Transformer Explainer: visualiza GPT-2 en el navegador

Qué es Transformer Explainer y por qué debería importarte como founder

Transformer Explainer es una herramienta interactiva del Polo Club de Datos del Georgia Institute of Technology que ejecuta un modelo GPT-2 (small) de 124 millones de parámetros directamente en tu navegador. No requiere instalación ni backend: escribes un prompt, y la página te muestra en tiempo real cómo el modelo lo tokeniza, calcula embeddings, propaga la atención capa por capa y finalmente decide qué palabra sale después.

Detrás de cada producto de IA que probablemente usas a diario — ChatGPT, Claude, Gemini, Llama, Mistral — hay variantes de la misma arquitectura que este visualizador desarma pieza por pieza.

Por qué un founder debería dedicar 15 minutos a esto

La mayoría de equipos no técnicos usan los LLMs como cajas negras. Eso funciona cuando el producto responde bien, pero deja de funcionar cuando necesitas:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Diagnosticar por qué el modelo alucina en tu caso concreto
  • Explicar a un cliente enterprise qué hace tu producto «por dentro»
  • Decidir con criterio qué modelo contratar (¿te alcanza con GPT-2 small o necesitas Claude Opus?)
  • Defender con solvencia ante un inversionista que entiendes el stack técnico

El visualizador de Georgia Tech te entrega ese vocabulario en menos tiempo que un paper de 30 páginas.

Cómo está armado el modelo que corre en tu navegador

El GPT-2 (small) que carga la herramienta tiene estas características técnicas, todas verificables desde la documentación oficial del proyecto:

  • 124 millones de parámetros entrenables
  • Vocabulario de 50.257 tokens (palabras o fragmentos de palabra)
  • 12 bloques Transformer apilados secuencialmente
  • 12 cabezas de atención por bloque
  • Embeddings de 768 dimensiones

La página confirma que el modelo corre gracias a la conversión a ONNX Runtime del proyecto nanoGPT de Andrej Karpathy, y que la interfaz se construyó con Svelte y D3.js para que los valores numéricos se actualicen en vivo cada vez que escribes.

Los cuatro conceptos clave que la herramienta te enseña

Tokenización: el texto se rompe en piezas

Antes de procesar nada, el modelo divide el prompt en tokens. GPT-2 usa un vocabulario fijo de 50.257 piezas; palabras frecuentes como «Data» son un único token, mientras que «empowers» se parte en dos. Cada token recibe un ID numérico que luego se convierte en un vector.

Embedding: cada palabra se vuelve un punto en 768 dimensiones

Cada token se representa como un vector de 768 números. La matriz total de embeddings tiene forma (50.257, 768), aproximadamente 39 millones de parámetros. Durante el entrenamiento, el modelo aprende que palabras con significado similar quedan cerca en ese espacio y palabras distintas quedan lejos.

Self-attention: el mecanismo que cambió la IA en 2017

La idea central del Transformer — la que popularizó el paper «Attention Is All You Need» de 2017, según confirma el blog de Cisco sobre fundamentos de IA — es que cada token puede mirar a todos los demás tokens de la secuencia al mismo tiempo. Esto se hace proyectando cada embedding en tres vectores:

  • Query (Q): qué busca este token
  • Key (K): qué ofrece cada token candidato
  • Value (V): qué información entrega cuando hay match

Según explica el blog de Cisco, la atención funciona como una «tabla de búsqueda suave»: el query es tu término de búsqueda, las keys son el índice y los values son los datos que recibes. Es exactamente la analogía que usa Transformer Explainer para que la operación matemática deje de sentirse abstracta.

En la práctica, este mecanismo es lo que permite que el modelo entienda que «it» en the cat sat on the mat because it was tired se refiere al gato y no al piso. Los modelos previos a 2017 leían palabra por palabra y olvidaban el principio de la frase al llegar al final.

Multi-head attention: 12 perspectivas simultáneas

En lugar de hacer una sola pasada de atención, el modelo la divide en 12 cabezas independientes. Una puede capturar relaciones sintácticas cortas (sujeto-verbo), otra seguir dependencias semánticas más largas (pronombres y sus referentes), otra enfocarse en la estructura de la oración. Al final, los 12 resultados se concatenan y se procesan juntos.

El visualizador te permite pasar el cursor sobre los tokens para ver exactamente a qué otros tokens está prestando atención cada cabeza en cada capa. Es la vía más rápida para desarrollar intuición sobre cómo «piensa» el modelo.

El MLP: donde se refina cada token

Después de la atención, cada token pasa por una red feed-forward (MLP) que opera de forma independiente sobre cada posición. La arquitectura típica de GPT-2 (small) expande la dimensión de 768 a 3072 (cuatro veces más), aplica una activación GELU y luego comprime de vuelta a 768. Esta expansión le da al modelo espacio para capturar patrones no lineales que la atención por sí sola no puede.

El detalle clave: el MLP no mezcla información entre tokens, solo refina la representación de cada uno individualmente. La atención integra, el MLP enriquece.

Cómo la temperatura cambia lo que el modelo «dice»

El último paso — elegir qué token sale después de cada palabra — depende de tres hiperparámetros que puedes ajustar en el visualizador:

  • Temperature = 1: comportamiento por defecto, divide los logits por 1 y mantiene la distribución original
  • Temperature < 1: distribución más picuda, el modelo se vuelve más determinista y predecible
  • Temperature > 1: distribución más suave, mayor aleatoriedad — lo que algunos llaman «creatividad»

Combinado con top-k (limitar candidatos a los k tokens más probables) y top-p (nucleus sampling: tomar el conjunto mínimo de tokens cuya probabilidad acumulada supera un umbral p), puedes controlar el balance entre respuestas conservadoras y respuestas diversas.

Para un founder que está montando un chatbot de soporte: bajar la temperatura y mantener top-k bajo es tu mejor amigo. Para un generador de copy creativo: subir ambos abre el espacio de respuestas.

Qué puedes implementar mañana en tu startup

  1. Usa la herramienta con prompts reales de tu producto. Escribe las preguntas que tus clientes hacen y observa qué tan seguro está el modelo. Si te das cuenta de que necesitas bajar la temperatura para que sea más determinista, ahora entiendes exactamente por qué.
  2. Memoriza las cuatro cifras clave — 124M parámetros, 50.257 vocab, 768 dimensiones, 12 bloques — son el equivalente a entender la cilindrada del motor cuando alguien te vende un auto. Te servirán en cualquier conversación técnica con proveedores de LLM.
  3. Mira las capas de atención de tu propio prompt. Si un token no está prestando atención al contexto relevante, eso explica por qué el modelo alucina. Es la base para escribir mejores prompts y diseñar mejor contexto.

Quién está detrás

El equipo detrás de Transformer Explainer está formado por Aeree Cho, Grace C. Kim, Alexander Karpekov, Alec Helbling, Jay Wang, Seongmin Lee, Benjamin Hoover y Polo Chau, todos del Georgia Institute of Technology. El modelo que ejecuta la herramienta se deriva del nanoGPT de Andrej Karpathy, convertido a ONNX Runtime para correr en el navegador sin backend.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...