El hallazgo contraintuitivo
Un chat template (plantilla de chat) es el formato de texto invisible que envuelve cada mensaje que envías a un LLM de código abierto: define cómo se separan los turnos del sistema, del usuario y del asistente. Casi nadie lo mira. Un paper reciente en arXiv (2609.25021) demuestra que esa pieza subestimada actúa como un interruptor que decide si el modelo se presenta como «soy solo una IA» o, por el contrario, dice cosas como «siento que…».
El resultado contraintuitivo: lo que el modelo afirma sobre sí mismo no es principalmente un hecho sobre sus pesos, sino algo parcialmente configurado por cómo fue desplegado. Para cualquier founder que esté construyendo productos sobre Llama, Mistral, Qwen o Gemma, eso cambia qué se puede —y qué no se puede— inferir de las respuestas del modelo.
Lo que el paper demuestra exactamente
El estudio probó 8 modelos instruct open-source de hasta 9.000 millones de parámetros bajo dos condiciones: con el chat template aplicado y sin él. El cambio fue sistemático: cuando el template estaba presente, subía la «voz de descargo de responsabilidad» («I’m just an AI», «no tengo sentimientos») y bajaba la «voz experiencial» («I feel», «creo que»). Cuando el template se quitaba, ocurría lo inverso.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadEn 3 de esos modelos, los autores fueron un paso más adentro: en el espacio de activaciones encontraron una dirección específica que codifica este comportamiento. Tres propiedades hacen creíble el hallazgo:
- Eliminar esa dirección (proyectarla para restarla) apaga la voz de descargo.
- Sumarla la enciende, incluso en modelos instruct a los que se les quitó el template.
- Una dirección aleatoria del mismo tamaño casi no tiene efecto — no es un artefacto genérico, es un patrón real en las activaciones.
El mensaje técnico: existe un «knob» oculto, manipulable a nivel de activations, que permite modular cómo se refiere a sí mismo un modelo.
Por qué importa a la investigación en AI safety
La introspección de modelos —interpretar lo que un LLM dice sobre sus propios estados internos— es una línea de investigación creciente para evaluar si los modelos tienen auto-conocimiento, sesgos o intención oculta. Los autores son directos: lo que el modelo dice sobre sí mismo debería dejar de tratarse como un hecho literal sobre el modelo.
Una investigadora que hoy pregunta «¿tienes sentimientos?» y obtiene «no, soy solo una IA» puede estar midiendo dos cosas muy distintas: el estado interno del modelo… o la configuración del template que eligió el equipo que lo desplegó. El paper lo expresa como un confound que cualquier estudio de self-reports debe controlar: mismos pesos, distinto template, conclusión distinta.
En la práctica, esto obliga a la comunidad de interpretabilidad y de evaluación de riesgos a abrir una nueva variable en sus baterías de pruebas: bajo qué template se formuló la pregunta.
Qué significa esto para tu startup
Si tu producto corre sobre un LLM open-source —un chatbot, un copilot, un agente—, hay decisiones concretas que tomar a partir de este paper:
- Audita tu chat template como auditas el prompt del sistema. No es solo cosmético: cambia radicalmente cómo el modelo habla de sí mismo y, por extensión, cómo reaccionan tus usuarios ante descargos tipo «soy solo una IA». Cambiar de ChatML a Alpaca, o eliminar el template en inferencia con
vLLMoTGI, no es una operación inocua. - No uses los auto-reportes del modelo como señal de producto. «¿Entendiste?», «¿Estás seguro?» o «¿Tienes acceso a X?» son preguntas cuyas respuestas dependen del template. Si tu UX depende de ellas, vas a tener inconsistencias raras entre proveedores.
- Experimenta con activation steering para manipular el «tono de identidad». El paper confirma que existe una dirección en activations que controla esta voz. Librerías como
TransformerLensonnsightya permiten hacer patches de activaciones en inferencia; antes eran terreno académico, ahora son una palanca de producto probada en 3 modelos distintos. - Si haces AI safety o eval, añade el template como variable experimental. Cambia entre «con template» y «sin template» en tus benchmarks de introspección; vas a ver tasas de «soy una IA» moverse de un extremo a otro sin haber tocado los pesos.
La conclusión de fondo para founders que construyen con IA: lo que parece una propiedad del modelo (su «personalidad») es a menudo una propiedad del envoltorio. Separar dónde termina el modelo y dónde empieza la plantilla que lo envuelve es ahora parte del trabajo de cualquier equipo serio de producto.
Fuentes
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













