Los modelos están perdiendo conocimiento a propósito
GLM-5.2 alcanza un 99.2% en el benchmark AIME 2026 con apenas 40 mil millones de parámetros activos por token, mientras que GPT-4 en 2023 necesitaba unos 280 mil millones y apenas podía resolver problemas AIME. Esta es la tendencia más disruptiva en IA para 2026: los modelos están sacrificando conocimiento factual deliberadamente para potenciar el razonamiento, y el cambio está redefiniendo cómo los founders deben construir con IA.
Según el artículo original, DeepSeek V4-Flash funciona con solo 13 mil millones de parámetros activos por token, mientras que Qwen3.5 alcanza 91.3% con 17 mil millones. En el extremo pequeño, Qwen3.5 9B cabe en solo 6GB de VRAM cuantizado y duplica el puntaje del siguiente mejor modelo bajo 10B parámetros en el índice de inteligencia de Artificial Analysis.
Pero el panorama cambia radicalmente en recall factual. En SimpleQA, un benchmark de recuperación factual sin herramientas, el líder actual es Gemini 2.5 Pro con solo 53%, lo que significa que el mejor recall del mercado aún falla la mitad de las preguntas. Los modelos pequeños apenas registran: Artificial Analysis mide tasas de alucinación del 80-82% para Qwen3.5 4B y 9B en su benchmark de conocimiento.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadPor qué los laboratorios están intercambiando conocimiento por razonamiento
Los hechos consumen espacio. Investigaciones sobre capacidad de conocimiento sugieren que cada parámetro almacena aproximadamente dos bits de conocimiento factual. Si quieres un modelo que conozca el año de nacimiento de cada figura menor de Wikipedia, necesitas pesos masivos, y esa fue la razón principal por la que los modelos frontera crecieron a billones de parámetros.
El razonamiento, en cambio, se comprime mucho mejor porque es un conjunto relativamente pequeño de procedimientos aplicados repetidamente: descomponer problemas, rastrear estado intermedio, verificar el propio trabajo, retroceder cuando un paso falla. La destilación y el aprendizaje por refuerzo en tareas verificables transfieren estos procedimientos a modelos pequeños sorprendentemente bien.
Phi-4, con 14 mil millones de parámetros y entrenado intensivamente en datos sintéticos estilo libro de texto, es bueno en matemáticas y malo en trivia, lo que revela exactamente qué contenía su data de entrenamiento. Esta mezcla antes parecía una limitación del enfoque de datos sintéticos; ahora parece el objetivo de diseño.
El conocimiento que sobrevive tiene una forma específica
Estos modelos son generalistas: saben un poco sobre casi todo y casi nada en profundidad. Pregúntale sobre PostgreSQL y sabrá qué es, para qué sirve y cómo funciona MVCC aproximadamente, pero pregunta qué versión añadió una característica específica del planner y volverás a hechos inventados.
Esta es la capa correcta para mantener en pesos, porque la amplitud es lo que permite a un modelo entender de qué trata una pregunta, saber qué buscar y juzgar si una fuente es plausible. La profundidad es barata de recuperar y cara de almacenar, así que es la parte que se elimina.
Los hechos caducan, los procedimientos no
Un entrenamiento frontera toma meses y cuesta cientos de millones de dólares, y en el momento que termina, los hechos dentro comienzan a volverse obsoletos. Las APIs de bibliotecas cambian, los precios cambian, las personas cambian de trabajo, y la mitad de lo que un modelo de 2024 creía sobre el ecosistema JavaScript estaba desactualizado antes de que el modelo se enviara.
Los procedimientos no caducan. El álgebra funcionaba igual en 1970 que ahora, y lo mismo ocurre con descomponer un problema o detectar una contradicción entre dos fuentes. Un modelo que es principalmente procedimiento y solo ligeramente cargado con hechos no envejece como un modelo pesado en conocimiento. Su cutoff de entrenamiento importa mucho menos, porque el estado actual del mundo nunca se suponía que viviera en los pesos.
El harness carga el conocimiento
Si el modelo no sabe cosas, algo más tiene que hacerlo, y ese algo es el harness: recuperación sobre una base de conocimiento, llamadas a herramientas, búsqueda web, un sistema de archivos lleno de documentación. El modelo contribuye razonamiento, y todo sobre lo que razona se suministra en tiempo de ejecución.
Ya puedes ver agentes trabajando así. Un agente de codificación no necesita haber memorizado la superficie API de tu dependencia, porque busca en node_modules o lee la documentación antes de llamar a cualquier cosa, y su respuesta está fundamentada en la versión que realmente tienes instalada en lugar de la versión que dominaba el data de entrenamiento.
Un modelo frontera en tu GPU
Siguiendo la tendencia un par de años adelante, obtenemos un modelo con razonamiento de calidad frontera que corre en una sola GPU de consumo. La mitad de compute ya casi está allí. DeepSeek V4-Flash razona con unos 13 mil millones de parámetros activos por token, bien dentro del rango de GPU de consumo.
Según Fello AI, DeepSeek-V4-Flash tiene 284 mil millones de parámetros totales con 13 mil millones activados por token, y cuesta $0.14 por millón de tokens de entrada y $0.28 por millón de salida. Lo que no cabe es los otros 271 mil millones de parámetros sentados en sus expertos, y las capas de expertos son principalmente almacenamiento de hechos. Esa es la parte que todo este intercambio hace opcional.
Quita el conocimiento y el tamaño total se reduce hacia el tamaño activo, y un modelo de 20 a 40B a cuantización de 4 bits cabe en la tarjeta de 24GB que ha estado en PCs gaming desde 2022.
Esto casi resuelve la alucinación
La parte más prometedora es lo que esto hace con la alucinación. Cuando un hecho vive en pesos, un hecho incorrecto es inencontrable e inarreglable. No puedes buscar en los pesos, no puedes compararlos con el mes pasado, y corregir un error significa un fine-tune que podría romper quién sabe qué más. El modelo afirma el hecho incorrecto con la misma confianza fluida que uno correcto, y no hay artefacto para verificarlo.
Cuando el hecho vive fuera del modelo, una respuesta incorrecta tiene una dirección. El modelo cita un documento, así que puedes abrir el documento. Si el documento está mal, editas el documento, y cada consulta futura obtiene la corrección, lo que supera esperar el próximo entrenamiento por aproximadamente un año. La recuperación no te lleva a cero, ya que un modelo aún puede malinterpretar una fuente o unir dos de ellas mal, pero una afirmación con fuente es verificable y una afirmación desde pesos no lo es.
Qué significa esto para tu startup
Esta tendencia cambia fundamentalmente cómo debes construir con IA en 2026. Los modelos pequeños y especializados en razonamiento están democratizando el acceso a capacidades que antes requerían infraestructura masiva.
1. Prioriza RAG sobre fine-tuning para conocimiento específico
En lugar de gastar miles de dólares en fine-tuning para incorporar conocimiento de dominio, invierte en sistemas de Recuperación Aumentada por Generación (RAG) robustos. Un modelo pequeño con buen razonamiento + una base de conocimiento actualizable te da:
- Actualizaciones en tiempo real sin retrenar modelos
- Verificabilidad de cada afirmación
- Costos predecibles sin sorpresas por entrenamientos
2. Diseña tu producto asumiendo que el modelo no sabe nada
Construye desde el principio con la mentalidad de que el modelo es un motor de razonamiento puro. Esto significa:
- Interfaces que solicitan contexto explícitamente
- Flujos de trabajo que integran búsqueda automática
- Sistemas de verificación que contrastan respuestas con fuentes
3. Explora modelos pequeños locales para tareas críticas
DeepSeek V4-Flash y similares abren la puerta a:
- Procesamiento sensible sin enviar datos a la nube
- Costos marginales cercanos a cero una vez la infraestructura está montada
- Latencia predecible sin dependencia de APIs externas
4. Monitorea alucinaciones con trazabilidad completa
Implementa sistemas que:
- Registren la fuente de cada pieza de información
- Alerten cuando las respuestas no tengan respaldo verificable
- Permitan correcciones sin retrenar el modelo completo
El futuro: modelos como CPUs, conocimiento como programas
Hay una versión de este futuro donde la ficha técnica del modelo deja de listar un cutoff de conocimiento, porque lo que queda en los pesos caduca en una escala de años en lugar de semanas. El modelo simplemente recibe el estado actual del mundo en tiempo de ejecución, de la misma manera que una CPU recibe un programa.
Para founders, esto significa que la ventaja competitiva ya no está en tener el modelo más grande, sino en tener el sistema de conocimiento mejor organizado y el harness más inteligente. El razonamiento se commoditiza; la capacidad de encontrar, verificar y aplicar información correcta se vuelve el diferencial.
Fuentes
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













