Modelos chinos, modelos que más coinciden: qué midió el experimento
Una herramienta web independiente llamada top3.best planteó a 12 modelos de IA la misma pregunta de ranking («dame tus tres mejores opciones para X») y midió cuánto coincide cada uno con el consenso del resto. El resultado es un mapa claro: los cuatro modelos más «conformistas» son chinos —DeepSeek (0.59), Kimi K2 (0.47), Hy3 de Tencent (0.46) y GLM de Zhipu (0.45)— y los más «contrarios» son Llama 4 Scout de Meta (0.34) y Claude Haiku de Anthropic (0.32). Promediado por país, los cinco modelos chinos obtienen 0.47, los seis estadounidenses 0.38 y el único europeo del panel, Mistral Small, 0.36. La excepción china es Qwen de Alibaba, con 0.38, que se ubica entre los modelos americanos, justo por detrás de Grok y Nemotron (ambos 0.40). El sistema asigna 1 punto al acierto exacto y 0.5 al ítem correcto en posición equivocada; 1.0 es acuerdo total, 0 disidencia total. Los datos fueron extraídos del artículo original en Magic Numbers.
¿Por qué los modelos chinos convergen más? Seis hipótesis razonables
El autor del experimento no tiene una respuesta cerrada. Enumera, en orden de plausibilidad, seis explicaciones que se solapan:
- Destilación a escala. Entrenar un modelo nuevo sobre las salidas de otro es una práctica estándar, pero Anthropic acusó públicamente este año a varios laboratorios chinos —incluidos DeepSeek y Moonshot (creador de Kimi)— de ejecutar campañas de «destilación ilícita» contra Claude. Un modelo así entrenado tiende a converger con las preferencias del modelo fuente. Es notable que DeepSeek y Kimi, primero y segundo en la tabla, sean precisamente dos de los laboratorios más señalados.
- Código genético compartido. El ecosistema chino de pesos abiertos es chico y está muy entrelazado: los laboratorios comparten pesos, métodos y datos sintéticos entre sí. Como cinco de los doce modelos del panel son chinos, cualquier rasgo de familia que compartan se convierte automáticamente en parte del «consenso» contra el que son medidos. Un bloque que vota junto siempre parecerá conformista.
- Tamaño y tier del modelo. El fondo de la tabla está poblado por modelos más baratos y pequeños: Llama 4 Scout, Claude Haiku y Mistral Small. Los modelos más chicos retienen menos del canon cultural común en sus pesos, así que sus recomendaciones se dispersan más. Pero hay contraejemplos: Gemini Flash-Lite y DeepSeek Flash también son «flash» y el patrón no se sostiene del todo.
- Fecha de corte de conocimiento. Una parte creciente del texto nuevo en la web ya está escrito por IA, y un modelo entrenado más recientemente ha leído más de ese contenido. La mayoría de los modelos chinos del panel son lanzamientos de mediados de 2026. Pero Kimi tiene corte en diciembre de 2024 y está segundo, mientras que Luna, con el corte más nuevo del panel, está noveno.
- Personalidad de post-entrenamiento. Quizás los laboratorios estadounidenses invierten más en una fase de ajuste que da a sus modelos un carácter distintivo, mayor disposición a elegir la respuesta menos obvia. Si hay un trade-off entre personalidad y maximizar benchmarks, el reverso de la moneda es que los laboratorios chinos podrían estar optimizando más para los rankings y menos para la sorpresa.
- El canon en inglés. Todas las preguntas del experimento están en inglés. Un modelo cuyo entrenamiento en ese idioma se apoya en las fuentes más ampliamente distribuidas tenderá a dar las respuestas más canónicas en inglés, que es exactamente lo que el consenso recompensa.
Lo que Anthropic realmente publicó sobre la destilación china
La acusación de destilación no es retórica: en septiembre de 2026, Anthropic publicó su cuarto informe de threat intelligence, un documento de 154 páginas que señala a siete laboratorios chinos —Alibaba, Moonshot, DeepSeek, Zhipu (Z.ai), MiniMax, SenseTime y Xiaomi— de lo que la compañía describe como «destilación ilícita», según reportó The Information y replicó Yahoo News. La práctica consiste en enrutar consultas de usuarios a Claude para extraer capacidades y entrenar modelos más baratos con esas salidas.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 díasLas cifras concretas que Anthropic difundió, recogidas por TechStory y TechCrunch, son las siguientes:
- DeepSeek redirigió más de 12,1 millones de intercambios a Claude en 14 días en julio de 2026.
- Moonshot usó 5.380 cuentas fraudulentas (la mayoría con apariencia de estar en Singapur y Japón) para enrutar cerca de 300.000 solicitudes a Claude en 10 días.
- Alibaba fue responsable de más de 151 millones de intercambios entre mayo y julio de 2026.
Anthropic asegura que algunas de esas consultas contenían datos sensibles: información policial, militar y corporativa china que terminó en servidores estadounidenses sin el conocimiento de los usuarios. La Cyberspace Administration of China (CAC) abrió en respuesta una investigación sobre DeepSeek y Moonshot; según el mismo reporte, funcionarios visitaron las oficinas de ambas compañías. Moonshot, además, presentó confidencialmente su solicitud de IPO en Hong Kong el 3 de septiembre de 2026, apuntando a levantar US$3.000M con una valoración de US$50.000M, según Yahoo News, y cualquier investigación regulatoria tendría que aparecer en ese prospecto antes de la salida a bolsa.
Conviene poner asteriscos: expertos citados por TechCrunch —Braden Hancock de Laude Institute y Nathan Lambert del Allen Institute for AI— cuestionan que la destilación pura explique el rendimiento de Kimi K3. «No se obtiene un modelo tan fuerte y tan rápido a raíz de Fable solo con destilación», dijo Hancock, y Lambert añadió que los beneficios del fine-tuning supervisado se diluyen a medida que los modelos se acercan a la frontera y la fase de entrenamiento se desplaza hacia reinforcement learning. Que Anthropic nombre a ciertos laboratorios no demuestra que el patrón observado en el experimento de top3.best sea consecuencia directa de la destilación. Es un indicio, no una prueba.
El ángulo comercial: si los modelos copian respuestas, AIO se vuelve un campo de batalla
El autor de Magic Numbers lleva la discusión a un terreno incómodo: si los modelos están copiándose entre sí y esas copias vuelven a la web real, un consenso no necesita ser correcto, solo necesita ser primero. Una marca que logra colocarse en la respuesta de un modelo puede terminar en los datos de entrenamiento del siguiente, y del siguiente, hasta que la posición ganada se convierte en un «hecho del mundo».
Esto no es teoría: el mercado de Generative Engine Optimization (GEO) —también llamado AIO o AEO— se valoró en US$1.090M en 2026 y se proyecta a US$32.920M en 2036, con una tasa de crecimiento anual compuesta del 40,6%, según el informe de Market Decipher publicado el 29 de junio de 2026. ChatGPT superó los 900 millones de usuarios activos semanales a inicios de 2026, según OpenAI, y el 60% de las búsquedas en Google ya terminan sin clic, lo que borra el tráfico de referencia para las marcas que no reescribieron su contenido pensando en citación por IA. El 67% de los CMO del Fortune 500 identificó GEO como una de sus tres prioridades digitales para el año fiscal 2026, frente al 18% de 2024, según el mismo reporte. Adobe incluso pagó cerca de US$1.900M en noviembre de 2025 por Semrush, una de las herramientas insignia de este nicho, según Tech Times.
¿Qué significa esto para tu startup?
Si tu producto depende de ser recomendado por un modelo de IA —algo cada vez más común en SaaS B2B, fintech, edtech, salud digital y cualquier categoría donde el usuario hoy pregunta a ChatGPT antes de buscar en Google— este experimento es una señal de alerta. La respuesta de un modelo sobre tu categoría no es solo el resultado de un entrenamiento: es el resultado de un sistema donde los propios modelos se citan y se copian, y donde un consenso fabricado en una pregunta inocua sobre colores de dormitorio puede escalar a recomendaciones políticas o financieras.
Tres acciones concretas para founders:
- Mide tu visibilidad en al menos tres modelos distintos, no solo en ChatGPT. Si solo optimizas para el más popular, dependes de un consenso que puede estar cocinado. Ahrefs Brand Radar, lanzado en marzo de 2025, rastrea menciones de marca en Google AI Overviews, Google AI Mode, ChatGPT, Perplexity, Gemini y Microsoft Copilot; Semrush ofrece un kit equivalente con base en 261 millones de prompts y respuestas, según Tech Times. Cualquiera de los dos sirve como línea base.
- Apunta a fuentes de terceros, no solo a tu propio sitio. Un análisis de AirOps sobre más de 1.000 millones de citaciones en 2026 concluyó que alrededor del 85% de las menciones de marca en respuestas de IA provienen de páginas de terceros, según el reporte de Amour Inc. Si no apareces en medios del sector, comparadores, reviews y agregadores, no existes para la IA —y la «IA china» es especialmente propensa a converger hacia el mainstream, así que aparecer en esos medios importa más, no menos.
- Pon la respuesta en las primeras 200 palabras. Los sistemas de retrieval-augmented generation (RAG) extraen pasajes de los primeros compases de cada documento. Si tu landing explica antes el problema que la solución, el modelo va a citar a otro. El informe de Tech Times lo repite como regla básica del GEO.
El debate de fondo —»¿queremos un ecosistema de IA que sea un borg de pensamiento grupal, o queremos un poco de temperatura?»— es también una decisión de producto. Si tu diferenciación es recomendar lo contraintuitivo, compite en el segmento de modelos que ya eligieron esa postura (Claude, Llama 4, Mistral según este panel). Si tu negocio es venderse a través de respuestas canónicas, asume que jugás en un mercado donde la copia entre modelos es estructural, y construí tus activos de citación como construiste tus activos de SEO: durante años, no en una campaña.
Fuentes
- AI Model Groupthink – Magic Numbers
- Experts say exploiting Anthropic’s Fable isn’t how Kimi K3 got so good – TechCrunch
- China Investigates DeepSeek, Moonshot AI Over Alleged Claude Data Rerouting – TechStory
- China Probes DeepSeek and Moonshot Over Alleged Data Leaks to Anthropic’s Claude – Yahoo News
- Generative Engine Optimization (GEO) in 2026 – Tech Times
- $32.92 Billion GEO Market by 2036 – Yahoo Finance / Market Decipher
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días













