AA-Omniscience: 66% de acierto y el SEO sigue vivo

¿Qué mide AA-Omniscience y por qué el 66 % debería importarte?

Claude Opus 5.5, el modelo que encabeza el índice AA-Omniscience de Artificial Analysis, acierta el 66 % de las preguntas de hechos concretos cuando no puede buscar en internet. El resto se reparte entre errores y respuestas del tipo «no lo sé».

Traducido a tu operación: el asistente al que le preguntas por el precio de un proveedor, el tamaño de un mercado o la fecha de una norma acierta, falla o se queda callado —y no siempre avisa de cuál de las tres cosas está haciendo.

El benchmark mide dos cosas a la vez: si el modelo sabe datos concretos y si sabe cuándo no los sabe. Son 6.000 preguntas repartidas en 42 temas de seis áreas: empresa, humanidades, finanzas, derecho, medicina y ciencia. La prueba se hace sin herramientas: el modelo no puede buscar, ni consultar documentos, ni ejecutar código. Se evalúa únicamente lo que lleva dentro.

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

El sistema de puntuación explica el resto. El índice va de -100 a 100: suma por cada acierto, resta por cada respuesta incorrecta y no penaliza abstenerse. Un cero significa tantos aciertos como errores. En otras palabras, premia al modelo que calla cuando duda y castiga al que inventa.

¿Por qué el modelo más preciso no es el que lidera la tabla?

Los tres primeros puestos están muy juntos y el orden no sigue la precisión pura. Según la página de Artificial Analysis, Opus 5.5 lidera con un índice de 46 y una precisión del 66 %. Le siguen GPT-6 Astra en su configuración alta, con 44, y Claude Fable 5.1, con 43 pero la precisión más alta del grupo, del 67 %.

El dato llamativo es ese último: Fable 5.1 acierta más que el líder y aun así queda por debajo. La razón es que responde más veces cuando no debería.

Artificial Analysis recoge esa tensión en una tercera métrica, la tasa de alucinación, definida como la proporción de respuestas incorrectas entre todas las que no fueron correctas. Es decir: cuando el modelo no sabe, ¿cuántas veces inventa en lugar de admitirlo? El análisis que acompaña al índice estima, a partir de las cifras públicas, que Opus 5.5 inventaría en torno al 59 % de las veces que no sabe, y Fable 5.1 cerca del 73 %.

El extremo opuesto de la tabla lo confirma: el modelo con la tasa de alucinación más baja es uno diminuto, MiniCPM5-1B, con un 1 %. No sabe más que nadie — casi siempre responde que no lo sabe. Un modelo prudente e ignorante resulta más fiable, en esta métrica, que uno brillante y atrevido.

La salida es buscar, y buscar es leer páginas web

Si un modelo no puede saberlo todo y no conviene que lo intente, la solución práctica es recuperar información de fuera. Y para eso alguien tiene que haberla publicado de forma que se pueda encontrar. Ahí está el argumento central: mientras exista un buscador, tradicional o de IA, habrá quien trabaje para aparecer en él.

El costo de esa búsqueda no es trivial. Según lo que contó en el juicio antimonopolio contra Google el responsable de producto de ChatGPT, Nick Turley, OpenAI estaba a años de poder responder el 80 % de las consultas con su propia tecnología de búsqueda. Lo recoge la fuente original: lo declaró el 22 de abril de 2025.

Mientras tanto, la industria se movió en la misma dirección. Adobe acordó adquirir Semrush por cerca de US$1.900 millones en una operación en efectivo anunciada el 19 de noviembre de 2025, presentada explícitamente como visibilidad de marca «en la era de la IA agéntica», según Tech Times. Es la señal de mercado más clara de que el GEO dejó de ser una disciplina de nicho.

La adopción acompaña. Tech Times recoge que OpenAI comunicó a fines de febrero de 2026 que ChatGPT superó los 900 millones de usuarios activos semanales, frente a los 800 millones de octubre de 2025 y los 400 millones de un año antes. El informe State of AI Discovery de Previsible, que analizó 1,96 millones de sesiones con modelos de lenguaje, encontró que las sesiones referidas por IA crecieron un 527 % entre enero y mayo de 2025 —de unas 17.000 a unas 107.000—, aunque el propio informe aclara que todo el tráfico de plataformas de IA sigue representando menos del 1 % del tráfico web total.

El problema es que ese tráfico no vuelve solo. Un asistente puede leer tu página, usar tu dato y responder sin que el usuario te visite nunca. Y hay evidencia de que el clic se contrae: Forbes cita investigación del Pew Research Center según la cual los usuarios son menos propensos a hacer clic en los enlaces de resultados cuando aparece un resumen generado por IA. La misma publicación estima en hasta US$750.000 millones los ingresos en Estados Unidos que estarán influidos por sistemas de búsqueda con IA hacia 2028.

¿El GEO reemplaza al SEO? Lo que dice Google

No. Y la respuesta no es una opinión de foro: Google publicó en mayo de 2026 su primera guía oficial para optimizar contenido para sus funciones de IA generativa, y su postura fue tajante —como los AI Overviews y el modo IA se apoyan en los sistemas de ranking de Search, optimizar para búsqueda generativa «sigue siendo SEO». La compañía también señaló que los archivos llms.txt, las reescrituras de contenido específicas para IA y el schema especial no son necesarios para sus funciones generativas.

La mecánica de fondo es la generación aumentada por recuperación (RAG): el sistema indexa, convierte en vectores y recupera pasajes relevantes de documentos externos, y luego sintetiza una respuesta citando los pasajes en los que se apoyó. Eso cambia la unidad de optimización: pasa de la página al pasaje. El contenido se fragmenta y se recupera cuando es la coincidencia semánticamente más relevante para una consulta.

De ahí salen dos consecuencias operativas. La primera: la respuesta a la pregunta debe aparecer en las primeras 200 palabras, porque los sistemas de recuperación y resumen ponderan con fuerza el arranque. La segunda: los encabezados claros, las listas, las tablas y el formato explícito de pregunta-respuesta hacen que un pasaje sea mucho más fácil de extraer y citar.

También cambia a quién le creen. Como resume Joseph Levi, CEO de la agencia británica Noise Media Group, en FoodNavigator: «Los agentes de IA confiarán más en lo que otros dicen de ti que en lo que tú dices de ti mismo». La validación de terceros —prensa, reseñas, menciones— pesa más que la autopromoción.

¿Qué significa esto para tu startup?

Para un founder con recursos limitados, la lectura no es apocalíptica. Es una reasignación de esfuerzo hacia lo que un modelo no puede fabricar solo.

  • Publica tu dato propietario, no una versión del dato de otro. El único contenido que un modelo no puede conseguir en otro sitio es el que solo tienes tú: tus precios reales, tus tiempos de implementación medidos, tus tasas de conversión por canal, tus benchmarks internos. Eso es lo que se cita.
  • Reescribe tus páginas clave con la respuesta arriba. Toma tus diez URLs con más tráfico orgánico y mueve la conclusión concreta a las primeras 200 palabras. Si tu página responde en el párrafo siete, un motor generativo puede perfectamente no llegar nunca hasta ahí.
  • Haz el test manual antes de invertir en herramientas. Pregúntale a ChatGPT, Gemini y Perplexity por tu categoría y por tu marca, y anota si te menciona, si te confunde con un competidor o si directamente inventa algo sobre ti. Esa auditoría gratuita te dice si tu problema es de contenido o de señales externas.
  • Trata las fechas, cifras y nombres propios como activo. Los modelos recurren a la web sobre todo para lo que cambia y lo que es verificable. Un artículo con un número actualizado y una fecha explícita es mucho más citable que uno con adjetivos.

La advertencia final es para quien construye su negocio sobre tráfico. Que los modelos necesiten la web no garantiza que devuelvan la visita. El trabajo de posicionamiento solo tiene sentido económico si los asistentes citan y enlazan de verdad; si se limitan a absorber, el incentivo para publicar buen contenido se erosiona, y con él la materia prima de la que dependen sus respuestas.

Mientras eso se decide, la ventaja práctica es la de siempre: el que publica datos concretos, propios y bien estructurados aparece en la respuesta. El que publica relleno, también desaparece del enlace.

Fuentes

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...