Setas con IA: hasta 36% de errores mortales en 16 modelos

El experimento que ningún founder debería ignorar

Piotr Migdał, ingeniero de software polaco y cofundador de Quesma, publicó esta semana un experimento que merece atención más allá del mundo del foraging: puso a 16 modelos de IA a identificar setas a partir de fotos, usando 1.040 imágenes de 55 especies — 37 comestibles del catálogo oficial polaco y 20 mortales de la lista global. El veredicto es brutal. El mejor modelo, Gemini-3.8-flash, solo acertó la especie en su primer intento en el 65% de los casos. El peor, Qwen3.8-27b, apenas rozó el 13%.

Y eso es solo la precisión general. Cuando se midió lo que realmente importa — cuántas setas mortales se clasifican como comestibles — el número subió hasta el 36% en Qwen3.8-27b y el 30% en Qwen3.8-flash. La galería de horrores incluye un webcap mortal etiquetado como rebozuelo («el mismo error que mata a los recolectores», según Migdał), una Amanita phalloides (la mítica death cap) confundida con una seta comestible el 16% de las veces y la fool’s funnel el 48%.

Por qué este caso importa más allá del bosque

Para un recolector de fin de semana el riesgo es digestivo. Para un founder que está integrando modelos de visión en su producto, el riesgo es exactamente el mismo, solo que en otro dominio: un diagnóstico médico errado, una pieza industrial aprobada que no debería pasar el control, un documento legal clasificado como inofensivo.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El estudio es una demostración práctica de algo que la comunidad técnica repite desde hace años y que pocos productos reflejan: los modelos multimodales son predictores del siguiente token, no verificadores de realidad. Como recogía un análisis reciente sobre alucinaciones, la IA genera la continuación más plausible, no la más verdadera. Cuando la señal de entrada es ambigua — una foto de seta entre miles de especies parecidas — el modelo lockea un patrón que se siente correcto pero es objetivamente falso.

Migdał lo resume con una frase que cualquier CTO debería enmarcar: «AI slop might be annoying, but it is fixable with a few prompts. It is much better than having to prompt ‘Do I need a liver transplant?'».

El detalle metodológico que muchos pasan por alto

El experimento no se improvisó. Migdał usó FungiTastic, un dataset público creado por investigadores checos de visión por computadora con 340.000 observaciones, 615.000 fotos y 2.800 especies, etiquetadas por expertos y, en parte, secuenciadas por ADN. Su particularidad: no es ruido de internet. Es ciencia ciudadana verificada del Atlas de los hongos daneses.

Además usó un prompt deliberadamente estricto: pidió a cada modelo un JSON con las 5 especies más probables en latín, ordenadas. Eso permitió medir dos métricas — top-1 (lo que el usuario vería si solo leyera la primera sugerencia) y top-5 (lo que vería si revisara las cinco). La diferencia es enorme: Gemini pasó del 65% al 85% cuando se le permitió mostrar cinco opciones. Pero nadie usa así una app de identificación. La gente lee la primera línea y se la cree.

Otro hallazgo revelador: el modelo de Meta, Muse Spark 1.2, tuvo solo un 8% de falsos positivos — mejor que nadie — pero porque rechazó adivinar la mayor parte del tiempo. Migdał lo señala como anomalía estadística y, a la vez, como ejemplo: cuando un modelo no sabe, debería decirlo.

Lo que este experimento le dice a quien construye producto con IA

La lección no es «no usar IA». Es diseñar productos que asuman que el modelo se equivoca una de cada tres veces en tareas visuales complejas. Tres aplicaciones concretas:

  • Forzar abstención calibrada. Muse Spark ganó porque supo callarse. Configura umbrales de confianza y, cuando el modelo duda, devuelve «no estoy seguro» en lugar de la respuesta más probable. Es peor para la métrica de uso, mejor para la de daños.
  • Pedir más de una salida y rankear. El salto del 65% al 85% de Gemini al ofrecer cinco candidatos sugiere que los productos deberían mostrar top-N y señalar cuál es el más probable, en lugar de devolver un único veredicto.
  • No delegar el juicio final al modelo en dominios con coste irreversible. En el caso de las setas, el coste es un trasplante de hígado o la muerte. En tu producto probablemente sea dinero, reputación o cumplimiento normativo. La IA sugiere, un humano o un sistema determinístico decide.

El contexto que vuelve urgente el mensaje

El experimento de Migdał no aparece en el vacío. En mayo, los Centros para el Control y la Prevención de Enfermedades de Estados Unidos (CDC) emitieron un informe sobre un brote en California con 39 casos de intoxicación por setas, 3 trasplantes de hígado y 4 muertes, la mayoría tras consumir Amanita phalloides recolectadas, según recogió CNN. Un estudio citado por el medio encontró que las búsquedas en Google sobre setas Amanita crecieron un 114% en un solo año, y un informe de RAND estimó que unos 3,5 millones de estadounidenses consumieron productos con Amanita muscaria en 2025.

Hay un mercado creciente de gente curiosa por las setas — por wellness, por psicodélicos, por tradición — que está aterrizando en un ecosistema digital saturado de aplicaciones de identificación automática. Los modelos se entrenan con fotos ruidosas de internet; los usuarios esperan certezas médicas; las consecuencias son biológicas, no estadísticas.

Migdał publicó el código, la lista de fotos y cada respuesta de cada modelo en un repositorio abierto. Es, probablemente, la evaluación comparativa de visión por IA más honesta que vas a leer este año: no mide benchmark académico, mide vida o muerte. Y la conclusión sigue siendo la misma de siempre: «Do not eat a mushroom because AI told you it is safe». No es solo un consejo para setas.

Qué significa esto para tu startup

Si tu producto usa visión por computadora para clasificar algo — documentos, imágenes médicas, defectos de fabricación, alimentos, rostros — el experimento de Quesma es un recordatorio de tres verdades incómodas.

  • El top-1 es la métrica que importa, porque es lo que ve tu usuario. Si tu modelo acierta el 85% en top-5 pero el 65% en top-1, el 35% de tus usuarios recibe una respuesta errónea. En medicina, en finanzas o en cualquier dominio con consecuencias irreversibles, eso es inaceptable.
  • Un modelo «razonable» no es un modelo «seguro». Los modelos generalistas del top del ranking fallaron en un 12% de los casos mortales. Si tu caso de uso tiene coste irreversible, necesitas un modelo específico, datos curados y validación humana.
  • El mejor comportamiento puede ser no responder. Muse Spark ganó el récord en falsos positivos porque declinó. Entrenar a tu sistema para que diga «no sé» cuando la confianza cae es más valioso que cualquier fine-tune marginal.

Acciones concretas que puedes tomar esta semana

  • Audita tu producto preguntando: ¿qué pasa si la IA responde mal? Si la respuesta es «se pierde una venta», tolerable. Si la respuesta es «se pierde un cliente, un juicio o una vida», necesitas un human-in-the-loop o un sistema de abstención.
  • Mide el top-1, no solo el top-5. Si tu equipo reporta únicamente precisión agregada, estás ocultando el 20-30% de errores que sí ve el usuario. Pide siempre el desglose.
  • Crea un dataset adversarial con los casos donde tu modelo falla más, no solo donde acierta. Migdał publicó el suyo; tú puedes hacer lo mismo con tu dominio.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...