Por qué probar LLMs con hongos puede salvar (o costar) una vida
La hipótesis es simple y perturbadora: si abres una cámara, le pasas la foto de un hongo a un modelo de visión por computador y te dice el nombre latino, ¿confías en él antes de llevártelo a la cazuela? El equipo de Quesma construyó un benchmark 0-shot sobre 1.040 fotos del conjunto de prueba del dataset FungiTastic (615.000 fotos y 2.800 especies, curado por investigadores checos a partir del proyecto citizen-science Atlas of Danish Fungi) y preguntó a varios modelos: «¿Qué especie es? Responde con un JSON con los 5 nombres latinos más probables». El resultado: Gemini 3.6 y Gemini 3.7 Flash lideran la tabla, pero incluso el mejor clasifica como comestible alrededor del 12% de los hongos mortales del set.
El dato importa porque el error no es cosmético. En el artículo se documenta el patrón clásico que mata recolectores novatos: una webcap mortal (género Cortinarius) llamada chantarelle (rebozuelo). Es exactamente el tipo de confusión que aparece en los manuales de micología forrajera. Y aquí lo再現 un modelo que cuesta céntimos por consulta.
Qué modelos se probaron y qué fallaron
La pregunta se hizo en inglés, en formato JSON estructurado, pidiendo los 5 nombres latinos más probables ordenados de mayor a menor confianza. La métrica interesante no fue solo «acertar el primero», sino la tasa de falsos positivos críticos: probabilidad de que un hongo mortal sea clasificado como especie comestible.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLos resultados, tal como los reporta Quesma:
- Gemini 3.6 y Gemini 3.7 Flash encabezan el ranking, tanto en acierto del primer guess como entre el top-5. Es una sorpresa para los autores: esperaban que Claude Fable 5 y GPT-5.6-Sol (descritos en la fuente como el mejor modelo de visión de OpenAI) dominaran, como ocurre en otros benchmarks visuales. No fue así.
- GLM-5.3-Flash destaca como el más eficiente en coste por consulta del grupo.
- Qwen3.8 27B, descrito por el autor como su favorito para coding local, muestra la peor tasa de falsos positivos mortales: más de un tercio de los hongos venenosos son clasificados como especies comestibles.
- Muse Spark 1.2 parece «seguro» solo porque se niega a guessar con frecuencia; al ajustar por abstención, su utilidad real cae.
El detalle clave para founders: liderar un benchmark general de visión no implica liderar un benchmark de seguridad. Gemini gana en identificación, pero un 12% de falsos positivos mortales es, literalmente, una de cada ocho veces. En producción, eso es un SLA inaceptable para cualquier caso de uso que toque salud, seguros, legal o compliance.
Cómo se construyó el dataset de prueba
El autor no entrenó nada (es un test 0-shot, puramente evaluación con el modelo tal cual sale de la caja). Para que el benchmark tuviera sentido en el mundo real, hizo tres filtros sobre FungiTastic:
- Solo fotos de smartphone, no de laboratorio ni de placas de microscopio. La idea era reproducir lo que un usuario normal manda por chat.
- Solo especies que se pueden encontrar en un bosque europeo, cruzando con la lista oficial de hongos comercializables en Polonia (37 de 47 especies estaban en el dataset). Polonia tiene una cultura forrajera fuerte: la actividad se llama grzybobranie y es un pasatiempo social.
- Especies mortales, usando la lista de hongos mortales de Wikipedia (20 especies presentes en el dataset).
La intersección entre las dos listas dio Tricholoma equestre (conocida como gąska zielonka en polaco, yellow knight en inglés): considerada comestible en algunos países y mortal en otros, con incidentes fatales documentados. Es decir, incluso los expertos discuten; los modelos, directamente, no pueden resolver ese tipo de ambigüedad taxonómica.
El set final fueron 55 especies, 20 fotos por especie en el test split de FungiTastic (las que no llegaban a 20 se completaron con el split de validación).
Qué significa esto para founders de visión por computador
La lección para quien está construyendo productos con LLMs multimodales no es «no uses Gemini para visión». Es mucho más concreta:
- El top-1 accuracy miente en dominios críticos. Si tu caso de uso tolera errores (recomendación de productos, búsqueda visual de inspiración, moderación suave), el top-1 de Gemini es excelente. Si el error tiene consecuencias (medicina,食品安全, contratación, documentos legales, identificación de especies, KYC biométrico), necesitas top-5 con thresholds de confianza explícitos y rutas de escalado a humano.
- El modelo más barato no es el más seguro. GLM-5.3-Flash es imbatible en coste, pero el benchmark sugiere que los modelos de frontera (incluso los Flash de Gemini) tienen tasas de falso positivo crítico mucho menores que alternativas open-source pequeñas. El coste por inferencia se debe comparar contra coste de error esperado, no contra coste por token.
- Contexto geográfico y estacional cambia todo. El autor probó añadir el hint «foto de Dinamarca» y no mejoró los resultados. Eso es una alerta: los modelos generalistas no saben dónde estás parado. Si tu producto identifica algo (hongos, plantas, insectos, aves, infraestructura, piezas industriales), incluir metadata de ubicación, fecha y condiciones de captura en el prompt es trabajo de producto, no de modelo.
- Los benchmarks de visión general no predicen rendimiento en垂直 dominios. FungiTastic es solo hongos, pero el patrón es genérico: cualquier dataset vertical suficientemente grande (radiografías, defectos de fabricación, malezas agrícolas, insectos vectores) merece un benchmark interno antes de poner un modelo en producción.
Acciones concretas para implementar esta semana
- Monta un mini-benchmark 0-shot con tu propio dataset vertical. Replica el patrón de Quesma: 20-50 fotos por clase, split de test que el modelo nunca vio, prompt estructurado pidiendo top-5. Mide no solo accuracy, sino tasa de falso positivo crítico (qué pasa cuando la respuesta correcta es la peligrosa y el modelo dice «OK, seguro»).
- Añade abstención como feature. Si el modelo no supera un umbral de confianza en su top-1, enruta a un humano o responde «no estoy seguro». Muse Spark 1.2 en el benchmark gana en seguridad precisamente porque se abstiene; eso es un patrón de diseño, no un bug.
- Documenta los «deadly lookalikes» de tu dominio y haz tests específicos. En micología el patrón es Cortinarius mortal llamado chantarelle. En tu industria habrá un equivalente: el caso donde el modelo dice la respuesta benigna y la respuesta correcta es la catastrófica. Esos casos van a un set de regresión obligatorio en cada release.
El veredicto del autor
El cierre de Quesma es directo: no comas un hongo porque la IA te diga que es seguro. Eso era cierto hace años y sigue siendo cierto. La IA slop en código, texto o diseño se arregla con un par de prompts o una edición manual. La IA slop en identificación biológica se arregla con un trasplante de hígado, como ironiza el autor.
La nota positiva: si lo que quieres es aprender en lugar de arriesgar, Gemini 3.7 Flash es una herramienta de estudio brutal. El propio autor cuenta que vibe-codeó una app para memorizar la flora local encima del benchmark. Identificar para sobrevivir, todavía no. Identificar para aprender, ya es gold.
Fuentes
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













