Un benchmark que desnuda a los extractores web: cuando inventar datos es la norma, no la excepción
Un test reciente publicado en earnanhonestdollar.com/bench puso a 16 modelos de lenguaje y 3 APIs pagas de extracción web frente a 42 pares de páginas gemelas con campos trampa. La instrucción fue tan simple como reveladora: "Use null para cualquier campo cuyo valor no esté en la página. No adivine". Con esa sola línea, los modelos pasaron de inventar 70,7% de los campos faltantes (405 de 573) a solo 20,2% (116 de 574).
El resultado es un golpe directo a la confianza que los founders depositan en scrapers y agentes: la mayoría de los LLMs no sabe decir "no sé".
¿Qué midió exactamente el test?
El benchmark construyó 42 pares de páginas de 7 tipos distintos. Cada par difiere por una sola fila: una página muestra el valor real, la otra lo omite. En ambos casos aparece un "cebo" diseñado para tentar al modelo a inventar: precios tachados, nombres de verificadores, fechas de actualización antiguas.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadPor ejemplo, en una página figuraba Was $493.00 (precio viejo) junto al precio actual. Sin la instrucción explícita, los 16 modelos cayeron y devolvieron 493 como precio. Con la instrucción, solo 1 de 16 siguió cayendo.
Cada concursante corrió una vez el 27 de septiembre de 2026 sobre los 84 pares de páginas (42 con el campo, 42 sin él). Se comparó la versión "con" instrucción vs. la versión "sin" instrucción, y los rangos de confianza al 95% se calcularon como intervalos de Wilson.
El ranking: los modelos que mejor y peor se comportan
Con la instrucción activada, los mejores extractores fueron los modelos de razonamiento de bajo costo:
- Gemini 3.8 Flash: 1 de 36 campos inventados (rango 0,5–14,2%)
- GLM 5.3: 1 de 35 (rango 0,5–14,5%)
- Hy3: 3 de 36 (rango 2,9–21,8%)
- DeepSeek V4.1 Flash: 3 de 35 (rango 3,0–22,4%)
- GPT-6 Luna: 5 de 36 (rango 6,1–28,7%) — con un costo total de la corrida de US$0,0049
- Sonnet 5, GLM 5.3 Flash y GPT-5.6 Sol empataron en 5–6 de 36
Sin la instrucción, el mismo GPT-6 Luna pasó a inventar 25 de 36 campos, un salto de 5x. Lo mismo ocurrió con todos los demás modelos, sin excepción. Como resume el test: "Los 16 modelos inventaron más sin la frase. Cada uno de ellos".
El costo total de la corrida de los 84 pares fue revelador: el más caro fue Gemini 3.8 Flash (US$0,1619), seguido por GLM 5.3 (US$0,1723). Modelos como DeepSeek V4.1 Flash (US$0,0188) o Gemma 4 31B (US$0,0037) ofrecen tasas de error razonables a una fracción del costo de los premium.
Las APIs pagas: el caso Firecrawl sorprende (y preocupa)
El resultado más llamativo fue el de las tres APIs comerciales evaluadas:
- Firecrawl: inventó 24 de 36 campos faltantes (50,3–79,8%) — peor que 13 de los 16 modelos del ranking, con rangos de confianza que no se solapan
- ScrapingBee: 16 de 36 (rango 29,5–60,4%)
- ScrapeGraphAI: 7 de 31 (rango 11,4–39,8%)
Las 24 respuestas inventadas por Firecrawl copiaron el cebo textual de la página. Es decir: cuando un modelo tiene que elegir entre admitir incertidumbre y copiar algo plausible que vio en el HTML, la mayoría de los proveedores pagos elige lo segundo.
El test aclara que las APIs corrieron en plan gratuito y solo con la instrucción activada — no se probó la versión "sin instrucción". El plan pago podría comportarse distinto, pero en la configuración accesible para un founder promediando ScrapingBee no permite incluir la instrucción a nivel de prompt (no tiene slot de schema), así que la regla del null se metió en cada descripción de campo.
El verificador barato: tu red de seguridad por fracción de centavo
El test también evaluó si un segundo modelo puede auditar al primero, un patrón de LLM-as-judge cada vez más común. Los resultados:
- GPT-6 Luna como verificador: atrapó 38 de 49 valores inventados sin rechazar ningún valor correcto
- Jev 1.13 como verificador: atrapó 23 de 49, también sin falsos rechazos
Sobre los 24 valores inventados por Firecrawl, GPT-6 Luna cazó 20. Revisar los 126 pares página-valor únicos costó US$0,0049 con GPT-6 Luna y US$0,0024 con Jev. Eso es menos de medio centavo de dólar por lote.
Jev, descrito como "un modelo de decisión", detectó bien los cebos obvios (autor equivocado, precio incorrecto), pero falló en casos casi-semánticos: tiempo de reposo, cocción o total dado como tiempo de preparación (0 de 6 cazados). Para esa capa, GPT-6 Luna fue más confiable.
¿Qué significa esto para tu startup?
Tres lecciones directas si usas LLMs para extraer datos web — ya sea con Firecrawl, ScrapingBee, ScrapeGraphAI, o con un modelo y un fetch plano:
- La instrucción anti-alucinación es obligatoria, no opcional. Pasar de 70,7% a 20,2% de error con una sola frase en el prompt es la mejor optimización de ingeniería que vas a hacer esta semana. Literal:
"Use null for any field whose value is not on the page. Do not guess". - Pagar más no implica menos errores. Firecrawl (API paga) rindió peor que 13 de los 16 modelos abiertos y cerrados evaluados. El test sugiere que, para extracción confiable, un fetch plano + un modelo chico con buena instrucción supera a la mayoría de los servicios especializados en su tier gratuito.
- El verificador externo cuesta casi nada. Un modelo barato como GPT-6 Luna (US$0,0049) o Jev 1.13 (US$0,0024) puede auditar cada respuesta por fracción de centavo. Para flujos donde los datos inventados contaminan tu pipeline (pricing, leads, contenido RAG), esa segunda llamada es un seguro obligatorio.
Tres acciones concretas para implementar hoy
- Audita tus prompts de extracción. Si tu pipeline no incluye la frase "do not guess" o equivalente, estás asumiendo un ~70% de alucinación por defecto. Pega el texto literal del test en tu system prompt.
- Reemplaza Firecrawl/ScrapingBee por un fetch + modelo chico en su tier gratuito, mientras mides latencia. El benchmark sugiere que
curl + BeautifulSoup + GPT-6 Lunapuede superar a Firecrawl en tu caso, por una fracción del costo. El test aclara que las APIs corrieron en plan gratuito; el plan pago podría mejorar, pero conviene medirlo antes de renovar contrato. - Implementa un verificador LLM-as-judge en tu pipeline. Un segundo modelo de ~US$0,005 por lote de auditoría es una red de seguridad ridículamente barata para datos que después alimentan dashboards, CRM o contextos RAG. Empieza con GPT-6 Luna y baja a Jev si la latencia importa.
Lo que el test no demuestra (y conviene tener en mente)
El benchmark es transparente con sus límites. Vale la pena repetirlos antes de tomar decisiones arquitectónicas grandes:
- Una sola corrida por concursante. No se hicieron repeticiones. Los rangos de Wilson muestran que muchas posiciones del medio del ranking se solapan y no se pueden separar con una sola medición.
- Páginas sintéticas. Los 7 tipos de páginas y las trampas fueron escritas por los autores. Sitios reales, con su desorden, pueden diferir.
- APIs en plan gratuito. ScrapingBee, Firecrawl y ScrapeGraphAI corrieron solo con la instrucción; el plan pago puede comportarse distinto. ScrapingBee, además, no permite prompt a nivel de sistema.
- Trampas de email excluidas. Una dirección de contacto de prensa se prestaría a lectura razonable, así que se removió del cómputo de checker y de la tabla principal.
- GPT-6 Luna no emitió veredicto en 1 de 98 inputs del checker. Se excluyó de su conteo.
Aun con esos asteriscos, la conclusión es difícil de esquivar: los LLMs mienten por defecto, una instrucción clara baja la mentira a una quinta parte, y un verificador barato la caza casi toda. Para cualquier founder montando un agente que compra, vende o resume información de la web, esos tres números deberían cambiar el diseño del pipeline esta semana.
Fuentes
- Calling the AI bluff: "Do not guess" cut made-up fields from 70.7% to 20.2% (fuente original)
- Top 6 LLM Scrapers: ChatGPT, Perplexity & Gemini - AIMultiple
- Best Web Scraping Tools: 11 Picks That Actually Scale - Olostep
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













