¿Qué es OCR It y qué problema resuelve?
OCR It es una extensión de Chrome de código abierto (licencia MIT) que convierte cualquier documento paginado en texto plano editable sin enviar nada a la nube. Según su README en GitHub, la herramienta está construida sobre Tesseract.js, el motor OCR open source de referencia, y corre 100% en el navegador mediante un build local de Tesseract.
Su mecánica es directa: defines una región rectangular sobre el área de texto una sola vez con ⌥⇧R, y a partir de ahí cada vez que pulsas ⌥⇧S la extensión captura esa misma zona de pantalla, aplica OCR y añade el texto a una transcripción acumulada. Si prefieres automatizar el paso de página, ⌥⇧A lanza un bucle que captura, gira la página y repite hasta que el documento termina o se alcanza un tope de 300 páginas.
El desarrollador Thiago Tigaz publicó el repositorio en github.com/thiagotigaz/ocr-it esta semana. En el momento de escribir esta nota registra 2 estrellas y 1 fork, números de salida típicos de un proyecto open source recién publicado, no de un producto corporativo con tracción.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad¿Por qué importa para un founder que trabaja con información atrapada?
Tres casos aparecen una y otra vez en equipos técnicos:
- Libros escaneados o PDFs protegidos. El texto está visible en pantalla pero
Ctrl+Cno funciona. Copiar a mano capítulo por capítulo es inviable para cualquier documento de más de 50 páginas. - Lectores web con visor incrustado. Slides, artículos paginados, manuales corporativos: muchos viven en iframes cross-origin que bloquean la selección.
- Documentos de investigación en baja calidad. Papers y reportes sectoriales en escaneos antiguos que un LLM no puede leer directamente.
OCR It ataca los tres. El contexto importa: según un análisis de Klippa publicado en 2026 sobre alternativas a Tesseract, las opciones comerciales como Doxis AI.dp prometen hasta un 99% de precisión y prometen reducir el tiempo de procesamiento manual hasta en un 95%, pero operan en la nube, parten de €25 en créditos iniciales y suelen requerir API keys con sus implicaciones de privacidad y coste recurrente.
Para founders que procesan decenas, no miles, de documentos al mes, una herramienta local sin suscripción cambia el cálculo.
¿Cómo funciona en la práctica?
El flujo tiene cuatro pasos y no requiere build ni dependencias de npm en runtime:
- Descarga el ZIP o clona el repo desde
github.com/thiagotigaz/ocr-it. - Instala como Load unpacked en
chrome://extensionscon el modo desarrollador activo. - Fija la región con
⌥⇧Rarrastrando un rectángulo sobre el área de texto, dejando un margen interno para evitar números de página y cabeceras. - Captura página a página con
⌥⇧S, o lanza el modo automático con⌥⇧A.
El OCR se serializa en una cola: puedes apilar capturas sin esperar entre páginas, y el badge del icono cuenta cuántas quedan por procesar. Desde el popup puedes editar el texto capturado, re-correr el OCR en una sola página si la lectura salió mal, y exportar a .txt con separadores --- page N ---. Las páginas idénticas a la anterior se marcan como DUPLICATE y, en modo automático, cierran la ejecución para evitar transcripciones fantasma.
Cómo maneja los lectores que bloquean selectores CSS
La parte más interesante del código está en cómo gira páginas automáticamente. En lugar de almacenar un selector CSS (que se rompe cuando el visor re-renderiza el DOM), guarda un punto en coordenadas de pantalla. Al avanzar la página, ese punto se ofrece a cada frame del documento y el que dice es mío ejecuta la secuencia completa pointerdown → mousedown → pointerup → mouseup → click. Esto le permite funcionar con iframes cross-origin y shadow DOM, donde ningún selector del frame padre llega.
La extensión lleva un registro de fallos y los muestra como toasts: control no detectado, viewer inaccesible, página duplicada, OCR atascado. Cuando termina una ejecución automática, reporta en el popup la razón exacta del cierre, así que una corrida desatendida nunca termina sin diagnóstico.
¿Qué limitaciones y tradeoffs tiene?
El propio README las lista con claridad. Vale la pena tenerlas presentes antes de adoptarla:
- Solo captura el viewport visible. Si el documento tiene scroll infinito, hay que avanzar manualmente y volver a situar la región.
- Chrome limita las capturas a ~2 por segundo. La herramienta encola con reintentos, así que funciona, pero no esperes procesar 300 páginas en segundos.
- La precisión depende del material original. Texto renderizado en pantalla lee con >90% de confianza, según el propio repositorio; escaneos a baja resolución y handwriting necesitan limpieza manual.
- El visor de PDF nativo de Chrome bloquea auto-advance porque es un plugin al que ninguna extensión puede inyectarse.
⌥⇧S+PageDownsí funciona ahí. - Idiomas. Vienen tres de serie (inglés, portugués, español). Cualquiera de los ~100 idiomas de Tesseract se puede añadir con
npm run vendor -- fra deu jpny actualizandoLANGUAGESensrc/shared.js. Cargar dos a la vez coneng+porfunciona, a costa de algo de velocidad.
Sobre privacidad, el README es tajante: la extensión no hace ninguna petición saliente, así que el texto OCR-eado nunca sale del equipo. Esto es justamente lo que la mayoría de las APIs comerciales no te pueden garantizar sin coste extra de cumplimiento.
¿Qué significa esto para tu startup?
Si tu equipo pasa horas al mes extrayendo texto de documentos para alimentar pipelines de IA, OCR It cambia el cálculo de coste. Un caso rápido: un analista que tarda 2 minutos por página en transcribir un reporte de 80 páginas dedica casi 3 horas. Con OCR It, 80 pulsaciones de ⌥⇧S y un copy-paste al final resuelven lo mismo, sin que la información cruce la frontera del navegador.
Acción 1 — Audita tu pipeline de ingestión de documentos
Haz una lista de los 5 documentos que más cuesta meter a tu LLM (papers internos, manuales de producto, contratos escaneados, libros de sector). Si más de la mitad requieren OCR o copy manual, OCR It te devuelve esas horas gratis a cambio de cambiar un poco el flujo. El coste de oportunidad es lo que importa: cada hora humana cuesta más que cualquier suscripción SaaS de OCR.
Acción 2 — Valida con OCR It antes de pagar una API cloud
Antes de enchufar Google Document AI, AWS Textract o Doxis AI.dp a un proyecto pequeño, valida si el problema es realmente de escala o de horas. Para volúmenes bajos (decenas de documentos al mes, menos de 300 páginas cada uno) el coste marginal es cero. Cuando el cuello pase de unos pocos miles de páginas al mes, ahí sí mira opciones en la nube, empezando por las que alcanzan ese 99% de precisión reportado por Klippa.
Acción 3 — Activa el acceso a PDFs locales desde el primer día
Para PDFs en disco (file:///...), Chrome bloquea el acceso por defecto a cualquier extensión. Hay que entrar en chrome://extensions, abrir los detalles de OCR It y activar Allow access to file URLs. Sin ese paso la extensión simplemente no verá el archivo. Es un toggle que ningún tutorial menciona hasta que lo necesitas, y perder 20 minutos en debug por eso es evitable.
Acción 4 — Lee el código antes de adoptarlo en producción
El repositorio abierto es una oportunidad, no solo una herramienta. El src/ es corto, las pruebas instalan la extensión en Chrome headless vía CDP y verifican casos reales (iframes cross-origin, shadow DOM, runs desatendidos que paran solos al final del documento). Para un equipo técnico, auditar el código en una tarde es viable y te da confianza sobre qué hace exactamente, algo que ninguna API comercial te garantiza de serie.
Fuentes
- OCR It — Repositorio oficial en GitHub (fuente original)
- The Best Alternatives to Tesseract in 2026 — Klippa
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













