Qué es SCM, la app de macOS que indexa fotos y videos con IA local

Qué es SCM, la app de macOS que indexa fotos y videos con IA local

SCM (Smart Content Memory) es una app nativa para macOS que hace búsqueda por IA sobre cada foto y cada fotograma de video en cualquier carpeta del Mac. La idea es directa: en lugar de recordar el nombre de un archivo, escribes una frase natural del tipo "la cena en la playa el verano pasado" y la app devuelve los momentos exactos —incluyendo el milisegundo dentro de un video— sin que ningún archivo salga de tu máquina.

La propuesta se apoya en tres decisiones técnicas que la diferencian de la mayoría de alternativas:

  • Local-first real: corre en el Mac del usuario, no usa cuentas ni sube nada a la nube. La inferencia se ejecuta en local, y los pesos de los modelos se descargan una sola vez.
  • Granularidad de fotograma: divide cada video en escenas y embebe cada una, por lo que un acierto aterriza en el momento exacto, no en el archivo.
  • Múltiples modos de búsqueda combinables: visión semántica, OCR literal, transcripción de diálogo con Whisper, y un chat LLM opcional que cita la evidencia.

Modos de búsqueda: visión, OCR, diálogo y chat con citas

SCM expone cuatro modos principales, cada uno pensado para un tipo distinto de memoria:

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad
  • Files: búsqueda por significado sobre fotos y videos enteros. El motor usa CLIP ViT-L/14@336 por defecto, con boosts por nombre de archivo y frase.
  • Scenes: el modo que justifica la app. Cada video se segmenta con ffmpeg y se embebe por escena; un acierto abre el video y salta al timecode exacto.
  • OCR: texto literal visible en imágenes y fotogramas, con Tesseract en inglés y 35 idiomas conmutables.
  • Dialogue: transcripción con Whisper tiny.en o base.en y búsqueda exacta de líneas habladas, en tres niveles de exigencia (línea exacta, palabras en la misma utterance, palabras en el video).
  • LLMs (opt-in): chat con un modelo local (Qwen3 1.7B por defecto, Llama 3.2 3B opcional) que responde citando la evidencia que la app ya extrajo —dialogue, OCR y nombre de archivo— con número de cita clickable.

Los modelos que puedes cambiar según tu Mac

SCM incluye cuatro modelos vision con ONNX Runtime y permite cambiar el activo por biblioteca:

  • CLIP ViT-L/14@336 (default): el más sólido para escenas de video del mundo real. ~480–570ms por imagen en CPU. ~435 MB de pesos.
  • SigLIP-2-B/16: el más rápido para importar bibliotecas grandes. ~50–100ms por imagen. ~412 MB.
  • SigLIP-2-L/16@256: alta definición (1024-dim) para detalles pequeños, señales, texto en pantalla. ~200ms. ~850 MB.
  • SigLIP-B/16@384: máxima definición. ~480ms. ~214 MB.

Cambiar de modelo re-embebe toda la biblioteca en segundo plano; mientras termina, la búsqueda cae automáticamente a keyword sobre nombre de archivo para no quedarse muda.

Privacidad y arquitectura: por qué importa en 2026

Toda la biblioteca vive bajo ~/Library/Application Support/scm: índice JSON, bins de embeddings Float32 por modelo, sidecars de escenas y transcripciones, thumbnails y posters. Nada se sube. El renderer corre en app:// con contextIsolation, sandbox del sistema operativo y CSP anclada a 'self'.

Las descargas ocurren una vez por cosa desde workers del proceso main, todas con verificación sha256:

  • Pesos de visión desde Hugging Face.
  • Packs de idioma OCR desde el CDN de Tesseract.
  • Pesos de Whisper.
  • Solo si activas el chat: el sidecar de llama.cpp y los modelos GGUF desde GitHub y Hugging Face.

En 2026, con la proliferación de apps "AI-first" que procesan tu biblioteca personal en la nube, este enfoque de inferencia local con modelos de pesos abiertos responde a una demanda concreta de founders, periodistas, equipos legales y cualquier persona que maneje material sensible.

Para equipos y founders: cuándo SCM encaja y cuándo no

SCM no pretende reemplazar a Apple Photos ni a un Lightroom: está pensado como capa de búsqueda semántica y forense sobre archivos que ya tienes, en sus carpetas originales. Casos donde el enfoque local-first aporta valor real:

  • Equipos de contenido y productoras: localizar el fotograma exacto en horas de material sin etiquetar manualmente.
  • Investigación periodística y legal: indexar archivos sin enviarlos a ningún servidor.
  • Equipos técnicos con material propietario: código en pantalla, capturas internas, videos de demos que no deberían pasar por un SaaS.
  • Founders en LATAM y España: infraestructura cloud para IA sigue siendo cara y a veces inestable; correr el índice en local evita latencia y costes recurrentes de inferencia.

El trade-off es esperable: la primera indexación de una biblioteca grande lleva horas, y el primer build de la app (vía electron-builder) descarga el binario de Electron y ffmpeg. Después, todo queda offline.

Qué significa esto para tu startup

  • Reempaqueta la idea para tu vertical: si tu producto maneja assets visuales (catálogos, footage, evidencia, fotos de usuario), un índice semántico local con OCR + Whisper es un feature que se monta sobre modelos abiertos sin tocar tu backend.
  • Evalúa modelos antes de comprar: la tabla de SCM (CLIP vs SigLIP-2 en tamaño, latencia y precisión) es un benchmark utilizable para decidir qué embedder correr en CPU/GPU para tu caso.
  • Ofrece un plan offline como diferenciador: en mercados con conectividad irregular o clientes con requisitos de residencia de datos, el "no sale de tu máquina" se vuelve argumento de venta.

Acciones concretas que puedes tomar hoy

  • Clona el repo y pruébalo con tu biblioteca de screenshots: brew tap allenv0/scm && brew install --cask scm es la ruta más corta en Apple Silicon. Con 1.000–2.000 imágenes verás si el modelo por defecto cubre tu caso antes de cambiar a SigLIP.
  • Mide el coste de indexar tu archivo de video: corre el preset Balanced (30s/punto, 8–128 segmentos) y compara tiempo total contra Ultra Pro (2.5s/punto, 24–2048) antes de comprometerte con un pipeline propio.
  • Evalúa Qwen3 1.7B como LLM local por defecto: si planeas ofrecer un chat "con citas" sobre evidencia, el binario default de SCM te da un punto de referencia de tamaño (~1.1 GB) y rendimiento en Macs de 8 GB.

Fuentes

👥 ¿Quieres ir más allá de la noticia?

En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.

👥 Unirme a la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...