EmbeddingGemma 2: el modelo de Google que corre en tu móvil

EmbeddingGemma 2 lleva los embeddings multimodales al dispositivo

Google DeepMind publicó EmbeddingGemma 2, un modelo abierto de 740 millones de parámetros que convierte texto, código, imágenes, audio y vídeo en un solo espacio vectorial de 768 dimensiones. La diferencia frente a la mayoría de alternativas del mercado no es técnica: es de dónde corren los datos. Todo el procesamiento ocurre en el smartphone o el portátil del usuario, bajo esquema Apache 2.0 y sin pagar royalties a Google.

Los ingenieros de DeepMind Sahil Dua y Henrique Schechter Vera presentaron el modelo el 6 de octubre y los pesos ya están disponibles en Hugging Face y Kaggle, según SiliconAngle. Funciona con sentence-transformers, vLLM, llama.cpp, Ollama, LiteRT y MediaPipe; el soporte para ML Kit en Android con aceleración NPU llega en las próximas semanas, según la ficha técnica reportada por MarkTechPost.

Para un founder, esto resuelve un problema que hasta ahora obligaba a elegir entre potencia y privacidad: indexar la galería de fotos, los documentos internos o el historial de llamadas de un cliente sin que esa información salga del teléfono.

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Qué cambia respecto a EmbeddingGemma 1

La primera versión, lanzada en septiembre de 2025, solo entendía texto y acumuló más de 20 millones de descargas, según cifras citadas por DeepMind en el anuncio. EmbeddingGemma 2 mantiene la base abierta de Gemma pero da un salto de alcance en tres frentes:

  • Modalidades: pasa de texto y código a texto, código, imágenes, vídeo y audio en un único espacio vectorial.
  • Ventana de contexto: 8.192 tokens, cuatro veces más que la versión 1. Según la ficha técnica, caben alrededor de 29 imágenes, 58 frames de vídeo o 5,5 minutos de audio.
  • Recuperación de código: salta de 68,68 a 78,68 puntos en MTEB Code v1, una mejora de casi 10 puntos reportada por la propia DeepMind.

El salto en código es relevante porque el grueso de pipelines RAG para asistentes de programación dependen de embeddings que entiendan bien la sintaxis y la semántica. La mejora posiciona a EmbeddingGemma 2 como una alternativa seria para empresas que montan agentes internos sobre código propietario.

Cómo está construido el modelo de 740M parámetros

EmbeddingGemma 2 está montado sobre la arquitectura Gemma 4, la familia abierta que Google lanzó en abril de 2026. El diseño es modular para que cada desarrollador cargue solo lo que necesita:

  • Backbone de texto y código: 270 millones de parámetros (130M del transformer más 140M del embedder).
  • Encoder de visión: 170 millones de parámetros, opcional.
  • Encoder de audio: 300 millones de parámetros, opcional.

Combinaciones posibles: 270M solo texto, 440M texto y visión, 570M texto y audio, 740M todo. Todos producen vectores en el mismo espacio, según MarkTechPost: una consulta embeddeada con la versión solo-texto puede matchear documentos procesados por el modelo completo. Esto evita reindexar cuando un producto crece de «solo texto» a «multimodal».

Rendimiento en el dispositivo: qué esperar en hardware real

La pregunta práctica es si el modelo cabe y corre bien en un móvil de 2026. Las cifras publicadas por el equipo Google AI Edge son concretas:

  • Solo texto en Pixel 11 Pro con cuantización: alrededor de 191 MB de RAM activa.
  • Modelo multimodal completo: unos 567 MB de RAM activa.
  • Latencia de visión en MacBook M5 Pro: 37,3 ms por imagen con un presupuesto de 70 tokens visuales.

La cuantización es parte del entrenamiento: los pesos vienen preparados para INT4 e INT8, lo que evita el degradado típico de cuantizar modelos a posteriori.

Para una startup, la implicación es directa: una app de notas con búsqueda semántica puede correr con el backbone de 270M en dispositivos de gama media, y una app de cámara con búsqueda por voz o imagen puede activar el modelo completo sin tener que migrar a un servidor.

Matryoshka Representation Learning: recortar vectores sin perder calidad

Una técnica llamada Matryoshka Representation Learning (MRL) permite truncar el vector de salida a 512, 256 o 128 dimensiones en lugar de las 768 completas. La consecuencia práctica es almacenamiento hasta 6 veces menor en la base de datos vectorial.

Los puntos de corte que reporta la documentación de Google:

  • 256 dimensiones: MTEB multilingual baja de 61,36 a 60,41 — caída mínima.
  • 128 dimensiones: MMEB cae a 45,65, por lo que Google recomienda usarlo solo en cargas de solo texto.

Para founders que pagan por almacenamiento en Qdrant, Pinecone o Weaviate, recortar a 256 dimensiones en flujos de texto es una palanca de ahorro concreta sin sacrificar la calidad de búsqueda.

Comparativa con los competidores multimodales abiertos

EmbeddingGemma 2 entra en un mercado donde ya hay alternativas multimodales abiertas, pero pocas con audio y on-device a la vez. La tabla publicada por MarkTechPost resume las opciones relevantes:

  • Qwen3-VL-Embedding-2B (Alibaba): 2.000 millones de parámetros, sin audio, contexto de 32K.
  • LCO-Embedding-Omni-3B: 3.000 millones en el backbone (5.000M según Hugging Face), con audio pero sin cifras de RAM on-device publicadas.
  • Gemini Embedding 2 (Google): solo API de pago, sin pesos abiertos.

El hueco que EmbeddingGemma 2 ocupa es multimodal con audio, abierto, cuantizado para correr en dispositivo y bajo Apache 2.0. El competidor más cercano en multimodalidad completa (LCO) triplica su tamaño; el más cercano en licencia abierta (Qwen3-VL) no tiene audio. La propia DeepMind afirma liderar entre embedders multimodales sub-1B en los benchmarks MTEB Code y MAEB.

¿Qué significa esto para tu startup?

Tres palancas concretas para founders que están montando producto con IA:

  • Costo por búsqueda cercano a cero: si el embedding se genera en el dispositivo del usuario, no hay tarifa de API por inferencia. En productos con cientos de miles de usuarios activos, esto cambia el unit economics de funciones como «búsqueda en tu galería» o «resumen de tus documentos».
  • Cumplimiento de privacidad sin servidor: fotos, historiales clínicos, conversaciones y notas de clientes pueden indexarse sin salir del dispositivo. En sectores regulados (salud, legal, fintech), esta arquitectura simplifica el argumento de cumplimiento frente al cliente corporativo.
  • RAG local para datos sensibles: EmbeddingGemma 2 se combina con Gemma 4 en local para montar retrieval-augmented generation completamente offline. La app AI Edge Foresight de Google para Mac ya corre ese combo, según SiliconAngle.

Dos acciones para esta semana:

  1. Audita tu pipeline de embeddings actual. Si pagas por un servicio cloud para indexar contenido del usuario que podrías procesar localmente, EmbeddingGemma 2 te da un comparativo abierto para renegociar precio.
  2. Prototipa una feature on-device. El ejemplo más rápido: una búsqueda de fotos por descripción («playa con perro») en una app móvil. Con pip install "sentence-transformers[image,audio,video]" y el modelo google/embeddinggemma-2 en Ollama, se monta en horas.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

¿Y esto cómo se aplica en tu negocio?

En CAR, dueños de empresa de Latinoamérica y España usan la tecnología para ser más rentables. Empiezas con una ruta de 7 días y terminas con un sistema funcionando en tu negocio.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...