Google mete en un vector lo que antes necesitabas cinco modelos
Google DeepMind presentó este 6 de octubre EmbeddingGemma 2, un modelo de 740 millones de parámetros bajo licencia Apache 2.0 que convierte texto, código, imágenes, video y audio en un único espacio vectorial de 768 dimensiones. Es la primera versión nativa y multimodopen-source de la familia, construida sobre la arquitectura Gemma 4, y está pensada para correr on-device: en un Pixel 11 Pro cuantizado ocupa unos 191 MB de RAM activa en modo texto y alrededor de 567 MB cuando se cargan los encoders de visión y audio. Para un founder acostumbrado a pagar por cada llamada a una API de embeddings, esa cifra es la noticia: el retrieval deja de tener un coste por consulta y pasa a ser un coste fijo en megabytes.
Qué es un embedding y por qué importa que ahora sea multimodal
Un embedding es una representación numérica de un contenido (palabras, imágenes, audios) en un espacio vectorial donde "lo parecido" queda cerca y "lo distinto" lejos. Es la pieza que permite a un buscador semántico encontrar documentos relevantes aunque no compartan las mismas palabras, y es la base de casi cualquier pipeline moderno de RAG (Retrieval-Augmented Generation): el LLM recupera los vectores más cercanos a la pregunta y los usa como contexto antes de responder.
Hasta hoy, la mayoría de productos resolvían esto con varios modelos separados: uno para texto, otro distinto para imágenes, otro para audio. El problema es que cada modelo vive en su propio espacio vectorial, así que no se pueden comparar de verdad: una foto de un gato no podía estar cerca del texto "gato" porque vivían en mapas distintos. EmbeddingGemma 2 resuelve ese problema proyectando las cinco modalidades al mismo espacio de 768 dimensiones, lo que habilita búsquedas cruzadas tipo "encuéntrame el clip de video que coincide con esta nota de voz" o "busca en mi biblioteca las imágenes relacionadas con esta consulta de texto".
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 díasQué trae EmbeddingGemma 2 frente a la versión 1
El primer EmbeddingGemma llegó en septiembre de 2025 con 308 millones de parámetros y solo texto. La nueva versión multiplica por 2,4 el tamaño, pero el salto real está en tres frentes:
- Multimodalidad nativa: texto, código, imágenes, video y audio en un solo modelo.
- Ventana de contexto 4 veces mayor: pasa de 2K a 8K tokens, suficiente para meter 29 imágenes, 58 frames de video o 5,5 minutos de audio en una sola pasada.
- Salto en código: según la model card, el puntaje en MTEB Code v1 sube de 68,76 a 78,68 (+9,92 puntos), una mejora de cerca del 14% que vuelve al modelo competitivo para indexar repositorios locales y alimentar agentes de coding.
En texto multilingüe se mantiene el rendimiento de la versión 1 (61,36 vs 61,15 en MTEB multilingual v2), así que la v1 no se queda obsoleta: sigue siendo útil para cargas puramente textuales y de menor consumo.
Diseño modular: pagas solo por lo que necesitas
Uno de los trucos más interesantes del lanzamiento es que los 740M parámetros están particionados y se pueden cargar de forma selectiva:
- 270M para texto y código (un transformer de 130M más un embedder de 140M).
- 440M para texto y visión (añade el encoder de visión de 170M).
- 570M para texto y audio (añade el encoder de audio de 300M).
- 740M para el modelo multimodal completo.
Todos comparten el mismo espacio vectorial, así que una nota de texto embebida con la versión de 270M puede matchear un documento embebido con la versión completa. Para una startup esto significa que puedes empezar con una app de búsqueda en notas (solo texto, ~191 MB de RAM), y el día que necesites buscar entre screenshots o audios, subes el modelo sin migrar la base vectorial.
Además, el modelo entrena con Matryoshka Representation Learning (MRL): los vectores de 768 dimensiones se pueden truncar a 512, 128 sin perder casi calidad en texto, lo que reduce el almacenamiento de la base vectorial hasta 6 veces. Para founders con límites de memoria o de coste en su vector store, mover de 768 a 256 dimensiones implica que un millón de vectores pase de ~1,5 GB a ~250 MB en bfloat16.
Benchmarks: dónde queda frente a la competencia
Según los reportes de MarkTechPost y Unite.ai, EmbeddingGemma 2 lidera entre embedders multimodales sub-1B en benchmarks como MTEB Code y MAEB. Los resultados completos a precisión completa en 768 dimensiones son: 64,64 en MIEB lite (imagen), 59,01 en MMEB v2 overall, 69,54 en MSEB retrieval (sonido) y 49,39 en MAEB (audio).
En el lado de la competencia abierta con más parámetros:
- Qwen3-VL-Embedding-2B (Alibaba): 73,2 en su corrida de MMEB-V2, con 2,7 veces más parámetros y sin audio.
- LCO-Embedding-Omni-3B: 3B parámetros, multimodal completo, pero sin cifras de RAM on-device publicadas.
- Gemini Embedding 2: solo por API de pago, hasta 3.072 dimensiones, sin versión local.
La ventaja competitiva de Google no es liderar todas las tablas — los modelos más grandes ganan en algunas — sino ser el único sub-1B open source con audio, video, imagen y código bajo licencia Apache 2.0 que cabe en un teléfono.
El contexto: Gemma ya es una familia masiva
EmbeddingGemma 2 llega en un momento en que la familia Gemma de Google ya pasó, según Google, 1.000 millones de descargas y más de 100.000 variantes publicadas por la comunidad. El ecosistema alrededor se llama internamente "Gemmaverse" e incluye despliegues en órbita (con NASA, Satlyt y Starcloud), en la app de salud india Aarogya Setu 2.0 y en traductores offline. En el lado de la competencia, Alibaba afirma que Qwen superó los 3.000 millones de descargas, y Hugging Face cuenta 151.448 derivados de Qwen en su hub.
Para un founder hispanohablante esto importa porque la disponibilidad multiplataforma ya está resuelta: EmbeddingGemma 2 funciona con sentence-transformers, transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio, y tiene build optimizado para LiteRT (Android) y navegador vía transformers.js/WebGPU. El soporte ML Kit con aceleración NPU en Android llega "en las próximas semanas", según Google.
Qué significa esto para tu startup
Si tu producto toca búsqueda semántica, RAG o recomendación de contenido multimedia, esta release cambia tres cosas concretas:
Coste por consulta tiende a cero en uso privado. Una app de notas, un CRM móvil, una plataforma de journaling o un asistente legal pueden hacer embedding on-device sin enviar el contenido del usuario a un servidor. Para mercados con regulación estricta (salud, finanzas, legal en Europa y LATAM), esto abre puertas que antes requerían arquitecturas complejas con anonimización previa.
El retrieval multimodal ya es viable en producto, no solo en demo. Antes necesitabas CLIP para imagen, Whisper para audio y un modelo text por separado, y el resultado era que un usuario no podía buscar "esa foto del cliente donde se ve el logo". Ahora una sola query de texto puede devolver imágenes, audios y clips relevantes desde la misma base vectorial. Casos inmediatos: búsqueda en archivos de centros de soporte, navegación de bibliotecas de fotos y video en productOS verticales, agentes que recuperan contexto multimodal en tiempo real.
Tu vector store puede ser 6 veces más barato con MRL. Si ya tenés un producto en producción, probar truncar a 256 dimensiones es un cambio de una línea en el cliente de embeddings. La guía oficial reporta que a 256 dimensiones retienes ~95% de calidad en imagen, video y speech retrieval. Vale la pena medirlo en tu propio dataset antes de migrar.
Acciones concretas que podés implementar esta semana:
- Descargá los pesos en Hugging Face o Kaggle y corré un benchmark rápido con
ollama pull embeddinggemma-2o consentence-transformersen tu propio dataset, comparando el rendimiento contra el modelo de embeddings que usás hoy. - Si tu producto tiene búsqueda multimodal, mapeá qué encoders estás cargando hoy (texto, visión, audio) y armá un proof-of-concept cargando solo los módulos necesarios. La promesa de 191 MB de RAM en texto puro hace viable correr el modelo en celulares Android de gama media.
Fuentes
- EmbeddingGemma 2: an open, lightweight multimodal embedding model (Google DeepMind)
- Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4 (MarkTechPost)
- DeepMind Debuts EmbeddingGemma 2, Mapping Five Modalities Into One Space (Unite.ai)
- Google releases EmbeddingGemma 2, a 740 million parameter open-weight model under Apache 2.0 (Crypto Briefing)
- Google's EmbeddingGemma aims to raise the bar for on-device AI (Crypto Briefing)
- EmbeddingGemma 2 Elevates On-Device Multimodal Search (Blockchain News)
- Google says Gemma has passed a billion downloads (The Next Web)
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días














