Google lanza EmbeddingGemma 2: 740M parámetros, multimodal y open source bajo Apache 2.0
Google DeepMind publicó EmbeddingGemma 2, un modelo de embeddings de 740 millones de parámetros capaz de convertir texto, código, imágenes, video y audio en un único espacio vectorial de 768 dimensiones, bajo licencia Apache 2.0 y pensado para correr on-device. El lanzamiento, anunciado el 6 de octubre, llega como sucesor del EmbeddingGemma original —que según Google superó los 20 millones de descargas— y supone el primer embedder multimodal abierto de la familia corta a menores de 1B parámetros con soporte nativo de audio.
Para un founder, lo importante es que el modelo está disponible en Hugging Face y Kaggle desde el día uno, con builds optimizados para Ollama, llama.cpp, LiteRT, MLX, vLLM, SGLang, sentence-transformers y LM Studio. No es un paper: son pesos que ya puedes descargar y ejecutar hoy.
Por qué importa que sea Apache 2.0 y no propietario
Simon Willison, autor del blog de referencia donde se comenta el lanzamiento, lo resume en una línea: «Para modelos de embeddings no tiene sentido usar uno cerrado y propietario hosted-only». La razón es práctica y económica.
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 díasLos embeddings se generan por miles o millones a la vez y se guardan para compararlos después. Si tu proveedor decide retirar ese modelo, tienes que re-calcular todos los vectores almacenados y volver a pagar. En abril de 2026, cuando OpenAI deprecó modelos anteriores a GPT-4, la propia compañía ofreció cubrir el coste de re-embarquetar contenido — pero Willison recuerda que ese gesto no es algo que se pueda dar por sentado con cualquier proveedor.
Con EmbeddingGemma 2 la situación cambia: puedes pagar a un proveedor mientras el modelo esté disponible, pero si deja de ofrecerlo, levantas los pesos y lo ejecutas en tu infraestructura. Es la opción que minimiza el lock-in sin obligarte a mantener GPUs propios desde el día uno.
Qué trae de nuevo frente a EmbeddingGemma 1
El modelo está construido sobre la arquitectura Gemma 4 y es modular. Los 740M se reparten en tres bloques que se cargan bajo demanda:
- Backbone de texto y código: 270M parámetros (130M transformer + 140M embedder)
- Encoder de visión: 170M parámetros (opcional)
- Encoder de audio: 300M parámetros (opcional)
Esto permite cuatro configuraciones que comparten el mismo espacio vectorial: 270M para texto, 440M para texto+visión, 570M para texto+audio, o 740M para todo. Una query embeddeada con la versión solo-texto puede encontrar documentos embeddeados con la versión multimodal completa.
La ventana de contexto sube a 8.192 tokens, cuatro veces más que EmbeddingGemma 1 (2K). En la práctica, cabe una sola entrada con hasta 29 imágenes, 58 frames de video o 5,5 minutos de audio.
Benchmarks: lo que Google reporta
Según el model card citado por MarkTechPost, EmbeddingGemma 2 lidera entre embedders multimodales sub-1B en MTEB Code y MAEB. Los resultados a 768 dimensiones y precisión completa son:
- MTEB multilingual v2: 61,58 (vs. 61,15 de v1)
- MTEB Code v1: 78,68 (vs. 68,76 de v1 — un salto de +9,92 puntos, ~14%)
- MIEB lite (imagen): 64,64
- MSEB retrieval (sonido): 69,54
- MAEB (audio): 49,39
Google aclara que modelos más grandes aún lideran algunos rankings —Qwen3-VL-Embedding-2B reporta 73,2 en MMEB-V2 con 2,7 veces más parámetros y sin soporte de audio— pero EmbeddingGemma 2 gana donde la multimodalidad completa importa y el hardware es limitado.
Cuánta memoria necesitas en el dispositivo
Con quantization en un Pixel 11 Pro, Google midó:
- ~191 MB de RAM activa para la configuración solo-texto
- ~567 MB para el modelo multimodal completo
- 37,3 ms por imagen en una GPU de MacBook M5 Pro con presupuesto de visión de 70 tokens
El modelo trae Matryoshka Representation Learning (MRL): puedes recortar los vectores a 512, 256 o 128 dimensiones. Pasar de 768 a 128 reduce almacenamiento hasta 6x. A 256 dimensiones, MTEB multilingual solo cae de 61,58 a 60,41; a 128 dimensiones MMEB baja a 45,65, por lo que Google recomienda 128d principalmente para cargas de solo texto.
El developer guide citado por Unite.AI precisa que almacenar 1 millón de vectores de 768 dimensiones en bfloat16 ocupa unos 1,5 GB, frente a ~250 MB a 128 dimensiones.
Ecosistema y cómo empezar hoy
EmbeddingGemma 2 funciona con:
- sentence-transformers v6.1.0+
- transformers, vLLM, SGLang, MLX
- llama.cpp y Ollama (
ollama pull embeddinggemma-2, tags desde 270m a 740m) - LiteRT y MediaPipe para despliegue on-device
- Qdrant para vector storage
- Unsloth para fine-tuning
- transformers.js y WebGPU para correrlo en el navegador
Demos como Instant Media Search y Video Moments Finder están en la app Google AI Edge Gallery. El soporte de ML Kit para Android con aceleración NPU llegará en las próximas semanas, según Google.
Qué significa esto para tu startup
Si tu producto depende de RAG, búsqueda semántica o clasificación, el coste marginal de cambiar tu pipeline de embeddings a EmbeddingGemma 2 acaba de caer mucho. Antes necesitabas un proveedor cloud con API de embeddings; ahora puedes ejecutar el mismo modelo en el dispositivo del usuario final, en tu propio cluster, o alternar entre proveedores según precio — porque los pesos son tuyos.
Tres movimientos concretos que puedes hacer esta semana:
- Audita tu stack actual de embeddings. Si usas un modelo propietario hosted-only y almacenas millones de vectores, calcula el coste de re-embeddar si el proveedor depreca el modelo. Ese cálculo justifica migrar a un modelo Apache 2.0 como EmbeddingGemma 2 antes de que te obliguen.
- Prototipa on-device. Si tu caso de uso es privacidad sensible — notas de pacientes, fotos personales, documentos legales—, EmbeddingGemma 2 cabe en un Pixel 11 Pro con ~191 MB de RAM. Eso te permite vender «tus datos nunca salen del dispositivo» como feature, no como promesa de marketing.
- Experimenta con MRL para recortar costes. Si ya mantienes tu propio índice vectorial, prueba a reducir de 768 a 256 dimensiones. Google reporta que retienes ~95% de calidad en retrieval de imagen, video y audio, mientras tu factura de almacenamiento cae.
Conclusión
EmbeddingGemma 2 no es solo «otro modelo open source»: es la confirmación de que los embedders multimodales abiertos ya son buenos y pequeños para correr donde corren tus usuarios. Para la mayoría de startups hispanohablantes, la decisión ya no es «¿qué proveedor de embeddings uso?», sino «¿qué embedder open source descargo y dónde lo ejecuto?». Quienes se atrincheren en APIs propietarias hoy asumirán un riesgo de lock-in que, como recordó Willison, no se puede subestimar.
Fuentes
- Simon Willison — EmbeddingGemma 2
- Google Blog — EmbeddingGemma 2
- MarkTechPost — Google DeepMind Releases EmbeddingGemma 2
- Unite.AI — DeepMind Debuts EmbeddingGemma 2
- CryptoBriefing — Google releases EmbeddingGemma 2
Leíste lo que hace la IA. ¿Y en tu negocio?
En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.
👥 Probar 7 días













