Google ha presentado EmbeddingGemma 2, una innovadora solución de inteligencia artificial que integra de forma simultánea búsquedas por texto, código, imágenes, vídeo y audio en un único modelo abierto con 740 millones de parámetros. Este desarrollo, probado con éxito en un Pixel 11 Pro, utiliza aproximadamente 567 MB de memoria RAM activa mediante técnicas de cuantización, demostrando un equilibrio inédito entre potencia y eficiencia para la computación en el dispositivo.
Basado en la arquitectura Gemma 4, EmbeddingGemma 2 mapea estos cinco tipos de datos diferentes en el mismo espacio vectorial de 768 dimensiones. Esto significa que ya no es necesario que las imágenes contengan títulos o que el audio sea transcrito para poder lanzar búsquedas combinadas con texto, lo que facilita una experiencia multimodal rápida y coherente.
Los pesos del modelo han sido liberados bajo licencia Apache 2.0 y ya se puede implementar a nivel local a través de LiteRT y MediaPipe Tasks. Próximamente, Google lanzará una integración con ML Kit para Android que incluirá aceleración por NPU en dispositivos compatibles, facilitando una mayor rapidez y eficiencia en la ejecución de tareas.
Encoders modulares y espacio vectorial uniforme
El modelo completo cuenta con 740 millones de parámetros, pero los desarrolladores pueden elegir cargar solo los encoders necesarios según el tipo de datos que procesen. La versión básica para texto y código utiliza 270 millones de parámetros, ocupando unos 191 MB de RAM en el Pixel 11 Pro. Incorporar el encoder de visión para imágenes y vídeo aumenta el modelo hasta los 440 millones de parámetros, y añadir el encoder de audio eleva el total a 570 millones; al cargar ambos, se llega a los 740 millones.
Independientemente de la configuración, todas las representaciones se proyectan en el mismo espacio vectorial. Esto permite a los equipos empezar con un índice únicamente textual y, posteriormente, añadir funcionalidades de búsqueda por imágenes o audio sin la necesidad de volver a embebir los datos ya almacenados, lo que es una significativa optimización en tiempo y recursos.
Además, Google ha ampliado el tamaño de la ventana de contexto de 2.048 a 8.192 tokens. Esto equivale a procesar hasta 5,5 minutos de audio, o bien 29 imágenes, o 58 fotogramas de vídeo —pues la muestra de vídeo se realiza a un fotograma por segundo, cubriendo poco menos de un minuto de metraje. Esta ampliación mejora sustancialmente la capacidad del modelo para entender y buscar en contenidos complejos y variados.
La demo Video Moments Finder de Google ejemplifica esta capacidad, indexando de forma local fotogramas de vídeo y fragmentos de audio para poder buscar momentos específicos mediante texto simple, sin necesidad de generar títulos o transcripciones. Similarmente, Instant Media Search aplica este sistema a las fotos y vídeos almacenados en un teléfono, guardando los vectores de las búsquedas en bases de datos SQLite y actualizando los resultados en tiempo real conforme el usuario introduce texto.
Reducción del tamaño de índice con Matryoshka Representation Learning
Una preocupación al ejecutar este tipo de modelos en teléfonos móviles es el espacio ocupado en almacenamiento e incluso en memoria. Por ejemplo, un millón de vectores bfloat16 de 768 dimensiones ocupa aproximadamente 1,5 GB. Para optimizar esto, Google ha implementado Matryoshka Representation Learning, que posibilita truncar las dimensiones del embedding a 512, 256 o incluso 128, sin necesidad de reentrenar el modelo.
Con un índice reducido a 256 dimensiones, el tamaño baja a alrededor de 500 MB. Google asegura que esta reducción apenas afecta la calidad de recuperación para texto y código, manteniendo más del 95 % de eficacia en imágenes, vídeo y audio. En la configuración más compacta de 128 dimensiones, la precisión desciende alrededor del 90 % para texto y código, y aproximadamente un 75 % para búsqueda multimodal, por lo que recomiendan validar esta opción con datos reales antes de aplicarla.
Esta estrategia de sacrificar un poco de calidad para ganar eficiencia es tendencia en lanzamientos recientes de modelos de embeddings, donde mejoras considerables en velocidad y tamaño se obtienen sin impactos notables en el rendimiento.
Búsqueda de código y clasificación en el dispositivo
El modelo para código funciona sobre la base de 270 millones de parámetros que comparten con el texto. Google ha obtenido un notable resultado MTEB Code de 78,68 para EmbeddingGemma 2, frente a los 68,76 de la versión original, reflejando un avance significativo en la comprensión y recuperación de fragmentos de código.
Para demostrar la aplicabilidad en flujos de trabajo de agentes inteligentes, Google indexó el repositorio Transformers de Hugging Face usando solo texto y combinó este índice con un modelo más grande, Gemma 4 26B A4B, corriendo en Pi. En este escenario, EmbeddingGemma 2 se encarga de la recuperación eficiente de información, mientras que el modelo mayor impulsa las funcionalidades avanzadas del agente.
Además, EmbeddingGemma 2 es capaz de realizar tareas de clasificación mediante MediaPipe Decision, que evalúa vectores de entrada contra descripciones candidatas, sin necesidad de generar respuestas textuales. En una demostración de ajedrez, el sistema evaluó 500 opciones por turno en menos de 100 milisegundos, ofreciendo una vía más económica para que los agentes tomen decisiones sin consumir tokens generando respuestas innecesarias.
Pipelines RAG más ligeros para dispositivos móviles
EmbeddingGemma 2 comparte componentes con Gemma 4, como el tokenizador de texto y el encoder de audio, lo que reduce la necesidad de memoria cuando ambos modelos se ejecutan simultáneamente en un mismo dispositivo. Hasta ahora, Google ha exhibido esta búsqueda multimodal operando en su teléfono punta de lanza, pero resta comprobar su rendimiento con índices mayores, en otras plataformas y aplicaciones que no sean demos controladas.
En definitiva, EmbeddingGemma 2 representa un paso adelante en la integración de IA multimodal en dispositivos móviles, facilitando búsquedas más inteligentes, rápidas y versátiles en un abanico amplio de contenidos, manteniendo un tamaño y consumo de recursos compatibles con la experiencia diaria de los usuarios.