Google DeepMind ha lanzado EmbeddingGemma 2, un modelo abierto que incorpora texto, código, imágenes, vídeo y audio en un espacio de 768 dimensiones. Cuenta con 740 millones de parámetros, una ventana de contexto de token de 8K y una licencia Apache 2.0. Su objetivo es la búsqueda en el dispositivo, la clasificación y los RAG que dan prioridad a la privacidad. Este artículo analiza, compara y muestra cómo encaja EmbeddingGemma 2

en este sector.

¿Se puede implementar hoy? ¿Sí?.

Los pesos están disponibles en Hugging Face y Kaggle, y las versiones de Ollama, llama.cpp GGUF y Litert ya están disponibles.

Qué hace un modelo de incrustación

Un modelo de incrustación convierte el contenido en un vector de números que captura el significado. Los objetos similares aparecen muy cerca unos de otros, por lo que es fácil buscarlos y compararlos. En una canalización de RAG, estos vectores permiten a un LLM recuperar información nueva con la que no ha sido entrenado. La generación local de incrustaciones mantiene los datos en el dispositivo, reduce la latencia

y funciona sin conexión.

Un espacio vectorial para cada modalidad

EmbeddingGemma 2 se basa en la arquitectura Gemma 4. Una consulta de texto puede recuperar una foto. Una nota de voz puede recuperar un clip de vídeo. Las entradas intercaladas, como una lista de productos con texto, imágenes y un vídeo de demostración, producen una única

incrustación.

El diseño es modular. Consta de tres partes:

  • Estructura troncal de texto y código: 270 millones de parámetros (130 M de transformador más 140 M de embebedor)
  • Codificador de visión: 170 millones de parámetros, opcional
  • Codificador de audio: parámetros de 300 M, opcional
  • Los desarrolladores solo cargan lo que necesitan: 270 M para texto, 440 M para texto y visión, 570 M para texto y audio, o 740 M para todo. Todas las configuraciones comparten un espacio vectorial. Una consulta incrustada con la configuración de solo texto puede coincidir con los documentos incrustados en el modelo completo

    .

    La ventana de contexto es de 8.192 fichas, cuatro veces más grande que la de la versión 1. En ella caben unas 29 imágenes, 58 fotogramas de vídeo o 5,5 minutos de audio.

    Puntos de referencia

    El equipo de investigación de Google informa de las puntuaciones más altas entre los integradores multimodales sub-1B en MTEB Code y MAEB. Resultados de

    máxima precisión en 768 dimensiones:
    MIEB lite (imagen) 64.64 MMEB v2 49.39 n/a
    Benchmark EmbeddingGemma 2 EmbeddingGemma 1
    MTEB multilingual v2 61.36 61.15 MTEB Code v1 78.68 68.76 n/a
    global
    59.01 n/a Recuperación MSEB (sonido) 69.54 n/a MAEB (audio)

    Fuente: tarjeta modelo EmbeddingGemma 2

    La

    recuperación de código gana 9,92 puntos, aproximadamente un 14%. La calidad del texto multilingüe se mantiene estable. Los modelos más grandes siguen liderando algunas tablas. La Qwen3-VL-Embedding-2b registra 73,2 en su propia versión de MMEB-V2, con unos 2,7

    veces más parámetros y sin soporte de audio.

    Diseñado para teléfonos y ordenadores portátiles

    Con la cuantificación en un Pixel 11 Pro, la RAM activa es de aproximadamente 191 MB para pesos de solo texto. El modelo multimodal completo necesita unos 567 MB. El entrenamiento basado en la cuantificación comprime las pesas en INT4 e INT8. El equipo de Google AI Edge midió 37,3 ms por imagen en una GPU del MacBook M5 Pro, con un presupuesto

    de visión de 70 fichas.

    Matryoshka Representation Learning (MRL) permite a los desarrolladores truncar vectores en 512, 256 o 128 dimensiones. Pasar de 768 a 128 dimensiones reduce el almacenamiento hasta 6 veces. Con 256 dimensiones, el MTEB multilingüe solo pasa de 61,36 a 60,41. En 128 dimensiones, el MMEB se reduce a 45,65, por lo que Google recomienda 128d principalmente para cargas de trabajo de solo

    texto.

    Explicador interactivo

    &&&

    Embedding Gemma 2 contra sus competidores más cercanos

    Google DeepMind Google DeepMind LCO-Embedding Parameters (270 M solo texto) 308M 2B 3Bbackbone ( Más de
    Función EmbeddingGemma 2 EmbeddingGemma 1 Qwen3-VL-Embedding-2b LCO-Embedding-Omni-3B Gemini Embedding 2 DesarrolladorAlibaba Qwen (investigación) Google
    5B en HF
    ) No revelado Texto/código Sí
    Sí Sí Sí Sí
    Imágenes Sí No Sí Sí Sí
    Vídeo Sí No Sí Sí Sí
    Audio Sí No No Sí Sí Sí
    Dims de salida (MRL) 768 (512, 256, 128) 768 (hasta 128) Hasta 2048 (64 a 2048) No indicado 3072 (128 a 3072)
    Contexto 8.192 fichas 2K fichas 32 000 fichas No se indica 8, 192 fichas
    Idiomas 100+ 100+ 30+ No declarado100
    Licencia/acceso Apache 2.0, pesos abiertos Pesos abiertos (términos de Gemma) Apache 2.0, pesos abiertos Apache 2.0, pesos abiertos Solo API de pago
    Publicado en el dispositivo RAM ~191 MB de texto, ~567 MB completos Menos de 200 MB No publicado No publicado Solo en la nube
    Tarjeta modelo fuente Documentos :
    tarjeta HF, tarjeta HF, documentos API

    ¿Cómo ejecutarlo

    Funciona en sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiterT y MediaPipe. Qdrant cubre el almacenamiento vectorial y Unsloth cubre el ajuste fino. El soporte del ML Kit para Android, con aceleración de NPU,

    llegará en unas semanas.
    :
    pip install -U «sentence-transformers [imagen, audio, vídeo]»
    
    desde sentence_transformers importa SentenceTransformer
    modelo = SentenceTransformer («google/embeddinggemma-2")
    q = model.encode («¿Qué causa la aurora boreal?» , PROMPT_NAME = «Consulta de búsqueda»)
    d = model.encode («Partículas cargadas del sol. «, PROMPT_NAME="Documento»)
    imprimir (modelo.similitud (q
    , d))

    En Ollama, ejecuta ollama pull embeddinggemma-2. Las etiquetas oscilan entre 270 m (378 MB) y 740 m (1,3 GB). Las demostraciones están en directo en Google AI Edge Gallery. Consulta la guía para desarrolladores para obtener más información.

    Conclusiones clave

    • Un modelo abierto de 740M incrusta texto, código, imágenes, vídeo y audio en un espacio compartido de 768d.
    • Los codificadores modulares escalan el espacio de 270 millones (texto) a 740 millones (multimodo completo)

    ¿Tiene un proyecto de software o plataforma SaaS en mente?

    Hable directamente con nuestros arquitectos de software en SoftAndino. Le brindamos asesoría técnica y cotización inmediata sin compromiso.