Un model d'*embeddings* converteix textos, imatges o sons en llistes de números que permeten comparar-los pel significat. Serveix, per exemple, per cercar documents semblants o perquè un assistent trobi el fragment adequat d'un arxiu. Google n'havia publicat una primera versió, EmbeddingGemma, només per a text.
La segona versió, presentada el 6 d'octubre, és multimodal: situa text, imatges, àudio, vídeo i codi en un mateix espai. Té 740 milions de paràmetres, es basa en Gemma 4 i admet 8.000 *tokens* de context, quatre vegades més que la primera. Per a un ús només de text en bastarien 270 milions, i els mòduls de visió (170 milions) i d'àudio (300 milions) són opcionals. Els pesos es poden baixar de Hugging Face i Kaggle amb llicència Apache 2.0, i funciona amb eines com llama.cpp, Ollama o sentence-transformers.
Segons Google, la puntuació en codi de la prova MTEB passa de 68,76 a 78,68 punts, i el model encapçala els de menys de mil milions de paràmetres en codi i en àudio. També es pot escurçar de 768 a 128 dimensions per estalviar fins a sis vegades d'espai. Quantitzat en un Pixel 11 Pro, diu que ocupa uns 191 MB de memòria només amb text i uns 567 MB en versió completa.
Totes les xifres de rendiment són de Google, mesurades per ella mateixa; no hi ha cap avaluació independent. El model admet com a màxim uns 5 minuts i mig d'àudio, 29 imatges o 58 fotogrames de vídeo per consulta, i la disponibilitat a la plataforma d'empresa de Google queda anunciada com a «properament».
