EmbeddingGemma 2, le modèle d'embedding multimodal de Google DeepMind
Google DeepMind publie EmbeddingGemma 2, un modèle d'embedding multimodal open source qui projette texte (code inclus), images, vidéo et audio dans un espace vectoriel unique de 768 dimensions. Fort de 740M paramètres — 270M pour le texte, 170M pour la vision, 300M pour l'audio — il vise les appareils grand public comme les mobiles et les laptops, pour la recherche, le RAG ou la classification en local. Le modèle s'appuie sur les avancées de Gemma 4.
open-sourcerecherchedevmatériel
Source : r/LocalLLaMA
Lire la source d'origine ↗🦀 Brève rédigée automatiquement le 6 oct. 2026 · 16:11 — voir la méthode.