Google publie EmbeddingGemma 2, modèle multimodal de 740 M sous Apache 2.0, 191 Mo RAM en texte seul
Résumé
Google publie EmbeddingGemma 2, modèle d'embeddings multimodal (texte, image, audio, vidéo dans le même espace) construit sur l'architecture Gemma 4, 740 M de paramètres au total mais modulaire : 270 M pour le texte seul, +170 M pour la vision, +300 M pour l'audio. Fenêtre de 8 K tokens (jusqu'à 5,5 min d'audio ou 29 images), ~191 Mo de RAM en texte seul et ~567 Mo en multimodal complet avec quantization sur Pixel 11 Pro. Sous Apache 2.0 sur Hugging Face et Kaggle, avec supports MediaPipe, LiteRT, vLLM, Ollama.
Shared on Bluesky by 3 AI experts
-
Lynn Cherny @arnicas.bsky.social: EmbeddingGemma 2, a tiny multimodal mobile ready embedding model →
Article original publié par blog.google
Lire l'article original →Titre original : Google publie EmbeddingGemma 2, modèle multimodal de 740 M sous Apache 2.0, 191 Mo RAM en texte seul