blog.google détecté sur le web

Google publie EmbeddingGemma 2, modèle multimodal de 740 M sous Apache 2.0, 191 Mo RAM en texte seul

Résumé

Google publie EmbeddingGemma 2, modèle d'embeddings multimodal (texte, image, audio, vidéo dans le même espace) construit sur l'architecture Gemma 4, 740 M de paramètres au total mais modulaire : 270 M pour le texte seul, +170 M pour la vision, +300 M pour l'audio. Fenêtre de 8 K tokens (jusqu'à 5,5 min d'audio ou 29 images), ~191 Mo de RAM en texte seul et ~567 Mo en multimodal complet avec quantization sur Pixel 11 Pro. Sous Apache 2.0 sur Hugging Face et Kaggle, avec supports MediaPipe, LiteRT, vLLM, Ollama.

Shared on Bluesky by 3 AI experts