Cua expose Metal aux VMs macOS et obtient 11 à 16× d'accélération d'inférence LLM sur llama.cpp
Résumé
Cua décrit une couche de compatibilité Metal permettant aux machines virtuelles macOS d'accéder à des chemins GPU plus rapides pour l'inférence LLM. Les tests sur llama.cpp affichent 11 à 16× de gain de performance sur Apple Silicon, ouvrant la voie à un usage sérieux des VMs pour les workloads d'agent en local.
Article original publié par github.com
Lire l'article original →Titre original : Cua expose Metal aux VMs macOS et obtient 11 à 16× d'accélération d'inférence LLM sur llama.cpp