github.com via Hacker News

Cua expose Metal aux VMs macOS et obtient 11 à 16× d'accélération d'inférence LLM sur llama.cpp

Résumé

Cua décrit une couche de compatibilité Metal permettant aux machines virtuelles macOS d'accéder à des chemins GPU plus rapides pour l'inférence LLM. Les tests sur llama.cpp affichent 11 à 16× de gain de performance sur Apple Silicon, ouvrant la voie à un usage sérieux des VMs pour les workloads d'agent en local.