huggingface.co détecté sur le web

Random Attention repense l'éviction du cache KV pour un raisonnement LLM plus efficace

Research Inference ai-business

Résumé

Le papier Random Attention grimpe à 49 upvotes sur Hugging Face avec une nouvelle politique d'éviction du cache KV pour l'inférence longue. Les auteurs revendiquent des gains de mémoire et de latence pour les modèles de raisonnement, un point sensible pour tout déploiement production de LLM.