Random Attention repense l'éviction du cache KV pour un raisonnement LLM plus efficace
Résumé
Le papier Random Attention grimpe à 49 upvotes sur Hugging Face avec une nouvelle politique d'éviction du cache KV pour l'inférence longue. Les auteurs revendiquent des gains de mémoire et de latence pour les modèles de raisonnement, un point sensible pour tout déploiement production de LLM.
Article original publié par huggingface.co
Lire l'article original →Titre original : Random Attention repense l'éviction du cache KV pour un raisonnement LLM plus efficace