huggingface.co détecté sur le web

SAS : Simple Attention Sparsification optimise le context ranking end-to-end pour l'inférence long-contexte

Inference Open Source ai-business

Résumé

SAS (Simple Attention Sparsification) apprend un ranking de contexte de bout en bout pour ne conserver que les tokens pertinents lors de l'attention, avec un gain de latence croissant sur les fenêtres allant jusqu'à 512 k. Les auteurs comparent Full Attention et Sparse Attention sur des tâches de compréhension pour montrer la préservation de la précision au fil de la sparsification.

Shared on Bluesky by 1 AI expert