github.com via Hacker News

Strata exécute Qwen 3.8 Flash Next 125B à 100 tokens/s sur une simple RTX 4090 grand public

Résumé

Un développeur anonyme a publié Strata, un moteur d'inférence open-source qui fait tourner Qwen 3.8 Flash Next (125 Md paramètres, 6 Md actifs) sur une RTX 4090 avec 32 Go de RAM, en mettant en cache sélectivement 10 des 24 576 experts MoE par token. Les premiers testeurs annoncent 124 tokens/seconde en décodage et 2 650 t/s en préfill, avec une variante Coder qui conserve 91 % du score SWE-bench Verified en supprimant la moitié des experts. Si la performance se confirme, elle fait tomber la barrière à l'inférence frontière sous le millier de dollars de hardware.