Étude indépendante : la 'lossless' speculative decoding d'Orthrus diverge dans 55 % des cas en BF16
Résumé
Une équipe indépendante reproduit Orthrus, l'architecture hybride auto-régressif/diffusion promue comme 'lossless', et montre que sous inférence BF16 seuls 43-45 % des 1 190 prompts convergent exactement vers la trajectoire du modèle Qwen3-1.7B. En FP32, l'égalité redevient parfaite. Les auteurs plaident pour que toute revendication de speculative decoding 'sans perte' précise la précision numérique de référence et distingue équivalence de tokens et scores lm-eval.
Article original publié par huggingface.co
Lire l'article original →Titre original : Étude indépendante : la 'lossless' speculative decoding d'Orthrus diverge dans 55 % des cas en BF16