AMD et Cerebras revendiquent 5× de tokens par watt en inférence
TL;DR
- AMD et Cerebras annoncent le 23 juillet 2026 une solution d'inférence désagrégée couplant les racks Helios (GPU Instinct) au Wafer-Scale Engine.
- Le duo revendique jusqu'à 5× de tokens par seconde et par watt par rapport à une configuration WSE seule, mesurés sur le modèle Kimi 2.6 1T.
- La solution est attendue via Cerebras Cloud au second semestre 2026, avec Helios chargé du prompt processing et le WSE de la génération de tokens.
Ce qu'AMD et Cerebras ont annoncé le 23 juillet n'est pas une nouvelle puce, c'est un nouveau découpage. Dans un communiqué publié sur ir.amd.com, les deux sociétés décrivent un pipeline d'inférence désagrégé où les racks AMD Helios, équipés de GPU Instinct, assurent le prompt processing à haut débit, pendant que le Wafer-Scale Engine de Cerebras prend en charge la génération de tokens en très basse latence.
Le chiffre mis en avant est un rapport de jusqu'à 5× de tokens par seconde et par watt par rapport à une configuration Cerebras WSE seule, mesuré en juillet 2026 par les AMD Performance Labs et Cerebras sur le modèle Kimi 2.6 1T. Lisa Su, présidente et CEO d'AMD, présente l'inférence comme l'une des plus grandes opportunités d'infrastructure de l'IA et insiste sur la diversité croissante des charges. Andrew Feldman, CEO et cofondateur de Cerebras, parle d'une demande d'inférence ultra-rapide qui croît à un rythme sans précédent.
L'intérêt stratégique tient moins au silicium qu'à l'aveu implicite : le prompt et le decode ne se dimensionnent pas de la même façon, et les faire tourner sur une architecture unique optimise mal l'un ou l'autre. Les découpler ouvre la porte à un mélange de fournisseurs plutôt qu'à un stack unique, et donne à AMD un cas d'usage concret pour Helios en dehors de la comparaison frontale avec Nvidia sur l'entraînement.
L'honnête caveat est que ce 5× repose sur un seul modèle, mesuré par les deux vendeurs eux-mêmes, et rapporté à une configuration WSE seule plutôt qu'à un système Nvidia comparable. Le communiqué ne donne ni prix, ni coût par million de tokens, ni latence absolue, ni liste de clients de lancement, au-delà d'une disponibilité annoncée via Cerebras Cloud au second semestre 2026. À prendre comme un signal d'intention plutôt que comme un benchmark établi. Ce qui vaut d'être suivi, c'est de voir si d'autres acheteurs cloud reprennent cette logique de découpage prompt / decode entre fournisseurs distincts.
Article original publié par ir.amd.com
Lire l'article original →Titre original : AMD et Cerebras couplent Helios et Wafer-Scale Engine pour une inférence désagrégée jusqu'à 5× plus efficace