z.ai via Hacker News

Z.ai fait tourner GLM-5.3-Flash sur 100 000 puces IA chinoises via un agent d'infra GLM

China AI Inference Chips ai-business

Résumé

Z.ai publie « Toward Recursive Self-Improvement » : un rapport détaillant comment GLM-5.3-Flash tourne en production sur plus de 100 000 accélérateurs IA chinois, un cluster inédit à cette échelle. Un Infra Agent alimenté par GLM-5.3 aurait porté le modèle de l'adaptation à la production en moins de deux semaines, triplant le débit end-to-end et atteignant un coût par token comparable aux GPU Nvidia. La société tempère : « nous n'avons pas encore atteint le RSI ».