huggingface.co détecté sur le web

Mind Lab publie Macaron-V1-Venti, agent 748 Md en Mixture-of-LoRA

TL;DR

  • Macaron-V1-Venti empile quatre adaptateurs LoRA de 1 Md (Chat, Agent, Coding, GenUI) sur une base GLM-5.2 figée de 744 Md, sous licence MIT.
  • Le spécialiste L0 route chaque nouvelle requête vers l'adaptateur adapté, avec un contexte de 1 M tokens et un support day-0 dans SGLang.
  • Mind Lab revendique 87,6 sur TerminalBench 2.1, 85,6 sur SWE Verified et 87,8 sur UI4ABench pour Venti face aux baselines listées.

Un modèle de 748 milliards de paramètres qui n'ajoute que quatre adaptateurs LoRA d'un milliard chacun à une base figée: c'est le pari que Mind Lab expose sur Hugging Face avec Macaron-V1-Venti. La base est GLM-5.2, non touchée, et par-dessus viennent quatre spécialistes routés à la volée: L0 Chat sert d'entrée et d'aiguilleur, L1 gère les tâches d'agent personnel et l'outillage, L2 prend le code et les workflows de dépôt, L3 s'occupe du rendu d'interface générative baptisé UI4A. À l'inférence, L0 lit la requête et décide vers quel spécialiste elle part.

L'intérêt de la construction est double. Elle évite d'entraîner quatre gros modèles distincts, et elle permet de garder la base intacte, ce qui simplifie la mise à jour d'un seul spécialiste sans retoucher les 744 Md de poids sous-jacents. Le harness d'inférence, publié sous MIT et disponible sur GitHub, tourne dans SGLang avec un support day-0 annoncé côté SGLang, un serving multi-LoRA natif et un IndexCache dédié. Contexte affiché à 1 M tokens, précision BF16.

Sur les chiffres, Mind Lab revendique 87,6 sur TerminalBench 2.1, 85,6 sur SWE Verified, 87,8 sur UI4ABench, 94,0 sur PinchBench, 64,0 sur LivingBench et 58,3 sur ChatBench. Le model card précise que Venti mène cinq de ces six suites face aux baselines listées. Ces scores sont à prendre pour ce qu'ils sont, ceux publiés par le fournisseur au jour du lancement, pas rejoués par des tiers indépendants.

Pour qui n'a pas le budget de servir 748 Md, Mind Lab annonce également une variante Tall à 50 Md sur la même architecture Mixture-of-LoRA, pensée pour un déploiement plus local. Ce que le model card ne détaille pas, c'est le coût réel en VRAM pour tenir les quatre LoRA en parallèle, la latence du routeur L0 sur des requêtes multi-domaines, ni les conditions commerciales de GLM-5.2 comme socle figé.

L'angle qui mérite le plus d'attention n'est pas la course au paramètre, c'est la modularité. Un agent multi-capacités où chaque compétence est un adaptateur d'un milliard, mis à jour indépendamment, changerait le rythme des releases pour les équipes qui n'ont pas envie de refaire un post-training complet chaque trimestre. Reste à voir si le routage tient sur des workloads réels.