Upstage publie Solar Open 2, MoE 250B ouvert à 1M de contexte
TL;DR
- Solar Open2's Selective Weight Transfer carried only 2.3% of Solar Open 1 parameters into the expanded MoE, cutting training time to target performance by 58%.
- The hybrid attention stack (one softmax per three linear layers, no positional encoding) delivers the 1M-token context window while keeping active parameters at 15B.
- Upstage will deploy Solar Open2 on Daum (10M+ weekly users) and its Tamnlee agent platform before expanding to finance, law, and healthcare verticals.
Upstage a poussé en ligne un nouveau modèle open-weight qui mérite qu'on regarde l'architecture avant la taille. Publié sur Hugging Face, Solar Open 2 est un modèle Mixture-of-Experts de 250B paramètres dont 15B s'activent par token, positionné explicitement pour l'agentique bureautique, le travail documentaire et le code.
Le détail qui distingue cette annonce, c'est l'architecture d'attention hybride. Upstage alterne des couches softmax et linéaires selon un motif régulier, sans encodage positionnel rotatif (NoPE), et déclare tenir une fenêtre de contexte de 1M tokens. Le modèle compte 321 experts, dont 320 routés et 1 partagé, avec 8 experts routés plus le partagé activés par token. Côté matériel, l'inférence demande au minimum 4 GPU NVIDIA H200, 8 étant recommandés pour la production. La fiche revendique aussi un pré-entraînement d'environ 12 trillions de tokens sur GPU NVIDIA B200.
Sur les benchmarks affichés dans la fiche, Solar Open 2 revendique 92.4 sur LiveCodeBench v6, un cheveu devant les 92.3 attribués à DeepSeek-V4-Flash, avec 86.2 sur MMLU-Pro et 70.4 sur SWE-Bench Verified. À prendre comme des chiffres constructeur: DeepSeek-V4-Flash conserve d'ailleurs l'avantage sur SWE-Bench Verified (73.8) et GPQA-Diamond (88.9) selon la même fiche.
La prudence honnête porte sur deux points que le document ne traite pas vraiment. D'abord, ces scores viennent d'Upstage sans reproduction indépendante à ce stade. Ensuite, la licence Upstage Solar impose un préfixe 'Solar' aux dérivés et un badge 'Built with Solar' en communication publique, ce qui n'est pas de l'open source au sens strict et mérite lecture avant tout déploiement commercial.
Pour qui compte-t-il? Une équipe qui veut internaliser un moteur d'agent de code capable, avec un budget matériel d'un nœud H200, dispose d'une option supplémentaire face aux poids ouverts qui dominaient ce segment, notamment côté coréen et japonais où la couverture linguistique native change concrètement la donne.
Ce qu'en disent les autres médias
-
Upstage (Official Blog) Lire →
First-party post introducing Selective Weight Transfer (2.3% param transfer, 58% faster training) and framing open weights as enabling data sovereignty for enterprise deployment.
We built Solar Open 2 to be more than a model with high benchmark scores: a model with the performance and cost structure to power agents in real work environments.
-
The Korea Times Lire →
CEO on-record quote on agent usability over benchmarks; domestic deployment roadmap across finance, law, healthcare; government sovereign AI chip context added.
This model was built around the usability of an agent that completes work on its own, not just benchmark scores, CEO Kim Sung-hoon stated.
-
arXiv (Solar Open 2 Technical Report) Lire →
Full technical paper documenting 1.7x token efficiency via selective weight transfer and the hybrid attention architecture (3 linear + 1 softmax per group) enabling 1M-token context.
Solar Open 2 reaches a 1M-token window through a hybrid attention stack that interleaves one softmax layer among every three linear-attention layers, using no positional encoding.
-
Open Source For You Lire →
Links model launch to Daum portal (10M+ weekly users) and Tamnlee agent platform; emphasizes two-H200 hardware accessibility for enterprise deployment.
Solar Open 2 is designed to operate with only two NVIDIA H200 GPUs, CEO Kim Sung-hun stated.
Shared on Bluesky by 1 AI expert
Article original publié par huggingface.co
Lire l'article original →Titre original : Upstage libère Solar Open2, un MoE 250B-A15B ouvert avec 1 M de contexte pour l'agentique