Beam, de Reflection : 3 à 4 fois moins de calcul que GLM 5.2, selon son créateur
La start-up américaine Reflection AI présente Beam, son premier modèle à poids ouverts. Elle revendique le niveau de GLM 5.2 en raisonnement avec trois à quatre fois moins de calcul, une estimation à nuancer.
Reflection AI, start-up new-yorkaise fondée en 2024 par d'anciens chercheurs de DeepMind, a dévoilé lundi 5 octobre 2026 Beam, son premier modèle à poids ouverts. Il compte 501 milliards de paramètres, dont 23 milliards actifs par token. L'entreprise le présente comme une réponse occidentale aux modèles ouverts chinois, pour le code et les tâches d'agents. Les poids doivent être publiés sous licence Apache 2.0 « plus tard ce mois-ci ».
Une architecture pensée pour l'efficacité
Beam est un modèle de type « mixture d'experts » : seule une partie du réseau travaille pour chaque token, ce qui réduit le coût de chaque réponse. Selon Reuters, GLM-5.2, le modèle de Z.ai auquel Beam se compare, compte environ 744 milliards de paramètres au total, dont 40 milliards actifs.
Reflection affirme que Beam obtient sur les benchmarks de raisonnement avancé des scores comparables à ceux de GLM-5.2, avec 3 à 4 fois moins de calcul d'inférence. Le modèle « approcherait » aussi Qwen 3.8-Max d'Alibaba en code et en tâches d'agents. L'entreprise reconnaît que des modèles comme Kimi K3 restent devant en capacité brute : son atout serait l'efficacité à l'usage.
Son PDG, Misha Laskin, résume l'argument à Semafor : le modèle demande trois à quatre fois moins de puissance pour raisonner, donc il serait plus rapide et moins cher à exécuter, selon Semafor.
Des scores plus nuancés que l'annonce
Help Net Security relativise le tableau. Sur Terminal Bench v2.1, Beam obtient 80,1, contre 81,0 pour GLM 5.2, 88,3 pour Kimi K3 et 90,6 pour DeepSeek V4.1 Flash. Sur DeepSWE v1.1, il atteint 44,4, juste au-dessus de GLM 5.2 (44,0), mais loin derrière DeepSeek V4.1 Flash.
Le chiffre de 3 à 4 fois moins de calcul est en outre une estimation : Reflection l'obtient avec une formule (deux fois le nombre de paramètres actifs, multiplié par le nombre moyen de tokens générés). Elle ignore le traitement du prompt, le coût de l'attention et les frais de service. « Treat that compute figure as a rough guide », écrit Anamarija Pogorelec, de Help Net Security : « Considérez ce chiffre de calcul comme un ordre de grandeur approximatif » (traduction, Help Net Security). La facture réelle dépendra donc des usages et du matériel. Les scores des concurrents proviennent d'Artificial Analysis et de DataCurve.
Un entraînement à grande échelle
D'après le billet de Reflection, le pré-entraînement a porté sur 23,8 trillions de tokens, en moins de quatre semaines sur 6 144 GPU NVIDIA GB300 NVL72. L'apprentissage par renforcement a mobilisé 10 500 GPU GB300 pendant quatre semaines. Il a produit plus de 100 millions de rollouts (tentatives de résolution), à partir de près d'un million d'environnements et d'environ 1,3 milliard de sandboxes. L'entreprise dit que les performances progressaient encore à la fin, sans plateau visible.
Elle a aussi appliqué une pénalité de longueur contrôlable, qui récompense les solutions réussies et décourage les tokens superflus. Un paramètre d'effort de raisonnement permet à l'utilisateur d'arbitrer entre réponses courtes et raisonnement plus long.
Un effet de généralisation est signalé : les scores de navigation web ont progressé alors que l'entraînement ne comprenait aucune tâche de navigation. Avec un accès web, le modèle a appris à interroger d'autres modèles de langage et à utiliser des API de reconnaissance de texte. Help Net Security y voit un comportement à journaliser avant d'accorder un accès réseau.
Enjeux commerciaux et politiques
Reflection, soutenue par Nvidia, Sequoia et Citigroup, a confirmé en juin une levée de fonds sur une valorisation de 25 milliards de dollars avant investissement, selon Semafor. Elle vise les entreprises et les États qui veulent une IA souveraine sans recourir aux modèles chinois. « They don't really have very good options today » : « Ils n'ont pas vraiment de bonnes options aujourd'hui », estime Misha Laskin (traduction, Semafor).
Le contexte est celui d'inquiétudes de sécurité : des évaluateurs américains et britanniques ont jugé que des modèles chinois récents pouvaient aider des pirates à exploiter des failles. Reflection dit travailler avec des organismes américain et britannique pour évaluer Beam, encore en phase finale de red-teaming. Les résultats de sécurité figureront dans un rapport technique publié avec les poids, et l'accès anticipé passe par une liste d'attente. Reflection entraîne déjà un modèle suivant, que Laskin dit « beaucoup » plus puissant.
Sources
- Reflection AI unveils an open-source Western answer to Chinese labs — Semafor
- Introducing Beam: Reflection’s 501B open-weight model — Reflection — Reflection
- Reflection's Beam trails top open models on coding tests but claims lower inference compute - Help Net Security — Help Net Security
- Nvidia-backed AI model: Nvidia-backed Reflection unveils first AI model to take on Chinese open models - The Economic Times — Reuters