Nvidia出資のReflection AIがオープンウェイトモデル「Beam」を発表 — 501B MoEの中身と、今の時点で分かること

Reflection AI が 2026年10月5日、初のオープンウェイトモデル「Beam」を発表しました。合計 5,010億パラメータ、トークンごとの有効パラメータ 230億のスパース Mixture-of-Experts (専門家モジュールを切り替えて使う構成) で、コーディング・推論・エージェント用途に特化しています。ただし現時点 (10月6日) で重みはまだ公開されていません。Apache 2.0 ライセンスでの重み公開は「今月中」とされ、今は一部ユーザー向けの早期アクセスのみです。性能は同社の自己申告で、第三者による検証結果もまだ出ていません。評価を急がず、重みと技術レポートが出る数週間を待つのが現実的です。
Beam の中身: 売りは「スコア」ではなく「トークンあたりの効率」
Beam はテキスト専用モデルです。事前学習は 23.8兆トークン、中間学習で実効コンテキスト長を100万トークンまで拡張しています。アーキテクチャはローカル注意とグローバル注意の交互配置、細粒度のルーテッド専門家、残差ストリームの制御などを組み合わせ、MoE の学習を数値的に安定させることを重視したと説明されています。
特徴的なのは、強化学習 (RL) を中心的なスケーリング軸に据えた点です。NVIDIA GB300 を 10,500基使い、4週間で1億回以上のロールアウト (タスク試行) を生成。約100万件のコーディング・エージェント・STEM 環境を用意したとしています。事前学習は GB300 NVL72 を 6,144基使って4週間未満で完了し、終盤の goodput (最終モデルに残った学習時間の割合) は 92.3% に達したと公開されています。この水準の学習インフラ情報をオープンモデル側が自ら開示した例は多くありません。
同社は Beam を「ワークホース (日常の作業馬)」と位置づけています。最高スコアを狙うモデルではなく、同等の出力に対して消費トークンと計算量を抑えるモデルという整理です。
ベンチマークの実際: 強い行と、負けている行が混在する
公開された比較表は、良い数字だけを並べたものではありません。Beam は SWE-Bench Verified で 80.9、Terminal Bench v2.1 で 80.1 を報告しています。Terminal Bench v2.1 では GLM 5.2 が 81.0 でほぼ同水準ですが、GLM 5.3 は 88.2、Kimi K3 は 88.3、DeepSeek V4.1 Flash は 90.6 と、より新しい中国系オープンモデルが上にいます。DeepSWE v1.1 では Beam 44.4 に対し DeepSeek V4.1 Flash が 74.2 です。
Reflection 自身も「Kimi K3 などは素の能力で先行している」と認めています。一方、西側のオープンモデルとの比較では、Thinking Machines Lab の Inkling に対し、双方がスコアを出している4つのコーディング系テストで Beam が上回っています。ただし Inkling はマルチモーダル、Beam はテキスト専用で、対象範囲が異なります。
読み方としては、「現時点のオープンモデル最強」ではなく「西側勢のコーディング系では上位、中国系の最新版には届いていない」が妥当です。
「推論計算量が3〜4分の1」の前提を確認する
最も広く引用されているのが、高難度の推論ベンチマークで GLM-5.2 と同等スコアを3〜4分の1の推論計算量で出す、という主張です。この数字の出し方は公式ブログに明記されています。生成時の計算量を「2 × 有効パラメータ数 × 1試行あたりの平均生成トークン数」で概算し、プロンプトのプリフィル、コンテキスト依存の注意計算、サービング時のオーバーヘッドを除外した推定値です。つまり実測コストではなく、近似比較です。
有効パラメータが効いています。GLM-5.2 は合計約7,440億・有効400億とされ、Beam の有効230億はその6割以下です。有効パラメータが小さく、かつ生成トークン数が少なければ、この式では差が大きく開きます。実際の API 料金や自社 GPU での実効スループットは、サービング構成や同時実行数で変わります。自社のワークロードで検証するまでは、効率の主張は「有望だが未検証」として扱うのが安全です。
なお Beam には reasoning effort (推論の努力量) パラメータがあり、応答の短さと精度を使う側で調整できます。コスト最適化の余地が設計に組み込まれているのは、実運用を想定する上で評価できる点です。
いつ使えるか、セルフホストは現実的か
公式ブログによれば、今月中に Apache 2.0 で重みを公開し、技術レポート、モデルカード、実行・評価・ファインチューニングのためのスタックとドキュメントを合わせて出す計画です。配布パートナーやオープンソースのライブラリ・ハーネスとの統合も同時に進めるとしています。Apache 2.0 は商用利用・改変・再配布を許す寛容なライセンスで、利用条件に独自制約を付ける一部のオープンウェイトモデルとは扱いが異なります。
一方、セルフホストのハードルは小さくありません。有効パラメータが230億でも、推論時には5,010億パラメータ分をメモリに保持する必要があります。単純計算で 8bit 量子化なら約500GB、4bit でも約250GB 規模です。個人のワークステーションで動かす前提の設計ではなく、まずはパートナー経由の API や GPU クラスタでの運用が現実的な選択肢になります。量子化ビルドが出るかどうかが、小規模事業者にとっての分岐点です。
検証状況についても押さえておく価値があります。独立評価機関の Artificial Analysis は Reflection からアクセスを得てテスト中で、10月5日の投稿でトークン効率の高さを示す初期の兆候に言及していますが、完全な独立評価はまだ公開されていません。
Nvidia の出資が意味すること
Reflection AI は 2024年3月に元 Google DeepMind の研究者 Misha Laskin 氏と Ioannis Antonoglou 氏が創業した米国のスタートアップです。2025年10月に Nvidia 主導で20億ドルを調達し、当時の企業評価額は80億ドルでした。その後の評価額は報道ベースで大きく上昇しており、報じられた数字は出典によって幅があります。
Nvidia にとって、オープンウェイトモデルの普及は GPU 需要の裾野を広げる動きです。クローズドな大手ラボに依存しない選択肢が増えれば、企業や政府が自前で推論基盤を持つ理由が増えます。Beam が「企業・公共部門・開発者向け」と明示されているのは、この流れに沿った位置づけです。中国系オープンモデルがオープンウェイトのダウンロード需要を押さえてきた状況に対し、西側に同等の選択肢を用意するという政策的な文脈も重なっています。
開発・導入を検討する側が次に取るべき行動
いま決め打ちする必要はありません。順序立てて確認するのが得策です。
重み公開と同時に出る技術レポートとモデルカードを読み、学習データの開示範囲と安全性評価の結果を確認する。Reflection は社内で使った安全性評価をオープンソース化すると表明しています
Artificial Analysis などの独立評価が出るまで、3〜4倍という効率の主張を調達資料の前提に置かない
自社の代表的なタスク (既存コードベースの修正、ターミナル操作、ツール呼び出し) で小さな評価セットを先に用意する。汎用ベンチマークより自社タスクでの比較が判断材料になります
テキスト専用であることを確認する。画像や PDF をそのまま扱う必要がある用途では、別途 OCR やマルチモーダルモデルとの組み合わせが前提になります
自己ホストを検討するなら、量子化ビルドの提供と必要 VRAM を待ってから試算する。API 利用との総コスト比較は、価格が公表されてからで十分です
Beam の意義は、単発のスコアよりも「Apache 2.0 で、コーディングとエージェント用途に振った西側の大規模オープンモデルが選択肢に加わる」という点にあります。重み公開後に自社タスクで測り、既存の選択肢と並べて比較する。その準備を今のうちに整えておくのが、最も無駄の少ない進め方です。


