リーダーボード
全モデルを同一の条件で測っています — 同じ問題、同じ思考トークン予算、同じ1台。 精度スイートは複数リクエストを並列で流して測っており(バッチ処理は答えの 中身を変えません。EXL3のサーバだけはスロットが1つなので直列です)、 速度は単一ストリームで別に測っています。
| # | モデル | 平均 | GSM8K | MMLU | MMLU 日本語 | HumanEval | 長時間タスク | Decode | メモリ |
|---|---|---|---|---|---|---|---|---|---|
| 1 | DeepSeek-V4-Flash-0731 (EXL3) | 95.2 | 98.3 | 90.0 ! | 89.0 ! | 98.8 ! | 100.0 | 55.3 tok/s | 107.0 GiB |
| 2 | Gemma 4 31B | 94.9 | 98.3 | 91.0 | 86.0 | 99.4 | 100.0 | 10.9 tok/s | 51.0 GiB |
| 3 | DeepSeek-V4-Flash-0731 | 94.7 | 97.5 | 92.5 | 84.5 ! | 98.8 | 100.0 | 17.0 tok/s | 86.5 GiB |
| 4 | Qwen3.8-27B | 93.5 | 98.3 ! | 86.5 ! | 85.0 ! | 97.6 ! | 100.0 | 11.1 tok/s | 32.9 GiB |
| 5 | Muse Glimmer 30B | 93.1 | 95.8 | 90.0 | 81.0 | 98.8 ! | 100.0 | 13.4 tok/s | 29.5 GiB |
| 6 | Gemma 4 26B-A4B | 89.7 | 98.3 ! | 89.5 | 85.5 | 100.0 | 75.0 ! | 53.8 tok/s | 42.6 GiB |
| 7 | Ornith-1.5-35B-A3B | 87.5 | 98.3 | 87.5 ! | 82.0 ! | 94.5 ! | 75.0 | 79.3 tok/s | 40.9 GiB |
| 8 | Qwen3.6-27B | 84.1 | 94.2 ! | 91.0 ! | 87.0 ! | 98.2 | 50.0 ! | 10.9 tok/s | 49.5 GiB |
| 9 | Nemotron 3.5 Lightning 30B-A3B | 81.6 | 90.8 ! | 88.0 ! | 83.0 ! | 96.3 | 50.0 ! | 66.5 tok/s | 29.7 GiB |
数値は正答した問題の割合です。! は一部の問題がエラーになったか、思考トークンが尽きて答えに到達しなかったスイートを示します (件数はホバーで表示)。Decodeは短いプロンプトでの単一ストリーム実測値です。 列をクリックすると並べ替えできます。
検証済みモデル数が配色の識別限界(8色)を超えたため、9番目以降は グラフ上で灰色になります。識別はラベルで行ってください。
精度1ポイントの値段
全ベンチマークの平均スコアと、単一ストリームのdecode速度。円の面積は 121.7 GiB のプール上での実測ピークメモリです。右上が良く、小さいほど安上がり。
縦軸は0%ではなく75%から始まります。全モデルがこれを上回っており、 0起点にすると意味のある差が潰れるためです。
メモリ予算
GB10のメモリはCPUとGPUで1つのプールを共有します。収まるか、動かないかの二択です。 色の付いた部分が重み、濃い部分がKVキャッシュと実行時のオーバーヘッド(実測ピーク)。
- 各バー: モデル固有色が重み、続いて
- KVキャッシュと実行時オーバーヘッド(実測ピーク)
速度
prefillとdecodeは桁が違うので別々に描いています。decodeは返答を読んでいる間の速さ、 prefillは最初の一文字が出るまでの待ち時間を決めます。
DeepSeek-V4-Flashは2つのスタックで別々に測っています。同じ重みでも、量子化形式と 推論エンジンが違えば別の実測対象です — llama.cppのGGUF UD-IQ2_M(2bit)と、 EXL3 3.0bpwをsparkinfer/vLLMでDSpark投機デコードとNVFP4 KVキャッシュ付きで 動かしたもの。後者はこの箱のデスクトップ環境が常時メモリを使う都合で、配布元の既定 (util 0.94 / 384kコンテキスト)では起動できず、util 0.92 / コンテキスト98,304 トークン(KVプール115,219トークン)で測りました。プロンプト長スイープの上限32kには 余裕がありますが、配布元が主張する384k級の長文脈は未検証です。サンプリングも1点だけ 揃っていません — DeepSeekが推奨するmin_p 0.01を、このサーバは投機デコードと併用できず 拒否するため、EXL3側だけ外しています。
なお速度は思考モードで大きく変わります。上のグラフは思考を切った単一ストリームの値で、 EXL3は50〜55 tok/s出ますが、思考を入れた精度スイート実行中は25〜36 tok/sでした。 文脈が伸びるほどデコードは落ち、投機デコードの受理率も問題の性質で変わります。
デコード速度
プロンプト長に対するトークン毎秒。高いほど良い。
- Qwen3.8-27B
- DeepSeek-V4-Flash-0731
- DeepSeek-V4-Flash-0731 (EXL3)
- Qwen3.6-27B
- Gemma 4 31B
- Gemma 4 26B-A4B
- Muse Glimmer 30B
- Ornith-1.5-35B-A3B
- Nemotron 3.5 Lightning 30B-A3B
プリフィル速度
プロンプト長に対するトークン毎秒。高いほど良い。
- Qwen3.8-27B
- DeepSeek-V4-Flash-0731
- DeepSeek-V4-Flash-0731 (EXL3)
- Qwen3.6-27B
- Gemma 4 31B
- Gemma 4 26B-A4B
- Muse Glimmer 30B
- Ornith-1.5-35B-A3B
- Nemotron 3.5 Lightning 30B-A3B
どこで頭打ちになるか
リクエストを同時に何本流すと合計スループットが最大になるかを、モデルごとに 測っています。1本あたりの速度は必ず落ちますが、合計で勝てばスイープは 早く終わります。精度スイートはここで選ばれた本数で実行しています。
Gemma 4 31B 最適 16 本 · 108 tok/s
| 同時実行 | 合計 | 1本あたり | |
|---|---|---|---|
| 1 | 10.1 | 10.4 | |
| 2 | 19.3 | 10.0 | |
| 4 | 36.7 | 9.6 | |
| 8 | 60.3 | 7.8 | |
| 16 | 108.3 | 7.2 |
Gemma 4 26B-A4B 最適 16 本 · 398 tok/s
| 同時実行 | 合計 | 1本あたり | |
|---|---|---|---|
| 1 | 53.1 | 55.1 | |
| 2 | 95.6 | 49.7 | |
| 4 | 147.9 | 41.2 | |
| 8 | 240.5 | 33.4 | |
| 16 | 398.2 | 26.6 |
Muse Glimmer 30B 最適 16 本 · 157 tok/s
| 同時実行 | 合計 | 1本あたり | |
|---|---|---|---|
| 1 | 13.1 | 13.4 | |
| 2 | 25.5 | 13.1 | |
| 4 | 47.8 | 12.6 | |
| 8 | 78.3 | 10.5 | |
| 16 | 157.3 | 10.6 |
Ornith-1.5-35B-A3B 最適 16 本 · 296 tok/s
| 同時実行 | 合計 | 1本あたり | |
|---|---|---|---|
| 1 | 75.7 | 79.1 | |
| 2 | 106.9 | 58.5 | |
| 4 | 179.5 | 47.2 | |
| 8 | 232.6 | 32.8 | |
| 16 | 296.2 | 19.6 |
Nemotron 3.5 Lightning 30B-A3B 最適 16 本 · 166 tok/s
| 同時実行 | 合計 | 1本あたり | |
|---|---|---|---|
| 1 | 63.5 | 66.7 | |
| 2 | 81.2 | 42.5 | |
| 4 | 116.9 | 30.2 | |
| 8 | 135.8 | 18.6 | |
| 16 | 166.2 | 10.9 |
単位は tok/s。プロンプトは2行、生成は256トークン固定で、思考は切って測っています — スケジューリングの測定なので、モデルが考え込む長さの差が混ざらないようにしています。
長時間タスクをどこまで保てるか
単発の問題を採点するベンチマークでは、長い作業を通して破綻しないかは分かりません。 ここでは2つ測っています。1つ目は演算を連ねて最終値を答えさせるもので、長さを変えて 追跡が崩れる地点を可視化します。2つ目は鍵と部屋の環境に放り込み、1ターン1コマンドで 自力で探索させるものです。ヒントは与えません。
| モデル | 20手 | 60手 | 150手 | エージェント |
|---|---|---|---|---|
| Qwen3.8-27B | 追跡成功 587 tok | 追跡成功 2,526 tok | 追跡成功 8,904 tok | 到達 12 / 25 ターン |
| DeepSeek-V4-Flash-0731 | 追跡成功 472 tok | 追跡成功 1,847 tok | 追跡成功 4,390 tok | 到達 11 / 25 ターン |
| DeepSeek-V4-Flash-0731 (EXL3) | 追跡成功 203 tok | 追跡成功 1,462 tok | 追跡成功 3,457 tok | 到達 12 / 25 ターン |
| Qwen3.6-27B | 追跡成功 3,554 tok | 追跡失敗 16,384 tok | 追跡失敗 16,384 tok | 到達 12 / 25 ターン |
| Gemma 4 31B | 追跡成功 2,769 tok | 追跡成功 4,810 tok | 追跡成功 12,541 tok | 到達 12 / 25 ターン |
| Gemma 4 26B-A4B | 追跡成功 4,769 tok | 追跡成功 15,893 tok | 追跡失敗 16,384 tok | 到達 11 / 25 ターン |
| Muse Glimmer 30B | 追跡成功 786 tok | 追跡成功 1,382 tok | 追跡成功 4,032 tok | 到達 21 / 25 ターン |
| Ornith-1.5-35B-A3B | 追跡成功 803 tok | 追跡成功 2,920 tok | 追跡成功 6,508 tok | 未到達 22 / 25 ターン |
| Nemotron 3.5 Lightning 30B-A3B | 追跡成功 1,181 tok | 追跡成功 13,676 tok | 追跡失敗 16,384 tok | 未到達 25 / 25 ターン |
測定方法
何を測っているか
全ての数値が1台のマシンで、1度に1モデルずつ、llama.cppのOpenAI互換サーバー経由で 得たものです。時間はクライアント側で計測しているので、TTFTはこの箱に対して リクエストを投げた人が実際に待つ時間そのものです。ハードウェア間の正規化も、 モデルカードからの引用も一切していません。
問題の抽出方法
データセット全体から等間隔に抽出しています。MMLUのtestスプリットは科目順に 並んでいるため、先頭から200問取ると57科目のうち2科目しか入りません。 等間隔抽出なら全科目が出現数に比例して入り、決定論的なので再現もできます。 HumanEvalは164問全てを使います。
注意すべき点
DeepSeek-V4-Flashは2bit量子化での測定です。1台に載せる唯一の方法であり、 APIで叩けるものとは別物です。また思考トークンが予算内に収まらず答えに 到達しなかった項目は、正答率上は不正解としつつ ! で区別して表示しています。 精度スイートの同時実行数は途中で4から8に上げました。1モデル13時間を 縮めるためで、各結果ファイルにその時の値を記録してあります。 decodeとprefillの数値は同時実行数に関わらず単一ストリームでの実測です。
- GPU
- NVIDIA GB10
- Driver
- 580.173.02
- CUDA
- 13.0
- llama.cpp
- ece963f
- 統合メモリ
- 121.7 GiB
- Qwen3.8-27B — unsloth/Qwen3.8-27B-GGUF · UD-Q4_K_XL
- DeepSeek-V4-Flash-0731 — unsloth/DeepSeek-V4-Flash-0731-GGUF · UD-IQ2_M
- DeepSeek-V4-Flash-0731 (EXL3) — 0xSero/deepseek-v4-flash-0731-spark · EXL3-3.0bpw
- Qwen3.6-27B — unsloth/Qwen3.6-27B-GGUF · UD-Q4_K_XL
- Gemma 4 31B — unsloth/gemma-4-31B-it-GGUF · UD-Q4_K_XL
- Gemma 4 26B-A4B — unsloth/gemma-4-26B-A4B-it-GGUF · UD-Q4_K_XL
- Muse Glimmer 30B — unsloth/Muse-Glimmer-30B-GGUF · UD-Q4_K_XL
- Ornith-1.5-35B-A3B — ornith-ai/Ornith-1.5-35B-A3B-GGUF · Q4_K_M
- Nemotron 3.5 Lightning 30B-A3B — unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF · UD-Q4_K_XL