1台のSparkで、どこまで動くのか。

オープンなLLMを同じ1台のDGX Sparkに載せて、精度と速度を実測しています。 正規化も推定も一切なく、全てこの机の上の箱で出た数字です。

モデル 9 検証済み
ベンチマーク 5 688 問 / モデル
最高スコア 95.2% DeepSeek-V4-Flash-0731 (EXL3)
最速 79.3 tok/s · Ornith-1.5-35B-A3B

リーダーボード

全モデルを同一の条件で測っています — 同じ問題、同じ思考トークン予算、同じ1台。 精度スイートは複数リクエストを並列で流して測っており(バッチ処理は答えの 中身を変えません。EXL3のサーバだけはスロットが1つなので直列です)、 速度は単一ストリームで別に測っています。

# モデル 平均 GSM8K MMLU MMLU 日本語 HumanEval 長時間タスク Decode メモリ
1 DeepSeek-V4-Flash-0731 (EXL3) EXL3-3.0bpw · 284B (13B active) · sparkinfer/vLLM + DSpark K5 95.2 98.3 90.0 ! 89.0 ! 98.8 ! 100.0 55.3 tok/s 107.0 GiB
2 Gemma 4 31B UD-Q4_K_XL · 31B · llama.cpp 94.9 98.3 91.0 86.0 99.4 100.0 10.9 tok/s 51.0 GiB
3 DeepSeek-V4-Flash-0731 UD-IQ2_M · 284B (13B active) · llama.cpp 94.7 97.5 92.5 84.5 ! 98.8 100.0 17.0 tok/s 86.5 GiB
4 Qwen3.8-27B UD-Q4_K_XL · 27B · llama.cpp 93.5 98.3 ! 86.5 ! 85.0 ! 97.6 ! 100.0 11.1 tok/s 32.9 GiB
5 Muse Glimmer 30B UD-Q4_K_XL · 30B · llama.cpp 93.1 95.8 90.0 81.0 98.8 ! 100.0 13.4 tok/s 29.5 GiB
6 Gemma 4 26B-A4B UD-Q4_K_XL · 26B (4B active) · llama.cpp 89.7 98.3 ! 89.5 85.5 100.0 75.0 ! 53.8 tok/s 42.6 GiB
7 Ornith-1.5-35B-A3B Q4_K_M · 35B (3B active) · llama.cpp 87.5 98.3 87.5 ! 82.0 ! 94.5 ! 75.0 79.3 tok/s 40.9 GiB
8 Qwen3.6-27B UD-Q4_K_XL · 27B · llama.cpp 84.1 94.2 ! 91.0 ! 87.0 ! 98.2 50.0 ! 10.9 tok/s 49.5 GiB
9 Nemotron 3.5 Lightning 30B-A3B UD-Q4_K_XL · 30B (3B active) · llama.cpp 81.6 90.8 ! 88.0 ! 83.0 ! 96.3 50.0 ! 66.5 tok/s 29.7 GiB

数値は正答した問題の割合です。! は一部の問題がエラーになったか、思考トークンが尽きて答えに到達しなかったスイートを示します (件数はホバーで表示)。Decodeは短いプロンプトでの単一ストリーム実測値です。 列をクリックすると並べ替えできます。

検証済みモデル数が配色の識別限界(8色)を超えたため、9番目以降は グラフ上で灰色になります。識別はラベルで行ってください。

精度1ポイントの値段

全ベンチマークの平均スコアと、単一ストリームのdecode速度。円の面積は 121.7 GiB のプール上での実測ピークメモリです。右上が良く、小さいほど安上がり。

75% 81% 88% 94% 100% 020406080100 デコード速度(トークン毎秒) 平均スコア DeepSeek-V4-Flash-0731 (EXL3) · 95.2% · 55.3 tok/s · 107.0 GiB DeepSeek-V4-Flash-0731 · 94.7% · 17.0 tok/s · 86.5 GiB Gemma 4 31B · 94.9% · 10.9 tok/s · 51.0 GiB Qwen3.6-27B · 84.1% · 10.9 tok/s · 49.5 GiB Gemma 4 26B-A4B · 89.7% · 53.8 tok/s · 42.6 GiB Ornith-1.5-35B-A3B · 87.5% · 79.3 tok/s · 40.9 GiB Qwen3.8-27B · 93.5% · 11.1 tok/s · 32.9 GiB Nemotron 3.5 Lightning 30B-A3B · 81.6% · 66.5 tok/s · 29.7 GiB Muse Glimmer 30B · 93.1% · 13.4 tok/s · 29.5 GiB DeepSeek-V4-Flash-0731 (EXL3)DeepSeek-V4-Flash-0731Gemma 4 31BQwen3.6-27BGemma 4 26B-A4BOrnith-1.5-35B-A3BQwen3.8-27BNemotron 3.5 Lightning 30B-A3BMuse Glimmer 30B

縦軸は0%ではなく75%から始まります。全モデルがこれを上回っており、 0起点にすると意味のある差が潰れるためです。

メモリ予算

GB10のメモリはCPUとGPUで1つのプールを共有します。収まるか、動かないかの二択です。 色の付いた部分が重み、濃い部分がKVキャッシュと実行時のオーバーヘッド(実測ピーク)。

統合メモリ · 121.7 GiB · CPUとGPUで共有
Qwen3.8-27B UD-Q4_K_XL · 27B total / 27B active
32.9 GiB 残り 88.8 GiB
DeepSeek-V4-Flash-0731 UD-IQ2_M · 284B total / 13B active
86.5 GiB 残り 35.2 GiB
DeepSeek-V4-Flash-0731 (EXL3) EXL3-3.0bpw · 284B total / 13B active
107.0 GiB 残り 14.7 GiB
Qwen3.6-27B UD-Q4_K_XL · 27B total / 27B active
49.5 GiB 残り 72.2 GiB
Gemma 4 31B UD-Q4_K_XL · 31B total / 31B active
51.0 GiB 残り 70.7 GiB
Gemma 4 26B-A4B UD-Q4_K_XL · 26B total / 4B active
42.6 GiB 残り 79.1 GiB
Muse Glimmer 30B UD-Q4_K_XL · 30B total / 30B active
29.5 GiB 残り 92.2 GiB
Ornith-1.5-35B-A3B Q4_K_M · 35B total / 3B active
40.9 GiB 残り 80.8 GiB
Nemotron 3.5 Lightning 30B-A3B UD-Q4_K_XL · 30B total / 3B active
29.7 GiB 残り 92.0 GiB
  • 各バー: モデル固有色が重み、続いて
  • KVキャッシュと実行時オーバーヘッド(実測ピーク)

速度

prefillとdecodeは桁が違うので別々に描いています。decodeは返答を読んでいる間の速さ、 prefillは最初の一文字が出るまでの待ち時間を決めます。

DeepSeek-V4-Flashは2つのスタックで別々に測っています。同じ重みでも、量子化形式と 推論エンジンが違えば別の実測対象です — llama.cppのGGUF UD-IQ2_M(2bit)と、 EXL3 3.0bpwをsparkinfer/vLLMでDSpark投機デコードとNVFP4 KVキャッシュ付きで 動かしたもの。後者はこの箱のデスクトップ環境が常時メモリを使う都合で、配布元の既定 (util 0.94 / 384kコンテキスト)では起動できず、util 0.92 / コンテキスト98,304 トークン(KVプール115,219トークン)で測りました。プロンプト長スイープの上限32kには 余裕がありますが、配布元が主張する384k級の長文脈は未検証です。サンプリングも1点だけ 揃っていません — DeepSeekが推奨するmin_p 0.01を、このサーバは投機デコードと併用できず 拒否するため、EXL3側だけ外しています。

なお速度は思考モードで大きく変わります。上のグラフは思考を切った単一ストリームの値で、 EXL3は50〜55 tok/s出ますが、思考を入れた精度スイート実行中は25〜36 tok/sでした。 文脈が伸びるほどデコードは落ち、投機デコードの受理率も問題の性質で変わります。

デコード速度

プロンプト長に対するトークン毎秒。高いほど良い。

  • Qwen3.8-27B
  • DeepSeek-V4-Flash-0731
  • DeepSeek-V4-Flash-0731 (EXL3)
  • Qwen3.6-27B
  • Gemma 4 31B
  • Gemma 4 26B-A4B
  • Muse Glimmer 30B
  • Ornith-1.5-35B-A3B
  • Nemotron 3.5 Lightning 30B-A3B
0 25 50 75 100 149 201 228 1k 4k 16k 33k プロンプト長(トークン) Qwen3.8-27B · 158 tokens · 11.1 トークン毎秒 Qwen3.8-27B · 1k tokens · 11.1 トークン毎秒 Qwen3.8-27B · 4k tokens · 11.0 トークン毎秒 Qwen3.8-27B · 16k tokens · 10.5 トークン毎秒 Qwen3.8-27B · 33k tokens · 9.9 トークン毎秒 DeepSeek-V4-Flash-0731 · 149 tokens · 17.0 トークン毎秒 DeepSeek-V4-Flash-0731 · 1k tokens · 16.7 トークン毎秒 DeepSeek-V4-Flash-0731 · 4k tokens · 16.4 トークン毎秒 DeepSeek-V4-Flash-0731 · 16k tokens · 16.0 トークン毎秒 DeepSeek-V4-Flash-0731 · 33k tokens · 15.2 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 228 tokens · 55.3 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 1k tokens · 53.3 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 4k tokens · 51.4 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 16k tokens · 51.1 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 33k tokens · 50.3 トークン毎秒 Qwen3.6-27B · 158 tokens · 10.9 トークン毎秒 Qwen3.6-27B · 1k tokens · 10.9 トークン毎秒 Qwen3.6-27B · 4k tokens · 10.7 トークン毎秒 Qwen3.6-27B · 16k tokens · 10.2 トークン毎秒 Qwen3.6-27B · 33k tokens · 9.7 トークン毎秒 Gemma 4 31B · 164 tokens · 10.9 トークン毎秒 Gemma 4 31B · 1k tokens · 10.5 トークン毎秒 Gemma 4 31B · 4k tokens · 10.2 トークン毎秒 Gemma 4 31B · 16k tokens · 9.7 トークン毎秒 Gemma 4 31B · 33k tokens · 9.1 トークン毎秒 Gemma 4 26B-A4B · 164 tokens · 53.8 トークン毎秒 Gemma 4 26B-A4B · 1k tokens · 51.3 トークン毎秒 Gemma 4 26B-A4B · 4k tokens · 49.2 トークン毎秒 Gemma 4 26B-A4B · 16k tokens · 46.1 トークン毎秒 Gemma 4 26B-A4B · 33k tokens · 43.3 トークン毎秒 Muse Glimmer 30B · 201 tokens · 13.4 トークン毎秒 Muse Glimmer 30B · 1k tokens · 13.2 トークン毎秒 Muse Glimmer 30B · 4k tokens · 13.0 トークン毎秒 Muse Glimmer 30B · 16k tokens · 13.0 トークン毎秒 Muse Glimmer 30B · 33k tokens · 12.8 トークン毎秒 Ornith-1.5-35B-A3B · 158 tokens · 79.3 トークン毎秒 Ornith-1.5-35B-A3B · 1k tokens · 79.2 トークン毎秒 Ornith-1.5-35B-A3B · 4k tokens · 78.7 トークン毎秒 Ornith-1.5-35B-A3B · 16k tokens · 70.1 トークン毎秒 Ornith-1.5-35B-A3B · 33k tokens · 63.7 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 162 tokens · 66.5 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 1k tokens · 66.3 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 4k tokens · 65.5 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 16k tokens · 64.3 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 33k tokens · 61.8 トークン毎秒

プリフィル速度

プロンプト長に対するトークン毎秒。高いほど良い。

  • Qwen3.8-27B
  • DeepSeek-V4-Flash-0731
  • DeepSeek-V4-Flash-0731 (EXL3)
  • Qwen3.6-27B
  • Gemma 4 31B
  • Gemma 4 26B-A4B
  • Muse Glimmer 30B
  • Ornith-1.5-35B-A3B
  • Nemotron 3.5 Lightning 30B-A3B
0 1000 2000 3000 4000 149 201 228 1k 4k 16k 33k プロンプト長(トークン) Qwen3.8-27B · 158 tokens · 221.2 トークン毎秒 Qwen3.8-27B · 1k tokens · 616.5 トークン毎秒 Qwen3.8-27B · 4k tokens · 783.9 トークン毎秒 Qwen3.8-27B · 16k tokens · 797.5 トークン毎秒 Qwen3.8-27B · 33k tokens · 760.4 トークン毎秒 DeepSeek-V4-Flash-0731 · 149 tokens · 152.6 トークン毎秒 DeepSeek-V4-Flash-0731 · 1k tokens · 447.6 トークン毎秒 DeepSeek-V4-Flash-0731 · 4k tokens · 498.3 トークン毎秒 DeepSeek-V4-Flash-0731 · 16k tokens · 471.9 トークン毎秒 DeepSeek-V4-Flash-0731 · 33k tokens · 426.0 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 228 tokens · 79.2 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 1k tokens · 333.5 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 4k tokens · 722.8 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 16k tokens · 1020.1 トークン毎秒 DeepSeek-V4-Flash-0731 (EXL3) · 33k tokens · 1092.3 トークン毎秒 Qwen3.6-27B · 158 tokens · 260.9 トークン毎秒 Qwen3.6-27B · 1k tokens · 681.2 トークン毎秒 Qwen3.6-27B · 4k tokens · 790.3 トークン毎秒 Qwen3.6-27B · 16k tokens · 798.4 トークン毎秒 Qwen3.6-27B · 33k tokens · 748.8 トークン毎秒 Gemma 4 31B · 164 tokens · 206.8 トークン毎秒 Gemma 4 31B · 1k tokens · 517.1 トークン毎秒 Gemma 4 31B · 4k tokens · 623.7 トークン毎秒 Gemma 4 31B · 16k tokens · 674.4 トークン毎秒 Gemma 4 31B · 33k tokens · 621.3 トークン毎秒 Gemma 4 26B-A4B · 164 tokens · 418.2 トークン毎秒 Gemma 4 26B-A4B · 1k tokens · 2026.8 トークン毎秒 Gemma 4 26B-A4B · 4k tokens · 2625.0 トークン毎秒 Gemma 4 26B-A4B · 16k tokens · 2942.7 トークン毎秒 Gemma 4 26B-A4B · 33k tokens · 2734.3 トークン毎秒 Muse Glimmer 30B · 201 tokens · 321.4 トークン毎秒 Muse Glimmer 30B · 1k tokens · 746.1 トークン毎秒 Muse Glimmer 30B · 4k tokens · 936.2 トークン毎秒 Muse Glimmer 30B · 16k tokens · 990.6 トークン毎秒 Muse Glimmer 30B · 33k tokens · 983.3 トークン毎秒 Ornith-1.5-35B-A3B · 158 tokens · 531.8 トークン毎秒 Ornith-1.5-35B-A3B · 1k tokens · 2018.1 トークン毎秒 Ornith-1.5-35B-A3B · 4k tokens · 2437.7 トークン毎秒 Ornith-1.5-35B-A3B · 16k tokens · 2542.9 トークン毎秒 Ornith-1.5-35B-A3B · 33k tokens · 2423.4 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 162 tokens · 296.8 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 1k tokens · 2084.0 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 4k tokens · 2773.3 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 16k tokens · 2960.4 トークン毎秒 Nemotron 3.5 Lightning 30B-A3B · 33k tokens · 2888.5 トークン毎秒

どこで頭打ちになるか

リクエストを同時に何本流すと合計スループットが最大になるかを、モデルごとに 測っています。1本あたりの速度は必ず落ちますが、合計で勝てばスイープは 早く終わります。精度スイートはここで選ばれた本数で実行しています。

Gemma 4 31B 最適 16 本 · 108 tok/s

同時実行合計1本あたり
110.110.4
219.310.0
436.79.6
860.37.8
16108.37.2

Gemma 4 26B-A4B 最適 16 本 · 398 tok/s

同時実行合計1本あたり
153.155.1
295.649.7
4147.941.2
8240.533.4
16398.226.6

Muse Glimmer 30B 最適 16 本 · 157 tok/s

同時実行合計1本あたり
113.113.4
225.513.1
447.812.6
878.310.5
16157.310.6

Ornith-1.5-35B-A3B 最適 16 本 · 296 tok/s

同時実行合計1本あたり
175.779.1
2106.958.5
4179.547.2
8232.632.8
16296.219.6

Nemotron 3.5 Lightning 30B-A3B 最適 16 本 · 166 tok/s

同時実行合計1本あたり
163.566.7
281.242.5
4116.930.2
8135.818.6
16166.210.9

単位は tok/s。プロンプトは2行、生成は256トークン固定で、思考は切って測っています — スケジューリングの測定なので、モデルが考え込む長さの差が混ざらないようにしています。

長時間タスクをどこまで保てるか

単発の問題を採点するベンチマークでは、長い作業を通して破綻しないかは分かりません。 ここでは2つ測っています。1つ目は演算を連ねて最終値を答えさせるもので、長さを変えて 追跡が崩れる地点を可視化します。2つ目は鍵と部屋の環境に放り込み、1ターン1コマンドで 自力で探索させるものです。ヒントは与えません。

モデル 20手 60手 150手 エージェント
Qwen3.8-27B 追跡成功 587 tok 追跡成功 2,526 tok 追跡成功 8,904 tok 到達 12 / 25 ターン
DeepSeek-V4-Flash-0731 追跡成功 472 tok 追跡成功 1,847 tok 追跡成功 4,390 tok 到達 11 / 25 ターン
DeepSeek-V4-Flash-0731 (EXL3) 追跡成功 203 tok 追跡成功 1,462 tok 追跡成功 3,457 tok 到達 12 / 25 ターン
Qwen3.6-27B 追跡成功 3,554 tok 追跡失敗 16,384 tok 追跡失敗 16,384 tok 到達 12 / 25 ターン
Gemma 4 31B 追跡成功 2,769 tok 追跡成功 4,810 tok 追跡成功 12,541 tok 到達 12 / 25 ターン
Gemma 4 26B-A4B 追跡成功 4,769 tok 追跡成功 15,893 tok 追跡失敗 16,384 tok 到達 11 / 25 ターン
Muse Glimmer 30B 追跡成功 786 tok 追跡成功 1,382 tok 追跡成功 4,032 tok 到達 21 / 25 ターン
Ornith-1.5-35B-A3B 追跡成功 803 tok 追跡成功 2,920 tok 追跡成功 6,508 tok 未到達 22 / 25 ターン
Nemotron 3.5 Lightning 30B-A3B 追跡成功 1,181 tok 追跡成功 13,676 tok 追跡失敗 16,384 tok 未到達 25 / 25 ターン

測定方法

何を測っているか

全ての数値が1台のマシンで、1度に1モデルずつ、llama.cppのOpenAI互換サーバー経由で 得たものです。時間はクライアント側で計測しているので、TTFTはこの箱に対して リクエストを投げた人が実際に待つ時間そのものです。ハードウェア間の正規化も、 モデルカードからの引用も一切していません。

問題の抽出方法

データセット全体から等間隔に抽出しています。MMLUのtestスプリットは科目順に 並んでいるため、先頭から200問取ると57科目のうち2科目しか入りません。 等間隔抽出なら全科目が出現数に比例して入り、決定論的なので再現もできます。 HumanEvalは164問全てを使います。

注意すべき点

DeepSeek-V4-Flashは2bit量子化での測定です。1台に載せる唯一の方法であり、 APIで叩けるものとは別物です。また思考トークンが予算内に収まらず答えに 到達しなかった項目は、正答率上は不正解としつつ ! で区別して表示しています。 精度スイートの同時実行数は途中で4から8に上げました。1モデル13時間を 縮めるためで、各結果ファイルにその時の値を記録してあります。 decodeとprefillの数値は同時実行数に関わらず単一ストリームでの実測です。

GPU
NVIDIA GB10
Driver
580.173.02
CUDA
13.0
llama.cpp
ece963f
統合メモリ
121.7 GiB