1台のSparkで、どこまで動くのか。

オープンなLLMを同じ1台のDGX Sparkに載せて、精度と速度を実測しています。 正規化も推定も一切なく、全てこの机の上の箱で出た数字です。

モデル 3 +3 実行待ち
ベンチマーク 5 688 問 / モデル
最高スコア 94.7% DeepSeek-V4-Flash-0731
最速 17.0 tok/s · DeepSeek-V4-Flash-0731

リーダーボード

全モデルを同一の条件で測っています — 同じ問題、同じ思考トークン予算、同じ1台。 精度スイートは複数リクエストを並列で流して測っており(バッチ処理は答えの 中身を変えません)、速度は単一ストリームで別に測っています。

# モデル 平均 GSM8K MMLU MMLU 日本語 HumanEval 長時間タスク Decode メモリ
1 DeepSeek-V4-Flash-0731 UD-IQ2_M · 284B (13B active) 94.7 97.5 0 92.5 0 84.5 ! 98.8 0 100.0 0 17.0 tok/s 86.5 GiB
2 Qwen3.8-27B UD-Q4_K_XL · 27B 93.5 98.3 ! 86.5 ! 85.0 ! 97.6 ! 100.0 0 11.1 tok/s 32.9 GiB
3 Qwen3.6-27B UD-Q4_K_XL · 27B 92.6 94.2 ! 91.0 ! 10.9 tok/s 32.9 GiB

数値は正答した問題の割合です。! は一部の問題がエラーになったか、思考トークンが尽きて答えに到達しなかったスイートを示します (件数はホバーで表示)。Decodeは短いプロンプトでの単一ストリーム実測値です。 列をクリックすると並べ替えできます。

実行待ち: Gemma 4 31B、Muse Glimmer 30B、Nemotron 3.5 Lightning 30B-A3B。 結果が出た分だけ随時追加されます。推定値は一切載せません。

精度1ポイントの値段

全ベンチマークの平均スコアと、単一ストリームのdecode速度。円の面積は 121.7 GiB のプール上での実測ピークメモリです。右上が良く、小さいほど安上がり。

85% 89% 93% 96% 100% 048121620 デコード速度(トークン毎秒) 平均スコア DeepSeek-V4-Flash-0731 · 94.7% · 17.0 tok/s · 86.5 GiB Qwen3.6-27B · 92.6% · 10.9 tok/s · 32.9 GiB Qwen3.8-27B · 93.5% · 11.1 tok/s · 32.9 GiB DeepSeek-V4-Flash-0731Qwen3.6-27BQwen3.8-27B

縦軸は0%ではなく85%から始まります。全モデルがこれを上回っており、 0起点にすると意味のある差が潰れるためです。

メモリ予算

GB10のメモリはCPUとGPUで1つのプールを共有します。収まるか、動かないかの二択です。 色の付いた部分が重み、濃い部分がKVキャッシュと実行時のオーバーヘッド(実測ピーク)。

統合メモリ · 121.7 GiB · CPUとGPUで共有
Qwen3.8-27B UD-Q4_K_XL · 27B total / 27B active
32.9 GiB 残り 88.8 GiB
DeepSeek-V4-Flash-0731 UD-IQ2_M · 284B total / 13B active
86.5 GiB 残り 35.2 GiB
Qwen3.6-27B UD-Q4_K_XL · 27B total / 27B active
32.9 GiB 残り 88.8 GiB
  • 各バー: モデル固有色が重み、続いて
  • KVキャッシュと実行時オーバーヘッド(実測ピーク)

速度

prefillとdecodeは桁が違うので別々に描いています。decodeは返答を読んでいる間の速さ、 prefillは最初の一文字が出るまでの待ち時間を決めます。

デコード速度

プロンプト長に対するトークン毎秒。高いほど良い。

  • Qwen3.8-27B
  • DeepSeek-V4-Flash-0731
  • Qwen3.6-27B
0 5 10 15 20 149 1k 4k 16k 33k プロンプト長(トークン) Qwen3.8-27B · 158 tokens · 11.1 トークン毎秒 Qwen3.8-27B · 1k tokens · 11.1 トークン毎秒 Qwen3.8-27B · 4k tokens · 11.0 トークン毎秒 Qwen3.8-27B · 16k tokens · 10.5 トークン毎秒 Qwen3.8-27B · 33k tokens · 9.9 トークン毎秒 DeepSeek-V4-Flash-0731 · 149 tokens · 17.0 トークン毎秒 DeepSeek-V4-Flash-0731 · 1k tokens · 16.7 トークン毎秒 DeepSeek-V4-Flash-0731 · 4k tokens · 16.4 トークン毎秒 DeepSeek-V4-Flash-0731 · 16k tokens · 16.0 トークン毎秒 DeepSeek-V4-Flash-0731 · 33k tokens · 15.2 トークン毎秒 Qwen3.6-27B · 158 tokens · 10.9 トークン毎秒 Qwen3.6-27B · 1k tokens · 10.9 トークン毎秒 Qwen3.6-27B · 4k tokens · 10.7 トークン毎秒 Qwen3.6-27B · 16k tokens · 10.2 トークン毎秒 Qwen3.6-27B · 33k tokens · 9.7 トークン毎秒

プリフィル速度

プロンプト長に対するトークン毎秒。高いほど良い。

  • Qwen3.8-27B
  • DeepSeek-V4-Flash-0731
  • Qwen3.6-27B
0 250 500 750 1000 149 1k 4k 16k 33k プロンプト長(トークン) Qwen3.8-27B · 158 tokens · 221.2 トークン毎秒 Qwen3.8-27B · 1k tokens · 616.5 トークン毎秒 Qwen3.8-27B · 4k tokens · 783.9 トークン毎秒 Qwen3.8-27B · 16k tokens · 797.5 トークン毎秒 Qwen3.8-27B · 33k tokens · 760.4 トークン毎秒 DeepSeek-V4-Flash-0731 · 149 tokens · 152.6 トークン毎秒 DeepSeek-V4-Flash-0731 · 1k tokens · 447.6 トークン毎秒 DeepSeek-V4-Flash-0731 · 4k tokens · 498.3 トークン毎秒 DeepSeek-V4-Flash-0731 · 16k tokens · 471.9 トークン毎秒 DeepSeek-V4-Flash-0731 · 33k tokens · 426.0 トークン毎秒 Qwen3.6-27B · 158 tokens · 260.9 トークン毎秒 Qwen3.6-27B · 1k tokens · 681.2 トークン毎秒 Qwen3.6-27B · 4k tokens · 790.3 トークン毎秒 Qwen3.6-27B · 16k tokens · 798.4 トークン毎秒 Qwen3.6-27B · 33k tokens · 748.8 トークン毎秒

長時間タスクをどこまで保てるか

単発の問題を採点するベンチマークでは、長い作業を通して破綻しないかは分かりません。 ここでは2つ測っています。1つ目は演算を連ねて最終値を答えさせるもので、長さを変えて 追跡が崩れる地点を可視化します。2つ目は鍵と部屋の環境に放り込み、1ターン1コマンドで 自力で探索させるものです。ヒントは与えません。

モデル 20手 60手 150手 エージェント
Qwen3.8-27B 追跡成功 587 tok 追跡成功 2,526 tok 追跡成功 8,904 tok 到達 12 / 25 ターン
DeepSeek-V4-Flash-0731 追跡成功 472 tok 追跡成功 1,847 tok 追跡成功 4,390 tok 到達 11 / 25 ターン

測定方法

何を測っているか

全ての数値が1台のマシンで、1度に1モデルずつ、llama.cppのOpenAI互換サーバー経由で 得たものです。時間はクライアント側で計測しているので、TTFTはこの箱に対して リクエストを投げた人が実際に待つ時間そのものです。ハードウェア間の正規化も、 モデルカードからの引用も一切していません。

問題の抽出方法

データセット全体から等間隔に抽出しています。MMLUのtestスプリットは科目順に 並んでいるため、先頭から200問取ると57科目のうち2科目しか入りません。 等間隔抽出なら全科目が出現数に比例して入り、決定論的なので再現もできます。 HumanEvalは164問全てを使います。

注意すべき点

DeepSeek-V4-Flashは2bit量子化での測定です。1台に載せる唯一の方法であり、 APIで叩けるものとは別物です。また思考トークンが予算内に収まらず答えに 到達しなかった項目は、正答率上は不正解としつつ ! で区別して表示しています。 精度スイートの同時実行数は途中で4から8に上げました。1モデル13時間を 縮めるためで、各結果ファイルにその時の値を記録してあります。 decodeとprefillの数値は同時実行数に関わらず単一ストリームでの実測です。

GPU
NVIDIA GB10
Driver
580.159.03
CUDA
13.0
llama.cpp
ece963f
統合メモリ
121.7 GiB