FreeToken 1秒あたりのトークン数:2026年ベンチマークガイド - ベンチマーク

FreeToken 1秒あたりのトークン数:2026年ベンチマークガイド

FreeTokenの1秒あたりのトークン数の結果を読み解き、ハードウェアを比較し、2026年のローカルMoE推論性能を向上させる方法を学びます。

2026-08-25
FreeTokenチーム
クイックガイド
  • FreeTokenの1秒あたりのトークン数は、GPUキャッシュヒット、システムメモリ、PCIe帯域幅に左右されます。
  • RTX 3090のテストでは、ローカル環境でデコード時に約10~11トークン/秒を達成しました。
  • デスクトップクライアントの結果では、同等のテストで約8.8トークン/秒を測定しました。
  • モデルの選択は重要です。MoEモデルと密モデルでは、メモリ要件が大きく異なるためです。
  • 最も効果的な改善は通常、より高速なメモリ、より多くの使用可能RAM、バックグラウンド負荷の削減によって得られます。

FreeTokenの1秒あたりのトークン数:この指標の意味

FreeTokenの1秒あたりのトークン数は、プロンプト処理後にローカルで提供される言語モデルが出力を生成する速度、つまりデコードスループットを表します。これは、初回トークンまでの時間、プロンプト処理速度、合計応答時間とは異なります。インタラクティブなチャットでは、回答が表示されている間にユーザーが通常実感するのがデコードスループットです。

FreeTokenは、大規模なMixture-of-Expertsモデル向けのエッジネイティブなサービングシステムです。その設計では、エキスパート全体をホストメモリに保持し、利用可能なGPUメモリを柔軟なエキスパートキャッシュとして使用します。その結果、性能はグラフィックスカードだけでなく、マシン全体に依存します。

動画のハイライト:

  • 単一のRTX 3090環境で、約10~11デコードトークン/秒を生成しました。
  • 後のテストでは、デスクトップクライアントが約8.8トークン/秒を報告しました。
  • システムRAMの容量と帯域幅が、主要な性能要因として確認されました。
  • バックグラウンドアプリケーションは、使用可能なVRAMを減らし、スループットに影響する可能性があります。
指標意味重要な理由
1秒あたりのデコードトークン数生成される出力速度会話の応答性を示す
プロンプト処理速度入力トークンの処理速度長いプロンプトの開始遅延に影響する
初回トークンまでの時間出力開始前の遅延エージェントや大規模コンテキストで重要
合計応答時間リクエスト全体の所要時間プロンプト処理とデコードのコストを合算する

公開されているFreeTokenの研究論文では、システムが測定されたホストメモリとPCIeの帯域幅に応じて実行方法を適応させることが説明されています。同じGPUを搭載した2台のコンピューターでも、結果に明確な差が生じるのはこのためです。

数値の読み方

1秒あたりのトークン数は、固定された製品仕様ではなく、ワークロードの測定値として扱ってください。モデル、コンテキスト長、思考モード、メモリ条件を変更すると、結果は大きく変わる可能性があります。

構成別に見るFreeTokenの実測性能

利用可能なテストでは、サーバー側とデスクトップクライアントの測定値に実用上の差があることが示されています。単一のRTX 3090では、通常のチャットプロンプトでDeepSeek V4 Flashが毎秒10~11トークン付近を維持しました。別のデスクトップクライアントの実行では、毎秒8.8トークンが報告されました。これらの数値は参考値として有用ですが、普遍的な評価値ではありません。

この差は、クライアントのオーバーヘッド、OSの挙動、モデル設定、バックグラウンドプロセス、測定のばらつきなどから生じる可能性があります。思考モードもワークロードを変化させます。最大限の推論で生成された回答は、短く直接的な回答と比べて、表示上の出力速度が低くなり、完了までの経路が長くなる場合があります。

構成モデルまたはモード報告されたデコード速度実用上の見方
単一のRTX 3090DeepSeek V4 Flash、ローカルサーバー約10~11 tok/sインタラクティブなチャットに適している
デスクトップクライアントDeepSeek V4 Flash、思考モード有効約8.8 tok/sセットアップは簡単だが、結果はやや遅い
単一のRTX 4090との比較DeepSeek V4 Flash固定された結果なしハードウェア比較の目標として利用する
RTX PRO 6000の研究向け構成GLM-5.2 NVFP414.9 tok/s最先端規模のデモンストレーション
RTX 5090の研究向け構成DeepSeek V4 Flash22~25 tok/s研究ベンチマークであり、3090で期待できる値ではない

研究評価で新しいハードウェアの結果が高くなっているのは、最適化されたサービングランタイム、測定された帯域幅スケジューリング、特定のベンチマーク条件が使用されているためです。これらの数値を、そのまま一般的なデスクトップ環境の推定値として使用しないでください。

インタラクティブチャット

通常のローカル会話では、プロンプトとモデルの挙動によって異なりますが、8~11 tok/s程度でも応答性が高く感じられます。

エージェントワークロード

ツール呼び出しや長いプロンプトの繰り返しでは、デコード速度だけでなく初回トークンまでの時間がより重要になります。

推論モード

ハードウェアが変わらなくても、長時間の思考によって表示上の速度が低下し、完了までの合計時間が増加することがあります。

有効な比較方法は、各構成で同じモデル、プロンプト形式、コンテキストサイズ、生成設定を使ってテストすることです。1回の完了結果だけに頼らず、複数の応答を記録してください。MoEのルーティングはトークンごとに変化するため、個々の結果にはばらつきが生じます。

ベンチマーク条件を混在させない

デスクトップクライアントの結果、サーバー側の測定値、研究ベンチマークでは、異なるランタイムや設定が使われている可能性があります。すべてのテスト条件が一致していない限り、方向性の比較にとどめてください。

スループットを変化させるハードウェア要因

FreeTokenでは、性能に関する議論の多くが、GPUの生の計算能力からメモリ転送へと移ります。Mixture-of-Expertsモデルは、各トークンでパラメータの一部だけを有効化しますが、エキスパート全体をシステムメモリ上で利用可能な状態に保つ必要がある場合があります。エキスパートがGPUにキャッシュされていない場合、ランタイムはPCIe経由で転送するか、CPU上で直接実行できます。

そのため、システムメモリの容量が不可欠になります。テストでは、一部のローカル構成では32GBが開始点になり得る一方、64GBあればより余裕を持てることが示されています。より大きなモデルでは、さらに多くのメモリが必要になる可能性があります。研究資料では、特に最先端規模のモデルについて、数百GBのホストメモリを必要とする構成が説明されています。

ハードウェア要因FreeTokenへの影響推奨される見方
GPU VRAMエキスパートキャッシュの容量を決めるVRAMが多いほどキャッシュミスを減らせる可能性がある
システムRAM容量ホスト上に常駐するエキスパートを保持する使用可能なRAMが不足するとロードできない
RAM帯域幅CPU実行と転送にデータを供給する高速なメモリはデコード性能を向上させる可能性がある
PCIeリンク幅エキスパートの転送速度を制御する一般にx16はx8より余裕がある
バックグラウンドでのGPU使用使用可能なVRAMを減らすブラウザ、録画ツール、ゲームなどが干渉する可能性がある
ストレージ速度起動とモデルのロードに影響するNVMeストレージは初回ロードの遅延を短縮できる

研究論文では、エキスパート転送におけるプラットフォームレベルの差が概算されています。PCIe 4.0 x16を使用するRTX 4090およびRTX 3090クラスのシステムでは、プリフィル中に大規模なエキスパートセットを移動するのに数秒かかることがあります。一方、より狭いノートPC向けリンクではさらに時間がかかる可能性があります。デコード時の挙動は異なり、キャッシュとCPUの同時実行によって転送コストの一部が隠れる場合があります。

最適なアップグレード優先順位

単一GPUのFreeTokenシステムでは、まず使用可能なRAM容量を優先し、次にメモリ帯域幅とPCIeの条件を確認してください。GPUの計算能力だけを追加しても、ホストメモリのボトルネックが解消されるとは限りません。

クリーンなテスト環境も重要です。不要なGPU負荷の高いソフトウェアを終了し、複数のモデルサービスを同時に実行することを避け、OS用に十分なRAMを確保してください。ランタイムがRAMまたはVRAM不足を報告している場合、1秒あたりのトークン数への期待値を下げてもロード問題は解決しません。まずモデル構成がリソース内に収まる必要があります。

FreeTokenベンチマーク環境の構築手順

この手順を使って、信頼できるローカル環境のベースラインを測定してください。目的は、一時的に非常に高い数値を追いかけることではなく、変化の原因を説明できる再現可能なテストを作ることです。

1

マシン情報を記録する

GPUモデル、VRAM、システムRAM、RAMの世代と速度、OS、PCIeリンク、ストレージの種類を書き留めます。これらの詳細は、結果の違いの多くを説明します。

2

1つのモデルを選ぶ

比較するすべての構成で、同じ対応モデルから始めます。利用可能な単一GPUテストではDeepSeek V4 Flashが最も明確な基準ですが、密モデルでは挙動が異なる可能性があります。

3

クリーンなセッションを準備する

競合するGPUワークロードやバックグラウンドの推論サービスを終了します。モデル、コンテキストサイズ、温度、思考モード、サンプリング設定を統一します。

4

ランタイムをウォームアップする

結果を記録する前に、短いプロンプトを1つ送信します。最初の応答にはロードやキャッシュのウォームアップにかかるコストが含まれる場合があり、定常状態のデコード速度を示さないことがあります。

5

複数回の実行結果を平均する

比較可能なプロンプトを少なくとも3回実行し、表示されたデコード速度、プロンプト処理速度、初回トークンまでの時間を記録します。最高値ではなく、中央値または平均値を使用してください。

テスト変数固定する条件記録例
モデル同じチェックポイントと量子化DeepSeek V4 Flash
プロンプト近い長さとタスク短い事実確認の質問
生成同じ思考モードとサンプリングモード思考モード有効または無効
ランタイム同じクライアントまたはサーバー経路デスクトップクライアントまたはAPIサーバー
結果複数回の実行を記録10.5、10.1、10.8 tok/s

デスクトップクライアントとサーバー接続インターフェースを比較する場合は、それぞれを分けてテストしてください。利用可能な結果からは、デスクトップ経路は便利である一方、測定値が低くなる可能性が示唆されています。これは、すべてのワークロードでモデルが自動的に遅いという意味ではありません。インターフェースとランタイム経路を記録すべきだという意味です。

ベンチマークのヒント

表示された速度と応答条件の両方を記録してください。モデル、コンテキスト、ランタイム、思考モードの詳細がない数値は、再現や比較が困難です。

最適化チェックリストと一般的な制限

FreeTokenの最大の強みは、GPUメモリ、ホストメモリ、CPU実行、PCIe転送を連携させることにあります。そのため、実用的なチューニングでは、モデルを変更したり高い出力速度を期待したりする前に、回避可能なリソース競合を取り除くことが重要です。

パフォーマンスチェックリスト:

  • モデルが使用可能なシステムRAMとVRAMの範囲内に収まることを確認する
  • システムで利用可能な、安定して動作する最速のRAM構成を使用する
  • ベンチマーク前に不要なGPU負荷の高いアプリケーションを終了する
  • モデル、プロンプト長、思考設定を統一する
  • ウォームアップ後のテストを複数回実行し、1秒あたりのトークン数の中央値を記録する
症状考えられる原因最初に行う対処
モデルが起動しない使用可能なRAMまたはVRAMが不足しているより小さいモデルを選ぶか、メモリを増設する
速度の変動が大きいエキスパートのルーティングとキャッシュミス複数回実行して平均する
デスクトップの結果が低いクライアントまたはランタイムのオーバーヘッドサーバー経路と比較する
初期遅延が長いプリフィルまたはエキスパートのロードコスト初回トークンまでの時間を個別に測定する
他のアプリケーションで推論が遅くなるGPUまたはメモリリソースの共有バックグラウンドのワークロードを終了する

利用可能なテストでは、ソフトウェアの成熟度も考慮すべき要素として挙げられています。FreeTokenはベータ版ソフトウェアと説明されており、テスト中にある密モデルのQwen構成が予期せず終了しました。モデルの起動失敗は、1秒あたりのトークン数の結果ではなく、互換性またはリソースの問題として扱うべきです。

トラブルシューティングでは、ログを確認し、モデルが対応している形式を検証し、OSや他のアプリケーションの使用分を考慮したうえで利用可能なメモリを確認し、ランタイムを再起動してテストを繰り返してください。1回の起動失敗を、すべてのモデル構成に互換性がない証拠だと解釈しないでください。

互換性の制限

概念上は収まるモデルでも、精度形式、ランタイムのサポート、メモリ登録、利用可能なホストリソースなどが原因で失敗する場合があります。速度を比較する前に互換性を確認してください。

Q: RTX 3090でFreeTokenの1秒あたりのトークン数は、どの程度なら良い結果ですか?

利用可能な単一GPUテストでは、DeepSeek V4 Flashで約10~11デコードトークン/秒に到達しました。これは実用的な参考値であり、保証された評価値ではありません。

Q: デスクトップクライアントが約8.8トークン/秒と報告したのはなぜですか?

デスクトップクライアントでは、異なるランタイムの挙動、インターフェースのオーバーヘッド、メモリ条件、設定が使用されている可能性があります。この結果はインタラクティブなローカル推論としては同程度の傾向にありますが、条件を一致させて比較する必要があります。

Q: システムRAMを増やせば、必ず1秒あたりのトークン数が増えますか?

RAM容量が主に決めるのは、モデルをロードできるかどうかと、どれだけのキャッシュ領域を確保できるかです。容量が十分になった後は、スループットに対してRAM帯域幅やPCIeの挙動がより重要になる場合があります。

Q: 同じGPUを搭載した2台のコンピューターで性能が異なるのはなぜですか?

FreeTokenは、エキスパートがVRAM上に常駐していない場合に、ホストメモリとPCIe転送を使用します。RAM帯域幅、PCIeリンク幅、バックグラウンドアプリケーション、OSの挙動、ランタイムの選択などが結果を変える可能性があります。