- FreeTokenの1秒あたりのトークン数は、GPUキャッシュヒット、システムメモリ、PCIe帯域幅に左右されます。
- RTX 3090のテストでは、ローカル環境でデコード時に約10~11トークン/秒を達成しました。
- デスクトップクライアントの結果では、同等のテストで約8.8トークン/秒を測定しました。
- モデルの選択は重要です。MoEモデルと密モデルでは、メモリ要件が大きく異なるためです。
- 最も効果的な改善は通常、より高速なメモリ、より多くの使用可能RAM、バックグラウンド負荷の削減によって得られます。
FreeTokenの1秒あたりのトークン数:この指標の意味
FreeTokenの1秒あたりのトークン数は、プロンプト処理後にローカルで提供される言語モデルが出力を生成する速度、つまりデコードスループットを表します。これは、初回トークンまでの時間、プロンプト処理速度、合計応答時間とは異なります。インタラクティブなチャットでは、回答が表示されている間にユーザーが通常実感するのがデコードスループットです。
FreeTokenは、大規模なMixture-of-Expertsモデル向けのエッジネイティブなサービングシステムです。その設計では、エキスパート全体をホストメモリに保持し、利用可能なGPUメモリを柔軟なエキスパートキャッシュとして使用します。その結果、性能はグラフィックスカードだけでなく、マシン全体に依存します。
動画のハイライト:
- 単一のRTX 3090環境で、約10~11デコードトークン/秒を生成しました。
- 後のテストでは、デスクトップクライアントが約8.8トークン/秒を報告しました。
- システムRAMの容量と帯域幅が、主要な性能要因として確認されました。
- バックグラウンドアプリケーションは、使用可能なVRAMを減らし、スループットに影響する可能性があります。
| 指標 | 意味 | 重要な理由 |
|---|---|---|
| 1秒あたりのデコードトークン数 | 生成される出力速度 | 会話の応答性を示す |
| プロンプト処理速度 | 入力トークンの処理速度 | 長いプロンプトの開始遅延に影響する |
| 初回トークンまでの時間 | 出力開始前の遅延 | エージェントや大規模コンテキストで重要 |
| 合計応答時間 | リクエスト全体の所要時間 | プロンプト処理とデコードのコストを合算する |
公開されているFreeTokenの研究論文では、システムが測定されたホストメモリとPCIeの帯域幅に応じて実行方法を適応させることが説明されています。同じGPUを搭載した2台のコンピューターでも、結果に明確な差が生じるのはこのためです。
1秒あたりのトークン数は、固定された製品仕様ではなく、ワークロードの測定値として扱ってください。モデル、コンテキスト長、思考モード、メモリ条件を変更すると、結果は大きく変わる可能性があります。
構成別に見るFreeTokenの実測性能
利用可能なテストでは、サーバー側とデスクトップクライアントの測定値に実用上の差があることが示されています。単一のRTX 3090では、通常のチャットプロンプトでDeepSeek V4 Flashが毎秒10~11トークン付近を維持しました。別のデスクトップクライアントの実行では、毎秒8.8トークンが報告されました。これらの数値は参考値として有用ですが、普遍的な評価値ではありません。
この差は、クライアントのオーバーヘッド、OSの挙動、モデル設定、バックグラウンドプロセス、測定のばらつきなどから生じる可能性があります。思考モードもワークロードを変化させます。最大限の推論で生成された回答は、短く直接的な回答と比べて、表示上の出力速度が低くなり、完了までの経路が長くなる場合があります。
| 構成 | モデルまたはモード | 報告されたデコード速度 | 実用上の見方 |
|---|---|---|---|
| 単一のRTX 3090 | DeepSeek V4 Flash、ローカルサーバー | 約10~11 tok/s | インタラクティブなチャットに適している |
| デスクトップクライアント | DeepSeek V4 Flash、思考モード有効 | 約8.8 tok/s | セットアップは簡単だが、結果はやや遅い |
| 単一のRTX 4090との比較 | DeepSeek V4 Flash | 固定された結果なし | ハードウェア比較の目標として利用する |
| RTX PRO 6000の研究向け構成 | GLM-5.2 NVFP4 | 14.9 tok/s | 最先端規模のデモンストレーション |
| RTX 5090の研究向け構成 | DeepSeek V4 Flash | 22~25 tok/s | 研究ベンチマークであり、3090で期待できる値ではない |
研究評価で新しいハードウェアの結果が高くなっているのは、最適化されたサービングランタイム、測定された帯域幅スケジューリング、特定のベンチマーク条件が使用されているためです。これらの数値を、そのまま一般的なデスクトップ環境の推定値として使用しないでください。
インタラクティブチャット
通常のローカル会話では、プロンプトとモデルの挙動によって異なりますが、8~11 tok/s程度でも応答性が高く感じられます。
エージェントワークロード
ツール呼び出しや長いプロンプトの繰り返しでは、デコード速度だけでなく初回トークンまでの時間がより重要になります。
推論モード
ハードウェアが変わらなくても、長時間の思考によって表示上の速度が低下し、完了までの合計時間が増加することがあります。
有効な比較方法は、各構成で同じモデル、プロンプト形式、コンテキストサイズ、生成設定を使ってテストすることです。1回の完了結果だけに頼らず、複数の応答を記録してください。MoEのルーティングはトークンごとに変化するため、個々の結果にはばらつきが生じます。
デスクトップクライアントの結果、サーバー側の測定値、研究ベンチマークでは、異なるランタイムや設定が使われている可能性があります。すべてのテスト条件が一致していない限り、方向性の比較にとどめてください。
スループットを変化させるハードウェア要因
FreeTokenでは、性能に関する議論の多くが、GPUの生の計算能力からメモリ転送へと移ります。Mixture-of-Expertsモデルは、各トークンでパラメータの一部だけを有効化しますが、エキスパート全体をシステムメモリ上で利用可能な状態に保つ必要がある場合があります。エキスパートがGPUにキャッシュされていない場合、ランタイムはPCIe経由で転送するか、CPU上で直接実行できます。
そのため、システムメモリの容量が不可欠になります。テストでは、一部のローカル構成では32GBが開始点になり得る一方、64GBあればより余裕を持てることが示されています。より大きなモデルでは、さらに多くのメモリが必要になる可能性があります。研究資料では、特に最先端規模のモデルについて、数百GBのホストメモリを必要とする構成が説明されています。
| ハードウェア要因 | FreeTokenへの影響 | 推奨される見方 |
|---|---|---|
| GPU VRAM | エキスパートキャッシュの容量を決める | VRAMが多いほどキャッシュミスを減らせる可能性がある |
| システムRAM容量 | ホスト上に常駐するエキスパートを保持する | 使用可能なRAMが不足するとロードできない |
| RAM帯域幅 | CPU実行と転送にデータを供給する | 高速なメモリはデコード性能を向上させる可能性がある |
| PCIeリンク幅 | エキスパートの転送速度を制御する | 一般にx16はx8より余裕がある |
| バックグラウンドでのGPU使用 | 使用可能なVRAMを減らす | ブラウザ、録画ツール、ゲームなどが干渉する可能性がある |
| ストレージ速度 | 起動とモデルのロードに影響する | NVMeストレージは初回ロードの遅延を短縮できる |
研究論文では、エキスパート転送におけるプラットフォームレベルの差が概算されています。PCIe 4.0 x16を使用するRTX 4090およびRTX 3090クラスのシステムでは、プリフィル中に大規模なエキスパートセットを移動するのに数秒かかることがあります。一方、より狭いノートPC向けリンクではさらに時間がかかる可能性があります。デコード時の挙動は異なり、キャッシュとCPUの同時実行によって転送コストの一部が隠れる場合があります。
単一GPUのFreeTokenシステムでは、まず使用可能なRAM容量を優先し、次にメモリ帯域幅とPCIeの条件を確認してください。GPUの計算能力だけを追加しても、ホストメモリのボトルネックが解消されるとは限りません。
クリーンなテスト環境も重要です。不要なGPU負荷の高いソフトウェアを終了し、複数のモデルサービスを同時に実行することを避け、OS用に十分なRAMを確保してください。ランタイムがRAMまたはVRAM不足を報告している場合、1秒あたりのトークン数への期待値を下げてもロード問題は解決しません。まずモデル構成がリソース内に収まる必要があります。
FreeTokenベンチマーク環境の構築手順
この手順を使って、信頼できるローカル環境のベースラインを測定してください。目的は、一時的に非常に高い数値を追いかけることではなく、変化の原因を説明できる再現可能なテストを作ることです。
マシン情報を記録する
GPUモデル、VRAM、システムRAM、RAMの世代と速度、OS、PCIeリンク、ストレージの種類を書き留めます。これらの詳細は、結果の違いの多くを説明します。
1つのモデルを選ぶ
比較するすべての構成で、同じ対応モデルから始めます。利用可能な単一GPUテストではDeepSeek V4 Flashが最も明確な基準ですが、密モデルでは挙動が異なる可能性があります。
クリーンなセッションを準備する
競合するGPUワークロードやバックグラウンドの推論サービスを終了します。モデル、コンテキストサイズ、温度、思考モード、サンプリング設定を統一します。
ランタイムをウォームアップする
結果を記録する前に、短いプロンプトを1つ送信します。最初の応答にはロードやキャッシュのウォームアップにかかるコストが含まれる場合があり、定常状態のデコード速度を示さないことがあります。
複数回の実行結果を平均する
比較可能なプロンプトを少なくとも3回実行し、表示されたデコード速度、プロンプト処理速度、初回トークンまでの時間を記録します。最高値ではなく、中央値または平均値を使用してください。
| テスト変数 | 固定する条件 | 記録例 |
|---|---|---|
| モデル | 同じチェックポイントと量子化 | DeepSeek V4 Flash |
| プロンプト | 近い長さとタスク | 短い事実確認の質問 |
| 生成 | 同じ思考モードとサンプリングモード | 思考モード有効または無効 |
| ランタイム | 同じクライアントまたはサーバー経路 | デスクトップクライアントまたはAPIサーバー |
| 結果 | 複数回の実行を記録 | 10.5、10.1、10.8 tok/s |
デスクトップクライアントとサーバー接続インターフェースを比較する場合は、それぞれを分けてテストしてください。利用可能な結果からは、デスクトップ経路は便利である一方、測定値が低くなる可能性が示唆されています。これは、すべてのワークロードでモデルが自動的に遅いという意味ではありません。インターフェースとランタイム経路を記録すべきだという意味です。
表示された速度と応答条件の両方を記録してください。モデル、コンテキスト、ランタイム、思考モードの詳細がない数値は、再現や比較が困難です。
最適化チェックリストと一般的な制限
FreeTokenの最大の強みは、GPUメモリ、ホストメモリ、CPU実行、PCIe転送を連携させることにあります。そのため、実用的なチューニングでは、モデルを変更したり高い出力速度を期待したりする前に、回避可能なリソース競合を取り除くことが重要です。
パフォーマンスチェックリスト:
- モデルが使用可能なシステムRAMとVRAMの範囲内に収まることを確認する
- システムで利用可能な、安定して動作する最速のRAM構成を使用する
- ベンチマーク前に不要なGPU負荷の高いアプリケーションを終了する
- モデル、プロンプト長、思考設定を統一する
- ウォームアップ後のテストを複数回実行し、1秒あたりのトークン数の中央値を記録する
| 症状 | 考えられる原因 | 最初に行う対処 |
|---|---|---|
| モデルが起動しない | 使用可能なRAMまたはVRAMが不足している | より小さいモデルを選ぶか、メモリを増設する |
| 速度の変動が大きい | エキスパートのルーティングとキャッシュミス | 複数回実行して平均する |
| デスクトップの結果が低い | クライアントまたはランタイムのオーバーヘッド | サーバー経路と比較する |
| 初期遅延が長い | プリフィルまたはエキスパートのロードコスト | 初回トークンまでの時間を個別に測定する |
| 他のアプリケーションで推論が遅くなる | GPUまたはメモリリソースの共有 | バックグラウンドのワークロードを終了する |
利用可能なテストでは、ソフトウェアの成熟度も考慮すべき要素として挙げられています。FreeTokenはベータ版ソフトウェアと説明されており、テスト中にある密モデルのQwen構成が予期せず終了しました。モデルの起動失敗は、1秒あたりのトークン数の結果ではなく、互換性またはリソースの問題として扱うべきです。
トラブルシューティングでは、ログを確認し、モデルが対応している形式を検証し、OSや他のアプリケーションの使用分を考慮したうえで利用可能なメモリを確認し、ランタイムを再起動してテストを繰り返してください。1回の起動失敗を、すべてのモデル構成に互換性がない証拠だと解釈しないでください。
概念上は収まるモデルでも、精度形式、ランタイムのサポート、メモリ登録、利用可能なホストリソースなどが原因で失敗する場合があります。速度を比較する前に互換性を確認してください。
Q: RTX 3090でFreeTokenの1秒あたりのトークン数は、どの程度なら良い結果ですか?
利用可能な単一GPUテストでは、DeepSeek V4 Flashで約10~11デコードトークン/秒に到達しました。これは実用的な参考値であり、保証された評価値ではありません。
Q: デスクトップクライアントが約8.8トークン/秒と報告したのはなぜですか?
デスクトップクライアントでは、異なるランタイムの挙動、インターフェースのオーバーヘッド、メモリ条件、設定が使用されている可能性があります。この結果はインタラクティブなローカル推論としては同程度の傾向にありますが、条件を一致させて比較する必要があります。
Q: システムRAMを増やせば、必ず1秒あたりのトークン数が増えますか?
RAM容量が主に決めるのは、モデルをロードできるかどうかと、どれだけのキャッシュ領域を確保できるかです。容量が十分になった後は、スループットに対してRAM帯域幅やPCIeの挙動がより重要になる場合があります。
Q: 同じGPUを搭載した2台のコンピューターで性能が異なるのはなぜですか?
FreeTokenは、エキスパートがVRAM上に常駐していない場合に、ホストメモリとPCIe転送を使用します。RAM帯域幅、PCIeリンク幅、バックグラウンドアプリケーション、OSの挙動、ランタイムの選択などが結果を変える可能性があります。