- FreeToken vramは、モデルメモリ全体ではなく、柔軟に拡張・縮小できるエキスパートキャッシュとして機能します。
- システムRAMは、モデルが利用可能なVRAMを超える場合に、エキスパートプール全体を保持します。
- PCIe帯域幅は、PrefillおよびDecode中のエキスパート転送速度に大きく影響します。
- 32 GBのRAMは小規模なテストをサポートできますが、64 GB以上あれば、より柔軟に運用できます。
- 適応型キャッシュは、メモリの空き状況やルーティングパターンの変化に応じて、GPU上のデータ常駐状態を変更します。
FreeToken vramとは
FreeToken vramは、統合されたローカル推論システムの一部として理解するのが最適です。FreeTokenは、GPUメモリ、システムRAM、CPU処理、そしてそれらを接続するPCIeリンクを組み合わせて、Mixture-of-Expertsモデルを提供します。ルーティング対象となるエキスパートプール全体をホストメモリに保持しながら、利用可能なVRAMには非エキスパート重み、ランタイム状態、KVキャッシュページ、最近使用されたエキスパートを格納できます。
この設計が重要なのは、MoEモデルが非常に大きな総パラメータ数を持ちながら、各トークンではその一部だけをアクティブ化する場合があるためです。DeepSeek-V4-Flashは、284Bパラメータのモデルで、1トークンあたり約13Bのアクティブパラメータを持つモデルとして説明されています。これによりローカルでの提供がより現実的になりますが、より広範なエキスパートプールをどこかに保持する必要がなくなるわけではありません。
動画のハイライト:
- 単一GPUでのテストでは、RTX 3090を使用したFreeTokenのローカル提供が実証されています。
- DeepSeek-V4-Flashは、あるサーバー構成で毎秒およそ10~11トークンに達します。
- デスクトップクライアントは起動が簡単ですが、サーバー経由よりスループットが低くなる場合があります。
- システムRAMの容量とメモリ帯域幅は、実際のパフォーマンスに直接影響します。
| メモリ領域 | FreeTokenでの役割 | 主な制限 |
|---|---|---|
| VRAM | エキスパートキャッシュ、非エキスパート重み、KVキャッシュ、アクティベーション | 容量が限られ、他のアプリケーションと共有される |
| システムRAM | ホスト上に常駐するエキスパートプール全体 | デュアルチャネル帯域幅がDecode速度を制限する場合がある |
| CPUキャッシュとコア | 必要に応じて選択されたキャッシュミスを実行 | 実測されたホスト帯域幅に依存する |
| NVMeストレージ | 起動時にエキスパートプールを読み込む | ディスク速度がコールドスタート時間に影響する |
| PCIeリンク | RAMからVRAMへエキスパートを転送する | リンク幅と世代が転送レイテンシに影響する |
実用上の要点はシンプルです。VRAMが多いほど有利ですが、VRAMだけで対応可能なモデルの範囲が決まるわけではありません。大容量GPUを搭載していても、ホストメモリが不足しているシステムでは、フロンティア規模のモデルを読み込めない場合があります。一方、十分なRAMを備えたシステムでは、より柔軟なオフロード動作でモデルを実行できますが、応答速度は帯域幅に大きく左右されます。
VRAMをパフォーマンス予算として扱いましょう。FreeTokenはシステムRAMを基準となる保存先として利用できますが、一般的に、より大容量で高速なVRAMほどキャッシュヒット率を高め、繰り返し発生する転送を減らします。
FreeToken vramとシステムRAMの要件
FreeTokenのメモリ要件は、モデル、量子化形式、コンテキスト長、そしてエキスパートキャッシュ用に確保するVRAM容量によって異なります。利用可能な資料では、単一GPU構成におけるシステムRAMの実用的な開始点として32 GBが示されており、64 GBあればより余裕を持って運用できます。より大規模なモデルでは、これを大幅に上回る容量が必要になる場合があります。
モデル全体のフットプリントを、アクティブパラメータと混同しないようにしてください。スパースなアクティベーションは各トークンの計算量を削減しますが、非アクティブなエキスパートもホストメモリまたは別のストレージ階層に保持しておく必要があります。そのため、計算上は実行可能なモデルでも、VRAMとRAMを合わせた利用可能なメモリ予算が小さすぎると起動に失敗することがあります。
| 構成 | 実用上の位置付け | 想定用途 |
|---|---|---|
| 8 GB VRAM + 32 GB RAM | エントリーレベルのテスト構成 | 小規模なMoEモデル、または大幅に制約されたローカル提供 |
| 12~24 GB VRAM + 64 GB RAM | バランスの取れたコンシューマー向け構成 | より柔軟なエキスパートキャッシュと長時間のセッション |
| 24 GB VRAM + 96~128 GB RAM | 高性能な単一GPU構成 | ホスト側に余裕を持たせた大規模MoE実験 |
| 32 GB VRAM + 128 GB以上のRAM | 大容量ローカル構成 | より大きなエキスパートプールとコンテキスト拡張の余地 |
| 48~96 GB VRAM + 数百GBのRAM | ワークステーション構成 | 非常に大規模なNVFP4モデルなど、フロンティア規模のデモンストレーション |
コンテキストが長くなると、メモリの配分も変化します。エージェントセッションが長くなるにつれてKVキャッシュの需要は増加する一方、エキスパートのワーキングセットは比較的安定している場合があります。そのためFreeTokenは、初回起動時の割り当てを固定のものとして扱うのではなく、KVキャッシュページとエキスパートキャッシュスロットの配分を調整する必要があります。
2026年に公開された論文FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Executionでは、この柔軟なメモリアプローチが説明されています。GPU上のエキスパートキャッシュは、エンジンを再起動したり、CPU上に常駐するエキスパートプール全体を再読み込みしたりすることなく、スケジューラの安全なタイミングで再構築できます。
VRAM容量
- アクティブなエキスパートデータとランタイム状態を保存
- 容量が大きいほど常駐できるデータが増える
- デスクトップアプリケーション用の空きを確保する
RAM容量
- エキスパートプール全体を保持
- 読み込めるモデルを決定する
- 余裕があると長時間のセッションに役立つ
メモリ帯域幅
- CPU側のエキスパート処理を制御
- PCIe転送の競合に影響する
- DDR5はホスト側の処理経路を改善できる
VRAM容量だけで互換性を判断しないでください。モデル、ランタイム、KVキャッシュ、ホスト常駐エキスパートを同時に収容できない場合、FreeTokenは利用可能なメモリが不足していると報告することがあります。
FreeToken vramのセットアップ手順
以下の手順に従って、ローカルFreeToken環境を準備してください。利用可能なテスト資料ではデスクトップアプリケーションがベータ版ソフトウェアとして説明されているため、正確なインターフェースや対応モデルの一覧は変更される可能性があります。
利用可能なメモリを確認する
モデルを起動する前に、不要なGPUアプリケーションを終了し、利用可能なVRAMとシステムRAMを確認します。ブラウザ、録画ソフト、ゲーム、仮想マシン、デスクトップコンポジターなどによって、FreeTokenが利用できるメモリが減少する場合があります。
対応モデルを選択する
VRAMとRAMを合わせたメモリ予算に合うMoEモデルから始めます。DeepSeek-V4-Flashは、スパースアクティベーションによって、ホストメモリへのオフロードを利用しながら、1台のコンシューマー向けGPUで大規模モデルを動かせるため、適切なテストケースです。
適切なビルドをインストールする
使用しているオペレーティングシステムに適したパッケージを選択します。利用可能な資料では、Windows、Ubuntu AppImage、Arch Linux、デスクトップアプリケーションの経路が参照されています。グラフィックスドライバーとCUDA環境が、選択したビルドと互換性を持つようにしてください。
APIサーバーを起動する
モデルを読み込み、インターフェースにAPIサーバーの準備完了が表示されるまで待ちます。これはランタイムの初期セットアップが完了し、互換性のあるクライアントからのリクエストを受け付けられる状態になったことを示します。
チャットクライアントを接続する
Open WebUIなどのインターフェース、または別の互換エンドポイントを使用します。まず短いプロンプトでテストし、その後、コンテキスト長を増やしたり最大推論設定を有効にしたりする前に、トークン速度、メモリ使用量、安定性を確認します。
| セットアップ確認項目 | 推奨アクション | 重要な理由 |
|---|---|---|
| 利用可能なVRAM | GPUを使用する他のアプリケーションを終了する | エキスパートキャッシュとKV状態のための空きを確保できる |
| ホストRAM | 柔軟性のため64 GB以上を推奨 | メモリ不足による失敗を減らせる |
| RAM速度 | 対応している中で最も高速かつ安定したメモリを使用する | ホスト帯域幅がCPU処理と転送に影響する |
| PCIe接続 | リンクの世代と幅を確認する | ノートPCのx8リンクはデスクトップのx16リンクより遅い場合がある |
| クライアント接続 | テスト前にAPIの準備完了を確認する | モデル読み込みエラーとエンドポイントエラーの混同を防げる |
初回起動は、最終的なパフォーマンス結果ではなく、基準値を測定するテストとして扱うべきです。メモリ使用量、プロンプト処理時間、Decode速度、そして複数のリクエストにわたってモデルが安定して動作するかを記録してください。
短いプロンプトから始め、API接続を確認し、複数の応答を測定してから、コンテキスト長を増やしたり集中的な推論を有効にしたりしてください。
パフォーマンス要因とキャッシュ動作
FreeTokenのパフォーマンスは、頻繁に使用されるエキスパートをどれだけ効果的にVRAMに保持できるか、そしてキャッシュミスをどのように処理するかに左右されます。Decode中、ルーティングされたエキスパートがすでに常駐している場合もあれば、ホストメモリから移動させる必要がある場合もあります。FreeTokenは共有のLRU方式エキスパートキャッシュを使用するため、直近のルーティング動作が今後の常駐状態に影響する可能性があります。
ランタイムは、キャッシュミスをGPU転送とCPUによる直接実行に振り分けます。この分割は、単一の固定ルールではなく、実測されたホスト側の処理帯域幅とピン留め転送帯域幅に基づいて行われます。この方式が有用なのは、PCIe性能に優れたデスクトップと、リンク幅の狭いノートPCでは、異なる配分が有効になる可能性があるためです。
| パフォーマンス要因 | FreeTokenへの影響 | 最適化方法 |
|---|---|---|
| VRAMキャッシュサイズ | 常駐できるエキスパートが増えるとミスを減らせる | 十分なGPUメモリを確保する |
| PCIe帯域幅 | ホストからGPUへのエキスパート移動を制御する | 可能であればフルスピードのx16リンクを使用する |
| ホスト帯域幅 | CPU実行と転送の共有を制限する | より高速なデュアルチャネルメモリ、または高帯域幅メモリを使用する |
| キャッシュ局所性 | ルーティングされたエキスパートがヒットする頻度を決める | 可能な限り関連するセッションをウォーム状態に保つ |
| 同時実行中のアプリケーション | ランタイムのメモリ予算を減らす | GPUとRAMを大量に使用する処理を終了する |
PrefillとDecodeでは動作が異なります。Prefillでは大きなプロンプトを処理するため、エキスパートプールの広範囲にわたる移動が必要になる場合があります。FreeTokenは、利用可能なメモリ予算が許す場合、フルレイヤーのダブルバッファリングを使用して、エキスパート転送とGPU計算をオーバーラップさせます。Decodeはより段階的に進みますが、キャッシュミスが繰り返されると応答性が低下する可能性があります。
提供された資料のテストでは、単一のRTX 3090構成が、あるサーバー側のシナリオで毎秒約10.5トークンを生成しました。別の構成で行われたデスクトップクライアントのテストでは、毎秒約8.8トークンに達しました。これらの数値は普遍的なベンチマークではなく、特定の構成に依存する参考値です。保証値としてではなく、目安として利用してください。
長時間セッションを開始する前に:
- 利用可能なVRAMとシステムRAMを確認する
- GPUメモリを使用するアプリケーションを終了する
- 選択したモデルがホストメモリの予算に収まることを確認する
- APIサーバーが準備完了状態になることを確認する
- 基準となるトークン速度とメモリ使用量を記録する
1つの応答だけに頼らず、複数のプロンプトを比較してください。エキスパートのルーティングはリクエストごとに変化するため、アクティブなエキスパート、コンテキスト長、クライアントのオーバーヘッドによってトークン速度が変わる場合があります。
モデルの互換性とトラブルシューティング
すべてのモデルがFreeTokenで同じように動作するわけではありません。参照されたテストでは、密結合型のQwen 3.8 27B BF16構成が、ある環境で起動に失敗し、予期しないエンジン終了が発生しました。これは、メモリ容量だけでなく、モデルの互換性、量子化形式、ランタイムのサポートも重要であることを示しています。
大規模モデルは、単純に利用可能なRAMが不足しているという理由でも失敗します。あるテストでは、GLM-5.2 NVFP4構成に、利用可能な予算を超えて数百GBの追加システムメモリが必要であることが示されました。このようなモデルには、より大規模なワークステーション構成が必要になる場合があります。
| 症状 | 考えられる原因 | トラブルシューティングの方向性 |
|---|---|---|
| モデルの読み込みに失敗する | VRAMとRAMの合計が不足している | より小さなモデルを選ぶか、ホストメモリを増設する |
| APIが準備完了にならない | ドライバー、パッケージ、またはモデルの互換性の問題 | ログを確認し、対応ビルドであることを確認する |
| Decode速度が予想より遅い | ホスト帯域幅の不足、またはキャッシュミスの頻発 | 他の処理による負荷を減らし、メモリ帯域幅をテストする |
| デスクトップクライアントの速度が遅い | クライアントのオーバーヘッド、または異なるランタイム経路 | サーバー構成またはAPI構成と比較する |
| モデルが予期せず終了する | ベータ版の制限、または未対応形式 | 別のチェックポイントを試し、ランタイムログを確認する |
| アプリケーションを開いた後に性能が低下する | VRAMの予算が減少している | GPU負荷の高いアプリケーションを終了し、必要に応じて再起動する |
以下の管理された手順でトラブルシューティングを行ってください。
- 同じモデルを短いプロンプトでテストする。
- 失敗が読み込み中に発生したのか、生成中に発生したのかを確認する。
- モデルが対応している量子化形式を使用しているか確認する。
- 他のアプリケーションを終了する前後で利用可能なメモリを比較する。
- 再現可能なエンジンエラーを報告する際は、サーバーログを保存する。
最も確実な方法は、一度に1つの変数だけを変更することです。モデル、クライアント、オペレーティングシステム用パッケージ、メモリ割り当て、推論モードを同時に変更すると、実際の原因を特定することが難しくなります。
モデルが失敗した場合は、まず容量の問題とソフトウェア互換性の問題を切り分けてください。VRAMやRAMの予算を増やしても、未対応のモデル形式やランタイムの不具合を解決することはできません。
FreeToken vram FAQ
Q: FreeToken vramは何をしますか?
FreeTokenは、利用可能なVRAMをエキスパート、ランタイム状態、非エキスパート重み、KVキャッシュデータのための柔軟なキャッシュとして使用します。モデルがGPU容量を超える場合、エキスパートプール全体をシステムRAMに保持できます。
Q: FreeTokenではシステムRAMをどのくらい使用すべきですか?
利用可能なテスト結果では、一部の単一GPU実験では32 GBが開始点として示され、64 GBがより余裕のある目標とされています。大規模なモデルでは、96 GB、128 GB、または数百GBが必要になる場合があります。
Q: 単一のRTX 3090で大規模なMoEモデルを実行できますか?
単一のRTX 3090でも、システムメモリへのオフロードを利用して特定の大規模MoE構成を提供できます。ただし、速度はモデル、量子化、ホスト帯域幅、PCIe接続、キャッシュ動作に左右されます。
Q: FreeTokenの性能がベンチマークより低いのはなぜですか?
トークン速度は、エキスパートのルーティング、キャッシュ常駐状態、プロンプト長、メモリ帯域幅、クライアントのオーバーヘッド、システムリソースを使用する他のアプリケーションによって変化します。結論を出す前に、同じハードウェアとワークロードで比較してください。
FreeTokenは、VRAM、システムRAM、CPU実行、PCIe転送を連携させることで、ローカルMoEモデルの提供をより身近なものにします。システム全体のメモリ予算を計画し、そのうえでキャッシュ動作と帯域幅を調整しましょう。