- FreeToken deepseek により、一般向けハードウェア上で大規模なDeepSeek MoEモデルをローカル提供できます。
- DeepSeek-V4-Flash はスパースなエキスパート活性化を使用しますが、それでも大量のシステムメモリを必要とします。
- 単一GPU構成 は、VRAM、RAM、メモリ帯域幅のバランスが取れていれば、良好に動作します。
- ベータ版ソフトウェア では、特に大規模な密モデルのチェックポイントで互換性の問題が発生する可能性があります。
- 最初の一歩として最適な方法:対応する量子化モデルを使用し、コンテキスト長を増やす前にメモリ使用量を確認してください。
FreeToken deepseek:システムの仕組み
FreeTokenは、GPU、CPU、ホストメモリ、およびそれらを接続するPCIe接続をまたいで、大規模なMixture-of-Expertsモデルを提供するためのエッジネイティブ推論システムです。DeepSeekで最も有用なシナリオはDeepSeek-V4-Flashです。このモデルでは、各トークンに対してモデル内の一部のエキスパートだけが活性化されますが、完全なエキスパートプールは一般的なコンシューマー向けGPUメモリよりはるかに大きくなります。
すべてのエキスパートをVRAMに常駐させる代わりに、FreeTokenはルーティング対象となるエキスパートプール全体をホストメモリに保持し、利用可能なGPUメモリを柔軟なキャッシュとして使用します。ランタイムは必要に応じてエキスパートをGPUへ移動したり、キャッシュにないエキスパートの一部をCPU上で直接実行したりできます。これにより、モデル全体をVRAMに保持できないハードウェアでもローカルでの実験が可能になります。
動画のハイライト:
- RTX 3090クラスの構成による単一GPUでのDeepSeek-V4-Flashテスト
- デスクトップアプリケーションとローカルエンドポイントのワークフロー
- 対話型チャットのためのOpen WebUI接続
- あるサーバー構成で報告された、毎秒約10~11トークンのデコード性能
- メモリ制限、ベータ版の挙動、モデル互換性に関する警告
研究設計では、相互に補完する2つのアイデアを採用しています。Prefill中、FreeTokenはフルレイヤーのダブルバッファリングによって、エキスパート転送とGPU計算をオーバーラップさせます。Decode中は共有LRUエキスパートキャッシュを使用し、最近ルーティングされたエキスパートがGPU上に残りやすくします。
また、このシステムは公称仕様だけに依存せず、対象マシンを実測します。ホストメモリ帯域幅とPCIe転送帯域幅によって、キャッシュにないエキスパートのうち、GPUへコピーすべき数とCPUで直接処理すべき数が決まります。
| コンポーネント | FreeTokenでの役割 | 重要な理由 |
|---|---|---|
| GPU VRAM | 非エキスパート重みと動的なエキスパートキャッシュを保存 | 利用可能なVRAMが多いほどキャッシュミスを減らせる |
| システムRAM | エキスパートプール全体を保持 | 大規模MoEモデルには大量のホストメモリが必要 |
| PCIeリンク | キャッシュにないエキスパートをGPUへ転送 | 帯域幅がDecodeとPrefillのレイテンシに影響する |
| CPU | 選択されたキャッシュミスのエキスパートを実行 | ホストメモリの帯域幅に余裕がある場合に有効 |
| LRUキャッシュ | 最近使用されたレイヤーとエキスパートの組み合わせを追跡 | トークン単位で変化するルーティングに適応する |
FreeTokenは小型化されたモデルではなく、提供用のランタイムとして捉えてください。リソースの連携方法は改善しますが、基盤となるチェックポイントに必要なメモリ量そのものをなくすわけではありません。
DeepSeekモデルとハードウェア要件
最も重要な区別は、アクティブパラメータと保存される総パラメータの違いです。DeepSeek-V4-Flashは、284BパラメータのMoEモデルで、トークンごとのアクティブパラメータは約13Bと説明されています。スパースな活性化によって各トークンに必要な計算量は減りますが、エキスパート全体は依然としてシステム内のどこかに格納されている必要があります。
参考資料では、論文のFP4展開における有力なターゲットとしてRTX 5090が挙げられています。一方、実用テストでは、ホストメモリへのオフロードを利用してRTX 3090クラスのマシン上でもDeepSeek-V4-Flashを動作させています。これらは異なる構成であるため、結果を相互に置き換え可能なベンチマークとして扱うべきではありません。
| 構成レベル | GPU例 | メモリの目安 | 想定用途 |
|---|---|---|---|
| 入門実験 | RTX 3090クラスGPU | システムRAMは最低32 GB、64 GBならより快適 | 控えめな設定でのローカルチャット |
| 実用的なデスクトップ | RTX 4090クラスGPU | モデルに応じてシステムRAM 64~128 GB | より高速なオフロードと長時間のセッション |
| ハイエンドコンシューマー | RTX 5090クラスGPU | 大容量RAMプールと対応する量子化 | キャッシュ容量の向上と転送負荷の軽減 |
| 最先端ワークステーション | RTX PRO 6000 Blackwell、96 GB | ワークステーション向けのメモリ構成 | GLM-5.2のデモンストレーションと大規模なワークロード |
動画の単一GPUテストでは、システムメモリ32 GBが開始地点になり得る一方、64 GB以上あればより安全な動作余裕を確保できることが示唆されています。研究論文でも、GPUを十分に活用した後は、システムRAM、メモリ速度、PCIe帯域幅が制限要因になる可能性が強調されています。
DDR5は、古いデュアルチャネルDDR4プラットフォームに比べて大きな利点をもたらす可能性があります。これは、ホスト側のエキスパート実行とPCIe転送がメモリ帯域幅を競合するためです。ただし、具体的な結果は、マザーボード、メモリ構成、CPU、OS、実行中のアプリケーションによって異なります。
VRAM容量
空きVRAMが多いほど、FreeTokenはより多くのエキスパートとKVキャッシュの状態を保持できます。テスト時には、ブラウザ、録画ツール、その他のGPU負荷が高いアプリケーションを終了してください。
ホストメモリ
オフロード中、システムRAMにはエキスパートプール全体が保存されます。搭載容量だけでなく、使用可能なメモリを確認してください。
帯域幅のバランス
PCIeとRAMの帯域幅は、最適なCPU-GPU分担に影響します。FreeTokenはこれらのリソースをプロファイリングし、ランタイム戦略を選択します。
必要量をアクティブパラメータだけから見積もらないでください。スパースモデルはトークンごとに少数のエキスパートサブセットだけを計算できますが、それでも非常に大きな常駐重みプールを必要とする場合があります。
FreeToken DeepSeekセットアップのワークフロー
デスクトップのワークフローは、手動で行うエンジン設定の量を減らすように設計されています。利用可能な配布形式はOSによって異なり、参考テストではWindows、Ubuntu、AppImage、Arch Linux、およびデスクトップアプリケーションの手順が扱われています。
対応するモデル形式を使用し、開始前に必要なホストメモリが利用可能であることを確認してください。選択したチェックポイントが現在のハードウェアの予算を超える場合、FreeTokenは使用可能なRAMやVRAMが不足していると報告することがあります。
対応するビルドをインストールする
使用しているOSとアーキテクチャに一致するFreeTokenのビルドを選択してください。Linuxでは、ディストリビューションに適したパッケージまたはAppImageを使用します。GPUドライバーとCUDA環境を、アプリケーションの要件に合わせてください。
メモリとアプリケーションを準備する
不要なGPUワークロード、録画ソフトウェア、ゲーム、ブラウザのタブを終了してください。エキスパートプール全体に加えて、OSやその他のサービスが使用できるだけのシステムRAMが残っていることを確認します。
対応するエンドポイントを選択する
アプリケーションのインターフェースからモデルエンドポイントを設定します。実演されたワークフローでは、エンドポイントとしてHugging Faceを使用し、ローカルサーバーをOpen WebUIに接続してチャットを行います。
DeepSeek-V4-Flashを読み込む
より大きな密モデルではなく、対応するDeepSeek-V4-Flashビルドから始めてください。アプリケーションの読み込みが完了するまで待ち、APIサーバーが準備完了を報告することを確認します。
短いプロンプトを測定する
まず簡単なリクエストを送信し、トークン速度、メモリ使用量、応答の安定性を確認します。複数の変数を一度に変更するのではなく、コンテキストや推論設定を少しずつ増やしてください。
APIサーバーの準備が完了していても、ダウンロードしたすべてのモデルが正常に動作するとは限りません。テストノートでは、Qwen 3.8 27B BF16構成の起動に失敗した例が説明されています。これは、モデルのサポート状況とメモリへの適合性を別々に確認する必要があることを示しています。
| セットアップ確認項目 | 合格条件 | 失敗した場合 |
|---|---|---|
| ドライバーとランタイム | GPU初期化エラーなしでアプリケーションが起動する | 対応環境に更新または適合させる |
| ホストメモリ | FreeTokenが十分な使用可能RAMとVRAMを報告する | アプリケーションを終了するか、より小さいビルドを選ぶ |
| モデルサポート | 選択したチェックポイントが正常に起動する | 公式に対応している形式をテストする |
| APIステータス | サーバーが準備完了を報告する | ログを確認してエンジンを再起動する |
| チャットエンドポイント | Open WebUIが応答を受信する | エンドポイントのアドレスとモデル選択を確認する |
対応するDeepSeek構成の中で最も小さいものを使用し、短いプロンプトを送信してください。最大推論設定や長いコンテキストのワークロードを有効にする前に、メモリ使用量を記録しましょう。
パフォーマンス、キャッシュ、チューニング
パフォーマンスは、エキスパートの局所性、キャッシュ容量、ホスト帯域幅、ワークロードの相互作用によって決まります。エージェント型ワークロードではコンテキストを繰り返し参照し、アクティブなエキスパートのパターンが変化するため、短い1ターンのプロンプトと、複数ターンのコーディングやツール利用セッションでは結果が異なる場合があります。
参考にしたRTX 3090クラスのテストでは、DeepSeek-V4-Flashはサーバー側のワークフローで毎秒約10~11トークンに達しました。あるテストでは、デスクトップクライアントの実測値は毎秒約8.8トークンと、より低い結果になりました。これらの数値は構成固有のものであり、普遍的な目標値ではありません。
研究評価では、より新しいハードウェアでさらに高い結果が報告されています。RTX 5090では、FreeTokenは一覧にあるエージェント型ワークロード全体で、DeepSeek-V4-Flashに対して毎秒約22~25トークンを維持しました。同じ論文では、静的配置戦略と比較して、グローバルLRUキャッシュのほうがミス率が低いことも報告されています。
| チューニングの優先度 | 対策 | 効果 |
|---|---|---|
| 1 | 読み込み前にVRAMを解放する | エキスパートキャッシュに割り当てられる容量が増える |
| 2 | より高速なホストメモリを使用する | CPU実行と転送の共有を改善する |
| 3 | より広いPCIeリンクを優先する | エキスパートの移動時間を短縮する |
| 4 | 中程度のコンテキストから始める | KVキャッシュの増加に対応する余裕が生まれる |
| 5 | サーバー経路とデスクトップ経路を比較する | クライアントのオーバーヘッドとランタイムの違いが分かる |
FreeTokenのキャッシュは柔軟に変化します。これは、セッション中にエキスパートの保存とKVキャッシュの最適な配分が変わるためです。長い会話ではKVキャッシュのメモリ消費が増え、ルーティングパターンが変化すると、保持する価値のあるエキスパートも変わります。最初のリクエストで良好に動作した構成でも、数ターン後には調整が必要になる場合があります。
q-starポリシーは、キャッシュミスをGPU転送とCPU実行に分配します。簡単に言えば、PCIe帯域幅が強いマシンでは、より多くのミスをVRAMへコピーできます。一方、ホストメモリ帯域幅が相対的に強いマシンでは、より多くのミスをその場で処理できます。FreeTokenはデプロイ時にこれらの値をプロファイリングします。
同一のモデル、量子化、プロンプト、コンテキスト長、推論設定、バックグラウンドアプリケーションで比較してください。これらの変数を一致させない限り、異なるランタイムの毎秒トークン数を直接比較することはできません。
各ベンチマークの前に確認すること:
- 同じDeepSeekモデルと量子化を使用していることを確認する
- 使用可能なVRAMとシステムRAMを記録する
- 競合するGPUおよびメモリワークロードを終了する
- 同じプロンプトとコンテキスト長を使用する
- スループット、起動時間、応答の安定性を追跡する
制限事項とトラブルシューティングFAQ
FreeTokenによってローカルでのMoE提供はより利用しやすくなりますが、ソフトウェアの成熟度やハードウェアの状態には依然として敏感です。参考資料でテストされたアプリケーションはベータ版ソフトウェアとされており、ダウンロードしたすべてのモデルが正常に起動するとは限りません。
モデルが予期せず終了した場合は、基本的な確認から始めてください。モデル形式を確認し、サーバーログを調べ、使用可能なメモリを確認し、より小さく対応済みのチェックポイントをテストします。起動に失敗したからといって、GPUの性能不足だと決めつけないでください。互換性、ドライバーの挙動、ピン留めメモリ、ランタイムのサポート状況などが関係している可能性もあります。
FreeTokenの研究論文では、技術設計、評価方法、帯域幅適応型実行、セマンティック対応キャッシュ、柔軟なメモリ管理について解説されています。
Q: FreeToken deepseekは何に使われますか?
GPU実行、ホストメモリへの保存、PCIe転送、CPU側でのエキスパート実行を組み合わせて、大規模なDeepSeek MoEモデルをローカルで提供するために使われます。
Q: DeepSeek-V4-FlashはRTX 3090一台で動作しますか?
参考にした実用テストでは、システムメモリへのオフロードを利用し、単一のRTX 3090クラス構成でDeepSeek-V4-Flashを実行しています。結果は、使用可能なRAM、モデル形式、帯域幅、アプリケーション構成に大きく左右されます。
Q: システムRAMはどのくらい準備すべきですか?
テストの指針では、32 GBが開始地点になり得る一方、64 GBならより快適だとされています。より大きなモデルや構成では、はるかに多くの使用可能メモリが必要になる場合があります。
Q: 別のダウンロードモデルが失敗するのはなぜですか?
非対応アーキテクチャ、互換性のない量子化、使用可能メモリの不足、ランタイムのバグ、ドライバーやプラットフォームの違いなどが原因で、モデルが失敗することがあります。ハードウェアを変更する前に、ログを確認して対応モデルをテストしてください。
| 症状 | 考えられる原因 | 実際の対処 |
|---|---|---|
| APIサーバーが準備完了にならない | モデル読み込み、ドライバー、またはメモリの問題 | ログを確認し、モデル構成を縮小する |
| トークン速度が非常に低い | ホスト帯域幅の不足、またはエキスパートキャッシュミスの多発 | メモリを解放し、帯域幅を改善して、キャッシュ設定を比較する |
| デスクトップの結果がサーバーの結果を下回る | クライアントのオーバーヘッド、または競合するワークロード | バックグラウンドアプリケーションを減らして再テストする |
| モデルが予期せず終了する | 互換性の問題、またはベータ版ランタイムの問題 | 対応するチェックポイントを試し、エラーログを保存する |
| 時間の経過とともに性能が低下する | KVキャッシュの増加、またはVRAMの圧迫 | コンテキストを短くするか、KV状態により多くのメモリを割り当てる |
FreeTokenは、システム実験として捉えると最も有効に活用できます。安定したDeepSeek-V4-Flash構成から始めて基準値を確立し、一度に1つの変数だけを変更してください。この方法により、ハードウェアの限界とモデルサポートの問題を区別しやすくなります。
テストごとに変更する要素は1つだけにしてください。モデル形式、コンテキスト長、メモリ予算、エンドポイント、バックグラウンドワークロードのいずれか1つに限定します。管理された比較によって、実際のボトルネックをより早く特定できます。