- FreeToken RTX 3090構成では、GPUとシステムメモリへのオフロードによって、大規模なMoEモデルを実行できます。
- システムメモリは重要です。RTX 3090には、最先端モデルのエキスパートプール全体を保持する容量がないためです。
- 推奨される開始点:RAMは最低32 GBを使用し、64 GBあればより実用的な余裕を確保できます。
- 期待できる速度:サーバー側のテストでは、DeepSeek V4 Flashが毎秒およそ10~11トークンに達しました。
- ベストプラクティス:モデルを読み込む前にメモリを大量に消費するアプリケーションを終了し、RAM、VRAM、トークン速度を監視してください。
FreeToken RTX 3090:この構成でできること
FreeTokenはゲームやエンターテインメント作品ではなく、ローカルAIサービングシステムです。GPUメモリ、システムRAM、CPU実行、PCIe転送を組み合わせることで、大規模なオープンウェイトのMixture-of-Expertsモデルを一般向けハードウェアでより実用的に動作させることを目的としています。
RTX 3090は24 GBのVRAMを搭載しています。これは多くの小規模なローカルモデルには十分ですが、DeepSeek V4 Flashのようなモデルのエキスパートプール全体を保持するには不十分です。FreeTokenは、すべてのエキスパートの重みをホストメモリに保持し、GPUを頻繁にルーティングされるエキスパートの伸縮可能なキャッシュとして使用することで、この制限に対応します。
その結果、次のようなハイブリッドワークフローが実現します。
- エキスパート以外のモデル重みはGPU上に保持されます。
- エキスパートプール全体はシステムメモリに格納されます。
- 頻繁に使用されるエキスパートはVRAMにキャッシュされます。
- 不足しているエキスパートはGPUへ転送するか、CPU上で処理できます。
- ランタイムは、測定されたPCIe帯域幅とホストメモリ帯域幅に応じて動作を調整します。
この設計により、FreeToken RTX 3090の組み合わせは、より大容量のGPUやホスト型APIがなければ実行が難しいモデルを試すための有用な環境になります。
参考資料: FreeTokenの研究論文では、帯域幅適応型の実行モデル、伸縮可能なエキスパートキャッシュ、エッジ向けサービング設計について説明されています。
動画のハイライト:
- 1枚のRTX 3090で、システムメモリへのオフロードを使用してDeepSeek V4 Flashを実行。
- サーバー側のテストで毎秒約10~11トークンを達成。
- 同等条件のデスクトップクライアントでは毎秒約8.8トークンを測定。
- Open WebUIを介したブラウザベースのチャットインターフェースを使用。
- メモリ容量と帯域幅が使用感に大きな影響を与えました。
| コンポーネント | 実用上の役割 | 主な考慮事項 |
|---|---|---|
| RTX 3090 | GPU実行とエキスパートキャッシュ | 24 GBのVRAMではモデル全体を常駐させられない |
| システムRAM | ホストに常駐するエキスパートの重みを保存 | 容量が大きいほどモデルの互換性が向上 |
| CPU | 選択された不足エキスパートを処理 | メモリ帯域幅がデコード速度を制限する場合がある |
| PCIeリンク | RAMとVRAM間でエキスパートを移動 | PCIe 4.0クラスのリンクは実用的だが、瞬時ではない |
| NVMeストレージ | 起動時にモデルデータを読み込む | 高速なストレージは初期読み込み時間を短縮 |
FreeTokenによって284Bパラメータモデル全体が24 GBのRTX 3090内に収まるわけではありません。選択的な実行とメモリ移動を、ローカルテストに十分実用的なレベルで行えるようにする仕組みです。
ハードウェア要件とメモリ計画
RTX 3090はシステムの一要素にすぎません。FreeTokenで扱えるモデルの規模は、使用可能なシステムRAM、ホストメモリの帯域幅、ストレージ速度、そして他のアプリケーションがリソースを使用した後に利用できるVRAM容量に大きく左右されます。
実用的な開始点はシステムメモリ32 GBですが、より大規模なMoE実験には64 GBのほうが余裕があります。参考テストでは、より大きなホスト常駐エキスパートプールを必要とするモデルのために、これを大幅に上回るRAMを搭載したシステムも検証されました。GPU自体があまり使用されていないように見えても、FreeTokenは使用可能なRAMとVRAMを合わせて評価するため、モデルがメモリ不足と報告する場合があります。
| メモリ容量 | 適した用途 | 計画時のポイント |
|---|---|---|
| 32 GB RAM | エントリーレベルのMoEテスト | 一部のモデルに適した現実的な開始点 |
| 64 GB RAM | より快適なローカルサービング | モデル、OS、アプリケーション用の余裕が増える |
| 96~128 GB RAM | より大規模なモデル実験 | 大容量メモリ構成での柔軟性が向上 |
| 168 GB以上 | 非常に大規模なホストオフロードモデル | 一般的なデスクトップ容量を超えるモデル要件に有用 |
| 512 GB RAM | 最先端規模の実験 | 非常に大きなエキスパートプールを持つモデルに関連 |
メモリ帯域幅も重要です。参考資料では、デュアルチャネルDDR4およびDDR5システムが比較されており、一般的にDDR5のほうが高いホスト帯域幅を提供します。ただし、FreeTokenは実際に展開されたマシンの転送性能とCPU処理動作を測定するため、仕様だけでパフォーマンスが決まるわけではありません。
モデルを起動する前に、次の項目を確認してください。
- OSとバックグラウンドアプリケーションを考慮した後の使用可能なシステムRAM。
- RTX 3090の空きVRAM。
- PCIeリンクの幅と世代。
- RAMのチャネル構成と実効メモリ速度。
- モデルファイルと変換済み重みに必要なNVMe容量。
- 長時間推論時のCPU温度および電力制限。
GPUの余裕
エキスパート以外の重み、ランタイム状態、KVキャッシュ、デスクトップアプリケーションのために、数GBのVRAMを確保してください。
RAM容量
ホストメモリにはエキスパートプール全体が保存されるため、容量が互換性を左右する主な制限になる場合があります。
帯域幅のバランス
PCIeの転送速度とCPU側のメモリ帯域幅によって、FreeTokenがGPUとCPUの間でどのように処理を分担するかが決まります。
互換性をVRAMだけで判断しないでください。ランタイムのGPU部分に収まるモデルでも、使用可能なシステムRAMが不足していると失敗する場合があります。
FreeToken RTX 3090のセットアップ手順
このワークフローを使って、最初のテストをクリーンな状態で準備してください。プロジェクトの進展に伴って利用可能なパッケージやインターフェースが変わる可能性があるため、インストール前に最新リリースの手順を確認してください。
システムを準備する
NVIDIAドライバーを更新し、RTX 3090が正しく検出されることを確認します。ゲーム、ブラウザのタブ、録画ツール、その他のGPU負荷が高いアプリケーションを終了してください。これらのプログラムは、サービング中に使用可能なVRAMを減らしたり、メモリ予算を変動させたりする可能性があります。
適切なビルドをインストールする
使用しているOSに合ったパッケージを選択します。参考資料で説明されている形式には、Windowsディストリビューション、Ubuntuパッケージ、AppImage、Arch Linuxパッケージがあります。正確なインストールコマンドについては、プロジェクトの最新リリースチャンネルを利用してください。
互換性のあるモデルを選択する
RAMとVRAMを合わせた要件が現実的なモデルから始めます。DeepSeek V4 Flashは代表的なMoEターゲットですが、パラメータ数の多い密なBF16モデルは、単一のRTX 3090システムで実用上の限界を超える可能性があります。
APIサーバーを待つ
ランタイムを起動し、エキスパートプールの読み込み中にメモリ使用量を監視します。インターフェースにAPIサーバーの準備完了が表示されたら、Open WebUIなどの互換クライアント、または対応している別のチャットフロントエンドに接続します。
制御されたテストを実行する
短いプロンプトから始め、トークン速度、メモリ使用量、応答の安定性を記録します。MoEのルーティングによってアクティブなエキスパートが変わり、結果が異なる可能性があるため、複数のプロンプトでテストを繰り返してください。
| セットアップ段階 | 確認する内容 | 推奨プラクティス |
|---|---|---|
| ドライバーチェック | RTX 3090が認識され、安定している | 基本的なGPU監視コマンドでテストする |
| インストール | パッケージがOSに適合している | 最新のプロジェクトリリースを優先する |
| モデル読み込み | RAMとVRAMが確保されている | 初回読み込み中はマルチタスクを避ける |
| APIの準備 | サーバーが準備完了状態を報告している | 初期化完了後にのみクライアントを接続する |
| ベンチマーク | 1秒あたりのトークン数とメモリ使用量 | 1つのサンプルではなく複数のプロンプトを使う |
負荷をかけすぎた実行よりも、クリーンな初回実行のほうが有用です。すでにメモリ予算の限界に近いモデルから始めると、初期の失敗がソフトウェアの欠陥ではなく、メモリ割り当ての圧迫によって引き起こされる可能性があります。
モデル1つ、クライアント1つ、短いプロンプト1つで実行してください。サーバーが安定したら、長いコンテキストや負荷の高いアプリケーションを一度に1つずつ追加します。
RTX 3090のパフォーマンスに関する期待値
パフォーマンスは、モデルアーキテクチャ、量子化、プロンプトの長さ、アクティブなエキスパート、RAM速度、PCIeの動作、そしてランタイムをサーバーアプリケーションとして実行するかデスクトップアプリケーションとして実行するかによって変わります。そのため、利用可能なRTX 3090のテスト結果は、保証された仕様ではなく、実用上の参考値として扱ってください。
あるサーバー側のテストでは、単一のRTX 3090上でDeepSeek V4 Flashが毎秒10~11トークンを生成しました。同等の構成でデスクトップクライアントは毎秒8.8トークンを測定しました。この差から、インターフェースやランタイムの経路がスループットに影響することが分かりますが、正確な結果はOSやシステム構成によって異なります。
| テスト条件 | 報告された結果 | 解釈 |
|---|---|---|
| RTX 3090のサーバー側実行 | 約10~11 tok/s | チャット形式の用途で対話的な速度が可能 |
| デスクトップクライアントの実行 | 約8.8 tok/s | セットアップは容易だが、観測されたスループットはやや低い |
| デスクトップクライアントのメモリ使用量 | 約20.38 GB | ランタイムが大きなメモリを必要とすることを示す |
| RTX 3090クラスのプリフィル転送 | 140 GBのエキスパートプールで約5秒 | 転送遅延はPCIe帯域幅に依存 |
| RTX 4090/3090クラスのリンク | 研究ではPCIe 4.0 x16相当 | ホストからデバイスへの移動が依然として大きな要因 |
モデルがVRAM容量を超えているにもかかわらず、デコード速度を実用的な水準に維持できる理由は、論文で説明されている設計にあります。FreeTokenは共有LRUエキスパートキャッシュを維持し、最近ルーティングされたエキスパートをGPU上に残せるようにします。キャッシュミスが発生した場合、ランタイムは測定された帯域幅に基づき、PCIeによるキャッシュへの補充とCPUでの直接実行の分担を計算します。
次のような要因によって結果が低下する可能性があります。
- OBSやその他のGPUエンコード処理が使用可能なメモリに影響する場合があります。
- ブラウザのタブやデスクトップアプリケーションがVRAMを消費する可能性があります。
- 低速なRAMやシングルチャネルRAMは、CPU側のエキスパート処理を制約する可能性があります。
- 長いプロンプトはプリフィル処理とコンテキスト管理のコストを増加させます。
- 密なモデルは、疎なMoEモデルとは異なる動作をする可能性があります。
- ベータ版ソフトウェアの問題により、モデル固有の起動失敗やエンジンエラーが発生する場合があります。
トークン速度は普遍的なスコアではありません。結論を出す前に、同一のモデル、プロンプト、量子化形式、コンテキスト長、クライアント経路を比較してください。
トラブルシューティングと最適化チェックリスト
FreeTokenのハイブリッド設計では、GPUだけで動作するローカルモデルよりも多くの変数が発生します。高度なランタイム設定を変更する前に、まずメモリと実行環境を確認してトラブルシューティングを始めてください。
各ベンチマークの前に確認すること:
- RTX 3090のドライバーとCUDA環境が正しく検出されていることを確認する
- ゲーム、録画ツール、ブラウザ、その他のGPU負荷が高いアプリケーションを終了する
- 搭載RAMの総量だけでなく、使用可能なシステムRAMを確認する
- PCIeリンク幅、RAM構成、モデル形式、コンテキスト長を記録する
- 複数のプロンプトを実行し、安定したトークン速度の範囲を比較する
モデルの起動に失敗した場合は、まず競合するメモリ使用量を減らしてください。モデル固有のエンジンエラーが発生しても、必ずしもRTX 3090が故障しているとは限りません。参考テストでは、同じ一般的な構成でも、密なBF16モデルは失敗し、別のMoEモデルは正常に読み込めるケースが確認されています。
生成速度が予想より遅い場合は、ホストメモリの帯域幅とCPUの使用状況を調べてください。GPUキャッシュが小さい場合やルーティングパターンが変化した場合、FreeTokenはより多くのキャッシュミスをCPUで処理する必要が生じることがあります。RAM容量を増やすと互換性が向上し、高速なメモリやより強力なプラットフォームを使用すると、ホスト常駐エキスパートの処理速度を改善できる可能性があります。
| 症状 | 考えられる原因 | 最初の対応 |
|---|---|---|
| メモリ不足のメッセージ | RAMとVRAMを合わせた予算が小さすぎる | より小さなモデルを使用するか、使用可能なシステムRAMを増やす |
| エンジンが予期せず終了する | モデル形式またはベータ版の互換性問題 | ログを確認し、別の対応モデルをテストする |
| トークン速度が低い | ホスト帯域幅、キャッシュミス、またはCPU経路 | バックグラウンドアプリを終了し、RAM性能を確認する |
| 起動が遅い | 大規模なエキスパートプールとストレージ読み込み | 高速なNVMeストレージを使用し、初期読み込みの完了を待つ |
| スループットが変動する | プロンプトごとにMoEのルーティングが変化する | 複数のプロンプトでベンチマークし、範囲で報告する |
FreeTokenのプロジェクト説明と論文では、このシステムをプロジェクトの公式チャンネルを通じて公開された研究志向のソフトウェアとして位置付けています。リリース情報、対応モデル、プラットフォームの更新については、flashml.aiの最新プロジェクトページを確認してください。
システムは次の順番で改善してください:使用可能なメモリ、バックグラウンド負荷、RAM帯域幅、ストレージ速度、そして最後に高度なモデル設定またはクライアント設定。
FreeToken RTX 3090 FAQ
Q: FreeTokenは1枚のRTX 3090で大規模なMoEモデルを実行できますか?
はい。参考テストでは、より大きなエキスパートプールにシステムメモリを使用することで、1枚のRTX 3090上でDeepSeek V4 Flashを実行しました。モデル全体がGPUの24 GB VRAMに完全に収まるわけではないため、システムメモリの総容量と帯域幅が重要です。
Q: RTX 3090のFreeTokenシステムにはどのくらいのRAMが必要ですか?
一部のモデルでは、最低32 GBが妥当な開始点です。64 GBあれば、より実用的な余裕を確保できます。モデル形式やランタイム要件によっては、より大規模なモデルに96 GB、128 GB、168 GB、またはそれ以上のRAMが必要になる場合があります。
Q: RTX 3090でFreeTokenを使う場合、どの程度のトークン速度を期待できますか?
サーバー側のテストでは、DeepSeek V4 Flashで毎秒およそ10~11トークンが報告されています。デスクトップクライアントのテストでは毎秒約8.8トークンが測定されました。RAM帯域幅、PCIe構成、プロンプト、ルーティング、バックグラウンドアプリケーションによって結果は異なる場合があります。
Q: RTX 3090に空きVRAMがあるのに、なぜモデルの実行に失敗するのですか?
FreeTokenは、エキスパートプール全体、ホストメモリ、ランタイム状態、KVキャッシュを考慮する必要があります。空きVRAMがあるだけでは、合計メモリ予算が十分であるとは限りません。モデル形式の互換性やベータ版ソフトウェアの問題によって、起動に失敗することもあります。