FreeToken RTX 3090:セットアップガイドとパフォーマンスのヒント - ハードウェア

FreeToken RTX 3090:セットアップガイドとパフォーマンスのヒント

RTX 3090でFreeTokenを実行する方法、システムメモリの準備、ローカルモデルの設定、パフォーマンス上の制限に関するトラブルシューティングを解説します。

2026-08-25
FreeTokenチーム
クイックガイド
  • FreeToken RTX 3090構成では、GPUとシステムメモリへのオフロードによって、大規模なMoEモデルを実行できます。
  • システムメモリは重要です。RTX 3090には、最先端モデルのエキスパートプール全体を保持する容量がないためです。
  • 推奨される開始点:RAMは最低32 GBを使用し、64 GBあればより実用的な余裕を確保できます。
  • 期待できる速度:サーバー側のテストでは、DeepSeek V4 Flashが毎秒およそ10~11トークンに達しました。
  • ベストプラクティス:モデルを読み込む前にメモリを大量に消費するアプリケーションを終了し、RAM、VRAM、トークン速度を監視してください。

FreeToken RTX 3090:この構成でできること

FreeTokenはゲームやエンターテインメント作品ではなく、ローカルAIサービングシステムです。GPUメモリ、システムRAM、CPU実行、PCIe転送を組み合わせることで、大規模なオープンウェイトのMixture-of-Expertsモデルを一般向けハードウェアでより実用的に動作させることを目的としています。

RTX 3090は24 GBのVRAMを搭載しています。これは多くの小規模なローカルモデルには十分ですが、DeepSeek V4 Flashのようなモデルのエキスパートプール全体を保持するには不十分です。FreeTokenは、すべてのエキスパートの重みをホストメモリに保持し、GPUを頻繁にルーティングされるエキスパートの伸縮可能なキャッシュとして使用することで、この制限に対応します。

その結果、次のようなハイブリッドワークフローが実現します。

  • エキスパート以外のモデル重みはGPU上に保持されます。
  • エキスパートプール全体はシステムメモリに格納されます。
  • 頻繁に使用されるエキスパートはVRAMにキャッシュされます。
  • 不足しているエキスパートはGPUへ転送するか、CPU上で処理できます。
  • ランタイムは、測定されたPCIe帯域幅とホストメモリ帯域幅に応じて動作を調整します。

この設計により、FreeToken RTX 3090の組み合わせは、より大容量のGPUやホスト型APIがなければ実行が難しいモデルを試すための有用な環境になります。

参考資料: FreeTokenの研究論文では、帯域幅適応型の実行モデル、伸縮可能なエキスパートキャッシュ、エッジ向けサービング設計について説明されています。

動画のハイライト:

  • 1枚のRTX 3090で、システムメモリへのオフロードを使用してDeepSeek V4 Flashを実行。
  • サーバー側のテストで毎秒約10~11トークンを達成。
  • 同等条件のデスクトップクライアントでは毎秒約8.8トークンを測定。
  • Open WebUIを介したブラウザベースのチャットインターフェースを使用。
  • メモリ容量と帯域幅が使用感に大きな影響を与えました。
コンポーネント実用上の役割主な考慮事項
RTX 3090GPU実行とエキスパートキャッシュ24 GBのVRAMではモデル全体を常駐させられない
システムRAMホストに常駐するエキスパートの重みを保存容量が大きいほどモデルの互換性が向上
CPU選択された不足エキスパートを処理メモリ帯域幅がデコード速度を制限する場合がある
PCIeリンクRAMとVRAM間でエキスパートを移動PCIe 4.0クラスのリンクは実用的だが、瞬時ではない
NVMeストレージ起動時にモデルデータを読み込む高速なストレージは初期読み込み時間を短縮
基本概念

FreeTokenによって284Bパラメータモデル全体が24 GBのRTX 3090内に収まるわけではありません。選択的な実行とメモリ移動を、ローカルテストに十分実用的なレベルで行えるようにする仕組みです。

ハードウェア要件とメモリ計画

RTX 3090はシステムの一要素にすぎません。FreeTokenで扱えるモデルの規模は、使用可能なシステムRAM、ホストメモリの帯域幅、ストレージ速度、そして他のアプリケーションがリソースを使用した後に利用できるVRAM容量に大きく左右されます。

実用的な開始点はシステムメモリ32 GBですが、より大規模なMoE実験には64 GBのほうが余裕があります。参考テストでは、より大きなホスト常駐エキスパートプールを必要とするモデルのために、これを大幅に上回るRAMを搭載したシステムも検証されました。GPU自体があまり使用されていないように見えても、FreeTokenは使用可能なRAMとVRAMを合わせて評価するため、モデルがメモリ不足と報告する場合があります。

メモリ容量適した用途計画時のポイント
32 GB RAMエントリーレベルのMoEテスト一部のモデルに適した現実的な開始点
64 GB RAMより快適なローカルサービングモデル、OS、アプリケーション用の余裕が増える
96~128 GB RAMより大規模なモデル実験大容量メモリ構成での柔軟性が向上
168 GB以上非常に大規模なホストオフロードモデル一般的なデスクトップ容量を超えるモデル要件に有用
512 GB RAM最先端規模の実験非常に大きなエキスパートプールを持つモデルに関連

メモリ帯域幅も重要です。参考資料では、デュアルチャネルDDR4およびDDR5システムが比較されており、一般的にDDR5のほうが高いホスト帯域幅を提供します。ただし、FreeTokenは実際に展開されたマシンの転送性能とCPU処理動作を測定するため、仕様だけでパフォーマンスが決まるわけではありません。

モデルを起動する前に、次の項目を確認してください。

  • OSとバックグラウンドアプリケーションを考慮した後の使用可能なシステムRAM。
  • RTX 3090の空きVRAM。
  • PCIeリンクの幅と世代。
  • RAMのチャネル構成と実効メモリ速度。
  • モデルファイルと変換済み重みに必要なNVMe容量。
  • 長時間推論時のCPU温度および電力制限。

GPUの余裕

エキスパート以外の重み、ランタイム状態、KVキャッシュ、デスクトップアプリケーションのために、数GBのVRAMを確保してください。

RAM容量

ホストメモリにはエキスパートプール全体が保存されるため、容量が互換性を左右する主な制限になる場合があります。

帯域幅のバランス

PCIeの転送速度とCPU側のメモリ帯域幅によって、FreeTokenがGPUとCPUの間でどのように処理を分担するかが決まります。

メモリに関する注意

互換性をVRAMだけで判断しないでください。ランタイムのGPU部分に収まるモデルでも、使用可能なシステムRAMが不足していると失敗する場合があります。

FreeToken RTX 3090のセットアップ手順

このワークフローを使って、最初のテストをクリーンな状態で準備してください。プロジェクトの進展に伴って利用可能なパッケージやインターフェースが変わる可能性があるため、インストール前に最新リリースの手順を確認してください。

1

システムを準備する

NVIDIAドライバーを更新し、RTX 3090が正しく検出されることを確認します。ゲーム、ブラウザのタブ、録画ツール、その他のGPU負荷が高いアプリケーションを終了してください。これらのプログラムは、サービング中に使用可能なVRAMを減らしたり、メモリ予算を変動させたりする可能性があります。

2

適切なビルドをインストールする

使用しているOSに合ったパッケージを選択します。参考資料で説明されている形式には、Windowsディストリビューション、Ubuntuパッケージ、AppImage、Arch Linuxパッケージがあります。正確なインストールコマンドについては、プロジェクトの最新リリースチャンネルを利用してください。

3

互換性のあるモデルを選択する

RAMとVRAMを合わせた要件が現実的なモデルから始めます。DeepSeek V4 Flashは代表的なMoEターゲットですが、パラメータ数の多い密なBF16モデルは、単一のRTX 3090システムで実用上の限界を超える可能性があります。

4

APIサーバーを待つ

ランタイムを起動し、エキスパートプールの読み込み中にメモリ使用量を監視します。インターフェースにAPIサーバーの準備完了が表示されたら、Open WebUIなどの互換クライアント、または対応している別のチャットフロントエンドに接続します。

5

制御されたテストを実行する

短いプロンプトから始め、トークン速度、メモリ使用量、応答の安定性を記録します。MoEのルーティングによってアクティブなエキスパートが変わり、結果が異なる可能性があるため、複数のプロンプトでテストを繰り返してください。

セットアップ段階確認する内容推奨プラクティス
ドライバーチェックRTX 3090が認識され、安定している基本的なGPU監視コマンドでテストする
インストールパッケージがOSに適合している最新のプロジェクトリリースを優先する
モデル読み込みRAMとVRAMが確保されている初回読み込み中はマルチタスクを避ける
APIの準備サーバーが準備完了状態を報告している初期化完了後にのみクライアントを接続する
ベンチマーク1秒あたりのトークン数とメモリ使用量1つのサンプルではなく複数のプロンプトを使う

負荷をかけすぎた実行よりも、クリーンな初回実行のほうが有用です。すでにメモリ予算の限界に近いモデルから始めると、初期の失敗がソフトウェアの欠陥ではなく、メモリ割り当ての圧迫によって引き起こされる可能性があります。

最初に推奨するテスト

モデル1つ、クライアント1つ、短いプロンプト1つで実行してください。サーバーが安定したら、長いコンテキストや負荷の高いアプリケーションを一度に1つずつ追加します。

RTX 3090のパフォーマンスに関する期待値

パフォーマンスは、モデルアーキテクチャ、量子化、プロンプトの長さ、アクティブなエキスパート、RAM速度、PCIeの動作、そしてランタイムをサーバーアプリケーションとして実行するかデスクトップアプリケーションとして実行するかによって変わります。そのため、利用可能なRTX 3090のテスト結果は、保証された仕様ではなく、実用上の参考値として扱ってください。

あるサーバー側のテストでは、単一のRTX 3090上でDeepSeek V4 Flashが毎秒10~11トークンを生成しました。同等の構成でデスクトップクライアントは毎秒8.8トークンを測定しました。この差から、インターフェースやランタイムの経路がスループットに影響することが分かりますが、正確な結果はOSやシステム構成によって異なります。

テスト条件報告された結果解釈
RTX 3090のサーバー側実行10~11 tok/sチャット形式の用途で対話的な速度が可能
デスクトップクライアントの実行8.8 tok/sセットアップは容易だが、観測されたスループットはやや低い
デスクトップクライアントのメモリ使用量20.38 GBランタイムが大きなメモリを必要とすることを示す
RTX 3090クラスのプリフィル転送140 GBのエキスパートプールで約5秒転送遅延はPCIe帯域幅に依存
RTX 4090/3090クラスのリンク研究ではPCIe 4.0 x16相当ホストからデバイスへの移動が依然として大きな要因

モデルがVRAM容量を超えているにもかかわらず、デコード速度を実用的な水準に維持できる理由は、論文で説明されている設計にあります。FreeTokenは共有LRUエキスパートキャッシュを維持し、最近ルーティングされたエキスパートをGPU上に残せるようにします。キャッシュミスが発生した場合、ランタイムは測定された帯域幅に基づき、PCIeによるキャッシュへの補充とCPUでの直接実行の分担を計算します。

次のような要因によって結果が低下する可能性があります。

  • OBSやその他のGPUエンコード処理が使用可能なメモリに影響する場合があります。
  • ブラウザのタブやデスクトップアプリケーションがVRAMを消費する可能性があります。
  • 低速なRAMやシングルチャネルRAMは、CPU側のエキスパート処理を制約する可能性があります。
  • 長いプロンプトはプリフィル処理とコンテキスト管理のコストを増加させます。
  • 密なモデルは、疎なMoEモデルとは異なる動作をする可能性があります。
  • ベータ版ソフトウェアの問題により、モデル固有の起動失敗やエンジンエラーが発生する場合があります。
トークン速度の読み方

トークン速度は普遍的なスコアではありません。結論を出す前に、同一のモデル、プロンプト、量子化形式、コンテキスト長、クライアント経路を比較してください。

トラブルシューティングと最適化チェックリスト

FreeTokenのハイブリッド設計では、GPUだけで動作するローカルモデルよりも多くの変数が発生します。高度なランタイム設定を変更する前に、まずメモリと実行環境を確認してトラブルシューティングを始めてください。

各ベンチマークの前に確認すること:

  • RTX 3090のドライバーとCUDA環境が正しく検出されていることを確認する
  • ゲーム、録画ツール、ブラウザ、その他のGPU負荷が高いアプリケーションを終了する
  • 搭載RAMの総量だけでなく、使用可能なシステムRAMを確認する
  • PCIeリンク幅、RAM構成、モデル形式、コンテキスト長を記録する
  • 複数のプロンプトを実行し、安定したトークン速度の範囲を比較する

モデルの起動に失敗した場合は、まず競合するメモリ使用量を減らしてください。モデル固有のエンジンエラーが発生しても、必ずしもRTX 3090が故障しているとは限りません。参考テストでは、同じ一般的な構成でも、密なBF16モデルは失敗し、別のMoEモデルは正常に読み込めるケースが確認されています。

生成速度が予想より遅い場合は、ホストメモリの帯域幅とCPUの使用状況を調べてください。GPUキャッシュが小さい場合やルーティングパターンが変化した場合、FreeTokenはより多くのキャッシュミスをCPUで処理する必要が生じることがあります。RAM容量を増やすと互換性が向上し、高速なメモリやより強力なプラットフォームを使用すると、ホスト常駐エキスパートの処理速度を改善できる可能性があります。

症状考えられる原因最初の対応
メモリ不足のメッセージRAMとVRAMを合わせた予算が小さすぎるより小さなモデルを使用するか、使用可能なシステムRAMを増やす
エンジンが予期せず終了するモデル形式またはベータ版の互換性問題ログを確認し、別の対応モデルをテストする
トークン速度が低いホスト帯域幅、キャッシュミス、またはCPU経路バックグラウンドアプリを終了し、RAM性能を確認する
起動が遅い大規模なエキスパートプールとストレージ読み込み高速なNVMeストレージを使用し、初期読み込みの完了を待つ
スループットが変動するプロンプトごとにMoEのルーティングが変化する複数のプロンプトでベンチマークし、範囲で報告する

FreeTokenのプロジェクト説明と論文では、このシステムをプロジェクトの公式チャンネルを通じて公開された研究志向のソフトウェアとして位置付けています。リリース情報、対応モデル、プラットフォームの更新については、flashml.aiの最新プロジェクトページを確認してください。

最適化の優先順位

システムは次の順番で改善してください:使用可能なメモリ、バックグラウンド負荷、RAM帯域幅、ストレージ速度、そして最後に高度なモデル設定またはクライアント設定。

FreeToken RTX 3090 FAQ

Q: FreeTokenは1枚のRTX 3090で大規模なMoEモデルを実行できますか?

はい。参考テストでは、より大きなエキスパートプールにシステムメモリを使用することで、1枚のRTX 3090上でDeepSeek V4 Flashを実行しました。モデル全体がGPUの24 GB VRAMに完全に収まるわけではないため、システムメモリの総容量と帯域幅が重要です。

Q: RTX 3090のFreeTokenシステムにはどのくらいのRAMが必要ですか?

一部のモデルでは、最低32 GBが妥当な開始点です。64 GBあれば、より実用的な余裕を確保できます。モデル形式やランタイム要件によっては、より大規模なモデルに96 GB、128 GB、168 GB、またはそれ以上のRAMが必要になる場合があります。

Q: RTX 3090でFreeTokenを使う場合、どの程度のトークン速度を期待できますか?

サーバー側のテストでは、DeepSeek V4 Flashで毎秒およそ10~11トークンが報告されています。デスクトップクライアントのテストでは毎秒約8.8トークンが測定されました。RAM帯域幅、PCIe構成、プロンプト、ルーティング、バックグラウンドアプリケーションによって結果は異なる場合があります。

Q: RTX 3090に空きVRAMがあるのに、なぜモデルの実行に失敗するのですか?

FreeTokenは、エキスパートプール全体、ホストメモリ、ランタイム状態、KVキャッシュを考慮する必要があります。空きVRAMがあるだけでは、合計メモリ予算が十分であるとは限りません。モデル形式の互換性やベータ版ソフトウェアの問題によって、起動に失敗することもあります。