- FreeTokenのインストールには、対応するCUDA対応GPU、ホストメモリ、ストレージ、互換性のあるランタイム環境が必要です。
- リリース場所:本システムは、公式FlashMLプロジェクトのチャンネルを通じてリリースが告知されます。
- 基本設定:モデルの重み、ホスト常駐のエキスパートストレージ、GPUキャッシュ領域、測定済みの帯域幅値を準備します。
- 重要な制限:現在利用できる参考資料には、そのままコピーして使えるインストールコマンドは掲載されていません。
- ベストプラクティス:モデルの重みを変換したりエンジンを起動したりする前に、最新のリリース手順を確認してください。
FreeTokenのインストール:システム要件
FreeTokenは、大規模な**Mixture-of-Experts(MoE)**モデル向けのエッジネイティブ・サービングシステムです。ゲーム、ダウンロード可能なキャラクタータイトル、または引き換えコードサービスではありません。そのため、インストールプロセスはGPU推論、ホストメモリ、CUDAサポート、モデルストレージ、ランタイム設定を中心に行います。
公開されている設計は、利用可能なVRAMを完全なエキスパートプールが上回る可能性のあるパーソナルコンピューター、ワークステーション、ノートパソコンを対象としています。FreeTokenはルーティング対象となるエキスパートプール全体をホストメモリに保持し、GPUメモリを可変式のエキスパートキャッシュとして使用します。エキスパート以外の重みはGPU上に残り、他のアプリケーションがVRAMを使用または解放すると、キャッシュ容量は変化します。
FreeTokenはワンクリックアプリケーションではなく、システムデプロイメントとして扱ってください。ランタイムのスケジューリングは実際のマシンに依存するため、ハードウェアのプロファイリング、モデルの準備、メモリ計画もセットアップの一部です。
GPUクラス
ディスクリートのCUDA対応GPUが主な実行経路を提供します。参考評価では、8GBのノートパソコン向けGPUからワークステーションクラスのハードウェアまで検証されています。
ホストメモリ
システムメモリは完全なエキスパートプールを保存し、GPUキャッシュミスが発生した場合にCPU側でエキスパートを実行するための帯域幅を提供します。
高速ストレージ
NVMeストレージは起動時に重要です。FreeTokenは準備済みの重みを最終的なホストレイアウトへ直接読み込めます。
最も重要な違いは、容量と性能の間にあります。モデル全体をVRAMに完全に収める必要はありませんが、ホスト側にはエキスパートプールを保持し、許容できるレイテンシーを実現する十分な転送帯域幅を提供する能力が必要です。
| リソース | FreeTokenでの役割 | セットアップ優先度 |
|---|---|---|
| GPU VRAM | エキスパート以外の重み、KVキャッシュ、可変式エキスパートスロットを保存 | 高 |
| ホストメモリ | ルーティング対象となるエキスパートプール全体を保持 | 高 |
| PCIeリンク | 選択されたエキスパートをGPUキャッシュへ移動 | 高 |
| CPU帯域幅 | ホストメモリから残りのエキスパートキャッシュミスを実行 | 高 |
| NVMeストレージ | 起動時にモデルデータを読み込み | 中 |
| CUDA環境 | GPUカーネルとキャプチャ済み実行パスをサポート | 高 |
参考システムの報告では、スペックシート上の想定よりもハードウェアのバランスが重要です。PCIe帯域幅が限られたノートパソコンではCPU実行を増やす構成が適する場合があり、一方でGPU転送帯域幅に余裕のあるデスクトップでは、より多くのキャッシュスロットを埋めることで性能が向上する可能性があります。
FreeTokenをインストールする前に
ランタイムを入手する前に、マシンとモデル資産を準備してください。公開されているシステムでは、FreeToken Weight(FTW)形式と呼ばれる正規化されたエキスパートレイアウトを使用します。この形式は、論理的なレイヤー・エキスパート識別子を基準にエキスパートバンクを整理し、CPUエグゼキューターとGPUキャッシュが同じマッピングを利用できるようにします。
利用可能な参考資料には、汎用的な変換コマンドやパッケージマネージャーの手順は記載されていません。他の推論エンジンのコマンドを推測して使用しないでください。代わりに、公式のFreeTokenプロジェクトのリリースチャンネルに関連付けられた最新のリリースドキュメントが公開されたら、それを使用してください。
llama.cpp、Ollama、または別のサービングエンジンからコピーしたコマンドでは、必要なFTWレイアウトが作成されなかったり、FreeTokenのキャッシュや帯域幅ポリシーが正しく設定されなかったりする可能性があります。
次の準備表を使ってデプロイメントを整理してください。
| 準備項目 | 確認する内容 | 重要な理由 |
|---|---|---|
| GPU | CUDA互換アーキテクチャと十分な空きVRAM | キャッシュサイズとカーネル互換性を決定する |
| メモリ | ホスト側のエキスパートプール全体を収める十分な容量 | ページングや不安定な実行を防ぐ |
| ストレージ | 選択したチェックポイントとFTWファイル用のNVMe容量 | モデルの読み込み時間を短縮する |
| ドライバー | 対応する最新のNVIDIAドライバーとCUDAスタック | GPU実行とグラフサポートを有効にする |
| モデル | 対応するMoEチェックポイントと精度バリアント | エキスパートサイズとメモリ需要を決定する |
| ワークロード | プロンプト長、エージェントのターン数、想定デコード速度 | KVキャッシュとプレフィル負荷に影響する |
FreeTokenの設計は、次のような重要なランタイム動作をサポートしています。
- 全レイヤーのダブルバッファリング:プレフィル中にエキスパート転送とGPU計算をオーバーラップさせます。
- セマンティクス対応の状態キャッシュ:思考ブロック、ツール呼び出し、会話ターンの周辺にある有用なプレフィックスを保持します。
- 共有LRUエキスパートキャッシュ:デコード中に変化するトークン単位のルーティングに追従します。
- 帯域幅適応型実行:キャッシュミスをPCIe転送とCPUによる直接実行に分配します。
- 可変式キャッシュ再構築:エンジンを再起動せず、スケジューラーが安全なポイントに到達した時点でGPUエキスパートキャッシュの予算を変更します。
初回のデプロイメントでは、1つのモデルと制御されたワークロードを使用してください。複数の大規模チェックポイントを同時にテストすることは避けましょう。ホストメモリとストレージの要件が、ランタイム上の問題と区別しにくくなる可能性があります。
| デプロイメントの選択 | 低リスクの開始オプション | より高負荷なオプション |
|---|---|---|
| モデルサイズ | より小さい対応MoEチェックポイント | 最先端規模のMoEチェックポイント |
| 精度 | サポートが文書化された公式精度 | 専用の量子化レイアウト |
| ワークロード | 短時間の単一セッションテスト | 複数ターンのエージェントワークロード |
| キャッシュポリシー | デフォルトの測定済み設定 | 手動で調整したメモリ分割 |
| ホスト実行 | 最小限のCPUキャッシュミス処理 | 積極的なCPU・GPUハイブリッド実行 |
FreeTokenセットアップの手順
以下の手順を順番に実行してください。この順序では、環境準備、モデル変換、ランタイムチューニングを分離しているため、問題の診断が容易になります。
まずホストを準備し、次にGPUスタックを確認し、その後モデルをステージングしてください。基本的なリクエストが成功してから、サービングキャッシュを調整します。
ホスト環境を準備する
メモリを大量に使用するアプリケーションを終了し、GPU、CPU、ホストメモリ、NVMeストレージがサービングに利用できることを確認します。VRAM総容量、システムメモリ、GPUモデル、PCIeリンク幅、ドライバーまたはCUDAのバージョンを記録してください。FreeTokenは変動するエッジリソース向けに設計されていますが、クリーンなベースラインを用意すると初回テストの信頼性が高まります。
公式ランタイムを入手する
FlashMLでFreeTokenのリリースとともに公開されている最新のインストール手順を使用してください。インストール前に、対応OS、CUDAバージョン、Pythonまたはネイティブ依存関係、モデル互換性を確認します。参考資料ではリリース場所は示されていますが、固定されたコマンド手順は指定されていません。
対応MoEチェックポイントをステージングする
認可された配布チャンネルからモデルファイルをダウンロードし、チェックポイントがランタイムの対応するエキスパート表現と一致することを確認します。元のチェックポイントと変換後のFTWファイルを保存するのに十分なストレージを確保してください。一般的なモデルファイルがすでにFreeTokenの最適化レイアウトになっているとは限りません。
FTWレイアウトを作成または入手する
FreeToken Weightファイルを変換またはダウンロードするためのリリースドキュメントに従ってください。FTWはランタイムが想定するレイアウトでエキスパートバンクを保存するため、ホストメモリへのアラインされた直接読み込みが可能になり、起動時のテンソル探索や再パッキングの繰り返しを避けられます。
制御されたテストを起動する
1件のリクエストと短いプロンプトから始めます。ホスト側のエキスパートプールが読み込まれ、GPUが初期化され、最初のリクエストが完了し、ルーティングされたエキスパートがホストメモリとGPUキャッシュの間を移動できることを確認してください。その後で、長いコンテキスト、ツール呼び出し、同時実行のエージェントセッションをテストします。
初期検証では、ピークスループットではなく機能を重視してください。ランタイムがコールドキャッシュ状態でリクエストを処理できることを確認します。FreeTokenは設計上、別個のウォームアップフェーズを必要としません。初期リクエストの実行を通じて、通常の処理の中でキャッシュを構築できます。
| 検証項目 | 期待される結果 | 失敗した場合 |
|---|---|---|
| モデル検出 | 選択したチェックポイントまたはFTW資産が認識される | モデル形式とリリース互換性を再確認する |
| ホスト読み込み | エキスパートデータがホスト常駐プールに到達する | メモリ容量、ファイルパス、権限を確認する |
| GPU起動 | エキスパート以外のレイヤーとランタイム状態が初期化される | CUDA、ドライバー、VRAMの利用可能状態を確認する |
| 初回リクエスト | コールドキャッシュ推論が完了する | 転送、カーネル、CPUバックエンドのログを確認する |
| 繰り返しデコード | 最近使用したエキスパートでキャッシュヒットが発生し始める | キャッシュ割り当てとルーティングサポートを確認する |
FreeTokenの性能とメモリチューニング
FreeTokenの主要なチューニング概念は、ホスト側帯域幅とPCIe転送帯域幅の関係です。ランタイムは次の2つの値を測定またはプロファイリングします。
- Bₚ:PCIe経由のピン留めエキスパート転送帯域幅。
- Bₕ:CPUによるエキスパート実行に利用できる実効ホスト側帯域幅。
m個のエキスパートが欠落しているデコードステップでは、システムは次の関係でキャッシュ充填数を推定します。
q* ≈ m × Bₚ / Bₕ
これはユーザー向けの保証値でも、固定されたハードウェアルールでもありません。GPUキャッシュへの同時充填とCPU実行のバランスを取るスケジューリングモデルです。適切な分割は、ノートパソコンやデスクトップ、PCIe構成、メモリチャネル、バックグラウンド負荷によって変化します。
公称のPCIe仕様やメモリ仕様だけに頼らず、実際にデプロイするマシンで測定した帯域幅を使用してください。FreeTokenのスケジューリングポリシーは、モデルを実行している実際のハードウェアを反映するよう設計されています。
GPUメモリの予算も計画する必要があります。FreeTokenは、利用可能なVRAMをKVキャッシュと完全なエキスパートスロットに分配します。コンテキストが長くなるほどKVキャッシュの需要は増えますが、エキスパートキャッシュを大きくするとデコード時のキャッシュミスを減らせます。システムは安全なポイントでエキスパートキャッシュを再構築できるため、このバランスをセッション全体で固定しておく必要はありません。
Prefill
転送のオーバーラップとプレフィックスの再利用を優先します。長いプロンプトでは、エキスパートの移動と再計算のコストが顕在化します。
Decode
ルーティングの局所性と共有LRUキャッシュを優先します。静的な配置よりも、最近のエキスパート使用状況の方が有用です。
Agent Workloads
ツール呼び出しや編集されたコンテキストブロックの周辺にあるセマンティックなチェックポイントを保持します。
Shared Desktop
ブラウザー、ディスプレイ、ゲーム、その他のアプリケーション用にVRAMの余裕を残します。
参考評価は、結果を保証値とすることなく、規模を把握するための有用な指標を示しています。RTX 5090のテストシステムでは、FreeTokenはテストしたワークロードにおいて、Qwen3.6-35Bで毎秒77~83トークン、DeepSeek-V4-Flashで毎秒22~25トークンを報告しました。結果はモデルの精度、キャッシュ容量、ホスト帯域幅、プロンプト長、バックグラウンドアプリケーションによって異なります。
| チューニング目標 | 実践的な操作 | トレードオフ |
|---|---|---|
| 初回トークンを高速化 | 準備済みモデルレイアウトと転送のオーバーラップを有効にする | 正しいステージングと十分なストレージが必要 |
| デコード速度を向上 | 有効なエキスパートキャッシュ容量を増やす | KVキャッシュに使えるVRAMが減る |
| より長いコンテキスト | KVページ用に多くのVRAMを確保する | エキスパートキャッシュミスが増える可能性がある |
| キャッシュミス処理を改善 | 測定値に基づくCPU・GPU協調を許可する | ホスト帯域幅とCPUリソースを使用する |
| デスクトップ利用を安定化 | サービングのメモリ予算を減らす | キャッシュヒット率が低下する可能性がある |
インストールチェックリストとトラブルシューティング
基本テストから本番形式のローカルエンドポイントまたはエージェントワークロードへ移行する前に、このチェックリストを使用してください。
テストが遅い場合は、設定を変更する前に、ボトルネックがストレージ読み込み、プレフィル転送、デコード時のキャッシュミス、CPU帯域幅、KVキャッシュ不足のいずれにあるかを特定してください。
デプロイメント準備状況:
- GPU、ドライバー、CUDA環境、利用可能なVRAMを確認する
- エキスパートプール全体を収めるのに十分なホストメモリを確保する
- 対応MoEチェックポイントと文書化されたFTWレイアウトを使用する
- 長時間のエージェントセッションをテストする前に、コールドキャッシュで1件のリクエストを実行する
- チューニング用に測定したPCIeおよびホスト側帯域幅を記録する
| 症状 | 可能性の高い領域 | 最初の対応 |
|---|---|---|
| 起動に時間がかかりすぎる | ストレージまたは未準備の重みレイアウト | 文書化されたFTWパスと高速なローカルストレージを使用する |
| プレフィル中にGPUがアイドル状態になる | 転送と計算が直列化されている | 全レイヤーのダブルバッファリングが有効になっていることを確認する |
| デコードがCPU依存になる | キャッシュミスが多すぎる、またはホスト帯域幅が限られている | キャッシュサイズと測定帯域幅のバランスを確認する |
| 長時間のセッションで速度が低下する | KVキャッシュが元のエキスパート予算を消費している | ランタイムの安全なポイントでVRAMを再配分する |
| ランタイムがモデルを提供できない | 対応していない表現、またはホストメモリ不足 | リリースのモデルおよびプラットフォーム対応表を確認する |
| デスクトップが不安定になる | 他のアプリケーションがVRAMを消費している | バックグラウンドのワークロードを終了するか、サービング割り当てを減らす |
FreeTokenのフォールバック動作も重要です。OSまたはドライバーの制限により、エキスパートプール全体をピン留めしたりDMA用に登録したりできない場合、ランタイムはCPUのみのMoEバックエンドを使用できます。これによりデプロイのしやすさは向上しますが、高速な転送経路は利用できなくなります。エキスパート以外のレイヤーはGPU上に残しつつ、アクティベーションサイズの入力、ルーティングメタデータ、出力をデバイス間で転送することも可能です。
短いプロンプト1件だけでインストール品質を判断しないでください。プレフィルとデコードはシステムの異なる部分に負荷をかけ、複数ターンのエージェントセッションではコンテキスト処理が繰り返し発生します。有効なテスト計画には、短いリクエスト1件、長いプロンプト1件、繰り返しデコード、コンテキスト編集ワークロードを含めてください。
FreeTokenインストール FAQ
Q: FreeTokenはゲームまたは引き換えコードプラットフォームですか?
いいえ。FreeTokenはエッジネイティブなMoEモデルサービングシステムです。インストールでは、GPU推論、ホストメモリ、モデルファイル、CUDAサポート、ランタイム設定を扱います。
Q: FreeTokenのインストーラーまたはリリースパッケージはどこで入手できますか?
公開されているプロジェクト説明では、FlashMLで本システムが告知されています。パッケージ名、依存関係、コマンドについては、公式の最新リリースドキュメント(https://flashml.ai/)を使用してください。参考資料には固定されたランチャーコマンドが記載されていません。
Q: すべてのモデルの重みをVRAMに収める必要がありますか?
いいえ。FreeTokenはルーティング対象となるエキスパートプール全体をホストメモリに保持し、GPUメモリを可変式のエキスパートキャッシュとして使用します。ただしVRAMには、エキスパート以外の重み、ランタイム状態、KVキャッシュページ、キャッシュされたエキスパートを保持する必要があります。
Q: なぜFreeTokenには帯域幅プロファイリングが必要なのですか?
デコード時のキャッシュミスはGPUへ転送することも、CPU上で直接実行することもできます。FreeTokenは測定したPCIe帯域幅とホスト側帯域幅を使用して、これらの経路間で実用的な分配を決定します。
2026年のリリースが進むにつれて、インストールの詳細は変更される可能性があります。変換コマンドやサービングコマンドを実行する前に、公式パッケージ、対応モデル形式、プラットフォーム要件を確認してください。