FreeTokenのインストール:エッジサービング設定のステップガイド - ガイド

FreeTokenのインストール:エッジサービング設定のステップガイド

FreeTokenのエッジネイティブMoEサービングをインストールするために、ハードウェア、ストレージ、メモリ、ランタイム設定を準備する方法を解説します。

2026-08-25
FreeTokenチーム
クイックガイド
  • FreeTokenのインストールには、対応するCUDA対応GPU、ホストメモリ、ストレージ、互換性のあるランタイム環境が必要です。
  • リリース場所:本システムは、公式FlashMLプロジェクトのチャンネルを通じてリリースが告知されます。
  • 基本設定:モデルの重み、ホスト常駐のエキスパートストレージ、GPUキャッシュ領域、測定済みの帯域幅値を準備します。
  • 重要な制限:現在利用できる参考資料には、そのままコピーして使えるインストールコマンドは掲載されていません。
  • ベストプラクティス:モデルの重みを変換したりエンジンを起動したりする前に、最新のリリース手順を確認してください。

FreeTokenのインストール:システム要件

FreeTokenは、大規模な**Mixture-of-Experts(MoE)**モデル向けのエッジネイティブ・サービングシステムです。ゲーム、ダウンロード可能なキャラクタータイトル、または引き換えコードサービスではありません。そのため、インストールプロセスはGPU推論、ホストメモリ、CUDAサポート、モデルストレージ、ランタイム設定を中心に行います。

公開されている設計は、利用可能なVRAMを完全なエキスパートプールが上回る可能性のあるパーソナルコンピューター、ワークステーション、ノートパソコンを対象としています。FreeTokenはルーティング対象となるエキスパートプール全体をホストメモリに保持し、GPUメモリを可変式のエキスパートキャッシュとして使用します。エキスパート以外の重みはGPU上に残り、他のアプリケーションがVRAMを使用または解放すると、キャッシュ容量は変化します。

インストール時の考え方

FreeTokenはワンクリックアプリケーションではなく、システムデプロイメントとして扱ってください。ランタイムのスケジューリングは実際のマシンに依存するため、ハードウェアのプロファイリング、モデルの準備、メモリ計画もセットアップの一部です。

GPUクラス

ディスクリートのCUDA対応GPUが主な実行経路を提供します。参考評価では、8GBのノートパソコン向けGPUからワークステーションクラスのハードウェアまで検証されています。

ホストメモリ

システムメモリは完全なエキスパートプールを保存し、GPUキャッシュミスが発生した場合にCPU側でエキスパートを実行するための帯域幅を提供します。

高速ストレージ

NVMeストレージは起動時に重要です。FreeTokenは準備済みの重みを最終的なホストレイアウトへ直接読み込めます。

最も重要な違いは、容量性能の間にあります。モデル全体をVRAMに完全に収める必要はありませんが、ホスト側にはエキスパートプールを保持し、許容できるレイテンシーを実現する十分な転送帯域幅を提供する能力が必要です。

リソースFreeTokenでの役割セットアップ優先度
GPU VRAMエキスパート以外の重み、KVキャッシュ、可変式エキスパートスロットを保存
ホストメモリルーティング対象となるエキスパートプール全体を保持
PCIeリンク選択されたエキスパートをGPUキャッシュへ移動
CPU帯域幅ホストメモリから残りのエキスパートキャッシュミスを実行
NVMeストレージ起動時にモデルデータを読み込み
CUDA環境GPUカーネルとキャプチャ済み実行パスをサポート

参考システムの報告では、スペックシート上の想定よりもハードウェアのバランスが重要です。PCIe帯域幅が限られたノートパソコンではCPU実行を増やす構成が適する場合があり、一方でGPU転送帯域幅に余裕のあるデスクトップでは、より多くのキャッシュスロットを埋めることで性能が向上する可能性があります。

FreeTokenをインストールする前に

ランタイムを入手する前に、マシンとモデル資産を準備してください。公開されているシステムでは、FreeToken Weight(FTW)形式と呼ばれる正規化されたエキスパートレイアウトを使用します。この形式は、論理的なレイヤー・エキスパート識別子を基準にエキスパートバンクを整理し、CPUエグゼキューターとGPUキャッシュが同じマッピングを利用できるようにします。

利用可能な参考資料には、汎用的な変換コマンドやパッケージマネージャーの手順は記載されていません。他の推論エンジンのコマンドを推測して使用しないでください。代わりに、公式のFreeTokenプロジェクトのリリースチャンネルに関連付けられた最新のリリースドキュメントが公開されたら、それを使用してください。

ランチャーを推測しない

llama.cpp、Ollama、または別のサービングエンジンからコピーしたコマンドでは、必要なFTWレイアウトが作成されなかったり、FreeTokenのキャッシュや帯域幅ポリシーが正しく設定されなかったりする可能性があります。

次の準備表を使ってデプロイメントを整理してください。

準備項目確認する内容重要な理由
GPUCUDA互換アーキテクチャと十分な空きVRAMキャッシュサイズとカーネル互換性を決定する
メモリホスト側のエキスパートプール全体を収める十分な容量ページングや不安定な実行を防ぐ
ストレージ選択したチェックポイントとFTWファイル用のNVMe容量モデルの読み込み時間を短縮する
ドライバー対応する最新のNVIDIAドライバーとCUDAスタックGPU実行とグラフサポートを有効にする
モデル対応するMoEチェックポイントと精度バリアントエキスパートサイズとメモリ需要を決定する
ワークロードプロンプト長、エージェントのターン数、想定デコード速度KVキャッシュとプレフィル負荷に影響する

FreeTokenの設計は、次のような重要なランタイム動作をサポートしています。

  • 全レイヤーのダブルバッファリング:プレフィル中にエキスパート転送とGPU計算をオーバーラップさせます。
  • セマンティクス対応の状態キャッシュ:思考ブロック、ツール呼び出し、会話ターンの周辺にある有用なプレフィックスを保持します。
  • 共有LRUエキスパートキャッシュ:デコード中に変化するトークン単位のルーティングに追従します。
  • 帯域幅適応型実行:キャッシュミスをPCIe転送とCPUによる直接実行に分配します。
  • 可変式キャッシュ再構築:エンジンを再起動せず、スケジューラーが安全なポイントに到達した時点でGPUエキスパートキャッシュの予算を変更します。

初回のデプロイメントでは、1つのモデルと制御されたワークロードを使用してください。複数の大規模チェックポイントを同時にテストすることは避けましょう。ホストメモリとストレージの要件が、ランタイム上の問題と区別しにくくなる可能性があります。

デプロイメントの選択低リスクの開始オプションより高負荷なオプション
モデルサイズより小さい対応MoEチェックポイント最先端規模のMoEチェックポイント
精度サポートが文書化された公式精度専用の量子化レイアウト
ワークロード短時間の単一セッションテスト複数ターンのエージェントワークロード
キャッシュポリシーデフォルトの測定済み設定手動で調整したメモリ分割
ホスト実行最小限のCPUキャッシュミス処理積極的なCPU・GPUハイブリッド実行

FreeTokenセットアップの手順

以下の手順を順番に実行してください。この順序では、環境準備、モデル変換、ランタイムチューニングを分離しているため、問題の診断が容易になります。

推奨手順

まずホストを準備し、次にGPUスタックを確認し、その後モデルをステージングしてください。基本的なリクエストが成功してから、サービングキャッシュを調整します。

1

ホスト環境を準備する

メモリを大量に使用するアプリケーションを終了し、GPU、CPU、ホストメモリ、NVMeストレージがサービングに利用できることを確認します。VRAM総容量、システムメモリ、GPUモデル、PCIeリンク幅、ドライバーまたはCUDAのバージョンを記録してください。FreeTokenは変動するエッジリソース向けに設計されていますが、クリーンなベースラインを用意すると初回テストの信頼性が高まります。

2

公式ランタイムを入手する

FlashMLでFreeTokenのリリースとともに公開されている最新のインストール手順を使用してください。インストール前に、対応OS、CUDAバージョン、Pythonまたはネイティブ依存関係、モデル互換性を確認します。参考資料ではリリース場所は示されていますが、固定されたコマンド手順は指定されていません。

3

対応MoEチェックポイントをステージングする

認可された配布チャンネルからモデルファイルをダウンロードし、チェックポイントがランタイムの対応するエキスパート表現と一致することを確認します。元のチェックポイントと変換後のFTWファイルを保存するのに十分なストレージを確保してください。一般的なモデルファイルがすでにFreeTokenの最適化レイアウトになっているとは限りません。

4

FTWレイアウトを作成または入手する

FreeToken Weightファイルを変換またはダウンロードするためのリリースドキュメントに従ってください。FTWはランタイムが想定するレイアウトでエキスパートバンクを保存するため、ホストメモリへのアラインされた直接読み込みが可能になり、起動時のテンソル探索や再パッキングの繰り返しを避けられます。

5

制御されたテストを起動する

1件のリクエストと短いプロンプトから始めます。ホスト側のエキスパートプールが読み込まれ、GPUが初期化され、最初のリクエストが完了し、ルーティングされたエキスパートがホストメモリとGPUキャッシュの間を移動できることを確認してください。その後で、長いコンテキスト、ツール呼び出し、同時実行のエージェントセッションをテストします。

初期検証では、ピークスループットではなく機能を重視してください。ランタイムがコールドキャッシュ状態でリクエストを処理できることを確認します。FreeTokenは設計上、別個のウォームアップフェーズを必要としません。初期リクエストの実行を通じて、通常の処理の中でキャッシュを構築できます。

検証項目期待される結果失敗した場合
モデル検出選択したチェックポイントまたはFTW資産が認識されるモデル形式とリリース互換性を再確認する
ホスト読み込みエキスパートデータがホスト常駐プールに到達するメモリ容量、ファイルパス、権限を確認する
GPU起動エキスパート以外のレイヤーとランタイム状態が初期化されるCUDA、ドライバー、VRAMの利用可能状態を確認する
初回リクエストコールドキャッシュ推論が完了する転送、カーネル、CPUバックエンドのログを確認する
繰り返しデコード最近使用したエキスパートでキャッシュヒットが発生し始めるキャッシュ割り当てとルーティングサポートを確認する

FreeTokenの性能とメモリチューニング

FreeTokenの主要なチューニング概念は、ホスト側帯域幅とPCIe転送帯域幅の関係です。ランタイムは次の2つの値を測定またはプロファイリングします。

  • Bₚ:PCIe経由のピン留めエキスパート転送帯域幅。
  • Bₕ:CPUによるエキスパート実行に利用できる実効ホスト側帯域幅。

m個のエキスパートが欠落しているデコードステップでは、システムは次の関係でキャッシュ充填数を推定します。

q* ≈ m × Bₚ / Bₕ

これはユーザー向けの保証値でも、固定されたハードウェアルールでもありません。GPUキャッシュへの同時充填とCPU実行のバランスを取るスケジューリングモデルです。適切な分割は、ノートパソコンやデスクトップ、PCIe構成、メモリチャネル、バックグラウンド負荷によって変化します。

測定値から調整する

公称のPCIe仕様やメモリ仕様だけに頼らず、実際にデプロイするマシンで測定した帯域幅を使用してください。FreeTokenのスケジューリングポリシーは、モデルを実行している実際のハードウェアを反映するよう設計されています。

GPUメモリの予算も計画する必要があります。FreeTokenは、利用可能なVRAMをKVキャッシュと完全なエキスパートスロットに分配します。コンテキストが長くなるほどKVキャッシュの需要は増えますが、エキスパートキャッシュを大きくするとデコード時のキャッシュミスを減らせます。システムは安全なポイントでエキスパートキャッシュを再構築できるため、このバランスをセッション全体で固定しておく必要はありません。

Prefill

転送のオーバーラップとプレフィックスの再利用を優先します。長いプロンプトでは、エキスパートの移動と再計算のコストが顕在化します。

Decode

ルーティングの局所性と共有LRUキャッシュを優先します。静的な配置よりも、最近のエキスパート使用状況の方が有用です。

Agent Workloads

ツール呼び出しや編集されたコンテキストブロックの周辺にあるセマンティックなチェックポイントを保持します。

Shared Desktop

ブラウザー、ディスプレイ、ゲーム、その他のアプリケーション用にVRAMの余裕を残します。

参考評価は、結果を保証値とすることなく、規模を把握するための有用な指標を示しています。RTX 5090のテストシステムでは、FreeTokenはテストしたワークロードにおいて、Qwen3.6-35Bで毎秒77~83トークン、DeepSeek-V4-Flashで毎秒22~25トークンを報告しました。結果はモデルの精度、キャッシュ容量、ホスト帯域幅、プロンプト長、バックグラウンドアプリケーションによって異なります。

チューニング目標実践的な操作トレードオフ
初回トークンを高速化準備済みモデルレイアウトと転送のオーバーラップを有効にする正しいステージングと十分なストレージが必要
デコード速度を向上有効なエキスパートキャッシュ容量を増やすKVキャッシュに使えるVRAMが減る
より長いコンテキストKVページ用に多くのVRAMを確保するエキスパートキャッシュミスが増える可能性がある
キャッシュミス処理を改善測定値に基づくCPU・GPU協調を許可するホスト帯域幅とCPUリソースを使用する
デスクトップ利用を安定化サービングのメモリ予算を減らすキャッシュヒット率が低下する可能性がある

インストールチェックリストとトラブルシューティング

基本テストから本番形式のローカルエンドポイントまたはエージェントワークロードへ移行する前に、このチェックリストを使用してください。

トラブルシューティングの優先順位

テストが遅い場合は、設定を変更する前に、ボトルネックがストレージ読み込み、プレフィル転送、デコード時のキャッシュミス、CPU帯域幅、KVキャッシュ不足のいずれにあるかを特定してください。

デプロイメント準備状況:

  • GPU、ドライバー、CUDA環境、利用可能なVRAMを確認する
  • エキスパートプール全体を収めるのに十分なホストメモリを確保する
  • 対応MoEチェックポイントと文書化されたFTWレイアウトを使用する
  • 長時間のエージェントセッションをテストする前に、コールドキャッシュで1件のリクエストを実行する
  • チューニング用に測定したPCIeおよびホスト側帯域幅を記録する
症状可能性の高い領域最初の対応
起動に時間がかかりすぎるストレージまたは未準備の重みレイアウト文書化されたFTWパスと高速なローカルストレージを使用する
プレフィル中にGPUがアイドル状態になる転送と計算が直列化されている全レイヤーのダブルバッファリングが有効になっていることを確認する
デコードがCPU依存になるキャッシュミスが多すぎる、またはホスト帯域幅が限られているキャッシュサイズと測定帯域幅のバランスを確認する
長時間のセッションで速度が低下するKVキャッシュが元のエキスパート予算を消費しているランタイムの安全なポイントでVRAMを再配分する
ランタイムがモデルを提供できない対応していない表現、またはホストメモリ不足リリースのモデルおよびプラットフォーム対応表を確認する
デスクトップが不安定になる他のアプリケーションがVRAMを消費しているバックグラウンドのワークロードを終了するか、サービング割り当てを減らす

FreeTokenのフォールバック動作も重要です。OSまたはドライバーの制限により、エキスパートプール全体をピン留めしたりDMA用に登録したりできない場合、ランタイムはCPUのみのMoEバックエンドを使用できます。これによりデプロイのしやすさは向上しますが、高速な転送経路は利用できなくなります。エキスパート以外のレイヤーはGPU上に残しつつ、アクティベーションサイズの入力、ルーティングメタデータ、出力をデバイス間で転送することも可能です。

短いプロンプト1件だけでインストール品質を判断しないでください。プレフィルとデコードはシステムの異なる部分に負荷をかけ、複数ターンのエージェントセッションではコンテキスト処理が繰り返し発生します。有効なテスト計画には、短いリクエスト1件、長いプロンプト1件、繰り返しデコード、コンテキスト編集ワークロードを含めてください。

FreeTokenインストール FAQ

Q: FreeTokenはゲームまたは引き換えコードプラットフォームですか?

いいえ。FreeTokenはエッジネイティブなMoEモデルサービングシステムです。インストールでは、GPU推論、ホストメモリ、モデルファイル、CUDAサポート、ランタイム設定を扱います。

Q: FreeTokenのインストーラーまたはリリースパッケージはどこで入手できますか?

公開されているプロジェクト説明では、FlashMLで本システムが告知されています。パッケージ名、依存関係、コマンドについては、公式の最新リリースドキュメント(https://flashml.ai/)を使用してください。参考資料には固定されたランチャーコマンドが記載されていません。

Q: すべてのモデルの重みをVRAMに収める必要がありますか?

いいえ。FreeTokenはルーティング対象となるエキスパートプール全体をホストメモリに保持し、GPUメモリを可変式のエキスパートキャッシュとして使用します。ただしVRAMには、エキスパート以外の重み、ランタイム状態、KVキャッシュページ、キャッシュされたエキスパートを保持する必要があります。

Q: なぜFreeTokenには帯域幅プロファイリングが必要なのですか?

デコード時のキャッシュミスはGPUへ転送することも、CPU上で直接実行することもできます。FreeTokenは測定したPCIe帯域幅とホスト側帯域幅を使用して、これらの経路間で実用的な分配を決定します。

リリース状況に関する注意

2026年のリリースが進むにつれて、インストールの詳細は変更される可能性があります。変換コマンドやサービングコマンドを実行する前に、公式パッケージ、対応モデル形式、プラットフォーム要件を確認してください。