FreeToken Wiki
最先端のオープンウェイトMoEモデルを、コンシューマー向けNVIDIA GPU上でローカル実行。適応型CPU-GPU実行、効率的なキャッシュ、量子化、OpenAIまたはAnthropic互換APIに対応しています。
FreeToken Wikiガイド
FreeTokenを使って大規模MoEモデルをローカルにインストール、設定、実行するために必要なすべてを紹介します
Latest Updates
Discover the newest guides, tips, and content
FreeToken 290bモデル:2026年版エッジMoEセットアップガイド
適応型キャッシュ、帯域幅スケジューリング、弾性メモリによって、FreeTokenがコンシューマー向けハードウェアでフロンティア規模のMoEモデルを提供する仕組みを解説します。
FreeToken 4gb vram:セットアップガイドとハードウェアの制限
FreeTokenが限られたVRAM、CPUオフロード、エキスパートキャッシュをどのように扱うか、そしてローカルMoEサービングに必要な現実的なハードウェア要件を解説します。
FreeToken 753bモデル:セットアップガイドとMoEチューニングのヒント
FreeTokenがローカル環境で753BのGLM-5.2を提供する仕組みを解説します。セットアップ、メモリページング、MoEキャッシュ、ベンチマーク、実践的なチューニング方法を取り上げます。
FreeToken Anthropic API:ステップごとのセットアップガイド
安全なキー、環境変数、リクエストテスト、トラブルシューティングのヒントを使用して、FreeTokenプロジェクトでAnthropic APIアクセスを設定します。
FreeToken api:ローカルMoEサービング設定ガイド 2026
FreeTokenがエキスパートキャッシュ、適応型CPU-GPU実行、柔軟なメモリ管理によって、大規模MoEモデルをローカルで提供する仕組みを解説します。
FreeToken api server:セットアップガイドとランタイムのヒント
FreeToken api server による MoE キャッシュ、CPU-GPU 実行、ハードウェアチェック、実用的なローカルサービングの判断方法について解説します。
FreeTokenベンチマーク:ローカルMoEサービングセットアップガイド
FreeToken claude code:モデルルーティングのセットアップガイド
ローカルゲートウェイ、モデルルーティング、フォールバックプロバイダー、安全なトラブルシューティング手順を使って FreeToken claude code を設定します。
FreeToken codex:セットアップガイド、ベンチマークと制限事項
FreeToken codexを解説します。エキスパート認識型メモリシステムの仕組み、ベンチマーク、ハードウェア制限、セットアップ時の注意点、ローカルAIのトレードオフを確認できます。
FreeToken deepseek:ローカルAIセットアップガイドとベンチマーク
MoEキャッシュ、CPU-GPUオフロード、ハードウェアの指針、セットアップ手順、パフォーマンスに関する注意点を通じて、FreeTokenがDeepSeekをローカルで提供する方法を解説します。
FreeToken DeepSeek V4 Flash:ローカルセットアップガイド 2026
RAM計画、GPU要件、Open WebUIへのアクセス、トラブルシューティングを含む、FreeTokenでDeepSeek V4 FlashをローカルAI推論用にセットアップする方法を解説します。
FreeTokenエッジネイティブMoEサービング:アーキテクチャガイド
FreeTokenが帯域幅適応型実行、キャッシュ、CPU-GPU協調を活用して、エッジハードウェア上で大規模MoEモデルを提供する方法を解説します。
FreeTokenインストールガイド
デスクトップアプリ、uv、PyPI、またはソースコードを使ってFreeTokenをセットアップし、最初のローカルモデルサーバーを起動します。NVIDIA GPUユーザーは、高速化対応Pythonパッケージをインストールし、システム帯域幅を確認したうえで、ft CLIからOpenAI互換サーバーを起動できます。
ホストシステムを確認する
対応するNVIDIA GPUを搭載したWindowsまたはLinux PCを使用します。FreeTokenはRTX 30、RTX 40、RTX 50シリーズのシステムを対象としており、GPUメモリとシステムRAMを組み合わせて大規模モデルを実行できます。
デスクトップアプリをインストールする
最も簡単にセットアップするには、WindowsまたはLinux向けのFreeTokenデスクトップアプリをダウンロードしてインストールします。デスクトップワークフローでは、ローカルモデルの設定と提供をグラフィカルに行えます。
uvでインストールする
uvを使って、高速化対応FreeTokenパッケージをPython環境にインストールします。
uv pip install "freetoken[accel]"PyPIからインストールする
uvを使用しない場合は、標準的なPythonパッケージの手順で同じ高速化対応パッケージをインストールできます。
pip install "freetoken[accel]"ソースコードからインストールする
開発版が必要な場合やソースツリーを直接扱いたい場合は、FreeTokenリポジトリをクローンし、プロジェクトと高速化用の依存関係をインストールします。
git clone https://github.com/FlashML-org/FreeToken.gitホストの帯域幅を測定する
非常に大規模なMoEチェックポイントを提供する前に、組み込みの帯域幅ベンチマークを実行します。FreeTokenはその結果を使用して、CPUメモリとGPUをどの程度効率的に連携させられるかを判断します。
ft bench bwモデルサーバーを起動する
ft serveでFreeTokenのサービングワークフローを起動します。サーバーは、アプリケーションやコーディングエージェント向けに、OpenAI互換およびAnthropic互換のインターフェースを通じてローカル推論を提供します。
ft serve初回実行を確認する
外部クライアント(Codex、Claude Code、OpenCodeなど)を接続する前に、選択したモデルが読み込まれ、サーバーが稼働し続け、ローカルAPIリクエストから生成結果が返されることを確認します。
Quick Tips
- freetoken[accel]エクストラをインストールすると、RTXクラスのハードウェアに必要なGPU高速化スタックが導入されます。
- 最初の大規模モデルを実行する前にft bench bwを一度実行すると、FreeTokenが効率的な実行戦略を選択できます。
- デスクトップアプリとft CLIは同じエンジンを使用するため、自由に切り替えられます。
- 高速化パッケージ内でのカーネルエラーや互換性エラーを避けるため、CUDAとNVIDIAドライバーは最新の状態に保ってください。
FreeToken対応モデル
FreeTokenは、総パラメータ数が単一のコンシューマー向けGPUのメモリ容量を超えることもある、大規模なスパースMixture-of-Expertsモデルを中心に設計されています。実行バックエンドは、GPU計算、システムメモリ、エキスパートキャッシュ、モデル固有のチェックポイント処理を組み合わせ、これらのモデルをローカルマシンで実用的に動作させます。
| モデル | 規模 | チェックポイント形式 | 量子化 | バックエンド | 最適な用途 |
|---|---|---|---|---|---|
| GLM-5.2 | 総パラメータ数753B | GLM MoEチェックポイント | MXFP4 / NVFP4 / FP8 / BF16 | ハイブリッドMoE / エキスパートオフロード | 高容量ワークステーションでのサービング |
| DeepSeek-V4-Flash | 大規模スパースMoE | DeepSeek MoEチェックポイント | MXFP4 / NVFP4 / FP8 / BF16 | ハイブリッドMoE / エキスパートオフロード | ローカル推論およびエージェントワークロード |
| Qwen3.6 | 35B-A3BクラスのスパースMoE | Qwen MoEチェックポイント | MXFP4 / NVFP4 / FP8 / BF16 | MoEサービングバックエンド | ローカルチャット、コーディング、エージェント |
| Qwen3 MoE | 複数のスパースモデル規模 | Qwen MoEチェックポイント | MXFP4 / NVFP4 / FP8 / BF16 | MoEサービングバックエンド | 汎用ローカル推論 |
| gpt-oss | 複数のチェックポイント規模 | gpt-ossチェックポイント | MXFP4 / NVFP4 / FP8 / BF16 | スパースモデルサービングバックエンド | OpenAI互換アプリのワークフロー |
| Gemma-4 | モデルに依存 | Gemmaチェックポイント | MXFP4 / NVFP4 / FP8 / BF16 | モデルに適したバックエンド | ローカル汎用推論 |
| MiniMax | 大規模スパースMoE | MiniMaxチェックポイント | MXFP4 / NVFP4 / FP8 / BF16 | ハイブリッドMoE / エキスパートオフロード | 大規模コンテキストのエージェントワークロード |
Quick Tips
- 主要なすべてのモデルファミリーが、FP8およびBF16に加えてMXFP4とNVFP4の低精度チェックポイントに対応しています。
- 量子化方式は、チェックポイントのサイズと、VRAMとシステムRAMを合計した予算を照らし合わせて選択してください。
- 最大規模のチェックポイントにはハイブリッドMoE実行が適しており、より小規模なスパースモデルはGPU上に多くを常駐させられます。
- 新しいモデルファミリーは定期的に追加されるため、エンジンのリリースごとにモデルのドキュメントを確認してください。
FreeTokenのハードウェア要件
FreeTokenでは、モデル全体をGPU VRAM内に収める必要はありません。帯域幅に適応するCPU-GPU実行、エキスパートキャッシュ、柔軟なメモリ管理により、スパースMoEチェックポイントはGPUメモリとホストRAMの両方を使用できます。そのため、GPUの純粋な容量だけでなく、システムメモリとPCIe帯域幅も重要です。
| コンポーネント | 要件 | 重要な理由 |
|---|---|---|
| オペレーティングシステム | WindowsまたはLinux | どちらのプラットフォームもデスクトップアプリとローカルサービングワークフローに対応しています。 |
| GPUファミリー | NVIDIA RTX 30 / 40 / 50シリーズ | 新しいGPUほどVRAMと計算リソースに余裕があり、より大規模なアクティブエキスパートセットに対応できます。 |
| GPU VRAM | モデル、精度、キャッシュに依存 | VRAMが多いほど、アクティブな重みとキャッシュ済みエキスパートをGPU上に保持でき、転送を削減できます。 |
| システムRAM | 大規模MoEチェックポイントには大容量が必要 | ホストRAMがVRAMを超える重みを保持するため、はるかに大きなチェックポイントを実行できます。 |
| CPUメモリ帯域幅 | オフロードでは高いほど有利 | 帯域幅適応型実行では、測定されたホストメモリ性能を使用します。 |
| PCIe帯域幅 | 高速転送を推奨 | エキスパートの重みをRAMとVRAMの間でどれだけ速く移動できるかを左右します。 |
| CUDAとドライバー | 互換性のあるNVIDIAランタイム | freetoken[accel]を通じた高速GPU実行に必要です。 |
| 290B以上のクラスのモデル | 大容量のホストRAMとRTX GPU | ハイブリッドCPU-GPU実行により、モデル全体をVRAMに収める必要がなくなります。 |
| 最大規模のチェックポイント | ワークステーション向けRAM、ストレージ、帯域幅 | 753BパラメータのGLM-5.2など、最先端規模のスパースモデルを提供できます。 |
Quick Tips
- RTX 30シリーズは、中規模のチェックポイントや、より強い量子化に適しています。
- RTX 40シリーズは、ハイブリッドMoEワークロードでより高い推論性能とメモリ効率を発揮します。
- RTX 50シリーズは、NVFP4低精度形式や、より大規模で高スループットなデプロイに適しています。
- デュアルチャネル以上のシステムメモリは、オフロードされたエキスパートの転送速度を直接向上させます。
FreeToken ベンチマーク
FreeToken のパフォーマンスは GPU の演算性能だけで決まるわけではありません。大規模な MoE チェックポイントでは、エキスパートがホストメモリと GPU の間を継続的に移動する場合があるためです。FreeToken のベンチマークツールは、特定のマシンで利用可能な帯域幅を測定し、ランタイムがより多くのオフロードを行う方式と、より多くを GPU に常駐させるハイブリッド実行のどちらを選択するかを支援します。
| ベンチマーク | コマンド | 測定対象 | 重要性 |
|---|---|---|---|
| CPU メモリ帯域幅 | ft bench bw | ホストメモリのスループット | オフロードされたエキスパートの重みはシステム RAM から読み込まれるため、帯域幅がエキスパートの転送速度を直接向上させます。 |
| CPU-GPU 間帯域幅 | ft bench bw | PCIe 転送スループット | 重みがすでに VRAM にない場合に、GPU へ到達する速度を決定します。 |
| デコードスループット | ft serve | 1 秒あたりの生成トークン数 | プロンプト処理後のインタラクティブな生成速度です。 |
| プリフィルスループット | ft serve | プロンプト処理のスループット | ダブルバッファリングされたプリフィルストリーミングにより、長いプロンプトでデータ移動と計算をオーバーラップさせます。 |
| GPU メモリ使用量 | ft serve | 重み、キャッシュ、状態に使用する VRAM | 弾力的な VRAM 管理により、メモリ予算内にモデルを常駐させます。 |
| システムメモリ使用量 | ft serve | チェックポイントとエキスパートに使用する RAM | 大容量のホストメモリにより、GPU VRAM をはるかに上回るチェックポイントを扱えます。 |
| エキスパートキャッシュ効率 | ft serve | GPU に常駐するエキスパートの再利用 | グローバル LRU キャッシュにより、CPU-GPU 間の転送の繰り返しを削減します。 |
| オフロード実行 | ft bench bw | ホストに常駐するエキスパートの割合 | VRAM が限られていても、CPU メモリと PCIe の帯域幅が十分に高い環境で最も効果を発揮します。 |
| ハイブリッド MoE 実行 | ft bench bw | GPU とホストのエキスパート構成 | VRAM 容量、キャッシュ局所性、転送帯域幅のバランスを取ります。 |
| コンシューマー向けノート PC プロファイル | ft bench bw | モバイル環境の帯域幅制限 | ノート PC のメモリ容量に適した、より小さい、またはより強く量子化されたチェックポイントの選択に役立ちます。 |
| ゲーミング PC プロファイル | ft bench bw | デスクトップ RTX + RAM + PCIe | RTX 30、40、50 シリーズ搭載システムにおける、一般的な FreeToken 構成です。 |
| ワークステーションプロファイル | ft bench bw | あらゆるリソースの大容量構成 | CPU と GPU の協調動作により、フロンティア規模のスパースチェックポイントをサポートします。 |
Quick Tips
- 新しいマシンでは、実行戦略を選択する前に必ず ft bench bw を実行してください。
- 大半のエキスパートをオフロードする場合、デコード速度はホスト帯域幅に大きく左右されます。
- 十分な数のエキスパートを VRAM に収められる場合、ハイブリッド実行は通常、完全なオフロードより高速です。
- 長いコンテキストのワークロードでは両方に負荷がかかるため、プリフィルとデコードを合わせて比較してください。
FreeToken API ガイド
FreeToken は、使い慣れた API 形式を通じてローカルモデル推論を提供します。ft serve でサポート対象モデルを読み込んだ後、アプリケーションからモデルの一覧取得、Chat Completions API または Responses API リクエストの送信、Anthropic 形式のメッセージの利用、ローカルサーバーからの生成トークンのストリーミングが可能です。
サポート対象モデルを指定して FreeToken のサービングプロセスを起動します。サーバーはモデルの読み込み、CPU-GPU 実行、メモリ割り当て、HTTP API リクエストを処理します。
ft serve <model>
OpenAI Chat Completions
OpenAI-compatible既存の SDK または HTTP クライアントから、OpenAI 互換の Chat Completions エンドポイントを使用します。
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "<model>",
"messages": [
{"role": "user", "content": "Mixture-of-Experts モデルについて説明してください。"}
]
}'OpenAI Responses API
OpenAI-compatible新しい OpenAI Responses API を中心に構築されたアプリケーションから、対応するローカルエンドポイントへリクエストを送信できます。
curl http://localhost:8000/v1/responses \
-H "Content-Type: application/json" \
-d '{
"model": "<model>",
"input": "リストを反転する短い Python 関数を書いてください。"
}'利用可能なモデルを一覧表示する
OpenAI-compatibleOpenAI 互換の models エンドポイントに問い合わせて、実行中の FreeToken サーバーが公開しているモデルを確認します。
curl http://localhost:8000/v1/models
Anthropic Messages API
Anthropic-compatibleFreeToken は、Anthropic API を中心に設計されたクライアントやコーディングツール向けに、Anthropic 互換の messages インターフェースも提供します。
curl http://localhost:8000/v1/messages \
-H "Content-Type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "<model>",
"max_tokens": 512,
"messages": [
{"role": "user", "content": "このリポジトリのアーキテクチャを要約してください。"}
]
}'ストリーミングレスポンス
SSEクライアントがサーバー送信イベントによる逐次出力に対応している場合はストリーミングを有効にし、生成されたトークンを到着時に利用できるようにします。
{
"model": "<model>",
"messages": [
{"role": "user", "content": "REST API の例を書いてください。"}
],
"stream": true
}CLI オプションを確認する
CLIFreeToken では、より新しいエンジンリリースで追加されたオプションを含め、現在のサービングおよびランタイムのオプションをコマンドラインヘルプから直接確認できます。
ft --help ft serve --help
FreeToken Claude Code と Codex のセットアップ
FreeToken は、OpenAI または Anthropic 互換 API に対応したエージェント型コーディングツールのローカル推論バックエンドとして利用できます。ft launch ワークフローはサポート対象エージェントの設定を支援し、dry-run モードでは、実際に変更や起動を行う前に予定されているセットアップを確認できます。
FreeToken をインストールして確認する
外部コーディングエージェントを接続する前に、FreeToken CLI がインストールされ、サポート対象モデルをローカルで読み込めることを確認してください。
ft --helpエージェントの起動オプションを確認する
launch コマンドのヘルプを使用して、現在サポートされているエージェント連携と利用可能な設定オプションを確認します。
ft launch --helpdry run でプレビューする
最終的なワークフローを開始せずに生成されるコマンドと環境設定を確認したい場合は、エージェントを起動する前に dry-run モードを使用します。
ft launch <agent> --dry-runコーディングエージェントを起動する
FreeToken を通じて選択したコーディングエージェントを起動し、その API 設定がローカル推論バックエンドを指すようにします。
ft launch <agent>Claude Code
Claude Code は FreeToken の Anthropic 互換インターフェースを利用できます。ローカル設定により、サポート対象の Anthropic メッセージトラフィックを FreeToken サーバーへリダイレクトしながら、エージェントのワークフローを維持します。
ft launch claudeCodex
Codex 形式のクライアントは FreeToken の OpenAI 互換エンドポイント経由で接続でき、ローカルでサービングされるモデルにエージェントのリクエストを処理させることができます。
ft launch codexOpenCode、Hermes、OpenClaw
FreeToken の launch ワークフローは、OpenCode、Hermes、OpenClaw など、追加のコーディングクライアントや自律エージェントクライアントにも対応します。現在の連携名とオプションについては、launch のヘルプを確認してください。
ft launch --helpクラウド API へのフォールバックを防ぐ
長時間のタスクを開始する前に、エージェントのプロバイダーとベース URL の設定を確認してください。完全なローカル推論を目的とする場合は、不要なクラウドプロバイダー設定を削除または無効化し、dry-run モードを使用して FreeToken がエージェントに渡す環境を確認します。
ft launch <agent> --dry-runQuick Tips
- 新しいエージェントを初めて実際に起動する前に、必ず一度 dry-run プレビューを実行してください。
- 長時間のセッションでは同じエンドポイントに再接続するため、エージェントの動作中は FreeToken サーバーを起動したままにしてください。
- セットアップ後にプロバイダーのベース URL を確認し、リクエストがホスト型 API ではなくローカルサーバーに到達していることを確認してください。
- 連携名はエンジンのリリースに伴って変わるため、アップグレード後は ft launch --help を再確認してください。
FreeTokenのアーキテクチャ
FreeTokenは、Mixture-of-Expertsモデルのスパース構造を中心に設計されています。すべてのエキスパートの重みをGPUメモリに保持する必要はなく、CPUとGPUの実行を協調させ、頻繁に使用されるエキスパートをキャッシュし、転送と計算をオーバーラップさせ、モデルを実行するマシンに合わせてメモリ使用量を適応させます。
FreeTokenのアップデートとリリース
FreeTokenは、推論エンジンとデスクトップ体験の両方で進化を続けています。リリーストラッカーでは、インストール、モデル互換性、ローカルサービング、GPUサポート、パフォーマンス、エージェントワークフローに直接影響する変更に焦点を当てています。
Follow FreeToken Development
Track new releases and join the community through the official channels: