エッジネイティブMoE推論エンジン

FreeToken Wiki

最先端のオープンウェイトMoEモデルを、コンシューマー向けNVIDIA GPU上でローカル実行。適応型CPU-GPU実行、効率的なキャッシュ、量子化、OpenAIまたはAnthropic互換APIに対応しています。

GitHubで見る

FreeToken Wikiガイド

FreeTokenを使って大規模MoEモデルをローカルにインストール、設定、実行するために必要なすべてを紹介します

Latest Updates

Discover the newest guides, tips, and content

FreeToken 290bモデル:2026年版エッジMoEセットアップガイド

適応型キャッシュ、帯域幅スケジューリング、弾性メモリによって、FreeTokenがコンシューマー向けハードウェアでフロンティア規模のMoEモデルを提供する仕組みを解説します。

2026年8月25日performance
Read more →
FreeToken 4gb vram:セットアップガイドとハードウェアの制限

FreeTokenが限られたVRAM、CPUオフロード、エキスパートキャッシュをどのように扱うか、そしてローカルMoEサービングに必要な現実的なハードウェア要件を解説します。

2026年8月25日hardware
Read more →
FreeToken 753bモデル:セットアップガイドとMoEチューニングのヒント

FreeTokenがローカル環境で753BのGLM-5.2を提供する仕組みを解説します。セットアップ、メモリページング、MoEキャッシュ、ベンチマーク、実践的なチューニング方法を取り上げます。

2026年8月25日performance
Read more →
FreeToken Anthropic API:ステップごとのセットアップガイド

安全なキー、環境変数、リクエストテスト、トラブルシューティングのヒントを使用して、FreeTokenプロジェクトでAnthropic APIアクセスを設定します。

2026年8月25日api
Read more →
FreeToken api:ローカルMoEサービング設定ガイド 2026

FreeTokenがエキスパートキャッシュ、適応型CPU-GPU実行、柔軟なメモリ管理によって、大規模MoEモデルをローカルで提供する仕組みを解説します。

2026年8月25日api
Read more →
FreeToken api server:セットアップガイドとランタイムのヒント

FreeToken api server による MoE キャッシュ、CPU-GPU 実行、ハードウェアチェック、実用的なローカルサービングの判断方法について解説します。

2026年8月25日api
Read more →
FreeTokenベンチマーク:ローカルMoEサービングセットアップガイド

FreeTokenベンチマーク、ローカルMoEサービング設計、ハードウェア要件、インストール手順、実測パフォーマンス結果を解説します。

2026年8月25日performance
Read more →
FreeToken claude code:モデルルーティングのセットアップガイド

ローカルゲートウェイ、モデルルーティング、フォールバックプロバイダー、安全なトラブルシューティング手順を使って FreeToken claude code を設定します。

2026年8月25日agents
Read more →
FreeToken codex:セットアップガイド、ベンチマークと制限事項

FreeToken codexを解説します。エキスパート認識型メモリシステムの仕組み、ベンチマーク、ハードウェア制限、セットアップ時の注意点、ローカルAIのトレードオフを確認できます。

2026年8月25日agents
Read more →
FreeToken deepseek:ローカルAIセットアップガイドとベンチマーク

MoEキャッシュ、CPU-GPUオフロード、ハードウェアの指針、セットアップ手順、パフォーマンスに関する注意点を通じて、FreeTokenがDeepSeekをローカルで提供する方法を解説します。

2026年8月25日models
Read more →
FreeToken DeepSeek V4 Flash:ローカルセットアップガイド 2026

RAM計画、GPU要件、Open WebUIへのアクセス、トラブルシューティングを含む、FreeTokenでDeepSeek V4 FlashをローカルAI推論用にセットアップする方法を解説します。

2026年8月25日models
Read more →
FreeTokenエッジネイティブMoEサービング:アーキテクチャガイド

FreeTokenが帯域幅適応型実行、キャッシュ、CPU-GPU協調を活用して、エッジハードウェア上で大規模MoEモデルを提供する方法を解説します。

2026年8月25日architecture
Read more →
Install

FreeTokenインストールガイド

デスクトップアプリ、uv、PyPI、またはソースコードを使ってFreeTokenをセットアップし、最初のローカルモデルサーバーを起動します。NVIDIA GPUユーザーは、高速化対応Pythonパッケージをインストールし、システム帯域幅を確認したうえで、ft CLIからOpenAI互換サーバーを起動できます。

1

ホストシステムを確認する

対応するNVIDIA GPUを搭載したWindowsまたはLinux PCを使用します。FreeTokenはRTX 30、RTX 40、RTX 50シリーズのシステムを対象としており、GPUメモリとシステムRAMを組み合わせて大規模モデルを実行できます。

2

デスクトップアプリをインストールする

最も簡単にセットアップするには、WindowsまたはLinux向けのFreeTokenデスクトップアプリをダウンロードしてインストールします。デスクトップワークフローでは、ローカルモデルの設定と提供をグラフィカルに行えます。

3

uvでインストールする

uvを使って、高速化対応FreeTokenパッケージをPython環境にインストールします。

uv pip install "freetoken[accel]"
4

PyPIからインストールする

uvを使用しない場合は、標準的なPythonパッケージの手順で同じ高速化対応パッケージをインストールできます。

pip install "freetoken[accel]"
5

ソースコードからインストールする

開発版が必要な場合やソースツリーを直接扱いたい場合は、FreeTokenリポジトリをクローンし、プロジェクトと高速化用の依存関係をインストールします。

git clone https://github.com/FlashML-org/FreeToken.git
6

ホストの帯域幅を測定する

非常に大規模なMoEチェックポイントを提供する前に、組み込みの帯域幅ベンチマークを実行します。FreeTokenはその結果を使用して、CPUメモリとGPUをどの程度効率的に連携させられるかを判断します。

ft bench bw
7

モデルサーバーを起動する

ft serveでFreeTokenのサービングワークフローを起動します。サーバーは、アプリケーションやコーディングエージェント向けに、OpenAI互換およびAnthropic互換のインターフェースを通じてローカル推論を提供します。

ft serve
8

初回実行を確認する

外部クライアント(Codex、Claude Code、OpenCodeなど)を接続する前に、選択したモデルが読み込まれ、サーバーが稼働し続け、ローカルAPIリクエストから生成結果が返されることを確認します。

Quick Tips

  • freetoken[accel]エクストラをインストールすると、RTXクラスのハードウェアに必要なGPU高速化スタックが導入されます。
  • 最初の大規模モデルを実行する前にft bench bwを一度実行すると、FreeTokenが効率的な実行戦略を選択できます。
  • デスクトップアプリとft CLIは同じエンジンを使用するため、自由に切り替えられます。
  • 高速化パッケージ内でのカーネルエラーや互換性エラーを避けるため、CUDAとNVIDIAドライバーは最新の状態に保ってください。
Models

FreeToken対応モデル

FreeTokenは、総パラメータ数が単一のコンシューマー向けGPUのメモリ容量を超えることもある、大規模なスパースMixture-of-Expertsモデルを中心に設計されています。実行バックエンドは、GPU計算、システムメモリ、エキスパートキャッシュ、モデル固有のチェックポイント処理を組み合わせ、これらのモデルをローカルマシンで実用的に動作させます。

モデル規模チェックポイント形式量子化バックエンド最適な用途
GLM-5.2総パラメータ数753BGLM MoEチェックポイントMXFP4 / NVFP4 / FP8 / BF16ハイブリッドMoE / エキスパートオフロード高容量ワークステーションでのサービング
DeepSeek-V4-Flash大規模スパースMoEDeepSeek MoEチェックポイントMXFP4 / NVFP4 / FP8 / BF16ハイブリッドMoE / エキスパートオフロードローカル推論およびエージェントワークロード
Qwen3.635B-A3BクラスのスパースMoEQwen MoEチェックポイントMXFP4 / NVFP4 / FP8 / BF16MoEサービングバックエンドローカルチャット、コーディング、エージェント
Qwen3 MoE複数のスパースモデル規模Qwen MoEチェックポイントMXFP4 / NVFP4 / FP8 / BF16MoEサービングバックエンド汎用ローカル推論
gpt-oss複数のチェックポイント規模gpt-ossチェックポイントMXFP4 / NVFP4 / FP8 / BF16スパースモデルサービングバックエンドOpenAI互換アプリのワークフロー
Gemma-4モデルに依存GemmaチェックポイントMXFP4 / NVFP4 / FP8 / BF16モデルに適したバックエンドローカル汎用推論
MiniMax大規模スパースMoEMiniMaxチェックポイントMXFP4 / NVFP4 / FP8 / BF16ハイブリッドMoE / エキスパートオフロード大規模コンテキストのエージェントワークロード

Quick Tips

  • 主要なすべてのモデルファミリーが、FP8およびBF16に加えてMXFP4とNVFP4の低精度チェックポイントに対応しています。
  • 量子化方式は、チェックポイントのサイズと、VRAMとシステムRAMを合計した予算を照らし合わせて選択してください。
  • 最大規模のチェックポイントにはハイブリッドMoE実行が適しており、より小規模なスパースモデルはGPU上に多くを常駐させられます。
  • 新しいモデルファミリーは定期的に追加されるため、エンジンのリリースごとにモデルのドキュメントを確認してください。
Hardware

FreeTokenのハードウェア要件

FreeTokenでは、モデル全体をGPU VRAM内に収める必要はありません。帯域幅に適応するCPU-GPU実行、エキスパートキャッシュ、柔軟なメモリ管理により、スパースMoEチェックポイントはGPUメモリとホストRAMの両方を使用できます。そのため、GPUの純粋な容量だけでなく、システムメモリとPCIe帯域幅も重要です。

コンポーネント要件重要な理由
オペレーティングシステムWindowsまたはLinuxどちらのプラットフォームもデスクトップアプリとローカルサービングワークフローに対応しています。
GPUファミリーNVIDIA RTX 30 / 40 / 50シリーズ新しいGPUほどVRAMと計算リソースに余裕があり、より大規模なアクティブエキスパートセットに対応できます。
GPU VRAMモデル、精度、キャッシュに依存VRAMが多いほど、アクティブな重みとキャッシュ済みエキスパートをGPU上に保持でき、転送を削減できます。
システムRAM大規模MoEチェックポイントには大容量が必要ホストRAMがVRAMを超える重みを保持するため、はるかに大きなチェックポイントを実行できます。
CPUメモリ帯域幅オフロードでは高いほど有利帯域幅適応型実行では、測定されたホストメモリ性能を使用します。
PCIe帯域幅高速転送を推奨エキスパートの重みをRAMとVRAMの間でどれだけ速く移動できるかを左右します。
CUDAとドライバー互換性のあるNVIDIAランタイムfreetoken[accel]を通じた高速GPU実行に必要です。
290B以上のクラスのモデル大容量のホストRAMとRTX GPUハイブリッドCPU-GPU実行により、モデル全体をVRAMに収める必要がなくなります。
最大規模のチェックポイントワークステーション向けRAM、ストレージ、帯域幅753BパラメータのGLM-5.2など、最先端規模のスパースモデルを提供できます。

Quick Tips

  • RTX 30シリーズは、中規模のチェックポイントや、より強い量子化に適しています。
  • RTX 40シリーズは、ハイブリッドMoEワークロードでより高い推論性能とメモリ効率を発揮します。
  • RTX 50シリーズは、NVFP4低精度形式や、より大規模で高スループットなデプロイに適しています。
  • デュアルチャネル以上のシステムメモリは、オフロードされたエキスパートの転送速度を直接向上させます。
Benchmarks

FreeToken ベンチマーク

FreeToken のパフォーマンスは GPU の演算性能だけで決まるわけではありません。大規模な MoE チェックポイントでは、エキスパートがホストメモリと GPU の間を継続的に移動する場合があるためです。FreeToken のベンチマークツールは、特定のマシンで利用可能な帯域幅を測定し、ランタイムがより多くのオフロードを行う方式と、より多くを GPU に常駐させるハイブリッド実行のどちらを選択するかを支援します。

ベンチマークコマンド測定対象重要性
CPU メモリ帯域幅ft bench bwホストメモリのスループットオフロードされたエキスパートの重みはシステム RAM から読み込まれるため、帯域幅がエキスパートの転送速度を直接向上させます。
CPU-GPU 間帯域幅ft bench bwPCIe 転送スループット重みがすでに VRAM にない場合に、GPU へ到達する速度を決定します。
デコードスループットft serve1 秒あたりの生成トークン数プロンプト処理後のインタラクティブな生成速度です。
プリフィルスループットft serveプロンプト処理のスループットダブルバッファリングされたプリフィルストリーミングにより、長いプロンプトでデータ移動と計算をオーバーラップさせます。
GPU メモリ使用量ft serve重み、キャッシュ、状態に使用する VRAM弾力的な VRAM 管理により、メモリ予算内にモデルを常駐させます。
システムメモリ使用量ft serveチェックポイントとエキスパートに使用する RAM大容量のホストメモリにより、GPU VRAM をはるかに上回るチェックポイントを扱えます。
エキスパートキャッシュ効率ft serveGPU に常駐するエキスパートの再利用グローバル LRU キャッシュにより、CPU-GPU 間の転送の繰り返しを削減します。
オフロード実行ft bench bwホストに常駐するエキスパートの割合VRAM が限られていても、CPU メモリと PCIe の帯域幅が十分に高い環境で最も効果を発揮します。
ハイブリッド MoE 実行ft bench bwGPU とホストのエキスパート構成VRAM 容量、キャッシュ局所性、転送帯域幅のバランスを取ります。
コンシューマー向けノート PC プロファイルft bench bwモバイル環境の帯域幅制限ノート PC のメモリ容量に適した、より小さい、またはより強く量子化されたチェックポイントの選択に役立ちます。
ゲーミング PC プロファイルft bench bwデスクトップ RTX + RAM + PCIeRTX 30、40、50 シリーズ搭載システムにおける、一般的な FreeToken 構成です。
ワークステーションプロファイルft bench bwあらゆるリソースの大容量構成CPU と GPU の協調動作により、フロンティア規模のスパースチェックポイントをサポートします。

Quick Tips

  • 新しいマシンでは、実行戦略を選択する前に必ず ft bench bw を実行してください。
  • 大半のエキスパートをオフロードする場合、デコード速度はホスト帯域幅に大きく左右されます。
  • 十分な数のエキスパートを VRAM に収められる場合、ハイブリッド実行は通常、完全なオフロードより高速です。
  • 長いコンテキストのワークロードでは両方に負荷がかかるため、プリフィルとデコードを合わせて比較してください。
Local API

FreeToken API ガイド

FreeToken は、使い慣れた API 形式を通じてローカルモデル推論を提供します。ft serve でサポート対象モデルを読み込んだ後、アプリケーションからモデルの一覧取得、Chat Completions API または Responses API リクエストの送信、Anthropic 形式のメッセージの利用、ローカルサーバーからの生成トークンのストリーミングが可能です。

サポート対象モデルを指定して FreeToken のサービングプロセスを起動します。サーバーはモデルの読み込み、CPU-GPU 実行、メモリ割り当て、HTTP API リクエストを処理します。

ft serve <model>

OpenAI Chat Completions

OpenAI-compatible

既存の SDK または HTTP クライアントから、OpenAI 互換の Chat Completions エンドポイントを使用します。

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "messages": [
      {"role": "user", "content": "Mixture-of-Experts モデルについて説明してください。"}
    ]
  }'

OpenAI Responses API

OpenAI-compatible

新しい OpenAI Responses API を中心に構築されたアプリケーションから、対応するローカルエンドポイントへリクエストを送信できます。

curl http://localhost:8000/v1/responses \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": "リストを反転する短い Python 関数を書いてください。"
  }'

利用可能なモデルを一覧表示する

OpenAI-compatible

OpenAI 互換の models エンドポイントに問い合わせて、実行中の FreeToken サーバーが公開しているモデルを確認します。

curl http://localhost:8000/v1/models

Anthropic Messages API

Anthropic-compatible

FreeToken は、Anthropic API を中心に設計されたクライアントやコーディングツール向けに、Anthropic 互換の messages インターフェースも提供します。

curl http://localhost:8000/v1/messages \
  -H "Content-Type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "<model>",
    "max_tokens": 512,
    "messages": [
      {"role": "user", "content": "このリポジトリのアーキテクチャを要約してください。"}
    ]
  }'

ストリーミングレスポンス

SSE

クライアントがサーバー送信イベントによる逐次出力に対応している場合はストリーミングを有効にし、生成されたトークンを到着時に利用できるようにします。

{
  "model": "<model>",
  "messages": [
    {"role": "user", "content": "REST API の例を書いてください。"}
  ],
  "stream": true
}

ft serve の設定を使用してモデルを選択し、ホスト、ポート、メモリ設定など、ローカル HTTP サービスの公開方法を制御します。

ft serve --help

CLI オプションを確認する

CLI

FreeToken では、より新しいエンジンリリースで追加されたオプションを含め、現在のサービングおよびランタイムのオプションをコマンドラインヘルプから直接確認できます。

ft --help
ft serve --help
Coding Agents

FreeToken Claude Code と Codex のセットアップ

FreeToken は、OpenAI または Anthropic 互換 API に対応したエージェント型コーディングツールのローカル推論バックエンドとして利用できます。ft launch ワークフローはサポート対象エージェントの設定を支援し、dry-run モードでは、実際に変更や起動を行う前に予定されているセットアップを確認できます。

1

FreeToken をインストールして確認する

外部コーディングエージェントを接続する前に、FreeToken CLI がインストールされ、サポート対象モデルをローカルで読み込めることを確認してください。

ft --help
2

エージェントの起動オプションを確認する

launch コマンドのヘルプを使用して、現在サポートされているエージェント連携と利用可能な設定オプションを確認します。

ft launch --help
3

dry run でプレビューする

最終的なワークフローを開始せずに生成されるコマンドと環境設定を確認したい場合は、エージェントを起動する前に dry-run モードを使用します。

ft launch <agent> --dry-run
4

コーディングエージェントを起動する

FreeToken を通じて選択したコーディングエージェントを起動し、その API 設定がローカル推論バックエンドを指すようにします。

ft launch <agent>
5

Claude Code

Claude Code は FreeToken の Anthropic 互換インターフェースを利用できます。ローカル設定により、サポート対象の Anthropic メッセージトラフィックを FreeToken サーバーへリダイレクトしながら、エージェントのワークフローを維持します。

ft launch claude
6

Codex

Codex 形式のクライアントは FreeToken の OpenAI 互換エンドポイント経由で接続でき、ローカルでサービングされるモデルにエージェントのリクエストを処理させることができます。

ft launch codex
7

OpenCode、Hermes、OpenClaw

FreeToken の launch ワークフローは、OpenCode、Hermes、OpenClaw など、追加のコーディングクライアントや自律エージェントクライアントにも対応します。現在の連携名とオプションについては、launch のヘルプを確認してください。

ft launch --help
8

クラウド API へのフォールバックを防ぐ

長時間のタスクを開始する前に、エージェントのプロバイダーとベース URL の設定を確認してください。完全なローカル推論を目的とする場合は、不要なクラウドプロバイダー設定を削除または無効化し、dry-run モードを使用して FreeToken がエージェントに渡す環境を確認します。

ft launch <agent> --dry-run

Quick Tips

  • 新しいエージェントを初めて実際に起動する前に、必ず一度 dry-run プレビューを実行してください。
  • 長時間のセッションでは同じエンドポイントに再接続するため、エージェントの動作中は FreeToken サーバーを起動したままにしてください。
  • セットアップ後にプロバイダーのベース URL を確認し、リクエストがホスト型 API ではなくローカルサーバーに到達していることを確認してください。
  • 連携名はエンジンのリリースに伴って変わるため、アップグレード後は ft launch --help を再確認してください。
How It Works

FreeTokenのアーキテクチャ

FreeTokenは、Mixture-of-Expertsモデルのスパース構造を中心に設計されています。すべてのエキスパートの重みをGPUメモリに保持する必要はなく、CPUとGPUの実行を協調させ、頻繁に使用されるエキスパートをキャッシュし、転送と計算をオーバーラップさせ、モデルを実行するマシンに合わせてメモリ使用量を適応させます。

FreeTokenは、GPU VRAMを利用可能な唯一のモデルメモリとして扱うのではなく、エキスパートの計算をCPUとGPUのリソースにどのように分担させるかを決定します。実行戦略では、利用可能なCPU-GPU帯域幅とハードウェア特性を考慮し、ホストメモリとGPUの計算能力の間で計算とデータ移動のバランスを取ります。
Release Tracker

FreeTokenのアップデートとリリース

FreeTokenは、推論エンジンとデスクトップ体験の両方で進化を続けています。リリーストラッカーでは、インストール、モデル互換性、ローカルサービング、GPUサポート、パフォーマンス、エージェントワークフローに直接影響する変更に焦点を当てています。

公開済みのFreeTokenリリースは、パッケージ化されたエンジンの変更点とリリースノートを確認するための主な場所です。アップグレード時は各リリースを確認してください。特に、モデルサポート、チェックポイント形式、サービング動作、インストール要件、ランタイムパフォーマンスが変更される場合は重要です。

Follow FreeToken Development

Track new releases and join the community through the official channels: