FreeToken ローカル API:MoE サービングのセットアップガイド - API

FreeToken ローカル API:MoE サービングのセットアップガイド

Windows または Linux で FreeToken ローカル API ワークフローを構築し、エンジンをインストールしてモデルを選択し、ローカル MoE サービングの問題を解決する方法を説明します。

2026-08-25
FreeTokenチーム
クイックガイド
  • FreeToken ローカル API ワークフローは、公式デスクトップアプリまたは CLI のインストールから始まります。
  • サポート対象の環境:現行リリースでドキュメント化されているデスクトップ環境は Windows と Linux です。
  • 主な目的:GPU、CPU、ホストメモリを活用して、大規模な Mixture-of-Experts モデルを実行します。
  • ベストプラクティス:クライアント統合を作成する前に、公式 API またはサービングコマンドを確認してください。
  • 主な制限:macOS、古い NVIDIA カード、一部の要望されているバックエンドについては、今後の対応が必要になる可能性があります。

FreeToken ローカル API の概要

FreeToken ローカル API とは、ホスト型モデルのエンドポイントに依存するのではなく、FreeToken をローカル推論サービスとして使用することを指します。FreeToken は、コンシューマー向けハードウェア上でフロンティア規模のオープンウェイトモデルを実行するために設計された、エッジネイティブな Mixture-of-Experts サービングエンジンです。ドキュメントに記載されたアーキテクチャでは、GPU メモリ、CPU リソース、ホストメモリ、利用可能なインターコネクトを1つの推論プラットフォームとして組み合わせます。

実用上の利点は柔軟性です。MoE モデルには数千億個のパラメータが含まれる場合がありますが、各トークンではそのうち比較的小さなグループのエキスパートだけが有効化されます。FreeToken は、すべてのモデルウェイトを常に GPU メモリに保持することを前提とせず、エキスパートを効率的に移動・キャッシュすることに重点を置いています。

動画のポイント:

  • FreeToken は、個人所有のハードウェア上で大規模 MoE モデルをローカルサービングすることを目的としています。
  • エンジンは、ルーティングを考慮したエキスパートキャッシュと CPU–GPU 協調を重視しています。
  • 報告されているベンチマークは、独立した再現結果が得られるまでは、プロジェクト側のベンチマークとして扱うべきです。
  • ハードウェア互換性は、実績のあるマルチバックエンドランタイムよりも限定的です。

公式の FreeToken GitHub リポジトリでは、このプロジェクトが Apache License 2.0 のソフトウェアであることが示されています。また、Windows と Linux 向けのデスクトップアプリに加え、uv または pip による CLI インストールも掲載されています。そのため、ローカルでの実験、研究、エージェントワークフローに適しています。ただし、推論エンジンと、保証された HTTP API は区別して考える必要があります。

項目FreeToken が提供するもの実用的な意味
モデルアーキテクチャMixture-of-Experts サービング大規模モデルの処理を利用可能なリソース全体に分散できます
メモリ戦略グローバル LRU エキスパートキャッシュ頻繁に使用されるエキスパートを後続トークンのために保持できます
実行方式CPU–GPU 協調実行帯域幅とハードウェアのバランスに応じて処理を調整できます
状態処理セマンティックアンカーチェックポイントエージェントによる編集時に、繰り返し発生するコンテキスト処理を削減できる場合があります
ライセンスApache License 2.0ライセンスに基づくレビュー、変更、研究に適しています
編集者のヒント

「ローカル API」は特定のエンドポイントが存在する証拠ではなく、統合の目標として捉えてください。使用するリリースでサポートされているインターフェースを特定するには、プロジェクトの最新のインストールおよびサービングドキュメントを確認してください。

デスクトップアプリ

モデル選択、チャット、エンジン調整を1つの画面で行いたい Windows および Linux ユーザー向けの、グラフィカルなセットアップ方法です。

CLI ワークフロー

ドキュメント化された Python パッケージのインストール、またはソースコードのチェックアウトを使用するターミナルベースの方法です。

MoE ランタイム

コアエンジンが、GPU、CPU、ホストメモリ、インターコネクトの各リソースにわたるエキスパートの配置を調整します。

研究レイヤー

FTW ウェイト、セマンティックキャッシュ、グラフ互換実行により、高度なローカル推論のユースケースを対象とします。

インストールと初回起動

最適なセットアップ方法は、グラフィカルなワークフローを使用するか、再現可能な開発環境を構築するかによって異なります。リポジトリでは、デスクトップアプリと CLI の両方の方法がドキュメント化されています。現在は Windows と Linux が主な対象であり、利用可能なプロジェクト情報では macOS はサポート対象のビルドとして記載されていません。

インストールする前に、オペレーティングシステム、NVIDIA またはその他のサポート対象アクセラレーターの構成、システムメモリ、モデル形式を確認してください。別のランタイムでサポートされているモデルが、変更なしで FreeToken でも動作すると想定しないでください。

1

インストール方法を選択する

ガイド付きの Windows または Linux セットアップを行う場合は、公式デスクトップ版をダウンロードしてください。スクリプト、仮想環境、ソース変更、再現可能な開発コマンドが必要な場合は CLI を選択します。

2

ランタイムをインストールする

ドキュメント化されたパッケージ経由の方法では、Python 環境を作成または使用し、uv pip install "freetoken[accel]" でアクセラレーター用追加機能をインストールします。コマンドは現在のリポジトリの指示に合わせてください。

3

モデルを準備する

FreeToken がサポートするサービング経路に適合するオープンウェイトモデルを選択します。トークンごとに一部のエキスパートだけが有効になる場合でも、大規模な MoE モデルでは大量のホストメモリが必要になることがあります。

4

ローカルセッションを起動する

デスクトップアプリケーション、またはプロジェクトでドキュメント化されている CLI コマンドを起動します。外部クライアントを構築する前に、モデルが読み込まれ、アクセラレーターが検出され、短いプロンプトから出力が得られることを確認してください。

5

動作する構成を記録する

モデル名、量子化またはウェイト形式、メモリ設定、オペレーティングシステム、ランタイムのバージョンを保存します。これらの情報があれば、後で性能比較を再現しやすくなります。

リポジトリには、ソースからインストールする方法も用意されています。

git clone <repository-url>
cd FreeToken
uv venv
source .venv/bin/activate
uv pip install -e ".[accel]"

このワークフローを適用する際は、公式ドキュメントに記載された正確なリポジトリ URL と、プラットフォームに応じたアクティベーションコマンドを使用してください。ソースの抜粋からは、汎用的な HTTP サーバーコマンドの存在は確認できません。そのため、本番スクリプトに未検証のエンドポイントを追加しないでください。

セットアップ方法適している用途主な要件注意点
デスクトップアプリ初めて利用するユーザーWindows または Linux システム開発の詳細を細かく制御しにくい
uv パッケージインストール再現可能な CLI 利用Python 環境とアクセラレーターのサポートパッケージのバージョンを記録しておく
編集可能なソースインストール開発者と研究者Git、Python ツール、ビルド依存関係ソース変更が安定性に影響する可能性がある
外部クライアント統合エージェントとアプリケーションドキュメント化されたローカルサービングインターフェースエンドポイントの詳細はリリースごとに変わる可能性がある
互換性に関する警告

利用可能なプロジェクト情報では、Windows と Linux のデスクトップサポート、および NVIDIA CUDA を中心とした環境が記載されています。現在の公式ドキュメントを確認せずに、macOS、旧世代の NVIDIA、Apple Silicon、デュアル GPU の Docker 構成がサポートされていると想定しないでください。

信頼性の高いローカルワークフローの構築

FreeToken が正常に起動したら、ローカル API ワークフローを段階的に構築します。まず直接生成を検証し、次にモデルの読み込みを繰り返し実行できることを確認します。その後で、エージェント、エディター、またはカスタムクライアントを接続してください。この順序により、モデルの問題と統合の問題を切り分けられます。

ローカルサービスはコーディングエージェントにとって有用です。リクエストがユーザーのハードウェア上に留まり、ホスト型プロバイダーのレート制限やモデル廃止スケジュールの影響を受けないためです。ただし、こうした利点があっても、メモリ、レイテンシ、コンテキストサイズ、プロセスの安定性を監視する必要はあります。

次のワークフローを使用してください。

  • 短いプロンプトと控えめなコンテキストから始めます。
  • 選択したモデルが複数のリクエストにわたって一貫して応答することを確認します。
  • いきなり最大サイズのプロンプトでテストせず、コンテキスト長を段階的に増やします。
  • GPU メモリ、ホストメモリ、システムの応答性を監視します。
  • シングルターン推論が安定してから、ツール呼び出しやエージェントループを追加します。
  • 小型モデルまたは短いコンテキスト用のフォールバック構成を用意します。
ワークフローの段階検証対象推奨アクション
直接生成モデルが一貫した出力を返す最初は短いプロンプトをテストする
繰り返しリクエストプロセスが応答し続ける設定を変更せずに複数ターン実行する
コンテキストの拡張メモリ使用量が許容範囲で増加する測定しながら段階的にプロンプト長を増やす
エージェント接続クライアントが有効な応答を受け取るインストールしたリリースでドキュメント化されたインターフェースを使う
長時間セッションキャッシュと状態が安定しているテールレイテンシ、メモリ圧迫、プロセス終了を監視する

FreeToken のセマンティック対応キャッシュは、ツール呼び出しや思考ブロックを含む、エージェントによるコンテキスト編集向けに設計されています。セッションが構造化された形で変化した際に、不要なコンテキスト再計算を避けることが意図された利点です。実際のキャッシュ動作は、モデル、コンテキストパターン、利用可能なメモリ、ランタイム構成によって異なります。

安定した統合パターン

最初の統合は小規模に保ちます。1つのモデル、1つのクライアント、1つのプロンプト形式、1台のローカルマシンから始めてください。基本的なリクエスト経路を再現可能な状態にしてから、ツール、並列リクエスト、長時間稼働するエージェントへ拡張します。

性能テストでは、1秒あたりのトークン数だけでなく、次の項目も測定してください。

  • 最初のトークンが出るまでの時間。
  • 生成開始後のデコードスループット。
  • シングルターンでの最悪レイテンシ。
  • プリフィル中のメモリ消費量。
  • デコード中のメモリ消費量。
  • クライアントまたはウォッチドッグが低速なリクエストを終了するかどうか。

平均速度が速くても、許容できないテール動作が隠れている場合があります。エージェントにとっては、完了まで確実に動作する低速な構成のほうが、時折タイムアウトを超える高速構成より有用なことがあります。

性能、キャッシュ、ハードウェアの選択

FreeToken の特徴的な設計は、異種ハードウェアを柔軟な推論プラットフォームのように動作させようとする点にあります。リポジトリには、帯域幅適応型の CPU–GPU 協調実行、ダブルバッファ方式のプリフィルストリーミング、グローバル LRU エキスパートキャッシュ、グラフ互換実行、FTW 高速ウェイト形式が記載されています。

最も重要な概念は、エキスパートの配置です。MoE モデルでは、各トークンの計算に参加するのは選択されたエキスパートだけですが、ルーティングが変化した際には利用可能なエキスパートへアクセスできなければなりません。キャッシュは頻繁に選択されるエキスパートの再転送を減らし、CPU–GPU 実行は特定のマシンで利用可能な帯域幅に応じて適応できます。

機能サービングにおける役割ユーザーから見た効果
グローバル LRU エキスパートキャッシュ最近使用したエキスパートを保持するエキスパートの再移動を減らせる可能性がある
帯域幅適応型実行リソースに基づいて CPU–GPU の協調方法を選択する計算コストと転送コストのバランスに役立つ
ダブルバッファ方式のプリフィルプロンプト処理中にレイヤー全体をストリーミングするプロンプト取り込みの滑らかさを目指す
FTW 形式高速なウェイト表現を提供するサポート対象モデルの読み込みまたは実行を改善できる可能性がある
セマンティックチェックポイント有用な再帰状態と KV 状態を保持する重複するコンテキスト処理を削減できる

ハードウェアの選択は、すでに所有している機器から始めるべきです。利用可能なプロジェクト資料では、十分なホストメモリを備えた比較的新しい NVIDIA システムが最も明確な対象となっています。このエンジンは、あらゆるオペレーティングシステムやアクセラレーターで成熟したランタイムを置き換えられる万能なものではありません。

比較的新しい NVIDIA デスクトップ

ドキュメント化された CUDA 中心のワークフローや、より大規模な MoE モデルのテストに最適です。

GPU メモリが限られている環境

モデルを慎重に選択し、ホストメモリや CPU の参加がより重要になることを想定してください。

サポート対象外のプラットフォーム

本番導入を計画する前に、公式の Issue Tracker とリリースノートを確認してください。

FreeToken を別のローカルランタイムと比較する際は、公平なテストを行ってください。

  • 同一のモデルウェイトと、同等の量子化を使用します。
  • プロンプト長、出力上限、サンプリング設定を統一します。
  • プリフィル速度とデコード速度を分けて測定します。
  • 中央値と最悪レイテンシの両方を記録します。
  • キャッシュをウォームアップした後にテストを繰り返します。
  • 正確なソフトウェアおよびドライバーのバージョンを記録します。

利用可能なベンチマークの議論では、選択された MoE ワークロードにおいてプロジェクト側の優れた結果が報告されています。一方で、レビュー時点では独立したベンチマークがまだ存在していなかったことも強調されています。これらの数値は、普遍的な保証ではなく、方向性を示す有用な証拠として扱ってください。

ベンチマークに関する注意

有意義な FreeToken 比較には、テールレイテンシとハードウェア互換性を含めるべきです。スループットだけでは、長時間稼働するコーディングエージェントがタイムアウト以内に完了できるかどうかは分かりません。

トラブルシューティングと準備チェックリスト

初回起動時の問題の多くは、サポート対象外のハードウェア、アクセラレーターのインストール不備、不適切なモデルファイル、またはドキュメント化されていないエンドポイントを前提とした統合の4つの領域のいずれかに起因します。この順番で解決してください。

インストールに失敗した場合は、公式リポジトリの指示に戻り、環境を確認してください。アプリケーションは起動するものの生成に失敗する場合は、複数の変数を同時に変更する前に、より小さいモデルまたは既知のサポート対象モデルをテストします。生成は動作するもののクライアントが接続できない場合は、URL パス、ポート、リクエストスキーマを推測せず、現在のサービングドキュメントを確認してください。

症状考えられる領域最初の対応
パッケージのインストールに失敗する環境またはアクセラレーター依存関係環境を再作成し、公式のインストール方法を確認する
モデルを読み込めない形式、メモリ、互換性ドキュメント化されたモデルを試し、利用可能なホストメモリを確認する
出力が非常に遅い転送の負荷またはキャッシュミスコンテキストを短くし、GPU とシステムメモリを監視する
クライアントが接続できないインターフェースの不一致リリース固有のローカルサービング手順を確認する
セッションが予期せず停止するタイムアウトまたはリソース不足より短いリクエストをテストし、最悪レイテンシを記録する

ローカル API 準備チェックリスト:

  • 公式デスクトップ版または CLI 経由で FreeToken をインストールする
  • アクセラレーターとオペレーティングシステムがサポート対象であることを確認する
  • ドキュメント化されたモデルを読み込み、短い生成テストを完了する
  • モデル、ランタイム、ドライバー、メモリ、構成の詳細を記録する
  • 外部クライアントを接続する前に、現在のサービングインターフェースを確認する

セットアップを信頼できる状態とみなす前に、次のリリースチェックリストを使用してください。

  • 2026 年の現行バージョンとインストール日を確認します。
  • 公式リポジトリ URL とリリースノートを保存します。
  • コールドスタートと、ウォームアップ済みキャッシュでのリクエストをテストします。
  • 通常時と最悪時の応答時間を両方測定します。
  • プロセスが想定される最長プロンプトに耐えられるか確認します。
  • 小型のフォールバックモデルを用意します。
  • 認証および通信保護がドキュメント化されていない限り、信頼できるネットワークの外部にローカルサービスを公開しないでください。
セキュリティに関する注意

ローカル推論プロセスであっても、アクセス可能なネットワークインターフェースにバインドされていると、機密性の高いプロンプトが外部に露出する可能性があります。プロジェクトで広範なデプロイ向けのセキュリティ制御が文書化されていない限り、開発サービスへのアクセスを信頼できる範囲に制限してください。

Q: FreeToken ローカル API は何に使われますか?

デスクトップチャット、CLI 実験、研究ツール、エージェント統合など、FreeToken を中心としたローカル推論ワークフローの構築に使用します。正確な HTTP またはクライアントインターフェースはインストールしたリリースによって異なるため、公式ドキュメントで確認してください。

Q: FreeToken は Windows と Linux をサポートしていますか?

利用可能な公式プロジェクト情報では、Windows と Linux 向けのデスクトップアプリケーションがドキュメント化されています。記載されている環境は NVIDIA CUDA と POSIX Linux を中心としているため、別のプラットフォームで使用する前に現在の互換性情報を確認してください。

Q: FreeToken はコンシューマー向けハードウェアで大規模 MoE モデルを実行できますか?

FreeToken は、GPU、CPU、ホストメモリ、インターコネクトのリソースを活用して、フロンティア規模のオープンウェイト MoE モデルをサービングするように設計されています。実際のモデル互換性は、利用可能なメモリ、ハードウェア帯域幅、サポート対象形式、プロジェクトの現行リリースによって異なります。

Q: 公式のインストール情報はどこで確認できますか?

公式の FreeToken GitHub リポジトリ(https://github.com/FlashML-org/FreeToken)を使用してください。デスクトップ版の手順、パッケージインストール、ソースセットアップ、機能概要、ライセンス、プロジェクトリンクが記載されています。