- FreeToken api server は、GPU、CPU、メモリ、PCIe リソースを活用したローカル MoE 推論を対象としています。
- 最適な構成:新しい NVIDIA ハードウェア、十分なシステムメモリ、長時間の mixture-of-experts ワークロード。
- 主な利点:静的な配置だけに依存せず、共有 LRU エキスパートキャッシュがトークンのルーティングに追従します。
- ランタイム方式:キャッシュミスしたエキスパートは GPU に転送するか、CPU 上で直接実行できます。
- 主な制限:2026 年版は初期段階にあるため、現在のプラットフォーム対応状況を確認する必要があります。
FreeToken api server の概要
FreeToken は、大規模なオープンウェイト mixture-of-experts モデル向けのエッジネイティブなサービングシステムです。ゲームやエンターテインメントのプラットフォームではなく、互換性のあるアプリケーションやエージェントフレームワークから利用できるサービングランタイムを通じて、ローカルモデル推論を提供することを目的としています。
このシステムは、2 層のメモリ階層を中心に設計されています。完全なエキスパートプールはホストメモリに保持され、GPU には非エキスパートの重みと、ルーティングされたエキスパートの伸縮可能なキャッシュが保存されます。これにより、利用可能な VRAM より大きなモデルでも、すべてのエキスパートをグラフィックスカードに常駐させることなく実行できます。
動画のハイライト:
- FreeToken は、最先端規模の MoE モデル向けローカル推論に重点を置いています。
- 中心的な課題は、キャッシュミスしたエキスパートを効率的に移動または実行することです。
- 報告された結果には、コンシューマー向け GPU、ノートパソコン、ワークステーション級のハードウェアが含まれます。
- 最高スループットの数値だけでなく、ハードウェアの互換性が重要です。
| コンポーネント | FreeToken における役割 | 実際の意味 |
|---|---|---|
| GPU メモリ | エキスパートキャッシュと非エキスパートの重み | 頻繁にルーティングされるエキスパートを実行場所の近くに保持 |
| ホストメモリ | 完全なエキスパートプール | VRAM に完全には収まらない重みを保存 |
| PCIe リンク | エキスパートの転送経路 | 選択されたキャッシュミスを GPU キャッシュへ移動 |
| CPU | エキスパートの直接実行 | GPU 転送なしで一部のキャッシュミスを処理 |
| API レイヤー | アプリケーション向けのサービングインターフェース | 互換性のあるクライアントから推論リクエストを送信可能 |
FreeToken を理解するには、モデル容量とアクティブな計算量を分けて考えると便利です。MoE モデルには合計で数千億のパラメータが含まれている場合がありますが、各トークンで有効化されるのはエキスパートのごく一部だけです。参考論文では、DeepSeek-V4-Flash は各レイヤーで 256 個のルーティング対象エキスパートのうち 6 個を有効化し、2840 億個のパラメータのうち約 130 億個がアクティブパラメータになると説明されています。
このスパース性によってローカルサービングが可能になりますが、メモリの問題がなくなるわけではありません。ルーターはトークンごとに異なるエキスパートを選択できるため、すべてのエキスパートにアクセスできる状態を維持する必要があります。そのため FreeToken では、キャッシュポリシーと帯域幅スケジューリングを API サーバー設計の中核要素として扱います。
FreeToken は単なるモデルランチャーではなく、ハードウェアを考慮した推論サービスとして捉えてください。GPU 容量、ホストメモリ帯域幅、PCIe 接続、同時に動作するデスクトップワークロードのすべてが最終結果に影響します。
ハードウェアと互換性のチェック
FreeToken api server を設定する前に、マシンがランタイムの想定する導入プロファイルに合っていることを確認してください。公開資料では CUDA 中心のベータ環境が説明されており、新しい NVIDIA GPU と、完全なエキスパートプールを保持できる十分なホストメモリで最も良い結果が得られています。
最も重要なチェック項目は次のとおりです。
- NVIDIA GPU が利用可能で、適切な CUDA サポートがあること。
- 選択したモデルの完全なエキスパートプールを保持できるシステムメモリがあること。
- エキスパートの重みを効率的に転送できる PCIe 接続があること。
- CPU 側のエキスパート実行を継続できるホストメモリ帯域幅があること。
- モデルファイル用に十分なストレージ容量と読み取り速度があること。
- 非エキスパートの重みとランタイムキャッシュの両方に十分な空き VRAM があること。
| ハードウェア要素 | 重要な理由 | 制限された場合のリスク |
|---|---|---|
| VRAM | キャッシュサイズと常駐する重みを決定する | ルーティングミスが増え、デコードが遅くなる |
| システム RAM | 完全なエキスパートプールを保持する | モデルを読み込めない、または低速なフォールバック動作に頼る可能性がある |
| PCIe 帯域幅 | GPU へのキャッシュ補充速度を制御する | 転送が主なレイテンシーのボトルネックになる |
| CPU メモリ帯域幅 | CPU によるエキスパートの直接実行を支える | CPU でのキャッシュミス処理に時間がかかる |
| NVMe ストレージ | 起動とモデル準備に影響する | 大規模モデルの起動に時間がかかる |
| 同時実行アプリケーション | 利用可能な VRAM と CPU 容量を変化させる | セッション中にパフォーマンスが変動する |
論文の評価では、RTX 4060 ノートパソコン、RTX 3090 および RTX 4090 システム、RTX 5090 ハードウェア、RTX PRO 6000 ワークステーションが対象となっています。これらの結果は、すべての構成で保証される性能ではなく、参考値として扱ってください。
たとえば、8 GB の RTX 4060 ノートパソコンで報告された毎秒 39.3 トークンという結果は、NVFP4 ビルドと特定のモデル構成を使用したものです。異なるモデル形式、ドライバー、メモリレイアウト、ワークロードでは、結果も変わる可能性があります。
API サーバーは、動的なメモリ圧迫にも対応する必要があります。FreeToken の実行中は、ブラウザー、デスクトップコンポジター、ゲーム、その他のアプリケーションが VRAM を使用することがあります。FreeToken の伸縮可能なメモリ方式は、利用可能な予算が変わるたびにエンジン全体を再起動するのではなく、スケジューラーが安全に処理できる時点でエキスパートキャッシュのサイズを変更することを目的としています。
推奨プロファイル
- 新しい NVIDIA GPU
- 高速な PCIe 接続
- 十分なホストメモリ
- 長時間実行する MoE ワークロード
注意して使用できる構成
- 限られた VRAM
- ノートパソコンの PCIe x8 リンク
- 共有システムリソース
- 少ない CPU 帯域幅
導入前に確認する項目
- オペレーティングシステムのサポート
- CUDA 環境
- モデル形式
- ホストメモリ要件
別のローカル推論エンジンが対応しているすべてのプラットフォームを、FreeToken もサポートしているとは考えないでください。2026 年の公開情報では、ベータ版で CUDA に重点を置いた POSIX 指向の環境とされています。Windows、macOS、または NVIDIA 以外のハードウェアを選ぶ前に、現在のリリースドキュメントを確認してください。
FreeToken api server セットアップガイド
信頼性の高いセットアップは、スループットの調整ではなく、モデルとメモリ計画から始まります。起動失敗を減らし、その後の比較を意味のあるものにするため、以下の手順に従ってください。
対応モデルを選択する
利用可能なホストメモリ、GPU メモリ、対応する重み表現に合った MoE チェックポイントを選択します。参考評価では、異なるハードウェア階層で DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2 が使用されています。サーバーを準備する前に、モデル形式と必要な精度を確認してください。
ホストメモリプールを準備する
ルーティング対象となる完全なエキスパートプールを保持できるだけのシステムメモリを確保します。FreeToken はホストメモリを正となるデータソースとして扱い、GPU には作業用キャッシュを保持します。初回ロード時は、メモリを大量に消費するアプリケーションと同時にサービスを起動しないでください。
CUDA と転送経路を検証する
GPU、CUDA 環境、ドライバーの互換性、PCIe 経路を確認します。ランタイムの帯域幅適応ポリシーは、ホストからデバイスへの転送帯域幅と、CPU 側のエキスパート処理帯域幅の実測値に依存します。
ランタイム用の重みレイアウトを準備する
対応している場合は、FreeToken Weight 形式を使用して、エキスパートバンクをあらかじめランタイムのレイアウトに配置します。これにより、起動時のテンソル検出や再パッキングを避けられるため、大規模チェックポイントのブートストラップ処理を減らせます。
互換性のあるクライアントを接続する
小さなテストリクエストに対してモデルが正しく応答することを確認してから、サービングエンドポイントを公開します。その後、現在のリリースで文書化されている API プロトコルを利用できるエージェントまたはアプリケーションを接続し、単一プロンプトとは分けてマルチターン動作をテストしてください。
セットアップ手順が重要なのは、FreeToken の主な利点が継続的なサービング中に現れるためです。短いプロンプトでは、プレフィックス再利用、セマンティックチェックポイント、適応型エキスパートキャッシュの価値が現れない場合があります。マルチターンのエージェントワークロードでは、コンテキストが繰り返し編集され、変化するエキスパートの組み合わせを通じてトークンがルーティングされるため、設計目標をより正確に反映します。
| セットアップ段階 | 成功の確認 | 推奨アクション |
|---|---|---|
| モデル選択 | モデルがホストメモリの予算に収まる | エキスパートプール全体のサイズを確認する |
| ランタイム準備 | 重みが対応レイアウトと一致する | 文書化された FTW ワークフローを優先する |
| ハードウェア検証 | CUDA と帯域幅のチェックに合格する | GPU、PCIe、RAM、CPU の詳細を記録する |
| 初回リクエスト | サーバーが有効な応答を返す | 小さく制御されたプロンプトから始める |
| クライアント統合 | ターンをまたいでもリクエストが安定する | 利用規模を拡大する前に対象 API クライアントをテストする |
最初の応答に成功したことは、基本機能が動作していることを示すだけで、本番運用への準備が整ったことを意味しません。API サーバーを評価する前に、繰り返しのターン、長いコンテキスト、デスクトップ上の同時アクティビティをテストしてください。
キャッシュ、ルーティング、パフォーマンスのヒント
FreeToken の最も特徴的な仕組みは、共有 LRU エキスパートキャッシュです。デコード中、ルーターは次のトークンに必要なエキスパートを特定し、そのエキスパートがすでに常駐しているかを確認します。キャッシュヒットは GPU 上で実行されます。キャッシュミスは、実測された帯域幅に基づいて GPU キャッシュへの補充と CPU による直接実行に振り分けられます。
これは固定的なレイヤー分割とは異なります。静的な配置ポリシーでは、トークンごとのルーティングの変化が分かる前にエキスパートの配置場所を決定します。一方 FreeToken では、最近のルーティング動作に合わせてキャッシュの常駐内容が変化します。引用されているリプレイ結果では、同じキャッシュ容量であってもミス率が低下しており、特にワークロードが短期的なエキスパート局所性を示す場合に効果が大きくなっています。
| ランタイムの動作 | FreeToken の方式 | 期待される効果 |
|---|---|---|
| エキスパートヒット | GPU キャッシュから実行 | 移動コストを最小化 |
| 補充対象に選ばれたエキスパートミス | 転送、実行、保持 | 将来の局所性を改善 |
| CPU 実行対象に選ばれたエキスパートミス | ホストメモリから実行 | otherwise idle になり得る帯域幅を活用 |
| コンテキスト編集 | セマンティックチェックポイントを再利用 | 繰り返しのプレフィル処理を削減 |
| VRAM 圧迫 | 安全な時点でキャッシュサイズを変更 | 完全な再起動なしでサービスの可用性を維持 |
q-star ポリシーは、PCIe 経由で取得すべきキャッシュミスの数と、CPU 上で実行すべきキャッシュミスの数を推定します。この分割は、ページ固定転送の帯域幅とホスト側エキスパート処理帯域幅の実測関係に基づいています。これは重要な点です。デュアルチャネル DDR5 を搭載したデスクトップと LPDDR5 を搭載したノートパソコンでは、GPU が似ていても最適な動作が大きく異なる可能性があります。
チューニングでは、平均デコード速度だけでなく、テールレイテンシーを優先してください。評価では、テストされたすべてのセルで FreeToken の最悪ターンの TTFT が 44 秒未満だった一方、一部のベースラインは 150 秒を超えました。実際のエージェント統合では、平均 tokens-per-second の数値が競争力のあるものに見えても、長い停止によってクライアントのタイムアウトやアイドル監視が発生する可能性があります。
実用上のルールとして、次の点を守ってください。
- ホストシステムに不要なメモリ圧迫を発生させない。
- 各エンジンで同一のモデル重みと精度を比較する。
- 単独のプロンプトだけでなく、マルチターンのタスクを測定する。
- 初回トークンのレイテンシーと最悪ターンのレイテンシーを追跡する。
- キャッシュサイズ、コンテキスト長、CPU スレッド数の上限を記録する。
- 他のアプリケーションが VRAM を使用した後にテストを繰り返す。
公式の FreeToken 研究論文 では、セマンティック対応キャッシュ、パイプライン化されたプレフィル、伸縮可能なメモリ管理、帯域幅適応型実行について技術的に説明されています。リリースの動作が初期の概要と異なる場合は、この論文を基準として使用してください。
同じ条件で比較できる測定を行ってください。デコードスループット、エンドツーエンドの応答時間、初回トークンまでの時間、テールレイテンシーは、API サーバー体験の異なる側面を表します。
制限事項と準備状況チェックリスト
FreeToken は特定の導入プロファイルにおいて有望ですが、すべてのローカル推論ユーザーにとって自動的に最適な選択肢になるわけではありません。十分な RAM を備えた新しい NVIDIA システム、MoE ワークロード、そして長時間にわたって推論をローカルで実行する理由がある環境が、最も適しています。
初期段階にあるという公開状況も重要です。提供された 2026 年の資料におけるプロジェクトの公開履歴はまだ短く、より広く採用されるためには、対応ハードウェアの拡大、追加のオペレーティングシステム、デュアル GPU ワークフロー、一般的なモデル形式など、いくつかの実用的な要望が残されています。
API を公開する前に確認すること:
- 選択したモデルと精度がサポートされていることを確認する
- ホストメモリが完全なエキスパートプールを保持できることを確認する
- CUDA、ドライバー、PCIe、ストレージの互換性を確認する
- マルチターンのレイテンシーとタイムアウト動作を測定する
- 共有ネットワークで提供する場合はエンドポイントへのアクセスを制限する
| ユースケース | 適合度 | 理由 |
|---|---|---|
| ローカルコーディングエージェント | 高い | 繰り返しのターンとローカルデータの利点を活かせる |
| 単一の短いプロンプト | 中程度 | キャッシュとプレフィックス再利用の機会が少ない |
| 新しい NVIDIA ワークステーション | 高い | 評価された導入方針に合致する |
| macOS または Apple Silicon | 不確実 | セットアップ前に現在の対応状況を確認する必要がある |
| 非 MoE の密モデル | 利点が限定的 | 中核機構がルーティングされたエキスパートを対象としている |
| パブリックインターネット上のエンドポイント | 強化対策が必要 | 認証とネットワーク制御が不可欠 |
ローカルサービングは、ホスト型サービスのレート制限への依存を減らし、プロンプトをユーザーのマシン内に保持できます。一方で、運用上の責任はユーザーに移ります。API 認証情報を保護し、サービスのバインド先を意図的に設定し、認証なしのエンドポイントを共有ネットワークに公開しないでください。
ローカルモデルサーバーもネットワークサービスです。他のマシンからの接続を許可する前に、認証、限定的なバインドアドレス、ファイアウォールルール、アクセスログを設定してください。
FreeToken api server FAQ
Q: FreeToken api server は何を目的として設計されていますか?
大規模な mixture-of-experts モデル向けのローカル推論サービングシステムです。GPU メモリ、ホストメモリ、CPU 実行、PCIe 転送を連携させ、利用可能な VRAM より大きなモデルを、適切な個人用ハードウェア上でサービングできるようにします。
Q: FreeToken にはハイエンド GPU が必要ですか?
評価された構成は、8 GB の RTX 4060 ノートパソコンから RTX PRO 6000 ワークステーションまで、NVIDIA GPU を中心としています。正確な要件は、モデル、精度、ホストメモリ容量、許容できるレイテンシーによって異なります。
Q: FreeToken がエキスパートキャッシュを使用するのはなぜですか?
MoE のルーティングはトークンごとに変化するため、固定されたエキスパート配置では頻繁に選択されるエキスパートをキャッシュミスする可能性があります。FreeToken は共有 LRU キャッシュを使用して最近のルーティング局所性に追従し、キャッシュミスの残りについてはキャッシュ補充と CPU による直接実行を組み合わせます。
Q: FreeToken はすべてのオペレーティングシステムで利用できますか?
普遍的な対応を前提にしてはいけません。2026 年の資料では、CUDA に重点を置いたベータ環境として説明されています。導入前に、現在のリリースドキュメントでオペレーティングシステム、GPU、モデル形式、クライアント API の対応状況を確認してください。
ローカル MoE サービング、マルチターンのワークロード、新しい NVIDIA ハードウェアが揃っている場合は FreeToken を選択してください。それ以外の場合は、同じモデルとレイテンシー指標を使って、対応している代替手段を比較しましょう。