- FreeTokenは、帯域幅に応じたローカルMoEサービングを実現するApacheライセンスのエンジンです。
- ルーティング対応キャッシュにより、システムバス上で不要なエキスパート転送を削減します。
- 最適な環境は、大規模モデルを扱える十分なシステムメモリを備えた新しいNVIDIAハードウェアです。
- 主な制限はプラットフォームの範囲で、公開されているサポート対象はLinuxとNVIDIA CUDAです。
- 評価の原則:スループットだけでなく、テールレイテンシとハードウェア互換性を比較してください。
FreeTokenとは何か、なぜ重要なのか
FreeTokenは、コンシューマー向けおよびワークステーション向けハードウェア上で、大規模なMixture-of-Expertsモデルを実行するために設計されたエッジネイティブ推論エンジンです。このプロジェクトは、2026年8月に投稿されたFreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution論文で紹介されています。すべてのパラメーターをグラフィックスメモリに保持することを求めるのではなく、各トークンで選択されたエキスパートを中心に、システムメモリ、GPUメモリ、転送バスを協調させます。
この設計は、スパースモデルが抱える特有の問題に対応します。1つのトークンに対してアクティブになるパラメーターはごく一部であっても、エキスパート全体には引き続きアクセスできなければなりません。そのため、モデルはアクティブな計算量が比較的少なくても、大容量のメモリと慎重なデータ移動を必要とする場合があります。
動画のポイント:
- FreeTokenは、非常に大規模なMixture-of-Expertsモデルのローカルサービングを対象としています。
- 中心となる考え方は、固定的なレイヤー分割ではなく、動的にエキスパートを配置することです。
- 報告された性能向上は、互換性のあるNVIDIAシステムで最も顕著です。
- 確認した資料には、独立した第三者ベンチマークはありませんでした。
このプロジェクトが重要なのは、ローカル推論が単純な計算性能だけで制約されるわけではないからです。モデルが複数のメモリプールに収まっていても、頻繁に選択されるエキスパートが低速な接続を経由しなければならない場合、性能が低下する可能性があります。FreeTokenは、固定的な配置ルールを受け入れるのではなく、こうした転送をスケジューリング問題として扱います。
| 項目 | FreeTokenの概要 |
|---|---|
| プロジェクトの種類 | ローカルAI推論エンジン |
| 対象モデル | Mixture-of-Expertsモデル |
| ライセンス | Apacheライセンス |
| 論文 | arXiv:2608.16157 |
| 公開サポート | NVIDIA CUDA、POSIX Linux |
| 主な最適化 | 帯域幅適応型エキスパート実行 |
FreeTokenは、単に小型化されたモデルランタイムではありません。推論中に、選択されたエキスパートをどこで実行し、どこに配置するかを決定する仕組みこそが特徴です。
ルーティング対応MoE設計の仕組み
Mixture-of-Expertsモデルには、多数の専門化されたフィードフォワードネットワークが含まれていますが、ルーターは各トークンに対してその一部だけをアクティブ化します。確認した例では、各レイヤーに数百のエキスパートがあり、その時点では数個だけが選択されます。これにより計算はスパースになりますが、より広範なパラメーター集合にアクセスする必要がなくなるわけではありません。
実際のボトルネックは、エキスパートキャッシュミスです。次のトークンがGPU上にまだ用意されていないエキスパートを選択した場合、システムはそのデータをバス経由で移動するか、重みがすでに存在する場所で関連処理を実行する必要があります。各判断はレイテンシ、スループット、安定性に影響します。
FreeTokenのアプローチはルーティング対応です。実際に選択されたエキスパートを利用して、配置と実行方法を適応させます。これは、レイヤー番号だけを基準にした固定分割とは異なります。静的なルールは予測しやすい一方で、モデルが将来どのエキスパートを選択するかを把握できません。
| 実行上の関心事項 | 静的なレイヤー配置 | ルーティング対応配置 |
|---|---|---|
| 判断のタイミング | 推論開始前 | トークン生成中 |
| 主なシグナル | レイヤーインデックス | エキスパートのルーティング活動 |
| 適応性 | 実行中は固定 | 選択されたエキスパートに応じて調整 |
| 主な強み | 予測可能性 | 回避可能な転送負荷の低減 |
| 主なリスク | 変化するルートを考慮できない | スケジューリングが複雑になる |
スパース計算
各トークンでは選択されたエキスパートだけが処理を行うため、同程度の総サイズを持つ密モデルと比べてアクティブな計算量を削減できます。
大容量メモリの必要性
次のルーティング判断は事前に分からないため、すべてのエキスパートの重みをアクセス可能な保存場所に置いておく必要があります。
バスへの配慮
キャッシュミスは転送やリモート実行を引き起こす可能性があり、帯域幅はローカル推論の性能を左右する重要な要素になります。
重要なのは、アクティブパラメーターと常駐パラメーターを区別することです。モデルは比較的小さなサブセットだけをアクティブ化する場合でも、大きなメモリフットプリントを必要とすることがあります。そのため、数学的なワークロードが変わらなくても、ルーティングポリシーが実際の応答性に影響を与える可能性があります。
スパースなアクティベーションは1トークンあたりの処理量を減らしますが、すべてのモデルがGPUメモリに余裕をもって収まるようになるわけではありません。アクセス可能なパラメーター全体のフットプリントを想定してください。
FreeTokenの性能比較
報告されたベンチマーク結果は、テストされたハードウェアとワークロードにおいて、FreeTokenに明確な優位性があることを示しています。GeForce RTX 5090で350億パラメーターのQwenモデルを提供した場合、論文では毎秒およそ77~83トークンと報告されています。DeepSeek V4 Flashでは、報告された範囲は毎秒22~25トークンです。ワークステーション向けカードでGLMを提供したテストでは毎秒5.2~14.9トークンと報告されており、引用された比較ではllama.cppが毎秒7.3トークンでした。
最も注目すべき結果は、ノートPC向けのテストです。8 GBのグラフィックスカードで毎秒39.3トークンが報告されており、テスト対象のデスクトップ版RTX 4090の結果の約92%と説明されています。この数値は、グラフィックスメモリが限られている場合に配置戦略が大きな意味を持つ可能性を示しています。ただし、これは普遍的なハードウェア性能の保証ではなく、プロジェクトによるベンチマークとして扱うべきです。
| ワークロード | FreeTokenの結果 | 記載された比較 | 報告された関係 |
|---|---|---|---|
| RTX 5090上のQwen 35B | 77~83 tokens/s | テストされた代替手段の中で最良 | 1.8~2.3倍 |
| DeepSeek V4 Flash | 22~25 tokens/s | テストされた代替手段 | 1.5~1.9倍 |
| ワークステーション向けカード上のGLM | 5.2~14.9 tokens/s | llama.cppは7.3 tokens/s | ワークロードに依存 |
| 8 GBノートPC GPU上の35Bクラスモデル | 39.3 tokens/s | デスクトップ版RTX 4090を基準 | 約92% |
スループットは比較要素の一部にすぎません。テールレイテンシによって、外部ウォッチドッグが終了させる前にエージェントが1ターンを完了できるかどうかが決まることがあります。確認した資料では、FreeTokenの1ターンにおける最悪値は44秒未満と報告されている一方、一部の比較結果は232秒を超えていました。低速な外れ値が平均速度の低下よりも大きな問題になり得るコーディングエージェントのワークフローでは、これらの数値は特に重要です。
| 指標 | 重要な理由 | 評価の指針 |
|---|---|---|
| デコードスループット | トークン生成速度を測定する | 継続的な出力に有用 |
| 最初のトークンまでの時間 | 初期応答性を測定する | インタラクティブな利用で重要 |
| テールレイテンシ | 異常に遅いターンを捉える | エージェントのウォッチドッグにとって重要 |
| キャッシュミス率 | 転送負荷を示す | 性能差の理由を説明するのに役立つ |
| ハードウェア対応範囲 | どのユーザーがエンジンを実行できるかを定義する | 速度を比較する前に確認する |
慎重に読み解くには、同じ条件での測定も必要です。エンドツーエンドのエージェント速度には、最初のトークンまでの時間や推論時間が含まれる場合がありますが、純粋なデコード速度ではその一部が除外されます。測定方法の定義を考慮せずに、これらの数値を単純に並べて比較すべきではありません。
公開された数値は、プロジェクトチームによる有望な証拠として捉えてください。購入や導入を決定する前に、モデルの量子化、プロンプト長、キャッシュサイズ、ハードウェア、測定方法の定義を再確認しましょう。
FreeTokenのセットアップとハードウェア適合性
FreeTokenの現在の対応範囲は、成熟したクロスプラットフォームランタイムよりも狭いものです。公開されている分類では、開発ステータスはベータ、環境はNVIDIA CUDA、対象OSはPOSIX Linuxとされています。確認したプロジェクト資料には、Windowsの修正、デュアルGPU対応、旧世代NVIDIAカード、GGUF対応、Apple Silicon対応を求める声も記載されています。
そのため、セットアップで最初に確認すべきなのは互換性です。新しいNVIDIAカードで高速な結果が出たからといって、同じエンジンがMac、旧世代のGeForceカード、またはCUDA非対応アクセラレーターで動作するとは限りません。サポート対象外の構成を最適化しようとするのではなく、まず対応環境から始めてください。
プラットフォームを確認する
システムがサポート対象のNVIDIA CUDA構成と、互換性のあるLinux環境を使用していることを確認します。macOS、Apple Silicon、または旧世代GPUを使用している場合は、プロジェクトのドキュメントが変更されていない限り、サポート対象外として扱ってください。
メモリの余裕を測定する
GPUメモリとシステムメモリを分けて確認します。大規模なMoEモデルでは、各トークンでアクティブになるのが一部だけであっても、エキスパート全体にアクセスできる状態を維持する必要があります。
テストモデルを選ぶ
ドキュメントに記載されたベンチマークのクラスに合うモデルと量子化レベルから始めます。モデル名、量子化、コンテキスト長、キャッシュ設定を記録してください。
実際のワークロードをテストする
最初のトークンまでの遅延、継続的な生成、キャッシュの挙動、最も遅いターンを比較します。コーディングエージェントや長いコンテキストを使うワークフローでは、短い合成プロンプトとは異なる結果になる可能性があります。
| ハードウェアまたはプラットフォーム | 実用上の見込み | 推奨事項 |
|---|---|---|
| Linux搭載の新しいNVIDIA GPU | 公開されている対応範囲に最も合致 | ここから始める |
| 8 GBのNVIDIAノートPC GPU | 特定のワークロードでは高い性能が期待できる可能性 | 慎重にテストする |
| 旧世代NVIDIA GPU | 対応要望が確認されている | セットアップ前に確認する |
| Apple Silicon Mac | 確認した資料には公開済みMacビルドがない | 対応が確認されるまで待つ |
| Windowsシステム | 互換性に関する懸念が報告されている | 現在の対応状況を確認する |
管理されたテスト用ディレクトリを使用し、設定内容を明確にしておきましょう。エンジンのバージョン、モデルファイル、量子化、プロンプト形式、コンテキストサイズ、測定した出力を記録します。これにより、高速な結果を別のモデルや軽いワークロードの結果と取り違えるのを防げます。
導入を決める前に:
- LinuxとNVIDIA CUDAの互換性を確認する
- 利用可能なGPUメモリとシステムメモリを測定する
- モデル、量子化、コンテキスト、キャッシュ設定を記録する
- 平均速度と最も遅いターンのレイテンシを両方テストする
- ハードウェアがすでにサポートしているランタイムと結果を比較する
FreeTokenは、新しいNVIDIAハードウェア、十分なシステムメモリ、MoEワークロード、そしてローカルでのコーディングエージェント推論に対する強いニーズを持つユーザーに最も適しています。
強み、制限、そしてプロジェクトの展望
FreeTokenの最大の強みは、すべてのローカルAIユーザーが直ちに既存のランタイムを置き換えるべきだという点ではありません。その価値は、より具体的なものです。難しいメモリ帯域幅の問題に対してルーティング対応の解決策を探り、互換性のあるシステムで大幅な性能向上を報告しています。エージェントがエキスパート転送で頻繁に停止するユーザーにとっては、平均速度の見栄えよりもテールレイテンシの低さが重要になる可能性があります。
その代わりに、成熟度と対応範囲にはトレードオフがあります。確認したプロジェクトはllama.cppと比べて公開されてからの歴史が浅く、資料では独立した第三者ベンチマークも確認できませんでした。より広範なハードウェア対応、安定したパッケージング、再現可能な外部テストによって、このアプローチが広く採用されるランタイムになるのか、それとも確立されたプロジェクトに取り込まれる技術群にとどまるのかが決まるでしょう。
| 強み | 制限 | 意味すること |
|---|---|---|
| ルーティング対応のエキスパート処理 | より複雑な実行ポリシー | MoEの局所性が向上する可能性 |
| 報告されたベンチマーク結果が優れている | 結果はプロジェクト作成者によるもの | 独自に検証する必要がある |
| Apacheライセンス | ベータ段階のエコシステム | 統合作業を想定する |
| ローカル実行 | 適切なハードウェアが必要 | ハードウェアコストは依然として大きい |
| 専門的な最適化 | プラットフォームの対応範囲が狭い | 万能な置き換えではない |
FreeToken固有の利点が自分のワークロードに合う場合に利用してください。移植性、幅広いバックエンド対応、予測可能なインストールが、特定クラスのNVIDIAシステムでのMoE性能の最大化よりも重要な場合は、確立されたランタイムを利用できる状態にしておきましょう。
ローカルエンジンには、スループットのグラフでは捉えきれない実用上の利点もあります。
- プロンプトと生成内容をローカルマシン内に保持できます。
- プロバイダーのレート制限やサービスの可用性に左右されません。
- 固定されたローカル環境により、モデルサービスの変更への依存を減らせます。
- ハードウェアを所有するには、依然として相応の初期費用がかかります。
- 電力消費、メモリ容量、保守も評価に含めるべきです。
FreeTokenは、特定の目的に集中した有望なMoEサービングプロジェクトであり、万能の勝者ではありません。ルーティング負荷の高いNVIDIAワークロードにはFreeTokenを、互換性とエコシステムの厚みを重視する場合は、より幅広いランタイムを選びましょう。
FreeToken FAQ
Q: FreeTokenは何に使われますか?
FreeTokenは、大規模なMixture-of-Expertsモデルをローカルで提供するためのエッジネイティブ推論エンジンです。利用可能なメモリ帯域幅と配置に応じて、エキスパートの実行方法を適応させることに重点を置いています。
Q: FreeTokenはApple Siliconをサポートしていますか?
確認した2026年の資料には、MacビルドやApple Silicon対応は記載されていません。プロジェクトが対応実装を正式に公開するまでは、Appleへの対応は利用できないものとして扱うべきです。
Q: FreeTokenはllama.cppより高速ですか?
プロジェクトは、特定のNVIDIAワークロードにおいて、より高いスループットとより低い最悪時レイテンシを報告しています。これらの結果は有望ですが、同じモデル、設定、独立したテストによって検証する必要があります。
Q: 最初にFreeTokenを試すべきなのは誰ですか?
最適な候補は、新しいNVIDIAハードウェア、十分なシステムメモリ、大規模なMoEモデルを持ち、長いテールレイテンシが実用上の問題を引き起こすコーディングエージェントのワークロードを利用しているユーザーです。
1つのtokens-per-secondの数値だけで推論エンジンを選ばないでください。まず、OSのサポート、GPUバックエンド、モデル形式、メモリ要件、ワークロードの挙動を確認しましょう。