엣지 네이티브 MoE 추론 엔진

FreeToken 위키

적응형 CPU-GPU 실행, 효율적인 캐싱, 양자화, OpenAI 또는 Anthropic 호환 API를 통해 최신 오픈 웨이트 MoE 모델을 일반 소비자용 NVIDIA GPU에서 로컬로 실행하세요.

GitHub에서 보기

FreeToken 위키 가이드

FreeToken으로 대규모 MoE 모델을 로컬에 설치하고 구성하며 실행하는 데 필요한 모든 정보

Latest Updates

Discover the newest guides, tips, and content

FreeToken 290b 모델: 2026 엣지 MoE 설정 가이드

적응형 캐싱, 대역폭 스케줄링, 탄력적 메모리를 통해 FreeToken이 소비자용 하드웨어에서 프런티어급 MoE 모델을 서비스하는 방법을 알아보세요.

2026년 8월 25일performance
Read more →
FreeToken 4gb vram: 설정 가이드 및 하드웨어 한계

FreeToken이 제한된 VRAM, CPU 오프로딩, 전문가 캐싱을 처리하는 방식과 로컬 MoE 서빙에 필요한 현실적인 하드웨어 요구 사항을 알아보세요.

2026년 8월 25일hardware
Read more →
FreeToken 753b 모델: 설정 가이드 및 MoE 튜닝 팁

FreeToken이 로컬 환경에서 753B GLM-5.2를 제공하는 방법을 알아보세요. 설정, 메모리 페이징, MoE 캐싱, 벤치마크 및 실용적인 튜닝 조언을 다룹니다.

2026년 8월 25일performance
Read more →
FreeToken anthropic api: 단계별 설정 가이드

보안 키, 환경 변수, 요청 테스트 및 문제 해결 팁을 활용해 FreeToken 프로젝트에서 Anthropic API 액세스를 설정하는 방법을 안내합니다.

2026년 8월 25일api
Read more →
FreeToken api: 로컬 MoE 서빙 설정 가이드 2026

전문가 캐싱, 적응형 CPU-GPU 실행, 탄력적 메모리 관리를 통해 FreeToken이 프런티어급 MoE 모델을 로컬에서 서빙하는 방법을 알아보세요.

2026년 8월 25일api
Read more →
FreeToken API 서버: 설정 가이드 및 런타임 팁

FreeToken API 서버가 MoE 캐싱, CPU-GPU 실행, 하드웨어 확인 및 실용적인 로컬 서빙 결정을 처리하는 방식을 알아보세요.

2026년 8월 25일api
Read more →
FreeToken 벤치마크: 로컬 MoE 서빙 설정 가이드

FreeToken 벤치마크, 로컬 MoE 서빙 설계, 하드웨어 요구 사항, 설치 과정 및 측정된 성능 결과를 살펴봅니다.

2026년 8월 25일performance
Read more →
FreeToken claude code: 모델 라우팅 설정 가이드

로컬 게이트웨이, 모델 라우팅, 대체 프로바이더 및 안전한 문제 해결 방식을 사용하여 FreeToken claude code를 구성합니다.

2026년 8월 25일agents
Read more →
FreeToken codex: 설정 가이드, 벤치마크 및 한계

FreeToken codex를 소개합니다. 전문가 인식 메모리 시스템의 작동 방식, 벤치마크, 하드웨어 한계, 설정 고려 사항 및 로컬 AI의 장단점을 알아보세요.

2026년 8월 25일agents
Read more →
FreeToken deepseek: 로컬 AI 설정 가이드 및 벤치마크

MoE 캐싱, CPU-GPU 오프로딩, 하드웨어 안내, 설정 단계 및 성능 정보를 통해 FreeToken으로 DeepSeek를 로컬에서 실행하는 방법을 알아보세요.

2026년 8월 25일models
Read more →
FreeToken DeepSeek V4 Flash: 로컬 설정 가이드 2026

FreeToken으로 DeepSeek V4 Flash를 활용한 로컬 AI 추론 환경을 설정하는 방법을 안내합니다. RAM 계획, GPU 요구 사항, Open WebUI 접속 및 문제 해결 방법을 포함합니다.

2026년 8월 25일models
Read more →
FreeToken 엣지 네이티브 MoE 서빙: 아키텍처 가이드

FreeToken이 대규모 MoE 모델을 엣지 하드웨어에서 서빙하기 위해 대역폭 적응형 실행, 캐싱, CPU-GPU 조정을 사용하는 방법을 알아보세요.

2026년 8월 25일architecture
Read more →
Install

FreeToken 설치 가이드

데스크톱 앱, uv, PyPI 또는 소스 코드로 FreeToken을 설정한 다음 첫 번째 로컬 모델 서버를 실행하세요. NVIDIA GPU 사용자는 가속 Python 패키지를 설치하고 시스템 대역폭을 확인한 후 ft CLI로 OpenAI 호환 서버를 시작할 수 있습니다.

1

호스트 시스템 확인

지원되는 NVIDIA GPU가 장착된 Windows 또는 Linux PC를 사용하세요. FreeToken은 RTX 30, RTX 40 및 RTX 50 시리즈 시스템을 대상으로 하며, 대규모 모델 실행을 위해 GPU 메모리와 시스템 RAM을 결합할 수 있습니다.

2

데스크톱 앱 설치

가장 간단하게 설정하려면 Windows 또는 Linux용 FreeToken 데스크톱 애플리케이션을 다운로드하여 설치하세요. 데스크톱 워크플로는 로컬 모델을 구성하고 서비스하기 위한 그래픽 인터페이스를 제공합니다.

3

uv로 설치

uv를 사용하여 Python 환경에 가속 FreeToken 패키지를 설치하세요.

uv pip install "freetoken[accel]"
4

PyPI에서 설치

uv를 사용하지 않는 경우에도 표준 Python 패키지 설치 방식으로 동일한 가속 패키지를 설치할 수 있습니다.

pip install "freetoken[accel]"
5

소스에서 설치

개발 버전이 필요하거나 소스 트리에서 직접 작업하려면 FreeToken 저장소를 복제한 다음 프로젝트와 가속 관련 종속성을 설치하세요.

git clone https://github.com/FlashML-org/FreeToken.git
6

호스트 대역폭 측정

매우 큰 MoE 체크포인트를 서비스하기 전에 내장 대역폭 벤치마크를 실행하세요. FreeToken은 이 결과를 사용하여 CPU 메모리와 GPU가 얼마나 효율적으로 함께 작동할 수 있는지 판단합니다.

ft bench bw
7

모델 서버 시작

ft serve로 FreeToken 서비스 워크플로를 시작하세요. 서버는 애플리케이션과 코딩 에이전트를 위해 OpenAI 및 Anthropic 호환 인터페이스를 통해 로컬 추론을 제공합니다.

ft serve
8

첫 실행 확인

외부 클라이언트인 Codex, Claude Code 또는 OpenCode를 연결하기 전에 선택한 모델이 로드되고 서버가 계속 실행되며 로컬 API 요청이 생성된 출력을 반환하는지 확인하세요.

Quick Tips

  • freetoken[accel] extra는 RTX급 하드웨어에 필요한 GPU 가속 스택을 설치합니다.
  • 첫 번째 대규모 모델을 실행하기 전에 ft bench bw를 한 번 실행하면 FreeToken이 효율적인 실행 전략을 선택할 수 있습니다.
  • 데스크톱 앱과 ft CLI는 동일한 엔진을 사용하므로 자유롭게 전환할 수 있습니다.
  • 가속 패키지 내부의 커널 및 호환성 오류를 방지하려면 CUDA와 NVIDIA 드라이버를 최신 상태로 유지하세요.
Models

FreeToken 지원 모델

FreeToken은 전체 파라미터 수가 단일 소비자용 GPU의 메모리를 초과할 수 있는 대규모 희소 Mixture-of-Experts 모델을 중심으로 설계되었습니다. 실행 백엔드는 GPU 연산, 시스템 메모리, expert 캐싱 및 모델별 체크포인트 처리를 결합하여 이러한 모델을 로컬 머신에서 실용적으로 실행할 수 있도록 합니다.

모델규모체크포인트 형식양자화백엔드적합한 용도
GLM-5.2총 753B 파라미터GLM MoE 체크포인트MXFP4 / NVFP4 / FP8 / BF16하이브리드 MoE / expert 오프로딩고용량 워크스테이션 서비스
DeepSeek-V4-Flash대규모 희소 MoEDeepSeek MoE 체크포인트MXFP4 / NVFP4 / FP8 / BF16하이브리드 MoE / expert 오프로딩로컬 추론 및 에이전트 워크로드
Qwen3.635B-A3B급 희소 MoEQwen MoE 체크포인트MXFP4 / NVFP4 / FP8 / BF16MoE 서비스 백엔드로컬 채팅, 코딩 및 에이전트
Qwen3 MoE여러 희소 모델 크기Qwen MoE 체크포인트MXFP4 / NVFP4 / FP8 / BF16MoE 서비스 백엔드범용 로컬 추론
gpt-oss여러 체크포인트 크기gpt-oss 체크포인트MXFP4 / NVFP4 / FP8 / BF16희소 모델 서비스 백엔드OpenAI 호환 애플리케이션 워크플로
Gemma-4모델에 따라 다름Gemma 체크포인트MXFP4 / NVFP4 / FP8 / BF16모델에 적합한 백엔드로컬 범용 추론
MiniMax대규모 희소 MoEMiniMax 체크포인트MXFP4 / NVFP4 / FP8 / BF16하이브리드 MoE / expert 오프로딩대규모 컨텍스트 에이전트 워크로드

Quick Tips

  • 모든 주요 모델군은 FP8 및 BF16과 함께 MXFP4 및 NVFP4 저정밀 체크포인트를 지원합니다.
  • 결합된 VRAM과 시스템 RAM 예산에 체크포인트 크기를 맞춰 양자화 방식을 선택하세요.
  • 하이브리드 MoE 실행은 가장 큰 체크포인트에 적합하며, 더 작은 희소 모델은 GPU에 더 많이 상주할 수 있습니다.
  • 새로운 모델군이 정기적으로 추가되므로 엔진이 릴리스될 때마다 모델 문서를 확인하세요.
Hardware

FreeToken 하드웨어 요구 사항

FreeToken은 모델 전체가 GPU VRAM 안에 들어가야 할 필요가 없습니다. 대역폭에 적응하는 CPU-GPU 실행, expert 캐싱 및 탄력적 메모리 관리 덕분에 희소 MoE 체크포인트가 GPU 메모리와 호스트 RAM을 모두 사용할 수 있으므로, 순수한 GPU 용량과 함께 시스템 메모리와 PCIe 대역폭도 중요합니다.

구성 요소요구 사항중요한 이유
운영 체제Windows 또는 Linux두 플랫폼 모두 데스크톱 앱과 로컬 서비스 워크플로에서 지원됩니다.
GPU 제품군NVIDIA RTX 30 / 40 / 50 시리즈최신 GPU는 더 많은 VRAM과 연산 여유를 제공하여 더 큰 활성 expert 집합을 처리할 수 있습니다.
GPU VRAM모델, 정밀도 및 캐시에 따라 다름VRAM이 많을수록 활성 가중치와 캐시된 expert를 GPU에 유지하여 전송을 줄일 수 있습니다.
시스템 RAM대규모 MoE 체크포인트를 위한 높은 용량호스트 RAM이 VRAM을 초과하는 가중치를 보관하여 훨씬 더 큰 체크포인트를 사용할 수 있게 합니다.
CPU 메모리 대역폭오프로딩에는 높을수록 좋음대역폭 적응형 실행은 측정된 호스트 메모리 성능을 사용합니다.
PCIe 대역폭빠른 전송 권장expert 가중치가 RAM과 VRAM 사이에서 이동하는 속도를 결정합니다.
CUDA 및 드라이버호환 가능한 NVIDIA 런타임freetoken[accel]을 통한 가속 GPU 실행에 필요합니다.
290B+급 모델충분한 호스트 RAM 및 RTX GPU하이브리드 CPU-GPU 실행으로 VRAM에 모두 적재해야 할 필요가 없어집니다.
최대 규모 체크포인트워크스테이션 RAM, 스토리지 및 대역폭753B 파라미터 GLM-5.2와 같은 최신 대규모 희소 모델을 서비스합니다.

Quick Tips

  • RTX 30 시리즈는 중간 규모 체크포인트와 더 강한 양자화 설정에서 잘 작동합니다.
  • RTX 40 시리즈는 하이브리드 MoE 워크로드에서 더 높은 추론 성능과 메모리 효율을 제공합니다.
  • RTX 50 시리즈는 NVFP4 저정밀 형식과 더 큰 고처리량 배포에 적합합니다.
  • 듀얼 채널 이상의 시스템 메모리는 오프로딩된 expert 전달 속도를 직접적으로 향상합니다.
Benchmarks

FreeToken 벤치마크

FreeToken의 성능은 GPU 연산 성능만으로 결정되지 않습니다. 대규모 MoE 체크포인트는 호스트 메모리와 GPU 사이에서 expert를 지속적으로 이동시킬 수 있기 때문입니다. FreeToken의 벤치마크 도구는 특정 시스템에서 사용 가능한 대역폭을 측정하고, 런타임이 더 많은 offload를 사용할지 GPU 상주형 하이브리드 실행을 사용할지 선택하도록 지원합니다.

벤치마크명령어측정 항목중요한 이유
CPU 메모리 대역폭ft bench bw호스트 메모리 처리량Offload된 expert 가중치는 시스템 RAM에서 읽으므로, 대역폭이 높을수록 expert 전송 속도가 직접적으로 향상됩니다.
CPU-GPU 대역폭ft bench bwPCIe 전송 처리량가중치가 VRAM에 이미 상주하지 않을 때 GPU에 얼마나 빠르게 도달하는지를 결정합니다.
디코드 처리량ft serve초당 생성 토큰 수프롬프트 처리 이후의 대화형 생성 속도입니다.
프리필 처리량ft serve프롬프트 처리 처리량더블 버퍼링된 프리필 스트리밍은 긴 프롬프트에서 데이터 이동과 연산을 중첩합니다.
GPU 메모리 사용량ft serve가중치, 캐시, 상태에 사용되는 VRAM탄력적인 VRAM 관리는 메모리 예산 내에서 모델이 상주하도록 유지합니다.
시스템 메모리 사용량ft serve체크포인트와 expert에 사용되는 RAM대용량 호스트 메모리는 GPU VRAM보다 훨씬 큰 체크포인트를 처리할 수 있도록 합니다.
Expert 캐시 효율ft serveGPU 상주 expert 재사용전역 LRU 캐시는 CPU-GPU 간의 반복적인 전송을 줄입니다.
Offload 실행ft bench bw호스트에 상주하는 expert 비율VRAM이 제한적이어도 CPU 메모리와 PCIe 대역폭이 충분하면 가장 효과적으로 작동합니다.
하이브리드 MoE 실행ft bench bwGPU + 호스트 expert 구성VRAM 용량, 캐시 지역성, 전송 대역폭의 균형을 맞춥니다.
소비자용 노트북 프로필ft bench bw모바일 환경의 대역폭 제한노트북 메모리에 맞춰 더 작거나 더 많이 양자화된 체크포인트를 선택하는 데 도움이 됩니다.
게이밍 PC 프로필ft bench bw데스크톱 RTX + RAM + PCIeRTX 30, 40, 50 시스템에서 일반적으로 사용되는 FreeToken 구성입니다.
워크스테이션 프로필ft bench bw모든 구성 요소의 높은 용량CPU-GPU 협업을 통해 최첨단 규모의 희소 체크포인트를 지원합니다.

Quick Tips

  • 새 시스템에서 실행 전략을 선택하기 전에 항상 ft bench bw를 실행하세요.
  • 대부분의 expert가 offload된 경우 디코드 속도는 호스트 대역폭의 영향을 크게 받습니다.
  • VRAM에 충분한 수의 expert가 들어가면 하이브리드 실행이 일반적으로 순수 offload보다 빠릅니다.
  • 긴 컨텍스트 워크로드는 두 항목 모두에 부담을 주므로 프리필과 디코드 성능을 함께 비교하세요.
Local API

FreeToken API 가이드

FreeToken은 익숙한 API 형식을 통해 로컬 모델 추론을 제공합니다. ft serve로 지원되는 모델을 로드한 후, 애플리케이션은 모델을 검색하고, Chat 또는 Responses API 요청을 전송하며, Anthropic 스타일 메시지를 사용하고, 로컬 서버에서 생성된 토큰을 스트리밍할 수 있습니다.

로컬 서버 시작

CLI

지원되는 모델로 FreeToken 서빙 프로세스를 시작합니다. 서버는 모델 로딩, CPU-GPU 실행, 메모리 할당 및 HTTP API 요청을 처리합니다.

ft serve <model>

OpenAI Chat Completions

OpenAI-compatible

기존 SDK 또는 HTTP 클라이언트와 함께 OpenAI 호환 Chat Completions 엔드포인트를 사용합니다.

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "messages": [
      {"role": "user", "content": "Mixture-of-experts 모델을 설명하세요."}
    ]
  }'

OpenAI Responses API

OpenAI-compatible

새로운 OpenAI Responses API를 기반으로 구축된 애플리케이션은 해당 로컬 엔드포인트로 요청을 전송할 수 있습니다.

curl http://localhost:8000/v1/responses \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": "리스트를 뒤집는 짧은 Python 함수를 작성하세요."
  }'

사용 가능한 모델 목록 조회

OpenAI-compatible

OpenAI 호환 models 엔드포인트를 조회하여 실행 중인 FreeToken 서버가 노출하는 모델을 확인합니다.

curl http://localhost:8000/v1/models

Anthropic Messages API

Anthropic-compatible

FreeToken은 Anthropic API를 기반으로 설계된 클라이언트와 코딩 도구를 위해 Anthropic 호환 메시지 인터페이스도 제공합니다.

curl http://localhost:8000/v1/messages \
  -H "Content-Type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "<model>",
    "max_tokens": 512,
    "messages": [
      {"role": "user", "content": "이 저장소의 아키텍처를 요약하세요."}
    ]
  }'

스트리밍 응답

SSE

클라이언트가 서버 전송 이벤트를 통한 점진적 출력을 지원하는 경우 스트리밍을 활성화하면 생성된 토큰을 도착하는 즉시 사용할 수 있습니다.

{
  "model": "<model>",
  "messages": [
    {"role": "user", "content": "REST API 예제를 작성하세요."}
  ],
  "stream": true
}

서버 구성

CLI

ft serve 구성을 사용하여 모델을 선택하고 호스트, 포트, 메모리 설정을 포함해 로컬 HTTP 서비스의 노출 방식을 제어합니다.

ft serve --help

CLI 옵션 확인

CLI

FreeToken은 최신 엔진 릴리스에서 추가된 옵션을 포함해 현재 지원되는 서빙 및 런타임 옵션을 명령줄 도움말에서 직접 확인할 수 있도록 제공합니다.

ft --help
ft serve --help
Coding Agents

FreeToken Claude Code 및 Codex 설정

FreeToken은 OpenAI 또는 Anthropic 호환 API를 이해하는 에이전트형 코딩 도구의 로컬 추론 백엔드로 사용할 수 있습니다. ft launch 워크플로는 지원되는 에이전트의 구성을 지원하며, dry-run 모드를 사용하면 실제로 변경하거나 시작하기 전에 예정된 설정을 확인할 수 있습니다.

1

FreeToken 설치 및 확인

외부 코딩 에이전트를 연결하기 전에 FreeToken CLI가 설치되어 있고 지원되는 모델을 로컬에서 로드할 수 있는지 확인하세요.

ft --help
2

에이전트 실행 옵션 확인

launch 명령어 도움말을 사용하여 현재 지원되는 에이전트 통합과 사용 가능한 구성 옵션을 확인하세요.

ft launch --help
3

dry run으로 미리 보기

최종 워크플로를 시작하지 않고 생성된 명령어와 환경 구성을 확인하려면 에이전트를 실행하기 전에 dry-run 모드를 사용하세요.

ft launch <agent> --dry-run
4

코딩 에이전트 실행

FreeToken을 통해 선택한 코딩 에이전트를 시작하면 에이전트의 API 구성이 로컬 추론 백엔드를 가리키도록 설정됩니다.

ft launch <agent>
5

Claude Code

Claude Code는 FreeToken의 Anthropic 호환 인터페이스를 사용할 수 있습니다. 로컬 구성은 지원되는 Anthropic 메시지 트래픽을 FreeToken 서버로 리디렉션하면서 에이전트 워크플로를 유지합니다.

ft launch claude
6

Codex

Codex 스타일 클라이언트는 FreeToken의 OpenAI 호환 엔드포인트를 통해 연결할 수 있으므로, 로컬에서 제공되는 모델이 에이전트 요청을 처리할 수 있습니다.

ft launch codex
7

OpenCode, Hermes 및 OpenClaw

FreeToken의 launch 워크플로는 OpenCode, Hermes, OpenClaw와 같은 추가 코딩 및 자율 에이전트 클라이언트도 지원합니다. 현재 통합 이름과 옵션은 launch 도움말에서 확인하세요.

ft launch --help
8

클라우드 API fallback 방지

장시간 작업을 시작하기 전에 에이전트의 provider 및 base URL 구성을 확인하세요. 완전한 로컬 추론이 목적이라면 원치 않는 클라우드 provider 구성을 제거하거나 비활성화하고, dry-run 모드를 사용하여 FreeToken이 에이전트에 전달할 환경을 확인하세요.

ft launch <agent> --dry-run

Quick Tips

  • 새 에이전트를 처음 실제로 실행하기 전에 항상 dry-run 미리 보기를 한 번 실행하세요.
  • 에이전트가 작업하는 동안 FreeToken 서버를 계속 실행해 두세요. 장시간 세션은 동일한 엔드포인트에 다시 연결하기 때문입니다.
  • 설정 후 provider base URL을 확인하여 요청이 호스팅 API가 아닌 로컬 서버로 전달되는지 확인하세요.
  • 통합 이름은 엔진 릴리스에 따라 변경될 수 있으므로 업그레이드 후 ft launch --help를 다시 확인하세요.
How It Works

FreeToken 아키텍처

FreeToken은 Mixture-of-Experts 모델의 희소 구조를 중심으로 설계되었습니다. 모든 expert weight를 GPU 메모리에 유지할 필요 없이 CPU와 GPU 실행을 조정하고, 자주 사용되는 expert를 캐시하며, 전송과 연산을 오버랩하고, 모델이 실행되는 시스템에 맞춰 메모리 사용량을 조정합니다.

FreeToken은 GPU VRAM을 사용할 수 있는 유일한 모델 메모리로 간주하는 대신, expert 연산을 CPU와 GPU 리소스에 어떻게 분배할지 결정합니다. 실행 전략은 사용 가능한 CPU-GPU 대역폭과 하드웨어 특성을 고려하여 호스트 메모리와 GPU 연산 사이에서 연산과 데이터 이동의 균형을 맞춥니다.
Release Tracker

FreeToken 업데이트 및 릴리스

FreeToken은 추론 엔진과 데스크톱 환경 모두에서 발전하고 있습니다. 릴리스 추적기는 설치, 모델 호환성, 로컬 서빙, GPU 지원, 성능 및 agent 워크플로에 직접 영향을 미치는 변경 사항에 초점을 맞춥니다.

게시된 FreeToken 릴리스는 패키징된 엔진 변경 사항과 릴리스 노트를 확인할 수 있는 주요 위치입니다. 업그레이드할 때는 각 릴리스를 확인하세요. 특히 모델 지원, 체크포인트 형식, 서빙 동작, 설치 요구 사항 또는 런타임 성능이 변경되는 경우 반드시 확인해야 합니다.

Follow FreeToken Development

Track new releases and join the community through the official channels: