FreeToken api: 로컬 MoE 서빙 설정 가이드 2026 - API

FreeToken api: 로컬 MoE 서빙 설정 가이드 2026

전문가 캐싱, 적응형 CPU-GPU 실행, 탄력적 메모리 관리를 통해 FreeToken이 프런티어급 MoE 모델을 로컬에서 서빙하는 방법을 알아보세요.

2026-08-25
FreeToken 팀
빠른 가이드
  • FreeToken api는 대규모 전문가 혼합(Mixture-of-Experts) 모델을 서빙하기 위한 로컬 추론 스택입니다.
  • 핵심 장점: 라우팅을 인식하는 전문가 캐싱으로 불필요한 CPU 및 PCIe 병목을 줄입니다.
  • 가장 적합한 하드웨어: 충분한 시스템 메모리와 CUDA를 지원하는 최신 NVIDIA GPU입니다.
  • 주요 제한 사항: 공개 릴리스는 베타 중심이며 주로 Linux NVIDIA 환경을 대상으로 합니다.
  • 주요 기대 사항: 결과는 VRAM, 호스트 대역폭, PCIe 대역폭, 모델 형식에 크게 좌우됩니다.

FreeToken api란 무엇인가요?

FreeToken은 개인 하드웨어에서 대규모 오픈 웨이트 전문가 혼합 모델을 실행하도록 설계된 엣지 네이티브 서빙 시스템입니다. GPU만 사용 가능한 자원으로 취급하는 대신 GPU 메모리, CPU 메모리, CPU 실행, PCIe 인터커넥트를 하나의 추론 플랫폼으로 조율합니다.

이 시스템은 전체 전문가 풀이 사용 가능한 VRAM을 초과하지만 토큰당 희소 연산은 실용적인 수준으로 유지되는 모델을 대상으로 합니다. 예를 들어 DeepSeek-V4-Flash는 총 284B개의 파라미터와 13B개의 활성 파라미터를 보유한 것으로 설명되며, GLM-5.2는 총 753B개의 파라미터와 40B개의 활성 파라미터를 가진 것으로 소개됩니다. 각 토큰에서는 라우팅된 전문가 중 일부만 참여하지만, 전체 전문가 풀에는 여전히 접근할 수 있어야 합니다.

동영상 하이라이트:

  • FreeToken은 대규모 MoE 모델을 위한 새로운 로컬 엔진으로 소개됩니다.
  • 주요 비교 대상은 라우팅 인식 캐싱과 정적 배치 방식입니다.
  • 보고된 결과에는 소비자용 GPU, 노트북, 워크스테이션급 GPU가 포함됩니다.
  • 에이전트 워크로드에서는 꼬리 지연 시간이 가용성 문제로 다뤄집니다.
용어의미
MoE많은 전문가를 포함하면서 각 토큰을 소수의 전문가에게만 라우팅하는 모델 아키텍처
전문가 풀라우팅된 전문가 가중치의 전체 집합
프리필생성이 시작되기 전에 기존 프롬프트 또는 컨텍스트를 처리하는 과정
디코드한 번에 한 단계씩 새로운 토큰을 생성하는 과정
TTFT출력이 시작되기 전에 필요한 작업을 포함한 첫 토큰까지의 시간
엣지 서빙데이터센터 클러스터가 아닌 개인 또는 소비자용 하드웨어에서 추론을 실행하는 방식
가장 좋은 시작점

FreeToken을 모델이 아닌 서빙 런타임으로 생각하세요. 여전히 호환 가능한 모델 체크포인트, 지원되는 하드웨어, 충분한 호스트 메모리, 올바르게 준비된 런타임 형식이 필요합니다.

FreeToken은 MoE 메모리를 어떻게 처리하나요?

FreeToken은 모델을 GPU에 상주하는 부분과 호스트에 상주하는 전문가 풀로 분리합니다. 비전문가 가중치는 GPU에 남아 있고, CPU에 상주하는 풀은 라우팅된 전문가를 위한 기준 데이터 역할을 합니다. 사용 가능한 VRAM은 MoE 레이어 전체가 공유하는 탄력적인 전문가 캐시로 전환됩니다.

이 설계가 중요한 이유는 희소 연산이 메모리 압박을 없애 주지 않기 때문입니다. 하나의 토큰이 훨씬 더 큰 풀에서 단 6개의 전문가만 활성화할 수 있지만, 런타임은 라우터가 다음에 선택하는 전문가가 무엇이든 액세스할 준비가 되어 있어야 합니다.

공유 전문가 캐시

  • 전역 LRU 상주 공간 사용
  • 레이어-전문가 쌍 추적
  • 토큰 수준의 변화하는 라우팅을 따름

적응형 캐시 미스 처리

  • 일부 캐시 미스를 PCIe를 통해 전송
  • 다른 캐시 미스는 CPU에서 직접 실행
  • 측정된 대역폭을 사용해 작업을 균형 있게 분배

탄력적 메모리

  • 안전한 지점에서 GPU 캐시 조정
  • KV 캐시와 용량 공유
  • 변화하는 VRAM 가용량에 대응

디코드 중에 FreeToken은 GPU에서 캐시 적중과 캐시 미스를 식별합니다. 적중한 항목은 VRAM에서 직접 실행됩니다. 캐시 미스는 측정된 호스트 측 대역폭과 PCIe 대역폭에 따라 GPU 캐시 채우기와 CPU 실행으로 나뉩니다. 이를 통해 런타임이 모든 시스템에 하나의 고정된 전략만 적용하는 것을 방지합니다.

런타임 구성 요소주요 위치주요 책임
비전문가 가중치GPU 메모리일반적인 모델 실행에 사용할 수 있도록 유지
전체 전문가 풀호스트 메모리라우팅된 전문가를 위한 원본 가중치 제공
전문가 캐시남은 GPU 메모리최근 사용된 레이어-전문가 쌍 유지
KV 캐시GPU 메모리 예산활성 컨텍스트의 어텐션 상태 저장
라우팅 메타데이터GPU 및 런타임 버퍼선택된 전문가와 캐시 상태 식별
이 설계가 중요한 이유

중요한 변화는 단순히 더 많은 가중치를 CPU와 GPU 사이에서 이동시키는 데 있지 않습니다. FreeToken은 누락된 전문가를 전송 가능한 데이터 또는 실행 가능한 작업으로 취급한 다음, 배포된 시스템에 맞춰 두 경로 중 하나를 선택합니다.

FreeToken api 설정 워크플로

신뢰할 수 있는 설정은 성능 기대치보다 호환성 확인에서 시작됩니다. 공개 자료에서는 CUDA 및 NVIDIA 기반 Linux 환경을 주요 지원 대상으로 제시하고 있으며, 2026년 공개 출시 시기에도 더 폭넓은 Windows, macOS 및 구형 GPU 지원 요청이 계속 확인되었습니다.

모든 모델이나 운영체제가 지원된다고 가정하지 말고, 다음 워크플로를 사용해 로컬 배포를 준비하세요.

1

하드웨어 프로필 확인

GPU 메모리, 호스트 메모리, PCIe 링크 폭, CPU 메모리 대역폭, 운영체제를 기록하세요. 이러한 값은 전문가 캐시를 VRAM에 얼마나 많이 유지할 수 있는지와 캐시 미스를 얼마나 효율적으로 처리할 수 있는지에 영향을 줍니다.

2

호환 가능한 모델 선택

Qwen3.6-35B-A3B, DeepSeek-V4-Flash 또는 GLM-5.2 데모처럼 프로젝트의 공개 평가에 나열된 모델부터 시작하세요. 저장 공간을 준비하기 전에 필요한 정밀도와 체크포인트 레이아웃을 확인하세요.

3

런타임 형식 준비

FreeToken은 전문가 뱅크를 직접 로드하기에 적합한 레이아웃으로 정규화하는 FreeToken Weight 형식을 사용합니다. 준비된 형식을 사용하면 텐서를 반복해서 검색하고 재패킹하는 작업을 피하여 시작에 필요한 작업을 줄일 수 있습니다.

4

튜닝 전에 측정

런타임이 호스트 측 전문가 처리 성능과 페이지 고정 전송 대역폭을 프로파일링하도록 하세요. 이러한 측정값이 캐시 채우기와 직접적인 CPU 실행 사이의 균형을 결정합니다.

5

에이전트 워크로드 테스트

단순한 토큰 속도만 평가하지 마세요. 멀티턴 코딩, 추론 또는 도구 호출 워크플로를 사용하고 TTFT, 긴 멈춤, 캐시 동작, 완료 안정성을 모니터링하세요.

설정 확인 항목중요한 이유권장 조치
NVIDIA CUDA 환경고속 경로가 CUDA 호환 하드웨어를 중심으로 구성됨모델을 준비하기 전에 드라이버와 CUDA 스택 확인
호스트 메모리 용량전체 전문가 풀이 VRAM을 크게 초과할 수 있음선택한 체크포인트에 충분한 메모리 확보
PCIe 대역폭GPU 캐시 채우기가 호스트-디바이스 전송 속도에 의존함가능한 경우 폭이 넓고 대역폭이 높은 링크 사용
모델 정밀도형식에 따라 가중치 크기와 커널 호환성이 달라짐체크포인트 정밀도를 지원되는 런타임 경로에 맞춤
동시 실행 애플리케이션브라우저, 게임 및 데스크톱 작업이 VRAM 가용량을 변경할 수 있음여유 공간을 남기고 실제 사용 환경에서 테스트

시스템에 접근하려면 프로젝트 문서와 릴리스 자료에서 공식 FreeToken 프로젝트 페이지를 안내합니다. 기술 설계는 FreeToken 연구 논문에 문서화되어 있습니다.

사전 점검 체크리스트:

  • 지원되는 NVIDIA CUDA 환경 확인
  • 호스트 메모리와 사용 가능한 GPU 메모리 확인
  • 모델과 일치하는 정밀도 선택
  • 필요한 FreeToken Weight 형식 준비 또는 확보
  • 현실적인 멀티턴 워크로드 벤치마크 실행
호환성 경고

모델 다운로드가 성공했다고 해서 런타임 호환성이 입증된 것으로 간주하지 마세요. 공개 지원 프로필은 NVIDIA CUDA와 POSIX Linux를 강조하며, Apple Silicon, 구형 NVIDIA 카드 및 더 폭넓은 플랫폼 지원에는 향후 프로젝트 변경이 필요할 수 있습니다.

성능 및 하드웨어 비교

FreeToken의 보고된 성능 향상은 대규모 MoE 모델, 제한된 VRAM, 반복적인 전문가 라우팅, 장시간 실행되는 에이전트 턴이 결합된 워크로드에서 가장 크게 나타납니다. 해당 평가는 여러 소비자용 시스템과 워크스테이션급 RTX PRO 6000에서 활발히 유지 관리되는 엣지 엔진들과 FreeToken을 비교합니다.

RTX 5090에서 공개된 결과는 Qwen3.6-35B의 경우 초당 77–83토큰, DeepSeek-V4-Flash의 경우 초당 22–25토큰을 보고합니다. 같은 평가에서 FreeToken의 최악의 턴 TTFT는 44초 미만으로 나타났으며, 하나 이상의 테스트 셀에서 기준 구현의 멈춤 시간은 llama.cpp 232초, Ollama 179초, KTransformers 946초에 달했습니다.

모델 또는 등급하드웨어 예시FreeToken 결과보고된 비교
Qwen3.6-35B-A3BRTX 509077–83 tok/s가장 강력한 기준 구현 대비 1.8–2.3배
DeepSeek-V4-FlashRTX 509022–25 tok/s가장 강력한 기준 구현 대비 1.5–1.9배
Qwen3.6-35B-A3BRTX 4060 노트북, 8 GB39.3 tok/s보고된 RTX 4090 속도의 약 92%
GLM-5.2RTX PRO 6000 Blackwell, 96 GB14.9 tok/sllama.cpp의 7.3 tok/s 대비 약 2.0배
Qwen3.6-35B-A3BRTX 5090 데스크톱선도적인 기준 비교 대상으로 언급됨서버 설정 대비 호스트 대역폭으로 인해 결과가 약 4% 감소

캐시 정책은 보고된 라우팅 추적 재생에서도 상당한 차이를 만들었습니다. RTX 5090 서빙 용량에서 FreeToken의 전역 LRU는 Qwen3.6 전문가 읽기의 16%, DeepSeek-V4-Flash 읽기의 39%를 캐시 미스로 처리했습니다. 같은 모델 순서에서 비교 수치는 llama.cpp의 정적 분할이 각각 62%와 89%의 캐시 미스를 기록한 것으로 제시했습니다.

배치 전략라우팅 인식강점주요 절충점
FreeToken 전역 LRU토큰 수준에서 지속적으로 업데이트현재 전문가 작업 집합 추적동적 캐시 제어 필요
llama.cpp 정적 분할레이어 배치에 따라 고정예측 가능하고 간단함변화하는 라우팅 전문가를 놓칠 수 있음
KTransformers 핫 배치프리필 동작을 중심으로 업데이트선택한 전문가를 GPU 또는 CPU에 유지 가능모든 디코드 시점의 변화를 따라가지 못할 수 있음
CPU 전용 전문가 경로GPU 캐시에 의존하지 않음폭넓은 폴백 동작호스트 메모리 대역폭에 제한됨

또한 평가에서는 전체 레이어 더블 버퍼링이 전문가 이동을 연산 뒤에 숨겨 프리필 처리량을 향상했다고 보고합니다. 인용된 Qwen3.6 테스트에서 두 번째 버퍼를 비활성화하면 4K 토큰에서 처리량이 19%, 8K에서 25%, 16K에서 26% 감소했습니다.

벤치마크를 신중하게 읽으세요

주요 처리량 수치는 프로젝트 자체 평가에서 나온 것입니다. 동일한 가중치와 여러 워크로드를 사용했지만, 제공된 자료만으로는 독립적인 제3자 벤치마크가 확립되지 않았습니다. 꼬리 지연 시간, 호환성, 반복 가능성도 peak tokens per second만큼 중요하게 고려하세요.

제한 사항, 최적의 사용 사례 및 FAQ

FreeToken은 최신 NVIDIA 하드웨어를 이미 보유하고 있고, 충분한 시스템 메모리를 갖추었으며, 코딩 또는 추론 에이전트를 통해 MoE 모델을 실행하는 사용자에게 가장 매력적입니다. 선택한 모델이 이미 VRAM에 여유 있게 들어가거나, 플랫폼에 필요한 CUDA 경로가 없거나, 워크로드가 짧은 단일 턴 요청인 경우에는 이점이 덜 분명합니다.

또한 이 시스템이 실질적인 의미에서 로컬 추론을 무료로 만들어 주는 것은 아닙니다. 하드웨어, 전력, 저장 공간, 냉각, 설정에 드는 시간은 여전히 의사 결정의 일부입니다. 대신 FreeToken의 가치는 개인정보 보호, 로컬 제어, 속도 제한에 대한 노출 감소, 호스팅 서비스에 의존하지 않고 모델을 계속 사용할 수 있다는 점과 연결됩니다.

사용자 프로필적합성이유
최신 NVIDIA 데스크톱 사용자높음캐시와 PCIe 경로를 효과적으로 사용할 가능성이 가장 높음
8 GB NVIDIA 노트북 사용자조건부보고된 노트북 결과는 유망하지만 발열 및 메모리 제한이 여전히 중요함
Apple Silicon 사용자제공된 2026년 지원 프로필에서는 제한적공개된 Mac 고속 경로가 확인되지 않음
구형 NVIDIA GPU 사용자불확실구형 하드웨어 지원은 미해결 요청으로 등록됨
짧은 단일 턴 사용자보통긴 컨텍스트와 에이전트 워크로드에서 FreeToken의 장점이 더 잘 드러남
대규모 MoE 모델을 사용하는 코딩 에이전트 사용자높음꼬리 지연 시간과 반복적인 라우팅이 핵심 해결 대상 문제임

Q: FreeToken api는 어떤 용도로 사용되나요?

GPU 메모리, 호스트 메모리, CPU 실행 및 PCIe 전송을 조율하여 개인 하드웨어에서 대규모 오픈 웨이트 전문가 혼합 모델을 서빙하는 데 사용됩니다.

Q: FreeToken을 사용하려면 특정 모델이 필요한가요?

런타임은 모델에 따라 달라집니다. 제공된 평가에서는 Qwen3.6-35B-A3B, DeepSeek-V4-Flash 및 GLM-5.2를 언급하지만, 각 모델에는 여전히 호환 가능한 정밀도와 준비된 런타임 레이아웃이 필요합니다.

Q: FreeToken이 모든 사용자에게 llama.cpp보다 더 나은가요?

아닙니다. FreeToken은 대규모 MoE 워크로드를 실행하는 최신 NVIDIA 시스템을 대상으로 합니다. 플랫폼 지원 범위와 기존 하드웨어 호환성이 우선이라면 llama.cpp가 여전히 더 폭넓게 검증된 선택지입니다.

Q: FreeToken은 왜 CPU 실행과 GPU 캐싱을 모두 사용하나요?

캐시 미스가 발생한 전문가는 GPU로 전송하거나 현재 상주한 위치에서 실행할 수 있습니다. FreeToken은 하나의 고정 정책에 의존하지 않고 측정된 대역폭을 사용해 두 경로 사이에 캐시 미스를 분배합니다.

실용적인 권장 사항

워크로드가 대규모 MoE 전문가 풀과 장시간 에이전트 턴으로 인해 제한될 때 FreeToken을 사용하세요. 일반적인 로컬 추론에서는 초당 최대 토큰 수에만 의존하기보다 플랫폼 지원, 모델 사용 가능 여부, 설정에 필요한 노력, 꼬리 지연 시간을 먼저 비교하세요.