- FreeToken api는 대규모 전문가 혼합(Mixture-of-Experts) 모델을 서빙하기 위한 로컬 추론 스택입니다.
- 핵심 장점: 라우팅을 인식하는 전문가 캐싱으로 불필요한 CPU 및 PCIe 병목을 줄입니다.
- 가장 적합한 하드웨어: 충분한 시스템 메모리와 CUDA를 지원하는 최신 NVIDIA GPU입니다.
- 주요 제한 사항: 공개 릴리스는 베타 중심이며 주로 Linux NVIDIA 환경을 대상으로 합니다.
- 주요 기대 사항: 결과는 VRAM, 호스트 대역폭, PCIe 대역폭, 모델 형식에 크게 좌우됩니다.
FreeToken api란 무엇인가요?
FreeToken은 개인 하드웨어에서 대규모 오픈 웨이트 전문가 혼합 모델을 실행하도록 설계된 엣지 네이티브 서빙 시스템입니다. GPU만 사용 가능한 자원으로 취급하는 대신 GPU 메모리, CPU 메모리, CPU 실행, PCIe 인터커넥트를 하나의 추론 플랫폼으로 조율합니다.
이 시스템은 전체 전문가 풀이 사용 가능한 VRAM을 초과하지만 토큰당 희소 연산은 실용적인 수준으로 유지되는 모델을 대상으로 합니다. 예를 들어 DeepSeek-V4-Flash는 총 284B개의 파라미터와 13B개의 활성 파라미터를 보유한 것으로 설명되며, GLM-5.2는 총 753B개의 파라미터와 40B개의 활성 파라미터를 가진 것으로 소개됩니다. 각 토큰에서는 라우팅된 전문가 중 일부만 참여하지만, 전체 전문가 풀에는 여전히 접근할 수 있어야 합니다.
동영상 하이라이트:
- FreeToken은 대규모 MoE 모델을 위한 새로운 로컬 엔진으로 소개됩니다.
- 주요 비교 대상은 라우팅 인식 캐싱과 정적 배치 방식입니다.
- 보고된 결과에는 소비자용 GPU, 노트북, 워크스테이션급 GPU가 포함됩니다.
- 에이전트 워크로드에서는 꼬리 지연 시간이 가용성 문제로 다뤄집니다.
| 용어 | 의미 |
|---|---|
| MoE | 많은 전문가를 포함하면서 각 토큰을 소수의 전문가에게만 라우팅하는 모델 아키텍처 |
| 전문가 풀 | 라우팅된 전문가 가중치의 전체 집합 |
| 프리필 | 생성이 시작되기 전에 기존 프롬프트 또는 컨텍스트를 처리하는 과정 |
| 디코드 | 한 번에 한 단계씩 새로운 토큰을 생성하는 과정 |
| TTFT | 출력이 시작되기 전에 필요한 작업을 포함한 첫 토큰까지의 시간 |
| 엣지 서빙 | 데이터센터 클러스터가 아닌 개인 또는 소비자용 하드웨어에서 추론을 실행하는 방식 |
FreeToken을 모델이 아닌 서빙 런타임으로 생각하세요. 여전히 호환 가능한 모델 체크포인트, 지원되는 하드웨어, 충분한 호스트 메모리, 올바르게 준비된 런타임 형식이 필요합니다.
FreeToken은 MoE 메모리를 어떻게 처리하나요?
FreeToken은 모델을 GPU에 상주하는 부분과 호스트에 상주하는 전문가 풀로 분리합니다. 비전문가 가중치는 GPU에 남아 있고, CPU에 상주하는 풀은 라우팅된 전문가를 위한 기준 데이터 역할을 합니다. 사용 가능한 VRAM은 MoE 레이어 전체가 공유하는 탄력적인 전문가 캐시로 전환됩니다.
이 설계가 중요한 이유는 희소 연산이 메모리 압박을 없애 주지 않기 때문입니다. 하나의 토큰이 훨씬 더 큰 풀에서 단 6개의 전문가만 활성화할 수 있지만, 런타임은 라우터가 다음에 선택하는 전문가가 무엇이든 액세스할 준비가 되어 있어야 합니다.
공유 전문가 캐시
- 전역 LRU 상주 공간 사용
- 레이어-전문가 쌍 추적
- 토큰 수준의 변화하는 라우팅을 따름
적응형 캐시 미스 처리
- 일부 캐시 미스를 PCIe를 통해 전송
- 다른 캐시 미스는 CPU에서 직접 실행
- 측정된 대역폭을 사용해 작업을 균형 있게 분배
탄력적 메모리
- 안전한 지점에서 GPU 캐시 조정
- KV 캐시와 용량 공유
- 변화하는 VRAM 가용량에 대응
디코드 중에 FreeToken은 GPU에서 캐시 적중과 캐시 미스를 식별합니다. 적중한 항목은 VRAM에서 직접 실행됩니다. 캐시 미스는 측정된 호스트 측 대역폭과 PCIe 대역폭에 따라 GPU 캐시 채우기와 CPU 실행으로 나뉩니다. 이를 통해 런타임이 모든 시스템에 하나의 고정된 전략만 적용하는 것을 방지합니다.
| 런타임 구성 요소 | 주요 위치 | 주요 책임 |
|---|---|---|
| 비전문가 가중치 | GPU 메모리 | 일반적인 모델 실행에 사용할 수 있도록 유지 |
| 전체 전문가 풀 | 호스트 메모리 | 라우팅된 전문가를 위한 원본 가중치 제공 |
| 전문가 캐시 | 남은 GPU 메모리 | 최근 사용된 레이어-전문가 쌍 유지 |
| KV 캐시 | GPU 메모리 예산 | 활성 컨텍스트의 어텐션 상태 저장 |
| 라우팅 메타데이터 | GPU 및 런타임 버퍼 | 선택된 전문가와 캐시 상태 식별 |
중요한 변화는 단순히 더 많은 가중치를 CPU와 GPU 사이에서 이동시키는 데 있지 않습니다. FreeToken은 누락된 전문가를 전송 가능한 데이터 또는 실행 가능한 작업으로 취급한 다음, 배포된 시스템에 맞춰 두 경로 중 하나를 선택합니다.
FreeToken api 설정 워크플로
신뢰할 수 있는 설정은 성능 기대치보다 호환성 확인에서 시작됩니다. 공개 자료에서는 CUDA 및 NVIDIA 기반 Linux 환경을 주요 지원 대상으로 제시하고 있으며, 2026년 공개 출시 시기에도 더 폭넓은 Windows, macOS 및 구형 GPU 지원 요청이 계속 확인되었습니다.
모든 모델이나 운영체제가 지원된다고 가정하지 말고, 다음 워크플로를 사용해 로컬 배포를 준비하세요.
하드웨어 프로필 확인
GPU 메모리, 호스트 메모리, PCIe 링크 폭, CPU 메모리 대역폭, 운영체제를 기록하세요. 이러한 값은 전문가 캐시를 VRAM에 얼마나 많이 유지할 수 있는지와 캐시 미스를 얼마나 효율적으로 처리할 수 있는지에 영향을 줍니다.
호환 가능한 모델 선택
Qwen3.6-35B-A3B, DeepSeek-V4-Flash 또는 GLM-5.2 데모처럼 프로젝트의 공개 평가에 나열된 모델부터 시작하세요. 저장 공간을 준비하기 전에 필요한 정밀도와 체크포인트 레이아웃을 확인하세요.
런타임 형식 준비
FreeToken은 전문가 뱅크를 직접 로드하기에 적합한 레이아웃으로 정규화하는 FreeToken Weight 형식을 사용합니다. 준비된 형식을 사용하면 텐서를 반복해서 검색하고 재패킹하는 작업을 피하여 시작에 필요한 작업을 줄일 수 있습니다.
튜닝 전에 측정
런타임이 호스트 측 전문가 처리 성능과 페이지 고정 전송 대역폭을 프로파일링하도록 하세요. 이러한 측정값이 캐시 채우기와 직접적인 CPU 실행 사이의 균형을 결정합니다.
에이전트 워크로드 테스트
단순한 토큰 속도만 평가하지 마세요. 멀티턴 코딩, 추론 또는 도구 호출 워크플로를 사용하고 TTFT, 긴 멈춤, 캐시 동작, 완료 안정성을 모니터링하세요.
| 설정 확인 항목 | 중요한 이유 | 권장 조치 |
|---|---|---|
| NVIDIA CUDA 환경 | 고속 경로가 CUDA 호환 하드웨어를 중심으로 구성됨 | 모델을 준비하기 전에 드라이버와 CUDA 스택 확인 |
| 호스트 메모리 용량 | 전체 전문가 풀이 VRAM을 크게 초과할 수 있음 | 선택한 체크포인트에 충분한 메모리 확보 |
| PCIe 대역폭 | GPU 캐시 채우기가 호스트-디바이스 전송 속도에 의존함 | 가능한 경우 폭이 넓고 대역폭이 높은 링크 사용 |
| 모델 정밀도 | 형식에 따라 가중치 크기와 커널 호환성이 달라짐 | 체크포인트 정밀도를 지원되는 런타임 경로에 맞춤 |
| 동시 실행 애플리케이션 | 브라우저, 게임 및 데스크톱 작업이 VRAM 가용량을 변경할 수 있음 | 여유 공간을 남기고 실제 사용 환경에서 테스트 |
시스템에 접근하려면 프로젝트 문서와 릴리스 자료에서 공식 FreeToken 프로젝트 페이지를 안내합니다. 기술 설계는 FreeToken 연구 논문에 문서화되어 있습니다.
사전 점검 체크리스트:
- 지원되는 NVIDIA CUDA 환경 확인
- 호스트 메모리와 사용 가능한 GPU 메모리 확인
- 모델과 일치하는 정밀도 선택
- 필요한 FreeToken Weight 형식 준비 또는 확보
- 현실적인 멀티턴 워크로드 벤치마크 실행
모델 다운로드가 성공했다고 해서 런타임 호환성이 입증된 것으로 간주하지 마세요. 공개 지원 프로필은 NVIDIA CUDA와 POSIX Linux를 강조하며, Apple Silicon, 구형 NVIDIA 카드 및 더 폭넓은 플랫폼 지원에는 향후 프로젝트 변경이 필요할 수 있습니다.
성능 및 하드웨어 비교
FreeToken의 보고된 성능 향상은 대규모 MoE 모델, 제한된 VRAM, 반복적인 전문가 라우팅, 장시간 실행되는 에이전트 턴이 결합된 워크로드에서 가장 크게 나타납니다. 해당 평가는 여러 소비자용 시스템과 워크스테이션급 RTX PRO 6000에서 활발히 유지 관리되는 엣지 엔진들과 FreeToken을 비교합니다.
RTX 5090에서 공개된 결과는 Qwen3.6-35B의 경우 초당 77–83토큰, DeepSeek-V4-Flash의 경우 초당 22–25토큰을 보고합니다. 같은 평가에서 FreeToken의 최악의 턴 TTFT는 44초 미만으로 나타났으며, 하나 이상의 테스트 셀에서 기준 구현의 멈춤 시간은 llama.cpp 232초, Ollama 179초, KTransformers 946초에 달했습니다.
| 모델 또는 등급 | 하드웨어 예시 | FreeToken 결과 | 보고된 비교 |
|---|---|---|---|
| Qwen3.6-35B-A3B | RTX 5090 | 77–83 tok/s | 가장 강력한 기준 구현 대비 1.8–2.3배 |
| DeepSeek-V4-Flash | RTX 5090 | 22–25 tok/s | 가장 강력한 기준 구현 대비 1.5–1.9배 |
| Qwen3.6-35B-A3B | RTX 4060 노트북, 8 GB | 39.3 tok/s | 보고된 RTX 4090 속도의 약 92% |
| GLM-5.2 | RTX PRO 6000 Blackwell, 96 GB | 14.9 tok/s | llama.cpp의 7.3 tok/s 대비 약 2.0배 |
| Qwen3.6-35B-A3B | RTX 5090 데스크톱 | 선도적인 기준 비교 대상으로 언급됨 | 서버 설정 대비 호스트 대역폭으로 인해 결과가 약 4% 감소 |
캐시 정책은 보고된 라우팅 추적 재생에서도 상당한 차이를 만들었습니다. RTX 5090 서빙 용량에서 FreeToken의 전역 LRU는 Qwen3.6 전문가 읽기의 16%, DeepSeek-V4-Flash 읽기의 39%를 캐시 미스로 처리했습니다. 같은 모델 순서에서 비교 수치는 llama.cpp의 정적 분할이 각각 62%와 89%의 캐시 미스를 기록한 것으로 제시했습니다.
| 배치 전략 | 라우팅 인식 | 강점 | 주요 절충점 |
|---|---|---|---|
| FreeToken 전역 LRU | 토큰 수준에서 지속적으로 업데이트 | 현재 전문가 작업 집합 추적 | 동적 캐시 제어 필요 |
| llama.cpp 정적 분할 | 레이어 배치에 따라 고정 | 예측 가능하고 간단함 | 변화하는 라우팅 전문가를 놓칠 수 있음 |
| KTransformers 핫 배치 | 프리필 동작을 중심으로 업데이트 | 선택한 전문가를 GPU 또는 CPU에 유지 가능 | 모든 디코드 시점의 변화를 따라가지 못할 수 있음 |
| CPU 전용 전문가 경로 | GPU 캐시에 의존하지 않음 | 폭넓은 폴백 동작 | 호스트 메모리 대역폭에 제한됨 |
또한 평가에서는 전체 레이어 더블 버퍼링이 전문가 이동을 연산 뒤에 숨겨 프리필 처리량을 향상했다고 보고합니다. 인용된 Qwen3.6 테스트에서 두 번째 버퍼를 비활성화하면 4K 토큰에서 처리량이 19%, 8K에서 25%, 16K에서 26% 감소했습니다.
주요 처리량 수치는 프로젝트 자체 평가에서 나온 것입니다. 동일한 가중치와 여러 워크로드를 사용했지만, 제공된 자료만으로는 독립적인 제3자 벤치마크가 확립되지 않았습니다. 꼬리 지연 시간, 호환성, 반복 가능성도 peak tokens per second만큼 중요하게 고려하세요.
제한 사항, 최적의 사용 사례 및 FAQ
FreeToken은 최신 NVIDIA 하드웨어를 이미 보유하고 있고, 충분한 시스템 메모리를 갖추었으며, 코딩 또는 추론 에이전트를 통해 MoE 모델을 실행하는 사용자에게 가장 매력적입니다. 선택한 모델이 이미 VRAM에 여유 있게 들어가거나, 플랫폼에 필요한 CUDA 경로가 없거나, 워크로드가 짧은 단일 턴 요청인 경우에는 이점이 덜 분명합니다.
또한 이 시스템이 실질적인 의미에서 로컬 추론을 무료로 만들어 주는 것은 아닙니다. 하드웨어, 전력, 저장 공간, 냉각, 설정에 드는 시간은 여전히 의사 결정의 일부입니다. 대신 FreeToken의 가치는 개인정보 보호, 로컬 제어, 속도 제한에 대한 노출 감소, 호스팅 서비스에 의존하지 않고 모델을 계속 사용할 수 있다는 점과 연결됩니다.
| 사용자 프로필 | 적합성 | 이유 |
|---|---|---|
| 최신 NVIDIA 데스크톱 사용자 | 높음 | 캐시와 PCIe 경로를 효과적으로 사용할 가능성이 가장 높음 |
| 8 GB NVIDIA 노트북 사용자 | 조건부 | 보고된 노트북 결과는 유망하지만 발열 및 메모리 제한이 여전히 중요함 |
| Apple Silicon 사용자 | 제공된 2026년 지원 프로필에서는 제한적 | 공개된 Mac 고속 경로가 확인되지 않음 |
| 구형 NVIDIA GPU 사용자 | 불확실 | 구형 하드웨어 지원은 미해결 요청으로 등록됨 |
| 짧은 단일 턴 사용자 | 보통 | 긴 컨텍스트와 에이전트 워크로드에서 FreeToken의 장점이 더 잘 드러남 |
| 대규모 MoE 모델을 사용하는 코딩 에이전트 사용자 | 높음 | 꼬리 지연 시간과 반복적인 라우팅이 핵심 해결 대상 문제임 |
Q: FreeToken api는 어떤 용도로 사용되나요?
GPU 메모리, 호스트 메모리, CPU 실행 및 PCIe 전송을 조율하여 개인 하드웨어에서 대규모 오픈 웨이트 전문가 혼합 모델을 서빙하는 데 사용됩니다.
Q: FreeToken을 사용하려면 특정 모델이 필요한가요?
런타임은 모델에 따라 달라집니다. 제공된 평가에서는 Qwen3.6-35B-A3B, DeepSeek-V4-Flash 및 GLM-5.2를 언급하지만, 각 모델에는 여전히 호환 가능한 정밀도와 준비된 런타임 레이아웃이 필요합니다.
Q: FreeToken이 모든 사용자에게 llama.cpp보다 더 나은가요?
아닙니다. FreeToken은 대규모 MoE 워크로드를 실행하는 최신 NVIDIA 시스템을 대상으로 합니다. 플랫폼 지원 범위와 기존 하드웨어 호환성이 우선이라면 llama.cpp가 여전히 더 폭넓게 검증된 선택지입니다.
Q: FreeToken은 왜 CPU 실행과 GPU 캐싱을 모두 사용하나요?
캐시 미스가 발생한 전문가는 GPU로 전송하거나 현재 상주한 위치에서 실행할 수 있습니다. FreeToken은 하나의 고정 정책에 의존하지 않고 측정된 대역폭을 사용해 두 경로 사이에 캐시 미스를 분배합니다.
워크로드가 대규모 MoE 전문가 풀과 장시간 에이전트 턴으로 인해 제한될 때 FreeToken을 사용하세요. 일반적인 로컬 추론에서는 초당 최대 토큰 수에만 의존하기보다 플랫폼 지원, 모델 사용 가능 여부, 설정에 필요한 노력, 꼬리 지연 시간을 먼저 비교하세요.