- FreeToken API 서버는 GPU, CPU, 메모리, PCIe 리소스를 활용한 로컬 MoE 추론을 목표로 합니다.
- 가장 적합한 환경: 최신 NVIDIA 하드웨어, 넉넉한 시스템 메모리, 지속적인 mixture-of-experts 워크로드.
- 핵심 장점: 공유 LRU 전문가 캐시가 정적 배치에만 의존하지 않고 토큰 라우팅을 따라갑니다.
- 런타임 방식: 캐시에 없는 전문가는 GPU로 전송하거나 CPU에서 직접 실행할 수 있습니다.
- 주요 제한 사항: 2026년 릴리스는 초기 단계이므로 현재 플랫폼 지원 여부를 확인해야 합니다.
FreeToken API 서버 개요
FreeToken은 대규모 오픈 웨이트 mixture-of-experts 모델을 위한 엣지 네이티브 서빙 시스템입니다. 게임이나 엔터테인먼트 플랫폼이 아니며, 호환되는 애플리케이션과 에이전트 프레임워크에서 사용할 수 있도록 서빙 런타임을 통해 로컬 모델 추론을 제공하는 것이 목적입니다.
이 시스템은 2단계 메모리 계층 구조를 중심으로 설계되었습니다. 전체 전문가 풀이 호스트 메모리에 유지되는 동안 GPU에는 비전문가 가중치와 라우팅된 전문가를 위한 가변 캐시가 저장됩니다. 이를 통해 사용 가능한 VRAM보다 큰 모델도 모든 전문가를 그래픽 카드에 영구적으로 배치하지 않고 실행할 수 있습니다.
동영상 주요 내용:
- FreeToken은 최첨단 규모의 MoE 모델을 위한 로컬 추론에 집중합니다.
- 핵심 과제는 캐시에 없는 전문가를 효율적으로 이동하거나 실행하는 것입니다.
- 공개된 결과에는 소비자용 GPU, 노트북, 워크스테이션급 하드웨어가 포함됩니다.
- 단순한 최고 처리량 수치보다 하드웨어 호환성이 더 중요합니다.
| 구성 요소 | FreeToken에서의 역할 | 실질적인 의미 |
|---|---|---|
| GPU 메모리 | 전문가 캐시 및 비전문가 가중치 | 자주 라우팅되는 전문가를 실행 위치 가까이에 유지 |
| 호스트 메모리 | 전체 전문가 풀 | VRAM에 모두 들어가지 않는 가중치 저장 |
| PCIe 링크 | 전문가 전송 경로 | 선택된 캐시 미스 전문가를 GPU 캐시로 이동 |
| CPU | 전문가 직접 실행 | GPU 전송 없이 일부 캐시 미스 처리 |
| API 계층 | 애플리케이션용 서빙 인터페이스 | 호환 클라이언트가 추론 요청을 전송할 수 있도록 지원 |
FreeToken을 이해하는 유용한 방법은 모델 용량과 활성 계산량을 구분하는 것입니다. MoE 모델에는 수천억 개의 전체 파라미터가 포함될 수 있지만, 각 토큰은 그중 소수의 전문가만 활성화합니다. 참고 논문에서는 DeepSeek-V4-Flash가 각 레이어에서 256개의 라우팅 전문가 중 6개를 활성화하며, 2840억 개의 전체 파라미터 중 약 130억 개의 활성 파라미터를 사용한다고 설명합니다.
이러한 희소성 덕분에 로컬 서빙이 가능해지지만 메모리 문제 자체가 사라지는 것은 아닙니다. 라우터가 토큰마다 서로 다른 전문가를 선택할 수 있으므로 모든 전문가에 접근할 수 있어야 합니다. 따라서 FreeToken은 캐시 정책과 대역폭 스케줄링을 API 서버 설계의 핵심 요소로 취급합니다.
FreeToken을 단순한 모델 실행기가 아니라 하드웨어를 인식하는 추론 서비스로 생각하세요. GPU 용량, 호스트 메모리 대역폭, PCIe 연결, 동시에 실행되는 데스크톱 작업이 모두 최종 결과에 영향을 줍니다.
하드웨어 및 호환성 확인
FreeToken API 서버를 구성하기 전에 시스템이 런타임의 의도된 배포 환경에 부합하는지 확인하세요. 공개 자료에서는 CUDA 중심의 베타 환경을 설명하고 있으며, 최신 NVIDIA GPU와 전체 전문가 풀을 수용할 수 있는 충분한 호스트 메모리에서 가장 좋은 결과가 나타납니다.
가장 중요한 확인 사항은 다음과 같습니다.
- NVIDIA GPU 사용 가능 여부 및 적절한 CUDA 지원.
- 선택한 모델의 전체 전문가 풀을 수용할 수 있는 충분한 시스템 메모리.
- 전문가 가중치를 효율적으로 이동할 수 있는 PCIe 연결.
- CPU 측 전문가 실행을 지속할 수 있는 호스트 메모리 대역폭.
- 모델 파일을 위한 충분한 저장 공간과 읽기 속도.
- 비전문가 가중치와 런타임 캐시를 모두 수용할 수 있는 충분한 여유 VRAM.
| 하드웨어 요소 | 중요한 이유 | 제한될 때의 위험 |
|---|---|---|
| VRAM | 캐시 크기와 상주 가중치를 결정 | 라우팅 미스 증가 및 디코딩 속도 저하 |
| 시스템 RAM | 전체 전문가 풀을 보유 | 모델이 로드되지 않거나 더 느린 폴백 동작에 의존할 수 있음 |
| PCIe 대역폭 | GPU 캐시 채우기 속도를 제어 | 전송이 주요 지연 시간 병목이 됨 |
| CPU 메모리 대역폭 | CPU에서 전문가를 직접 실행하도록 지원 | CPU 캐시 미스 처리 시간이 증가 |
| NVMe 저장 장치 | 시작 및 모델 준비 시간에 영향 | 대형 모델 실행에 더 오래 걸림 |
| 동시 실행 애플리케이션 | 사용 가능한 VRAM과 CPU 용량을 변경 | 세션 중 성능이 변동할 수 있음 |
논문의 평가에는 RTX 4060 노트북, RTX 3090 및 RTX 4090 시스템, RTX 5090 하드웨어, RTX PRO 6000 워크스테이션이 포함됩니다. 이러한 결과는 모든 구성에 대한 보장이 아니라 참고 기준으로 봐야 합니다.
예를 들어 8GB RTX 4060 노트북에서 보고된 초당 39.3토큰 결과는 NVFP4 빌드와 특정 모델 구성에서 측정된 것입니다. 모델 형식, 드라이버, 메모리 배치 또는 워크로드가 다르면 결과도 달라질 수 있습니다.
API 서버는 동적인 메모리 압력도 고려해야 합니다. FreeToken 실행 중에는 브라우저, 데스크톱 컴포지터, 게임 및 기타 애플리케이션이 VRAM을 사용할 수 있습니다. FreeToken의 가변 메모리 방식은 사용 가능한 예산이 바뀔 때마다 엔진을 완전히 재시작하는 대신, 스케줄러가 안전한 지점에서 전문가 캐시 크기를 조정하도록 설계되었습니다.
권장 프로필
- 최신 NVIDIA GPU
- 우수한 PCIe 연결
- 넉넉한 호스트 메모리
- 장시간 실행되는 MoE 워크로드
주의해서 사용 가능한 환경
- 제한된 VRAM
- 노트북 PCIe x8 링크
- 공유 시스템 리소스
- 낮은 CPU 대역폭
배포 전 확인 사항
- 운영체제 지원
- CUDA 환경
- 모델 형식
- 호스트 메모리 요구 사항
다른 로컬 추론 엔진이 지원하는 모든 플랫폼을 FreeToken도 지원한다고 가정하지 마세요. 2026년 공개 분류 자료에서는 베타 단계의 CUDA 중심 POSIX 지향 환경으로 소개하고 있으므로, Windows, macOS 또는 NVIDIA가 아닌 하드웨어를 선택하기 전에 현재 릴리스 문서를 확인하세요.
FreeToken API 서버 설정 가이드
안정적인 설정은 처리량 튜닝이 아니라 모델과 메모리 계획에서 시작합니다. 아래 순서를 따르면 실행 실패를 줄이고 이후 비교를 더 의미 있게 진행할 수 있습니다.
지원되는 모델 선택
사용 가능한 호스트 메모리, GPU 메모리 및 지원되는 가중치 표현 형식에 맞는 MoE 체크포인트를 선택하세요. 참고 평가에서는 하드웨어 등급에 따라 DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2를 사용합니다. 서버를 준비하기 전에 모델 형식과 필요한 정밀도를 확인하세요.
호스트 메모리 풀 준비
전체 라우팅 전문가 풀을 수용할 수 있도록 충분한 시스템 메모리를 확보하세요. FreeToken은 호스트 메모리를 기준 데이터로 취급하고 GPU에는 작업 캐시를 유지합니다. 최초 로드 중에는 메모리를 많이 사용하는 애플리케이션과 함께 서비스를 실행하지 않는 것이 좋습니다.
CUDA 및 전송 경로 검증
GPU, CUDA 환경, 드라이버 호환성 및 PCIe 경로를 확인하세요. 런타임의 대역폭 적응형 정책은 측정된 호스트-디바이스 전송 대역폭과 CPU 측 전문가 처리 대역폭에 따라 작동합니다.
런타임 가중치 레이아웃 준비
지원되는 경우 FreeToken Weight 형식을 사용하여 전문가 뱅크가 런타임 레이아웃에 맞게 미리 배치되도록 하세요. 이렇게 하면 실행 중 텐서 탐색과 재패킹을 피할 수 있어 대형 체크포인트의 부트스트랩 작업을 줄일 수 있습니다.
호환 클라이언트 연결
소규모 테스트 요청에 모델이 올바르게 응답한 후에만 서빙 엔드포인트를 공개하세요. 그런 다음 현재 릴리스에 문서화된 API 프로토콜을 사용할 수 있는 에이전트나 애플리케이션을 연결하고, 단일 프롬프트와 별도로 다중 턴 동작을 테스트하세요.
FreeToken의 주요 장점은 지속적인 서빙 환경에서 나타나므로 설정 순서가 중요합니다. 짧은 프롬프트에서는 프리픽스 재사용, 시맨틱 체크포인트 또는 적응형 전문가 캐시의 가치가 드러나지 않을 수 있습니다. 다중 턴 에이전트 워크로드는 컨텍스트를 반복적으로 수정하고 변화하는 전문가 조합을 통해 토큰을 라우팅하므로 설계 목표를 더 잘 반영합니다.
| 설정 단계 | 성공 확인 | 권장 조치 |
|---|---|---|
| 모델 선택 | 모델이 호스트 메모리 예산에 부합 | 전체 전문가 풀 크기 확인 |
| 런타임 준비 | 가중치가 지원 레이아웃과 일치 | 문서화된 FTW 워크플로 우선 사용 |
| 하드웨어 검증 | CUDA 및 대역폭 확인 통과 | GPU, PCIe, RAM, CPU 세부 정보 기록 |
| 첫 번째 요청 | 서버가 유효한 응답 반환 | 작고 통제된 프롬프트로 시작 |
| 클라이언트 통합 | 턴이 바뀌어도 요청이 안정적 | 사용량을 늘리기 전에 대상 API 클라이언트 테스트 |
첫 번째 응답이 성공했다고 해서 기본 기능이 작동한다는 뜻일 뿐, 프로덕션 준비가 완료된 것은 아닙니다. API 서버를 평가하기 전에 반복 턴, 긴 컨텍스트, 동시에 실행되는 데스크톱 작업을 테스트하세요.
캐싱, 라우팅 및 성능 팁
FreeToken의 가장 독특한 메커니즘은 공유 LRU 전문가 캐시입니다. 디코딩 중 라우터는 다음 토큰에 필요한 전문가를 식별하고 어떤 전문가가 이미 상주하는지 확인합니다. 캐시 적중은 GPU에서 실행됩니다. 캐시 미스는 측정된 대역폭에 따라 GPU 캐시 채우기와 CPU 직접 실행으로 나뉩니다.
이는 고정 레이어 분할 방식과 다릅니다. 정적 배치 정책은 토큰별 라우팅 변화가 알려지기 전에 전문가가 어디에 상주할지 결정합니다. 반면 FreeToken은 최근 라우팅 동작에 따라 캐시 상주 상태를 변경합니다. 인용된 재생 결과에 따르면 동일한 캐시 용량에서 미스율이 더 낮았으며, 특히 워크로드가 단거리 전문가 지역성을 보일 때 그 차이가 두드러졌습니다.
| 런타임 동작 | FreeToken 방식 | 예상 효과 |
|---|---|---|
| 전문가 캐시 적중 | GPU 캐시에서 실행 | 가장 낮은 이동 비용 |
| 채우기 대상으로 선택된 전문가 캐시 미스 | 전송, 실행, 유지 | 향후 지역성 향상 |
| CPU 실행 대상으로 선택된 전문가 캐시 미스 | 호스트 메모리에서 실행 | 그렇지 않으면 유휴 상태일 대역폭 활용 |
| 컨텍스트 수정 | 시맨틱 체크포인트 재사용 | 반복적인 프리필 작업 감소 |
| VRAM 압박 | 안전한 지점에서 캐시 크기 조정 | 전체 재시작 없이 서비스 가용성 유지 |
q-star 정책은 PCIe를 통해 가져와야 하는 캐시 미스 수와 CPU에서 실행해야 하는 캐시 미스 수를 추정합니다. 이 분할은 고정된 전송 대역폭과 호스트 측 전문가 처리 대역폭 사이의 측정된 관계를 기반으로 합니다. GPU가 비슷하더라도 듀얼 채널 DDR5를 사용하는 데스크톱과 LPDDR5를 사용하는 노트북은 최적의 동작이 크게 다를 수 있으므로 이는 중요합니다.
튜닝할 때는 평균 디코딩 속도만이 아니라 꼬리 지연 시간도 우선적으로 고려하세요. 평가 결과에 따르면 테스트된 모든 셀에서 FreeToken의 최악 턴 TTFT는 44초 미만이었지만, 일부 기준선은 150초를 넘었습니다. 실제 에이전트 통합에서는 평균 초당 토큰 수가 경쟁력 있어 보여도 긴 지연으로 인해 클라이언트 시간 초과나 유휴 감시가 발생할 수 있습니다.
다음과 같은 실용적인 규칙을 따르세요.
- 호스트 시스템에서 불필요한 메모리 압박을 줄이세요.
- 엔진 간에 동일한 모델 가중치와 정밀도를 비교하세요.
- 단일 프롬프트만이 아니라 다중 턴 작업을 측정하세요.
- 첫 토큰 지연 시간과 최악 턴 지연 시간을 추적하세요.
- 캐시 크기, 컨텍스트 길이 및 CPU 스레드 제한을 기록하세요.
- 다른 애플리케이션이 VRAM을 사용한 후 테스트를 반복하세요.
공식 FreeToken 연구 논문에서는 시맨틱 인식 캐싱, 파이프라인 프리필, 가변 메모리 관리 및 대역폭 적응형 실행에 대한 기술적 설명을 제공합니다. 릴리스 동작이 초기 요약과 다를 때는 이 논문을 참고 자료로 사용하세요.
동일한 조건의 측정값을 사용하세요. 디코딩 처리량, 엔드투엔드 응답 시간, 첫 토큰까지의 시간, 꼬리 지연 시간은 API 서버 사용 경험의 서로 다른 부분을 설명합니다.
제한 사항 및 준비 상태 체크리스트
FreeToken은 특정 배포 프로필에 적합한 유망한 솔루션이지만, 모든 로컬 추론 사용자에게 자동으로 최선의 선택이 되는 것은 아닙니다. 충분한 RAM을 갖춘 최신 NVIDIA 시스템, MoE 워크로드, 장시간 추론을 로컬에서 유지해야 할 이유가 있는 환경에 가장 적합합니다.
초기 공개 단계라는 점도 중요합니다. 제공된 2026년 자료에서 이 프로젝트의 공개 이력은 아직 짧으며, 더 폭넓은 도입을 위해서는 하드웨어 지원 확대, 추가 운영체제 지원, 듀얼 GPU 워크플로, 일반적인 모델 형식 지원 등 여러 실용적인 요구 사항이 남아 있습니다.
API를 공개하기 전에:
- 선택한 모델과 정밀도가 지원되는지 확인
- 호스트 메모리가 전체 전문가 풀을 보유할 수 있는지 검증
- CUDA, 드라이버, PCIe 및 저장 장치 호환성 확인
- 다중 턴 지연 시간과 시간 초과 동작 측정
- 공유 네트워크에서 서비스를 제공할 때 엔드포인트 접근 제한
| 사용 사례 | 적합성 | 이유 |
|---|---|---|
| 로컬 코딩 에이전트 | 높음 | 반복 턴과 로컬 데이터의 이점을 활용 |
| 단일 짧은 프롬프트 | 보통 | 캐시 및 프리픽스 재사용 기회가 적음 |
| 최신 NVIDIA 워크스테이션 | 높음 | 평가된 배포 방향과 일치 |
| macOS 또는 Apple Silicon | 불확실 | 설정 전에 현재 지원 여부 확인 |
| 비-MoE 밀집 모델 | 이점 제한적 | 핵심 메커니즘이 라우팅 전문가를 대상으로 함 |
| 퍼블릭 인터넷 엔드포인트 | 강화된 보안 필요 | 인증 및 네트워크 제어가 필수 |
로컬 서빙은 호스팅 서비스의 속도 제한에 대한 의존도를 줄이고 프롬프트를 사용자의 컴퓨터에 보관할 수 있게 해주지만, 운영 책임은 사용자에게 넘어옵니다. API 자격 증명을 보호하고 서비스를 의도한 주소에만 바인딩하며, 인증되지 않은 엔드포인트를 공유 네트워크에 노출하지 마세요.
로컬 모델 서버도 여전히 네트워크 서비스입니다. 다른 시스템의 연결을 허용하기 전에 인증, 제한된 바인드 주소, 방화벽 규칙 및 접근 로그를 사용하세요.
FreeToken API 서버 FAQ
Q: FreeToken API 서버는 무엇을 위해 설계되었나요?
대규모 mixture-of-experts 모델을 위한 로컬 추론 서빙 시스템입니다. GPU 메모리, 호스트 메모리, CPU 실행 및 PCIe 전송을 조정하여 사용 가능한 VRAM보다 큰 모델도 적합한 개인용 하드웨어에서 서빙할 수 있도록 합니다.
Q: FreeToken을 사용하려면 고급 GPU가 필요한가요?
평가된 구성은 8GB RTX 4060 노트북부터 RTX PRO 6000 워크스테이션까지 다양한 NVIDIA GPU에 초점을 맞춥니다. 정확한 요구 사항은 모델, 정밀도, 호스트 메모리 용량 및 허용 가능한 지연 시간에 따라 달라집니다.
Q: FreeToken은 왜 전문가 캐시를 사용하나요?
MoE 라우팅은 토큰마다 변경되므로 고정된 전문가 배치에서는 자주 선택되는 전문가가 캐시에 없을 수 있습니다. FreeToken은 공유 LRU 캐시를 사용해 최근 라우팅 지역성을 따르고, 남은 캐시 미스에 대해서는 캐시 채우기와 CPU 직접 실행을 결합합니다.
Q: FreeToken은 모든 운영체제에서 사용할 수 있나요?
모든 운영체제를 보편적으로 지원한다고 가정해서는 안 됩니다. 2026년 자료에서는 베타 단계의 CUDA 중심 환경으로 설명하고 있습니다. 배포 전에 현재 릴리스 문서에서 운영체제, GPU, 모델 형식 및 클라이언트 API 지원 여부를 확인하세요.
로컬 MoE 서빙, 다중 턴 워크로드 및 최신 NVIDIA 하드웨어가 모두 필요한 환경이라면 FreeToken을 선택하세요. 그렇지 않다면 동일한 모델과 지연 시간 지표를 사용해 지원되는 대안을 비교하세요.