FreeToken 290b 모델: 2026 엣지 MoE 설정 가이드 - 벤치마크

FreeToken 290b 모델: 2026 엣지 MoE 설정 가이드

적응형 캐싱, 대역폭 스케줄링, 탄력적 메모리를 통해 FreeToken이 소비자용 하드웨어에서 프런티어급 MoE 모델을 서비스하는 방법을 알아보세요.

2026-08-25
FreeToken 위키 팀
빠른 가이드
  • FreeToken 290b 모델: 프런티어급 희소 모델을 엣지에서 서비스하는 접근 방식을 이해합니다.
  • 핵심 설계: GPU 전문가 캐싱, CPU 실행, PCIe 전송을 결합합니다.
  • 최적의 설정: 런타임을 조정하기 전에 호스트 및 PCIe 대역폭을 측정합니다.
  • 주요 장점: 디코드 캐시 미스를 줄이고 프리필 전송을 연산 뒤에 숨깁니다.
  • 하드웨어 범위: 8GB 노트북 GPU부터 워크스테이션급 하드웨어까지 지원합니다.

FreeToken 290b 모델: 시스템의 역할

FreeToken은 대규모 Mixture-of-Experts 모델을 위한 엣지 네이티브 서빙 시스템입니다. FreeToken 290b 모델이라는 검색어는 일반적으로 논문에서 다루는 프런티어급 서빙 맥락을 가리키지만, 문서화된 시연은 총 284B개의 파라미터와 토큰당 약 13B개의 활성 파라미터를 가진 DeepSeek-V4-Flash를 사용합니다. 중요한 차이점은 희소 활성화가 연산량을 줄여 주지만, 전체 전문가 풀을 유지하려면 여전히 상당한 호스트 메모리와 저장 공간이 필요하다는 점입니다.

전체 모델을 GPU 메모리에 넣어야 하는 대신, FreeToken은 GPU, CPU, 호스트 메모리, PCIe 인터커넥트를 하나의 추론 플랫폼으로 취급합니다. 비전문가 가중치는 GPU에 유지하고, 라우팅된 전체 전문가 풀은 호스트 메모리에 둡니다. 동적 GPU 캐시는 현재 워크로드에 가장 유용한 전문가-레이어 쌍을 저장합니다.

이 시스템은 긴 컨텍스트와 반복적인 도구 호출로 프리필과 디코드 모두에 부담이 발생하는 에이전트 세션을 대상으로 합니다. 설계는 다음 세 가지 반복적인 문제를 해결합니다.

  • 프리필 전송 비용: 대규모 전문가 풀이 CPU-GPU 링크를 통해 이동해야 합니다.
  • 디코드 캐시 미스: 각 토큰이 현재 상주하지 않는 전문가를 요청할 수 있습니다.
  • 변화하는 리소스: 브라우저, 게임, 데스크톱 애플리케이션, 증가하는 KV 캐시가 사용 가능한 VRAM을 줄일 수 있습니다.

연구 논문 “FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution”은 2026년 8월 24일에 공개된 아키텍처, 구현, 평가 결과를 설명합니다.

희소 연산

MoE 라우팅은 각 토큰에 대해 소수의 전문가 하위 집합만 활성화하므로, 프런티어급 연산을 로컬 하드웨어에서 더욱 실용적으로 수행할 수 있습니다.

탄력적 캐시

공유 LRU 캐시는 최근에 라우팅된 전문가를 추적하며, 사용 가능한 GPU 메모리 예산이 변하면 크기를 조정할 수 있습니다.

하이브리드 실행

측정된 대역폭에 따라 캐시 미스를 GPU로 전송하거나 CPU에서 직접 실행할 수 있습니다.

핵심 개념

전체 파라미터 수는 토큰당 활성 연산량과 같지 않습니다. FreeToken은 전체 전문가 풀의 더 큰 메모리 사용량을 관리하면서 희소 연산을 활용할 수 있도록 합니다.

FreeToken의 프리필 및 디코드 처리 방식

FreeToken은 프리필과 디코드의 병목 지점이 서로 다르기 때문에 추론을 두 단계로 나눕니다. 프리필은 프롬프트를 처리하고 첫 토큰 생성 시간에 영향을 주는 반면, 디코드는 한 번에 하나의 토큰을 생성하므로 전문가 지역성과 대역폭 균형에 더 민감합니다.

프리필 중 시스템은 전체 레이어 더블 버퍼링을 사용합니다. GPU가 한 레이어를 계산하는 동안 다음 레이어의 전문가 가중치는 PCIe를 통해 두 번째 버퍼로 스트리밍됩니다. 모든 전문가 이동이 끝날 때까지 기다리는 대신 전송과 연산을 겹쳐 처리합니다.

에이전트 워크로드에서는 대화 기록도 자주 수정됩니다. 사고 블록, 도구 호출, 도구 출력, 대화 턴은 요청 사이에 삭제되거나 교체될 수 있습니다. FreeToken은 이러한 의미적 경계에 반복 상태 체크포인트를 배치하여 남아 있는 접두사를 재사용할 수 있도록 합니다. 변경된 접미사만 다시 처리하면 됩니다.

디코드 중에는 라우팅된 전문가가 공유 GPU 캐시에 있는지 확인합니다. 캐시 적중은 GPU에서 직접 실행됩니다. 캐시 미스는 대역폭을 기반으로 계산된 비율에 따라 GPU 캐시 채우기와 CPU 실행으로 나뉩니다.

추론 단계주요 부담FreeToken의 대응실제 결과
프리필전문가 전송 및 프롬프트 재계산전체 레이어 더블 버퍼링 및 의미적 체크포인트전송 노출 감소 및 반복 작업 감소
디코드전문가 미스 및 제한된 호스트 대역폭LRU 캐싱과 CPU-GPU 미스 분할토큰당 실행의 균형 개선
멀티턴 에이전트 사용도구 또는 추론 이후의 컨텍스트 수정의미적 앵커에서 접두사 재사용보존된 기록의 재프리필 시간 단축
런타임 변경변동하는 VRAM 및 KV 캐시 수요탄력적인 전문가 캐시 크기 조정모든 메모리 조정마다 엔진을 재시작할 필요 없음

미스 정책은 측정된 두 값을 사용합니다.

  • Bₚ: 고정된 호스트-디바이스 전문가 전송 대역폭
  • Bₕ: CPU 전문가 커널에 사용할 수 있는 유효 호스트 측 대역폭

m개의 누락된 전문가가 있는 단계에서, 근사 캐시 채우기 수는 다음과 같습니다.

q* ≈ m × Bₚ / Bₕ

PCIe 비중이 높을수록 더 많은 GPU 캐시 채우기가 유리합니다. CPU 경로가 강할수록 더 많은 미스를 CPU에서 직접 실행할 수 있습니다. 이는 고정된 하드웨어 등급표가 아니라 런타임 정책입니다.

사양만 보고 조정하지 마세요

최적의 CPU-GPU 분할은 측정된 대역폭, 메모리 레이아웃, CPU 동작, 실제 배포된 PCIe 링크에 따라 달라집니다. 하드웨어 사양표는 계획 수립에 유용하지만, FreeToken의 정책은 런타임 측정값을 기반으로 해야 합니다.

FreeToken 290b 모델 하드웨어 및 성능 가이드

문서화된 평가는 여러 소비자용 및 워크스테이션 구성에서 수행되었습니다. 결과는 모델, 양자화 방식, 호스트 메모리, PCIe 세대, 워크로드에 따라 달라지므로 아래 수치는 보편적으로 보장되는 값이 아니라 보고된 참고 지점으로 보아야 합니다.

이 시스템은 Qwen3.6-35B-A3B, DeepSeek-V4-Flash, 그리고 워크스테이션급 GLM-5.2 시연을 지원합니다. 가장 큰 예시는 96GB 메모리를 탑재한 단일 RTX PRO 6000 Blackwell에서 753B 파라미터 MoE 모델을 사용하는 구성입니다.

모델 또는 등급전체 파라미터활성 파라미터보고된 배포 환경
Qwen3.6-35B-A3B35B3B급노트북 하드웨어를 포함한 소비자용 GPU
DeepSeek-V4-Flash284B13BRTX 3090, 4090, 5090급 시스템
GLM-5.2753B40BRTX PRO 6000 Blackwell, 96GB
FreeToken 논문 범위20개 이상의 MoE 모델모델에 따라 다름8GB 노트북 GPU부터 워크스테이션 GPU까지

RTX 5090에서 논문은 테스트한 워크로드 전반에서 Qwen3.6이 초당 약 7783토큰, DeepSeek-V4-Flash가 초당 2225토큰을 기록했다고 보고합니다. 보고된 결과는 모델과 시나리오에 따라 가장 강력한 베이스라인보다 1.5배에서 2.3배 높았습니다.

하드웨어를 달리한 Qwen3.6 코딩 워크로드에서 FreeToken은 가장 강력한 베이스라인보다 다음과 같은 성능 우위를 보였습니다.

하드웨어 구성보고된 성능 우위
RTX 30901.3배
RTX 40901.3배
RTX 5090 서버1.9배
RTX 5090 데스크톱2.1배
RTX 4060 노트북1.8배
GLM-5.2가 탑재된 RTX PRO 6000llama.cpp 대비 2.0배

RTX 4060 노트북 사례가 주목할 만한 이유는 8GB 시스템이 NVFP4 빌드를 사용해 초당 39.3토큰에 도달했으며, 해당 비교에서 RTX 4090 속도의 92%로 보고되었기 때문입니다. 이 결과는 호스트 대역폭과 양자화가 GPU 모델명만큼이나 중요할 수 있음을 보여 줍니다.

성능 핵심

FreeToken의 가장 큰 성능 향상은 조정에서 비롯됩니다. 런타임이 PCIe 링크, CPU 대역폭, 캐시 용량, 모델 형식을 효율적으로 활용하면 더 작은 GPU도 경쟁력을 유지할 수 있습니다.

단계별 FreeToken 설정 워크플로

실용적인 배포는 캐시 크기를 추측하는 것보다 메모리 계층 구조를 먼저 파악하는 것에서 시작해야 합니다. 호스트에 상주하는 전문가 풀은 여전히 기준 데이터이므로, GPU 캐시 용량은 모델의 정확성이 아니라 속도와 지연 시간에 영향을 줍니다.

1

모델 및 전문가 형식 확인

모델의 전체 파라미터, 활성 파라미터, 정밀도, 전문가 수, 체크포인트 레이아웃을 확인합니다. FreeToken의 FTW 형식은 전문가 뱅크를 런타임에 적합한 레이어-전문가 구조로 정규화하며, 시작 시 텐서 탐색과 재패킹을 피할 수 있습니다.

2

호스트 및 PCIe 대역폭 측정

대상 머신에서 고정된 전문가 전송 대역폭과 유효 CPU 전문가 처리 대역폭을 프로파일링합니다. 광고된 대역폭에만 의존하지 말고, 이 값을 사용해 각 디코드 미스에서 캐시 채우기가 차지하는 비율을 추정합니다.

3

메모리 예산 확보

남은 공간을 전문가 슬롯에 할당하기 전에 비전문가 가중치, 활성화, KV 캐시를 위한 GPU 메모리를 먼저 할당합니다. 긴 에이전트 세션에서는 KV 캐시 수요가 증가하므로 캐시를 탄력적으로 유지합니다.

4

호스트 전문가 풀 준비

전문가를 최종 호스트 레이아웃에 직접 로드한 다음, 플랫폼이 지원하는 경우 사용 중인 메모리를 DMA용으로 고정합니다. 이렇게 하면 불필요한 페이지 폴트를 방지하고 시작 오버헤드를 줄일 수 있습니다.

5

실제 워크로드로 워밍업

대표적인 프롬프트, 도구 호출, 멀티턴 세션으로 시작합니다. 공유 LRU 캐시가 활성 라우팅 패턴을 학습하도록 한 뒤 디코드 속도, 첫 토큰 생성 시간, 미스율, 꼬리 지연 시간을 평가합니다.

설정 확인 항목권장 조치중요한 이유
GPU 메모리KV 캐시와 전문가 슬롯 사이에 공간 분배컨텍스트 증가에 따라 적절한 균형이 달라짐
호스트 메모리전체 전문가 풀을 사용 가능한 상태로 유지호스트 저장 공간이 정확성의 기준으로 남음
PCIe 경로지원되는 경우 고정 메모리 사용DMA 전송이 캐시 채우기 속도를 결정함
CPU 실행GPU의 NUMA 노드 근처에 워커 고정불필요한 메모리 접근 페널티 방지
시작 형식사전 패킹된 FTW 스타일 레이아웃 사용탐색 및 재패킹 작업 감소
배포 조언

콜드 캐시 테스트와 멀티턴 에이전트 테스트로 시작하세요. 짧은 단일 프롬프트만으로는 실제 성능을 결정하는 전송, 캐시, 컨텍스트 재사용 동작이 드러나지 않을 수 있습니다.

제한 사항, 체크리스트 및 모범 사례

FreeToken은 서빙 시스템을 개선하지만 대규모 모델에 필요한 물리적 비용을 없애지는 않습니다. 전체 전문가 풀에는 여전히 수백 GB의 호스트 메모리 또는 저장 공간이 필요할 수 있습니다. 플랫폼 지원은 운영체제와 드라이버의 동작에도 좌우되며, 특히 고정 또는 등록된 메모리의 경우 더욱 그렇습니다.

빠른 DMA 경로를 구축할 수 없는 경우 런타임은 순수 CPU MoE 백엔드로 대체될 수 있습니다. 비전문가 레이어는 GPU에 남고, 활성화, 라우팅 메타데이터, 집계된 출력은 디바이스 경계를 넘어 이동합니다. 이는 배포 가능성을 높이지만 최대 전송 성능을 낮출 수 있습니다.

결과를 비교하기 전에 다음 체크리스트를 사용하세요.

배포 준비 체크리스트:

  • 모델 정밀도와 전체 전문가 풀 크기 확인
  • 고정된 PCIe 전송 및 CPU 전문가 대역폭 측정
  • KV 캐시와 전문가 슬롯 모두를 위한 VRAM 확보
  • 콜드 스타트, 싱글턴, 멀티턴 워크로드 테스트
  • 캐시 미스율, TTFT, 디코드 속도, 꼬리 지연 시간 추적

가장 유용한 지표는 평균 초당 토큰 수에만 국한되지 않습니다. 에이전트 워크로드에서는 긴 꼬리 TTFT가 클라이언트가 정상적으로 기다릴 수 있는지, 아니면 타임아웃 한계에 도달하는지를 결정할 수 있습니다. 논문은 테스트 셀에서 FreeToken의 최악의 턴 TTFT가 44초 미만으로 유지되었다고 보고했으며, 각 베이스라인은 평가 중 어느 한 지점에서 150초를 초과했습니다.

지표모니터링할 항목해석
디코드 처리량평균 초당 토큰 수생성 효율 측정
TTFT평균 및 최악의 턴 지연 시간프롬프트 전송 및 재계산 반영
전문가 미스율라우팅된 읽기 중 미스 비율캐시 지역성 품질 표시
캐시 용량상주하는 전문가 풀의 비율VRAM 할당과 재사용의 연결 관계 표시
시작 시간디스크 로드부터 첫 응답까지실제 온디맨드 사용성 측정
모범 사례

엔진 간에 동일한 하네스, 프롬프트, 모델 정밀도, 성공 기준을 사용해 평가하세요. 에이전트의 진행 경로는 달라질 수 있으므로, 요청마다 수행하는 작업량이 다를 때 단순한 실제 경과 시간 비교는 오해를 불러일으킬 수 있습니다.

FreeToken FAQ

Q: FreeToken 290b 모델은 공식적으로 별도 명명된 모델인가요?

제공된 연구에서 FreeToken은 독립적인 290B 모델 체크포인트가 아니라 서빙 시스템으로 설명됩니다. 주요 문서화 예시는 총 284B 파라미터의 DeepSeek-V4-Flash이므로, 290b라는 표현은 프런티어급 서빙 주제를 가리키는 검색용 명칭으로 보는 것이 적절합니다.

Q: FreeToken은 정적인 CPU-GPU 배치 방식과 어떻게 다른가요?

정적 시스템은 로드 시점이나 프리필 시점에 전문가 배치를 결정합니다. FreeToken은 디코드 라우팅을 따라가는 공유 LRU 캐시를 사용하며, 피할 수 없는 미스를 PCIe 캐시 채우기와 CPU 직접 실행으로 나눕니다.

Q: FreeToken은 8GB 노트북 GPU에서 대규모 MoE 모델을 실행할 수 있나요?

평가에서는 NVFP4를 사용하는 8GB RTX 4060 노트북 구성에서 Qwen3.6을 실행한 결과를 보고합니다. 전체 모델은 여전히 호스트에 상주하는 전문가에 의존하므로 GPU 메모리만으로는 전체 체크포인트를 저장하지 않습니다.

Q: 멀티턴 에이전트 워크로드가 중요한 이유는 무엇인가요?

도구 호출과 컨텍스트 수정은 프리필을 반복적으로 발생시킵니다. FreeToken은 재사용 가능한 접두사를 보존하기 위해 의미적 체크포인트를 사용하며, 디코드 중에는 전문가 캐시가 라우팅 지역성을 추적합니다.