- FreeToken 양자화는 주로 지원되는 저정밀도 체크포인트를 로컬 하드웨어에서 효율적으로 서비스하는 것과 관련이 있습니다.
- MoE 설계는 각 토큰에 대해 모델 파라미터의 일부만 활성화되도록 합니다.
- VRAM 용량 제한이 있어도 전체 모델을 보관하기에 충분한 시스템 RAM은 여전히 필요합니다.
- 현재 가장 적합한 하드웨어는 Linux, NVIDIA GPU, CUDA 13 및 최신 드라이버를 갖춘 환경입니다.
- 주요 장점은 대규모 MoE 모델을 GPU 메모리에 완전히 저장할 수 없을 때 나타납니다.
FreeToken 양자화와 핵심 서비스 모델
FreeToken은 새로운 언어 모델이나 독립적인 양자화 알고리즘이 아니라 엣지 네이티브 추론 엔진입니다. FreeToken 양자화의 맥락에서 중요한 점은 전체 mixture-of-experts 모델이 사용 가능한 VRAM을 초과할 때 런타임이 지원되는 저정밀도 체크포인트를 어떻게 서비스하는가입니다.
mixture-of-experts 모델은 대규모 전문가 풀을 저장하지만 각 토큰을 제한된 수의 전문가에게만 라우팅합니다. DeepSeek-V4-Flash는 총 2,840억 개의 파라미터를 보유하며 토큰당 약 130억 개가 활성화되는 것으로 설명됩니다. 이러한 희소 활성화는 로컬 실행을 더욱 실용적으로 만들지만, 전체 전문가 풀은 여전히 상당한 메모리 및 데이터 전송 문제를 야기합니다.
| 개념 | 의미 | 중요한 이유 |
|---|---|---|
| 양자화된 체크포인트 | 낮은 정밀도의 가중치를 사용해 저장된 모델 | 저장 공간과 메모리 부담을 줄임 |
| MoE 모델 | 많은 전문가와 희소한 토큰 라우팅을 사용하는 모델 | 토큰당 활성 계산량을 줄임 |
| 활성 파라미터 | 현재 토큰에 사용되는 파라미터 | 즉각적인 계산 부하의 상당 부분을 결정함 |
| 전체 체크포인트 | 모든 모델 및 전문가 가중치 | 시스템 어딘가에는 여전히 저장되어 있어야 함 |
| 엣지 서비스 | GPU, CPU, RAM 및 PCIe를 통한 추론 | 소비자용 하드웨어를 하나의 통합 런타임으로 활용함 |
이 논문은 FreeToken이 여러 모델 계열과 정밀도 형식을 지원한다고 설명합니다. 평가에는 네이티브 MXFP4 양자화가 적용된 DeepSeek-V4-Flash 체크포인트, 8GB 노트북 구성용 NVFP4 릴리스, 그리고 BF16 형식의 Qwen3.6-35B-A3B가 포함됩니다. 이는 “양자화 지원”이 범용 변환 규칙이 아니라 특정 모델 체크포인트와 런타임 경로에 따라 달라진다는 의미입니다.
영상 하이라이트:
- FreeToken은 GPU 메모리를 초과하는 대규모 MoE 모델을 위해 설계되었습니다.
- 적응형 전문가 캐싱은 자주 라우팅되는 전문가를 VRAM에 유지합니다.
- 캐시 미스가 발생하면 CPU 실행과 PCIe 전송을 함께 활용할 수 있습니다.
- 장시간 코딩 에이전트 세션은 주요 대상 워크로드입니다.
먼저 지원되는 양자화 체크포인트를 선택한 다음 전체 시스템 메모리 요구 사항을 계산하세요. 8GB GPU는 더 큰 모델을 가속할 수 있지만, 체크포인트 전체를 단독으로 저장할 수는 없습니다.
양자화된 MoE 가중치가 메모리에서 이동하는 방식
FreeToken은 2단계 전문가 메모리 계층을 중심으로 추론을 구성합니다. 호스트 시스템은 라우팅된 전문가 풀 전체를 보관하고, 비전문가 가중치는 GPU에 유지됩니다. 이후 사용 가능한 VRAM은 MoE 레이어 전체에서 공유되는 탄력적인 전문가 캐시로 사용됩니다.
이 구조는 양자화의 역할을 바꿉니다. 저정밀도 가중치는 호스트에 상주하는 모델의 크기와 전송량을 줄이지만, 런타임은 어떤 전문가를 VRAM에 둘지, 누락된 전문가 중 어떤 것을 전송할지, 어떤 전문가를 CPU에서 직접 실행할 수 있을지를 여전히 결정해야 합니다.
| 메모리 계층 | 주요 내용 | 런타임 역할 |
|---|---|---|
| GPU 메모리 | 비전문가 가중치, KV 캐시, 선택된 전문가 | 빠른 실행 및 활성 상태 저장 |
| 호스트 RAM | 전체 전문가 풀 | 모델 가중치의 기준 저장소 |
| PCIe 링크 | 전문가 전송 및 활성화 트래픽 | CPU 측 저장 공간과 GPU 실행을 연결 |
| NVMe 저장 장치 | 체크포인트 파일 및 FTW 데이터 | 시작 시 모델 데이터를 제공 |
| CPU 캐시 경로 | 최근 사용된 호스트 측 데이터 | 캐시 미스의 직접 실행을 지원 |
프리필 중 충분한 캐시 용량을 사용할 수 있으면 FreeToken은 전체 레이어 이중 버퍼링을 사용합니다. GPU가 한 레이어를 계산하는 동안 다음 레이어의 전문가가 PCIe를 통해 스트리밍될 수 있습니다. 이를 통해 데이터 이동과 계산을 겹치게 하여 각 전송이 별도의 GPU 유휴 시간으로 노출되는 것을 방지합니다.
디코드 중에는 라우팅이 더욱 세분화됩니다. 런타임은 최근 선택된 전문가를 기반으로 공유 LRU 캐시를 유지합니다. 캐시 히트는 GPU에서 실행됩니다. 캐시 미스는 측정된 호스트 및 전송 대역폭에 따라 PCIe를 통해 캐시에 추가하거나 CPU에서 직접 실행할 수 있습니다.
대역폭 적응형 정책은 이 설계의 핵심입니다. 빠른 PCIe 연결은 누락된 전문가를 더 많이 전송하는 방식을 선호할 수 있으며, 호스트 메모리 대역폭이 더 강하면 CPU에서 직접 실행하는 방식이 더 유리할 수 있습니다. 이 결정은 고정된 하드웨어 프로필을 그대로 적용하지 않고 실제 배포된 시스템에 맞춰 내려집니다.
양자화는 체크포인트 크기를 줄이지만 메모리 요구 사항을 없애지는 않습니다. 대규모 모델은 호스트에 상주하는 전체 전문가 풀과 운영체제 및 애플리케이션 오버헤드를 수용할 수 있을 만큼 충분한 RAM을 여전히 필요로 합니다.
지원 형식, 하드웨어 및 성능 프로필
현재 FreeToken의 문서화된 가속 설정은 특정 환경에 맞춰져 있습니다. 제공된 자료에 설명된 명령줄 경로에는 x86-64 컴퓨터의 Linux, NVIDIA GPU, CUDA 13 및 최신 드라이버가 필요합니다. 프로젝트는 RTX 30, RTX 40 및 RTX 50 시리즈 하드웨어를 강조합니다.
| 하드웨어 또는 플랫폼 | 제공된 문서에서의 상태 | 주요 고려 사항 |
|---|---|---|
| RTX 30 시리즈 | 지원 대상으로 강조됨 | 대형 MoE 모델에서는 호스트 RAM이 여전히 중요함 |
| RTX 40 시리즈 | 지원 대상으로 강조됨 | PCIe 및 CPU 대역폭이 캐시 미스에 영향을 줌 |
| RTX 50 시리즈 | 지원 대상으로 강조됨 | 대규모 로컬 MoE 실험에 적합함 |
| RTX 4060 노트북 | 평가된 구성 | VRAM 8GB, 시스템 메모리 32GB, NVFP4 체크포인트 |
| RTX PRO 6000 Blackwell | 프런티어 규모 평가 | GLM-5.2 시연에 사용됨 |
| Apple Silicon | 이에 상응하는 경로가 설명되지 않음 | 네이티브 동등 환경이라고 가정하지 말 것 |
| CPU 전용 실행 | 주요 대상이 아님 | 특화된 GPU 서비스가 초점임 |
공개된 평가에 따르면 RTX 5090 구성에서 Qwen3.6-35B-A3B는 초당 7783토큰, DeepSeek-V4-Flash는 초당 2225토큰을 기록했습니다. VRAM 8GB와 시스템 메모리 32GB를 갖춘 RTX 4060 노트북에서는 공식 NVFP4 Qwen 구성으로 초당 39.3토큰에 도달했습니다.
별도의 워크스테이션 결과에서는 7,530억 개 파라미터 모델로 설명된 GLM-5.2를 단일 RTX PRO 6000에서 초당 14.9토큰으로 서비스했습니다. 이러한 수치는 특정 체크포인트, 하드웨어, 워크로드 및 정밀도 형식에 종속됩니다. 따라서 보편적인 성능 보장이 아니라 참고 수치로 받아들여야 합니다.
| 모델 또는 구성 | 정밀도 또는 형식 | 보고된 하드웨어 | 보고된 결과 |
|---|---|---|---|
| Qwen3.6-35B-A3B | BF16 | RTX 5090 | 초당 77~83토큰 |
| DeepSeek-V4-Flash | MXFP4 라우팅 전문가 | RTX 5090 | 초당 22~25토큰 |
| Qwen3.6-35B-A3B | 공식 NVFP4 릴리스 | RTX 4060 노트북, VRAM 8GB | 초당 39.3토큰 |
| GLM-5.2 | NVFP4 라우팅 전문가 | RTX PRO 6000 Blackwell | 초당 14.9토큰 |
| Qwen3.6-35B-A3B | 커뮤니티 보고 양자화 테스트 | RTX 5080 시스템 | 약 초당 100토큰으로 보고됨 |
가장 강력한 사용 사례는 VRAM에는 들어가지 않지만 시스템 메모리에서는 관리 가능한 모델입니다. 양자화된 모델이 GPU 내부에 완전히 들어간다면 범용 런타임도 이미 뛰어난 속도를 제공할 수 있으므로 FreeToken의 전송 중심 장점은 상대적으로 덜 중요할 수 있습니다.
NVIDIA GPU, 충분한 시스템 RAM 및 대규모 MoE 체크포인트를 함께 활용해 대화형 로컬 추론을 수행해야 할 때 FreeToken의 장점이 가장 분명하게 드러납니다.
FreeToken 양자화 설정 워크플로
공개된 벤치마크 수치를 보장된 결과로 간주하지 않고, 지원되는 양자화 모델을 평가하려면 다음 워크플로를 사용하세요.
플랫폼 확인
시스템이 Linux, x86-64 프로세서, 지원되는 NVIDIA GPU, CUDA 13 및 최신 드라이버를 사용하는지 확인하세요. 또한 사용 가능한 VRAM, 시스템 RAM, PCIe 링크 폭 및 호스트 메모리 대역폭을 기록하세요.
지원되는 체크포인트 선택
MXFP4, NVFP4 또는 명시된 BF16 평가 구성과 같이 호환되는 정밀도 형식의 공식 또는 문서화된 체크포인트를 선택하세요. 가중치를 다운로드하기 전에 해당 모델 계열이 지원되는지 확인하세요.
전체 메모리 요구 사항 계산
GPU 메모리를 전체 저장 공간이 아니라 가속 공간으로 간주하세요. 전체 전문가 풀, 런타임 상태, 운영체제 및 증가하는 KV 캐시를 수용할 수 있도록 충분한 시스템 RAM을 확보하세요.
런타임 형식 준비
프로젝트에 문서화된 로딩 경로를 사용하세요. 해당되는 경우 FreeToken Weight 형식은 런타임 레이아웃으로 전문가 뱅크를 저장하여 시작 중 체크포인트 탐색 및 재패킹 작업을 줄여줍니다.
실제 워크로드로 테스트
멀티턴 세션에서 프롬프트 지연 시간, 첫 토큰까지의 시간, 디코드 속도 및 안정성을 측정하세요. 코딩 에이전트와 도구 호출은 짧은 단일 프롬프트 테스트에서 드러나지 않는 동작을 보여줄 수 있습니다.
런타임은 스케줄러의 안전 지점에서 GPU 전문가 캐시의 크기를 동적으로 조정하고 재구성할 수 있습니다. 이는 세션 중 브라우저 창, 데스크톱 애플리케이션 또는 기타 GPU 워크로드로 인해 사용 가능한 VRAM이 변할 때 유용합니다.
에이전트 워크로드에서는 순수한 디코드 속도만큼 컨텍스트 처리도 중요합니다. FreeToken은 사고 구간, 도구 호출, 도구 출력 및 대화 턴과 같은 의미적 경계에 반복 상태 체크포인트를 배치합니다. 에이전트가 이전 블록을 편집하면 런타임은 변경되지 않은 접두사를 재사용하고 새 접미사만 다시 프리필할 수 있습니다.
| 테스트 지표 | 기록할 내용 | 중요한 이유 |
|---|---|---|
| VRAM 사용량 | 캐시, KV 캐시 및 비전문가 할당량 | 메모리가 균형 있게 사용되는지 보여줌 |
| 시스템 RAM 사용량 | 호스트 상주 모델 및 런타임 오버헤드 | 메모리 압박을 감지함 |
| 첫 토큰까지의 시간 | 평균 및 가장 느린 턴 | 프리필 및 컨텍스트 비용을 드러냄 |
| 디코드 속도 | 워크로드별 초당 토큰 수 | 엔진 간 공정한 비교를 가능하게 함 |
| 캐시 동작 | 히트율 및 미스율 | 전문가 지역성이 도움이 되는지 보여줌 |
| 세션 안정성 | 긴 컨텍스트 및 반복적인 도구 호출 | 실제 에이전트 서비스를 테스트함 |
엔진 간에 동일한 모델, 정밀도, 프롬프트 시퀀스 및 에이전트 하니스를 사용해 실행하세요. 장시간 세션 동작은 짧은 단일 턴 처리량과 별도로 비교하세요.
준비 상태 체크리스트 및 엔진 비교
FreeToken을 정기적인 로컬 서비스에 도입하기 전에 설정의 실용성을 가장 자주 결정하는 제약 조건을 확인하세요.
준비 상태 체크리스트:
- Linux, x86-64, NVIDIA GPU, CUDA 13 및 최신 드라이버를 확인합니다
- 문서화된 모델과 호환되는 양자화 형식을 선택합니다
- 호스트에 상주하는 전체 체크포인트를 위한 시스템 RAM을 확보합니다
- 대상 시스템에서 PCIe 전송 및 CPU 메모리 대역폭을 측정합니다
- 일상적으로 사용하기 전에 긴 컨텍스트 및 도구 호출 워크로드를 테스트합니다
FreeToken은 llama.cpp를 보편적으로 대체하는 솔루션으로 포지셔닝되지 않습니다. llama.cpp는 더 다양한 운영체제, 프로세서, GPU 공급업체, Apple Silicon 기기 및 모델 형식을 지원합니다. 반면 FreeToken은 대형 MoE 모델과 GPU 메모리, CPU 실행, 호스트 RAM 및 PCIe 전송의 조율에 초점을 맞춥니다.
| 런타임 | 주요 강점 | 이 사용 사례에서의 주요 한계 |
|---|---|---|
| FreeToken | GPU 및 CPU 리소스 전반에 걸친 적응형 MoE 서비스 | 플랫폼 및 모델 생태계가 더 제한적임 |
| llama.cpp | 폭넓은 하드웨어 및 모델 호환성 | 정적 하이브리드 배치로 인해 변화하는 전문가 지역성을 놓칠 수 있음 |
| KTransformers | CPU 전문가 실행 및 하이브리드 서비스 | 보고된 정책이 하드웨어 균형에 덜 적응적일 수 있음 |
| Ollama | 접근성이 높은 로컬 모델 워크플로 | 대형 MoE 서비스의 주요 특화 대상은 아님 |
이 프로젝트는 OpenAI 호환 및 Anthropic 호환 API도 제공하므로 로컬 모델을 지원되는 코딩 및 에이전트 도구에 연결할 수 있습니다. API 계층의 호환성이 모든 클라이언트에서 동일한 동작을 보장하는 것은 아니므로 인증, 컨텍스트 처리, 도구 호출 및 타임아웃 설정을 개별적으로 테스트하세요.
기술 설계 및 평가 세부 사항은 FreeToken 연구 논문을 참고하세요. 이 논문은 FreeToken을 Apache 2.0 오픈 소스 시스템으로 소개하며, 릴리스 제공처로 flashml.ai를 명시합니다.
지원되는 양자화 MoE 체크포인트 하나와 재현 가능한 벤치마크로 시작하세요. 메모리 여유, 허용 가능한 첫 토큰 지연 시간 및 안정적인 에이전트 세션을 확인한 후에만 범위를 확장하세요.
FreeToken 양자화 FAQ
Q: FreeToken 자체가 양자화 알고리즘인가요?
아닙니다. FreeToken은 추론 및 서비스 엔진입니다. 일반적으로 FreeToken 양자화라는 용어는 호환되는 저정밀도 체크포인트를 MoE 서비스 시스템에서 실행하는 것을 의미합니다.
Q: 8GB GPU가 8GB 메모리만 사용해 35B 모델을 실행할 수 있나요?
아닙니다. 평가된 노트북 구성은 VRAM 8GB와 시스템 메모리 32GB를 사용했습니다. GPU는 가속을 담당하고 호스트 메모리는 나머지 모델 가중치를 보관했습니다.
Q: FreeToken에 대해 어떤 양자화 형식이 논의되나요?
제공된 평가에서는 DeepSeek-V4-Flash에 MXFP4 라우팅 전문가, 노트북 테스트에 공식 NVFP4 Qwen3.6 릴리스, 주요 Qwen3.6 비교에 BF16이 사용된 것으로 설명합니다.
Q: FreeToken은 언제 일반적인 로컬 런타임보다 더 유용한가요?
대규모 MoE 모델이 VRAM을 초과하고, 컴퓨터에 충분한 시스템 RAM이 있으며, 적응형 전문가 캐싱 또는 CPU-GPU 조율을 통해 전송 지연을 줄일 수 있을 때 가장 유용합니다.