- FreeToken 설정 가이드: GPU, CPU, RAM, 스토리지, PCIe 링크를 하나의 서빙 시스템으로 고려하세요.
- 하드웨어 적합성: 희소 활성화는 연산 수요를 줄이지만, 전체 전문가 풀을 저장하려면 여전히 호스트 메모리가 필요합니다.
- 대역폭 정책: 사양표에만 의존하지 말고 호스트 및 PCIe 대역폭을 측정하세요.
- 캐시 전략: 에이전트 워크로드에서는 탄력적인 GPU 전문가 캐싱을 KV 캐시 관리와 함께 사용하세요.
FreeToken에 필요한 요소
FreeToken은 대규모 Mixture-of-Experts 모델을 위한 엣지 네이티브 서빙 시스템입니다. 실용적인 설정은 활성 연산과 전체 모델 저장 공간을 분리하는 것에서 시작합니다. 각 토큰을 처리하는 전문가는 일부에 불과하지만, 라우팅된 전체 전문가 풀은 호스트 메모리 또는 다른 스토리지 계층에서 계속 사용할 수 있어야 합니다.
참조 설계에서는 전체 전문가 풀을 CPU 메모리에 유지하고, 비전문가 가중치는 GPU에 둡니다. 남은 VRAM은 MoE 레이어 전체에서 공유되는 탄력적인 전문가 캐시가 됩니다. 호스트 메모리와 인터커넥트 예산이 적절하다면, 이 방식으로 전체 가중치가 사용 가능한 VRAM을 초과하는 모델도 일반 소비자용 컴퓨터에서 서빙할 수 있습니다.
| 리소스 | 설정에서의 역할 | 확인할 항목 |
|---|---|---|
| GPU VRAM | 비전문가 가중치, KV 캐시, 전문가 캐시 | 변하는 컨텍스트 길이를 위한 여유 공간 확보 |
| 호스트 메모리 | 라우팅된 전문가의 기준 저장소 | 배포된 전체 전문가 풀을 수용해야 함 |
| PCIe 링크 | 누락된 전문가를 GPU로 이동 | 유효 전송 대역폭 측정 |
| CPU 및 DRAM | 선택된 캐시 미스 전문가를 직접 실행 | 대상 텐서로 대역폭 측정 |
| NVMe 스토리지 | 호스트에 상주하는 풀 로드 | 충분한 용량과 지속 읽기 속도 사용 |
GPU 등급
VRAM이 클수록 더 큰 전문가 캐시를 지원하고 디코드 적중률을 높일 수 있습니다. 연구의 RTX 5090급 구성은 8GB 노트북 GPU보다 훨씬 큰 워킹 세트를 처리했습니다.
호스트 등급
호스트 메모리는 라우팅된 전체 전문가 풀을 저장합니다. CPU가 캐시 미스를 처리할 때 듀얼 채널 DDR4 또는 DDR5 대역폭이 병목이 될 수 있습니다.
링크 등급
PCIe 대역폭은 누락된 전문가가 GPU에 얼마나 빠르게 도달하는지를 결정합니다. 특히 PCIe x8 연결을 사용하는 노트북 링크에서는 전송 지연이 더 크게 나타날 수 있습니다.
활성 파라미터만 기준으로 시스템 규모를 정하지 마세요. 희소 활성화는 토큰당 연산량을 줄이지만, 전체 전문가 풀은 여전히 GPU 및 시스템 메모리 예산을 초과할 수 있습니다.
FreeToken 설정 가이드: 단계별 안내
이 FreeToken 설정 가이드를 단일 명령어 레시피가 아니라 배포 순서로 활용하세요. 현재 제공된 참조 자료는 시스템 설계와 평가를 설명하며, 릴리스별 설치 세부 사항은 2026년에 공개된 FreeToken 프로젝트 페이지에서 확인해야 합니다.
지원되는 모델 선택
전문가 표현 방식과 정밀도가 런타임에서 지원되는 MoE 체크포인트로 시작하세요. 참조 평가에는 하드웨어 등급별로 DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2가 포함되어 있습니다.
호스트 메모리 확보
운영체제와 동시에 실행되는 애플리케이션을 위한 여유 공간을 남긴 상태에서, 라우팅된 전체 전문가 풀이 사용 가능한 호스트 메모리에 들어가는지 확인하세요. 디스크 용량을 런타임 메모리의 대체 수단으로 간주하지 마세요.
대역폭 측정
배포된 텐서 형태를 사용해 PCIe를 통한 고정 전문가 전송의 유효 대역폭과 CPU 측 전문가 처리 대역폭을 프로파일링하세요. 이 값이 캐시 미스 처리 분할을 결정합니다.
런타임 예산 설정
먼저 비전문가 가중치와 KV 캐시를 위한 VRAM을 확보하세요. 남은 예산은 공유 전문가 캐시에 할당하되, 더 긴 에이전트 세션을 위한 충분한 유연성을 남겨 두세요.
콜드 캐시 테스트 실행
콜드 캐시로 시작해 첫 요청이 완료되는지 확인한 다음, 일반적인 서빙 과정에서 캐시가 예열된 후 디코드 속도와 첫 토큰까지의 시간을 비교하세요.
| 설정 단계 | 주요 결정 | 검증 신호 |
|---|---|---|
| 모델 선택 | 정밀도 및 전문가 레이아웃 확인 | 런타임이 체크포인트를 로드할 수 있음 |
| 메모리 확보 | 시스템 오버헤드를 포함해 전문가 수용 | 할당 또는 페이징 실패가 없음 |
| 대역폭 프로파일링 | 호스트 및 PCIe 속도 기록 | 대상 하드웨어에서 측정값이 안정적임 |
| VRAM 할당 | 전문가와 KV 캐시 간 균형 조정 | 컨텍스트 증가로 VRAM이 고갈되지 않음 |
| 첫 요청 | 콜드 스타트 동작 테스트 | 별도의 예열 전용 경로 없이 요청이 완료됨 |
각 시스템의 대역폭 측정값을 기록하세요. 동일한 GPU를 사용하는 두 시스템이라도 DRAM 채널, PCIe 링크 또는 동시에 실행되는 워크로드가 다르면 결과가 달라질 수 있습니다.
프리필 및 디코드 구성
FreeToken은 두 가지 주요 추론 단계에 서로 다른 전략을 사용합니다. 프리필은 프롬프트를 처리하며 첫 토큰까지의 시간에 큰 영향을 줍니다. 디코드는 한 번에 하나씩 토큰을 생성하므로 전문가 캐시 미스와 호스트 대역폭에 더 민감합니다.
프리필 중 시스템은 전체 레이어 이중 버퍼링을 사용합니다. GPU가 한 레이어를 계산하는 동안 다음 레이어의 전문가가 PCIe를 통해 스트리밍됩니다. 이를 통해 전송과 연산을 겹치게 하여 전체 전문가 이동 시간이 GPU 유휴 시간으로 노출되는 것을 방지합니다. 캐시에 전체 레이어 버퍼 두 개를 확보할 여유가 없으면 VRAM 과잉 할당을 피하기 위해 온디맨드 로딩으로 전환합니다.
에이전트 세션은 의미 기반 상태 캐싱의 이점도 얻을 수 있습니다. 사고 구간, 도구 호출, 도구 출력, 대화 전환과 같은 경계에 체크포인트를 배치합니다. 하네스가 대화 기록의 전체 블록을 수정할 때 런타임은 보존된 접두부를 재사용하고 새 접미부만 다시 계산할 수 있습니다.
| 단계 | 주요 병목 | FreeToken의 대응 |
|---|---|---|
| 프리필 | 전체 전문가 이동 및 반복적인 컨텍스트 재계산 | 이중 버퍼 레이어 로딩 및 의미 기반 체크포인트 |
| 디코드 | 누락된 전문가와 제한된 CPU 대역폭 | 공유 LRU 캐시 및 대역폭 적응형 실행 |
| 장시간 세션 | 증가하는 KV 캐시 수요 | KV 페이지와 전문가 슬롯 간 탄력적 분할 |
| 재시작 | 전체 전문가 풀 로딩 | 최종 호스트 레이아웃으로 직접 로딩 |
디코드 중에는 공유 LRU 캐시에 이미 있는 라우팅된 전문가가 GPU에서 실행됩니다. 누락된 전문가는 두 경로로 나뉩니다.
- 캐시 채우기 경로: 선택된 전문가를 PCIe를 통해 전송하고 GPU에서 실행한 다음, 이후 재사용을 위해 유지합니다.
- CPU 경로: 다른 누락된 전문가를 GPU 상주 상태를 변경하지 않고 호스트 상주 풀에서 직접 실행합니다.
- 병합 경로: 정확한 MoE 계산을 유지하면서 GPU와 CPU의 부분 출력을 결합합니다.
대략적인 캐시 채우기 전문가는 다음과 같이 계산됩니다.
q* ≈ m × BP / BH
여기서 m은 누락된 전문가 수, BP는 측정된 고정 전송 대역폭, BH는 측정된 호스트 측 전문가 처리 대역폭입니다. 런타임은 결과를 반올림하며, CPU 실행이 대부분의 캐시 미스를 처리하는 경우에도 캐시 예열을 계속 진행합니다.
짧은 단일 턴 프롬프트와 다중 턴 에이전트 추적 양쪽에서 처리량을 비교하세요. 독립적인 디코드에서는 강해 보이는 구성이 반복적인 프리필과 컨텍스트 편집이 주를 이루는 상황에서는 성능이 저하될 수 있습니다.
캐시, 스토리지 및 런타임 튜닝
CPU에 상주하는 전문가 풀은 계속해서 기준 저장소 역할을 하므로 GPU 캐시 용량은 모델의 정확성이 아니라 성능을 변화시킵니다. 브라우저, 데스크톱 애플리케이션 및 기타 GPU 워크로드가 세션 중 사용 가능한 VRAM 예산을 바꿀 수 있는 개인용 컴퓨터에서는 특히 중요합니다.
FreeToken은 엔진을 재시작하거나 호스트 풀을 다시 로드하지 않고도 스케줄러의 안전 지점에서 GPU 전문가 캐시를 재구축할 수 있습니다. 캐시는 MoE 레이어 전체에서 공유되며 논리적인 레이어-전문가 식별자를 사용하므로, 상주 상태와 실행이 현재 라우팅된 워킹 세트를 따를 수 있습니다.
| 튜닝 영역 | 권장 방식 | 피해야 할 방식 |
|---|---|---|
| 전문가 캐시 | LRU가 최근 라우팅 지역성을 따르도록 함 | 프리필 전용 핫 세트를 영구적으로 고정 |
| KV 캐시 | 세션 길이에 따라 늘리되 전문가 용량 보호 | 사용 가능한 VRAM을 모두 컨텍스트에 할당 |
| 호스트 풀 | 최종 런타임 레이아웃으로 직접 로드 | 시작할 때마다 대규모 뱅크를 다시 패킹 |
| 고정 메모리 | 로드 후 데이터가 채워진 버퍼를 고정 | 빈 버퍼를 고정하고 불필요하게 페이지 폴트 발생 |
| 시작 | 일반 경로를 통해 콜드 캐시 요청 처리 | 별도의 전체 예열 단계 요구 |
서빙 전 확인 사항:
- 라우팅된 전체 전문가 풀이 호스트 메모리에 들어가는지 확인
- 유효 PCIe 전송 대역폭과 CPU 전문가 처리 대역폭 측정
- 비전문가 가중치와 증가하는 KV 캐시를 위한 VRAM 확보
- 선택한 모델의 정밀도와 전문가 레이아웃 확인
- 콜드 캐시 시작과 예열된 디코드를 모두 테스트
스토리지 측면에서 참조 설계는 전문가 뱅크를 런타임에 적합한 레이아웃으로 정규화하는 FreeToken Weight 형식을 도입합니다. 사전 포맷된 뱅크를 사용하면 엔진이 정렬된 청크를 정확한 크기의 호스트 버퍼로 직접 읽을 수 있어, 시작 시 텐서 탐색과 재패킹 작업을 줄일 수 있습니다. 플랫폼에서 필요한 고정 또는 등록 메모리 경로를 설정할 수 없는 경우 런타임은 순수 CPU MoE 백엔드를 사용할 수 있으며, 최대 전송 성능을 낮추는 대신 더 폭넓은 배포 가능성을 제공합니다.
소비자용 하드웨어는 전용 인프라가 아닙니다. 불필요한 애플리케이션을 종료하고 지속적인 온도를 모니터링하며, 데스크톱·브라우저·GPU 워크로드를 변경한 후 측정을 반복하세요.
검증, 문제 해결 및 FAQ
실제 병목을 드러내는 지표로 배포를 검증하세요. 디코드 처리량은 현재 전문가 워킹 세트가 얼마나 효율적으로 처리되는지를 보여 주며, 첫 토큰까지의 시간은 프리필 전송 및 재계산 비용을 나타냅니다. 에이전트 클라이언트에서는 단 한 번의 긴 턴만으로도 다른 측면에서는 허용 가능한 설정이 사용할 수 없는 것처럼 느껴질 수 있으므로 테일 지연 시간도 중요합니다.
| 증상 | 예상 원인 | 첫 번째 대응 |
|---|---|---|
| 첫 토큰이 느림 | 직렬화된 전문가 전송 또는 반복적인 프리필 | 이중 버퍼 사용 가능 여부와 접두부 재사용 확인 |
| 낮은 디코드 속도 | 과도한 캐시 미스 | KV 수요가 허용한다면 전문가 캐시 예산 증가 |
| CPU 포화 | 호스트 실행에 너무 많은 캐시 미스 할당 | 호스트 대역폭을 다시 프로파일링하고 미스 분할 점검 |
| GPU 활용률 저하 | PCIe 또는 호스트 메모리 병목 | 측정된 전송 대역폭과 CPU 대역폭 비교 |
| 시작 지연 | 디스크 로딩 또는 런타임 재패킹 | 준비된 가중치 레이아웃과 더 빠른 스토리지 사용 |
Q: FreeToken의 주요 목적은 무엇인가요?
FreeToken은 GPU 실행, CPU 실행, 호스트 메모리, PCIe 전송 및 탄력적인 전문가 캐싱을 조정하여 엣지 하드웨어에서 대규모 MoE 모델을 서빙합니다.
Q: FreeToken은 전체 모델이 VRAM에 들어가야 하나요?
아니요. 이 설계는 라우팅된 전체 전문가 풀을 호스트 메모리에 유지하고, GPU VRAM은 비전문가 가중치, KV 캐시 및 공유 전문가 캐시에 사용합니다.
Q: 대역폭 측정이 중요한 이유는 무엇인가요?
PCIe 캐시 채우기와 직접 CPU 실행 사이의 최적 분할은 배포된 시스템에 따라 달라집니다. FreeToken은 측정된 호스트 및 전송 대역폭을 바탕으로 이 분할을 도출합니다.
Q: FreeToken 설정은 어떻게 검증해야 하나요?
콜드 요청과 웜 요청을 테스트하고 디코드 처리량 및 첫 토큰까지의 시간을 모니터링한 다음, 실제와 유사한 다중 턴 또는 에이전트 프롬프트로 테스트를 반복하세요.
설계와 보고된 평가 결과는 2026년 8월 24일에 공개된 FreeToken 연구 논문에 문서화되어 있습니다. 최신 설치 지침은 프로젝트 릴리스 자료를 확인하세요.