- FreeToken linux는 CUDA 하드웨어와 호스트 메모리를 활용한 로컬 MoE 서빙에 중점을 둡니다.
- 가장 적합한 환경: 충분한 RAM과 PCIe 대역폭을 갖춘 최신 NVIDIA 시스템.
- 핵심 장점: 라우팅을 인식하는 전문가 캐시가 토큰 수준의 모델 동작에 맞춰 적응합니다.
- 주요 제한 사항: Linux 지원이 가장 명확한 대상이며, macOS 지원은 명시되어 있지 않습니다.
- 핵심 결과: 보고된 성능 향상은 대규모 MoE 모델과 에이전트 워크로드에서 가장 큽니다.
FreeToken linux 개요 및 적합한 사용 사례
FreeToken linux는 개인 하드웨어에서 대규모 전문가 혼합(MoE) 모델을 서빙하도록 설계된 베타 단계의 로컬 추론 시스템입니다. 모든 전문가 가중치를 GPU 메모리에 상주시키는 대신, 전체 전문가 풀을 호스트 메모리에 유지하고 사용 가능한 VRAM을 탄력적인 캐시로 활용합니다. 따라서 이 프로젝트는 모델, 게임 또는 리워드 코드 플랫폼이라기보다 시스템 런타임에 가깝습니다.
가장 적합한 사용자는 코딩, 수학 또는 도구를 사용하는 에이전트를 통해 대규모 오픈 웨이트 모델을 실행하는 개발자입니다. 모델이 사용 가능한 VRAM을 초과하면서도 희소 활성화 구조를 갖춘 경우 FreeToken의 활용도가 특히 높습니다. 이 시스템은 소비자용 GPU, CPU, RAM 및 PCIe 리소스를 하나의 통합된 추론 플랫폼으로 구성하는 것을 목표로 합니다.
동영상 주요 내용:
- FreeToken은 수천억 개의 파라미터를 가진 모델의 로컬 서빙을 목표로 합니다.
- 라우팅 인식 캐싱은 디코딩 중 불필요한 전문가 전송을 줄입니다.
- 공개된 벤치마크에는 NVIDIA 데스크톱, 워크스테이션 및 8GB 노트북 GPU가 포함됩니다.
- 현재 프로젝트 메타데이터에서 Linux와 NVIDIA CUDA가 가장 명확하게 지원되는 환경입니다.
| 영역 | FreeToken이 제공하는 기능 | 실제 의미 |
|---|---|---|
| 런타임 중점 | 엣지 네이티브 MoE 서빙 | 대규모 희소 모델을 데이터센터 외부에서도 실행할 수 있음 |
| 주요 플랫폼 | NVIDIA CUDA를 사용하는 POSIX Linux | Linux 사용자가 가장 명확한 대상 환경을 가짐 |
| 메모리 모델 | 호스트 상주 전문가와 GPU 캐시 | 전체 모델 가중치가 VRAM에 모두 들어갈 필요가 없음 |
| 워크로드 중점 | 에이전트 추론 | 다중 턴 컨텍스트와 도구 호출을 핵심 요구 사항으로 다룸 |
| 프로젝트 성숙도 | 베타 단계 시스템 | 호환성과 패키징이 변경될 수 있음 |
FreeToken을 특화된 Linux 추론 런타임으로 이해하세요. 호환되는 NVIDIA 하드웨어와 충분한 시스템 메모리를 이미 보유하고 있으며, 대규모 MoE 모델을 반복적으로 사용하는 워크로드가 있다면 특히 매력적인 선택입니다.
FreeToken의 MoE 메모리 처리 방식
전문가 혼합 모델에는 많은 전문가 네트워크가 포함되지만, 라우터는 각 토큰마다 그중 일부만 활성화합니다. 참고 논문은 DeepSeek-V4-Flash를 예로 들며, 각 레이어에서 라우팅된 256개 전문가 중 6개가 활성화되고 284B 파라미터 모델에서 13B 파라미터가 활성화된다고 설명합니다. 희소 활성화는 연산량을 줄이지만, 모든 전문가 가중치에 계속 접근할 수 있어야 합니다.
FreeToken은 모델을 CPU 상주 전문가 풀과 GPU 상주 작업 세트로 분리합니다. GPU 캐시는 MoE 레이어 전체에서 공유되는 LRU 정책을 사용하므로 최근 선택된 전문가가 이후 토큰에서도 사용 가능하도록 유지됩니다. 필요한 전문가가 캐시에 없을 경우 런타임은 해당 전문가를 GPU로 전송하거나 CPU에서 직접 실행할 수 있습니다.
| 메모리 계층 | 저장 데이터 | 추론 중 역할 |
|---|---|---|
| GPU 메모리 | 비전문가 가중치, KV 캐시, 전문가 슬롯 | 빠른 실행 및 최근 사용된 전문가 제공 |
| 호스트 메모리 | 전체 라우팅 전문가 풀 | 전체 MoE 모델의 원본 데이터 |
| PCIe 링크 | 전문가 전송 및 런타임 데이터 | 선택된 캐시 미스 전문가를 GPU 메모리로 이동 |
| CPU 코어 | 선택된 캐시 미스 전문가의 직접 실행 | 대기하는 대신 남은 호스트 대역폭 활용 |
| NVMe 스토리지 | 원본 모델 또는 준비된 가중치 파일 | 시작 및 형식 변환을 위한 소스 |
런타임은 호스트 측 전문가 처리 대역폭과 PCIe를 통한 고정 메모리 전송 대역폭이라는 두 가지 대역폭을 측정합니다. 그런 다음 GPU 캐시에 채워야 할 캐시 미스 전문가 수와 CPU에서 직접 실행해야 할 전문가 수를 추정합니다. 이 방식은 모든 하드웨어 구성을 동일하게 취급하는 문제를 피합니다.
프리필 단계에서 FreeToken은 전체 레이어 이중 버퍼링을 사용합니다. 한 레이어가 실행되는 동안 다음 레이어의 전문가를 PCIe를 통해 스트리밍할 수 있습니다. 디코드 단계에서는 공유 캐시가 변화하는 라우터 결정에 따라 동작합니다. 동일한 캐시가 두 단계를 모두 지원하므로 별도의 프리필 및 디코드 메모리 풀 사이에서 발생하는 비용이 큰 전환을 줄일 수 있습니다.
| 메커니즘 | 해결하는 문제 | 중요한 이유 |
|---|---|---|
| 공유 LRU 전문가 캐시 | 토큰 간 라우팅 변경 | GPU 상주 전문가가 최근 수요를 따름 |
| 대역폭 적응형 실행 | 일부 전문가가 캐시에서 누락됨 | CPU와 GPU가 캐시 미스를 동시에 처리할 수 있음 |
| 전체 레이어 이중 버퍼링 | 프리필 전송으로 인한 실행 중단 | 전문가 이동과 연산이 겹쳐서 수행됨 |
| 의미 상태 체크포인트 | 에이전트 컨텍스트가 반복적으로 편집됨 | 보존된 접두사는 재계산이 덜 필요함 |
| 탄력적 캐시 크기 조정 | VRAM 가용량 변화 | 재시작 없이 캐시 용량을 조정할 수 있음 |
희소 활성화가 메모리 요구 사항을 없애 주는 것은 아닙니다. 전체 전문가 풀에 호스트 메모리에서 계속 접근할 수 있어야 하며, 모델 파일은 매우 클 수 있습니다. GPU 속도를 평가하기 전에 시스템 RAM, 스토리지 용량 및 메모리 대역폭을 확인하세요.
FreeToken linux 설정 경로
현재 이용 가능한 자료에서는 Linux, NVIDIA CUDA, POSIX 운영 체제 및 베타 개발 상태가 가장 명확한 환경으로 제시됩니다. 패키징은 빠르게 변경될 수 있으므로 오래된 가이드의 명령을 그대로 복사하기보다 flashml.ai에서 프로젝트의 최신 릴리스 지침을 사용하세요.
하드웨어 프로필 확인
시스템이 호환되는 NVIDIA GPU와 CUDA 환경을 사용하는지 확인하세요. 사용 가능한 VRAM, 시스템 RAM, PCIe 링크 폭, 스토리지 용량 및 호스트 메모리 대역폭을 기록합니다. 이러한 값은 전문가 캐시의 크기와 GPU 전송 및 CPU 실행 간 분배에 영향을 줍니다.
Linux 런타임 준비
지원되는 POSIX Linux 환경을 사용하고 프로젝트에서 지정한 최신 종속성을 설치하세요. NVIDIA 드라이버와 CUDA 스택을 릴리스 요구 사항에 맞게 유지하세요. 현재 메타데이터에서 FreeToken은 베타 소프트웨어로 분류되므로, 한 배포판용으로 빌드된 패키지가 다른 배포판에서도 동일하게 작동한다고 가정하지 마세요.
모델 가중치 준비
지원되는 MoE 체크포인트를 선택하고 전체 전문가 풀이 호스트 메모리에 들어가는지 확인하세요. FreeToken의 FTW 형식은 런타임 레이아웃에 전문가 뱅크를 저장하므로 시작 중 텐서 탐색과 재패킹을 줄여 줍니다. 원본 체크포인트와 준비된 표현을 저장할 수 있도록 충분한 NVMe 공간을 확보하세요.
프로파일링 및 소규모 요청 테스트
런타임이 호스트 처리 대역폭과 PCIe 전송 대역폭을 측정하도록 한 다음 짧은 프롬프트로 시작하세요. 긴 에이전트 세션으로 넘어가기 전에 모델이 로드되고 GPU 캐시가 초기화되며 CPU–GPU 캐시 미스 처리가 작동하는지 확인하세요.
실제 워크로드에 맞게 조정
실제 운영 환경에서 실행할 것으로 예상되는 코딩, 수학 또는 도구 사용 패턴을 동일하게 테스트하세요. 평균 디코드 처리량에만 의존하지 말고 첫 토큰까지의 시간, 최악의 턴 지연 시간, RAM 사용량, VRAM 압박 및 요청 완료 여부를 확인하세요.
| 설정 확인 항목 | 목표 조건 | 실패 신호 |
|---|---|---|
| GPU 백엔드 | NVIDIA CUDA 호환 환경 | 런타임이 GPU 경로를 초기화하지 못함 |
| 운영 체제 | POSIX Linux 대상 | 지원되지 않는 패키징 또는 대체 경로 부재 |
| 호스트 메모리 | 전체 전문가 풀을 저장하기에 충분한 용량 | 로딩 실패 또는 과도한 페이징 발생 |
| 스토리지 | 체크포인트와 준비된 파일을 저장할 NVMe 용량 | 준비 시간이 길거나 디스크 공간 부족 |
| 런타임 테스트 | 짧은 프롬프트가 성공적으로 완료됨 | 캐시, 드라이버 또는 모델 형식 오류 |
긴 세션을 실행하기 전에:
- NVIDIA 드라이버와 CUDA 호환성 확인
- 전체 전문가 풀을 저장할 충분한 RAM 확보
- 원본 및 FTW 모델 파일을 위한 NVMe 공간 확인
- PCIe 링크와 호스트 메모리 성능 측정
- 에이전트를 시작하기 전에 짧은 프롬프트 테스트
성공적인 설정은 모델이 한 번 로드되는 것만을 의미하지 않습니다. 에이전트 워크로드는 프리필, 캐시 재사용 및 전문가 캐시 미스를 반복적으로 발생시키므로, 과도한 테일 지연 없이 다중 턴 요청이 완료되는지 확인하세요.
성능, 호환성 및 트레이드오프
FreeToken의 공개 평가에 따르면 대규모 MoE 모델과 에이전트 워크로드에서 가장 강력한 결과를 보였습니다. RTX 5090에서 이 시스템은 Qwen3.6-35B에서 초당 77–83토큰, DeepSeek-V4-Flash에서 초당 22–25토큰에 도달합니다. 또한 평가에서는 8GB GPU를 사용하는 RTX 4060 노트북에서 초당 39.3토큰, 단일 RTX PRO 6000에서 GLM-5.2에 대해 초당 14.9토큰을 기록했습니다.
동일한 평가에서는 첫 토큰까지의 테일 시간도 강조합니다. 테스트된 조건에서 FreeToken의 보고된 최악의 턴은 44초 미만으로 유지되었지만, 일부 구성에서는 베이스라인의 정지 시간이 훨씬 더 높은 값을 넘었습니다. 이러한 측정값은 프로젝트 자체 평가에서 나온 것이므로, 배포 결정을 내리기 전에 독립적인 테스트를 진행하는 것이 좋습니다.
| 모델 또는 등급 | 하드웨어 | 보고된 FreeToken 결과 | 컨텍스트 |
|---|---|---|---|
| Qwen3.6-35B-A3B | RTX 5090 | 77–83 tok/s | 에이전트 워크로드 |
| DeepSeek-V4-Flash | RTX 5090 | 22–25 tok/s | 에이전트 워크로드 |
| Qwen3.6-35B-A3B | RTX 4060 노트북, 8GB | 39.3 tok/s | NVFP4 릴리스, PCIe x8 |
| GLM-5.2 | RTX PRO 6000, 96GB | 14.9 tok/s | 753B 규모 시연 |
| FreeToken 테일 TTFT | 테스트된 구성 | 44초 미만 | 보고된 최악의 턴 결과 |
llama.cpp와의 비교는 단순히 평균 속도만의 문제가 아닙니다. 참고 분석에 따르면 특정 RTX 5090 캐시 용량에서 FreeToken의 전역 LRU 캐시는 Qwen3.6 전문가 읽기의 16%를 놓친 반면, 라우팅을 고려하지 않는 정적 분할은 62%를 놓쳤습니다. 동일한 비교 지점에서 DeepSeek-V4-Flash의 경우 FreeToken의 캐시 미스율은 39%였으며, 인용된 정적 정책에서는 더 자주 캐시 미스가 발생했습니다.
그러나 호환성은 중요한 트레이드오프입니다. 현재 이용 가능한 프로젝트 메타데이터에서는 Linux와 NVIDIA CUDA가 지원 대상 환경으로 제시됩니다. 구형 NVIDIA 카드, 듀얼 GPU Docker 지원, GGUF, Windows 수정 사항 및 Apple Silicon 지원 요청은 출시 당시 오픈 이슈로 설명되었습니다. FreeToken이 제한된 시스템 범주에서 성능 우위를 보이더라도, 기존 프로젝트가 더 폭넓은 하드웨어 지원을 제공할 수 있습니다.
FreeToken이 강점을 보이는 환경
- 대규모 MoE 체크포인트
- 최신 NVIDIA GPU
- 장시간 실행되는 코딩 에이전트
- 테일 지연 시간에 민감한 워크로드
호환성이 더 중요한 환경
- Apple Silicon 시스템
- 구형 NVIDIA 하드웨어
- 혼합 또는 다중 GPU 구성
- 검증된 크로스 플랫폼 워크플로
측정해야 할 항목
- 최악의 턴 TTFT
- 전문가 캐시 미스율
- 호스트 RAM 압박
- 요청 완료율
공개된 수치는 유용한 참고 자료로 활용하되, 모든 환경에 적용되는 보장으로 받아들이지는 마세요. 하드웨어 대역폭, 모델 형식, 프롬프트 길이, 동시 실행 애플리케이션 및 에이전트 하네스의 동작에 따라 로컬 결과가 크게 달라질 수 있습니다.
FreeToken linux FAQ 및 실용 체크리스트
FreeToken은 로컬 오픈 웨이트 MoE 추론을 위한 엣지 네이티브 서빙 시스템으로 이해하는 것이 가장 적절합니다. 모든 모델을 모든 컴퓨터에서 실행할 수 있게 해 주는 것은 아니며, 초당 최대 토큰 수만으로 평가해서도 안 됩니다. Linux 사용자는 호환성 확인, 메모리 계획 및 현실적인 다중 턴 테스트를 우선해야 합니다.
기술 세부 사항은 2026년 8월 24일 공개된 arXiv의 FreeToken 논문에 문서화되어 있습니다. 이 논문에서는 캐시 아키텍처, 대역폭 적응형 정책, 탄력적 메모리 관리, 구현 방식 및 평가 방법론을 설명합니다.
Q: FreeToken linux란 무엇인가요?
FreeToken linux는 대규모 전문가 혼합 모델을 위한 Linux 중심의 로컬 추론 런타임입니다. GPU 메모리, CPU 실행, 호스트 RAM 및 PCIe 전송을 조정하여 사용 가능한 VRAM보다 큰 모델도 엣지 하드웨어에서 사용할 수 있도록 합니다.
Q: FreeToken은 macOS 또는 Apple Silicon을 지원하나요?
현재 이용 가능한 2026년 프로젝트 정보에는 Mac 빌드나 Apple Silicon 지원이 명시되어 있지 않습니다. 공식 플랫폼 문서가 변경되기 전까지는 NVIDIA CUDA를 사용하는 Linux를 가장 명확한 지원 대상으로 간주하세요.
Q: FreeToken은 GPU 메모리를 초과하는 모델을 어떻게 실행할 수 있나요?
MoE 라우팅은 각 토큰에 대해 전문가의 일부만 활성화합니다. FreeToken은 전체 전문가 풀을 호스트 메모리에 유지하고 VRAM을 라우팅 인식 캐시로 사용하며, 선택된 캐시 미스 전문가는 GPU로 전송하거나 CPU에서 직접 실행할 수 있습니다.
Q: FreeToken은 모든 컴퓨터에서 llama.cpp보다 빠른가요?
아닙니다. 보고된 장점은 대규모 MoE 모델과 에이전트 워크로드를 최신 NVIDIA 하드웨어에서 실행할 때 가장 크게 나타납니다. 폭넓은 하드웨어 지원과 검증된 크로스 플랫폼 워크플로가 특화된 MoE 성능보다 중요하다면 llama.cpp가 여전히 실용적인 선택입니다.
호환되는 NVIDIA Linux 하드웨어에서 로컬 MoE 서빙을 하는 것이 우선이라면 FreeToken을 선택하세요. 플랫폼 지원 범위, 간단한 배포 또는 기존 모델 형식 지원이 결정적인 요소라면 더 폭넓은 런타임을 선택하세요.