- FreeToken RTX 5090 테스트는 사용 가능한 VRAM을 초과하는 대규모 MoE 모델에 초점을 맞춥니다.
- 최적의 사용 사례: 긴 컨텍스트와 반복적인 도구 호출을 사용하는 로컬 에이전트 워크로드입니다.
- 핵심 장점: 적응형 전문가 캐싱으로 GPU, CPU, RAM 및 PCIe 대역폭을 조율합니다.
- 보고된 속도: 테스트된 워크로드에서 Qwen3.6은 초당 약 77–83토큰에 도달합니다.
- 주요 제한 사항: 현재는 Linux, NVIDIA 하드웨어, CUDA 13 및 충분한 시스템 RAM 환경이 선호됩니다.
FreeToken RTX 5090: 런타임의 역할
FreeToken은 새로운 AI 모델이 아니라 엣지 네이티브 추론 런타임입니다. RTX 5090에서 FreeToken의 주요 목적은 전체 전문가 풀을 GPU 메모리에 저장할 수 없는 대규모 혼합 전문가 모델을 제공하는 것입니다. 런타임은 전체 모델을 호스트 메모리에 유지하면서 GPU를 적응형 작업 캐시로 사용합니다.
이 방식이 중요한 이유는 MoE 모델이 각 토큰마다 전체 파라미터 중 일부만 활성화하기 때문입니다. 예를 들어 DeepSeek-V4-Flash는 총 2,840억 개의 파라미터와 약 130억 개의 활성 파라미터를 갖는 것으로 표시되어 있습니다. 활성 연산은 고급 GPU의 실용적인 메모리 용량에 들어갈 수 있지만, 전체 체크포인트는 여전히 다른 저장 공간에 훨씬 더 많은 메모리를 필요로 합니다.
영상 하이라이트:
- FreeToken은 모든 로컬 모델 워크로드가 아니라 VRAM을 초과하는 대규모 MoE 모델을 위해 설계되었습니다.
- 단일 RTX 5090에서 DeepSeek-V4-Flash로 초당 20토큰 이상의 속도를 기록한 것으로 보고되었습니다.
- 런타임은 전문가 캐싱, 전송과 연산의 중첩, CPU 실행을 결합합니다.
- 짧은 합성 프롬프트보다 긴 코딩 에이전트 세션에서 더 큰 차이가 나타납니다.
GPU 전문가 캐시
자주 사용되는 전문가는 공유 LRU 캐시를 통해 VRAM에 유지되므로 디코딩 중 반복적인 전송을 줄일 수 있습니다.
대역폭 적응형 실행
측정된 하드웨어 대역폭에 따라 캐시 누락 전문가를 GPU로 전송하거나 CPU에서 직접 실행할 수 있습니다.
에이전트 인식 재사용
시맨틱 체크포인트는 사고 블록, 도구 호출 및 여러 턴에 걸친 컨텍스트 수정 과정에서 유용한 접두사를 보존합니다.
선택한 MoE 체크포인트가 VRAM보다 클 때 FreeToken의 장점이 가장 잘 드러납니다. 모델 전체가 RTX 5090에 들어간다면, 성숙한 범용 런타임도 충분히 실용적인 선택일 수 있습니다.
| 런타임 기능 | FreeToken | 일반적인 정적 하이브리드 런타임 |
|---|---|---|
| 전문가 배치 | 동적 LRU 캐시 | 고정 배치 또는 프리필 기반 배치 |
| 캐시 누락 처리 | GPU 전송 또는 CPU 실행 | 대개 사전 결정 |
| 에이전트 컨텍스트 재사용 | 시맨틱 체크포인트 | 런타임에 따라 다름 |
| 리소스 대응 | 측정된 대역폭에 맞게 조정 | 하드웨어별 튜닝이 필요한 경우가 많음 |
| 주요 초점 | 대규모 MoE 제공 | 폭넓은 로컬 추론 지원 |
RTX 5090 설정 요구 사항
가속 FreeToken 경로는 현재 Linux, x86-64 시스템, NVIDIA GPU, CUDA 13 및 최신 드라이버를 중심으로 구성되어 있습니다. 프로젝트는 RTX 30·40·50 시리즈 하드웨어를 지원 대상으로 강조하며, RTX 5090은 핵심 목표 범위에 포함됩니다.
GPU는 구성의 한 부분일 뿐입니다. 전체 전문가 풀이 VRAM을 초과하는 경우, 완전한 전문가 풀은 시스템 메모리에 있어야 합니다. RTX 5090은 모델의 총 메모리 요구량을 줄이는 것이 아니라, 사용 가능한 GPU, CPU, RAM 및 PCIe 리소스가 조율되는 방식을 개선합니다.
연구 설정에서는 PCIe 대역폭과 호스트 측 전문가 처리 대역폭도 구분합니다. 이러한 값은 제품 사양만으로 추정하지 말고 실제 컴퓨터에서 측정해야 합니다.
플랫폼 확인
지원되는 NVIDIA GPU, CUDA 13 및 최신 드라이버가 설치된 x86-64 Linux 환경을 사용합니다. 프로젝트는 Windows와 Linux 데스크톱 지원도 홍보하고 있지만, 문서화된 가속 워크플로는 여전히 Linux에 크게 초점을 맞추고 있습니다.
시스템 메모리 준비
호스트에 상주하는 전체 전문가 풀과 운영체제 및 기타 애플리케이션을 수용할 수 있도록 충분한 RAM을 확보합니다. DeepSeek-V4-Flash와 같은 대형 체크포인트는 활성 파라미터 수가 암시하는 것보다 훨씬 많은 메모리를 필요로 합니다.
지원되는 체크포인트 선택
지원되는 Hugging Face 체크포인트 또는 공식 저정밀도 릴리스를 사용해 시작합니다. Qwen3.6-35B-A3B와 DeepSeek-V4-Flash는 2026년 평가의 핵심 예시입니다.
시스템 측정
런타임이 호스트 측 처리 대역폭과 PCIe 전송 대역폭을 프로파일링하도록 합니다. 이 측정값은 GPU 캐시 로드와 CPU에서의 직접적인 전문가 실행 사이의 균형을 결정하는 데 사용됩니다.
클라이언트 연결
OpenAI 호환 또는 Anthropic 호환 API를 통해 로컬 서버를 실행한 다음, 지원되는 코딩 클라이언트나 도구 호출 클라이언트를 연결합니다.
시스템 RAM에는 VRAM에 들어가지 않는 체크포인트 부분을 저장할 수 있어야 합니다. GPU 메모리 사용량을 낮춰도 전체 모델에 필요한 저장 공간이 없어지는 것은 아닙니다.
| 요구 사항 | RTX 5090 권장 사항 | 중요한 이유 |
|---|---|---|
| GPU | NVIDIA RTX 5090급 하드웨어 | 활성 연산과 전문가 캐싱에 필요한 고대역폭 VRAM 제공 |
| 운영체제 | 문서화된 우선순위는 Linux | 가속 명령줄 경로가 Linux를 중심으로 구성됨 |
| CUDA | CUDA 13 | 문서화된 설정 경로에 필요 |
| 시스템 RAM | 전체 체크포인트를 수용할 수 있는 용량 | 호스트 메모리에 상주 전문가 가중치를 저장 |
| 인터커넥트 | PCIe 5.0 x16 권장 | 더 빠른 전송으로 캐시 누락 및 프리필 지연 노출 감소 |
| API 계층 | OpenAI 호환 또는 Anthropic 호환 | 로컬 클라이언트와 에이전트가 익숙한 워크플로를 재사용할 수 있음 |
RTX 5090 벤치마크 및 실제 워크로드
2026년 평가에서는 수학, 코딩 에이전트, 네이티브 프로토콜 및 이메일/캘린더 워크로드에서 디코드 처리량과 첫 토큰 생성 시간을 측정합니다. 에이전트는 컨텍스트를 반복적으로 변경하고 도구를 호출하며 새로운 요청을 보내기 때문에 이는 중요합니다. 짧은 단일 프롬프트로는 동일한 프리필 및 캐시 동작을 확인할 수 없습니다.
RTX 5090에서 FreeToken은 테스트된 워크로드 전반에서 Qwen3.6-35B-A3B로 초당 약 77–83토큰, DeepSeek-V4-Flash로 초당 약 22–25토큰을 지속적으로 생성했습니다. 가장 강력한 지원 대안과 비교한 보고된 성능 향상은 모델과 시나리오에 따라 약 1.5배에서 2.3배였습니다.
| 모델 | 총 파라미터 | 활성 파라미터 | RTX 5090 결과 |
|---|---|---|---|
| Qwen3.6-35B-A3B | 35B | 3B | 약 77–83 tok/s |
| DeepSeek-V4-Flash | 284B | 약 13B | 약 22–25 tok/s |
| GLM-5.2 | 753B | 40B | RTX 5090이 아닌 RTX PRO 6000에서 테스트 |
| Qwen3.6 노트북 빌드 | 35B | 3B | RTX 4060 결과: 39.3 tok/s |
RTX 5090의 결과는 모델이 GPU에서 사용 가능한 VRAM보다 클 때 가장 강력합니다. FreeToken의 공유 LRU 캐시는 토큰 사이의 라우팅 지역성을 따르며, 대역폭 정책은 캐시에서 누락된 전문가를 어떤 방식으로 제공할지 결정합니다.
평가에 따르면 테스트된 RTX 5090 제공 용량에서 FreeToken의 캐시 누락률은 **Qwen3.6 전문가 읽기의 약 16%, DeepSeek-V4-Flash 읽기의 약 39%**였습니다. 동일하게 재생된 추적 데이터에서 비교 대상 배치 방식은 더 높은 누락률을 보였습니다.
장시간 실행되는 에이전트에서는 단일 요청의 최고 토큰 속도보다 안정적인 생성과 최악의 대기 시간 단축이 더 중요할 수 있습니다. 테스트된 RTX 5090 환경에서 FreeToken의 보고된 최장 턴은 44초 미만이었습니다.
| 워크로드 | 테스트하는 항목 | RTX 5090 결과가 중요한 이유 |
|---|---|---|
| 수학 추론 | 도구 사용이 제한된 긴 디코드 | 지속적인 토큰 생성 측정 |
| 코딩 에이전트 | 저장소 접근 및 반복적인 도구 호출 | 컨텍스트 재사용과 캐시 안정성 테스트 |
| 네이티브 프로토콜 코딩 | 서브에이전트 및 56k–65k 토큰 세션 | 긴 컨텍스트 프리필 동작 노출 |
| 이메일/캘린더 에이전트 | 13개의 고정 사용자 턴 | 반복적인 멀티턴 제공 테스트 |
FreeToken이 RTX 5090을 활용하는 방식
FreeToken은 메모리를 계층 구조로 구성합니다. 호스트에 상주하는 전문가 풀에는 라우팅된 전체 전문가 가중치가 저장되고, 비전문가 가중치는 GPU에 남아 있습니다. 남은 VRAM은 공유 전문가 캐시가 되며, 세션 변화에 따라 서로 다른 방식으로 분할할 수 있습니다.
프리필 중에는 메모리가 허용하는 경우 런타임이 전체 레이어 이중 버퍼링을 사용합니다. GPU가 한 레이어를 처리하는 동안 다음 레이어의 전문가는 PCIe를 통해 이동할 수 있습니다. 이를 통해 활성 연산 뒤에 전송 비용의 일부를 숨길 수 있습니다. 디코드 중에는 런타임이 공유 LRU 캐시를 사용해 최근 라우팅 결정으로 선택된 전문가를 추적합니다.
캐시 누락은 하나의 고정된 작업으로 처리되지 않습니다. FreeToken은 다음과 같은 방식으로 분할을 추정합니다.
- GPU 캐시 로드: 누락된 전문가를 PCIe를 통해 전송하고 재사용을 위해 보관합니다.
- CPU 직접 실행: 가중치가 이미 상주한 위치에서 전문가를 처리합니다.
- 동시 실행: 두 경로가 모두 현재 토큰 처리에 기여하도록 합니다.
이 분할은 측정된 호스트 대역폭과 PCIe 대역폭에 따라 달라집니다. PCIe 연결이 강력한 데스크톱은 더 많은 GPU 캐시 로드를 선호할 수 있으며, 호스트 메모리 대역폭이 더 높은 시스템은 CPU에서 직접 더 많은 작업을 수행할 수 있습니다.
FreeToken 테스트 전 확인 사항:
- Linux, x86-64, NVIDIA, CUDA 13 및 최신 드라이버 호환성 확인
- 호스트에 상주하는 전체 체크포인트에 필요한 시스템 RAM 용량 계산
- 지원되는 MoE 모델과 공식 저정밀도 형식 선택
- 컨텍스트 증가 및 기타 애플리케이션을 위해 VRAM 여유 공간 확보
- 초당 토큰 수, 첫 토큰 생성 시간, 모델, 양자화 및 하드웨어 기록
모델 형식, 시스템 RAM, PCIe 링크, 컨텍스트 길이, 클라이언트 및 워크로드를 기록하세요. 이러한 변수가 문서화되어 있으면 결과를 더 쉽게 해석할 수 있습니다.
| 최적화 | 단계 | 실제 효과 |
|---|---|---|
| 전체 레이어 이중 버퍼링 | 프리필 | 전문가 전송과 GPU 연산을 중첩 |
| 공유 LRU 전문가 캐시 | 디코드 | 최근 라우팅된 전문가를 VRAM에서 추적 |
| 대역폭 적응형 분할 | 디코드 | PCIe 경로와 CPU 경로 사이에 누락 작업 분배 |
| 시맨틱 체크포인트 | 에이전트 턴 | 변경되지 않은 컨텍스트 접두사 재사용 |
| 탄력적 캐시 크기 조정 | 런타임 | 엔진을 재시작하지 않고 VRAM 할당 조정 |
런타임은 스케줄러의 안전 지점에서 동적 재구성도 지원합니다. 호스트 메모리가 계속해서 기준 저장소 역할을 하므로 GPU 캐시 용량을 변경해도 모델의 정확성이 아니라 성능에 영향을 줍니다. 브라우저, 데스크톱 애플리케이션 및 기타 GPU 워크로드로 사용 가능한 VRAM 예산이 달라질 수 있는 개인용 컴퓨터에서 유용한 기능입니다.
FreeToken과 다른 로컬 런타임 비교
FreeToken은 llama.cpp, Ollama 또는 KTransformers를 모든 상황에서 대체하는 범용 도구가 아닙니다. FreeToken의 강점은 전문화에서 나옵니다. 이 프로젝트는 대규모 MoE 체크포인트, NVIDIA 가속, 호스트 상주 전문가 및 에이전트형 서비스에 초점을 맞춥니다.
Llama.cpp는 CPU, NVIDIA, AMD 및 Apple Silicon 경로를 포함해 더 폭넓은 하드웨어와 운영체제를 지원합니다. 또한 대규모 GGUF 생태계와 높은 성숙도를 갖추고 있습니다. Ollama는 접근하기 쉬운 로컬 모델 관리를 강조하며, KTransformers는 지원되는 모델 계열을 대상으로 CPU-GPU 하이브리드 실행을 지향합니다.
최적의 선택은 모델이 VRAM에 들어가는지, 그리고 워크로드가 대화형인지 에이전트형인지에 따라 달라집니다.
FreeToken 선택
NVIDIA GPU와 충분한 시스템 RAM이 있고, VRAM을 초과하는 대규모 MoE 모델을 사용합니다.
llama.cpp 선택
폭넓은 하드웨어 지원, 성숙한 생태계 또는 VRAM에 여유 있게 들어가는 모델이 필요합니다.
Ollama 선택
전문화된 MoE 스케줄링보다 간단한 로컬 워크플로와 지원되는 모델 관리 기능을 우선시합니다.
KTransformers 평가
모델과 하드웨어가 하이브리드 실행 경로에 적합하고 직접 비교를 원합니다.
동일한 체크포인트, 양자화 방식, 프롬프트 기록, 클라이언트 및 컨텍스트 길이를 사용해 런타임을 비교하세요. VRAM에 전체가 들어가는 더 작은 모델을 사용하면 비교 결과가 왜곡될 수 있습니다.
| 시나리오 | 권장 방향 | 이유 |
|---|---|---|
| 대규모 MoE가 VRAM 초과 | FreeToken | 적응형 전문가 제공을 위해 설계됨 |
| 모델이 VRAM에 완전히 들어감 | 성숙한 GPU 런타임 모두 가능 | 호스트에서 GPU로의 이동이 덜 중요함 |
| Apple Silicon 시스템 | 다른 런타임 고려 | 이에 상응하는 FreeToken 경로가 강조되지 않음 |
| 폭넓은 CPU 또는 AMD 지원 | llama.cpp 또는 다른 범용 런타임 | FreeToken의 가속 경로는 NVIDIA 중심임 |
| 장시간 코딩 에이전트 세션 | FreeToken 평가 권장 | 접두사 재사용과 캐시 지역성이 중요해짐 |
기술적인 세부 사항은 arXiv의 FreeToken 연구 논문과 저자들이 flashml.ai에서 참조한 프로젝트 릴리스를 확인하세요. 프로젝트가 발전함에 따라 지원 모델, 구현 변경 사항 및 배포 지침을 확인할 때 이 링크들이 가장 신뢰할 수 있는 근거를 제공합니다.
FreeToken RTX 5090 FAQ
Q: RTX 5090에서 FreeToken이란 무엇인가요?
FreeToken은 RTX 5090 VRAM, 시스템 RAM, CPU 실행 및 PCIe 전송을 조율해 대규모 혼합 전문가 모델을 제공하는 로컬 추론 런타임입니다. 모델 자체가 아니라 모델을 실행하기 위한 소프트웨어입니다.
Q: RTX 5090에서 FreeToken은 얼마나 빠른가요?
2026년 평가에서는 테스트된 워크로드 전반에서 Qwen3.6-35B-A3B가 초당 약 77–83토큰, DeepSeek-V4-Flash가 초당 약 22–25토큰을 기록한 것으로 보고되었습니다. 결과는 모델 형식, 컨텍스트, 호스트 메모리 및 워크로드에 따라 달라집니다.
Q: RTX 5090에 DeepSeek-V4-Flash 전체 모델을 저장할 수 있나요?
아니요. 활성 연산은 GPU에서 실용적으로 처리할 수 있지만, 전체 전문가 풀은 VRAM보다 훨씬 큽니다. FreeToken은 나머지 부분을 시스템 메모리에 저장하고 필요에 따라 전문가를 이동하거나 실행합니다.
Q: 모든 설정에서 FreeToken이 llama.cpp보다 나은가요?
아니요. FreeToken은 VRAM을 초과하는 대규모 MoE 모델, 특히 장시간 실행되는 에이전트에 특화되어 있습니다. Llama.cpp는 더 폭넓고 성숙하며 다양한 하드웨어와 GPU 메모리에 전체가 들어가는 모델에 더 적합합니다.
런타임을 전환하기 전에 자신의 모델과 에이전트 워크플로를 직접 벤치마크하세요. RTX 5090의 이점은 워크로드에 따라 달라지며, 시스템 RAM과 PCIe 동작이 결과를 크게 바꿀 수 있습니다.