- FreeToken 설치에는 지원되는 CUDA 호환 GPU, 호스트 메모리, 스토리지 및 호환 가능한 런타임 환경이 필요합니다.
- 출시 위치: 이 시스템은 공식 FlashML 프로젝트 채널을 통해 출시될 예정입니다.
- 핵심 설정: 모델 가중치, 호스트 상주 전문가 저장 공간, GPU 캐시 공간 및 측정된 대역폭 값을 준비하세요.
- 중요한 제한 사항: 제공된 참고 자료에는 바로 복사해 사용할 수 있는 설치 명령이 공개되어 있지 않습니다.
- 권장 사항: 모델 가중치를 변환하거나 엔진을 실행하기 전에 최신 출시 지침을 확인하세요.
FreeToken 설치: 시스템 요구 사항
FreeToken은 대규모 Mixture-of-Experts (MoE) 모델을 위한 엣지 네이티브 서빙 시스템입니다. 게임, 다운로드 가능한 캐릭터 타이틀 또는 교환 코드 서비스가 아닙니다. 따라서 설치 과정은 GPU 추론, 호스트 메모리, CUDA 지원, 모델 스토리지 및 런타임 구성에 중점을 둡니다.
공개된 설계는 전체 전문가 풀이 사용 가능한 VRAM을 초과할 수 있는 개인용 컴퓨터, 워크스테이션 및 노트북을 대상으로 합니다. FreeToken은 라우팅된 전체 전문가 풀을 호스트 메모리에 유지하면서 GPU 메모리를 탄력적인 전문가 캐시로 사용합니다. 비전문가 가중치는 GPU에 남아 있으며, 다른 애플리케이션이 VRAM을 사용하거나 반환함에 따라 캐시 용량이 변경될 수 있습니다.
FreeToken을 원클릭 애플리케이션이 아니라 시스템 배포로 취급하세요. 런타임 스케줄링은 실제 머신에 따라 달라지므로 하드웨어 프로파일링, 모델 준비 및 메모리 계획이 설정 과정에 포함됩니다.
GPU 등급
개별 CUDA 호환 GPU가 주요 실행 경로를 제공합니다. 참고 평가에는 8GB 노트북 GPU부터 워크스테이션급 하드웨어까지 포함됩니다.
호스트 메모리
시스템 메모리는 전체 전문가 풀을 저장하며, GPU 캐시 누락이 발생할 때 CPU 측 전문가 실행에 필요한 대역폭을 제공합니다.
고속 스토리지
NVMe 스토리지는 시작 과정에서 중요합니다. FreeToken은 준비된 가중치를 최종 호스트 레이아웃에 직접 로드할 수 있습니다.
가장 중요한 구분은 용량과 성능 사이의 차이입니다. 전체 모델이 VRAM에 완전히 들어갈 필요는 없지만, 호스트는 전문가 풀을 보관하고 허용 가능한 지연 시간을 위해 충분한 전송 대역폭을 제공해야 합니다.
| 리소스 | FreeToken에서의 역할 | 설정 우선순위 |
|---|---|---|
| GPU VRAM | 비전문가 가중치, KV 캐시 및 탄력적 전문가 슬롯 저장 | 높음 |
| 호스트 메모리 | 라우팅된 전체 전문가 풀 보관 | 높음 |
| PCIe 링크 | 선택된 전문가를 GPU 캐시로 이동 | 높음 |
| CPU 대역폭 | 호스트 메모리에서 누락된 잔여 전문가 실행 | 높음 |
| NVMe 스토리지 | 시작 중 모델 데이터 로드 | 중간 |
| CUDA 환경 | GPU 커널 및 캡처된 실행 경로 지원 | 높음 |
참고 시스템은 사양표상의 가정보다 하드웨어 균형이 더 중요하다고 보고합니다. PCIe 대역폭이 제한된 노트북은 더 많은 CPU 실행을 선호할 수 있으며, GPU 전송 대역폭이 더 강한 데스크톱은 더 많은 캐시 슬롯을 채우는 방식의 이점을 얻을 수 있습니다.
FreeToken 설치 전 준비 사항
런타임을 확보하기 전에 머신과 모델 자산을 준비하세요. 공개된 시스템은 FreeToken Weight (FTW) 형식이라고 하는 정규화된 전문가 레이아웃을 사용합니다. 이 형식은 논리적인 레이어–전문가 식별자를 기준으로 전문가 뱅크를 구성하여 CPU 실행기와 GPU 캐시가 동일한 매핑을 사용할 수 있도록 합니다.
제공된 참고 자료에는 범용 변환 명령이나 패키지 관리자 지침이 없습니다. 다른 추론 엔진의 명령을 임의로 만들어 사용하지 마세요. 대신 공식 FreeToken 프로젝트 출시 채널과 연결된 최신 출시 문서가 제공되면 해당 문서를 사용하세요.
llama.cpp, Ollama 또는 다른 서빙 엔진에서 복사한 명령은 필요한 FTW 레이아웃을 생성하지 못하거나 FreeToken의 캐시 및 대역폭 정책을 올바르게 구성하지 못할 수 있습니다.
다음 준비 표를 사용하여 배포를 정리하세요.
| 준비 영역 | 확인할 사항 | 중요한 이유 |
|---|---|---|
| GPU | CUDA 호환 아키텍처 및 충분한 여유 VRAM | 캐시 크기와 커널 호환성 결정 |
| 메모리 | 전체 호스트 전문가 풀을 수용할 수 있는 충분한 용량 | 페이징 및 불안정한 실행 방지 |
| 스토리지 | 선택한 체크포인트와 FTW 파일을 위한 NVMe 용량 | 모델 로딩 시간 단축 |
| 드라이버 | 현재 호환 가능한 NVIDIA 드라이버 및 CUDA 스택 | GPU 실행 및 그래프 지원 활성화 |
| 모델 | 지원되는 MoE 체크포인트 및 정밀도 변형 | 전문가 크기와 메모리 요구량 결정 |
| 워크로드 | 프롬프트 길이, 에이전트 턴 수 및 예상 디코드 속도 | KV 캐시 및 프리필 부하에 영향 |
FreeToken의 설계는 다음과 같은 중요한 런타임 동작을 지원합니다.
- 전체 레이어 더블 버퍼링은 프리필 중 전문가 전송과 GPU 계산을 겹쳐 실행합니다.
- 시맨틱 인식 상태 캐싱은 사고 블록, 도구 호출 및 대화 턴 주변의 유용한 접두사를 보존합니다.
- 공유 LRU 전문가 캐싱은 디코드 중 변화하는 토큰 수준 라우팅을 따라갑니다.
- 대역폭 적응형 실행은 캐시 누락을 PCIe 전송과 직접적인 CPU 실행으로 나눕니다.
- 탄력적 캐시 재구성은 엔진을 재시작하지 않고 스케줄러가 안전한 지점에서 GPU 전문가 캐시 예산을 변경합니다.
첫 배포에서는 단일 모델과 제어된 워크로드를 사용하세요. 여러 대형 체크포인트를 동시에 테스트하면 호스트 메모리 및 스토리지 요구 사항과 런타임 문제를 구분하기 어려워질 수 있으므로 피하는 것이 좋습니다.
| 배포 선택 | 위험이 낮은 시작점 | 수요가 높은 선택지 |
|---|---|---|
| 모델 크기 | 더 작은 지원 MoE 체크포인트 | 프런티어급 MoE 체크포인트 |
| 정밀도 | 문서화된 지원이 있는 공식 정밀도 | 특수 양자화 레이아웃 |
| 워크로드 | 짧은 단일 세션 테스트 | 다중 턴 에이전트 워크로드 |
| 캐시 정책 | 기본 측정 구성 | 수동으로 조정한 메모리 분할 |
| 호스트 실행 | 최소한의 CPU 누락 처리 | 적극적인 CPU–GPU 하이브리드 실행 |
단계별 FreeToken 설정
다음 단계를 순서대로 따르세요. 이 순서는 환경 준비를 모델 변환 및 런타임 튜닝과 분리하므로 문제를 더 쉽게 진단할 수 있습니다.
먼저 호스트를 준비하고, 두 번째로 GPU 스택을 확인하며, 세 번째로 모델을 스테이징하세요. 기본 요청이 성공한 후에만 서빙 캐시를 조정하세요.
호스트 환경 준비
메모리를 많이 사용하는 애플리케이션을 닫고 GPU, CPU, 호스트 메모리 및 NVMe 스토리지를 서빙에 사용할 수 있는지 확인하세요. 전체 VRAM, 시스템 메모리, GPU 모델, PCIe 링크 폭 및 드라이버 또는 CUDA 버전을 기록하세요. FreeToken은 변화하는 엣지 리소스를 위해 설계되었지만, 깨끗한 기준 환경을 마련하면 첫 테스트의 신뢰성이 높아집니다.
공식 런타임 확보
FlashML의 FreeToken 출시와 함께 게시된 최신 설치 지침을 사용하세요. 설치하기 전에 지원되는 운영 체제, CUDA 버전, Python 또는 네이티브 종속성 및 모델 호환성을 확인하세요. 참고 자료에는 출시 위치가 명시되어 있지만 고정된 명령 시퀀스는 제공되지 않습니다.
지원되는 MoE 체크포인트 스테이징
승인된 배포 채널을 통해 모델 파일을 다운로드하고 체크포인트가 런타임에서 지원하는 전문가 표현과 일치하는지 확인하세요. 원본 체크포인트와 변환된 FTW 파일을 저장할 수 있도록 충분한 스토리지를 확보하세요. 일반 모델 파일이 이미 FreeToken의 최적화된 레이아웃으로 구성되어 있다고 가정하지 마세요.
FTW 레이아웃 생성 또는 확보
FreeToken Weight 파일을 변환하거나 다운로드하는 방법은 출시 문서를 따르세요. FTW는 런타임이 예상하는 레이아웃으로 전문가 뱅크를 저장하므로 호스트 메모리로 정렬된 직접 읽기가 가능하고 시작 중 반복적인 텐서 검색이나 재패킹을 방지합니다.
제어된 테스트 실행
하나의 요청과 짧은 프롬프트로 시작하세요. 호스트 전문가 풀이 로드되고, GPU가 초기화되며, 첫 요청이 완료되고, 라우팅된 전문가가 호스트 메모리와 GPU 캐시 사이를 이동할 수 있는지 확인하세요. 그 후에야 긴 컨텍스트, 도구 호출 또는 동시 에이전트 세션을 테스트하세요.
초기 검증은 최고 처리량보다 기능에 중점을 두어야 합니다. 런타임이 콜드 캐시 상태에서 요청을 처리할 수 있는지 확인하세요. FreeToken은 설계상 별도의 워밍업 단계가 필요하지 않으며, 초기 요청이 일반 실행을 통해 캐시를 채울 수 있습니다.
| 검증 항목 | 예상 결과 | 실패할 경우 |
|---|---|---|
| 모델 검색 | 선택한 체크포인트 또는 FTW 자산이 인식됨 | 모델 형식 및 출시 호환성 재확인 |
| 호스트 로딩 | 전문가 데이터가 호스트 상주 풀에 도달함 | 메모리 용량, 파일 경로 및 권한 확인 |
| GPU 시작 | 비전문가 레이어와 런타임 상태가 초기화됨 | CUDA, 드라이버 및 VRAM 가용성 확인 |
| 첫 요청 | 콜드 캐시 추론이 완료됨 | 전송, 커널 및 CPU 백엔드 로그 점검 |
| 반복 디코드 | 최근 사용된 전문가가 캐시 적중을 생성하기 시작함 | 캐시 할당 및 라우팅 지원 확인 |
FreeToken 성능 및 메모리 튜닝
FreeToken의 핵심 튜닝 개념은 호스트 측 대역폭과 PCIe 전송 대역폭의 관계입니다. 런타임은 다음 두 값을 측정하거나 프로파일링합니다.
- Bₚ: PCIe를 통한 고정 전문가 전송 대역폭.
- Bₕ: CPU 전문가 실행에 사용할 수 있는 유효 호스트 측 대역폭.
m개의 누락된 전문가가 있는 디코드 단계에서 시스템은 다음 관계를 사용하여 캐시 채우기 수를 추정합니다.
q* ≈ m × Bₚ / Bₕ
이는 사용자에게 제공되는 보장이나 고정된 하드웨어 규칙이 아닙니다. 동시 GPU 캐시 채우기와 CPU 실행의 균형을 맞추는 스케줄링 모델입니다. 적절한 분할은 노트북, 데스크톱, PCIe 구성, 메모리 채널 및 백그라운드 부하에 따라 달라집니다.
광고된 PCIe 또는 메모리 사양에만 의존하지 말고 배포된 머신에서 측정한 대역폭을 사용하세요. FreeToken의 스케줄링 정책은 실제로 모델을 실행하는 하드웨어를 반영하도록 설계되었습니다.
GPU 메모리 예산도 계획해야 합니다. FreeToken은 사용 가능한 VRAM을 KV 캐시와 전체 전문가 슬롯 사이에 나눕니다. 더 긴 컨텍스트는 KV 캐시 요구량을 증가시키지만, 더 큰 전문가 캐시는 디코드 누락을 줄일 수 있습니다. 시스템은 안전한 지점에서 전문가 캐시를 재구성할 수 있으므로 이 균형을 전체 세션 동안 고정할 필요는 없습니다.
프리필
전송 중첩과 접두사 재사용을 우선하세요. 긴 프롬프트는 전문가 이동 및 재계산 비용을 드러냅니다.
디코드
라우팅 지역성과 공유 LRU 캐시를 우선하세요. 정적인 배치보다 최근 전문가 사용 패턴이 더 유용합니다.
에이전트 워크로드
도구 호출 및 편집된 컨텍스트 블록 주변의 시맨틱 체크포인트를 보존하세요.
공유 데스크톱
브라우저, 디스플레이, 게임 및 기타 애플리케이션을 위해 VRAM 여유 공간을 남겨 두세요.
참고 평가 결과는 보장된 성능으로 간주하지 않고도 유용한 규모 지표를 제공합니다. RTX 5090 테스트 시스템에서 FreeToken은 테스트된 워크로드 전반에서 Qwen3.6-35B에 대해 초당 77–83토큰, DeepSeek-V4-Flash에 대해 초당 22–25토큰을 보고했습니다. 결과는 모델 정밀도, 캐시 용량, 호스트 대역폭, 프롬프트 길이 및 백그라운드 애플리케이션에 따라 달라집니다.
| 튜닝 목표 | 실용적인 조치 | 절충점 |
|---|---|---|
| 더 빠른 첫 토큰 | 준비된 모델 레이아웃 및 전송 중첩 활성화 | 올바른 스테이징과 충분한 스토리지 필요 |
| 더 높은 디코드 속도 | 유용한 전문가 캐시 용량 증가 | KV 캐시에 사용할 VRAM 감소 |
| 더 긴 컨텍스트 | KV 페이지에 더 많은 VRAM 할당 | 전문가 캐시 누락 증가 가능 |
| 더 나은 누락 처리 | 측정값에 기반한 CPU–GPU 협력 허용 | 호스트 대역폭과 CPU 리소스 사용 |
| 더 안정적인 데스크톱 사용 | 서빙 메모리 예산 감소 | 캐시 적중률 저하 가능 |
설치 체크리스트 및 문제 해결
기본 테스트에서 운영 환경과 유사한 로컬 엔드포인트 또는 에이전트 워크로드로 넘어가기 전에 이 체크리스트를 사용하세요.
테스트가 느릴 때 설정을 변경하기 전에 병목이 스토리지 로딩, 프리필 전송, 디코드 누락, CPU 대역폭 또는 부족한 KV 캐시 중 어디에 있는지 확인하세요.
배포 준비 상태:
- GPU, 드라이버, CUDA 환경 및 사용 가능한 VRAM 확인
- 전체 전문가 풀을 수용할 수 있도록 충분한 호스트 메모리 확보
- 지원되는 MoE 체크포인트와 문서화된 FTW 레이아웃 사용
- 장시간 에이전트 세션을 테스트하기 전에 콜드 캐시 요청 하나 실행
- 튜닝을 위해 측정된 PCIe 및 호스트 측 대역폭 기록
| 증상 | 가능성이 높은 영역 | 첫 번째 대응 |
|---|---|---|
| 시작 시간이 너무 김 | 스토리지 또는 준비되지 않은 가중치 레이아웃 | 문서화된 FTW 경로와 빠른 로컬 스토리지 사용 |
| 프리필 중 GPU가 유휴 상태임 | 전송과 계산이 직렬화됨 | 전체 레이어 더블 버퍼링이 활성화되었는지 확인 |
| 디코드가 CPU에 치우침 | 누락이 너무 많거나 호스트 대역폭이 제한됨 | 캐시 크기와 측정된 대역폭 균형 검토 |
| 장시간 세션이 느려짐 | KV 캐시가 기존 전문가 예산을 소모함 | 안전한 런타임 지점에서 VRAM 재균형 |
| 런타임이 모델을 처리하지 못함 | 지원되지 않는 표현 또는 부족한 호스트 메모리 | 출시 문서의 모델 및 플랫폼 매트릭스 확인 |
| 데스크톱이 불안정해짐 | 다른 애플리케이션이 VRAM을 사용함 | 백그라운드 워크로드를 닫거나 서빙 할당량 축소 |
FreeToken의 폴백 동작도 중요합니다. 운영 체제 또는 드라이버 제한으로 인해 전체 전문가 풀을 고정하거나 DMA에 등록할 수 없는 경우 런타임은 순수 CPU MoE 백엔드를 사용할 수 있습니다. 이는 배포 가능성을 높이지만 더 빠른 전송 경로를 포기해야 합니다. 비전문가 레이어는 GPU에 유지하면서 활성화 크기의 입력, 라우팅 메타데이터 및 출력은 디바이스 경계를 넘어 이동할 수 있습니다.
짧은 프롬프트 하나만으로 설치 품질을 판단하지 마세요. 프리필과 디코드는 시스템의 서로 다른 부분에 부하를 주며, 다중 턴 에이전트 세션은 컨텍스트 처리를 반복해서 추가합니다. 유용한 테스트 계획에는 짧은 요청 하나, 긴 프롬프트 하나, 반복 디코드 및 컨텍스트 편집 워크로드가 포함됩니다.
FreeToken 설치 FAQ
Q: FreeToken은 게임 또는 교환 코드 플랫폼인가요?
아니요. FreeToken은 엣지 네이티브 MoE 모델 서빙 시스템입니다. 설치에는 GPU 추론, 호스트 메모리, 모델 파일, CUDA 지원 및 런타임 구성이 필요합니다.
Q: FreeToken 설치 프로그램 또는 출시 패키지는 어디에서 받아야 하나요?
공개된 프로젝트 설명은 FlashML에서 이 시스템을 발표합니다. 참고 자료에는 고정된 런처 명령이 없으므로 패키지 이름, 종속성 및 명령은 https://flashml.ai/의 최신 공식 출시 문서를 사용하세요.
Q: 모든 모델 가중치가 VRAM에 들어가야 하나요?
아니요. FreeToken은 라우팅된 전체 전문가 풀을 호스트 메모리에 유지하고 GPU 메모리를 탄력적인 전문가 캐시로 사용합니다. 다만 VRAM에는 비전문가 가중치, 런타임 상태, KV 캐시 페이지 및 캐시된 전문가가 저장되어야 합니다.
Q: FreeToken에 대역폭 프로파일링이 필요한 이유는 무엇인가요?
디코드 누락은 GPU로 전송하거나 CPU에서 직접 실행할 수 있습니다. FreeToken은 측정된 PCIe 및 호스트 측 대역폭을 사용하여 두 경로 사이의 실용적인 분할을 선택합니다.
2026년 출시가 진행됨에 따라 설치 세부 사항이 변경될 수 있습니다. 변환 또는 서빙 명령을 실행하기 전에 공식 패키지, 지원되는 모델 형식 및 플랫폼 요구 사항을 확인하세요.