FreeToken github: 로컬 MoE 설정 가이드 및 벤치마크 - 가이드

FreeToken github: 로컬 MoE 설정 가이드 및 벤치마크

FreeToken GitHub 프로젝트, 로컬 MoE 추론 기능, 설치 경로, 하드웨어 요구 사항, 벤치마크 및 실용적인 설정 팁을 살펴보세요.

2026-08-25
FreeToken 위키 팀
빠른 가이드
  • FreeToken github: 공식 저장소에서 프로젝트 개요, 설치 경로, 인용 정보 및 Apache 2.0 라이선스를 확인할 수 있습니다.
  • 주요 용도: FreeToken은 사용 가능한 GPU VRAM을 초과하는 대규모 Mixture-of-Experts 모델을 대상으로 합니다.
  • 핵심 장점: 적응형 CPU–GPU 실행, 전문가 캐싱 및 전송과 연산의 중첩을 통해 하드웨어 유휴 시간을 줄입니다.
  • 가장 적합한 환경: 충분한 호스트 메모리와 지원되는 CUDA 가속 기능을 갖춘 Nvidia Linux 시스템입니다.
  • 중요한 한계: FreeToken은 하드웨어 활용도를 높이지만 모델의 전체 메모리 요구 사항을 없애지는 않습니다.

FreeToken github 저장소 개요

FreeToken github은 개인용 및 소비자용 하드웨어에서 프런티어급 오픈 웨이트 Mixture-of-Experts 모델을 실행하도록 설계된 엣지 네이티브 추론 엔진의 공개 저장소입니다. 이 프로젝트는 GPU 메모리, 시스템 RAM, CPU 연산 성능 및 인터커넥트 대역폭을 하나의 유연한 서빙 플랫폼으로 결합하며, GPU를 고립된 장치로만 취급하지 않습니다.

공식 FreeToken GitHub 저장소에서는 프로젝트 설명, 데스크톱 애플리케이션 방향, CLI 설치 안내, 연구 인용 정보, 감사의 글 및 라이선스 정보를 제공합니다. 또한 논문, 개발자 Slack, 커뮤니티 Discord 및 커뮤니티 WeChat 채널로 연결되는 링크도 제공합니다.

영상 하이라이트:

  • FreeToken은 GPU 메모리에 완전히 들어가지 않는 대규모 MoE 모델을 위해 설계되었습니다.
  • 적응형 전문가 캐싱을 사용하면 자주 사용되는 모델 구성 요소를 GPU에 더 가깝게 유지할 수 있습니다.
  • 에이전트 워크로드에서는 반복적인 도구 호출 중 컨텍스트 재계산이 줄어드는 이점을 얻을 수 있습니다.
  • 이 프로젝트는 특화된 엔진이며 모든 로컬 추론 런타임을 대체하는 범용 솔루션은 아닙니다.

엣지 네이티브 런타임

FreeToken은 대규모 모델 서빙을 위해 GPU, CPU, 호스트 메모리 및 인터커넥트를 조정합니다.

MoE 특화

이 엔진은 각 토큰마다 선택된 전문가만 활성화되는 희소 전문가 모델에 초점을 맞춥니다.

에이전트 컨텍스트 재사용

시맨틱 앵커 체크포인트를 사용해 도구 호출과 컨텍스트 수정 이후의 불필요한 재계산을 줄입니다.

저장소 활용 팁

공식 저장소와 연결된 빠른 시작 문서부터 확인하세요. 시스템을 구성하기 전에 최신 설치 지침을 검증하려면 GitHub 페이지를 확인하는 것이 가장 좋습니다.

FreeToken이 대규모 MoE 모델을 처리하는 방식

Mixture-of-Experts 모델은 전체 파라미터 수가 매우 많더라도 각 토큰에 대해 더 적은 수의 전문가만 활성화할 수 있습니다. 이러한 희소 실행 방식은 프런티어급 로컬 추론을 더욱 현실적으로 만들어 주지만, 전체 체크포인트는 여전히 어딘가에 저장되어 있어야 합니다.

FreeToken은 여러 런타임 전략을 조율하여 이 문제에 대응합니다. 대역폭 적응형 CPU–GPU 공동 실행 정책은 특정 연산을 CPU에 유지할지 GPU로 이동할지를 판단합니다. 이 결정은 고정된 하드웨어 분할이 아니라 실제 시스템 상태에 따라 이루어집니다.

런타임 기능실제 역할가장 적합한 사용 시나리오
대역폭 적응형 실행사용 가능한 대역폭에 따라 CPU 또는 GPU 작업을 선택합니다CPU, RAM, GPU 및 PCIe 성능이 혼합된 시스템
전문가 캐싱자주 선택되는 전문가를 VRAM에서 사용 가능한 상태로 유지합니다생성 중 전문가 선택 패턴이 반복되는 경우
더블 버퍼 스트리밍레이어 준비와 현재 연산을 중첩합니다가중치가 VRAM 외부에 있는 대규모 모델
시맨틱 앵커 체크포인트변경되지 않은 컨텍스트와 반복 상태를 재사용합니다코딩 에이전트 및 다중 턴 도구 워크플로
FTW 가중치 형식프로젝트의 빠른 가중치 처리 경로를 지원합니다지원되는 FreeToken 모델 배포

이 프로젝트는 전역 LRU 전문가 캐싱도 사용합니다. 실제로는 자주 필요한 전문가를 더 빠른 메모리 계층에 유지하고, 덜 유용한 항목을 교체할 수 있습니다. 모델의 전체 가중치가 시스템 메모리에 일부 저장되는 경우 특히 유용한 방식입니다.

더블 버퍼 프리필 스트리밍은 GPU가 이미 수행 중인 작업 뒤에 전송 지연을 숨기려고 시도합니다. 전송에는 여전히 대역폭이 필요하지만, 전송과 연산을 중첩하면 사용자가 체감하는 대기 시간을 줄일 수 있습니다. 프롬프트가 길어지고 에이전트가 작업 컨텍스트를 반복적으로 업데이트할수록 이 접근 방식의 중요성은 커집니다.

메모리 현실 점검

FreeToken은 대규모 체크포인트가 사용 가능한 VRAM만 차지하도록 만들어 주지 않습니다. VRAM에 남길 수 없는 나머지 가중치를 지원하려면 선택한 모델에 맞는 충분한 시스템 RAM, 저장 공간 및 메모리 대역폭이 여전히 필요합니다.

공식 프로젝트 설명에서는 그래프 호환 실행과 시맨틱 인식 캐싱도 강조합니다. 이러한 기능은 파일을 읽고, 도구를 호출하고, 결과를 받은 뒤 후속 요청을 제출하는 코딩 에이전트처럼 프롬프트가 점진적으로 변경되는 워크로드를 대상으로 합니다.

워크로드FreeToken이 도움을 줄 수 있는 이유주요 고려 사항
짧은 단일 프롬프트효율적인 생성으로 처리량이 향상될 수 있습니다이미 VRAM에 들어가는 모델이라면 성숙한 다른 런타임이 더 적합할 수 있습니다
장시간 코딩 세션턴 사이에 변경되지 않은 컨텍스트를 재사용합니다시작 시간과 메모리 요구 사항은 여전히 상당합니다
도구 호출 에이전트컨텍스트 수정 이후 반복 처리를 줄입니다클라이언트 호환성을 테스트해야 합니다
대규모 MoE 체크포인트호스트 메모리와 GPU 실행을 조정합니다오프로드된 모델 데이터를 시스템 RAM에 저장할 수 있어야 합니다
다중 사용자 서빙OpenAI 호환 및 Anthropic 호환 API 경로를 제공합니다용량은 하드웨어와 워크로드 형태에 따라 달라집니다

FreeToken github 설정 경로

저장소에서는 두 가지 주요 접근 경로를 제시합니다. 하나는 Windows 또는 Linux용 데스크톱 애플리케이션이고, 다른 하나는 uv 또는 pip를 사용하는 명령줄 설치 경로입니다. 현재 가속 CLI 경로는 Linux, x86-64 하드웨어, Nvidia 그래픽, CUDA 13 및 최신 드라이버 환경과 가장 밀접하게 연관되어 있습니다.

첫 설정을 집중적이고 검증 가능한 방식으로 진행하려면 다음 절차를 사용하세요.

1

하드웨어 확인

컴퓨터에 지원되는 Nvidia GPU, x86-64 환경, 충분한 시스템 RAM 및 최신 드라이버 지원이 있는지 확인하세요. VRAM은 전체 메모리 계획의 일부일 뿐이라는 점을 고려해야 합니다.

2

접근 경로 선택

다운로드, 채팅 및 튜닝을 위한 안내형 인터페이스가 필요하다면 FreeToken 데스크톱 애플리케이션을 사용하세요. 터미널 제어, 개발 통합 또는 소스 수준의 사용자 지정을 원한다면 CLI를 선택하세요.

3

런타임 설치

저장소에서는 uv pip install "freetoken[accel]"을 권장 가속 설치 경로로 안내합니다. 가상 환경과 편집 가능한 프로젝트 설치를 사용하는 소스 설치 방법도 문서화되어 있습니다.

4

지원되는 체크포인트 선택

호환되는 Hugging Face 체크포인트를 선택하고 VRAM에 남길 수 없는 가중치를 저장할 충분한 호스트 메모리가 있는지 확인하세요. 저정밀도 버전에 따라 실제 메모리 요구 사항이 달라질 수 있습니다.

5

클라이언트 연결

로컬 서버를 시작하고 지원되는 클라이언트로 문서에 안내된 OpenAI 호환 또는 Anthropic 호환 API 경로를 테스트하세요. 긴 에이전트 세션을 테스트하기 전에 짧은 요청부터 시작하세요.

설정 영역권장 확인 사항일반적인 문제
운영 체제문서화된 가속 CLI 경로에는 Linux 사용데스크톱과 CLI의 지원 범위가 다를 수 있습니다
GPU프로젝트에서 강조하는 Nvidia RTX 30, 40 또는 50 시리즈지원되지 않는 가속기는 의도된 경로를 사용하지 못할 수 있습니다
CUDA최신 드라이버와 CUDA 13 사용버전이 일치하지 않으면 가속이 작동하지 않을 수 있습니다
호스트 메모리오프로드된 가중치와 컨텍스트를 저장할 충분한 RAM대규모 체크포인트는 일반적인 데스크톱 용량을 초과할 수 있습니다
설치uv, pip 또는 소스 기반 설정편집 가능한 설치에는 올바르게 준비된 환경이 필요합니다
설정 권장 사항

먼저 하나의 모델과 하나의 짧은 요청으로 검증하세요. 서버가 안정적으로 응답하면 컨텍스트 길이를 늘리고 에이전트 도구를 활성화한 뒤 실제 워크로드에서 성능을 비교하세요.

성능 기대치 및 비교

FreeToken의 가장 강력한 사용 사례는 GPU에 완전히 들어가지 않는 대규모 MoE 모델입니다. 이러한 상황에서 런타임은 호스트 메모리를 사용하면서 CPU와 GPU 간 작업 분담을 적응형으로 조정할 수 있습니다.

보고된 테스트에서는 RTX 5090에서 Qwen 3.5 35B A3B를 실행했을 때 일부 워크로드에서 초당 약 77–83토큰이 측정되었습니다. 같은 범주의 테스트 환경에서 DeepSeek V4 Flash는 초당 약 22–25토큰으로 보고되었습니다. 이 수치는 프로젝트 관련 테스트에서 나온 결과이므로 보편적인 보장이 아니라 특정 워크로드에 해당하는 결과로 해석해야 합니다.

별도의 커뮤니티 보고 결과에서는 RTX 5080, 64GB 시스템 메모리 및 Ryzen 9 9950X3D를 사용했습니다. 사용자는 Qwen 3.5 35B A3B에서 초당 약 100토큰을 기록했으며, 한 사례에서는 약 110토큰에 도달했다고 보고했습니다. 이는 통제된 벤치마크가 아닌 초기 커뮤니티 결과입니다.

하드웨어 예시모델 또는 워크로드보고된 결과해석
RTX 5090Qwen 3.5 35B A3B초당 약 77–83토큰대규모 MoE 워크로드에서 강력한 결과입니다
RTX 5090DeepSeek V4 Flash초당 약 22–25토큰모델과 워크로드 차이의 영향을 보여 줍니다
RTX 4060 노트북, 8GB VRAMQwen 3.5 35B A3B, 4비트초당 약 39.3토큰사용 가능한 VRAM을 초과하는 가중치를 호스트 메모리에 저장합니다
RTX Pro 6000, 196GBGLM-5 2, 753B 파라미터초당 약 15토큰프로젝트가 대규모 모델에 초점을 맞추고 있음을 보여 줍니다
RTX 5080, 64GB RAMQwen 3.5 35B A3B약 100, 한 보고에서는 약 110독립적인 검증이 필요한 커뮤니티 결과입니다

토큰 생성 속도는 전체 사용 경험의 일부에 불과합니다. 특히 클라이언트가 대화 내용을 반복적으로 수정할 때 에이전트 워크플로에서는 컨텍스트 처리 중 긴 지연이 나타날 수 있습니다. FreeToken의 시맨틱 인식 캐싱은 변경되지 않은 컨텍스트를 보존하고 중복 재계산을 줄이기 위한 기능입니다.

공정하게 비교하려면 동일한 체크포인트, 양자화 방식, 프롬프트 길이, 컨텍스트 설정 및 클라이언트 동작을 사용해 테스트하세요. VRAM에 완전히 들어가는 소형 모델은 이미 다른 런타임에서 매우 우수한 성능을 낼 수 있습니다. 메모리 이동과 긴 컨텍스트 업데이트가 주요 제약일 때 FreeToken의 장점이 더욱 분명해집니다.

가장 적합한 경우

GPU VRAM을 초과하지만 시스템의 전체 메모리 예산 안에는 들어오는 대규모 MoE 체크포인트.

유망한 시나리오

컨텍스트 업데이트가 반복되는 장시간 코딩 또는 도구 호출 에이전트.

상대적으로 덜 적합한 경우

VRAM에 완전히 들어가며 상당한 CPU–GPU 조정이 필요하지 않은 소형 모델.

벤치마크 참고 사항

첫 토큰 지연 시간, 지속 생성 속도, 컨텍스트 업데이트 및 클라이언트 안정성을 비교하세요. 단일 초당 토큰 수치만으로는 전체 에이전트 워크플로를 나타낼 수 없습니다.

호환성, 한계 및 실용적인 체크리스트

FreeToken은 특화된 프로젝트입니다. Windows와 Linux 데스크톱 접근을 지원한다고 안내하지만, 가속 명령줄 문서는 Linux, x86-64 시스템, Nvidia GPU, CUDA 13 및 최신 드라이버에 초점을 맞추고 있습니다. 범용 CPU 실행기나 모든 하드웨어 생태계를 대체하는 광범위한 솔루션으로 소개되지는 않습니다.

또한 이 프로젝트가 충분한 저장 공간과 시스템 RAM의 필요성을 없애 주는 것도 아닙니다. 희소 실행으로 토큰마다 활성화되는 파라미터 수가 줄어들더라도 대규모 체크포인트 자체는 여전히 큽니다. 모델 형식, 양자화, 컨텍스트 길이 및 에이전트 동작은 모두 최종 메모리 요구 사항에 영향을 줍니다.

첫 테스트 전에 확인할 사항:

  • Nvidia GPU, 드라이버, CUDA 및 운영 체제 호환성 확인
  • 선택한 전체 체크포인트에 필요한 시스템 RAM 용량 추정
  • 지원되는 저정밀도 또는 Hugging Face 모델 버전 선택
  • 도구를 활성화하기 전에 짧은 요청으로 로컬 API 테스트
  • 공정한 벤치마크를 위해 모델, 양자화, 컨텍스트 길이 및 하드웨어 기록
판단 기준다음과 같은 경우 FreeToken이 유력한 선택다음과 같은 경우 다른 런타임 고려
모델 크기MoE 체크포인트가 사용 가능한 VRAM을 초과하는 경우모델이 VRAM에 여유 있게 들어가는 경우
하드웨어Nvidia 가속과 충분한 호스트 RAM을 사용할 수 있는 경우폭넓은 CPU, AMD, Apple Silicon 또는 소형 기기 지원이 필요한 경우
워크플로장시간 코딩 또는 도구 호출 세션을 실행하는 경우주로 짧고 단순한 프롬프트를 생성하는 경우
생태계프로젝트가 지원하는 API 호환성을 원하는 경우기존 GGUF 기반 워크플로에 크게 의존하는 경우
제어 수준특화된 엔진을 직접 튜닝하는 데 익숙한 경우성숙한 범용 런타임을 선호하는 경우
실용적인 조언

모든 테스트에 대해 GPU, CPU, RAM, 모델, 양자화, 컨텍스트 크기, 첫 토큰 지연 시간 및 지속 생성 속도를 기록하세요. 이렇게 하면 커뮤니티 결과를 훨씬 쉽게 비교할 수 있습니다.

Apache License 2.0에 따라 저장소는 라이선스 조건 내에서 검토와 재사용에 적합합니다. 프로젝트는 SGLang, vLLM, FlashInfer, LightLLM, flash-linear-attention 및 llama.cpp를 비롯한 시스템에서 영감을 얻었으며 일부 코드를 재사용했음을 밝히고 있습니다. 수정된 구성 요소를 배포하기 전에 저장소의 최신 라이선스와 고지 사항을 검토하세요.

FreeToken github FAQ

Q: FreeToken은 어떤 용도로 사용되나요?

FreeToken은 GPU, CPU, 호스트 메모리 및 인터커넥트에 걸쳐 대규모 오픈 웨이트 Mixture-of-Experts 모델을 서빙하기 위한 엣지 네이티브 추론 엔진입니다.

Q: FreeToken이 모든 시스템에서 llama.cpp를 대체하나요?

아닙니다. FreeToken은 더욱 특화된 엔진입니다. GPU VRAM을 초과하는 대규모 MoE 모델에는 매력적인 선택이 될 수 있지만, llama.cpp는 더 폭넓은 하드웨어와 모델 생태계를 지원합니다.

Q: 가속 설정에는 어떤 하드웨어가 필요한가요?

문서화된 가속 경로는 Linux, x86-64, Nvidia GPU, CUDA 13 및 최신 드라이버에 초점을 맞춥니다. 오프로드된 가중치와 컨텍스트를 저장할 충분한 시스템 RAM도 필요합니다.

Q: 최신 설치 지침은 어디에서 확인해야 하나요?

공식 FreeToken GitHub 저장소와 연결된 설치 및 빠른 시작 문서를 이용하세요. 호환성 세부 사항은 변경될 수 있으므로 설치하기 전에 해당 자료를 확인해야 합니다.

문서를 최신 상태로 유지하세요

설치 명령, 지원되는 체크포인트 및 하드웨어 안내는 2026년 중에도 변경될 수 있습니다. 이전 설정 안내를 적용하기 전에 공식 저장소를 다시 확인하세요.