FreeToken 앱: 로컬 MoE 추론 설정 가이드 - 가이드

FreeToken 앱: 로컬 MoE 추론 설정 가이드

Windows 또는 Linux에서 FreeToken 앱을 설정하고, MoE 캐싱을 이해하며, 대형 로컬 모델에 적합한 런타임을 선택하는 방법을 알아보세요.

2026-08-31
FreeToken Wiki 팀
빠른 가이드
  • FreeToken 앱은 로컬 Mixture-of-Experts 모델을 실행하기 위한 데스크톱 인터페이스를 제공합니다.
  • 가장 적합한 사용 사례: 활성화된 전문가 수가 사용 가능한 GPU VRAM 용량을 초과하는 모델입니다.
  • 핵심 장점: 적응형 CPU–GPU 스케줄링, 전문가 캐싱, 백그라운드 스트리밍을 제공합니다.
  • 설치 옵션: Windows 또는 Linux 데스크톱 앱을 사용하거나, uv로 CLI를 설치할 수 있습니다.
  • 중요한 제한 사항: VRAM에 여유 있게 들어가는 모델은 더 단순한 런타임에서 더 빠르게 실행될 수 있습니다.

FreeToken 앱 개요

FreeToken 앱은 소비자용 하드웨어에서 대규모 오픈 웨이트 Mixture-of-Experts 모델을 실행하기 위한 로컬 추론 인터페이스이자 엔진입니다. 전체 모델이 GPU 메모리에 들어가야 하는 방식 대신, GPU, CPU, 시스템 RAM, PCIe 연결을 하나의 유연한 실행 플랫폼으로 조정합니다.

FreeToken은 모델이 사용 가능한 VRAM에 비해 너무 크지만 컴퓨터의 나머지 자원으로는 실행 가능한 경우에 특히 유용합니다. 데스크톱 애플리케이션에서는 호환 모델을 그래픽 인터페이스로 확인하고, 대화를 시작하며, 엔진 설정을 조정할 수 있습니다. 명령줄 버전은 개발 및 벤치마킹 작업에 더 세밀한 제어 기능을 제공합니다.

영상 주요 내용:

  • FreeToken은 특정 MoE 작업에서 Ollama 및 llama.cpp와 같은 도구의 대안으로 소개됩니다.
  • 이 엔진은 모델 레이어를 하나의 장치에 영구적으로 할당하는 대신 GPU 전문가 캐싱을 사용합니다.
  • Q-star 스케줄링은 누락된 전문가를 GPU로 이동할지 CPU에서 실행할지를 결정합니다.
  • 이중 버퍼링 프리필은 계산과 전문가 전송을 겹쳐서 처리합니다.
  • 성능은 VRAM 용량, PCIe 대역폭, RAM 속도, 모델 형식에 크게 좌우됩니다.

이 프로젝트는 오픈 소스 Apache License 2.0 프로젝트로 유지 관리됩니다. 공식 문서와 설치 리소스는 FreeToken GitHub 저장소에서 확인할 수 있습니다.

영역FreeToken 방식중요한 이유
모델 유형Mixture-of-Experts 모델전체 매개변수 수가 많은 희소 모델을 대상으로 합니다
메모리 전략GPU 캐시와 시스템 RAM모든 전문가가 VRAM에 계속 상주할 필요를 없앱니다
스케줄링대역폭 적응형 CPU–GPU 실행로컬 시스템에 맞게 조정합니다
인터페이스데스크톱 앱 및 CLI시각적 작업과 개발 작업을 모두 지원합니다
라이선스Apache License 2.0라이선스 조건에 따라 폭넓은 오픈 소스 사용을 허용합니다
가장 좋은 시작점

시각적인 모델 개요를 확인하고 싶다면 데스크톱 앱으로 시작하세요. 재현 가능한 명령, 프로젝트 통합 또는 상세한 테스트가 필요하다면 CLI를 사용하세요.

FreeToken이 대규모 MoE 모델을 처리하는 방법

Mixture-of-Experts 모델은 수천억 개의 전체 매개변수를 포함하면서도 각 토큰에 대해 그중 일부만 활성화할 수 있습니다. 이러한 희소성은 계산량을 줄일 수 있지만 메모리 문제를 없애지는 않습니다. 전체 모델은 여전히 어딘가에 저장되어 있어야 합니다.

FreeToken은 GPU 메모리를 활성 전문가 캐시로 취급합니다. 시스템 RAM은 전체 모델의 기준 저장소로 유지되고, 자주 요청되는 전문가는 GPU에 더 가까운 위치에 보관됩니다. 라우터는 인접한 토큰에서 동일한 전문가를 자주 재사용하므로, 비교적 작은 핫 세트만으로도 작업량의 상당 부분을 처리할 수 있습니다.

전문가 캐시

자주 사용되는 전문가는 GPU 근처에 유지되어, 로컬에서 재사용되는 라우팅 패턴에서 반복적인 전송을 줄입니다.

Q-Star 정책

측정된 하드웨어 대역폭에 따라 캐시 누락을 GPU 전송과 직접적인 CPU 실행으로 나눌 수 있습니다.

이중 버퍼링 프리필

한 레이어를 처리하는 동안 다음 레이어에 필요한 전문가를 백그라운드에서 스트리밍할 수 있습니다.

프롬프트 처리 과정은 프리필이라고도 하며, 긴 입력은 광범위한 전문가에 접근할 수 있습니다. FreeToken은 각 전송이 완료될 때까지 기다린 후 처리를 계속하는 대신 데이터 이동과 계산을 겹쳐서 이 문제에 대응합니다.

생성 과정에서 엔진은 캐시 누락을 처리해야 합니다. 한 시스템에서는 PCIe를 통해 전문가를 가져오는 것이 유리할 수 있지만, 다른 시스템에서는 CPU에서 직접 계산하는 편이 더 나을 수 있습니다. Q-star 정책은 RAM과 PCIe 대역폭 사이의 로컬 균형을 측정하고 현재 작업량에 적합한 분할 방식을 선택합니다.

메커니즘기능주요 이점주요 의존 요소
글로벌 LRU 캐시최근 사용된 전문가를 계속 사용할 수 있도록 유지합니다토큰 간 재사용을 개선합니다전문가 지역성 및 캐시 크기
Q-star 실행캐시 누락 시 GPU 전송 또는 CPU 실행을 선택합니다다양한 하드웨어 구성에 적응합니다RAM 및 PCIe 대역폭
이중 버퍼링현재 계산 중에 다음 전문가를 스트리밍합니다눈에 띄는 전송 지연을 줄입니다동시 전송 및 계산 지원
FTW 형식엔진에 필요한 레이아웃으로 가중치를 로드합니다시작 시 재패키징 작업을 줄입니다FTW 호환 형식의 모델 제공 여부
시맨틱 앵커유용한 상태와 KV 캐시 체크포인트를 보존합니다반복적인 컨텍스트 재계산을 줄일 수 있습니다에이전트형 컨텍스트 및 캐시 동작

이 엔진에는 반복 상태와 키-값 캐시를 위한 시맨틱 앵커 체크포인트도 포함되어 있습니다. 이러한 기능은 에이전트형 워크플로에서 도구 호출이나 사고 블록을 통해 컨텍스트를 편집할 때 불필요한 컨텍스트 재계산을 줄이는 것을 목표로 합니다.

작업량의 경계를 이해하세요

FreeToken은 모든 로컬 추론 엔진을 대체하는 만능 솔루션이 아닙니다. CPU 실행이 병목이 되지 않으면서 사용 가능한 VRAM 한계를 초과하는 MoE 모델에서 가장 큰 강점을 발휘합니다.

FreeToken 앱 설정 단계

공식 프로젝트는 Windows 및 Linux용 데스크톱 앱과 Python 기반 CLI 설치를 지원합니다. 런타임을 어떻게 사용할지에 따라 한 가지 경로를 선택하세요.

1

하드웨어 프로필 확인

사용 가능한 GPU VRAM, 시스템 RAM, PCIe 연결 상태, 운영 체제 지원 여부를 확인하세요. FreeToken은 소비자용 시스템을 대상으로 설계되었지만, 매우 큰 최신 모델은 고성능 데스크톱의 용량도 초과할 수 있습니다.

2

인터페이스 선택

안내에 따른 설정, 모델 확인, 채팅 중심의 사용을 원한다면 Windows 또는 Linux 데스크톱 앱을 선택하세요. 스크립팅, 프로젝트 통합 또는 반복 가능한 벤치마크 명령이 필요하다면 CLI를 선택하세요.

3

필요한 경우 CLI 설치

공식 저장소에서는 uv pip install "freetoken[accel]" 명령으로 가속 패키지를 설치할 것을 권장합니다. 소스에서 빌드하는 방법도 저장소의 가상 환경 워크플로를 통해 문서화되어 있습니다.

4

적합한 MoE 모델 로드

GPU에 완전히 로드하기에는 너무 크지만 RAM과 저장 공간으로는 현실적으로 감당할 수 있는 모델부터 시작하세요. 모델 형식과 런타임 요구 사항이 지원되는지 확인하세요.

5

튜닝 및 측정

일관된 프롬프트나 코딩 작업을 실행한 다음 속도, 안정성, 메모리 동작을 비교하세요. 성능 곡선을 확인해야 한다면 실행 중인 서버 테스트에서 GPU 전문가 캐시 크기를 조정하세요.

설정 경로권장 대상강점제한 사항
데스크톱 앱신규 사용자 및 시각적 모니터링안내형 인터페이스와 모델 개요현재 앱 워크플로는 프로젝트 파일 작업에 더 제한적입니다
uv를 사용한 CLI개발자 및 테스터스크립트 작성 및 구성 가능명령줄 사용에 익숙해야 합니다
소스 빌드기여자 및 고급 사용자프로젝트 코드에 직접 접근더 많은 설정과 유지 관리 책임이 필요합니다

현재 데스크톱 앱은 Windows와 Linux용으로 제공됩니다. 로컬 시스템에서 실행 가능해 보이는 모델을 표시할 수 있지만, 현재 워크플로는 코딩 중심 통합 기능과 동일한 프로젝트 폴더 또는 파일 수정 기능을 제공하지 않을 수 있습니다.

설정 권장 사항

대규모 모델을 사용하기로 결정하기 전에 작고 반복 가능한 테스트를 실행하세요. 짧은 벤치마크를 통해 전송, CPU 작업 또는 캐시 누락 중 무엇이 시스템을 제한하는지 확인할 수 있습니다.

성능 비교 및 튜닝

가장 중요한 판단 기준은 모델이 GPU 메모리에 여유 있게 들어가는지 여부입니다. 들어간다면 FreeToken의 스트리밍 및 스케줄링 오버헤드를 피할 수 있는 기존의 완전 상주 GPU 구성이 더 빠를 수 있습니다. 모델이 VRAM을 초과한다면 FreeToken은 필요한 전문가만 이동시키면서 수학적 연산을 GPU에서 계속 수행할 수 있습니다.

보고된 워크스테이션 비교 결과는 이러한 차이를 보여줍니다. 32GB GPU에서 약 38GB로 추정되는 8비트 Qwen 모델을 사용했을 때, 레이어 분할 구성은 동일한 코딩 작업에서 초당 약 58토큰을 기록한 반면 FreeToken은 초당 약 132토큰을 기록했습니다. 작업 소요 시간은 각각 약 14분 20초와 4분 40초였습니다.

동일한 비교에서 32GB VRAM에 들어가는 4비트 버전은 다른 결과를 보였습니다. 완전 GPU 상주 구성은 초당 약 240토큰을 기록했고, FreeToken은 초당 약 225토큰을 기록했습니다. 이러한 수치는 보편적인 목표가 아니라 하드웨어와 작업량에 따라 달라지는 결과입니다.

시나리오관찰된 결과권장 방식
용량을 초과하는 8비트 MoE 모델인용된 테스트에서 FreeToken은 약 132 tokens/sec를 기록했습니다먼저 FreeToken을 테스트하세요
레이어 분할 비교대체 런타임은 약 58 tokens/sec를 기록했습니다유용한 기준선
VRAM에 들어가는 더 작은 4비트 모델완전 GPU 구성은 약 240 tokens/sec를 기록했습니다더 단순한 완전 GPU 경로를 선호하세요
FreeToken 캐시를 58%에서 40%로 축소인용된 테스트에서 속도 손실은 약 **7%**였습니다더 작은 캐시를 고려하세요
캐시를 약 20% 미만으로 축소인용된 테스트에서 성능이 급격히 저하되었습니다지나치게 작은 설정은 피하세요

FreeToken은 서버가 실행 중일 때 GPU 전문가 캐시 크기를 조정하는 기능도 지원합니다. 인용된 테스트에서는 캐시를 58%에서 40%로 줄여도 속도 저하는 크지 않았지만, 약 20% 미만으로 낮추자 PCIe 트래픽이 포화되면서 성능이 훨씬 더 크게 떨어졌습니다.

VRAM에 완전히 적합

모델을 GPU에 완전히 유지하고 불필요한 스트리밍 오버헤드를 피할 수 있는 런타임을 우선 선택하세요.

약간의 VRAM 초과

FreeToken은 핫 전문가를 캐싱하고 CPU–GPU 실행을 조정하여 성능을 회복할 수 있습니다.

제한적인 PCIe 연결

특히 전문가 캐시가 작은 경우 캐시 누락과 전송량에 더 민감하게 반응할 수 있습니다.

대용량 시스템 RAM

추가 RAM은 전체 모델을 보관하는 데 도움이 되지만 대역폭 제한을 없애지는 못합니다.

벤치마크를 신중하게 해석하세요

초당 토큰 수 결과는 모델 양자화, 프롬프트 길이, 하드웨어, 캐시 크기, 작업 형태에 따라 달라집니다. 공개된 수치는 보장된 결과가 아니라 비교 기준으로 활용하세요.

실용 체크리스트 및 FAQ

대규모 로컬 모델을 평가하기 전에 이 체크리스트를 사용하세요. 사용 가능한 모델 중 가장 큰 모델이 항상 최선의 선택이라고 가정하기보다 호환성과 측정에 초점을 맞춥니다.

사전 점검 체크리스트:

  • 선택한 인터페이스가 Windows 또는 Linux를 지원하는지 확인
  • 사용 가능한 GPU VRAM과 시스템 RAM 측정
  • 대상 모델이 호환되는 Mixture-of-Experts 작업인지 확인
  • 모든 런타임 비교에서 동일한 프롬프트 또는 코딩 작업 실행
  • 캐시 크기, 생성 속도, 안정성, 전송 동작 기록
점검 항목확인할 내용권장 조치
운영 체제데스크톱 앱 지원 여부그래픽 인터페이스에는 Windows 또는 Linux 사용
모델 아키텍처MoE 라우팅 및 지원되는 가중치Dense 모델도 동일한 이점을 얻는다고 가정하지 않기
메모리 균형VRAM과 전체 모델 크기 비교모델이 VRAM을 초과하면 스트리밍 테스트
연결 속도PCIe 전송 동작캐시 누락 중 포화 여부 확인
평가 방법동일한 작업과 프롬프트동일한 조건에서 런타임 비교

Q: FreeToken 앱은 무엇을 실행하도록 설계되었나요?

소비자용 GPU, CPU, 시스템 메모리 및 인터커넥트를 활용해 대규모 오픈 웨이트 Mixture-of-Experts 모델을 로컬에서 추론하도록 설계되었습니다.

Q: 모델이 VRAM에 완전히 들어갈 때도 FreeToken을 사용해야 하나요?

반드시 그렇지는 않습니다. 완전 GPU 상주 모델은 FreeToken에서 사용하는 스트리밍 및 스케줄링 오버헤드를 피할 수 있으므로 더 빠를 수 있습니다.

Q: FreeToken은 데스크톱 인터페이스로만 작동하나요?

아닙니다. FreeToken은 Windows와 Linux용 데스크톱 앱과 함께 문서에 안내된 가속 패키지로 설치할 수 있는 CLI를 제공합니다.

Q: 재시작하지 않고 GPU 전문가 캐시를 변경할 수 있나요?

이 엔진은 실행 중인 서버에서 GPU 전문가 캐시 크기를 실시간으로 조정할 수 있도록 지원하므로, 재시작 없이 메모리와 속도의 균형을 테스트할 수 있습니다.

편집 권장 사항

공식 저장소의 안내를 따라 시작하고, 하드웨어 및 모델 구성 기록을 남기며, 동일한 조건의 로컬 테스트를 기준으로 FreeToken을 평가하세요.