FreeToken 릴리스: 2026 설정 가이드 및 주요 변경 사항 - 가이드

FreeToken 릴리스: 2026 설정 가이드 및 주요 변경 사항

2026 FreeToken 릴리스의 기능, 엣지 네이티브 MoE 엔진의 작동 방식, 지원 하드웨어, 벤치마크 및 설정 시 고려 사항을 알아보세요.

2026-08-25
FreeToken 위키 팀
빠른 가이드
  • FreeToken 릴리스는 대규모 MoE 모델을 위한 엣지 네이티브 서빙 시스템을 도입합니다.
  • 핵심 장점: 동적 전문가 캐싱이 GPU, CPU, 호스트 메모리 및 PCIe 대역폭을 결합합니다.
  • 가장 적합한 환경: 충분한 시스템 메모리를 갖춘 최신 NVIDIA 시스템과 MoE 워크로드.
  • 주요 제한 사항: 2026 빌드는 베타에 초점을 두며 주로 CUDA를 사용하는 Linux를 대상으로 합니다.
  • 핵심 요점: 엔진을 전환하기 전에 하드웨어 지원 범위와 벤치마크의 주의 사항을 검토해야 합니다.

FreeToken 릴리스: 2026년에 달라진 점

2026 FreeToken 릴리스는 최첨단 규모의 혼합 전문가 모델을 개인용 하드웨어에서 더욱 실용적으로 사용할 수 있도록 설계된 로컬 추론 엔진을 선보입니다. 모든 전문가 가중치를 GPU 메모리에 유지하도록 요구하는 대신, 시스템은 전체 전문가 풀을 호스트 메모리에 보관하고 사용 가능한 VRAM을 탄력적인 캐시로 활용합니다.

프로젝트의 연구 논문 FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution은 2026년 8월 24일에 공개되었습니다. 이 논문은 해당 릴리스를 새로운 모델이 아닌 서빙 시스템으로 설명합니다. 목적은 기존 오픈 웨이트 MoE 모델을 소비자용 하드웨어 전반에서 로드하고, 캐시하며, 실행하는 방식을 개선하는 것입니다.

영상 주요 내용:

  • FreeToken은 매우 큰 파라미터 수를 가진 모델의 로컬 서빙을 목표로 합니다.
  • 동적 라우팅이 어떤 전문가를 GPU 메모리에 유지할지 결정합니다.
  • 측정된 대역폭에 따라 CPU 실행과 PCIe 전송의 균형을 조정합니다.
  • 보고된 결과에는 노트북, 데스크톱 및 워크스테이션급 하드웨어가 포함됩니다.

MoE 서빙

  • 희소 라우팅은 토큰마다 소수의 전문가 하위 집합만 활성화합니다.
  • 전체 전문가 풀은 호스트 메모리에서 계속 사용할 수 있습니다.
  • 로컬 VRAM 용량을 초과하는 모델에 유용합니다.

적응형 캐시

  • 공유 LRU 캐시가 최근에 라우팅된 전문가를 추적합니다.
  • 런타임 중 캐시 용량이 변경될 수 있습니다.
  • 프리필과 디코드가 동일한 전문가 메모리 풀을 공유합니다.

하이브리드 실행

  • 캐시에 없는 전문가는 GPU로 전송할 수 있습니다.
  • 다른 캐시 미스는 CPU에서 직접 실행할 수 있습니다.
  • 분할 방식은 측정된 호스트 및 PCIe 대역폭을 따릅니다.
편집자 의견

FreeToken을 모델 릴리스가 아닌 추론 런타임 릴리스로 이해해야 합니다. 여전히 호환되는 모델 가중치, 지원되는 런타임 환경, 그리고 전체 전문가 풀을 수용할 충분한 호스트 메모리가 필요합니다.

릴리스 영역2026년 방향중요한 이유
모델 지원약 35B~753B 파라미터의 MoE 모델일반적인 VRAM 한계를 초과하는 모델에 대한 로컬 접근성을 확대합니다
메모리 설계탄력적 GPU 캐싱을 사용하는 호스트 상주 전문가 풀GPU 용량은 기본적인 정상 작동보다 속도에 더 큰 영향을 줍니다
스케줄링대역폭 적응형 CPU/GPU 실행피할 수 없는 캐시 미스의 영향을 줄입니다
프리필전체 레이어 이중 버퍼링전문가 이동과 GPU 계산을 겹쳐 처리합니다
사용 가능 환경베타 중심의 CUDA 및 POSIX Linux 대상설치 전에 플랫폼 지원 여부를 확인해야 합니다

FreeToken 아키텍처의 작동 방식

FreeToken은 추론을 프리필과 디코드라는 두 가지 중요한 단계로 나눕니다. 프리필은 기존 프롬프트 또는 대화 컨텍스트를 처리하고, 디코드는 한 번에 하나씩 새로운 토큰을 생성합니다. 각 단계에는 서로 다른 병목이 있으므로 런타임은 단계별로 다른 기법을 사용합니다.

프리필 중에는 긴 컨텍스트 전반에서 많은 전문가에 접근할 수 있습니다. FreeToken은 GPU가 현재 레이어를 처리하는 동안 다음 레이어의 전문가를 스트리밍하는 전체 레이어 이중 버퍼링을 사용합니다. 이를 통해 일부 전송 시간을 계산 과정 뒤에 숨길 수 있습니다. 또한 이 설계는 사고 구간, 도구 호출, 대화 전환과 같은 의미적 경계에 체크포인트를 저장합니다. 에이전트가 컨텍스트를 편집할 때는 변경된 접미사만 다시 계산하면 될 수 있습니다.

디코드 중 라우팅은 희소하지만 토큰마다 변경됩니다. 시작 시 선택한 정적 배치는 활성 전문가를 자주 놓칠 수 있습니다. 대신 FreeToken은 레이어 전반의 최근 라우팅 동작을 추적하는 공유 LRU 캐시를 사용합니다.

런타임 단계주요 과제FreeToken의 대응
프리필대규모 전문가 이동 및 반복적인 컨텍스트 재계산전체 레이어 파이프라이닝 및 의미적 상태 체크포인트
디코드변화하는 전문가 경로 및 캐시 미스공유 LRU 전문가 캐시
캐시 미스전송과 CPU 실행이 호스트 대역폭을 두고 경쟁측정된 대역폭 분할
메모리 압박애플리케이션과 컨텍스트가 증가함에 따른 VRAM 변화런타임 캐시 크기 조정
시작대규모 전문가 풀 로드에 시간이 걸림최종 호스트 레이아웃으로 직접 로드

대역폭 정책은 이 릴리스를 정의하는 핵심 아이디어 중 하나입니다. Bₚ를 측정된 PCIe 전송 대역폭, Bₕ를 유효 호스트 측 전문가 처리 대역폭이라고 합시다. 런타임은 누락된 전문가 중 몇 개를 GPU 캐시로 전송하고 몇 개를 CPU에서 직접 실행해야 하는지 추정합니다.

이 접근 방식은 모든 캐시 미스를 전송으로 처리하는 것을 피합니다. 전문가는 이후 토큰을 위해 캐시에 남아 있을 수 있으므로 전송이 유용할 때도 있지만, 호스트 대역폭에 여유가 있거나 캐시 용량이 제한된 경우에는 CPU 실행이 더 빠를 수 있습니다.

중요한 아키텍처 한계

희소 활성화는 토큰당 계산량을 줄이지만, 전체 전문가 풀을 접근 가능한 곳에 저장해야 할 필요성을 없애지는 않습니다. 대규모 모델은 여전히 상당한 호스트 메모리와 저장 공간을 요구할 수 있습니다.

1

전문가 풀 로드

FreeToken은 정규화된 전문가 가중치를 호스트 메모리로 읽어옵니다. FTW 형식은 서빙 중 사용되는 레이아웃에 가중치를 직접 배치하도록 설계되어 시작 시 탐색 및 재패킹 작업을 줄입니다.

2

GPU 캐시 예약

비전문가 가중치와 런타임 상태를 할당한 후, 남은 VRAM은 KV 캐시와 전체 전문가 슬롯으로 나뉩니다. 이 예산은 런타임의 안전한 지점에서 다시 조정할 수 있습니다.

3

컨텍스트 프리필

전체 레이어 버퍼링은 GPU가 계산하는 동안 전문가 데이터를 스트리밍합니다. 의미적 체크포인트는 에이전트 전환과 컨텍스트 편집 과정에서 유용한 접두사를 보존합니다.

4

라우팅 인식 캐싱을 통한 디코드

라우터가 활성 전문가를 식별하고 GPU 상주 여부를 확인한 뒤, 캐시 미스를 대역폭 적응형 CPU 또는 PCIe 경로로 전달합니다.

성능 결과와 하드웨어 적합성

보고된 2026년 평가에서는 6개 시스템과 여러 에이전트 워크로드에서 FreeToken을 활발히 유지 관리되는 엣지 서빙 엔진과 비교합니다. 최신 NVIDIA GPU, 충분한 호스트 메모리, 그리고 CPU 메모리 대역폭과 PCIe 전송 용량 사이의 적절한 균형을 갖춘 시스템에서 가장 강력한 결과가 나타납니다.

RTX 5090에서 논문은 Qwen3.6-35B에 대해 초당 77~83토큰, DeepSeek-V4-Flash에 대해 초당 22~25토큰을 보고합니다. 8GB 구성의 RTX 4060 노트북에서는 보고된 Qwen3.6 결과가 초당 39.3토큰에 도달합니다. 워크스테이션급 RTX PRO 6000은 GLM-5.2를 초당 14.9토큰으로 서빙하며, 이는 제시된 llama.cpp 구성의 7.3보다 높은 수치입니다.

하드웨어 등급시연된 워크로드보고된 결과실용적 해석
RTX 4060 노트북, 8GBQwen3.6-35B39.3 tok/s제한된 VRAM에서 적응형 서빙의 가치를 보여줍니다
RTX 5090 데스크톱/서버Qwen3.6-35B77~83 tok/s보고된 소비자급 결과 중 가장 강력합니다
RTX 5090 데스크톱/서버DeepSeek-V4-Flash22~25 tok/s대규모 전문가 풀도 로컬에서 운용할 수 있음을 보여줍니다
RTX PRO 6000, 96GBGLM-5.214.9 tok/s753B 파라미터의 최첨단 규모 계층을 시연합니다
RTX PRO 6000, 96GBllama.cpp 비교7.3 tok/s비교 가능한 가중치 조건에서 보고된 기준 결과입니다

최악의 턴에서 발생하는 지연 시간도 중요합니다. 평가에 따르면 테스트된 조건에서 FreeToken의 최악의 턴은 44초 미만으로 유지되었지만, 일부 경우 기준 시스템은 상당히 더 높은 지연을 기록했습니다. 에이전트 애플리케이션에서는 이 차이가 클라이언트 감시 타이머나 타임아웃에 의해 중단되기 전에 요청이 완료되는지에 영향을 줄 수 있습니다.

그러나 벤치마크는 적절한 주의를 기울여 해석해야 합니다. 측정은 논문 저자들이 수행했으며, 공개된 자료만으로는 광범위한 독립 재현이 확립되지 않았습니다. 특히 디코드 처리량을 엔드투엔드 프로덕션 추적 결과와 비교할 때는 주요 비교 수치의 측정 정의도 확인해야 합니다.

가장 적합한 하드웨어

FreeToken은 최신 NVIDIA GPU, 충분한 시스템 메모리, 그리고 대규모 MoE 모델을 반복적으로 서빙하는 워크로드에서 가장 큰 가치를 발휘합니다. 하드웨어 호환성이 표면적인 토큰 처리량보다 더 중요합니다.

하드웨어 요소유리한 조건잠재적 우려 사항
GPU최신 NVIDIA CUDA 지원 카드구형 카드는 테스트되거나 패키징된 경로가 없을 수 있습니다
VRAM비전문가 가중치, KV 캐시 및 전문가 슬롯을 수용할 충분한 공간VRAM이 작으면 캐시 미스가 증가합니다
호스트 메모리전체 전문가 풀을 수용할 수 있는 용량대규모 모델은 일반적인 데스크톱 메모리를 초과할 수 있습니다
PCIe넓고 대역폭이 높은 링크노트북의 x8 또는 그보다 느린 링크는 전송 부담을 높입니다
CPU 메모리강력한 듀얼 채널 DDR5 이상CPU 측 실행이 대역폭 제한을 받을 수 있습니다
운영체제CUDA를 사용하는 POSIX LinuxmacOS 및 광범위한 Windows 지원은 확립되지 않았습니다

지원 현황, 제한 사항 및 설정 점검

2026 릴리스는 초기 단계 시스템으로 접근해야 합니다. 공개된 분류 정보는 베타 개발 상태, CUDA 환경 및 POSIX Linux 운영체제를 명시합니다. 현재 확인 가능한 플랫폼 자료만으로는 네이티브 Apple Silicon 빌드, 광범위한 macOS 지원 또는 더 성숙한 엣지 런타임에 해당하는 하드웨어 범위가 확립되지 않았습니다.

프로젝트가 제시한 방향에는 FTW 가중치 형식, CUDA 호환 커널, CPU SIMD 구현, 그리고 고정 메모리 또는 DMA 등록을 사용할 수 없을 때의 순수 CPU 기반 MoE 폴백 백엔드가 포함됩니다. 이러한 기능은 유연성을 높이지만, 운영체제나 그래픽 카드에 관계없이 동일한 성능을 보장하지는 않습니다.

FreeToken 테스트 전 확인 사항:

  • GPU와 CUDA 환경이 지원되는 런타임 경로와 일치하는지 확인합니다
  • 사용 가능한 호스트 메모리를 전체 모델 전문가 풀과 비교해 측정합니다
  • 성능을 추정하기 전에 PCIe 링크 폭과 호스트 메모리 대역폭을 확인합니다
  • 비전문가 가중치와 증가하는 KV 캐시를 위해 충분한 VRAM을 확보합니다
  • 엔진을 비교할 때 동일한 가중치와 워크로드를 사용합니다
시작점

릴리스 세부 정보, 구현 참고 사항 및 지원 구성을 확인할 때 공식 FreeToken 프로젝트 페이지2026년 연구 논문을 주요 참고 자료로 사용하세요.

확인 항목권장 조치이유
설치 대상테스트된 Linux CUDA 시스템을 우선합니다릴리스 자료에서 가장 명확하게 지원되는 환경입니다
모델 형식모델에 호환되거나 변환 가능한 레이아웃이 있는지 확인합니다FreeToken은 정규화된 전문가 뱅크와 FTW 저장 형식을 사용합니다
메모리 계획전문가 풀, KV 캐시 및 동시에 실행되는 애플리케이션을 고려합니다엣지 시스템은 변동하는 메모리 예산을 가집니다
벤치마크 방법프롬프트, 가중치 및 워크로드 추적을 재사용합니다서로 다른 에이전트 경로가 비교 결과를 왜곡할 수 있습니다
안정성 테스트평균 처리량뿐 아니라 꼬리 지연 시간도 측정합니다긴 지연이 클라이언트 감시 타이머나 타임아웃을 유발할 수 있습니다

첫 평가에서는 호스트 메모리 예산에 맞는 모델과 짧고 통제된 워크로드로 시작하세요. 시작 시간, 첫 토큰까지의 시간, 안정적인 디코드 속도, 캐시 동작 및 최악의 턴 지연 시간을 기록합니다. 그런 다음 일반적인 데스크톱 애플리케이션을 실행하는 상태에서 테스트를 반복하여 압박 상황에서 탄력적 메모리 관리가 어떻게 동작하는지 확인하세요.

2026년에 FreeToken을 사용해야 하는 사람은?

FreeToken은 모든 로컬 추론 엔진을 대체하는 만능 솔루션이 아닙니다. 가장 적합한 사용자는 적절한 NVIDIA 하드웨어를 보유하고 MoE 모델을 다루며, 로컬 제어, 예측 가능한 가용성 및 호스팅 추론에 대한 의존도 감소를 중요하게 생각하는 기술적으로 숙련된 사용자 또는 소규모 팀입니다.

플랫폼 지원 범위가 최우선이라면 이 시스템은 적합하지 않을 수 있습니다. Apple Silicon, 구형 NVIDIA 카드, CUDA를 사용하지 않는 장치 또는 간단한 크로스 플랫폼 설치에 의존하는 사용자는 마이그레이션에 시간을 투자하기 전에 지원 여부를 확인해야 합니다.

높은 적합성

  • 최신 NVIDIA GPU
  • 넉넉한 호스트 메모리 예산
  • 빈번한 MoE 서빙
  • 에이전트 또는 멀티턴 워크로드

가능한 적합성

  • 제한된 VRAM
  • 빠른 PCIe 링크
  • 최신 DDR5 시스템
  • 로컬 벤치마크를 수행할 의향

낮은 적합성

  • Apple Silicon 의존
  • 구형 GPU 하드웨어
  • 적은 시스템 메모리 용량
  • 완성도 높은 범용 설치 프로그램 필요

평가 우선순위

  • 먼저 호환성 확인
  • 꼬리 지연 시간 비교
  • 메모리 압박 모니터링
  • 워크로드 정확성 검증

이 릴리스의 더 넓은 의미는 아키텍처에 있습니다. GPU 메모리만 따로 평가하는 대신 소비자용 하드웨어를 하나의 통합 시스템으로 다룹니다. 전문가 캐시, CPU 공동 실행, 의미적 체크포인트 및 런타임 메모리 조정은 모두 같은 문제의 서로 다른 부분을 해결합니다. 즉, 전용 데이터센터 외부에서도 대규모 희소 모델을 사용할 수 있도록 하는 것입니다.

권장 평가 순서

먼저 호환성을 확인하고, 다음으로 메모리 용량을 검증한 뒤, 짧은 워크로드를 측정하고, 마지막으로 처리량을 비교하세요. 이렇게 하면 인상적인 벤치마크 수치가 실제로 사용할 수 없는 배포 경로를 가리는 일을 방지할 수 있습니다.

Q: 2026 FreeToken 릴리스란 무엇인가요?

공개된 FreeToken 엣지 네이티브 MoE 서빙 시스템과 이에 수반되는 2026년 8월 24일 연구 릴리스를 의미합니다. FreeToken은 새로운 언어 모델이 아니라 추론 런타임입니다.

Q: FreeToken은 어떤 하드웨어를 대상으로 하나요?

문서화된 경로는 주로 소비자용 노트북, 데스크톱 및 워크스테이션급 GPU를 포함한 NVIDIA CUDA 시스템을 대상으로 합니다. 공개된 릴리스 자료에서는 Linux와 POSIX 환경이 가장 명확하게 지원되는 방향입니다.

Q: FreeToken은 GPU 메모리보다 큰 모델을 어떻게 서빙할 수 있나요?

전체 전문가 풀은 호스트 메모리에 유지하면서 선택된 전문가는 탄력적인 GPU 캐시로 이동하거나 CPU에서 직접 실행합니다. 희소 MoE 라우팅은 각 토큰에서 일부 전문가만 활성화하지만, 전체 풀을 저장할 공간은 여전히 필요합니다.

Q: FreeToken은 모든 로컬 추론 엔진보다 빠른가요?

2026년 논문은 일부 엣지 서빙 기준 시스템과 비교해 강력한 결과를 보고하지만, 해당 측정은 프로젝트 저자들이 수행한 것입니다. 자신의 하드웨어와 워크로드에서 독립적으로 테스트해야 합니다.