FreeToken: 엣지 네이티브 MoE 설정 가이드 및 비교 - 아키텍처

FreeToken: 엣지 네이티브 MoE 설정 가이드 및 비교

FreeToken이 대규모 혼합 전문가 모델을 로컬에서 제공하는 방식, llama.cpp와 라우팅 인식 캐시를 비교하는 방법, 하드웨어 적합성을 알아봅니다.

2026-08-25
FreeToken 위키 팀
빠른 가이드
  • FreeToken은 대역폭에 맞춰 로컬 MoE 서비스를 제공하는 Apache 라이선스 엔진입니다.
  • 라우팅 인식 캐싱은 시스템 버스를 통한 불필요한 전문가 전송을 줄입니다.
  • 가장 적합한 환경은 대규모 모델을 수용할 수 있는 충분한 시스템 메모리를 갖춘 최신 NVIDIA 하드웨어입니다.
  • 주요 제한 사항은 플랫폼 범위입니다. 공식 지원 대상은 Linux와 NVIDIA CUDA입니다.
  • 평가 기준: 처리량만이 아니라 꼬리 지연 시간과 하드웨어 호환성을 비교해야 합니다.

FreeToken이란 무엇이며 왜 중요한가

FreeToken은 소비자용 및 워크스테이션 하드웨어에서 대규모 혼합 전문가 모델을 실행하도록 설계된 엣지 네이티브 추론 엔진입니다. 이 프로젝트는 2026년 8월 제출된 FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution 논문에서 소개되었습니다. 모든 파라미터를 그래픽 메모리에 유지하도록 요구하는 대신, 각 토큰에 선택된 전문가를 중심으로 시스템 메모리, GPU 메모리, 전송 버스를 조율합니다.

이 설계는 희소 모델의 특정 문제를 해결합니다. 하나의 토큰에 대해 활성화되는 파라미터는 일부에 불과할 수 있지만, 전체 전문가 풀에는 여전히 접근할 수 있어야 합니다. 따라서 모델은 활성 연산량은 적당한 수준으로 유지하면서도 상당한 메모리 용량과 신중한 데이터 이동을 요구할 수 있습니다.

영상 하이라이트:

  • FreeToken은 초대형 혼합 전문가 모델의 로컬 서비스를 목표로 합니다.
  • 핵심 아이디어는 고정된 레이어 분할 대신 동적인 전문가 배치입니다.
  • 보고된 성능 향상은 호환되는 NVIDIA 시스템에서 가장 크게 나타납니다.
  • 검토한 자료에서는 독립적인 제3자 벤치마크를 확인할 수 없었습니다.

이 프로젝트가 중요한 이유는 로컬 추론이 순수 연산 성능 이상의 요소에 의해 제약되기 때문입니다. 모델이 여러 메모리 풀에 걸쳐 저장될 수 있더라도, 자주 선택되는 전문가가 느린 연결을 통과해야 한다면 성능이 저하될 수 있습니다. FreeToken은 이러한 전송을 고정된 배치 규칙으로 받아들이는 대신 스케줄링 문제로 다룹니다.

항목FreeToken 프로필
프로젝트 유형로컬 AI 추론 엔진
모델 초점혼합 전문가 모델
라이선스Apache 라이선스
논문arXiv:2608.16157
공식 지원NVIDIA CUDA, POSIX Linux
주요 최적화대역폭 적응형 전문가 실행
핵심 아이디어

FreeToken은 단순히 더 작은 모델 런타임이 아닙니다. 차별화되는 특징은 추론 중 선택된 전문가를 어디에서 실행하거나 상주하게 할지 결정하는 방식입니다.

라우팅 인식 MoE 설계의 작동 방식

혼합 전문가 모델에는 여러 특화 피드포워드 네트워크가 포함되지만, 라우터는 각 토큰에 대해 그중 일부만 활성화합니다. 검토한 예시에서는 레이어마다 수백 개의 전문가가 존재하고, 한 번에 그중 소수만 선택됩니다. 이로 인해 연산은 희소해지지만 더 넓은 파라미터 집합에 접근해야 할 필요까지 사라지는 것은 아닙니다.

실질적인 병목은 전문가 캐시 미스입니다. 다음 토큰이 GPU에서 이미 사용할 수 없는 전문가를 선택하면, 시스템은 해당 데이터를 버스를 통해 이동시키거나 가중치가 이미 위치한 곳에서 관련 작업을 실행해야 합니다. 각각의 결정은 지연 시간, 처리량, 안정성에 영향을 줍니다.

FreeToken의 접근 방식은 라우팅 인식형입니다. 실제 전문가 선택 결과를 사용해 배치와 실행 방식을 조정합니다. 이는 레이어 번호만을 기준으로 고정 분할을 수행하는 방식과 다릅니다. 정적 규칙은 예측 가능하지만 모델이 이후 토큰에서 어떤 전문가를 선택할지는 알 수 없습니다.

실행 고려 사항정적 레이어 배치라우팅 인식 배치
결정 시점추론 시작 전토큰 생성 중
주요 신호레이어 인덱스전문가 라우팅 활동
적응성실행 중 고정선택된 전문가에 맞춰 조정
주요 강점예측 가능성불필요한 전송 압력 감소
주요 위험변화하는 경로를 반영하지 못함더 복잡한 스케줄링

희소 연산

각 토큰은 선택된 전문가만 처리하므로, 전체 크기가 비슷한 밀집 모델에 비해 활성 연산량이 줄어듭니다.

대규모 메모리 필요

다음 라우팅 결정은 사전에 알 수 없으므로 모든 전문가 가중치는 접근 가능한 저장 위치에 있어야 합니다.

버스 인식

캐시 미스는 전송이나 원격 실행을 유발할 수 있으므로, 대역폭은 로컬 추론 성능의 핵심 요소가 됩니다.

중요한 구분은 활성 파라미터상주 파라미터의 차이입니다. 모델은 비교적 작은 부분 집합만 활성화하면서도 여전히 큰 메모리 공간을 요구할 수 있습니다. 따라서 수학적 작업량이 변하지 않더라도 라우팅 정책이 실제 응답성에 영향을 줄 수 있습니다.

희소성을 낮은 메모리 사용량과 혼동하지 마세요

희소 활성화는 토큰당 수행되는 작업량을 줄이지만, 모든 모델이 GPU 메모리에 여유 있게 들어간다는 의미는 아닙니다. 전체적으로 접근 가능한 파라미터 용량을 기준으로 계획하세요.

FreeToken 성능 비교

보고된 벤치마크 결과는 테스트한 하드웨어와 작업 부하에서 FreeToken이 의미 있는 이점을 보였음을 나타냅니다. GeForce RTX 5090에서 350억 파라미터 Qwen 모델을 서비스할 때 논문은 초당 약 7783토큰을 보고합니다. DeepSeek V4 Flash의 보고 범위는 초당 2225토큰입니다. GLM을 워크스테이션 카드에서 서비스한 테스트에서는 초당 5.2~14.9토큰이 보고되었으며, 인용된 비교에서 llama.cpp는 초당 7.3토큰을 기록했습니다.

가장 주목할 만한 결과는 노트북 중심의 테스트입니다. 8GB 그래픽 카드에서 초당 39.3토큰이 보고되었으며, 이는 테스트한 데스크톱 RTX 4090 결과의 약 92%에 해당하는 것으로 설명됩니다. 이 수치는 그래픽 메모리가 제한된 경우 배치 전략이 매우 중요할 수 있음을 시사하지만, 해당 결과는 보편적인 하드웨어 보장이 아니라 프로젝트 벤치마크로 받아들여야 합니다.

작업 부하FreeToken 결과언급된 비교보고된 관계
RTX 5090에서 Qwen 35B77~83 tokens/s테스트된 대안 중 가장 강력함1.8~2.3배
DeepSeek V4 Flash22~25 tokens/s테스트된 대안1.5~1.9배
워크스테이션 카드에서 GLM5.2~14.9 tokens/sllama.cpp는 7.3 tokens/s작업 부하에 따라 다름
8GB 노트북 GPU에서 35B급 모델39.3 tokens/s데스크톱 RTX 4090 기준약 92%

처리량은 비교의 한 부분일 뿐입니다. 꼬리 지연 시간은 외부 워치독이 종료하기 전에 에이전트가 한 턴을 완료할 수 있는지를 결정할 수 있습니다. 검토한 자료에 따르면 FreeToken의 단일 턴 최악 결과는 44초 미만이었지만, 일부 비교 결과는 232초를 초과했습니다. 이러한 수치는 코딩 에이전트 워크플로에서 특히 중요합니다. 느린 이상치가 평균 속도가 더 낮은 것보다 더 큰 문제를 일으킬 수 있기 때문입니다.

지표중요한 이유평가 지침
디코드 처리량토큰 생성 속도를 측정지속적인 출력에 유용
첫 토큰까지의 시간초기 응답성을 측정대화형 사용에 중요
꼬리 지연 시간비정상적으로 느린 턴을 포착에이전트 워치독에 중요
캐시 미스율전송 압력을 보여 줌성능 차이의 원인을 설명하는 데 도움
하드웨어 지원 범위엔진을 실행할 수 있는 사용자를 결정속도 비교 전에 확인

신중하게 읽으려면 동일한 조건의 측정도 필요합니다. 엔드투엔드 에이전트 속도에는 첫 토큰까지의 시간과 추론 시간이 포함될 수 있지만, 순수 디코드 속도에는 이러한 작업 일부가 제외됩니다. 측정 정의를 고려하지 않고 이러한 수치를 나란히 비교해서는 안 됩니다.

벤치마크 해석 기준

공개된 수치는 프로젝트 팀이 제시한 유망한 근거로 받아들이세요. 구매 또는 배포를 결정하기 전에 모델 양자화, 프롬프트 길이, 캐시 크기, 하드웨어, 측정 정의를 다시 확인해야 합니다.

FreeToken 설정 및 하드웨어 적합성

현재 FreeToken의 지원 범위는 성숙한 크로스 플랫폼 런타임보다 좁습니다. 공개 분류에서는 베타 개발 상태, 환경으로서의 NVIDIA CUDA, 운영체제 대상으로서의 POSIX Linux를 명시합니다. 검토한 프로젝트 자료에는 Windows 수정, 듀얼 GPU 지원, 구형 NVIDIA 카드, GGUF 지원, Apple Silicon 지원에 대한 요청도 언급되어 있습니다.

따라서 호환성 확인이 첫 번째 설정 단계입니다. 최신 NVIDIA 카드에서 빠른 결과가 나왔다고 해서 동일한 엔진이 Mac, 구형 GeForce 카드 또는 비-CUDA 가속기에서 실행된다는 의미는 아닙니다. 지원되지 않는 구성을 최적화하려 하기보다 지원 환경부터 확인하세요.

1

플랫폼 확인

시스템이 지원되는 NVIDIA CUDA 구성과 호환 가능한 Linux 환경을 사용하는지 확인하세요. macOS, Apple Silicon 또는 구형 GPU를 사용한다면 프로젝트 문서가 변경되지 않은 한 지원되지 않는 것으로 간주하세요.

2

메모리 여유 공간 측정

GPU 메모리와 시스템 메모리를 별도로 확인하세요. 대규모 MoE 모델은 각 토큰에서 일부만 활성화되더라도 전체 전문가 풀이 계속 접근 가능한 상태로 유지되어야 할 수 있습니다.

3

테스트 모델 선택

문서화된 벤치마크 등급과 일치하는 모델 및 양자화 수준으로 시작하세요. 모델 식별자, 양자화 방식, 컨텍스트 길이, 캐시 설정을 기록하세요.

4

실제 작업 부하 테스트

첫 토큰 지연 시간, 지속적인 생성 속도, 캐시 동작, 가장 느린 턴을 비교하세요. 코딩 에이전트나 긴 컨텍스트 워크플로는 짧은 합성 프롬프트와 다른 결과를 낼 수 있습니다.

하드웨어 또는 플랫폼실질적인 기대치권장 사항
Linux가 설치된 최신 NVIDIA GPU공개된 지원 범위와 가장 잘 부합여기서 시작
8GB NVIDIA 노트북 GPU특정 작업 부하에서 잠재적으로 높은 성능신중하게 테스트
구형 NVIDIA GPU지원 요청이 언급됨설정 전에 확인
Apple Silicon Mac검토한 자료에 공개된 Mac 빌드 없음공식 지원 확인까지 대기
Windows 시스템호환성 문제가 보고됨현재 상태 확인

통제된 테스트 디렉터리를 사용하고 구성을 명확하게 기록하세요. 엔진 버전, 모델 파일, 양자화 방식, 프롬프트 형식, 컨텍스트 크기, 측정된 출력을 기록해야 합니다. 이렇게 하면 빠른 결과를 다른 모델이나 더 가벼운 작업 부하의 결과로 착각하는 일을 방지할 수 있습니다.

도입 전 확인 사항:

  • Linux 및 NVIDIA CUDA 호환성 확인
  • 사용 가능한 GPU 및 시스템 메모리 측정
  • 모델, 양자화, 컨텍스트, 캐시 설정 기록
  • 평균 속도와 가장 느린 턴의 지연 시간을 모두 테스트
  • 사용 중인 하드웨어에서 이미 지원되는 런타임과 결과 비교
가장 적합한 사용자

FreeToken은 최신 NVIDIA 하드웨어, 충분한 시스템 메모리, MoE 작업 부하, 그리고 로컬 코딩 에이전트 추론에 대한 높은 수요를 가진 사용자에게 가장 매력적입니다.

강점, 한계 및 프로젝트 전망

FreeToken의 가장 강력한 근거는 모든 로컬 AI 사용자가 즉시 기존 런타임을 교체해야 한다는 데 있지 않습니다. 더 구체적인 가치는 어려운 메모리 대역폭 문제에 대해 라우팅 인식형 해결책을 탐구하고, 호환되는 시스템에서 큰 성능 향상을 보고했다는 점입니다. 에이전트가 전문가 전송으로 자주 멈추는 사용자에게는 대표적인 평균 속도보다 낮은 꼬리 지연 시간이 더 중요할 수 있습니다.

그 대가로 성숙도와 지원 범위에는 한계가 있습니다. 검토한 프로젝트는 llama.cpp에 비해 공개된 개발 역사가 짧았으며, 자료에서는 독립적인 제3자 벤치마크를 확인할 수 없었습니다. 더 폭넓은 하드웨어 지원, 안정적인 패키징, 재현 가능한 외부 테스트가 이 접근 방식이 널리 채택되는 런타임이 될지, 아니면 기존 프로젝트에 흡수되는 기술 모음으로 남을지를 결정할 것입니다.

강점한계의미
라우팅 인식형 전문가 처리더 복잡한 실행 정책MoE의 데이터 지역성이 개선될 가능성
강력하게 보고된 벤치마크 결과프로젝트 작성자가 제시한 결과독립적으로 검증 필요
Apache 라이선스베타 단계 생태계통합 작업이 필요할 수 있음
로컬 실행적합한 하드웨어 필요하드웨어 비용이 여전히 상당함
집중된 최적화좁은 플랫폼 범위범용적인 대체재는 아님

FreeToken의 구체적인 장점이 작업 부하와 일치할 때 사용하세요. 한 종류의 NVIDIA 시스템에서 MoE 성능을 극대화하는 것보다 이식성, 폭넓은 백엔드 지원 또는 예측 가능한 설치가 더 중요하다면 기존 런타임을 함께 유지하는 것이 좋습니다.

로컬 엔진은 처리량 차트에 나타나지 않는 실질적인 이점도 제공할 수 있습니다.

  • 프롬프트와 생성된 콘텐츠를 로컬 머신에 유지할 수 있습니다.
  • 사용량이 서비스 제공업체의 속도 제한이나 서비스 가용성에 종속되지 않습니다.
  • 고정된 로컬 스택은 모델 서비스 변경에 대한 의존성을 줄일 수 있습니다.
  • 하드웨어를 직접 보유하려면 여전히 상당한 초기 비용이 듭니다.
  • 평가에는 에너지 사용량, 메모리 용량, 유지 관리도 포함해야 합니다.
편집자 평가

FreeToken은 집중적이고 유망한 MoE 서비스 프로젝트이지, 모든 상황에서 승리하는 범용 솔루션은 아닙니다. 라우팅 비중이 높은 NVIDIA 작업 부하에는 FreeToken을 선택하고, 호환성과 생태계의 깊이를 중시한다면 더 폭넓은 런타임을 선택하세요.

FreeToken FAQ

Q: FreeToken은 어떤 용도로 사용하나요?

FreeToken은 대규모 혼합 전문가 모델을 로컬에서 서비스하기 위한 엣지 네이티브 추론 엔진입니다. 사용 가능한 메모리 대역폭과 배치에 맞춰 전문가 실행을 조정하는 데 초점을 둡니다.

Q: FreeToken은 Apple Silicon을 지원하나요?

검토한 2026년 자료에는 Mac 빌드나 Apple Silicon 지원이 명시되어 있지 않습니다. 프로젝트가 공식 구현을 발표하기 전까지는 Apple 지원을 제공하지 않는 것으로 간주해야 합니다.

Q: FreeToken이 llama.cpp보다 빠른가요?

프로젝트는 일부 NVIDIA 작업 부하에서 더 높은 처리량과 더 낮은 최악 지연 시간을 보고합니다. 이러한 결과는 유망하지만 동일한 모델과 설정, 독립적인 테스트를 통해 검증해야 합니다.

Q: 누가 FreeToken을 먼저 사용해 봐야 하나요?

최적의 대상은 최신 NVIDIA 하드웨어와 충분한 시스템 메모리, 대규모 MoE 모델을 보유하고 있으며 긴 꼬리 지연 시간으로 인해 실제 문제가 발생하는 코딩 에이전트 작업 부하를 사용하는 사용자입니다.

호환성 알림

단일 초당 토큰 수치만으로 추론 엔진을 선택하지 마세요. 먼저 운영체제 지원, GPU 백엔드, 모델 형식, 메모리 요구 사항, 작업 부하 동작을 확인해야 합니다.