아키텍처
FreeToken 아키텍처
FreeToken이 소비자용 하드웨어에서 거대한 MoE 모델을 실행하는 방식입니다. CPU-GPU 공동 실행, q* 전문가 라우팅, 더블 버퍼 프리필 및 LRU 전문가 캐시를 다룹니다.
아키텍처란 무엇인가요?
아키텍처 문서에서는 FreeToken이 소비자용 하드웨어에서 거대한 전문가 혼합 모델을 실행할 수 있는 이유를 설명합니다. CPU-GPU 공동 실행, q* 전문가 라우팅 정책, 더블 버퍼 프리필, LRU 전문가 캐시, Fourier Token Weighting, 탄력적 메모리 관리 및 중복 계산을 건너뛰는 시맨틱 캐시를 다룹니다.
아키텍처를 이해해야 하는 이유
1
의도에 맞게 조정
오프로딩, 하이브리드 및 캐시 설정이 처리량에 실제로 어떤 영향을 미치는지 이해하세요
2
논문을 자신 있게 읽기
벤치마크 표의 기반이 되는 q* 정책과 FTW 설명을 따라가 보세요
3
병목 현상 진단
느린 프리필 또는 디코드의 원인을 대역폭, 캐시 또는 전문가 배치 문제까지 추적하세요
추천 및 필수
모든 아키텍처 가이드
튜토리얼
FreeToken 엣지 네이티브 MoE 서빙: 아키텍처 가이드
FreeToken이 대규모 MoE 모델을 엣지 하드웨어에서 서빙하기 위해 대역폭 적응형 실행, 캐싱, CPU-GPU 조정을 사용하는 방법을 알아보세요.
가이드
FreeToken github moe: 설정 가이드 및 MoE 런타임 비교
FreeToken이 대규모 MoE 모델을 어떻게 서비스하는지, 어떤 하드웨어가 필요한지, 그리고 적응형 런타임이 llama.cpp와 어떻게 비교되는지 알아보세요.
가이드
FreeToken: 엣지 네이티브 MoE 설정 가이드 및 비교
FreeToken이 대규모 혼합 전문가 모델을 로컬에서 제공하는 방식, llama.cpp와 라우팅 인식 캐시를 비교하는 방법, 하드웨어 적합성을 알아봅니다.