아키텍처

FreeToken 아키텍처

FreeToken이 소비자용 하드웨어에서 거대한 MoE 모델을 실행하는 방식입니다. CPU-GPU 공동 실행, q* 전문가 라우팅, 더블 버퍼 프리필 및 LRU 전문가 캐시를 다룹니다.

아키텍처란 무엇인가요?

아키텍처 문서에서는 FreeToken이 소비자용 하드웨어에서 거대한 전문가 혼합 모델을 실행할 수 있는 이유를 설명합니다. CPU-GPU 공동 실행, q* 전문가 라우팅 정책, 더블 버퍼 프리필, LRU 전문가 캐시, Fourier Token Weighting, 탄력적 메모리 관리 및 중복 계산을 건너뛰는 시맨틱 캐시를 다룹니다.

아키텍처를 이해해야 하는 이유

1

의도에 맞게 조정

오프로딩, 하이브리드 및 캐시 설정이 처리량에 실제로 어떤 영향을 미치는지 이해하세요

2

논문을 자신 있게 읽기

벤치마크 표의 기반이 되는 q* 정책과 FTW 설명을 따라가 보세요

3

병목 현상 진단

느린 프리필 또는 디코드의 원인을 대역폭, 캐시 또는 전문가 배치 문제까지 추적하세요

추천 및 필수

모든 아키텍처 가이드