ARQUITECTURA

Arquitectura de FreeToken

Cómo ejecuta FreeToken modelos MoE gigantes en hardware de consumo: coejecución CPU-GPU, enrutamiento de expertos q*, prefill con doble búfer y caché de expertos LRU.

¿Qué es la arquitectura?

Los artículos de arquitectura explican por qué FreeToken puede ejecutar modelos gigantes de mixture-of-experts en hardware de consumo. Cubren la coejecución CPU-GPU, la política de enrutamiento de expertos q*, el prefill con doble búfer, la caché de expertos LRU, Fourier Token Weighting, la gestión de memoria elástica y la caché semántica que omite cálculos redundantes.

¿Por qué entender la arquitectura?

1

Ajusta con intención

Comprende cómo afectan realmente al rendimiento la descarga de capas, la ejecución híbrida y la configuración de la caché

2

Lee el artículo con confianza

Sigue las explicaciones de la política q* y FTW que sustentan las tablas de benchmarks

3

Diagnostica los cuellos de botella

Determina si un prefill o decode lento se debe al ancho de banda, la caché o la ubicación de los expertos

Destacadas y esenciales

Todas las guías de arquitectura