Arquitectura de FreeToken
Cómo ejecuta FreeToken modelos MoE gigantes en hardware de consumo: coejecución CPU-GPU, enrutamiento de expertos q*, prefill con doble búfer y caché de expertos LRU.
¿Qué es la arquitectura?
Los artículos de arquitectura explican por qué FreeToken puede ejecutar modelos gigantes de mixture-of-experts en hardware de consumo. Cubren la coejecución CPU-GPU, la política de enrutamiento de expertos q*, el prefill con doble búfer, la caché de expertos LRU, Fourier Token Weighting, la gestión de memoria elástica y la caché semántica que omite cálculos redundantes.
¿Por qué entender la arquitectura?
Ajusta con intención
Comprende cómo afectan realmente al rendimiento la descarga de capas, la ejecución híbrida y la configuración de la caché
Lee el artículo con confianza
Sigue las explicaciones de la política q* y FTW que sustentan las tablas de benchmarks
Diagnostica los cuellos de botella
Determina si un prefill o decode lento se debe al ancho de banda, la caché o la ubicación de los expertos
Destacadas y esenciales
Cuantización de FreeToken: guía de configuración para inferencia MoE
Aprende cómo FreeToken gestiona modelos MoE cuantizados, niveles de memoria, requisitos de hardware, almacenamiento en caché y configuración de inferencia local en 2026.
Artículo de FreeToken: Comparativa y guía de configuración del servicio MoE
Explora el artículo de FreeToken, su diseño de servicio MoE adaptado al ancho de banda, las afirmaciones de sus benchmarks, sus limitaciones de hardware y los pasos prácticos para evaluarlo.
Todas las guías de arquitectura
Servicio MoE nativo del edge de FreeToken: Guía de arquitectura
Descubre cómo FreeToken utiliza ejecución adaptativa al ancho de banda, almacenamiento en caché y coordinación entre CPU y GPU para servir modelos MoE grandes en hardware edge.
FreeToken github moe: Guía de configuración y comparación de runtimes MoE
Descubre cómo FreeToken sirve modelos MoE sobredimensionados, qué hardware necesita y cómo se compara su runtime adaptativo con llama.cpp.
FreeToken: Guía de configuración y comparación de MoE nativo del edge
Descubre cómo FreeToken sirve localmente modelos grandes de mezcla de expertos, compara su caché consciente del enrutamiento con llama.cpp y evalúa su compatibilidad de hardware.