- Las búsquedas de FreeToken github moe suelen referirse a un runtime abierto de servicio de modelos MoE, no a un modelo ni a un juego.
- Mejor caso de uso: Ejecutar modelos grandes de mezcla de expertos que superan la memoria disponible de la GPU.
- Ventaja principal: Caché adaptativa de expertos, transferencias superpuestas y equilibrio de cargas entre CPU y GPU.
- Limitación principal: La configuración acelerada se centra actualmente en Linux, GPU NVIDIA y CUDA 13.
- Comparación clave: FreeToken está especializado, mientras que llama.cpp admite más plataformas y formatos de modelo.
FreeToken github moe: Qué hace el runtime
FreeToken es un motor de inferencia en el borde diseñado para servir modelos grandes de mezcla de expertos (MoE) en hardware personal. Si buscas “FreeToken github moe”, la distinción importante es que FreeToken es software de servicio, no un modelo de lenguaje nuevo. Carga checkpoints compatibles y coordina la GPU, la CPU, la memoria del sistema y la conexión PCIe durante la inferencia.
El sistema está dirigido a modelos cuyo número total de parámetros es mucho mayor que la VRAM disponible. Un modelo MoE activa solo un subconjunto de expertos para cada token, lo que hace manejable el cálculo por token. Sin embargo, el conjunto completo de expertos aún debe permanecer en algún lugar de la memoria. FreeToken mantiene el conjunto completo en la memoria del sistema mientras utiliza la VRAM como una caché adaptativa de expertos.
Aspectos destacados del video:
- FreeToken se presenta como una alternativa especializada a llama.cpp para modelos MoE sobredimensionados.
- Las pruebas publicadas incluyen Qwen3.6-35B-A3B, DeepSeek-V4-Flash y GLM-5.2.
- El runtime está diseñado para sesiones prolongadas con agentes de programación y llamadas a herramientas.
- Los requisitos de hardware dependen de la VRAM, la RAM del sistema, el ancho de banda de la CPU y el ancho de banda PCIe.
El artículo de investigación de FreeToken describe tres mecanismos principales:
| Mecanismo | Función | Por qué es importante |
|---|---|---|
| Caché con conciencia semántica | Conserva en la VRAM los expertos direccionados recientemente | Reduce las recuperaciones repetidas desde la memoria del sistema |
| Ejecución adaptada al ancho de banda | Divide los fallos de caché entre la transferencia a la GPU y la ejecución en la CPU | Utiliza el equilibrio real del hardware |
| Gestión elástica de memoria | Cambia el tamaño de la caché de expertos a medida que cambian las necesidades de memoria | Conserva espacio para ventanas de contexto crecientes |
El artículo informa que FreeToken puede servir modelos de la clase de 35.000 millones de parámetros en una GPU de portátil con 8 GB, siempre que los pesos restantes quepan en la memoria del sistema. Esto no significa que el modelo requiera solo 8 GB de memoria total. La GPU aloja el cálculo activo y los expertos almacenados en caché, mientras que la RAM del sistema guarda el conjunto más grande residente en el host.
Piensa en FreeToken como un controlador de tráfico para modelos MoE sobredimensionados. Decide qué expertos deben permanecer en la VRAM, cuáles deben transferirse mediante PCIe y cuáles conviene procesar directamente en la CPU cuando no están en la caché.
Perfil de rendimiento y niveles de hardware
FreeToken resulta especialmente interesante cuando un modelo no cabe por completo en la VRAM. Si el modelo cuantizado completo ya cabe en tu GPU, un runtime convencional puede seguir siendo muy competitivo porque evita las transferencias repetidas entre la memoria del sistema y la VRAM.
Los resultados publicados para la RTX 5090 muestran comportamientos diferentes según el modelo y la carga de trabajo:
| Modelo | Parámetros totales | Parámetros activos | Velocidad de FreeToken publicada |
|---|---|---|---|
| Qwen3.6-35B-A3B | 35B | 3B | 77–83 tokens/s |
| DeepSeek-V4-Flash | 284B | 13B | 22–25 tokens/s |
| GLM-5.2 | 753B | 40B | 14.9 tokens/s |
| Versión para portátil de Qwen3.6 | 35B | 3B | 39.3 tokens/s |
Estas cifras proceden de la evaluación publicada por el proyecto, por lo que deben considerarse resultados reportados y no garantías universales. La precisión del modelo, la longitud del prompt, la memoria del sistema, la arquitectura de la CPU, el enlace PCIe y las aplicaciones en segundo plano pueden cambiar considerablemente el rendimiento.
El sistema también pone énfasis en el tiempo hasta el primer token (TTFT) durante las cargas de trabajo agénticas. Un agente de programación lee archivos repetidamente, llama a herramientas, recibe resultados y envía nuevas solicitudes con un contexto cada vez mayor. FreeToken utiliza checkpoints de prefijo y de estado recurrente en límites semánticos, lo que permite reutilizar las secciones de contexto que no han cambiado después de las llamadas a herramientas o de las ediciones del contexto.
| Nivel de hardware | Configuración de ejemplo | Resultado publicado | Restricción principal |
|---|---|---|---|
| Portátil | RTX 4060, 8 GB de VRAM, 32 GB de RAM | 39.3 tokens/s en Qwen3.6 | PCIe x8 y ancho de banda de memoria limitado |
| Sobremesa | RTX 5090, host de consumo | Sólido rendimiento de decodificación MoE | Memoria del host de doble canal |
| GPU de clase servidor | RTX 5090 con mayor ancho de banda del host | Hasta 77–83 tokens/s en Qwen3.6 | Requiere una pila NVIDIA compatible |
| Estación de trabajo | RTX PRO 6000, 96 GB de VRAM | 14.9 tokens/s en GLM-5.2 | Checkpoint grande residente en el host |
La evaluación compara FreeToken con llama.cpp, KTransformers, Ollama y MoE-Infinity. La ventaja reportada es mayor en los casos en que los pesos de los expertos deben moverse con frecuencia y la carga de trabajo contiene contextos largos y cambiantes.
Una cifra de tokens por segundo no describe toda la experiencia de usuario. En las cargas de trabajo con agentes, las largas pausas de TTFT pueden importar más que la velocidad máxima de decodificación, especialmente cuando el cliente tiene un watchdog de inactividad o un tiempo de espera para las solicitudes.
VRAM reducida
Una GPU de 8 GB puede participar en el servicio de un checkpoint MoE más grande cuando la RAM del sistema contiene el conjunto restante de expertos.
Contexto largo
Los checkpoints semánticos reducen el trabajo repetido de prellenado después de las llamadas a herramientas y las ediciones estructuradas del contexto.
Caché adaptativa
La caché LRU compartida sigue el direccionamiento reciente en lugar de depender de una ubicación fija de los expertos.
Co-ejecución con la CPU
Algunos fallos de caché pueden ejecutarse directamente desde la memoria del sistema cuando el ancho de banda de la CPU hace que esa ruta sea más rápida.
Proceso de configuración de FreeToken para sistemas compatibles
La documentación acelerada descrita en el material disponible se centra en Linux x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto también menciona compatibilidad de escritorio con Windows y Linux, pero la ruta mejor documentada sigue siendo Linux con hardware NVIDIA.
Utiliza la siguiente secuencia de configuración como guía de planificación. Confirma los comandos actuales y los checkpoints compatibles a través del canal oficial de lanzamientos del proyecto antes de instalar, ya que la compatibilidad del runtime puede cambiar.
Verifica la plataforma
Confirma que la máquina utiliza Linux en x86-64, una GPU NVIDIA RTX de las series 30, 40 o 50, un controlador reciente y un entorno CUDA 13 compatible. Registra la VRAM disponible, la RAM del sistema, el ancho de banda de memoria de la CPU y el ancho del enlace PCIe.
Elige un checkpoint compatible
Selecciona una familia de modelos incluida en el proyecto, como Qwen3.6-35B-A3B, DeepSeek-V4-Flash o GLM-5.2. Comprueba la precisión requerida y el tamaño total del checkpoint antes de descargarlo.
Reserva memoria del host
Asegúrate de que la RAM del sistema pueda contener el conjunto completo de expertos residente en el host, además del sistema operativo, la sobrecarga de las aplicaciones, la caché de contexto y cualquier otro modelo o servicio que se ejecute simultáneamente.
Prepara el runtime
Instala la compilación documentada de FreeToken, configura la ruta del modelo compatible y permite que el motor perfile el procesamiento en el host y el ancho de banda de transferencia PCIe en la máquina de destino.
Conecta un cliente
Inicia el endpoint compatible con OpenAI o Anthropic y conecta después un agente de programación compatible o una aplicación local. Comienza con una solicitud corta antes de probar sesiones largas de varios turnos.
El diseño del proyecto utiliza un formato de almacenamiento FTW para normalizar los bancos de expertos en una disposición que pueda cargarse de forma eficiente. Si una distribución compatible proporciona un formato preprocesado, puede reducir el trabajo de inicio al evitar el descubrimiento y reempaquetado repetidos de tensores.
| Comprobación de configuración | Pregunta recomendada | Riesgo de fallo |
|---|---|---|
| Compatibilidad de la GPU | ¿La arquitectura NVIDIA es compatible con la compilación actual? | Kernels ausentes o rendimiento reducido |
| Pila CUDA | ¿El controlador coincide con el entorno CUDA requerido? | Errores al iniciar el runtime |
| RAM del sistema | ¿La RAM puede contener el checkpoint completo y la sobrecarga de las aplicaciones? | Uso de swap o fallo de carga |
| Almacenamiento | ¿El modelo está almacenado en una unidad NVMe rápida? | Mayor tiempo de inicio |
| Protocolo de API | ¿El cliente admite la compatibilidad con OpenAI o Anthropic? | Problemas de conexión o de llamadas a herramientas |
Comienza con un modelo que deje un margen claro de RAM del sistema. Un inicio correcto no es suficiente; el sistema debe seguir respondiendo mientras el modelo, la caché de contexto, el escritorio y el cliente funcionan conjuntamente.
FreeToken frente a llama.cpp y otros runtimes
FreeToken no debe considerarse un reemplazo universal de llama.cpp. Ambos proyectos optimizan prioridades diferentes. llama.cpp es compatible con una combinación mucho más amplia de sistemas operativos, CPU, fabricantes de GPU, dispositivos Apple Silicon y modelos GGUF. FreeToken, en cambio, se centra en el difícil caso de servir modelos MoE muy grandes cuyos expertos desbordan la memoria de la GPU.
| Runtime | Ventaja principal | Amplitud de plataformas | Mejor opción para |
|---|---|---|---|
| FreeToken | Servicio MoE adaptativo y coordinación entre CPU y GPU | Ruta rápida más limitada y centrada en NVIDIA | Modelos MoE sobredimensionados en sistemas compatibles |
| llama.cpp | Ecosistema maduro y amplia compatibilidad de hardware | Muy amplia | Inferencia local general |
| KTransformers | Ejecución híbrida CPU-GPU para modelos seleccionados | Selectiva | Cargas MoE con kernels compatibles |
| Ollama | Gestión sencilla de modelos locales y acceso a la API | Amplia, pero depende del modelo | Implementaciones locales prácticas |
| MoE-Infinity | Enfoque especializado para servir modelos MoE | Limitada por la compatibilidad con la carga de trabajo | Escenarios seleccionados de un solo turno o de investigación |
Las ventajas publicadas de FreeToken proceden de la combinación de varias políticas, en lugar de depender de una sola optimización:
- Caché LRU compartida de expertos: sigue la localidad del direccionamiento a nivel de token.
- Prellenado con doble búfer: solapa el movimiento de expertos de la siguiente capa con el cálculo actual.
- Planificación adaptada al ancho de banda: mide la máquina real en lugar de asumir que todos los sistemas tienen el mismo equilibrio entre PCIe y DRAM.
- Redimensionamiento elástico de la caché: ajusta la división de la VRAM entre los expertos y la creciente demanda de la caché KV.
- Reutilización de prefijos: ayuda a que las sesiones con agentes eviten recalcular el contexto sin cambios después de las interacciones con herramientas.
Elige FreeToken cuando la mayoría de las siguientes afirmaciones sean ciertas:
- Tu modelo objetivo es un checkpoint MoE que supera la VRAM disponible.
- Tienes suficiente RAM del sistema para el modelo completo.
- Tu GPU es NVIDIA y la pila de software es compatible.
- Te interesan los agentes de programación o de llamadas a herramientas de larga duración.
- Te sientes cómodo con una configuración más especializada.
Elige llama.cpp u otro runtime general cuando la portabilidad, la variedad de modelos, Apple Silicon, la compatibilidad con AMD, la operación en CPU o la compatibilidad con GGUF sean más importantes que el rendimiento máximo en modelos MoE sobredimensionados.
Utiliza FreeToken para resolver el problema del desbordamiento. Utiliza un runtime más amplio cuando el modelo quepa en la VRAM o cuando la compatibilidad multiplataforma sea tu requisito principal.
Lista de validación y errores comunes
La arquitectura de FreeToken hace que los modelos locales grandes sean más accesibles, pero no elimina sus requisitos de almacenamiento o memoria. Una GPU de 8 GB no convierte un checkpoint de 35B o 284B en una instalación de 8 GB. El modelo completo sigue necesitando memoria del host, almacenamiento y un runtime compatible.
Antes de iniciar FreeToken:
- Confirma la compatibilidad de Linux, x86-64, la GPU NVIDIA, el controlador y CUDA
- Mide la VRAM y la RAM del sistema disponibles después del uso normal del escritorio
- Verifica que el checkpoint completo quepa en la memoria del host
- Selecciona un modelo y una precisión compatibles oficialmente
- Prueba una solicitud corta antes de conectar un agente de larga duración
- Registra por separado los tokens por segundo y el tiempo hasta el primer token
| Error | Por qué causa problemas | Mejor enfoque |
|---|---|---|
| Medir solo la velocidad máxima de decodificación | Ignora el procesamiento del prompt y las demoras del agente | Registra la velocidad de decodificación, el TTFT y la estabilidad en turnos largos |
| Tratar la VRAM como la memoria total del modelo | Los expertos residentes en el host siguen necesitando RAM | Calcula el tamaño total del checkpoint |
| Esperar una caché estática | El direccionamiento cambia entre tokens y cargas de trabajo | Permite que la caché adaptativa siga el uso actual |
| Ignorar las aplicaciones en segundo plano | Los navegadores y las herramientas de escritorio consumen VRAM y RAM | Deja margen para el runtime antes de realizar las pruebas |
| Comparar cuantizaciones diferentes | La precisión cambia la memoria y la velocidad | Compara checkpoints y formatos equivalentes |
Para realizar pruebas fiables, utiliza el mismo modelo, precisión, prompt, cliente y carga de trabajo en todos los runtimes. Un prompt corto de una sola interacción sirve para comprobar que el servidor funciona, pero no representa a un agente de programación de varios turnos. Ejecuta varios turnos, incluye llamadas a herramientas si corresponde y registra el TTFT más lento en lugar de solo el promedio.
La evaluación publicada por el proyecto informa de que el peor turno probado de FreeToken se mantuvo por debajo de 44 segundos, mientras que los runtimes de referencia superaron demoras mucho mayores en algunas celdas. Estos valores son útiles para comprender el objetivo de diseño, pero los resultados locales variarán según el hardware y las versiones de software.
Registra con cada resultado el nombre del modelo, la cuantización, la GPU, la VRAM, la RAM del sistema, la CPU, el enlace PCIe, la longitud del contexto y el protocolo del cliente. Sin esos datos, las comparaciones de la comunidad son difíciles de reproducir.
Q: ¿Qué es FreeToken en el contexto de GitHub y los modelos MoE?
FreeToken es un sistema de inferencia y servicio en el borde para modelos grandes de mezcla de expertos. Es software que ejecuta checkpoints compatibles, no un modelo independiente.
Q: ¿Puede FreeToken ejecutar un modelo más grande que la VRAM de la GPU?
Sí. Su diseño mantiene el conjunto completo de expertos en la memoria del host mientras utiliza la memoria de la GPU como caché adaptativa. El sistema aún necesita suficiente RAM y almacenamiento para el checkpoint completo.
Q: ¿Es FreeToken más rápido que llama.cpp en todas las máquinas?
No. FreeToken está especializado en cargas de trabajo MoE sobredimensionadas, especialmente en sesiones agénticas prolongadas. llama.cpp sigue siendo una opción atractiva cuando el modelo cabe en la VRAM o se necesita una compatibilidad de hardware más amplia.
Q: ¿Qué hardware requiere la configuración acelerada?
La ruta rápida documentada se centra en Linux x86-64, una GPU NVIDIA, CUDA 13, un controlador reciente, suficiente RAM del sistema y un checkpoint de modelo compatible.