FreeToken linux: guía de configuración, límites y benchmarks - Guía

FreeToken linux: guía de configuración, límites y benchmarks

Descubre cómo FreeToken ejecuta grandes modelos MoE en hardware Linux, qué admite y cómo se compara su diseño de caché y ancho de banda.

2026-08-25
Equipo de FreeToken
Guía rápida
  • FreeToken linux se centra en servir modelos MoE localmente mediante hardware CUDA y memoria del sistema.
  • Más adecuado para: Sistemas NVIDIA recientes con una cantidad considerable de RAM y ancho de banda PCIe.
  • Ventaja principal: Una caché de expertos consciente del enrutamiento se adapta al comportamiento del modelo a nivel de token.
  • Limitación principal: Linux es el objetivo de compatibilidad más claro, mientras que no se indica compatibilidad con macOS.
  • Resultado clave: Las mejoras reportadas son más significativas en modelos MoE grandes y cargas de trabajo agénticas.

Descripción general de FreeToken linux y mejor caso de uso

FreeToken linux es un sistema de inferencia local en fase beta diseñado para servir grandes modelos de mezcla de expertos en hardware personal. En lugar de exigir que todos los pesos de los expertos permanezcan en la memoria de la GPU, mantiene el conjunto completo de expertos en la memoria del sistema y utiliza la VRAM disponible como una caché elástica. Esto convierte el proyecto en un entorno de ejecución de sistemas, no en un modelo, juego o plataforma de códigos de recompensa.

Los usuarios más adecuados son desarrolladores que ejecutan modelos grandes de pesos abiertos mediante agentes de programación, matemáticas o uso de herramientas. FreeToken resulta especialmente relevante cuando un modelo supera la VRAM disponible, pero mantiene una activación dispersa. El objetivo del sistema es convertir los recursos de la GPU, CPU, RAM y PCIe de consumo en una plataforma de inferencia coordinada.

Aspectos destacados del vídeo:

  • FreeToken está orientado al servicio local de modelos con cientos de miles de millones de parámetros.
  • La caché consciente del enrutamiento reduce las transferencias innecesarias de expertos durante la decodificación.
  • Los benchmarks reportados incluyen equipos de escritorio NVIDIA, estaciones de trabajo y una GPU de portátil de 8 GB.
  • Linux y NVIDIA CUDA son el entorno compatible más claro según los metadatos disponibles del proyecto.
ÁreaLo que ofrece FreeTokenSignificado práctico
Enfoque del runtimeServicio MoE nativo para edgeLos modelos dispersos grandes pueden ejecutarse fuera de un centro de datos
Plataforma principalLinux POSIX con NVIDIA CUDALos usuarios de Linux tienen el entorno objetivo más claro
Modelo de memoriaExpertos residentes en el sistema más caché de GPULos pesos completos del modelo no tienen que caber en la VRAM
Enfoque de carga de trabajoInferencia agénticaEl contexto de varios turnos y las llamadas a herramientas son aspectos prioritarios
Madurez del proyectoSistema en fase betaSe esperan cambios de compatibilidad y empaquetado
Mejor punto de partida

Considera FreeToken como un runtime de inferencia Linux especializado. Resulta más atractivo cuando ya dispones de hardware NVIDIA compatible, suficiente memoria del sistema y una carga de trabajo que utiliza repetidamente un modelo MoE grande.

Cómo gestiona FreeToken la memoria MoE

Un modelo de mezcla de expertos contiene muchas redes expertas, pero un router activa solo un pequeño subconjunto para cada token. El artículo de referencia utiliza DeepSeek-V4-Flash como ejemplo: seis de los 256 expertos enrutados se activan en cada capa, con 13B de parámetros activos de un modelo de 284B parámetros. La activación dispersa reduce el cálculo, pero todos los pesos de los expertos aún deben permanecer accesibles.

FreeToken separa el modelo en un conjunto de expertos residente en la CPU y un conjunto de trabajo residente en la GPU. La caché de GPU utiliza una política LRU compartida entre las capas MoE, lo que permite que los expertos seleccionados recientemente permanezcan disponibles para tokens futuros. Cuando falta un experto, el runtime puede transferirlo a la GPU o ejecutarlo directamente en la CPU.

Nivel de memoriaDatos almacenadosFunción durante la inferencia
Memoria de GPUPesos no expertos, caché KV, espacios para expertosEjecución rápida y expertos utilizados recientemente
Memoria del sistemaConjunto completo de expertos enrutadosFuente de verdad para el modelo MoE completo
Enlace PCIeTransferencias de expertos y datos del runtimeMueve las ausencias seleccionadas a la memoria de la GPU
Núcleos de CPUEjecución directa de ausencias seleccionadasUtiliza el ancho de banda restante del sistema en lugar de esperar
Almacenamiento NVMeModelo original o archivos de pesos preparadosFuente para el inicio y la conversión de formato

El runtime mide dos anchos de banda: el ancho de banda de procesamiento de expertos del sistema y el ancho de banda de transferencia fijada mediante PCIe. Después estima cuántos expertos ausentes deben incorporarse a la caché de GPU y cuántos deben ejecutarse directamente en la CPU. Este enfoque evita tratar todas las configuraciones de hardware como si fueran idénticas.

Durante el prellenado, FreeToken utiliza doble búfer para la capa completa. Mientras se ejecuta una capa, los expertos de la siguiente pueden transmitirse mediante PCIe. Durante la decodificación, la caché compartida sigue las decisiones cambiantes del router. La misma caché admite ambas fases, lo que ayuda a evitar una costosa transferencia entre grupos de memoria separados para prellenado y decodificación.

MecanismoProblema abordadoPor qué importa
Caché LRU compartida de expertosCambios de enrutamiento entre tokensLa residencia en la GPU sigue la demanda reciente
Ejecución adaptada al ancho de bandaAlgunos expertos no están en la cachéLa CPU y la GPU pueden atender las ausencias simultáneamente
Doble búfer para la capa completaLas transferencias de prellenado detienen la ejecuciónEl movimiento de expertos se solapa con el cálculo
Puntos de control del estado semánticoEl contexto del agente se edita repetidamenteLos prefijos conservados necesitan menos recomputación
Redimensionamiento de caché elásticaCambia la VRAM disponibleLa capacidad de la caché puede adaptarse sin reiniciar
La memoria sigue siendo la principal limitación

La activación dispersa no elimina los requisitos de memoria. El conjunto completo de expertos debe permanecer accesible en la memoria del sistema y los archivos del modelo pueden ser extremadamente grandes. Comprueba la RAM del sistema, la capacidad de almacenamiento y el ancho de banda de memoria antes de evaluar la velocidad de la GPU.

Ruta de configuración de FreeToken linux

Las fuentes disponibles identifican Linux, NVIDIA CUDA, los sistemas operativos POSIX y el estado de desarrollo beta como el entorno más claro. Dado que el empaquetado puede cambiar rápidamente, utiliza las instrucciones de lanzamiento actuales del proyecto en flashml.ai en lugar de copiar comandos de una guía desactualizada.

1

Confirma el perfil de hardware

Verifica que el equipo utilice una GPU NVIDIA compatible y un entorno CUDA adecuado. Registra la VRAM disponible, la RAM del sistema, el ancho del enlace PCIe, la capacidad de almacenamiento y el ancho de banda de la memoria del sistema. Estos valores influyen en el tamaño de la caché de expertos y en la distribución entre las transferencias a la GPU y la ejecución en la CPU.

2

Prepara el runtime de Linux

Utiliza un entorno Linux POSIX compatible e instala las dependencias actuales especificadas por el proyecto. Mantén el controlador NVIDIA y la pila CUDA alineados con los requisitos de la versión. Dado que FreeToken es software beta según los metadatos disponibles, no des por sentado que un paquete creado para una distribución funcionará exactamente igual en otra.

3

Prepara los pesos del modelo

Elige un checkpoint MoE compatible y asegúrate de que el conjunto completo de expertos quepa en la memoria del sistema. El formato FTW de FreeToken almacena los bancos de expertos en el diseño del runtime, reduciendo el descubrimiento y el reempaquetado de tensores durante el inicio. Reserva suficiente espacio NVMe para el checkpoint de origen y cualquier representación preparada.

4

Perfila y prueba una solicitud pequeña

Permite que el runtime mida el procesamiento en el sistema y el ancho de banda de transferencia PCIe, y comienza después con un prompt corto. Confirma que el modelo se carga, que la caché de GPU se inicializa y que la gestión de ausencias entre CPU y GPU funciona antes de pasar a sesiones agénticas prolongadas.

5

Ajusta el sistema para la carga de trabajo real

Prueba el mismo patrón de programación, matemáticas o uso de herramientas que esperas ejecutar en producción. Observa el tiempo hasta el primer token, la latencia del peor turno, el uso de RAM, la presión sobre la VRAM y la finalización de solicitudes, en lugar de depender únicamente del rendimiento medio de decodificación.

Comprobación de configuraciónCondición objetivoSeñal de fallo
Backend de GPUEntorno compatible con NVIDIA CUDAEl runtime no puede inicializar la ruta de GPU
Sistema operativoLinux POSIX como objetivoEmpaquetado no compatible o ausencia de fallback
Memoria del sistemaCapacidad suficiente para el conjunto completo de expertosEl cargado falla o el paginado se vuelve excesivo
AlmacenamientoCapacidad NVMe para el checkpoint y los archivos preparadosPreparación prolongada o espacio insuficiente
Prueba del runtimeEl prompt corto se completa correctamenteError de caché, controlador o formato del modelo

Antes de ejecutar una sesión prolongada:

  • Confirma la compatibilidad del controlador NVIDIA y CUDA
  • Reserva suficiente RAM para el conjunto completo de expertos
  • Comprueba el espacio NVMe para los archivos del modelo de origen y FTW
  • Mide el rendimiento del enlace PCIe y de la memoria del sistema
  • Prueba un prompt corto antes de iniciar un agente
Regla de validación

Una configuración exitosa implica más que cargar un modelo una sola vez. Confirma que una solicitud de varios turnos se complete sin una latencia de cola excesiva, ya que las cargas de trabajo agénticas ponen a prueba repetidamente el prellenado, la reutilización de la caché y las ausencias de expertos.

Rendimiento, compatibilidad y compromisos

La evaluación publicada de FreeToken informa de sus mejores resultados en modelos MoE grandes y cargas de trabajo agénticas. En una RTX 5090, el sistema alcanza entre 77 y 83 tokens por segundo en Qwen3.6-35B y entre 22 y 25 tokens por segundo en DeepSeek-V4-Flash. La evaluación también informa de 39,3 tokens por segundo en un portátil con RTX 4060 y una GPU de 8 GB, y de 14,9 tokens por segundo para GLM-5.2 en una única RTX PRO 6000.

La misma evaluación destaca el tiempo de cola hasta el primer token. El peor turno reportado de FreeToken se mantuvo por debajo de 44 segundos en las celdas probadas, mientras que los bloqueos de referencia superaron valores mucho mayores en algunas configuraciones. Estas mediciones proceden de la propia evaluación del proyecto, por lo que las pruebas independientes siguen siendo útiles antes de tomar decisiones de despliegue.

Modelo o nivelHardwareResultado reportado de FreeTokenContexto
Qwen3.6-35B-A3BRTX 509077–83 tok/sCargas de trabajo agénticas
DeepSeek-V4-FlashRTX 509022–25 tok/sCargas de trabajo agénticas
Qwen3.6-35B-A3BPortátil RTX 4060, 8 GB39,3 tok/sLanzamiento NVFP4, PCIe x8
GLM-5.2RTX PRO 6000, 96 GB14,9 tok/sDemostración a escala 753B
TTFT de cola de FreeTokenConfiguraciones probadasMenos de 44 segundosResultado reportado del peor turno

La comparación con llama.cpp no se reduce simplemente a la velocidad media. El análisis de referencia informa de que la caché LRU global de FreeToken no encontró el 16 % de las lecturas de expertos de Qwen3.6 con una determinada capacidad de caché en una RTX 5090, frente al 62 % de fallos con una división estática ajena al enrutamiento. Para DeepSeek-V4-Flash en el mismo punto de comparación, FreeToken registró un 39 % de fallos, mientras que las políticas estáticas citadas fallaron con mayor frecuencia.

Sin embargo, la compatibilidad es un compromiso importante. Los metadatos disponibles del proyecto identifican Linux y NVIDIA CUDA como el entorno compatible. Las solicitudes de compatibilidad con tarjetas NVIDIA antiguas, Docker con doble GPU, GGUF, correcciones para Windows y Apple Silicon se describieron como problemas abiertos durante el periodo de lanzamiento. Los proyectos existentes pueden ofrecer una cobertura de hardware más amplia, incluso cuando FreeToken presenta una ventaja de rendimiento en una clase más limitada de sistemas.

Dónde destaca FreeToken

  • Checkpoints MoE grandes
  • GPUs NVIDIA recientes
  • Agentes de programación de larga duración
  • Cargas de trabajo sensibles a la latencia de cola

Dónde gana la compatibilidad

  • Sistemas Apple Silicon
  • Hardware NVIDIA antiguo
  • Configuraciones mixtas o con varias GPU
  • Flujos de trabajo multiplataforma consolidados

Qué medir

  • TTFT del peor turno
  • Tasa de fallos de la caché de expertos
  • Presión sobre la RAM del sistema
  • Tasa de finalización de solicitudes
Evalúa los benchmarks con cuidado

Utiliza las cifras publicadas como una referencia útil, no como una garantía universal. El ancho de banda del hardware, el formato del modelo, la longitud del prompt, las aplicaciones simultáneas y el comportamiento del entorno del agente pueden cambiar sustancialmente los resultados locales.

Preguntas frecuentes y lista de comprobación práctica de FreeToken linux

FreeToken se entiende mejor como un sistema de servicio nativo para edge destinado a la inferencia local de modelos MoE de pesos abiertos. No hace que todos los modelos sean adecuados para cualquier ordenador y no debe evaluarse únicamente por los tokens por segundo máximos. Los usuarios de Linux deben priorizar las comprobaciones de compatibilidad, la planificación de memoria y las pruebas realistas de varios turnos.

Los detalles técnicos están documentados en el artículo de FreeToken en arXiv, publicado el 24 de agosto de 2026. El artículo explica la arquitectura de caché, la política adaptada al ancho de banda, la gestión elástica de memoria, el enfoque de implementación y la metodología de evaluación.

Q: ¿Qué es FreeToken linux?

FreeToken linux es un runtime de inferencia local centrado en Linux para grandes modelos de mezcla de expertos. Coordina la memoria de la GPU, la ejecución de la CPU, la RAM del sistema y las transferencias PCIe para que los modelos que superan la VRAM disponible sigan siendo utilizables en hardware edge.

Q: ¿FreeToken es compatible con macOS o Apple Silicon?

La información disponible del proyecto en 2026 no incluye una compilación para Mac ni indica compatibilidad con Apple Silicon. Considera Linux con NVIDIA CUDA como el objetivo compatible más claro hasta que cambie la documentación oficial de plataformas.

Q: ¿Por qué FreeToken puede ejecutar modelos que superan la memoria de la GPU?

El enrutamiento MoE activa solo un subconjunto de expertos para cada token. FreeToken mantiene el conjunto completo de expertos en la memoria del sistema y utiliza la VRAM como una caché consciente del enrutamiento, mientras que las ausencias seleccionadas pueden transferirse a la GPU o ejecutarse directamente en la CPU.

Q: ¿FreeToken es más rápido que llama.cpp en cualquier ordenador?

No. La ventaja reportada es más fuerte en hardware NVIDIA reciente que ejecuta modelos MoE grandes y cargas de trabajo agénticas. llama.cpp sigue siendo una opción práctica cuando la amplia compatibilidad de hardware y un flujo multiplataforma consolidado importan más que el rendimiento MoE especializado.

Recomendación editorial

Elige FreeToken cuando tu prioridad sea servir modelos MoE localmente en hardware Linux NVIDIA compatible. Elige un runtime más amplio cuando la cobertura de plataformas, un despliegue más sencillo o la compatibilidad con formatos de modelos existentes sean el factor decisivo.