- FreeToken linux se centra en servir modelos MoE localmente mediante hardware CUDA y memoria del sistema.
- Más adecuado para: Sistemas NVIDIA recientes con una cantidad considerable de RAM y ancho de banda PCIe.
- Ventaja principal: Una caché de expertos consciente del enrutamiento se adapta al comportamiento del modelo a nivel de token.
- Limitación principal: Linux es el objetivo de compatibilidad más claro, mientras que no se indica compatibilidad con macOS.
- Resultado clave: Las mejoras reportadas son más significativas en modelos MoE grandes y cargas de trabajo agénticas.
Descripción general de FreeToken linux y mejor caso de uso
FreeToken linux es un sistema de inferencia local en fase beta diseñado para servir grandes modelos de mezcla de expertos en hardware personal. En lugar de exigir que todos los pesos de los expertos permanezcan en la memoria de la GPU, mantiene el conjunto completo de expertos en la memoria del sistema y utiliza la VRAM disponible como una caché elástica. Esto convierte el proyecto en un entorno de ejecución de sistemas, no en un modelo, juego o plataforma de códigos de recompensa.
Los usuarios más adecuados son desarrolladores que ejecutan modelos grandes de pesos abiertos mediante agentes de programación, matemáticas o uso de herramientas. FreeToken resulta especialmente relevante cuando un modelo supera la VRAM disponible, pero mantiene una activación dispersa. El objetivo del sistema es convertir los recursos de la GPU, CPU, RAM y PCIe de consumo en una plataforma de inferencia coordinada.
Aspectos destacados del vídeo:
- FreeToken está orientado al servicio local de modelos con cientos de miles de millones de parámetros.
- La caché consciente del enrutamiento reduce las transferencias innecesarias de expertos durante la decodificación.
- Los benchmarks reportados incluyen equipos de escritorio NVIDIA, estaciones de trabajo y una GPU de portátil de 8 GB.
- Linux y NVIDIA CUDA son el entorno compatible más claro según los metadatos disponibles del proyecto.
| Área | Lo que ofrece FreeToken | Significado práctico |
|---|---|---|
| Enfoque del runtime | Servicio MoE nativo para edge | Los modelos dispersos grandes pueden ejecutarse fuera de un centro de datos |
| Plataforma principal | Linux POSIX con NVIDIA CUDA | Los usuarios de Linux tienen el entorno objetivo más claro |
| Modelo de memoria | Expertos residentes en el sistema más caché de GPU | Los pesos completos del modelo no tienen que caber en la VRAM |
| Enfoque de carga de trabajo | Inferencia agéntica | El contexto de varios turnos y las llamadas a herramientas son aspectos prioritarios |
| Madurez del proyecto | Sistema en fase beta | Se esperan cambios de compatibilidad y empaquetado |
Considera FreeToken como un runtime de inferencia Linux especializado. Resulta más atractivo cuando ya dispones de hardware NVIDIA compatible, suficiente memoria del sistema y una carga de trabajo que utiliza repetidamente un modelo MoE grande.
Cómo gestiona FreeToken la memoria MoE
Un modelo de mezcla de expertos contiene muchas redes expertas, pero un router activa solo un pequeño subconjunto para cada token. El artículo de referencia utiliza DeepSeek-V4-Flash como ejemplo: seis de los 256 expertos enrutados se activan en cada capa, con 13B de parámetros activos de un modelo de 284B parámetros. La activación dispersa reduce el cálculo, pero todos los pesos de los expertos aún deben permanecer accesibles.
FreeToken separa el modelo en un conjunto de expertos residente en la CPU y un conjunto de trabajo residente en la GPU. La caché de GPU utiliza una política LRU compartida entre las capas MoE, lo que permite que los expertos seleccionados recientemente permanezcan disponibles para tokens futuros. Cuando falta un experto, el runtime puede transferirlo a la GPU o ejecutarlo directamente en la CPU.
| Nivel de memoria | Datos almacenados | Función durante la inferencia |
|---|---|---|
| Memoria de GPU | Pesos no expertos, caché KV, espacios para expertos | Ejecución rápida y expertos utilizados recientemente |
| Memoria del sistema | Conjunto completo de expertos enrutados | Fuente de verdad para el modelo MoE completo |
| Enlace PCIe | Transferencias de expertos y datos del runtime | Mueve las ausencias seleccionadas a la memoria de la GPU |
| Núcleos de CPU | Ejecución directa de ausencias seleccionadas | Utiliza el ancho de banda restante del sistema en lugar de esperar |
| Almacenamiento NVMe | Modelo original o archivos de pesos preparados | Fuente para el inicio y la conversión de formato |
El runtime mide dos anchos de banda: el ancho de banda de procesamiento de expertos del sistema y el ancho de banda de transferencia fijada mediante PCIe. Después estima cuántos expertos ausentes deben incorporarse a la caché de GPU y cuántos deben ejecutarse directamente en la CPU. Este enfoque evita tratar todas las configuraciones de hardware como si fueran idénticas.
Durante el prellenado, FreeToken utiliza doble búfer para la capa completa. Mientras se ejecuta una capa, los expertos de la siguiente pueden transmitirse mediante PCIe. Durante la decodificación, la caché compartida sigue las decisiones cambiantes del router. La misma caché admite ambas fases, lo que ayuda a evitar una costosa transferencia entre grupos de memoria separados para prellenado y decodificación.
| Mecanismo | Problema abordado | Por qué importa |
|---|---|---|
| Caché LRU compartida de expertos | Cambios de enrutamiento entre tokens | La residencia en la GPU sigue la demanda reciente |
| Ejecución adaptada al ancho de banda | Algunos expertos no están en la caché | La CPU y la GPU pueden atender las ausencias simultáneamente |
| Doble búfer para la capa completa | Las transferencias de prellenado detienen la ejecución | El movimiento de expertos se solapa con el cálculo |
| Puntos de control del estado semántico | El contexto del agente se edita repetidamente | Los prefijos conservados necesitan menos recomputación |
| Redimensionamiento de caché elástica | Cambia la VRAM disponible | La capacidad de la caché puede adaptarse sin reiniciar |
La activación dispersa no elimina los requisitos de memoria. El conjunto completo de expertos debe permanecer accesible en la memoria del sistema y los archivos del modelo pueden ser extremadamente grandes. Comprueba la RAM del sistema, la capacidad de almacenamiento y el ancho de banda de memoria antes de evaluar la velocidad de la GPU.
Ruta de configuración de FreeToken linux
Las fuentes disponibles identifican Linux, NVIDIA CUDA, los sistemas operativos POSIX y el estado de desarrollo beta como el entorno más claro. Dado que el empaquetado puede cambiar rápidamente, utiliza las instrucciones de lanzamiento actuales del proyecto en flashml.ai en lugar de copiar comandos de una guía desactualizada.
Confirma el perfil de hardware
Verifica que el equipo utilice una GPU NVIDIA compatible y un entorno CUDA adecuado. Registra la VRAM disponible, la RAM del sistema, el ancho del enlace PCIe, la capacidad de almacenamiento y el ancho de banda de la memoria del sistema. Estos valores influyen en el tamaño de la caché de expertos y en la distribución entre las transferencias a la GPU y la ejecución en la CPU.
Prepara el runtime de Linux
Utiliza un entorno Linux POSIX compatible e instala las dependencias actuales especificadas por el proyecto. Mantén el controlador NVIDIA y la pila CUDA alineados con los requisitos de la versión. Dado que FreeToken es software beta según los metadatos disponibles, no des por sentado que un paquete creado para una distribución funcionará exactamente igual en otra.
Prepara los pesos del modelo
Elige un checkpoint MoE compatible y asegúrate de que el conjunto completo de expertos quepa en la memoria del sistema. El formato FTW de FreeToken almacena los bancos de expertos en el diseño del runtime, reduciendo el descubrimiento y el reempaquetado de tensores durante el inicio. Reserva suficiente espacio NVMe para el checkpoint de origen y cualquier representación preparada.
Perfila y prueba una solicitud pequeña
Permite que el runtime mida el procesamiento en el sistema y el ancho de banda de transferencia PCIe, y comienza después con un prompt corto. Confirma que el modelo se carga, que la caché de GPU se inicializa y que la gestión de ausencias entre CPU y GPU funciona antes de pasar a sesiones agénticas prolongadas.
Ajusta el sistema para la carga de trabajo real
Prueba el mismo patrón de programación, matemáticas o uso de herramientas que esperas ejecutar en producción. Observa el tiempo hasta el primer token, la latencia del peor turno, el uso de RAM, la presión sobre la VRAM y la finalización de solicitudes, en lugar de depender únicamente del rendimiento medio de decodificación.
| Comprobación de configuración | Condición objetivo | Señal de fallo |
|---|---|---|
| Backend de GPU | Entorno compatible con NVIDIA CUDA | El runtime no puede inicializar la ruta de GPU |
| Sistema operativo | Linux POSIX como objetivo | Empaquetado no compatible o ausencia de fallback |
| Memoria del sistema | Capacidad suficiente para el conjunto completo de expertos | El cargado falla o el paginado se vuelve excesivo |
| Almacenamiento | Capacidad NVMe para el checkpoint y los archivos preparados | Preparación prolongada o espacio insuficiente |
| Prueba del runtime | El prompt corto se completa correctamente | Error de caché, controlador o formato del modelo |
Antes de ejecutar una sesión prolongada:
- Confirma la compatibilidad del controlador NVIDIA y CUDA
- Reserva suficiente RAM para el conjunto completo de expertos
- Comprueba el espacio NVMe para los archivos del modelo de origen y FTW
- Mide el rendimiento del enlace PCIe y de la memoria del sistema
- Prueba un prompt corto antes de iniciar un agente
Una configuración exitosa implica más que cargar un modelo una sola vez. Confirma que una solicitud de varios turnos se complete sin una latencia de cola excesiva, ya que las cargas de trabajo agénticas ponen a prueba repetidamente el prellenado, la reutilización de la caché y las ausencias de expertos.
Rendimiento, compatibilidad y compromisos
La evaluación publicada de FreeToken informa de sus mejores resultados en modelos MoE grandes y cargas de trabajo agénticas. En una RTX 5090, el sistema alcanza entre 77 y 83 tokens por segundo en Qwen3.6-35B y entre 22 y 25 tokens por segundo en DeepSeek-V4-Flash. La evaluación también informa de 39,3 tokens por segundo en un portátil con RTX 4060 y una GPU de 8 GB, y de 14,9 tokens por segundo para GLM-5.2 en una única RTX PRO 6000.
La misma evaluación destaca el tiempo de cola hasta el primer token. El peor turno reportado de FreeToken se mantuvo por debajo de 44 segundos en las celdas probadas, mientras que los bloqueos de referencia superaron valores mucho mayores en algunas configuraciones. Estas mediciones proceden de la propia evaluación del proyecto, por lo que las pruebas independientes siguen siendo útiles antes de tomar decisiones de despliegue.
| Modelo o nivel | Hardware | Resultado reportado de FreeToken | Contexto |
|---|---|---|---|
| Qwen3.6-35B-A3B | RTX 5090 | 77–83 tok/s | Cargas de trabajo agénticas |
| DeepSeek-V4-Flash | RTX 5090 | 22–25 tok/s | Cargas de trabajo agénticas |
| Qwen3.6-35B-A3B | Portátil RTX 4060, 8 GB | 39,3 tok/s | Lanzamiento NVFP4, PCIe x8 |
| GLM-5.2 | RTX PRO 6000, 96 GB | 14,9 tok/s | Demostración a escala 753B |
| TTFT de cola de FreeToken | Configuraciones probadas | Menos de 44 segundos | Resultado reportado del peor turno |
La comparación con llama.cpp no se reduce simplemente a la velocidad media. El análisis de referencia informa de que la caché LRU global de FreeToken no encontró el 16 % de las lecturas de expertos de Qwen3.6 con una determinada capacidad de caché en una RTX 5090, frente al 62 % de fallos con una división estática ajena al enrutamiento. Para DeepSeek-V4-Flash en el mismo punto de comparación, FreeToken registró un 39 % de fallos, mientras que las políticas estáticas citadas fallaron con mayor frecuencia.
Sin embargo, la compatibilidad es un compromiso importante. Los metadatos disponibles del proyecto identifican Linux y NVIDIA CUDA como el entorno compatible. Las solicitudes de compatibilidad con tarjetas NVIDIA antiguas, Docker con doble GPU, GGUF, correcciones para Windows y Apple Silicon se describieron como problemas abiertos durante el periodo de lanzamiento. Los proyectos existentes pueden ofrecer una cobertura de hardware más amplia, incluso cuando FreeToken presenta una ventaja de rendimiento en una clase más limitada de sistemas.
Dónde destaca FreeToken
- Checkpoints MoE grandes
- GPUs NVIDIA recientes
- Agentes de programación de larga duración
- Cargas de trabajo sensibles a la latencia de cola
Dónde gana la compatibilidad
- Sistemas Apple Silicon
- Hardware NVIDIA antiguo
- Configuraciones mixtas o con varias GPU
- Flujos de trabajo multiplataforma consolidados
Qué medir
- TTFT del peor turno
- Tasa de fallos de la caché de expertos
- Presión sobre la RAM del sistema
- Tasa de finalización de solicitudes
Utiliza las cifras publicadas como una referencia útil, no como una garantía universal. El ancho de banda del hardware, el formato del modelo, la longitud del prompt, las aplicaciones simultáneas y el comportamiento del entorno del agente pueden cambiar sustancialmente los resultados locales.
Preguntas frecuentes y lista de comprobación práctica de FreeToken linux
FreeToken se entiende mejor como un sistema de servicio nativo para edge destinado a la inferencia local de modelos MoE de pesos abiertos. No hace que todos los modelos sean adecuados para cualquier ordenador y no debe evaluarse únicamente por los tokens por segundo máximos. Los usuarios de Linux deben priorizar las comprobaciones de compatibilidad, la planificación de memoria y las pruebas realistas de varios turnos.
Los detalles técnicos están documentados en el artículo de FreeToken en arXiv, publicado el 24 de agosto de 2026. El artículo explica la arquitectura de caché, la política adaptada al ancho de banda, la gestión elástica de memoria, el enfoque de implementación y la metodología de evaluación.
Q: ¿Qué es FreeToken linux?
FreeToken linux es un runtime de inferencia local centrado en Linux para grandes modelos de mezcla de expertos. Coordina la memoria de la GPU, la ejecución de la CPU, la RAM del sistema y las transferencias PCIe para que los modelos que superan la VRAM disponible sigan siendo utilizables en hardware edge.
Q: ¿FreeToken es compatible con macOS o Apple Silicon?
La información disponible del proyecto en 2026 no incluye una compilación para Mac ni indica compatibilidad con Apple Silicon. Considera Linux con NVIDIA CUDA como el objetivo compatible más claro hasta que cambie la documentación oficial de plataformas.
Q: ¿Por qué FreeToken puede ejecutar modelos que superan la memoria de la GPU?
El enrutamiento MoE activa solo un subconjunto de expertos para cada token. FreeToken mantiene el conjunto completo de expertos en la memoria del sistema y utiliza la VRAM como una caché consciente del enrutamiento, mientras que las ausencias seleccionadas pueden transferirse a la GPU o ejecutarse directamente en la CPU.
Q: ¿FreeToken es más rápido que llama.cpp en cualquier ordenador?
No. La ventaja reportada es más fuerte en hardware NVIDIA reciente que ejecuta modelos MoE grandes y cargas de trabajo agénticas. llama.cpp sigue siendo una opción práctica cuando la amplia compatibilidad de hardware y un flujo multiplataforma consolidado importan más que el rendimiento MoE especializado.
Elige FreeToken cuando tu prioridad sea servir modelos MoE localmente en hardware Linux NVIDIA compatible. Elige un runtime más amplio cuando la cobertura de plataformas, un despliegue más sencillo o la compatibilidad con formatos de modelos existentes sean el factor decisivo.