- Los lanzamientos de FreeToken introducen un sistema de serving nativo para el edge destinado a modelos MoE de gran tamaño.
- Ventaja principal: la caché dinámica de expertos combina GPU, CPU, memoria del sistema y ancho de banda PCIe.
- Mejor compatibilidad: sistemas NVIDIA recientes con una cantidad considerable de memoria del sistema y cargas de trabajo MoE.
- Limitación clave: la versión de 2026 está enfocada en la fase beta y se dirige principalmente a Linux con CUDA.
- Conclusión principal: revisa la compatibilidad del hardware y las advertencias de los benchmarks antes de cambiar de motor.
Lanzamientos de FreeToken: qué cambió en 2026
El lanzamiento de FreeToken de 2026 presenta un motor de inferencia local diseñado para hacer más prácticos en hardware personal los modelos de mezcla de expertos de escala punta de lanza. En lugar de exigir que todos los pesos de los expertos permanezcan en la memoria de la GPU, el sistema mantiene el conjunto completo de expertos en la memoria del sistema y utiliza la VRAM disponible como una caché elástica.
El artículo de investigación del proyecto, FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution, se publicó el 24 de agosto de 2026. El artículo identifica el lanzamiento como un sistema de serving, no como un modelo nuevo. Su objetivo es mejorar la forma en que los modelos MoE de pesos abiertos existentes se cargan, almacenan en caché y ejecutan en hardware de consumo.
Aspectos destacados del video:
- FreeToken está orientado al serving local de modelos con cantidades muy grandes de parámetros.
- El enrutamiento dinámico determina qué expertos deben permanecer en la memoria de la GPU.
- La ejecución en la CPU y las transferencias PCIe se equilibran según el ancho de banda medido.
- Los resultados publicados incluyen hardware de clase portátil, sobremesa y estación de trabajo.
Serving MoE
- El enrutamiento disperso activa solo un pequeño subconjunto de expertos por token.
- Los conjuntos completos de expertos permanecen disponibles en la memoria del sistema.
- Es útil para modelos que superan la capacidad de VRAM local.
Caché adaptativa
- Una caché LRU compartida registra los expertos enrutados recientemente.
- La capacidad de la caché puede cambiar durante la ejecución.
- Prefill y decode comparten el mismo conjunto de memoria para expertos.
Ejecución híbrida
- Los expertos ausentes pueden transferirse a la GPU.
- Otros expertos ausentes pueden ejecutarse directamente en la CPU.
- La división sigue el ancho de banda medido de la memoria del sistema y PCIe.
Considera FreeToken como un lanzamiento de un runtime de inferencia, no como un lanzamiento de modelo. Aún necesitas pesos de modelo compatibles, un entorno de ejecución compatible y suficiente memoria del sistema para el conjunto completo de expertos.
| Área del lanzamiento | Dirección en 2026 | Por qué importa |
|---|---|---|
| Compatibilidad de modelos | Modelos MoE de aproximadamente 35B a 753B de parámetros | Amplía el acceso local a modelos que superan los límites habituales de VRAM |
| Diseño de memoria | Conjunto de expertos residente en la memoria del sistema con caché GPU elástica | La capacidad de la GPU afecta más a la velocidad que a la corrección básica |
| Planificación | Ejecución CPU/GPU adaptada al ancho de banda | Reduce el impacto de los fallos de caché inevitables |
| Prefill | Doble búfer para capas completas | Superpone el movimiento de expertos con el cálculo de la GPU |
| Disponibilidad | Objetivo beta para CUDA y Linux POSIX | La compatibilidad de la plataforma debe comprobarse antes de la instalación |
Cómo funciona la arquitectura de FreeToken
FreeToken divide la inferencia en dos fases importantes: prefill y decode. Prefill procesa el prompt existente o el contexto de la conversación, mientras que decode genera nuevos tokens uno a uno. Cada fase tiene un cuello de botella diferente, por lo que el runtime utiliza técnicas distintas.
Durante el prefill, es posible acceder a muchos expertos a lo largo de un contexto extenso. FreeToken utiliza doble búfer para capas completas con el fin de transmitir los expertos de la siguiente capa mientras la GPU trabaja en la capa actual. Esto puede ocultar parte del tiempo de transferencia detrás del cálculo. El diseño también almacena puntos de control en límites semánticos, como segmentos de razonamiento, llamadas a herramientas y turnos de conversación. Cuando un agente edita su contexto, puede que solo sea necesario recalcular el sufijo modificado.
Durante el decode, el enrutamiento es disperso, pero cambia con cada token. Una ubicación estática elegida al inicio puede no contener con frecuencia los expertos activos. En su lugar, FreeToken utiliza una caché LRU compartida que sigue el comportamiento reciente del enrutamiento entre capas.
| Fase del runtime | Desafío principal | Respuesta de FreeToken |
|---|---|---|
| Prefill | Movimiento de grandes cantidades de expertos y recomputación repetida del contexto | Pipeline de capas completas y puntos de control del estado semántico |
| Decode | Rutas de expertos cambiantes y fallos de caché | Caché LRU compartida de expertos |
| Fallo de caché | La transferencia y la ejecución en CPU compiten por el ancho de banda del sistema | División basada en el ancho de banda medido |
| Presión de memoria | La VRAM cambia a medida que crecen las aplicaciones y el contexto | Redimensionamiento de la caché durante la ejecución |
| Inicio | Los conjuntos grandes de expertos tardan en cargarse | Carga directa en la disposición final de la memoria del sistema |
La política de ancho de banda es una de las ideas definitorias del lanzamiento. Sea Bₚ el ancho de banda de transferencia PCIe medido y Bₕ el ancho de banda efectivo de procesamiento de expertos en el sistema. El runtime estima cuántos expertos ausentes deben transferirse a la caché de la GPU y cuántos deben ejecutarse directamente desde la CPU.
Este enfoque evita tratar cada fallo como una transferencia. Una transferencia puede ser útil porque el experto puede permanecer en la caché para tokens posteriores, pero la ejecución en CPU puede ser más rápida cuando todavía hay ancho de banda disponible en el sistema o cuando la capacidad de la caché es limitada.
La activación dispersa reduce la cantidad de cálculo por token, pero no elimina la necesidad de almacenar el conjunto completo de expertos en algún lugar accesible. Los modelos grandes aún pueden requerir una cantidad considerable de memoria y almacenamiento del sistema.
Cargar el conjunto de expertos
FreeToken lee los pesos de expertos normalizados en la memoria del sistema. Su formato FTW está diseñado para colocar los pesos directamente en la disposición utilizada durante el serving, reduciendo el trabajo de descubrimiento y reorganización al inicio.
Reservar la caché de la GPU
Después de asignar los pesos que no son de expertos y el estado del runtime, la VRAM restante se divide entre la caché KV y las ranuras completas para expertos. Este presupuesto puede revisarse en puntos seguros de la ejecución.
Preparar el contexto
El búfer de capas completas transmite los datos de los expertos mientras la GPU calcula. Los puntos de control semánticos conservan prefijos útiles entre los turnos del agente y las ediciones del contexto.
Decodificar con caché consciente del enrutamiento
El router identifica los expertos activos, comprueba su residencia en la GPU y envía los fallos de caché por la ruta de CPU o PCIe adaptada al ancho de banda.
Resultados de rendimiento y compatibilidad del hardware
La evaluación publicada en 2026 compara FreeToken con motores de serving para el edge mantenidos activamente en seis máquinas y varias cargas de trabajo agénticas. Los resultados son más sólidos en sistemas con GPU NVIDIA modernas, suficiente memoria del sistema y un equilibrio adecuado entre el ancho de banda de memoria de la CPU y la capacidad de transferencia PCIe.
En una RTX 5090, el artículo informa de 77–83 tokens por segundo para Qwen3.6-35B y 22–25 tokens por segundo para DeepSeek-V4-Flash. En un portátil con RTX 4060 y una configuración de 8 GB, el resultado publicado para Qwen3.6 alcanza 39.3 tokens por segundo. Una RTX PRO 6000 de clase estación de trabajo sirve GLM-5.2 a 14.9 tokens por segundo, frente a 7.3 para la configuración indicada de llama.cpp.
| Nivel de hardware | Carga de trabajo demostrada | Resultado publicado | Interpretación práctica |
|---|---|---|---|
| Portátil RTX 4060, 8 GB | Qwen3.6-35B | 39.3 tok/s | Muestra el valor del serving adaptativo con VRAM limitada |
| RTX 5090 de sobremesa/servidor | Qwen3.6-35B | 77–83 tok/s | Mejores resultados publicados en la gama de consumo |
| RTX 5090 de sobremesa/servidor | DeepSeek-V4-Flash | 22–25 tok/s | El gran conjunto de expertos sigue siendo viable localmente |
| RTX PRO 6000, 96 GB | GLM-5.2 | 14.9 tok/s | Demuestra un nivel de escala punta de lanza con 753B de parámetros |
| RTX PRO 6000, 96 GB | Comparación con llama.cpp | 7.3 tok/s | Resultado de referencia publicado con pesos comparables |
La latencia de cola también es importante. La evaluación informa de que el peor turno de FreeToken se mantuvo por debajo de 44 segundos en las celdas probadas, mientras que los sistemas de referencia superaron retrasos considerablemente mayores en algunos casos. En aplicaciones agénticas, esto puede determinar si una solicitud termina antes de que un watchdog o un tiempo de espera del cliente la interrumpa.
Sin embargo, los benchmarks deben interpretarse con la debida cautela. Las mediciones fueron producidas por los autores, y el material disponible no establece una replicación independiente amplia. Las comparaciones principales también requieren prestar atención a las definiciones de medición, especialmente al comparar el rendimiento de decode con trazas de producción de extremo a extremo.
FreeToken resulta especialmente atractivo para una GPU NVIDIA reciente, una memoria del sistema abundante y cargas de trabajo que sirven repetidamente modelos MoE grandes. La compatibilidad del hardware importa más que la tasa de tokens anunciada.
| Factor de hardware | Condición favorable | Posible preocupación |
|---|---|---|
| GPU | Tarjeta NVIDIA reciente compatible con CUDA | Las tarjetas antiguas pueden no disponer de una ruta probada o empaquetada |
| VRAM | Espacio suficiente para pesos no expertos, caché KV y ranuras de expertos | Una VRAM reducida aumenta los fallos de caché |
| Memoria del sistema | Capacidad para el conjunto completo de expertos | Los modelos grandes pueden superar la memoria habitual de un equipo de sobremesa |
| PCIe | Enlace amplio y de gran ancho de banda | Los enlaces x8 de portátiles o más lentos aumentan la presión de transferencia |
| Memoria de la CPU | DDR5 de doble canal potente o superior | La ejecución en CPU puede verse limitada por el ancho de banda |
| Sistema operativo | Linux POSIX con CUDA | No se ha establecido compatibilidad con macOS ni con Windows de forma amplia |
Estado de compatibilidad, limitaciones y comprobaciones de configuración
El lanzamiento de 2026 debe abordarse como un sistema en una fase inicial. Los clasificadores publicados indican un estado de desarrollo beta, un entorno CUDA y sistemas operativos Linux POSIX. El material de plataforma disponible no establece una versión nativa para Apple Silicon, compatibilidad amplia con macOS ni la cobertura de hardware asociada con runtimes para el edge más maduros.
La dirección declarada del proyecto incluye un formato de pesos FTW, kernels compatibles con CUDA, implementaciones SIMD para CPU y un backend MoE de respaldo completamente basado en CPU cuando la memoria fijada o el registro DMA no están disponibles. Estas funciones mejoran la flexibilidad, pero no garantizan un rendimiento equivalente entre sistemas operativos o tarjetas gráficas.
Antes de probar FreeToken:
- Confirma que tu GPU y entorno CUDA coincidan con la ruta de runtime compatible
- Compara la memoria del sistema disponible con el conjunto completo de expertos del modelo
- Comprueba el ancho del enlace PCIe y el ancho de banda de la memoria del sistema antes de estimar el rendimiento
- Reserva suficiente VRAM para los pesos no expertos y la caché KV en crecimiento
- Utiliza pesos y cargas de trabajo idénticos al comparar motores
Utiliza el destino oficial del proyecto FreeToken y el artículo de investigación de 2026 como referencias principales para consultar los detalles del lanzamiento, las notas de implementación y las configuraciones compatibles.
| Punto de comprobación | Acción recomendada | Motivo |
|---|---|---|
| Objetivo de instalación | Prefiere una máquina Linux con CUDA que haya sido probada | Es el entorno compatible más claramente indicado en el material del lanzamiento |
| Formato del modelo | Confirma si el modelo tiene una disposición compatible o convertible | FreeToken utiliza bancos de expertos normalizados y almacenamiento FTW |
| Plan de memoria | Ten en cuenta el conjunto de expertos, la caché KV y las aplicaciones simultáneas | Los sistemas edge tienen presupuestos de memoria cambiantes |
| Método de benchmark | Reutiliza prompts, pesos y trazas de carga de trabajo | Las distintas trayectorias de los agentes pueden distorsionar las comparaciones |
| Prueba de fiabilidad | Mide la latencia de cola, no solo el rendimiento medio | Las pausas prolongadas pueden activar watchdogs o tiempos de espera del cliente |
Para una primera evaluación, comienza con un modelo que se ajuste a tu presupuesto de memoria del sistema y una carga de trabajo breve y controlada. Registra el tiempo de inicio, el tiempo hasta el primer token, la tasa de decode estable, el comportamiento de la caché y la latencia del peor turno. Después, repite la prueba mientras ejecutas aplicaciones de escritorio normales para observar cómo se comporta la gestión elástica de memoria bajo presión.
¿Quién debería usar FreeToken en 2026?
FreeToken no es un sustituto universal para todos los motores de inferencia local. Su caso de uso más sólido es el de un usuario técnicamente competente o un equipo pequeño que posee hardware NVIDIA adecuado, trabaja con modelos MoE y valora el control local, la disponibilidad predecible y una menor dependencia de la inferencia alojada.
El sistema puede ser menos adecuado cuando la amplitud de plataformas es la prioridad. Los usuarios que dependen de Apple Silicon, tarjetas NVIDIA antiguas, dispositivos no compatibles con CUDA o una instalación multiplataforma sencilla deberían verificar la compatibilidad antes de invertir tiempo en la migración.
Compatibilidad alta
- GPU NVIDIA reciente
- Gran presupuesto de memoria del sistema
- Serving MoE frecuente
- Cargas de trabajo agénticas o multiturno
Compatibilidad posible
- VRAM limitada
- Enlace PCIe rápido
- Sistema DDR5 moderno
- Disposición para realizar benchmarks localmente
Compatibilidad baja
- Dependencia de Apple Silicon
- Hardware GPU antiguo
- Poca capacidad de memoria del sistema
- Necesidad de un instalador general pulido
Prioridad de evaluación
- Comprobar primero la compatibilidad
- Comparar la latencia de cola
- Supervisar la presión de memoria
- Validar la precisión de la carga de trabajo
La importancia más amplia del lanzamiento es arquitectónica. Trata el hardware de consumo como un sistema combinado en lugar de evaluar la memoria de la GPU de forma aislada. Su caché de expertos, la coejecución en CPU, los puntos de control semánticos y el ajuste de memoria durante la ejecución abordan distintas partes del mismo problema: hacer utilizables los modelos dispersos grandes fuera de los centros de datos dedicados.
Comienza por la compatibilidad, confirma después la capacidad de memoria, mide una carga de trabajo breve y solo entonces compara el rendimiento. Así evitarás que una cifra de benchmark impresionante oculte una ruta de despliegue inutilizable.
Q: ¿Qué son los lanzamientos de FreeToken de 2026?
Se refieren al sistema público de serving MoE nativo para el edge de FreeToken y a su lanzamiento de investigación complementario del 24 de agosto de 2026. FreeToken es un runtime de inferencia, no un modelo de lenguaje nuevo.
Q: ¿Qué hardware admite FreeToken?
La ruta documentada se dirige principalmente a sistemas NVIDIA con CUDA, incluidos portátiles y equipos de sobremesa de consumo, así como GPU de clase estación de trabajo. Linux y los entornos POSIX son la dirección de compatibilidad más clara en el material disponible del lanzamiento.
Q: ¿Por qué FreeToken puede servir modelos más grandes que la memoria de la GPU?
El conjunto completo de expertos permanece en la memoria del sistema, mientras que los expertos seleccionados se trasladan a una caché GPU elástica o se ejecutan directamente en la CPU. El enrutamiento MoE disperso hace que solo un subconjunto esté activo para cada token, aunque el conjunto completo siga necesitando almacenamiento.
Q: ¿Es FreeToken más rápido que todos los motores de inferencia local?
El artículo de 2026 informa de resultados sólidos frente a determinados sistemas de referencia para serving en el edge, pero esas mediciones proceden de los autores del proyecto y deberían probarse de forma independiente en tu hardware y con tu carga de trabajo.