Lanzamientos de FreeToken: guía de configuración de 2026 y cambios clave - Guía

Lanzamientos de FreeToken: guía de configuración de 2026 y cambios clave

Descubre qué ofrece el lanzamiento de FreeToken de 2026, cómo funciona su motor MoE nativo para el edge, qué hardware es compatible, sus benchmarks y las consideraciones de configuración.

2026-08-25
Equipo de FreeToken
Guía rápida
  • Los lanzamientos de FreeToken introducen un sistema de serving nativo para el edge destinado a modelos MoE de gran tamaño.
  • Ventaja principal: la caché dinámica de expertos combina GPU, CPU, memoria del sistema y ancho de banda PCIe.
  • Mejor compatibilidad: sistemas NVIDIA recientes con una cantidad considerable de memoria del sistema y cargas de trabajo MoE.
  • Limitación clave: la versión de 2026 está enfocada en la fase beta y se dirige principalmente a Linux con CUDA.
  • Conclusión principal: revisa la compatibilidad del hardware y las advertencias de los benchmarks antes de cambiar de motor.

Lanzamientos de FreeToken: qué cambió en 2026

El lanzamiento de FreeToken de 2026 presenta un motor de inferencia local diseñado para hacer más prácticos en hardware personal los modelos de mezcla de expertos de escala punta de lanza. En lugar de exigir que todos los pesos de los expertos permanezcan en la memoria de la GPU, el sistema mantiene el conjunto completo de expertos en la memoria del sistema y utiliza la VRAM disponible como una caché elástica.

El artículo de investigación del proyecto, FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution, se publicó el 24 de agosto de 2026. El artículo identifica el lanzamiento como un sistema de serving, no como un modelo nuevo. Su objetivo es mejorar la forma en que los modelos MoE de pesos abiertos existentes se cargan, almacenan en caché y ejecutan en hardware de consumo.

Aspectos destacados del video:

  • FreeToken está orientado al serving local de modelos con cantidades muy grandes de parámetros.
  • El enrutamiento dinámico determina qué expertos deben permanecer en la memoria de la GPU.
  • La ejecución en la CPU y las transferencias PCIe se equilibran según el ancho de banda medido.
  • Los resultados publicados incluyen hardware de clase portátil, sobremesa y estación de trabajo.

Serving MoE

  • El enrutamiento disperso activa solo un pequeño subconjunto de expertos por token.
  • Los conjuntos completos de expertos permanecen disponibles en la memoria del sistema.
  • Es útil para modelos que superan la capacidad de VRAM local.

Caché adaptativa

  • Una caché LRU compartida registra los expertos enrutados recientemente.
  • La capacidad de la caché puede cambiar durante la ejecución.
  • Prefill y decode comparten el mismo conjunto de memoria para expertos.

Ejecución híbrida

  • Los expertos ausentes pueden transferirse a la GPU.
  • Otros expertos ausentes pueden ejecutarse directamente en la CPU.
  • La división sigue el ancho de banda medido de la memoria del sistema y PCIe.
Análisis editorial

Considera FreeToken como un lanzamiento de un runtime de inferencia, no como un lanzamiento de modelo. Aún necesitas pesos de modelo compatibles, un entorno de ejecución compatible y suficiente memoria del sistema para el conjunto completo de expertos.

Área del lanzamientoDirección en 2026Por qué importa
Compatibilidad de modelosModelos MoE de aproximadamente 35B a 753B de parámetrosAmplía el acceso local a modelos que superan los límites habituales de VRAM
Diseño de memoriaConjunto de expertos residente en la memoria del sistema con caché GPU elásticaLa capacidad de la GPU afecta más a la velocidad que a la corrección básica
PlanificaciónEjecución CPU/GPU adaptada al ancho de bandaReduce el impacto de los fallos de caché inevitables
PrefillDoble búfer para capas completasSuperpone el movimiento de expertos con el cálculo de la GPU
DisponibilidadObjetivo beta para CUDA y Linux POSIXLa compatibilidad de la plataforma debe comprobarse antes de la instalación

Cómo funciona la arquitectura de FreeToken

FreeToken divide la inferencia en dos fases importantes: prefill y decode. Prefill procesa el prompt existente o el contexto de la conversación, mientras que decode genera nuevos tokens uno a uno. Cada fase tiene un cuello de botella diferente, por lo que el runtime utiliza técnicas distintas.

Durante el prefill, es posible acceder a muchos expertos a lo largo de un contexto extenso. FreeToken utiliza doble búfer para capas completas con el fin de transmitir los expertos de la siguiente capa mientras la GPU trabaja en la capa actual. Esto puede ocultar parte del tiempo de transferencia detrás del cálculo. El diseño también almacena puntos de control en límites semánticos, como segmentos de razonamiento, llamadas a herramientas y turnos de conversación. Cuando un agente edita su contexto, puede que solo sea necesario recalcular el sufijo modificado.

Durante el decode, el enrutamiento es disperso, pero cambia con cada token. Una ubicación estática elegida al inicio puede no contener con frecuencia los expertos activos. En su lugar, FreeToken utiliza una caché LRU compartida que sigue el comportamiento reciente del enrutamiento entre capas.

Fase del runtimeDesafío principalRespuesta de FreeToken
PrefillMovimiento de grandes cantidades de expertos y recomputación repetida del contextoPipeline de capas completas y puntos de control del estado semántico
DecodeRutas de expertos cambiantes y fallos de cachéCaché LRU compartida de expertos
Fallo de cachéLa transferencia y la ejecución en CPU compiten por el ancho de banda del sistemaDivisión basada en el ancho de banda medido
Presión de memoriaLa VRAM cambia a medida que crecen las aplicaciones y el contextoRedimensionamiento de la caché durante la ejecución
InicioLos conjuntos grandes de expertos tardan en cargarseCarga directa en la disposición final de la memoria del sistema

La política de ancho de banda es una de las ideas definitorias del lanzamiento. Sea Bₚ el ancho de banda de transferencia PCIe medido y Bₕ el ancho de banda efectivo de procesamiento de expertos en el sistema. El runtime estima cuántos expertos ausentes deben transferirse a la caché de la GPU y cuántos deben ejecutarse directamente desde la CPU.

Este enfoque evita tratar cada fallo como una transferencia. Una transferencia puede ser útil porque el experto puede permanecer en la caché para tokens posteriores, pero la ejecución en CPU puede ser más rápida cuando todavía hay ancho de banda disponible en el sistema o cuando la capacidad de la caché es limitada.

Límite importante de la arquitectura

La activación dispersa reduce la cantidad de cálculo por token, pero no elimina la necesidad de almacenar el conjunto completo de expertos en algún lugar accesible. Los modelos grandes aún pueden requerir una cantidad considerable de memoria y almacenamiento del sistema.

1

Cargar el conjunto de expertos

FreeToken lee los pesos de expertos normalizados en la memoria del sistema. Su formato FTW está diseñado para colocar los pesos directamente en la disposición utilizada durante el serving, reduciendo el trabajo de descubrimiento y reorganización al inicio.

2

Reservar la caché de la GPU

Después de asignar los pesos que no son de expertos y el estado del runtime, la VRAM restante se divide entre la caché KV y las ranuras completas para expertos. Este presupuesto puede revisarse en puntos seguros de la ejecución.

3

Preparar el contexto

El búfer de capas completas transmite los datos de los expertos mientras la GPU calcula. Los puntos de control semánticos conservan prefijos útiles entre los turnos del agente y las ediciones del contexto.

4

Decodificar con caché consciente del enrutamiento

El router identifica los expertos activos, comprueba su residencia en la GPU y envía los fallos de caché por la ruta de CPU o PCIe adaptada al ancho de banda.

Resultados de rendimiento y compatibilidad del hardware

La evaluación publicada en 2026 compara FreeToken con motores de serving para el edge mantenidos activamente en seis máquinas y varias cargas de trabajo agénticas. Los resultados son más sólidos en sistemas con GPU NVIDIA modernas, suficiente memoria del sistema y un equilibrio adecuado entre el ancho de banda de memoria de la CPU y la capacidad de transferencia PCIe.

En una RTX 5090, el artículo informa de 77–83 tokens por segundo para Qwen3.6-35B y 22–25 tokens por segundo para DeepSeek-V4-Flash. En un portátil con RTX 4060 y una configuración de 8 GB, el resultado publicado para Qwen3.6 alcanza 39.3 tokens por segundo. Una RTX PRO 6000 de clase estación de trabajo sirve GLM-5.2 a 14.9 tokens por segundo, frente a 7.3 para la configuración indicada de llama.cpp.

Nivel de hardwareCarga de trabajo demostradaResultado publicadoInterpretación práctica
Portátil RTX 4060, 8 GBQwen3.6-35B39.3 tok/sMuestra el valor del serving adaptativo con VRAM limitada
RTX 5090 de sobremesa/servidorQwen3.6-35B77–83 tok/sMejores resultados publicados en la gama de consumo
RTX 5090 de sobremesa/servidorDeepSeek-V4-Flash22–25 tok/sEl gran conjunto de expertos sigue siendo viable localmente
RTX PRO 6000, 96 GBGLM-5.214.9 tok/sDemuestra un nivel de escala punta de lanza con 753B de parámetros
RTX PRO 6000, 96 GBComparación con llama.cpp7.3 tok/sResultado de referencia publicado con pesos comparables

La latencia de cola también es importante. La evaluación informa de que el peor turno de FreeToken se mantuvo por debajo de 44 segundos en las celdas probadas, mientras que los sistemas de referencia superaron retrasos considerablemente mayores en algunos casos. En aplicaciones agénticas, esto puede determinar si una solicitud termina antes de que un watchdog o un tiempo de espera del cliente la interrumpa.

Sin embargo, los benchmarks deben interpretarse con la debida cautela. Las mediciones fueron producidas por los autores, y el material disponible no establece una replicación independiente amplia. Las comparaciones principales también requieren prestar atención a las definiciones de medición, especialmente al comparar el rendimiento de decode con trazas de producción de extremo a extremo.

Hardware más adecuado

FreeToken resulta especialmente atractivo para una GPU NVIDIA reciente, una memoria del sistema abundante y cargas de trabajo que sirven repetidamente modelos MoE grandes. La compatibilidad del hardware importa más que la tasa de tokens anunciada.

Factor de hardwareCondición favorablePosible preocupación
GPUTarjeta NVIDIA reciente compatible con CUDALas tarjetas antiguas pueden no disponer de una ruta probada o empaquetada
VRAMEspacio suficiente para pesos no expertos, caché KV y ranuras de expertosUna VRAM reducida aumenta los fallos de caché
Memoria del sistemaCapacidad para el conjunto completo de expertosLos modelos grandes pueden superar la memoria habitual de un equipo de sobremesa
PCIeEnlace amplio y de gran ancho de bandaLos enlaces x8 de portátiles o más lentos aumentan la presión de transferencia
Memoria de la CPUDDR5 de doble canal potente o superiorLa ejecución en CPU puede verse limitada por el ancho de banda
Sistema operativoLinux POSIX con CUDANo se ha establecido compatibilidad con macOS ni con Windows de forma amplia

Estado de compatibilidad, limitaciones y comprobaciones de configuración

El lanzamiento de 2026 debe abordarse como un sistema en una fase inicial. Los clasificadores publicados indican un estado de desarrollo beta, un entorno CUDA y sistemas operativos Linux POSIX. El material de plataforma disponible no establece una versión nativa para Apple Silicon, compatibilidad amplia con macOS ni la cobertura de hardware asociada con runtimes para el edge más maduros.

La dirección declarada del proyecto incluye un formato de pesos FTW, kernels compatibles con CUDA, implementaciones SIMD para CPU y un backend MoE de respaldo completamente basado en CPU cuando la memoria fijada o el registro DMA no están disponibles. Estas funciones mejoran la flexibilidad, pero no garantizan un rendimiento equivalente entre sistemas operativos o tarjetas gráficas.

Antes de probar FreeToken:

  • Confirma que tu GPU y entorno CUDA coincidan con la ruta de runtime compatible
  • Compara la memoria del sistema disponible con el conjunto completo de expertos del modelo
  • Comprueba el ancho del enlace PCIe y el ancho de banda de la memoria del sistema antes de estimar el rendimiento
  • Reserva suficiente VRAM para los pesos no expertos y la caché KV en crecimiento
  • Utiliza pesos y cargas de trabajo idénticos al comparar motores
Por dónde empezar

Utiliza el destino oficial del proyecto FreeToken y el artículo de investigación de 2026 como referencias principales para consultar los detalles del lanzamiento, las notas de implementación y las configuraciones compatibles.

Punto de comprobaciónAcción recomendadaMotivo
Objetivo de instalaciónPrefiere una máquina Linux con CUDA que haya sido probadaEs el entorno compatible más claramente indicado en el material del lanzamiento
Formato del modeloConfirma si el modelo tiene una disposición compatible o convertibleFreeToken utiliza bancos de expertos normalizados y almacenamiento FTW
Plan de memoriaTen en cuenta el conjunto de expertos, la caché KV y las aplicaciones simultáneasLos sistemas edge tienen presupuestos de memoria cambiantes
Método de benchmarkReutiliza prompts, pesos y trazas de carga de trabajoLas distintas trayectorias de los agentes pueden distorsionar las comparaciones
Prueba de fiabilidadMide la latencia de cola, no solo el rendimiento medioLas pausas prolongadas pueden activar watchdogs o tiempos de espera del cliente

Para una primera evaluación, comienza con un modelo que se ajuste a tu presupuesto de memoria del sistema y una carga de trabajo breve y controlada. Registra el tiempo de inicio, el tiempo hasta el primer token, la tasa de decode estable, el comportamiento de la caché y la latencia del peor turno. Después, repite la prueba mientras ejecutas aplicaciones de escritorio normales para observar cómo se comporta la gestión elástica de memoria bajo presión.

¿Quién debería usar FreeToken en 2026?

FreeToken no es un sustituto universal para todos los motores de inferencia local. Su caso de uso más sólido es el de un usuario técnicamente competente o un equipo pequeño que posee hardware NVIDIA adecuado, trabaja con modelos MoE y valora el control local, la disponibilidad predecible y una menor dependencia de la inferencia alojada.

El sistema puede ser menos adecuado cuando la amplitud de plataformas es la prioridad. Los usuarios que dependen de Apple Silicon, tarjetas NVIDIA antiguas, dispositivos no compatibles con CUDA o una instalación multiplataforma sencilla deberían verificar la compatibilidad antes de invertir tiempo en la migración.

Compatibilidad alta

  • GPU NVIDIA reciente
  • Gran presupuesto de memoria del sistema
  • Serving MoE frecuente
  • Cargas de trabajo agénticas o multiturno

Compatibilidad posible

  • VRAM limitada
  • Enlace PCIe rápido
  • Sistema DDR5 moderno
  • Disposición para realizar benchmarks localmente

Compatibilidad baja

  • Dependencia de Apple Silicon
  • Hardware GPU antiguo
  • Poca capacidad de memoria del sistema
  • Necesidad de un instalador general pulido

Prioridad de evaluación

  • Comprobar primero la compatibilidad
  • Comparar la latencia de cola
  • Supervisar la presión de memoria
  • Validar la precisión de la carga de trabajo

La importancia más amplia del lanzamiento es arquitectónica. Trata el hardware de consumo como un sistema combinado en lugar de evaluar la memoria de la GPU de forma aislada. Su caché de expertos, la coejecución en CPU, los puntos de control semánticos y el ajuste de memoria durante la ejecución abordan distintas partes del mismo problema: hacer utilizables los modelos dispersos grandes fuera de los centros de datos dedicados.

Orden de evaluación recomendado

Comienza por la compatibilidad, confirma después la capacidad de memoria, mide una carga de trabajo breve y solo entonces compara el rendimiento. Así evitarás que una cifra de benchmark impresionante oculte una ruta de despliegue inutilizable.

Q: ¿Qué son los lanzamientos de FreeToken de 2026?

Se refieren al sistema público de serving MoE nativo para el edge de FreeToken y a su lanzamiento de investigación complementario del 24 de agosto de 2026. FreeToken es un runtime de inferencia, no un modelo de lenguaje nuevo.

Q: ¿Qué hardware admite FreeToken?

La ruta documentada se dirige principalmente a sistemas NVIDIA con CUDA, incluidos portátiles y equipos de sobremesa de consumo, así como GPU de clase estación de trabajo. Linux y los entornos POSIX son la dirección de compatibilidad más clara en el material disponible del lanzamiento.

Q: ¿Por qué FreeToken puede servir modelos más grandes que la memoria de la GPU?

El conjunto completo de expertos permanece en la memoria del sistema, mientras que los expertos seleccionados se trasladan a una caché GPU elástica o se ejecutan directamente en la CPU. El enrutamiento MoE disperso hace que solo un subconjunto esté activo para cada token, aunque el conjunto completo siga necesitando almacenamiento.

Q: ¿Es FreeToken más rápido que todos los motores de inferencia local?

El artículo de 2026 informa de resultados sólidos frente a determinados sistemas de referencia para serving en el edge, pero esas mediciones proceden de los autores del proyecto y deberían probarse de forma independiente en tu hardware y con tu carga de trabajo.