- Modelo FreeToken 290b: Comprende el enfoque de servicio en el borde para modelos dispersos de escala avanzada.
- Diseño principal: Combina el almacenamiento en caché de expertos en la GPU, la ejecución en la CPU y las transferencias PCIe.
- Mejor configuración: Mide el ancho de banda del host y de PCIe antes de ajustar el entorno de ejecución.
- Ventaja principal: Reduce los fallos de caché durante la decodificación y oculta las transferencias del prellenado tras el cómputo.
- Alcance del hardware: La compatibilidad abarca desde una GPU de portátil de 8 GB hasta hardware de clase estación de trabajo.
Modelo FreeToken 290b: qué hace el sistema
FreeToken es un sistema de servicio nativo del borde para modelos grandes de Mezcla de Expertos. El término de búsqueda modelo FreeToken 290b generalmente apunta al contexto de servicio de escala avanzada del artículo, aunque la demostración documentada utiliza DeepSeek-V4-Flash, con 284B de parámetros totales y aproximadamente 13B de parámetros activos por token. La distinción importante es que la activación dispersa reduce el cómputo, pero el conjunto completo de expertos todavía requiere una cantidad considerable de memoria y almacenamiento del host.
En lugar de exigir que el modelo completo quepa en la memoria de la GPU, FreeToken trata la GPU, la CPU, la memoria del host y la interconexión PCIe como una única plataforma de inferencia. Los pesos que no pertenecen a expertos permanecen en la GPU, mientras que el conjunto completo de expertos seleccionables permanece en la memoria del host. Una caché dinámica en la GPU almacena las parejas de capa y experto más útiles para la carga de trabajo actual.
El sistema está orientado a sesiones agénticas, en las que los contextos largos y las llamadas repetidas a herramientas generan presión tanto en el prellenado como en la decodificación. Su diseño aborda tres problemas recurrentes:
- Coste de transferencia del prellenado: Los grandes conjuntos de expertos deben desplazarse a través del enlace entre la CPU y la GPU.
- Fallos de caché durante la decodificación: Cada token puede solicitar expertos que no están actualmente residentes.
- Recursos cambiantes: Los navegadores, juegos, aplicaciones de escritorio y las cachés KV en crecimiento pueden reducir la VRAM disponible.
El artículo de investigación, “FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution”, describe la arquitectura, la implementación y la evaluación publicadas el 24 de agosto de 2026.
Cómputo disperso
El enrutamiento MoE activa solo un pequeño subconjunto de expertos para cada token, lo que hace más práctico el cómputo de escala avanzada en hardware local.
Caché elástica
Una caché LRU compartida realiza un seguimiento de los expertos enrutados recientemente y puede redimensionarse a medida que cambia el presupuesto de memoria disponible en la GPU.
Ejecución híbrida
Los fallos de caché pueden transferirse a la GPU o ejecutarse directamente en la CPU según el ancho de banda medido.
El número total de parámetros no equivale al cómputo activo por token. FreeToken hace utilizable el cómputo disperso mientras gestiona la mayor huella de memoria del conjunto completo de expertos.
Cómo gestiona FreeToken el prellenado y la decodificación
FreeToken separa la inferencia en dos fases porque el prellenado y la decodificación tienen cuellos de botella diferentes. El prellenado procesa el prompt y determina el tiempo hasta el primer token, mientras que la decodificación genera tokens uno a uno y es más sensible a la localidad de los expertos y al equilibrio del ancho de banda.
Durante el prellenado, el sistema utiliza doble búfer para capas completas. Mientras la GPU calcula una capa, los pesos de expertos de la siguiente capa se transmiten por PCIe a un segundo búfer. Esto solapa la transferencia y el cómputo, en lugar de esperar a que termine cada movimiento de expertos antes de continuar.
Las cargas de trabajo agénticas también modifican con frecuencia el historial de conversación. Los bloques de razonamiento, las llamadas a herramientas, sus resultados y los turnos de conversación pueden eliminarse o reemplazarse entre solicitudes. FreeToken coloca puntos de control del estado recurrente en estos límites semánticos para que pueda reutilizarse un prefijo que permanezca intacto. Solo es necesario procesar de nuevo el sufijo modificado.
Durante la decodificación, los expertos enrutados se comprueban en la caché compartida de la GPU. Los aciertos de caché se ejecutan directamente en la GPU. Los fallos se dividen entre el llenado de la caché de la GPU y la ejecución en la CPU mediante una proporción derivada del ancho de banda.
| Fase de inferencia | Presión principal | Respuesta de FreeToken | Resultado práctico |
|---|---|---|---|
| Prellenado | Transferencia de expertos y recomputación del prompt | Doble búfer de capas completas y puntos de control semánticos | Menor exposición a transferencias y menos trabajo repetido |
| Decodificación | Fallos de expertos y ancho de banda limitado del host | Caché LRU y división de fallos entre CPU y GPU | Ejecución más equilibrada por token |
| Uso agéntico de varios turnos | Modificaciones del contexto después de herramientas o razonamiento | Reutilización de prefijos en anclajes semánticos | Prellenado de nuevo más corto para el historial conservado |
| Cambios en el entorno de ejecución | Fluctuaciones de la VRAM y demanda de la caché KV | Redimensionamiento elástico de la caché de expertos | No es necesario reiniciar el motor para cada ajuste de memoria |
La política de fallos utiliza dos valores medidos:
- Bₚ: Ancho de banda de transferencia de expertos del host al dispositivo mediante memoria fijada.
- Bₕ: Ancho de banda efectivo del host disponible para el kernel de expertos de la CPU.
Para un paso con m expertos ausentes, el número aproximado de llenados de caché es:
q* ≈ m × Bₚ / Bₕ
Una proporción PCIe más alta favorece un mayor número de llenados de caché en la GPU. Una ruta de CPU más potente deja más fallos para la ejecución directa en la CPU. Se trata de una política del entorno de ejecución, no de una lista fija de niveles de hardware.
La división óptima entre CPU y GPU depende del ancho de banda medido, la disposición de la memoria, el comportamiento de la CPU y el enlace PCIe utilizado. Las hojas de especificaciones del hardware son útiles para la planificación, pero la política de FreeToken debe basarse en mediciones del entorno de ejecución.
Guía de hardware y rendimiento del modelo FreeToken 290b
La evaluación documentada cubre varias configuraciones de consumo y de estación de trabajo. Los resultados varían según el modelo, la cuantización, la memoria del host, la generación de PCIe y la carga de trabajo, por lo que las cifras siguientes deben considerarse puntos de referencia reportados, no garantías universales.
El sistema sirve Qwen3.6-35B-A3B, DeepSeek-V4-Flash y una demostración de GLM-5.2 en una estación de trabajo. El ejemplo más grande utiliza un modelo MoE de 753B parámetros en una única RTX PRO 6000 Blackwell con 96 GB de memoria.
| Modelo o nivel | Parámetros totales | Parámetros activos | Implementación reportada |
|---|---|---|---|
| Qwen3.6-35B-A3B | 35B | Clase 3B | GPUs de consumo, incluido hardware de portátiles |
| DeepSeek-V4-Flash | 284B | 13B | Sistemas de clase RTX 3090, 4090 y 5090 |
| GLM-5.2 | 753B | 40B | RTX PRO 6000 Blackwell, 96 GB |
| Alcance del artículo de FreeToken | Más de 20 modelos MoE | Depende del modelo | Desde una GPU de portátil de 8 GB hasta una GPU de estación de trabajo |
En una RTX 5090, el artículo informa aproximadamente de 77–83 tokens por segundo para Qwen3.6 y de 22–25 tokens por segundo para DeepSeek-V4-Flash en las cargas de trabajo probadas. El resultado reportado se sitúa entre 1.5× y 2.3× del baseline más potente, según el modelo y el escenario.
Para la carga de trabajo de programación con Qwen3.6 en distintos dispositivos, FreeToken superó al baseline más potente aproximadamente en:
| Configuración de hardware | Ventaja reportada |
|---|---|
| RTX 3090 | 1.3× |
| RTX 4090 | 1.3× |
| Servidor RTX 5090 | 1.9× |
| Equipo de escritorio RTX 5090 | 2.1× |
| Portátil RTX 4060 | 1.8× |
| RTX PRO 6000 con GLM-5.2 | 2.0× frente a llama.cpp |
El ejemplo del portátil con RTX 4060 es notable porque el sistema de 8 GB utilizó una compilación NVFP4 y alcanzó 39.3 tokens por segundo, equivalente al 92 % de la tasa de la RTX 4090 en esa comparación. El resultado demuestra por qué el ancho de banda del host y la cuantización pueden ser tan importantes como los nombres de los modelos de GPU.
Las mayores mejoras de FreeToken provienen de la coordinación. Una GPU más pequeña puede seguir siendo competitiva cuando el entorno de ejecución utiliza de forma eficiente su enlace PCIe, el ancho de banda de la CPU, la capacidad de la caché y el formato del modelo.
Flujo de configuración de FreeToken paso a paso
Una implementación práctica debe comenzar por la jerarquía de memoria, no por suposiciones sobre el tamaño de la caché. El conjunto de expertos residente en el host sigue siendo la fuente de verdad, por lo que la capacidad de la caché de la GPU afecta a la velocidad y la latencia, pero no a la integridad del modelo.
Identifica el modelo y el formato de expertos
Confirma los parámetros totales del modelo, los parámetros activos, la precisión, el número de expertos y la disposición del checkpoint. El formato FTW de FreeToken normaliza los bancos de expertos en una estructura de capa y experto adecuada para el entorno de ejecución, y puede evitar el descubrimiento de tensores y el reempaquetado durante el inicio.
Mide el ancho de banda del host y de PCIe
Perfila el ancho de banda de transferencia de expertos mediante memoria fijada y el ancho de banda efectivo de procesamiento de expertos de la CPU en la máquina de destino. Utiliza estos valores para estimar la parte de llenado de caché de cada fallo de decodificación, en lugar de depender únicamente del ancho de banda anunciado.
Reserva el presupuesto de memoria
Asigna memoria de la GPU para los pesos que no son de expertos, las activaciones y la caché KV antes de asignar el espacio restante a las ranuras de expertos. Mantén la caché elástica porque las sesiones agénticas largas aumentan la demanda de la caché KV.
Prepara el conjunto de expertos del host
Carga los expertos directamente en su disposición final en el host y, cuando la plataforma lo admita, fija la memoria ocupada para DMA. Esto evita fallos de página innecesarios y reduce la sobrecarga de inicio.
Calienta el sistema con cargas de trabajo reales
Comienza con prompts representativos, llamadas a herramientas y sesiones de varios turnos. Deja que la caché LRU compartida aprenda el patrón de enrutamiento activo y, después, evalúa la velocidad de decodificación, el tiempo hasta el primer token, la tasa de fallos y la latencia de cola.
| Comprobación de configuración | Acción recomendada | Por qué es importante |
|---|---|---|
| Memoria de la GPU | Divide el espacio entre la caché KV y las ranuras de expertos | El crecimiento del contexto cambia el equilibrio adecuado |
| Memoria del host | Mantén disponible el conjunto completo de expertos | El almacenamiento del host sigue siendo la fuente de verdad |
| Ruta PCIe | Utiliza memoria fijada cuando sea compatible | La transferencia DMA determina la velocidad de llenado de la caché |
| Ejecución de la CPU | Fija los trabajadores cerca del nodo NUMA de la GPU | Evita penalizaciones innecesarias de acceso a memoria |
| Formato de inicio | Prefiere disposiciones preempaquetadas de estilo FTW | Reduce el trabajo de descubrimiento y reempaquetado |
Comienza con una prueba con la caché fría y otra con un agente de varios turnos. Un único prompt corto puede ocultar el comportamiento de transferencia, caché y reutilización del contexto que determina el rendimiento en el mundo real.
Limitaciones, lista de comprobación y buenas prácticas
FreeToken mejora el sistema de servicio, pero no elimina el coste físico de los modelos grandes. El conjunto completo de expertos todavía puede requerir cientos de gigabytes de memoria o almacenamiento del host. La compatibilidad de la plataforma también depende del comportamiento del sistema operativo y de los controladores, especialmente en el caso de la memoria fijada o registrada.
Cuando no se puede establecer la ruta DMA rápida, el entorno de ejecución puede recurrir a un backend MoE basado exclusivamente en la CPU. Las capas que no son de expertos permanecen en la GPU, mientras que las activaciones, los metadatos de enrutamiento y las salidas agregadas cruzan el límite entre dispositivos. Esto mejora la facilidad de implementación, pero puede reducir el rendimiento máximo de transferencia.
Utiliza la siguiente lista de comprobación antes de comparar resultados:
Lista de comprobación de preparación para la implementación:
- Confirma la precisión del modelo y el tamaño completo del conjunto de expertos
- Mide la transferencia PCIe mediante memoria fijada y el ancho de banda de expertos de la CPU
- Reserva VRAM tanto para la caché KV como para las ranuras de expertos
- Prueba cargas de trabajo de inicio en frío, de un solo turno y de varios turnos
- Registra la tasa de fallos de caché, el TTFT, la velocidad de decodificación y la latencia de cola
Las métricas más útiles no se limitan a la media de tokens por segundo. En las cargas de trabajo agénticas, un TTFT de cola larga puede determinar si un cliente espera correctamente o alcanza el umbral de tiempo de espera. El artículo informa que FreeToken se mantuvo por debajo de 44 segundos en el peor turno de TTFT de las celdas probadas, mientras que cada baseline superó los 150 segundos en algún punto de la evaluación.
| Métrica | Qué supervisar | Interpretación |
|---|---|---|
| Rendimiento de decodificación | Media de tokens por segundo | Mide la eficiencia de generación |
| TTFT | Latencia media y del peor turno | Captura la transferencia del prompt y la recomputación |
| Tasa de fallos de expertos | Fallos como proporción de lecturas enrutadas | Muestra la calidad de la localidad de caché |
| Capacidad de la caché | Porcentaje del conjunto de expertos residente | Relaciona la asignación de VRAM con la reutilización |
| Tiempo de inicio | Carga desde el disco más la primera respuesta | Mide la usabilidad práctica bajo demanda |
Evalúa el mismo arnés, los mismos prompts, la misma precisión del modelo y los mismos criterios de éxito en todos los motores. Las trayectorias de los agentes pueden divergir, lo que hace que las comparaciones directas de tiempo de pared sean engañosas cuando las solicitudes realizan cantidades de trabajo diferentes.
Preguntas frecuentes sobre FreeToken
Q: ¿El modelo FreeToken 290b es un modelo independiente con nombre oficial?
La investigación proporcionada identifica FreeToken como un sistema de servicio, no como un checkpoint de modelo 290B independiente. Su principal ejemplo documentado es DeepSeek-V4-Flash, con 284B de parámetros totales, por lo que la expresión 290b debe tratarse como una etiqueta de búsqueda para el tema del servicio de escala avanzada.
Q: ¿Qué diferencia a FreeToken de la asignación estática entre CPU y GPU?
Los sistemas estáticos deciden la ubicación de los expertos durante la carga o el prellenado. FreeToken utiliza una caché LRU compartida que sigue el enrutamiento de la decodificación y divide los fallos inevitables entre los llenados de caché mediante PCIe y la ejecución directa en la CPU.
Q: ¿Puede FreeToken ejecutar modelos MoE grandes en una GPU de portátil de 8 GB?
La evaluación informa de una configuración con un portátil RTX 4060 de 8 GB para Qwen3.6 utilizando NVFP4. El modelo completo sigue dependiendo de expertos residentes en el host, por lo que la memoria de la GPU por sí sola no contiene el checkpoint completo.
Q: ¿Por qué son importantes las cargas de trabajo agénticas de varios turnos?
Las llamadas a herramientas y las modificaciones del contexto activan repetidamente el prellenado. FreeToken utiliza puntos de control semánticos para conservar prefijos reutilizables, mientras que su caché de expertos realiza un seguimiento de la localidad del enrutamiento durante la decodificación.