- El servicio MoE nativo del edge de FreeToken coordina los recursos de CPU y GPU para modelos grandes de mezcla de expertos.
- La ejecución consciente del ancho de banda adapta el cálculo a los límites de memoria e interconexión de cada máquina.
- El doble búfer superpone el movimiento de datos con el cálculo durante la etapa de prellenado.
- La decodificación adaptativa responde a los fallos de caché de expertos en lugar de depender de una colocación fija.
- Los resultados publicados incluyen hasta 40 tokens por segundo en un portátil y 15 en una estación de trabajo para un modelo de 753B.
Explicación del servicio MoE nativo del edge de FreeToken
El servicio MoE nativo del edge de FreeToken es un sistema de investigación para ejecutar modelos de lenguaje muy grandes de mezcla de expertos, o MoE, en hardware local convencional. En lugar de considerar la memoria limitada de la GPU como un bloqueo automático, el diseño divide el trabajo entre el procesador gráfico, el procesador central, la memoria del sistema y las interconexiones disponibles.
La idea central es la orquestación de recursos. Un ordenador de consumo puede tener una GPU capaz, pero no suficiente memoria gráfica para un modelo de escala frontera. Pasar cada operación por la misma ruta lenta provoca esperas. FreeToken adapta la ejecución al ancho de banda, al estado de la caché y a la fase actual de inferencia.
El proyecto se publicó en arXiv el 17 de agosto de 2026, con el título FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution. Entre los autores enumerados se encuentran Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt Keutzer, Song Han, Matei Zaharia, Chenfeng Xu e Ion Stoica.
Aspectos destacados del vídeo:
- Los modelos MoE grandes pueden distribuirse entre los recursos de CPU y GPU.
- El prellenado utiliza transferencias, cálculo y creación de puntos de control superpuestos.
- La decodificación adapta la carga de expertos cuando se producen fallos de caché.
- Las pruebas publicadas abarcan desde un portátil con 8 GB hasta una estación de trabajo con 96 GB.
- Las cargas de trabajo de agentes se benefician de una decodificación más rápida y de una menor latencia inicial de respuesta.
| Concepto | Enfoque de FreeToken | Efecto práctico |
|---|---|---|
| Límite de memoria de la GPU | Distribuye el trabajo del modelo entre la GPU, la CPU y la memoria del sistema | Hace más prácticos los modelos grandes en sistemas locales |
| Transferencias lentas | Adapta la ejecución al ancho de banda medido | Reduce los periodos de inactividad evitables |
| Carga de expertos | Utiliza una colocación consciente de la caché y una carga dinámica | Limita el movimiento repetido de los expertos activos |
| Prompts largos | Superpone la transferencia y el cálculo durante el prellenado | Mejora el rendimiento del procesamiento de prompts |
| Ediciones de agentes | Mantiene puntos de control en anclajes de tokens | Evita rehacer innecesariamente todo el prellenado |
Considera FreeToken como un proyecto de investigación de sistemas e inferencia, no como una aplicación convencional para usuarios finales. Su principal aportación es la forma en que coordina los recursos durante el servicio del modelo.
Adaptación al ancho de banda
La ejecución cambia según el ancho de banda de la memoria de la CPU, la capacidad de la GPU y la conexión entre ambas.
Consciencia de la caché
Los expertos utilizados recientemente permanecen disponibles cuando es posible, lo que reduce el coste de transferirlos repetidamente.
Orientación a pipelines
El movimiento de datos y el cálculo se organizan para superponerse en lugar de esperar en una única cola secuencial.
Arquitectura y fases de inferencia
FreeToken separa la inferencia en dos fases importantes: prellenado y decodificación. El prellenado procesa el contexto de entrada, mientras que la decodificación genera nuevos tokens uno a uno. Estas fases tienen presiones de rendimiento diferentes, por lo que utilizar una única política de planificación fija para ambas puede dejar el hardware infrautilizado.
Durante el prellenado, el sistema utiliza doble búfer para la capa completa. Mientras se calcula una parte del modelo, otra parte puede transferirse o prepararse. Esta disposición es especialmente importante cuando los pesos de los expertos no pueden permanecer permanentemente en la memoria de la GPU.
El sistema también mantiene puntos de control del estado en anclajes especiales de tokens. En los flujos de trabajo de agentes, un usuario o una herramienta puede editar parte de la conversación. En lugar de reconstruir todo el estado del prompt después de cada edición, los puntos de control pueden ayudar a conservar el cálculo reutilizable y reducir el trabajo repetido de prellenado.
| Fase de inferencia | Desafío principal | Técnica de FreeToken | Beneficio esperado |
|---|---|---|---|
| Prellenado | Procesar prompts largos mientras se mueven los datos del modelo | Doble búfer para la capa completa | Mejor superposición entre transferencia y cálculo |
| Prellenado | Recalcular después de las ediciones de un agente | Puntos de control del estado en anclajes de tokens | Menor coste del procesamiento repetido de prompts |
| Decodificación | Los pesos de los expertos pueden no estar en la caché | Política adaptativa para gestionar fallos | Utilización más equilibrada de CPU y GPU |
| Decodificación | La CPU y la GPU pueden esperar recursos diferentes | Carga dinámica de expertos y trabajo de la CPU en el propio lugar | Menos periodos de inactividad evitables |
La etapa de decodificación utiliza una estrategia diferente. Cuando un experto no está disponible en la caché activa, FreeToken puede equilibrar la carga de ese experto a través de la interconexión con el cálculo realizado directamente en la CPU. La política está diseñada para evitar que cualquiera de los dos lados permanezca inactivo mientras el otro pueda continuar con trabajo útil.
Esta distinción es importante porque los modelos MoE no activan todos los expertos para cada token. El sistema debe identificar qué expertos se necesitan, determinar dónde están disponibles y elegir si es más eficiente mover el trabajo o procesarlo localmente.
Un número elevado de parámetros no equivale directamente a la cantidad de cálculo utilizada para cada token en un modelo MoE. Sin embargo, el modelo completo sigue generando importantes necesidades de almacenamiento y movimiento de datos, que FreeToken aborda mediante la planificación.
Prepara el contexto activo
Realiza el prellenado del prompt mientras organizas las transferencias de datos del modelo y el cálculo mediante el pipeline de doble búfer.
Registra el estado reutilizable
Conserva puntos de control en anclajes de tokens seleccionados para que las ediciones adecuadas del agente puedan reutilizar cálculos anteriores.
Controla la disponibilidad de los expertos
Supervisa qué expertos ya están en la caché e identifica los fallos durante la generación de tokens.
Selecciona la ruta de ejecución
Equilibra la carga de expertos a través del bus con la ejecución directa en la CPU según las condiciones actuales de los recursos.
Continúa con la decodificación adaptativa
Reevalúa la colocación a medida que cambian el estado de la caché y las condiciones de la carga de trabajo, en lugar de mantener una política estática.
Cobertura de hardware y perfil de rendimiento
FreeToken se evaluó en diversas configuraciones locales, en lugar de utilizar una única máquina idealizada. El rango de pruebas publicado va desde un portátil con 8 GB hasta una estación de trabajo con 96 GB. Estos sistemas difieren considerablemente en el ancho de banda de la memoria del sistema y en el rendimiento de la interconexión, por lo que la planificación adaptativa resulta importante.
Una configuración compacta de portátil tenía un ancho de banda de interconexión inferior a 12 GB por segundo. En el otro extremo, la configuración de estación de trabajo más potente alcanzó 178 GB por segundo de ancho de banda de memoria de la CPU. Estas diferencias influyen en si un experto debe trasladarse a la GPU, procesarse en la CPU o conservarse en una caché para utilizarlo posteriormente.
| Entorno de prueba | Característica de hardware publicada | Por qué importa |
|---|---|---|
| Portátil compacto | Clase de memoria de 8 GB; interconexión inferior a 12 GB/s | Los retrasos de transferencia se convierten en una importante restricción de planificación |
| Portátil RTX 4060 | Configuración de GPU portátil | Comprueba si las cargas de trabajo de agentes de programación siguen siendo prácticas |
| Ordenador de sobremesa RTX 5090 | GPU de sobremesa de gama alta | Demuestra una decodificación de agentes y un procesamiento de prompts más rápidos |
| Estación de trabajo grande | Hasta 96 GB de memoria del sistema; ancho de banda de la CPU de hasta 178 GB/s | Ofrece más margen para la ejecución en el sistema anfitrión |
| Prueba MoE en estación de trabajo | Modelo de 753B parámetros | Muestra el comportamiento del sistema con un modelo inusualmente grande |
Los resultados publicados varían según la carga de trabajo y el hardware. En una configuración de portátil, FreeToken se acercó a 40 tokens por segundo al servir un modelo de 753 mil millones de parámetros. En una estación de trabajo, la misma categoría general de prueba alcanzó unos 15 tokens por segundo para ese modelo y se publicó como un rendimiento aproximadamente dos veces superior al de los motores de servicio comparados.
En un ordenador de sobremesa con RTX 5090, las cargas de trabajo de agentes de programación superaron los 76 tokens por segundo en las pruebas publicadas. Otra carga de trabajo con un modelo grande superó los 22 tokens por segundo, mientras que otro modelo alcanzó más de 80 tokens por segundo. Estas cifras deben interpretarse como observaciones de benchmarks vinculadas a configuraciones, variantes de modelos y cargas de trabajo específicas, no como garantías universales para cualquier dispositivo.
| Carga de trabajo o configuración | Resultado publicado de FreeToken | Interpretación |
|---|---|---|
| Portátil con modelo MoE grande | Casi 40 tokens/s | Muestra el valor de la ejecución local adaptativa |
| Estación de trabajo con modelo 753B | Aproximadamente 15 tokens/s | Publicado con un rendimiento aproximadamente dos veces superior al de motores rivales |
| Prueba de agente de programación en RTX 4060 | Más de 39 tokens/s | Demuestra un rendimiento sólido en una configuración de GPU móvil |
| Prueba de agente de programación en sobremesa RTX 5090 | Más de 76 tokens/s | Indica un mayor rendimiento en un ordenador de sobremesa potente |
| Prellenado de prompts largos | Más de 6.600 tokens/s con 16.000 tokens | Destaca el escalado del pipeline durante el prellenado |
Los resultados demuestran que la coordinación del hardware puede cambiar el límite práctico del servicio. No significan que todos los portátiles o estaciones de trabajo reproduzcan el mismo rendimiento.
Caché, fallos y prioridades de ajuste
La caché es uno de los mecanismos de rendimiento más importantes de FreeToken. Como la inferencia MoE activa determinados expertos, una caché útil puede evitar transferencias repetidas. Una política de colocación deficiente aumenta los fallos y obliga al sistema a mover o recalcular datos en momentos poco convenientes.
La evaluación publicada compara una política de caché de uso menos reciente con estrategias de colocación estática y basadas en el prellenado. La política de uso menos reciente de FreeToken redujo sustancialmente los fallos de caché de expertos en los modelos probados. Este enfoque resulta intuitivo para cargas de trabajo cambiantes: es más probable que los expertos utilizados recientemente sigan siendo útiles durante los pasos de decodificación cercanos, aunque el comportamiento puede variar según la carga de trabajo.
| Política | Comportamiento de colocación | Ventaja | Riesgo |
|---|---|---|---|
| Uso menos reciente | Conserva los expertos a los que se ha accedido recientemente | Se adapta a los cambios en la demanda de tokens | Puede no predecir un cambio repentino en la carga de trabajo |
| Colocación estática | Mantiene una disposición de expertos predeterminada | Es sencilla y predecible | Puede desperdiciar espacio cuando cambia la demanda |
| Colocación basada en el prellenado | Utiliza la actividad de la etapa del prompt para orientar la colocación posterior | Conecta el contexto inicial con la configuración de la caché | Puede quedar obsoleta durante una decodificación larga |
| Ejecución adaptativa | Elige dinámicamente rutas de CPU, GPU o transferencia | Responde al ancho de banda actual y a los fallos | Requiere una mayor coordinación en tiempo de ejecución |
Para prompts largos, el rendimiento de prellenado publicado superó los 6.600 tokens por segundo con un contexto de 16.000 tokens en la configuración probada. El pipeline de doble búfer se comparó con la ejecución sin pipeline y con sistemas de referencia, y el diseño superpuesto mostró un mayor rendimiento en las mediciones publicadas.
Un orden práctico de ajuste sigue la arquitectura del sistema:
- Mide el ancho de banda de la memoria del sistema y el comportamiento de la interconexión antes de elegir una colocación fija.
- Separa el análisis del prellenado del análisis de la decodificación porque sus cuellos de botella son diferentes.
- Observa los fallos de caché de expertos en lugar de evaluar el rendimiento únicamente por el tamaño total del modelo.
- Conserva el estado reutilizable en los flujos de trabajo de agentes cuyos prompts se editan repetidamente.
- Compara los costes de ejecución en la CPU y de transferencia bajo la carga de trabajo real.
Lista de comprobación para revisar el servicio:
- Identificar la memoria disponible de la GPU y la capacidad de la memoria del sistema
- Medir el ancho de banda efectivo de la interconexión entre CPU y GPU
- Comprobar por separado el rendimiento de prellenado y de decodificación
- Supervisar los fallos de caché de expertos durante cargas de trabajo representativas
- Registrar el tiempo hasta el primer token y el rendimiento estable de tokens
Utiliza prompts, acciones de agentes y variantes de modelos representativos. Un prompt corto de chatbot puede ocultar los costes de transferencia que aparecen en cargas de trabajo con contextos largos o uso de herramientas.
Casos de uso, limitaciones y contexto de investigación
FreeToken resulta especialmente relevante para investigadores, ingenieros de infraestructura y usuarios avanzados de inferencia local interesados en el servicio de modelos nativos del edge. Sus cargas de trabajo de agentes publicadas incluyen tareas orientadas a la programación, en las que tanto el tiempo hasta el primer token como la velocidad sostenida de decodificación afectan a la usabilidad.
El sistema también destaca que servir modelos MoE masivos no es únicamente un problema de capacidad de memoria. La memoria sigue siendo importante, pero la ruta entre las ubicaciones de almacenamiento, la velocidad del cálculo en el sistema anfitrión, el comportamiento de la caché y las decisiones de planificación pueden determinar si el hardware disponible se utiliza de forma eficiente.
Los resultados publicados del tiempo hasta el primer token se mantuvieron dentro de unos pocos segundos en las pruebas destacadas de agentes con RTX 5090, mientras que los sistemas comparados a veces necesitaban mucho más tiempo o no completaban correctamente. Esta medida es distinta del rendimiento de decodificación: un sistema puede generar tokens rápidamente después de un inicio lento, o comenzar con rapidez pero mantener una velocidad de salida menor.
| Métrica | Qué mide | Por qué importa |
|---|---|---|
| Tiempo hasta el primer token | Retraso antes de que comience la generación | Es importante para asistentes interactivos y agentes |
| Rendimiento de decodificación | Tokens generados por segundo | Indica la velocidad sostenida de respuesta |
| Rendimiento de prellenado | Tokens de contexto procesados por segundo | Importa para prompts largos e historiales de herramientas |
| Tasa de fallos de caché | Frecuencia con la que no están disponibles los datos de los expertos | Revela la presión sobre las transferencias y la colocación |
| Utilización de recursos | Actividad de la CPU y la GPU durante el servicio | Muestra si uno de los procesadores permanece inactivo |
FreeToken no elimina la necesidad de contar con hardware adecuado, compatibilidad con el modelo o una evaluación cuidadosa. El rendimiento depende de la capacidad de memoria, el ancho de banda, la velocidad de interconexión, la estructura del modelo, la longitud del prompt y el comportamiento de la carga de trabajo de servicio. El material publicado también describe una evaluación de investigación, no una lista universal de compatibilidad.
Para los lectores técnicos, la referencia principal es el artículo de FreeToken en arXiv, registrado como arXiv:2608.16157 en computación distribuida, paralela y de clústeres. La publicación del artículo en agosto de 2026 lo convierte en el punto de partida adecuado para consultar los detalles de implementación, la metodología experimental y la terminología formal de los autores.
Comienza por la arquitectura y después reproduce un pequeño experimento de prellenado o de caché antes de intentar desplegar un servicio completo de modelos grandes.
Q: ¿Qué es el servicio MoE nativo del edge de FreeToken?
Es un enfoque de investigación para servir modelos de lenguaje grandes de mezcla de expertos en hardware local o edge mediante la coordinación del cálculo de la CPU, el cálculo de la GPU, la memoria del sistema, las transferencias y la caché de expertos.
Q: ¿Por qué FreeToken utiliza políticas diferentes para el prellenado y la decodificación?
El prellenado procesa el contexto de entrada en bloque, mientras que la decodificación genera tokens secuencialmente y puede encontrar fallos de caché de expertos. Sus cuellos de botella son diferentes, por lo que FreeToken utiliza una ejecución de pipeline superpuesta para el prellenado y un equilibrio adaptativo durante la decodificación.
Q: ¿A qué hardware se dirige FreeToken?
La evaluación publicada abarca sistemas desde un portátil con 8 GB hasta una estación de trabajo con 96 GB, incluidas configuraciones con un portátil RTX 4060 y un ordenador de sobremesa RTX 5090. Los resultados dependen del hardware y la carga de trabajo exactos.
Q: ¿FreeToken garantiza un resultado específico de tokens por segundo?
No. Las cifras publicadas son mediciones realizadas con modelos, dispositivos y cargas de trabajo seleccionados en 2026. El rendimiento real puede cambiar según la memoria, el ancho de banda de la interconexión, la longitud del prompt, el comportamiento de la caché y las condiciones de planificación.