Servicio MoE nativo del edge de FreeToken: Guía de arquitectura - Arquitectura

Servicio MoE nativo del edge de FreeToken: Guía de arquitectura

Descubre cómo FreeToken utiliza ejecución adaptativa al ancho de banda, almacenamiento en caché y coordinación entre CPU y GPU para servir modelos MoE grandes en hardware edge.

2026-08-25
Equipo de FreeToken
Guía rápida
  • El servicio MoE nativo del edge de FreeToken coordina los recursos de CPU y GPU para modelos grandes de mezcla de expertos.
  • La ejecución consciente del ancho de banda adapta el cálculo a los límites de memoria e interconexión de cada máquina.
  • El doble búfer superpone el movimiento de datos con el cálculo durante la etapa de prellenado.
  • La decodificación adaptativa responde a los fallos de caché de expertos en lugar de depender de una colocación fija.
  • Los resultados publicados incluyen hasta 40 tokens por segundo en un portátil y 15 en una estación de trabajo para un modelo de 753B.

Explicación del servicio MoE nativo del edge de FreeToken

El servicio MoE nativo del edge de FreeToken es un sistema de investigación para ejecutar modelos de lenguaje muy grandes de mezcla de expertos, o MoE, en hardware local convencional. En lugar de considerar la memoria limitada de la GPU como un bloqueo automático, el diseño divide el trabajo entre el procesador gráfico, el procesador central, la memoria del sistema y las interconexiones disponibles.

La idea central es la orquestación de recursos. Un ordenador de consumo puede tener una GPU capaz, pero no suficiente memoria gráfica para un modelo de escala frontera. Pasar cada operación por la misma ruta lenta provoca esperas. FreeToken adapta la ejecución al ancho de banda, al estado de la caché y a la fase actual de inferencia.

El proyecto se publicó en arXiv el 17 de agosto de 2026, con el título FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution. Entre los autores enumerados se encuentran Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt Keutzer, Song Han, Matei Zaharia, Chenfeng Xu e Ion Stoica.

Aspectos destacados del vídeo:

  • Los modelos MoE grandes pueden distribuirse entre los recursos de CPU y GPU.
  • El prellenado utiliza transferencias, cálculo y creación de puntos de control superpuestos.
  • La decodificación adapta la carga de expertos cuando se producen fallos de caché.
  • Las pruebas publicadas abarcan desde un portátil con 8 GB hasta una estación de trabajo con 96 GB.
  • Las cargas de trabajo de agentes se benefician de una decodificación más rápida y de una menor latencia inicial de respuesta.
ConceptoEnfoque de FreeTokenEfecto práctico
Límite de memoria de la GPUDistribuye el trabajo del modelo entre la GPU, la CPU y la memoria del sistemaHace más prácticos los modelos grandes en sistemas locales
Transferencias lentasAdapta la ejecución al ancho de banda medidoReduce los periodos de inactividad evitables
Carga de expertosUtiliza una colocación consciente de la caché y una carga dinámicaLimita el movimiento repetido de los expertos activos
Prompts largosSuperpone la transferencia y el cálculo durante el prellenadoMejora el rendimiento del procesamiento de prompts
Ediciones de agentesMantiene puntos de control en anclajes de tokensEvita rehacer innecesariamente todo el prellenado
Principio fundamental

Considera FreeToken como un proyecto de investigación de sistemas e inferencia, no como una aplicación convencional para usuarios finales. Su principal aportación es la forma en que coordina los recursos durante el servicio del modelo.

Adaptación al ancho de banda

La ejecución cambia según el ancho de banda de la memoria de la CPU, la capacidad de la GPU y la conexión entre ambas.

Consciencia de la caché

Los expertos utilizados recientemente permanecen disponibles cuando es posible, lo que reduce el coste de transferirlos repetidamente.

Orientación a pipelines

El movimiento de datos y el cálculo se organizan para superponerse en lugar de esperar en una única cola secuencial.

Arquitectura y fases de inferencia

FreeToken separa la inferencia en dos fases importantes: prellenado y decodificación. El prellenado procesa el contexto de entrada, mientras que la decodificación genera nuevos tokens uno a uno. Estas fases tienen presiones de rendimiento diferentes, por lo que utilizar una única política de planificación fija para ambas puede dejar el hardware infrautilizado.

Durante el prellenado, el sistema utiliza doble búfer para la capa completa. Mientras se calcula una parte del modelo, otra parte puede transferirse o prepararse. Esta disposición es especialmente importante cuando los pesos de los expertos no pueden permanecer permanentemente en la memoria de la GPU.

El sistema también mantiene puntos de control del estado en anclajes especiales de tokens. En los flujos de trabajo de agentes, un usuario o una herramienta puede editar parte de la conversación. En lugar de reconstruir todo el estado del prompt después de cada edición, los puntos de control pueden ayudar a conservar el cálculo reutilizable y reducir el trabajo repetido de prellenado.

Fase de inferenciaDesafío principalTécnica de FreeTokenBeneficio esperado
PrellenadoProcesar prompts largos mientras se mueven los datos del modeloDoble búfer para la capa completaMejor superposición entre transferencia y cálculo
PrellenadoRecalcular después de las ediciones de un agentePuntos de control del estado en anclajes de tokensMenor coste del procesamiento repetido de prompts
DecodificaciónLos pesos de los expertos pueden no estar en la cachéPolítica adaptativa para gestionar fallosUtilización más equilibrada de CPU y GPU
DecodificaciónLa CPU y la GPU pueden esperar recursos diferentesCarga dinámica de expertos y trabajo de la CPU en el propio lugarMenos periodos de inactividad evitables

La etapa de decodificación utiliza una estrategia diferente. Cuando un experto no está disponible en la caché activa, FreeToken puede equilibrar la carga de ese experto a través de la interconexión con el cálculo realizado directamente en la CPU. La política está diseñada para evitar que cualquiera de los dos lados permanezca inactivo mientras el otro pueda continuar con trabajo útil.

Esta distinción es importante porque los modelos MoE no activan todos los expertos para cada token. El sistema debe identificar qué expertos se necesitan, determinar dónde están disponibles y elegir si es más eficiente mover el trabajo o procesarlo localmente.

Evita una interpretación común

Un número elevado de parámetros no equivale directamente a la cantidad de cálculo utilizada para cada token en un modelo MoE. Sin embargo, el modelo completo sigue generando importantes necesidades de almacenamiento y movimiento de datos, que FreeToken aborda mediante la planificación.

1

Prepara el contexto activo

Realiza el prellenado del prompt mientras organizas las transferencias de datos del modelo y el cálculo mediante el pipeline de doble búfer.

2

Registra el estado reutilizable

Conserva puntos de control en anclajes de tokens seleccionados para que las ediciones adecuadas del agente puedan reutilizar cálculos anteriores.

3

Controla la disponibilidad de los expertos

Supervisa qué expertos ya están en la caché e identifica los fallos durante la generación de tokens.

4

Selecciona la ruta de ejecución

Equilibra la carga de expertos a través del bus con la ejecución directa en la CPU según las condiciones actuales de los recursos.

5

Continúa con la decodificación adaptativa

Reevalúa la colocación a medida que cambian el estado de la caché y las condiciones de la carga de trabajo, en lugar de mantener una política estática.

Cobertura de hardware y perfil de rendimiento

FreeToken se evaluó en diversas configuraciones locales, en lugar de utilizar una única máquina idealizada. El rango de pruebas publicado va desde un portátil con 8 GB hasta una estación de trabajo con 96 GB. Estos sistemas difieren considerablemente en el ancho de banda de la memoria del sistema y en el rendimiento de la interconexión, por lo que la planificación adaptativa resulta importante.

Una configuración compacta de portátil tenía un ancho de banda de interconexión inferior a 12 GB por segundo. En el otro extremo, la configuración de estación de trabajo más potente alcanzó 178 GB por segundo de ancho de banda de memoria de la CPU. Estas diferencias influyen en si un experto debe trasladarse a la GPU, procesarse en la CPU o conservarse en una caché para utilizarlo posteriormente.

Entorno de pruebaCaracterística de hardware publicadaPor qué importa
Portátil compactoClase de memoria de 8 GB; interconexión inferior a 12 GB/sLos retrasos de transferencia se convierten en una importante restricción de planificación
Portátil RTX 4060Configuración de GPU portátilComprueba si las cargas de trabajo de agentes de programación siguen siendo prácticas
Ordenador de sobremesa RTX 5090GPU de sobremesa de gama altaDemuestra una decodificación de agentes y un procesamiento de prompts más rápidos
Estación de trabajo grandeHasta 96 GB de memoria del sistema; ancho de banda de la CPU de hasta 178 GB/sOfrece más margen para la ejecución en el sistema anfitrión
Prueba MoE en estación de trabajoModelo de 753B parámetrosMuestra el comportamiento del sistema con un modelo inusualmente grande

Los resultados publicados varían según la carga de trabajo y el hardware. En una configuración de portátil, FreeToken se acercó a 40 tokens por segundo al servir un modelo de 753 mil millones de parámetros. En una estación de trabajo, la misma categoría general de prueba alcanzó unos 15 tokens por segundo para ese modelo y se publicó como un rendimiento aproximadamente dos veces superior al de los motores de servicio comparados.

En un ordenador de sobremesa con RTX 5090, las cargas de trabajo de agentes de programación superaron los 76 tokens por segundo en las pruebas publicadas. Otra carga de trabajo con un modelo grande superó los 22 tokens por segundo, mientras que otro modelo alcanzó más de 80 tokens por segundo. Estas cifras deben interpretarse como observaciones de benchmarks vinculadas a configuraciones, variantes de modelos y cargas de trabajo específicas, no como garantías universales para cualquier dispositivo.

Carga de trabajo o configuraciónResultado publicado de FreeTokenInterpretación
Portátil con modelo MoE grandeCasi 40 tokens/sMuestra el valor de la ejecución local adaptativa
Estación de trabajo con modelo 753BAproximadamente 15 tokens/sPublicado con un rendimiento aproximadamente dos veces superior al de motores rivales
Prueba de agente de programación en RTX 4060Más de 39 tokens/sDemuestra un rendimiento sólido en una configuración de GPU móvil
Prueba de agente de programación en sobremesa RTX 5090Más de 76 tokens/sIndica un mayor rendimiento en un ordenador de sobremesa potente
Prellenado de prompts largosMás de 6.600 tokens/s con 16.000 tokensDestaca el escalado del pipeline durante el prellenado
Cómo interpretar las cifras

Los resultados demuestran que la coordinación del hardware puede cambiar el límite práctico del servicio. No significan que todos los portátiles o estaciones de trabajo reproduzcan el mismo rendimiento.

Caché, fallos y prioridades de ajuste

La caché es uno de los mecanismos de rendimiento más importantes de FreeToken. Como la inferencia MoE activa determinados expertos, una caché útil puede evitar transferencias repetidas. Una política de colocación deficiente aumenta los fallos y obliga al sistema a mover o recalcular datos en momentos poco convenientes.

La evaluación publicada compara una política de caché de uso menos reciente con estrategias de colocación estática y basadas en el prellenado. La política de uso menos reciente de FreeToken redujo sustancialmente los fallos de caché de expertos en los modelos probados. Este enfoque resulta intuitivo para cargas de trabajo cambiantes: es más probable que los expertos utilizados recientemente sigan siendo útiles durante los pasos de decodificación cercanos, aunque el comportamiento puede variar según la carga de trabajo.

PolíticaComportamiento de colocaciónVentajaRiesgo
Uso menos recienteConserva los expertos a los que se ha accedido recientementeSe adapta a los cambios en la demanda de tokensPuede no predecir un cambio repentino en la carga de trabajo
Colocación estáticaMantiene una disposición de expertos predeterminadaEs sencilla y predeciblePuede desperdiciar espacio cuando cambia la demanda
Colocación basada en el prellenadoUtiliza la actividad de la etapa del prompt para orientar la colocación posteriorConecta el contexto inicial con la configuración de la cachéPuede quedar obsoleta durante una decodificación larga
Ejecución adaptativaElige dinámicamente rutas de CPU, GPU o transferenciaResponde al ancho de banda actual y a los fallosRequiere una mayor coordinación en tiempo de ejecución

Para prompts largos, el rendimiento de prellenado publicado superó los 6.600 tokens por segundo con un contexto de 16.000 tokens en la configuración probada. El pipeline de doble búfer se comparó con la ejecución sin pipeline y con sistemas de referencia, y el diseño superpuesto mostró un mayor rendimiento en las mediciones publicadas.

Un orden práctico de ajuste sigue la arquitectura del sistema:

  • Mide el ancho de banda de la memoria del sistema y el comportamiento de la interconexión antes de elegir una colocación fija.
  • Separa el análisis del prellenado del análisis de la decodificación porque sus cuellos de botella son diferentes.
  • Observa los fallos de caché de expertos en lugar de evaluar el rendimiento únicamente por el tamaño total del modelo.
  • Conserva el estado reutilizable en los flujos de trabajo de agentes cuyos prompts se editan repetidamente.
  • Compara los costes de ejecución en la CPU y de transferencia bajo la carga de trabajo real.

Lista de comprobación para revisar el servicio:

  • Identificar la memoria disponible de la GPU y la capacidad de la memoria del sistema
  • Medir el ancho de banda efectivo de la interconexión entre CPU y GPU
  • Comprobar por separado el rendimiento de prellenado y de decodificación
  • Supervisar los fallos de caché de expertos durante cargas de trabajo representativas
  • Registrar el tiempo hasta el primer token y el rendimiento estable de tokens
Buenas prácticas de benchmarking

Utiliza prompts, acciones de agentes y variantes de modelos representativos. Un prompt corto de chatbot puede ocultar los costes de transferencia que aparecen en cargas de trabajo con contextos largos o uso de herramientas.

Casos de uso, limitaciones y contexto de investigación

FreeToken resulta especialmente relevante para investigadores, ingenieros de infraestructura y usuarios avanzados de inferencia local interesados en el servicio de modelos nativos del edge. Sus cargas de trabajo de agentes publicadas incluyen tareas orientadas a la programación, en las que tanto el tiempo hasta el primer token como la velocidad sostenida de decodificación afectan a la usabilidad.

El sistema también destaca que servir modelos MoE masivos no es únicamente un problema de capacidad de memoria. La memoria sigue siendo importante, pero la ruta entre las ubicaciones de almacenamiento, la velocidad del cálculo en el sistema anfitrión, el comportamiento de la caché y las decisiones de planificación pueden determinar si el hardware disponible se utiliza de forma eficiente.

Los resultados publicados del tiempo hasta el primer token se mantuvieron dentro de unos pocos segundos en las pruebas destacadas de agentes con RTX 5090, mientras que los sistemas comparados a veces necesitaban mucho más tiempo o no completaban correctamente. Esta medida es distinta del rendimiento de decodificación: un sistema puede generar tokens rápidamente después de un inicio lento, o comenzar con rapidez pero mantener una velocidad de salida menor.

MétricaQué midePor qué importa
Tiempo hasta el primer tokenRetraso antes de que comience la generaciónEs importante para asistentes interactivos y agentes
Rendimiento de decodificaciónTokens generados por segundoIndica la velocidad sostenida de respuesta
Rendimiento de prellenadoTokens de contexto procesados por segundoImporta para prompts largos e historiales de herramientas
Tasa de fallos de cachéFrecuencia con la que no están disponibles los datos de los expertosRevela la presión sobre las transferencias y la colocación
Utilización de recursosActividad de la CPU y la GPU durante el servicioMuestra si uno de los procesadores permanece inactivo

FreeToken no elimina la necesidad de contar con hardware adecuado, compatibilidad con el modelo o una evaluación cuidadosa. El rendimiento depende de la capacidad de memoria, el ancho de banda, la velocidad de interconexión, la estructura del modelo, la longitud del prompt y el comportamiento de la carga de trabajo de servicio. El material publicado también describe una evaluación de investigación, no una lista universal de compatibilidad.

Para los lectores técnicos, la referencia principal es el artículo de FreeToken en arXiv, registrado como arXiv:2608.16157 en computación distribuida, paralela y de clústeres. La publicación del artículo en agosto de 2026 lo convierte en el punto de partida adecuado para consultar los detalles de implementación, la metodología experimental y la terminología formal de los autores.

Ruta de investigación recomendada

Comienza por la arquitectura y después reproduce un pequeño experimento de prellenado o de caché antes de intentar desplegar un servicio completo de modelos grandes.

Q: ¿Qué es el servicio MoE nativo del edge de FreeToken?

Es un enfoque de investigación para servir modelos de lenguaje grandes de mezcla de expertos en hardware local o edge mediante la coordinación del cálculo de la CPU, el cálculo de la GPU, la memoria del sistema, las transferencias y la caché de expertos.

Q: ¿Por qué FreeToken utiliza políticas diferentes para el prellenado y la decodificación?

El prellenado procesa el contexto de entrada en bloque, mientras que la decodificación genera tokens secuencialmente y puede encontrar fallos de caché de expertos. Sus cuellos de botella son diferentes, por lo que FreeToken utiliza una ejecución de pipeline superpuesta para el prellenado y un equilibrio adaptativo durante la decodificación.

Q: ¿A qué hardware se dirige FreeToken?

La evaluación publicada abarca sistemas desde un portátil con 8 GB hasta una estación de trabajo con 96 GB, incluidas configuraciones con un portátil RTX 4060 y un ordenador de sobremesa RTX 5090. Los resultados dependen del hardware y la carga de trabajo exactos.

Q: ¿FreeToken garantiza un resultado específico de tokens por segundo?

No. Las cifras publicadas son mediciones realizadas con modelos, dispositivos y cargas de trabajo seleccionados en 2026. El rendimiento real puede cambiar según la memoria, el ancho de banda de la interconexión, la longitud del prompt, el comportamiento de la caché y las condiciones de planificación.