Guía de configuración de FreeToken: servicio Edge MoE paso a paso - Guía

Guía de configuración de FreeToken: servicio Edge MoE paso a paso

Usa esta guía de configuración de FreeToken para planificar el hardware, la memoria, el ancho de banda, la caché y las comprobaciones del entorno de ejecución para servir modelos MoE localmente.

2026-08-25
Equipo de FreeToken
Guía rápida
  • Guía de configuración de FreeToken: Trata la GPU, la CPU, la RAM, el almacenamiento y el enlace PCIe como un único sistema de servicio.
  • Adecuación del hardware: La activación dispersa reduce la demanda de cómputo, pero el conjunto completo de expertos todavía necesita memoria del host.
  • Política de ancho de banda: Mide el ancho de banda del host y de PCIe en lugar de basarte únicamente en las hojas de especificaciones.
  • Estrategia de caché: Usa una caché elástica de expertos en la GPU junto con la gestión de la caché KV para cargas de trabajo agénticas.

Requisitos de FreeToken

FreeToken es un sistema de servicio nativo para dispositivos edge destinado a modelos grandes de Mezcla de Expertos. Una configuración práctica comienza separando el cómputo activo del almacenamiento total del modelo. Solo un subconjunto de expertos procesa cada token, pero el conjunto completo de expertos enrutados debe permanecer disponible en la memoria del host o en otra capa de almacenamiento.

El diseño de referencia mantiene el conjunto completo de expertos en la memoria de la CPU, mientras que los pesos que no corresponden a expertos permanecen en la GPU. La VRAM restante se convierte en una caché elástica de expertos compartida entre las capas MoE. Esta configuración permite que un equipo de consumo sirva modelos cuyos pesos totales superan la VRAM disponible, siempre que los presupuestos de memoria del host y de interconexión sean adecuados.

RecursoFunción en la configuraciónQué comprobar
VRAM de la GPUPesos no expertos, caché KV y caché de expertosDeja espacio para cambios en la longitud del contexto
Memoria del hostFuente de verdad de los expertos enrutadosDebe contener el conjunto de expertos desplegado
Enlace PCIeTransfiere los expertos faltantes a la GPUMide el ancho de banda de transferencia efectivo
CPU y DRAMEjecutan localmente los fallos seleccionadosMide el ancho de banda con los tensores objetivo
Almacenamiento NVMeCarga el conjunto residente en el hostUsa suficiente capacidad y velocidad de lectura sostenida

Nivel de GPU

Una mayor VRAM permite una caché de expertos más grande y mejora las tasas de aciertos durante la decodificación. La configuración de clase RTX 5090 del estudio procesó conjuntos de trabajo considerablemente más grandes que una GPU de portátil de 8 GB.

Nivel de host

La memoria del host almacena el conjunto completo de expertos enrutados. El ancho de banda de DDR4 o DDR5 de doble canal puede convertirse en el factor limitante cuando la CPU gestiona fallos de caché.

Nivel del enlace

El ancho de banda de PCIe determina la rapidez con la que los expertos faltantes llegan a la GPU. Los enlaces de portátiles, especialmente las conexiones PCIe x8, pueden aumentar la latencia de transferencia.

Planificación de la memoria

No dimensione la máquina basándose únicamente en los parámetros activos. La activación dispersa reduce el cómputo por token, mientras que el conjunto completo de expertos todavía puede superar los presupuestos de la GPU y de la memoria del sistema.

Guía de configuración de FreeToken: paso a paso

Usa esta guía de configuración de FreeToken como una secuencia de despliegue, no como una receta basada en un único comando. La referencia disponible describe el diseño y la evaluación del sistema, mientras que los detalles de instalación específicos de cada versión deben comprobarse en la página del proyecto FreeToken, publicada en 2026.

1

Elige un modelo compatible

Comienza con un checkpoint MoE cuya representación de expertos y precisión sean compatibles con el entorno de ejecución. La evaluación de referencia incluye DeepSeek-V4-Flash, Qwen3.6-35B-A3B y GLM-5.2 en distintos niveles de hardware.

2

Reserva memoria del host

Confirma que el conjunto completo de expertos enrutados cabe en la memoria disponible del host, dejando espacio para el sistema operativo y las aplicaciones simultáneas. No consideres la capacidad del disco como sustituto de la memoria de ejecución.

3

Mide el ancho de banda

Perfila el ancho de banda efectivo de transferencia de expertos fijados a través de PCIe y el ancho de banda de procesamiento de expertos en la CPU usando las formas de tensor desplegadas. Estos valores determinan la división de los fallos.

4

Establece el presupuesto del entorno de ejecución

Reserva primero la VRAM para los pesos no expertos y la caché KV. Asigna el presupuesto restante a la caché de expertos compartida, dejando suficiente flexibilidad para sesiones agénticas más largas.

5

Ejecuta una prueba con la caché fría

Comienza con la caché fría, verifica que se complete la primera solicitud y compara después la velocidad de decodificación y el tiempo hasta el primer token cuando la caché se caliente mediante el servicio normal.

Fase de configuraciónDecisión principalSeñal de validación
Selección del modeloComprueba la precisión y la disposición de los expertosEl entorno de ejecución puede cargar el checkpoint
Reserva de memoriaAloja los expertos y la sobrecarga del sistemaNo se producen fallos de asignación ni de paginación
Perfilado del ancho de bandaRegistra las velocidades del host y de PCIeMediciones estables en el hardware objetivo
Asignación de VRAMEquilibra los expertos y la caché KVEl crecimiento del contexto no agota la VRAM
Primera solicitudPrueba el comportamiento de inicio en fríoLa solicitud se completa sin depender únicamente del calentamiento
Hábito de despliegue

Registra las mediciones de ancho de banda de cada máquina. Dos sistemas con la misma GPU pueden producir resultados diferentes cuando varían sus canales DRAM, enlaces PCIe o cargas de trabajo simultáneas.

Configuración de Prefill y Decode

FreeToken utiliza tácticas diferentes para las dos fases principales de inferencia. Prefill procesa el prompt y afecta considerablemente al tiempo hasta el primer token. Decode genera tokens uno a uno y es más sensible a los fallos de la caché de expertos y al ancho de banda del host.

Durante el prefill, el sistema utiliza doble búfer para la capa completa. Mientras la GPU calcula una capa, los expertos de la siguiente se transfieren mediante PCIe. Esto solapa la transferencia y el cómputo en lugar de exponer todo el intervalo de movimiento de expertos como tiempo de inactividad de la GPU. Si la caché no puede reservar dos búferes de capa completa, el diseño recurre a la carga bajo demanda para evitar la sobresuscripción de la VRAM.

Las sesiones agénticas también se benefician de una caché de estado con conocimiento semántico. Los puntos de control se colocan alrededor de límites como segmentos de razonamiento, llamadas a herramientas, resultados de herramientas y turnos de conversación. Cuando un sistema de ejecución edita un bloque completo del historial, el entorno de ejecución puede reutilizar el prefijo conservado y recalcular únicamente el nuevo sufijo.

FaseCuello de botella principalRespuesta de FreeToken
PrefillMovimiento completo de expertos y recomputación repetida del contextoCarga de capas con doble búfer y puntos de control semánticos
DecodeExpertos faltantes y ancho de banda limitado de la CPUCaché LRU compartida y ejecución adaptada al ancho de banda
Sesiones largasCreciente demanda de caché KVDivisión elástica entre páginas KV y espacios para expertos
ReinicioCarga del conjunto completo de expertosCarga directa en la disposición final del host

Durante el decode, los expertos enrutados que ya están en la caché LRU compartida se ejecutan en la GPU. Los expertos faltantes se dividen entre dos rutas:

  • Ruta de llenado de caché: Transfiere los expertos seleccionados mediante PCIe, ejecútalos en la GPU y consérvalos para reutilizarlos en el futuro.
  • Ruta de CPU: Ejecuta otros expertos faltantes directamente desde el conjunto residente en el host sin cambiar la residencia en la GPU.
  • Ruta de combinación: Combina las salidas parciales de la GPU y la CPU preservando el cálculo exacto de MoE.

La cantidad aproximada de expertos para llenar la caché es:

q* ≈ m × BP / BH

Aquí, m es el número de expertos faltantes, BP es el ancho de banda de transferencia fijada medido y BH es el ancho de banda medido del procesamiento de expertos en el host. El entorno de ejecución redondea el resultado y continúa calentando la caché incluso cuando la ejecución en la CPU gestiona la mayoría de los fallos.

Objetivo de rendimiento

Compara el rendimiento tanto en prompts cortos de un solo turno como en trazas agénticas de varios turnos. Una configuración que parece sólida en un decode aislado puede degradarse cuando predominan los prefills repetidos y las ediciones de contexto.

Ajuste de la caché, el almacenamiento y el entorno de ejecución

El conjunto de expertos residente en la CPU sigue siendo la fuente de verdad, por lo que la capacidad de la caché de la GPU modifica el rendimiento, no la corrección del modelo. Esto es importante en ordenadores personales, donde los navegadores, las aplicaciones de escritorio y otras cargas de trabajo de la GPU pueden cambiar el presupuesto de VRAM disponible durante una sesión.

FreeToken puede reconstruir la caché de expertos de la GPU en puntos seguros del planificador sin reiniciar el motor ni volver a cargar el conjunto del host. La caché se comparte entre las capas MoE y utiliza identificadores lógicos de capa y experto, lo que permite que la residencia y la ejecución sigan el conjunto de trabajo enrutado actual.

Área de ajusteEnfoque recomendadoEvita
Caché de expertosDeja que LRU siga la localidad de enrutamiento recienteFijar permanentemente un conjunto activo exclusivo del prefill
Caché KVAuméntala con la duración de la sesión, pero protege la capacidad de expertosAsignar toda la VRAM libre al contexto
Conjunto del hostCárgalo directamente en la disposición final del entorno de ejecuciónReempaquetar bancos grandes en cada lanzamiento
Memoria fijadaFija los búferes poblados después de la cargaFijar búferes vacíos y provocar fallos de página innecesariamente
InicioSirve las solicitudes con caché fría mediante la ruta normalExigir una fase independiente de calentamiento completo

Antes de servir:

  • Confirma que el conjunto completo de expertos enrutados cabe en la memoria del host
  • Mide la transferencia efectiva mediante PCIe y el ancho de banda de expertos de la CPU
  • Reserva VRAM para los pesos no expertos y la caché KV en crecimiento
  • Verifica la precisión y la disposición de expertos del modelo seleccionado
  • Prueba tanto el inicio con caché fría como el decode con la caché caliente

Para el almacenamiento, el diseño de referencia introduce el formato FreeToken Weight, que normaliza los bancos de expertos en una disposición adecuada para el entorno de ejecución. Los bancos preformateados permiten que el motor lea fragmentos alineados directamente en búferes del host de tamaño exacto, reduciendo el trabajo de descubrimiento y reempaquetado de tensores durante el lanzamiento. Si una plataforma no puede establecer la ruta de memoria fijada o registrada necesaria, el entorno de ejecución puede utilizar un backend MoE exclusivo de CPU, sacrificando el rendimiento máximo de transferencia para lograr una mayor capacidad de despliegue.

Carga térmica y procesos en segundo plano

El hardware de consumo no es una infraestructura dedicada. Cierra las aplicaciones innecesarias, controla las temperaturas sostenidas y repite las mediciones después de cambiar las cargas de trabajo del escritorio, el navegador o la GPU.

Validación, resolución de problemas y preguntas frecuentes

Valida un despliegue con métricas que expongan el cuello de botella real. El rendimiento del decode muestra con qué eficiencia se sirve el conjunto de trabajo actual de expertos, mientras que el tiempo hasta el primer token revela los costes de transferencia y recomputación del prefill. La latencia de cola es importante para los clientes agénticos, porque un único turno largo puede hacer que una configuración por lo demás aceptable parezca no disponible.

SíntomaCausa probablePrimera respuesta
Primer token lentoTransferencia serializada de expertos o prefill repetidoComprueba la disponibilidad del doble búfer y la reutilización del prefijo
Baja tasa de decodeExceso de fallos de cachéAumenta el presupuesto de la caché de expertos si la demanda de KV lo permite
Saturación de la CPUDemasiados fallos asignados a la ejecución del hostVuelve a perfilar el ancho de banda del host e inspecciona la división de fallos
Uso reducido de la GPUCuello de botella de PCIe o de la memoria del hostCompara el ancho de banda de transferencia medido con el ancho de banda de la CPU
Inicio lentoCarga desde el disco o reempaquetado del entorno de ejecuciónUsa la disposición de pesos preparada y un almacenamiento más rápido

Q: ¿Cuál es el objetivo principal de FreeToken?

FreeToken sirve modelos MoE grandes en hardware edge coordinando la ejecución de la GPU, la ejecución de la CPU, la memoria del host, las transferencias PCIe y la caché elástica de expertos.

Q: ¿FreeToken requiere que el modelo completo quepa en la VRAM?

No. El diseño mantiene el conjunto completo de expertos enrutados en la memoria del host, mientras utiliza la VRAM de la GPU para los pesos no expertos, la caché KV y una caché de expertos compartida.

Q: ¿Por qué son importantes las mediciones de ancho de banda?

La mejor división entre los llenados de caché mediante PCIe y la ejecución directa en la CPU depende de la máquina desplegada. FreeToken obtiene esa división a partir del ancho de banda medido del host y de la transferencia.

Q: ¿Cómo debo validar una configuración de FreeToken?

Prueba solicitudes frías y calientes, supervisa el rendimiento del decode y el tiempo hasta el primer token, y repite la prueba con prompts realistas de varios turnos o agénticos.

Referencia

El diseño y las evaluaciones publicadas están documentados en el artículo de investigación de FreeToken, publicado el 24 de agosto de 2026. Consulta los materiales de lanzamiento del proyecto para obtener las instrucciones de instalación actuales.