- Guía de configuración de FreeToken: Trata la GPU, la CPU, la RAM, el almacenamiento y el enlace PCIe como un único sistema de servicio.
- Adecuación del hardware: La activación dispersa reduce la demanda de cómputo, pero el conjunto completo de expertos todavía necesita memoria del host.
- Política de ancho de banda: Mide el ancho de banda del host y de PCIe en lugar de basarte únicamente en las hojas de especificaciones.
- Estrategia de caché: Usa una caché elástica de expertos en la GPU junto con la gestión de la caché KV para cargas de trabajo agénticas.
Requisitos de FreeToken
FreeToken es un sistema de servicio nativo para dispositivos edge destinado a modelos grandes de Mezcla de Expertos. Una configuración práctica comienza separando el cómputo activo del almacenamiento total del modelo. Solo un subconjunto de expertos procesa cada token, pero el conjunto completo de expertos enrutados debe permanecer disponible en la memoria del host o en otra capa de almacenamiento.
El diseño de referencia mantiene el conjunto completo de expertos en la memoria de la CPU, mientras que los pesos que no corresponden a expertos permanecen en la GPU. La VRAM restante se convierte en una caché elástica de expertos compartida entre las capas MoE. Esta configuración permite que un equipo de consumo sirva modelos cuyos pesos totales superan la VRAM disponible, siempre que los presupuestos de memoria del host y de interconexión sean adecuados.
| Recurso | Función en la configuración | Qué comprobar |
|---|---|---|
| VRAM de la GPU | Pesos no expertos, caché KV y caché de expertos | Deja espacio para cambios en la longitud del contexto |
| Memoria del host | Fuente de verdad de los expertos enrutados | Debe contener el conjunto de expertos desplegado |
| Enlace PCIe | Transfiere los expertos faltantes a la GPU | Mide el ancho de banda de transferencia efectivo |
| CPU y DRAM | Ejecutan localmente los fallos seleccionados | Mide el ancho de banda con los tensores objetivo |
| Almacenamiento NVMe | Carga el conjunto residente en el host | Usa suficiente capacidad y velocidad de lectura sostenida |
Nivel de GPU
Una mayor VRAM permite una caché de expertos más grande y mejora las tasas de aciertos durante la decodificación. La configuración de clase RTX 5090 del estudio procesó conjuntos de trabajo considerablemente más grandes que una GPU de portátil de 8 GB.
Nivel de host
La memoria del host almacena el conjunto completo de expertos enrutados. El ancho de banda de DDR4 o DDR5 de doble canal puede convertirse en el factor limitante cuando la CPU gestiona fallos de caché.
Nivel del enlace
El ancho de banda de PCIe determina la rapidez con la que los expertos faltantes llegan a la GPU. Los enlaces de portátiles, especialmente las conexiones PCIe x8, pueden aumentar la latencia de transferencia.
No dimensione la máquina basándose únicamente en los parámetros activos. La activación dispersa reduce el cómputo por token, mientras que el conjunto completo de expertos todavía puede superar los presupuestos de la GPU y de la memoria del sistema.
Guía de configuración de FreeToken: paso a paso
Usa esta guía de configuración de FreeToken como una secuencia de despliegue, no como una receta basada en un único comando. La referencia disponible describe el diseño y la evaluación del sistema, mientras que los detalles de instalación específicos de cada versión deben comprobarse en la página del proyecto FreeToken, publicada en 2026.
Elige un modelo compatible
Comienza con un checkpoint MoE cuya representación de expertos y precisión sean compatibles con el entorno de ejecución. La evaluación de referencia incluye DeepSeek-V4-Flash, Qwen3.6-35B-A3B y GLM-5.2 en distintos niveles de hardware.
Reserva memoria del host
Confirma que el conjunto completo de expertos enrutados cabe en la memoria disponible del host, dejando espacio para el sistema operativo y las aplicaciones simultáneas. No consideres la capacidad del disco como sustituto de la memoria de ejecución.
Mide el ancho de banda
Perfila el ancho de banda efectivo de transferencia de expertos fijados a través de PCIe y el ancho de banda de procesamiento de expertos en la CPU usando las formas de tensor desplegadas. Estos valores determinan la división de los fallos.
Establece el presupuesto del entorno de ejecución
Reserva primero la VRAM para los pesos no expertos y la caché KV. Asigna el presupuesto restante a la caché de expertos compartida, dejando suficiente flexibilidad para sesiones agénticas más largas.
Ejecuta una prueba con la caché fría
Comienza con la caché fría, verifica que se complete la primera solicitud y compara después la velocidad de decodificación y el tiempo hasta el primer token cuando la caché se caliente mediante el servicio normal.
| Fase de configuración | Decisión principal | Señal de validación |
|---|---|---|
| Selección del modelo | Comprueba la precisión y la disposición de los expertos | El entorno de ejecución puede cargar el checkpoint |
| Reserva de memoria | Aloja los expertos y la sobrecarga del sistema | No se producen fallos de asignación ni de paginación |
| Perfilado del ancho de banda | Registra las velocidades del host y de PCIe | Mediciones estables en el hardware objetivo |
| Asignación de VRAM | Equilibra los expertos y la caché KV | El crecimiento del contexto no agota la VRAM |
| Primera solicitud | Prueba el comportamiento de inicio en frío | La solicitud se completa sin depender únicamente del calentamiento |
Registra las mediciones de ancho de banda de cada máquina. Dos sistemas con la misma GPU pueden producir resultados diferentes cuando varían sus canales DRAM, enlaces PCIe o cargas de trabajo simultáneas.
Configuración de Prefill y Decode
FreeToken utiliza tácticas diferentes para las dos fases principales de inferencia. Prefill procesa el prompt y afecta considerablemente al tiempo hasta el primer token. Decode genera tokens uno a uno y es más sensible a los fallos de la caché de expertos y al ancho de banda del host.
Durante el prefill, el sistema utiliza doble búfer para la capa completa. Mientras la GPU calcula una capa, los expertos de la siguiente se transfieren mediante PCIe. Esto solapa la transferencia y el cómputo en lugar de exponer todo el intervalo de movimiento de expertos como tiempo de inactividad de la GPU. Si la caché no puede reservar dos búferes de capa completa, el diseño recurre a la carga bajo demanda para evitar la sobresuscripción de la VRAM.
Las sesiones agénticas también se benefician de una caché de estado con conocimiento semántico. Los puntos de control se colocan alrededor de límites como segmentos de razonamiento, llamadas a herramientas, resultados de herramientas y turnos de conversación. Cuando un sistema de ejecución edita un bloque completo del historial, el entorno de ejecución puede reutilizar el prefijo conservado y recalcular únicamente el nuevo sufijo.
| Fase | Cuello de botella principal | Respuesta de FreeToken |
|---|---|---|
| Prefill | Movimiento completo de expertos y recomputación repetida del contexto | Carga de capas con doble búfer y puntos de control semánticos |
| Decode | Expertos faltantes y ancho de banda limitado de la CPU | Caché LRU compartida y ejecución adaptada al ancho de banda |
| Sesiones largas | Creciente demanda de caché KV | División elástica entre páginas KV y espacios para expertos |
| Reinicio | Carga del conjunto completo de expertos | Carga directa en la disposición final del host |
Durante el decode, los expertos enrutados que ya están en la caché LRU compartida se ejecutan en la GPU. Los expertos faltantes se dividen entre dos rutas:
- Ruta de llenado de caché: Transfiere los expertos seleccionados mediante PCIe, ejecútalos en la GPU y consérvalos para reutilizarlos en el futuro.
- Ruta de CPU: Ejecuta otros expertos faltantes directamente desde el conjunto residente en el host sin cambiar la residencia en la GPU.
- Ruta de combinación: Combina las salidas parciales de la GPU y la CPU preservando el cálculo exacto de MoE.
La cantidad aproximada de expertos para llenar la caché es:
q* ≈ m × BP / BH
Aquí, m es el número de expertos faltantes, BP es el ancho de banda de transferencia fijada medido y BH es el ancho de banda medido del procesamiento de expertos en el host. El entorno de ejecución redondea el resultado y continúa calentando la caché incluso cuando la ejecución en la CPU gestiona la mayoría de los fallos.
Compara el rendimiento tanto en prompts cortos de un solo turno como en trazas agénticas de varios turnos. Una configuración que parece sólida en un decode aislado puede degradarse cuando predominan los prefills repetidos y las ediciones de contexto.
Ajuste de la caché, el almacenamiento y el entorno de ejecución
El conjunto de expertos residente en la CPU sigue siendo la fuente de verdad, por lo que la capacidad de la caché de la GPU modifica el rendimiento, no la corrección del modelo. Esto es importante en ordenadores personales, donde los navegadores, las aplicaciones de escritorio y otras cargas de trabajo de la GPU pueden cambiar el presupuesto de VRAM disponible durante una sesión.
FreeToken puede reconstruir la caché de expertos de la GPU en puntos seguros del planificador sin reiniciar el motor ni volver a cargar el conjunto del host. La caché se comparte entre las capas MoE y utiliza identificadores lógicos de capa y experto, lo que permite que la residencia y la ejecución sigan el conjunto de trabajo enrutado actual.
| Área de ajuste | Enfoque recomendado | Evita |
|---|---|---|
| Caché de expertos | Deja que LRU siga la localidad de enrutamiento reciente | Fijar permanentemente un conjunto activo exclusivo del prefill |
| Caché KV | Auméntala con la duración de la sesión, pero protege la capacidad de expertos | Asignar toda la VRAM libre al contexto |
| Conjunto del host | Cárgalo directamente en la disposición final del entorno de ejecución | Reempaquetar bancos grandes en cada lanzamiento |
| Memoria fijada | Fija los búferes poblados después de la carga | Fijar búferes vacíos y provocar fallos de página innecesariamente |
| Inicio | Sirve las solicitudes con caché fría mediante la ruta normal | Exigir una fase independiente de calentamiento completo |
Antes de servir:
- Confirma que el conjunto completo de expertos enrutados cabe en la memoria del host
- Mide la transferencia efectiva mediante PCIe y el ancho de banda de expertos de la CPU
- Reserva VRAM para los pesos no expertos y la caché KV en crecimiento
- Verifica la precisión y la disposición de expertos del modelo seleccionado
- Prueba tanto el inicio con caché fría como el decode con la caché caliente
Para el almacenamiento, el diseño de referencia introduce el formato FreeToken Weight, que normaliza los bancos de expertos en una disposición adecuada para el entorno de ejecución. Los bancos preformateados permiten que el motor lea fragmentos alineados directamente en búferes del host de tamaño exacto, reduciendo el trabajo de descubrimiento y reempaquetado de tensores durante el lanzamiento. Si una plataforma no puede establecer la ruta de memoria fijada o registrada necesaria, el entorno de ejecución puede utilizar un backend MoE exclusivo de CPU, sacrificando el rendimiento máximo de transferencia para lograr una mayor capacidad de despliegue.
El hardware de consumo no es una infraestructura dedicada. Cierra las aplicaciones innecesarias, controla las temperaturas sostenidas y repite las mediciones después de cambiar las cargas de trabajo del escritorio, el navegador o la GPU.
Validación, resolución de problemas y preguntas frecuentes
Valida un despliegue con métricas que expongan el cuello de botella real. El rendimiento del decode muestra con qué eficiencia se sirve el conjunto de trabajo actual de expertos, mientras que el tiempo hasta el primer token revela los costes de transferencia y recomputación del prefill. La latencia de cola es importante para los clientes agénticos, porque un único turno largo puede hacer que una configuración por lo demás aceptable parezca no disponible.
| Síntoma | Causa probable | Primera respuesta |
|---|---|---|
| Primer token lento | Transferencia serializada de expertos o prefill repetido | Comprueba la disponibilidad del doble búfer y la reutilización del prefijo |
| Baja tasa de decode | Exceso de fallos de caché | Aumenta el presupuesto de la caché de expertos si la demanda de KV lo permite |
| Saturación de la CPU | Demasiados fallos asignados a la ejecución del host | Vuelve a perfilar el ancho de banda del host e inspecciona la división de fallos |
| Uso reducido de la GPU | Cuello de botella de PCIe o de la memoria del host | Compara el ancho de banda de transferencia medido con el ancho de banda de la CPU |
| Inicio lento | Carga desde el disco o reempaquetado del entorno de ejecución | Usa la disposición de pesos preparada y un almacenamiento más rápido |
Q: ¿Cuál es el objetivo principal de FreeToken?
FreeToken sirve modelos MoE grandes en hardware edge coordinando la ejecución de la GPU, la ejecución de la CPU, la memoria del host, las transferencias PCIe y la caché elástica de expertos.
Q: ¿FreeToken requiere que el modelo completo quepa en la VRAM?
No. El diseño mantiene el conjunto completo de expertos enrutados en la memoria del host, mientras utiliza la VRAM de la GPU para los pesos no expertos, la caché KV y una caché de expertos compartida.
Q: ¿Por qué son importantes las mediciones de ancho de banda?
La mejor división entre los llenados de caché mediante PCIe y la ejecución directa en la CPU depende de la máquina desplegada. FreeToken obtiene esa división a partir del ancho de banda medido del host y de la transferencia.
Q: ¿Cómo debo validar una configuración de FreeToken?
Prueba solicitudes frías y calientes, supervisa el rendimiento del decode y el tiempo hasta el primer token, y repite la prueba con prompts realistas de varios turnos o agénticos.
El diseño y las evaluaciones publicadas están documentados en el artículo de investigación de FreeToken, publicado el 24 de agosto de 2026. Consulta los materiales de lanzamiento del proyecto para obtener las instrucciones de instalación actuales.