FreeToken api: Guía de configuración del servicio MoE local 2026 - API

FreeToken api: Guía de configuración del servicio MoE local 2026

Aprende cómo FreeToken ejecuta localmente modelos MoE de escala avanzada mediante caché de expertos, ejecución adaptativa en CPU-GPU y gestión elástica de memoria.

2026-08-25
Equipo de FreeToken
Guía rápida
  • FreeToken api se refiere a una pila de inferencia local para servir modelos grandes de mezcla de expertos.
  • Ventaja principal: La caché de expertos consciente del enrutamiento reduce los cuellos de botella innecesarios de la CPU y PCIe.
  • Hardware más adecuado: GPU NVIDIA recientes con suficiente memoria del sistema y compatibilidad con CUDA.
  • Limitación principal: La versión pública está orientada a la fase beta y se centra principalmente en configuraciones NVIDIA con Linux.
  • Expectativa clave: Los resultados dependen en gran medida de la VRAM, el ancho de banda del host, el ancho de banda de PCIe y el formato del modelo.

¿Qué es FreeToken api?

FreeToken es un sistema de servicio nativo para el edge, diseñado para ejecutar modelos grandes de mezcla de expertos con pesos abiertos en hardware personal. En lugar de tratar la GPU como el único recurso utilizable, coordina la memoria de la GPU, la memoria de la CPU, la ejecución en la CPU y la interconexión PCIe como una única plataforma de inferencia.

El sistema está dirigido a modelos cuyo conjunto completo de expertos supera la VRAM disponible, pero cuyo cálculo disperso por token sigue siendo práctico. Por ejemplo, se describe DeepSeek-V4-Flash con 284B de parámetros totales y 13B de parámetros activos, mientras que GLM-5.2 figura con 753B de parámetros totales y 40B de parámetros activos. Solo una parte de los expertos enrutados participa en cada token, pero el conjunto completo de expertos aún debe permanecer accesible.

Aspectos destacados del video:

  • FreeToken se presenta como un nuevo motor local para modelos MoE grandes.
  • La comparación principal se centra en la caché consciente del enrutamiento frente a la colocación estática.
  • Los resultados reportados incluyen GPU de consumo, portátiles y una GPU de clase workstation.
  • La latencia de cola se trata como un problema de disponibilidad para cargas de trabajo agénticas.
TérminoSignificado
MoEArquitectura de modelo que contiene muchos expertos y enruta cada token solo a unos pocos
Conjunto de expertosColección completa de los pesos de los expertos enrutados
PrefillProcesamiento del prompt o contexto existente antes de comenzar la generación
DecodeGeneración de nuevos tokens, uno a uno
TTFTTiempo hasta el primer token, incluido el trabajo necesario antes de comenzar la salida
Servicio en el edgeEjecución de inferencia en hardware personal o de consumo en lugar de un clúster de centro de datos
Mejor punto de partida

Considera FreeToken como un runtime de servicio, no como un modelo. Aún necesitas un checkpoint de modelo compatible, hardware admitido, suficiente memoria del host y un formato de runtime preparado correctamente.

Cómo gestiona FreeToken la memoria MoE

FreeToken divide el modelo en una parte residente en la GPU y un conjunto de expertos residente en el host. Los pesos que no pertenecen a expertos permanecen en la GPU, mientras que el conjunto residente en la CPU actúa como fuente de verdad para los expertos enrutados. La VRAM disponible se convierte en una caché elástica de expertos compartida entre las capas MoE.

Este diseño es importante porque el cálculo disperso no elimina la presión sobre la memoria. Un token puede activar solo seis expertos de un conjunto mucho mayor, pero el runtime aún debe estar preparado para acceder a cualquier experto que el enrutador seleccione a continuación.

Caché de expertos compartida

  • Utiliza un espacio de residencia LRU global
  • Rastrea pares de capa y experto
  • Sigue los cambios en el enrutamiento a nivel de token

Gestión adaptativa de fallos de caché

  • Envía algunos fallos a través de PCIe
  • Ejecuta otros fallos directamente en la CPU
  • Equilibra el trabajo usando el ancho de banda medido

Memoria elástica

  • Ajusta la caché de la GPU en puntos seguros
  • Comparte capacidad con la caché KV
  • Puede responder a cambios en la disponibilidad de VRAM

Durante el decode, FreeToken identifica los aciertos y fallos de caché en la GPU. Los aciertos se ejecutan directamente desde la VRAM. Los fallos se dividen entre la carga de datos en la caché de la GPU y la ejecución en la CPU según el ancho de banda medido del host y de PCIe. Esto evita que el runtime dependa de una única estrategia fija para todas las máquinas.

Componente del runtimeUbicación principalResponsabilidad principal
Pesos no pertenecientes a expertosMemoria de la GPUPermanecen disponibles para la ejecución normal del modelo
Conjunto completo de expertosMemoria del hostProporciona los pesos de origen para los expertos enrutados
Caché de expertosMemoria restante de la GPUConserva los pares de capa y experto utilizados recientemente
Caché KVPresupuesto de memoria de la GPUAlmacena el estado de atención de los contextos activos
Metadatos de enrutamientoGPU y búferes del runtimeIdentifica los expertos seleccionados y el estado de la caché
Por qué importa el diseño

El cambio importante no consiste simplemente en mover más pesos entre la CPU y la GPU. FreeToken trata un experto ausente como datos transferibles o como trabajo ejecutable, y luego elige entre ambas rutas según la máquina desplegada.

Flujo de configuración de FreeToken api

Una configuración fiable comienza con comprobaciones de compatibilidad, no con expectativas de rendimiento. El material publicado identifica los entornos CUDA y los sistemas de estilo Linux con NVIDIA como el objetivo principal compatible, mientras que las solicitudes de compatibilidad más amplia con Windows, macOS y GPU antiguas seguían siendo visibles durante el periodo del lanzamiento público de 2026.

Utiliza el siguiente flujo de trabajo para preparar un despliegue local sin asumir que todos los modelos o sistemas operativos son compatibles.

1

Confirma el perfil de hardware

Registra la memoria de la GPU, la memoria del host, el ancho del enlace PCIe, el ancho de banda de memoria de la CPU y el sistema operativo. Estos valores influyen en la cantidad de caché de expertos que puede permanecer en la VRAM y en la eficiencia con la que se pueden atender los fallos.

2

Elige un modelo compatible

Comienza con un modelo incluido en la evaluación publicada del proyecto, como Qwen3.6-35B-A3B, DeepSeek-V4-Flash o la demostración de GLM-5.2. Verifica la precisión requerida y la disposición del checkpoint antes de preparar el almacenamiento.

3

Prepara el formato del runtime

FreeToken utiliza un formato FreeToken Weight que normaliza los bancos de expertos en una disposición adecuada para la carga directa. Un formato preparado puede reducir el trabajo de inicio al evitar la detección y el reempaquetado repetidos de tensores.

4

Mide antes de ajustar

Permite que el runtime perfile el procesamiento de expertos en el host y el ancho de banda de transferencia con memoria fijada. Estas mediciones determinan el equilibrio entre las cargas de la caché y la ejecución directa en la CPU.

5

Prueba una carga de trabajo agéntica

Evalúa algo más que la velocidad de tokens aislada. Utiliza un flujo de trabajo de varias rondas para programación, razonamiento o llamadas a herramientas, y supervisa el TTFT, las pausas prolongadas, el comportamiento de la caché y la fiabilidad de finalización.

Comprobación de configuraciónPor qué importaAcción recomendada
Entorno NVIDIA CUDALa ruta rápida se centra en hardware compatible con CUDAConfirma el controlador y la pila CUDA antes de preparar el modelo
Capacidad de memoria del hostEl conjunto completo de expertos puede superar ampliamente la VRAMReserva suficiente memoria para el checkpoint seleccionado
Ancho de banda de PCIeLas cargas de la caché de la GPU dependen de la velocidad de transferencia del host al dispositivoPrefiere un enlace amplio y de gran ancho de banda cuando esté disponible
Precisión del modeloEl tamaño de los pesos y la compatibilidad de los kernels varían según el formatoAjusta la precisión del checkpoint a la ruta compatible del runtime
Aplicaciones simultáneasLos navegadores, juegos y cargas de trabajo de escritorio pueden cambiar la disponibilidad de VRAMDeja margen y prueba en condiciones de uso realistas

La documentación del proyecto y el material del lanzamiento remiten a la página oficial del proyecto FreeToken para acceder al sistema. El diseño técnico está documentado en el artículo de investigación de FreeToken.

Lista de comprobación previa:

  • Confirma un entorno NVIDIA CUDA compatible
  • Verifica la memoria del host y la memoria disponible de la GPU
  • Selecciona un modelo y una precisión coincidente
  • Prepara u obtén el formato FreeToken Weight requerido
  • Evalúa una carga de trabajo realista de varias rondas
Advertencia de compatibilidad

No consideres que una descarga correcta del modelo sea una prueba de compatibilidad con el runtime. El perfil de compatibilidad público destaca NVIDIA CUDA y POSIX Linux, mientras que Apple Silicon, las tarjetas NVIDIA antiguas y una compatibilidad más amplia con otras plataformas pueden requerir cambios futuros del proyecto.

Comparación de rendimiento y hardware

Las mejoras reportadas de FreeToken son más notables cuando la carga de trabajo combina un modelo MoE grande, VRAM limitada, enrutamiento repetido de expertos y turnos agénticos prolongados. La evaluación lo compara con motores edge mantenidos activamente en varios sistemas de consumo y en una RTX PRO 6000 de clase workstation.

En una RTX 5090, los resultados publicados reportan entre 77 y 83 tokens por segundo para Qwen3.6-35B y entre 22 y 25 tokens por segundo para DeepSeek-V4-Flash. La misma evaluación informa de un TTFT del peor turno inferior a 44 segundos para FreeToken, mientras que las pausas de las líneas base alcanzaron 232 segundos para llama.cpp, 179 segundos para Ollama y 946 segundos para KTransformers en al menos una celda probada.

Modelo o categoríaEjemplo de hardwareResultado de FreeTokenComparación reportada
Qwen3.6-35B-A3BRTX 509077–83 tok/s1.8–2.3 veces la línea base más potente
DeepSeek-V4-FlashRTX 509022–25 tok/s1.5–1.9 veces la línea base más potente
Qwen3.6-35B-A3BPortátil RTX 4060, 8 GB39.3 tok/sAproximadamente el 92 % de la tasa reportada de la RTX 4090
GLM-5.2RTX PRO 6000 Blackwell, 96 GB14.9 tok/sAproximadamente 2.0 veces los 7.3 tok/s de llama.cpp
Qwen3.6-35B-A3BRTX 5090 de escritorioSeñalado como comparación líder con la línea baseEl ancho de banda del host redujo el resultado aproximadamente un 4 % frente a la configuración de servidor

La política de caché también produjo una diferencia considerable en la reproducción de las trazas de enrutamiento reportadas. Con una capacidad de servicio de RTX 5090, la LRU global de FreeToken tuvo fallos en el 16 % de las lecturas de expertos de Qwen3.6 y en el 39 % de las lecturas de DeepSeek-V4-Flash. Las cifras comparativas indicaron un 62 % y un 89 % de fallos para la división estática de llama.cpp en el mismo orden de modelos.

Estrategia de colocaciónConciencia del enrutamientoFortalezaPrincipal contrapartida
LRU global de FreeTokenA nivel de token y actualizada continuamenteRastrea el conjunto de trabajo actual de expertosRequiere control dinámico de la caché
División estática de llama.cppFijada por la colocación de las capasPredecible y sencillaPuede no detectar cambios en los expertos enrutados
Colocación de expertos activos de KTransformersActualizada en torno al comportamiento del prefillPuede mantener expertos seleccionados en la GPU o la CPUPuede no seguir todos los cambios durante el decode
Ruta de expertos exclusiva de CPUNo depende de la caché de la GPUAmplio comportamiento de respaldoLimitada por el ancho de banda de memoria del host

La evaluación también informa de que el doble búfer de capas completas mejoró el rendimiento del prefill al ocultar el movimiento de expertos detrás del cálculo. Desactivar el segundo búfer redujo el rendimiento un 19 % con 4K tokens, un 25 % con 8K y un 26 % con 16K en la prueba citada de Qwen3.6.

Lee el benchmark con atención

Las cifras principales de rendimiento proceden de la evaluación propia del proyecto. Utilizan pesos idénticos y varias cargas de trabajo, pero el material proporcionado no estableció benchmarks independientes de terceros. Considera la latencia de cola, la compatibilidad y la repetibilidad igual de importantes.

Limitaciones, mejores casos de uso y preguntas frecuentes

FreeToken resulta especialmente atractivo para usuarios que ya poseen hardware NVIDIA reciente, cuentan con una cantidad considerable de memoria del sistema y ejecutan modelos MoE mediante agentes de programación o razonamiento. El beneficio es menos evidente cuando el modelo elegido ya cabe cómodamente en la VRAM, cuando la plataforma no dispone de la ruta CUDA requerida o cuando la carga de trabajo consiste en una solicitud breve de un solo turno.

El sistema tampoco hace que la inferencia local sea gratuita en términos prácticos. El hardware, la electricidad, el almacenamiento, la refrigeración y el tiempo de configuración siguen formando parte de la decisión. Su valor está relacionado, en cambio, con la privacidad, el control local, una menor exposición a límites de uso y la posibilidad de mantener un modelo disponible sin depender de un servicio alojado.

Perfil de usuarioAdecuaciónMotivo
Propietario de un equipo de escritorio NVIDIA recienteAltaTiene la mejor posibilidad de utilizar eficazmente la caché y la ruta PCIe
Propietario de un portátil NVIDIA de 8 GBCondicionalEl resultado reportado del portátil es prometedor, pero las limitaciones térmicas y de memoria siguen siendo importantes
Usuario de Apple SiliconLimitada según el perfil de compatibilidad de 2026 proporcionadoNo se identificó una ruta rápida publicada para Mac
Propietario de una GPU NVIDIA antiguaInciertaLa compatibilidad con hardware antiguo figuraba como una solicitud abierta
Usuario de solicitudes breves de un solo turnoModeradaLas cargas de trabajo con contexto largo y de tipo agéntico muestran mejor las ventajas de FreeToken
Usuario de agentes de programación con modelos MoE grandesAltaLa latencia de cola y el enrutamiento repetido son problemas centrales que se pretenden resolver

Q: ¿Para qué se utiliza FreeToken api?

Se utiliza para servir modelos grandes de mezcla de expertos con pesos abiertos en hardware personal, coordinando la memoria de la GPU, la memoria del host, la ejecución en la CPU y las transferencias PCIe.

Q: ¿FreeToken requiere un modelo específico?

El runtime depende del modelo. La evaluación proporcionada menciona Qwen3.6-35B-A3B, DeepSeek-V4-Flash y GLM-5.2, pero cada modelo sigue necesitando una precisión compatible y una disposición de runtime preparada.

Q: ¿FreeToken es mejor que llama.cpp para todos los usuarios?

No. FreeToken está dirigido a sistemas NVIDIA recientes que ejecutan cargas de trabajo MoE grandes. llama.cpp sigue siendo la opción más consolidada y amplia cuando la cobertura de plataformas y la compatibilidad con el hardware existente son prioritarias.

Q: ¿Por qué FreeToken utiliza tanto la ejecución en la CPU como la caché de la GPU?

Un experto ausente puede transferirse a la GPU o ejecutarse donde ya reside. FreeToken utiliza el ancho de banda medido para dividir los fallos entre ambas rutas, en lugar de depender de una política fija.

Recomendación práctica

Utiliza FreeToken cuando tu carga de trabajo esté limitada por grandes conjuntos de expertos MoE y turnos agénticos prolongados. Para la inferencia local general, compara primero la compatibilidad de la plataforma, la disponibilidad de modelos, el esfuerzo de configuración y la latencia de cola, en lugar de basarte únicamente en el máximo de tokens por segundo.