Servidor API de FreeToken: guía de configuración y consejos de ejecución - API

Servidor API de FreeToken: guía de configuración y consejos de ejecución

Descubre cómo el servidor API de FreeToken gestiona la caché MoE, la ejecución CPU-GPU, las comprobaciones de hardware y las decisiones prácticas para el servicio local.

2026-08-25
Equipo de FreeToken
Guía rápida
  • El servidor API de FreeToken está orientado a la inferencia MoE local utilizando recursos de GPU, CPU, memoria y PCIe.
  • Mejor opción: hardware NVIDIA reciente, abundante memoria del sistema y cargas de trabajo de mezcla de expertos sostenidas.
  • Ventaja principal: una caché LRU de expertos compartida sigue el enrutamiento de tokens en lugar de depender únicamente de una colocación estática.
  • Método de ejecución: los expertos que no están en la caché pueden transferirse a la GPU o ejecutarse directamente en la CPU.
  • Limitación principal: la versión de 2026 se encuentra en una fase inicial y debe comprobarse con la compatibilidad actual de la plataforma.

Descripción general del servidor API de FreeToken

FreeToken es un sistema de servicio nativo del entorno edge para modelos grandes de mezcla de expertos con pesos abiertos. No es una plataforma de juegos ni de entretenimiento; su objetivo es exponer la inferencia local de modelos mediante un entorno de servicio que puedan utilizar aplicaciones y frameworks de agentes compatibles.

El sistema está diseñado en torno a una jerarquía de memoria de dos niveles. El conjunto completo de expertos permanece en la memoria del host, mientras que la GPU almacena los pesos que no pertenecen a expertos y una caché elástica de expertos enrutados. Esto permite ejecutar modelos más grandes que la VRAM disponible sin colocar permanentemente cada experto en la tarjeta gráfica.

Aspectos destacados del video:

  • FreeToken se centra en la inferencia local para modelos MoE de escala avanzada.
  • El desafío central consiste en mover o ejecutar los expertos ausentes de forma eficiente.
  • Los resultados publicados abarcan GPU de consumo, portátiles y hardware de clase workstation.
  • La compatibilidad del hardware importa más que el rendimiento máximo anunciado por sí solo.
ComponenteFunción en FreeTokenSignificado práctico
Memoria de la GPUCaché de expertos y pesos no expertosMantiene cerca de la ejecución a los expertos enrutados con frecuencia
Memoria del hostConjunto completo de expertosAlmacena los pesos que no caben por completo en la VRAM
Enlace PCIeRuta de transferencia de expertosMueve las ausencias seleccionadas a la caché de la GPU
CPUEjecución directa de expertosGestiona algunas ausencias sin una transferencia a la GPU
Capa APIInterfaz de servicio orientada a aplicacionesPermite que los clientes compatibles envíen solicitudes de inferencia

Una forma útil de entender FreeToken es separar la capacidad del modelo de la computación activa. Un modelo MoE puede contener cientos de miles de millones de parámetros en total, pero cada token activa únicamente un pequeño subconjunto de expertos. El artículo de referencia describe DeepSeek-V4-Flash activando seis de los 256 expertos enrutados por capa, con aproximadamente 13 mil millones de parámetros activos de un total de 284 mil millones.

Esta escasez hace posible el servicio local, pero no elimina el problema de memoria. Todos los expertos deben permanecer accesibles porque el router puede seleccionar expertos diferentes para cada token. Por ello, FreeToken considera la política de caché y la planificación del ancho de banda como partes fundamentales del diseño del servidor API.

Mejor punto de partida

Considera FreeToken como un servicio de inferencia consciente del hardware, no simplemente como un lanzador de modelos. La capacidad de tu GPU, el ancho de banda de la memoria del host, la conexión PCIe y las cargas de trabajo simultáneas del escritorio afectan al resultado final.

Comprobaciones de hardware y compatibilidad

Antes de configurar el servidor API de FreeToken, confirma que la máquina coincide con el perfil de implementación previsto por el entorno de ejecución. El material público describe un entorno beta centrado en CUDA, con los mejores resultados en GPU NVIDIA recientes y suficiente memoria del host para albergar el conjunto completo de expertos.

Las comprobaciones más importantes son:

  • Disponibilidad de una GPU NVIDIA y compatibilidad adecuada con CUDA.
  • Memoria del sistema suficiente para el conjunto completo de expertos del modelo seleccionado.
  • Una conexión PCIe capaz de mover los pesos de los expertos de forma eficiente.
  • Ancho de banda de la memoria del host capaz de mantener la ejecución de expertos en la CPU.
  • Capacidad de almacenamiento y velocidad de lectura adecuadas para los archivos del modelo.
  • VRAM libre suficiente para los pesos no expertos y la caché del entorno de ejecución.
Factor de hardwarePor qué importaRiesgo cuando es limitado
VRAMDetermina el tamaño de la caché y los pesos residentesMás ausencias de enrutamiento y una decodificación más lenta
RAM del sistemaAlberga el conjunto completo de expertosEs posible que el modelo no se cargue o dependa de un comportamiento de respaldo más lento
Ancho de banda PCIeControla la velocidad de llenado de la caché de la GPULas transferencias se convierten en el principal cuello de botella de latencia
Ancho de banda de memoria de la CPUPermite la ejecución directa de expertos en la CPULas ausencias gestionadas por la CPU tardan más en completarse
Almacenamiento NVMeInfluye en el inicio y la preparación del modeloLos modelos grandes tardan más en iniciarse
Aplicaciones simultáneasModifica la VRAM y la capacidad de CPU disponiblesEl rendimiento puede variar durante la sesión

La evaluación del artículo abarca un portátil con RTX 4060, sistemas con RTX 3090 y RTX 4090, hardware RTX 5090 y una workstation con RTX PRO 6000. Estos resultados deben considerarse puntos de referencia, no garantías para todas las configuraciones.

Por ejemplo, los 39,3 tokens por segundo registrados en un portátil con RTX 4060 de 8 GB utilizan una compilación NVFP4 y una configuración de modelo específica. Un formato de modelo, controlador, distribución de memoria o carga de trabajo diferente puede producir un resultado distinto.

El servidor API también debe tener en cuenta la presión dinámica de memoria. Los navegadores, compositores de escritorio, juegos y otras aplicaciones pueden reclamar VRAM mientras FreeToken está en ejecución. Su enfoque de memoria elástica pretende redimensionar la caché de expertos en puntos seguros para el planificador, en lugar de requerir un reinicio completo del motor cada vez que cambia el presupuesto disponible.

Perfil recomendado

  • GPU NVIDIA reciente
  • Conexión PCIe sólida
  • Memoria del host abundante
  • Cargas de trabajo MoE de larga duración

Utilizable con precaución

  • VRAM limitada
  • Enlace PCIe x8 de portátil
  • Recursos del sistema compartidos
  • Menor ancho de banda de CPU

Comprobar antes de la implementación

  • Compatibilidad del sistema operativo
  • Entorno CUDA
  • Formato del modelo
  • Requisitos de memoria del host
Advertencia de compatibilidad

No asumas que todas las plataformas compatibles con otro motor de inferencia local también son compatibles con FreeToken. Los clasificadores públicos de 2026 describen un entorno beta centrado en CUDA y orientado a POSIX, así que verifica la documentación de la versión actual antes de elegir Windows, macOS o hardware no NVIDIA.

Guía de configuración del servidor API de FreeToken

Una configuración fiable comienza con el modelo y el plan de memoria, no con el ajuste del rendimiento. Sigue la secuencia siguiente para reducir los lanzamientos fallidos y hacer que las comparaciones posteriores sean significativas.

1

Selecciona un modelo compatible

Elige un checkpoint MoE que coincida con la memoria del host, la memoria de la GPU y la representación de pesos compatible disponibles. La evaluación de referencia utiliza DeepSeek-V4-Flash, Qwen3.6-35B-A3B y GLM-5.2 en distintos niveles de hardware. Confirma el formato del modelo y la precisión requerida antes de preparar el servidor.

2

Prepara el conjunto de memoria del host

Reserva suficiente memoria del sistema para el conjunto completo de expertos enrutados. FreeToken considera la memoria del host como fuente de verdad, mientras la GPU mantiene una caché de trabajo. Evita iniciar el servicio junto a aplicaciones que consuman mucha memoria durante la primera carga.

3

Valida CUDA y las rutas de transferencia

Comprueba la GPU, el entorno CUDA, la compatibilidad del controlador y la ruta PCIe. La política adaptativa al ancho de banda del entorno de ejecución depende del ancho de banda medido de transferencia entre el host y el dispositivo, así como del ancho de banda de procesamiento de expertos en la CPU.

4

Prepara la distribución de pesos del entorno de ejecución

Cuando sea compatible, utiliza el formato FreeToken Weight para que los bancos de expertos ya estén organizados según la distribución del entorno de ejecución. Esto puede evitar el descubrimiento y el reempaquetado de tensores durante el inicio, reduciendo el trabajo de preparación de checkpoints grandes.

5

Conecta un cliente compatible

Expón el endpoint de servicio únicamente después de que el modelo responda correctamente a una solicitud de prueba pequeña. Después, conecta un agente o aplicación que pueda utilizar el protocolo API documentado por la versión actual y prueba el comportamiento en varios turnos por separado de las solicitudes individuales.

La secuencia de configuración es importante porque las principales ventajas de FreeToken aparecen durante un servicio sostenido. Un prompt corto puede no mostrar el valor de la reutilización de prefijos, los checkpoints semánticos o una caché adaptativa de expertos. Las cargas de trabajo de agentes en varios turnos editan repetidamente el contexto y enrutan tokens mediante combinaciones cambiantes de expertos, por lo que representan mejor los objetivos de diseño.

Etapa de configuraciónComprobación de éxitoAcción recomendada
Selección del modeloEl modelo encaja en el presupuesto de memoria del hostConfirma el tamaño total del conjunto de expertos
Preparación del entorno de ejecuciónLos pesos coinciden con la distribución compatiblePrioriza el flujo de trabajo FTW documentado
Validación del hardwareLas comprobaciones de CUDA y ancho de banda son correctasRegistra los detalles de GPU, PCIe, RAM y CPU
Primera solicitudEl servidor devuelve una respuesta válidaComienza con un prompt controlado y pequeño
Integración del clienteLas solicitudes permanecen estables entre turnosPrueba el cliente API objetivo antes de ampliar el uso
Comprobación de implementación

Una primera respuesta correcta confirma la funcionalidad básica, no la preparación para producción. Prueba turnos repetidos, contextos más largos y actividad simultánea del escritorio antes de evaluar el servidor API.

Consejos sobre caché, enrutamiento y rendimiento

El mecanismo más distintivo de FreeToken es su caché LRU de expertos compartida. Durante la decodificación, el router identifica los expertos necesarios para el siguiente token y comprueba cuáles ya están residentes. Los aciertos de caché se ejecutan en la GPU. Las ausencias se dividen entre el llenado de la caché de la GPU y la ejecución directa en la CPU según el ancho de banda medido.

Esto difiere de una división fija por capas. Una política de colocación estática decide dónde viven los expertos antes de conocer los cambios del enrutamiento token a token. FreeToken, en cambio, permite que la residencia de la caché siga el comportamiento reciente del enrutamiento. Los resultados de reproducción citados muestran menores tasas de ausencia con la misma capacidad de caché, especialmente cuando la carga de trabajo presenta localidad de expertos a corto plazo.

Comportamiento del entorno de ejecuciónEnfoque de FreeTokenEfecto esperado
Acierto de expertoEjecutar desde la caché de la GPUMenor coste de movimiento
Ausencia de experto seleccionada para llenadoTransferir, ejecutar y conservarMejora la localidad futura
Ausencia de experto seleccionada para la CPUEjecutar desde la memoria del hostUtiliza ancho de banda que de otro modo podría quedar inactivo
Edición del contextoReutilizar el checkpoint semánticoReduce el trabajo de prellenado repetido
Presión sobre la VRAMRedimensionar la caché en puntos segurosMantiene la disponibilidad del servicio sin un reinicio completo

La política q-star estima cuántas ausencias deben obtenerse mediante PCIe y cuántas deben ejecutarse en la CPU. La división se basa en la relación medida entre el ancho de banda de transferencia con memoria fijada y el ancho de banda de procesamiento de expertos en el host. Esto es importante porque un equipo de escritorio con DDR5 de doble canal y un portátil con LPDDR5 pueden tener comportamientos óptimos muy diferentes, incluso cuando sus GPU son similares.

Para el ajuste, prioriza la latencia de cola en lugar de fijarte únicamente en la velocidad media de decodificación. La evaluación informa de un TTFT del peor turno inferior a 44 segundos en todas las celdas probadas de FreeToken, mientras que algunas líneas base superaron los 150 segundos. En una integración real con un agente, una pausa larga puede activar un tiempo de espera del cliente o un supervisor de inactividad, aunque la cifra media de tokens por segundo parezca competitiva.

Aplica estas reglas prácticas:

  • Mantén el sistema host libre de presión de memoria innecesaria.
  • Compara pesos y precisión idénticos del modelo entre los distintos motores.
  • Mide tareas de varios turnos, no solo prompts aislados.
  • Registra la latencia del primer token y la latencia del peor turno.
  • Anota el tamaño de la caché, la longitud del contexto y los límites de hilos de la CPU.
  • Repite las pruebas después de que otras aplicaciones reclamen VRAM.

El artículo de investigación oficial de FreeToken proporciona la descripción técnica de la caché con consciencia semántica, el prellenado canalizado, la gestión elástica de memoria y la ejecución adaptativa al ancho de banda. Utilízalo como referencia cuando el comportamiento de la versión publicada difiera de los primeros resúmenes.

Consejos para las pruebas de rendimiento

Utiliza mediciones comparables. El rendimiento de decodificación, el tiempo de respuesta de extremo a extremo, el tiempo hasta el primer token y la latencia de cola describen partes diferentes de la experiencia con el servidor API.

Limitaciones y lista de comprobación de preparación

FreeToken resulta prometedor para un perfil de implementación específico, pero no es automáticamente la mejor opción para todos los usuarios de inferencia local. Se adapta especialmente bien a un sistema NVIDIA reciente con suficiente RAM, una carga de trabajo MoE y una razón para mantener la inferencia en local durante largos periodos.

Su estado público inicial también es importante. El proyecto cuenta con un historial público limitado en los materiales de 2026 proporcionados, y siguen siendo necesarias varias mejoras prácticas para una adopción más amplia, como una cobertura de hardware mayor, sistemas operativos adicionales, flujos de trabajo con dos GPU y formatos de modelos habituales.

Antes de exponer la API:

  • Confirma que el modelo y la precisión seleccionados son compatibles
  • Verifica que la memoria del host pueda contener el conjunto completo de expertos
  • Comprueba la compatibilidad de CUDA, el controlador, PCIe y el almacenamiento
  • Mide la latencia y el comportamiento de los tiempos de espera en varios turnos
  • Restringe el acceso al endpoint cuando el servicio se ejecute en una red compartida
Caso de usoAdecuaciónMotivo
Agente de programación localAltaSe beneficia de los turnos repetidos y los datos locales
Prompt corto individualModeradaLa caché y la reutilización de prefijos tienen menos oportunidades
Workstation NVIDIA recienteAltaCoincide con la dirección de implementación evaluada
macOS o Apple SiliconInciertaConfirma la compatibilidad actual antes de configurarlo
Modelo denso no MoEVentaja limitadaLos mecanismos principales están dirigidos a expertos enrutados
Endpoint en Internet públicoRequiere protecciónLa autenticación y los controles de red son esenciales

El servicio local puede reducir la dependencia de los límites de uso de servicios alojados y mantener los prompts en el equipo del usuario, pero también transfiere la responsabilidad al operador. Protege las credenciales de la API, configura deliberadamente la dirección de escucha y evita exponer un endpoint sin autenticación a una red compartida.

Recordatorio de seguridad

Un servidor de modelos local sigue siendo un servicio de red. Utiliza autenticación, direcciones de escucha restringidas, reglas de firewall y registros de acceso antes de permitir que se conecten otros equipos.

Preguntas frecuentes sobre el servidor API de FreeToken

Q: ¿Para qué está diseñado el servidor API de FreeToken?

Es un sistema de servicio de inferencia local para modelos grandes de mezcla de expertos. Coordina la memoria de la GPU, la memoria del host, la ejecución en la CPU y las transferencias PCIe para que los modelos más grandes que la VRAM disponible puedan ejecutarse en hardware personal adecuado.

Q: ¿FreeToken requiere una GPU de gama alta?

Las configuraciones evaluadas se centran en GPU NVIDIA que van desde un portátil con RTX 4060 de 8 GB hasta una workstation con RTX PRO 6000. El requisito exacto depende del modelo, la precisión, la capacidad de memoria del host y la latencia aceptable.

Q: ¿Por qué FreeToken utiliza una caché de expertos?

El enrutamiento MoE cambia de un token a otro, por lo que una colocación fija de expertos puede no incluir a los expertos seleccionados con frecuencia. FreeToken utiliza una caché LRU compartida para seguir la localidad reciente del enrutamiento y combina el llenado de la caché con la ejecución directa en la CPU para las ausencias restantes.

Q: ¿Está FreeToken listo para todos los sistemas operativos?

No debe asumirse una compatibilidad universal. El material de 2026 describe un entorno beta centrado en CUDA. Antes de implementarlo, consulta la documentación de la versión actual para comprobar la compatibilidad del sistema operativo, la GPU, el formato del modelo y la API del cliente.

Recomendación final

Elige FreeToken cuando el servicio local de MoE, las cargas de trabajo en varios turnos y el hardware NVIDIA reciente sean compatibles entre sí. De lo contrario, compara las alternativas compatibles utilizando el mismo modelo y las mismas métricas de latencia.