- El servidor API de FreeToken está orientado a la inferencia MoE local utilizando recursos de GPU, CPU, memoria y PCIe.
- Mejor opción: hardware NVIDIA reciente, abundante memoria del sistema y cargas de trabajo de mezcla de expertos sostenidas.
- Ventaja principal: una caché LRU de expertos compartida sigue el enrutamiento de tokens en lugar de depender únicamente de una colocación estática.
- Método de ejecución: los expertos que no están en la caché pueden transferirse a la GPU o ejecutarse directamente en la CPU.
- Limitación principal: la versión de 2026 se encuentra en una fase inicial y debe comprobarse con la compatibilidad actual de la plataforma.
Descripción general del servidor API de FreeToken
FreeToken es un sistema de servicio nativo del entorno edge para modelos grandes de mezcla de expertos con pesos abiertos. No es una plataforma de juegos ni de entretenimiento; su objetivo es exponer la inferencia local de modelos mediante un entorno de servicio que puedan utilizar aplicaciones y frameworks de agentes compatibles.
El sistema está diseñado en torno a una jerarquía de memoria de dos niveles. El conjunto completo de expertos permanece en la memoria del host, mientras que la GPU almacena los pesos que no pertenecen a expertos y una caché elástica de expertos enrutados. Esto permite ejecutar modelos más grandes que la VRAM disponible sin colocar permanentemente cada experto en la tarjeta gráfica.
Aspectos destacados del video:
- FreeToken se centra en la inferencia local para modelos MoE de escala avanzada.
- El desafío central consiste en mover o ejecutar los expertos ausentes de forma eficiente.
- Los resultados publicados abarcan GPU de consumo, portátiles y hardware de clase workstation.
- La compatibilidad del hardware importa más que el rendimiento máximo anunciado por sí solo.
| Componente | Función en FreeToken | Significado práctico |
|---|---|---|
| Memoria de la GPU | Caché de expertos y pesos no expertos | Mantiene cerca de la ejecución a los expertos enrutados con frecuencia |
| Memoria del host | Conjunto completo de expertos | Almacena los pesos que no caben por completo en la VRAM |
| Enlace PCIe | Ruta de transferencia de expertos | Mueve las ausencias seleccionadas a la caché de la GPU |
| CPU | Ejecución directa de expertos | Gestiona algunas ausencias sin una transferencia a la GPU |
| Capa API | Interfaz de servicio orientada a aplicaciones | Permite que los clientes compatibles envíen solicitudes de inferencia |
Una forma útil de entender FreeToken es separar la capacidad del modelo de la computación activa. Un modelo MoE puede contener cientos de miles de millones de parámetros en total, pero cada token activa únicamente un pequeño subconjunto de expertos. El artículo de referencia describe DeepSeek-V4-Flash activando seis de los 256 expertos enrutados por capa, con aproximadamente 13 mil millones de parámetros activos de un total de 284 mil millones.
Esta escasez hace posible el servicio local, pero no elimina el problema de memoria. Todos los expertos deben permanecer accesibles porque el router puede seleccionar expertos diferentes para cada token. Por ello, FreeToken considera la política de caché y la planificación del ancho de banda como partes fundamentales del diseño del servidor API.
Considera FreeToken como un servicio de inferencia consciente del hardware, no simplemente como un lanzador de modelos. La capacidad de tu GPU, el ancho de banda de la memoria del host, la conexión PCIe y las cargas de trabajo simultáneas del escritorio afectan al resultado final.
Comprobaciones de hardware y compatibilidad
Antes de configurar el servidor API de FreeToken, confirma que la máquina coincide con el perfil de implementación previsto por el entorno de ejecución. El material público describe un entorno beta centrado en CUDA, con los mejores resultados en GPU NVIDIA recientes y suficiente memoria del host para albergar el conjunto completo de expertos.
Las comprobaciones más importantes son:
- Disponibilidad de una GPU NVIDIA y compatibilidad adecuada con CUDA.
- Memoria del sistema suficiente para el conjunto completo de expertos del modelo seleccionado.
- Una conexión PCIe capaz de mover los pesos de los expertos de forma eficiente.
- Ancho de banda de la memoria del host capaz de mantener la ejecución de expertos en la CPU.
- Capacidad de almacenamiento y velocidad de lectura adecuadas para los archivos del modelo.
- VRAM libre suficiente para los pesos no expertos y la caché del entorno de ejecución.
| Factor de hardware | Por qué importa | Riesgo cuando es limitado |
|---|---|---|
| VRAM | Determina el tamaño de la caché y los pesos residentes | Más ausencias de enrutamiento y una decodificación más lenta |
| RAM del sistema | Alberga el conjunto completo de expertos | Es posible que el modelo no se cargue o dependa de un comportamiento de respaldo más lento |
| Ancho de banda PCIe | Controla la velocidad de llenado de la caché de la GPU | Las transferencias se convierten en el principal cuello de botella de latencia |
| Ancho de banda de memoria de la CPU | Permite la ejecución directa de expertos en la CPU | Las ausencias gestionadas por la CPU tardan más en completarse |
| Almacenamiento NVMe | Influye en el inicio y la preparación del modelo | Los modelos grandes tardan más en iniciarse |
| Aplicaciones simultáneas | Modifica la VRAM y la capacidad de CPU disponibles | El rendimiento puede variar durante la sesión |
La evaluación del artículo abarca un portátil con RTX 4060, sistemas con RTX 3090 y RTX 4090, hardware RTX 5090 y una workstation con RTX PRO 6000. Estos resultados deben considerarse puntos de referencia, no garantías para todas las configuraciones.
Por ejemplo, los 39,3 tokens por segundo registrados en un portátil con RTX 4060 de 8 GB utilizan una compilación NVFP4 y una configuración de modelo específica. Un formato de modelo, controlador, distribución de memoria o carga de trabajo diferente puede producir un resultado distinto.
El servidor API también debe tener en cuenta la presión dinámica de memoria. Los navegadores, compositores de escritorio, juegos y otras aplicaciones pueden reclamar VRAM mientras FreeToken está en ejecución. Su enfoque de memoria elástica pretende redimensionar la caché de expertos en puntos seguros para el planificador, en lugar de requerir un reinicio completo del motor cada vez que cambia el presupuesto disponible.
Perfil recomendado
- GPU NVIDIA reciente
- Conexión PCIe sólida
- Memoria del host abundante
- Cargas de trabajo MoE de larga duración
Utilizable con precaución
- VRAM limitada
- Enlace PCIe x8 de portátil
- Recursos del sistema compartidos
- Menor ancho de banda de CPU
Comprobar antes de la implementación
- Compatibilidad del sistema operativo
- Entorno CUDA
- Formato del modelo
- Requisitos de memoria del host
No asumas que todas las plataformas compatibles con otro motor de inferencia local también son compatibles con FreeToken. Los clasificadores públicos de 2026 describen un entorno beta centrado en CUDA y orientado a POSIX, así que verifica la documentación de la versión actual antes de elegir Windows, macOS o hardware no NVIDIA.
Guía de configuración del servidor API de FreeToken
Una configuración fiable comienza con el modelo y el plan de memoria, no con el ajuste del rendimiento. Sigue la secuencia siguiente para reducir los lanzamientos fallidos y hacer que las comparaciones posteriores sean significativas.
Selecciona un modelo compatible
Elige un checkpoint MoE que coincida con la memoria del host, la memoria de la GPU y la representación de pesos compatible disponibles. La evaluación de referencia utiliza DeepSeek-V4-Flash, Qwen3.6-35B-A3B y GLM-5.2 en distintos niveles de hardware. Confirma el formato del modelo y la precisión requerida antes de preparar el servidor.
Prepara el conjunto de memoria del host
Reserva suficiente memoria del sistema para el conjunto completo de expertos enrutados. FreeToken considera la memoria del host como fuente de verdad, mientras la GPU mantiene una caché de trabajo. Evita iniciar el servicio junto a aplicaciones que consuman mucha memoria durante la primera carga.
Valida CUDA y las rutas de transferencia
Comprueba la GPU, el entorno CUDA, la compatibilidad del controlador y la ruta PCIe. La política adaptativa al ancho de banda del entorno de ejecución depende del ancho de banda medido de transferencia entre el host y el dispositivo, así como del ancho de banda de procesamiento de expertos en la CPU.
Prepara la distribución de pesos del entorno de ejecución
Cuando sea compatible, utiliza el formato FreeToken Weight para que los bancos de expertos ya estén organizados según la distribución del entorno de ejecución. Esto puede evitar el descubrimiento y el reempaquetado de tensores durante el inicio, reduciendo el trabajo de preparación de checkpoints grandes.
Conecta un cliente compatible
Expón el endpoint de servicio únicamente después de que el modelo responda correctamente a una solicitud de prueba pequeña. Después, conecta un agente o aplicación que pueda utilizar el protocolo API documentado por la versión actual y prueba el comportamiento en varios turnos por separado de las solicitudes individuales.
La secuencia de configuración es importante porque las principales ventajas de FreeToken aparecen durante un servicio sostenido. Un prompt corto puede no mostrar el valor de la reutilización de prefijos, los checkpoints semánticos o una caché adaptativa de expertos. Las cargas de trabajo de agentes en varios turnos editan repetidamente el contexto y enrutan tokens mediante combinaciones cambiantes de expertos, por lo que representan mejor los objetivos de diseño.
| Etapa de configuración | Comprobación de éxito | Acción recomendada |
|---|---|---|
| Selección del modelo | El modelo encaja en el presupuesto de memoria del host | Confirma el tamaño total del conjunto de expertos |
| Preparación del entorno de ejecución | Los pesos coinciden con la distribución compatible | Prioriza el flujo de trabajo FTW documentado |
| Validación del hardware | Las comprobaciones de CUDA y ancho de banda son correctas | Registra los detalles de GPU, PCIe, RAM y CPU |
| Primera solicitud | El servidor devuelve una respuesta válida | Comienza con un prompt controlado y pequeño |
| Integración del cliente | Las solicitudes permanecen estables entre turnos | Prueba el cliente API objetivo antes de ampliar el uso |
Una primera respuesta correcta confirma la funcionalidad básica, no la preparación para producción. Prueba turnos repetidos, contextos más largos y actividad simultánea del escritorio antes de evaluar el servidor API.
Consejos sobre caché, enrutamiento y rendimiento
El mecanismo más distintivo de FreeToken es su caché LRU de expertos compartida. Durante la decodificación, el router identifica los expertos necesarios para el siguiente token y comprueba cuáles ya están residentes. Los aciertos de caché se ejecutan en la GPU. Las ausencias se dividen entre el llenado de la caché de la GPU y la ejecución directa en la CPU según el ancho de banda medido.
Esto difiere de una división fija por capas. Una política de colocación estática decide dónde viven los expertos antes de conocer los cambios del enrutamiento token a token. FreeToken, en cambio, permite que la residencia de la caché siga el comportamiento reciente del enrutamiento. Los resultados de reproducción citados muestran menores tasas de ausencia con la misma capacidad de caché, especialmente cuando la carga de trabajo presenta localidad de expertos a corto plazo.
| Comportamiento del entorno de ejecución | Enfoque de FreeToken | Efecto esperado |
|---|---|---|
| Acierto de experto | Ejecutar desde la caché de la GPU | Menor coste de movimiento |
| Ausencia de experto seleccionada para llenado | Transferir, ejecutar y conservar | Mejora la localidad futura |
| Ausencia de experto seleccionada para la CPU | Ejecutar desde la memoria del host | Utiliza ancho de banda que de otro modo podría quedar inactivo |
| Edición del contexto | Reutilizar el checkpoint semántico | Reduce el trabajo de prellenado repetido |
| Presión sobre la VRAM | Redimensionar la caché en puntos seguros | Mantiene la disponibilidad del servicio sin un reinicio completo |
La política q-star estima cuántas ausencias deben obtenerse mediante PCIe y cuántas deben ejecutarse en la CPU. La división se basa en la relación medida entre el ancho de banda de transferencia con memoria fijada y el ancho de banda de procesamiento de expertos en el host. Esto es importante porque un equipo de escritorio con DDR5 de doble canal y un portátil con LPDDR5 pueden tener comportamientos óptimos muy diferentes, incluso cuando sus GPU son similares.
Para el ajuste, prioriza la latencia de cola en lugar de fijarte únicamente en la velocidad media de decodificación. La evaluación informa de un TTFT del peor turno inferior a 44 segundos en todas las celdas probadas de FreeToken, mientras que algunas líneas base superaron los 150 segundos. En una integración real con un agente, una pausa larga puede activar un tiempo de espera del cliente o un supervisor de inactividad, aunque la cifra media de tokens por segundo parezca competitiva.
Aplica estas reglas prácticas:
- Mantén el sistema host libre de presión de memoria innecesaria.
- Compara pesos y precisión idénticos del modelo entre los distintos motores.
- Mide tareas de varios turnos, no solo prompts aislados.
- Registra la latencia del primer token y la latencia del peor turno.
- Anota el tamaño de la caché, la longitud del contexto y los límites de hilos de la CPU.
- Repite las pruebas después de que otras aplicaciones reclamen VRAM.
El artículo de investigación oficial de FreeToken proporciona la descripción técnica de la caché con consciencia semántica, el prellenado canalizado, la gestión elástica de memoria y la ejecución adaptativa al ancho de banda. Utilízalo como referencia cuando el comportamiento de la versión publicada difiera de los primeros resúmenes.
Utiliza mediciones comparables. El rendimiento de decodificación, el tiempo de respuesta de extremo a extremo, el tiempo hasta el primer token y la latencia de cola describen partes diferentes de la experiencia con el servidor API.
Limitaciones y lista de comprobación de preparación
FreeToken resulta prometedor para un perfil de implementación específico, pero no es automáticamente la mejor opción para todos los usuarios de inferencia local. Se adapta especialmente bien a un sistema NVIDIA reciente con suficiente RAM, una carga de trabajo MoE y una razón para mantener la inferencia en local durante largos periodos.
Su estado público inicial también es importante. El proyecto cuenta con un historial público limitado en los materiales de 2026 proporcionados, y siguen siendo necesarias varias mejoras prácticas para una adopción más amplia, como una cobertura de hardware mayor, sistemas operativos adicionales, flujos de trabajo con dos GPU y formatos de modelos habituales.
Antes de exponer la API:
- Confirma que el modelo y la precisión seleccionados son compatibles
- Verifica que la memoria del host pueda contener el conjunto completo de expertos
- Comprueba la compatibilidad de CUDA, el controlador, PCIe y el almacenamiento
- Mide la latencia y el comportamiento de los tiempos de espera en varios turnos
- Restringe el acceso al endpoint cuando el servicio se ejecute en una red compartida
| Caso de uso | Adecuación | Motivo |
|---|---|---|
| Agente de programación local | Alta | Se beneficia de los turnos repetidos y los datos locales |
| Prompt corto individual | Moderada | La caché y la reutilización de prefijos tienen menos oportunidades |
| Workstation NVIDIA reciente | Alta | Coincide con la dirección de implementación evaluada |
| macOS o Apple Silicon | Incierta | Confirma la compatibilidad actual antes de configurarlo |
| Modelo denso no MoE | Ventaja limitada | Los mecanismos principales están dirigidos a expertos enrutados |
| Endpoint en Internet público | Requiere protección | La autenticación y los controles de red son esenciales |
El servicio local puede reducir la dependencia de los límites de uso de servicios alojados y mantener los prompts en el equipo del usuario, pero también transfiere la responsabilidad al operador. Protege las credenciales de la API, configura deliberadamente la dirección de escucha y evita exponer un endpoint sin autenticación a una red compartida.
Un servidor de modelos local sigue siendo un servicio de red. Utiliza autenticación, direcciones de escucha restringidas, reglas de firewall y registros de acceso antes de permitir que se conecten otros equipos.
Preguntas frecuentes sobre el servidor API de FreeToken
Q: ¿Para qué está diseñado el servidor API de FreeToken?
Es un sistema de servicio de inferencia local para modelos grandes de mezcla de expertos. Coordina la memoria de la GPU, la memoria del host, la ejecución en la CPU y las transferencias PCIe para que los modelos más grandes que la VRAM disponible puedan ejecutarse en hardware personal adecuado.
Q: ¿FreeToken requiere una GPU de gama alta?
Las configuraciones evaluadas se centran en GPU NVIDIA que van desde un portátil con RTX 4060 de 8 GB hasta una workstation con RTX PRO 6000. El requisito exacto depende del modelo, la precisión, la capacidad de memoria del host y la latencia aceptable.
Q: ¿Por qué FreeToken utiliza una caché de expertos?
El enrutamiento MoE cambia de un token a otro, por lo que una colocación fija de expertos puede no incluir a los expertos seleccionados con frecuencia. FreeToken utiliza una caché LRU compartida para seguir la localidad reciente del enrutamiento y combina el llenado de la caché con la ejecución directa en la CPU para las ausencias restantes.
Q: ¿Está FreeToken listo para todos los sistemas operativos?
No debe asumirse una compatibilidad universal. El material de 2026 describe un entorno beta centrado en CUDA. Antes de implementarlo, consulta la documentación de la versión actual para comprobar la compatibilidad del sistema operativo, la GPU, el formato del modelo y la API del cliente.
Elige FreeToken cuando el servicio local de MoE, las cargas de trabajo en varios turnos y el hardware NVIDIA reciente sean compatibles entre sí. De lo contrario, compara las alternativas compatibles utilizando el mismo modelo y las mismas métricas de latencia.