- FreeToken api se refiere a una pila de inferencia local para servir modelos grandes de mezcla de expertos.
- Ventaja principal: La caché de expertos consciente del enrutamiento reduce los cuellos de botella innecesarios de la CPU y PCIe.
- Hardware más adecuado: GPU NVIDIA recientes con suficiente memoria del sistema y compatibilidad con CUDA.
- Limitación principal: La versión pública está orientada a la fase beta y se centra principalmente en configuraciones NVIDIA con Linux.
- Expectativa clave: Los resultados dependen en gran medida de la VRAM, el ancho de banda del host, el ancho de banda de PCIe y el formato del modelo.
¿Qué es FreeToken api?
FreeToken es un sistema de servicio nativo para el edge, diseñado para ejecutar modelos grandes de mezcla de expertos con pesos abiertos en hardware personal. En lugar de tratar la GPU como el único recurso utilizable, coordina la memoria de la GPU, la memoria de la CPU, la ejecución en la CPU y la interconexión PCIe como una única plataforma de inferencia.
El sistema está dirigido a modelos cuyo conjunto completo de expertos supera la VRAM disponible, pero cuyo cálculo disperso por token sigue siendo práctico. Por ejemplo, se describe DeepSeek-V4-Flash con 284B de parámetros totales y 13B de parámetros activos, mientras que GLM-5.2 figura con 753B de parámetros totales y 40B de parámetros activos. Solo una parte de los expertos enrutados participa en cada token, pero el conjunto completo de expertos aún debe permanecer accesible.
Aspectos destacados del video:
- FreeToken se presenta como un nuevo motor local para modelos MoE grandes.
- La comparación principal se centra en la caché consciente del enrutamiento frente a la colocación estática.
- Los resultados reportados incluyen GPU de consumo, portátiles y una GPU de clase workstation.
- La latencia de cola se trata como un problema de disponibilidad para cargas de trabajo agénticas.
| Término | Significado |
|---|---|
| MoE | Arquitectura de modelo que contiene muchos expertos y enruta cada token solo a unos pocos |
| Conjunto de expertos | Colección completa de los pesos de los expertos enrutados |
| Prefill | Procesamiento del prompt o contexto existente antes de comenzar la generación |
| Decode | Generación de nuevos tokens, uno a uno |
| TTFT | Tiempo hasta el primer token, incluido el trabajo necesario antes de comenzar la salida |
| Servicio en el edge | Ejecución de inferencia en hardware personal o de consumo en lugar de un clúster de centro de datos |
Considera FreeToken como un runtime de servicio, no como un modelo. Aún necesitas un checkpoint de modelo compatible, hardware admitido, suficiente memoria del host y un formato de runtime preparado correctamente.
Cómo gestiona FreeToken la memoria MoE
FreeToken divide el modelo en una parte residente en la GPU y un conjunto de expertos residente en el host. Los pesos que no pertenecen a expertos permanecen en la GPU, mientras que el conjunto residente en la CPU actúa como fuente de verdad para los expertos enrutados. La VRAM disponible se convierte en una caché elástica de expertos compartida entre las capas MoE.
Este diseño es importante porque el cálculo disperso no elimina la presión sobre la memoria. Un token puede activar solo seis expertos de un conjunto mucho mayor, pero el runtime aún debe estar preparado para acceder a cualquier experto que el enrutador seleccione a continuación.
Caché de expertos compartida
- Utiliza un espacio de residencia LRU global
- Rastrea pares de capa y experto
- Sigue los cambios en el enrutamiento a nivel de token
Gestión adaptativa de fallos de caché
- Envía algunos fallos a través de PCIe
- Ejecuta otros fallos directamente en la CPU
- Equilibra el trabajo usando el ancho de banda medido
Memoria elástica
- Ajusta la caché de la GPU en puntos seguros
- Comparte capacidad con la caché KV
- Puede responder a cambios en la disponibilidad de VRAM
Durante el decode, FreeToken identifica los aciertos y fallos de caché en la GPU. Los aciertos se ejecutan directamente desde la VRAM. Los fallos se dividen entre la carga de datos en la caché de la GPU y la ejecución en la CPU según el ancho de banda medido del host y de PCIe. Esto evita que el runtime dependa de una única estrategia fija para todas las máquinas.
| Componente del runtime | Ubicación principal | Responsabilidad principal |
|---|---|---|
| Pesos no pertenecientes a expertos | Memoria de la GPU | Permanecen disponibles para la ejecución normal del modelo |
| Conjunto completo de expertos | Memoria del host | Proporciona los pesos de origen para los expertos enrutados |
| Caché de expertos | Memoria restante de la GPU | Conserva los pares de capa y experto utilizados recientemente |
| Caché KV | Presupuesto de memoria de la GPU | Almacena el estado de atención de los contextos activos |
| Metadatos de enrutamiento | GPU y búferes del runtime | Identifica los expertos seleccionados y el estado de la caché |
El cambio importante no consiste simplemente en mover más pesos entre la CPU y la GPU. FreeToken trata un experto ausente como datos transferibles o como trabajo ejecutable, y luego elige entre ambas rutas según la máquina desplegada.
Flujo de configuración de FreeToken api
Una configuración fiable comienza con comprobaciones de compatibilidad, no con expectativas de rendimiento. El material publicado identifica los entornos CUDA y los sistemas de estilo Linux con NVIDIA como el objetivo principal compatible, mientras que las solicitudes de compatibilidad más amplia con Windows, macOS y GPU antiguas seguían siendo visibles durante el periodo del lanzamiento público de 2026.
Utiliza el siguiente flujo de trabajo para preparar un despliegue local sin asumir que todos los modelos o sistemas operativos son compatibles.
Confirma el perfil de hardware
Registra la memoria de la GPU, la memoria del host, el ancho del enlace PCIe, el ancho de banda de memoria de la CPU y el sistema operativo. Estos valores influyen en la cantidad de caché de expertos que puede permanecer en la VRAM y en la eficiencia con la que se pueden atender los fallos.
Elige un modelo compatible
Comienza con un modelo incluido en la evaluación publicada del proyecto, como Qwen3.6-35B-A3B, DeepSeek-V4-Flash o la demostración de GLM-5.2. Verifica la precisión requerida y la disposición del checkpoint antes de preparar el almacenamiento.
Prepara el formato del runtime
FreeToken utiliza un formato FreeToken Weight que normaliza los bancos de expertos en una disposición adecuada para la carga directa. Un formato preparado puede reducir el trabajo de inicio al evitar la detección y el reempaquetado repetidos de tensores.
Mide antes de ajustar
Permite que el runtime perfile el procesamiento de expertos en el host y el ancho de banda de transferencia con memoria fijada. Estas mediciones determinan el equilibrio entre las cargas de la caché y la ejecución directa en la CPU.
Prueba una carga de trabajo agéntica
Evalúa algo más que la velocidad de tokens aislada. Utiliza un flujo de trabajo de varias rondas para programación, razonamiento o llamadas a herramientas, y supervisa el TTFT, las pausas prolongadas, el comportamiento de la caché y la fiabilidad de finalización.
| Comprobación de configuración | Por qué importa | Acción recomendada |
|---|---|---|
| Entorno NVIDIA CUDA | La ruta rápida se centra en hardware compatible con CUDA | Confirma el controlador y la pila CUDA antes de preparar el modelo |
| Capacidad de memoria del host | El conjunto completo de expertos puede superar ampliamente la VRAM | Reserva suficiente memoria para el checkpoint seleccionado |
| Ancho de banda de PCIe | Las cargas de la caché de la GPU dependen de la velocidad de transferencia del host al dispositivo | Prefiere un enlace amplio y de gran ancho de banda cuando esté disponible |
| Precisión del modelo | El tamaño de los pesos y la compatibilidad de los kernels varían según el formato | Ajusta la precisión del checkpoint a la ruta compatible del runtime |
| Aplicaciones simultáneas | Los navegadores, juegos y cargas de trabajo de escritorio pueden cambiar la disponibilidad de VRAM | Deja margen y prueba en condiciones de uso realistas |
La documentación del proyecto y el material del lanzamiento remiten a la página oficial del proyecto FreeToken para acceder al sistema. El diseño técnico está documentado en el artículo de investigación de FreeToken.
Lista de comprobación previa:
- Confirma un entorno NVIDIA CUDA compatible
- Verifica la memoria del host y la memoria disponible de la GPU
- Selecciona un modelo y una precisión coincidente
- Prepara u obtén el formato FreeToken Weight requerido
- Evalúa una carga de trabajo realista de varias rondas
No consideres que una descarga correcta del modelo sea una prueba de compatibilidad con el runtime. El perfil de compatibilidad público destaca NVIDIA CUDA y POSIX Linux, mientras que Apple Silicon, las tarjetas NVIDIA antiguas y una compatibilidad más amplia con otras plataformas pueden requerir cambios futuros del proyecto.
Comparación de rendimiento y hardware
Las mejoras reportadas de FreeToken son más notables cuando la carga de trabajo combina un modelo MoE grande, VRAM limitada, enrutamiento repetido de expertos y turnos agénticos prolongados. La evaluación lo compara con motores edge mantenidos activamente en varios sistemas de consumo y en una RTX PRO 6000 de clase workstation.
En una RTX 5090, los resultados publicados reportan entre 77 y 83 tokens por segundo para Qwen3.6-35B y entre 22 y 25 tokens por segundo para DeepSeek-V4-Flash. La misma evaluación informa de un TTFT del peor turno inferior a 44 segundos para FreeToken, mientras que las pausas de las líneas base alcanzaron 232 segundos para llama.cpp, 179 segundos para Ollama y 946 segundos para KTransformers en al menos una celda probada.
| Modelo o categoría | Ejemplo de hardware | Resultado de FreeToken | Comparación reportada |
|---|---|---|---|
| Qwen3.6-35B-A3B | RTX 5090 | 77–83 tok/s | 1.8–2.3 veces la línea base más potente |
| DeepSeek-V4-Flash | RTX 5090 | 22–25 tok/s | 1.5–1.9 veces la línea base más potente |
| Qwen3.6-35B-A3B | Portátil RTX 4060, 8 GB | 39.3 tok/s | Aproximadamente el 92 % de la tasa reportada de la RTX 4090 |
| GLM-5.2 | RTX PRO 6000 Blackwell, 96 GB | 14.9 tok/s | Aproximadamente 2.0 veces los 7.3 tok/s de llama.cpp |
| Qwen3.6-35B-A3B | RTX 5090 de escritorio | Señalado como comparación líder con la línea base | El ancho de banda del host redujo el resultado aproximadamente un 4 % frente a la configuración de servidor |
La política de caché también produjo una diferencia considerable en la reproducción de las trazas de enrutamiento reportadas. Con una capacidad de servicio de RTX 5090, la LRU global de FreeToken tuvo fallos en el 16 % de las lecturas de expertos de Qwen3.6 y en el 39 % de las lecturas de DeepSeek-V4-Flash. Las cifras comparativas indicaron un 62 % y un 89 % de fallos para la división estática de llama.cpp en el mismo orden de modelos.
| Estrategia de colocación | Conciencia del enrutamiento | Fortaleza | Principal contrapartida |
|---|---|---|---|
| LRU global de FreeToken | A nivel de token y actualizada continuamente | Rastrea el conjunto de trabajo actual de expertos | Requiere control dinámico de la caché |
| División estática de llama.cpp | Fijada por la colocación de las capas | Predecible y sencilla | Puede no detectar cambios en los expertos enrutados |
| Colocación de expertos activos de KTransformers | Actualizada en torno al comportamiento del prefill | Puede mantener expertos seleccionados en la GPU o la CPU | Puede no seguir todos los cambios durante el decode |
| Ruta de expertos exclusiva de CPU | No depende de la caché de la GPU | Amplio comportamiento de respaldo | Limitada por el ancho de banda de memoria del host |
La evaluación también informa de que el doble búfer de capas completas mejoró el rendimiento del prefill al ocultar el movimiento de expertos detrás del cálculo. Desactivar el segundo búfer redujo el rendimiento un 19 % con 4K tokens, un 25 % con 8K y un 26 % con 16K en la prueba citada de Qwen3.6.
Las cifras principales de rendimiento proceden de la evaluación propia del proyecto. Utilizan pesos idénticos y varias cargas de trabajo, pero el material proporcionado no estableció benchmarks independientes de terceros. Considera la latencia de cola, la compatibilidad y la repetibilidad igual de importantes.
Limitaciones, mejores casos de uso y preguntas frecuentes
FreeToken resulta especialmente atractivo para usuarios que ya poseen hardware NVIDIA reciente, cuentan con una cantidad considerable de memoria del sistema y ejecutan modelos MoE mediante agentes de programación o razonamiento. El beneficio es menos evidente cuando el modelo elegido ya cabe cómodamente en la VRAM, cuando la plataforma no dispone de la ruta CUDA requerida o cuando la carga de trabajo consiste en una solicitud breve de un solo turno.
El sistema tampoco hace que la inferencia local sea gratuita en términos prácticos. El hardware, la electricidad, el almacenamiento, la refrigeración y el tiempo de configuración siguen formando parte de la decisión. Su valor está relacionado, en cambio, con la privacidad, el control local, una menor exposición a límites de uso y la posibilidad de mantener un modelo disponible sin depender de un servicio alojado.
| Perfil de usuario | Adecuación | Motivo |
|---|---|---|
| Propietario de un equipo de escritorio NVIDIA reciente | Alta | Tiene la mejor posibilidad de utilizar eficazmente la caché y la ruta PCIe |
| Propietario de un portátil NVIDIA de 8 GB | Condicional | El resultado reportado del portátil es prometedor, pero las limitaciones térmicas y de memoria siguen siendo importantes |
| Usuario de Apple Silicon | Limitada según el perfil de compatibilidad de 2026 proporcionado | No se identificó una ruta rápida publicada para Mac |
| Propietario de una GPU NVIDIA antigua | Incierta | La compatibilidad con hardware antiguo figuraba como una solicitud abierta |
| Usuario de solicitudes breves de un solo turno | Moderada | Las cargas de trabajo con contexto largo y de tipo agéntico muestran mejor las ventajas de FreeToken |
| Usuario de agentes de programación con modelos MoE grandes | Alta | La latencia de cola y el enrutamiento repetido son problemas centrales que se pretenden resolver |
Q: ¿Para qué se utiliza FreeToken api?
Se utiliza para servir modelos grandes de mezcla de expertos con pesos abiertos en hardware personal, coordinando la memoria de la GPU, la memoria del host, la ejecución en la CPU y las transferencias PCIe.
Q: ¿FreeToken requiere un modelo específico?
El runtime depende del modelo. La evaluación proporcionada menciona Qwen3.6-35B-A3B, DeepSeek-V4-Flash y GLM-5.2, pero cada modelo sigue necesitando una precisión compatible y una disposición de runtime preparada.
Q: ¿FreeToken es mejor que llama.cpp para todos los usuarios?
No. FreeToken está dirigido a sistemas NVIDIA recientes que ejecutan cargas de trabajo MoE grandes. llama.cpp sigue siendo la opción más consolidada y amplia cuando la cobertura de plataformas y la compatibilidad con el hardware existente son prioritarias.
Q: ¿Por qué FreeToken utiliza tanto la ejecución en la CPU como la caché de la GPU?
Un experto ausente puede transferirse a la GPU o ejecutarse donde ya reside. FreeToken utiliza el ancho de banda medido para dividir los fallos entre ambas rutas, en lugar de depender de una política fija.
Utiliza FreeToken cuando tu carga de trabajo esté limitada por grandes conjuntos de expertos MoE y turnos agénticos prolongados. Para la inferencia local general, compara primero la compatibilidad de la plataforma, la disponibilidad de modelos, el esfuerzo de configuración y la latencia de cola, en lugar de basarte únicamente en el máximo de tokens por segundo.