- El modelo FreeToken 753b se refiere a la ejecución local de GLM-5.2 mediante un motor MoE nativo para edge.
- Método principal: coloca la carga de trabajo activa en la GPU mientras pagina los expertos inactivos a través de la memoria del sistema.
- Configuración recomendada: usa Linux x86-64, una GPU NVIDIA, un controlador R580 o posterior y CUDA 13.
- Principal ventaja: ejecuta inferencias privadas y de baja latencia sin necesidad de un clúster de GPU de centro de datos.
- Limitación principal: los modelos MoE grandes siguen necesitando una cantidad considerable de memoria del sistema y compilaciones de hardware compatibles.
Explicación del modelo FreeToken 753b
FreeToken es un motor de serving nativo para edge diseñado para hacer prácticos los modelos de mixture-of-experts de pesos abiertos y de gran tamaño en máquinas individuales. La distinción importante es que FreeToken no es en sí un modelo de 753B. Es el runtime que ejecuta GLM-5.2, un modelo descrito como uno con aproximadamente 753 mil millones de parámetros, en una única GPU de estación de trabajo.
El sistema trata todo el ordenador como una plataforma de inferencia elástica. La memoria de la GPU, la memoria de la CPU, el almacenamiento del sistema, el ancho de banda de PCIe y la capacidad de ejecución de la CPU se coordinan, en lugar de asumir que cada tensor del modelo debe permanecer en la VRAM.
Aspectos destacados del vídeo:
- FreeToken ejecuta GLM-5.2 con aproximadamente 40 mil millones de parámetros activos en una GPU de estación de trabajo.
- El runtime expone endpoints compatibles con OpenAI y Anthropic en el puerto 1919.
- La dispersión de mixture-of-experts reduce la cantidad de computación necesaria para cada token.
- Una caché compartida y un sistema de paginación de la memoria del sistema ayudan a reducir los fallos durante la decodificación.
En los modelos MoE, el número total de parámetros puede ser mucho mayor que el número de parámetros utilizados para un token individual. DeepSeek-V4-Flash, por ejemplo, dirige cada token a través de seis de 256 expertos distribuidos en 43 capas. Esto significa que aproximadamente 13B parámetros participan en el cálculo de un token, mientras que los expertos inactivos permanecen disponibles en el conjunto general del modelo.
| Concepto | Significado | Por qué es importante |
|---|---|---|
| Parámetros totales | Capacidad completa del modelo, incluidos los expertos inactivos | Determina los requisitos de almacenamiento y memoria del sistema |
| Parámetros activos | Expertos seleccionados para el token actual | Influye en la demanda de computación y la velocidad de generación de tokens |
| Conjunto de expertos | Todos los expertos MoE disponibles | Deben almacenarse y recuperarse cuando cambia el enrutamiento |
| Paginación del sistema | Traslado de expertos inactivos a través de la memoria del sistema | Permite ejecutar modelos más grandes que los límites de la VRAM |
| Plataforma unificada | GPU, CPU, memoria e interconexión trabajando conjuntamente | Adapta la ejecución al hardware disponible |
Un recuento de 753B parámetros no significa que cada token realice una computación densa de 753B. FreeToken se basa en la dispersión de MoE, la colocación adaptativa y la paginación de memoria para hacer manejable esta carga de trabajo.
Configuración del hardware e instalación
FreeToken está pensado para sistemas NVIDIA compatibles, no para implementaciones de propósito general basadas únicamente en CPU. El objetivo documentado para la línea de comandos es Linux x86-64 con una GPU NVIDIA, un controlador R580 o posterior y CUDA 13. También hay disponible una aplicación de escritorio de instalación con un clic para Windows y Linux mediante FlashML.
El paquete de PyPI se publica como freetoken, y la versión de la publicación mencionada es la 0.1.2. Una instalación acelerada típica utiliza:
uv pip install "freetoken[accel]"
El rendimiento exacto que obtengas depende de la generación de la GPU, el controlador, la capacidad de memoria, el enlace PCIe, el ancho de banda de la memoria del sistema, el formato del modelo y la disponibilidad de la compilación NVFP4 o MXFP4 necesaria para tu configuración.
| Área de configuración | Requisito documentado | Comprobación práctica |
|---|---|---|
| Sistema operativo | Linux x86-64 para la CLI; aplicación de escritorio para Windows y Linux | Confirma la arquitectura antes de instalar |
| GPU | GPU NVIDIA | Verifica que el controlador detecte la tarjeta |
| Controlador | R580 o posterior | Compruébalo con nvidia-smi |
| CUDA | Objetivo CUDA 13 | Haz coincidir el runtime con la compilación del acelerador |
| Paquete | freetoken[accel] en PyPI | Instálalo dentro de un entorno aislado |
| Puerto de la API | Puerto 1919 | Reserva el puerto para el servicio local |
Verifica el entorno NVIDIA
Confirma que la GPU sea visible, que el controlador cumpla el requisito R580 o posterior y que la pila de CUDA sea compatible con la compilación de FreeToken prevista. Registra la VRAM y la RAM del sistema disponibles antes de elegir un modelo.
Instala el paquete acelerado
Crea un entorno de Python aislado e instala freetoken[accel] con el gestor de paquetes compatible con tu flujo de trabajo. Mantén el entorno separado de otros motores de inferencia para facilitar la resolución de problemas.
Mide el ancho de banda del sistema
Ejecuta ft bench bw para analizar la relación entre el ancho de banda de transferencia de PCIe y el ancho de banda de la memoria del sistema. FreeToken utiliza estas mediciones para decidir cómo dividir los fallos de caché entre las cargas en la GPU y la ejecución en la CPU.
Inicia un endpoint compatible
Inicia el proceso de serving con ft serve y conecta después un cliente compatible con OpenAI o Anthropic al puerto 1919. Para flujos de trabajo con agentes, ft launch claude puede conectar clientes de programación compatibles con el endpoint local.
No consideres que las cifras de rendimiento publicadas estén garantizadas para todas las tarjetas NVIDIA. Las versiones de los controladores, los formatos de cuantización, la RAM del sistema, la topología PCIe y los límites térmicos pueden cambiar notablemente el rendimiento.
Cómo funcionan la paginación y la caché de MoE
El desafío central no consiste únicamente en almacenar un modelo grande. También hay que mover los expertos correctos al lugar de ejecución adecuado en el momento preciso. La colocación estática tradicional puede volverse ineficiente porque el enrutamiento cambia de un token a otro. Un experto que permanece inactivo durante una solicitud puede volverse importante durante el siguiente paso de decodificación.
FreeToken aborda este problema mediante tres mecanismos relacionados.
En primer lugar, la ejecución adaptada al ancho de banda estima cuánto trabajo debe enviarse a través de PCIe y cuánto debe permanecer en la CPU. El sistema analiza el ancho de banda de la memoria del sistema y de PCIe, y utiliza el resultado para dividir los fallos de caché. Esto es más flexible que una regla fija de «GPU primero» o «fallback a la CPU».
En segundo lugar, la caché consciente de la semántica utiliza límites de contexto significativos para las cargas de trabajo con agentes. Los puntos de control pueden alinearse con bloques de razonamiento, llamadas a herramientas y resultados de herramientas. Cuando un agente edita el final de una conversación, el runtime puede necesitar únicamente volver a precargar el sufijo modificado, en lugar de repetir todo el trabajo anterior.
En tercer lugar, la gestión elástica de memoria permite reconstruir la caché de expertos de la GPU en puntos seguros del planificador con un presupuesto de VRAM revisado. Los expertos pueden cargarse en su disposición final en la memoria del sistema sin requerir un reinicio completo del motor ni un calentamiento completo de la GPU.
| Mecanismo | Principio de funcionamiento | Principal beneficio |
|---|---|---|
| Ejecución adaptada al ancho de banda | Divide los fallos de caché entre las cargas por PCIe y el cálculo en la CPU | Utiliza el perfil real de la máquina |
| Caché consciente de la semántica | Fija los puntos de control del estado recurrente en los límites de los agentes | Reduce el trabajo de precarga repetido |
| Caché global de expertos LRU | Comparte las decisiones de caché entre las capas MoE | Sigue la demanda cambiante del enrutador |
| Gestión elástica de memoria | Reconstruye la caché de la GPU con un nuevo presupuesto de VRAM | Se adapta sin reiniciar el motor |
| Carga directa en el sistema | Lee los expertos en su disposición final en la memoria del sistema | Evita reorganizaciones innecesarias |
Con la misma capacidad de caché, la estrategia LRU global registrada produjo una tasa de fallos de lectura de expertos durante la decodificación del 16 % para el conjunto de Qwen3.6, frente al 41 % de KTransformers y el 62 % de llama.cpp en la evaluación citada. Estas cifras describen una configuración de prueba específica, pero ilustran por qué la conciencia global del enrutamiento es importante para la decodificación agéntica.
La mejora más importante procede de coordinar el enrutamiento, la colocación de memoria y la medición del ancho de banda. Aumentar únicamente la VRAM no resuelve todos los cuellos de botella del serving de MoE.
Pruebas de rendimiento y adecuación del modelo
Los resultados publicados muestran que FreeToken está orientado a la inferencia local interactiva, no únicamente al procesamiento por lotes sin conexión. En una RTX 5090, el runtime mantuvo entre 77 y 83 tokens por segundo con Qwen3.6-35B-A3B en BF16 y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash en MXFP4.
En un portátil con una RTX 4060 de 8 GB, una compilación NVFP4 ejecutó un modelo de 35B a 39,3 tokens por segundo. En una RTX PRO 6000, GLM-5.2 con aproximadamente 40B de parámetros activos alcanzó 14,9 tokens por segundo, frente a los 7,3 tokens por segundo de llama.cpp en la prueba citada.
| Hardware | Modelo o compilación | Rendimiento registrado | Contexto |
|---|---|---|---|
| RTX 5090 | Qwen3.6-35B-A3B, BF16 | 77–83 tok/s | Decodificación sostenida |
| RTX 5090 | DeepSeek-V4-Flash, MXFP4 | 22–25 tok/s | Decodificación sostenida |
| RTX 4060, 8 GB | Modelo de 35B, NVFP4 | 39,3 tok/s | Resultado en GPU de portátil |
| RTX PRO 6000 | GLM-5.2, aproximadamente 40B activos | 14,9 tok/s | Frente a 7,3 tok/s en llama.cpp |
| RTX 5090 | Cargas de trabajo agénticas | Dentro del 12 % de la decodificación de un solo turno | Tres cargas de trabajo registradas |
La misma evaluación registró un tiempo máximo hasta el primer token inferior a 44 segundos en toda su matriz de pruebas. Los motores de referencia alcanzaron valores de cola más altos en algunos casos, incluidos 232 segundos para llama.cpp, 179 segundos para Ollama y 946 segundos para KTransformers. Estas comparaciones son útiles para clientes con agentes, donde los retrasos prolongados de inicio pueden provocar tiempos de espera agotados, pero no deben interpretarse como benchmarks universales.
Mejor opción: agentes privados
- Asistentes de programación locales
- Contexto de proyectos sensibles
- Sesiones interactivas de baja latencia
- Compatibilidad con clientes de OpenAI
Buena opción: modelos MoE grandes
- Modelos que superan la VRAM local
- Enrutamiento dinámico de expertos
- Capacidad disponible en la memoria del sistema
- Ajuste necesario de la caché de la GPU
Precaución: escala de producción
- Hardware de estación de trabajo limitado
- Alto número de solicitudes simultáneas
- Objetivos estrictos de nivel de servicio para la latencia
- Expectativas de reemplazar un centro de datos
FreeToken puede hacer que los modelos de escala frontier sean más accesibles en estaciones de trabajo, pero la concurrencia, el tiempo de carga del modelo, la presión de memoria y la compatibilidad del hardware siguen definiendo el límite práctico de implementación.
Lista de comprobación de implementación y resolución de problemas
Una implementación fiable de FreeToken comienza con mediciones, no con suposiciones. Comprueba el perfil de la máquina, selecciona un formato de modelo compatible y prueba una solicitud breve antes de conectar un stack completo de agentes.
Utiliza la siguiente lista de comprobación antes de considerar que el endpoint está listo:
Preparación para la implementación:
- Confirma que haya una GPU NVIDIA y un controlador R580 o posterior
- Verifica CUDA 13 y la compilación NVFP4 o MXFP4 seleccionada
- Mide el ancho de banda de PCIe y de la memoria del sistema con ft bench bw
- Reserva el puerto 1919 para el endpoint de la API local
- Prueba una finalización breve antes de activar las herramientas del agente
| Síntoma | Causa probable | Acción recomendada |
|---|---|---|
| La instalación falla | Incompatibilidad del controlador, CUDA o acelerador | Vuelve a comprobar la compilación y el entorno compatibles |
| Baja velocidad de decodificación | Ancho de banda del sistema insuficiente o enlace PCIe deficiente | Ejecuta el análisis del ancho de banda e inspecciona la topología |
| Fallos frecuentes de expertos | El presupuesto de caché es demasiado pequeño o el enrutamiento cambia rápidamente | Aumenta la caché disponible cuando sea posible |
| Alta latencia de precarga | Contexto grande o tráfico amplio de expertos | Utiliza puntos de control semánticos y prompts de prueba más breves |
| Tiempo de espera agotado del agente | El tiempo de cola hasta el primer token es demasiado alto | Reduce la carga de trabajo, prueba otro formato de modelo o usa un runtime remoto |
Para un asistente de programación, comienza con un contexto moderado y una sola llamada a una herramienta. Observa la latencia hasta el primer token, la velocidad de decodificación, el uso de la memoria del sistema y la utilización de la GPU. Si la GPU está inactiva mientras la CPU y el bus de memoria están saturados, el problema puede estar en el ancho de banda de transferencia o de ejecución del sistema, y no en una capacidad de cálculo insuficiente del modelo.
FreeToken también puede conectarse a Claude Code, Codex, OpenCode u OpenClaw mediante el flujo de lanzamiento documentado. Mantén los permisos limitados al activar herramientas, especialmente cuando el endpoint sea accesible desde fuera de la máquina local.
Un endpoint local compatible con API debe seguir tratándose como un límite de servicio. Restringe la exposición de red, revisa los permisos de los agentes y evita colocar el puerto 1919 en una interfaz pública no confiable.
Preguntas frecuentes sobre el modelo FreeToken 753b
Las siguientes respuestas resumen los aspectos prácticos más relevantes para los desarrolladores que evalúan la ejecución local de modelos de clase 753B en 2026.
Q: ¿FreeToken es en sí un modelo de 753B?
No. FreeToken es un motor de serving. La referencia a 753B describe GLM-5.2, que FreeToken puede ejecutar con aproximadamente 40B de parámetros activos, según lo registrado en la evaluación de la estación de trabajo.
Q: ¿Puede FreeToken ejecutarse en una única GPU de consumo?
Los resultados citados incluyen un modelo de 35B en una RTX 4060 de 8 GB y modelos más grandes en hardware de estación de trabajo. GLM-5.2 en una única GPU de estación de trabajo se registró en una RTX PRO 6000, por lo que la capacidad del hardware y el formato del modelo siguen siendo importantes.
Q: ¿Qué sistema operativo y controlador requiere la CLI?
El objetivo documentado para la CLI es Linux x86-64 con una GPU NVIDIA, un controlador R580 o posterior y CUDA 13. También se describe una aplicación de escritorio de instalación con un clic para Windows y Linux.
Q: ¿Por qué FreeToken necesita tanta memoria del sistema?
La dispersión de MoE reduce la computación activa, pero no elimina los expertos inactivos del conjunto del modelo. Esos expertos pueden permanecer en la memoria del sistema y recuperarse cuando el enrutamiento los necesita.
Para obtener más contexto técnico, consulta el análisis de FreeToken 753B GLM-5.2 publicado por MarkTechPost. El artículo cubre la arquitectura de serving, las pruebas de rendimiento publicadas, los detalles de instalación y las limitaciones de implementación.
Usa FreeToken cuando la privacidad, el control local y la inferencia en estaciones de trabajo sean importantes. Analiza primero el ancho de banda, selecciona la compilación de cuantización correcta y valida la latencia del agente antes de ampliar la carga de trabajo.