- La cuantización de FreeToken se centra principalmente en servir de forma eficiente checkpoints compatibles de baja precisión en hardware local.
- El diseño MoE permite activar solo un pequeño subconjunto de los parámetros del modelo para cada token.
- Los límites de VRAM no eliminan la necesidad de contar con suficiente RAM del sistema para alojar el modelo completo.
- El hardware más adecuado actualmente incluye Linux, GPU NVIDIA, CUDA 13 y un controlador reciente.
- La principal ventaja aparece cuando un modelo MoE grande no cabe por completo en la memoria de la GPU.
La cuantización de FreeToken y el modelo de servicio principal
FreeToken es un motor de inferencia nativo para el edge, no un nuevo modelo de lenguaje ni un algoritmo de cuantización independiente. En el contexto de la cuantización de FreeToken, la cuestión importante es cómo el entorno ejecuta checkpoints compatibles de baja precisión cuando el modelo completo de mezcla de expertos supera la VRAM disponible.
Un modelo de mezcla de expertos almacena un gran conjunto de expertos, pero dirige cada token únicamente a una selección limitada. Se describe que DeepSeek-V4-Flash tiene 284 mil millones de parámetros totales, con aproximadamente 13 mil millones activos para cada token. Esta activación dispersa hace que la ejecución local sea más práctica, aunque el conjunto completo de expertos sigue suponiendo un importante desafío de memoria y transferencia.
| Concepto | Qué significa | Por qué importa |
|---|---|---|
| Checkpoint cuantizado | Un modelo almacenado utilizando pesos de precisión reducida | Reduce la presión sobre el almacenamiento y la memoria |
| Modelo MoE | Un modelo con muchos expertos y enrutamiento disperso de tokens | Reduce el cálculo activo por token |
| Parámetros activos | Parámetros utilizados para el token actual | Determinan gran parte de la carga de cálculo inmediata |
| Checkpoint completo | Todos los pesos del modelo y de los expertos | Aun así, deben residir en algún lugar del sistema |
| Servicio en el edge | Inferencia distribuida entre GPU, CPU, RAM y PCIe | Convierte el hardware de consumo en un entorno de ejecución unificado |
El artículo describe que FreeToken admite varias familias de modelos y formatos de precisión. Su evaluación incluye un checkpoint de DeepSeek-V4-Flash cuantizado de forma nativa a MXFP4, una versión NVFP4 para una configuración de portátil con 8 GB y Qwen3.6-35B-A3B en BF16. Esto significa que la “compatibilidad con la cuantización” depende del checkpoint específico del modelo y de la ruta de ejecución, no de una regla universal de conversión.
Aspectos destacados del vídeo:
- FreeToken está diseñado para modelos MoE grandes que superan la memoria de la GPU.
- La caché adaptativa de expertos mantiene en la VRAM los expertos a los que se dirige con mayor frecuencia.
- La ejecución en CPU y las transferencias PCIe pueden trabajar conjuntamente cuando se producen fallos de caché.
- Las sesiones prolongadas con agentes de programación son una carga de trabajo importante para el sistema.
Elige primero un checkpoint cuantizado compatible y calcula después las necesidades totales de memoria del sistema. Una GPU de 8 GB puede acelerar un modelo más grande, pero no puede almacenar por sí sola el checkpoint completo.
Cómo se desplazan los pesos MoE cuantizados por la memoria
FreeToken organiza la inferencia en torno a una jerarquía de memoria de expertos de dos niveles. El sistema anfitrión conserva el conjunto completo de expertos enrutados, mientras que los pesos que no pertenecen a expertos permanecen en la GPU. La VRAM disponible se utiliza entonces como una caché de expertos elástica y compartida entre las capas MoE.
Esta disposición cambia el papel de la cuantización. Los pesos de precisión reducida disminuyen el tamaño del modelo residente en el sistema anfitrión y reducen el volumen de transferencia, pero el entorno todavía debe decidir qué expertos deben estar en la VRAM, qué expertos ausentes deben transferirse y cuáles pueden ejecutarse directamente en la CPU.
| Capa de memoria | Contenido principal | Función en el entorno de ejecución |
|---|---|---|
| Memoria de la GPU | Pesos no expertos, caché KV y expertos seleccionados | Ejecución rápida y almacenamiento del estado activo |
| RAM del sistema anfitrión | Conjunto completo de expertos | Fuente principal de los pesos del modelo |
| Enlace PCIe | Transferencias de expertos y tráfico de activaciones | Conecta el almacenamiento del lado de la CPU con la ejecución en la GPU |
| Almacenamiento NVMe | Archivos de checkpoint y datos FTW | Proporciona los datos del modelo durante el inicio |
| Ruta de caché de la CPU | Datos recientes del lado del sistema anfitrión | Permite la ejecución directa de los fallos |
Durante el prellenado, FreeToken utiliza doble búfer para la capa completa cuando hay suficiente capacidad de caché. Mientras la GPU calcula una capa, los expertos de la siguiente pueden transmitirse a través de PCIe. Esto solapa el movimiento de datos con el cálculo, en lugar de exponer cada transferencia como un periodo independiente de inactividad de la GPU.
Durante la decodificación, el enrutamiento se vuelve más detallado. El entorno mantiene una caché LRU compartida basada en los expertos seleccionados recientemente. Un acierto de caché se ejecuta en la GPU. Un fallo puede añadirse a la caché mediante PCIe o ejecutarse directamente en la CPU, según el ancho de banda medido del sistema anfitrión y de la transferencia.
La política adaptativa al ancho de banda es fundamental para este diseño. Una conexión PCIe rápida puede favorecer la transferencia de un mayor número de expertos ausentes, mientras que un ancho de banda superior de la memoria del sistema anfitrión puede hacer más atractiva la ejecución directa en la CPU. La decisión se toma para la máquina implementada, en lugar de copiarse de un perfil de hardware fijo.
La cuantización reduce el tamaño del checkpoint, pero no elimina los requisitos de memoria. Los modelos grandes siguen necesitando suficiente RAM para el conjunto completo de expertos residente en el sistema anfitrión, además de la sobrecarga del sistema operativo y las aplicaciones.
Formatos compatibles, hardware y perfil de rendimiento
La configuración acelerada documentada de FreeToken está actualmente especializada. La ruta de línea de comandos descrita en el material disponible requiere Linux en un ordenador x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto destaca el hardware de las series RTX 30, RTX 40 y RTX 50.
| Hardware o plataforma | Estado en la documentación disponible | Consideración clave |
|---|---|---|
| Serie RTX 30 | Compatibilidad destacada | La RAM del sistema anfitrión sigue siendo importante para modelos MoE sobredimensionados |
| Serie RTX 40 | Compatibilidad destacada | El ancho de banda de PCIe y de la CPU afecta a los fallos de caché |
| Serie RTX 50 | Compatibilidad destacada | Muy adecuada para grandes experimentos locales con MoE |
| Portátil RTX 4060 | Configuración evaluada | 8 GB de VRAM, 32 GB de memoria del sistema y checkpoint NVFP4 |
| RTX PRO 6000 Blackwell | Evaluación a escala punta | Utilizada para la demostración de GLM-5.2 |
| Apple Silicon | No se describe una ruta comparable | No debe asumirse que exista un equivalente nativo |
| Ejecución únicamente en CPU | No es el objetivo principal | El foco está en el servicio especializado mediante GPU |
La evaluación publicada informa de 77–83 tokens por segundo para Qwen3.6-35B-A3B y de 22–25 tokens por segundo para DeepSeek-V4-Flash en una configuración con RTX 5090. En un portátil RTX 4060 con 8 GB de VRAM y 32 GB de memoria del sistema, la configuración oficial de Qwen en NVFP4 alcanzó 39,3 tokens por segundo.
Otro resultado obtenido en una estación de trabajo sirvió GLM-5.2, descrito como un modelo de 753 mil millones de parámetros, a 14,9 tokens por segundo en una única RTX PRO 6000. Estas cifras están vinculadas a checkpoints, hardware, cargas de trabajo y formatos de precisión específicos. Deben tratarse como puntos de referencia, no como garantías universales de rendimiento.
| Modelo o configuración | Precisión o formato | Hardware indicado | Resultado indicado |
|---|---|---|---|
| Qwen3.6-35B-A3B | BF16 | RTX 5090 | 77–83 tokens por segundo |
| DeepSeek-V4-Flash | Expertos enrutados MXFP4 | RTX 5090 | 22–25 tokens por segundo |
| Qwen3.6-35B-A3B | Versión oficial NVFP4 | Portátil RTX 4060, 8 GB de VRAM | 39,3 tokens por segundo |
| GLM-5.2 | Expertos enrutados NVFP4 | RTX PRO 6000 Blackwell | 14,9 tokens por segundo |
| Qwen3.6-35B-A3B | Prueba cuantizada comunicada por la comunidad | Sistema con RTX 5080 | Alrededor de 100 tokens por segundo, según el informe |
El caso de uso más sólido es el de un modelo que no cabe en la VRAM, pero que sigue siendo manejable en la memoria del sistema. Si un modelo cuantizado cabe por completo en la GPU, un entorno de propósito general puede ofrecer ya una velocidad excelente, por lo que las ventajas de FreeToken orientadas a las transferencias pueden ser menos importantes.
FreeToken resulta especialmente atractivo cuando una GPU NVIDIA, suficiente RAM del sistema y un checkpoint MoE grande deben trabajar conjuntamente para realizar inferencia local interactiva.
Flujo de configuración de la cuantización de FreeToken
Utiliza este flujo de trabajo para evaluar un modelo cuantizado compatible sin considerar garantizados los números de referencia publicados.
Confirma la plataforma
Verifica que la máquina utiliza Linux, un procesador x86-64, una GPU NVIDIA compatible, CUDA 13 y un controlador reciente. Registra también la VRAM disponible, la RAM del sistema, el ancho del enlace PCIe y el ancho de banda de la memoria del sistema anfitrión.
Selecciona un checkpoint compatible
Elige un checkpoint oficial o documentado con un formato de precisión compatible, como MXFP4, NVFP4 o la configuración de evaluación BF16 indicada. Confirma que la familia del modelo sea compatible antes de descargar sus pesos.
Calcula las necesidades totales de memoria
Considera la memoria de la GPU como espacio de aceleración, no como la ubicación de almacenamiento completa. Reserva suficiente RAM del sistema para el conjunto completo de expertos, el estado del entorno de ejecución, el sistema operativo y la caché KV en crecimiento.
Prepara el formato del entorno de ejecución
Utiliza la ruta de carga documentada por el proyecto. Cuando corresponda, el formato FreeToken Weight almacena los bancos de expertos en el diseño del entorno de ejecución, reduciendo el trabajo de búsqueda y reempaquetado del checkpoint durante el inicio.
Prueba con tu carga de trabajo real
Mide la latencia de las indicaciones, el tiempo hasta el primer token, la velocidad de decodificación y la estabilidad en sesiones de varios turnos. Los agentes de programación y las llamadas a herramientas pueden revelar comportamientos que las pruebas breves con una sola indicación no detectan.
El entorno de ejecución puede cambiar dinámicamente el tamaño y reconstruir la caché de expertos de la GPU en puntos seguros del planificador. Esto resulta útil cuando las ventanas del navegador, las aplicaciones de escritorio u otras cargas de trabajo de la GPU modifican la VRAM disponible durante una sesión.
En las cargas de trabajo agénticas, la gestión del contexto es tan importante como la velocidad de decodificación bruta. FreeToken fija checkpoints del estado recurrente en límites semánticos, como segmentos de razonamiento, llamadas a herramientas, resultados de herramientas y turnos de conversación. Cuando un agente edita un bloque anterior, el entorno puede reutilizar el prefijo sin cambios y volver a realizar el prellenado únicamente del nuevo sufijo.
| Métrica de prueba | Qué registrar | Por qué importa |
|---|---|---|
| Uso de VRAM | Caché, caché KV y asignación de elementos no expertos | Muestra si la memoria está equilibrada |
| Uso de la RAM del sistema | Modelo residente en el sistema anfitrión y sobrecarga del entorno de ejecución | Detecta la presión de memoria |
| Tiempo hasta el primer token | Turnos promedio y más lentos | Revela los costes del prellenado y del contexto |
| Velocidad de decodificación | Tokens por segundo según la carga de trabajo | Permite comparar los motores de forma justa |
| Comportamiento de la caché | Tasa de aciertos y fallos | Muestra si la localidad de los expertos resulta útil |
| Estabilidad de la sesión | Contexto largo y llamadas repetidas a herramientas | Evalúa el servicio práctico para agentes |
Ejecuta el mismo modelo, precisión, secuencia de indicaciones y arnés de agente en todos los motores. Compara por separado el comportamiento en sesiones largas y el rendimiento de turnos únicos breves.
Lista de preparación y comparación de motores
Antes de adoptar FreeToken para un servicio local habitual, comprueba las restricciones que con mayor frecuencia determinan si la configuración resulta práctica.
Lista de preparación:
- Confirma Linux, x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente
- Selecciona un modelo documentado y un formato de cuantización compatible
- Reserva RAM del sistema para el checkpoint completo residente en el sistema anfitrión
- Mide la transferencia PCIe y el ancho de banda de la memoria de la CPU en la máquina objetivo
- Prueba las cargas de trabajo con contexto largo y llamadas a herramientas antes del uso diario
FreeToken no se presenta como un reemplazo universal de llama.cpp. llama.cpp admite una gama más amplia de sistemas operativos, procesadores, proveedores de GPU, dispositivos Apple Silicon y formatos de modelo. FreeToken, en cambio, se centra en modelos MoE sobredimensionados y en la coordinación de la memoria de la GPU, la ejecución en CPU, la RAM del sistema anfitrión y las transferencias PCIe.
| Entorno de ejecución | Principal fortaleza | Principal limitación para este caso de uso |
|---|---|---|
| FreeToken | Servicio MoE adaptativo entre los recursos de GPU y CPU | Ecosistema de plataformas y modelos más reducido |
| llama.cpp | Amplia compatibilidad de hardware y modelos | La asignación híbrida estática puede no detectar cambios en la localidad de los expertos |
| KTransformers | Ejecución de expertos en CPU y servicio híbrido | Las políticas comunicadas pueden adaptarse menos al equilibrio del hardware |
| Ollama | Flujo de trabajo local accesible para modelos | No es el objetivo especializado principal para servir MoE sobredimensionados |
El proyecto también proporciona API compatibles con OpenAI y Anthropic, lo que permite conectar modelos locales con herramientas compatibles de programación y agentes. La compatibilidad en la capa de API no garantiza un comportamiento idéntico en todos los clientes, por lo que debes probar individualmente la autenticación, la gestión del contexto, las llamadas a herramientas y la configuración de tiempos de espera.
Para conocer los detalles del diseño técnico y la evaluación, consulta el artículo de investigación de FreeToken. El artículo identifica FreeToken como un sistema de código abierto con licencia Apache 2.0 y señala flashml.ai como destino de publicación.
Comienza con un checkpoint MoE cuantizado compatible y una prueba de rendimiento reproducible. Amplía la configuración solo después de confirmar que existe margen de memoria, que la latencia hasta el primer token es aceptable y que las sesiones de agentes son estables.
Preguntas frecuentes sobre la cuantización de FreeToken
Q: ¿Es FreeToken un algoritmo de cuantización?
No. FreeToken es un motor de inferencia y servicio. El término cuantización de FreeToken suele referirse a ejecutar checkpoints compatibles de baja precisión mediante su sistema de servicio MoE.
Q: ¿Una GPU de 8 GB ejecuta un modelo de 35B utilizando únicamente 8 GB de memoria?
No. La configuración de portátil evaluada utilizó 8 GB de VRAM y 32 GB de memoria del sistema. La GPU se encargó de la aceleración, mientras que la memoria del sistema anfitrión almacenó los pesos restantes del modelo.
Q: ¿Qué formatos de cuantización se mencionan para FreeToken?
La evaluación disponible describe expertos enrutados MXFP4 para DeepSeek-V4-Flash, una versión oficial de Qwen3.6 en NVFP4 para la prueba en portátil y BF16 para la comparación principal de Qwen3.6.
Q: ¿Cuándo resulta FreeToken más útil que un entorno local general?
Resulta más útil cuando un modelo MoE grande supera la VRAM, el ordenador dispone de suficiente RAM del sistema y la caché adaptativa de expertos o la coordinación entre CPU y GPU pueden reducir las pausas causadas por las transferencias.