Cuantización de FreeToken: guía de configuración para inferencia MoE - Arquitectura

Cuantización de FreeToken: guía de configuración para inferencia MoE

Aprende cómo FreeToken gestiona modelos MoE cuantizados, niveles de memoria, requisitos de hardware, almacenamiento en caché y configuración de inferencia local en 2026.

2026-08-25
Equipo de FreeToken
Guía rápida
  • La cuantización de FreeToken se centra principalmente en servir de forma eficiente checkpoints compatibles de baja precisión en hardware local.
  • El diseño MoE permite activar solo un pequeño subconjunto de los parámetros del modelo para cada token.
  • Los límites de VRAM no eliminan la necesidad de contar con suficiente RAM del sistema para alojar el modelo completo.
  • El hardware más adecuado actualmente incluye Linux, GPU NVIDIA, CUDA 13 y un controlador reciente.
  • La principal ventaja aparece cuando un modelo MoE grande no cabe por completo en la memoria de la GPU.

La cuantización de FreeToken y el modelo de servicio principal

FreeToken es un motor de inferencia nativo para el edge, no un nuevo modelo de lenguaje ni un algoritmo de cuantización independiente. En el contexto de la cuantización de FreeToken, la cuestión importante es cómo el entorno ejecuta checkpoints compatibles de baja precisión cuando el modelo completo de mezcla de expertos supera la VRAM disponible.

Un modelo de mezcla de expertos almacena un gran conjunto de expertos, pero dirige cada token únicamente a una selección limitada. Se describe que DeepSeek-V4-Flash tiene 284 mil millones de parámetros totales, con aproximadamente 13 mil millones activos para cada token. Esta activación dispersa hace que la ejecución local sea más práctica, aunque el conjunto completo de expertos sigue suponiendo un importante desafío de memoria y transferencia.

ConceptoQué significaPor qué importa
Checkpoint cuantizadoUn modelo almacenado utilizando pesos de precisión reducidaReduce la presión sobre el almacenamiento y la memoria
Modelo MoEUn modelo con muchos expertos y enrutamiento disperso de tokensReduce el cálculo activo por token
Parámetros activosParámetros utilizados para el token actualDeterminan gran parte de la carga de cálculo inmediata
Checkpoint completoTodos los pesos del modelo y de los expertosAun así, deben residir en algún lugar del sistema
Servicio en el edgeInferencia distribuida entre GPU, CPU, RAM y PCIeConvierte el hardware de consumo en un entorno de ejecución unificado

El artículo describe que FreeToken admite varias familias de modelos y formatos de precisión. Su evaluación incluye un checkpoint de DeepSeek-V4-Flash cuantizado de forma nativa a MXFP4, una versión NVFP4 para una configuración de portátil con 8 GB y Qwen3.6-35B-A3B en BF16. Esto significa que la “compatibilidad con la cuantización” depende del checkpoint específico del modelo y de la ruta de ejecución, no de una regla universal de conversión.

Aspectos destacados del vídeo:

  • FreeToken está diseñado para modelos MoE grandes que superan la memoria de la GPU.
  • La caché adaptativa de expertos mantiene en la VRAM los expertos a los que se dirige con mayor frecuencia.
  • La ejecución en CPU y las transferencias PCIe pueden trabajar conjuntamente cuando se producen fallos de caché.
  • Las sesiones prolongadas con agentes de programación son una carga de trabajo importante para el sistema.
Interpretación práctica

Elige primero un checkpoint cuantizado compatible y calcula después las necesidades totales de memoria del sistema. Una GPU de 8 GB puede acelerar un modelo más grande, pero no puede almacenar por sí sola el checkpoint completo.

Cómo se desplazan los pesos MoE cuantizados por la memoria

FreeToken organiza la inferencia en torno a una jerarquía de memoria de expertos de dos niveles. El sistema anfitrión conserva el conjunto completo de expertos enrutados, mientras que los pesos que no pertenecen a expertos permanecen en la GPU. La VRAM disponible se utiliza entonces como una caché de expertos elástica y compartida entre las capas MoE.

Esta disposición cambia el papel de la cuantización. Los pesos de precisión reducida disminuyen el tamaño del modelo residente en el sistema anfitrión y reducen el volumen de transferencia, pero el entorno todavía debe decidir qué expertos deben estar en la VRAM, qué expertos ausentes deben transferirse y cuáles pueden ejecutarse directamente en la CPU.

Capa de memoriaContenido principalFunción en el entorno de ejecución
Memoria de la GPUPesos no expertos, caché KV y expertos seleccionadosEjecución rápida y almacenamiento del estado activo
RAM del sistema anfitriónConjunto completo de expertosFuente principal de los pesos del modelo
Enlace PCIeTransferencias de expertos y tráfico de activacionesConecta el almacenamiento del lado de la CPU con la ejecución en la GPU
Almacenamiento NVMeArchivos de checkpoint y datos FTWProporciona los datos del modelo durante el inicio
Ruta de caché de la CPUDatos recientes del lado del sistema anfitriónPermite la ejecución directa de los fallos

Durante el prellenado, FreeToken utiliza doble búfer para la capa completa cuando hay suficiente capacidad de caché. Mientras la GPU calcula una capa, los expertos de la siguiente pueden transmitirse a través de PCIe. Esto solapa el movimiento de datos con el cálculo, en lugar de exponer cada transferencia como un periodo independiente de inactividad de la GPU.

Durante la decodificación, el enrutamiento se vuelve más detallado. El entorno mantiene una caché LRU compartida basada en los expertos seleccionados recientemente. Un acierto de caché se ejecuta en la GPU. Un fallo puede añadirse a la caché mediante PCIe o ejecutarse directamente en la CPU, según el ancho de banda medido del sistema anfitrión y de la transferencia.

La política adaptativa al ancho de banda es fundamental para este diseño. Una conexión PCIe rápida puede favorecer la transferencia de un mayor número de expertos ausentes, mientras que un ancho de banda superior de la memoria del sistema anfitrión puede hacer más atractiva la ejecución directa en la CPU. La decisión se toma para la máquina implementada, en lugar de copiarse de un perfil de hardware fijo.

Advertencia sobre la memoria

La cuantización reduce el tamaño del checkpoint, pero no elimina los requisitos de memoria. Los modelos grandes siguen necesitando suficiente RAM para el conjunto completo de expertos residente en el sistema anfitrión, además de la sobrecarga del sistema operativo y las aplicaciones.

Formatos compatibles, hardware y perfil de rendimiento

La configuración acelerada documentada de FreeToken está actualmente especializada. La ruta de línea de comandos descrita en el material disponible requiere Linux en un ordenador x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto destaca el hardware de las series RTX 30, RTX 40 y RTX 50.

Hardware o plataformaEstado en la documentación disponibleConsideración clave
Serie RTX 30Compatibilidad destacadaLa RAM del sistema anfitrión sigue siendo importante para modelos MoE sobredimensionados
Serie RTX 40Compatibilidad destacadaEl ancho de banda de PCIe y de la CPU afecta a los fallos de caché
Serie RTX 50Compatibilidad destacadaMuy adecuada para grandes experimentos locales con MoE
Portátil RTX 4060Configuración evaluada8 GB de VRAM, 32 GB de memoria del sistema y checkpoint NVFP4
RTX PRO 6000 BlackwellEvaluación a escala puntaUtilizada para la demostración de GLM-5.2
Apple SiliconNo se describe una ruta comparableNo debe asumirse que exista un equivalente nativo
Ejecución únicamente en CPUNo es el objetivo principalEl foco está en el servicio especializado mediante GPU

La evaluación publicada informa de 77–83 tokens por segundo para Qwen3.6-35B-A3B y de 22–25 tokens por segundo para DeepSeek-V4-Flash en una configuración con RTX 5090. En un portátil RTX 4060 con 8 GB de VRAM y 32 GB de memoria del sistema, la configuración oficial de Qwen en NVFP4 alcanzó 39,3 tokens por segundo.

Otro resultado obtenido en una estación de trabajo sirvió GLM-5.2, descrito como un modelo de 753 mil millones de parámetros, a 14,9 tokens por segundo en una única RTX PRO 6000. Estas cifras están vinculadas a checkpoints, hardware, cargas de trabajo y formatos de precisión específicos. Deben tratarse como puntos de referencia, no como garantías universales de rendimiento.

Modelo o configuraciónPrecisión o formatoHardware indicadoResultado indicado
Qwen3.6-35B-A3BBF16RTX 509077–83 tokens por segundo
DeepSeek-V4-FlashExpertos enrutados MXFP4RTX 509022–25 tokens por segundo
Qwen3.6-35B-A3BVersión oficial NVFP4Portátil RTX 4060, 8 GB de VRAM39,3 tokens por segundo
GLM-5.2Expertos enrutados NVFP4RTX PRO 6000 Blackwell14,9 tokens por segundo
Qwen3.6-35B-A3BPrueba cuantizada comunicada por la comunidadSistema con RTX 5080Alrededor de 100 tokens por segundo, según el informe

El caso de uso más sólido es el de un modelo que no cabe en la VRAM, pero que sigue siendo manejable en la memoria del sistema. Si un modelo cuantizado cabe por completo en la GPU, un entorno de propósito general puede ofrecer ya una velocidad excelente, por lo que las ventajas de FreeToken orientadas a las transferencias pueden ser menos importantes.

Escenario más adecuado

FreeToken resulta especialmente atractivo cuando una GPU NVIDIA, suficiente RAM del sistema y un checkpoint MoE grande deben trabajar conjuntamente para realizar inferencia local interactiva.

Flujo de configuración de la cuantización de FreeToken

Utiliza este flujo de trabajo para evaluar un modelo cuantizado compatible sin considerar garantizados los números de referencia publicados.

1

Confirma la plataforma

Verifica que la máquina utiliza Linux, un procesador x86-64, una GPU NVIDIA compatible, CUDA 13 y un controlador reciente. Registra también la VRAM disponible, la RAM del sistema, el ancho del enlace PCIe y el ancho de banda de la memoria del sistema anfitrión.

2

Selecciona un checkpoint compatible

Elige un checkpoint oficial o documentado con un formato de precisión compatible, como MXFP4, NVFP4 o la configuración de evaluación BF16 indicada. Confirma que la familia del modelo sea compatible antes de descargar sus pesos.

3

Calcula las necesidades totales de memoria

Considera la memoria de la GPU como espacio de aceleración, no como la ubicación de almacenamiento completa. Reserva suficiente RAM del sistema para el conjunto completo de expertos, el estado del entorno de ejecución, el sistema operativo y la caché KV en crecimiento.

4

Prepara el formato del entorno de ejecución

Utiliza la ruta de carga documentada por el proyecto. Cuando corresponda, el formato FreeToken Weight almacena los bancos de expertos en el diseño del entorno de ejecución, reduciendo el trabajo de búsqueda y reempaquetado del checkpoint durante el inicio.

5

Prueba con tu carga de trabajo real

Mide la latencia de las indicaciones, el tiempo hasta el primer token, la velocidad de decodificación y la estabilidad en sesiones de varios turnos. Los agentes de programación y las llamadas a herramientas pueden revelar comportamientos que las pruebas breves con una sola indicación no detectan.

El entorno de ejecución puede cambiar dinámicamente el tamaño y reconstruir la caché de expertos de la GPU en puntos seguros del planificador. Esto resulta útil cuando las ventanas del navegador, las aplicaciones de escritorio u otras cargas de trabajo de la GPU modifican la VRAM disponible durante una sesión.

En las cargas de trabajo agénticas, la gestión del contexto es tan importante como la velocidad de decodificación bruta. FreeToken fija checkpoints del estado recurrente en límites semánticos, como segmentos de razonamiento, llamadas a herramientas, resultados de herramientas y turnos de conversación. Cuando un agente edita un bloque anterior, el entorno puede reutilizar el prefijo sin cambios y volver a realizar el prellenado únicamente del nuevo sufijo.

Métrica de pruebaQué registrarPor qué importa
Uso de VRAMCaché, caché KV y asignación de elementos no expertosMuestra si la memoria está equilibrada
Uso de la RAM del sistemaModelo residente en el sistema anfitrión y sobrecarga del entorno de ejecuciónDetecta la presión de memoria
Tiempo hasta el primer tokenTurnos promedio y más lentosRevela los costes del prellenado y del contexto
Velocidad de decodificaciónTokens por segundo según la carga de trabajoPermite comparar los motores de forma justa
Comportamiento de la cachéTasa de aciertos y fallosMuestra si la localidad de los expertos resulta útil
Estabilidad de la sesiónContexto largo y llamadas repetidas a herramientasEvalúa el servicio práctico para agentes
Consejos para las pruebas de rendimiento

Ejecuta el mismo modelo, precisión, secuencia de indicaciones y arnés de agente en todos los motores. Compara por separado el comportamiento en sesiones largas y el rendimiento de turnos únicos breves.

Lista de preparación y comparación de motores

Antes de adoptar FreeToken para un servicio local habitual, comprueba las restricciones que con mayor frecuencia determinan si la configuración resulta práctica.

Lista de preparación:

  • Confirma Linux, x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente
  • Selecciona un modelo documentado y un formato de cuantización compatible
  • Reserva RAM del sistema para el checkpoint completo residente en el sistema anfitrión
  • Mide la transferencia PCIe y el ancho de banda de la memoria de la CPU en la máquina objetivo
  • Prueba las cargas de trabajo con contexto largo y llamadas a herramientas antes del uso diario

FreeToken no se presenta como un reemplazo universal de llama.cpp. llama.cpp admite una gama más amplia de sistemas operativos, procesadores, proveedores de GPU, dispositivos Apple Silicon y formatos de modelo. FreeToken, en cambio, se centra en modelos MoE sobredimensionados y en la coordinación de la memoria de la GPU, la ejecución en CPU, la RAM del sistema anfitrión y las transferencias PCIe.

Entorno de ejecuciónPrincipal fortalezaPrincipal limitación para este caso de uso
FreeTokenServicio MoE adaptativo entre los recursos de GPU y CPUEcosistema de plataformas y modelos más reducido
llama.cppAmplia compatibilidad de hardware y modelosLa asignación híbrida estática puede no detectar cambios en la localidad de los expertos
KTransformersEjecución de expertos en CPU y servicio híbridoLas políticas comunicadas pueden adaptarse menos al equilibrio del hardware
OllamaFlujo de trabajo local accesible para modelosNo es el objetivo especializado principal para servir MoE sobredimensionados

El proyecto también proporciona API compatibles con OpenAI y Anthropic, lo que permite conectar modelos locales con herramientas compatibles de programación y agentes. La compatibilidad en la capa de API no garantiza un comportamiento idéntico en todos los clientes, por lo que debes probar individualmente la autenticación, la gestión del contexto, las llamadas a herramientas y la configuración de tiempos de espera.

Para conocer los detalles del diseño técnico y la evaluación, consulta el artículo de investigación de FreeToken. El artículo identifica FreeToken como un sistema de código abierto con licencia Apache 2.0 y señala flashml.ai como destino de publicación.

Recomendación editorial

Comienza con un checkpoint MoE cuantizado compatible y una prueba de rendimiento reproducible. Amplía la configuración solo después de confirmar que existe margen de memoria, que la latencia hasta el primer token es aceptable y que las sesiones de agentes son estables.

Preguntas frecuentes sobre la cuantización de FreeToken

Q: ¿Es FreeToken un algoritmo de cuantización?

No. FreeToken es un motor de inferencia y servicio. El término cuantización de FreeToken suele referirse a ejecutar checkpoints compatibles de baja precisión mediante su sistema de servicio MoE.

Q: ¿Una GPU de 8 GB ejecuta un modelo de 35B utilizando únicamente 8 GB de memoria?

No. La configuración de portátil evaluada utilizó 8 GB de VRAM y 32 GB de memoria del sistema. La GPU se encargó de la aceleración, mientras que la memoria del sistema anfitrión almacenó los pesos restantes del modelo.

Q: ¿Qué formatos de cuantización se mencionan para FreeToken?

La evaluación disponible describe expertos enrutados MXFP4 para DeepSeek-V4-Flash, una versión oficial de Qwen3.6 en NVFP4 para la prueba en portátil y BF16 para la comparación principal de Qwen3.6.

Q: ¿Cuándo resulta FreeToken más útil que un entorno local general?

Resulta más útil cuando un modelo MoE grande supera la VRAM, el ordenador dispone de suficiente RAM del sistema y la caché adaptativa de expertos o la coordinación entre CPU y GPU pueden reducir las pausas causadas por las transferencias.