- La compatibilidad con FreeToken gguf es nativa para Gemma-4, mientras que la mayoría de los modelos incluidos usan safetensors de Hugging Face.
- Mejor caso de uso: Checkpoints MoE grandes que superan la VRAM disponible de la GPU, pero caben en la memoria del sistema.
- Ventaja principal: La caché adaptativa de expertos, el trabajo de la CPU y las transferencias PCIe pueden reducir la espera entre tokens.
- Limitación clave: La configuración acelerada está enfocada en Linux, GPU NVIDIA, CUDA 13 y sistemas x86-64.
- Comprobación importante: Un archivo GGUF no es automáticamente compatible a menos que FreeToken admita su arquitectura y formato.
Compatibilidad de FreeToken gguf explicada
FreeToken es un motor de inferencia local, no un modelo de IA. Su propósito es ejecutar checkpoints compatibles en el hardware disponible, especialmente modelos grandes de mezcla de expertos cuyos pesos completos no caben en la VRAM. La documentación actual de modelos indica que FreeToken carga directamente checkpoints safetensors de Hugging Face y admite GGUF nativo para Gemma-4.
Esto significa que “FreeToken gguf” no debe interpretarse como compatibilidad universal con GGUF. GGUF es un formato contenedor de modelos, pero el entorno de ejecución también necesita compatibilidad con la arquitectura correspondiente, kernels y lógica de carga. Consulta la documentación oficial de modelos de FreeToken antes de convertir o descargar un checkpoint.
Aspectos destacados del vídeo:
- FreeToken está orientado a modelos MoE demasiado grandes, no a cualquier carga de inferencia local.
- La caché adaptativa de expertos mantiene disponibles en la VRAM los expertos que se utilizan con frecuencia.
- La ejecución híbrida puede combinar transferencias de la GPU y cálculos de la CPU.
- Las pruebas publicadas incluyen modelos grandes ejecutándose más allá de los límites de sus tarjetas gráficas.
| Formato u origen | Gestión actual en FreeToken | Significado práctico |
|---|---|---|
| Hugging Face safetensors | Carga directa para checkpoints verificados | Ruta principal para las familias de modelos incluidas |
| GGUF | Compatibilidad nativa documentada para Gemma-4 | No asumas que todos los modelos GGUF se cargarán |
| Checkpoint convertido de FreeToken | Formato opcional de carga rápida | ft serve --model puede detectar automáticamente el resultado |
| Arquitectura no compatible | No existe garantía documentada | Verifica la compatibilidad del modelo antes de convertirlo |
La extensión del archivo por sí sola no confirma la compatibilidad. Verifica la familia del modelo, la estructura del checkpoint, la cuantización y la compatibilidad documentada del backend antes de preparar un despliegue de FreeToken.
Modelos compatibles y backends del entorno de ejecución
La lista de modelos documentada identifica DeepSeek-V4 y GLM-5.2 como checkpoints de Hugging Face verificados. La documentación también explica varios backends MoE que determinan dónde se almacenan los expertos y cómo se gestionan los fallos de caché.
La configuración auto selecciona un valor predeterminado según el tipo de modelo. Los modelos densos se resuelven como fused, mientras que los modelos MoE generalmente usan offload y pueden cambiar a hybrid cuando una prueba del equipo lo recomienda.
fused
Los expertos permanecen en la GPU. Esto puede ser eficiente cuando la VRAM disponible es suficiente, pero requiere la mayor cantidad de memoria de GPU.
offload
Los expertos se almacenan en la RAM del sistema, mientras que una caché LRU mantiene determinadas ranuras de expertos en la GPU. Los fallos de caché se transfieren mediante PCIe.
hybrid
Cada paso puede obtener algunos expertos a través de PCIe y calcular otros en la CPU, superponiendo el trabajo cuando el hardware favorece esa división.
| Backend | Ubicación de los expertos | Situación más adecuada |
|---|---|---|
fused | VRAM de la GPU | El modelo y la carga activa caben cómodamente en la GPU |
offload | RAM del sistema con caché en la GPU | Los modelos MoE grandes superan la capacidad de la VRAM |
cpu | La CPU gestiona los fallos de caché | El ancho de banda de memoria de la CPU es preferible a las transferencias repetidas |
hybrid | CPU y transferencias PCIe | Las pruebas muestran que una ruta mixta es más rápida |
auto | Seleccionada automáticamente | Un punto de partida razonable para los modelos compatibles |
El diseño de FreeToken es especialmente relevante cuando el modelo es más grande que la tarjeta gráfica, pero aún cabe en la memoria total del sistema. Trata el cálculo de la GPU, el cálculo de la CPU, la capacidad de RAM y el ancho de banda PCIe como un único sistema, en lugar de depender de una división fija.
Ejecuta ft bench bw una vez por equipo antes de confiar en la ejecución híbrida. El perfil de ancho de banda resultante ayuda a FreeToken a estimar si obtener los datos o realizar el cálculo en la CPU es más adecuado para los fallos de caché.
Pasos de configuración de FreeToken para un checkpoint compatible
Antes de comenzar la configuración, confirma que el equipo cumple con los requisitos indicados en la documentación: Linux, un ordenador x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto destaca las tarjetas de las series RTX 30, RTX 40 y RTX 50, pero el rendimiento real depende del tamaño del modelo, la cuantización, la RAM, la VRAM, la velocidad de la CPU y el ancho de banda PCIe.
Verifica el checkpoint
Comienza con un modelo incluido en la documentación oficial, como un checkpoint de Hugging Face compatible de DeepSeek-V4 o GLM-5.2. Para GGUF, confirma que la arquitectura sea compatible explícitamente; el ejemplo nativo documentado es Gemma-4.
Comprueba la capacidad de memoria
Asegúrate de que el checkpoint completo pueda almacenarse entre la VRAM y la RAM del sistema. Una GPU de 8 GB no reduce a 8 GB el requisito de almacenamiento total del modelo.
Realiza una prueba del equipo
Usa ft bench bw para medir el comportamiento de la memoria local y de las transferencias. Esto ayuda a determinar si offload, cpu o hybrid es la mejor ruta MoE.
Prepara el formato opcional de carga rápida
Ejecuta la conversión documentada del checkpoint únicamente si resulta útil cargarlo más rápido. La conversión es opcional y el comando de servicio puede detectar automáticamente el formato resultante.
Inicia y supervisa
Inicia el modelo con ft serve --model y observa el uso de memoria, la latencia hasta el primer token, la velocidad de generación y la estabilidad durante contextos largos o solicitudes repetidas de agentes.
| Comprobación de configuración | Qué debes confirmar | Por qué es importante |
|---|---|---|
| Sistema operativo | Ruta acelerada centrada en Linux | Las instrucciones actuales no constituyen una configuración de escritorio universal |
| GPU | Tarjeta NVIDIA con un controlador adecuado | La aceleración documentada se centra en NVIDIA y CUDA |
| CUDA | CUDA 13 | Es necesaria según las instrucciones de línea de comandos documentadas |
| RAM del sistema | Suficiente para los pesos descargados | Los pesos restantes del modelo deben almacenarse en algún lugar |
| Checkpoint | Arquitectura y formato compatibles | La carga depende de la compatibilidad del entorno, no solo de la extensión del archivo |
Prueba la carga del modelo y un prompt corto antes de comenzar con cargas de trabajo de contexto largo o de agentes. Esto permite detectar problemas del checkpoint, del controlador y de la memoria sin comprometerse con una sesión extensa.
Rendimiento, memoria y comparación con llama.cpp
El principal argumento a favor de FreeToken no es que sustituya a todos los entornos de ejecución locales. Su especialización consiste en ejecutar modelos MoE grandes cuando sus pesos totales superan la VRAM. El motor puede almacenar en caché los expertos activos, superponer las transferencias con los cálculos y elegir entre mover datos a la GPU o realizar trabajo en la CPU según el equipo anfitrión.
Las pruebas descritas en el material disponible incluyen Qwen3.6-35B-A3B a aproximadamente 77–83 tokens por segundo en una RTX 5090, y DeepSeek-V4 Flash a aproximadamente 22–25 tokens por segundo en las cargas de trabajo probadas. Según los informes, un portátil con RTX 4060, 8 GB de VRAM y 32 GB de memoria del sistema alcanzó 39,3 tokens por segundo con un checkpoint Qwen oficial de 4 bits. Estos son resultados publicados, no una garantía para todas las configuraciones.
| Condición de la carga de trabajo | Relevancia de FreeToken | Nota de comparación |
|---|---|---|
| El modelo cabe completamente en la VRAM | Menor | Un entorno maduro ya puede ser muy rápido |
| El modelo MoE supera la VRAM | Alta | La caché de expertos y la descarga se vuelven fundamentales |
| Contexto largo de agente | Alta | Las llamadas repetidas a herramientas pueden revelar retrasos de transferencia |
| Operación solo con CPU | Limitada | FreeToken no se presenta como un entorno universal para CPU |
| Configuración con Apple Silicon | No clara | No se documenta una ruta comparable en el material proporcionado |
La comparación con llama.cpp depende de la carga de trabajo. llama.cpp es compatible con una gama mucho más amplia de sistemas operativos, procesadores, GPU y formatos de modelo, incluido un amplio ecosistema GGUF. FreeToken es más reciente y limitado, pero ese enfoque más concreto puede resultar útil para despliegues MoE sobredimensionados basados en NVIDIA.
Para un agente, la velocidad de generación es solo una métrica. La latencia hasta el primer token, la reutilización del contexto, el tiempo de respuesta de las llamadas a herramientas y la estabilidad durante sesiones largas pueden ser más importantes que un prompt sintético breve. Un entorno de ejecución que evita pausas de varios minutos puede sentirse más receptivo incluso cuando las cifras generales de tokens por segundo parecen similares.
Considera las cifras publicadas y de la comunidad como específicas de cada configuración. Compara el mismo modelo, cuantización, longitud del prompt, tamaño del contexto, hardware, backend y distribución de memoria antes de sacar conclusiones.
Lista de comprobación de validación y preguntas frecuentes
Usa esta lista al evaluar un flujo de trabajo de FreeToken gguf o cualquier checkpoint compatible. El objetivo es confirmar la compatibilidad y la adecuación del sistema antes de ajustar el rendimiento.
Comprobaciones previas:
- Confirma que la arquitectura del modelo aparece en la documentación de FreeToken
- Verifica si el checkpoint utiliza safetensors de Hugging Face o GGUF nativo compatible
- Mide la RAM del sistema, la VRAM de la GPU y el almacenamiento disponible
- Ejecuta ft bench bw antes de seleccionar la ejecución híbrida
- Prueba un prompt corto antes de las cargas de trabajo de contexto largo o de agentes
| Señal | Resultado saludable | Acción si falla |
|---|---|---|
| Carga del modelo | El checkpoint se inicializa sin errores de formato | Vuelve a comprobar la arquitectura y la estructura del checkpoint |
| Uso de VRAM | La caché y el contexto dejan margen operativo | Reduce la presión de la caché o elige otro backend |
| Latencia hasta el primer token | Estable en solicitudes repetidas | Revisa las transferencias, la longitud del contexto y la presión sobre la RAM |
| Tasa de generación | Constante para la carga de trabajo seleccionada | Compara las opciones de backend usando el mismo prompt |
| Contexto largo | Sin pausas graves ni agotamiento de memoria | Reduce el tamaño del contexto o revisa la capacidad del sistema |
Q: ¿FreeToken es compatible con todos los modelos GGUF?
No se ha establecido una compatibilidad universal. La documentación identifica específicamente la compatibilidad nativa con GGUF para Gemma-4, mientras que la mayoría de los checkpoints incluidos utilizan safetensors de Hugging Face. Comprueba la compatibilidad de la arquitectura antes de usar otro archivo GGUF.
Q: ¿Es FreeToken mejor que llama.cpp en cualquier ordenador?
No. llama.cpp ofrece una cobertura más amplia de hardware, sistemas operativos y GGUF. FreeToken está más especializado en modelos MoE grandes que superan la VRAM de la GPU en sistemas NVIDIA compatibles.
Q: ¿Una GPU de 8 GB puede ejecutar un modelo de más de 8 GB?
Puede ser posible cuando hay suficiente RAM del sistema para almacenar los pesos restantes y el checkpoint es compatible. El modelo completo sigue necesitando su capacidad total de almacenamiento distribuida en el ordenador.
Q: ¿Qué debo hacer si falla un checkpoint de DeepSeek-V4?
Confirma que el subdirectorio inference/config.json siga presente, ya que los argumentos documentados del modelo se leen desde esa ubicación.
Comienza con checkpoints documentados, valida los requisitos de memoria y realiza pruebas en el equipo real. La compatibilidad del formato y el comportamiento del hardware importan más que la etiqueta GGUF por sí sola.
La documentación oficial de modelos de FreeToken es el punto de referencia para los checkpoints compatibles, las opciones de backend, las notas de conversión y los requisitos específicos de cada modelo.