FreeToken gguf: compatibilidad, guía de configuración y límites - Modelos

FreeToken gguf: compatibilidad, guía de configuración y límites

Descubre cómo FreeToken gestiona los checkpoints GGUF y Hugging Face, con pasos de configuración, modelos compatibles, consideraciones de hardware y comparaciones con llama.cpp.

2026-08-31
Equipo de Wiki de FreeToken
Guía rápida
  • La compatibilidad con FreeToken gguf es nativa para Gemma-4, mientras que la mayoría de los modelos incluidos usan safetensors de Hugging Face.
  • Mejor caso de uso: Checkpoints MoE grandes que superan la VRAM disponible de la GPU, pero caben en la memoria del sistema.
  • Ventaja principal: La caché adaptativa de expertos, el trabajo de la CPU y las transferencias PCIe pueden reducir la espera entre tokens.
  • Limitación clave: La configuración acelerada está enfocada en Linux, GPU NVIDIA, CUDA 13 y sistemas x86-64.
  • Comprobación importante: Un archivo GGUF no es automáticamente compatible a menos que FreeToken admita su arquitectura y formato.

Compatibilidad de FreeToken gguf explicada

FreeToken es un motor de inferencia local, no un modelo de IA. Su propósito es ejecutar checkpoints compatibles en el hardware disponible, especialmente modelos grandes de mezcla de expertos cuyos pesos completos no caben en la VRAM. La documentación actual de modelos indica que FreeToken carga directamente checkpoints safetensors de Hugging Face y admite GGUF nativo para Gemma-4.

Esto significa que “FreeToken gguf” no debe interpretarse como compatibilidad universal con GGUF. GGUF es un formato contenedor de modelos, pero el entorno de ejecución también necesita compatibilidad con la arquitectura correspondiente, kernels y lógica de carga. Consulta la documentación oficial de modelos de FreeToken antes de convertir o descargar un checkpoint.

Aspectos destacados del vídeo:

  • FreeToken está orientado a modelos MoE demasiado grandes, no a cualquier carga de inferencia local.
  • La caché adaptativa de expertos mantiene disponibles en la VRAM los expertos que se utilizan con frecuencia.
  • La ejecución híbrida puede combinar transferencias de la GPU y cálculos de la CPU.
  • Las pruebas publicadas incluyen modelos grandes ejecutándose más allá de los límites de sus tarjetas gráficas.
Formato u origenGestión actual en FreeTokenSignificado práctico
Hugging Face safetensorsCarga directa para checkpoints verificadosRuta principal para las familias de modelos incluidas
GGUFCompatibilidad nativa documentada para Gemma-4No asumas que todos los modelos GGUF se cargarán
Checkpoint convertido de FreeTokenFormato opcional de carga rápidaft serve --model puede detectar automáticamente el resultado
Arquitectura no compatibleNo existe garantía documentadaVerifica la compatibilidad del modelo antes de convertirlo
Comprueba primero la arquitectura

La extensión del archivo por sí sola no confirma la compatibilidad. Verifica la familia del modelo, la estructura del checkpoint, la cuantización y la compatibilidad documentada del backend antes de preparar un despliegue de FreeToken.

Modelos compatibles y backends del entorno de ejecución

La lista de modelos documentada identifica DeepSeek-V4 y GLM-5.2 como checkpoints de Hugging Face verificados. La documentación también explica varios backends MoE que determinan dónde se almacenan los expertos y cómo se gestionan los fallos de caché.

La configuración auto selecciona un valor predeterminado según el tipo de modelo. Los modelos densos se resuelven como fused, mientras que los modelos MoE generalmente usan offload y pueden cambiar a hybrid cuando una prueba del equipo lo recomienda.

fused

Los expertos permanecen en la GPU. Esto puede ser eficiente cuando la VRAM disponible es suficiente, pero requiere la mayor cantidad de memoria de GPU.

offload

Los expertos se almacenan en la RAM del sistema, mientras que una caché LRU mantiene determinadas ranuras de expertos en la GPU. Los fallos de caché se transfieren mediante PCIe.

hybrid

Cada paso puede obtener algunos expertos a través de PCIe y calcular otros en la CPU, superponiendo el trabajo cuando el hardware favorece esa división.

BackendUbicación de los expertosSituación más adecuada
fusedVRAM de la GPUEl modelo y la carga activa caben cómodamente en la GPU
offloadRAM del sistema con caché en la GPULos modelos MoE grandes superan la capacidad de la VRAM
cpuLa CPU gestiona los fallos de cachéEl ancho de banda de memoria de la CPU es preferible a las transferencias repetidas
hybridCPU y transferencias PCIeLas pruebas muestran que una ruta mixta es más rápida
autoSeleccionada automáticamenteUn punto de partida razonable para los modelos compatibles

El diseño de FreeToken es especialmente relevante cuando el modelo es más grande que la tarjeta gráfica, pero aún cabe en la memoria total del sistema. Trata el cálculo de la GPU, el cálculo de la CPU, la capacidad de RAM y el ancho de banda PCIe como un único sistema, en lugar de depender de una división fija.

Elige el backend mediante mediciones

Ejecuta ft bench bw una vez por equipo antes de confiar en la ejecución híbrida. El perfil de ancho de banda resultante ayuda a FreeToken a estimar si obtener los datos o realizar el cálculo en la CPU es más adecuado para los fallos de caché.

Pasos de configuración de FreeToken para un checkpoint compatible

Antes de comenzar la configuración, confirma que el equipo cumple con los requisitos indicados en la documentación: Linux, un ordenador x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto destaca las tarjetas de las series RTX 30, RTX 40 y RTX 50, pero el rendimiento real depende del tamaño del modelo, la cuantización, la RAM, la VRAM, la velocidad de la CPU y el ancho de banda PCIe.

1

Verifica el checkpoint

Comienza con un modelo incluido en la documentación oficial, como un checkpoint de Hugging Face compatible de DeepSeek-V4 o GLM-5.2. Para GGUF, confirma que la arquitectura sea compatible explícitamente; el ejemplo nativo documentado es Gemma-4.

2

Comprueba la capacidad de memoria

Asegúrate de que el checkpoint completo pueda almacenarse entre la VRAM y la RAM del sistema. Una GPU de 8 GB no reduce a 8 GB el requisito de almacenamiento total del modelo.

3

Realiza una prueba del equipo

Usa ft bench bw para medir el comportamiento de la memoria local y de las transferencias. Esto ayuda a determinar si offload, cpu o hybrid es la mejor ruta MoE.

4

Prepara el formato opcional de carga rápida

Ejecuta la conversión documentada del checkpoint únicamente si resulta útil cargarlo más rápido. La conversión es opcional y el comando de servicio puede detectar automáticamente el formato resultante.

5

Inicia y supervisa

Inicia el modelo con ft serve --model y observa el uso de memoria, la latencia hasta el primer token, la velocidad de generación y la estabilidad durante contextos largos o solicitudes repetidas de agentes.

Comprobación de configuraciónQué debes confirmarPor qué es importante
Sistema operativoRuta acelerada centrada en LinuxLas instrucciones actuales no constituyen una configuración de escritorio universal
GPUTarjeta NVIDIA con un controlador adecuadoLa aceleración documentada se centra en NVIDIA y CUDA
CUDACUDA 13Es necesaria según las instrucciones de línea de comandos documentadas
RAM del sistemaSuficiente para los pesos descargadosLos pesos restantes del modelo deben almacenarse en algún lugar
CheckpointArquitectura y formato compatiblesLa carga depende de la compatibilidad del entorno, no solo de la extensión del archivo
Realiza una prueba de validación breve

Prueba la carga del modelo y un prompt corto antes de comenzar con cargas de trabajo de contexto largo o de agentes. Esto permite detectar problemas del checkpoint, del controlador y de la memoria sin comprometerse con una sesión extensa.

Rendimiento, memoria y comparación con llama.cpp

El principal argumento a favor de FreeToken no es que sustituya a todos los entornos de ejecución locales. Su especialización consiste en ejecutar modelos MoE grandes cuando sus pesos totales superan la VRAM. El motor puede almacenar en caché los expertos activos, superponer las transferencias con los cálculos y elegir entre mover datos a la GPU o realizar trabajo en la CPU según el equipo anfitrión.

Las pruebas descritas en el material disponible incluyen Qwen3.6-35B-A3B a aproximadamente 77–83 tokens por segundo en una RTX 5090, y DeepSeek-V4 Flash a aproximadamente 22–25 tokens por segundo en las cargas de trabajo probadas. Según los informes, un portátil con RTX 4060, 8 GB de VRAM y 32 GB de memoria del sistema alcanzó 39,3 tokens por segundo con un checkpoint Qwen oficial de 4 bits. Estos son resultados publicados, no una garantía para todas las configuraciones.

Condición de la carga de trabajoRelevancia de FreeTokenNota de comparación
El modelo cabe completamente en la VRAMMenorUn entorno maduro ya puede ser muy rápido
El modelo MoE supera la VRAMAltaLa caché de expertos y la descarga se vuelven fundamentales
Contexto largo de agenteAltaLas llamadas repetidas a herramientas pueden revelar retrasos de transferencia
Operación solo con CPULimitadaFreeToken no se presenta como un entorno universal para CPU
Configuración con Apple SiliconNo claraNo se documenta una ruta comparable en el material proporcionado

La comparación con llama.cpp depende de la carga de trabajo. llama.cpp es compatible con una gama mucho más amplia de sistemas operativos, procesadores, GPU y formatos de modelo, incluido un amplio ecosistema GGUF. FreeToken es más reciente y limitado, pero ese enfoque más concreto puede resultar útil para despliegues MoE sobredimensionados basados en NVIDIA.

Para un agente, la velocidad de generación es solo una métrica. La latencia hasta el primer token, la reutilización del contexto, el tiempo de respuesta de las llamadas a herramientas y la estabilidad durante sesiones largas pueden ser más importantes que un prompt sintético breve. Un entorno de ejecución que evita pausas de varios minutos puede sentirse más receptivo incluso cuando las cifras generales de tokens por segundo parecen similares.

Interpreta las pruebas en su contexto

Considera las cifras publicadas y de la comunidad como específicas de cada configuración. Compara el mismo modelo, cuantización, longitud del prompt, tamaño del contexto, hardware, backend y distribución de memoria antes de sacar conclusiones.

Lista de comprobación de validación y preguntas frecuentes

Usa esta lista al evaluar un flujo de trabajo de FreeToken gguf o cualquier checkpoint compatible. El objetivo es confirmar la compatibilidad y la adecuación del sistema antes de ajustar el rendimiento.

Comprobaciones previas:

  • Confirma que la arquitectura del modelo aparece en la documentación de FreeToken
  • Verifica si el checkpoint utiliza safetensors de Hugging Face o GGUF nativo compatible
  • Mide la RAM del sistema, la VRAM de la GPU y el almacenamiento disponible
  • Ejecuta ft bench bw antes de seleccionar la ejecución híbrida
  • Prueba un prompt corto antes de las cargas de trabajo de contexto largo o de agentes
SeñalResultado saludableAcción si falla
Carga del modeloEl checkpoint se inicializa sin errores de formatoVuelve a comprobar la arquitectura y la estructura del checkpoint
Uso de VRAMLa caché y el contexto dejan margen operativoReduce la presión de la caché o elige otro backend
Latencia hasta el primer tokenEstable en solicitudes repetidasRevisa las transferencias, la longitud del contexto y la presión sobre la RAM
Tasa de generaciónConstante para la carga de trabajo seleccionadaCompara las opciones de backend usando el mismo prompt
Contexto largoSin pausas graves ni agotamiento de memoriaReduce el tamaño del contexto o revisa la capacidad del sistema

Q: ¿FreeToken es compatible con todos los modelos GGUF?

No se ha establecido una compatibilidad universal. La documentación identifica específicamente la compatibilidad nativa con GGUF para Gemma-4, mientras que la mayoría de los checkpoints incluidos utilizan safetensors de Hugging Face. Comprueba la compatibilidad de la arquitectura antes de usar otro archivo GGUF.

Q: ¿Es FreeToken mejor que llama.cpp en cualquier ordenador?

No. llama.cpp ofrece una cobertura más amplia de hardware, sistemas operativos y GGUF. FreeToken está más especializado en modelos MoE grandes que superan la VRAM de la GPU en sistemas NVIDIA compatibles.

Q: ¿Una GPU de 8 GB puede ejecutar un modelo de más de 8 GB?

Puede ser posible cuando hay suficiente RAM del sistema para almacenar los pesos restantes y el checkpoint es compatible. El modelo completo sigue necesitando su capacidad total de almacenamiento distribuida en el ordenador.

Q: ¿Qué debo hacer si falla un checkpoint de DeepSeek-V4?

Confirma que el subdirectorio inference/config.json siga presente, ya que los argumentos documentados del modelo se leen desde esa ubicación.

Regla práctica

Comienza con checkpoints documentados, valida los requisitos de memoria y realiza pruebas en el equipo real. La compatibilidad del formato y el comportamiento del hardware importan más que la etiqueta GGUF por sí sola.

La documentación oficial de modelos de FreeToken es el punto de referencia para los checkpoints compatibles, las opciones de backend, las notas de conversión y los requisitos específicos de cada modelo.