- La aplicación FreeToken proporciona una interfaz de escritorio para ejecutar modelos locales de Mezcla de Expertos.
- Mejor caso de uso: Modelos cuyos expertos activos superan la capacidad de VRAM disponible de la GPU.
- Ventaja principal: Programación adaptativa CPU–GPU, caché de expertos y transferencia en segundo plano.
- Opciones de instalación: Usa la aplicación de escritorio para Windows o Linux, o instala la CLI con
uv. - Limitación importante: Los modelos que caben cómodamente en la VRAM pueden ejecutarse más rápido con un runtime más sencillo.
Descripción general de la aplicación FreeToken
La aplicación FreeToken es una interfaz y un motor de inferencia local diseñados para ejecutar grandes modelos de Mezcla de Expertos con pesos abiertos en hardware de consumo. En lugar de exigir que el modelo completo quepa en la memoria de la GPU, coordina la GPU, la CPU, la RAM del sistema y la conexión PCIe como una única plataforma de ejecución flexible.
FreeToken resulta especialmente relevante cuando un modelo es demasiado grande para la VRAM disponible, pero sigue siendo viable para el resto del equipo. Su aplicación de escritorio ofrece una forma gráfica de inspeccionar modelos compatibles, iniciar conversaciones y ajustar la configuración del motor. La versión de línea de comandos proporciona más control para flujos de desarrollo y evaluación comparativa.
Aspectos destacados del vídeo:
- FreeToken se presenta como una alternativa a herramientas como Ollama y llama.cpp para determinadas cargas de trabajo MoE.
- El motor utiliza una caché de expertos en la GPU en lugar de asignar permanentemente las capas del modelo a un solo dispositivo.
- La programación Q-star decide si los expertos ausentes deben transferirse a la GPU o ejecutarse en la CPU.
- El prellenado con doble búfer solapa los cálculos y las transferencias de expertos.
- El rendimiento depende en gran medida de la capacidad de VRAM, el ancho de banda PCIe, la velocidad de la RAM y el formato del modelo.
El proyecto se mantiene como un proyecto de código abierto bajo la licencia Apache 2.0. Su documentación oficial y sus recursos de instalación están disponibles en el repositorio de FreeToken en GitHub.
| Área | Enfoque de FreeToken | Por qué es importante |
|---|---|---|
| Tipo de modelo | Modelos de Mezcla de Expertos | Está dirigido a modelos dispersos con grandes cantidades totales de parámetros |
| Estrategia de memoria | Caché de GPU más RAM del sistema | Evita exigir que todos los expertos permanezcan en la VRAM |
| Programación | Ejecución CPU–GPU adaptada al ancho de banda | Se ajusta al equipo local |
| Interfaz | Aplicación de escritorio y CLI | Admite flujos de trabajo visuales y de desarrollo |
| Licencia | Apache 2.0 | Permite un uso amplio del código abierto conforme a los términos de la licencia |
Comienza con la aplicación de escritorio si quieres una visión general visual de los modelos. Usa la CLI cuando necesites comandos reproducibles, integración con proyectos o pruebas detalladas.
Cómo gestiona FreeToken los modelos MoE grandes
Un modelo de Mezcla de Expertos puede contener cientos de miles de millones de parámetros totales y activar únicamente un subconjunto menor para cada token. Esta dispersión puede reducir los cálculos, pero no elimina el desafío de memoria: el modelo completo todavía debe estar disponible en algún lugar.
FreeToken trata la memoria de la GPU como una caché activa de expertos. La RAM del sistema sigue siendo la fuente de verdad del modelo completo, mientras que los expertos solicitados con frecuencia se mantienen más cerca de la GPU. Como los routers suelen reutilizar expertos entre tokens cercanos, un conjunto activo relativamente pequeño puede atender gran parte de la carga de trabajo.
Caché de expertos
Los expertos utilizados con frecuencia permanecen cerca de la GPU, lo que reduce las transferencias repetidas en patrones de enrutamiento reutilizados localmente.
Política Q-Star
Los fallos de caché pueden dividirse entre la transferencia a la GPU y la ejecución directa en la CPU según el ancho de banda medido del hardware.
Prellenado con doble búfer
Mientras se procesa una capa, los expertos necesarios para la siguiente pueden transmitirse en segundo plano.
Durante el procesamiento del prompt, también llamado prellenado, las entradas largas pueden acceder a un amplio conjunto de expertos. FreeToken aborda esto solapando el movimiento de datos y los cálculos, en lugar de esperar a que termine cada transferencia antes de continuar el procesamiento.
Durante la generación, el motor debe gestionar los fallos de caché. Transferir un experto mediante PCIe puede ser beneficioso en un sistema, mientras que calcularlo directamente en la CPU puede ser mejor en otro. La política Q-star mide el equilibrio local entre el ancho de banda de la RAM y el de PCIe, y selecciona una división adecuada para la carga de trabajo actual.
| Mecanismo | Función | Beneficio principal | Dependencia principal |
|---|---|---|---|
| Caché LRU global | Mantiene disponibles los expertos utilizados recientemente | Mejora la reutilización entre tokens | Localidad de los expertos y tamaño de la caché |
| Ejecución Q-star | Elige la transferencia a la GPU o la ejecución en la CPU para los fallos | Se adapta a distintas configuraciones de hardware | Ancho de banda de la RAM y PCIe |
| Doble búfer | Transmite futuros expertos durante los cálculos actuales | Reduce las pausas visibles por transferencias | Compatibilidad con transferencias y cálculos simultáneos |
| Formato FTW | Carga los pesos en la disposición requerida por el motor | Reduce el trabajo de reorganización inicial | Disponibilidad del modelo en un formato compatible con FTW |
| Anclajes semánticos | Conserva estados útiles y puntos de control de la caché KV | Puede reducir los recálculos repetidos del contexto | Contexto agéntico y comportamiento de la caché |
El motor también incluye puntos de control de anclajes semánticos para el estado recurrente y las cachés de clave-valor. Su objetivo es reducir los recálculos redundantes del contexto cuando los flujos de trabajo agénticos modifican el contexto mediante llamadas a herramientas o bloques de razonamiento.
FreeToken no es un reemplazo universal para todos los motores de inferencia local. Su caso más sólido es un modelo MoE que supera el umbral de VRAM disponible sin convertir la ejecución en la CPU en el cuello de botella.
Pasos de configuración de la aplicación FreeToken
El proyecto oficial admite una aplicación de escritorio para Windows y Linux, además de una instalación de la CLI basada en Python. Elige una ruta según cómo planees utilizar el runtime.
Comprueba el perfil de hardware
Revisa la VRAM disponible de la GPU, la RAM del sistema, la conectividad PCIe y la compatibilidad del sistema operativo. FreeToken está diseñado para equipos de consumo, pero los modelos frontera muy grandes todavía pueden superar la capacidad de un ordenador de sobremesa potente.
Elige la interfaz
Selecciona la aplicación de escritorio para Windows o Linux si quieres una configuración guiada, visibilidad de los modelos y un uso orientado al chat. Selecciona la CLI cuando necesites scripts, integración con proyectos o comandos de evaluación comparativa repetibles.
Instala la CLI cuando sea necesario
El repositorio oficial recomienda instalar el paquete acelerado con uv pip install "freetoken[accel]". La compilación desde el código fuente también está documentada mediante el flujo de trabajo del entorno virtual del repositorio.
Carga un modelo MoE adecuado
Comienza con un modelo demasiado grande para una carga completa cómoda en la GPU, pero que siga siendo realista para tu RAM y almacenamiento. Confirma que el formato del modelo y los requisitos del runtime sean compatibles.
Ajusta y mide
Ejecuta un prompt o una tarea de programación coherente y compara después la velocidad, la estabilidad y el comportamiento de la memoria. Cambia el tamaño de la caché de expertos de la GPU durante una prueba con el servidor activo cuando necesites estudiar la curva de rendimiento.
| Ruta de configuración | Recomendada para | Ventaja | Limitación |
|---|---|---|---|
| Aplicación de escritorio | Nuevos usuarios y supervisión visual | Interfaz guiada y visión general de los modelos | El flujo de trabajo actual de la aplicación es más limitado para operaciones con archivos de proyecto |
CLI con uv | Desarrolladores y evaluadores | Programable y configurable | Requiere familiaridad con la línea de comandos |
| Compilación desde el código fuente | Colaboradores y usuarios avanzados | Acceso directo al código del proyecto | Mayor responsabilidad de configuración y mantenimiento |
La aplicación de escritorio aparece actualmente disponible para Windows y Linux. Puede mostrar qué modelos parecen viables para el sistema local, pero su flujo de trabajo actual puede no ofrecer las mismas capacidades de gestión de carpetas de proyecto o modificación de archivos que una integración orientada a la programación.
Realiza una prueba pequeña y repetible antes de comprometerte con un modelo grande. Una evaluación comparativa breve puede revelar si las transferencias, el trabajo de la CPU o los fallos de caché están limitando tu sistema.
Comparación y ajuste del rendimiento
La decisión más importante es determinar si el modelo cabe cómodamente en la memoria de la GPU. Si cabe, una configuración convencional con el modelo completamente residente en la GPU puede ser más rápida, ya que evita la sobrecarga de transmisión y programación de FreeToken. Si el modelo supera la VRAM, FreeToken puede mantener los cálculos matemáticos en la GPU mientras transfiere únicamente los expertos necesarios.
Una comparación publicada entre estaciones de trabajo ilustra esta diferencia. Con un modelo Qwen de 8 bits estimado en unos 38 GB sobre una GPU de 32 GB, una configuración con división por capas alcanzó aproximadamente 58 tokens por segundo, mientras que FreeToken alcanzó aproximadamente 132 tokens por segundo en la misma tarea de programación. La duración de la tarea fue de unos 14 minutos y 20 segundos frente a 4 minutos y 40 segundos.
La misma comparación mostró un resultado diferente con una versión de 4 bits que cabía dentro de 32 GB de VRAM. La configuración completamente residente en la GPU alcanzó aproximadamente 240 tokens por segundo, mientras que FreeToken alcanzó aproximadamente 225 tokens por segundo. Estas cifras son específicas del hardware y de la carga de trabajo, no objetivos universales.
| Escenario | Resultado observado | Enfoque preferido |
|---|---|---|
| Modelo MoE de 8 bits demasiado grande | FreeToken alcanzó unos 132 tokens/seg en la prueba citada | Probar FreeToken primero |
| Comparación con división por capas | El runtime alternativo alcanzó unos 58 tokens/seg | Línea base útil |
| Modelo de 4 bits más pequeño que cabe en la VRAM | La configuración completamente en GPU alcanzó unos 240 tokens/seg | Preferir la ruta más sencilla completamente en GPU |
| Caché de FreeToken reducida del 58 % al 40 % | La pérdida de velocidad fue de aproximadamente un 7 % en la prueba citada | Considerar una caché más pequeña |
| Caché reducida por debajo de aproximadamente el 20 % | El rendimiento disminuyó bruscamente en la prueba citada | Evitar reducirla demasiado |
FreeToken también permite cambiar el tamaño de su caché de expertos de la GPU mientras el servidor está en ejecución. En la prueba citada, reducir la caché del 58 % al 40 % solo provocó una reducción moderada de la velocidad, mientras que bajar de aproximadamente el 20 % produjo una caída mucho más pronunciada al saturarse el tráfico PCIe.
Cabe completamente en la VRAM
Prefiere un runtime que pueda mantener el modelo completamente en la GPU y evitar una sobrecarga innecesaria de transmisión.
Ligero exceso de VRAM
FreeToken puede recuperar rendimiento almacenando en caché los expertos activos y adaptando la ejecución CPU–GPU.
Enlace PCIe limitado
Espera una mayor sensibilidad a los fallos de caché y al volumen de transferencias, especialmente con una caché de expertos pequeña.
Mucha RAM del sistema
La RAM adicional ayuda a contener el modelo completo, pero no elimina las limitaciones de ancho de banda.
Los resultados en tokens por segundo dependen de la cuantización del modelo, la longitud del prompt, el hardware, el tamaño de la caché y el tipo de tarea. Utiliza las cifras publicadas como puntos de comparación, no como resultados garantizados.
Lista de comprobación práctica y preguntas frecuentes
Utiliza esta lista antes de evaluar un modelo local grande. Se centra en la compatibilidad y la medición, en lugar de asumir que el modelo más grande disponible será la mejor opción.
Lista de comprobación previa:
- Confirma la compatibilidad con Windows o Linux de la interfaz seleccionada
- Mide la VRAM disponible de la GPU y la RAM del sistema
- Verifica que el modelo objetivo sea una carga de trabajo compatible de Mezcla de Expertos
- Ejecuta el mismo prompt o tarea de programación para comparar cada runtime
- Registra el tamaño de la caché, la velocidad de generación, la estabilidad y el comportamiento de las transferencias
| Punto de control | Qué verificar | Acción recomendada |
|---|---|---|
| Sistema operativo | Compatibilidad de la aplicación de escritorio | Usa Windows o Linux para la interfaz gráfica |
| Arquitectura del modelo | Enrutamiento MoE y pesos compatibles | No asumas que los modelos densos obtendrán el mismo beneficio |
| Equilibrio de memoria | VRAM frente al tamaño total del modelo | Prueba la transmisión cuando el modelo supere la VRAM |
| Velocidad de conexión | Comportamiento de las transferencias PCIe | Vigila la saturación durante los fallos de caché |
| Método de evaluación | La misma tarea y el mismo prompt | Compara los runtimes bajo condiciones equivalentes |
Q: ¿Para qué está diseñada la aplicación FreeToken?
Está diseñada para la inferencia local con grandes modelos de Mezcla de Expertos con pesos abiertos, utilizando GPU y CPU de consumo, memoria del sistema e interconexiones.
Q: ¿Debería usar FreeToken cuando mi modelo cabe completamente en la VRAM?
No necesariamente. Un modelo completamente residente en la GPU puede ser más rápido porque evita la sobrecarga de transmisión y programación que utiliza FreeToken.
Q: ¿FreeToken funciona únicamente mediante una interfaz de escritorio?
No. FreeToken ofrece una aplicación de escritorio para Windows y Linux, además de una CLI que puede instalarse con el paquete acelerado documentado.
Q: ¿Puedo cambiar la caché de expertos de la GPU sin reiniciar?
El motor admite cambiar en vivo el tamaño de la caché de expertos de la GPU en un servidor en ejecución, lo que permite probar las compensaciones entre memoria y velocidad sin reiniciar.
Comienza con las instrucciones del repositorio oficial, lleva un registro de la configuración de tu hardware y modelo, y evalúa FreeToken mediante pruebas locales realizadas bajo condiciones equivalentes.