Aplicación FreeToken: Guía de configuración para inferencia MoE local - Guía

Aplicación FreeToken: Guía de configuración para inferencia MoE local

Configura la aplicación FreeToken en Windows o Linux, comprende la caché de MoE y elige el runtime adecuado para modelos locales de gran tamaño.

2026-08-31
Equipo de Wiki de FreeToken
Guía rápida
  • La aplicación FreeToken proporciona una interfaz de escritorio para ejecutar modelos locales de Mezcla de Expertos.
  • Mejor caso de uso: Modelos cuyos expertos activos superan la capacidad de VRAM disponible de la GPU.
  • Ventaja principal: Programación adaptativa CPU–GPU, caché de expertos y transferencia en segundo plano.
  • Opciones de instalación: Usa la aplicación de escritorio para Windows o Linux, o instala la CLI con uv.
  • Limitación importante: Los modelos que caben cómodamente en la VRAM pueden ejecutarse más rápido con un runtime más sencillo.

Descripción general de la aplicación FreeToken

La aplicación FreeToken es una interfaz y un motor de inferencia local diseñados para ejecutar grandes modelos de Mezcla de Expertos con pesos abiertos en hardware de consumo. En lugar de exigir que el modelo completo quepa en la memoria de la GPU, coordina la GPU, la CPU, la RAM del sistema y la conexión PCIe como una única plataforma de ejecución flexible.

FreeToken resulta especialmente relevante cuando un modelo es demasiado grande para la VRAM disponible, pero sigue siendo viable para el resto del equipo. Su aplicación de escritorio ofrece una forma gráfica de inspeccionar modelos compatibles, iniciar conversaciones y ajustar la configuración del motor. La versión de línea de comandos proporciona más control para flujos de desarrollo y evaluación comparativa.

Aspectos destacados del vídeo:

  • FreeToken se presenta como una alternativa a herramientas como Ollama y llama.cpp para determinadas cargas de trabajo MoE.
  • El motor utiliza una caché de expertos en la GPU en lugar de asignar permanentemente las capas del modelo a un solo dispositivo.
  • La programación Q-star decide si los expertos ausentes deben transferirse a la GPU o ejecutarse en la CPU.
  • El prellenado con doble búfer solapa los cálculos y las transferencias de expertos.
  • El rendimiento depende en gran medida de la capacidad de VRAM, el ancho de banda PCIe, la velocidad de la RAM y el formato del modelo.

El proyecto se mantiene como un proyecto de código abierto bajo la licencia Apache 2.0. Su documentación oficial y sus recursos de instalación están disponibles en el repositorio de FreeToken en GitHub.

ÁreaEnfoque de FreeTokenPor qué es importante
Tipo de modeloModelos de Mezcla de ExpertosEstá dirigido a modelos dispersos con grandes cantidades totales de parámetros
Estrategia de memoriaCaché de GPU más RAM del sistemaEvita exigir que todos los expertos permanezcan en la VRAM
ProgramaciónEjecución CPU–GPU adaptada al ancho de bandaSe ajusta al equipo local
InterfazAplicación de escritorio y CLIAdmite flujos de trabajo visuales y de desarrollo
LicenciaApache 2.0Permite un uso amplio del código abierto conforme a los términos de la licencia
Mejor punto de partida

Comienza con la aplicación de escritorio si quieres una visión general visual de los modelos. Usa la CLI cuando necesites comandos reproducibles, integración con proyectos o pruebas detalladas.

Cómo gestiona FreeToken los modelos MoE grandes

Un modelo de Mezcla de Expertos puede contener cientos de miles de millones de parámetros totales y activar únicamente un subconjunto menor para cada token. Esta dispersión puede reducir los cálculos, pero no elimina el desafío de memoria: el modelo completo todavía debe estar disponible en algún lugar.

FreeToken trata la memoria de la GPU como una caché activa de expertos. La RAM del sistema sigue siendo la fuente de verdad del modelo completo, mientras que los expertos solicitados con frecuencia se mantienen más cerca de la GPU. Como los routers suelen reutilizar expertos entre tokens cercanos, un conjunto activo relativamente pequeño puede atender gran parte de la carga de trabajo.

Caché de expertos

Los expertos utilizados con frecuencia permanecen cerca de la GPU, lo que reduce las transferencias repetidas en patrones de enrutamiento reutilizados localmente.

Política Q-Star

Los fallos de caché pueden dividirse entre la transferencia a la GPU y la ejecución directa en la CPU según el ancho de banda medido del hardware.

Prellenado con doble búfer

Mientras se procesa una capa, los expertos necesarios para la siguiente pueden transmitirse en segundo plano.

Durante el procesamiento del prompt, también llamado prellenado, las entradas largas pueden acceder a un amplio conjunto de expertos. FreeToken aborda esto solapando el movimiento de datos y los cálculos, en lugar de esperar a que termine cada transferencia antes de continuar el procesamiento.

Durante la generación, el motor debe gestionar los fallos de caché. Transferir un experto mediante PCIe puede ser beneficioso en un sistema, mientras que calcularlo directamente en la CPU puede ser mejor en otro. La política Q-star mide el equilibrio local entre el ancho de banda de la RAM y el de PCIe, y selecciona una división adecuada para la carga de trabajo actual.

MecanismoFunciónBeneficio principalDependencia principal
Caché LRU globalMantiene disponibles los expertos utilizados recientementeMejora la reutilización entre tokensLocalidad de los expertos y tamaño de la caché
Ejecución Q-starElige la transferencia a la GPU o la ejecución en la CPU para los fallosSe adapta a distintas configuraciones de hardwareAncho de banda de la RAM y PCIe
Doble búferTransmite futuros expertos durante los cálculos actualesReduce las pausas visibles por transferenciasCompatibilidad con transferencias y cálculos simultáneos
Formato FTWCarga los pesos en la disposición requerida por el motorReduce el trabajo de reorganización inicialDisponibilidad del modelo en un formato compatible con FTW
Anclajes semánticosConserva estados útiles y puntos de control de la caché KVPuede reducir los recálculos repetidos del contextoContexto agéntico y comportamiento de la caché

El motor también incluye puntos de control de anclajes semánticos para el estado recurrente y las cachés de clave-valor. Su objetivo es reducir los recálculos redundantes del contexto cuando los flujos de trabajo agénticos modifican el contexto mediante llamadas a herramientas o bloques de razonamiento.

Conoce los límites de la carga de trabajo

FreeToken no es un reemplazo universal para todos los motores de inferencia local. Su caso más sólido es un modelo MoE que supera el umbral de VRAM disponible sin convertir la ejecución en la CPU en el cuello de botella.

Pasos de configuración de la aplicación FreeToken

El proyecto oficial admite una aplicación de escritorio para Windows y Linux, además de una instalación de la CLI basada en Python. Elige una ruta según cómo planees utilizar el runtime.

1

Comprueba el perfil de hardware

Revisa la VRAM disponible de la GPU, la RAM del sistema, la conectividad PCIe y la compatibilidad del sistema operativo. FreeToken está diseñado para equipos de consumo, pero los modelos frontera muy grandes todavía pueden superar la capacidad de un ordenador de sobremesa potente.

2

Elige la interfaz

Selecciona la aplicación de escritorio para Windows o Linux si quieres una configuración guiada, visibilidad de los modelos y un uso orientado al chat. Selecciona la CLI cuando necesites scripts, integración con proyectos o comandos de evaluación comparativa repetibles.

3

Instala la CLI cuando sea necesario

El repositorio oficial recomienda instalar el paquete acelerado con uv pip install "freetoken[accel]". La compilación desde el código fuente también está documentada mediante el flujo de trabajo del entorno virtual del repositorio.

4

Carga un modelo MoE adecuado

Comienza con un modelo demasiado grande para una carga completa cómoda en la GPU, pero que siga siendo realista para tu RAM y almacenamiento. Confirma que el formato del modelo y los requisitos del runtime sean compatibles.

5

Ajusta y mide

Ejecuta un prompt o una tarea de programación coherente y compara después la velocidad, la estabilidad y el comportamiento de la memoria. Cambia el tamaño de la caché de expertos de la GPU durante una prueba con el servidor activo cuando necesites estudiar la curva de rendimiento.

Ruta de configuraciónRecomendada paraVentajaLimitación
Aplicación de escritorioNuevos usuarios y supervisión visualInterfaz guiada y visión general de los modelosEl flujo de trabajo actual de la aplicación es más limitado para operaciones con archivos de proyecto
CLI con uvDesarrolladores y evaluadoresProgramable y configurableRequiere familiaridad con la línea de comandos
Compilación desde el código fuenteColaboradores y usuarios avanzadosAcceso directo al código del proyectoMayor responsabilidad de configuración y mantenimiento

La aplicación de escritorio aparece actualmente disponible para Windows y Linux. Puede mostrar qué modelos parecen viables para el sistema local, pero su flujo de trabajo actual puede no ofrecer las mismas capacidades de gestión de carpetas de proyecto o modificación de archivos que una integración orientada a la programación.

Recomendación de configuración

Realiza una prueba pequeña y repetible antes de comprometerte con un modelo grande. Una evaluación comparativa breve puede revelar si las transferencias, el trabajo de la CPU o los fallos de caché están limitando tu sistema.

Comparación y ajuste del rendimiento

La decisión más importante es determinar si el modelo cabe cómodamente en la memoria de la GPU. Si cabe, una configuración convencional con el modelo completamente residente en la GPU puede ser más rápida, ya que evita la sobrecarga de transmisión y programación de FreeToken. Si el modelo supera la VRAM, FreeToken puede mantener los cálculos matemáticos en la GPU mientras transfiere únicamente los expertos necesarios.

Una comparación publicada entre estaciones de trabajo ilustra esta diferencia. Con un modelo Qwen de 8 bits estimado en unos 38 GB sobre una GPU de 32 GB, una configuración con división por capas alcanzó aproximadamente 58 tokens por segundo, mientras que FreeToken alcanzó aproximadamente 132 tokens por segundo en la misma tarea de programación. La duración de la tarea fue de unos 14 minutos y 20 segundos frente a 4 minutos y 40 segundos.

La misma comparación mostró un resultado diferente con una versión de 4 bits que cabía dentro de 32 GB de VRAM. La configuración completamente residente en la GPU alcanzó aproximadamente 240 tokens por segundo, mientras que FreeToken alcanzó aproximadamente 225 tokens por segundo. Estas cifras son específicas del hardware y de la carga de trabajo, no objetivos universales.

EscenarioResultado observadoEnfoque preferido
Modelo MoE de 8 bits demasiado grandeFreeToken alcanzó unos 132 tokens/seg en la prueba citadaProbar FreeToken primero
Comparación con división por capasEl runtime alternativo alcanzó unos 58 tokens/segLínea base útil
Modelo de 4 bits más pequeño que cabe en la VRAMLa configuración completamente en GPU alcanzó unos 240 tokens/segPreferir la ruta más sencilla completamente en GPU
Caché de FreeToken reducida del 58 % al 40 %La pérdida de velocidad fue de aproximadamente un 7 % en la prueba citadaConsiderar una caché más pequeña
Caché reducida por debajo de aproximadamente el 20 %El rendimiento disminuyó bruscamente en la prueba citadaEvitar reducirla demasiado

FreeToken también permite cambiar el tamaño de su caché de expertos de la GPU mientras el servidor está en ejecución. En la prueba citada, reducir la caché del 58 % al 40 % solo provocó una reducción moderada de la velocidad, mientras que bajar de aproximadamente el 20 % produjo una caída mucho más pronunciada al saturarse el tráfico PCIe.

Cabe completamente en la VRAM

Prefiere un runtime que pueda mantener el modelo completamente en la GPU y evitar una sobrecarga innecesaria de transmisión.

Ligero exceso de VRAM

FreeToken puede recuperar rendimiento almacenando en caché los expertos activos y adaptando la ejecución CPU–GPU.

Enlace PCIe limitado

Espera una mayor sensibilidad a los fallos de caché y al volumen de transferencias, especialmente con una caché de expertos pequeña.

Mucha RAM del sistema

La RAM adicional ayuda a contener el modelo completo, pero no elimina las limitaciones de ancho de banda.

Lee las evaluaciones comparativas con atención

Los resultados en tokens por segundo dependen de la cuantización del modelo, la longitud del prompt, el hardware, el tamaño de la caché y el tipo de tarea. Utiliza las cifras publicadas como puntos de comparación, no como resultados garantizados.

Lista de comprobación práctica y preguntas frecuentes

Utiliza esta lista antes de evaluar un modelo local grande. Se centra en la compatibilidad y la medición, en lugar de asumir que el modelo más grande disponible será la mejor opción.

Lista de comprobación previa:

  • Confirma la compatibilidad con Windows o Linux de la interfaz seleccionada
  • Mide la VRAM disponible de la GPU y la RAM del sistema
  • Verifica que el modelo objetivo sea una carga de trabajo compatible de Mezcla de Expertos
  • Ejecuta el mismo prompt o tarea de programación para comparar cada runtime
  • Registra el tamaño de la caché, la velocidad de generación, la estabilidad y el comportamiento de las transferencias
Punto de controlQué verificarAcción recomendada
Sistema operativoCompatibilidad de la aplicación de escritorioUsa Windows o Linux para la interfaz gráfica
Arquitectura del modeloEnrutamiento MoE y pesos compatiblesNo asumas que los modelos densos obtendrán el mismo beneficio
Equilibrio de memoriaVRAM frente al tamaño total del modeloPrueba la transmisión cuando el modelo supere la VRAM
Velocidad de conexiónComportamiento de las transferencias PCIeVigila la saturación durante los fallos de caché
Método de evaluaciónLa misma tarea y el mismo promptCompara los runtimes bajo condiciones equivalentes

Q: ¿Para qué está diseñada la aplicación FreeToken?

Está diseñada para la inferencia local con grandes modelos de Mezcla de Expertos con pesos abiertos, utilizando GPU y CPU de consumo, memoria del sistema e interconexiones.

Q: ¿Debería usar FreeToken cuando mi modelo cabe completamente en la VRAM?

No necesariamente. Un modelo completamente residente en la GPU puede ser más rápido porque evita la sobrecarga de transmisión y programación que utiliza FreeToken.

Q: ¿FreeToken funciona únicamente mediante una interfaz de escritorio?

No. FreeToken ofrece una aplicación de escritorio para Windows y Linux, además de una CLI que puede instalarse con el paquete acelerado documentado.

Q: ¿Puedo cambiar la caché de expertos de la GPU sin reiniciar?

El motor admite cambiar en vivo el tamaño de la caché de expertos de la GPU en un servidor en ejecución, lo que permite probar las compensaciones entre memoria y velocidad sin reiniciar.

Recomendación editorial

Comienza con las instrucciones del repositorio oficial, lleva un registro de la configuración de tu hardware y modelo, y evalúa FreeToken mediante pruebas locales realizadas bajo condiciones equivalentes.