- FreeToken deploy permite ejecutar modelos locales de Mixture-of-Experts en hardware de escritorio compatible.
- La configuración de escritorio es compatible con Windows y Linux e incluye una interfaz gráfica para modelos y chats.
- La planificación del hardware depende de la memoria de la GPU, la RAM del sistema, el ancho de banda de memoria y el tamaño del modelo.
- La instalación mediante CLI utiliza
uvopippara quienes prefieren una configuración basada en terminal. - El ajuste del rendimiento comienza con la selección del modelo, el control de los procesos en segundo plano y la disponibilidad de RAM.
Descripción general de FreeToken deploy
FreeToken deploy es una configuración de servicio de IA local para ejecutar modelos de Mixture-of-Experts de pesos abiertos en hardware de consumo. En lugar de considerar la GPU como el único recurso, FreeToken coordina la memoria de la GPU, la RAM del sistema, los recursos de la CPU y el ancho de banda de interconexión disponible. Este diseño facilita el uso de modelos grandes en un equipo de escritorio, aunque la experiencia final depende en gran medida del modelo y de la configuración del hardware.
El repositorio oficial de FreeToken en GitHub describe el proyecto como un motor de servicio MoE nativo para dispositivos edge. Su runtime incluye coejecución CPU–GPU adaptada al ancho de banda, streaming de prefill con doble búfer, caché global de expertos, ejecución compatible con grafos y el formato de pesos rápidos FTW.
Aspectos destacados del vídeo:
- Métodos de instalación de escritorio para Windows y Linux
- Carga de modelos locales con una sola GPU de alta memoria
- Requisitos de RAM del sistema para modelos MoE grandes
- Conexión a una interfaz de chat basada en navegador
- Comprobaciones prácticas de rendimiento mediante tokens por segundo
La aplicación de escritorio es el punto de partida más sencillo porque gestiona gran parte de la configuración del motor y ofrece un flujo de trabajo gráfico para descargar modelos, iniciar un endpoint, chatear y ajustar las opciones del runtime. La ruta mediante línea de comandos ofrece más control y es más adecuada para implementaciones repetibles, entornos de desarrollo y usuarios que desean inspeccionar los registros directamente.
| Ruta de implementación | Ideal para | Ventaja principal | Limitación principal |
|---|---|---|---|
| Aplicación de escritorio | Usuarios nuevos | Configuración guiada y controles gráficos | Menor visibilidad de la configuración de bajo nivel |
CLI con uv | Desarrolladores y usuarios avanzados | Entornos repetibles y comandos flexibles | Requiere familiaridad con la terminal |
| Compilación desde el código fuente | Colaboradores y evaluadores | Acceso directo a los archivos del proyecto | Requiere más configuración y gestión de dependencias |
| Escritorio más interfaz de chat | Uso local interactivo | Ruta rápida desde el inicio del motor hasta la conversación | El rendimiento varía según el modelo y la distribución de la memoria |
Comienza con la aplicación de escritorio si tu objetivo es probar un modelo rápidamente. Pasa a la CLI después de comprender los requisitos de tu modelo, memoria y endpoint.
Planificación del hardware y del modelo
La parte más importante de una implementación exitosa de FreeToken es adaptar el modelo a la memoria disponible. Una sola GPU puede proporcionar una inferencia local útil, pero la RAM del sistema se vuelve esencial cuando el modelo seleccionado no cabe por completo en la VRAM. Los modelos MoE grandes también pueden beneficiarse de un ancho de banda de memoria elevado, ya que los pesos de los expertos y los datos del runtime se transfieren entre la memoria del host y la GPU.
Un plan de implementación práctico debería registrar cuatro valores antes de la instalación:
- VRAM de la GPU y capacidad de cómputo
- RAM total del sistema y RAM libre utilizable
- Generación de la RAM y velocidad efectiva de memoria
- Huella de memoria prevista del modelo
Las pruebas de referencia utilizaron una sola RTX 3090 y demostraron un rendimiento interactivo con un modelo MoE grande, pero la tasa de salida comunicada varió según los expertos activos y las condiciones del runtime. Las configuraciones de escritorio y del lado del servidor también produjeron resultados diferentes, por lo que las expectativas de los benchmarks deben mantenerse flexibles.
| Recurso | Por qué es importante | Recomendación de implementación |
|---|---|---|
| VRAM de la GPU | Contiene los datos del modelo y la memoria de trabajo activa | Más VRAM puede reducir las transferencias desde la memoria del host |
| RAM del sistema | Permite almacenar pesos descargados y modelos más grandes | 64 GB es un objetivo más sólido que una configuración mínima |
| Ancho de banda de memoria | Afecta al movimiento de datos entre CPU y GPU | Una RAM más rápida puede mejorar las cargas de trabajo con mucho offload |
| CPU | Admite la orquestación y la ejecución en el lado del host | Mantén suficiente margen para el sistema operativo |
| Almacenamiento | Contiene las aplicaciones y los archivos de modelos | Usa almacenamiento rápido si cambias de modelo con frecuencia |
La experiencia de prueba mostró que una sola 3090 podía ejecutar un modelo MoE exigente cuando se combinaba con una cantidad considerable de memoria del host. También demostró por qué la elección del modelo es importante: un modelo denso 27B BF16 no pudo iniciarse en la configuración probada, mientras que otro modelo grande necesitó considerablemente más RAM del sistema y VRAM combinadas.
MoE pequeño o moderado
Es más fácil de iniciar en una sola GPU. Es una opción práctica para validar la instalación y la conexión con el endpoint.
Modelo MoE grande
Puede utilizar la RAM del host y la caché de expertos para superar la capacidad de la VRAM, pero el ancho de banda y la memoria disponible se vuelven críticos.
Modelo BF16 denso
Puede requerir mucha más memoria que un modelo MoE con activación selectiva de expertos. Confirma la compatibilidad antes de descargarlo.
| Perfil del modelo | Comportamiento de la memoria | Riesgo durante la implementación | Mejor primera acción |
|---|---|---|---|
| MoE con expertos selectivos | Utiliza los expertos activos durante la generación | La velocidad puede variar entre prompts | Comienza con una conversación de prueba breve |
| MoE grande con offload | Utiliza conjuntamente la VRAM de la GPU y la RAM del sistema | Memoria utilizable insuficiente | Cierra primero las aplicaciones en segundo plano |
| BF16 denso 27B | Mantiene una huella de modelo denso más grande | El motor puede cerrarse o no iniciarse | Comprueba los registros y la memoria disponible |
| Modelo frontier muy grande | Puede superar la capacidad habitual de un equipo de escritorio | El iniciador informa de RAM insuficiente | Utiliza una estación de trabajo con más memoria |
No evalúes la compatibilidad basándote únicamente en la RAM total instalada. FreeToken necesita RAM y VRAM utilizables después de tener en cuenta el sistema operativo, las aplicaciones de escritorio y los demás procesos.
Implementación de FreeToken paso a paso
El siguiente proceso funciona como una ruta general de implementación para la aplicación de escritorio. Mantén el primer inicio bajo control: utiliza un modelo que se ajuste a la memoria disponible, evita las cargas de trabajo innecesarias en segundo plano y confirma que el servidor API esté listo antes de abrir un cliente de chat.
Elige la ruta de instalación
Descarga la aplicación de escritorio para Windows o Linux desde la página oficial de distribución de FreeToken, o prepara un entorno de Python para la ruta CLI. La aplicación de escritorio es la opción más sencilla para una implementación inicial porque incluye el flujo de configuración principal y ofrece controles gráficos para los modelos.
Prepara el sistema host
Cierra las aplicaciones que consuman mucha memoria antes de iniciar un modelo grande. La grabación de pantalla, las pestañas del navegador, las máquinas virtuales y las herramientas aceleradas por GPU pueden competir por la memoria o afectar a los recursos disponibles del codificador y los gráficos. Confirma que el sistema tenga suficiente RAM libre para el modelo que deseas probar.
Instala o inicia FreeToken
Para una instalación mediante CLI, la documentación del proyecto indica uv pip install "freetoken[accel]" como el comando recomendado para instalar el paquete. Los usuarios avanzados pueden clonar el repositorio, crear un entorno virtual e instalar el proyecto en modo editable.
Selecciona un modelo compatible
Abre la sección de modelos, elige un modelo descargado o compatible y revisa sus requisitos de memoria. Comienza con un modelo que deje margen disponible en lugar de utilizar inmediatamente la opción más grande. Si el iniciador informa de RAM insuficiente, selecciona un modelo más pequeño o cambia a un sistema con más memoria.
Verifica el endpoint
Inicia el motor y espera a que el servidor API indique que está listo. Después, conecta la vista de chat integrada o una interfaz externa como Open WebUI. Envía primero un prompt corto, comprueba el comportamiento de generación y solo después pasa a un contexto más largo o a los ajustes máximos de razonamiento.
| Etapa de implementación | Señal de éxito | Si falla |
|---|---|---|
| Instalación | La aplicación se abre o el paquete termina de instalarse | Revisa las dependencias de la plataforma y los registros de instalación |
| Carga del modelo | El modelo comienza a ocupar la memoria prevista | Comprueba la compatibilidad del modelo y la RAM utilizable |
| Inicio de la API | El servidor API está listo | Reinicia el motor e inspecciona la salida del servidor |
| Conexión del chat | El prompt recibe una respuesta | Confirma la dirección del endpoint y la configuración del cliente |
| Benchmark | Medición estable de la generación | Repite la prueba con prompts más cortos y menos tareas en segundo plano |
Para los usuarios que prefieren un flujo de trabajo mediante terminal, el repositorio admite la instalación con uv o pip, y ofrece la instalación desde el código fuente para desarrollo. Mantén el entorno aislado para que los cambios en las dependencias no interfieran con otros proyectos de IA local.
Considera que “el servidor API está listo” es el hito de la implementación. Cuando aparezca ese mensaje, verifica el endpoint con un prompt corto antes de cambiar los ajustes avanzados.
Ajuste y pruebas del rendimiento
El rendimiento de FreeToken no se representa mediante una única cifra fija. La velocidad de generación cambia según los expertos activos, la arquitectura del modelo, la longitud del prompt, la ubicación de la memoria y la configuración del runtime. En las pruebas de referencia, una configuración produjo aproximadamente entre 10 y 11 tokens por segundo para una carga de trabajo interactiva, mientras que una configuración de escritorio obtuvo un resultado inferior, cercano a 8,8 tokens por segundo, con una disposición de prueba diferente. Estas cifras son ejemplos útiles, no garantías universales.
Utiliza una rutina de prueba repetible:
- Reinicia o vuelve a cargar el mismo modelo.
- Envía el mismo prompt corto.
- Espera a que termine la primera respuesta.
- Registra el procesamiento del prompt y el comportamiento de generación.
- Repite la prueba antes de comparar el hardware o las interfaces.
| Variable | Efecto probable | Ajuste práctico |
|---|---|---|
| Expertos activos | La tasa de generación puede cambiar entre prompts | Prueba varios prompts antes de sacar conclusiones |
| Velocidad de la RAM del sistema | Afecta al ancho de banda del offload | Prefiere una memoria con mayor ancho de banda cuando sea posible |
| Cargas de trabajo de la GPU en segundo plano | Reduce los recursos disponibles | Detén las tareas de grabación, renderizado o GPU no relacionadas |
| Longitud del contexto | Aumenta la demanda de memoria y procesamiento | Comienza con conversaciones cortas |
| Modo de razonamiento | Añade trabajo de razonamiento adicional | Prueba el modo normal antes de utilizar los ajustes máximos |
| Interfaz del cliente | Puede añadir sobrecarga o mostrar métricas diferentes | Compara utilizando el mismo prompt y modelo |
El comportamiento de la caché del runtime es especialmente importante para las cargas de trabajo MoE. La caché de expertos puede reducir las cargas repetidas, mientras que la caché con conciencia semántica está diseñada para evitar el recálculo redundante del contexto en flujos de trabajo agénticos compatibles. Sin embargo, el comportamiento de la caché sigue dependiendo de la memoria disponible y de la carga de trabajo. Si el sistema comienza a expulsar datos con frecuencia, la generación puede volverse menos consistente.
Prueba de referencia
Utiliza un modelo, un prompt y un cliente. Registra el resultado antes de realizar cambios.
Prueba de memoria
Observa la RAM del sistema y la VRAM mientras el modelo se carga y genera texto.
Prueba de interfaz
Compara el acceso de escritorio y del lado del servidor solo después de confirmar que los ajustes del modelo son idénticos.
Prueba de estabilidad
Ejecuta varios prompts para identificar cierres inesperados, expulsiones de datos o velocidades de salida inconsistentes.
Los tokens por segundo pueden variar considerablemente entre prompts. Utiliza pruebas repetidas e informa conjuntamente del modelo, el hardware, la interfaz y la configuración de memoria.
Solución de problemas y lista de comprobación de implementación
Un inicio fallido no siempre indica que la instalación esté defectuosa. Las causas más comunes son formatos de modelo no compatibles, memoria utilizable insuficiente, problemas con las dependencias o competencia por los recursos de otras aplicaciones. FreeToken se describe como software beta en el flujo de trabajo probado, por lo que algunos problemas de compatibilidad pueden requerir un reinicio, una revisión de los registros o un informe de incidencia.
Utiliza esta tabla de solución de problemas para delimitar el problema:
| Síntoma | Causa probable | Respuesta sugerida |
|---|---|---|
| El motor se cierra inesperadamente | Problema de compatibilidad del modelo o error del runtime | Reinicia, prueba otro modelo e inspecciona los registros del servidor |
| Mensaje de RAM insuficiente | La VRAM y la RAM combinadas no son suficientes | Cierra aplicaciones o selecciona un modelo más pequeño |
| Velocidad de generación baja | Offload a la memoria del host o límite de ancho de banda | Reduce la carga de trabajo y compara la configuración de memoria |
| El cliente de chat no puede conectarse | El endpoint de la API no está listo o la dirección es incorrecta | Espera a que esté listo y verifica los ajustes del endpoint |
| El rendimiento cambia entre prompts | Se activan expertos diferentes | Ejecuta varios prompts antes de evaluar la velocidad |
| El inicio de escritorio es más lento | Sobrecarga de la interfaz o de la plataforma | Compara con el mismo modelo mediante otra ruta compatible |
Lista previa al inicio:
- Confirma el sistema operativo y la ruta de instalación
- Comprueba la VRAM disponible de la GPU y la RAM utilizable del sistema
- Elige un modelo que se ajuste al presupuesto de memoria combinado
- Cierra las aplicaciones en segundo plano que utilicen recursos de CPU, RAM o GPU
- Espera a que el servidor API indique que está listo antes de conectar un cliente de chat
Para realizar implementaciones repetibles, guarda el nombre del modelo, la versión de la aplicación, el sistema operativo, la configuración de memoria y los ajustes del cliente en cada prueba. Esto facilita distinguir una limitación del modelo de un problema de instalación. Si un modelo falla repetidamente mientras otro se inicia correctamente, conserva los registros sin modificar del servidor antes de abrir una incidencia del proyecto.
La ruta de actualización más segura es incremental:
- Valida la instalación con un modelo compatible y manejable.
- Confirma el funcionamiento del chat y del endpoint.
- Prueba los modelos que consumen mucha memoria de uno en uno.
- Cambia solo una variable de rendimiento en cada benchmark.
- Conserva un modelo conocido y funcional para realizar comparaciones.
Cuando un modelo falle, no reinstales todo inmediatamente. Primero prueba un modelo conocido como compatible, comprueba la memoria utilizable y revisa los registros sin modificar del motor.
Preguntas frecuentes sobre FreeToken Deploy
Q: ¿Para qué está diseñado FreeToken deploy?
FreeToken deploy ejecuta localmente modelos de Mixture-of-Experts de pesos abiertos mediante la coordinación de los recursos de la GPU, la CPU, la RAM del sistema y el ancho de banda de interconexión. Su objetivo es acercar la ejecución de modelos grandes al hardware de escritorio.
Q: ¿Puede FreeToken ejecutarse en una sola GPU?
Sí, una sola GPU con mucha memoria puede ejecutar modelos compatibles cuando hay suficiente RAM del sistema disponible para el offload. El resultado práctico depende de la arquitectura del modelo, el ancho de banda de memoria, los expertos activos y el uso del sistema en segundo plano.
Q: ¿Debería utilizar la aplicación de escritorio o la CLI?
Utiliza la aplicación de escritorio para disfrutar de la configuración, selección de modelos y flujo de chat más sencillos. Utiliza la CLI cuando necesites entornos aislados, comandos repetibles, acceso al código fuente o un control más directo de los registros y las dependencias.
Q: ¿Por qué puede funcionar un modelo mientras otro falla?
Los modelos tienen diferentes huellas de memoria, formatos, arquitecturas y requisitos de compatibilidad. Un modelo BF16 denso puede requerir más memoria que un modelo MoE, y la compatibilidad beta del runtime también puede provocar que un motor específico se cierre inesperadamente.
El mejor hábito de implementación consiste en tratar FreeToken como un motor de inferencia local configurable, no como un ajuste de rendimiento de un solo clic. Comienza con un modelo realista, confirma el endpoint, mide utilizando prompts repetibles y amplía gradualmente las pruebas a medida que comprendas los límites de tu sistema.
Una configuración fiable de FreeToken se consigue adaptando el modelo a la memoria utilizable, validando el endpoint de la API y ajustando el rendimiento mediante pruebas controladas.