FreeToken deploy: Guía paso a paso para configurar la IA local - Arquitectura

FreeToken deploy: Guía paso a paso para configurar la IA local

Aprende a implementar FreeToken en Windows o Linux, preparar tu hardware, ejecutar modelos MoE locales y solucionar problemas comunes de configuración.

2026-08-31
Equipo de Wiki de FreeToken
Guía rápida
  • FreeToken deploy permite ejecutar modelos locales de Mixture-of-Experts en hardware de escritorio compatible.
  • La configuración de escritorio es compatible con Windows y Linux e incluye una interfaz gráfica para modelos y chats.
  • La planificación del hardware depende de la memoria de la GPU, la RAM del sistema, el ancho de banda de memoria y el tamaño del modelo.
  • La instalación mediante CLI utiliza uv o pip para quienes prefieren una configuración basada en terminal.
  • El ajuste del rendimiento comienza con la selección del modelo, el control de los procesos en segundo plano y la disponibilidad de RAM.

Descripción general de FreeToken deploy

FreeToken deploy es una configuración de servicio de IA local para ejecutar modelos de Mixture-of-Experts de pesos abiertos en hardware de consumo. En lugar de considerar la GPU como el único recurso, FreeToken coordina la memoria de la GPU, la RAM del sistema, los recursos de la CPU y el ancho de banda de interconexión disponible. Este diseño facilita el uso de modelos grandes en un equipo de escritorio, aunque la experiencia final depende en gran medida del modelo y de la configuración del hardware.

El repositorio oficial de FreeToken en GitHub describe el proyecto como un motor de servicio MoE nativo para dispositivos edge. Su runtime incluye coejecución CPU–GPU adaptada al ancho de banda, streaming de prefill con doble búfer, caché global de expertos, ejecución compatible con grafos y el formato de pesos rápidos FTW.

Aspectos destacados del vídeo:

  • Métodos de instalación de escritorio para Windows y Linux
  • Carga de modelos locales con una sola GPU de alta memoria
  • Requisitos de RAM del sistema para modelos MoE grandes
  • Conexión a una interfaz de chat basada en navegador
  • Comprobaciones prácticas de rendimiento mediante tokens por segundo

La aplicación de escritorio es el punto de partida más sencillo porque gestiona gran parte de la configuración del motor y ofrece un flujo de trabajo gráfico para descargar modelos, iniciar un endpoint, chatear y ajustar las opciones del runtime. La ruta mediante línea de comandos ofrece más control y es más adecuada para implementaciones repetibles, entornos de desarrollo y usuarios que desean inspeccionar los registros directamente.

Ruta de implementaciónIdeal paraVentaja principalLimitación principal
Aplicación de escritorioUsuarios nuevosConfiguración guiada y controles gráficosMenor visibilidad de la configuración de bajo nivel
CLI con uvDesarrolladores y usuarios avanzadosEntornos repetibles y comandos flexiblesRequiere familiaridad con la terminal
Compilación desde el código fuenteColaboradores y evaluadoresAcceso directo a los archivos del proyectoRequiere más configuración y gestión de dependencias
Escritorio más interfaz de chatUso local interactivoRuta rápida desde el inicio del motor hasta la conversaciónEl rendimiento varía según el modelo y la distribución de la memoria
Punto de partida recomendado

Comienza con la aplicación de escritorio si tu objetivo es probar un modelo rápidamente. Pasa a la CLI después de comprender los requisitos de tu modelo, memoria y endpoint.

Planificación del hardware y del modelo

La parte más importante de una implementación exitosa de FreeToken es adaptar el modelo a la memoria disponible. Una sola GPU puede proporcionar una inferencia local útil, pero la RAM del sistema se vuelve esencial cuando el modelo seleccionado no cabe por completo en la VRAM. Los modelos MoE grandes también pueden beneficiarse de un ancho de banda de memoria elevado, ya que los pesos de los expertos y los datos del runtime se transfieren entre la memoria del host y la GPU.

Un plan de implementación práctico debería registrar cuatro valores antes de la instalación:

  • VRAM de la GPU y capacidad de cómputo
  • RAM total del sistema y RAM libre utilizable
  • Generación de la RAM y velocidad efectiva de memoria
  • Huella de memoria prevista del modelo

Las pruebas de referencia utilizaron una sola RTX 3090 y demostraron un rendimiento interactivo con un modelo MoE grande, pero la tasa de salida comunicada varió según los expertos activos y las condiciones del runtime. Las configuraciones de escritorio y del lado del servidor también produjeron resultados diferentes, por lo que las expectativas de los benchmarks deben mantenerse flexibles.

RecursoPor qué es importanteRecomendación de implementación
VRAM de la GPUContiene los datos del modelo y la memoria de trabajo activaMás VRAM puede reducir las transferencias desde la memoria del host
RAM del sistemaPermite almacenar pesos descargados y modelos más grandes64 GB es un objetivo más sólido que una configuración mínima
Ancho de banda de memoriaAfecta al movimiento de datos entre CPU y GPUUna RAM más rápida puede mejorar las cargas de trabajo con mucho offload
CPUAdmite la orquestación y la ejecución en el lado del hostMantén suficiente margen para el sistema operativo
AlmacenamientoContiene las aplicaciones y los archivos de modelosUsa almacenamiento rápido si cambias de modelo con frecuencia

La experiencia de prueba mostró que una sola 3090 podía ejecutar un modelo MoE exigente cuando se combinaba con una cantidad considerable de memoria del host. También demostró por qué la elección del modelo es importante: un modelo denso 27B BF16 no pudo iniciarse en la configuración probada, mientras que otro modelo grande necesitó considerablemente más RAM del sistema y VRAM combinadas.

MoE pequeño o moderado

Es más fácil de iniciar en una sola GPU. Es una opción práctica para validar la instalación y la conexión con el endpoint.

Modelo MoE grande

Puede utilizar la RAM del host y la caché de expertos para superar la capacidad de la VRAM, pero el ancho de banda y la memoria disponible se vuelven críticos.

Modelo BF16 denso

Puede requerir mucha más memoria que un modelo MoE con activación selectiva de expertos. Confirma la compatibilidad antes de descargarlo.

Perfil del modeloComportamiento de la memoriaRiesgo durante la implementaciónMejor primera acción
MoE con expertos selectivosUtiliza los expertos activos durante la generaciónLa velocidad puede variar entre promptsComienza con una conversación de prueba breve
MoE grande con offloadUtiliza conjuntamente la VRAM de la GPU y la RAM del sistemaMemoria utilizable insuficienteCierra primero las aplicaciones en segundo plano
BF16 denso 27BMantiene una huella de modelo denso más grandeEl motor puede cerrarse o no iniciarseComprueba los registros y la memoria disponible
Modelo frontier muy grandePuede superar la capacidad habitual de un equipo de escritorioEl iniciador informa de RAM insuficienteUtiliza una estación de trabajo con más memoria
Advertencia sobre la memoria

No evalúes la compatibilidad basándote únicamente en la RAM total instalada. FreeToken necesita RAM y VRAM utilizables después de tener en cuenta el sistema operativo, las aplicaciones de escritorio y los demás procesos.

Implementación de FreeToken paso a paso

El siguiente proceso funciona como una ruta general de implementación para la aplicación de escritorio. Mantén el primer inicio bajo control: utiliza un modelo que se ajuste a la memoria disponible, evita las cargas de trabajo innecesarias en segundo plano y confirma que el servidor API esté listo antes de abrir un cliente de chat.

1

Elige la ruta de instalación

Descarga la aplicación de escritorio para Windows o Linux desde la página oficial de distribución de FreeToken, o prepara un entorno de Python para la ruta CLI. La aplicación de escritorio es la opción más sencilla para una implementación inicial porque incluye el flujo de configuración principal y ofrece controles gráficos para los modelos.

2

Prepara el sistema host

Cierra las aplicaciones que consuman mucha memoria antes de iniciar un modelo grande. La grabación de pantalla, las pestañas del navegador, las máquinas virtuales y las herramientas aceleradas por GPU pueden competir por la memoria o afectar a los recursos disponibles del codificador y los gráficos. Confirma que el sistema tenga suficiente RAM libre para el modelo que deseas probar.

3

Instala o inicia FreeToken

Para una instalación mediante CLI, la documentación del proyecto indica uv pip install "freetoken[accel]" como el comando recomendado para instalar el paquete. Los usuarios avanzados pueden clonar el repositorio, crear un entorno virtual e instalar el proyecto en modo editable.

4

Selecciona un modelo compatible

Abre la sección de modelos, elige un modelo descargado o compatible y revisa sus requisitos de memoria. Comienza con un modelo que deje margen disponible en lugar de utilizar inmediatamente la opción más grande. Si el iniciador informa de RAM insuficiente, selecciona un modelo más pequeño o cambia a un sistema con más memoria.

5

Verifica el endpoint

Inicia el motor y espera a que el servidor API indique que está listo. Después, conecta la vista de chat integrada o una interfaz externa como Open WebUI. Envía primero un prompt corto, comprueba el comportamiento de generación y solo después pasa a un contexto más largo o a los ajustes máximos de razonamiento.

Etapa de implementaciónSeñal de éxitoSi falla
InstalaciónLa aplicación se abre o el paquete termina de instalarseRevisa las dependencias de la plataforma y los registros de instalación
Carga del modeloEl modelo comienza a ocupar la memoria previstaComprueba la compatibilidad del modelo y la RAM utilizable
Inicio de la APIEl servidor API está listoReinicia el motor e inspecciona la salida del servidor
Conexión del chatEl prompt recibe una respuestaConfirma la dirección del endpoint y la configuración del cliente
BenchmarkMedición estable de la generaciónRepite la prueba con prompts más cortos y menos tareas en segundo plano

Para los usuarios que prefieren un flujo de trabajo mediante terminal, el repositorio admite la instalación con uv o pip, y ofrece la instalación desde el código fuente para desarrollo. Mantén el entorno aislado para que los cambios en las dependencias no interfieran con otros proyectos de IA local.

Comprobación del inicio

Considera que “el servidor API está listo” es el hito de la implementación. Cuando aparezca ese mensaje, verifica el endpoint con un prompt corto antes de cambiar los ajustes avanzados.

Ajuste y pruebas del rendimiento

El rendimiento de FreeToken no se representa mediante una única cifra fija. La velocidad de generación cambia según los expertos activos, la arquitectura del modelo, la longitud del prompt, la ubicación de la memoria y la configuración del runtime. En las pruebas de referencia, una configuración produjo aproximadamente entre 10 y 11 tokens por segundo para una carga de trabajo interactiva, mientras que una configuración de escritorio obtuvo un resultado inferior, cercano a 8,8 tokens por segundo, con una disposición de prueba diferente. Estas cifras son ejemplos útiles, no garantías universales.

Utiliza una rutina de prueba repetible:

  1. Reinicia o vuelve a cargar el mismo modelo.
  2. Envía el mismo prompt corto.
  3. Espera a que termine la primera respuesta.
  4. Registra el procesamiento del prompt y el comportamiento de generación.
  5. Repite la prueba antes de comparar el hardware o las interfaces.
VariableEfecto probableAjuste práctico
Expertos activosLa tasa de generación puede cambiar entre promptsPrueba varios prompts antes de sacar conclusiones
Velocidad de la RAM del sistemaAfecta al ancho de banda del offloadPrefiere una memoria con mayor ancho de banda cuando sea posible
Cargas de trabajo de la GPU en segundo planoReduce los recursos disponiblesDetén las tareas de grabación, renderizado o GPU no relacionadas
Longitud del contextoAumenta la demanda de memoria y procesamientoComienza con conversaciones cortas
Modo de razonamientoAñade trabajo de razonamiento adicionalPrueba el modo normal antes de utilizar los ajustes máximos
Interfaz del clientePuede añadir sobrecarga o mostrar métricas diferentesCompara utilizando el mismo prompt y modelo

El comportamiento de la caché del runtime es especialmente importante para las cargas de trabajo MoE. La caché de expertos puede reducir las cargas repetidas, mientras que la caché con conciencia semántica está diseñada para evitar el recálculo redundante del contexto en flujos de trabajo agénticos compatibles. Sin embargo, el comportamiento de la caché sigue dependiendo de la memoria disponible y de la carga de trabajo. Si el sistema comienza a expulsar datos con frecuencia, la generación puede volverse menos consistente.

Prueba de referencia

Utiliza un modelo, un prompt y un cliente. Registra el resultado antes de realizar cambios.

Prueba de memoria

Observa la RAM del sistema y la VRAM mientras el modelo se carga y genera texto.

Prueba de interfaz

Compara el acceso de escritorio y del lado del servidor solo después de confirmar que los ajustes del modelo son idénticos.

Prueba de estabilidad

Ejecuta varios prompts para identificar cierres inesperados, expulsiones de datos o velocidades de salida inconsistentes.

Consejos para los benchmarks

Los tokens por segundo pueden variar considerablemente entre prompts. Utiliza pruebas repetidas e informa conjuntamente del modelo, el hardware, la interfaz y la configuración de memoria.

Solución de problemas y lista de comprobación de implementación

Un inicio fallido no siempre indica que la instalación esté defectuosa. Las causas más comunes son formatos de modelo no compatibles, memoria utilizable insuficiente, problemas con las dependencias o competencia por los recursos de otras aplicaciones. FreeToken se describe como software beta en el flujo de trabajo probado, por lo que algunos problemas de compatibilidad pueden requerir un reinicio, una revisión de los registros o un informe de incidencia.

Utiliza esta tabla de solución de problemas para delimitar el problema:

SíntomaCausa probableRespuesta sugerida
El motor se cierra inesperadamenteProblema de compatibilidad del modelo o error del runtimeReinicia, prueba otro modelo e inspecciona los registros del servidor
Mensaje de RAM insuficienteLa VRAM y la RAM combinadas no son suficientesCierra aplicaciones o selecciona un modelo más pequeño
Velocidad de generación bajaOffload a la memoria del host o límite de ancho de bandaReduce la carga de trabajo y compara la configuración de memoria
El cliente de chat no puede conectarseEl endpoint de la API no está listo o la dirección es incorrectaEspera a que esté listo y verifica los ajustes del endpoint
El rendimiento cambia entre promptsSe activan expertos diferentesEjecuta varios prompts antes de evaluar la velocidad
El inicio de escritorio es más lentoSobrecarga de la interfaz o de la plataformaCompara con el mismo modelo mediante otra ruta compatible

Lista previa al inicio:

  • Confirma el sistema operativo y la ruta de instalación
  • Comprueba la VRAM disponible de la GPU y la RAM utilizable del sistema
  • Elige un modelo que se ajuste al presupuesto de memoria combinado
  • Cierra las aplicaciones en segundo plano que utilicen recursos de CPU, RAM o GPU
  • Espera a que el servidor API indique que está listo antes de conectar un cliente de chat

Para realizar implementaciones repetibles, guarda el nombre del modelo, la versión de la aplicación, el sistema operativo, la configuración de memoria y los ajustes del cliente en cada prueba. Esto facilita distinguir una limitación del modelo de un problema de instalación. Si un modelo falla repetidamente mientras otro se inicia correctamente, conserva los registros sin modificar del servidor antes de abrir una incidencia del proyecto.

La ruta de actualización más segura es incremental:

  • Valida la instalación con un modelo compatible y manejable.
  • Confirma el funcionamiento del chat y del endpoint.
  • Prueba los modelos que consumen mucha memoria de uno en uno.
  • Cambia solo una variable de rendimiento en cada benchmark.
  • Conserva un modelo conocido y funcional para realizar comparaciones.
Consejo de recuperación

Cuando un modelo falle, no reinstales todo inmediatamente. Primero prueba un modelo conocido como compatible, comprueba la memoria utilizable y revisa los registros sin modificar del motor.

Preguntas frecuentes sobre FreeToken Deploy

Q: ¿Para qué está diseñado FreeToken deploy?

FreeToken deploy ejecuta localmente modelos de Mixture-of-Experts de pesos abiertos mediante la coordinación de los recursos de la GPU, la CPU, la RAM del sistema y el ancho de banda de interconexión. Su objetivo es acercar la ejecución de modelos grandes al hardware de escritorio.

Q: ¿Puede FreeToken ejecutarse en una sola GPU?

Sí, una sola GPU con mucha memoria puede ejecutar modelos compatibles cuando hay suficiente RAM del sistema disponible para el offload. El resultado práctico depende de la arquitectura del modelo, el ancho de banda de memoria, los expertos activos y el uso del sistema en segundo plano.

Q: ¿Debería utilizar la aplicación de escritorio o la CLI?

Utiliza la aplicación de escritorio para disfrutar de la configuración, selección de modelos y flujo de chat más sencillos. Utiliza la CLI cuando necesites entornos aislados, comandos repetibles, acceso al código fuente o un control más directo de los registros y las dependencias.

Q: ¿Por qué puede funcionar un modelo mientras otro falla?

Los modelos tienen diferentes huellas de memoria, formatos, arquitecturas y requisitos de compatibilidad. Un modelo BF16 denso puede requerir más memoria que un modelo MoE, y la compatibilidad beta del runtime también puede provocar que un motor específico se cierre inesperadamente.

El mejor hábito de implementación consiste en tratar FreeToken como un motor de inferencia local configurable, no como un ajuste de rendimiento de un solo clic. Comienza con un modelo realista, confirma el endpoint, mide utilizando prompts repetibles y amplía gradualmente las pruebas a medida que comprendas los límites de tu sistema.

Conclusión

Una configuración fiable de FreeToken se consigue adaptando el modelo a la memoria utilizable, validando el endpoint de la API y ajustando el rendimiento mediante pruebas controladas.