Wiki de FreeToken
Ejecuta localmente modelos MoE open-weight de vanguardia en GPUs NVIDIA de consumo, con ejecución adaptativa CPU-GPU, caché eficiente, cuantización y APIs compatibles con OpenAI o Anthropic.
FreeToken Guías de la wiki
Todo lo que necesitas para instalar, configurar y ejecutar grandes modelos MoE localmente con FreeToken
Latest Updates
Discover the newest guides, tips, and content
Modelo FreeToken 290b: Guía de configuración de Edge MoE 2026
Aprende cómo FreeToken sirve modelos MoE de escala avanzada en hardware de consumo mediante caché adaptativa, programación del ancho de banda y memoria elástica.
FreeToken con 4 GB de VRAM: guía de configuración y límites de hardware
Descubre cómo FreeToken gestiona la VRAM limitada, la descarga en la CPU, la caché de expertos y los requisitos de hardware realistas para servir MoE localmente.
Modelo FreeToken 753b: guía de configuración y consejos de ajuste de MoE
Descubre cómo FreeToken ejecuta localmente GLM-5.2 de 753B, incluyendo la configuración, la paginación de memoria, la caché de MoE, las pruebas de rendimiento y consejos prácticos de ajuste.
FreeToken anthropic api: Guía de configuración paso a paso
Configura el acceso a la API de Anthropic para un proyecto FreeToken con claves seguras, variables de entorno, pruebas de solicitudes y consejos para resolver problemas.
FreeToken api: Guía de configuración del servicio MoE local 2026
Aprende cómo FreeToken ejecuta localmente modelos MoE de escala avanzada mediante caché de expertos, ejecución adaptativa en CPU-GPU y gestión elástica de memoria.
Servidor API de FreeToken: guía de configuración y consejos de ejecución
Descubre cómo el servidor API de FreeToken gestiona la caché MoE, la ejecución CPU-GPU, las comprobaciones de hardware y las decisiones prácticas para el servicio local.
Benchmark de FreeToken: guía de configuración para servir MoE localmente
Analiza el benchmark de FreeToken, el diseño del servicio MoE local, los requisitos de hardware, el proceso de instalación y los resultados de rendimiento medidos.
FreeToken claude code: Guía de configuración para el enrutamiento de modelos
Configura FreeToken claude code con una puerta de enlace local, enrutamiento de modelos, proveedores de respaldo y prácticas seguras de resolución de problemas.
FreeToken codex: Guía de configuración, benchmarks y límites
FreeToken codex explicado: descubre cómo funciona su sistema de memoria consciente de los expertos, revisa sus benchmarks, límites de hardware, consideraciones de configuración y ventajas y desventajas de la IA local.
FreeToken deepseek: Guía de configuración y benchmarks de IA local
Aprende cómo FreeToken sirve DeepSeek localmente mediante caché MoE, descarga entre CPU y GPU, orientación sobre hardware, pasos de configuración y notas de rendimiento.
FreeToken deepseek v4 flash: Guía de configuración local 2026
Configura DeepSeek V4 Flash con FreeToken para inferencia de IA local, incluida la planificación de RAM, las expectativas de GPU, el acceso a Open WebUI y la resolución de problemas.
Servicio MoE nativo del edge de FreeToken: Guía de arquitectura
Descubre cómo FreeToken utiliza ejecución adaptativa al ancho de banda, almacenamiento en caché y coordinación entre CPU y GPU para servir modelos MoE grandes en hardware edge.
Guía de instalación de FreeToken
Configura FreeToken con la aplicación de escritorio, uv, PyPI o el código fuente y, después, inicia tu primer servidor de modelos local. Los usuarios de GPUs NVIDIA pueden instalar el paquete de Python acelerado, comprobar el ancho de banda del sistema e iniciar un servidor compatible con OpenAI mediante la CLI de ft.
Comprueba el sistema host
Usa un PC con Windows o Linux y una GPU NVIDIA compatible. FreeToken está orientado a sistemas con las series RTX 30, RTX 40 y RTX 50, y puede combinar la memoria de la GPU con la RAM del sistema para ejecutar modelos grandes.
Instala la aplicación de escritorio
Para una configuración sencilla, descarga e instala la aplicación de escritorio de FreeToken para Windows o Linux. El flujo de trabajo de escritorio ofrece una vía gráfica para configurar y servir modelos locales.
Instala con uv
Instala el paquete acelerado de FreeToken en tu entorno de Python con uv.
uv pip install "freetoken[accel]"Instala desde PyPI
El mismo paquete acelerado puede instalarse mediante un flujo de trabajo estándar de paquetes de Python cuando no se utiliza uv.
pip install "freetoken[accel]"Instala desde el código fuente
Clona el repositorio de FreeToken cuando necesites la versión de desarrollo o quieras trabajar directamente con el árbol de código fuente; después, instala el proyecto y sus dependencias de aceleración.
git clone https://github.com/FlashML-org/FreeToken.gitMide el ancho de banda del host
Ejecuta el benchmark de ancho de banda integrado antes de servir checkpoints MoE muy grandes. FreeToken utiliza el resultado para ayudar a determinar con qué eficacia pueden trabajar conjuntamente la memoria de la CPU y la GPU.
ft bench bwInicia el servidor de modelos
Inicia el flujo de servicio de FreeToken con ft serve. El servidor expone la inferencia local mediante interfaces compatibles con OpenAI y Anthropic para aplicaciones y agentes de programación.
ft serveVerifica la primera ejecución
Confirma que el modelo seleccionado se carga, que el servidor permanece activo y que una solicitud a la API local puede devolver una salida generada antes de conectar clientes externos como Codex, Claude Code u OpenCode.
Quick Tips
- El extra freetoken[accel] instala la pila de aceleración de GPU necesaria para hardware de clase RTX.
- Ejecuta ft bench bw una vez antes de usar tu primer modelo grande para que FreeToken pueda elegir una estrategia de ejecución eficiente.
- La aplicación de escritorio y la CLI de ft utilizan el mismo motor, por lo que puedes cambiar libremente entre ambas.
- Mantén CUDA y los controladores de NVIDIA actualizados para evitar errores de kernels y de compatibilidad dentro del paquete acelerado.
Modelos compatibles con FreeToken
FreeToken está diseñado en torno a grandes modelos dispersos de Mixture-of-Experts cuyo número total de parámetros puede superar la memoria de una única GPU de consumo. Sus backends de ejecución combinan cómputo de GPU, memoria del sistema, caché de expertos y gestión de checkpoints específica para cada modelo, haciendo que estos modelos sean prácticos en equipos locales.
| Modelo | Escala | Formato del checkpoint | Cuantización | Backend | Ideal para |
|---|---|---|---|---|---|
| GLM-5.2 | 753B de parámetros totales | Checkpoint MoE de GLM | MXFP4 / NVFP4 / FP8 / BF16 | MoE híbrido / descarga de expertos | Servicio en estaciones de trabajo de gran capacidad |
| DeepSeek-V4-Flash | MoE disperso grande | Checkpoint MoE de DeepSeek | MXFP4 / NVFP4 / FP8 / BF16 | MoE híbrido / descarga de expertos | Razonamiento local y cargas de trabajo con agentes |
| Qwen3.6 | MoE disperso de clase 35B-A3B | Checkpoint MoE de Qwen | MXFP4 / NVFP4 / FP8 / BF16 | Backend de servicio MoE | Chat local, programación y agentes |
| Qwen3 MoE | Múltiples tamaños dispersos | Checkpoints MoE de Qwen | MXFP4 / NVFP4 / FP8 / BF16 | Backend de servicio MoE | Inferencia local de propósito general |
| gpt-oss | Múltiples tamaños de checkpoint | Checkpoint de gpt-oss | MXFP4 / NVFP4 / FP8 / BF16 | Backend de servicio de modelos dispersos | Flujos de trabajo de aplicaciones compatibles con OpenAI |
| Gemma-4 | Depende del modelo | Checkpoint de Gemma | MXFP4 / NVFP4 / FP8 / BF16 | Backend adecuado para el modelo | Inferencia local de propósito general |
| MiniMax | MoE disperso grande | Checkpoint de MiniMax | MXFP4 / NVFP4 / FP8 / BF16 | MoE híbrido / descarga de expertos | Cargas de trabajo con agentes y contextos extensos |
Quick Tips
- Todas las familias principales son compatibles con checkpoints de baja precisión MXFP4 y NVFP4, además de FP8 y BF16.
- Elige la cuantización comparando el tamaño del checkpoint con tu presupuesto combinado de VRAM y RAM del sistema.
- La ejecución MoE híbrida es adecuada para los checkpoints más grandes; los modelos dispersos más pequeños pueden permanecer en mayor medida en la GPU.
- Se añaden nuevas familias de modelos con regularidad, así que consulta la documentación de modelos con cada versión del motor.
Requisitos de hardware de FreeToken
FreeToken no requiere que el modelo completo quepa en la VRAM de la GPU. Su ejecución CPU-GPU adaptativa al ancho de banda, la caché de expertos y la gestión elástica de memoria permiten que los checkpoints MoE utilicen tanto la memoria de la GPU como la RAM del host, por lo que la memoria del sistema y el ancho de banda PCIe son tan importantes como la capacidad bruta de la GPU.
| Componente | Requisito | Por qué es importante |
|---|---|---|
| Sistema operativo | Windows o Linux | Ambas plataformas son compatibles con la aplicación de escritorio y el flujo de servicio local. |
| Familia de GPU | Series NVIDIA RTX 30 / 40 / 50 | Las GPUs más nuevas ofrecen más VRAM y margen de cómputo para conjuntos de expertos activos más grandes. |
| VRAM de la GPU | Depende del modelo, la precisión y la caché | Una mayor VRAM mantiene los pesos activos y los expertos en caché en la GPU, reduciendo las transferencias. |
| RAM del sistema | Alta capacidad para checkpoints MoE grandes | La RAM del host almacena los pesos que superan la VRAM, permitiendo checkpoints mucho más grandes. |
| Ancho de banda de memoria de la CPU | Cuanto mayor, mejor para la descarga | La ejecución adaptativa al ancho de banda utiliza el rendimiento medido de la memoria del host. |
| Ancho de banda PCIe | Se recomiendan transferencias rápidas | Determina la rapidez con la que los pesos de los expertos se mueven entre la RAM y la VRAM. |
| CUDA y controladores | Runtime de NVIDIA compatible | Es necesario para la ejecución acelerada en GPU mediante freetoken[accel]. |
| Modelos de clase 290B+ | RAM del host considerable y una GPU RTX | La ejecución híbrida CPU-GPU elimina la necesidad de que el modelo quepa en la VRAM. |
| Checkpoints más grandes | RAM de estación de trabajo, almacenamiento y ancho de banda | Permite servir modelos dispersos de escala vanguardista, como GLM-5.2 de 753B de parámetros. |
Quick Tips
- La serie RTX 30 funciona bien con checkpoints de tamaño medio y una cuantización más agresiva.
- La serie RTX 40 ofrece un mejor rendimiento de inferencia y una mayor eficiencia de memoria para cargas de trabajo MoE híbridas.
- La serie RTX 50 es adecuada para formatos de baja precisión NVFP4 y despliegues más grandes de alto rendimiento.
- La memoria del sistema de doble canal o superior mejora directamente la velocidad de entrega de los expertos descargados.
Benchmarks de FreeToken
El rendimiento de FreeToken depende de más que la capacidad de cómputo de la GPU, porque los checkpoints MoE grandes pueden mover continuamente los expertos entre la memoria del sistema y la GPU. Sus herramientas de benchmarking miden el ancho de banda disponible en una máquina específica y ayudan al runtime a elegir entre un offload más intensivo y una ejecución híbrida con más componentes residentes en la GPU.
| Benchmark | Comando | Mide | Por qué importa |
|---|---|---|---|
| Ancho de banda de la memoria de la CPU | ft bench bw | Rendimiento de la memoria del sistema | Los pesos de los expertos descargados se leen desde la RAM del sistema, por lo que el ancho de banda mejora directamente la entrega de expertos. |
| Ancho de banda de CPU a GPU | ft bench bw | Rendimiento de transferencia por PCIe | Determina la velocidad a la que los pesos llegan a la GPU cuando no están ya en la VRAM. |
| Rendimiento de decodificación | ft serve | Tokens generados por segundo | Velocidad de generación interactiva después del procesamiento del prompt. |
| Rendimiento de prefill | ft serve | Rendimiento del procesamiento del prompt | El streaming de prefill con doble búfer solapa el movimiento y el cómputo para prompts largos. |
| Uso de memoria de la GPU | ft serve | VRAM para pesos, cachés y estado | La gestión elástica de la VRAM mantiene el modelo residente dentro del presupuesto de memoria. |
| Uso de memoria del sistema | ft serve | RAM para el checkpoint y los expertos | La gran capacidad del host permite servir checkpoints mucho mayores que la VRAM de la GPU. |
| Eficiencia de la caché de expertos | ft serve | Reutilización de expertos residentes en la GPU | La caché LRU global reduce las transferencias repetidas de CPU a GPU. |
| Ejecución con offload | ft bench bw | Proporción de expertos residentes en el host | Funciona mejor con un ancho de banda sólido de memoria de la CPU y PCIe, incluso con VRAM limitada. |
| Ejecución híbrida MoE | ft bench bw | Combinación de expertos en GPU y host | Equilibra la capacidad de VRAM, la localidad de la caché y el ancho de banda de transferencia. |
| Perfil de portátil de consumo | ft bench bw | Límites del ancho de banda móvil | Ayuda a elegir checkpoints más pequeños o más cuantizados para la memoria del portátil. |
| Perfil de PC gaming | ft bench bw | RTX de escritorio + RAM + PCIe | La configuración habitual de FreeToken en sistemas con RTX 30, 40 y 50. |
| Perfil de workstation | ft bench bw | Alta capacidad en todos los componentes | Admite checkpoints dispersos de escala frontier mediante la cooperación entre CPU y GPU. |
Quick Tips
- Ejecuta ft bench bw en cada máquina nueva antes de elegir una estrategia de ejecución.
- La velocidad de decodificación sigue de cerca el ancho de banda del host cuando la mayoría de los expertos están descargados.
- La ejecución híbrida normalmente supera al offload puro cuando suficientes expertos caben en la VRAM.
- Compara el prefill y la decodificación conjuntamente, ya que las cargas de trabajo con contextos largos ejercen presión sobre ambos.
Guía de la API de FreeToken
FreeToken expone la inferencia de modelos locales mediante formatos de API conocidos. Después de cargar un modelo compatible con ft serve, las aplicaciones pueden descubrir modelos, enviar solicitudes de chat o a la Responses API, usar mensajes con el estilo de Anthropic y transmitir tokens generados desde el servidor local.
Inicia el proceso de servicio de FreeToken con un modelo compatible. El servidor gestiona la carga del modelo, la ejecución CPU-GPU, la asignación de memoria y las solicitudes a la API HTTP.
ft serve <model>
Completados de chat de OpenAI
Compatible con OpenAIUsa el endpoint de completados de chat compatible con OpenAI junto con SDK existentes o clientes HTTP.
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "<model>",
"messages": [
{"role": "user", "content": "Explica los modelos de mezcla de expertos."}
]
}'Responses API de OpenAI
Compatible con OpenAILas aplicaciones basadas en la nueva Responses API de OpenAI pueden enviar solicitudes al endpoint local correspondiente.
curl http://localhost:8000/v1/responses \
-H "Content-Type: application/json" \
-d '{
"model": "<model>",
"input": "Escribe una función corta de Python que invierta una lista."
}'Enumerar modelos disponibles
Compatible con OpenAIConsulta el endpoint de modelos compatible con OpenAI para ver los modelos expuestos por el servidor de FreeToken en ejecución.
curl http://localhost:8000/v1/models
Messages API de Anthropic
Compatible con AnthropicFreeToken también proporciona una interfaz de mensajes compatible con Anthropic para clientes y herramientas de programación diseñados en torno a la API de Anthropic.
curl http://localhost:8000/v1/messages \
-H "Content-Type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "<model>",
"max_tokens": 512,
"messages": [
{"role": "user", "content": "Resume la arquitectura de este repositorio."}
]
}'Respuestas en streaming
SSEActiva el streaming cuando el cliente admita salida incremental enviada por el servidor, para que los tokens generados puedan consumirse a medida que llegan.
{
"model": "<model>",
"messages": [
{"role": "user", "content": "Escribe un ejemplo de API REST."}
],
"stream": true
}Configuración del servidor
CLIUsa la configuración de ft serve para seleccionar el modelo y controlar cómo se expone el servicio HTTP local, incluidos el host, el puerto y los ajustes de memoria.
ft serve --help
Inspeccionar las opciones de la CLI
CLIFreeToken mantiene disponibles directamente desde la ayuda de la línea de comandos las opciones actuales del servicio y del runtime, incluidas las opciones añadidas por versiones más recientes del motor.
ft --help ft serve --help
Configuración de Claude Code y Codex con FreeToken
FreeToken puede actuar como backend de inferencia local para herramientas de programación agéntica que entienden API compatibles con OpenAI o Anthropic. El flujo de trabajo de ft launch ayuda a configurar agentes compatibles, mientras que el modo de simulación permite inspeccionar la configuración prevista antes de cambiar o iniciar cualquier elemento.
Instalar y verificar FreeToken
Asegúrate de que la CLI de FreeToken esté instalada y de que se pueda cargar localmente un modelo compatible antes de conectar un agente de programación externo.
ft --helpComprobar las opciones de inicio del agente
Usa la ayuda del comando de inicio para consultar las integraciones de agentes compatibles actualmente y sus opciones de configuración disponibles.
ft launch --helpObtener una vista previa mediante una simulación
Usa el modo de simulación antes de iniciar un agente cuando quieras inspeccionar el comando generado y la configuración del entorno sin iniciar el flujo de trabajo final.
ft launch <agent> --dry-runIniciar el agente de programación
Inicia el agente de programación seleccionado mediante FreeToken para que su configuración de API apunte al backend de inferencia local.
ft launch <agent>Claude Code
Claude Code puede usar la interfaz compatible con Anthropic de FreeToken. La configuración local redirige el tráfico de mensajes de Anthropic compatible al servidor de FreeToken, preservando el flujo de trabajo del agente.
ft launch claudeCodex
Los clientes de estilo Codex pueden conectarse mediante los endpoints compatibles con OpenAI de FreeToken, lo que permite que un modelo servido localmente gestione las solicitudes del agente.
ft launch codexOpenCode, Hermes y OpenClaw
El flujo de trabajo de inicio de FreeToken también admite clientes adicionales de programación y agentes autónomos, como OpenCode, Hermes y OpenClaw. Consulta la ayuda de inicio para conocer los nombres de integración y las opciones actuales.
ft launch --helpEvitar el fallback a una API en la nube
Verifica la configuración del proveedor y de la URL base del agente antes de comenzar una tarea larga. Elimina o desactiva la configuración no deseada del proveedor en la nube cuando el objetivo sea una inferencia completamente local, y usa el modo de simulación para inspeccionar el entorno que FreeToken pasará al agente.
ft launch <agent> --dry-runQuick Tips
- Ejecuta siempre una vez la vista previa de simulación antes del primer inicio real de un agente nuevo.
- Mantén el servidor de FreeToken en ejecución mientras los agentes trabajan, ya que las sesiones largas se vuelven a conectar al mismo endpoint.
- Comprueba la URL base del proveedor después de la configuración para confirmar que las solicitudes llegan al servidor local y no a una API alojada.
- Los nombres de las integraciones evolucionan con las versiones del motor, así que vuelve a comprobar ft launch --help después de actualizar.
Arquitectura de FreeToken
FreeToken está diseñado en torno a la estructura dispersa de los modelos de mezcla de expertos. En lugar de exigir que todos los pesos de los expertos permanezcan en la memoria de la GPU, coordina la ejecución entre CPU y GPU, almacena en caché los expertos utilizados con frecuencia, solapa las transferencias con el cómputo y adapta el uso de memoria a la máquina que ejecuta el modelo.
Actualizaciones y versiones de FreeToken
FreeToken evoluciona tanto en su motor de inferencia como en la experiencia de escritorio. El seguimiento de versiones se centra en los cambios que afectan directamente a la instalación, la compatibilidad de modelos, el servicio local, la compatibilidad con GPU, el rendimiento y los flujos de trabajo de agentes.
Follow FreeToken Development
Track new releases and join the community through the official channels: