Motor de inferencia MoE nativo del edge

Wiki de FreeToken

Ejecuta localmente modelos MoE open-weight de vanguardia en GPUs NVIDIA de consumo, con ejecución adaptativa CPU-GPU, caché eficiente, cuantización y APIs compatibles con OpenAI o Anthropic.

Ver en GitHub

FreeToken Guías de la wiki

Todo lo que necesitas para instalar, configurar y ejecutar grandes modelos MoE localmente con FreeToken

Latest Updates

Discover the newest guides, tips, and content

Modelo FreeToken 290b: Guía de configuración de Edge MoE 2026

Aprende cómo FreeToken sirve modelos MoE de escala avanzada en hardware de consumo mediante caché adaptativa, programación del ancho de banda y memoria elástica.

25 ago 2026performance
Read more →
FreeToken con 4 GB de VRAM: guía de configuración y límites de hardware

Descubre cómo FreeToken gestiona la VRAM limitada, la descarga en la CPU, la caché de expertos y los requisitos de hardware realistas para servir MoE localmente.

25 ago 2026hardware
Read more →
Modelo FreeToken 753b: guía de configuración y consejos de ajuste de MoE

Descubre cómo FreeToken ejecuta localmente GLM-5.2 de 753B, incluyendo la configuración, la paginación de memoria, la caché de MoE, las pruebas de rendimiento y consejos prácticos de ajuste.

25 ago 2026performance
Read more →
FreeToken anthropic api: Guía de configuración paso a paso

Configura el acceso a la API de Anthropic para un proyecto FreeToken con claves seguras, variables de entorno, pruebas de solicitudes y consejos para resolver problemas.

25 ago 2026api
Read more →
FreeToken api: Guía de configuración del servicio MoE local 2026

Aprende cómo FreeToken ejecuta localmente modelos MoE de escala avanzada mediante caché de expertos, ejecución adaptativa en CPU-GPU y gestión elástica de memoria.

25 ago 2026api
Read more →
Servidor API de FreeToken: guía de configuración y consejos de ejecución

Descubre cómo el servidor API de FreeToken gestiona la caché MoE, la ejecución CPU-GPU, las comprobaciones de hardware y las decisiones prácticas para el servicio local.

25 ago 2026api
Read more →
Benchmark de FreeToken: guía de configuración para servir MoE localmente

Analiza el benchmark de FreeToken, el diseño del servicio MoE local, los requisitos de hardware, el proceso de instalación y los resultados de rendimiento medidos.

25 ago 2026performance
Read more →
FreeToken claude code: Guía de configuración para el enrutamiento de modelos

Configura FreeToken claude code con una puerta de enlace local, enrutamiento de modelos, proveedores de respaldo y prácticas seguras de resolución de problemas.

25 ago 2026agents
Read more →
FreeToken codex: Guía de configuración, benchmarks y límites

FreeToken codex explicado: descubre cómo funciona su sistema de memoria consciente de los expertos, revisa sus benchmarks, límites de hardware, consideraciones de configuración y ventajas y desventajas de la IA local.

25 ago 2026agents
Read more →
FreeToken deepseek: Guía de configuración y benchmarks de IA local

Aprende cómo FreeToken sirve DeepSeek localmente mediante caché MoE, descarga entre CPU y GPU, orientación sobre hardware, pasos de configuración y notas de rendimiento.

25 ago 2026models
Read more →
FreeToken deepseek v4 flash: Guía de configuración local 2026

Configura DeepSeek V4 Flash con FreeToken para inferencia de IA local, incluida la planificación de RAM, las expectativas de GPU, el acceso a Open WebUI y la resolución de problemas.

25 ago 2026models
Read more →
Servicio MoE nativo del edge de FreeToken: Guía de arquitectura

Descubre cómo FreeToken utiliza ejecución adaptativa al ancho de banda, almacenamiento en caché y coordinación entre CPU y GPU para servir modelos MoE grandes en hardware edge.

25 ago 2026architecture
Read more →
Install

Guía de instalación de FreeToken

Configura FreeToken con la aplicación de escritorio, uv, PyPI o el código fuente y, después, inicia tu primer servidor de modelos local. Los usuarios de GPUs NVIDIA pueden instalar el paquete de Python acelerado, comprobar el ancho de banda del sistema e iniciar un servidor compatible con OpenAI mediante la CLI de ft.

1

Comprueba el sistema host

Usa un PC con Windows o Linux y una GPU NVIDIA compatible. FreeToken está orientado a sistemas con las series RTX 30, RTX 40 y RTX 50, y puede combinar la memoria de la GPU con la RAM del sistema para ejecutar modelos grandes.

2

Instala la aplicación de escritorio

Para una configuración sencilla, descarga e instala la aplicación de escritorio de FreeToken para Windows o Linux. El flujo de trabajo de escritorio ofrece una vía gráfica para configurar y servir modelos locales.

3

Instala con uv

Instala el paquete acelerado de FreeToken en tu entorno de Python con uv.

uv pip install "freetoken[accel]"
4

Instala desde PyPI

El mismo paquete acelerado puede instalarse mediante un flujo de trabajo estándar de paquetes de Python cuando no se utiliza uv.

pip install "freetoken[accel]"
5

Instala desde el código fuente

Clona el repositorio de FreeToken cuando necesites la versión de desarrollo o quieras trabajar directamente con el árbol de código fuente; después, instala el proyecto y sus dependencias de aceleración.

git clone https://github.com/FlashML-org/FreeToken.git
6

Mide el ancho de banda del host

Ejecuta el benchmark de ancho de banda integrado antes de servir checkpoints MoE muy grandes. FreeToken utiliza el resultado para ayudar a determinar con qué eficacia pueden trabajar conjuntamente la memoria de la CPU y la GPU.

ft bench bw
7

Inicia el servidor de modelos

Inicia el flujo de servicio de FreeToken con ft serve. El servidor expone la inferencia local mediante interfaces compatibles con OpenAI y Anthropic para aplicaciones y agentes de programación.

ft serve
8

Verifica la primera ejecución

Confirma que el modelo seleccionado se carga, que el servidor permanece activo y que una solicitud a la API local puede devolver una salida generada antes de conectar clientes externos como Codex, Claude Code u OpenCode.

Quick Tips

  • El extra freetoken[accel] instala la pila de aceleración de GPU necesaria para hardware de clase RTX.
  • Ejecuta ft bench bw una vez antes de usar tu primer modelo grande para que FreeToken pueda elegir una estrategia de ejecución eficiente.
  • La aplicación de escritorio y la CLI de ft utilizan el mismo motor, por lo que puedes cambiar libremente entre ambas.
  • Mantén CUDA y los controladores de NVIDIA actualizados para evitar errores de kernels y de compatibilidad dentro del paquete acelerado.
Models

Modelos compatibles con FreeToken

FreeToken está diseñado en torno a grandes modelos dispersos de Mixture-of-Experts cuyo número total de parámetros puede superar la memoria de una única GPU de consumo. Sus backends de ejecución combinan cómputo de GPU, memoria del sistema, caché de expertos y gestión de checkpoints específica para cada modelo, haciendo que estos modelos sean prácticos en equipos locales.

ModeloEscalaFormato del checkpointCuantizaciónBackendIdeal para
GLM-5.2753B de parámetros totalesCheckpoint MoE de GLMMXFP4 / NVFP4 / FP8 / BF16MoE híbrido / descarga de expertosServicio en estaciones de trabajo de gran capacidad
DeepSeek-V4-FlashMoE disperso grandeCheckpoint MoE de DeepSeekMXFP4 / NVFP4 / FP8 / BF16MoE híbrido / descarga de expertosRazonamiento local y cargas de trabajo con agentes
Qwen3.6MoE disperso de clase 35B-A3BCheckpoint MoE de QwenMXFP4 / NVFP4 / FP8 / BF16Backend de servicio MoEChat local, programación y agentes
Qwen3 MoEMúltiples tamaños dispersosCheckpoints MoE de QwenMXFP4 / NVFP4 / FP8 / BF16Backend de servicio MoEInferencia local de propósito general
gpt-ossMúltiples tamaños de checkpointCheckpoint de gpt-ossMXFP4 / NVFP4 / FP8 / BF16Backend de servicio de modelos dispersosFlujos de trabajo de aplicaciones compatibles con OpenAI
Gemma-4Depende del modeloCheckpoint de GemmaMXFP4 / NVFP4 / FP8 / BF16Backend adecuado para el modeloInferencia local de propósito general
MiniMaxMoE disperso grandeCheckpoint de MiniMaxMXFP4 / NVFP4 / FP8 / BF16MoE híbrido / descarga de expertosCargas de trabajo con agentes y contextos extensos

Quick Tips

  • Todas las familias principales son compatibles con checkpoints de baja precisión MXFP4 y NVFP4, además de FP8 y BF16.
  • Elige la cuantización comparando el tamaño del checkpoint con tu presupuesto combinado de VRAM y RAM del sistema.
  • La ejecución MoE híbrida es adecuada para los checkpoints más grandes; los modelos dispersos más pequeños pueden permanecer en mayor medida en la GPU.
  • Se añaden nuevas familias de modelos con regularidad, así que consulta la documentación de modelos con cada versión del motor.
Hardware

Requisitos de hardware de FreeToken

FreeToken no requiere que el modelo completo quepa en la VRAM de la GPU. Su ejecución CPU-GPU adaptativa al ancho de banda, la caché de expertos y la gestión elástica de memoria permiten que los checkpoints MoE utilicen tanto la memoria de la GPU como la RAM del host, por lo que la memoria del sistema y el ancho de banda PCIe son tan importantes como la capacidad bruta de la GPU.

ComponenteRequisitoPor qué es importante
Sistema operativoWindows o LinuxAmbas plataformas son compatibles con la aplicación de escritorio y el flujo de servicio local.
Familia de GPUSeries NVIDIA RTX 30 / 40 / 50Las GPUs más nuevas ofrecen más VRAM y margen de cómputo para conjuntos de expertos activos más grandes.
VRAM de la GPUDepende del modelo, la precisión y la cachéUna mayor VRAM mantiene los pesos activos y los expertos en caché en la GPU, reduciendo las transferencias.
RAM del sistemaAlta capacidad para checkpoints MoE grandesLa RAM del host almacena los pesos que superan la VRAM, permitiendo checkpoints mucho más grandes.
Ancho de banda de memoria de la CPUCuanto mayor, mejor para la descargaLa ejecución adaptativa al ancho de banda utiliza el rendimiento medido de la memoria del host.
Ancho de banda PCIeSe recomiendan transferencias rápidasDetermina la rapidez con la que los pesos de los expertos se mueven entre la RAM y la VRAM.
CUDA y controladoresRuntime de NVIDIA compatibleEs necesario para la ejecución acelerada en GPU mediante freetoken[accel].
Modelos de clase 290B+RAM del host considerable y una GPU RTXLa ejecución híbrida CPU-GPU elimina la necesidad de que el modelo quepa en la VRAM.
Checkpoints más grandesRAM de estación de trabajo, almacenamiento y ancho de bandaPermite servir modelos dispersos de escala vanguardista, como GLM-5.2 de 753B de parámetros.

Quick Tips

  • La serie RTX 30 funciona bien con checkpoints de tamaño medio y una cuantización más agresiva.
  • La serie RTX 40 ofrece un mejor rendimiento de inferencia y una mayor eficiencia de memoria para cargas de trabajo MoE híbridas.
  • La serie RTX 50 es adecuada para formatos de baja precisión NVFP4 y despliegues más grandes de alto rendimiento.
  • La memoria del sistema de doble canal o superior mejora directamente la velocidad de entrega de los expertos descargados.
Benchmarks

Benchmarks de FreeToken

El rendimiento de FreeToken depende de más que la capacidad de cómputo de la GPU, porque los checkpoints MoE grandes pueden mover continuamente los expertos entre la memoria del sistema y la GPU. Sus herramientas de benchmarking miden el ancho de banda disponible en una máquina específica y ayudan al runtime a elegir entre un offload más intensivo y una ejecución híbrida con más componentes residentes en la GPU.

BenchmarkComandoMidePor qué importa
Ancho de banda de la memoria de la CPUft bench bwRendimiento de la memoria del sistemaLos pesos de los expertos descargados se leen desde la RAM del sistema, por lo que el ancho de banda mejora directamente la entrega de expertos.
Ancho de banda de CPU a GPUft bench bwRendimiento de transferencia por PCIeDetermina la velocidad a la que los pesos llegan a la GPU cuando no están ya en la VRAM.
Rendimiento de decodificaciónft serveTokens generados por segundoVelocidad de generación interactiva después del procesamiento del prompt.
Rendimiento de prefillft serveRendimiento del procesamiento del promptEl streaming de prefill con doble búfer solapa el movimiento y el cómputo para prompts largos.
Uso de memoria de la GPUft serveVRAM para pesos, cachés y estadoLa gestión elástica de la VRAM mantiene el modelo residente dentro del presupuesto de memoria.
Uso de memoria del sistemaft serveRAM para el checkpoint y los expertosLa gran capacidad del host permite servir checkpoints mucho mayores que la VRAM de la GPU.
Eficiencia de la caché de expertosft serveReutilización de expertos residentes en la GPULa caché LRU global reduce las transferencias repetidas de CPU a GPU.
Ejecución con offloadft bench bwProporción de expertos residentes en el hostFunciona mejor con un ancho de banda sólido de memoria de la CPU y PCIe, incluso con VRAM limitada.
Ejecución híbrida MoEft bench bwCombinación de expertos en GPU y hostEquilibra la capacidad de VRAM, la localidad de la caché y el ancho de banda de transferencia.
Perfil de portátil de consumoft bench bwLímites del ancho de banda móvilAyuda a elegir checkpoints más pequeños o más cuantizados para la memoria del portátil.
Perfil de PC gamingft bench bwRTX de escritorio + RAM + PCIeLa configuración habitual de FreeToken en sistemas con RTX 30, 40 y 50.
Perfil de workstationft bench bwAlta capacidad en todos los componentesAdmite checkpoints dispersos de escala frontier mediante la cooperación entre CPU y GPU.

Quick Tips

  • Ejecuta ft bench bw en cada máquina nueva antes de elegir una estrategia de ejecución.
  • La velocidad de decodificación sigue de cerca el ancho de banda del host cuando la mayoría de los expertos están descargados.
  • La ejecución híbrida normalmente supera al offload puro cuando suficientes expertos caben en la VRAM.
  • Compara el prefill y la decodificación conjuntamente, ya que las cargas de trabajo con contextos largos ejercen presión sobre ambos.
Local API

Guía de la API de FreeToken

FreeToken expone la inferencia de modelos locales mediante formatos de API conocidos. Después de cargar un modelo compatible con ft serve, las aplicaciones pueden descubrir modelos, enviar solicitudes de chat o a la Responses API, usar mensajes con el estilo de Anthropic y transmitir tokens generados desde el servidor local.

Inicia el proceso de servicio de FreeToken con un modelo compatible. El servidor gestiona la carga del modelo, la ejecución CPU-GPU, la asignación de memoria y las solicitudes a la API HTTP.

ft serve <model>

Completados de chat de OpenAI

Compatible con OpenAI

Usa el endpoint de completados de chat compatible con OpenAI junto con SDK existentes o clientes HTTP.

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "messages": [
      {"role": "user", "content": "Explica los modelos de mezcla de expertos."}
    ]
  }'

Responses API de OpenAI

Compatible con OpenAI

Las aplicaciones basadas en la nueva Responses API de OpenAI pueden enviar solicitudes al endpoint local correspondiente.

curl http://localhost:8000/v1/responses \
  -H "Content-Type: application/json" \
  -d '{
    "model": "<model>",
    "input": "Escribe una función corta de Python que invierta una lista."
  }'

Enumerar modelos disponibles

Compatible con OpenAI

Consulta el endpoint de modelos compatible con OpenAI para ver los modelos expuestos por el servidor de FreeToken en ejecución.

curl http://localhost:8000/v1/models

Messages API de Anthropic

Compatible con Anthropic

FreeToken también proporciona una interfaz de mensajes compatible con Anthropic para clientes y herramientas de programación diseñados en torno a la API de Anthropic.

curl http://localhost:8000/v1/messages \
  -H "Content-Type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "<model>",
    "max_tokens": 512,
    "messages": [
      {"role": "user", "content": "Resume la arquitectura de este repositorio."}
    ]
  }'

Respuestas en streaming

SSE

Activa el streaming cuando el cliente admita salida incremental enviada por el servidor, para que los tokens generados puedan consumirse a medida que llegan.

{
  "model": "<model>",
  "messages": [
    {"role": "user", "content": "Escribe un ejemplo de API REST."}
  ],
  "stream": true
}

Configuración del servidor

CLI

Usa la configuración de ft serve para seleccionar el modelo y controlar cómo se expone el servicio HTTP local, incluidos el host, el puerto y los ajustes de memoria.

ft serve --help

Inspeccionar las opciones de la CLI

CLI

FreeToken mantiene disponibles directamente desde la ayuda de la línea de comandos las opciones actuales del servicio y del runtime, incluidas las opciones añadidas por versiones más recientes del motor.

ft --help
ft serve --help
Coding Agents

Configuración de Claude Code y Codex con FreeToken

FreeToken puede actuar como backend de inferencia local para herramientas de programación agéntica que entienden API compatibles con OpenAI o Anthropic. El flujo de trabajo de ft launch ayuda a configurar agentes compatibles, mientras que el modo de simulación permite inspeccionar la configuración prevista antes de cambiar o iniciar cualquier elemento.

1

Instalar y verificar FreeToken

Asegúrate de que la CLI de FreeToken esté instalada y de que se pueda cargar localmente un modelo compatible antes de conectar un agente de programación externo.

ft --help
2

Comprobar las opciones de inicio del agente

Usa la ayuda del comando de inicio para consultar las integraciones de agentes compatibles actualmente y sus opciones de configuración disponibles.

ft launch --help
3

Obtener una vista previa mediante una simulación

Usa el modo de simulación antes de iniciar un agente cuando quieras inspeccionar el comando generado y la configuración del entorno sin iniciar el flujo de trabajo final.

ft launch <agent> --dry-run
4

Iniciar el agente de programación

Inicia el agente de programación seleccionado mediante FreeToken para que su configuración de API apunte al backend de inferencia local.

ft launch <agent>
5

Claude Code

Claude Code puede usar la interfaz compatible con Anthropic de FreeToken. La configuración local redirige el tráfico de mensajes de Anthropic compatible al servidor de FreeToken, preservando el flujo de trabajo del agente.

ft launch claude
6

Codex

Los clientes de estilo Codex pueden conectarse mediante los endpoints compatibles con OpenAI de FreeToken, lo que permite que un modelo servido localmente gestione las solicitudes del agente.

ft launch codex
7

OpenCode, Hermes y OpenClaw

El flujo de trabajo de inicio de FreeToken también admite clientes adicionales de programación y agentes autónomos, como OpenCode, Hermes y OpenClaw. Consulta la ayuda de inicio para conocer los nombres de integración y las opciones actuales.

ft launch --help
8

Evitar el fallback a una API en la nube

Verifica la configuración del proveedor y de la URL base del agente antes de comenzar una tarea larga. Elimina o desactiva la configuración no deseada del proveedor en la nube cuando el objetivo sea una inferencia completamente local, y usa el modo de simulación para inspeccionar el entorno que FreeToken pasará al agente.

ft launch <agent> --dry-run

Quick Tips

  • Ejecuta siempre una vez la vista previa de simulación antes del primer inicio real de un agente nuevo.
  • Mantén el servidor de FreeToken en ejecución mientras los agentes trabajan, ya que las sesiones largas se vuelven a conectar al mismo endpoint.
  • Comprueba la URL base del proveedor después de la configuración para confirmar que las solicitudes llegan al servidor local y no a una API alojada.
  • Los nombres de las integraciones evolucionan con las versiones del motor, así que vuelve a comprobar ft launch --help después de actualizar.
How It Works

Arquitectura de FreeToken

FreeToken está diseñado en torno a la estructura dispersa de los modelos de mezcla de expertos. En lugar de exigir que todos los pesos de los expertos permanezcan en la memoria de la GPU, coordina la ejecución entre CPU y GPU, almacena en caché los expertos utilizados con frecuencia, solapa las transferencias con el cómputo y adapta el uso de memoria a la máquina que ejecuta el modelo.

FreeToken decide cómo dividir el cómputo de los expertos entre los recursos de la CPU y la GPU, en lugar de tratar la VRAM de la GPU como la única memoria utilizable para el modelo. Su estrategia de ejecución tiene en cuenta el ancho de banda disponible entre CPU y GPU y las características del hardware, equilibrando el cómputo y el movimiento de datos entre la memoria del sistema y el procesamiento de la GPU.
Release Tracker

Actualizaciones y versiones de FreeToken

FreeToken evoluciona tanto en su motor de inferencia como en la experiencia de escritorio. El seguimiento de versiones se centra en los cambios que afectan directamente a la instalación, la compatibilidad de modelos, el servicio local, la compatibilidad con GPU, el rendimiento y los flujos de trabajo de agentes.

Las versiones publicadas de FreeToken son el lugar principal para consultar los cambios empaquetados del motor y las notas de versión. Consulta cada versión al actualizar, especialmente cuando modifique la compatibilidad de modelos, los formatos de checkpoint, el comportamiento del servicio, los requisitos de instalación o el rendimiento del runtime.

Follow FreeToken Development

Track new releases and join the community through the official channels: