FreeToken github: Guía de configuración local de MoE y benchmarks - Guía

FreeToken github: Guía de configuración local de MoE y benchmarks

Explora el proyecto FreeToken en GitHub, sus funciones de inferencia local de MoE, opciones de instalación, requisitos de hardware, benchmarks y consejos prácticos de configuración.

2026-08-25
Equipo de FreeToken
Guía rápida
  • FreeToken github: El repositorio oficial contiene la descripción del proyecto, las opciones de instalación, la cita académica y la licencia Apache 2.0.
  • Uso principal: FreeToken está orientado a modelos grandes de Mixture-of-Experts que superan la VRAM disponible de la GPU.
  • Ventaja principal: La ejecución adaptativa entre CPU y GPU, la caché de expertos y las transferencias superpuestas reducen el tiempo de inactividad del hardware.
  • Mejor opción para: Sistemas Nvidia con Linux, suficiente memoria del sistema y aceleración CUDA compatible.
  • Límite importante: FreeToken mejora la utilización, pero no elimina los requisitos de memoria total de un modelo.

Descripción general del repositorio de FreeToken github

FreeToken github es el hogar público de un motor de inferencia nativo para el edge, diseñado para ejecutar modelos Mixture-of-Experts de código abierto y escala puntera en hardware personal y de consumo. El proyecto combina la memoria de la GPU, la RAM del sistema, el procesamiento de la CPU y el ancho de banda de las interconexiones como una plataforma flexible de servicio, en lugar de tratar la GPU como un dispositivo aislado.

El repositorio oficial de FreeToken en GitHub ofrece la descripción del proyecto, información sobre la aplicación de escritorio, notas de instalación de la CLI, la cita de investigación, los agradecimientos y la información de licencia. También enlaza al artículo, al Slack de desarrolladores, al Discord de la comunidad y a los canales comunitarios de WeChat.

Aspectos destacados del vídeo:

  • FreeToken está diseñado para modelos MoE grandes que no caben por completo en la memoria de la GPU.
  • La caché adaptativa de expertos puede mantener más cerca de la GPU los componentes del modelo que se utilizan con frecuencia.
  • Los flujos de trabajo con agentes se benefician de una menor recomputación del contexto durante llamadas repetidas a herramientas.
  • El proyecto está especializado y no pretende sustituir universalmente a todos los runtimes de inferencia local.

Runtime nativo para edge

FreeToken coordina GPU, CPU, memoria del sistema e interconexiones para servir modelos grandes.

Especialización en MoE

El motor se centra en modelos de expertos dispersos, en los que solo algunos expertos seleccionados están activos para cada token.

Reutilización del contexto de agentes

Los puntos de control de anclaje semántico ayudan a reducir la recomputación redundante después de llamadas a herramientas y ediciones del contexto.

Consejo sobre el repositorio

Comienza con el repositorio oficial y su documentación de inicio rápido enlazada. La página de GitHub es el mejor lugar para verificar las instrucciones de instalación actuales antes de configurar un sistema.

Cómo gestiona FreeToken los modelos MoE grandes

Un modelo Mixture-of-Experts puede contener un número total muy grande de parámetros y, al mismo tiempo, activar solo un subconjunto menor de expertos para cada token. Este patrón de ejecución dispersa hace más práctica la inferencia local a escala puntera, pero el checkpoint completo aún debe almacenarse en algún lugar.

FreeToken aborda este desafío mediante varias estrategias de runtime coordinadas. Su política de coejecución CPU–GPU adaptada al ancho de banda evalúa si una operación debe permanecer en la CPU o trasladarse a la GPU. La decisión depende del sistema real y no de una división fija del hardware.

Función del runtimeFunción prácticaEscenario de mejor uso
Ejecución adaptada al ancho de bandaElige el trabajo de CPU o GPU según el ancho de banda disponibleSistemas con rendimiento mixto de CPU, RAM, GPU y PCIe
Caché de expertosMantiene disponibles en la VRAM los expertos seleccionados con frecuenciaPatrones de expertos repetidos durante la generación
Streaming con doble búferSuperpone la preparación de capas con el cálculo activoModelos grandes cuyos pesos están fuera de la VRAM
Checkpoints de anclaje semánticoReutiliza el contexto sin cambios y el estado recurrenteAgentes de programación y flujos de trabajo con herramientas en varios turnos
Formato de pesos FTWAdmite la ruta rápida de gestión de pesos del proyectoImplementaciones de modelos compatibles con FreeToken

El proyecto también utiliza una caché global de expertos basada en LRU. En términos prácticos, los expertos que se necesitan con frecuencia pueden permanecer en un nivel de memoria más rápido, mientras que las entradas menos útiles se reemplazan. Esto es especialmente relevante cuando los pesos completos de un modelo residen parcialmente en la memoria del sistema.

El streaming de prellenado con doble búfer intenta ocultar los retrasos de transferencia detrás del trabajo que la GPU ya está realizando. Las transferencias siguen consumiendo ancho de banda, pero superponerlas con el cálculo puede reducir la espera visible. Este enfoque adquiere mayor importancia a medida que los prompts se hacen más largos y los agentes actualizan repetidamente su contexto de trabajo.

Comprobación de la realidad de la memoria

FreeToken no hace que un checkpoint grande ocupe únicamente la VRAM disponible. Los pesos restantes siguen necesitando suficiente RAM del sistema, almacenamiento y ancho de banda de memoria para admitir el modelo seleccionado.

La descripción oficial del proyecto también destaca la ejecución compatible con grafos y la caché con conciencia semántica. Estas funciones están dirigidas a cargas de trabajo en las que el prompt cambia de forma incremental, como los agentes de programación que leen archivos, llaman a herramientas, reciben resultados y envían solicitudes posteriores.

Carga de trabajoPor qué FreeToken puede ayudarConsideración principal
Prompt corto individualUna generación eficiente puede mejorar el rendimientoUn modelo que ya cabe en la VRAM puede beneficiarse más de una alternativa madura
Sesión larga de programaciónReutiliza el contexto sin cambios entre turnosLas necesidades de inicio y memoria siguen siendo importantes
Agente con llamadas a herramientasReduce el procesamiento repetido después de editar el contextoDebe probarse la compatibilidad con el cliente
Checkpoint MoE grandeCoordina la memoria del sistema y la ejecución de la GPULa RAM del sistema debe contener los datos del modelo descargados
Servicio multiusuarioProporciona rutas de API compatibles con OpenAI y AnthropicLa capacidad depende del hardware y de la forma de la carga de trabajo

Ruta de configuración de FreeToken github

El repositorio presenta dos vías principales de acceso: una aplicación de escritorio para Windows o Linux y una ruta de instalación mediante línea de comandos usando uv o pip. Actualmente, la ruta de CLI acelerada está asociada principalmente con Linux, hardware x86-64, gráficos Nvidia, CUDA 13 y un controlador reciente.

Utiliza el siguiente proceso para mantener la primera configuración centrada y verificable.

1

Comprueba el hardware

Confirma que el equipo cuenta con una GPU Nvidia compatible, un entorno x86-64, suficiente RAM del sistema y compatibilidad con controladores actuales. Considera la VRAM solo como una parte del plan de memoria total.

2

Elige la vía de acceso

Utiliza la aplicación de escritorio de FreeToken si quieres una interfaz guiada para descargar, chatear y ajustar la configuración. Elige la CLI cuando necesites control desde el terminal, integración con el desarrollo o personalización a nivel de código fuente.

3

Instala el runtime

El repositorio indica uv pip install "freetoken[accel]" como la ruta de instalación acelerada recomendada. También se documenta una instalación desde el código fuente mediante un entorno virtual y una instalación editable del proyecto.

4

Selecciona un checkpoint compatible

Elige un checkpoint compatible de Hugging Face y verifica que el sistema tenga suficiente memoria del sistema para los pesos que no pueden permanecer en la VRAM. Las variantes de baja precisión pueden cambiar los requisitos prácticos de memoria.

5

Conecta tu cliente

Inicia el servidor local y prueba la ruta de API compatible con OpenAI o Anthropic documentada utilizando un cliente compatible. Comienza con una solicitud corta antes de probar sesiones largas con agentes.

Área de configuraciónComprobación recomendadaProblema habitual
Sistema operativoLinux para la ruta de CLI acelerada documentadaLa compatibilidad de escritorio y CLI puede diferir
GPUSeries Nvidia RTX 30, 40 o 50 destacadas por el proyectoLos aceleradores no compatibles pueden no disponer de la ruta prevista
CUDACUDA 13 con un controlador recienteLas incompatibilidades de versión pueden impedir la aceleración
Memoria del sistemaSuficiente RAM para los pesos descargados y el contextoLos checkpoints grandes pueden superar la capacidad de un equipo de escritorio convencional
InstalaciónConfiguración mediante uv, pip o desde el código fuenteLas instalaciones editables requieren un entorno preparado correctamente
Recomendación de configuración

Valida primero un modelo y una solicitud corta. Cuando el servidor responda de forma fiable, aumenta la longitud del contexto, activa las herramientas de agentes y compara el rendimiento con tu carga de trabajo real.

Expectativas de rendimiento y comparaciones

El caso de uso más sólido de FreeToken es un modelo MoE grande que no cabe por completo en la GPU. En esa situación, el runtime puede utilizar la memoria del sistema mientras adapta la distribución del trabajo entre la CPU y la GPU.

Las pruebas comunicadas incluyen una RTX 5090 ejecutando Qwen 3.5 35B A3B a aproximadamente 77–83 tokens por segundo en determinadas cargas de trabajo. DeepSeek V4 Flash registró aproximadamente 22–25 tokens por segundo en el mismo contexto general de pruebas. Estas cifras proceden de pruebas relacionadas con el proyecto y deben considerarse específicas de cada carga de trabajo, no garantías universales.

Otro resultado comunicado por la comunidad utilizó una RTX 5080, 64 GB de memoria del sistema y un Ryzen 9 9950X3D. El usuario informó de aproximadamente 100 tokens por segundo para Qwen 3.5 35B A3B, con un ejemplo cercano a 110 tokens por segundo. Se trata de un resultado comunitario inicial, no de un benchmark controlado.

Ejemplo de hardwareModelo o carga de trabajoResultado comunicadoCómo interpretarlo
RTX 5090Qwen 3.5 35B A3BAproximadamente 77–83 tokens/segundoResultado sólido para una carga de trabajo MoE grande
RTX 5090DeepSeek V4 FlashAproximadamente 22–25 tokens/segundoMuestra el impacto de las diferencias entre modelos y cargas de trabajo
Portátil con RTX 4060, 8 GB de VRAMQwen 3.5 35B A3B, 4 bitsAproximadamente 39,3 tokens/segundoLa memoria del sistema almacena los pesos que superan la VRAM disponible
RTX Pro 6000, 196 GBGLM-5 2, 753B de parámetrosCasi 15 tokens/segundoDemuestra el enfoque del proyecto en modelos grandes
RTX 5080, 64 GB de RAMQwen 3.5 35B A3BAproximadamente 100; un informe alcanzó casi 110Resultado comunitario que requiere verificación independiente

La velocidad de generación de tokens es solo una parte de la experiencia. Los flujos de trabajo con agentes pueden revelar largas esperas durante el procesamiento del contexto, especialmente cuando un cliente edita repetidamente la conversación. La caché con conciencia semántica de FreeToken pretende conservar el contexto sin cambios y reducir la recomputación redundante.

Para realizar una comparación justa, prueba checkpoints, cuantización, longitudes de prompt, configuraciones de contexto y comportamiento del cliente idénticos. Un modelo pequeño que cabe por completo en la VRAM puede ofrecer ya un rendimiento muy bueno con otro runtime. FreeToken resulta más interesante cuando el movimiento de memoria y las actualizaciones de contexto extensas son las principales limitaciones.

Mejor coincidencia

Checkpoints MoE grandes que superan la VRAM de la GPU, pero caben dentro del presupuesto total de memoria del sistema.

Escenario prometedor

Agentes de programación o con llamadas a herramientas de larga duración y actualizaciones repetidas del contexto.

Menos convincente

Modelos pequeños que caben por completo en la VRAM y no requieren una coordinación significativa entre CPU y GPU.

Nota sobre benchmarks

Compara el retraso del primer token, la generación sostenida, las actualizaciones del contexto y la estabilidad del cliente. Una sola cifra de tokens por segundo no puede representar todo un flujo de trabajo con agentes.

Compatibilidad, límites y lista de comprobación práctica

FreeToken está especializado. El proyecto destaca el acceso mediante aplicaciones de escritorio en Windows y Linux, mientras que la documentación de la línea de comandos acelerada se centra en Linux, sistemas x86-64, GPU Nvidia, CUDA 13 y controladores recientes. No se presenta como un ejecutor universal para CPU ni como un sustituto general de todos los ecosistemas de hardware.

El proyecto tampoco elimina la necesidad de contar con suficiente almacenamiento y RAM del sistema. Un checkpoint grande sigue siendo grande aunque la ejecución dispersa reduzca el número de parámetros activos por token. El formato del modelo, la cuantización, la longitud del contexto y el comportamiento del agente afectan a los requisitos finales de memoria.

Antes de tu primera prueba:

  • Verifica la compatibilidad de la GPU Nvidia, el controlador, CUDA y el sistema operativo
  • Calcula los requisitos de RAM del sistema para el checkpoint seleccionado completo
  • Elige una variante compatible de baja precisión o un modelo de Hugging Face
  • Prueba la API local con una solicitud corta antes de activar las herramientas
  • Registra el modelo, la cuantización, la longitud del contexto y el hardware para realizar benchmarks justos
Punto de decisiónFreeToken es un buen candidato cuandoConsidera otro runtime cuando
Tamaño del modeloEl checkpoint MoE supera la VRAM disponibleEl modelo cabe cómodamente en la VRAM
HardwareHay aceleración Nvidia y suficiente RAM del sistemaNecesitas compatibilidad amplia con CPU, AMD, Apple Silicon o dispositivos pequeños
Flujo de trabajoEjecutas sesiones largas de programación o llamadas a herramientasPrincipalmente generas prompts cortos y sencillos
EcosistemaQuieres la compatibilidad de API admitida por el proyectoDependes de un flujo de trabajo GGUF existente y amplio
ControlTe sientes cómodo ajustando un motor especializadoPrefieres un runtime maduro y de propósito general
Consejo práctico

Conserva una nota de benchmark para cada prueba: GPU, CPU, RAM, modelo, cuantización, tamaño del contexto, retraso del primer token y velocidad sostenida. Esto facilita mucho la comparación de resultados de la comunidad.

La licencia Apache 2.0 hace que el repositorio sea adecuado para su inspección y reutilización dentro de los términos de la licencia. El proyecto reconoce la inspiración y el código reutilizado de sistemas como SGLang, vLLM, FlashInfer, LightLLM, flash-linear-attention y llama.cpp. Revisa la licencia y los avisos actuales del repositorio antes de distribuir componentes modificados.

Preguntas frecuentes sobre FreeToken github

Q: ¿Para qué se utiliza FreeToken?

FreeToken es un motor de inferencia nativo para edge que sirve modelos Mixture-of-Experts grandes y de pesos abiertos mediante GPU, CPU, memoria del sistema e interconexiones.

Q: ¿FreeToken sustituye a llama.cpp en todos los sistemas?

No. FreeToken está más especializado. Puede resultar atractivo para modelos MoE grandes que superan la VRAM de la GPU, mientras que llama.cpp ofrece una cobertura más amplia de hardware y del ecosistema de modelos.

Q: ¿Qué hardware requiere la configuración acelerada?

La ruta acelerada documentada se centra en Linux, x86-64, GPU Nvidia, CUDA 13 y un controlador reciente. También necesitas suficiente RAM del sistema para los pesos descargados y el contexto.

Q: ¿Dónde puedo encontrar las instrucciones de instalación actuales?

Utiliza el repositorio oficial de FreeToken en GitHub y su documentación enlazada de instalación e inicio rápido. Consulta esos recursos antes de instalar, ya que los detalles de compatibilidad pueden cambiar.

Mantén actualizada la documentación

Los comandos de instalación, los checkpoints compatibles y las recomendaciones de hardware pueden evolucionar durante 2026. Vuelve a consultar el repositorio oficial antes de aplicar una nota de configuración antigua.