- FreeToken github: El repositorio oficial contiene la descripción del proyecto, las opciones de instalación, la cita académica y la licencia Apache 2.0.
- Uso principal: FreeToken está orientado a modelos grandes de Mixture-of-Experts que superan la VRAM disponible de la GPU.
- Ventaja principal: La ejecución adaptativa entre CPU y GPU, la caché de expertos y las transferencias superpuestas reducen el tiempo de inactividad del hardware.
- Mejor opción para: Sistemas Nvidia con Linux, suficiente memoria del sistema y aceleración CUDA compatible.
- Límite importante: FreeToken mejora la utilización, pero no elimina los requisitos de memoria total de un modelo.
Descripción general del repositorio de FreeToken github
FreeToken github es el hogar público de un motor de inferencia nativo para el edge, diseñado para ejecutar modelos Mixture-of-Experts de código abierto y escala puntera en hardware personal y de consumo. El proyecto combina la memoria de la GPU, la RAM del sistema, el procesamiento de la CPU y el ancho de banda de las interconexiones como una plataforma flexible de servicio, en lugar de tratar la GPU como un dispositivo aislado.
El repositorio oficial de FreeToken en GitHub ofrece la descripción del proyecto, información sobre la aplicación de escritorio, notas de instalación de la CLI, la cita de investigación, los agradecimientos y la información de licencia. También enlaza al artículo, al Slack de desarrolladores, al Discord de la comunidad y a los canales comunitarios de WeChat.
Aspectos destacados del vídeo:
- FreeToken está diseñado para modelos MoE grandes que no caben por completo en la memoria de la GPU.
- La caché adaptativa de expertos puede mantener más cerca de la GPU los componentes del modelo que se utilizan con frecuencia.
- Los flujos de trabajo con agentes se benefician de una menor recomputación del contexto durante llamadas repetidas a herramientas.
- El proyecto está especializado y no pretende sustituir universalmente a todos los runtimes de inferencia local.
Runtime nativo para edge
FreeToken coordina GPU, CPU, memoria del sistema e interconexiones para servir modelos grandes.
Especialización en MoE
El motor se centra en modelos de expertos dispersos, en los que solo algunos expertos seleccionados están activos para cada token.
Reutilización del contexto de agentes
Los puntos de control de anclaje semántico ayudan a reducir la recomputación redundante después de llamadas a herramientas y ediciones del contexto.
Comienza con el repositorio oficial y su documentación de inicio rápido enlazada. La página de GitHub es el mejor lugar para verificar las instrucciones de instalación actuales antes de configurar un sistema.
Cómo gestiona FreeToken los modelos MoE grandes
Un modelo Mixture-of-Experts puede contener un número total muy grande de parámetros y, al mismo tiempo, activar solo un subconjunto menor de expertos para cada token. Este patrón de ejecución dispersa hace más práctica la inferencia local a escala puntera, pero el checkpoint completo aún debe almacenarse en algún lugar.
FreeToken aborda este desafío mediante varias estrategias de runtime coordinadas. Su política de coejecución CPU–GPU adaptada al ancho de banda evalúa si una operación debe permanecer en la CPU o trasladarse a la GPU. La decisión depende del sistema real y no de una división fija del hardware.
| Función del runtime | Función práctica | Escenario de mejor uso |
|---|---|---|
| Ejecución adaptada al ancho de banda | Elige el trabajo de CPU o GPU según el ancho de banda disponible | Sistemas con rendimiento mixto de CPU, RAM, GPU y PCIe |
| Caché de expertos | Mantiene disponibles en la VRAM los expertos seleccionados con frecuencia | Patrones de expertos repetidos durante la generación |
| Streaming con doble búfer | Superpone la preparación de capas con el cálculo activo | Modelos grandes cuyos pesos están fuera de la VRAM |
| Checkpoints de anclaje semántico | Reutiliza el contexto sin cambios y el estado recurrente | Agentes de programación y flujos de trabajo con herramientas en varios turnos |
| Formato de pesos FTW | Admite la ruta rápida de gestión de pesos del proyecto | Implementaciones de modelos compatibles con FreeToken |
El proyecto también utiliza una caché global de expertos basada en LRU. En términos prácticos, los expertos que se necesitan con frecuencia pueden permanecer en un nivel de memoria más rápido, mientras que las entradas menos útiles se reemplazan. Esto es especialmente relevante cuando los pesos completos de un modelo residen parcialmente en la memoria del sistema.
El streaming de prellenado con doble búfer intenta ocultar los retrasos de transferencia detrás del trabajo que la GPU ya está realizando. Las transferencias siguen consumiendo ancho de banda, pero superponerlas con el cálculo puede reducir la espera visible. Este enfoque adquiere mayor importancia a medida que los prompts se hacen más largos y los agentes actualizan repetidamente su contexto de trabajo.
FreeToken no hace que un checkpoint grande ocupe únicamente la VRAM disponible. Los pesos restantes siguen necesitando suficiente RAM del sistema, almacenamiento y ancho de banda de memoria para admitir el modelo seleccionado.
La descripción oficial del proyecto también destaca la ejecución compatible con grafos y la caché con conciencia semántica. Estas funciones están dirigidas a cargas de trabajo en las que el prompt cambia de forma incremental, como los agentes de programación que leen archivos, llaman a herramientas, reciben resultados y envían solicitudes posteriores.
| Carga de trabajo | Por qué FreeToken puede ayudar | Consideración principal |
|---|---|---|
| Prompt corto individual | Una generación eficiente puede mejorar el rendimiento | Un modelo que ya cabe en la VRAM puede beneficiarse más de una alternativa madura |
| Sesión larga de programación | Reutiliza el contexto sin cambios entre turnos | Las necesidades de inicio y memoria siguen siendo importantes |
| Agente con llamadas a herramientas | Reduce el procesamiento repetido después de editar el contexto | Debe probarse la compatibilidad con el cliente |
| Checkpoint MoE grande | Coordina la memoria del sistema y la ejecución de la GPU | La RAM del sistema debe contener los datos del modelo descargados |
| Servicio multiusuario | Proporciona rutas de API compatibles con OpenAI y Anthropic | La capacidad depende del hardware y de la forma de la carga de trabajo |
Ruta de configuración de FreeToken github
El repositorio presenta dos vías principales de acceso: una aplicación de escritorio para Windows o Linux y una ruta de instalación mediante línea de comandos usando uv o pip. Actualmente, la ruta de CLI acelerada está asociada principalmente con Linux, hardware x86-64, gráficos Nvidia, CUDA 13 y un controlador reciente.
Utiliza el siguiente proceso para mantener la primera configuración centrada y verificable.
Comprueba el hardware
Confirma que el equipo cuenta con una GPU Nvidia compatible, un entorno x86-64, suficiente RAM del sistema y compatibilidad con controladores actuales. Considera la VRAM solo como una parte del plan de memoria total.
Elige la vía de acceso
Utiliza la aplicación de escritorio de FreeToken si quieres una interfaz guiada para descargar, chatear y ajustar la configuración. Elige la CLI cuando necesites control desde el terminal, integración con el desarrollo o personalización a nivel de código fuente.
Instala el runtime
El repositorio indica uv pip install "freetoken[accel]" como la ruta de instalación acelerada recomendada. También se documenta una instalación desde el código fuente mediante un entorno virtual y una instalación editable del proyecto.
Selecciona un checkpoint compatible
Elige un checkpoint compatible de Hugging Face y verifica que el sistema tenga suficiente memoria del sistema para los pesos que no pueden permanecer en la VRAM. Las variantes de baja precisión pueden cambiar los requisitos prácticos de memoria.
Conecta tu cliente
Inicia el servidor local y prueba la ruta de API compatible con OpenAI o Anthropic documentada utilizando un cliente compatible. Comienza con una solicitud corta antes de probar sesiones largas con agentes.
| Área de configuración | Comprobación recomendada | Problema habitual |
|---|---|---|
| Sistema operativo | Linux para la ruta de CLI acelerada documentada | La compatibilidad de escritorio y CLI puede diferir |
| GPU | Series Nvidia RTX 30, 40 o 50 destacadas por el proyecto | Los aceleradores no compatibles pueden no disponer de la ruta prevista |
| CUDA | CUDA 13 con un controlador reciente | Las incompatibilidades de versión pueden impedir la aceleración |
| Memoria del sistema | Suficiente RAM para los pesos descargados y el contexto | Los checkpoints grandes pueden superar la capacidad de un equipo de escritorio convencional |
| Instalación | Configuración mediante uv, pip o desde el código fuente | Las instalaciones editables requieren un entorno preparado correctamente |
Valida primero un modelo y una solicitud corta. Cuando el servidor responda de forma fiable, aumenta la longitud del contexto, activa las herramientas de agentes y compara el rendimiento con tu carga de trabajo real.
Expectativas de rendimiento y comparaciones
El caso de uso más sólido de FreeToken es un modelo MoE grande que no cabe por completo en la GPU. En esa situación, el runtime puede utilizar la memoria del sistema mientras adapta la distribución del trabajo entre la CPU y la GPU.
Las pruebas comunicadas incluyen una RTX 5090 ejecutando Qwen 3.5 35B A3B a aproximadamente 77–83 tokens por segundo en determinadas cargas de trabajo. DeepSeek V4 Flash registró aproximadamente 22–25 tokens por segundo en el mismo contexto general de pruebas. Estas cifras proceden de pruebas relacionadas con el proyecto y deben considerarse específicas de cada carga de trabajo, no garantías universales.
Otro resultado comunicado por la comunidad utilizó una RTX 5080, 64 GB de memoria del sistema y un Ryzen 9 9950X3D. El usuario informó de aproximadamente 100 tokens por segundo para Qwen 3.5 35B A3B, con un ejemplo cercano a 110 tokens por segundo. Se trata de un resultado comunitario inicial, no de un benchmark controlado.
| Ejemplo de hardware | Modelo o carga de trabajo | Resultado comunicado | Cómo interpretarlo |
|---|---|---|---|
| RTX 5090 | Qwen 3.5 35B A3B | Aproximadamente 77–83 tokens/segundo | Resultado sólido para una carga de trabajo MoE grande |
| RTX 5090 | DeepSeek V4 Flash | Aproximadamente 22–25 tokens/segundo | Muestra el impacto de las diferencias entre modelos y cargas de trabajo |
| Portátil con RTX 4060, 8 GB de VRAM | Qwen 3.5 35B A3B, 4 bits | Aproximadamente 39,3 tokens/segundo | La memoria del sistema almacena los pesos que superan la VRAM disponible |
| RTX Pro 6000, 196 GB | GLM-5 2, 753B de parámetros | Casi 15 tokens/segundo | Demuestra el enfoque del proyecto en modelos grandes |
| RTX 5080, 64 GB de RAM | Qwen 3.5 35B A3B | Aproximadamente 100; un informe alcanzó casi 110 | Resultado comunitario que requiere verificación independiente |
La velocidad de generación de tokens es solo una parte de la experiencia. Los flujos de trabajo con agentes pueden revelar largas esperas durante el procesamiento del contexto, especialmente cuando un cliente edita repetidamente la conversación. La caché con conciencia semántica de FreeToken pretende conservar el contexto sin cambios y reducir la recomputación redundante.
Para realizar una comparación justa, prueba checkpoints, cuantización, longitudes de prompt, configuraciones de contexto y comportamiento del cliente idénticos. Un modelo pequeño que cabe por completo en la VRAM puede ofrecer ya un rendimiento muy bueno con otro runtime. FreeToken resulta más interesante cuando el movimiento de memoria y las actualizaciones de contexto extensas son las principales limitaciones.
Mejor coincidencia
Checkpoints MoE grandes que superan la VRAM de la GPU, pero caben dentro del presupuesto total de memoria del sistema.
Escenario prometedor
Agentes de programación o con llamadas a herramientas de larga duración y actualizaciones repetidas del contexto.
Menos convincente
Modelos pequeños que caben por completo en la VRAM y no requieren una coordinación significativa entre CPU y GPU.
Compara el retraso del primer token, la generación sostenida, las actualizaciones del contexto y la estabilidad del cliente. Una sola cifra de tokens por segundo no puede representar todo un flujo de trabajo con agentes.
Compatibilidad, límites y lista de comprobación práctica
FreeToken está especializado. El proyecto destaca el acceso mediante aplicaciones de escritorio en Windows y Linux, mientras que la documentación de la línea de comandos acelerada se centra en Linux, sistemas x86-64, GPU Nvidia, CUDA 13 y controladores recientes. No se presenta como un ejecutor universal para CPU ni como un sustituto general de todos los ecosistemas de hardware.
El proyecto tampoco elimina la necesidad de contar con suficiente almacenamiento y RAM del sistema. Un checkpoint grande sigue siendo grande aunque la ejecución dispersa reduzca el número de parámetros activos por token. El formato del modelo, la cuantización, la longitud del contexto y el comportamiento del agente afectan a los requisitos finales de memoria.
Antes de tu primera prueba:
- Verifica la compatibilidad de la GPU Nvidia, el controlador, CUDA y el sistema operativo
- Calcula los requisitos de RAM del sistema para el checkpoint seleccionado completo
- Elige una variante compatible de baja precisión o un modelo de Hugging Face
- Prueba la API local con una solicitud corta antes de activar las herramientas
- Registra el modelo, la cuantización, la longitud del contexto y el hardware para realizar benchmarks justos
| Punto de decisión | FreeToken es un buen candidato cuando | Considera otro runtime cuando |
|---|---|---|
| Tamaño del modelo | El checkpoint MoE supera la VRAM disponible | El modelo cabe cómodamente en la VRAM |
| Hardware | Hay aceleración Nvidia y suficiente RAM del sistema | Necesitas compatibilidad amplia con CPU, AMD, Apple Silicon o dispositivos pequeños |
| Flujo de trabajo | Ejecutas sesiones largas de programación o llamadas a herramientas | Principalmente generas prompts cortos y sencillos |
| Ecosistema | Quieres la compatibilidad de API admitida por el proyecto | Dependes de un flujo de trabajo GGUF existente y amplio |
| Control | Te sientes cómodo ajustando un motor especializado | Prefieres un runtime maduro y de propósito general |
Conserva una nota de benchmark para cada prueba: GPU, CPU, RAM, modelo, cuantización, tamaño del contexto, retraso del primer token y velocidad sostenida. Esto facilita mucho la comparación de resultados de la comunidad.
La licencia Apache 2.0 hace que el repositorio sea adecuado para su inspección y reutilización dentro de los términos de la licencia. El proyecto reconoce la inspiración y el código reutilizado de sistemas como SGLang, vLLM, FlashInfer, LightLLM, flash-linear-attention y llama.cpp. Revisa la licencia y los avisos actuales del repositorio antes de distribuir componentes modificados.
Preguntas frecuentes sobre FreeToken github
Q: ¿Para qué se utiliza FreeToken?
FreeToken es un motor de inferencia nativo para edge que sirve modelos Mixture-of-Experts grandes y de pesos abiertos mediante GPU, CPU, memoria del sistema e interconexiones.
Q: ¿FreeToken sustituye a llama.cpp en todos los sistemas?
No. FreeToken está más especializado. Puede resultar atractivo para modelos MoE grandes que superan la VRAM de la GPU, mientras que llama.cpp ofrece una cobertura más amplia de hardware y del ecosistema de modelos.
Q: ¿Qué hardware requiere la configuración acelerada?
La ruta acelerada documentada se centra en Linux, x86-64, GPU Nvidia, CUDA 13 y un controlador reciente. También necesitas suficiente RAM del sistema para los pesos descargados y el contexto.
Q: ¿Dónde puedo encontrar las instrucciones de instalación actuales?
Utiliza el repositorio oficial de FreeToken en GitHub y su documentación enlazada de instalación e inicio rápido. Consulta esos recursos antes de instalar, ya que los detalles de compatibilidad pueden cambiar.
Los comandos de instalación, los checkpoints compatibles y las recomendaciones de hardware pueden evolucionar durante 2026. Vuelve a consultar el repositorio oficial antes de aplicar una nota de configuración antigua.