- FreeToken codex utiliza el enrutamiento de expertos en tiempo de ejecución para reducir las transferencias innecesarias de pesos del modelo.
- Ventaja principal: los modelos de mezcla de expertos pueden ejecutarse localmente sin cargar todos los expertos en la VRAM.
- Rendimiento informado: hasta 77–83 tokens por segundo en determinado hardware de estación de trabajo.
- Limitación principal: la compatibilidad se centra actualmente en entornos Nvidia CUDA.
- Mejor caso de uso: agentes de programación locales y privados para usuarios con sistemas Linux o Windows compatibles.
FreeToken codex: qué es y por qué importa
FreeToken es un sistema de inferencia local diseñado para hacer más prácticos los modelos de mezcla de expertos de gran tamaño en una sola GPU de estación de trabajo. El proyecto es especialmente relevante para los desarrolladores que crean un agente de programación privado, ya que aborda el problema de las transferencias de memoria que a menudo limita el rendimiento de los modelos locales.
La idea clave es sencilla: un modelo puede contener cientos de miles de millones de parámetros, pero una arquitectura de mezcla de expertos activa solo un pequeño grupo de expertos para cada token. En lugar de tratar a todos los expertos como igualmente importantes, FreeToken registra qué pesos es probable que solicite el enrutador y administra la memoria del sistema en consecuencia.
El artículo del 17 de agosto de 2026 describe un modelo de 753.000 millones de parámetros ejecutándose en una sola GPU de estación de trabajo. Eso no significa que el modelo completo quepa dentro de 96 GB de VRAM. Los pesos de cuatro bits ocupan aproximadamente 433 GB en disco, por lo que FreeToken depende de la carga selectiva, el almacenamiento en caché y el movimiento entre la RAM del sistema y la memoria de la GPU.
Aspectos destacados del video:
- El enfoque de enrutamiento en tiempo de ejecución de FreeToken comparado con la descarga estática de expertos.
- Rendimiento informado en las familias de modelos Qwen, DeepSeek y GLM.
- Limitaciones prácticas relacionadas con Windows, Docker, GGUF, Apple Silicon y varias GPU.
- Por qué la privacidad local puede ser más importante que las comparaciones directas de costes con la nube.
| Característica | FreeToken | Descarga estática tradicional |
|---|---|---|
| Ubicación de los expertos | Se ajusta según el enrutamiento en tiempo de ejecución | Se fija antes de la generación |
| Estrategia de memoria | Prioriza las lecturas probables de expertos | Utiliza una división predeterminada |
| Fallos de lectura de expertos informados | 16 % en la comparación citada | 62 % en la comparación citada |
| Entorno principal | Nvidia CUDA en Linux o Windows | Cobertura de hardware más amplia en runtimes maduros |
| Beneficio principal | Mejor uso del ancho de banda de memoria | Compatibilidad e implementación más sencillas |
Piensa en FreeToken como un gestor de tráfico para los expertos del modelo. Su valor proviene de reducir las transferencias evitables, no de disminuir el número total de parámetros del modelo.
Benchmarks y contexto de rendimiento de FreeToken codex
Los resultados informados por FreeToken son más sólidos cuando el modelo utiliza el enrutamiento de mezcla de expertos y el sistema dispone de suficiente ancho de banda de memoria para mantener disponibles los expertos activos. En las pruebas citadas, el motor se comparó con llama.cpp utilizando trazas de enrutamiento y condiciones de caché similares.
Las cifras informadas muestran una ventaja significativa en varias configuraciones. En una tarjeta de estación de trabajo de clase RTX 5090, Qwen 35B alcanzó aproximadamente 77–83 tokens por segundo, mientras que DeepSeek V4 Flash llegó a unos 22–25 tokens por segundo. Una prueba con GLM 5.2 alcanzó 14,9 tokens por segundo, frente a los 7,3 tokens por segundo de llama.cpp en la misma discusión.
Estas cifras deben interpretarse como benchmarks informados por el proyecto, no como garantías universales de hardware. Los resultados pueden cambiar según la cuantización del modelo, la longitud del prompt, el tamaño del contexto, la configuración de la caché, la velocidad del almacenamiento, las versiones de los controladores y el modelo exacto de GPU.
| Modelo o escenario | Resultado de FreeToken | Comparación o contexto |
|---|---|---|
| Qwen 35B en hardware de clase RTX 5090 | 77–83 tokens/s | Aproximadamente entre 1,8 y 2,3 veces el competidor más cercano citado |
| DeepSeek V4 Flash | 22–25 tokens/s | Probado como una carga de trabajo grande de mezcla de expertos |
| GLM 5.2 | 14,9 tokens/s | La comparación citada con llama.cpp alcanzó 7,3 tokens/s |
| Portátil con GPU de 8 GB | 39,3 tokens/s | Informado como aproximadamente el 92 % del resultado de escritorio citado |
| Referencia de agente de programación en la nube | 33,9 tokens/s | Cifra de traza normalizada de extremo a extremo, no velocidad de decodificación pura |
La comparación con la nube requiere especial cuidado. Un gráfico principal puede colocar la velocidad de decodificación de FreeToken junto a una cifra de un agente de programación en la nube, pero esas mediciones pueden representar distintas etapas de la inferencia. El análisis citado distingue una cifra normalizada de extremo a extremo de una mediana de decodificación pura de 61,3 tokens por segundo para la referencia en la nube.
Esto hace que la comparación sea menos espectacular de lo que sugiere una simple proporción en un gráfico de barras. FreeToken sigue pareciendo más rápido en la configuración citada, pero la diferencia se acerca más a una ventaja de rendimiento moderada cuando se utilizan denominadores equivalentes.
| Tipo de medición | Qué incluye | Por qué importa |
|---|---|---|
| Velocidad de decodificación pura | Generación de tokens después del inicio | Útil para comparar la salida sostenida |
| Tiempo hasta el primer token | Preparación del modelo y retraso de la respuesta inicial | Importante para la programación interactiva |
| Traza de extremo a extremo | Inicio, razonamiento, gestión del contexto y salida | Mejor para flujos de trabajo de agentes realistas |
| Cifra de decodificación normalizada | Representación estandarizada del benchmark | Debe compararse utilizando la misma definición |
Los resultados disponibles fueron producidos por los autores del proyecto. Considéralos pruebas técnicas útiles, pero valida el rendimiento con tu propio modelo, GPU, sistema operativo y carga de trabajo.
FreeToken frente a Llama.cpp para agentes de programación locales
La comparación más práctica no consiste simplemente en determinar qué motor informa de una mayor tasa de tokens. Lo importante es qué motor es compatible con el hardware, el formato del modelo y el flujo de implementación que ya utilizas.
FreeToken se centra en un problema específico de los sistemas: la colocación dinámica de expertos. Llama.cpp es más maduro y admite una gama más amplia de backends de hardware, incluidos Apple Metal, AMD, Vulkan y entornos orientados a dispositivos móviles. También ofrece una opción de mezcla de expertos en la CPU, aunque la comparación citada describe ese enfoque como estático en lugar de consciente del enrutamiento.
Para un desarrollador que utiliza una GPU Nvidia compatible, FreeToken puede ofrecer un experimento de rendimiento interesante. Para un equipo con hardware diverso, un propietario de un Mac o un usuario que necesita compatibilidad con GGUF y Docker, llama.cpp puede seguir siendo la referencia más conveniente.
Elige FreeToken
- Hardware Nvidia CUDA
- Modelos grandes de mezcla de expertos
- Configuración Linux o Windows compatible
- Prioridad en la eficiencia del enrutamiento local
Elige Llama.cpp
- Sistemas Apple Silicon o AMD
- Flujos de trabajo de modelos basados en GGUF
- Compatibilidad más amplia con backends
- Herramientas comunitarias maduras
Usa ambos
- Compara dos veces el mismo modelo
- Conserva una alternativa compatible
- Compara la latencia y el rendimiento
- Separa los experimentos de la producción
| Factor de decisión | FreeToken | Llama.cpp |
|---|---|---|
| Gestión dinámica de MoE | Enfoque principal del proyecto | Opción de MoE estático en CPU citada |
| Amplitud de hardware | Énfasis en Nvidia CUDA | Se citan 17 backends de hardware |
| Apple Silicon | No compatible según el estado citado | Se cita compatibilidad con Apple Metal |
| Compatibilidad con GGUF | No disponible según el estado citado | De uso común en su ecosistema |
| Compatibilidad con Docker | No disponible según el estado citado | Opciones de implementación más consolidadas |
| Madurez de la comunidad | Proyecto inicial con dos colaboradores citados | Base de colaboradores más amplia y uso consolidado |
El estado inicial del proyecto es importante. La discusión de lanzamiento citada informó de ocho incidencias abiertas en GitHub, incluidos fallos de instalación en Windows, ausencia de compatibilidad con Docker y GGUF, falta de modo para dos GPU y ausencia de compatibilidad con Apple Silicon. No son detalles menores si tu flujo de trabajo de agente de programación depende de contenedores reproducibles o de una estación de trabajo Mac.
Un motor más rápido solo resulta útil cuando ejecuta tu modelo en tu entorno. Comprueba la compatibilidad con el sistema operativo, la GPU, el formato del modelo y la implementación antes de cambiar tu stack local.
Guía de configuración de FreeToken para un flujo de trabajo Codex local
FreeToken debe abordarse como un proyecto de configuración técnica, no como un asistente de programación de un solo clic. La implementación citada está asociada al repositorio de GitHub FlashML/FreeToken y a una versión de investigación con licencia Apache. Revisa la documentación del proyecto y el registro actual de incidencias antes de instalarlo.
El artículo está identificado como arXiv:2608.16157, enviado el 17 de agosto de 2026: lee el artículo de FreeToken. El código del proyecto se referencia como FlashML/FreeToken en GitHub. Confirma que estos enlaces y las revisiones compatibles coincidan con la implementación que pretendes realizar antes de continuar.
Confirma el hardware
Verifica que tu sistema utiliza una GPU Nvidia CUDA compatible y que dispone de suficiente RAM del sistema para los pesos de los expertos del modelo seleccionado. Un modelo MoE grande puede superar la VRAM varias veces.
Selecciona un modelo compatible
Empieza con un modelo de mezcla de expertos documentado y registra su número de parámetros, cuantización, longitud del contexto y requisitos de almacenamiento. No des por supuesto que todos los formatos de modelos populares son compatibles.
Prepara el runtime
Sigue las instrucciones de instalación del repositorio correspondientes a tu sistema operativo, versión de CUDA, dependencias de Python o nativas y requisitos del compilador. Mantén la configuración inicial aislada de tu entorno de producción.
Ejecuta una prueba controlada
Utiliza un prompt fijo, una longitud de contexto fija y ajustes de generación repetibles. Registra el tiempo hasta el primer token, los tokens por segundo sostenidos, el uso de memoria y cualquier advertencia de la caché de expertos.
Conecta el agente de programación
Conecta un editor, un cliente de API local o una interfaz de agente de programación solo después de que la configuración básica funcione. Mantén disponible un segundo backend de inferencia para modelos no compatibles o fallos inesperados.
| Punto de control de configuración | Condición de aprobación | Preocupación habitual |
|---|---|---|
| GPU | Dispositivo Nvidia CUDA compatible | La VRAM por sí sola quizá no resuelva las limitaciones de ancho de banda |
| Memoria del sistema | Espacio suficiente para los pesos del modelo y la sobrecarga del sistema operativo | Los modelos MoE grandes pueden requerir cientos de gigabytes |
| Formato del modelo | Compatible explícitamente con la compilación actual | La compatibilidad con GGUF figuraba como no disponible en el estado citado |
| Sistema operativo | Configuración Linux o Windows compatible | Se informaron problemas de instalación en Windows |
| Integración con el agente | Endpoint local o conexión estable con el cliente | El éxito en los benchmarks no garantiza la compatibilidad con el editor |
Empieza por la inferencia, mide después la repetibilidad y añade las herramientas del agente solo al final. De este modo, los problemas del motor quedan aislados de los problemas del editor, la API y la gestión de prompts.
Privacidad, costes y ventajas y desventajas prácticas
La razón más importante para investigar FreeToken codex no es necesariamente el precio. La inferencia local mantiene los prompts, el código fuente y las respuestas intermedias en un hardware que controlas. Esto puede ser valioso para repositorios privados, trabajos regulados o proyectos que no pueden enviarse a un servicio de programación alojado.
El análisis de costes citado compara una GPU de estación de trabajo con un precio superior a 4.000 $ en julio de 2026 con sesiones de agentes de programación en la nube. Estima que la misma compra de hardware podría equivaler aproximadamente a 500 sesiones medianas en un servicio premium citado o hasta 40.000 sesiones con el nivel de precios más económico de DeepSeek. Son cálculos ilustrativos, no una fórmula universal de retorno de la inversión.
El hardware local también introduce gastos que las comparaciones con la nube pueden omitir:
- Compra o depreciación de la GPU
- Electricidad y refrigeración
- Almacenamiento para los archivos de los modelos
- Ampliaciones de la memoria del sistema
- Tiempo de configuración y mantenimiento
- Trabajo de compatibilidad de controladores, compiladores y modelos
| Ventaja o desventaja | Flujo de trabajo local con FreeToken | Agente de programación alojado |
|---|---|---|
| Privacidad | El código permanece en la infraestructura local | Los datos pasan por un proveedor |
| Límites de uso | Dependen de la capacidad del hardware local | Dependen de los límites de la cuenta y del servicio |
| Coste inicial | Alta inversión en hardware | Normalmente menor coste inicial |
| Mantenimiento | El usuario administra el software y el hardware | El proveedor administra la infraestructura |
| Disponibilidad de modelos | Limitada por la compatibilidad local y la memoria | El proveedor controla los modelos disponibles |
| Control a largo plazo | El hardware sigue disponible después de la configuración | El servicio y los precios pueden cambiar |
Un sistema local también evita depender del calendario de retirada de modelos de un proveedor. Sin embargo, esa ventaja implica responsabilidad: debes actualizar los controladores, vigilar las temperaturas, proteger los endpoints locales y mantener copias de seguridad de los prompts y de la configuración del proyecto.
Antes de usar FreeToken para programar:
- Confirma la compatibilidad con Nvidia CUDA y el sistema operativo
- Mide el tiempo hasta el primer token y el rendimiento sostenido
- Comprueba la compatibilidad con el formato y la cuantización del modelo
- Protege la API local y los archivos del proyecto
- Mantén disponible un runtime alternativo compatible
Para código sensible, la posibilidad de mantener los prompts y los repositorios localmente puede ser más importante que igualar el coste por token de un proveedor en la nube.
Preguntas frecuentes sobre FreeToken Codex
FreeToken se entiende mejor como un proyecto inicial de inferencia local para cargas de trabajo exigentes de mezcla de expertos. Puede resultar útil para desarrolladores a quienes les gusta ajustar sistemas y que disponen de hardware Nvidia compatible, pero no es un sustituto universal de los runtimes consolidados.
Q: ¿Qué es FreeToken codex?
FreeToken codex se refiere al uso del sistema de inferencia FreeToken como motor de un flujo de trabajo privado y local con un agente de programación. Su técnica central administra los pesos de la mezcla de expertos según el enrutamiento en tiempo de ejecución, en lugar de depender únicamente de una división fija de la memoria.
Q: ¿Puede FreeToken ejecutar un modelo de 753.000 millones de parámetros en una sola GPU?
El artículo citado del 17 de agosto de 2026 informa de un modelo de 753.000 millones de parámetros ejecutándose en una GPU de estación de trabajo. Los pesos completos no caben en la VRAM; FreeToken depende de la memoria del sistema, la activación selectiva de expertos, el almacenamiento en caché y las transferencias de datos.
Q: ¿Es FreeToken más rápido que llama.cpp?
Los benchmarks citados informan de un mayor rendimiento de FreeToken en varias pruebas MoE seleccionadas, incluidas Qwen 35B y GLM 5.2. Los resultados reales dependen del hardware, la configuración del modelo y de si las mediciones utilizan la misma definición de benchmark.
Q: ¿FreeToken es compatible con Mac, GGUF, Docker o dos GPU?
El estado citado del proyecto indicaba que no había compatibilidad con Apple Silicon, GGUF, Docker ni dos GPU el 25 de agosto de 2026. Comprueba el repositorio actual antes de instalarlo, ya que la compatibilidad puede cambiar después de la instantánea informada.
FreeToken está evolucionando rápidamente. Vuelve a comprobar el repositorio oficial, las notas de lanzamiento y las incidencias abiertas el 25 de agosto de 2026 o después antes de considerar permanente cualquier detalle de compatibilidad.