FreeToken codex: Guía de configuración, benchmarks y límites - Agentes

FreeToken codex: Guía de configuración, benchmarks y límites

FreeToken codex explicado: descubre cómo funciona su sistema de memoria consciente de los expertos, revisa sus benchmarks, límites de hardware, consideraciones de configuración y ventajas y desventajas de la IA local.

2026-08-25
Equipo de FreeToken
Guía rápida
  • FreeToken codex utiliza el enrutamiento de expertos en tiempo de ejecución para reducir las transferencias innecesarias de pesos del modelo.
  • Ventaja principal: los modelos de mezcla de expertos pueden ejecutarse localmente sin cargar todos los expertos en la VRAM.
  • Rendimiento informado: hasta 77–83 tokens por segundo en determinado hardware de estación de trabajo.
  • Limitación principal: la compatibilidad se centra actualmente en entornos Nvidia CUDA.
  • Mejor caso de uso: agentes de programación locales y privados para usuarios con sistemas Linux o Windows compatibles.

FreeToken codex: qué es y por qué importa

FreeToken es un sistema de inferencia local diseñado para hacer más prácticos los modelos de mezcla de expertos de gran tamaño en una sola GPU de estación de trabajo. El proyecto es especialmente relevante para los desarrolladores que crean un agente de programación privado, ya que aborda el problema de las transferencias de memoria que a menudo limita el rendimiento de los modelos locales.

La idea clave es sencilla: un modelo puede contener cientos de miles de millones de parámetros, pero una arquitectura de mezcla de expertos activa solo un pequeño grupo de expertos para cada token. En lugar de tratar a todos los expertos como igualmente importantes, FreeToken registra qué pesos es probable que solicite el enrutador y administra la memoria del sistema en consecuencia.

El artículo del 17 de agosto de 2026 describe un modelo de 753.000 millones de parámetros ejecutándose en una sola GPU de estación de trabajo. Eso no significa que el modelo completo quepa dentro de 96 GB de VRAM. Los pesos de cuatro bits ocupan aproximadamente 433 GB en disco, por lo que FreeToken depende de la carga selectiva, el almacenamiento en caché y el movimiento entre la RAM del sistema y la memoria de la GPU.

Aspectos destacados del video:

  • El enfoque de enrutamiento en tiempo de ejecución de FreeToken comparado con la descarga estática de expertos.
  • Rendimiento informado en las familias de modelos Qwen, DeepSeek y GLM.
  • Limitaciones prácticas relacionadas con Windows, Docker, GGUF, Apple Silicon y varias GPU.
  • Por qué la privacidad local puede ser más importante que las comparaciones directas de costes con la nube.
CaracterísticaFreeTokenDescarga estática tradicional
Ubicación de los expertosSe ajusta según el enrutamiento en tiempo de ejecuciónSe fija antes de la generación
Estrategia de memoriaPrioriza las lecturas probables de expertosUtiliza una división predeterminada
Fallos de lectura de expertos informados16 % en la comparación citada62 % en la comparación citada
Entorno principalNvidia CUDA en Linux o WindowsCobertura de hardware más amplia en runtimes maduros
Beneficio principalMejor uso del ancho de banda de memoriaCompatibilidad e implementación más sencillas
Concepto clave

Piensa en FreeToken como un gestor de tráfico para los expertos del modelo. Su valor proviene de reducir las transferencias evitables, no de disminuir el número total de parámetros del modelo.

Benchmarks y contexto de rendimiento de FreeToken codex

Los resultados informados por FreeToken son más sólidos cuando el modelo utiliza el enrutamiento de mezcla de expertos y el sistema dispone de suficiente ancho de banda de memoria para mantener disponibles los expertos activos. En las pruebas citadas, el motor se comparó con llama.cpp utilizando trazas de enrutamiento y condiciones de caché similares.

Las cifras informadas muestran una ventaja significativa en varias configuraciones. En una tarjeta de estación de trabajo de clase RTX 5090, Qwen 35B alcanzó aproximadamente 77–83 tokens por segundo, mientras que DeepSeek V4 Flash llegó a unos 22–25 tokens por segundo. Una prueba con GLM 5.2 alcanzó 14,9 tokens por segundo, frente a los 7,3 tokens por segundo de llama.cpp en la misma discusión.

Estas cifras deben interpretarse como benchmarks informados por el proyecto, no como garantías universales de hardware. Los resultados pueden cambiar según la cuantización del modelo, la longitud del prompt, el tamaño del contexto, la configuración de la caché, la velocidad del almacenamiento, las versiones de los controladores y el modelo exacto de GPU.

Modelo o escenarioResultado de FreeTokenComparación o contexto
Qwen 35B en hardware de clase RTX 509077–83 tokens/sAproximadamente entre 1,8 y 2,3 veces el competidor más cercano citado
DeepSeek V4 Flash22–25 tokens/sProbado como una carga de trabajo grande de mezcla de expertos
GLM 5.214,9 tokens/sLa comparación citada con llama.cpp alcanzó 7,3 tokens/s
Portátil con GPU de 8 GB39,3 tokens/sInformado como aproximadamente el 92 % del resultado de escritorio citado
Referencia de agente de programación en la nube33,9 tokens/sCifra de traza normalizada de extremo a extremo, no velocidad de decodificación pura

La comparación con la nube requiere especial cuidado. Un gráfico principal puede colocar la velocidad de decodificación de FreeToken junto a una cifra de un agente de programación en la nube, pero esas mediciones pueden representar distintas etapas de la inferencia. El análisis citado distingue una cifra normalizada de extremo a extremo de una mediana de decodificación pura de 61,3 tokens por segundo para la referencia en la nube.

Esto hace que la comparación sea menos espectacular de lo que sugiere una simple proporción en un gráfico de barras. FreeToken sigue pareciendo más rápido en la configuración citada, pero la diferencia se acerca más a una ventaja de rendimiento moderada cuando se utilizan denominadores equivalentes.

Tipo de mediciónQué incluyePor qué importa
Velocidad de decodificación puraGeneración de tokens después del inicioÚtil para comparar la salida sostenida
Tiempo hasta el primer tokenPreparación del modelo y retraso de la respuesta inicialImportante para la programación interactiva
Traza de extremo a extremoInicio, razonamiento, gestión del contexto y salidaMejor para flujos de trabajo de agentes realistas
Cifra de decodificación normalizadaRepresentación estandarizada del benchmarkDebe compararse utilizando la misma definición
Precaución con los benchmarks

Los resultados disponibles fueron producidos por los autores del proyecto. Considéralos pruebas técnicas útiles, pero valida el rendimiento con tu propio modelo, GPU, sistema operativo y carga de trabajo.

FreeToken frente a Llama.cpp para agentes de programación locales

La comparación más práctica no consiste simplemente en determinar qué motor informa de una mayor tasa de tokens. Lo importante es qué motor es compatible con el hardware, el formato del modelo y el flujo de implementación que ya utilizas.

FreeToken se centra en un problema específico de los sistemas: la colocación dinámica de expertos. Llama.cpp es más maduro y admite una gama más amplia de backends de hardware, incluidos Apple Metal, AMD, Vulkan y entornos orientados a dispositivos móviles. También ofrece una opción de mezcla de expertos en la CPU, aunque la comparación citada describe ese enfoque como estático en lugar de consciente del enrutamiento.

Para un desarrollador que utiliza una GPU Nvidia compatible, FreeToken puede ofrecer un experimento de rendimiento interesante. Para un equipo con hardware diverso, un propietario de un Mac o un usuario que necesita compatibilidad con GGUF y Docker, llama.cpp puede seguir siendo la referencia más conveniente.

Elige FreeToken

  • Hardware Nvidia CUDA
  • Modelos grandes de mezcla de expertos
  • Configuración Linux o Windows compatible
  • Prioridad en la eficiencia del enrutamiento local

Elige Llama.cpp

  • Sistemas Apple Silicon o AMD
  • Flujos de trabajo de modelos basados en GGUF
  • Compatibilidad más amplia con backends
  • Herramientas comunitarias maduras

Usa ambos

  • Compara dos veces el mismo modelo
  • Conserva una alternativa compatible
  • Compara la latencia y el rendimiento
  • Separa los experimentos de la producción
Factor de decisiónFreeTokenLlama.cpp
Gestión dinámica de MoEEnfoque principal del proyectoOpción de MoE estático en CPU citada
Amplitud de hardwareÉnfasis en Nvidia CUDASe citan 17 backends de hardware
Apple SiliconNo compatible según el estado citadoSe cita compatibilidad con Apple Metal
Compatibilidad con GGUFNo disponible según el estado citadoDe uso común en su ecosistema
Compatibilidad con DockerNo disponible según el estado citadoOpciones de implementación más consolidadas
Madurez de la comunidadProyecto inicial con dos colaboradores citadosBase de colaboradores más amplia y uso consolidado

El estado inicial del proyecto es importante. La discusión de lanzamiento citada informó de ocho incidencias abiertas en GitHub, incluidos fallos de instalación en Windows, ausencia de compatibilidad con Docker y GGUF, falta de modo para dos GPU y ausencia de compatibilidad con Apple Silicon. No son detalles menores si tu flujo de trabajo de agente de programación depende de contenedores reproducibles o de una estación de trabajo Mac.

La compatibilidad es lo primero

Un motor más rápido solo resulta útil cuando ejecuta tu modelo en tu entorno. Comprueba la compatibilidad con el sistema operativo, la GPU, el formato del modelo y la implementación antes de cambiar tu stack local.

Guía de configuración de FreeToken para un flujo de trabajo Codex local

FreeToken debe abordarse como un proyecto de configuración técnica, no como un asistente de programación de un solo clic. La implementación citada está asociada al repositorio de GitHub FlashML/FreeToken y a una versión de investigación con licencia Apache. Revisa la documentación del proyecto y el registro actual de incidencias antes de instalarlo.

El artículo está identificado como arXiv:2608.16157, enviado el 17 de agosto de 2026: lee el artículo de FreeToken. El código del proyecto se referencia como FlashML/FreeToken en GitHub. Confirma que estos enlaces y las revisiones compatibles coincidan con la implementación que pretendes realizar antes de continuar.

1

Confirma el hardware

Verifica que tu sistema utiliza una GPU Nvidia CUDA compatible y que dispone de suficiente RAM del sistema para los pesos de los expertos del modelo seleccionado. Un modelo MoE grande puede superar la VRAM varias veces.

2

Selecciona un modelo compatible

Empieza con un modelo de mezcla de expertos documentado y registra su número de parámetros, cuantización, longitud del contexto y requisitos de almacenamiento. No des por supuesto que todos los formatos de modelos populares son compatibles.

3

Prepara el runtime

Sigue las instrucciones de instalación del repositorio correspondientes a tu sistema operativo, versión de CUDA, dependencias de Python o nativas y requisitos del compilador. Mantén la configuración inicial aislada de tu entorno de producción.

4

Ejecuta una prueba controlada

Utiliza un prompt fijo, una longitud de contexto fija y ajustes de generación repetibles. Registra el tiempo hasta el primer token, los tokens por segundo sostenidos, el uso de memoria y cualquier advertencia de la caché de expertos.

5

Conecta el agente de programación

Conecta un editor, un cliente de API local o una interfaz de agente de programación solo después de que la configuración básica funcione. Mantén disponible un segundo backend de inferencia para modelos no compatibles o fallos inesperados.

Punto de control de configuraciónCondición de aprobaciónPreocupación habitual
GPUDispositivo Nvidia CUDA compatibleLa VRAM por sí sola quizá no resuelva las limitaciones de ancho de banda
Memoria del sistemaEspacio suficiente para los pesos del modelo y la sobrecarga del sistema operativoLos modelos MoE grandes pueden requerir cientos de gigabytes
Formato del modeloCompatible explícitamente con la compilación actualLa compatibilidad con GGUF figuraba como no disponible en el estado citado
Sistema operativoConfiguración Linux o Windows compatibleSe informaron problemas de instalación en Windows
Integración con el agenteEndpoint local o conexión estable con el clienteEl éxito en los benchmarks no garantiza la compatibilidad con el editor
Orden de pruebas recomendado

Empieza por la inferencia, mide después la repetibilidad y añade las herramientas del agente solo al final. De este modo, los problemas del motor quedan aislados de los problemas del editor, la API y la gestión de prompts.

Privacidad, costes y ventajas y desventajas prácticas

La razón más importante para investigar FreeToken codex no es necesariamente el precio. La inferencia local mantiene los prompts, el código fuente y las respuestas intermedias en un hardware que controlas. Esto puede ser valioso para repositorios privados, trabajos regulados o proyectos que no pueden enviarse a un servicio de programación alojado.

El análisis de costes citado compara una GPU de estación de trabajo con un precio superior a 4.000 $ en julio de 2026 con sesiones de agentes de programación en la nube. Estima que la misma compra de hardware podría equivaler aproximadamente a 500 sesiones medianas en un servicio premium citado o hasta 40.000 sesiones con el nivel de precios más económico de DeepSeek. Son cálculos ilustrativos, no una fórmula universal de retorno de la inversión.

El hardware local también introduce gastos que las comparaciones con la nube pueden omitir:

  • Compra o depreciación de la GPU
  • Electricidad y refrigeración
  • Almacenamiento para los archivos de los modelos
  • Ampliaciones de la memoria del sistema
  • Tiempo de configuración y mantenimiento
  • Trabajo de compatibilidad de controladores, compiladores y modelos
Ventaja o desventajaFlujo de trabajo local con FreeTokenAgente de programación alojado
PrivacidadEl código permanece en la infraestructura localLos datos pasan por un proveedor
Límites de usoDependen de la capacidad del hardware localDependen de los límites de la cuenta y del servicio
Coste inicialAlta inversión en hardwareNormalmente menor coste inicial
MantenimientoEl usuario administra el software y el hardwareEl proveedor administra la infraestructura
Disponibilidad de modelosLimitada por la compatibilidad local y la memoriaEl proveedor controla los modelos disponibles
Control a largo plazoEl hardware sigue disponible después de la configuraciónEl servicio y los precios pueden cambiar

Un sistema local también evita depender del calendario de retirada de modelos de un proveedor. Sin embargo, esa ventaja implica responsabilidad: debes actualizar los controladores, vigilar las temperaturas, proteger los endpoints locales y mantener copias de seguridad de los prompts y de la configuración del proyecto.

Antes de usar FreeToken para programar:

  • Confirma la compatibilidad con Nvidia CUDA y el sistema operativo
  • Mide el tiempo hasta el primer token y el rendimiento sostenido
  • Comprueba la compatibilidad con el formato y la cuantización del modelo
  • Protege la API local y los archivos del proyecto
  • Mantén disponible un runtime alternativo compatible
Valor más allá del precio

Para código sensible, la posibilidad de mantener los prompts y los repositorios localmente puede ser más importante que igualar el coste por token de un proveedor en la nube.

Preguntas frecuentes sobre FreeToken Codex

FreeToken se entiende mejor como un proyecto inicial de inferencia local para cargas de trabajo exigentes de mezcla de expertos. Puede resultar útil para desarrolladores a quienes les gusta ajustar sistemas y que disponen de hardware Nvidia compatible, pero no es un sustituto universal de los runtimes consolidados.

Q: ¿Qué es FreeToken codex?

FreeToken codex se refiere al uso del sistema de inferencia FreeToken como motor de un flujo de trabajo privado y local con un agente de programación. Su técnica central administra los pesos de la mezcla de expertos según el enrutamiento en tiempo de ejecución, en lugar de depender únicamente de una división fija de la memoria.

Q: ¿Puede FreeToken ejecutar un modelo de 753.000 millones de parámetros en una sola GPU?

El artículo citado del 17 de agosto de 2026 informa de un modelo de 753.000 millones de parámetros ejecutándose en una GPU de estación de trabajo. Los pesos completos no caben en la VRAM; FreeToken depende de la memoria del sistema, la activación selectiva de expertos, el almacenamiento en caché y las transferencias de datos.

Q: ¿Es FreeToken más rápido que llama.cpp?

Los benchmarks citados informan de un mayor rendimiento de FreeToken en varias pruebas MoE seleccionadas, incluidas Qwen 35B y GLM 5.2. Los resultados reales dependen del hardware, la configuración del modelo y de si las mediciones utilizan la misma definición de benchmark.

Q: ¿FreeToken es compatible con Mac, GGUF, Docker o dos GPU?

El estado citado del proyecto indicaba que no había compatibilidad con Apple Silicon, GGUF, Docker ni dos GPU el 25 de agosto de 2026. Comprueba el repositorio actual antes de instalarlo, ya que la compatibilidad puede cambiar después de la instantánea informada.

Recordatorio sobre el estado

FreeToken está evolucionando rápidamente. Vuelve a comprobar el repositorio oficial, las notas de lanzamiento y las incidencias abiertas el 25 de agosto de 2026 o después antes de considerar permanente cualquier detalle de compatibilidad.