FreeToken opencode: Guía de configuración de IA local para agentes de programación - Agentes

FreeToken opencode: Guía de configuración de IA local para agentes de programación

Aprende a conectar FreeToken con opencode, elegir hardware adecuado, gestionar grandes modelos MoE y solucionar problemas en flujos de trabajo locales con agentes de programación.

2026-08-25
Equipo de FreeToken
Guía rápida
  • FreeToken opencode conecta un motor de inferencia local con un flujo de trabajo de agente de programación de OpenCode.
  • Mejor caso de uso: Modelos grandes de mezcla de expertos que superan la memoria GPU disponible.
  • Ventaja principal: Caché adaptativa de expertos, transferencias superpuestas y decisiones sobre la carga de trabajo de la CPU/GPU.
  • Hardware recomendado: Linux, x86-64, GPU NVIDIA, CUDA 13, controladores recientes y suficiente RAM del sistema.
  • Limitación clave: FreeToken está especializado y no sustituye la amplia compatibilidad de hardware de los runtimes generales.

Descripción general de la integración de FreeToken con opencode

FreeToken opencode se entiende mejor como una configuración de agente de programación local, no como un modelo nuevo ni como un asistente independiente. FreeToken es un motor de inferencia diseñado para ejecutar modelos grandes en el hardware disponible, mientras que opencode proporciona el flujo de trabajo del agente de programación que lee archivos del proyecto, utiliza herramientas, actualiza el contexto y solicita la siguiente respuesta.

La integración es especialmente importante cuando el modelo seleccionado es demasiado grande para caber por completo en la VRAM de la GPU. En lugar de tratar la GPU, la CPU, la memoria del sistema y la conexión PCIe como limitaciones independientes, FreeToken intenta coordinarlas como un solo sistema. Este enfoque resulta especialmente útil durante sesiones de programación prolongadas, en las que un agente envía repetidamente prompts y resultados de herramientas que van cambiando.

Aspectos destacados del vídeo:

  • Los modelos grandes de mezcla de expertos pueden ejecutarse incluso cuando sus pesos completos superan la VRAM de la GPU.
  • La caché adaptativa de expertos ayuda a mantener disponibles para tokens posteriores los expertos utilizados con frecuencia.
  • Las pruebas del creador mostraron buenos resultados en hardware RTX 5090 y RTX 4060 para portátiles.
  • Las API compatibles con OpenAI y Anthropic pueden conectar la inferencia local con herramientas de programación.
  • Los contextos largos de los agentes son una prueba más significativa que un benchmark corto de generación de tokens.

La ventaja de rendimiento mencionada no es universal. Es más relevante cuando un modelo utiliza un diseño de mezcla de expertos y sus pesos deben dividirse entre la VRAM y la RAM del sistema. Si un modelo cuantizado más pequeño ya cabe por completo en la GPU, un runtime general maduro puede seguir siendo muy competitivo.

ComponenteFunción en la configuraciónPor qué es importante
FreeTokenMotor de inferencia localCoordina la ejecución del modelo entre la GPU, la CPU, la RAM y PCIe
opencodeInterfaz del agente de programaciónGestiona archivos, herramientas, prompts y tareas de desarrollo de varios turnos
Modelo MoEArquitectura del modeloActiva expertos seleccionados en lugar de todos los parámetros para cada token
RAM del sistemaAlmacenamiento de pesos y espacio de desbordamientoContiene los datos del modelo que no caben en la VRAM de la GPU
GPU NVIDIADispositivo de cálculo aceleradoGestiona el cálculo activo y los expertos almacenados en caché cuando es posible
Configuración ideal

Elige esta combinación cuando tu modelo de programación sea demasiado grande para la VRAM, pero aún quepa dentro del presupuesto total de memoria del ordenador. Ahí es donde la especialización de FreeToken ofrece su valor más claro.

Requisitos de hardware y del modelo

Antes de configurar opencode, comprueba si el equipo coincide con la ruta acelerada documentada. El material disponible describe una configuración centrada en Linux, un equipo x86-64, una GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto destaca las tarjetas de las series RTX 30, RTX 40 y RTX 50, pero el rendimiento real depende de la GPU exacta, el procesador, el ancho de banda de memoria, la conexión PCIe, el formato del modelo y la longitud del contexto.

La RAM del sistema es tan importante como la VRAM. Una tarjeta gráfica con 8 GB de VRAM no reduce un modelo de 35.000 millones de parámetros a una instalación de 8 GB. Los pesos restantes todavía necesitan residir en algún otro lugar, y para operar de forma práctica se requieren checkpoints de baja precisión.

RequisitoSignificado prácticoQué comprobar antes de la configuración
Sistema operativoLinux es el enfoque documentado para la línea de comandosConfirma tu distribución y entorno de terminal
Arquitectura de CPUEquipo x86-64Verifica la plataforma del procesador
GPUHardware NVIDIA con aceleración compatibleIdentifica el modelo RTX exacto y la capacidad de VRAM
CUDACUDA 13 es necesaria según el comando documentadoComprueba la compatibilidad del toolkit instalado y del controlador
Memoria del sistemaAlmacena los pesos fuera de la VRAMReserva suficiente RAM para el checkpoint seleccionado
Formato del modeloCheckpoint compatible de Hugging FaceConfirma que la familia y la precisión del modelo sean compatibles
Capacidad de contextoLas sesiones más grandes requieren más memoriaPlanifica espacio para archivos, resultados de herramientas y prompts repetidos

Los ejemplos publicados muestran por qué es importante el equilibrio general del sistema. Se utilizó un portátil RTX 4060 con 8 GB de VRAM y 32 GB de memoria del sistema junto con un checkpoint Qwen3.6 35B A3B de 4 bits. El modelo no cabía por completo en la VRAM, pero la velocidad de generación indicada fue de aproximadamente 39,3 tokens por segundo. Otro ejemplo de estación de trabajo utilizó una capacidad de memoria mucho mayor para ejecutar un modelo de 753.000 millones de parámetros.

Estas cifras deben considerarse puntos de referencia, no resultados garantizados. El modelo, la cuantización, la longitud del prompt, el controlador, la velocidad de la memoria y la carga de trabajo pueden cambiar el resultado.

GPU pequeña, modelo grande

  • Útil cuando los pesos del modelo superan la VRAM
  • Requiere suficiente RAM del sistema
  • Es sensible a PCIe y al ancho de banda de memoria

Sistema NVIDIA de gama alta

  • Mayor capacidad de caché
  • Más espacio para contextos largos
  • Buen candidato para agentes MoE grandes

El modelo cabe en la VRAM

  • Menos cuellos de botella por transferencias
  • Los runtimes generales siguen siendo competitivos
  • La ventaja de FreeToken puede ser menor
La realidad de la memoria

FreeToken mejora el uso del hardware disponible; no elimina el requisito de almacenamiento del checkpoint completo. Confirma la capacidad total de RAM antes de descargar o iniciar un modelo grande.

Cómo mejora FreeToken el rendimiento de los agentes locales

El principal objetivo de diseño de FreeToken es resolver el problema de transferencias creado por los grandes modelos de mezcla de expertos. Un modelo MoE puede contener cientos de miles de millones de parámetros totales y activar solo un subconjunto menor para cada token. Por tanto, el cálculo puede ser manejable, pero el conjunto completo de pesos aún debe almacenarse y estar disponible.

El runtime utiliza tres estrategias importantes:

  1. Caché adaptativa de expertos mantiene en la VRAM los expertos seleccionados con frecuencia. Cuando tokens cercanos utilizan repetidamente expertos similares, el motor puede evitar volver a obtener los mismos pesos desde la RAM del sistema.
  2. Ejecución superpuesta prepara el trabajo siguiente mientras la GPU procesa la capa actual. Las transferencias siguen produciéndose, pero parte de la espera puede ocultarse detrás del cálculo activo.
  3. Distribución consciente del hardware estima si un experto debe transferirse a la GPU o ejecutarse directamente en la CPU. La decisión puede tener en cuenta el ancho de banda de memoria real y el comportamiento de PCIe, en lugar de depender de una división fija.
OptimizaciónProblema abordadoBeneficio para las sesiones de opencode
Caché de expertosTransferencias repetidas de expertos popularesGeneración más consistente durante solicitudes relacionadas
Trabajo superpuestoTiempo de inactividad de la GPU durante el movimiento de pesosMenos espera entre capas
Selección de CPU/GPUCada equipo favorece distribuciones diferentesMejor adaptación al hardware local
Asignación dinámica de VRAMCompetencia entre la caché y el contextoMás flexibilidad durante conversaciones largas
Reutilización del contextoReprocesamiento de secciones sin cambios del promptTurnos de seguimiento más rápidos en los flujos de trabajo de agentes

Un benchmark con un prompt corto puede no mostrar todo el beneficio. Un agente de opencode puede leer archivos fuente, llamar a una herramienta de shell o del proyecto, recibir el resultado, modificar su contexto y enviar otra solicitud. Algunas sesiones pueden superar los 50.000 tokens. Cuando solo cambia una parte de la conversación, resulta importante reutilizar la sección que no ha cambiado.

Por ello, la evaluación más significativa es la finalización de tareas con llamadas repetidas a herramientas. Mide el tiempo hasta el primer token nuevo, la consistencia de las respuestas entre turnos y el tiempo total de espera, no solo la cifra final de tokens por segundo.

Principio de rendimiento

Para los agentes de programación locales, un tiempo de respuesta estable durante muchos turnos puede importar más que la mayor velocidad obtenida con un único prompt aislado. Prueba el flujo de trabajo que realmente utilizas en opencode.

Configuración paso a paso de FreeToken opencode

Utiliza la siguiente secuencia para preparar una conexión con un agente de programación local. Los comandos exactos pueden cambiar a medida que evolucione el proyecto, así que adapta cada comando a la versión actual de FreeToken y a la documentación del modelo compatible.

1

Verifica el equipo

Confirma Linux, arquitectura x86-64, una GPU NVIDIA, un controlador reciente, CUDA 13 y suficiente RAM del sistema. Anota el modelo de GPU, el tamaño de la VRAM, la capacidad de RAM y la configuración PCIe antes de seleccionar un checkpoint.

2

Selecciona un modelo compatible

Elige un checkpoint compatible de Hugging Face, preferiblemente un modelo MoE que se beneficie de dividir los pesos entre la VRAM y la memoria del sistema. Comprueba la precisión del modelo y su requisito de memoria estimado.

3

Instala e inicia FreeToken

Sigue la ruta de instalación acelerada para Linux del proyecto y, después, inicia el servidor local con el checkpoint seleccionado. Deja suficiente memoria para el sistema operativo, el contexto, la caché y los resultados de las herramientas de opencode.

4

Conecta opencode

Utiliza la configuración de API local compatible o el comando de agente de programación admitido por el proyecto. Selecciona el proveedor local en opencode y confirma que una solicitud sencilla devuelve una respuesta.

5

Ejecuta una prueba con un proyecto real

Abre un repositorio pequeño, pide al agente que inspeccione un archivo, realice una llamada a una herramienta y haga un cambio limitado. Registra el retraso hasta el primer token, la velocidad de generación, el uso de memoria y si el servidor mantiene la capacidad de respuesta entre turnos.

La primera prueba debe ser deliberadamente pequeña. Evita comenzar con un repositorio enorme o un prompt extremadamente largo, ya que un fallo podría deberse al tamaño del contexto y no a la conexión. Cuando una tarea breve con llamadas a herramientas funcione, aumenta gradualmente el tamaño del proyecto y del contexto.

Etapa de configuraciónSeñal de éxitoSi falla
Controlador y CUDALa GPU es visible para el runtimeVuelve a comprobar las versiones y el hardware compatible
Carga del modeloEl checkpoint se inicializa sin errores de memoriaUtiliza un modelo más pequeño o de menor precisión
Servidor localLa API responde a una solicitud básicaInspecciona los registros de inicio y la configuración del endpoint
Conexión con opencodeEl agente recibe una respuesta válida del modeloVuelve a comprobar el proveedor y la configuración del modelo
Flujo de herramientasSe completan la inspección de archivos y una llamada a una herramientaReduce el contexto y prueba las herramientas por separado
Consejos de configuración

Mantén sencilla la primera solicitud de opencode y valida después por separado el acceso a los archivos y las llamadas a herramientas. Así aislarás los problemas del modelo, la API y el agente en lugar de depurar todas las capas a la vez.

Benchmarking y solución de problemas

Un benchmark útil de FreeToken opencode debe representar el trabajo de desarrollo normal. Compara el mismo modelo, checkpoint, prompt, proyecto y secuencia de herramientas entre distintos runtimes. Registra tanto el rendimiento como el retraso, porque un agente puede parecer lento incluso cuando su velocidad final de generación parece razonable.

Las comparaciones publicadas mostraron un comportamiento especialmente sólido con contextos largos y cambiantes. En las pruebas del creador, se indicó que Qwen3.6 35B A3B alcanzaba aproximadamente entre 77 y 83 tokens por segundo en una RTX 5090, mientras que DeepSeek V4 Flash alcanzaba entre 22 y 25 tokens por segundo. Estos resultados proceden de pruebas del proyecto y no deben considerarse garantías independientes. Una prueba inicial de la comunidad en una RTX 5080 también indicó aproximadamente 100 tokens por segundo para Qwen3.6 35B A3B, con un ejemplo cercano a 110 tokens por segundo.

MétricaQué medirPor qué importa
Tiempo hasta el primer tokenRetraso antes de que comience una nueva respuestaLas pausas prolongadas pueden hacer que el agente parezca no disponible
Velocidad de generaciónTokens por segundo después del inicioMuestra el rendimiento de salida sostenido
Crecimiento del contextoComportamiento de la respuesta a medida que se amplían los promptsRevela la estabilidad durante sesiones largas
Latencia de herramientasTiempo entre el resultado de una herramienta y la siguiente respuestaRefleja la utilidad real del agente
Presión de memoriaUso de VRAM y RAM durante los turnosAyuda a identificar sobrecarga o uso de memoria virtual
Finalización de tareasSi el cambio solicitado se completa correctamenteConecta las cifras del benchmark con el valor práctico

Utiliza este orden para solucionar problemas:

  • Si el modelo no se carga, comprueba primero la RAM total y la precisión del checkpoint.
  • Si el inicio funciona pero las respuestas se detienen, inspecciona la longitud del contexto y la presión de las transferencias.
  • Si el rendimiento varía mucho, compara el comportamiento de la caché, el ancho de banda de PCIe y el uso de memoria en segundo plano.
  • Si opencode no puede conectarse, prueba la API local de forma independiente antes de cambiar la configuración del agente.
  • Si un modelo ya cabe por completo en la VRAM, compáralo con un runtime general utilizando el mismo prompt y contexto.

Antes de ejecutar una sesión de programación larga:

  • Confirma Linux, x86-64, GPU NVIDIA, CUDA 13 y controladores recientes
  • Verifica que la RAM del sistema pueda contener la parte que queda fuera de la VRAM de la GPU
  • Utiliza un checkpoint compatible de Hugging Face y de baja precisión
  • Prueba la API local antes de abrir un repositorio grande
  • Mide el retraso hasta el primer token y la estabilidad durante varios turnos
Compara de forma justa

No compares un modelo MoE grande descargado parcialmente en la memoria del sistema con un modelo pequeño que cabe por completo en la VRAM. Iguala la familia del modelo, la precisión, el prompt, el contexto y la tarea antes de sacar conclusiones.

Limitaciones y recomendación final

FreeToken no es un sustituto universal para todos los flujos de trabajo de inferencia local. La ruta acelerada documentada es más limitada que la de los runtimes generales compatibles con varios sistemas operativos, procesadores, fabricantes de GPU y ecosistemas de modelos. El material disponible también describe un fuerte enfoque en Linux y hardware NVIDIA, sin identificar una ruta comparable para Apple Silicon.

Su ventaja es la especialización. Si tu ordenador tiene una GPU NVIDIA, suficiente RAM del sistema y un modelo MoE grande que no cabe en la VRAM, FreeToken puede ofrecer una base más adecuada para opencode que una división estática entre CPU y GPU. El beneficio resulta más convincente cuando el agente vuelve repetidamente con contextos largos y cambiantes.

Caso de usoRecomendaciónMotivo
El modelo MoE grande supera la VRAMCandidato sólidoLa distribución adaptativa está orientada a este cuello de botella
Sesiones largas de opencode con herramientasVale la pena probarloLa reutilización del contexto y la estabilidad entre turnos son importantes
El modelo pequeño cabe en la VRAMCompara primeroOtros runtimes pueden ser ya muy rápidos
Ordenador con Apple SiliconNo asumas compatibilidadAquí no se ha establecido una compatibilidad acelerada comparable
Compatibilidad con hardware diversoConsidera alternativasLa ruta documentada de FreeToken es más especializada
Máxima amplitud del ecosistema de modelosUtiliza un runtime más generalFreeToken no es compatible con todos los formatos y dispositivos

Para tomar una decisión práctica, comienza con un modelo compatible y un repositorio pequeño. Si FreeToken reduce los retrasos hasta el primer token y mantiene un rendimiento utilizable durante llamadas repetidas a herramientas, amplía la configuración. Si el modelo cabe cómodamente en la VRAM o tu hardware está fuera de la ruta documentada, un runtime de propósito general puede ser una opción más predecible.

La conclusión principal es sencilla: FreeToken opencode es una combinación de IA local orientada a modelos de programación MoE demasiado grandes. Utiliza la coordinación mediante software para aprovechar mejor el ordenador completo, pero sigue dependiendo de una capacidad de memoria real y de hardware compatible.

Q: ¿Qué es FreeToken opencode?

Es una configuración de agente de programación local que combina el motor de inferencia FreeToken con opencode. FreeToken ejecuta el modelo, mientras que opencode gestiona los archivos del proyecto, las herramientas, los prompts y las tareas de programación de varios turnos.

Q: ¿FreeToken hace que un modelo grande quepa dentro de una GPU pequeña?

No. Puede mantener parte del modelo en la RAM del sistema y coordinar la ejecución entre la CPU y la GPU, pero el checkpoint completo sigue necesitando suficiente memoria total.

Q: ¿Qué modelos se benefician más de FreeToken?

Los modelos grandes de mezcla de expertos son el objetivo más claro, porque solo se activan determinados expertos para cada token mientras el modelo completo sigue siendo más grande que la VRAM disponible.

Q: ¿Debería usar FreeToken en lugar de un runtime local general?

Prueba ambos con el mismo modelo y flujo de trabajo de opencode. FreeToken resulta más atractivo cuando el modelo supera la VRAM y el agente utiliza sesiones largas con llamadas repetidas a herramientas.

Punto de partida recomendado

Comienza con un checkpoint MoE compatible, un repositorio pequeño y una prueba breve con llamadas a herramientas. Amplía la configuración solo después de que el uso de memoria, la conectividad de la API y los tiempos de respuesta entre turnos sean estables.