FreeToken windows: Guía de configuración, límites y rendimiento - Guía

FreeToken windows: Guía de configuración, límites y rendimiento

Aprende a configurar FreeToken en Windows, comprobar los requisitos de hardware, conectar agentes de programación compatibles y comprender los límites de rendimiento actuales.

2026-08-25
Equipo de FreeToken
Guía rápida
  • La compatibilidad con FreeToken windows está disponible mediante la aplicación de escritorio para Windows.
  • El mejor hardware es una GPU NVIDIA reciente con suficiente memoria del sistema.
  • El caso de uso principal es servir modelos de Mixture-of-Experts de forma local.
  • La compatibilidad de API incluye endpoints compatibles con OpenAI y Anthropic.
  • La principal limitación es una cobertura de hardware más reducida que la de los motores locales consolidados.

FreeToken windows: qué admite la plataforma

FreeToken windows se entiende mejor como un entorno local para servir IA que como un juego o una aplicación para consumidores. La versión para Windows está diseñada para permitir que los desarrolladores ejecuten modelos de lenguaje de pesos abiertos en su propio ordenador, tratando la GPU, la CPU, la memoria del sistema y la conexión PCIe como una única plataforma de inferencia elástica.

El enfoque práctico es el servicio de modelos Mixture-of-Experts. Estos modelos contienen un gran conjunto de expertos, pero solo se activa un pequeño grupo de expertos para cada token. Esto hace que la inferencia a escala de frontera sea más accesible en una estación de trabajo personal, aunque el modelo completo todavía debe permanecer accesible mediante la memoria del host y el almacenamiento.

Aspectos destacados del vídeo:

  • FreeToken está orientado a la inferencia local de modelos dispersos de gran tamaño.
  • La caché consciente del enrutamiento reduce las transferencias innecesarias de expertos.
  • Los resultados comunicados incluyen modelos 35B en una GPU de portátil de 8 GB.
  • El proyecto se presenta como una alternativa inicial a los motores locales consolidados.
Área de la plataformaSituación actualQué significa
Aplicación de escritorio para WindowsDisponibleEl punto de entrada más sencillo para los usuarios de Windows
Implementación mediante línea de comandosCentrada principalmente en LinuxLos usuarios avanzados pueden preferir Linux para flujos de trabajo de servidor
GPU objetivoNVIDIA CUDALa compatibilidad de hardware es más limitada que en llama.cpp
Capa de APICompatible con OpenAI y AnthropicLas herramientas de programación existentes pueden conectarse mediante endpoints locales
LicenciaApache-2.0Adecuada para inspección, experimentación e integración
El mejor punto de partida

Usa primero la aplicación de escritorio para Windows si quieres realizar una prueba local sencilla. Pasa a la implementación mediante línea de comandos solo cuando necesites servir modelos mediante scripts, realizar pruebas de rendimiento o automatizar agentes.

El empaquetado público del proyecto identifica distribuciones de escritorio para Windows y Linux, mientras que el flujo de trabajo mediante línea de comandos está centrado en sistemas Linux x86_64 con hardware NVIDIA y un controlador CUDA reciente. Esta distinción es importante: un usuario de Windows puede comenzar rápidamente, pero no debe esperar que todos los comandos o patrones de implementación orientados a Linux funcionen exactamente igual en Windows.

Para obtener contexto técnico adicional, consulta la descripción general del servicio edge-native de FreeToken.

Guía de configuración de Windows: instalar y conectar FreeToken

Una configuración fiable de FreeToken windows comienza con las comprobaciones de hardware, seguida de la instalación de la aplicación y las pruebas del endpoint. Evita cargar inmediatamente un modelo grande. Primero confirma que la aplicación se abre, que se detecta la GPU y que el servicio local puede aceptar una solicitud básica.

1

Comprueba el hardware de Windows

Confirma que el ordenador tiene una GPU NVIDIA compatible, controladores gráficos actualizados, suficiente memoria del sistema para el modelo seleccionado y espacio de disco adecuado para los archivos del modelo. Una GPU de portátil de 8 GB puede servir un modelo 35B con la configuración NVFP4 comunicada, pero el formato del modelo y los requisitos de memoria siguen siendo importantes.

2

Instala la aplicación para Windows

Descarga la versión de escritorio para Windows desde la página oficial de distribución del proyecto. Usa el instalador estándar o la aplicación empaquetada y permite que el programa complete sus primeras comprobaciones de hardware y del entorno de ejecución antes de importar un modelo.

3

Selecciona un modelo compatible

Comienza con un modelo cuya cuantización y arquitectura aparezcan en la lista de elementos compatibles. FreeToken es especialmente relevante para modelos MoE dispersos, en los que la colocación de expertos consciente del enrutamiento puede reducir los cuellos de botella de transferencia.

4

Inicia el endpoint local

Inicia el proceso de servicio y verifica el puerto local configurado. El endpoint documentado utiliza el puerto 1919 y admite formatos de solicitud compatibles con OpenAI y Anthropic.

5

Conecta tu agente de programación

Dirige un cliente compatible, como Claude Code, Codex, OpenCode u OpenClaw, al endpoint local. Ejecuta primero una solicitud breve y después prueba una tarea de programación más larga mientras supervisas el uso de memoria y la latencia de respuesta.

Comprobación de configuraciónAcción recomendadaMotivo
Controlador de GPUActualízalo antes de la instalaciónLas cargas de trabajo CUDA dependen de la compatibilidad del controlador
Memoria del sistemaDeja espacio para Windows y otros procesosLos pesos de los expertos pueden permanecer en la memoria del host
Formato del modeloUsa una compilación compatible incluida en la listaLos formatos no compatibles pueden fallar antes de la inferencia
Puerto localConfirma que el puerto 1919 esté libreEl servicio necesita un endpoint accesible
Primera solicitudUsa una solicitud de prueba breveUna prueba pequeña permite aislar los problemas de configuración
Advertencia de compatibilidad con Windows

La aplicación de escritorio y el entorno de línea de comandos de Linux no son intercambiables. Si un comando, backend de aceleración o flujo de trabajo de modelos está documentado para Linux, verifica la compatibilidad con Windows antes de utilizarlo en producción.

La arquitectura de FreeToken pretende evitar una regla fija que envíe cada fallo de caché a un único lado del sistema. En su lugar, su política adaptativa al ancho de banda puede dividir el trabajo de los expertos no encontrados entre las transferencias PCIe y la ejecución en la CPU. Esto resulta útil cuando la caché de la GPU no puede contener todo el conjunto de expertos.

Para la primera sesión, mantén una configuración conservadora:

  • Usa un solo modelo en lugar de probar varios simultáneamente.
  • Cierra otras aplicaciones que consuman muchos recursos de la GPU.
  • Observa la memoria de la GPU, la memoria del sistema y la actividad del disco.
  • Registra por separado el tiempo hasta el primer token y la velocidad de decodificación estable.
  • Detén la prueba si Windows empieza a utilizar intensamente el archivo de paginación.

Cómo gestiona FreeToken la inferencia MoE local

El diseño central de FreeToken se basa en la diferencia entre las necesidades de computación dispersa y las necesidades de almacenamiento denso. Un modelo puede activar solo una fracción de sus parámetros para cada token, pero el conjunto completo de expertos debe seguir estando disponible porque el enrutador puede seleccionar expertos diferentes para el token siguiente.

En DeepSeek-V4-Flash, la arquitectura descrita contiene 256 expertos enrutados distribuidos en 43 capas, con seis expertos activados por token. Esto significa que aproximadamente 13B parámetros realizan el cálculo inmediato, mientras que el conjunto mucho mayor sigue formando parte del problema de servicio.

MecanismoFunciónImpacto para el usuario de Windows
Ejecución adaptativa al ancho de bandaDivide los fallos de caché entre las cargas en la GPU y el trabajo de la CPUPuede reducir la presión sobre el enlace PCIe
Caché consciente de la semánticaConserva estados útiles alrededor del razonamiento y los límites de las herramientasAyuda en flujos de trabajo repetidos con agentes
Caché LRU compartida de expertosRastrea el enrutamiento entre las capas MoESe adapta a la demanda cambiante token a token
Gestión elástica de memoriaReconstruye la caché de la GPU con un presupuesto revisadoPermite ajustar la configuración sin recargar por completo
Diseño directo del hostLee los expertos en su disposición final de memoriaReduce el trabajo de preparación innecesario

La estrategia de caché es especialmente importante durante las cargas de trabajo con agentes. Los agentes de programación suelen generar contextos largos, invocar herramientas, recibir sus resultados y continuar con el razonamiento. Una caché que siga esos límites semánticos puede evitar más trabajo repetido que una política de colocación fijada únicamente por el número de capa.

La comparación comunicada con cachés de igual capacidad otorga a FreeToken una tasa de fallos de lectura de expertos durante la decodificación inferior a la de las líneas base probadas:

Motor o políticaTasa comunicada de fallos de lectura de expertosInterpretación
LRU compartida de FreeToken16%Comportamiento de caché más consciente del enrutamiento
Política de KTransformers41%Mayor frecuencia de fallos con la misma capacidad
Colocación estática de llama.cpp62%La colocación fija responde peor a los cambios de enrutamiento
Por qué es importante el diseño

FreeToken no necesita cambiar el enrutador del modelo ni aproximar la salida de los expertos. Su ventaja proviene de decidir si un experto no encontrado debe transferirse, calcularse en la CPU o conservarse en la caché de la GPU.

Este enfoque no elimina las limitaciones del hardware. Por lo general, las CPU de consumo ofrecen mucho menos ancho de banda de memoria que una GPU moderna, y los enlaces PCIe de los portátiles pueden ser más estrechos que los de las conexiones de escritorio. Por ello, FreeToken se beneficia de medir la máquina implementada en lugar de aplicar una única regla universal de descarga.

Expectativas de rendimiento y comparación con líneas base

El rendimiento depende del modelo, la cuantización, el presupuesto de caché, la GPU, la memoria del sistema, el enlace PCIe y la forma de la carga de trabajo. Considera las cifras publicadas como puntos de referencia, no como garantías para todos los ordenadores con Windows.

Las mediciones comunicadas incluyen buenos resultados tanto en hardware de escritorio como de portátil:

Carga de trabajoHardwareResultado de FreeTokenComparación indicada
Qwen3.6-35B-A3B, BF16RTX 509077–83 tok/sAproximadamente 1,8–2,3× la línea base probada más potente
DeepSeek-V4-Flash, MXFP4RTX 509022–25 tok/sAproximadamente 1,5–1,9× la línea base probada más potente
Modelo 35B, NVFP4RTX 4060 de portátil, 8 GB39,3 tok/sPor encima de la mediana comunicada de 33 tok/s en trazas de producción
GLM-5.2, 753B, 40B activosRTX PRO 600014,9 tok/sFrente a 7,3 tok/s con llama.cpp
TTFT en el peor casoMatriz probadaMenos de 44 segundosLas líneas base alcanzaron 179–946 segundos en algunas celdas

La métrica más útil para los agentes de programación puede ser la latencia de cola en lugar del rendimiento máximo de tokens. Un sistema que ofrece una tasa media alta, pero que ocasionalmente se bloquea más allá del tiempo de espera del cliente, puede ser menos práctico que un sistema más lento con un comportamiento de finalización predecible.

Mejor opción

  • GPU NVIDIA reciente
  • Gran capacidad de memoria del sistema
  • Modelos MoE
  • Agentes de programación de larga duración

Opción posible

  • GPU de portátil de 8 GB
  • Modelo 35B cuantizado
  • Experimentación local moderada
  • Supervisión cuidadosa de la memoria

Mala opción

  • Proveedor de GPU no compatible
  • Configuración exclusiva de Apple Silicon
  • Hardware NVIDIA antiguo
  • Poca capacidad de memoria del sistema

Una alternativa consolidada puede seguir siendo la mejor opción cuando la prioridad sea una amplia compatibilidad de hardware. La comparación citada describe llama.cpp como compatible con muchos más backends y plataformas, incluidos Apple Metal y AMD Vulkan. El valor actual de FreeToken es más especializado: se centra en la inferencia MoE local y consciente del enrutamiento en sistemas NVIDIA compatibles.

Consejos para las pruebas de rendimiento

Mide por separado el tiempo hasta el primer token, la velocidad de decodificación estable y la latencia del peor turno. Una única cifra de tokens por segundo no puede describir una carga de trabajo interactiva con un agente de programación.

Al comparar tu resultado en Windows con una prueba de rendimiento publicada, iguala estas variables tanto como sea posible:

  • Pesos y cuantización idénticos del modelo.
  • Longitud de solicitud y tamaño de contexto similares.
  • Capacidad equivalente de caché de la GPU.
  • El mismo agente o patrón de solicitudes.
  • La misma definición de medición para el prellenado, el TTFT y la decodificación.

Lista de comprobación de Windows y prioridades de resolución de problemas

Utiliza esta lista de comprobación antes de considerar que una instalación de FreeToken está preparada para el trabajo diario. El objetivo no es simplemente iniciar un modelo, sino establecer un flujo de trabajo local estable que no falle cuando el contexto crezca o un agente llame a varias herramientas.

Lista de comprobación de preparación para Windows:

  • Instala el controlador NVIDIA actual y confirma que se detecta la GPU
  • Verifica que haya suficiente memoria del sistema y espacio en disco para el modelo MoE seleccionado
  • Inicia una solicitud local pequeña antes de conectar un agente de programación
  • Confirma que el endpoint local y el puerto 1919 responden correctamente
  • Registra el TTFT, la velocidad de decodificación, el uso de memoria y la latencia del peor turno
SíntomaÁrea probable que se debe inspeccionarRespuesta práctica
La aplicación falla durante el inicioIncompatibilidad del controlador o del entorno de ejecuciónActualiza el controlador NVIDIA y vuelve a intentarlo
Falla la importación del modeloCompatibilidad del formato o de la arquitecturaElige una compilación compatible documentada
Primera respuesta muy lentaPresión durante el prellenado o sobre la memoriaReduce el contexto y cierra las aplicaciones en segundo plano
Pausas largas durante la decodificaciónCuello de botella de PCIe o de la memoria del hostReduce la carga del modelo o ajusta la configuración de la caché
El agente no puede conectarseConfiguración del endpoint o del puertoConfirma la dirección del servicio y el puerto 1919
Windows deja de responderPaginación o memoria insuficienteDetén la ejecución y reduce el tamaño de la carga de trabajo

No asumas que una primera respuesta correcta demuestra que la configuración está en buen estado. Ejecuta una solicitud más larga y una tarea asistida por herramientas. Las cargas de trabajo con agentes pueden revelar problemas de prellenado, caché y latencia de cola que permanecen invisibles durante una conversación breve.

La estabilidad es lo primero

Si el rendimiento es irregular, reduce la longitud del contexto o el tamaño del modelo antes de cambiar varios ajustes a la vez. Un único cambio controlado facilita identificar la causa.

FreeToken también es un proyecto inicial, por lo que su experiencia en Windows puede cambiar a medida que se amplíen el empaquetado, la cobertura de hardware y la compatibilidad de modelos. Guarda una configuración de modelo que sepas que funciona, documenta la versión del controlador y evita eliminar el entorno operativo hasta haber probado una actualización.

Preguntas frecuentes sobre FreeToken para Windows

Q: ¿FreeToken está disponible en Windows?

Sí. Se describe que el proyecto ofrece una aplicación de escritorio para Windows, junto con opciones de distribución para Linux. El flujo de trabajo mediante línea de comandos está más centrado en Linux, por lo que los usuarios de Windows deberían comenzar con la versión de escritorio.

Q: ¿Qué GPU se recomienda para FreeToken en Windows?

El enfoque de implementación actual es el hardware NVIDIA CUDA. Una GPU NVIDIA reciente con suficiente memoria del sistema es el punto de partida más seguro, aunque la compatibilidad exacta depende de la arquitectura y la cuantización seleccionadas.

Q: ¿Puede FreeToken ejecutar modelos MoE grandes en un portátil?

Las pruebas comunicadas incluyen un modelo 35B a 39,3 tokens por segundo en una GPU de portátil RTX 4060 de 8 GB. Tus resultados pueden variar según la memoria, el ancho de banda PCIe, los controladores, la cuantización y la longitud del contexto.

Q: ¿Qué aplicaciones pueden conectarse a un endpoint local de FreeToken?

El flujo de trabajo documentado admite endpoints compatibles con OpenAI y Anthropic, con integraciones mencionadas para Claude Code, Codex, OpenCode y OpenClaw.

Mantén expectativas realistas

FreeToken es un motor especializado para servir modelos localmente, no un reemplazo universal para todos los backends de inferencia. Confirma la compatibilidad de Windows, la GPU, el modelo y el cliente antes de trasladar proyectos importantes.

Para la mayoría de los usuarios de Windows, el camino recomendado es sencillo: instala la versión de escritorio, verifica la aceleración NVIDIA, prueba un modelo moderado y después conecta un agente. FreeToken resulta especialmente atractivo cuando tu carga de trabajo depende de modelos MoE grandes y de la ejecución local, donde la caché consciente del enrutamiento y la reducción de la latencia de cola pueden importar más que una simple gráfica de velocidad media.