- La instalación de FreeToken requiere una GPU compatible con CUDA, memoria del sistema, almacenamiento y un entorno de ejecución compatible.
- Ubicación de la versión: El sistema se anuncia para su lanzamiento a través del canal oficial del proyecto FlashML.
- Configuración principal: Prepara los pesos del modelo, el almacenamiento de expertos en el host, espacio para la caché de la GPU y valores de ancho de banda medidos.
- Limitación importante: El material de referencia disponible no publica un comando de instalación listo para copiar y pegar.
- Buena práctica: Verifica las instrucciones de la versión actual antes de convertir los pesos del modelo o iniciar el motor.
Instalación de FreeToken: requisitos del sistema
FreeToken es un sistema de servicio nativo para edge destinado a modelos grandes de Mezcla de Expertos (MoE). No es un juego, un título de personajes descargable ni un servicio de códigos de canje. Por lo tanto, el proceso de instalación se centra en la inferencia mediante GPU, la memoria del host, la compatibilidad con CUDA, el almacenamiento del modelo y la configuración del entorno de ejecución.
El diseño publicado está orientado a ordenadores personales, estaciones de trabajo y portátiles en los que el conjunto completo de expertos puede superar la VRAM disponible. FreeToken mantiene el conjunto completo de expertos enrutados en la memoria del host y utiliza la memoria de la GPU como una caché elástica de expertos. Los pesos que no pertenecen a expertos permanecen en la GPU, y la capacidad de la caché puede cambiar a medida que otras aplicaciones consumen o liberan VRAM.
Considera FreeToken como un despliegue de sistemas, no como una aplicación de un solo clic. La creación de perfiles del hardware, la preparación del modelo y la planificación de la memoria forman parte de la configuración, ya que la programación del entorno de ejecución depende de la máquina real.
Nivel de GPU
Una GPU CUDA discreta proporciona la ruta principal de ejecución. La evaluación de referencia abarca desde GPU de portátiles con 8 GB hasta hardware de clase estación de trabajo.
Memoria del host
La memoria del sistema almacena el conjunto completo de expertos y proporciona el ancho de banda necesario para ejecutar expertos en la CPU cuando se producen fallos de caché en la GPU.
Almacenamiento rápido
El almacenamiento NVMe es importante durante el arranque. FreeToken puede cargar los pesos preparados directamente en su disposición final en el host.
La distinción más importante es entre capacidad y rendimiento. El modelo completo no tiene que caber enteramente en la VRAM, pero el host debe contener el conjunto de expertos y proporcionar suficiente ancho de banda de transferencia para lograr una latencia aceptable.
| Recurso | Función en FreeToken | Prioridad de configuración |
|---|---|---|
| VRAM de la GPU | Almacena los pesos que no son de expertos, la caché KV y las ranuras elásticas de expertos | Alta |
| Memoria del host | Contiene el conjunto completo de expertos enrutados | Alta |
| Enlace PCIe | Mueve los expertos seleccionados a la caché de la GPU | Alta |
| Ancho de banda de la CPU | Ejecuta los fallos residuales de expertos desde la memoria del host | Alta |
| Almacenamiento NVMe | Carga los datos del modelo durante el arranque | Media |
| Entorno CUDA | Admite los kernels de la GPU y las rutas de ejecución capturadas | Alta |
El sistema de referencia indica que el equilibrio del hardware importa más que las suposiciones basadas en las hojas de especificaciones. Un portátil con ancho de banda PCIe limitado puede favorecer una mayor ejecución en la CPU, mientras que un ordenador de sobremesa con mayor ancho de banda de transferencia hacia la GPU puede beneficiarse de llenar más ranuras de caché.
Antes de instalar FreeToken
Antes de obtener el entorno de ejecución, prepara la máquina y los recursos del modelo. El sistema publicado utiliza una disposición normalizada de expertos denominada formato FreeToken Weight (FTW). Este formato organiza los bancos de expertos en torno a identificadores lógicos de capa y experto, de modo que el ejecutor de la CPU y la caché de la GPU puedan utilizar la misma asignación.
La referencia disponible no proporciona un comando de conversión universal ni instrucciones para un gestor de paquetes. No inventes un comando procedente de otro motor de inferencia. En su lugar, utiliza la documentación de la versión actual asociada al canal oficial de versiones del proyecto FreeToken cuando esté disponible.
Un comando copiado de llama.cpp, Ollama u otro motor de servicio podría no crear la disposición FTW necesaria ni configurar correctamente las políticas de caché y ancho de banda de FreeToken.
Utiliza esta tabla de preparación para organizar el despliegue:
| Área de preparación | Qué confirmar | Por qué importa |
|---|---|---|
| GPU | Arquitectura compatible con CUDA y suficiente VRAM libre | Determina el tamaño de la caché y la compatibilidad de los kernels |
| Memoria | Capacidad suficiente para el conjunto completo de expertos del host | Evita la paginación y una ejecución inestable |
| Almacenamiento | Capacidad NVMe para el checkpoint seleccionado y los archivos FTW | Reduce el tiempo de carga del modelo |
| Controladores | Controlador NVIDIA compatible y pila CUDA actuales | Permite la ejecución en GPU y la compatibilidad con grafos |
| Modelo | Checkpoint MoE compatible y variante de precisión | Determina el tamaño de los expertos y la demanda de memoria |
| Carga de trabajo | Longitud del prompt, turnos del agente y tasa de decodificación esperada | Influye en la caché KV y la presión del prefill |
El diseño de FreeToken admite varios comportamientos importantes durante la ejecución:
- Doble búfer de capa completa: Solapa la transferencia de expertos con el cálculo de la GPU durante el prefill.
- Caché de estado con consciencia semántica: Conserva prefijos útiles alrededor de bloques de razonamiento, llamadas a herramientas y turnos de conversación.
- Caché de expertos LRU compartida: Sigue los cambios en el enrutamiento a nivel de token durante la decodificación.
- Ejecución adaptada al ancho de banda: Divide los fallos de caché entre la transferencia PCIe y la ejecución directa en la CPU.
- Reconstrucción elástica de la caché: Cambia el presupuesto de la caché de expertos de la GPU en puntos seguros para el planificador sin reiniciar el motor.
Para el primer despliegue, utiliza un solo modelo y una carga de trabajo controlada. Evita probar varios checkpoints grandes simultáneamente, ya que los requisitos de memoria del host y almacenamiento pueden ser difíciles de distinguir de los problemas del entorno de ejecución.
| Opción de despliegue | Punto de partida de menor riesgo | Opción de mayor exigencia |
|---|---|---|
| Tamaño del modelo | Checkpoint MoE compatible más pequeño | Checkpoint MoE de escala puntera |
| Precisión | Precisión oficial con compatibilidad documentada | Disposición cuantizada especializada |
| Carga de trabajo | Prueba breve de una sola sesión | Carga de trabajo de agente con varios turnos |
| Política de caché | Configuración medida predeterminada | División de memoria ajustada manualmente |
| Ejecución en el host | Gestión mínima de fallos en la CPU | Ejecución híbrida CPU–GPU agresiva |
Configuración de FreeToken paso a paso
Sigue estos pasos en orden. La secuencia separa la preparación del entorno de la conversión del modelo y del ajuste del entorno de ejecución, lo que facilita el diagnóstico de fallos.
Prepara primero el host, verifica después la pila de la GPU, prepara el modelo en tercer lugar y ajusta la caché del servicio solo después de que una solicitud básica se complete correctamente.
Prepara el entorno del host
Cierra las aplicaciones que consuman mucha memoria y confirma que la GPU, la CPU, la memoria del host y el almacenamiento NVMe están disponibles para el servicio. Registra la VRAM total, la memoria del sistema, el modelo de GPU, el ancho del enlace PCIe y las versiones del controlador o de CUDA. FreeToken está diseñado para recursos edge variables, pero una línea base limpia hace que la primera prueba sea más fiable.
Obtén el entorno de ejecución oficial
Utiliza las instrucciones de instalación actuales publicadas con la versión de FreeToken en FlashML. Confirma el sistema operativo compatible, la versión de CUDA, las dependencias de Python o nativas y la compatibilidad del modelo antes de instalar. El material de referencia identifica la ubicación de la versión, pero no especifica una secuencia fija de comandos.
Prepara un checkpoint MoE compatible
Descarga los archivos del modelo mediante un canal de distribución autorizado y verifica que el checkpoint coincida con la representación de expertos compatible con el entorno de ejecución. Reserva suficiente almacenamiento para el checkpoint original y para cualquier archivo FTW convertido. No supongas que un archivo de modelo genérico ya está en la disposición optimizada de FreeToken.
Crea u obtén la disposición FTW
Sigue la documentación de la versión para convertir o descargar los archivos FreeToken Weight. FTW almacena los bancos de expertos en la disposición esperada por el entorno de ejecución, lo que permite lecturas directas alineadas en la memoria del host y evita descubrir o reempaquetar tensores repetidamente durante el arranque.
Inicia una prueba controlada
Comienza con una solicitud y un prompt corto. Confirma que se carga el conjunto de expertos del host, que la GPU se inicializa, que se completa la primera solicitud y que los expertos enrutados pueden moverse entre la memoria del host y la caché de la GPU. Solo después prueba contextos largos, llamadas a herramientas o sesiones de agentes simultáneas.
La validación inicial debe centrarse en el funcionamiento, no en el rendimiento máximo. Confirma que el entorno de ejecución puede atender una solicitud con la caché fría. FreeToken no requiere, por diseño, una fase de calentamiento independiente; las primeras solicitudes pueden llenar la caché mediante la ejecución normal.
| Punto de validación | Observación esperada | Si falla |
|---|---|---|
| Detección del modelo | Se reconoce el checkpoint o los recursos FTW seleccionados | Vuelve a comprobar el formato del modelo y la compatibilidad de la versión |
| Carga en el host | Los datos de los expertos llegan al conjunto residente en el host | Comprueba la capacidad de memoria, las rutas de los archivos y los permisos |
| Arranque de la GPU | Se inicializan las capas que no son de expertos y el estado del entorno de ejecución | Comprueba CUDA, el controlador y la disponibilidad de VRAM |
| Primera solicitud | Se completa la inferencia con la caché fría | Revisa los registros de transferencia, kernels y backend de CPU |
| Decodificación repetida | Los expertos usados recientemente empiezan a producir aciertos de caché | Confirma la asignación de caché y la compatibilidad con el enrutamiento |
Rendimiento y ajuste de memoria de FreeToken
El concepto clave para ajustar FreeToken es la relación entre el ancho de banda del host y el ancho de banda de transferencia PCIe. El entorno de ejecución mide o perfila dos valores:
- Bₚ: Ancho de banda de transferencia de expertos fijados a través de PCIe.
- Bₕ: Ancho de banda efectivo del host disponible para la ejecución de expertos en la CPU.
Para un paso de decodificación con m expertos ausentes, el sistema estima la cantidad de rellenos de caché mediante la relación:
q* ≈ m × Bₚ / Bₕ
Esto no es una promesa para el usuario ni una regla fija del hardware. Es un modelo de planificación que equilibra los rellenos simultáneos de la caché de la GPU con la ejecución en la CPU. La división adecuada cambia según los portátiles, los ordenadores de sobremesa, las configuraciones PCIe, los canales de memoria y la carga en segundo plano.
Utiliza el ancho de banda medido en la máquina desplegada en lugar de depender únicamente de las especificaciones anunciadas de PCIe o de la memoria. La política de planificación de FreeToken está diseñada para reflejar el hardware que realmente ejecuta el modelo.
El presupuesto de memoria de la GPU también requiere planificación. FreeToken divide la VRAM disponible entre la caché KV y las ranuras completas de expertos. Los contextos más largos aumentan la demanda de la caché KV, mientras que una caché de expertos más grande puede reducir los fallos durante la decodificación. Como el sistema puede reconstruir la caché de expertos en puntos seguros, este equilibrio no tiene que permanecer fijo durante toda la sesión.
Prefill
Da prioridad al solapamiento de transferencias y a la reutilización de prefijos. Los prompts largos exponen los costes del movimiento y la recomputación de expertos.
Decodificación
Da prioridad a la localidad del enrutamiento y a una caché LRU compartida. El uso reciente de los expertos resulta más útil que una colocación estática.
Cargas de trabajo de agentes
Conserva puntos de control semánticos alrededor de las llamadas a herramientas y los bloques de contexto editados.
Ordenador compartido
Deja margen de VRAM para navegadores, pantallas, juegos y otras aplicaciones.
La evaluación de referencia ofrece indicadores de escala útiles sin convertirlos en resultados garantizados. En un sistema de prueba con una RTX 5090, FreeToken registró entre 77 y 83 tokens por segundo en Qwen3.6-35B y entre 22 y 25 tokens por segundo en DeepSeek-V4-Flash en las cargas de trabajo probadas. Los resultados dependen de la precisión del modelo, la capacidad de la caché, el ancho de banda del host, la longitud del prompt y las aplicaciones en segundo plano.
| Objetivo de ajuste | Acción práctica | Compensación |
|---|---|---|
| Primer token más rápido | Activa la disposición preparada del modelo y el solapamiento de transferencias | Requiere una preparación correcta y suficiente almacenamiento |
| Mayor tasa de decodificación | Aumenta la capacidad útil de la caché de expertos | Deja menos VRAM para la caché KV |
| Contexto más largo | Reserva más VRAM para las páginas KV | Puede aumentar los fallos de la caché de expertos |
| Mejor gestión de fallos | Permite la cooperación medida entre CPU y GPU | Utiliza el ancho de banda del host y recursos de la CPU |
| Uso más estable del ordenador | Reduce el presupuesto de memoria del servicio | Puede disminuir las tasas de aciertos de caché |
Lista de comprobación y solución de problemas de la instalación
Utiliza esta lista antes de pasar de una prueba básica a un endpoint local de estilo producción o a una carga de trabajo de agente.
Cuando una prueba sea lenta, identifica si el cuello de botella está en la carga del almacenamiento, la transferencia del prefill, los fallos de decodificación, el ancho de banda de la CPU o una caché KV insuficiente antes de cambiar la configuración.
Preparación para el despliegue:
- Confirma la GPU, el controlador, el entorno CUDA y la VRAM disponible
- Reserva suficiente memoria del host para el conjunto completo de expertos
- Utiliza un checkpoint MoE compatible y la disposición FTW documentada
- Ejecuta una solicitud con la caché fría antes de probar sesiones largas de agentes
- Registra el ancho de banda PCIe y del host medido para realizar los ajustes
| Síntoma | Área probable | Primera respuesta |
|---|---|---|
| El arranque tarda demasiado | Almacenamiento o disposición de pesos no preparada | Utiliza la ruta FTW documentada y almacenamiento local rápido |
| La GPU permanece inactiva durante el prefill | Las transferencias y el cálculo están serializados | Confirma que el doble búfer de capa completa está habilitado |
| La decodificación está limitada por la CPU | Demasiados fallos o ancho de banda del host limitado | Revisa el tamaño de la caché y el equilibrio del ancho de banda medido |
| Las sesiones largas se ralentizan | La caché KV consume el presupuesto original de expertos | Reequilibra la VRAM en un punto seguro del entorno de ejecución |
| El entorno no puede servir un modelo | Representación no compatible o memoria del host insuficiente | Comprueba la matriz de modelos y plataformas de la versión |
| El ordenador se vuelve inestable | Las aplicaciones en competencia consumen VRAM | Cierra las cargas de trabajo en segundo plano o reduce la asignación del servicio |
El comportamiento de respaldo de FreeToken también es importante. Si el conjunto completo de expertos no puede fijarse ni registrarse para DMA debido a restricciones del sistema operativo o del controlador, el entorno de ejecución puede utilizar un backend MoE exclusivamente en la CPU. Esto mejora la capacidad de despliegue, pero renuncia a la ruta de transferencia más rápida. Las capas que no son de expertos pueden permanecer en la GPU, mientras que las entradas del tamaño de las activaciones, los metadatos de enrutamiento y las salidas cruzan el límite entre dispositivos.
No evalúes la calidad de la instalación a partir de un solo prompt corto. El prefill y la decodificación someten a presión distintas partes del sistema, y las sesiones de agentes con varios turnos añaden un procesamiento repetido del contexto. Un plan de pruebas útil incluye una solicitud corta, un prompt largo, decodificación repetida y una carga de trabajo con edición del contexto.
Preguntas frecuentes sobre la instalación de FreeToken
Q: ¿FreeToken es un juego o una plataforma de códigos de canje?
No. FreeToken es un sistema de servicio de modelos MoE nativo para edge. Su instalación está relacionada con la inferencia mediante GPU, la memoria del host, los archivos del modelo, la compatibilidad con CUDA y la configuración del entorno de ejecución.
Q: ¿Dónde debo obtener el instalador o el paquete de versión de FreeToken?
La descripción publicada del proyecto anuncia el sistema en FlashML. Utiliza la documentación oficial actual de la versión en https://flashml.ai/ para consultar los nombres de los paquetes, las dependencias y los comandos, ya que el material de referencia no proporciona un comando de inicio fijo.
Q: ¿Es necesario que todos los pesos del modelo quepan en la VRAM?
No. FreeToken mantiene el conjunto completo de expertos enrutados en la memoria del host y utiliza la memoria de la GPU como una caché elástica de expertos. La VRAM aún debe contener los pesos que no son de expertos, el estado del entorno de ejecución, las páginas de la caché KV y los expertos almacenados en caché.
Q: ¿Por qué necesita FreeToken crear perfiles de ancho de banda?
Los fallos de decodificación pueden transferirse a la GPU o ejecutarse directamente en la CPU. FreeToken utiliza el ancho de banda PCIe y del host medido para elegir una división práctica entre ambas rutas.
Los detalles de instalación pueden cambiar a medida que avance la versión de 2026. Confirma el paquete oficial, los formatos de modelo compatibles y los requisitos de la plataforma antes de ejecutar comandos de conversión o de servicio.