Instalación de FreeToken: configuración paso a paso del servicio edge - Guía

Instalación de FreeToken: configuración paso a paso del servicio edge

Aprende a preparar el hardware, el almacenamiento, la memoria y los ajustes del entorno de ejecución para instalar el servicio MoE nativo para edge de FreeToken.

2026-08-25
Equipo de FreeToken
Guía rápida
  • La instalación de FreeToken requiere una GPU compatible con CUDA, memoria del sistema, almacenamiento y un entorno de ejecución compatible.
  • Ubicación de la versión: El sistema se anuncia para su lanzamiento a través del canal oficial del proyecto FlashML.
  • Configuración principal: Prepara los pesos del modelo, el almacenamiento de expertos en el host, espacio para la caché de la GPU y valores de ancho de banda medidos.
  • Limitación importante: El material de referencia disponible no publica un comando de instalación listo para copiar y pegar.
  • Buena práctica: Verifica las instrucciones de la versión actual antes de convertir los pesos del modelo o iniciar el motor.

Instalación de FreeToken: requisitos del sistema

FreeToken es un sistema de servicio nativo para edge destinado a modelos grandes de Mezcla de Expertos (MoE). No es un juego, un título de personajes descargable ni un servicio de códigos de canje. Por lo tanto, el proceso de instalación se centra en la inferencia mediante GPU, la memoria del host, la compatibilidad con CUDA, el almacenamiento del modelo y la configuración del entorno de ejecución.

El diseño publicado está orientado a ordenadores personales, estaciones de trabajo y portátiles en los que el conjunto completo de expertos puede superar la VRAM disponible. FreeToken mantiene el conjunto completo de expertos enrutados en la memoria del host y utiliza la memoria de la GPU como una caché elástica de expertos. Los pesos que no pertenecen a expertos permanecen en la GPU, y la capacidad de la caché puede cambiar a medida que otras aplicaciones consumen o liberan VRAM.

Enfoque de instalación

Considera FreeToken como un despliegue de sistemas, no como una aplicación de un solo clic. La creación de perfiles del hardware, la preparación del modelo y la planificación de la memoria forman parte de la configuración, ya que la programación del entorno de ejecución depende de la máquina real.

Nivel de GPU

Una GPU CUDA discreta proporciona la ruta principal de ejecución. La evaluación de referencia abarca desde GPU de portátiles con 8 GB hasta hardware de clase estación de trabajo.

Memoria del host

La memoria del sistema almacena el conjunto completo de expertos y proporciona el ancho de banda necesario para ejecutar expertos en la CPU cuando se producen fallos de caché en la GPU.

Almacenamiento rápido

El almacenamiento NVMe es importante durante el arranque. FreeToken puede cargar los pesos preparados directamente en su disposición final en el host.

La distinción más importante es entre capacidad y rendimiento. El modelo completo no tiene que caber enteramente en la VRAM, pero el host debe contener el conjunto de expertos y proporcionar suficiente ancho de banda de transferencia para lograr una latencia aceptable.

RecursoFunción en FreeTokenPrioridad de configuración
VRAM de la GPUAlmacena los pesos que no son de expertos, la caché KV y las ranuras elásticas de expertosAlta
Memoria del hostContiene el conjunto completo de expertos enrutadosAlta
Enlace PCIeMueve los expertos seleccionados a la caché de la GPUAlta
Ancho de banda de la CPUEjecuta los fallos residuales de expertos desde la memoria del hostAlta
Almacenamiento NVMeCarga los datos del modelo durante el arranqueMedia
Entorno CUDAAdmite los kernels de la GPU y las rutas de ejecución capturadasAlta

El sistema de referencia indica que el equilibrio del hardware importa más que las suposiciones basadas en las hojas de especificaciones. Un portátil con ancho de banda PCIe limitado puede favorecer una mayor ejecución en la CPU, mientras que un ordenador de sobremesa con mayor ancho de banda de transferencia hacia la GPU puede beneficiarse de llenar más ranuras de caché.

Antes de instalar FreeToken

Antes de obtener el entorno de ejecución, prepara la máquina y los recursos del modelo. El sistema publicado utiliza una disposición normalizada de expertos denominada formato FreeToken Weight (FTW). Este formato organiza los bancos de expertos en torno a identificadores lógicos de capa y experto, de modo que el ejecutor de la CPU y la caché de la GPU puedan utilizar la misma asignación.

La referencia disponible no proporciona un comando de conversión universal ni instrucciones para un gestor de paquetes. No inventes un comando procedente de otro motor de inferencia. En su lugar, utiliza la documentación de la versión actual asociada al canal oficial de versiones del proyecto FreeToken cuando esté disponible.

No adivines el comando de inicio

Un comando copiado de llama.cpp, Ollama u otro motor de servicio podría no crear la disposición FTW necesaria ni configurar correctamente las políticas de caché y ancho de banda de FreeToken.

Utiliza esta tabla de preparación para organizar el despliegue:

Área de preparaciónQué confirmarPor qué importa
GPUArquitectura compatible con CUDA y suficiente VRAM libreDetermina el tamaño de la caché y la compatibilidad de los kernels
MemoriaCapacidad suficiente para el conjunto completo de expertos del hostEvita la paginación y una ejecución inestable
AlmacenamientoCapacidad NVMe para el checkpoint seleccionado y los archivos FTWReduce el tiempo de carga del modelo
ControladoresControlador NVIDIA compatible y pila CUDA actualesPermite la ejecución en GPU y la compatibilidad con grafos
ModeloCheckpoint MoE compatible y variante de precisiónDetermina el tamaño de los expertos y la demanda de memoria
Carga de trabajoLongitud del prompt, turnos del agente y tasa de decodificación esperadaInfluye en la caché KV y la presión del prefill

El diseño de FreeToken admite varios comportamientos importantes durante la ejecución:

  • Doble búfer de capa completa: Solapa la transferencia de expertos con el cálculo de la GPU durante el prefill.
  • Caché de estado con consciencia semántica: Conserva prefijos útiles alrededor de bloques de razonamiento, llamadas a herramientas y turnos de conversación.
  • Caché de expertos LRU compartida: Sigue los cambios en el enrutamiento a nivel de token durante la decodificación.
  • Ejecución adaptada al ancho de banda: Divide los fallos de caché entre la transferencia PCIe y la ejecución directa en la CPU.
  • Reconstrucción elástica de la caché: Cambia el presupuesto de la caché de expertos de la GPU en puntos seguros para el planificador sin reiniciar el motor.

Para el primer despliegue, utiliza un solo modelo y una carga de trabajo controlada. Evita probar varios checkpoints grandes simultáneamente, ya que los requisitos de memoria del host y almacenamiento pueden ser difíciles de distinguir de los problemas del entorno de ejecución.

Opción de desplieguePunto de partida de menor riesgoOpción de mayor exigencia
Tamaño del modeloCheckpoint MoE compatible más pequeñoCheckpoint MoE de escala puntera
PrecisiónPrecisión oficial con compatibilidad documentadaDisposición cuantizada especializada
Carga de trabajoPrueba breve de una sola sesiónCarga de trabajo de agente con varios turnos
Política de cachéConfiguración medida predeterminadaDivisión de memoria ajustada manualmente
Ejecución en el hostGestión mínima de fallos en la CPUEjecución híbrida CPU–GPU agresiva

Configuración de FreeToken paso a paso

Sigue estos pasos en orden. La secuencia separa la preparación del entorno de la conversión del modelo y del ajuste del entorno de ejecución, lo que facilita el diagnóstico de fallos.

Orden recomendado

Prepara primero el host, verifica después la pila de la GPU, prepara el modelo en tercer lugar y ajusta la caché del servicio solo después de que una solicitud básica se complete correctamente.

1

Prepara el entorno del host

Cierra las aplicaciones que consuman mucha memoria y confirma que la GPU, la CPU, la memoria del host y el almacenamiento NVMe están disponibles para el servicio. Registra la VRAM total, la memoria del sistema, el modelo de GPU, el ancho del enlace PCIe y las versiones del controlador o de CUDA. FreeToken está diseñado para recursos edge variables, pero una línea base limpia hace que la primera prueba sea más fiable.

2

Obtén el entorno de ejecución oficial

Utiliza las instrucciones de instalación actuales publicadas con la versión de FreeToken en FlashML. Confirma el sistema operativo compatible, la versión de CUDA, las dependencias de Python o nativas y la compatibilidad del modelo antes de instalar. El material de referencia identifica la ubicación de la versión, pero no especifica una secuencia fija de comandos.

3

Prepara un checkpoint MoE compatible

Descarga los archivos del modelo mediante un canal de distribución autorizado y verifica que el checkpoint coincida con la representación de expertos compatible con el entorno de ejecución. Reserva suficiente almacenamiento para el checkpoint original y para cualquier archivo FTW convertido. No supongas que un archivo de modelo genérico ya está en la disposición optimizada de FreeToken.

4

Crea u obtén la disposición FTW

Sigue la documentación de la versión para convertir o descargar los archivos FreeToken Weight. FTW almacena los bancos de expertos en la disposición esperada por el entorno de ejecución, lo que permite lecturas directas alineadas en la memoria del host y evita descubrir o reempaquetar tensores repetidamente durante el arranque.

5

Inicia una prueba controlada

Comienza con una solicitud y un prompt corto. Confirma que se carga el conjunto de expertos del host, que la GPU se inicializa, que se completa la primera solicitud y que los expertos enrutados pueden moverse entre la memoria del host y la caché de la GPU. Solo después prueba contextos largos, llamadas a herramientas o sesiones de agentes simultáneas.

La validación inicial debe centrarse en el funcionamiento, no en el rendimiento máximo. Confirma que el entorno de ejecución puede atender una solicitud con la caché fría. FreeToken no requiere, por diseño, una fase de calentamiento independiente; las primeras solicitudes pueden llenar la caché mediante la ejecución normal.

Punto de validaciónObservación esperadaSi falla
Detección del modeloSe reconoce el checkpoint o los recursos FTW seleccionadosVuelve a comprobar el formato del modelo y la compatibilidad de la versión
Carga en el hostLos datos de los expertos llegan al conjunto residente en el hostComprueba la capacidad de memoria, las rutas de los archivos y los permisos
Arranque de la GPUSe inicializan las capas que no son de expertos y el estado del entorno de ejecuciónComprueba CUDA, el controlador y la disponibilidad de VRAM
Primera solicitudSe completa la inferencia con la caché fríaRevisa los registros de transferencia, kernels y backend de CPU
Decodificación repetidaLos expertos usados recientemente empiezan a producir aciertos de cachéConfirma la asignación de caché y la compatibilidad con el enrutamiento

Rendimiento y ajuste de memoria de FreeToken

El concepto clave para ajustar FreeToken es la relación entre el ancho de banda del host y el ancho de banda de transferencia PCIe. El entorno de ejecución mide o perfila dos valores:

  • Bₚ: Ancho de banda de transferencia de expertos fijados a través de PCIe.
  • Bₕ: Ancho de banda efectivo del host disponible para la ejecución de expertos en la CPU.

Para un paso de decodificación con m expertos ausentes, el sistema estima la cantidad de rellenos de caché mediante la relación:

q* ≈ m × Bₚ / Bₕ

Esto no es una promesa para el usuario ni una regla fija del hardware. Es un modelo de planificación que equilibra los rellenos simultáneos de la caché de la GPU con la ejecución en la CPU. La división adecuada cambia según los portátiles, los ordenadores de sobremesa, las configuraciones PCIe, los canales de memoria y la carga en segundo plano.

Ajusta a partir de mediciones

Utiliza el ancho de banda medido en la máquina desplegada en lugar de depender únicamente de las especificaciones anunciadas de PCIe o de la memoria. La política de planificación de FreeToken está diseñada para reflejar el hardware que realmente ejecuta el modelo.

El presupuesto de memoria de la GPU también requiere planificación. FreeToken divide la VRAM disponible entre la caché KV y las ranuras completas de expertos. Los contextos más largos aumentan la demanda de la caché KV, mientras que una caché de expertos más grande puede reducir los fallos durante la decodificación. Como el sistema puede reconstruir la caché de expertos en puntos seguros, este equilibrio no tiene que permanecer fijo durante toda la sesión.

Prefill

Da prioridad al solapamiento de transferencias y a la reutilización de prefijos. Los prompts largos exponen los costes del movimiento y la recomputación de expertos.

Decodificación

Da prioridad a la localidad del enrutamiento y a una caché LRU compartida. El uso reciente de los expertos resulta más útil que una colocación estática.

Cargas de trabajo de agentes

Conserva puntos de control semánticos alrededor de las llamadas a herramientas y los bloques de contexto editados.

Ordenador compartido

Deja margen de VRAM para navegadores, pantallas, juegos y otras aplicaciones.

La evaluación de referencia ofrece indicadores de escala útiles sin convertirlos en resultados garantizados. En un sistema de prueba con una RTX 5090, FreeToken registró entre 77 y 83 tokens por segundo en Qwen3.6-35B y entre 22 y 25 tokens por segundo en DeepSeek-V4-Flash en las cargas de trabajo probadas. Los resultados dependen de la precisión del modelo, la capacidad de la caché, el ancho de banda del host, la longitud del prompt y las aplicaciones en segundo plano.

Objetivo de ajusteAcción prácticaCompensación
Primer token más rápidoActiva la disposición preparada del modelo y el solapamiento de transferenciasRequiere una preparación correcta y suficiente almacenamiento
Mayor tasa de decodificaciónAumenta la capacidad útil de la caché de expertosDeja menos VRAM para la caché KV
Contexto más largoReserva más VRAM para las páginas KVPuede aumentar los fallos de la caché de expertos
Mejor gestión de fallosPermite la cooperación medida entre CPU y GPUUtiliza el ancho de banda del host y recursos de la CPU
Uso más estable del ordenadorReduce el presupuesto de memoria del servicioPuede disminuir las tasas de aciertos de caché

Lista de comprobación y solución de problemas de la instalación

Utiliza esta lista antes de pasar de una prueba básica a un endpoint local de estilo producción o a una carga de trabajo de agente.

Prioridad para la solución de problemas

Cuando una prueba sea lenta, identifica si el cuello de botella está en la carga del almacenamiento, la transferencia del prefill, los fallos de decodificación, el ancho de banda de la CPU o una caché KV insuficiente antes de cambiar la configuración.

Preparación para el despliegue:

  • Confirma la GPU, el controlador, el entorno CUDA y la VRAM disponible
  • Reserva suficiente memoria del host para el conjunto completo de expertos
  • Utiliza un checkpoint MoE compatible y la disposición FTW documentada
  • Ejecuta una solicitud con la caché fría antes de probar sesiones largas de agentes
  • Registra el ancho de banda PCIe y del host medido para realizar los ajustes
SíntomaÁrea probablePrimera respuesta
El arranque tarda demasiadoAlmacenamiento o disposición de pesos no preparadaUtiliza la ruta FTW documentada y almacenamiento local rápido
La GPU permanece inactiva durante el prefillLas transferencias y el cálculo están serializadosConfirma que el doble búfer de capa completa está habilitado
La decodificación está limitada por la CPUDemasiados fallos o ancho de banda del host limitadoRevisa el tamaño de la caché y el equilibrio del ancho de banda medido
Las sesiones largas se ralentizanLa caché KV consume el presupuesto original de expertosReequilibra la VRAM en un punto seguro del entorno de ejecución
El entorno no puede servir un modeloRepresentación no compatible o memoria del host insuficienteComprueba la matriz de modelos y plataformas de la versión
El ordenador se vuelve inestableLas aplicaciones en competencia consumen VRAMCierra las cargas de trabajo en segundo plano o reduce la asignación del servicio

El comportamiento de respaldo de FreeToken también es importante. Si el conjunto completo de expertos no puede fijarse ni registrarse para DMA debido a restricciones del sistema operativo o del controlador, el entorno de ejecución puede utilizar un backend MoE exclusivamente en la CPU. Esto mejora la capacidad de despliegue, pero renuncia a la ruta de transferencia más rápida. Las capas que no son de expertos pueden permanecer en la GPU, mientras que las entradas del tamaño de las activaciones, los metadatos de enrutamiento y las salidas cruzan el límite entre dispositivos.

No evalúes la calidad de la instalación a partir de un solo prompt corto. El prefill y la decodificación someten a presión distintas partes del sistema, y las sesiones de agentes con varios turnos añaden un procesamiento repetido del contexto. Un plan de pruebas útil incluye una solicitud corta, un prompt largo, decodificación repetida y una carga de trabajo con edición del contexto.

Preguntas frecuentes sobre la instalación de FreeToken

Q: ¿FreeToken es un juego o una plataforma de códigos de canje?

No. FreeToken es un sistema de servicio de modelos MoE nativo para edge. Su instalación está relacionada con la inferencia mediante GPU, la memoria del host, los archivos del modelo, la compatibilidad con CUDA y la configuración del entorno de ejecución.

Q: ¿Dónde debo obtener el instalador o el paquete de versión de FreeToken?

La descripción publicada del proyecto anuncia el sistema en FlashML. Utiliza la documentación oficial actual de la versión en https://flashml.ai/ para consultar los nombres de los paquetes, las dependencias y los comandos, ya que el material de referencia no proporciona un comando de inicio fijo.

Q: ¿Es necesario que todos los pesos del modelo quepan en la VRAM?

No. FreeToken mantiene el conjunto completo de expertos enrutados en la memoria del host y utiliza la memoria de la GPU como una caché elástica de expertos. La VRAM aún debe contener los pesos que no son de expertos, el estado del entorno de ejecución, las páginas de la caché KV y los expertos almacenados en caché.

Q: ¿Por qué necesita FreeToken crear perfiles de ancho de banda?

Los fallos de decodificación pueden transferirse a la GPU o ejecutarse directamente en la CPU. FreeToken utiliza el ancho de banda PCIe y del host medido para elegir una división práctica entre ambas rutas.

Recordatorio sobre el estado de la versión

Los detalles de instalación pueden cambiar a medida que avance la versión de 2026. Confirma el paquete oficial, los formatos de modelo compatibles y los requisitos de la plataforma antes de ejecutar comandos de conversión o de servicio.