FreeToken deepseek: Guía de configuración y benchmarks de IA local - Modelos

FreeToken deepseek: Guía de configuración y benchmarks de IA local

Aprende cómo FreeToken sirve DeepSeek localmente mediante caché MoE, descarga entre CPU y GPU, orientación sobre hardware, pasos de configuración y notas de rendimiento.

2026-08-25
Equipo de FreeToken
Guía rápida
  • FreeToken deepseek permite servir localmente modelos MoE grandes de DeepSeek en hardware de consumo.
  • DeepSeek-V4-Flash utiliza una activación dispersa de expertos, pero aun así necesita una cantidad considerable de memoria del sistema.
  • Las configuraciones con una sola GPU pueden funcionar bien cuando la VRAM, la RAM y el ancho de banda de memoria están equilibrados.
  • El software beta puede presentar problemas de compatibilidad con algunos modelos, especialmente con checkpoints densos de gran tamaño.
  • Mejor punto de partida: utiliza un modelo cuantizado compatible y supervisa la memoria antes de aumentar la longitud del contexto.

FreeToken deepseek: Qué hace el sistema

FreeToken es un sistema de inferencia nativo para el edge que sirve modelos grandes de mezcla de expertos distribuyendo la carga entre una GPU, la CPU, la memoria del sistema y la conexión PCIe entre ellos. Su escenario más útil con DeepSeek es DeepSeek-V4-Flash, donde solo se activa una fracción de los expertos del modelo para cada token, mientras que el conjunto completo de expertos sigue siendo mucho mayor que la memoria habitual de una GPU de consumo.

En lugar de exigir que cada experto permanezca en la VRAM, FreeToken mantiene el conjunto completo de expertos enrutados en la memoria del sistema y utiliza la memoria disponible de la GPU como una caché elástica. El entorno de ejecución puede mover expertos a la GPU cuando es necesario o ejecutar directamente en la CPU ciertos fallos de caché. Esto hace posible experimentar localmente con hardware que no podría contener el modelo completo en la VRAM.

Aspectos destacados del video:

  • Pruebas de DeepSeek-V4-Flash con una sola GPU y una configuración de clase RTX 3090
  • Aplicación de escritorio y flujo de trabajo con un endpoint local
  • Conexión con Open WebUI para chat interactivo
  • Rendimiento de decodificación informado de aproximadamente 10–11 tokens por segundo en una configuración de servidor
  • Limitaciones de memoria, comportamiento beta y advertencias sobre compatibilidad de modelos

El diseño de investigación utiliza dos ideas complementarias. Durante el prellenado, FreeToken solapa las transferencias de expertos con los cálculos de la GPU mediante un doble búfer de capa completa. Durante la decodificación, utiliza una caché LRU compartida de expertos para que los expertos enrutados recientemente tengan más probabilidades de permanecer disponibles en la GPU.

El sistema también mide la máquina de destino en lugar de depender únicamente de las especificaciones anunciadas. El ancho de banda de la memoria del sistema y el ancho de banda de transferencia PCIe determinan cuántos expertos faltantes deben copiarse a la GPU y cuántos deben procesarse directamente en la CPU.

ComponenteFunción en FreeTokenPor qué importa
VRAM de la GPUAlmacena los pesos no expertos y una caché dinámica de expertosUna mayor cantidad de VRAM disponible puede reducir los fallos de caché
RAM del sistemaContiene el conjunto completo de expertosLos modelos MoE grandes requieren una cantidad considerable de memoria del sistema
Enlace PCIeTransfiere los expertos faltantes a la GPUEl ancho de banda afecta a la latencia de decodificación y prellenado
CPUEjecuta los fallos de expertos seleccionadosEs útil cuando aún queda ancho de banda disponible en la memoria del sistema
Caché LRURegistra los pares de capa y experto utilizados recientementeSe adapta a los cambios en el enrutamiento a nivel de token
Idea principal

Considera FreeToken como un entorno de ejecución para servir modelos, no como un modelo más pequeño. Mejora la coordinación de los recursos, pero no elimina los requisitos de memoria del checkpoint subyacente.

Requisitos del modelo DeepSeek y del hardware

La distinción más importante es la que existe entre los parámetros activos y los parámetros totales almacenados. DeepSeek-V4-Flash se describe como un modelo MoE de 284B parámetros, con aproximadamente 13B parámetros activos por token. La activación dispersa reduce el cálculo necesario para cada token, pero el conjunto completo de expertos aún debe residir en algún lugar del sistema.

El material de referencia identifica la RTX 5090 como un objetivo sólido para la implementación FP4 del artículo, mientras que las pruebas prácticas también demuestran DeepSeek-V4-Flash en una máquina de clase RTX 3090 con descarga hacia la memoria del sistema. Se trata de configuraciones diferentes, por lo que sus resultados no deben considerarse benchmarks intercambiables.

Nivel de configuraciónEjemplo de GPUOrientación sobre memoriaUso previsto
Experimento inicialGPU de clase RTX 3090Al menos 32 GB de RAM del sistema; 64 GB resulta más cómodoChat local con ajustes conservadores
Escritorio prácticoGPU de clase RTX 409064–128 GB de RAM del sistema, según el modeloDescarga más rápida y sesiones más largas
Consumo de gama altaGPU de clase RTX 5090Gran cantidad de RAM junto con cuantización compatibleMayor capacidad de caché y menor presión de transferencia
Estación de trabajo avanzadaRTX PRO 6000 Blackwell, 96 GBConfiguración de memoria de clase estación de trabajoDemostración de GLM-5.2 y cargas de trabajo más grandes

Las pruebas del video con una sola GPU sugieren que 32 GB de memoria del sistema pueden ser un punto de partida, mientras que 64 GB o más ofrecen un margen operativo más seguro. El artículo de investigación también enfatiza que la RAM del sistema, la velocidad de la memoria y el ancho de banda PCIe pueden convertirse en los factores limitantes una vez que la GPU se utiliza por completo.

DDR5 puede ofrecer una ventaja significativa frente a las plataformas DDR4 antiguas de doble canal, ya que la ejecución de expertos en el sistema y las transferencias PCIe compiten por el ancho de banda de memoria. Sin embargo, el resultado exacto depende de la placa base, la configuración de memoria, la CPU, el sistema operativo y las aplicaciones activas.

Capacidad de VRAM

Una mayor cantidad de VRAM libre permite a FreeToken conservar más expertos y estado de la caché KV. Cierra los navegadores, las herramientas de grabación y otras aplicaciones que consuman mucha GPU durante las pruebas.

Memoria del sistema

La RAM del sistema almacena el conjunto completo de expertos durante la descarga. Comprueba la memoria utilizable, no solo la capacidad instalada.

Equilibrio del ancho de banda

El ancho de banda de PCIe y de la RAM influye en la mejor división entre CPU y GPU. FreeToken perfila estos recursos para elegir una estrategia de ejecución.

Advertencia sobre la memoria

No calcules los requisitos basándote únicamente en los parámetros activos. Un modelo disperso puede calcular solo un pequeño subconjunto de expertos por token y, aun así, requerir un conjunto de pesos residente muy grande.

Flujo de configuración de FreeToken DeepSeek

El flujo de trabajo de escritorio está diseñado para reducir la cantidad de configuración manual del motor. La distribución disponible depende del sistema operativo; las pruebas de referencia abarcan Windows, Ubuntu, AppImage, Arch Linux y una ruta mediante la aplicación de escritorio.

Utiliza un formato de modelo compatible y confirma que la memoria necesaria del sistema esté disponible antes de comenzar. FreeToken puede informar que la RAM y la VRAM utilizables son insuficientes cuando el checkpoint seleccionado supera el presupuesto de hardware actual.

1

Instala la compilación adecuada

Elige la compilación de FreeToken que coincida con tu sistema operativo y arquitectura. En Linux, utiliza el paquete o AppImage apropiado para tu distribución. Mantén el controlador de la GPU y el entorno CUDA alineados con los requisitos de la aplicación.

2

Prepara la memoria y las aplicaciones

Cierra las cargas de trabajo innecesarias de la GPU, el software de grabación, los juegos y las pestañas del navegador. Confirma que quede suficiente RAM del sistema disponible para el conjunto completo de expertos, además del sistema operativo y otros servicios.

3

Selecciona un endpoint compatible

Configura el endpoint del modelo mediante la interfaz de la aplicación. El flujo demostrado utiliza Hugging Face como endpoint y conecta el servidor local con Open WebUI para el chat.

4

Carga DeepSeek-V4-Flash

Comienza con la compilación compatible de DeepSeek-V4-Flash en lugar de un modelo denso más grande. Espera a que la aplicación termine de cargar y confirma que el servidor API indique que está listo.

5

Mide con un prompt corto

Envía primero una solicitud sencilla y, después, comprueba el rendimiento en tokens, el uso de memoria y la estabilidad de la respuesta. Aumenta gradualmente el contexto o los ajustes de razonamiento en lugar de cambiar varias variables a la vez.

Que el servidor API esté listo no significa necesariamente que todos los modelos descargados vayan a ejecutarse correctamente. Las notas de las pruebas describen un intento fallido con una configuración Qwen 3.8 27B BF16, lo que demuestra por qué la compatibilidad del modelo y el ajuste a la memoria deben verificarse por separado.

Comprobación de configuraciónCondición de aprobaciónSi falla
Controlador y entorno de ejecuciónLa aplicación se inicia sin errores de inicialización de la GPUActualiza el entorno o utiliza uno compatible
Memoria del sistemaFreeToken informa que hay suficiente RAM y VRAM utilizablesCierra aplicaciones o elige una compilación más pequeña
Compatibilidad del modeloEl checkpoint seleccionado se inicia correctamentePrueba un formato compatible oficialmente
Estado de la APIEl servidor indica que está listoRevisa los registros y reinicia el motor
Endpoint de chatOpen WebUI recibe una respuestaVerifica la dirección del endpoint y la selección del modelo
Primera ejecución recomendada

Utiliza la configuración DeepSeek compatible más pequeña, envía un prompt corto y registra el uso de memoria antes de activar el máximo razonamiento o cargas de trabajo con contexto largo.

Rendimiento, caché y ajustes

El rendimiento depende de la interacción entre la localidad de los expertos, la capacidad de la caché, el ancho de banda del sistema y la carga de trabajo. Un prompt corto de un solo turno puede producir un resultado diferente al de una sesión de programación o uso de herramientas con varios turnos, ya que las cargas de trabajo agénticas vuelven a consultar el contexto repetidamente y modifican el patrón de expertos activos.

En la prueba de referencia con una máquina de clase RTX 3090, DeepSeek-V4-Flash alcanzó aproximadamente entre 10 y 11 tokens por segundo en el flujo de trabajo del servidor. El cliente de escritorio mostró un resultado inferior, de aproximadamente 8,8 tokens por segundo en una prueba. Estas cifras dependen de la configuración y no son objetivos universales.

La evaluación de investigación informa de resultados superiores en hardware más moderno. En una RTX 5090, FreeToken mantuvo aproximadamente entre 22 y 25 tokens por segundo para DeepSeek-V4-Flash en las cargas de trabajo agénticas indicadas. El mismo artículo informa de tasas de fallos más bajas con su caché LRU global que con las estrategias de colocación estática.

Prioridad de ajusteAcciónBeneficio
1Libera VRAM antes de cargarCrea un presupuesto mayor para la caché de expertos
2Utiliza memoria del sistema más rápidaMejora la ejecución en la CPU y el uso compartido de las transferencias
3Prefiere un enlace PCIe más amplioReduce el tiempo de movimiento de los expertos
4Comienza con un contexto moderadoDeja espacio para el crecimiento de la caché KV
5Compara las rutas del servidor y del escritorioRevela la sobrecarga del cliente y las diferencias del entorno de ejecución

La caché de FreeToken es elástica porque la mejor división entre el almacenamiento de expertos y la caché KV cambia durante una sesión. Las conversaciones largas consumen más memoria de la caché KV, mientras que los cambios en los patrones de enrutamiento modifican qué expertos conviene conservar. Una configuración que funciona bien en la primera solicitud puede necesitar ajustes después de varios turnos.

La política q-star divide los fallos de caché entre la transferencia a la GPU y la ejecución en la CPU. En términos simplificados, una máquina con mayor ancho de banda PCIe puede copiar más fallos a la VRAM, mientras que una máquina con un ancho de banda de memoria del sistema relativamente superior puede procesar más fallos directamente en su ubicación. FreeToken perfila estos valores durante la implementación.

Realiza los benchmarks con cuidado

Compara modelos, cuantización, prompts, longitudes de contexto, ajustes de razonamiento y aplicaciones en segundo plano idénticos. Los resultados de tokens por segundo de distintos entornos de ejecución no son directamente comparables si esas variables no coinciden.

Antes de cada benchmark:

  • Confirma que el modelo DeepSeek y la cuantización sean los mismos
  • Registra la VRAM y la RAM del sistema disponibles
  • Cierra las cargas de trabajo que compitan por la GPU y la memoria
  • Utiliza el mismo prompt y la misma longitud de contexto
  • Registra el rendimiento, el tiempo de inicio y la estabilidad de la respuesta

Limitaciones y preguntas frecuentes sobre solución de problemas

FreeToken hace más accesible el servicio local de modelos MoE, pero sigue siendo sensible a la madurez del software y a las condiciones del hardware. La aplicación probada en el material de referencia se identifica como software beta, y no todos los modelos descargados se inician correctamente.

Cuando un modelo se cierra inesperadamente, comienza con las comprobaciones básicas: verifica el formato del modelo, inspecciona los registros del servidor, confirma la memoria utilizable y prueba un checkpoint compatible más pequeño. No supongas que un inicio fallido demuestra que la GPU es demasiado débil; también pueden influir la compatibilidad, el comportamiento del controlador, la memoria fijada y la compatibilidad del entorno de ejecución.

El artículo de investigación de FreeToken proporciona el diseño técnico, la metodología de evaluación y el análisis de la ejecución adaptada al ancho de banda, la caché con conciencia semántica y la gestión elástica de la memoria.

Q: ¿Para qué se utiliza FreeToken deepseek?

Se utiliza para servir localmente modelos MoE grandes de DeepSeek combinando la ejecución en la GPU, el almacenamiento en la memoria del sistema, las transferencias PCIe y la ejecución de expertos en la CPU.

Q: ¿Puede DeepSeek-V4-Flash ejecutarse en una sola RTX 3090?

La prueba práctica de referencia demuestra una configuración con una sola GPU de clase RTX 3090 ejecutando DeepSeek-V4-Flash con descarga hacia la memoria del sistema. Los resultados dependen en gran medida de la RAM disponible, el formato del modelo, el ancho de banda y la configuración de la aplicación.

Q: ¿Cuánta RAM del sistema debo preparar?

Las recomendaciones de las pruebas identifican 32 GB como un posible punto de partida y 64 GB como una opción más cómoda. Los modelos y las configuraciones más grandes pueden requerir bastante más memoria utilizable.

Q: ¿Por qué podría fallar otro modelo descargado?

Un modelo puede fallar debido a una arquitectura no compatible, una cuantización incompatible, memoria utilizable insuficiente, errores del entorno de ejecución o diferencias entre controladores y plataformas. Comprueba los registros y prueba un modelo compatible antes de cambiar el hardware.

SíntomaCausa probableRespuesta práctica
El servidor API nunca llega a estar listoProblema al cargar el modelo, con el controlador o con la memoriaComprueba los registros y reduce la configuración del modelo
Tasa de tokens muy bajaAncho de banda del sistema insuficiente o demasiados fallos de expertosLibera memoria, mejora el ancho de banda y compara los ajustes de caché
El resultado del escritorio es inferior al del servidorSobrecarga del cliente o cargas de trabajo en competenciaRepite la prueba con menos aplicaciones en segundo plano
El modelo se cierra inesperadamenteProblema de compatibilidad o del entorno de ejecución betaPrueba un checkpoint compatible y conserva el registro de errores
El rendimiento disminuye con el tiempoCrecimiento de la caché KV o presión sobre la VRAMReduce el contexto o permite más memoria para el estado KV

FreeToken resulta más útil cuando se aborda como un experimento de sistemas. Comienza con una configuración estable de DeepSeek-V4-Flash, establece una línea base y cambia una variable cada vez. Este método facilita distinguir las limitaciones del hardware de los problemas de compatibilidad del modelo.

Regla para solucionar problemas

Cambia solo un factor por prueba: formato del modelo, longitud del contexto, presupuesto de memoria, endpoint o carga de trabajo en segundo plano. Las comparaciones controladas permiten identificar más rápidamente el verdadero cuello de botella.