- FreeToken deepseek permite servir localmente modelos MoE grandes de DeepSeek en hardware de consumo.
- DeepSeek-V4-Flash utiliza una activación dispersa de expertos, pero aun así necesita una cantidad considerable de memoria del sistema.
- Las configuraciones con una sola GPU pueden funcionar bien cuando la VRAM, la RAM y el ancho de banda de memoria están equilibrados.
- El software beta puede presentar problemas de compatibilidad con algunos modelos, especialmente con checkpoints densos de gran tamaño.
- Mejor punto de partida: utiliza un modelo cuantizado compatible y supervisa la memoria antes de aumentar la longitud del contexto.
FreeToken deepseek: Qué hace el sistema
FreeToken es un sistema de inferencia nativo para el edge que sirve modelos grandes de mezcla de expertos distribuyendo la carga entre una GPU, la CPU, la memoria del sistema y la conexión PCIe entre ellos. Su escenario más útil con DeepSeek es DeepSeek-V4-Flash, donde solo se activa una fracción de los expertos del modelo para cada token, mientras que el conjunto completo de expertos sigue siendo mucho mayor que la memoria habitual de una GPU de consumo.
En lugar de exigir que cada experto permanezca en la VRAM, FreeToken mantiene el conjunto completo de expertos enrutados en la memoria del sistema y utiliza la memoria disponible de la GPU como una caché elástica. El entorno de ejecución puede mover expertos a la GPU cuando es necesario o ejecutar directamente en la CPU ciertos fallos de caché. Esto hace posible experimentar localmente con hardware que no podría contener el modelo completo en la VRAM.
Aspectos destacados del video:
- Pruebas de DeepSeek-V4-Flash con una sola GPU y una configuración de clase RTX 3090
- Aplicación de escritorio y flujo de trabajo con un endpoint local
- Conexión con Open WebUI para chat interactivo
- Rendimiento de decodificación informado de aproximadamente 10–11 tokens por segundo en una configuración de servidor
- Limitaciones de memoria, comportamiento beta y advertencias sobre compatibilidad de modelos
El diseño de investigación utiliza dos ideas complementarias. Durante el prellenado, FreeToken solapa las transferencias de expertos con los cálculos de la GPU mediante un doble búfer de capa completa. Durante la decodificación, utiliza una caché LRU compartida de expertos para que los expertos enrutados recientemente tengan más probabilidades de permanecer disponibles en la GPU.
El sistema también mide la máquina de destino en lugar de depender únicamente de las especificaciones anunciadas. El ancho de banda de la memoria del sistema y el ancho de banda de transferencia PCIe determinan cuántos expertos faltantes deben copiarse a la GPU y cuántos deben procesarse directamente en la CPU.
| Componente | Función en FreeToken | Por qué importa |
|---|---|---|
| VRAM de la GPU | Almacena los pesos no expertos y una caché dinámica de expertos | Una mayor cantidad de VRAM disponible puede reducir los fallos de caché |
| RAM del sistema | Contiene el conjunto completo de expertos | Los modelos MoE grandes requieren una cantidad considerable de memoria del sistema |
| Enlace PCIe | Transfiere los expertos faltantes a la GPU | El ancho de banda afecta a la latencia de decodificación y prellenado |
| CPU | Ejecuta los fallos de expertos seleccionados | Es útil cuando aún queda ancho de banda disponible en la memoria del sistema |
| Caché LRU | Registra los pares de capa y experto utilizados recientemente | Se adapta a los cambios en el enrutamiento a nivel de token |
Considera FreeToken como un entorno de ejecución para servir modelos, no como un modelo más pequeño. Mejora la coordinación de los recursos, pero no elimina los requisitos de memoria del checkpoint subyacente.
Requisitos del modelo DeepSeek y del hardware
La distinción más importante es la que existe entre los parámetros activos y los parámetros totales almacenados. DeepSeek-V4-Flash se describe como un modelo MoE de 284B parámetros, con aproximadamente 13B parámetros activos por token. La activación dispersa reduce el cálculo necesario para cada token, pero el conjunto completo de expertos aún debe residir en algún lugar del sistema.
El material de referencia identifica la RTX 5090 como un objetivo sólido para la implementación FP4 del artículo, mientras que las pruebas prácticas también demuestran DeepSeek-V4-Flash en una máquina de clase RTX 3090 con descarga hacia la memoria del sistema. Se trata de configuraciones diferentes, por lo que sus resultados no deben considerarse benchmarks intercambiables.
| Nivel de configuración | Ejemplo de GPU | Orientación sobre memoria | Uso previsto |
|---|---|---|---|
| Experimento inicial | GPU de clase RTX 3090 | Al menos 32 GB de RAM del sistema; 64 GB resulta más cómodo | Chat local con ajustes conservadores |
| Escritorio práctico | GPU de clase RTX 4090 | 64–128 GB de RAM del sistema, según el modelo | Descarga más rápida y sesiones más largas |
| Consumo de gama alta | GPU de clase RTX 5090 | Gran cantidad de RAM junto con cuantización compatible | Mayor capacidad de caché y menor presión de transferencia |
| Estación de trabajo avanzada | RTX PRO 6000 Blackwell, 96 GB | Configuración de memoria de clase estación de trabajo | Demostración de GLM-5.2 y cargas de trabajo más grandes |
Las pruebas del video con una sola GPU sugieren que 32 GB de memoria del sistema pueden ser un punto de partida, mientras que 64 GB o más ofrecen un margen operativo más seguro. El artículo de investigación también enfatiza que la RAM del sistema, la velocidad de la memoria y el ancho de banda PCIe pueden convertirse en los factores limitantes una vez que la GPU se utiliza por completo.
DDR5 puede ofrecer una ventaja significativa frente a las plataformas DDR4 antiguas de doble canal, ya que la ejecución de expertos en el sistema y las transferencias PCIe compiten por el ancho de banda de memoria. Sin embargo, el resultado exacto depende de la placa base, la configuración de memoria, la CPU, el sistema operativo y las aplicaciones activas.
Capacidad de VRAM
Una mayor cantidad de VRAM libre permite a FreeToken conservar más expertos y estado de la caché KV. Cierra los navegadores, las herramientas de grabación y otras aplicaciones que consuman mucha GPU durante las pruebas.
Memoria del sistema
La RAM del sistema almacena el conjunto completo de expertos durante la descarga. Comprueba la memoria utilizable, no solo la capacidad instalada.
Equilibrio del ancho de banda
El ancho de banda de PCIe y de la RAM influye en la mejor división entre CPU y GPU. FreeToken perfila estos recursos para elegir una estrategia de ejecución.
No calcules los requisitos basándote únicamente en los parámetros activos. Un modelo disperso puede calcular solo un pequeño subconjunto de expertos por token y, aun así, requerir un conjunto de pesos residente muy grande.
Flujo de configuración de FreeToken DeepSeek
El flujo de trabajo de escritorio está diseñado para reducir la cantidad de configuración manual del motor. La distribución disponible depende del sistema operativo; las pruebas de referencia abarcan Windows, Ubuntu, AppImage, Arch Linux y una ruta mediante la aplicación de escritorio.
Utiliza un formato de modelo compatible y confirma que la memoria necesaria del sistema esté disponible antes de comenzar. FreeToken puede informar que la RAM y la VRAM utilizables son insuficientes cuando el checkpoint seleccionado supera el presupuesto de hardware actual.
Instala la compilación adecuada
Elige la compilación de FreeToken que coincida con tu sistema operativo y arquitectura. En Linux, utiliza el paquete o AppImage apropiado para tu distribución. Mantén el controlador de la GPU y el entorno CUDA alineados con los requisitos de la aplicación.
Prepara la memoria y las aplicaciones
Cierra las cargas de trabajo innecesarias de la GPU, el software de grabación, los juegos y las pestañas del navegador. Confirma que quede suficiente RAM del sistema disponible para el conjunto completo de expertos, además del sistema operativo y otros servicios.
Selecciona un endpoint compatible
Configura el endpoint del modelo mediante la interfaz de la aplicación. El flujo demostrado utiliza Hugging Face como endpoint y conecta el servidor local con Open WebUI para el chat.
Carga DeepSeek-V4-Flash
Comienza con la compilación compatible de DeepSeek-V4-Flash en lugar de un modelo denso más grande. Espera a que la aplicación termine de cargar y confirma que el servidor API indique que está listo.
Mide con un prompt corto
Envía primero una solicitud sencilla y, después, comprueba el rendimiento en tokens, el uso de memoria y la estabilidad de la respuesta. Aumenta gradualmente el contexto o los ajustes de razonamiento en lugar de cambiar varias variables a la vez.
Que el servidor API esté listo no significa necesariamente que todos los modelos descargados vayan a ejecutarse correctamente. Las notas de las pruebas describen un intento fallido con una configuración Qwen 3.8 27B BF16, lo que demuestra por qué la compatibilidad del modelo y el ajuste a la memoria deben verificarse por separado.
| Comprobación de configuración | Condición de aprobación | Si falla |
|---|---|---|
| Controlador y entorno de ejecución | La aplicación se inicia sin errores de inicialización de la GPU | Actualiza el entorno o utiliza uno compatible |
| Memoria del sistema | FreeToken informa que hay suficiente RAM y VRAM utilizables | Cierra aplicaciones o elige una compilación más pequeña |
| Compatibilidad del modelo | El checkpoint seleccionado se inicia correctamente | Prueba un formato compatible oficialmente |
| Estado de la API | El servidor indica que está listo | Revisa los registros y reinicia el motor |
| Endpoint de chat | Open WebUI recibe una respuesta | Verifica la dirección del endpoint y la selección del modelo |
Utiliza la configuración DeepSeek compatible más pequeña, envía un prompt corto y registra el uso de memoria antes de activar el máximo razonamiento o cargas de trabajo con contexto largo.
Rendimiento, caché y ajustes
El rendimiento depende de la interacción entre la localidad de los expertos, la capacidad de la caché, el ancho de banda del sistema y la carga de trabajo. Un prompt corto de un solo turno puede producir un resultado diferente al de una sesión de programación o uso de herramientas con varios turnos, ya que las cargas de trabajo agénticas vuelven a consultar el contexto repetidamente y modifican el patrón de expertos activos.
En la prueba de referencia con una máquina de clase RTX 3090, DeepSeek-V4-Flash alcanzó aproximadamente entre 10 y 11 tokens por segundo en el flujo de trabajo del servidor. El cliente de escritorio mostró un resultado inferior, de aproximadamente 8,8 tokens por segundo en una prueba. Estas cifras dependen de la configuración y no son objetivos universales.
La evaluación de investigación informa de resultados superiores en hardware más moderno. En una RTX 5090, FreeToken mantuvo aproximadamente entre 22 y 25 tokens por segundo para DeepSeek-V4-Flash en las cargas de trabajo agénticas indicadas. El mismo artículo informa de tasas de fallos más bajas con su caché LRU global que con las estrategias de colocación estática.
| Prioridad de ajuste | Acción | Beneficio |
|---|---|---|
| 1 | Libera VRAM antes de cargar | Crea un presupuesto mayor para la caché de expertos |
| 2 | Utiliza memoria del sistema más rápida | Mejora la ejecución en la CPU y el uso compartido de las transferencias |
| 3 | Prefiere un enlace PCIe más amplio | Reduce el tiempo de movimiento de los expertos |
| 4 | Comienza con un contexto moderado | Deja espacio para el crecimiento de la caché KV |
| 5 | Compara las rutas del servidor y del escritorio | Revela la sobrecarga del cliente y las diferencias del entorno de ejecución |
La caché de FreeToken es elástica porque la mejor división entre el almacenamiento de expertos y la caché KV cambia durante una sesión. Las conversaciones largas consumen más memoria de la caché KV, mientras que los cambios en los patrones de enrutamiento modifican qué expertos conviene conservar. Una configuración que funciona bien en la primera solicitud puede necesitar ajustes después de varios turnos.
La política q-star divide los fallos de caché entre la transferencia a la GPU y la ejecución en la CPU. En términos simplificados, una máquina con mayor ancho de banda PCIe puede copiar más fallos a la VRAM, mientras que una máquina con un ancho de banda de memoria del sistema relativamente superior puede procesar más fallos directamente en su ubicación. FreeToken perfila estos valores durante la implementación.
Compara modelos, cuantización, prompts, longitudes de contexto, ajustes de razonamiento y aplicaciones en segundo plano idénticos. Los resultados de tokens por segundo de distintos entornos de ejecución no son directamente comparables si esas variables no coinciden.
Antes de cada benchmark:
- Confirma que el modelo DeepSeek y la cuantización sean los mismos
- Registra la VRAM y la RAM del sistema disponibles
- Cierra las cargas de trabajo que compitan por la GPU y la memoria
- Utiliza el mismo prompt y la misma longitud de contexto
- Registra el rendimiento, el tiempo de inicio y la estabilidad de la respuesta
Limitaciones y preguntas frecuentes sobre solución de problemas
FreeToken hace más accesible el servicio local de modelos MoE, pero sigue siendo sensible a la madurez del software y a las condiciones del hardware. La aplicación probada en el material de referencia se identifica como software beta, y no todos los modelos descargados se inician correctamente.
Cuando un modelo se cierra inesperadamente, comienza con las comprobaciones básicas: verifica el formato del modelo, inspecciona los registros del servidor, confirma la memoria utilizable y prueba un checkpoint compatible más pequeño. No supongas que un inicio fallido demuestra que la GPU es demasiado débil; también pueden influir la compatibilidad, el comportamiento del controlador, la memoria fijada y la compatibilidad del entorno de ejecución.
El artículo de investigación de FreeToken proporciona el diseño técnico, la metodología de evaluación y el análisis de la ejecución adaptada al ancho de banda, la caché con conciencia semántica y la gestión elástica de la memoria.
Q: ¿Para qué se utiliza FreeToken deepseek?
Se utiliza para servir localmente modelos MoE grandes de DeepSeek combinando la ejecución en la GPU, el almacenamiento en la memoria del sistema, las transferencias PCIe y la ejecución de expertos en la CPU.
Q: ¿Puede DeepSeek-V4-Flash ejecutarse en una sola RTX 3090?
La prueba práctica de referencia demuestra una configuración con una sola GPU de clase RTX 3090 ejecutando DeepSeek-V4-Flash con descarga hacia la memoria del sistema. Los resultados dependen en gran medida de la RAM disponible, el formato del modelo, el ancho de banda y la configuración de la aplicación.
Q: ¿Cuánta RAM del sistema debo preparar?
Las recomendaciones de las pruebas identifican 32 GB como un posible punto de partida y 64 GB como una opción más cómoda. Los modelos y las configuraciones más grandes pueden requerir bastante más memoria utilizable.
Q: ¿Por qué podría fallar otro modelo descargado?
Un modelo puede fallar debido a una arquitectura no compatible, una cuantización incompatible, memoria utilizable insuficiente, errores del entorno de ejecución o diferencias entre controladores y plataformas. Comprueba los registros y prueba un modelo compatible antes de cambiar el hardware.
| Síntoma | Causa probable | Respuesta práctica |
|---|---|---|
| El servidor API nunca llega a estar listo | Problema al cargar el modelo, con el controlador o con la memoria | Comprueba los registros y reduce la configuración del modelo |
| Tasa de tokens muy baja | Ancho de banda del sistema insuficiente o demasiados fallos de expertos | Libera memoria, mejora el ancho de banda y compara los ajustes de caché |
| El resultado del escritorio es inferior al del servidor | Sobrecarga del cliente o cargas de trabajo en competencia | Repite la prueba con menos aplicaciones en segundo plano |
| El modelo se cierra inesperadamente | Problema de compatibilidad o del entorno de ejecución beta | Prueba un checkpoint compatible y conserva el registro de errores |
| El rendimiento disminuye con el tiempo | Crecimiento de la caché KV o presión sobre la VRAM | Reduce el contexto o permite más memoria para el estado KV |
FreeToken resulta más útil cuando se aborda como un experimento de sistemas. Comienza con una configuración estable de DeepSeek-V4-Flash, establece una línea base y cambia una variable cada vez. Este método facilita distinguir las limitaciones del hardware de los problemas de compatibilidad del modelo.
Cambia solo un factor por prueba: formato del modelo, longitud del contexto, presupuesto de memoria, endpoint o carga de trabajo en segundo plano. Las comparaciones controladas permiten identificar más rápidamente el verdadero cuello de botella.