Actualizado el 16 de agosto de 2026: Publicación inicial. Los tamaños de los modelos y las cifras de memoria se han verificado con las versiones oficiales de los modelos a esta fecha; esta tabla se actualiza trimestralmente debido a la variabilidad en los tamaños de los modelos.
Toda guía de hardware para IA local se reduce, en última instancia, a una pregunta: ¿el modelo es compatible? Esta página responde a esta pregunta con datos numéricos y va un paso más allá de las especificaciones técnicas. Cuando aparece una clase de modelo en las tablas siguientes, significa que la hemos probado en el laboratorio de StorageReview, y las recomendaciones de hardware enlazan con sistemas que hemos probado en nuestras clasificaciones de IA local para ordenadores de sobremesa y portátiles.
En resumen: el número de parámetros por sí solo ya no predice los requisitos de hardware. La cuantización reduce los pesos aproximadamente cuatro veces, los modelos de mezcla de expertos consumen mucha menos memoria de lo que sugieren sus parámetros totales, y las cargas de trabajo con agentes añaden un coste de memoria que la mayoría de las guías de dimensionamiento omiten por completo. Aquí te explicamos cómo presupuestar los tres.
Requisitos de memoria del modelo
Los tamaños de archivo que se muestran a continuación corresponden a las versiones cuantificadas Q4_K_M habituales (o al formato nativo, según se indique) publicadas en Ollama y Hugging Face en agosto de 2026. La columna "Memoria necesaria para la ejecución" añade información adicional sobre el procesamiento y un margen de tiempo moderado; las cifras marcadas con un asterisco son estimaciones calculadas, mientras que las cifras de GPT-OSS y DeepSeek 671B son declaraciones de los propios proveedores.
| Modelo | Parámetros | Q4 / Descarga nativa | Memoria para ejecutar* | Se ejecuta en |
|---|---|---|---|---|
| Llama 3.1 8B | 8B | 4.9 GB | ~6 a 8 GB | portátiles con 8 GB de VRAM y arriba |
| Phi-4 14B | 14.7B | 9.1 GB | ~11 a 12 GB | 16 GB de VRAM o portátiles con memoria compartida de 64 GB |
| GPT-OSS 20B (MXFP4) | 21B (3.6B activo) | 12 a 14 GB | ~13 a 16 GB | 16GB de RAM, portátiles con memoria compartida |
| Mistral Pequeño 3.2 24B | 24B | 15 GB | ~18 a 20 GB | Portátiles RTX PRO de 24 GB |
| Gema 3 27B | 27B | 17 GB | ~20 a 22 GB | Portátiles RTX PRO de 24 GB, escritorios de memoria unificada |
| Qwen3 30B-A3B | 30.5B (3.3B activo) | 19 GB | ~22 a 24 GB | 24 GB de VRAM (ajustado) o memoria unificada |
| QwQ 32B / DeepSeek-R1 32B | 32B | 20 GB | ~22 a 24 GB | 24 GB de VRAM (ajustado) o memoria unificada |
| Llama 3.3 70B / R1 Distill 70B | 70B | 43 GB | ~48 a 50 GB | Memoria unificada de más de 96 GB, Torres RTX PRO 6000 |
| GPT-OSS 120B (MXFP4) | 117B (5.1B activo) | 65 GB | ~65 a 80 GB | Memoria unificada de 96 GB a 128 GBGPU de 96 GB |
| DeepSeek-R1 671B (completo) | 671B (37B activo) | 404 GB | 450+GB | Fuera del alcance de los ordenadores de sobremesa; territorio de escala de rack. |
*Las estimaciones asumen aproximadamente 8 KB de contexto activo y alrededor del 15 % de sobrecarga de tiempo de ejecución además del archivo de pesos. Los contextos más grandes cuestan mucho más; consulte el impuesto de agencia a continuación.
Dos patrones dignos de mención. Primero, la combinación de expertos cambia las matemáticas: GPT-OSS 120B lleva 117 mil millones de parámetros, pero activa solo 5.1 mil millones por token, por lo que se ejecuta en un único pool de memoria de 96 GB a 128 GB, y OpenAI indica que el objetivo es una única GPU de 80 GB. Lo hemos ejecutado en el HP Z2 Mini G1a , una máquina de 1 litro sin GPU dedicada. Segundo, el DeepSeek-R1 completo con 671 mil millones de parámetros está en un universo diferente: 404 GB solo para descargar en Q4, aproximadamente 450 GB de memoria combinada para ejecutarlo de manera aceptable. Ninguno de los programas en nuestras clasificaciones lo ejecuta, y ningún ordenador de escritorio debería intentarlo.
¿Qué corre dónde?
Portátiles con 8 GB de VRAM (de la serie RTX PRO 500 a 2000). Funcionan bien con los modelos 7B a 8B del cuarto trimestre y las variantes más pequeñas Phi y Gemma. El límite es real: en nuestras pruebas, un modelo 13B que requería unos 12 GB de memoria gráfica simplemente no alcanzaba los 8 GB. Nuestra página «Mejores portátiles para IA local» cubre este ámbito.
Sistemas con 24 GB de VRAM (portátiles RTX PRO 5000, tarjetas RTX de escritorio). El punto óptimo para modelos de 14B a 27B con contexto de sobra, y la forma más rápida de ejecutarlos; nuestro Dell Pro Max 18 Plus lidera el sector con 185 tokens por segundo en Phi. La clase de 32B se ajusta al Q4, pero deja poco margen para el contexto, que es más importante de lo que parece cuando intervienen los agentes.
Sistemas de memoria unificada y compartida (de 96 GB a 128 GB). Las máquinas AMD Strix Halo pueden asignar hasta 96 GB de RAM del sistema a la GPU, y los sistemas GB10 como el NVIDIA DGX Spark cuentan con 128 GB de memoria coherente. Esta clase ejecuta modelos 70B en Q4 y GPT-OSS 120B, priorizando la capacidad sobre la velocidad. La clasificación de los mejores ordenadores de sobremesa para IA local los incluye, y la misma arquitectura se encuentra en portátiles como el HP ZBook Ultra G1a 14 , que cargó DeepSeek-R1 70B en nuestras pruebas.
Torres de estación de trabajo RTX PRO 6000 (96 GB por tarjeta, hasta 384 GB probados). Velocidad y capacidad a la vez: modelos 70B con mayor cuantización y contexto completo, GPT-OSS 120B con margen de seguridad, o varios modelos residentes simultáneamente para pipelines multiagente. Nuestra clasificación de las mejores estaciones de trabajo de escritorio abarca la clase, encabezada por la HP Z8 Fury G6i con capacidad para cuatro GPU.
El impuesto agénito: el contexto es un segundo presupuesto de memoria
El dimensionamiento basado únicamente en el archivo de pesos funciona para sesiones de chat cortas. Los agentes rompen con esta premisa. Un agente entra en un bucle: lee la salida de la herramienta, los archivos y los pasos anteriores en su ventana de contexto, y cada token que se mantiene en el contexto consume memoria en la caché KV, además de los pesos. Los costos no son pequeños.
| Clase de modelo | Caché KV en el contexto de 32K | Caché KV en el contexto de 128K | Coste aproximado por cada 1,000 fichas |
|---|---|---|---|
| 8B (Llama 3.1 8B, FP16 KV) | 4.19 GB | 16.78 GB | ~ 0.13 GB |
| 70B (Llama 3.3 70B, FP16 KV) | 10.49 GB | 41.94 GB | ~ 0.33 GB |
Si comparamos esa tabla con la de dimensionamiento anterior, el problema resulta evidente. Un modelo de 70B en Q4 requiere 43 GB de pesos, pero con un contexto completo de 128K necesita aproximadamente 85 GB en total, el doble de pesos. Un modelo de 8B en 128K gasta más memoria en contexto (16.78 GB) que en sus propios pesos Q4 (4.9 GB). La cuantización de la caché KV ayuda, ya que FP8 reduce esas cifras a la mitad e INT4 las reduce a la cuarta parte a costa de cierta calidad, pero la regla de planificación se mantiene: para el trabajo con agentes, el contexto debe considerarse como un segundo modelo.
El servicio multiplica nuevamente el costo. Si un sistema aloja varios agentes o usuarios simultáneamente, cada solicitud mantiene su propia caché KV. vLLM, la pila de servicio que utilizamos en nuestras clasificaciones de IA local, preasigna el 90 por ciento de la memoria de la GPU por defecto precisamente porque el espacio KV es lo que determina cuántas solicitudes concurrentes sobreviven sin interrupciones que afecten el rendimiento. Una máquina que ejecuta un chat sin problemas puede resultar insuficiente para tres agentes.
Memoria RAM del sistema: La tercera pata olvidada
Para la inferencia solo con GPU, la RAM del sistema simplemente no debe interferir, y de 32 GB a 64 GB es un mínimo cómodo en las máquinas que probamos. Esto se vuelve decisivo en dos casos. La descarga, donde las capas que no caben en la VRAM se transfieren a la CPU, funciona a través de archivos de modelo mapeados en memoria, por lo que la RAM del sistema debe coincidir como mínimo con el tamaño del archivo del modelo más el espacio disponible del sistema operativo. Y en máquinas con memoria unificada, la RAM del sistema es la memoria de la GPU, que es precisamente la razón por la que las configuraciones de 64 GB y 128 GB dominan nuestras clasificaciones de IA local. La propia guía de Ollama utiliza 8 GB de RAM para modelos de 7B, 16 GB para 13B y 32 GB para la clase de 33B; considérelos como mínimos, no como objetivos.
Almacenamiento: La parte que todos se saltan
Las bibliotecas de modelos crecen rápidamente. Los diez modelos de nuestra tabla de dimensionamiento suman aproximadamente 240 GB en sus cuantizaciones comunes, y una biblioteca en funcionamiento con algunas variantes, modelos de incrustación para recuperación y almacenes vectoriales para la memoria del agente puede superar los 500 GB antes de que lleguen los datos del proyecto. Además, los flujos de trabajo basados en agentes generan tráfico de datos temporal real: registros, puntos de control e índices de recuperación que coexisten con los modelos.
El tiempo de carga es donde se nota la clase de unidad. La fórmula es sencilla: un archivo GPT-OSS de 65 GB y 120 bytes se lee en unos 109 segundos a velocidades SATA, en unos 17 segundos en una unidad NVMe Gen3 y en menos de 9 segundos a velocidades Gen4, solo en la primera carga, ya que la caché de páginas del sistema operativo hace que las recargas sean casi instantáneas. Los cargadores reales no siempre mantienen la velocidad máxima de la unidad, por lo que planeamos publicar nuestros propios datos de carga del modelo medidos en todas las clases de unidades; consulta el registro de cambios. Nuestra clasificación de almacenamiento cubre las unidades en sí.
Orientación práctica: 2 TB NVMe es el mínimo recomendable para una estación de trabajo de IA dedicada, 4 TB si la máquina aloja agentes que acumulan estado, y Gen4 o superior si se cambia regularmente entre modelos grandes.
Preguntas frecuentes sobre hardware de IA agenica
¿Cuánta VRAM necesito para ejecutar un modelo 70B localmente?
Aproximadamente de 48 a 50 GB en Q4 con contexto moderado, razón por la cual esta clase pertenece a máquinas con memoria unificada de 96 GB y GPU de estaciones de trabajo de 96 GB en lugar de cualquier tarjeta de consumo. Si se aumenta el contexto a 128 KB, el total se acerca a los 85 GB. Si se ejecuta en Q8, solo los pesos alcanzan los 75 GB.
¿Puedo ejecutar DeepSeek-R1 completo localmente?
No en ninguna de las clasificaciones de este sitio. El modelo completo de 671B requiere una descarga de 404 GB en el cuarto trimestre y necesita aproximadamente 450 GB de memoria combinada para funcionar de forma aceptable. La ruta local práctica son las configuraciones oficiales, y las configuraciones de 32B y 70B en nuestra tabla de dimensionamiento capturan gran parte de la capacidad para los requisitos de un ordenador de sobremesa.
¿Los modelos de mezcla de expertos modifican las matemáticas del hardware?
Sustancialmente. Los modelos MoE activan una fracción de sus parámetros por token, por lo que la memoria aumenta con el número total de parámetros, pero la velocidad aumenta más cerca de los parámetros activos. GPT-OSS 120B (5.1B activos) y Qwen3 30B-A3B (3.3B activos) se ejecutan más rápido de lo que sugieren sus tamaños en los grupos de memoria que los admiten. Aún se necesita memoria para todos los pesos; simplemente se obtiene mayor velocidad por gigabyte.
¿Cuánto almacenamiento necesita una estación de trabajo de IA?
Planifique un mínimo de 2 TB NVMe, 4 TB para los hosts de los agentes. Una biblioteca de modelos modesta por sí sola ocupa cientos de gigabytes, los agentes acumulan registros y almacenes de vectores, y los archivos individuales más grandes (65 GB o más) hacen que las unidades lentas sean un problema cada vez que se carga o se intercambia un modelo.
¿Qué hardware debería comprar específicamente para los agentes locales?
Prioriza la memoria sobre la velocidad bruta. Los agentes mantienen contextos extensos y a veces se ejecutan simultáneamente, por lo que el presupuesto de caché KV es tan importante como el presupuesto de memoria. Un sistema de memoria unificada de 96 GB a 128 GB en nuestra clasificación de IA local para escritorio es la opción más económica, y las torres RTX PRO 6000 en la clasificación de estaciones de trabajo son la solución cuando la velocidad y la concurrencia son cruciales.
Reseña: Ya están aquí las cifras del GB300
Todo lo anterior refleja el hardware que hemos probado, y el sistema que dijimos que cambiaría las cosas ya lo ha hecho. Nuestra reseña de la MSI XpertStation WS300 , la primera estación GB300 DGX que hemos tenido en nuestras manos, ya está disponible: un grupo de memoria coherente de 748 GB que abarca 252 GB de HBM3e y 496 GB de LPDDR5X, 20 petaFLOPS de FP4, y en nuestras pruebas sirvió un punto de control GLM-5.2 de 433 GB que no debería estar funcionando en una estación de trabajo, con 216 GB de pesos expertos alojados en memoria Grace.
La importancia de esta guía radica en la memoria. Todas las recomendaciones de esta página se basan en un límite máximo, dividiendo los modelos entre varias GPU, recurriendo a la cuantización o aceptando la descarga de la CPU cuando los pesos y la caché KV no caben. NVIDIA especifica que los sistemas de sobremesa GB300 cuentan con varios cientos de gigabytes de memoria coherente direccionable por el acelerador, lo que representa un orden de magnitud diferente al de las tarjetas de 96 GB que sirven de base a las tablas anteriores. Las clases de modelos que actualmente requieren una torre multi-GPU, o que consideramos poco prácticas para ejecutar localmente, se sitúan dentro del rango de una sola unidad.
No vamos a cuantificarlo hasta que hayamos realizado la prueba. Ninguna cifra de esta página se basa en GB300, y nada de lo que se muestra aquí se ha ajustado en previsión de dicha prueba. Cuando se publique la revisión, esta guía se actualizará con base en los resultados medidos y el cambio se registrará en el historial a continuación.
Cómo mantenemos esta guía
Los tamaños de los modelos y la lista de modelos populares cambian trimestralmente, más rápido que cualquier ciclo de hardware. Verificamos la tabla de tamaños con las versiones oficiales cada trimestre, y añadimos los resultados de laboratorio a medida que los nuevos sistemas superan nuestras pruebas de IA local. Los cambios se registran en la nota con fecha en la parte superior de la página. Las cifras de tamaño marcadas como estimaciones utilizan el archivo de ponderación publicado más los costos de caché KV medidos y la sobrecarga de tiempo de ejecución estándar; las cifras indicadas por el proveedor se identifican como tales.




Amazon