DGX Spark vs Strix Halo vs Gorgon Halo: ¿Qué hardware de IA local deberías comprar?
DGX Spark vs Strix Halo vs Gorgon Halo: ¿qué plataforma encaja con tu carga de trabajo de LLM local?
Un sistema con 192GB no es automáticamente más rápido que uno con 128GB. Una especificación de 1 PFLOP no te dice a qué velocidad generará tokens un LLM. Y un benchmark sin resultados separados de prefill y decode puede dar una imagen engañosa del rendimiento real.
Esos matices importan al comparar la plataforma de NVIDIA, la opción AMD de 128GB y las configuraciones de clase 192GB más recientes para IA local / LLM locales.

Las tres pueden cubrir cargas de trabajo que antes empujaban a torres con GPU discretas grandes: inferencia privada, agentes de código, RAG, contexto largo y pipelines multimodelo. Solo que resuelven esos problemas de formas distintas.
La forma útil de compararlas es:
- ¿Cabe el modelo y sus datos de trabajo en memoria?
- ¿Con qué rapidez procesa el sistema un prompt largo (prefill)?
- ¿Con qué rapidez genera tokens (decode)?
- ¿Depende tu software de CUDA?
- ¿Qué ocurre cuando la carga supera los 128GB?
La distinción más importante sigue siendo:
La capacidad de memoria determina qué puede caber. El ancho de banda de memoria, el cómputo, la cuantización y el software determinan a qué velocidad corre.
La pregunta principal que responde esta guía: cómo elegir entre el aparato NVIDIA de 128GB, la opción Strix de AMD de 128GB y los sistemas de sobremesa de clase Gorgon con 192GB para inferencia de LLM local —sobre todo la bifurcación de capacidad 128GB vs 192GB—, sin tratar una captura suelta de tokens/s como un ranking.
Comparativa rápida
| Característica | DGX Spark | Strix Halo | Gorgon Halo |
|---|---|---|---|
| Plataforma principal | NVIDIA Grace Blackwell | AMD Zen 5 + APU Radeon | Clase AMD de sobremesa con más memoria |
| Memoria unificada | 128GB | Hasta 128GB en sistemas tope de gama | Hasta 192GB (configuraciones clase Max+ PRO 495) |
| Ancho de banda de memoria | 273 GB/s declarado | 256 GB/s (LPDDR5X-8000, pico declarado por AMD) | 273 GB/s pico teórico (256-bit × LPDDR5X-8533) |
| Software | CUDA / DGX OS | ROCm / Vulkan / llama.cpp / Ollama | ROCm / Vulkan / llama.cpp / Ollama |
| Formato | Aparato de IA compacto | Mini PC de IA / estación de trabajo compacta | Estación de trabajo de IA compacta |
| Mejor motivo para elegirlo | Desarrollo CUDA-first + prefill sólido en algunas pruebas publicadas | Inferencia local de 128GB más un PC x86 normal | Cargas que de verdad superan los 128GB |
Esta tabla orienta las plataformas. No significa que una columna sea universalmente más rápida: eso depende del caso de uso.
AMD lista Gorgon Halo como el antiguo nombre en clave en la página del Ryzen AI Max+ PRO 495 (hasta 192GB, Radeon 8065S). Aquí lo usamos como abreviatura de comprador para ese escalón de sobremesa de 192GB, no como una marca de arquitectura de consumo aparte.

Planificación rápida: qué suele comprar 128GB vs 192GB
Solo orientación de planificación —no es un límite duro de modelo. La cuantización, la longitud de contexto y las pilas multiservicio mueven la cifra real.
| Memoria unificada | Rol práctico (solo planificación) |
|---|---|
| ~64GB | 7B-32B con holgura; algunos modelos mayores solo con cuantización agresiva |
| 128GB | Clase 70B con holgura; algunas cargas 120B / MoE según cuantización + contexto |
| 192GB | Cuants más altos, ficheros de pesos MoE más grandes, pilas multimodelo, más margen de caché KV |
Si con 128GB ya cabe con margen, trata los 192GB como colchón de capacidad.

Mapa de cuellos de botella en hardware para LLM
| Carga de trabajo | Primer cuello de botella | Segundo cuello de botella | Por qué |
|---|---|---|---|
| Chat 7B | Cómputo / software | Memoria | El modelo es relativamente pequeño |
| Chat 32B | Ancho de banda | Cómputo | El decode se vuelve más sensible a la memoria |
| 70B | Capacidad | Ancho de banda | El tamaño de los pesos crece con fuerza |
| 120B+ | Capacidad | Ancho de banda | Cabida es la primera restricción |
| Contexto largo | Caché KV | Memoria | El contexto aumenta los requisitos de caché |
| Agente de código | Contexto + KV | Decode | Prompts largos + generación |
| RAG | Prefill | Ancho de banda de memoria | Muchos tokens de entrada |
| MoE | Capacidad + runtime | Ancho de banda | Los parámetros totales y los activos difieren |
Este mapa es el punto de partida al comprar estas plataformas en 2026: no una captura suelta de tokens/s.
Por qué se comparan estas tres plataformas
El salto de los PC con IA a las estaciones de trabajo locales
El marketing de «AI PC» sigue apoyándose en los TOPS de NPU. Quien compra en serio para LLM locales mira más la memoria unificada, las rutas de inferencia GPU/APU y si la caja puede alojar agentes privados, RAG y trabajo de contexto largo en el escritorio —por eso la plataforma de NVIDIA, la opción AMD de 128GB y las configuraciones de clase 192GB aparecen juntas al buscar hardware de mini PC de IA / estación de trabajo compacta.
Por qué la capacidad de memoria se volvió una especificación clave
Cuando la gente empezó a cargar pesos de clase 70B y 120B+ en local, 128GB y 192GB dejaron de sonar a lujo y empezaron a sonar a «¿cabrá siquiera?». La memoria unificada explica por qué estas tres opciones de sobremesa comparten atención: prometen una memoria unificada lo bastante grande para hardware de LLM local que antes exigía torres multi-GPU.
(Las diferencias a nivel de chip entre 128GB y 192GB están en nuestra guía Ryzen AI Max+ 395 vs PRO 495. En la ficha de AMD, el Ryzen AI Max+ PRO 495 lista el antiguo nombre en clave Gorgon Halo, Radeon 8065S (40 CU) y hasta 192GB LPDDR5X-8533 —ese es el silicio de clase 192GB que esta guía aplica a los equipos de sobremesa.)
¿Qué es AMD Strix Halo?
Plataforma y Ryzen AI Max
Strix Halo es la plataforma APU de gama alta de AMD que mete una CPU Zen 5 potente, una iGPU Radeon grande y un bus ancho de memoria unificada LPDDR5X en sistemas compactos. Quien busca suele teclear AMD Strix Halo; el Ryzen AI Max+ 395 es uno de los chips más conocidos que implementan esa plataforma en SKU de mini PC Strix Halo y estaciones de trabajo (incluido el perfil Ryzen AI Max+ 395 128GB).
Para lo básico de la plataforma y el formato, consulta esa misma guía Strix Halo 128GB. Si estás comparando un PC Strix Halo con aparatos tipo appliance NVIDIA, empieza por esa guía.
Por qué Strix interesa para IA local
La plataforma importa para IA local porque combina:
- Una memoria unificada amplia (habitualmente hasta 128GB en configuraciones tope como Strix Halo 128GB)
- Cómputo GPU real para inferencia LLM (no solo marketing de NPU)
- Opciones de chasis compacto —desde diseños de mini PC AMD compactos hasta cajas de sobremesa más densas
- Holgura suficiente para software x86 cotidiano además del modelo
No es «una RTX 4090 discreta en una caja minúscula». Es un enfoque APU-first: caber pesos grandes en un solo pool, aceptar que el decode suele estar limitado por el ancho de banda de memoria y optimizar la ruta de software (ROCm, Vulkan, llama.cpp, Ollama).
¿Qué es AMD Gorgon Halo?
Este es el hueco de información que la mayoría de posts Spark-vs-Strix aún omiten.
Capacidad: AMD de 128GB vs clase 192GB
La propia ficha de producto de AMD lista Gorgon Halo como el antiguo nombre en clave del Ryzen AI Max+ PRO 495 (Radeon 8065S, 40 CU, hasta 192GB LPDDR5X-8533). En esta guía seguimos usando «Gorgon Halo» sobre todo como abreviatura de comprador para ese escalón de sobremesa de 192GB —no como una marca de arquitectura de consumo por la que debas comprar por nombre.
Para el comprador, la distinción útil es más simple:
- La opción AMD de clase 128GB → suele bastar para muchas pilas de LLM local que se mantienen en memoria
- La configuración de 192GB → más margen cuando pesos, caché KV y pilas multiservicio dejan de caber
Frente a Strix, por tanto, es sobre todo una historia de capacidad (con frecuencias y márgenes térmicos que dependen de la configuración), pensada para cargas que ya chocaban con el muro de 128GB: RAG multiservicio, contexto más largo, ficheros de pesos MoE mayores, cuantizaciones más altas.
Frente al aparato NVIDIA de 128GB, la pregunta es otra: la caja de NVIDIA sigue centrada en CUDA y 128GB de memoria unificada coherente; los sistemas AMD con más memoria responden a «¿y si la memoria residente de 128GB es el verdadero muro?».
Por qué importa más capacidad de memoria para LLM locales
La capacidad aparece con pesos mayores, cachés KV más largas, pilas multiservicio o cuantización menos agresiva.
¿Más memoria es siempre mejor?
No. La capacidad fija que puedes cargar; la velocidad sigue ligada al ancho de banda, al cómputo y al software.

¿Qué es NVIDIA DGX Spark?
Especificaciones que importan para IA
Según la ficha de producto de NVIDIA, las especificaciones del DGX Spark que importan para IA local / inferencia LLM (y para leer con cuidado las afirmaciones de rendimiento) son, a grandes rasgos:
- Superchip NVIDIA GB10 basado en NVIDIA Blackwell
- 128GB de memoria unificada coherente a 273 GB/s declarados
- Rendimiento Tensor de clase FP4 en marketing (hasta ~1 PFLOP FP4 sparse —teórico)
- Pila de software CUDA, DGX OS, playbooks / herramientas orientadas a NIM
- Almacenamiento local rápido (las configuraciones Founders incluyen NVMe grande)
- Red ConnectX-7 para historias de scale-out multi-caja
El PVP de la Founders Edition se sitúa actualmente en 4.699 USD (solo contexto de precio —esta guía no es un repaso de precios).
Por qué CUDA forma parte de la historia de Spark
Para muchos compradores, la plataforma de NVIDIA no es «otra caja de 128 GB». Es el acceso al ecosistema CUDA: frameworks, kernels, recetas de fine-tune y pilas de serving que ya asume NVIDIA. Esa capa de software forma parte del rendimiento del LLM medido; no es un accesorio.
Diferencias clave de hardware (detalle)
La comparativa rápida de arriba basta para la mayoría de los compradores. Esta tabla añade la capa de especificaciones más densa.
| Característica | Spark | Strix | Gorgon |
|---|---|---|---|
| Arquitectura | Grace Blackwell (GB10) | Familia APU Strix | Clase Max+ PRO 495 / AMD de sobremesa con más memoria |
| CPU | Arm de 20 núcleos | Zen 5 x86 (implementaciones clase Strix) | Zen 5 x86 (implementaciones clase PRO 495) |
| GPU | Blackwell | iGPU Radeon (p. ej. Radeon 8060S) | iGPU Radeon (p. ej. Radeon 8065S) |
| Memoria unificada | 128GB | Habitualmente hasta 128 GB | Hasta 192GB |
| Ancho de banda de memoria | 273 GB/s declarado | 256 GB/s (LPDDR5X-8000, pico declarado por AMD) | 273 GB/s pico teórico (256-bit × LPDDR5X-8533); sostenido OEM por confirmar |
| Cómputo IA (marketing) | ~1 PFLOP FP4 sparse | TOPS de plataforma / iGPU | Las etiquetas TOPS de plataforma siguen ≠ tok/s de LLM |
| Pila de software | CUDA / DGX OS | ROCm / Vulkan / llama.cpp | ROCm / Vulkan / llama.cpp |
| Formato | Aparato ultracompacto | Mini PC de IA / estación de trabajo compacta | SKU de estación de trabajo compacta |
| Ángulo principal de compra | Ecosistema CUDA + fuerza de prefill publicada en algunas pruebas | Plataforma AMD compacta de 128GB | Más capacidad de memoria para pilas limitadas por cabida |
Las especificaciones que de verdad importan para LLM
Para inferencia LLM, tres cifras no son intercambiables:
- Capacidad de memoria — ¿caben pesos + KV + runtime?
- Ancho de banda de memoria — ¿a qué velocidad puede el decode mover pesos?
- Cómputo + software — ¿qué tan rápido es el prefill y qué kernels existen?
TOPS / PFLOPS solos no responden a esas preguntas.
Capacidad de memoria vs ancho de banda para LLM locales
Por qué 128GB puede importar más que los FLOPS de la GPU
Si el modelo no cabe, los FLOPS son irrelevantes. Por eso las conversaciones de hardware para LLM local se fijan en Strix Halo 128GB y en los 128GB de memoria unificada de Spark —y por qué Gorgon 192GB es una historia de producto real para usuarios limitados por capacidad.
Por qué más memoria no significa automáticamente inferencia más rápida
Una vez que cabe el conjunto de trabajo, añadir RAM rara vez sube tokens/s por sí solo. El decode en APU de memoria unificada suele estar limitado por el ancho de banda. La capacidad extra reduce sobre todo el swapping, la descarga forzada y las bajadas de cuantización obligadas.
Qué cambia el ancho de banda de memoria
El ancho de banda se nota más en:
- Decode (generación token a token)
- Streaming de pesos en modelos densos grandes
- Rendimiento LLM limitado por memoria cuando la GPU espera al bus
Los 273 GB/s declarados de Spark y el pico de 256 GB/s de Strix ayudan a explicar por qué, en algunas corridas públicas emparejadas, las brechas de generación parecen modestas —aunque las de prefill se vean grandes. Las configuraciones de clase 192GB del Max+ PRO 495 también aterrizan en un pico teórico de 273 GB/s a partir de 256 bits × LPDDR5X-8533 (el sostenido OEM puede diferir).
¿Qué ocurre al añadir más contexto?
Más contexto hace crecer la caché KV. Los agentes de código y el RAG que reenvían prompts enormes castigan el prefill y la huella de caché. Ese mapa de cuellos de botella es distinto al de turnos cortos de chatbot.
Por qué el tamaño del modelo ya no basta para elegir hardware de IA local
«¿Cuántos GB para un modelo 70B?» es la pregunta incorrecta si se queda sola.
Un presupuesto práctico de memoria para LLM locales:
- Pesos del modelo (depende de la cuantización)
- Caché KV (depende de la longitud de contexto)
- Overhead de runtime (framework, grafos CUDA/ROCm, SO)
- Contexto/herramientas (espacio temporal del agente, buffers de recuperación)
- Varios modelos/servicios (embedder, reranker, segundo LLM)
Así, la misma etiqueta «70B» puede ir cómoda en 128GB en una pila y ser dolorosa en otra. Planificar capacidad es una suma, no un recuento de parámetros.
(Consulta la tabla temprana de planificación rápida para los rangos de 64 / 128 / 192GB.)
Inferencia LLM por clase de modelo
LLM pequeños y medianos
Para chat 7B-32B, el cómputo, la madurez del software, el coste y la potencia suelen importar más que perseguir 192GB. Un mini PC de IA sobre la opción AMD de 128GB puede ser la compra racional si tus modelos ya caben.
Modelos de clase 70B
Aquí la capacidad de memoria, la cuantización y el ancho de banda empiezan a codominar. Ambas plataformas de 128GB compiten en el mismo club; el diferenciador pasa a ser CUDA vs. rutas ROCm y cómo se reparte tu carga entre prefill y decode.
Modelos 120B+
La capacidad se convierte en la puerta n.º 1. La cuantización y la política de contexto deciden si la máquina es usable. La configuración de 192GB apunta a esta banda más que a «chat 14B más rápido».
Nota de capacidad (F9A-PRO495 / Ryzen AI Max+ PRO 495): objetivos de producto como 120B Q4 o hasta 300B MoE describen cabida teórica según cuantización, contexto y runtime —no son una garantía de tokens/s. Sin mediciones reproducibles, trátalos como techos de capacidad, no como ranking de velocidad.
Modelos MoE grandes
Parámetros totales ≠ parámetros activos. Un MoE de 200B+ puede parecer aterrador en una diapositiva mientras activa muchos menos expertos por token. Sigues necesitando capacidad para los pesos en disco/en memoria, pero el coste de decode sigue el trabajo activo más el overhead de enrutado. La calidad del runtime importa tanto como el recuento de parámetros del titular —por eso el MoE pertenece a cualquier guía seria de inferencia de sobremesa.
Por qué los modelos de 200B+ parámetros no siempre pesan tanto como parecen
Los modelos densos mantienen la mayoría de parámetros calientes en cada token. Los MoE activan solo a algunos expertos, así que el cómputo por token puede verse más ligero que el recuento de parámetros del titular.
La activación dispersa reduce el cómputo por token, pero no elimina la necesidad de almacenar los pesos del modelo. Por eso, un MoE grande puede seguir necesitando capacidad de clase 192GB aunque el decode se sienta manejable —y por qué parámetros totales, tamaño de los pesos, parámetros activos, caché KV y tokens/s medidos deben permanecer separados al leer cualquier benchmark de LLM.
Por qué los benchmarks de LLM pueden engañar
Prefill vs decode
El prefill procesa el prompt de entrada (a menudo intensivo en cómputo, en paralelo).
El decode emite tokens uno a uno (a menudo sensible al ancho de banda/a la latencia).
Esta división también explica por qué las cifras de rendimiento de DGX Spark pueden verse irregulares entre pruebas: el prefill puede abrir una brecha grande en un setup mientras el decode se mantiene cerca. Una caja puede sentirse rápida en un chatbot corto y lenta en «analiza este repo de 20k tokens».
Tokens por segundo no es toda la historia
Los resultados se mueven con la longitud del prompt, el contexto, el tamaño de lote, la cuantización, el backend, el modelo y el runtime. Un único resultado sin etiquetar modelo, cuantización, contexto y runtime está incompleto.
Por qué dos benchmarks muestran resultados distintos
Las corridas públicas emparejadas sirven como orientación indicativa —no como un ranking completo de plataforma.

| Condición de prueba | DGX Spark | Strix |
|---|---|---|
| Modelo | GPT-OSS 120B MXFP4 | GPT-OSS 120B MXFP4 |
| Cuantización | MXFP4 (según publicado) | MXFP4 (según publicado) |
| Runtime | llama.cpp | llama.cpp |
| Prefill | ~1.723 tok/s | ~340 tok/s |
| Decode | ~38,6 tok/s | ~34,1 tok/s |
| Qué sugiere | Procesado de prompt más fuerte en esta prueba | Velocidad de generación mucho más cercana |
Fuentes: HardwareCorner, IntuitionLabs, Memeburn.
En esa comparación publicada, Spark mostró una ventaja sustancial de prefill, mientras que los resultados de decode estuvieron mucho más cerca —útil para flujos pesados en prompt, no un ganador universal para cada trabajo de LLM local.
CUDA vs ROCm: la diferencia de software
CUDA en Spark
En comparativas DGX Spark vs AMD, CUDA suele ser la decisión real: frameworks, TensorRT-LLM / vLLM, fine-tune y menos tiempo cazando forks —aunque existan cajas AMD de 128GB.
ROCm y hardware AMD
En sistemas clase Strix / Gorgon, la inferencia de IA y de LLM reales suele correr por ROCm, Vulkan, llama.cpp, Ollama, LM Studio y similares. La pila funciona; puede exigir más cuidado al operador.
Por qué el software puede cambiar el rendimiento del hardware
Mismo silicio, distinto backend → distinto prefill/decode. El rendimiento de inferencia es una pila, no una especificación de chip.
Aplicación de IA
↓
Modelo / Cuantización
↓
Runtime de inferencia
↙ ↘
CUDA ROCm/Vulkan
↘ ↙
GPU / APU
↓
Arquitectura de memoria
↓
Refrigeración / Potencia

Capacidad de hardware vs fricción de despliegue
Las especificaciones en bruto son solo la mitad de la compra. La otra mitad es lo doloroso que resulta servir un modelo de forma fiable:
- Ruta NVIDIA: herramientas nativas de CUDA, más recetas de «simplemente funciona» para pilas comunes (vLLM / TensorRT-LLM / playbooks). A menudo pagas prima por menos fricción en la puesta en marcha —no solo por una captura de tokens/s.
- Ruta AMD: muchos entornos reales de sobremesa corren con llama.cpp, Vulkan, Ollama, LM Studio y ROCm donde esté soportado. Funciona; el cuidado del operador varía más según modelo/runtime.
Así que «¿Merece Spark frente a una caja AMD de 128 GB?» suele ser: ecosistema CUDA + menos fricción + la brecha de prefill publicada en algunas pruebas emparejadas —frente a precio, comodidad Windows/x86 y un decode que puede estar cerca.
Experimentos de escenario (a partir de preguntas reales de usuarios)
En lugar de volcar tokens/s de Reddit, traduce los debates recurrentes de LocalLLM en pruebas:
Escenario 1 — «Quiero ejecutar un modelo 70B en local.» Comprueba capacidad → cuantización → ancho de banda → runtime.
Escenario 2 — «Quiero un agente de código local.» Comprueba contexto + caché KV → sensación de decode → herramientas de agentes de software (CUDA puede importar).
Escenario 3 — «Quiero 120B+.» Comprueba la capacidad primero → cuant → si el sistema con más memoria ayuda más que la ruta de prefill de NVIDIA para tus prompts.
Escenario 4 — «Quiero varios modelos residentes.» Comprueba memoria libre tras SO/runtime → concurrencia → térmicas en ejecuciones largas.
Mini PC vs estación de trabajo de IA compacta para LLM locales
Al elegir un mini PC basado en Strix para IA local, mira más allá del nombre del procesador. Capacidad de memoria, refrigeración, expansión de almacenamiento y potencia sostenida importan más para cargas de inferencia largas que la etiqueta del folleto.
| Carga de trabajo | Mini PC | Estación de trabajo de IA compacta |
|---|---|---|
| Chatbot / agentes ligeros | ✓ | ✓ |
| Asistente de código / RAG | ✓ | ✓ |
| LLM grande / multimodelo | Depende de memoria + refrigeración | Mejor adaptado |
| Inferencia de larga duración | Depende de térmicas | Mejor adaptado |
| Expansión (USB4 / OCuLink) | Limitada | Más opciones |
Ningún formato gana de forma universal —ajusta al ciclo de uso. Y para inferencia LLM de sobremesa, TOPS de NPU ≠ rendimiento LLM: dominan el cómputo GPU/APU, la memoria unificada y el runtime.
¿Dónde encaja ACEMAGIC?
¿Qué configuración ACEMAGIC encaja con cada carga?
| Si necesitas… | Qué cambia para ti | Considera |
|---|---|---|
| 128GB ya cubre pesos + KV + extras | Despliegue compacto; techo de memoria más bajo; suficiente para muchos flujos de clase 70B |
Consulta la ficha del M1A PRO+ para capacidades y configuración en uso real. |
| 128GB + chasis F9A de 2L con OCuLink | Mismo techo clase Strix, formato F9A más denso | F9A (Ryzen AI Max+ 395) |
| Más margen de memoria residente sin forzar bajadas agresivas de cuantización | Techo de 192GB (clase Gorgon / Max+ PRO 495); más holgura para pesos, KV y multiservicio | F9A-PRO495 (página de prelanzamiento) |
| Trabajo de escritorio Windows/x86 junto al modelo | Software de PC cotidiano + inferencia local en una sola caja AMD de sobremesa | Sistemas ACEMAGIC basados en AMD |
Hardware de IA local vs GPU en la nube
Cuándo tiene sentido el hardware local
Privacidad, inferencia repetida, trabajo sin conexión, agentes diarios predecibles, bucles de desarrollo que corres cada hora.
Cuándo las GPU en la nube tienen más sentido
Trabajos enormes ocasionales, entrenamiento a ráfagas, modelos que aún no caben, experimentos distribuidos.
Cómo pensar el coste total
Precisa las horas que de verdad ejecutas, no un viral de «se amortiza en N meses» sin tus registros de tokens. Lo local gana en privacidad y coste marginal; la nube gana en elasticidad.
Cómo elegir hardware de LLM local en 2026
- Empieza por la clase de tamaño de modelo — 7B / 14B / 32B / 70B / 120B+ — y añade de inmediato contexto y necesidades multiservicio.
- Comprueba la capacidad de memoria — ¿cabe el conjunto de trabajo completo?
- Comprueba el ancho de banda de memoria y de cómputo — ¿se sentirá aceptable el decode?
- Comprueba la longitud de contexto — caché KV y ruta de prefill.
- Comprueba el software — ¿hace falta CUDA o vale ROCm/llama.cpp?
- Comprueba térmicas/formato — ciclo de uso de mini PC vs. estación de trabajo.
Matriz de decisión de hardware de IA local
| Tu prioridad | Qué importa más |
|---|---|
| Ejecutar el modelo más grande | Capacidad de memoria |
| Generación de tokens más rápida | Ancho de banda de memoria + cómputo |
| Código con contexto largo | Memoria + caché KV |
| RAG | Prefill + memoria |
| Modelos MoE | Capacidad + runtime |
| Desarrollo de IA | Ecosistema de software |
| Varios modelos | Capacidad de memoria |
| Sistema pequeño y compacto | Potencia + térmicas |
| Estación de trabajo Windows | Compatibilidad x86 |
| Desarrollo CUDA | Pila de software NVIDIA |
No hay una tabla de ganador único. En pilas de clase 128GB, elige por software, comportamiento prefill/decode y diseño del sistema. Cruza el muro de capacidad y 192GB es una clase distinta de ventaja —no un número de benchmark más alto.
Resumen
Elegir entre estas tres opciones de sobremesa se reduce al encaje con tu escenario real, no a un ganador único:
- Capacidad ≠ velocidad. 192GB ayuda cuando pesos, caché KV o pilas multiservicio no caben en 128GB —no sube automáticamente tokens/s.
- Prefill ≠ decode. En la prueba emparejada publicada GPT-OSS 120B MXFP4 con llama.cpp, el prefill de Spark iba muy por delante mientras el decode se mantenía cerca —tómalo como orientativo, no como un ranking universal.
- Clase 128GB: la ruta CUDA / menos fricción de NVIDIA frente a la ruta de sobremesa x86 clase Strix de AMD (p. ej. M1A PRO+ o F9A-395), según pila de software y formato.
- Clase 192GB: cuando el conjunto de trabajo es el muro, el F9A-PRO495 (página de prelanzamiento en acemagic.es) corresponde al Max+ PRO 495 / 192GB LPDDR5X-8533 (Radeon 8065S). «Gorgon» aquí sigue siendo antiguo nombre en clave / abreviatura de comprador para ese escalón.
- Compra el cuello de botella que de verdad tienes: cabida primero, luego ancho de banda/cómputo, luego fricción CUDA vs ROCm/llama.cpp, luego térmicas y expansión.
FAQ
¿Merece la caja NVIDIA de 128GB frente a la opción AMD de 128GB para inferencia de LLM local?
Depende de qué estés comprando. En la prueba emparejada GPT-OSS 120B MXFP4 publicada arriba, el prefill de Spark iba muy por delante mientras el decode estaba cerca. La prima suele comprar ecosistema CUDA, menos fricción de despliegue y herramientas orientadas a DGX —no una afirmación universal de generación 5× más rápida. La opción AMD de 128GB sigue siendo competitiva en muchos entornos de mini PC de IA Windows/x86 pesados en decode.
¿Cuánta RAM necesito para ejecutar un LLM 70B en local?
Planifica pesos + caché KV + runtime + extras, no solo la etiqueta de parámetros. Muchos entornos de clase 70B van cómodos con 128GB de memoria unificada con cuantizaciones habituales; contexto largo, cuantizaciones más altas o pilas multiservicio suben el presupuesto. Usa la tabla de planificación de arriba —es orientación, no un límite duro.
¿Puedo ejecutar modelos 120B en 128GB de memoria unificada?
Sí, con cuantización agresiva y longitud de contexto limitada, pero pierdes margen para caché KV, modelos de embedding y rerankers. Ahí es donde el hardware de clase Gorgon de 192GB aporta valor. Cabida sigue siendo la primera puerta; velocidad usable, la segunda.
¿El F9A-PRO495 “soporta” 120B Q4 o hasta 300B MoE?
Esas cifras son objetivos de capacidad del producto (cuantización + contexto + runtime), no una promesa de tokens/s. Un MoE de 300B no equivale a un denso de 300B: caber no implica generar rápido. Exige mediciones reproducibles antes de tomarlas como rendimiento.
¿Es 192GB mejor que 128GB para LLM locales?
192GB da más margen de modelo y de caché KV, pero no aumenta automáticamente los tokens/s cuando la carga ya cabe en 128GB. Elígelo para pilas limitadas por cabida (cuantizaciones más altas, multimodelo, contexto largo, pesos MoE mayores) —no como una subida gratuita de velocidad.
¿Cuándo importa más la configuración de 192GB que cualquiera de las cajas de 128GB?
Cuando el conjunto de trabajo ya no cabe: RAG multimodelo, ficheros de pesos MoE mayores, cuantizaciones más altas o cachés KV largas. Ver también la FAQ 192GB vs 128GB de arriba.
¿Más memoria unificada significa tokens/s más rápidos?
No. Caber en los pesos no es lo mismo que generar tokens rápido —el ancho de banda, el cómputo, la cuantización y el runtime siguen marcando el ritmo.
¿Son los TOPS de NPU una buena forma de elegir hardware LLM en dispositivo?
Por lo general, no. Para inferencia LLM de sobremesa, GPU/APU + memoria + software dominan los resultados de inferencia de IA más que las diapositivas de TOPS de NPU.
¿Mini PC o estación de trabajo de sobremesa?
Chat y agentes ligeros suelen caber en un mini PC. Modelos grandes, RAG multiservicio e inferencia de larga duración se inclinan hacia una estación de trabajo —incluida una estación compacta como el F9A cuando necesitas memoria de clase 192GB.
Fuentes
- AMD Ryzen AI Max+ PRO 495 (antiguo nombre en clave Gorgon; máx. 192GB; Radeon 8065S)
- AMD Ryzen AI Max+ 395 / Strix Halo (máx. 128GB LPDDR5X-8000)
- NVIDIA DGX Spark especificaciones de producto
-
Benchmarks LLM de HardwareCorner sobre Spark; IntuitionLabs; Memeburn






