Saltar al contenido
Carro
0 elementos

DGX Spark vs Strix Halo vs Gorgon Halo: ¿Qué hardware de IA local deberías comprar?

por US CHERRY 17 Sep 2026 0 comentarios

DGX Spark vs Strix Halo vs Gorgon Halo: ¿qué plataforma encaja con tu carga de trabajo de LLM local?

Un sistema con 192GB no es automáticamente más rápido que uno con 128GB. Una especificación de 1 PFLOP no te dice a qué velocidad generará tokens un LLM. Y un benchmark sin resultados separados de prefill y decode puede dar una imagen engañosa del rendimiento real.

Esos matices importan al comparar la plataforma de NVIDIA, la opción AMD de 128GB y las configuraciones de clase 192GB más recientes para IA local / LLM locales.

DGX Spark vs Strix Halo vs Gorgon Halo

Las tres pueden cubrir cargas de trabajo que antes empujaban a torres con GPU discretas grandes: inferencia privada, agentes de código, RAG, contexto largo y pipelines multimodelo. Solo que resuelven esos problemas de formas distintas.

La forma útil de compararlas es:

  1. ¿Cabe el modelo y sus datos de trabajo en memoria?
  2. ¿Con qué rapidez procesa el sistema un prompt largo (prefill)?
  3. ¿Con qué rapidez genera tokens (decode)?
  4. ¿Depende tu software de CUDA?
  5. ¿Qué ocurre cuando la carga supera los 128GB?

La distinción más importante sigue siendo:

La capacidad de memoria determina qué puede caber. El ancho de banda de memoria, el cómputo, la cuantización y el software determinan a qué velocidad corre.

La pregunta principal que responde esta guía: cómo elegir entre el aparato NVIDIA de 128GB, la opción Strix de AMD de 128GB y los sistemas de sobremesa de clase Gorgon con 192GB para inferencia de LLM local —sobre todo la bifurcación de capacidad 128GB vs 192GB—, sin tratar una captura suelta de tokens/s como un ranking.

Comparativa rápida

Característica DGX Spark Strix Halo Gorgon Halo
Plataforma principal NVIDIA Grace Blackwell AMD Zen 5 + APU Radeon Clase AMD de sobremesa con más memoria
Memoria unificada 128GB Hasta 128GB en sistemas tope de gama Hasta 192GB (configuraciones clase Max+ PRO 495)
Ancho de banda de memoria 273 GB/s declarado 256 GB/s (LPDDR5X-8000, pico declarado por AMD) 273 GB/s pico teórico (256-bit × LPDDR5X-8533)
Software CUDA / DGX OS ROCm / Vulkan / llama.cpp / Ollama ROCm / Vulkan / llama.cpp / Ollama
Formato Aparato de IA compacto Mini PC de IA / estación de trabajo compacta Estación de trabajo de IA compacta
Mejor motivo para elegirlo Desarrollo CUDA-first + prefill sólido en algunas pruebas publicadas Inferencia local de 128GB más un PC x86 normal Cargas que de verdad superan los 128GB

Esta tabla orienta las plataformas. No significa que una columna sea universalmente más rápida: eso depende del caso de uso.

AMD lista Gorgon Halo como el antiguo nombre en clave en la página del Ryzen AI Max+ PRO 495 (hasta 192GB, Radeon 8065S). Aquí lo usamos como abreviatura de comprador para ese escalón de sobremesa de 192GB, no como una marca de arquitectura de consumo aparte.

Infografía que compara tres plataformas de IA: NVIDIA DGX Spark, AMD Strix Halo y AMD Gorgon Halo con barras de capacidad de memoria a 128GB, 128GB y 192GB, e indicadores de ancho de banda y pila de software

Planificación rápida: qué suele comprar 128GB vs 192GB

Solo orientación de planificación —no es un límite duro de modelo. La cuantización, la longitud de contexto y las pilas multiservicio mueven la cifra real.

Memoria unificada Rol práctico (solo planificación)
~64GB 7B-32B con holgura; algunos modelos mayores solo con cuantización agresiva
128GB Clase 70B con holgura; algunas cargas 120B / MoE según cuantización + contexto
192GB Cuants más altos, ficheros de pesos MoE más grandes, pilas multimodelo, más margen de caché KV

Si con 128GB ya cabe con margen, trata los 192GB como colchón de capacidad.

Diagrama de tres niveles de capacidad de memoria unificada: 64GB para modelos 7B-32B, 128GB para modelos de clase 70B y 192GB para MoE grandes y pilas multiservicio

Mapa de cuellos de botella en hardware para LLM

Carga de trabajo Primer cuello de botella Segundo cuello de botella Por qué
Chat 7B Cómputo / software Memoria El modelo es relativamente pequeño
Chat 32B Ancho de banda Cómputo El decode se vuelve más sensible a la memoria
70B Capacidad Ancho de banda El tamaño de los pesos crece con fuerza
120B+ Capacidad Ancho de banda Cabida es la primera restricción
Contexto largo Caché KV Memoria El contexto aumenta los requisitos de caché
Agente de código Contexto + KV Decode Prompts largos + generación
RAG Prefill Ancho de banda de memoria Muchos tokens de entrada
MoE Capacidad + runtime Ancho de banda Los parámetros totales y los activos difieren

Este mapa es el punto de partida al comprar estas plataformas en 2026: no una captura suelta de tokens/s.

Por qué se comparan estas tres plataformas

El salto de los PC con IA a las estaciones de trabajo locales

El marketing de «AI PC» sigue apoyándose en los TOPS de NPU. Quien compra en serio para LLM locales mira más la memoria unificada, las rutas de inferencia GPU/APU y si la caja puede alojar agentes privados, RAG y trabajo de contexto largo en el escritorio —por eso la plataforma de NVIDIA, la opción AMD de 128GB y las configuraciones de clase 192GB aparecen juntas al buscar hardware de mini PC de IA / estación de trabajo compacta.

Por qué la capacidad de memoria se volvió una especificación clave

Cuando la gente empezó a cargar pesos de clase 70B y 120B+ en local, 128GB y 192GB dejaron de sonar a lujo y empezaron a sonar a «¿cabrá siquiera?». La memoria unificada explica por qué estas tres opciones de sobremesa comparten atención: prometen una memoria unificada lo bastante grande para hardware de LLM local que antes exigía torres multi-GPU.

(Las diferencias a nivel de chip entre 128GB y 192GB están en nuestra guía Ryzen AI Max+ 395 vs PRO 495. En la ficha de AMD, el Ryzen AI Max+ PRO 495 lista el antiguo nombre en clave Gorgon Halo, Radeon 8065S (40 CU) y hasta 192GB LPDDR5X-8533 —ese es el silicio de clase 192GB que esta guía aplica a los equipos de sobremesa.)

¿Qué es AMD Strix Halo?

Plataforma y Ryzen AI Max

Strix Halo es la plataforma APU de gama alta de AMD que mete una CPU Zen 5 potente, una iGPU Radeon grande y un bus ancho de memoria unificada LPDDR5X en sistemas compactos. Quien busca suele teclear AMD Strix Halo; el Ryzen AI Max+ 395 es uno de los chips más conocidos que implementan esa plataforma en SKU de mini PC Strix Halo y estaciones de trabajo (incluido el perfil Ryzen AI Max+ 395 128GB).

Para lo básico de la plataforma y el formato, consulta esa misma guía Strix Halo 128GB. Si estás comparando un PC Strix Halo con aparatos tipo appliance NVIDIA, empieza por esa guía.

Por qué Strix interesa para IA local

La plataforma importa para IA local porque combina:

  • Una memoria unificada amplia (habitualmente hasta 128GB en configuraciones tope como Strix Halo 128GB)
  • Cómputo GPU real para inferencia LLM (no solo marketing de NPU)
  • Opciones de chasis compacto —desde diseños de mini PC AMD compactos hasta cajas de sobremesa más densas
  • Holgura suficiente para software x86 cotidiano además del modelo

No es «una RTX 4090 discreta en una caja minúscula». Es un enfoque APU-first: caber pesos grandes en un solo pool, aceptar que el decode suele estar limitado por el ancho de banda de memoria y optimizar la ruta de software (ROCm, Vulkan, llama.cpp, Ollama).

¿Qué es AMD Gorgon Halo?

Este es el hueco de información que la mayoría de posts Spark-vs-Strix aún omiten.

Capacidad: AMD de 128GB vs clase 192GB

La propia ficha de producto de AMD lista Gorgon Halo como el antiguo nombre en clave del Ryzen AI Max+ PRO 495 (Radeon 8065S, 40 CU, hasta 192GB LPDDR5X-8533). En esta guía seguimos usando «Gorgon Halo» sobre todo como abreviatura de comprador para ese escalón de sobremesa de 192GB —no como una marca de arquitectura de consumo por la que debas comprar por nombre.

Para el comprador, la distinción útil es más simple:

  • La opción AMD de clase 128GB → suele bastar para muchas pilas de LLM local que se mantienen en memoria
  • La configuración de 192GB → más margen cuando pesos, caché KV y pilas multiservicio dejan de caber

Frente a Strix, por tanto, es sobre todo una historia de capacidad (con frecuencias y márgenes térmicos que dependen de la configuración), pensada para cargas que ya chocaban con el muro de 128GB: RAG multiservicio, contexto más largo, ficheros de pesos MoE mayores, cuantizaciones más altas.

Frente al aparato NVIDIA de 128GB, la pregunta es otra: la caja de NVIDIA sigue centrada en CUDA y 128GB de memoria unificada coherente; los sistemas AMD con más memoria responden a «¿y si la memoria residente de 128GB es el verdadero muro?».

Por qué importa más capacidad de memoria para LLM locales

La capacidad aparece con pesos mayores, cachés KV más largas, pilas multiservicio o cuantización menos agresiva.

¿Más memoria es siempre mejor?

No. La capacidad fija que puedes cargar; la velocidad sigue ligada al ancho de banda, al cómputo y al software.

Visualización conceptual a pantalla partida: a la izquierda un pool de memoria brillante con bloques de pesos del modelo que caben dentro (capacidad); a la derecha una autopista de datos con tokens en streaming (ancho de banda y velocidad de decode)

¿Qué es NVIDIA DGX Spark?

Especificaciones que importan para IA

Según la ficha de producto de NVIDIA, las especificaciones del DGX Spark que importan para IA local / inferencia LLM (y para leer con cuidado las afirmaciones de rendimiento) son, a grandes rasgos:

  • Superchip NVIDIA GB10 basado en NVIDIA Blackwell
  • 128GB de memoria unificada coherente a 273 GB/s declarados
  • Rendimiento Tensor de clase FP4 en marketing (hasta ~1 PFLOP FP4 sparse —teórico)
  • Pila de software CUDA, DGX OS, playbooks / herramientas orientadas a NIM
  • Almacenamiento local rápido (las configuraciones Founders incluyen NVMe grande)
  • Red ConnectX-7 para historias de scale-out multi-caja

El PVP de la Founders Edition se sitúa actualmente en 4.699 USD (solo contexto de precio —esta guía no es un repaso de precios).

Por qué CUDA forma parte de la historia de Spark

Para muchos compradores, la plataforma de NVIDIA no es «otra caja de 128 GB». Es el acceso al ecosistema CUDA: frameworks, kernels, recetas de fine-tune y pilas de serving que ya asume NVIDIA. Esa capa de software forma parte del rendimiento del LLM medido; no es un accesorio.

Diferencias clave de hardware (detalle)

La comparativa rápida de arriba basta para la mayoría de los compradores. Esta tabla añade la capa de especificaciones más densa.

Característica Spark Strix Gorgon
Arquitectura Grace Blackwell (GB10) Familia APU Strix Clase Max+ PRO 495 / AMD de sobremesa con más memoria
CPU Arm de 20 núcleos Zen 5 x86 (implementaciones clase Strix) Zen 5 x86 (implementaciones clase PRO 495)
GPU Blackwell iGPU Radeon (p. ej. Radeon 8060S) iGPU Radeon (p. ej. Radeon 8065S)
Memoria unificada 128GB Habitualmente hasta 128 GB Hasta 192GB
Ancho de banda de memoria 273 GB/s declarado 256 GB/s (LPDDR5X-8000, pico declarado por AMD) 273 GB/s pico teórico (256-bit × LPDDR5X-8533); sostenido OEM por confirmar
Cómputo IA (marketing) ~1 PFLOP FP4 sparse TOPS de plataforma / iGPU Las etiquetas TOPS de plataforma siguen ≠ tok/s de LLM
Pila de software CUDA / DGX OS ROCm / Vulkan / llama.cpp ROCm / Vulkan / llama.cpp
Formato Aparato ultracompacto Mini PC de IA / estación de trabajo compacta SKU de estación de trabajo compacta
Ángulo principal de compra Ecosistema CUDA + fuerza de prefill publicada en algunas pruebas Plataforma AMD compacta de 128GB Más capacidad de memoria para pilas limitadas por cabida

Las especificaciones que de verdad importan para LLM

Para inferencia LLM, tres cifras no son intercambiables:

  1. Capacidad de memoria — ¿caben pesos + KV + runtime?
  2. Ancho de banda de memoria — ¿a qué velocidad puede el decode mover pesos?
  3. Cómputo + software — ¿qué tan rápido es el prefill y qué kernels existen?

TOPS / PFLOPS solos no responden a esas preguntas.

Capacidad de memoria vs ancho de banda para LLM locales

Por qué 128GB puede importar más que los FLOPS de la GPU

Si el modelo no cabe, los FLOPS son irrelevantes. Por eso las conversaciones de hardware para LLM local se fijan en Strix Halo 128GB y en los 128GB de memoria unificada de Spark —y por qué Gorgon 192GB es una historia de producto real para usuarios limitados por capacidad.

Por qué más memoria no significa automáticamente inferencia más rápida

Una vez que cabe el conjunto de trabajo, añadir RAM rara vez sube tokens/s por sí solo. El decode en APU de memoria unificada suele estar limitado por el ancho de banda. La capacidad extra reduce sobre todo el swapping, la descarga forzada y las bajadas de cuantización obligadas.

Qué cambia el ancho de banda de memoria

El ancho de banda se nota más en:

  • Decode (generación token a token)
  • Streaming de pesos en modelos densos grandes
  • Rendimiento LLM limitado por memoria cuando la GPU espera al bus

Los 273 GB/s declarados de Spark y el pico de 256 GB/s de Strix ayudan a explicar por qué, en algunas corridas públicas emparejadas, las brechas de generación parecen modestas —aunque las de prefill se vean grandes. Las configuraciones de clase 192GB del Max+ PRO 495 también aterrizan en un pico teórico de 273 GB/s a partir de 256 bits × LPDDR5X-8533 (el sostenido OEM puede diferir).

¿Qué ocurre al añadir más contexto?

Más contexto hace crecer la caché KV. Los agentes de código y el RAG que reenvían prompts enormes castigan el prefill y la huella de caché. Ese mapa de cuellos de botella es distinto al de turnos cortos de chatbot.

Por qué el tamaño del modelo ya no basta para elegir hardware de IA local

«¿Cuántos GB para un modelo 70B?» es la pregunta incorrecta si se queda sola.

Un presupuesto práctico de memoria para LLM locales:

  1. Pesos del modelo (depende de la cuantización)
  2. Caché KV (depende de la longitud de contexto)
  3. Overhead de runtime (framework, grafos CUDA/ROCm, SO)
  4. Contexto/herramientas (espacio temporal del agente, buffers de recuperación)
  5. Varios modelos/servicios (embedder, reranker, segundo LLM)

Así, la misma etiqueta «70B» puede ir cómoda en 128GB en una pila y ser dolorosa en otra. Planificar capacidad es una suma, no un recuento de parámetros.

(Consulta la tabla temprana de planificación rápida para los rangos de 64 / 128 / 192GB.)

Inferencia LLM por clase de modelo

LLM pequeños y medianos

Para chat 7B-32B, el cómputo, la madurez del software, el coste y la potencia suelen importar más que perseguir 192GB. Un mini PC de IA sobre la opción AMD de 128GB puede ser la compra racional si tus modelos ya caben.

Modelos de clase 70B

Aquí la capacidad de memoria, la cuantización y el ancho de banda empiezan a codominar. Ambas plataformas de 128GB compiten en el mismo club; el diferenciador pasa a ser CUDA vs. rutas ROCm y cómo se reparte tu carga entre prefill y decode.

Modelos 120B+

La capacidad se convierte en la puerta n.º 1. La cuantización y la política de contexto deciden si la máquina es usable. La configuración de 192GB apunta a esta banda más que a «chat 14B más rápido».

Nota de capacidad (F9A-PRO495 / Ryzen AI Max+ PRO 495): objetivos de producto como 120B Q4 o hasta 300B MoE describen cabida teórica según cuantización, contexto y runtime —no son una garantía de tokens/s. Sin mediciones reproducibles, trátalos como techos de capacidad, no como ranking de velocidad.

Modelos MoE grandes

Parámetros totales ≠ parámetros activos. Un MoE de 200B+ puede parecer aterrador en una diapositiva mientras activa muchos menos expertos por token. Sigues necesitando capacidad para los pesos en disco/en memoria, pero el coste de decode sigue el trabajo activo más el overhead de enrutado. La calidad del runtime importa tanto como el recuento de parámetros del titular —por eso el MoE pertenece a cualquier guía seria de inferencia de sobremesa.

Por qué los modelos de 200B+ parámetros no siempre pesan tanto como parecen

Los modelos densos mantienen la mayoría de parámetros calientes en cada token. Los MoE activan solo a algunos expertos, así que el cómputo por token puede verse más ligero que el recuento de parámetros del titular.

La activación dispersa reduce el cómputo por token, pero no elimina la necesidad de almacenar los pesos del modelo. Por eso, un MoE grande puede seguir necesitando capacidad de clase 192GB aunque el decode se sienta manejable —y por qué parámetros totales, tamaño de los pesos, parámetros activos, caché KV y tokens/s medidos deben permanecer separados al leer cualquier benchmark de LLM.

Por qué los benchmarks de LLM pueden engañar

Prefill vs decode

El prefill procesa el prompt de entrada (a menudo intensivo en cómputo, en paralelo).

El decode emite tokens uno a uno (a menudo sensible al ancho de banda/a la latencia).

Esta división también explica por qué las cifras de rendimiento de DGX Spark pueden verse irregulares entre pruebas: el prefill puede abrir una brecha grande en un setup mientras el decode se mantiene cerca. Una caja puede sentirse rápida en un chatbot corto y lenta en «analiza este repo de 20k tokens».

Tokens por segundo no es toda la historia

Los resultados se mueven con la longitud del prompt, el contexto, el tamaño de lote, la cuantización, el backend, el modelo y el runtime. Un único resultado sin etiquetar modelo, cuantización, contexto y runtime está incompleto.

Por qué dos benchmarks muestran resultados distintos

Las corridas públicas emparejadas sirven como orientación indicativa —no como un ranking completo de plataforma.

Gráfico de barras que compara NVIDIA DGX Spark vs AMD Strix Halo en GPT-OSS 120B MXFP4 con llama.cpp: prefill Spark ~1723 tok/s vs Strix 340 tok/s; decode Spark 38,6 tok/s vs Strix 34,1 tok/s

Condición de prueba DGX Spark Strix
Modelo GPT-OSS 120B MXFP4 GPT-OSS 120B MXFP4
Cuantización MXFP4 (según publicado) MXFP4 (según publicado)
Runtime llama.cpp llama.cpp
Prefill ~1.723 tok/s ~340 tok/s
Decode ~38,6 tok/s ~34,1 tok/s
Qué sugiere Procesado de prompt más fuerte en esta prueba Velocidad de generación mucho más cercana

Fuentes: HardwareCorner, IntuitionLabs, Memeburn.

En esa comparación publicada, Spark mostró una ventaja sustancial de prefill, mientras que los resultados de decode estuvieron mucho más cerca —útil para flujos pesados en prompt, no un ganador universal para cada trabajo de LLM local.

CUDA vs ROCm: la diferencia de software

CUDA en Spark

En comparativas DGX Spark vs AMD, CUDA suele ser la decisión real: frameworks, TensorRT-LLM / vLLM, fine-tune y menos tiempo cazando forks —aunque existan cajas AMD de 128GB.

ROCm y hardware AMD

En sistemas clase Strix / Gorgon, la inferencia de IA y de LLM reales suele correr por ROCm, Vulkan, llama.cpp, Ollama, LM Studio y similares. La pila funciona; puede exigir más cuidado al operador.

Por qué el software puede cambiar el rendimiento del hardware

Mismo silicio, distinto backend → distinto prefill/decode. El rendimiento de inferencia es una pila, no una especificación de chip.

         Aplicación de IA
               ↓
     Modelo / Cuantización
               ↓
      Runtime de inferencia
     ↙                  ↘
  CUDA                  ROCm/Vulkan
     ↘                  ↙
        GPU / APU
             ↓
     Arquitectura de memoria
             ↓
      Refrigeración / Potencia

Diagrama piramidal en capas de la pila de software de inferencia IA de arriba abajo: Aplicación de IA, Modelo/Cuantización, Runtime de inferencia, luego se divide en ruta CUDA en verde hacia GPU y ruta ROCm/Vulkan en rojo hacia APU, convergiendo en Arquitectura de memoria y Refrigeración/Potencia

Capacidad de hardware vs fricción de despliegue

Las especificaciones en bruto son solo la mitad de la compra. La otra mitad es lo doloroso que resulta servir un modelo de forma fiable:

  • Ruta NVIDIA: herramientas nativas de CUDA, más recetas de «simplemente funciona» para pilas comunes (vLLM / TensorRT-LLM / playbooks). A menudo pagas prima por menos fricción en la puesta en marcha —no solo por una captura de tokens/s.
  • Ruta AMD: muchos entornos reales de sobremesa corren con llama.cpp, Vulkan, Ollama, LM Studio y ROCm donde esté soportado. Funciona; el cuidado del operador varía más según modelo/runtime.

Así que «¿Merece Spark frente a una caja AMD de 128 GB?» suele ser: ecosistema CUDA + menos fricción + la brecha de prefill publicada en algunas pruebas emparejadas —frente a precio, comodidad Windows/x86 y un decode que puede estar cerca.

Experimentos de escenario (a partir de preguntas reales de usuarios)

En lugar de volcar tokens/s de Reddit, traduce los debates recurrentes de LocalLLM en pruebas:

Ejecuta tus propios agentes de IA para creación de contenido, gestión del conocimiento y automatización con capacidades de IA de nivel empresarial.

Escenario 1 — «Quiero ejecutar un modelo 70B en local.» Comprueba capacidad → cuantización → ancho de banda → runtime.

Escenario 2 — «Quiero un agente de código local.» Comprueba contexto + caché KV → sensación de decode → herramientas de agentes de software (CUDA puede importar).

Escenario 3 — «Quiero 120B+.» Comprueba la capacidad primero → cuant → si el sistema con más memoria ayuda más que la ruta de prefill de NVIDIA para tus prompts.

Escenario 4 — «Quiero varios modelos residentes.» Comprueba memoria libre tras SO/runtime → concurrencia → térmicas en ejecuciones largas.

Mini PC vs estación de trabajo de IA compacta para LLM locales

Al elegir un mini PC basado en Strix para IA local, mira más allá del nombre del procesador. Capacidad de memoria, refrigeración, expansión de almacenamiento y potencia sostenida importan más para cargas de inferencia largas que la etiqueta del folleto.

Carga de trabajo Mini PC Estación de trabajo de IA compacta
Chatbot / agentes ligeros
Asistente de código / RAG
LLM grande / multimodelo Depende de memoria + refrigeración Mejor adaptado
Inferencia de larga duración Depende de térmicas Mejor adaptado
Expansión (USB4 / OCuLink) Limitada Más opciones

Ningún formato gana de forma universal —ajusta al ciclo de uso. Y para inferencia LLM de sobremesa, TOPS de NPU ≠ rendimiento LLM: dominan el cómputo GPU/APU, la memoria unificada y el runtime.

¿Dónde encaja ACEMAGIC?

¿Qué configuración ACEMAGIC encaja con cada carga?

Si necesitas… Qué cambia para ti Considera
128GB ya cubre pesos + KV + extras Despliegue compacto; techo de memoria más bajo; suficiente para muchos flujos de clase 70B

M1A PRO+

Consulta la ficha del M1A PRO+ para capacidades y configuración en uso real.

128GB + chasis F9A de 2L con OCuLink Mismo techo clase Strix, formato F9A más denso F9A (Ryzen AI Max+ 395)
Más margen de memoria residente sin forzar bajadas agresivas de cuantización Techo de 192GB (clase Gorgon / Max+ PRO 495); más holgura para pesos, KV y multiservicio F9A-PRO495 (página de prelanzamiento)
Trabajo de escritorio Windows/x86 junto al modelo Software de PC cotidiano + inferencia local en una sola caja AMD de sobremesa Sistemas ACEMAGIC basados en AMD

Rendimiento de sobremesa en una mini estación de trabajo

Hardware de IA local vs GPU en la nube

Cuándo tiene sentido el hardware local

Privacidad, inferencia repetida, trabajo sin conexión, agentes diarios predecibles, bucles de desarrollo que corres cada hora.

Cuándo las GPU en la nube tienen más sentido

Trabajos enormes ocasionales, entrenamiento a ráfagas, modelos que aún no caben, experimentos distribuidos.

Cómo pensar el coste total

Precisa las horas que de verdad ejecutas, no un viral de «se amortiza en N meses» sin tus registros de tokens. Lo local gana en privacidad y coste marginal; la nube gana en elasticidad.

Cómo elegir hardware de LLM local en 2026

  1. Empieza por la clase de tamaño de modelo — 7B / 14B / 32B / 70B / 120B+ — y añade de inmediato contexto y necesidades multiservicio.
  2. Comprueba la capacidad de memoria — ¿cabe el conjunto de trabajo completo?
  3. Comprueba el ancho de banda de memoria y de cómputo — ¿se sentirá aceptable el decode?
  4. Comprueba la longitud de contexto — caché KV y ruta de prefill.
  5. Comprueba el software — ¿hace falta CUDA o vale ROCm/llama.cpp?
  6. Comprueba térmicas/formato — ciclo de uso de mini PC vs. estación de trabajo.

Matriz de decisión de hardware de IA local

Tu prioridad Qué importa más
Ejecutar el modelo más grande Capacidad de memoria
Generación de tokens más rápida Ancho de banda de memoria + cómputo
Código con contexto largo Memoria + caché KV
RAG Prefill + memoria
Modelos MoE Capacidad + runtime
Desarrollo de IA Ecosistema de software
Varios modelos Capacidad de memoria
Sistema pequeño y compacto Potencia + térmicas
Estación de trabajo Windows Compatibilidad x86
Desarrollo CUDA Pila de software NVIDIA

No hay una tabla de ganador único. En pilas de clase 128GB, elige por software, comportamiento prefill/decode y diseño del sistema. Cruza el muro de capacidad y 192GB es una clase distinta de ventaja —no un número de benchmark más alto.

Resumen

Elegir entre estas tres opciones de sobremesa se reduce al encaje con tu escenario real, no a un ganador único:

  1. Capacidad ≠ velocidad. 192GB ayuda cuando pesos, caché KV o pilas multiservicio no caben en 128GB —no sube automáticamente tokens/s.
  2. Prefill ≠ decode. En la prueba emparejada publicada GPT-OSS 120B MXFP4 con llama.cpp, el prefill de Spark iba muy por delante mientras el decode se mantenía cerca —tómalo como orientativo, no como un ranking universal.
  3. Clase 128GB: la ruta CUDA / menos fricción de NVIDIA frente a la ruta de sobremesa x86 clase Strix de AMD (p. ej. M1A PRO+ o F9A-395), según pila de software y formato.
  4. Clase 192GB: cuando el conjunto de trabajo es el muro, el F9A-PRO495 (página de prelanzamiento en acemagic.es) corresponde al Max+ PRO 495 / 192GB LPDDR5X-8533 (Radeon 8065S). «Gorgon» aquí sigue siendo antiguo nombre en clave / abreviatura de comprador para ese escalón.
  5. Compra el cuello de botella que de verdad tienes: cabida primero, luego ancho de banda/cómputo, luego fricción CUDA vs ROCm/llama.cpp, luego térmicas y expansión.

FAQ

¿Merece la caja NVIDIA de 128GB frente a la opción AMD de 128GB para inferencia de LLM local?

Depende de qué estés comprando. En la prueba emparejada GPT-OSS 120B MXFP4 publicada arriba, el prefill de Spark iba muy por delante mientras el decode estaba cerca. La prima suele comprar ecosistema CUDA, menos fricción de despliegue y herramientas orientadas a DGX —no una afirmación universal de generación 5× más rápida. La opción AMD de 128GB sigue siendo competitiva en muchos entornos de mini PC de IA Windows/x86 pesados en decode.

¿Cuánta RAM necesito para ejecutar un LLM 70B en local?

Planifica pesos + caché KV + runtime + extras, no solo la etiqueta de parámetros. Muchos entornos de clase 70B van cómodos con 128GB de memoria unificada con cuantizaciones habituales; contexto largo, cuantizaciones más altas o pilas multiservicio suben el presupuesto. Usa la tabla de planificación de arriba —es orientación, no un límite duro.

¿Puedo ejecutar modelos 120B en 128GB de memoria unificada?

Sí, con cuantización agresiva y longitud de contexto limitada, pero pierdes margen para caché KV, modelos de embedding y rerankers. Ahí es donde el hardware de clase Gorgon de 192GB aporta valor. Cabida sigue siendo la primera puerta; velocidad usable, la segunda.

¿El F9A-PRO495 “soporta” 120B Q4 o hasta 300B MoE?

Esas cifras son objetivos de capacidad del producto (cuantización + contexto + runtime), no una promesa de tokens/s. Un MoE de 300B no equivale a un denso de 300B: caber no implica generar rápido. Exige mediciones reproducibles antes de tomarlas como rendimiento.

¿Es 192GB mejor que 128GB para LLM locales?

192GB da más margen de modelo y de caché KV, pero no aumenta automáticamente los tokens/s cuando la carga ya cabe en 128GB. Elígelo para pilas limitadas por cabida (cuantizaciones más altas, multimodelo, contexto largo, pesos MoE mayores) —no como una subida gratuita de velocidad.

¿Cuándo importa más la configuración de 192GB que cualquiera de las cajas de 128GB?

Cuando el conjunto de trabajo ya no cabe: RAG multimodelo, ficheros de pesos MoE mayores, cuantizaciones más altas o cachés KV largas. Ver también la FAQ 192GB vs 128GB de arriba.

¿Más memoria unificada significa tokens/s más rápidos?

No. Caber en los pesos no es lo mismo que generar tokens rápido —el ancho de banda, el cómputo, la cuantización y el runtime siguen marcando el ritmo.

¿Son los TOPS de NPU una buena forma de elegir hardware LLM en dispositivo?

Por lo general, no. Para inferencia LLM de sobremesa, GPU/APU + memoria + software dominan los resultados de inferencia de IA más que las diapositivas de TOPS de NPU.

¿Mini PC o estación de trabajo de sobremesa?

Chat y agentes ligeros suelen caber en un mini PC. Modelos grandes, RAG multiservicio e inferencia de larga duración se inclinan hacia una estación de trabajo —incluida una estación compacta como el F9A cuando necesitas memoria de clase 192GB.

Fuentes

Publicación anterior
Siguiente publicación

Deja un comentario

Tenga en cuenta que los comentarios deben aprobarse antes de publicarse.

Compra el look

Elige opciones

ACEMAGIC ES
¡Los nuevos usuarios que se registren recibirán un descuento del 3 %! ¡Venga!

Visto recientemente

Social

Opción de edición
Have Questions?
Back In Stock Notification

Elige opciones

this is just a warning
Acceso
Carro de la compra
0 elementos