Lenovo ha sido líder durante mucho tiempo en el suministro de soluciones para el mercado de la computación de alto rendimiento (HPC). Sus productos principales son bien conocidos tanto por los usuarios finales como por los administradores de centros de datos, pero su destreza en HPC es quizás su secreto mejor guardado. De hecho, ese secreto reside en ser el mayor proveedor mundial de supercomputadoras (el 32%, según datos de Top 500 ).
Estos importantes logros en el sector de la computación de alto rendimiento (HPC) se deben fundamentalmente al profundo conocimiento que Lenovo tiene de este ámbito y a su disposición a asumir riesgos para satisfacer las necesidades de sus clientes. ¿Cómo se traduce exactamente esta asunción de riesgos? Pues bien, hace aproximadamente una década, Lenovo entregó una supercomputadora con refrigeración líquida al Centro de Supercomputación Leibniz en Múnich, Alemania. Este acontecimiento contribuyó a transformar la economía de la supercomputación, especialmente en lugares como Europa, donde el espacio en rack, la refrigeración y la energía son muy costosos.
Lenovo Think System SR670 V2
Aunque la supercomputación ha evolucionado mucho desde entonces, Lenovo sigue innovando. En el verano de 2018, Lenovo lanzó oficialmente Neptune , mostrando su visión de centros de datos más eficientes gracias a la refrigeración líquida. Con el lanzamiento del ThinkSystem SD650, Lenovo demostró a sus clientes de HPC la facilidad de implementar refrigeración líquida en componentes de una bandeja de 1U compatible con dos nodos DWX (Neptune Direct Water Cooling) por bandeja. El gabinete NeXtScale n1200 (6U) admite hasta seis bandejas. Dos años después, Lenovo lanzó el SD650-N V2, con refrigeración líquida, CPU Ice Lake, GPU con zócalo, DRAM, almacenamiento y módulos de E/S. La implementación del intercambiador de calor líquido-aire (L2A) en el ThinkSystem SR670 V2 es un ejemplo de la ingeniería de vanguardia de Lenovo.
Lenovo ThinkSystem SD650 V2 con tecnología de refrigeración líquida Neptune™.
¿Quién necesita sistemas HPC de todos modos?
¿Quién necesita toda esta potencia de todos modos con las mejoras de rendimiento en la potencia de procesamiento, las innovaciones de almacenamiento y la memoria?
Las empresas de todos los tamaños buscan formas más eficientes de recopilar y analizar datos para extraer inteligencia de varios recursos diferentes en la red. Especialmente las empresas se centraron en programas intensivos en computación, como biología molecular, finanzas, seguimiento del cambio climático global, análisis genético rápido e imágenes sísmicas. HPC también está atrayendo la atención de un campo más amplio de organizaciones, como aquellas empresas que buscan una ventaja en el mercado y están dispuestas a invertir en tecnología que impactará en la productividad y el crecimiento. HPC e IA, la base de las aplicaciones mencionadas anteriormente, se están alineando cada vez más, lo que brinda nuevos caminos para que las organizaciones aprovechen esos datos.
La necesidad de acceso inmediato a datos agregados continúa impulsando la demanda de estos sistemas HPC. Mantenerse un paso por delante de la competencia es imprescindible para el éxito y la longevidad de una organización. HPC es fundamental para resolver problemas complejos para los negocios, la ciencia y la ingeniería, y se ha convertido en la base subyacente de las innovaciones en ciencia, investigación, comercio minorista, AV y más, e impulsa avances en tecnologías que afectan a la sociedad.
El crecimiento explosivo de los datos recopilados de tecnologías como AI & M/L, IoT, investigación y servicios de transmisión en vivo requiere procesamiento en tiempo real, que es más de lo que puede manejar un servidor típico.
Otra fuerza impulsora detrás del crecimiento de la demanda de HPC es que los sistemas se pueden implementar en el borde, en la nube o en las instalaciones. La clave es procesar los datos donde se crean y no tener que transferirlos a otra ubicación remota para su procesamiento.
Lenovo ThinkSystem SR670 v2 con intercambiador de calor L2A
Una consideración crítica al seleccionar una plataforma HPC es la capacidad de escalar horizontalmente. Cuando se trata de recursos computacionales masivos, más es mejor. Las capacidades de escalamiento horizontal para estos sistemas son cruciales, y la capacidad de crear grandes clústeres de HPC puede significar el éxito o el fracaso según la capacidad de escalamiento. El uso de interconexiones de alta velocidad y baja latencia y tecnología de almacenamiento más nueva como NVMe acelerará el resultado computacional. Los clústeres se pueden construir en un centro de datos, en la nube o en un modelo híbrido, lo que brinda una implementación flexible y escalable. El Lenovo ThinkSystem SR670 V2 es uno de esos sistemas.
Un servidor rico en GPU que cumple con los requisitos de HPC
Lenovo ThinkSystem SR670 V2 es un servidor en rack de 3U rico en GPU que admite ocho GPU de doble ancho, incluidas las GPU NVIDIA A100 y A40 Tensor Core, y un modelo con NVIDIA HGX A100 4-GPU ofrecido con NVLink y Lenovo Neptune híbrido líquido- enfriamiento al aire. El servidor se basa en la nueva familia de procesadores Intel Xeon Scalable de tercera generación (anteriormente "Ice Lake") y la última serie Intel Optane Persistent Memory 200.
El SR670 V2 ofrece un rendimiento óptimo para la inteligencia artificial (IA), la computación de alto rendimiento (HPC) y las cargas de trabajo gráficas en varias industrias. Las industrias minorista, manufacturera, de servicios financieros y de atención médica pueden aprovechar la potencia de procesamiento de las GPU en el SR670 V2 para extraer información más significativa e impulsar la innovación utilizando el aprendizaje automático (ML) y el aprendizaje profundo (DL).
Los métodos tradicionales de refrigeración por aire están alcanzando límites críticos. Los aumentos en la potencia de los componentes, especialmente para CPU y GPU, han dado como resultado mayores costos de energía e infraestructura, sistemas ruidosos y una alta huella de carbono. El modelo SR670 V2 emplea la tecnología de refrigeración híbrida líquido-aire (L2A) Lenovo Neptune que combate estos desafíos y disipa el calor rápidamente. El calor de las GPU NVIDIA HGX A100 se elimina a través de un exclusivo intercambiador de calor de líquido a aire de circuito cerrado que brinda los beneficios de la refrigeración líquida, como una mayor densidad, un menor consumo de energía, un funcionamiento silencioso y un mayor rendimiento sin agregar tuberías.
Las industrias están aprovechando la tecnología GPU
El SR670 V2 se basa en dos procesadores escalables Intel Xeon de tercera generación diseñados para admitir las GPU más recientes en la cartera de centros de datos NVIDIA Ampere. El SR3 V670 ofrece un rendimiento optimizado para la carga de trabajo, ya sea utilizando visualización, renderizado o HPC e IA computacionalmente intensivos.
Las industrias minorista, manufacturera, de servicios financieros y de atención médica están aprovechando las GPU para extraer información más significativa e impulsar la innovación utilizando el aprendizaje automático (ML) y el aprendizaje profundo (DL). Aquí hay algunas formas en que la computación acelerada aprovecha las GPU en diferentes organizaciones:
- Visualización remota para equipos de trabajo desde casa
- Representación con trazado de rayos para gráficos fotorrealistas
- Potente codificación y decodificación de video
- Ensayos in-silico e inmunología en Ciencias de la Vida
- Procesamiento de lenguaje natural (NLP) para call centers
- Inspección óptica automática (AOI) para control de calidad
- Visión artificial para la experiencia del cliente minorista
A medida que más cargas de trabajo utilizan las capacidades de los aceleradores, aumenta la demanda de GPU. El ThinkSystem SR670 V2 ofrece una solución de nivel empresarial optimizada para implementar cargas de trabajo aceleradas de HPC e IA en producción, maximizando el rendimiento del sistema.
Opciones de configuración flexibles
El diseño modular ofrece la máxima flexibilidad en el SR670 V2. Las opciones de configuración incluyen:
- Hasta ocho GPU de doble ancho con NVLink Bridge
- NVIDIA HGX™ A100 4-GPU con NVLink y refrigeración líquida híbrida Lenovo Neptune™
- Elección de red de alta velocidad delantera o trasera
- Elección de almacenamiento local de alta velocidad de 2.5″, 3.5″ y NVMe
El rendimiento del ThinkSystem SR670 V2 está optimizado para su carga de trabajo, visualización, renderizado o HPC e IA computacionalmente intensivos.
La GPU NVIDIA A100 Tensor Core ofrece una aceleración sin precedentes, en todas las escalas, para potenciar los centros de datos elásticos de mayor rendimiento del mundo para aplicaciones de IA, análisis de datos y HPC. El A100 puede escalarse de manera eficiente o particionarse en siete instancias de GPU aisladas. GPU de instancias múltiples (MIG) proporciona una plataforma unificada que permite que los centros de datos elásticos se ajusten dinámicamente a las cambiantes demandas de carga de trabajo. Un rack de 13 ThinkSystem SR670 V2 puede generar hasta dos PFLOPS de potencia informática.
Basado en las últimas CPU de la familia Intel® Xeon® Scalable y diseñado para admitir GPU de gama alta, incluidas NVIDIA Tesla V100 y T4, ThinkSystem SR670 V2 ofrece un rendimiento acelerado optimizado para cargas de trabajo de IA y HPC.
Soluciones que escalan
Ya sea que comience con IA o pase a producción, las soluciones deben adaptarse a las necesidades de la organización. El ThinkSystem SR670 V2 se puede utilizar en un entorno de clúster utilizando una estructura de alta velocidad para escalar a medida que aumentan las demandas de su carga de trabajo.
Habilitado con Lenovo Intelligent Computing Orchestration (LiCO), agrega soporte para múltiples usuarios y escalará dentro de un solo entorno de clúster. LiCO es una plataforma poderosa que administra recursos de clúster para aplicaciones de HPC e IA.
LiCO proporciona flujos de trabajo de IA y HPC y admite múltiples marcos de IA, incluidos TensorFlow, Caffe, Neon y MXNet, aprovechando un solo clúster para diversos requisitos de carga de trabajo.
La progresión de la innovación en toda la cartera de HPC ha avanzado con la misma rapidez. Para las organizaciones que aún no están preparadas para dar el paso a la refrigeración líquida total, el ThinkSystem SR670 V2 ofrece una flexibilidad impresionante.
Lenovo ThinkSystem SR670 V2 Configurabilidad y especificaciones
La configurabilidad es el núcleo del atractivo del ThinkSystem SR670 V2. Su flexibilidad se centra en la computación densa en GPU, y la mayor parte de su volumen físico está dedicado a las GPU modulares, ya sea de ancho simple o doble o NVIDIA SXM. Las tres configuraciones básicas son las siguientes.
| Configuración 1 | Configuración 2 | Configuración 3 | |
| # de GPU | 4x SXM | 4x de doble ancho u 8x de ancho simple | 8x doble ancho |
| Soporte de Drive | 8x 2.5 pulgadas | 8x 2.5 pulgadas o 4x 3.5 pulgadas | 6x E1.S |
Las configuraciones ilustradas:
La siguiente tabla muestra las especificaciones completas del SR670 V2.
| Componentes | Especificación |
| tipos de máquinas | 7Z22 – 1 año de garantía 7Z23 – 3 año de garantía |
| Factor de forma | Rack 3U |
| Procesador | Dos procesadores escalables Intel Xeon de tercera generación (anteriormente con el nombre en código "Ice Lake"). Admite procesadores de hasta 40 núcleos, velocidades de núcleo de hasta 3.6 GHz y índices TDP de hasta 270 W. |
| chipset | Conjunto de chips Intel C621A "Lewisburg", parte de la plataforma con nombre en código "Whitley". |
| Salud Cerebral | 32 ranuras DIMM con dos procesadores (16 ranuras DIMM por procesador). Cada procesador tiene 8 canales de memoria, con 2 DIMM por canal (DPC). Se admiten los RDIMM TruDDR4 y 3DS RDIMM de Lenovo. Las ranuras DIMM se comparten entre la memoria del sistema estándar y la memoria persistente. Los DIMM funcionan hasta a 3200 MHz a 2 DPC. |
| Memoria persistente | Admite hasta 16 módulos Intel Optane Persistent Memory 200 Series (8 por procesador) instalados en las ranuras DIMM. La memoria persistente (Pmem) se instala en combinación con los DIMM de memoria del sistema. |
| Máximo de memoria | Con RDIMM: hasta 4 TB con 32 RDIMM 128DS de 3 GB Con memoria persistente: hasta 4 TB con 16 módulos RDIMM 128DS de 3 GB y 16 módulos Pmem de 128 GB (1.5 TB por procesador) |
| Protección de la memoria | ECC, SDDC (para módulos DIMM de memoria basados en x4), ADDDC (para módulos DIMM de memoria basados en x4, requiere procesadores Platinum o Gold) y duplicación de memoria. |
| Bahías de unidad de disco | Unidades de 2.5 pulgadas, 3.5 pulgadas o EDSFF, según la configuración:
El servidor también admite un adaptador M.2 interno que admite hasta dos unidades M.2. |
| Almacenamiento interno máximo |
|
| Controlador de almacenamiento |
|
| Bahías de unidad óptica | Sin unidad óptica interna. |
| Bahías de unidad de cinta | Sin unidad de copia de seguridad interna. |
| Interfaces de red | Ranura OCP 3.0 SFF con interfaz de host PCIe 4.0 x8 o x16 flexible, disponible según las configuraciones del servidor:
La ranura OCP admite una variedad de adaptadores de 2 y 4 puertos con conectividad de red de 1 GbE, 10 GbE y 25 GbE. Un puerto se puede compartir opcionalmente con el procesador de gestión XClarity Controller (XCC) para compatibilidad con Wake-on-LAN y NC-SI. |
| Ranuras de expansión PCI | Hasta 4 ranuras PCIe 4.0, según la GPU y la configuración de bahía de unidad seleccionada. La selección de ranuras es de:
|
| Soporte de GPU | Admite hasta 8 GPU PCIe de doble ancho o 4 GPU SXM, según la configuración:
Nota: Las configuraciones con GPU de ancho único, como NVIDIA A10, pueden ser posibles a través de una solicitud de oferta especial. |
| Puertos | Frente:
Trasera:
Interna:
|
| Enfriamiento | 5 ventiladores de intercambio simple de doble rotor de 80 mm, según la configuración. Los ventiladores tienen un rotor redundante N+1 y toleran una falla de un solo rotor. Un ventilador está integrado en cada fuente de alimentación. |
| Fuente de alimentación | Hasta cuatro fuentes de alimentación de CA redundantes intercambiables en caliente con certificación 80 PLUS Platinum. Opciones de CA de 1800 W o 2400 W, compatible con 220 V CA. Solo en China, las fuentes de alimentación también admiten 240 V CC.
|
| Vídeo | Gráficos G200 con 16 MB de memoria con acelerador de hardware 2D, integrado en el controlador XClarity. La resolución máxima es 1920×1200 32bpp a 60Hz. |
| Piezas intercambiables en caliente | Accionamientos y fuentes de alimentación. |
| Gestión de sistemas | Panel de operador con LED de estado. En los modelos de GPU SXM y 4-DW, auricular de diagnóstico externo con pantalla LCD (no disponible en los modelos de GPU 8-DW). Administración integrada de XClarity Controller (XCC), entrega de infraestructura centralizada de XClarity Administrator, complementos de XClarity Integrator y administración centralizada de energía del servidor XClarity Energy Manager. XClarity Controller Advanced y Enterprise opcionales para habilitar las funciones de control remoto. |
| Características de seguridad | Interruptor de intrusión en el chasis, contraseña de encendido, contraseña de administrador, módulo de plataforma segura (TPM), compatible con TPM 2.0. Solo en China, Nationz TPM 2.0 opcional. |
| Sistemas operativos compatibles | Servidor Microsoft Windows, Red Hat Enterprise Linux, SUSE Linux Enterprise Server, VMware ESXi. |
| Garantía limitada | Unidad reemplazable por el cliente de tres años o un año (según el modelo) y garantía limitada en el sitio con 9 × 5 al siguiente día hábil (NBD). |
| Servicio y soporte | Las actualizaciones de servicio opcionales están disponibles a través de los servicios de Lenovo: tiempo de respuesta de 4 o 2 horas, tiempo de reparación de 6 horas, extensión de garantía de 1 o 2 años, soporte de software para hardware de Lenovo y algunas aplicaciones de terceros. |
| Dimensiones | Ancho: 448 mm (17.6 pulg.), Alto: 131 mm (5.2 pulg.), Profundidad: 892 mm (35.1 pulg.). |
| Peso | Peso aproximado, en función de la configuración seleccionada:
|
Las GPU ofrecen opciones significativas de rendimiento de configuración
La compatibilidad con GPU es la variable más importante entre configuraciones. Las GPU de ancho simple usan carriles PCIe x8 y escalan a NVIDIA A10, mientras que las GPU de doble ancho usan PCIe x16 y escalan a NVIDIA A100. La configuración insignia de SXM utiliza NVIDIA HGX A100, que utiliza un puente NVIDIA NVLink (comunicación directa de GPU a GPU) para conectar sus cuatro GPU integradas. Las configuraciones de GPU de doble ancho son compatibles con NVLink, y el SR670 V2 también es compatible con AMD Instinct MI210 de doble ancho.
La plataforma HGX A100 es la variante "Redstone" sin NVSwitch, con cuatro GPU SXM A100 en una sola placa. Están disponibles las variantes de 40 GB, 400 vatios y 80 GB, 500 vatios. En particular, el SR670 V2 emplea la refrigeración híbrida líquido-aire (L2A) Neptune de Lenovo con esta plataforma para una refrigeración más silenciosa y eficiente y un menor consumo de energía. Se monta una placa fría en cada GPU, a través de la cual cuatro bombas redundantes de baja presión hacen circular el líquido. Un solo radiador grande disipa el calor. Otras configuraciones de GPU son solo refrigeradas por aire.
Las bombas de refrigerante individuales sobre cada GPU son visibles en la placa fría como parte de la sección de la marca Neptune. Todo esto fluye de regreso a través del radiador único para mantener las temperaturas bajo control incluso bajo cargas máximas.
Si bien la refrigeración líquida tiene beneficios obvios para mantener las temperaturas más bajas, muchos no se dan cuenta del impacto en el rendimiento que puede tener con la velocidad del reloj de la GPU. Cuando las GPU están sometidas a una gran carga con refrigeración por aire, pueden alcanzar puntos máximos de diseño térmico en los que tienen que acelerar el rendimiento y reducir la velocidad del reloj para mantener las temperaturas bajo control. La refrigeración líquida no tiene este problema, lo que permite que las GPU funcionen con más fuerza y rapidez mientras mantienen un perfil térmico constante en el transcurso de la carga de trabajo.
El siguiente gráfico muestra la diferencia entre una GPU refrigerada por aire y una GPU refrigerada por líquido a plena carga. Cuando el modelo refrigerado por aire comienza a alcanzar temperaturas máximas, la frecuencia de la GPU disminuye, mientras que la CPU refrigerada por líquido permanece a la velocidad máxima del reloj durante todo el tiempo.
Para las ranuras, las configuraciones base SR670 V2 tienen 2 ranuras de E/S PCIe 4.0 x16 frontales, aunque el resto de la parte frontal se puede configurar para las opciones de unidad mencionadas anteriormente. Todos admiten intercambio en caliente.
- Modelo SXM: elección de:
- 4 bahías para unidades NVMe de intercambio en caliente de 2.5 pulgadas
- 8 bahías para unidades NVMe de intercambio en caliente de 2.5 pulgadas
- Modelo de GPU 4-DW: elección de:
- 8 bahías para unidades AnyBay de intercambio en caliente de 2.5 pulgadas compatibles con unidades SAS, SATA o NVMe
- 4 bahías de unidades intercambiables en caliente de 3.5 pulgadas compatibles con unidades SATA HDD o SSD (compatible con NVMe solo a través de una oferta especial)
- Modelo de GPU 8-DW:
- 6 bahías de unidad NVMe de intercambio en caliente EDSFF E1.S
El SR670 V2 también admite una o dos unidades de almacenamiento o arranque SATA o NVMe de formato M.2. El soporte RAID se ofrece a través de un controlador de hardware integrado.
Mientras tanto, el backplane es fijo, con cuatro ranuras PCIe 4.0 x16 y una OCP 3.0. Las cuatro fuentes de alimentación intercambiables en caliente redundantes del SR670 V2 también son visibles desde la parte trasera. Vienen en opciones de 1800 W o 2400 W y cuentan con clasificaciones 80 Plus Platinum.
Se incluye un enlace de fuente de alimentación diferente en los modelos SR670 V2 equipados con la configuración SXM, que alimenta la sección de GPU frontal con un enlace de alimentación dedicado. Estos modelos contrastan marcadamente con los modelos de GPU de carga por ranura, que no incluyen este enlace de alimentación sustancial desde la parte posterior del chasis.
El resto del hardware del SR670 V2 es igualmente impresionante y continúa con su tema de flexibilidad. Admite hasta dos procesadores Intel Xeon Scalable de tercera generación "Ice Lake" de 40 núcleos/80 hilos, con un TDP de hasta 270 vatios. Cada CPU tiene 16 ranuras DDR4-3200 RDIMM; con RDIMM de 128 GB, el límite de memoria es de 4 TB. Dependiendo de la CPU, el SR670 V2 también admite hasta 16 módulos Intel Persistent Memory Serie 200 , instalados con la memoria del sistema estándar. Con todo el hardware que ofrece el ThinkSystem SR670 V2, Lenovo se centró en el diseño de refrigeración para obtener el máximo rendimiento del sistema. No todos los sistemas permiten que todos los componentes funcionen al 100 % de utilización sin estrangulamiento térmico, mientras que el SR670 V2 está diseñado para permitir precisamente eso.
Conclusión
Lenovo está comprometido con la refrigeración líquida y ha aprovechado ese conocimiento para desarrollar cosas como el intercambiador de calor L2A. A medida que la densidad de energía continúa aumentando dentro de los servidores, los proveedores deben idear métodos creativos para eliminar la carga térmica de los componentes y sacarla del sistema. No todos los clientes necesitan o desean soluciones completas de refrigeración líquida. Lenovo, sin embargo, puede ofrecer soluciones para satisfacer las demandas de refrigeración de los clientes con servidores refrigerados por aire, parcialmente refrigerados por agua y completamente refrigerados por agua en su cartera.
La primera generación de Neptune™ entregó Liquid Cooling solo a CPU y memoria. Además de las CPU y la memoria, el sistema de refrigeración líquida Neptune de Lenovo se ha ampliado para incluir regulación de voltaje, almacenamiento, PCIe y, ahora, GPU. Lenovo incluso ha lanzado una fuente de alimentación refrigerada por líquido que elimina los ventiladores. Mirando hacia el futuro, Lenovo considera que la refrigeración líquida es la clave para manejar el calor generado por las futuras generaciones de CPU y GPU y la forma de mantener la densidad y el espacio al que se han acostumbrado los clientes empresariales.
Este informe está patrocinado por Lenovo Todos los puntos de vista y opiniones expresados en este informe se basan en nuestra visión imparcial de los productos en consideración.




Amazon