PerfectScalePerfectScale

PerfectScale

Optimización de GPU con la visibilidad excepcional de PerfectScale

Obtén transparencia en el uso de GPU con monitoreo, análisis y right-sizing continuos de tus workloads para mantener eficientes tus clústeres de K8s.

Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

Ira Chernous
By Ira Chernous
Jun 30, 20254 min read

Las GPU se han convertido en una pieza esencial de la infraestructura moderna en la nube. A medida que más equipos adoptan la IA, el machine learning y los modelos de lenguaje de gran escala (LLM) para hacer evolucionar sus aplicaciones, el uso de GPU crece a gran velocidad, y con él los costos de Kubernetes en la nube necesarios para mantener esos workloads. Esta tendencia suma una nueva capa de complejidad a la gestión de recursos en Kubernetes: la optimización del uso de GPU.

"A diferencia de otros recursos de Kubernetes, las solicitudes de GPU se tratan de forma distinta: un pod obtiene acceso a una GPU completa o a ninguna. Sin asignación fraccionada, las GPU suelen quedar subutilizadas, lo que genera pérdida. Como las GPU pueden representar hasta el 75% de los costos de infraestructura por hora, cualquier ineficiencia se traduce en una pérdida financiera considerable. Por eso, eliminar la sobreasignación puede tener un gran impacto y generar ahorros significativos", señaló Eli Birger, CTO de PerfectScale by DoiT. "Sin visibilidad del uso real de las GPU, los Engineers no cuentan con la información necesaria para hacer right-sizing de los workloads, implementar estrategias avanzadas de programación de pods y tomar decisiones de infraestructura basadas en datos."

Para ayudar a los equipos a superar estos desafíos, nos entusiasma presentar GPU Visibility de PerfectScale by DoiT: la funcionalidad que te da un panorama claro del uso de GPU en tus clústeres de Kubernetes, y te ayuda a identificar ineficiencias, hacer right-sizing de los workloads y sacar el máximo provecho a tus recursos de GPU.

Veamos más de cerca cómo GPU Visibility ayuda a detectar ineficiencias y optimizar el uso de GPU con facilidad.

¿Qué ofrece la visibilidad de GPU?

La funcionalidad de GPU de PerfectScale es una solución potente que recopila métricas de utilización de GPU y ofrece visibilidad profunda en el contexto de todo el clúster. Con esta vista se logra un análisis preciso del entorno de Kubernetes y una optimización certera basada en datos.

Ingresa a Infrafit de PerfectScale para acceder a información detallada sobre el uso de GPU en tus grupos de nodos. El gráfico de utilización muestra un desglose claro del uso y las solicitudes de GPU en toda tu infraestructura. Esta vista resulta especialmente útil para identificar rápidamente capacidad de GPU subutilizada o inactiva, priorizar los esfuerzos de optimización en las áreas más críticas, reducir la pérdida de GPU y mejorar la eficiencia de costos en general.

Una vez identificada un área problemática, basta con hacer clic en el grupo de nodos correspondiente para profundizar en una vista más detallada de la infraestructura. Este nivel de granularidad ofrece un desglose completo de las instancias individuales dentro del grupo, junto con las métricas clave de cada una.

Después de detectar el problema gracias a esta visibilidad, el siguiente paso es decidir cómo resolverlo. La plataforma te ayuda a entender qué está fallando (GPU que no se aprovechan por completo, workloads aprovisionados con más recursos de los necesarios o instancias que corren sin hacer gran cosa) y a elegir la estrategia adecuada para solucionarlo. Por ejemplo, puedes hacer right-sizing de las instancias para ajustarlas mejor al workload, balancear la carga y mejorar el bin-packing, o apagar las instancias que no se necesitan.

Explorando escenarios de uso

Right-sizing de instancias de GPU

En muchos casos, los workloads no requieren toda la capacidad de la máquina con GPU. Al identificar instancias subutilizadas, puedes reemplazar instancias costosas por otras más pequeñas y rentables, mejor adaptadas a la tarea. Así se reduce el gasto innecesario sin dejar de cumplir con los requisitos de rendimiento.

Para tomar decisiones basadas en datos con total confianza, puedes apoyarte en la visibilidad de GPU de PerfectScale y detectar dónde tiene más sentido este ajuste.

Maximizar la utilización con GPU splitting

Si bien cambiar a instancias de GPU más pequeñas suele ser una excelente forma de reducir costos, no siempre es el enfoque más adecuado o efectivo.

Algunos workloads, como los pipelines de ML compartidos, no escalan bien cuando se dividen entre máquinas separadas y pueden requerir un control más estricto de los recursos. En esos casos, las instancias más pequeñas por sí solas quizá no ofrezcan el rendimiento, la eficiencia o la flexibilidad deseados.

Aquí es donde Multi-Instance GPU (MIG) de NVIDIA puede ayudar. MIG te permite dividir una GPU física en varias unidades más pequeñas y aisladas, cada una con su propio cómputo, memoria y ancho de banda. Estas particiones funcionan como GPU independientes, por lo que puedes ejecutar varios trabajos pequeños o en paralelo al mismo tiempo, sin conflictos.

PerfectScale facilita la identificación de GPU subutilizadas que ejecutan workloads que no necesitan toda la capacidad. En lugar de cambiar a una máquina más pequeña, puedes conservar la GPU más grande y dividirla en instancias MIG, ajustando cada fracción a las necesidades específicas de cada workload.

Aumentar la eficiencia con KAI Scheduler

Algunas tareas no necesitan una GPU todo el tiempo; por ejemplo, workloads efímeros, trabajos de CI/CD o etapas de entrenamiento de modelos con largas esperas de CPU. Solo la usan durante un período corto, y asignar una GPU dedicada a cada uno de estos trabajos implica una gran pérdida de recursos y dinero.

Con la visibilidad de GPU de PerfectScale, puedes identificar fácilmente estos patrones, como workloads que no aprovechan por completo la GPU asignada. Una vez identificados, puedes implementar Kai-Scheduler para consolidar varios trabajos en una sola GPU, maximizando el uso y reduciendo costos sin sacrificar el rendimiento.

Ya viste cómo PerfectScale ayuda a detectar la pérdida de GPU y a aplicar estrategias de optimización inteligentes. ¡Ahora es momento de poner ese conocimiento en práctica!

Profundiza en nuestro Portal de documentación o agenda una sesión técnica con nuestro equipo para recibir asistencia experta.

¿Todavía no usas PerfectScale? Comienza gratis hoy mismo y simplifica la optimización de tus clústeres de K8s.