PerfectScalePerfectScale

PerfectScale

Otimização de GPU com a visibilidade excepcional do PerfectScale

Tenha transparência na utilização de GPUs com monitoramento contínuo, análise e right-sizing de workloads de GPU para garantir a eficiência dos clusters K8s.

Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

Ira Chernous
By Ira Chernous
Jun 30, 20254 min read

As GPUs se tornaram parte essencial da infraestrutura de nuvem moderna. Com cada vez mais times adotando IA, machine learning e grandes modelos de linguagem (LLMs) para evoluir suas aplicações, o uso de GPUs cresce rapidamente — e, junto com ele, os custos de nuvem do Kubernetes para manter esses workloads. Essa tendência adiciona uma nova camada de complexidade à gestão de recursos no Kubernetes: a otimização da utilização de GPUs.

"Diferentemente de outros recursos do Kubernetes, as requisições de GPU são tratadas de forma diferente: um pod recebe acesso a uma GPU inteira ou a nenhuma. Sem alocação fracionada, as GPUs costumam ficar subutilizadas, gerando desperdício. Como as GPUs podem representar até 75% dos custos de infraestrutura por hora, qualquer ineficiência resulta em um desperdício financeiro significativo. Eliminar a superalocação pode, portanto, ter um grande impacto e destravar economias expressivas", afirmou Eli Birger, CTO do PerfectScale by DoiT. "Sem visibilidade sobre a utilização real das GPUs, os engenheiros não têm os insights necessários para aplicar right-sizing nos workloads, implementar estratégias avançadas de agendamento de pods e tomar decisões de infraestrutura orientadas por dados."

Para ajudar os times a superar esses desafios, temos o prazer de apresentar o GPU Visibility do PerfectScale by DoiT — o recurso que oferece uma visão clara do uso de GPUs nos seus clusters Kubernetes, ajudando a identificar ineficiências, aplicar right-sizing nos workloads e aproveitar ao máximo seus recursos de GPU.

Vamos ver mais de perto como o GPU Visibility ajuda a revelar ineficiências e otimizar a utilização de GPUs com facilidade.

O que o GPU Visibility oferece?

O recurso de GPU do PerfectScale é uma solução poderosa que coleta métricas de utilização de GPU e entrega visibilidade profunda no contexto do cluster inteiro. Essa visão permite uma análise minuciosa do ambiente Kubernetes, destravando uma otimização precisa e orientada por dados.

Acesse o Infrafit do PerfectScale para ver insights detalhados de utilização de GPU dos seus node groups. O gráfico de utilização traz um detalhamento claro do uso e das requisições de GPU em toda a sua infraestrutura. Essa visão é especialmente útil para identificar rapidamente capacidade de GPU subutilizada ou ociosa, priorizar os esforços de otimização nas áreas mais críticas, reduzir o desperdício de GPU e melhorar a eficiência de custos como um todo.

Ao identificar uma área problemática, basta clicar no node group correspondente para se aprofundar em uma visão mais detalhada da infraestrutura. Esse nível de granularidade oferece um detalhamento completo das instâncias individuais dentro do grupo, junto com as principais métricas de cada instância.

Depois de detectar o problema com a visibilidade oferecida, o próximo passo é decidir como resolvê-lo. A plataforma ajuda você a entender o que está dando errado (GPUs sem uso pleno, workloads provisionados com mais recursos do que o necessário ou certas instâncias rodando sem fazer quase nada) e a escolher a estratégia certa para resolver o problema. Por exemplo, você pode aplicar right-sizing nas instâncias para que se ajustem melhor ao workload, balancear a carga e melhorar o bin-packing, ou desligar instâncias que não são necessárias.

Explorando cenários de uso

Right-sizing de instâncias de GPU

Em muitos casos, os workloads não precisam de toda a capacidade da máquina com GPU. Ao identificar instâncias subutilizadas, você pode substituir instâncias caras por outras menores e mais econômicas, mais adequadas à tarefa. Isso ajuda a reduzir gastos desnecessários sem abrir mão dos requisitos de desempenho.

Para tomar decisões confiáveis e orientadas por dados, você pode usar a visibilidade de GPU do PerfectScale e identificar exatamente onde esse ajuste faz mais sentido.

Maximizando a utilização com GPU splitting

Embora migrar para instâncias de GPU menores costume ser uma ótima forma de reduzir custos, nem sempre é a abordagem melhor ou mais eficaz.

Alguns workloads, como pipelines de ML compartilhados, não escalam bem quando divididos entre máquinas separadas e podem exigir um controle mais rígido dos recursos. Nesses casos, instâncias menores, por si só, podem não entregar o desempenho, a eficiência ou a flexibilidade desejados.

É aqui que o Multi-Instance GPU (MIG) da NVIDIA pode ajudar. O MIG permite dividir uma GPU física em várias unidades menores e isoladas, cada uma com sua própria capacidade de computação, memória e largura de banda. Essas frações funcionam como GPUs separadas, permitindo executar vários jobs pequenos ou paralelos ao mesmo tempo, sem conflitos.

O PerfectScale facilita a identificação de GPUs subutilizadas que executam workloads que não precisam da capacidade total. Em vez de migrar para uma máquina menor, você pode manter a GPU maior e dividi-la em instâncias MIG, ajustando cada fração às necessidades específicas de cada workload.

Aumentando a eficiência com o KAI Scheduler

Algumas tarefas não precisam de uma GPU o tempo todo — por exemplo, workloads efêmeros, jobs de CI/CD ou etapas de treinamento de modelos com longas esperas de CPU. Elas usam a GPU apenas por um curto período, e dedicar uma GPU exclusiva a cada um desses jobs desperdiça recursos e dinheiro de forma significativa.

Com a visibilidade de GPU do PerfectScale, você identifica facilmente padrões como workloads que não usam plenamente a GPU alocada. Uma vez identificados, você pode implementar o Kai-Scheduler para consolidar vários jobs em uma única GPU, maximizando o uso e reduzindo custos sem sacrificar o desempenho.

Você viu como o PerfectScale ajuda a revelar desperdícios de GPU e aplicar estratégias inteligentes de otimização. Agora é hora de colocar esses insights em prática!

Explore mais a fundo nosso Portal de Documentação ou agende uma sessão técnica com nosso time para receber apoio especializado.

Ainda não usa o PerfectScale? Comece gratuitamente hoje e simplifique sua jornada de otimização de K8s.