PerfectScale
L'optimisation GPU grâce à la visibilité exceptionnelle de PerfectScale
Gagnez en transparence sur l'utilisation de vos GPU : monitoring continu, analyse et right-sizing des workloads GPU pour des clusters K8s plus efficaces.
Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.
Les GPU font désormais partie intégrante de l'infrastructure cloud moderne. À mesure que les équipes adoptent l'IA, le machine learning et les grands modèles de langage (LLM) pour faire évoluer leurs applications, l'utilisation des GPU croît rapidement — tout comme les coûts cloud Kubernetes nécessaires pour faire tourner ces workloads. Cette tendance ajoute une nouvelle couche de complexité à la gestion des ressources Kubernetes : l'optimisation de l'utilisation des GPU.
"Contrairement aux autres ressources Kubernetes, les requêtes GPU sont traitées différemment : un pod obtient soit l'accès à un GPU entier, soit aucun. Sans allocation fractionnée, les GPU sont souvent sous-utilisés, ce qui génère du gaspillage GPU. Les GPU pouvant représenter jusqu'à 75 % des coûts horaires d'infrastructure, la moindre inefficacité se traduit par un gaspillage financier considérable. Éliminer la surallocation peut donc avoir un impact majeur et débloquer des économies substantielles", explique Eli Birger, CTO de PerfectScale by DoiT. "Sans visibilité sur l'utilisation réelle des GPU, les ingénieurs ne disposent pas des informations nécessaires pour appliquer le right-sizing aux workloads, mettre en place des stratégies avancées de scheduling des pods et prendre des décisions d'infrastructure fondées sur les données."
Pour aider les équipes à relever ces défis, nous sommes ravis de vous présenter GPU Visibility de PerfectScale by DoiT : une fonctionnalité qui vous offre une vision claire de l'utilisation des GPU sur l'ensemble de vos clusters Kubernetes, afin d'identifier les inefficacités, d'ajuster vos workloads et de tirer pleinement parti de vos ressources GPU.

Voyons plus en détail comment GPU Visibility permet de révéler les inefficacités et d'optimiser facilement l'utilisation des GPU.
Qu'apporte la visibilité GPU ?
La fonctionnalité GPU de PerfectScale est une solution puissante qui collecte les métriques d'utilisation des GPU et offre une visibilité approfondie, replacée dans le contexte de l'ensemble du cluster. Cette vue permet une analyse précise de votre environnement Kubernetes et ouvre la voie à une optimisation fiable, fondée sur les données.

Rendez-vous dans Infrafit de PerfectScale pour accéder à des informations détaillées sur l'utilisation des GPU de vos groupes de nœuds. Le graphique d'utilisation offre une ventilation claire de l'usage GPU et des requêtes sur l'ensemble de votre infrastructure. Cette vue est particulièrement utile pour repérer rapidement les capacités GPU sous-utilisées ou inactives, concentrer vos efforts d'optimisation sur les zones les plus critiques, réduire le gaspillage GPU et améliorer globalement la rentabilité.
Une fois une zone problématique identifiée, il vous suffit de cliquer sur le groupe de nœuds concerné pour accéder à une vue détaillée de l'infrastructure. Ce niveau de granularité offre une ventilation complète des instances individuelles au sein du groupe, avec les métriques clés de chacune.

Après avoir repéré le problème grâce à cette visibilité, l'étape suivante consiste à décider comment le résoudre. La plateforme vous aide à comprendre ce qui ne va pas (GPU pas pleinement exploités, workloads provisionnés avec plus de ressources que nécessaire, ou instances qui tournent presque à vide) et à choisir la bonne stratégie pour y remédier. Vous pouvez par exemple appliquer le right-sizing aux instances pour mieux les adapter au workload, équilibrer la charge et améliorer le bin-packing, ou encore éteindre les instances superflues.
Cas d'usage concrets
Right-sizing des instances GPU

Dans bien des cas, les workloads n'ont pas besoin de la capacité totale de la machine GPU. En identifiant les instances sous-utilisées, vous pouvez remplacer des instances coûteuses par des instances plus petites et plus économiques, mieux adaptées à la tâche. Vous réduisez ainsi les dépenses inutiles tout en respectant vos exigences de performance.
Pour prendre des décisions fiables, fondées sur les données, appuyez-vous en toute simplicité sur la visibilité GPU de PerfectScale et repérez les endroits où cet ajustement a le plus de sens.
Maximiser l'utilisation grâce au GPU splitting
Si le passage à des instances GPU plus petites est souvent un excellent moyen de réduire les coûts, ce n'est pas toujours l'approche la plus adaptée ni la plus efficace.
Certains workloads, comme les pipelines ML partagés, se prêtent mal à une répartition sur des machines distinctes et peuvent nécessiter un contrôle plus fin des ressources. Dans ce cas, des instances plus petites ne suffisent pas forcément à offrir les performances, l'efficacité ou la flexibilité recherchées.

C'est là que le Multi-Instance GPU (MIG) de NVIDIA entre en jeu. MIG permet de découper un GPU physique en plusieurs unités plus petites et isolées, chacune disposant de ses propres ressources de calcul, de mémoire et de bande passante. Ces fragments se comportent comme des GPU indépendants : vous pouvez ainsi exécuter simultanément plusieurs tâches légères ou parallèles, sans conflit.
PerfectScale facilite l'identification des GPU sous-utilisés qui exécutent des workloads n'ayant pas besoin de toute la capacité disponible. Plutôt que de basculer vers une machine plus petite, vous pouvez conserver le GPU de plus grande taille et le diviser en instances MIG, en adaptant chaque fraction aux besoins spécifiques du workload.
Gagner en efficacité avec KAI Scheduler
Certaines tâches n'ont pas besoin d'un GPU en permanence : workloads éphémères, jobs CI/CD ou étapes d'entraînement de modèles avec de longues attentes CPU, par exemple. Elles ne l'utilisent que brièvement, et attribuer un GPU dédié à chacune de ces tâches gaspille énormément de ressources et d'argent.

Grâce à la visibilité GPU de PerfectScale, vous identifiez facilement ces schémas, comme les workloads qui n'exploitent pas pleinement le GPU qui leur est alloué. Une fois ces cas repérés, vous pouvez mettre en place Kai-Scheduler pour regrouper plusieurs jobs sur un même GPU, maximisant ainsi l'utilisation et réduisant les coûts sans sacrifier les performances.
Vous avez vu comment PerfectScale aide à révéler le gaspillage GPU et à appliquer des stratégies d'optimisation intelligentes. À vous de passer à l'action !
Approfondissez le sujet sur notre portail de documentation, ou planifiez une session technique avec notre équipe pour bénéficier d'un accompagnement expert.
Vous n'utilisez pas encore PerfectScale ? Commencez gratuitement dès aujourd'hui et simplifiez l'optimisation de vos clusters K8s.