PerfectScale
Mehr GPU-Effizienz durch volle Transparenz mit PerfectScale
Volle Transparenz über die GPU-Auslastung: kontinuierliches Monitoring, Analyse und Right-Sizing von GPU-Workloads für effiziente K8s-Cluster.
Diese Seite ist auch in English, Español, Français, Italiano, 日本語 und Português verfügbar.
GPUs sind aus moderner Cloud-Infrastruktur nicht mehr wegzudenken. Da immer mehr Teams auf KI, Machine Learning und Large Language Models (LLMs) setzen, um ihre Anwendungen weiterzuentwickeln, wächst die GPU-Nutzung rasant – und mit ihr steigen die Kubernetes-Cloud-Kosten für den Betrieb solcher Workloads. Dieser Trend bringt eine neue Ebene der Komplexität in das Kubernetes-Ressourcenmanagement: die Optimierung der GPU-Auslastung.
"Anders als andere Kubernetes-Ressourcen werden GPU-Requests gesondert behandelt: Ein Pod erhält entweder Zugriff auf eine ganze GPU oder gar keinen. Ohne anteilige Zuweisung bleiben GPUs oft unterausgelastet – das Ergebnis ist GPU-Waste. Da GPUs bis zu 75 % der stündlichen Infrastrukturkosten ausmachen können, führt jede Ineffizienz zu erheblicher finanzieller Verschwendung. Die Beseitigung von Überprovisionierung kann daher enorme Wirkung entfalten und signifikante Kosteneinsparungen freisetzen", sagt Eli Birger, CTO von PerfectScale by DoiT. "Ohne Einblick in die tatsächliche GPU-Auslastung fehlen Engineers die Erkenntnisse, um Workloads per Right-Sizing anzupassen, fortgeschrittene Pod-Scheduling-Strategien umzusetzen und datenbasierte Infrastrukturentscheidungen zu treffen."
Um Teams bei diesen Herausforderungen zu unterstützen, freuen wir uns, GPU Visibility von PerfectScale by DoiT vorzustellen – das Feature, das Ihnen ein klares Bild der GPU-Nutzung über Ihre Kubernetes-Cluster hinweg liefert. So erkennen Sie Ineffizienzen, dimensionieren Workloads passgenau und schöpfen Ihre GPU-Ressourcen voll aus.

Schauen wir uns genauer an, wie GPU Visibility Ineffizienzen aufdeckt und die Optimierung der GPU-Auslastung spürbar erleichtert.
Was bietet GPU Visibility?
Das GPU-Feature von PerfectScale ist eine leistungsstarke Lösung, die Metriken zur GPU-Auslastung erfasst und tiefe Einblicke im Kontext des gesamten Clusters liefert. Diese Sicht ermöglicht eine präzise Analyse der Kubernetes-Umgebung – die Grundlage für exakte, datenbasierte Optimierung.

Öffnen Sie Infrafit in PerfectScale, um detaillierte Einblicke in die GPU-Auslastung Ihrer Node Groups zu erhalten. Das Auslastungsdiagramm schlüsselt GPU-Nutzung und -Requests über Ihre gesamte Infrastruktur hinweg übersichtlich auf. Diese Ansicht ist besonders hilfreich, um unterausgelastete oder ungenutzte GPU-Kapazitäten schnell zu erkennen, Optimierungsmaßnahmen auf die kritischsten Bereiche zu fokussieren, GPU-Waste zu reduzieren und die Kosteneffizienz insgesamt zu steigern.
Sobald ein Problembereich identifiziert ist, klicken Sie einfach auf die entsprechende Node Group, um in eine detailliertere Infrastrukturansicht einzutauchen. Auf dieser Ebene erhalten Sie eine umfassende Aufschlüsselung der einzelnen Instanzen innerhalb der Gruppe – inklusive der wichtigsten Metriken je Instanz.

Haben Sie das Problem dank der gewonnenen Transparenz erkannt, geht es im nächsten Schritt darum, die passende Lösung zu wählen. Die Plattform hilft Ihnen zu verstehen, wo es hakt (GPUs, die nicht voll ausgelastet sind, Workloads mit mehr Ressourcen als nötig oder Instanzen, die kaum etwas leisten), und die richtige Strategie zu finden. Sie können zum Beispiel Instanzen per Right-Sizing besser auf die Workloads abstimmen, die Last ausbalancieren und das Bin-Packing verbessern – oder nicht benötigte Instanzen abschalten.
Anwendungsszenarien im Überblick
Right-Sizing von GPU-Instanzen

In vielen Fällen benötigen Workloads nicht die volle Kapazität der GPU-Maschine. Indem Sie unterausgelastete Instanzen identifizieren, können Sie teure Instanzen durch kleinere, kosteneffizientere ersetzen, die besser zur Aufgabe passen. So senken Sie unnötige Ausgaben und erfüllen dennoch alle Performance-Anforderungen.
Für fundierte, datenbasierte Entscheidungen nutzen Sie einfach die GPU-Transparenz von PerfectScale – und erkennen sofort, wo sich diese Anpassung am meisten lohnt.
Maximale Auslastung durch GPU-Splitting
Der Wechsel zu kleineren GPU-Instanzen ist oft ein guter Hebel zur Kostensenkung – aber nicht immer der beste oder effektivste Ansatz.
Manche Workloads, etwa gemeinsam genutzte ML-Pipelines, skalieren schlecht, wenn sie auf separate Maschinen verteilt werden, und erfordern eine feinere Ressourcenkontrolle. In solchen Fällen liefern kleinere Instanzen allein möglicherweise nicht die gewünschte Performance, Effizienz oder Flexibilität.

Hier kommt NVIDIAs Multi-Instance GPU (MIG) ins Spiel. Mit MIG teilen Sie eine physische GPU in mehrere kleinere, isolierte Einheiten auf – jede mit eigener Rechenleistung, eigenem Speicher und eigener Bandbreite. Diese Einheiten verhalten sich wie separate GPUs, sodass Sie mehrere kleine oder parallele Jobs gleichzeitig und konfliktfrei ausführen können.
Mit PerfectScale finden Sie im Handumdrehen unterausgelastete GPUs, auf denen Workloads laufen, die keine volle Kapazität benötigen. Statt auf eine kleinere Maschine zu wechseln, behalten Sie die größere GPU und teilen sie in MIG-Instanzen auf – jede Einheit passgenau auf die jeweiligen Workload-Anforderungen zugeschnitten.
Mehr Effizienz mit dem KAI Scheduler
Manche Aufgaben benötigen nicht durchgehend eine GPU – etwa kurzlebige Workloads, CI/CD-Jobs oder Trainingsschritte für Modelle mit langen CPU-Wartezeiten. Sie nutzen die GPU nur kurzzeitig, und jedem dieser Jobs eine dedizierte GPU zuzuweisen, verschwendet erhebliche Ressourcen und Geld.

Mit der GPU-Transparenz von PerfectScale erkennen Sie solche Muster – Workloads, die ihre zugewiesene GPU nicht voll ausnutzen – auf einen Blick. Anschließend können Sie den KAI Scheduler einsetzen, um mehrere Jobs auf einer einzigen GPU zu konsolidieren: maximale Auslastung, geringere Kosten, ohne Kompromisse bei der Performance.
Sie haben gesehen, wie PerfectScale GPU-Waste aufdeckt und smarte Optimierungsstrategien ermöglicht. Jetzt ist es an der Zeit, diese Erkenntnisse in die Praxis umzusetzen!
Vertiefen Sie Ihr Wissen in unserem Dokumentationsportal oder vereinbaren Sie eine technische Session mit unserem Team für Unterstützung durch unsere Experten.
Sie nutzen PerfectScale noch nicht? Starten Sie noch heute kostenlos und vereinfachen Sie Ihre K8s-Optimierung.