PerfectScalePerfectScale

Diese Seite ist auch in English, Español, Français, Italiano, 日本語 und Português verfügbar.

PlayHQ optimiert Kubernetes-Kosten im Multi-Tenant-Betrieb

Wie PlayHQ mit PerfectScale by DoiT das Kubernetes-Right-Sizing automatisiert und Echtzeit-Transparenz über die Kosten pro Tenant gewonnen hat

PerfectScale
PlayHQ

The Challenge

PlayHQ migrierte von ECS zu Kubernetes und erzielte zunächst erhebliche Einsparungen. Doch mit dem wachsenden Multi-Tenant-Kundenstamm wurden die Nutzungsmuster komplexer und unberechenbarer. Rund 90 % der Compute-Ressourcen laufen auf Kubernetes, verteilt auf Hunderte kleine, variable Workloads über alle Tenants hinweg. Autoscaling auf Infrastrukturebene mit Karpenter, HPA und KEDA stellte zwar die Kapazität sicher, konnte CPU- und Memory-Requests auf Workload-Ebene jedoch nicht präzise dimensionieren. Manuelle Ressourcenoptimierung ließ sich für ein schlankes Platform-Team nicht skalieren, und eine Evaluierung von OpenCost zeigte einen zu hohen operativen Aufwand für Betrieb und Konfiguration.

The Solution

PlayHQ setzte über DoiT auf PerfectScale, um das Kubernetes-Right-Sizing zu automatisieren und die EKS-Kosteneffizienz über die Multi-Tenant-Cluster hinweg zu verbessern. Bereits eine Stunde nach der ersten Demo lief die Automatisierung in einem Dev-Cluster. PerfectScale lieferte automatisiertes Right-Sizing der Workloads mit kontinuierlicher Anpassung der CPU- und Memory-Requests, Wartungsfenster, die Änderungen während der Traffic-Spitzen an Samstags-Spieltagen verhindern, Ausschlüsse auf Namespace-Ebene für sensible Workloads sowie ausgewogene Optimierungsrichtlinien für Production-Cluster, die Stabilität schützen und zugleich Kosten senken.

Results

  • Non-Production-Kubernetes-Kosten um 40 % gesenkt
  • Production-Kubernetes-Kosten um 20 % gesenkt
  • Jährlich Zehntausende Dollar eingespart
  • Performance-Konsistenz über alle Workloads hinweg verbessert
  • Echtzeit-Transparenz über die Kubernetes-Kostenzuordnung pro Tenant gewonnen
  • Resilienz-Probleme wie OOM-Alerts schneller erkannt und behoben
  • Automatisierung innerhalb einer Stunde nach der ersten Demo im Dev-Cluster eingerichtet

Jeder Kunde hat individuelle Nutzungsmuster. Manuelle Ressourcenoptimierung ließ sich schlicht nicht skalieren – wir brauchten Automatisierung, damit jeder Kunde, unabhängig von seiner Größe, eine passend dimensionierte Infrastruktur bekommt, ohne die Kapazität unseres Teams zu binden.

Brad Quinn, Lead Platform Engineer, PlayHQ

Community-Sport läuft auf Kubernetes

Tag für Tag betreibt PlayHQ weltweit kritische digitale Infrastruktur für Tausende Amateursport-Wettbewerbe. Führende Sportorganisationen – darunter Junioren-Clubs im Australian Rules Football, Basketball-Ligen sowie lokale Netball- und Fußballverbände – verlassen sich auf die Plattform, gerade in den Spitzenzeiten rund um Spieltage, wenn die Nutzung sprunghaft ansteigt. Diese Organisationen wickeln über PlayHQ Registrierungen, Scoring, Zahlungen und den Wettbewerbsbetrieb für Hunderte Teams ab. Da die Nachfrage je nach Sportart, Saison und Region stark schwankt, sind effizientes Skalieren der Infrastruktur und Kostenkontrolle eine ständige Herausforderung. Im Zentrum steht das Platform-Engineering-Team von PlayHQ unter der Leitung von Lead Platform Engineer Brad Quinn, das Zuverlässigkeit, Performance und Kosten der Kubernetes-Umgebung verantwortet. "Kubernetes ist für uns sehr wichtig: Es ist der tägliche Workflow unserer Engineers", sagt Quinn. Da rund 90 Prozent der Compute-Ressourcen von PlayHQ auf Kubernetes laufen, brauchte das Team mit wachsendem Kundenstamm einen stärker automatisierten und intelligenteren Ansatz für die Kostenoptimierung.

Warum Kubernetes-Kostenoptimierung für PlayHQ Priorität hatte

PlayHQ migrierte von ECS zu Kubernetes, um Infrastrukturkosten zu senken und Tenant-Deployments zu beschleunigen. Der Umstieg brachte zunächst Einsparungen, doch mit jeder neuen Organisation auf der Plattform stiegen die Kosten wieder, und die Nutzungsmuster wurden unberechenbarer. "Wir sind von ECS zu Kubernetes gewechselt und haben anfangs erhebliche Einsparungen erzielt", sagt Quinn. "Als unser Kundenstamm wuchs und die Nutzungsmuster komplexer wurden, mussten wir unseren Optimierungsansatz weiterentwickeln, um diese Effizienz zu halten." PlayHQ nutzte bereits Karpenter für effizientes Node-Scaling und setzte auf HPA und KEDA, um die Kapazität bedarfsgerecht anzupassen – insbesondere bei den Traffic-Spitzen am Wochenende. Doch die Anforderungen der Workloads unterschieden sich stark zwischen den Tenants. Autoscaling auf Infrastrukturebene stellte zwar die Kapazität sicher, löste aber nicht das Problem, CPU- und Memory-Requests über Hunderte kleine, variable Workloads hinweg präzise zu dimensionieren. Quinn evaluierte auch OpenCost, hielt den operativen Aufwand für ein schlankes Platform-Team jedoch für zu hoch.

Wie PerfectScale die Kubernetes-Optimierung automatisiert hat

PerfectScale erwies sich schnell als ideale Lösung, um das Kubernetes-Right-Sizing zu automatisieren und die EKS-Kosteneffizienz über die Multi-Tenant-Cluster von PlayHQ hinweg zu verbessern. Geschwindigkeit war dabei ein entscheidender Faktor: "Wir hatten die erste Demo, bekamen Zugang zur Plattform und hatten die Automatisierung innerhalb einer Stunde in einem Dev-Cluster eingerichtet", sagt Quinn. Die Funktionen von PerfectScale passten gut zur Umgebung und zu den operativen Abläufen von PlayHQ – das Team konnte die Optimierung sicher automatisieren und behielt zugleich die volle Kontrolle darüber, wann und wo Änderungen erfolgen. Zu den zentralen Funktionen gehörten automatisiertes Right-Sizing der Workloads mit kontinuierlicher Anpassung der CPU- und Memory-Requests, Wartungsfenster, die Änderungen in Phasen mit hohem Traffic wie an Samstags-Spieltagen verhindern, Ausschlüsse auf Namespace-Ebene, damit sensible Workloads unangetastet bleiben, sowie ausgewogene Optimierungsrichtlinien für Production-Cluster, die Stabilität und Kostensenkung in Einklang bringen.

Ergebnisse: Geringere Kosten und schnellere Problemlösung

Nach der Einführung von PerfectScale über DoiT erzielte PlayHQ deutliche Verbesserungen bei Kosten und operativer Performance: 40 % geringere Kubernetes-Kosten in Non-Production, 20 % geringere Kubernetes-Kosten in Production, Zehntausende Dollar jährliche Einsparungen, konsistentere Performance über alle Workloads hinweg und mehr Transparenz bei der Kostenzuordnung pro Tenant. Auch Resilienz-Probleme erkennt und behebt das Team jetzt schneller. "Die Resilienz-Funktionen, etwa OOM-Alerts, verkürzen die Zeit bis zur Lösung erheblich", sagt Quinn. Der Echtzeit-Einblick in die Kubernetes-Kosten pro Tenant verschafft Quinn einen klareren Blick auf die Saisonalität der einzelnen Tenants und stärkt seine Argumentation gegenüber der Führungsebene, wenn es um den Wert der Optimierung geht. "Wir können die Compute-Kosten pro Tenant jederzeit ad hoc abrufen", sagt Quinn. "Die eingesparten Summen und gelösten Probleme kann ich dann direkt mit dem CTO teilen."

Eine kostenbewusste Engineering-Kultur aufbauen

Nachdem die automatisierte Kubernetes-Optimierung nun etabliert ist, plant PlayHQ, den Zugang zu PerfectScale über das Platform-Team hinaus auszuweiten. Ziel ist es, die Produkt-Engineering-Squads dabei zu unterstützen, ihre eigenen SLOs zu steuern und zu verstehen, wie Designentscheidungen die Kubernetes-Ressourcennutzung und die Infrastrukturkosten beeinflussen. Das zahlt auf das langfristige Ziel von PlayHQ ein, Engineering-Praktiken auf nachhaltiges Wachstum auszurichten – und dabei weiterhin verlässliche digitale Erlebnisse für Vereine, Ligen und Familien zu liefern.

Mit DoiT als Partner: Kubernetes-Optimierung im großen Maßstab

Quinn hob den Wert von DoiT und PerfectScale als langfristige Partner hervor. Während des Onboardings identifizierten und lösten die Teams ein Problem innerhalb weniger Stunden – was das Vertrauen von PlayHQ in die Lösung weiter stärkte. Mit automatisierter Optimierung, spürbaren Kosteneinsparungen und verbesserter Zuverlässigkeit verfügt das Platform-Team über die operative Effizienz und Transparenz, um das weitere Wachstum von PlayHQ zu unterstützen.

So steigert PerfectScale die Kubernetes-Effizienz

Erfahren Sie, wie PerfectScale Teams beim Right-Sizing ihrer Cluster unterstützt, Ressourcenverschwendung reduziert und die Performance verbessert – ganz ohne manuelles Tuning.

More customer stories

PicnicAI

PicnicAI automatisiert 85–90 % der Kubernetes-Workloads – und gewinnt Zuverlässigkeit mit PerfectScale by DoiT

85–90%
der Anwendungs-Workloads jetzt durch automatisiertes Resizing abgedeckt
50%
weniger Zeitaufwand des Infrastruktur-Teams für Infrastruktur (ca.)
Stefanini

26 % weniger Kubernetes-Compute-Kosten: Stefanini optimiert mit PerfectScale by DoiT

26%
Weniger Kubernetes-Compute-Kosten
>60%
Geringere Infrastrukturkosten im letzten Jahr
OneFootball

Kubernetes-Optimierung im Takt des Weltfußballs

25%
weniger Kosten für die Kubernetes-Infrastruktur
80%
weniger Engineering-Aufwand für Kubernetes-Kostenoptimierung und Resilienz-Tuning
Luma Health

Luma Health senkt EKS-Kosten um 40 % und gewinnt jährlich Tausende Engineering-Stunden zurück

90%
Weniger Zeit für manuelles Kubernetes-Right-Sizing
40%
Weniger Amazon-EKS-Kosten
+1,700h/year
Engineering-Stunden für Zuverlässigkeit und Performance
SNCF

Wie SNCF Kubernetes-Waste reduzierte und die Zuverlässigkeit im großen Maßstab steigerte

30%
Mehr Workloads bei gleichbleibenden Kosten
~€500K
Geschätzte jährliche Einsparungen
250
Optimierte Cluster
NOS

NOS halbiert Kubernetes-Kosten und gewinnt Vertrauen in Optimierung zurück

50%
Kostensenkung
50%
Kostensenkung auf dem größten Cluster
0%
Ungenutzte Ressourcen auf zentralen Node-Pools
K1x

K1x senkt Cloud-Kosten drastisch und vereinfacht den Kubernetes-Betrieb

Thousands
Ersparnis pro Monat
Thousands
Monatliche Ersparnis bei den Cloud-Kosten
<10%
Ressourcenauslastung überdimensionierter Nodes vor der Optimierung
Riftweaver

Wie ein einzelner DevOps Engineer Riftweaver mit PerfectScale skaliert

59%
Reduktion des CPU-Throttlings
6
Optimierte kritische APIs
80,000+
Game-Downloads