PerfectScalePerfectScale

Diese Seite ist auch in English, Español, Français, Italiano, 日本語 und Português verfügbar.

PicnicAI automatisiert 85–90 % der Kubernetes-Workloads – und gewinnt Zuverlässigkeit mit PerfectScale by DoiT

Wie PicnicAI mit PerfectScale by DoiT die Workload-Optimierung automatisiert, den operativen Aufwand senkt und Engineers mehr Vertrauen in ihre Infrastruktur gibt

PerfectScale
PicnicAI

The Challenge

Mit der Weiterentwicklung der Kubernetes-Umgebung von PicnicAI stand das Team vor einer Herausforderung, die vielen Teams bekannt vorkommen dürfte: herauszufinden, wie viel CPU und Speicher einzelne Workloads tatsächlich benötigen.

Bislang wurden die Ressourcenanforderungen beim Anlegen eines Workloads weitgehend geschätzt und blieben oft unverändert, bis ein Problem auftrat. Besonders problematisch war das bei Datenverarbeitungs-Workloads, deren Anforderungen von Job zu Job stark schwanken können.

"Früher lief das Scaling bei uns im Grunde so, dass jemand beim Anlegen eines Jobs geschätzt hat, wie viel Speicher und CPU er braucht – und dann wurde das einfach nie wieder angefasst, bis es zu vielen OOMs (Out-of-Memory-Fehlern) kam", sagt Josh Zarrabi, Infrastructure Engineer bei PicnicAI.

Waren Workloads zu knapp dimensioniert, konnten Jobs wiederholt fehlschlagen und neu starten – mit Warteschlangen und zusätzlichem Druck auf gemeinsam genutzte Datenbanken als Folge. Umgekehrt führte Überprovisionierung zu unnötiger Infrastrukturkapazität und unnötigen Cloud-Ausgaben.

Erschwerend kam hinzu, dass PicnicAI mit einem schlanken Engineering-Team arbeitet. Infrastrukturentscheidungen stammten häufig von Engineers, die das Unternehmen inzwischen verlassen hatten – dem Team fehlte daher oft der Kontext hinter bestehenden Konfigurationen.

Die Senkung der Cloud-Kosten war zwar ein Anlass, sich mit Optimierung zu beschäftigen, doch die Zuverlässigkeit wurde schnell zum wichtigeren Ziel. "Der Zugewinn an Zuverlässigkeit war für uns wirklich wichtig, und die Kosteneinsparungen waren ein schöner zusätzlicher Vorteil", sagt Zarrabi.

The Solution

Vom manuellen Right-Sizing zur Automatisierung

PicnicAI begann die Zusammenarbeit mit DoiT im Rahmen einer umfassenderen Initiative zur Cloud-Kostenoptimierung. DoiT führte PerfectScale ein, damit das Team die Ressourcennutzung auf Workload-Ebene versteht und die Kubernetes-Optimierung automatisieren kann.

PerfectScale kombiniert granulare Kubernetes-Transparenz mit automatisiertem, Workload-spezifischem Right-Sizing und hilft Teams, CPU und Speicher zu optimieren, ohne auf ständiges manuelles Monitoring angewiesen zu sein.

Bei PicnicAI erfolgte die Einführung bewusst schrittweise. Zunächst konzentrierte sich das Team darauf, die Zuverlässigkeit zu verbessern und Vertrauen in die Empfehlungen aufzubauen, bevor die Automatisierung nach und nach ausgeweitet wurde.

Ineffiziente Konfigurationen aufspüren

Mit den InfraFit-Funktionen von PerfectScale konnte PicnicAI ineffiziente Infrastrukturkonfigurationen identifizieren und erkennen, wo Workloads nicht zu den bereitgestellten Ressourcen passten.

"Mit InfraFit von PerfectScale ist es viel einfacher zu sagen: Okay, hier verschwenden wir tatsächlich Ressourcen, weil der Zuschnitt nicht zu unseren Workloads passt", sagt Zarrabi. "Das gibt mir mehr Sicherheit, Änderungen vorzunehmen, auch wenn wir nicht immer den vollen Kontext zu den ursprünglichen Entscheidungen haben."

Automatisierung plus Experten-Support

Die Technologie war nur ein Teil der Lösung. Die Field-Engineering- und Customer-Success-Teams von DoiT arbeiteten eng mit PicnicAI zusammen, um dem Team das Verhalten von Kubernetes näherzubringen und zu bestimmen, wo Automatisierung sicher eingeführt werden konnte.

Dazu gehörten die Analyse des Zusammenspiels von HPA (Horizontal Pod Autoscaling) und Cluster Autoscaler, die Anpassung von Schwellenwerten und die Einführung kontrollierter Richtlinien für Ressourcenanforderungen.

Dank der Policy- und Guardrail-Funktionen von PerfectScale konnte PicnicAI steuern, wo und wie optimiert wird – statt die Automatisierung einfach pauschal für alle Workloads zu aktivieren.

Sensiblere Workloads wurden vorsichtig behandelt, während die Automatisierung schrittweise auf Produktions-, Staging- und Entwicklungsumgebungen ausgeweitet wurde.

Für Zarrabi war der laufende technische Support neben der Plattform ein wichtiger Bestandteil der Zusammenarbeit. "Es ist gut, wenn jemand mit draufschaut und mich in die Pflicht nimmt", sagt er. "Einfach sicherzustellen, dass wir das Maximum aus dem Produkt herausholen – das ist hilfreich."

Results

  • 85–90 % der Workloads jetzt automatisiert
  • Rund 50 % weniger Zeitaufwand des Infrastruktur-Teams für Infrastruktur
  • Höhere Zuverlässigkeit und weniger Ablenkung durch Infrastrukturthemen
  • Kosteneffizienz als zusätzlicher Vorteil
  • Mehr Engineering-Kapazität für wertschöpfende Aufgaben

"PerfectScale gibt uns die Sicherheit, die Kubernetes-Optimierung zu automatisieren – und unsere Engineers können sich darauf konzentrieren, das zu bauen, was wirklich zählt."

Josh Zarrabi, Infrastructure Engineer

Ergebnisse

85–90 % der Workloads jetzt automatisiert

Die größte operative Veränderung ist die Abkehr vom manuellen Ressourcenmanagement. Vor PerfectScale hatte PicnicAI kein automatisiertes Workload-Resizing im Einsatz. Heute deckt das automatisierte Resizing rund 85–90 % der Workloads in den Anwendungsclustern ab.

Ressourcenanforderungen können damit kontinuierlich optimiert werden, ohne dass Engineers einzelne Workloads manuell prüfen und anpassen müssen.

Höhere Zuverlässigkeit und weniger Ablenkung durch Infrastrukturthemen

Die Vorteile gehen über die Optimierung selbst hinaus. PicnicAI verzeichnet weniger speicherbedingte Probleme und weniger von den Betriebsstörungen, die früher mit falsch dimensionierten Workloads einhergingen.

"Es ist einfach eine lästige Sache weniger, um die man sich kümmern muss", sagt Zarrabi.

Für eine schlanke Engineering-Organisation ist dieser Wandel besonders bedeutsam. Durch die stärkere Automatisierung des Infrastrukturmanagements konnte PicnicAI die Kapazität des Teams erhöhen und mehr Projekte im gesamten Unternehmen vorantreiben – ohne zusätzlichen operativen Aufwand.

Statt immer wieder zu untersuchen, warum Jobs fehlschlagen, Warteschlangen entstehen oder Datenbanken unnötig belastet werden, können sich Engineers stärker strategischen Infrastruktur- und Produktinitiativen widmen.

Kosteneffizienz als zusätzlicher Vorteil

Zuverlässigkeit war das Hauptziel der Zusammenarbeit – aber nicht das einzige Ergebnis. Weil das Right-Sizing von PerfectScale Workload-spezifisch arbeitet, konnte PicnicAI auch die Überprovisionierung abbauen, die sich früher aufgebaut hatte, wenn Ressourcenlimits einmal geschätzt und nie wieder überprüft wurden – und so neben dem Zugewinn an Zuverlässigkeit auch unnötige Infrastrukturausgaben reduzieren.

"Der Zugewinn an Zuverlässigkeit war für uns wirklich wichtig, und die Kosteneinsparungen waren ein schöner zusätzlicher Vorteil", sagt Zarrabi.

Für ein schlankes Team, das ohnehin viele Prioritäten jongliert, ist Automatisierung damit eine Investition, die sich leicht rechtfertigen lässt: Sie erzwingt keinen Kompromiss zwischen einem straffen Infrastrukturbudget und zuverlässigen Systemen – sie liefert beides.

Mehr Engineering-Kapazität für wertschöpfende Aufgaben

Der geringere Aufwand für manuelles Kubernetes-Management gibt den Engineers von PicnicAI Raum für längerfristige Projekte – etwa die Ablösung von Jenkins für Continuous Integration und die Erkundung neuer KI-Initiativen.

Der Wert der Zusammenarbeit geht damit weit über das Zuverlässigkeitsproblem hinaus, für dessen Lösung sie ursprünglich gedacht war. Durch die Automatisierung einer Aufgabe, die zuvor Engineering-Urteilsvermögen und manuelles Eingreifen erforderte, hat PicnicAI zugleich die Infrastrukturkosten gesenkt, knappe technische Kapazitäten freigesetzt und den Engineers mehr Sicherheit im Umgang mit historischen Konfigurationen gegeben, die sie nicht selbst aufgesetzt haben.

"Man will seine Zeit mit Dingen verbringen, die nützlich sind", sagt Zarrabi. "Das Raten von Speicher- und CPU-Limits gehört nicht dazu."

Wie geht es weiter?

PicnicAI plant, die Rolle von PerfectScale mit der Weiterentwicklung seiner Kubernetes-Umgebung weiter auszubauen – mit mehr Automatisierung für zusätzliche Workloads und der schrittweisen Einbeziehung sensiblerer Produktionsinfrastruktur.

Außerdem wird das Unternehmen weiterhin auf die umfassende Cloud-Expertise von DoiT zurückgreifen, während sich seine Plattform und seine KI-Initiativen weiterentwickeln. Für PicnicAI ist das Ziel klar: die Infrastrukturoptimierung überall dort automatisieren, wo es möglich ist, die Zuverlässigkeit für kritische Healthcare-Workloads sicherstellen – und den Engineers ermöglichen, weniger Zeit mit Kubernetes-Management und mehr Zeit mit Technologie zu verbringen, die die Behandlungsergebnisse von Patienten verbessern kann.

Über PicnicAI

PicnicAI ist ein Health-Tech-Unternehmen, das Intelligenz entwickelt, um die menschliche Gesundheit voranzubringen. Seine Technologie verarbeitet und validiert große Mengen medizinischer Daten, hilft Pharmaforschenden, Beobachtungsstudien effizienter durchzuführen, und unterstützt Patienten dabei, ihre Behandlung besser zu steuern.

Die Cloud-Infrastruktur des Unternehmens spielt für diese Mission eine zentrale Rolle. PicnicAI betreibt acht bis neun Kubernetes-Cluster für automatisierte Workloads, deren CPU- und Speicheranforderungen je nach verarbeiteten Daten stark variieren können. Zuverlässige Infrastruktur bedeutet für PicnicAI letztlich, dass sich die Engineers auf Healthcare-Innovation konzentrieren können, statt ihre Zeit mit manuellem Kubernetes-Management zu verbringen.

Schluss mit dem Raten von CPU- und Speicherlimits für jeden Kubernetes-Workload

Kubernetes-Right-Sizing sicher automatisieren

Sehen Sie, was PerfectScale by DoiT in Ihren Clustern findet: Transparenz auf Workload-Ebene, automatisiertes Resizing und Policy-Guardrails unter Ihrer Kontrolle – mit DoiT-Engineers an der Seite Ihres Teams.

More customer stories

Stefanini

26 % weniger Kubernetes-Compute-Kosten: Stefanini optimiert mit PerfectScale by DoiT

26%
Weniger Kubernetes-Compute-Kosten
>60%
Geringere Infrastrukturkosten im letzten Jahr
OneFootball

Kubernetes-Optimierung im Takt des Weltfußballs

25%
weniger Kosten für die Kubernetes-Infrastruktur
80%
weniger Engineering-Aufwand für Kubernetes-Kostenoptimierung und Resilienz-Tuning
Luma Health

Luma Health senkt EKS-Kosten um 40 % und gewinnt jährlich Tausende Engineering-Stunden zurück

90%
Weniger Zeit für manuelles Kubernetes-Right-Sizing
40%
Weniger Amazon-EKS-Kosten
+1,700h/year
Engineering-Stunden für Zuverlässigkeit und Performance
PlayHQ

PlayHQ optimiert Kubernetes-Kosten im Multi-Tenant-Betrieb

40%
Reduzierung der Non-Production-Kubernetes-Kosten
40%
Reduzierung der Non-Production-K8s-Kosten
20%
Reduzierung der Production-K8s-Kosten
SNCF

Wie SNCF Kubernetes-Waste reduzierte und die Zuverlässigkeit im großen Maßstab steigerte

30%
Mehr Workloads bei gleichbleibenden Kosten
~€500K
Geschätzte jährliche Einsparungen
250
Optimierte Cluster
NOS

NOS halbiert Kubernetes-Kosten und gewinnt Vertrauen in Optimierung zurück

50%
Kostensenkung
50%
Kostensenkung auf dem größten Cluster
0%
Ungenutzte Ressourcen auf zentralen Node-Pools
K1x

K1x senkt Cloud-Kosten drastisch und vereinfacht den Kubernetes-Betrieb

Thousands
Ersparnis pro Monat
Thousands
Monatliche Ersparnis bei den Cloud-Kosten
<10%
Ressourcenauslastung überdimensionierter Nodes vor der Optimierung
Riftweaver

Wie ein einzelner DevOps Engineer Riftweaver mit PerfectScale skaliert

59%
Reduktion des CPU-Throttlings
6
Optimierte kritische APIs
80,000+
Game-Downloads