PerfectScalePerfectScale

Diese Seite ist auch in English, Español, Français, Italiano, 日本語 und Português verfügbar.

NOS halbiert Kubernetes-Kosten und gewinnt Vertrauen in Optimierung zurück

Wie Portugals führender Telekommunikationsanbieter seine K8s-Ausgaben in einer komplexen Multi-Cluster-Umgebung sicher senkte

PerfectScale
NOS

The Challenge

Mit dem Wachstum der Kubernetes-Landschaft von NOS über eine hybride On-Prem- und Google-Cloud-Umgebung hinweg wurde die Optimierung zum großen Schmerzpunkt. Observability-Tools wie Prometheus und Grafana lieferten zwar Rohmetriken, aber keine umsetzbaren Empfehlungen – beim Right-Sizing mussten die Engineers raten. Frühere manuelle Optimierungsversuche führten zu Abstürzen und SLA-Verstößen und untergruben das Vertrauen in Optimierungsmaßnahmen. FinOps-Teams verbrachten zudem jeden Monat mehrere Tage damit, fragmentierte Kostendaten zusammenzutragen, während Overprovisioning zur Risikovermeidung der Standard blieb.

The Solution

NOS führte PerfectScale zunächst in den Entwicklungs-Clustern ein, wo die Automatisierung vier Monate lang unauffällig lief – bei sinkenden Kosten und ohne einen einzigen Vorfall. Nach diesem Erfolg weitete NOS die Automatisierung auf Plattform-Komponenten wie Ingress Controller, Cert Manager und den Observability-Stack aus. In der Produktion wenden SREs die Empfehlungen manuell an – gestützt auf kontextbezogene Nachweise von PerfectScale, die sicherstellen, dass Änderungen die Performance nicht beeinträchtigen. InfraFit identifiziert optimale Node-Typen, damit der Cluster Autoscaler effizient und im Takt des Nutzer-Traffics skaliert.

Results

  • Kosten auf dem größten und geschäftskritischsten Cluster von NOS (Haupt-API-Cluster) um über 50 % gesenkt
  • 0 % ungenutzte Ressourcen auf mehreren zentralen Node-Pools durch InfraFit und Right-Sizing-Automatisierung erreicht
  • Performance-Probleme wie Out-of-Memory-Kills und CPU-Throttling aufgedeckt und behoben
  • SLA-Verstöße eliminiert und die Gesamtperformance der Anwendungen verbessert
  • 2–3 volle Tage pro Monat zurückgewonnen, die zuvor für FinOps-Reporting und Meetings anfielen
  • Teamübergreifendes Vertrauen in sichere, intelligente Kubernetes-Optimierung wieder aufgebaut
  • Unternehmensweite Nutzung durch Platform Engineers, SREs, Entwickler, Financial Controller und Management ermöglicht

Ich habe an das Produkt geglaubt, als ich es zum ersten Mal gesehen habe. Ich zeige es heute noch jedem. Es war die einzige Lösung, die intelligente Automatisierung mit echten Kosteneinsparungen verbunden hat – ohne die Performance aufs Spiel zu setzen.

Joao Soares, Platform Engineering Lead, NOS

Über NOS

NOS ist einer der führenden Telekommunikationsanbieter Portugals und versorgt Millionen von Kunden mit Netz-, Internet- und Entertainment-Diensten. Vor fast einem Jahrzehnt setzte NOS auf Containerisierung, um Overhead zu reduzieren und schneller zu werden – von virtuellen Maschinen über Docker und Rancher bis hin zu Kubernetes, das unternehmensweit ausgerollt wurde. Heute betreibt das Unternehmen ein hybrides Setup: Telco-spezifische Systeme laufen weiterhin on-prem, skalierbare Workloads auf Google Cloud. Das Ziel ist unverändert: Agilität und Performance liefern und dabei die Infrastrukturkosten im Griff behalten.

Die Herausforderung: Manuelle Optimierung wurde zum Risiko

Mit der Weiterentwicklung der Kubernetes-Architektur von NOS wuchs auch die Komplexität. Die Teams nutzten Prometheus und Grafana, doch diese Tools lieferten nur Rohmetriken – ohne die Transparenz und Empfehlungen, die für sichere, fundierte Entscheidungen nötig sind, besonders wenn SLAs auf dem Spiel stehen. Ohne klare Orientierung mussten die Engineers raten. Nach mehreren gescheiterten manuellen Right-Sizing-Versuchen, die Abstürze und SLA-Verstöße verursachten, zogen sich die Teams zurück. "Entwickler haben Änderungen nach eigenem Ermessen vorgenommen – und es ging nach hinten los", sagt Joao Soares, Platform Engineering Lead bei NOS. Hinzu kam, dass FinOps-Teams jeden Monat mehrere Tage damit verbrachten, fragmentierte Daten für Reports zusammenzutragen – Probleme zu erkennen oder Budget-Reviews vorzubereiten war entsprechend schwierig.

PerfectScale auf der KubeCon entdeckt

Auf der KubeCon Europe 2024 in Paris suchte Soares nach genau einer Sache: einem sichereren Weg, Kubernetes-Kosten zu senken. PerfectScale stach sofort heraus. "Ich habe an das Produkt geglaubt, als ich es zum ersten Mal gesehen habe. Ich zeige es heute noch jedem", sagt Soares. "Es war die einzige Lösung, die intelligente Automatisierung mit echten Kosteneinsparungen verbunden hat – ohne die Performance aufs Spiel zu setzen."

Die Lösung: Intelligente, automatisierte Optimierung, die Vertrauen schafft

PerfectScale wurde zunächst in den Entwicklungs-Clustern ausgerollt, wo die Automatisierung vier Monate lang unauffällig lief – die Kosten sanken, ohne einen einzigen Vorfall oder eine einzige Beschwerde. Nach diesem Erfolg begann NOS, Plattform-Komponenten wie Ingress Controller, Cert Manager und den Observability-Stack zu automatisieren. In der Produktion wenden die SREs die Empfehlungen weiterhin manuell an, doch das Vertrauen wächst: PerfectScale liefert die kontextbezogenen Nachweise, die sie brauchen, um sicher zu sein, dass Änderungen keine Performance-Probleme verursachen.

Die Ergebnisse: Kosten, Performance und Zeitersparnis

NOS senkte die Kosten auf dem größten und geschäftskritischsten Cluster – dem Haupt-API-Cluster, der zur Risikovermeidung stark überprovisioniert war – um über 50 %. PerfectScale deckte übersehene Probleme wie Out-of-Memory-Kills und CPU-Throttling auf und lieferte gezielte Empfehlungen zu deren Behebung. Mit InfraFit identifizierte NOS optimale Node-Typen, sodass der Cluster Autoscaler effizienter skaliert. "Wir sehen genau die Sinuskurve, die wir wollten – ein perfektes Hoch- und Runterskalieren im Takt des Nutzer-Traffics. In Kombination mit automatisiertem Workload-Right-Sizing laufen mehrere zentrale Node-Pools jetzt mit 0 % ungenutzten Ressourcen", sagt Soares. Auch das FinOps-Reporting beschleunigte sich deutlich – zwei bis drei Tage pro Monat wurden frei. "Heute gehe ich in Meetings und weiß: Alles ist im grünen Bereich", sagt Soares.

Unternehmensweite Nutzung

PerfectScale steuert heute die täglichen Entscheidungen bei NOS und ersetzt verstreute Tools und Rätselraten durch eine einzige vertrauenswürdige Plattform. Platform Engineers automatisieren damit Cluster- und Ressourcenmanagement, SREs wenden Empfehlungen auf geschäftskritische Services an, Entwickler provisionieren passgenau von Dev bis Prod, Financial Controller überwachen Budget und Ausgaben, und das Management behält Effizienz und teamübergreifende Zusammenarbeit im Blick. Diese gemeinsame Transparenz hat die Zusammenarbeit verbessert und Kubernetes-Optimierung im gesamten Unternehmen zum festen Bestandteil des Tagesgeschäfts gemacht.

Erfahren Sie, wie PerfectScale die Kubernetes-Effizienz steigert

Entdecken Sie, wie PerfectScale Teams dabei hilft, Cluster passgenau zu dimensionieren, Verschwendung zu reduzieren und die Performance zu verbessern – ganz ohne manuelles Tuning.

More customer stories

PicnicAI

PicnicAI automatisiert 85–90 % der Kubernetes-Workloads – und gewinnt Zuverlässigkeit mit PerfectScale by DoiT

85–90%
der Anwendungs-Workloads jetzt durch automatisiertes Resizing abgedeckt
50%
weniger Zeitaufwand des Infrastruktur-Teams für Infrastruktur (ca.)
Stefanini

26 % weniger Kubernetes-Compute-Kosten: Stefanini optimiert mit PerfectScale by DoiT

26%
Weniger Kubernetes-Compute-Kosten
>60%
Geringere Infrastrukturkosten im letzten Jahr
OneFootball

Kubernetes-Optimierung im Takt des Weltfußballs

25%
weniger Kosten für die Kubernetes-Infrastruktur
80%
weniger Engineering-Aufwand für Kubernetes-Kostenoptimierung und Resilienz-Tuning
Luma Health

Luma Health senkt EKS-Kosten um 40 % und gewinnt jährlich Tausende Engineering-Stunden zurück

90%
Weniger Zeit für manuelles Kubernetes-Right-Sizing
40%
Weniger Amazon-EKS-Kosten
+1,700h/year
Engineering-Stunden für Zuverlässigkeit und Performance
PlayHQ

PlayHQ optimiert Kubernetes-Kosten im Multi-Tenant-Betrieb

40%
Reduzierung der Non-Production-Kubernetes-Kosten
40%
Reduzierung der Non-Production-K8s-Kosten
20%
Reduzierung der Production-K8s-Kosten
SNCF

Wie SNCF Kubernetes-Waste reduzierte und die Zuverlässigkeit im großen Maßstab steigerte

30%
Mehr Workloads bei gleichbleibenden Kosten
~€500K
Geschätzte jährliche Einsparungen
250
Optimierte Cluster
K1x

K1x senkt Cloud-Kosten drastisch und vereinfacht den Kubernetes-Betrieb

Thousands
Ersparnis pro Monat
Thousands
Monatliche Ersparnis bei den Cloud-Kosten
<10%
Ressourcenauslastung überdimensionierter Nodes vor der Optimierung
Riftweaver

Wie ein einzelner DevOps Engineer Riftweaver mit PerfectScale skaliert

59%
Reduktion des CPU-Throttlings
6
Optimierte kritische APIs
80,000+
Game-Downloads