PerfectScalePerfectScale

Diese Seite ist auch in English, Español, Français, Italiano, 日本語 und Português verfügbar.

Wie SNCF Kubernetes-Waste reduzierte und die Zuverlässigkeit im großen Maßstab steigerte

Europas größter Bahnbetreiber bewältigte 30 % mehr Workloads ohne zusätzliche Cloud-Ausgaben – bei verbesserter Stabilität über mehr als 250 Cluster hinweg

The Challenge

SNCF betreibt das nationale Schienennetz Frankreichs sowie globale Mobilitätsdienste (TGV, OUIGO, Eurostar, TER, Transilien, Keolis). Kubernetes bildet dabei das Fundament für Ticketing, Fahrpläne, Bordservices und Echtzeit-Logistik über Hunderte von Clustern hinweg. Manuelles Right-Sizing über Datadog, Prometheus und FinOps-Workshops ließ sich über 200+ Projekte und bis zu 250 Cluster – teils mit mehr als 1.000 Workloads – nicht skalieren. Überprovisionierung war weit verbreitet, weil Engineers in der Produktion auf Nummer sicher gingen: Optimierung barg dort ein reales Risiko von Betriebsstörungen. Datadog-basierte Analysen überschätzten die Nutzung aufgrund von Aggregationseffekten häufig, was das Vertrauen in Empfehlungen untergrub. Nach der Rugby-Weltmeisterschaft und den Olympischen Spielen 2024 forderte die Unternehmensführung eine Neuausrichtung auf digitale Kosteneffizienz – ohne die Modernisierung zu bremsen.

The Solution

SNCF entdeckte PerfectScale auf der KubeCon und führte es als produktionsreife Control Plane für die Optimierung ein. Der entscheidende Unterschied: risikobewusste In-Place-Right-Sizing-Empfehlungen, die sich sicher im laufenden Produktivbetrieb anwenden lassen. PerfectScale integriert sich über Custom Resources und ArgoCD, sodass Autopilot auf Namespace-Ebene als Feature Flag aktiviert werden kann. SNCF rollte eine Standard-Autopilot-Konfiguration automatisch über alle Nicht-Produktionsumgebungen aus – mit feingranularen Ausnahmen für Sonderfälle. In der Produktion wurde die Automatisierung schrittweise eingeführt: zunächst für den cloud-native Stack (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), anschließend für Anwendungs-Namespaces. Optimierung wurde so zur kontinuierlichen Governance statt zu einem befristeten Projekt.

Results

  • Rund 30 % mehr Kubernetes-Nutzung ohne höhere Cloud-Kosten bewältigt – die Abrechnung im September 2025 lag trotz höheren Volumens unter der vom Januar 2025
  • Rund 500.000 € jährliche Einsparungen erzielt, davon ca. 350.000 € durch Automatisierung in Nicht-Produktionsumgebungen
  • Automatisierung auf 45 % der Nicht-Produktions-Namespaces, 1 % der Produktions-Namespaces und 100 % des cloud-native Stacks in beiden Umgebungen aktiviert
  • Cluster-Stabilität durch Ressourcenverteilung nach Bedarfskurven und Ausfallrisiko verbessert und CPU-Engpässe reduziert
  • Right-Sizing-Zyklen auf Basis von implizitem Erfahrungswissen abgelöst und durch gesteuerte, automatisierte Abläufe ersetzt
  • Aufwendige Eigenentwicklungen vermieden – durch Standardisierung auf PerfectScale für sichere Optimierung in der Produktion

Mit PerfectScale konnten wir die Kapazität erhöhen, ohne dass die Kosten mitgewachsen sind. Wir haben faktisch 30 % mehr Nutzung zum Nulltarif bewältigt.

Thomas Comtet, Senior Staff Engineer, SNCF

SNCF im Überblick

SNCF ist einer der größten Transportkonzerne Europas und betreibt das nationale Schienennetz Frankreichs sowie globale Mobilitätsdienste unter Marken wie TGV, OUIGO, Eurostar, TER, Transilien und Keolis. Mit über 270.000 Mitarbeitenden und einem Jahresumsatz von mehr als 40 Mrd. € ist SNCF auf hochverfügbare digitale Systeme angewiesen, auf denen Ticketing, Fahrpläne, Bordservices und operative Echtzeit-Logistik basieren. Kubernetes bildet das Fundament vieler dieser Services – über Hunderte von Clustern in unternehmenskritischen Umgebungen. Im Zuge einer konzernweiten Initiative für digitale Modernisierung und Effizienz musste SNCF die steigenden Betriebskosten dieser Cluster in den Griff bekommen, ohne Abstriche bei der Ausfallsicherheit zu machen.

Die Herausforderung

Das Plattform-Team stand im Spannungsfeld zwischen den FinOps-Versprechen von Kubernetes, der Risikobereitschaft der Entwickler in puncto Zuverlässigkeit und Verfügbarkeit sowie dem wachsenden Kostendruck seitens der Unternehmensführung. Manuelles Right-Sizing erforderte implizites Erfahrungswissen, lange Meetings und Neustarts – und jede Optimierungsinitiative musste von vorne beginnen, sobald Verantwortlichkeiten wechselten oder Engineers rotierten. Datadog-basierte Analysen überschätzten die Nutzung aufgrund von Aggregationseffekten häufig, was zu Misstrauen gegenüber den Empfehlungen führte. Die Arbeit war inkonsistent, langsam und ließ sich über die gesamte Landschaft von 200+ Projekten und bis zu 250 Clustern nie abschließen. SNCF brauchte ein System, das vertrauenswürdige, verhaltensbasierte Right-Sizing-Erkenntnisse liefert, sicher in der Produktion arbeitet, Kosten senkt, ohne die Zuverlässigkeit zu gefährden, kontinuierlich statt punktuell agiert und sich reibungslos über Cluster und Teams hinweg skalieren lässt. Nach der Rugby-Weltmeisterschaft und den Olympischen Spielen 2024 in Frankreich erhielt SNCF den Auftrag, sich wieder auf digitale Kosteneffizienz zu konzentrieren – ohne die Modernisierung der Bahnplattform zu verlangsamen.

PerfectScale als produktionsreife Control Plane

SNCF entdeckte PerfectScale, heute PerfectScale by DoiT, auf der KubeCon. Der entscheidende Unterschied war nicht ein weiteres Dashboard, sondern die Fähigkeit, risikobewusste In-Place-Right-Sizing-Empfehlungen zu generieren, die sich sicher in laufenden Produktionsumgebungen anwenden lassen. Thomas Comtet, Senior Staff Engineer bei SNCF, bringt es auf den Punkt: "Überzeugt hat uns, dass PerfectScale nicht von uns verlangt hat, der Theorie zu vertrauen. Es hat uns genau gezeigt, was sich ändern lässt, ohne die Stabilität zu gefährden."

Von Empfehlungen zur Automatisierung mit ArgoCD

PerfectScale by DoiT integriert sich über Custom Resources und ArgoCD, sodass Autopilot auf Namespace-Ebene als Feature Flag aktiviert werden kann. SNCF etablierte eine Standard-Autopilot-Konfiguration und rollte sie automatisch über alle Nicht-Produktionsumgebungen aus – mit der Möglichkeit feingranularer Ausnahmen für Sonderfälle. In der Produktion führte SNCF die Automatisierung schrittweise ein: zunächst für den gesamten cloud-native Stack (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), dann – nach validierter Zuverlässigkeit – für Anwendungs-Namespaces.

Optimierung als Governance verankern

Statt eine befristete Right-Sizing-Initiative durchzuführen, machte SNCF die Optimierung zu einem kontinuierlichen Betriebsprinzip, das mit PerfectScale by DoiT automatisch über Governance durchgesetzt wird. Da die Empfehlungen auf dem beobachteten Verhalten der Workloads basieren und automatisiert umgesetzt werden, werden sie nicht mehr diskutiert, sondern als Policy ausgeführt. Das PerfectScale-Team hatte zudem vorausgesehen, dass In-Place-Resizing die versteckten Kosten neustartbasierter Optimierungen beseitigen würde – eine Fähigkeit, die SNCF andernfalls selbst hätte entwickeln oder Dutzenden Teams für den sicheren Einsatz hätte vermitteln müssen.

Die Ergebnisse

Seit der Einführung ist die Kubernetes-Nutzung von SNCF um rund 30 % gestiegen – ohne höhere Cloud-Kosten. Die tatsächliche Cloud-Abrechnung im September 2025 lag trotz des höheren Volumens unter der vom Januar 2025. Die jährlichen Einsparungen werden auf rund 500.000 € geschätzt, wobei der Großteil (ca. 350.000 €) durch Automatisierung in Nicht-Produktionsumgebungen erzielt wird. Aktuell hat SNCF die Automatisierung auf 45 % der Nicht-Produktions-Namespaces, 1 % der Produktions-Namespaces und 100 % des cloud-native Stacks in beiden Umgebungen aktiviert – die kritischste gemeinsam genutzte Infrastruktur über alle Cluster hinweg wird damit automatisch gesteuert. Auch die Cluster-Stabilität verbesserte sich, da PerfectScale die Ressourcen anhand von Bedarfskurven und Ausfallrisiken neu verteilte, so die Wahrscheinlichkeit von CPU-Engpässen senkte und zugleich überschüssige Kapazitäten abbaute.

Der Blick nach vorn

SNCF plant, die Automatisierung auf weitere Nicht-Produktions-Namespaces auszuweiten und schrittweise auch auf ausgewählte Produktionsumgebungen für Early Adopters zu übertragen. Zudem evaluiert das Team In-Place-Pod-Right-Sizing, um neustartbedingte Unterbrechungen weiter zu minimieren und die Stabilität der Workloads zu erhöhen. Über die eigene Roadmap hinaus ist SNCF zu einem aktiven Mitgestalter der Produktentwicklung von PerfectScale geworden – jüngste Erweiterungen wie die Unterstützung von Java-Workloads und In-Place-Pod-Right-Sizing gehen direkt auf das Feedback von SNCF zurück. "Wir haben es in der Produktion bewiesen", sagt Thomas Comtet. "Jetzt skalieren wir, was funktioniert, und helfen dabei, es noch besser zu machen."

Erfahren Sie, wie PerfectScale die Kubernetes-Effizienz steigert

Entdecken Sie, wie PerfectScale Teams beim Right-Sizing von Clustern unterstützt, Waste reduziert und die Performance verbessert – ganz ohne manuelles Tuning.

More customer stories

PicnicAI

PicnicAI automatisiert 85–90 % der Kubernetes-Workloads – und gewinnt Zuverlässigkeit mit PerfectScale by DoiT

85–90%
der Anwendungs-Workloads jetzt durch automatisiertes Resizing abgedeckt
50%
weniger Zeitaufwand des Infrastruktur-Teams für Infrastruktur (ca.)
Stefanini

26 % weniger Kubernetes-Compute-Kosten: Stefanini optimiert mit PerfectScale by DoiT

26%
Weniger Kubernetes-Compute-Kosten
>60%
Geringere Infrastrukturkosten im letzten Jahr
OneFootball

Kubernetes-Optimierung im Takt des Weltfußballs

25%
weniger Kosten für die Kubernetes-Infrastruktur
80%
weniger Engineering-Aufwand für Kubernetes-Kostenoptimierung und Resilienz-Tuning
Luma Health

Luma Health senkt EKS-Kosten um 40 % und gewinnt jährlich Tausende Engineering-Stunden zurück

90%
Weniger Zeit für manuelles Kubernetes-Right-Sizing
40%
Weniger Amazon-EKS-Kosten
+1,700h/year
Engineering-Stunden für Zuverlässigkeit und Performance
PlayHQ

PlayHQ optimiert Kubernetes-Kosten im Multi-Tenant-Betrieb

40%
Reduzierung der Non-Production-Kubernetes-Kosten
40%
Reduzierung der Non-Production-K8s-Kosten
20%
Reduzierung der Production-K8s-Kosten
NOS

NOS halbiert Kubernetes-Kosten und gewinnt Vertrauen in Optimierung zurück

50%
Kostensenkung
50%
Kostensenkung auf dem größten Cluster
0%
Ungenutzte Ressourcen auf zentralen Node-Pools
K1x

K1x senkt Cloud-Kosten drastisch und vereinfacht den Kubernetes-Betrieb

Thousands
Ersparnis pro Monat
Thousands
Monatliche Ersparnis bei den Cloud-Kosten
<10%
Ressourcenauslastung überdimensionierter Nodes vor der Optimierung
Riftweaver

Wie ein einzelner DevOps Engineer Riftweaver mit PerfectScale skaliert

59%
Reduktion des CPU-Throttlings
6
Optimierte kritische APIs
80,000+
Game-Downloads