PerfectScalePerfectScale

Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.

Comment la SNCF a éliminé le gaspillage K8s et renforcé sa fiabilité à grande échelle

Le premier opérateur ferroviaire européen a absorbé 30 % de workloads en plus sans augmenter ses dépenses cloud, tout en améliorant la stabilité de plus de 250 clusters

The Challenge

La SNCF exploite le réseau ferroviaire national français et des services de mobilité à l'international (TGV, OUIGO, Eurostar, TER, Transilien, Keolis), avec Kubernetes au cœur de la billetterie, des horaires, des services à bord et de la logistique en temps réel, sur des centaines de clusters. Le right-sizing manuel via Datadog, Prometheus et des ateliers FinOps ne pouvait pas passer à l'échelle sur plus de 200 projets et jusqu'à 250 clusters, dont certains hébergent plus de 1 000 workloads. Le surprovisionnement était généralisé : les ingénieurs privilégiaient par défaut la sécurité en production, où toute optimisation comportait un risque réel de perturbation. Les analyses basées sur Datadog surestimaient souvent l'utilisation en raison d'effets d'agrégation, ce qui érodait la confiance dans les recommandations. Après la Coupe du monde de rugby et les Jeux olympiques de 2024, la direction a imposé un recentrage sur l'efficience des coûts numériques, sans freiner la modernisation.

The Solution

La SNCF a découvert PerfectScale à la KubeCon et l'a adopté comme control plane d'optimisation de niveau production. Le facteur différenciant : des recommandations de right-sizing in-place, tenant compte du risque, applicables en toute sécurité en production. PerfectScale s'intègre via des Custom Resources et ArgoCD, ce qui permet d'activer Autopilot au niveau du namespace, à la manière d'un feature flag. La SNCF a déployé automatiquement une configuration Autopilot standard sur les environnements hors production, avec des dérogations fines pour les cas particuliers. En production, l'automatisation a été introduite progressivement, en commençant par la stack cloud-native (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), avant de s'étendre aux namespaces applicatifs. L'optimisation est devenue une gouvernance continue plutôt qu'un projet ponctuel.

Results

  • Absorption d'environ 30 % d'utilisation Kubernetes en plus sans hausse des coûts cloud — facturation de septembre 2025 inférieure à celle de janvier 2025 malgré un volume supérieur
  • Économies annualisées estimées à environ 500 K€, dont environ 350 K€ issus des environnements hors production grâce à l'automatisation
  • Automatisation activée sur 45 % des namespaces hors production, 1 % des namespaces de production et 100 % de la stack cloud-native dans les deux environnements
  • Stabilité des clusters améliorée grâce à la redistribution des ressources selon les courbes de demande et le risque de défaillance, réduisant les situations de CPU starvation
  • Élimination des cycles de right-sizing fondés sur des connaissances informelles, remplacés par un comportement automatisé et gouverné
  • Aucun développement sur mesure nécessaire, grâce à la standardisation sur PerfectScale pour une optimisation sûre en production

PerfectScale nous a permis d'augmenter la capacité sans augmenter les coûts. Concrètement, nous avons absorbé 30 % d'utilisation en plus, gratuitement.

Thomas Comtet, Senior Staff Engineer, SNCF

À propos de la SNCF

La SNCF est l'un des plus grands groupes de transport européens : elle exploite le réseau ferroviaire national français et des services de mobilité dans le monde entier à travers des marques comme TGV, OUIGO, Eurostar, TER, Transilien et Keolis. Avec plus de 270 000 collaborateurs et plus de 40 milliards d'euros de chiffre d'affaires annuel, la SNCF s'appuie sur des systèmes numériques à haute disponibilité pour la billetterie, les horaires, les services à bord et la logistique opérationnelle en temps réel. Kubernetes sous-tend nombre de ces services, sur des centaines de clusters exécutés dans des environnements critiques. Dans le cadre d'une démarche de modernisation numérique et d'efficience à l'échelle du groupe, la SNCF devait maîtriser le coût croissant de ces clusters sans sacrifier la résilience.

Le défi

L'équipe plateforme se trouvait prise entre les promesses FinOps de Kubernetes, la tolérance au risque des développeurs en matière de fiabilité et de disponibilité, et une pression financière croissante de la direction. Le right-sizing manuel exigeait des connaissances informelles, de longues réunions et des redémarrages — et chaque effort d'optimisation devait être repris à zéro à chaque changement de responsable ou rotation d'ingénieurs. Les analyses basées sur Datadog surestimaient souvent l'utilisation en raison d'effets d'agrégation, alimentant la méfiance envers les recommandations. Le travail était irrégulier, lent, et impossible à mener à bien sur l'ensemble du périmètre : plus de 200 projets et jusqu'à 250 clusters. La SNCF avait besoin d'un système capable de fournir des recommandations de right-sizing fiables, fondées sur le comportement réel ; de fonctionner en toute sécurité en production ; de réduire les coûts sans compromettre la fiabilité ; d'opérer en continu, et non ponctuellement ; et de passer à l'échelle sur l'ensemble des clusters et des équipes, sans friction. Après la Coupe du monde de rugby et les Jeux olympiques de 2024 en France, la SNCF a reçu pour mission de se recentrer sur l'efficience des coûts numériques sans ralentir la modernisation de sa plateforme ferroviaire.

Adopter PerfectScale comme control plane de niveau production

La SNCF a découvert PerfectScale, désormais PerfectScale by DoiT, à la KubeCon. Le facteur différenciant n'était pas un dashboard de plus, mais la capacité à générer des recommandations de right-sizing in-place, tenant compte du risque, applicables en toute sécurité dans des environnements de production. Comme le résume Thomas Comtet, Senior Staff Engineer à la SNCF : "Ce qui nous a convaincus, c'est que PerfectScale ne nous demandait pas de nous fier à la théorie. L'outil nous montrait exactement ce qui pouvait changer sans nuire à la stabilité."

Des recommandations à l'automatisation avec ArgoCD

PerfectScale by DoiT s'intègre via des Custom Resources et ArgoCD, ce qui permet d'activer Autopilot au niveau du namespace, à la manière d'un feature flag. La SNCF a défini une configuration Autopilot standard et l'a déployée automatiquement sur tous les environnements hors production, tout en autorisant des dérogations fines pour les cas particuliers. En production, l'automatisation a été introduite progressivement, en commençant par l'ensemble de la stack cloud-native (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), avec validation de la fiabilité avant l'extension aux namespaces applicatifs.

L'optimisation érigée en gouvernance

Plutôt que de mener une initiative de right-sizing ponctuelle, la SNCF a fait de l'optimisation un comportement opérationnel continu, appliqué automatiquement via la gouvernance avec PerfectScale by DoiT. Parce que les recommandations reposent sur le comportement observé des workloads et sont appliquées par l'automatisation, elles ne font plus l'objet de débats : elles s'exécutent comme une politique. L'équipe PerfectScale avait également anticipé que le resizing in-place éliminerait le coût caché des optimisations avec redémarrage — un travail qui aurait sinon obligé la SNCF à développer cette capacité sur mesure ou à former des dizaines d'équipes pour l'appliquer en toute sécurité.

Les résultats

Depuis l'adoption, l'utilisation de Kubernetes à la SNCF a augmenté d'environ 30 % sans hausse des coûts cloud. La facturation cloud réelle de septembre 2025 était inférieure à celle de janvier 2025, malgré un volume supérieur. Les économies annualisées sont estimées à environ 500 K€ par an, dont la majeure partie (~350 K€) provient des environnements hors production grâce à l'automatisation. La SNCF active aujourd'hui l'automatisation sur 45 % des namespaces hors production, 1 % des namespaces de production et 100 % de la stack cloud-native dans les deux environnements — autrement dit, l'infrastructure partagée la plus critique des clusters est gouvernée automatiquement. La stabilité des clusters s'est également améliorée : PerfectScale redistribue les ressources selon les courbes de demande et le risque de défaillance, ce qui réduit la probabilité de CPU starvation tout en éliminant les capacités excédentaires.

Et ensuite ?

La SNCF prévoit d'étendre l'automatisation à d'autres namespaces hors production, puis progressivement à des environnements de production sélectionnés pour les équipes pionnières. L'équipe évalue également le right-sizing in-place des pods afin de minimiser encore les perturbations liées aux redémarrages et d'améliorer la stabilité des workloads. Au-delà de sa propre feuille de route, la SNCF est devenue un contributeur actif de l'évolution du produit : des améliorations récentes comme la prise en charge des workloads Java et le right-sizing in-place des pods découlent directement de ses retours. "Nous l'avons prouvé en production", conclut Thomas Comtet. "Nous passons désormais à l'échelle ce qui fonctionne, et nous contribuons à le rendre encore meilleur."

Découvrez comment PerfectScale améliore l'efficience de Kubernetes

Voyez comment PerfectScale aide les équipes à ajuster leurs clusters au plus juste, réduire le gaspillage et améliorer les performances — sans réglage manuel.

More customer stories

PicnicAI

PicnicAI automatise 85 à 90 % de ses workloads Kubernetes et gagne en fiabilité avec PerfectScale by DoiT

85–90%
des workloads applicatifs désormais couverts par le redimensionnement automatisé
50%
de réduction approximative du temps consacré par l'équipe à la gestion de l'infrastructure
Stefanini

Stefanini réduit de 26 % ses coûts de compute Kubernetes grâce à PerfectScale by DoiT

26%
De réduction des coûts de compute Kubernetes
>60%
De réduction des coûts d'infrastructure au cours de l'année écoulée
OneFootball

PerfectScale by DoiT aide OneFootball à optimiser Kubernetes face au trafic football mondial à grande échelle

25%
De réduction des coûts d'infrastructure Kubernetes
80%
De réduction de l'effort d'ingénierie consacré à l'optimisation des coûts et au réglage de la résilience Kubernetes
Luma Health

Luma Health réduit ses coûts EKS de 40 % et libère des milliers d'heures d'ingénierie par an

90%
De temps en moins sur le rightsizing manuel de Kubernetes
40%
De réduction des coûts Amazon EKS
+1,700h/year
D'heures d'ingénierie réorientées vers la fiabilité et la performance
PlayHQ

PlayHQ optimise ses coûts Kubernetes multi-tenant

40%
De réduction des coûts Kubernetes hors production
40%
De réduction des coûts K8s hors production
20%
De réduction des coûts K8s en production
NOS

NOS divise ses coûts Kubernetes par deux et retrouve confiance dans l'optimisation

50%
Réduction des coûts
50%
De réduction des coûts sur le plus grand cluster
0%
De ressources inutilisées sur les node pools principaux
K1x

K1x réduit drastiquement ses coûts cloud et simplifie ses opérations Kubernetes

Thousands
D'économies par mois
Thousands
D'économies mensuelles sur les dépenses cloud
<10%
D'utilisation des ressources sur les nœuds surdimensionnés avant optimisation
Riftweaver

Un seul ingénieur DevOps pour faire évoluer Riftweaver, grâce à PerfectScale

59%
De réduction du throttling CPU
6
API critiques améliorées
80,000+
Téléchargements du jeu