PerfectScalePerfectScale

Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.

Come SNCF ha ridotto gli sprechi su K8s aumentando l'affidabilità su larga scala

Il più grande operatore ferroviario europeo ha assorbito il 30% di workloads in più senza aumentare la spesa cloud, migliorando la stabilità su oltre 250 cluster

The Challenge

SNCF gestisce la rete ferroviaria nazionale francese e servizi di mobilità a livello globale (TGV, OUIGO, Eurostar, TER, Transilien, Keolis), con Kubernetes alla base di biglietteria, orari, servizi di bordo e logistica in tempo reale su centinaia di cluster. Il right-sizing manuale tramite Datadog, Prometheus e workshop FinOps non poteva scalare su oltre 200 progetti e fino a 250 cluster, alcuni dei quali con più di 1.000 workloads. L'over-provisioning era diffuso perché in produzione gli Engineers sceglievano per default la prudenza, dato che l'ottimizzazione comportava un rischio reale di interruzioni. Le analisi basate su Datadog spesso sovrastimavano l'utilizzo per effetto dell'aggregazione, minando la fiducia nelle raccomandazioni. Dopo la Coppa del Mondo di Rugby e i Giochi Olimpici del 2024, la direzione ha imposto un nuovo focus sull'efficienza dei costi digitali senza rallentare la modernizzazione.

The Solution

SNCF ha scoperto PerfectScale a KubeCon e lo ha adottato come control plane di ottimizzazione di livello production. Il fattore differenziante è stata la capacità di generare raccomandazioni di right-sizing in-place che tengono conto del rischio, applicabili in sicurezza in ambienti di produzione live. PerfectScale si integra tramite Custom Resources e ArgoCD, consentendo di attivare Autopilot a livello di namespace come feature flag. SNCF ha distribuito automaticamente una configurazione Autopilot standard in tutti gli ambienti non di produzione, con override granulari per i casi limite. In produzione, l'automazione è stata introdotta gradualmente, partendo dallo stack cloud-native (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), per poi estendersi ai namespace applicativi. L'ottimizzazione è diventata governance continua anziché un progetto a termine.

Results

  • Assorbito circa il 30% di utilizzo Kubernetes in più senza aumentare i costi cloud: la fatturazione di settembre 2025 è risultata inferiore a quella di gennaio 2025 nonostante i volumi più elevati
  • Stimati circa 500.000 € di risparmi annualizzati, di cui circa 350.000 € dagli ambienti non di produzione grazie all'automazione
  • Attivata l'automazione sul 45% dei namespace non di produzione, sull'1% dei namespace di produzione e sul 100% dello stack cloud-native in entrambi gli ambienti
  • Migliorata la stabilità dei cluster ridistribuendo le risorse in base alle curve di domanda e al rischio di guasto, riducendo la CPU starvation
  • Eliminati i cicli di right-sizing basati su conoscenze tribali, sostituiti da comportamenti automatizzati e governati
  • Evitato il carico di sviluppo custom standardizzando su PerfectScale per un'ottimizzazione sicura in produzione

PerfectScale ci ha permesso di aumentare la capacità senza far crescere i costi. In pratica abbiamo assorbito il 30% di utilizzo in più a costo zero.

Thomas Comtet, Senior Staff Engineer, SNCF

Chi è SNCF

SNCF è uno dei maggiori gruppi di trasporto europei: gestisce la rete ferroviaria nazionale francese e servizi di mobilità a livello globale attraverso marchi come TGV, OUIGO, Eurostar, TER, Transilien e Keolis. Con oltre 270.000 dipendenti e più di 40 miliardi di euro di fatturato annuo, SNCF si affida a sistemi digitali ad alta disponibilità per biglietteria, orari, servizi di bordo e logistica operativa in tempo reale. Kubernetes è alla base di molti di questi servizi, distribuiti su centinaia di cluster in ambienti mission-critical. Nell'ambito di una spinta aziendale verso la modernizzazione e l'efficienza digitale, SNCF doveva tenere sotto controllo i costi crescenti di questi cluster senza sacrificare la resilienza.

La sfida

Il team di piattaforma si trovava stretto tra le promesse FinOps di Kubernetes, la tolleranza al rischio degli sviluppatori in materia di affidabilità e uptime e la crescente pressione finanziaria della direzione. Il right-sizing manuale richiedeva conoscenze tribali, riunioni interminabili e riavvii — e ogni iniziativa di ottimizzazione doveva ripartire da zero a ogni cambio di ownership o rotazione degli Engineers. Le analisi basate su Datadog spesso sovrastimavano l'utilizzo per effetto dell'aggregazione, generando sfiducia nelle raccomandazioni. Il lavoro era incoerente, lento e impossibile da completare sull'intero perimetro di oltre 200 progetti e fino a 250 cluster. SNCF aveva bisogno di un sistema in grado di fornire raccomandazioni di right-sizing affidabili e basate sul comportamento reale; operare in sicurezza in produzione; ridurre i costi senza compromettere l'affidabilità; funzionare in modo continuo, non episodico; e scalare su cluster e team senza attriti. Dopo la Coppa del Mondo di Rugby e i Giochi Olimpici del 2024 in Francia, a SNCF è stato chiesto di rimettere al centro l'efficienza dei costi digitali senza rallentare la modernizzazione della piattaforma ferroviaria.

L'adozione di PerfectScale come control plane production-grade

SNCF ha scoperto PerfectScale, oggi PerfectScale by DoiT, a KubeCon. Il fattore differenziante non era l'ennesima dashboard, ma la capacità di generare raccomandazioni di right-sizing in-place che tengono conto del rischio, applicabili in sicurezza in ambienti di produzione live. Come afferma Thomas Comtet, Senior Staff Engineer di SNCF: "Ciò che ci ha convinto è che PerfectScale non ci chiedeva di fidarci della teoria. Ci mostrava esattamente cosa poteva cambiare senza compromettere la stabilità."

Dalle raccomandazioni all'automazione con ArgoCD

PerfectScale by DoiT si integra tramite Custom Resources e ArgoCD, così che Autopilot possa essere attivato a livello di namespace come feature flag. SNCF ha definito una configurazione Autopilot standard e l'ha distribuita automaticamente in tutti gli ambienti non di produzione, mantenendo la possibilità di override granulari per i casi limite. In produzione, SNCF ha introdotto l'automazione in modo graduale, partendo dall'intero stack cloud-native (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), e ne ha validato l'affidabilità prima di estenderla ai namespace applicativi.

L'ottimizzazione integrata nella governance

Invece di condurre un'iniziativa di right-sizing a termine, SNCF ha trasformato l'ottimizzazione in un comportamento operativo continuo, applicato automaticamente attraverso la governance con PerfectScale by DoiT. Poiché le raccomandazioni si basano sul comportamento osservato dei workloads e vengono applicate tramite automazione, non sono più oggetto di discussione ma vengono eseguite come policy. Il team di PerfectScale aveva inoltre previsto che il resizing in-place avrebbe eliminato il costo nascosto delle ottimizzazioni basate sui riavvii — un lavoro che altrimenti avrebbe richiesto a SNCF di sviluppare internamente questa capacità o di formare decine di team per applicarla in sicurezza.

I risultati

Dall'adozione, l'utilizzo di Kubernetes in SNCF è cresciuto di circa il 30% senza alcun aumento dei costi cloud. La fatturazione cloud effettiva di settembre 2025 è risultata inferiore a quella di gennaio 2025, nonostante i volumi più elevati. I risparmi annualizzati sono stimati in circa 500.000 € l'anno, la maggior parte dei quali (~350.000 €) proveniente dagli ambienti non di produzione grazie all'automazione. Oggi SNCF attiva l'automazione sul 45% dei namespace non di produzione, sull'1% dei namespace di produzione e sul 100% dello stack cloud-native in entrambi gli ambienti: l'infrastruttura condivisa più critica tra i cluster è quindi governata in modo automatico. Anche la stabilità dei cluster è migliorata, perché PerfectScale ha ridistribuito le risorse in base alle curve di domanda e al rischio di guasto, riducendo la probabilità di CPU starvation ed eliminando al contempo la capacità in eccesso.

I prossimi passi

SNCF prevede di continuare a estendere l'automazione ad altri namespace non di produzione e, gradualmente, a specifici ambienti di produzione per gli early adopter. Il team sta inoltre valutando il right-sizing in-place dei pod per ridurre ulteriormente le interruzioni legate ai riavvii e migliorare la stabilità dei workloads. Oltre alla propria roadmap di adozione, SNCF contribuisce oggi attivamente all'evoluzione del prodotto PerfectScale: miglioramenti recenti come il supporto dei workloads Java e il right-sizing in-place dei pod sono stati influenzati direttamente dal feedback di SNCF. "L'abbiamo dimostrato in produzione", afferma Comtet. "Ora stiamo scalando ciò che funziona e contribuendo a renderlo ancora migliore."

Scopra come PerfectScale migliora l'efficienza di Kubernetes

Scopra come PerfectScale aiuta i team a fare right-sizing dei cluster, ridurre gli sprechi e migliorare le prestazioni senza interventi manuali.

More customer stories

PicnicAI

PicnicAI automatizza l'85-90% dei workload Kubernetes e migliora l'affidabilità con PerfectScale by DoiT

85–90%
dei workload applicativi ora coperti dal resizing automatico
50%
riduzione approssimativa del tempo che il team infrastruttura dedica all'infrastruttura
Stefanini

Stefanini taglia del 26% i costi di compute Kubernetes con PerfectScale by DoiT

26%
Riduzione dei costi di compute Kubernetes
>60%
Riduzione dei costi di infrastruttura nell'ultimo anno
OneFootball

PerfectScale by DoiT aiuta OneFootball a ottimizzare Kubernetes per il traffico calcistico globale su larga scala

25%
di riduzione dei costi dell'infrastruttura Kubernetes
80%
di riduzione del lavoro di engineering dedicato all'ottimizzazione dei costi e al tuning della resilienza su Kubernetes
Luma Health

Luma Health taglia del 40% i costi di EKS e libera migliaia di ore di engineering all'anno

90%
Tempo in meno sul rightsizing manuale di Kubernetes
40%
Riduzione dei costi di Amazon EKS
+1,700h/year
Ore di engineering reindirizzate ad affidabilità e prestazioni
PlayHQ

PlayHQ ottimizza i costi Kubernetes multi-tenant

40%
Riduzione dei costi Kubernetes non-production
40%
Riduzione dei costi K8s non-production
20%
Riduzione dei costi K8s in produzione
NOS

NOS dimezza i costi Kubernetes e ricostruisce la fiducia nell'ottimizzazione

50%
Riduzione dei costi
50%
Riduzione dei costi sul cluster più grande
0%
Risorse inattive sui node pool principali
K1x

K1x abbatte i costi cloud e semplifica le operazioni Kubernetes

Thousands
Risparmio mensile
Thousands
Risparmio mensile sulla spesa cloud
<10%
Utilizzo delle risorse sui nodi sovradimensionati prima dell'ottimizzazione
Riftweaver

Come PerfectScale permette a un team DevOps di una sola persona di scalare Riftweaver

59%
Riduzione del throttling della CPU
6
API critiche migliorate
80,000+
Download del gioco