PerfectScalePerfectScale

Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

Como a SNCF cortou desperdício em K8s e aumentou a confiabilidade em escala

A maior operadora ferroviária da Europa absorveu 30% mais workloads sem aumentar os gastos com nuvem, melhorando a estabilidade em mais de 250 clusters

The Challenge

A SNCF opera a rede ferroviária nacional da França e serviços globais de mobilidade (TGV, OUIGO, Eurostar, TER, Transilien, Keolis), com o Kubernetes sustentando venda de passagens, horários, serviços a bordo e logística em tempo real em centenas de clusters. O right-sizing manual via Datadog, Prometheus e workshops de FinOps não conseguia escalar por mais de 200 projetos e até 250 clusters, alguns hospedando mais de 1.000 workloads. O superprovisionamento era generalizado porque os engenheiros priorizavam a segurança em produção, onde otimizar trazia risco real de interrupção. As análises baseadas no Datadog frequentemente superestimavam o uso por conta de efeitos de agregação, minando a confiança nas recomendações. Após a Copa do Mundo de Rugby e os Jogos Olímpicos de 2024, a liderança determinou um novo foco na eficiência de custos digitais sem desacelerar a modernização.

The Solution

A SNCF conheceu o PerfectScale na KubeCon e o adotou como plano de controle de otimização pronto para produção. O grande diferencial eram as recomendações de right-sizing in-place e sensíveis ao risco, que podiam ser aplicadas com segurança diretamente em produção. O PerfectScale se integra via Custom Resources e ArgoCD, permitindo ativar o Autopilot no nível de namespace como uma feature flag. A SNCF implantou uma configuração padrão do Autopilot automaticamente em todos os ambientes de não produção, com ajustes granulares para casos específicos. Em produção, a automação foi introduzida gradualmente, começando pelo stack nativo da nuvem (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), antes de se estender aos namespaces de aplicações. A otimização virou governança contínua, e não um projeto com data para acabar.

Results

  • Absorveu cerca de 30% mais uso de Kubernetes sem aumento no custo de nuvem — a fatura de setembro de 2025 foi menor que a de janeiro de 2025, apesar do volume maior
  • Gerou economia anualizada estimada em ~€500 mil, sendo ~€350 mil vindos de ambientes de não produção via automação
  • Ativou a automação em 45% dos namespaces de não produção, 1% dos namespaces de produção e 100% do stack nativo da nuvem em ambos os ambientes
  • Melhorou a estabilidade dos clusters ao redistribuir recursos com base em curvas de demanda e risco de falha, reduzindo a escassez de CPU
  • Eliminou ciclos de right-sizing baseados em conhecimento tribal, substituindo-os por um comportamento automatizado e governado
  • Evitou o ônus de engenharia customizada ao padronizar o PerfectScale para otimização segura em produção

O PerfectScale nos permitiu aumentar a capacidade sem aumentar o custo. Na prática, absorvemos 30% mais uso de graça.

Thomas Comtet, Senior Staff Engineer, SNCF

Conheça a SNCF

A SNCF é um dos maiores grupos de transporte da Europa, operando a rede ferroviária nacional da França e serviços globais de mobilidade por meio de marcas como TGV, OUIGO, Eurostar, TER, Transilien e Keolis. Com mais de 270.000 colaboradores e receita anual superior a €40 bilhões, a SNCF depende de sistemas digitais de alta disponibilidade para venda de passagens, horários, serviços a bordo e logística operacional em tempo real. O Kubernetes sustenta muitos desses serviços em centenas de clusters rodando em ambientes de missão crítica. Como parte de um movimento de toda a empresa rumo à modernização e eficiência digital, a SNCF precisava controlar o custo crescente de operar esses clusters sem abrir mão da resiliência.

O desafio

A equipe de plataforma estava pressionada entre as promessas de FinOps do Kubernetes, a tolerância a risco dos desenvolvedores em relação a confiabilidade e disponibilidade, e a pressão financeira crescente da liderança. O right-sizing manual exigia conhecimento tribal, reuniões longas e reinicializações — e todo esforço de otimização precisava recomeçar do zero a cada mudança de responsável ou rotação de engenheiros. As análises baseadas no Datadog frequentemente superestimavam o uso por conta de efeitos de agregação, gerando desconfiança nas recomendações. O trabalho era inconsistente, lento e nunca conseguia cobrir toda a base de mais de 200 projetos e até 250 clusters. A SNCF precisava de um sistema que fornecesse inteligência de right-sizing confiável e baseada em comportamento; funcionasse com segurança em produção; reduzisse custos sem comprometer a confiabilidade; operasse de forma contínua, e não pontual; e escalasse entre clusters e equipes sem atrito. Após a Copa do Mundo de Rugby e os Jogos Olímpicos de 2024 na França, a SNCF recebeu a diretriz de voltar o foco para a eficiência de custos digitais sem desacelerar a modernização da plataforma ferroviária.

Adotando o PerfectScale como plano de controle pronto para produção

A SNCF conheceu o PerfectScale, hoje PerfectScale by DoiT, na KubeCon. O grande diferencial não era mais um dashboard — era a capacidade de gerar recomendações de right-sizing in-place e sensíveis ao risco, que podiam ser aplicadas com segurança em ambientes de produção em operação. Como resume Thomas Comtet, Senior Staff Engineer da SNCF: "O que nos convenceu foi que o PerfectScale não nos pediu para confiar na teoria. Ele nos mostrou exatamente o que podia mudar sem prejudicar a estabilidade."

Das recomendações à automação com ArgoCD

O PerfectScale by DoiT se integra via Custom Resources e ArgoCD, de modo que o Autopilot pode ser ativado no nível de namespace como uma feature flag. A SNCF estabeleceu uma configuração padrão do Autopilot e a implantou automaticamente em todos os ambientes de não produção, permitindo ajustes granulares em casos específicos. Em produção, a SNCF introduziu a automação gradualmente, começando por todo o stack nativo da nuvem (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), e validou a confiabilidade antes de estender aos namespaces de aplicações.

Incorporando a otimização como governança

Em vez de conduzir uma iniciativa pontual de right-sizing, a SNCF transformou a otimização em um comportamento operacional contínuo, aplicado automaticamente por meio de governança com o PerfectScale by DoiT. Como as recomendações se baseiam no comportamento observado dos workloads e são aplicadas via automação, elas deixaram de ser debatidas e passaram a ser executadas como política. A equipe do PerfectScale também previu que o redimensionamento in-place eliminaria o custo oculto das otimizações baseadas em reinicialização — um trabalho que, de outra forma, exigiria que a SNCF desenvolvesse essa capacidade internamente ou treinasse dezenas de equipes para aplicá-la com segurança.

Os resultados

Desde a adoção, o uso de Kubernetes da SNCF aumentou cerca de 30% sem aumento no custo de nuvem. A fatura real de nuvem em setembro de 2025 foi menor do que em janeiro de 2025, apesar do volume maior. A economia anualizada é estimada em €500 mil por ano, com a maior parte (€350 mil) vinda de ambientes de não produção via automação. Atualmente, a SNCF mantém a automação ativada em 45% dos namespaces de não produção, 1% dos namespaces de produção e 100% do stack nativo da nuvem em ambos os ambientes — ou seja, a infraestrutura compartilhada mais crítica entre os clusters é governada automaticamente. A estabilidade dos clusters também melhorou, já que o PerfectScale redistribuiu recursos com base em curvas de demanda e risco de falha, reduzindo a probabilidade de escassez de CPU e eliminando a capacidade excedente.

Próximos passos

A SNCF planeja continuar expandindo a automação para mais namespaces de não produção e, gradualmente, para ambientes de produção selecionados de early adopters. A equipe também está avaliando o right-sizing in-place de pods para minimizar ainda mais as interrupções causadas por reinicializações e melhorar a estabilidade dos workloads. Além do próprio roadmap de adoção, a SNCF se tornou uma colaboradora ativa na evolução do produto PerfectScale — melhorias recentes, como o suporte a workloads Java e o right-sizing in-place de pods, foram diretamente influenciadas pelo feedback da SNCF. "Provamos em produção", diz Thomas Comtet. "Agora estamos escalando o que funciona e ajudando a torná-lo ainda melhor."

Saiba como o PerfectScale melhora a eficiência do Kubernetes

Descubra como o PerfectScale ajuda equipes a fazer right-sizing de clusters, reduzir desperdício e melhorar a performance sem ajustes manuais.

More customer stories

PicnicAI

PicnicAI automatiza 85-90% dos workloads de Kubernetes e melhora a confiabilidade com o PerfectScale by DoiT

85–90%
dos workloads de aplicação agora cobertos por redimensionamento automatizado
50%
de redução aproximada no tempo que a equipe de infraestrutura dedica à infraestrutura
Stefanini

Stefanini corta 26% dos custos de computação Kubernetes com PerfectScale by DoiT

26%
Redução nos custos de computação Kubernetes
>60%
Redução nos custos de infraestrutura no último ano
OneFootball

PerfectScale by DoiT ajuda a OneFootball a otimizar Kubernetes para o tráfego global do futebol em larga escala

25%
de redução nos custos de infraestrutura Kubernetes
80%
de redução no esforço de engenharia dedicado à otimização de custos e ao ajuste de resiliência em Kubernetes
Luma Health

Luma Health corta 40% dos custos com EKS e libera milhares de horas de engenharia por ano

90%
Menos tempo em right-sizing manual de Kubernetes
40%
Redução nos custos com Amazon EKS
+1,700h/year
Horas de engenharia redirecionadas para confiabilidade e performance
PlayHQ

PlayHQ otimiza custos de Kubernetes multi-tenant

40%
Redução nos custos de Kubernetes fora de produção
40%
Redução nos custos de K8s fora de produção
20%
Redução nos custos de K8s em produção
NOS

NOS corta custos de Kubernetes pela metade e recupera a confiança na otimização

50%
Redução de custos
50%
Redução de custos no maior cluster
0%
Recursos ociosos nos node pools principais
K1x

K1x corta custos de nuvem e simplifica as operações de Kubernetes

Thousands
Economizados por mês
Thousands
Economizados por mês em gastos com nuvem
<10%
Utilização de recursos nos nós superprovisionados antes da otimização
Riftweaver

Como o PerfectScale ajuda um time de DevOps de uma pessoa a escalar a Riftweaver

59%
Redução no throttling de CPU
6
APIs críticas otimizadas
80,000+
Downloads do jogo