PerfectScalePerfectScale

Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

Cómo SNCF eliminó la pérdida en K8s y mejoró la confiabilidad a gran escala

El mayor operador ferroviario de Europa absorbió un 30% más de workloads sin aumentar su gasto en la nube, mejorando la estabilidad en más de 250 clusters

The Challenge

SNCF opera la red ferroviaria nacional de Francia y servicios de movilidad globales (TGV, OUIGO, Eurostar, TER, Transilien, Keolis), con Kubernetes como base de la venta de boletos, los horarios, los servicios a bordo y la logística en tiempo real en cientos de clusters. El right-sizing manual con Datadog, Prometheus y talleres de FinOps no podía escalar a más de 200 proyectos y hasta 250 clusters, algunos con más de 1,000 workloads. El sobreaprovisionamiento estaba generalizado porque los Engineers optaban por la seguridad en producción, donde optimizar implicaba un riesgo real de interrupciones. El análisis basado en Datadog solía sobreestimar el uso por efectos de agregación, lo que erosionaba la confianza en las recomendaciones. Tras la Copa Mundial de Rugby y los Juegos Olímpicos de 2024, la dirección ordenó volver a enfocarse en la eficiencia de costos digitales sin frenar la modernización.

The Solution

SNCF descubrió PerfectScale en KubeCon y lo adoptó como un plano de control de optimización listo para producción. El diferenciador clave fueron las recomendaciones de right-sizing in-place que tienen en cuenta el riesgo, aplicables de forma segura en entornos productivos en vivo. PerfectScale se integra mediante Custom Resources y ArgoCD, lo que permite activar Autopilot a nivel de namespace como un feature flag. SNCF desplegó automáticamente una configuración estándar de Autopilot en los entornos de no producción, con ajustes granulares para casos especiales. En producción, la automatización se introdujo de forma gradual, comenzando por el stack nativo de la nube (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), antes de extenderla a los namespaces de aplicaciones. La optimización se convirtió en gobernanza continua, no en un proyecto con fecha de fin.

Results

  • Absorbió ~30% más de uso de Kubernetes sin aumentar el costo en la nube: la facturación de septiembre de 2025 fue menor que la de enero de 2025, a pesar del mayor volumen
  • Generó ahorros anualizados estimados en ~€500K, con ~€350K provenientes de entornos de no producción gracias a la automatización
  • Activó la automatización en el 45% de los namespaces de no producción, el 1% de los de producción y el 100% del stack nativo de la nube en ambos entornos
  • Mejoró la estabilidad de los clusters al redistribuir recursos según curvas de demanda y riesgo de falla, reduciendo los casos de CPU starvation
  • Eliminó los ciclos de right-sizing basados en conocimiento informal y los reemplazó por un comportamiento automatizado y gobernado
  • Evitó la carga de desarrollos a medida al estandarizar en PerfectScale la optimización segura en producción

PerfectScale nos permitió crecer en capacidad sin crecer en costos. En la práctica, absorbimos un 30% más de uso gratis.

Thomas Comtet, Senior Staff Engineer, SNCF

Conoce a SNCF

SNCF es uno de los mayores grupos de transporte de Europa: opera la red ferroviaria nacional de Francia y servicios de movilidad globales a través de marcas como TGV, OUIGO, Eurostar, TER, Transilien y Keolis. Con más de 270,000 empleados y más de €40B en ingresos anuales, SNCF depende de sistemas digitales de alta disponibilidad para la venta de boletos, los horarios, los servicios a bordo y la logística operativa en tiempo real. Kubernetes sostiene muchos de estos servicios en cientos de clusters que corren en entornos de misión crítica. Como parte de una iniciativa a nivel de toda la compañía hacia la modernización digital y la eficiencia, SNCF necesitaba controlar el costo creciente de operar estos clusters sin sacrificar la resiliencia.

El desafío

El equipo de plataforma estaba en medio de las promesas de FinOps de Kubernetes, la tolerancia al riesgo de los desarrolladores en torno a la confiabilidad y el tiempo de actividad, y la creciente presión financiera de la dirección. El right-sizing manual requería conocimiento informal, reuniones largas y reinicios, y cada esfuerzo de optimización debía comenzar de cero cada vez que cambiaba el equipo responsable o rotaban los Engineers. El análisis basado en Datadog solía sobreestimar el uso por efectos de agregación, lo que generaba desconfianza en las recomendaciones. El trabajo era inconsistente, lento y nunca podía completarse en la totalidad de los más de 200 proyectos y hasta 250 clusters. SNCF necesitaba un sistema que ofreciera inteligencia de right-sizing confiable y basada en el comportamiento real; que funcionara de forma segura en producción; que redujera costos sin comprometer la confiabilidad; que operara de manera continua, no episódica; y que escalara entre clusters y equipos sin fricción. Tras la Copa Mundial de Rugby y los Juegos Olímpicos de 2024 en Francia, SNCF recibió el mandato de volver a enfocarse en la eficiencia de costos digitales sin frenar la modernización de la plataforma ferroviaria.

La adopción de PerfectScale como plano de control de nivel productivo

SNCF descubrió PerfectScale, hoy PerfectScale by DoiT, en KubeCon. El diferenciador clave no era otro dashboard: era la capacidad de proponer recomendaciones de right-sizing in-place que tienen en cuenta el riesgo, aplicables de forma segura en entornos de producción en vivo. Como lo resume Thomas Comtet, Senior Staff Engineer en SNCF: "Lo que nos convenció fue que PerfectScale no nos pidió confiar en la teoría. Nos mostró exactamente qué se podía cambiar sin afectar la estabilidad."

De las recomendaciones a la automatización con ArgoCD

PerfectScale by DoiT se integra mediante Custom Resources y ArgoCD, de modo que Autopilot puede activarse a nivel de namespace como un feature flag. SNCF definió una configuración estándar de Autopilot y la desplegó automáticamente en los entornos de no producción, permitiendo ajustes granulares en casos especiales. En producción, SNCF introdujo la automatización de forma gradual, comenzando por todo el stack nativo de la nube (Datadog, Kyverno, KEDA, AWS Load Balancer Controller, Karpenter), y validó la confiabilidad antes de extenderla a los namespaces de aplicaciones.

La optimización como gobernanza

En lugar de ejecutar una iniciativa de right-sizing con fecha de fin, SNCF convirtió la optimización en un comportamiento operativo continuo, aplicado automáticamente mediante gobernanza con PerfectScale by DoiT. Como las recomendaciones se basan en el comportamiento observado de los workloads y se aplican mediante automatización, ya no se debaten: se ejecutan como política. El equipo de PerfectScale también anticipó que el redimensionamiento in-place eliminaría el costo oculto de las optimizaciones basadas en reinicios, un trabajo que de otro modo habría obligado a SNCF a desarrollar la capacidad a medida o a capacitar a decenas de equipos para aplicarla de forma segura.

Los resultados

Desde la adopción, el uso de Kubernetes en SNCF aumentó cerca de un 30% sin aumentar el costo en la nube. La facturación real de septiembre de 2025 fue menor que la de enero de 2025, a pesar del mayor volumen. Los ahorros anualizados se estiman en €500K al año, y la mayor parte (€350K) proviene de entornos de no producción gracias a la automatización. Actualmente, SNCF tiene activada la automatización en el 45% de los namespaces de no producción, el 1% de los namespaces de producción y el 100% del stack nativo de la nube en ambos entornos, lo que significa que la infraestructura compartida más crítica entre clusters se gobierna de forma automática. La estabilidad de los clusters también mejoró: PerfectScale redistribuyó los recursos según curvas de demanda y riesgo de falla, reduciendo la probabilidad de CPU starvation y eliminando a la vez la capacidad excedente.

Lo que viene

SNCF planea seguir expandiendo la automatización a más namespaces de no producción y, de forma gradual, a entornos de producción seleccionados para los equipos pioneros. El equipo también evalúa el right-sizing in-place de pods para minimizar aún más las interrupciones por reinicios y mejorar la estabilidad de los workloads. Más allá de su propia hoja de ruta de adopción, SNCF se ha convertido en un colaborador activo en la evolución del producto de PerfectScale: mejoras recientes como el soporte para workloads de Java y el right-sizing in-place de pods surgieron directamente de su feedback. "Lo demostramos en producción", dice Comtet. "Ahora estamos escalando lo que funciona y ayudando a hacerlo aún mejor."

Descubre cómo PerfectScale mejora la eficiencia de Kubernetes

Explora cómo PerfectScale ayuda a los equipos a ajustar el tamaño de sus clusters, reducir la pérdida y mejorar el rendimiento sin ajustes manuales.

More customer stories

PicnicAI

PicnicAI automatiza el 85-90% de sus workloads de Kubernetes y gana en confiabilidad con PerfectScale by DoiT

85–90%
de los workloads de aplicaciones ya cuenta con redimensionamiento automatizado
50%
de reducción aproximada en el tiempo del equipo dedicado a la infraestructura
Stefanini

Un 26% menos en costos de cómputo de Kubernetes: así lo logró Stefanini con PerfectScale by DoiT

26%
Reducción en costos de cómputo de Kubernetes
>60%
Reducción de costos de infraestructura en el último año
OneFootball

PerfectScale by DoiT ayuda a OneFootball a optimizar Kubernetes para el tráfico global del fútbol a gran escala

25%
de reducción en los costos de infraestructura de Kubernetes
80%
de reducción en el esfuerzo de Engineering dedicado a la optimización de costos y al ajuste de resiliencia en Kubernetes
Luma Health

Luma Health reduce un 40% los costos de EKS y libera miles de horas de Engineering al año

90%
Menos tiempo en right-sizing manual de Kubernetes
40%
Reducción en costos de Amazon EKS
+1,700h/year
Horas de Engineering redirigidas a fiabilidad y rendimiento
PlayHQ

PlayHQ optimiza sus costos de Kubernetes multi-tenant

40%
Reducción de costos de Kubernetes fuera de producción
40%
Reducción de costos de K8s fuera de producción
20%
Reducción de costos de K8s en producción
NOS

NOS reduce a la mitad sus costos de Kubernetes y recupera la confianza en la optimización

50%
Reducción de costos
50%
Reducción de costos en el clúster más grande
0%
Recursos ociosos en los node pools principales
K1x

K1x recorta sus costos de nube y simplifica la operación de Kubernetes

Thousands
Ahorro mensual
Thousands
Ahorro mensual en gasto de nube
<10%
Utilización de recursos en nodos sobredimensionados antes de la optimización
Riftweaver

Cómo PerfectScale ayuda a un equipo DevOps de una sola persona a escalar Riftweaver

59%
Reducción del throttling de CPU
6
APIs críticas mejoradas
80,000+
Descargas del juego