PerfectScalePerfectScale

このページはEnglish、Deutsch、Español、Français、Italiano、Portuguêsでもご覧いただけます。

SNCFが実現した、K8sの無駄削減と大規模環境での信頼性向上

欧州最大の鉄道事業者は、250超のクラスタの安定性を高めながら、クラウド支出を増やすことなく30%多くのワークロードを吸収しました

The Challenge

SNCFはフランスの全国鉄道網とグローバルなモビリティサービス(TGV、OUIGO、Eurostar、TER、Transilien、Keolis)を運営しており、発券、時刻表、車内サービス、リアルタイム物流を支えるKubernetesが数百のクラスタで稼働しています。DatadogやPrometheus、FinOpsワークショップを用いた手動のライトサイジングは、200超のプロジェクトと最大250のクラスタ(一部は1,000以上のワークロードをホスト)にはスケールしませんでした。最適化が実際に障害リスクを伴う本番環境では、エンジニアが安全側に倒す傾向があったため、オーバープロビジョニングが常態化していました。また、Datadogベースの分析は集計の影響で利用量を過大に見積もることが多く、推奨内容への信頼が損なわれていました。2024年のラグビーワールドカップとオリンピックを経て、経営層はモダナイゼーションを減速させることなく、デジタルコスト効率への再注力を指示しました。

The Solution

SNCFはKubeConでPerfectScaleに出会い、本番環境レベルの最適化コントロールプレーンとして採用しました。決め手となったのは、稼働中の本番環境にも安全に適用できる、リスクを考慮したインプレースのライトサイジング推奨です。PerfectScaleはCustom ResourcesとArgoCDを介して統合され、Autopilotをフィーチャーフラグとしてnamespace単位で有効化できます。SNCFは標準のAutopilot設定を非本番環境全体に自動展開し、エッジケースにはきめ細かなオーバーライドで対応しました。本番環境では、クラウドネイティブスタック(Datadog、Kyverno、KEDA、AWS Load Balancer Controller、Karpenter)から段階的に自動化を導入し、その後アプリケーションのnamespaceへと拡大しました。最適化は一過性のプロジェクトではなく、継続的なガバナンスとなりました。

Results

  • クラウドコストを増やすことなくKubernetes利用量を約30%拡大——利用量が増えたにもかかわらず、2025年9月の請求額は2025年1月を下回りました
  • 年間換算で約50万ユーロの削減を実現(うち約35万ユーロは非本番環境の自動化によるもの)
  • 非本番namespaceの45%、本番namespaceの1%、両環境のクラウドネイティブスタックの100%で自動化を有効化
  • 需要カーブと障害リスクに基づくリソースの再配分でCPU枯渇を低減し、クラスタの安定性を向上
  • 属人的な知識に依存したライトサイジングのサイクルを廃止し、ガバナンスの効いた自動化された運用へ置き換え
  • 安全な本番環境の最適化をPerfectScaleに標準化し、独自開発の負担を回避

PerfectScaleのおかげで、コストを増やさずにキャパシティを拡大できました。実質的に、30%多い利用量を追加コストゼロで処理できたのです。

Thomas Comtet, SNCF シニアスタッフエンジニア

SNCFについて

SNCFは欧州最大級の輸送グループであり、TGV、OUIGO、Eurostar、TER、Transilien、Keolisといったブランドを通じて、フランスの全国鉄道網とグローバルなモビリティサービスを運営しています。従業員数27万人超、年間売上高400億ユーロ超を誇るSNCFは、発券、時刻表、車内サービス、リアルタイムの運行ロジスティクスを支える高可用性のデジタルシステムに依存しています。これらのサービスの多くは、ミッションクリティカルな環境で稼働する数百のクラスタ上のKubernetesによって支えられています。全社的なデジタルモダナイゼーションと効率化の推進の一環として、SNCFはレジリエンスを犠牲にすることなく、これらのクラスタの運用コストの増大を抑える必要がありました。

課題

プラットフォームチームは、KubernetesにおけるFinOpsの理想と、信頼性や稼働率に対する開発者のリスク許容度、そして経営層からの高まる財務的プレッシャーの板挟みになっていました。手動のライトサイジングには属人的な知識、長時間の会議、再起動が必要で、オーナーが変わったりエンジニアが異動したりするたびに、最適化の取り組みをやり直さなければなりませんでした。Datadogベースの分析は集計の影響で利用量を過大に見積もることが多く、推奨内容への不信を招いていました。作業は一貫性を欠き、時間がかかり、200超のプロジェクトと最大250のクラスタという全体をカバーすることは到底できませんでした。SNCFに必要だったのは、実際の挙動に基づく信頼できるライトサイジングの知見を提供し、本番環境で安全に機能し、信頼性を損なわずにコストを削減し、単発ではなく継続的に稼働し、クラスタやチームを横断して摩擦なくスケールするシステムでした。フランスで開催された2024年のラグビーワールドカップとオリンピックを経て、SNCFは鉄道プラットフォームのモダナイゼーションを減速させることなく、デジタルコスト効率への再注力を求められました。

本番環境レベルのコントロールプレーンとしてPerfectScaleを採用

SNCFがPerfectScale(現PerfectScale by DoiT)と出会ったのはKubeConでした。決め手は、単なるダッシュボードではなく、稼働中の本番環境に安全に適用できる、リスクを考慮したインプレースのライトサイジング推奨を生成できる点でした。SNCFのシニアスタッフエンジニアであるThomas Comtet氏は次のように語ります。「私たちを納得させたのは、PerfectScaleが理論を信じろと言わなかったことです。安定性を損なわずに何を変えられるのかを、正確に示してくれました」

ArgoCDで推奨から自動化へ

PerfectScale by DoiTはCustom ResourcesとArgoCDを介して統合されるため、Autopilotをフィーチャーフラグとしてnamespace単位で有効化できます。SNCFは標準のAutopilot設定を策定して非本番環境全体に自動展開し、エッジケースにはきめ細かなオーバーライドで対応しました。本番環境では、クラウドネイティブスタック全体(Datadog、Kyverno、KEDA、AWS Load Balancer Controller、Karpenter)から段階的に自動化を導入し、信頼性を検証したうえでアプリケーションのnamespaceへと拡大しました。

ガバナンスとしての最適化の定着

SNCFはライトサイジングを一過性の取り組みとして進めるのではなく、PerfectScale by DoiTのガバナンスによって自動的に適用される、継続的な運用プラクティスへと変えました。推奨は観測されたワークロードの挙動に基づき、自動化によって適用されるため、もはや議論の対象ではなく、ポリシーとして実行されます。また、PerfectScaleチームは、インプレースのリサイズによって再起動を伴う最適化の隠れたコストが解消されることも見込んでいました。この機能がなければ、SNCFは同等の仕組みを独自開発するか、数十のチームに安全な適用方法をトレーニングする必要があったはずです。

成果

導入以来、SNCFのKubernetes利用量はクラウドコストを増やすことなく約30%増加しました。利用量が増えたにもかかわらず、2025年9月の実際のクラウド請求額は2025年1月を下回りました。年間換算の削減額は約50万ユーロと推定され、その大半(約35万ユーロ)は非本番環境の自動化によるものです。現在SNCFは、非本番namespaceの45%、本番namespaceの1%、そして両環境のクラウドネイティブスタックの100%で自動化を有効化しています。つまり、クラスタを横断する最も重要な共有インフラが自動的にガバナンスされているのです。さらに、PerfectScaleが需要カーブと障害リスクに基づいてリソースを再配分したことで、過剰なキャパシティを排除しながらCPU枯渇の発生確率が下がり、クラスタの安定性も向上しました。

今後の展望

SNCFは今後、さらに多くの非本番namespaceへ自動化を拡大し、アーリーアダプター向けに一部の本番環境へも段階的に展開していく計画です。また、再起動による中断を最小限に抑え、ワークロードの安定性を高めるために、インプレースのPodライトサイジングも評価中です。自社の導入ロードマップにとどまらず、SNCFはPerfectScaleの製品進化にも積極的に貢献しています。JavaワークロードのサポートやインプレースのPodライトサイジングといった最近の機能強化は、SNCFのフィードバックが直接反映されたものです。「本番環境で実証できました」とThomas Comtet氏は語ります。「今は、うまくいく手法をスケールさせながら、製品をさらに良くする手伝いをしています」

PerfectScaleでKubernetesの効率化を実現

PerfectScaleがどのように、手動チューニングなしでクラスタのライトサイジング、無駄の削減、パフォーマンス向上を支援するかをご覧ください。

More customer stories

PicnicAI

Kubernetesワークロードの85〜90%を自動化——PicnicAIがPerfectScale by DoiTで信頼性を向上

85–90%
自動リサイズが適用されたアプリケーションワークロードの割合
50%
インフラチームがインフラ管理に費やす時間の削減率(概算)
Stefanini

PerfectScale by DoiTでKubernetesコンピューティングコストを26%削減

26%
Kubernetesコンピューティングコスト削減
>60%
過去1年間のインフラコスト削減
OneFootball

PerfectScale by DoiTがOneFootballのKubernetesを世界中のサッカートラフィックに合わせて最適化

25%
Kubernetesインフラコスト削減
80%
Kubernetesのコスト最適化とレジリエンシーチューニングに費やすエンジニアリング工数の削減
Luma Health

Luma Health、EKSコストを40%削減し年間数千時間のエンジニアリング工数を創出

90%
Kubernetes手動ライトサイジング時間の削減
40%
Amazon EKSコストの削減
+1,700h/year
信頼性とパフォーマンスへ再配分したエンジニアリング工数
PlayHQ

PlayHQ、マルチテナントKubernetesのコストを最適化

40%
非本番環境のKubernetesコスト削減率
40%
非本番K8sコストの削減率
20%
本番K8sコストの削減率
NOS

Kubernetesコストを半減、最適化への信頼を取り戻したNOS

50%
コスト削減
50%
最大クラスターでのコスト削減
0%
主要ノードプールのアイドルリソース
K1x

K1x、クラウドコストを大幅削減しKubernetes運用を効率化

Thousands
月間削減額
Thousands
クラウド費用の月間削減額
<10%
最適化前の過剰プロビジョニングノードのリソース使用率
Riftweaver

DevOpsエンジニア1人でRiftweaverをスケール——PerfectScaleの実力

59%
CPUスロットリング削減率
6
改善された重要API数
80,000+
ゲームダウンロード数