PerfectScalePerfectScale

このページはEnglish、Deutsch、Español、Français、Italiano、Portuguêsでもご覧いただけます。

Kubernetesコストを半減、最適化への信頼を取り戻したNOS

ポルトガルを代表する通信事業者が、複雑なマルチクラスター環境でK8sコストを安全に削減した方法

PerfectScale
NOS

The Challenge

オンプレミスとGoogle Cloudのハイブリッド環境でKubernetesの利用が拡大するにつれ、NOSにとって最適化は大きな課題となっていました。PrometheusやGrafanaといった可観測性ツールから得られるのは生のメトリクスだけで、実行可能な推奨事項はなく、エンジニアは手探りでライトサイジングを行わざるを得ませんでした。過去に手動で最適化を試みた際にはクラッシュやSLA違反を招き、最適化への信頼は失われていました。さらにFinOpsチームは、断片化したコストデータの集計に毎月数日を費やし、リスク回避のために過剰なリソース割り当てが常態化していました。

The Solution

NOSはPerfectScaleを導入し、まず開発クラスターで展開しました。自動化は4か月間、安定して稼働し続け、コストは着実に下がり、インシデントは一件も発生しませんでした。この成功を受けて、NOSはIngressコントローラー、cert-manager、可観測性スタックなどのプラットフォームレベルのコンポーネントにも自動化を拡大。本番環境では、SREがPerfectScaleの提示する裏付けとなるコンテキスト情報を確認しながら推奨事項を手動で適用し、変更がパフォーマンスに影響しないことを担保しています。InfraFitが最適なノードタイプを特定することで、Cluster Autoscalerはユーザートラフィックに連動して効率的にスケールします。

Results

  • NOSの最大かつ最も重要なクラスター(メインAPIクラスター)でコストを50%以上削減
  • InfraFitとライトサイジングの自動化により、複数の主要ノードプールでアイドルリソース0%を達成
  • OOM KillやCPUスロットリングなどのパフォーマンス問題を発見・解消
  • SLA違反を解消し、アプリケーション全体のパフォーマンスを向上
  • FinOpsのレポート作成と会議に費やしていた月2〜3日分の工数を削減
  • 安全でインテリジェントなKubernetes最適化に対するチーム横断の信頼を再構築
  • プラットフォームエンジニア、SRE、開発者、財務管理者、経営層まで全社的な活用を実現

初めて見たときから、この製品には確信を持っていました。今でもいろいろな人に見せています。パフォーマンスを犠牲にすることなく、スマートな自動化と実際のコスト削減を両立できる唯一のソリューションでした。

Joao Soares, NOS プラットフォームエンジニアリングリード

NOSについて

NOSはポルトガルを代表する通信事業者のひとつで、ネットワーク、インターネット、エンターテインメントの各サービスを数百万人に提供しています。約10年前、NOSはオーバーヘッドの削減と開発スピードの向上を目指してコンテナ化に踏み切り、仮想マシンからDockerとRancherへ、そして最終的には全社的なKubernetesの展開へと歩みを進めてきました。現在は、通信事業特有のシステムはオンプレミスに残しつつ、スケーラブルなworkloadsはGoogle Cloud上で稼働させるハイブリッド構成を運用しています。インフラコストを抑えながら俊敏性とパフォーマンスを提供するという目標は、一貫して変わっていません。

課題:手動の最適化がリスク要因に

NOSのKubernetesアーキテクチャが進化するにつれ、その複雑さも増していきました。各チームはPrometheusとGrafanaを利用していましたが、これらのツールから得られるのは生のメトリクスだけで、SLAが関わる場面で安全かつ自信を持って判断するために必要な可視性や推奨事項はありませんでした。明確な指針がないなか、エンジニアは推測に頼るしかありませんでした。手動でのライトサイジングを何度か試みた結果、クラッシュやSLA違反を招き、チームは手を引くようになりました。「開発者たちは自分たちなりに妥当だと考えた変更を試みましたが、裏目に出てしまいました」と、NOSのプラットフォームエンジニアリングリードであるJoao Soares氏は語ります。さらに追い打ちをかけるように、FinOpsチームは毎月数日をかけて断片化したデータをつなぎ合わせてレポートを作成しており、問題の発見や予算レビューの準備が困難な状態でした。

KubeConでPerfectScaleと出会う

2024年にパリで開催されたKubeCon Europeで、Soares氏が探していたのはただひとつ、Kubernetesのコストをより安全に削減する方法でした。PerfectScaleはすぐに目に留まりました。「初めて見たときから、この製品には確信を持っていました。今でもいろいろな人に見せています」とSoares氏。「パフォーマンスを犠牲にすることなく、スマートな自動化と実際のコスト削減を両立できる唯一のソリューションでした」

ソリューション:信頼を前提に設計されたスマートな自動最適化

PerfectScaleはまず開発クラスターに展開されました。自動化は4か月間、安定して稼働し続け、コストは下がり、問題も苦情も一件もありませんでした。この成功を受けて、NOSはIngressコントローラー、cert-manager、可観測性スタックといったプラットフォームレベルのコンポーネントの自動化に着手しました。本番環境ではSREが引き続き推奨事項を手動で適用していますが、変更がパフォーマンス問題を引き起こさないと確信できるだけの裏付けをPerfectScaleが提供することで、信頼は着実に高まっています。

成果:コスト、パフォーマンス、そして時間の削減

NOSは、リスク回避のために大幅に過剰なリソースが割り当てられていた最大かつ最も重要なクラスター(メインAPIクラスター)で、コストを50%以上削減しました。PerfectScaleはOOM KillやCPUスロットリングといった見過ごされていた問題を発見し、解決に向けた的確な推奨事項を提示しました。さらにInfraFitが最適なノードタイプの特定を支援し、Cluster Autoscalerがより効率的にスケールできるようになりました。「私たちが望んでいたサインカーブ、つまりユーザートラフィックに完璧に連動したスケールアップ・ダウンが実現できています。workloadsのライトサイジング自動化と組み合わせることで、複数の主要ノードプールが現在アイドルリソース0%で稼働しています」とSoares氏は語ります。FinOpsのレポート作成も劇的に速くなり、毎月2〜3日分の時間を取り戻しました。「今では、すべて問題ないとわかった状態で会議に臨めます」とSoares氏は述べています。

全社的な活用へ

PerfectScaleは今や、NOSの日々の意思決定を支えており、バラバラのツールと勘に頼った運用を、信頼できる単一のプラットフォームに置き換えました。プラットフォームエンジニアはクラスターとリソース管理の自動化に、SREはビジネスクリティカルなサービスへの推奨事項の適用に、開発者は開発から本番までの適切なリソース割り当てに活用しています。財務管理者は予算の監視と支出の追跡を行い、経営層は効率性とチーム間の連携を統括しています。こうして可視性を全員で共有できるようになったことでコラボレーションが向上し、Kubernetesの最適化は全社の日常業務の一部になりました。

PerfectScaleでKubernetesの効率を高める方法

PerfectScaleが、手動チューニングなしでクラスターのライトサイジング、無駄の削減、パフォーマンス向上をどのように実現するかをご覧ください。

More customer stories

PicnicAI

Kubernetesワークロードの85〜90%を自動化——PicnicAIがPerfectScale by DoiTで信頼性を向上

85–90%
自動リサイズが適用されたアプリケーションワークロードの割合
50%
インフラチームがインフラ管理に費やす時間の削減率(概算)
Stefanini

PerfectScale by DoiTでKubernetesコンピューティングコストを26%削減

26%
Kubernetesコンピューティングコスト削減
>60%
過去1年間のインフラコスト削減
OneFootball

PerfectScale by DoiTがOneFootballのKubernetesを世界中のサッカートラフィックに合わせて最適化

25%
Kubernetesインフラコスト削減
80%
Kubernetesのコスト最適化とレジリエンシーチューニングに費やすエンジニアリング工数の削減
Luma Health

Luma Health、EKSコストを40%削減し年間数千時間のエンジニアリング工数を創出

90%
Kubernetes手動ライトサイジング時間の削減
40%
Amazon EKSコストの削減
+1,700h/year
信頼性とパフォーマンスへ再配分したエンジニアリング工数
PlayHQ

PlayHQ、マルチテナントKubernetesのコストを最適化

40%
非本番環境のKubernetesコスト削減率
40%
非本番K8sコストの削減率
20%
本番K8sコストの削減率
SNCF

SNCFが実現した、K8sの無駄削減と大規模環境での信頼性向上

30%
コスト据え置きでのワークロード増加
30%
コスト据え置きで吸収したワークロード
~€500K
推定年間削減額
K1x

K1x、クラウドコストを大幅削減しKubernetes運用を効率化

Thousands
月間削減額
Thousands
クラウド費用の月間削減額
<10%
最適化前の過剰プロビジョニングノードのリソース使用率
Riftweaver

DevOpsエンジニア1人でRiftweaverをスケール——PerfectScaleの実力

59%
CPUスロットリング削減率
6
改善された重要API数
80,000+
ゲームダウンロード数