Kubernetesワークロードの85〜90%を自動化——PicnicAIがPerfectScale by DoiTで信頼性を向上
- 85–90%
- 自動リサイズが適用されたアプリケーションワークロードの割合
- 50%
- インフラチームがインフラ管理に費やす時間の削減率(概算)
オンプレミスとGoogle Cloudのハイブリッド環境でKubernetesの利用が拡大するにつれ、NOSにとって最適化は大きな課題となっていました。PrometheusやGrafanaといった可観測性ツールから得られるのは生のメトリクスだけで、実行可能な推奨事項はなく、エンジニアは手探りでライトサイジングを行わざるを得ませんでした。過去に手動で最適化を試みた際にはクラッシュやSLA違反を招き、最適化への信頼は失われていました。さらにFinOpsチームは、断片化したコストデータの集計に毎月数日を費やし、リスク回避のために過剰なリソース割り当てが常態化していました。
NOSはPerfectScaleを導入し、まず開発クラスターで展開しました。自動化は4か月間、安定して稼働し続け、コストは着実に下がり、インシデントは一件も発生しませんでした。この成功を受けて、NOSはIngressコントローラー、cert-manager、可観測性スタックなどのプラットフォームレベルのコンポーネントにも自動化を拡大。本番環境では、SREがPerfectScaleの提示する裏付けとなるコンテキスト情報を確認しながら推奨事項を手動で適用し、変更がパフォーマンスに影響しないことを担保しています。InfraFitが最適なノードタイプを特定することで、Cluster Autoscalerはユーザートラフィックに連動して効率的にスケールします。
初めて見たときから、この製品には確信を持っていました。今でもいろいろな人に見せています。パフォーマンスを犠牲にすることなく、スマートな自動化と実際のコスト削減を両立できる唯一のソリューションでした。
Joao Soares, NOS プラットフォームエンジニアリングリード
NOSはポルトガルを代表する通信事業者のひとつで、ネットワーク、インターネット、エンターテインメントの各サービスを数百万人に提供しています。約10年前、NOSはオーバーヘッドの削減と開発スピードの向上を目指してコンテナ化に踏み切り、仮想マシンからDockerとRancherへ、そして最終的には全社的なKubernetesの展開へと歩みを進めてきました。現在は、通信事業特有のシステムはオンプレミスに残しつつ、スケーラブルなworkloadsはGoogle Cloud上で稼働させるハイブリッド構成を運用しています。インフラコストを抑えながら俊敏性とパフォーマンスを提供するという目標は、一貫して変わっていません。
NOSのKubernetesアーキテクチャが進化するにつれ、その複雑さも増していきました。各チームはPrometheusとGrafanaを利用していましたが、これらのツールから得られるのは生のメトリクスだけで、SLAが関わる場面で安全かつ自信を持って判断するために必要な可視性や推奨事項はありませんでした。明確な指針がないなか、エンジニアは推測に頼るしかありませんでした。手動でのライトサイジングを何度か試みた結果、クラッシュやSLA違反を招き、チームは手を引くようになりました。「開発者たちは自分たちなりに妥当だと考えた変更を試みましたが、裏目に出てしまいました」と、NOSのプラットフォームエンジニアリングリードであるJoao Soares氏は語ります。さらに追い打ちをかけるように、FinOpsチームは毎月数日をかけて断片化したデータをつなぎ合わせてレポートを作成しており、問題の発見や予算レビューの準備が困難な状態でした。
2024年にパリで開催されたKubeCon Europeで、Soares氏が探していたのはただひとつ、Kubernetesのコストをより安全に削減する方法でした。PerfectScaleはすぐに目に留まりました。「初めて見たときから、この製品には確信を持っていました。今でもいろいろな人に見せています」とSoares氏。「パフォーマンスを犠牲にすることなく、スマートな自動化と実際のコスト削減を両立できる唯一のソリューションでした」
PerfectScaleはまず開発クラスターに展開されました。自動化は4か月間、安定して稼働し続け、コストは下がり、問題も苦情も一件もありませんでした。この成功を受けて、NOSはIngressコントローラー、cert-manager、可観測性スタックといったプラットフォームレベルのコンポーネントの自動化に着手しました。本番環境ではSREが引き続き推奨事項を手動で適用していますが、変更がパフォーマンス問題を引き起こさないと確信できるだけの裏付けをPerfectScaleが提供することで、信頼は着実に高まっています。
NOSは、リスク回避のために大幅に過剰なリソースが割り当てられていた最大かつ最も重要なクラスター(メインAPIクラスター)で、コストを50%以上削減しました。PerfectScaleはOOM KillやCPUスロットリングといった見過ごされていた問題を発見し、解決に向けた的確な推奨事項を提示しました。さらにInfraFitが最適なノードタイプの特定を支援し、Cluster Autoscalerがより効率的にスケールできるようになりました。「私たちが望んでいたサインカーブ、つまりユーザートラフィックに完璧に連動したスケールアップ・ダウンが実現できています。workloadsのライトサイジング自動化と組み合わせることで、複数の主要ノードプールが現在アイドルリソース0%で稼働しています」とSoares氏は語ります。FinOpsのレポート作成も劇的に速くなり、毎月2〜3日分の時間を取り戻しました。「今では、すべて問題ないとわかった状態で会議に臨めます」とSoares氏は述べています。
PerfectScaleは今や、NOSの日々の意思決定を支えており、バラバラのツールと勘に頼った運用を、信頼できる単一のプラットフォームに置き換えました。プラットフォームエンジニアはクラスターとリソース管理の自動化に、SREはビジネスクリティカルなサービスへの推奨事項の適用に、開発者は開発から本番までの適切なリソース割り当てに活用しています。財務管理者は予算の監視と支出の追跡を行い、経営層は効率性とチーム間の連携を統括しています。こうして可視性を全員で共有できるようになったことでコラボレーションが向上し、Kubernetesの最適化は全社の日常業務の一部になりました。
PerfectScaleが、手動チューニングなしでクラスターのライトサイジング、無駄の削減、パフォーマンス向上をどのように実現するかをご覧ください。