Kubernetesワークロードの85〜90%を自動化——PicnicAIがPerfectScale by DoiTで信頼性を向上
- 85–90%
- 自動リサイズが適用されたアプリケーションワークロードの割合
- 50%
- インフラチームがインフラ管理に費やす時間の削減率(概算)
PlayHQはECSからKubernetesへ移行し、当初は大きなコスト削減を実現しました。しかし、マルチテナントの顧客基盤が拡大するにつれ、利用パターンはより複雑で予測しにくいものになりました。コンピューティングの約90%がKubernetes上で稼働し、テナントごとに数百の小規模で変動の大きいワークロードが存在する中、Karpenter、HPA、KEDAによるインフラレベルのオートスケーリングでキャパシティは確保できても、ワークロード単位でCPUとメモリのリクエストを正確にライトサイジングすることはできませんでした。手動でのリソース最適化は少数精鋭のプラットフォームチームにはスケールせず、OpenCostを評価した結果も、運用と設定の負荷が大きすぎることが判明しました。
PlayHQはDoiT経由でPerfectScaleを導入し、マルチテナントクラスタ全体でKubernetesのライトサイジングを自動化してEKSのコスト効率を改善しました。初回デモから1時間以内に、開発クラスタで自動化の運用を開始。PerfectScaleは、CPUとメモリのリクエストを継続的に調整する自動ライトサイジング、トラフィックが集中する土曜日の試合日に変更を防ぐメンテナンスウィンドウ、センシティブなワークロードを対象外にできるnamespaceレベルの除外設定、そして安定性を守りながらコストを削減する本番クラスタ向けのバランス型最適化ポリシーを提供しました。
お客様ごとに利用パターンはまったく異なります。手動でのリソース最適化ではとてもスケールしませんでした。規模の大小を問わず、すべてのお客様に適切なサイズのインフラを提供しつつ、チームのリソースを消費しない自動化が必要だったのです。
Brad Quinn, PlayHQ リードプラットフォームエンジニア
世界中で毎日、PlayHQは数千のコミュニティスポーツ大会を支える重要なデジタルインフラを運用しています。オーストラリアンフットボールのジュニアクラブ、バスケットボールリーグ、地域のネットボールやサッカーの協会など、有力なスポーツ団体が、利用が急増する試合のピーク時間帯にこのプラットフォームを頼りにしています。これらの団体はPlayHQを使って、数百のチームにまたがる参加登録、スコア管理、決済、大会運営を行っています。需要は競技・シーズン・地域によって大きく変動するため、インフラを効率的にスケールさせつつコストを抑えることは常に課題でした。この運用の中心にいるのが、リードプラットフォームエンジニアのBrad Quinn氏が率いるPlayHQのプラットフォームエンジニアリングチームで、Kubernetes環境の信頼性、パフォーマンス、コストを管理しています。「Kubernetesは私たちにとって非常に重要です。エンジニアの日々のワークフローそのものですから」とQuinn氏は語ります。PlayHQのコンピューティングの約90%がKubernetes上で稼働する中、顧客基盤の拡大に伴い、チームにはより自動化されたインテリジェントなコスト最適化のアプローチが必要でした。
PlayHQは、インフラコストの削減とテナントデプロイの迅速化を目的にECSからKubernetesへ移行しました。移行当初は削減効果が得られたものの、プラットフォームに参加する団体が増え、利用パターンが予測しにくくなるにつれ、コストは再び増加し始めました。「ECSからKubernetesへ移行し、当初は大きなコスト削減を実現しました」とQuinn氏。「しかし顧客基盤が拡大し、利用パターンが複雑になるにつれ、その効率を維持するには最適化のアプローチを進化させる必要がありました」。PlayHQはすでにKarpenterでノードを効率的にスケールさせ、HPAとKEDAで需要、特に週末のピークトラフィックに応じてキャパシティを調整していました。しかし、ワークロードの要求はテナントごとに大きく異なります。インフラレベルのオートスケーリングでキャパシティは確保できても、数百の小規模で変動の大きいワークロードにわたってCPUとメモリのリクエストを正確にライトサイジングするという課題は解決できませんでした。Quinn氏はOpenCostも評価しましたが、少数精鋭のプラットフォームチームには運用負荷が高すぎると判断しました。
PerfectScaleは、PlayHQのマルチテナントクラスタ全体でKubernetesのライトサイジングを自動化し、EKSのコスト効率を高める理想的なソリューションとしてすぐに浮上しました。導入スピードも決め手のひとつでした。「初回デモを受けてプラットフォームへのアクセスを取得し、1時間以内に開発クラスタで自動化をセットアップできました」とQuinn氏は語ります。PerfectScaleの機能はPlayHQの環境や運用リズムとよく合致しており、変更のタイミングと対象を完全にコントロールしながら、安全に最適化を自動化できました。主な機能には、CPUとメモリのリクエストを継続的に調整する自動ライトサイジング、土曜日の試合日などトラフィックが集中する時間帯の変更を防ぐメンテナンスウィンドウ、センシティブなワークロードへの変更を避けるnamespaceレベルの除外設定、コスト削減と安定性を両立させる本番クラスタ向けのバランス型最適化ポリシーが含まれます。
DoiT経由でPerfectScaleを導入した後、PlayHQはコストと運用パフォーマンスの両面で大きな改善を達成しました。非本番環境のKubernetesコストを40%削減、本番環境のKubernetesコストを20%削減、年間数万ドルの節約、ワークロード全体でのパフォーマンスの一貫性向上、そしてテナント別コスト配分の可視性向上です。レジリエンスに関わる問題の検知と修復も迅速になりました。「OOMアラートのようなレジリエンス関連の機能のおかげで、解決までの時間が大幅に短縮されました」とQuinn氏。テナントごとのKubernetesコストをリアルタイムで把握できるようになったことで、Quinn氏はテナントごとの季節変動をより明確に捉え、最適化の価値を経営層に伝えやすくなりました。「テナントごとのコンピューティングコストをその場ですぐに確認できます」とQuinn氏は語ります。「削減した総額と解決した問題をCTOに共有できるのです」。
Kubernetes最適化の自動化が定着した今、PlayHQはPerfectScaleへのアクセスをプラットフォームチーム以外にも広げる計画です。プロダクトエンジニアリングの各スクワッドが自らSLOを管理し、設計上の意思決定がKubernetesのリソース使用量やインフラコストにどう影響するかを理解できるようにすることが狙いです。これは、クラブ、リーグ、そして家族に信頼性の高いデジタル体験を届け続けながら、エンジニアリングの実践を持続可能な成長と整合させるというPlayHQの長期的な目標を後押しするものです。
Quinn氏は、長期的なパートナーとしてのDoiTとPerfectScaleの価値を強調しています。オンボーディングの際には、両チームが数時間以内に問題を特定・解決し、PlayHQのソリューションへの信頼をさらに強めました。最適化の自動化、大きなコスト削減、信頼性の向上により、プラットフォームチームはPlayHQの継続的な拡大を支えるために必要な運用効率と可視性を手にしています。
PerfectScaleが手動チューニングなしでクラスタのライトサイジング、無駄の削減、パフォーマンス向上を支援する方法をご覧ください。