PerfectScalePerfectScale

このページはEnglish、Deutsch、Español、Français、Italiano、Portuguêsでもご覧いただけます。

PlayHQ、マルチテナントKubernetesのコストを最適化

PlayHQがDoiTのPerfectScaleでKubernetesのライトサイジングを自動化し、テナント別コストのリアルタイム可視化を実現した方法

PerfectScale
PlayHQ

The Challenge

PlayHQはECSからKubernetesへ移行し、当初は大きなコスト削減を実現しました。しかし、マルチテナントの顧客基盤が拡大するにつれ、利用パターンはより複雑で予測しにくいものになりました。コンピューティングの約90%がKubernetes上で稼働し、テナントごとに数百の小規模で変動の大きいワークロードが存在する中、Karpenter、HPA、KEDAによるインフラレベルのオートスケーリングでキャパシティは確保できても、ワークロード単位でCPUとメモリのリクエストを正確にライトサイジングすることはできませんでした。手動でのリソース最適化は少数精鋭のプラットフォームチームにはスケールせず、OpenCostを評価した結果も、運用と設定の負荷が大きすぎることが判明しました。

The Solution

PlayHQはDoiT経由でPerfectScaleを導入し、マルチテナントクラスタ全体でKubernetesのライトサイジングを自動化してEKSのコスト効率を改善しました。初回デモから1時間以内に、開発クラスタで自動化の運用を開始。PerfectScaleは、CPUとメモリのリクエストを継続的に調整する自動ライトサイジング、トラフィックが集中する土曜日の試合日に変更を防ぐメンテナンスウィンドウ、センシティブなワークロードを対象外にできるnamespaceレベルの除外設定、そして安定性を守りながらコストを削減する本番クラスタ向けのバランス型最適化ポリシーを提供しました。

Results

  • 非本番環境のKubernetesコストを40%削減
  • 本番環境のKubernetesコストを20%削減
  • 年間数万ドルを節約
  • ワークロード全体でパフォーマンスの一貫性を向上
  • テナント別Kubernetesコスト配分をリアルタイムで可視化
  • OOMアラートをはじめとするレジリエンス問題の検知と修復を迅速化
  • 初回デモから1時間以内に開発クラスタで自動化を構築

お客様ごとに利用パターンはまったく異なります。手動でのリソース最適化ではとてもスケールしませんでした。規模の大小を問わず、すべてのお客様に適切なサイズのインフラを提供しつつ、チームのリソースを消費しない自動化が必要だったのです。

Brad Quinn, PlayHQ リードプラットフォームエンジニア

コミュニティスポーツをKubernetesで支える

世界中で毎日、PlayHQは数千のコミュニティスポーツ大会を支える重要なデジタルインフラを運用しています。オーストラリアンフットボールのジュニアクラブ、バスケットボールリーグ、地域のネットボールやサッカーの協会など、有力なスポーツ団体が、利用が急増する試合のピーク時間帯にこのプラットフォームを頼りにしています。これらの団体はPlayHQを使って、数百のチームにまたがる参加登録、スコア管理、決済、大会運営を行っています。需要は競技・シーズン・地域によって大きく変動するため、インフラを効率的にスケールさせつつコストを抑えることは常に課題でした。この運用の中心にいるのが、リードプラットフォームエンジニアのBrad Quinn氏が率いるPlayHQのプラットフォームエンジニアリングチームで、Kubernetes環境の信頼性、パフォーマンス、コストを管理しています。「Kubernetesは私たちにとって非常に重要です。エンジニアの日々のワークフローそのものですから」とQuinn氏は語ります。PlayHQのコンピューティングの約90%がKubernetes上で稼働する中、顧客基盤の拡大に伴い、チームにはより自動化されたインテリジェントなコスト最適化のアプローチが必要でした。

PlayHQがKubernetesコスト最適化を優先した理由

PlayHQは、インフラコストの削減とテナントデプロイの迅速化を目的にECSからKubernetesへ移行しました。移行当初は削減効果が得られたものの、プラットフォームに参加する団体が増え、利用パターンが予測しにくくなるにつれ、コストは再び増加し始めました。「ECSからKubernetesへ移行し、当初は大きなコスト削減を実現しました」とQuinn氏。「しかし顧客基盤が拡大し、利用パターンが複雑になるにつれ、その効率を維持するには最適化のアプローチを進化させる必要がありました」。PlayHQはすでにKarpenterでノードを効率的にスケールさせ、HPAとKEDAで需要、特に週末のピークトラフィックに応じてキャパシティを調整していました。しかし、ワークロードの要求はテナントごとに大きく異なります。インフラレベルのオートスケーリングでキャパシティは確保できても、数百の小規模で変動の大きいワークロードにわたってCPUとメモリのリクエストを正確にライトサイジングするという課題は解決できませんでした。Quinn氏はOpenCostも評価しましたが、少数精鋭のプラットフォームチームには運用負荷が高すぎると判断しました。

PerfectScaleによるKubernetes最適化の自動化

PerfectScaleは、PlayHQのマルチテナントクラスタ全体でKubernetesのライトサイジングを自動化し、EKSのコスト効率を高める理想的なソリューションとしてすぐに浮上しました。導入スピードも決め手のひとつでした。「初回デモを受けてプラットフォームへのアクセスを取得し、1時間以内に開発クラスタで自動化をセットアップできました」とQuinn氏は語ります。PerfectScaleの機能はPlayHQの環境や運用リズムとよく合致しており、変更のタイミングと対象を完全にコントロールしながら、安全に最適化を自動化できました。主な機能には、CPUとメモリのリクエストを継続的に調整する自動ライトサイジング、土曜日の試合日などトラフィックが集中する時間帯の変更を防ぐメンテナンスウィンドウ、センシティブなワークロードへの変更を避けるnamespaceレベルの除外設定、コスト削減と安定性を両立させる本番クラスタ向けのバランス型最適化ポリシーが含まれます。

成果:コスト削減と問題解決の迅速化

DoiT経由でPerfectScaleを導入した後、PlayHQはコストと運用パフォーマンスの両面で大きな改善を達成しました。非本番環境のKubernetesコストを40%削減、本番環境のKubernetesコストを20%削減、年間数万ドルの節約、ワークロード全体でのパフォーマンスの一貫性向上、そしてテナント別コスト配分の可視性向上です。レジリエンスに関わる問題の検知と修復も迅速になりました。「OOMアラートのようなレジリエンス関連の機能のおかげで、解決までの時間が大幅に短縮されました」とQuinn氏。テナントごとのKubernetesコストをリアルタイムで把握できるようになったことで、Quinn氏はテナントごとの季節変動をより明確に捉え、最適化の価値を経営層に伝えやすくなりました。「テナントごとのコンピューティングコストをその場ですぐに確認できます」とQuinn氏は語ります。「削減した総額と解決した問題をCTOに共有できるのです」。

コスト意識の高いエンジニアリング文化の醸成

Kubernetes最適化の自動化が定着した今、PlayHQはPerfectScaleへのアクセスをプラットフォームチーム以外にも広げる計画です。プロダクトエンジニアリングの各スクワッドが自らSLOを管理し、設計上の意思決定がKubernetesのリソース使用量やインフラコストにどう影響するかを理解できるようにすることが狙いです。これは、クラブ、リーグ、そして家族に信頼性の高いデジタル体験を届け続けながら、エンジニアリングの実践を持続可能な成長と整合させるというPlayHQの長期的な目標を後押しするものです。

DoiTとの協業で実現する大規模なKubernetes最適化

Quinn氏は、長期的なパートナーとしてのDoiTとPerfectScaleの価値を強調しています。オンボーディングの際には、両チームが数時間以内に問題を特定・解決し、PlayHQのソリューションへの信頼をさらに強めました。最適化の自動化、大きなコスト削減、信頼性の向上により、プラットフォームチームはPlayHQの継続的な拡大を支えるために必要な運用効率と可視性を手にしています。

PerfectScaleがKubernetesの効率を高める仕組みを知る

PerfectScaleが手動チューニングなしでクラスタのライトサイジング、無駄の削減、パフォーマンス向上を支援する方法をご覧ください。

More customer stories

PicnicAI

Kubernetesワークロードの85〜90%を自動化——PicnicAIがPerfectScale by DoiTで信頼性を向上

85–90%
自動リサイズが適用されたアプリケーションワークロードの割合
50%
インフラチームがインフラ管理に費やす時間の削減率(概算)
Stefanini

PerfectScale by DoiTでKubernetesコンピューティングコストを26%削減

26%
Kubernetesコンピューティングコスト削減
>60%
過去1年間のインフラコスト削減
OneFootball

PerfectScale by DoiTがOneFootballのKubernetesを世界中のサッカートラフィックに合わせて最適化

25%
Kubernetesインフラコスト削減
80%
Kubernetesのコスト最適化とレジリエンシーチューニングに費やすエンジニアリング工数の削減
Luma Health

Luma Health、EKSコストを40%削減し年間数千時間のエンジニアリング工数を創出

90%
Kubernetes手動ライトサイジング時間の削減
40%
Amazon EKSコストの削減
+1,700h/year
信頼性とパフォーマンスへ再配分したエンジニアリング工数
SNCF

SNCFが実現した、K8sの無駄削減と大規模環境での信頼性向上

30%
コスト据え置きでのワークロード増加
30%
コスト据え置きで吸収したワークロード
~€500K
推定年間削減額
NOS

Kubernetesコストを半減、最適化への信頼を取り戻したNOS

50%
コスト削減
50%
最大クラスターでのコスト削減
0%
主要ノードプールのアイドルリソース
K1x

K1x、クラウドコストを大幅削減しKubernetes運用を効率化

Thousands
月間削減額
Thousands
クラウド費用の月間削減額
<10%
最適化前の過剰プロビジョニングノードのリソース使用率
Riftweaver

DevOpsエンジニア1人でRiftweaverをスケール——PerfectScaleの実力

59%
CPUスロットリング削減率
6
改善された重要API数
80,000+
ゲームダウンロード数