PerfectScalePerfectScale

このページはEnglish、Deutsch、Español、Français、Italiano、Portuguêsでもご覧いただけます。

Kubernetesワークロードの85〜90%を自動化——PicnicAIがPerfectScale by DoiTで信頼性を向上

PicnicAIがPerfectScale by DoiTを活用してワークロード最適化を自動化し、運用負荷を削減、エンジニアがインフラに自信を持てるようになった経緯をご紹介します。

PerfectScale
PicnicAI

The Challenge

PicnicAIのKubernetes環境が拡大するにつれ、チームは多くの企業が直面する課題に突き当たりました。個々のワークロードが実際にどれだけのCPUとメモリを必要としているのかを把握することです。

従来、リソース要件はワークロード作成時に大まかに見積もられ、問題が発生するまでそのまま放置されることがほとんどでした。ジョブごとに要件が大きく変動するデータ処理ワークロードでは、このアプローチは特に問題となっていました。

「以前のスケーリングは、ジョブを作る人が必要なメモリとCPUを推測で設定し、その後はOOM(メモリ不足エラー)が頻発するまで一切手を付けない、というやり方でした」 と、PicnicAIのインフラストラクチャエンジニアであるJosh Zarrabi氏は語ります。

ワークロードのリソースが不足すると、ジョブが失敗とリトライを繰り返し、キューが滞留して共有データベースに余計な負荷がかかります。逆に過剰に割り当てれば、不要なインフラ容量とクラウド支出が生じます。

この課題は、PicnicAIの少数精鋭のエンジニアリングチームにとってさらに深刻でした。インフラに関する意思決定の多くはすでに退職したエンジニアによるもので、既存の構成の背景をチームが常に把握できているわけではなかったのです。

最適化に取り組む動機のひとつはクラウドコストの削減でしたが、ほどなくして信頼性の向上がより重要な目標になりました。「信頼性の向上は私たちにとって非常に重要で、コスト削減はうれしいおまけでした」 とZarrabi氏は語ります。

The Solution

手動のライトサイジングから自動化へ

PicnicAIは、クラウドコスト最適化に向けた幅広い取り組みの一環としてDoiTとの協業を開始しました。DoiTは、ワークロード単位でのリソース使用状況の把握とKubernetes最適化の自動化を支援するため、PerfectScaleを導入しました。

PerfectScaleは、Kubernetesの詳細な可視化と、ワークロードの特性を踏まえた自動ライトサイジングを組み合わせ、常時の手動監視に頼ることなくCPUとメモリを最適化できるようにします。

PicnicAIでは、導入をあえて段階的に進めました。まず信頼性の改善と推奨内容への信頼の確立に注力し、その後、自動化の範囲を徐々に広げていきました。

非効率な構成の特定

PerfectScaleのInfraFit機能により、PicnicAIは非効率なインフラ構成を特定し、ワークロードとプロビジョニングされたリソースが噛み合っていない箇所を把握できるようになりました。

「PerfectScaleのInfraFitがあれば、『ここはワークロードに対して構成の形が合っていないから無駄が出ている』と判断するのがずっと簡単になります。構成の背景を必ずしも完全には把握できていない状況でも、自信を持って変更を加えられます」とZarrabi氏は語ります。

自動化と専門家によるサポートの組み合わせ

テクノロジーはソリューションの一部にすぎません。DoiTのField EngineeringチームとCustomer SuccessチームはPicnicAIに伴走し、Kubernetesの挙動の理解や、どこに自動化を安全に導入できるかの見極めを支援しました。

これには、HPA(水平ポッドオートスケーリング)とクラスターオートスケーラーの相互作用の検証、しきい値の調整、リソース要件に関する統制されたポリシーの導入などが含まれます。

PerfectScaleのポリシーとガードレール機能により、PicnicAIはすべてのワークロードで一斉に自動化を有効にするのではなく、最適化を適用する範囲と方法をコントロールできました。

よりセンシティブなワークロードは慎重に扱いながら、本番・ステージング・開発の各環境へと自動化を段階的に広げていきました。

Zarrabi氏にとって、プラットフォームに加えて継続的な技術サポートを受けられることも、この取り組みの重要な要素でした。「見守ってくれて、きちんとやれているか確認してくれる存在がいるのはありがたいです。製品を最大限に活用できているかを確かめられるのは助かります」と同氏は語ります。

Results

  • ワークロードの85〜90%を自動化
  • インフラチームがインフラ管理に費やす時間を約50%削減
  • 信頼性を向上させ、インフラ起因の割り込み作業を削減
  • 副次的効果としてコスト効率も改善
  • より価値の高い業務へエンジニアリングリソースを確保

「PerfectScaleのおかげで、Kubernetesの最適化を安心して自動化でき、エンジニアは本当に重要なものづくりに集中できています」

Josh Zarrabi, インフラストラクチャエンジニア

成果

ワークロードの85〜90%を自動化

運用面で最も大きな変化は、手動のリソース管理からの脱却です。PerfectScale導入前、PicnicAIにはワークロードの自動リサイズの仕組みがまったくありませんでした。現在では、アプリケーションクラスター全体でワークロードの約85〜90%が自動リサイズの対象になっています。

これにより、エンジニアが個々のワークロードを手動で確認・調整することなく、リソース要件を継続的に最適化できるようになりました。

信頼性の向上とインフラ起因の割り込み作業の削減

メリットは最適化そのものにとどまりません。PicnicAIではメモリ関連の問題が減少し、サイズ設定を誤ったワークロードに起因していた運用上の混乱も少なくなりました。

「気にすべき面倒事がひとつ減った、というだけの話です」 とZarrabi氏は語ります。

この変化は、少数精鋭のエンジニアリング組織にとって特に大きな意味を持ちます。インフラ管理の自動化を進めたことで、PicnicAIは運用負荷を増やすことなく、事業全体でより多くの仕事に取り組めるだけのチームのキャパシティを確保できました。

ジョブの失敗、キューの滞留、データベースへの不要な負荷の原因を繰り返し調査する代わりに、エンジニアは戦略的なインフラ施策やプロダクトの取り組みにより多くの時間を使えるようになっています。

副次的効果としてのコスト効率

信頼性の向上が今回の取り組みの第一の目的でしたが、成果はそれだけではありません。PerfectScaleのライトサイジングはワークロードの特性を踏まえて行われるため、リソース上限を一度推測で決めたまま見直されずに積み上がっていた過剰プロビジョニングの解消にも役立ち、信頼性の向上と同時に不要なインフラ支出も削減できました。

「信頼性の向上は私たちにとって非常に重要で、コスト削減はうれしいおまけでした」 とZarrabi氏は語ります。

すでに多くの優先事項を抱える少数精鋭のチームにとって、この組み合わせは自動化への投資を続ける十分な理由になっています。インフラ予算の引き締めとシステムの信頼性維持のどちらかを選ぶ必要はなく、その両方を実現できるからです。

より価値の高い業務へエンジニアリングリソースを確保

Kubernetesの手動管理が減ったことで、PicnicAIのエンジニアは、継続的インテグレーションのJenkinsからの移行や新たなAI施策の検討など、より長期的なプロジェクトに集中できるようになりました。

つまり、この取り組みの価値は、当初解決すべきだった信頼性の課題をはるかに超えています。従来はエンジニアの判断と介入を必要としていた作業を自動化することで、PicnicAIはインフラコストを削減し、貴重な技術リソースを解放し、自分たちが設定したわけではない過去の構成に対してもエンジニアが自信を持って向き合えるようになったのです。

「時間は本当に役立つことに使いたいですよね」 とZarrabi氏は言います。「メモリやCPUの上限を推測する作業は、そうではありません」

今後の展望

PicnicAIは、Kubernetes環境の進化に合わせてPerfectScaleの役割を今後も拡大していく計画です。より多くのワークロードへ自動化を広げつつ、よりセンシティブな本番インフラにも段階的に取り組んでいきます。

また、プラットフォームやAI施策の発展に伴い、DoiTの幅広いクラウドの専門知識も引き続き活用していきます。PicnicAIの目標は明快です。可能な限りインフラ最適化を自動化し、重要なヘルスケアワークロードに必要な信頼性を維持しながら、エンジニアがKubernetesの管理に費やす時間を減らし、患者アウトカムの改善につながるテクノロジーの開発により多くの時間を使えるようにすることです。

PicnicAIについて

PicnicAIは、人々の健康の向上を加速するインテリジェンスを開発するヘルステック企業です。同社のテクノロジーは大量の医療データを処理・検証し、製薬企業の研究者が観察臨床試験をより効率的に実施できるよう支援するとともに、患者の治療管理を手助けしています。

このミッションにおいて、クラウドインフラは重要な役割を担っています。PicnicAIは8〜9個のKubernetesクラスターを運用して自動化されたワークロードを支えていますが、そのCPUとメモリの要件は処理するデータによって大きく変動します。 PicnicAIにとって、信頼性の高いインフラの目的は突き詰めれば、エンジニアがKubernetesの手動管理に時間を費やすのではなく、ヘルスケアのイノベーションに集中できるようにすることにあります。

ワークロードごとのKubernetes CPU・メモリ上限の推測は、もう終わりに

Kubernetesのライトサイジングを安心して自動化

PerfectScale by DoiTがクラスター内で何を発見できるかをご確認ください。ワークロード単位の可視化、自動リサイズ、自在に制御できるポリシーガードレールを、DoiTのエンジニアによる伴走支援とともに提供します。

More customer stories

Stefanini

PerfectScale by DoiTでKubernetesコンピューティングコストを26%削減

26%
Kubernetesコンピューティングコスト削減
>60%
過去1年間のインフラコスト削減
OneFootball

PerfectScale by DoiTがOneFootballのKubernetesを世界中のサッカートラフィックに合わせて最適化

25%
Kubernetesインフラコスト削減
80%
Kubernetesのコスト最適化とレジリエンシーチューニングに費やすエンジニアリング工数の削減
Luma Health

Luma Health、EKSコストを40%削減し年間数千時間のエンジニアリング工数を創出

90%
Kubernetes手動ライトサイジング時間の削減
40%
Amazon EKSコストの削減
+1,700h/year
信頼性とパフォーマンスへ再配分したエンジニアリング工数
PlayHQ

PlayHQ、マルチテナントKubernetesのコストを最適化

40%
非本番環境のKubernetesコスト削減率
40%
非本番K8sコストの削減率
20%
本番K8sコストの削減率
SNCF

SNCFが実現した、K8sの無駄削減と大規模環境での信頼性向上

30%
コスト据え置きでのワークロード増加
30%
コスト据え置きで吸収したワークロード
~€500K
推定年間削減額
NOS

Kubernetesコストを半減、最適化への信頼を取り戻したNOS

50%
コスト削減
50%
最大クラスターでのコスト削減
0%
主要ノードプールのアイドルリソース
K1x

K1x、クラウドコストを大幅削減しKubernetes運用を効率化

Thousands
月間削減額
Thousands
クラウド費用の月間削減額
<10%
最適化前の過剰プロビジョニングノードのリソース使用率
Riftweaver

DevOpsエンジニア1人でRiftweaverをスケール——PerfectScaleの実力

59%
CPUスロットリング削減率
6
改善された重要API数
80,000+
ゲームダウンロード数