PerfectScalePerfectScale

Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.

PlayHQ optimise ses coûts Kubernetes multi-tenant

Comment PlayHQ a automatisé le right-sizing Kubernetes et gagné une visibilité en temps réel sur les coûts par tenant avec PerfectScale by DoiT

PerfectScale
PlayHQ

The Challenge

PlayHQ a migré d'ECS vers Kubernetes et réalisé d'importantes économies initiales, mais à mesure que sa base clients multi-tenant s'élargissait, les schémas d'utilisation sont devenus plus complexes et imprévisibles. Avec environ 90 % du compute exécuté sur Kubernetes et des centaines de petits workloads variables répartis entre les tenants, l'autoscaling au niveau de l'infrastructure avec Karpenter, HPA et KEDA garantissait la capacité, mais ne permettait pas d'ajuster précisément les requests CPU et mémoire au niveau des workloads. L'optimisation manuelle des ressources n'était pas viable à cette échelle pour une équipe plateforme réduite, et l'évaluation d'OpenCost a révélé une charge opérationnelle trop lourde à exploiter et à configurer.

The Solution

PlayHQ a adopté PerfectScale via DoiT pour automatiser le right-sizing Kubernetes et améliorer l'efficacité des coûts EKS sur ses clusters multi-tenant. L'équipe a mis l'automatisation en place dans un cluster de dev moins d'une heure après la démo initiale. PerfectScale a apporté un right-sizing automatisé des workloads qui ajuste en continu les requests CPU et mémoire, des fenêtres de maintenance qui bloquent toute modification pendant les journées de match du samedi à fort trafic, des exclusions au niveau des namespaces pour les workloads sensibles, ainsi que des politiques d'optimisation équilibrées pour les clusters de production, qui préservent la stabilité tout en réduisant les coûts.

Results

  • Réduction de 40 % des coûts Kubernetes hors production
  • Réduction de 20 % des coûts Kubernetes en production
  • Des dizaines de milliers de dollars économisés chaque année
  • Des performances plus homogènes sur l'ensemble des workloads
  • Visibilité en temps réel sur l'allocation des coûts Kubernetes par tenant
  • Détection et résolution plus rapides des problèmes de résilience, y compris les alertes OOM
  • Automatisation opérationnelle dans un cluster de dev moins d'une heure après la démo initiale

Chaque client a des schémas d'utilisation qui lui sont propres. L'optimisation manuelle des ressources n'était tout simplement plus tenable à cette échelle : il nous fallait de l'automatisation pour garantir à chaque client, quelle que soit sa taille, une infrastructure correctement dimensionnée, sans mobiliser la capacité de notre équipe.

Brad Quinn, Lead Platform Engineer, PlayHQ

Le sport amateur propulsé par Kubernetes

Chaque jour, aux quatre coins du monde, PlayHQ fait tourner l'infrastructure numérique critique de milliers de compétitions sportives amateurs. De grandes organisations sportives — clubs juniors de football australien, ligues de basketball, associations locales de netball et de football — s'appuient sur la plateforme pendant les pics de match, quand l'utilisation grimpe en flèche. Ces organisations utilisent PlayHQ pour gérer les inscriptions, les scores, les paiements et l'organisation des compétitions pour des centaines d'équipes. La demande variant fortement selon le sport, la saison et la région, faire évoluer l'infrastructure efficacement tout en maîtrisant les coûts est un défi permanent. Au cœur de ce dispositif se trouve l'équipe platform engineering de PlayHQ, dirigée par le Lead Platform Engineer Brad Quinn, qui gère la fiabilité, les performances et les coûts de l'environnement Kubernetes. "Kubernetes est essentiel pour nous : c'est le quotidien de nos ingénieurs", explique Quinn. Avec environ 90 % du compute de PlayHQ exécuté sur Kubernetes, l'équipe avait besoin d'une approche plus automatisée et intelligente de l'optimisation des coûts à mesure que sa base clients s'élargissait.

Pourquoi PlayHQ a fait de l'optimisation des coûts Kubernetes une priorité

PlayHQ a migré d'ECS vers Kubernetes pour réduire ses coûts d'infrastructure et accélérer les déploiements par tenant. Si la migration a généré des économies immédiates, les coûts ont recommencé à grimper à mesure que de nouvelles organisations rejoignaient la plateforme et que les schémas d'utilisation devenaient plus imprévisibles. "Nous sommes passés d'ECS à Kubernetes et avons réalisé d'importantes économies initiales, explique Quinn. Avec l'expansion de notre base clients et la complexification des usages, nous devions faire évoluer notre approche d'optimisation pour préserver cette efficacité." PlayHQ utilisait déjà Karpenter pour dimensionner efficacement ses nœuds et s'appuyait sur HPA et KEDA pour ajuster la capacité en fonction de la demande, notamment lors des pics de trafic du week-end. Mais les besoins variaient fortement d'un tenant à l'autre. L'autoscaling au niveau de l'infrastructure garantissait la capacité, sans résoudre le défi du dimensionnement précis des requests CPU et mémoire sur des centaines de petits workloads variables. Quinn a également évalué OpenCost, mais a jugé la charge opérationnelle trop lourde pour une équipe plateforme réduite.

Comment PerfectScale a automatisé l'optimisation Kubernetes

PerfectScale s'est rapidement imposé comme la solution idéale pour automatiser le right-sizing Kubernetes et améliorer l'efficacité des coûts EKS sur les clusters multi-tenant de PlayHQ. La rapidité a été un facteur clé : "Nous avons eu la démo initiale, obtenu l'accès à la plateforme et mis l'automatisation en place dans un cluster de dev en moins d'une heure", raconte Quinn. Les capacités de PerfectScale correspondaient parfaitement à l'environnement et aux rythmes opérationnels de PlayHQ, permettant à l'équipe d'automatiser l'optimisation en toute sécurité, tout en gardant le contrôle total du moment et du périmètre des changements. Parmi les fonctionnalités clés : le right-sizing automatisé des workloads pour ajuster en continu les requests CPU et mémoire, des fenêtres de maintenance qui bloquent toute modification pendant les périodes sportives à fort trafic comme les matchs du samedi, des exclusions au niveau des namespaces pour préserver les workloads sensibles, et des politiques d'optimisation équilibrées pour les clusters de production, garantes de stabilité tout en réduisant les coûts.

Résultats : des coûts réduits et une résolution plus rapide des incidents

Après avoir adopté PerfectScale via DoiT, PlayHQ a enregistré des améliorations significatives, tant sur les coûts que sur la performance opérationnelle : une réduction de 40 % des coûts Kubernetes hors production, une réduction de 20 % des coûts en production, des dizaines de milliers de dollars économisés chaque année, des performances plus homogènes sur l'ensemble des workloads et une meilleure visibilité sur l'allocation des coûts par tenant. L'équipe a aussi constaté une détection et une résolution plus rapides des problèmes de résilience. "Tout ce qui touche à la résilience, comme les alertes OOM, accélère nettement le temps de résolution", souligne Quinn. La visibilité en temps réel sur les coûts Kubernetes par tenant offre à Quinn une lecture plus claire de la saisonnalité selon les tenants et renforce sa capacité à démontrer la valeur de l'optimisation auprès de la direction. "Nous pouvons obtenir à la volée les coûts de compute par tenant, explique Quinn. Je peux ensuite partager avec le CTO le total des économies réalisées et des problèmes résolus."

Instaurer une culture d'ingénierie attentive aux coûts

Maintenant que l'optimisation Kubernetes est automatisée, PlayHQ prévoit d'étendre l'accès à PerfectScale au-delà de l'équipe plateforme. L'objectif : permettre aux squads de product engineering de gérer leurs propres SLO et de comprendre comment leurs choix de conception influencent l'utilisation des ressources Kubernetes et les coûts d'infrastructure. Une démarche qui sert l'ambition de long terme de PlayHQ : aligner les pratiques d'ingénierie sur une croissance durable, tout en continuant d'offrir des expériences numériques fiables aux clubs, aux ligues et aux familles.

Un partenariat avec DoiT pour optimiser Kubernetes à grande échelle

Quinn a souligné la valeur de DoiT et de PerfectScale en tant que partenaires de long terme. Lors de l'onboarding, les équipes ont identifié et résolu un problème en quelques heures, renforçant encore la confiance de PlayHQ dans la solution. Avec une optimisation automatisée, des économies significatives et une fiabilité accrue, l'équipe plateforme dispose de l'efficacité opérationnelle et de la visibilité nécessaires pour accompagner l'expansion continue de PlayHQ.

Découvrez comment PerfectScale améliore l'efficacité de Kubernetes

Explorez comment PerfectScale aide les équipes à dimensionner leurs clusters au plus juste, à réduire le gaspillage et à améliorer les performances, sans réglages manuels.

More customer stories

PicnicAI

PicnicAI automatise 85 à 90 % de ses workloads Kubernetes et gagne en fiabilité avec PerfectScale by DoiT

85–90%
des workloads applicatifs désormais couverts par le redimensionnement automatisé
50%
de réduction approximative du temps consacré par l'équipe à la gestion de l'infrastructure
Stefanini

Stefanini réduit de 26 % ses coûts de compute Kubernetes grâce à PerfectScale by DoiT

26%
De réduction des coûts de compute Kubernetes
>60%
De réduction des coûts d'infrastructure au cours de l'année écoulée
OneFootball

PerfectScale by DoiT aide OneFootball à optimiser Kubernetes face au trafic football mondial à grande échelle

25%
De réduction des coûts d'infrastructure Kubernetes
80%
De réduction de l'effort d'ingénierie consacré à l'optimisation des coûts et au réglage de la résilience Kubernetes
Luma Health

Luma Health réduit ses coûts EKS de 40 % et libère des milliers d'heures d'ingénierie par an

90%
De temps en moins sur le rightsizing manuel de Kubernetes
40%
De réduction des coûts Amazon EKS
+1,700h/year
D'heures d'ingénierie réorientées vers la fiabilité et la performance
SNCF

Comment la SNCF a éliminé le gaspillage K8s et renforcé sa fiabilité à grande échelle

30%
De workloads en plus à coût constant
30%
De workloads absorbés en plus à coût constant
~€500K
D'économies annualisées estimées
NOS

NOS divise ses coûts Kubernetes par deux et retrouve confiance dans l'optimisation

50%
Réduction des coûts
50%
De réduction des coûts sur le plus grand cluster
0%
De ressources inutilisées sur les node pools principaux
K1x

K1x réduit drastiquement ses coûts cloud et simplifie ses opérations Kubernetes

Thousands
D'économies par mois
Thousands
D'économies mensuelles sur les dépenses cloud
<10%
D'utilisation des ressources sur les nœuds surdimensionnés avant optimisation
Riftweaver

Un seul ingénieur DevOps pour faire évoluer Riftweaver, grâce à PerfectScale

59%
De réduction du throttling CPU
6
API critiques améliorées
80,000+
Téléchargements du jeu