PerfectScalePerfectScale

Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.

PlayHQ ottimizza i costi Kubernetes multi-tenant

Come PlayHQ ha automatizzato il right-sizing Kubernetes e ottenuto visibilità in tempo reale sui costi per tenant con PerfectScale by DoiT

PerfectScale
PlayHQ

The Challenge

PlayHQ è migrata da ECS a Kubernetes ottenendo risparmi iniziali significativi, ma con l'espansione della base clienti multi-tenant i pattern di utilizzo sono diventati più complessi e imprevedibili. Con circa il 90% del compute in esecuzione su Kubernetes e centinaia di workloads piccoli e variabili distribuiti tra i tenant, l'autoscaling a livello di infrastruttura con Karpenter, HPA e KEDA garantiva la capacità, ma non permetteva di dimensionare con precisione le richieste di CPU e memoria a livello di workload. L'ottimizzazione manuale delle risorse non era scalabile per un team di piattaforma snello, e la valutazione di OpenCost ha evidenziato un overhead operativo eccessivo in termini di gestione e configurazione.

The Solution

PlayHQ ha adottato PerfectScale tramite DoiT per automatizzare il right-sizing di Kubernetes e migliorare l'efficienza dei costi EKS sui suoi cluster multi-tenant. Il team ha attivato l'automazione in un cluster dev entro un'ora dalla demo iniziale. PerfectScale ha fornito right-sizing automatizzato dei workloads con adeguamento continuo delle richieste di CPU e memoria, finestre di manutenzione che impediscono modifiche durante le giornate di gara del sabato ad alto traffico, esclusioni a livello di namespace per i workloads sensibili e policy di ottimizzazione bilanciate per i cluster di produzione, che tutelano la stabilità riducendo al contempo i costi.

Results

  • Riduzione del 40% dei costi Kubernetes non-production
  • Riduzione del 20% dei costi Kubernetes in produzione
  • Decine di migliaia di dollari risparmiati ogni anno
  • Performance più uniformi tra i workloads
  • Visibilità in tempo reale sull'allocazione dei costi Kubernetes per tenant
  • Rilevamento e risoluzione più rapidi dei problemi di resilienza, inclusi gli alert OOM
  • Automazione attivata in un cluster dev entro un'ora dalla demo iniziale

Ogni cliente ha pattern di utilizzo unici. L'ottimizzazione manuale delle risorse semplicemente non era scalabile: ci serviva l'automazione per garantire a ogni cliente, indipendentemente dalle dimensioni, un'infrastruttura dimensionata correttamente senza assorbire la capacità del nostro team.

Brad Quinn, Lead Platform Engineer, PlayHQ

Lo sport amatoriale gira su Kubernetes

Ogni giorno, in tutto il mondo, PlayHQ gestisce l'infrastruttura digitale critica di migliaia di competizioni sportive amatoriali. Organizzazioni sportive di primo piano — tra cui club giovanili di football australiano, leghe di basket e associazioni locali di netball e calcio — si affidano alla piattaforma nei momenti di picco delle partite, quando l'utilizzo aumenta bruscamente. Queste organizzazioni usano PlayHQ per gestire iscrizioni, punteggi, pagamenti e operazioni di gara per centinaia di squadre. Con una domanda che varia notevolmente in base a sport, stagione e area geografica, scalare l'infrastruttura in modo efficiente e tenere sotto controllo i costi è una sfida costante. Al centro di tutto c'è il gruppo di platform engineering di PlayHQ, guidato dal Lead Platform Engineer Brad Quinn, responsabile di affidabilità, performance e costi dell'ambiente Kubernetes. "Kubernetes è fondamentale per noi: è il flusso di lavoro quotidiano dei nostri Engineers", afferma Quinn. Con circa il 90% del compute di PlayHQ in esecuzione su Kubernetes, il team aveva bisogno di un approccio più automatizzato e intelligente all'ottimizzazione dei costi, man mano che la base clienti cresceva.

Perché PlayHQ ha dato priorità all'ottimizzazione dei costi Kubernetes

PlayHQ è passata da ECS a Kubernetes per ridurre i costi infrastrutturali e accelerare i deployment dei tenant. La migrazione ha portato risparmi immediati, ma i costi hanno ripreso a salire man mano che nuove organizzazioni si univano alla piattaforma e i pattern di utilizzo diventavano più imprevedibili. "Siamo passati da ECS a Kubernetes ottenendo risparmi iniziali significativi", racconta Quinn. "Con l'espansione della base clienti e pattern di utilizzo sempre più complessi, dovevamo far evolvere il nostro approccio all'ottimizzazione per mantenere quell'efficienza." PlayHQ utilizzava già Karpenter per scalare i nodi in modo efficiente e si affidava a HPA e KEDA per adeguare la capacità alla domanda, in particolare durante i picchi di traffico del weekend. Le esigenze dei workloads, però, variavano notevolmente da tenant a tenant. L'autoscaling a livello di infrastruttura garantiva la capacità, ma non risolveva il problema del right-sizing accurato delle richieste di CPU e memoria su centinaia di workloads piccoli e variabili. Quinn ha valutato anche OpenCost, ma l'overhead operativo si è rivelato eccessivo per un team di piattaforma snello.

Come PerfectScale ha automatizzato l'ottimizzazione di Kubernetes

PerfectScale si è rapidamente affermata come la soluzione ideale per automatizzare il right-sizing di Kubernetes e migliorare l'efficienza dei costi EKS sui cluster multi-tenant di PlayHQ. La velocità è stata un elemento chiave: "Abbiamo fatto la demo iniziale, ottenuto l'accesso alla piattaforma e attivato l'automazione in un cluster dev nel giro di un'ora", racconta Quinn. Le funzionalità di PerfectScale si adattavano perfettamente all'ambiente e ai ritmi operativi di PlayHQ, permettendo al team di automatizzare l'ottimizzazione in sicurezza e mantenere il pieno controllo su quando e dove applicare le modifiche. Tra le funzionalità principali: right-sizing automatizzato dei workloads per adeguare continuamente le richieste di CPU e memoria, finestre di manutenzione che impediscono modifiche nei periodi sportivi ad alto traffico come le giornate di gara del sabato, esclusioni a livello di namespace per non toccare i workloads sensibili e policy di ottimizzazione bilanciate per i cluster di produzione, che garantiscono stabilità e riduzione dei costi allo stesso tempo.

I risultati: costi più bassi e risoluzione più rapida dei problemi

Dopo l'adozione di PerfectScale tramite DoiT, PlayHQ ha ottenuto miglioramenti significativi sia sui costi sia sulle performance operative: una riduzione del 40% dei costi Kubernetes non-production, una riduzione del 20% dei costi Kubernetes in produzione, decine di migliaia di dollari risparmiati ogni anno, performance più uniformi tra i workloads e maggiore visibilità sull'allocazione dei costi per tenant. Il team ha inoltre riscontrato tempi più rapidi di rilevamento e risoluzione dei problemi di resilienza. "Le funzioni legate alla resilienza, come gli alert OOM, rendono i tempi di risoluzione molto più rapidi", afferma Quinn. La visibilità in tempo reale sui costi Kubernetes per tenant offre a Quinn un quadro più chiaro della stagionalità dei diversi tenant e rafforza il modo in cui comunica il valore dell'ottimizzazione al management. "Possiamo ottenere al volo i costi di compute per tenant", spiega Quinn. "Poi posso condividere con il CTO il totale risparmiato e i problemi risolti."

Costruire una cultura ingegneristica attenta ai costi

Con l'ottimizzazione automatizzata di Kubernetes ormai operativa, PlayHQ prevede di estendere l'accesso a PerfectScale oltre il team di piattaforma. L'obiettivo è aiutare le squad di product engineering a gestire i propri SLO e a capire come le decisioni di design influenzino l'utilizzo delle risorse Kubernetes e i costi infrastrutturali. Un passo che sostiene l'obiettivo di lungo periodo di PlayHQ: allineare le pratiche di ingegneria a una crescita sostenibile, continuando a offrire esperienze digitali affidabili a club, leghe e famiglie.

La partnership con DoiT per l'ottimizzazione di Kubernetes su larga scala

Quinn ha sottolineato il valore di DoiT e PerfectScale come partner di lungo periodo. Durante l'onboarding, i team hanno individuato e risolto un problema nel giro di poche ore, rafforzando ulteriormente la fiducia di PlayHQ nella soluzione. Con l'ottimizzazione automatizzata, risparmi concreti e una maggiore affidabilità, il team di piattaforma dispone dell'efficienza operativa e della visibilità necessarie per sostenere la continua espansione di PlayHQ.

Scopra come PerfectScale migliora l'efficienza di Kubernetes

Scopra come PerfectScale aiuta i team a dimensionare correttamente i cluster, ridurre gli sprechi e migliorare le performance senza interventi manuali.

More customer stories

PicnicAI

PicnicAI automatizza l'85-90% dei workload Kubernetes e migliora l'affidabilità con PerfectScale by DoiT

85–90%
dei workload applicativi ora coperti dal resizing automatico
50%
riduzione approssimativa del tempo che il team infrastruttura dedica all'infrastruttura
Stefanini

Stefanini taglia del 26% i costi di compute Kubernetes con PerfectScale by DoiT

26%
Riduzione dei costi di compute Kubernetes
>60%
Riduzione dei costi di infrastruttura nell'ultimo anno
OneFootball

PerfectScale by DoiT aiuta OneFootball a ottimizzare Kubernetes per il traffico calcistico globale su larga scala

25%
di riduzione dei costi dell'infrastruttura Kubernetes
80%
di riduzione del lavoro di engineering dedicato all'ottimizzazione dei costi e al tuning della resilienza su Kubernetes
Luma Health

Luma Health taglia del 40% i costi di EKS e libera migliaia di ore di engineering all'anno

90%
Tempo in meno sul rightsizing manuale di Kubernetes
40%
Riduzione dei costi di Amazon EKS
+1,700h/year
Ore di engineering reindirizzate ad affidabilità e prestazioni
SNCF

Come SNCF ha ridotto gli sprechi su K8s aumentando l'affidabilità su larga scala

30%
Più workloads a costi invariati
30%
Workloads in più assorbiti a costi invariati
~€500K
Risparmi annualizzati stimati
NOS

NOS dimezza i costi Kubernetes e ricostruisce la fiducia nell'ottimizzazione

50%
Riduzione dei costi
50%
Riduzione dei costi sul cluster più grande
0%
Risorse inattive sui node pool principali
K1x

K1x abbatte i costi cloud e semplifica le operazioni Kubernetes

Thousands
Risparmio mensile
Thousands
Risparmio mensile sulla spesa cloud
<10%
Utilizzo delle risorse sui nodi sovradimensionati prima dell'ottimizzazione
Riftweaver

Come PerfectScale permette a un team DevOps di una sola persona di scalare Riftweaver

59%
Riduzione del throttling della CPU
6
API critiche migliorate
80,000+
Download del gioco