Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.

Luma Health taglia del 40% i costi di EKS e libera migliaia di ore di engineering all'anno

Il team SRE di Luma Health ha recuperato il 90% del tempo dedicato all'ottimizzazione manuale di Kubernetes e ha risparmiato circa il 40% della spesa annua per EKS adottando PerfectScale by DoiT sui propri cluster Amazon EKS. I risparmi hanno liberato budget che il team ha reinvestito in un'infrastruttura di cache critica per le prestazioni, tutelando l'esperienza dei pazienti su cui contano oltre 600 sistemi sanitari.

PerfectScale
Luma Health

The Challenge

L'ottimizzazione manuale di Kubernetes costava più di quanto facesse risparmiare

Il team finance di Luma Health impone a ogni reparto un budget cloud rigoroso, ancorato agli obiettivi di margine lordo dell'azienda. Per il team SRE di Caio, questo significava un ciclo mensile senza tregua. "Nel team SRE dedicavamo almeno 20 ore al mese all'ottimizzazione dei costi. Eravamo continuamente impegnati ad analizzare le metriche, capire dove i costi crescevano e definire action item di follow-up per contenerli." racconta Caio.

Il processo era logorante. Gli engineer analizzavano le metriche di Datadog, valutavano l'utilizzo di CPU e memoria su centinaia di pod e modificavano manualmente request e limit delle risorse per deployment e DaemonSet. Avevano provato strumenti di AI generalisti come Claude e ChatGPT per velocizzare l'analisi, ma i risultati erano discontinui.

Il tuning delle risorse Kubernetes richiede di tenere conto della stagionalità del traffico, dei pattern specifici dei workloads e degli effetti a cascata che una singola modifica può avere su centinaia di pod. Una riduzione anche modesta dell'allocazione di CPU può mettere in crisi un servizio. Un limite di memoria troppo conservativo può causare crash per out-of-memory e riavvii dei pod. Il team di Caio intercettava la maggior parte di questi rischi, ma il margine d'errore era stretto e l'impegno in termini di tempo non era sostenibile.

Caio si trovava sempre nella stessa conversazione: giustificare al finance l'aumento di spesa, oppure trovare altrove risparmi equivalenti per compensare l'investimento. "A tutti sta a cuore la soddisfazione del cliente," spiega Caio, "e il cliente non è soddisfatto se una pagina ci mette 10 secondi a caricarsi." Al team SRE serviva un modo per ottimizzare i costi di Kubernetes con sicurezza, così da reinvestire quei risparmi nell'infrastruttura su cui i pazienti fanno affidamento.

The Solution

Perché Luma Health ha scelto PerfectScale

Caio ha scoperto PerfectScale by DoiT mentre stava valutando strumenti di ottimizzazione per Kubernetes. Racconta: "PerfectScale si è rivelato la scelta giusta fin da subito. Non ho nemmeno portato avanti i trial con gli altri strumenti."

PerfectScale ha dato al team di Caio un'ottimizzazione automatizzata e consapevole del contesto, impensabile con il processo manuale. Il punto chiave: policy di ottimizzazione tarate su diverse tolleranze al rischio. "Usiamo profili specifici. Negli ambienti lower adottiamo un approccio più aggressivo all'ottimizzazione dei costi. In produzione, un approccio più bilanciato." spiega Caio, "In base a output e metriche, possiamo applicare facilmente queste modifiche alla nostra piattaforma."

Negli ambienti non di produzione, l'automazione di PerfectScale lavora in continuo, facendo il rightsizing dei pod per ridurre al minimo gli sprechi senza interventi manuali. In produzione, la policy bilanciata mette sul piatto il risparmio sui costi e le garanzie di affidabilità che la sanità impone. La distinzione conta: una piattaforma che serve 100 milioni di pazienti non può permettersi in produzione la stessa aggressività che funziona in un cluster di staging a carico minimo.

Le raccomandazioni di PerfectScale si basano su un'analisi continua dei workloads e non su semplici medie, considerando la stagionalità del traffico e i picchi di utilizzo che mandavano in difficoltà il processo precedente del team. Caio osserva che la stragrande maggioranza delle raccomandazioni si è dimostrata sicura da applicare in produzione, mentre negli ambienti lower il sistema applica le modifiche in automatico.

"Il fattore fiducia è stato determinante. Oltre il 90% delle raccomandazioni erano accurate. Si potevano applicare in produzione in sicurezza" racconta Caio.

Il team di supporto di PerfectScale ha offerto un affiancamento concreto per tutta la durata del deployment, aiutando a calibrare le policy e a gestire i casi limite man mano che il team di Caio estendeva l'automazione ai vari cluster.

Results

  • 90% di tempo in meno sul rightsizing manuale di Kubernetes
  • 40% di riduzione dei costi di Amazon EKS
  • +1.700 h/anno di engineering reindirizzate ad affidabilità e prestazioni

PerfectScale ci ha tagliato del 40% la spesa totale per EKS, e le automazioni gestiscono quello che prima richiedeva al team 20 ore al mese. Oggi dedichiamo quel tempo ad affidabilità e prestazioni, invece di rincorrere le metriche di costo.

Caio Cristo, Director of Infrastructure/SRE

Chi è Luma Health

Luma Health sviluppa la Patient Success Platform su cui contano oltre 600 sistemi sanitari, network specialistici e cliniche degli Stati Uniti per mettere in contatto i pazienti con le cure. La piattaforma orchestra i percorsi dei pazienti, dalla prenotazione alla comunicazione fino ai flussi clinici e finanziari, al servizio di oltre 100 milioni di pazienti. Quando il sistema di un operatore sanitario rallenta o va offline, ci sono persone reali che saltano appuntamenti, ritardano le cure o perdono fiducia nel proprio team medico. In Luma Health, uptime e prestazioni non sono concetti astratti: sono outcome per i pazienti.

Caio Cristo, Director of Infrastructure, guida un team SRE distribuito a livello globale composto da nove engineer tra Brasile ed Europa. Il team si occupa di tutto, dall'orchestrazione dei container all'infrastructure-as-code, fino alla strategia cloud di lungo periodo.

Con la crescita di Luma Health è cresciuta anche la complessità del suo ambiente Amazon EKS. Il team utilizzava già Karpenter per lo scaling dei nodi, KEDA per l'autoscaling orizzontale dei pod su trigger RabbitMQ, HTTP e database, e Datadog per l'observability. Il tooling era moderno. La vera sfida era tenere sotto controllo i costi senza compromettere l'affidabilità che la sanità richiede.

Riduzione del 40% dei costi di EKS e oltre 1.700 ore di engineering recuperate

L'impatto è stato immediato. Già nel primo ciclo di ottimizzazione, PerfectScale ha individuato una riduzione del 40% dei costi specifici di EKS, che pesano per circa il 15% sulla spesa AWS complessiva di Luma Health.

Il risparmio di tempo si è rivelato altrettanto dirompente. Il team SRE di Caio ha registrato una riduzione del 90% del tempo dedicato al rightsizing di Kubernetes, liberando engineer distribuiti su tre fusi orari e permettendo loro di concentrarsi sul lavoro che fa davvero crescere la piattaforma.

Ma forse l'aspetto più importante è un altro: PerfectScale ha fornito a Caio una risposta credibile nella ricorrente conversazione sul budget con il team finance di Luma Health. Quando il layer di cache ha richiesto investimenti aggiuntivi per mantenere le prestazioni applicative, il team SRE ha potuto portare in tavola i risparmi Kubernetes verificati come contropartita. La conversazione si è spostata dal difendere i costi al riallocare strategicamente i risparmi. AWS ha continuato a garantire una base di compute affidabile e scalabile tramite Amazon EKS, mentre PerfectScale by DoiT ha fatto in modo che ogni dollaro speso su quella base rendesse al massimo.

"Un aspetto in cui PerfectScale ci ha aiutati molto è bilanciare questi costi. Dobbiamo aumentare il nostro layer di cache, ma c'è qualcosa che possiamo risparmiare dall'altra parte? La prima volta che abbiamo applicato le raccomandazioni, siamo arrivati a circa il 40% di risparmio annuo su EKS. Questo aiuta sicuramente nelle conversazioni in cui dobbiamo difendere le nostre posizioni su affidabilità e risparmio sui costi." Caio Cristo, Director of Infrastructure di Luma Health

Uno stack di ottimizzazione Kubernetes best-in-class su AWS

Con PerfectScale a gestire l'ottimizzazione a livello di workloads, Luma Health dispone oggi di una pipeline di autoscaling e ottimizzazione su tutto lo stack Kubernetes in AWS. Karpenter gestisce lo scaling a livello di nodo, KEDA guida l'autoscaling orizzontale dei pod su trigger RabbitMQ, HTTP e database, e PerfectScale ottimizza in continuo request e limit delle risorse, che determinano quanto efficientemente ogni pod sfrutta la capacità messa a disposizione da Karpenter.

Il risultato è un ambiente Amazon EKS che scala in modo efficiente su ogni livello: infrastruttura, numero di pod e risorse dei singoli workloads. Man mano che la piattaforma cresce per servire più sistemi sanitari e più pazienti, questo stack cresce con lei, moltiplicando nel tempo il valore dell'ottimizzazione automatizzata.

Caio e il suo team continuano a collaborare con il team di supporto di PerfectScale per affinare le policy di automazione nei vari ambienti, mantenendo il giusto equilibrio tra efficienza dei costi e affidabilità con l'evolvere dei workloads. L'obiettivo è semplice: tenere prevedibili i costi di Kubernetes mentre Luma Health porta avanti la sua missione, rendere la sanità più efficace per ogni paziente.

More customer stories

OneFootball

PerfectScale by DoiT aiuta OneFootball a ottimizzare Kubernetes per il traffico calcistico globale su larga scala

25%
di riduzione dei costi dell'infrastruttura Kubernetes
80%
di riduzione del lavoro di engineering dedicato all'ottimizzazione dei costi e al tuning della resilienza su Kubernetes
PlayHQ

PlayHQ automatizza l'ottimizzazione di Kubernetes con PerfectScale

40%
Reduction in non-production Kubernetes costs
40%
Reduction in non-production K8s costs
20%
Reduction in production K8s costs
SNCF

SNCF taglia del 30% i costi Kubernetes con PerfectScale

30%
Riduzione dei costi
~€500K
Estimated Annualized Savings
250
Clusters Under Optimization
NOS

NOS abbatte i costi di Kubernetes in un ambiente multi-cluster

50%
Cost Reduction
50%
Cost reduction on largest cluster
0%
Idle resources on main node pools
K1x

K1x abbatte i costi cloud e semplifica le operazioni Kubernetes

Thousands
Saved Per Month
Thousands
Saved per month on cloud spend
<10%
Resource utilization on over-provisioned nodes before optimization
Trax

Come Trax ha ridotto del 75% la spesa Kubernetes con PerfectScale

75%
Riduzione dei costi K8s
Riftweaver

Riftweaver ottimizza l'ambiente Kubernetes con PerfectScale

59%
Reduction in CPU Throttling
6
Critical APIs Improved
80,000+
Game Downloads
Rapyd

Rapyd riduce i costi cloud del 35-40% con PerfectScale

35-40%
Riduzione dei costi cloud
15+
AWS EKS Clusters Optimized
100+
Countries Supported for Payments