Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.

Come Trax ha ridotto del 75% la spesa Kubernetes con PerfectScale

Un leader della retail technology ripensa la propria strategia FinOps con l'ottimizzazione AI su oltre 200 microservizi

PerfectScale
Trax

The Challenge

Trax doveva rispondere a obiettivi di efficienza stringenti fissati dalla leadership, ma si è scontrata con diversi ostacoli nell'ottimizzazione dei cluster Kubernetes. L'ottimizzazione manuale con VPA e strumenti di monitoraggio non offriva la chiarezza necessaria ed era difficile da portare su larga scala. Le decisioni di approvazione si basavano sull'intuito più che sui dati, con conseguente carico operativo per l'engineering e rischi sui servizi.

The Solution

PerfectScale ha portato visibilità in tempo reale a livello di workload sull'ambiente Trax, composto da oltre 200 microservizi. L'intelligence guidata dall'AI ha reso possibile un'ottimizzazione sicura e basata su evidenze, nel pieno rispetto degli SLO. La piattaforma ha sostituito uno strumento FinOps poco efficace, offrendo dettagli di costo granulari e raccomandazioni operative.

Results

  • Riduzione del 75% dei costi Kubernetes in un singolo cluster, con risparmi annui a sei cifre
  • Sostituito uno strumento FinOps poco efficace senza aumentare il budget
  • Migliorata la metrica "cost per processing" grazie alla ri-architettura dei servizi
  • Accelerato il processo decisionale con raccomandazioni guidate dall'AI

Siamo riusciti a sostituire uno strumento FinOps che stavamo utilizzando e che non forniva dettagli granulari sui costi né indicazioni concrete su come ottimizzare il nostro ambiente. PerfectScale by DoiT è uno strumento pensato per i team di engineering, non solo per il finance: per noi è stato molto più semplice ottenere l'impatto sui costi che cercavamo.

Mark Serdze, Director of Cloud Infrastructure di Trax

Chi è Trax

La missione di Trax è permettere a brand e retailer di sfruttare la potenza delle tecnologie digitali per offrire ai clienti la migliore shopping experience possibile. Le sue innovazioni di riferimento nel settore e l'eccellenza nello sviluppo di tecnologie avanzate e di metodi autonomi di raccolta dati alimentano esperienze positive per gli shopper e aprono nuove opportunità di ricavo in ogni punto vendita. Il portfolio di soluzioni Trax mette a disposizione metriche, analytics e servizi mission-critical che aiutano i clienti a risparmiare tempo e denaro migliorando la shopping experience. Kubernetes è una componente chiave dell'infrastruttura, perché consente a Trax di innovare in modo continuo le proprie soluzioni e di garantire la scalabilità necessaria a rispondere costantemente alla domanda. Trax è cresciuta fino a diventare un ambiente multicloud e multi-cluster di grandi dimensioni, a supporto di clienti in oltre 90 Paesi, tra cui alcune delle più grandi aziende al mondo.

La sfida

All'inizio dell'anno il Chief Financial Officer (CFO) ha definito obiettivi ambiziosi di efficienza e unit economics per l'intera organizzazione. Per Mark Serdze, Director of Cloud Infrastructure, e per il suo team, questo significava agire rapidamente per ottimizzare i costi cloud. Fuori da Kubernetes Trax ha ottenuto risultati immediati, ma all'interno dei propri cluster ha incontrato ostacoli nell'ottimizzare in sicurezza e su larga scala. Il team ha iniziato a lavorare manualmente con le metriche disponibili, utilizzando Vertical Pod Autoscaler (VPA), log dei cluster e soluzioni di monitoraggio. Un approccio che non garantiva una visione chiara e che era difficile scalare in modo efficiente senza ingenti interventi di sviluppo. Il team finiva così per agire in modo ad hoc e reattivo, con un impatto minimo sugli obiettivi. Anche gli strumenti già in uso introducevano frizione nel processo di ottimizzazione. Pur individuando potenziali opportunità, le approvazioni sulla migliore linea d'azione si fondavano sull'intuito anziché sull'evidenza. La scarsa visibilità ha portato ad alcuni passi falsi, generando ulteriore carico operativo per l'engineering, tensioni interne e rischi capaci di compromettere la resilienza dei servizi.

La soluzione

Poco dopo aver implementato PerfectScale by DoiT, il team ha finalmente avuto la visibilità in tempo reale a livello di workload che gli mancava. Sui oltre 200 microservizi dell'ambiente Trax, il team ha potuto vedere con chiarezza di quali risorse avesse bisogno ciascun servizio e individuare le opportunità più rilevanti per eliminare gli sprechi senza mettere a rischio le performance. L'intelligence guidata dall'AI della piattaforma ha permesso di agire in sicurezza, sulla base di evidenze concrete, e di migliorare rapidamente l'unit economics. Valutando i trade-off tra efficienza e resilienza, è stato possibile regolare le risorse in modo sicuro ed efficiente, nel pieno rispetto degli SLO. Le raccomandazioni di cost optimization sono state determinanti: hanno indicato le azioni da intraprendere con una chiara comprensione dell'impatto di ogni modifica. In uno dei cluster il team è riuscito a ridurre i costi del 75%, con un risparmio di oltre centomila dollari l'anno. Trax è rimasta inoltre colpita dalla completezza dei dati e dell'intelligence che la soluzione offre sull'intero ambiente. Questa implementazione ha permesso di aggiornare gli strumenti di visibilità sui costi senza impatti sul budget.

Ottimizzare Kubernetes per migliorare le metriche di business

Eliminate le risorse sprecate, Trax si è concentrata sull'individuazione di ulteriori opportunità per migliorare efficienza e unit economics. Il team ha analizzato a fondo i dati di PerfectScale, cercando il modo di incidere in maniera significativa sulle metriche di business legate ai costi. Una metrica chiave per Trax è il "cost per processing", fortemente influenzato dall'efficienza di Kubernetes. PerfectScale offre una funzionalità unica che consolida tutte le repliche di un servizio in un'unica vista, restituendo un quadro chiaro dei trend di utilizzo: particolarmente utile per workloads effimeri come i job Spark o Flink. Trax ha sfruttato questa capacità per comprendere meglio l'utilizzo eterogeneo delle repliche di diversi servizi tra i più sollecitati. Questo livello di visibilità ha permesso a Trax di ri-architettare i servizi, ottenendo ulteriori guadagni di efficienza senza incidere su resilienza o disponibilità. Il team è riuscito a creare più varianti dello stesso servizio con livelli di risorse differenti, instradando le richieste in arrivo verso il servizio più adatto in base alla dimensione dei dati. Un cambiamento che ha avuto un forte impatto sulla metrica "cost per processing". PerfectScale ha reso disponibili questi dati in modo immediato; senza la piattaforma, il team avrebbe impiegato innumerevoli ore per valutare centinaia di repliche e arrivare agli stessi risultati.

Scopri come PerfectScale migliora l'efficienza di Kubernetes

Scopri come PerfectScale aiuta i team a fare il right-sizing dei cluster, ridurre gli sprechi e migliorare le performance senza interventi manuali.

More customer stories

OneFootball

PerfectScale by DoiT aiuta OneFootball a ottimizzare Kubernetes per il traffico calcistico globale su larga scala

25%
di riduzione dei costi dell'infrastruttura Kubernetes
80%
di riduzione del lavoro di engineering dedicato all'ottimizzazione dei costi e al tuning della resilienza su Kubernetes
Luma Health

Luma Health taglia del 40% i costi di EKS e libera migliaia di ore di engineering all'anno

90%
Tempo in meno sul rightsizing manuale di Kubernetes
40%
Riduzione dei costi di Amazon EKS
+1,700h/year
Ore di engineering reindirizzate ad affidabilità e prestazioni
PlayHQ

PlayHQ automatizza l'ottimizzazione di Kubernetes con PerfectScale

40%
Reduction in non-production Kubernetes costs
40%
Reduction in non-production K8s costs
20%
Reduction in production K8s costs
SNCF

SNCF taglia del 30% i costi Kubernetes con PerfectScale

30%
Riduzione dei costi
~€500K
Estimated Annualized Savings
250
Clusters Under Optimization
NOS

NOS abbatte i costi di Kubernetes in un ambiente multi-cluster

50%
Cost Reduction
50%
Cost reduction on largest cluster
0%
Idle resources on main node pools
K1x

K1x abbatte i costi cloud e semplifica le operazioni Kubernetes

Thousands
Saved Per Month
Thousands
Saved per month on cloud spend
<10%
Resource utilization on over-provisioned nodes before optimization
Riftweaver

Riftweaver ottimizza l'ambiente Kubernetes con PerfectScale

59%
Reduction in CPU Throttling
6
Critical APIs Improved
80,000+
Game Downloads
Rapyd

Rapyd riduce i costi cloud del 35-40% con PerfectScale

35-40%
Riduzione dei costi cloud
15+
AWS EKS Clusters Optimized
100+
Countries Supported for Payments