Stefanini taglia del 26% i costi di compute Kubernetes con PerfectScale by DoiT
- 26%
- Riduzione dei costi di compute Kubernetes
- >60%
- Riduzione dei costi di infrastruttura nell'ultimo anno
Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.
Come PicnicAI ha usato PerfectScale by DoiT per automatizzare l'ottimizzazione dei workload, ridurre il carico operativo e dare ai suoi engineer maggiore fiducia nella propria infrastruttura

Con l'evoluzione dell'ambiente Kubernetes di PicnicAI, il team si è trovato ad affrontare una sfida sempre più comune: capire quanta CPU e memoria servissero realmente ai singoli workload.
Storicamente, i requisiti di risorse venivano in gran parte stimati al momento della creazione dei workload e potevano rimanere invariati fino al verificarsi di un problema. Un approccio particolarmente problematico per i workload di elaborazione dati, dove i requisiti potevano variare notevolmente da un job all'altro.
"Prima, lo scaling funzionava essenzialmente così: qualcuno stimava quanta memoria e CPU sarebbero servite a un job al momento della creazione, e poi non veniva più toccato finché non si verificavano numerosi OOM (errori out-of-memory)", racconta Josh Zarrabi, Infrastructure Engineer di PicnicAI.
Quando i workload erano sottodimensionati, i job potevano fallire e riprovare ripetutamente, creando code e mettendo ulteriore pressione sui database condivisi. Al contrario, il sovradimensionamento generava capacità infrastrutturale e spesa cloud non necessarie.
La sfida era aggravata dalle dimensioni ridotte del team di engineering di PicnicAI. Le decisioni infrastrutturali erano spesso state prese da engineer non più in azienda, e il team non sempre disponeva del contesto alla base delle configurazioni esistenti.
Sebbene la riduzione dei costi cloud fosse una delle motivazioni per esplorare l'ottimizzazione, l'affidabilità è diventata rapidamente l'obiettivo più importante. "I vantaggi in termini di affidabilità sono stati davvero importanti per noi, e i risparmi sui costi un gradito beneficio aggiuntivo", afferma Zarrabi.
PicnicAI ha iniziato a collaborare con DoiT nell'ambito di una più ampia iniziativa di ottimizzazione dei costi cloud. DoiT ha introdotto PerfectScale per aiutare il team a comprendere l'utilizzo delle risorse a livello di workload e ad automatizzare l'ottimizzazione di Kubernetes.
PerfectScale combina una visibilità granulare su Kubernetes con un right-sizing automatico e workload-aware, aiutando i team a ottimizzare CPU e memoria senza dover ricorrere a un monitoraggio manuale costante.
Per PicnicAI, l'implementazione è stata volutamente graduale. Inizialmente il team si è concentrato sul miglioramento dell'affidabilità e sulla costruzione della fiducia nelle raccomandazioni, prima di estendere progressivamente l'automazione.
Le funzionalità InfraFit di PerfectScale hanno aiutato PicnicAI a identificare configurazioni infrastrutturali inefficienti e a capire dove i workload non erano allineati con le risorse allocate.
"Con InfraFit di PerfectScale è molto più facile dire: ok, qui stiamo davvero sprecando risorse perché la configurazione non è adatta ai nostri workload", spiega Zarrabi. "Mi dà più sicurezza nell'apportare modifiche quando non abbiamo sempre il contesto completo sulle decisioni che ci stanno dietro."
La tecnologia era solo una parte della soluzione. I team di Field Engineering e Customer Success di DoiT hanno lavorato fianco a fianco con PicnicAI per aiutare il team a comprendere il comportamento di Kubernetes e a stabilire dove l'automazione potesse essere introdotta in sicurezza.
Questo ha incluso l'analisi dell'interazione tra HPA (horizontal pod autoscaling) e il cluster autoscaler, la regolazione delle soglie e l'introduzione di policy controllate sui requisiti di risorse.
Le funzionalità di policy e guardrail di PerfectScale hanno permesso a PicnicAI di controllare dove e come applicare l'ottimizzazione, invece di attivare semplicemente l'automazione su ogni workload.
I workload più sensibili sono stati trattati con cautela, mentre l'automazione è stata progressivamente estesa agli ambienti di produzione, staging e sviluppo.
Per Zarrabi, il supporto tecnico continuativo affiancato alla piattaforma è stato una parte importante della collaborazione. "Fa piacere avere qualcuno che tiene d'occhio la situazione e mi chiede conto dei risultati", dice. "Anche solo assicurarsi che stiamo ottenendo il massimo dal prodotto è utile."
"PerfectScale ci dà la fiducia necessaria per automatizzare l'ottimizzazione di Kubernetes, lasciando i nostri engineer liberi di concentrarsi su ciò che conta davvero."
Josh Zarrabi, Infrastructure Engineer
Il cambiamento operativo più significativo è stato l'abbandono della gestione manuale delle risorse. Prima di PerfectScale, PicnicAI non disponeva di alcun resizing automatico dei workload. Oggi il resizing automatico copre circa l'85–90% dei workload nei suoi cluster applicativi.
Ciò significa che i requisiti di risorse possono essere ottimizzati in modo continuo, senza che gli engineer debbano rivedere e regolare manualmente i singoli workload.
I benefici vanno oltre l'ottimizzazione in sé. PicnicAI ha registrato meno problemi legati alla memoria e una riduzione delle interruzioni operative che in passato accompagnavano i workload dimensionati in modo errato.
"È semplicemente una cosa fastidiosa in meno di cui preoccuparsi", afferma Zarrabi.
Un cambiamento particolarmente significativo per un'organizzazione di engineering snella. Automatizzando una parte maggiore della gestione dell'infrastruttura, PicnicAI ha potuto aumentare la capacità del team di portare avanti più progetti in azienda senza aggiungere carico operativo.
Invece di indagare ripetutamente sul perché i job falliscono, le code si accumulano o i database vengono sottoposti a carichi non necessari, gli engineer possono dedicare più tempo a iniziative strategiche su infrastruttura e prodotto.
L'affidabilità era l'obiettivo principale della collaborazione, ma non è stato l'unico risultato. Poiché il right-sizing di PerfectScale è workload-aware, ha aiutato PicnicAI anche a eliminare il sovradimensionamento che in passato si accumulava quando i limiti di risorse venivano stimati una volta sola e mai più rivisti, riducendo la spesa infrastrutturale superflua insieme ai vantaggi in termini di affidabilità.
"I vantaggi in termini di affidabilità sono stati davvero importanti per noi, e i risparmi sui costi un gradito beneficio aggiuntivo", afferma Zarrabi.
Per un team snello già impegnato su più fronti, questa combinazione ha reso l'automazione un investimento facile da sostenere nel tempo: non impone un compromesso tra un budget infrastrutturale più contenuto e sistemi affidabili — offre entrambe le cose.
La riduzione della gestione manuale di Kubernetes ha permesso agli engineer di PicnicAI di concentrarsi su progetti a più lungo termine, tra cui la migrazione della continuous integration da Jenkins e l'esplorazione di nuove iniziative di AI.
Il valore della collaborazione, quindi, va ben oltre il problema di affidabilità che era stata chiamata a risolvere. Automatizzando un'attività che in precedenza richiedeva giudizio e intervento da parte degli engineer, PicnicAI ha anche ridotto i costi infrastrutturali, liberato preziosa capacità tecnica e dato agli engineer maggiore sicurezza nel lavorare con configurazioni storiche che non avevano impostato in prima persona.
"Il tempo va dedicato alle cose utili", afferma Zarrabi. "Tirare a indovinare i limiti di memoria e CPU non lo è."
PicnicAI prevede di ampliare ulteriormente il ruolo di PerfectScale con l'evolversi del suo ambiente Kubernetes, estendendo l'automazione ad altri workload e affrontando progressivamente l'infrastruttura di produzione più sensibile.
L'azienda continuerà inoltre ad attingere alla più ampia competenza cloud di DoiT man mano che la sua piattaforma e le sue iniziative di AI si sviluppano. Per PicnicAI l'obiettivo è chiaro: automatizzare l'ottimizzazione dell'infrastruttura ovunque possibile, mantenere l'affidabilità necessaria per i workload sanitari critici e permettere agli engineer di dedicare meno tempo alla gestione di Kubernetes e più tempo alla creazione di tecnologie in grado di migliorare i risultati per i pazienti.
PicnicAI è un'azienda health-tech che sviluppa intelligenza per accelerare i progressi nella salute umana. La sua tecnologia elabora e valida grandi volumi di dati medici, aiutando i ricercatori farmaceutici a condurre studi clinici osservazionali in modo più efficiente e i pazienti a gestire le proprie cure.
L'infrastruttura cloud dell'azienda svolge un ruolo cruciale in questa missione. PicnicAI gestisce otto o nove cluster Kubernetes a supporto di workload automatizzati, con requisiti di CPU e memoria che possono variare notevolmente in base ai dati elaborati. Per PicnicAI, un'infrastruttura affidabile significa in definitiva permettere ai propri engineer di concentrarsi sull'innovazione in ambito sanitario, invece di dedicare il proprio tempo alla gestione manuale di Kubernetes.
Basta tirare a indovinare i limiti di CPU e memoria di Kubernetes per ogni workload
Scopra cosa rileva PerfectScale by DoiT nei suoi cluster: visibilità a livello di workload, resizing automatico e guardrail basati su policy sotto il suo controllo, con gli engineer di DoiT al fianco del suo team.