PerfectScalePerfectScale

Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.

PicnicAI automatizza l'85-90% dei workload Kubernetes e migliora l'affidabilità con PerfectScale by DoiT

Come PicnicAI ha usato PerfectScale by DoiT per automatizzare l'ottimizzazione dei workload, ridurre il carico operativo e dare ai suoi engineer maggiore fiducia nella propria infrastruttura

PerfectScale
PicnicAI

The Challenge

Con l'evoluzione dell'ambiente Kubernetes di PicnicAI, il team si è trovato ad affrontare una sfida sempre più comune: capire quanta CPU e memoria servissero realmente ai singoli workload.

Storicamente, i requisiti di risorse venivano in gran parte stimati al momento della creazione dei workload e potevano rimanere invariati fino al verificarsi di un problema. Un approccio particolarmente problematico per i workload di elaborazione dati, dove i requisiti potevano variare notevolmente da un job all'altro.

"Prima, lo scaling funzionava essenzialmente così: qualcuno stimava quanta memoria e CPU sarebbero servite a un job al momento della creazione, e poi non veniva più toccato finché non si verificavano numerosi OOM (errori out-of-memory)", racconta Josh Zarrabi, Infrastructure Engineer di PicnicAI.

Quando i workload erano sottodimensionati, i job potevano fallire e riprovare ripetutamente, creando code e mettendo ulteriore pressione sui database condivisi. Al contrario, il sovradimensionamento generava capacità infrastrutturale e spesa cloud non necessarie.

La sfida era aggravata dalle dimensioni ridotte del team di engineering di PicnicAI. Le decisioni infrastrutturali erano spesso state prese da engineer non più in azienda, e il team non sempre disponeva del contesto alla base delle configurazioni esistenti.

Sebbene la riduzione dei costi cloud fosse una delle motivazioni per esplorare l'ottimizzazione, l'affidabilità è diventata rapidamente l'obiettivo più importante. "I vantaggi in termini di affidabilità sono stati davvero importanti per noi, e i risparmi sui costi un gradito beneficio aggiuntivo", afferma Zarrabi.

The Solution

Dal right-sizing manuale all'automazione

PicnicAI ha iniziato a collaborare con DoiT nell'ambito di una più ampia iniziativa di ottimizzazione dei costi cloud. DoiT ha introdotto PerfectScale per aiutare il team a comprendere l'utilizzo delle risorse a livello di workload e ad automatizzare l'ottimizzazione di Kubernetes.

PerfectScale combina una visibilità granulare su Kubernetes con un right-sizing automatico e workload-aware, aiutando i team a ottimizzare CPU e memoria senza dover ricorrere a un monitoraggio manuale costante.

Per PicnicAI, l'implementazione è stata volutamente graduale. Inizialmente il team si è concentrato sul miglioramento dell'affidabilità e sulla costruzione della fiducia nelle raccomandazioni, prima di estendere progressivamente l'automazione.

Identificare le configurazioni inefficienti

Le funzionalità InfraFit di PerfectScale hanno aiutato PicnicAI a identificare configurazioni infrastrutturali inefficienti e a capire dove i workload non erano allineati con le risorse allocate.

"Con InfraFit di PerfectScale è molto più facile dire: ok, qui stiamo davvero sprecando risorse perché la configurazione non è adatta ai nostri workload", spiega Zarrabi. "Mi dà più sicurezza nell'apportare modifiche quando non abbiamo sempre il contesto completo sulle decisioni che ci stanno dietro."

Automazione e supporto di esperti, insieme

La tecnologia era solo una parte della soluzione. I team di Field Engineering e Customer Success di DoiT hanno lavorato fianco a fianco con PicnicAI per aiutare il team a comprendere il comportamento di Kubernetes e a stabilire dove l'automazione potesse essere introdotta in sicurezza.

Questo ha incluso l'analisi dell'interazione tra HPA (horizontal pod autoscaling) e il cluster autoscaler, la regolazione delle soglie e l'introduzione di policy controllate sui requisiti di risorse.

Le funzionalità di policy e guardrail di PerfectScale hanno permesso a PicnicAI di controllare dove e come applicare l'ottimizzazione, invece di attivare semplicemente l'automazione su ogni workload.

I workload più sensibili sono stati trattati con cautela, mentre l'automazione è stata progressivamente estesa agli ambienti di produzione, staging e sviluppo.

Per Zarrabi, il supporto tecnico continuativo affiancato alla piattaforma è stato una parte importante della collaborazione. "Fa piacere avere qualcuno che tiene d'occhio la situazione e mi chiede conto dei risultati", dice. "Anche solo assicurarsi che stiamo ottenendo il massimo dal prodotto è utile."

Results

  • 85–90% dei workload ora automatizzati
  • Riduzione di circa il 50% del tempo che il team infrastruttura dedica all'infrastruttura
  • Maggiore affidabilità e meno distrazioni legate all'infrastruttura
  • Efficienza dei costi come beneficio aggiuntivo
  • Più capacità di engineering per attività a maggior valore

"PerfectScale ci dà la fiducia necessaria per automatizzare l'ottimizzazione di Kubernetes, lasciando i nostri engineer liberi di concentrarsi su ciò che conta davvero."

Josh Zarrabi, Infrastructure Engineer

I risultati

L'85–90% dei workload è ora automatizzato

Il cambiamento operativo più significativo è stato l'abbandono della gestione manuale delle risorse. Prima di PerfectScale, PicnicAI non disponeva di alcun resizing automatico dei workload. Oggi il resizing automatico copre circa l'85–90% dei workload nei suoi cluster applicativi.

Ciò significa che i requisiti di risorse possono essere ottimizzati in modo continuo, senza che gli engineer debbano rivedere e regolare manualmente i singoli workload.

Maggiore affidabilità e meno distrazioni legate all'infrastruttura

I benefici vanno oltre l'ottimizzazione in sé. PicnicAI ha registrato meno problemi legati alla memoria e una riduzione delle interruzioni operative che in passato accompagnavano i workload dimensionati in modo errato.

"È semplicemente una cosa fastidiosa in meno di cui preoccuparsi", afferma Zarrabi.

Un cambiamento particolarmente significativo per un'organizzazione di engineering snella. Automatizzando una parte maggiore della gestione dell'infrastruttura, PicnicAI ha potuto aumentare la capacità del team di portare avanti più progetti in azienda senza aggiungere carico operativo.

Invece di indagare ripetutamente sul perché i job falliscono, le code si accumulano o i database vengono sottoposti a carichi non necessari, gli engineer possono dedicare più tempo a iniziative strategiche su infrastruttura e prodotto.

L'efficienza dei costi come beneficio aggiuntivo

L'affidabilità era l'obiettivo principale della collaborazione, ma non è stato l'unico risultato. Poiché il right-sizing di PerfectScale è workload-aware, ha aiutato PicnicAI anche a eliminare il sovradimensionamento che in passato si accumulava quando i limiti di risorse venivano stimati una volta sola e mai più rivisti, riducendo la spesa infrastrutturale superflua insieme ai vantaggi in termini di affidabilità.

"I vantaggi in termini di affidabilità sono stati davvero importanti per noi, e i risparmi sui costi un gradito beneficio aggiuntivo", afferma Zarrabi.

Per un team snello già impegnato su più fronti, questa combinazione ha reso l'automazione un investimento facile da sostenere nel tempo: non impone un compromesso tra un budget infrastrutturale più contenuto e sistemi affidabili — offre entrambe le cose.

Più capacità di engineering per attività a maggior valore

La riduzione della gestione manuale di Kubernetes ha permesso agli engineer di PicnicAI di concentrarsi su progetti a più lungo termine, tra cui la migrazione della continuous integration da Jenkins e l'esplorazione di nuove iniziative di AI.

Il valore della collaborazione, quindi, va ben oltre il problema di affidabilità che era stata chiamata a risolvere. Automatizzando un'attività che in precedenza richiedeva giudizio e intervento da parte degli engineer, PicnicAI ha anche ridotto i costi infrastrutturali, liberato preziosa capacità tecnica e dato agli engineer maggiore sicurezza nel lavorare con configurazioni storiche che non avevano impostato in prima persona.

"Il tempo va dedicato alle cose utili", afferma Zarrabi. "Tirare a indovinare i limiti di memoria e CPU non lo è."

I prossimi passi

PicnicAI prevede di ampliare ulteriormente il ruolo di PerfectScale con l'evolversi del suo ambiente Kubernetes, estendendo l'automazione ad altri workload e affrontando progressivamente l'infrastruttura di produzione più sensibile.

L'azienda continuerà inoltre ad attingere alla più ampia competenza cloud di DoiT man mano che la sua piattaforma e le sue iniziative di AI si sviluppano. Per PicnicAI l'obiettivo è chiaro: automatizzare l'ottimizzazione dell'infrastruttura ovunque possibile, mantenere l'affidabilità necessaria per i workload sanitari critici e permettere agli engineer di dedicare meno tempo alla gestione di Kubernetes e più tempo alla creazione di tecnologie in grado di migliorare i risultati per i pazienti.

Chi è PicnicAI

PicnicAI è un'azienda health-tech che sviluppa intelligenza per accelerare i progressi nella salute umana. La sua tecnologia elabora e valida grandi volumi di dati medici, aiutando i ricercatori farmaceutici a condurre studi clinici osservazionali in modo più efficiente e i pazienti a gestire le proprie cure.

L'infrastruttura cloud dell'azienda svolge un ruolo cruciale in questa missione. PicnicAI gestisce otto o nove cluster Kubernetes a supporto di workload automatizzati, con requisiti di CPU e memoria che possono variare notevolmente in base ai dati elaborati. Per PicnicAI, un'infrastruttura affidabile significa in definitiva permettere ai propri engineer di concentrarsi sull'innovazione in ambito sanitario, invece di dedicare il proprio tempo alla gestione manuale di Kubernetes.

Basta tirare a indovinare i limiti di CPU e memoria di Kubernetes per ogni workload

Automatizzi il right-sizing di Kubernetes in tutta sicurezza

Scopra cosa rileva PerfectScale by DoiT nei suoi cluster: visibilità a livello di workload, resizing automatico e guardrail basati su policy sotto il suo controllo, con gli engineer di DoiT al fianco del suo team.

More customer stories

Stefanini

Stefanini taglia del 26% i costi di compute Kubernetes con PerfectScale by DoiT

26%
Riduzione dei costi di compute Kubernetes
>60%
Riduzione dei costi di infrastruttura nell'ultimo anno
OneFootball

PerfectScale by DoiT aiuta OneFootball a ottimizzare Kubernetes per il traffico calcistico globale su larga scala

25%
di riduzione dei costi dell'infrastruttura Kubernetes
80%
di riduzione del lavoro di engineering dedicato all'ottimizzazione dei costi e al tuning della resilienza su Kubernetes
Luma Health

Luma Health taglia del 40% i costi di EKS e libera migliaia di ore di engineering all'anno

90%
Tempo in meno sul rightsizing manuale di Kubernetes
40%
Riduzione dei costi di Amazon EKS
+1,700h/year
Ore di engineering reindirizzate ad affidabilità e prestazioni
PlayHQ

PlayHQ ottimizza i costi Kubernetes multi-tenant

40%
Riduzione dei costi Kubernetes non-production
40%
Riduzione dei costi K8s non-production
20%
Riduzione dei costi K8s in produzione
SNCF

Come SNCF ha ridotto gli sprechi su K8s aumentando l'affidabilità su larga scala

30%
Più workloads a costi invariati
30%
Workloads in più assorbiti a costi invariati
~€500K
Risparmi annualizzati stimati
NOS

NOS dimezza i costi Kubernetes e ricostruisce la fiducia nell'ottimizzazione

50%
Riduzione dei costi
50%
Riduzione dei costi sul cluster più grande
0%
Risorse inattive sui node pool principali
K1x

K1x abbatte i costi cloud e semplifica le operazioni Kubernetes

Thousands
Risparmio mensile
Thousands
Risparmio mensile sulla spesa cloud
<10%
Utilizzo delle risorse sui nodi sovradimensionati prima dell'ottimizzazione
Riftweaver

Come PerfectScale permette a un team DevOps di una sola persona di scalare Riftweaver

59%
Riduzione del throttling della CPU
6
API critiche migliorate
80,000+
Download del gioco