PerfectScalePerfectScale

Questa pagina è disponibile anche in English, Deutsch, Español, Français, 日本語 e Português.

NOS dimezza i costi Kubernetes e ricostruisce la fiducia nell'ottimizzazione

Come il principale operatore telecom portoghese ha ridotto in sicurezza la spesa K8s in un ambiente multi-cluster complesso

PerfectScale
NOS

The Challenge

Con la crescita dell'infrastruttura Kubernetes di NOS in un ambiente ibrido on-prem e Google Cloud, l'ottimizzazione è diventata una delle principali criticità. Strumenti di observability come Prometheus e Grafana fornivano metriche grezze ma nessuna raccomandazione concreta, costringendo gli Engineers a procedere per tentativi nel right-sizing. I precedenti tentativi di ottimizzazione manuale avevano causato crash e violazioni degli SLA, minando la fiducia negli sforzi di ottimizzazione. I team FinOps, inoltre, impiegavano giorni ogni mese per ricomporre dati di costo frammentati, mentre l'overprovisioning restava la scelta predefinita per evitare rischi.

The Solution

NOS ha adottato PerfectScale, introducendolo prima nei cluster di sviluppo, dove l'automazione ha operato in modo discreto per quattro mesi, con costi in calo e zero incidenti. Forte di questo successo, NOS ha esteso l'automazione ai componenti a livello di piattaforma, tra cui ingress controller, cert manager e stack di observability. In produzione, gli SRE applicano le raccomandazioni manualmente, supportati dalle evidenze contestuali di PerfectScale, per garantire che le modifiche non impattino le performance. InfraFit identifica i tipi di nodo ottimali, così Cluster Autoscaler scala in modo efficiente e in sincronia con il traffico degli utenti.

Results

  • Ridotti i costi di oltre il 50% sul cluster più grande e più critico di NOS (il cluster API principale)
  • Raggiunto lo 0% di risorse inattive su diversi node pool principali grazie a InfraFit e all'automazione del right-sizing
  • Individuati e risolti problemi di performance, tra cui out-of-memory kill e CPU throttling
  • Eliminate le violazioni degli SLA e migliorate le performance complessive delle applicazioni
  • Recuperati 2–3 giorni interi al mese prima dedicati a reporting e riunioni FinOps
  • Ricostruita la fiducia tra i team in un'ottimizzazione Kubernetes sicura e intelligente
  • Favorita l'adozione in tutta l'azienda: Platform Engineers, SRE, Developers, Financial Controllers e Management

Ho creduto nel prodotto fin dalla prima volta che l'ho visto. Lo mostro ancora a tutti. Era l'unica soluzione che univa automazione intelligente e risparmi reali sui costi, senza mettere a rischio le performance.

Joao Soares, Platform Engineering Lead, NOS

Chi è NOS

NOS è uno dei principali operatori di telecomunicazioni del Portogallo e serve milioni di clienti con servizi di rete, internet e intrattenimento. Quasi dieci anni fa, NOS ha puntato sulla containerizzazione per ridurre l'overhead e guadagnare velocità, evolvendo dalle macchine virtuali a Docker e Rancher, fino all'adozione di Kubernetes in tutta l'azienda. Oggi opera con un assetto ibrido: i sistemi specifici del mondo telco restano on-prem, mentre i workloads scalabili girano su Google Cloud. L'obiettivo è rimasto costante: garantire agilità e performance tenendo sotto controllo la spesa infrastrutturale.

La sfida: l'ottimizzazione manuale era diventata un rischio

Con l'evolversi dell'architettura Kubernetes di NOS, anche la complessità è cresciuta. I team utilizzavano Prometheus e Grafana, ma questi strumenti fornivano solo metriche grezze, senza la visibilità o le raccomandazioni necessarie per prendere decisioni sicure e consapevoli, soprattutto quando erano in gioco gli SLA. Senza indicazioni chiare, gli Engineers dovevano procedere per tentativi. Dopo diversi tentativi falliti di right-sizing manuale, che avevano causato crash e violazioni degli SLA, i team hanno fatto marcia indietro. "I Developers hanno provato ad apportare modifiche basandosi su ciò che ritenevano sensato, e l'effetto è stato controproducente", ha raccontato Joao Soares, Platform Engineering Lead di NOS. A peggiorare la situazione, i team FinOps impiegavano giorni ogni mese per ricomporre dati frammentati e produrre report, rendendo difficile individuare i problemi o prepararsi alle revisioni di budget.

La scoperta di PerfectScale a KubeCon

Alla KubeCon Europe 2024 di Parigi, Soares cercava una cosa sola: un modo più sicuro per ridurre i costi Kubernetes. PerfectScale si è distinto immediatamente. "Ho creduto nel prodotto fin dalla prima volta che l'ho visto. Lo mostro ancora a tutti", ha dichiarato Soares. "Era l'unica soluzione che univa automazione intelligente e risparmi reali sui costi, senza mettere a rischio le performance."

La soluzione: ottimizzazione automatizzata e intelligente, costruita sulla fiducia

PerfectScale è stato introdotto inizialmente nei cluster di sviluppo, dove l'automazione ha operato in modo discreto per quattro mesi, con costi in calo e senza un solo problema o reclamo. Forte di questo successo, NOS ha iniziato ad automatizzare i componenti a livello di piattaforma come ingress controller, cert manager e stack di observability. In produzione, gli SRE applicano ancora le raccomandazioni manualmente, ma la fiducia cresce man mano che PerfectScale fornisce le evidenze contestuali di cui hanno bisogno per essere certi che le modifiche non causeranno problemi di performance.

I risultati: risparmi su costi, performance e tempo

NOS ha ridotto i costi di oltre il 50% sul suo cluster più grande e più critico, il cluster API principale, che era stato fortemente sovradimensionato per evitare rischi. PerfectScale ha portato alla luce problemi passati inosservati, come out-of-memory kill e CPU throttling, fornendo raccomandazioni mirate per risolverli. InfraFit ha aiutato NOS a identificare i tipi di nodo ottimali, permettendo a Cluster Autoscaler di scalare in modo più efficiente. "Stiamo vedendo la curva sinusoidale che volevamo: il sistema sale e scende in perfetta sincronia con il traffico degli utenti. Insieme al right-sizing automatizzato dei workloads, diversi node pool principali funzionano ora con lo 0% di risorse inattive", ha spiegato Soares. Anche il reporting FinOps è diventato molto più rapido, liberando due o tre giorni ogni mese. "Ora entro nelle riunioni sapendo che va tutto bene", ha aggiunto Soares.

Adozione in tutta l'azienda

PerfectScale guida oggi le decisioni quotidiane in tutta NOS, sostituendo strumenti frammentati e supposizioni con un'unica piattaforma affidabile. I Platform Engineers lo usano per automatizzare la gestione di cluster e risorse; gli SRE applicano le raccomandazioni ai servizi business-critical; i Developers lo utilizzano per dimensionare correttamente le risorse dal dev alla produzione; i Financial Controllers monitorano il budget e tengono traccia della spesa; e il Management supervisiona l'efficienza e la collaborazione tra i team. Questa visibilità condivisa ha migliorato la collaborazione e ha reso l'ottimizzazione di Kubernetes parte delle attività quotidiane in tutta l'azienda.

Scopra come PerfectScale migliora l'efficienza di Kubernetes

Scopra come PerfectScale aiuta i team a fare right-sizing dei cluster, ridurre gli sprechi e migliorare le performance senza tuning manuale.

More customer stories

PicnicAI

PicnicAI automatizza l'85-90% dei workload Kubernetes e migliora l'affidabilità con PerfectScale by DoiT

85–90%
dei workload applicativi ora coperti dal resizing automatico
50%
riduzione approssimativa del tempo che il team infrastruttura dedica all'infrastruttura
Stefanini

Stefanini taglia del 26% i costi di compute Kubernetes con PerfectScale by DoiT

26%
Riduzione dei costi di compute Kubernetes
>60%
Riduzione dei costi di infrastruttura nell'ultimo anno
OneFootball

PerfectScale by DoiT aiuta OneFootball a ottimizzare Kubernetes per il traffico calcistico globale su larga scala

25%
di riduzione dei costi dell'infrastruttura Kubernetes
80%
di riduzione del lavoro di engineering dedicato all'ottimizzazione dei costi e al tuning della resilienza su Kubernetes
Luma Health

Luma Health taglia del 40% i costi di EKS e libera migliaia di ore di engineering all'anno

90%
Tempo in meno sul rightsizing manuale di Kubernetes
40%
Riduzione dei costi di Amazon EKS
+1,700h/year
Ore di engineering reindirizzate ad affidabilità e prestazioni
PlayHQ

PlayHQ ottimizza i costi Kubernetes multi-tenant

40%
Riduzione dei costi Kubernetes non-production
40%
Riduzione dei costi K8s non-production
20%
Riduzione dei costi K8s in produzione
SNCF

Come SNCF ha ridotto gli sprechi su K8s aumentando l'affidabilità su larga scala

30%
Più workloads a costi invariati
30%
Workloads in più assorbiti a costi invariati
~€500K
Risparmi annualizzati stimati
K1x

K1x abbatte i costi cloud e semplifica le operazioni Kubernetes

Thousands
Risparmio mensile
Thousands
Risparmio mensile sulla spesa cloud
<10%
Utilizzo delle risorse sui nodi sovradimensionati prima dell'ottimizzazione
Riftweaver

Come PerfectScale permette a un team DevOps di una sola persona di scalare Riftweaver

59%
Riduzione del throttling della CPU
6
API critiche migliorate
80,000+
Download del gioco