PerfectScalePerfectScale

Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.

NOS divise ses coûts Kubernetes par deux et retrouve confiance dans l'optimisation

Comment le premier opérateur télécom du Portugal a réduit en toute sécurité ses dépenses K8s dans un environnement multi-cluster complexe

PerfectScale
NOS

The Challenge

À mesure que l'empreinte Kubernetes de NOS s'étendait dans un environnement hybride on-prem et Google Cloud, l'optimisation est devenue un vrai point de friction. Les outils d'observabilité comme Prometheus et Grafana fournissaient des métriques brutes, mais aucune recommandation exploitable, obligeant les ingénieurs à faire du right-sizing à l'aveugle. Des tentatives d'optimisation manuelle avaient déjà provoqué des crashs et des violations de SLA, brisant la confiance dans les efforts d'optimisation. Les équipes FinOps passaient en outre plusieurs jours chaque mois à assembler des données de coûts fragmentées, tandis que le surprovisionnement restait la norme pour limiter les risques.

The Solution

NOS a adopté PerfectScale, d'abord déployé sur les clusters de développement, où l'automatisation a tourné discrètement pendant quatre mois — avec des coûts en baisse et zéro incident. Fort de ce succès, NOS a étendu l'automatisation aux composants de la plateforme, dont l'ingress controller, le cert manager et la stack d'observabilité. En production, les SREs appliquent les recommandations manuellement, en s'appuyant sur les éléments contextuels fournis par PerfectScale pour garantir que les changements n'affecteront pas les performances. InfraFit identifie les types de nœuds optimaux afin que le Cluster Autoscaler monte en charge efficacement, en phase avec le trafic utilisateur.

Results

  • Réduction de plus de 50 % des coûts sur le cluster le plus grand et le plus critique de NOS (cluster API principal)
  • 0 % de ressources inutilisées sur plusieurs node pools principaux grâce à InfraFit et à l'automatisation du right-sizing
  • Détection et résolution de problèmes de performance, dont des kills out-of-memory et du CPU throttling
  • Élimination des violations de SLA et amélioration des performances globales des applications
  • 2 à 3 jours complets récupérés chaque mois, auparavant consacrés au reporting et aux réunions FinOps
  • Confiance restaurée entre les équipes dans une optimisation Kubernetes sûre et intelligente
  • Adoption à l'échelle de l'entreprise : Platform Engineers, SREs, développeurs, contrôleurs financiers et direction

J'ai cru au produit dès la première fois que je l'ai vu. Je le montre encore à tout le monde. C'était la seule solution qui combinait automatisation intelligente et économies réelles, sans mettre les performances en danger.

Joao Soares, Responsable Platform Engineering, NOS

À propos de NOS

NOS est l'un des principaux opérateurs télécoms du Portugal, qui fournit à des millions de clients des services de réseau, d'internet et de divertissement. Il y a près de dix ans, NOS a fait le pari de la conteneurisation pour réduire les frais d'exploitation et gagner en rapidité, passant des machines virtuelles à Docker et Rancher, puis à Kubernetes déployé à l'échelle de toute l'entreprise. Aujourd'hui, l'opérateur fonctionne en mode hybride : les systèmes propres aux télécoms restent on-prem, tandis que les workloads scalables tournent sur Google Cloud. L'objectif est resté le même : offrir agilité et performance tout en gardant les dépenses d'infrastructure sous contrôle.

Le défi : quand l'optimisation manuelle devient un risque

À mesure que l'architecture Kubernetes de NOS évoluait, la complexité augmentait. Les équipes utilisaient Prometheus et Grafana, mais ces outils ne fournissaient que des métriques brutes, sans la visibilité ni les recommandations nécessaires pour décider en toute confiance — surtout lorsque des SLA étaient en jeu. Sans repères clairs, les ingénieurs devaient avancer à l'aveugle. Après plusieurs tentatives manuelles de right-sizing qui ont provoqué des crashs et des violations de SLA, les équipes ont fait machine arrière. "Les développeurs ont tenté des modifications selon ce qui leur semblait logique, et cela s'est retourné contre eux", explique Joao Soares, Responsable Platform Engineering chez NOS. Pour ne rien arranger, les équipes FinOps passaient chaque mois plusieurs jours à assembler des données fragmentées pour produire leurs rapports, ce qui compliquait la détection des problèmes et la préparation des revues budgétaires.

La rencontre avec PerfectScale à la KubeCon

Lors de la KubeCon Europe 2024 à Paris, Joao Soares cherchait une chose : un moyen plus sûr de réduire les coûts Kubernetes. PerfectScale s'est immédiatement démarqué. "J'ai cru au produit dès la première fois que je l'ai vu. Je le montre encore à tout le monde", raconte-t-il. "C'était la seule solution qui combinait automatisation intelligente et économies réelles, sans mettre les performances en danger."

La solution : une optimisation automatisée intelligente, pensée pour la confiance

PerfectScale a d'abord été déployé sur les clusters de développement, où l'automatisation a tourné discrètement pendant quatre mois — avec des coûts en baisse, sans le moindre incident ni la moindre plainte. Fort de ce succès, NOS a commencé à automatiser des composants de la plateforme comme l'ingress controller, le cert manager et la stack d'observabilité. En production, les SREs appliquent encore les recommandations manuellement, mais la confiance grandit : PerfectScale leur apporte les éléments contextuels dont ils ont besoin pour être certains que les changements n'entraîneront pas de problèmes de performance.

Les résultats : coûts, performances et gain de temps

NOS a réduit de plus de 50 % les coûts de son cluster le plus grand et le plus critique — le cluster API principal —, jusque-là fortement surprovisionné par précaution. PerfectScale a mis au jour des problèmes passés inaperçus, comme des kills out-of-memory et du CPU throttling, avec des recommandations ciblées pour les résoudre. InfraFit a aidé NOS à identifier les types de nœuds optimaux, permettant au Cluster Autoscaler de monter en charge plus efficacement. "Nous observons la sinusoïde que nous voulions : une montée et une descente en charge parfaitement calées sur le trafic utilisateur. Combiné au right-sizing automatisé des workloads, plusieurs node pools principaux tournent désormais avec 0 % de ressources inutilisées", explique Joao Soares. Le reporting FinOps s'est lui aussi considérablement accéléré, libérant deux à trois jours chaque mois. "Aujourd'hui, j'arrive en réunion en sachant que tout est en ordre", conclut-il.

Une adoption à l'échelle de l'entreprise

PerfectScale alimente désormais les décisions quotidiennes chez NOS, remplaçant outils épars et approximations par une plateforme unique et fiable. Les Platform Engineers l'utilisent pour automatiser la gestion des clusters et des ressources ; les SREs appliquent les recommandations aux services critiques ; les développeurs s'en servent pour dimensionner correctement leurs environnements, du dev à la prod ; les contrôleurs financiers suivent le budget et les dépenses ; et la direction pilote l'efficacité et la collaboration entre équipes. Cette visibilité partagée a renforcé la collaboration et fait de l'optimisation Kubernetes une composante du quotidien opérationnel de toute l'entreprise.

Découvrez comment PerfectScale améliore l'efficacité de Kubernetes

Explorez comment PerfectScale aide les équipes à dimensionner leurs clusters au plus juste, réduire le gaspillage et améliorer les performances, sans réglages manuels.

More customer stories

PicnicAI

PicnicAI automatise 85 à 90 % de ses workloads Kubernetes et gagne en fiabilité avec PerfectScale by DoiT

85–90%
des workloads applicatifs désormais couverts par le redimensionnement automatisé
50%
de réduction approximative du temps consacré par l'équipe à la gestion de l'infrastructure
Stefanini

Stefanini réduit de 26 % ses coûts de compute Kubernetes grâce à PerfectScale by DoiT

26%
De réduction des coûts de compute Kubernetes
>60%
De réduction des coûts d'infrastructure au cours de l'année écoulée
OneFootball

PerfectScale by DoiT aide OneFootball à optimiser Kubernetes face au trafic football mondial à grande échelle

25%
De réduction des coûts d'infrastructure Kubernetes
80%
De réduction de l'effort d'ingénierie consacré à l'optimisation des coûts et au réglage de la résilience Kubernetes
Luma Health

Luma Health réduit ses coûts EKS de 40 % et libère des milliers d'heures d'ingénierie par an

90%
De temps en moins sur le rightsizing manuel de Kubernetes
40%
De réduction des coûts Amazon EKS
+1,700h/year
D'heures d'ingénierie réorientées vers la fiabilité et la performance
PlayHQ

PlayHQ optimise ses coûts Kubernetes multi-tenant

40%
De réduction des coûts Kubernetes hors production
40%
De réduction des coûts K8s hors production
20%
De réduction des coûts K8s en production
SNCF

Comment la SNCF a éliminé le gaspillage K8s et renforcé sa fiabilité à grande échelle

30%
De workloads en plus à coût constant
30%
De workloads absorbés en plus à coût constant
~€500K
D'économies annualisées estimées
K1x

K1x réduit drastiquement ses coûts cloud et simplifie ses opérations Kubernetes

Thousands
D'économies par mois
Thousands
D'économies mensuelles sur les dépenses cloud
<10%
D'utilisation des ressources sur les nœuds surdimensionnés avant optimisation
Riftweaver

Un seul ingénieur DevOps pour faire évoluer Riftweaver, grâce à PerfectScale

59%
De réduction du throttling CPU
6
API critiques améliorées
80,000+
Téléchargements du jeu