À mesure que l'architecture Kubernetes de NOS évoluait, la complexité augmentait. Les équipes utilisaient Prometheus et Grafana, mais ces outils ne fournissaient que des métriques brutes, sans la visibilité ni les recommandations nécessaires pour décider en toute confiance — surtout lorsque des SLA étaient en jeu. Sans repères clairs, les ingénieurs devaient avancer à l'aveugle. Après plusieurs tentatives manuelles de right-sizing qui ont provoqué des crashs et des violations de SLA, les équipes ont fait machine arrière. "Les développeurs ont tenté des modifications selon ce qui leur semblait logique, et cela s'est retourné contre eux", explique Joao Soares, Responsable Platform Engineering chez NOS. Pour ne rien arranger, les équipes FinOps passaient chaque mois plusieurs jours à assembler des données fragmentées pour produire leurs rapports, ce qui compliquait la détection des problèmes et la préparation des revues budgétaires.