PerfectScalePerfectScale

Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

NOS corta custos de Kubernetes pela metade e recupera a confiança na otimização

Como a principal operadora de telecom de Portugal reduziu com segurança os gastos com K8s em um ambiente multi-cluster complexo

PerfectScale
NOS

The Challenge

À medida que a infraestrutura de Kubernetes da NOS crescia em um ambiente híbrido on-prem e Google Cloud, a otimização se tornou uma grande dor de cabeça. Ferramentas de observabilidade como Prometheus e Grafana forneciam métricas brutas, mas nenhuma recomendação acionável, obrigando os engenheiros a fazer rightsizing no achismo. Tentativas anteriores de otimização manual causaram quedas e violações de SLA, minando a confiança nos esforços de otimização. As equipes de FinOps também passavam dias todo mês juntando dados de custos fragmentados, enquanto o superprovisionamento continuava sendo o padrão para evitar riscos.

The Solution

A NOS adotou a PerfectScale, começando pelos clusters de desenvolvimento, onde a automação rodou discretamente por quatro meses, com custos caindo e nenhum incidente. Com esse sucesso, a NOS expandiu a automação para componentes de plataforma, incluindo o ingress controller, o cert manager e a stack de observabilidade. Em produção, os SREs aplicam as recomendações manualmente, com evidências contextuais da PerfectScale para garantir que as mudanças não afetem a performance. O InfraFit identifica os tipos de nó ideais para que o Cluster Autoscaler escale de forma eficiente, em sincronia com o tráfego dos usuários.

Results

  • Reduziu os custos em mais de 50% no maior e mais crítico cluster da NOS (cluster principal de APIs)
  • Alcançou 0% de recursos ociosos em vários node pools principais usando o InfraFit e a automação de rightsizing
  • Identificou e resolveu problemas de performance, incluindo out-of-memory kills e throttling de CPU
  • Eliminou violações de SLA e melhorou a performance geral das aplicações
  • Recuperou de 2 a 3 dias inteiros por mês que antes iam para relatórios e reuniões de FinOps
  • Reconstruiu a confiança entre equipes em uma otimização de Kubernetes segura e inteligente
  • Viabilizou a adoção em toda a empresa, de Platform Engineers e SREs a desenvolvedores, controllers financeiros e liderança

Acreditei no produto desde a primeira vez que o vi. Até hoje mostro para todo mundo. Foi a única solução que combinou automação inteligente com economia real de custos, sem colocar a performance em risco.

Joao Soares, Líder de Platform Engineering, NOS

Sobre a NOS

A NOS é uma das principais operadoras de telecom de Portugal, atendendo milhões de pessoas com serviços de rede, internet e entretenimento. Há quase uma década, a NOS apostou na containerização para reduzir overhead e ganhar velocidade, evoluindo de máquinas virtuais para Docker e Rancher e, por fim, para Kubernetes implantado em toda a empresa. Hoje, opera uma configuração híbrida: sistemas específicos de telecom permanecem on-prem, enquanto workloads escaláveis rodam no Google Cloud. O objetivo continua o mesmo: entregar agilidade e performance mantendo os gastos com infraestrutura sob controle.

O desafio: a otimização manual virou um risco

À medida que a arquitetura Kubernetes da NOS evoluía, a complexidade crescia junto. As equipes usavam Prometheus e Grafana, mas essas ferramentas forneciam apenas métricas brutas, sem a visibilidade ou as recomendações necessárias para decisões seguras e confiantes — principalmente quando os SLAs estavam em jogo. Sem orientação clara, os engenheiros precisavam adivinhar. Depois de várias tentativas fracassadas de rightsizing manual que causaram quedas e violações de SLA, as equipes recuaram. 'Os desenvolvedores tentavam fazer mudanças com base no que achavam que fazia sentido, e o tiro saía pela culatra', contou Joao Soares, líder de Platform Engineering da NOS. Para piorar, as equipes de FinOps passavam dias todo mês juntando dados fragmentados para montar relatórios, o que dificultava identificar problemas ou se preparar para revisões de orçamento.

O encontro com a PerfectScale na KubeCon

Na KubeCon Europe 2024, em Paris, Soares buscava uma coisa: uma forma mais segura de cortar custos de Kubernetes. A PerfectScale se destacou de imediato. 'Acreditei no produto desde a primeira vez que o vi. Até hoje mostro para todo mundo', disse Soares. 'Foi a única solução que combinou automação inteligente com economia real de custos, sem colocar a performance em risco.'

A solução: otimização automatizada e inteligente, construída para gerar confiança

A PerfectScale foi implantada primeiro nos clusters de desenvolvimento, onde a automação rodou discretamente por quatro meses — com custos caindo e sem um único problema ou reclamação. Com esse sucesso, a NOS começou a automatizar componentes de plataforma, como o ingress controller, o cert manager e a stack de observabilidade. Em produção, os SREs ainda aplicam as recomendações manualmente, mas a confiança está crescendo, já que a PerfectScale fornece as evidências contextuais de que eles precisam para ter certeza de que as mudanças não causarão problemas de performance.

Resultados: economia de custos, performance e tempo

A NOS reduziu os custos em mais de 50% no seu maior e mais crítico cluster — o cluster principal de APIs —, que estava fortemente superprovisionado para evitar riscos. A PerfectScale revelou problemas que passavam despercebidos, como out-of-memory kills e throttling de CPU, com recomendações direcionadas para resolvê-los. O InfraFit ajudou a NOS a identificar os tipos de nó ideais, permitindo que o Cluster Autoscaler escalasse com mais eficiência. 'Estamos vendo a curva senoidal que queríamos — escalando para cima e para baixo em perfeita sintonia com o tráfego dos usuários. Combinado com o rightsizing automatizado de workloads, vários node pools principais agora rodam com 0% de recursos ociosos', afirmou Soares. Os relatórios de FinOps também aceleraram drasticamente, liberando de dois a três dias todo mês. 'Agora entro nas reuniões sabendo que está tudo em ordem', disse Soares.

Adoção em toda a empresa

Hoje, a PerfectScale sustenta as decisões do dia a dia em toda a NOS, substituindo ferramentas dispersas e achismos por uma única plataforma confiável. Os Platform Engineers a usam para automatizar a gestão de clusters e recursos; os SREs aplicam recomendações em serviços críticos para o negócio; os desenvolvedores a utilizam para provisionar adequadamente de dev a prod; os controllers financeiros monitoram o orçamento e acompanham os gastos; e a liderança supervisiona a eficiência e a colaboração entre equipes. Essa visibilidade compartilhada melhorou a colaboração e tornou a otimização de Kubernetes parte da operação diária de toda a empresa.

Descubra como a PerfectScale melhora a eficiência do Kubernetes

Veja como a PerfectScale ajuda equipes a fazer right-sizing de clusters, reduzir desperdício e melhorar a performance sem ajustes manuais.

More customer stories

PicnicAI

PicnicAI automatiza 85-90% dos workloads de Kubernetes e melhora a confiabilidade com o PerfectScale by DoiT

85–90%
dos workloads de aplicação agora cobertos por redimensionamento automatizado
50%
de redução aproximada no tempo que a equipe de infraestrutura dedica à infraestrutura
Stefanini

Stefanini corta 26% dos custos de computação Kubernetes com PerfectScale by DoiT

26%
Redução nos custos de computação Kubernetes
>60%
Redução nos custos de infraestrutura no último ano
OneFootball

PerfectScale by DoiT ajuda a OneFootball a otimizar Kubernetes para o tráfego global do futebol em larga escala

25%
de redução nos custos de infraestrutura Kubernetes
80%
de redução no esforço de engenharia dedicado à otimização de custos e ao ajuste de resiliência em Kubernetes
Luma Health

Luma Health corta 40% dos custos com EKS e libera milhares de horas de engenharia por ano

90%
Menos tempo em right-sizing manual de Kubernetes
40%
Redução nos custos com Amazon EKS
+1,700h/year
Horas de engenharia redirecionadas para confiabilidade e performance
PlayHQ

PlayHQ otimiza custos de Kubernetes multi-tenant

40%
Redução nos custos de Kubernetes fora de produção
40%
Redução nos custos de K8s fora de produção
20%
Redução nos custos de K8s em produção
SNCF

Como a SNCF cortou desperdício em K8s e aumentou a confiabilidade em escala

30%
Mais workloads com custo estável
30%
Mais workloads absorvidos com custo estável
~€500K
Economia anualizada estimada
K1x

K1x corta custos de nuvem e simplifica as operações de Kubernetes

Thousands
Economizados por mês
Thousands
Economizados por mês em gastos com nuvem
<10%
Utilização de recursos nos nós superprovisionados antes da otimização
Riftweaver

Como o PerfectScale ajuda um time de DevOps de uma pessoa a escalar a Riftweaver

59%
Redução no throttling de CPU
6
APIs críticas otimizadas
80,000+
Downloads do jogo