PerfectScalePerfectScale

Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

NOS reduce a la mitad sus costos de Kubernetes y recupera la confianza en la optimización

Cómo el principal operador de telecomunicaciones de Portugal redujo de forma segura el gasto en K8s en un entorno complejo de múltiples clústeres

PerfectScale
NOS

The Challenge

A medida que el entorno de Kubernetes de NOS crecía entre infraestructura híbrida on-prem y Google Cloud, la optimización se convirtió en un gran dolor de cabeza. Herramientas de observabilidad como Prometheus y Grafana entregaban métricas en bruto, pero ninguna recomendación aplicable, lo que obligaba a los Engineers a adivinar el rightsizing. Los intentos previos de optimización manual provocaron caídas e incumplimientos de SLA, lo que quebró la confianza en los esfuerzos de optimización. Además, los equipos de FinOps dedicaban días cada mes a consolidar datos de costos fragmentados, mientras el sobreaprovisionamiento seguía siendo la opción por defecto para evitar riesgos.

The Solution

NOS adoptó PerfectScale, implementándolo primero en los clústeres de desarrollo, donde la automatización funcionó de forma discreta durante cuatro meses, con costos a la baja y sin un solo incidente. Con ese éxito, NOS amplió la automatización a componentes a nivel de plataforma, incluidos el ingress controller, el cert manager y el stack de observabilidad. En producción, los SREs aplican las recomendaciones de forma manual, respaldados por la evidencia contextual de PerfectScale para asegurarse de que los cambios no afecten el rendimiento. InfraFit identifica los tipos de nodo óptimos para que el Cluster Autoscaler escale de forma eficiente al ritmo del tráfico de usuarios.

Results

  • Redujo más del 50% los costos en el clúster más grande y crítico de NOS (el clúster principal de API)
  • Logró 0% de recursos ociosos en varios node pools principales gracias a InfraFit y la automatización del rightsizing
  • Detectó y resolvió problemas de rendimiento, como out-of-memory kills y CPU throttling
  • Eliminó los incumplimientos de SLA y mejoró el rendimiento general de las aplicaciones
  • Recuperó de 2 a 3 días completos al mes que antes se dedicaban a reportes y reuniones de FinOps
  • Restableció la confianza entre equipos en una optimización de Kubernetes segura e inteligente
  • Impulsó la adopción en toda la empresa: Platform Engineers, SREs, desarrolladores, controllers financieros y la dirección

Creí en el producto desde la primera vez que lo vi. Todavía se lo muestro a todo el mundo. Era la única solución que combinaba automatización inteligente con ahorros reales, sin poner en riesgo el rendimiento.

Joao Soares, Líder de Platform Engineering, NOS

Acerca de NOS

NOS es uno de los principales operadores de telecomunicaciones de Portugal y ofrece servicios de red, internet y entretenimiento a millones de personas. Hace casi una década, NOS apostó por la contenedorización para reducir la sobrecarga operativa y avanzar más rápido: pasó de máquinas virtuales a Docker y Rancher, y finalmente a Kubernetes desplegado en toda la empresa. Hoy opera una configuración híbrida: los sistemas específicos de telecomunicaciones permanecen on-prem, mientras que los workloads escalables se ejecutan en Google Cloud. El objetivo se ha mantenido constante: ofrecer agilidad y rendimiento con el gasto en infraestructura siempre bajo control.

El desafío: la optimización manual se convirtió en un riesgo

A medida que la arquitectura de Kubernetes de NOS evolucionaba, la complejidad crecía con ella. Los equipos usaban Prometheus y Grafana, pero estas herramientas solo entregaban métricas en bruto, sin la visibilidad ni las recomendaciones necesarias para tomar decisiones seguras y con confianza, sobre todo cuando había SLAs en juego. Sin una guía clara, los Engineers tenían que adivinar. Tras varios intentos fallidos de rightsizing manual que provocaron caídas e incumplimientos de SLA, los equipos dieron un paso atrás. "Los desarrolladores intentaron hacer cambios según lo que les parecía lógico, y salió mal", comentó Joao Soares, líder de Platform Engineering en NOS. A esto se sumaba que los equipos de FinOps dedicaban días cada mes a unir datos fragmentados para armar reportes, lo que dificultaba detectar problemas o prepararse para las revisiones de presupuesto.

El descubrimiento de PerfectScale en KubeCon

En KubeCon Europe 2024, en París, Soares buscaba una sola cosa: una forma más segura de reducir los costos de Kubernetes. PerfectScale destacó de inmediato. "Creí en el producto desde la primera vez que lo vi. Todavía se lo muestro a todo el mundo", dijo Soares. "Era la única solución que combinaba automatización inteligente con ahorros reales, sin poner en riesgo el rendimiento".

La solución: optimización automatizada e inteligente, diseñada para generar confianza

PerfectScale se implementó primero en los clústeres de desarrollo, donde la automatización funcionó de forma discreta durante cuatro meses, con costos a la baja y sin un solo incidente ni queja. Con ese éxito, NOS comenzó a automatizar componentes a nivel de plataforma, como el ingress controller, el cert manager y el stack de observabilidad. En producción, los SREs siguen aplicando las recomendaciones de forma manual, pero la confianza crece, porque PerfectScale les brinda la evidencia contextual que necesitan para tener la certeza de que los cambios no causarán problemas de rendimiento.

Resultados: ahorro en costos, rendimiento y tiempo

NOS redujo más del 50% los costos en su clúster más grande y crítico —el clúster principal de API—, que estaba fuertemente sobreaprovisionado para evitar riesgos. PerfectScale sacó a la luz problemas que habían pasado desapercibidos, como out-of-memory kills y CPU throttling, y ofreció recomendaciones puntuales para resolverlos. InfraFit ayudó a NOS a identificar los tipos de nodo óptimos, lo que permitió al Cluster Autoscaler escalar con mayor eficiencia. "Estamos viendo la onda sinusoidal que queríamos: escalar hacia arriba y hacia abajo en perfecta sincronía con el tráfico de usuarios. Combinado con el rightsizing automatizado de workloads, varios node pools principales ahora funcionan con 0% de recursos ociosos", dijo Soares. Los reportes de FinOps también se aceleraron drásticamente, lo que permitió recuperar de dos a tres días cada mes. "Ahora entro a las reuniones sabiendo que todo está en orden", comentó Soares.

Adopción en toda la empresa

PerfectScale impulsa hoy las decisiones del día a día en NOS, reemplazando herramientas dispersas y conjeturas por una única plataforma confiable. Los Platform Engineers la usan para automatizar la gestión de clústeres y recursos; los SREs aplican recomendaciones en servicios críticos para el negocio; los desarrolladores la aprovechan para aprovisionar de forma adecuada desde dev hasta producción; los controllers financieros monitorean el presupuesto y dan seguimiento al gasto; y la dirección supervisa la eficiencia y la colaboración entre equipos. Esta visibilidad compartida ha mejorado la colaboración y ha convertido la optimización de Kubernetes en parte de la operación diaria de toda la empresa.

Descubre cómo PerfectScale mejora la eficiencia de Kubernetes

Conoce cómo PerfectScale ayuda a los equipos a aplicar right-sizing a sus clústeres, reducir la pérdida y mejorar el rendimiento sin ajustes manuales.

More customer stories

PicnicAI

PicnicAI automatiza el 85-90% de sus workloads de Kubernetes y gana en confiabilidad con PerfectScale by DoiT

85–90%
de los workloads de aplicaciones ya cuenta con redimensionamiento automatizado
50%
de reducción aproximada en el tiempo del equipo dedicado a la infraestructura
Stefanini

Un 26% menos en costos de cómputo de Kubernetes: así lo logró Stefanini con PerfectScale by DoiT

26%
Reducción en costos de cómputo de Kubernetes
>60%
Reducción de costos de infraestructura en el último año
OneFootball

PerfectScale by DoiT ayuda a OneFootball a optimizar Kubernetes para el tráfico global del fútbol a gran escala

25%
de reducción en los costos de infraestructura de Kubernetes
80%
de reducción en el esfuerzo de Engineering dedicado a la optimización de costos y al ajuste de resiliencia en Kubernetes
Luma Health

Luma Health reduce un 40% los costos de EKS y libera miles de horas de Engineering al año

90%
Menos tiempo en right-sizing manual de Kubernetes
40%
Reducción en costos de Amazon EKS
+1,700h/year
Horas de Engineering redirigidas a fiabilidad y rendimiento
PlayHQ

PlayHQ optimiza sus costos de Kubernetes multi-tenant

40%
Reducción de costos de Kubernetes fuera de producción
40%
Reducción de costos de K8s fuera de producción
20%
Reducción de costos de K8s en producción
SNCF

Cómo SNCF eliminó la pérdida en K8s y mejoró la confiabilidad a gran escala

30%
Más workloads al mismo costo
30%
Más workloads absorbidos al mismo costo
~€500K
Ahorros anualizados estimados
K1x

K1x recorta sus costos de nube y simplifica la operación de Kubernetes

Thousands
Ahorro mensual
Thousands
Ahorro mensual en gasto de nube
<10%
Utilización de recursos en nodos sobredimensionados antes de la optimización
Riftweaver

Cómo PerfectScale ayuda a un equipo DevOps de una sola persona a escalar Riftweaver

59%
Reducción del throttling de CPU
6
APIs críticas mejoradas
80,000+
Descargas del juego