Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

Luma Health reduce un 40% los costos de EKS y libera miles de horas de Engineering al año

El equipo de SRE de Luma Health recuperó el 90% del tiempo que dedicaba a optimizar Kubernetes manualmente y ahorró cerca del 40% de su gasto anual en EKS, tras desplegar PerfectScale by DoiT en sus clústeres de Amazon EKS. Con ese ahorro liberaron presupuesto que reinvirtieron en infraestructura de caché crítica para el rendimiento, protegiendo así la experiencia del paciente de la que dependen más de 600 sistemas de salud.

PerfectScale
Luma Health

The Challenge

Optimizar Kubernetes a mano costaba más de lo que ahorraba

El equipo de finanzas de Luma Health le exige a cada área un presupuesto de nube estricto, atado a los objetivos de margen bruto de la compañía. Para el equipo de SRE de Caio, eso se traducía en un ciclo mensual implacable. "Dedicábamos al menos 20 horas al mes a trabajar en la optimización de costos dentro del equipo de SRE. Estábamos todo el tiempo revisando métricas, entendiendo dónde estaban subiendo los costos y sumando tareas de seguimiento para mitigarlos." cuenta Caio.

El proceso era arduo. Los Engineers revisaban métricas de Datadog, evaluaban el uso de CPU y memoria en cientos de pods y ajustaban manualmente los requests y límites de recursos para deployments y DaemonSets. Probaron herramientas de IA de propósito general como Claude y ChatGPT para acelerar el análisis, pero los resultados eran inconsistentes.

Ajustar recursos en Kubernetes exige conocer la estacionalidad del tráfico, los patrones propios de cada workload y los efectos en cascada que puede tener un solo cambio sobre cientos de pods. Una reducción modesta en la asignación de CPU podía dejar a un servicio sin recursos. Un límite de memoria demasiado conservador podía provocar caídas por out-of-memory y reinicios de pods. El equipo de Caio detectaba la mayoría de estos riesgos, pero el margen de error era estrecho y la inversión de tiempo, insostenible.

Caio se veía atrapado en la misma conversación una y otra vez: justificar el aumento de gasto ante finanzas o encontrar ahorros equivalentes en otro frente para compensar la inversión. "A todos les importa muchísimo que el cliente esté contento," explica Caio, "y el cliente no está contento si una página tarda 10 segundos en cargar." El equipo de SRE necesitaba una manera de optimizar los costos de Kubernetes con tranquilidad, para reinvertir esos ahorros en la infraestructura de la que dependen los pacientes.

The Solution

Por qué Luma Health eligió PerfectScale

Caio descubrió PerfectScale by DoiT mientras evaluaba herramientas de optimización para Kubernetes. Cuenta: "PerfectScale encajó desde el primer momento. Ni siquiera seguí con las pruebas de las otras herramientas."

PerfectScale le dio al equipo de Caio una optimización automatizada y consciente del entorno que su proceso manual nunca pudo lograr. La clave: políticas de optimización adaptadas a distintos niveles de tolerancia al riesgo. "Tenemos perfiles específicos que usamos. Para los entornos inferiores aplicamos un enfoque de optimización de costos más agresivo. En producción, uno más equilibrado." Explica Caio, "A partir de los resultados y las métricas, podemos aplicar esos cambios a nuestra plataforma sin complicaciones."

En los entornos no productivos, la automatización de PerfectScale corre de manera continua y hace right-sizing de los pods para minimizar la pérdida sin intervención manual. En producción, la política equilibrada pondera el ahorro frente a las garantías de fiabilidad que exige el sector salud. La diferencia importa: una plataforma que atiende a 100 millones de pacientes no puede tolerar en producción el mismo nivel de agresividad que funciona en un clúster de staging con carga mínima.

Las recomendaciones de PerfectScale se basan en un análisis continuo de los workloads, no en simples promedios, y contemplan la estacionalidad del tráfico y los picos de uso que hacían tropezar al proceso anterior del equipo. Caio destaca que la enorme mayoría de las recomendaciones resultaron seguras para aplicar en producción, y que en los entornos inferiores el sistema aplica los cambios de forma automática.

"El factor confianza era algo clave. Más del 90% de las recomendaciones eran precisas. Se podían aplicar a producción con seguridad" comparte Caio.

El equipo de soporte de PerfectScale acompañó la implementación de cerca, ayudando a afinar políticas y a resolver casos límite a medida que el equipo de Caio escalaba la automatización en los clústeres.

Results

  • 90% menos tiempo en right-sizing manual de Kubernetes
  • 40% de reducción en costos de Amazon EKS
  • +1.700 h/año de Engineering redirigidas a fiabilidad y rendimiento

PerfectScale nos recortó un 40% del gasto total en EKS, y las automatizaciones se encargan de lo que antes le tomaba 20 horas al mes a nuestro equipo. Ahora dedicamos ese tiempo a la fiabilidad y al rendimiento, en lugar de andar persiguiendo métricas de costos.

Caio Cristo, Director de Infraestructura/SRE

Conoce a Luma Health

Luma Health desarrolla la Patient Success Platform en la que confían más de 600 sistemas de salud, redes especializadas y clínicas de Estados Unidos para conectar a los pacientes con la atención que necesitan. La plataforma orquesta el recorrido del paciente, desde la agenda y la comunicación hasta los flujos clínicos y financieros, y atiende a más de 100 millones de pacientes. Cuando el sistema de un proveedor de salud se ralentiza o se cae, hay personas reales que pierden citas, retrasan tratamientos o pierden la confianza en su equipo médico. En Luma Health, el uptime y el rendimiento no son abstracciones. Son resultados para los pacientes.

Caio Cristo, Director de Infraestructura, lidera un equipo de SRE distribuido globalmente, con nueve Engineers entre Brasil y Europa. El equipo es responsable de todo, desde la orquestación de contenedores y la infrastructure-as-code hasta la estrategia de nube a largo plazo.

A medida que Luma Health crecía, también lo hacía la complejidad de su entorno de Amazon EKS. El equipo ya operaba Karpenter para el escalado de nodos, KEDA para el autoescalado horizontal de pods con triggers de RabbitMQ, HTTP y base de datos, y Datadog para observabilidad. El tooling era moderno. El reto era mantener los costos bajo control sin comprometer la fiabilidad que exige el sector salud.

40% de reducción de costos en EKS y +1.700 horas de Engineering recuperadas

El impacto fue inmediato. En el primer ciclo de optimización, PerfectScale identificó una reducción del 40% en los costos específicos de EKS, que representan cerca del 15% del gasto total de Luma Health en AWS.

El ahorro de tiempo fue igual de transformador. El equipo de SRE de Caio logró una reducción del 90% en el tiempo dedicado al right-sizing de Kubernetes, lo que liberó a Engineers en tres husos horarios para concentrarse en el trabajo que de verdad mueve la plataforma hacia adelante.

Quizá lo más importante: PerfectScale le dio a Caio una respuesta sólida en la conversación recurrente con el equipo de finanzas de Luma Health. Cuando la capa de caché necesitó una inversión adicional para sostener el rendimiento de la aplicación, el equipo de SRE pudo apoyarse en los ahorros verificados en Kubernetes como compensación. La conversación dejó de ser defender costos para pasar a reasignar ahorros de forma estratégica. AWS siguió aportando la base de cómputo fiable y escalable a través de Amazon EKS, mientras que PerfectScale by DoiT se aseguraba de que cada dólar invertido en esa base rindiera al máximo.

"Algo en lo que PerfectScale nos ayudó muchísimo fue a equilibrar este costo. Necesitamos ampliar nuestra capa de caché, pero ¿hay algo que podamos ahorrar por el otro lado? La primera vez que aplicamos las recomendaciones, llegamos a un ahorro de aproximadamente el 40% anual en EKS. Eso definitivamente ayuda en las conversaciones donde tenemos que defender nuestras posiciones sobre fiabilidad frente a ahorro de costos." Caio Cristo, Director de Infraestructura en Luma Health

Un stack de optimización de Kubernetes de primer nivel sobre AWS

Con PerfectScale a cargo de la optimización a nivel de workload, Luma Health opera ahora un pipeline de autoescalado y optimización en todo el stack de Kubernetes sobre AWS. Karpenter gestiona el escalado a nivel de nodo, KEDA impulsa el autoescalado horizontal de pods con triggers de RabbitMQ, HTTP y base de datos, y PerfectScale optimiza de forma continua los requests y límites de recursos que determinan con qué eficiencia cada pod aprovecha la capacidad que Karpenter aprovisiona.

Gracias a esta combinación, el entorno de Amazon EKS de Luma Health escala de manera eficiente en cada capa: infraestructura, cantidad de pods y recursos de cada workload individual. A medida que la plataforma crece para atender a más sistemas de salud y más pacientes, este stack crece con ella y multiplica el valor de la optimización automatizada con el tiempo.

Caio y su equipo siguen trabajando con el equipo de soporte de PerfectScale para refinar las políticas de automatización en los distintos entornos, buscando el equilibrio justo entre eficiencia de costos y fiabilidad a medida que evolucionan los workloads. El objetivo es claro: mantener los costos de Kubernetes predecibles mientras Luma Health avanza en su misión de hacer que el sector salud funcione mejor para cada paciente.

More customer stories

OneFootball

PerfectScale by DoiT ayuda a OneFootball a optimizar Kubernetes para el tráfico global del fútbol a gran escala

25%
de reducción en los costos de infraestructura de Kubernetes
80%
de reducción en el esfuerzo de Engineering dedicado a la optimización de costos y al ajuste de resiliencia en Kubernetes
PlayHQ

PlayHQ automatiza la optimización de Kubernetes con PerfectScale

40%
Reduction in non-production Kubernetes costs
40%
Reduction in non-production K8s costs
20%
Reduction in production K8s costs
SNCF

SNCF reduce 30% sus costos de Kubernetes con PerfectScale

30%
Reducción de costos
~€500K
Estimated Annualized Savings
250
Clusters Under Optimization
NOS

NOS recorta drásticamente el gasto en Kubernetes en su entorno multi-cluster

50%
Cost Reduction
50%
Cost reduction on largest cluster
0%
Idle resources on main node pools
K1x

K1x reduce costos en la nube y agiliza sus operaciones de Kubernetes

Thousands
Saved Per Month
Thousands
Saved per month on cloud spend
<10%
Resource utilization on over-provisioned nodes before optimization
Trax

Cómo Trax redujo un 75% el gasto en Kubernetes con PerfectScale

75%
Reducción en costos de K8s
Riftweaver

Riftweaver optimiza su entorno de Kubernetes con PerfectScale

59%
Reduction in CPU Throttling
6
Critical APIs Improved
80,000+
Game Downloads
Rapyd

Rapyd reduce sus costos de nube entre un 35 y un 40% con PerfectScale

35-40%
Reducción de costos de nube
15+
AWS EKS Clusters Optimized
100+
Countries Supported for Payments