Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

Luma Health corta 40% dos custos com EKS e libera milhares de horas de engenharia por ano

O time de SRE da Luma Health recuperou 90% do tempo que gastava com otimização manual de Kubernetes e economizou cerca de 40% do gasto anual com EKS ao adotar o PerfectScale by DoiT em seus clusters Amazon EKS. A economia liberou orçamento que o time reinvestiu em uma infraestrutura de cache crítica para performance, protegendo a experiência dos pacientes da qual mais de 600 sistemas de saúde dependem.

PerfectScale
Luma Health

The Challenge

A otimização manual do Kubernetes custava mais do que economizava

O time financeiro da Luma Health mantém todas as áreas dentro de um orçamento de nuvem rigoroso, atrelado às metas de margem bruta da empresa. Para o time de SRE do Caio, isso virava um ciclo mensal sem trégua. "A gente reservava pelo menos 20 horas por mês para trabalhar em otimização de custos no time de SRE. Estávamos o tempo todo revisando métricas, entendendo onde os custos estavam subindo e abrindo itens de ação para mitigar isso." conta Caio.

O processo era trabalhoso. Os engenheiros revisavam métricas no Datadog, avaliavam o uso de CPU e memória em centenas de pods e ajustavam manualmente requests e limits de recursos em deployments e DaemonSets. Chegaram a testar ferramentas de IA de uso geral, como Claude e ChatGPT, para acelerar a análise, mas os resultados eram inconsistentes.

Ajustar recursos no Kubernetes exige sensibilidade à sazonalidade do tráfego, aos padrões específicos de cada workload e aos efeitos em cascata que uma única mudança pode provocar em centenas de pods. Uma redução modesta na alocação de CPU pode sufocar um serviço. Um limite de memória conservador demais pode disparar crashes por falta de memória e reinícios de pods. O time do Caio pegava a maior parte desses riscos, mas a margem de erro era estreita e o tempo investido, insustentável.

Caio se via numa conversa recorrente: justificar o aumento de gasto para o financeiro ou achar economia equivalente em outro lugar para compensar o investimento. "Todo mundo está muito preocupado em garantir que o cliente esteja feliz," explica Caio, "e o cliente não fica feliz se uma página leva 10 segundos para carregar." O time de SRE precisava de um jeito de otimizar os custos do Kubernetes com segurança para reinvestir essa economia na infraestrutura da qual os pacientes dependem.

The Solution

Por que a Luma Health escolheu o PerfectScale

Caio descobriu o PerfectScale by DoiT enquanto avaliava ferramentas de otimização para Kubernetes. Ele conta: "O PerfectScale fez sentido desde o primeiro momento. Nem cheguei a continuar os trials com as outras ferramentas."

O PerfectScale entregou ao time do Caio uma otimização automatizada e sensível ao ambiente que o processo manual nunca conseguiu. A chave: políticas de otimização ajustadas a diferentes níveis de tolerância a risco. "Temos perfis específicos que usamos. Para ambientes mais baixos, adotamos uma abordagem de otimização de custos mais agressiva. Em produção, temos uma abordagem mais equilibrada." Explica Caio, "Com base no output e nas métricas, conseguimos aplicar essas mudanças na nossa plataforma com facilidade."

Fora de produção, a automação do PerfectScale roda continuamente, fazendo o right-sizing dos pods para reduzir desperdício sem intervenção manual. Em produção, a política equilibrada pesa a economia de custos contra as garantias de confiabilidade que a saúde exige. A distinção importa: uma plataforma que atende 100 milhões de pacientes não pode tolerar em produção a mesma agressividade que funciona num cluster de staging com carga mínima.

As recomendações do PerfectScale se apoiam em uma análise contínua dos workloads, e não em médias simples, levando em conta a sazonalidade do tráfego e os picos de uso que travavam o processo anterior do time. Caio destaca que a esmagadora maioria das recomendações se mostrou segura para aplicar em produção e que, nos ambientes mais baixos, o sistema aplica as mudanças automaticamente.

"O fator confiança era muito importante. Mais de 90% das recomendações foram precisas. Dava para aplicar em produção com segurança" conta Caio.

O time de suporte do PerfectScale ofereceu acompanhamento próximo durante toda a implantação, ajudando a calibrar políticas e resolver casos extremos à medida que o time do Caio escalava a automação pelos clusters.

Results

  • 90% menos tempo em right-sizing manual de Kubernetes
  • 40% de redução nos custos com Amazon EKS
  • +1.700h/ano de engenharia redirecionadas para confiabilidade e performance

O PerfectScale cortou 40% do nosso gasto total com EKS, e as automações dão conta do que antes consumia 20 horas por mês do nosso time. Hoje usamos esse tempo com confiabilidade e performance, em vez de correr atrás de métricas de custo.

Caio Cristo, Diretor de Infraestrutura/SRE

Conheça a Luma Health

A Luma Health desenvolve a Patient Success Platform, em que mais de 600 sistemas de saúde, redes especializadas e clínicas em todos os Estados Unidos confiam para conectar pacientes ao cuidado. A plataforma orquestra as jornadas dos pacientes, do agendamento e da comunicação aos workflows clínicos e financeiros, atendendo mais de 100 milhões de pacientes. Quando o sistema de um provedor de saúde fica lento ou sai do ar, pessoas reais perdem consultas, adiam tratamentos ou perdem a confiança na sua equipe de cuidado. Uptime e performance não são abstrações na Luma Health. São desfechos para os pacientes.

Caio Cristo, Diretor de Infraestrutura, lidera um time de SRE distribuído globalmente, com nove engenheiros entre Brasil e Europa. O time é responsável por tudo, da orquestração de contêineres e da infraestrutura como código à estratégia de nuvem de longo prazo.

Conforme a Luma Health crescia, crescia também a complexidade do seu ambiente Amazon EKS. O time já rodava o Karpenter para escala de nós, o KEDA para autoscaling horizontal de pods com triggers de RabbitMQ, HTTP e banco de dados, e o Datadog para observabilidade. O ferramental era moderno. O desafio era manter os custos sob controle sem abrir mão da confiabilidade que a saúde exige.

Redução de 40% nos custos com EKS e +1.700 horas de engenharia recuperadas

O impacto foi imediato. No primeiro ciclo de otimização, o PerfectScale identificou uma redução de 40% nos custos específicos do EKS, que representam cerca de 15% do gasto total da Luma Health com AWS.

A economia de tempo foi igualmente transformadora. O time de SRE do Caio viu uma queda de 90% no tempo gasto com right-sizing de Kubernetes, liberando engenheiros em três fusos horários para focar no trabalho que realmente faz a plataforma avançar.

Talvez o mais importante: o PerfectScale deu ao Caio uma resposta sólida para a conversa recorrente sobre orçamento com o time financeiro da Luma Health. Quando a camada de cache precisou de investimento adicional para manter a performance da aplicação, o time de SRE pôde apontar para a economia comprovada no Kubernetes como contrapartida. A conversa deixou de ser sobre defender custos e passou a ser sobre realocar economia de forma estratégica. A AWS seguiu fornecendo a base de computação confiável e escalável por meio do Amazon EKS, enquanto o PerfectScale by DoiT garantia que cada dólar gasto nessa base rendesse o máximo possível.

"Uma coisa em que o PerfectScale ajudou muito a gente foi equilibrar esse custo. Precisamos aumentar nossa camada de cache, mas tem algo que dá para economizar do outro lado? Na primeira vez que aplicamos as recomendações, chegamos a aproximadamente 40% de economia anual no EKS. Isso ajuda demais nas conversas em que precisamos defender nossas posições sobre confiabilidade versus economia de custos." Caio Cristo, Diretor de Infraestrutura na Luma Health

Construindo um stack de otimização de Kubernetes de classe mundial na AWS

Com o PerfectScale cuidando da otimização no nível dos workloads, a Luma Health hoje opera um pipeline de autoscaling e otimização em todo o stack Kubernetes na AWS. O Karpenter gerencia a escala no nível dos nós, o KEDA conduz o autoscaling horizontal de pods com triggers de RabbitMQ, HTTP e banco de dados, e o PerfectScale otimiza continuamente os requests e limits de recursos que determinam o quanto cada pod aproveita a capacidade provisionada pelo Karpenter.

A combinação faz com que o ambiente Amazon EKS da Luma Health escale com eficiência em todas as camadas: infraestrutura, quantidade de pods e recursos individuais dos workloads. À medida que a plataforma cresce para atender mais sistemas de saúde e mais pacientes, esse stack acompanha, multiplicando o valor da otimização automatizada ao longo do tempo.

Caio e seu time seguem trabalhando com o time de suporte do PerfectScale para refinar as políticas de automação entre ambientes, garantindo o equilíbrio certo entre eficiência de custo e confiabilidade conforme os workloads evoluem. O objetivo é simples: manter os custos do Kubernetes previsíveis enquanto a Luma Health persegue sua missão de fazer a saúde funcionar melhor para cada paciente.

More customer stories

OneFootball

PerfectScale by DoiT ajuda a OneFootball a otimizar Kubernetes para o tráfego global do futebol em larga escala

25%
de redução nos custos de infraestrutura Kubernetes
80%
de redução no esforço de engenharia dedicado à otimização de custos e ao ajuste de resiliência em Kubernetes
PlayHQ

PlayHQ automatiza a otimização do Kubernetes com o PerfectScale

40%
Reduction in non-production Kubernetes costs
40%
Reduction in non-production K8s costs
20%
Reduction in production K8s costs
SNCF

SNCF reduz custos do Kubernetes em 30% com PerfectScale

30%
Redução de custos
~€500K
Estimated Annualized Savings
250
Clusters Under Optimization
NOS

NOS corta drasticamente os gastos com Kubernetes em ambiente multi-cluster

50%
Cost Reduction
50%
Cost reduction on largest cluster
0%
Idle resources on main node pools
K1x

K1x reduz custos de nuvem e otimiza operações de Kubernetes

Thousands
Saved Per Month
Thousands
Saved per month on cloud spend
<10%
Resource utilization on over-provisioned nodes before optimization
Trax

Como a Trax cortou 75% dos gastos com Kubernetes usando o PerfectScale

75%
Redução nos custos de K8s
Riftweaver

Riftweaver otimiza o ambiente Kubernetes com o PerfectScale

59%
Reduction in CPU Throttling
6
Critical APIs Improved
80,000+
Game Downloads
Rapyd

Rapyd corta custos de nuvem em 35-40% com a PerfectScale

35-40%
Redução de custos de nuvem
15+
AWS EKS Clusters Optimized
100+
Countries Supported for Payments