Stefanini corta 26% dos custos de computação Kubernetes com PerfectScale by DoiT
- 26%
- Redução nos custos de computação Kubernetes
- >60%
- Redução nos custos de infraestrutura no último ano
Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.
Como a PicnicAI usou o PerfectScale by DoiT para automatizar a otimização de workloads, reduzir a sobrecarga operacional e dar aos engenheiros mais confiança na infraestrutura

À medida que o ambiente Kubernetes da PicnicAI evoluía, a equipe enfrentava um desafio cada vez mais comum: entender de quanta CPU e memória cada workload realmente precisava.
Historicamente, os requisitos de recursos eram, em grande parte, estimados no momento em que os workloads eram criados e podiam permanecer inalterados até que surgisse algum problema. Essa abordagem era especialmente problemática para workloads de processamento de dados, em que os requisitos podiam variar bastante de um job para outro.
"Antes, o dimensionamento funcionava basicamente assim: alguém chutava quanta memória e CPU um job precisaria ao criá-lo, e depois aquilo simplesmente nunca mais era tocado até acontecerem vários OOMs (erros de falta de memória)", diz Josh Zarrabi, Engenheiro de Infraestrutura da PicnicAI.
Quando os workloads eram subprovisionados, os jobs podiam falhar e tentar novamente repetidas vezes, criando filas e pressionando ainda mais os bancos de dados compartilhados. Por outro lado, o superprovisionamento gerava capacidade de infraestrutura desnecessária e gastos extras com nuvem.
O desafio era agravado pela equipe enxuta de engenharia da PicnicAI. Muitas decisões de infraestrutura haviam sido tomadas por engenheiros que já não estavam na empresa, o que significava que a equipe nem sempre tinha o contexto por trás das configurações existentes.
Embora reduzir os custos de nuvem tenha sido uma das motivações para explorar a otimização, a confiabilidade logo se tornou o objetivo mais importante. "Os ganhos de confiabilidade têm sido muito importantes para nós, e a economia de custos foi um benefício adicional bem-vindo", diz Zarrabi.
A PicnicAI começou a trabalhar com a DoiT como parte de uma iniciativa mais ampla de otimização de custos de nuvem. A DoiT apresentou o PerfectScale para ajudar a equipe a entender a utilização de recursos no nível de workload e automatizar a otimização do Kubernetes.
O PerfectScale combina visibilidade granular do Kubernetes com right-sizing automatizado e sensível a cada workload, ajudando as equipes a otimizar CPU e memória sem depender de monitoramento manual constante.
Para a PicnicAI, a implementação foi deliberadamente feita em fases. A equipe se concentrou inicialmente em melhorar a confiabilidade e ganhar confiança nas recomendações antes de expandir a automação progressivamente.
Os recursos de InfraFit do PerfectScale ajudaram a PicnicAI a identificar configurações ineficientes de infraestrutura e a entender onde os workloads não estavam alinhados com os recursos provisionados.
"Com o InfraFit do PerfectScale, fica muito mais fácil dizer: ok, estamos realmente desperdiçando aqui porque o formato está errado para os nossos workloads", diz Zarrabi. "Isso me dá mais confiança para fazer mudanças quando nem sempre temos o contexto completo das decisões por trás delas."
A tecnologia era só parte da solução. As equipes de Field Engineering e Customer Success da DoiT trabalharam lado a lado com a PicnicAI para ajudar o time a entender o comportamento do Kubernetes e determinar onde a automação poderia ser introduzida com segurança.
Isso incluiu revisar a interação entre o HPA (horizontal pod autoscaling) e o cluster autoscaler, ajustar thresholds e introduzir políticas controladas em torno dos requisitos de recursos.
Os recursos de políticas e guardrails do PerfectScale permitiram que a PicnicAI controlasse onde e como a otimização era aplicada, em vez de simplesmente ativar a automação em todos os workloads.
Workloads mais sensíveis foram tratados com cautela, enquanto a automação foi expandida progressivamente pelos ambientes de produção, staging e desenvolvimento.
Para Zarrabi, contar com suporte técnico contínuo junto com a plataforma foi uma parte importante da parceria. "É bom ter alguém acompanhando e me cobrando", diz ele. "Só de garantir que estamos aproveitando o produto ao máximo já ajuda."
"O PerfectScale nos dá a confiança para automatizar a otimização do Kubernetes, permitindo que nossos engenheiros foquem em construir o que realmente importa."
Josh Zarrabi, Engenheiro de Infraestrutura
A maior mudança operacional foi o fim do gerenciamento manual de recursos. Antes do PerfectScale, a PicnicAI não tinha nenhum redimensionamento automatizado de workloads. Hoje, o redimensionamento automatizado cobre aproximadamente 85–90% dos workloads em seus clusters de aplicação.
Isso significa que os requisitos de recursos podem ser otimizados continuamente sem que os engenheiros precisem revisar e ajustar manualmente cada workload.
Os benefícios vão além da otimização em si. A PicnicAI passou a ter menos problemas relacionados a memória e menos interrupções operacionais do tipo que antes acompanhava workloads mal dimensionados.
"É simplesmente uma coisa chata a menos para se preocupar", diz Zarrabi.
Essa mudança é especialmente significativa para uma organização de engenharia enxuta. Ao automatizar uma parte maior do gerenciamento da sua infraestrutura, a PicnicAI conseguiu aumentar a capacidade da equipe de entregar mais trabalho em toda a empresa sem adicionar sobrecarga operacional.
Em vez de investigar repetidamente por que os jobs estão falhando, as filas estão crescendo ou os bancos de dados estão sob carga desnecessária, os engenheiros podem dedicar mais tempo a iniciativas estratégicas de infraestrutura e produto.
A confiabilidade era o objetivo principal da parceria, mas não foi o único resultado. Como o right-sizing do PerfectScale é sensível a cada workload, ele também ajudou a PicnicAI a eliminar o superprovisionamento que antes se acumulava quando os limites de recursos eram estimados uma única vez e nunca mais revisados — reduzindo gastos desnecessários com infraestrutura junto com os ganhos de confiabilidade.
"Os ganhos de confiabilidade têm sido muito importantes para nós, e a economia de custos foi um benefício adicional bem-vindo", diz Zarrabi.
Para uma equipe enxuta já dividida entre várias prioridades, essa combinação tornou a automação um investimento fácil de justificar: ela não impõe uma escolha entre manter um orçamento de infraestrutura mais apertado e manter os sistemas confiáveis — ela entrega os dois.
A redução do gerenciamento manual do Kubernetes permitiu que os engenheiros da PicnicAI se concentrassem em projetos de longo prazo, incluindo a migração da integração contínua para fora do Jenkins e a exploração de novas iniciativas de IA.
O valor da parceria, portanto, vai muito além do problema de confiabilidade que ela veio resolver. Ao automatizar uma tarefa que antes exigia julgamento e intervenção da engenharia, a PicnicAI também reduziu os custos de infraestrutura, liberou capacidade técnica escassa e deu aos engenheiros mais confiança para trabalhar com configurações históricas que eles não definiram originalmente.
"Você quer gastar seu tempo focando em coisas que são úteis", diz Zarrabi. "Tentar adivinhar seus limites de memória e CPU não é uma delas."
A PicnicAI planeja continuar expandindo o papel do PerfectScale à medida que seu ambiente Kubernetes evolui, aumentando a automação em mais workloads e abordando progressivamente a infraestrutura de produção mais sensível.
A empresa também continuará contando com a expertise mais ampla da DoiT em nuvem conforme sua plataforma e suas iniciativas de IA se desenvolvem. Para a PicnicAI, o objetivo é simples: automatizar a otimização da infraestrutura sempre que possível, manter a confiabilidade necessária para workloads críticos de saúde e permitir que os engenheiros passem menos tempo gerenciando o Kubernetes e mais tempo construindo tecnologia capaz de melhorar os resultados dos pacientes.
A PicnicAI é uma empresa de health-tech que desenvolve inteligência para acelerar a saúde humana. Sua tecnologia processa e valida grandes volumes de dados médicos, ajudando pesquisadores farmacêuticos a conduzir estudos clínicos observacionais com mais eficiência e ajudando pacientes a gerenciar seus cuidados.
A infraestrutura de nuvem da empresa desempenha um papel crítico nessa missão. A PicnicAI opera oito ou nove clusters Kubernetes que dão suporte a workloads automatizados, com requisitos de CPU e memória que podem variar significativamente dependendo dos dados processados. Para a PicnicAI, uma infraestrutura confiável é, em última análise, o que permite que seus engenheiros se concentrem na inovação em saúde em vez de passar o tempo gerenciando o Kubernetes manualmente.
Chega de adivinhar os limites de CPU e memória do Kubernetes para cada workload
Veja o que o PerfectScale by DoiT encontra nos seus clusters. Tenha visibilidade no nível de workload, redimensionamento automatizado e guardrails de políticas sob seu controle, com engenheiros da DoiT ao lado da sua equipe.