PerfectScalePerfectScale

Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

PlayHQ otimiza custos de Kubernetes multi-tenant

Como a PlayHQ automatizou o rightsizing de Kubernetes e ganhou visibilidade em tempo real dos custos por tenant com PerfectScale by DoiT

PerfectScale
PlayHQ

The Challenge

A PlayHQ migrou do ECS para o Kubernetes e alcançou economias iniciais significativas, mas, à medida que sua base de clientes multi-tenant se expandia, os padrões de uso foram ficando mais complexos e imprevisíveis. Com cerca de 90% da computação rodando em Kubernetes e centenas de workloads pequenos e variáveis entre os tenants, o autoscaling em nível de infraestrutura com Karpenter, HPA e KEDA garantia capacidade, mas não conseguia fazer o right-sizing preciso dos requests de CPU e memória no nível do workload. A otimização manual de recursos não escalava para um time de plataforma enxuto, e uma avaliação do OpenCost revelou um overhead operacional alto demais para operar e configurar.

The Solution

A PlayHQ adotou o PerfectScale por meio da DoiT para automatizar o rightsizing de Kubernetes e melhorar a eficiência de custos do EKS em seus clusters multi-tenant. Menos de uma hora depois da demonstração inicial, o time já tinha a automação funcionando em um cluster de desenvolvimento. O PerfectScale trouxe rightsizing automatizado de workloads, com ajuste contínuo dos requests de CPU e memória, janelas de manutenção que impedem alterações durante os sábados de jogos com alto tráfego, exclusões em nível de namespace para workloads sensíveis e políticas de otimização balanceadas para clusters de produção, que protegem a estabilidade ao mesmo tempo em que reduzem custos.

Results

  • Redução de 40% nos custos de Kubernetes fora de produção
  • Redução de 20% nos custos de Kubernetes em produção
  • Dezenas de milhares de dólares economizados por ano
  • Maior consistência de performance entre os workloads
  • Visibilidade em tempo real da alocação de custos de Kubernetes por tenant
  • Detecção e correção mais rápidas de problemas de resiliência, incluindo alertas de OOM
  • Automação configurada em um cluster de desenvolvimento em menos de uma hora após a demonstração inicial

Cada cliente tem padrões de uso únicos. A otimização manual de recursos simplesmente não escalava — precisávamos de automação para garantir que cada cliente, independentemente do tamanho, tivesse uma infraestrutura dimensionada corretamente sem consumir a capacidade do nosso time.

Brad Quinn, Lead Platform Engineer, PlayHQ

Rodando o esporte comunitário em Kubernetes

Todos os dias, ao redor do mundo, a PlayHQ opera infraestrutura digital crítica para milhares de competições esportivas comunitárias. Organizações esportivas de destaque — incluindo clubes juvenis de futebol australiano, ligas de basquete e associações locais de netball e futebol — dependem da plataforma durante os horários de pico das partidas, quando o uso dispara. Essas organizações usam a PlayHQ para gerenciar inscrições, placares, pagamentos e a operação de competições envolvendo centenas de equipes. Com a demanda variando muito por esporte, temporada e região, escalar a infraestrutura com eficiência e controlar custos é um desafio constante. No centro dessa operação está o grupo de engenharia de plataforma da PlayHQ, liderado pelo Lead Platform Engineer Brad Quinn, responsável pela confiabilidade, pela performance e pelos custos do ambiente Kubernetes. "O Kubernetes é muito importante para nós: é o fluxo de trabalho diário dos nossos engenheiros", diz Quinn. Com cerca de 90% da computação da PlayHQ rodando em Kubernetes, o time precisava de uma abordagem mais automatizada e inteligente para a otimização de custos à medida que a base de clientes crescia.

Por que a PlayHQ priorizou a otimização de custos de Kubernetes

A PlayHQ migrou do ECS para o Kubernetes para reduzir custos de infraestrutura e acelerar os deploys de tenants. Embora a mudança tenha trazido economias iniciais, os custos voltaram a subir conforme mais organizações entravam na plataforma e os padrões de uso ficavam mais imprevisíveis. "Migramos do ECS para o Kubernetes e alcançamos economias iniciais significativas", diz Quinn. "À medida que nossa base de clientes se expandiu e os padrões de uso ficaram mais complexos, precisamos evoluir nossa abordagem de otimização para manter essa eficiência." A PlayHQ já usava o Karpenter para escalar nós com eficiência e contava com HPA e KEDA para ajustar a capacidade conforme a demanda, especialmente durante os picos de tráfego dos fins de semana. Mas as demandas dos workloads variavam muito entre os tenants. O autoscaling em nível de infraestrutura garantia capacidade, mas não resolvia o desafio de fazer o right-sizing preciso dos requests de CPU e memória em centenas de workloads pequenos e variáveis. Quinn também avaliou o OpenCost, mas concluiu que o overhead operacional era alto demais para um time de plataforma enxuto.

Como o PerfectScale automatizou a otimização de Kubernetes

O PerfectScale logo se destacou como a solução ideal para automatizar o rightsizing de Kubernetes e melhorar a eficiência de custos do EKS nos clusters multi-tenant da PlayHQ. A velocidade foi parte fundamental da equação: "Fizemos a demonstração inicial, recebemos acesso à plataforma e configuramos a automação em um cluster de desenvolvimento em menos de uma hora", diz Quinn. Os recursos do PerfectScale se encaixaram bem no ambiente e no ritmo operacional da PlayHQ, permitindo que o time automatizasse a otimização com segurança e mantivesse controle total sobre quando e onde as mudanças aconteciam. Entre os principais recursos estavam o rightsizing automatizado de workloads, com ajuste contínuo dos requests de CPU e memória, janelas de manutenção que impedem alterações durante períodos esportivos de alto tráfego, como os sábados de jogos, exclusões em nível de namespace para evitar mexer em workloads sensíveis e políticas de otimização balanceadas para clusters de produção, garantindo estabilidade junto com a redução de custos.

Resultados: custos menores e resolução mais rápida de problemas

Após adotar o PerfectScale por meio da DoiT, a PlayHQ obteve melhorias significativas tanto em custos quanto em performance operacional: redução de 40% nos custos de Kubernetes fora de produção, redução de 20% nos custos de Kubernetes em produção, dezenas de milhares de dólares economizados por ano, maior consistência de performance entre os workloads e mais visibilidade da alocação de custos por tenant. O time também passou a detectar e corrigir problemas de resiliência com mais rapidez. "A parte de resiliência, como os alertas de OOM, deixa o tempo de resolução muito mais rápido", diz Quinn. A visão em tempo real dos custos de Kubernetes por tenant dá a Quinn uma leitura mais clara da sazonalidade entre os diferentes tenants e fortalece a forma como ele comunica o valor da otimização à liderança. "Conseguimos levantar na hora os custos de computação por tenant", diz Quinn. "Depois, posso compartilhar com o CTO o total economizado e os problemas resolvidos."

Construindo uma cultura de engenharia consciente dos custos

Com a otimização automatizada de Kubernetes em funcionamento, a PlayHQ planeja estender o acesso ao PerfectScale para além do time de plataforma. O objetivo é ajudar os squads de engenharia de produto a gerenciar seus próprios SLOs e entender como as decisões de design influenciam o uso de recursos de Kubernetes e os custos de infraestrutura. Isso apoia a meta de longo prazo da PlayHQ de alinhar as práticas de engenharia ao crescimento sustentável, sem deixar de entregar experiências digitais confiáveis para clubes, ligas e famílias.

Parceria com a DoiT para otimização de Kubernetes em escala

Quinn destacou o valor da DoiT e do PerfectScale como parceiros de longo prazo. Durante o onboarding, os times identificaram e resolveram um problema em questão de horas, o que fortaleceu ainda mais a confiança da PlayHQ na solução. Com otimização automatizada, economias significativas e maior confiabilidade, o time de plataforma tem a eficiência operacional e a visibilidade necessárias para apoiar a expansão contínua da PlayHQ.

Saiba como o PerfectScale melhora a eficiência do Kubernetes

Descubra como o PerfectScale ajuda times a fazer o right-sizing dos clusters, reduzir desperdício e melhorar a performance sem ajustes manuais.

More customer stories

PicnicAI

PicnicAI automatiza 85-90% dos workloads de Kubernetes e melhora a confiabilidade com o PerfectScale by DoiT

85–90%
dos workloads de aplicação agora cobertos por redimensionamento automatizado
50%
de redução aproximada no tempo que a equipe de infraestrutura dedica à infraestrutura
Stefanini

Stefanini corta 26% dos custos de computação Kubernetes com PerfectScale by DoiT

26%
Redução nos custos de computação Kubernetes
>60%
Redução nos custos de infraestrutura no último ano
OneFootball

PerfectScale by DoiT ajuda a OneFootball a otimizar Kubernetes para o tráfego global do futebol em larga escala

25%
de redução nos custos de infraestrutura Kubernetes
80%
de redução no esforço de engenharia dedicado à otimização de custos e ao ajuste de resiliência em Kubernetes
Luma Health

Luma Health corta 40% dos custos com EKS e libera milhares de horas de engenharia por ano

90%
Menos tempo em right-sizing manual de Kubernetes
40%
Redução nos custos com Amazon EKS
+1,700h/year
Horas de engenharia redirecionadas para confiabilidade e performance
SNCF

Como a SNCF cortou desperdício em K8s e aumentou a confiabilidade em escala

30%
Mais workloads com custo estável
30%
Mais workloads absorvidos com custo estável
~€500K
Economia anualizada estimada
NOS

NOS corta custos de Kubernetes pela metade e recupera a confiança na otimização

50%
Redução de custos
50%
Redução de custos no maior cluster
0%
Recursos ociosos nos node pools principais
K1x

K1x corta custos de nuvem e simplifica as operações de Kubernetes

Thousands
Economizados por mês
Thousands
Economizados por mês em gastos com nuvem
<10%
Utilização de recursos nos nós superprovisionados antes da otimização
Riftweaver

Como o PerfectScale ajuda um time de DevOps de uma pessoa a escalar a Riftweaver

59%
Redução no throttling de CPU
6
APIs críticas otimizadas
80,000+
Downloads do jogo