PerfectScalePerfectScale

Esta página também está disponível em English, Deutsch, Español, Français, Italiano e 日本語.

Como o PerfectScale ajuda um time de DevOps de uma pessoa a escalar a Riftweaver

O estúdio de games Riftweaver reduziu o throttling de CPU em 59% e deu a uma única engenheira de DevOps a confiança para escalar Kubernetes

PerfectScale
Riftweaver

The Challenge

A Riftweaver enfrentava desafios para escalar seus ambientes Kubernetes e lidar com a carga imprevisível de jogadores à medida que passava do beta fechado para o acesso antecipado e o lançamento público. Com um cluster de produção e vários ambientes de não produção rodando no AWS EKS, a engenheira de DevOps Rumby Osei dependia do Cluster AutoScaler (CAS) para escalar nós e do Horizontal Pod Autoscaler (HPA) para escalar pods. Quando os serviços começaram a apresentar problemas de throttling, ela recorreu ao VPA, mas encontrou obstáculos: a ferramenta não fornecia dados históricos nem resultados consistentes. Entre as principais dores estavam o throttling frequente de CPU durante testes de carga e partidas ao vivo, causando lag, o troubleshooting manual demorado, com métricas conflitantes, e a visibilidade limitada das ferramentas existentes, que não ofereciam insights históricos nem recomendações acionáveis.

The Solution

O PerfectScale se tornou parte fundamental da estratégia de infraestrutura da Riftweaver. Osei o utiliza para reduzir o throttling de CPU, identificando workloads de alto risco e recebendo recomendações personalizadas de ajustes de CPU; simplificar a alocação de recursos com insights sobre nós e workloads subutilizados, permitindo otimizar tanto o posicionamento dos pods quanto a seleção de nós; e aumentar a resiliência ao priorizar mudanças com base nos perfis de risco do PerfectScale, minimizando problemas como chamadas de API perdidas ou duplicadas. A interface do PerfectScale, os perfis de risco e recursos exclusivos como o rastreamento de CO2 deram a Osei confiança nas recomendações.

Results

  • Reduziu o throttling de CPU em quase 59% em seis APIs críticas
  • Melhorou a experiência dos usuários ao resolver gargalos de desempenho e reduzir o lag
  • Permitiu que uma única engenheira de DevOps gerenciasse a escalabilidade de forma proativa com o mínimo de esforço manual
  • Simplificou as operações para um time de DevOps de uma pessoa só
  • Obteve otimização de nível corporativo sem custo algum por meio do Community Package do PerfectScale
  • Preparou a infraestrutura para o crescimento futuro, à medida que a Riftweaver se expande para mais plataformas e usuários

O PerfectScale mudou o jogo para nós. Os insights não só resolveram problemas imediatos, como também nos prepararam para o crescimento futuro, à medida que expandimos para mais plataformas e usuários.

Rumby Osei, Engenheira Sênior de DevOps na Riftweaver

Quem é a Riftweaver?

A Riftweaver é um estúdio de games inovador que avançou muito no último ano. Do lançamento de seu jogo principal à chegada em plataformas como Steam e iPads, o estúdio já acumula mais de 80.000 downloads do seu jogo. Com uma equipe enxuta de apenas 15 pessoas, a infraestrutura de backend da Riftweaver é gerenciada por uma única engenheira de DevOps, Rumby Osei — que garante que a infraestrutura do jogo escale com eficiência e ofereça uma experiência impecável para uma base de jogadores em constante crescimento.

O desafio

"Quando entrei na Riftweaver, o jogo não escalava nem aguentava carga de nível de produção. Meu papel era nos levar até lá", conta Osei. A Riftweaver enfrentava desafios para escalar seus ambientes Kubernetes e lidar com a carga imprevisível de jogadores à medida que passava do beta fechado para o acesso antecipado e o lançamento público. Rodando no AWS EKS com Cluster AutoScaler e HPA, o time começou a enfrentar problemas de throttling. Quando Osei recorreu ao VPA, encontrou obstáculos: "O VPA não fornecia dados históricos nem me permitia gerar resultados consistentes. Eu não conseguia voltar e ver o que tinha mudado ao longo do tempo. Cheguei a escrever um script para extrair todos os VPAs de cada deployment só para conseguir comparar os dados." Entre as principais dores estavam o throttling frequente de CPU durante as partidas, o troubleshooting manual demorado e a visibilidade limitada das ferramentas existentes.

Por que o PerfectScale?

Rumby Osei começou a buscar uma solução que a ajudasse a tomar decisões de right-sizing mais orientadas por dados, reduzir gargalos de desempenho e obter insights acionáveis sobre o uso de recursos. Após uma conversa com o time do PerfectScale, Osei enxergou o potencial da ferramenta para preencher a lacuna entre as previsões dos testes de carga e o comportamento real dos usuários, aumentando a resiliência de suas workloads. "A interface e os perfis de risco do PerfectScale me deram confiança nas recomendações. A ferramenta também trouxe recursos que eu nunca tinha visto antes — como o monitoramento do impacto ambiental com rastreamento de CO2."

A solução: otimizando escalabilidade e desempenho com o PerfectScale

O PerfectScale agora é parte fundamental da estratégia de infraestrutura da Riftweaver. Osei o utiliza para reduzir o throttling de CPU, identificando workloads de alto risco e recebendo recomendações personalizadas de ajustes de CPU. Os insights sobre nós e workloads subutilizados permitiram otimizar tanto o posicionamento dos pods quanto a seleção de nós, reduzindo desperdício e aumentando a eficiência. Ao priorizar mudanças com base nos perfis de risco do PerfectScale, a Riftweaver minimiza problemas como chamadas de API perdidas ou duplicadas, que antes frustravam os usuários.

Resultados: jogabilidade mais fluida e eficiência operacional

O PerfectScale está ajudando a Riftweaver a escalar para atender à demanda crescente e, ao mesmo tempo, reduzir a sobrecarga operacional. Entre os principais resultados estão: redução de 59% no throttling de CPU em seis APIs críticas, garantindo uma jogabilidade mais fluida; melhor experiência dos usuários, com menos interrupções mesmo nos horários de pico; operações simplificadas, permitindo que um time de DevOps de uma pessoa só gerencie escalabilidade e resiliência de forma proativa com o mínimo de esforço manual; e escalabilidade com bom custo-benefício por meio do Community Package do PerfectScale, permitindo que o time otimize a infraestrutura sem pressão financeira adicional.

Por que o PerfectScale funciona para a Riftweaver

A interface intuitiva, as análises robustas e as recomendações acionáveis do PerfectScale o tornaram uma ferramenta essencial para o time pequeno, mas dinâmico, da Riftweaver. Recursos como o rastreamento de impacto ambiental e a visibilidade do HPA também estão alinhados com a abordagem visionária do estúdio para a gestão de infraestrutura. Ao integrar o PerfectScale, a Riftweaver otimizou seu ambiente Kubernetes, garantindo escalabilidade, confiabilidade e uma experiência superior para os jogadores. À medida que o estúdio continua crescendo, o PerfectScale segue como um parceiro importante nessa jornada de entregar uma jogabilidade empolgante e sem lag para jogadores do mundo todo.

Descubra como o PerfectScale aumenta a eficiência do Kubernetes

Veja como o PerfectScale ajuda times a fazer o right-sizing de clusters, reduzir desperdício e melhorar o desempenho sem ajustes manuais.

More customer stories

PicnicAI

PicnicAI automatiza 85-90% dos workloads de Kubernetes e melhora a confiabilidade com o PerfectScale by DoiT

85–90%
dos workloads de aplicação agora cobertos por redimensionamento automatizado
50%
de redução aproximada no tempo que a equipe de infraestrutura dedica à infraestrutura
Stefanini

Stefanini corta 26% dos custos de computação Kubernetes com PerfectScale by DoiT

26%
Redução nos custos de computação Kubernetes
>60%
Redução nos custos de infraestrutura no último ano
OneFootball

PerfectScale by DoiT ajuda a OneFootball a otimizar Kubernetes para o tráfego global do futebol em larga escala

25%
de redução nos custos de infraestrutura Kubernetes
80%
de redução no esforço de engenharia dedicado à otimização de custos e ao ajuste de resiliência em Kubernetes
Luma Health

Luma Health corta 40% dos custos com EKS e libera milhares de horas de engenharia por ano

90%
Menos tempo em right-sizing manual de Kubernetes
40%
Redução nos custos com Amazon EKS
+1,700h/year
Horas de engenharia redirecionadas para confiabilidade e performance
PlayHQ

PlayHQ otimiza custos de Kubernetes multi-tenant

40%
Redução nos custos de Kubernetes fora de produção
40%
Redução nos custos de K8s fora de produção
20%
Redução nos custos de K8s em produção
SNCF

Como a SNCF cortou desperdício em K8s e aumentou a confiabilidade em escala

30%
Mais workloads com custo estável
30%
Mais workloads absorvidos com custo estável
~€500K
Economia anualizada estimada
NOS

NOS corta custos de Kubernetes pela metade e recupera a confiança na otimização

50%
Redução de custos
50%
Redução de custos no maior cluster
0%
Recursos ociosos nos node pools principais
K1x

K1x corta custos de nuvem e simplifica as operações de Kubernetes

Thousands
Economizados por mês
Thousands
Economizados por mês em gastos com nuvem
<10%
Utilização de recursos nos nós superprovisionados antes da otimização