A Riftweaver enfrentava desafios para escalar seus ambientes Kubernetes e lidar com a carga imprevisível de jogadores à medida que passava do beta fechado para o acesso antecipado e o lançamento público. Com um cluster de produção e vários ambientes de não produção rodando no AWS EKS, a engenheira de DevOps Rumby Osei dependia do Cluster AutoScaler (CAS) para escalar nós e do Horizontal Pod Autoscaler (HPA) para escalar pods. Quando os serviços começaram a apresentar problemas de throttling, ela recorreu ao VPA, mas encontrou obstáculos: a ferramenta não fornecia dados históricos nem resultados consistentes. Entre as principais dores estavam o throttling frequente de CPU durante testes de carga e partidas ao vivo, causando lag, o troubleshooting manual demorado, com métricas conflitantes, e a visibilidade limitada das ferramentas existentes, que não ofereciam insights históricos nem recomendações acionáveis.