Riftweaver enfrentaba desafíos para escalar sus entornos de Kubernetes y manejar la carga impredecible de jugadores al pasar de la beta cerrada al acceso anticipado y al lanzamiento público. Con un clúster de producción y varios entornos no productivos en AWS EKS, la ingeniera DevOps Rumby Osei dependía de Cluster AutoScaler (CAS) para escalar nodos y de Horizontal Pod Autoscaler (HPA) para escalar pods. Cuando los servicios comenzaron a presentar problemas de throttling, recurrió a VPA, pero se topó con obstáculos: no ofrecía datos históricos ni resultados consistentes. Entre los principales problemas estaban el throttling de CPU frecuente durante las pruebas de carga y el juego en vivo (lo que causaba lag), un troubleshooting manual que consumía mucho tiempo con métricas contradictorias, y la visibilidad limitada de las herramientas existentes, que carecían de datos históricos y recomendaciones concretas.