PerfectScalePerfectScale

Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

Cómo PerfectScale ayuda a un equipo DevOps de una sola persona a escalar Riftweaver

El estudio de videojuegos Riftweaver redujo el throttling de CPU en un 59% y empoderó a una única ingeniera DevOps para escalar Kubernetes con total confianza

PerfectScale
Riftweaver

The Challenge

Riftweaver enfrentaba desafíos para escalar sus entornos de Kubernetes y manejar la carga impredecible de jugadores al pasar de la beta cerrada al acceso anticipado y al lanzamiento público. Con un clúster de producción y varios entornos no productivos en AWS EKS, la ingeniera DevOps Rumby Osei dependía de Cluster AutoScaler (CAS) para escalar nodos y de Horizontal Pod Autoscaler (HPA) para escalar pods. Cuando los servicios comenzaron a presentar problemas de throttling, recurrió a VPA, pero se topó con obstáculos: no ofrecía datos históricos ni resultados consistentes. Entre los principales problemas estaban el throttling de CPU frecuente durante las pruebas de carga y el juego en vivo (lo que causaba lag), un troubleshooting manual que consumía mucho tiempo con métricas contradictorias, y la visibilidad limitada de las herramientas existentes, que carecían de datos históricos y recomendaciones concretas.

The Solution

PerfectScale se convirtió en una pieza clave de la estrategia de infraestructura de Riftweaver. Osei lo utiliza para reducir el throttling de CPU al identificar workloads de alto riesgo y recibir recomendaciones a medida para ajustar la CPU; simplificar la asignación de recursos gracias a la visibilidad sobre nodos y workloads subutilizados, lo que permite optimizar tanto la ubicación de los pods como la selección de nodos; y mejorar la resiliencia al priorizar los cambios según los perfiles de riesgo de PerfectScale, minimizando problemas como llamadas a la API perdidas o duplicadas. La interfaz de PerfectScale, sus perfiles de riesgo y funciones únicas como el seguimiento de CO2 le dieron a Osei plena confianza en las recomendaciones.

Results

  • Redujo el throttling de CPU en casi un 59% en seis APIs críticas
  • Mejoró la experiencia de los usuarios al resolver cuellos de botella de rendimiento y reducir el lag
  • Permitió a una única ingeniera DevOps gestionar el escalado de forma proactiva con un esfuerzo manual mínimo
  • Simplificó las operaciones de un equipo DevOps de una sola persona
  • Accedió a optimización de nivel empresarial sin costo gracias al Community Package de PerfectScale
  • Preparó la infraestructura para el crecimiento futuro mientras Riftweaver se expande a más plataformas y usuarios

PerfectScale marcó un antes y un después. Sus insights no solo resolvieron los problemas inmediatos, sino que también nos prepararon para el crecimiento futuro a medida que nos expandimos a más plataformas y usuarios.

Rumby Osei, Senior DevOps Engineer en Riftweaver

¿Quién es Riftweaver?

Riftweaver es un innovador estudio de videojuegos que ha dado grandes pasos en el último año. Desde el lanzamiento de su juego insignia hasta la llegada a plataformas como Steam e iPads, el estudio acumula más de 80,000 descargas. Con un equipo pequeño de solo 15 empleados, la infraestructura backend de Riftweaver está a cargo de una única ingeniera DevOps, Rumby Osei, quien se asegura de que la infraestructura del juego escale de manera eficiente mientras ofrece una experiencia impecable a una base de jugadores en constante crecimiento.

El desafío

"Cuando me uní a Riftweaver, el juego no escalaba ni soportaba una carga lista para producción. Mi rol era lograr que llegáramos a ese punto", cuenta Osei. Riftweaver enfrentaba desafíos para escalar sus entornos de Kubernetes y manejar la carga impredecible de jugadores al pasar de la beta cerrada al acceso anticipado y al lanzamiento público. Con su infraestructura en AWS EKS, Cluster AutoScaler y HPA, el equipo comenzó a sufrir problemas de throttling. Cuando Osei recurrió a VPA, se topó con obstáculos: "VPA no ofrecía datos históricos ni me permitía obtener resultados consistentes. No podía volver atrás y ver qué había cambiado con el tiempo. Incluso tuve que escribir un script para extraer todos los VPAs de cada deployment solo para comparar los datos". Entre los principales problemas estaban el throttling de CPU frecuente durante el juego, un troubleshooting manual que consumía mucho tiempo y la visibilidad limitada de las herramientas existentes.

¿Por qué PerfectScale?

Rumby Osei comenzó a buscar una solución que le permitiera tomar decisiones de right-sizing basadas en datos, reducir los cuellos de botella de rendimiento y obtener insights concretos sobre el uso de recursos. Tras una conversación con el equipo de PerfectScale, Osei vio su potencial para cerrar la brecha entre las predicciones de las pruebas de carga y el comportamiento real de los usuarios, y así mejorar la resiliencia de sus workloads. "La interfaz y los perfiles de riesgo de PerfectScale me dieron confianza en las recomendaciones. Además, incorporó funciones que nunca había visto, como el monitoreo del impacto ambiental con seguimiento de CO2".

La solución: optimizar el escalado y el rendimiento con PerfectScale

Hoy PerfectScale es una pieza clave de la estrategia de infraestructura de Riftweaver. Osei lo utiliza para reducir el throttling de CPU al identificar workloads de alto riesgo y recibir recomendaciones a medida para ajustar la CPU. La visibilidad sobre nodos y workloads subutilizados le permitió optimizar tanto la ubicación de los pods como la selección de nodos, reduciendo la pérdida y mejorando la eficiencia. Al priorizar los cambios según los perfiles de riesgo de PerfectScale, Riftweaver minimiza problemas como llamadas a la API perdidas o duplicadas que antes frustraban a los usuarios.

Resultados: un juego más fluido y mayor eficiencia operativa

PerfectScale está ayudando a Riftweaver a escalar para responder a una demanda creciente mientras reduce la carga operativa. Los resultados clave incluyen: una reducción del 59% en el throttling de CPU en seis APIs críticas, garantizando una experiencia de juego más fluida; una mejor experiencia de usuario con menos interrupciones incluso en los momentos de mayor demanda; operaciones simplificadas que permiten a un equipo DevOps de una sola persona gestionar el escalado y la resiliencia de forma proactiva con un esfuerzo manual mínimo; y un escalado rentable gracias al Community Package de PerfectScale, que permite al equipo optimizar la infraestructura sin presión financiera adicional.

Por qué PerfectScale funciona para Riftweaver

La interfaz intuitiva de PerfectScale, sus análisis robustos y sus recomendaciones concretas lo convirtieron en una herramienta esencial para el equipo pequeño pero dinámico de Riftweaver. Funciones como el seguimiento del impacto ambiental y la visibilidad de HPA también encajaron con el enfoque visionario del estudio para gestionar su infraestructura. Al integrar PerfectScale, Riftweaver optimizó su entorno de Kubernetes, garantizando escalabilidad, confiabilidad y una experiencia de juego superior. A medida que el estudio sigue creciendo, PerfectScale continúa siendo un socio clave en su camino para ofrecer una experiencia de juego emocionante y sin lag a jugadores de todo el mundo.

Descubre cómo PerfectScale mejora la eficiencia de Kubernetes

Conoce cómo PerfectScale ayuda a los equipos a hacer right-sizing de sus clústeres, reducir la pérdida y mejorar el rendimiento sin ajustes manuales.

More customer stories

PicnicAI

PicnicAI automatiza el 85-90% de sus workloads de Kubernetes y gana en confiabilidad con PerfectScale by DoiT

85–90%
de los workloads de aplicaciones ya cuenta con redimensionamiento automatizado
50%
de reducción aproximada en el tiempo del equipo dedicado a la infraestructura
Stefanini

Un 26% menos en costos de cómputo de Kubernetes: así lo logró Stefanini con PerfectScale by DoiT

26%
Reducción en costos de cómputo de Kubernetes
>60%
Reducción de costos de infraestructura en el último año
OneFootball

PerfectScale by DoiT ayuda a OneFootball a optimizar Kubernetes para el tráfico global del fútbol a gran escala

25%
de reducción en los costos de infraestructura de Kubernetes
80%
de reducción en el esfuerzo de Engineering dedicado a la optimización de costos y al ajuste de resiliencia en Kubernetes
Luma Health

Luma Health reduce un 40% los costos de EKS y libera miles de horas de Engineering al año

90%
Menos tiempo en right-sizing manual de Kubernetes
40%
Reducción en costos de Amazon EKS
+1,700h/year
Horas de Engineering redirigidas a fiabilidad y rendimiento
PlayHQ

PlayHQ optimiza sus costos de Kubernetes multi-tenant

40%
Reducción de costos de Kubernetes fuera de producción
40%
Reducción de costos de K8s fuera de producción
20%
Reducción de costos de K8s en producción
SNCF

Cómo SNCF eliminó la pérdida en K8s y mejoró la confiabilidad a gran escala

30%
Más workloads al mismo costo
30%
Más workloads absorbidos al mismo costo
~€500K
Ahorros anualizados estimados
NOS

NOS reduce a la mitad sus costos de Kubernetes y recupera la confianza en la optimización

50%
Reducción de costos
50%
Reducción de costos en el clúster más grande
0%
Recursos ociosos en los node pools principales
K1x

K1x recorta sus costos de nube y simplifica la operación de Kubernetes

Thousands
Ahorro mensual
Thousands
Ahorro mensual en gasto de nube
<10%
Utilización de recursos en nodos sobredimensionados antes de la optimización