PerfectScalePerfectScale

Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

PlayHQ optimiza sus costos de Kubernetes multi-tenant

Cómo PlayHQ automatizó el right-sizing de Kubernetes y logró visibilidad en tiempo real de los costos por tenant con PerfectScale de DoiT

PerfectScale
PlayHQ

The Challenge

PlayHQ migró de ECS a Kubernetes y logró ahorros iniciales significativos, pero a medida que su base de clientes multi-tenant crecía, los patrones de uso se volvieron más complejos e impredecibles. Con cerca del 90% del cómputo corriendo en Kubernetes y cientos de workloads pequeños y variables distribuidos entre los tenants, el autoescalado a nivel de infraestructura con Karpenter, HPA y KEDA garantizaba la capacidad, pero no permitía ajustar con precisión los requests de CPU y memoria a nivel de workload. La optimización manual de recursos no escalaba para un equipo de plataforma reducido, y al evaluar OpenCost se detectó una carga operativa demasiado alta para ejecutarlo y configurarlo.

The Solution

PlayHQ adoptó PerfectScale a través de DoiT para automatizar el right-sizing de Kubernetes y mejorar la eficiencia de costos de EKS en sus clústeres multi-tenant. El equipo tenía la automatización funcionando en un clúster de dev apenas una hora después de la demo inicial. PerfectScale aportó right-sizing automatizado de workloads que ajusta continuamente los requests de CPU y memoria, ventanas de mantenimiento que evitan cambios durante los sábados de partido con alto tráfico, exclusiones a nivel de namespace para workloads sensibles y políticas de optimización balanceadas para los clústeres de producción, que protegen la estabilidad mientras se reduce el costo.

Results

  • 40% de reducción en los costos de Kubernetes fuera de producción
  • 20% de reducción en los costos de Kubernetes en producción
  • Decenas de miles de dólares ahorrados al año
  • Mayor consistencia de rendimiento en todos los workloads
  • Visibilidad en tiempo real de la asignación de costos de Kubernetes por tenant
  • Detección y resolución más rápidas de problemas de resiliencia, incluidas las alertas OOM
  • Automatización configurada en un clúster de dev en menos de una hora tras la demo inicial

Cada cliente tiene patrones de uso únicos. La optimización manual de recursos simplemente no escalaba: necesitábamos automatización para asegurar que cada cliente, sin importar su tamaño, tuviera una infraestructura bien dimensionada sin consumir la capacidad de nuestro equipo.

Brad Quinn, Lead Platform Engineer, PlayHQ

El deporte comunitario corre sobre Kubernetes

Todos los días, en distintas partes del mundo, PlayHQ opera infraestructura digital crítica para miles de competencias deportivas comunitarias. Organizaciones deportivas líderes —incluidos clubes juveniles de fútbol australiano, ligas de básquetbol y asociaciones locales de netball y fútbol— dependen de la plataforma durante las ventanas de partidos, cuando el uso se dispara. Estas organizaciones utilizan PlayHQ para gestionar inscripciones, marcadores, pagos y la operación de competencias entre cientos de equipos. Con una demanda que varía enormemente según el deporte, la temporada y la región, escalar la infraestructura de forma eficiente y controlar los costos es un desafío constante. En el centro de esta operación está el equipo de ingeniería de plataforma de PlayHQ, liderado por el Lead Platform Engineer Brad Quinn, que gestiona la confiabilidad, el rendimiento y el costo del entorno de Kubernetes. "Kubernetes es muy importante para nosotros: es el flujo de trabajo diario de nuestros Engineers", dice Quinn. Con cerca del 90 por ciento del cómputo de PlayHQ corriendo en Kubernetes, el equipo necesitaba un enfoque más automatizado e inteligente para optimizar costos a medida que su base de clientes crecía.

Por qué PlayHQ priorizó la optimización de costos de Kubernetes

PlayHQ migró de ECS a Kubernetes para reducir los costos de infraestructura y acelerar los despliegues por tenant. Aunque el cambio generó ahorros desde el inicio, los costos comenzaron a subir de nuevo a medida que más organizaciones se sumaban a la plataforma y los patrones de uso se volvían más impredecibles. "Pasamos de ECS a Kubernetes y logramos ahorros iniciales significativos", dice Quinn. "A medida que nuestra base de clientes crecía y los patrones de uso se volvían más complejos, necesitábamos evolucionar nuestro enfoque de optimización para mantener esa eficiencia". PlayHQ ya usaba Karpenter para escalar nodos de forma eficiente y se apoyaba en HPA y KEDA para ajustar la capacidad según la demanda, especialmente durante los picos de tráfico de los fines de semana. Pero las demandas de los workloads variaban mucho entre tenants. El autoescalado a nivel de infraestructura garantizaba la capacidad, pero no resolvía el desafío de dimensionar con precisión los requests de CPU y memoria en cientos de workloads pequeños y variables. Quinn también evaluó OpenCost, pero la carga operativa resultó demasiado alta para un equipo de plataforma reducido.

Cómo PerfectScale automatizó la optimización de Kubernetes

PerfectScale se perfiló rápidamente como la solución ideal para automatizar el right-sizing de Kubernetes y mejorar la eficiencia de costos de EKS en los clústeres multi-tenant de PlayHQ. La velocidad fue una parte clave de la ecuación: "Tuvimos la demo inicial, obtuvimos acceso a la plataforma y en una hora ya teníamos la automatización configurada en un clúster de dev", dice Quinn. Las capacidades de PerfectScale encajaron muy bien con el entorno y los ritmos operativos de PlayHQ, lo que permitió al equipo automatizar la optimización de forma segura sin perder el control sobre cuándo y dónde se aplicaban los cambios. Entre las capacidades clave se incluyen el right-sizing automatizado de workloads para ajustar continuamente los requests de CPU y memoria, ventanas de mantenimiento que evitan cambios durante períodos deportivos de alto tráfico como los sábados de partido, exclusiones a nivel de namespace para no modificar workloads sensibles y políticas de optimización balanceadas para los clústeres de producción, que garantizan la estabilidad a la par de la reducción de costos.

Resultados: menores costos y resolución de problemas más rápida

Tras adoptar PerfectScale a través de DoiT, PlayHQ logró mejoras significativas tanto en costos como en rendimiento operativo: una reducción del 40% en los costos de Kubernetes fuera de producción, una reducción del 20% en los costos de Kubernetes en producción, decenas de miles de dólares ahorrados al año, mayor consistencia de rendimiento en todos los workloads y más visibilidad de la asignación de costos por tenant. El equipo también notó una detección y resolución más rápidas de los problemas de resiliencia. "Las cuestiones de resiliencia, como las alertas OOM, hacen que la resolución sea mucho más rápida", dice Quinn. La visibilidad en tiempo real de los costos de Kubernetes por tenant le da a Quinn una vista más clara de la estacionalidad entre los distintos tenants y refuerza la manera en que comunica el valor de la optimización a la dirección. "Podemos obtener al instante los costos de cómputo por tenant", dice Quinn. "Luego puedo compartir con el CTO el total ahorrado y los problemas resueltos".

Construir una cultura de ingeniería consciente de los costos

Con la optimización automatizada de Kubernetes ya en marcha, PlayHQ planea extender el acceso a PerfectScale más allá del equipo de plataforma. El objetivo es ayudar a los equipos de ingeniería de producto a gestionar sus propios SLO y entender cómo las decisiones de diseño influyen en el uso de recursos de Kubernetes y en los costos de infraestructura. Esto respalda el objetivo a largo plazo de PlayHQ de alinear las prácticas de ingeniería con un crecimiento sostenible, mientras sigue ofreciendo experiencias digitales confiables a clubes, ligas y familias.

Una alianza con DoiT para optimizar Kubernetes a escala

Quinn destacó el valor de DoiT y PerfectScale como socios a largo plazo. Durante el onboarding, los equipos identificaron y resolvieron un problema en cuestión de horas, lo que reforzó aún más la confianza de PlayHQ en la solución. Con optimización automatizada, ahorros de costos significativos y mayor confiabilidad, el equipo de plataforma cuenta con la eficiencia operativa y la visibilidad necesarias para acompañar la expansión continua de PlayHQ.

Descubre cómo PerfectScale mejora la eficiencia de Kubernetes

Conoce cómo PerfectScale ayuda a los equipos a dimensionar bien sus clústeres, reducir la pérdida y mejorar el rendimiento sin ajustes manuales.

More customer stories

PicnicAI

PicnicAI automatiza el 85-90% de sus workloads de Kubernetes y gana en confiabilidad con PerfectScale by DoiT

85–90%
de los workloads de aplicaciones ya cuenta con redimensionamiento automatizado
50%
de reducción aproximada en el tiempo del equipo dedicado a la infraestructura
Stefanini

Un 26% menos en costos de cómputo de Kubernetes: así lo logró Stefanini con PerfectScale by DoiT

26%
Reducción en costos de cómputo de Kubernetes
>60%
Reducción de costos de infraestructura en el último año
OneFootball

PerfectScale by DoiT ayuda a OneFootball a optimizar Kubernetes para el tráfico global del fútbol a gran escala

25%
de reducción en los costos de infraestructura de Kubernetes
80%
de reducción en el esfuerzo de Engineering dedicado a la optimización de costos y al ajuste de resiliencia en Kubernetes
Luma Health

Luma Health reduce un 40% los costos de EKS y libera miles de horas de Engineering al año

90%
Menos tiempo en right-sizing manual de Kubernetes
40%
Reducción en costos de Amazon EKS
+1,700h/year
Horas de Engineering redirigidas a fiabilidad y rendimiento
SNCF

Cómo SNCF eliminó la pérdida en K8s y mejoró la confiabilidad a gran escala

30%
Más workloads al mismo costo
30%
Más workloads absorbidos al mismo costo
~€500K
Ahorros anualizados estimados
NOS

NOS reduce a la mitad sus costos de Kubernetes y recupera la confianza en la optimización

50%
Reducción de costos
50%
Reducción de costos en el clúster más grande
0%
Recursos ociosos en los node pools principales
K1x

K1x recorta sus costos de nube y simplifica la operación de Kubernetes

Thousands
Ahorro mensual
Thousands
Ahorro mensual en gasto de nube
<10%
Utilización de recursos en nodos sobredimensionados antes de la optimización
Riftweaver

Cómo PerfectScale ayuda a un equipo DevOps de una sola persona a escalar Riftweaver

59%
Reducción del throttling de CPU
6
APIs críticas mejoradas
80,000+
Descargas del juego