Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

Cómo Trax redujo un 75% el gasto en Kubernetes con PerfectScale

Un líder en tecnología retail transforma su estrategia FinOps con optimización basada en IA en más de 200 microservicios

PerfectScale
Trax

The Challenge

Trax tenía metas de eficiencia exigentes marcadas por la dirección, pero se topó con obstáculos al optimizar sus clusters de Kubernetes. La optimización manual con VPA y herramientas de monitoreo no daba la claridad necesaria y resultaba difícil de escalar. El proceso de aprobación se basaba más en intuición que en evidencia, lo que generaba carga extra para el equipo de Engineering y riesgos para los servicios.

The Solution

PerfectScale aportó visibilidad en tiempo real a nivel de workload en el entorno de más de 200 microservicios de Trax. La inteligencia guiada por IA permitió optimizar de forma segura y con respaldo en datos, protegiendo los SLOs. La plataforma reemplazó a una herramienta FinOps que se quedaba corta y entregó detalles granulares de costos con recomendaciones accionables.

Results

  • Reducción del 75% en costos de Kubernetes en un cluster, con ahorros anuales de más de seis cifras
  • Reemplazo de una herramienta FinOps poco efectiva sin aumentar el presupuesto
  • Mejora en la métrica de 'costo por procesamiento' gracias al rediseño de la arquitectura de servicios
  • Toma de decisiones más ágil con recomendaciones impulsadas por IA

Pudimos reemplazar una herramienta FinOps que veníamos usando y que no nos daba detalles granulares de costos ni nos orientaba sobre cómo optimizar el entorno. PerfectScale by DoiT es una herramienta pensada para los equipos de Engineering, no solo para finanzas, y eso nos facilitó lograr el impacto en costos que buscábamos.

Mark Serdze, Director of Cloud Infrastructure en Trax

Conoce a Trax

La misión de Trax es que marcas y retailers aprovechen el poder de las tecnologías digitales para ofrecer la mejor experiencia de compra a sus clientes. Sus innovaciones líderes en la industria y su excelencia en el desarrollo de tecnologías avanzadas y métodos autónomos de recolección de datos están detrás de experiencias positivas para los compradores y abren oportunidades de ingresos en todos los puntos de venta. El portfolio de soluciones de Trax ofrece métricas, analítica y servicios críticos para el negocio, que ayudan a sus clientes a ahorrar tiempo y dinero al mejorar la experiencia de compra. Kubernetes es una pieza clave de su infraestructura, ya que le permite a Trax innovar de forma continua y contar con la escalabilidad necesaria para responder a la demanda. Trax ha crecido hasta operar un entorno multicloud y multi-cluster a gran escala, con clientes en más de 90 países, incluidas algunas de las empresas más grandes del mundo.

El reto

A inicios de año, el Chief Financial Officer (CFO) planteó metas exigentes de eficiencia y unit economics para toda la organización. Para Mark Serdze, Director of Cloud Infrastructure, y su equipo, esto significaba actuar rápido para optimizar los costos de la nube. Trax obtuvo resultados rápidos fuera de Kubernetes, pero se topó con obstáculos al optimizar de forma segura y a escala dentro de sus clusters. El equipo empezó a optimizar manualmente con las métricas disponibles, apoyándose en Vertical Pod Autoscaler (VPA), logs de cluster y soluciones de monitoreo. Este enfoque no daba la claridad necesaria y era difícil de escalar con eficiencia sin un gran esfuerzo de desarrollo. Esto los llevó a tomar acciones reactivas y puntuales, con un impacto mínimo en sus objetivos. Las herramientas que ya tenían también sumaban fricción al proceso de optimización. Incluso cuando el equipo identificaba oportunidades, la aprobación para validar el mejor curso de acción se basaba en la intuición y no en la evidencia. Por la falta de visibilidad, algunos errores derivaron en trabajo adicional para Engineering, generaron tensión interna e introdujeron riesgos que podían comprometer la resiliencia del servicio.

La solución

Poco después de desplegar PerfectScale by DoiT, el equipo logró la visibilidad en tiempo real y a nivel de workload que le faltaba. En el entorno de más de 200 microservicios de Trax, vieron con claridad qué recursos necesitaba cada servicio e identificaron las oportunidades más relevantes para eliminar la pérdida sin poner en riesgo el rendimiento. La inteligencia guiada por IA de la plataforma le permitió al equipo actuar de forma segura y con respaldo en evidencia, mejorando la unit economics con rapidez. Al evaluar el equilibrio entre eficiencia y resiliencia, pudieron ajustar recursos de manera segura y eficiente, protegiendo los SLOs. Las recomendaciones de optimización de costos fueron clave: indicaban qué acciones tomar con una idea clara del impacto de cada cambio. En uno de sus clusters lograron reducir el costo un 75%, con un ahorro de más de cien mil dólares al año. Además, Trax quedó impresionada con la profundidad de los datos y la inteligencia que la solución entregaba en todo su entorno. Esta implementación le permitió renovar sus herramientas de visibilidad de costos sin afectar el presupuesto.

Optimización de Kubernetes para mejorar las métricas de negocio

Tras eliminar los recursos desaprovechados, Trax se enfocó en encontrar nuevas oportunidades para mejorar la eficiencia y la unit economics. El equipo se sumergió en los datos de PerfectScale en busca de formas de impactar de manera significativa sus métricas de negocio centradas en costos. Una métrica clave para Trax es el 'costo por procesamiento', muy ligada a la eficiencia de Kubernetes. PerfectScale tiene una funcionalidad única que consolida cada réplica de un servicio en una sola vista, lo que da una imagen clara de las tendencias de utilización en todas las réplicas; algo especialmente útil para workloads efímeros como jobs de Spark o Flink. Trax aprovechó esta capacidad para entender mejor la utilización heterogénea entre las réplicas de varios de sus servicios más usados. Ese nivel de visibilidad ayudó a Trax a rediseñar la arquitectura de sus servicios y obtener mejoras adicionales de eficiencia sin afectar la resiliencia ni la disponibilidad. Pudieron construir varias versiones del servicio con distintos niveles de recursos y enrutar las solicitudes entrantes al servicio adecuado según el tamaño de los datos. Esto tuvo un gran impacto en su métrica de 'costo por procesamiento'. PerfectScale puso estos datos al alcance al instante; sin la solución, habrían dedicado incontables horas a evaluar cientos de réplicas para llegar al mismo resultado.

Descubre cómo PerfectScale mejora la eficiencia de Kubernetes

Explora cómo PerfectScale ayuda a los equipos a hacer right-sizing de clusters, reducir la pérdida y mejorar el rendimiento sin ajustes manuales.

More customer stories

OneFootball

PerfectScale by DoiT ayuda a OneFootball a optimizar Kubernetes para el tráfico global del fútbol a gran escala

25%
de reducción en los costos de infraestructura de Kubernetes
80%
de reducción en el esfuerzo de Engineering dedicado a la optimización de costos y al ajuste de resiliencia en Kubernetes
Luma Health

Luma Health reduce un 40% los costos de EKS y libera miles de horas de Engineering al año

90%
Menos tiempo en right-sizing manual de Kubernetes
40%
Reducción en costos de Amazon EKS
+1,700h/year
Horas de Engineering redirigidas a fiabilidad y rendimiento
PlayHQ

PlayHQ automatiza la optimización de Kubernetes con PerfectScale

40%
Reduction in non-production Kubernetes costs
40%
Reduction in non-production K8s costs
20%
Reduction in production K8s costs
SNCF

SNCF reduce 30% sus costos de Kubernetes con PerfectScale

30%
Reducción de costos
~€500K
Estimated Annualized Savings
250
Clusters Under Optimization
NOS

NOS recorta drásticamente el gasto en Kubernetes en su entorno multi-cluster

50%
Cost Reduction
50%
Cost reduction on largest cluster
0%
Idle resources on main node pools
K1x

K1x reduce costos en la nube y agiliza sus operaciones de Kubernetes

Thousands
Saved Per Month
Thousands
Saved per month on cloud spend
<10%
Resource utilization on over-provisioned nodes before optimization
Riftweaver

Riftweaver optimiza su entorno de Kubernetes con PerfectScale

59%
Reduction in CPU Throttling
6
Critical APIs Improved
80,000+
Game Downloads
Rapyd

Rapyd reduce sus costos de nube entre un 35 y un 40% con PerfectScale

35-40%
Reducción de costos de nube
15+
AWS EKS Clusters Optimized
100+
Countries Supported for Payments