En début d'année, le Chief Financial Officer (CFO) a fixé à l'ensemble de l'organisation des objectifs ambitieux d'efficacité et d'unit economics. Pour Mark Serdze, Director of Cloud Infrastructure, et son équipe, cela signifiait passer rapidement à l'action pour optimiser leurs coûts cloud. Trax a obtenu des résultats rapides en dehors de Kubernetes, mais s'est heurté à des obstacles pour optimiser ses clusters à grande échelle en toute sécurité. L'équipe a commencé par optimiser manuellement à partir des métriques disponibles, en s'appuyant sur le Vertical Pod Autoscaler (VPA), les logs des clusters et des solutions de monitoring. Cette approche manquait de clarté et passait difficilement à l'échelle sans efforts de développement conséquents. L'équipe se retrouvait à mener des actions ponctuelles et réactives, avec un impact minime sur les objectifs. L'outillage existant de Trax ajoutait également des frictions au processus d'optimisation. Même lorsque les Engineers identifiaient des opportunités, le processus de validation reposait sur l'intuition plutôt que sur des données concrètes. Faute de visibilité, certaines erreurs ont entraîné une charge supplémentaire pour les Engineers, créé des tensions internes et introduit des risques susceptibles de compromettre la résilience des services.