Stefanini réduit de 26 % ses coûts de compute Kubernetes grâce à PerfectScale by DoiT
- 26%
- De réduction des coûts de compute Kubernetes
- >60%
- De réduction des coûts d'infrastructure au cours de l'année écoulée
Cette page est également disponible en English, Deutsch, Español, Italiano, 日本語 et Português.
Comment PicnicAI a utilisé PerfectScale by DoiT pour automatiser l'optimisation de ses workloads, réduire la charge opérationnelle et donner à ses ingénieurs davantage de confiance dans leur infrastructure

À mesure que l'environnement Kubernetes de PicnicAI évoluait, l'équipe s'est heurtée à un défi de plus en plus courant : comprendre de combien de CPU et de mémoire chaque workload avait réellement besoin.
Historiquement, les besoins en ressources étaient largement estimés à la création des workloads et pouvaient rester inchangés jusqu'à l'apparition d'un problème. Cette approche posait particulièrement problème pour les workloads de traitement de données, dont les besoins pouvaient varier fortement d'un job à l'autre.
"Avant, le scaling consistait essentiellement à ce que quelqu'un devine la quantité de mémoire et de CPU dont un job aurait besoin au moment de sa création, puis on n'y touchait plus jusqu'à ce que les erreurs OOM (out-of-memory) se multiplient", explique Josh Zarrabi, ingénieur infrastructure chez PicnicAI.
Lorsque les workloads étaient sous-dimensionnés, les jobs pouvaient échouer et être relancés en boucle, créant des files d'attente et mettant sous pression les bases de données partagées. À l'inverse, le surdimensionnement générait une capacité d'infrastructure et des dépenses cloud inutiles.
Ce défi était accentué par la taille réduite de l'équipe d'ingénierie de PicnicAI. Les décisions d'infrastructure avaient souvent été prises par des ingénieurs qui avaient quitté l'entreprise, si bien que l'équipe ne disposait pas toujours du contexte derrière les configurations existantes.
Si la réduction des coûts cloud a été l'une des motivations pour explorer l'optimisation, la fiabilité est rapidement devenue l'objectif prioritaire. "Les gains de fiabilité ont été vraiment essentiels pour nous, et les économies réalisées ont été un bénéfice supplémentaire appréciable", souligne Zarrabi.
PicnicAI a commencé à travailler avec DoiT dans le cadre d'une initiative plus large d'optimisation des coûts cloud. DoiT a introduit PerfectScale pour aider l'équipe à comprendre l'utilisation des ressources au niveau de chaque workload et à automatiser l'optimisation de Kubernetes.
PerfectScale combine une visibilité granulaire sur Kubernetes avec un right-sizing automatisé et adapté à chaque workload, permettant aux équipes d'optimiser CPU et mémoire sans dépendre d'une surveillance manuelle constante.
Pour PicnicAI, la mise en œuvre a été volontairement progressive. L'équipe s'est d'abord concentrée sur l'amélioration de la fiabilité et l'instauration de la confiance dans les recommandations, avant d'étendre progressivement l'automatisation.
Les fonctionnalités InfraFit de PerfectScale ont aidé PicnicAI à identifier les configurations d'infrastructure inefficaces et à comprendre où les workloads n'étaient pas alignés avec les ressources provisionnées.
"Avec InfraFit de PerfectScale, c'est beaucoup plus facile de se dire : ok, on gaspille réellement des ressources ici parce que la configuration ne correspond pas à nos workloads", explique Zarrabi. "Cela me donne plus de confiance pour effectuer des changements alors que nous n'avons pas toujours tout le contexte sur les décisions d'origine."
La technologie n'était qu'une partie de la solution. Les équipes Field Engineering et Customer Success de DoiT ont travaillé aux côtés de PicnicAI pour aider l'équipe à comprendre le comportement de Kubernetes et à déterminer où l'automatisation pouvait être introduite en toute sécurité.
Cela incluait l'examen de l'interaction entre le HPA (horizontal pod autoscaling) et l'autoscaler du cluster, l'ajustement des seuils et la mise en place de politiques contrôlées autour des besoins en ressources.
Les fonctionnalités de politiques et de garde-fous de PerfectScale ont permis à PicnicAI de contrôler où et comment l'optimisation était appliquée, plutôt que d'activer simplement l'automatisation sur l'ensemble des workloads.
Les workloads les plus sensibles ont été traités avec prudence, tandis que l'automatisation a été progressivement étendue aux environnements de production, de staging et de développement.
Pour Zarrabi, bénéficier d'un accompagnement technique continu en complément de la plateforme a été un élément important de la collaboration. "C'est appréciable d'avoir quelqu'un qui garde un œil sur ce qu'on fait et me pousse à rester rigoureux", dit-il. "S'assurer que nous tirons le maximum du produit, c'est vraiment utile."
"PerfectScale nous donne la confiance nécessaire pour automatiser l'optimisation de Kubernetes, tout en laissant nos ingénieurs se concentrer sur l'essentiel."
Josh Zarrabi, Ingénieur infrastructure
Le plus grand changement opérationnel a été l'abandon de la gestion manuelle des ressources. Avant PerfectScale, PicnicAI ne disposait d'aucun redimensionnement automatisé de ses workloads. Aujourd'hui, le redimensionnement automatisé couvre environ 85 à 90 % des workloads de ses clusters applicatifs.
Les besoins en ressources peuvent ainsi être optimisés en continu, sans que les ingénieurs aient à examiner et ajuster manuellement chaque workload.
Les bénéfices vont au-delà de l'optimisation elle-même. PicnicAI a constaté moins de problèmes liés à la mémoire et moins de perturbations opérationnelles auparavant causées par des workloads mal dimensionnés.
"C'est simplement une source d'agacement en moins", résume Zarrabi.
Ce changement est particulièrement significatif pour une organisation d'ingénierie aux effectifs réduits. En automatisant davantage la gestion de son infrastructure, PicnicAI a pu accroître la capacité de l'équipe à livrer plus de projets pour l'entreprise, sans alourdir la charge opérationnelle.
Au lieu d'enquêter sans cesse sur les échecs de jobs, l'accumulation de files d'attente ou la surcharge inutile des bases de données, les ingénieurs peuvent consacrer plus de temps aux initiatives stratégiques d'infrastructure et de produit.
La fiabilité était l'objectif principal de la collaboration, mais ce n'est pas le seul résultat. Le right-sizing de PerfectScale étant adapté à chaque workload, il a également aidé PicnicAI à éliminer le surdimensionnement qui s'accumulait lorsque les limites de ressources étaient devinées une fois pour toutes et jamais réexaminées — réduisant ainsi les dépenses d'infrastructure inutiles en plus des gains de fiabilité.
"Les gains de fiabilité ont été vraiment essentiels pour nous, et les économies réalisées ont été un bénéfice supplémentaire appréciable", souligne Zarrabi.
Pour une équipe réduite déjà sollicitée sur de nombreuses priorités, cette combinaison a fait de l'automatisation un investissement évident : elle n'impose aucun compromis entre un budget d'infrastructure maîtrisé et des systèmes fiables — elle apporte les deux.
La réduction de la gestion manuelle de Kubernetes a permis aux ingénieurs de PicnicAI de se concentrer sur des projets de plus long terme, notamment la migration de l'intégration continue hors de Jenkins et l'exploration de nouvelles initiatives d'IA.
La valeur de la collaboration dépasse donc largement le problème de fiabilité qu'elle devait initialement résoudre. En automatisant une tâche qui exigeait auparavant jugement et intervention des ingénieurs, PicnicAI a également réduit ses coûts d'infrastructure, libéré une capacité technique précieuse et donné à ses ingénieurs plus de confiance pour travailler avec des configurations historiques qu'ils n'avaient pas définies eux-mêmes.
"On veut consacrer son temps à des choses utiles", conclut Zarrabi. "Deviner ses limites de mémoire et de CPU n'en fait pas partie."
PicnicAI prévoit d'élargir encore le rôle de PerfectScale à mesure que son environnement Kubernetes évolue, en étendant l'automatisation à davantage de workloads et en abordant progressivement l'infrastructure de production la plus sensible.
L'entreprise continuera également à s'appuyer sur l'expertise cloud plus large de DoiT au fil du développement de sa plateforme et de ses initiatives d'IA. Pour PicnicAI, l'objectif est simple : automatiser l'optimisation de l'infrastructure partout où c'est possible, maintenir la fiabilité indispensable aux workloads critiques du secteur de la santé et permettre aux ingénieurs de passer moins de temps à gérer Kubernetes et plus de temps à créer des technologies capables d'améliorer la vie des patients.
PicnicAI est une entreprise health-tech qui développe une intelligence au service de l'accélération de la santé humaine. Sa technologie traite et valide d'importants volumes de données médicales, aidant les chercheurs pharmaceutiques à mener plus efficacement des essais cliniques observationnels et les patients à mieux gérer leur parcours de soins.
L'infrastructure cloud de l'entreprise joue un rôle essentiel dans cette mission. PicnicAI exploite huit ou neuf clusters Kubernetes qui prennent en charge des workloads automatisés, avec des besoins en CPU et en mémoire pouvant varier fortement selon les données traitées. Pour PicnicAI, une infrastructure fiable vise avant tout à permettre à ses ingénieurs de se concentrer sur l'innovation en santé plutôt que de passer leur temps à gérer manuellement Kubernetes.
Arrêtez de deviner les limites CPU et mémoire de chaque workload Kubernetes
Découvrez ce que PerfectScale by DoiT détecte dans vos clusters : visibilité au niveau des workloads, redimensionnement automatisé et garde-fous que vous contrôlez, avec les ingénieurs DoiT aux côtés de votre équipe.