Un 26% menos en costos de cómputo de Kubernetes: así lo logró Stefanini con PerfectScale by DoiT
- 26%
- Reducción en costos de cómputo de Kubernetes
- >60%
- Reducción de costos de infraestructura en el último año
Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.
Cómo PicnicAI usó PerfectScale by DoiT para automatizar la optimización de workloads, reducir la carga operativa y dar a sus Engineers más confianza en su infraestructura

A medida que el entorno de Kubernetes de PicnicAI evolucionaba, el equipo se enfrentó a un desafío cada vez más común: entender cuánta CPU y memoria necesitaban realmente los workloads individuales.
Históricamente, los requisitos de recursos se estimaban al crear los workloads y podían quedar sin cambios hasta que surgía un problema. Ese enfoque era especialmente problemático para los workloads de procesamiento de datos, donde los requisitos podían variar significativamente entre trabajos.
"Antes, la forma en que hacíamos el escalado era básicamente que alguien adivinaba cuánta memoria y CPU necesitaría un trabajo al crearlo, y después no se volvía a tocar hasta que aparecían muchos OOMs (errores por falta de memoria)", dice Josh Zarrabi, Ingeniero de Infraestructura en PicnicAI.
Cuando los workloads estaban subaprovisionados, los trabajos podían fallar y reintentarse una y otra vez, generando colas y presionando aún más las bases de datos compartidas. Por el contrario, el sobreaprovisionamiento creaba capacidad de infraestructura innecesaria y gasto en la nube.
El desafío se agravaba por lo reducido del equipo de ingeniería de PicnicAI. Muchas decisiones de infraestructura habían sido tomadas por Engineers que ya no estaban en la empresa, por lo que el equipo no siempre contaba con el contexto detrás de las configuraciones existentes.
Si bien reducir los costos de la nube fue una de las motivaciones para explorar la optimización, la confiabilidad se convirtió rápidamente en el objetivo más importante. "Las mejoras en confiabilidad han sido muy importantes para nosotros, y el ahorro en costos ha sido un buen beneficio adicional", dice Zarrabi.
PicnicAI comenzó a trabajar con DoiT como parte de una iniciativa más amplia de optimización de costos en la nube. DoiT presentó PerfectScale para ayudar al equipo a entender la utilización de recursos a nivel de workload y automatizar la optimización de Kubernetes.
PerfectScale combina una visibilidad granular de Kubernetes con un right-sizing automatizado y adaptado a cada workload, lo que ayuda a los equipos a optimizar CPU y memoria sin depender de un monitoreo manual constante.
En PicnicAI, la implementación fue deliberadamente gradual. El equipo se enfocó primero en mejorar la confiabilidad y ganar confianza en las recomendaciones antes de expandir progresivamente la automatización.
Las capacidades de InfraFit de PerfectScale ayudaron a PicnicAI a identificar configuraciones de infraestructura ineficientes y a entender dónde los workloads no estaban alineados con los recursos aprovisionados.
"Con InfraFit de PerfectScale, es mucho más fácil decir: ok, aquí realmente estamos perdiendo recursos porque la configuración no es la correcta para nuestros workloads", dice Zarrabi. "Me da más confianza para hacer cambios cuando no siempre tenemos el contexto completo de las decisiones que hay detrás."
La tecnología fue solo una parte de la solución. Los equipos de Field Engineering y Customer Success de DoiT trabajaron codo a codo con PicnicAI para ayudarles a entender el comportamiento de Kubernetes y determinar dónde se podía introducir la automatización de forma segura.
Esto incluyó revisar la interacción entre el HPA (autoescalado horizontal de pods) y el autoescalador del clúster, ajustar umbrales e introducir políticas controladas sobre los requisitos de recursos.
Las capacidades de políticas y guardrails de PerfectScale permitieron a PicnicAI controlar dónde y cómo se aplicaba la optimización, en lugar de simplemente activar la automatización en todos los workloads.
Los workloads más sensibles se trataron con cautela, mientras la automatización se expandía progresivamente por los entornos de producción, staging y desarrollo.
Para Zarrabi, contar con soporte técnico continuo además de la plataforma fue una parte importante de la colaboración. "Es bueno tener a alguien que está pendiente y me hace rendir cuentas", dice. "Ayuda mucho para asegurarnos de que le estamos sacando el máximo provecho al producto."
"PerfectScale nos da la confianza para automatizar la optimización de Kubernetes mientras nuestros Engineers se enfocan en construir lo que realmente importa."
Josh Zarrabi, Ingeniero de Infraestructura
El mayor cambio operativo ha sido dejar atrás la gestión manual de recursos. Antes de PerfectScale, PicnicAI no contaba con ningún redimensionamiento automatizado de workloads. Hoy, el redimensionamiento automatizado cubre aproximadamente el 85–90% de los workloads en sus clústeres de aplicaciones.
Esto significa que los requisitos de recursos se pueden optimizar de forma continua sin que los Engineers tengan que revisar y ajustar manualmente cada workload.
Los beneficios van más allá de la optimización en sí. PicnicAI ha experimentado menos problemas relacionados con la memoria y menos de las interrupciones operativas que antes acompañaban a los workloads mal dimensionados.
"Simplemente es una cosa molesta menos de la que preocuparse", dice Zarrabi.
Ese cambio es especialmente significativo para una organización de ingeniería reducida. Al automatizar una mayor parte de la gestión de su infraestructura, PicnicAI ha podido aumentar la capacidad del equipo para entregar más trabajo en toda la empresa sin sumar carga operativa.
En lugar de investigar una y otra vez por qué fallan los trabajos, se acumulan colas o las bases de datos reciben una carga innecesaria, los Engineers pueden dedicar más tiempo a iniciativas estratégicas de infraestructura y de producto.
La confiabilidad fue el objetivo principal de la colaboración, pero no fue el único resultado. Como el right-sizing de PerfectScale se adapta a cada workload, también ha ayudado a PicnicAI a eliminar el sobreaprovisionamiento que antes se acumulaba cuando los límites de recursos se estimaban una sola vez y nunca se volvían a revisar, reduciendo el gasto innecesario en infraestructura junto con las mejoras de confiabilidad.
"Las mejoras en confiabilidad han sido muy importantes para nosotros, y el ahorro en costos ha sido un buen beneficio adicional", dice Zarrabi.
Para un equipo reducido y con muchas prioridades, esa combinación ha hecho que seguir invirtiendo en automatización sea una decisión fácil: no obliga a elegir entre un presupuesto de infraestructura más ajustado y sistemas confiables; ofrece ambas cosas.
La reducción de la gestión manual de Kubernetes ha permitido a los Engineers de PicnicAI enfocarse en proyectos a más largo plazo, como migrar la integración continua fuera de Jenkins y explorar nuevas iniciativas de IA.
El valor de la colaboración, entonces, va mucho más allá del problema de confiabilidad que vino a resolver. Al automatizar una tarea que antes requería criterio e intervención de ingeniería, PicnicAI también ha reducido sus costos de infraestructura, ha liberado capacidad técnica escasa y ha dado a sus Engineers más confianza para trabajar con configuraciones históricas que no crearon ellos.
"Quieres dedicar tu tiempo a cosas que son útiles", dice Zarrabi. "Adivinar tus límites de memoria y CPU no lo es."
PicnicAI planea seguir ampliando el rol de PerfectScale a medida que su entorno de Kubernetes evoluciona, aumentando la automatización en más workloads y abordando progresivamente la infraestructura de producción más sensible.
La empresa también seguirá apoyándose en la amplia experiencia en la nube de DoiT a medida que su plataforma y sus iniciativas de IA se desarrollan. Para PicnicAI, el objetivo es claro: automatizar la optimización de la infraestructura siempre que sea posible, mantener la confiabilidad que exigen los workloads críticos del sector salud y permitir que sus Engineers dediquen menos tiempo a gestionar Kubernetes y más tiempo a construir tecnología que pueda mejorar los resultados de los pacientes.
PicnicAI es una empresa de tecnología de salud que construye inteligencia para acelerar la salud humana. Su tecnología procesa y valida grandes volúmenes de datos médicos, ayudando a los investigadores farmacéuticos a realizar ensayos clínicos observacionales de forma más eficiente y a los pacientes a gestionar su atención.
La infraestructura en la nube de la empresa juega un papel crítico en esa misión. PicnicAI opera ocho o nueve clústeres de Kubernetes que soportan workloads automatizados, con requisitos de CPU y memoria que pueden variar significativamente según los datos que se procesan. Para PicnicAI, contar con una infraestructura confiable significa, en última instancia, que sus Engineers puedan enfocarse en la innovación en salud en lugar de dedicar su tiempo a gestionar Kubernetes manualmente.
Deja de adivinar los límites de CPU y memoria de Kubernetes para cada workload
Descubre lo que PerfectScale by DoiT encuentra en tus clústeres. Obtén visibilidad a nivel de workload, redimensionamiento automatizado y guardrails de políticas que tú controlas, con los Engineers de DoiT trabajando junto a tu equipo.