PerfectScalePerfectScale

Esta página también está disponible en English, Deutsch, Français, Italiano, 日本語 y Português.

PicnicAI automatiza el 85-90% de sus workloads de Kubernetes y gana en confiabilidad con PerfectScale by DoiT

Cómo PicnicAI usó PerfectScale by DoiT para automatizar la optimización de workloads, reducir la carga operativa y dar a sus Engineers más confianza en su infraestructura

PerfectScale
PicnicAI

The Challenge

A medida que el entorno de Kubernetes de PicnicAI evolucionaba, el equipo se enfrentó a un desafío cada vez más común: entender cuánta CPU y memoria necesitaban realmente los workloads individuales.

Históricamente, los requisitos de recursos se estimaban al crear los workloads y podían quedar sin cambios hasta que surgía un problema. Ese enfoque era especialmente problemático para los workloads de procesamiento de datos, donde los requisitos podían variar significativamente entre trabajos.

"Antes, la forma en que hacíamos el escalado era básicamente que alguien adivinaba cuánta memoria y CPU necesitaría un trabajo al crearlo, y después no se volvía a tocar hasta que aparecían muchos OOMs (errores por falta de memoria)", dice Josh Zarrabi, Ingeniero de Infraestructura en PicnicAI.

Cuando los workloads estaban subaprovisionados, los trabajos podían fallar y reintentarse una y otra vez, generando colas y presionando aún más las bases de datos compartidas. Por el contrario, el sobreaprovisionamiento creaba capacidad de infraestructura innecesaria y gasto en la nube.

El desafío se agravaba por lo reducido del equipo de ingeniería de PicnicAI. Muchas decisiones de infraestructura habían sido tomadas por Engineers que ya no estaban en la empresa, por lo que el equipo no siempre contaba con el contexto detrás de las configuraciones existentes.

Si bien reducir los costos de la nube fue una de las motivaciones para explorar la optimización, la confiabilidad se convirtió rápidamente en el objetivo más importante. "Las mejoras en confiabilidad han sido muy importantes para nosotros, y el ahorro en costos ha sido un buen beneficio adicional", dice Zarrabi.

The Solution

Del right-sizing manual a la automatización

PicnicAI comenzó a trabajar con DoiT como parte de una iniciativa más amplia de optimización de costos en la nube. DoiT presentó PerfectScale para ayudar al equipo a entender la utilización de recursos a nivel de workload y automatizar la optimización de Kubernetes.

PerfectScale combina una visibilidad granular de Kubernetes con un right-sizing automatizado y adaptado a cada workload, lo que ayuda a los equipos a optimizar CPU y memoria sin depender de un monitoreo manual constante.

En PicnicAI, la implementación fue deliberadamente gradual. El equipo se enfocó primero en mejorar la confiabilidad y ganar confianza en las recomendaciones antes de expandir progresivamente la automatización.

Identificación de configuraciones ineficientes

Las capacidades de InfraFit de PerfectScale ayudaron a PicnicAI a identificar configuraciones de infraestructura ineficientes y a entender dónde los workloads no estaban alineados con los recursos aprovisionados.

"Con InfraFit de PerfectScale, es mucho más fácil decir: ok, aquí realmente estamos perdiendo recursos porque la configuración no es la correcta para nuestros workloads", dice Zarrabi. "Me da más confianza para hacer cambios cuando no siempre tenemos el contexto completo de las decisiones que hay detrás."

Automatización con acompañamiento experto

La tecnología fue solo una parte de la solución. Los equipos de Field Engineering y Customer Success de DoiT trabajaron codo a codo con PicnicAI para ayudarles a entender el comportamiento de Kubernetes y determinar dónde se podía introducir la automatización de forma segura.

Esto incluyó revisar la interacción entre el HPA (autoescalado horizontal de pods) y el autoescalador del clúster, ajustar umbrales e introducir políticas controladas sobre los requisitos de recursos.

Las capacidades de políticas y guardrails de PerfectScale permitieron a PicnicAI controlar dónde y cómo se aplicaba la optimización, en lugar de simplemente activar la automatización en todos los workloads.

Los workloads más sensibles se trataron con cautela, mientras la automatización se expandía progresivamente por los entornos de producción, staging y desarrollo.

Para Zarrabi, contar con soporte técnico continuo además de la plataforma fue una parte importante de la colaboración. "Es bueno tener a alguien que está pendiente y me hace rendir cuentas", dice. "Ayuda mucho para asegurarnos de que le estamos sacando el máximo provecho al producto."

Results

  • Automatización del 85–90% de los workloads
  • Reducción aproximada del 50% del tiempo del equipo dedicado a la infraestructura
  • Mayor confiabilidad y menos distracciones por la infraestructura
  • Eficiencia en costos como beneficio adicional
  • Más capacidad de ingeniería para trabajo de mayor valor

"PerfectScale nos da la confianza para automatizar la optimización de Kubernetes mientras nuestros Engineers se enfocan en construir lo que realmente importa."

Josh Zarrabi, Ingeniero de Infraestructura

Resultados

El 85–90% de los workloads ya está automatizado

El mayor cambio operativo ha sido dejar atrás la gestión manual de recursos. Antes de PerfectScale, PicnicAI no contaba con ningún redimensionamiento automatizado de workloads. Hoy, el redimensionamiento automatizado cubre aproximadamente el 85–90% de los workloads en sus clústeres de aplicaciones.

Esto significa que los requisitos de recursos se pueden optimizar de forma continua sin que los Engineers tengan que revisar y ajustar manualmente cada workload.

Mayor confiabilidad y menos distracciones por la infraestructura

Los beneficios van más allá de la optimización en sí. PicnicAI ha experimentado menos problemas relacionados con la memoria y menos de las interrupciones operativas que antes acompañaban a los workloads mal dimensionados.

"Simplemente es una cosa molesta menos de la que preocuparse", dice Zarrabi.

Ese cambio es especialmente significativo para una organización de ingeniería reducida. Al automatizar una mayor parte de la gestión de su infraestructura, PicnicAI ha podido aumentar la capacidad del equipo para entregar más trabajo en toda la empresa sin sumar carga operativa.

En lugar de investigar una y otra vez por qué fallan los trabajos, se acumulan colas o las bases de datos reciben una carga innecesaria, los Engineers pueden dedicar más tiempo a iniciativas estratégicas de infraestructura y de producto.

Eficiencia en costos como beneficio adicional

La confiabilidad fue el objetivo principal de la colaboración, pero no fue el único resultado. Como el right-sizing de PerfectScale se adapta a cada workload, también ha ayudado a PicnicAI a eliminar el sobreaprovisionamiento que antes se acumulaba cuando los límites de recursos se estimaban una sola vez y nunca se volvían a revisar, reduciendo el gasto innecesario en infraestructura junto con las mejoras de confiabilidad.

"Las mejoras en confiabilidad han sido muy importantes para nosotros, y el ahorro en costos ha sido un buen beneficio adicional", dice Zarrabi.

Para un equipo reducido y con muchas prioridades, esa combinación ha hecho que seguir invirtiendo en automatización sea una decisión fácil: no obliga a elegir entre un presupuesto de infraestructura más ajustado y sistemas confiables; ofrece ambas cosas.

Más capacidad de ingeniería para trabajo de mayor valor

La reducción de la gestión manual de Kubernetes ha permitido a los Engineers de PicnicAI enfocarse en proyectos a más largo plazo, como migrar la integración continua fuera de Jenkins y explorar nuevas iniciativas de IA.

El valor de la colaboración, entonces, va mucho más allá del problema de confiabilidad que vino a resolver. Al automatizar una tarea que antes requería criterio e intervención de ingeniería, PicnicAI también ha reducido sus costos de infraestructura, ha liberado capacidad técnica escasa y ha dado a sus Engineers más confianza para trabajar con configuraciones históricas que no crearon ellos.

"Quieres dedicar tu tiempo a cosas que son útiles", dice Zarrabi. "Adivinar tus límites de memoria y CPU no lo es."

¿Qué sigue?

PicnicAI planea seguir ampliando el rol de PerfectScale a medida que su entorno de Kubernetes evoluciona, aumentando la automatización en más workloads y abordando progresivamente la infraestructura de producción más sensible.

La empresa también seguirá apoyándose en la amplia experiencia en la nube de DoiT a medida que su plataforma y sus iniciativas de IA se desarrollan. Para PicnicAI, el objetivo es claro: automatizar la optimización de la infraestructura siempre que sea posible, mantener la confiabilidad que exigen los workloads críticos del sector salud y permitir que sus Engineers dediquen menos tiempo a gestionar Kubernetes y más tiempo a construir tecnología que pueda mejorar los resultados de los pacientes.

Conoce a PicnicAI

PicnicAI es una empresa de tecnología de salud que construye inteligencia para acelerar la salud humana. Su tecnología procesa y valida grandes volúmenes de datos médicos, ayudando a los investigadores farmacéuticos a realizar ensayos clínicos observacionales de forma más eficiente y a los pacientes a gestionar su atención.

La infraestructura en la nube de la empresa juega un papel crítico en esa misión. PicnicAI opera ocho o nueve clústeres de Kubernetes que soportan workloads automatizados, con requisitos de CPU y memoria que pueden variar significativamente según los datos que se procesan. Para PicnicAI, contar con una infraestructura confiable significa, en última instancia, que sus Engineers puedan enfocarse en la innovación en salud en lugar de dedicar su tiempo a gestionar Kubernetes manualmente.

Deja de adivinar los límites de CPU y memoria de Kubernetes para cada workload

Automatiza el right-sizing de Kubernetes con confianza

Descubre lo que PerfectScale by DoiT encuentra en tus clústeres. Obtén visibilidad a nivel de workload, redimensionamiento automatizado y guardrails de políticas que tú controlas, con los Engineers de DoiT trabajando junto a tu equipo.

More customer stories

Stefanini

Un 26% menos en costos de cómputo de Kubernetes: así lo logró Stefanini con PerfectScale by DoiT

26%
Reducción en costos de cómputo de Kubernetes
>60%
Reducción de costos de infraestructura en el último año
OneFootball

PerfectScale by DoiT ayuda a OneFootball a optimizar Kubernetes para el tráfico global del fútbol a gran escala

25%
de reducción en los costos de infraestructura de Kubernetes
80%
de reducción en el esfuerzo de Engineering dedicado a la optimización de costos y al ajuste de resiliencia en Kubernetes
Luma Health

Luma Health reduce un 40% los costos de EKS y libera miles de horas de Engineering al año

90%
Menos tiempo en right-sizing manual de Kubernetes
40%
Reducción en costos de Amazon EKS
+1,700h/year
Horas de Engineering redirigidas a fiabilidad y rendimiento
PlayHQ

PlayHQ optimiza sus costos de Kubernetes multi-tenant

40%
Reducción de costos de Kubernetes fuera de producción
40%
Reducción de costos de K8s fuera de producción
20%
Reducción de costos de K8s en producción
SNCF

Cómo SNCF eliminó la pérdida en K8s y mejoró la confiabilidad a gran escala

30%
Más workloads al mismo costo
30%
Más workloads absorbidos al mismo costo
~€500K
Ahorros anualizados estimados
NOS

NOS reduce a la mitad sus costos de Kubernetes y recupera la confianza en la optimización

50%
Reducción de costos
50%
Reducción de costos en el clúster más grande
0%
Recursos ociosos en los node pools principales
K1x

K1x recorta sus costos de nube y simplifica la operación de Kubernetes

Thousands
Ahorro mensual
Thousands
Ahorro mensual en gasto de nube
<10%
Utilización de recursos en nodos sobredimensionados antes de la optimización
Riftweaver

Cómo PerfectScale ayuda a un equipo DevOps de una sola persona a escalar Riftweaver

59%
Reducción del throttling de CPU
6
APIs críticas mejoradas
80,000+
Descargas del juego