Un cluster Kubernetes de production affichait une latence p95 bloquée à 200ms malgré des ressources CPU/mémoire suffisantes. Les captures révélaient un hairpinning east-west excessif et une pression conntrack du CNI sous charge burst.
Nous avons resserré les NetworkPolicies, migré vers un CNI avec routage eBPF et ajusté le mode kube-proxy sur les node pools concernés. Les seuils HPA ont été recalibrés après observation des nouvelles métriques de base.
La latence est passée de 200ms à 15ms en p95 en 48 heures. Le correctif était du tuning opérationnel — pas l'ajout de nœuds.