Lors d'un incident de production récent, un cluster Nacos à trois nœuds a subi une grave panne en cascade après le redémarrage d'un seul nœud en raison de problèmes matériels. Malgré le support inhérent du cluster pour le basculement de nœuds, le redémarrage a déclenché une vague d'alertes de services non sains, entraînant des redémarrages généralisés. La cause racine n'était pas la panne du nœud elle-même, mais la manière dont la brève gigue côté serveur s'est propagée aux clients, provoquant un effet boule de neige. Cet incident souligne l'importance d'une résilience robuste côté client, y compris une logique de nouvelle tentative appropriée, le regroupement de connexions et les délais d'attente des vérifications de santé. Il met également en évidence la nécessité de tester minutieusement les scénarios de basculement et de mettre en œuvre des disjoncteurs pour prévenir les pannes en cascade.
Un cluster Nacos de production à trois nœuds a subi une panne en cascade lorsqu'un nœud a été redémarré, provoquant des échecs de vérification de santé et des redémarrages généralisés. Cela met en évidence des leçons critiques en matière de conception de systèmes distribués.