Une panne de serveur qui valait une leçon
Mon serveur est tombé pendant environ sept heures — incident chez l’hébergeur, rien à faire de mon côté. Le vrai problème : je l’ai découvert tard, parce que mon système d’alerte tournait… sur le serveur en panne. Un système de surveillance hébergé sur la machine qu’il surveille ne sert à rien le jour où ça compte.
Correctif le jour même : un « dead man’s switch » externe. Le serveur envoie un battement de cœur régulier à un service indépendant ; si le battement s’arrête, je suis alerté sur mon téléphone en quelques minutes.
La leçon : La supervision se conçoit dès l’architecture, pas après la première panne. C’est vrai pour mon laboratoire, c’est encore plus vrai pour un outil déployé en entreprise.