
1. Partir de l’inventaire de la supervision existante pas toujours à jour
A moins de partir d’une source de vérité fiable et garantie 100% à jour, le risque est réel d’avoir une supervision qui passe à côté de sa cible si le système existant n’a pas été régulièrement rafraichi..
Un audit réalisé en amont va permettre de dresser un inventaire exhaustif et de définir ensemble ce qui doit être surveillé.
2. Ne pas inclure dés le début et tout au long du projet les équipes support
Un système de supervision efficace est adapté à chaque organisation et pensé pour être intégré comme un nouvel outil de travail à destination des équipes support. Ne pas associer dés les premières phases du projet les mainteneurs et exploitants, c’est prendre le risque d’un rejet du nouvel environnement d’aide à la maintenance.
Intégrer les équipes support très tôt dés la phase de conception ne présente que des avantages : évite la perte de temps engendrée par des reprises de design sur une solution sur le point d’être livrée, favorise une montée en compétences et une prise en main progressives par les équipes, suscite un enthousiasme et une dynamique positives face au changement .
3. Ne pas consacrer suffisamment de temps à la réduction du bruit
Des seuils d’alertes inadaptés, des déclencheurs non pertinents ou encore des logs non filtrés peuvent générer une quantité très importante d’informations non pertinentes.
Autre point de vigilance: la tentation peut être grande d’afficher tous les indicateurs possibles sans que cela n’aide forcément à réduire le temps de diagnostic par les équipes.
Les métriques, indicateurs, logs et autres valeurs surveillées ont toute leur utilité dés lors qu’ils sont adaptés à leur contexte opérationnel et organisés selon une certaine logique et cohérence.
Une des approches possible consiste à organiser fonctionnellement les vues et les actions selon que l’usage soit sur un temps court (surveillance et détection d’anomalies) ou sur un temps long (capacity planning, recherche de causes post-mortem..).
4. Absence d’un plan de suivi dans la durée
L’infrastructure est supervisée à un instant T : super boulot. Qu’en sera t’il dans 6 mois? un an?
Une infrastructure digitale n’est jamais figée, elle vit et évolue selon les besoins. Un système de supervision efficace doit aussi s’inscrire dans cette dynamique.
Les infrastructures IT sont en perpétuelles mutations, l’écosystéme de supervision doit être en mesure de suivre et d’absorber ces changements en quasi temps réel.
5. Et enfin last but not least : qui supervise la supervision?
C’est l’histoire de l’œuf et de la poule mais il est primordial de mettre en place des processus nécessaires pour s’assurer du bon état de santé de la NMS.
Cas réel rencontré : un tableau de bord avec tous les voyants au vert et qui était en réalité figé depuis plusieurs semaines en raison d’une saturation de l’espace disque qui n’a pas été vue.