Supervision

Quel outil de supervision choisir ?

Tout le monde vous conseillera son outil, avec conviction. Voici une carte honnête : ce que chaque famille fait bien, ce qu'elle fait mal, et pour qui.

Niveau débutant  ·  Lecture 9 min  ·  Mise à jour octobre 2026

Choisir un outil de supervision ressemble à choisir une voiture : tout le monde vous conseille la sienne, avec conviction. La bonne question n'est pas « quel est le meilleur outil » mais « que voulons-nous savoir, et qui va lire les alertes à trois heures du matin ». Cette page sert de carte. Les guides détaillés, en bas, servent de route.

01Les trois questions d'une supervision

Toute supervision répond, plus ou moins bien, à trois questions distinctes. Les outils se différencient surtout par celle qu'ils traitent le mieux.

  • Est-ce que ça marche ? La disponibilité vue de l'extérieur : le site répond, le certificat est valide, le port de messagerie accepte les connexions. C'est la question du client, et la seule qui compte pour lui.
  • Pourquoi ça marche mal ? Les ressources vues de l'intérieur : processeur, mémoire, disques, latence de stockage, files d'attente. C'est la question de l'administrateur pendant l'incident.
  • Qu'est-ce qui va casser ? Les tendances : un disque qui se remplit de 2 % par semaine, une base qui grossit, un SSD qui s'use. C'est la question de celui qui veut dormir.
La règle qui précède le choix de l'outil

Une alerte doit toujours appeler une action. Une alerte qui ne demande rien finit ignorée, et entraîne avec elle les alertes importantes. Avant d'installer quoi que ce soit, listez ce que vous feriez si chaque indicateur passait au rouge. Ce qui n'a pas de réponse n'a pas besoin d'alerte : un graphique suffit.

02Quatre familles d'outils

Le duo léger : Beszel et Uptime Kuma

Beszel collecte les ressources des serveurs et des conteneurs avec un agent minuscule, Uptime Kuma teste les services depuis l'extérieur. Installation en un quart d'heure, interface claire, alertes simples. C'est le bon choix tant que le parc tient dans une page d'écran et qu'une personne suffit à tout surveiller.

La pile métrique : Prometheus, InfluxDB et Grafana

Des bases de séries temporelles qui ingèrent tout, et Grafana qui en fait des tableaux de bord superbes. Imbattable pour l'analyse, la corrélation et la planification de capacité. En revanche c'est un assemblage : la configuration vit dans des fichiers, les alertes demandent du soin, et chaque brique se maintient.

La plateforme intégrée : Zabbix

Un seul produit pour la collecte, le stockage, les seuils, les escalades, la cartographie et l'inventaire. Des centaines de modèles prêts à l'emploi, des proxies pour les sites distants, une API complète. La courbe d'apprentissage est réelle, mais au-delà de quelques dizaines de machines, ou quand plusieurs équipes se partagent les alertes, c'est souvent l'outil le plus économique en temps.

Les anciens : Nagios, Icinga, Xymon

Ils supervisaient des serveurs quand le mot « cloud » désignait encore la météo. Leur modèle de sondes qui renvoient OK, WARNING ou CRITICAL a inspiré tout le monde, et leurs greffons fonctionnent encore partout. Ils restent pertinents dans certains cas précis, que nous détaillons dans un article dédié.

03Le comparatif

CritèreBeszel + KumaPrometheus + GrafanaZabbixNagios / Icinga
Mise en route15 minutesUne journéeDeux à trois joursUne journée
Taille de parc confortable1 à 50 hôtesIllimitée10 à plusieurs milliers10 à plusieurs milliers
Disponibilité vue de l'extérieurExcellente (Kuma)Via blackbox exporterTrès bonneExcellente
Métriques et graphiquesBons, sans réglageLes meilleursCorrectsRudimentaires
Escalades et astreinteBasiquesAlertmanager, correctComplètesComplètes
ConfigurationInterface webFichiers YAMLInterface et APIFichiers ou Director
Multi-sites et zones isoléesLimitéFédération, agentsProxies, natifSatellites (Icinga)
Courbe d'apprentissagePlateMoyenneRaideMoyenne

04Quel outil pour quel profil

Quelques situations que nous rencontrons souvent, et ce que nous y installons.

SituationNotre choixPourquoi
Une TPE, trois serveurs et un site vitrineBeszel + Uptime KumaTout tient sur un écran, l'alerte part sur le téléphone, personne n'a besoin de former qui que ce soit.
Un cluster Proxmox VE de trois à cinq noeudsInfluxDB + Grafana, plus KumaProxmox pousse ses métriques nativement, les tableaux de bord parlent tout de suite. Kuma garde l'oeil sur les services.
Une équipe de développement en conteneursPrometheus + GrafanaLes applications exposent déjà des métriques, et l'écosystème d'exporters couvre le reste.
Un hébergeur ou un infogéreur, plusieurs clientsZabbix 8.0 avec proxiesUn proxy par client ou par site, des droits par groupe d'hôtes, des escalades par contrat.
Un parc historique sous Nagios qui fonctionneLe garder, ou passer à IcingaUne migration se justifie par un besoin, pas par la mode. Les greffons restent compatibles.
Les combinaisons sont la norme

Aucune de nos plateformes n'utilise un seul outil. Le cas le plus fréquent : Zabbix pour les alertes et l'astreinte, Grafana branché sur Zabbix pour les tableaux de bord de direction, et un Uptime Kuma hébergé ailleurs qui surveille Zabbix lui-même.

05Les pièges communs à tous les outils

  • Qui surveille le surveillant ? Une supervision hébergée sur l'infrastructure qu'elle surveille tombe avec elle, en silence. Le minimum : une sonde externe, ailleurs, qui vérifie que la supervision répond. Juvénal posait déjà la question, nous n'avons pas trouvé mieux que la redondance.
  • La fatigue d'alerte. Cent notifications par jour, c'est zéro notification lue. Mieux vaut cinq alertes justes qu'une couverture exhaustive que personne ne regarde.
  • Le canal unique. Des alertes envoyées par le serveur de messagerie qui vient de tomber n'arrivent jamais. Prévoyez un second canal qui ne dépend pas de votre infrastructure.
  • Les seuils copiés d'Internet. 80 % de disque n'a pas le même sens sur 50 Go et sur 50 To. Un seuil se règle sur votre plateforme, puis se révise après chaque fausse alerte.
  • L'absence de données. Un hôte qui ne remonte plus rien n'est pas un hôte en bonne santé. Chaque outil sait alerter sur l'absence de données, encore faut-il l'activer.

06Les guides détaillés

Une supervision qui veille pendant que vous dormez

Nous concevons, installons et exploitons des plateformes de supervision pour des PME, des hébergeurs et des collectivités : Zabbix, Prometheus et Grafana, ou plus léger quand le besoin l'est. Reprise d'une supervision existante, réglage des alertes qui sonnent pour rien, astreinte : nous intervenons au forfait comme au long cours.