Choisir un outil de supervision ressemble à choisir une voiture : tout le monde vous conseille la sienne, avec conviction. La bonne question n'est pas « quel est le meilleur outil » mais « que voulons-nous savoir, et qui va lire les alertes à trois heures du matin ». Cette page sert de carte. Les guides détaillés, en bas, servent de route.
01Les trois questions d'une supervision
Toute supervision répond, plus ou moins bien, à trois questions distinctes. Les outils se différencient surtout par celle qu'ils traitent le mieux.
- Est-ce que ça marche ? La disponibilité vue de l'extérieur : le site répond, le certificat est valide, le port de messagerie accepte les connexions. C'est la question du client, et la seule qui compte pour lui.
- Pourquoi ça marche mal ? Les ressources vues de l'intérieur : processeur, mémoire, disques, latence de stockage, files d'attente. C'est la question de l'administrateur pendant l'incident.
- Qu'est-ce qui va casser ? Les tendances : un disque qui se remplit de 2 % par semaine, une base qui grossit, un SSD qui s'use. C'est la question de celui qui veut dormir.
Une alerte doit toujours appeler une action. Une alerte qui ne demande rien finit ignorée, et entraîne avec elle les alertes importantes. Avant d'installer quoi que ce soit, listez ce que vous feriez si chaque indicateur passait au rouge. Ce qui n'a pas de réponse n'a pas besoin d'alerte : un graphique suffit.
02Quatre familles d'outils
Le duo léger : Beszel et Uptime Kuma
Beszel collecte les ressources des serveurs et des conteneurs avec un agent minuscule, Uptime Kuma teste les services depuis l'extérieur. Installation en un quart d'heure, interface claire, alertes simples. C'est le bon choix tant que le parc tient dans une page d'écran et qu'une personne suffit à tout surveiller.
La pile métrique : Prometheus, InfluxDB et Grafana
Des bases de séries temporelles qui ingèrent tout, et Grafana qui en fait des tableaux de bord superbes. Imbattable pour l'analyse, la corrélation et la planification de capacité. En revanche c'est un assemblage : la configuration vit dans des fichiers, les alertes demandent du soin, et chaque brique se maintient.
La plateforme intégrée : Zabbix
Un seul produit pour la collecte, le stockage, les seuils, les escalades, la cartographie et l'inventaire. Des centaines de modèles prêts à l'emploi, des proxies pour les sites distants, une API complète. La courbe d'apprentissage est réelle, mais au-delà de quelques dizaines de machines, ou quand plusieurs équipes se partagent les alertes, c'est souvent l'outil le plus économique en temps.
Les anciens : Nagios, Icinga, Xymon
Ils supervisaient des serveurs quand le mot « cloud » désignait encore la météo. Leur modèle de sondes qui renvoient OK, WARNING ou CRITICAL a inspiré tout le monde, et leurs greffons fonctionnent encore partout. Ils restent pertinents dans certains cas précis, que nous détaillons dans un article dédié.
03Le comparatif
| Critère | Beszel + Kuma | Prometheus + Grafana | Zabbix | Nagios / Icinga |
|---|---|---|---|---|
| Mise en route | 15 minutes | Une journée | Deux à trois jours | Une journée |
| Taille de parc confortable | 1 à 50 hôtes | Illimitée | 10 à plusieurs milliers | 10 à plusieurs milliers |
| Disponibilité vue de l'extérieur | Excellente (Kuma) | Via blackbox exporter | Très bonne | Excellente |
| Métriques et graphiques | Bons, sans réglage | Les meilleurs | Corrects | Rudimentaires |
| Escalades et astreinte | Basiques | Alertmanager, correct | Complètes | Complètes |
| Configuration | Interface web | Fichiers YAML | Interface et API | Fichiers ou Director |
| Multi-sites et zones isolées | Limité | Fédération, agents | Proxies, natif | Satellites (Icinga) |
| Courbe d'apprentissage | Plate | Moyenne | Raide | Moyenne |
04Quel outil pour quel profil
Quelques situations que nous rencontrons souvent, et ce que nous y installons.
| Situation | Notre choix | Pourquoi |
|---|---|---|
| Une TPE, trois serveurs et un site vitrine | Beszel + Uptime Kuma | Tout tient sur un écran, l'alerte part sur le téléphone, personne n'a besoin de former qui que ce soit. |
| Un cluster Proxmox VE de trois à cinq noeuds | InfluxDB + Grafana, plus Kuma | Proxmox pousse ses métriques nativement, les tableaux de bord parlent tout de suite. Kuma garde l'oeil sur les services. |
| Une équipe de développement en conteneurs | Prometheus + Grafana | Les applications exposent déjà des métriques, et l'écosystème d'exporters couvre le reste. |
| Un hébergeur ou un infogéreur, plusieurs clients | Zabbix 8.0 avec proxies | Un proxy par client ou par site, des droits par groupe d'hôtes, des escalades par contrat. |
| Un parc historique sous Nagios qui fonctionne | Le garder, ou passer à Icinga | Une migration se justifie par un besoin, pas par la mode. Les greffons restent compatibles. |
Aucune de nos plateformes n'utilise un seul outil. Le cas le plus fréquent : Zabbix pour les alertes et l'astreinte, Grafana branché sur Zabbix pour les tableaux de bord de direction, et un Uptime Kuma hébergé ailleurs qui surveille Zabbix lui-même.
05Les pièges communs à tous les outils
- Qui surveille le surveillant ? Une supervision hébergée sur l'infrastructure qu'elle surveille tombe avec elle, en silence. Le minimum : une sonde externe, ailleurs, qui vérifie que la supervision répond. Juvénal posait déjà la question, nous n'avons pas trouvé mieux que la redondance.
- La fatigue d'alerte. Cent notifications par jour, c'est zéro notification lue. Mieux vaut cinq alertes justes qu'une couverture exhaustive que personne ne regarde.
- Le canal unique. Des alertes envoyées par le serveur de messagerie qui vient de tomber n'arrivent jamais. Prévoyez un second canal qui ne dépend pas de votre infrastructure.
- Les seuils copiés d'Internet. 80 % de disque n'a pas le même sens sur 50 Go et sur 50 To. Un seuil se règle sur votre plateforme, puis se révise après chaque fausse alerte.
- L'absence de données. Un hôte qui ne remonte plus rien n'est pas un hôte en bonne santé. Chaque outil sait alerter sur l'absence de données, encore faut-il l'activer.
06Les guides détaillés
Beszel et Uptime Kuma
Ressources vues de l'intérieur, disponibilité vue de l'extérieur, alertes sur le téléphone. Le tout en une heure, sans base de données à administrer.
DE JOLIS GRAPHIQUESGrafana, Prometheus et InfluxDB
La pile métrique hybride : Proxmox vers InfluxDB, le reste vers Prometheus, Grafana pour tout réunir. Avec le choix raisonné entre InfluxDB 2 et 3.
LE GUIDE AVANCÉZabbix 8.0 en production
Six chapitres : haute disponibilité, proxies, modèles et découverte, alertes et escalades, automatisation par l'API, migration depuis Zabbix 7.0.
LES ANCIENSNagios, Icinga, Xymon
Ce qu'ils font encore mieux que les autres, ce qu'il faut éviter de leur demander, et comment en sortir le jour venu.
Une supervision qui veille pendant que vous dormez
Nous concevons, installons et exploitons des plateformes de supervision pour des PME, des hébergeurs et des collectivités : Zabbix, Prometheus et Grafana, ou plus léger quand le besoin l'est. Reprise d'une supervision existante, réglage des alertes qui sonnent pour rien, astreinte : nous intervenons au forfait comme au long cours.