La plupart des clusters que nous reprenons fonctionnent. Le problème n'est presque jamais l'installation : c'est l'absence de réseaux séparés, de test de bascule, de restauration vérifiée et d'indicateurs qui disent si la plateforme peut encore encaisser la perte d'un noeud. Ce guide suit donc l'ordre réel d'un chantier, du plan d'adressage jusqu'à la première astreinte.
Il est volontairement méthodologique. Les extraits de commande sont donnés pour fixer les idées et signaler les options qui comptent, pas pour être collés tels quels : chaque plateforme a son matériel, son réseau et ses contraintes de service.
Ce guide vise Proxmox VE 9, bâti sur Debian 13 Trixie. Plusieurs points diffèrent de la génération précédente : les dépôts passent au format deb822, les groupes de haute disponibilité laissent place aux règles d'affinité, et Ceph Tentacle devient la version par défaut des nouvelles installations. Le support standard de la génération 8 s'est achevé en août 2026 : une nouvelle plateforme n'a plus de raison de partir sur cette base.
Administrateurs système et responsables informatique qui déploient un premier cluster, reprennent une plateforme existante, ou préparent une migration depuis VMware vSphere. Nous supposons une aisance avec Debian, le réseau et la ligne de commande.
Les six chapitres
Architecture, matériel et plan réseau
Dimensionner les noeuds, choisir les disques, séparer les réseaux corosync, Ceph et production. Les décisions les plus coûteuses à corriger plus tard.
CHAPITRE 02Installation des noeuds et création du cluster
Dépôts, horloge, interfaces, création du cluster avec deux liens corosync, QDevice, comptes et accès. Le socle sur lequel tout le reste repose.
CHAPITRE 03Stockage : Ceph, ou ZFS et réplication
Moniteurs, gestionnaires, OSD, pools, domaine de défaillance, marge de reconstruction. Et quand il vaut mieux renoncer à Ceph.
CHAPITRE 04Haute disponibilité, sauvegardes et pare-feu
Groupes HA, watchdog, isolation d'un noeud défaillant, Proxmox Backup Server, règle 3-2-1, restauration testée et cloisonnement réseau.
CHAPITRE 05Collecte des métriques : InfluxDB et Grafana
Serveur de métriques natif de Proxmox VE, compléments Telegraf pour Ceph, SMART et corosync, rétention, et trois niveaux de tableaux de bord.
CHAPITRE 06KPI, alerting et recette de mise en production
Le tableau des indicateurs et de leurs seuils, le routage des alertes par gravité, et la liste des tests à passer avant d'ouvrir le service.
Ce que ce guide ne couvre pas
- Le SDN avancé de Proxmox VE (zones EVPN, VXLAN multi-sites), qui mérite son propre guide.
- La réplication Ceph inter-sites (RBD mirroring) et les architectures étirées.
- Le détail de la migration VMware vers Proxmox VE, traité dans notre guide de migration dédié.
- Le durcissement complet au sens d'un référentiel type ANSSI ou ISO 27001.
Un cluster a batir, a auditer ou a reprendre en main
Nous concevons, deployons et exploitons des clusters Proxmox VE et Ceph en production pour des PME, des structures reglementees et des collectivites. Nous formons aussi vos equipes, notamment dans le cadre des migrations depuis VMware.