La plupart des clusters que nous reprenons fonctionnent. Le problème n'est presque jamais l'installation : c'est l'absence de réseaux séparés, de test de bascule, de restauration vérifiée et d'indicateurs qui disent si la plateforme peut encore encaisser la perte d'un noeud. Ce guide suit donc l'ordre réel d'un chantier, du plan d'adressage jusqu'à la première astreinte.
Il est volontairement méthodologique. Les extraits de commande sont donnés pour fixer les idées et signaler les options qui comptent, pas pour être collés tels quels : chaque plateforme a son matériel, son réseau et ses contraintes de service.
Administrateurs système et responsables informatique qui déploient un premier cluster, reprennent une plateforme existante, ou préparent une migration depuis VMware vSphere. Nous supposons une aisance avec Debian, le réseau et la ligne de commande.
Les six chapitres
Architecture, matériel et plan réseau
Dimensionner les noeuds, choisir les disques, séparer les réseaux corosync, Ceph et production. Les décisions les plus coûteuses à corriger plus tard.
CHAPITRE 02Installation des noeuds et création du cluster
Dépôts, horloge, interfaces, création du cluster avec deux liens corosync, QDevice, comptes et accès. Le socle sur lequel tout le reste repose.
CHAPITRE 03Stockage : Ceph, ou ZFS et réplication
Moniteurs, gestionnaires, OSD, pools, domaine de défaillance, marge de reconstruction. Et quand il vaut mieux renoncer à Ceph.
CHAPITRE 04Haute disponibilité, sauvegardes et pare-feu
Groupes HA, watchdog, isolation d'un noeud défaillant, Proxmox Backup Server, règle 3-2-1, restauration testée et cloisonnement réseau.
CHAPITRE 05Collecte des métriques : InfluxDB et Grafana
Serveur de métriques natif de Proxmox VE, compléments Telegraf pour Ceph, SMART et corosync, rétention, et trois niveaux de tableaux de bord.
CHAPITRE 06KPI, alerting et recette de mise en production
Le tableau des indicateurs et de leurs seuils, le routage des alertes par gravité, et la liste des tests à passer avant d'ouvrir le service.
Ce que ce guide ne couvre pas
- Le SDN avancé de Proxmox VE (zones EVPN, VXLAN multi-sites), qui mérite son propre guide.
- La réplication Ceph inter-sites (RBD mirroring) et les architectures étirées.
- Le détail de la migration VMware vers Proxmox VE, que nous traitons en accompagnement.
- Le durcissement complet au sens d'un référentiel type ANSSI ou ISO 27001.
Un cluster a batir, a auditer ou a reprendre en main
Nous concevons, deployons et exploitons des clusters Proxmox VE et Ceph en production pour des PME, des structures reglementees et des collectivites. Nous formons aussi vos equipes, notamment dans le cadre des migrations depuis VMware.