Projet
8 min de lecture
Stack de monitoring et d’observabilité
📊 Une stack complète pour surveiller mes sites et conteneurs, centraliser les logs, suivre les certificats TLS et recevoir des alertes e-mail ou SMS.
Publie le 17/08/2026
Mise a jour 17/08/2026
Vue d'ensemble
📊 Comprendre l’état de toute l’infrastructure en un regard
Héberger plusieurs applications ne consiste pas seulement à les démarrer. Il faut pouvoir savoir si elles répondent, anticiper une saturation, détecter une erreur et retrouver rapidement son origine. J’ai donc conçu une stack de monitoring et d’observabilité dédiée à l’ensemble de mon infrastructure.
Cette plateforme regroupe la disponibilité des sites, les métriques du serveur, l’activité des conteneurs, les journaux et les alertes. Elle fournit une vue globale tout en permettant de descendre dans le détail d’un service lorsque cela est nécessaire.
🌐 Surveillance des sites et des certificats TLS
Blackbox Exporter effectue des sondes régulières sur les domaines publics. Il contrôle le code HTTP reçu, la durée de la requête, les redirections et la validité de la connexion TLS. Cette vérification reproduit davantage le point de vue d’un visiteur qu’un simple contrôle interne du conteneur.
La date d’expiration des certificats est également collectée afin d’être alerté avant qu’un problème HTTPS ne devienne visible pour les utilisateurs. Les tableaux de bord distinguent la disponibilité générale et l’analyse détaillée de chaque site.
📈 Métriques serveur et conteneurs avec Prometheus
Prometheus centralise les séries temporelles produites par les différents exporters. Node Exporter expose les informations du serveur Linux : processeur, mémoire, stockage, charge et réseau. cAdvisor fournit une vision plus précise de la consommation de chaque conteneur Docker.
Ces données permettent de repérer une hausse inhabituelle de mémoire, un manque d’espace disque ou un conteneur trop consommateur. Les règles d’alerte transforment les métriques brutes en signaux réellement exploitables.
🧾 Centralisation des logs avec Alloy et Loki
Grafana Alloy collecte les journaux des services et leur applique des étiquettes pour faciliter les recherches. Loki les stocke de manière centralisée et permet de les interroger depuis la même interface que les métriques.
Cette corrélation est particulièrement utile pendant un incident : une alerte de disponibilité peut être comparée aux ressources du conteneur et aux erreurs enregistrées au même moment. Le diagnostic devient plus rapide et repose sur des éléments factuels.
📉 Des dashboards Grafana conçus pour être lisibles
Grafana rassemble toutes les sources dans des tableaux de bord adaptés à mes besoins. La vue d’ensemble met en avant les informations prioritaires : services disponibles, temps de réponse, certificats, alertes actives et état des composants de supervision.
Des vues détaillées permettent ensuite d’explorer un site, une métrique ou une période précise. Le but n’est pas d’accumuler les graphiques, mais de présenter les informations qui aident réellement à prendre une décision.
🚨 Alertes e-mail et SMS avec Alertmanager
Alertmanager reçoit les alertes déclenchées par Prometheus, les regroupe et les distribue selon leur nature. J’ai mis en place des connecteurs dédiés pour envoyer des notifications par e-mail et par SMS.
Le regroupement évite de recevoir une avalanche de messages lorsqu’un même incident provoque plusieurs symptômes. Les notifications contiennent suffisamment de contexte pour identifier le service concerné et commencer le diagnostic rapidement.
🛡️ Une stack elle-même sécurisée et résiliente
Chaque composant fonctionne dans Docker avec des volumes persistants, des limites de ressources et uniquement les accès nécessaires. Les interfaces sensibles ne sont pas toutes exposées publiquement. Les réseaux et les permissions sont organisés pour limiter les communications inutiles.
La stack inclut également des composants de sécurité et peut exploiter les événements remontés par les services de protection. Les healthchecks et politiques de redémarrage améliorent sa capacité à revenir automatiquement en fonctionnement.
🚀 Une compétence DevOps concrète
Ce projet montre ma capacité à exploiter une infrastructure dans la durée, et pas uniquement à livrer du code. Il mobilise Docker, Linux, Prometheus, Grafana, Loki, Alloy, Alertmanager, Blackbox Exporter, cAdvisor et plusieurs connecteurs personnalisés. Il démontre une approche proactive de la disponibilité, de la performance et de la résolution d’incidents.