DOSSIER / EXPERTISE

Infrastructure & Reliability

Fiabilité des systèmes, SRE et production IT : relier objectifs de service, observation et décisions d’exploitation.

La fiabilité se définit par le service attendu et par les événements qui empêchent de le rendre. Une infrastructure disponible ne garantit pas, à elle seule, que le parcours utilisateur fonctionne. Ce dossier rapproche architecture, production IT et objectifs de service.

Commencer par le service

Le cadre SLO présenté par Google SRE distingue la mesure, son objectif et les engagements éventuels. Le choix d’un indicateur doit permettre une décision : intervenir, limiter un déploiement ou accepter un risque connu.

SRE : améliorer la fiabilité des systèmes critiques propose une méthode pour choisir ces indicateurs, construire un budget d’erreur et éviter une supervision qui accumule des alertes sans priorités.

Organiser les responsabilités

Qui gère un incident ? Qui modifie l’application ? Qui arbitre la réduction du risque ? Les réponses dépendent de l’organisation. DevOps, SRE et IT Production compare ces approches sans les réduire à des intitulés de poste.

Changer sans perdre la capacité d’exploiter

Un changement d’infrastructure traverse plusieurs couches : identité, réseau, composants et procédures d’exploitation. Piloter un projet d’infrastructure critique fournit une grille de préparation et de décision pour cette traversée.

Avant une évolution, réunir quatre preuves : un service mesurable, une procédure testée, une limite d’arrêt et une responsabilité d’intervention. Cette grille est une proposition de méthode, à adapter aux contraintes du système.