Programme de Formation
5
module(s)
Durée totale : 600
Adopter la discipline SRE — SLO, budgets d'erreur, on-call, capacity planning — et livrer un TP de définition de SLO et d'alertes pour une application web.
Module 1 : SLO, SLI, SLA : définir le bon SLO
120
Distinguer SLI, SLO et SLA, choisir une fenêtre de mesure pertinente, comprendre les fameux neufs et leur coût, et rédiger un SLO réaliste pour un service.
Module 2 : Budget d'erreur et toil
90
Calculer un budget d'erreur, suivre son burn rate, identifier le toil opérationnel et mettre en place une cible de 50 % de project work pour les équipes SRE.
Module 3 : Incident response avec on-call
90
Structurer une rotation d'astreinte, écrire un playbook utile, conduire un incident en temps réel et publier un post-mortem blameless qui produit du savoir.
Module 4 : Capacity planning
90
Modéliser la charge d'une plateforme, identifier les goulots, scaler vertical ou horizontal et anticiper les pics saisonniers avec une marge de sécurité raisonnable.
Module 5 : TP — définir SLO et alertes pour une appli web
210
Bâtir trois SLO réalistes pour une application web fictive, écrire les recording rules, configurer des alertes Alertmanager basées sur burn rate multi-fenêtre et associer un runbook à chaque alerte.
Commentaires
0 commentaire
Aucun commentaire pour le moment
Soyez le premier à partager votre avis !
Se connecter pour commenter