File tree Expand file tree Collapse file tree
Expand file tree Collapse file tree Original file line number Diff line number Diff line change 1+ # SLOs — FleetOps API
2+
3+ ## Définitions
4+
5+ Un SLO (Service Level Objective) est un objectif de fiabilité mesurable.
6+ Un SLI (Service Level Indicator) est la métrique qui mesure cet objectif.
7+ Un Error Budget est la marge d'indisponibilité tolérée.
8+
9+ ---
10+
11+ ## SLO 1 — Disponibilité
12+
13+ ** SLI :** Pourcentage de requêtes qui retournent un code HTTP non-5xx
14+ ** Objectif :** >= 99.5% sur une fenêtre glissante de 30 jours
15+ ** Error Budget :** 0.5% = ~ 3h36 d'indisponibilité par mois
16+
17+ ** Requête Prometheus :**
18+ 1 - (rate(http_requests_total{status=~ "5.."}[ 30d] ) / rate(http_requests_total[ 30d] ))
19+
20+ ---
21+
22+ ## SLO 2 — Latence
23+
24+ ** SLI :** Pourcentage de requêtes avec latence < 300ms (p95)
25+ ** Objectif :** >= 95% des requêtes répondent en moins de 300ms
26+ ** Error Budget :** 5% des requêtes peuvent dépasser 300ms
27+
28+ ** Requête Prometheus :**
29+ histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[ 5m] )) < 0.3
30+
31+ ---
32+
33+ ## Alertes liées aux SLOs
34+
35+ | SLO | Alerte | Sévérité | Condition |
36+ | ---| ---| ---| ---|
37+ | Disponibilité | HighErrorRate | Critical | > 5% erreurs 5xx depuis 1 min |
38+ | Latence | HighLatency | Warning | p95 > 300ms depuis 2 min |
39+
40+ ---
41+
42+ ## Suivi
43+
44+ Les SLOs sont visualisés dans le dashboard Grafana "FleetOps — Métier".
45+ Les alertes Prometheus notifient l'équipe en cas de burn rate élevé.
You can’t perform that action at this time.
0 commit comments