Skip to content

Commit 0689e5e

Browse files
committed
feat: add SLO definitions and runbooks
1 parent bdcc7a9 commit 0689e5e

1 file changed

Lines changed: 45 additions & 0 deletions

File tree

docs/SLO.md

Lines changed: 45 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,45 @@
1+
# SLOs — FleetOps API
2+
3+
## Définitions
4+
5+
Un SLO (Service Level Objective) est un objectif de fiabilité mesurable.
6+
Un SLI (Service Level Indicator) est la métrique qui mesure cet objectif.
7+
Un Error Budget est la marge d'indisponibilité tolérée.
8+
9+
---
10+
11+
## SLO 1 — Disponibilité
12+
13+
**SLI :** Pourcentage de requêtes qui retournent un code HTTP non-5xx
14+
**Objectif :** >= 99.5% sur une fenêtre glissante de 30 jours
15+
**Error Budget :** 0.5% = ~3h36 d'indisponibilité par mois
16+
17+
**Requête Prometheus :**
18+
1 - (rate(http_requests_total{status=~"5.."}[30d]) / rate(http_requests_total[30d]))
19+
20+
---
21+
22+
## SLO 2 — Latence
23+
24+
**SLI :** Pourcentage de requêtes avec latence < 300ms (p95)
25+
**Objectif :** >= 95% des requêtes répondent en moins de 300ms
26+
**Error Budget :** 5% des requêtes peuvent dépasser 300ms
27+
28+
**Requête Prometheus :**
29+
histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[5m])) < 0.3
30+
31+
---
32+
33+
## Alertes liées aux SLOs
34+
35+
| SLO | Alerte | Sévérité | Condition |
36+
|---|---|---|---|
37+
| Disponibilité | HighErrorRate | Critical | > 5% erreurs 5xx depuis 1 min |
38+
| Latence | HighLatency | Warning | p95 > 300ms depuis 2 min |
39+
40+
---
41+
42+
## Suivi
43+
44+
Les SLOs sont visualisés dans le dashboard Grafana "FleetOps — Métier".
45+
Les alertes Prometheus notifient l'équipe en cas de burn rate élevé.

0 commit comments

Comments
 (0)