Skip to content
Draft
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
63 changes: 7 additions & 56 deletions rhobs/alerting/data_plane/prometheus.release_service_alerts.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -10,61 +10,12 @@ spec:
interval: 1m

rules:
# record rules for `ReleaseServicePreProcessingDurationSeconds`
- record: rate_of_release_pre_processing_duration_seconds_shorter_than_10s_per_10m
expr: sum by (job,source_cluster) (rate(release_pre_processing_duration_seconds_bucket{le="10.0"}[10m]))

# preprocessing for more than 60 seconds
- record: rate_of_release_pre_processing_duration_seconds_shorter_than_60s_per_10m
expr: sum by (job,source_cluster) (rate(release_pre_processing_duration_seconds_bucket{le="60.0"}[10m]))

- record: rate_of_release_pre_processing_duration_seconds_counter_per_10m
expr: sum by (job,source_cluster) (rate(release_pre_processing_duration_seconds_count[10m]) > 0)

# record rules for `ReleaseServiceValidationDurationSeconds`
- record: rate_of_release_validation_duration_seconds_shorter_than_5s_per_10m
expr: sum by (job,source_cluster) (rate(release_validation_duration_seconds_bucket{le="5.0"}[10m]))

- record: rate_of_release_validation_duration_seconds_counter_per_10m
expr: sum by (job,source_cluster) (rate(release_validation_duration_seconds_count[10m]) > 0)

- alert: ReleaseServiceValidationDurationSeconds
expr: |
(
rate_of_release_validation_duration_seconds_shorter_than_5s_per_10m / rate_of_release_validation_duration_seconds_counter_per_10m
) < 0.90
for: 15m
labels:
severity: high
slo: "false"
component: release-service
annotations:
summary: >-
90% of Releases must be validated under 5 seconds
description: >-
Release service is failing to run the validations under 5 seconds for 90% of releases
alert_routing_key: release-service
runbook_url: https://gitlab.cee.redhat.com/konflux/docs/sop/-/blob/main/release-service/release-validation-latency.md?ref_type=heads
team: release

- alert: ReleaseServicePreProcessingDurationSeconds
expr: |
(
rate_of_release_pre_processing_duration_seconds_shorter_than_60s_per_10m / rate_of_release_pre_processing_duration_seconds_counter_per_10m
) < 0.90
for: 15m
labels:
severity: high
slo: "false"
component: release-service
annotations:
summary: >-
90% of Releases must start processing under 10 seconds
description: >-
Release service is failing to start processing under 10 seconds for 90% of releases
alert_routing_key: release-service
runbook_url: https://gitlab.cee.redhat.com/konflux/docs/sop/-/blob/main/release-service/release-processing-latency.md?ref_type=heads
team: release
# RELEASE-2373: ValidationDurationSeconds and PreProcessingDurationSeconds
# alerts (and their recording rules) were removed. They were early-dev
# latency SLOs that flapped, often self-healed, and did not reflect
# actionable controller health. Metrics remain on the operator for
# dashboards. Formal app-interface SLO entries should be updated in a
# follow-up.

- alert: ReleaseServiceControllerManagerPodNotReady
expr: |
Expand Down Expand Up @@ -94,7 +45,7 @@ spec:
slo: "true"
component: release-service
annotations:
html_url: https://github.com/redhat-appstudio/o11y/blob/main/rhobs/alerting/data_plane/prometheus.release_service_alerts.yaml#L85
html_url: https://github.com/redhat-appstudio/o11y/blob/main/rhobs/alerting/data_plane/prometheus.release_service_alerts.yaml#L36
summary: >-
Release Service Controller Manager pod is down in cluster {{ $labels.source_cluster }}
description: >
Expand Down
62 changes: 1 addition & 61 deletions test/promql/tests/data_plane/release_service_test.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -4,66 +4,6 @@ rule_files:
evaluation_interval: 1m

tests:
- name: ReleaseServiceAlertOnPreProcessingSLOFailure
interval: 1m
input_series:
- series: 'release_pre_processing_duration_seconds_bucket{le="60.0", job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+8x59'
- series: 'release_pre_processing_duration_seconds_count{job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+9x59'
- series: 'release_pre_processing_duration_seconds_bucket{le="60.0", job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+8x59'
- series: 'release_pre_processing_duration_seconds_count{job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+9x59'
alert_rule_test:
- eval_time: 1h
alertname: ReleaseServicePreProcessingDurationSeconds
exp_alerts:
- exp_labels:
severity: high
slo: "false"
job: "release"
source_cluster: "cluster01"
component: release-service
exp_annotations:
summary: >-
90% of Releases must start processing under 10 seconds
description: >-
Release service is failing to start processing under 10 seconds for 90% of releases
alert_routing_key: release-service
runbook_url: https://gitlab.cee.redhat.com/konflux/docs/sop/-/blob/main/release-service/release-processing-latency.md?ref_type=heads
team: release

- name: ReleaseServiceAlertOnValidationSLOFailure
interval: 1m
input_series:
- series: 'release_validation_duration_seconds_bucket{le="5.0", job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+8x59'
- series: 'release_validation_duration_seconds_count{job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+9x59'
- series: 'release_validation_duration_seconds_bucket{le="5.0", job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+8x59'
- series: 'release_validation_duration_seconds_count{job="release", namespace="foo", source_cluster="cluster01"}'
values: '1+9x59'
alert_rule_test:
- eval_time: 1h
alertname: ReleaseServiceValidationDurationSeconds
exp_alerts:
- exp_labels:
severity: high
slo: "false"
job: "release"
source_cluster: "cluster01"
component: release-service
exp_annotations:
summary: >-
90% of Releases must be validated under 5 seconds
description: >-
Release service is failing to run the validations under 5 seconds for 90% of releases
alert_routing_key: release-service
runbook_url: https://gitlab.cee.redhat.com/konflux/docs/sop/-/blob/main/release-service/release-validation-latency.md?ref_type=heads
team: release

- name: ReleaseServiceControllerManagerOnPodNotReadyStonePrdRh01
interval: 1m
input_series:
Expand Down Expand Up @@ -143,7 +83,7 @@ tests:
source_cluster: c1
component: release-service
exp_annotations:
html_url: https://github.com/redhat-appstudio/o11y/blob/main/rhobs/alerting/data_plane/prometheus.release_service_alerts.yaml#L85
html_url: https://github.com/redhat-appstudio/o11y/blob/main/rhobs/alerting/data_plane/prometheus.release_service_alerts.yaml#L36
summary: Release Service Controller Manager pod is down in cluster c1
description: >
Release Service Controller Manager pod has been down for 10 minutes in cluster c1
Expand Down
Loading