mirror of
https://github.com/krkn-chaos/krkn.git
synced 2026-08-25 09:27:36 +00:00
Functional & Unit Tests / Functional & Unit Tests (push) Failing after 1m28s
Functional & Unit Tests / Generate Coverage Badge (push) Has been skipped
Signed-off-by: Paige Patton <prubenda@redhat.com>
248 lines
12 KiB
YAML
248 lines
12 KiB
YAML
metrics:
|
|
|
|
# API server
|
|
- query: sum(apiserver_current_inflight_requests{}) by (request_kind) > 0
|
|
metricName: APIInflightRequests
|
|
instant: true
|
|
|
|
# Kubelet & CRI-O
|
|
|
|
# Average and max of the CPU usage from all worker's kubelet
|
|
- query: avg(avg_over_time(irate(process_cpu_seconds_total{service="kubelet",job="kubelet"}[2m])[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: cpu-kubelet
|
|
instant: true
|
|
|
|
- query: max(max_over_time(irate(process_cpu_seconds_total{service="kubelet",job="kubelet"}[2m])[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: max-cpu-kubelet
|
|
instant: true
|
|
|
|
# Average of the memory usage from all worker's kubelet
|
|
- query: avg(avg_over_time(process_resident_memory_bytes{service="kubelet",job="kubelet"}[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: memory-kubelet
|
|
instant: true
|
|
|
|
# Max of the memory usage from all worker's kubelet
|
|
- query: max(max_over_time(process_resident_memory_bytes{service="kubelet",job="kubelet"}[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: max-memory-kubelet
|
|
instant: true
|
|
|
|
- query: max_over_time(sum(process_resident_memory_bytes{service="kubelet",job="kubelet"} and on (node) kube_node_role{role="worker"})[.elapsed:])
|
|
metricName: max-memory-sum-kubelet
|
|
instant: true
|
|
|
|
# Average and max of the CPU usage from all worker's CRI-O
|
|
- query: avg(avg_over_time(irate(process_cpu_seconds_total{service="kubelet",job="crio"}[2m])[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: cpu-crio
|
|
instant: true
|
|
|
|
- query: max(max_over_time(irate(process_cpu_seconds_total{service="kubelet",job="crio"}[2m])[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: max-cpu-crio
|
|
instant: true
|
|
|
|
# Average of the memory usage from all worker's CRI-O
|
|
- query: avg(avg_over_time(process_resident_memory_bytes{service="kubelet",job="crio"}[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: memory-crio
|
|
instant: true
|
|
|
|
# Max of the memory usage from all worker's CRI-O
|
|
- query: max(max_over_time(process_resident_memory_bytes{service="kubelet",job="crio"}[.elapsed:]) and on (node) kube_node_role{role="worker"})
|
|
metricName: max-memory-crio
|
|
instant: true
|
|
|
|
# Etcd
|
|
|
|
- query: avg(avg_over_time(histogram_quantile(0.99, rate(etcd_disk_backend_commit_duration_seconds_bucket[2m]))[.elapsed:]))
|
|
metricName: 99thEtcdDiskBackendCommit
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(histogram_quantile(0.99, rate(etcd_disk_wal_fsync_duration_seconds_bucket[2m]))[.elapsed:]))
|
|
metricName: 99thEtcdDiskWalFsync
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(histogram_quantile(0.99, irate(etcd_network_peer_round_trip_time_seconds_bucket[2m]))[.elapsed:]))
|
|
metricName: 99thEtcdRoundTripTime
|
|
instant: true
|
|
|
|
# Control-plane
|
|
|
|
- query: avg(avg_over_time(topk(1, sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-kube-controller-manager"}[2m])) by (pod))[.elapsed:]))
|
|
metricName: cpu-kube-controller-manager
|
|
instant: true
|
|
|
|
- query: max(max_over_time(topk(1, sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-kube-controller-manager"}[2m])) by (pod))[.elapsed:]))
|
|
metricName: max-cpu-kube-controller-manager
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(1, sum(container_memory_rss{name!="", namespace="openshift-kube-controller-manager"}) by (pod))[.elapsed:]))
|
|
metricName: memory-kube-controller-manager
|
|
instant: true
|
|
|
|
- query: max(max_over_time(topk(1, sum(container_memory_rss{name!="", namespace="openshift-kube-controller-manager"}) by (pod))[.elapsed:]))
|
|
metricName: max-memory-kube-controller-manager
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(3, sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-kube-apiserver"}[2m])) by (pod))[.elapsed:]))
|
|
metricName: cpu-kube-apiserver
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(3, sum(container_memory_rss{name!="", namespace="openshift-kube-apiserver"}) by (pod))[.elapsed:]))
|
|
metricName: memory-kube-apiserver
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(3, sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-apiserver"}[2m])) by (pod))[.elapsed:]))
|
|
metricName: cpu-openshift-apiserver
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(3, sum(container_memory_rss{name!="", namespace="openshift-apiserver"}) by (pod))[.elapsed:]))
|
|
metricName: memory-openshift-apiserver
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(3, sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-etcd"}[2m])) by (pod))[.elapsed:]))
|
|
metricName: cpu-etcd
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(3,sum(container_memory_rss{name!="", namespace="openshift-etcd"}) by (pod))[.elapsed:]))
|
|
metricName: memory-etcd
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(1, sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-controller-manager"}[2m])) by (pod))[.elapsed:]))
|
|
metricName: cpu-openshift-controller-manager
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(topk(1, sum(container_memory_rss{name!="", namespace="openshift-controller-manager"}) by (pod))[.elapsed:]))
|
|
metricName: memory-openshift-controller-manager
|
|
instant: true
|
|
|
|
# multus
|
|
|
|
- query: avg(avg_over_time(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-multus", pod=~"(multus).+", container!="POD"}[2m])[.elapsed:])) by (container)
|
|
metricName: cpu-multus
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(container_memory_rss{name!="", namespace="openshift-multus", pod=~"(multus).+", container!="POD"}[.elapsed:])) by (container)
|
|
metricName: memory-multus
|
|
instant: true
|
|
|
|
# OVNKubernetes - standard & IC
|
|
|
|
- query: avg(avg_over_time(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-ovn-kubernetes", pod=~"(ovnkube-master|ovnkube-control-plane).+", container!="POD"}[2m])[.elapsed:])) by (container)
|
|
metricName: cpu-ovn-control-plane
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(container_memory_rss{name!="", namespace="openshift-ovn-kubernetes", pod=~"(ovnkube-master|ovnkube-control-plane).+", container!="POD"}[.elapsed:])) by (container)
|
|
metricName: memory-ovn-control-plane
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-ovn-kubernetes", pod=~"ovnkube-node.+", container!="POD"}[2m])[.elapsed:])) by (container)
|
|
metricName: cpu-ovnkube-node
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(container_memory_rss{name!="", namespace="openshift-ovn-kubernetes", pod=~"ovnkube-node.+", container!="POD"}[.elapsed:])) by (container)
|
|
metricName: memory-ovnkube-node
|
|
instant: true
|
|
|
|
# Nodes
|
|
|
|
- query: avg(avg_over_time(sum(irate(node_cpu_seconds_total{mode!="idle", mode!="steal"}[2m]) and on (instance) label_replace(kube_node_role{role="master"}, "instance", "$1", "node", "(.+)")) by (instance)[.elapsed:]))
|
|
metricName: cpu-masters
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time((node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes)[.elapsed:]) and on (instance) label_replace(kube_node_role{role="master"}, "instance", "$1", "node", "(.+)"))
|
|
metricName: memory-masters
|
|
instant: true
|
|
|
|
- query: max(max_over_time((node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes)[.elapsed:]) and on (instance) label_replace(kube_node_role{role="master"}, "instance", "$1", "node", "(.+)"))
|
|
metricName: max-memory-masters
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(sum(irate(node_cpu_seconds_total{mode!="idle", mode!="steal"}[2m]) and on (instance) label_replace(kube_node_role{role="worker"}, "instance", "$1", "node", "(.+)")) by (instance)[.elapsed:]))
|
|
metricName: cpu-workers
|
|
instant: true
|
|
|
|
- query: max(max_over_time(sum(irate(node_cpu_seconds_total{mode!="idle", mode!="steal"}[2m]) and on (instance) label_replace(kube_node_role{role="worker"}, "instance", "$1", "node", "(.+)")) by (instance)[.elapsed:]))
|
|
metricName: max-cpu-workers
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time((node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes)[.elapsed:]) and on (instance) label_replace(kube_node_role{role="worker"}, "instance", "$1", "node", "(.+)"))
|
|
metricName: memory-workers
|
|
instant: true
|
|
|
|
- query: max(max_over_time((node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes)[.elapsed:]) and on (instance) label_replace(kube_node_role{role="worker"}, "instance", "$1", "node", "(.+)"))
|
|
metricName: max-memory-workers
|
|
instant: true
|
|
|
|
- query: sum( (node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes) and on (instance) label_replace(kube_node_role{role="worker"}, "instance", "$1", "node", "(.+)") )
|
|
metricName: memory-sum-workers
|
|
instant: true
|
|
|
|
|
|
- query: avg(avg_over_time(sum(irate(node_cpu_seconds_total{mode!="idle", mode!="steal"}[2m]) and on (instance) label_replace(kube_node_role{role="infra"}, "instance", "$1", "node", "(.+)")) by (instance)[.elapsed:]))
|
|
metricName: cpu-infra
|
|
instant: true
|
|
|
|
- query: max(max_over_time(sum(irate(node_cpu_seconds_total{mode!="idle", mode!="steal"}[2m]) and on (instance) label_replace(kube_node_role{role="infra"}, "instance", "$1", "node", "(.+)")) by (instance)[.elapsed:]))
|
|
metricName: max-cpu-infra
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time((node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes)[.elapsed:]) and on (instance) label_replace(kube_node_role{role="infra"}, "instance", "$1", "node", "(.+)"))
|
|
metricName: memory-infra
|
|
instant: true
|
|
|
|
- query: max(max_over_time((node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes)[.elapsed:]) and on (instance) label_replace(kube_node_role{role="infra"}, "instance", "$1", "node", "(.+)"))
|
|
metricName: max-memory-infra
|
|
instant: true
|
|
|
|
- query: max_over_time(sum((node_memory_MemTotal_bytes - node_memory_MemAvailable_bytes) and on (instance) label_replace(kube_node_role{role="infra"}, "instance", "$1", "node", "(.+)"))[.elapsed:])
|
|
metricName: max-memory-sum-infra
|
|
instant: true
|
|
|
|
# Monitoring and ingress
|
|
|
|
- query: avg(avg_over_time(sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-monitoring", pod=~"prometheus-k8s.+"}[2m])) by (pod)[.elapsed:]))
|
|
metricName: cpu-prometheus
|
|
instant: true
|
|
|
|
- query: max(max_over_time(sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-monitoring", pod=~"prometheus-k8s.+"}[2m])) by (pod)[.elapsed:]))
|
|
metricName: max-cpu-prometheus
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(sum(container_memory_rss{name!="", namespace="openshift-monitoring", pod=~"prometheus-k8s.+"}) by (pod)[.elapsed:]))
|
|
metricName: memory-prometheus
|
|
instant: true
|
|
|
|
- query: max(max_over_time(sum(container_memory_rss{name!="", namespace="openshift-monitoring", pod=~"prometheus-k8s.+"}) by (pod)[.elapsed:]))
|
|
metricName: max-memory-prometheus
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(sum(irate(container_cpu_usage_seconds_total{name!="", namespace="openshift-ingress", pod=~"router-default.+"}[2m])) by (pod)[.elapsed:]))
|
|
metricName: cpu-router
|
|
instant: true
|
|
|
|
- query: avg(avg_over_time(sum(container_memory_rss{name!="", namespace="openshift-ingress", pod=~"router-default.+"}) by (pod)[.elapsed:]))
|
|
metricName: memory-router
|
|
instant: true
|
|
|
|
# Cluster
|
|
|
|
- query: avg_over_time(cluster:memory_usage:ratio[.elapsed:])
|
|
metricName: memory-cluster-usage-ratio
|
|
instant: true
|
|
|
|
- query: avg_over_time(cluster:node_cpu:ratio[.elapsed:])
|
|
metricName: cpu-cluster-usage-ratio
|
|
instant: true
|
|
|
|
# Retain the raw CPU seconds totals for comparison
|
|
- query: sum(node_cpu_seconds_total and on (instance) label_replace(kube_node_role{role="worker",role!="infra"}, "instance", "$1", "node", "(.+)")) by (mode)
|
|
metricName: nodeCPUSeconds-Workers
|
|
instant: true
|
|
|
|
|
|
- query: sum(node_cpu_seconds_total and on (instance) label_replace(kube_node_role{role="master"}, "instance", "$1", "node", "(.+)")) by (mode)
|
|
metricName: nodeCPUSeconds-Masters
|
|
instant: true
|
|
|
|
|
|
- query: sum(node_cpu_seconds_total and on (instance) label_replace(kube_node_role{role="infra"}, "instance", "$1", "node", "(.+)")) by (mode)
|
|
metricName: nodeCPUSeconds-Infra
|
|
instant: true |