@intentius/chant-lexicon-k8s 0.98.0 → 0.99.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -0,0 +1,425 @@
1
+ apiVersion: monitoring.coreos.com/v1
2
+ kind: PrometheusRule
3
+ metadata:
4
+ labels:
5
+ app.kubernetes.io/component: exporter
6
+ app.kubernetes.io/name: node-exporter
7
+ app.kubernetes.io/part-of: kube-prometheus
8
+ app.kubernetes.io/version: 1.12.1
9
+ prometheus: k8s
10
+ role: alert-rules
11
+ name: node-exporter-rules
12
+ namespace: monitoring
13
+ spec:
14
+ groups:
15
+ - name: node-exporter
16
+ rules:
17
+ - alert: NodeFilesystemSpaceFillingUp
18
+ annotations:
19
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available space left and is filling up.
20
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemspacefillingup
21
+ summary: Filesystem is predicted to run out of space within the next 24 hours.
22
+ expr: |
23
+ (
24
+ node_filesystem_avail_bytes{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_size_bytes{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 15
25
+ and
26
+ predict_linear(node_filesystem_avail_bytes{job="node-exporter",fstype!="",mountpoint!=""}[6h], 24*60*60) < 0
27
+ and
28
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
29
+ )
30
+ for: 1h
31
+ labels:
32
+ severity: warning
33
+ - alert: NodeFilesystemSpaceFillingUp
34
+ annotations:
35
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available space left and is filling up fast.
36
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemspacefillingup
37
+ summary: Filesystem is predicted to run out of space within the next 4 hours.
38
+ expr: |
39
+ (
40
+ node_filesystem_avail_bytes{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_size_bytes{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 10
41
+ and
42
+ predict_linear(node_filesystem_avail_bytes{job="node-exporter",fstype!="",mountpoint!=""}[6h], 4*60*60) < 0
43
+ and
44
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
45
+ )
46
+ for: 1h
47
+ labels:
48
+ severity: critical
49
+ - alert: NodeFilesystemAlmostOutOfSpace
50
+ annotations:
51
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available space left.
52
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemalmostoutofspace
53
+ summary: Filesystem has less than 5% space left.
54
+ expr: |
55
+ (
56
+ node_filesystem_avail_bytes{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_size_bytes{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 5
57
+ and
58
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
59
+ )
60
+ for: 30m
61
+ labels:
62
+ severity: warning
63
+ - alert: NodeFilesystemAlmostOutOfSpace
64
+ annotations:
65
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available space left.
66
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemalmostoutofspace
67
+ summary: Filesystem has less than 3% space left.
68
+ expr: |
69
+ (
70
+ node_filesystem_avail_bytes{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_size_bytes{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 3
71
+ and
72
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
73
+ )
74
+ for: 30m
75
+ labels:
76
+ severity: critical
77
+ - alert: NodeFilesystemFilesFillingUp
78
+ annotations:
79
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available inodes left and is filling up.
80
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemfilesfillingup
81
+ summary: Filesystem is predicted to run out of inodes within the next 24 hours.
82
+ expr: |
83
+ (
84
+ node_filesystem_files_free{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_files{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 40
85
+ and
86
+ predict_linear(node_filesystem_files_free{job="node-exporter",fstype!="",mountpoint!=""}[6h], 24*60*60) < 0
87
+ and
88
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
89
+ )
90
+ for: 1h
91
+ labels:
92
+ severity: warning
93
+ - alert: NodeFilesystemFilesFillingUp
94
+ annotations:
95
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available inodes left and is filling up fast.
96
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemfilesfillingup
97
+ summary: Filesystem is predicted to run out of inodes within the next 4 hours.
98
+ expr: |
99
+ (
100
+ node_filesystem_files_free{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_files{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 20
101
+ and
102
+ predict_linear(node_filesystem_files_free{job="node-exporter",fstype!="",mountpoint!=""}[6h], 4*60*60) < 0
103
+ and
104
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
105
+ )
106
+ for: 1h
107
+ labels:
108
+ severity: critical
109
+ - alert: NodeFilesystemAlmostOutOfFiles
110
+ annotations:
111
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available inodes left.
112
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemalmostoutoffiles
113
+ summary: Filesystem has less than 5% inodes left.
114
+ expr: |
115
+ (
116
+ node_filesystem_files_free{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_files{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 5
117
+ and
118
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
119
+ )
120
+ for: 1h
121
+ labels:
122
+ severity: warning
123
+ - alert: NodeFilesystemAlmostOutOfFiles
124
+ annotations:
125
+ description: Filesystem on {{ $labels.device }}, mounted on {{ $labels.mountpoint }}, at {{ $labels.instance }} has only {{ printf "%.2f" $value }}% available inodes left.
126
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefilesystemalmostoutoffiles
127
+ summary: Filesystem has less than 3% inodes left.
128
+ expr: |
129
+ (
130
+ node_filesystem_files_free{job="node-exporter",fstype!="",mountpoint!=""} / node_filesystem_files{job="node-exporter",fstype!="",mountpoint!=""} * 100 < 3
131
+ and
132
+ node_filesystem_readonly{job="node-exporter",fstype!="",mountpoint!=""} == 0
133
+ )
134
+ for: 1h
135
+ labels:
136
+ severity: critical
137
+ - alert: NodeNetworkReceiveErrs
138
+ annotations:
139
+ description: '{{ $labels.instance }} interface {{ $labels.device }} has encountered {{ printf "%.0f" $value }} receive errors in the last two minutes.'
140
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodenetworkreceiveerrs
141
+ summary: Network interface is reporting many receive errors.
142
+ expr: |
143
+ rate(node_network_receive_errs_total{job="node-exporter"}[2m]) / rate(node_network_receive_packets_total{job="node-exporter"}[2m]) > 0.01
144
+ for: 1h
145
+ labels:
146
+ severity: warning
147
+ - alert: NodeNetworkTransmitErrs
148
+ annotations:
149
+ description: '{{ $labels.instance }} interface {{ $labels.device }} has encountered {{ printf "%.0f" $value }} transmit errors in the last two minutes.'
150
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodenetworktransmiterrs
151
+ summary: Network interface is reporting many transmit errors.
152
+ expr: |
153
+ rate(node_network_transmit_errs_total{job="node-exporter"}[2m]) / rate(node_network_transmit_packets_total{job="node-exporter"}[2m]) > 0.01
154
+ for: 1h
155
+ labels:
156
+ severity: warning
157
+ - alert: NodeHighNumberConntrackEntriesUsed
158
+ annotations:
159
+ description: '{{ $labels.instance }} {{ $value | humanizePercentage }} of conntrack entries are used.'
160
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodehighnumberconntrackentriesused
161
+ summary: Number of conntrack are getting close to the limit.
162
+ expr: |
163
+ (node_nf_conntrack_entries{job="node-exporter"} / node_nf_conntrack_entries_limit) > 0.75
164
+ labels:
165
+ severity: warning
166
+ - alert: NodeTextFileCollectorScrapeError
167
+ annotations:
168
+ description: Node Exporter text file collector on {{ $labels.instance }} failed to scrape.
169
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodetextfilecollectorscrapeerror
170
+ summary: Node Exporter text file collector failed to scrape.
171
+ expr: |
172
+ node_textfile_scrape_error{job="node-exporter"} == 1
173
+ labels:
174
+ severity: warning
175
+ - alert: NodeClockSkewDetected
176
+ annotations:
177
+ description: Clock at {{ $labels.instance }} is out of sync by more than 0.05s. Ensure NTP is configured correctly on this host.
178
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodeclockskewdetected
179
+ summary: Clock skew detected.
180
+ expr: |
181
+ (
182
+ node_timex_offset_seconds{job="node-exporter"} > 0.05
183
+ and
184
+ deriv(node_timex_offset_seconds{job="node-exporter"}[5m]) >= 0
185
+ )
186
+ or
187
+ (
188
+ node_timex_offset_seconds{job="node-exporter"} < -0.05
189
+ and
190
+ deriv(node_timex_offset_seconds{job="node-exporter"}[5m]) <= 0
191
+ )
192
+ for: 10m
193
+ labels:
194
+ severity: warning
195
+ - alert: NodeClockNotSynchronising
196
+ annotations:
197
+ description: Clock at {{ $labels.instance }} is not synchronising. Ensure NTP is configured on this host.
198
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodeclocknotsynchronising
199
+ summary: Clock not synchronising.
200
+ expr: |
201
+ min_over_time(node_timex_sync_status{job="node-exporter"}[5m]) == 0
202
+ and
203
+ node_timex_maxerror_seconds{job="node-exporter"} >= 16
204
+ for: 10m
205
+ labels:
206
+ severity: warning
207
+ - alert: NodeRAIDDegraded
208
+ annotations:
209
+ description: RAID array '{{ $labels.device }}' at {{ $labels.instance }} is in degraded state due to one or more disks failures. Number of spare drives is insufficient to fix issue automatically.
210
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/noderaiddegraded
211
+ summary: RAID Array is degraded.
212
+ expr: |
213
+ node_md_disks_required{job="node-exporter",device=~"(/dev/)?(mmcblk.p.+|nvme.+|rbd.+|sd.+|vd.+|xvd.+|dm-.+|md.+|dasd.+)"} - ignoring (state) (node_md_disks{state="active",job="node-exporter",device=~"(/dev/)?(mmcblk.p.+|nvme.+|rbd.+|sd.+|vd.+|xvd.+|dm-.+|md.+|dasd.+)"}) > 0
214
+ for: 15m
215
+ labels:
216
+ severity: critical
217
+ - alert: NodeRAIDDiskFailure
218
+ annotations:
219
+ description: At least one device in RAID array at {{ $labels.instance }} failed. Array '{{ $labels.device }}' needs attention and possibly a disk swap.
220
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/noderaiddiskfailure
221
+ summary: Failed device in RAID array.
222
+ expr: |
223
+ node_md_disks{state="failed",job="node-exporter",device=~"(/dev/)?(mmcblk.p.+|nvme.+|rbd.+|sd.+|vd.+|xvd.+|dm-.+|md.+|dasd.+)"} > 0
224
+ labels:
225
+ severity: warning
226
+ - alert: NodeFileDescriptorLimit
227
+ annotations:
228
+ description: File descriptors limit at {{ $labels.instance }} is currently at {{ printf "%.2f" $value }}%.
229
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefiledescriptorlimit
230
+ summary: Kernel is predicted to exhaust file descriptors limit soon.
231
+ expr: |
232
+ (
233
+ node_filefd_allocated{job="node-exporter"} * 100 / node_filefd_maximum{job="node-exporter"} > 70
234
+ )
235
+ for: 15m
236
+ labels:
237
+ severity: warning
238
+ - alert: NodeFileDescriptorLimit
239
+ annotations:
240
+ description: File descriptors limit at {{ $labels.instance }} is currently at {{ printf "%.2f" $value }}%.
241
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodefiledescriptorlimit
242
+ summary: Kernel is predicted to exhaust file descriptors limit soon.
243
+ expr: |
244
+ (
245
+ node_filefd_allocated{job="node-exporter"} * 100 / node_filefd_maximum{job="node-exporter"} > 90
246
+ )
247
+ for: 15m
248
+ labels:
249
+ severity: critical
250
+ - alert: NodeCPUHighUsage
251
+ annotations:
252
+ description: |
253
+ CPU usage at {{ $labels.instance }} has been above 90% for the last 15 minutes, is currently at {{ printf "%.2f" $value }}%.
254
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodecpuhighusage
255
+ summary: High CPU usage.
256
+ expr: |
257
+ sum without(mode) (avg without (cpu) (rate(node_cpu_seconds_total{job="node-exporter", mode!~"idle|iowait"}[2m]))) * 100 > 90
258
+ for: 15m
259
+ labels:
260
+ severity: info
261
+ - alert: NodeSystemSaturation
262
+ annotations:
263
+ description: |
264
+ System load per core at {{ $labels.instance }} has been above 2 for the last 15 minutes, is currently at {{ printf "%.2f" $value }}.
265
+ This might indicate this instance resources saturation and can cause it becoming unresponsive.
266
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodesystemsaturation
267
+ summary: System saturated, load per core is very high.
268
+ expr: |
269
+ node_load1{job="node-exporter"}
270
+ / count without (cpu, mode) (node_cpu_seconds_total{job="node-exporter", mode="idle"}) > 2
271
+ for: 15m
272
+ labels:
273
+ severity: warning
274
+ - alert: NodeMemoryMajorPagesFaults
275
+ annotations:
276
+ description: |
277
+ Memory major pages are occurring at very high rate at {{ $labels.instance }}, 500 major page faults per second for the last 15 minutes, is currently at {{ printf "%.2f" $value }}.
278
+ Please check that there is enough memory available at this instance.
279
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodememorymajorpagesfaults
280
+ summary: Memory major page faults are occurring at very high rate.
281
+ expr: |
282
+ rate(node_vmstat_pgmajfault{job="node-exporter"}[5m]) > 500
283
+ for: 15m
284
+ labels:
285
+ severity: warning
286
+ - alert: NodeMemoryHighUtilization
287
+ annotations:
288
+ description: |
289
+ Memory is filling up at {{ $labels.instance }}, has been above 90% for the last 15 minutes, is currently at {{ printf "%.2f" $value }}%.
290
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodememoryhighutilization
291
+ summary: Host is running out of memory.
292
+ expr: |
293
+ 100 - (node_memory_MemAvailable_bytes{job="node-exporter"} / node_memory_MemTotal_bytes{job="node-exporter"} * 100) > 90
294
+ for: 15m
295
+ labels:
296
+ severity: warning
297
+ - alert: NodeDiskIOSaturation
298
+ annotations:
299
+ description: |
300
+ Disk IO queue (aqu-sq) is high on {{ $labels.device }} at {{ $labels.instance }}, has been above 10 for the last 30 minutes, is currently at {{ printf "%.2f" $value }}.
301
+ This symptom might indicate disk saturation.
302
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodediskiosaturation
303
+ summary: Disk IO queue is high.
304
+ expr: |
305
+ rate(node_disk_io_time_weighted_seconds_total{job="node-exporter", device=~"(/dev/)?(mmcblk.p.+|nvme.+|rbd.+|sd.+|vd.+|xvd.+|dm-.+|md.+|dasd.+)"}[5m]) > 10
306
+ for: 30m
307
+ labels:
308
+ severity: warning
309
+ - alert: NodeSystemdServiceFailed
310
+ annotations:
311
+ description: Systemd service {{ $labels.name }} has entered failed state at {{ $labels.instance }}
312
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodesystemdservicefailed
313
+ summary: Systemd service has entered failed state.
314
+ expr: |
315
+ node_systemd_unit_state{job="node-exporter", state="failed"} == 1
316
+ for: 5m
317
+ labels:
318
+ severity: warning
319
+ - alert: NodeSystemdServiceCrashlooping
320
+ annotations:
321
+ description: Systemd service {{ $labels.name }} has being restarted too many times at {{ $labels.instance }} for the last 15 minutes. Please check if service is crash looping.
322
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodesystemdservicecrashlooping
323
+ summary: Systemd service keeps restaring, possibly crash looping.
324
+ expr: |
325
+ increase(node_systemd_service_restart_total{job="node-exporter"}[5m]) > 2
326
+ for: 15m
327
+ labels:
328
+ severity: warning
329
+ - alert: NodeBondingDegraded
330
+ annotations:
331
+ description: Bonding interface {{ $labels.master }} on {{ $labels.instance }} is in degraded state due to one or more slave failures.
332
+ runbook_url: https://runbooks.prometheus-operator.dev/runbooks/node/nodebondingdegraded
333
+ summary: Bonding interface is degraded.
334
+ expr: |
335
+ (node_bonding_slaves{job="node-exporter"} - node_bonding_active{job="node-exporter"}) != 0
336
+ for: 5m
337
+ labels:
338
+ severity: warning
339
+ - name: node-exporter.rules
340
+ rules:
341
+ - expr: |
342
+ count without (cpu, mode) (
343
+ node_cpu_seconds_total{job="node-exporter",mode="idle"}
344
+ )
345
+ record: instance:node_num_cpu:sum
346
+ - expr: |
347
+ 1 - avg without (cpu) (
348
+ sum without (mode) (rate(node_cpu_seconds_total{job="node-exporter", mode=~"idle|iowait|steal"}[5m]))
349
+ )
350
+ record: instance:node_cpu_utilisation:rate5m
351
+ - expr: |
352
+ (
353
+ node_load1{job="node-exporter"}
354
+ /
355
+ instance:node_num_cpu:sum{job="node-exporter"}
356
+ )
357
+ record: instance:node_load1_per_cpu:ratio
358
+ - expr: |
359
+ 1 - (
360
+ (
361
+ node_memory_MemAvailable_bytes{job="node-exporter"}
362
+ or
363
+ (
364
+ node_memory_Buffers_bytes{job="node-exporter"}
365
+ +
366
+ node_memory_Cached_bytes{job="node-exporter"}
367
+ +
368
+ node_memory_MemFree_bytes{job="node-exporter"}
369
+ +
370
+ node_memory_Slab_bytes{job="node-exporter"}
371
+ )
372
+ )
373
+ /
374
+ node_memory_MemTotal_bytes{job="node-exporter"}
375
+ )
376
+ record: instance:node_memory_utilisation:ratio
377
+ - expr: |
378
+ rate(node_vmstat_pgmajfault{job="node-exporter"}[5m])
379
+ record: instance:node_vmstat_pgmajfault:rate5m
380
+ - expr: |
381
+ rate(node_disk_io_time_seconds_total{job="node-exporter", device=~"(/dev/)?(mmcblk.p.+|nvme.+|rbd.+|sd.+|vd.+|xvd.+|dm-.+|md.+|dasd.+)"}[5m])
382
+ record: instance_device:node_disk_io_time_seconds:rate5m
383
+ - expr: |
384
+ rate(node_disk_io_time_weighted_seconds_total{job="node-exporter", device=~"(/dev/)?(mmcblk.p.+|nvme.+|rbd.+|sd.+|vd.+|xvd.+|dm-.+|md.+|dasd.+)"}[5m])
385
+ record: instance_device:node_disk_io_time_weighted_seconds:rate5m
386
+ - expr: |
387
+ sum without (device) (
388
+ rate(node_network_receive_bytes_total{job="node-exporter", device!="lo"}[5m])
389
+ )
390
+ record: instance:node_network_receive_bytes_excluding_lo:rate5m
391
+ - expr: |
392
+ sum without (device) (
393
+ rate(node_network_transmit_bytes_total{job="node-exporter", device!="lo"}[5m])
394
+ )
395
+ record: instance:node_network_transmit_bytes_excluding_lo:rate5m
396
+ - expr: |
397
+ sum without (device) (
398
+ rate(node_network_receive_drop_total{job="node-exporter", device!="lo"}[5m])
399
+ )
400
+ record: instance:node_network_receive_drop_excluding_lo:rate5m
401
+ - expr: |
402
+ sum without (device) (
403
+ rate(node_network_transmit_drop_total{job="node-exporter", device!="lo"}[5m])
404
+ )
405
+ record: instance:node_network_transmit_drop_excluding_lo:rate5m
406
+ - expr: |
407
+ sum without (device) (
408
+ rate(node_network_receive_bytes_total{job="node-exporter", device!~"lo|veth.+"}[5m])
409
+ )
410
+ record: instance:node_network_receive_bytes_physical:rate5m
411
+ - expr: |
412
+ sum without (device) (
413
+ rate(node_network_transmit_bytes_total{job="node-exporter", device!~"lo|veth.+"}[5m])
414
+ )
415
+ record: instance:node_network_transmit_bytes_physical:rate5m
416
+ - expr: |
417
+ sum without (device) (
418
+ rate(node_network_receive_drop_total{job="node-exporter", device!~"lo|veth.+"}[5m])
419
+ )
420
+ record: instance:node_network_receive_drop_physical:rate5m
421
+ - expr: |
422
+ sum without (device) (
423
+ rate(node_network_transmit_drop_total{job="node-exporter", device!~"lo|veth.+"}[5m])
424
+ )
425
+ record: instance:node_network_transmit_drop_physical:rate5m
@@ -0,0 +1,225 @@
1
+ ---
2
+ # Source: opentelemetry-collector/templates/configmap-agent.yaml
3
+ apiVersion: v1
4
+ kind: ConfigMap
5
+ metadata:
6
+ name: example-opentelemetry-collector-agent
7
+ namespace: default
8
+ labels:
9
+ helm.sh/chart: opentelemetry-collector-0.173.1
10
+ app.kubernetes.io/name: opentelemetry-collector
11
+ app.kubernetes.io/instance: example
12
+ app.kubernetes.io/version: "0.160.0"
13
+ app.kubernetes.io/managed-by: Helm
14
+ app.kubernetes.io/part-of: opentelemetry-collector
15
+ app.kubernetes.io/component: agent-collector
16
+ data:
17
+ relay: |
18
+ exporters:
19
+ debug: {}
20
+ extensions:
21
+ health_check:
22
+ endpoint: ${env:MY_POD_IP}:13133
23
+ processors:
24
+ batch: {}
25
+ memory_limiter:
26
+ check_interval: 5s
27
+ limit_percentage: 80
28
+ spike_limit_percentage: 25
29
+ receivers:
30
+ jaeger:
31
+ protocols:
32
+ grpc:
33
+ endpoint: ${env:MY_POD_IP}:14250
34
+ thrift_compact:
35
+ endpoint: ${env:MY_POD_IP}:6831
36
+ thrift_http:
37
+ endpoint: ${env:MY_POD_IP}:14268
38
+ otlp:
39
+ protocols:
40
+ grpc:
41
+ endpoint: ${env:MY_POD_IP}:4317
42
+ http:
43
+ endpoint: ${env:MY_POD_IP}:4318
44
+ prometheus:
45
+ config:
46
+ scrape_configs:
47
+ - job_name: opentelemetry-collector
48
+ scrape_interval: 10s
49
+ static_configs:
50
+ - targets:
51
+ - ${env:MY_POD_IP}:8888
52
+ zipkin:
53
+ endpoint: ${env:MY_POD_IP}:9411
54
+ service:
55
+ extensions:
56
+ - health_check
57
+ pipelines:
58
+ logs:
59
+ exporters:
60
+ - debug
61
+ processors:
62
+ - memory_limiter
63
+ - batch
64
+ receivers:
65
+ - otlp
66
+ metrics:
67
+ exporters:
68
+ - debug
69
+ processors:
70
+ - memory_limiter
71
+ - batch
72
+ receivers:
73
+ - otlp
74
+ - prometheus
75
+ traces:
76
+ exporters:
77
+ - debug
78
+ processors:
79
+ - memory_limiter
80
+ - batch
81
+ receivers:
82
+ - otlp
83
+ - jaeger
84
+ - zipkin
85
+ telemetry:
86
+ metrics:
87
+ readers:
88
+ - pull:
89
+ exporter:
90
+ prometheus:
91
+ host: ${env:MY_POD_IP}
92
+ port: 8888
93
+ resource:
94
+ host.name: ${env:OTEL_K8S_NODE_NAME}
95
+ k8s.namespace.name: ${env:OTEL_K8S_NAMESPACE}
96
+ k8s.node.ip: ${env:OTEL_K8S_NODE_IP}
97
+ k8s.node.name: ${env:OTEL_K8S_NODE_NAME}
98
+ k8s.pod.ip: ${env:OTEL_K8S_POD_IP}
99
+ k8s.pod.name: ${env:OTEL_K8S_POD_NAME}
100
+ ---
101
+ # Source: opentelemetry-collector/templates/daemonset.yaml
102
+ apiVersion: apps/v1
103
+ kind: DaemonSet
104
+ metadata:
105
+ name: example-opentelemetry-collector-agent
106
+ namespace: default
107
+ labels:
108
+ helm.sh/chart: opentelemetry-collector-0.173.1
109
+ app.kubernetes.io/name: opentelemetry-collector
110
+ app.kubernetes.io/instance: example
111
+ app.kubernetes.io/version: "0.160.0"
112
+ app.kubernetes.io/managed-by: Helm
113
+ app.kubernetes.io/part-of: opentelemetry-collector
114
+ app.kubernetes.io/component: agent-collector
115
+ spec:
116
+ revisionHistoryLimit: 10
117
+ selector:
118
+ matchLabels:
119
+ app.kubernetes.io/name: opentelemetry-collector
120
+ app.kubernetes.io/instance: example
121
+ component: agent-collector
122
+ updateStrategy:
123
+ type: RollingUpdate
124
+ template:
125
+ metadata:
126
+ annotations:
127
+ checksum/config: e4ff59dfcded1b562c6b8ef93fad7a7c6954b8d279b8599f87252ae1caa773e2
128
+
129
+ labels:
130
+ app.kubernetes.io/name: opentelemetry-collector
131
+ app.kubernetes.io/instance: example
132
+ component: agent-collector
133
+
134
+ spec:
135
+
136
+ serviceAccountName: example-opentelemetry-collector
137
+ automountServiceAccountToken: true
138
+ securityContext:
139
+ {}
140
+ containers:
141
+ - name: opentelemetry-collector
142
+ command:
143
+ - /otelcol-k8s
144
+ args:
145
+ - --config=/conf/relay.yaml
146
+ securityContext:
147
+ {}
148
+ image: "ghcr.io/open-telemetry/opentelemetry-collector-releases/opentelemetry-collector-k8s:0.160.0"
149
+ imagePullPolicy: IfNotPresent
150
+ ports:
151
+
152
+ - name: jaeger-compact
153
+ containerPort: 6831
154
+ protocol: UDP
155
+ hostPort: 6831
156
+ - name: jaeger-grpc
157
+ containerPort: 14250
158
+ protocol: TCP
159
+ hostPort: 14250
160
+ - name: jaeger-thrift
161
+ containerPort: 14268
162
+ protocol: TCP
163
+ hostPort: 14268
164
+ - name: otlp
165
+ containerPort: 4317
166
+ protocol: TCP
167
+ hostPort: 4317
168
+ - name: otlp-http
169
+ containerPort: 4318
170
+ protocol: TCP
171
+ hostPort: 4318
172
+ - name: zipkin
173
+ containerPort: 9411
174
+ protocol: TCP
175
+ hostPort: 9411
176
+ env:
177
+ - name: MY_POD_IP
178
+ valueFrom:
179
+ fieldRef:
180
+ apiVersion: v1
181
+ fieldPath: status.podIP
182
+ - name: OTEL_K8S_NODE_NAME
183
+ valueFrom:
184
+ fieldRef:
185
+ fieldPath: spec.nodeName
186
+ - name: OTEL_K8S_NODE_IP
187
+ valueFrom:
188
+ fieldRef:
189
+ fieldPath: status.hostIP
190
+ - name: OTEL_K8S_NAMESPACE
191
+ valueFrom:
192
+ fieldRef:
193
+ apiVersion: v1
194
+ fieldPath: metadata.namespace
195
+ - name: OTEL_K8S_POD_NAME
196
+ valueFrom:
197
+ fieldRef:
198
+ apiVersion: v1
199
+ fieldPath: metadata.name
200
+ - name: OTEL_K8S_POD_IP
201
+ valueFrom:
202
+ fieldRef:
203
+ apiVersion: v1
204
+ fieldPath: status.podIP
205
+ livenessProbe:
206
+ httpGet:
207
+ path: /
208
+ port: 13133
209
+ readinessProbe:
210
+ httpGet:
211
+ path: /
212
+ port: 13133
213
+ volumeMounts:
214
+ - mountPath: /conf
215
+ name: opentelemetry-collector-configmap
216
+ terminationGracePeriodSeconds: 30
217
+ volumes:
218
+ - name: opentelemetry-collector-configmap
219
+ configMap:
220
+ name: example-opentelemetry-collector-agent
221
+ items:
222
+ - key: relay
223
+ path: relay.yaml
224
+ hostNetwork: false
225
+ hostPID: false