292 lines
15 KiB
YAML
292 lines
15 KiB
YAML
replicaCount: 3
|
|
image:
|
|
repository: quay.io/influxdb/telegraf-operator
|
|
pullPolicy: IfNotPresent
|
|
sidecarImage: "asia-southeast1-docker.pkg.dev/meesho-devops-admin-0622/admin/sre/telegraf:1.24.4"
|
|
|
|
dedicatedValue: false
|
|
schedulerName: default-scheduler
|
|
|
|
classes:
|
|
secretName: "telegraf-operator-classes"
|
|
default: "infra"
|
|
data:
|
|
infra: |
|
|
[[inputs.mem]]
|
|
[[outputs.file]]
|
|
files = ["stdout"]
|
|
[[outputs.prometheus_client]]
|
|
listen = ":9273"
|
|
metric_version = 2
|
|
path = "/metrics"
|
|
expiration_interval = "60s"
|
|
export_timestamp = false
|
|
[agent]
|
|
interval = "10s"
|
|
round_interval = true
|
|
metric_batch_size = 1000
|
|
metric_buffer_limit = 40000
|
|
collection_jitter = "0s"
|
|
flush_interval = "30s"
|
|
flush_jitter = "0s"
|
|
precision = ""
|
|
debug = true
|
|
hostname = ""
|
|
omit_hostname = true
|
|
[[aggregators.basicstats]]
|
|
period = "60s"
|
|
grace = "10s"
|
|
delay = "30s"
|
|
drop_original = false
|
|
stats = ["count", "min", "max", "mean", "sum"]
|
|
[[aggregators.histogram]]
|
|
period = "60s"
|
|
grace = "10s"
|
|
delay = "30s"
|
|
drop_original = false
|
|
[[aggregators.histogram.config]]
|
|
buckets = [5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "CONTROLLER"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "RDS"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [1.0, 2.0, 3.0, 4.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "REDIS"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "HBASE"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "HTTP"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "METHOD"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "QUERY_EXECUTION_LATENCY"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "DOWN_STREAM_LATENCY"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "API_LATENCY"
|
|
|
|
[[inputs.socket_listener]]
|
|
service_address = "udp://:8094"
|
|
read_buffer_size = "16MB"
|
|
[[inputs.statsd]]
|
|
protocol = "udp"
|
|
service_address = ":8125"
|
|
delete_gauges = false
|
|
delete_counters = false
|
|
percentiles = [50.0, 90.0, 99.0, 99.9, 99.95, 100.0]
|
|
datadog_extensions = true
|
|
allowed_pending_messages = 100000
|
|
|
|
infra-histogram-expiration-enabled: |
|
|
[[inputs.mem]]
|
|
[[outputs.file]]
|
|
files = ["stdout"]
|
|
[[outputs.prometheus_client]]
|
|
listen = ":9273"
|
|
metric_version = 2
|
|
path = "/metrics"
|
|
expiration_interval = "60s"
|
|
export_timestamp = false
|
|
[agent]
|
|
interval = "10s"
|
|
round_interval = true
|
|
metric_batch_size = 1000
|
|
metric_buffer_limit = 40000
|
|
collection_jitter = "0s"
|
|
flush_interval = "30s"
|
|
flush_jitter = "0s"
|
|
precision = ""
|
|
debug = true
|
|
hostname = ""
|
|
omit_hostname = true
|
|
[[aggregators.basicstats]]
|
|
period = "60s"
|
|
grace = "10s"
|
|
delay = "30s"
|
|
drop_original = false
|
|
stats = ["count", "min", "max", "mean", "sum"]
|
|
[[aggregators.histogram]]
|
|
period = "60s"
|
|
grace = "10s"
|
|
delay = "30s"
|
|
drop_original = false
|
|
expiration_interval = "2m"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "CONTROLLER"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "RDS"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [1.0, 2.0, 3.0, 4.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "REDIS"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "HBASE"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "HTTP"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "METHOD"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "QUERY_EXECUTION_LATENCY"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "DOWN_STREAM_LATENCY"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "API_LATENCY"
|
|
|
|
[[inputs.socket_listener]]
|
|
service_address = "udp://:8094"
|
|
read_buffer_size = "16MB"
|
|
[[inputs.statsd]]
|
|
protocol = "udp"
|
|
service_address = ":8125"
|
|
delete_gauges = false
|
|
delete_counters = false
|
|
percentiles = [50.0, 90.0, 99.0, 99.9, 99.95, 100.0]
|
|
datadog_extensions = true
|
|
allowed_pending_messages = 100000
|
|
|
|
infra-telegraf-cardinality-optimized: |
|
|
[[inputs.mem]]
|
|
[[outputs.file]]
|
|
files = ["stdout"]
|
|
[[outputs.prometheus_client]]
|
|
listen = ":9273"
|
|
metric_version = 2
|
|
path = "/metrics"
|
|
expiration_interval = "60s"
|
|
export_timestamp = false
|
|
[agent]
|
|
interval = "10s"
|
|
round_interval = true
|
|
metric_batch_size = 1000
|
|
metric_buffer_limit = 40000
|
|
collection_jitter = "0s"
|
|
flush_interval = "30s"
|
|
flush_jitter = "0s"
|
|
precision = ""
|
|
debug = true
|
|
hostname = ""
|
|
omit_hostname = true
|
|
[[aggregators.histogram]]
|
|
period = "60s"
|
|
grace = "10s"
|
|
delay = "30s"
|
|
drop_original = false
|
|
expiration_interval = "2m"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "CONTROLLER"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "RDS"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [1.0, 2.0, 3.0, 4.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0, 1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "REDIS"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "HBASE"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "HTTP"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "METHOD"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "QUERY_EXECUTION_LATENCY"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "DOWN_STREAM_LATENCY"
|
|
[[aggregators.histogram.config]]
|
|
buckets = [0.0, 5.0, 10.0, 20.0, 30.0, 40.0, 50.0, 60.0, 80.0, 100.0, 120.0, 150.0, 175.0, 200.0, 225.0, 250.0, 275.0, 300.0, 350.0, 400.0, 450.0, 500.0, 600.0, 700.0, 800.0, 900.0,1000.0, 1200.0, 1500.0, 2000.0, 5000.0, 10000.0, 12500.0, 15000.0, 20000.0, 25000.0, 30000.0]
|
|
measurement_name = "API_LATENCY"
|
|
|
|
[[inputs.socket_listener]]
|
|
service_address = "udp://:8094"
|
|
read_buffer_size = "16MB"
|
|
[[inputs.statsd]]
|
|
protocol = "udp"
|
|
service_address = ":8125"
|
|
delete_gauges = false
|
|
delete_counters = false
|
|
percentiles = [50.0, 90.0, 99.0, 99.9, 99.95]
|
|
datadog_extensions = true
|
|
allowed_pending_messages = 100000
|
|
|
|
certManager:
|
|
enable: false
|
|
|
|
imagePullSecrets: []
|
|
nameOverride: ""
|
|
fullnameOverride: ""
|
|
serviceAccount:
|
|
# Annotations to add to the service account
|
|
annotations: {}
|
|
podSecurityContext: {}
|
|
# fsGroup: 2000
|
|
securityContext: {}
|
|
# capabilities:
|
|
# drop:
|
|
# - ALL
|
|
# readOnlyRootFilesystem: true
|
|
# runAsNonRoot: true
|
|
# runAsUser: 1000
|
|
resources:
|
|
limits:
|
|
cpu: 200m
|
|
memory: 256Mi
|
|
requests:
|
|
cpu: 50m
|
|
memory: 64Mi
|
|
sidecarResources:
|
|
requests:
|
|
cpu: 200m
|
|
memory: 200Mi
|
|
topologySpreadConstraints:
|
|
- maxSkew: 1
|
|
topologyKey: topology.kubernetes.io/zone
|
|
whenUnsatisfiable: ScheduleAnyway
|
|
labelSelector:
|
|
matchLabels:
|
|
type: exporter
|
|
- maxSkew: 1
|
|
topologyKey: kubernetes.io/hostname
|
|
whenUnsatisfiable: DoNotSchedule
|
|
labelSelector:
|
|
matchLabels:
|
|
type: exporter
|
|
labels:
|
|
bu: "demand"
|
|
team: "demand-sre"
|
|
service: "telegraf-operator-demand-prd"
|
|
env: "prd"
|
|
priority: "p0"
|
|
type: "exporter"
|
|
|
|
nodeSelector:
|
|
dedicated: "vmselect-mds"
|
|
|
|
tolerations:
|
|
- key: "dedicated"
|
|
operator: "Equal"
|
|
value: "vmselect-mds"
|
|
effect: "NoSchedule"
|
|
|
|
affinity: {}
|
|
requireAnnotationsForSecret: false
|
|
# allow hot reload ; disabled by default to support versions of telegraf
|
|
# that do not support hot-reload and --watch-config flag
|
|
hotReload: false |