Files
devops-infra-helm-charts-gcp/helm-overrides/k8s-dsgpu-prd-ase1/opentelemetry-daemonset/custom-values.yaml
T
2026-08-26 03:39:42 +05:30

134 lines
3.1 KiB
YAML

fullnameOverride: opentelemetry-dsgpu-prd
mode: daemonset
# priorityClassName: "system-node-critical"
# Removing since dataengg pods are going into pending state
config:
exporters:
loadbalancing:
routing_key: "traceID"
protocol:
otlp:
timeout: 5s
tls:
insecure: true
sending_queue:
num_consumers: 500
queue_size: 50000
resolver:
dns:
hostname: opentelemetry-admin-prd-headless.opentelemetry.svc.clusterset.local
processors: {}
receivers:
otlp:
protocols:
grpc:
endpoint: ${env:MY_POD_IP}:4317
http:
endpoint: ${env:MY_POD_IP}:4318
service:
telemetry:
metrics:
level: detailed
readers:
- pull:
exporter:
prometheus:
host: '0.0.0.0'
port: 8888
extensions:
- health_check
pipelines:
logs: null
metrics: null
traces:
exporters:
- loadbalancing
processors: []
receivers:
- otlp
image:
repository: asia-southeast1-docker.pkg.dev/meesho-devops-admin-0622/admin/sre/opentelemetry-collector-contrib
tag: "0.111.0"
tolerations:
- operator: Exists
affinity:
nodeAffinity:
requiredDuringSchedulingIgnoredDuringExecution:
nodeSelectorTerms:
- matchExpressions:
- key: p-dsgpu-contour-ext
operator: NotIn
values:
- dedicated
- key: p-dsgpu-contour-int-0
operator: NotIn
values:
- dedicated
- key: p-dsgpu-contour-int-1
operator: NotIn
values:
- dedicated
- key: p-dsgpu-contour-int
operator: NotIn
values:
- dedicated
- key: node_pool
operator: NotIn
values:
- np-dsgpu-default-prd-ase1
- key: cloud.google.com/compute-class
operator: NotIn
values:
- n4d-highcpu-64-vmagent-compute-class
- n4-highcpu-16-vminsert-compute-class
- c3-highcpu-44-vmselect-compute-class
- n4d-highmem-48-vmstorage-compute-class
- c3-highcpu-22-contour-internal-1-compute-class
- c4d-highcpu-16-contour-internal-1-compute-class
- c3-highcpu-22-contour-internal-0-compute-class
- c4d-highcpu-16-contour-internal-0-compute-class
extraEnvs:
- name: K8S_NODE_NAME
valueFrom:
fieldRef:
apiVersion: v1
fieldPath: spec.nodeName
- name: OTEL_RESOURCE_ATTRIBUTES
value: "k8s.node.name=$(K8S_NODE_NAME)"
ports:
metrics:
enabled: true
resources:
requests:
cpu: 100m
memory: 124Mi
limits:
cpu: 200m
memory: 256Mi
podAnnotations:
otel.io/path: "/metrics"
otel.io/scrape: "true"
otel.io/port: "8888"
podLabels:
bu: "dsgpu"
team: "sre"
service: "opentelemetry-dsgpu-prd"
env: "prd"
priority: "p0"
type: "opentelemetry"
arch: "any"
runpod: "ondemand"
rollout:
rollingUpdate:
maxUnavailable: 10%