Skip to content

telemetry_config.yml

This file configures telemetry sources (iDRAC, LDMS, DCGM, PowerScale, UFM, VAST, OpenManage Enterprise), telemetry bridges (Vector-LDMS, Vector-OME), and telemetry sinks (VictoriaMetrics, VictoriaLogs, Kafka). It also includes component-specific configurations for each telemetry source.

Supported Telemetry Sources, Bridges and Sinks

Source Description Sinks
iDRAC Out-of-band hardware metrics (power, thermal, storage health) from Dell servers via Redfish Kafka, VictoriaMetrics
LDMS In-band OS metrics (CPU, memory, network, I/O) from Slurm compute nodes Kafka, VictoriaMetrics (via Vector-LDMS)
PowerScale Storage performance metrics and logs from Dell PowerScale clusters VictoriaMetrics, VictoriaLogs
UFM NVIDIA UFM InfiniBand Fabric Manager metrics (IB port state, transmit/receive data, error counters, fabric topology) and syslog logs VictoriaMetrics, VictoriaLogs
VAST Storage performance metrics and syslog events from VAST Storage appliances VictoriaMetrics, VictoriaLogs
OpenManage Enterprise (OME) Server inventory, health, alerts, and audit logs from Dell OME via Kafka mTLS Kafka, VictoriaMetrics, VictoriaLogs (via Vector-OME)
SFM Network telemetry metrics from Smart Fabric Manager VictoriaMetrics

Kafka PV Sizing Guidance

Set persistence_size in input/telemetry_config.yml under telemetry_sinks.kafka according to the table below. This value is applied per Kafka pod.

Telemetry Sources Node Count Retention Kafka PV Size
iDRAC only 50 nodes 7 days 128Gi per broker
iDRAC only 200 nodes 7 days 512Gi per broker
iDRAC + LDMS 50 nodes 7 days 200Gi per broker
iDRAC + LDMS 200 nodes 7 days 800Gi per broker
iDRAC + LDMS + DCGM 200 nodes 7 days 1Ti per broker
iDRAC + LDMS + DCGM 500+ nodes 7 days 2Ti per broker

Note

  • Kafka does not enable compression by default. All telemetry data (iDRAC, LDMS, DCGM) is stored uncompressed.
  • Each Kafka topic uses a replication factor of 2. The PV size recommendations already account for this.
  • Actual storage consumption varies based on iDRAC metric report group subscriptions, LDMS sampler plugin count, sampling intervals, and DCGM collection frequency.
  • Controllers use minimal storage (~100Mi for metadata) but share the same persistence_size setting as brokers.
  • If log_retention_hours is increased beyond the default of 168 (7 days), scale the PV size proportionally.

Monitor actual usage after deployment. If any broker exceeds 70% of its PV capacity within the first 3-4 days, increase persistence_size and redeploy to avoid filling the disk before the 7-day retention window.

Parameter Reference

Telemetry Configuration Parameters

Parameter

Details

telemetry_sources

dict / required

Data collectors — each source can be independently enabled/disabled.

idrac

dict / required

iDRAC hardware metrics from Dell PowerEdge servers.

metrics_enabled

boolean / required

Enable or disable iDRAC metrics collection from Dell PowerEdge servers

Collected metrics: temperature, power, fan speed, storage health, CPU/memory errors

Data path:

iDRAC Receiver -> ActiveMQ -> KafkaPump -> Kafka 'idrac' topic

iDRAC Receiver -> ActiveMQ -> VictoriaPump -> vmagent -> victoria_metrics

Accepted values: true or false

Default value: true

Note

  • If iDRAC telemetry is enabled, mysqldb_user, mysqldb_password, and mysqldb_root_password parameters in the omnia_config_credentials.yml file become mandatory.
  • If you want to deploy only Slurm clusters (slurm_custom), set metrics_enabled to false.

collection_targets

list / elements=string / required

Collection targets define where iDRAC data is sent before Vector processing

Supported values: victoria_metrics, kafka

Multiple targets: Can specify both [victoria_metrics, kafka]

Default: [victoria_metrics, kafka]

ldms

dict / required

Lightweight Distributed Metric Service for compute node metrics.

metrics_enabled

boolean / required

Enable or disable LDMS metrics collection from compute nodes

Collected metrics: CPU, memory, network, disk metrics

Data path: LDMS samplers → LDMS aggregator → store_avro_kafka → Kafka 'ldms' topic

Accepted values: true or false

Default value: true

collection_targets

list / elements=string / required

LDMS only supports Kafka collection (no direct victoria_metrics path)

Vector-LDMS bridge consumes from Kafka and routes to victoria_metrics

Supported values: kafka

Default: [kafka]

dcgm

dict / required

NVIDIA Data Center GPU Manager telemetry.

metrics_enabled

boolean / required

Enable or disable DCGM (NVIDIA Data Center GPU Manager) metrics collection

Collected metrics: GPU temperature, utilization, memory, ECC errors, power

Requires: NVIDIA GPU driver installed on compute nodes

Accepted values: true or false

Default value: true

powerscale

dict / required

Dell PowerScale (OneFS) storage telemetry.

metrics_enabled

boolean / required

Enable or disable PowerScale metrics collection from Dell PowerScale (OneFS) storage

Collected metrics: Storage metrics from Dell PowerScale clusters

Requires: CSM Observability (Karavi) values file configured

Data path: CSM Metrics PowerScale → OTEL Collector → vmagent(shared) → victoria_metrics

Accepted values: true or false

Default value: true

logs_enabled

boolean

Enable or disable PowerScale logs collection

Accepted values: true or false

Default value: true

collection_targets

list / elements=string / required

PowerScale uses dedicated vmagent(shared) (no Kafka, no Vector)

Supported values: victoria_metrics, victoria_logs

Default: [victoria_metrics, victoria_logs]

ufm

dict / required

NVIDIA UFM InfiniBand Fabric telemetry.

metrics_enabled

boolean / required

Enable or disable UFM (NVIDIA UFM InfiniBand Fabric Manager) metrics collection

Collected metrics: IB port state, transmit/receive data, error counters, fabric topology

Requires: NVIDIA UFM appliance with Prometheus exporter enabled

Data path: UFM Prometheus Exporter → vmagent(shared) → victoria_metrics

Accepted values: true or false

Default value: false

logs_enabled

boolean

Enable or disable UFM syslog logs collection

Accepted values: true or false

Default value: false

collection_targets

list / elements=string / required

UFM uses vmagent(shared) for metrics and VLAgent for logs

Supported values: victoria_metrics, victoria_logs

Default: [victoria_metrics, victoria_logs]

vast

dict / required

VAST Data Storage telemetry.

metrics_enabled

boolean / required

Enable or disable VAST (Data Storage) metrics collection

Collected metrics: IB port state, transmit/receive data, error counters, fabric topology

Requires: VAST appliance with Prometheus exporter enabled

Data path: Prometheus Exporter → vmagent(shared) → victoria_metrics

Accepted values: true or false

Default value: false

logs_enabled

boolean

Enable or disable VAST syslog logs collection

Accepted values: true or false

Default value: false

collection_targets

list / elements=string / required

VAST uses vmagent(shared) for metrics and VLAgent for logs

Supported values: victoria_metrics, victoria_logs

Default: [victoria_metrics, victoria_logs]

ome

dict / required

Dell OpenManage Enterprise telemetry. OME publishes to Kafka; Vector-OME bridge routes to Victoria sinks.

metrics_enabled

boolean / required

Enable or disable Vector-OME metrics routing (Kafka-to-Victoria bridge for OME metrics)

Data flow: Kafka 'ome.*' topics → Vector-OME → vmagent-vector (metrics)

Requires: OME to be configured with kafka

Accepted values: true or false

Default value: true

logs_enabled

boolean / required

Enable or disable OME logs collection

Accepted values: true or false

Default value: true

collection_targets

list / elements=string / required

OME only supports Kafka collection. Vector-OME bridge routes to victoria_metrics/victoria_logs.

Default: [kafka]

telemetry_bridges

dict / required

Data routers — Vector pods that consume from Kafka and produce to Victoria sinks.

vector_ldms

dict / required

Vector-LDMS: Kafka-to-victoria_metrics bridge for LDMS metrics.

metrics_enabled

boolean / required

Enable or disable Vector-LDMS bridge (Kafka-to-victoria_metrics bridge for LDMS metrics)

Purpose: Consume LDMS metrics from Kafka 'ldms' topic, transform NERSC schema to Prometheus format, and write to victoria_metrics

Data flow: Kafka 'ldms' topic → Vector-LDMS → vmagent-vector → victoria_metrics

Requires: telemetry_sources > ldms > metrics_enabled = true

Accepted values: true or false

Default value: true

vector_ome

dict / required

Vector-OME: Kafka-to-Victoria bridge for OME metrics and logs.

metrics_enabled

boolean / required

Enable or disable Vector-OME metrics routing (Kafka-to-Victoria bridge for OME metrics)

Data flow: Kafka 'ome.*' topics → Vector-OME → vmagent-vector (metrics)

Requires: OME to be configured with kafka

Accepted values: true or false

Default value: true

logs_enabled

boolean / required

Enable or disable Vector-OME logs routing

Data flow: Kafka 'ome.*' topics → Vector-OME → vlagent-vector (logs)

Accepted values: true or false

Default value: true

ome_identifier

string / required

Identifier used by Vector-OME for topic identification and routing

Internally used to match topics with the prefix (e.g., ^ome\\..*$)

minLength: 1

Default value: ome

Note: Change only if your OME Kafka topics use a different prefix

telemetry_sinks

dict / required

Storage backends — auto-enabled when at least one source targets them.

victoria_metrics

dict / required

victoria_metrics time-series database for metrics.

persistence_size

string / required

Storage per vmstorage pod PVC

Important: Total VictoriaMetrics storage depends on deployment mode:

Single-node mode: Total storage = persistence_size * 1 pod

Cluster mode: Total storage = persistence_size * 3 vmstorage pods

Example (cluster): 8Gi * 3 = 24Gi total VictoriaMetrics storage

Accepted values: Must be specified in the form of X[Ki|Mi|Gi|Ti|Pi|Ei]

Default value: 8Gi (results in 24Gi total storage for cluster mode)

retention_period

integer / required

Metric retention period in hours

Default: 168 (7 days)

additional_metric_remote_write_endpoints

list / elements=dict

Additional remote write endpoints for metrics (optional)

Purpose: Send metrics to external VictoriaMetrics instances in addition to Omnia-managed VictoriaMetrics

Format: List of endpoint objects with 'url' field (must start with http:// or https://)

TLS: Set 'tls_insecure_skip_verify: true' to skip TLS certificate verification

Default: [] (empty — only Omnia VictoriaMetrics receives metrics)

Example:

- url: https://external-metrics-server:8480/insert/0/prometheus/api/v1/write

tls_insecure_skip_verify: false

url

string / required

Metrics remote_write endpoint URL.

tls_insecure_skip_verify

boolean

Skip TLS certificate verification for this endpoint.

Default: False.

victoria_logs

dict / required

victoria_logs centralized log storage.

storage_size

string / required

Storage per vlstorage pod PVC

Total storage = storage_size × 3 vlstorage pods

Accepted values: Must be specified in the form of X[Ki|Mi|Gi|Ti|Pi|Ei]

Default value: 8Gi (results in 24Gi total storage)

Sizing formula: (140 MB/day × retention_days × node_count) / 3 replicas

Warning

Storage under-provisioning can lead to data loss before the retention period is reached. Calculate storage requirements based on expected log volume and retention needs.

retention_period

integer / required

Log retention period in hours

Accepted values: 24-8760 (1 day to 1 year)

Default: 168 (7 days)

Note

  • Retention is global and applies to all log streams uniformly. Deletion occurs asynchronously during background merge operations.
  • VictoriaLogs does not return an error when log entries with timestamps outside the configured retention window are submitted. Log entries will be automatically removed from VictoriaLogs after the retention period.

additional_log_write_endpoints

list / elements=dict

Additional remote write endpoints for logs (optional)

Purpose: Send logs to external VictoriaLogs instances in addition to Omnia-managed VictoriaLogs

Format: List of endpoint objects with 'url' field (must start with http:// or https://)

TLS: Set 'tls_insecure_skip_verify: true' to skip TLS certificate verification

Default: [] (empty — only Omnia VictoriaLogs receives logs)

Example:

- url: https://external-logs-server:9481/internal/insert

tls_insecure_skip_verify: false

url

string / required

Logs remote_write endpoint URL.

tls_insecure_skip_verify

boolean

Skip TLS certificate verification for this endpoint.

Default: False.

kafka

dict / required

Apache Kafka distributed streaming platform.

persistence_size

string / required

Storage per Kafka pod PVC

Total = persistence_size × 6 pods (3 brokers + 3 controllers)

Accepted values: Must be specified in the form of X[Ki|Mi|Gi|Ti|Pi|Ei]

Default value: 8Gi (results in 48Gi total storage)

The default 8Gi size is suitable for small clusters (typically fewer than 5 nodes). For larger clusters, you should increase the persistence_size and adjust log_retention_hours and log_retention_bytes based on expected data volume and cluster size.

Caution

Ensure that the Kafka broker settings persistence_size, log_retention_hours, and log_retention_bytes are configured based on your data retention requirements. If the persistent volume reaches its capacity before logs are deleted according to the log retention period configured, Kafka brokers may run out of disk space. For more details on managing Kafka log retention and cleanup policies, see Managing Kafka logs with delete and compact policies.

log_retention_hours

integer / required

Log retention period in hours

Default: 168 (7 days)

log_retention_bytes

integer / required

Maximum size of Kafka logs (in bytes) before deletion

Default: -1 (unlimited)

log_segment_bytes

integer / required

Maximum size of Kafka log segments (in bytes)

Default: 1073741824 (1 GB)

topic_partitions

dict / required

Topic partitions per source (object format, not array)

Format: {topic_name: partition_count}

Required when: Source has kafka in collection_targets

Allowed topics: idrac, ldms only

Default partition counts: idrac=1, ldms=2

Example: {idrac: 1, ldms: 2}

idrac

integer

Number of partitions for the 'idrac' topic.

Range: 1-100.

Default: 1.

ldms

integer

Number of partitions for the 'ldms' topic.

Range: 1-100.

Default: 2.

ldms_configurations

dict / required

LDMS-specific configurations for aggregator, store, and sampler.

agg_port

integer / required

Aggregator port on service K8s cluster

Valid range: 6001-6100

Default: 6001

store_port

integer / required

Store daemon port on service K8s cluster

The port can be the same as LDMS aggregator port

Valid range: 6001-6100

Default: 6001

sampler_port

integer / required

Sampler port on compute nodes

Valid range: 10001-10100

Default: 10001

sampler_plugins

list / elements=dict / required

Sampler plugins define which metrics to collect from compute nodes

Parameters:

plugin_name: Name of the LDMS sampler plugin

config_parameters: Plugin-specific configuration (as a single string)

activation_parameters: Collection schedule in MICROSECONDS

Format: interval=<microseconds> offset=<microseconds>

Example: interval=30000000 (30 seconds)

Default plugins:

meminfo: Memory usage statistics (free, used, buffers, cached)

procstat2: Process statistics (CPU, memory, I/O per process)

vmstat: Virtual memory statistics (paging, swapping, memory pressure)

loadavg: System load average (1, 5, and 15 minute averages)

procnetdev2: Network interface statistics (bytes, packets, errors, drops per interface)

Default activation_parameters: interval=30000000 (30 seconds for all plugins except procnetdev2 which includes offset=0)

plugin_name

string / required

Name of the LDMS sampler plugin.

config_parameters

string

Plugin-specific configuration parameters as a single string.

activation_parameters

string / required

Activation parameters (e.g., 'interval=30000000 offset=0').

powerscale_configurations

dict / required

PowerScale telemetry detailed configurations.

otel_collector_storage_size

string / required

PVC size for OTEL Collector metric batching and buffering

Accepted values: Must be specified in the form of X[Ki|Mi|Gi|Ti|Pi|Ei]

Default value: 5Gi

csm_observability_values_file_path

string / required

Path to the CSM Observability (Karavi Observability) values.yaml file

Required when: telemetry_sources > powerscale > metrics_enabled: true

Reference: https://raw.githubusercontent.com/dell/helm-charts/refs/heads/release-v1.17.1/charts/karavi-observability/values.yaml

Default value: ""

Note

  • In the values.yaml file, only set karaviMetricsPowerscale -> enabled: true. Set the following parameters to false: karaviMetricsPowerflex -> enabled=false, karaviMetricsPowerstore -> enabled=false, karaviMetricsPowerscaleauthorization.-> enabled=false, karaviMetricsPowermax -> enabled=false.
  • Update the isiAuthType in the values.yaml file based on the current auth type setting. To check the current auth type setting, use the command isi http settings view.
  • For CSI PowerScale health metrics, enable controller > healthMonitor > enabled: true and node > healthMonitor > enabled: true in the CSI PowerScale values.yaml (https://raw.githubusercontent.com/dell/helm-charts/csi-isilon-2.17.0/charts/csi-isilon/values.yaml).

ufm_configuration

dict / required

UFM telemetry detailed configurations.

ufm_endpoint

string

UFM appliance IP address or hostname

Required when: telemetry_sources > ufm > metrics_enabled is true

Example: 172.20.44.180 or ufm.example.com

Default value: ""

ufm_metrics_port

integer

UFM Prometheus exporter port

Default value: 9001 (UFM default Prometheus port)

scrape_interval

string

Prometheus scrape interval for UFM metrics

Accepted values: Prometheus duration format (e.g., 15s, 30s, 1m)

Default value: 30s

scrape_timeout

string

Prometheus scrape timeout (must be <= scrape_interval)

Accepted values: Prometheus duration format (e.g., 10s, 15s)

Default value: 15s

tls_mode

string

TLS mode for connecting to UFM Prometheus endpoint

Accepted values: self_signed, ca_signed

self_signed: Skip TLS verification (insecure_skip_verify=true)

ca_signed: Use CA certificate for TLS verification

Default value: self_signed

ufm_ca_cert_path

string

Path to CA certificate file for UFM TLS verification

Required when: tls_mode is ca_signed

Must be a valid PEM-format certificate file

Default value: "" (empty — not used when tls_mode is self_signed)

auth_mode

string

Authentication mode for UFM Prometheus endpoint

Accepted values: basic, none

basic: Use ufm_username/ufm_password from omnia_config_credentials.yml

none: No authentication (UFM endpoint is open)

Default value: basic

vast_configuration

dict / required

VAST telemetry detailed configurations.

vast_endpoint

string

VAST appliance IP address or hostname

Required when: telemetry_sources > vast > metrics_enabled is true

Example: 172.20.44.180 or vast.example.com

Default value: ""

vast_metrics_port

integer

VAST Prometheus exporter port

Default value: 9001 (VAST default Prometheus port)

metrics_path

string

Prometheus metrics path for VAST API.

Default: /api/prometheusmetrics/all.

scrape_interval

string

Prometheus scrape interval for VAST metrics

Accepted values: Prometheus duration format (e.g., 15s, 30s, 1m)

Default value: 30s

scrape_timeout

string

Prometheus scrape timeout (must be <= scrape_interval)

Accepted values: Prometheus duration format (e.g., 10s, 15s)

Default value: 15s

tls_mode

string

TLS mode for connecting to VAST Prometheus endpoint

Accepted values: self_signed, ca_signed

self_signed: Skip TLS verification (insecure_skip_verify=true)

ca_signed: Use CA certificate for TLS verification

Default value: self_signed

vast_ca_cert_path

string

Path to CA certificate file for VAST TLS verification

Required when: tls_mode is ca_signed

Must be a valid PEM-format certificate file

Default value: "" (empty — not used when tls_mode is self_signed)

auth_mode

string

Authentication mode for VAST Prometheus endpoint

Accepted values: basic, none

basic: Use vast_username/vast_password from omnia_config_credentials.yml

none: No authentication (VAST endpoint is open)

Default value: basic

Telemetry Storage Configuration Parameters

Parameter

Details

victoria_cluster_storage

dict / required

VictoriaMetrics cluster resource configurations.

vmstorage

dict / required

VMStorage resource configuration.

replicas

integer / required

Number of vmstorage pod replicas

Default value: 3

Note: For cluster mode, minimum 3 replicas are recommended for high availability

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vmstorage pods

Default value: 1Gi

cpu

string / required

CPU request for vmstorage pods

Default value: 250m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vmstorage pods

Default value: 2Gi

cpu

string / required

CPU limit for vmstorage pods

Default value: 1000m

vminsert

dict / required

VMInsert resource configuration.

replicas

integer / required

Number of vminsert pod replicas

Default value: 2

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vminsert pods

Default value: 256Mi

cpu

string / required

CPU request for vminsert pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vminsert pods

Default value: 512Mi

cpu

string / required

CPU limit for vminsert pods

Default value: 500m

vmselect

dict / required

VMSelect resource configuration.

replicas

integer / required

Number of vmselect pod replicas

Default value: 2

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vmselect pods

Default value: 256Mi

cpu

string / required

CPU request for vmselect pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vmselect pods

Default value: 512Mi

cpu

string / required

CPU limit for vmselect pods

Default value: 500m

vmagent

dict / required

VMAgent resource configuration.

replicas

integer / required

Number of vmagent pod replicas

Default value: 1

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vmagent pods

Default value: 256Mi

cpu

string / required

CPU request for vmagent pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vmagent pods

Default value: 512Mi

cpu

string / required

CPU limit for vmagent pods

Default value: 500m

victoria_logs_cluster_storage

dict / required

VictoriaLogs cluster resource configurations.

vlstorage

dict / required

VLStorage resource configuration.

replicas

integer / required

Number of vlstorage pod replicas

Default value: 3

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vlstorage pods

Default value: 512Mi

cpu

string / required

CPU request for vlstorage pods

Default value: 250m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vlstorage pods

Default value: 1Gi

cpu

string / required

CPU limit for vlstorage pods

Default value: 1000m

vlinsert

dict / required

VLInsert resource configuration.

replicas

integer / required

Number of vlinsert pod replicas

Default value: 2

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vlinsert pods

Default value: 256Mi

cpu

string / required

CPU request for vlinsert pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vlinsert pods

Default value: 512Mi

cpu

string / required

CPU limit for vlinsert pods

Default value: 500m

vlselect

dict / required

VLSelect resource configuration.

replicas

integer / required

Number of vlselect pod replicas

Default value: 2

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vlselect pods

Default value: 256Mi

cpu

string / required

CPU request for vlselect pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vlselect pods

Default value: 512Mi

cpu

string / required

CPU limit for vlselect pods

Default value: 500m

vlagent

dict / required

VLAgent resource configuration.

replicas

integer / required

Number of vlagent pod replicas

Default value: 1

pvc_size

string / required

PVC size for vlagent pods

Default value: 5Gi

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vlagent pods

Default value: 256Mi

cpu

string / required

CPU request for vlagent pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vlagent pods

Default value: 512Mi

cpu

string / required

CPU limit for vlagent pods

Default value: 500m

vector_storage

dict / required

Vector component resource configurations.

ldms

dict / required

Vector-LDMS resource configuration.

replicas

integer / required

Number of Vector-LDMS pod replicas

Default value: 1

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for Vector-LDMS pods

Default value: 256Mi

cpu

string / required

CPU request for Vector-LDMS pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for Vector-LDMS pods

Default value: 512Mi

cpu

string / required

CPU limit for Vector-LDMS pods

Default value: 500m

ome

dict / required

Vector-OME resource configuration.

replicas

integer / required

Number of Vector-OME pod replicas

Default value: 1

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for Vector-OME pods

Default value: 256Mi

cpu

string / required

CPU request for Vector-OME pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for Vector-OME pods

Default value: 512Mi

cpu

string / required

CPU limit for Vector-OME pods

Default value: 500m

vlagent_vector

dict / required

VLAgent-Vector resource configuration.

replicas

integer / required

Number of vlagent-vector pod replicas

Default value: 1

pvc_size

string / required

PVC size for vlagent-vector pods

Default value: 5Gi

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vlagent-vector pods

Default value: 256Mi

cpu

string / required

CPU request for vlagent-vector pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vlagent-vector pods

Default value: 512Mi

cpu

string / required

CPU limit for vlagent-vector pods

Default value: 500m

vmagent_vector

dict / required

VMAgent-Vector resource configuration.

replicas

integer / required

Number of vmagent-vector pod replicas

Default value: 1

pvc_size

string / required

PVC size for vmagent-vector pods

Default value: 5Gi

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for vmagent-vector pods

Default value: 256Mi

cpu

string / required

CPU request for vmagent-vector pods

Default value: 100m

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for vmagent-vector pods

Default value: 512Mi

cpu

string / required

CPU limit for vmagent-vector pods

Default value: 500m

csi_volume_exporter_storage

dict / required

CSI Volume Exporter resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU request for CSI Volume Exporter pods.

memory

string / required

Memory request for CSI Volume Exporter pods.

limits

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU limit for CSI Volume Exporter pods.

memory

string / required

Memory limit for CSI Volume Exporter pods.

csm_metrics_powerscale_storage

dict / required

CSM Metrics PowerScale resource configuration.

requests

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU request for CSM Metrics PowerScale pods.

memory

string / required

Memory request for CSM Metrics PowerScale pods.

limits

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU limit for CSM Metrics PowerScale pods.

memory

string / required

Memory limit for CSM Metrics PowerScale pods.

kafka_storage

dict / required

Kafka storage resource configuration. Required when kafka is in collection_targets for any source.

kafka

dict / required

Kafka broker resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for Kafka broker pods.

cpu

string / required

CPU request for Kafka broker pods.

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for Kafka broker pods.

cpu

string / required

CPU limit for Kafka broker pods.

entity_operator

dict / required

Kafka Entity Operator resource configuration.

user_operator

dict / required

Kafka User Operator resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

memory

string / required

Memory request for Kafka User Operator pods.

cpu

string / required

CPU request for Kafka User Operator pods.

limits

dict / required

Kubernetes resource specifications.

memory

string / required

Memory limit for Kafka User Operator pods.

cpu

string / required

CPU limit for Kafka User Operator pods.

idrac_telemetry_storage

dict / required

iDRAC Telemetry container resource configuration. Required when iDRAC metrics are enabled.

mysqldb

dict / required

MySQL database container resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU request for mysqldb container.

memory

string / required

Memory request for mysqldb container.

limits

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU limit for mysqldb container.

memory

string / required

Memory limit for mysqldb container.

activemq

dict / required

ActiveMQ container resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU request for activemq container.

memory

string / required

Memory request for activemq container.

limits

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU limit for activemq container.

memory

string / required

Memory limit for activemq container.

receiver

dict / required

iDRAC telemetry receiver container resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU request for receiver container.

memory

string / required

Memory request for receiver container.

limits

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU limit for receiver container.

memory

string / required

Memory limit for receiver container.

kafka_pump

dict / required

Kafka pump container resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU request for kafka_pump container.

memory

string / required

Memory request for kafka_pump container.

limits

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU limit for kafka_pump container.

memory

string / required

Memory limit for kafka_pump container.

victoria_pump

dict / required

Victoria pump container resource configuration.

resources

dict / required

Resource requests and limits.

requests

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU request for victoria_pump container.

memory

string / required

Memory request for victoria_pump container.

limits

dict / required

Kubernetes resource specifications.

cpu

string / required

CPU limit for victoria_pump container.

memory

string / required

Memory limit for victoria_pump container.

Usage example

File: /opt/omnia/input/project_default/telemetry_config.yml
---
telemetry_sources:

  idrac:
    metrics_enabled: true
    collection_targets:
      - "victoria_metrics"
      - "kafka"

  ldms:
    metrics_enabled: true
    collection_targets:
      - "kafka"

  dcgm:
    metrics_enabled: true

  powerscale:
    metrics_enabled: true
    logs_enabled: true
    collection_targets:
      - "victoria_metrics"
      - "victoria_logs"

  ufm:
    metrics_enabled: false
    logs_enabled: false
    collection_targets:
      - "victoria_metrics"
      - "victoria_logs"

  vast:
    metrics_enabled: false
    logs_enabled: false
    collection_targets:
      - "victoria_metrics"
      - "victoria_logs"

  ome:
    metrics_enabled: true
    logs_enabled: true
    collection_targets:
      - "kafka"

telemetry_bridges:

  vector_ldms:
    metrics_enabled: true

  vector_ome:
    metrics_enabled: true
    logs_enabled: true
    ome_identifier: "ome"

telemetry_sinks:

  victoria_metrics:
    persistence_size: "8Gi"
    retention_period: 168
    additional_metric_remote_write_endpoints: []

  victoria_logs:
    storage_size: "8Gi"
    retention_period: 168
    additional_log_write_endpoints: []

  kafka:
    persistence_size: "8Gi"
    log_retention_hours: 168
    log_retention_bytes: -1
    log_segment_bytes: 1073741824
    topic_partitions:
      idrac: 1
      ldms: 2

idrac_telemetry_configurations:
  mysqldb_storage: "1Gi"

ldms_configurations:
  agg_port: 6001
  store_port: 6001
  sampler_port: 10001
  sampler_plugins:
    - plugin_name: meminfo
      config_parameters: ""
      activation_parameters: "interval=30000000"

    - plugin_name: procstat2
      config_parameters: ""
      activation_parameters: "interval=30000000"

    - plugin_name: vmstat
      config_parameters: ""
      activation_parameters: "interval=30000000"

    - plugin_name: loadavg
      config_parameters: ""
      activation_parameters: "interval=30000000"

    - plugin_name: procnetdev2
      config_parameters: ""
      activation_parameters: "interval=30000000 offset=0"

powerscale_configurations:
  otel_collector_storage_size: "5Gi"
  csm_observability_values_file_path: ""

ufm_configuration:
  ufm_endpoint: ""
  ufm_metrics_port: 9001
  scrape_interval: "30s"
  scrape_timeout: "15s"
  tls_mode: "self_signed"
  ufm_ca_cert_path: ""
  auth_mode: "basic"

vast_configuration:
  vast_endpoint: ""
  vast_metrics_port: 443
  metrics_path: "/api/prometheusmetrics/all"
  scrape_interval: "30s"
  scrape_timeout: "15s"
  tls_mode: "self_signed"
  vast_ca_cert_path: ""
  auth_mode: "basic"
File: /opt/omnia/input/project_default/telemetry_storage_config.yml
---
victoria_cluster_storage:
  vmstorage:
    replicas: 3
    resources:
      requests:
        memory: "1Gi"
        cpu: "250m"
      limits:
        memory: "2Gi"
        cpu: "1000m"
  vminsert:
    replicas: 2
    resources:
      requests:
        memory: "256Mi"
        cpu: "100m"
      limits:
        memory: "512Mi"
        cpu: "500m"
  vmselect:
    replicas: 2
    resources:
      requests:
        memory: "256Mi"
        cpu: "100m"
      limits:
        memory: "512Mi"
        cpu: "500m"
  vmagent:
    replicas: 2
    resources:
      requests:
        memory: "128Mi"
        cpu: "50m"
      limits:
        memory: "512Mi"
        cpu: "250m"

victoria_logs_cluster_storage:
  vlstorage:
    replicas: 3
    resources:
      requests:
        memory: "512Mi"
        cpu: "100m"
      limits:
        memory: "1Gi"
        cpu: "500m"
  vlinsert:
    replicas: 2
    resources:
      requests:
        memory: "256Mi"
        cpu: "100m"
      limits:
        memory: "512Mi"
        cpu: "500m"
  vlselect:
    replicas: 2
    resources:
      requests:
        memory: "256Mi"
        cpu: "100m"
      limits:
        memory: "512Mi"
        cpu: "500m"
  vlagent:
    replicas: 2
    pvc_size: "5Gi"
    resources:
      requests:
        memory: "64Mi"
        cpu: "25m"
      limits:
        memory: "256Mi"
        cpu: "100m"

vector_storage:
  ldms:
    replicas: 2
    resources:
      requests:
        memory: "128Mi"
        cpu: "50m"
      limits:
        memory: "256Mi"
        cpu: "250m"
  ome:
    replicas: 2
    resources:
      requests:
        memory: "256Mi"
        cpu: "100m"
      limits:
        memory: "512Mi"
        cpu: "500m"
  vlagent_vector:
    replicas: 2
    pvc_size: "5Gi"
    resources:
      requests:
        memory: "128Mi"
        cpu: "50m"
      limits:
        memory: "256Mi"
        cpu: "250m"
  vmagent_vector:
    replicas: 2
    pvc_size: "5Gi"
    resources:
      requests:
        memory: "128Mi"
        cpu: "50m"
      limits:
        memory: "256Mi"
        cpu: "250m"

csi_volume_exporter_storage:
  resources:
    requests:
      cpu: "50m"
      memory: "64Mi"
    limits:
      cpu: "200m"
      memory: "256Mi"

csm_metrics_powerscale_storage:
  requests:
    cpu: "100m"
    memory: "128Mi"
  limits:
    cpu: "500m"
    memory: "512Mi"

idrac_telemetry_storage:
  mysqldb:
    resources:
      requests:
        cpu: "100m"
        memory: "256Mi"
      limits:
        cpu: "500m"
        memory: "512Mi"
  activemq:
    resources:
      requests:
        cpu: "100m"
        memory: "512Mi"
      limits:
        cpu: "500m"
        memory: "1536Mi"
  receiver:
    resources:
      requests:
        cpu: "100m"
        memory: "128Mi"
      limits:
        cpu: "500m"
        memory: "256Mi"
  kafka_pump:
    resources:
      requests:
        cpu: "50m"
        memory: "128Mi"
      limits:
        cpu: "200m"
        memory: "512Mi"
  victoria_pump:
    resources:
      requests:
        cpu: "50m"
        memory: "128Mi"
      limits:
        cpu: "200m"
        memory: "512Mi"

kafka_storage:
  kafka:
    resources:
      requests:
        memory: "512Mi"
        cpu: "200m"
      limits:
        memory: "1Gi"
        cpu: "1000m"
  entity_operator:
    user_operator:
      resources:
        requests:
          memory: "512Mi"
          cpu: "200m"
        limits:
          memory: "512Mi"
          cpu: "1000m"

Info