telemetry_config.yml¶
This file configures telemetry sources (iDRAC, LDMS, DCGM, PowerScale, UFM, VAST, OpenManage Enterprise), telemetry bridges (Vector-LDMS, Vector-OME), and telemetry sinks (VictoriaMetrics, VictoriaLogs, Kafka). It also includes component-specific configurations for each telemetry source.
Supported Telemetry Sources, Bridges and Sinks¶
| Source | Description | Sinks |
|---|---|---|
| iDRAC | Out-of-band hardware metrics (power, thermal, storage health) from Dell servers via Redfish | Kafka, VictoriaMetrics |
| LDMS | In-band OS metrics (CPU, memory, network, I/O) from Slurm compute nodes | Kafka, VictoriaMetrics (via Vector-LDMS) |
| PowerScale | Storage performance metrics and logs from Dell PowerScale clusters | VictoriaMetrics, VictoriaLogs |
| UFM | NVIDIA UFM InfiniBand Fabric Manager metrics (IB port state, transmit/receive data, error counters, fabric topology) and syslog logs | VictoriaMetrics, VictoriaLogs |
| VAST | Storage performance metrics and syslog events from VAST Storage appliances | VictoriaMetrics, VictoriaLogs |
| OpenManage Enterprise (OME) | Server inventory, health, alerts, and audit logs from Dell OME via Kafka mTLS | Kafka, VictoriaMetrics, VictoriaLogs (via Vector-OME) |
| SFM | Network telemetry metrics from Smart Fabric Manager | VictoriaMetrics |
Kafka PV Sizing Guidance¶
Set persistence_size in input/telemetry_config.yml under telemetry_sinks.kafka according to the table below. This value is applied per Kafka pod.
| Telemetry Sources | Node Count | Retention | Kafka PV Size |
|---|---|---|---|
| iDRAC only | 50 nodes | 7 days | 128Gi per broker |
| iDRAC only | 200 nodes | 7 days | 512Gi per broker |
| iDRAC + LDMS | 50 nodes | 7 days | 200Gi per broker |
| iDRAC + LDMS | 200 nodes | 7 days | 800Gi per broker |
| iDRAC + LDMS + DCGM | 200 nodes | 7 days | 1Ti per broker |
| iDRAC + LDMS + DCGM | 500+ nodes | 7 days | 2Ti per broker |
Note
- Kafka does not enable compression by default. All telemetry data (iDRAC, LDMS, DCGM) is stored uncompressed.
- Each Kafka topic uses a replication factor of 2. The PV size recommendations already account for this.
- Actual storage consumption varies based on iDRAC metric report group subscriptions, LDMS sampler plugin count, sampling intervals, and DCGM collection frequency.
- Controllers use minimal storage (~100Mi for metadata) but share the same
persistence_sizesetting as brokers. - If
log_retention_hoursis increased beyond the default of 168 (7 days), scale the PV size proportionally.
Monitor actual usage after deployment. If any broker exceeds 70% of its PV capacity within the first 3-4 days, increase persistence_size and redeploy to avoid filling the disk before the 7-day retention window.
Parameter Reference¶
Telemetry Configuration Parameters¶
|
Parameter |
Details |
|---|---|
|
telemetry_sources dict / required |
Data collectors — each source can be independently enabled/disabled. |
|
idrac dict / required |
iDRAC hardware metrics from Dell PowerEdge servers. |
|
metrics_enabled boolean / required |
Enable or disable iDRAC metrics collection from Dell PowerEdge servers Collected metrics: temperature, power, fan speed, storage health, CPU/memory errors Data path: iDRAC Receiver -> ActiveMQ -> KafkaPump -> Kafka 'idrac' topic iDRAC Receiver -> ActiveMQ -> VictoriaPump -> vmagent -> victoria_metrics Accepted values: Default value: Note
|
|
collection_targets list / elements=string / required |
Collection targets define where iDRAC data is sent before Vector processing Supported values: Multiple targets: Can specify both [ Default: [ |
|
ldms dict / required |
Lightweight Distributed Metric Service for compute node metrics. |
|
metrics_enabled boolean / required |
Enable or disable LDMS metrics collection from compute nodes Collected metrics: CPU, memory, network, disk metrics Data path: LDMS samplers → LDMS aggregator → store_avro_kafka → Kafka 'ldms' topic Accepted values: Default value: |
|
collection_targets list / elements=string / required |
LDMS only supports Kafka collection (no direct victoria_metrics path) Vector-LDMS bridge consumes from Kafka and routes to victoria_metrics Supported values: Default: [ |
|
dcgm dict / required |
NVIDIA Data Center GPU Manager telemetry. |
|
metrics_enabled boolean / required |
Enable or disable DCGM (NVIDIA Data Center GPU Manager) metrics collection Collected metrics: GPU temperature, utilization, memory, ECC errors, power Requires: NVIDIA GPU driver installed on compute nodes Accepted values: Default value: |
|
powerscale dict / required |
Dell PowerScale (OneFS) storage telemetry. |
|
metrics_enabled boolean / required |
Enable or disable PowerScale metrics collection from Dell PowerScale (OneFS) storage Collected metrics: Storage metrics from Dell PowerScale clusters Requires: CSM Observability (Karavi) values file configured Data path: CSM Metrics PowerScale → OTEL Collector → vmagent(shared) → victoria_metrics Accepted values: Default value: |
|
logs_enabled boolean |
Enable or disable PowerScale logs collection Accepted values: Default value: |
|
collection_targets list / elements=string / required |
PowerScale uses dedicated vmagent(shared) (no Kafka, no Vector) Supported values: Default: [ |
|
ufm dict / required |
NVIDIA UFM InfiniBand Fabric telemetry. |
|
metrics_enabled boolean / required |
Enable or disable UFM (NVIDIA UFM InfiniBand Fabric Manager) metrics collection Collected metrics: IB port state, transmit/receive data, error counters, fabric topology Requires: NVIDIA UFM appliance with Prometheus exporter enabled Data path: UFM Prometheus Exporter → vmagent(shared) → victoria_metrics Accepted values: Default value: |
|
logs_enabled boolean |
Enable or disable UFM syslog logs collection Accepted values: Default value: |
|
collection_targets list / elements=string / required |
UFM uses vmagent(shared) for metrics and VLAgent for logs Supported values: Default: [ |
|
vast dict / required |
VAST Data Storage telemetry. |
|
metrics_enabled boolean / required |
Enable or disable VAST (Data Storage) metrics collection Collected metrics: IB port state, transmit/receive data, error counters, fabric topology Requires: VAST appliance with Prometheus exporter enabled Data path: Prometheus Exporter → vmagent(shared) → victoria_metrics Accepted values: Default value: |
|
logs_enabled boolean |
Enable or disable VAST syslog logs collection Accepted values: Default value: |
|
collection_targets list / elements=string / required |
VAST uses vmagent(shared) for metrics and VLAgent for logs Supported values: Default: [ |
|
ome dict / required |
Dell OpenManage Enterprise telemetry. OME publishes to Kafka; Vector-OME bridge routes to Victoria sinks. |
|
metrics_enabled boolean / required |
Enable or disable Vector-OME metrics routing (Kafka-to-Victoria bridge for OME metrics) Data flow: Kafka 'ome.*' topics → Vector-OME → vmagent-vector (metrics) Requires: OME to be configured with kafka Accepted values: Default value: |
|
logs_enabled boolean / required |
Enable or disable OME logs collection Accepted values: Default value: |
|
collection_targets list / elements=string / required |
OME only supports Kafka collection. Vector-OME bridge routes to victoria_metrics/victoria_logs. Default: [ |
|
telemetry_bridges dict / required |
Data routers — Vector pods that consume from Kafka and produce to Victoria sinks. |
|
vector_ldms dict / required |
Vector-LDMS: Kafka-to-victoria_metrics bridge for LDMS metrics. |
|
metrics_enabled boolean / required |
Enable or disable Vector-LDMS bridge (Kafka-to-victoria_metrics bridge for LDMS metrics) Purpose: Consume LDMS metrics from Kafka 'ldms' topic, transform NERSC schema to Prometheus format, and write to victoria_metrics Data flow: Kafka 'ldms' topic → Vector-LDMS → vmagent-vector → victoria_metrics Requires: telemetry_sources > ldms > metrics_enabled = true Accepted values: Default value: |
|
vector_ome dict / required |
Vector-OME: Kafka-to-Victoria bridge for OME metrics and logs. |
|
metrics_enabled boolean / required |
Enable or disable Vector-OME metrics routing (Kafka-to-Victoria bridge for OME metrics) Data flow: Kafka 'ome.*' topics → Vector-OME → vmagent-vector (metrics) Requires: OME to be configured with kafka Accepted values: Default value: |
|
logs_enabled boolean / required |
Enable or disable Vector-OME logs routing Data flow: Kafka 'ome.*' topics → Vector-OME → vlagent-vector (logs) Accepted values: Default value: |
|
ome_identifier string / required |
Identifier used by Vector-OME for topic identification and routing Internally used to match topics with the prefix (e.g., minLength: 1 Default value: Note: Change only if your OME Kafka topics use a different prefix |
|
telemetry_sinks dict / required |
Storage backends — auto-enabled when at least one source targets them. |
|
victoria_metrics dict / required |
victoria_metrics time-series database for metrics. |
|
persistence_size string / required |
Storage per vmstorage pod PVC Important: Total VictoriaMetrics storage depends on deployment mode: Single-node mode: Total storage = Cluster mode: Total storage = Example (cluster): Accepted values: Must be specified in the form of Default value: |
|
retention_period integer / required |
Metric retention period in hours Default: 168 (7 days) |
|
additional_metric_remote_write_endpoints list / elements=dict |
Additional remote write endpoints for metrics (optional) Purpose: Send metrics to external VictoriaMetrics instances in addition to Omnia-managed VictoriaMetrics Format: List of endpoint objects with 'url' field (must start with http:// or https://) TLS: Set 'tls_insecure_skip_verify: true' to skip TLS certificate verification Default: [] (empty — only Omnia VictoriaMetrics receives metrics) Example: - url: https://external-metrics-server:8480/insert/0/prometheus/api/v1/write tls_insecure_skip_verify: false |
|
url string / required |
Metrics remote_write endpoint URL. |
|
tls_insecure_skip_verify boolean |
Skip TLS certificate verification for this endpoint. Default: |
|
victoria_logs dict / required |
victoria_logs centralized log storage. |
|
storage_size string / required |
Storage per vlstorage pod PVC Total storage = storage_size × 3 vlstorage pods Accepted values: Must be specified in the form of Default value: Sizing formula: (140 MB/day × retention_days × node_count) / 3 replicas Warning Storage under-provisioning can lead to data loss before the retention period is reached. Calculate storage requirements based on expected log volume and retention needs. |
|
retention_period integer / required |
Log retention period in hours Accepted values: 24-8760 (1 day to 1 year) Default: 168 (7 days) Note
|
|
additional_log_write_endpoints list / elements=dict |
Additional remote write endpoints for logs (optional) Purpose: Send logs to external VictoriaLogs instances in addition to Omnia-managed VictoriaLogs Format: List of endpoint objects with 'url' field (must start with http:// or https://) TLS: Set 'tls_insecure_skip_verify: true' to skip TLS certificate verification Default: [] (empty — only Omnia VictoriaLogs receives logs) Example: - url: https://external-logs-server:9481/internal/insert tls_insecure_skip_verify: false |
|
url string / required |
Logs remote_write endpoint URL. |
|
tls_insecure_skip_verify boolean |
Skip TLS certificate verification for this endpoint. Default: |
|
kafka dict / required |
Apache Kafka distributed streaming platform. |
|
persistence_size string / required |
Storage per Kafka pod PVC Total = persistence_size × 6 pods (3 brokers + 3 controllers) Accepted values: Must be specified in the form of Default value: The default Caution Ensure that the Kafka broker settings |
|
log_retention_hours integer / required |
Log retention period in hours Default: 168 (7 days) |
|
log_retention_bytes integer / required |
Maximum size of Kafka logs (in bytes) before deletion Default: -1 (unlimited) |
|
log_segment_bytes integer / required |
Maximum size of Kafka log segments (in bytes) Default: 1073741824 (1 GB) |
|
topic_partitions dict / required |
Topic partitions per source (object format, not array) Format: {topic_name: partition_count} Required when: Source has kafka in collection_targets Allowed topics: Default partition counts: Example: {idrac: 1, ldms: 2} |
|
idrac integer |
Number of partitions for the 'idrac' topic. Range: 1-100. Default: |
|
ldms integer |
Number of partitions for the 'ldms' topic. Range: 1-100. Default: |
|
ldms_configurations dict / required |
LDMS-specific configurations for aggregator, store, and sampler. |
|
agg_port integer / required |
Aggregator port on service K8s cluster Valid range: 6001-6100 Default: 6001 |
|
store_port integer / required |
Store daemon port on service K8s cluster The port can be the same as LDMS aggregator port Valid range: 6001-6100 Default: 6001 |
|
sampler_port integer / required |
Sampler port on compute nodes Valid range: 10001-10100 Default: 10001 |
|
sampler_plugins list / elements=dict / required |
Sampler plugins define which metrics to collect from compute nodes Parameters: plugin_name: Name of the LDMS sampler plugin config_parameters: Plugin-specific configuration (as a single string) activation_parameters: Collection schedule in MICROSECONDS Format: Example: Default plugins:
Default activation_parameters: |
|
plugin_name string / required |
Name of the LDMS sampler plugin. |
|
config_parameters string |
Plugin-specific configuration parameters as a single string. |
|
activation_parameters string / required |
Activation parameters (e.g., 'interval=30000000 offset=0'). |
|
powerscale_configurations dict / required |
PowerScale telemetry detailed configurations. |
|
otel_collector_storage_size string / required |
PVC size for OTEL Collector metric batching and buffering Accepted values: Must be specified in the form of Default value: |
|
csm_observability_values_file_path string / required |
Path to the CSM Observability (Karavi Observability) values.yaml file Required when: telemetry_sources > powerscale > metrics_enabled: true Reference: https://raw.githubusercontent.com/dell/helm-charts/refs/heads/release-v1.17.1/charts/karavi-observability/values.yaml Default value: Note
|
|
ufm_configuration dict / required |
UFM telemetry detailed configurations. |
|
ufm_endpoint string |
UFM appliance IP address or hostname Required when: telemetry_sources > ufm > metrics_enabled is true Example: Default value: |
|
ufm_metrics_port integer |
UFM Prometheus exporter port Default value: 9001 (UFM default Prometheus port) |
|
scrape_interval string |
Prometheus scrape interval for UFM metrics Accepted values: Prometheus duration format (e.g., Default value: |
|
scrape_timeout string |
Prometheus scrape timeout (must be <= scrape_interval) Accepted values: Prometheus duration format (e.g., Default value: |
|
tls_mode string |
TLS mode for connecting to UFM Prometheus endpoint Accepted values: self_signed: Skip TLS verification (insecure_skip_verify=true) ca_signed: Use CA certificate for TLS verification Default value: |
|
ufm_ca_cert_path string |
Path to CA certificate file for UFM TLS verification Required when: tls_mode is Must be a valid PEM-format certificate file Default value: |
|
auth_mode string |
Authentication mode for UFM Prometheus endpoint Accepted values: basic: Use ufm_username/ufm_password from omnia_config_credentials.yml none: No authentication (UFM endpoint is open) Default value: |
|
vast_configuration dict / required |
VAST telemetry detailed configurations. |
|
vast_endpoint string |
VAST appliance IP address or hostname Required when: telemetry_sources > vast > metrics_enabled is true Example: Default value: |
|
vast_metrics_port integer |
VAST Prometheus exporter port Default value: 9001 (VAST default Prometheus port) |
|
metrics_path string |
Prometheus metrics path for VAST API. Default: |
|
scrape_interval string |
Prometheus scrape interval for VAST metrics Accepted values: Prometheus duration format (e.g., Default value: |
|
scrape_timeout string |
Prometheus scrape timeout (must be <= scrape_interval) Accepted values: Prometheus duration format (e.g., Default value: |
|
tls_mode string |
TLS mode for connecting to VAST Prometheus endpoint Accepted values: self_signed: Skip TLS verification (insecure_skip_verify=true) ca_signed: Use CA certificate for TLS verification Default value: |
|
vast_ca_cert_path string |
Path to CA certificate file for VAST TLS verification Required when: tls_mode is Must be a valid PEM-format certificate file Default value: |
|
auth_mode string |
Authentication mode for VAST Prometheus endpoint Accepted values: basic: Use vast_username/vast_password from omnia_config_credentials.yml none: No authentication (VAST endpoint is open) Default value: |
Telemetry Storage Configuration Parameters¶
|
Parameter |
Details |
|---|---|
|
victoria_cluster_storage dict / required |
VictoriaMetrics cluster resource configurations. |
|
vmstorage dict / required |
VMStorage resource configuration. |
|
replicas integer / required |
Number of vmstorage pod replicas Default value: 3 Note: For cluster mode, minimum 3 replicas are recommended for high availability |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vmstorage pods Default value: |
|
cpu string / required |
CPU request for vmstorage pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vmstorage pods Default value: |
|
cpu string / required |
CPU limit for vmstorage pods Default value: |
|
vminsert dict / required |
VMInsert resource configuration. |
|
replicas integer / required |
Number of vminsert pod replicas Default value: 2 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vminsert pods Default value: |
|
cpu string / required |
CPU request for vminsert pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vminsert pods Default value: |
|
cpu string / required |
CPU limit for vminsert pods Default value: |
|
vmselect dict / required |
VMSelect resource configuration. |
|
replicas integer / required |
Number of vmselect pod replicas Default value: 2 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vmselect pods Default value: |
|
cpu string / required |
CPU request for vmselect pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vmselect pods Default value: |
|
cpu string / required |
CPU limit for vmselect pods Default value: |
|
vmagent dict / required |
VMAgent resource configuration. |
|
replicas integer / required |
Number of vmagent pod replicas Default value: 1 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vmagent pods Default value: |
|
cpu string / required |
CPU request for vmagent pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vmagent pods Default value: |
|
cpu string / required |
CPU limit for vmagent pods Default value: |
|
victoria_logs_cluster_storage dict / required |
VictoriaLogs cluster resource configurations. |
|
vlstorage dict / required |
VLStorage resource configuration. |
|
replicas integer / required |
Number of vlstorage pod replicas Default value: 3 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vlstorage pods Default value: |
|
cpu string / required |
CPU request for vlstorage pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vlstorage pods Default value: |
|
cpu string / required |
CPU limit for vlstorage pods Default value: |
|
vlinsert dict / required |
VLInsert resource configuration. |
|
replicas integer / required |
Number of vlinsert pod replicas Default value: 2 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vlinsert pods Default value: |
|
cpu string / required |
CPU request for vlinsert pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vlinsert pods Default value: |
|
cpu string / required |
CPU limit for vlinsert pods Default value: |
|
vlselect dict / required |
VLSelect resource configuration. |
|
replicas integer / required |
Number of vlselect pod replicas Default value: 2 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vlselect pods Default value: |
|
cpu string / required |
CPU request for vlselect pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vlselect pods Default value: |
|
cpu string / required |
CPU limit for vlselect pods Default value: |
|
vlagent dict / required |
VLAgent resource configuration. |
|
replicas integer / required |
Number of vlagent pod replicas Default value: 1 |
|
pvc_size string / required |
PVC size for vlagent pods Default value: |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vlagent pods Default value: |
|
cpu string / required |
CPU request for vlagent pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vlagent pods Default value: |
|
cpu string / required |
CPU limit for vlagent pods Default value: |
|
vector_storage dict / required |
Vector component resource configurations. |
|
ldms dict / required |
Vector-LDMS resource configuration. |
|
replicas integer / required |
Number of Vector-LDMS pod replicas Default value: 1 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for Vector-LDMS pods Default value: |
|
cpu string / required |
CPU request for Vector-LDMS pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for Vector-LDMS pods Default value: |
|
cpu string / required |
CPU limit for Vector-LDMS pods Default value: |
|
ome dict / required |
Vector-OME resource configuration. |
|
replicas integer / required |
Number of Vector-OME pod replicas Default value: 1 |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for Vector-OME pods Default value: |
|
cpu string / required |
CPU request for Vector-OME pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for Vector-OME pods Default value: |
|
cpu string / required |
CPU limit for Vector-OME pods Default value: |
|
vlagent_vector dict / required |
VLAgent-Vector resource configuration. |
|
replicas integer / required |
Number of vlagent-vector pod replicas Default value: 1 |
|
pvc_size string / required |
PVC size for vlagent-vector pods Default value: |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vlagent-vector pods Default value: |
|
cpu string / required |
CPU request for vlagent-vector pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vlagent-vector pods Default value: |
|
cpu string / required |
CPU limit for vlagent-vector pods Default value: |
|
vmagent_vector dict / required |
VMAgent-Vector resource configuration. |
|
replicas integer / required |
Number of vmagent-vector pod replicas Default value: 1 |
|
pvc_size string / required |
PVC size for vmagent-vector pods Default value: |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for vmagent-vector pods Default value: |
|
cpu string / required |
CPU request for vmagent-vector pods Default value: |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for vmagent-vector pods Default value: |
|
cpu string / required |
CPU limit for vmagent-vector pods Default value: |
|
csi_volume_exporter_storage dict / required |
CSI Volume Exporter resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU request for CSI Volume Exporter pods. |
|
memory string / required |
Memory request for CSI Volume Exporter pods. |
|
limits dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU limit for CSI Volume Exporter pods. |
|
memory string / required |
Memory limit for CSI Volume Exporter pods. |
|
csm_metrics_powerscale_storage dict / required |
CSM Metrics PowerScale resource configuration. |
|
requests dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU request for CSM Metrics PowerScale pods. |
|
memory string / required |
Memory request for CSM Metrics PowerScale pods. |
|
limits dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU limit for CSM Metrics PowerScale pods. |
|
memory string / required |
Memory limit for CSM Metrics PowerScale pods. |
|
kafka_storage dict / required |
Kafka storage resource configuration. Required when kafka is in collection_targets for any source. |
|
kafka dict / required |
Kafka broker resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for Kafka broker pods. |
|
cpu string / required |
CPU request for Kafka broker pods. |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for Kafka broker pods. |
|
cpu string / required |
CPU limit for Kafka broker pods. |
|
entity_operator dict / required |
Kafka Entity Operator resource configuration. |
|
user_operator dict / required |
Kafka User Operator resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory request for Kafka User Operator pods. |
|
cpu string / required |
CPU request for Kafka User Operator pods. |
|
limits dict / required |
Kubernetes resource specifications. |
|
memory string / required |
Memory limit for Kafka User Operator pods. |
|
cpu string / required |
CPU limit for Kafka User Operator pods. |
|
idrac_telemetry_storage dict / required |
iDRAC Telemetry container resource configuration. Required when iDRAC metrics are enabled. |
|
mysqldb dict / required |
MySQL database container resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU request for mysqldb container. |
|
memory string / required |
Memory request for mysqldb container. |
|
limits dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU limit for mysqldb container. |
|
memory string / required |
Memory limit for mysqldb container. |
|
activemq dict / required |
ActiveMQ container resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU request for activemq container. |
|
memory string / required |
Memory request for activemq container. |
|
limits dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU limit for activemq container. |
|
memory string / required |
Memory limit for activemq container. |
|
receiver dict / required |
iDRAC telemetry receiver container resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU request for receiver container. |
|
memory string / required |
Memory request for receiver container. |
|
limits dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU limit for receiver container. |
|
memory string / required |
Memory limit for receiver container. |
|
kafka_pump dict / required |
Kafka pump container resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU request for kafka_pump container. |
|
memory string / required |
Memory request for kafka_pump container. |
|
limits dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU limit for kafka_pump container. |
|
memory string / required |
Memory limit for kafka_pump container. |
|
victoria_pump dict / required |
Victoria pump container resource configuration. |
|
resources dict / required |
Resource requests and limits. |
|
requests dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU request for victoria_pump container. |
|
memory string / required |
Memory request for victoria_pump container. |
|
limits dict / required |
Kubernetes resource specifications. |
|
cpu string / required |
CPU limit for victoria_pump container. |
|
memory string / required |
Memory limit for victoria_pump container. |
Usage example¶
---
telemetry_sources:
idrac:
metrics_enabled: true
collection_targets:
- "victoria_metrics"
- "kafka"
ldms:
metrics_enabled: true
collection_targets:
- "kafka"
dcgm:
metrics_enabled: true
powerscale:
metrics_enabled: true
logs_enabled: true
collection_targets:
- "victoria_metrics"
- "victoria_logs"
ufm:
metrics_enabled: false
logs_enabled: false
collection_targets:
- "victoria_metrics"
- "victoria_logs"
vast:
metrics_enabled: false
logs_enabled: false
collection_targets:
- "victoria_metrics"
- "victoria_logs"
ome:
metrics_enabled: true
logs_enabled: true
collection_targets:
- "kafka"
telemetry_bridges:
vector_ldms:
metrics_enabled: true
vector_ome:
metrics_enabled: true
logs_enabled: true
ome_identifier: "ome"
telemetry_sinks:
victoria_metrics:
persistence_size: "8Gi"
retention_period: 168
additional_metric_remote_write_endpoints: []
victoria_logs:
storage_size: "8Gi"
retention_period: 168
additional_log_write_endpoints: []
kafka:
persistence_size: "8Gi"
log_retention_hours: 168
log_retention_bytes: -1
log_segment_bytes: 1073741824
topic_partitions:
idrac: 1
ldms: 2
idrac_telemetry_configurations:
mysqldb_storage: "1Gi"
ldms_configurations:
agg_port: 6001
store_port: 6001
sampler_port: 10001
sampler_plugins:
- plugin_name: meminfo
config_parameters: ""
activation_parameters: "interval=30000000"
- plugin_name: procstat2
config_parameters: ""
activation_parameters: "interval=30000000"
- plugin_name: vmstat
config_parameters: ""
activation_parameters: "interval=30000000"
- plugin_name: loadavg
config_parameters: ""
activation_parameters: "interval=30000000"
- plugin_name: procnetdev2
config_parameters: ""
activation_parameters: "interval=30000000 offset=0"
powerscale_configurations:
otel_collector_storage_size: "5Gi"
csm_observability_values_file_path: ""
ufm_configuration:
ufm_endpoint: ""
ufm_metrics_port: 9001
scrape_interval: "30s"
scrape_timeout: "15s"
tls_mode: "self_signed"
ufm_ca_cert_path: ""
auth_mode: "basic"
vast_configuration:
vast_endpoint: ""
vast_metrics_port: 443
metrics_path: "/api/prometheusmetrics/all"
scrape_interval: "30s"
scrape_timeout: "15s"
tls_mode: "self_signed"
vast_ca_cert_path: ""
auth_mode: "basic"
---
victoria_cluster_storage:
vmstorage:
replicas: 3
resources:
requests:
memory: "1Gi"
cpu: "250m"
limits:
memory: "2Gi"
cpu: "1000m"
vminsert:
replicas: 2
resources:
requests:
memory: "256Mi"
cpu: "100m"
limits:
memory: "512Mi"
cpu: "500m"
vmselect:
replicas: 2
resources:
requests:
memory: "256Mi"
cpu: "100m"
limits:
memory: "512Mi"
cpu: "500m"
vmagent:
replicas: 2
resources:
requests:
memory: "128Mi"
cpu: "50m"
limits:
memory: "512Mi"
cpu: "250m"
victoria_logs_cluster_storage:
vlstorage:
replicas: 3
resources:
requests:
memory: "512Mi"
cpu: "100m"
limits:
memory: "1Gi"
cpu: "500m"
vlinsert:
replicas: 2
resources:
requests:
memory: "256Mi"
cpu: "100m"
limits:
memory: "512Mi"
cpu: "500m"
vlselect:
replicas: 2
resources:
requests:
memory: "256Mi"
cpu: "100m"
limits:
memory: "512Mi"
cpu: "500m"
vlagent:
replicas: 2
pvc_size: "5Gi"
resources:
requests:
memory: "64Mi"
cpu: "25m"
limits:
memory: "256Mi"
cpu: "100m"
vector_storage:
ldms:
replicas: 2
resources:
requests:
memory: "128Mi"
cpu: "50m"
limits:
memory: "256Mi"
cpu: "250m"
ome:
replicas: 2
resources:
requests:
memory: "256Mi"
cpu: "100m"
limits:
memory: "512Mi"
cpu: "500m"
vlagent_vector:
replicas: 2
pvc_size: "5Gi"
resources:
requests:
memory: "128Mi"
cpu: "50m"
limits:
memory: "256Mi"
cpu: "250m"
vmagent_vector:
replicas: 2
pvc_size: "5Gi"
resources:
requests:
memory: "128Mi"
cpu: "50m"
limits:
memory: "256Mi"
cpu: "250m"
csi_volume_exporter_storage:
resources:
requests:
cpu: "50m"
memory: "64Mi"
limits:
cpu: "200m"
memory: "256Mi"
csm_metrics_powerscale_storage:
requests:
cpu: "100m"
memory: "128Mi"
limits:
cpu: "500m"
memory: "512Mi"
idrac_telemetry_storage:
mysqldb:
resources:
requests:
cpu: "100m"
memory: "256Mi"
limits:
cpu: "500m"
memory: "512Mi"
activemq:
resources:
requests:
cpu: "100m"
memory: "512Mi"
limits:
cpu: "500m"
memory: "1536Mi"
receiver:
resources:
requests:
cpu: "100m"
memory: "128Mi"
limits:
cpu: "500m"
memory: "256Mi"
kafka_pump:
resources:
requests:
cpu: "50m"
memory: "128Mi"
limits:
cpu: "200m"
memory: "512Mi"
victoria_pump:
resources:
requests:
cpu: "50m"
memory: "128Mi"
limits:
cpu: "200m"
memory: "512Mi"
kafka_storage:
kafka:
resources:
requests:
memory: "512Mi"
cpu: "200m"
limits:
memory: "1Gi"
cpu: "1000m"
entity_operator:
user_operator:
resources:
requests:
memory: "512Mi"
cpu: "200m"
limits:
memory: "512Mi"
cpu: "1000m"
Info
- Idrac Metrics -- iDRAC metric catalog.
- Ldms Metrics -- LDMS sampler metric catalog.
- DCGM Metrics -- In-band GPU metric catalog (DCGM/ROCm).
- Ports -- Ports used by telemetry services.