版本 v1.1.1 | 适用补丁包
rms-patch-1.1.1.tar.gz| 适用 RMS v1.0.0 及以上 本补丁为 RMS 增加 vCenter 平台级监控:一台探针直连 vCenter API,自动发现并采集 全部 数据中心 / 集群 / ESXi 主机 / 虚拟机 / 数据存储,无需在每台虚拟机内安装探针; 并提供按部门 / 业务分组的资源统计报表与容量告警。v1.1.1 离线零依赖版:补丁内置免安装 Python3 运行时,目标机无需联网、无需预装 python, 一键升级;不再包含校验码环节。仅支持 x86_64 Linux(glibc ≥ 2.17,CentOS 7 及以上)。
| 能力 | 说明 |
|---|---|
| 平台级采集 | Categraf input.vsphere 插件直连 vCenter(https://<vcenter>/sdk),一个账号覆盖整个虚拟化平台 |
| 五层自动发现 | datacenter / cluster / host(ESXi) / vm / datastore,拓扑标签自动附带(datacentername/clustername/esxhostname/vmname/dsname) |
| 部门/业务分组 | 通过 vCenter 自定义属性 dept、biz 打标,采集后自动转为指标 label |
| 统计报表 | 7 条记录规则预聚合为 virtualization_* 指标 + 2 张看板(平台总览、部门/业务报表) |
| 容量告警 | 6 条告警规则:主机 CPU/内存饱和、数据存储容量告急/预警、VM CPU 争用、采集中断 |
| 层级 | 指标 | 含义 |
|---|---|---|
| 虚拟机 | vsphere_vm_cpu_usage_average |
VM CPU 利用率(%) |
| 虚拟机 | vsphere_vm_mem_usage_average |
VM 内存利用率(%) |
| 虚拟机 | vsphere_vm_cpu_ready_summation |
CPU 就绪等待(ms),争用/Co-Stop 信号 |
| 主机 | vsphere_host_cpu_usage_average |
ESXi 主机 CPU 利用率(%) |
| 主机 | vsphere_host_mem_usage_average |
ESXi 主机内存利用率(%) |
| 数据存储 | vsphere_datastore_disk_used_latest / vsphere_datastore_disk_capacity_latest |
已用 / 总容量(Byte) |
| 预聚合 | virtualization_vm_count 等 virtualization_* |
按 dept/biz/cluster 聚合的报表指标(记录规则产出) |
/opt/rms,rms-n9e 运行正常);/sdk 端点一致);https://rms.thinkalike.com.cn/dl/rms-patch-1.1.1.tar.gz(约 30MB,含内置 Python3 运行时)tar xzf rms-patch-1.1.1.tar.gz -C /tmp && cd /tmp/rms-patch-1.1.1
bash install_patch.sh # 一键升级:自动读取 /opt/rms/.env 凭据
# 或显式指定:bash install_patch.sh --rms-home /opt/rms --user admin --password 'xxx'
脚本自动完成:环境自检(x86_64/磁盘/docker)→ 备份 compose 与集成目录 → 落地 vSphere 集成物料 →
选择 Python(系统 python3≥3.6 可用则复用,否则自动解包内置运行时到 /opt/rms/py3)→
追加 compose 挂载 → 重启 rms-n9e → 播种「虚拟化平台」业务组、2 张看板、7 条记录规则、6 条告警。
输出 PATCH_INSTALL_OK 即成功;回滚方法见脚本末尾提示(恢复 patch-bak-v1.1.1-* 备份目录)。
补丁已内置模板 /opt/rms/etc-integrations/vSphere/collect/vsphere/vsphere.toml。
在探针机的 Categraf 配置目录(RMS 宿主机部署默认 /opt/rms/etc/categraf/conf/input.vsphere/,
若探针独立部署则为该机 conf/ 目录)下新建 vsphere.toml,按模板填写。
monitor@vsphere.local)+ 角色 RMS-Monitor + 传播到子对象。interval = 60
[[instances]]
vcenter = "https://vcenter.example.local/sdk" # 注意带 /sdk 后缀
username = "monitor@vsphere.local"
password = "实际口令"
insecure_skip_verify = true # 自签证书场景
vm_instances = true
host_instances = true
cluster_instances = true
datastore_instances = true
datacenter_instances = true
custom_attribute_include = ["dept", "biz"] # 部门/业务打标透出
多 vCenter:复制整段
[[instances]]块即可,各实例独立采集。
systemctl restart categraf # 或 docker restart rms-categraf
journalctl -u categraf --since -2m | grep -i vsphere # 应无 error
在 RMS → 指标 explorer 查询 vsphere_vm_cpu_usage_average,1~2 个采集周期(约 2 分钟)后应有数据;
ESXi 主机/集群/数据存储层指标来自 vCenter 性能 API 的 5 分钟粒度统计,首批数据到位约 5~10 分钟,属正常现象。
| 现象 | 原因与处理 |
|---|---|
cannot connect to vCenter / context deadline |
探针机到 vCenter 443 不通;curl -k https://<vcenter>/sdk 自检 |
ServerFaultCode: Cannot complete login due to an incorrect user name or password |
账号口令错,或被 vCenter 锁定(连续失败会锁 15 分钟) |
| 有 VM 指标、无集群/数据存储指标 | historical_interval 与 vCenter 统计粒度不一致,或权限不足;确认 4.3 五层开关全开 |
| 证书报错 | 保持 insecure_skip_verify = true,或改为 tls_ca 指定 vCenter 根证书 |
| vCenter 负载升高 | 收窄 vm_metric_include 白名单、interval 提到 120、collect_concurrency 保持 ≤2 |
记录规则与部门报表基于指标上的 dept、biz 两个 label 聚合,其来源是 vCenter 自定义属性:
dept(类型:虚拟机)、名称 biz(类型:虚拟机);dept=研发部、biz=核心交易;
(批量场景可用 PowerCLI:Get-VM web-01 | New-CustomAttribute -Name dept -Value 研发部,或 vCenter API/Ansible);dept/biz label;未打标的 VM label 为空,总览看板仍可见,部门报表不计入。看板变量 dept / biz 的下拉枚举通过 label 自动发现,无需维护。
面向平台运维视角:资产盘点(数据中心/集群/主机/VM/数据存储数量 stat 卡)、
集群 CPU/内存水位趋势、ESXi 主机热点 Top10、虚拟机资源消耗 Top20 明细表、数据存储使用率排行。
支持按 datasource / datacenter / cluster 变量下钻。
面向管理者/成本视角:部门×业务维度的 VM 数、CPU/内存均值与 24h 峰值台账(tableNG),
支持 dept / biz 变量过滤。数据来自 virtualization_* 记录规则,查询轻量、加载快。
virtualization_* 指标用 PromQL 自助拼装(指标 explorer → 另存看板面板)。安装后自动登记(业务组「虚拟化平台」,数据源绑定默认 Prometheus/VictoriaMetrics 数据源):
| 告警 | 触发条件 | 级别 |
|---|---|---|
| ESXi 主机 CPU 饱和 | vsphere_host_cpu_usage_average > 90(5m) |
P2 |
| ESXi 主机内存压力 | vsphere_host_mem_usage_average > 90(5m) |
P2 |
| 数据存储容量告急 | 使用率 > 95% |
P1 |
| 数据存储容量预警 | 使用率 > 85% |
P3 |
| 虚拟机 CPU 争用 | cpu.ready / cpu.used > 10%(Co-Stop 前兆) |
P3 |
| vCenter 采集中断 | vsphere_vm_cpu_usage_average absent(10m) |
P1 |
记录规则 7 条(virtualization_vm_count / cpu_usage_avg / mem_usage_avg / cpu_usage_max_24h / cluster_cpu_usage_avg / cluster_mem_usage_avg / datastore_usage_pct),
每分钟/每 5 分钟评估一次,聚出的新指标可直接用于自建看板与二次告警。
告警通知渠道(邮件/钉钉/企微/短信)请在 RMS「告警 → 通知渠道」配置后,将上述规则绑定到对应订阅策略。
install_patch.sh 幂等,重跑即覆盖更新物料与播种;/opt/rms/py3,仅播种脚本使用,不污染系统);docker-compose.yml 与 etc-integrations/ 至 /opt/rms/patch-bak-v1.1.1-<时间戳>/,恢复备份后 docker compose up -d n9e 即可;/opt/rms/etc-integrations/vSphere、移除 compose 中的 vSphere 挂载行并重启 n9e;看板/规则可在 RMS UI 内按名称批量删除。产品问题请联系交付团队,附:docker logs rms-n9e --since 10m、探针机 categraf 日志中 vsphere 片段、vCenter 版本号。