← 返回发布中心

Think RMS · VMware vSphere 虚拟化平台接入使用说明

版本 v1.1.1 | 适用补丁包 rms-patch-1.1.1.tar.gz | 适用 RMS v1.0.0 及以上 本补丁为 RMS 增加 vCenter 平台级监控:一台探针直连 vCenter API,自动发现并采集 全部 数据中心 / 集群 / ESXi 主机 / 虚拟机 / 数据存储,无需在每台虚拟机内安装探针; 并提供按部门 / 业务分组的资源统计报表与容量告警。

v1.1.1 离线零依赖版:补丁内置免安装 Python3 运行时,目标机无需联网、无需预装 python, 一键升级;不再包含校验码环节。仅支持 x86_64 Linux(glibc ≥ 2.17,CentOS 7 及以上)。


1. 能力总览

能力 说明
平台级采集 Categraf input.vsphere 插件直连 vCenter(https://<vcenter>/sdk),一个账号覆盖整个虚拟化平台
五层自动发现 datacenter / cluster / host(ESXi) / vm / datastore,拓扑标签自动附带(datacentername/clustername/esxhostname/vmname/dsname)
部门/业务分组 通过 vCenter 自定义属性 dept、biz 打标,采集后自动转为指标 label
统计报表 7 条记录规则预聚合为 virtualization_* 指标 + 2 张看板(平台总览、部门/业务报表)
容量告警 6 条告警规则:主机 CPU/内存饱和、数据存储容量告急/预警、VM CPU 争用、采集中断

1.1 核心指标名(看板/告警/自助查询通用)

层级 指标 含义
虚拟机 vsphere_vm_cpu_usage_average VM CPU 利用率(%)
虚拟机 vsphere_vm_mem_usage_average VM 内存利用率(%)
虚拟机 vsphere_vm_cpu_ready_summation CPU 就绪等待(ms),争用/Co-Stop 信号
主机 vsphere_host_cpu_usage_average ESXi 主机 CPU 利用率(%)
主机 vsphere_host_mem_usage_average ESXi 主机内存利用率(%)
数据存储 vsphere_datastore_disk_used_latest / vsphere_datastore_disk_capacity_latest 已用 / 总容量(Byte)
预聚合 virtualization_vm_count 等 virtualization_* 按 dept/biz/cluster 聚合的报表指标(记录规则产出)

2. 前置条件


3. 补丁安装(RMS 宿主机执行,离线一键)

  1. 从发布页下载补丁(公开直链,无需凭据): https://rms.thinkalike.com.cn/dl/rms-patch-1.1.1.tar.gz(约 30MB,含内置 Python3 运行时)
  2. 上传到 RMS 宿主机并解压安装(root 执行,幂等可重跑,全程不需要外网):
tar xzf rms-patch-1.1.1.tar.gz -C /tmp && cd /tmp/rms-patch-1.1.1
bash install_patch.sh                      # 一键升级:自动读取 /opt/rms/.env 凭据
# 或显式指定:bash install_patch.sh --rms-home /opt/rms --user admin --password 'xxx'

脚本自动完成:环境自检(x86_64/磁盘/docker)→ 备份 compose 与集成目录 → 落地 vSphere 集成物料 → 选择 Python(系统 python3≥3.6 可用则复用,否则自动解包内置运行时到 /opt/rms/py3)→ 追加 compose 挂载 → 重启 rms-n9e → 播种「虚拟化平台」业务组、2 张看板、7 条记录规则、6 条告警。 输出 PATCH_INSTALL_OK 即成功;回滚方法见脚本末尾提示(恢复 patch-bak-v1.1.1-* 备份目录)。

  1. 验证:浏览器进入 RMS → 业务组「虚拟化平台」,可见两张看板: vSphere 虚拟化平台总览、虚拟化资源统计(部门/业务分组)。

4. 接入 vCenter(探针机配置)

4.1 放置采集模板

补丁已内置模板 /opt/rms/etc-integrations/vSphere/collect/vsphere/vsphere.toml。 在探针机的 Categraf 配置目录(RMS 宿主机部署默认 /opt/rms/etc/categraf/conf/input.vsphere/, 若探针独立部署则为该机 conf/ 目录)下新建 vsphere.toml,按模板填写。

4.2 vCenter 侧准备(只读监控账号)

  1. 登录 vCenter Host Client / Flash Client;
  2. 菜单 → 管理 → 访问控制 → 角色 → 新建角色「RMS-Monitor」,仅勾选只读权限项: 全局 → 全局(查看)、主机 → 清单(查看)、资源 → 池/主机/虚拟机(查看)、虚拟机 → 虚拟机配置(查看)、数据中心 → 清单(查看);切勿授予任何电源操作/编辑/删除类权限;
  3. 在全局(vCenter 根对象)→ 权限 → 添加权限:选择本地用户(如 monitor@vsphere.local)+ 角色 RMS-Monitor + 传播到子对象。

4.3 最小可用配置

interval = 60

[[instances]]
  vcenter = "https://vcenter.example.local/sdk"   # 注意带 /sdk 后缀
  username = "monitor@vsphere.local"
  password = "实际口令"
  insecure_skip_verify = true                      # 自签证书场景
  vm_instances = true
  host_instances = true
  cluster_instances = true
  datastore_instances = true
  datacenter_instances = true
  custom_attribute_include = ["dept", "biz"]       # 部门/业务打标透出

多 vCenter:复制整段 [[instances]] 块即可,各实例独立采集。

4.4 重启探针并验证

systemctl restart categraf            # 或 docker restart rms-categraf
journalctl -u categraf --since -2m | grep -i vsphere   # 应无 error

在 RMS → 指标 explorer 查询 vsphere_vm_cpu_usage_average,1~2 个采集周期(约 2 分钟)后应有数据; ESXi 主机/集群/数据存储层指标来自 vCenter 性能 API 的 5 分钟粒度统计,首批数据到位约 5~10 分钟,属正常现象。

4.5 常见接入问题

现象 原因与处理
cannot connect to vCenter / context deadline 探针机到 vCenter 443 不通;curl -k https://<vcenter>/sdk 自检
ServerFaultCode: Cannot complete login due to an incorrect user name or password 账号口令错,或被 vCenter 锁定(连续失败会锁 15 分钟)
有 VM 指标、无集群/数据存储指标 historical_interval 与 vCenter 统计粒度不一致,或权限不足;确认 4.3 五层开关全开
证书报错 保持 insecure_skip_verify = true,或改为 tls_ca 指定 vCenter 根证书
vCenter 负载升高 收窄 vm_metric_include 白名单、interval 提到 120、collect_concurrency 保持 ≤2

5. 部门 / 业务分组打标(报表前提)

记录规则与部门报表基于指标上的 dept、biz 两个 label 聚合,其来源是 vCenter 自定义属性:

  1. vCenter → 菜单 → 策略和配置文件 → 自定义属性 → 新建:名称 dept(类型:虚拟机)、名称 biz(类型:虚拟机);
  2. 给每台 VM 编辑 → 监控 → 自定义属性 → 赋值,如 dept=研发部、biz=核心交易; (批量场景可用 PowerCLI:Get-VM web-01 | New-CustomAttribute -Name dept -Value 研发部,或 vCenter API/Ansible);
  3. 打标后下一个采集周期(60s)指标自动携带 dept/biz label;未打标的 VM label 为空,总览看板仍可见,部门报表不计入。

看板变量 dept / biz 的下拉枚举通过 label 自动发现,无需维护。


6. 看板与报表使用

6.1 vSphere 虚拟化平台总览

面向平台运维视角:资产盘点(数据中心/集群/主机/VM/数据存储数量 stat 卡)、 集群 CPU/内存水位趋势、ESXi 主机热点 Top10、虚拟机资源消耗 Top20 明细表、数据存储使用率排行。 支持按 datasource / datacenter / cluster 变量下钻。

6.2 虚拟化资源统计(部门/业务分组)

面向管理者/成本视角:部门×业务维度的 VM 数、CPU/内存均值与 24h 峰值台账(tableNG), 支持 dept / biz 变量过滤。数据来自 virtualization_* 记录规则,查询轻量、加载快。

6.3 按需出报表


7. 告警与记录规则

安装后自动登记(业务组「虚拟化平台」,数据源绑定默认 Prometheus/VictoriaMetrics 数据源):

告警 触发条件 级别
ESXi 主机 CPU 饱和 vsphere_host_cpu_usage_average > 90(5m) P2
ESXi 主机内存压力 vsphere_host_mem_usage_average > 90(5m) P2
数据存储容量告急 使用率 > 95% P1
数据存储容量预警 使用率 > 85% P3
虚拟机 CPU 争用 cpu.ready / cpu.used > 10%(Co-Stop 前兆) P3
vCenter 采集中断 vsphere_vm_cpu_usage_average absent(10m) P1

记录规则 7 条(virtualization_vm_count / cpu_usage_avg / mem_usage_avg / cpu_usage_max_24h / cluster_cpu_usage_avg / cluster_mem_usage_avg / datastore_usage_pct), 每分钟/每 5 分钟评估一次,聚出的新指标可直接用于自建看板与二次告警。

告警通知渠道(邮件/钉钉/企微/短信)请在 RMS「告警 → 通知渠道」配置后,将上述规则绑定到对应订阅策略。


8. 升级 / 回滚 / 卸载


9. 支持

产品问题请联系交付团队,附:docker logs rms-n9e --since 10m、探针机 categraf 日志中 vsphere 片段、vCenter 版本号。