三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

服务器硬件巡检只能靠人跑机房吗?DCMP 带外监控实践

服务器硬件巡检只能靠人跑机房吗?DCMP 带外监控实践

机房设备一多,硬件巡检就成了个绕不过去的活。每周或者每月去机房走一圈,看指示灯、听风扇、抄面板,回来再更新台账,忙半天还是会漏。

而且有些故障你站在机器面前也看不出来。双电源坏了一路,另一路顶着,机器照常跑,业务无感,指示灯就算有提示,一排机柜几十台设备靠肉眼一台台看也很容易漏。SSD 磨损度快到头了,指示灯不会因为盘还剩 5% 寿命就变红。

这些信息设备本身其实一直都有,在主板上那颗 BMC 芯片里,走带外通道就能取出来。下面说说我们智安维DCMP是怎么做的。

一、代替机房巡检

7×24 带外采集,有告警一分钟内通知到。每天一封巡检报告直接发到邮箱,不用登录系统,打开邮件就知道昨天机房什么情况。

报告里写清楚三件事:今天有没有问题、哪些要立刻处理、哪些可以观察。不是丢一堆传感器读数让人自己判断。

告警这块做了收敛和定级。BMC 上报的东西挺杂的,一个故障可能触发好几条,不做处理的话值班的人两天就麻木了。我们把同一个部件的多条事件合并成一条,标明严重程度,能直接拿去派单。

严重告警会定位到具体设备和机柜位置,比如哪个机房、哪一排、哪个机柜、第几个 U 位,不用再去翻台账找机器在哪。

二、自动生成设备台账

设备接进来的同时台账就长出来了,不用人工填。

厂商、型号、序列号、CPU 内存硬盘的部件级配置、所在机柜和 U 位、维保到期时间,都是自动采的。换一根内存、插一块硬盘,系统会自动更新并留痕,能看到什么时候换的、换的什么型号。

这块省的人力其实比告警还多。以前靠 Excel 维护台账,永远是过期的,人一走就断档,现在是账实同源的。

三、机房可视化管理

U 位用了多少还剩多少、电力负载多少、哪个机柜还能上架、PDU 使用率多少,一张报表说完。

季度上报的容量材料能直接生成,不用每次重新梳理,而且数据是从设备实采出来的,跟实际对得上。

数据是怎么采到的

这部分展开说一下,因为很多人对带外能拿到什么没概念。

服务器主板上有一颗独立的管理芯片 BMC,戴尔叫 iDRAC,HP 叫 iLO,华为叫 iBMC,联想那边是 XCC。它有独立的处理器、独立网口、独立供电,只要机器插着电,哪怕没开机、系统崩了,都能通过网络访问到它。这就是带外,走的是业务网络之外的一条独立通道。

这也是它和装 agent 的根本区别:agent 跑在操作系统里,机器一宕它第一个失联,而带外在机器关机、系统起不来的时候照样能采。

DCMP 走两个协议:

IPMI 2.0,老标准,基本所有服务器都支持。能拿到厂商型号序列号这类资产信息,以及温度、功率、风扇转速、电压这些传感器读数。局限是告警比较简陋,只知道有个告警,具体哪个部件什么原因说不清楚,部件清单也拿不全。

Redfish,DMTF 后来推的标准,走 HTTPS 加 JSON。能拿到的细得多:每根内存条在哪个插槽、什么型号什么容量、错误计数多少;硬盘的健康状态和 SSD 剩余寿命百分比;RAID 卡和逻辑卷状态;电源模块的具体输入输出。告警是部件级的,能直接定位到是哪一根内存、哪一块盘出的问题,这种告警才是能直接开工单的。另外 SEL 系统事件日志也在这条通道里,机器上次为什么宕的一般都写在里面。

老机器不一定支持 Redfish,所以实际是两个协议混着用,能走 Redfish 的走 Redfish,不行的用 IPMI 兜底。

支持哪些设备

服务器这块戴尔、HP、浪潮、华为、联想这些主流厂商都在跑,信创服务器和国产算力设备也做了适配。

存储和网络设备走 SNMP 纳管,交换机、路由器、防火墙、存储阵列都能接进来,采基础运行状态和台账信息。深度上比不了服务器那一层,但机房管理本来就不只有服务器,设备清单、机柜里放了什么、容量还剩多少,得把这些都算进去才是完整的一张视图。

社区版免费

100 台纳管设备以内免费用,功能包括巡检报告、设备台账、容量统计。一台虚机就能部署,官网 www.dcmp.cn可以直接下载安装包。

← 返回列表