案例详情页
  • 下载
  • 开发
  • 文档
  • 学习
  • 支持
  • 社区
  • 动态
Repositories
EN
Repositories
EN
基于 openUBMC 北向自接入实现刀片机箱节点一体化健康管理

基于 openUBMC 北向自接入实现刀片机箱节点一体化健康管理

2026/07/30

一、应用背景

当前,AI 算力数据中心广泛采用高密度刀片机箱,单机箱内置多片独立刀片,每片刀片搭载专属 BMC 管理芯片。传统 BMC 仅支持单节点本地管控,彼此隔离形成管理孤岛,存在以下运维痛点:

  • sensor、fru_ctrl 等基础组件仅管理本机资源,缺少跨板通信接口;
  • 缺乏统一的数据聚合上报通道,网管系统只能逐一轮询各刀片 BMC;
  • 交换刀片 Web 界面缺少整机视角,无法集中查看整机刀片健康状态并远程控制;

多重限制叠加,进一步造成 IPMB 总线拥堵、页面卡顿、多终端数据不一致、故障发现滞后等问题,大幅降低集群运维效率。

二、解决方案

昆仑太科基于 openUBMC 开源架构自研 health_manager 专用管理组件,部署于交换刀片 BMC,充分利用社区北向自接入能力,将 UDP 上报、Web 展示、MDB 接口扩展等北向功能以独立组件形式接入框架,使团队得以聚焦于跨刀片管理核心逻辑的实现。

health_manager 通过 IPMB 总线统一采集框内所有刀片数据,经 blade_cache 缓存后,同步供给 Web 展示与网管系统,构建底层采集、上层可视化上报双业务闭环。

image

关键技术创新包括:

  • 采集-缓存-服务三层分离:引入 blade_cache 中枢后,Web 详情响应从 600ms 降至 5ms 以内,IPMB 总线负载恒定,多用户并发无阻塞;
  • MDB 与 RPC 混合数据模型:MDB 仅维护每刀片 1 个聚合对象,详情页通过 RPC 直接读取缓存原子快照,大幅降低 D-Bus 信号开销;
  • 双通道统一数据源:Web REST 与 UDP 上报共享同一份 blade_cache 数据,彻底消除多通道数据不一致;
  • 自适应降级采集:默认 3s 轮询,刀片失联自动降频至 10s/30s 并标记离线;刀片采集时间错峰偏移 100ms,规避总线瞬时抢占;
  • 数据面异步、控制面同步:采集与页面刷新异步进行保证总线平稳,上下电控制同步穿透,指令延迟 ≤200ms
指标传统穿透模式本方案缓存模式
Web 详情响应12×50ms = 600ms< 5ms
IPMB 峰值负载随 Web 并发线性增长恒定
多用户并发总线拥塞互相阻塞无影响

新旧方案核心性能对比

此外,方案构建了通信层(超时自动重试、降频等)、服务层(Skynet 心跳监控、systemd 自动拉起等)、安全层(IPMB 通道隔离、UDP 白名单校验、Web 权限管控等)三层防护体系,保障机房 7×24 小时稳定运行。

三、客户价值

  • 管理效率大幅提升:Web 详情响应从 600ms 降至 5ms 以内,运维人员可在秒级内感知整机箱健康状态,端到端上报延迟 ≤4s,无需逐个访问刀片 BMC,故障快速定位。
  • 运维准确性显著增强:Web 与网管系统共享同一数据源,彻底消除多通道数据不一致导致的误判。
  • 系统稳定性充分保障:自适应降级采集避免单刀片故障拖垮整机采集链路;三层防护体系确保通信异常、进程崩溃等场景下服务持续可用。
  • 架构开放,可快速扩展:基于 openUBMC 北向自接入能力,核心采集链路与北向功能完全解耦,后续对接新网管协议或扩展新可视化维度均可独立迭代,无需改动底层采集链路,方案演进的技术风险与回归验证成本大幅降低。

【版权声明】Copyright © 2026 openUBMC Community。本文由openUBMC社区首发,欢迎遵照CC-BY-SA 4.0协议规定转载。转载时敬请在正文注明并保留原文链接和作者信息。

【免责声明】本文仅代表作者本人观点,与本网站无关。本网站对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。本文仅供读者参考,由此产生的所有法律责任均由读者本人承担。