[{"data":1,"prerenderedAt":316},["ShallowReactive",2],{"content-doc-\u002Fzh\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding":3,"surround-\u002Fzh\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding":314},{"_path":4,"_dir":5,"_draft":6,"_partial":6,"_locale":7,"title":8,"description":9,"company":10,"date":11,"logo":12,"logoDark":13,"body":14,"_type":306,"_id":307,"_source":308,"_file":309,"_stem":310,"_extension":311,"coverImage":79,"plainText":312,"authorNames":313},"\u002Fzh\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding","usercase",false,"","基于 openUBMC 北向自接入实现刀片机箱节点一体化健康管理","当前，AI 算力数据中心广泛采用高密度刀片机箱，单机箱内置多片独立刀片，每片刀片搭载专属 BMC 管理芯片。传统 BMC 仅支持单节点本地管控，彼此隔离形成管理孤岛，存在以下运维痛点：","昆仑太科","2026\u002F07\u002F30","\u002Fcategory\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding\u002Flogo.png","\u002Fcategory\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding\u002Flogo-dark.png",{"type":15,"children":16,"toc":299},"root",[17,26,31,51,56,62,67,72,81,86,140,236,245,250,256],{"type":18,"tag":19,"props":20,"children":22},"element","h3",{"id":21},"一应用背景",[23],{"type":24,"value":25},"text","一、应用背景",{"type":18,"tag":27,"props":28,"children":29},"p",{},[30],{"type":24,"value":9},{"type":18,"tag":32,"props":33,"children":34},"ul",{},[35,41,46],{"type":18,"tag":36,"props":37,"children":38},"li",{},[39],{"type":24,"value":40},"sensor、fru_ctrl 等基础组件仅管理本机资源，缺少跨板通信接口；",{"type":18,"tag":36,"props":42,"children":43},{},[44],{"type":24,"value":45},"缺乏统一的数据聚合上报通道，网管系统只能逐一轮询各刀片 BMC；",{"type":18,"tag":36,"props":47,"children":48},{},[49],{"type":24,"value":50},"交换刀片 Web 界面缺少整机视角，无法集中查看整机刀片健康状态并远程控制；",{"type":18,"tag":27,"props":52,"children":53},{},[54],{"type":24,"value":55},"多重限制叠加，进一步造成 IPMB 总线拥堵、页面卡顿、多终端数据不一致、故障发现滞后等问题，大幅降低集群运维效率。",{"type":18,"tag":19,"props":57,"children":59},{"id":58},"二解决方案",[60],{"type":24,"value":61},"二、解决方案",{"type":18,"tag":27,"props":63,"children":64},{},[65],{"type":24,"value":66},"昆仑太科基于 openUBMC 开源架构自研 health_manager 专用管理组件，部署于交换刀片 BMC，充分利用社区北向自接入能力，将 UDP 上报、Web 展示、MDB 接口扩展等北向功能以独立组件形式接入框架，使团队得以聚焦于跨刀片管理核心逻辑的实现。",{"type":18,"tag":27,"props":68,"children":69},{},[70],{"type":24,"value":71},"health_manager 通过 IPMB 总线统一采集框内所有刀片数据，经 blade_cache 缓存后，同步供给 Web 展示与网管系统，构建底层采集、上层可视化上报双业务闭环。",{"type":18,"tag":27,"props":73,"children":74},{},[75],{"type":18,"tag":76,"props":77,"children":80},"img",{"alt":78,"src":79},"image","\u002Fcategory\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding\u002Fimg1.png",[],{"type":18,"tag":27,"props":82,"children":83},{},[84],{"type":24,"value":85},"关键技术创新包括：",{"type":18,"tag":32,"props":87,"children":88},{},[89,100,110,120,130],{"type":18,"tag":36,"props":90,"children":91},{},[92,98],{"type":18,"tag":93,"props":94,"children":95},"strong",{},[96],{"type":24,"value":97},"采集-缓存-服务三层分离",{"type":24,"value":99},"：引入 blade_cache 中枢后，Web 详情响应从 600ms 降至 5ms 以内，IPMB 总线负载恒定，多用户并发无阻塞；",{"type":18,"tag":36,"props":101,"children":102},{},[103,108],{"type":18,"tag":93,"props":104,"children":105},{},[106],{"type":24,"value":107},"MDB 与 RPC 混合数据模型",{"type":24,"value":109},"：MDB 仅维护每刀片 1 个聚合对象，详情页通过 RPC 直接读取缓存原子快照，大幅降低 D-Bus 信号开销；",{"type":18,"tag":36,"props":111,"children":112},{},[113,118],{"type":18,"tag":93,"props":114,"children":115},{},[116],{"type":24,"value":117},"双通道统一数据源",{"type":24,"value":119},"：Web REST 与 UDP 上报共享同一份 blade_cache 数据，彻底消除多通道数据不一致；",{"type":18,"tag":36,"props":121,"children":122},{},[123,128],{"type":18,"tag":93,"props":124,"children":125},{},[126],{"type":24,"value":127},"自适应降级采集",{"type":24,"value":129},"：默认 3s 轮询，刀片失联自动降频至 10s\u002F30s 并标记离线；刀片采集时间错峰偏移 100ms，规避总线瞬时抢占；",{"type":18,"tag":36,"props":131,"children":132},{},[133,138],{"type":18,"tag":93,"props":134,"children":135},{},[136],{"type":24,"value":137},"数据面异步、控制面同步",{"type":24,"value":139},"：采集与页面刷新异步进行保证总线平稳，上下电控制同步穿透，指令延迟 ≤200ms",{"type":18,"tag":141,"props":142,"children":143},"table",{},[144,168],{"type":18,"tag":145,"props":146,"children":147},"thead",{},[148],{"type":18,"tag":149,"props":150,"children":151},"tr",{},[152,158,163],{"type":18,"tag":153,"props":154,"children":155},"th",{},[156],{"type":24,"value":157},"指标",{"type":18,"tag":153,"props":159,"children":160},{},[161],{"type":24,"value":162},"传统穿透模式",{"type":18,"tag":153,"props":164,"children":165},{},[166],{"type":24,"value":167},"本方案缓存模式",{"type":18,"tag":169,"props":170,"children":171},"tbody",{},[172,194,215],{"type":18,"tag":149,"props":173,"children":174},{},[175,181,186],{"type":18,"tag":176,"props":177,"children":178},"td",{},[179],{"type":24,"value":180},"Web 详情响应",{"type":18,"tag":176,"props":182,"children":183},{},[184],{"type":24,"value":185},"12×50ms = 600ms",{"type":18,"tag":176,"props":187,"children":188},{},[189],{"type":18,"tag":93,"props":190,"children":191},{},[192],{"type":24,"value":193},"\u003C 5ms",{"type":18,"tag":149,"props":195,"children":196},{},[197,202,207],{"type":18,"tag":176,"props":198,"children":199},{},[200],{"type":24,"value":201},"IPMB 峰值负载",{"type":18,"tag":176,"props":203,"children":204},{},[205],{"type":24,"value":206},"随 Web 并发线性增长",{"type":18,"tag":176,"props":208,"children":209},{},[210],{"type":18,"tag":93,"props":211,"children":212},{},[213],{"type":24,"value":214},"恒定",{"type":18,"tag":149,"props":216,"children":217},{},[218,223,228],{"type":18,"tag":176,"props":219,"children":220},{},[221],{"type":24,"value":222},"多用户并发",{"type":18,"tag":176,"props":224,"children":225},{},[226],{"type":24,"value":227},"总线拥塞互相阻塞",{"type":18,"tag":176,"props":229,"children":230},{},[231],{"type":18,"tag":93,"props":232,"children":233},{},[234],{"type":24,"value":235},"无影响",{"type":18,"tag":27,"props":237,"children":238},{},[239],{"type":18,"tag":240,"props":241,"children":242},"em",{},[243],{"type":24,"value":244},"新旧方案核心性能对比",{"type":18,"tag":27,"props":246,"children":247},{},[248],{"type":24,"value":249},"此外，方案构建了通信层（超时自动重试、降频等）、服务层（Skynet 心跳监控、systemd 自动拉起等）、安全层（IPMB 通道隔离、UDP 白名单校验、Web 权限管控等）三层防护体系，保障机房 7×24 小时稳定运行。",{"type":18,"tag":19,"props":251,"children":253},{"id":252},"三客户价值",[254],{"type":24,"value":255},"三、客户价值",{"type":18,"tag":32,"props":257,"children":258},{},[259,269,279,289],{"type":18,"tag":36,"props":260,"children":261},{},[262,267],{"type":18,"tag":93,"props":263,"children":264},{},[265],{"type":24,"value":266},"管理效率大幅提升",{"type":24,"value":268},"：Web 详情响应从 600ms 降至 5ms 以内，运维人员可在秒级内感知整机箱健康状态，端到端上报延迟 ≤4s，无需逐个访问刀片 BMC，故障快速定位。",{"type":18,"tag":36,"props":270,"children":271},{},[272,277],{"type":18,"tag":93,"props":273,"children":274},{},[275],{"type":24,"value":276},"运维准确性显著增强",{"type":24,"value":278},"：Web 与网管系统共享同一数据源，彻底消除多通道数据不一致导致的误判。",{"type":18,"tag":36,"props":280,"children":281},{},[282,287],{"type":18,"tag":93,"props":283,"children":284},{},[285],{"type":24,"value":286},"系统稳定性充分保障",{"type":24,"value":288},"：自适应降级采集避免单刀片故障拖垮整机采集链路；三层防护体系确保通信异常、进程崩溃等场景下服务持续可用。",{"type":18,"tag":36,"props":290,"children":291},{},[292,297],{"type":18,"tag":93,"props":293,"children":294},{},[295],{"type":24,"value":296},"架构开放，可快速扩展",{"type":24,"value":298},"：基于 openUBMC 北向自接入能力，核心采集链路与北向功能完全解耦，后续对接新网管协议或扩展新可视化维度均可独立迭代，无需改动底层采集链路，方案演进的技术风险与回归验证成本大幅降低。",{"title":7,"searchDepth":300,"depth":300,"links":301},4,[302,304,305],{"id":21,"depth":303,"text":25},3,{"id":58,"depth":303,"text":61},{"id":252,"depth":303,"text":255},"markdown","content:zh:usercase:implementing-blade-chassis-integrated-management-via-northbound-self-onboarding.md","content","zh\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding.md","zh\u002Fusercase\u002Fimplementing-blade-chassis-integrated-management-via-northbound-self-onboarding","md","一、应用背景 当前，AI 算力数据中心广泛采用高密度刀片机箱，单机箱内置多片独立刀片，每片刀片搭载专属 BMC 管理芯片。传统 BMC 仅支持单节点本地管控，彼此隔离形成管理孤岛，存在以下运维痛点： sensor、fru_ctrl 等基础组件仅管理本机资源，缺少跨板通信接口； 缺乏统一的数据聚合上报通道，网管系统只能逐一轮询各刀片 BMC； 交换刀片 Web 界面缺少整机视角，无法集中查看整机刀片健康状态并远程控制； 多重限制叠加，进一步造成 IPMB 总线拥堵、页面卡顿、多终端数据不一致、故障发现滞后等问题，大幅降低集群运维效率。 二、解决方案 昆仑太科基于 openUBMC 开源架构自研 health_manager 专用管理组件，部署于交换刀片 BMC，充分利用社区北向自接入能力，将 UDP 上报、Web 展示、MDB 接口扩展等北向功能以独立组件形式接入框架，使团队得以聚焦于跨刀片管理核心逻辑的实现。 health_manager 通过 IPMB 总线统一采集框内所有刀片数据，经 blade_cache 缓存后，同步供给 Web 展示与网管系统，构建底层采集、上层可视化上报双业务闭环。  关键技术创新包括： 采集-缓存-服务三层分离 ：引入 blade_cache 中枢后，Web 详情响应从 600ms 降至 5ms 以内，IPMB 总线负载恒定，多用户并发无阻塞； MDB 与 RPC 混合数据模型 ：MDB 仅维护每刀片 1 个聚合对象，详情页通过 RPC 直接读取缓存原子快照，大幅降低 D-Bus 信号开销； 双通道统一数据源 ：Web REST 与 UDP 上报共享同一份 blade_cache 数据，彻底消除多通道数据不一致； 自适应降级采集 ：默认 3s 轮询，刀片失联自动降频至 10s\u002F30s 并标记离线；刀片采集时间错峰偏移 100ms，规避总线瞬时抢占； 数据面异步、控制面同步 ：采集与页面刷新异步进行保证总线平稳，上下电控制同步穿透，指令延迟 ≤200ms 指标 传统穿透模式 本方案缓存模式 Web 详情响应 12×50ms = 600ms \u003C 5ms IPMB 峰值负载 随 Web 并发线性增长 恒定 多用户并发 总线拥塞互相阻塞 无影响 新旧方案核心性能对比 此外，方案构建了通信层（超时自动重试、降频等）、服务层（Skynet 心跳监控、systemd 自动拉起等）、安全层（IPMB 通道隔离、UDP 白名单校验、Web 权限管控等）三层防护体系，保障机房 7×24 小时稳定运行。 三、客户价值 管理效率大幅提升 ：Web 详情响应从 600ms 降至 5ms 以内，运维人员可在秒级内感知整机箱健康状态，端到端上报延迟 ≤4s，无需逐个访问刀片 BMC，故障快速定位。 运维准确性显著增强 ：Web 与网管系统共享同一数据源，彻底消除多通道数据不一致导致的误判。 系统稳定性充分保障 ：自适应降级采集避免单刀片故障拖垮整机采集链路；三层防护体系确保通信异常、进程崩溃等场景下服务持续可用。 架构开放，可快速扩展 ：基于 openUBMC 北向自接入能力，核心采集链路与北向功能完全解耦，后续对接新网管协议或扩展新可视化维度均可独立迭代，无需改动底层采集链路，方案演进的技术风险与回归验证成本大幅降低。",[],[315,315],null,1785415973994]