ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

储能BMS三级架构解析:BMU、BCU、BAU究竟有何区别?

储能BMS三级架构解析:BMU、BCU、BAU究竟有何区别? 1. 从一块电芯到一座电站先搞懂BMU/BCU/BAU到底站在哪一层做储能系统的人基本都绕不开这三个缩写BMU、BCU、BAU。刚入行的时候我也被绕晕过网上搜储能系统控制单元结果出来一堆BMS资料越看越糊涂。后来跟项目多了才摸清楚这三兄弟其实是电池管理系统BMS的三级组织架构只是很多人一开始就被这个命名搞蒙了。先回答那个大家搜得最多的问题BMS和BMU到底啥关系一句话就能说明白——BMS是整套电池管理系统的总称BMU是BMS最底层的硬件执行单元。就像一家公司BMS是公司BMU是基层员工BCU是部门经理BAU是总经理。你们公司叫某某科技但真正干活的还是底下那些人。具体的层级关系是这样的最底层BMUBattery Monitor Unit电池监控单元负责采集每个电芯的电压、温度做均衡控制中间层BCUBattery Cluster Unit电池簇控制单元管理一个电池簇负责簇级的总压、总流采集执行保护逻辑与PCS通信顶层BAUBattery Array Unit电池阵列单元整个储能电站或大型系统的电池管理大脑负责功率调度、状态估算、与EMS交互从物理位置上看BMU长在电池模组上一个模组一块板子BCU装在每个电池簇的高压箱里一簇一个BAU则放在整个储能电站的汇流柜或者中控柜里整个站可能就一两个。我在项目里见过一个5MWh的储能单元一共配了8个电池簇每个簇里有14个模组。算下来就是8个BCU加112个BMU再加上1个BAU。这个比例你感受一下越往上数量越少但每个单元管的范围越大、逻辑越复杂。所以这篇文章我准备按硬件构成—功能职责—通信机制—实战经验这条线把这三个控制单元讲透。不管你是做电气设计的、搞调试的还是做运维的看完都能对这套系统有个清晰的底。2. 硬件构成拆解每块板子上面到底焊了些什么2.1 BMU——贴着电芯安装的数据采集器BMU板子一般直接装在电池模组的端板上或者模组内部离电芯越近越好。了一圈项目BMU的硬件核心基本都跑不出这几块采集前端AFEAnalog Front End这是BMU真正的心脏。主流方案有ADI的LTC6811系列、TI的BQ79616国产的也有不少比如杰华特、圣邦微的方案。这些AFE芯片通常支持串联12到16串电芯的电压采集精度能做到±1mV以内。以LTC6811-1为例它能同时采集12串电芯电压每颗芯片的数据通过隔离式SPI菊花链往下传。我实际测过一款基于LTC6811的BMU板子在-20℃到60℃范围里电压采样误差能稳定在±2mV以内对于SOC估算来说这个精度基本够用了。顺便说一句AFE芯片的温度系数是选型时最容易忽略的指标有的便宜芯片低温飘得厉害冬天电压测出来偏高SOC跟着跑偏后期会很麻烦。温度采集通道主流方案是NTC热敏电阻BMU板上一般会留4到8路NTC接口。这里有个细节不是所有NTC都直采进AFE的很多设计会再加一颗MCU用MCU的ADC去读NTC因为AFE的通用IO不够用。温度点的布放很关键——每片模组至少要在正负极耳、模组中部布测温点如果模组长尽量保一头一尾各一个防止两头凉中间热的隐蔽温升。均衡电路被动均衡最常见每个电芯并一个放电电阻加一个MOS开关。常见电阻值33Ω到100Ω均衡电流一般在60mA到120mA。比如100Ω电阻配4.2V电芯电压均衡电流就是42mA左右一个满电的100Ah电芯要放到和其他电芯齐平理论上得均衡很久所以被动均衡本质上就是个慢工出细活的活。主控MCU负责把AFE读回来的数据打包、做简单的故障判断比如单体过压、欠压、跑均衡策略。常用的有NXP的S32K系列、ST的STM32F1/F4、国产的GD32等。MCU选型主要看通信接口数量和算力——它身上至少要引出一路SPI连AFE一路隔离CAN连BCU有些设计还留一路UART做调试。上面这几块凑起来再加一个DC-DC电源模块一般输入电压范围8V到60V从电池包总压取电一块BMU板子的BOM成本大概几十到一百多块人民币。设计紧凑的可以做到信用卡大小固定方式就是模组端板上的四个铜柱。2.2 BCU——高压箱里的微型主机到了BCU这一级板子就复杂多了因为它要管的不是一个模组而是整个电池簇。BCU的硬件一般分成两部分一部分是主控板一部分是外围采样与驱动板或者集成在一起做成一块大板子装在高压箱里。主控板上核心芯片需要的算力比BMU高一档因为要做SOC估算、绝缘检测、热管理策略这些活。常见的选择有NXP的S32K1系列、瑞萨的RH850或者带MPU的方案比如IMX6ULL国产的也见了不少芯驰、全志、瑞芯微都在储能主控上有布局。稍微大点的系统主控板上甚至会加一颗独立的加密芯片用于通信数据的签名校验。BCU的高压采样部分很有意思它不像BMU用AFE——BCU直接采的是母线电压和电流电压几百伏电流上千安AFE根本扛不住。电压采样用电阻分压加隔离运放电流采样用霍尔传感器或者分流器。分流器方案精度高但发热大霍尔方案不发热但小电流精度差一截。个人经验直流侧电流超过500A的簇用霍尔更稳妥小电流系统想省成本可以上分流器。BCU板子上还有一个容易被忽略但极其关键的器件——高压互锁HVIL检测电路。高压连接器如果没插到位接触电阻会变大大电流一过就发热起火。HVIL回路就是把所有高压连接器的辅助触点串成一个闭环只要任何一个连接器没插好BCU立刻就能检测到然后禁止闭合高压继电器。这个功能别省我见过不止一起因为高压连接器松动打火的事件最后查下来HVIL回路被某家厂商省了教训很深刻。2.3 BAU——机柜里的服务器BAU的形态差别比较大。小型的储能系统比如一个单一柜子的工商业储能BAU可能就是一块扩展坞加一个显示屏大型储能电站的BAU经常是一台机架式工控机加上专用IO板卡。BAU的硬件核心有这么几块高性能处理器运行的算法多而且要考虑之后可能跑一些预测性维护模型一般至少得是Cortex-A系列的MPU。常见的平台有TI的AM62x、NXP的i.MX 8M Plus算力要求再高就上FPGA或者带NPU的芯片但价格就上去了多路CAN/以太网接口BAU要跟几十台上百台BCU通信CAN口的数量必须够多。如果BCU数量超过一二十台就得分CAN网段一般一个网段挂不超过30个节点否则总线负载率太高DI/DO和继电器驱动控制风扇、加热器、空调、接触器的启停还要采集烟感、水浸、门磁这些环境量存储单元eMMC或者SD卡用来存历史故障记录和运行日志。故障日志真的很重要出了问题要回溯原因全靠它另外BAU一般都会配一块触摸屏或者至少留一个调试口。现场调试的时候工程师得能快速看到所有簇的状态最好能在触摸屏上直接下发分合闸指令省得搬着电脑到处跑。3. 功能实战解析这三层控制单元是怎么各司其职的3.1 功能划分的灵魂三级控制 分工不分工果三级架构为什么这么设计一个核心原因是——物理上天然分层控制上必须分层。电芯在模组里模组在电池包里电池包组成簇簇并联成阵列。你不可能用一个中央处理器把每个电芯的电压采集都做完——线束的物理长度就不允许通信时延更不允许。电芯级的电压采样必须就近完成这就是BMU存在的最根本原因。BMU干的是手脚的活采集、执行、上报。它最靠近电芯电压、温度数据采集完做一层初级判断比如某一串电芯电压突然跌破2.5VBMU立刻标志一个过压/欠压事件往BCU上报的同时也可能触发电芯级的主动保护如果硬件设计支持的话。BCU干的是关节的活它手里攥着这个簇的接触器收到BMU上来的故障信号等级足够高时会直接执行簇级保护——断高压、闭合预充、报故障给BAU。同时BCU还要跟PCS通信告诉PCS当前这个簇能充多大电流、能放多大电流。这些电流限制值的计算本质上就是BMS的核心算法。BAU干的是大脑的活它不做电芯级的精细控制它专注全局。所有BCU上报的数据汇聚到BAUBAU根据整个阵列的SOC不均衡度、温度分布、历史数据给每个簇下发不同的功率调度指令。比如3号簇温度偏高那就少充点7号簇SOC偏低放电时优先让它多放一点。这就是簇级均衡的核心逻辑也是BAU和BCU最大的区别——BCU管单簇BAU管全局。举个例子有个项目里出现过这种情况某个储能单元里8个簇因为投产时电芯批次不同1号和2号簇的内阻比其它簇高不少。系统装好以后没有做簇级均衡结果1号簇在放电时电压跌落特别快总是最先触底整站被迫降功率。后来靠BAU的上层调度给1、2号簇在充电时提前减少充电电流放电时反之相当于细水长流这个站的整体可放容量硬是提升了8%。这就是BAU的价值——管好木桶最短板。3.2 协议交互CAN总线是分层架构的神经系统这三层控制单元之间靠什么交流目前行业里主流还是CAN总线部分新系统开始用工业以太网比如EtherCAT做主干了。但CAN总线的地位在未来五年内依然稳固主要原因就是成本低、可靠性高、布线简单在电芯级这么小的空间里以太网物理层那套东西根本塞不下。通信架构上一个典型储能单元的布局是这样[BMU×14]---CAN---[BCU×1]---CAN---[BAU×1]---以太网---[EMS/PCS]这里有一个特别容易踩的技术坑BMU和BCU之间的CAN波特率、BCU和BAU之间的CAN波特率很多系统是不一致的。BMU到BCU这一段一般用的是250kbps因为这段距离短、节点多数据量不大但实时性要求高BCU到BAU这一段根据距离长短和数据量常用500kbps或者1Mbps。波特率不一致怎么桥接BCU就是天然的网关——它一边收250kbps的CAN一边发500kbps的CAN数据在两个网段之间转发。协议栈方面行业里最常用的是基于J1939改的私有协议或者直接用CANopen。J1939的好处是报文ID结构清晰适合点对点广播混合的通信模式。至于应用层的报文格式各家有各家的私货但核心几类报文是共通的电压/温度上报帧、状态帧充放电状态、SOC/SOH、故障帧、均衡控制帧、心跳帧。心跳帧特别重要——这是分层系统里判断下面那个设备死了没有的关键机制。一般BCU每100ms发一次心跳给BAUBAU如果连续3个心跳周期没收到就判定这个BCU失联执行相应的保护逻辑。有的系统里心跳超时判定是200ms有的设计更保守判定为500ms以上。判定值不能太激进否则CAN总线上偶发干扰导致丢帧就会误判误判后全场跳闸动静太大。但如果太保守又失去了快速保护的意义。我给个经验值心跳周期100ms连续丢失5帧判离线也就是500ms既不会太敏感也不会太慢。3.3 保护策略的三级联动从电芯到电站的层层设防储能系统的安全性靠什么兜底就是这套三级联动的保护策略。第一级电芯级保护BMU做的单体电压超过3.65V磷酸铁锂立刻报过压低于2.5V报欠压温度超过60℃报过温。这一步的动作要求是快——从采样到标志位置位BMU的响应时间一般在毫秒级。第二级簇级保护BCU做的当BCU收到BMU上报的过压/欠压/过温事件并且判断达到严重等级BCU直接分断簇内主正、主负继电器隔离故障簇。这一级动作的核心诉求是独立——簇内故障不能殃及整个系统其它簇还能正常工作。第三级阵列级保护BAU做的BAU收到多个BCU的故障上报或者检测到通讯丢失、绝缘故障、消防联动信号会执行整站级的分闸和急停。这一级的动作原则是全局——要么整站隔离要么降功率运行视故障严重程度而定。这三级的差异用一个场景说清楚某簇一个电芯电压偏高BMU上报BCU判断是轻微偏高不动作但标记了该簇限流BAU收到所有簇的限流请求以后统一给PCS下发一个降低充电功率的指令。如果这个电芯继续恶化电压超过了硬压保护阈值BCU才会直接断开这个簇。辅助继电器序列这里必须得补一个关键细节。BCU断高压的时候要严格按照先分主正、再分主负、最后断预充回路的顺序来。不能同时断开因为直流母线有储能电容瞬间的通断会产生电弧严重了会烧蚀继电器触点。4. 实操中的关键环节从选型、联调到运维我踩过的那些坑4.1 选型把关三个必须较真的参数硬件选型阶段大家最容易被宣传册上的参数唬住。我建议碰到这三个参数的时候多问几句电压采集精度。很多供应商标称±1mV但那是在恒温条件下的表现。实际工况下温度范围拉大、电压输入有共模干扰能稳定在±3mV以内就算不错了。合同上签归签到货后按GB/T 34131标准抽检一下才靠谱。均衡电流。真正的均衡电流不只看标称值还得实测。有的板子标称100mA均衡电流但实际均衡电阻底下铺铜面积不够工作不到十分钟热保护了。均衡电流上去了热设计必须跟着走不然就是纸上谈兵。CAN通信波特率误差。CAN总线对位定时要求挺严格要求波特率误差不超过±0.5%。碰到过一批BMU标称250kbps实测波特率误差到了1.3%结果在高温条件下大量丢帧。后来排查发现是晶振选的劣质货温度一高频率就飘。4.2 联调阶段的痛点多簇并联的“基线对齐”储能项目联调阶段最让我头疼的问题之一是多簇之间的SOC基线不一致。为什么会出现这个问题因为每簇的BMU都独立在算自己的SOC初始上电时如果没有一个统一的基准每个簇的SOC都会有一点点差异。数量少还好数量一多差异就放大了。系统运行一段时间后可能出现1号簇40% SOC2号簇45% SOC的情况。解决办法有两种第一种是上电静态对齐。系统断电状态下通过CAN下发指令让所有BCU读取本簇的OCV开路电压根据OCV-SOC曲线做一次初值标定。但这种办法要求电芯已经静置足够长时间电压回稳了才准。第二种是运行中对齐这也是BAU的核心算法之一。BAU实时汇总所有簇的SOC、电压、电流通过卡尔曼滤波或者安时积分修正把各簇的SOC往平均值上靠拢配合簇级均衡逐步把差异拉平。实操中的建议新项目联调时先在静态工况下做一遍基线对齐再进入动态联调。别指望单个供应商帮你搞定所有兼容问题自己需要懂这套逻辑现场才调得动。4.3 运维阶段的实用技巧故障排查不给力的“三大要因”系统运行以后出问题怎么排查我总结下来90%的BMS类故障都逃不开这三个原因通信故障。表现形式是BCU一直报BMU通信超时。常见原因有这么几个CAN总线终端电阻没接对CAN网络两端各需要120Ω中间绝对不能加、连接器端子松动、布线时CAN线跟动力线走了一个线槽导致干扰。排查手法是用示波器抓CAN_H和CAN_L的差分波形看电平是否正常再看眼图是否干净。采样偏差。表现形式是某个BMU上报的电压跟万用表实测值差很多。先查采集线束的接插件是不是氧化或者松了再用一个标准电压源从BMU采集端子注入已知电压验证板卡的采样链路是否正常。这里的坑是——很多现场的采样偏差其实不是BMU板子的锅而是电芯本身已经出了问题内阻变大导致实际端电压就是低的。换个思路去排查能少走很多弯路。继电器粘连。表现形式是BCU下发分闸命令后母线依然有电压。原因基本是继电器触点在多次大电流开断后烧蚀粘连。排查方法是在分闸状态下看母线电压传感器读数如果还有电压基本就能确认。预防思路是加强分闸前的电流判断——电流小于一定阈值再分闸能最大程度减小电弧损伤。5. 当前行业趋势与进阶方向控制器到底会不会被“融合”掉聊到这里有个趋势必须提三级架构正在被融合。原来的分层设计是物理原因决定的——信号线太长、算力不够、接口不统一。但现在芯片算力暴涨MCU越来越多以太网通信逐渐下放很多设备厂商开始在做一个事情把BCU和BAU融合甚至在某些中小型系统里把三级直接合并成一级。比如工商业储能柜有时候一套系统就一个柜子几簇电池那还要BAU吗有的厂商就把BAU做成了BCU的一个逻辑功能模块。这种融合降低了BOM成本也减少了一级通信故障点。但代价是灵活性下降——柜子扩容时原来的一台BAU管20个BCU就变成单机模式扩展得加设备。我的建议是做项目时想清楚系统规模和发展预期。如果是想做标准化的小产品比如家用储能三级改两级甚至一级都行降本显著。如果是大型电站未来有分期扩容的打算老老实实保留三级架构别为省一两个控制器的钱把系统灵活性丢掉了。还有一个比较新的技术方向是AI辅助的故障预测。现在BMU采集的数据越来越全BCU和BAU完全可以利用这些数据做趋势分析提前预判电芯热失控。我见过一个实验性项目用BCU采集到的电芯内阻变化曲线结合温度上升速率成功提前了20分钟预警了一次电芯内部异常。这个方向后期应该会越来越多地落到工程里。6. 最后再分享一个真实的故障排查案例去年年底一个投运半年的储能站报了一个比较隐蔽的故障2号簇经常在凌晨两三点钟无征兆跳闸。白天运行一切正常一到夜间低负荷时段就跳。现场排查了很久一开始怀疑是消防联动误动作把烟感探头换了三遍没用又怀疑是PCS通信干扰隔离了一整晚还是跳。后来翻BCU的故障记录日志发现每一次跳闸前几十秒都会报一条BMU电压采样异常但只是一闪而过没有保持。顺着这个线索我们把2号簇的14个BMU的CAN报文全部抓下来做了离线比对发现出问题的BMU在跳闸前会有连续几次报文的电压值明显跳变从正常值跳到零再跳回来。这一看就是典型的接触不良——BMU采集线束的端子在某温度段下热胀冷缩间歇性断开。处理办法其实很简单把问题BMU的采集端子重新压接了一遍更换了端子母头问题彻底消失。但这个案例最值得反思的是从最初出问题到最终定位用了整整两周。如果当初在BCU里多设计一个逻辑——同一电芯电压异常跳变连续出现3次即记录为疑似接线问题并报警这个故障应该一天内就能被发现。所以做储能系统控制单元的研发或调试时日志记录和逻辑诊断功能真的值得多做一点。这比多堆一些硬件参数来得更实在。你永远不知道现场会出什么样的奇葩问题而多留一条诊断信息就多了一分快速找到问题的把握。
返回列表