ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

H3C S6520 IRF堆叠现网配置与避坑指南

H3C S6520 IRF堆叠现网配置与避坑指南 简介面向现网核心交换机升级改造场景这份H3C S6520系列IRF2堆叠实战资料为网络运维工程师提供了不断网配置的完整思路与操作指引。该文档以现网实战为背景尤其适合核心交换机流量接近瓶颈、需要横向扩容的园区网或数据中心场景。资料聚焦两台S6520-26Q-SI设备在不中断现有业务的前提下完成堆叠涵盖成员编号、优先级、堆叠口绑定、BFD分裂检测等关键配置并对配置前规划、业务中断预案和失败恢复步骤给出实用建议同时强调使用万兆或四十兆堆叠链路时速率与线缆匹配以及命令行相比Web配置更精确的原因。压缩包内为一个PDF文档大小约395KB便于快速查阅目前已有1267人学习。文档整理了完整的Device A与Device B双侧配置示例包括irf-port 1/2与2/1对接规则、端口shutdown/undo shutdown时序、保存激活及主备竞选机制适合正在规划核心交换机堆叠或因扩容需要提升转发能力的工程师直接对照落地。1. 现网做堆叠难的不是配置是节奏两台 H3C S6520 核心交换机各自跑着业务想把它们做成一套堆叠统一管理、跨设备做链路聚合又怕现网环境下一通操作把整网搞断。这件事的命令其实不难网上随便翻翻文档都有真正麻烦的是操作顺序哪台先改编号、哪台先重启、堆叠线什么时候插、MAD 检测配在哪个口。顺序错了轻则从设备反复重启重则堆叠分裂让业务出现双活。这篇就按现网实战的节奏来讲先规划再敲命令把每次重启的业务影响压到最低。2. IRF 选型与物理规划先想清楚再敲命令2.1 为什么选 IRF 而不是继续用 VRRP很多现网核心原本是两台 S6520 跑 VRRP 做主备或者靠 STP 断掉冗余链路避免环路。这种架构能用但有个天然问题两台设备是两套独立控制面转发表各自维护主备切换要等 VRRP 或 STP 收敛秒级中断在核心交换机上很难接受。IRFIntelligent Resilient Framework是把两台 S6520 虚拟成一台逻辑设备控制面统一转发表项一致跨成员做链路聚合后任何一台故障或者链路断了流量直接从另一台转发业务侧基本无感知。选 IRF 还有一个实际好处管理 IP、SNMP、日志服务器、ACL 这些配置只在主设备上维护一份不用像 VRRP 那样两台设备反复同步。但 IRF 的代价是引入了堆叠分裂这个新故障域如果 MAD 检测没配或者配错裂开后两台设备同时抢业务比 VRRP 切换失败还难查。所以选 IRF 的前提是你愿意把一部分精力花在 MAD 检测和堆叠链路监控上。如果团队对堆叠不熟业务又不能接受任何波动老老实实继续用 VRRP 反而更稳。2.2 S6520 堆叠前的成员编号与物理连线规划S6520 是 Comware 7 平台IRF 的成员编号默认是 1单台跑的时候大家都没感觉但两台要合并必须把其中一台改成 2否则编号冲突从设备会在加入堆叠时反复重启。优先级也是同样道理主设备优先级调高比如priority 5从设备保持默认 1避免两台设备在启动顺序相同的情况下靠 MAC 随机选主。另外要留意成员编号在renumber之后必须重启才生效这是现网操作里最容易忽略的一步。物理连线要先于堆叠配置考虑。IRF-Port1 和 IRF-Port2 要组成环状设备 A 的 IRF-Port1 连接设备 B 的 IRF-Port2设备 A 的 IRF-Port2 连接设备 B 的 IRF-Port1。这样即使一根堆叠线断了另一根还能维持堆叠状态只是从双链路变成单链路不会直接分裂。S6520 的堆叠口通常用最后几个万兆 SFP 口比如 48 口机型用 Ten-GigabitEthernet1/0/49 和 1/0/5024 口机型对应 1/0/23 和 1/0/24具体以你手里设备的display interface brief输出为准。堆叠线建议优先使用原厂万兆堆叠线缆或适配的万兆光模块千兆模块插上去速率协商不上物理口根本起不来。规划项主设备Master从设备Member成员编号12优先级51IRF-Port1 绑定物理口如 Ten-GigabitEthernet1/0/49如 Ten-GigabitEthernet2/0/50IRF-Port2 绑定物理口如 Ten-GigabitEthernet1/0/50如 Ten-GigabitEthernet2/0/49MAD 检测方式BFD MAD独立 VLANBFD MAD独立 VLAN优先级数值越大越优先这里只是示例具体范围以设备手册为准。min 上面这张表定下来之后配置只是把表翻译成命令的事。3. S6520 堆叠配置落地编号、IRF-Port 与 MAD 检测3.1 成员编号与优先级配置先在从设备上修改成员编号。假设设备 B 当前单机运行编号是 1要改成 2system-view irf member 1 renumber 2renumber只是修改配置不会立即生效必须保存配置并重启后设备 B 才会真正变成 member 2。这一步一定要单独做并且确认display irf configuration里显示的信息是预期的编号再继续下一步。主设备 A 上则配置优先级system-view irf member 1 priority 5这条命令在设备 A 上执行后立即生效不需要重启。如果两台设备都已经在跑业务建议先改从设备编号并安排重启窗口主设备这边只动优先级不重启把业务影响面先控制住。这里有个细节从设备 B 在重启前还是 member 1此时如果先把 IRF-Port 绑定了重启后这些 IRF-Port 会跟着新编号变成 2/1 和 2/2。理论上自动映射没问题但我见过个别版本在这个环节出现 IRF-Port 编号和物理口绑定丢失的情况。稳妥做法是先让编号生效再绑定 IRF-Port多一次重启但不赌自动映射。3.2 IRF-Port 绑定与环状连接编号生效后在主设备 A 上绑定堆叠口system-view irf-port 1/1 port group interface Ten-GigabitEthernet1/0/49 quit irf-port 1/2 port group interface Ten-GigabitEthernet1/0/50 quit在从设备 B 上绑定对应物理口。注意 B 的接口编号现在是 2/0/x 开头system-view irf-port 2/1 port group interface Ten-GigabitEthernet2/0/50 quit irf-port 2/2 port group interface Ten-GigabitEthernet2/0/49 quit这里irf-port 2/1表示 member 2 的 IRF-Port1绑定的物理口是 B 的 2/0/50。看到没有A 的 IRF-Port1 绑的是 1/0/49B 的 IRF-Port1 绑的是 2/0/50物理口诀就是交叉连接。如果两台设备的 IRF-Port1 都接了同一侧的端口堆叠协商会失败物理层 up 但 IRF 层一直不合并。绑定完成后先别急着插线。我习惯在两个堆叠物理口下先执行shutdown保存配置再把堆叠线插好最后通过undo shutdown让 IRF 协商开始。这样做的原因是如果线已经插好端口处于 up 状态一旦绑定配置下发设备可能立即触发 IRF 协商合并完全没有给你检查配置的缓冲时间。用 shutdown 把合并动作的触发点放在你手里比让设备自己触发要可控得多。3.3 MAD 检测堆叠分裂的后悔药IRF 最怕的是堆叠链路断开但两台设备都在运行此时没有 MAD 检测两台设备同时处理业务MAC 表、ARP 表全部打架网络会出现间歇性通断极其难排查。BFD MAD 是现网最常见的做法占用一个独立物理口和独立 VLANvlan 4092 description BFD-MAD-VLAN quit在两台设备的专用 MAD 口下做相同配置比如都用各自的最后一个万兆口interface Ten-GigabitEthernet1/0/51 port link-mode bridge port access vlan 4092 stp disable mad bfd enable mad ip address 10.1.1.1 24 member 1 quit从设备 B 上相同编号的接口interface Ten-GigabitEthernet2/0/51 port link-mode bridge port access vlan 4092 stp disable mad bfd enable mad ip address 10.1.1.2 24 member 2 quit最后在系统视图下开启irf mad enable这里有几个关键点。MAD 检测口必须用独立的 VLAN不能跟业务 VLAN 混在一起否则 BFD 报文会被业务广播干扰出现误检测。stp disable是为了避免 MAD VLAN 参与生成树计算因为这台设备本身已经在一个逻辑堆叠里了。mad ip address的地址不需要真实路由可达它只是给 BFD MAD 提供一个成员标识两端必须配置不同地址掩码建议统一用 24 位避免某些版本对掩码不匹配报错。irf mad enable是全局开关必须在堆叠建立前后都确认存在否则前面配的 MAD 口不会真正生效。3.4 合并前检查堆叠线插好并undo shutdown之后先做一轮检查再考虑后续操作。display irf configuration可以查看两台设备的成员编号、优先级和 IRF-Port 绑定关系display irf topology能看到拓扑是否形成环。如果 topology 里只有一台设备说明物理链路没起或者 IRF-Port 接反了先别继续回到 3.2 检查绑定和线序。display mad verbose则确认 MAD 检测配置已经生效。这三条命令在现网操作里比任何配置都值钱因为堆叠合并的过程往往伴随设备重启等重启完再发现问题排查成本高一个量级。4. 不断网的关键操作合并顺序与跨设备链路聚合4.1 业务影响面先说清楚不断网配置堆叠这个说法在现网里要打折理解。严格意义上从单机切换成堆叠从设备必然要经历一次重启重启期间从设备上的业务端口全部 down这是物理上的硬损耗靠配置绕不开。我们能做到的是把业务影响控制在几秒到几十秒的可接受范围并且让主设备全程不重启保证主链路上的业务不掉线。所以操作前先盘一下两台 S6520 上各挂了什么业务哪些是主设备承载哪些是从设备承载。从设备上如果接了重要的服务器或者办公网网关要么提前把流量切到主设备要么把操作窗口放在业务低峰期。这不是技术问题是风险管理问题。4.2 推荐的合并顺序先主后从从设备最后一次重启实际操作顺序按下面这个节奏走。第一步主设备 A 上配置好优先级从设备 B 上配置好renumber 2并重启让 B 以 member 2 的身份独立运行。第二步在 A 和 B 上分别配置 IRF-Port 绑定和 MAD 检测确认配置无误后把堆叠线插好堆叠物理口保持 shutdown。第三步先undo shutdown主设备 A 的堆叠口再undo shutdown从设备 B 的堆叠口。这时 A 和 B 开始协商优先级高的 A 成为 MasterB 会自动重启并加入堆叠。B 的第二次重启是整个过程中最后一次业务中断之后 IRF 就稳定了。B system-view [B] irf member 1 renumber 2 [B] save force [B] rebootB 重启完成并确认是 member 2 后再进行堆叠口上线操作。这里把save force单独提出来是因为如果不保存B 重启后有可能回滚到 member 1前功尽弃。4.3 跨设备链路聚合让流量在合并期间有路可走如果从设备 B 上确实存在关键业务流量又不想在 B 重启期间断掉必须在堆叠之前先把 B 的上行或下行链路改成跨设备链路聚合。这个前提是两台交换机之间要先形成堆叠聚合组才能横跨两台成员设备。所以标准打法分两步先接受 B 的一次短暂重启完成编号变更然后在堆叠建立后立刻配置跨设备聚合把原来单挂在 B 上的链路吸进聚合组。聚合配置如下interface Bridge-Aggregation1 link-aggregation mode dynamic quit interface Ten-GigabitEthernet1/0/1 port link-mode bridge port link-aggregation group 1 quit interface Ten-GigabitEthernet2/0/1 port link-mode bridge port link-aggregation group 1 quit这个聚合组把 A 的 1/0/1 和 B 的 2/0/1 聚合成一条逻辑链路对端交换机或服务器看到的是一个聚合口。B 重启时聚合组里 B 那个成员端口 down流量全部从 A 的成员口转发业务不中断。等 B 重启完成加入堆叠聚合口自动恢复两个成员。配置聚合时要注意两端协商模式一致建议都用动态 LACP避免静态聚合在成员设备重启期间出现状态不一致。如果对端是服务器服务器网卡也要配置对应的 bond 模式。这个环节最容易翻车的是对端设备没做聚合对接只把两根线分别插在两个口上堆叠一建立STP 或环路就直接出来了。4.4 中断窗口估算按上面的顺序从设备 B 总共重启两次一次是renumber生效一次是堆叠合并。主设备 A 全程不重启。如果 B 上没有直接挂关键业务或者关键业务已经通过跨设备聚合切换到 A整个过程中断时间就是 B 两次重启的时间加起来一到两分钟。如果把这两次重启都安排在维护窗口这个窗口时间绰绰有余但建议把第一次renumber重启和第二次堆叠合并重启之间留出足够的时间来检查配置不要赶在同一个窗口里连续做否则出错时没有回退机会。我一般会第一天先做编号变更第二天再插线合并中间隔一个晚上用巡检确认设备状态稳定。5. 避坑现网堆叠最容易翻车的五个点5.1 成员编号冲突导致从设备反复重启现象堆叠线插好后从设备一直在重启起来后显示 standalone过一会儿又重启循环反复。原因从设备没有提前执行irf member 1 renumber 2或者执行了但没重启生效两台设备都以 member 1 身份尝试合并系统无法区分谁是谁。解决在从设备上单独执行irf member 1 renumber 2save force后重启确认display irf里显示的是 member 2再插堆叠线。如果已经插了线先把线拔掉或 shutdown 堆叠物理口等编号生效后再接。5.2 IRF-Port 接反而协商不上现象物理口是 up 的但display irf topology只有一台设备另一台始终是 standaloneIRF 合并不成功。原因IRF-Port 物理连线不是环状。比如 A 的 IRF-Port1 接了 B 的 IRF-Port1A 的 IRF-Port2 接了 B 的 IRF-Port2这种对应连接方式不能形成 IRF 环。解决按交叉方式重新接线或调整绑定关系。A 的 IRF-Port1 必须对端是 B 的 IRF-Port2A 的 IRF-Port2 对端是 B 的 IRF-Port1。改完之后用display irf topology确认拓扑图里出现了环形结构。5.3 MAD 检测漏配堆叠分裂后业务双活现象某天堆叠链路闪断但两台设备都没宕机网络出现大量 ARP 冲突、MAC 漂移告警业务时通时断排查很久才发现两台设备各自在处理流量。原因IRF 分裂后没有 MAD 检测机制两台 S6520 都认为自己是 Master都在转发业务报文形成了事实上的双活。解决每台成员设备上必须配置 BFD MAD使用独立 VLAN 和独立物理口并确认irf mad enable已全局开启。分裂恢复后堆叠会自动合并但如果 MAD 没配这个分裂就会演变成重大故障。这个坑是堆叠事故里后果最严重的没有之一。5.4 堆叠后接口编号变化脚本和监控全部失效现象堆叠配置完成后原本监控平台里记录的是 A 设备的 Ten-GigabitEthernet1/0/10现在流量还在但这个接口在设备上已经不存在了告警刷屏。原因堆叠建立后从设备 B 的接口编号整体变成 2/0/x所有依赖物理端口号的脚本、网管平台、导出配置都失效。解决在配置堆叠前把所有涉及物理接口编号的脚本和监控项梳理一遍用逻辑名或聚合口替代物理口。比如监控端口流量就监控 Bridge-Aggregation 口而不是物理口这样堆叠后监控不用改。已经踩了坑的话只能把脚本里的接口前缀从 1/0/ 批量改成 2/0/但这不是长久之计。5.5 堆叠口用了千兆模块物理口一直 down现象堆叠口绑定了物理口线也插了但端口始终是 downdisplay link看不到光模块信息。原因S6520 的堆叠口是万兆口有人为了省成本插了千兆 SFP 模块速率协商不匹配物理层直接起不来。解决换用万兆 SFP 模块或原厂堆叠线缆。堆叠口不建议混用兼容模块IRF 链路对报文时延和一致性要求比普通业务口高非原厂模块在高温或长距离场景下偶尔会出现误码导致堆叠链路闪断。堆叠这事上省模块钱最后大概率在故障处理上还回去。6. 验证与快速回退堆叠不是配完就结束堆叠建立后的第一件事不是看业务而是跑一轮完整验证。display irf确认两台成员设备的角色和状态Master 的优先级应该高于 Slavedisplay mad verbose确认 MAD 检测状态是 Enabled。然后跨设备聚合验证display link-aggregation verbose看聚合组成员是不是分布在 1/0/x 和 2/0/x 两个成员上每个成员的选中状态是否正常。如果有跨设备聚合随便拔掉一台设备的堆叠口业务不应该中断这才算真正达到了堆叠的预期效果。这个过程建议在维护窗口做一次不要等故障了才验证。快速回退方案也要提前写在纸上。如果堆叠合并后出现异常回退的节奏是先把从设备 B 的堆叠物理口shutdown让堆叠分裂成两台独立设备MAD 会将 B 的业务口全部关闭然后登录 B 的 console 口在 B 上把 IRF-Port 绑定删除保存配置重启B 就恢复成独立设备。A 这边同理删除 IRF-Port 即可。这里最关键的教训是回退操作要在堆叠物理口 shutdown 之后做不要带着堆叠配置直接拔线。另一次我图省事直接拔堆叠线结果 MAD 把两台设备的业务口全给关了整网瘫了十几分钟比不堆叠还惨。从那以后每次堆叠维护前我都会把回退步骤打印出来贴在现场每步命令提前写好不临场发挥。堆叠这种操作验证和回退才是真正的技术含量希望帮到你。本文还有配套的精品资源点击获取
返回列表