ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

工业物联网丢包根因排查与TSN、工业5G低时延高可靠网络设计实战

工业物联网丢包根因排查与TSN、工业5G低时延高可靠网络设计实战 1. 车间里那些莫名其妙的丢包到底卡在哪个环节如果你在工厂里做过网络运维大概率遇到过这种场景PLC和上位机之间偶尔断一下SCADA画面上某个阀门状态闪一下红又恢复AGV小车走到某个拐角就卡顿几秒视觉质检相机传回来的图片偶尔花屏。问IT部门回复永远是网络没问题ping都通问设备厂商回复是我们设备没问题是网络抖动。最后这事儿就不了了之产线继续带着隐患跑。工业物联网的丢包和你在办公室遇到的Wi-Fi卡顿完全是两码事。办公网络丢一个包顶多视频糊一下、网页慢一点用户感知不强。但工业场景里一个丢包可能意味着一条运动控制指令没送达机械臂的轨迹就偏了一个丢包可能意味着急停信号延迟了50毫秒安全联锁就失效了。这就是为什么工业物联网对网络的要求从来不是带宽够不够大而是时延确定性和可靠性这两个硬指标。先把概念说清楚。低时延不是指平均时延低而是指最坏情况下的时延有上界。一个网络平均时延1毫秒、但偶尔飙到200毫秒对工业控制来说就是不可用的。高可靠也不是指大部分时候能通而是指丢包率要低到10的负6次方甚至更低量级并且要有冗余机制保证单点故障不影响业务。工业里常说的五个九99.999%可用性换算下来一年停机时间不能超过5分钟这个标准比大多数互联网服务苛刻得多。那丢包到底卡在哪我梳理下来工业物联网的丢包来源基本集中在四个层面物理层链路质量线缆、接头、电磁干扰、网络层拥塞与排队交换机缓冲区溢出、突发流量、协议层机制缺陷传统以太网的CSMA/CD冲突、TCP重传超时、时间同步与调度缺失各设备各跑各的时钟没有统一节拍。这四个层面里前两个是硬件和布线问题后两个才是真正需要靠TSN、工业5G这类技术去解决的架构问题。很多人一上来就想上TSN、上5G但如果你的车间还在用劣质网线、交换机还是商用的、接地都没做好那再先进的协议也救不了。我见过一个项目客户花大价钱上了TSN交换机结果丢包依旧最后查出来是某段网线的水晶头压接不良在振动环境下接触电阻周期性变化。所以排查丢包永远要从物理层往上查别一上来就怀疑协议。这篇文章我想把工业物联网丢包的根因、低时延高可靠网络的构建思路、TSN和工业5G各自的适用边界以及实际落地时的踩坑经验系统地讲一遍。不管你是刚接触工业网络的工程师还是正在做产线网络改造的负责人希望能帮你少走点弯路。2. 从物理层到协议层丢包的根因排查链路2.1 物理层最容易被忽视也最容易出问题工业现场的物理层环境和办公室完全不是一个量级。变频器、伺服驱动器、大功率电机、焊接设备这些都是强电磁干扰源。网线如果和动力线走同一个线槽或者屏蔽层没做好接地干扰直接耦合到差分信号上误码率飙升交换机就丢包。排查物理层我一般按这个顺序来看线缆等级工业现场至少要用Cat5e屏蔽线高干扰环境建议Cat6a S/FTP。普通商用非屏蔽线在变频器旁边基本活不过去。看接头工艺水晶头压接要保证8根线全部到位屏蔽层要和接头金属壳可靠连接。我习惯用带屏蔽的工业级RJ45接头压完后用测线仪逐根测通断和串扰。看走线信号线和动力线间距至少保持20厘米交叉时尽量垂直交叉不要平行走长距离。看接地屏蔽层只能单端接地通常接在交换机侧两端接地会形成地环路反而引入干扰。看环境拖链、机器人关节处的网线要用高柔性拖链专用线普通线缆反复弯折后内部铜丝断裂表现为时通时断的随机丢包。这里有个经验随机丢包且无规律优先怀疑物理层规律性丢包比如每秒钟固定丢几个优先怀疑协议或配置。因为物理层干扰往往和设备的运行状态相关电机启停、变频器载波频率变化表现出来就是没规律。2.2 网络层缓冲区溢出和突发流量是隐形杀手物理层没问题丢包还在发生那就要看网络层了。工业以太网交换机普遍采用存储转发机制每个端口有输入缓冲区和输出缓冲区。当多个端口同时向一个端口发送数据而该端口出口速率不够时数据包就在缓冲区里排队。缓冲区满了后来的包直接被丢弃这就是拥塞丢包。工业场景的拥塞有个特点流量是突发的、周期性的。比如视觉检测系统平时没数据一旦触发就是几十兆的图片 burst再比如多轴运动控制每个控制周期所有轴同时上报状态瞬间流量是平均流量的好几倍。这种突发流量最容易打爆交换机缓冲区。排查网络层重点看这几个指标排查项正常范围异常表现处理方向端口利用率峰值70%持续80%分流或升级链路缓冲区丢弃计数0持续增长调整QoS或限速广播包占比5%10%划分VLAN隔离组播包占比按需泛洪启用IGMP SnoopingCRC错误计数0增长查物理层交换机的丢弃计数是最直接的证据。登录交换机管理界面看每个端口的discard或drop计数如果持续增长基本可以确认是拥塞。这时候要么做流量整形要么把大流量业务视频、文件传输和实时控制业务分到不同VLAN甚至不同物理网络。2.3 协议层传统以太网的先天缺陷传统以太网用的是CSMA/CD载波监听多路访问/冲突检测本质是先听后说冲突就退避重发。这个机制在办公网络里没问题但在工业实时控制里是致命的——因为冲突后的退避时间是随机的你无法保证一个包在最坏情况下多久能送达。虽然现在全双工交换式以太网已经消除了冲突域CSMA/CD基本不生效了但传统以太网还有另一个问题没有时间调度机制。所有数据包都是尽力而为Best Effort转发谁先到谁先走没有优先级保证。一个大的文件传输包可能堵住一个急停信号包这在工业里是不可接受的。TCP协议本身也有问题。TCP的重传超时RTO机制在丢包后会等待一个超时周期再重传这个周期通常是几百毫秒到几秒。对于运动控制来说等几百毫秒再重传机械臂早就撞上去了。所以工业实时控制普遍用UDP或专用实时协议如EtherCAT、Profinet IRT但UDP本身不保证可靠丢了就丢了。这就是为什么需要TSN——它要在标准以太网上补上时间调度和可靠性这两块短板。2.4 时间同步没有统一节拍调度无从谈起很多人忽略了一点要做时间调度前提是所有设备的时间是同步的。如果交换机A认为现在是10点00分00秒001毫秒交换机B认为现在是10点00分00秒003毫秒那调度器根本没法协调。工业网络的时间同步普遍用IEEE 1588PTP精确时间协议精度可以做到亚微秒级。PTP通过在主时钟和从时钟之间交换同步报文计算链路延迟和时钟偏移然后调整从时钟。TSN的调度机制如时间感知整形器TAS完全依赖PTP提供的时间基准。PTP同步失败或精度不够会直接导致调度错乱表现为周期性丢包或时延抖动。排查PTP要看主时钟是否稳定、网络路径是否支持透明时钟TC、是否有非PTP设备阻断了同步报文。我遇到过因为一个普通交换机不支持PTP透传导致整条链路同步精度从亚微秒退化到毫秒级TSN调度直接失效。3. TSN在标准以太网上造出确定性3.1 TSN到底解决了什么问题TSNTime-Sensitive Networking时间敏感网络不是某一个协议而是IEEE 802.1工作组下的一系列标准集合。它的核心目标就一个在标准以太网上实现确定性传输。所谓确定性就是我承诺这个包在X微秒内一定送到且不会丢这个承诺是可验证、可保证的。TSN的几个关键机制802.1ASgPTP时间同步为所有调度提供统一时钟基准。802.1Qbv时间感知整形器TAS把时间划分成周期性的时间片每个时间片只允许特定优先级的数据通过。比如每1毫秒一个周期前200微秒留给实时控制后800微秒留给普通数据。802.1Qbu 802.3br帧抢占高优先级帧可以打断正在传输的低优先级帧不用等低优先级帧传完。这解决了一个大包堵住急停信号的问题。802.1CB帧复制与消除FRER同一个帧在两条独立路径上同时发送接收端去重。一条路径断了另一条还能到实现无缝冗余。802.1Qcc配置模型集中式或分布式的网络配置管理。这几个机制组合起来才能实现低时延高可靠。单独上TAS没有FRER可靠性不够单独上FRER没有TAS时延还是不确定。3.2 TAS时间感知整形器的工作逻辑TAS是TSN里最核心也最难理解的机制我用一个类比来解释。想象一个十字路口普通网络是谁先到谁先过高峰期就堵死。TAS相当于给路口装了红绿灯而且这个红绿灯的周期是严格固定的每1毫秒一个循环前0.2毫秒只放行急救车实时控制流量后0.8毫秒放行普通车普通数据。急救车永远不用等因为它的通行窗口是预留的。具体到交换机实现每个出端口维护一个门控列表Gate Control List列表里定义了每个时间片哪些队列的门是开的。比如周期 1ms 时间片00-200us队列7门开实时控制其他队列门关 时间片1200-1000us队列0-6门开普通数据队列7门关这样实时控制流量在每个周期都能获得200微秒的独占带宽时延上界就是200微秒加上传输时间。普通数据在剩余800微秒里传输不影响实时流量。TAS的难点在于时间片规划。时间片太短保护带开销大带宽利用率低时间片太长实时流量的时延上界就大。而且所有交换机的门控列表必须严格同步这依赖gPTP的精度。实际项目中我一般先用流量分析工具统计各业务的周期和突发特征再反推时间片划分而不是拍脑袋定。3.3 FRER帧复制与消除无缝冗余的实现工业现场最怕的就是单点故障。一根线断了、一个交换机挂了业务就中断。传统冗余方案如STP、RSTP的问题是切换需要时间通常是几十毫秒到几秒对实时控制来说太慢。FRER的思路很直接同一个帧从源节点同时发两份走两条完全不相交的路径到目的节点去重。正常情况下两份都到接收端保留先到的丢弃后到的一条路径断了另一条照常工作接收端完全无感知。切换时间是0因为根本没有切换这个动作。FRER的实现需要在帧里加一个R-TAG冗余标签包含序列号。接收端根据序列号判断哪些是重复帧。序列号空间要足够大避免回绕导致误判。实际部署FRER要注意两条路径必须物理独立不能共用同一根线缆或同一个交换机。我见过为了省成本两条路径走同一个线槽的不同网线结果施工时一铲子下去两根全断冗余形同虚设。真正的冗余要连供电、交换机、线槽都独立。3.4 TSN落地的现实门槛TSN技术很美好但落地有几个现实门槛第一成本。支持TSN的工业交换机比普通工业交换机贵好几倍而且需要支持gPTP、TAS、FRER的完整功能集不是所有标称TSN的交换机都全支持。选型时要逐条核对功能列表。第二配置复杂度。TAS的门控列表、FRER的路径规划、gPTP的时钟域划分都需要专业工具和专业知识。目前各厂商的配置工具还不互通容易形成厂商锁定。第三生态成熟度。支持TSN的终端设备PLC、伺服、IO模块还不多很多现场设备只有标准以太网口。TSN交换机可以兼容普通设备但普通设备享受不到确定性保障只能走尽力而为队列。第四运维能力。TSN网络的故障排查比普通网络复杂得多需要抓包分析PTP报文、检查门控列表执行情况、验证FRER路径状态。运维团队要经过专门培训。我的建议是不要为了TSN而TSN。先评估业务是否真的需要微秒级确定性。如果只是毫秒级要求用工业以太网QoSVLAN划分可能就够了。TSN适合的是多业务融合场景——同一张网上既有实时控制、又有视频、又有普通IT流量且实时控制要求严格。4. 工业5G无线场景下的确定性尝试4.1 工业5G和消费级5G的区别工业5G有时叫5G-ACIA定义的工业5G和你在手机上用的5G虽然底层空口技术同源但设计目标完全不同。消费级5G追求的是峰值速率和用户体验工业5G追求的是确定性时延和可靠性。关键区别在几个方面上行增强工业场景大量数据是设备往上传传感器、视觉工业5G会配置更大的上行时隙比例。确定性调度通过预留资源块、配置半静态调度SPS保证关键业务的时延上界。本地化部署工业5G通常用专网核心网下沉到工厂本地数据不出厂时延也低。冗余传输支持双连接、PDCP复制同一个包走两条路径。时间同步支持IEEE 802.1AS over 5G让无线设备也能接入TSN时间域。工业5G的目标时延是1毫秒级端到端可靠性做到99.999%。这个指标在实验室环境能实现实际工厂环境受无线信道质量、多径、干扰影响会打折扣。4.2 工业5G适合哪些场景工业5G不是要取代有线而是补有线的短板。适合的场景移动设备AGV、移动机器人、手持终端这些设备本来就没法拉线。旋转设备机械臂关节、旋转工作台线缆反复弯折容易坏无线更可靠。临时产线快速换产、临时工位拉线成本高、周期长。危险区域高温、高湿、腐蚀环境布线困难。跨区域连接厂区跨度大拉光纤成本高无线更经济。不适合的场景固定安装、高带宽、强实时的设备比如固定式视觉相机、高精度伺服这些还是有线更稳。无线信道是共享介质再好的调度也做不到有线那样的确定性。4.3 工业5G的时延构成与优化工业5G的端到端时延由几段组成时延段典型值优化手段终端处理0.1-0.5ms优化协议栈、减少拷贝空口传输0.5-2ms配置SPS、预留资源基站处理0.1-0.5ms边缘计算下沉核心网0.5-2ms本地UPF下沉应用服务器0.1-1ms边缘部署要压到1毫秒级核心网必须下沉到工厂本地UPF下沉应用服务器也要边缘部署。如果数据要绕到运营商核心网再回来时延轻松上到十几毫秒工业实时控制就没法用了。空口优化方面**半静态调度SPS**是关键。普通5G是动态调度每个时隙都要基站分配资源有调度信令开销和等待。SPS是预先配置好资源终端直接发省掉调度等待。代价是资源利用率低因为预留的资源即使不用也不能给别人。工业场景流量规律SPS很合适。4.4 工业5G和TSN的融合工业5G和TSN不是竞争关系而是互补。3GPP在Release 16之后定义了5G系统作为TSN桥的能力让5G网络在TSN架构里表现为一个逻辑桥。这样有线TSN域和无线5G域可以统一时间同步、统一调度。融合的关键是时间同步。5G系统要对外提供gPTP时钟让无线终端和有线设备在同一个时间域里。3GPP定义了5G内部时钟和外部gPTP的映射机制但实现复杂度高目前支持的产品还不多。实际项目中如果只是用5G做移动设备的接入不一定需要完整的TSN融合。可以用5G自己的确定性调度保证时延然后在5G和有线网的边界做流量整形和缓冲把抖动吸收掉。这种分段确定性的方案更务实落地也更容易。5. 一张网融合多业务VLAN划分与QoS的实战配置5.1 为什么必须做网络分段工业现场的网络如果所有业务跑在一张平网上迟早出问题。视觉相机的突发流量会冲击PLC的控制流量办公网的下载会占用产线带宽广播风暴会波及所有设备。网络分段不是可选项是必选项。分段有两个维度VLAN划分逻辑隔离和QoS优先级同一VLAN内的差异化服务。VLAN解决不同业务互不干扰QoS解决同一业务内关键流量优先。我一般按业务类型划分VLANVLAN ID业务类型优先级说明10实时控制7PLC、伺服、IO20运动控制6多轴同步30视觉检测4相机、图像传输40监控视频3安防摄像头50办公IT1办公电脑、打印99管理0交换机管理实时控制VLAN的流量最小但优先级最高视觉和视频VLAN流量大但优先级低。这样即使视觉系统突发大流量也不会影响控制流量。5.2 交换机QoS配置的关键参数以主流工业交换机为例QoS配置涉及几个关键点信任边界Trust Boundary在接入端口上要配置信任终端打上的优先级标记还是由交换机重新标记。工业终端很多不打标记所以通常在接入端口用基于端口的优先级Port-based Priority把整个端口划到某个优先级。汇聚和核心端口则信任DSCP或802.1p标记。队列调度交换机每个端口有多个优先级队列调度算法有严格优先级SP、加权轮询WRR、混合模式。实时控制流量用SP保证绝对优先普通流量用WRR按权重分配带宽。拥塞管理当队列快满时用WRED加权随机早期检测主动丢弃低优先级包避免缓冲区完全打爆导致所有流量都丢。配置示例以某工业交换机CLI为例# 创建VLAN vlan 10 name RealTimeControl vlan 30 name Vision # 配置接入端口 interface GigabitEthernet1/0/1 switchport mode access switchport access vlan 10 qos trust cos qos cos 7 # 配置上联端口 interface GigabitEthernet1/0/24 switchport mode trunk switchport trunk allowed vlan 10,30,40,50 qos trust dscp mls qos queue-set output 1 threshold 1 80 100 100 # 配置队列调度 mls qos srr-queue output shape 1 mls qos queue-set output 1 buffers 15 25 40 20具体命令各厂商不同但逻辑一致接入端口打标汇聚端口信任标记出口队列按优先级调度。5.3 组播优化视觉和视频业务的必修课视觉检测和视频监控大量用组播。组播如果配置不当交换机会把组播包泛洪到所有端口形成组播风暴严重时打爆网络。必须启用IGMP Snooping让交换机知道哪些端口有组播接收者只往那些端口转发。进一步可以启用IGMP Querier让交换机主动查询组播组成员。对于已知的固定组播流可以直接配置静态组播组避免动态学习的延迟。组播还有风暴抑制的问题。工业交换机一般支持广播/组播/未知单播风暴抑制配置阈值时要小心阈值太低会误丢正常组播太高起不到保护作用。我一般先统计正常业务的组播速率然后把阈值设成正常峰值的1.5到2倍。5.4 冗余环网比STP更快的选择工业现场常用环网冗余因为环网布线简单一根线断了两边还能通。传统STP/RSTP切换时间几十毫秒到几秒工业实时控制等不了。所以工业交换机普遍支持专用环网协议如RSTP的工业增强版、HIPER-Ring、MRP介质冗余协议等切换时间可以做到10毫秒以内甚至零丢包。MRP是IEC 62439-2标准切换时间典型值10毫秒支持环网和相切环。配置时要指定一个冗余管理器RM它负责监控环网状态正常时阻塞一个端口避免环路故障时打开阻塞端口恢复连通。环网配置的坑环网里不能有普通交换机因为普通交换机不支持MRP会破坏环网逻辑。所有环网节点必须是支持同一环网协议的工业交换机。另外环网规模不宜太大一般建议不超过50个节点否则切换时间会变长。6. 现场踩坑实录那些文档里不会写的教训6.1 接地不良导致的幽灵丢包有个项目产线运行几个月后开始随机丢包每天几次每次几秒钟。查了交换机日志、抓了包、换了网线都没找到原因。最后用示波器测网线屏蔽层对地电压发现有几十毫伏的工频干扰。顺着查下去发现是车间新增了一台大功率设备它的接地和网络机柜的接地接到了同一个接地排但接地电阻不达标导致地电位差。教训工业网络接地是独立的系统工程。网络机柜要有独立的接地排接地电阻小于4欧姆不能和动力设备共用接地。屏蔽层单端接地接地点要选在交换机侧。有条件的话用光纤做跨区域连接彻底隔离地电位差。6.2 PTP主时钟被降级引发的调度失效一个TSN试点项目调试时一切正常运行一周后开始出现周期性丢包。查gPTP状态发现主时钟从Grandmaster降级成了Slave整个时间域乱了。原因是网络里接入了一台新设备它的PTP优先级配置比原主时钟高触发了BMCA最佳主时钟算法重新选举。新设备时钟精度差导致整个域同步精度下降。教训TSN网络里所有PTP设备的优先级要统一规划关键设备如核心交换机配置为高优先级主时钟终端设备配置为从时钟。启用PTP域隔离不同业务用不同域号。上线前用PTP分析仪验证同步精度运行中监控主时钟状态。6.3 5G专网和Wi-Fi的频谱冲突某工厂同时部署了工业5G专网和Wi-Fi 6运行后发现5G上行时延偶尔飙高。查频谱发现Wi-Fi在5GHz频段某些信道和5G专网频段相邻带外泄漏导致5G上行信噪比下降。调整Wi-Fi信道规划避开5G频段后恢复正常。教训无线频谱是共享资源多制式共存必须做频谱规划。工业5G专网频段通常是运营商分配的专用频段但Wi-Fi、蓝牙、Zigbee等免许可频段可能相邻。部署前用频谱仪扫频识别干扰源合理规划信道。5G基站和Wi-Fi AP的物理位置也要拉开距离减少近场干扰。6.4 交换机缓冲区看起来够用其实不够选型时看交换机参数缓冲区1.5MB觉得够用。实际运行发现视觉检测触发时丢包。算一下视觉相机突发流量500Mbps持续10毫秒就是5Mb的数据。交换机上联端口1Gbps10毫秒能传10Mb理论上够。但问题是多个相机同时触发总突发2Gbps上联端口只有1Gbps多出来的1Gb数据要在缓冲区里排队。1.5MB缓冲区只能存12Mb数据1Gb数据需要125MB缓冲区差了两个数量级。教训缓冲区大小要按最坏情况突发算不是按平均流量算。工业场景的突发往往是多个设备同时触发要统计所有设备的同步突发总量。缓冲区不够时要么升级上联带宽要么做流量整形把突发削平要么用TAS给突发业务预留时间片。6.5 光纤收发器不匹配导致的间歇性链路一个跨厂房连接用了光纤收发器运行一段时间后偶尔丢包。换了收发器、换了光纤跳线问题依旧。最后发现两端收发器的光功率预算不匹配一端是长距收发器发射功率高另一端是短距收发器接收灵敏度低长距的强光把短距的接收端打饱和了信号失真。教训光纤链路两端收发器的光功率预算要匹配。长距对长距、短距对短距或者中间加衰减器。用光功率计实测接收光功率要在收发器规格书的接收范围内一般建议在灵敏度以上3dB、饱和点以下3dB的区间。光纤接头要清洁灰尘是光链路的大敌。7. 从需求到落地一套可复用的网络设计检查清单7.1 需求梳理阶段要问清楚的几个问题网络设计不是一上来就选设备先把需求问清楚。我一般会问业务类型有哪些实时控制、运动控制、视觉、视频、办公各占多少带宽时延要求是多少是毫秒级还是微秒级最坏情况允许多少可靠性要求是多少允许一年停机多久单点故障能否接受设备数量多少现在多少未来三年扩展到多少移动设备有多少哪些必须无线哪些可以有线环境有什么特殊高温、高湿、振动、电磁干扰、防爆现有网络是什么能否利旧还是全部新建运维团队能力如何能否维护TSN这种复杂网络这些问题答不清楚后面选型就是拍脑袋。我见过太多项目需求阶段含糊实施阶段扯皮最后网络建好了但不好用。7.2 设备选型的硬指标核对选工业交换机别只看品牌和价格逐条核对硬指标指标要求说明工作温度-40~75℃宽温型号看实际环境防护等级IP40以上粉尘环境要IP54冗余电源双电源输入单电源故障不停机环网协议支持MRP/RSTP切换时间20msQoS队列至少4个实时控制要8个VLAN数满足分段需求至少支持256组播IGMP Snooping视觉视频必需管理SNMP/CLI/Web便于运维TSN功能按需核对gPTP/TAS/FRER逐条确认TSN交换机选型尤其要小心有些厂商标称TSN ready实际只支持gPTP不支持TAS和FRER。要拿到功能列表逐条确认最好要求现场演示。7.3 上线前的验证测试网络建好不是终点上线前必须做验证测试时延测试用专业测试仪如Spirent、IXIA打流测最坏时延和抖动。丢包测试满负载打流持续24小时看丢包计数。冗余切换测试拔掉主路径测切换时间和丢包数。时间同步测试测gPTP同步精度看是否满足调度要求。故障注入测试模拟各种故障断线、断电、干扰看网络行为。压力测试所有业务同时跑看是否互相影响。测试要形成报告记录测试条件、结果、是否达标。这份报告是验收依据也是后续运维的基线。7.4 运维阶段的持续监控网络上线后运维才是长期挑战。建议部署监控系统持续采集交换机端口流量、利用率、丢弃计数gPTP同步状态和精度环网状态和切换事件无线信号质量和时延关键业务的端到端时延设置告警阈值比如端口利用率持续超过70%、丢弃计数增长、PTP失步及时告警。定期做健康检查每季度或每半年一次提前发现隐患。我在实际项目里的体会是工业网络没有一劳永逸的方案。产线在变、设备在增、业务在演进网络也要持续优化。把监控和巡检做成制度比出了故障再抢修要划算得多。另外文档要齐全——拓扑图、配置备份、测试报告、变更记录这些在故障排查时能救命。我见过因为没文档一个简单故障查了两天的案例教训深刻。
返回列表