ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

IPS入侵防御系统全解析:原理、部署与双机热备

IPS入侵防御系统全解析:原理、部署与双机热备 做了这么多年安全运维被问得最多的一个问题就是IPS和防火墙到底有什么区别每次售前讲方案的时候防火墙、IPS、WAF一样不少可真到验收上线的时候很多人对着这台号称“入侵防御系统”的设备一脸茫然。今天我就把这事儿掰开揉碎了聊透——什么是IPS、它靠什么拦住攻击、部署时有哪些坑顺带把双机热备下防火墙、IPS、WAF的自动切换原理也一次讲清楚。这篇文章适合刚接触安全设备的新人也适合那些已经上了设备但总觉得没玩明白的运维老手。1. IPS到底是什么先搞懂这个“网络安检门”是干什么的1.1 流量必经之路IPS在企业网络中的位置理解IPS最简单的方式就是把它想象成机场安检口。你进安检门行李过X光机工作人员盯着屏幕发现违禁品直接扣下人都不让登机。IPS干的活儿一模一样——只不过它检查的不是行李箱而是网络里跑的数据包。它串联在业务流量必经的链路上所有进出的流量都得从它眼皮底下过一遍一旦发现里面有攻击行为直接就地拦截不让恶意流量继续往服务器或终端上跑。这里有个很关键的点IPS这个名字里的“防御”二字决定了它必须工作在串联模式。数据包从交换机出来不经过IPS是到不了服务器的它就像一扇只能从它这儿通过的门。这种部署方式跟旁路探针完全不同旁路设备只能看不能挡而IPS是既能看又能挡。很多刚接触的人不理解为什么非要串联觉得多加一台串联设备多一个故障点但这就是IPS的天职——它不是监控摄像头而是保安本人站门口。1.2 IDS、IPS、防火墙到底有啥区别很多人把这三者混着叫其实它们的定位差异挺大。我直接列个表你一看就明白设备部署方式能不能拦截关注层面防火墙串联能基于IP、端口、协议做访问控制IDS入侵检测系统旁路不能只报警分析镜像流量发现攻击后发告警IPS入侵防御系统串联能深度检测流量内容实时阻断攻击打个比方防火墙是小区保安看门禁卡判断谁进得来IDS是物业装的摄像头看到可疑的人只能记下来、喊一嗓子IPS则是站在单元门口的保镖不光看到坏人来还直接上手把人摁住。从功能演进看IPS可以理解为“IDS的拦截升级版”但它又跟防火墙形成互补——防火墙管的是“谁能访问”IPS管的是“访问的内容里有没有坏东西”。现在很多下一代防火墙已经内嵌了IPS模块但独立IPS设备在处理深层次攻击检测、规则精度、性能调优上依然有它不可替代的位置。1.3 别小看IPS它还能干这些活除了拦常见的SQL注入、XSS攻击、命令注入这类Web攻击IPS能干的事情比想象中多得多。我实际运维中发现它最常用的几个场景是漏洞利用防护系统漏洞没来得及打补丁的时候IPS规则可以先顶上漏洞特征被识别出来就直接拦截相当于给脆弱系统套了一层临时铠甲。暴力破解阻断针对SSH、RDP、数据库等服务的爆破行为IPS可以根据源IP的登录失败频率进行锁定或限速。木马与僵尸网络通信检测内网机器中了木马尝试向外网C2服务器回连的时候IPS能识别出这种异常外联行为并断开连接。违规流量管控一些不符合规范或企业安全策略的协议、应用特征IPS可以拦防止敏感数据通过非常规通道外传。从这个角度看IPS不是一台只会“报错”的设备它是企业安全防线里真正动手干活的角色。理解了它是什么下一步就得看透它到底是怎么认出攻击的。2. IPS识破攻击的原理从特征匹配到全流量解析2.1 特征匹配效率最高的传统招数IPS检测攻击最基础的手段就是特征匹配逻辑说起来极简单安全厂商的攻防实验室把已知攻击行为写成规则规则里描述了攻击流量中特有的字符串、二进制特征或代码序列IPS把经过的每个数据包拿去做规则比对匹配上了就判定为攻击。这个思路跟通缉令上的照片比对一模一样。攻击者如果老老实实按已知姿势打过来一眼就能被认出来。特征匹配的好处是准确率高、性能开销小误报相对可控坏处也明显——只能识别规则库里面写过的攻击遇到变种或者新出零日漏洞就抓瞎。所以IPS设备非常依赖特征库的更新速度这也直接决定了这台设备的“视力”好坏。我在选型时会重点看厂商的规则更新频率和应急响应能力而不是光看设备参数。2.2 协议解码与异常检测专治不按套路出牌的对手攻击者又不傻不会总拿原版特征来打。他们经常把攻击载荷做变形——大小写混写、插入无关字符、用编码绕一下特征匹配很容易被绕过。这时候就得靠IPS的协议解码能力。所谓协议解码就是IPS不只是看数据包表皮它会按照HTTP、SMTP、DNS等协议规范把流量拆开、还原还原成应用层能看到的内容然后拿协议标准去比对。比如HTTP请求里该有的字段格式、长度、字符集不符合RFC规范的异常情况就会被揪出来。这个过程我习惯比喻成查账特征匹配是看发票上的公章是不是真的协议解码是逐行核对这账目本身合不合规矩。很多混淆过的攻击载荷在解码还原之后真实意图根本藏不住。还有一类是异常检测基于行为基线来发现攻击。IPS会记录一个时间段内的正常流量特征比如某个服务器平时对外请求的包大小、连接频率、协议类型一旦流量偏离基线范围比如一个从不对外的内网机器突然向外疯狂发包系统就会产生告警或阻断。这一招对未知攻击特别有用但也是误报的重灾区需要后期花时间做基线的学习调优。2.3 流量重组为什么分片攻击和慢速攻击逃不掉网络传输有个特点大包会被拆分多个小包、分多条路径到达目的地再组装。攻击者就利用这一点把恶意载荷拆散藏进不同数据包里每个包单独看都是人畜无害的碎片到了服务器端一重组攻击就成型了。IPS的应对思路很直白它也做重组。IPS先把属于同一会话的所有TCP数据段缓存下来做流重组还原出完整的应用层数据流再做检测。这就像海关查行李单独一件件散件看不出问题但把所有零件拼在一起发现是一把枪的组件那就不让你过。同理慢速攻击——攻击者把数据包拉长间隔一点一点发企图耗死检测设备的会话表或绕过阈值——IPS通过跟踪会话状态和超时机制来处理会话持续时间、传输速率异常都会触发规则这功能在实战里非常能打。2.4 从检测到阻断动作机制与误报权衡检测到了之后怎么办IPS一般提供几种动作我建议每个策略都根据业务场景去选而不是一刀切全“阻断”放行Pass不作处理直接通过一般用于临时豁免。告警Alert记录日志、上报告警但不断开连接适合刚开始上线设备、不确定业务兼容性的时候。阻断Drop直接丢弃匹配的包连接会中断或超时这是动作里最“硬”的也是IPS存在的意义。重置连接Reset主动发送TCP RST包把会话断开但因为还要发包对性能有一点额外开销不过它是双向断开效果更干净。限速Rate Limit对特定源IP或会话做流量整形比如限制爆破请求的频率这是比较精细化的方式。这里一定要提误报。IPS的规则很多写得比较严生产环境里如果把所有规则都开成阻断大概率会把正常业务打断。所以我的习惯是新设备先全局告警模式跑一两周观察告警和业务日志的吻合度再分批把高置信度的规则切成阻断。这个平衡做不好IPS很容易变成业务方的“眼中钉”最后被偷偷改成只告警失去意义。3. 架构部署与选型串联还是旁路你得想清楚3.1 串联部署IPS真正的用武之地前面反复强调IPS要防御必须串联。但串联也要看怎么串、用什么模式串。目前两种典型模式透明桥接模式。IPS像一根“网线”一样插在交换机和防火墙之间不改变原有IP规划不用改路由对现有网络结构几乎无感。这种模式适合大多数企业部署成本最低。需要注意的是一定要给设备配好管理IP独立走管理网段不然设备一上线你就失联了。路由模式。IPS作为三层设备参与路由接口配置IP地址、走静态或动态路由。一般用在网络边界需要同时做区域隔离的场景IPS顺便当了一台路由器。这种模式配置复杂一些但流量控制更精细适合网络本来就该重新规划的地方。串联设备最怕什么怕设备挂了导致整个网络瘫痪。所以正规的IPS都带Bypass功能——设备断电或故障时流量自动切换到物理链路直通保证业务不断。硬件设备一般通过继电器实现断电自动Bypass但进程卡死这类故障需要靠看门狗或HA机制来处理。这个细节在采购时一定要确认清楚别等断网了才发现设备不支持硬件Bypass。3.2 旁路部署只检测不拦截的场景那旁路部署就完全没用吗也不是。有些场景没法串联比如核心交换机上流量非常重要、绝不允许加设备或者需要先做一段时间的检测评估、看效果再决定要不要上IPS拦截。旁路部署就是把IPS接在交换机镜像口上流量复制一份给它它只分析不干预。这时候它其实退化成了“带防御能力的IDS”——能看到攻击能精确报警就是不能自己动手挡。不过旁路的优势是零风险、不影响业务特别适合做安全评估阶段的数据采集或者用来做等保合规里的入侵检测要求。有的企业会把一台高配IPS先旁路跑一个月把内网攻击面的底数摸清楚再谈串联拦截的事这是个很稳妥的渐进式落地思路。3.3 硬件、软件、云上三种部署形态怎么选IPS的交付形态现在非常多样按场景选型才不会花冤枉钱硬件IPS独立盒子通常带专用的ASIC加速芯片吞吐高、延迟低适合大中型企业数据中心出口或核心区域。缺点是一台设备就是一台设备要扩容得上新硬件。软件IPS以虚拟机镜像或软件包形式部署在虚拟化平台或云主机上成本低、弹性好适合中小规模或云上租户场景。性能受宿主机影响高流量场景容易吃CPU。云原生安全组/云IPS云厂商托管的安全能力规则库由云厂商统一更新安全组联动弹性伸缩适合用公有云的企业。但灵活度不如自建设备有些精细化策略做不了。我在实际项目中遇到过客户在公有云上硬塞一台硬件IPS的做法结果弹性没享受到还得自己维护链路非常别扭。现在云上安全能力已经很成熟了云环境优先选云原生方案别用传统硬件思维硬套。内部核心机房的南北向流量再用专用硬件IPS去扛。3.4 性能指标怎么选别只看吞吐量IPS是串联设备性能直接决定业务体验选型参数必须看仔细。下面这几个指标一个都不能少吞吐量Throughput设备每秒能处理的最大流量。公式很现实买来的设备实际跑业务只能发挥标称值的50%到70%因为真实流量有大量小包、长连接、并发会话不像测试环境那么干净。所以出口带宽10G建议IPS标称吞吐至少20G起步。并发连接数Concurrent Connections设备同时能维护的会话总数。现在业务都是长连接、高并发这个数低于100万容易出问题。可以按“在线用户数×平均每用户连接数”粗估一下。新建连接速率CPS每秒能处理多少个新建立的会话。高并发场景比如抢购、秒杀、对外API尤其看重这个不然高峰期连接建立都来不及直接被拒绝。时延Latency数据经过IPS带来的额外延迟。一般以微秒到毫秒级为标准但对交易系统、量化这类场景延迟高一点就受不了选型时要问清楚设备在开启全部检测功能后的最大时延是多少。我给客户的建议一直是IPS的性能余量起码留40%以上宁可多配不能少配。串联设备一旦性能到瓶颈最先表现出的不是“设备挂了”而是“业务莫名卡顿”排查起来相当头疼。4. 高可用与双机热备设备挂了安全防线不能跟着挂4.1 高可用设计的基本思路主备模式与负载分担串联设备最怕单点故障所以正经的生产环境厂商方案里都会写“以上方案所用设备均为2套”。两套设备其实就是做高可用最常见的两种形态主备模式Active-Standby。同一时间只有一台设备处理流量另一台热备待命。主设备正常运行备设备同步配置和会话信息一旦主设备故障备设备接管业务。这种模式的优点是切换逻辑简单、不会乱缺点是一台设备闲着资源利用率只有50%。负载分担模式Active-Active。两台设备同时处理流量通过链路聚合或等价路由把流量分别甩给两台设备。这种模式利用率高但设计复杂度也高会话状态如何同步、流量来回路径不一致怎么办、连接跟踪表怎么合并理论上都更麻烦。对防火墙、IPS这类状态检测设备来说我个人的建议是流量模型复杂的场景稳字当头优先主备业务弹性需求大、设备性能不足以支撑单机的再考虑负载分担。别为了那50%利用率把自己坑了会话同步不彻底造成的“切换后业务断连”问题比设备故障本身更让人崩溃。4.2 防火墙、IPS、WAF的自动切换原理心跳、浮动IP与会话同步网络热词里提到的“各种故障情况下的防火墙IPS WAF自动切换原理”本质上都有共性的技术底座——无非三件事健康检查、故障通告、接管流量。我从底层把这套机制一次说透。第一层是心跳机制。两台设备之间通过专用HA心跳口周期性互发报文告诉对方“我还活着”。心跳报文可以是厂家私有协议也可以走VRRP等标准协议。主备设备通过心跳来感知对端状态连续丢失几个心跳包一般默认是3到5个间隔1秒左右备机就判定主机故障。第二层是故障触发条件。不只是“设备断电”才叫故障。真实生产环境里故障来源五花八门主机电源坏了、CPU跑满、内存泄漏、接口掉线、链路拥塞、上行交换机端口down了甚至IPS的检测引擎进程异常退出。所以现在的设备支持多维度健康检测不只是心跳还包括接口链路状态检测、进程状态监控、甚至主动向外发探测报文比如定期ping下一跳网关只要有一项异常就进入“我要接管”的流程。第三层是浮动IPVIP机制。主备设备上配置同一个虚拟IP正常时候VIP在主设备上生效流量设备的网关指向这个VIP认准它走。主设备一挂备设备立刻把VIP抢过来绑定在自己身上同时通过免费ARP通告刷新交换机MAC表让下游设备改走自己。这个过程用户完全无感知业务IP没有变化网络不通的时间就是切换耗时。第四层是会话同步Session Sync。状态检测设备跟普通路由器最大的不同是它记录每条会话的状态。如果主设备上有大量活跃TCP连接切到备设备后备设备不认识这些连接会当成新来的陌生流量给丢掉业务连接就会断。所以主设备要把会话表实时同步给备设备备设备时刻准备着接管所有连接。会话同步的完整度直接决定了切换质量是“秒断秒续”还是“全断重连”。这也就是为什么上一节我说主备模式的会话同步要做好Windows域控、数据库长连接、WebSocket这类长会话在切换时对同步质量极其敏感。4.3 故障切换的触发条件、时间线与常见故障场景我直接按场景拆解一下切换的时间线大致是这样故障场景检测方式切换时间业务影响设备整机断电心跳超时3~10秒毫秒级~秒级中断接口/链路断开链路检测1~3秒暂时中断切换后恢复检测引擎卡死进程监控5~15秒可能伴随部分误丢包上行网关不可达探测报文10~30秒取决于探测周期设置这里要特别说明切换时间不等于业务中断时间。因为切换期间交换机MAC表刷新、备机加载VIP、免费ARP广播这些动作都需要时间整体算下来一般会产生秒级的业务抖动。对普通Web业务来说基本无感但对证券交易、工业生产控制这类超低延迟场景哪怕一秒的中断都是大事方案上就得额外考虑链路双活、应用层负载均衡等机制不能只靠设备HA解决。另外有个容易被忽略的故障场景——脑裂。两台设备之间的心跳链路本身断了但业务链路都正常于是主备设备都认为对方死了双双抢VIP、都开始转发流量。结果就是网络里出现两台设备同时处理流量、路由混乱、MAC表反复动荡。防止脑裂的常规做法是加双心跳线两条独立的物理链路连HA口有条件再加一条管理通道做第三心跳投票机制决定谁是主。我在设计高可用方案时双心跳是标配绝不省这个钱。4.4 我在双机切换上踩过的坑分享几个真实踩过的坑这些都是厂商文档里不会写明、但实战中一定会遇到的。第一个坑会话同步方向配反了。设备A把会话同步给设备B但设备B没有把会话回同步给设备A。结果主备来回切换一次每次都有一侧业务重连。后来排查了配置才发现厂商的会话同步是双向各配各的不是勾一个“启用同步”就完事。第二个坑抢占机制没关。一台设备故障恢复后默认会主动抢回VIP。但此时另一台设备上可能积累了大量的、它不认识的会话状态一抢回来业务又断一次。后来我把“抢占模式”关掉让故障设备恢复后保持备机状态等到下一个维护窗口手动切回业务稳定了很多。第三个坑Bypass口和HA链路混在一起。有一次维护人员把业务光口和HA光口接到了同一对光纤收发器上结果光纤链路一抖HA心跳和业务链路同时跳整台设备被判定故障另一边刚接管这边又抢回来网络瘫痪了半小时。从此之后我要求业务链路和HA链路必须物理分离走不同的交换机、不同光模块尤其是单纤收发器场景一定要理清楚。5. 常见问题与排查技巧实录真实运维中积累的经验5.1 常见问题速查表先对号入座现象可能原因排查思路业务网页偶尔打不开IPS误拦了正常请求查IPS日志里的阻断记录确认是否命中可疑规则切换后大量连接断开会话同步不完整检查同步配置、抓包验证备机上是否已有会话表IPS设备CPU长期100%规则全开太多、流量超过性能精简规则集、开流量整形、升级设备性能攻击日志很多但业务无感设备在旁路模式只告警确认部署模式检查告警策略是否生效HA切换频繁心跳链路不稳、双心跳未配置检查HA口光衰、配置第三心跳、查看切换历史特定应用上传慢深度检测导致延迟增加针对该应用IP或端口做白名单或降低检测深度5.2 误报和漏报这对矛盾怎么平衡这是IPS运维里最核心的日常。误报多了正常业务被拦业务部门肯定骂人漏报多了攻击绕过了你安全部门兜不住。我的经验是分三类做精细化运营第一类高置信度攻击规则直接阻断。比如SQL注入特征库、CVE漏洞利用特征、恶意文件传输等这些规则误报率低、危害大放心开阻断。第二类行为类规则先告警后阻断。比如暴力破解、异常流量、隧道行为这类规则依赖基线容易误伤先告警观察一段时间确认阈值适用了再逐步切阻断。第三类自定义白名单必须给足。对业务系统记录它们正常使用的源IP段、目的端口、协议特征凡是白名单命中的流量不做深度检测或者降低检测级别。这能大幅减少误报同时让设备把资源省下来认真盯真正的攻击。5.3 SSL加密流量根本看不到IPS怎么防现在全网都在推HTTPS这意味着IPS能看到的内容越来越少。很多流量都是加密的明文规则直接失效。这个问题不解决IPS就在裸奔。常见的解法是SSL解密检测SSL Inspection。IPS作为中间人把加密流量先解密成明文做完深度检测再重新加密发给对端。技术上能实现但有两个代价一是性能消耗巨大解密重加密对CPU要求很高选型时得给足余量二是部署了SSL解密涉及用户隐私、合规、证书管理一堆事儿在很多行业里不是想解就能解的。更务实的思路是靠元数据和指纹来兜底。证书指纹黑名单、SNI域名信誉、加密流量特征比如TLS指纹JA3、连接行为分析这些不用解密也能看出端倪。实践中我一般双管齐下对内部办公区的流量做全量解密检测反正企业是自己管自己对互联网出口流量用指纹和元数据做大范围覆盖对举报或威胁情报提示的可疑流量做针对性解密深查。5.4 规则库更新和验证不能只管“自动更新”IPS规则库就像杀毒软件的病毒库不更新就等于废了一半。但更新时间是有讲究的工作时段不要大规模更新规则库万一新规则误杀业务影响面很大。我一般设置成凌晨低峰时段自动拉取更新后看告警数据有没有异常的规律性抖动。验证方法也简单用测试工具模拟几种典型的攻击比如Web扫描、恶意文件传输确认规则确实识别并拦截了再放行让业务继续跑。规则库管理还有一个细节——厂商有很多规则分组比如“高危漏洞利用”“新兴威胁”“可疑行为”等。默认全开最省事但性能消耗和误报率也是全开的。合理做法是高危漏洞利用规则全开新兴威胁规则开告警可疑行为规则结合业务场景做精细化配置。这样既保住防御效果也不至于给自己天天找事。写在最后的一点个人体会做了这么多年安全运维IPS这类设备给我的最大体会是它既不是神器也不是摆设关键看你会不会用。会用的团队靠一台IPS就能挡住绝大多数外部攻击把安全事件处理时间从“小时级”压缩到“分钟级”不会用的团队买了一台几十万的盒子最后因为误报严重被业务方投诉到下线这种情况我见过太多了。如果你现在正准备上IPS我的建议就三条第一耐心花两周时间做告警模式的流量观察别急着开阻断第二高可用方案一定要把会话同步、双心跳、非抢占这三个点配到位第三规则库绝不只依赖设备默认配置要结合自己业务做取舍。这三条做到位IPS才会真正成为你网络里那道可靠的安检门。
返回列表