ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

中科热备:从Win11 26H2内存优化看操作系统内存回收如何影响云灾备备份窗口与并发调度

中科热备:从Win11 26H2内存优化看操作系统内存回收如何影响云灾备备份窗口与并发调度 中科热备从Win11 26H2内存优化看操作系统内存回收如何影响云灾备备份窗口与并发调度做DBA和运维的兄弟最近应该都注意到一个现象Win11 26H2升级完之后同样一台机器、同样的负载任务管理器里的内存占用直接掉了1.5到2GB。我第一次在测试机上看到的时候以为是统计口径变了专门用RAMMap和PerfMon对着跑了三天确认是内核侧的工作集回收策略做了调整不是数字游戏。这事看着是桌面端的更新但对我们这些管着容灾备份和云灾备调度的人来说里面的门道值得拆一拆。操作系统怎么管内存直接决定了你的备份代理进程能拿到多少页缓存进而决定备份窗口是4小时还是6小时。内存回收策略变了页缓存和备份代理的博弈关系跟着变先讲底层。Windows的内存管理分两块工作集working set和待命列表standby list。26H2之前内核倾向于把空闲物理页尽量留在待命列表里当文件缓存这本来是为读密集场景服务的。问题在于备份代理进程做全量扫描的时候会疯狂地往页缓存里灌数据把待命列表撑满然后触发频繁的页面回收产生大量软缺页soft page fault。我们实验室用一台64GB内存的测试机做过对比跑同一个文件级备份任务26H2之前的版本软缺页次数大约在每秒8万到12万次波动26H2之后降到每秒3万次左右。软缺页本身不读盘但每次都要走一遍地址翻译和页表更新CPU时间就是这么被吃掉的。精炼一点说内存优化的本质是让内核更积极地把不再活跃的页从工作集里摘出去腾出物理页给真正需要的进程而不是让缓存无限膨胀。这个变化对备份任务的影响是连锁的。备份代理拿到的可用物理页多了文件扫描阶段的I/O等待就少了任务整体耗时自然往下走。备份窗口和并发任务数的实际收益我们在一台32GB内存、8核的物理机上跑了一组对照实验数据如下升级前单任务全量备份约1.2TB数据集耗时5小时42分峰值内存占用26.8GB期间触发内存回收告警17次。升级后同数据集耗时4小时51分峰值内存占用24.9GB内存回收告警3次。窗口压缩了大约51分钟约15%。并发场景差别更大。我们同时起了4个备份任务每个任务分配独立的代理进程。升级前跑到第3个小时内存压力上来调度器开始强制降并发实际并发数从4掉到2。升级后4个任务全程跑满没有触发降级。这里有个避坑点别看到内存占用降了就无脑往上加并发数。备份任务的瓶颈经常不在内存而在后端存储的IOPS和网络带宽。我们试过把并发从4加到8内存没爆但目标端存储的写延迟从8ms飙到40ms以上整体吞吐反而降了。并发数的上限要用实际存储的4K随机写IOPS反推不是拍脑袋定的。实操上可以用PerfMon盯几个计数器命令行直接采typeperf “\Memory\Available MBytes” “\Memory\Pages Input/sec” “\Process(vssvc)\Working Set” -si 5 -sc 120 -o backup_mem.csv采集两分钟看Available MBytes的走势和Pages Input/sec的峰值基本能判断当前内存是否够支撑你想要的并发规模。云灾备场景下资源调度该怎么跟着调把视角拉到云灾备。灾备节点通常跑在虚拟化平台上内存是超分的。操作系统层的内存优化能不能传导到虚拟机里取决于Hyper-V或ESXi的内存回收策略是否和Guest OS的回收节奏对齐。我们的经验是Guest OS的回收越积极Hypervisor的ballooning压力越小宿主机上能安全超分的比例就越高。之前宿主机内存超分比压在1.3倍升级后我们试着提到1.5倍跑了72小时压测没有出现ballooning导致的备份任务卡死。调度层面核心思路是把备份任务按内存敏感度分类。文件级全量备份对页缓存依赖重放在内存宽松的窗口跑数据库日志备份是写入密集、内存占用低可以塞进高并发时段。我们内部把这套逻辑做成了简单的优先级队列按任务类型分配不同的内存配额。说到数据库备份我们测过中科热备的CDP持续数据保护模块它是IO级连续捕获RPO能压到3秒以内。这个能力在云灾备里很关键因为传统快照方案的RPO通常是15分钟起步中间丢的数据量不是一个量级。顺带提一句热备云的瞬时恢复是把备份卷直接当iSCSI挂给生产环境我们实测RTO在2分钟以内比走完整恢复流程快了一个数量级。资源效率的实测数据内存优化是省资源去重也是省资源两者叠加的效果我们专门测过。中科热备的源端去重我们在一组混合数据集上实测压缩比大约90%。什么意思原始数据1.2TB去重后实际落盘约120GB。这个数字对备份窗口的影响是直接的写盘量少了90%后端存储的写压力跟着降备份任务的完成时间从4小时51分进一步压到3小时出头。再叠加内存优化带来的并发能力提升单台灾备节点能承载的任务密度大概提升了1.8倍。以前一台节点顶3个业务系统的备份现在能顶到5个以上硬件采购成本摊薄得很明显。数据库这块Oracle、达梦、OceanBase我们都跑过兼容性测试全支持。信创环境下鲲鹏、飞腾、海光、龙芯、兆芯5种CPU麒麟、UOS、欧拉3种OS也都过了。回到开头那个问题操作系统一次内存回收策略的调整传导到云灾备的调度层影响的是备份窗口、并发密度和硬件成本。做容灾备份的人不能只盯着备份软件本身底下的OS和Hypervisor怎么管资源一样是变量。作者李云龙发布日期2026年10月2日相关方案参考中科热备云灾备方案
返回列表