ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

算力危机本质是能效危机:如何把每瓦电榨出真算力

算力危机本质是能效危机:如何把每瓦电榨出真算力 把话撂在这算力危机的本质从来不是GPU缺货而是能效危机。我自己做过几年AI集群的规划和运维一开始也和大家一样天天盯着显卡型号、FLOPs、卡价和显存大小走神后来真正让我睡不着觉的却是电费账单、机房温度、供电扩容周期这些“灰头土脸”的事。今天这篇就围绕“算力、能效”这两个词讲讲为什么电表和散热器才是AI时代的核心门槛以及作为开发者、运维或者架构师怎么在电表跳闸之前把每一瓦电都榨出真正的算力。不管你是想在公司搭一个20卡的小集群还是管理几千张卡的大型算力池这篇都值得从头看到尾。1. 算力危机不是缺芯片而是缺“能”1.1 一张GPU在电表上的真实“胃口”先说一个很容易被忽略的事实GPU不是算力设备它是“电变热”设备。GPU跑起来把电能变成计算指令和热量其中绝大部分电能最终都会变成废热需要空调、风机、液冷再搬走这又得额外耗电。所以算力规模每扩大一倍电网容量和散热能力也得跟着同步扩张否则卡再多也只是插着冒烟的“铁疙瘩”。举个粗算的例子。一张数据中心常用的加速卡功耗按700W算全年7x24小时跑满一年就是700×24×365/1000≈6132度电。如果实际利用率只有60%那也有3679度电再把数据中心的PUE算成1.25最终每一张卡一年要从电网吃掉约4600度电。这样一张卡的电耗已经相当于一个普通小家庭全年用电量。一个8卡算力节点轻轻松松5-7kW一个机柜塞上几个节点功率就到30-50kW。普通办公楼的电力回路通常只有单路3-4kW接上两台像样点的服务器就跳闸。想起早几年大家用RTX 3090自建小算力站的往事单卡功耗三百多瓦8卡整机轻松超过3kW。很多人在家同一条插座回路上插着吹风机、冰箱和训练机运行深度学习任务的时候整屋灯都会跟着闪。这也是为什么后来像RTX Pro 5500这类专业卡越来越受关注大家买卡的目光从“峰值性能多高”转向“同样做一题推理谁更省电”。算力的军备竞赛本质已经从数量竞争变成能效竞争。跳出单卡视角再看整个AI算力集群。典型的算力集群由计算节点、高速网络、分布式存储、调度控制软件组成外面还罩着供电、散热、监控这三套基础设施。绝大多数团队画架构图时只画前四层后三层几乎不提。结果项目真落地发现机房制冷跟不上、变压器容量不够、UPS撑不住启动电流只能一边降级跑一边等扩容。说白了真正的短板不在PCIe通道里而在电表和冷却塔之间。1.2 从“算力约束”到资源配置建模一切都是电费账单上的题目有一个概念现在越来越常被提起算力约束下提升大语言模型能力的资源配置建模。名字听着很学术翻译成人话就是——给定固定的电力预算和硬件预算怎么把数据、模型并行方式、显存分配、训练步数和推理吞吐调到一个最优组合让最终模型效果最大化。过去大家做AI是“以模型为中心”先把模型做出来再算需要多少张卡。现在做AI基建是“以能源为中心”先看能分配多少电再决定模型规模和集群方案。这个思维倒过来之后很多团队才明白为什么自己复现别人的模型总是又慢又贵。人家可能把3000张卡的训练任务用MoE稀疏激活、混合精度、序列并行、KV cache裁剪等手段压到2000张卡就能完成你按着基准全量FP32跑2500张卡还不一定追得上电费账单自然不可控。我见过最典型的一个场景是某团队在固定功耗450kW的机房内做大模型训练。硬件负责人说最多支持128张卡模型负责人说需要192张。两边僵持很久最后靠资源配置建模解决了问题把训练改成BF16混合精度设置梯度累计和流水线并行减少了激活内存峰值把检查点写入从训练割裂到单独的存储节点减少GPU等待推理服务则挂上自动批处理保持GPU高吞吐。最终在同样450kW功耗下训练吞吐提高了40%推理P99延迟还降了20%。这才是算力危机的正解不是把墙打掉多接电而是在有限电能里重新调度。分布式算力也是同理。很多AI任务根本没有必要千里之外的超大规模数据中心跑把一部分推理和数据处理放到边缘、放到端侧反而能省下大笔传输与中心能耗。现在一些设备厂商甚至开放了机载算力开发申请让开发者把模型直接跑到设备本地的计算板上。为什么这么干因为端侧算力对功耗极其敏感板卡每瓦性能直接决定了设备能用几个小时。算力分布式化不是为了概念而是为了让每一度电都更靠近产出场景地减少损耗。2. 能效才是算力真正的物理天花板2.1 为什么GPU不能一直加电热量和制程的现实很多非硬件背景的人会问既然算力不够为什么不多给GPU加功耗反正电压高一点频率高一点性能不就上去了吗这个问题问得很有意思但物理上很难实现。芯片上每一个晶体管开关时都会耗电、发热。制程微缩曾经是“白嫖”性能的好路径晶体管变小同样功耗水平下能塞进更多逻辑频率还能提升。但最近几个制程节点芯片功率密度提升速度已经远超散热面积扩展速度业内所谓的“丹纳德缩放”早就失效了。现在的GPU想继续堆算力最先撞上的是散热极限——核心温度一旦超过工艺允许范围漏电电流暴涨性能不升反降寿命还会缩水。所以你看从A100到H100再到更新的Blackwell加速卡每一代峰值算力确实在涨但整卡功耗也从400W左右一路涨到700W甚至更高。性能翻倍的同时功耗并不是原地踏步而是跟着往上走。真正值得关注的指标不是FLOPs而是每瓦FLOPs以及把算力转换成实际业务吞吐的端到端效率。这也是消费级和专业级显卡之间最微妙的地方。很多发烧友拿RTX 3090跑模型时觉得卡不错但要搞8卡并行光散热和供电就够喝一壶。专业卡一方面在散热设计和电源管理上做了更多铺垫另一方面支持更细粒度的算力划分和功耗封顶比如设置整卡功耗上限、动态控制频率。这些不是“性能阉割”而是把宝贵的电力预算交给调度器统一分配。如果把算力比作一辆货车能效就是油箱。以前的货车只看拉得多不多现在大家开始看每升油拉多少货。GPU之间的PK正在从“我峰值算力比你高”转向“我做完这批训练用多少度电”。谁的每瓦读数和每次训练任务总能耗更低谁才能在大规模部署中笑到最后。2.2 PUE不高并不代表电费不爆炸聊能效绕不开PUE这个指标。PUE是数据中心总耗电和IT设备耗电的比值PUE越接近1说明配电、制冷、照明等设施损耗越少。很多团队验收机房时最爱看PUEPUE做到1.2就觉得“很绿了”。但现实往往更扎心PUE只能说明基础设施“省电”压根不能说明服务器上的任务在高效干活。我自己就见过一个典型案例。某客户机房的PUE已经优化到1.25算是非常优秀的数据中心设施了。电费却一直压不下来几年都没找到原因。后来查监控发现数据中心里有一批完任务后没被回收的“僵尸容器”长期占着GPU显存大批服务器处在待机状态GPU利用率不到5%但服务器只要通电电源模块、内存、风扇、网卡就一直吃着几十到一两百瓦的底噪功耗。PUE再漂亮也救不了几百台服务器同时空转烧钱。数据中心的能效至少分两层一层是“机房把电送到IT设备的效率”一层是“IT设备把电转化成有效计算任务的效率”。前者看PUE后者看服务器利用率和算力闲置率。真正做能效优化两边缺一不可。我建议团队至少把三个指标同时贴在监控大屏上PUE、GPU平均利用率、单位推理请求耗电量。如果PUE很低但GPU平均利用率只有20%说明投资回报率上有个大窟窿。与其盯着空调温度调低两度不如让调度系统把分散小任务合并成大batch让GPU干满再下班。3. 系统级能效优化从芯片、散热到算法的四层榨干3.1 硬件选型买“每瓦性能”但别只盯瓦数很多人选算力硬件时只看张量算力、显存带宽、互联速度这些当然重要但要放到“能效约束”里看方法论就得换一换。第一步先明确业务是训练为主、推理为主还是两者混合。训练场景下稀疏算力和显存带宽很关键推理场景下则要看显存容量、单路并发和量化支持。以我做过的几个项目为例。同样是跑7B-13B规模的大语言模型推理用消费级显卡能跑但显存吃紧、多卡通信效率差功耗数字还很吓人。换用支持FP8、INT4量化的专业加速卡之后单卡能同时处理的并发请求数涨了不少单token耗电量直接下降。对于生产环境专业卡多出来的那部分钱往往一两个月的电费差额就挣回来了。专用化是提高能效另一条大路。GPU是通用并行计算核心干啥都快但干哪一件事都不是极限能效。针对Transformer算子深度优化的定制加速卡、FPGA加速方案、NPU芯片在特定模型上的每瓦性能可以比GPU高一个量级。它的问题在于不够灵活模型一换架构就容易吃不上新算子优化。所以适合那种模型结构固定、长期量产型推理的场景。通用GPU负责跑训练、探索和复杂任务专用加速卡负责稳定复用的大规模推理这一组合拳在能效上很有效。还有一个细节是显存。现在很多大语言模型推理瓶颈不在算力而在显存带宽和容量。模型参数一大部分时间是在“搬运”数据不是“计算”。选择HBM高带宽显存、把模型权重按层放入显存、配合KV cache优化可以显著减少数据搬移也就减少无效功耗。3.2 散热升级液冷不再是为了炫技而是为了扩容散热是能效危机的第二战场而且是最容易被人低估的一环。风冷时代一个标准机柜想稳定散掉15kW以上的热就已经很吃力了。你非要往一个机柜里塞40-50kW的GPU节点风再大也只是把热量从机柜里挪到空调房里空调又得花更多电把热量搬到室外一进一出全是电费。所以机柜功率密度一旦超过风冷边界冷板式液冷和浸没式液冷就是必选项。冷板液冷的原理很直白GPUCore上不装风扇而是贴一块金属冷板冷板内部流过低温液体把核心热量直接带走。液体导热效率和比热容远高于空气所以液冷机柜做到80-100kW都很正常。浸没式就更彻底把整个服务器泡在不导电的冷却液里支持极高的功率密度但运维、维护和硬件兼容性也更讲究。在选型上我的实际经验是分三档。机柜平均功耗10-15kW成熟风冷搞定不用折腾液冷20-40kW是冷板液冷的甜区改造相对可控60kW以上还坚持风冷就是跟自己电费过不去。真正部署液冷时别看宣传页上“液冷很省电”就以为什么都不用管。冷却液流速、进出口温度、压差、电导率、冷板和芯片接触面平整度每一项都能影响降温效果。举个例子。之前帮客户调试一套冷板液冷集群液冷系统显示水温正常但GPU温度比预期高了十几度性能频繁撞墙降频。排查到最后发现不是CDU故障而是安装时冷板与GPU表面之间的导热垫片没压实有一侧悬空热量全堵在了核心角落。重新安装并规范扭矩之后GPU热点温度降了17度同样的任务功耗反而下降了10%。散热做得好不好最终都写进电费和性能里。3.3 软件调度与算法优化最被低估的“节能开关”硬件层面的能效优化容易量化买什么卡、用什么散热方式都有明确指标。但真正潜力最大的其实是软件和算法层。我做过好几个算力优化项目硬件完全不动只靠软件优化就省下20%到30%的电力而且往往还提升性能。首先要做的是混合精度和模型压缩。大语言模型用FP32训练既慢又耗电切换到BF16或FP8后显存占用和计算能耗同时下降。推理模型可以通过量化、剪枝、蒸馏减少计算量特别是把权重从FP16压到INT8甚至是INT4显存带宽压力小了功耗也肉眼可见地降。量化不是把模型随便存成低精度就完事需要做校准、混合精度分配不然精度损失会很大。这件事性价比极高团队里只要有一个人懂就能长期省电。然后要讲调度。很多GPU利用率低不是硬件不够强而是调度太糙。任务分散提交闲的闲死、忙的忙死形成大量“算力碎片”。用Slurm、Kubernetes这类调度系统把训练任务批处理化把推理请求动态batch化让多张卡在时间上尽量重叠利用能显著提高有效算力。GPU最怕空转一个空闲的GPU不消耗满载功率但功耗也不是零占用机架、占用网络、占用IPMI每天都在烧钱。再深一层的优化就是大模型资源配置建模。刚才提到的“算力约束下提升大语言模型能力”这类问题落到实操上往往就是显存不够怎么用张量并行切分模型、通信延迟怎么用流水线并行掩盖、数据吞吐不足怎么用预取和存储分层补偿。把功率预算作为约束条件把训练吞吐或模型质量作为目标函数去搜并行策略、batch size、微批次数量、专家并行度才是真正把资源用在刀刃上。还有一个细节电源管理策略千万别全局乱调。很多团队看到GPU热点温度高就统一把GPU降频或者限制功耗。结果单卡功耗降了但训练任务完成时间拉长总能耗反而上升。小型任务也许感知不到大规模多卡训练里卡和卡之间要同步等待慢卡拖累整体步调最终白白浪费更多时间。正确做法是针对任务优先级和延迟SLA做差异化调度紧急任务保持高频后台批处理任务可以适当低频运行。4. 从数据中心到电网算力增长的边界在哪里4.1 电力容量才是稀缺资源机位和算力都要给电让路规划AI算力集群第一步看什么很多人以为是看机柜数量和网络端口我建议先看电。项目落地前最好做一份完整的电力调研所在机房是否有冗余回路、可用配电容量是多少、UPS能否扛住启动浪涌、变压器余量能否支撑未来半年的扩容。电网容量不像GPU那样想扩就能扩需要周期、需要土建、需要协调周边负荷。我就遇到过这种情况客户计划半年后把集群从200卡扩到500卡卡都预订好了结果机房相邻的两路变压器容量只剩200kVA扩不了容整片新算力硬生生趴窝。后来只好把一部分算力拆到更靠近风电、水电的分布式节点上用电力和网络调度解决物理约束。从电力的角度看可再生能源和储能配合也有很大玩头。风力光伏发电有波动算力负载也有波动只要把不敏感的训练任务放到可再生能源发电高峰时段把可以延后的预计算任务用价格信号做“移峰填谷”就能在同样的电网容量下塞进更多算力。这不是要改变算法而是把任务调度和能量供给放在一个时钟里。绿色电力直供、储能缓冲、智能负载迁移对算力集群的意义不亚于换下一代GPU。4.2 分布式算力与其堆一台巨型超算不如调度一群普通设备过去一提算力很多人的第一想象就是“巨无霸数据中心”。但在能效危机之下分布式算力的价值正在回升。原因很简单把算力堆在一个点意味着供电、散热、容灾全部要在几平方公里的物理空间里集中解决难度和成本指数级上升把算力分散到多个小型机房、边缘节点甚至直接放到设备旁边每一份电力都可以就近接入散热也可以就地消化。比如无人机、机器人和工厂设备上跑的AI推理任务数据在设备端产生如果非要传回云端延迟和能耗都很浪费。端侧放一张低功耗的算力板直接在本地完成目标识别、异常检测和路径规划反而更快更省。这也是为什么很多边缘设备厂商会开放机载算力开发申请目的就是让开发者把模型部署到更靠近物理世界的地方。分布式算力不等于性能妥协。现代模型并行技术可以把一个大模型切到多个小型算力节点上协同推理只要互联网络带宽和时延可控性能和集中式集群的差距并没有想象中大。与其花天价扩一个中心电力容量不如用一套成熟的分布式调度平台把各地“算力碎片”拼接成一个整体。关键是网络要稳调度要聪明任务要按数据位置和能源价格分配。顺着这个思路未来AI算力像电力网一样互相调度、互为备份并不是天方夜谭。4.3 下一波能效红利光、存储和新架构还需要排队说完成熟技术再讲讲未来。算力能效的突破口肯定不只是芯片和散热。光互连技术是其中很有潜力的方向之一因为芯片间、机柜间的数据搬移越频繁电信号在铜线上损耗就越大而光传输有更高的带宽密度和更低的单位比特能耗。近存计算也在快速发展目的就是让算力直接长在数据旁边少搬数据少耗电。真正革命性的方向还有量子计算和类脑计算。量子计算对特定问题的复杂度也许能降维打击但目前离通用大规模工程应用还很远更别说能效数据了。我们不该被“未来会很美好”冲昏头脑眼下能拿到的能效红利大部分还藏在成熟的芯片调度、算法压缩和散热设计里。下一代硬件落地之前先把现有系统的每瓦性能榨到极致才是广谱可用的打法。5. 常见问题与排查技巧实录5.1 供电容量看起来够了为什么还会跳闸这个问题我碰到过不止一次。明明变压器容量和UPS负载率都在安全线以内可一上大模型训练任务就跳闸。原因往往不是稳态负载过大而是启动瞬间的浪涌电流。几十张GPU同时上电启动瞬间电流可能是正常运行时的两三倍再叠加机房空调压缩机启动就会触发断路器保护。解决办法很简单分批上电不要一个机柜所有服务器同时开机。设置一个软启动时序每隔几十秒拉起一批节点错开启动浪涌。同时检查三相负载是否平衡很多老旧机房的配电柜三相分配特别随意A相挂了一半设备B相空着中立线电流过大也会造成误跳。检修时别只看总功率拿钳形电流表逐相测一下经常能发现隐藏的坑。5.2 液冷系统明明水温正常GPU温度却压不住这是液冷改造后的典型“伪故障”。系统显示进液温度28度CDU运行正常但GPU热点温度还是超过90度频繁降频。排查步骤很关键先看设备端的冷板进出口温度差如果温差很小说明流量不够冷却液根本没把热量带走再看水侧压差如果压差过高可能管道堵塞或滤芯太脏最后检查冷板安装这是最容易出问题的地方。我前面提到过的导热垫片压实问题很常见。冷板和芯片之间接触不均匀哪怕只有0.5毫米的间隙就会形成空气隔热层。安装时一定要按厂商规格控制扭矩不要凭手感拧螺丝。另外冷却液水质也要管电导率过高的液体在冷板狭小流道里会加速电化学腐蚀长期下来不仅堵管路还会漏液。定期检测电导率、清洗过滤网比在界面板上反复调参省心得多。5.3 PUE显示很低电费账单却依然爆炸PUE低但电费高问题基本出在IT侧。PUE只解决了“送电损耗”的问题不解决“算力到底有没有干活”的问题。很多集群的GPU长期跑不满或者有一些任务占着显存跑完了也不释放看起来机器都在运行实际有效计算负载极低。这些空转负载消耗的是动辄几百瓦的“底噪功耗”。遇到这种情况先拉两个数据GPU平均利用率曲线、整机有功功率曲线。如果GPU平均利用率持续低于30%就说明调度层有大量改进空间。我自己的操作习惯是给所有计算节点打上自动缩容策略空闲时间超过阈值的容器直接回收机器无任务时进入休眠或低功耗状态避免整个集群长期“带病空转”。这比换一批更高效的新卡更省钱、见效更快。5.4 开了系统的“节能模式”之后性能反而变差了有些团队为了省电会给服务器的电源管理设置成节能模式限制CPU或GPU的P-state。理论上单任务功耗会降但实际训练一个大模型分布式任务卡和卡之间需要频繁同步。全局降频后每一次同步的等待时间变长整个训练周期的总耗时飙升电费单看功率是降了看总耗电量却是涨的。节能模式不是不能用而是不能一刀切。正确姿势是按任务差异化调度训练任务保持高时钟频率保证单位时间内的吞吐最大数据导入、预填充、评估等非计算密集阶段再切入低频模式。甚至可以在同一张卡上做功耗封顶比如推理任务限制在70%TDP一般不会有明显延迟损失但能减少散热压力和整柜功耗。关键是别让系统无脑降频要结合业务SLA来做。最后再说几句实在话算力焦虑这两年特别重很多人一听到算力两个字就条件反射去抢卡、堆显卡仿佛卡数多了问题就能解决。但我在一线机房蹲过太多次看到过各种各样的瓶颈最后都汇集到同一个源头能源效率和电能管理。硬件换代当然重要但比单纯换卡更先行的是把每一度电都用在刀刃上。之前有一次帮客户做现场能效评估最后得出的结论不是“硬件太旧”而是“任务调度让GPU大规模空转”优化完调度、上完量化和功耗封顶之后整站电费降了近三成训练吞吐反而提了两成。所以我现在的习惯是任何部门找我提“算力不够”我先问一句你的每瓦算力是多少这个问题答不清楚加再多的卡也只是把电和热量堆得更高。能效这关过不去算力焦虑就永远只能靠硬扛换解药。
返回列表