
AI Infra 是什么为什么要学从一次 AI 请求的 6 层分工讲起AI Infra 入门系列 · 第一篇劝学篇年少不知 AI Infra 好错把古法手搓当个宝。一、先说清楚AI Infra 到底是什么聊 AI Infra 的人很多但真被问一句AI Infra 是什么能一句话答上来的不多。AI Infra的定义很朴素AI Infra 是支撑 AI 训练与推理的基础设施包含计算设备、存储与互联以及把这些硬件资源组织起来的软件。拆开看就是三层层次包含什么典型代表计算GPU / NPU / TPU 等加速器H100、A100、4090存储与互联HBM、NVLink、RDMA 网络、分布式存储NVLink 4.0、IB / RoCE软件组织上述资源的调度与运行时CUDA、vLLM、SGLang、K8s 调度器硬件决定上限软件决定你能逼近上限到什么程度。AI Infra 这一行的全部工作基本都围绕这两句话展开。二、为什么重要一次请求背后的 6 层分工因为一次 AI 请求从来就不是模型算一下这么简单它要穿过从应用到硬件的多层分工这张图有两个读法都很关键从上往下读是数据的层层传递用户请求 → 应用 → 框架 → 调度 → 运行时 → 硬件。从下往上读是约束的层层传导加速器的可用显存容量、算力与带宽直接决定了这套系统能跑多大的模型、能同时接多少请求、能多快给出响应。这就是为什么很多看起来是上层问题的毛病根因其实在下面几层长上下文跑不动 → 显存容量不够并发上不去 → 显存带宽或 KV Cache 管理策略受限首 Token 延迟高 → 计算与通信没有 overlap卡在同步点上。具体到执行路径一次请求会先由路由器选出合适的推理实例再由实例内部的调度器安排具体执行。这两步的算法策略本身就是一个独立的优化战场负载均衡、KV Cache 亲和性、PD 分离等。三、先来建立数量级感多卡、多机的学习曲线更陡因为它引入了网络这一整个新维度。所以更合理的路径是先吃透单卡再看多卡。先看单卡的单个请求下各类操作大致要花多久操作耗时换算为纳秒访问一级缓存L1 Cache0.5 ns0.5 ns访问主存DRAM0.1 μs100 ns磁盘寻道10 ms10,000,000 ns数据包从加州发到荷兰再返回150 ms150,000,000 ns这张表的价值不在于精确而在于数量级访问主存比访问 L1 慢约200 倍磁盘寻道比访问主存慢约10 万倍一次跨大西洋网络往返比磁盘寻道还慢15 倍。有了这把尺子你才能判断一个新方案理论上能快多少。四、为什么必须找瓶颈阿姆达尔定律我们要优化 AI 的训练和推理第一步不是动手改代码而是知道当前瓶颈在哪。阿姆达尔定律Amdahl’s Law给了最冷酷的答案假设待优化部分 A 占原本总处理时间的1%比如某程序里访存时间只占 1%那么即使把 A 优化到极致——降到 0——整体也只提升了1%。也就是说优化一个不重要的点做得再完美也等于没做。所以 AI Infra 的第一步永远是同一件事找到最值得优化的点。先测量再优化先定位瓶颈再谈方案。这也是整个系列后续所有内容的出发点。五、什么叫极致先看清硬件的天花板要让性能发挥到极致首先得理解什么叫极致。极致就是硬件的上限。以下是三张显卡各自的上限显卡显存容量显存带宽BF16 矩阵峰值按带宽读满显存RTX 409024 GB1.008 TB/s165.2 TFLOP/s0.99 ms/GBA100 80GB SXM80 GB2.039 TB/s312 TFLOP/s0.49 ms/GBH100 80GB SXM80 GB3.35 TB/s989.4 TFLOP/s0.30 ms/GB最后一行特别值得玩味按带宽峰值读取每 GB 数据最快也要 0.30 ms。这是个死线。任何需要把数据搬进显存的操作都不可能比它更快——Prefill 要读权重、Decode 每步要读一遍权重和 KV Cache全都要受这条线约束。所以当有人跟你说我这个推理加速方案能快 10 倍时你可以先做个心算它的数据搬运量有没有突破这条带宽死线假设没有那这 10 倍就不可能成立。小结第一篇先立住四个基本盘AI Infra 计算 存储互联 组织它们的软件硬件定上限软件定逼近程度。一次请求要穿过 6 层分工自上而下传数据自下而上传约束。要有数量级感L1 → 主存 → 磁盘 → 跨洋网络每一级差 2~5 个数量级。优化前先找瓶颈阿姆达尔定律说优化 1% 的部分最多也就能快 1%。下一篇会从单卡上的单次推理开始把 Prefill 和 Decode 的耗时仔仔细细过一遍。标签AI Infra大模型推理优化GPUCUDA性能优化H100如果这篇帮你把AI Infra 到底干嘛的讲明白了欢迎点赞收藏后续章节持续更新。