
AI 推理时代的芯片分工麦肯锡 2026 年“应用专用半导体”研究解读麦肯锡《Technology Trends Outlook 2026》技术趋势解读系列 · 第 5 篇摘要麦肯锡将“应用专用半导体”Application-specific semiconductors列为第五项技术趋势强调专用芯片正在与模型、软件、内存、网络和数据中心运行方式共同设计。推动这一变化的重要力量是 AI 推理需求增长及其工作负载分化不同任务对吞吐量、响应时间、内存和通信具有不同要求。报告显示相关股权投资显著增长采纳进入规模化扩展阶段但工作负载稳定性、封装与内存供给以及技术更新速度仍构成关键不确定性。本文分析专用加速器与可编程 GPU 的取舍解释芯片性能为何依赖编译工具、数据流和互联并提出评价完整使用周期经济性的框架。本文认为专用化能否创造持续价值取决于真实负载、系统交付与累计使用量能否共同支撑设计和迁移投入。未来竞争更可能表现为不同计算角色之间的分工以及围绕具体任务形成的跨企业协同。关键词应用专用半导体ASICAI 推理GPU软硬件共同设计HBM芯粒芯片经济性一、这一趋势的核心为实际工作负载安排更合适的硬件假设一家平台同时运行三种 AI 服务在线对话、批量资料处理和推荐排序。它们都可以被称为 AI 计算但需要的资源并不相同。在线对话关注用户等待时间批量处理更重视单位时间完成多少工作推荐系统还可能大量访问特定数据结构。业务高峰、输入长度和模型更新也会改变硬件负载。这是用于解释机制的假设场景。它说明选择芯片之前需要先理解计算在什么条件下发生。麦肯锡将应用专用半导体定义为针对特定计算工作负载优化的芯片。在 AI 领域它们越来越需要与软件、内存架构、网络基础设施及数据中心运行方式共同设计。[1第 50 页]这种专用化早已存在于汽车、工业和消费电子等领域。AI 带来的变化是工作负载增长、模型更新与商业化要求共同推动了更深层的计算架构调整。[1第 50 页]第四项趋势讨论模型能力如何进入规模化服务第五项进一步讨论在服务需求已经形成之后硬件应怎样承担不同计算角色。因此本文把这一趋势理解为一项匹配问题模型和业务提出要求芯片与系统提供能力软件组织实际执行最终通过任务结果和完整成本评价匹配是否有效。峰值算力只是这个过程中的一个条件。工作负载是否适合架构数据能否及时到达软件能否有效执行以及设备是否得到充分使用同样决定实际收益。二、理解专用化计算目标与编程灵活性讨论这一趋势时需要区分硬件优化目标与可编程程度。产业中常用的“GPU 与专用芯片”比较是对不同设计侧重点的概括并不意味着两者之间存在完全排他的技术边界。GPU 是可编程的并行处理器现代 AI GPU 也包含针对矩阵等运算优化的计算单元。应用专用集成电路ASIC则围绕特定应用类别设计但仍可能通过编译器和程序支持不同模型。计算角色常见设计侧重点在 AI 系统中的作用CPU多种控制与软件任务的执行能力数据处理、任务编排、系统控制及部分模型计算GPU可编程并行计算与成熟的软件生态多种训练、推理及其他并行负载AI 专用加速器与 ASIC特定运算、数据流或工作负载类别的效率在适用任务中优化计算、内存、通信与能耗上表是本文的功能归纳具体产品的能力范围与灵活性需要分别评价。专用化也可以发生在不同层次。一个芯片可能重点优化矩阵运算另一个可能重点优化特定数据访问方式整套系统还可以针对大规模互联、固定时延或高并发服务设计。这使“专用芯片是否优于 GPU”难以获得脱离场景的统一答案。需要说明比较的是哪类模型、什么输入、怎样的并发以及什么质量和时延条件。通用性与效率之间确实存在取舍但取舍程度取决于设计。有些专用系统保留较强的可编程能力有些则更依赖明确的数据流与算子范围。实际使用中还需要观察软件与硬件共同提供了怎样的适应空间。本文认为更有解释力的研究问题是在给定任务与更新预期下专用优化获得了多少收益又引入了多少适配、维护与迁移成本三、投资与人才数据增长显著但应保留统计边界报告中的发展信号如下。指标报告结果解读时需要注意什么2024 年股权投资75 亿美元按报告定义统计的资本活动2025 年股权投资416 亿美元约为上一年的 5.5 倍不能换算成产品收入或制造支出相关岗位公告变化2024—2025 年增长 22%反映统计范围内的招聘恢复与扩张2025 年岗位职能结构研发占 82%包含研究、软件、数据与工程等技术建设工作企业采纳评级4规模化扩展中覆盖数据中心、云环境与企业负载主要采用者仍是大型云服务商资料来源报告正文第 51、53—54 页。其中5.5 倍为依据报告数值进行的近似计算。报告的投资数据包含私募与公开市场资本活动以及相关并购等交易明确不包含企业资本开支和运营支出。[1第 3 页] 因而这些数字更适合用来观察资金进入相关企业的程度。人才变化则需要同时看近期与较长时期。报告指出招聘正在从 2022 年之后的收缩中恢复设计、硬件和光学工程等岗位仍低于 2022 年水平而研究工程师与解决方案架构师需求有所增长。[1第 53 页]因此最近一年的增长并不说明所有岗位都在持续扩张。这些变化也不能单独证明某类传统岗位已被 AI 替代。研究活动评分还有另一层边界。报告认为相关论文活动没有明显加速但部分创新可能发生在发表激励较弱的企业内部。[1第 51 页] 这是一种解释不能由论文曲线直接计算企业内部创新产出。同样关键词活动的相对评分不能直接作为一个产业整体技术水平或商业成熟程度的测量。[1第 3 页]本文据此认为这一章显示的是资本关注、技术建设与采用范围在扩大。它没有证明所有新架构都能持续获得客户也没有证明专用化在所有负载上具有经济优势。四、推理需求的分化怎样改变芯片设计报告援引预测认为到 2030 年推理可能占全部数据中心需求的 30%—40%并成为 AI 计算中的主要负载。[1第 51 页] 这是未来需求情景不能当作已经实现的市场结构。这一预测背后的机制值得分析。模型训练完成之后面向用户和企业的持续调用会形成长期运行负载。随着应用范围扩大设计目标也会更加关注效率、时延与完整服务成本。但“推理”本身并不是一种完全一致的计算任务。1. 同一语言模型请求也包含不同计算阶段大语言模型生成通常可以区分输入处理和逐步生成。前者常称为预填充prefill主要处理已有提示后者称为解码decode持续生成新的 token。token 是模型处理文本的基本计量单元与汉字或单词并不一一对应。两个阶段的计算形态和资源要求有所不同。较长输入可以形成较大的并行计算需求逐步生成则需要持续访问权重、缓存等数据。它们受到计算、内存与调度影响的程度会随模型、批量和上下文变化。工作部分主要需要处理什么评价时应关注什么输入处理提示、资料与上下文的计算输入长度、计算组织与首个 token 时延逐步生成连续生成及相关状态访问内存与缓存使用、每步时延与并发模型内部或跨设备通信分布式计算所需的数据交换互联带宽、通信安排与计算等待外部工具与任务编排检索、调用、状态和流程管理整体等待、任务执行与系统协调上表是本文对服务过程的分析归纳具体系统未必把这些部分分别部署。DistServe 研究提供了一个相关案例。它把输入处理与解码分配到不同 GPU按照首个 token 与每个输出 token 的时延要求联合安排资源、并行策略和阶段间通信。[2]该研究在其评估条件中证明了分阶段组织资源的价值。它主要研究 GPU 服务系统能够帮助解释为何需要先拆解负载不能直接作为某种 ASIC 已经全面优于 GPU 的证据。2. 不同应用又会进一步改变优化目标实时交互、离线批处理、推荐排序和现场设备推理关注的资源与服务目标可能不同。模型的结构、数据精度和输入形式也会改变计算安排。即使是同一模型低并发交互与高并发批量运行也可能需要不同设置。提高设备利用率的方式未必满足严格的用户等待要求。因此推理增长会创造专用优化的机会同时要求产业面对更复杂的负载组合。企业需要确定哪些需求可以持续、哪些计算模式足够重复以及哪些部分适合进入硬件设计。本文认为专用化的重要条件之一是能够从变化的应用中识别可复用的计算规律。应用名称相同并不自动说明底层负载保持不变。五、软硬件共同设计芯片优势怎样被实际执行出来报告把处理器、内存、网络与软件的共同设计视为竞争的重要方向。[1第 52 页] 这意味着设计目标需要在系统层面确定。1. 数据流和互联会影响计算单元能否持续工作一个计算单元具备较高运算能力但如果数据读取或设备间交换无法跟上就会出现等待。单独增加计算能力可能不足以改善整体任务表现。因此架构需要同时考虑哪些数据可以重复使用数据存放在哪里怎样传递以及计算和通信能否有效配合。Google 的 TPU v4 研究展示了一种共同设计方式系统包含针对依赖嵌入表示的模型设计的 SparseCore也通过光交换技术调整互联拓扑。[3] 它说明优化可以发生在专门计算模块和整个系统连接方式上。这是 2023 年公开的技术研究用于理解设计机制。本文不把其中的特定性能结果作为 2026 年不同产品之间的统一排名。这一案例还揭示了专用化与适应性的关系。优化某些计算模式同时保留能够调整连接与执行方式的机制有机会扩大架构的适用范围。实际收益仍需要在对应负载中检验。2. 编译器和运行系统是硬件能力进入模型执行的桥梁芯片提供计算与数据处理能力模型则需要通过软件安排实际执行。编译器、运行时、计算库与调试工具因此成为专用系统的重要部分。AWS 的 Neuron 官方资料显示支持 Trainium 与 Inferentia 的软件栈包含编译器、运行时、训练与推理库以及监测、性能分析和调试工具。[4]这说明专用硬件作为可使用的产品需要一整套软件支持。能够运行某个模型与在业务要求下高效运行还需要进一步区分。迁移过程中组织可能需要处理计算操作的支持、数值精度、模型并行、数据布局和服务接口。模型版本发生变化后也需要重新观察质量、性能和资源使用。因此硬件选型应评价软件与模型的实际配合而不能只确认某个框架名称出现在支持列表中。3. 共同设计还涉及不同企业之间的知识与责任模型开发者了解计算需求和更新计划芯片设计者了解资源与实现约束云服务商掌握运行负载和服务组织。这些信息往往分布在不同企业。报告明确指出芯片企业、云服务商与模型开发者的边界正在变化重要架构决策越来越需要跨企业协作。[1第 50、55 页]本文认为这种协作的关键是把未来需求转化为可检验的设计目标优化什么负载保留怎样的变化余地何时能够交付以及用什么结果评价系统。如果这些判断缺少共同依据局部性能改善就可能与实际客户需求脱节。共同设计的价值最终仍要由可交付、可持续运行的系统证明。六、内存、封装与互联为什么芯片性能越来越依赖系统连接报告把高带宽内存、芯粒、先进封装和硅光列为支撑这一趋势的重要技术。[1第 50、52、55 页] 它们分别处理数据访问、模块组合和通信等问题作用需要区分。1. 内存容量与带宽对应不同需求容量关系到能够存放多少权重、缓存和状态带宽关系到单位时间能够传递多少数据。容量足够的系统仍可能受到读取速度约束高带宽系统也需要满足模型与并发所需的容量。因此设计应共同考虑容量、带宽、访问方式、能耗与成本。不同负载的优化重点可能不同不能只增加其中一项指标。高带宽内存HBM是数据中心 AI 系统的重要路径。实际架构还可以使用不同层次的内存与缓存边缘设备和大型数据中心也不必采用同一种配置。2. 芯粒与先进封装扩大了模块组合的空间芯粒chiplet将不同功能的芯片模块组合为系统。它为逻辑、接口和其他功能的分工与复用提供了空间同时要求模块之间具有有效连接。台积电的 CoWoS 资料显示其先进封装技术可以组合多个逻辑芯片与 HBM 堆叠以支持高性能计算和内存带宽需求。[5] 这个例子说明封装已经直接参与系统性能形成。模块化也需要处理互联、供电、散热和测试。采用更多模块可能增加组合能力也可能带来新的整合问题。UCIe 联盟为封装内芯粒互联提供了覆盖物理接口、协议和软件模型的标准。[6] 标准化有助于建立连接与兼容的共同依据具体产品仍需要完成性能、可靠性和制造条件的验证。因此芯粒生态的价值需要通过实际组合和交付体现。能够定义接口与能够稳定制造并运行完整系统仍是不同阶段。3. 光通信的价值需要回到具体连接环节报告讨论了硅光在提高带宽、降低数据传输能耗方面的作用。[1第 50、55 页] 其意义在于为部分数据通信提供新的实现路径。评价时需要明确改进发生在哪里芯片之间、设备之间还是更大规模的网络连接还需要把相关器件、控制与维护投入计入系统。本文认为这些技术的共同方向是减少计算过程中数据访问与传递造成的约束。但它们各自面对的工程条件不同不能由一种连接技术的进展推导整套系统已经解决所有瓶颈。七、专用芯片的经济性效率收益能否覆盖额外投入专用化可能改善适用负载的效率也会产生设计、软件、验证和部署投入。其经济性需要覆盖完整使用过程。1. 先确定比较条件再解释性能结果硬件性能比较应说明模型、输入、数据精度、并发、响应要求与软件配置。改变这些条件可能改变不同系统之间的表现。MLPerf Inference 为基准指定数据集、质量目标与测试场景并区分不同比较规则Closed 类别要求使用与参考实现相同的模型Open 类别允许改变模型或重新训练。[7]这些规则说明性能数字需要与其测试条件一起阅读。标准基准可以提供可比较的证据企业实际负载则还需要单独评价。吞吐量与用户等待也应分别观察。系统每秒可以处理更多请求并不直接说明每个请求更快在严格响应要求下能够有效服务的请求数量可能不同。本文建议在相同业务目标下比较通过质量验收、并满足响应要求的任务产出再计算所需成本与资源。这样更容易将芯片表现连接到实际价值。2. 固定投入需要累计使用量来覆盖可以用一个简化关系说明专用化的经济条件覆盖额外固定投入所需的累计任务量 额外固定投入 ÷ 每个合格任务节约的运行成本。这个关系假设单位节约保持稳定并且两种方案满足可比的质量和时延要求。固定投入与运行成本需要分开计算避免重复计入。假设某组织采用专用系统新增 100 万元适配与部署投入每个合格任务的其他运行成本减少 0.02 元那么需要累计约 5,000 万个任务才能覆盖这项额外投入。如果实际节约只有 0.005 元就需要约 2 亿个任务。这是本文提出的假设例子不是报告中的市场成本也不是芯片研发报价。它说明单位效率优势能否形成总体收益取决于实际节约与累计使用量。完整评价还需要考虑投入时间、设备利用率、需求波动、升级、故障和价格变化。若模型变化缩短了适用周期原本预期的任务量可能无法实现若系统能够持续承接可比负载固定投入就更容易得到分摊。因此专用芯片的经济价值不只发生在完成单次计算时也发生在它能够持续适配多少实际工作上。3. 采用专用芯片有不同投入门槛报告把大型云服务商视为主要采用者同时指出企业采用正在逐步扩大。[1第 54 页] 企业进入这一趋势可以有不同方式。采用路径主要需要组织什么重点评价什么通过云服务使用专用硬件服务接入、模型适配与运行管理真实价格性能、服务条件与迁移能力采购商业化专用系统设备部署、软件支持与运维利用率、系统兼容、升级与完整成本自行设计或参与定制芯片芯片、软件、制造与客户需求协同需求规模、稳定性、交付周期与累计投入上表是本文的管理分析框架。三种路径的能力要求和风险承担不同采纳等级为 4并不意味着多数企业都需要自行设计芯片。对于芯片开发方投入还包含设计验证、制造、封装测试、软件工具和客户导入。获得可以工作的芯片是重要进展形成客户愿意持续使用的系统还需要后续交付能力。八、云服务商的定制芯片怎样改变产业分工报告指出定制芯片正在从内部优化能力扩展为面向客户的竞争方式。[1第 52 页] 这会改变芯片、模型与云服务之间的关系。1. 大型平台有机会把真实负载带入设计持续服务大量客户的平台可以积累模型、并发、输入和运行条件方面的信息。它们也可能拥有较大的使用规模使专用优化获得更多分摊机会。这种优势不仅来自资金还来自设计与真实负载之间的连接。平台能够让芯片设计围绕具体需求展开并通过软件和服务安排扩大使用范围。不过内部效率改善怎样传递给客户需要另行观察。客户获得的是服务其价格、支持、可用性与迁移条件并不完全由芯片制造成本决定。因此“平台拥有定制芯片”和“客户获得更好的任务经济性”之间还存在商业与系统层面的转换。2. 模型开发者也可能同时使用多种硬件Anthropic 在 2025 年 10 月公布了扩大 Google Cloud 使用、包括至多 100 万个 TPU 的计划。其公告同时说明计算策略覆盖 Google TPU、Amazon Trainium 和 NVIDIA GPU 三类平台。[8]这里引用的是当时公布的计划和策略不把规划数量视为截至本文核对日已经全部交付的容量。这个案例展示了一个重要方向采用专用硬件可以与保留其他平台同时发生。不同平台之间可能形成资源、模型与服务的分工而非要求所有任务立即迁移到同一种架构。多平台安排也会增加软件适配、评价与运维工作。它的价值需要通过实际交付、服务能力和完整成本证明。3. 新架构的商业化需要持续客户与生态支持报告提到推理加速、内存优化、晶圆级计算和硅光等创新方向也列举 Cerebras、Groq 和 SambaNova 等参与者。[1第 50—51 页]这说明行业正在探索多种计算路径。架构多样性提供了新的优化机会但资本进入并不能保证所有设计都能形成长期市场。本文认为新架构需要同时证明三件事针对什么负载有价值客户能否顺利使用以及模型与需求变化后能否继续交付。性能展示、软件支持和客户采用应形成相互验证的过程。九、人才与供应链专用化需要跨环节的交付能力报告的人才数据具有启发性相关岗位中61% 要求云计算56% 要求机器学习C 人才供给需求比约为 9.2而优化与 GPU 技能分别约为 0.1。[1第 54 页]这些比例基于报告的数据与技能识别方法主要来源于英语国家不能直接当作某个地区的缺口也不能机械解释为“九成相关岗位无法招聘”。[1第 3 页]它们提示的是能力组合的差异。掌握编程语言与能够理解模型负载、编写高效计算实现、安排内存与并行并验证系统表现不是同一层次的能力。专用芯片发展仍然需要 GPU 与优化经验也说明技术路径之间存在知识联系。理解既有系统的瓶颈往往有助于确定新的设计目标。因此组织需要协调模型、编译、芯片、系统和客户使用方面的知识。各团队应能够解释局部改进怎样影响整体表现哪些条件已经验证哪些仍属于假设。1. 供应链分散需要覆盖实际依赖环节报告把制造集中、内存与封装供给、网络以及电力和热限制列为不确定性。[1第 54—55 页]芯片能够完成设计并不直接说明制造、内存、封装与系统交付都已准备好。供应链评价需要覆盖实际依赖的各个环节。增加某一环节的地区选择能够改善部分安排整套系统的供给能力则需要看其他配套条件。交付时间通常由多个环节共同决定。2. 芯片开发周期需要与模型和客户更新协调报告强调基础设施投入与技术快速变化之间的取舍。[1第 55 页] 专用设计需要预先判断负载但模型和客户要求可能在交付之前继续变化。因此设计需要明确哪些计算模式相对稳定哪些部分允许软件调整哪些变化需要重新配置或开发。适应能力应成为产品评价的一部分。这不意味着所有专用架构都会因模型更新失去价值。影响取决于优化对象、可编程空间和软件支持。组织需要通过实际更新检验它的延续能力。本文据此认为专用半导体的交付优势来自技术、供应与需求信息的持续协调。一次成功设计还需要在制造、部署和迭代中被继续实现。十、如何评价麦肯锡的判断并检验未来发展报告的贡献是把推理需求、专用设计、先进封装、软件支持和产业合作联系起来。它没有把芯片性能完全归结为计算单元数量也明确保留了负载稳定性和使用周期经济性等不确定性。[1第 50、52、55—56 页]但读者仍需要区分资本活动、研究案例、厂商性能说明与实际客户收益。它们回答不同问题不能直接连成已经被证实的商业因果链。本文认为专用半导体的方向性机会较明确当负载具有足够规模与可识别的计算规律系统优化就可能产生持续收益。具体架构能否获得这些收益则取决于软件、供给、使用量和变化条件。未来一至两年可以重点观察以下四个判断。这些判断属于作者分析不是报告已经证实的结论。第一异构分工会继续成为重要部署方式。不同推理阶段和应用可能需要不同资源。可以观察系统是否依据实际负载分配硬件以及这种分配能否改善合格任务产出和完整成本。第二软件支持与模型更新能力会更直接影响新芯片的采用。硬件优势需要通过编译、运行和服务实现。可以观察模型导入所需时间、升级后的质量与性能以及客户持续运行是否顺畅。第三内存、封装与互联的价值会随实际瓶颈变化。当计算单元主要等待数据与通信时改善连接可能具有更大作用。可以观察系统等待、带宽使用和供给条件而非只统计新增计算能力。第四专用化的商业筛选会更重视使用周期内的适配能力。架构需要在足够任务量中形成收益也需要承接模型与需求变化。可以观察客户采用是否持续、适配工作是否可控以及固定投入能否通过实际使用覆盖。这些判断也需要随证据更新。若某类负载长期稳定较深的专用化可能更有利若模型和任务变化更快保留灵活性可能更重要若软件与互联改善扩大了适用范围原有取舍也会发生变化。前瞻分析应关注这些条件如何演变而不是预先宣布某一种芯片将赢得全部计算任务。结语应用专用半导体的兴起体现了 AI 从能力建设走向持续运行之后对效率、响应和资源使用提出的更具体要求。专用芯片的价值需要由工作负载、数据流、软件工具、内存、封装与互联共同实现。设备能够完成计算还需要进一步证明客户能够以合理成本持续获得所需结果。本文认为这一趋势的核心评价单位应当是使用周期内持续完成的合格任务。模型变化、累计使用量、服务要求和系统支持都影响专用化收益是否能够延续。未来更有机会形成持续优势的参与者是能够把需求判断、架构设计与完整交付连接起来的组织。它们既要理解如何优化计算也要理解这些优化在什么条件下值得长期使用。参考资料与口径说明本文主要依据用户提供的麦肯锡 2026 年 9 月版报告解读第 5 项技术趋势正文第 50—56 页并结合第 3 页研究方法。页码指报告印刷页码对应 PDF 文件页序第 52—58 页和第 5 页。补充资料用于核对服务组织、芯片架构、软件支持、封装标准与评价方法核对日期为 2026 年 10 月 3 日。文中的假设场景、功能分类、经济性关系、费用示例、采用路径与前瞻判断属于作者分析。历史技术论文保留其测试和时间范围企业公告按其原始计划与表述理解性能比较以具体任务和评价条件为前提。McKinsey Company.Technology Trends Outlook 2026. September 2026, sixth edition. “Application-specific semiconductors”, pp. 50–56; research methodology, p. 3. 本文主要依据用户提供的 PDF。Zhong, Y., et al.DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving.OSDI 2024. 用于理解推理阶段分离、服务时延与资源配置的关系。Jouppi, N. P., et al.TPU v4: An Optically Reconfigurable Supercomputer for Machine Learning with Hardware Support for Embeddings. arXiv:2304.01433;ISCA 2023. 用于理解专用计算模块与互联共同设计。Amazon Web Services.What is AWS Neuron?. 官方技术文档。用于核对 Trainium 与 Inferentia 的软件栈组成。Taiwan Semiconductor Manufacturing Company.CoWoS. 官方技术资料。用于理解逻辑芯片、HBM 与先进封装的组合。UCIe Consortium.Specifications. 官方标准说明。用于核对封装内芯粒互联的标准化范围。MLCommons.MLPerf Inference: Datacenter. 官方基准说明。用于核对质量目标、场景与比较规则。Anthropic.Expanding our use of Google Cloud TPUs and Services. October 23, 2025. 用于核对 TPU 扩容计划及多芯片平台策略。