
截至 2026 年 9 月按 Anthropic 官方文档Claude Opus 5 的上下文窗口是 1M token每百万输入 token 收费 5 美元每百万输出 token 收费 25 美元。按我的估算这个窗口能一次装下一个中小规模的代码库或者一家企业的整套制度文件。同一年 5 月 11 日OpenAI 宣布成立由其控股的 OpenAI Deployment Company部署公司。崔牛会《FDE 落地中国白皮书》整理过这家公司公开描述的合作过程。第一步是诊断高价值机会挑出少量优先的工作流接着构建生产系统把模型连到客户的数据和工具上嵌进客户的控制措施和业务流程。做模型的公司在模型之外另建了一家做部署的公司。模型一次能读完一整套制度文件企业为什么还要请 FDEForward Deployed Engineer前线部署工程师这样的人进现场我的判断是模型补上的是通用能力企业缺的是模型无法取得的部分包括自己的数据口径、业务流程和权限也包括出了错由谁负责。模型越强通用能力越便宜项目成败越取决于这部分。先认几个词责任区崔牛会白皮书的用词指软件能力和业务结果之间的一段距离需要有人负责把前者变成后者。五个连接同一份白皮书的框架指 AI 进入企业必须接上的五个方面从数据一直到经营结果。80/95/99腾讯研究院《FDE 模式行业观察与实践》总结的经验规律描述 AI 应用覆盖的用例从 80% 提到 95%、再提到 99% 时难度和投入怎样变化。三道成本门槛同一份报告的说法指行业知识蒸馏、定制开发和复合型人才供给三项成本。最小经济可行项目《全球 FDE 发展研究报告》的用词指在经济上刚好值得做的最小项目。稳定认知中心同一份报告的用词指一个人或一个责任单元始终掌握从现实问题到生产结果的完整认知并承担端到端责任。资产专用性《关于 FDE 的 100 个问题》借用的经济学概念。书里的用法是任务需要高度专业化的知识时市场上的标准化服务很难满足。 :::试点停在哪一步腾讯研究院报告引用未具名的多家机构统计称超过七成企业已在至少一个职能中尝试生成式 AI但超过六成仍停留在试点或实验阶段。报告没有写明这组数字出自哪家机构我只把它当作方向性的信号。范冰《前线部署工程师》引用了另一组数字。MITMassachusetts Institute of Technology麻省理工学院NANDA 实验室 2025 年 7 月发布的报告《The GenAI Divide: State of AI in Business 2025》称在其调研的企业生成式 AI 项目中约 95% 没有产生可衡量的财务回报报告依据是 52 家组织访谈、153 份高管问卷和 300 多个公开项目。没有可衡量的财务回报不等于项目失败。这份报告的样本也不是随机抽样不能直接外推到中国企业。两组数字的口径不同一组说停在试点一组说没有财务回报我不把它们合成一个比例。两份资料对原因的解释可以对照着看。据范冰的转述MIT 的报告认为问题不在模型这些项目里的系统不会记住用户的反馈不保存上下文也没有嵌进工作流程。腾讯研究院报告把从 Demo 到生产分成成熟度 L0–L4 五级多数项目在 L1原型验证和 L2试点运行之间夭折。报告列的三类卡点都在组织一侧试点用户没有纳入考核数据质量问题在 Demo 阶段被回避审批流程没有提前办好。腾讯研究院报告还判断AI 能力进展的速度快于企业采用的速度模型每升级一次技术能做到的和组织用得起来的距离就拉大一次。这是一个判断报告没有给出测量这段距离的数据。标题里的「越需要有人」要先说清楚。我指的是两件事。一件是项目成败越来越取决于模型之外的上下文和责任这部分只能由人补上。另一件是值得做的项目变多了每个项目至少要有一个掌握全貌、对结果负责的人。每个项目派多少人是另一个问题崔牛会白皮书的判断是 FDE 人数可能下降部署系统会更复杂。「进现场」也不等于驻场崔牛会白皮书和腾讯研究院报告都把重点放在接近真实业务上驻场只是手段之一。同一个模型为什么在两家公司效果不同崔牛会白皮书第一章从传统企业软件讲起。传统软件处理确定性的问题需求可以写成流程流程可以配置成系统系统上线后经过培训和验收就算交付完成。软件公司交付功能客户负责把功能变成价值。同样的输入在任何一家客户那里都得到同样的输出所以功能有没有上线可以当作项目成功的标准。大模型改变了这个前提模型的输出是概率性的。白皮书指出同一个模型放进两家公司会因为数据质量、业务语境和权限结构不同也因为员工的用法和反馈机制不同给出完全不同的结果。企业无法再用功能有没有上线来判断项目成败一次性的实施也完成不了交付。白皮书把软件能力和业务结果之间空出来的这一段叫作责任区FDE 是组织对这段责任区的回应。白皮书把 AI 进入企业要完成的工作拆成五个连接每个连接对应一个要回答的问题。连接要回答的问题数据哪些数据可信、完整能不能被系统调用业务语义同一个词在不同部门和场景里指什么工作流程AI 在哪个节点介入由谁触发影响谁组织责任AI 出错时由谁判断、纠正和承担后果经营结果项目改善的是收入和成本还是效率和决策质量白皮书认为这五个连接无法只在产品总部完成。我的理解是五个问题的答案都属于某一家企业。有的答案写在系统里有的只存在于员工的做法里还有的要由有权限的人来决定。产品总部看不到这些答案模型也读不到没有写下来的部分。白皮书的卷首语描述过这种失效。演示中表现好的 Agent智能体进入组织后可能因为数据不全和目标不一致而失效也可能因为权限不清、出错没人担责而失效。数巅智能在白皮书里给过一个例子。企业数据很难真正标准化即使在同一个行业「利润」这样的指标也会因为企业口径、业务规则和历史系统不同而算法不同。场景越依赖这种组织内部的语义越需要有人进入现场把数据、指标和分析方式翻译成 AI 能理解的结构。我举一个假设的场景。业务人员让模型找出上个季度利润最高的产品线模型会按它能看到的字段去算。这家企业算利润时要不要扣除分摊的管理费用退货冲减哪个月的收入都是具体的规则。这些规则可能写在财务制度里也可能只存在于某个老系统的计算逻辑里。规则不同排名就可能不同。模型可以把几种算法都算一遍判断不了哪一种是这家企业认可的口径。模型变强为什么反而让这部分更重要崔牛会白皮书的解释是模型的推理和编码能力持续提高企业之间的差异不会消失。差异会更多集中到模型无法从公共语料中学到的部分也就是企业自己的数据和流程客户关系和决策习惯以及行业经验。白皮书由此认为FDE 的出现与模型不够强无关。模型越强通用能力越容易获得真实的上下文和业务判断越稀缺。我的推断是这个变化来自一个事实。前沿模型通过 API 对外销售一家企业能调用的模型它的竞争对手也能调用。模型这一部分对大家都一样项目结果的差别只能来自模型之外。模型部分拉平得越多结果的差别就越集中在上下文和责任上。FDE Frontier 与 FDE时代联合发布的《全球 FDE 发展研究报告》从另一个方向得出了相近的结论。报告认为模型能力越强可进入的细分流程越多可进入的流程越多需要识别和组织的企业差异也越多。按这个逻辑通用能力和企业定制会一起增长。崔牛会白皮书的依据是 16 个采访项目全球 FDE 报告的依据是自己的机制分析两份资料之间没有引用关系。Demo 做到八成以后剩下的难在哪里腾讯研究院报告的 80/95/99 规律描述了另一段距离。报告把企业级 AI 应用的难度分成三段。区间团队在做什么难点0 到 80%通用大模型加简单提示词有经验的工程师一天内能搭出看起来好用的原型太容易让很多人误以为 AI 落地很容易80% 到 95%大量优化提示词补充规则标注数据建评测集模型在特定场景出错行业术语理解不准边界情况处理不了95% 到 99%依靠 FDE、专用平台和上万级真实对话数据客服答错一次可能变成品牌事故金融、医疗和政务场景的错误可能触发合规风险接入越多权限和回滚越复杂修好一处另一处又出错报告把上限定在 99%理由有三个。大模型是概率系统输出空间开放总有预料不到的边缘情况。从 99% 推到 99.9%边际成本指数级上升收益却在递减。高风险场景里的那 1% 不该交给 AI应该由人工复核和回滚机制处理。报告据此说客户愿意为 FDE 付费是因为「Demo 到生产之间有一条很长的沟」。这组数字是经验归纳报告没有给出测量数据我把它当作描述难度分布的一种方式不当作研究结论。模型变强会改变哪一段我的推断是前两段会变短。更强的模型出错更少Demo 做得更快也更完整。第三段的工作量取决于三件事这家企业的长尾有多长错一次的代价有多大出了错能不能被发现和撤回。三件事都是企业自己的属性。模型变强能减少出错的次数决定不了哪些错不能出也不会替企业建好人工复核和回滚。报告还观察到很多客户在 Demo 阶段兴奋到生产阶段失望。我由此推出两个后果资料没有给出数据。Demo 越完整客户对上线的期待越高落差越大。另一方面做一个 Demo 的成本下降以后启动的项目会变多走到第三段的项目也会变多。第三段需要的人要掌握这家企业的上下文也要能对结果负责。评测集怎样建、怎样用见 第 13 讲。Opus 5 补得上哪一段补不上哪一段回到开头的 Claude Opus 5。截至 2026 年 9 月按 Anthropic 官方文档Opus 5 的上下文窗口是 1M token单次最大输出 128K token通过 Messages API它可以使用工具调用和结构化输出。放到部署现场模型可以一次读完大量制度文件和代码可以调用工具查询客户系统也可以按固定格式输出结果交给规则代码校验。五个连接里数据和工作流程两项的一部分技术工作模型已经能承担。模型的上下文窗口装得下的是有人放进去的内容。Opus 5 做不到的有三件读不到没有写下来的上下文。利润口径如果有一部分只存在于财务人员的做法和老系统的计算逻辑里窗口再大也读不到。裁决不了口径冲突。两份制度文件对利润的算法不一样模型可以把差异列出来用哪一种要由有权限的人决定。承担不了结果。《全球 FDE 发展研究报告》设计 FDE 责任单元时写明Agent 只承担可编排的执行不构成责任主体最终裁决、独立复核和生产工程边界三类责任必须由人承担。Anthropic 自己的开发文档给过一份判断清单。截至 2026 年 9 月文档建议从能满足需求的最简单方案开始决定用 Agent 之前检查四个条件任何一条不满足就留在更简单的方案任务复杂度任务是否多步骤难以预先写清价值结果是否值得更高的成本和延迟可行性模型能否胜任这类任务出错代价错误能否被发现和挽回例如有没有测试、评审和回滚。按我的读法四个条件里只有可行性主要取决于模型。任务能不能预先写清要看这家企业的流程有没有人理清楚结果值不值得要看业务的账错了能不能挽回要看客户那边有没有复核和回滚。模型升级扩大的是可行性另外三个条件的答案要到客户的业务里去找。模型能力和部署能力的区别在这里。模型能力是给定输入以后模型能做到什么。部署能力是找到该给的输入定义这家企业认可的正确输出把结果嵌进流程并对结果负责。模型升级提高的是前者后者要有人在客户的业务里完成。这门课的读者多数在国内这里要说明一个限制。按 Anthropic 官方支持地区列表截至 2026 年 9 月中国大陆不在 Claude API 的服务范围内2025 年 9 月起Anthropic 还按股权结构限制中资控股企业使用其服务。国内企业客户的生产系统通常选择国产模型或私有化部署。这里拿 Opus 5 只作能力参照国内的模型选型见 第 22 讲。写代码变快以后交接为什么成了瓶颈上下文为什么要由同一个人或同一个单元掌握《全球 FDE 发展研究报告》给了解释。传统交付把责任分给咨询和架构再分给开发、交付和运维。报告认为每交接一次就会损耗四样内容语言转换中丢失的意思没有说出口的设计意图接手的人重建上下文的时间以及沟通等待。报告接着作出一个反直觉的判断AI 带来的实现速度越快这种认知断裂对整体效率的制约越明显。用一组假设的数字看比例怎么变。一个需求从提出到上线实现要 6 周交接和等待要 2 周交接占总时长的四分之一。实现压到 2 周交接和等待还是 2 周交接就占了一半。数字是假设的只用来说明比例实现到底快了多少项目层面没有数据。能找到的研究只测到任务层面。据《全球 FDE 发展研究报告》引用Cui、Demirer 与 Jaffe 等人 2025 年的研究汇总了三项随机现场试验共 4,867 名软件开发者使用 AI 编码助手的开发者完成的任务数增加 26.08%。这是完成任务数不能换算成项目的人月、周期或质量报告自己也这样限定。实现变快还有第二个效应。团队一个月能出更多版本每个版本都要对照同一个经营问题检查一遍。报告认为各部门掌握的局部认知即使分别正确也难以支撑高频版本对同一个问题的持续校正。版本越多交接越多损耗随交接次数累加。报告因此主张由同一个责任主体掌握全程从问题定义和架构取舍到需求与验收再到运行反馈和下一轮修改。报告把这个主体叫作稳定认知中心它可以是一名 FDE也可以是首席 FDE 带领的责任单元。问题和设计的责任验收和结果的责任都不能在交接中被切断。崔牛会白皮书里的数巅智能说过相近的话。数巅把产品经理接需求、写需求文档研发再去实现的传统链条称为信息传递损耗认为要由一个前线连接者把多层接力变成端到端的直接连接。两份资料之间没有引用关系结论方向一致。模型变强压短的是实现。实现越短交接占的比重越大能掌握全程的人就越稀缺。这份工作为什么买不来自己做也难《关于 FDE 的 100 个问题》作者署名磊叔用经济学解释了这件事。科斯问过企业为什么存在答案是市场交易有成本。书里接着引入资产专用性任务需要高度专业化的知识时市场上的标准化服务很难满足企业自己做更稳妥。作者认为 AI 部署的专用性很高每家公司的数据、流程和合规要求都不同AI 能力又变化很快。书里没有写资产专用性这个概念由谁提出。按这个逻辑企业应该自己做。自己做的难处《全球 FDE 发展研究报告》写得具体。员工掌握业务流程和行业经验通常缺少软件架构思维和工程技能也不承担生产级系统的责任。AI 能帮员工生成代码和搭原型也能改局部功能补不上系统边界和技术取舍也补不上验收标准、安全要求和持续运行能力。从市场上买也不合适。同一份报告分析过两种传统供给。标准软件产品必须围绕共性设计进不了企业独有的流程和例外。传统咨询和定制开发能深入现场但业务和技术之间要多次转述周期长固定成本高上线后的责任还可能分散在不同供应商那里。两头都不合适就需要一种中间形态。《100 个问题》把 FDE 称为「嵌入式的混合治理」它有内部员工的上下文深度又保留外部专家的灵活性。作者也写明了这个解释的边界AI 能力标准化到一定程度专用性会下降。需求一侧有一组小样本数据可以对照。崔牛会对企业 CIOChief Information Officer首席信息官做过一次定向探索性调研报告没有公开样本量按比例推算可能只有 15 份。在问 CIO 最需要 FDE 解决哪些问题的多选题里选业务需求难以转化为技术方案的占 60.0%选标准产品与企业实际场景不匹配的也占 60.0%。这组数字只能说明方向不能代表中国企业 CIO 的总体。这个解释也划出了不需要 FDE 的情况。《100 个问题》自己提醒过如果企业买的软件本来够用只是没人会用需要的是一个会用的人不需要 FDE。书里同一处还给了一个软件支出与实施支出的比例全书没有写出处其他六份资料也没有出现我不引用。范冰在书里用 Harvey 标出了另一条边界。Harvey 做法律行业的 AI 应用。范冰的判断是保密制度、数据驻留和关键用户自主权三项障碍同时存在的市场产品化交付进不去只有人进到客户内部系统才部署得进去。我对这三项障碍的理解是这样的。保密制度让外部团队无法远程取得数据上下文只能在现场获取。数据驻留要求系统部署在客户自己的环境里部署和运维也在那里发生。关键用户自主权意味着每个关键用户都要单独争取。范冰描述过律所里的三层人群合伙人付费但不亲自使用律师助理使用但不付费知识管理律师看得到双方的盲区。三项障碍都不存在的市场标准产品加远程支持可能就够了。场景怎样筛选见 第 08 讲。派人进现场过去太贵现在为什么算得过账派工程师进客户现场不是新做法Palantir 的来历见 第 01 讲。腾讯研究院报告的判断是过去十几年里真正把这套模式做成的公司极少。2024 到 2026 年它重新流行报告认为原因是 AI 同时改变了这套模式的三项成本结构过去不划算的做法变得可行。报告也说明FDE 升温不等于企业更愿意买驻场服务。成本项过去AI 之后行业知识蒸馏现场团队发现了问题只能写需求文档排队等产品团队评估和开发FDE 在现场写脚本和搭原型还能生成测试用例问题更快变成可验证的产品改进定制开发理解业务 → 写需求 → 排期开发 → 测试上线理解业务 → 抽象语义 → 生成原型 → 现场验证更小的团队就能完成价值验证复合型人才供给同时懂业务和技术的人才门槛很高AI 补上一部分工程、文档和产品能力更多一线人员能跨越业务和技术的边界工作报告对第三行加了限定。AI 压缩的是工程执行的成本判断场景价值和理解行业逻辑的能力以及推动组织采用的能力不会因此变得更容易获得。这一点和前面的机制对得上执行变便宜以后稀缺的部分是上下文和判断。《全球 FDE 发展研究报告》把供给和需求放在一起算账提出三种力量AI 降低首次实现的成本FDE 减少认知和交接的损耗行业资产复用降低后续项目的成本。需求一侧企业智能化让更多生产流程成为软件可以参与的对象。两边同时作用最小经济可行项目的门槛降低。有些企业过去因为预算太小、需求太细或变化太快得不到定制软件现在开始进入可服务的范围。报告判断新增市场主要来自中小企业和细分流程。复用降低后续成本有一个行业基准可以参考。据全球 FDE 报告引用北京软件造价评估技术创新联盟发布过《2025年中国软件行业基准数据》。其中的工作量调整因子同行业有相似项目背景时为 0.8缺少相似背景时为 1.2。这两个数是做工作量估算时用的调整因子报告没有给出实测的节省。这一层和模型能力的关系更直接。模型越强原型越便宜派一个人进现场能做的事越多同样的预算能覆盖更小的项目。在这一层「越需要有人」的意思是需要人的项目变多了。中小企业能不能成为主要市场资料之间有分歧。崔牛会白皮书里毕昇认为中小企业负担不起 FDE数巅认为中小企业要等产品标准化和模型成本下降。白皮书的研究判断是重 FDE 只适合少数高价值客户。全球 FDE 报告自己也把中小企业能否承担服务成本列为全球实践还没有证明的问题长期的单位经济也在其中。这份报告的发布方以 FDE 命名立场是推动 FDE 成为明确的职业。我的倾向是门槛下降这个机制成立中小企业付不付得起还没有证据。崔牛会的受访者是在做这门生意的厂商判断来自自己的账全球 FDE 报告的判断来自机制推演。在看到中小企业项目的续约和利润数据之前我把新增市场主要来自中小企业这个判断当作待验证的假设。两份资料都认为海外面向大客户的长期驻场做法不能直接搬到中小企业身上。国内项目的经济账见 第 04 讲怎样让第二个客户比第一个便宜见 第 25 讲。岗位会不会被产品和 Agent 吸收范冰在书里引用了一条高德纳Gartner的预测。据 CIO.com 2026 年 5 月 6 日报道高德纳分析师 Alex Coqueiro 预测到 2028 年70% 的企业将因供应商成本过高与内部技能不足放弃由前线部署工程师主导的 Agent 方案。这条预测要到 2028 年才能检验。范冰用它提醒 FDE 团队不要让客户觉得被绑定。按我的理解这条预测的两个原因都指向对外部供应商的依赖一个是付出的钱太多一个是企业内部没有人能接手。它预测企业会放弃 FDE 主导的方案没有说五个连接可以不接。我的推断是企业放弃以后这部分工作会转给产品、平台或企业自己的团队没有人接的项目继续停在试点。范冰还记录了一个更直接的质疑。Kuse.ai 创始人吴显昆认为 FDE 很难成为好的商业模式。做浅了模型厂商自己会做做深了就和外包没有区别交付成本高也难规模化。范冰把这个质疑和高德纳的预测放在一起判断 FDE 模式最大的敌人可能是它自己的成本结构。崔牛会白皮书的立场是FDE 可能是过渡性的岗位部署能力不会消失。部署能力会被产品和平台吸收也会流向客户团队和生态伙伴还有一部分交给 AI Agent。吸收已经在发生白皮书提到Palantir 已经把部分数据转换和应用构建工作交给名为 AI FDE 的产品功能。白皮书收录的反方样本是元理智能。元理想用虚拟商业环境和强化学习训练数字员工让系统在自我博弈中进化跳过人工部署。白皮书列出了这条路线还没有回答的五个问题谁定义商业环境和奖励信号谁判断模型学到的是正确的能力没有钻规则的空子谁取得客户的信任和数据权限谁处理组织冲突、责任和伦理边界谁决定一个结果值不值得追求。五个问题问的都是上下文和责任和前面几节的机制指向同一处。白皮书建议换一个问法不问未来还有没有 FDE 这个岗位问部署责任最终由谁承担、通过什么系统承担。我的判断是前面这些机制能解释企业为什么需要部署能力解释不了 FDE 这个岗位名称和人数会不会保留。决定岗位去留的变量是成本结构也就是同类的第二个项目有没有比第一个便宜。同类项目始终要同样的人数和时间崔牛会白皮书把这种情况叫作高端定制经验沉淀成可复用的资产下一个客户的交付成本才会下降。判断一个项目属于哪一种第 03 讲 给出了三项检验岗位的长期走向在 第 31 讲 展开。这些机制的证据主要来自推理和访谈。80/95/99 是经验归纳全球 FDE 报告是倡导型报告崔牛会的受访者多是厂商停在试点的比例出自未具名的统计。我在七份资料里找过对照数据想看有人进现场的项目成功率是否更高没有找到这样的研究。我接受这些机制依据是它们和模型的三个属性一致输出是概率性的取不到企业没有写下的上下文也不构成责任主体。机制说得通不等于在你的项目里成立下面的检查要用你自己的项目来做。FDE 实战课连载下一讲是《03FDE 和售前、实施、咨询、外包的分界线》。用一张九个相邻角色的对照表和三项检验判断一个岗位或项目是不是真正的 FDE。资料展示下面是我整理的AI大模型 学习资料和工具包预览适合收藏后按主题逐步学习。