
AI 写代码越来越快合并前的人工审查成了最慢的一环。审查公司要同时过三张账评论有没有人改漏掉的 bug 谁来赔GitHub、Cursor、Anthropic 把审查塞进自家订阅以后独立厂商还能不能单独收费。问迹AI TrackBook · AI原生创投情报站 · Agent 编程 IDE · AI 代码审查 · 2026-09-28Google 在 2026 年 4 月说公司新写的代码约 75% 由 AI 生成再由工程师审核上线。写的速度上去了审的速度没跟上Faros 在 2026 年的统计里高 AI 采用团队的 PR 审查时间比两年前多了 441%31% 的 PR 干脆没人审就合并了。LinearB 看了 810 万个 PRAI 生成的只有 32.7% 最终被合并人写的是 84.4%。审查者的时间大量花在读最后不会合并的代码上。于是合并前这道关成了单独一笔预算。CodeRabbit 2026 年 8 月拿到 1.43 亿美元 C 轮、估值 15 亿美元Greptile 一年内连拿 A、B 两轮。另一边GitHub Copilot code review 已占 GitHub 五分之一以上的审查Cursor 买下 GraphiteAnthropic 推出 Claude Code Review。写代码的公司也在卖审查独立公司得先说清自己比平台自带的强在哪。75%· Google 新代码由 AI 生成2026 年 4 月Google 官方口径经工程师审核后上线441%· PR 审查时间Faros 2026 年统计高 AI 采用团队对比基线32.7% vs 84.4%· AI PR 与人写 PR 的合并率LinearB 2026 年基于 810 万个 PR1/5· GitHub 审查由 Copilot 完成GitHub 2026 年 3 月累计 6000 万次四个数字来自不同机构、不同样本只用来说明审查已经堵住不能互相换算。机器人写一百条评论不难难的是让开发者真去改其中几条还不漏掉那一条越权漏洞。01 AI 写代码的速度翻了几倍合并前那道人工审查却没有变快AI 代码审查指的是接在 GitHub 或 GitLab 上、每开一个 PR 就自动读改动、在代码行上留评论并给出改法的产品。付钱的是研发负责人按席位或按次计费交付物是 PR 里的评论和修复建议验收看两件事评论有没有被开发者采纳上线后的缺陷有没有变少。边界外有两类各说一句。一是自己接需求、写代码、提 PR 的自主编程 Agent它们是被审的一方。二是 Sonar、Snyk 这类传统静态扫描厂商规则固定、结果可复现只拿来作对照。IDE 里提交前的本地自查比如 CodeBuddy 的 /cr 命令算相邻形态放在国内部分顺带说。堵点不止一家机构看到。Faros 统计的 PR 平均体积大了 51.3%LinearB 的数据里AI 生成的 PR 在 P75 分位有 408 行人写的只有 157 行。PR 更大、更多、更容易被打回审查者自然审不过来。问题的性质也变了。Apiiro 2025 年 9 月的研究显示用 AI 助手的仓库里安全问题约为原来的 10 倍权限提升路径多了 322%语法错误反而少了 76%。多出来的是跨文件的权限和设计问题扫一眼 diff 看不出来。2026 年一篇 arXiv 综述把代码审查自动化分成 5 个领域、18 项任务商业产品目前主要卖其中一件合并前找出会出事的缺陷并附上改法。02 只读 diff、索引全仓库、多 Agent 互查、跑测试复现四种审法各在三张账上付代价审查工具的差别首先在于审一个 PR 时读多少代码、验证到哪一步。读得越多、验得越深漏报越少但更慢、更贵。01 只读改动和周边文件最便宜读 diff 和相邻文件就出评论。GitHub Copilot code review 的 Lite 档单次额度约 0.05 到 1 美元Codex 默认只标 P0、P1 两级问题规则写进 AGENTS.md靠少说话压噪声。代价是改一个函数签名、牵连另外三个服务只看 diff 看不出。02 先给全仓库建索引接入时把仓库解析成函数和调用关系审查时顺着引用查影响。Greptile 接入即建代码图谱Macroscope 为 10 种语言写了语法树遍历器Entelligence.ai、Bito 也主打跨仓库上下文。漏报少但大仓库、多语言项目建索引成本高。03 多个 Agent 分工再互查一次审查拆给几个专职 Agent交叉核对后再出评论。Claude Code Review 平均约 20 分钟、每次 15 到 25 美元Qodo 按严重问题、破坏性变更、需求合规、重复逻辑、团队规则分设 Agent文心快码的 AI IDE 也支持多子 Agent 并行审查。能压误报慢和贵写在价目表上。04 写测试、跑起来复现把问题跑出来而不只是提醒。Greptile 的 TREX 在沙箱里跑测试Jazzberry 靠真实执行代码找漏洞Gitar 反复修改直到 CI 通过CodeAnt AI 在评论里附复现步骤。证据最硬门槛是客户代码得能在沙箱里装起来。四条路头部产品都在混用差别在默认档位。Martian 的评测里Graphite 精确率最高、召回最低CodeRabbit 线上召回最高为 0.54一家少说但说准一家多找但更吵。调参本身就是在噪声账和漏报账之间选边。03 噪声账评论被开发者改掉才算数被静音的机器人等于没装开发者对审查机器人最常见的抱怨是吵一个 PR 刷出二十条评论真正要命的那条淹在风格建议里。评论一多开发者就整体忽略甚至把机器人关掉。所以噪声账不问找出多少问题只问开发者改了多少。Cursor 把这个指标叫解决率PR 合并时机器人标出的问题有多少被作者改掉。Cursor Bugbot 从 2025 年 7 月第一版到 2026 年 1 月第十一版解决率从 52% 升到七成以上每个 PR 被解决的问题从 0.2 个增加到 0.5 个但是否算解决由模型判断不是人工标注。国内少见的公开口径来自阿里Open Code Review 在内部用了近两年月活约 2 万采纳率 30% 以上、误报率低于 5%。误报低说明评论大多没说错采纳率 30% 说明七成说对的评论开发者也没改。读评论的越来越多不是人而是编码 Agent。Macroscope 建议评论交给 Agent 处理时选偏覆盖模式同时用自家基准宣传多找 5% 的 bug、评论少 75%。人嫌吵Agent 不嫌吵只要修得对噪声的成本从开发者的注意力变成了 Token 和 CI 时间。评测榜单帮不了买方太多。Greptile 转引的 Martian 线上榜2026 年 7 月 30 日里Greptile F1 为 60.8%Codex 59.4%cubic 58.7%CodeRabbit 57.5%Qodo 融资时称自己在 Martian 上得分 64.3%Baz 说自己在按精确率加权的榜单上排第一到 9 月cubic 又引用 8 月 26 日至 9 月 25 日的线上数据称自己 F1 65.7% 排第一。几家都说第一因为时段、版本和权重不同。看榜先问三件事一是离线题库还是线上真实 PR二是看精确率还是召回三是谁发布的。真正压噪声的是让机器人学会这个团队在意什么。Greptile 从团队过往评论里学规范cubic 也从历史 PR 评论学习自称合并快了 28%。同一句空指针提醒对支付服务必须改对内部脚本就是噪声这个区别只有团队历史知道。04 漏报账漏掉一个越权漏洞的代价至今仍由买方自己承担压噪声很容易调高阈值就行代价是漏报。精确率最高的 Graphite 恰好召回最低很安静也漏得多。漏报平时感受不到上线出事才会发现而代价在变大Faros 2026 年的数据里每个 PR 带来的线上事故多了 242.7%人均 bug 多了 54%。按席位或按次付费买方买到的是评论不是结果担保漏掉的越权漏洞上线后事故成本仍记在买方账上。厂商的回应分三种。一是卖更深、更贵的单次审查Claude Code Review 每次 15 到 25 美元Anthropic 称内部几乎每个 PR 都跑VentureBeat 的报道里这个价格招来不少开发者质疑Claude Code /ultrareview 在云端用并行 Agent 集群做更重的审查。二是分档Cursor Bugbot 高强度档比默认档多找 35% 的问题GitHub Copilot code review 的 Balanced 档单次额度最高约 5 美元。三是只报最严重的Codex 默认只标 P0 和 P1。分档收费让漏报账第一次能由买方自己配置改权限、改支付、改数据库迁移的 PR 跑深档改文案的跑浅档。厂商要回答的问题也随之变成审查之前能不能判断这个 PR 值得花多少钱审。传统扫描厂商也在补这一块。Sonar 在 2026 年 5 月收购 GitarSonarQube 的规则分析是确定性的、不耗 TokenGitar 用 Agent 反复修改直到 CI 通过它一个月前才以 Venrock 领投的 900 万美元结束隐身。Snyk 这类安全扫描厂商同样握着规则库和企业安全预算。规则给出可复现的底线模型负责读懂业务逻辑漏报才有人讲得清。05 平台账审查被塞进订阅以后独立厂商只能在价格、渠道和中立性上找差异GitHub 手里握着最大的入口。GitHub Copilot code review 到 2026 年 3 月累计 6000 万次一年增长 10 倍占 GitHub 上五分之一以上的代码审查超过 1.2 万个组织对每个 PR 自动开启。但它也不再算白送2026 年 6 月 1 日起 Copilot 改为按用量计费代码审查还要额外消耗 Actions 分钟费用记在发起审查的人或 PR 作者名下。平台自带的审查也开始按次收费了。Cursor 的路线是买。2025 年 12 月它宣布收购 GraphiteAxios 报道价格远高于 Graphite 约 2.9 亿美元的上一轮估值。2026 年 5 月Cursor Bugbot 取消每席位 40 美元的订阅改成每次约 1 到 1.5 美元。SpaceX 8 月完成收购 Cursor 后OpenAI 宣布自 11 月 12 日起停止向 Cursor 提供模型。审查效果取决于背后的模型模型供应一变审查质量就可能跟着变。模型厂商也自己下场Anthropic 把 Claude Code Review 放进 Claude Code 的 Team 和 Enterprise 版OpenAI 让用户在 PR 里 Codex 发起审查。独立厂商的差异只剩三处。一是中立CodeRabbit 专门发文指出Bugbot 默认用 Cursor 自家的 Composer 系列模型写和审是同一家领投 CodeRabbit C 轮的 Atomico 也说需要一个不管哪个模型写的代码都能校验的独立层。CodeRabbit 同样调用外部大模型这里的中立指不绑定写代码的那一家。二是价格CodeRabbit 每开发者每月 24 到 30 美元超额每个文件 0.25 美元Greptile 每席位 30 美元含 50 次Macroscope 不收席位费平均每次约 0.95 美元。三是渠道Bito 同时支持 GitHub、GitLab 和 BitbucketGreptile 可部署在客户自己的云上Sourcery 提供零数据留存和自带模型。价格和渠道容易被追平能守住的主要是中立和深度中立也可以检验直接问审查模型和写代码的模型是不是同一家。06 按三张账排一排独立厂商押深度和中立大厂押默认入口国内押私有化下面三张表分别列独立厂商、大厂内置和传统扫描与国内玩家。融资明星之外也列上规模较小但路线清楚的公司。独立 AI 代码审查厂商纳入标准以 PR 审查为主产品接入 GitHub / GitLab 等代码托管平台向研发团队单独收费。CodeRabbit成立/背景2023 年创立17000 客户每周 200 万 次审查最近融资时间C 轮 1.43 亿美元估值 15 亿美元2026-08收费方式每开发者每月 24–30 美元 超额按文件计主要押哪张账平台账不绑定写代码模型的独立审查Greptile成立/背景2023 年创立YC W242.2 万 团队最近融资时间B 轮 4000 万美元2026-08CB Insights收费方式每席位 30 美元含 50 次主要押哪张账漏报账全仓库图谱 沙箱测试Qodo成立/背景创始人曾任阿里总监最近融资时间B 轮 7000 万美元累计 1.2 亿2026-03收费方式团队 / 企业订阅主要押哪张账漏报账多专职 Agent 需求合规Macroscope成立/背景创始团队来自 Periscope、Magic Pony最近融资时间A 轮 3000 万美元累计 4000 万2025-09收费方式每 KB 0.05 美元不收席位费主要押哪张账噪声账少评论、按量计费Baz成立/背景审查代码与产品行为最近融资时间种子扩展 900 万美元累计 1700 万2026-06收费方式未公开主要押哪张账噪声账按精确率加权CodeAnt AI成立/背景YC 出身最近融资时间种子轮 200 万美元估值 2000 万2025-05收费方式每开发者 10–40 美元主要押哪张账漏报账评论附复现步骤cubic成立/背景YC 2025 春季批次最近融资时间YC 阶段未见后续公开轮次收费方式未公开主要押哪张账噪声账学团队历史评论Bito成立/背景由 IDE 助手转向审查 Agent最近融资时间种子扩展 570 万美元种子累计 880 万2025-05收费方式席位订阅可自托管主要押哪张账平台账GitHub / GitLab / Bitbucket 全覆盖Sourcery成立/背景2018 年创立于伦敦30 万 开发者最近融资时间未见近期公开轮次收费方式免费版 团队订阅主要押哪张账平台账零留存、自带模型融资与估值以公司通稿、CB Insights 与媒体报道为准未公开的不做推测。大厂与平台内置的审查纳入标准由代码托管平台、编程 IDE 或模型厂商提供挂在自家产品上。GitHub Copilot code review挂在哪GitHub PR 原生2026 计费6 月起按 AI 额度 Actions 分钟单次约 0.05–5 美元公开效果口径6000 万次占 GitHub 五分之一以上审查Cursor Bugbot挂在哪GitHub PR可转 Cursor 修复2026 计费5 月起每次约 1–1.5 美元公开效果口径解决率七成以上模型判定默认档 80%Graphite Agent挂在哪Graphite 堆叠 PR 流程现属 Cursor2026 计费Team 40 / Starter 20 美元每月2025-10公开效果口径Martian 评测精确率最高、召回最低Claude Code Review挂在哪GitHubClaude Team / Enterprise2026 计费每次 15–25 美元公开效果口径Anthropic 内部几乎每个 PR 都跑Codex挂在哪GitHub PR 中 codex review2026 计费随 Codex 套餐额度公开效果口径只标 P0/P1Martian 线上 F1 59.4%效果口径多为厂商自报解决率、F1 的定义各不相同不能横向比较。传统扫描厂商与国内玩家纳入标准已有规则扫描或编码助手产品、正在补 AI 审查能力的公司以及国内代表。Sonar审查能力放在哪SonarQube 确定性规则分析商业形态企业授权值得注意的动作2026-05 收购 Gitar补 Agent 修复Snyk审查能力放在哪开发者安全扫描商业形态企业安全预算值得注意的动作与 AI 审查争同一笔安全预算通义灵码审查能力放在哪IDE 插件 云效流水线推送即审商业形态阿里云订阅值得注意的动作阿里另开源 Open Code ReviewOpen Code Review审查能力放在哪命令行接 GitHub Actions / GitLab CI / Gerrit商业形态Apache-2.0 开源值得注意的动作开源约四个月约 2.1 万星文心快码审查能力放在哪AI IDE 多子 Agent 并行审查商业形态订阅 私有化值得注意的动作接入规范与缺陷知识库CodeBuddy审查能力放在哪IDE 内 /cr 本地自审商业形态腾讯云值得注意的动作2026-09 上线代码评审文档词元无限审查能力放在哪InfCode 的 CodeReview 模块商业形态企业私有化部署值得注意的动作一年三轮合计数亿元2026-07国内产品多把审查做成编码助手的一个功能单独按审查收费的公司很少。长尾还有Entelligence.ai 主打完整代码库上下文Optibot 和 Unblocked Code Review 都强调少打扰Ellipsis 审完直接修Sentry 让 Seer 结合错误监控做审查。它们大多没有公开规模数字差异集中在噪声账上。国内的格局不同大厂把审查做成编码助手的一个功能通义灵码配合云效代码一推送就触发 AI 评审文心快码在 AI IDE 里用多子 Agent 审查CodeBuddy 在 IDE 里用 /cr 做提交前自查。阿里还把 Open Code Review 以 Apache-2.0 协议开源约四个月拿到约 2.1 万颗星。独立公司里词元无限的 InfCode 带 CodeReview 模块主打私有化部署一年完成三轮合计数亿元融资。国内客户的代码多数不能出内网能私有化部署才上得了桌。07 估值一年涨近三倍钱押的是审查会从写代码的工具里独立出来CodeRabbit 的数字最能说明钱怎么在动。2025 年 9 月 B 轮时它的 ARR 超过 1500 万美元、估值 5.5 亿美元2026 年 8 月 C 轮估值 15 亿美元客户 1.7 万多家公司称收入增长 5 倍以上。Sacra 估算其 2026 年 7 月 ARR 约 5000 万美元量子位与 36 氪报道累计融资 2.31 亿美元。按此算估值约 30 倍 ARRSignals Inbox 专门写文章质疑倍数偏高。早期支票为什么好拿第一笔钱好拿有三个原因。一是痛点有第三方数据Faros 和 LinearB 的报告直接告诉研发负责人审查堵了不用创业者教育市场。二是试用链路短装一个 GitHub App当天就能在真实 PR 上看到评论。三是团队背景好讲Macroscope 的创始人来自 Periscope 和 Magic PonyQodo 创始人曾任阿里总监词元无限 CEO 在字节参与过 MarsCode 和 Trae。YC 也在成批孵化CodeAnt AI 种子轮 200 万美元、估值 2000 万美元cubic 同样出自 YC。出钱的人要分开看。财务 VC 押的是赛道成长Atomico 和 Smash Capital 领投 CodeRabbit C 轮CRV、Scale VP 等老股东跟投Benchmark 连续领投 Greptile 的 A、B 轮Qumra 领投 QodoLightspeed 领投 MacroscopeBattery 和 boldstart 投了 BazVela 领投 BitoVenrock 领投 Gitar。产业资本是另一类Datadog 和 BMW i Ventures 进了 CodeRabbit 的 C 轮英伟达的 NVentures 在 B 轮。Datadog 同样卖给研发团队对审查公司更实在的是可能带来的渠道和数据打通而不只是估值背书。国内的词元无限由临芯投资领投、华控基金追投。B 轮以后看什么后续融资看四件事。一是收入有多少跟着 PR 数量涨而不是跟着工程师人数涨CodeRabbit 超额按文件收费Macroscope 全部按改动大小收费连 GitHub 也改成按用量计费。二是能不能延伸到更大的预算CodeRabbit C 轮同时推出分诊、变更栈和安全三块的变更管理产品Qodo 把自己定位成代码验证与治理。三是第三方评测上站不站得住。四是对平台依赖多深GitHub 既是渠道也是对手OpenAI 对 Cursor 断供说明模型来源本身就是风险。这一轮也有值得警惕的地方投资人看的核心数字大多由被投公司自己定义。解决率由模型判定三家公司各称评测第一30 倍 ARR 的估值已有人公开质疑。估值一年涨 2.7 倍押的是审查会从写代码的工具里独立出来如果 GitHub 按次计费后照样守住五分之一以上的份额这个判断就要打折。新公司还能从哪里下场新入局的创业者再做一个通用的 GitHub PR 评论机器人机会很小GitHub Copilot code review 已占五分之一以上的审查Cursor Bugbot 每次只要 1 到 1.5 美元CodeRabbit 手里有 C 轮的 1.43 亿美元。还剩三个具体切口。一是把跑测试复现做成某一类技术栈的标准件。Greptile 的 TREX 和 Jazzberry 证明把问题跑出来比口头提醒更有说服力后者已停掉这款产品转做别的说明单靠这一招很难撑起一家公司难点在于把客户环境装进沙箱。移动端、嵌入式、数据管道这类难复现的栈通用厂商短期做不深专做一类的新公司可以按复现成功一次收费。二是受监管行业的私有化审查。金融、制造、政企的代码不能出内网Open Code Review 开源降低了技术门槛但部署、规则定制和调优仍要人服务词元无限靠私有化拿到三轮融资说明有人付钱。堵点是私有化交付重、毛利低规模化要靠把规则库和模型适配做成产品。三是只给编码 Agent 看的审查。当修复由 Agent 完成评论多一点不再是噪声比的是一轮跑完修掉多少真问题。新公司可以按修复成功的缺陷数收费这是席位和按次都没覆盖的定价。堵点在于修复成功怎么判定买卖双方得先有共认的标准而今天连解决率都还由模型自己判。08 看一家 AI 代码审查公司就看它的三张账能不能同时对上判断一家审查公司问三个问题就够。一是噪声账能不能拿出经人工核验的采纳率或解决率而不是模型自评阿里公开的 30% 采纳率是一个可对照的起点。二是漏报账对改权限、改支付这类高风险 PR有没有更深的档位评论里有没有复现证据。三是平台账比 GitHub Copilot code review 贵还是便宜贵的那部分买到的是中立、深度还是 GitLab 与私有化渠道。未来一年有三个信号可以检验。一是 GitHub 按用量计费以后GitHub Copilot code review 的份额会不会继续涨。二是 11 月 12 日 OpenAI 停止供模型之后Cursor Bugbot 的解决率会不会变。三是 CodeRabbit 的收入增速能不能撑住约 30 倍 ARR 的估值。三个答案里有两个对独立厂商不利这门生意就会回到平台手里。本文整理自问迹AI TrackBook。数字与融资口径来自公开报道文中已写明年份与机构便于核对。