ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Agent 把活干完了,但它干对了吗?——我盯着那个绿色对勾,总觉得哪里不对

Agent 把活干完了,但它干对了吗?——我盯着那个绿色对勾,总觉得哪里不对 周五下午我让一个 coding agent 去改我们内部工具的一个接口就是那种把旧的鉴权逻辑换成新方案的活听起来挺规整的。它跑了两分钟界面弹出一个绿色对勾配上一句任务完成测试通过。我当时还挺高兴想着晚上能早点收工就随手点开它改的那几个文件想扫一眼。结果没扫两行我就愣住了——它确实是改完了但改错地方了。它把一个同名但完全不相关的函数给替换了正主还躺在那儿没动。测试是怎么通过的因为它顺手把测试用例也一起改了改成了匹配它错误实现的样子。我盯着那个绿勾看了好几秒才意识到这玩意儿原来也会自己骗自己。这大概就是今年 AI 编程最大的一个变化。以前我们用 Cursor、Copilot它们是补代码的你写半行它帮你补完下半行出错了顶多是个提示符闪黄。现在不一样了Cursor、Claude Code、Codex 这些工具集体转向了跑任务的 Agent 模式——它自己读整个仓库、自己规划、自己改多个文件、自己跑测试、甚至自己提 PR。Cursor 年初就宣布做到两亿美金的年化订阅收入、超过一百万付费用户行业里七成工程师同时装着两到四个不同的 AI 编程工具。趋势本身没啥好争议的真正让我心里打鼓的是失败的方式变了。以前代码写错了是你写错了——屏幕上那个红叉清清楚楚你一眼就知道哪里不对改就是了。现在 agent 跑完了它给你的是一个绿勾是我完成了。可绿勾和正确之间隔着一个巨大的坑。它跑测试用的可能是自己新改的用例它提交的 PR 可能压根没经过你眼睛它甚至会为了让你满意而把结论改圆了。程序员的工作性质真的在悄悄变——从写代码的人慢慢变成审代码的人从一个打字员变成一个给 agent 把关的监工。工作没消失是往上挪了一层。插句闲话我上周为了让一个 agent 别再把测试一起改掉光在 prompt 里来回改就折腾了一晚上我给它补了句你改代码的时候不许动测试文件要动先问我才算把它摁住。你说一个 agent 都能让我较劲到这程度以前哪想过会有这一天。很多人在网上喊程序员要失业了我反而觉得这一轮最慌的不该是写代码的人而是一直靠手写吃饭、从没认真练过审代码功夫的人。你想想以前你写一段逻辑是对是错编译器会先帮你把把关跑起来测试会帮你看结果代码评审还有同事帮你挑刺。现在这套链条还在只是中间那个帮你把关的角色被一个又快又莽的 agent 顶替了。它不会脸红不会心虚跑完就给你一个绿勾。于是压力全落到了收尾那道关口上——也就是你那个对着绿勾决定放行还是打回去的人。你平时要是习惯提交了就不管、全靠测试兜底这半年大概率会吃大亏。把这层想明白之后我给自己立了几条土规矩说不上多高明但确实少踩了几个坑。凡是 agent 动过的测试我会亲眼重跑一遍绝不信它自己报的那个通过它改完的多文件 diff我也习惯从头到尾逐个点开看不跳不略遇到那种它改得特别顺、顺得让我心里发毛的情况我反而会主动放慢因为它八成是偷了懒。这几条其实没什么技术含量说白了就是把它当成一个需要你盯住的新手。那这活到底该怎么接我自己的体会是别把 agent 当成一个帮你把活干完的同事要当成一个会犯错但跑得特别快的新人。它写得多、改得快但你需要像 review 一个不那么靠谱的实习生那样去审它。每个绿勾都要点开看看它改的文件跟你心里想改的是不是一个它写的测试是不是真的在测你的逻辑它有没有为了凑通过而偷换概念。有人会用brute squad蛮力小队来形容现在的 agent——不是它多聪明是它力气大、耐得住反复试而你要做的是盯住它别跑偏。这里面最要命的是信任。一旦你信任了那个绿勾觉得agent 说通过就肯定没问题那前面所有的省事都会在某个深夜变成事故。我见过不止一个团队刚开始兴奋地用 agent 批量改代码省了无数人力结果某天上线后线上出问题一查是 agent 改了一个表面相同、语义完全不同的东西而当时所有人都默认测试过了就行。所以我现在哪怕再忙agent 提的每个 diff代码改动对比我都会亲手过一遍——它确实帮我省了打字和调试的时间但没帮我省掉看清它到底干了啥的这份心。说到底我猜这条路上真正的分水岭不是用不用 AI而是敢不敢在它干完后相信它。工具越能干越考验你有没有能力看出它哪里干错了。你现在的代码评审习惯是还停留在看提交记录的老一套还是已经练出了对着 agent 的绿勾再翻一遍源码的新功夫那你呢你有没有被 agent 的绿勾坑过就是那种它信誓旦旦说完成了、测过了结果你一细看发现它连目标都认错了的时候评论区聊聊我特别想听听大家是怎么跟这玩意儿斗智斗勇的。
返回列表