Token大清算——当AI编程的账单开始逼近程序员的工资条
补贴盛宴散场之后,每一个token都要有人买单。问题是——谁?
2026年6月1日,一位Reddit用户晒出了自己的GitHub Copilot账单截图:上个月,10。这个月,**847**。
使用习惯没变。工具没变。变的只有一件事:GitHub把计费模式从"按月订阅"切换成了"按token计量"。
这张截图在程序员社区炸开的那一刻,很多人才后知后觉地意识到:过去三年,我们享受的从来不是"AI编程很便宜",而是"有人在替我们付钱"。
现在,付钱的人不想付了。
一、三脚刹车:自助餐厅同时打烊
把2026年上半年AI编程工具厂商的动作排成时间线,你会看到一场协调得近乎默契的集体转身。
GitHub先动手。4月28日,GitHub宣布从6月1日起,Copilot告别"无限畅饮",全面转向按使用量计费。新体系引入虚拟货币"GitHub AI Credits",1个Credit价值0.01美元。订阅价格表面没变——Pro还是每月10美元,含1000个Credits——但每一次交互的输入token、输出token、缓存token都要分别计价扣减。高端模型的"倍率"同步暴涨:Claude Opus 4.7从7.5倍拉到27倍,GPT-5.4从1倍涨到6倍。
GitHub首席产品官Mario Rodriguez的解释罕见地坦诚:"GitHub已经吸收了太多推理成本,当前模式不可持续。"翻译一下:我们一直在亏本请你们吃饭,现在饭钱要AA了。
更早一周,GitHub做了一件更能说明问题的事——直接暂停了Copilot Pro、Pro+和学生套餐的新用户注册。一家平台宁可不要新增用户,也要先止血。这在"用户增长压倒一切"的互联网叙事里,几乎是自残行为。
Anthropic同步收网。几乎在同一时间,Claude Code限制了Pro用户对Opus模型的访问——每月20美元想继续用旗舰模型?请额外付费。负责人Boris Cherny的说法同样直白:"订阅模式本就不是为这种使用强度设计的。"5月,Anthropic开始把部分客户从订阅制强制切换为按token计费,有小型公司客户的支出首日暴涨7倍。一位客户CEO的评论堪称年度金句:"我们创造了一个怪物。大模型公司之前一直在补贴我们的所有使用,现在他们不再补贴了。"
国内厂商跟进得更狼狈。6月1日,MiniMax发布新旗舰M3,同步把"按次计费、不限token"的Coding Plan悄悄替换成"限量不限速"的Token Plan。49元的Plus档,从"每月随便用"变成"每月6亿token封顶"。有重度用户算了笔账:过去每月消耗30-50亿token只要49元,新规则下同等用量实际成本约175元——涨幅257%。投诉海啸之下,MiniMax公开致歉,紧急推出三条补偿措施。而在这之前不久,Kimi刚刚因为同样的计费调整挨过一轮骂。
三条战线,同一个方向:把过去被平均掉、被平台吸收掉的成本,按token逐笔拆回到每一次真实使用上。
自助餐时代结束了。现在是按粒收米。
二、凶手是Agent:订阅制是怎么被吃垮的
为什么订阅制突然撑不住了?答案藏在一个词里:Agent。
订阅制的本质是"平均成本"游戏。不管你一天跑十个任务还是一周问两个问题,平台都按同一档月费收钱。高频用户多出来的成本,被低频用户摊掉,被平台自己吸收。这个模型在"聊天问答"时代运转良好——因为一个人再能问,一天也就问几十轮。
Agent把这个前提炸了。
你输入一句50个token的指令,Agent在后台开始工作:推演不同路径、启动子Agent分解任务、调用工具、读取返回结果、验证、重试。思考→调工具→读结果→再思考,一轮循环可能跑6到15遍。等任务完成,这个50 token的问题,实际消耗可能超过10万token。
而且这些token里,藏着大量普通用户根本看不见的"结构性开销":
- 推理token:带深度思考的模型不直接给答案,先在内部生成成千上万token的推理链。最终答案可能只输出一个"42",但你的账单是"推理+输出"的总和。
- 工具调用token:给模型接入工具,必须把工具的JSON schema随请求一起发过去。10个工具带完整描述,每次调用就多出3000-4000个token——无论这次有没有用到。
- 无效token:Agent走错路退回来、反复检查却不改任何东西、甚至停下来"给自己写首诗"。整个行业都在努力减少这种浪费,但短期内没戏。
- 输出溢价:输出token通常比输入贵2到6倍——生成是串行的,读取可以并行,这是物理层面的差异,不是定价策略。
OpenClaw这类爆火的自主Agent工具,7×24小时连续跑任务,等于把"一个用户"变成了"一支永不下班的施工队"。Anthropic严格限制OpenClaw用户,微软自2026年1月以来Copilot周运行成本几乎翻倍——订阅制不是被涨价杀死的,是被Agent吃死的。
最有说服力的旁证来自微软自己:6月30日起,微软取消了体验和设备部门大部分员工的Claude Code访问权限,转向自家GitHub Copilot CLI。理由只有一个——控制AI编码成本。
连给别人卖铲子的人,都开始省着用铲子了。
三、Tokenmaxxing:一场自愿的烧钱表演
如果说技术层面的浪费是无奈,那么接下来这件事就是纯粹的荒诞。
2026年,硅谷流行起一个新词:tokenmaxxing——员工拼命消耗更多token,以此证明自己"深度拥抱AI"。
Visa自豪地对外宣布,公司token使用量从2月的1万亿翻到了3月的2万亿。摩根大通和迪士尼内部设有专门的仪表盘,追踪每个员工用了多少AI额度。谁消耗得多,谁就显得更"前沿"。token用量,这个本该出现在成本控制报表里的数字,摇身一变成了绩效考核里的"AI拥抱度指标"。
登峰造极的是Meta。4月,Meta内部出现了一个叫Claudeonomics的排行榜,追踪全公司8.5万人的token消耗量,只展示前250名。
然后事情朝着所有懂KPI的人都能预测的方向狂奔:有人让Agent空跑几个小时刷量,有人一次性并发几十个用例,还有人直接写了无限循环脚本——让AI不断调用自己,一晚上刷出几十亿token。
30天内,Meta全公司烧掉60万亿token,按公开定价估算相当于9亿美元。排名第一的个人,一个月账单接近200万美元——这笔钱可以雇8个资深工程师干一整年。
这一幕似曾相识。上一次企业用"消耗量"证明先进性,还是大跃进时代的亩产卫星。当一个指标变成目标,它就不再是一个好指标——古德哈特定律在AI时代的应验速度,比任何时代都快。
而所有这些表演消耗的token,最终都会变成两张账单:一张寄给公司的CFO,一张寄给整个行业的资产负债表。
四、算不平的大账:一道让Gartner沉默的数学题
现在把镜头从个体账单拉到行业全景,你会看到这场清算真正的驱动力。
Gartner分析师估算:2024到2029年,全球AI数据中心的资本投入将达到6.3万亿美元——差不多是美国一年GDP的四分之一。为了避免资产减值,厂商需要约25%的投资回报率;如果回报低于7%,就是"对所有投资者的灾难"。
要够到7%这条最低红线,大型AI公司到2029年需要累计赚出接近7万亿美元的AI收入——平均每年2万亿。
这些钱从哪来?只能靠卖token。
问题来了。谷歌透露它每月处理约1.3千万亿个token,全行业加起来每年大概处理100到200千万亿个。而Gartner算了一下:要实现年入2万亿美元,按每token约10%的利润率,token消耗量需要在未来几年增长5万到10万倍。
5万倍。不是50%,不是5倍,是5万倍。
这已经不是"激进的增长预期",这是物理学意义上的不可能——现在的算力根本处理不了这个量级,而拼命扩建算力本身又在推高那6.3万亿的分母。更糟的是,把训练下一代模型的"天文级"间接成本算进去,每个token那10%的利润几乎被完全吞噬。
Gartner的结论冷静得可怕:市场整合几乎不可避免,每个区域最终可能只剩不超过两家大模型厂商。
这就是补贴退潮的真正原因。不是厂商变贪心了,而是投资人的耐心和数学规律同时到期了。2010年代的网约车大战至少还能靠涨价实现盈利闭环,而AI行业面对的是一个烧钱速度史无前例、回本路径依赖"5万倍增长"的赌局。
慷慨的免费额度时代必须结束——对AI实验室来说,问题从来不是"要不要变现",而是"什么时候开始、下手多重"。
五、致命一问:AI账单什么时候超过程序员的工资?
于是我们终于抵达了这场清算最锋利的那个问题。
过去大家默认"AI比人便宜",是因为真实成本被补贴和平均掉了。Copilot每月十几美元、Claude Code每月几十美元,看起来当然比一个工程师便宜。现在token逐笔计价,这笔账要重算了。
算法很简单:假设一个工程师年综合成本25万美元,折合每月约2万美元。如果一个AI工具每月花1000美元,能稳定替代5%以上的工程产出,那就是划算的。但如果一个团队每月token账单烧到几万、几十万美元,换来的却是重复尝试和无效产出——AI就比人贵了。
这不是思想实验。证据已经排着队出现:
- Uber在2026年4月就用完了全年的AI编码预算。TechCrunch以《Token账单到期了》为题报道了企业"集体变脸"的现象。
- 硅谷投资人Chamath Palihapitiya透露,他的公司已经开始给开发者设定token预算——单个Agent通过Claude API跑起来,一天就可能花掉300美元,一年就是10万美元。团队必须至少提升2倍生产力,才能覆盖"工资+AI账单"的总成本。
- All-In Podcast主持人Jason Calacanis在2月的播客里直接点破:"token成本超过员工工资的临界点,不是未来,是马上就会发生。"那些长时间跑Agent的重度开发者,其实早已越过了这个点。
- Nvidia应用深度学习副总裁Bryan Catanzaro公开承认:他的团队的算力成本已经高于员工成本。
- 2024年MIT的一项研究给出更扎心的基线:综合考虑成本和效果,77%的情况下人类完成任务比AI更优。
还有一道更宏观的算术题。如果乐观假设AI利润率10%、单位成本与人类持平,AI行业需要替代4680万个工作岗位,才能覆盖未来几年3万亿美元债务的年偿债需求。就算把雇主承担的社保、医保、办公场地全算进去,也仍需替代约3250万个岗位。
你花3万亿美元造了一台机器,结果它干每件事的成本比雇人还高——这笔账,无论从哪个方向算,都平不了。
六、成本工程:程序员的新必修课
那么,这场大清算之后,世界会变成什么样?
第一,token预算会成为新的组织制度。就像云计算时代催生了FinOps(云成本治理)岗位,Agent时代正在催生"AI成本工程"。Chamath的公司给开发者设token预算只是开始——可以预见,"这个月你的Agent烧了多少钱"会和"这个月你写了多少代码"一样,出现在越来越多的周会上。只不过这一次,指标的方向反过来了:从tokenmaxxing的"烧得多光荣",变成"烧得少才专业"。
第二,降本会成为产品竞争力本身。开源项目OpenSquilla内置了智能路由:一个跑在本地的轻量分类器,根据任务难度自动判断该调用低成本模型还是高性能模型,官方数据显示综合token成本可降低60%到80%。当模型能力趋于同质化,"同样的活谁烧的token少"会取代"谁的模型更聪明",成为下一轮竞争的主战场。
第三,"会算账"会成为程序员的核心技能。一次Agent会话会"想"多久、调用多少工具、读多少上下文,事前几乎不可预测——GitHub自己都只能提供"模糊的费用预览"。在这样的环境里,知道什么任务值得开Opus、什么任务用小模型就够、怎么设计上下文让Agent少走弯路,会直接决定一个团队的毛利率。提示词工程教你怎么让AI干活,成本工程教你怎么让AI干活时不把公司干破产。
第四,也是最微妙的一点:人的价格被重新发现了。当AI的真实成本浮出水面,"不如把程序员请回来"从一句玩笑变成了严肃的财务选项。这不是AI的失败——AI依然在该用的地方创造巨大价值——而是市场终于开始区分"AI创造的价值"和"补贴制造的幻觉"。
尾声:所有人都在等第一张真实的账单
回头看,2023到2025年的AI编程狂欢,本质上是一场由风险投资赞助的大型免费试吃活动。我们以为自己见证了"软件开发成本归零"的历史时刻,实际上只是恰好站在了补贴曲线的最高点。
现在,试吃结束,收银台亮灯。
GitHub的$847账单、Meta的200万美元月消耗、Uber提前八个月见底的预算、Gartner那道5万倍增长的数学题——它们说的是同一件事:token不是空气,是电力、芯片和数万亿美元资本开支的最终计价单位。过去它假装免费,是因为有人愿意替你付钱;未来它明码标价,是因为再也没人付得起了。
对程序员来说,这未必是坏消息。当AI的每一次调用都有价格,"人类的判断力"反而第一次有了清晰的比价对象。你的经验值多少钱?你的架构直觉值多少钱?你一眼看出Agent在瞎绕弯路、及时喊停的能力值多少钱?
在自助餐时代,这些问题没有答案,因为没人需要算账。
在按粒收米的时代,每一个问题都会有一个精确到小数点后两位的答案。
而历史反复证明:真正的价值,从来不怕被标价。怕被标价的,从来都是泡沫。