
大模型应用一上量账单就开始教做人。很多团队的 AI 项目不是死于效果而是死于月底的 token 账单。这篇聊怎么把成本从「玄学焦虑」变成可管理的工程问题。成本的三个来源第一是输入 token。每次调用塞进上下文的内容都在计费系统提示、对话历史、检索资料、工具返回。多数团队的成本大头在这里——重复的系统提示、无限增长的对话历史、全量塞入的工具输出每一项都在默默烧钱。第二是输出 token。输出通常比输入贵两到四倍。让模型输出一百行没人看的日志式内容等于主动烧钱。要求模型简洁作答、只输出结构化关键字段是立竿见影的省钱手段。第三是重试与放大。一次用户请求背后可能是三五次模型调用Agent 循环、重试、多模型交叉放大系数不核算清楚预算永远对不上。四个立竿见影的降本手段一是分级模型路由简单任务分类、抽取、格式转换用小模型复杂推理才上大模型。小模型的成本是大模型的几十分之一而日常流量里简单任务占七成以上。二是缓存。相同或语义相似的问题直接返回缓存结果。客服场景的缓存命中率能到三成以上这块是纯省。三是上下文裁剪对话历史按相关性保留、旧轮次压缩成摘要、工具返回只留关键字段。这条在上一篇上下文工程里讲过它同时是效果和成本的胜负手。四是流式输出加提前终止Agent 循环里设置步数与预算上限命中即停输出用流式用户提前得到答案也能减少无效生成。把账算清楚给每个业务场景记三本账单次调用平均 token 数、日均调用量、缓存命中率。月成本 调用量 × (输入 token × 单价 输出 token × 单价) × (1 - 命中率)。有了这个公式每一次架构调整加 RAG、换模型、加缓存都能预估对账单的影响。成本工程不丢人。能用在刀刃上的预算多了你的 AI 项目才能活得久。