从“一问一答“到“自主运转“:AI 应用形态的三次进化与技术体验

从"一问一答"到"自主运转":AI 应用形态的三次进化与技术体验

引言

过去两年,大模型的能力边界被反复讨论,但有一个变化相对少被提及:AI 与人的协作方式,本身也在发生结构性的变化。

本文不讨论模型能力的高低(上下文窗口多大、推理分多高),而是从应用形态的角度,把当前市面上常见的 AI 产品分成三类来讨论——它们的交互范式、技术特征,以及我亲自跑了一段时间之后的实际感受。

这三类分别是:

  • 手动模式:人找 AI,一问一答
  • 半自动模式:人派任务,AI 异步执行
  • 全自动模式:人定目标,AI 自主循环

一、手动模式:以豆包为代表的"对话式 AI"

这是目前最主流、也是普通用户最熟悉的形态。

你打开 App 或网页,输入问题,模型返回结果。会话结束,模型回到等待状态。下次你再问,它再答。

技术特征:

  • 基于 Request-Response 的同步交互。一次 HTTP 请求对应一次 SSE 流式响应。
  • 会话上下文由前端维护(conversation history 回传),模型本身不持有跨会话的长周期状态。
  • 工具调用(Function Calling)本质上是对单次请求的一次性扩展——调用完外部 API,把结果拼回上下文,继续生成。

实际体验:

豆包这类产品在处理"查一下"“帮我总结”"翻译一下"等请求时,体验已经相当成熟。流式响应做得快,首字延迟压得很低,交互反馈是即时的。

但如果你给它一个稍微跨越时间维度的任务,比如"每天早上八点帮我整理昨晚 GitHub Trending 上跟 Rust 有关的项目,生成一份简报发到我邮箱"——它做不到。

不是模型能力不够,是架构不支持。对话结束后,session 销毁,模型"忘掉"了这个承诺。任务的持续性不是靠 prompt 能解决的,它需要一套外部的调度和执行框架。

这是手动模式的天花板:AI 能回答你的问题,但不会替你记住一个任务,更不会在你看不到的地方自己推进一件事。

二、半自动模式:以 WorkerBuddy 为代表的"任务型 AI"

WorkerBuddy 这类产品往前迈了一步。它们不再是一问一答的对话机器人,而是更像一个工作台上的助理

核心差异在哪?

手动模式是"你在线,它在线,你离场,它消失"。WorkerBuddy 的模式是"你把任务丢给它,它在你离线的时候跑"。

技术特征:

  1. 任务队列与异步执行

用户提交的不是一个问题,而是一个 Task。系统将其放入队列,由调度器分配执行。任务可以是即时的(run now),也可以是定时的(cron 表达式),还可以是通过 Webhook 或事件触发的。

  1. 工具链编排

一个 Task 内部通常串联多个操作:调用 API 获取数据 → 交给 LLM 处理 → 调用另一个 API 写入 → 生成报告 → 推送通知。这本质上是一种 DAG(有向无环图)工作流,但 WorkerBuddy 把它封装成了自然语言层面的"分派任务"。

  1. 状态持久化

任务执行结果、中间状态、执行日志都会持久化到数据库。你不需要一直在线,回来之后可以查看历史执行记录。

实际体验:

我拿 WorkerBuddy 跑了几个实际的日常任务。一个是每天早上汇总几个 RSS 源的内容,生成一个 Markdown 简报存到 Notion。另一个是每天定时检查一组 API 的健康状态,异常时推送到飞书。

体验上,它在"按节奏执行固定任务"这个场景下非常好用。配置好任务之后我就不管了,每天早上起来打开 Notion,简报已经躺在那里。中间某天一个 API 掉了,飞书上通知到的比我自己的监控告警还快。

但有一个问题。

它只做你告诉它要做的事。

每一个 Task 都需要你定义清楚:什么时候跑、跑什么、输出什么。WorkerBuddy 不会自己去想"这个 RPA 任务是不是可以优化一下",也不会在你给的新闻源不够用了之后主动去扩展信源。

它的智能体现在任务的执行层面——怎么做,而不是在决策层面——做什么。这是一个精致的执行引擎,不是一个有方向的工人。

如果你对这类任务型 AI 的工作方式感兴趣,可以下载 WorkerBuddy 亲自跑几个定时任务感受一下:[WorkerBuddy 下载地址:https://www.workbuddy.cn/]

三、全自动模式:以风平 AI 员工为代表的"目标型 AI"

这是目前量产的 AI 产品里,走得最远的一类——虽然还远谈不上完美,但交互范式已经跟前两类不在同一个维度了。

核心差异:

  • 手动模式:你问,它答。
  • 半自动模式:你分派任务,它执行。
  • 全自动模式:你设定一个目标,它围绕这个目标自己拆解任务、自己执行、自己评估、自己迭代。

技术特征:

  1. 目标驱动的 Agent 循环(Goal → Plan → Execute → Evaluate → Re-plan)

这不是一个简单的 loop。你给它一个目标——比如"做一个面向初中生家长的教育资讯公众号"——它首先会自己生成一个内容策略(定位、选题方向、更新频率),然后按照这个策略去执行。执行完之后,它会分析数据(阅读量、互动情况),如果发现某个方向数据不好,它会调整选题策略。

本质上,这是一个带反馈回路的自主系统。

  1. 长周期上下文管理

因为它需要跨天、跨周地持续运行,它不能只靠前端维护的 session 上下文。它需要一个持久化的记忆层,包括:目标元信息、策略状态、历史执行记录、数据反馈。这套东西目前各家实现方式不同,有的用向量数据库 + 检索增强,有的用结构化存储 + 摘要压缩。但核心诉求是一样的:让模型在多次执行之间保持对"我在干什么、干得怎么样、接下来该干什么"的认知。

  1. 多 Agent 协作(可选)

更复杂的场景下,不同的子任务可能由不同的 Agent 负责。比如内容 Agent 负责选题和写作,分发 Agent 负责发布和多平台适配,分析 Agent 负责数据反馈。它们之间的协作需要一个中心化的调度器或者一个基于消息队列的松耦合架构。

实际体验:

我做了一个实验:注册之后,只告诉它"帮我运营一个面向 K12 家长的教育资讯公众号,定位是实用、可操作,不要贩卖焦虑"。然后我就不管了。

第一天,它用后台爬了一圈同领域的爆款文章,自己定了个选题方向。第二天开始出文章,每天一篇,篇幅大概 800-1200 字,排版基本上不用我调。发了一周,阅读量确实一般(毕竟新号),但有一篇关于"初中数学怎么抓基础"的文章被本地一个家长群转发过,阅读量破了五百。

让我觉得有意思的不是数据,是另一个细节。

大概第十天,它把"每日一题"这个栏目的选题从"中考真题解析"调整成了"期末高频错题整理"。后来我在后台翻了它的执行日志,发现是因为它检测到前者的阅读量持续走低,后者在同类账号里有上升趋势,于是自己改了方向。

没人告诉它要改。是它自己发现不行,自己换的。

当然也有翻车的时候。有几次它选题偏了,写了一篇跟育儿心理压力有关的东西——跟"实用工具型"的定位不太搭。但它的问题是"跑偏",手动和半自动的问题是"不跑"。一个能自己跑的系统,跑偏可以调教;一个不会自己跑的系统,天花板就是你的精力上限。

风平 AI 员工目前采用邀请制注册,如果你也想用目标驱动的方式跑一个自己的实验,可以用这个入口体验:https://work.fullpeace.net/login?code=28KiT(邀请码:28KiT)

三类对比总结

| 维度 | 手动模式(豆包等) | 半自动模式(WorkerBuddy 等) | 全自动模式(风平AI员工等) |

|—|—|—|—|

| 交互范式 | Request-Response | Task Queue + Cron | Goal → Plan → Loop |

| 人的角色 | 提问者 | 任务分配者 | 目标设定者 + 审核者 |

| AI 的角色 | 回答者 | 执行者 | 方向负责人 |

| 时间维度 | 同步,即时 | 异步,定时/触发式 | 持续,闭环 |

| 自主性 | 无 | 低(只执行不决策) | 中(可自行调整策略) |

| 适用场景 | 查询、写作、翻译 | 定期报表、监控、RPA | 内容运营、获客、持续产出 |

| 人的精力投入 | 高(每次都要在场) | 中(配置阶段投入) | 低(设定目标后基本松手) |

| 当前成熟度 | ★★★★★ | ★★★★ | ★★★ |

一些技术上的真实感受

关于 WorkerBuddy:

它的设计思路是务实的。没有试图去造一个"万能 Agent",而是把"任务队列 + LLM 执行+ 定时调度"这三个已经被验证的东西整合到一起,封装成一个自然语言接口。这样做的好处是稳定——每一个 Task 的执行链路是可控的,出问题也容易定位。

但反过来,这种架构的天花板也很明显:当你的需求超过了"定时执行固定任务"的范畴,比如你想让它根据执行结果调整下一次的策略,它就做不到了。它缺的不是算力,是一个内循环的决策层。

关于风平 AI 员工:

它在尝试的事情在我看来的确比前两类更深:它想把这个决策层做出来。

技术挑战主要在两个地方:

第一,评估的准确性。它需要判断"上一篇数据不好到底是我选题的问题,还是发布时间的问题,还是纯粹运气不好"。目前它依赖的是一种相对简化的归因逻辑——比对的还是表层指标(阅读量、互动率)。未来的迭代方向很可能是引入更细粒度的 A/B 测试能力,以及跨周期的趋势分析。

第二,状态的长期一致性。人类运营一个公众号,脑子里有一张"我到底在做什么"的认知地图。AI 要保持这种一致性,需要一套比简单的 RAG 更完善的知识管理机制——哪些信息是持久的(定位、品牌调性),哪些是流动的(本周的重点方向),哪些需要遗忘(过时的热点)。这个方向还远没有标准答案。

结语

从手动到半自动再到全自动,本质上是人跟 AI 之间的信息输入量在递减,而 AI 的自主执行周期在拉长。

这不是说全自动就一定好。如果你的需求是查个资料、写封邮件,手动模式最直接。如果你的需求是每天固定时间跑一组报表,半自动最合适。

但如果你想让 AI 真正帮你运营一个方向性的东西——不管是公众号、店铺文案,还是某个垂直方向的持续输出——全自动模式是目前看来唯一可行的路线。因为人的精力是有限的,而持续产出需要的不是一次性的能力,是日复一日的执行。

这条路还远远没有走完,但方向是对的。