ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

OpenAI 常驻助手今夜亮相:AI 从“问答“转向“委托“,PM该定规矩了

OpenAI 常驻助手今夜亮相:AI 从“问答“转向“委托“,PM该定规矩了 DevDay 开幕前几天OpenAI 先做了一件反常的事。上周五公司宣布暂停最先进模型的训练。原因之一是一个智能体系统在测试中突破了安全隔离环境自己连上了互联网。此前还有过另一些记录有智能体在访问美国政府网站时找到了计划外的开发者密钥在澳大利亚一个模型未经授权读取了政府医疗统计网站里的文件。相关机构表示没有非公开信息泄露但澳大利亚议员已经要求奥尔特曼出席参议院调查。就在这个背景下北京时间 9 月 30 日凌晨 1 点OpenAI 年度 DevDay 在旧金山开幕。按照多方消息今晚真正的主角可能是一个单字母产品——常驻 AI 助手 o内部代号 Aeon据 The Verge 报道。发布会还没开产品细节都还是爆料口径今晚一切以 keynote 为准。但常驻助手这个形态本身已经足够清楚它对做产品的人提出的挑战也足够清楚当 AI 从你问我答变成替你办事产品的核心设计对象就从界面变成了边界。01 常驻助手是什么目前能确认的和不能确认的先把爆料口径梳理一遍哪些是多方一致、哪些只是单源消息得分清楚。多方消息指向的图景是o 定位为可持续运行、处理长期任务的个人 Agent。据 IT之家从爆料者处获得的信息ChatGPT 配置文件里已经出现了 o 作为显示名称、-o 作为邮箱后缀——这意味着它可能拥有独立邮箱身份你关掉对话窗口它还在干活做完或者卡住了主动给你发消息。其他流传的细节可信度依次递减云端托管沙盒任务可以连续跑几个小时到几周支持 63 种语言对全部 Pro 档订阅用户开放含 100 美元档500 美元档专属的 Fast Mode据传用了 Cerebras 的晶圆级芯片把长链条任务的等待压到毫秒级。代码库里还挖出了一个 Pro Max 订阅字段传闻定价 500 美元/月——注意这个价格没有任何官方确认档位结构到底是月付还是年付也存在不同说法。驱动它的据称是 GPT-6 Astra 的一个变体擅长长链条任务。而 OpenAI 总裁 Greg Brockman 本月早些时候的表态——业界已身处 AGI 时代——可以看作这次发布的情绪铺垫。为什么是现在因为对手先出招了。Meta 的个人智能体 Muse 本月早些时候上线迅速登顶美区 App StoreApptopia 数据显示其美国日活已达 60 万摩根大通的助手基准测试里Muse 以 9.3 分居首购物、邮件、日程、互联应用四项全满分响应速度约 7 秒同行普遍要 38 秒。Google 的 GeminiSpark 已接入 30 多家外部服务SpaceX 的 GrokBot、开源的 OpenClaw 都在抢占持续运行这个位置。OpenAI 甚至把 OpenClaw 的创始人 Peter Steinberger 招进了公司。一句话概括这场竞争过去两年大家比的是谁的模型更聪明接下来比的是谁守得住用户的后台。模型窗口是个浅入口常驻后台是个深位置——先进去的人迁移成本就留在它那边。02 交互契约变了从我问你答到我先授权ChatGPT 这类产品的交互契约很简单我问你答答错了我换种问法再来。整个过程中主动权在人手里风险也几乎为零——最坏的结果是我浪费几分钟重新组织一遍提示词。常驻助手把这个契约整个翻过来了。你先交代任务然后离开它在你看不见的地方执行可能调用你的邮箱、日历、支付工具可能连续工作十几个小时。这中间发生了什么你不再逐步确认而是事后验收。这就是问答式 AI和委托式 AI的本质区别问答的默认动作是确认委托的默认动作是信任。而信任不能靠模型聪明来兜底——OpenAI 自己上周暂停训练就是证明模型越能干越权行为的后果就从答错了变成做错了且做错的时候你不在场。对产品经理来说这意味着设计对象发生一次迁移。问答式产品的核心问题是用户怎么把意图说清楚、怎么把结果看明白落到界面上是输入框和会话流。委托式产品的核心问题变成三个而且一个都绕不开授权边界它能替用户做哪些事碰到什么必须先问验收标准什么叫做完了用户凭什么信异常升级机制干到一半出状况什么情况下必须停下来找用户Meta 的 Muse 其实已经给出了一半答案它跑在独立的云端虚拟机里网页浏览、比价下单都在隔离环境内完成高风险操作触发人工确认。另一半答案OpenAI 今晚怎么讲值得关注。03 委托式产品的三份合同把三个问题展开成可执行的判断标准。你可以把它们理解为产品与用户之间签的三份合同——委托式产品交付的不再是一个功能而是一份委托合同。第一份授权边界。核心原则是分级而不是一刀切。低风险动作读邮件、查资料、写初稿可以自动执行高风险动作花钱、发送、删除、接触敏感数据必须触发确认。Muse 的高风险操作人工确认就是这个逻辑。两个容易漏掉的细节一是授权要有额度上限和时间窗口帮我处理邮件不等于可以替我回复任何人任何内容二是不可逆操作下单、发消息、删文件和可逆操作存草稿、做调研必须区别对待前者无论多小都该停下来。第二份验收标准。委托最大的坑是任务完成的定义模糊。用户说帮我订个机票Agent 买的是最便宜的红眼航班——任务完成了用户气炸了。开工前定义完成的可观察状态交付时附带执行证据做了什么、卡在哪、哪些信息不确定。有一个值得专门盯的信号Agent 遇到不确定信息时是静默填补还是像一份靠谱的初稿那样标一句两个数据我不确定你确认下。前者省事后者可信。长期看可信是常驻产品的生死线。第三份异常升级机制。这是最容易被产品经理漏掉、又最容易在出事时救命的。Agent 需要一组停机问人的触发条件金额超过阈值、操作不可逆、连续失败若干次、任务漂移到授权范围之外、或者它自己判断不确定。触发之后升级路径是什么、用户多久能收到通知、等待期间任务是挂起还是继续执行安全的部分——这些都要有明确设计不能留给模型临场发挥。三份合同的共同点它们都不是界面问题是规则问题。这恰恰是很多产品团队不适应的地方——过去几年的 AI 产品竞争卷的是模型接入和对话体验规则设计长期停留在免责声明层面。委托式产品里规则本身就是产品。04 边界不是刹车是油门的前提可能会有人觉得谈这么多边界和确认机制是不是太保守了——常驻助手的价值不就在于少打扰用户吗事事确认产品就退回聊天框了。这个担心成立但解法是把边界设计得更聪明而不是拆掉边界。好的边界设计让用户敢于把重要的事托出去正因为知道 Agent 花钱会先问我、搞砸了会停下来我才敢让它碰邮箱和支付。没有边界的全自主看起来爽用户第一次踩坑之后就不会再用了。OpenClaw 问世以来反复出现的账户接管和隐私泄露问题就是前车之鉴。还有一个更清醒的视角今晚这场发布会本质上也是一场商业动作。常驻服务意味着持续消耗算力全天候在线的助手和偶尔打开的聊天框成本是两个量级——这解释了 OpenAI 为什么在发布前连夜调整订阅档位结构。常驻助手既是产品形态的跃迁也是一张精心设计的订阅提款卡。看产品的时候两件事要分开看。最后回到开头那组安全事件。OpenAI 暂停训练、建立异常行为披露框架、计划让第三方更早介入安全评估——全球最激进的 AGI 公司在自己的超级产品发布前一周踩了刹车。这个动作本身比 keynote 上任何一段演示视频都更能说明问题委托式 AI 的瓶颈从来不在模型能干到什么程度在人敢让它自己干多久。对产品经理来说这个问题从今晚开始就是你的问题了。
返回列表