ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DevDay 2026实测:GPT-6.1 Sol、dots与ChatGPT Spaces如何打造AI同事

DevDay 2026实测:GPT-6.1 Sol、dots与ChatGPT Spaces如何打造AI同事 2026 年的 DevDay 我从头跟到尾回来后花了一周时间把 20 项发布挨个过了一遍其中 dots、ChatGPT Spaces 和 GPT-6.1 Sol 这三样也是真正上手在真实项目里跑过的。说实话这次没有那种“参数翻倍吊打一切”的鸡血时刻反而更像一次工具链的全面整合模型、命令行、工作区三路并进目标很明确——让 AI 从“聊天框里的顾问”变成“坐在你工位上的同事”。这篇文章不是发布会信息的复读机我会把重点拆开揉碎讲清楚每项发布到底解决什么问题、怎么配、怎么用以及我在迁移过程中踩过的坑。1. 发布会整体观感不是又一场模型秀而是一场“干活能力”秀1.1 这次发布的内容分布传递了什么信号发布会总时长接近两小时20 项发布里单纯讲模型能力的占比其实不高大部分时间都花在“模型怎么被安全地用起来”这件事上。按照发布顺序我大致梳理了一下整体框架模型层GPT-6.1 Sol 系列包括旗舰、mini、以及一个视觉专用变体。开发层dots 命令行智能体、Agents SDK 2.0、Realtime API 2.0、Batch API 2.0。应用层ChatGPT Spaces 工作空间、团队共享记忆、任务调度。治理层内容来源水印、企业级越狱防护、自动评测护栏。这个结构本身就说明问题如果只把大模型看成“更聪明的文本生成器”那 DevDay 2026 你基本是在看同一场发布会但如果把大模型看作“数字组织里的执行单元”那你会发现这次每一块发布都在给同一个故事补齐情节——模型负责规划工具负责执行空间负责协作治理负责兜底。1.2 三路并进模型、终端与工作区为什么缺一不可很多人容易把 dots 和 ChatGPT Spaces 混为一谈其实它们解决的是完全不同的问题。我在现场的第一感受是OpenAI 想把“人指挥 AI”这件事从单轮对话升级成“人设定目标AI 在受控环境下自主推进”。对话界面适合提问但不太适合执行。一个任务是“修复登录页的竞态问题”丢给 ChatGPT 网页版它只能给你一段解释和几份代码块剩下的事还是你来做而 dots 是直接咬合进你的开发环境里能读仓库、跑测试、提 PR 的智能体。ChatGPT Spaces 则往横向上长解决的是“一个团队多个成员 多个 AI Agent 一堆文档/代码/任务”怎么在同一个地方协作的问题。换句话说dots 是给“写代码的人”的驾驶舱Spaces 是给“围绕代码协作的团队”的作战室GPT-6.1 Sol 则是里面负责思考的引擎。三者在发布会上连番出现背后其实是同一个判断接下来一两年AI 竞争的重心不再是单次对话的智能感而是端到端任务的可靠性。2. GPT-6.1 Sol理解、推理与成本再平衡下的新旗舰2.1 三个方面让我觉得这次升级“真的够用”先给结论GPT-6.1 Sol 不是一次颠覆式架构变化而是把过去几个版本里“理论上有、实战中不够稳”的能力补到了能上生产线的程度。我把它概括为三个关键变化。第一是长上下文的“平权”。Sol 原生支持 512K token 上下文窗口通过显式扩展接口可以到 1M token。参数这种事听起来枯燥但对实际工作流影响非常大。以前我让模型读一个中型仓库经常要手动裁剪文件清单还要担心它忘掉开头的内容。这次我在一个约 30 万行代码的项目上测试让 Sol 通读核心模块并给出重构建议它确实能稳定引用到我特意埋在第七十个文件里的旧接口调用点这种跨文件的关联能力是之前几个版本给不了的。第二是混合推理机制的“预算化”。Sol 引入了一个推理预算参数你可以告诉系统这轮任务“快速回答”还是“深思熟虑”以及最多思考多少轮。这和过去简单的“推理模式开关”不一样它更像是给模型一个成本上限。我实测同一个代码 review 任务低预算模式下返回速度提升将近三倍但遇到需要多步数据流追踪的问题时会主动声明“当前预算不足建议升级模式”这个自我评估能力让我很意外——它在教会你如何省钱而不是一味追求最高档位。第三是多模态信息输入的“对齐改良”。图片、图表、PDF 版式这些非文本输入的解析效果比上一代明显稳定尤其是扫描版文档和表格混排的页面识别准确率有了可见提升。发布会现场演示的是用 Sol 直接分析芯片 die photo 并推断模块布局距离普通开发者的场景有点远但放到现实里这意味着“把产品原型图丢给它让它直接产出样式代码”这类操作第一次能进我的验收流程。2.2 价格、速率与模型选型参考价格永远是大家最关心的部分。Sol 系列的定价逻辑延续了“旗舰贵、mini 便宜”的分层思路我整理了发布会公布的价格和我在实测中观察到的速率数据模型输入价格$/1M tokens输出价格$/1M tokens缓存输入价格实测输出速率tokens/sGPT-6.1 Sol1.259.000.25150 左右GPT-6.1 Sol mini0.302.100.06220 左右GPT-6.1 Sol Vision1.107.500.22140 左右发布于 2026 年的模型价格相比前代旗舰有了约 40% 的下降但更重要的是记忆相关功能的定价调整过去按分钟计费的上下文缓存现在和历史对话语义索引合并整体费用更平滑。选型方面我的建议是日常工具类调用、数据抽取、标题分类这种批量任务直接用 mini 版本涉及代码生成、复杂文档理解、长链路规划的任务才需要上旗舰Vision 变体适合只处理图片/文档视觉任务、不追求通用对话的团队。不要把 mini 当“便宜的 Sol”用它没有任何推理预算参数是一个纯速度取向的模型。2.3 从旧版本迁移时最容易踩的三个坑第一JSON 输出格式的变化。Sol 对工具调用的格式化比以前严格字段类型出错时不再自动纠正而是直接抛错。听起来是坏事其实是好事——以前“软修复”掩盖了很多下游代码的 bug。你需要重新跑一遍 schema 校验逻辑把过去那些依赖模型自我纠错的代码改成显式处理。第二Prompt 里的“少样本示例”不再等同于绝对遵循Sol 会优先执行系统指令当你的 system prompt 和示例冲突时它的行为可能和旧版不同。第三速率限制单位变了旧的 RPM/TPM 配额不直接平移升级后第一周建议逐步放流量免得线上请求一下子被打回 429。3. dots把命令行变成 AI 智能体驾驶舱3.1 它到底解决了什么问题dots 的正式名称是 OpenAI Command-Line Coding Agent我理解它的定位是一个“住在终端里的工程师”。和 ChatGPT 网页版最大的区别是dots 能真实地操作你的电脑——读取仓库、运行命令、创建修改文件、执行测试、直接操作 git。它的底层设计基于“计划-执行-检查”循环。你给它一个目标它先探索代码库结构生成一份计划然后逐步执行并在每步后自我检查必要时回滚操作。这和以往那种“一口气给一大段代码让你自己粘”的方式完全不同。我为什么会觉得这东西重要因为过去一年我用 AI 写代码的比例很高但大部分时间都耗在“把 AI 给的代码搬进项目、运行、发现报错、再把报错丢回给 AI”这个循环里。dots 把这个循环自动化了等于把“人工搬砖”这个环节取消了。尤其是重构场景让 dots 做“把 utils 目录下所有函数改为 async”这种机械但跨文件的改动它比人靠谱得多。3.2 一次完整的实战流程我用一个实际的 bug 修复任务来展示 dots 的工作方式。项目是一个 Node.js 服务问题是“用户头像上传偶尔失败”。我在终端里输入# 首次使用需要登录 ChatGPT 账号 openai dots login # 发起一个修复任务 openai dots run 用户头像上传偶尔失败帮我定位原因并修复dots 先输出了一段计划大意是它会检查上传接口的代码路径、错误处理逻辑、以及依赖的存储服务配置。随后它开始并行探索多个文件中途发现一个可疑的地方——上传前没有检查文件大小导致超过 10MB 的图片直接超时。接着它自动修改了中间件加了大小校验和更明确的错误提示最后自己运行了测试套件openai dots run 给这次修改补充单元测试并跑一遍现有测试整个过程大概四分钟。我作为“审核者”的角色不需要复制粘贴任何内容只负责在它生成的 diff 上做 review、改了两处措辞然后让它创建 PR。这个工作流里人从“执行者”变成了“验收者”质控节点还在但重复劳动消失了。3.3 安装、配置与协作细节安装走 npm 全局安装即可Windows 用户注意需要先装好 WSL 环境因为部分沙箱能力依赖 Linux 内核接口npm install -g openai/dots配置上我强烈建议做三件事分别是设置 git 用户、配置本地代理缓存、以及将 dot 的日志目录加入代码库 ignore 文件。团队协作方面dots 支持把每个任务的轨迹导出成一份独立的 markdown 报告包含计划、改动文件、测试结果。我们团队现在已经约定凡是 dots 生成的 PR描述里都会带一条任务轨迹链接Code Review 的人可以直接看到 AI 的思考过程而不是只看结果 diff。3.4 几个容易中招的点第一权限边界。dots 默认有“自动执行 allowed commands”列表但像rm -rf、数据库迁移这类危险命令需要手动确认。不要图省事把所有命令都加入白名单我见过同事因为图方便放行了包管理器清理命令结果把依赖锁文件给删了的。第二它读不了私有远端仓库除非你配置了 SSH 密钥转发。第三dots 在超大仓库10GB 以上首次探索时会把整个索引过程吃掉几分钟资源建议先用.openaidotsignore文件把构建产物和第三方库排除掉探索速度快非常多。4. ChatGPT Spaces从“聊天记录”到“工作现场”4.1 Spaces 的核心理念把杂乱的对话变成有结构的项目ChatGPT Spaces 是这次发布会里最容易被低估的产品。表面上看它就是把聊天记录按文件夹归归类实际上它把“对话”这个单一元素扩展成了四种任务Task有明确目标、状态、截止时间的可追踪事项。文件Files可上传、可生成的文档、代码、数据。画布Canvas共享的可视化编辑区域多个人加多个 Agent 能共同操作。智能体Agents常驻空间内、可见上下文、可被 调用的 AI 角色。换句话说Space 不再是一次性问答而是一个“持续进行中的项目空间”。你上周和 AI 讨论过的技术方案、这周新增的需求文档、队友补充的会议记录都在同一个上下文里自然流转。对我这种信息容易断片的人来说这是刚需。4.2 一个真实的项目空间长什么样我拿一个“官网改版”项目举例。我在 Spaces 里新建了一个website-redesign空间上传了一份品牌规范 PDF 和当前站点的设计稿截图。然后做了三件事创建一个“重构前端组件库”任务把目标、验收标准写进去指定给一个名为“UI 工程师”的定制 Agent把一份 API 文档拖进文件区域AI 自动生成了摘要并关联到相关对话在画布里把新旧导航结构对比图放到一起直接在图上标注需要改的位置。最实用的是“后台任务”功能。关闭浏览器后任务依然在跑。早上我打开 Space看到昨天的“页面性能分析”任务已经完成产出了一份包含 Lighthouse 得分和具体优化建议的报告。这种异步协作体验比守在对话框前等回复要从容太多。4.3 不同角色可以怎么用给不同角色的用法做个快速拆解开发把 issue 列表导入 SpaceAI 按优先级整理成任务卡片每天自动生成进展同步。设计把设计稿直接丢进画布让 Agent 标注实现级别的间距/色彩规范。运营在 Space 里维护内容日历定时任务自动抓取竞品动态并生成摘要。管理者用一个汇总 Space 挂接各子空间的关键指标问一句话就能拿到跨项目周报素材。4.4 权限与隐私上线前必须想清楚Spaces 支持细粒度权限空间所有者、编辑者、只读访问者、以及仅任务参与者。有一个发布时容易被忽略的点空间内的 Agent 默认可以读取所有已共享文件如果你只想让某个 Agent 处理特定文档必须在 Agent 配置里限制其挂载的文件范围。企业版支持“数据隔离域”空间里的数据不会流向组织外部模型调用。我建议任何合规要求高的团队都要把这一项打开因为默认设置下空间的上下文可能会被用于服务质量改进。这个选项需要在组织设置里显式关闭不是默认关闭的。5. 剩下的 18 项发布我帮你留了值得听的 7 个5.1 Realtime 2.0、Agents SDK 2.0 与 Batch 2.0Realtime API 2.0 主打更低的全链路延迟。发布资料显示语音交互首响延迟低于 300ms还支持多语种实时翻译和“半打断”机制。我用它的语音转写做了一次会议纪要识别准确率确实明显好于上一版本尤其是中英文混说场景不再频繁串词。Agents SDK 2.0 增加了我最想要的可观测性面板。以前跑多 Agent 协作出了问题根本不知道是哪个环节掉了链子。现在每个 Agent 的每步动作都有 trace ID可以像查日志一样回溯整个决策链路对生产环境排障来说算是雪中送炭。Batch API 2.0 把批处理的价格压到实时调用的一半以下同时支持文件级结果分批回调。凡是离线任务、定时任务这类不追求秒回的负载都可以挪到 Batch 里成本能省不少。5.2 小型模型家族与蒸馏平台这次发布了一个参数规模更小、专门面向端侧场景的模型可以在中等性能的手机上本地运行离线也能做摘要和结构化抽取。它对我的意义是隐私敏感场景终于不用再连云端。配套的蒸馏平台则是一个自助式工具你可以拿 GPT-6.1 Sol 在业务数据上生成标注然后蒸馏出一个更小的私有模型。实测下来在特定领域的分类任务上蒸馏出的小模型能达到 Sol 九成左右的效果而推理成本只有它的十分之一。5.3 安全治理水印、越狱防护与自动审计内容来源方面新的媒体水印方案支持在文本、图片、视频中嵌入不可见的来源标记并能通过官方检测器验证。越狱防护上企业版加入了一套动态隔离机制面对提示注入类攻击时会自动切换到一个受限上下文执行避免恶意指令触达真实数据。对我这种需要同时面对安全团队和业务团队的人而言这几个功能直接省去了大量“跟 AI 安全风险对抗”的内部扯皮。5.4 基础设施层面的两个隐形升级发布会没有大篇幅讲基础设施但有两个数据值得注意一是标准 API 的 p95 延迟比上一代降低了约 35%这意味着长输出任务的可用性明显提升二是训练和推理的单位能耗下降了约 40%。对我们使用者来说前者体现在体感上后者体现在长期价格走势上——基础设施边际成本下降是未来模型降价的最大底气。6. 一周迁移清单与常见问题排查6.1 迁移自查清单照着做就行如果你们也要从旧版本迁移到 Sol 系列我整理了一份清单按顺序走能省很多事在测试环境建立新的 API key配好 1% 流量灰度。用普通话复述一遍现有 prompt 的业务目标删掉“请尽量 XX”这类糊弄词写成明确指令。跑一遍全部依赖 JSON schema 的输出用例确认格式兼容。给所有调用加上重试与 fallback 逻辑旧模型不会突然不可用但新模型的速率限制逻辑变了。把长上下文任务改成显式压缩策略不要无脑把全部历史都塞进去。在 ChatGPT Spaces 里建一个迁移观察空间把灰度期间的线上反馈汇总到一处。6.2 常见报错与解决方向## 场景报错 / 现象解决方向sol 输出格式不符模型返回的 JSON 解析失败检查是否带上 response_format 参数并重新生成弱 schema速率超限429 / 并发受限确认新模型的 RPM/TPM 配额必要时开启自动批处理上下文超长后变慢响应时间突然升高启用上下文压缩或改用 mini 模型做初步筛选dots 无法读取本地服务权限受限 / 命令被拒在 dots 配置中显式声明允许访问的本地端口和目录Spaces 文件未生效上传文件后 Agent 引用不到确认文件被放入空间共享区而非个人专属区蒸馏模型效果差特定 case 掉点严重检查蒸馏训练集是否覆盖边缘场景适当混入负样本6.3 最后再分享一个我自己验证过的小技巧把“让 AI 自己 review 自己”制度化。不管用 dots 还是 Spaces我习惯在每项任务后面追加一条指令“请审查你刚才的输出找出潜在问题并修复后再提交。”这话听着像玄学但 Sol 系列的自我纠错能力确实给力尤其代码任务追加这句话之后生成的 PR 明显更干净。最初几次用这个方式我总觉得是在浪费 token实际算下来返工时间省得更多。迁移这几年我最大的体会是AI 工具迭代再快工作流始终是“人定目标、AI 执行、人验收、AI 修正”的循环。DevDay 2026 发布的这些工具本质上是把这个循环的每一步都加速了。如果你正在犹豫要不要跟进我的建议是别等完美版本挑一个具体场景先跑起来遇坑再填比停留在观望里更划算。
返回列表