OpenAI 为 ChatGPT 桌面应用加入语音控制,动嘴即可调度多个智能体
2026 年 7 月 23 日(周四),OpenAI 通过官方渠道宣布,ChatGPT 桌面应用迎来一次关键更新——ChatGPT Voice 语音功能正式进入 macOS 与 Windows 桌面端,并于当日开始向全球用户分批推送。这是继 2026 年 7 月 8 日 OpenAI 发布新一代全双工语音模型家族 GPT-Live 之后,该模型首次从移动端和网页端扩展到桌面环境,并与智能体执行能力深度绑定。
此次更新的核心,在于语音不再只是"对话界面",而是升级为智能体的"编排层"。基于 GPT-Live 的全双工能力,ChatGPT Voice 可以同时聆听、说话并在应用内协调任务:用户只要开口,就能在 ChatGPT Work 与 Codex 两大场景中发起、检查和调整任务,甚至在同一条语音对话里并行驱动多个智能体分工协作——例如一边让某个智能体编写代码,一边让另一个整理资料或执行搜索,系统同步协调执行,大幅减少手动切换窗口与输入指令的需求。
在 macOS 平台上,OpenAI 还配合推出了 Appshots 功能。用户在授权后,ChatGPT Voice 可以读取当前前台窗口屏幕所显示的内容,包括图片的替代文本(alt-text),从而基于可见上下文采取行动,而不是盲目执行指令。结合计算机操作(Computer Use)能力,语音智能体能够代用户在网站上查找信息、操作本地应用程序。OpenAI 在演示视频中展示了一名开发者通过单条语音指令,要求 ChatGPT 创建新线程、发起拉取请求并定位某个漏洞的根本原因,体现了"一次口述、多步执行"的实际效果。
桌面版语音功能主要面向 Plus、Pro、Business、Edu、Enterprise 等付费订阅用户开放,免费档暂不可用。对于不在电脑前的场景,OpenAI 同步上线了远程接入能力:用户可通过 iOS 版 ChatGPT App,以远程连接的方式在 Codex 中使用 ChatGPT Voice 发出语音指令;Android 版本的类似远程访问支持则在开发中,后续推出。
这一事件的影响远超一次常规的功能迭代。对开发者群体而言,"动嘴指挥 Codex 跑任务"意味着编程流程从"键入—等待—键入"转向"口述—并行执行—口述调整",尤其适合需要高带宽倾倒上下文、边想边说的知识工作者。对整个 AI 行业而言,OpenAI 把语音从"输入方式"重新定义为"智能体编排入口",让 ChatGPT 桌面端真正具备了类似"贾维斯"式的语音管家雏形。随着 GPT-Live 模型的自然打断、实时回应等能力持续打磨,人机交互的带宽正在被重新打开,多智能体协同的工作方式也有望从开发者的尝鲜玩法,逐步走向普通办公用户的日常习惯。
总结
OpenAI 于 2026 年 7 月 23 日将 ChatGPT Voice 带入桌面应用,是 GPT-Live 全双工语音模型与智能体执行框架的首次端侧合体。它让"用语音调度多个 AI 智能体在电脑上干活"成为现实,不仅重塑了开发者与 ChatGPT Work、Codex 的交互方式,也标志着语音交互正式从"对话层"迈入"编排层"。随着 iOS 远程接入先行、Android 支持在路上,OpenAI 正加速构建一个跨设备、多智能体、自然语音驱动的桌面智能体生态。