
本期编辑三水 鲍勃AMD 将以约 82 亿美元收购世界模型公司 World Labs李飞飞将出任 AMD 执行副总裁兼首席科学家。当世界模型开始理解空间、持续模拟环境并实时响应人的输入AI 生成的就不再只是一段内容而可能是一个可以进入、探索和交互的世界。这也是 RTE 开发者社区最近一直在关注的一条路线从实时视频生成、空间智能、交互式视频到可交互世界模型视频正在从「生成出来给人看」继续走向「跟人实时互动」。所以今年iRTE 2026 实时智能大会专门设置了「视频 AI 技术专场从实时视频生成到可交互世界模型」。现场生数科技 Vidu团队会从 SageAttention、Vidu S1/S2 出发聊视频生成如何进一步走向实时Xmax AI也会带来实时交互模型的探索讨论当生成内容可以持续响应用户之后会出现怎样的新娱乐和交互形态。从World Labs 的可交互 3D 世界到Vidu、Xmax 对实时视频与交互模型的探索这条路线正在变得越来越具体。如果你也在关注空间智能、实时视频和可交互世界10 月 24 日来现场看看这条路线已经走到哪一步。扫描下方二维码报名线上追进展这次线下聊实现。01 有话题的技术1、Amphion 与港中大深圳、清华、腾讯混元等提出音频理解自进化训练框架 EvoAudio训练数据随模型短板动态调整五个音频模型最高提升 6.3 个百分点EvoAudio 把音频模型的能力诊断、训练题生成、强化学习和验证接成一个递归训练闭环每轮先检查当前模型在 47 项音频技能上的表现再据此调整下一轮训练的题型配额和难度。候选模型只有在固定验证集上超过上一轮模型才会进入下一轮并重新决定训练数据。训练内容会跟着模型能力变化系统覆盖语音韵律、说话人与对话、语音内容、声音事件、音乐以及长音频等 6 类共 47 种任务。规划模型根据各技能的准确率、近期提升和训练情况分配下一轮训练重点并动态调整音高差、信噪比等可控难度同时保留一部分已掌握任务降低训练过程中遗忘其他能力的风险。训练题可以从音频构造过程直接得到可验证答案EvoAudio 组合 TTS、MIDI、音高变换、时间拉伸、混音等 24 种工具生成音频答案来自生成参数或原始数据标签不依赖外部大模型逐题标注。生成后还会重新测量音高、语速、响度、节奏等声学属性并过滤掉仅看文字就能回答的问题。模型更新后必须通过独立验证才能「晋级」系统使用 GRPO 训练候选模型再用固定的 2,500 道留出题与当前模型比较候选模型没有提高就被丢弃原模型继续生成新的训练课程。这样上一轮得到的模型会直接决定下一轮训练什么、练多难。研究在 Qwen2.5-Omni、Kimi-Audio、Audio Flamingo 3、MiMo-Audio 和 MiniCPM-o 4.5 上进行了 13 轮训练。在 MMSU、MMAU-Pro、MMAR 三项评测的平均成绩上五个模型分别提升1.4–6.3 个百分点其中 Qwen2.5-Omni 的 MMSU 声学感知准确率从44.5% 提升至 61.5%。在相同训练预算下Qwen2.5-Omni 使用固定训练配置的平均成绩为 62.8%使用 EvoAudio 动态课程后达到65.4%。https://jensenyx.github.io/EvoAudio.github.io/2、Voice AI 公司 Gradium 将 Jev 决策模型接入 TTS根据对话情绪与紧急程度动态匹配或生成语音风格Gradium 展示了一套上下文驱动的 Voice Agent 工作流用 TypeSafe AI 的决策模型 Jev 从用户消息中判断情绪状态和紧急程度再把这些结构化信号转换成 Voice Design 描述为 Gradium TTS 匹配已有声音缺少合适声音时则在后台生成新的声音并加入可复用的声音库。Jev 不负责决定智能体回复什么只决定这段回复应该以怎样的声音表达。声音成为对话上下文的一部分示例中 Jev 将输入判断为frustrated / neutral / enthusiastic等情绪以及relaxed / urgent两档紧急程度再结合语言、表达正式程度映射成具体的声音描述。相比固定使用一套 TTS 声音同一个客服智能体可以在普通请求、投诉或紧急问题中采用不同的表达方式。声音生成移出实时对话主链路实时路径只需要完成上下文判断、查找对应voice_id和 TTS 合成尚不存在的声音由 Voice Design 在后台生成并缓存之后直接复用避免每轮对话都重新生成声音。Gradium 此前已在 9 月 7 日开放通过文本描述创建新声音的 Voice Design这次进一步把它接入了对话上下文决策流程。Jev 可直接作为每轮对话的轻量决策层Gradium 测试中单次 Jev 请求包含网络往返耗时约240–850 ms无需针对这些分类标签单独训练模型开发者可以直接定义情绪和紧急程度等标签及描述并设置置信度阈值。https://gradium.ai/blog/voice-that-adapts-to-context3、Interspeech 2026 开放语音感知 LLM 实践教程用 Whisper Qwen3 跑通训练流程自生成数据无需 ASR 专项训练也能做到 3.93% WERInterspeech 2026 的 Spoken Language Models 教程开放了一套 Hands-on 代码演示如何把 Whisper-large-v3 编码器接入 Qwen3-4B-Instruct-2507并在加入语音能力的同时尽量保留原 LLM 的指令遵循能力。仓库提供完整数据准备、训练、评测代码以及两套约 147 MB 的 adapter LoRA checkpoint。只训练 3,670 万参数接入语音Whisper-large-v3 编码器保持冻结Qwen3-4B-Instruct-2507 主体同样冻结仅训练 1,310 万参数的语音适配器以及 Qwen3 注意力层上的 2,360 万 LoRA 参数。语音特征经过适配器后直接接入 Qwen3 的文本输入序列。自生成数据让训练目标保持在原 LLM 的输出分布中文本版 Qwen3 先读取音频转写和说话人信息为每条样本生成自然语言回复训练语音模型时再把文本描述替换成真实音频让模型学习从声音生成自己原本就会产生的回复。这样无需人工编写大量语音指令数据也减少为了适配单一语音任务而改变 LLM 原有回答方式的问题。没有做 ASR 和说话人性别专项训练也能通过提示词完成对应任务自生成版本训练过程中只学习自由形式的对话回复从未直接训练 ASR 或性别识别。在 LibriSpeech test-clean 上通过要求固定输出格式ASR 清洗后 WER 从默认提示下的 16.54% 降至3.93%说话人性别识别准确率从 81.87% 提升至98.24%。作为对照直接针对 ASR 性别任务监督微调的版本 WER 为 1.81%性别识别准确率为 98.85%。仓库同时提供 Colab、训练脚本和预训练 checkpoint可以直接复现「任务专项 SFT」和「自生成跨模态对齐」两条训练路线。https://github.com/kehanlu/interspeech-tutorial02 有亮点的产品1、OpenAI DevDay 2026 将语音接入 Dots、Codex CLI 与 Meetings可直接通话智能体、语音控制编程任务并生成会议后续行动OpenAI 在 DevDay 2026 将语音进一步接入智能体和工作流产品长期运行的智能体 Dots 支持直接语音通话Codex CLI 可以通过语音启动和引导编程任务新的 Meetings 插件则从麦克风与 Mac 系统音频生成会议记录、摘要和后续行动。Dots 可以直接进行语音通话Dots 是由 GPT-6 Astra 驱动的常驻智能体拥有自己的云电脑、浏览器和已连接应用可以持续处理多个任务。除了通过 ChatGPT、Slack 和 Teams 与它交互用户也可以直接与 Dot 发起语音通话在对话过程中继续给反馈或讨论任务。Codex CLI 新增语音控制更新后的 Codex CLI 支持通过语音启动和引导任务开发者可以在编码过程中直接用语音下达任务或调整正在执行的工作。新增 Meetings 插件把会议音频直接接入后续工作流Meetings 插件同时读取 Mac 的麦克风和系统音频生成会议记录并将个性化摘要和行动项保存到 ChatGPT Space。它还可以结合 ChatGPT Work 和已连接应用中的上下文生成后续任务用户审核后可继续让 ChatGPT 更新项目计划或起草跟进邮件笔记生成完成后原始音频会被删除且无法回放。https://openai.com/index/devday-2026-recap/https://openai.com/index/introducing-dots/https://help.openai.com/en/articles/20001546-the-meetings-plugin-in-chatgpt2、多模态记忆基础设施公司 Memories.ai 推出本地 AI 记忆工具 LUCI Desktop让 Claude Code、Cursor 和 Codex 直接查询跨应用屏幕与会议历史LUCI Desktop 将用户在电脑上看到的屏幕内容和会议语音持续整理成一份本地可搜索的历史记录并通过 Agent Skills 提供给 Claude Code、Cursor、Codex 等智能体对于不支持 Skills 的智能体也可以通过 MCP 接入。这样智能体在执行任务时可以直接检索此前浏览过的网页、PDF、桌面应用内容以及会议中的讨论和决定而不需要用户重新复制上下文。跨应用屏幕历史成为智能体可调用的上下文LUCI 不依赖每个应用单独提供连接器而是从电脑屏幕和会议记录建立统一历史。接入后的智能体可以按关键词或语义搜索过去看到的内容、听到的对话并限定应用或时间范围还能取回对应时刻的截图。Skills 是默认接入方式MCP 作为兼容路径LUCI 可以直接向 Claude Code、Cursor 和 Codex 安装官方 SkillsSkill 本身不保存记忆而是调用设备上的本地命令读取正在运行的 LUCI。其他无法加载 Skills 的智能体可以通过 MCP 访问同一份记忆。捕获、理解和存储主要留在设备端LUCI 在 Mac 和 Windows 上运行屏幕记录、会议转写和记忆数据保存在本机并静态加密只有智能体实际检索出的片段才会进入对应的智能体会话。https://luci.memories.ai/computer-history-for-ai-agents3、抵押贷款 Voice AI 公司 Sela 累计融资 2100 万美元语音智能体每月参与促成超 10 亿美元新增房贷Sela 宣布种子轮和 A 轮累计融资2100 万美元由 Costanoa 领投Emergence Capital 参投。公司专门为抵押贷款销售部署语音智能体用于回答借款人问题、介绍贷款方案并在需要时转接贷款专员Sela 称目前这些智能体每月参与促成超过10 亿美元的新抵押贷款。公司成立 18 个月后年化收入已超过1000 万美元美国十大独立抵押贷款银行中已有6 家使用其产品。在一项覆盖超过 1 万名潜在借款人的 A/B 测试中其语音智能体将 lead-to-lock 转化率提高了9%公司计划利用新资金扩充团队并把智能体覆盖范围进一步延伸到消费者贷款流程。以上业务及测试数据均来自 Sela 公布的信息。( PR Newswire)4、临床 AI 公司 Heidi 获 3.4 亿美元新资金并发布 Heidi II从自动病历记录扩展到可执行临床行政任务Heidi 先宣布获得3.4 亿美元新资金包括 Blackbird 领投的 1 亿美元 C 轮融资和 General Catalyst Customer Value Fund 提供的 2.4 亿美元增长投资随后发布新一代临床 AI 平台Heidi II。Heidi 此前主要通过 Scribe 监听医患交流并生成病历目前产品线已经扩展至临床证据检索工具 Evidence、可穿戴录音设备 Remote 和语音转文字功能 Dictate。Agents 从「生成记录」进一步走向执行任务医生可以直接用自然语言要求 Heidi 完成就诊前病历准备、追踪检查结果、填写转诊表等工作。Agent 会自行规划并跨电子病历、日历、邮箱等系统执行完成后再把需要临床判断的部分交回医生审核常用任务还可以保存为定时运行的 Routines。Memory 会持续学习医生的工作习惯Heidi II 可以从医生明确告诉它的偏好以及后续修改中学习病历格式、表达习惯和工作规则让之后的生成和执行结果适配个人或机构的工作方式。临床证据也被接入同一工作流Heidi II 可以结合患者上下文检索 NEJM、Wiley、Cochrane 等来源的同行评审研究并在回答中提供引用Scribe、Evidence、Dictate 等原有能力继续保留在同一平台中。目前平台每周支持约280 万次患者就诊。Heidi II 已于 9 月 29 日开始推出英文版本现阶段不在英国和欧盟提供这些新能力。https://www.heidihealth.com/blog/series-c5、YouTube 将说话声检测接入 AI 肖像保护结合面部与声音识别创作者被仿冒的内容YouTube 宣布将在今年晚些时候把说话声检测speaking voice detection接入现有的 likeness detection 系统与面部检测共同判断视频是否在使用 AI 模仿创作者。现有系统主要识别未经授权使用创作者面部形象的 AI 内容这次开始把「声音是否像本人」也纳入匹配信号。从只看脸扩展到「脸 声音」联合匹配YouTube 表示将说话声检测与面部检测结合后可以提高整体匹配准确率并为之后更广泛的声音保护能力打基础。目前官方尚未披露语音检测模型、支持语言或单独针对纯语音克隆内容的具体处理规则。创作者可以继续通过 AI 肖像与身份仿冒检测处理匹配结果YouTube 的 AI 肖像与身份仿冒检测已用于发现包含本人 AI 合成形象的视频并支持用户查看匹配结果和申请移除这项能力也将进入 YouTube 移动端方便创作者直接完成注册、查看和处理。https://blog.youtube/news-and-events/made-on-youtube-new-tools-power-creation-journey/03 有态度的观点1、Instinct 创始人AI 助手影响用户购买不想要的商品将是「非常危险的世界」据《商业内幕》报道AI 助手 Instinct 创始人 Noah Shinn 表示如果 AI 智能体利用自身能力影响用户购买他们并不想要的商品或服务将会是「非常危险的世界」。他称Instinct 不希望通过商业化影响用户行为使其偏离自身意愿。如果 Instinct 影响用户去购买他们不想买的东西或者订阅他们不想订阅的服务还利用自身的智能说服他们那将会是一个非常危险的世界。Shinn 在播客节目《Invest Like The Best》中谈到Instinct 的数据表明用户使用前三周内有 40% 的人分享过信用卡信息分享信用卡等敏感信息的用户留存率达到 80%。他认为用户需要数周时间建立信任而提供更多信息也能让助手更主动、更了解用户处境并提供更有针对性的帮助。这份信任也涉及 Instinct 将如何实现商业化。Shinn 批评一些免费平台会向用户推送付费广告试图说服他们购买可能并不需要的商品。他表示Instinct 不希望用户成为产品也不希望助手将用户信任转化为说服消费的能力。( APPSO) Voice Agent 学习笔记了解最懂 AI 语音的头脑都在思考什么写在最后我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创感兴趣的朋友请通过开发者社区或公众号留言联系记得报暗号「共创」。对于任何反馈包括但不限于内容上、形式上我们不胜感激、并有小惊喜回馈例如你希望从日报中看到哪些内容自己推荐的信源、项目、话题、活动等或者列举几个你喜欢看、平时常看的内容渠道内容排版或呈现形式上有哪些可以改进的地方等。作者提示: 个人观点仅供参考