
从智能座舱到语音客服基于qwen-audio-agent构建实战场景全解析【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agentqwen-audio-agent 是一个面向 AI Agent 的实时语音运行时它让 Agent 不仅能听、说、聊还能真正动手办事。基于它社区已经沉淀出一批可运行的实战场景在 docs/scenarios/index.zh.md 的示例索引中智能座舱用自然语音控车、导航、放音乐和语音客服零售订单查询、退款、航旅改签是最有代表性的两个——一个演示了语音 × 硬件设备的边界另一个演示了语音 × 企业业务流程的边界。本文将带你拆解这两个场景的设计思路、架构分工与落地步骤帮你看懂实时语音 工具调用 后台 Agent这一套组合拳并给出复用到自己业务的替换路径。三个核心概念看懂实时语音 Agent 的分工在深入场景之前先花两分钟理解 qwen-audio-agent 的三层接入参考架构后面所有场景都是这个骨架的换装。层级角色一句话理解第一层 · 实时前台语音客户端 Qwen Audio Realtime负责聊连续对话、随时打断、低延迟语音应答第二层 · Gateway 协调TaskManager 后台适配负责派单把复杂任务委托出去跟踪任务状态第三层 · 后台执行独立后台 Agent Session负责干活多步骤、长耗时、可独立上下文的业务任务理解这张图的关键在于spawn_thinking当用户的一句话需要多步业务操作比如取消订单并退款时前台不阻塞通话而是把它结构化成任务委托给后台 Agent前台继续和用户说话。任务完成后结果再以一句话摘要 完整文本的形式回到前台播报。这一设计同时出现在智能座舱和语音客服两个场景里——前台管快后台管深是所有场景复用的核心模式。场景一智能座舱用自然语言开车智能座舱示例examples/smart-cockpit/README_ZH.md让用户通过语音完成车控、导航、音乐、天气、闪购和自定义技能座舱 UI 同步展示车辆与任务状态。它是框架前台实时对话 工具调用 可替换后台 Agent三种能力的完整组合。38 个 MCP 工具覆盖 6 大车载领域座舱 Service 把车上的能力统一定义为 MCP 工具模型看到的是一个干净的函数工具面领域工具数能力示例vehicle11位置车况、空调、车窗、天窗、车灯、充电navigation12地点搜索、路线规划、多途经点、路线偏好music10搜索播放、上下曲、音量、收藏weather1城市天气查询flashbuy1闪购商品搜索与下单custom-skills3列出、创建、加载自定义工作流技能工具目录与注册方式见 examples/smart-cockpit/service/tools/README.md。前台快、后台深座舱如何分工前后台分工不是拍脑袋定的而是靠一份路由配置决定。打开 examples/smart-cockpit/service/tools/surface-routing.json 就能看到每个工具归属前台还是后台前台 Realtime 直调车控、导航、音乐、天气——要求秒级响应平均工具返回时延约1.48 秒后台 Agent 委托闪购下单、多来源新闻研究等长任务——平均时延约 3.56 秒但执行期间前台不中断你还可以继续跟它聊天。官方评测数据短用例 86 例整例通过率 97.67%500 轮长对话逐轮工具准确率 99.80%也验证了这套前后台分流 运行时保护的稳定性明细见示例 README 的评测章节。智能座舱架构谁负责什么四个组件各司其职任意一个都可以被你的自有实现替换组件职责主要接口client/React 座舱 UI 浏览器音频Gateway Client Protocolgateway/前台 Realtime 对话 任务协调GCP / MCP / BackendPortagent/后台 Agent闪购、新闻研究A2A 1.0 / MCPservice/共享场景状态、业务规则、工具执行HTTP/SSE / MCP注意Service 不是额外的 Agent 层而是前后台共享的环境与基础设施车辆状态、路线、订单都存在这里界面通过 SSE 通道实时投影——这正是语音说话、屏幕同步亮灯体验的来源。本地跑起一个智能座舱在仓库根目录执行首次使用先克隆仓库git clone https://gitcode.com/gh_mirrors/qw/qwen-audio-agentcp examples/smart-cockpit/.env.example examples/smart-cockpit/.env.local # 在 .env.local 中填入 DASHSCOPE_API_KEY地图 Key 可选 npm run example:smart-cockpit:install npm run example:smart-cockpit一条命令会同时拉起 service、agent、gateway 和 client 四个进程浏览器打开http://localhost:5173即可对着麦克风说把空调调到 22 度。场景二语音客服从订单查询到退款办结客服示例examples/customer-service/README_ZH.md把同一套前后台架构搬进了企业业务流程语音前台负责沟通、身份核验与只读查询涉及金额、不可逆或组合型操作则通过 A2A 交给后台 Agent 执行。两个行业域同一套流程场景已实现能力零售邮箱/姓名核验、订单查询、库存查询、取消订单、退货、改收货地址航空会员号核验、预订/航班查询、退票、改签、改舱、加行李、按细则补偿业务边界未核验拒答、资格/金额判定、超权限自动转人工最值得关注的设计写操作必须先预览、再批准语音客服最容易踩坑的地方是模型自作主张改了数据。这个示例给出了教科书式的解法——批准不是模型填一个 true写工具首次调用只生成预览和内部审批令牌不落库客户听到的是可读的预览将取消订单 #W1082334退款 ¥xxx 原路退回客户说同意取消前台把决定回传executor 才真正提交原操作拒绝、取消或超时5 分钟有效期一律撤销令牌参数漂移比如预订已变化也会拒绝提交每笔写操作逐笔重新批准不共用上一次同意。资格、金额、库存规则不靠模型记忆而是由服务层的guards.json决策表执行examples/customer-service/service/guards.mjspolicy 缺口或超权限金额会明确转人工而不是让模型编规则。三张管理台把运营也做进示例页面端口零售/航空用途客服工作台4620 / 4720语音通话、核验状态、订单数据、工具调用审计人工坐席台4630 / 4730查看已转人工客户的上下文Policy 配置台4610决策表/流程编辑、变更 diff、备份与审计启动方式同样简单npm install npm run example:customer-service:install npm run example:customer-service # 零售域 # 或 npm run example:customer-service:airline # 航空域打开工作台后允许麦克风访问按 README 给出的口令如查询订单→取消订单→先说不取消了再说同意取消即可完整体验预览 → 批准 → 办结的闭环。实测数据前后台架构值多少分示例内置了 EVA Airline 50 任务的公开评测三条路径对比很有说服力评测路径Task completion仅 Realtime API纯前台直答44%Realtime 前台 完整客服 Harness62%纯文本后台模型68%结论清晰纯语音前台无法独立完成复杂业务但语音前台 后台委托把完成率从 44% 拉到 62%接近纯文本上限同时保留了自然的语音交互。完整口径见 examples/customer-service/benchmark/。两个场景的共性一张可复用的架构配方对比下来两个场景其实是同一张配方的两份填法设计点智能座舱语音客服前台Realtime车控、导航、音乐直调身份核验、只读查询后台A2A Agent闪购、多来源新闻研究取消/退款、改签等写操作共享事实源Service车辆、路线、订单状态订单、预订、库存界面投影SSE 投影到座舱 UISSE 投影到工作台/坐席台安全机制前台工具 10 秒超时如实回错预览 逐笔批准 决策表调分流入口surface-routing.jsonPolicy 配置台工具归属这张配方可以抽象成四步套用到你自己的业务定义领域工具把业务能力写成 MCP 工具放入 Service划前后台边界低延迟查询走前台写操作/长任务走后台客服场景写操作必须留在后台因为前台没有可挂起的批准生命周期接入协议客户端用 Gateway Client Protocol 对话后台 Agent 用 A2A 接入协议文档见 docs/gateway-protocol.zh.md界面同步用 HTTP/SSE 把业务状态投影到你的 UI。下一步把配方搬进你的业务你想做的从哪里下手换座舱 UI / 音频 I/O替换 examples/smart-cockpit/client/换成你自己的后台 Agent修改COCKPIT_AGENT_CARD_URL或实现 Backend Adapter增加场景工具扩展 examples/smart-cockpit/service/tools/ 与surface-routing.json换语音模型实现 Realtime Provider换知识库 / 长期记忆实现 Knowledge Provider / Memory Provider了解全部可运行示例examples/README_ZH.md 与 docs/scenarios/index.zh.md最后提醒示例均为本地演示环境进程重启后内存状态会清空也不具备生产级鉴权接入生产前需要补充持久化与访问控制。但从能跑起来到改成自己的两个示例已经铺好了最短路径——跑通一个你就拿到了整个实时语音 Agent 的架构手感。【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考