ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1: A Real-Time Interactive Video Generation Model Vidu S1 论文完整整理(arXiv:2607.03118)一、论文整体概述1. 基础信息论文由清华大学 + 生数科技(Shengshu Technology)联合发布,提出Vidu S1——一款语音可控、无限时长、实时交互的数字人视频生成模型,解决现有离线视频生成模型无法实时交互、语音控制弱、长视频画面漂移、推理成本高四大行业痛点。现有主流视频模型(Sora、Veo、Wan、Seedance)均为离线一次性生成:用户输入提示词后等待数分钟拿到完整视频,中途无法干预;而Vidu S1实现流式实时生成,用户可在视频生成全程用语音实时下发动作指令,数字人即时响应。2. 核心功能语音实时控制数字人:语音作为原生控制信号,随时下发抬手、比心、坐下等全身动作指令;无限时长稳定流式生成:抑制时序误差累积,无画面漂移、模糊、人物崩坏;自定义角色生成:单张图片即可生成真人、动漫、宠物类交互数字人,支持自定义音色;消费级显卡实时推理:基于自研TurboDiffusion加速内核+TurboServe部署框架,RTX 5090可输出540p、最高42
返回列表