概览
Vidu Q 系列是由生数科技发布的中国首个长时长、高一致性、高动态性视频生成模型。Vidu 在语义理解、推理速度、动态幅度等方面具备领先优势,并上线了全球首个“多主体参考”功能,突破视频模型一致性生成难题,开启了视觉上下文时代。
Vidu S 系列是由生数科技发布的全球领先的流式推理视频模型为基础,面向 B 端企业提供准实时、可交互、具备双向感知能力的新一代企业级数字人服务。帮助客户在社交、电商、游戏、教育等场景中,快速落地“能互动、会表演、可感知、可长期陪伴”的视频 AI 角色。
通过搭建大规模推理平台与推理链路优化,Vidu 开放平台将模型能力转化为功能丰富、易用性高的 API ,企业和开发者可以轻松将多模态输入转换为高质量的视频内容,在互动娱乐、动漫短剧、电商广告、文旅教育等多个领域为用户带来更丰富的互动体验。
参考生视频:输入参考图图片和文本描述,生成视频。目前已支持参考人物、物品等多类主体;
图生视频:输入首帧图片或首帧和尾帧图片以及对应的文本描述,生成视频;
文生视频:输入一段文本,生成视频;目前支持通用风格以及专门优化的动漫风格。
社交媒体互动玩法:包括双人拥抱、老照片动起来、个性化表情包等;
动画、游戏等短片内容制作:根据故事脚本生成视频片段并剪辑成片;
虚拟 IP 日常互动宣发内容制作:IP 宣发短片制作以及互动视频生成;
电商广告制作:生成广告空镜素材、根据静态图生成特效镜头等。
动态幅度大、有想象力:生成的视频动作幅度较大,不会出现 AI PPT 的迟缓感,非常适合表现有想象力的画面或特效玩法;
强大的语义理解:能够准确遵循输入的 prompt 指令,特别是图-视频能力可以遵循提示词生成各种画面,抽卡更加高效;
动漫风格效果突出:文生成动漫风格的视频效果更好,且使用动漫图片进行图生视频时风格稳定性高很少出现风格变化等问题;
主体参照效果稳定:突破了图片层面很难解决的一致性问题,能够实现主体高度一致性,不再需要制作首帧图就可以生成一致性主体的视频,创作更加简单。
Vidu S2-Avatar :支持实时语音交互、复杂动作控制,并可结合参考图完成物品互动、服装更换和背景切换;
Vidu S2-Editing:可基于风格、服装、主体及背景参考图,持续对输入视频流进行实时编辑。
AI 陪伴、虚拟偶像、影游互动、培训讲解、AI 客服、电商直播
商业级产品:首个能互动、会表演、可双向感知的商业级交互式数字人;
无限时长互动:全球首个支持无限互动时长的生成式视频大模型技术,生成 1 分钟到 2 小时无质量损失;
极佳的指令响应效率:支持指令遵循,语义理解能力强,推理速度业内最快,实现准实时跨屏互动;
有温度的互动体验:支持真人、二次元人物、萌宠动物等多种自定义人格和形象,有短期记忆,提供个性化、有温度的互动体验;
多模态互动形式:支持语音、文字、视频等多种交互方式,可精准捕捉用户外貌、情绪等因素;
极佳画面质量:高分辨率实时交互生成。
更多功能与模型能力可以参考
功能清单 与
模型地图