字节跳动旗舰产品

Seedance 2.0

字节跳动新一代AI视频模型,搭载革命性的 @-reference 系统。将文字、图片、视频片段和音频融合在单一提示词中。原生音视频同步、V2V编辑、最高2K分辨率30fps输出——全部在统一的生成流程中完成。

About

关于 Seedance 2.0

Seedance 2.0 是字节跳动最先进的AI视频生成模型,于2026年2月发布。它采用统一的多模态音视频联合生成架构,同时支持4种输入模态——文字、最多9张图片、最多3段视频片段和最多3条音轨。开创性的 @-reference 系统让您可以在提示词中标记特定元素,并将其绑定到上传的参考素材,实现对镜头运动、角色外观、音频节奏和视觉风格的精细控制。输出最高可达2K分辨率,并配备原生同步音频,包括多语言口型同步、音效和背景音乐。

关于 Seedance 2.0

Seedance 2.0 核心功能

@-reference系统、4模态输入、原生音频同步、V2V编辑、2K分辨率

核心功能概览

@-Reference 系统

@-reference 系统是 Seedance 2.0 的标志性创新。您在文字提示词中用 @Image1、@Video1、@Audio1 标记元素,并将其绑定到上传的参考文件。模型从视频参考中提取镜头运动,从音频参考中提取节拍节奏和声音特征,从图片参考中提取构图和风格。这实现了前所未有的控制力:『一个 @Image1 走过 @Image2,同时播放 @Video1 的镜头运动,并由 @Audio1 营造氛围。』

提示词
输出示例 (Output)

@Image1 走过 @Image2,镜头运动来自 @Video1,背景音乐来自 @Audio1

结合所有模态的多重参考提示词

@-Reference 系统 示例

@Image1 角色跟随 @Audio1 的节奏在 @Image3 环境中跳舞

角色动作由音频节拍参考引导

@-Reference 系统 示例

原生音频生成

Seedance 2.0 采用双分支扩散Transformer架构,通过共享交叉注意力机制并行处理视频和音频的潜在表示。这意味着音频不是作为后期处理步骤添加的——而是与视觉画面同时生成,确保毫秒级同步。模型可以生成多语言口型同步对话、与动作匹配的音效和符合氛围的背景音乐,全部通过文字提示词或音频参考进行控制。

提示词
输出示例 (Output)

一个人进行演示演讲,配有同步的英语语音和幻灯片切换

口型同步对话配合视觉内容

原生音频生成 示例

烹饪教程,配有逐步旁白和厨房环境音

旁白与烹饪动作同步

原生音频生成 示例
官方展示

官方展示

探索 Seedance 2.0 在多模态参考控制、原生音频生成和视频编辑方面的强大能力

结合所有模态的多重参考提示词@-Reference 系统

@Image1 走过 @Image2,镜头运动来自 @Video1,背景音乐来自 @Audio1

结合所有模态的多重参考提示词

角色动作由音频节拍参考引导@-Reference 系统

@Image1 角色跟随 @Audio1 的节奏在 @Image3 环境中跳舞

角色动作由音频节拍参考引导

口型同步对话配合视觉内容原生音频生成

一个人进行演示演讲,配有同步的英语语音和幻灯片切换

口型同步对话配合视觉内容

旁白与烹饪动作同步原生音频生成

烹饪教程,配有逐步旁白和厨房环境音

旁白与烹饪动作同步

FAQ

Seedance 2.0 常见问题

Seedance 2.0 FAQ

@-reference 系统让您可以在提示词中用 @Image1、@Video1、@Audio1 标签标记元素,并将其绑定到上传的参考文件。Seedance 2.0 会从视频参考中提取镜头运动,从音频中提取节拍节奏,从图片中提取构图风格。这使您能精细控制生成视频的每一个方面。

Seedance 2.0 同时支持4种输入模态:文字提示词(长度不限)、最多9张参考图片(每张≤30MB)、最多3段视频片段(总时长2-15秒,每段≤50MB)和最多3条音轨(总时长≤15秒,每条≤15MB)。文件总数限制:每次请求最多12个文件。

Seedance 2.0 输出原生2K(2048×1080)分辨率,30fps,提供多种质量级别:480p、720p和1080p。每次生成时长为4至15秒。支持的画面比例包括横屏、竖屏和21:9超宽屏。

Seedance 2.0 采用双分支架构,并行处理视频和音频的潜在表示。音频与视觉画面同时生成,确保毫秒级同步。支持多语言口型同步对话、与动作匹配的音效和符合氛围的背景音乐。您也可以上传音频参考作为输入。

V2V 编辑功能让您可以上传现有视频片段作为参考,生成继承其运动模式、镜头轨迹和节奏的新视频。您可以在保留原始动作结构的同时修改服装、动作或场景细节等特定元素。

Seedance 2.0 新增了视频和音频参考输入,图片参考从1张增加到9张,引入了 @-reference 系统实现多模态控制,增加了 V2V 视频编辑,最大分辨率从1080p提升到2K,时长从12秒延长至15秒,并且比 1.5 Pro 快约30%。

Seedance 2.0 采用按秒动态定价,基于分辨率收费:480p(每秒14-28积分)、720p(每秒28.5-57积分)和1080p(每秒640-3,810积分)。提供标准和高两种速度模式,高速模式约快30%。

Seedance 2.0 非常适合需要精确运动控制的视频导演、希望免去后期制作即可实现原生音频同步的内容创作者、制作品牌视频内容的广告从业者、制作旁白教程的教育工作者,以及任何需要专业级AI视频与同步音频的用户。

Testimonials

创作者对 Seedance 2.0 的评价

@-reference 系统是真正的革命性创新。我可以从参考片段中提取镜头运动并即时应用——这是一种全新的创作工作流。

Alex Kim

Alex Kim

视频导演

Alex Kim: “@-reference 系统是真正的革命性创新。我可以从参考片段中提取镜头运动并即时应用——这是一种全新的创作工作流。

Priya Sharma: “原生音频同步省去了数小时的后期制作时间。即使是非英语对话,口型同步的精准度也令人惊叹。

Lucas Müller: “V2V 编辑让我无需重新拍摄就能增强现有素材。Seedance 2.0 已经成为我们制作流程中的核心工具。

Yuki Tanaka: “4模态输入是一个颠覆性的改变。我可以将角色设计、镜头运动参考和背景音乐全部放入一个提示词中,得到完全符合预期的结果。

探索更多AI视频模型

立即开始使用 Seedance 2.0 创作

体验 Seedance 2.0 —— 字节跳动最先进的AI视频生成器,在线免费使用

user 1
user 2
user 3
user 4
user 5

10,000+ users