几天前,字节跳动 Seed 团队正式发布了新一代视频生成模型 Seedance 2.5。
今年年初,Seedance 2.0 就以黑马之姿证明了大模型制作高规格影片的可行性。大半年过去了,2.0 依然是 AI 视频领域最强的模式。
这次 Seedance 2.5 的到来,可能会真正开启 AI 视频创作时代。
单次生成时长达 30 秒
Seedance 2.5 可以一次性生成最长 30 秒的音视频内容,相比上一版本的 15 秒翻了一倍,同时支持多轮续写。
而且能在这 30 秒内安排多个相互关联的镜头,让内容拥有开场、发展、转折和结尾。
一镜到底手持稳定器跟拍,镜头从红色厚重幕布缝隙缓缓推进,进入暖色后台化妆间。
年轻女歌手背对镜头整理耳机,工作人员提醒她准备登台。
她回头看向镜头,开始唱起 City Pop。镜头后退跟拍,歌手穿过幕布进后台通道,与舞伴自然互动,一位工作人员把麦克风递给她。
随后歌手与舞伴登上舞台,镜头绕至背面,红黑舞美、LED 屏、追光、烟雾与反光地板逐渐展开。
镜头最终拉远至体育馆全景,呈现满场观众、灯牌、荧光棒与欢呼声,营造年轻自由的演唱会高潮氛围。
凭借模型的多轮延长能力,用户能在已有的视频结果上自然衔接后续镜头,并在延长过程中保持主体特征、场景环境和叙事节奏的连贯,最终生成数分钟具有统一视听语言的连贯内容,减少拆分镜头、反复拼接和处理衔接的成本。
衔接 @视频 1 画面内容和主体继续生成一个 30 秒的视频,保持人物主体、场景、画面风格、声音音效一致。
小男孩抱着足球沿车厢跑,地铁停稳后侧边门打开,他立刻冲出,男主紧追。
两人一路穿过站台跑到街上,惊动街边鸽子飞起,一路狂奔至破旧看台前才刹停。镜头后拉变焦带全景。
多模态参考能力全面升级
这次的另一个明显升级,是多模态参考能力。
Seedance 2.5 单次最多可以接收 30 张图片、10 段视频和 10 段音频作为参考。模型会综合理解其中的人物外观、场景、构图、道具、声音、动作和视觉风格,再根据提示词组织成最终的视频。
30 秒音乐会片段,16:9 横屏,电影感写实,真实音乐厅光影,暖金色舞台灯,正式古典音乐会氛围。
场景@图一,钢琴家参考@图二,大提琴参考@图三,小提琴参考@图四,主唱参考@图五,管弦等其他乐队参考@图六到图十,合唱团参考图十一到图十四,观众席参考@图十五到图十八。
主唱舞台中央走向前沿,钢琴家在钢琴旁,乐队分布两侧与后方,合唱团在舞台后方。
开场高位俯拍音乐厅全景,钢琴家落键,主唱进入追光演唱,镜头自然带过小提琴、大提琴与管弦乐队,小提琴明亮,大提琴温暖。后段合唱团加入,主唱与第一排观众短暂眼神交流,观众微笑点头。结尾镜头后移,演唱结束,观众跟随鼓掌。
更精准、稳定的编辑能力
Seedance 2.5 开始提供更精细的时间戳控制。用户可以在提示词中规定某个时间段应该出现什么剧情、动作和镜头,也可以在生成完成后,只修改特定片段中的人物、动作或情节,同时尽量保持前后内容连贯。
它还加强了绿幕编辑、摄像机视角编辑和参考视频编辑。例如保留原视频中的人物动作,只替换背景、服装和配角,或者在不改变人物和场景的情况下重新设计运镜。
把 @视频 1 绿幕背景渲染场景、障碍、服装和配角。
0-4 秒:户外训练,障碍换石头、砖块、轮胎、木箱;
4-10 秒:休息室,朋友鼓励;
10-15 秒:国际赛场,训练杆换原创防守球员和门将,主角进球。整体写实电影级。
编辑 @视频 1,保持人物、动作及画风不变,仅调整运镜。
15 秒分段运镜设计:
0–4 秒,微型 FPV 贴锅穿行,跟随弹起的吐司后横甩至咖啡;
4–7 秒,推近并沿锅边横移,跟随煎蛋翻起落回;
7–11 秒,急速升至顶视角,匀速下压扫过餐盘和钥匙;
11–15 秒,手持近镜跟随双手快速横甩,最后推近早餐,再拉回双人中景。全程连贯稳定。
从视频模型走向创作工具
Seedance 2.5 已经开始被用于教育、工业制造、机器人和自动驾驶等场景。
它可以把历史故事、科学原理和实验过程制作成动态教学内容,也可以生成工业流程演示以及用于机器人或自动驾驶训练的合成视频数据。
过去,我们只能通过向模型描述一个个画面来拼凑视频。现在,可以直接向模型提交人物设定、参考素材、镜头设计、时间轴和修改意见。
AI 视频生成也越来越接近于真正的视频制作流程。