多镜头叙事,Seedance2.5身处第一阵营
2026-08-07 10:08      作者:李昆昆     来源:中国经营网

中经记者 李昆昆 李正豪 北京报道

近日,Seedance2.5发布,这次升级的核心变化是:单次生成视频时长从15秒拉到30秒原生直出,并支持多轮延长;单次生成最多可参考50个素材,涵盖图片、视频、音频三种模态;强化了视频局部编辑的能力,支持局部细节修改、元素增减,时间戳指令的精度可控制在1秒以内;支持直接参考绿幕和白模素材生成,并可通过Maya、Blender插件调用;覆盖十余种语言,口型与语速也能同步匹配。

谈起对Seedance2.5的看法,经济学家余丰慧告诉《中国经营报》记者,Seedance 2.5是字节跳动在AI视频生成领域的一次实质性能力跃迁,其核心突破在于将视频生成从“单镜头拼接”推向了“多镜头叙事连贯性”的新阶段。

多重升级

据介绍,Seedance 2.5可单次生成30秒视频片段,并支持多轮延长;支持用户单次输入最多30张图片、10段视频、10段音频作为参考素材;支持精准的时间戳控制,可定向编辑视频内容。

目前,Seedance 2.5正在陆续上线即梦AI、豆包专业版等平台,API服务也将在近期上线火山方舟。

此前Seedance 2.0开启内测,在社交媒体上引发大量讨论,不少用户给出正面反馈。但热度退去后,问题也逐渐暴露:比如人物皮肤有蜡质油腻感,表情夸张、AI味明显,角色长得千人一面。

而Seedance 2.5的真实感有了明显提升,人物面部的蜡质感有所减轻,皮肤纹理更接近真实质感,表情也不再像过去那样用力过猛。但画面接上了,剧情衔接却仍不到位。

“该模型首次实现了对复杂物理规律和人物动作的一致性建模,在运镜流畅度和主体稳定性上较上一代有代际提升。这标志着国内大模型在视频生成赛道已从追赶到并跑,字节跳动借助其短视频生态的海量训练数据和场景理解,构建了独特的竞争壁垒。”余丰慧指出,但需要直面一个核心问题:Seedance 2.5的商业化落地仍处于早期,生成式视频在版权归属、内容审核和创作者变现上缺乏明确的平台规则,技术能力无法自动转化为产品价值。建议字节在技术迭代的同时,必须同步推出明确的AI生成内容版权框架和创作者分成机制,否则工具的代际领先会被商业生态的滞后所稀释。

更值得关注的是,这些能力的叠加正在推动视频生成技术从内容创作领域加速向实体产业渗透。

发布当日,徐工集团、小鹏汽车、灵初智能、微分智飞、穹彻智能等多家企业已确认合作,将率先引入Seedance 2.5。从工程机械到智能汽车,从具身智能到自动驾驶,视频生成大模型正从创意工具走向生产流程中的标准化工具。

第一阵营

8月6日,阿里云宣布全新一代视频生成模型Wan3.0开启公测。据介绍,Wan3.0单次可生成30秒视频,在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入。即日起,Wan3.0在阿里云百炼、万镜一刻、万相官网和千问创作PC端开启公测,在千问APP灰度开放,480P/720P/1080P的API价格分别为0.3/0.6/1.2元/秒,API接口将于近期全量开放。

此前,谷歌发布高质量视频生成模型Gemini Omni Flash,支持图、文、视频混合输入,同时将最新文生图模型Nano Banana 2 Lite与Gemini Omni Flash通过Interactions API串联,构建文字、图片、视频自动流水线,缩短创作周期。

余丰慧认为,与国外Sora、Veo 2等一线模型相比,Seedance 2.5已处于同一技术梯队,但在差异化的竞争维度上各有胜负手。其优势在于物理规律一致性建模和对中文语义及东亚文化场景的理解深度,这是字节依托抖音和西瓜视频海量本土数据训练的天然壁垒,在处理中式场景、人物和叙事逻辑上明显优于国外模型。

差距则体现在两个维度:一是视频时长上限和复杂场景的开放域生成能力,Sora在模拟大规模动态场景和长镜头连续性上仍占优势;二是多模态交互融合尚处追赶状态,谷歌Veo 2在音频视频同步生成和交互式编辑上的能力更为成熟。整体判断是,Seedance 2.5代表中国视频生成大模型正式进入全球第一阵营,但距离全面领先还需在长视频生成稳定性和开放域泛化能力上做持续突破。建议研发重点不应单纯追逐时长和分辨率,而应深挖短视频生态的闭环应用场景,先占据从创作工具到内容分发的端到端价值高地。

目前,相较发展迅速的大语言模型赛道,视频生成领域仍属早期阶段。浙商证券研报分析认为,多模态大模型仍处于产业早期,渗透率和行业景气度是收入超预期的关键:现阶段可灵5亿美元ARR(截至2026年5月)相对于千亿美元的多模态生成市场空间,商业化渗透率不足1%,行业仍处于优质供给创造需求阶段。

且多模态理解与生成技术上尚未出现类似大语言模型的“Transformer时刻”,在底层范式完全收敛之前,行业玩家仍有机会通过视频数据、创作者生态、参考一致性、音画同步、多镜头叙事和工程优化形成差异化竞争优势。

(编辑:吴清 审核:李正豪  校对:颜京宁)