单次生成时长延长至 30 秒与长叙事连贯性
字节跳动正式发布新一代视频生成模型 Seedance 2.5。该模型延续了前代统一的多模态音视频联合生成架构,并在时序稳定性和长序列建模上进行了重构,将单次原生视频生成时长从 15 秒提升至 30 秒。
核心规格与指标
-
30s
单次原生视频生成时长,支持多轮无缝时序延展。
-
50
单次支持输入的最大多模态参考素材插槽总数。
-
4K
原生输出分辨率(3840×2160),支持 10bit 色彩位深。
新模型将单次视频生成时长延长至 30 秒并支持多轮时序延展,显著提升了镜头运镜、人物交互与光影过渡的跨帧一致性。 这种长序列生成能力有效降低了分段拼接导致的断层问题,满足了复杂故事线与连贯剧情的表达需求。
50 插槽多模态参考与局部精准编辑
为了解决视频生成中常见的角色身份漂移和可控性不足难题,Seedance 2.5 引入了多达 50 个素材插槽的多模态参考架构,允许创作者同时输入多张图像、视频切片和音频片段。
多模态参考与生成处理链路
-
输入多模态参考
输入角色三视图、绿幕资产、动作视频或音频节奏素材。
-
特征解耦与对齐
模型解析素材中的身份特征、空间结构和运镜轨迹。
-
定向合成与渲染
生成原生 4K 10bit 视频并保持跨帧主体一致性。
此外,模型新增了基于时间戳的局部视频编辑能力。创作者无需重新渲染整段视频,即可对特定时间区间的背景、道具或人物服装进行局部定向重绘。
基于时间戳的局部编辑与 50 插槽参考架构大幅降低了修改成本,使创作者能够在锁定角色与场景结构的前提下进行局部微调。 这使得 AI 视频生成流程真正具备了工业制作所需的可迭代性与可修改性。
产品矩阵接入与工业落地场景
在落地生态方面,Seedance 2.5 已陆续在字节跳动旗下的即梦 AI、豆包专业版、扣子(Coze)以及小云雀等产品上线,供个人创作者和专业用户体验。
企业级服务方面,火山引擎即日起向企业客户开放 API 接入申请。徐工集团、小鹏汽车、灵初智能、微分智飞以及穹彻智能等企业已率先开展合作,将该模型用于工业操作培训仿真、汽车造型可视化以及具身智能合成训练数据生成等场景。
模型已全面接入字节跳动消费级产品矩阵,并通过火山引擎面向工业制造、智能汽车与具身智能等前沿领域开放企业级服务。 这种双轨交付模式进一步推动了生成式视频技术在实际业务流中的工程化落地。