示例

这个页面能产出的效果示例。

参考图生视频

多参考素材 AI 视频生成器

上传最多 30 张参考图或 10 段短视频,为新 AI 视频中的角色、产品和视觉风格提供引导。生成细节仍可能变化,请逐次检查。

最多使用 30 张参考图来引导角色、产品或视觉风格;生成细节仍可能变化。

模型

2.5 新能力:最长生成 30 秒,可用最多 30 张图片引导运动,也可仅从音频开始生成。

输入模式参考素材

请至少添加一种参考素材。图片、视频和音频可以单独使用,也可以组合使用。

参考图片(可选)0/30

参考视频(可选)0/10

MP4 或 MOV,单段 2–30 秒,总时长不超过 30 秒,单个不超过 200MB。需要配置带公开域名的 R2,模型会通过网络拉取该文件。

参考音频(可选)0/10

Seedance 2.5 支持 MP3 或 WAV;单段 2–30 秒,总时长不超过 30 秒。 支持仅使用音频作为参考。

画面比例
5
4s30s
分辨率

免费余额只用于快速试片,不是最终成片。先用较短时长和较低分辨率检查主体、动态与提示词。更完整、更有表现力的成片通常需要更长时长和模型支持的更高分辨率;需要这些设置时,请使用付费余额。

输出数量

声音

有声音

同步生成声音、人声与配乐

最大预留余额:¥7.99

生成的视频会显示在这里。描述一个镜头,然后点击生成。

参考图转 AI 视频 — 跨镜头保持角色与风格一致

上传最多 30 张参考图或 10 段短视频引导角色、产品和视觉风格。让主体在多个生成中保持一致。

当单靠提示词难以描述主体或视觉风格时,可以使用参考素材。角色设定图、产品图或配色板能为模型服务商提供更多上下文,但它不是后期锁定,也不能保证跨生成的一致性。请保持参考集聚焦,单独描述镜头,并在使用结果前检查生成片段。

  • 最多 30 张参考图、10 段参考视频和 10 个音频文件
  • 参考素材作为生成引导
  • 逐条检查角色与细节

不同参考素材如何引导输出

不同类型的参考素材引导生成的不同方面。

始终是同一个人的角色

提供两三张同一张脸的清晰图片——不同角度、光照一致——模型就能在整段片子以及多次生成之间保持这个身份。这正是让一组镜头看起来像同一个项目的关键。

始终是你那件产品

配色、比例、品牌标志位置、材质。文字提示会生成一个看似合理的物体;参考图锁定的才是真实对象——对任何商业用途来说,这一点不容妥协。

立得住的美术方向

配色、颗粒、对比度、年代感、镜头质感。投入一组共享同一种质感的静图,这种质感就会被迁移过去,于是一批片子看起来属于同一个完整系列,而不是一堆风格拼贴。

如何选择合适的参考素材

人的第一反应是把手上所有素材都传上去。忍住——参考之间会互相竞争,九张互相矛盾的图,效果不如三张彼此一致的图。挑那些共享同一套布光逻辑、并且对「你想锁住的东西」毫不含糊的图:锁脸,就用同一个人在相近光线下的两三个角度;锁产品,就用一张干净的主图加一张细节图;锁质感,就用真正共享同一种调色(而不只是「氛围相似」)的静图。把不想被带过去的部分裁掉,因为模型没法知道那个杂乱背景只是偶然入镜。

视频参考和图片参考的工作方式不同,值得刻意区分。图片说的是「东西长什么样」,视频片段说的是「东西怎么动」——节奏、运镜行为、一个动作的韵律;音频参考则可以在没有画面素材的情况下引导声音。Seedance 2.5 单次最多接受 30 张图片、10 段视频和 10 个音频文件,但输入越多并不自动越好。参考素材还要符合供应商对单个文件和总时长的限制,所以要挑出承载运动的那一小段,而不是把整条素材传上去。

三张强参考胜过九张弱参考

互相冲突的光线或矛盾的角度会迫使模型去做平均。你的参考之间有多一致,输出就有多一致。

图片承载外观,视频承载运动

用静图锁定身份与美术方向,用片段借来运镜或动作韵律。把两者放进同一次请求,正是这个工具最强的用法。

模型规格

Seedance 2.5 AI 视频生成规格

模型的实际规格限制,而非营销数字。每个数值都在生成器提交前校验。

480p / 720p / 1080p
该模型的输出分辨率 —— 智擎云 全部模型最高可达 4K
4–30 秒
每次生成的片段时长,帧率为 24 帧/秒
原生音频
音效与环境声与画面同步生成
30 + 10 + 10
单次请求可用参考图、参考视频与音频数量
支持 7 种画面比例
支持的画面比例:自动, 16:9, 4:3, 1:1, 3:4, 9:16, 21:9
付费生成支持商用
具体以《服务条款》为准

为什么创作者在 智擎云 上生成 AI 视频

模型来自字节跳动。智擎云 提供的是让它可用于工作的部分:真实的规格、透明的计费、可商用的成果。

文字·图片·视频单次生成

文本、最多 30 张参考图、10 段参考视频和 10 个音频参考可以共同引导同一次 Seedance 2.5 生成,而不是事后拼接。这里没有需要来回切换的「文生视频模式」——你手上有什么素材就丢进去,模型自己去调和它们。

声音与画面一起生成

开启音频后,Seedance 2.5 可随视频生成脚步、房间环境声、撞击声、对白和配乐。发布前请检查声音的时机与内容;如需单独设计声音,也可以关闭音频。

七种画幅,最高 4K

同一条提示词可以产出 9:16 竖版短视频、16:9 的 YouTube 主片,以及 21:9 的宽银幕片头。分辨率从 480p 到 4K,同一个镜头既能适配宽银幕画幅,也能用于手机。

可预测的积分消耗

最大预留积分根据所选模型、时长、分辨率、画面比例和参考视频输入计算,并在提交前显示。视频任务成功后,若供应商报告的实际用量更低,则返还未使用的积分;确认失败的任务会退回全部预留积分。

为高效迭代而设计

用 Mini 低成本探索提示词;需要兼顾生成速度与成本时选 Fast;当镜头需要更长时长或更丰富的参考输入时选 Seedance 2.5。切换模型会发起一次新的生成,结果可能有所不同。

成片归你,可直接变现

使用付费订阅或已购买积分包生成的内容,可依《服务条款》用于商业用途;仅使用注册赠送或促销积分生成的内容,只限评估和个人使用。

三步:用参考素材生成视频

参考素材配置一次,这个系列后面的每个镜头都会继承它。

  1. 1

    附上参考素材

    上传最多 30 张图片、10 段片段和 10 个音频文件。把每一份都裁到你希望模型参考的角色、产品、场景、风格、动作或声音上,并剔除彼此冲突的参考。

  2. 2

    只描述新增的部分

    参考素材已经说清了「东西长什么样」。你的提示词应该说的是「发生什么」和「镜头怎么走」——把参考里已有的内容再描述一遍,等于浪费了这条指令。

  3. 3

    生成整个系列

    保持参考集不变,只改提示词,就能产出第二、第三、第四个镜头,而它们都属于同一个世界。

参考素材改变结果的场景

下面每一项在纯文字模型上都会立刻失败,原因相同:必须有东西精确地保持它本来的样子。

有固定面孔的品牌系列项目

出现在十几条片子里的代言人或吉祥物,每次都必须是同一个人。锁定角色参考,才能把「十几个陌生人」变成一个完整系列项目。

规模化的商品视频

几百个商品款号,每一个都需要动态、每一个都必须准确。换掉产品参考、保持提示词与美术方向不变,整个商品库的风格就统一了。

连载与剧集类内容

跨集出现的角色和场景,需要的是提示词无法保证的连贯性。参考素材给了一个系列真正的贯穿线。

参考图转 AI 视频 — 常见问题

什么是参考图生视频?

它是一种接受源图片、视频或受支持音频作为引导的视频生成方式。使用 Seedance 2.5 时,单次最多可添加 30 张图片、10 段视频和 10 个音频文件,然后描述想要生成的镜头。

一次最多能用多少份参考?

单次 Seedance 2.5 请求最多 30 张图片、10 段视频和 10 个音频文件。每个模型的单次上限都不同,切换模型就会改变你能上传的数量。参考素材还要符合供应商对单个文件和总时长的限制。更多并不自动等于更好——彼此矛盾的参考会让结果变差。

角色身份的一致性到底有多稳?

没有固定的一致性保证。两三张主体相同、光线相近的清晰参考图,通常能提供更好的引导;极端角度、遮挡或互相冲突的参考素材会增加漂移。

图片参考和视频参考有什么区别?

图片参考主要引导外观,例如身份特征、颜色、材质和美术方向;视频参考可提供动作、运镜和节奏等动态信息。两者可以在同一次请求中使用,但生成细节仍可能变化。

参考生视频与图片转视频有什么区别?

图片转视频会把一张上传图片作为必需的首帧;参考生视频则把一张或多张图片或视频片段作为新镜头的引导,因此参考素材不必出现在第一帧。

可以用真人照片当参考吗?

仅在获得当事人同意的前提下可以。模型无法核验授权,因此责任在你。未经同意生成可识别的真人,不符合本服务的商业使用条件。

准备把 AI 视频加入你的内容工作流?

需要商用资格、可预测的生成成本,以及任务失败或被拒绝后恢复预留积分时,请选择付费方案。也可购买无需订阅的一次性积分包。

  • 一次性积分包永久有效
  • 付费生成支持商用
  • 生成失败时恢复预留积分