如何让角色在 AI 视频的多个镜头间保持一致
角色在 AI 视频镜头间跑偏只有一个原因:每次重生成,模型都会重新「捏」一张脸。解法是别再重生成,改成执导——用参考输入锁住身份,提示词只写「要变什么」,并在上一帧的基础上迭代,而不是从零开始。像 Seedance 2.5 这样的模型现在能一次接收最多 50 个参考,这让上述做法真正落地。下面是完整方法,以及那些会悄悄破坏一致性的错误。
角色为什么会在镜头间跑偏
每一次文生视频都是一次全新的掷骰子。如果你唯一的输入就是提示词——「一个红发、穿皮夹克的年轻女子」——那么模型每次都会画出一个符合这个描述的新人。两个镜头,两张脸。文字描述的是一个类别,而不是一个身份。一致性来自于把同一个身份信号喂进每一个镜头,而不是把句子写得更详细。
这正是图生视频与参考驱动生成在角色创作上胜过纯文生视频的原因。你把外观锚定到真实像素上——角色设定图、多角度转身图、服装图——让提示词去管运动和构图。提示词于是成了一句导演的注解,而不是一张选角启事。
方法:锁住身份,只为动作写提示
- 先做一个小小的参考包。 三到六张干净的角色图:一张正面脸、一张四分之三侧脸、一张全身服装图,再加一张目标打光下的。稳定的参考胜过繁复的提示词。
- 用参考锁身份,而不是当装饰。 把参考包作为参考输入喂进去,让模型把每一帧都对齐到同一张脸、同一头发、同一套服装。在 Seedance 2.5 上,你可以在一次调用里提供最多 30 张图像,外加视频和音频参考——足够组成一整套角色圣经。
- 提示词只写变化。 描述动作、运镜和瞬间——绝不重新描述那张脸。「她转向窗户,光线随之变化」能守住角色;「一个红发女子转身……」则是在邀请模型重新选角。
- 让打光和镜头在各镜头间保持一致。 硬侧光下和柔正光下,同一张脸会读成两个人。在一整段序列的每个镜头里都写同样的调色和镜头语言。
- 在上一帧基础上迭代,别重生成。 当一个镜头已经对了九成,就去打磨它——推一下相机、修一下手——而不是从零重生成、拿已经对的部分去赌。
- 先拉长,再裁剪。 需要更长的一段时,生成一条又长又连贯的镜头再裁,而不是拼接短片段——在每个接缝处脸都会跳。
参考名额该怎么分配
Seedance 2.5 会同时处理最多 50 个参考,而不是逐个处理,因此模型能一次性拿到你整套角色圣经。把名额花在刀刃上:
| 参考类型 | 提供什么 | 锁住什么 |
|---|---|---|
| 脸 / 身份 | 2–4 张干净、不同角度的头像 | 那个人始终是同一个人 |
| 服装 / 造型 | 全身图、关键细节 | 服装和道具不会乱变 |
| 环境 | 场景或布景参考 | 世界在镜头间保持一致 |
| 打光 / 调色 | 一份 lookbook 或调好色的静帧 | 氛围和肤色保持稳定 |
| 运动 / 节奏 | 一段短视频或音轨 | 动作能量与场景相符 |
会悄悄破坏一致性的坑
- 在提示词里重新描述脸。 你一旦打出「绿眼睛、下颌线利落」,就覆盖了参考、招来一张新脸。让图像去掌管身份。
- 序列中途换打光风格。 镜头 1 是黄金时刻,镜头 2 是头顶日光灯——同一个角色,读起来像两个人。把调色固定下来。
- 拼接短片段,而不是生成长镜头。 每一个接缝都是跑偏的机会。一条原生长镜头比五条拼起来的更能守住那张脸。
- 为修一处而整段重生成。 从零重生成会丢掉你已经锁好的身份。改成在上一帧基础上打磨。
- 参考图模糊或不统一。 输入是垃圾,输出也是垃圾。如果你的角色设定图里有三张略有差异的脸,模型会把它们平均成第四张。
让视觉 Agent 替你完成锁定
每个镜头都手动这样做,账目太多。一个视觉 Agent 会把这套方法变成默认项。ReelWand 的 导演分镜工作室 内置一套固定的风格 DNA——镜头、打光、调色、质量基准——在服务端拼进每一次请求,因此你的序列无需反复输入术语也能保持一致观感。它的会话记忆意味着你的下一句提示会在 2 小时窗口内、在上一帧的基础上迭代——这正是上面「打磨、别重生成」那一步,已经内建好了。
对于反复出现的角色,知识层会保存一份成文的规则手册——这个角色的脸、服装和世界——在每次生成时被检索进来,让身份跨会话存活,而不只是跨镜头。而且因为视频走积分制、计价高于静态图,这个迭代循环便宜到足以让你真正去「导」。在图像侧,同样的原理支撑着用 AI 保持品牌图像一致。
在内建参考锁定与会话记忆的 Agent 里执导一段一致的序列。
用导演分镜工作室让你的角色始终不脱形常见问题
怎样让同一张脸贯穿多个 AI 视频镜头?
把同一组参考图喂进每一个镜头,提示词只写动作、不写外观。参考锁住身份,提示词负责运动、运镜和瞬间。绝不要在文字里重新描述那张脸,否则模型会重新选角。
Seedance 2.5 能接收多少张参考图?
一次最多 50 个参考——最多 30 张静态图像、10 段视频和 10 条音轨——并且同时处理。这足够组成一整套角色圣经:脸部角度、服装、环境、打光和节奏。
为什么我的角色每个镜头都长得不一样?
通常是因为提示词在替你选角。文字描述指的是一个类别、而不是一个人,所以模型每次都会画出一个新的匹配对象。用参考图锚定身份,把提示词留给「要变什么」。
是拼接短片段好,还是生成一条长镜头好?
生成长镜头。每个拼接接缝都是脸跑偏的机会。一条原生长片段能在整段镜头里守住外观,这也是原生时长对角色创作重要的原因。
我需要 Agent,还是用裸模型就行?
用裸模型也能做,只是每个镜头都要手动管理参考和打光。像导演分镜工作室这样的 Agent 会在服务端把风格 DNA 内建进来,再加上会话记忆和知识层,让一致性成为默认项,而不是一张清单。
把它变成作品
62 个专精视觉 Agent,每一个都内置了本文所讲的手艺。挑一个,开始创作。