单锚点优于三视图:一次没做身份板却撑住了一致性的实跑
来源:项目 61《雨里旧信》MV,2026-08-20 ~ 08-25 全流程 规模:40 镜 / 233.7s 成片,其中 18 镜(45%)看得清女主的脸 工具:Midjourney v8.2 出锚点图 → MiniMax H3 / 可灵 Kling 出视频 状态:⚠️ 单次实跑的观察,不是准则。反例见文末第六节。
一、这次的反常在哪
角色一致性的经典配置是三视图 / 身份板(turnaround sheet / model sheet): 正面、侧面、背面,外加服装形制拆解,做成一张总图当作角色的”标准答案”。
这次一张都没做。 全片只有一张锚点图——封面人物素材.png,
一张四分之三侧的胸像,连衣服都只看得见立领。
结果是 18 个看得清脸的镜头里,脸和发型撑住了。用户复盘时直接问: 「我们并没有制作经典必备的三视图或身份板,但是我们的人物一致性做的还很不错」。
这份档案回答的就是:为什么撑住了,以及这能不能复用。
二、核心判断:AI 出的三视图,本身就可能不是同一个人
这是全篇最反直觉的一条,也是整件事的根。
三视图之所以在传统流程里有效,是因为它是人画的——三个视角天然是同一个角色。 但 AI 出的三视图不是。它是三次独立采样,正面那张和侧面那张之间, 没有任何机制保证是同一个人。
项目 61 早期确实准备过双图方案(R3 五官基准 + R2 服饰定妆),后来放弃了, 理由记在项目档案里:
R2 和 R3 是两次独立的 MJ 生成。封面走 oref-off, 结果是「气质锚定,不是角色锁定,同批出的脸不保证是同一个人」。
把两张不保证同一张脸的图一起当身份参考喂进去,模型会在两张脸之间插值, 一致性反而比单图更差。
人画的三视图 = 一个角色的三个视角 → 信息增益
AI 出的三视图 = 三个相似角色各一个视角 → 噪声注入
推论:能不能用三视图,取决于你能不能保证那三张是同一个人。 如果你的出图链路本身就有身份方差(oref-off、纯 sref、跨批次), 那么”身份板”是漂移的来源,不是解药。
三、那身份板的内容去哪了:写成文字
放弃多图不等于放弃身份板的内容。形制、五官、发型这些信息还在, 只是换了载体——从图挪到了文字,并且显式声明文字优先:
The qipao construction described above is authoritative
even where <Picture 1> shows only the collar.
这一句是关键。锚点图只看得见立领,但旗袍的立领 / 右衽 / 一列盘扣 / 短袖 / 收腰全部写在文本里,并写明「即使图里看不见,也以文字为准」。
为什么这样反而更稳:文字是确定性的,同一段描述每次装配都一模一样; 而图是采样出来的,每一张都带方差。把能写清楚的东西写清楚, 只把写不清楚的东西(五官、气质)交给图。
| 信息类型 | 载体 | 理由 |
|---|---|---|
| 五官、发型、肤质、气质 | 图(单张,唯一权威) | 写不清楚,只能靠图 |
| 服装形制、盘扣数、袖长、下摆 | 文字(声明优先于图) | 能写清楚,写了就不会漂 |
| 场景材质、道具外观 | 图(各自独立的资产图) | 与身份无关,不参与插值 |
四、一致性不是一次性设置,是每镜重申
40 镜里每一个有人物的镜头,prompt 都重新挂一次锚点图,并重新声明一次
「<Picture 1> 是身份的唯一依据」。不是开头设一次就完事。
而且这个声明要随镜头调整。项目 61 栽过一次: S03 分镜要求「背对镜头只见后脑」,但身份声明里写着 「参考图提供她的五官与表情」——这句话在背影镜里和分镜直接打架, 模型选择服从身份声明,把脸转了回来。
改为按视角分三种措辞(visible / turned / hidden)之后,
背影镜把参考图的权威从「五官表情」改判到「发型轮廓、体态、衣着」,
第一帧就对了。
教训:身份声明是全局模板,但它会和个别镜头的分镜冲突。 模板越强势,冲突时越是模板赢。
五、把验收放在便宜的那一步
真正让一致性”看起来很稳”的,还有一条工程性的原因: 漂移在 2 积分的阶段就被拦掉了,而不是 64 积分的阶段。
项目 61 后期改为两段式:可灵出关键帧静图(2 分 / 30 秒)→ 人眼逐镜验 → 通过的才驱动成视频(64 分 / 数分钟)。
这道关卡实际拦下的身份问题:
- S11 第一张候选出的是完全不同的一张脸(连镜头内容都错了,出的是人像不是挂钟)
- S15 出的画面带了侧脸,而且脸走形了
两个都在静图阶段被换掉。如果直接赌视频,这是两次 64 积分 + 两次几分钟。
一致性的观感,很大程度上是”你拦掉了多少张不一致的图”, 而不是”模型有多稳”。 把审片放在最便宜的那一步,就能拦得起。
六、⚠️ 反例:这次并没有全赢
不写这一节,上面的结论就是自我表扬。
颜色漂了,而且一路带到成片
角色卡里旗袍设定是靛蓝。封面阶段就偏成了墨黑,当时的判断是 「调色会牵动整张的色彩关系和面料质感,为一个看不见的差别冒险不值」, 并留了一句「⚠️ 但 MV 阶段要把靛蓝找回来」。
MV 阶段没找回来。 40 镜全是墨黑。
代价是具体的:歌词里「蓝」是唯一的颜色锚点
(像旧邮票发蓝 / 你没带走的蓝衫),现在这个锚点只由男主的蓝衫承担,
女主完全没参与。
所以「一致性做得不错」这句话的准确范围是:五官、发型、服装形制稳; 颜色没稳,而且是从上游一路带下来的。
单锚点也不是没有代价
背影、侧脸、俯视这些锚点图没有覆盖的视角,模型是在外推。 S03 连改三版才拿到全程背影,最后靠的不是加图,而是把镜头从 5.17s 缩到 3.04s ——让漂移来不及发生。
单锚点省掉了插值风险,但也省掉了非正面视角的信息。这是取舍,不是免费。
七、什么时候该做三视图
不要把本文读成”三视图没用”。它的适用条件是明确的:
| 该做三视图 | 该用单锚点 |
|---|---|
| 出图链路能保证跨视角同一人(oref-on、微调模型、真人素材) | 链路有身份方差(oref-off、纯 sref、跨批次) |
| 角色要长期复用、跨项目复用 | 单个作品用完即止 |
| 大量非正面镜头,且必须看清角色 | 非正面镜头可以靠”看不清”来化解 |
| 有多人协作,需要一份共同的标准答案 | 单人从头做到尾 |
项目 61 落在右列的每一格上,所以单锚点是对的。 换一个要做 IP 长期运营的项目,结论会反过来。
八、可复用的清单
如果下次也走单锚点:
- 只挑一张图当身份权威,并在每镜 prompt 里重申它是唯一依据
- 挑的那张必须是同一次生成里选出来的,不要事后再补一张”侧面版”
- 能写清楚的(服装形制、配饰、发型结构)写成文字,并声明文字优先于图
- 身份声明要按视角分档:正面 / 转身 / 背影三种措辞,别用同一套
- 场景与道具资产单独挂,并写明「只取材质,不取构图」,避免和身份图抢权重
- 把审片放在最便宜的那一步(静图,不是视频)
- 颜色单独列一条验收项——它最容易在上游漂掉且没人发现
关联文档
- 角色一致性金字塔 —— 本文是它在”单锚点”这一支上的一次实跑数据
- oref高方差律 —— 本文第二节的前提:链路本身有身份方差时会发生什么
- sref纯净性原则 —— 同源:参考的纯净性比数量重要
- 装扮签名vs五官精度 —— 本文第三节”形制写文字、五官交给图”的分工与之呼应
- MiniMaxH3_行为规律_v1 —— 同项目的模型行为档案,含 prompt 写法的实测规律
- 物品先分档_像素级换工具_学员答疑案例_v1 —— 引用本文两条:「能写清楚的写成文字并声明文字优先于图」与「颜色单独验收 + 把验收放在最便宜那一步」,迁移到物品一致性