方法论与洞察

单锚点优于三视图:一次没做身份板却撑住了一致性的实跑

来源:项目 61《雨里旧信》MV,2026-08-20 ~ 08-25 全流程 规模:40 镜 / 233.7s 成片,其中 18 镜(45%)看得清女主的脸 工具:Midjourney v8.2 出锚点图 → MiniMax H3 / 可灵 Kling 出视频 状态:⚠️ 单次实跑的观察,不是准则。反例见文末第六节。


一、这次的反常在哪

角色一致性的经典配置是三视图 / 身份板(turnaround sheet / model sheet): 正面、侧面、背面,外加服装形制拆解,做成一张总图当作角色的”标准答案”。

这次一张都没做。 全片只有一张锚点图——封面人物素材.png, 一张四分之三侧的胸像,连衣服都只看得见立领。

结果是 18 个看得清脸的镜头里,脸和发型撑住了。用户复盘时直接问: 「我们并没有制作经典必备的三视图或身份板,但是我们的人物一致性做的还很不错」。

这份档案回答的就是:为什么撑住了,以及这能不能复用。


二、核心判断:AI 出的三视图,本身就可能不是同一个人

这是全篇最反直觉的一条,也是整件事的根。

三视图之所以在传统流程里有效,是因为它是人画的——三个视角天然是同一个角色。 但 AI 出的三视图不是。它是三次独立采样,正面那张和侧面那张之间, 没有任何机制保证是同一个人。

项目 61 早期确实准备过双图方案(R3 五官基准 + R2 服饰定妆),后来放弃了, 理由记在项目档案里:

R2 和 R3 是两次独立的 MJ 生成。封面走 oref-off, 结果是「气质锚定,不是角色锁定,同批出的脸不保证是同一个人」。

把两张不保证同一张脸的图一起当身份参考喂进去,模型会在两张脸之间插值, 一致性反而比单图更差。

人画的三视图  =  一个角色的三个视角      → 信息增益
AI 出的三视图 =  三个相似角色各一个视角  → 噪声注入

推论:能不能用三视图,取决于你能不能保证那三张是同一个人。 如果你的出图链路本身就有身份方差(oref-off、纯 sref、跨批次), 那么”身份板”是漂移的来源,不是解药。


三、那身份板的内容去哪了:写成文字

放弃多图不等于放弃身份板的内容。形制、五官、发型这些信息还在, 只是换了载体——从图挪到了文字,并且显式声明文字优先:

The qipao construction described above is authoritative
even where <Picture 1> shows only the collar.

这一句是关键。锚点图只看得见立领,但旗袍的立领 / 右衽 / 一列盘扣 / 短袖 / 收腰全部写在文本里,并写明「即使图里看不见,也以文字为准」。

为什么这样反而更稳:文字是确定性的,同一段描述每次装配都一模一样; 而图是采样出来的,每一张都带方差。把能写清楚的东西写清楚, 只把写不清楚的东西(五官、气质)交给图。

信息类型载体理由
五官、发型、肤质、气质(单张,唯一权威)写不清楚,只能靠图
服装形制、盘扣数、袖长、下摆文字(声明优先于图)能写清楚,写了就不会漂
场景材质、道具外观(各自独立的资产图)与身份无关,不参与插值

四、一致性不是一次性设置,是每镜重申

40 镜里每一个有人物的镜头,prompt 都重新挂一次锚点图,并重新声明一次 「<Picture 1> 是身份的唯一依据」。不是开头设一次就完事。

而且这个声明要随镜头调整。项目 61 栽过一次: S03 分镜要求「背对镜头只见后脑」,但身份声明里写着 「参考图提供她的五官与表情」——这句话在背影镜里和分镜直接打架, 模型选择服从身份声明,把脸转了回来。

改为按视角分三种措辞(visible / turned / hidden)之后, 背影镜把参考图的权威从「五官表情」改判到「发型轮廓、体态、衣着」, 第一帧就对了。

教训:身份声明是全局模板,但它会和个别镜头的分镜冲突。 模板越强势,冲突时越是模板赢。


五、把验收放在便宜的那一步

真正让一致性”看起来很稳”的,还有一条工程性的原因: 漂移在 2 积分的阶段就被拦掉了,而不是 64 积分的阶段。

项目 61 后期改为两段式:可灵出关键帧静图(2 分 / 30 秒)→ 人眼逐镜验 → 通过的才驱动成视频(64 分 / 数分钟)。

这道关卡实际拦下的身份问题:

两个都在静图阶段被换掉。如果直接赌视频,这是两次 64 积分 + 两次几分钟。

一致性的观感,很大程度上是”你拦掉了多少张不一致的图”, 而不是”模型有多稳”。 把审片放在最便宜的那一步,就能拦得起。


六、⚠️ 反例:这次并没有全赢

不写这一节,上面的结论就是自我表扬。

颜色漂了,而且一路带到成片

角色卡里旗袍设定是靛蓝。封面阶段就偏成了墨黑,当时的判断是 「调色会牵动整张的色彩关系和面料质感,为一个看不见的差别冒险不值」, 并留了一句「⚠️ 但 MV 阶段要把靛蓝找回来」。

MV 阶段没找回来。 40 镜全是墨黑。

代价是具体的:歌词里「蓝」是唯一的颜色锚点 (像旧邮票发蓝 / 你没带走的蓝衫),现在这个锚点只由男主的蓝衫承担, 女主完全没参与。

所以「一致性做得不错」这句话的准确范围是:五官、发型、服装形制稳; 颜色没稳,而且是从上游一路带下来的。

单锚点也不是没有代价

背影、侧脸、俯视这些锚点图没有覆盖的视角,模型是在外推。 S03 连改三版才拿到全程背影,最后靠的不是加图,而是把镜头从 5.17s 缩到 3.04s ——让漂移来不及发生。

单锚点省掉了插值风险,但也省掉了非正面视角的信息。这是取舍,不是免费。


七、什么时候该做三视图

不要把本文读成”三视图没用”。它的适用条件是明确的:

该做三视图该用单锚点
出图链路能保证跨视角同一人(oref-on、微调模型、真人素材)链路有身份方差(oref-off、纯 sref、跨批次)
角色要长期复用、跨项目复用单个作品用完即止
大量非正面镜头,且必须看清角色非正面镜头可以靠”看不清”来化解
有多人协作,需要一份共同的标准答案单人从头做到尾

项目 61 落在右列的每一格上,所以单锚点是对的。 换一个要做 IP 长期运营的项目,结论会反过来。


八、可复用的清单

如果下次也走单锚点:


关联文档

类型/洞察