skill存档

AIGC Video Cover (GPT Image 2)

适用场景

把「一张人物参考图 + 一份视频脚本」直接变成若干张可发布的 16:9 横版视频封面,由 GPT Image 2 一步出含中文大标题的整张图。面向商单视频、知识科普、揭秘解说这类需要「缩略图秒懂 + 有点击欲」的封面。

典型触发语:

与相邻 skill 的区别

核心约定(本 skill 的硬设定)

  1. 一步出整图:GPT Image 2 直接生成含中文大标题的完整封面,不做「底图 + 后期排版」两段式。
  2. 接受 ~92% AI 近似:人物用参考图重画,靠「禁美化 + 点名锚点」把身份拽回到工具上限,不做抠图换脸。详见 GPTImage2锁脸的脸占比上限_v1
  3. 只出 16:9 横版:用自然语言 Wide 16:9 horizontal video thumbnail,GPT Image 2 不吃 --ar
  4. 若干张 = 多个标题钩子:默认从脚本发散 3 个不同钩子,各出 1 张,而非同一张改比例。
  5. 构图不固定:人物不锁死在右侧。从「构图库」(见第三步)随机选位——左置 / 居中 / 前景大头 / 底部探出 / 左右对峙 / 斜角 / 分屏 等都可;一批 3 张默认构图各不相同,让封面有变化、不千篇一律。唯一不变的是「文字与主体不互相糊住、主标题缩略图可读」。
  6. 暗版 / 亮版双影调随机:每张封面随机走「暗版」或「亮版」影调(见第三步);一批 3 张默认两种影调都出现(如 2 暗 1 亮 / 1 暗 2 亮,随机),让用户在明暗两种风格里挑。
  7. prompt 是中间产物:先把 prompt 写清楚给用户过目(尤其文字内容、锚点、构图、影调),再调用出图。

第一步:拆参考图 + 拆脚本

1A. 从参考图抽「身份锚点」

找出参考图最强的单一特征(眼睛颜色/形状、脸型、发型、肤色、标志性配饰其一),作为锁脸成败的判据。

锁脸先看锚点有没有还原,不必逐项比对五官。锚点丢 = 锁脸失败GPTImage2锁脸的脸占比上限_v1)。

记录:性别、年龄段、锚点特征、是否戴眼镜、气质(温婉/硬朗/书卷/喜剧)。

1B. 从脚本抽「封面要素」

读完脚本,提炼:


第二步:发散标题钩子矩阵(默认 3 个)

不要只想一个标题。从脚本发散 3 个不同角度的钩子,每个包含:

字段说明
主标题2–4 字核心词,缩略图主角
高亮字标题里最戏剧的 1–2 字,用对比色单独跳出
副钩子一句吊人的短句,常带「!」或「?」(如「建议低调使用!」「今天你哈了吗?」)
英文幽灵层全大写英文,做低透明度背景字(如 DISASSEMBLE WAR MUSK
角度这个钩子打的是悬念 / 利益 / 冲突 / 反差 哪一种

三个钩子尽量打不同情绪(如:① 悬念式 ② 利益式 ③ 冲突式),让用户有得挑。


第三步:商单封面公式(从高质量模板提炼,核心资产)

这是这套「高质量封面」的统一骨架,每张图都按它搭:

版式骨架(16:9 横版)= 一套元素 + 一种构图

封面恒定由这套元素搭成,但它们在画面里怎么摆是变量(见下「构图库」):

下面是最常见的一种摆法(主标左、主体右),但只是构图库里的一个,不是唯一解:

┌─────────────────────────────────────────────┐
│   (顶角留空,不挂品牌条 / 栏目名 / 英文 slogan)    │
│  超大主标题(左)            主体(人物/产品/IP)    │
│  ▓▓▓▓ 高亮字 ▓▓▓▓          3/4 侧身 / 指向标题   │
│  英文幽灵层(半透明压在标题后)                     │
│  ── 副钩子短句 ! ──                            │
└─────────────────────────────────────────────┘
        ↑ 这只是「主标左·主体右」一种,换构图见下表

这套元素 + 任一构图 暗版亮版通用,差别只在「背景影调 + 主体光照 + 文字撑读方式 + 氛围元素」。

要点:

  1. 构图从「构图库」随机选,不锁右侧:主体可左 / 中 / 右 / 前景大头 / 底部探出 / 对峙 / 分屏(见下表);核心只有一条——主标题与主体不互相遮糊,缩略图一眼读到标题。
  2. 主体要够大:人物至少占到半身(前景大头构图更是脸占大头)。脸越小越跑(工具硬上限),封面天然适合给脸足够像素。
  3. 顶角默认留空——不上品牌条 / 栏目名 / 英文 slogan(如「GenJi冷知识」「DAILY FACT CHECK」这类顶部标签一律不要)。封面只承载「主标题 + 高亮字 + 一句副钩子」,文字越少越秒懂。运营信息(IP 名、栏目名、期号)写进视频简介 / 标题,不上封面。用户明确反馈(2026-06-24)。

构图库:主体不锁右侧(v1.2 核心,随机选位)

同一套元素可以摆成很多构图。每张封面从下表随机抽一种,一批 3 张默认构图各不相同。下列是常用项,不是穷举——也可自由组合 / 新创,只要守住「文字不被主体糊住、缩略图读得到标题」:

构图主体位置主标题落点适合一句话画面
左置人物在左、3/4 朝右右侧大字人物望向标题、引导视线主体左、视线/手势把眼睛带到右边的字
居中主体正中、看镜头标题在上下两条或绕主体环抱对视感强、单人高光大头/半身居中,标题分跨顶部与底部
前景大头(特写)脸/上半身怼满、近景大占比标题压在一侧或半透叠脸缘情绪脸、锁脸最稳(脸像素最多)超大脸占 50–70%,标题贴边不挡五官
底部探出主体从画面下缘探半身/露头上来标题占上半幅上文字下人物、留出顶部大字区人物像从下方冒出来,上方一片留给标题
左右对峙两个主体(或主体 vs 对象)分踞左右标题压中缝 / VS 字对决、挑战、二选一、对比左 A 右 B 中间对冲,红蓝分场 + 中缝大字
斜角构图主体沿对角线、动势倾斜标题顺另一条对角压角活力、动感、运动、爆点画面被一条斜线切,人物与字各占一斜半
分屏构图画面竖切/横切成 2–3 格,主体分格标题压在分隔条或跨格前后对比、多状态、流程、Tier左「之前」右「之后」,中条嵌标题

选位规则:

影调:暗版 / 亮版双范式(v1.1 核心,随机产出)

同一套版式骨架有两种影调,每张封面随机选一种;一批 3 张默认两种都出现。两者不是好坏之分,是不同情绪气口:

维度暗版(悬疑 / 揭秘 / 暗黑)亮版(积极 / 科技 / 对决 / 活力)
背景深色科技底(蓝黑 / 红黑),四角压暗托主体高调明亮底(亮蓝 / 白 / 浅色),通透高曝;亮体育馆、亮办公室、数据中心、亮天空
主体光照暗部反衬 + 局部边缘高光正面均匀打亮,肤色明亮干净
文字撑读靠暗底反衬浅色字厚白多层描边 + 投影 + 高饱和填充(亮底上靠描边和饱和度抢出来)
氛围元素危险信号:骷髅 / 警示三角 / 火花 / 暗电光明亮科技:全息 HUD 面板 / 数据流 / 发光 AI 芯片 / 上升箭头 / 发光图标
强调色警示黄、血红亮蓝、荧光绿、亮黄、橙红

亮版的成败关键:背景亮了之后,文字最容易糊。所以亮版主标题必须厚白描边(常 2–3 层)+ 深色投影 + 高饱和填充色,别用低饱和浅字压在亮底上(会糊成一团)。

影调选择规则

字体与文字系统(封面成败关键)

配色情绪模板(按题材选,再叠加影调)

先按题材定基调,再叠加第三步选定的暗版 / 亮版影调:

题材暗版基调亮版基调强调色
科技 / AI蓝黑 + 暗电路光亮蓝 + 白 + 全息 HUD 高曝电光紫 / 青 / 荧光绿
揭秘 / 暗黑红黑 + 压暗 + 危险信号(暗黑题偏暗版;要亮版则亮蓝底 + 强警示色对冲)警示黄 / 血红
对决 / 挑战深色擂台 + 聚光亮体育馆 / 数据中心 + 通透高曝红 vs 黄、亮蓝
活泼 / 梗暗底高饱和撞色亮底高饱和撞色 + 漫画描边紫 / 青 / 黄 / 荧光绿
教学 / 正经深蓝 + 暖金亮白办公室 + 浅蓝白 / 暖金 / 亮蓝

第四步:写 GPT Image 2 提示词(中间产物)

把第二、三步的决定翻译成一条结构化 prompt。先给用户看 prompt 再出图,重点核对「文字内容」和「身份锚点」两块。

提示词分块(英文为主、中文字符串照抄):

[1·画幅] Wide 16:9 horizontal video thumbnail, bold YouTube/Bilibili cover style.

[2·锁脸] A [年龄/性别] with the EXACT facial identity from the attached
reference photo — keep the same [点名锚点:如 round face, large blue-grey eyes],
same face shape, eyes, nose, lips, skin tone. Do NOT beautify or alter features.
[主体景别与姿态,按本张构图填:half-body / big close-up face / two figures facing off
/ emerging from bottom edge ... , 3/4 turned / looking at camera / pointing].

[3·构图·按本张构图库选项填] Composition: [构图英文,二选一示例:
  · 左置  Subject on the LEFT facing right; HUGE bold Chinese title fills the RIGHT ~50%.
  · 居中  Subject CENTERED looking at camera; title split across top and bottom bands.
  · 前景大头  Extreme close-up face filling 50–70%; title hugs one edge, never covering the face.
  · 底部探出  Subject emerges from the BOTTOM edge; title occupies the upper half.
  · 左右对峙  Two figures on LEFT vs RIGHT facing off; big title / "VS" down the center seam.
  · 斜角  Subject along a diagonal, dynamic tilt; title runs along the opposite diagonal corner.
  · 分屏  Frame split into 2 panels (before/after); title sits on the divider or spans panels.
]. Keep title and subject from overlapping; title stays readable at thumbnail size.

[4·文字内容·逐条列清] Render ONLY this exact text — no other text anywhere:
  - Main title: "折解" in [color], thick [outline color] outline.
  - Highlight: the character "V4" in bright yellow.
  - Subtitle: "DeepSeek" white bold below.
  - Ghost English behind title: "DISASSEMBLE" large, low-opacity.
  - NO top brand bar, NO channel name, NO English slogan in the top corners.
  - Keep the top-left and top-right corners clean / empty.

[5·配色氛围 — 二选一,按本张影调]
  · 暗版: deep blue-black (or red-black) tech background, vignette darkening the
    four corners, moody rim light on the subject, [危险元素: sparks / warning
    triangle / circuit lines]. Title in light color reads against the dark base.
  · 亮版: BRIGHT high-key background (bright blue / white, airy, overexposed) —
    [亮场景: bright arena / bright office / data center / bright sky], frontal even
    lighting on the subject, glowing holographic HUD panels / data streams / rising
    arrows / glowing AI chip. Title MUST have a thick white multi-layer outline +
    drop shadow + high-saturation fill so it stays readable on the bright base.

[6·质感] Cinematic lighting, high contrast, crisp poster typography, ultra-detailed, 4k.

[7·负面] No garbled text, no misspelled Chinese characters, no extra random text,
no top brand bar / channel name / English slogan in the corners,
no watermark, no blurry low-quality.

写 prompt 的硬规则:

  1. 锁脸块永远在最前面且显式禁美化——GPT Image 2 默认会顺手美化导致跑脸。
  2. 中文文字必须逐条列出确切字符串 + 颜色 + 位置,别让模型自己编字。
  3. 主标题字数压到 2–4 字:中文越短越长的句子越容易糊/错字。复杂生僻字尽量避开或换近义短词。
  4. 负面词必带 no garbled text, no misspelled Chinese characters
  5. 每条 prompt 标注本张构图(左置 / 居中 / 前景大头 / 底部探出 / 左右对峙 / 斜角 / 分屏),[3·构图] 块按构图填;一批 3 张构图尽量各不相同。
  6. 每条 prompt 标注本张影调(暗版 / 亮版),[5·配色氛围] 块按影调二选一填;一批 3 张里明暗都要有。
  7. 一个钩子一条 prompt;3 个钩子 = 3 条 prompt。

第五步:调用 GPT Image 2 出图

出图机制比 prompt 更决定质量出图机制优先律_智能体原生出图vs盲调API_v1,实测同套 prompt 两个档次):


第六步:自检 + 锁脸补救阶梯

出图后逐张自检:

锁脸三级补救阶梯(按性价比,来自 GPTImage2锁脸的脸占比上限_v1):

  1. 对话式微调(首选)The face is not matching the reference. Regenerate with her EXACT face from the photo: [点名锚点]. Keep pose, scene, text the same. —— 只动脸不动景。
  2. 拉近景别:全身→半身/七分身,脸占比一上去锁脸立刻稳。封面本就该给脸足够像素。
  3. 两步合成(终极):先出脸部特写确认锁脸,再融合氛围图。要求最高时用。

收尾铁律:锚点对 + 气质对 + 文字无错 = 可定稿。别为修小瑕疵重抽——重抽有脸再次跑偏的风险,见好就收。


交付格式

交付时给:

不长篇讲设计理论。用户要的是能直接发的封面。


禁止行为


关联文档