出图机制优先律 · 智能体原生出图 vs 盲调编辑 API v1
入档:2026-06-26 触发:B站冷知识封面量产,同一套提示词,Codex 出图参考级、我写脚本盲调 API 出图却文字错 / 截断 / 脸漂。排查后发现差距全在「出图机制」,与 prompt 无关。已实测验证。 关联:生成式vs编辑式工具选择律_v1 / GPTImage2锁脸的脸占比上限_v1 / 识别工具天花板的时机
一句话律
出图质量先看「机制」,再看 prompt。 同一条提示词,用「会看着自己的成图反复自纠的智能体原生出图工具」和用「脚本盲调一次成图的 API」,质量是两个档次。出图反复不行时,先问「我是不是用错了出图路径」,别再死磕 prompt。
案例:同一套提示词,两个档次
做一批 B站冷知识辟谣封面(人物参考图 + 视频脚本 → 一步出含中文大字的 16:9 封面)。两边的提示词结构几乎一样(锁脸块前置 / 逐字列中文 / 构图 / 影调 / 装饰 / 负面词),结果天差地别:
| ❌ 盲调编辑 API(差) | ✅ 智能体原生出图(参考级) | |
|---|---|---|
| 路径 | 脚本直接 client.images.edit | Codex 调 image_generation 工具 / API 用 Responses + 同款工具 |
| 模型 | 老 gpt-image-1 | 视觉模型(gpt-5.5)驱动,可挂 gpt-image-2 |
| 参考图角色 | 当「编辑底图」→ 顺着原图结构硬改 | 当「身份参照」input_image → 自由重构只锁身份 |
| 画幅 | 原生 3:2,要再裁 → 裁掉贴边的字 | 工具原生直接输出真 16:9,不用裁 |
| 闭环 | 一次成图,模型看不到自己画的结果 | 模型看着成图自纠,错字/跑脸当场重画 |
| 结果 | 大标题爱出错字、画面被截断、人脸漂移 | 文字零错、无截断、跨图人物一致 |
关键:不是 prompt 没写好,是出图路径选错。 在盲调一次成的 API 上,再好的提示词也救不回「看不到结果就没法自纠」这个先天缺陷。
为什么「会看图的智能体闭环」更强
普通出图 API 是开环:把 prompt 丢进去,吐一张图出来,模型不知道自己画成了什么样——中文错字、文字被边缘切掉、脸跑了,它全都察觉不到,你只能靠重试碰运气。
智能体原生出图工具是闭环:负责出图的是一个能看图的多模态模型,它生成后能审视结果,发现「字错了 / 脸不对 / 构图糊了」就当场再画一版。这等于把人工「出图→挑错→重述确切文字→重出」的循环,内化进了一次工具调用里。所以中文渲染、锁脸、版式这些最吃自纠的环节,质量明显更稳。
这也呼应 GPTImage2锁脸的脸占比上限_v1 的三级补救——「看图自纠」本质就是把「对话式微调」自动化了。
正解配方(API 侧复刻智能体出图)
没有 Codex / ChatGPT 客户端、只能用 API key 时,用 Responses API + image_generation 工具复刻同款机制:
stream = client.responses.create(
model="gpt-5.5", # 会看图的驱动模型(非 gpt-image-1)
input=[{"role": "user", "content": [
{"type": "input_text", "text": 封面指令}, # 锁脸+逐字中文+构图+影调
{"type": "input_image", "image_url": f"data:image/png;base64,{参考图}"}, # 身份参照
]}],
tools=[{"type": "image_generation"}], # 原生出图工具,自己出真 16:9
stream=True, # 流式保活(出图久,防长连接被代理掐断)
)
# 从 partial_image_b64 / response.completed 的 image_generation_call.result 取图
要点:
- 参考图走
input_image(身份参照),不要走images.edit(编辑底图)——前者让模型自由重构只锁脸,后者被原图结构绑死。 - 画幅交给工具:自然语言说「Wide 16:9」即可,工具原生出宽图,不要事后中心裁切去啃字。
- 流式 + 重试:这类调用耗时长(单张 1–2 分钟),走代理时长连接易 SSL 断,必须 stream 保活 + 指数退避重试。
排错
| 现象 | 大概率根因 | 对症 |
|---|---|---|
| 大标题反复错字 / 乱码 | 用了盲调一次成的 API,无自纠 | 换会看图的智能体出图工具/Responses image_generation |
| 文字被边缘切掉 | 出图比例≠交付比例,事后中心裁切 | 让工具原生出目标比例,不裁;或文字留安全区 |
| 人脸/服装漂移 | 参考图当编辑底图被重绘,或景别太碎 | 参考图作 input_image 身份参照 + 锁服装 + 七分身够大 |
| 中文复杂字(如「剪」)偶发错 | 模型对生僻/笔画多的字渲染不稳 | 优先换等义常用字,比反复重出划算 |
举一反三
- 任何「图生图 / 带参考图出图」任务,先选机制再写 prompt:要原样保留多→编辑式(生成式vs编辑式工具选择律_v1);要自由造图+锁身份+吃自纠→智能体原生出图工具。
- 判断「该换工具还是该调 prompt」:同一 prompt 在工具 A 反复不行,先怀疑工具/机制,别无限调参(识别工具天花板的时机 / MJ出图绕开抠图陷阱)。
- 凡是吃「自纠闭环」的环节(中文文字、锁脸、精确版式),优先放到能看图的模型链路里做。
规模验证(2026-06-26 补)
本律从 10 张测试提炼,同日100 张量产复现:同一主题、同款 Responses + image_generation + gpt-5.5 机制,0 失败、未触额度、质量与测试批一致(文字零错 / 无截断 / 跨图人物一致 / 真 16:9),连分屏对比这种硬构图也稳。结论在规模上成立,不是单张运气。约 7.4k tokens/张(gpt-5.5,出图费另计)。
配套的批量方法:把单主题做成 N 张不重复封面时,用「curated 安全字标题钩子池 × 构图 × 影调」组合去重,而不是纯随机生成标题——
- 标题钩子人工备好一池(每个知识点几个 2–4 字、全用常用字、避开难字如「剪」),保证每条都通顺可出;
- 再与构图库 / 暗亮影调做笛卡尔组合、按「标题+构图+影调」唯一去重,凑够 N 张;
- 表情 / 手势 / 主题背景按池轮换增加多样性。 这样既上量又每张质量可控,避免「让模型自由编标题」带来的错字 / 尬词。
关联文档
- 2026-06-26_B站冷知识封面量产_出图机制复盘 —— 本律的来源案例(同套prompt两个档次的完整踩坑与回正 + agent自检)
- 生成式vs编辑式工具选择律_v1 —— 工具选择的另一轴(保留占比),与本律(机制/闭环)互补
- GPTImage2锁脸的脸占比上限_v1 —— 「看图自纠」即把锁脸三级补救自动化
- 识别工具天花板的时机 —— 同一 prompt 反复不行时,先换工具/机制
- MJ出图绕开抠图陷阱 —— 同为「选对做这件事最省力的路径」的工具智慧
- 应用 skill:
aigc-video-cover-gpt(视频封面一步出图,本律是其出图机制的实测依据) - 索引入口:04_方法论与洞察索引