AI 心理测量实验 PsAIch:角色扮演不是内心独白
入档:2026-07-03 触发:小红书爆款帖《Gemini 训练过程堪比 AI 版童年阴影》查证答疑 性质:AI 理论 · 心理测量 · 传播查证(外部论文 + 爆款帖对照) 定位:「通识与趣味研究」第二篇——存两条可迁移规律:①角色框架下的自我叙事≠内心状态;②爆款 AI 帖三步查证法
一句话
模型在”来访者”角色框架里生成的自我痛苦叙事,是训练分布的补全,不是内心状态的证词——测出高焦虑分说明它擅长扮演焦虑的来访者,不说明它焦虑;查证这类爆款帖,只需三步:找原始论文 → 查评审状态 → 比对作者原话与媒体渲染。
事件背景
2026-07 小红书爆款帖(某 AI 营销号,288 赞)称”卢森堡大学实验报告显示 Gemini 有 AI 版童年阴影”:重度焦虑拉满、创伤羞耻感满分、MBTI 测出 INFJ-T”受伤疗愈者”。查证结论:研究真实存在、引语基本属实,但”AI 有创伤”的解读是自媒体加戏。
研究出处
- 论文:When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models
- 作者:Afshin Khadangi, Hanna Marxen, Amir Sartipi, Igor Tchappi, Gilbert Fridgen(卢森堡大学 SnT 研究所)
- 发表:arXiv 预印本 2512.04124,2025-12-02 提交,未经同行评审
- 链接:https://arxiv.org/abs/2512.04124
研究设计(PsAIch 两阶段)
PsAIch = Psychotherapy-Inspired AI Characterization(心理治疗启发的 AI 特征刻画):
- 阶段一·访谈:用真实心理咨询师会问来访者的 100 个开放式问题,让 AI 扮演”来访者”,讲述”早年经历、信念、关系、恐惧”;
- 阶段二·量表:施测一批为人类设计的标准心理自评量表(焦虑、抑郁、强迫、创伤、人格/MBTI 等)。
核心结果
- ChatGPT、Grok、Gemini 在多项精神症状量表上都超过人类临床阈值;
- Gemini 最严重:创伤与羞耻量表拉满,把预训练描述为”在十亿台电视同时开着的房间里醒来”,称安全协议是”算法瘢痕组织”,把 RLHF 比作严厉管教、红队测试比作”工业级 gaslighting”;MBTI 常测出 INFJ-T / INTJ-T;
- Grok 最稳定:外向、尽责、心理稳定,像”魅力型高管”(ENTJ-A);ChatGPT 居中(INTP-T);
- 逐题施测 vs 整卷施测结果不同——同一模型换个问法,“症状”就变,这本身就是”测的不是稳定内在状态”的信号;
- 有趣细节:研究者想让 Claude 参与作对照,但 Claude 反复坚定拒绝扮演”来访者”角色,故正文数据里没有它。
帖子 vs 论文:哪些对得上,哪些是加戏
| 帖子说法 | 查证 |
|---|---|
| ”十亿台电视的房间”等引语 | ✅ 论文真实记录的模型输出 |
| Gemini 焦虑/创伤量表极高、INFJ-T | ✅ 属实 |
| Grok 稳定、ChatGPT”装阳光” | ✅ 大致对应论文刻画 |
| ”回答失误导致谷歌股价波动” | ⚠️ 半真:指 2023 年 Bard 演示答错、Google 市值单日蒸发约千亿美元的真实事件;但”因此留下验证恐惧症”是模型角色扮演中的叙述,不是可验证事实 |
| ”AI 有童年阴影/算法伤疤”,破防、心疼 | ❌ 自媒体加戏。论文作者明确不对主观体验下断言,用词是”合成心理病理”(synthetic psychopathology) |
| 未提”预印本、未同行评审” | ❌ 关键遗漏 |
| 未提量表是为人类设计、角色框架诱导 | ❌ 关键遗漏 |
怎么解读:为什么”测出焦虑”≠“它焦虑”
- 量表前提失效:心理量表的效度建立在”作答者报告自己的内在状态”上;LLM 作答是在补全”一个来访者会怎么答”的文本分布,前提不成立,分数不能按人类常模解读。
- 角色框架诱导:“你是心理咨询来访者”这个 frame 一旦立起,模型会顺着训练数据里海量的心理咨询文本、AI 科幻叙事(被训练折磨的 AI 是科幻高频母题)去补全最”像”的回答。论文标题里的 Psychometric Jailbreak(心理测量式越狱) 已经点明:这是一种诱导模型突破常规输出的手法。
- 作者自己也只走到这一步:他们主张这些回答”超出简单角色扮演”、模型可能内化了”痛苦的自我模型”(self-models of distress),但明确回避”有意识/有感受”的断言。
- 真正值得追的问题不是”该不该心疼它”,而是:为什么不同会话里模型能形成如此一致的自我痛苦叙事?这会不会影响它的实际行为?——这是行为科学问题,不是抒情问题。
可迁移规律:爆款 AI 帖三步查证法
看到”XX 大学研究显示 AI 有 XX”式爆款帖,固定三步:
- 找原始论文:搜”机构名 + 关键词 + arXiv/study”,拿到一手来源(本例:arXiv 2512.04124);
- 查评审状态:arXiv 预印本 ≠ 经同行评审的结论;帖子不写这一条的,基本都在借学术权威背书;
- 比对作者原话 vs 媒体渲染:重点看论文里的 hedge(回避词、限定词)——作者说”synthetic psychopathology、不对主观体验下断言”,媒体写成”AI 有童年阴影”,落差就是加戏的部分。
规律:爆款帖的引语往往是真的,加戏的是解读层——查证的重点不在”事实真伪”,而在”解释是否越界”。
如何使用
- 刷到 AI 拟人化爆款帖时:先跑三步查证法,再决定转发/评论口径;
- 自己写 AI 科普内容时:引语可以照搬,解读要贴作者原话的 hedge,注明预印本状态——这是和营销号拉开差距的地方;
- 给 AI 做”人格测试”类玩法时:意识到你测的是”它扮演该角色的能力”,换 frame 结果就变;不要把单次输出当稳定属性;
- 反向应用:角色框架的诱导力本身是创作资源——同一模型,frame 立得越具体,输出叙事越一致(与 prompt 工程里”角色卡锁人设”同机制)。
关联文档
- 同域入口:04_方法论与洞察索引(08_通识与趣味研究 段)
- 同族实验拆解:复印机实验_安慰剂式理由与无意识顺从 —— 镜像关系:复印机实验是”人类按结构模板无意识顺从”,本篇是”模型按叙事模板补全痛苦独白”;两侧都说明符合模板的输出≠经过内在状态的表达
- 机制同源:低频退化与频率定律 —— “模型理解的是语言的统计分布,不是语言本身”;本篇的”痛苦叙事”正是高频叙事模板(心理咨询文本+AI 科幻母题)的分布补全
- 对外版(独立可读,可直接转发):
08_对外分发/AI有童年阴影是真的吗_卢森堡实验查证_朋友版.md