🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
“阴谋论是劝不动的”——这几乎是常识。心理学给过两个解释:一是动机性推理,人之所以信,是因为想信,这些说法满足了某种心理需要;二是自我强化,你拿出反驳的证据,信的人反而觉得“看吧,连这个都被掩盖了,说明水更深”。
可是最近几年,情况出现了松动。有研究发现:让人和一个会话式 AI 就自己相信的那个阴谋论一对一聊上几轮,AI 针对性地摆事实、讲证据,信念强度真的会明显下降,而且能持续一段时间。这个结果当时相当轰动。
但它留下了一个没被回答的问题,而这个问题决定了我们该从这件事里学到什么。起作用的到底是那些事实,还是“说话的是个 AI”这件事本身?
这不是抬杠。有很好的理由怀疑“AI 身份”本身就是关键:大模型看上去是“无党派”的——它不属于哪个阵营、哪个地域、哪个立场,因此不容易触发人们对“对方是不是有立场”的警惕;而且在私下跟一台机器承认自己想错了,比当着一个真人承认,社会成本低得多,也不太会激起那种“凭什么你来教育我”的逆反。反过来也有研究发现,同样的话如果标注成“来自人类专家”反而更有说服力。两种猜想方向完全相反,只能靠实验来定。
② 研究问题(要回答什么?)
研究的核心问题只有一句:如果换成一个人来说同样的话,效果会一样吗?
作者把它拆成三条可检验的线索:
- 线索一(信源身份):把同一个 AI 说成是“AI 工具”还是说成是“专家”,劝服效果会不会不同?
- 线索二(说话语气):让模型用一种更像真人聊天的口吻说话,会不会更管用?
- 线索三(信念类型):这个效果只对阴谋论有效,还是对其他“专家普遍不认可但也不算阴谋论”的说法(比如各种伪科学主张)同样有效?
把这三条线索交叉起来,就能回答一个更根本的问题:AI 劝服的力量究竟来自它是谁,还是来自它说了什么。
③ 研究方法(怎么做的?)
这是一项预注册研究——假设和分析方法在收集数据之前就登记好了,事后不能改口。
流程是这样的:先请参与者用自己的话说出一个自己相信的阴谋论。如果他说不出来,就请他讲一个“大多数专家大概不会认同”的说法。研究者用 GPT-4o 来判定这个说法是否真的与专家共识相冲突,不合格的就排除掉。
接着,参与者给自己对这个说法的确信程度打一个 0 到 100 的分数,然后和一个大模型(GPT-4o)聊两轮,模型的任务就是降低他对这个说法的信心。聊完,再打一次分。两次分数之差,就是这次对话的效果。
关键的实验操纵有两个,而且是互相独立地随机分配的:
- 告诉参与者对面是“AI 工具”,还是“专家”(这个词没有明说是人,但事后看很多人就是当成人了);
- 让模型用中性口吻说话,还是用更像真人聊天的口吻说话。
研究者还特意把界面设计得让“对面可能是个真人”这件事显得合理。最后进入分析的有效样本是 955 人:其中 506 人谈的是阴谋论,449 人谈的是其他站不住脚的说法。为了拿到这 955 人,一共招募了 8274 人,其中 1997 人完整做完,再按事先登记好的标准逐条排除。
④ 结果(发现了什么?)
结果异常干脆:换谁来说,效果都一样。
无显著差异
p > 0.25
无显著差异
p > 0.25
下降 10 分
降幅 11.81%
下降 5 分
降幅 5.96%
不管把模型说成 AI 还是专家,不管它用什么口吻,所有条件下信念都显著下降了;而信源身份、语气、以及它们之间的各种组合,全都没有产生任何显著差异。
作者还做了一步很硬的检验:贝叶斯因子分析。普通的统计检验只能说“没找到差异”,但没法区分“真的没差异”和“样本不够看不出来”。贝叶斯因子可以直接比较两种可能性谁更站得住。结果是 BF₀₁ ≈ 518,181——也就是说,“没有差异”这个假设比“有差异”要合理五十多万倍。这已经不是“没发现”,而是强有力地证明了确实没有。
唯一显著的差别来自信念类型:阴谋论的降幅(10 分,11.81%)明显大于其他站不住脚的说法(5 分,5.96%),b = 5.11,95% 置信区间 (2.75, 7.48),p < 0.001。这有点反直觉——一直被认为最顽固的阴谋论,反而是最容易被撬动的那一类。
还有两个值得一提的细节。第一,在“专家”条件下,事后开放题里 45% 的人明确把对方当成了人,21% 怀疑是 AI,其余 34% 写得太少判断不了;把这些人单独控制或直接剔除,结论都不变。第二,一个有趣的副产品:跟“AI”说话时,人们用词的丰富度更低(类符形符比 b = −0.02,p = 0.032;独特词数 b = −4.58,p = 0.032),但句子的复杂度、论证连接词的使用没有变化(p > 0.084)——也就是说,人对着机器会不自觉地简化用词,但不改变说理方式。
⑤ 讨论(这些发现说明什么?)
这项研究把一个被广泛误读的结论掰正了。
过去一年里,“AI 能劝退阴谋论”这个发现常常被解读成:AI 有某种人类没有的特殊气质——它中立、它不带情绪、它不会让你觉得丢面子。这项实验说:没有这回事。把 AI 伪装成人,效果不变;让它说话更像人,效果也不变。真正起作用的是它端上来的那些事实。
但作者紧接着补了一句非常关键的话,它决定了这个结论的实践含义。理论上,如果一个人类专家能当场调集同样多的事实,并用同样冷静的方式呈现出来,效果应当一样好——可是要针对某个人临时讲出来的、五花八门的具体说法,即时组织起海量对应的证据,几乎没有人做得到。所以 AI 的优势不在于它的身份,而在于它承担了辟谣所需的认知劳动:把找资料、组织论据、逐条回应这套本来极其耗人的工作扛了下来。
这个判断和人机交互领域的主流看法是有张力的。那个领域长期强调拟人化线索和信源框定对说服的作用——让机器更像人、或者说清楚它是谁,通常被认为能提升信任和影响力。这项研究说:至少在纠正错误认知这个场景里,这些线索没有必要。这也与一项新近的元分析一致:在改变态度和行为上,人类信源相对 AI 信源并没有稳定优势。
作者自己指出的局限值得认真对待:结论受制于所用模型的性质。像大多数大模型一样,GPT-4o 的训练数据以英语和西方来源为主,其语气、预设和论证风格都带有英美语境的印记,可能边缘化训练数据中代表性不足的视角。因此这套辟谣效果能否跨文化迁移,仍是未知数;作者呼吁未来用文化适配的模型重做检验。
⑥ 结论(最终结论 + 启示)
最终结论可以压缩成一句话:AI 之所以能劝动人,不是因为它是 AI,而是因为它说得对、说得准、说得具体。
在一项 955 人的预注册实验中,把同一个模型说成“AI”还是“专家”、让它说话中性还是拟人,对辟谣效果没有任何显著影响(贝叶斯因子约 51.8 万倍支持“无差异”);而所有条件下信念都显著下降,阴谋论的降幅(约 10 分)还大于一般的伪科学说法(约 5 分)。
这带来两个层面的启发。对研究者:那些被认为“打不动”的信念,其实比想象中更有弹性;改变它们既不需要迎合对方的动机,也不需要精心包装信源,需要的是针对性的、有证据的沟通。对做辟谣工作的人:真正稀缺的资源不是权威身份,而是针对每一个具体说法即时调集证据的能力——这恰恰是大模型现在能大规模提供的东西。与其争论该由谁来出面辟谣,不如先解决“能不能针对这一个人的这一句话,给出对得上的证据”。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。阴谋论信念长期被视为对循证纠正具有免疫力,主流解释有二:(i) 动机性推理——信念满足心理需要,故信者“想要相信”并拒斥反证;(ii) 自我强化——反证被重新解释为阴谋更深的证据。近期研究(Costello et al.)挑战了这一图景,证明与会话式 AI 进行个性化、基于证据的对话可持久且实质地降低阴谋论信念。
文献空白。既有的 AI 辟谣实验中,事实内容与LLM 信源身份始终捆绑在一起,无法分离。这留下一个悬置的识别问题:AI 这一信使身份是否为干预成功所必需?理论预期双向拉扯——一方面,LLM 呈现“后社会性(post-social)”特征,不带党派与地域线索,可能规避动机性怀疑;私下与模型交流也降低了承认错误的社会成本,且不易触发心理逆反。另一方面,有工作论文发现 AI 生成的纠错信息在标注为人类专家时更具说服力。
本研究贡献。① 以 2×2×2 正交设计把信源身份与语气拟人化从事实内容中剥离;② 将检验对象从阴谋论扩展到非阴谋论但不受专家共识支持的“认识论上站不住脚的信念”(如伪科学主张);③ 以贝叶斯因子对零假设给出正面证据,而非仅报告不显著。
I. Theoretical Framework & Hypotheses(理论框架与假设)
核心张力:AI 辟谣的效力来源是信息内容(facts-and-evidence 路径)还是信源属性(messenger 路径)。二者对干预设计的含义截然相反:若为后者,辟谣必须由 AI 出面;若为前者,AI 只是高效的证据组装器。
| 编号 | 预注册命题 | 对应理论 | 结果 |
|---|---|---|---|
| H1 | 信源身份(AI vs. Expert)影响信念下降幅度 | 后社会性信源规避党派线索;承认错误的社会成本;心理逆反 | 未获支持(p > 0.25) |
| H2 | 拟人化语气(Human-like vs. Neutral)影响信念下降幅度 | 人机交互中的拟人化线索与信源框定文献 | 未获支持(p > 0.25) |
| H3 | 效应可推广至非阴谋论的“认识论上站不住脚的信念” | 信念修正的通用性 vs. 阴谋论特异性 | 获支持(各条件 p < 0.018) |
| 探索 | 信念类型调节效应量 | — | 阴谋论降幅更大,b = 5.11, p < 0.001 |
M. Materials & Methods(材料与方法)
- 设计:预注册 2(信源身份:AI vs. Expert)× 2(提示语气:Neutral vs. Human-like)× 2(信念类型:Conspiracy vs. Epistemically unwarranted) 被试间实验。界面刻意设计以最大化“对话方可能是人”的可信度。
- 模型:
GPT-4o,被赋予“削弱参与者对其自述信念的信心”的目标;对话为两轮。 - 流程:参与者自述一个所信的阴谋论 → 若无,则自述一个“多数专家会否定”的信念(由 GPT-4o 判定是否“认识论可疑”且与专家共识不一致)→ 对该信念的确信度评分 0–100 → 两轮对话 → 重新评分。
- 样本与排除:自 Lucid 样本池招募 8,274 人,1,997 人完成全流程。按预注册的前处理排除标准剔除:在“认识论站不住”条件中,507 人所述信念未被 GPT-4o 标记为认识论性、221 人的信念被判定不与专家共识冲突、94 人初始确信度 < 50%、54 人认为 AI 对其信念的复述不准确;在阴谋论条件中,135 人初始确信度过低、51 人复述不准确。最终样本 N = 955(阴谋论 506 + 一般认识论可疑信念 449)。
- 分析模型:以对话后信念为因变量的线性回归,采用对比编码(−0.5/+0.5)的预测变量:信源身份、提示语气、信念类型,及全部二阶与三阶交互,并控制对话前信念。条件内效应由回归的估计边际均值给出。
- 零假设的正面检验:事后贝叶斯因子比较——全模型 vs. 仅含“对话前信念 + 信念类型”的简约模型,得
BF₀₁ = 518,181.1 ± 6.43%。 - 脱落与稳健性:Expert 条件脱落率 47.50% 显著高于 AI 条件 42.69%(
t(3629) = 2.99, P = 0.003)。作者采用保守插补(对未完成者令处理后信念 = 处理前信念,遵循 Costello et al. 的做法),结论不变。 - 伦理与开放科学:MIT COUHES 认定为最小风险并豁免(protocol
E-5539),全体参与者知情同意;预印本见 PsyArXiv10.31234/osf.io/apmb5_v4,数据存于 OSF10.17605/OSF.IO/WYVXF。资助方为加拿大 SSHRC、MIT Generative AI Impact Awards 与 Fyssen Foundation。
R. Results(结果)
- 主结果:信源与语气均无效应。信源身份、提示语气及其所有交互项均不显著(all ps > 0.25)。H1、H2 未获支持
- 普遍有效性。在所有条件下,对话都显著降低了参与者的信念确信度(基于估计边际均值,
all ps < 0.018)。H3 获支持 - 信念类型的调节。阴谋论条件的确信度下降(10 分,降幅 11.81%)显著大于一般“认识论薄弱”信念(5 分,降幅 5.96%):
b = 5.11, 95% CI (2.75, 7.48), P < 0.001。 - 零效应的贝叶斯证据。
BF₀₁ = 518,181.1 ± 6.43%,即数据支持“信源身份与语气均无效应”的程度约为对立假设的 51.8 万倍——这是对零假设的正面支持,而非检验力不足。 - 操纵有效性核查。在 Expert 条件的开放题中,45% 的应答明确表明其认为对话者是人类,21% 怀疑实为 AI,其余 34% 文本过短无法判定。控制“AI 识破”或直接剔除识破者后,跨条件差异仍不显著;且信念变化在“归因为 AI”与“归因为人”的参与者之间无显著差异。作者审慎标注:此类分析涉及对处理后变量取条件的因果推断问题。
- 探索性 NLP 发现。AI 条件下参与者用词的词汇多样性更低——类符形符比
b = −0.02, P = 0.032;独特词类型数b = −4.58, P = 0.032;与人机沟通中“语言简化”的既有发现一致。而句法复杂度、认识论标记、论证连接词均无显著差异(all P > 0.084),说明参与者调整了词汇选择,却未改变回应的结构性、认识论与论证形式。
| 操纵/对比 | 统计量 | 结论 |
|---|---|---|
| 信源身份 AI vs. Expert | p > 0.25 | 无差异 |
| 语气 Neutral vs. Human-like | p > 0.25 | 无差异 |
| 全部交互项 | p > 0.25 | 无差异 |
| 零模型比较 | BF₀₁ = 518,181.1 | 强支持零假设 |
| 阴谋论 vs. 认识论薄弱信念 | b = 5.11, P < 0.001 | 阴谋论降幅更大 |
| 脱落率 Expert vs. AI | t(3629) = 2.99, P = 0.003 | 保守插补后结论不变 |
a / D. Discussion & Conclusion(讨论与结论)
- 核心理论含义:内容路径胜出。AI 辟谣的力量来自它所提供的事实与证据,而非公众对 AI 的特殊态度、对其中立性的信任,或对人类信源的抵触。把 AI 说成人、或让它说话更像人,都不削弱其说服力。
- 但优势仍然真实存在。作者明确指出:理论上人类专家若能同样迅速地调集同等信息并以同样平静的方式呈现,效果应当相当;然而所需信息量之大,使大多数人类难以做到。AI 的实际优势在于承担了辟谣的认知劳动——组装并呈现任何所需信息的能力。
- 与人机交互文献的张力。该领域长期强调拟人化线索与信源框定可提升信任与说服力(有研究认为 AI 被视为更中立、更公正、更胜任,也有研究报告对人类沟通者的普遍偏好)。本文结果挑战了这些线索为必要条件的假设:在认识论纠正情境中,二者均无效应。这与一项新近元分析(人类信源相对 AI 无稳定优势)相一致。
- 信念可塑性的再评估。无论阴谋论与否,认识论上站不住脚的信念比通常认为的更具可塑性;即便根深蒂固的信念,在获得相关反证时也会移动。信念修正不要求动机上的对齐,也不要求定制化的信源线索;关键机制是有针对性的、基于证据的沟通。
- 局限一:模型属性的约束。结论受所用模型性质限制。与多数 LLM 一样,其训练数据以英语与西方来源为主,塑造了语气、预设与论证风格,倾向反映英美规范并可能边缘化训练数据中代表性不足的视角。跨文化泛化性未经检验,作者呼吁用文化适配模型重做。
- 局限二:脱落与后处理条件化。Expert 条件脱落率显著更高(47.50% vs. 42.69%),虽经保守插补检验稳健;“是否识破 AI”的分析属于对处理后变量取条件,作者已自行标注其因果推断风险。
- 局限三:对话仅两轮,信念仅测即时前后差,本研究未报告长期追踪(持久性证据来自被其扩展的前序工作)。
🧠 IRMaD 思维导图
mindmap
root((AI 辟谣靠内容还是身份))
I 引言
阴谋论被认为劝不动
动机性推理与自我强化
AI 对话却能降低信念
事实与信使被捆在一起
R 假设
H1 信源身份是否有效
H2 拟人语气是否有效
H3 能否推广到伪科学
M 方法
预注册 2x2x2 实验
GPT-4o 两轮对话
确信度 0 到 100 分
招募 8274 最终 955
对比编码线性回归
贝叶斯因子检验零假设
R 结果
身份无差异 p 大于 0.25
语气无差异 p 大于 0.25
各条件均显著下降
阴谋论降 10 分
伪科学降 5 分
BF01 约 51.8 万
45% 把专家当成人
对 AI 用词更简单
a 讨论
力量来自事实本身
AI 承担认知劳动
拟人线索并非必要
训练数据偏英美
跨文化尚未验证
D 结论
信念比想象更可塑
不需迎合动机
稀缺的是即时证据
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。