PNAS Nexus 4(11):pgaf325 · 预注册 2×2×2 实验 · MIT / Cornell / American University · 金色 OA (CC BY 4.0)

与大模型对话能削弱阴谋论信念——哪怕对方被当成了人

Esther Boissin, Thomas H. Costello, Daniel Spinoza-Martín 等 5 人 · PNAS Nexus · 2025 · DOI: 10.1093/pnasnexus/pgaf325
原题:Dialogues with large language models reduce conspiracy beliefs even when the AI is perceived as human
Open Access 新颖度 0.83

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

“阴谋论是劝不动的”——这几乎是常识。心理学给过两个解释:一是动机性推理,人之所以信,是因为想信,这些说法满足了某种心理需要;二是自我强化,你拿出反驳的证据,信的人反而觉得“看吧,连这个都被掩盖了,说明水更深”。

可是最近几年,情况出现了松动。有研究发现:让人和一个会话式 AI 就自己相信的那个阴谋论一对一聊上几轮,AI 针对性地摆事实、讲证据,信念强度真的会明显下降,而且能持续一段时间。这个结果当时相当轰动。

但它留下了一个没被回答的问题,而这个问题决定了我们该从这件事里学到什么。起作用的到底是那些事实,还是“说话的是个 AI”这件事本身?

这不是抬杠。有很好的理由怀疑“AI 身份”本身就是关键:大模型看上去是“无党派”的——它不属于哪个阵营、哪个地域、哪个立场,因此不容易触发人们对“对方是不是有立场”的警惕;而且在私下跟一台机器承认自己想错了,比当着一个真人承认,社会成本低得多,也不太会激起那种“凭什么你来教育我”的逆反。反过来也有研究发现,同样的话如果标注成“来自人类专家”反而更有说服力。两种猜想方向完全相反,只能靠实验来定。

② 研究问题(要回答什么?)

研究的核心问题只有一句:如果换成一个人来说同样的话,效果会一样吗?

作者把它拆成三条可检验的线索:

把这三条线索交叉起来,就能回答一个更根本的问题:AI 劝服的力量究竟来自它是谁,还是来自它说了什么

③ 研究方法(怎么做的?)

这是一项预注册研究——假设和分析方法在收集数据之前就登记好了,事后不能改口。

流程是这样的:先请参与者用自己的话说出一个自己相信的阴谋论。如果他说不出来,就请他讲一个“大多数专家大概不会认同”的说法。研究者用 GPT-4o 来判定这个说法是否真的与专家共识相冲突,不合格的就排除掉。

接着,参与者给自己对这个说法的确信程度打一个 0 到 100 的分数,然后和一个大模型(GPT-4o)聊两轮,模型的任务就是降低他对这个说法的信心。聊完,再打一次分。两次分数之差,就是这次对话的效果。

关键的实验操纵有两个,而且是互相独立地随机分配的:

研究者还特意把界面设计得让“对面可能是个真人”这件事显得合理。最后进入分析的有效样本是 955 人:其中 506 人谈的是阴谋论,449 人谈的是其他站不住脚的说法。为了拿到这 955 人,一共招募了 8274 人,其中 1997 人完整做完,再按事先登记好的标准逐条排除。

④ 结果(发现了什么?)

结果异常干脆:换谁来说,效果都一样。

说成 AI vs. 说成专家
无显著差异
p > 0.25
中性口吻 vs. 拟人口吻
无显著差异
p > 0.25
阴谋论信念
下降 10 分
降幅 11.81%
其他站不住的说法
下降 5 分
降幅 5.96%

不管把模型说成 AI 还是专家,不管它用什么口吻,所有条件下信念都显著下降了;而信源身份、语气、以及它们之间的各种组合,全都没有产生任何显著差异

作者还做了一步很硬的检验:贝叶斯因子分析。普通的统计检验只能说“没找到差异”,但没法区分“真的没差异”和“样本不够看不出来”。贝叶斯因子可以直接比较两种可能性谁更站得住。结果是 BF₀₁ ≈ 518,181——也就是说,“没有差异”这个假设比“有差异”要合理五十多万倍。这已经不是“没发现”,而是强有力地证明了确实没有

唯一显著的差别来自信念类型:阴谋论的降幅(10 分,11.81%)明显大于其他站不住脚的说法(5 分,5.96%),b = 5.11,95% 置信区间 (2.75, 7.48),p < 0.001。这有点反直觉——一直被认为最顽固的阴谋论,反而是最容易被撬动的那一类。

还有两个值得一提的细节。第一,在“专家”条件下,事后开放题里 45% 的人明确把对方当成了人,21% 怀疑是 AI,其余 34% 写得太少判断不了;把这些人单独控制或直接剔除,结论都不变。第二,一个有趣的副产品:跟“AI”说话时,人们用词的丰富度更低(类符形符比 b = −0.02,p = 0.032;独特词数 b = −4.58,p = 0.032),但句子的复杂度、论证连接词的使用没有变化(p > 0.084)——也就是说,人对着机器会不自觉地简化用词,但不改变说理方式

⑤ 讨论(这些发现说明什么?)

这项研究把一个被广泛误读的结论掰正了。

过去一年里,“AI 能劝退阴谋论”这个发现常常被解读成:AI 有某种人类没有的特殊气质——它中立、它不带情绪、它不会让你觉得丢面子。这项实验说:没有这回事。把 AI 伪装成人,效果不变;让它说话更像人,效果也不变。真正起作用的是它端上来的那些事实

但作者紧接着补了一句非常关键的话,它决定了这个结论的实践含义。理论上,如果一个人类专家能当场调集同样多的事实,并用同样冷静的方式呈现出来,效果应当一样好——可是要针对某个人临时讲出来的、五花八门的具体说法,即时组织起海量对应的证据,几乎没有人做得到。所以 AI 的优势不在于它的身份,而在于它承担了辟谣所需的认知劳动:把找资料、组织论据、逐条回应这套本来极其耗人的工作扛了下来。

这个判断和人机交互领域的主流看法是有张力的。那个领域长期强调拟人化线索信源框定对说服的作用——让机器更像人、或者说清楚它是谁,通常被认为能提升信任和影响力。这项研究说:至少在纠正错误认知这个场景里,这些线索没有必要。这也与一项新近的元分析一致:在改变态度和行为上,人类信源相对 AI 信源并没有稳定优势。

作者自己指出的局限值得认真对待:结论受制于所用模型的性质。像大多数大模型一样,GPT-4o 的训练数据以英语和西方来源为主,其语气、预设和论证风格都带有英美语境的印记,可能边缘化训练数据中代表性不足的视角。因此这套辟谣效果能否跨文化迁移,仍是未知数;作者呼吁未来用文化适配的模型重做检验。

⑥ 结论(最终结论 + 启示)

最终结论可以压缩成一句话:AI 之所以能劝动人,不是因为它是 AI,而是因为它说得对、说得准、说得具体。

在一项 955 人的预注册实验中,把同一个模型说成“AI”还是“专家”、让它说话中性还是拟人,对辟谣效果没有任何显著影响(贝叶斯因子约 51.8 万倍支持“无差异”);而所有条件下信念都显著下降,阴谋论的降幅(约 10 分)还大于一般的伪科学说法(约 5 分)。

这带来两个层面的启发。对研究者:那些被认为“打不动”的信念,其实比想象中更有弹性;改变它们既不需要迎合对方的动机,也不需要精心包装信源,需要的是针对性的、有证据的沟通对做辟谣工作的人:真正稀缺的资源不是权威身份,而是针对每一个具体说法即时调集证据的能力——这恰恰是大模型现在能大规模提供的东西。与其争论该由谁来出面辟谣,不如先解决“能不能针对这一个人的这一句话,给出对得上的证据”。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。阴谋论信念长期被视为对循证纠正具有免疫力,主流解释有二:(i) 动机性推理——信念满足心理需要,故信者“想要相信”并拒斥反证;(ii) 自我强化——反证被重新解释为阴谋更深的证据。近期研究(Costello et al.)挑战了这一图景,证明与会话式 AI 进行个性化、基于证据的对话可持久且实质地降低阴谋论信念。

文献空白。既有的 AI 辟谣实验中,事实内容LLM 信源身份始终捆绑在一起,无法分离。这留下一个悬置的识别问题:AI 这一信使身份是否为干预成功所必需?理论预期双向拉扯——一方面,LLM 呈现“后社会性(post-social)”特征,不带党派与地域线索,可能规避动机性怀疑;私下与模型交流也降低了承认错误的社会成本,且不易触发心理逆反。另一方面,有工作论文发现 AI 生成的纠错信息在标注为人类专家时更具说服力。

本研究贡献。① 以 2×2×2 正交设计把信源身份语气拟人化事实内容中剥离;② 将检验对象从阴谋论扩展到非阴谋论但不受专家共识支持的“认识论上站不住脚的信念”(如伪科学主张);③ 以贝叶斯因子对零假设给出正面证据,而非仅报告不显著。

I. Theoretical Framework & Hypotheses(理论框架与假设)

核心张力:AI 辟谣的效力来源是信息内容(facts-and-evidence 路径)还是信源属性(messenger 路径)。二者对干预设计的含义截然相反:若为后者,辟谣必须由 AI 出面;若为前者,AI 只是高效的证据组装器。

编号预注册命题对应理论结果
H1信源身份(AI vs. Expert)影响信念下降幅度后社会性信源规避党派线索;承认错误的社会成本;心理逆反未获支持(p > 0.25)
H2拟人化语气(Human-like vs. Neutral)影响信念下降幅度人机交互中的拟人化线索与信源框定文献未获支持(p > 0.25)
H3效应可推广至非阴谋论的“认识论上站不住脚的信念”信念修正的通用性 vs. 阴谋论特异性获支持(各条件 p < 0.018)
探索信念类型调节效应量阴谋论降幅更大,b = 5.11, p < 0.001

M. Materials & Methods(材料与方法)

R. Results(结果)

操纵/对比统计量结论
信源身份 AI vs. Expertp > 0.25无差异
语气 Neutral vs. Human-likep > 0.25无差异
全部交互项p > 0.25无差异
零模型比较BF₀₁ = 518,181.1强支持零假设
阴谋论 vs. 认识论薄弱信念b = 5.11, P < 0.001阴谋论降幅更大
脱落率 Expert vs. AIt(3629) = 2.99, P = 0.003保守插补后结论不变

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((AI 辟谣靠内容还是身份))
    I 引言
      阴谋论被认为劝不动
      动机性推理与自我强化
      AI 对话却能降低信念
      事实与信使被捆在一起
    R 假设
      H1 信源身份是否有效
      H2 拟人语气是否有效
      H3 能否推广到伪科学
    M 方法
      预注册 2x2x2 实验
      GPT-4o 两轮对话
      确信度 0 到 100 分
      招募 8274 最终 955
      对比编码线性回归
      贝叶斯因子检验零假设
    R 结果
      身份无差异 p 大于 0.25
      语气无差异 p 大于 0.25
      各条件均显著下降
      阴谋论降 10 分
      伪科学降 5 分
      BF01 约 51.8 万
      45% 把专家当成人
      对 AI 用词更简单
    a 讨论
      力量来自事实本身
      AI 承担认知劳动
      拟人线索并非必要
      训练数据偏英美
      跨文化尚未验证
    D 结论
      信念比想象更可塑
      不需迎合动机
      稀缺的是即时证据

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。