PNAS Nexus 2026 · 27 国 · 预注册被试内实验 · 有效样本 26,437 · 金色 OA

人写的假新闻和 AI 写的假新闻,谁更骗得过人?——27 国实验证据

Ádám Stefkovics, Dömötör Gere · PNAS Nexus · 2026 · DOI: 10.1093/pnasnexus/pgag032
原题:Beliefs and sharing intentions of human- and AI-generated fake news: Evidence from a 27-country experiment
Open Access 新颖度 0.81

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

现在造一条假新闻有多容易?这项研究给出了一个具体的答案:给 GPT-4o 一句提示词——“照这个标题写一小段新闻,再配一张插图”——一条带标题、带正文、带图片的假新闻就出来了。整个过程不需要写作能力,也不需要成本。

这件事之所以让人紧张,是因为它把假信息生产从“需要有人费力去编”变成了“可以批量生成”。于是一个非常现实的问题浮上来:AI 造出来的假新闻,是不是比人写的更容易骗到人?

直觉上有两种相反的猜测。一种是 AI 更危险:它可以针对性地把话说得更顺、更像模像样,还能顺手配一张看起来很真的图。另一种是 AI 反而更容易被识破:已有研究发现,人们对“AI 生成的内容”普遍带着一层怀疑,一旦觉得某段文字有机器味,可信度就打折。

但这两种猜测都缺乏一个关键前提:大多数人在真实场景里,其实根本不知道自己看的是人写的还是 AI 写的。所以真正该问的,是在不告诉你来源的情况下,人们的判断会不会不一样。这就是这项覆盖 27 个欧洲国家的实验要回答的问题。

② 研究问题(要回答什么?)

研究要同时回答两组问题,一组关于“真假”,一组关于“谁写的”。

③ 研究方法(怎么做的?)

研究者在 2025 年 5 月 5 日到 6 月 13 日之间,在 27 个欧洲国家做了一次网络调查,每国目标样本 1000 人,总共收到 27,227 份回答;经过按年龄、性别、教育和地区做的加权处理后,实际进入分析的是 26,437 人

实验的材料是 24 条关于俄乌战争的新闻,按两个维度交叉设计:真 / 假 × 人写 / AI 写。之所以话题全部锁定在俄乌战争,是为了避免不同议题本身的熟悉度和立场差异干扰结果。

AI 版本是用 GPT-4o 生成的,提示词非常简单:给它一个标题,让它写一段与标题相符的短新闻,并生成一张配图。原稿是英文,再由各国本地专家翻译成当地语言。

每位参与者会随机看到 8 条新闻——四种组合各两条:人写的真、人写的假、AI 写的真、AI 写的假。参与者完全不知道哪条是谁写的。研究者还特意设了一条规则:同一个故事的“人写版”和“AI 版”不会同时给同一个人看,以免他一眼看出这是在做对比而刻意配合。作者坦承,这个设计虽然保护了内部效度,但也让“同一个人对同一条新闻两个版本的反应”无法直接比较。

每看完一条,回答两个问题:“你觉得这条新闻有多真?”(1 到 4 分)和“你有多大可能把它转发到社交媒体?”(1 到 4 分)。整个实验是预注册的,并且放在 20 分钟问卷的最前面。

④ 结果(发现了什么?)

第一个发现:人们确实能分辨真假,但分辨得不算好。

真新闻
可信度 2.60
57% 认为“基本真”
假新闻
可信度 2.15
但仍有 34% 认为“基本真”
愿意转发真新闻
34%
愿意转发假新闻
26%

假新闻的平均可信度是 2.15 分,真新闻是 2.60 分——方向是对的,但请注意那个刺眼的数字:仍有 34% 的假新闻被判定为“基本真”或“完全真”。转发意愿上的差距更小,真新闻 1.93 分、假新闻 1.76 分,只差 0.18 分。也就是说,“看出这是假的”和“不去转发它”之间,联系比想象中弱得多。

第二个发现,也是最关键的:来源几乎不产生差别,而且方向还反了。

AI 生成新闻的平均可信度是 2.40,人写的是 2.34——AI 的略高。被判为“基本真”的比例,AI 是 47%,人写是 44%。转发意愿上 AI 1.86、人写 1.84,几乎没有差别。把两个维度合起来看,得分最高的是AI 写的真新闻(2.63),最低的是人写的假新闻(2.12)

换句话说,人们对 AI 内容那种“总觉得机器味”的怀疑,在不告诉来源的条件下完全没有出现。而这正是现实中的常态。

第三个发现:谁更容易上当,与谁能识别 AI,是两回事。数据显示女性、更年轻、学历较低、以及认知反思测验得分较差的人,在某些情况下更容易受错误信息影响。但作者强调了一个更重要的结论:即使是那些成功识破假新闻、也最不愿转发的人群,同样分不出内容是人写的还是 AI 写的。识别 AI 的困难是普遍的,不集中在任何特定人群。

第四个发现:27 国高度一致。与俄乌接壤的国家和不接壤的国家,数字几乎重合——非边境国家:人写真 2.57、AI 真 2.64、人写假 2.14、AI 假 2.19;边境国家:2.54、2.63、2.08、2.13。作者说这份跨国一致性“有些出人意料”。

⑤ 讨论(这些发现说明什么?)

这项研究把一个常见的安慰性说法拆掉了:“大家对 AI 内容会有防备心。”

这句话在标注了来源的情况下也许成立,但在不标注来源的情况下——也就是绝大多数人刷手机时的真实处境——它不成立。实验里 AI 内容的可信度不仅没有更低,反而略高一点点。作者在结论里用了很直白的表述:GPT-4o 能够从一句简单提示词生成关于俄乌战争的假新闻,其被感知的可信度与人写内容相当,某些情况下甚至更高

另一个值得停下来想的,是“识别”和“不转发”之间的缝隙。假新闻的可信度比真新闻低了 0.45 分,可转发意愿只低了 0.18 分。这说明转发这个动作,并不完全由“我认为它是真的”驱动——立场表达、情绪、社交信号都在里面。因此,只提升辨别力的干预(比如媒介素养训练),未必能同比例地减少传播。

还有一个对政策特别重要的结论:脆弱性和识别难度是两回事。过去的干预常常瞄准“高风险人群”——年长者、低学历者、不爱多想的人。这项研究说,在“区分人写与 AI 写”这件事上,没有低风险人群。哪怕是判断力最好的那一群人,也照样分不出来。所以指望通过教育让公众练出“AI 火眼金睛”,方向可能就是错的;更现实的路径是内容溯源、来源标注这类不依赖个人辨别力的制度性手段。

作者自己列出的局限也很诚实:全部材料只涉及俄乌战争这一个高度政治化、信息密集的话题,结论可能受这个话题的情绪强度影响;刺激材料数量有限,且是在受控的问卷环境里呈现的;因此关于“AI 与人写没有差别”的这些零结果,也可能只是所选标题或模型输出的特性,而非普遍规律。他们建议未来把假信息嵌入模拟或真实的社交媒体信息流中,用更多样的材料重做。

⑥ 结论(最终结论 + 启示)

这项覆盖 27 个欧洲国家的实验给出了一个不太让人安心的结论:只要不告诉你是谁写的,AI 生成的新闻在可信度上就和人写的没有区别——甚至略高一点。

更具体地说:人们能在一定程度上识别假新闻(可信度 2.15 对 2.60),但仍有三分之一的假新闻被当成真的;识别出来也不等于不会转发(转发意愿只差 0.18 分);而在辨别“人写还是 AI 写”这件事上,所有人群、所有国家的表现都一样差

如果要从中带走一件事,那就是:把信息安全的希望寄托在“公众能练出辨别力”上,是不够的。真正需要建设的,是那些不依赖个体判断的东西——内容来源的可追溯、平台层面的标注机制,以及在信息环境本身变得更复杂时,帮助人们保持认知韧性的制度安排。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。生成式 AI 对错误信息生态构成“双刃剑”:它既可用于检测错误信息、促进民主审议、对抗阴谋叙事,也使快速、大规模生产具有说服力的虚假内容成为可能。理解公众如何感知 AI 生成的错误信息,因而成为设计干预与保障信息完整性的前提。

文献空白。既有研究中,关于人们区分真假新闻能力的证据本身就结论不一;而专门考察AI 生成新闻(尤其是虚假的 AI 内容)如何被感知与互动的研究更为稀少。既有工作还呈现出内在张力:一方面,AI 生成新闻常引发对其可信度与真实性的显著怀疑;另一方面,大量研究表明个体难以区分人写与 AI 生成内容。此外,跨国比较证据缺失——错误信息易感性理应因信息与政治环境不同而变化,但缺乏统一设计下的跨国实验。

本研究贡献。提供首个大规模跨国证据,考察感知真实性与分享意愿如何在人写与 AI 生成、真实与虚假新闻之间变化;在 27 个欧洲国家开展预注册网络调查实验,并检验个体特质(认知反思、年龄、教育、意识形态等)与区域情境的调节作用。

I. Theoretical Framework & Hypotheses(理论框架与假设)

编号命题理论依据结果
H1虚假新闻较真实新闻被感知为更不可信、更不愿分享错误信息辨识文献获支持
H2AI 生成新闻较人写新闻被感知为更不可信、更不愿分享对 AI 内容真实性的普遍怀疑未获支持,方向反向且极小
RQ1处理效应是否被个体特质(性别、年龄、教育、认知反思、意识形态、信任)调节社会经济与认知因素影响错误信息易感性部分调节,但不调节 AI/人写的区分
RQ2处理效应是否随国别情境(尤其是否与俄乌接壤)变化信息与政治环境差异27 国高度一致

关键区分:错误信息易感性(能否识别真假)与来源辨识能力(能否识别人写 vs. AI 写)是两个独立维度——本文最重要的理论发现即在于前者存在群体异质性,后者不存在

M. Materials & Methods(材料与方法)

R. Results(结果)

条件感知真实性分享意愿
AI 生成 · 真实2.63(最高)1.94(最高)
人写 · 真实2.57–2.601.93(真实总体)
AI 生成 · 虚假2.19
人写 · 虚假2.12(最低)1.75(最低)
真实 vs. 虚假总差0.450.18
AI vs. 人写总差+0.06(AI 略高)+0.02(可忽略)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((人写与 AI 假新闻))
    I 引言
      生成式 AI 是双刃剑
      假信息可批量生产
      对 AI 内容有怀疑
      却分不出谁写的
      缺跨国实验证据
    R 假设
      H1 假新闻更不可信
      H2 AI 内容更不可信
      RQ1 个体特质是否调节
      RQ2 边境国家是否不同
    M 方法
      27 个欧洲国家
      有效样本 26437
      被试内 2x2 析因
      24 条俄乌战争新闻
      GPT-4o 生成文与图
      每人评估 8 条
      多层模型双随机截距
    R 结果
      真新闻可信度 2.60
      假新闻可信度 2.15
      仍有 34% 信以为真
      AI 内容反而略高
      分享差距仅 0.18
      27 国高度一致
      边境国家无差别
    a 讨论
      不标来源则防备失效
      识别与不转发有缝隙
      来源辨识困难是普遍的
      单一议题限制外推
      零效应可能来自选材
    D 结论
      靠个人辨别力不够
      需内容溯源与标注
      提升认知韧性

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。