🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
现在造一条假新闻有多容易?这项研究给出了一个具体的答案:给 GPT-4o 一句提示词——“照这个标题写一小段新闻,再配一张插图”——一条带标题、带正文、带图片的假新闻就出来了。整个过程不需要写作能力,也不需要成本。
这件事之所以让人紧张,是因为它把假信息生产从“需要有人费力去编”变成了“可以批量生成”。于是一个非常现实的问题浮上来:AI 造出来的假新闻,是不是比人写的更容易骗到人?
直觉上有两种相反的猜测。一种是 AI 更危险:它可以针对性地把话说得更顺、更像模像样,还能顺手配一张看起来很真的图。另一种是 AI 反而更容易被识破:已有研究发现,人们对“AI 生成的内容”普遍带着一层怀疑,一旦觉得某段文字有机器味,可信度就打折。
但这两种猜测都缺乏一个关键前提:大多数人在真实场景里,其实根本不知道自己看的是人写的还是 AI 写的。所以真正该问的,是在不告诉你来源的情况下,人们的判断会不会不一样。这就是这项覆盖 27 个欧洲国家的实验要回答的问题。
② 研究问题(要回答什么?)
研究要同时回答两组问题,一组关于“真假”,一组关于“谁写的”。
- 问题一:人们能不能分辨真新闻和假新闻?分辨出来之后,会不会就不转发了?
- 问题二:在不知道来源的前提下,AI 生成的新闻和人写的新闻,在可信度和转发意愿上有区别吗?
- 问题三:什么样的人更容易上当?性别、年龄、学历、政治立场、还是“遇事会不会多想一步”的思考习惯?
- 问题四:这些规律会不会因国家而异?特别是——和俄罗斯或乌克兰接壤的国家,因为离战争更近、相关信息更密集,会不会表现得不一样?
③ 研究方法(怎么做的?)
研究者在 2025 年 5 月 5 日到 6 月 13 日之间,在 27 个欧洲国家做了一次网络调查,每国目标样本 1000 人,总共收到 27,227 份回答;经过按年龄、性别、教育和地区做的加权处理后,实际进入分析的是 26,437 人。
实验的材料是 24 条关于俄乌战争的新闻,按两个维度交叉设计:真 / 假 × 人写 / AI 写。之所以话题全部锁定在俄乌战争,是为了避免不同议题本身的熟悉度和立场差异干扰结果。
AI 版本是用 GPT-4o 生成的,提示词非常简单:给它一个标题,让它写一段与标题相符的短新闻,并生成一张配图。原稿是英文,再由各国本地专家翻译成当地语言。
每位参与者会随机看到 8 条新闻——四种组合各两条:人写的真、人写的假、AI 写的真、AI 写的假。参与者完全不知道哪条是谁写的。研究者还特意设了一条规则:同一个故事的“人写版”和“AI 版”不会同时给同一个人看,以免他一眼看出这是在做对比而刻意配合。作者坦承,这个设计虽然保护了内部效度,但也让“同一个人对同一条新闻两个版本的反应”无法直接比较。
每看完一条,回答两个问题:“你觉得这条新闻有多真?”(1 到 4 分)和“你有多大可能把它转发到社交媒体?”(1 到 4 分)。整个实验是预注册的,并且放在 20 分钟问卷的最前面。
④ 结果(发现了什么?)
第一个发现:人们确实能分辨真假,但分辨得不算好。
可信度 2.60
57% 认为“基本真”
可信度 2.15
但仍有 34% 认为“基本真”
34%
26%
假新闻的平均可信度是 2.15 分,真新闻是 2.60 分——方向是对的,但请注意那个刺眼的数字:仍有 34% 的假新闻被判定为“基本真”或“完全真”。转发意愿上的差距更小,真新闻 1.93 分、假新闻 1.76 分,只差 0.18 分。也就是说,“看出这是假的”和“不去转发它”之间,联系比想象中弱得多。
第二个发现,也是最关键的:来源几乎不产生差别,而且方向还反了。
AI 生成新闻的平均可信度是 2.40,人写的是 2.34——AI 的略高。被判为“基本真”的比例,AI 是 47%,人写是 44%。转发意愿上 AI 1.86、人写 1.84,几乎没有差别。把两个维度合起来看,得分最高的是AI 写的真新闻(2.63),最低的是人写的假新闻(2.12)。
换句话说,人们对 AI 内容那种“总觉得机器味”的怀疑,在不告诉来源的条件下完全没有出现。而这正是现实中的常态。
第三个发现:谁更容易上当,与谁能识别 AI,是两回事。数据显示女性、更年轻、学历较低、以及认知反思测验得分较差的人,在某些情况下更容易受错误信息影响。但作者强调了一个更重要的结论:即使是那些成功识破假新闻、也最不愿转发的人群,同样分不出内容是人写的还是 AI 写的。识别 AI 的困难是普遍的,不集中在任何特定人群。
第四个发现:27 国高度一致。与俄乌接壤的国家和不接壤的国家,数字几乎重合——非边境国家:人写真 2.57、AI 真 2.64、人写假 2.14、AI 假 2.19;边境国家:2.54、2.63、2.08、2.13。作者说这份跨国一致性“有些出人意料”。
⑤ 讨论(这些发现说明什么?)
这项研究把一个常见的安慰性说法拆掉了:“大家对 AI 内容会有防备心。”
这句话在标注了来源的情况下也许成立,但在不标注来源的情况下——也就是绝大多数人刷手机时的真实处境——它不成立。实验里 AI 内容的可信度不仅没有更低,反而略高一点点。作者在结论里用了很直白的表述:GPT-4o 能够从一句简单提示词生成关于俄乌战争的假新闻,其被感知的可信度与人写内容相当,某些情况下甚至更高。
另一个值得停下来想的,是“识别”和“不转发”之间的缝隙。假新闻的可信度比真新闻低了 0.45 分,可转发意愿只低了 0.18 分。这说明转发这个动作,并不完全由“我认为它是真的”驱动——立场表达、情绪、社交信号都在里面。因此,只提升辨别力的干预(比如媒介素养训练),未必能同比例地减少传播。
还有一个对政策特别重要的结论:脆弱性和识别难度是两回事。过去的干预常常瞄准“高风险人群”——年长者、低学历者、不爱多想的人。这项研究说,在“区分人写与 AI 写”这件事上,没有低风险人群。哪怕是判断力最好的那一群人,也照样分不出来。所以指望通过教育让公众练出“AI 火眼金睛”,方向可能就是错的;更现实的路径是内容溯源、来源标注这类不依赖个人辨别力的制度性手段。
作者自己列出的局限也很诚实:全部材料只涉及俄乌战争这一个高度政治化、信息密集的话题,结论可能受这个话题的情绪强度影响;刺激材料数量有限,且是在受控的问卷环境里呈现的;因此关于“AI 与人写没有差别”的这些零结果,也可能只是所选标题或模型输出的特性,而非普遍规律。他们建议未来把假信息嵌入模拟或真实的社交媒体信息流中,用更多样的材料重做。
⑥ 结论(最终结论 + 启示)
这项覆盖 27 个欧洲国家的实验给出了一个不太让人安心的结论:只要不告诉你是谁写的,AI 生成的新闻在可信度上就和人写的没有区别——甚至略高一点。
更具体地说:人们能在一定程度上识别假新闻(可信度 2.15 对 2.60),但仍有三分之一的假新闻被当成真的;识别出来也不等于不会转发(转发意愿只差 0.18 分);而在辨别“人写还是 AI 写”这件事上,所有人群、所有国家的表现都一样差。
如果要从中带走一件事,那就是:把信息安全的希望寄托在“公众能练出辨别力”上,是不够的。真正需要建设的,是那些不依赖个体判断的东西——内容来源的可追溯、平台层面的标注机制,以及在信息环境本身变得更复杂时,帮助人们保持认知韧性的制度安排。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。生成式 AI 对错误信息生态构成“双刃剑”:它既可用于检测错误信息、促进民主审议、对抗阴谋叙事,也使快速、大规模生产具有说服力的虚假内容成为可能。理解公众如何感知 AI 生成的错误信息,因而成为设计干预与保障信息完整性的前提。
文献空白。既有研究中,关于人们区分真假新闻能力的证据本身就结论不一;而专门考察AI 生成新闻(尤其是虚假的 AI 内容)如何被感知与互动的研究更为稀少。既有工作还呈现出内在张力:一方面,AI 生成新闻常引发对其可信度与真实性的显著怀疑;另一方面,大量研究表明个体难以区分人写与 AI 生成内容。此外,跨国比较证据缺失——错误信息易感性理应因信息与政治环境不同而变化,但缺乏统一设计下的跨国实验。
本研究贡献。提供首个大规模跨国证据,考察感知真实性与分享意愿如何在人写与 AI 生成、真实与虚假新闻之间变化;在 27 个欧洲国家开展预注册网络调查实验,并检验个体特质(认知反思、年龄、教育、意识形态等)与区域情境的调节作用。
I. Theoretical Framework & Hypotheses(理论框架与假设)
| 编号 | 命题 | 理论依据 | 结果 |
|---|---|---|---|
| H1 | 虚假新闻较真实新闻被感知为更不可信、更不愿分享 | 错误信息辨识文献 | 获支持 |
| H2 | AI 生成新闻较人写新闻被感知为更不可信、更不愿分享 | 对 AI 内容真实性的普遍怀疑 | 未获支持,方向反向且极小 |
| RQ1 | 处理效应是否被个体特质(性别、年龄、教育、认知反思、意识形态、信任)调节 | 社会经济与认知因素影响错误信息易感性 | 部分调节,但不调节 AI/人写的区分 |
| RQ2 | 处理效应是否随国别情境(尤其是否与俄乌接壤)变化 | 信息与政治环境差异 | 27 国高度一致 |
关键区分:错误信息易感性(能否识别真假)与来源辨识能力(能否识别人写 vs. AI 写)是两个独立维度——本文最重要的理论发现即在于前者存在群体异质性,后者不存在。
M. Materials & Methods(材料与方法)
- 数据与场域:2025 年 5 月 5 日–6 月 13 日,27 个欧洲国家网络调查;样本由 CINT 提供,来自非概率在线样本库;每国目标 1,000 人,总样本 27,227。按性别、年龄、教育与地区(NUTS2)设配额。
- 加权:以年龄组、性别、教育、地区(NUTS2)做事后分层加权,基准取自欧盟劳动力调查(EU-LFS)与欧洲社会调查(ESS)。因加权变量存在少量缺失,加权仅可施用于 26,437 名受访者,此为分析用的有效样本量。作者说明未按国家人口规模做比例加权,因分析聚焦个体层面关系而非产生具人口代表性的跨国估计。
- 设计:完全平衡的被试内 2(来源:human vs. AI)× 2(真实性:real vs. fake)析因设计。刺激库共 24 条新闻;每位受访者随机分得 8 条,四种条件各两条,即每国 8,000 次评估。约束条件:受访者不会同时看到同一母题故事的人写版与 AI 版,以避免需求效应;作者明确承认此举限制了个体内因果比较。
- 刺激生成:主题统一为俄乌战争(避免议题显著性、先验知识与话题偏见的混淆)。AI 版由
GPT-4o生成,提示词为:“Here is a news headline. Use this to generate a short news item with a similar title and some more text that elaborates on the title and gives more detail. Generate a photo as well, which illustrates the news item.” 输出含标题、短正文与合成配图;原文英文,由各国本地专家翻译。 - 因变量:① 感知真实性——“你在多大程度上相信刚读到的这条新闻是真的?”四点量表,从“完全不像真的”到“看起来完全真实”;② 分享意愿——“你有多大可能把刚读到的新闻分享到社交媒体?”从“肯定不会(1)”到“肯定会(4)”。采用允许跳答设计(不显示拒答选项)。
- 协变量:性别(二分)、年龄(连续)、教育(初/中/高等)、聚落规模(五级,从大城市到农村)、主观经济状况(四级)、政治意识形态(五级,强自由派—强保守派)、以及认知反思测验 CRT。
- 模型:评估嵌套于个体与国家,故按预注册拟合多层线性回归,含受访者与国家的随机截距,处理变量为固定效应并纳入个体层控制变量;调节检验(RQ1)在同一设定下加入处理 × 个体特征的交互项;RQ2 另在边境/非边境分组给出边际均值,并逐国估计(去掉国家随机效应)。分析在 RStudio 中完成。
- 预注册与开放科学:实验已预注册;数据与代码置于 OSF;伦理审查依机构与国家规定予以豁免(匿名、非干预、最小风险、未收集 GDPR 定义的个人数据),全体参与者知情同意。作者声明无资助。
R. Results(结果)
- 真实性主效应(H1 支持)。虚假新闻感知真实性均值 2.15,真实新闻 2.60。57% 的真实新闻被评为“基本真实”或“完全真实”,而虚假新闻仍有 34% 获得同等评价。
- 来源主效应(H2 未支持,且方向相反)。AI 生成新闻感知真实性 2.40,高于人写内容 2.34;被评为“基本/完全真实”的比例为 47% vs. 44%。
- 交叉条件。感知真实性最高者为 AI 生成的真实新闻(2.63),最低者为 人写的虚假新闻(2.12)。
- 分享意愿:差距更小。真实 1.93 vs. 虚假 1.76,作者报告均值差 0.18(四点量表);愿意分享比例 34% vs. 26%。来源对分享意愿无效应:AI 1.86 vs. 人写 1.84(31% vs. 29%)。交叉条件下最高为 AI 真实新闻 1.94,最低为人写虚假新闻 1.75。
- 多层模型。纳入数据的聚类结构并控制个体特征后,上述模式基本复现。
- 调节效应(RQ1)。性别、年龄、教育与认知反思引入了一定异质性:与既往研究一致,女性、更年轻、教育程度较低、以及 CRT 表现较差者在某些情形下对错误信息更脆弱。但关键在于:即便是那些正确判定虚假条目为“不真实”、且最不愿分享的子群体,同样无法区分人写与 AI 生成内容——来源辨识的困难是普遍性的,而非集中于特定人口或认知群体。
- 跨国一致性(RQ2)。与俄罗斯或乌克兰接壤的国家与其他国家反应高度相似。非边境国家:人写真实 2.57 / AI 真实 2.64 / 人写虚假 2.14 / AI 虚假 2.19;边境国家:2.54 / 2.63 / 2.08 / 2.13。多层模型给出同样结论。作者称这一跨国一致性“有些出人意料”。
| 条件 | 感知真实性 | 分享意愿 |
|---|---|---|
| AI 生成 · 真实 | 2.63(最高) | 1.94(最高) |
| 人写 · 真实 | 2.57–2.60 | 1.93(真实总体) |
| AI 生成 · 虚假 | 2.19 | — |
| 人写 · 虚假 | 2.12(最低) | 1.75(最低) |
| 真实 vs. 虚假总差 | 0.45 | 0.18 |
| AI vs. 人写总差 | +0.06(AI 略高) | +0.02(可忽略) |
a / D. Discussion & Conclusion(讨论与结论)
- 核心结论。基于 27 国大规模跨国调查数据,本研究证明
GPT-4o可从一句简单提示词生成关于俄乌战争的虚假新闻,其被感知的可信度与人写内容相当,某些情况下甚至更高。这凸显了虚假内容模仿真实信息的说服力,以及在 AI 驱动的媒介环境中增强个体抵御能力的必要性。 - 识别与传播之间的缝隙。虚假与真实之间的差距在分享意愿上小于感知真实性上(0.18 vs. 0.45);“识别出假”与“不愿分享”之间的相关性偏弱,与既往研究一致。这意味着仅提升辨别力的干预未必能等比例抑制传播——分享行为同时受立场表达、情绪与社交信号驱动。
- 脆弱性 ≠ 来源辨识力。个体特征塑造了对错误信息的总体易感性,但并不塑造区分人写与 AI 内容的能力。这对干预设计有直接含义:针对“高风险人群”的媒介素养教育难以解决来源辨识问题,需转向内容溯源与平台标注等不依赖个体判断的制度性手段。
- 跨国稳健性。结果在 27 国间显著一致,包括直接毗邻冲突的国家,提示这些感知机制具有较强的跨情境普遍性。
- 局限一:单一议题。全部材料聚焦俄乌战争这一高度显著且政治化的话题,结论可能受具体内容、框架或情绪显著性影响。作者建议扩展至健康、科学与日常社会议题等政治化程度不同的领域。
- 局限二:刺激与情境的外部效度。实验依赖有限的刺激集合与受控问卷环境。作者明确提醒:关于 AI 与人写内容差异的零效应,可能反映所选标题或模型输出的特异性,而非一般倾向。建议未来将错误信息嵌入模拟或真实社交媒体信息流,并使用更多样的 AI 与人类产出材料。
- 局限三:因果推断的设计代价。为避免需求效应而禁止同一受访者同时看到同一母题的两个版本,牺牲了个体内对同一底层刺激不同版本的比较能力,作者已自行标注。
- 样本性质。非概率在线样本库 + 配额抽样 + 事后分层加权;作者说明分析目标为个体层面关系而非人口代表性估计。
🧠 IRMaD 思维导图
mindmap
root((人写与 AI 假新闻))
I 引言
生成式 AI 是双刃剑
假信息可批量生产
对 AI 内容有怀疑
却分不出谁写的
缺跨国实验证据
R 假设
H1 假新闻更不可信
H2 AI 内容更不可信
RQ1 个体特质是否调节
RQ2 边境国家是否不同
M 方法
27 个欧洲国家
有效样本 26437
被试内 2x2 析因
24 条俄乌战争新闻
GPT-4o 生成文与图
每人评估 8 条
多层模型双随机截距
R 结果
真新闻可信度 2.60
假新闻可信度 2.15
仍有 34% 信以为真
AI 内容反而略高
分享差距仅 0.18
27 国高度一致
边境国家无差别
a 讨论
不标来源则防备失效
识别与不转发有缝隙
来源辨识困难是普遍的
单一议题限制外推
零效应可能来自选材
D 结论
靠个人辨别力不够
需内容溯源与标注
提升认知韧性
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。