🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
如今用人工智能就能轻松生成以假乱真的照片,这类假图正越来越多地出现在社交媒体上,被用来给各种谣言“作证”。你可能刷到过这样的画面:荷兰的弗里斯兰群岛整片泡在海水里,或者一群难民在城市公园里搭满帐篷。这些事从没发生过,看上去却像新闻照片一样真。
麻烦在于,照片天生带着“这是真的”的光环。一段文字谣言我们还会怀疑一下,一张逼真的照片却会让人下意识觉得“有图有真相”。传播学者把这叫做“真实感捷思”:大脑一看到照片,就默认它记录了现实。更让人头疼的是,X 平台自带的 Grok、谷歌的 Gemini 等工具让人人都能随手造图,假图的花样越来越多,光靠一张张辟谣已经跟不上了。
平台手里主要有三种“贴标签”的办法:一是标上“由 AI 制作”(类似水印,欧盟《人工智能法》要求平台标注 AI 生成内容);二是请专业事实核查员标出“有误导”;三是让普通用户写“社区笔记”补充背景,这是 X 上的做法。2025 年 1 月,Meta 宣布在美国停止事实核查、全面改用社区笔记,“到底谁来贴标签更管用”一下子成了现实问题。可过去的研究大多针对文字谣言,而且常常只用单张图、单个话题做实验,把三种标签放在一起、专门比较它们对 AI 假图效果的研究还很少。
② 研究问题(要回答什么?)
这项研究想弄清楚,给人工智能生成的假图贴上纠错标签,能不能让人少信一点,以及由谁来贴最管用。作者关心两个结果:一是人们觉得这张图本身有多可信;二是人们多大程度上相信图里讲的那件假事。具体问题如下:
- H1:只要贴了标签(不管是谁贴的),是不是都比不贴更能降低图的可信度和人们对假事的相信?
- H2:事实核查员贴的标签,是不是比“由 AI 制作”的标签更有效?
- RQ1、RQ2:社区笔记和另外两种标签相比,谁强谁弱?
- H4 到 H6:越相信“机器很客观”的人,AI 标签对他越管用吗?越信任事实核查的人,核查标签对他越管用吗?越相信“大家都说对就是对”的人,社区笔记对他越管用吗?
- RQ3、RQ4:假图讲的是气候变化还是移民,结果会不会不一样?人们原本对这个话题的态度,会不会改变标签的效果?
有意思的是,作者特意让两个话题的“政治方向”相反:气候假图讲的是偏左的叙事(夸大气候变化的后果),移民假图讲的是偏右的叙事(渲染移民带来的问题)。这样就能看看,标签对左右两边的谣言是不是一样管用。
③ 研究方法(怎么做的?)
作者在荷兰做了一个事先登记方案的线上实验(预注册:先把要检验什么、怎么分析公开写好,防止事后“挑结果”)。调查公司 Dynata 按荷兰人口结构招募了 1018 名成年人,实验在 2025 年 4 月 7 日到 28 日之间完成。
第一步:造假图。研究者用 X 平台自带的 AI 画图工具 Grok 先生成了 30 张假图,再请 100 名荷兰网友打分:看起来多可信、故事多合理、多容易看出是 AI 画的。一眼就穿帮的、和逼真到谁都会信的都被剔掉,免得结果“触底”或“到顶”。最后留下 10 张图:5 张讲气候变化的夸张后果(比如弗里斯兰群岛被海水淹没),5 张讲关于移民的误导性故事(比如难民在公共公园里搭帐篷)。
第二步:贴标签。每张图都放进一条仿真的社交媒体帖子里,再配上四种处理之一:
抬头用的是 Meta 真实使用的“Made with AI”(由 AI 制作)。
写明是事实核查员作出的判定。
抬头用的是 X 上真实的“Readers added context”(读者补充了背景)。
什么标签都不贴。
为了公平,三种标签除了“是谁说的”以外一字不差,都写着:“某某已判定这张照片是用人工智能生成的。帖子中的说法具有误导性。”这样一来,效果上的差别就只能归到标签的来源上。10 张图乘以 4 种处理,一共 40 个版本,每个人随机只看其中一个,这叫“被试间设计”。
第三步:测反应。参与者先回答背景问题和几道“干扰题”(防止猜到实验目的),然后至少看帖子 12 秒,再用 1 到 7 分打分:这张图准确吗、真实吗、可信吗;以及“据你所知,这件事真的发生过吗”。实验前还测了他们对 AI 的看法、对事实核查员的信任、“随大流”的心理,以及对移民和气候变化的态度。结束时,研究者会告诉每个人这些图都是 AI 做的,并教大家怎么识别假图。
人数也是事先算好的:模拟计算显示每组要 235 人、共 940 人,才有九成把握发现标签的主效应;考虑到还要分话题比较,作者多招了一些,最终是一千零一十八人。
④ 结果(发现了什么?)
总体来看,三种标签都没能让人明显少信这些人工智能假图,只有在移民话题上,社区笔记显出了效果。先看全部 1018 人:按“觉得这张图有多可信”(1 到 7 分)来算,不贴标签的对照组平均 3.72 分,AI 标签组 3.50 分,事实核查组 3.46 分,社区笔记组 3.33 分。方向是对的,贴了标签的组分数都更低,社区笔记最低;但差距太小,统计检验的 p 值是 0.069,没跨过 0.05 这条“显著”门槛。“相信那件假事”的程度也一样:对照组 3.07 分,三个标签组分别是 2.84、2.76、2.69 分,p 值 0.14,同样不显著。所以 H1、H2 都被否定,三种标签之间也分不出高下。
只看看到气候假图的 502 人,结果和总体一样,哪种标签都没有显著效果。倒是另一个现象很清楚:越担心气候变化的人,越觉得这些夸大气候后果的假图可信(p = 0.003),而且不管贴没贴标签都这样。
只看看到移民假图的 516 人,情况就不同了。对照组“相信那件假事”的程度是 3.31 分,社区笔记组降到 2.56 分,差异显著(p = 0.02),效果大小属于“小到中等”。社区笔记组给图片的可信度打分也更低(3.21 对 3.75),但只是“接近显著”(p = 0.057)。
在移民假图上,反移民态度越强的人,社区笔记让他们降低对假图信任的幅度越大(p = 0.011);同时,越不信任事实核查员的人,社区笔记对他们越有效(p = 0.015)。
还有一个值得留意的细节:那些相信“很多人都信的事多半是真的”的人(“随大流”心理强),AI 标签和事实核查标签对他们的效果会打折扣;社区笔记的效果虽然没有因此变强,但至少没有变弱,作者据此认为 H6 得到部分支持。在移民假图上,随大流心理越强的人,社区笔记和事实核查标签降低其“相信假事”的效果也越弱。
作者还做了一些没有事先登记的探索分析,只能当线索看:换一种更宽松的统计方法后,全体样本中社区笔记能显著降低可信度和相信程度;气候话题上,事实核查标签能降低假图的可信度;移民话题上,社区笔记再次两项都有效,AI 标签也能降低人们对假事的相信。
⑤ 讨论(这些发现说明什么?)
为什么贴了标签,人们还是差不多照样信?作者给出了几种解释。
照片被当成现实的直接记录,一个小小的标签很难打破这种默认的信任。而且实验里的假事在帖子文字和图片里各说了一遍,读起来更顺,也就更容易被当真。
实验里的标签只有短短两句话。以往研究发现,人们读完整篇核查文章才会有明显的纠正效果,一句“有误导”可能力度不够。
检查显示参与者都记得自己看到的是哪种标签,说明他们看得很仔细,可能比平时刷手机认真得多。于是三种标签都被“同样认真”地对待,差别也就显不出来了。
荷兰确实发生过森林火灾,一些骚乱里也确实有移民参与。半真半假的内容,可供纠正的“硬伤”更少。再加上作者用了 10 张不同的图,结果的“噪音”更大,效果更难测出来,但换来的是结论更贴近真实世界。
那为什么偏偏在移民话题上,社区笔记管用?移民问题牵动的是身份认同和“我们与他们”的群体情绪,和气候问题的心理机制很不一样。反移民态度越强的人,本来就越容易相信这类假图,所以可纠正的空间也更大;态度温和的人本来就不太信,标签能起的作用自然有限。更关键的是,社区笔记来自“和你一样的普通用户”,不像专业机构那样容易让人觉得“又是精英媒体在说教”,对不信任事实核查员的人尤其如此。作者认为这符合“动机性推理”和“选择性接受纠正”的研究:人们并不会一视同仁地接受所有纠正,来源让不让自己反感,影响很大。
不过作者也提醒,社区笔记靠普通人参与,可能出错、有偏见,甚至本身被谣言带偏;现实中的社区笔记还常常要引用专业核查文章。所以它应该是事实核查的补充,而不是替代。另外还有两个可能的干扰:一是两个话题的画面本身就不同,气候假图多是风景,移民假图多有人物,人脸和情绪线索本身就可能影响判断;二是数据收集于 2025 年 4 月,正好在扎克伯格宣布 Meta 放弃事实核查、改用社区笔记之后,偏右的受访者可能因此更不信核查、更愿意接受社区笔记。
⑥ 结论(最终结论 + 启示)
这项研究的结论是,对付人工智能生成的假图没有一招鲜的办法,标签管不管用要看话题和贴标签的是谁。总体上,三种标签都只让人“少信了一点点”,统计上站不住;但在移民这种高度两极化的话题上,普通用户写的社区笔记确实让人更少相信假事,对反移民态度强、最容易上当的人尤其有效。
这给平台和政策制定者带来三点启示。具体如下:
- 水印不等于纠错:“由 AI 制作”的标签能告诉你图是怎么来的,却不一定能纠正人们的错误看法。讨论政策时不能只问“要不要贴”,还要问“贴了想达到什么效果”。
- 事实核查员仍不可替代:平台正在缩减与核查机构的合作,但恰恰在移民这类两极化话题上,一部分人最容易信假,最需要专业人士把关。
- 多管齐下:没有适用于所有情况的方案,干预方式要看话题,甚至要看具体的图片和说法。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。生成式 AI(Grok、Gemini、Meta AI 等)大幅降低了合成图像的制作门槛,AI 驱动的视觉虚假信息在社交媒体上日益常见(Corsi 等 2024),2025 年荷兰大选期间亦有案例(Votta 与 Kruschinski 2025)。既有研究表明,此类内容会被视为真实信息(Shen 等 2021)、负面影响对政治人物的态度(Dan 2026)、削弱对视觉材料(Weikmann 与 Lecheler 2023)和社交媒体新闻的信任(Vaccari 与 Chadwick 2020),进而可能侵蚀数字环境中新闻业的公信力。然而与文本虚假信息的纠正研究(Walter 等 2020;Martel 与 Rand 2023)相比,如何降低 AI 视觉虚假信息的误导力仍缺乏证据。
制度背景。欧洲《强化版虚假信息行为准则》(2022)要求更可见的事实核查;欧盟《人工智能法》要求平台标注 AI 生成内容;X 广泛部署社区笔记;Meta 于 2025 年 1 月宣布在美国终止事实核查、全面转向社区笔记模式。由此,AI 生成的视觉虚假信息可由三类主体标注:AI 标签(水印)、独立事实核查员、用户社区笔记;而与此同时,事实核查机构与平台的正式合作正在弱化。
文献空白。(1)标签总体有效但效应温和(Clayton 等 2020),针对视觉内容、尤其是比较不同标签来源的证据稀缺,而公众对各干预主体的信任本就不同(Lee 2024);(2)既有研究多为单议题(如 Jia 等 2022)、单刺激(如 Koch 等 2023)设计;(3)多数研究聚焦美国语境与右倾虚假信息(Walter 等 2020)。
本研究贡献。预注册、经预测试的调查嵌入实验(荷兰代表性样本 N = 1,018),以原创生成的 10 张 AI 图像覆盖两个意识形态方向相反的议题(左倾的气候变化叙事 vs 右倾的反移民叙事),比较 AI 标签、事实核查标签、社区笔记与无标签对照对图像可信度与虚假主张认同的影响,并检验来源态度与议题态度的调节作用;作者称这是少数明确比较左右两种意识形态框架虚假信息纠正效果、且在美国以外检验平台干预的研究之一。
I. Theoretical Framework & Hypotheses(理论框架与假设)
两个结果变量。(1)图像可信度:视觉模态触发「真实感捷思」(realism heuristic;Sundar 2008 的 MAIN 模型),越逼真越可信(Weikmann 等 2025a、2025b),有效标签应明示图像非真以降低其可信度;(2)虚假主张认同:配图会让虚假记忆更生动(Weikmann 与 Lecheler 2023),效果取决于叙事与语境(Lee 与 Hameleers 2025),有效干预应阻止人们在「视觉证据」加持下接受虚假主张。两者分别测量,但预期同时发生。
标签起效的两条机制。其一,改变即时加工,促使个体重新评估而非「默认为真」(Pennycook 等 2018);其二,可信来源提升纠正信息本身的可靠性(Prike 与 Ecker 2023)。对视觉虚假信息而言,真实感捷思与图像的指示性(indexicality)使其更抗纠正,纠正须「击穿」视觉证据与虚假叙事之间看似直接的联系。作者推想:AI 标签通过触发怀疑起效;事实核查进一步解释误导之处并提供替代解读;社区笔记提供社会证明。实验中三类标签在措辞与设计上被刻意设为「原则上同等有效」,只改变来源。
| 编号 | 假设 / 研究问题 | 对应理论 |
|---|---|---|
| H1a / H1b | 任一标签来源(AI、事实核查、社区笔记)相较无干预,更能降低图像可信度(a)与虚假主张认同(b) | 警示标签有效性综述(Martel 与 Rand 2023);打断「默认为真」 |
| H2a / H2b | 事实核查来源比 AI 来源更能降低可信度(a)与认同(b) | 过程型 AI 标签效力较弱(Wittenberg 等 2025);事实核查对深度伪造有效(Dan 2026) |
| RQ1a / RQ1b | 图像可信度:AI vs 社区笔记;事实核查 vs 社区笔记 | 社区笔记证据有限(Jia 等 2022;Drolsbach 等 2024) |
| RQ2a / RQ2b | 虚假主张认同:同上两组比较 | 同上 |
| H4a / H4b | 「AI 捷思」(相信 AI 客观、中立、准确、公平)越强者,AI 来源越有效 | 机器捷思:机器「不带意识形态偏见」(Sundar 2008);人机传播来源理论(Lee 2024) |
| H5a / H5b | 对事实核查信任越高者,事实核查来源越有效 | 来源可信度;不信任主流媒体者抵触核查(Primig 2024) |
| H6a / H6b | 从众捷思(群体智慧)越强者,社区笔记越有效 | 从众捷思(Banas 等 2022);众包核查(Drolsbach 等 2024) |
| RQ3 | 议题(气候 vs 移民)是否影响两项结果 | 动机性推理(Taber 与 Lodge 2006);亲态度纠正更有效的元分析(Walter 等 2020) |
| RQ4a / RQ4b | 上述效应是否受气候变化 / 移民既有态度调节 | 党派一致性调节标签效果(Jia 等 2022) |
注:原文假设编号由 H2 直接跳到 H4,没有 H3。议题层面作者未设先验预期,将双议题比较定位为稳健性检验与探索。
M. Materials & Methods(材料与方法)
- 识别策略:预注册(OSF:osf.io/r38ae)、经预测试的调查嵌入式随机实验,单因素四水平被试间设计:AI 标签 / 事实核查标签 / 社区笔记 / 无标签对照;刺激层面嵌套「2 议题 × 5 图像」,共 40 个刺激版本,分析时合并为四组,另按议题拆分子样本。与预注册的(原文称「极小的」)偏离在 Supplementary D 报告。伦理审批:阿姆斯特丹大学 FMG-13362。
- 刺激生成:用 X 提供的文生图工具 Grok 生成初始图库 30 张(流程见 Supplementary E)。
- 预测试:Prolific 非代表性荷兰样本
N = 100,评估图像可信度、虚假叙事合理性、可辨识为 AI 生成的程度;据此做 k-means 聚类,剔除过易识破或过于逼真的图,以规避地板 / 天花板效应(Supplementary A)。 - 最终刺激:10 张 AI 图像:5 张夸大人为气候变化后果(如弗里斯兰群岛被淹),5 张围绕移民政策的误导叙事(如难民在公共公园搭帐篷);每张分别配四种条件,
5 × 4 + 5 × 4 = 40。气候叙事为左倾(夸大人为气候变化风险),移民叙事为右倾(反移民)。 - 标签设计:仿照 Instagram / Meta 现行干预,位置与措辞跨条件标准化;抬头直接取自平台:AI 标签 “Made with AI”(Meta),社区笔记 “Readers added context”(X);正文统一为 “A [label source] has determined that this photo was created using artificial intelligence. The claim in this post is misleading. More information.”
- 流程:知情同意 → 人口学与前测变量 → 干扰题(降低启动效应)→ 观看刺激至少 12 秒 → 操纵检验一(帖子主题,通过)→ 因变量 → 操纵检验二(能否正确回忆标签或无标签,通过;Supplementary B)→ 事后说明(告知图像由 AI 生成并提供识别指南)。
- 测量(除另注外均为 7 点 Likert,1 = 非常不同意,7 = 非常同意):
| 变量 | 题项 | M | SD | Cronbach α |
|---|---|---|---|---|
| AI 捷思(Lee 等 2022) | 4 题:AI 客观、中立、准确、公平 | 3.99 | 1.34 | .83 |
| 事实核查信任(Martel 与 Rand 2023;Tsfati 与 Cappella 2003) | 4 题,以 Nieuwscheckers、deCheckers、Knack 为例:公正、讲出全貌、值得信任等 | 4.03 | 1.10 | .79 |
| 从众捷思(Banas 等 2022) | 3 题,如「如果很多人相信某信息为真,它大概就是真的」 | 3.59 | 1.33 | .80 |
| 移民态度(Hameleers 等 2021) | 5 题,如难民威胁安全、应对难民关闭边境 | 4.27 | 1.70 | .94 |
| 气候变化态度(Gustafson 等 2020) | 语义差异量表 4 题 | 4.71 | 1.46 | .79 |
| DV1 图像可信度(Appelman 与 Sundar 2016) | 3 题:准确、真实、可信 | 3.50 | 1.68 | .80 |
| DV2 虚假主张认同(Wittenberg 等 2025) | 单题:据你所知该事件是否发生过 | 2.85 | 1.96 | — |
- 功效分析与样本:R 包
Superpower做基于模拟的功效分析,参照 Wittenberg 等(2025)的均值:每组n = 235、共N = 940可在 90% 功效下检测主效应;为交互与议题差异预留余量,目标N = 1,000。经 Dynata 招募荷兰代表性样本N = 1,018,2025 年 4 月 7 日至 28 日施测。年龄 M = 49.49(SD = 17.55);女性 51.6%、男性 48.2%;教育低 / 中 / 高 = 24.8% / 42.8% / 32.4%;政治取向(0 = 极左,10 = 极右)M = 5.65(SD = 2.35);中位作答时长 7.4 分钟。议题子样本:气候n = 502,移民n = 516。 - 随机化检验:年龄
F(1, 1016) = 0.534, p = .47;政治取向F(1, 1016) = 0.128, p = .72;性别χ²(9, N = 1018) = 16.731, p = .053;教育χ²(6, N = 1018) = 0.853, p = .99,均判为随机化成功(性别一项接近临界)。 - 分析策略:H1、H2 与 RQ1、RQ2 用单因素 ANOVA,主效应显著时做 Bonferroni 校正的两两比较;H4 至 H6 与 RQ4 用 OLS 线性回归,以对照组为参照的虚拟变量加交互项。据原文描述可写作
Y = β₀ + β₁·AI + β₂·FC + β₃·CN + β₄·M + β₅·AI×M + β₆·FC×M + β₇·CN×M + ε(M 为调节变量;气候子样本模型自由度 F(7, 494) 与 7 个预测项吻合)。全样本分析完成后,按议题拆分子样本重复同一流程;另做未预注册的探索分析:k−1 虚拟编码的 OLS(对照组为参照)。
R. Results(结果)
R1 · 全样本主效应(N = 1,018):均值方向一致(对照组最高、社区笔记最低),但单因素 ANOVA 均不显著,故未做事后比较。
| 条件 | 图像可信度 M(SD) | 虚假主张认同 M(SD) |
|---|---|---|
| 无标签对照 | 3.72(1.63) | 3.07(2.08) |
| AI 标签 | 3.50(1.68) | 2.84(1.92) |
| 事实核查标签 | 3.46(1.70) | 2.76(1.93) |
| 社区笔记 | 3.33(1.69) | 2.69(1.90) |
| ANOVA | F(3, 1014) = 2.37, p = .069, η² = .007 | F(3, 1014) = 1.82, p = .14, η² = .005 |
R2 · 假设检验汇总(全样本)
| 假设 | 检验项 | 系数 | p | 结论 |
|---|---|---|---|---|
| H1a / H1b | 标签 vs 无标签(ANOVA) | 见上表 | .069 / .14 | 拒绝 |
| H2a / H2b | 事实核查 vs AI | 未做事后比较 | — | 拒绝 |
| RQ1 / RQ2 | 社区笔记 vs AI、事实核查 | — | — | 无差异 |
| H4a | AI 来源 × AI 捷思 → 可信度 | β = 0.09 | .419 | 拒绝 |
| H4b | AI 来源 × AI 捷思 → 认同 | β = 0.03 | .816 | 拒绝 |
| H5a | 核查来源 × 核查信任 → 可信度 | β = 0.15 | .236 | 拒绝 |
| H5b | 核查来源 × 核查信任 → 认同 | β = 0.07 | .659 | 拒绝 |
| H6a | 社区笔记 × 从众捷思 → 可信度 | β = 0.07 | .50 | 部分支持 |
| H6b | 社区笔记 × 从众捷思 → 认同 | β = 0.15 | .236 | 拒绝 |
| 附 | AI 来源 × 从众捷思 → 可信度 | β = 0.21 | .049 | 从众越强,AI 标签越弱 |
| 附 | 核查来源 × 从众捷思 → 可信度 | β = 0.20 | .050 | 近显著,同向 |
- H6a 的「部分支持」:社区笔记的效力并未随从众捷思增强,但也不像 AI 与事实核查标签那样被削弱。
- R3 · 气候议题子样本(n = 502):模式与全样本一致,标签无效,且不受 AI 捷思、核查信任或从众捷思调节。RQ4a:气候态度交互均不显著(可信度模型
F(7, 494) = 3.15, p = .003, R² = .04;认同模型F(7, 494) = 2.20, p = .033, R² = .03;交互项ps > .05);但气候态度有显著主效应b = 0.30, SE = 0.10, t = 3.00, p = .003:越关切气候,越觉得夸大气候后果的假图可信,与条件无关。
R4 · 移民议题子样本(n = 516):唯一出现显著效应的情境。
| 效应 | 结果变量 | 统计量 | p | 解读 |
|---|---|---|---|---|
| 条件主效应(ANOVA) | 可信度 | F(3, 512) = 2.89,偏 η² = .017 | .035 | Bonferroni 两两均不显著;对照 3.75(1.64)vs 社区笔记 3.21(1.70),p = .057 |
| 条件主效应(ANOVA) | 认同 | F(3, 512) = 3.71,偏 η² = .022 | .012 | 对照 3.31(2.17)vs 社区笔记 2.56(1.92),p = .02,Cohen d = 0.37;其余两两不显著 |
| 社区笔记 × 从众捷思 | 认同 | β = 0.42 | .019 | 从众越强,社区笔记越弱 |
| 事实核查 × 从众捷思 | 认同 | β = 0.49 | .009 | 从众越强,事实核查越弱 |
| 社区笔记 × 核查信任 | 可信度 | b = 0.44, SE = 0.18, t(508) = 2.43 | .015 | 核查信任越低,社区笔记越能压低可信度 |
| RQ4b 社区笔记 × 反移民态度 | 可信度 | b = −0.29, SE = 0.11, t(508) = −2.57 | .011 | 反移民态度越强,社区笔记效果越强 |
| RQ4b 社区笔记 × 反移民态度 | 认同 | b = −0.25, SE = 0.13, t(508) = −1.86 | .064 | 同向趋势,边缘显著 |
- 移民子样本中与 AI 捷思的交互均不显著;其余交互项
ps > .07,包括事实核查来源 × 核查信任。 - RQ3 回答:议题确实重要。气候假图上所有干预均无效;移民假图上社区笔记最有效,尤其对反移民态度强、对事实核查信任低的人。
- R5 · 探索性分析(未预注册):作者以 ANOVA 加 Bonferroni 事后比较过于保守(Narum 2006)、η² 显示有意义的均值差异为由,改用 k−1 虚拟编码 OLS。全样本:社区笔记显著降低可信度与认同;气候:事实核查标签显著降低图像可信度;移民:社区笔记两项均降低,AI 标签降低虚假主张认同。作者自称该分析应谨慎对待、不够稳健;具体系数位于正文图表,本次抓取的 HTML 文本未含。
a / D. Discussion & Conclusion(讨论与结论)
- 核心结论:合并议题时零结果。不同于文本纠正研究(Walter 等 2020),AI 生成图像更抗反驳;与 Wittenberg 等(2025)以更大样本发现此类标签仅有温和降信效果的结论大体一致。标签条件均值有下降趋势但未显著。
- 对零结果的解释:(1)标签可能被图像「盖过」而被忽视(Oeldorf-Hirsch 等 2020),但本实验两项操纵检验均通过,说明被试注意力可能高于自然情境,对各标签施以相近的审视,反而压缩了条件间差异;(2)真实感捷思与指示性阻碍批判性审视(Sundar 2008);(3)虚假内容在文字与图像中重复出现,提高内容流畅性(Prike 与 Ecker 2023),单个标签即便被注意到也难以打断加工。
- 议题依赖与动机性推理:移民议题触及身份威胁与群际动态(Hameleers 与 van der Meer 2020),故仅议题内分析出现显著效应不足为奇。调节效应符合动机性推理与选择性接受纠正的文献(Taber 与 Lodge 2006;Walter 等 2020);反移民态度较弱者本就不易形成误判,纠正空间有限。社区笔记借同侪线索绕开制度性事实核查常引发的抵触(Primig 2024)。
- 与既往研究的张力:探索分析中常被视为中立来源的 AI 标签降低了移民虚假主张认同,与 Jia 等(2022)的美国文本型新冠虚假信息实验相呼应;但在 Jia 等研究中,社区笔记对政治右翼者尤其无效,与本研究移民议题上的结果相反,凸显跨语境检验的必要。事实核查或对气候虚假信息更有效,可能因为易受其影响者更认可成熟的新闻来源。
- 潜在混淆:视觉特征:气候刺激多为风景,移民刺激多含人物;人脸、情绪线索与生动性可能独立影响加工(Lee 与 Suk 2025),议题差异或部分源于表征方式。
- 局限:(1)2025 年 4 月施测,恰在扎克伯格宣布 Meta 终止事实核查、改用社区笔记之后,可能使右倾受访者更疑核查、更纳笔记;(2)现实社区笔记常引用正式核查,本设计未含此要素;机制究竟来自感知中立、来源框定还是措辞(如「Readers added context」传递较弱的说服意图)尚无法区分;(3)干预仅为简短标签,而阅读完整核查文章通常能产生显著纠正效果(Walter 等 2020),更详尽的标签或更有效(Dan 2026);(4)合并多图增加预测误差,是测量精度与外部效度的权衡;(5)刺激含真实成分(荷兰确有森林火灾、部分骚乱确有移民参与),可纠正内容有限;(6)无法分离图与文各自的欺骗效应,需增设纯文本、纯图像条件。
- 实践启示:水印能标示图像来源,却未必能纠正错误信念,政策讨论应从「透明度上需要哪种标签」转向「标签要达成什么」;平台正缩减内容审核及与核查机构的合作,但事实核查员仍是评估两极化议题的关键专家;社区笔记依赖业余参与,可能出错、有偏、受虚假信息影响,应作补充而非替代;总体建议对 AI 视觉虚假信息多管齐下,因议题乃至具体图像与主张而异。
- 本报告评述:显著结果集中在全样本零结果之后的议题子样本与多组交互检验中,正文未报告对交互项的多重比较校正,移民议题的显著交互(p 介于 .009 与 .019)宜视为待复制的线索;这与作者自己「没有简单解药」的定调一致。
- 开放科学与声明:预注册见 OSF(osf.io/r38ae),预注册偏离见 Supplementary D,完整子样本结果见 Supplementary C,预印本已发布于 OSF;作者声明无利益冲突;致谢 Rinaldo Kühne 的统计支持;抓取文本中资助一节为空。
🧠 IRMaD 思维导图
mindmap
root((AI假图标签难奏效))
I 引言
AI假图日益泛滥
平台三类标签并存
Meta转向社区笔记
视觉纠错证据稀缺
多为单题单图研究
R 问题
标签能否降低可信度
核查是否胜过AI标签
社区笔记相对效力
来源态度是否调节
气候与移民有无差异
M 方法
荷兰预注册实验
代表性样本1018人
四组被试间设计
Grok生成10张假图
标签措辞统一只换来源
七点量表测两项结果
ANOVA与OLS交互
R 结果
全样本差异不显著
H1 H2 均被拒绝
气候议题全部无效
移民议题社区笔记有效
小到中等效应量
反移民者效果更强
从众心理削弱标签
a 讨论
图像真实感难打破
图文重复增强流畅
标签过短力度不足
身份威胁与动机推理
同侪线索少引抵触
画面特征或混淆议题
D 结论
没有一招鲜
水印不等于纠错
社区笔记宜作补充
核查员仍不可替代
多管齐下因题施策
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。