arXiv 预印本 · 2026-08-27 · 牛津互联网研究所通讯作者 · 19,854 账号 / 57,935 次更正 / 1191 万条原创帖 · DiD 准实验

社区注释之后:被纠一次的账号收敛,屡被纠正的账号反而更活跃

Yuwei Chuai, Thomas Renault, Nicolas Pröllochs 等 5 人 · arXiv (cs.SI) · 2026 · arXiv: 2608.27526
原题:Community corrections have divergent downstream effects across corrected accounts
Open Access 新颖度 0.82

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

如今不少社交平台会请普通用户一起给可疑帖子“加注释”,说明它哪里可能误导人,这种做法叫社区事实核查。最有名的例子是 X(原推特)的 Community Notes(社区注释):任何用户都可以给帖子写补充说明,但只有当过去观点不同的一批评分者都认为这条注释有帮助时,它才会真正显示在帖子下方。之后 Meta 在 Facebook、Instagram 和 Threads 上推出了类似系统,YouTube 和 TikTok 也在测试。

你可以把它想成班级里的“同学互评纠错”:有人在公告栏上写了一个不准确的说法,几位平时意见不合的同学都点头之后,旁边就会贴上一张小纸条,说明哪里不对。已有不少研究证明,被贴了纸条的那条帖子转发量明显下降,作者也更可能把它删掉。

可问题在于,纸条管住的是“这一条”帖子,那写帖子的人呢?他会因此变得更小心、少发一点、发得更靠谱,还是心里不服,反而发得更多?这件事很要紧,因为网上的误导信息往往集中在一小撮账号手里。如果纠正能让这些人收敛,一点点改变就能少掉很多误导内容;如果他们反而更起劲,那么只看单条帖子的“好成绩”,就可能高估了这套系统的真实作用。

② 研究问题(要回答什么?)

这篇研究想弄清楚,一个人的帖子被公开加上更正注释之后,他自己之后发帖的多少和内容会不会跟着改变。也就是说,研究的镜头从“那条被纠正的帖子”转向了“写帖子的那个人”。具体如下:

作者心里有两种截然相反的猜想。一种是“吃一堑,长一智”:注释附带了证据,又是当众显示的,面子上的压力会让人收敛。另一种是“越说越不服”:被公开纠正会让人觉得自己的立场和身份受到攻击,于是更加防御、更想站队,反而发得更多。

③ 研究方法(怎么做的?)

研究者用的是一种叫“双重差分”的比较方法,可以理解为“同时看两组人的前后变化,再把两个变化相减”。

第一步,找两组帖子。一组是真的被显示了社区注释的误导帖,共 29,049 条,来自 10,799 个账号,这是“被纠正组”;另一组来自同一团队前作的数据集,是和被注释帖一一配对的相似帖子,共 28,886 条,来自 12,823 个账号,它们没有显示注释,是“对照组”。对照帖也被安排了一个“假想的注释时间”,就用和它配对的那条帖子的真实注释时间。数据覆盖社区注释上线后的二十多个月。

第二步,数作者前后各四周发了多少帖。研究者通过 X 的官方接口,数出每位作者在注释出现前后各 28 天里每天发了几条原创帖(不算回复和转发),一共拿到约一千一百九十万条原创帖。

第三步,相减。如果被纠正组的作者注释后比注释前多发了,而对照组作者同一时段没有多发,那么“多出来的那一截”才算是注释带来的变化。这就像比较两个班:一个班换了新老师,另一个班没换,只看两个班成绩变化的,才能排除“期末大家都更努力”这种共同原因。研究者还专门检查了注释出现之前两组的走势是否一致,一致才说明这个比较是公平的。

第四步,给内容打分。用现成的机器分类器给每条帖子打毒性、正负情绪、政治话题的分;用一个覆盖 11,520 个新闻网站的信誉数据库给帖子里的链接打分;还让大模型按一套经过验证的方法给帖子的误导程度打 0 到 1 分,它的判断准确度接近专业事实核查员。

④ 结果(发现了什么?)

整体来看,帖子被加注释之后,作者们反而比对照组多发了约百分之三的帖子,但这个平均数背后藏着两条方向相反的路。先看整体:注释出现后第一周多发 1.7%,第四周多发 3.9%,四周合计多发 2.9%(p < 0.001,意思是几乎不可能是运气)。而在注释出现之前的几周里,两组的发帖走势几乎一模一样,说明这不是本来就存在的差别。

① 只被纠一次的人:收敛了
在研究期间只被注释过一次的账号占被纠正账号的 71.4%。他们被注释后发帖量减少 2.4%(p = 0.007),之后发的帖子毒性更低、误导程度更低,高毒性帖子和引用低质量网站的帖子也都变少了。
② 屡次被纠的人:反而更起劲
他们只占被纠正账号的 28.6%,却贡献了 73.4% 的被注释帖。第一次被纠正后,他们的发帖量就增加 4.4%;而且后来被注释次数越多的账号,第一次之后涨得越多,至少被注释五次的账号涨了 9.5%
③ 后面几次纠正:几乎没反应
对屡次被纠的账号来说,从第二次注释开始,发帖量只变化约 1%,在统计上跟零没有区别。
④ 屡纠组的内容也没变好
他们帖子的平均毒性和误导程度都没有下降;引用的网站质量反而更低,政治内容的比例更高,高度误导的帖子数量还多了 1.9%

研究者还发现,屡次被纠的账号在被纠正之前就和别人不一样:粉丝更多、更可能是认证账号、政治立场更偏右、平时接触的误导信息更多,发帖也更频繁、政治内容更多。在这群人内部,第一次被纠后涨得最猛的,反而是平时发帖不多的账号,涨了 12.3%;以前发帖更毒、更误导、更政治化的账号也涨得更明显。

⑤ 讨论(这些发现说明什么?)

这说明,同样一张“小纸条”,贴在不同人身上效果完全不同。对只被纠一次的人来说,公开注释像一次“当众提醒”:纸条里附着证据,告诉他哪里说得不对;又因为是公开显示的,他的粉丝都看得见,面子上挂不住。于是他少发一点、发得更干净。这符合“吃一堑,长一智”或者“怕丢脸所以收敛”的解释。

而那些屡次被纠的人,更像是“越说越不服”。被当众纠正,可能让他们觉得自己的立场和身份受到了攻击,注意力就从“我说得对不对”转到了“我站在哪一边”。作者特别提醒:这只是和数据吻合的一种解释,研究并没有直接测到这些人心里在想什么。

还有一个关键细节:屡次被纠的账号在第一次被纠正时就已经走上了另一条路,之后的注释几乎起不到额外作用。所以第一次纠正可能是最要紧的时机。另外,在屡次被纠的人里,政治立场偏右的账号第一次被纠后发帖增加得更明显;而社区注释本来就更多落在右倾账号身上,这可能让后续注释更加集中到他们那边。不过作者强调,这不能理解成“政治立场导致不服”,只能说明在这个平台、这批样本里,增量集中在哪里。

研究也有局限:它不是真正的随机实验,不能完全排除随时间变化的其他因素;“被纠几次”是事后才知道的分组,第一次被纠后多发帖,本身也可能让人更容易再被纠;结论也只来自 X 这一个平台。

⑥ 结论(最终结论 + 启示)

这项研究的最终结论是,社区注释能管住一条条误导帖,却管不住最常发误导帖的那一小群人。只被纠一次的人会收敛,屡次被纠的人第一次被纠后反而更活跃,后面的注释也几乎不起作用,还多发了高度误导的帖子。

给平台设计者的启示是:“纠正内容”和“改变作者”是两个不同的目标,要分开来评估。判断一套事实核查系统好不好,不能只看被注释的帖子少转发了多少,还要看背后的作者后来发了什么。作者建议,平台可以在第一次公开纠正时,额外给作者本人一些帮助,比如提醒他注意信息是否准确,或者给他一个回应注释的机会;对总被注释的账号,一遍遍重复同一种纠正方式可能不够。同时,任何针对特定账号的区别对待,都需要透明的申诉渠道,还要防止错误的或有组织的恶意纠正。重点不是简单地惩罚这些账号,而是真正促成行为上的改变。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。社区事实核查(community-based fact-checking)正成为各平台治理误导内容的主力工具:它绕开专业核查员在覆盖面与速度上的瓶颈,由用户协作识别可能误导的帖子、补充语境并互评注释质量。最具代表性的实现是 X 的 Community Notes——注释只有在过往观点相异的贡献者普遍认为有帮助时才会公开显示。Meta 已在 Facebook、Instagram 与 Threads 引入同类系统,YouTube 与 TikTok 亦在测试基于注释的机制,其作为平台治理干预的有效性因而日益重要。

既往证据与空白。帖子层面的证据已相当充分:准实验研究显示注释显示会显著降低被注帖的转发与互动、改变其在社交网络中的扩散,并提高作者删帖概率;实验研究显示语境注释可提升对核查的信任、改善误导内容识别并抑制转发。另有研究考察核查对受众信念准确度、媒体信任与泛化怀疑的下游影响,但被纠正作者随后的内容生产行为几乎空白——删掉被注帖并不意味着之后少发或发得更可靠。这一空白之所以关键,在于误导信息的传播高度集中于少数账号:若纠正使其收敛,微小改进即可削减大量误导内容;若其照发甚至多发而内容不改善,帖子层面的强效应就会高估干预的总体成效。其他内容审核干预的证据也不一致:删帖说明与删除违规内容可减少后续违规,临时封禁却在提高发帖量的同时降低内容质量。

本研究贡献。作者团队(通讯作者 Mohsen Mosleh,牛津互联网研究所)以更正事件为分析单位,追踪 19,854 个账号、57,935 个事件(被注帖与匹配对照帖)在注释显示前后各四周的 11,909,591 条原创帖,用负二项与线性固定效应 DiD 同时估计发帖数量内容的变化,并区分被纠一次屡被纠正账号、首次后续更正。核心发现是整体 +2.9% 的发帖增量掩盖了两条分化轨迹,据此提出“纠正内容”与“改变生产者”是平台治理中需分开评估的两个目标。

I. Theoretical Framework & Hypotheses(理论框架与假设)

论文未设正式假设,而是就作者层下游效应提出竞争性预期,并以四个研究问题组织实证。

编号预期 / 研究问题对应理论与既往证据
E1纠错学习与威慑:被纠作者减少后续发帖或提升内容质量;重复反馈可能进一步强化学习纠错学习(注释直接说明为何误导并链接证据)+ 声誉威慑(注释公开显示,被注帖成为众目所见的争议对象,并招致批评与道德愤慨式回复);专业核查的显著性可抑制州议员的不实陈述(AJPS 2015 田野实验);公开注释提高并加快作者自愿撤帖
E2抵触与反向回应:作者贬低或质疑注释的正当性,视之为声誉或身份威胁,注意力由准确性转向社会与党派考量,发帖不减反增、质量不升反降防御性反应、身份威胁;X 平台田野实验发现,直接纠正分享虚假政治新闻的用户后,其转发质量下降、党派倾向与毒性上升,但原创帖未受影响(CHI 2021);临时封禁提高发帖量但降低质量(MISQ 2026)
E3屡被纠正者的特殊性与边际递减:屡被纠正账号可能本就是高活跃、政治投入或意识形态坚定、对纠正反馈不敏感的群体;更正累积后注释显著性下降、被视为例行公事、边际声誉成本递减误导信息分享高度集中于少数“超级分享者”(Science 2019、2024;Science Advances 2019);习惯化
RQ1注释显示后,被纠作者的原创帖数量如何变化发帖量 DiD(负二项)
RQ2后续内容的毒性、误导程度、信源质量、政治比例、情绪与自信度如何变化内容 DiD(线性固定效应)
RQ3被纠一次与屡被纠正账号的反应是否不同,两类账号事前有何差异按纠正频次分层 + 组间画像回归
RQ4屡被纠正账号对首次与后续更正的反应是否不同首次 / 第 k 次及以后更正分别估计

M. Materials & Methods(材料与方法)

R. Results(结果)

表 1 · 按纠正频次分层的发帖效应(RQ3/RQ4,effect = eβ − 1;首列括号内为图 2b 事件数)

观测到的被注次数全部更正事件仅首次更正第 k 次及以后
=1(9,796)−2.4%(z=−2.700,p=0.007)−2.4%
≥2(11,675)+2.3%(z=4.062,p<0.001)+4.4%(z=6.056,p<0.001)第 2 次起 +1.0%(p=0.085)
≥3(8,378)+2.6%(z=4.091,p<0.001)+6.9%(z=7.727,p<0.001)第 3 次起 +0.9%(p=0.165)
≥4(6,511)+3.0%(z=4.201,p<0.001)+8.1%(z=7.757,p<0.001)第 4 次起 +1.0%(p=0.172)
≥5(5,463)+3.4%(z=4.437,p<0.001)+9.5%(z=8.177,p<0.001)第 5 次起 +1.0%(p=0.261)

表 2 · 内容变化 DiD(RQ2)

结果变量被纠一次屡被纠正(≥2)结论
毒性(均值)−0.034,t(47330)=−2.263,p=0.024无可检出下降仅一次组改善
误导程度(均值)−0.064,t(39364)=−3.753,p<0.001无可检出下降仅一次组改善
URL 质量(均值)正文未报告显著变化−0.047,t(19911)=−3.034,p=0.002屡纠组信源变差
政治内容比例正文未报告系数(引言称下降)+0.014,t(51176)=2.053,p=0.040屡纠组更政治化
正/负情绪、观点自信度不显著不显著
高毒性帖数量−3.1%,z=−2.946,p=0.003无相应下降一次组减少
低 URL 质量帖数量−7.7%,z=−3.313,p<0.001无相应下降一次组减少
高误导帖数量正文未报告显著变化+1.9%,z=2.599,p=0.009屡纠组增多

表 3 · 屡被纠正组内首次更正的异质效应(中位数切分)

事前特征高组低组
发帖频率+1.2%(p=0.128)+12.3%(z=6.716,p<0.001)
毒性+5.4%(z=5.918,p<0.001)+2.2%(p=0.069)
误导程度+5.8%(z=6.700,p<0.001)+0.8%(p=0.532)
政治内容+5.8%(z=6.832,p<0.001)+0.8%(p=0.561)
URL 质量+5.1%(z=6.159,p<0.001)+1.0%(p=0.489)
政治倾向右倾:p<0.001左倾:p=0.048

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((社区注释的分化效应))
    I 引言
      逐帖效果已被证实
      作者行为效果未知
      误导信息高度集中
      学习与抵触两种预期
    R 问题
      发帖量是否变化
      内容质量是否变化
      一次与屡次被纠之别
      首次与后续更正之别
    M 方法
      19854 个账号
      57935 个更正事件
      1191 万条原创帖
      匹配对照帖 DiD
      负二项 前后各四周
      七项内容特征打分
    R 结果
      整体发帖增 2.9%
      被纠一次降 2.4%
      屡纠组首次增 4.4%
      后续更正无显著变化
      一次组毒性误导下降
      屡纠组高误导帖增多
    a 讨论
      少数账号占多数注释
      既有差异部分解释
      首次更正是关键点
      右倾账号增量更显著
      无法排除时变混杂
    D 结论
      纠正内容不等于改变作者
      作者层指标纳入评估
      首次纠正叠加作者干预
      差异化干预需申诉保障

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。