🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
虚假信息现在是个老大难问题,它会加剧政治极化、损害公共卫生。而在所有形式里,视频是最难核查的一种。
难在哪里?先看一个数字:YouTube 每天新增的用户上传视频,总时长相当于七十二万小时。事实核查机构不可能靠人力跟上。
但真正棘手的还不是数量,而是结构。一篇文章或者一张图,真假往往是整体判断。可视频不一样——一个五十五分钟的采访,可能整体内容都没问题,只是其中某几个瞬间说了假话。论文里举的例子就是这样:一段五十五分钟的视频,被核查专家标出了十六处虚假陈述。
过去的研究基本都在做一件事:判断这个视频整体是不是含有假信息。作者认为这个做法用处有限。因为它只给你一个标签,不告诉你假话出现在第几分钟,也不告诉你是哪句话有问题。对于核查记者来说,拿到一个“这视频有问题”的结论,还是得从头看到尾。
② 研究问题(要回答什么?)
这篇论文提出并尝试解决一个更精细的新任务,作者把它叫做虚假信息片段定位。
打个比方:过去的做法像是告诉你“这本书里有错别字”,而这项研究要做的是直接把错别字圈出来,告诉你在第几页第几行。
论文围绕三个具体问题展开:
- 问题一 · 数据从哪来:这个任务此前根本没有标注数据。能不能设计一套流程,把事实核查机构已有的成果转化成可用于训练的、带时间标记的数据集?
- 问题二 · 到底做不做得到:用现有的语言模型,能不能把说假话的那几十秒从几十万个正常片段里挑出来?
- 问题三 · 换个人还灵吗:在一个人的言论上训练出来的模型,拿去检测完全不同的说话人,还能用吗?
③ 研究方法(怎么做的?)
研究团队的整体思路是:把事实核查机构已经做完的人工劳动,自动对齐回视频的时间轴上。
数据来自巴西最有声望的核查机构之一 Aos Fatos,它是国际事实核查联盟的成员。团队做了两个数据集:
- BOL4Y:该机构整理了巴西前总统博索纳罗四年任期内的 6685 条不实陈述。团队抓取网站数据,筛出以视频为来源的部分,下载得到 525 个视频。
- EI22:2022 年巴西总统选举期间,选民发布的关于选举舞弊的 78 个核查视频,由机构私下提供。这批视频的说话人和上一批完全不同。
核心技术流程分四步,最巧妙的是第三步:
第一步 转写与切分。用 OpenAI 的 Whisper 模型把音频转成文字,它会自动切成最长三十秒的片段。
第二步 转成向量。用一个专门为巴西葡萄牙语训练的 BERT 模型(BERTimbau),把每个片段变成 768 维的向量。
第三步 语义匹配。这一步是关键。团队把每一条已知的假陈述也变成向量,然后拿去和视频里所有片段比对相似度,找出最像的那个片段。因为一句话可能横跨好几个片段,所以还会把前后相邻的片段一并取出来。
第四步 人工复核。这里作者做得很扎实。他们设了一个相似度 0.7 的门槛(低于这个值经人工检查基本都对不上),得到 2996 组待标注的配对,然后用标注工具逐条人工确认。两位标注者最终匹配上 2373 条,只在 18 条上有分歧,这些有分歧的直接从数据集里剔除,最终得到 2355 个片段,一致率 99.24%。
还有一个必须交代的现实:这个数据极度不平衡——正例只有 2355 个,而没有假话的负例有 336855 个,比例接近一比一百四十。所以团队专门测试了各种欠采样比例(从一比一到一比一百)。
④ 结果(发现了什么?)
研究证明这个任务是可行的,但同时也暴露出它相当有难度。最好的成绩是宏平均 F1 达到 0.68。
最佳配置(BERTimbau 一比七十五)
宏平均 F1 0.68。
用完整数据训练的模型
被所有欠采样版本击败。
在博索纳罗数据上训练,
测选民视频得到 F1 0.71。
先看最实用的一个发现:把全部数据一股脑喂进去,效果反而最差。BERTimbau 用完整数据训练时宏平均 F1 只有 0.56,而适度欠采样后能到 0.68。作者的结论很直接——在这个任务上用全量数据训练既费钱又适得其反。这对资源有限的团队是个好消息。
不同配置之间的权衡也很清楚。一比一的平衡训练集能拿到最高的平衡准确率 0.82,但精确率只有 0.09,意味着报警报得太多。随着负例比例提高,精确率稳步上升到 0.43,而召回率始终维持在 0.99 以上。两个模型对比,BERTimbau 整体不输甚至优于 PTT5。
第二个发现揭示了转写质量的影响。团队做了一个很聪明的对照:核查记者发布的陈述文字是经过润色的,还会在方括号里补充上下文,比如把“他建了三座海外水电站”改成“他指卢拉建了三座海外水电站”。团队用这个“编辑版”重跑了一遍,成绩明显提升,最好能到 0.81。这个对比干净地说明了:性能的一大瓶颈在于转写文本本身是嘈杂的。
第三个发现关乎实际部署。团队做了时序实验——只用过去的数据训练,去预测之后月份的情况。宏平均 F1 在 0.5 到 0.8 之间波动。值得注意的是,2022 年下半年所有配置的成绩都下滑了,即便是那些累积了全部历史数据的模型也不例外。那正是巴西大选临近、博索纳罗和卢拉激烈交锋的时期。这提示:当虚假信息的话题和话术发生转变时,旧模型会跟不上。
最后是跨数据集测试,这一条最能说明实用价值。用博索纳罗的数据训练,拿去测完全不同说话人的选民视频,F1 达到 0.71,甚至高于同数据集内的成绩。这说明模型学到的不只是某个人的说话习惯。
⑤ 讨论(这些发现说明什么?)
作者对这项工作的定位很清醒:这是为一个新任务建立起点,而不是宣布问题已经解决。0.68 这个分数被明确称为“基线”,作者反复强调仍有很大改进空间。
研究最实在的贡献其实是那批数据。作者按照 FAIR 原则(可发现、可获取、可互操作、可复用)把资源全部公开:两个数据集的核查条目、对应的音频、转写文本、以及能拿到的原始视频,分别托管在 Zenodo 和 HuggingFace,代码也在 GitHub 上开源。他们还特意指出,这套构建数据的方法本身可以被别的团队复用,去生成其他语言、其他场景的类似资源。
从传播学角度看,这项研究指向了一个很具体的应用场景。作者设想的不是“自动删视频”,而是在假话出现的那个时间点,给观众叠加一个带上下文的提示标签。这比封禁整段视频温和得多,也更符合“提供信息”而非“限制信息”的治理思路。
作者还把这项工作放到了监管背景下。欧盟的数字服务法要求平台移除违规内容,并且对审核过程保持透明。作者认为,这类法规恰恰需要更可靠的自动审核工具支撑——而能精确定位到时间点的检测,正好同时服务于“处置”和“透明度”两个要求。
局限作者交代得很坦率,主要有三条。第一,转写噪音:即便 Whisper 质量很高,效果仍高度依赖音质;而且它只能做到句子级切分,不支持词级。部分转写还来自机构的专有服务,实现细节不公开。第二,语言与地域单一:全部数据都是巴西葡萄牙语。作者为此做了辩护,理由是巴西是研究虚假信息的重要场景,且数据覆盖了四年间被大量利用的多种议题。第三,任务本身还有很大提升空间。作者把使用大语言模型和视觉语言模型列为下一步方向——目前的方法只用了音频转出来的文字,完全没有利用画面信息。
⑥ 结论(最终结论 + 启示)
这项研究的核心价值可以概括为:它把一个此前不存在的任务定义了出来,并且给这个任务配齐了数据、基线和评测方式。
三项主要成果是:定义并首次尝试了视频虚假信息片段定位任务;发布了两个带时间标注的数据集(分别含 2355 条和 78 条已核查的不实陈述);建立了 F1 为 0.68 的基线,并以 0.71 的跨数据集成绩证明了方法在换了说话人之后依然有效。
对做传播和治理研究的人来说,这项工作的启发在于:对付虚假信息的工具,正在从“判断真假”走向“定位位置”。这个转变看起来只是精度提升,实际上改变了干预方式——从事后删除整条内容,变成在恰当的时刻给观众补上恰当的上下文。
作者最后表达的期待也很务实:希望这类工具能减少核查人员在视频上耗费的时间,帮他们快速定位到值得核查的那几个点。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
虚假信息已成为当代社会最具挑战的问题之一,充当攻击民主、政治极化与激进化运动的引擎,并波及气候变化与公共卫生等多个议题。其形态横跨网站、迷因、图像及 WhatsApp、Telegram 等消息平台,媒介涵盖音频、视频、图像与文本。
视频形态尤为棘手:YouTube 单日新增用户生成视频的时长即相当于 720,000 小时,核查机构在缺乏辅助工具的情况下无法跟上传播速度。同时,内容审核对 YouTube、TikTok 等平台日益成为合规问题——欧盟数字服务法(DSA)要求平台移除违反条款的内容并对审核过程提供透明度。
论文识别出的关键研究空白在于:既往工作均在视频层面判断其是否传播虚假信息。作者指出该做法“提供的视角有限且不易解释”,因为它既不说明虚假信息在视频中何时出现,也不说明是哪些断言导致该视频具有虚假性质。这一空白具有直接的实务后果:一个五十五分钟的视频可能仅因其中若干简短片段的虚假陈述而被判定为虚假(论文示例中该视频经专家标出 16 处不实断言)。
据作者所知,本文是首次处理视频中的虚假信息片段定位问题,其任务设定明确类比于 Pavlopoulos 等人的“毒性片段检测(Toxic Spans Detection)”任务。
I. Theoretical Framework & Hypotheses(理论框架与假设)
| 编号 | 研究问题 / 任务设定 | 判定与对应设计 |
|---|---|---|
| 任务 | 虚假信息片段定位:不仅判断内容是否虚假,更要确定内容中哪些片段造成其虚假性质 | 类比 Toxic Spans Detection;片段级二分类 |
| RQ1 | 该任务此前无标注数据,能否设计流程将既有事实核查成果对齐回视频时间轴? | 转写 → 嵌入 → 语义匹配 → 人工复核的四步管线;产出 BOL4Y 与 EI22 |
| RQ2 | 以现有预训练语言模型能否在极不平衡的片段池中识别虚假片段? | BERTimbau 与 PTT5 微调;宏平均 F1 为主指标(因类别不平衡) |
| RQ3 | 类别不平衡如何影响性能?训练数据越多是否越好? | 七档欠采样比例(1:1 至 1:100 及全量)对照 |
| RQ4 | 转写文本的噪声在多大程度上构成性能瓶颈? | Original 版 vs. Edited 版对照:后者以记者润色版断言替换转写版断言 |
| RQ5 | 模型能否泛化到不同说话人、不同来源的虚假信息?能否预测未来? | 跨数据集测试(BOL4Y 训练 → EI22 测试)+ 两种时序滑窗实验 |
应用价值定位:精确到时间点的定位可使核查者与平台在假断言出现的确切时刻提供必要上下文(如叠加警示标签),这既服务于 DSA 的内容处置要求,也服务于其透明度要求。
M. Materials & Methods(材料与方法)
- 数据源:巴西核查机构 Aos Fatos(国际事实核查联盟 IFCN 成员)。BOL4Y —— 2023 年 3 月抓取其网站,获前总统博索纳罗四年任期内 6,685 条不实断言、来自 1,595 个唯一来源;筛出视频来源者下载得 525 个视频,另补入该机构 Escriba 转写服务提供的 121 份无视频链接的文本转写。EI22 —— 由机构私下提供的 2022 年巴西大选期间选民发布的选举舞弊主题核查视频,77 个视频、1,997 个片段,其中 78 个为虚假断言,与 BOL4Y 视频无关联。
- 步骤一 · 转写与切分:以 OpenAI Whisper 对 525 个视频音频转写。Whisper 当时不支持词级时间戳,且切分窗口不可配置,仅能切分为最长 30 秒的句子级片段。Escriba 提供的转写则已由机构切分。
- 步骤二 · 片段嵌入:使用 BERTimbau(在巴西葡语网络语料 BrWac 上预训练的 BERT),经 SentenceTransformers 的均值池化取
768维稠密向量。 - 步骤三 · 语义匹配:对每条不实断言取嵌入,与全部片段嵌入计算余弦相似度,取相似度最高者为首选候选;因一条断言可能跨越多个转写片段,同时取其前后相邻片段一并送审。
- 步骤四 · 人工标注与质控:以余弦相似度
≥ 0.7为筛选门槛(经人工检验,低于 0.7 的配对语义上并不相似),得 2,996 组待标注配对,使用开源标注工具 Doccano。标注者须标出三个候选片段中哪些构成该断言(凡包含断言中至少一个词即标记),并可另行标记:需要更多片段才能覆盖完整断言、存在转写错误、或三个片段均不匹配。对标记为“断言不完整”的实例执行额外轮次的匹配,向前后继续扩展。两位标注者(本文作者)自 6,685 条中匹配出 2,373 条,仅 18 条存在分歧;分歧条目经讨论后从数据集中移除,最终得 2,355 个片段,一致率 99.24%。匹配后将构成同一断言的多个片段拼接为一条作为正例,以保证断言的完整语境。 - 负例构造与类别不平衡:所有未被匹配或标注的片段视为负例,得 336,855 个负例,与 2,355 个正例形成约
1:143的极端不平衡。因此对训练集负例执行随机欠采样,设七档:1:1 / 1:10 / 1:25 / 1:50 / 1:75 / 1:100 / 全量。 - Original vs. Edited 双版本(转写噪声的识别设计):机构网站发布的断言经记者润色(订正语法、以方括号补充上下文),与转写原文未必一致。作者据此构造 Edited 版(以记者版断言替换转写版正例)与 Original 版对照,用以隔离转写质量对分类性能的影响。示例:Original “He built three hydroelectric power plants abroad” vs. Edited “He
[Lula, Brazil's former president]built three hydroelectric power plants abroad”。 - 分类器:BERTimbau(encoder-only)与 PTT5(同在 BrWac 上预训练,基于 T5 的 encoder-decoder),均接 softmax 分类头。选用两者的目的正是比较底层 Transformer 架构(编码器 vs. 编码器—解码器)对性能的影响。
- 训练与评估:HuggingFace 实现,Nvidia T4 微调,5 折交叉验证(每折三份训练、一份验证、一份测试),训练 3 个 epoch,以验证集早停选取最佳 epoch。指标在视频层面计算后对五折取平均;因类别不平衡,主指标为宏平均 F1,辅以类别平衡准确率与正类精确率/召回率。
- 时序滑窗实验:按博索纳罗发表断言的月份切分。设两种设定——Walk-Forward(固定 6 个月训练窗、1 个月测试窗,逐月前移)与 Expand(测试窗固定 1 个月,训练窗自 6 个月起逐次扩张)。两者均以训练集最后一个月为验证集,并测试其后一个月。因 2019 年 6 月无断言,该月作测试与 7 月作验证时均产生空值。
- 跨数据集实验:以 BOL4Y 训练、EI22 测试,覆盖多档欠采样比例。
R. Results(结果)
- 全量训练适得其反:BERTimbau 与 PTT5 在全量数据上训练的版本均被所有欠采样版本超越(BERTimbau 全量宏平均 F1 仅 0.56,PTT5 仅 0.54),作者据此将全量版本排除出后续实验,理由是性能差且训练耗时高。结论:在本任务上以全量数据训练既昂贵又可能起反作用。
- Original 版主结果(宏平均 F1 为主指标)
BERTimbau 在相同训练集下的宏平均 F1 持平或优于 PTT5。模型 / 比例 全量 1:1 1:10 1:25 1:50 1:75 1:100 BERTimbau 平衡准确率 0.55 0.82 0.78 0.75 0.68 0.69 0.62 BERTimbau 宏平均 F1 0.56 0.49 0.63 0.67 0.66 0.68 0.63 BERTimbau 正类精确率 0.21 0.09 0.24 0.35 0.38 0.43 0.35 BERTimbau 正类召回率 1.00 0.75 0.94 0.97 0.99 0.99 1.00 PTT5 宏平均 F1 0.54 0.49 0.61 0.64 0.62 0.60 0.58 1:1配置取得最高平衡准确率 0.82,但精确率仅 0.09;最佳整体表现为 BERTimbau1:75,宏平均 F1 = 0.68——即本任务的基线。召回率在各欠采样档位普遍维持 0.94–1.00。 - Edited 版对照(隔离转写噪声):改用记者润色版断言后性能全面提升,平衡准确率最高 0.92(BERTimbau
1:10),宏平均 F1 最高 0.81,正类精确率自 0.21 升至 0.68。这直接量化了以转写文本为输入的难度——转写数据的噪声是当前性能的主要瓶颈之一。PTT5 的最优档位也因此从1:25移至1:75。 - 时序分析:以 Table 3 中宏平均 F1 最佳的 BERT-75 与 T5-25 为基础,月度宏平均 F1 在 0.5 至 0.8 之间波动,最高值出现在 2021 年 4 月(BERTimbau-Expand),即新冠纾困金发放启动的次月。关键观察:所有设定在 2022 年下半年均出现宏平均 F1 下滑,即便是累积了全部历史月份的 Expand 设定亦然——该时段正值大选临近、博索纳罗与卢拉激烈交锋,虚假断言数量在疫情期间上升、2022 年一季度后回落、临近大选又迅速攀升。PTT5 在两种设定间表现更为一致,而 BERTimbau 的 Walk-Forward 与 Expand 结果差异较大。
- 跨数据集泛化(最具实务意义):以 BOL4Y 训练、EI22 测试
两模型在模型 1:1 1:10 1:25 1:50 1:75 1:100 BERTimbau 0.64 0.71 0.62 0.62 0.58 0.61 PTT5 0.64 0.71 0.63 0.57 0.59 0.56 1:10比例下均达宏平均 F1 0.71,高于同数据集内的 0.68,说明模型学到的并非单一说话人的语言习惯,在断言来自不同来源与说话人时仍然有效。 - 发布资源(FAIR 原则):BOL4Y 含 2,355 条核查、约 339K 个片段、538 份转写、430 个原始视频;EI22 含 78 条核查、1,997 个片段、77 份转写与 77 个原始视频。数据集托管于 Zenodo,音视频因存储限制另托管于 HuggingFace(应研究社群请求提供),代码开源于 GitHub;BOL4Y 另发布原始抓取的 HTML 页面与解析后的 csv。
a / D. Discussion & Conclusion(讨论与结论)
- 贡献定位:论文明确将 0.68 定位为该任务的首个基线而非解决方案,指出“自动检测是可行的,但仍有改进空间”。作者认为更重要的贡献是数据资源与方法论本身——所构建的数据集为一个全新且未被探索的问题提供了完全新颖的数据,且该数据构建方法可被社群采用以生成同类资源,缓解该领域标注数据稀缺的问题。
- 对核查实务的意义:定位到片段可显著减少核查人员在视频上耗费的时间,通过指出潜在的核查点来辅助工作,而非要求其通读全片。
- 对平台治理的意义:识别视频内的虚假片段可使平台在假断言出现的确切时刻以叠加层形式提供警示标签与补充上下文——这是一种比整体下架更细粒度、更偏向“提供信息”的干预方式。
- 监管背景:作者明确将工作置于 DSA 等监管进展之下,指出此类法规通过有效的内容审核追求更安全、更负责任的在线环境,凸显了对更稳健的自动审核工具的需求。
- 局限一 · 转写噪声:尽管 Whisper 为高质量转写模型,音频转写仍可能含噪,且高度依赖音质;Whisper 自动执行句子级切分,当时不支持词级切分;部分转写来自 Escriba 这一未公开实现细节的专有服务。Edited 版对照(F1 0.81 vs. 0.68)正是对这一瓶颈的量化。
- 局限二 · 语言与地域单一:数据仅覆盖巴西语境与葡萄牙语。作者主动为代表性辩护:巴西是研究虚假信息的重要场景,且数据覆盖四年间被虚假信息运动大量利用的广泛议题(如博索纳罗定期举行、用于在不同主题上构建叙事的直播)。
- 局限三 · 单模态:当前方法仅使用自音频转出的文本,未利用画面信息。作者将大语言模型与视觉—语言模型的探索列为明确的后续方向,以扩充可用基线集合。
- 方法论启示:欠采样实验的结果具有独立的实践价值——不同欠采样档位也揭示了分类器可如何在真实场景中被实现和使用,因为更大的数据集同时意味着训练所需资源更多。
🧠 IRMaD 思维导图
mindmap
root((视频虚假信息片段定位))
I 引言
视频核查人力跟不上
单日上传七十二万小时
既往只判整段真假
不说何时何句有问题
数字服务法要求透明
R 问题
如何造出带时标数据
现有模型是否做得到
不平衡如何影响性能
转写噪声是否为瓶颈
换说话人能否泛化
M 方法
核查机构 6685 条断言
Whisper 转写切三十秒段
葡语 BERT 取向量
余弦相似度匹配断言
门槛零点七 人工复核
两标注者一致率 99.24
正负例约一比一百四十
七档欠采样对照
原始版与编辑版对照
R 结果
最佳宏平均 F1 零点六八
全量训练反被欠采样击败
平衡集准确率高但精确率低
编辑版提升到零点八一
大选季所有设定下滑
跨数据集达零点七一
a 讨论
定位为基线而非终点
数据与方法可被复用
叠加标签而非整体下架
转写噪声是主要瓶颈
仅用音频未用画面
D 结论
新任务与首批数据集
从判真假走向定位置
下一步引入视觉语言模型
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。