arXiv 预印本 · 2026 · 首个视频虚假信息片段定位任务与数据集 · 数据代码遵循 FAIR 原则全开放

借助音频转写在视频中定位虚假信息片段

Breno Matos, Rennan C. Lima, Savvas Zannettou 等 5 人 · arXiv 预印本 · 马普信息学研究所 / 米纳斯联邦大学 / 代尔夫特理工 / Kunumi · 2026 · arXiv: 2604.21767
原题:Misinformation Span Detection in Videos via Audio Transcripts
Open Access 新颖度 0.76

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

虚假信息现在是个老大难问题,它会加剧政治极化、损害公共卫生。而在所有形式里,视频是最难核查的一种

难在哪里?先看一个数字:YouTube 每天新增的用户上传视频,总时长相当于七十二万小时。事实核查机构不可能靠人力跟上。

但真正棘手的还不是数量,而是结构。一篇文章或者一张图,真假往往是整体判断。可视频不一样——一个五十五分钟的采访,可能整体内容都没问题,只是其中某几个瞬间说了假话。论文里举的例子就是这样:一段五十五分钟的视频,被核查专家标出了十六处虚假陈述。

过去的研究基本都在做一件事:判断这个视频整体是不是含有假信息。作者认为这个做法用处有限。因为它只给你一个标签,不告诉你假话出现在第几分钟,也不告诉你是哪句话有问题。对于核查记者来说,拿到一个“这视频有问题”的结论,还是得从头看到尾。

② 研究问题(要回答什么?)

这篇论文提出并尝试解决一个更精细的新任务,作者把它叫做虚假信息片段定位

打个比方:过去的做法像是告诉你“这本书里有错别字”,而这项研究要做的是直接把错别字圈出来,告诉你在第几页第几行。

论文围绕三个具体问题展开:

③ 研究方法(怎么做的?)

研究团队的整体思路是:把事实核查机构已经做完的人工劳动,自动对齐回视频的时间轴上

数据来自巴西最有声望的核查机构之一 Aos Fatos,它是国际事实核查联盟的成员。团队做了两个数据集:

核心技术流程分四步,最巧妙的是第三步:

第一步 转写与切分。用 OpenAI 的 Whisper 模型把音频转成文字,它会自动切成最长三十秒的片段。

第二步 转成向量。用一个专门为巴西葡萄牙语训练的 BERT 模型(BERTimbau),把每个片段变成 768 维的向量。

第三步 语义匹配。这一步是关键。团队把每一条已知的假陈述也变成向量,然后拿去和视频里所有片段比对相似度,找出最像的那个片段。因为一句话可能横跨好几个片段,所以还会把前后相邻的片段一并取出来。

第四步 人工复核。这里作者做得很扎实。他们设了一个相似度 0.7 的门槛(低于这个值经人工检查基本都对不上),得到 2996 组待标注的配对,然后用标注工具逐条人工确认。两位标注者最终匹配上 2373 条,只在 18 条上有分歧,这些有分歧的直接从数据集里剔除,最终得到 2355 个片段,一致率 99.24%

还有一个必须交代的现实:这个数据极度不平衡——正例只有 2355 个,而没有假话的负例有 336855 个,比例接近一比一百四十。所以团队专门测试了各种欠采样比例(从一比一到一比一百)。

④ 结果(发现了什么?)

研究证明这个任务是可行的,但同时也暴露出它相当有难度。最好的成绩是宏平均 F1 达到 0.68。

任务可行但不轻松
最佳配置(BERTimbau 一比七十五)
宏平均 F1 0.68
数据越多反而越差
用完整数据训练的模型
所有欠采样版本击败。
换个说话人依然管用
在博索纳罗数据上训练,
测选民视频得到 F1 0.71

先看最实用的一个发现:把全部数据一股脑喂进去,效果反而最差。BERTimbau 用完整数据训练时宏平均 F1 只有 0.56,而适度欠采样后能到 0.68。作者的结论很直接——在这个任务上用全量数据训练既费钱又适得其反。这对资源有限的团队是个好消息。

不同配置之间的权衡也很清楚。一比一的平衡训练集能拿到最高的平衡准确率 0.82,但精确率只有 0.09,意味着报警报得太多。随着负例比例提高,精确率稳步上升到 0.43,而召回率始终维持在 0.99 以上。两个模型对比,BERTimbau 整体不输甚至优于 PTT5

第二个发现揭示了转写质量的影响。团队做了一个很聪明的对照:核查记者发布的陈述文字是经过润色的,还会在方括号里补充上下文,比如把“他建了三座海外水电站”改成“他指卢拉建了三座海外水电站”。团队用这个“编辑版”重跑了一遍,成绩明显提升,最好能到 0.81。这个对比干净地说明了:性能的一大瓶颈在于转写文本本身是嘈杂的

第三个发现关乎实际部署。团队做了时序实验——只用过去的数据训练,去预测之后月份的情况。宏平均 F1 在 0.5 到 0.8 之间波动。值得注意的是,2022 年下半年所有配置的成绩都下滑了,即便是那些累积了全部历史数据的模型也不例外。那正是巴西大选临近、博索纳罗和卢拉激烈交锋的时期。这提示:当虚假信息的话题和话术发生转变时,旧模型会跟不上

最后是跨数据集测试,这一条最能说明实用价值。用博索纳罗的数据训练,拿去测完全不同说话人的选民视频,F1 达到 0.71,甚至高于同数据集内的成绩。这说明模型学到的不只是某个人的说话习惯。

⑤ 讨论(这些发现说明什么?)

作者对这项工作的定位很清醒:这是为一个新任务建立起点,而不是宣布问题已经解决。0.68 这个分数被明确称为“基线”,作者反复强调仍有很大改进空间。

研究最实在的贡献其实是那批数据。作者按照 FAIR 原则(可发现、可获取、可互操作、可复用)把资源全部公开:两个数据集的核查条目、对应的音频、转写文本、以及能拿到的原始视频,分别托管在 Zenodo 和 HuggingFace,代码也在 GitHub 上开源。他们还特意指出,这套构建数据的方法本身可以被别的团队复用,去生成其他语言、其他场景的类似资源。

从传播学角度看,这项研究指向了一个很具体的应用场景。作者设想的不是“自动删视频”,而是在假话出现的那个时间点,给观众叠加一个带上下文的提示标签。这比封禁整段视频温和得多,也更符合“提供信息”而非“限制信息”的治理思路。

作者还把这项工作放到了监管背景下。欧盟的数字服务法要求平台移除违规内容,并且对审核过程保持透明。作者认为,这类法规恰恰需要更可靠的自动审核工具支撑——而能精确定位到时间点的检测,正好同时服务于“处置”和“透明度”两个要求

局限作者交代得很坦率,主要有三条。第一,转写噪音:即便 Whisper 质量很高,效果仍高度依赖音质;而且它只能做到句子级切分,不支持词级。部分转写还来自机构的专有服务,实现细节不公开。第二,语言与地域单一:全部数据都是巴西葡萄牙语。作者为此做了辩护,理由是巴西是研究虚假信息的重要场景,且数据覆盖了四年间被大量利用的多种议题。第三,任务本身还有很大提升空间。作者把使用大语言模型和视觉语言模型列为下一步方向——目前的方法只用了音频转出来的文字,完全没有利用画面信息

⑥ 结论(最终结论 + 启示)

这项研究的核心价值可以概括为:它把一个此前不存在的任务定义了出来,并且给这个任务配齐了数据、基线和评测方式

三项主要成果是:定义并首次尝试了视频虚假信息片段定位任务;发布了两个带时间标注的数据集(分别含 2355 条和 78 条已核查的不实陈述);建立了 F1 为 0.68 的基线,并以 0.71 的跨数据集成绩证明了方法在换了说话人之后依然有效。

对做传播和治理研究的人来说,这项工作的启发在于:对付虚假信息的工具,正在从“判断真假”走向“定位位置”。这个转变看起来只是精度提升,实际上改变了干预方式——从事后删除整条内容,变成在恰当的时刻给观众补上恰当的上下文。

作者最后表达的期待也很务实:希望这类工具能减少核查人员在视频上耗费的时间,帮他们快速定位到值得核查的那几个点。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

虚假信息已成为当代社会最具挑战的问题之一,充当攻击民主、政治极化与激进化运动的引擎,并波及气候变化与公共卫生等多个议题。其形态横跨网站、迷因、图像及 WhatsApp、Telegram 等消息平台,媒介涵盖音频、视频、图像与文本。

视频形态尤为棘手:YouTube 单日新增用户生成视频的时长即相当于 720,000 小时,核查机构在缺乏辅助工具的情况下无法跟上传播速度。同时,内容审核对 YouTube、TikTok 等平台日益成为合规问题——欧盟数字服务法(DSA)要求平台移除违反条款的内容并对审核过程提供透明度。

论文识别出的关键研究空白在于:既往工作均在视频层面判断其是否传播虚假信息。作者指出该做法“提供的视角有限且不易解释”,因为它既不说明虚假信息在视频中何时出现,也不说明是哪些断言导致该视频具有虚假性质。这一空白具有直接的实务后果:一个五十五分钟的视频可能仅因其中若干简短片段的虚假陈述而被判定为虚假(论文示例中该视频经专家标出 16 处不实断言)。

据作者所知,本文是首次处理视频中的虚假信息片段定位问题,其任务设定明确类比于 Pavlopoulos 等人的“毒性片段检测(Toxic Spans Detection)”任务。

I. Theoretical Framework & Hypotheses(理论框架与假设)

编号研究问题 / 任务设定判定与对应设计
任务虚假信息片段定位:不仅判断内容是否虚假,更要确定内容中哪些片段造成其虚假性质类比 Toxic Spans Detection;片段级二分类
RQ1该任务此前无标注数据,能否设计流程将既有事实核查成果对齐回视频时间轴?转写 → 嵌入 → 语义匹配 → 人工复核的四步管线;产出 BOL4Y 与 EI22
RQ2以现有预训练语言模型能否在极不平衡的片段池中识别虚假片段?BERTimbau 与 PTT5 微调;宏平均 F1 为主指标(因类别不平衡)
RQ3类别不平衡如何影响性能?训练数据越多是否越好?七档欠采样比例(1:1 至 1:100 及全量)对照
RQ4转写文本的噪声在多大程度上构成性能瓶颈?Original 版 vs. Edited 版对照:后者以记者润色版断言替换转写版断言
RQ5模型能否泛化到不同说话人、不同来源的虚假信息?能否预测未来?跨数据集测试(BOL4Y 训练 → EI22 测试)+ 两种时序滑窗实验

应用价值定位:精确到时间点的定位可使核查者与平台在假断言出现的确切时刻提供必要上下文(如叠加警示标签),这既服务于 DSA 的内容处置要求,也服务于其透明度要求。

M. Materials & Methods(材料与方法)

R. Results(结果)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((视频虚假信息片段定位))
    I 引言
      视频核查人力跟不上
      单日上传七十二万小时
      既往只判整段真假
      不说何时何句有问题
      数字服务法要求透明
    R 问题
      如何造出带时标数据
      现有模型是否做得到
      不平衡如何影响性能
      转写噪声是否为瓶颈
      换说话人能否泛化
    M 方法
      核查机构 6685 条断言
      Whisper 转写切三十秒段
      葡语 BERT 取向量
      余弦相似度匹配断言
      门槛零点七 人工复核
      两标注者一致率 99.24
      正负例约一比一百四十
      七档欠采样对照
      原始版与编辑版对照
    R 结果
      最佳宏平均 F1 零点六八
      全量训练反被欠采样击败
      平衡集准确率高但精确率低
      编辑版提升到零点八一
      大选季所有设定下滑
      跨数据集达零点七一
    a 讨论
      定位为基线而非终点
      数据与方法可被复用
      叠加标签而非整体下架
      转写噪声是主要瓶颈
      仅用音频未用画面
    D 结论
      新任务与首批数据集
      从判真假走向定位置
      下一步引入视觉语言模型

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。