arXiv 预印本 · cs.CY · 2026-07-21 · ERC NEWSUSE 项目 · 三款浏览器 4.1 万条真实摘要审计 · 数据开放于 Zenodo

AI 浏览器作为新闻摘要器:总体准确,并削弱政治偏向与负面情绪

Yan Xia, Dominik Batorski, Erin Wertz 等 6 人 · arXiv (cs.CY) · 2026 · arXiv: 2607.18931
原题:AI-Powered Browsers Are Broadly Accurate News Summarizers That Reduce Political Bias and Negative Affect
Open Access 新颖度 0.80

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

如今很多人读新闻之前,浏览器里的人工智能已经先帮他们把文章浓缩成了几段摘要。你打开一篇长长的政治报道,点一下侧边栏的“总结此页”,几秒钟后要点就出来了——谷歌 Chrome 里是 Gemini,微软 Edge 里是 Copilot,还有专门的人工智能浏览器 Perplexity Comet。

过去我们说的“信息中介”,比如搜索引擎、新闻聚合、社交媒体推荐算法,主要决定的是你能看到哪些新闻。这一代人工智能多做了一步:它决定新闻以什么样子出现在你面前——它会改写、压缩、重新组织原文。也就是说,新闻在被你读到之前,已经被机器“再编辑”了一遍。

这让人不太放心。大语言模型被反复发现带有各种偏见,做摘要时会编出原文没有的内容,还有研究发现它们能左右人的政治态度。更麻烦的是,摘要功能本来就是为了让你不用读全文,所以就算它说错了,你也几乎没机会发现。此前英国广播公司和欧洲广播联盟的调查发现,聊天机器人回答新闻问题时错误不少;但还没有人系统地查过:浏览器里的摘要功能,会不会让新闻变得更偏激、更愤怒,或者偏向某一个政党?

② 研究问题(要回答什么?)

这项研究想弄清楚,浏览器自带的人工智能在帮我们总结新闻时,到底有没有把事实说错,又有没有悄悄改变新闻的立场、情绪和写法。作者把它拆成四组问题,具体如下:

此外,作者特别关心这些变化是不是一视同仁:三款浏览器之间有没有差别?左派、中间派、右派媒体的文章,受到的“处理”是否一样?在选举、移民、堕胎、俄乌冲突等 19 个不同议题上,结论还成立吗?这背后是一个“算法公平”的问题——如果某个工具专门把一方的观点“磨平”,它就不再是一个中立的传话人了。

③ 研究方法(怎么做的?)

想象你是一个“神秘顾客”,要暗访三家餐厅。你不会去后厨问厨师怎么做菜,而是像普通客人一样点菜、拍照、记录。这篇研究就是这么做的。

第一步,选文章。作者挑了美国 15 家新闻媒体,左、中、右各 5 家:左边有 MSNBC、《纽约时报》、CNN 等,中间有美联社、路透社等,右边有《华尔街日报》、福克斯新闻等。每家随机抽 1000 篇 2024 年 1 月到 2025 年 6 月发表的政治新闻,一共 15000 篇。

第二步,像真人一样让浏览器做摘要。程序自动打开每一篇新闻网页,唤出浏览器自带的助手,用它默认的“总结”功能,再把结果复制保存。每篇文章都开一个全新对话,免得上一篇影响下一篇。9 台虚拟机同时跑,全部走同一个美国网络地址,时间是 2026 年 2 月到 3 月。付费墙新闻用真实订阅账号登录,保证浏览器读到的是全文。

第三步,清理。去掉空白结果、无效回答,还有被验证码挡住却“假装在总结”的情况;只保留三款浏览器给出有效摘要的文章,再删掉太短的和纯视频、播客,最后剩下 13777 篇文章、41331 条摘要

第四步,打分。文章和摘要用同一把尺子量:让大语言模型把摘要拆成一句一句,逐句对照原文判断“有依据/与原文矛盾/查不到”;让大语言模型给左右倾向、政党态度、愤怒和恐惧打分;用专门训练的分类模型判断负面语气和写作质量。为了确认这些“机器评分员”靠得住,研究者请真人抽样打分来对照——比如在 880 句话上,机器和人的判断有 94% 一致。最后用统计检验比较“原文分数”和“摘要分数”,再用回归模型看浏览器、媒体立场、议题各自有什么影响。

④ 结果(发现了什么?)

总体来看,浏览器生成的新闻摘要大多忠于原文,而且比原文更中立、更平和、更清楚,只是读起来没那么吸引人。

① 事实:八成以上靠谱
平均每条摘要里 82.8% 的句子能在原文找到依据,只有 2.5% 与原文矛盾,14.7% 查不到出处。Edge 最准(88.3%),Chrome 最弱(76.6%),Comet 居中(83.4%)。人工细看 880 句后发现,完全凭空编造的只占出错句子的约 5%,折算不到全部句子的 1%;大部分错误是张冠李戴(把甲说的话安到乙头上)或措辞不准。
② 立场:被“磨平”
带左右倾向的文章,约 30.8% 的摘要变得更中立;原本中立的文章,只有 2.6% 被摘要“带偏”。但磨平并不对称:支持共和党的文章有 41.2% 被调得更中立,批评共和党的文章只有 22.6%。Edge 最明显——右倾文章 53% 被中和,左倾文章只有 34%。
③ 情绪:怒气消得最多
表达愤怒的文章,56.1% 的摘要把火气降了下来,原本没有怒气的文章只有 2.3% 被摘要加了怒气;负面语气有 34.8% 被冲淡;恐惧降得最少,21.2% 降低,却也有 11.7% 的无恐惧文章被摘要写出了恐惧感。
④ 写法:更清楚,但更平淡
写得不清楚的文章,80.3% 的摘要变清楚;个人色彩浓的,72.7% 变客观;用了标题党手法的,86.6% 被去掉。唯一变差的是“吸引力”:原本写得很生动的文章,78.0% 的摘要变得没那么抓人。

这些规律在三款浏览器、左中右三类媒体、19 个议题上方向都一致,只是强弱不同。比如,登在“对立阵营”媒体上的文章更容易被中和:右倾文章登在左派媒体上,62% 的摘要变中立,登在中间派媒体上只有 42%。又如移民、以色列与中东、犯罪这类“威胁型”议题,摘要加进恐惧的比例反而略高于减少恐惧的比例,不过差别在统计上并不显著。

⑤ 讨论(这些发现说明什么?)

这说明,人工智能浏览器已经不只是一个“压缩工具”,更像一位自带风格的编辑。它习惯用冷静、客观、信息密集的腔调重写新闻,于是原文里的党派火药味、愤怒和煽情被系统性地冲淡了。

好的一面:已有研究表明,偏激的党派新闻会加剧极化和对另一党的敌意,负面报道会降低人的幸福感,还会让很多人干脆不看新闻。如果摘要能把这些“毒性”调低,也许对公共讨论是好事。而且它比很多人担心的准确得多——之前的调查是让聊天机器人自己去搜、去综合多篇报道来回答问题,而本研究测的是“总结一篇给定的文章”,结果要乐观得多。

让人警惕的一面:记者怎么取角度、强调什么、用什么语气,并不只是“装饰”,它们本身就在告诉读者这件事有多重要、多紧急、有什么政治意味。把这些一律磨平,读者看到的就不再是记者和媒体原本想表达的版本,新闻也可能变得没人爱读。

磨平也不完全公平。作者细读样本后发现,一部分原因出在原文:“支持”某党往往靠选择性地强调好消息,很容易被摘要去掉;“批评”某党往往嵌在实打实的内容里,删不掉。但 Edge 确实有点特别——它给支持共和党的文章写摘要时,更常把开头的“简洁摘要”换成“中立摘要”,这个比例是支持民主党文章的三倍多,说明它可能真有额外的倾向。

还有一点值得注意:摘要偶尔会让恐惧和负面感变强,原因不是编造,而是把原文里起缓冲作用的背景和限定语删掉了,只剩下尖锐的结论。

⑥ 结论(最终结论 + 启示)

这篇论文的结论是,人工智能浏览器已经成了一种新的新闻编辑,它不只是压缩新闻,还在系统性地改造新闻。它总体上说得准,还让新闻更中立、更冷静、更好懂;但也让新闻变得更平淡,并在不同政党、不同浏览器之间留下了不完全对称的痕迹。

对普通读者的启示是:摘要能帮你快速了解一件事,但它给你的已经是“被重新编辑过”的版本;想知道记者真正想强调什么,还得回到原文。

对研究者和管理者的启示是:这些商业系统是黑箱,而且一直在更新,今天测到的结果明天可能就变了,需要长期、反复地审计。作者也坦言,这项研究只看了美国的英文新闻,只测了“内容变了没有”,还没测“读者受了什么影响”。下一步需要做实验,看看人们读了这种“降温版”新闻后,政治态度、对媒体的信任和看新闻的意愿会不会随之改变。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流:信息中介研究长期聚焦搜索引擎、新闻聚合器、社交平台与推荐算法如何决定用户接触到哪些信息(曝光层面的中介)。LLM 嵌入搜索、即时通讯、办公软件与浏览器后出现了新的中介形态:它们在曝光发生之前改写、压缩、重释源材料,构成“通过转换而非仅通过曝光的中介”(mediation through transformation, not merely exposure)。浏览器是在线新闻的首要入口,Chrome、Edge 与 AI 原生浏览器 Perplexity Comet 均允许用户不离开页面即生成新闻摘要;Reuters Institute《数字新闻报告 2025》显示,摘要被新闻用户视为最具吸引力的 AI 功能。

风险来源:三类文献叠加——LLM 的多种偏见(含政治偏见)、生成式摘要的忠实性失败与幻觉、LLM 对政治态度的说服效应;而摘要产品的设计目标正是免除阅读全文,使用户缺乏识别错误的理由与手段。

文献空白:(1) 既有大规模审计(BBC;EBU 与 BBC)主要检视聊天机器人回答新闻问题时的准确性与归属错误,未触及政治、情感与文体维度;(2) 算法系统与 LLM 聊天机器人的政治偏见证据丰富,但 AI 新闻摘要中的政治偏向仅 Savgira 等(CHI 2026 扩展摘要)在聊天机器人上以定制提示词做过;(3) 既有研究在受控环境中探测模型能力,无法捕捉真实部署、面向用户的浏览器内置摘要功能这一更具后果性的形态。

本研究贡献:作者称这是首个对真实浏览器内置 AI 新闻摘要的大规模审计,覆盖 11 项结果变量、15 家媒体、19 个议题、3 个部署环境;在准确性之外同时检视政治偏向、负面情感与新闻写作质量,并检验变换在意识形态谱系上是否对称,由此连接极化、超党派媒体、新闻回避与算法公平四条文献脉络,提升生态效度。

I. Theoretical Framework & Hypotheses(理论框架与假设)

本文为算法审计研究,不设正式假设,围绕四个内容维度与一类异质性组织问题(编号为本报告整理):

编号研究问题对应理论/文献
RQ1浏览器 AI 摘要相对源文章的事实准确性如何?错误类型与来源是什么?摘要忠实性与幻觉(Maynez 等 2020;Ji 等 2023);BBC/EBU 新闻完整性审计
RQ2摘要是否改变意识形态偏向及对民主党、共和党的立场?LLM 政治偏见(Rozado 2024;Buyl 等 2026);党派媒体与极化(Levendusky 2013)
RQ3摘要是否放大或削弱负面性、愤怒与恐惧?极化与党派敌意(Mason 2022;Kalmoe & Mason 2022);新闻回避(Villi 等 2022;Wertz & Wojcieszak 2026)
RQ4摘要是否改变清晰度、吸引力、个人化语气与标题党倾向?LLM 文体特征(Reinhart 等 2025;Muñoz-Ortiz 等 2024)
RQ5上述变换是否因浏览器、媒体立场、议题而异,在左右之间是否对称?算法公平与算法放大(Huszár 等 2022 等);议题所有权(Petrocik 1996;Walgrave 等 2012)

核心概念“编辑中介”(editorial intermediaries):AI 浏览器不仅决定用户看到什么,还决定信息如何被框架化、哪些方面被强调。讨论部分援引 Hanitzsch 等(2011)的新闻文化研究指出,框架、强调、情感基调与评价性语言并非报道的附带属性,而承载关于事件重要性、紧迫性与政治意义的信息,并使记者自身立场更透明;因此“去偏/降温”在规范层面具有两面性。

推断目标明确限定为“采集窗口内各部署的浏览器—模型系统的行为”,而非底层语言模型的孤立属性——这是审计研究而非模型评测的关键区分。

M. Materials & Methods(材料与方法)

构念工具与量表人工验证(编码员间 / 机器对人)
事实准确性GPT-5.5-2026-04-23 两步:拆为去语境化句子 → 逐句判 supported / contradicted / unverifiable;准确率 = supported 句占比拆句:24 条摘要 206 句,99%(204/206)正确;判定:90 条摘要 880 句(30 篇文章,每家 2 篇),双人编码 269 句一致率 87%、Cohen κ=.67;LLM 对人一致 94%、F1=.91
意识形态偏向GPT-5.2,−2(极左)至 2(极右)79%、Krippendorff α=.82 / 80%、F1=.47、O1=.90
对民主党立场GPT-5.2,−1/0/193%、α=.79 / 92%、F1=.87、O1=.93
对共和党立场GPT-5.2,−1/0/186%、α=.77 / 82%、F1=.73、O1=.87
负面性XLM-RoBERTa-Large 分类器(以 Facebook 上 600 余万条新闻帖微调),0/1α=.72 / 85%、F1=.85
愤怒GPT-5.2,0/1/288%、α=.81 / 80%、F1=.53、O1=.74
恐惧GPT-5.2,0/1/283%、α=.71 / 74%、F1=.75、O1=.88
写作质量四维自研 XLM-RoBERTa-Large 分类器:清晰度 0/1;吸引力、个人化语气、标题党 0/1/2。训练集 1,450 篇(1,000 篇双人编码 + 450 篇针对稀有分值的目的抽样)训练编码 α .75–.95(吸引力 ≈.71);模型:清晰度 80%/F1 .79,吸引力 75%/O1 .79,个人化 71%/O1 .83,标题党 86%/O1 .80;本数据复核准确率 95%/89%/90%/99%

R. Results(结果)

政治偏向维度原文类别(n)摘要更中立分浏览器 Edge / Chrome / Comet
意识形态左倾(2,919)28.3%34% / 30% / 21%
意识形态右倾(2,477)33.3%53% / 28% / 19%
对民主党亲民主党(752)34.9%37% / 38% / 30%
对民主党反民主党(2,136)33.3%37% / 33% / 30%
对共和党亲共和党(835)41.2%53% / 40% / 31%
对共和党反共和党(4,203)22.6%24% / 24% / 20%

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((AI浏览器新闻摘要审计))
    I 引言
      中介从曝光转向改写
      浏览器是新闻入口
      摘要让人不读全文
      既有审计只看准确性
      首个真实浏览器审计
    R 问题
      摘要是否准确
      是否改变政治偏向
      是否放大负面情绪
      写作质量如何变化
      跨浏览器媒体议题差异
    M 方法
      三款浏览器真实调用
      15家媒体左中右各5
      41331条浏览器摘要
      大模型与分类器编码
      人工验证一致率94%
      配对检验加混合回归
    R 结果
      句子有据率82.8%
      Edge最准确
      偏向中和率30.8%
      亲共和党更易被中和
      愤怒降低56.1%
      清晰度提升80.3%
      吸引力普遍下降
    a 讨论
      浏览器成为编辑中介
      降温或利于民主讨论
      抹平框架偏离原意
      不对称部分源于原文
      Edge或有额外倾向
    D 结论
      摘要准确且更中立
      需要纵向持续审计
      仅限美国英文新闻
      需测受众效应
      机制仍待识别

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。