🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
如今很多人读新闻之前,浏览器里的人工智能已经先帮他们把文章浓缩成了几段摘要。你打开一篇长长的政治报道,点一下侧边栏的“总结此页”,几秒钟后要点就出来了——谷歌 Chrome 里是 Gemini,微软 Edge 里是 Copilot,还有专门的人工智能浏览器 Perplexity Comet。
过去我们说的“信息中介”,比如搜索引擎、新闻聚合、社交媒体推荐算法,主要决定的是你能看到哪些新闻。这一代人工智能多做了一步:它决定新闻以什么样子出现在你面前——它会改写、压缩、重新组织原文。也就是说,新闻在被你读到之前,已经被机器“再编辑”了一遍。
这让人不太放心。大语言模型被反复发现带有各种偏见,做摘要时会编出原文没有的内容,还有研究发现它们能左右人的政治态度。更麻烦的是,摘要功能本来就是为了让你不用读全文,所以就算它说错了,你也几乎没机会发现。此前英国广播公司和欧洲广播联盟的调查发现,聊天机器人回答新闻问题时错误不少;但还没有人系统地查过:浏览器里的摘要功能,会不会让新闻变得更偏激、更愤怒,或者偏向某一个政党?
② 研究问题(要回答什么?)
这项研究想弄清楚,浏览器自带的人工智能在帮我们总结新闻时,到底有没有把事实说错,又有没有悄悄改变新闻的立场、情绪和写法。作者把它拆成四组问题,具体如下:
- 准不准:摘要里的每一句话,能不能在原文里找到依据?错了的话,是怎么错的?
- 偏不偏:摘要会让新闻的左右倾向变强还是变弱?对民主党、共和党的褒贬态度会不会变?
- 情绪:摘要会放大还是冲淡原文里的负面语气、愤怒和恐惧?
- 写得好不好:摘要是不是更清楚、更少个人色彩、更少标题党?还是变得干巴巴?
此外,作者特别关心这些变化是不是一视同仁:三款浏览器之间有没有差别?左派、中间派、右派媒体的文章,受到的“处理”是否一样?在选举、移民、堕胎、俄乌冲突等 19 个不同议题上,结论还成立吗?这背后是一个“算法公平”的问题——如果某个工具专门把一方的观点“磨平”,它就不再是一个中立的传话人了。
③ 研究方法(怎么做的?)
想象你是一个“神秘顾客”,要暗访三家餐厅。你不会去后厨问厨师怎么做菜,而是像普通客人一样点菜、拍照、记录。这篇研究就是这么做的。
第一步,选文章。作者挑了美国 15 家新闻媒体,左、中、右各 5 家:左边有 MSNBC、《纽约时报》、CNN 等,中间有美联社、路透社等,右边有《华尔街日报》、福克斯新闻等。每家随机抽 1000 篇 2024 年 1 月到 2025 年 6 月发表的政治新闻,一共 15000 篇。
第二步,像真人一样让浏览器做摘要。程序自动打开每一篇新闻网页,唤出浏览器自带的助手,用它默认的“总结”功能,再把结果复制保存。每篇文章都开一个全新对话,免得上一篇影响下一篇。9 台虚拟机同时跑,全部走同一个美国网络地址,时间是 2026 年 2 月到 3 月。付费墙新闻用真实订阅账号登录,保证浏览器读到的是全文。
第三步,清理。去掉空白结果、无效回答,还有被验证码挡住却“假装在总结”的情况;只保留三款浏览器都给出有效摘要的文章,再删掉太短的和纯视频、播客,最后剩下 13777 篇文章、41331 条摘要。
第四步,打分。文章和摘要用同一把尺子量:让大语言模型把摘要拆成一句一句,逐句对照原文判断“有依据/与原文矛盾/查不到”;让大语言模型给左右倾向、政党态度、愤怒和恐惧打分;用专门训练的分类模型判断负面语气和写作质量。为了确认这些“机器评分员”靠得住,研究者请真人抽样打分来对照——比如在 880 句话上,机器和人的判断有 94% 一致。最后用统计检验比较“原文分数”和“摘要分数”,再用回归模型看浏览器、媒体立场、议题各自有什么影响。
④ 结果(发现了什么?)
总体来看,浏览器生成的新闻摘要大多忠于原文,而且比原文更中立、更平和、更清楚,只是读起来没那么吸引人。
平均每条摘要里 82.8% 的句子能在原文找到依据,只有 2.5% 与原文矛盾,14.7% 查不到出处。Edge 最准(88.3%),Chrome 最弱(76.6%),Comet 居中(83.4%)。人工细看 880 句后发现,完全凭空编造的只占出错句子的约 5%,折算不到全部句子的 1%;大部分错误是张冠李戴(把甲说的话安到乙头上)或措辞不准。
带左右倾向的文章,约 30.8% 的摘要变得更中立;原本中立的文章,只有 2.6% 被摘要“带偏”。但磨平并不对称:支持共和党的文章有 41.2% 被调得更中立,批评共和党的文章只有 22.6%。Edge 最明显——右倾文章 53% 被中和,左倾文章只有 34%。
表达愤怒的文章,56.1% 的摘要把火气降了下来,原本没有怒气的文章只有 2.3% 被摘要加了怒气;负面语气有 34.8% 被冲淡;恐惧降得最少,21.2% 降低,却也有 11.7% 的无恐惧文章被摘要写出了恐惧感。
写得不清楚的文章,80.3% 的摘要变清楚;个人色彩浓的,72.7% 变客观;用了标题党手法的,86.6% 被去掉。唯一变差的是“吸引力”:原本写得很生动的文章,78.0% 的摘要变得没那么抓人。
这些规律在三款浏览器、左中右三类媒体、19 个议题上方向都一致,只是强弱不同。比如,登在“对立阵营”媒体上的文章更容易被中和:右倾文章登在左派媒体上,62% 的摘要变中立,登在中间派媒体上只有 42%。又如移民、以色列与中东、犯罪这类“威胁型”议题,摘要加进恐惧的比例反而略高于减少恐惧的比例,不过差别在统计上并不显著。
⑤ 讨论(这些发现说明什么?)
这说明,人工智能浏览器已经不只是一个“压缩工具”,更像一位自带风格的编辑。它习惯用冷静、客观、信息密集的腔调重写新闻,于是原文里的党派火药味、愤怒和煽情被系统性地冲淡了。
好的一面:已有研究表明,偏激的党派新闻会加剧极化和对另一党的敌意,负面报道会降低人的幸福感,还会让很多人干脆不看新闻。如果摘要能把这些“毒性”调低,也许对公共讨论是好事。而且它比很多人担心的准确得多——之前的调查是让聊天机器人自己去搜、去综合多篇报道来回答问题,而本研究测的是“总结一篇给定的文章”,结果要乐观得多。
让人警惕的一面:记者怎么取角度、强调什么、用什么语气,并不只是“装饰”,它们本身就在告诉读者这件事有多重要、多紧急、有什么政治意味。把这些一律磨平,读者看到的就不再是记者和媒体原本想表达的版本,新闻也可能变得没人爱读。
磨平也不完全公平。作者细读样本后发现,一部分原因出在原文:“支持”某党往往靠选择性地强调好消息,很容易被摘要去掉;“批评”某党往往嵌在实打实的内容里,删不掉。但 Edge 确实有点特别——它给支持共和党的文章写摘要时,更常把开头的“简洁摘要”换成“中立摘要”,这个比例是支持民主党文章的三倍多,说明它可能真有额外的倾向。
还有一点值得注意:摘要偶尔会让恐惧和负面感变强,原因不是编造,而是把原文里起缓冲作用的背景和限定语删掉了,只剩下尖锐的结论。
⑥ 结论(最终结论 + 启示)
这篇论文的结论是,人工智能浏览器已经成了一种新的新闻编辑,它不只是压缩新闻,还在系统性地改造新闻。它总体上说得准,还让新闻更中立、更冷静、更好懂;但也让新闻变得更平淡,并在不同政党、不同浏览器之间留下了不完全对称的痕迹。
对普通读者的启示是:摘要能帮你快速了解一件事,但它给你的已经是“被重新编辑过”的版本;想知道记者真正想强调什么,还得回到原文。
对研究者和管理者的启示是:这些商业系统是黑箱,而且一直在更新,今天测到的结果明天可能就变了,需要长期、反复地审计。作者也坦言,这项研究只看了美国的英文新闻,只测了“内容变了没有”,还没测“读者受了什么影响”。下一步需要做实验,看看人们读了这种“降温版”新闻后,政治态度、对媒体的信任和看新闻的意愿会不会随之改变。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流:信息中介研究长期聚焦搜索引擎、新闻聚合器、社交平台与推荐算法如何决定用户接触到哪些信息(曝光层面的中介)。LLM 嵌入搜索、即时通讯、办公软件与浏览器后出现了新的中介形态:它们在曝光发生之前改写、压缩、重释源材料,构成“通过转换而非仅通过曝光的中介”(mediation through transformation, not merely exposure)。浏览器是在线新闻的首要入口,Chrome、Edge 与 AI 原生浏览器 Perplexity Comet 均允许用户不离开页面即生成新闻摘要;Reuters Institute《数字新闻报告 2025》显示,摘要被新闻用户视为最具吸引力的 AI 功能。
风险来源:三类文献叠加——LLM 的多种偏见(含政治偏见)、生成式摘要的忠实性失败与幻觉、LLM 对政治态度的说服效应;而摘要产品的设计目标正是免除阅读全文,使用户缺乏识别错误的理由与手段。
文献空白:(1) 既有大规模审计(BBC;EBU 与 BBC)主要检视聊天机器人回答新闻问题时的准确性与归属错误,未触及政治、情感与文体维度;(2) 算法系统与 LLM 聊天机器人的政治偏见证据丰富,但 AI 新闻摘要中的政治偏向仅 Savgira 等(CHI 2026 扩展摘要)在聊天机器人上以定制提示词做过;(3) 既有研究在受控环境中探测模型能力,无法捕捉真实部署、面向用户的浏览器内置摘要功能这一更具后果性的形态。
本研究贡献:作者称这是首个对真实浏览器内置 AI 新闻摘要的大规模审计,覆盖 11 项结果变量、15 家媒体、19 个议题、3 个部署环境;在准确性之外同时检视政治偏向、负面情感与新闻写作质量,并检验变换在意识形态谱系上是否对称,由此连接极化、超党派媒体、新闻回避与算法公平四条文献脉络,提升生态效度。
I. Theoretical Framework & Hypotheses(理论框架与假设)
本文为算法审计研究,不设正式假设,围绕四个内容维度与一类异质性组织问题(编号为本报告整理):
| 编号 | 研究问题 | 对应理论/文献 |
|---|---|---|
| RQ1 | 浏览器 AI 摘要相对源文章的事实准确性如何?错误类型与来源是什么? | 摘要忠实性与幻觉(Maynez 等 2020;Ji 等 2023);BBC/EBU 新闻完整性审计 |
| RQ2 | 摘要是否改变意识形态偏向及对民主党、共和党的立场? | LLM 政治偏见(Rozado 2024;Buyl 等 2026);党派媒体与极化(Levendusky 2013) |
| RQ3 | 摘要是否放大或削弱负面性、愤怒与恐惧? | 极化与党派敌意(Mason 2022;Kalmoe & Mason 2022);新闻回避(Villi 等 2022;Wertz & Wojcieszak 2026) |
| RQ4 | 摘要是否改变清晰度、吸引力、个人化语气与标题党倾向? | LLM 文体特征(Reinhart 等 2025;Muñoz-Ortiz 等 2024) |
| RQ5 | 上述变换是否因浏览器、媒体立场、议题而异,在左右之间是否对称? | 算法公平与算法放大(Huszár 等 2022 等);议题所有权(Petrocik 1996;Walgrave 等 2012) |
核心概念“编辑中介”(editorial intermediaries):AI 浏览器不仅决定用户看到什么,还决定信息如何被框架化、哪些方面被强调。讨论部分援引 Hanitzsch 等(2011)的新闻文化研究指出,框架、强调、情感基调与评价性语言并非报道的附带属性,而承载关于事件重要性、紧迫性与政治意义的信息,并使记者自身立场更透明;因此“去偏/降温”在规范层面具有两面性。
推断目标明确限定为“采集窗口内各部署的浏览器—模型系统的行为”,而非底层语言模型的孤立属性——这是审计研究而非模型评测的关键区分。
M. Materials & Methods(材料与方法)
- 研究设计:算法审计 + 自动化内容分析;分析单位为文章—摘要对;源文章与摘要以同一工具测量后做配对比较,并以混合效应回归检验异质性。
- 媒体抽样:15 家美国媒体,按 Media Bias/Fact Check 偏向评分以 ±3.5 为界分左/中/右各 5 家。左:MSNBC(−6.4)、The New York Times、CNN、NBC News、The Guardian;中:Associated Press、Reuters、The Hill、Forbes、CBS News;右:Reason、The Free Press、The Wall Street Journal、OANN(7.9)、Fox News(8.0)。Breitbart 与 ZeroHedge 因浏览器系统性拒绝总结而在采集前剔除。
- 语料:2024-01-01 至 2025-06-30 发表;以 ERC-NEWSUSE 政治内容分类器(微调 transformer)按标题筛选政治新闻,每家随机抽 1,000 篇,共 15,000 篇。9 家全文取自 Media Cloud,6 家直接抓取;付费墙媒体使用认证订阅,确保浏览器读取全文而非截断预览。
- 浏览器与采集:Chrome(Gemini)与 Comet 无订阅、使用默认模型;Edge(Copilot)使用机构订阅以获得更高额度。调用默认摘要动作(Comet)或默认摘要提示(Chrome、Edge)。自动化流水线:打开页面 → 唤起内置助手 → 请求摘要 → 复制保存;每篇新开对话防止上下文残留。9 台虚拟机并行、统一经单一美国 IP(跨浏览器与波次固定地理位置);2026 年 2—3 月分波次采集(Edge、Comet 各 3 波,Chrome 2 波),后续波次补采失败项,并记录每波浏览器版本号。
- 三步过滤:删除空结果;以 GPT-5.2-2025-12-11 判别是否为有效文章摘要;对每次摘要截屏,含已知验证码短语者剔除(针对主要见于 Chrome 的“验证码页伪有效摘要”)。各浏览器保留:Edge 14,575、Comet 14,973、Chrome 14,800 篇;三者共同有效 14,365 篇,再删不足 100 词的 185 篇与纯视频/播客 403 篇,得平衡面板 13,777 篇 × 3 = 41,331 条摘要。
| 构念 | 工具与量表 | 人工验证(编码员间 / 机器对人) |
|---|---|---|
| 事实准确性 | GPT-5.5-2026-04-23 两步:拆为去语境化句子 → 逐句判 supported / contradicted / unverifiable;准确率 = supported 句占比 | 拆句:24 条摘要 206 句,99%(204/206)正确;判定:90 条摘要 880 句(30 篇文章,每家 2 篇),双人编码 269 句一致率 87%、Cohen κ=.67;LLM 对人一致 94%、F1=.91 |
| 意识形态偏向 | GPT-5.2,−2(极左)至 2(极右) | 79%、Krippendorff α=.82 / 80%、F1=.47、O1=.90 |
| 对民主党立场 | GPT-5.2,−1/0/1 | 93%、α=.79 / 92%、F1=.87、O1=.93 |
| 对共和党立场 | GPT-5.2,−1/0/1 | 86%、α=.77 / 82%、F1=.73、O1=.87 |
| 负面性 | XLM-RoBERTa-Large 分类器(以 Facebook 上 600 余万条新闻帖微调),0/1 | α=.72 / 85%、F1=.85 |
| 愤怒 | GPT-5.2,0/1/2 | 88%、α=.81 / 80%、F1=.53、O1=.74 |
| 恐惧 | GPT-5.2,0/1/2 | 83%、α=.71 / 74%、F1=.75、O1=.88 |
| 写作质量四维 | 自研 XLM-RoBERTa-Large 分类器:清晰度 0/1;吸引力、个人化语气、标题党 0/1/2。训练集 1,450 篇(1,000 篇双人编码 + 450 篇针对稀有分值的目的抽样) | 训练编码 α .75–.95(吸引力 ≈.71);模型:清晰度 80%/F1 .79,吸引力 75%/O1 .79,个人化 71%/O1 .83,标题党 86%/O1 .80;本数据复核准确率 95%/89%/90%/99% |
- 政治偏向、负面性、情绪与写作质量均在同一批 25 篇文章 + 75 条摘要上验证。标题党在文章中仅约 2%、摘要中不足 0.6%,故其 O1 仅 .50(仅 1 处不一致)。
- O1 分数(作者提出的 F1 序数扩展):以相对绝对误差
RAE(y,ŷ) = |y − ŷ| / |max ΩY − min ΩY|构造序数加权精确率与召回率,取调和平均后宏平均,使误判按与真值的距离计罚。 - 议题:BERTopic(all-MiniLM-L6-v2 嵌入;UMAP n_neighbors=15、n_components=5;HDBSCAN min_cluster_size=20、leaf),得 125 簇,人工归并为 19 个议题(如 Election 1,763 篇、Israel–Mideast 1,234 篇、Abortion 188 篇、Guns 162 篇)。
- 配对检验:序数变量 Wilcoxon 符号秩检验,二元变量 McNemar 检验,同一构念内 Holm 校正。
- 回归(R glmmTMB):准确性用 ordered beta 回归
accuracy ~ browser + outlet_lean + topic + log(article_length) + summary_length + (1|outlet) + (1|article_id);政治偏向用 logit,仅拟合非中立文章的摘要reduced ~ browser × article_lean + outlet_lean + cross_cut + topic + log(article_length) + (1|outlet) + (1|article_id),cross_cut 表示文章立场与所属媒体立场相反;负面情感(reduced)与写作质量(increased)模型去掉交互项与 cross_cut。参照组:Chrome、中间派媒体、Miscellaneous 议题(文章立场参照 Left);文章随机截距嵌套于媒体。
R. Results(结果)
- 准确性:平均 82.8% 句子有据、2.5% 矛盾、14.7% 无法核实。Edge 88.3%/1.8%/9.9%,Comet 83.4%/2.4%/14.3%,Chrome 76.6%/3.3%/20.1%。完全准确的摘要占比 Edge 25.3%、Comet 42.1%、Chrome 12.1%。ordered beta:Edge β=0.441(SE 0.010)、Comet β=0.245(SE 0.010),均 p<.001;媒体立场 Left −0.031、Right −0.010 均不显著;摘要长度 0.160***、文章长度 0.056***;议题 Economy +0.048*,Guns −0.087*、Environment −0.071*、Education −0.062*、World Affairs −0.053*。分立场(左/中/右):Edge 88.5/88.4/88.0,Comet 82.9/83.9/83.3,Chrome 77.2/75.9/76.9,均不显著。议题最高 Courts 85.7%、最低 Guns 80.7%,差距不超过 5 个百分点;媒体均值最高 Reason 87.0%,最低 Fox News 79.0%。
- 错误类型(880 句质性分析):矛盾 19 句(2.2%)、无法核实 144 句(16.4%),与全量 LLM 标注的 2.5%/14.7% 大致吻合。矛盾句:归属错误 57.9%、措辞不准 31.6%、捏造 5.3%、“摘要纠正了原文错误”5.3%。无法核实句:归属错误 27.8%、过度解读 25.7%、措辞不准 14.6%、准确的补充背景 13.2%、页面其他内容 13.2%、捏造 5.6%。90 条摘要中 9 条(10%)至少含一句捏造;约 95% 的不准确属措辞、过度解读或范围外背景,捏造约占全部句子 0.9%。
| 政治偏向维度 | 原文类别(n) | 摘要更中立 | 分浏览器 Edge / Chrome / Comet |
|---|---|---|---|
| 意识形态 | 左倾(2,919) | 28.3% | 34% / 30% / 21% |
| 意识形态 | 右倾(2,477) | 33.3% | 53% / 28% / 19% |
| 对民主党 | 亲民主党(752) | 34.9% | 37% / 38% / 30% |
| 对民主党 | 反民主党(2,136) | 33.3% | 37% / 33% / 30% |
| 对共和党 | 亲共和党(835) | 41.2% | 53% / 40% / 31% |
| 对共和党 | 反共和党(4,203) | 22.6% | 24% / 24% / 20% |
- 整体检验:三项政治偏向在摘要中均显著降低(Wilcoxon/McNemar,Holm 校正后均 p<.001);中立文章 8,381 篇中 94.7% 获中立摘要,中立立场保持率超过 95%;意识形态偏向平均削弱 30.8%、引入 2.6%。
- 不对称:Edge 右倾 vs 左倾 53% vs 34%(p<.001),Chrome 28% vs 30%(p=.37),Comet 19% vs 21%(p=.43);Edge 右倾中和率高于 Chrome、Comet(均 p<.001)。亲/反共和党差异在三款浏览器均 p<.001;反民主党立场比反共和党立场更易被削弱(三款均 p<.001),亲共和党比亲民主党更易被削弱(Edge p<.001)。回归交互 Edge × Right:意识形态 1.601***、对民主党 0.447*、对共和党 0.992***;Comet 主效应三项均为负(−0.825、−0.643、−0.404,均 p<.001)。
- 跨立场效应:cross_cut 系数意识形态 2.188***、对共和党 0.728**。右倾文章登于左派媒体 62% 被中和 vs 中间派媒体 42%;左倾文章登于右派媒体 45% vs 41%;亲共和党文章在左派媒体 50% vs 39%。中立文章更易被推向所属媒体立场:左派媒体 6% 获左倾摘要;右派媒体 9% 获右倾摘要、仅 1% 获左倾摘要。
- 议题:国际议题最易去偏(World Affairs 意识形态 0.634*、对民主党 1.459**、对共和党 1.107**;Russia–Ukraine 意识形态 0.974**;Israel–Mideast 0.577*)。偏移方向与议题所有权吻合:民主党议题摘要左移(中立文章左/右移 Gender & DEI 14%/3%、Abortion 10%/4%);共和党议题右移(左倾/右倾文章被中和 Israel–Mideast 45%/33%、Guns 36%/28%、Religion 30%/26%、Economy 32%/29%);例外 Immigration 左移(10%/2%)。
- 负面情感(均 p<.001):负面性削弱 34.8% / 引入 8.8%(Chrome 37%,Edge 36% p<.05,Comet 31% p<.001);愤怒 56.1% / 2.3%(Edge 73%、Chrome 53%、Comet 42%,差异均 p<.001);恐惧 21.2% / 11.7%(削弱/引入 Edge 27%/6%、Chrome 20%/15%、Comet 17%/14%)。回归 Edge 对愤怒 1.712***、恐惧 1.157***。右派媒体恐惧削弱更多(27% vs 中间派 17%,p<.001)、负面性削弱更少(31% vs 41%,p<.05)。威胁型议题恐惧引入略高于削弱(Immigration 22%/17%、Israel–Mideast 20%/18%、Crime 18%/17%,z 检验不显著),而 Religion 6%/36%、Trump Legal Cases 10%/37%、Election 8%/30%;愤怒削弱率跨议题 51–63%,负面性 25–55%。
- 写作质量(均 p<.001):清晰度提升 80.3%(降低 2.2%)、个人化语气减弱 72.7%(增强 1.7%)、标题党去除 86.6%(增加 0.2%);Comet 83%/76%/89%、Chrome 81%/74%/85%、Edge 76%/64%/85%。吸引力:低吸引力文章 39.9% 提升(Edge/Chrome/Comet 32%/40%/48%),高吸引力文章 78.0% 下降(82%/81%/71%),因高吸引力文章远多于低吸引力(2,305 vs 242)而总体下降。Economy 低清晰度文章仅 52% 获更清晰摘要(Miscellaneous 88%,p<.001)。
- 汇总:各偏向与负面情感指标削弱率 21.2%–56.1%(均值 34.0%),引入率 1.3%–11.7%(均值 3.8%)。
a / D. Discussion & Conclusion(讨论与结论)
- 修正悲观图景:与 BBC、EBU 对聊天机器人“检索并综合多源回答新闻问题”的审计相比,针对单篇文章的浏览器摘要准确度明显更高;约六分之一句子并非完全有据,但多为措辞不准与补充背景,捏造不足全部句子的 1%,矛盾句不足 3% 且多为小错(如单复数混淆导致归属错误)。作者强调单篇摘要是扩散更快、后果可能更大的 AI 新闻消费形态。
- 系统性“降温”:在商业部署环境复现并扩展了 Savgira 等(2026)在受控聊天机器人中“摘要降低意识形态偏向”的发现,并延伸至党派立场与多种负面情感;写作质量改善与吸引力下降被归因于 LLM 普遍的非个人化、信息前置文体。
- 编辑中介的规范两面性:一方面,偏向与党派新闻引发极化与外党敌意,负面报道降低福祉并驱使新闻回避,削弱这些特征或具民主益处、降低认知负担;另一方面,框架、强调与情感基调承载新闻价值与政治意义并使记者立场透明(Hanitzsch 等 2011),系统性抹平使用户读到的版本偏离记者与出版者原意,并可能使新闻对部分读者失去吸引力。
- 算法公平:变换方向在浏览器、媒体立场与议题间高度一致而幅度不对称。对 20 篇文章/60 条摘要的质性分析显示,不对称部分源于原文表达:“亲”立场多靠正面框架、选择性强调与单方引语,易被中和;“反”立场嵌于实质批评,易被保留;反民主党主题常作为亲共和党文章的次要元素(27% 的反民主党文章同时被标为亲共和党,反共和党文章同时亲民主党仅 14%)。但 Edge 摘要开头以“neutral”替换“concise”的比例总体 3.5%,亲共和党文章 6.6%、亲民主党文章仅 1.9%,提示 Edge 可能确有对亲共和党内容施加更强衰减的倾向。
- 负面情感增加的机制:对三款浏览器摘要一致增加恐惧的 70 篇文章与一致增加负面性的 159 篇文章做质性分析,发现增加源于压缩中弱化限定语、凸显批评与冲突、丢弃缓冲语境(个别情形颠倒事件顺序),而非添加或捏造信息——提示“偏斜呈现”风险。
- 局限(作者自述):① 仅三款浏览器与特定采集窗口,专有模型与产品设计持续迭代,需纵向审计;② 仅英文新闻与美国政治语境;③ 只测内容变化、不测受众效应(极化、政治态度、偏见感知、新闻信任与参与),需实验比较读者对摘要与原文的反应;④ 无法识别机制,未来需检验模型架构、系统提示词、安全策略与界面设计的联合作用。
- 局限(本报告补充):政治偏向、情绪与写作质量的人工验证样本仅 25 篇文章/75 条摘要;五级意识形态量表机器对人 F1 仅 .47(误差集中于相邻分值),愤怒 F1 .53;Edge 使用机构订阅而 Chrome、Comet 无订阅,配置并非完全对等;准确性与多数构念由 LLM 标注,存在“以 LLM 评 LLM”的潜在同源偏差。
- 理论与实践意义:把传播学的信息中介研究从“把关/曝光”推进到“转换/再编辑”层面,作者指出结论对民主讨论与 AI 治理具有直接含义,AI 摘要工具将日益影响政治学习、意见形成与新闻信任。
- 资助与数据:ERC Consolidator 101126218(NEWSUSE,PI Magdalena Wojcieszak);华沙大学社会科学卓越中心 Red Giant 项目;华沙大学 ICM 计算资源 G104-2654。作者声明无利益冲突;数据见 Zenodo(doi:10.5281/zenodo.21457591)。
🧠 IRMaD 思维导图
mindmap
root((AI浏览器新闻摘要审计))
I 引言
中介从曝光转向改写
浏览器是新闻入口
摘要让人不读全文
既有审计只看准确性
首个真实浏览器审计
R 问题
摘要是否准确
是否改变政治偏向
是否放大负面情绪
写作质量如何变化
跨浏览器媒体议题差异
M 方法
三款浏览器真实调用
15家媒体左中右各5
41331条浏览器摘要
大模型与分类器编码
人工验证一致率94%
配对检验加混合回归
R 结果
句子有据率82.8%
Edge最准确
偏向中和率30.8%
亲共和党更易被中和
愤怒降低56.1%
清晰度提升80.3%
吸引力普遍下降
a 讨论
浏览器成为编辑中介
降温或利于民主讨论
抹平框架偏离原意
不对称部分源于原文
Edge或有额外倾向
D 结论
摘要准确且更中立
需要纵向持续审计
仅限美国英文新闻
需测受众效应
机制仍待识别
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。