arXiv 预印本 · 实证 + 理论 + 法律三线论证 · 洪堡讲席资助

当人工智能替我们说话:AI 中介的沟通如何悄悄改变群体意见

Stratis Tsirtsis, Manuel Gomez-Rodriguez, Sandra Wachter · arXiv (cs.SI / cs.CY) · 2026 · arXiv: 2605.16245
原题:AI-Mediated Communication Can Steer Collective Opinion
Open Access 新颖度 0.86

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

越来越多的社交平台把大语言模型放进了普通人发帖的流程里。你在职场社交平台上写好一段话,旁边有个「帮我润色」的按钮;你在视频网站看到一条内容,系统自动给你生成一段摘要;你在广场式的社交平台上看到别人的帖子,点一下「解释这条帖子」,AI 就会补充一段背景。

这些功能看起来只是「帮忙」,它们不生产观点,只是把人写的东西改得更通顺、更好懂。可问题恰恰藏在这里。设想你本来想说「人工智能也许可以用来帮学生个性化学习」,语气是温和的、带点保留的。按下润色键之后,AI 还给你的版本变成了「让我们拥抱人工智能的潜力,彻底革新每一个学生的学习方式!」——意思好像没变,语气却从「也许可以」变成了「必须支持」。你觉得这个版本更好看,就直接发了出去。

一个人这样,无伤大雅。可如果同一个模型,每天在几百万人身上做同样方向的微调呢?这篇论文关心的,就是这种看不见的、批量的、方向一致的语气偏移,会不会顺着社交网络一层层传下去,最后把整个群体的看法挪动一个位置。

② 研究问题(要回答什么?)

这项研究想弄清楚一件事,就是当人工智能替我们润色文字时,整个群体的看法会不会被悄悄带偏。围绕这个核心,作者拆出了四个更具体的小问题。

作者的野心在于,他们不满足于「AI 有偏见」这种已经被说了很多遍的结论,而是要追问偏见进入人际沟通之后的集体后果

③ 研究方法(怎么做的?)

作者用了三种完全不同的办法来回答上面的问题,像是从三个方向朝同一个靶子开枪。

第一步,做实验测量偏移。他们找来四个可以自由下载的大模型,让它们做两件普通用户天天在做的事:一是根据一段论据写成社交帖,二是把用户自己写的帖子润色一遍。题材是十三个有争议的话题,比如堕胎、枪支管制、死刑、核能、气候变化、女权主义。关键在于,作者在系统提示里明确写了「请保持原文的立场和语气」。然后他们训练了一套打分器,把每段文字的立场换算成零到一之间的一个数,零是完全反对,一是完全支持。原文打一个分,AI 改完再打一个分,两个分数一减,就是这次润色带来的偏移。

第二步,把偏移放进网络里跑。光知道一次润色偏了多少还不够,得看它在人群里怎么发酵。作者借用了传播学里一个经典的意见演化模型,这个模型认为每个人的观点是「自己原本的想法」和「看到的邻居的想法」的加权平均。作者做的改动很巧妙:他在每个人和邻居之间插了一层 AI——你看到的不再是邻居真实的想法,而是被 AI 润色过的版本。他们形容这就像社交圈里多了一个看不见的邻居,这个邻居永远持有同一个立场,而且对每个人都说话。

然后他们把这个模型放到真实的社交网络数据上跑,用的是一个大约八万人、一百七十万条关注关系的推特子网络。AI 的改写方式不是随便假设的,而是直接从第一步的真实实验数据里估出来的。他们还设了一个「使用率」参数,模拟只有一部分人会用润色功能的现实情况。

第三步,去真实平台上抓现行。作者审计了某个社交平台上真实存在的「解释这条帖子」功能,用的是平台官方公开的提示词模板,一字不改。他们挑了立场相反但数量相等的两组帖子,让 AI 各解释五遍,攒下一千多条解释语句,再请另一个更强的模型来给每句话判立场。

④ 结果(发现了什么?)

研究发现,人工智能确实会给文字加上方向性的偏移,而且这种偏移会在社交网络里被放大。三步实验各自给出了很清楚的证据。

① 明说了也做不到
即便系统提示里写明「保持原意」,被测的模型仍在几乎所有话题上留下了统计上显著的方向性偏移。有意思的是,方向并不总是「更进步」:在无神论这个话题上,模型反而系统性地往反对的方向推。
② 偏移会被网络放大
这是全文最关键的一个数字。在真实网络上模拟的结果显示,群体平均意见的最终移动幅度,最高可以达到 AI 对单个人一次性偏移的九倍多。也就是说,AI 每次只推一小步,但网络会把这一小步反复传递、层层累加。
③ 什么时候最危险
放大效应在两种情况下最强:一是人们本来就不太固执、容易被别人影响;二是群体内部意见几乎势均力敌,而 AI 恰好站在人数较少的那一边——这时 AI 足以把摇摆的多数拉过去。

真实平台的审计结果更具体。面对立场 A 的帖子,AI 生成的解释里约三成半支持原帖,一成反对,多数保持中立;但面对立场 B 的帖子,支持原帖的解释占了多数,反对的只剩百分之四。作者用统计模型把这种不对称量化出来,得到的「附和偏差」约为零点二四,「反驳偏差」约为零点零四,两者都统计显著。

最耐人寻味的发现是:这个偏差有个明确的责任人。平台的提示词模板里写了四条指导原则,作者一条条地拿掉再放回去,发现其中某一条特定的指导语——要求模型「提供真实的洞见,挑战主流叙事」——是罪魁祸首。加上它,偏差显著;去掉它,两个偏差双双变得不再显著

⑤ 讨论(这些发现说明什么?)

这个发现的分量,在于它把「AI 有偏见」这个老问题挪到了一个新的位置上。

过去我们担心 AI,主要担心两件事:它自己胡说八道,或者它直接对着你劝说。这两件事都比较容易察觉——你知道自己在跟机器聊天,你可以选择不信。但这篇论文指出的情况完全不同:你以为你在读另一个人写的东西。中间那层 AI 是隐形的,你既不知道它改过,也不知道它往哪边改了。

更麻烦的是放大效应。如果 AI 只是让每个人的表达偏一点点,直觉上这似乎无伤大雅。但社交网络是一台放大器:你被推偏的表达成为别人眼中的「社会共识」的一部分,别人参考它调整自己的看法,调整后的看法又被 AI 润色一遍再传给下一个人。作者的模型说明,这种循环让最终的集体偏移远大于任何一次单独的润色。这也是为什么「每次只偏一点点,所以没关系」这个说法站不住脚。

而那个「某一条指导语说了算」的发现,有着双面的含义。坏的一面是,平台只需要在提示词里改一句话,就能悄悄地把千万人看到的解释推向某个方向,而外界几乎无从察觉。好的一面是,既然偏差可以被单条设计追溯,那它原则上也就可以被审计、被问责、被修正。这为监管提供了一个具体的抓手。

作者还专门用一整节讨论了法律。他们逐条检查了欧盟的人工智能法案和数字服务法案,结论相当悲观:润色文本导致的观点偏移,很可能既不构成「系统性风险」,也不触发高风险系统的义务,甚至不需要标注。换句话说,这件事目前是合法的。

⑥ 结论(最终结论 + 启示)

这项研究说明,人工智能中介的沟通已经成为影响群体意见的一个全新杠杆。它不像虚假信息那样制造假的内容,也不像推荐算法那样决定你看到什么,而是改变你说出口的话和你读到的话之间的那一层转换

作者的三重证据链条相当完整:实验证明偏移真实存在且方向一致,模型和模拟证明偏移会被网络放大到近九倍,平台审计证明这种偏移可以被一句设计指令所制造,也可以被同一句指令的删除所消除。

对普通人来说,这项研究提示的是一件很朴素的事:按下「帮我润色」之前,值得再读一遍它给你的版本,看看它是不是把你的「也许」改成了「一定」。对平台和监管者来说,它提出的要求更硬——中介型 AI 的提示词设计,应当被当作一项会影响公共讨论的公共事务来对待,而不只是产品团队的内部选择。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

生成式 AI 已被大规模嵌入主流社交平台的表达与理解环节:职业社交平台提供帖子改写、视频平台生成内容摘要、微博客平台提供帖子情境化解释。这类应用的共同特征是 AI 不生产独立内容,而是对人类生成内容进行转换或增补,从而在人际沟通链路上占据了一个中介位置。

既有文献已在两个方向上有所积累:其一是 LLM 在被直接询问立场时表达的观点偏见,以及在摘要多元观点时的间接偏见;其二是 LLM 通过定向信息与对话交互对个体产生的说服效应,包括在辅助写作中无意识改变个体表达立场的证据。然而,从个体效应到集体意见形成的跨层次跃迁尚未被系统研究。

本研究的贡献在于填补这一空白,并给出四项递进成果:(1) 通过对四个开源模型族在十三个争议话题上的受控实验,证明即便在系统提示中显式要求保持原意,LLM 仍引入统计显著的方向性偏差;(2) 提出一个 Friedkin-Johnsen 模型的扩展,将 AI 作为算子嵌入个体表达与感知之间,并解析刻画其收敛性与均衡;(3) 在真实社交网络数据上模拟,证明个体层面偏差经网络放大后可产生远超一次性偏差的集体位移;(4) 对真实平台功能进行审计,将观测到的方向性偏差归因至单条提示词指导语。研究进一步论证现行欧盟法律框架对该风险存在问责空白

I. Theoretical Framework & Hypotheses(理论框架与假设)

核心理论基础是 Friedkin-Johnsen (FJ) 意见动力学模型,该模型在人类被试实验与真实数据上均获得实证支持。作者的关键扩展是引入 AI 转换算子 f: [0,1] → [0,1],使个体 i 观察到的邻居 j 的意见为 y_j(t) = f(x_j(t)) 而非 x_j(t)

更新规则为:x_i(t+1) = λ_i·x_i(0) + (1−λ_i)·Σ_j W_ij·f(x_j(t)),向量形式 x(t+1) = Λx(0) + (I−Λ)·W·F(x(t))。其中 λ_i ∈ (0,1) 为固执度,W 为行随机影响矩阵。当 f 为恒等映射时退化为标准 FJ 模型。

命题内容理论意义
Prop. 3.1线性变换 f(x)=mx+b 下动力学收敛至唯一均衡 x̃ = (I−mC)⁻¹[Λx(0)+(1−m)ν(I−Λ)1],其中 C=(I−Λ)W,收敛率 ρ = m‖I−Λ‖∞ < 1保证模型良定义且几何收敛
Prop. 3.2均衡位移 x̃ − x* = (1−m)(I−mC)⁻¹(I−Λ)[ν·1 − Wx*]位移方向由 AI 中性点 ν 与个体所受社会影响之差决定,且依赖于网络结构 W
Prop. 3.3λ 同质且 W 双随机时,x̄ − x̄* = [(1−λ)/(λ+(1−λ)(1−m))]·B_one-off,放大系数在 m(1−λ) > λ 时大于 1给出偏差被网络放大的充分条件

线性形式可重写为 f(x) = mx + (1−m)ν,其中 ν = b/(1−m) 为变换不动点。作者据此提出核心比喻:AI 等价于网络中一个持有恒定意见 ν「隐形邻居」,对每个个体施加影响,强度随个体固执度下降而上升。

M. Materials & Methods(材料与方法)

R. Results(结果)

审计指标后验均值95% CI结论
附和偏差 β_sup0.24[0.09, 0.38]显著
反驳偏差 β_opp0.04[0.01, 0.08]显著
剔除指导语 3 的附和偏差差异 Δ⁽³⁾_sup0.20[0.11, 0.28]显著
剔除指导语 3 的反驳偏差差异 Δ⁽³⁾_opp0.05[0.02, 0.08]显著

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((AI中介改变群体意见))
    I 引言
      平台嵌入润色与解释
      AI只转换不生产内容
      已知个体说服效应
      集体层面尚属空白
    R 问题
      要求保持原意能否做到
      个体偏移会否被放大
      偏差是否来自平台设计
      现行法律能否管住
    M 方法
      四个开源模型十三话题
      嵌入集成打分零到一
      贝叶斯混合效应模型
      经典模型插入AI算子
      推特八万节点模拟
      官方提示词逐条消融
    R 结果
      几乎所有话题显著偏移
      网络放大最高九点二倍
      附和偏差零点二四
      反驳偏差零点零四
      单条指导语是主因
      剔除后偏差不再显著
    a 讨论
      AI是隐形的第三方邻居
      直接问立场的基准有盲区
      可归因即可审计
      放大条件已被刻画
    D 结论
      中介沟通是新型杠杆
      提示词设计属公共事务
      欧盟法律存在问责空白

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。