🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
越来越多的社交平台把大语言模型放进了普通人发帖的流程里。你在职场社交平台上写好一段话,旁边有个「帮我润色」的按钮;你在视频网站看到一条内容,系统自动给你生成一段摘要;你在广场式的社交平台上看到别人的帖子,点一下「解释这条帖子」,AI 就会补充一段背景。
这些功能看起来只是「帮忙」,它们不生产观点,只是把人写的东西改得更通顺、更好懂。可问题恰恰藏在这里。设想你本来想说「人工智能也许可以用来帮学生个性化学习」,语气是温和的、带点保留的。按下润色键之后,AI 还给你的版本变成了「让我们拥抱人工智能的潜力,彻底革新每一个学生的学习方式!」——意思好像没变,语气却从「也许可以」变成了「必须支持」。你觉得这个版本更好看,就直接发了出去。
一个人这样,无伤大雅。可如果同一个模型,每天在几百万人身上做同样方向的微调呢?这篇论文关心的,就是这种看不见的、批量的、方向一致的语气偏移,会不会顺着社交网络一层层传下去,最后把整个群体的看法挪动一个位置。
② 研究问题(要回答什么?)
这项研究想弄清楚一件事,就是当人工智能替我们润色文字时,整个群体的看法会不会被悄悄带偏。围绕这个核心,作者拆出了四个更具体的小问题。
- 问题一:如果明确要求 AI「保持原意」,它到底能不能做到?还是说它总会往某个方向轻轻推一把?
- 问题二:假如每个人的表达都被推了一点点,这些小小的偏移在社交网络里会互相抵消,还是会累积放大?
- 问题三:这种偏移,究竟是模型自己「有想法」,还是平台的设计选择造成的?
- 问题四:现行的法律管得住这件事吗?
作者的野心在于,他们不满足于「AI 有偏见」这种已经被说了很多遍的结论,而是要追问偏见进入人际沟通之后的集体后果。
③ 研究方法(怎么做的?)
作者用了三种完全不同的办法来回答上面的问题,像是从三个方向朝同一个靶子开枪。
第一步,做实验测量偏移。他们找来四个可以自由下载的大模型,让它们做两件普通用户天天在做的事:一是根据一段论据写成社交帖,二是把用户自己写的帖子润色一遍。题材是十三个有争议的话题,比如堕胎、枪支管制、死刑、核能、气候变化、女权主义。关键在于,作者在系统提示里明确写了「请保持原文的立场和语气」。然后他们训练了一套打分器,把每段文字的立场换算成零到一之间的一个数,零是完全反对,一是完全支持。原文打一个分,AI 改完再打一个分,两个分数一减,就是这次润色带来的偏移。
第二步,把偏移放进网络里跑。光知道一次润色偏了多少还不够,得看它在人群里怎么发酵。作者借用了传播学里一个经典的意见演化模型,这个模型认为每个人的观点是「自己原本的想法」和「看到的邻居的想法」的加权平均。作者做的改动很巧妙:他在每个人和邻居之间插了一层 AI——你看到的不再是邻居真实的想法,而是被 AI 润色过的版本。他们形容这就像社交圈里多了一个看不见的邻居,这个邻居永远持有同一个立场,而且对每个人都说话。
然后他们把这个模型放到真实的社交网络数据上跑,用的是一个大约八万人、一百七十万条关注关系的推特子网络。AI 的改写方式不是随便假设的,而是直接从第一步的真实实验数据里估出来的。他们还设了一个「使用率」参数,模拟只有一部分人会用润色功能的现实情况。
第三步,去真实平台上抓现行。作者审计了某个社交平台上真实存在的「解释这条帖子」功能,用的是平台官方公开的提示词模板,一字不改。他们挑了立场相反但数量相等的两组帖子,让 AI 各解释五遍,攒下一千多条解释语句,再请另一个更强的模型来给每句话判立场。
④ 结果(发现了什么?)
研究发现,人工智能确实会给文字加上方向性的偏移,而且这种偏移会在社交网络里被放大。三步实验各自给出了很清楚的证据。
即便系统提示里写明「保持原意」,被测的模型仍在几乎所有话题上留下了统计上显著的方向性偏移。有意思的是,方向并不总是「更进步」:在无神论这个话题上,模型反而系统性地往反对的方向推。
这是全文最关键的一个数字。在真实网络上模拟的结果显示,群体平均意见的最终移动幅度,最高可以达到 AI 对单个人一次性偏移的九倍多。也就是说,AI 每次只推一小步,但网络会把这一小步反复传递、层层累加。
放大效应在两种情况下最强:一是人们本来就不太固执、容易被别人影响;二是群体内部意见几乎势均力敌,而 AI 恰好站在人数较少的那一边——这时 AI 足以把摇摆的多数拉过去。
真实平台的审计结果更具体。面对立场 A 的帖子,AI 生成的解释里约三成半支持原帖,一成反对,多数保持中立;但面对立场 B 的帖子,支持原帖的解释占了多数,反对的只剩百分之四。作者用统计模型把这种不对称量化出来,得到的「附和偏差」约为零点二四,「反驳偏差」约为零点零四,两者都统计显著。
最耐人寻味的发现是:这个偏差有个明确的责任人。平台的提示词模板里写了四条指导原则,作者一条条地拿掉再放回去,发现其中某一条特定的指导语——要求模型「提供真实的洞见,挑战主流叙事」——是罪魁祸首。加上它,偏差显著;去掉它,两个偏差双双变得不再显著。
⑤ 讨论(这些发现说明什么?)
这个发现的分量,在于它把「AI 有偏见」这个老问题挪到了一个新的位置上。
过去我们担心 AI,主要担心两件事:它自己胡说八道,或者它直接对着你劝说。这两件事都比较容易察觉——你知道自己在跟机器聊天,你可以选择不信。但这篇论文指出的情况完全不同:你以为你在读另一个人写的东西。中间那层 AI 是隐形的,你既不知道它改过,也不知道它往哪边改了。
更麻烦的是放大效应。如果 AI 只是让每个人的表达偏一点点,直觉上这似乎无伤大雅。但社交网络是一台放大器:你被推偏的表达成为别人眼中的「社会共识」的一部分,别人参考它调整自己的看法,调整后的看法又被 AI 润色一遍再传给下一个人。作者的模型说明,这种循环让最终的集体偏移远大于任何一次单独的润色。这也是为什么「每次只偏一点点,所以没关系」这个说法站不住脚。
而那个「某一条指导语说了算」的发现,有着双面的含义。坏的一面是,平台只需要在提示词里改一句话,就能悄悄地把千万人看到的解释推向某个方向,而外界几乎无从察觉。好的一面是,既然偏差可以被单条设计追溯,那它原则上也就可以被审计、被问责、被修正。这为监管提供了一个具体的抓手。
作者还专门用一整节讨论了法律。他们逐条检查了欧盟的人工智能法案和数字服务法案,结论相当悲观:润色文本导致的观点偏移,很可能既不构成「系统性风险」,也不触发高风险系统的义务,甚至不需要标注。换句话说,这件事目前是合法的。
⑥ 结论(最终结论 + 启示)
这项研究说明,人工智能中介的沟通已经成为影响群体意见的一个全新杠杆。它不像虚假信息那样制造假的内容,也不像推荐算法那样决定你看到什么,而是改变你说出口的话和你读到的话之间的那一层转换。
作者的三重证据链条相当完整:实验证明偏移真实存在且方向一致,模型和模拟证明偏移会被网络放大到近九倍,平台审计证明这种偏移可以被一句设计指令所制造,也可以被同一句指令的删除所消除。
对普通人来说,这项研究提示的是一件很朴素的事:按下「帮我润色」之前,值得再读一遍它给你的版本,看看它是不是把你的「也许」改成了「一定」。对平台和监管者来说,它提出的要求更硬——中介型 AI 的提示词设计,应当被当作一项会影响公共讨论的公共事务来对待,而不只是产品团队的内部选择。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
生成式 AI 已被大规模嵌入主流社交平台的表达与理解环节:职业社交平台提供帖子改写、视频平台生成内容摘要、微博客平台提供帖子情境化解释。这类应用的共同特征是 AI 不生产独立内容,而是对人类生成内容进行转换或增补,从而在人际沟通链路上占据了一个中介位置。
既有文献已在两个方向上有所积累:其一是 LLM 在被直接询问立场时表达的观点偏见,以及在摘要多元观点时的间接偏见;其二是 LLM 通过定向信息与对话交互对个体产生的说服效应,包括在辅助写作中无意识改变个体表达立场的证据。然而,从个体效应到集体意见形成的跨层次跃迁尚未被系统研究。
本研究的贡献在于填补这一空白,并给出四项递进成果:(1) 通过对四个开源模型族在十三个争议话题上的受控实验,证明即便在系统提示中显式要求保持原意,LLM 仍引入统计显著的方向性偏差;(2) 提出一个 Friedkin-Johnsen 模型的扩展,将 AI 作为算子嵌入个体表达与感知之间,并解析刻画其收敛性与均衡;(3) 在真实社交网络数据上模拟,证明个体层面偏差经网络放大后可产生远超一次性偏差的集体位移;(4) 对真实平台功能进行审计,将观测到的方向性偏差归因至单条提示词指导语。研究进一步论证现行欧盟法律框架对该风险存在问责空白。
I. Theoretical Framework & Hypotheses(理论框架与假设)
核心理论基础是 Friedkin-Johnsen (FJ) 意见动力学模型,该模型在人类被试实验与真实数据上均获得实证支持。作者的关键扩展是引入 AI 转换算子 f: [0,1] → [0,1],使个体 i 观察到的邻居 j 的意见为 y_j(t) = f(x_j(t)) 而非 x_j(t)。
更新规则为:x_i(t+1) = λ_i·x_i(0) + (1−λ_i)·Σ_j W_ij·f(x_j(t)),向量形式 x(t+1) = Λx(0) + (I−Λ)·W·F(x(t))。其中 λ_i ∈ (0,1) 为固执度,W 为行随机影响矩阵。当 f 为恒等映射时退化为标准 FJ 模型。
| 命题 | 内容 | 理论意义 |
|---|---|---|
| Prop. 3.1 | 线性变换 f(x)=mx+b 下动力学收敛至唯一均衡 x̃ = (I−mC)⁻¹[Λx(0)+(1−m)ν(I−Λ)1],其中 C=(I−Λ)W,收敛率 ρ = m‖I−Λ‖∞ < 1 | 保证模型良定义且几何收敛 |
| Prop. 3.2 | 均衡位移 x̃ − x* = (1−m)(I−mC)⁻¹(I−Λ)[ν·1 − Wx*] | 位移方向由 AI 中性点 ν 与个体所受社会影响之差决定,且依赖于网络结构 W |
| Prop. 3.3 | λ 同质且 W 双随机时,x̄ − x̄* = [(1−λ)/(λ+(1−λ)(1−m))]·B_one-off,放大系数在 m(1−λ) > λ 时大于 1 | 给出偏差被网络放大的充分条件 |
线性形式可重写为 f(x) = mx + (1−m)ν,其中 ν = b/(1−m) 为变换不动点。作者据此提出核心比喻:AI 等价于网络中一个持有恒定意见 ν 的「隐形邻居」,对每个个体施加影响,强度随个体固执度下降而上升。
M. Materials & Methods(材料与方法)
- 模型与任务:四个开源权重模型 —— Llama-3.1-8B-Instruct、Ministral-3-8B-Instruct-2512、gemma-3-12b-it、Qwen3-8B。两项任务:撰写(论据 → 帖子,用 UKP 语料)与润色(帖子 → 帖子,用 SemEval 语料)。
- 语料:UKP Sentential Argument Mining Corpus 覆盖 8 话题(堕胎、克隆、死刑、枪支管制、大麻合法化、最低工资、核能、校服);SemEval-2016 Task 6 覆盖 6 话题(堕胎、无神论、气候变化、女权主义、希拉里·克林顿、唐纳德·特朗普)。
- 生成设置:每任务 3 个用户提示变体,每对 (文本, 提示) 生成 5 条响应,temperature = 1,top-
p= 0.95。系统提示显式要求保持原文的 voice 与 meaning。每话题抽取至多 200 条立场均衡的人类帖子,且仅保留被分类器正确分类者。 - 意见量化:每话题构建 5 个分类器的集成,各自使用不同的预训练文本嵌入模型;通过候选文本嵌入与「支持」「反对」类平均嵌入的相似度给出
[0,1]置信值,最终意见为按各分类器留出集准确率加权的平均值。 - 偏差估计:定义
β_i = y_i − x_i,对每 (话题, 模型) 拟合贝叶斯线性混合效应模型β ~ 1 + original_stance + (1|human_text) + (1|prompt_variant);截距的后验均值即平均偏差,以 95% 可信区间是否含零判定显著性。 - 网络模拟:SNAP 仓库的 Twitter / Facebook / Google Plus 真实子网络;主结果基于 Twitter 网络,约 8 万节点、170 万条边。AI 变换
f(·)由第一步的(x,y)数据经高斯核 Nadaraya–Watson 核回归非参数估计得到。设 AI 采用率φ,仅采用者的意见被变换。固执度λ_i ~ N̄(λ, 0.05)(截断高斯);以概率κ分配正向倾向,初始意见分别抽自N̄(0.75, 0.1)与N̄(0.25, 0.1)。每次模拟 100 时间步,20 个随机种子。 - 平台审计:复现某平台官方公开的提示词模板(含四条指导原则),对 39 条 pro-choice 与 39 条 pro-life 帖子各查询 5 次,共得 1,170 条情境化断言。以 gpt-5.4 作为裁判并提供每类 5 个少样本示例。拟合贝叶斯类别混合效应模型
claim_stance ~ 1 + post_stance + (1|post) + (1|claim_triplet),定义附和偏差β_sup与反驳偏差β_opp。通过逐条剔除指导语的消融识别归因。
R. Results(结果)
- R1 · 方向性偏差普遍存在:gemma-3-12b-it 在所有话题上引入统计显著偏差(可信区间排除零),方向除无神论外均为「支持」。Llama-3.1-8B 与 Ministral-3-8B 呈定性相似模式;Qwen3-8B 总体无偏,仅在女权主义话题上显著但幅度中等。
- R2 · 直接表达的观点与中介偏差仅中度相关:不同模型族的直接表达观点与引入偏差跨话题高度相似,作者归因于训练数据高度重叠。二者呈中度正相关,说明模型自身立场会「渗漏」进中介行为;但无神论构成反例——模型直接表达正面观点,润色时却引入负向偏差。据此作者论证:仅测量 LLM 直接表达观点的基准不足以捕捉其中介偏差。
- R3 · 网络放大效应:长期平均意见的位移与 AI 在该话题上的偏差呈正相关。关键量化结果:位移最高可达一次性偏差
B_one-off的 9.2 倍。位移随用户固执度下降而增强;在群体初始意见近乎均衡、而 AI 偏向少数一方时最强。
| 审计指标 | 后验均值 | 95% CI | 结论 |
|---|---|---|---|
附和偏差 β_sup | 0.24 | [0.09, 0.38] | 显著 |
反驳偏差 β_opp | 0.04 | [0.01, 0.08] | 显著 |
剔除指导语 3 的附和偏差差异 Δ⁽³⁾_sup | 0.20 | [0.11, 0.28] | 显著 |
剔除指导语 3 的反驳偏差差异 Δ⁽³⁾_opp | 0.05 | [0.02, 0.08] | 显著 |
- R4 · 立场分布不对称:对 pro-choice 帖子,35% 的断言支持、10% 反对,多数中立;对 pro-life 帖子,多数断言支持,仅 4% 反对。
- R5 · 单条设计归因:四条指导语效应各异 —— 第 1 条(「仅包含背景与来龙去脉」)提升中立断言比例;第 4 条(「纳入相关科学研究」)效应相反;第 3 条(「提供真实的洞见,挑战主流叙事」)效应高度不对称,显著抬升 pro-life 断言并同时压制 pro-choice 与中立断言。它是唯一使两项偏差都显著上升的指导语;剔除它后,两项偏差均不再统计显著。
a / D. Discussion & Conclusion(讨论与结论)
- 理论意义:本研究将 AI 中介识别为意见动力学中一个此前未被刻画的结构性干预杠杆,与既有文献中「改变关键个体意见」「扰动网络连边」并列。其独特之处在于作用于表达与感知之间的转换环节,而非节点或边本身。
- 跨层次贡献:Prop. 3.3 给出了从个体偏差到集体位移的放大条件
m(1−λ) > λ,将「微小个体效应可忽略」这一直觉证伪。实证上的 9.2 倍放大为该论证提供了量级参照。 - 方法论启示:R2 表明现行以「直接询问立场」为范式的 LLM 观点偏见基准存在系统性盲区——中介情境下的偏差既可能强于也可能反向于直接表达的观点。
- 治理启示:偏差可归因至单条提示词,意味着它同时是风险源与可审计对象。这为提示词模板的透明度与第三方审计提供了直接的政策抓手。
- 法律分析:作者逐条检视欧盟法律后认为存在问责空白。AIA:Art. 53 的通用模型文档义务未明确要求测试或防止观点推移;Art. 55 的系统性风险义务门槛(Art. 3(65))指向违法、虚假或歧视性内容,偏向性输出不太可能达标;Annex III (8)(b) 的高风险情形要求以影响选举为预期目的,本文所研究的功能不满足;Art. 50(4) 的水印义务原则上不覆盖文本,除非用于就公共利益事项告知公众。DSA:Art. 34(1) 的系统性风险定义虽涵盖对公民讨论与选举进程的负面影响,但因果链尚未确立,偏向性输出是否构成系统性风险存疑。作者并指出,即便义务成立,当前地缘政治环境下的执行力亦成问题。
- 局限:(1) 理论分析限于 FJ 模型与线性变换,非线性情形仅有模拟证据,且非线性下动力学未必收敛至均衡(实践中平均意见确实稳定);(2) 缺乏真人被试研究,未直接验证人类在 AI 中介下的意见交换行为;(3) 未与推荐算法、连边干预等其他平台杠杆联合建模。
- 资助:Alexander von Humboldt 基金会「技术与监管」洪堡讲席(授予 Sandra Wachter),由德国联邦教研部经 Hasso Plattner 研究院资助。
🧠 IRMaD 思维导图
mindmap
root((AI中介改变群体意见))
I 引言
平台嵌入润色与解释
AI只转换不生产内容
已知个体说服效应
集体层面尚属空白
R 问题
要求保持原意能否做到
个体偏移会否被放大
偏差是否来自平台设计
现行法律能否管住
M 方法
四个开源模型十三话题
嵌入集成打分零到一
贝叶斯混合效应模型
经典模型插入AI算子
推特八万节点模拟
官方提示词逐条消融
R 结果
几乎所有话题显著偏移
网络放大最高九点二倍
附和偏差零点二四
反驳偏差零点零四
单条指导语是主因
剔除后偏差不再显著
a 讨论
AI是隐形的第三方邻居
直接问立场的基准有盲区
可归因即可审计
放大条件已被刻画
D 结论
中介沟通是新型杠杆
提示词设计属公共事务
欧盟法律存在问责空白
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。