arXiv 预印本 · cs.CL · 2026 · 4,400 次 LLM 智能体网络仿真 · 四骨干跨两大模型家族

信念级联驱动大模型智能体网络中的说服

Haoyi Qiu, Genglin Liu, Pranav Narayanan Venkit 等 7 人 · arXiv preprint (cs.CL) · 2026 · DOI: 10.48550/arXiv.2608.25152 · arXiv: 2608.25152
原题:Belief Cascades Drive Persuasion in LLM Agent Networks
Open Access 新颖度 0.80

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

越来越多的人工智能系统由许多个大模型智能体组成,它们彼此辩论、转发和评论,一个智能体说服另一个智能体的能力因此变得格外重要。

你可以把这种系统想象成一个全是机器人的微博:有的机器人负责出主意,有的负责查资料,有的负责模拟普通网民。它们互相看帖、点赞、转发、评论,最后形成某种「集体看法」。在这个过程中,说服是一种基础能力——它能帮智能体纠正错误、统一认识;但它也是双刃剑,一群被安排好的智能体完全可能把操纵性叙事成规模地放大。

过去关于大模型说服力的研究,大多盯着「大模型能不能说服人类」,比如政治、健康、阴谋论话题。但智能体之间的说服,尤其是放在一张社交网络里的说服,几乎没人系统测过。作者强调,网络不只是「人多一点的聊天室」:它决定了谁能看到哪条说法、谁能把它转出去,也决定了某个智能体立场变化到底来自说服者本人、来自朋友转发,还是来自两派的拉锯。

还有一个测量上的麻烦:大模型对同一个问题的回答很容易被措辞和上下文带偏,只问一次「你同意吗」,可能根本测不准它的真实立场。所以作者主张每一轮都用同一把尺子反复测,看立场怎样随时间移动。这正是计算传播学里「说服—扩散—舆论」这条老问题线,在人工智能体社会里的一次新考试。

② 研究问题(要回答什么?)

这篇论文想弄清楚,当一个带着明确目标的说服者进入由大模型智能体组成的社交网络时,它的观点是如何一层层传开的。

作者把问题拆成三层,分别对应「结果—渠道—机制」三个镜头。具体如下:

打个比方:第一问是看「选举结果」,第二问是查「消息是从哪条线传来的」,第三问是翻「竞选团队的计划书和实际演讲稿」对不对得上。

③ 研究方法(怎么做的?)

作者搭了一个可控的仿真实验场,本质上是一种用大模型驱动每个个体的多智能体仿真(ABM)。

舞台:网络结构取自斯坦福 SNAP 公开的推特「自我网络」数据,只保留谁关注谁的连线,原始用户身份和推文全部丢弃。从不超过 50 个节点的图里挑了 5 张,节点数从 18 到 42,连线从稀疏到非常稠密都有。

角色:每张图里,被关注最多的节点当说服者,其余都是被说服者。有两种玩法:只有一个说服者(单方说服),或再挑一个离它较远的节点当反方说服者(双方对垒)。说服者的立场被钉死,不会动摇。

起点立场:不是人工写人设,而是用一种叫「个性化 PageRank」的网络算法,按每个被说服者在图上离说服者有多近来算——离得近的起点更赞同。

每一轮怎么玩:一共 10 轮。每轮先让说服者发帖或回复,再让所有被说服者看着同一份「冻结快照」各自行动(发帖、评论、转发、引用、点赞、举报、关注、取关或什么都不做,共 9 种动作),然后给每个被说服者做一次7 级态度测验。测验不是看它嘴上选哪项,而是读取模型对 7 个选项的概率,算出 0 到 1 之间的立场分数,这样连「犹豫」也能量出来。每条帖子是谁发的、经谁转到谁眼前,全都记进日志。

规模:55 条公共政策陈述(控枪、移民、气候、医保等 11 类话题各 5 条)× 5 张图 × 4 个大模型 × 2 种玩法 × 2 个随机种子,一共 4,400 次独立仿真。

④ 结果(发现了什么?)

研究发现,说服效果并不只看说服者本人说了什么,网络疏密、有没有对手、话题和模型本身的倾向都会改变结局。

① 网络越密,不一定越好传
最稠密的那张图(连线密度 0.65,其余 0.10 到 0.26)里,单方说服时只有 22% 到 52% 的被说服者立场上升,稀疏图里却有 69% 到 83%;可一旦有了反方,稠密图反而更利于正方,比例变成 49% 到 68%37% 到 55%。同一种网络,在有没有对手时作用正好相反。
② 有了对手,出现大量「拉锯」
以 GPT-4o 为例,单方说服时最大一类是「被成功说服到赞同」(53.4%);双方对垒时,被说服到反对的比例升到 17.1%,起点中立、来回摇摆的「拉锯型」轨迹占到 57.8%,大约是单方说服时的三倍。Gemini-2.5-Pro 的拉锯比例最高,达 69.6%。
③ 直接看到有效,朋友转发也有效
双方对垒时,每多看到一次正方帖子,立场平均往正方挪一点点;每多看到一次反方帖子,就往反方挪一点点——4 个模型方向全都一致。单次很小,但 10 轮累计下来,直接渠道能挪动整个量表的五分之一到三分之一。经由普通智能体转发来的反方内容,在 4 个模型上也都显著把人往反方推,只是力量小了大约一个数量级。
④ 嘴上说的和心里想的对不上
说服者计划要用的说服技巧,只有 72.7% 真正出现在发出去的文字里。被说服者的发言里有 94.0% 会模仿说服者的话术,但明确说「我改变看法了」的极少:彻底反转只占 0.18%,软化 12.4%,变得更坚定 0.11%。

换句话说,如果只看智能体发了什么帖子,会漏掉大量真实发生的立场移动。

⑤ 讨论(这些发现说明什么?)

这些发现说明,在智能体社会里,信息交流从来不是中性的「传话」,而是一条条影响力通道。

第一,二次说服是真实存在的。一个本来没有被安排去说服别人的普通智能体,只要转发、引用了说服者的观点,就能让下游的智能体立场发生可测的移动。这和我们熟悉的舆论场很像:真正把话传到你耳边的,常常不是大V本人,而是你身边转发它的朋友。

第二,一个智能体就足以带动一大片。单方说服的实验显示,一个目标明确的说服者就能让起点各不相同的一大群智能体向它靠拢。所以风险不只来自「一群机器人串通」,一个被操控或有偏的智能体也可能搅动整个群体。

第三,派一个对手出来,未必能把局面拉平。反方加入后,结局更贴近模型本来的倾向,同时出现大量来回摇摆,群体更分裂。这提醒那些靠「让两个智能体辩论」来求稳的系统设计:不能只看最后答案对不对,还得看中间立场晃得有多厉害。

第四,说服经常是不出声的。点赞、转发、选择回复谁,都可能在传递影响;而被说服者嘴上很少承认自己变了。只盯着文字做监测,就像只听演讲不看投票。

当然作者也坦白:起点立场是按网络位置算的,位置和立场天然绑在一起;网络只有 5 张小图、随机种子只有 2 个,也没有拿真人说服数据来校验。

⑥ 结论(最终结论 + 启示)

作者的结论是,要评估多智能体系统里的说服,不能只看最后的答案或说出来的话,而要追踪立场随轮次的变化和信息是谁传给谁的。

立场怎么移动,既不是说服者覆盖了多少人就能解释,也不是说服者写了什么就能解释:网络结构、朋友之间的转发、有没有对手,都会塑造轨迹,而且很多移动是「沉默的」。

对计算传播学来说,这项研究提供了一个很有意思的新实验室:过去研究说服、信息级联和舆论扩散,只能靠观察真人数据或做成本很高的实验;现在可以在可控的智能体网络里,精确记录每一次「谁让谁看到了什么」,把直接说服和同伴传递拆开来量。不过要记住,这里测的是大模型智能体,不是真人,结论能不能搬到人类社会,还需要真人数据来检验。

对设计和监管多智能体系统的人来说,启示很直接:记录暴露来源、测量潜在立场、保存动作日志,三样缺一不可。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。多智能体 LLM 系统在辩论、协同研究、用户模拟与社会仿真中日益依赖智能体间的相互影响。说服能力可以帮助纠错与协调,但具有双重用途,协同智能体可规模化放大操纵性叙事。既有 LLM 说服研究集中于模型生成信息对人类态度的影响(政治、健康、广告、政策、错误信息与阴谋论等情境),LLM 观点测量研究则指出模型「态度」易受提示措辞与瞬时上下文影响;LLM 社会仿真研究已扩展到社交网络、流行病、信任、极化与回音室,但多评估聚合行为或经验真实性。

文献空白。作者指出,智能体对智能体的说服作为一种网络化信念动力学问题尚未被系统测量:网络决定谁看到哪些主张、谁能转发,观测到的立场变化可能来自直接说服、同伴放大或对立叙事竞争;终局结果与群体均值会掩盖个体是真实移动、稳定放大还是暂时越过立场边界;单次诱出态度又不稳定,因此需要在固定探针下逐轮追踪

贡献(原文三点):(1) 将智能体间说服界定为多智能体 LLM 系统中独立的实证问题,并实现为可控仿真测试床;(2) 在跨真实图拓扑、政策陈述、模型家族与单/竞争说服者两种制度的大规模实验中实例化;(3) 得出三组发现——定向说服产生二次级联;竞争情境下结局更贴近话题与模型特定的先验倾向,而非固定的说服者身份或出场顺序;说服不只是影响是否扩散,还在于立场如何移动、谁越过赞成/反对阈值、哪些路径真正改变探针结果。

与计算传播学的连接(本报告解读):该设计把经典的说服效果、信息级联与舆论扩散问题搬进可完整观测的智能体网络——说服者按影响力最大化文献惯例选取最高触达节点(Kempe et al., 2003),双说服者初始立场借鉴竞争信源网络模型(Zhao et al., 2014),信息流区分关注流与算法推送流,55 条陈述均为控枪、移民、气候、医保等公共政策议题。

I. Theoretical Framework & Hypotheses(理论框架与假设)

本文不做理论假设检验,而以三个研究问题组织「结果—渠道—机制」三镜头分析;关键概念操作化如下。

编号研究问题分析镜头 / 概念依托
RQ1网络拓扑、说服设置、话题与 LLM 骨干如何改变被说服者(PE)信念轨迹的方向与形状?结果镜头;信念轨迹分类学(起止区间 × 净方向 × 时间形态);模型无上下文先验作为参照
RQ2直接暴露与同伴中介暴露对下一轮立场变化的单次暴露关联有多大?跨话题、骨干与是否存在竞争说服者是否稳定?渠道镜头;暴露溯源日志;二次说服 / 同伴放大
RQ3说服者(PR)陈述与执行了哪些说服策略?PR 与 PE 的动作选择如何随设置变化?PE 语言标记能否揭示潜在信念移动?机制镜头;Cialdini 六原则(互惠、承诺、社会认同、权威、喜好、稀缺);Argyris 与 Schön 的「信奉理论 vs 使用理论」

核心概念

M. Materials & Methods(材料与方法)

R. Results(结果)

RQ1 · 密度的制度翻转(表 7,up-share %)

设置骨干G3(d=0.65)非 G3(d=0.10–0.26)|Δ|
singlePRGPT-4o22.273.951.7
singlePRGPT-4.136.882.846.0
singlePRGemini-2.5-Flash31.470.238.7
singlePRGemini-2.5-Pro51.768.616.9
dualPRGPT-4o64.448.715.7
dualPRGPT-4.163.854.49.4
dualPRGemini-2.5-Flash48.637.011.6
dualPRGemini-2.5-Pro68.055.212.8

RQ2 · 单次暴露系数(表 1 / 表 8,M0 基线与 M3 全控制)

dualPR 渠道规格GPT-4oGPT-4.1Gemini-2.5-FlashGemini-2.5-Pro
direct (PR1)M0+0.0055+0.0042+0.0025+0.0031
direct (PR1)M3+0.0065+0.0052+0.0029+0.0064
direct (PR2)M0−0.0069−0.0055−0.0037−0.0050
direct (PR2)M3−0.0060−0.0043−0.0028−0.0062
peer (PR1)M0−0.0003+0.0004+0.0005+0.0002
peer (PR2)M0−0.0017−0.0022−0.0004−0.0053
peer (PR2)M3−0.0035−0.0045−0.0012−0.0060

RQ3 · 机制

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((智能体网络说服级联))
    I 引言
      智能体之间互相说服
      说服能力具有两面性
      网络决定谁看到什么
      单次问答测不准立场
    R 问题
      RQ1 立场轨迹怎么变
      RQ2 直接与同伴渠道
      RQ3 策略与行为机制
    M 方法
      大模型驱动的ABM
      SNAP推特自我网络
      五张图18到42节点
      单方说服与双方对垒
      PPR生成初始立场
      共10轮 7级概率探针
      四模型55条政策陈述
      4400次仿真运行
    R 结果
      稠密图单方传播变弱
      有对手时稠密图反助力
      拉锯轨迹占57.8%
      直接暴露符号全稳定
      同伴转发小但可测
      计划原则仅72.7%落地
      立场改变极少明说
    a 讨论
      转发即二次说服
      单个智能体可带动扩散
      引入对手未必中和
      说服常是非言语的
      先验与位置相互纠缠
    D 结论
      追踪信念轨迹
      记录暴露来源
      只看文本会漏判
      需真人数据检验

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。