arXiv 预印本 · 2026-05-19 · 立场论文 + 概念验证仿真 · 基于 SPINOS 真实立场轨迹数据初始化 200 名类人智能体

当群体信念变得可编程:大模型智能体带来的新问题与研究议程

Xin He, Junxi Shen, Yuchen Mou 等 7 人 · arXiv (cs.MA / cs.SI) · position paper · 2026 · arXiv: 2605.19915
原题:LLM Agents Make Collective Belief Dynamics Programmable: Challenges and Research Directions
Open Access 新颖度 0.78

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

研究舆论如何变化的模型,有一个用了几十年的默认前提:参与讨论的都是人。

这个前提带来两个重要的约束。第一,人的理性是有限的,注意力也有限,不可能对每个议题都深思熟虑。第二,也是更关键的一点——人很难被大规模地统一调度。要让一千个人在同一个论坛里坚持同一套说辞、连续说上几个月而不走样,成本高到几乎不可行。

正因为如此,舆论一直被当作一个自发涌现的过程来研究:它有规律,但没有人能精确地设计它。

这篇论文的核心判断是:这个前提正在失效。

大模型驱动的智能体已经可以参与在线讨论,写出的内容与人类难以区分,能在长时间里保持一致的说服策略,还能被精确控制数量、发帖时机、立场和话术。于是舆论影响这件事,从一个随机的社会过程,变成了一个可以工程化的问题。作者给它起了个名字:可编程的群体信念控制。

② 研究问题(要回答什么?)

这是一篇立场论文,它的目标不是给出完整解决方案,而是定义并勾勒出一个新的问题空间。作者要回答的问题分成三层。

第一层是可行性:协调一致的智能体,真的能把一群人的信念推向指定方向吗?这需要拿证据说话,而不是靠推演。

第二层是可控性:如果能推动,那么推动的效果由哪些参数决定?需要多少个智能体才够?发帖要多频繁?投放多久才能撤走?用什么口吻更有效?

第三层是防御难度:为什么这件事特别难被发现和抵抗?作者归纳出四条结构性特征来回答,并据此列出未来需要做的研究。

作者也明确划了边界:实验是示例性的,不是穷尽的,目的是确立可行性,而不是优化攻击策略。

③ 研究方法(怎么做的?)

作者搭了一个多轮在线讨论的仿真环境,里面有两类主体。

第一类是类人智能体。它们不是凭空捏造的,而是用一个真实数据集里的用户画像来设定——该数据集包含真实网络讨论中被标注过的立场轨迹,分为支持、反对、无法判断三类。每个画像还带一个叫立场熵的量:熵越高说明这个人历史上立场越多变,也就越容易被说服;熵为零则表示始终如一。

第二类是可编程的智能体,被设定为始终鼓吹一个固定立场,用来实施系统性干预。

为了追踪信念的演化,所有帖子都要被自动打上立场标签。作者先验证了这一步是否可靠:拿真实标注做对照,几个模型的准确率在 0.81 到 0.96 之间,一致性系数全都超过 0.6,其中最好的达到 0.94。

他们还验证了类人智能体是不是真的听话:在指定初始立场这项上,宏平均 F1 达到 0.6820,而基线只有 0.3938;在复现真实立场演化轨迹上,分布差异从 0.2591 降到 0.1652。也就是说,这些智能体既能准确采纳分配给它的立场,演化模式也贴近真人。

主实验设置为:四个议题、50 轮互动、200 个类人智能体加 80 个鼓吹反方立场的智能体,反方指的是与该议题初始多数派相反的立场。

④ 结果(发现了什么?)

第一组结果确认了可行性,但同时揭示出一件更微妙的事:效果在不同议题上相差极大。

议题(初始多数)条件支持无法判断反对
资本主义(支持)仅人类89.48.52.0
加 80 个反方智能体58.8(-30.6)6.0(-2.5)35.2(+33.2)
堕胎(支持)仅人类84.58.07.5
加 80 个反方智能体76.0(-8.5)4.0(-4.0)20.0(+12.5)
女权主义(支持)仅人类79.520.50.0
加 80 个反方智能体75.5(-4.0)24.0(+3.5)0.5(+0.5)
脱欧(反对)仅人类8.081.011.0
加 80 个正方智能体29.5(+21.5)69.5(-11.5)1.0(-10.0)

规律很清晰:共识越弱的议题越容易被整体翻转,共识越强的议题最多只能被稀释成中立。资本主义议题的共识最弱,反对比例暴涨 33.2 个百分点;女权主义议题的共识最强,几乎无法反转,智能体只能把支持者推向中立。

第二组结果给出了几个具体的控制旋钮,其中有两个特别值得记住。

一个是临界规模。5 个或 20 个智能体完全看不出效果;到 40 个时效应才开始出现;80 个和 160 个则带来递增的位移。数量太少不是效果小,而是几乎为零。

另一个是撤离后的残留。作者在第 10、20、30 轮分别撤走全部智能体:第 10 轮撤走只留下约 1 个百分点的残留;第 20 轮撤走保留了部分位移;而第 30 轮撤走的最终轨迹,与一直干预到第 50 轮在统计上没有区别,留下 5.5 个百分点的持久抬升。这意味着存在一个固化阈值,越过之后信念会自我维持。

还有一个数字相当刺眼:在一个 50 人的群体里只放一个反方智能体,若无人看到它,反对比例是 10.4%;曝光度到一半时升到 23.4%;全员可见时升到 42.9%。

⑤ 讨论(这些发现说明什么?)

作者用四条结构性特征来解释为什么这件事特别难防。

第一是难以区分。人类分辨机器生成文本的准确率只有 50% 到 52%,跟扔硬币差不多;自动检测在短文本和被刻意优化过的文本上同样不可靠。更棘手的是:单条消息看上去都很自然,协调影响只在总体分布的位移上才显形。这让基于内容的检测从原理上就失效了。

第二是持久性。人的立场分布会在不多的几轮之后趋于稳定,之后就很难再改变。这带来一个对平台极为不利的时间结构:如果没有在早期发现,智能体完全可以在造成位移之后撤走,不留任何痕迹,而平台会把这个被设计出来的结果误认为自然形成的共识。

第三是语境依赖。同样 80 个智能体、同样的参数,在不同议题上的结果从 +33.2 到 +0.5 不等。这意味着即便是正当的行动者——比如公共卫生机构——也无法预测自己的传播活动会有什么效果,在一个社区管用的策略在另一个社区可能适得其反。

第四是可配置性。这创造了一个归因难题:同样的结果可以由少量高活跃度的智能体产生,也可以由大量中等活跃度的智能体产生,单看观测到的效果无法反推出干预的形态;而每个个体的行为信号都可能落在正常范围之内。

⑥ 结论(最终结论 + 启示)

作者提出的研究议程分为三层,覆盖理论、方法与基础设施。

理论层要为对抗性的信念动力学建立基础。经典的意见动力学模型假设主体同质且受限理性,无法刻画协调一致的智能体干预。作者建议引入博弈论视角:把大模型智能体视为能预判人类反应的先行者,从而推导出稳健的应对策略;也可以用机制设计的思路,让平台设计出即便面对自利的对抗性智能体也能导向良好分布的激励结构。

方法层要解决检测与防御。由于内容级检测注定失败,作者主张转向系统级信号:发帖同步性等时间异常、异常的聚类模式与信息流拓扑、以及总体信念轨迹偏离预期动力学的情况。这里有一条来自仿真的硬约束——干预效果在不多的几轮内就会稳定,因此检测系统必须接近实时运行才来得及。

基础设施层则是要能支撑大规模实验的仿真系统。

关于防御端的干预协议,作者提出三个设计维度:时机(何时启动与终止)、剂量(多少智能体、多长曝光)与适应(如何随实时动态调整)。全文最尖锐的一问留在了最后:当在线讨论的构成在结构上不可知时,它还能保有认知上的权威吗?

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

大语言模型已具备生成类人文本的能力,可作为自主智能体参与在线讨论——社交媒体对话、论坛辩论与评论区,且常常与人类用户难以区分。与人类参与者不同,它们可被大规模部署,并对时机、立场与论辩策略实施精确控制。这在群体信念动力学中引入了一个新条件:部分参与者现在由外部协调、可被算法操控

历史上,信念演化一直被作为受限理性人类之间的涌现过程来研究,系统性的外部控制在实践中不可行。作者主张这一基础假设已不再成立:LLM 智能体生成的内容日益难以区分(indistinguishability),从而实现隐蔽参与;它们在长时段互动中维持一致的策略行为(持久性,persistence);根据会话语境调整回应(语境性,contextuality);并可在数量、时机、立场与说服策略上被精确配置地大规模部署(可配置性,configurability)。四者合起来,把信念影响从随机的社会过程转变为系统的工程问题。作者将其命名为可编程群体信念控制:设计干预以可预测地把总体信念分布推向目标构型的能力。

本文定位为立场论文(position paper),四项贡献为:(1)把可编程群体信念控制形式化为处于意见动力学、多智能体系统与平台治理交叉处的独立研究问题;(2)提供仿真证据证明系统性信念操控可行;(3)识别使检测与防御在根本上困难的四项结构性挑战;(4)勾勒理论、方法与基础设施三层研究方向。

I. Theoretical Framework & Hypotheses(理论框架与假设)

本文并不提出单一理论模型,而是论证一个范式条件的改变,并据此组织问题空间。

结构性属性含义对防御的后果
难以区分LLM 文本在风格、论证结构与修辞上日益接近人类内容级检测失效;协调影响只在总体分布位移上显形
持久性信念经由社会强化演化,趋同后难再改变;AI 触发的位移经同侪互动自我维持干预与结果在时间上解耦;平台易把工程结果误判为有机共识
语境性影响高度依赖议题的初始分布、转移概率与未表态人群规模效果不可预测;在一域校准的检测阈值在另一域可能失灵
可配置性数量、频率、时长、话术、可见度构成高维可编程参数空间归因问题:等价结果可由不同配置产生,个体信号却均在正常范围内

与经典模型的断裂:经典意见动力学假设同质、受限理性的主体,无法刻画协调一致的 AI 干预。作者由此指向三类可用的理论工具:Stackelberg 博弈(把 LLM 智能体视为能预判人类反应的知情先行者,便于推导最坏情况攻击与稳健反制策略)、马尔可夫博弈(刻画序贯干预下的影响累积,并可扩展到信念的部分可观测性)、以及机制设计(平台设计激励结构,使对抗性智能体自利行动时仍导出可欲的信念分布)。

M. Materials & Methods(材料与方法)

R. Results(结果)

1. 总体信念位移(T = 50,200 类人 + 80 AI)

议题(初始主导立场)条件Favor (%)NI (%)Against (%)
Abortion(Favor)仅人类84.58.07.5
+80 反方 AI76.0 (-8.5)4.0 (-4.0)20.0 (+12.5)
Capitalism(Favor)仅人类89.48.52.0
+80 反方 AI58.8 (-30.6)6.0 (-2.5)35.2 (+33.2)
Feminism(Favor)仅人类79.520.50.0
+80 反方 AI75.5 (-4.0)24.0 (+3.5)0.5 (+0.5)
Brexit(Against)仅人类8.081.011.0
+80 正方 AI29.5 (+21.5)69.5 (-11.5)1.0 (-10.0)

2. 控制维度的独立效应

维度发现
智能体数量存在临界规模阈值:5 或 20 个无任何可检测偏离;效应自 40 个开始出现;80 与 160 个产生递增位移。越过临界后,追加智能体转化为可预测的边际收益。作者另以比例表述:低于 1:20 无法撼动,超过 1:5 触发系统性下滑
发帖频率固定 80 个智能体:每步发帖显著抬高 Against 比例;降至每 4 步衰减;每 8 步则轨迹回归基线。说明影响随累积曝光而非单纯的存在而增长。
干预时长t = 10 撤离迅速回归基线(终端效应仅 +1%);t = 20 撤离部分保留;t = 30 撤离所得轨迹与持续干预至 t = 50 在统计上等价,留下 +5.5% 的持久抬升。存在固化阈值,越过后信念自我维持。
说服风格共情框架产生更大的总体位移且分布广泛;道德谴责总体变化较小,却不成比例地影响先验立场坚定者。相同资源投入因论辩策略不同而产生性质不同的结果。
可见度50 人群体中仅部署单个反方 AI:零可见度时收敛至仅人类均衡(Against 10.4%);50% 可见度升至 23.4%;全可见度升至 42.9%,随可见度单调上升。表明平台级放大可使低成本干预达成群体规模的信念位移

3. 支撑“难以区分”的外部证据:人类识别 AI 文本的准确率仅 50% 至 52%,几近随机;自动检测在短文本或经对抗性构造的输出上同样不可靠。

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((可编程的群体信念控制))
    I 引言
      舆论模型默认参与者都是人
      人难以被大规模统一调度
      大模型智能体推翻了这个前提
      影响从随机过程变成工程问题
    R 问题
      协调智能体真能推动信念吗
      推动效果由哪些参数决定
      为何检测与防御格外困难
      目标是定义问题不是优化攻击
    M 方法
      多轮在线讨论的智能体仿真
      用真实立场轨迹画像初始化
      立场熵刻画可被说服程度
      自动标注一致性系数超过0.6
      初始立场F1达0.6820
      轨迹散度由0.2591降到0.1652
      四议题五十轮两百人加八十AI
      扫描数量频率时长话术可见度
    R 结果
      资本主义反方暴涨33.2
      堕胎议题增加12.5
      女权几乎无法反转只能稀释
      共识越弱越容易被整体翻转
      少于四十个智能体几乎零效果
      每八步发帖回归基线
      第三十轮撤走等同持续干预
      单个智能体全曝光可达42.9
      未表态人群对说服最易感
    a 讨论
      人类识别AI文本约五成准确
      单条自然协调只在总量显形
      撤走后平台误认为自然共识
      同样效果可由不同配置产生
    D 结论
      内容级检测注定失效
      须转向系统级信号检测
      检测必须接近实时才来得及
      讨论构成不可知时权威何在

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。