arXiv 预印本 · cs.MA · v3(2026-06-18)· IEEE 期刊排版 · 未经同行评审 · 正文未见代码链接

事件牵引的多智能体模拟器:刻画美国公众对华态度的演变

Chenxu Zhu, Hantao Yao, Wu Liu 等 5 人 · arXiv (cs.MA) · 2026 · DOI: 10.48550/arXiv.2606.06971 · arXiv: 2606.06971
原题:Modeling U.S. Attitudes Toward China via an Event-Steered Multi-Agent Simulator
Open Access 新颖度 0.72

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

美国民众怎么看中国,会随着关税战、芯片禁令、元首会晤这些大事起起落落,这种态度变化关系到两国关系的走向和地缘政治风险。论文开头举了两个例子:二〇二二年芯片出口禁令升级后,中美关系明显变差;二〇二三年两国领导人在伍德赛德峰会会面,紧张气氛随之缓和。

过去想知道民众的态度,主要靠问卷调查专家分析。这两种办法费时费力,很难跟上舆论连续、快速的变化。于是研究者想到用电脑“搭一个社会”:造出很多虚拟的人,让他们互相影响,再看整体态度怎么变。这种做法叫基于主体的建模(英文缩写 ABM)。

老式的 ABM 有个毛病:每个虚拟人只会照着一条简单的数学规则行事,比如“只听和我意见差不多的人说话”。真人可没这么简单。近几年有了大语言模型,虚拟人终于能“读懂”一条新闻,还能说出自己的理由。可作者发现,现有的大模型模拟器大多用一份固定不变的数据固定的交流规则,模拟不出“一件大事发生,舆论马上转向”的情形;还有的模拟器让每个虚拟人各读各的新闻、各打各的分,彼此从不交流,结果每个人都被困在自己的小世界里,也就是常说的“信息茧房”

② 研究问题(要回答什么?)

这篇论文想回答的是,能不能让一群由大模型扮演的虚拟美国人读新闻、互相讨论,从而复现过去五年美国对华态度的真实起伏。

从实验设计看,作者其实把这个大问题拆成了几个小问题。具体如下:

这里要提前说明一点:论文用来判断“模拟得像不像”的标准答案,是清华大学国际关系研究院中国与大国关系数据库里的中美关系分数,而不是美国本土的民意调查。论文说这份数据按月更新,能反映中美关系在对抗与缓和之间的转换。这个选择后面还会再谈。

③ 研究方法(怎么做的?)

可以把这个模拟器想象成一个“虚拟美国小镇”,里面默认住着一百位居民。每位居民都有一张名片:名字、年龄、性别、兴趣、性格和政治立场,作者说这些是参照人口统计分布设定的。每位居民还有一本“日记”,也就是记忆,记着自己过去对中国的看法。

小镇的时钟三个月走一格,从二〇二一年走到二〇二五年,一共二十格。每走一格,会发生三件事:

聊完之后,每位居民给出一个从负十到正十的对华态度分,并更新自己的日记。把全镇的分数汇总,就是这个季度“美国对华态度”的模拟值。到了下一季度,新闻换了,大家关注的东西变了,群也会重新组合。

最后,作者把模拟曲线和清华的中美关系分数曲线放在一起比,用四把“尺子”量差距:平均值偏了多少、高低起伏的幅度差了多少,以及两条曲线的形状像不像(动态时间规整距离和弗雷歇距离,都是越小越好)。参加比赛的对手有八个:五个老式规则型 ABM,三个已有的大模型模拟器。虚拟居民的“大脑”用的是 GPT-4o-mini。

④ 结果(发现了什么?)

在二十个季度的回放测试里,新模拟器在四项贴合度指标上都优于八个对照模型,曲线形状误差大约只有次优模型的三分之一。

① 四项全部第一
平均偏差只有 0.58,次优的 FPS 模拟器是 1.50,老式的 BC 规则模型高达 5.56。衡量曲线形状的动态时间规整距离,新模拟器是 2.44,次优的 FPS 是 7.22,BC 是 22.79。
② 每个零件都有用
把大事件和个人选新闻一起拿掉,平均偏差从 0.58 升到 1.50,形状误差从 2.44 升到 6.18。只拿掉大事件,偏差变成 1.24;只拿掉个人选新闻,偏差 1.10;只拿掉群聊,偏差 0.92。
③ 大事件定方向,新闻补细节
只听大事件、不看新闻也不聊天,偏差是 1.16;只看新闻、不听大事件也不聊天,偏差是 1.45,形状误差 6.77。作者据此认为大事件决定了态度的基本盘,光看零碎新闻容易“迷路”。
④ 人多不一定更准
一百人时效果最好;两百人时偏差升到 1.50,五百人时是 1.33。对手 FPS 在两百人和五百人时偏差飙到 6.01 和 6.32,五百人时形状误差达到 28.51,几乎和历史曲线脱钩。

作者还做了两个补充实验。第一,把全镇居民的初始平均态度分别设成负 7.6、负 3、0、3、7 五档,模拟出的走势大体一致,说明结果不太依赖起点(论文只给了图,没有给具体数字)。第二,追踪两位虚拟居民 Mike 和 Ella,展示他们在芯片出口禁令、伍德赛德峰会等事件前后态度怎样变化,并各自给出理由。

有个细节值得留意:在五个老式规则模型里,表现最好的 RA 模型偏差 1.66,比大模型模拟器 HiSim(1.89)和 SOD(4.10)还要好。可见“用了大模型”本身并不自动带来更准的结果,关键在于怎么喂信息、怎么组织交流。

⑤ 讨论(这些发现说明什么?)

这项研究最有意思的地方,是把“大事件”和“日常新闻”分开处理。打个比方:大事件像一股冷空气南下,决定了整体是变冷还是变暖;日常新闻像每家窗外吹过的小风,让每个人的感受不太一样。实验显示两样都要有,模拟才更像。

它也和传播学的老话题连在一起:人会挑自己感兴趣的信息看(选择性接触),也更爱和关注同一件事的人扎堆讨论。作者把“评论同一条新闻”当作临时结成小圈子的依据,比事先画死一张社交关系网更接近社交媒体上的真实情形。

不过,读这篇论文时有几处要打个问号:

⑥ 结论(最终结论 + 启示)

这项研究说明,把真实大事件和日常新闻持续喂给会互相交流的大模型智能体,能让模拟出的舆论曲线更贴近历史,但它离真正的民意预测工具还有距离。

它的贡献主要有三点:一是整理出一个按季度排好的中美关系数据集,包括 258 件大事和 14,650 篇新闻;二是设计了“大事件全员广播、日常新闻个人自选”的双通道喂信息方式;三是让关注同一条新闻的虚拟人临时组群讨论,模拟意见怎样从小圈子扩散到整体。

对研究国际舆论和计算传播的人来说,这类工具将来也许能做“如果发生某件事,舆论会怎么变”的推演,比如预估一次外交会晤或一轮制裁可能引起的民意波动。但要真正派上用场,至少还要做到三件事:拿美国本土的民调数据来检验;留出一段模拟器没见过的时间做预测测试;公开提示词和代码,让别人能够复现。

作者在伦理声明里也提醒,这种技术可能被拿去操纵舆论,需要透明的监管、明确的授权和清楚的使用边界。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流:国际关系中的公众态度(本文聚焦美国公众对华态度)被视为地缘政治风险评估的关键输入。作者援引《Destined for War?》及“美国媒体消费模式与对华敌意”研究,指出忽视态度变动可能导致误判并抬高冲突风险;而传统的问卷与专家分析资源密集,难以捕捉舆论的快速、连续演化。

方法谱系与文献空白

本研究贡献:(1)构建 CURE 数据集(China–U.S. Relation Evolution),覆盖 2021–2025 年 20 个季度,含 258 个重大事件与 14,650 篇日常新闻;(2)提出双流数据融合引擎 DSDIE,以宏观重大事件把模拟锚定在历史时间线上,以个性化新闻摄入维持认知多样性;(3)提出新闻驱动动态交互模块 NDDI,按共同关注的新闻动态组群,实现自下而上的共识形成。三者合成 ES-MAS(Event-Steered Multi-Agent Simulator)。

与传播学与公共事务议题的连接:本文实质是一个国际舆论的计算传播模拟问题,牵涉媒介事件对舆论的冲击、受众的选择性接触、同质性聚群与信息茧房,以及大众意见如何在外部信息环境中形成(作者引用《The Nature and Origins of Mass Opinion》)。若经更严格验证,可作为公共外交效果推演与涉外政策舆情风险评估的工具原型。

I. Theoretical Framework & Hypotheses(理论框架与假设)

论文没有提出形式化假设,而是以“微观个体认知 → 群内互动 → 宏观态度轨迹”的涌现逻辑组织模型,并用消融与敏感性实验逐一检验各机制。其理论依据主要有三条:一是意见动力学中联结微观互动与宏观现象的传统(Schelling《Micromotives and Macrobehavior》、DeGroot 式共识模型);二是 LLM 能再现政治极化、内群体偏好、认知失调等人类认知现象的证据(文献 22–24),这是用 LLM 替代启发式规则的前提;三是外部信息环境(大众媒体与关键外生事件)塑造认知轨迹的观点。下表把机制、模型组件、理论依据与检验方式对应起来(检验方式由本报告据实验设计归纳)。

机制模型组件理论依据对应检验
宏观事件为态度定调SEIM 重大事件注入外生事件与大众媒体塑造认知轨迹;大众意见形成理论w/o SEIM、Only SEIM
个性化信息摄入维持认知多样性PAIM 个性化自主摄入选择性接触(文献 18)w/o PAIM、Only PAIM
同好聚群、小世界式扩散NDDI 新闻驱动动态组群同质性(Birds of a Feather)、小世界网络(Watts–Strogatz)、社会认同w/o NDDI
现实锚定的持续输入DSDIE(SEIM + PAIM)模拟需与历史时间线同步w/o DSDIE
对初始化不敏感初始态度 Oi,0作者主张好的模拟器应对初始值不敏感五档初始均值敏感性分析
规模稳健、抑制群体极化智能体数 N规模扩大带来复杂交互与极化N ∈ {25, 50, 100, 200, 500},与 FPS 对照

范式定位:ES-MAS 属于 LLM 驱动的 ABM(生成式智能体),离散时间推进,不涉及 SD 或 DES。它不预设固定社交网络,交互拓扑在每一步按“是否对同一新闻做出行为”重新生成,用共同关注近似同质性纽带,用“多个群之间共享成员”近似小世界网络的跨群连接。

M. Materials & Methods(材料与方法)

R. Results(结果)

表 II · 宏观对齐评测(越低越好)

方法类型ΔBiasΔDiversityDTWFréchet
BC规则 ABM5.56441.924822.78636.7223
HK规则 ABM3.93691.785617.36517.5510
LR规则 ABM2.18051.622410.90953.5467
SJ规则 ABM3.08011.313512.84374.7100
RA规则 ABM1.66391.23978.88803.0467
FPSLLM1.49871.19457.21682.0020
HiSimLLM1.89361.04458.90165.0950
SODLLM4.10181.265316.08465.1000
ES-MASLLM0.57670.74232.44031.6150

表 III · 组件消融

设定SEIMPAIMNDDIΔBiasΔDivDTWFréchet
ES-MAS0.57670.74232.44031.6150
w/o DSDIE××1.49840.79996.17642.0650
Only PAIM××1.45291.72476.76763.4300
w/o SEIM×1.23861.37145.22512.8650
Only SEIM××1.16131.40734.90912.6550
w/o PAIM×1.09940.97104.23182.5275
w/o NDDI×0.91771.16423.74782.5000

表 IV · 规模分析

NES-MAS ΔBiasES-MAS ΔDivES-MAS DTWES-MAS FréchetFPS ΔBiasFPS ΔDivFPS DTWFPS Fréchet
250.83881.01343.51581.69001.36501.43096.79852.1800
500.97831.17714.28992.33001.24611.30436.35381.9900
1000.57670.74232.44031.61501.49871.19457.21682.0020
2001.50271.78577.14293.00506.00511.811525.33069.1530
5001.32751.60526.23043.50566.32441.667828.50978.8335

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((美国对华态度模拟))
    I 引言
      态度变化关乎地缘风险
      问卷专家法费时
      规则型ABM缺认知
      LLM模拟器多静态
      只读新闻易成茧房
    R 问题
      能否复现五年曲线
      大事件与新闻谁重要
      群聊能否破茧房
      规模扩大是否稳健
    M 方法
      LLM驱动ABM
      100智能体 季度步长
      258大事 14650新闻
      每步自选24篇新闻
      同新闻动态组群
      清华关系分数作真值
      四项对齐指标
    R 结果
      四指标全面最优
      DTW 2.44 对 7.22
      去双流数据退化大
      仅大事件优于仅新闻
      N等于100时最佳
      500人仍稳 FPS失控
    a 讨论
      真值非美国民调
      未报告重复运行
      样本内无留出期
      预训练知识或泄漏
      茧房缓解未直接测
    D 结论
      事件牵引加群内互动
      可做国际舆论推演
      需民调与留出检验
      警惕舆论操纵滥用

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。