arXiv 预印本 · econ.GN · 300 个 LLM 家庭智能体 · 密歇根消费者调查标定与验证

关税威胁、宏观经济预期与政策传播策略:基于多智能体系统的实验

Jianhao Lin, Lexuan Sun, Yixin Yan · arXiv preprint · 2026 · DOI: 10.48550/arXiv.2608.30522 · arXiv: 2608.30522
原题:Tariff Threats, Macroeconomic Expectations, and Policy Communication Strategies: Experiments Based on a Multi-Agent System
Open Access 新颖度 0.84

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

关税还没真正开征,一句社交媒体上的威胁就可能先改变千家万户对物价和失业的判断。

你有没有过这种体验:新闻里说某样东西要涨价,你还没看到价签,心里就已经开始盘算要不要提前囤一点?2025 年 4 月 2 日,美国政府宣布了被称为「解放日」的关税方案——统一征收 10% 的基础关税,另对部分国家加征更高税率,力度远超第一任期的零敲碎打。

但这项研究真正盯住的不是税率,而是「话是怎么说出来的」。第二任期里,关税消息越来越多地以社交媒体短帖的形式冒出来,一天一个说法。有统计口径称,2025 年全年特朗普的 Truth Social 账号发帖加转帖共 6168 条,平均每天约 18 条,光是 12 月 1 日一天就发了 168 条。这些帖子往往有条件、带政治指向:2026 年 1 月 12 日威胁对与伊朗做生意的国家立刻加征 25%;五天后又改成对八个欧洲国家「2 月 1 日起 10%、6 月 1 日起 25%」,直到美国能买下格陵兰为止。推荐算法再把这些碎片分发给不同的人,于是同一项政策在不同人脑子里长成了不同的样子。

研究者因此被夹在中间:宏观结构模型算得了总量,却读不懂这些大白话帖子;真人问卷能问出信念,但要反复投放十几种措辞、还要月月追访,又贵又慢,根本追不上一天一变的说法。

② 研究问题(要回答什么?)

这篇论文要回答的是关税威胁怎么措辞才最能推高民众的通胀与失业预期,以及央行事后该怎么解释才能把分歧收拢回来。

说得再具体一点,作者把问题拆成两问:

这里有一个贯穿全文的关键区分:「把平均预期往下压」和「让大家想法趋于一致」是两件不同的事。一条消息完全可能既没怎么动平均值、却把分歧拉得更大;也可能反过来,让所有人整整齐齐地相信一个更糟的未来。作者坚持把这两件事分开测量。

③ 研究方法(怎么做的?)

作者的办法是:造一个 300 户人家的「数字社区」,让它跑 18 个月

这不是随便编 300 个人。他们从密歇根大学消费者调查(Michigan Surveys of Consumers,简称 MSC)2024 年 12 月那一期里做分层随机抽样,抽出 300 位真实受访者。每个人的年龄、性别、婚姻、地区、学历、政治倾向、收入、房产价值,被原封不动写进一个大语言模型智能体的「人设」;而这个人对未来一年物价和失业的真实回答,就成了这个智能体的初始信念。换句话说,每个虚拟家庭都是照着一个真人捏出来的,而且起点用的是真人当时说的数字——作者特意这么做,是因为大模型经过人类反馈训练后,自己报数容易全挤在一个很窄的区间里。

然后这 300 户开始过日子,一个月走一步,一共走 18 步。每个月,每个智能体都要:看一条社交媒体上的帖子 → 结合自己上个月的看法做个权衡 → 回答和真实问卷一模一样的六道题(未来 12 个月通胀点预测、把 100 分概率分到 10 个区间、用几句完整的话解释为什么这么想,失业同理)→ 自己也发一条帖子。它发的帖子,会进入下个月别人能刷到的信息池

刷到什么帖子不是随机的。系统里有个「信息茧房」开关:每个月有一半的人(α = 0.5)走推荐通道——先按语义相似度捞出 10 条候选,再由一个专门的「推荐官」智能体挑出和这个人自己观点最贴近的那条推给他;另一半人则随机刷到别人的帖子。还有一个记忆模块只记最近 3 个月,让新消息不至于被陈年旧事淹没。

第 7 个月,实验开始。300 个完全一样的智能体被复制成 13 份:1 组对照(收到一条真实的、但和经济毫无关系的特朗普帖子——夸儿子的书上了亚马逊第一),另外 12 组各收到一条不同措辞的关税威胁。人设、初始信念、前 6 个月的经历、连随机参数都完全一致,唯一的差别就是那一条消息。这种干净的对照在真人实验里根本做不到——真人不能洗掉记忆再来一次。

最关键的一步是验真。T1 这一组说的正是「解放日」那套 10% 立即生效的方案,而现实中真的有人类数据:MSC 在 2025 年 4 月到 11 月的八期调查。作者把模拟的第 7–14 个月和这八个月对齐,从三个角度比:分布像不像、机器学习能不能把假的和真的分辨出来、以及党派/收入/性别的差距有没有复现。

④ 结果(发现了什么?)

模拟结果显示,一条关税威胁怎么说、什么时候生效、由谁说出口,对家庭预期的影响不亚于税率数字本身。

① 越近越急,越推高预期
立刻生效 > 半年后生效 > 日期说不准。但「日期说不准」这一组的分歧最大——有人当它是空头支票,有人往最坏处想。
② 数字说清楚,反而更齐心
明说 100% 的效应大于明说 10%;但「税率可能很高也可能很低」这种含糊说法,平均效应最小、分歧却最大。说得越具体,大家越容易围着同一个数字想事。
③ 一路加码最狠,反复翻转最废
同样是最后甩出 100%,前面铺了六条从 40% 一路涨到 90% 的帖子(T11),效应最大也最持久;而前面反复「加了又撤、撤了又加」的那组(T10),效应最小——大家干脆不信了。

④ 话越简单,冲击越大。不到十个字把税率、范围、时间说完(T6),平均效应超过标准措辞;满口「依法定授权」「从价关税」「宏观审慎审查」的技术语言(T7),效应最小。但有意思的是,太简和太繁都会把分歧拉大:太简是因为没交代来龙去脉,大家各自脑补;太繁是因为有人看不懂。分组一看更清楚——复杂措辞只压住了低学历智能体的反应,高学历那组几乎没受影响。

⑤ 配个故事,反而降温。无论是「让美国再次伟大、制造业回流」的叙事,还是「关税是外国出口商掏钱」的叙事,都让平均预期涨得更少,但几乎不改变分歧。人工编码显示原因很实在:这两组里,认为「关税会传导到零售价」的解释明显变少,认为「关税没什么影响」的解释变多;而「外国出口商吸收成本」这个说法,在税负叙事组里比其他两组高出一截。

⑥ 同一段话,换个人署名,结果不同。把一模一样的关税帖署上哈里斯的名字(T12),平均效应和分歧都比署特朗普(T1)更大。几乎每个月里,T12 的「意外程度」和「可信度」都高于 T1:民主党人宣布全面关税不合常理,所以更意外;而智能体的解释里更常把哈里斯版本当成「认真的、会落实的」,却会因为特朗普「说了又改」的历史打个折扣。这与 2025 年 4 月皮尤调查的方向一致:48% 的美国成年人表示相比历任总统更不信任特朗普的说法,只有 32% 表示更信任。

⑦ 央行实验:只有一种说法能把预期压下去。在最难对付的 T11 场景之后放出五条美联储消息,通胀和失业预期的排序完全一致:C2(若物价持续走高就收紧)和 C5(容忍适度超调)显著为正C1(重申 2% 目标)和 C3(强调独立性)基本等于零只有 C4(把关税定性为一次性的相对价格扰动)在多数月份显著为负。但是——五条消息全都缩小了分歧。也就是说,央行完全可能成功地让所有人整齐地相信一个更高的通胀。

⑧ 这个数字社区像不像真人?校准后的 Cramér–von Mises 统计量中位数落在 0.18 到 0.33 之间,全都低于 0.451 的临界值;未校准版本则是 0.81 到 1.22,全部超标。四种机器学习分类器区分「模拟人」和「真人」的 AUC 只有 0.50 到 0.70(0.5 就是瞎猜);而未校准版本里,梯度提升模型的 AUC 普遍超过 0.90——一眼就能看出是假的。

⑤ 讨论(这些发现说明什么?)

这篇论文最值得学的,其实不是结论,而是它对自己有多诚实

作者反复强调一件事:只有 T1 这一组有人类数据可对。其余十一种关税场景、五种央行说法,现实中压根没发生过,也就没有真人答案可以核对。所以他们专门造了一张「证据分级表」,把全文的每一个结论按「离验证过的基准有多远」分成四档:T1 是有人类基准的;只改一个特征的 T2–T9 算「谨慎的近邻外推」,只能说方向和排序大概可信;T10、T11、T12 这种多条消息或换署名的,只算「情景探索」;至于 C1–C5 这五条央行消息,因为引入了一个全新的机构,只能当作实验设计的预演,不构成任何政策建议。而且他们明确写道:模拟内部的统计显著性,不能把一个结论往上提一档

更难得的是,他们还主动写出了「什么结果会推翻我们」:如果真人实验发现「日期含糊」既降低平均更新、又降低分歧,那么整个「模糊制造分歧」的机制就错了;如果人们对反复翻转的反应比对一路加码更强烈,那么「可信度耗损」的解释就得改写;如果只讲目标的央行话术和「一次性扰动」的解释一样有效,那么「因果归因才是关键」这个核心主张就被高估了。这是可证伪的假说,不是怎么都能圆的故事

还有两个值得记住的洞见。第一,鹰派/鸽派这个二分法太粗糙了。C2 明明是鹰派,却把预期推高了——因为「持续的上行压力」这几个字先说服了大家「情况确实很糟」,然后才轮到「我们会收紧」起安抚作用。作者管这叫「清晰不等于安抚」:说清楚一个触发条件,同时也让那个坏状态变得更扎眼。第二,叙事会变成一个「状态变量」。一条帖子的字面内容三个月后就滑出记忆窗口了,但它植入的那套因果故事,会通过智能体自己发的帖子在信息网络里继续传播,还会沉淀进它下个月的先验。所以管理预期不只是反复念数字,而是要盯住正在网络里流通的那套因果解释

局限也写得很实在:底座模型一升级,结果可能就变;训练数据里可能本来就含有相关事件;人设里的学历、性别可能激活模型学到的刻板印象;智能体自己生成的帖子会让早期误差滚雪球;系统里没有市场出清、没有预算约束、没有政客的策略性反应、也没有央行承诺的机构成本。作者还特别提到一条治理层面的理由:模拟器最可能漏掉的,恰恰是那些信息渠道特殊、语言不通、或者对机构信任度极低的人群——总体拟合得好,不代表尾部没问题。

⑥ 结论(最终结论 + 启示)

这套系统最大的价值不是替代真人调查,而是在花钱做真人实验之前,先帮研究者把话术筛一遍。

三条带得走的结论:

对政策机构来说,这意味着一种克制的用法:在发布重要措辞之前,先让校准过的智能体读一遍,同时看水平和分歧两条线,再翻翻那些反应特别大或特别对立的解释,就能揪出哪些说法的含义严重依赖听者的先验、期限判断或政治身份。但它无法告诉你公众在验证范围之外会怎么反应,也替代不了法律、制度和福利分析。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。近年美国贸易行动的价格传导、产能转移与福利效应已有大量证据(Amiti 等, 2019; Fajgelbaum 等, 2020; Cavallo 等, 2025),围绕关税预期的调查也记录到预期性涨价、预防性行为与党派化的税负认知(Coibion 等, 2025; Hirs-Garzón 等, 2026)。关税威胁因而既是一项潜在税收,也是一次信息冲击。与此同时,政策传播的节奏已经改变:关税信息大量以社交媒体短帖发布,常带条件性与政治指向,再经推荐系统分发,形成注意力集中、信息环境分层乃至分歧放大(Allcott 等, 2020; Levy, 2021; Santos 等, 2021)。

既往方法的缺口。结构与时间序列模型能约束总量反事实,却难以把非结构化文本映射为家庭层面的概率预测与解释;调查实验能揭示不可观测信念并制造识别变异(Stantcheva, 2023; Haaland 等, 2023),但维持一个含多种文本处理的密集月度面板成本高、重设计慢;社交媒体文本分析只能刻画已观测到的传播,无法生成对反事实消息的回应。语言模型研究已能以人类特征条件化合成受访者(Argyle 等, 2023; Horton 等, 2023),新近工作进一步处理覆盖度、动态与识别(Wu 等, 2025)。

三点贡献。其一,提出一个用调查数据与社交媒体文本标定的生成式经济实验动态框架:持久身份 + 观测到的初始信念 + 内生社交媒体信息 + 多期记忆 + 重复处理对照 + 点预测/概率分布/开放式解释三重联合诱导,并内嵌验证层级,把「观测基准内的对应性」「近邻定性外推」「远距情景探索」三类主张明确分开(Ludwig 等, 2026; Hullman 等, 2026)。其二,为家庭预期形成的经济学补上以消息设计为中心的视角,在同一动态信息环境内同时比较实施时间、税率确定性、序列语义一致性、复杂度、叙事与发送者六个维度,并把分布中心与信念协调作为两个独立结果。其三,提供一个推荐算法已塑造过信息环境之后的央行沟通实验台:消息不仅是鹰/鸽信号,还提供冲击的因果模型、持续性判断与政策反应条件(Kakhbod 等, 2026)。

I. Theoretical Framework & Hypotheses(理论框架与假设)

核心机制是置信度加权的贝叶斯信号提取(Supplementary Appendix B.1)。设先验 θ ~ N(μ₀, τ₀⁻¹),信号 s = θ + ε, ε ~ N(0, τ_s⁻¹),则后验均值为 μ₁ = (1−ω)·μ₀ + ω·s,其中 ω = τ_s / (τ₀ + τ_s)。引入置信度 γ > 0,令感知先验精度 τ̂₀(γ) = γ·τ₀,得主观信号权重 ω̂(γ) = τ_s / (γ·τ₀ + τ_s),且 ∂ω̂/∂γ = −τ₀τ_s/(γτ₀+τ_s)² < 0γ → ∞ 对应过度自信、低估新信息的保守性偏误γ → 0 对应基率忽视与过度更新。系统据此设定五级序数置信度,该推导不作为结构估计方程,仅为智能体指令提供经济学纪律。

六个处理维度构成实验的核心对照结构,每一维只改动对应特征,其余尽自然语言所能保持不变:

维度对照臂操纵内容对应理论
1 实施时间T1, T2, T3立即 / 半年后 / 日期不确定前瞻指引之谜与认知贴现(Del Negro 等, 2023; Gabaix, 2020);显著性与理性疏忽(Bordalo 等, 2012; Sims, 2003)
2 关税税率T2, T4, T510% / 100% / 税率不确定信息刚性与精度加权更新(Coibion & Gorodnichenko, 2015);奈特不确定性(Knight, 1921; Morris & Shin, 2002)
3 语义一致性T4, T10, T11单次 / 高频反转 / 高频递进(终端消息相同)外推型预期(Greenwood & Shleifer, 2014);廉价磋商与承诺缺失(Crawford & Sobel, 1982)
4 语义复杂度T1, T6, T7标准 / 极简(不足十词)/ 法条技术语言可读性与认知处理成本(Bholat 等, 2019; D’Acunto 等, 2019)
5 叙事T1, T8, T9无叙事 / MAGA 回流叙事 / 出口商承担税负叙事叙事经济学与主观因果模型(Shiller, 2017; Andre 等, 2022)
6 发送者T1, T12完全相同文本,署名特朗普 / 哈里斯政治身份与信源依赖更新(Kamdar 等, 2025; Hirs-Garzón 等, 2026)

第二个实验以 T11 为对照臂,检验五种美联储沟通策略(C1 目标重申、C2 情景式条件收紧、C3 机构独立性、C4 穿透看待、C5 容忍适度超调),并把沟通的两个政策目标——预期水平信念协调——分开评估。

M. Materials & Methods(材料与方法)

R. Results(结果)

(一)标定有效性:三条边的验证(Supplementary Appendix C,验证窗口 MAS Month 7–14 对齐 MSC 2025-04 至 2025-11)

(二)人口异质性复现(因变量为点预测,HC3 稳健标准误,控制年龄、年龄平方及地区、性别、婚姻、学历、收入的分类变量;跨样本系数相等性检验 Z_t = (β̂₁ᵗ,S − β̂₁ᵗ,H) / √(SE(β̂₁ᵗ,S)² + SE(β̂₁ᵗ,H)²)

梯度真人(MSC)标定 MAS相等性 p未标定 MAS
民主党身份(共和党执政期)+3.459 ~ +6.508,八个月全部 p < 0.01+4.352 ~ +4.427,全部 p < 0.010.145 ~ 0.913,从未拒绝仅 +0.272 ~ +0.353,方向对但每月都显著低于真人严重欠极化
高收入−0.936 ~ −2.572,仅最后三个月显著−0.993 ~ −1.220,稳定为负0.327 ~ 0.994,从未拒绝−0.065 ~ −0.123,严重衰减,后段显著偏离
性别(女性高于男性)八个月全部显著为正方向与动态持续性均复现集中在约 4.0%–4.4%、区间极窄,性别差衰减、信念同质化

(三)六个维度的 DTE 与信念分歧排序(Table 2;通胀结果见 Figure 3–4,失业结果见 Appendix D Figure D.1–D.2,定性结论一致,仅量级不同)

维度DTE 排序信念分歧排序文本机制证据
1 实施时间T1 > T2 > T3T3 > T1, T2时间紧迫度与关税关注度多数月份同为 T1 > T2 > T3;模糊感知几乎每月 T3 最高
2 关税税率T4 > T2 > T5T5 > T2, T4价格与就业影响、关税关注度多数月份 T4 > T2 > T5;模糊感知多数月份 T5 最高
3 语义一致性T11 > T4 > T10T11 > T4, T10外推密度 T11 最高、怀疑密度 T10 最高;模糊感知无稳定排序,但 Embedding Dispersion 多数月份 T11 最大
4 语义复杂度T6 > T1 > T7T6, T7 > T1分学历看:T6 抬高高低学历两组T7 只压低低学历组,高学历组几乎不受影响
5 叙事T1 > T8, T9三臂相近,无稳定排序人工编码:T8、T9 的关税—价格传导框架份额明显更低、无关税效应框架更高T9 处理后前几月的出口商吸收框架份额高于 T1 与 T8
6 发送者T12 > T1T12 > T1意外程度、可信度、模糊感知几乎每月都是 T12 > T1;与 2025 年 4 月皮尤调查方向一致(48% 更不信任 vs 32% 更信任)

(四)央行沟通实验(以 T11 为对照臂;T11 为特朗普先发六条帖子把拟议税率从 40% 抬到 90%、再甩出终端 100% 公告的升级序列)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((关税威胁与预期))
    I 引言
      关税威胁先动预期
      解放日十个百分点
      社媒短帖一天一变
      推荐算法塑造曝光
      结构模型读不懂文本
      真人面板又贵又慢
    R 问题
      六种措辞谁最推高
      央行事后该说什么
      水平与协调要分开
      虚拟家庭能否替代
    M 方法
      三百个LLM家庭智能体
      ABM不是SD也不是DES
      密歇根调查十二月标定
      十八个月月度迭代
      第七月投放十二臂
      事件研究DID估DTE
      词典密度加人工编码
    R 结果
      立即生效效应最大
      日期不明分歧最大
      递进升级效应最强
      反复翻转削弱可信
      哈里斯署名反应更大
      只有穿透看待能压低
      五条央行话术全降分歧
    a 讨论
      仅T1有人类基准
      四级证据分层表
      鹰鸽二分太粗糙
      叙事是状态变量
      尾部人群可能被漏掉
    D 结论
      语义结构也是处理
      均值与协调分开评
      仿真海选真人验证
      架构可移植到财政能源

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。