🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
关税还没真正开征,一句社交媒体上的威胁就可能先改变千家万户对物价和失业的判断。
你有没有过这种体验:新闻里说某样东西要涨价,你还没看到价签,心里就已经开始盘算要不要提前囤一点?2025 年 4 月 2 日,美国政府宣布了被称为「解放日」的关税方案——统一征收 10% 的基础关税,另对部分国家加征更高税率,力度远超第一任期的零敲碎打。
但这项研究真正盯住的不是税率,而是「话是怎么说出来的」。第二任期里,关税消息越来越多地以社交媒体短帖的形式冒出来,一天一个说法。有统计口径称,2025 年全年特朗普的 Truth Social 账号发帖加转帖共 6168 条,平均每天约 18 条,光是 12 月 1 日一天就发了 168 条。这些帖子往往有条件、带政治指向:2026 年 1 月 12 日威胁对与伊朗做生意的国家立刻加征 25%;五天后又改成对八个欧洲国家「2 月 1 日起 10%、6 月 1 日起 25%」,直到美国能买下格陵兰为止。推荐算法再把这些碎片分发给不同的人,于是同一项政策在不同人脑子里长成了不同的样子。
研究者因此被夹在中间:宏观结构模型算得了总量,却读不懂这些大白话帖子;真人问卷能问出信念,但要反复投放十几种措辞、还要月月追访,又贵又慢,根本追不上一天一变的说法。
② 研究问题(要回答什么?)
这篇论文要回答的是关税威胁怎么措辞才最能推高民众的通胀与失业预期,以及央行事后该怎么解释才能把分歧收拢回来。
说得再具体一点,作者把问题拆成两问:
- 问题一:一条关税威胁的哪些「非政策特征」在起作用?同样是加关税,什么时候生效(立刻/半年后/说不准)、税率是多少又说没说清、前面几条帖子是一路加码还是反复反悔、话说得极简还是满口术语、有没有配一个故事(比如「让美国再次伟大」或者「关税是外国人掏钱」)、署名是谁——这六件事会怎样改变人们的预期?
- 问题二:关税威胁已经把预期推上去、把分歧撑大之后,美联储该说什么?是重申 2% 的通胀目标,是承诺「物价持续走高就收紧」,是强调自己不受政治干预,是把关税说成一次性的相对价格扰动,还是干脆表示可以容忍通胀在一段时间里高于目标?
这里有一个贯穿全文的关键区分:「把平均预期往下压」和「让大家想法趋于一致」是两件不同的事。一条消息完全可能既没怎么动平均值、却把分歧拉得更大;也可能反过来,让所有人整整齐齐地相信一个更糟的未来。作者坚持把这两件事分开测量。
③ 研究方法(怎么做的?)
作者的办法是:造一个 300 户人家的「数字社区」,让它跑 18 个月。
这不是随便编 300 个人。他们从密歇根大学消费者调查(Michigan Surveys of Consumers,简称 MSC)2024 年 12 月那一期里做分层随机抽样,抽出 300 位真实受访者。每个人的年龄、性别、婚姻、地区、学历、政治倾向、收入、房产价值,被原封不动写进一个大语言模型智能体的「人设」;而这个人对未来一年物价和失业的真实回答,就成了这个智能体的初始信念。换句话说,每个虚拟家庭都是照着一个真人捏出来的,而且起点用的是真人当时说的数字——作者特意这么做,是因为大模型经过人类反馈训练后,自己报数容易全挤在一个很窄的区间里。
然后这 300 户开始过日子,一个月走一步,一共走 18 步。每个月,每个智能体都要:看一条社交媒体上的帖子 → 结合自己上个月的看法做个权衡 → 回答和真实问卷一模一样的六道题(未来 12 个月通胀点预测、把 100 分概率分到 10 个区间、用几句完整的话解释为什么这么想,失业同理)→ 自己也发一条帖子。它发的帖子,会进入下个月别人能刷到的信息池。
刷到什么帖子不是随机的。系统里有个「信息茧房」开关:每个月有一半的人(α = 0.5)走推荐通道——先按语义相似度捞出 10 条候选,再由一个专门的「推荐官」智能体挑出和这个人自己观点最贴近的那条推给他;另一半人则随机刷到别人的帖子。还有一个记忆模块只记最近 3 个月,让新消息不至于被陈年旧事淹没。
第 7 个月,实验开始。300 个完全一样的智能体被复制成 13 份:1 组对照(收到一条真实的、但和经济毫无关系的特朗普帖子——夸儿子的书上了亚马逊第一),另外 12 组各收到一条不同措辞的关税威胁。人设、初始信念、前 6 个月的经历、连随机参数都完全一致,唯一的差别就是那一条消息。这种干净的对照在真人实验里根本做不到——真人不能洗掉记忆再来一次。
最关键的一步是验真。T1 这一组说的正是「解放日」那套 10% 立即生效的方案,而现实中真的有人类数据:MSC 在 2025 年 4 月到 11 月的八期调查。作者把模拟的第 7–14 个月和这八个月对齐,从三个角度比:分布像不像、机器学习能不能把假的和真的分辨出来、以及党派/收入/性别的差距有没有复现。
④ 结果(发现了什么?)
模拟结果显示,一条关税威胁怎么说、什么时候生效、由谁说出口,对家庭预期的影响不亚于税率数字本身。
立刻生效 > 半年后生效 > 日期说不准。但「日期说不准」这一组的分歧最大——有人当它是空头支票,有人往最坏处想。
明说 100% 的效应大于明说 10%;但「税率可能很高也可能很低」这种含糊说法,平均效应最小、分歧却最大。说得越具体,大家越容易围着同一个数字想事。
同样是最后甩出 100%,前面铺了六条从 40% 一路涨到 90% 的帖子(T11),效应最大也最持久;而前面反复「加了又撤、撤了又加」的那组(T10),效应最小——大家干脆不信了。
④ 话越简单,冲击越大。不到十个字把税率、范围、时间说完(T6),平均效应超过标准措辞;满口「依法定授权」「从价关税」「宏观审慎审查」的技术语言(T7),效应最小。但有意思的是,太简和太繁都会把分歧拉大:太简是因为没交代来龙去脉,大家各自脑补;太繁是因为有人看不懂。分组一看更清楚——复杂措辞只压住了低学历智能体的反应,高学历那组几乎没受影响。
⑤ 配个故事,反而降温。无论是「让美国再次伟大、制造业回流」的叙事,还是「关税是外国出口商掏钱」的叙事,都让平均预期涨得更少,但几乎不改变分歧。人工编码显示原因很实在:这两组里,认为「关税会传导到零售价」的解释明显变少,认为「关税没什么影响」的解释变多;而「外国出口商吸收成本」这个说法,在税负叙事组里比其他两组高出一截。
⑥ 同一段话,换个人署名,结果不同。把一模一样的关税帖署上哈里斯的名字(T12),平均效应和分歧都比署特朗普(T1)更大。几乎每个月里,T12 的「意外程度」和「可信度」都高于 T1:民主党人宣布全面关税不合常理,所以更意外;而智能体的解释里更常把哈里斯版本当成「认真的、会落实的」,却会因为特朗普「说了又改」的历史打个折扣。这与 2025 年 4 月皮尤调查的方向一致:48% 的美国成年人表示相比历任总统更不信任特朗普的说法,只有 32% 表示更信任。
⑦ 央行实验:只有一种说法能把预期压下去。在最难对付的 T11 场景之后放出五条美联储消息,通胀和失业预期的排序完全一致:C2(若物价持续走高就收紧)和 C5(容忍适度超调)显著为正;C1(重申 2% 目标)和 C3(强调独立性)基本等于零;只有 C4(把关税定性为一次性的相对价格扰动)在多数月份显著为负。但是——五条消息全都缩小了分歧。也就是说,央行完全可能成功地让所有人整齐地相信一个更高的通胀。
⑧ 这个数字社区像不像真人?校准后的 Cramér–von Mises 统计量中位数落在 0.18 到 0.33 之间,全都低于 0.451 的临界值;未校准版本则是 0.81 到 1.22,全部超标。四种机器学习分类器区分「模拟人」和「真人」的 AUC 只有 0.50 到 0.70(0.5 就是瞎猜);而未校准版本里,梯度提升模型的 AUC 普遍超过 0.90——一眼就能看出是假的。
⑤ 讨论(这些发现说明什么?)
这篇论文最值得学的,其实不是结论,而是它对自己有多诚实。
作者反复强调一件事:只有 T1 这一组有人类数据可对。其余十一种关税场景、五种央行说法,现实中压根没发生过,也就没有真人答案可以核对。所以他们专门造了一张「证据分级表」,把全文的每一个结论按「离验证过的基准有多远」分成四档:T1 是有人类基准的;只改一个特征的 T2–T9 算「谨慎的近邻外推」,只能说方向和排序大概可信;T10、T11、T12 这种多条消息或换署名的,只算「情景探索」;至于 C1–C5 这五条央行消息,因为引入了一个全新的机构,只能当作实验设计的预演,不构成任何政策建议。而且他们明确写道:模拟内部的统计显著性,不能把一个结论往上提一档。
更难得的是,他们还主动写出了「什么结果会推翻我们」:如果真人实验发现「日期含糊」既降低平均更新、又降低分歧,那么整个「模糊制造分歧」的机制就错了;如果人们对反复翻转的反应比对一路加码更强烈,那么「可信度耗损」的解释就得改写;如果只讲目标的央行话术和「一次性扰动」的解释一样有效,那么「因果归因才是关键」这个核心主张就被高估了。这是可证伪的假说,不是怎么都能圆的故事。
还有两个值得记住的洞见。第一,鹰派/鸽派这个二分法太粗糙了。C2 明明是鹰派,却把预期推高了——因为「持续的上行压力」这几个字先说服了大家「情况确实很糟」,然后才轮到「我们会收紧」起安抚作用。作者管这叫「清晰不等于安抚」:说清楚一个触发条件,同时也让那个坏状态变得更扎眼。第二,叙事会变成一个「状态变量」。一条帖子的字面内容三个月后就滑出记忆窗口了,但它植入的那套因果故事,会通过智能体自己发的帖子在信息网络里继续传播,还会沉淀进它下个月的先验。所以管理预期不只是反复念数字,而是要盯住正在网络里流通的那套因果解释。
局限也写得很实在:底座模型一升级,结果可能就变;训练数据里可能本来就含有相关事件;人设里的学历、性别可能激活模型学到的刻板印象;智能体自己生成的帖子会让早期误差滚雪球;系统里没有市场出清、没有预算约束、没有政客的策略性反应、也没有央行承诺的机构成本。作者还特别提到一条治理层面的理由:模拟器最可能漏掉的,恰恰是那些信息渠道特殊、语言不通、或者对机构信任度极低的人群——总体拟合得好,不代表尾部没问题。
⑥ 结论(最终结论 + 启示)
这套系统最大的价值不是替代真人调查,而是在花钱做真人实验之前,先帮研究者把话术筛一遍。
三条带得走的结论:
- 一条政策消息不等于一个数字。生效时间、前后是否自洽、说得简还是繁、谁署名、配的是哪套因果故事——这些「非政策特征」对预期的影响,可能不亚于税率本身。只把关税压缩成一个百分数的模型,会同时估错平均反应和分歧程度。
- 平均值和协调度要分开评。分歧变小不等于沟通成功——关键要看大家是围着哪个水平整齐起来的。把点预测、概率分布、开放式解释三样一起看,才分得清「大家都没怎么动」和「有人上调有人下调正好抵消」。
- 正确的用法是「先有人、后有机器、再回到人」。先用真人数据校准,预先登记一套验证标准,再用模拟去海选大量话术,最后把最有信息量的几条拿去做真人实验,用真人结果反过来修正模拟器。
对政策机构来说,这意味着一种克制的用法:在发布重要措辞之前,先让校准过的智能体读一遍,同时看水平和分歧两条线,再翻翻那些反应特别大或特别对立的解释,就能揪出哪些说法的含义严重依赖听者的先验、期限判断或政治身份。但它无法告诉你公众在验证范围之外会怎么反应,也替代不了法律、制度和福利分析。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。近年美国贸易行动的价格传导、产能转移与福利效应已有大量证据(Amiti 等, 2019; Fajgelbaum 等, 2020; Cavallo 等, 2025),围绕关税预期的调查也记录到预期性涨价、预防性行为与党派化的税负认知(Coibion 等, 2025; Hirs-Garzón 等, 2026)。关税威胁因而既是一项潜在税收,也是一次信息冲击。与此同时,政策传播的节奏已经改变:关税信息大量以社交媒体短帖发布,常带条件性与政治指向,再经推荐系统分发,形成注意力集中、信息环境分层乃至分歧放大(Allcott 等, 2020; Levy, 2021; Santos 等, 2021)。
既往方法的缺口。结构与时间序列模型能约束总量反事实,却难以把非结构化文本映射为家庭层面的概率预测与解释;调查实验能揭示不可观测信念并制造识别变异(Stantcheva, 2023; Haaland 等, 2023),但维持一个含多种文本处理的密集月度面板成本高、重设计慢;社交媒体文本分析只能刻画已观测到的传播,无法生成对反事实消息的回应。语言模型研究已能以人类特征条件化合成受访者(Argyle 等, 2023; Horton 等, 2023),新近工作进一步处理覆盖度、动态与识别(Wu 等, 2025)。
三点贡献。其一,提出一个用调查数据与社交媒体文本标定的生成式经济实验动态框架:持久身份 + 观测到的初始信念 + 内生社交媒体信息 + 多期记忆 + 重复处理对照 + 点预测/概率分布/开放式解释三重联合诱导,并内嵌验证层级,把「观测基准内的对应性」「近邻定性外推」「远距情景探索」三类主张明确分开(Ludwig 等, 2026; Hullman 等, 2026)。其二,为家庭预期形成的经济学补上以消息设计为中心的视角,在同一动态信息环境内同时比较实施时间、税率确定性、序列语义一致性、复杂度、叙事与发送者六个维度,并把分布中心与信念协调作为两个独立结果。其三,提供一个推荐算法已塑造过信息环境之后的央行沟通实验台:消息不仅是鹰/鸽信号,还提供冲击的因果模型、持续性判断与政策反应条件(Kakhbod 等, 2026)。
I. Theoretical Framework & Hypotheses(理论框架与假设)
核心机制是置信度加权的贝叶斯信号提取(Supplementary Appendix B.1)。设先验 θ ~ N(μ₀, τ₀⁻¹),信号 s = θ + ε, ε ~ N(0, τ_s⁻¹),则后验均值为 μ₁ = (1−ω)·μ₀ + ω·s,其中 ω = τ_s / (τ₀ + τ_s)。引入置信度 γ > 0,令感知先验精度 τ̂₀(γ) = γ·τ₀,得主观信号权重 ω̂(γ) = τ_s / (γ·τ₀ + τ_s),且 ∂ω̂/∂γ = −τ₀τ_s/(γτ₀+τ_s)² < 0。γ → ∞ 对应过度自信、低估新信息的保守性偏误;γ → 0 对应基率忽视与过度更新。系统据此设定五级序数置信度,该推导不作为结构估计方程,仅为智能体指令提供经济学纪律。
六个处理维度构成实验的核心对照结构,每一维只改动对应特征,其余尽自然语言所能保持不变:
| 维度 | 对照臂 | 操纵内容 | 对应理论 |
|---|---|---|---|
| 1 实施时间 | T1, T2, T3 | 立即 / 半年后 / 日期不确定 | 前瞻指引之谜与认知贴现(Del Negro 等, 2023; Gabaix, 2020);显著性与理性疏忽(Bordalo 等, 2012; Sims, 2003) |
| 2 关税税率 | T2, T4, T5 | 10% / 100% / 税率不确定 | 信息刚性与精度加权更新(Coibion & Gorodnichenko, 2015);奈特不确定性(Knight, 1921; Morris & Shin, 2002) |
| 3 语义一致性 | T4, T10, T11 | 单次 / 高频反转 / 高频递进(终端消息相同) | 外推型预期(Greenwood & Shleifer, 2014);廉价磋商与承诺缺失(Crawford & Sobel, 1982) |
| 4 语义复杂度 | T1, T6, T7 | 标准 / 极简(不足十词)/ 法条技术语言 | 可读性与认知处理成本(Bholat 等, 2019; D’Acunto 等, 2019) |
| 5 叙事 | T1, T8, T9 | 无叙事 / MAGA 回流叙事 / 出口商承担税负叙事 | 叙事经济学与主观因果模型(Shiller, 2017; Andre 等, 2022) |
| 6 发送者 | T1, T12 | 完全相同文本,署名特朗普 / 哈里斯 | 政治身份与信源依赖更新(Kamdar 等, 2025; Hirs-Garzón 等, 2026) |
第二个实验以 T11 为对照臂,检验五种美联储沟通策略(C1 目标重申、C2 情景式条件收紧、C3 机构独立性、C4 穿透看待、C5 容忍适度超调),并把沟通的两个政策目标——预期水平与信念协调——分开评估。
M. Materials & Methods(材料与方法)
- 仿真范式:基于智能体的建模(ABM),不是系统动力学(SD),也不是离散事件仿真(DES)。具体实现为大语言模型驱动的多智能体系统(MAS)——没有存量流量方程,也没有事件队列;状态更新由每个 Household Agent 对自然语言输入的自主生成决定。
- 智能体规模与时间步:300 个 Household Agent;月度时间步、共迭代 18 个月(Month 0 = 2024 年 12 月为初始信念月)。处理施于 Month 7,构成 6 个前期月 + 12 个后期月的平衡事件时间面板。1 个对照臂 + 12 个处理臂;因样本完全计算生成,各臂复用完全相同的 300 个智能体,人设、初始信念、前期历史、置信度与解码参数一致,仅处理信息不同。
- 标定数据(一)· 人设与初始信念:Michigan Surveys of Consumers(MSC)2024 年 12 月横截面,分层随机抽样 300 位真实受访者。人设字段直接取自 MSC 变量(年龄、性别、婚姻、地区、六类学历 EDUC、五类政治倾向 POLAFF、收入 YTL5、住房价值 HTL5);初始信念取自
PX1Q1、PX1Q2(物价点预测)与UNEMP。选该月是因为预期相对平稳、且窗口内无可与处理冲击机械重合的大型关税公告。自 Month 2 起先验内生化:上月本智能体的点预测成为本月先验。 - 标定数据(二)· 社交媒体信息模块(SMIM):Month 1 以 2024 年 12 月按「US Inflation」「US Unemployment」检索、经清洗的高互动英文 X 帖子播种(不按政治观点人工筛选)。Month 2 起信息集全部来自其他智能体上月发布的帖子:每月按比例
α分流至推荐支路,语义相似度召回 10 条候选后由独立的 Recommender Agent 选出观点最贴近者;其余1−α随机分配他人帖子,由此构造信息茧房通道。 - 验证数据(关键):MSC 2025 年 4 月至 11 月共八期人类调查(即 Liberation Day 关税公布之后),与 MAS Month 7–14 逐月对齐。T1 文本依 Executive Order 14257(2025 年 4 月 2 日)的实质内容生成而非照抄帖子,以把基准锚定在真实政策事件上;对照臂用一条真实但与宏观无关的 Truth Social 帖子作安慰剂。
- 因变量诱导:每月六题——Q1/Q4 未来 12 个月点预测;Q2/Q5 将 100 个百分点分配到 10 个互斥区间;Q3/Q6 用若干完整句子解释理由。格式沿用 MSC 与纽约联储 SCE 的措辞(Manski, 2004)。
- 识别策略:事件研究式双重差分,估计动态处理效应 DTE:
Y_im = α + Σ_g Σ_{k=−6..−2} μ_gk·D_im^gk + Σ_g Σ_{k=0..11} β_gk·D_im^gk + λ_m + η_i + ε_im,D_im^gk = 1{i∈g}·1{m−7=k},η_i为智能体固定效应,λ_m为月份固定效应,省略 k = −1;μ_gk检验处理前平行性。 - 分歧指标:
Disp_m = Σ_b p̄_bm · [ (1/N_m) Σ_i (p_bim − p̄_bm)² ],B = 10。作者明确声明它是协调问题的代理变量,既非户内平均方差,也非完整福利度量。 - 基线参数(Table B.1):
α = 0.50(备选 0.10 / 0.90;三者 Pearson 相似度为 0.720 / 0.708 / 0.698);记忆窗口 w = 3 个月(备选 10 / 17,DTE 排序基本不变);五级置信度按智能体固定;温度 T_i = clip_[0,2](1 + u), u ~ N(0, 0.5²)、top-p P_i = clip_(0,1](0.5 + u), u ~ N(0, 0.25²),跨臂固定以免把消息效应与新抽的解码噪声混淆。 - 底座模型选择:相同提示、人设、先验与 SMIM 下预测五个前沿模型,以 Month 7–14 相对 MSC 的分布形状相似度为准则,选定 Qwen3.5 Plus(Pearson 0.720 / cosine 0.725),优于 GPT-5 Mini(0.566 / 0.575)、Kimi K2.5(0.523 / 0.533)、DeepSeek V3.2(0.350 / 0.365)与 Gemini 3 Pro(0.342 / 0.358);五者知识截止均不晚于 2025 年 3 月。嵌入使用
all-MiniLM-L6-v2。 - 机制测量(文本即数据):词典密度
S_igt^(k) = (1/N_igt^(k)) · Σ_{q∈D_k} C(q, y_igt^(k)),臂—月聚合后逐月排最大/中间/最小。九类词典(关税关注、时间紧迫、模糊感知、价格影响、就业影响、外推、怀疑、可信度、意外程度)在处理比较之前即已固定并经索引行人工审计剔除歧义词;另构造 Embedding Dispersion(臂—月内开放式回答的平均两两余弦距离)以规避固定词典的失效模式。 - 人工编码与编码信度:因果框架采用人工编码(关键词无法还原论证的方向与因果结构)。通胀侧设 7 个实质框架 + 1 个残差类(关税—价格传导 F1、供应链中断、货币或财政政策、无关税效应 F4、不确定性驱动通胀、出口商吸收 F6、个人经历、其他)。两名编码员先读完整手册、在预编码样本上练习并与参考答案比对,再与主研究者开校准会;正式阶段双人独立编码、不得讨论个案、对处理分配盲态;逐框架计算 Cohen's κ,若任一框架 κ < 0.70 即修订定义、重新培训并重编相应子样本;分歧由主研究者裁定。
R. Results(结果)
(一)标定有效性:三条边的验证(Supplementary Appendix C,验证窗口 MAS Month 7–14 对齐 MSC 2025-04 至 2025-11)
- 分布检验(Cramér–von Mises):每月约 300 个智能体对约 700 名真人,合池近 1000 观测。全样本下标准检验一律 p < 0.001,尽管标定后的 CvM 统计量只有未标定版本的 5%–50%,故改用重复随机子抽样:
m = ⌈n^γ⌉,基线γ = 0.60即 m = 31,每月抽 K = 200 对不放回子样本,按 Rüger 中位数加倍法则合并p_comb = min{1, 2·median(p₁,…,p_K)};5% 临界值T_α = 0.451。结果:标定后中位数 0.18–0.33(自助区间上端 0.21–0.35),八个月全部低于临界值;未标定中位数 0.81–1.22(下端 0.78–1.17),全部高于临界值。γ 从 0.55 到 0.85(m 由 24 增至 128)时,标定组不拒绝月数依次为 8/8、8/8、8/8、8/8、7/8、6/8、6/8,随 m 增大而下降,与大样本一致性讨论相符。 - 机器学习判别:按月二分类(1 = 真人,0 = 模拟),特征含年龄、地区、性别、婚姻、学历、政治倾向、收入与总收入百分位、住房财富与其百分位、点预测;月内分层 60/20/20 划分,标准化矩仅由训练集计算以防泄漏;四类模型(L2 正则 Logistic、随机森林、梯度提升、集成前馈神经网络)调参后只在留出测试集评 AUC。标定组四种算法八个月 AUC 全部落在 0.50–0.70;未标定组除 Logistic 外均易于区分,梯度提升普遍高于 0.90。
(二)人口异质性复现(因变量为点预测,HC3 稳健标准误,控制年龄、年龄平方及地区、性别、婚姻、学历、收入的分类变量;跨样本系数相等性检验 Z_t = (β̂₁ᵗ,S − β̂₁ᵗ,H) / √(SE(β̂₁ᵗ,S)² + SE(β̂₁ᵗ,H)²))
| 梯度 | 真人(MSC) | 标定 MAS | 相等性 p | 未标定 MAS |
|---|---|---|---|---|
| 民主党身份(共和党执政期) | +3.459 ~ +6.508,八个月全部 p < 0.01 | +4.352 ~ +4.427,全部 p < 0.01 | 0.145 ~ 0.913,从未拒绝 | 仅 +0.272 ~ +0.353,方向对但每月都显著低于真人,严重欠极化 |
| 高收入 | −0.936 ~ −2.572,仅最后三个月显著 | −0.993 ~ −1.220,稳定为负 | 0.327 ~ 0.994,从未拒绝 | −0.065 ~ −0.123,严重衰减,后段显著偏离 |
| 性别(女性高于男性) | 八个月全部显著为正 | 方向与动态持续性均复现 | — | 集中在约 4.0%–4.4%、区间极窄,性别差衰减、信念同质化 |
(三)六个维度的 DTE 与信念分歧排序(Table 2;通胀结果见 Figure 3–4,失业结果见 Appendix D Figure D.1–D.2,定性结论一致,仅量级不同)
| 维度 | DTE 排序 | 信念分歧排序 | 文本机制证据 |
|---|---|---|---|
| 1 实施时间 | T1 > T2 > T3 | T3 > T1, T2 | 时间紧迫度与关税关注度多数月份同为 T1 > T2 > T3;模糊感知几乎每月 T3 最高 |
| 2 关税税率 | T4 > T2 > T5 | T5 > T2, T4 | 价格与就业影响、关税关注度多数月份 T4 > T2 > T5;模糊感知多数月份 T5 最高 |
| 3 语义一致性 | T11 > T4 > T10 | T11 > T4, T10 | 外推密度 T11 最高、怀疑密度 T10 最高;模糊感知无稳定排序,但 Embedding Dispersion 多数月份 T11 最大 |
| 4 语义复杂度 | T6 > T1 > T7 | T6, T7 > T1 | 分学历看:T6 抬高高低学历两组;T7 只压低低学历组,高学历组几乎不受影响 |
| 5 叙事 | T1 > T8, T9 | 三臂相近,无稳定排序 | 人工编码:T8、T9 的关税—价格传导框架份额明显更低、无关税效应框架更高;T9 处理后前几月的出口商吸收框架份额高于 T1 与 T8 |
| 6 发送者 | T12 > T1 | T12 > T1 | 意外程度、可信度、模糊感知几乎每月都是 T12 > T1;与 2025 年 4 月皮尤调查方向一致(48% 更不信任 vs 32% 更信任) |
(四)央行沟通实验(以 T11 为对照臂;T11 为特朗普先发六条帖子把拟议税率从 40% 抬到 90%、再甩出终端 100% 公告的升级序列)
- 通胀与失业预期呈现完全相同的定性排序:C2 与 C5 > C1 与 C3 > C4。相对 T11,C2、C5 在多数处理后月份显著为正;C1、C3 多数月份与零无法区分;C4 多数月份显著为负,是唯一持续压低点预期的策略。
- 但 C1–C5 五条消息全部不同程度地降低了相对 T11 的信念分歧——分别协调于目标(C1)、独立性(C3)、触发条件(C2)、暂时性归因(C4)、容忍期限(C5)。降分歧本身不构成沟通成功的证据,关键是围绕哪个水平协调。
- 文本机制:语义压力指数
r_i^(y) = mean_{a∈A⁺} cos(e_i, a) − mean_{a∈A⁻} cos(e_i, a),在 T11 与 C1–C5 合池样本内标准化。语义压力排序与 DTE 排序一致:C2、C5 最高,C1、C3 居中,C4 最低。Embedding Dispersion 显示每条美联储消息都缩小语义分歧,C4 收敛最强。时间形态上,C4 因「暂时性冲击」的解释进入先验而在多数后续月份保持为负;C2、C5 则因「持续性」与「超调」措辞继续在智能体生成的帖子中流通而维持为正。
a / D. Discussion & Conclusion(讨论与结论)
- 理论意义一:非政策特征可与政策参数同等重要。家庭预期不仅回应税率与实施时间,也回应发送者政治身份、消息内嵌的因果叙事、跨公告的语义一致性、可读性与模糊度。这意味着关税威胁的预期效应未必对政策参数呈线性;把关税信号压缩成一个数值税率的 DSGE、HANK 或 CGE 政策评估,可能同时错估平均预期反应与信念分散度。
- 理论意义二:预期水平与信念协调是两个独立的政策对象。一条消息可以在平均 DTE 很小的同时扩大分歧(模糊时点/模糊税率场景),也可以提供一个共同焦点、把分歧压缩在一个不理想的均值周围。只看点预测会掩盖沟通风险的重要维度;点预测、主观分布与语义分散度三者联合观测,才能区分「更新微弱」与「异质更新相互抵消」。
- 理论意义三:因果叙事是预期动力学中的状态变量。消息的字面内容会滑出三个月记忆窗口,但它改变的感知税负归宿或持续性判断,会经由智能体修订后的先验及其生成并进入 SMIM 的帖子内生传播。管理预期因此要盯住在信息网络中流通的那套因果模型,而不只是反复宣告目标或税率。
- 理论意义四:鹰派/鸽派是过粗的充分统计量。C2 语气偏鹰却推高预期,因为「持续的广泛价格压力」先验证了冲击具有通胀性质,央行信息效应压过了承诺的稳定作用(Romer & Romer, 2000; Nakamura & Steinsson, 2018);C4 语气偏鸽却压低预期,因为它重新分类了冲击的持续性。沟通要协调信念,必须回答三个相连的问题:发生了什么类型的冲击、在什么条件下央行会反应、目标在多长的期限上约束。
- 局限一(最核心):验证只覆盖 T1。其余十一个关税臂与五条央行消息均为反事实,没有对应的人类面板。作者据此建立四级证据分层表(Table 5):① 观测基准(T1, Month 7–14;仅允许「在所测边际上的保真」,不得主张一般等价);② 受控近邻变体(T2–T9 中仅改一个特征者;允许谨慎的方向或排序定性外推);③ 远距关税情景(T10、T11、T12;仅作情景比较与假说生成);④ 新机构或新干预(C1–C5;仅作设计分析,不构成任何直接政策建议)。并明确规定:MAS 内部的统计显著性不能把一个情景提升到更强的证据档次。
- 局限二:作者主动写出可证伪条件。若真人实验发现模糊时点同时降低平均更新与分歧,模糊机制的关键比较预测即告失败;若人们对语义反转的反应强于语义递进,可信度解释需重写;若仅讲目标的央行措辞与暂时性冲击解释同样能压低预期,则「因果归因是关键」这一主张被高估。
- 局限三:系统性遗漏与治理风险。底座模型更新可能改变结果;训练数据可能已包含相关事件;人设可能激活刻板印象;内生生成的帖子会放大早期误差。系统不含市场出清、家庭预算约束、政治行为者的策略反应与央行承诺的机构成本。更要紧的是,模拟器最可能低估的恰恰是信息集特殊、语言可及性受限或机构信任度低的人群——总体拟合良好不保证尾部行为合格。跨平台迁移需重建语料与曝光代理:复用架构是合理的,复用效度主张则不是。
- 实践启示:一套有纪律的工作流。先用人类数据标定人设、先验与信息曝光,预先登记一组分布与异质性验证指标(处理场景留空不动),再用 MAS 海选大范围话术、按经济重要性与跨设定分歧挑出对照,最后把这些对照投入真人实验并回头更新标定。对政策机构而言,可在发布重要措辞前让标定过的智能体先读一遍,同时比较水平与分歧两条线、检视反应异常大或异常两极的解释文本,识别出含义高度依赖先验、期限或政治身份的措辞;但这无法确定公众在验证域外的反应,也替代不了法律、制度与福利分析。恰当的定位是三者互补:MAS 海选传播情景,真人实验识别选定效应,经济模型把验证过的预期变化映射为行为与总量结果。
- 发表信息:arXiv 预印本 2608.30522(econ.GN,2026 年 8 月 31 日提交);JEL 代码 C63、D83、D84、E58、F13。原文未见资助声明。
🧠 IRMaD 思维导图
mindmap
root((关税威胁与预期))
I 引言
关税威胁先动预期
解放日十个百分点
社媒短帖一天一变
推荐算法塑造曝光
结构模型读不懂文本
真人面板又贵又慢
R 问题
六种措辞谁最推高
央行事后该说什么
水平与协调要分开
虚拟家庭能否替代
M 方法
三百个LLM家庭智能体
ABM不是SD也不是DES
密歇根调查十二月标定
十八个月月度迭代
第七月投放十二臂
事件研究DID估DTE
词典密度加人工编码
R 结果
立即生效效应最大
日期不明分歧最大
递进升级效应最强
反复翻转削弱可信
哈里斯署名反应更大
只有穿透看待能压低
五条央行话术全降分歧
a 讨论
仅T1有人类基准
四级证据分层表
鹰鸽二分太粗糙
叙事是状态变量
尾部人群可能被漏掉
D 结论
语义结构也是处理
均值与协调分开评
仿真海选真人验证
架构可移植到财政能源
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。