🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
用大模型来跑社会仿真,这两年成了一股热潮。研究者把几百个大模型智能体放进一个模拟的社交网络里,让它们发帖、回复、转发,然后观察会不会出现极化、谣言扩散、群体分裂这些现象。
这种做法的诱人之处在于:过去做这类仿真,每一条行为规则都得研究者亲手写死。比如要模拟一个经济主体,你得明确规定:如果某种资源的价格是多少、我的内部需求达到什么阈值,就买入多少。这些规则从哪来?从假设、理论和数据里一点点抠出来。
而大模型似乎能跳过这一步——它在海量人类数据上训练过,看起来自带关于人类行为的信息,不用编规则就能生成丰富的行为。
但这里埋着一个容易被忽略的问题。一个仿真能生成某个现象,和这个仿真解释了这个现象,完全是两回事。
作者举了一个精彩的例子:你可以用两根刻着对数刻度的木棍来模拟人做乘法,结果完全正确——但人类根本不是这么算乘法的。能算对,不等于算法一样。
② 研究问题(要回答什么?)
这篇论文要回答的核心问题是:一个大模型社会仿真做出来了,它到底证明了什么?
这个问题之所以难,是因为研究者手里的证据往往含糊不清。目前这个领域最常用的验证方式叫可信度——找人来看智能体生成的对话,判断这像不像真人写的。
问题是:像真人,能说明什么呢?
作者把这个疑问拆解成一组更锋利的追问。一个仿真里出现了极化,这是因为大模型真的调用了它学到的社会知识,还是仅仅因为提示词把它逼出了这个结果?我们能不能分辨?如果分辨不了,那么当研究者说“我们的仿真显示某项政策干预会导致某某后果”时,这句话该不该被相信?
作者的目标是给出一把尺子,让研究者能清楚地说出自己的仿真处在哪个层级、能支撑什么强度的主张。
③ 研究方法(怎么做的?)
作者的做法是把科学哲学里已经很成熟的一套理论搬过来用。
在科学哲学里,机制指的是产生某个现象的那些实体与活动的组织方式。要解释一个现象,就是要说清楚它是怎么被产生出来的,而且这个说法必须可以被证伪。相对地,只能重现现象、说不出所以然的模型叫现象学模型。
作者把一个模型形式化成四个部件:仿真本身、目标现象、建模者的意图、以及证据。
基于这四个部件,他们造出了一把四级量表。
第零级:有仿真,但没有明确要解释的现象。这就是一个沙盒或演示。因为机制是相对于现象才有意义的,没有目标就谈不上机制。
第一级:加上了被明确定义的目标现象。仿真能把这个现象跑出来,就叫生成充分性。但它不做任何解释性主张——只要能跑出来,怎么跑出来的都行。
第二级:加上了建模者的意图,也就是一个假设,外加一张对照表,说清楚仿真里的哪个部件对应现实中的哪个机制。有了这张表,仿真才第一次具备了回答反事实问题的资格。
第三级:再加上证据——用真实数据来约束参数、支持这张对照表,或者做消融和敏感性分析。作者特别指出,第三级不是一个二元门槛,而是一个连续的梯度。
他们还设想了一个永远达不到的终点:所有机制都被完整描述、毫无疑问。作者用两条理由说明它不可达——每确认一层机制,就会分叉出新的待解释问题;而且假设从来不是孤立被检验的,失败或成功都无法被明确归因到某个特定部件。
④ 结果(发现了什么?)
把这把尺子拿去量当前的研究,作者得到一个不太乐观的诊断。
最直接的证据来自一项系统综述:在被调查的 35 篇大模型社会仿真论文里,有 22 篇把“可信度”当作主要的验证指标。也就是说,绝大多数研究提供的证据,只够把它们放在第一级。
而作者指出的核心毛病,比这更微妙,他们称之为层级混淆:研究者用智能体层面的验证,去支撑仿真层面的主张。
这话什么意思?在传统的仿真里,一个能正常工作的智能体是被预设的前提,而不是研究对象。如果智能体行为不对,那说明程序写错了。但因为大模型智能体是新东西,研究者花了大量篇幅去论证自己的智能体设计得好——能记住事实、能保持人设、生成的话像真人。
问题在于:证明智能体能正常工作,完全不能证明这个仿真解释了它想解释的那个社会现象。能工作的智能体是仿真的必要零件,但零件合格不等于整机结论成立。
作者还点出了一个很实际的隐患:提示词工程可以直接把想要的结果逼出来。如果只做第一级的现象学模型,这完全没问题;但一旦要做解释性主张,就必须说清楚——这句提示词到底是强行凑出正确输出的人为产物,还是对某个真实机制的有意抽象?不讲清楚,模型就处在一种含糊状态。
⑤ 讨论(这些发现说明什么?)
作者并不是要否定第一级的仿真。他们明确说,只经过可信度验证的仿真,对于演示某个现象能够被生成、或者用于头脑风暴和原型设计,是足够的。问题只出在越界主张上。
越界的具体表现是:一旦研究者想问“如果换一种政策会怎样”,他就已经在暗示仿真里的某些部件对结果负因果责任了。这是一个机制性主张,无论他是否用这个词来表述。而第一级的证据支撑不了它。
关于仿真到底怎么用才有价值,作者引用了一项很有说服力的实地研究。有团队与某大学的应急准备团队做了长达一年的共同设计。结果发现:即便智能体表现得很像真人,这些政策制定者对模型的预测能力仍然持怀疑态度。他们真正觉得有用的是把仿真当作头脑风暴工具——当仿真跑出明显不对的动态时,反而激活了他们的隐性知识,让他们列出真正重要的关切,比如疏散场景中的轮椅坡道。而当仿真在一次真实的毕业典礼场景中与他们的经验吻合之后,他们才开始愿意认真对待仿真给出的可能性推演。
作者还讨论了两个常被忽略的现实问题。一是可复现性:商用大模型接口会加入用户看不见的系统提示词与护栏,还会不加通告地更新版本,这可能悄悄改变智能体的行为轨迹,直接损害实验效度。二是伦理:用大模型替代真人被试,与代表性和包容性的价值相冲突;而且模型会把训练数据某个时点的规范与态度固化下来,形成价值锁定。
⑥ 结论(最终结论 + 启示)
这项工作最终交付的是一份可以填写的核查清单,参照的是机器学习领域已有的数据集说明书和模型卡片的做法。作者还在附录里给出了逐级示例,每一级各配一个历史上的经典仿真作为参照。
它的价值在于把一个含糊的争论变成了一件可操作的事。研究者不必再纠结自己的仿真是不是“真的”,而只需要诚实地回答:我明确了目标现象吗?我给出对照表了吗?我有证据吗?答到哪一步,就说到哪一步的话。
作者也提醒,这些问题并非大模型独有。关于如何设计有依据的仿真,是这个领域一场长期的讨论;历史上模型设定不清也曾造成真实的危害。大模型只是让这个老问题变得更急迫,因为它让“看起来很像那么回事”的仿真变得前所未有地容易生产。
对做公共政策和传播研究的人来说,这篇论文的实用价值很直接:下次看到一篇用大模型智能体做的政策仿真时,可以先问一句——它的证据只够支撑“这个现象能被生成”,还是真的支撑了“这个机制在起作用”?
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
自然语言处理的进展催生了将大语言模型用于社会仿真的热潮,典型做法是扩展 ABM 中主体的行动空间。作者指出,产品决策、政策制定乃至研究本身,都可能日益受到此类仿真结果的影响,因而其认识论地位不再只是学术趣味。
在经典 ABM 中,产生现象的机制由建模者显式操作化并编程(例如“若资源 A 价格为 X 且我的内部需求 B 达到阈值 Y,则买入若干 A”),这些规则基于假设、科学理论与经验数据的某种组合。引入 LLM 的诱人前提是:在社会数据上训练得到的权重可能已经编码了关于人类行为的相关分布信息,从而允许更丰富的人类主体表征。
由此产生一组核心困惑:给定一个仿真,结果究竟源自 LLM 权重中被正确检索的社会知识,还是源自与建模者意图无关的信息(机器学习领域称之为忠实性问题)?在可解释性与数据归因尚不成熟的当下,我们可能产出一个看似在解释社会科学现象、实则只是以其他途径生成了它的仿真。
Larooij & Törnberg (2025) 的综述发现,不少 LLM-ABM 研究未承认传统仿真文献的既有成果,甚至缺乏适当的操作效度,其评估普遍归结为某种形式的可信度(believability)——由人类标注者判断主体对话的输出是否像人写的。本文的两项贡献是:(1)汲取建模与机制文献,把“可信度”操作化为一把四级量表,将模型的生成充分性与机制可信度分离;(2)以此审视早期 LLM-ABM 研究,并把量表转化为可填写的核查清单。
I. Theoretical Framework & Hypotheses(理论框架与假设)
理论骨架取自科学哲学的机制文献(Machamer et al., 2000; Craver et al., 2024)与模型认识论(Weisberg, 2013; Epstein, 2006)。
- 现象:可从数据中可靠推断的稳定模式、规律或事件,是科学共同体的解释目标(Bogen & Woodward, 1988)。其范围随探究领域、建模者的方法论选择与研究问题而变。
- 机制:现象背后实体与活动的理论化组织;机制参与现象的因果过程,而非仅与之相关。关键约束:机制不能被孤立识别,须先操作化目标现象(Glennan 定律),故量表中操作化先于假设。
- 现象学模型:能产生目标模式却不含其机制信息的模型,解释力因此受限。
- 生成充分性(Epstein, 2006):以仿真“长出”目标现象,即建立了输入-输出映射,证明了一个充分而非必要的条件。
- 3M 要求(Kaplan & Craver, 2011):成功的解释性模型须满足——(a) 模型中的变量对应于产生、维持或支撑该现象的目标机制的组件、活动、属性与组织特征;(b) 模型中这些变量之间设定的依赖关系,对应于目标机制各组件之间的因果关系。解释不必细到原子层,可采用适配用途的抽象或理想化层次。
- 机制与预测之分:气压计读数可预测天气,但它测量的气压变化并非产生读数的机制。这对应因果推断中观察性问题与干预性问题的区别(Pearl, 2009)。预测模型的输出通常只在可对照观测结果验证的范围内成立;对于新的干预,机制才是判断输出是否可接受的依据。混淆解释与预测是一个在经典统计与早期 LLM-ABM 中都出现的范畴错误(Shmueli, 2010)。
形式化:模型被写为四元组 M = (S, T, I, E)——仿真、目标现象、建模者意图、证据。四项顺序依赖:若只有 S 与 E 而无 T 与 I,则仅是一堆仿真输出与任意“事实”的配对,二者之间没有清晰映射;T 与 I 是把无关事实转化为支持假设之证据的必要关系结构。
M. Materials & Methods(材料与方法)
- 范式定位:本文不跑新仿真,而是方法论与认识论分析——把科学哲学的机制解释理论与 LLM-ABM 实践对接,产出一把分级量表及其核查清单,并据此审视既有文献。所讨论的对象是生成式基于主体建模(LLM-ABM),贯穿全文的跑例是“一个基于 LLM 的社交媒体意见动力学仿真”。
- Level 0(无目标):仅有
S——一组产生输出的程序、代码与更新规则,但缺乏被明确界定的待解释现象。因机制相对于现象而定义,无目标者不可能有机制。未显式操作化T的模型亦被归入此级。跑例:把 LLM 主体放入模拟社交网络自由发帖、回复、分享,用以演示新技术,无待复现或解释的现象。 - Level 1(现象学 / 生成充分):加入被操作化的
T。若S能产生T的操作化模式,则称其生成充分,但不作任何解释性主张——S以任何方式产生T皆可。当前把 LLM 置于博弈论情景以测其合作能力或内在偏见的工作多属此级:其问题形如“某些 LLM 主体能否产生行为集合{x₀ … x_m}”,属生成充分性而非因果追问。该级另有一项诊断价值:识别仿真是否在“作弊”——通过提示工程完全可以逼出产生T的输出。对现象学模型这完全可接受;但若要作解释性主张,必须在I中说明该提示词是强行产出正确输出的人为产物,还是对真实机制的有意抽象,否则模型处于“现象学含混”状态。 - Level 2(how-possibly):加入建模者意图
I,其内容为一个假设加一张映射(亦称模型钥匙 model key),把S中的组件与活动连接到被认为产生T的机制上,即 3M 要求的落实。与 Level 1 的关键分野在于:Level 2 提供了对反事实情景进行推理的基础。作者强调映射是一种解释而非计算本身——同一个S与T,两位建模者可提出不同的I。对 LLM-ABM 而言,若主体经由人设提示或引导向量初始化,映射须明言:建模者假定 LLM 的训练数据编码了关于人类行为的相关分布;该假定是否成立是一个按领域界定的经验问题,且鉴于 LLM 的“理论本体”是自回归文本预测、与所述人设的认知过程结构相似性存疑,这仍是开放难题。 - Level 3(有证据支撑):加入证据
E,用以支持或约束模型的构建、参数化或验证——可以是据普查数据、调查结果或既有实证研究选取初始参数(例如依真实民调数据初始化主体的政治信念),也可以是消融或敏感性分析等进一步受约束的实验。该级不是二元门槛而是梯度:借 how-possibly 与 how-actually 的连续统观点(Brandon, 2014),随证据的质量、数量与直接性提升而渐进推进。 - Level Ω(不可达):所有机制均被完整描述、毫无疑问的理论终点。两条不可达理由:(a)Bokulich (2014) 的分叉论——某一抽象层的机制被证据确认后,试图进一步specify 该机制会开出新的 how-possibly 分支,各自又需自己的证据;(b)迪昂-蒯因论题——假设从不被孤立检验,故当模型对照经验观测出现失败(或成功)时,无法被无歧义地归因于特定组件,明确的证伪不可能。
- 核查清单:借鉴机器学习领域的数据集说明书与模型卡片(Gebru et al., 2021; Mitchell et al., 2019),把量表转化为可填写的启发式清单;附录另以历史上的经典 ABM 逐级给出示例,每级一例。
R. Results(结果)
- 领域现状的量化证据:在 Larooij & Törnberg (2025) 的系统综述中,35 篇被调查的 LLM 社会仿真论文里有 22 篇以“可信度”作为主要验证指标——由人类或 LLM 判断主体行动或仿真结果是否可信(作为研究的实验环节,或仅凭检视)。作者据此判定:这类验证提供的是生成充分性的评估,而非解释力,对应量表的 Level 1。
- 核心诊断:层级混淆。LLM 社会仿真普遍以主体层面的验证冒充仿真层面的验证。从 ABM 的视角看,一个正常工作的主体是被预设的机制,通常不是研究关心的目标现象;在经典 ABM 中主体行为由人手工编程,主体不工作只意味着程序有 bug。作者在自行审阅采用 LLM 驱动主体的 ABM 论文时发现,这些工作倾向于把大量篇幅用于论证其 LLM 主体的设计。然而,支持主体架构功能性的证据(例如展示主体能记住事实),不足以充当支撑关于更高层社会现象之映射
I的证据E。可工作的主体是S的必要构成,但其功能性本身不验证模型对T的解释。
| 层级 | S | T | I | E | 可支撑的主张 |
|---|---|---|---|---|---|
| Level 0 | ✓ | — | — | — | 无(沙盒 / 技术演示) |
| Level 1 | ✓ | ✓ | — | — | 该现象能够被生成;可用于探索、头脑风暴与原型设计 |
| Level 2 | ✓ | ✓ | ✓ | — | how-possibly 假设;反事实推理成为有意义的实验 |
| Level 3 | ✓ | ✓ | ✓ | ✓ | 有经验约束的机制主张(梯度而非门槛) |
| Level Ω | 虚构的终点 | 不可达(分叉 + 迪昂-蒯因) | |||
- 随层级上升而增加的是“可被证伪的承诺数量”:Level 1 只有
T的复现受检验;Level 2 增加映射I这一可证伪承诺;Level 3 的经验落地E再开出新的失败点。作者把这些统归于“可信度”这一伞式术语之下。 - 实践者的行为与量表一致(外部佐证):Li et al. (2025) 与某大学应急准备团队进行了为期一年(2024-2025)的仿真共同设计。政策制定者即便面对行为可信的主体,仍对模型的预测能力持怀疑;仿真对他们的价值主要体现为头脑风暴工具——当仿真动态被识别为错误时,反而重新浮现了他们的隐性知识,促使其列出重要关切(例如疏散场景中的轮椅坡道)。只有当仿真在该校真实的毕业典礼场景上与其经验吻合后,他们才愿意认真对待仿真给出的 how-possibly 结果。此模式呼应 Park et al. (2022) 中“虚假”的模拟社交平台帮助设计者在真实部署前识别并原型化问题。
a / D. Discussion & Conclusion(讨论与结论)
- 问题的正确提法:由于没有仿真能穷尽现象背后的机制,“如何实用地使用 LLM 社会仿真”应被理解为“在什么条件下,LLM-ABM 对某个特定目的是充分的”。仅经可信度验证的仿真(Level 1)足以证明现象可被生成,或用于探索性的头脑风暴与原型设计。
- 越界的判据:一旦建模者希望检验未被观察过的条件下会发生什么——例如某项政策干预会如何改变
T的动态——他就已经在隐含主张S的哪些组件对T负因果责任。这是一个机制性主张,无论建模者是否如此表述。而 Level 1 的证据不足以支撑它。 - 可复现性与专有接口:商用 LLM API 会引入终端用户不可见的提示注入、护栏或系统提示词,出于安全、合规或专有目的,却可能主动损害实验效度——隐藏提示词可能在建模者不知情时改变主体的行为轨迹,或阻止主体表现出研究者关心的行为;专有模型还常有不加通告的版本或系统提示词更新,使不同批次运行之间的主体行为发生变化。使用开源本地部署模型可解决此问题,但因 GPU 与技术门槛提高了准入成本。作者提及 OLMo(全开放训练数据、代码与中间检查点)与 Public AI Network(把 AI 视为公共基础设施)等应对方向,同时承认专有模型在商业部署与研究使用中仍占主导。
- 伦理与认识论关切:Agnew et al. (2024) 指出以 LLM 替身替代人类被试的提议与代表性、包容性以及对人类被试的理解等价值相冲突,并可能无视既有人类被试研究中研究者与被试之间的关系;当 LLM 生成类似问卷回答或社会行为的文本时,它并非直接来自一个在场个体的经验。另有价值锁定问题——LLM 编码的是其训练数据在某一时点的规范与态度;相关实证亦显示语言模型在训练语料未覆盖的时间段上性能退化(Lazaridou et al., 2021)。
- 问题并非 LLM 独有:关于有充分依据的 ABM 设计,学界已有长期讨论;作者另在讨论中列举了历史上模型设定不足所造成的真实危害。LLM 的作用是让“看似言之成理”的仿真变得空前易于生产,从而使这一老问题更为急迫。
- 交付物与用法:量表被转化为一份可填写的核查清单,附录以历史 ABM 逐级示例。作者的期望是:填写量表这一动作本身,能帮助新建模者厘定其仿真的认识论贡献,使目标现象、所作主张与支撑证据三者对齐并被恰当地限定范围。
🧠 IRMaD 思维导图
mindmap
root((大模型社会仿真的机制可信度))
I 引言
大模型社会仿真成为热潮
经典仿真要手写每条规则
大模型似乎能跳过这一步
能生成不等于能解释
两根木棍也能算对乘法
R 问题
这个仿真到底证明了什么
像真人能说明什么
结果是社会知识还是提示词
政策推演该不该被相信
M 方法
移植科学哲学的机制理论
机制须相对于现象才有意义
模型拆成仿真目标意图证据
零级是没有目标的沙盒
一级只有生成充分性
二级加上假设与对照表
三级加上经验证据是梯度
终点因分叉与整体论不可达
量表转成可填写的核查清单
R 结果
三十五篇里二十二篇只看可信度
核心毛病是层级混淆
用主体验证冒充仿真验证
能工作的主体只是必要零件
提示词可以直接逼出结果
不说明就处于现象学含混
a 讨论
一级仿真适合演示与头脑风暴
问政策会怎样就已越界
应急团队怀疑预测但重视启发
仿真出错反而唤起隐性知识
商用接口的隐藏提示损害效度
用模型替代真人有伦理代价
D 结论
诚实回答自己在第几级
说到证据支持的那一步为止
老问题被大模型放大了
读政策仿真先问证据够到哪
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。