arXiv 预印本 · 2026 · DFG 卓越集群 2186 资助 · 514 份人口代表性问卷转化为智能体 · 附伦理声明

从问卷人格到大模型智能体:交通政策偏好动态的生成式智能体仿真

Ali Torkayesh, Julia Offermann, Regina Gimpel 等 6 人 · arXiv 预印本 · 德国研究基金会卓越集群资助 · 2026 · arXiv: 2608.07519
原题:From Survey Personas to LLM Agents: A Generative Agent-based Simulation of Mobility Policy Preference Dynamics
Open Access 新颖度 0.72

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

研究公众对政策的态度,最常用的工具是问卷。问卷能很好地测出某一个时间点上大家怎么想。

但政策态度不是静止的。人们会互相影响,会看到新闻,会随着事情的发展改变想法。用作者的话说,问卷不太适合用来建模态度如何在外部冲击和不断展开的事件中演变

近年来出现了一个新思路:用大语言模型来扮演人,让这些“虚拟人”在模拟环境里互相影响、随事件调整立场,从而观察态度的演变过程。

可这里有一个被普遍忽视的问题。作者指出,现有研究里的虚拟人格大多是研究者手工编造的。而人格设定会强烈影响智能体如何理解情境、如何做决定——如果人格本身是编的,那模拟出来的社会动态又有多少可信度?

论文要解决的就是这个源头问题:不要编人,去用真人

② 研究问题(要回答什么?)

作者明确指出,现有文献中存在两个关键空白。它们分别是:

他们选的案例很有现实分量:德国民众对停止新增燃油车的支持度。这是欧盟净零目标下的一项重大政策,涉及巨大的经济与生活方式调整,争议性强。

具体要观察三件事:支持度随时间怎样演变、智能体在轮次之间如何改变立场、以及不同背景的人反应有何差异。

③ 研究方法(怎么做的?)

整个框架的核心思路是:把每一位真实受访者,翻译成一个用自然语言写成的虚拟人格

第一步 · 问卷设计。研究者没有随便发问卷,而是基于一个成熟的理论框架——整合性公共政策接受度框架(IPAC)来设计问题,确保能覆盖个人层面、情境层面和政策层面的决定因素。调查对象是 18 岁以上的德国普通民众,2025 年夏季进行,由第三方市场调研机构按人口普查代表性招募。经过多步数据清洗,最终 514 份数据用于构建智能体。

第二步 · 造人。每位受访者被转成一个智能体,带上 57 项属性:基本信息(州、年龄、性别、教育、收入)之外,还有 18 项意识形态特征、6 项出行行为、10 项燃料使用经验、18 项环境相关特征。每个智能体用它在问卷里的真实作答作为起点

第三步 · 造世界。所有智能体被放进一个模拟环境。开始时,系统把大家的初始回答汇总,算出全国和各州的支持度分布

第四步 · 跑轮次。每一轮,每个智能体会收到一份结构化的提示,里面包含:自己的人格、自己过去的回答历史、当前全国和本州的支持度分布,以及(在事件情形下)相关外部事件。然后它更新自己的立场。每轮结束后重新汇总,作为下一轮的输入——这就形成了个体决策与集体动态之间的反馈回路

模拟跑 16 轮,每轮代表一个季度,从 2025 年第一季度开始。答案是 1 到 6 分,6 分表示最支持。设了两种情形:基准情形(无外部冲击)和事件情形(引入十个有支持性也有反对性影响的事件)。

有几个技术细节体现了作者的谨慎:使用 GPT-4o mini,温度设为 0 以减少随机波动;提示语同时用德语和英语各跑一遍,专门检验智能体行为是不是被德语措辞驱动的;还对比了“环保导向”和“中性”两种摘要风格;并采用只回看前两轮的有界记忆窗口。

④ 结果(发现了什么?)

结果分两条线:一条是政策态度本身的演变,另一条——也是作者最看重的——是方法本身有多脆弱

普遍向上漂移
四种配置下,支持度
都明显向最高档 6 分集中。
提示语言影响巨大
德语提示导致更决断的一致化
英语提示则保留更多分散。
事件放大了这种敏感性
事件情形下不同配置的
支持度波动范围明显更大

基准情形下的核心发现是:模拟环境制造了一个明显的支持度上移,而不是维持问卷的初始分布。最大的流动来自中间档位,最终汇入最高支持档。这本身就是一个需要警惕的信号——虚拟环境有把人往一起推的倾向。

更值得注意的是配置差异。德语提示配中性摘要产生最强的向 6 分收敛,大多数中间档受访者最后都到了顶格;英语提示配环保摘要仍有明显上移但更分散;英语配中性摘要最为分散,回答比较均匀地铺在 4 到 6 分之间,作者判断这说明锚定更弱、极端整合更少

事件情形下,这种敏感性被进一步放大。德语提示继续产生显著的向顶格集中,说明事件强化了已有的支持立场;而中性摘要和英语提示则把更多质量分配到中间档。作者的总结是:事件设定放大了提示语言与风格的效应

从时间趋势看,基准情形下不同配置之间没有实质差别,都平稳上行;但事件情形下支持度的跨度明显扩大,波动在英语提示下更明显,不过英语情形的最终支持度反而略高于德语。

论文里的几个具体案例比统计数字更有说服力。有一位智能体在环保风格提示下全程保持最高支持,理由是气候关切和个人价值观;但同一个智能体在中性提示下,第三轮就从 6 分掉到 4 分并保持不变。这是同一个“人”,只因为提示措辞不同就产生了持续性的立场差异。

另一个案例展示了模型能捕捉到的合理推理。一位 65 岁、低收入、对政府气候政策抱有怀疑的女性智能体,在看到本州 73.1% 的高支持率后仍下调了支持度,理由是担心禁令会不成比例地影响低收入者,且觉得政府没有充分照顾像她这样的人。

还有一个案例更贴近政策讨论:一位原本中立的智能体在几个支持性事件后升到 5 分,却在遇到“媒体报道低收入和边缘地区家庭可能承担不成比例成本”这个事件后退回中立——它的推理明确提到了公平与分配正义的顾虑。

⑤ 讨论(这些发现说明什么?)

这项研究最有价值的地方,可能不是它对燃油车政策说了什么,而是它对这类方法本身说了什么

作者把提示敏感性作为一项发现而不是一个瑕疵来报告,这一点很值得肯定。他们的表述是:结果显示该框架对提示设计(包括语言、风格和顺序)高度敏感,说明这些选择是仿真设置的重要组成部分;同时这也暴露了一个局限——仿真结果会随配置大幅变化,因此解读结果时必须关注提示的具体设定

这个发现对整个生成式社会仿真领域都有警示意义。如果换一种语言、换一种措辞风格,同一个虚拟人就会给出不同的立场轨迹,那么任何单一配置下跑出来的结论都不能直接当作社会事实。作者的做法——同时跑德英双语和两种风格并把差异摊开——应当成为这类研究的标准配置。

另外那个普遍的向上漂移也值得警惕。模拟环境系统性地把支持度往高处推,而且是从中间档位大规模流向顶格。论文没有把这归因于任何真实的社会机制,这提示它更可能是大模型自身的某种倾向(比如趋向社会认可的答案,或者被反复展示的多数分布所锚定)。这对使用这类工具做政策预测的人是个重要提醒。

从政策研究角度看,那些案例推理确实展现了一些价值。智能体没有简单地跟随多数——那位 65 岁女性在面对本州七成多的支持率时仍然下调立场,理由扣住了自己的收入状况和对政府的不信任。而公平与分配正义这条线索在多个案例中反复出现,恰好呼应了真实世界里燃油车退出争议的核心矛盾。

作者列出的局限相当完整,有七条。最关键的几条是:结果完全依赖底层问卷的质量,问卷的测量误差会直接传导进人格;人格仍然把复杂的人类决策简化成了一段提示和一个有限的评分量表事件情景是人工设计的,未必能覆盖真实政治发展的复杂性和不可预测性;框架没有建模直接的人际沟通或网络结构,智能体只能看到汇总分布;只用了一个模型(GPT-4o mini),换模型可能结果不同;温度设为零,因此完全没有考察随机性的影响

⑥ 结论(最终结论 + 启示)

论文的核心主张是:应当从静态的问卷数据,走向能够捕捉政策偏好如何在变动的社会与政策情境中演变的动态生成式仿真

它交付的具体贡献有三项:一个把问卷受访者转译成大模型智能体的框架;一个在德国燃油车退出这一真实且紧迫的政策议题上的应用;以及一份关于这些智能体如何回应社会情境与外部发展的实证分析。

但真正应该被记住的,可能是那条方法论警告:这类仿真的输出对提示设计高度敏感。同一个虚拟人,换一种语言或换一种措辞风格,就会走出不同的立场轨迹。这意味着用生成式智能体做政策研究时,提示规格必须像实验条件一样被完整报告,结果也必须在多种配置下交叉验证——单一配置的结论不足以支撑政策判断。

作者把自己的工作定位为对计算社会科学与政治学交叉领域的贡献:在一个动态环境里,把一个政治问题与社会接受度分析连接起来

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

欧盟通过 Fit for 55 一揽子方案表达了逐步淘汰新增内燃机(ICE)车辆的强烈承诺,作为其净零转型的一部分。然而公众对此类重大政策变革的反应并非孤立产生:在此类社会与政治复杂系统中,公众反应由互动、反馈以及不断变化的社会、经济、环境与政治情境所塑造。

问卷的方法论局限是本文的出发点:问卷是获取实证证据的主要工具,非常适合测量特定时点的态度,却不适合建模这些态度如何在外生冲击与不断展开的事件下演化

大模型作为生成式智能体为此提供了新可能——它们能对自然语言人格、社会情境与展开中的事件进行推理,从而在静态观察数据之外探索动态偏好形成。但作者指出文献存在两个关键空白:(一)如何从有实证依据的受访者总体而非手工编造的人格来构建大模型智能体;(二)如何用这些智能体研究变动社会情境与外部事件下的动态政策偏好形成。

作者强调这一空白的重要性在于:人格设计强烈塑造智能体如何解读情境与作出决策,因此发展有实证根基的智能体档案是这一尚未充分探索领域中的关键环节。

I. Theoretical Framework & Hypotheses(理论框架与假设)

环节设定理论依据
问卷设计不作为通用工具处理,而基于整合性公共政策接受度框架(IPAC)设计IPAC 提供捕捉个人特定、情境特定、政策特定决定因素与政策接受度的完整结构
人格构建每位受访者 → 一个自然语言人格,编码人口背景、政治取向、出行行为、燃料经验与气候相关态度以实证根基替代手工编造,回应空白(一)
仿真世界GABM 框架:显式仿真环境 + 大模型智能体解读情境并随时间生成决策Ghaffarzadegan 等人的生成式 ABM 框架
反馈机制个体更新 → 汇总为州与全国支持分布 → 作为下一轮输入把偏好形成建模为时间上演化的社会过程,而非仅基于受访者特征的静态预测
因变量“在选举中你会在多大程度上投票给支持此类政策的政党”,1–6 分,6 为最高支持以投票意向测量政策接受度

分析维度:总体支持轨迹随时间的变化、轮次间的偏好切换、以及跨智能体档案的异质性。

M. Materials & Methods(材料与方法)

R. Results(结果)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((问卷受访者变智能体))
    I 引言
      欧盟推动燃油车退出
      问卷只能测某一时点
      难以建模态度如何演变
      现有虚拟人格多为手工编造
      人格设定强烈影响决策
    R 空白
      如何从真实受访者造智能体
      如何研究动态偏好形成
      案例选德国燃油车退出
    M 方法
      依 IPAC 框架设计问卷
      人口代表性招募 清洗后 514 份
      每人转成 57 项属性人格
      以问卷原始作答为起点
      汇总出州与全国支持分布
      十六轮 每轮一个季度
      基准情形与十个事件情形
      德英双语与两种风格对照
      温度设零 记忆只回看两轮
    R 结果
      支持度整体向最高档移动
      最大流动来自中间档
      德语中性提示收敛最强
      英语中性提示最为分散
      事件放大了提示效应
      英语下波动更明显
      同一智能体换风格即改立场
      六十五岁女性顶住多数压力
      公平议题令支持者退回中立
    a 讨论
      提示敏感性既是发现也是局限
      结果随配置大幅变化
      上移可能源自模型倾向
      未建模人际沟通与网络
      事件情景为人工设计
      仅测一个模型且无随机性
    D 结论
      从静态问卷走向动态仿真
      提示规格须完整报告
      单一配置不足以支撑政策判断

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。