arXiv 预印本 · 2026-09-04 · CHFS 等五套全国住户调查 · 代码开源

大模型能预判民众对社会政策的行为反应吗?以中国灵活就业人员的养老保险参保决策为例

Yumiao Li, Peixin Liu, Donglin Di 等 5 人 · arXiv (cs.CL) · 2026 · arXiv: 2609.05189
原题:Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers
Open Access 新颖度 0.74

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

假设政府准备调整一项养老保险政策,比如把最低缴费门槛降低一点,或者多给一笔补贴。在真正执行之前,怎么知道老百姓会不会因此多参保?

传统上有两条路,但都不太好走。第一条是用统计模型去拟合历史数据,问题是历史里从来没发生过这个新政策,模型往那外面推的时候常常不靠谱。第二条是先在某个地区搞试点,看效果再推广——这条路可靠,但太贵、太慢。

这篇论文研究的对象是中国的灵活就业人员,也就是外卖骑手、网约车司机、临时工、自由职业者这类人。根据文中引用的数据,这个群体已经超过 3 亿人。他们的养老保险有个特点:参不参加是自愿的。而且不只是参不参加的问题,还得选:一种是城镇职工基本养老保险,待遇高,但灵活就业者得自己承担全部缴费;另一种是城乡居民养老保险,便宜得多,但待遇也低。

所以这是一个两层的决定:先决定要不要参加,参加了再决定选哪一种。作者想知道:大语言模型能不能学会预测这种决定?

② 研究问题(要回答什么?)

论文要回答的核心问题是:能不能把一个通用的大模型改造成专门的政策评估工具,让它像一个懂政策的分析员那样,逐个预测灵活就业者会怎么选?

但作者很清楚现成的大模型有毛病。已有研究发现,直接拿来用的大模型有三个通病:规则用得很表面,只是嘴上提一下政策却没真算;有理性人偏见,总假设人是精打细算的经济人;结果不稳定,换个说法问,答案就变了。

于是问题被细化成三个:第一,怎么把政策规则和经济学的研究结论真正塞进模型的思考过程里?第二,怎么让一个较小的开源模型学会这套推理,而不是每次都去调昂贵的顶尖模型?第三,模型给出的理由,能不能被人工核对,而不是一个黑箱?

③ 研究方法(怎么做的?)

作者的主数据是 2019 年中国家庭金融调查,从中构建了 15672 个灵活就业者样本,其中参保的 8842 人(56.4%),未参保的 6830 人(43.6%)。为了检验模型换个数据还灵不灵,他们还额外从另外四套调查里各抽了 500 个样本。

方法叫 DKI-RDistill,可以拆成三步来理解。

第一步叫“领域知识注入”。作者先用经典的计量模型跑一遍数据,看清楚哪些因素真正影响参保决策,再把这些结论翻译成模型看得懂的提示。他们特意造了三个很聪明的指标。其中最关键的是“负担比”——把当地规定的最低缴费金额,除以这个人能拿得出来的最强财力信号。这就把抽象的“贵不贵”变成了一个具体数字。他们还手工收集了各省市的养老政策文件,按户籍省份逐个匹配。

第二步叫“理由蒸馏”,这一步的设计最有意思。他们先让一个强模型(Claude Sonnet 4.5)当老师,对每个案例给出预测和理由。老师答对的,理由直接留用;老师答错的,就把正确答案告诉它,让它重新写一遍理由。这样学生就不会去模仿老师的错误结论。在训练池里,88.9% 的样本是老师答对直接留用的,11.1% 是重新生成的。

第三步是训练学生。学生是开源的 Qwen 3.5-35B-A3B,用一种叫低秩适配的省钱办法微调——冻住原模型的大部分参数,只训练一小块。

④ 结果(发现了什么?)

在一个从头到尾没被碰过的盲测集上,这个专门改造过的模型,成绩排到了十八个参评系统里的第三名。具体来说,盲测集有 2350 个案例,模型的综合 F1 达到 0.9316

比未微调的自己
+0.1445
提升巨大
比它的老师
+0.0107
青出于蓝
比 17 个对手
显著胜出 15 个
换四套新数据
平均 0.7549
波动最小

最值得说的一点是:学生超过了老师。老师 Claude Sonnet 4.5 的成绩是 0.9209,学生是 0.9316。这不是常见现象,作者认为原因就在那个“错例重生成”的设计——学生学到的是被纠正过的推理,而不是老师的原样复制。

换到另外四套完全不同的调查数据上,模型的平均分是 0.7549,虽然不是最高,但波动范围最窄(0.7471 到 0.7687)。相比之下,成绩更高的 Claude Opus 4.6 波动区间要宽得多。对政策工具来说,稳定往往比偶尔的高分更重要。

拆开看哪一步最有用:把政策提示加给老师模型,成绩提升了 0.0668;错误分析显示,这一步直接把盲测错误砍掉了大约一半(从 468 个降到 246 个)。

还有一个很生动的边界案例。案例 A 是一位 44 岁的临时工女性,个人年收入只有 3000 元——单看收入,任何模型都会猜她不参保。未微调的模型确实猜错了。但改造后的模型注意到了另外两件事:她家有 214 万元资产,居民养老的负担比只有 0.03%;而且她已经连续缴了 14 年,再缴一年就到 15 年的领取门槛了。于是模型正确预测了她会继续参保。

最后是人的评价。27 位有经济学、公共管理或保险背景的专家做了盲评,在 324 次选择里,有 157 次(48.5%)认为这个模型的理由最可信,高于老师模型的 36.1%。

⑤ 讨论(这些发现说明什么?)

这项研究真正有意思的地方,不在于分数高,而在于它提出了一种新的政策分析工具形态

传统的统计模型告诉你“平均来说收入每高一万元,参保概率上升多少”——这是群体层面的规律。但政策制定者常常需要知道的是另一件事:某一类具体的人,在某个具体省份的具体规则下,会怎么选?而这恰恰是拟合方程不擅长的,因为收入波动、家庭支持、户籍限制、缴费负担这几个因素是纠缠在一起起作用的。

另一个值得注意的设计取向是可核查性。模型不只给出一个预测标签,还给出一条结构化的推理轨迹:第一步看缴费历史,第二步看家庭示范效应,第三步算负担比,第四步看户籍和流动性。这条轨迹可以被人对照政策条文逐条检查。作者反复强调,这套系统的定位是群体层面的政策模拟和决策支持,不是给某个具体的人做参保建议——这个边界划得很谨慎。

不过局限也很明显。模型学到的是 2019 年前后的行为模式,如果制度发生结构性变化,它凭什么还准?作者用四套外部调查做了迁移检验,但那些依然是同一时代的中国数据。真正的“反事实外推”能力,其实还没有被完整验证。

⑥ 结论(最终结论 + 启示)

这篇论文的结论可以概括成一句话:经过政策知识改造的大模型,可以成为一种介于统计模型和真实试点之间的新型政策评估工具。

它的三项贡献分别是:造出了第一个针对中国灵活就业人员参保决策的专用模型;提出了一套把计量先验、地方政策规则和纠错式理由监督连起来的方法;并用盲测、跨数据集迁移、消融实验、边界案例和专家盲评做了多角度验证。

对公共管理的启示更值得琢磨。过去我们评估政策,要么依赖平均效应,要么依赖昂贵的试点。这类工具提供了第三条路:在政策落地前,先在虚拟人群上跑一遍,看看不同缴费门槛、不同补贴设计会把哪些人推进来、把哪些人挡在外面。

但要用好它,有一个前提不能忘:模型的可信不来自分数,而来自它的理由能不能被检查。这也是这篇论文最值得借鉴的取向——它没有把大模型当成一个更准的黑箱,而是努力让它变成一个可以被追问的分析员。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

事前评估社会政策的行为后果是治理的基础难题。计量方法擅长识别关联,但在向反事实政策情景外推时可靠性有限;大规模区域试点则成本高昂。这一张力构成了“个体层面政策响应模拟”的方法论需求。

作者将该问题实例化于中国灵活就业人员的养老保险参保决策:该群体规模已超过 3 亿(Guo 2026;国务院办公厅 2020),且因参保自愿而形成一个天然的层级决策结构——先决定是否参保,参保后再在城镇职工基本养老保险(待遇高但灵活就业者需自担全部缴费)与城乡居民养老保险(可负担但待遇低)之间选择(Yang 2022)。既有文献已记录持续的覆盖缺口、异质性参保选择,以及参保不足与转移接续摩擦带来的福利损失(Qian & Wen 2021; Ma et al. 2024; Liu, Liu & Jiang 2022)。

本文的三项贡献:其一,提出 FlexPension-LLM,首个针对该层级参保预测任务的领域专用语言模型;其二,提出 DKI-RDistill 框架,把计量先验、户籍省份养老政策规则与错误过滤的理由监督连成一条通路,产出结构化、可核查的决策轨迹;其三,以盲测、四套外部调查、消融、稳健性检验、边界案例与专家盲评做多角度验证。

I. Theoretical Framework & Hypotheses(理论框架与假设)

作者不提出因果假设,而是把参保决策组织为四类政策可及的行为机制,并要求模型的推理轨迹显式经过它们。这一设计本身就是理论框架:它把“大模型能不能预测”这个技术问题,转译成“政策杠杆是否被显式表征”这个可检验的问题。

机制实证基础注入的提示线索在预测中的角色
可负担性(affordability)Probit 模型中收入与资产的平均边际效应居民养老负担比、职工养老负担比把地方最低缴费要求转换为个体可承受度
家庭影响(household influence)家庭参保与领取养老金产生方向相反的效应家庭养老金依赖度、家庭参保人数与领取人数区分示范效应与替代效应
路径依赖(path dependence)缴费年限编码延续激励连续缴费年限、中断状态捕捉现状依赖与临近 15 年门槛的延续动机
制度可及性(institutional access)户籍与教育解释制度分选户籍省份养老政策参数、流动状态约束可选渠道的制度边界

标签体系为两层结构:参保行动 → (条件于参保)险种选择,最终形成三个终端标签:不参保 / 居民养老保险 / 职工养老保险

M. Materials & Methods(材料与方法)

R. Results(结果)

模型盲测 Action盲测 Type盲测 Comp.外部均值外部区间Δ 盲测
Qwen-ZS(未微调基座)0.83780.71100.78710.63780.5962–0.7264+0.1445
Claude Sonnet 4.5(教师)0.91590.92840.92090.69540.6678–0.7158+0.0107
Correct-only SFT(消融)0.92580.94920.93520.73780.6883–0.7658−0.0036
Claude Opus 4.60.93550.93840.93670.77240.7397–0.7953−0.0051
Gemini 3.1 Pro Preview0.90810.90580.90720.76310.7229–0.7951+0.0244
Claude Sonnet 4.60.90360.92480.91210.73240.7034–0.7570+0.0195
FlexPension-LLM0.92710.93830.93160.75490.7471–0.7687

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((大模型预测参保决策))
    I 引言
      政策事前评估难题
      计量外推不可靠
      试点成本高昂
      三亿灵活就业人员
    R 任务设定
      两层决策结构
      先定参不参加
      再选居民或职工
      三个终端标签
    M 方法
      领域知识注入
      负担比与家庭依赖度
      教师错例按真值重写
      开源模型低秩微调
      盲测集全程隔离
    R 结果
      盲测综合分零点九三
      显著超过自己的老师
      跨四套调查波动最窄
      政策提示砍掉一半错误
      专家信任近五成
    a 讨论
      标签管边界理由管迁移
      稳定性比峰值更重要
      决策轨迹可对照政策条文
      定位是群体模拟非个体建议
    D 结论
      介于模型与试点的第三条路
      可信来自理由可核查
      结构性变迁外推待验证

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。