本次抓取共 9 篇 · run_id: run_2026-09-14_001
为啥做:政府越来越常用行为科学的办法来引导人们的日常选择,但老百姓到底愿不愿意接受这些办法,研究得还不够细。 要干啥:这篇研究想知道,美国公众更愿意支持替人设好默认选项的助推,还是组织大家坐下来讨论的思考型政策,以及对政府的信任在其中起什么作用。 咋整的:作者请专业调查公司 Qualtrics 在网上招募了 3,010 名美国成年人,按年龄、性别、族裔和地区做配额抽样,让样本尽量像美国成年人口。 发现了啥:总体来看,人们明显更支持组织讨论的思考型政策,而不是替人设好默认选项的助推,尽管大家觉得两者的效果差不多。 作者认为:这说明,“管不管用”并不是老百姓评判政策的唯一标准。 结论:这项研究的结论是,政府想用行为科学的办法做政策时,不能只看办法灵不灵,还要看公众信不信任政府、议题争议大不大。
为啥做:美国行政机关每年裁决的案件比所有联邦法院加起来还多,而这些关系到移民、残障人士、退伍军人和福利申请人的裁决常常又慢又容易出错。 要干啥:这项研究想弄清楚,给失业保险审核员配一个会写追问问题的人工智能助手,到底能不能让审核更快、更好、更一致。 咋整的:所有数据都锁在科罗拉多州劳工与就业厅自己的安全云环境(作者叫它「沙盒」)里,个人信息不出门。 发现了啥:试验结果出人意料:审核员都说这个工具好用,但和不用工具的对照组相比,写问卷既没有更快,质量也没有更高。 作者认为:这篇论文最值得记住的,是它揭示了三把评估尺子会给出不同答案。 结论:这项研究最重要的结论是,评估政府里的人工智能不能只看用户满意度或者跟历史比,必须做有对照组的真实情境试验。
为啥做:在美国,失业的人可以领取失业保险金,但如果长期找不到工作,不仅手头吃紧,身心健康乃至下一代的收入都会受到拖累。 要干啥:这项研究想弄清楚,罗德岛州把失业者点名进再就业服务项目,到底能不能让他们挣得更多、更快回到岗位、少领失业金。 咋整的:作者用的是评估项目最硬核的办法——抽签实验,而且分析计划在动手之前就公开登记在开放科学平台上。 发现了啥:结果很清楚,被抽中进入这个项目的失业者工资更高、再就业更多、领失业金的时间也更短,三项预先登记的结果全部显著。 作者认为:这项研究说明,一封要求必须来见面的信加上顾问面谈,在疫情后的新环境里依然能同时帮到失业者和州财政。 结论:罗德岛州这次大型抽签实验给出了强有力的证据,被选入再就业服务项目能提高工资和再就业率、缩短领失业金的时间,还能替州政府省钱。
为啥做:很多德国地方报纸已经不再完全靠编辑手动往脸书上发新闻,而是把挑稿、定时和发帖交给一种人工智能自动发布工具来完成。 要干啥:这项研究想弄清楚,报社把发帖交给人工智能工具之后,脸书上的新闻是不是变得更少谈政治、更爱用情绪化的字眼、也更能吸引互动。 咋整的:作者用 Meta 公司的数据工具 CrowdTangle 里预设的“德国地方媒体”名单,收集了 44 家德国地方和区域新闻媒体在 2018 年到 2023 年间…… 发现了啥:结果和研究者原本的担心正好相反,交给人工智能工具发布的新闻帖并没有变软,反而略微更常谈政治。 作者认为:这说明,“机器一上岗,新闻就变软”的直觉并不成立,至少在“人机合作”的模式下不成立。 结论:这篇研究的结论是,只要编辑仍然把关,人工智能自动发布工具并没有让德国地方新闻在脸书上变得更软。
为啥做:越来越多的人会在短视频平台上查健康信息,包括琢磨身体的异常症状和纠结要不要接受治疗。 要干啥:这篇论文想弄清楚的是,在 TikTok 搜索里,用户提问的方式会不会系统性地影响自己接触到多少乳腺癌错误信息。 咋整的:作者用的办法叫“傀儡账号审计”,有点像消费者协会派“神秘顾客”去门店暗访:研究者自己注册一批全新的账号,让程序按事先写好的剧本去搜索,再把平台返回的内容原样记下…… 发现了啥:结果非常醒目:带着替代医学倾向去搜,搜到的癌症相关视频里有一半多被判为可能的错误信息。 作者认为:这项研究最巧妙的地方,是用“病友故事型”问法做了一个对照。 结论:这项研究说明,在 TikTok 上搜乳腺癌信息时,你怎么提问,在很大程度上关系到你会碰到多少错误信息。
为啥做:在社交媒体上,一条帖子排在信息流的第几位,很大程度上决定了有多少人能看到它。 要干啥:这篇研究想弄清楚,两个不同的人发出一字不差的同一条帖子时,同一个信息流会不会给他们同样多的曝光。 咋整的:作者的做法可以想象成定时给一块块排行榜拍照,再在照片里找“双胞胎帖子”比名次。 发现了啥:研究发现,内容完全相同的帖子得到的曝光常常差得很远,大约每三组里就有一组是一份上了榜、另一份却完全没出现。 作者认为:这些结果最值得琢磨的地方是:问题不出在内容上。 结论:这项研究的结论是,平台上有成千上万个可选的信息流,并不能保证说同一句话的人都能被同样看见。
为啥做:德国想在二〇四五年让建筑实现气候中和,而这件事最终取决于成千上万个房主各自决定何时翻修、换什么暖气。 要干啥:这篇论文想弄清楚,把房主之间的差别和法规条文真实地装进模型之后,政策评估和电网规划的结论会不会跟着改变。 咋整的:作者搭了一个叫 AgentHomeID 的“虚拟德国住房世界”,它是一个基于主体的模型(ABM):每一栋楼都配一位“房主小人”(智能体),各自按自己的脾气做决定…… 发现了啥:三个尺度的模拟都表明,房主类型、收入高低和当地条件会实实在在地改变供暖转型的走向。 作者认为:这些结果说明,同一条政策落到不同的人身上,效果可以完全不同。 结论:作者的结论是,用于政策评估和基础设施规划的模型必须把不同房主和地方结构明确地表示出来。
为啥做:网上的人为什么会分裂成互不来往的阵营,一群人又在什么时候能比单个人更聪明,这两个问题过去一直是分开研究的。 要干啥:这篇论文想弄清楚,一个线上社会里成员的性格搭配,会不会同时影响观点极化和集体智慧,两者又是不是此消彼长。 咋整的:可以把这项研究想象成:在电脑里一共开了 991 个「迷你社交平台」,每个平台住着 100 个由大语言模型扮演的用户,这是一种基于主体的仿真(ABM),而不是用方…… 发现了啥:性格越多样的社会,观点越分散,却越少抱团成回音室,而性格整齐划一的社会反而像一团和气的回音室。 作者认为:这项研究最重要的提醒是:「极化」其实是两件事。 结论:性格搭配确实同时塑造了线上社会的极化方式与集体表现,但降低极化并不需要以牺牲集体智慧为代价。
为啥做:政府每推出一项新政策,都想提前知道老百姓会怎么反应,可这件事一直很难算准。 要干啥:这篇论文想回答的是,能不能让大模型扮演一个个虚拟居民,拼成一个会对政策作出反应、而且能用真实数据检验的“数字人群”。 咋整的:整个做法可以想象成“请十位演员演一座城市”。 发现了啥:在疫情期间阿联酋的真实出行数据上,这个数字孪生的整体预测误差比常用的统计模型低了约两成。 作者认为:这些结果说明,大模型当“大脑”并不是在所有事情上都更聪明,而是在“需要理解政策含义”的事情上更聪明。 结论:这篇论文的结论是,让大模型扮演虚拟居民、再用真实数据校准,是一条可行的政策模拟新路,但目前还只是一个小规模的原型验证。
面向跨领域硕博研究生和学者,用 B 站 / YouTube 长视频文案的口吻,一口气讲清今天目录里的内容。
如果把今天这批论文放在一支长视频里,我会先抛出一个问题:这些研究到底在帮我们重新理解什么?这一期论文雷达不做公式推导,也不堆术语,而是用尽量直白的话,把目录里的线索串成一条可以听下去的脉络。你可以把它当作正式阅读前的导览,先判断哪几篇最值得点开。
接下来这篇来自公共管理与公共政策方向的研究,题目可以先理解为《助推还是思考:公民对行为公共政策的支持与政府信任——来自两项在线实验的证据》。政府越来越常用行为科学的办法来引导人们的日常选择,但老百姓到底愿不愿意接受这些办法,研究得还不够细。这篇研究想知道,美国公众更愿意支持替人设好默认选项的助推,还是组织大家坐下来讨论的思考型政策,以及对政府的信任在其中起什么作用。总体来看,人们明显更支持组织讨论的思考型政策,而不是替人设好默认选项的助推,尽管大家觉得两者的效果差不多。这项研究的结论是,政府想用行为科学的办法做政策时,不能只看办法灵不灵,还要看公众信不信任政府、议题争议大不大。
接下来这篇来自公共管理与公共政策方向的研究,题目可以先理解为《生成式AI进失业金审核:用户好评、胜过历史,却没跑赢对照组》。美国行政机关每年裁决的案件比所有联邦法院加起来还多,而这些关系到移民、残障人士、退伍军人和福利申请人的裁决常常又慢又容易出错。这项研究想弄清楚,给失业保险审核员配一个会写追问问题的人工智能助手,到底能不能让审核更快、更好、更一致。试验结果出人意料:审核员都说这个工具好用,但和不用工具的对照组相比,写问卷既没有更快,质量也没有更高。这项研究最重要的结论是,评估政府里的人工智能不能只看用户满意度或者跟历史比,必须做有对照组的真实情境试验。
接下来这篇来自公共管理与公共政策方向的研究,题目可以先理解为《罗德岛州自我维持型再就业服务与资格评估(RESEA)项目对就业结果的影响评估》。在美国,失业的人可以领取失业保险金,但如果长期找不到工作,不仅手头吃紧,身心健康乃至下一代的收入都会受到拖累。这项研究想弄清楚,罗德岛州把失业者点名进再就业服务项目,到底能不能让他们挣得更多、更快回到岗位、少领失业金。结果很清楚,被抽中进入这个项目的失业者工资更高、再就业更多、领失业金的时间也更短,三项预先登记的结果全部显著。罗德岛州这次大型抽签实验给出了强有力的证据,被选入再就业服务项目能提高工资和再就业率、缩短领失业金的时间,还能替州政府省钱。
接下来这篇来自计算传播学方向的研究,题目可以先理解为《AI 自动发布进入社交媒体新闻:脸书上的新闻正在变“软”吗?》。很多德国地方报纸已经不再完全靠编辑手动往脸书上发新闻,而是把挑稿、定时和发帖交给一种人工智能自动发布工具来完成。这项研究想弄清楚,报社把发帖交给人工智能工具之后,脸书上的新闻是不是变得更少谈政治、更爱用情绪化的字眼、也更能吸引互动。结果和研究者原本的担心正好相反,交给人工智能工具发布的新闻帖并没有变软,反而略微更常谈政治。这篇研究的结论是,只要编辑仍然把关,人工智能自动发布工具并没有让德国地方新闻在脸书上变得更软。
接下来这篇来自计算传播学方向的研究,题目可以先理解为《怎么问就搜到什么:TikTok 搜索中乳腺癌错误信息的傀儡账号审计》。越来越多的人会在短视频平台上查健康信息,包括琢磨身体的异常症状和纠结要不要接受治疗。这篇论文想弄清楚的是,在 TikTok 搜索里,用户提问的方式会不会系统性地影响自己接触到多少乳腺癌错误信息。结果非常醒目:带着替代医学倾向去搜,搜到的癌症相关视频里有一半多被判为可能的错误信息。这项研究说明,在 TikTok 上搜乳腺癌信息时,你怎么提问,在很大程度上关系到你会碰到多少错误信息。
接下来这篇来自计算传播学方向的研究,题目可以先理解为《一字不差,谁被排上榜:Bluesky 自定义信息流中同文帖子的曝光差距》。在社交媒体上,一条帖子排在信息流的第几位,很大程度上决定了有多少人能看到它。这篇研究想弄清楚,两个不同的人发出一字不差的同一条帖子时,同一个信息流会不会给他们同样多的曝光。研究发现,内容完全相同的帖子得到的曝光常常差得很远,大约每三组里就有一组是一份上了榜、另一份却完全没出现。这项研究的结论是,平台上有成千上万个可选的信息流,并不能保证说同一句话的人都能被同样看见。
接下来这篇来自仿真方法-ABM_SD_DES方向的研究,题目可以先理解为《谁翻修、谁拿补贴:AgentHomeID 多尺度智能体模型推演德国建筑存量转型》。德国想在二〇四五年让建筑实现气候中和,而这件事最终取决于成千上万个房主各自决定何时翻修、换什么暖气。这篇论文想弄清楚,把房主之间的差别和法规条文真实地装进模型之后,政策评估和电网规划的结论会不会跟着改变。三个尺度的模拟都表明,房主类型、收入高低和当地条件会实实在在地改变供暖转型的走向。作者的结论是,用于政策评估和基础设施规划的模型必须把不同房主和地方结构明确地表示出来。
接下来这篇来自仿真方法-ABM_SD_DES方向的研究,题目可以先理解为《心智多元,网络分裂?大模型社会仿真中的人格构成、极化与集体智能》。网上的人为什么会分裂成互不来往的阵营,一群人又在什么时候能比单个人更聪明,这两个问题过去一直是分开研究的。这篇论文想弄清楚,一个线上社会里成员的性格搭配,会不会同时影响观点极化和集体智慧,两者又是不是此消彼长。性格越多样的社会,观点越分散,却越少抱团成回音室,而性格整齐划一的社会反而像一团和气的回音室。性格搭配确实同时塑造了线上社会的极化方式与集体表现,但降低极化并不需要以牺牲集体智慧为代价。
接下来这篇来自仿真方法-ABM_SD_DES方向的研究,题目可以先理解为《大模型驱动的社会数字孪生:模拟人群对政策干预行为反应的框架》。政府每推出一项新政策,都想提前知道老百姓会怎么反应,可这件事一直很难算准。这篇论文想回答的是,能不能让大模型扮演一个个虚拟居民,拼成一个会对政策作出反应、而且能用真实数据检验的“数字人群”。在疫情期间阿联酋的真实出行数据上,这个数字孪生的整体预测误差比常用的统计模型低了约两成。这篇论文的结论是,让大模型扮演虚拟居民、再用真实数据校准,是一条可行的政策模拟新路,但目前还只是一个小规模的原型验证。
所以,今天这期的重点不是记住每篇论文的所有细节,而是先抓住它们共同暴露出来的问题意识。先从最贴近你研究方向的一篇打开,再回头横向比较其他领域怎么提问、怎么组织证据,往往会更容易找到真正有启发的部分。