arXiv 预印本 · cs.CL / cs.CY / cs.SI · MIT 团队 · MacArthur 基金会与 MIT MGAIC 资助 · 首个真实平台大规模智能体审计

用 AI 智能体大规模自动化个性化算法的黑箱审计

Alessandro Morosini, Sarah H. Cen, Andrew Ilyas 等 6 人 · arXiv preprint · 2026 · DOI: 10.48550/arXiv.2606.30801 · arXiv: 2606.30801
原题:Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale
Open Access 新颖度 0.88

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

平台推荐算法决定了你每天刷到什么内容,但外部研究者几乎看不到它的内部构造,只能从外面观察它的输入与输出。

你有没有想过这样一件事:同样打开一个社交平台,为什么你和你同学刷到的东西完全不一样?这背后是一套个性化算法。它会根据你是谁(年龄、性别、住在哪)、你做过什么(点过赞、关注过谁、看过哪些评论),不断调整往你眼前推什么。

问题是,这套算法几乎没人能从外面看清。公司把它当商业机密,代码、训练数据、用户日志统统不对外。美国国会已经多次把 Meta、亚马逊、谷歌等公司的负责人叫去听证,追问算法到底在怎么影响人们看到什么、相信什么。但监管者和学者能拿到的,通常只有黑箱访问:给它喂一批输入,看它吐出什么,中间的过程一概不知。

更麻烦的是,个性化算法不像一台固定的机器。它不是「同一个问题总给同一个答案」,而是会随着你的使用不断变形——它推给你的内容会影响你的下一次点击,你的点击又会影响它下一次推什么,形成一个转不停的反馈回路。这意味着要审计它,就得穷举「什么样的人、做过什么事、看过什么内容」的全部组合,这在现实中根本做不到。

过去审计这类算法主要有两条路,各有各的死穴。第一条是招真人:找一批志愿者,看算法怎么对待他们。真实性没问题,但招人贵、样本受限(想研究的那类人可能招不到),而且每个真人都带着自己的历史和偏好,研究者分不清结果是算法造成的还是这个人本来就这样。第二条是用「马甲号」(研究者自己控制的假账号):便宜、可控,但过去的马甲号靠写死的脚本操作,行为「很平」,一眼假,得出的结论也就不好推广。

而且这两条路都有一个共同的硬伤:分不开「你是谁」和「你做了什么」。真人身上这两者天生绑在一起;脚本马甲号的「人物设定」本身就是靠写死的行为来实现的,等于把身份和行为焊在了一起。于是所有既有审计都只能回答「不同人看到的东西不一样」,却回答不了「算法到底是在响应我的身份标签,还是在响应我的行为」。这篇论文就是来拆开这一对的。

② 研究问题(要回答什么?)

这项研究想弄清楚一件事,那就是在只能从外部观察的条件下,如何把平台个性化算法的审计同时做到大规模和可控。

顺着这个总问题,作者把它拆成了三层:

第三层是这篇论文最独特的地方。它问的是一个反事实问题:「如果这个人还是这个人、行为一模一样,只是在平台眼里更老一点,算法会怎么待他?」这种问题在真人研究里永远问不清,因为你不可能让同一个人既是二十五岁又是五十五岁。

③ 研究方法(怎么做的?)

作者的办法可以这样理解:造一批「有灵魂的马甲号」,再给它们做双胞胎对照实验

第一步,造人设。研究者写了十四份「人物设定」,每一份都是一段自然语言描述:多大年纪、什么性别、住在哪座城市、什么种族、读到什么学历、政治上属于哪一类。这些属性不是拍脑袋编的,而是照着美国人口普查局的真实人口分布抽样,再乘上皮尤研究中心测到的各年龄段社交平台使用率。政治立场则直接用皮尤的九类政治类型学——从最右的「信仰与国旗保守派」一路排到最左的「进步左派」。

第二步,把人设交给大模型当「大脑」。每看到一条推文,系统就把这条推文连同人设描述一起发给大模型,让它以这个人的身份决定:点赞、关注作者、点开评论看看,还是划过去。温度参数设成零,意思是「同样的输入尽量给同样的反应」,保证同一个人设的所有账号行为一致。这跟老式马甲号的根本区别是:它不是按写死的脚本动作,而是真的读懂内容再决定怎么反应

第三步,做双胞胎。每个人设造八十个账号,随机分成四组各二十个。第一组是基准;第二组只把显示给平台的位置换成另一个州;第三组只把年龄换到另一个年龄段;第四组只把性别换掉。关键在于:四组账号的「大脑」用的是完全同一份人设描述,行为方式一个字都没改,改的只有平台能看到的那一个标签。这就像做药物实验时,两组人各方面都一样,只有吃的药不同——差异就只能归因于那一个变量。

怎么让平台「看到」这些标签?年龄靠注册时填的出生日期;性别靠显示名(用大模型按人设生成的姓名池);位置靠住宅代理服务把流量路由到目标州的真实住宅网络地址。

第四步,放到真平台上跑。时间选在 2024 年美国总统大选投票日当天到之后的第二十四天——这是政治话题最沸腾的时候。每个账号每天上线八次,四次刷算法推荐流、四次刷按时间排序的关注流,每次约十分钟,上线时间随机打散。浏览器由自动化工具驱动,看到的就是普通用户看到的页面。

第五步,给刷到的内容打标签。毒性用一个现成的开源检测库打分;政治性和极化程度因为现成模型在选举期数据上表现太差,作者自己搭了一条大模型标注流水线,让模型先讲理由再下结论,并拿两百条人工标注的推文做过校验。

还有两件事必须做:防封号——动作之间插入延迟、代理地址跟人设位置对齐、注册时间错开、上线时间随机;伦理合规——机构审查委员会批了豁免,前提是这些账号只对已有内容做反应,绝不自己发帖,因此不会污染真实用户的体验;研究团队还专门找了法律诊所核实做法的合法性。

④ 结果(发现了什么?)

结果显示,算法推荐的信息流比按时间排序的信息流,明显多推毒性内容、极化内容、政治内容和右倾内容。

先看总体。同一个账号,刷算法流和刷时间流,看到的东西差多少?

① 毒性内容涨得最多
算法流里毒性内容的占比比时间流高出 39.2%(置信区间 14.4% 到 69.7%)。时间流里这类内容本来只占 3.9%
② 撕裂性内容紧跟其后
把不同群体摆成道德对立的「极化内容」放大了 32.3%(23.7% 到 41.6%),基准占比 14.0%
③ 右倾涨、左倾不涨
右倾内容放大 23.3%;左倾内容是 −6.1%,而且置信区间跨过零,等于没有被放大
④ 政治内容绝对量最大
放大 14.2%,看着不多,但时间流里政治内容本来就占 38.0%,所以多出来的绝对数量是所有类别里最大的。

但真正惊人的是按用户立场分开看。平均数把两群人完全不同的处境糊成了一团:

再看反事实那一半:光改身份标签有用吗?把全部人设合在一起算平均,答案几乎是「没什么用」——十八个待检验的效应里只有两个显著:把年龄显示得更老,算法多塞的毒性内容增加约 0.8 个百分点;把位置换到更城市化的州,算法多塞的极化内容减少约 1.6 个百分点。而且这两个结果在做了多重检验校正之后就不再显著了。性别对任何指标都没有显著影响。

可「平均没用」不等于「算法不看标签」。作者把每个人设单独拿出来算,结果六个指标的联合检验全部拒绝了「效应处处为零」的假设,而且校正后依然成立。真相是:同一个标签改动,对不同人设的作用方向是反的——对这个人设推得更多,对那个人设推得更少,一平均就互相抵消成了零。在两百五十二个人设级系数里,有二十六个显著,大约是纯靠碰巧应该出现的数量的两倍。

这条发现有很强的方法论警示意义:只看平均值的审计,会漏掉专门针对某些特定人群的算法歧视

⑤ 讨论(这些发现说明什么?)

这项研究的分量,一半在「发现了什么」,另一半在「用什么方法发现的」。两半都值得说。

先说方法这一半。过去做算法审计,你只能在「真实」和「可控」之间二选一:要真实就招真人,但你控制不了他们是谁、做过什么;要可控就用脚本机器人,但它一眼假,算法未必当它是人。这篇论文把两者同时拿到了手——人设来自真实人口数据,行为由大模型即时判断因而足够像人;同时,因为「行为」整整装在一段提示词里,研究者可以在行为完全不动的前提下,单独把平台能看到的标签换掉。这是老办法结构上做不到的。

有一个容易被误解的点值得讲清楚。有人会问:大模型又不是真人,它扮演的「五十岁保守派」能算真的吗?作者的回答很讲道理:这套方法的有效性并不依赖大模型演得像真人。它只需要两件事:一是同一个人设的所有账号行为完全一致(这样组间差异才能归因于标签),二是行为真实到足以触发平台的个性化机制(不然算法不会把它当人对待)。至于大模型自带的偏见,在「同人设组间相减」这一步里会被抵消掉——因为两组用的是同一份提示词,偏见是同一份,减掉就没了。

他们也确实拿数据证明了行为足够像人:账号在约六成三的推文上做出了主动动作,远高于提示词里「每五条至少动一次」暗示的下限;四个实验组的活跃度几乎一模一样,统计上的差异小到可以忽略;账号的存活天数在四组之间也没有系统差异,说明不是某一组更容易被平台封掉从而扭曲了结果。

再说发现这一半。最值得琢磨的不是「算法放大毒性」这个已经被说过很多次的结论,而是放大的分布极不均匀。左倾用户吃掉了几乎全部的毒性放大;右倾用户则住在一个两头都被修饰过的房间里——合口味的抬上来,不合口味的压下去。这两种伤害不一样:前者是「被迫看到让人难受的东西」,后者是「看不到另一半世界」。如果只报一个总平均数,这两种伤害都会消失不见。

还有一层更深的方法论含义。作者做了一个漂亮的稳健性检验:把放大倍数按「只看第一天」「只看第一周」「只看前两周」「看全程」分别算一遍。如果两条信息流之间存在相互污染(在一条流上点赞影响了另一条流的推荐),那么随着账号使用变久,两条流应该越来越像,放大倍数应该一路往下掉。实际结果是:第一周之后数字就稳住不动了。这说明污染不严重;而且即便还有残余污染,它的方向也是把效应往零的方向压,所以论文报出的放大幅度如果有偏,偏在偏小的一侧

对平台问责与监管意味着什么?作者指出一个尖锐的事实:这家平台后来公开了推荐系统的源代码,但公开代码并不等于透明。没有模型权重、没有生产数据、没有周边基础设施,代码没法被独立验证;更要紧的是,审计真正想抓的那些现象,往往是优化目标跑出来的涌现结果,根本不写在代码里。所以黑箱审计不是「拿不到内部资料的退而求其次」,而是不可替代的手段——它回答的是「用户实际体验到了什么」,这恰恰是代码回答不了的。

作者也提醒,这套工具不必是对抗性的:平台自己可以在沙箱里放一群合成智能体,在新算法上线前做压力测试;监管机构也可以跑一套标准化的智能体群,产出可审计、可复现的合规证据

⑥ 结论(最终结论 + 启示)

这项研究的结论是,用人工智能体做黑箱审计既可行又有效,它把用户的行为方式和平台能看到的身份标签彻底拆开了。

这个「拆开」带来两样过去拿不到的东西:一是可以事先规定一个账号的政治立场,从而干净地按立场分组比较——而不是像观察研究那样,用「他点过什么赞」去反推立场(那个立场本身已经被算法塑造过了,属于循环论证);二是可以在行为不变的前提下单改一个标签,从而问出真正的反事实问题。

发现层面有两条:算法流确实系统性地多推毒性、极化、政治与右倾内容,但这种放大在不同立场的用户身上差异极大,甚至方向相反;算法确实在响应人口标签,只是响应方式高度因人而异,在总体平均里互相抵消得看不见。

作者自己划出了几条边界:这些数字来自一个平台、一个政治高热期、一批全新注册的账号,算法对老账号的身份标签未必这么权衡;人设级的异质性分析检验数量偏多,作者明确按探索性结果来定位,证据落在联合检验上而不是单个系数上。

往前看,最要紧的扩展是把这套框架搬到其他平台——设计里没有任何东西是这个平台专属的;以及把人设从十几个扩到几百个,那样才有足够的统计力去问「究竟是哪种属性在跟算法互动」。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。个性化排序已成为社交平台、搜索引擎与对话系统的底层机制,其对信息暴露、公共讨论与政治参与的塑造作用已有大量文献确证,在选举等高风险情境中尤为突出。伴随而来的是算法问责的制度压力:美国国会已多次就算法影响力质询 Meta、Amazon、Google、OpenAI 等公司负责人。然而算法内部构造被普遍视为商业机密,模型、训练数据与用户日志极少对外开放;独立第三方审计者通常仅拥有黑箱访问(black-box access),即在预设输入集上测试并观察输出。

个性化系统的特殊困难。与静态分类器不同,个性化系统的输出同时依赖用户属性 S 与不断演化的交互史 H,而交互史本身又由此前的推荐塑造,构成用户与算法之间的反馈回路。其有效输入空间是「属性 × 行为 × 暴露史 × 平台响应」随时间展开的全部用户轨迹,在黑箱条件下无法穷举。

既往两类审计的空白。(1) 真人审计生态效度高,但招募成本高、用户类型不可由研究者指定(无法对未被招募到的类型做因果分析)、且真人自带研究者无法观测的既有偏好与暴露史;(2) 马甲号(sock-puppet)审计可控且易扩展,但既有实现以预设规则的程序驱动账号,行为「扁平」且可预测,外推力受限。更根本的是,两类方法都无法把用户属性与用户行为解耦:真人身上二者天然相关,而马甲号的「类型」恰恰是通过脚本化行为来实例化的,即策略显式依赖于属性。结果是既有审计估计的是 E[Y|S=s₁,π=π₁] − E[Y|S=s₀,π=π₀](π₁≠π₀),把平台对信号的响应与对行为的响应混为一谈。

本研究贡献。其一,将个性化系统的黑箱审计形式化为策略条件信号响应(policy-conditional signal response)的识别问题,并提出以大模型驱动智能体作为合成账号「行为引擎」的审计框架:行为策略由提示词固定,属性与行为均先验设定、不由平台交互塑造,从而既支持按潜在特征(如意识形态)做设计性分层,又支持在固定行为下随机化平台可见信号以实现反事实识别。其二,完成首次在真实社交平台上的大规模智能体审计部署。其三,给出该平台差别待遇的实证证据:算法流相对时间序基线系统性放大毒性、极化、政治与右倾内容,且放大幅度随用户意识形态剧烈变化;平台对人口信号的响应虽在合并层面近乎为零,但联合检验拒绝同质性,呈高度人设依赖。研究由 MacArthur 基金会与 MIT MGAIC 资助。

I. Theoretical Framework & Hypotheses(理论框架与假设)

形式化设定。平台被建模为未知配置规则 A : (S_i, H_{i,t-1}) → D(Z),其中 Z 为内容空间、S_i ∈ S 为账号 i 的时不变、平台可见(或可高置信推断)信号向量、H_{i,t} = {(Z_{i,1},B_{i,1}),…,(Z_{i,t},B_{i,t})} 为交互史。用户行为由策略 π 生成,B_{i,t} ~ π(Z_{i,t})π 是对用户完整类型(含人口特征与意识形态、教育等潜在属性)的完备行为刻画,在实现上即大模型提示词。审计者以 Y_i = g(Z_{i,1:T}, B_{i,1:T}) 概括每条轨迹。

目标估计量。核心估计量为策略条件信号响应Δ_π(s₁,s₀) = E[Y | S=s₁, π] − E[Y | S=s₀, π](式 1)。落到实验设计上,对每个人设 p 与反事实条件 k,估计量为τ_{p,k} = E[Y | C=k, π_p] − E[Y | C=0, π_p](式 3),即 Δ_{π_p} 的实验版本。

框架适用条件(作者明示的三条):(i) 平台向账号顺序投放内容项;(ii) 推荐除交互史外还依赖平台可见的账号信号;(iii) 审计者能部署多个账号并记录实现结果。

编号研究问题 / 待检验命题对应理论与识别依据
RQ1黑箱条件下能否在固定行为策略的前提下识别平台对可见信号的响应策略条件信号响应(式 1);解耦 Sπ 破解式 2 的混淆
RQ2算法排序的 For You 流相对反向时间序 Following 流是否放大特定内容类型过滤气泡 / 回音室理论;Huszár 等的放大比率(amplification ratio)
RQ3放大幅度是否随用户意识形态系统性变化(是否投喂合意内容)合意性暴露(congenial exposure)与不对称意识形态隔离文献;先验设定立场以破解「分层变量本身由算法塑造」的循环性
RQ4在行为固定条件下扰动年龄 / 性别 / 地点信号,是否因果地改变内容投放人设内平衡随机化 → τ_{p,k} 的因果识别
RQ5该响应是同质的还是人设依赖的异质处理效应;式 8 的人设 × 条件交互 + 联合 F 检验

关键理论卖点。传统放大研究在按用户意识形态分层时面临根本识别困难:研究者用以判定意识形态的行为痕迹,正是平台用以个性化的信号,分层变量与结果之间因此循环。本设计通过先验指定立场(且行为策略全程不变)使该条件化在构造上即良定义。

M. Materials & Methods(材料与方法)

R. Results(结果)

R1 · For You 相对 Following 的放大比率(表 1,全样本)

内容类型时间流基准 r̄^FOL放大比率95% CI结论
政治性38.0%+14.2%[+9.1%, +19.8%]显著放大(基准占比最高,绝对增量最大)
右倾14.9%+23.3%[+15.8%, +31.9%]显著放大
左倾6.5%−6.1%[−14.6%, +2.1%]不显著(CI 含零)
毒性3.9%+39.2%[+14.4%, +69.7%]显著放大(效应最大)
极化14.0%+32.3%[+23.7%, +41.6%]显著放大
高触达作者64.5%+3.4%[−6.1%, +16.7%]不显著

R2 · 按用户意识形态分层(表 2)——总体格局掩盖了大幅异质,部分内容类型甚至变号

内容类型左倾用户95% CI右倾用户95% CI组间差
政治性+18.1%[+13.1%, +24.5%]+8.7%[+2.1%, +17.8%]−9.4 pp *
右倾+22.3%[+11.5%, +34.2%]+24.5%[+16.2%, +37.2%]+2.2 pp(不显著)
左倾−1.4%[−10.9%, +8.9%]−17.0%[−28.5%, −5.5%]−15.6 pp **
毒性+80.3%[+50.4%, +109.7%]−4.0%[−16.7%, +12.0%]−84.3 pp ***
极化+36.9%[+26.6%, +46.6%]+25.8%[+14.7%, +43.1%]−11.0 pp(不显著)
高触达作者−11.0%[−12.8%, −9.0%]+38.4%[+30.3%, +46.8%]+49.4 pp ***

R3 · 合并反事实处理效应(表 3,因变量为算法增益,单位百分点)

内容类型地点 D^urb β̂(p)年龄 D^age β̂(p)性别 D^male β̂(p)
政治性−1.70(0.142)0.70(0.473)0.90(0.449)
右倾−0.50(0.477)1.00(0.102)−0.40(0.534)
左倾−0.70(0.131)−0.30(0.367)0.30(0.436)
毒性0.10(0.770)0.80(0.031) CI [0.02, 1.58]−0.10(0.876)
极化−1.60(0.024) CI [−2.97, −0.23]0.50(0.439)−0.70(0.302)
高触达作者1.30(0.334)−0.90(0.524)−0.10(0.939)

R4 · 异质处理效应(式 8)——联合 F 检验在 5% 水平对全部六个结果变量拒绝「处理效应为零」的原假设,且六项均通过 BH 校正

结果变量Fp
左倾(异质性最强)2.02< 0.001
政治性1.93< 0.001
作者触达1.93< 0.001
毒性1.89< 0.001
右倾1.570.011
极化1.490.022

R5 · 稳健性与行为真实性校验

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((算法黑箱审计))
    I 引言
      个性化算法难审计
      仅有黑箱访问权
      真人审计成本高
      脚本马甲号不真实
      属性与行为难解耦
      国会多次听证
    R 问题
      黑箱下如何大规模审计
      信号响应能否识别
      算法流放大了什么
      放大是否因立场而异
      人口标签是否起作用
    M 方法
      14 人设 80 副本
      计划 1120 实部 826
      普查与皮尤锚定
      GPT-4o 零温度策略
      年龄性别地点扰动
      大选后 24 天部署
      推荐流对比时间流
      交互 243259 次
    R 结果
      毒性放大 39.2%
      极化放大 32.3%
      右倾放大 23.3%
      左倾未被放大
      左倾用户毒性 80.3%
      右倾用户左倾 -17%
      合并效应近零
      联合检验全部拒绝
    a 讨论
      均值掩盖异质待遇
      不对称回音室
      水平效应非投喂合意
      加性偏误可差分抵消
      开源代码不等于透明
      平台沙箱与监管队列
    D 结论
      智能体成审计新工具
      行为与信号解耦
      需超越聚合指标
      跨平台推广可行

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。