🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
平台推荐算法决定了你每天刷到什么内容,但外部研究者几乎看不到它的内部构造,只能从外面观察它的输入与输出。
你有没有想过这样一件事:同样打开一个社交平台,为什么你和你同学刷到的东西完全不一样?这背后是一套个性化算法。它会根据你是谁(年龄、性别、住在哪)、你做过什么(点过赞、关注过谁、看过哪些评论),不断调整往你眼前推什么。
问题是,这套算法几乎没人能从外面看清。公司把它当商业机密,代码、训练数据、用户日志统统不对外。美国国会已经多次把 Meta、亚马逊、谷歌等公司的负责人叫去听证,追问算法到底在怎么影响人们看到什么、相信什么。但监管者和学者能拿到的,通常只有黑箱访问:给它喂一批输入,看它吐出什么,中间的过程一概不知。
更麻烦的是,个性化算法不像一台固定的机器。它不是「同一个问题总给同一个答案」,而是会随着你的使用不断变形——它推给你的内容会影响你的下一次点击,你的点击又会影响它下一次推什么,形成一个转不停的反馈回路。这意味着要审计它,就得穷举「什么样的人、做过什么事、看过什么内容」的全部组合,这在现实中根本做不到。
过去审计这类算法主要有两条路,各有各的死穴。第一条是招真人:找一批志愿者,看算法怎么对待他们。真实性没问题,但招人贵、样本受限(想研究的那类人可能招不到),而且每个真人都带着自己的历史和偏好,研究者分不清结果是算法造成的还是这个人本来就这样。第二条是用「马甲号」(研究者自己控制的假账号):便宜、可控,但过去的马甲号靠写死的脚本操作,行为「很平」,一眼假,得出的结论也就不好推广。
而且这两条路都有一个共同的硬伤:分不开「你是谁」和「你做了什么」。真人身上这两者天生绑在一起;脚本马甲号的「人物设定」本身就是靠写死的行为来实现的,等于把身份和行为焊在了一起。于是所有既有审计都只能回答「不同人看到的东西不一样」,却回答不了「算法到底是在响应我的身份标签,还是在响应我的行为」。这篇论文就是来拆开这一对的。
② 研究问题(要回答什么?)
这项研究想弄清楚一件事,那就是在只能从外部观察的条件下,如何把平台个性化算法的审计同时做到大规模和可控。
顺着这个总问题,作者把它拆成了三层:
- 方法能不能成立:能不能造出一批「行为像人、但身份可以随意改」的假用户,让研究者既能大规模铺开,又能像做实验一样精确控制变量?
- 算法流到底放大了什么:把同一个账号的算法推荐流和纯按时间倒序排列的关注流放在一起比,算法多推了哪些内容?是更毒、更撕、更政治、更偏向某一方吗?
- 算法是不是在看你的身份标签:如果一个账号的行为方式完全不变,只是把它显示给平台的年龄改大、性别改掉、位置换到另一个州,它刷到的东西会变吗?
第三层是这篇论文最独特的地方。它问的是一个反事实问题:「如果这个人还是这个人、行为一模一样,只是在平台眼里更老一点,算法会怎么待他?」这种问题在真人研究里永远问不清,因为你不可能让同一个人既是二十五岁又是五十五岁。
③ 研究方法(怎么做的?)
作者的办法可以这样理解:造一批「有灵魂的马甲号」,再给它们做双胞胎对照实验。
第一步,造人设。研究者写了十四份「人物设定」,每一份都是一段自然语言描述:多大年纪、什么性别、住在哪座城市、什么种族、读到什么学历、政治上属于哪一类。这些属性不是拍脑袋编的,而是照着美国人口普查局的真实人口分布抽样,再乘上皮尤研究中心测到的各年龄段社交平台使用率。政治立场则直接用皮尤的九类政治类型学——从最右的「信仰与国旗保守派」一路排到最左的「进步左派」。
第二步,把人设交给大模型当「大脑」。每看到一条推文,系统就把这条推文连同人设描述一起发给大模型,让它以这个人的身份决定:点赞、关注作者、点开评论看看,还是划过去。温度参数设成零,意思是「同样的输入尽量给同样的反应」,保证同一个人设的所有账号行为一致。这跟老式马甲号的根本区别是:它不是按写死的脚本动作,而是真的读懂内容再决定怎么反应。
第三步,做双胞胎。每个人设造八十个账号,随机分成四组各二十个。第一组是基准;第二组只把显示给平台的位置换成另一个州;第三组只把年龄换到另一个年龄段;第四组只把性别换掉。关键在于:四组账号的「大脑」用的是完全同一份人设描述,行为方式一个字都没改,改的只有平台能看到的那一个标签。这就像做药物实验时,两组人各方面都一样,只有吃的药不同——差异就只能归因于那一个变量。
怎么让平台「看到」这些标签?年龄靠注册时填的出生日期;性别靠显示名(用大模型按人设生成的姓名池);位置靠住宅代理服务把流量路由到目标州的真实住宅网络地址。
第四步,放到真平台上跑。时间选在 2024 年美国总统大选投票日当天到之后的第二十四天——这是政治话题最沸腾的时候。每个账号每天上线八次,四次刷算法推荐流、四次刷按时间排序的关注流,每次约十分钟,上线时间随机打散。浏览器由自动化工具驱动,看到的就是普通用户看到的页面。
第五步,给刷到的内容打标签。毒性用一个现成的开源检测库打分;政治性和极化程度因为现成模型在选举期数据上表现太差,作者自己搭了一条大模型标注流水线,让模型先讲理由再下结论,并拿两百条人工标注的推文做过校验。
还有两件事必须做:防封号——动作之间插入延迟、代理地址跟人设位置对齐、注册时间错开、上线时间随机;伦理合规——机构审查委员会批了豁免,前提是这些账号只对已有内容做反应,绝不自己发帖,因此不会污染真实用户的体验;研究团队还专门找了法律诊所核实做法的合法性。
④ 结果(发现了什么?)
结果显示,算法推荐的信息流比按时间排序的信息流,明显多推毒性内容、极化内容、政治内容和右倾内容。
先看总体。同一个账号,刷算法流和刷时间流,看到的东西差多少?
算法流里毒性内容的占比比时间流高出 39.2%(置信区间 14.4% 到 69.7%)。时间流里这类内容本来只占 3.9%。
把不同群体摆成道德对立的「极化内容」放大了 32.3%(23.7% 到 41.6%),基准占比 14.0%。
右倾内容放大 23.3%;左倾内容是 −6.1%,而且置信区间跨过零,等于没有被放大。
放大 14.2%,看着不多,但时间流里政治内容本来就占 38.0%,所以多出来的绝对数量是所有类别里最大的。
但真正惊人的是按用户立场分开看。平均数把两群人完全不同的处境糊成了一团:
- 毒性内容的差距大到离谱:对左倾用户,算法把毒性内容放大了 80.3%;对右倾用户,是 −4.0% 且不显著。两群人之间差了 84.3 个百分点,非常非常显著。也就是说,「算法流更毒」这个结论几乎全部来自左倾用户那一侧。
- 右倾内容对谁都涨:对左倾用户放大 22.3%,对右倾用户放大 24.5%,两者几乎一样。注意这一点很反直觉——如果算法真的在「投喂你爱看的」,那右倾内容对左倾用户就不该涨。它涨了,而且涨得跟对右倾用户一样多,说明这更像是算法整体把右倾内容往上抬了一档,跟你是谁无关。
- 左倾内容对右倾用户是被压下去的:−17.0%,显著。而对左倾用户是 −1.4%,不显著。合起来看:右倾用户处在一个单向的信息环境里——合口味的被抬,不合口味的被压;左倾用户没有这个待遇,他们反而被塞了一堆右倾内容和毒性内容。作者把这叫「不对称的回音室」。
- 大号内容也是分裂的:粉丝数在中位数以上的作者,其内容对右倾用户放大 38.4%,对左倾用户却是 −11.0%,两者差 49.4 个百分点,非常非常显著。而总体上只有3.4% 且不显著——完美的「平均数骗人」案例。
再看反事实那一半:光改身份标签有用吗?把全部人设合在一起算平均,答案几乎是「没什么用」——十八个待检验的效应里只有两个显著:把年龄显示得更老,算法多塞的毒性内容增加约 0.8 个百分点;把位置换到更城市化的州,算法多塞的极化内容减少约 1.6 个百分点。而且这两个结果在做了多重检验校正之后就不再显著了。性别对任何指标都没有显著影响。
可「平均没用」不等于「算法不看标签」。作者把每个人设单独拿出来算,结果六个指标的联合检验全部拒绝了「效应处处为零」的假设,而且校正后依然成立。真相是:同一个标签改动,对不同人设的作用方向是反的——对这个人设推得更多,对那个人设推得更少,一平均就互相抵消成了零。在两百五十二个人设级系数里,有二十六个显著,大约是纯靠碰巧应该出现的数量的两倍。
这条发现有很强的方法论警示意义:只看平均值的审计,会漏掉专门针对某些特定人群的算法歧视。
⑤ 讨论(这些发现说明什么?)
这项研究的分量,一半在「发现了什么」,另一半在「用什么方法发现的」。两半都值得说。
先说方法这一半。过去做算法审计,你只能在「真实」和「可控」之间二选一:要真实就招真人,但你控制不了他们是谁、做过什么;要可控就用脚本机器人,但它一眼假,算法未必当它是人。这篇论文把两者同时拿到了手——人设来自真实人口数据,行为由大模型即时判断因而足够像人;同时,因为「行为」整整装在一段提示词里,研究者可以在行为完全不动的前提下,单独把平台能看到的标签换掉。这是老办法结构上做不到的。
有一个容易被误解的点值得讲清楚。有人会问:大模型又不是真人,它扮演的「五十岁保守派」能算真的吗?作者的回答很讲道理:这套方法的有效性并不依赖大模型演得像真人。它只需要两件事:一是同一个人设的所有账号行为完全一致(这样组间差异才能归因于标签),二是行为真实到足以触发平台的个性化机制(不然算法不会把它当人对待)。至于大模型自带的偏见,在「同人设组间相减」这一步里会被抵消掉——因为两组用的是同一份提示词,偏见是同一份,减掉就没了。
他们也确实拿数据证明了行为足够像人:账号在约六成三的推文上做出了主动动作,远高于提示词里「每五条至少动一次」暗示的下限;四个实验组的活跃度几乎一模一样,统计上的差异小到可以忽略;账号的存活天数在四组之间也没有系统差异,说明不是某一组更容易被平台封掉从而扭曲了结果。
再说发现这一半。最值得琢磨的不是「算法放大毒性」这个已经被说过很多次的结论,而是放大的分布极不均匀。左倾用户吃掉了几乎全部的毒性放大;右倾用户则住在一个两头都被修饰过的房间里——合口味的抬上来,不合口味的压下去。这两种伤害不一样:前者是「被迫看到让人难受的东西」,后者是「看不到另一半世界」。如果只报一个总平均数,这两种伤害都会消失不见。
还有一层更深的方法论含义。作者做了一个漂亮的稳健性检验:把放大倍数按「只看第一天」「只看第一周」「只看前两周」「看全程」分别算一遍。如果两条信息流之间存在相互污染(在一条流上点赞影响了另一条流的推荐),那么随着账号使用变久,两条流应该越来越像,放大倍数应该一路往下掉。实际结果是:第一周之后数字就稳住不动了。这说明污染不严重;而且即便还有残余污染,它的方向也是把效应往零的方向压,所以论文报出的放大幅度如果有偏,偏在偏小的一侧。
对平台问责与监管意味着什么?作者指出一个尖锐的事实:这家平台后来公开了推荐系统的源代码,但公开代码并不等于透明。没有模型权重、没有生产数据、没有周边基础设施,代码没法被独立验证;更要紧的是,审计真正想抓的那些现象,往往是优化目标跑出来的涌现结果,根本不写在代码里。所以黑箱审计不是「拿不到内部资料的退而求其次」,而是不可替代的手段——它回答的是「用户实际体验到了什么」,这恰恰是代码回答不了的。
作者也提醒,这套工具不必是对抗性的:平台自己可以在沙箱里放一群合成智能体,在新算法上线前做压力测试;监管机构也可以跑一套标准化的智能体群,产出可审计、可复现的合规证据。
⑥ 结论(最终结论 + 启示)
这项研究的结论是,用人工智能体做黑箱审计既可行又有效,它把用户的行为方式和平台能看到的身份标签彻底拆开了。
这个「拆开」带来两样过去拿不到的东西:一是可以事先规定一个账号的政治立场,从而干净地按立场分组比较——而不是像观察研究那样,用「他点过什么赞」去反推立场(那个立场本身已经被算法塑造过了,属于循环论证);二是可以在行为不变的前提下单改一个标签,从而问出真正的反事实问题。
发现层面有两条:算法流确实系统性地多推毒性、极化、政治与右倾内容,但这种放大在不同立场的用户身上差异极大,甚至方向相反;算法确实在响应人口标签,只是响应方式高度因人而异,在总体平均里互相抵消得看不见。
作者自己划出了几条边界:这些数字来自一个平台、一个政治高热期、一批全新注册的账号,算法对老账号的身份标签未必这么权衡;人设级的异质性分析检验数量偏多,作者明确按探索性结果来定位,证据落在联合检验上而不是单个系数上。
往前看,最要紧的扩展是把这套框架搬到其他平台——设计里没有任何东西是这个平台专属的;以及把人设从十几个扩到几百个,那样才有足够的统计力去问「究竟是哪种属性在跟算法互动」。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。个性化排序已成为社交平台、搜索引擎与对话系统的底层机制,其对信息暴露、公共讨论与政治参与的塑造作用已有大量文献确证,在选举等高风险情境中尤为突出。伴随而来的是算法问责的制度压力:美国国会已多次就算法影响力质询 Meta、Amazon、Google、OpenAI 等公司负责人。然而算法内部构造被普遍视为商业机密,模型、训练数据与用户日志极少对外开放;独立第三方审计者通常仅拥有黑箱访问(black-box access),即在预设输入集上测试并观察输出。
个性化系统的特殊困难。与静态分类器不同,个性化系统的输出同时依赖用户属性 S 与不断演化的交互史 H,而交互史本身又由此前的推荐塑造,构成用户与算法之间的反馈回路。其有效输入空间是「属性 × 行为 × 暴露史 × 平台响应」随时间展开的全部用户轨迹,在黑箱条件下无法穷举。
既往两类审计的空白。(1) 真人审计生态效度高,但招募成本高、用户类型不可由研究者指定(无法对未被招募到的类型做因果分析)、且真人自带研究者无法观测的既有偏好与暴露史;(2) 马甲号(sock-puppet)审计可控且易扩展,但既有实现以预设规则的程序驱动账号,行为「扁平」且可预测,外推力受限。更根本的是,两类方法都无法把用户属性与用户行为解耦:真人身上二者天然相关,而马甲号的「类型」恰恰是通过脚本化行为来实例化的,即策略显式依赖于属性。结果是既有审计估计的是 E[Y|S=s₁,π=π₁] − E[Y|S=s₀,π=π₀](π₁≠π₀),把平台对信号的响应与对行为的响应混为一谈。
本研究贡献。其一,将个性化系统的黑箱审计形式化为策略条件信号响应(policy-conditional signal response)的识别问题,并提出以大模型驱动智能体作为合成账号「行为引擎」的审计框架:行为策略由提示词固定,属性与行为均先验设定、不由平台交互塑造,从而既支持按潜在特征(如意识形态)做设计性分层,又支持在固定行为下随机化平台可见信号以实现反事实识别。其二,完成首次在真实社交平台上的大规模智能体审计部署。其三,给出该平台差别待遇的实证证据:算法流相对时间序基线系统性放大毒性、极化、政治与右倾内容,且放大幅度随用户意识形态剧烈变化;平台对人口信号的响应虽在合并层面近乎为零,但联合检验拒绝同质性,呈高度人设依赖。研究由 MacArthur 基金会与 MIT MGAIC 资助。
I. Theoretical Framework & Hypotheses(理论框架与假设)
形式化设定。平台被建模为未知配置规则 A : (S_i, H_{i,t-1}) → D(Z),其中 Z 为内容空间、S_i ∈ S 为账号 i 的时不变、平台可见(或可高置信推断)信号向量、H_{i,t} = {(Z_{i,1},B_{i,1}),…,(Z_{i,t},B_{i,t})} 为交互史。用户行为由策略 π 生成,B_{i,t} ~ π(Z_{i,t});π 是对用户完整类型(含人口特征与意识形态、教育等潜在属性)的完备行为刻画,在实现上即大模型提示词。审计者以 Y_i = g(Z_{i,1:T}, B_{i,1:T}) 概括每条轨迹。
目标估计量。核心估计量为策略条件信号响应:Δ_π(s₁,s₀) = E[Y | S=s₁, π] − E[Y | S=s₀, π](式 1)。落到实验设计上,对每个人设 p 与反事实条件 k,估计量为τ_{p,k} = E[Y | C=k, π_p] − E[Y | C=0, π_p](式 3),即 Δ_{π_p} 的实验版本。
框架适用条件(作者明示的三条):(i) 平台向账号顺序投放内容项;(ii) 推荐除交互史外还依赖平台可见的账号信号;(iii) 审计者能部署多个账号并记录实现结果。
| 编号 | 研究问题 / 待检验命题 | 对应理论与识别依据 |
|---|---|---|
| RQ1 | 黑箱条件下能否在固定行为策略的前提下识别平台对可见信号的响应 | 策略条件信号响应(式 1);解耦 S 与 π 破解式 2 的混淆 |
| RQ2 | 算法排序的 For You 流相对反向时间序 Following 流是否放大特定内容类型 | 过滤气泡 / 回音室理论;Huszár 等的放大比率(amplification ratio) |
| RQ3 | 放大幅度是否随用户意识形态系统性变化(是否投喂合意内容) | 合意性暴露(congenial exposure)与不对称意识形态隔离文献;先验设定立场以破解「分层变量本身由算法塑造」的循环性 |
| RQ4 | 在行为固定条件下扰动年龄 / 性别 / 地点信号,是否因果地改变内容投放 | 人设内平衡随机化 → τ_{p,k} 的因果识别 |
| RQ5 | 该响应是同质的还是人设依赖的 | 异质处理效应;式 8 的人设 × 条件交互 + 联合 F 检验 |
关键理论卖点。传统放大研究在按用户意识形态分层时面临根本识别困难:研究者用以判定意识形态的行为痕迹,正是平台用以个性化的信号,分层变量与结果之间因此循环。本设计通过先验指定立场(且行为策略全程不变)使该条件化在构造上即良定义。
M. Materials & Methods(材料与方法)
- 设计总览:人设数
P = 14,每人设副本(replica)数|I_p| = 80,反事实条件K = 3加基准共 4 组、每组 20 个账号,按人设内平衡随机化分配C_i ∈ {0,1,2,3};计划部署N = 1,120个账号。同一人设的所有副本共享同一行为策略π_p,仅平台可见信号S_i不同。 - 人设构造与锚定:人设
p为(θ_p, d_p),θ_p取皮尤九类政治类型学(自右至左:Faith and Flag Conservatives、Committed Conservatives、Populist Right、Ambivalent Right、Stressed Sideliners、Outsider Left、Democratic Mainstays、Establishment Liberals、Progressive Left),按P(θ | age, gender)抽样;d_p= (年龄, 性别, 地点, 种族, 教育),自美国人口普查数据抽样。
· 性别:女 50.5% / 男 47.2% / 其他 2.3%。
· 年龄:四档 18–29 / 30–49 / 50–64 / 65+,普查人口份额 13.3% / 25.8% / 19.0% / 17.1%,乘皮尤平台使用率 84% / 81% / 73% / 45%,得抽样权重P(age|Twitter) ∝ P(Twitter|age)·P(age)= 20.8% / 38.9% / 25.8% / 14.4%;档内年龄均匀抽取。
· 种族:七类——白人非西裔 58.9%、白人西裔 16.6%、黑人 13.6%、亚裔 6.3%、美洲原住民 1.3%、夏威夷及太平洋岛民 0.3%、多族裔 3.0%。
· 地点:人口 5 万以上的美国建制市,按 2022 年普查估计人口加权抽样(共 333 市)。
· 教育:以年龄、性别、种族为条件,按普查受教育程度表抽样,覆盖 15 个层级。 - 行为策略实现:
π_p : Z → D(B)由 GPT-4o 配固定提示词实现,temperature = 0。提示词模板为「Imagine that you {gender}. You are {age} years old and live {preposition_location} {location}. You are {race}, and {education}. You identify politically as {political_type}…」并嵌入皮尤对该类型的原文刻画。每条内容项以单次、无状态的 API 调用连同人设提示词送入模型,返回动作b ∈ {like, follow, read-replies, ignore}。用户提示要求模型先复述推文再解释反应,即以思维链方式确保内容被处理后才决策;推文的点赞 / 转推 / 回复计数一并给出以提供社会证明信号。 - 处理条件与信号通道(每个扰动只改一个维度,政治类型与其余人口属性全部固定在基准值):
·C=1地点:平台不要求申报位置,而由 IP 推断;账号流量经住宅代理服务 SmartProxy 的州级 sticky session 路由,预处理时按州查询端口区间并为每账号分配唯一端口。
·C=2年龄:注册时填写的出生日期,在指定年龄档内随机生成。
·C=3性别:经显示名传递;用 GPT-4o 按人设生成候选姓名,每人设生成 100 个候选名(大于每人设 80 个账号)后无放回抽样。
· 不携带人口信号的标识:头像由 DALL·E 生成且一律为非人类主体(如风景);邮箱来自一次性收件箱服务 MailSlurp;用户名由平台在注册时决定。三者全程固定、不参与反事实分析。 - 部署与交互协议:部署窗口 2024 年 11 月 5 日至 11 月 28 日(共 24 天),跨大选投票日及其直接余波。实验前设冷启动阶段:向模型展示平台的「推荐关注」页,由其依人设选择关注对象。此后每账号每日 8 次浏览会话,4 次 For You 流 + 4 次 Following 流,会话内信息流类型固定、时长约 10 分钟、开始时间全天随机抽取。「读回复」动作会进入回复线程,最多 5 条回复递归走同一流水线后返回主流。提示词层面设有「每 5 条至少一次主动动作」的软性推动(因调用无状态,仅为行为引导而非硬约束)。
- 数据采集:经 Selenium 浏览器自动化访问,使马甲号看到与普通用户相同的渲染页面。每条曝光记录文本、作者账号、时间戳、观测时点的点赞 / 转推 / 回复数、是否含媒体、信息流类型,以及账号动作与完整的模型推理轨迹。曝光定义为「浏览过程中被渲染并被日志管道记录」,不设停留时长阈值——即便选择 ignore,模型也必须处理该内容才能作出该选择,故停留时长由推理耗时机械决定,不构成注意力度量。
- 反侦测与账号运维:动作间插入模拟人类节奏的延迟、按分配位置匹配 IP、错开账号创建时间、随机化会话开始时间;对触发邮箱验证的临时锁定,以自定义邮件验证管线自动恢复。
- 伦理与合规:团队取得 IRB 豁免;智能体只与已有内容互动、不发布原创内容,以最小化对真实用户体验的影响。就抓取合法性,作者援引 2018 年 Sandvig v. Barr 判决(允许研究者为研究目的违反平台服务条款),并与法律诊所合作核实方案合法性。
- 结果变量操作化:
· 毒性:开源库 Detoxify 输出连续毒性分,以 0.5 为阈值二值化。
· 政治性:因现成通用语料模型在选举期数据上表现不佳,作者自建大模型标注流水线(附录 C:模型为 gpt-oss-20b,思维链提示 + few-shotk = 4,示例经 bootstrap 优化选出),分入 not_political / political_left / political_neutral / political_right 四互斥类,派生 politicalness(任一政治类,含中性)、right-leaning、left-leaning 三个二值指标,均在全部推文上计算。判定标准为明确指涉大选、政治制度 / 公共政策 / 治理、正式政治行为者,或明确的党派 / 选举站位。
· 极化:须同时满足两条件——(1) 区分两个以上社会 / 政治 / 宗教 / 性 / 种族群体;(2) 将这些群体框入道德化冲突(归罪、敌意、道德优越、威胁、受害者—压迫者叙事)。仅提及政治、宗教或身份不足以判定。分 political / religious / sexual / racial / other 五型(类型细分仅用于锚定模型推理以提升标注准确性),分析只用合并后的二值指标。
· 作者触达:以作者粉丝数为病毒性代理,超过样本中位数记为 high-reach。
· 标注流水线以 200 条人工标注推文做过校验。 - 放大比率估计:对账号
i、日d,先算各流的内容率r_id^FY = (1/m_id^FY)·Σ 1[z ∈ Z₀]、r_id^FOL同理(式 4);先在账号内跨日平均、再跨账号平均得r̄^FY、r̄^FOL;A(Z₀) = (r̄^FY / r̄^FOL − 1) × 100%(式 5)。与 Huszár 等的组间随机分流设计不同,本设计让同一账号同时刷两条流,得到用户层配对观测,从而消除账号历史与不可观测特征带来的混淆。推断以人设层聚类 bootstrap 实施(每次有放回重抽人设,保留共享行为策略诱导的人设内相依结构)。作者明示该比率捕捉的是「换流」的全部暴露变化(两流不仅排序不同,内容池也不同,For You 会引入关注图之外的内容),而非单纯的排序效应。 - 反事实回归:因变量取算法增益
y_id = r_id^FY − r_id^FOL(式 6,账号-日层级)。选加法而非比率有两个理由:(1) 稀疏内容(如毒性推文)的单日自然暴露常为零,使细粒度比率无定义;(2) 加法增益直接度量算法额外注入的内容「剂量」。
· 处理编码:D^urb ∈ {−1,0,+1}(显示州的城市化率高于 / 低于人设基准州,依 2020 年普查城市化人口比例)、D^age ∈ {−1,0,+1}(显示年龄档高于 / 低于基准)、D^male ∈ {0,1}。作者明示该序数编码假设了单调关系,分类虚拟变量等替代设定可捕捉非单调效应。
· 合并模型:y_id = γ_d + δ_{p_i} + β′T_i + X′_id θ + ε_id(式 7),γ_d为日固定效应、δ_{p_i}为人设固定效应,控制变量X_id含小时虚拟变量与账号存续时长(自创建起的小时数)。
· 异质模型:y_id = γ_d + δ_{p_i} + Σ_p Σ_k β_{p,k} W_{i,p,k} + X′_id θ + ε_id(式 8),W_{i,p,k} = 1{p_i = p, C_i = k}。
· 两个模型的标准误均在账号层聚类;多重检验以 Benjamini–Hochberg 程序校正。 - 实际样本与损耗:因注册阶段验证失败,计划的 1,120 个账号中实际成功部署 826 个,得 9,733 个账号-日观测;日活跃天数均值 13.2、中位数 12、IQR [10, 16]、最大 23,≥21 天者占 9.7%、≤3 天者占 2.3%。作者论证部署前损耗不引入选择偏误:同一人设–条件单元内的账号是运行同一行为策略的可交换副本,创建失败只损失统计功效、不影响存活账号的代表性。
R. Results(结果)
R1 · For You 相对 Following 的放大比率(表 1,全样本)
| 内容类型 | 时间流基准 r̄^FOL | 放大比率 | 95% CI | 结论 |
|---|---|---|---|---|
| 政治性 | 38.0% | +14.2% | [+9.1%, +19.8%] | 显著放大(基准占比最高,绝对增量最大) |
| 右倾 | 14.9% | +23.3% | [+15.8%, +31.9%] | 显著放大 |
| 左倾 | 6.5% | −6.1% | [−14.6%, +2.1%] | 不显著(CI 含零) |
| 毒性 | 3.9% | +39.2% | [+14.4%, +69.7%] | 显著放大(效应最大) |
| 极化 | 14.0% | +32.3% | [+23.7%, +41.6%] | 显著放大 |
| 高触达作者 | 64.5% | +3.4% | [−6.1%, +16.7%] | 不显著 |
R2 · 按用户意识形态分层(表 2)——总体格局掩盖了大幅异质,部分内容类型甚至变号。
| 内容类型 | 左倾用户 | 95% CI | 右倾用户 | 95% CI | 组间差 |
|---|---|---|---|---|---|
| 政治性 | +18.1% | [+13.1%, +24.5%] | +8.7% | [+2.1%, +17.8%] | −9.4 pp * |
| 右倾 | +22.3% | [+11.5%, +34.2%] | +24.5% | [+16.2%, +37.2%] | +2.2 pp(不显著) |
| 左倾 | −1.4% | [−10.9%, +8.9%] | −17.0% | [−28.5%, −5.5%] | −15.6 pp ** |
| 毒性 | +80.3% | [+50.4%, +109.7%] | −4.0% | [−16.7%, +12.0%] | −84.3 pp *** |
| 极化 | +36.9% | [+26.6%, +46.6%] | +25.8% | [+14.7%, +43.1%] | −11.0 pp(不显著) |
| 高触达作者 | −11.0% | [−12.8%, −9.0%] | +38.4% | [+30.3%, +46.8%] | +49.4 pp *** |
- 右倾内容对两类用户的放大幅度无显著差异(+22.3% vs +24.5%)。作者据此论证:这更符合算法内容配置中的水平效应(level effect),而不符合「向意识形态同构材料个性化」的解释。
- 对右倾用户,右倾内容被放大的同时左倾内容被主动压制(−17.0%),形成不对称回音室;左倾用户不存在该结构,反而被放大右倾内容超过 22%。
- 表 1、表 2 中所有显著结果均通过 Benjamini–Hochberg 多重检验校正,唯一例外是政治性的组间差异。
R3 · 合并反事实处理效应(表 3,因变量为算法增益,单位百分点)
| 内容类型 | 地点 D^urb β̂(p) | 年龄 D^age β̂(p) | 性别 D^male β̂(p) |
|---|---|---|---|
| 政治性 | −1.70(0.142) | 0.70(0.473) | 0.90(0.449) |
| 右倾 | −0.50(0.477) | 1.00(0.102) | −0.40(0.534) |
| 左倾 | −0.70(0.131) | −0.30(0.367) | 0.30(0.436) |
| 毒性 | 0.10(0.770) | 0.80(0.031) CI [0.02, 1.58] | −0.10(0.876) |
| 极化 | −1.60(0.024) CI [−2.97, −0.23] | 0.50(0.439) | −0.70(0.302) |
| 高触达作者 | 1.30(0.334) | −0.90(0.524) | −0.10(0.939) |
- 18 个系数中仅 2 个在 5% 水平显著:显示更年长使毒性内容的算法增益上升 0.80 pp(
p = 0.031);显示更城市化的位置使极化内容的算法增益下降 1.60 pp(p = 0.024)。相对基准增益换算,分别约为毒性额外注入量增加 70%(基准增益 1.15 pp)与极化额外注入量减少 38%(基准增益 4.18 pp)。性别对任何结果变量均无显著效应。 - 但两个显著结果都未通过 18 个假设的 BH 校正。附录 E 报告不加控制变量的稳健性设定,结果几乎完全一致(毒性 × 年龄 0.80,
p = 0.033;极化 × 地点 −1.60,p = 0.020),说明控制变量不影响估计。
R4 · 异质处理效应(式 8)——联合 F 检验在 5% 水平对全部六个结果变量拒绝「处理效应为零」的原假设,且六项均通过 BH 校正:
| 结果变量 | F | p |
|---|---|---|
| 左倾(异质性最强) | 2.02 | < 0.001 |
| 政治性 | 1.93 | < 0.001 |
| 作者触达 | 1.93 | < 0.001 |
| 毒性 | 1.89 | < 0.001 |
| 右倾 | 1.57 | 0.011 |
| 极化 | 1.49 | 0.022 |
- 以左倾内容为例:合并模型三个系数无一显著,但人设级效应方向与量级均随人设变化,故合并估计中不出现一致的平均效应。性别与地点扰动贡献了大部分异质性(尤以左倾与极化内容为著),年龄效应主要集中于毒性与作者触达。
- 个体层面,252 个「人设 × 结果 × 处理」系数中有 26 个在 5% 水平显著,约为纯随机应有数量的两倍。作者强调鉴于比较次数,单个系数不应被孤立解读;但「联合拒绝同质性 + 合并估计近零 + 显著系数约为随机预期两倍」三者合起来,指向算法对人口信号的响应在不同用户类型间方向不一。
- 直接的方法论推论:在异质用户总体上做平均的合并式审计,可能检测不到只针对特定子群存在的算法歧视。
R5 · 稳健性与行为真实性校验
- 暴露窗口稳健性(附录 D,表 10):识别假设为「浏览一条流不因果影响另一条流的内容」。若存在跨流污染,放大估计应随浏览史积累持续衰减。按累积窗口重算:政治性 +12.7% → +14.6% → +14.2% → +14.2%(第 1 天 / 第 1 周 / 前 2 周 / 全程),毒性 +37.9% → +42.5% → +39.4% → +39.2%,两者跨窗口无统计显著变化;右倾(+29.8% → +24.2%)、极化(+48.4% → +32.8%)、高触达(+14.5% → +3.3%)在第 1 天至第 1 周出现衰减后趋于稳定;左倾在第 1 天为显著的 −21.7%,到第 1 周衰减至不显著的 −6.2% 后稳定。作者判读:早期衰减反映算法在达到稳态前对用户行为的标定;估计值自第 1 周起平台化而非持续衰减,支持识别假设成立。且任何残余偏误方向都是把效应压向零,故报告的放大幅度若有偏,偏向保守。
- 动作分布(附录 B.3,表 8):读回复 139,000 次(57.1%)、忽略 90,151 次(37.1%)、点赞 14,095 次(5.8%)、关注 13 次(
< 0.01%),合计 243,259 次推文交互。智能体在约 63% 的被渲染推文上采取主动动作,远高于「每五条一次」软规则暗示的 20% 下限;连续主动动作之间的间隔中,仅 1.17% 含五次及以上连续忽略,表明软规则在绝大多数情形下被遵守。 - 处理组间活跃度平衡:基准 63.7% / 地点 62.7% / 年龄 62.5% / 性别 62.9%;对完整「动作 × 条件」表做卡方检验得 Cramér's V = 0.009,远低于 Cohen 的小效应阈值 0.07,跨条件活跃度差异可忽略。
- 差异性损耗检验(附录 B.4,表 9):在 826 个已部署账号上,以
DaysActive_i = α + β_loc·1[Location] + β_age·1[Age] + β_gen·1[Gender] + γ_{p_i} + ε_i(式 9)回归,无任何处理系数显著(地点p = 0.805、年龄p = 0.924、性别p = 0.301)。各组样本量与均值:基准 219 / 13.20 天、地点 191 / 13.39 天、年龄 209 / 13.30 天、性别 207 / 12.80 天。结论是观测时长在条件间平衡,无证据显示处理分配影响实验中途的封号 / 停用概率。
a / D. Discussion & Conclusion(讨论与结论)
- 方法论贡献 · 打破真实性—可控性的取舍。既往审计在生态效度(真人)与可扩展可控性(脚本马甲号)之间二选一,且两者都无法解耦属性与行为。本框架把行为完整编码进提示词,同时使属性与行为先验可指定,由此获得两项既有设计结构上做不到的能力:(1) 设计性分层——按事先规定的潜在特征(如意识形态)分层,而非从行为代理事后反推,从而消除「分层变量本身是用户与算法的联合产物」这一循环;(2) 反事实识别——在行为策略不变的前提下随机化平台可见信号,识别式 1 定义的策略条件信号响应。作者明确表示该方法论具一般性,可移植到广义的算法审计场景。
- 关于「大模型不像真人」的关键辩护。作者主张框架的有效性不要求大模型忠实逼近人类,只要求两点:同一人设各副本行为策略固定,以及行为真实到足以触发个性化。就反事实分析而言,任何加性的大模型偏误在人设内差分中被抵消;就放大分析而言,用户内比较仍内部有效,但作者坦承大模型的互动偏好可能塑造反馈回路、从而影响算法放大的水平值。
- 实质发现的理论意义。放大结果与「算法排序提升愤怒与外群体敌意暴露」的既有证据一致,但本研究把关键洞察推进了一层:右倾内容对两类用户被同等放大,说明观测到的意识形态倾斜更像是整体水平效应,而非「投喂合意内容」式的个性化。而对右倾用户,水平效应叠加对左倾内容的压制,构成单侧的不对称回音室;左倾用户则承受了几乎全部的毒性放大。两类伤害性质不同——前者是视野闭合,后者是敌意暴露,而总体均值会把两者同时抹去。
- 贯穿两组分析的共同模式:总体层面的汇总统计掩盖了算法对不同用户群的显著差别待遇。这构成对审计方法学的直接建议——应超越聚合指标,转向能检测人口与行为异质子群间差异效应的设计。
- 局限 1 · 行为引擎。GPT-4o 缺乏人类的亲历经验,在依人设选择反应时可能携带偏见;作者也承认无从判断 GPT-4o(配他们所给的提示词)是否是模拟社交媒体行为的最优选择,并指向近期改进大模型模仿人类选择的研究方向。
- 局限 2 · 统计功效与检验数量。每个「人设 × 条件」单元仅 20 个账号,而 6 个结果变量 × 3 个处理带来相对观测量偏多的假设检验;作者因此把异质性分析明确定位为探索性,其证据基础落在联合 F 检验而非单个系数上。
- 局限 3 · 外部效度。结论限定于该平台、限定于 2024 年美国大选后这一政治显著性异常高的时段,且全部账号为新注册账号;算法对老账号的档案信号可能给出不同权重。此外放大比率捕捉的是「换流」的全部暴露变化(含内容池差异),非纯排序效应;年龄与地点的序数编码假设了单调性。
- 未来方向。(1) 把人设扩到数百个以提高人口效应估计精度,并在功效充足时做调节分析,识别究竟哪些人设属性(互动模式抑或政治意识形态)在与算法交互中塑造其对人口信号的响应;(2) 允许智能体生产内容(发帖、回复、引用转推)以产生更丰富的互动信号、触发更深的个性化,但作者强调这需要更审慎的 IRB 监督,因为智能体生成的内容会直接影响真实用户;(3) 跨平台部署——设计中没有任何环节是该平台专属的。
- 对平台问责与算法透明的启示。作者点出一处关键张力:该平台已公开其推荐管线的源代码,但公开代码并不等于系统透明——缺少模型权重、生产数据与周边基础设施,已公开的代码无法被独立验证;更要紧的是,审计意图发现的那些模式往往是优化目标的涌现后果,而非可从源代码读出的行为。因此黑箱审计并非退而求其次,而是刻画用户实际体验的必要手段。
- 非对抗性用法与监管接口。作者强调该框架不必是对抗性的:平台自身可在沙箱环境中部署合成智能体群,在算法变更上线前做压力测试;监管机构可运行标准化的智能体队列,产出可审计、可复现的合规证据。论文在此处仅泛称 regulators(监管机构),未点名任何具体法规或司法辖区。
- 延伸解读(非论文原文观点,由本报告提出):需要先说明,论文全篇未提及欧盟《数字服务法案》(DSA)或其他任何具体立法,以下是本报告的引申。作者构想的「标准化智能体队列」恰好对应 DSA 中研究者数据获取与系统性风险审计条款的执行难题:当平台提供的数据接口本身受平台自身裁量限制时,由监管方或独立研究方自行部署可复现的合成账号队列,提供了一条不依赖平台配合的证据生产路径;而本文的人设级异质性结果进一步提示,此类合规证据若只报聚合指标,将系统性漏掉针对特定子群的差别待遇。读者请把这一段视为方法学引申,而非论文的实证主张。
- 资助:MacArthur 基金会资助与 MIT MGAIC 资助。
🧠 IRMaD 思维导图
mindmap
root((算法黑箱审计))
I 引言
个性化算法难审计
仅有黑箱访问权
真人审计成本高
脚本马甲号不真实
属性与行为难解耦
国会多次听证
R 问题
黑箱下如何大规模审计
信号响应能否识别
算法流放大了什么
放大是否因立场而异
人口标签是否起作用
M 方法
14 人设 80 副本
计划 1120 实部 826
普查与皮尤锚定
GPT-4o 零温度策略
年龄性别地点扰动
大选后 24 天部署
推荐流对比时间流
交互 243259 次
R 结果
毒性放大 39.2%
极化放大 32.3%
右倾放大 23.3%
左倾未被放大
左倾用户毒性 80.3%
右倾用户左倾 -17%
合并效应近零
联合检验全部拒绝
a 讨论
均值掩盖异质待遇
不对称回音室
水平效应非投喂合意
加性偏误可差分抵消
开源代码不等于透明
平台沙箱与监管队列
D 结论
智能体成审计新工具
行为与信号解耦
需超越聚合指标
跨平台推广可行
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。