🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
在社交媒体上,一条帖子排在信息流的第几位,很大程度上决定了有多少人能看到它。你刷手机时通常只看前面十几条,排在第四十名的帖子几乎没人会翻到。所以“排序”说到底是在分配“被看见的机会”。
大多数平台只有一套由平台自己掌控的推荐算法,Bluesky 却很特别:它允许任何人自己搭一个“自定义信息流”(custom feed)。你可以把它想成一台独立运营的推荐机器,平台把它和成千上万台别人的机器一起摆出来,用户想订阅哪台就订阅哪台。按文中引用的既往测量,平台上大约有四万个这样的信息流,出自一万八千位创建者之手。
很多人会想:可选的推荐机器这么多,总该公平些了吧?可是研究“公平排序”的学者过去主要在琢磨理想状态下曝光应该怎么分,对已经在运转的真实排序器到底怎么分,却很少实地去量。Bluesky 这种“千台机器同台”的格局,正好给了一个测量的机会。
② 研究问题(要回答什么?)
这篇研究想弄清楚,两个不同的人发出一字不差的同一条帖子时,同一个信息流会不会给他们同样多的曝光。换句话说:内容一模一样,排名也一样吗?如果不一样,差距跟“是谁发的”有没有关系?
这个思路其实有“前辈”。经济学里有个著名的“简历实验”:寄出内容完全相同的简历,只把求职者的名字换掉,看招聘方回电差多少。还有研究让同一首歌在不同的“虚拟音乐市场”里竞争,结果红不红差别巨大。本研究把这一招搬到了推荐算法上,而且更巧妙:作者不用注册假账号、不用发测试帖,而是去找平台上本来就存在的“撞文”帖子。
作者提出了两个问题。具体如下:
- 问题一:在同一个信息流的同一次排序结果里,不同作者发的相同文字,得到的排名曝光有多不平等?
- 问题二:把文字、信息流、抓取时间和帖子“年龄”都固定住以后,这种差距是否跟作者过去在这个信息流里被推荐过的历史有关?
③ 研究方法(怎么做的?)
作者的做法可以想象成定时给一块块排行榜拍照,再在照片里找“双胞胎帖子”比名次。
第一步,拍照。他们通过 Bluesky 官方开放的接口,大约每十分钟记录一次公开自定义信息流当下给出的前 50 名帖子,每拍一次叫一个“快照”。筛选之前,前 50 名里一共出现过 730 万条不同的帖子。作者只留下“完整”的快照——50 个名次、50 条不重复的帖子一个不缺。最后留下 297,093 个完整快照,时间是 2026 年 2 月到 4 月,覆盖 1,366 个信息流。
第二步,找双胞胎。在同一张快照里,找出文字逐字节完全相同、但作者不同的帖子,编成一个“匹配组”,组里每条叫一个“副本”。为了让比赛公平,还定了几条规矩:副本都要在拍照前发出,且发出不超过 7 天;同组副本的发帖时间差、年龄差都不能超过 120 分钟;每组至少有两位不同作者。这样一共凑出 64,853 个匹配组,分布在 250 个信息流里。撞文的内容大多是新闻和体育标题、粉丝话题标签和问候帖,常常是成对的账号同时发同一句话。
第三步,打分和比较。排第 r 名的帖子记 r 分之一的曝光分(第 1 名 1 分,第 10 名只剩 0.1 分),没上榜就是 0 分。然后只在每个组的内部比较副本之间的分差——同组的文字、信息流、时间都一样,这些因素就被自动“抵消”了。作者还把时间差上限收紧到 60 分钟和 30 分钟重算,检验结论稳不稳。
④ 结果(发现了什么?)
研究发现,内容完全相同的帖子得到的曝光常常差得很远,大约每三组里就有一组是一份上了榜、另一份却完全没出现。
在 33% 的匹配组里,一份副本进了前 50、另一份榜上无名;在 6.8% 的组里,一份挤进前 10,另一份却根本不在榜上。平均下来,排得好的那一份拿走了全组 66% 的曝光。把时间差上限从 120 分钟收紧到 60、30 分钟,差距几乎没缩小。
如果某个信息流以前从没推荐过某位作者的帖子,这位作者发同样的文字,曝光分平均少 0.061(p = 0.003,非常显著)。反过来,以前在这个信息流里被推荐得越多,这次得分越高。在最严格的 30 分钟限制下,新作者的帖子能上榜的概率低了 27 个百分点。
在 6,768 个“新作者对老作者”的组里,新作者只有 16% 的时候排得更靠前。就算只看新作者粉丝更多的 746 场对决,新作者仍有 74% 排在后面。
作者检查了 304 个帖子形式特征(有没有图片、是不是回复、带几个话题标签等),做完多重比较校正后一个都不显著。
这个结论也经得起“折腾”:每次去掉一个信息流重新算,250 次全部仍然是新作者吃亏;去掉发重复帖最多的那位作者,结果几乎不变(−0.063);就算考虑“谁先发谁占坑”的先后顺序,新作者的惩罚仍有 −0.049。
⑤ 讨论(这些发现说明什么?)
这些结果最值得琢磨的地方是:问题不出在内容上。文字一模一样,图片、回复这类形式特征又查不出影响,剩下能解释差距的,很大程度上就是“这个信息流认不认识你”。
打个比方:学校里有很多块社团公告栏,每块由不同的同学管理,大家以为“栏多了,谁的消息都有地方贴”。可研究发现,每个管理员都更愿意把熟人的纸条贴在显眼处,陌生人写了同样的话,却常常被压在下面甚至不贴。作者指出,这很像大型推荐系统里早就被发现的“流行度偏差反馈循环”:以前被推荐过,这次就更容易被推荐,下次的历史记录就更好看……而现在,这个循环在每一个小信息流内部也在转。
放到“算法决定谁被看见”这个大话题里看,这是一个重要提醒:把一个大算法拆成成千上万个小算法,并不会自动带来“被看见”的平等。新来的发声者即使粉丝更多,也可能在某个信息流里长期处于下风,可见性的不平等会在一个个小策展人手里被重新制造出来。
当然,作者也很坦诚:大多数信息流的算法是黑箱,可能有没观察到的因素在起作用;作者的“历史”也只能从开始收数据那天算起,更早的看不到。所以这些发现说的是“有关联”,还不能断言就是“新作者身份”直接造成了惩罚。
⑥ 结论(最终结论 + 启示)
这项研究的结论是,平台上有成千上万个可选的信息流,并不能保证说同一句话的人都能被同样看见。在 250 个信息流、64,853 组“撞文”帖子里,同样的文字经常得到悬殊的排名,而差距主要跟作者在该信息流里的过往记录有关:从没被这个信息流推荐过的作者,平均要吃 0.061 的曝光分亏。
它带来的启示可以分三点来看。具体如下:
- 对普通用户:你在某个信息流里“刷不到”某人,未必是对方说得不好,也可能只是算法还不“认识”他。
- 对信息流运营者和平台:这套方法只需要排序结果和平台上本来就有的重复帖,运营者完全可以拿自己的日志做“体检”,持续监测这种差距。
- 对研究者:它提供了一种不用建假号、不用发测试帖的算法审计思路,让“算法策展是否公平”变得可以直接量出来。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。在排序式信息流中,帖子的名次在很大程度上决定其触达人数。公平排序(fair ranking)研究因此把排序视为曝光分配问题(Singh & Joachims, 2018; Biega et al., 2018; Diaz et al., 2020; Singhal et al., 2025),并已有多篇综述系统梳理(Zehlike et al., 2023a, 2023b; Li et al., 2023)。但这一脉络多聚焦于为单一、由平台控制的排序器求解理想曝光分配方案,平台上已部署的排序器实际如何分配曝光则很少被测量。
场景。Bluesky 的自定义信息流允许任何人发布 feed generator——一种由平台分发、他人可订阅的独立推荐服务(Kleppmann et al., 2024);按 Balduf et al.(2024)的测量,平台上约有 40,000 个 feed,来自 18,000 名创建者。既有 Bluesky 研究描绘了平台网络与 feed 生态,但未测量 feed 如何分配曝光。
方法谱系。“固定内容”是成熟的审计策略:对应审计(correspondence audit)投递仅姓名不同的相同简历(Bertrand & Mullainathan, 2004);人工音乐市场中相同歌曲的成功程度可以天差地别(Salganik et al., 2006);Reddit 上同一图片反复发布的成败取决于标题与发布时机(Lakkaraju et al., 2013);算法审计已将这一思路延伸到社交信息流(Sandvig et al., 2014; Huszár et al., 2022)。
贡献。作者自称这是(1)首个基于平台上自然发生的重复帖、无需创建账号或注入测试内容的曝光审计;(2)首个在用户自建 feed 之间测量 feed 内部曝光分配的研究。对计算传播学而言,它把“算法策展与可见性不平等”的讨论从单一平台算法推进到“多元策展人并存”的去中心化生态。
I. Theoretical Framework & Hypotheses(理论框架与假设)
本文为 3 页短文,未提出正式假设,以两个研究问题组织;其概念框架是“排序即曝光分配”(公平排序文献)与“固定内容以隔离非内容因素”(对应审计 / 算法审计文献)的结合,结论部分以流行度偏差反馈循环解释所得模式。
| 编号 | 研究问题(原文) | 对应理论 / 文献脉络 |
|---|---|---|
| RQ1 | 在同一 Bluesky 自定义 feed 快照中,不同作者发布的(近)重复帖在多大程度上获得不平等的基于名次的曝光? | 公平排序:曝光分配(Singh & Joachims; Biega et al.; Diaz et al.) |
| RQ2 | 在固定文本、feed、快照时间与近似帖龄后,组内曝光差异是否与作者此前在同一 feed 上获得的曝光相关? | 对应审计 / 算法审计;集中式推荐中的流行度偏差反馈循环 |
识别逻辑。因匹配文本逐字节相同,文本本身的差异无法解释曝光差距;匹配组固定效应进一步吸收 feed、快照时间、文本内容以及该时点对组内所有副本共同作用的一切因素,剩余的组内差异只能来自副本层面的属性——作者历史、个人资料、媒体附件、帖子类型、线程位置、审核状态等。作者由此把问题转化为:在“同一句话、同一排序、同一时刻”的条件下,“谁说的”是否改变了被排上去的机会。
传播学对接(研判)。该设计直接回应平台研究中“算法策展是否制造可见性分层”的问题:若多元、独立的策展者仍系统性偏向已被自己推荐过的作者,则可见性不平等不仅来自单一平台算法,也会在分散化策展结构中被复制。
M. Materials & Methods(材料与方法)
- 数据采集:经 Bluesky API 的
app.bsky.feed.getFeed端点,约每 10 分钟抓取公开自定义 feed 的排序输出;单个 feed 的单次抓取为一个快照,记录其 Top-50 列表。过滤前共观测到 730 万条不同的 Top-50 帖子。 - 完整快照筛选:去重后须含 50 个不同名次与 50 条不同帖子(50 对不重复的名次–帖子)。保留 297,093 个完整快照(2026 年 2–4 月),覆盖 1,366 个 feed。
- 匹配设计(识别策略):自然发生的“固定内容”审计 + 匹配组内比较。匹配组 = 在同一完整快照上竞争、文本逐字节相同但作者不同的帖子(组内称“副本”)。条件:副本发布于快照生成之前且帖龄 ≤ 7 天;组内创建时间跨度与帖龄跨度均 ≤ 120 分钟(稳健性:60 / 30 分钟);至少 2 名不同作者。主样本 64,853 个匹配组,跨 250 个 feed;出现最多的单一文本占全部匹配组 0.5%,贡献最多的单一 feed 占 11%。重复内容以跨账号发布的新闻 / 体育标题、粉丝话题标签和问候帖为主,常见成对账号并行发布同一文本。另有“两种文本匹配规则”与“同媒体设定”作稳健性检验。
- 编码信度:匹配为确定性逐字节比对,无人工编码,故不涉及 κ 等编码者间信度指标。
- 残余差异:副本间仍可能在媒体附件、线程位置与审核状态上不同(引 Singhal et al., 2023);其中可观测的媒体因素纳入检验。
- 曝光度量:被返回帖子的曝光取其名次对应的位置权重——主指标倒数排名
RR = 1/r,备选 DCG 权重1/log2(r+1);未被列表返回的副本曝光记为 0。 - 特征块:作者历史(“新作者”= 在本研究日志中该 feed 此前从未返回过该作者任何帖子;既往同 feed 曝光,自然对数)、个人资料(profile)、媒体、帖子类型(如
has_image、is_reply、话题标签数)。 - 估计式(原文未给显式方程,依文字描述整理):
RRis = αs + β1·NewAuthoris + β2·ln PriorExpis + γ′Xis + εis,αs为匹配组固定效应;每个匹配组等权。 - 推断:标准误按文本组聚类(文本组 = 全部快照中共享同一逐字节文本的所有帖子);Benjamini–Hochberg 控制 FDR,分别在特征块内(
qblk)与全部检验间(qall)校正;另做置换检验(含 family-wise max-T)与多维聚类(文本 / 作者 / feed)。 - 补充分析:新作者“是否被返回”的概率(30 分钟上限下报告;原文未交代模型形式);控制副本到达顺序以排除“按先后去重”;逐一剔除 feed 重估(250 次);剔除发布重复内容最多的作者;新作者 vs. 曾被返回作者的两两对决(含新作者粉丝更多的子集)。
R. Results(结果)
- RQ1 组内曝光差距:33% 的匹配组中一份副本被返回而另一份缺席;6.8% 的组中一份进入 Top-10 而另一份完全不在列表。图 1 展示恰含 2 条帖子且至少 1 份被返回的 58,318 个组(占 64,853 组的 89.9%):若待遇平等,质量应全部落在对角线上。配对副本的平均 DCG 权重差为 0.102,最不平等十分位达 0.25(相当于第 15 名帖子的全部 DCG 权重);排名较优的副本平均占组内总曝光的 66%。时间跨度上限收紧至 60 / 30 分钟,差距仅降至 0.095 / 0.085。
- RQ2 作者历史:新作者副本就同一文本少获 −0.061 RR(p = 0.003);既往同 feed 曝光每增加 1 个自然对数单位,当前 RR +0.032(p = 0.007,
qall= 0.078)。首次进入某 feed 的作者也更难被返回:30 分钟上限下返回概率下降 27 个百分点(qblk= 0.007)。两项估计在不同时间上限、两种文本匹配规则与同媒体设定下保持稳定。 - 两两对决:在 6,768 个“新作者 vs. 曾被返回作者”的组中,新作者副本仅 16% 排名更优;其中新作者粉丝更多的 746 场对决里,新作者仍有 74% 排名更低。
- 内容特征:组内副本间存在差异的 304 个媒体与帖子类型特征,0 个通过 FDR。
| 变量(表 1) | RR 系数(SE) | qblk | qall | 置换 p | 结论 |
|---|---|---|---|---|---|
| 新作者(该 feed 上) | −0.061(0.020) | 0.023 | 0.047 | 0.007 | 块内与全局 FDR 均 < 0.05 |
| 既往同 feed 曝光(log) | +0.032(0.012) | 0.036 | 0.078 | 0.012 | 块内通过;全局 q 高于 0.05 |
| 媒体与帖子类型块 | 0 / 304 个可检验项通过 FDR | — | — | — | 无可检测关联 |
| 稳健性检验(新作者惩罚) | 估计 / 统计量 |
|---|---|
| 多维聚类 p:仅文本 / +作者 / +feed / 文本+作者+feed | 0.003 / 0.007 / 0.028 / 0.024 |
| family-wise max-T 置换 p | 0.017 |
| 控制副本到达顺序 | −0.049(p = 0.016) |
| 剔除发布重复内容最多的作者 | −0.063(p = 0.003) |
| 逐一剔除 feed(250 次重估) | 全部为负,99.6% 满足 p < 0.05 |
| 30 分钟上限下的被返回概率 | −27 个百分点(qblk = 0.007) |
a / D. Discussion & Conclusion(讨论与结论)
- RQ1 的回答:同文副本在同一排序中的曝光高度不均,且收紧时间跨度后差距几乎不变(0.102 → 0.095 → 0.085 的 DCG 差),说明差距并非主要由发布时机或帖龄差异造成。
- RQ2 的回答:差距与作者在特定 feed 上的历史相关——新作者受罚、既往曝光越多越受益,而粉丝数优势不能抵消、304 个形式特征无一显著。曝光更像附着于“作者–feed”关系,而非文本或帖子形式。惩罚在控制到达顺序、剔除任一 feed、剔除头部重复作者后均存续,不是单一 feed 或单一账号驱动。
- 作者的解释:在每个独立 feed 内部,这一模式类似集中式推荐系统中观察到的流行度偏差反馈循环;因而“可接入众多独立 feed”并不足以让相同文本获得平等曝光。
- 对算法策展与可见性不平等的意义(研判):去中心化 / 可选择的策展生态常被寄望于稀释单一平台算法的权力;本文提示可见性分层会在分散的小策展者手中被复制,新进入某一 feed 的发声者即使影响力更大也处于结构性劣势,形成以“是否已被该 feed 推荐过”为门槛的累积优势。对平台治理而言,feed 市场的透明度与常态化曝光审计比单纯增加 feed 数量更关键。
- 方法贡献与实践启示:审计只需排序输出与自然发生的重复帖,无需建号或注入测试内容;作者建议 feed 运营者可将该方法用于自有日志,持续监测此类差距。
- 局限(原文):多数 feed 算法为黑箱,可能存在影响结果的混杂变量;作者历史仅在采集窗口内可见(左删失),部分“新作者”可能在窗口前已被该 feed 返回过。
- 局限(研判):曝光以名次权重代理,未含真实展示量或 feed 订阅规模,250 个 feed 等权处理可能掩盖影响力差异;Top-50 截断使“未返回”混合了排在 50 名以外与被过滤两种情形;样本仅来自出现同文共现的 250 / 1,366 个 feed,重复内容以标题、粉丝标签、问候帖及成对账号为主,外推至原创内容需谨慎;短文未报告个人资料块结果、返回概率模型形式与副本 / 作者规模;既往曝光项全局 q = 0.078。
- 资助:原文未列资助或致谢信息;论文以 CC BY 4.0 许可发布。
🧠 IRMaD 思维导图
mindmap
root((同文不同曝光))
I 引言
名次决定谁被看见
公平排序多谈理想分配
已部署排序器少被测量
平台约四万自定义流
首个自然重复帖审计
R 问题
RQ1 同文曝光差多大
RQ2 与作者历史有关吗
固定文本流时间帖龄
M 方法
每十分钟抓前五十
297093个完整快照
覆盖1366个信息流
逐字节同文不同作者
时间跨度上限120分钟
64853组跨250个流
倒数排名为主指标
匹配组固定效应
R 结果
33%组一上榜一缺席
优者占组内66%曝光
新作者RR减0.061
上榜概率降27个点
粉丝更多仍74%落后
304个形式特征不显著
逐一剔除流仍为负
a 讨论
差距系于作者流关系
类似流行度偏差循环
可见性分层被复制
黑箱算法或有混杂
作者历史左删失
D 结论
多元信息流不保平等
新面孔遭系统性惩罚
运营者可自查日志
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。