ACM RecSys 2026 · 推荐系统旗舰会议 · 3 页短文 · 自然重复帖曝光审计 · CC BY 4.0 开放获取

一字不差,谁被排上榜:Bluesky 自定义信息流中同文帖子的曝光差距

Yipeng Wang, Mohit Singhal · RecSys ’26: 20th ACM Conference on Recommender Systems, Minneapolis, MN, USA(待刊短文;arXiv 2608.13879v1) · 2026 · DOI: 10.1145/3773078.3841250 · arXiv: 2608.13879
原题:Whose Posts Get Ranked: Identical-Text Exposure Gaps in Bluesky Custom Feeds
Open Access 新颖度 0.72

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

在社交媒体上,一条帖子排在信息流的第几位,很大程度上决定了有多少人能看到它。你刷手机时通常只看前面十几条,排在第四十名的帖子几乎没人会翻到。所以“排序”说到底是在分配“被看见的机会”。

大多数平台只有一套由平台自己掌控的推荐算法,Bluesky 却很特别:它允许任何人自己搭一个“自定义信息流”(custom feed)。你可以把它想成一台独立运营的推荐机器,平台把它和成千上万台别人的机器一起摆出来,用户想订阅哪台就订阅哪台。按文中引用的既往测量,平台上大约有四万个这样的信息流,出自一万八千位创建者之手。

很多人会想:可选的推荐机器这么多,总该公平些了吧?可是研究“公平排序”的学者过去主要在琢磨理想状态下曝光应该怎么分,对已经在运转的真实排序器到底怎么分,却很少实地去量。Bluesky 这种“千台机器同台”的格局,正好给了一个测量的机会。

② 研究问题(要回答什么?)

这篇研究想弄清楚,两个不同的人发出一字不差的同一条帖子时,同一个信息流会不会给他们同样多的曝光。换句话说:内容一模一样,排名也一样吗?如果不一样,差距跟“是谁发的”有没有关系?

这个思路其实有“前辈”。经济学里有个著名的“简历实验”:寄出内容完全相同的简历,只把求职者的名字换掉,看招聘方回电差多少。还有研究让同一首歌在不同的“虚拟音乐市场”里竞争,结果红不红差别巨大。本研究把这一招搬到了推荐算法上,而且更巧妙:作者不用注册假账号、不用发测试帖,而是去找平台上本来就存在的“撞文”帖子。

作者提出了两个问题。具体如下:

③ 研究方法(怎么做的?)

作者的做法可以想象成定时给一块块排行榜拍照,再在照片里找“双胞胎帖子”比名次。

第一步,拍照。他们通过 Bluesky 官方开放的接口,大约每十分钟记录一次公开自定义信息流当下给出的前 50 名帖子,每拍一次叫一个“快照”。筛选之前,前 50 名里一共出现过 730 万条不同的帖子。作者只留下“完整”的快照——50 个名次、50 条不重复的帖子一个不缺。最后留下 297,093 个完整快照,时间是 2026 年 2 月到 4 月,覆盖 1,366 个信息流。

第二步,找双胞胎。在同一张快照里,找出文字逐字节完全相同、但作者不同的帖子,编成一个“匹配组”,组里每条叫一个“副本”。为了让比赛公平,还定了几条规矩:副本都要在拍照前发出,且发出不超过 7 天;同组副本的发帖时间差、年龄差都不能超过 120 分钟;每组至少有两位不同作者。这样一共凑出 64,853 个匹配组,分布在 250 个信息流里。撞文的内容大多是新闻和体育标题、粉丝话题标签和问候帖,常常是成对的账号同时发同一句话。

第三步,打分和比较。排第 r 名的帖子记 r 分之一的曝光分(第 1 名 1 分,第 10 名只剩 0.1 分),没上榜就是 0 分。然后只在每个组的内部比较副本之间的分差——同组的文字、信息流、时间都一样,这些因素就被自动“抵消”了。作者还把时间差上限收紧到 60 分钟和 30 分钟重算,检验结论稳不稳。

④ 结果(发现了什么?)

研究发现,内容完全相同的帖子得到的曝光常常差得很远,大约每三组里就有一组是一份上了榜、另一份却完全没出现。

① 同文不同命
33% 的匹配组里,一份副本进了前 50、另一份榜上无名;在 6.8% 的组里,一份挤进前 10,另一份却根本不在榜上。平均下来,排得好的那一份拿走了全组 66% 的曝光。把时间差上限从 120 分钟收紧到 60、30 分钟,差距几乎没缩小。
② 新面孔吃亏
如果某个信息流以前从没推荐过某位作者的帖子,这位作者发同样的文字,曝光分平均少 0.061(p = 0.003,非常显著)。反过来,以前在这个信息流里被推荐得越多,这次得分越高。在最严格的 30 分钟限制下,新作者的帖子能上榜的概率低了 27 个百分点
③ 粉丝多也不管用
6,768 个“新作者对老作者”的组里,新作者只有 16% 的时候排得更靠前。就算只看新作者粉丝更多746 场对决,新作者仍有 74% 排在后面。
④ 带不带图不重要
作者检查了 304 个帖子形式特征(有没有图片、是不是回复、带几个话题标签等),做完多重比较校正后一个都不显著

这个结论也经得起“折腾”:每次去掉一个信息流重新算,250 次全部仍然是新作者吃亏;去掉发重复帖最多的那位作者,结果几乎不变(−0.063);就算考虑“谁先发谁占坑”的先后顺序,新作者的惩罚仍有 −0.049。

⑤ 讨论(这些发现说明什么?)

这些结果最值得琢磨的地方是:问题不出在内容上。文字一模一样,图片、回复这类形式特征又查不出影响,剩下能解释差距的,很大程度上就是“这个信息流认不认识你”。

打个比方:学校里有很多块社团公告栏,每块由不同的同学管理,大家以为“栏多了,谁的消息都有地方贴”。可研究发现,每个管理员都更愿意把熟人的纸条贴在显眼处,陌生人写了同样的话,却常常被压在下面甚至不贴。作者指出,这很像大型推荐系统里早就被发现的“流行度偏差反馈循环”:以前被推荐过,这次就更容易被推荐,下次的历史记录就更好看……而现在,这个循环在每一个小信息流内部也在转。

放到“算法决定谁被看见”这个大话题里看,这是一个重要提醒:把一个大算法拆成成千上万个小算法,并不会自动带来“被看见”的平等。新来的发声者即使粉丝更多,也可能在某个信息流里长期处于下风,可见性的不平等会在一个个小策展人手里被重新制造出来。

当然,作者也很坦诚:大多数信息流的算法是黑箱,可能有没观察到的因素在起作用;作者的“历史”也只能从开始收数据那天算起,更早的看不到。所以这些发现说的是“有关联”,还不能断言就是“新作者身份”直接造成了惩罚。

⑥ 结论(最终结论 + 启示)

这项研究的结论是,平台上有成千上万个可选的信息流,并不能保证说同一句话的人都能被同样看见。在 250 个信息流、64,853 组“撞文”帖子里,同样的文字经常得到悬殊的排名,而差距主要跟作者在该信息流里的过往记录有关:从没被这个信息流推荐过的作者,平均要吃 0.061 的曝光分亏。

它带来的启示可以分三点来看。具体如下:

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。在排序式信息流中,帖子的名次在很大程度上决定其触达人数。公平排序(fair ranking)研究因此把排序视为曝光分配问题(Singh & Joachims, 2018; Biega et al., 2018; Diaz et al., 2020; Singhal et al., 2025),并已有多篇综述系统梳理(Zehlike et al., 2023a, 2023b; Li et al., 2023)。但这一脉络多聚焦于为单一、由平台控制的排序器求解理想曝光分配方案,平台上已部署的排序器实际如何分配曝光则很少被测量。

场景。Bluesky 的自定义信息流允许任何人发布 feed generator——一种由平台分发、他人可订阅的独立推荐服务(Kleppmann et al., 2024);按 Balduf et al.(2024)的测量,平台上约有 40,000 个 feed,来自 18,000 名创建者。既有 Bluesky 研究描绘了平台网络与 feed 生态,但未测量 feed 如何分配曝光

方法谱系。“固定内容”是成熟的审计策略:对应审计(correspondence audit)投递仅姓名不同的相同简历(Bertrand & Mullainathan, 2004);人工音乐市场中相同歌曲的成功程度可以天差地别(Salganik et al., 2006);Reddit 上同一图片反复发布的成败取决于标题与发布时机(Lakkaraju et al., 2013);算法审计已将这一思路延伸到社交信息流(Sandvig et al., 2014; Huszár et al., 2022)。

贡献。作者自称这是(1)首个基于平台上自然发生的重复帖、无需创建账号或注入测试内容的曝光审计;(2)首个在用户自建 feed 之间测量 feed 内部曝光分配的研究。对计算传播学而言,它把“算法策展与可见性不平等”的讨论从单一平台算法推进到“多元策展人并存”的去中心化生态。

I. Theoretical Framework & Hypotheses(理论框架与假设)

本文为 3 页短文,未提出正式假设,以两个研究问题组织;其概念框架是“排序即曝光分配”(公平排序文献)与“固定内容以隔离非内容因素”(对应审计 / 算法审计文献)的结合,结论部分以流行度偏差反馈循环解释所得模式。

编号研究问题(原文)对应理论 / 文献脉络
RQ1在同一 Bluesky 自定义 feed 快照中,不同作者发布的(近)重复帖在多大程度上获得不平等的基于名次的曝光?公平排序:曝光分配(Singh & Joachims; Biega et al.; Diaz et al.)
RQ2在固定文本、feed、快照时间与近似帖龄后,组内曝光差异是否与作者此前在同一 feed 上获得的曝光相关?对应审计 / 算法审计;集中式推荐中的流行度偏差反馈循环

识别逻辑。因匹配文本逐字节相同,文本本身的差异无法解释曝光差距;匹配组固定效应进一步吸收 feed、快照时间、文本内容以及该时点对组内所有副本共同作用的一切因素,剩余的组内差异只能来自副本层面的属性——作者历史、个人资料、媒体附件、帖子类型、线程位置、审核状态等。作者由此把问题转化为:在“同一句话、同一排序、同一时刻”的条件下,“谁说的”是否改变了被排上去的机会。

传播学对接(研判)。该设计直接回应平台研究中“算法策展是否制造可见性分层”的问题:若多元、独立的策展者仍系统性偏向已被自己推荐过的作者,则可见性不平等不仅来自单一平台算法,也会在分散化策展结构中被复制。

M. Materials & Methods(材料与方法)

R. Results(结果)

变量(表 1)RR 系数(SE)qblkqall置换 p结论
新作者(该 feed 上)−0.061(0.020)0.0230.0470.007块内与全局 FDR 均 < 0.05
既往同 feed 曝光(log)+0.032(0.012)0.0360.0780.012块内通过全局 q 高于 0.05
媒体与帖子类型块0 / 304 个可检验项通过 FDR无可检测关联
稳健性检验(新作者惩罚)估计 / 统计量
多维聚类 p:仅文本 / +作者 / +feed / 文本+作者+feed0.003 / 0.007 / 0.028 / 0.024
family-wise max-T 置换 p0.017
控制副本到达顺序−0.049(p = 0.016)
剔除发布重复内容最多的作者−0.063(p = 0.003)
逐一剔除 feed(250 次重估)全部为负,99.6% 满足 p < 0.05
30 分钟上限下的被返回概率−27 个百分点(qblk = 0.007)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((同文不同曝光))
    I 引言
      名次决定谁被看见
      公平排序多谈理想分配
      已部署排序器少被测量
      平台约四万自定义流
      首个自然重复帖审计
    R 问题
      RQ1 同文曝光差多大
      RQ2 与作者历史有关吗
      固定文本流时间帖龄
    M 方法
      每十分钟抓前五十
      297093个完整快照
      覆盖1366个信息流
      逐字节同文不同作者
      时间跨度上限120分钟
      64853组跨250个流
      倒数排名为主指标
      匹配组固定效应
    R 结果
      33%组一上榜一缺席
      优者占组内66%曝光
      新作者RR减0.061
      上榜概率降27个点
      粉丝更多仍74%落后
      304个形式特征不显著
      逐一剔除流仍为负
    a 讨论
      差距系于作者流关系
      类似流行度偏差循环
      可见性分层被复制
      黑箱算法或有混杂
      作者历史左删失
    D 结论
      多元信息流不保平等
      新面孔遭系统性惩罚
      运营者可自查日志

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。