arXiv 预印本 · cs.SI · 2026-07-14 v1 工作论文 · UCLA 传播系 / Drexel 信息科学系 / UCLA 公卫与肿瘤学合作 · 3×2 傀儡账号审计 · 9,020 条搜索结果

怎么问就搜到什么:TikTok 搜索中乳腺癌错误信息的傀儡账号审计

Pooriya Jamie, Homa Hosseinmardi, Rezvaneh Rezapour 等 6 人 · arXiv 预印本(cs.SI)· 工作论文 v1 · 2026 · arXiv: 2607.13147
原题:How You Ask Shapes What You Get: Auditing Breast-Cancer Misinformation in TikTok Search
Open Access 新颖度 0.78

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

越来越多的人会在短视频平台上查健康信息,包括琢磨身体的异常症状和纠结要不要接受治疗。

你有没有想过这样一个场景:两位女性都在乳房里摸到一个肿块,一位搜“乳房肿块活检流程”,另一位搜“天然方法缩小乳房肿块”。她们在屏幕上看到的,会是同一个世界吗?

过去的研究已经发现,TikTok 上的癌症内容里有不少错误和低质量信息,还存在专门讲“替代疗法”的圈子;而社交媒体上的错误信息往往比准确信息传得更快、更远。系统综述估计,在被研究过的健康类社交媒体内容里,含错误信息的比例从两成到将近九成不等。

但以往给平台“做体检”的算法审计,大多盯着推荐流——也就是 TikTok 的“为你推荐”页。那里你看到什么,主要取决于平台从你过去的点赞、停留里猜出来的偏好。搜索却不一样:用户是自己敲字、主动说出“我想知道什么”。这样一来,你看到什么,既取决于平台怎么排序,也取决于你怎么问

这个区别在癌症这种高风险领域特别要紧。病人往往是在最焦虑、最拿不准的时候去搜索的;可此前的研究大多只描述平台上“有什么内容”,没有测过用不同方式提问的人实际“被推到眼前的是什么”,也没有人专门研究过乳腺癌。

② 研究问题(要回答什么?)

这篇论文想弄清楚的是,在 TikTok 搜索里,用户提问的方式会不会系统性地影响自己接触到多少乳腺癌错误信息。

作者把“提问方式”分成三种立场:相信正规医学、想弄懂检查和治疗流程的人;怀疑甚至回避正规医学、想找天然疗法的人;以及想听听病友亲身经历的人。再把搜索的时机分成两段:刚发现身体异常、还没确诊,和已经确诊、正在治疗。在此基础上,作者提出了四个研究问题。

具体如下:

其中第二个问题特别有现实分量:一个正在犹豫要不要做化疗的人,按理说最需要平台多加一层保护——平台做到了吗?

③ 研究方法(怎么做的?)

作者用的办法叫“傀儡账号审计”,有点像消费者协会派“神秘顾客”去门店暗访:研究者自己注册一批全新的账号,让程序按事先写好的剧本去搜索,再把平台返回的内容原样记下来。

第一步,画实验格子。“问法”分三种、“阶段”分两种,交叉成六个实验条件。医学信息型接受正规诊疗,想弄懂流程(如“核心针穿刺活检”“化疗期间输液港护理”);替代医学型站在对立面,一类是找偏方(如“乳房肿胀草药疗法”),另一类根本不提偏方、只表达对医生的不信任(如“避免乳房肿块活检”“医生对乳房肿块反应过度”“拒绝化疗 乳腺癌”);病友故事型想听别人的经历(如“乳腺癌 你不孤单”),它说的是大白话,但对正规医学和替代医学都不表态,专门用来当对照组——检验错误信息变多到底是因为“说话不专业”,还是因为“倾向替代医学”。

第二步,写搜索词。作者从 Reddit 的乳腺癌病友社区抓取了评论最多的 1,155 条帖子标题,当作“病人真实说话方式”的样本,交给大语言模型 GPT-5.4-mini,让它按每个条件写出 14 条 TikTok 风格的短搜索词,一共 84 条,再由人工逐条检查是否符合设定。这些帖子标题本身并不拿去搜索。

第三步,派账号去搜。30 个全新账号,每个条件 5 个。2026 年 5 月 15 日到 21 日,在美国用 TikTok 网页版,每个账号每天搜两次、连搜七天,每次打开最多前 25 条视频、每条截 5 张图并抓下评论。账号不点赞、不评论、不收藏、不转发、不关注任何人。除了搜索词不同,所有条件的自动化程序、地点、账号设置和模拟的用户画像(45 岁女性、每天刷 TikTok、健康素养中等)都一样。最后得到 420 次搜索、9,020 条结果,其中 7,199 条和癌症有关。

第四步,请 AI 当“阅卷老师”。每条视频取第 3 张截图,把评论区遮掉,交给能看图的 AI 模型 GPT-5.4-nano 判断:和癌症有没有关系?有没有在宣传或背书一个可能造成伤害的、错误或缺乏科学依据的癌症说法?如果有,是哪种造假方式、哪个话题?模型看不到搜索词,也不知道属于哪个实验条件。只是提到、质疑或纠正某个错误说法,不算;单纯讲个人经历也不算,除非在推销有害的无依据说法或劝人放弃正规治疗。评论区则另外单独用文字模型判断。

第五步,检查阅卷老师靠不靠谱。作者拿 50 条人工标注过的样本来对答案,还让另外两个模型用同样的提示重判一遍,看彼此是否一致。统计时,作者考虑到“同一个账号”“同一条搜索词”下的结果并不相互独立,用了更保守的误差算法。

④ 结果(发现了什么?)

结果非常醒目:带着替代医学倾向去搜,搜到的癌症相关视频里有一半多被判为可能的错误信息。

先看总账:30 个账号一共搜出 9,020 条视频,其中 7,199 条和癌症有关,这里面有 1,571 条(21.8%)被判为可能含错误信息。

① 怎么问,差别巨大
替代医学型:确诊前 1,011 条相关视频里有 547 条是错误信息(54.1%),治疗期 1,448 条里有 775 条(53.5%)。医学信息型只有 6.3%7.1%;病友故事型最低,3.8%3.2%。替代医学型分别是医学信息型的 8.6 倍7.6 倍。统计模型显示,替代医学型让一条结果“是错误信息”的胜算变成医学信息型的 17.64 倍(p < 0.001,非常非常显著);病友故事型和医学信息型的差别则不显著(p = 0.121)。
② 在哪个阶段搜,几乎没差
确诊前和确诊后去搜,错误信息比例没有统计上能检出的差别(胜算比 1.14,p = 0.703);问法和阶段之间也没有“叠加效应”(联合检验 p = 0.841)。
③ 不只挤在最前面
以替代医学型、确诊前为例:第 1–5 位的错误信息比例是 63.8%,第 11–25 位仍有 48.9%。在出现过错误信息的结果列表里,第一条错误信息的位置中位数是第 2 位;76 个结果列表中有 68 个(89.5%)在前 10 条里至少有一条错误信息。
④ 评论区也“同声相应”
在抓到评论的视频里,错误信息视频的评论区有 35.9%(379/1,056)也出现了错误说法,其他视频只有 9.7%(323/3,313),胜算比 5.18,p < 0.001。作者强调这只是“同时出现”,不能说明谁导致了谁。

两个刺眼的单条例子。搜“natural ways to reduce breast lump”(天然方法缩小乳房肿块),94 条癌症相关结果里有 87 条(92.6%)被判为错误信息。更出人意料的是,搜“evidence based breast cancer recovery”(循证的乳腺癌康复)这种一听就很专业的词,55 条里也有 15 条(27.3%)是错误信息。

错误信息都在说什么?最多的是宣传未经证实的疗法或替代疗法(1,135 条,占 72.2%),其次是质疑常规治疗的安全和效果(24.6%),以及关于诊断和筛查的误导(20.9%)。替代医学型里八成以上(81.8%)在讲替代疗法;而医学信息型和病友故事型里,最常见的是诊断和筛查方面的误导(44.6% 和 50.0%)。从“怎么造假”看,三种问法下都以“误导内容”为主,也就是歪曲、夸大、过度简化或选择性呈现事实的内容。

AI 阅卷靠谱吗?在 50 条人工标注样本上,GPT-5.4-nano 判对 44 条(准确率 0.88),精确率、召回率都是 0.84,和人工答案的一致性系数 κ = 0.75,错判方向也很均衡(多判 3 条、漏判 3 条)。换另外两个模型重判 386 条,两两一致率都在九成以上。

⑤ 讨论(这些发现说明什么?)

这项研究最巧妙的地方,是用“病友故事型”问法做了一个对照。

有人可能会想:替代医学型搜出的错误信息多,是不是只因为用的是大白话、不够专业?可病友故事型同样说大白话(比如“乳腺癌互助社区”“姐妹们分享化疗故事”),它的错误信息比例反而最低(3.8% 和 3.2%),比医学信息型还低一点,只是差别在统计上不显著。所以作者认为,让错误信息变多的不是“说话不专业”,而是“倾向替代医学”这个立场本身。不过作者也提醒:这几种问法不只是措辞不同,想问的话题和意图也不同,要彻底分开这几种因素,还得设计“意思相同、只换说法”的实验。

第二个值得警惕的发现,是平台不区分病人处在哪个阶段。按理说,一个正在犹豫要不要开始化疗的人,比一个刚摸到肿块的人更经不起误导——劝人放弃化疗、放疗或手术的内容,可能直接导致治疗被耽误、减量甚至放弃,而且这些决定时间紧、往往无法挽回。可数据显示,两个阶段搜到的错误信息比例几乎一样。作者把这种“一视同仁”本身看作一个安全缺口,同时强调这是关于平台“应当如何对待不同搜索”的推论,并不是在证明算法有意为之。

那平台能做什么?作者提了三条思路。第一,既然错误信息从头到尾都有,只调整最前面几条可能不够,要减少这些搜索词能召回的整个内容池里的错误信息,并在搜索词层面加上“引导到权威信息”的保护。第二,错误视频的评论区更容易出现错误说法,可以试试纠错提示、权威置顶回复和经过核实的健康信息链接。第三,对明确表达“拒绝化疗”“不做放疗”“化疗替代方案”这类意图的搜索,加大权威引导和降权力度。

至于 AI 阅卷,作者的态度很克制:它适合帮研究者做大规模的总体审计,或者给人工审核先筛一遍,而不适合直接替平台自动删帖。研究也有明确的边界:人工核对样本只有 50 条,且只核对了“是不是错误信息”,没核对类型和话题;每条视频只看了一张截图,可能漏掉其他时间点出现的说法;只测了搜索,没测推荐页;七天里账号可能积累了浏览记录;搜索词由 AI 生成,可能漏掉真实病人的说法;一周时间也看不出随时间的变化。还有一类人没被测到——完全不知道该搜什么、也没有任何立场的人,作者认为这类人恰恰最容易被排序结果带着走。

⑥ 结论(最终结论 + 启示)

这项研究说明,在 TikTok 上搜乳腺癌信息时,你怎么提问,在很大程度上关系到你会碰到多少错误信息。

把数字串起来看:7,199 条癌症相关结果里有 1,571 条(21.8%)可能含错误信息;带着替代医学倾向去搜,错误信息比例在两个阶段分别约是按医学思路搜的八倍半和七倍半;即便用了专业医学词汇,也仍有 6.3%–7.1%;而且错误信息不只挤在最前面几条。

普通人来说,启示很实际:搜索框里的措辞并不中性,“天然方法”“不做活检”“拒绝化疗”这样的词,会把你带进一个错误信息浓度很高的内容池。对平台来说,治理不能只盯推荐算法,也要审计搜索;不能只清理第一屏,而要清理整个召回池;对和治疗决策相关的高风险搜索,应当有更强的保护。对研究者来说,“用病友社区的语言让大模型生成搜索词、再让看图模型阅卷”这套流程可以推广到其他健康话题和平台,但要配合人工把关,而不是让 AI 单独做内容审核的决定。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。越来越多的人借助社交媒体理解症状、诊断与治疗决策;癌症错误信息在平台上可获得可观互动,而错误信息较准确内容传播得更快、更远(Vosoughi 等,2018)。针对 TikTok 癌症内容的既有研究已记录了大量错误与低质量信息(妇科癌症、前列腺癌),并识别出视觉上可区分的替代健康癌症讨论社群;系统综述估计被研究的健康类社交媒体内容中 20–87% 含错误信息。

空白一:审计对象偏向推荐流。算法审计传统涵盖过滤气泡与激进化路径、Google 搜索党派偏差、电商平台疫苗错误信息等议题,方法从平台痕迹的观察分析、真实用户浏览数据,到傀儡账号审计与估计推荐系统因果作用的反事实代理设计。TikTok 上的傀儡账号审计集中于“为你推荐”页(FYP),其曝光由跨会话累积的行为信号驱动;搜索较少被审计。YouTube 搜索审计(Hussein 等,2020)显示观看历史可改变返回结果中错误信息的占比,疫苗类查询尤甚。

空白二:描述“存在什么”而非“暴露给谁”。既有 TikTok 癌症研究刻画的是平台上可得的内容,而非用户在不同查询下实际被暴露的内容,且均未涉及乳腺癌。搜索与推荐的根本差异在于用户在每次交互中显式陈述信息需求,暴露因此同时取决于排序算法与查询表述——作者举例,“natural ways to shrink a breast lump”与“breast lump biopsy procedure”体现的是根本不同的信息寻求取向。

空白三:可扩展的自动标注。公共卫生主张的自动事实核查通常把主张与检索到的外部证据配对;视频场景下多模态方法融合文本、视觉与社交信号,结构上最接近的是 FakeSV 短视频假新闻基准(融合帧级视觉特征、屏幕文字与评论语境),但其为监督训练模型。本研究改用零样本提示的通用视觉语言模型(GPT-5.4-nano),延续“LLM 作为社会科学测量标注器”的路线,并以人工标签校验。

贡献。(1)首个针对癌症信息的 TikTok 搜索错误信息暴露大规模审计;(2)量化不同信息寻求框架对应的暴露差异;(3)刻画错误信息在排名上的分布,并比较症状察觉期与积极治疗期;(4)示范一套可扩展的 LLM/VLM 患者向搜索系统审计管线。

I. Theoretical Framework & Hypotheses(理论框架与假设)

设计逻辑:围绕“信任维度”构造查询框架。主操纵因素是表达信息需求的语言。医学信息(Medical Information)与替代医学(Alternative Medicine)对常规诊疗分别表达接受拒绝,二者共同界定审计所围绕的信任维度。替代医学框架以两种方式表达拒绝:寻求非标准疗法(“breast swelling herbal remedies”“holistic breast cancer recovery”),以及不点名任何疗法、只表达回避或拒绝临床诊疗(“avoid biopsy breast lump”“doctors overreact to breast lumps”“refused chemo breast cancer”)。后一类不请求任何替代医学内容、只表达不信任;若它们仍高比例召回错误信息,则该模式不能单纯用替代医学词汇的主题相关性解释。

病友叙事(Peer Narrative)作为对照。它寻求其他患者的叙述(既有支持寻求,如“breast cancer not alone”,也有经由他人经验的信息寻求,如“people who ignored breast changes”),使用外行、非临床词汇,但在常规与替代医学之间不表态。作者强调它“既非两极的中点,也非无立场的搜索者”,而是一种同样有明确目标的独立取向;其功能是检验暴露升高源于外行语言本身,还是源于信任维度上的替代医学一极。作者也承认三种框架都代表已进入某一信息框架的搜索者,设计中没有“无定向搜索者”条件,而这类人可能最具政策相关性,因为最容易被排序结果所左右。

第二因素:患者旅程阶段。症状察觉期(Symptom Noticing,确诊前解读症状)与积极治疗期(Active Treatment,确诊后做出或经历治疗决策)。

编码框架来源。三个标注维度(存在性、类型、话题)改编自相关工作中为 Reddit 帖子开发的多维癌症错误信息分类(在审稿件),保留可用于视频内容的维度;类型维度的七种机制取自 Wardle 与 Derakhshan 的信息失序(information disorder)类型学;话题维度为作者对既往健康与癌症错误信息研究的操作化,而非照搬单一来源。

编号研究问题对应设计 / 理论
RQ1 框架在固定搜索语境内,不同查询框架下 TikTok 搜索结果的错误信息暴露率有何差异?信任维度(接受—拒绝常规诊疗)+ 病友叙事对照
RQ2 语境症状察觉期与积极治疗期的暴露是否不同?患者旅程阶段;对风险敏感排序的规范性预期
RQ3 排名错误信息在排序结果列表中如何分布?搜索排序审计;逆排名位置加权暴露
RQ4 评论被标为错误信息与未被标为错误信息的视频,其评论内容有何差异?评论区语境;独立标注下的共现分析

M. Materials & Methods(材料与方法)

R. Results(结果)

R0 总体:7,199 条癌症相关结果中 1,571 条(21.8%)被标为可能含错误信息;以全部 9,020 条(含非癌症相关)为分母为 17.4%。癌症相关性本身随条件变化:替代医学-症状察觉期的相关池最小(n = 1,011),因“holistic breast health tips”“breast lump massage”等查询召回大量无明确癌症框架的泛健康内容——替代医学框架召回的内容池主题更松散、错误信息也更密集。

表 1 · 各条件错误信息率(癌症相关结果)

查询框架搜索语境阳性 / n比率95% Wilson CI
医学信息症状察觉88 / 1,4056.3%[5.1%, 7.7%]
医学信息积极治疗87 / 1,2297.1%[5.8%, 8.7%]
病友叙事症状察觉41 / 1,0743.8%[2.8%, 5.1%]
病友叙事积极治疗33 / 1,0323.2%[2.3%, 4.5%]
替代医学症状察觉547 / 1,01154.1%(医学信息的 8.6×)[51.0%, 57.2%]
替代医学积极治疗775 / 1,44853.5%(医学信息的 7.6×)[50.9%, 56.1%]

表 2 · Logistic 回归(参照:医学信息 × 症状察觉;账号 × 查询双向聚类标准误)

变量β̂OR95% CIp结论
截距−2.710.07[0.04, 0.11]< 0.001
替代医学+2.8717.64[8.35, 37.29]< 0.001显著
病友叙事−0.520.59[0.31, 1.15]0.121不显著
积极治疗+0.131.14[0.58, 2.24]0.703不显著
替代医学 × 积极治疗−0.150.86[0.33, 2.26]0.754不显著
病友叙事 × 积极治疗−0.310.73[0.25, 2.09]0.558不显著

表 3 · 分类器验证(二元存在性)

模型nPRF1AccMCCκ
GPT-5.4-nano500.840.840.840.880.750.75
GPT-5.4-mini501.000.680.810.880.760.73
Gemini 3.1 Pro Preview500.920.630.750.840.660.64
模型对(n = 386)一致率MCCκ
Nano–Mini0.92(正文 91.7%)0.740.73
Nano–Gemini0.92(正文 91.7%)0.740.73
Mini–Gemini0.96(正文 96.4%)0.870.87

表 D.1 · 稳健性:变分贝叶斯 logistic 混合模型(账号、查询交叉随机截距)

变量后验均值 β̂OR近似 95% OR 区间
截距−3.080.05[0.04, 0.05]
替代医学3.0721.49[19.66, 23.49]
病友叙事−0.510.60[0.47, 0.76]
积极治疗0.001.00[0.91, 1.10]
替代医学 × 积极治疗0.281.32[1.18, 1.47]
病友叙事 × 积极治疗−0.470.62[0.44, 0.89]

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((乳癌搜索错误信息审计))
    I 引言
      越来越多人上网查癌症
      既有审计多盯推荐流
      搜索由用户主动表达
      只描述内容未测暴露
      乳腺癌尚无研究
    R 问题
      RQ1 问法差异
      RQ2 就诊阶段差异
      RQ3 排名分布
      RQ4 评论区差异
    M 方法
      三乘二傀儡账号实验
      30个新账号 84条查询
      病友帖子驱动生成查询
      9020条结果 7199条相关
      看图模型盲评截图
      人工50条 kappa 0.75
      双向聚类逻辑回归
    R 结果
      替代医学约五成四
      医学信息仍有6至7%
      OR 17.64 p小于0.001
      阶段无差异 p=0.703
      前十位89.5%含错误
      评论区35.9对9.7
    a 讨论
      关键是立场非白话
      专业词汇不能免疫
      不分阶段即安全缺口
      清理召回池而非首屏
      评论区纠错提示
    D 结论
      问法强关联暴露
      搜索应与推荐并审
      模型辅助人工把关

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。