🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
越来越多的人会在短视频平台上查健康信息,包括琢磨身体的异常症状和纠结要不要接受治疗。
你有没有想过这样一个场景:两位女性都在乳房里摸到一个肿块,一位搜“乳房肿块活检流程”,另一位搜“天然方法缩小乳房肿块”。她们在屏幕上看到的,会是同一个世界吗?
过去的研究已经发现,TikTok 上的癌症内容里有不少错误和低质量信息,还存在专门讲“替代疗法”的圈子;而社交媒体上的错误信息往往比准确信息传得更快、更远。系统综述估计,在被研究过的健康类社交媒体内容里,含错误信息的比例从两成到将近九成不等。
但以往给平台“做体检”的算法审计,大多盯着推荐流——也就是 TikTok 的“为你推荐”页。那里你看到什么,主要取决于平台从你过去的点赞、停留里猜出来的偏好。搜索却不一样:用户是自己敲字、主动说出“我想知道什么”。这样一来,你看到什么,既取决于平台怎么排序,也取决于你怎么问。
这个区别在癌症这种高风险领域特别要紧。病人往往是在最焦虑、最拿不准的时候去搜索的;可此前的研究大多只描述平台上“有什么内容”,没有测过用不同方式提问的人实际“被推到眼前的是什么”,也没有人专门研究过乳腺癌。
② 研究问题(要回答什么?)
这篇论文想弄清楚的是,在 TikTok 搜索里,用户提问的方式会不会系统性地影响自己接触到多少乳腺癌错误信息。
作者把“提问方式”分成三种立场:相信正规医学、想弄懂检查和治疗流程的人;怀疑甚至回避正规医学、想找天然疗法的人;以及想听听病友亲身经历的人。再把搜索的时机分成两段:刚发现身体异常、还没确诊,和已经确诊、正在治疗。在此基础上,作者提出了四个研究问题。
具体如下:
- 问题一(问法):在同一个阶段里,三种提问方式搜出来的错误信息比例差多少?
- 问题二(阶段):确诊前去搜和确诊后正在治疗时去搜,碰到的错误信息多少有没有差别?
- 问题三(排名):错误信息是扎堆在搜索结果最前面几条,还是从头到尾都有?
- 问题四(评论区):被判为错误信息的视频,它们的评论区和其他视频的评论区有什么不同?
其中第二个问题特别有现实分量:一个正在犹豫要不要做化疗的人,按理说最需要平台多加一层保护——平台做到了吗?
③ 研究方法(怎么做的?)
作者用的办法叫“傀儡账号审计”,有点像消费者协会派“神秘顾客”去门店暗访:研究者自己注册一批全新的账号,让程序按事先写好的剧本去搜索,再把平台返回的内容原样记下来。
第一步,画实验格子。“问法”分三种、“阶段”分两种,交叉成六个实验条件。医学信息型接受正规诊疗,想弄懂流程(如“核心针穿刺活检”“化疗期间输液港护理”);替代医学型站在对立面,一类是找偏方(如“乳房肿胀草药疗法”),另一类根本不提偏方、只表达对医生的不信任(如“避免乳房肿块活检”“医生对乳房肿块反应过度”“拒绝化疗 乳腺癌”);病友故事型想听别人的经历(如“乳腺癌 你不孤单”),它说的是大白话,但对正规医学和替代医学都不表态,专门用来当对照组——检验错误信息变多到底是因为“说话不专业”,还是因为“倾向替代医学”。
第二步,写搜索词。作者从 Reddit 的乳腺癌病友社区抓取了评论最多的 1,155 条帖子标题,当作“病人真实说话方式”的样本,交给大语言模型 GPT-5.4-mini,让它按每个条件写出 14 条 TikTok 风格的短搜索词,一共 84 条,再由人工逐条检查是否符合设定。这些帖子标题本身并不拿去搜索。
第三步,派账号去搜。30 个全新账号,每个条件 5 个。2026 年 5 月 15 日到 21 日,在美国用 TikTok 网页版,每个账号每天搜两次、连搜七天,每次打开最多前 25 条视频、每条截 5 张图并抓下评论。账号不点赞、不评论、不收藏、不转发、不关注任何人。除了搜索词不同,所有条件的自动化程序、地点、账号设置和模拟的用户画像(45 岁女性、每天刷 TikTok、健康素养中等)都一样。最后得到 420 次搜索、9,020 条结果,其中 7,199 条和癌症有关。
第四步,请 AI 当“阅卷老师”。每条视频取第 3 张截图,把评论区遮掉,交给能看图的 AI 模型 GPT-5.4-nano 判断:和癌症有没有关系?有没有在宣传或背书一个可能造成伤害的、错误或缺乏科学依据的癌症说法?如果有,是哪种造假方式、哪个话题?模型看不到搜索词,也不知道属于哪个实验条件。只是提到、质疑或纠正某个错误说法,不算;单纯讲个人经历也不算,除非在推销有害的无依据说法或劝人放弃正规治疗。评论区则另外单独用文字模型判断。
第五步,检查阅卷老师靠不靠谱。作者拿 50 条人工标注过的样本来对答案,还让另外两个模型用同样的提示重判一遍,看彼此是否一致。统计时,作者考虑到“同一个账号”“同一条搜索词”下的结果并不相互独立,用了更保守的误差算法。
④ 结果(发现了什么?)
结果非常醒目:带着替代医学倾向去搜,搜到的癌症相关视频里有一半多被判为可能的错误信息。
先看总账:30 个账号一共搜出 9,020 条视频,其中 7,199 条和癌症有关,这里面有 1,571 条(21.8%)被判为可能含错误信息。
替代医学型:确诊前 1,011 条相关视频里有 547 条是错误信息(54.1%),治疗期 1,448 条里有 775 条(53.5%)。医学信息型只有 6.3% 和 7.1%;病友故事型最低,3.8% 和 3.2%。替代医学型分别是医学信息型的 8.6 倍和 7.6 倍。统计模型显示,替代医学型让一条结果“是错误信息”的胜算变成医学信息型的 17.64 倍(p < 0.001,非常非常显著);病友故事型和医学信息型的差别则不显著(p = 0.121)。
确诊前和确诊后去搜,错误信息比例没有统计上能检出的差别(胜算比 1.14,p = 0.703);问法和阶段之间也没有“叠加效应”(联合检验 p = 0.841)。
以替代医学型、确诊前为例:第 1–5 位的错误信息比例是 63.8%,第 11–25 位仍有 48.9%。在出现过错误信息的结果列表里,第一条错误信息的位置中位数是第 2 位;76 个结果列表中有 68 个(89.5%)在前 10 条里至少有一条错误信息。
在抓到评论的视频里,错误信息视频的评论区有 35.9%(379/1,056)也出现了错误说法,其他视频只有 9.7%(323/3,313),胜算比 5.18,p < 0.001。作者强调这只是“同时出现”,不能说明谁导致了谁。
两个刺眼的单条例子。搜“natural ways to reduce breast lump”(天然方法缩小乳房肿块),94 条癌症相关结果里有 87 条(92.6%)被判为错误信息。更出人意料的是,搜“evidence based breast cancer recovery”(循证的乳腺癌康复)这种一听就很专业的词,55 条里也有 15 条(27.3%)是错误信息。
错误信息都在说什么?最多的是宣传未经证实的疗法或替代疗法(1,135 条,占 72.2%),其次是质疑常规治疗的安全和效果(24.6%),以及关于诊断和筛查的误导(20.9%)。替代医学型里八成以上(81.8%)在讲替代疗法;而医学信息型和病友故事型里,最常见的是诊断和筛查方面的误导(44.6% 和 50.0%)。从“怎么造假”看,三种问法下都以“误导内容”为主,也就是歪曲、夸大、过度简化或选择性呈现事实的内容。
AI 阅卷靠谱吗?在 50 条人工标注样本上,GPT-5.4-nano 判对 44 条(准确率 0.88),精确率、召回率都是 0.84,和人工答案的一致性系数 κ = 0.75,错判方向也很均衡(多判 3 条、漏判 3 条)。换另外两个模型重判 386 条,两两一致率都在九成以上。
⑤ 讨论(这些发现说明什么?)
这项研究最巧妙的地方,是用“病友故事型”问法做了一个对照。
有人可能会想:替代医学型搜出的错误信息多,是不是只因为用的是大白话、不够专业?可病友故事型同样说大白话(比如“乳腺癌互助社区”“姐妹们分享化疗故事”),它的错误信息比例反而最低(3.8% 和 3.2%),比医学信息型还低一点,只是差别在统计上不显著。所以作者认为,让错误信息变多的不是“说话不专业”,而是“倾向替代医学”这个立场本身。不过作者也提醒:这几种问法不只是措辞不同,想问的话题和意图也不同,要彻底分开这几种因素,还得设计“意思相同、只换说法”的实验。
第二个值得警惕的发现,是平台不区分病人处在哪个阶段。按理说,一个正在犹豫要不要开始化疗的人,比一个刚摸到肿块的人更经不起误导——劝人放弃化疗、放疗或手术的内容,可能直接导致治疗被耽误、减量甚至放弃,而且这些决定时间紧、往往无法挽回。可数据显示,两个阶段搜到的错误信息比例几乎一样。作者把这种“一视同仁”本身看作一个安全缺口,同时强调这是关于平台“应当如何对待不同搜索”的推论,并不是在证明算法有意为之。
那平台能做什么?作者提了三条思路。第一,既然错误信息从头到尾都有,只调整最前面几条可能不够,要减少这些搜索词能召回的整个内容池里的错误信息,并在搜索词层面加上“引导到权威信息”的保护。第二,错误视频的评论区更容易出现错误说法,可以试试纠错提示、权威置顶回复和经过核实的健康信息链接。第三,对明确表达“拒绝化疗”“不做放疗”“化疗替代方案”这类意图的搜索,加大权威引导和降权力度。
至于 AI 阅卷,作者的态度很克制:它适合帮研究者做大规模的总体审计,或者给人工审核先筛一遍,而不适合直接替平台自动删帖。研究也有明确的边界:人工核对样本只有 50 条,且只核对了“是不是错误信息”,没核对类型和话题;每条视频只看了一张截图,可能漏掉其他时间点出现的说法;只测了搜索,没测推荐页;七天里账号可能积累了浏览记录;搜索词由 AI 生成,可能漏掉真实病人的说法;一周时间也看不出随时间的变化。还有一类人没被测到——完全不知道该搜什么、也没有任何立场的人,作者认为这类人恰恰最容易被排序结果带着走。
⑥ 结论(最终结论 + 启示)
这项研究说明,在 TikTok 上搜乳腺癌信息时,你怎么提问,在很大程度上关系到你会碰到多少错误信息。
把数字串起来看:7,199 条癌症相关结果里有 1,571 条(21.8%)可能含错误信息;带着替代医学倾向去搜,错误信息比例在两个阶段分别约是按医学思路搜的八倍半和七倍半;即便用了专业医学词汇,也仍有 6.3%–7.1%;而且错误信息不只挤在最前面几条。
对普通人来说,启示很实际:搜索框里的措辞并不中性,“天然方法”“不做活检”“拒绝化疗”这样的词,会把你带进一个错误信息浓度很高的内容池。对平台来说,治理不能只盯推荐算法,也要审计搜索;不能只清理第一屏,而要清理整个召回池;对和治疗决策相关的高风险搜索,应当有更强的保护。对研究者来说,“用病友社区的语言让大模型生成搜索词、再让看图模型阅卷”这套流程可以推广到其他健康话题和平台,但要配合人工把关,而不是让 AI 单独做内容审核的决定。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。越来越多的人借助社交媒体理解症状、诊断与治疗决策;癌症错误信息在平台上可获得可观互动,而错误信息较准确内容传播得更快、更远(Vosoughi 等,2018)。针对 TikTok 癌症内容的既有研究已记录了大量错误与低质量信息(妇科癌症、前列腺癌),并识别出视觉上可区分的替代健康癌症讨论社群;系统综述估计被研究的健康类社交媒体内容中 20–87% 含错误信息。
空白一:审计对象偏向推荐流。算法审计传统涵盖过滤气泡与激进化路径、Google 搜索党派偏差、电商平台疫苗错误信息等议题,方法从平台痕迹的观察分析、真实用户浏览数据,到傀儡账号审计与估计推荐系统因果作用的反事实代理设计。TikTok 上的傀儡账号审计集中于“为你推荐”页(FYP),其曝光由跨会话累积的行为信号驱动;搜索较少被审计。YouTube 搜索审计(Hussein 等,2020)显示观看历史可改变返回结果中错误信息的占比,疫苗类查询尤甚。
空白二:描述“存在什么”而非“暴露给谁”。既有 TikTok 癌症研究刻画的是平台上可得的内容,而非用户在不同查询下实际被暴露的内容,且均未涉及乳腺癌。搜索与推荐的根本差异在于用户在每次交互中显式陈述信息需求,暴露因此同时取决于排序算法与查询表述——作者举例,“natural ways to shrink a breast lump”与“breast lump biopsy procedure”体现的是根本不同的信息寻求取向。
空白三:可扩展的自动标注。公共卫生主张的自动事实核查通常把主张与检索到的外部证据配对;视频场景下多模态方法融合文本、视觉与社交信号,结构上最接近的是 FakeSV 短视频假新闻基准(融合帧级视觉特征、屏幕文字与评论语境),但其为监督训练模型。本研究改用零样本提示的通用视觉语言模型(GPT-5.4-nano),延续“LLM 作为社会科学测量标注器”的路线,并以人工标签校验。
贡献。(1)首个针对癌症信息的 TikTok 搜索错误信息暴露大规模审计;(2)量化不同信息寻求框架对应的暴露差异;(3)刻画错误信息在排名上的分布,并比较症状察觉期与积极治疗期;(4)示范一套可扩展的 LLM/VLM 患者向搜索系统审计管线。
I. Theoretical Framework & Hypotheses(理论框架与假设)
设计逻辑:围绕“信任维度”构造查询框架。主操纵因素是表达信息需求的语言。医学信息(Medical Information)与替代医学(Alternative Medicine)对常规诊疗分别表达接受与拒绝,二者共同界定审计所围绕的信任维度。替代医学框架以两种方式表达拒绝:寻求非标准疗法(“breast swelling herbal remedies”“holistic breast cancer recovery”),以及不点名任何疗法、只表达回避或拒绝临床诊疗(“avoid biopsy breast lump”“doctors overreact to breast lumps”“refused chemo breast cancer”)。后一类不请求任何替代医学内容、只表达不信任;若它们仍高比例召回错误信息,则该模式不能单纯用替代医学词汇的主题相关性解释。
病友叙事(Peer Narrative)作为对照。它寻求其他患者的叙述(既有支持寻求,如“breast cancer not alone”,也有经由他人经验的信息寻求,如“people who ignored breast changes”),使用外行、非临床词汇,但在常规与替代医学之间不表态。作者强调它“既非两极的中点,也非无立场的搜索者”,而是一种同样有明确目标的独立取向;其功能是检验暴露升高源于外行语言本身,还是源于信任维度上的替代医学一极。作者也承认三种框架都代表已进入某一信息框架的搜索者,设计中没有“无定向搜索者”条件,而这类人可能最具政策相关性,因为最容易被排序结果所左右。
第二因素:患者旅程阶段。症状察觉期(Symptom Noticing,确诊前解读症状)与积极治疗期(Active Treatment,确诊后做出或经历治疗决策)。
编码框架来源。三个标注维度(存在性、类型、话题)改编自相关工作中为 Reddit 帖子开发的多维癌症错误信息分类(在审稿件),保留可用于视频内容的维度;类型维度的七种机制取自 Wardle 与 Derakhshan 的信息失序(information disorder)类型学;话题维度为作者对既往健康与癌症错误信息研究的操作化,而非照搬单一来源。
| 编号 | 研究问题 | 对应设计 / 理论 |
|---|---|---|
| RQ1 框架 | 在固定搜索语境内,不同查询框架下 TikTok 搜索结果的错误信息暴露率有何差异? | 信任维度(接受—拒绝常规诊疗)+ 病友叙事对照 |
| RQ2 语境 | 症状察觉期与积极治疗期的暴露是否不同? | 患者旅程阶段;对风险敏感排序的规范性预期 |
| RQ3 排名 | 错误信息在排序结果列表中如何分布? | 搜索排序审计;逆排名位置加权暴露 |
| RQ4 评论 | 被标为错误信息与未被标为错误信息的视频,其评论内容有何差异? | 评论区语境;独立标注下的共现分析 |
M. Materials & Methods(材料与方法)
- 识别策略:受控傀儡账号(sock-puppet)审计,
3 × 2析因设计(查询框架 × 搜索语境),共 6 个条件。各条件共享同一浏览器自动化、采集流程、地理位置、账号设置与模拟用户画像(45 岁女性、每日使用 TikTok、中等健康素养),唯一的系统性差异是查询措辞,据此分离“查询框架与返回结果之间的关联”。由于代理必须打开视频截图并抓取评论、TikTok 可能记录了观看与点击,作者把结果界定为“标准化搜索-观看个性化条件下的观测暴露”,而非无状态搜索引擎的输出。 - 账号与采集:30 个全新 TikTok 账号,每条件 5 个(捕捉账号间变异);每条件 14 条独立查询,共 84 条;每个账号每天搜索 2 次、持续 7 天。一次搜索会话 = 一个账号发出一条查询并采集最多前 25 条结果;共 420 次观测会话、9,020 条搜索结果,其中 7,199 条癌症相关。采集于 2026 年 5 月 15–21 日,美国,TikTok 网页端。代理不点赞、不评论、不收藏、不分享、不关注;每条结果播放过程中截取 5 张截图并抓取评论。选择乳腺癌的理由:美国最常见癌症之一,且有大型活跃的 Reddit 社区可为查询语言提供依据。
- 查询构造:以 RedditExtractoR 抓取 r/breastcancer 评论数最多的 1,155 条帖子标题作为社区语言种子(按评论数排序以选取社区最投入的叙事类型;标题本身不作为查询发出)。对每个条件,以(i)目标框架与搜索语境描述、(ii)Reddit 种子标题提示 GPT-5.4-mini 生成简短的 TikTok 风格查询,每条件 14 条(7 天 × 每天 2 条);全部查询经人工复核与所分配框架及语境一致(附录表 C.1、C.2 列全 84 条)。条件指令含排他约束,例如医学信息-症状察觉期“不得寻求个人故事、替代解释或回避医疗的方法”,替代医学-积极治疗期“寻求自然或替代癌症疗法、拒绝或减少常规治疗的故事、质疑化疗/放疗/激素治疗的内容,不得请求临床信息或支持常规治疗的内容”。
- 视频内容编码(VLM):生产分类器 GPT-5.4-nano(
gpt-5.4-nano-2026-03-17),零样本结构化提示。每条记录只用第 3 张截图,以版面感知遮罩去除评论面板、保留视频与可见帖子信息;模型不获知评论、互动数、搜索查询或实验条件。输出字段:截图可用性及不可用原因、癌症相关性及置信度(0–1)、错误信息存在性、主类型 + 至多 2 个附加类型、主话题 + 至多 2 个附加话题、中性主张转述与 1–3 条可见证据、整体分类置信度(0–1)。 - 编码方案:
· 存在性:可见内容呈现、推销或背书一个具体的、可能造成伤害的虚假/误导/缺乏科学依据的癌症主张即为阳性;仅提及、质疑、批评或纠正虚假主张不算;个人经历本身不算,除非推销有害无据主张或鼓励拒绝/回避标准癌症治疗。提示给出 5 个示例主张族(未经证实或无效疗法;歪曲或选择性使用事实;过时或脱离语境的医学信息;阴谋叙事;基于无据癌症主张的商业推广),仅辅助判断、不作为类别。
· 类型(7 + 其他):捏造内容、误导内容、虚假语境、虚假关联、冒名内容、篡改内容、讽刺/戏仿。
· 话题(7 + 其他):病因/风险因素/预防;诊断与筛查;常规治疗的安全与有效性;未经证实或替代疗法;阴谋与制度不信任;道德/宗教/意识形态;医疗自主与医疗自由。
· 规则:“其他”不得与具名标签并用;非癌症截图不得获阳性标签;阴性时类型、话题、主张、证据字段全空。 - 评论编码:独立的 GPT-5.4-nano 纯文本分类,仅依据抓取的评论字符串判定错误信息存在性、类型与话题(同一词表,至多 3 个类型与话题);创作者文案与屏幕文字仅用于判断评论对视频信息是支持、挑战、混合还是无关;该分类器看不到视频截图及其标签。
- 编码信度:50 条人工标注子集(19 正、31 负)为参照,计算 P / R / F1 / Acc / MCC / Cohen’s κ;另以相同提示、输出结构与去评论截图,让 GPT-5.4-mini 与 Gemini 3.1 Pro Preview 重判,在 386 条评估样本上计算两两一致率、MCC 与 κ。全部信度指标只针对二元存在性,类型与话题未经人工验证。
- 暴露率与位置加权:比率一律报告 95% Wilson 置信区间。位置加权暴露
PW = Σi(mi / ranki) / Σi(1 / ranki),mi = 1表示第 i 次出现为错误信息。PW 与原始比率同尺度:接近原始率表示排名分布大致均匀,显著高于原始率表示头部集中。 - 主推断模型:癌症相关结果上的二项 logistic 回归,固定效应为框架、语境及其交互,参照组为“医学信息 × 症状察觉期”。按原文设定写作
logit P(Misinfoi = 1) = β0 + β1AltMedi + β2Peeri + β3ActiveTxi + β4AltMedi×ActiveTxi + β5Peeri×ActiveTxi。标准误按账号与查询双向聚类稳健(同一查询由 5 个复制账号发出,结果非独立,忽略会低估不确定性);两个交互系数以联合 Wald 检验。 - 稳健性:(1)去重分析,每个账号-条件-日保留覆盖度最高的一次采集;(2)分别按账号、按查询分组的广义估计方程(GEE);(3)含账号与查询交叉随机截距的变分贝叶斯 logistic 混合模型(附录 D)。
- 分类与评论分析:类型、话题分布以错误信息阳性的癌症相关暴露为分母,主、附加标签每类每条至多计一次,百分比可超 100%;视频标签与评论结局的关联以优势比与 Fisher 精确检验概括。
R. Results(结果)
R0 总体:7,199 条癌症相关结果中 1,571 条(21.8%)被标为可能含错误信息;以全部 9,020 条(含非癌症相关)为分母为 17.4%。癌症相关性本身随条件变化:替代医学-症状察觉期的相关池最小(n = 1,011),因“holistic breast health tips”“breast lump massage”等查询召回大量无明确癌症框架的泛健康内容——替代医学框架召回的内容池主题更松散、错误信息也更密集。
表 1 · 各条件错误信息率(癌症相关结果)
| 查询框架 | 搜索语境 | 阳性 / n | 比率 | 95% Wilson CI |
|---|---|---|---|---|
| 医学信息 | 症状察觉 | 88 / 1,405 | 6.3% | [5.1%, 7.7%] |
| 医学信息 | 积极治疗 | 87 / 1,229 | 7.1% | [5.8%, 8.7%] |
| 病友叙事 | 症状察觉 | 41 / 1,074 | 3.8% | [2.8%, 5.1%] |
| 病友叙事 | 积极治疗 | 33 / 1,032 | 3.2% | [2.3%, 4.5%] |
| 替代医学 | 症状察觉 | 547 / 1,011 | 54.1%(医学信息的 8.6×) | [51.0%, 57.2%] |
| 替代医学 | 积极治疗 | 775 / 1,448 | 53.5%(医学信息的 7.6×) | [50.9%, 56.1%] |
表 2 · Logistic 回归(参照:医学信息 × 症状察觉;账号 × 查询双向聚类标准误)
| 变量 | β̂ | OR | 95% CI | p | 结论 |
|---|---|---|---|---|---|
| 截距 | −2.71 | 0.07 | [0.04, 0.11] | < 0.001 | — |
| 替代医学 | +2.87 | 17.64 | [8.35, 37.29] | < 0.001 | 显著 |
| 病友叙事 | −0.52 | 0.59 | [0.31, 1.15] | 0.121 | 不显著 |
| 积极治疗 | +0.13 | 1.14 | [0.58, 2.24] | 0.703 | 不显著 |
| 替代医学 × 积极治疗 | −0.15 | 0.86 | [0.33, 2.26] | 0.754 | 不显著 |
| 病友叙事 × 积极治疗 | −0.31 | 0.73 | [0.25, 2.09] | 0.558 | 不显著 |
- RQ1 框架:替代医学是唯一显著的非截距系数(OR = 17.64,p < 0.001);病友叙事与医学信息之差不显著,点估计低于基线——暴露升高并非外行措辞的一般属性,而是追踪替代医学取向。极端查询“natural ways to reduce breast lump”(症状察觉期)94 条癌症相关结果中 87 条(92.6%)为阳性。
- RQ2 语境:积极治疗主效应不显著(OR = 1.14,p = 0.703),两交互项均不显著,联合 Wald
χ²(2) = 0.35,p = 0.841——框架差距在两阶段同样大。 - RQ3 排名(替代医学-症状察觉期):第 1–5 位合并比率 63.8%,第 11–25 位 48.9%;逆排名加权暴露 PW = 59.2%,高于原始 54.1%,有一定头部加权但不局限于前几位;在含至少一条错误信息的列表中,首条错误信息排名中位数为 2.0;76 个列表中 68 个(89.5%)在前 10 位内至少有一条错误信息。
- 意图-暴露错配:医学信息框架即便使用明确的临床词汇仍有 6.3%–7.1%;查询“evidence based breast cancer recovery”的 55 条癌症相关结果中 15 条(27.3%)为阳性。
- 话题(分母 1,571,含主、附加标签):未经证实/替代疗法 1,135(72.2%)、常规治疗安全有效性 387(24.6%)、诊断与筛查 329(20.9%)。分框架(替代医学 n = 1,322;医学信息 n = 175;病友叙事 n = 74):替代医学阳性中 81.8% 涉未经证实/替代疗法、24.8% 涉常规治疗安全有效性、16.2% 涉诊断筛查;医学信息与病友叙事阳性中诊断与筛查居首(44.6%、50.0%),未经证实/替代疗法分别占 21.7%、20.3%(描述性比较)。
- 类型:误导内容在三框架下均占主导(替代医学 91.1%、医学信息 98.9%、病友叙事 98.6%);替代医学结果获冒名内容(12.9%)、虚假关联(10.8%)、虚假语境(8.5%)标签的频率高于另两框架。
- RQ4 评论区:评论可见——错误信息视频 1,224/1,571(78.0%)vs 非错误信息视频 4,019/5,586(71.9%),OR = 1.38,p < 0.001。在评论被成功抓取并标注的子集中,评论含错误信息——错误信息视频 379/1,056(35.9%)vs 非错误信息视频 323/3,313(9.7%),OR = 5.18,p < 0.001。两套标签独立生成,作者只作共现解读。
- 查询与账号异质性(全部结果为分母):替代医学单条查询的错误信息率在症状察觉期为 0%–87.9%、积极治疗期为 24.8%–76.9%;医学信息为 0%–16.7% 与 0%–25.9%;病友叙事为 0%–7.4% 与 0%–15.9%;同一查询在不同账号间亦有变异,但多数替代医学查询仍明显高于另两框架。
表 3 · 分类器验证(二元存在性)
| 模型 | n | P | R | F1 | Acc | MCC | κ |
|---|---|---|---|---|---|---|---|
| GPT-5.4-nano | 50 | 0.84 | 0.84 | 0.84 | 0.88 | 0.75 | 0.75 |
| GPT-5.4-mini | 50 | 1.00 | 0.68 | 0.81 | 0.88 | 0.76 | 0.73 |
| Gemini 3.1 Pro Preview | 50 | 0.92 | 0.63 | 0.75 | 0.84 | 0.66 | 0.64 |
| 模型对(n = 386) | 一致率 | MCC | κ |
|---|---|---|---|
| Nano–Mini | 0.92(正文 91.7%) | 0.74 | 0.73 |
| Nano–Gemini | 0.92(正文 91.7%) | 0.74 | 0.73 |
| Mini–Gemini | 0.96(正文 96.4%) | 0.87 | 0.87 |
- Nano 在人工子集上 16 真阳、28 真阴、3 假阳、3 假阴,误差对称;Mini 与 Gemini 更保守,误差主要为假阴。多模型间的高一致表明二元信号不依赖单一模型,但各模型决策边界位置不同。
表 D.1 · 稳健性:变分贝叶斯 logistic 混合模型(账号、查询交叉随机截距)
| 变量 | 后验均值 β̂ | OR | 近似 95% OR 区间 |
|---|---|---|---|
| 截距 | −3.08 | 0.05 | [0.04, 0.05] |
| 替代医学 | 3.07 | 21.49 | [19.66, 23.49] |
| 病友叙事 | −0.51 | 0.60 | [0.47, 0.76] |
| 积极治疗 | 0.00 | 1.00 | [0.91, 1.10] |
| 替代医学 × 积极治疗 | 0.28 | 1.32 | [1.18, 1.47] |
| 病友叙事 × 积极治疗 | −0.47 | 0.62 | [0.44, 0.89] |
- 随机截距标准差:账号 0.09,查询 1.14。该模型复现了大幅正向的替代医学对比与负向的病友叙事对比;作者指出变分贝叶斯的不确定性可能过窄,仅作方向性稳健检验,统计推断以主模型为准。
a / D. Discussion & Conclusion(讨论与结论)
- 发现一:暴露追踪替代医学取向,而非外行语言。在人口学与健康素养画像固定的条件下,替代医学查询的错误信息率高出一个量级,而同样使用外行词汇的病友叙事并无升高。作者据此主张:平台审计应测量跨查询框架的差异化暴露,而不应把这种模式归因于患者的素养或身份。
- 发现二:临床意图不足以免疫。医学信息查询仍返回 6.3%–7.1% 的可能错误信息,把 Hussein 等(2020)关于 YouTube 健康查询的搜索审计证据扩展到移动优先的短视频场景与高风险癌症信息。
- 发现三:阶段无差别即安全缺口。劝阻化疗、放疗或手术的内容可直接转化为治疗延迟、减量或放弃,且此类决策时间敏感、常不可逆;负责任的排序系统理应对治疗阶段查询施加更严审查,但数据显示暴露几乎完全由查询框架决定、在两阶段间统计上持平。作者明确这是关于平台应如何加权查询语境的规范性推论,而非对排序算法的因果论断——审计测量的是暴露而非意图。
- 健康错误信息与平台搜索治理启示(作者提出的三处干预点):
① 治理召回池而非仅治理首屏:替代医学查询中错误信息在高位之外依然常见,只改动前几位可能无法实质降低暴露,需降低这类查询所召回内容池的错误信息密度,并辅以查询级保护(如权威信息重定向);
② 评论区干预:错误信息视频评论含错误信息 35.9% vs 9.7%,纠正性助推、权威置顶回复、指向经核实健康信息的链接值得评估;
③ 阶段敏感保护:积极治疗期替代医学查询仍达 53.5%(医学信息的 7.6×),对表达拒绝或替代治疗意图的查询(“refused chemo breast cancer”“breast cancer without radiation”“chemo alternatives breast cancer”)应更强地适用权威重定向与降权;当前结果缺乏阶段敏感性,说明此类定向尚未发生。
这三点共同指向一个治理结论:搜索系统应与推荐算法并列纳入审计,且审计单元应落到查询意图层面。 - 方法论贡献:以病友社区 Reddit 标题为语言依据、由 LLM 生成条件专属查询,再由 VLM 辅助标注,构成可复现、可推广到其他健康议题与平台的受控查询词汇审计框架;Nano 对人工 κ = 0.75、对其他模型 κ = 0.73,作者据此认为其适用于总体审计与人在回路的分诊,而非自主内容审核。
- 作者自述局限:错误信息标签是模型辅助的审计标签而非临床判定;50 条人工子集过小,无法估计分框架或分语境的误差率,且类型与话题未经人工独立验证;只评估第 3 张截图,仅在视频其他时点出现的主张可能被漏判;只审计搜索,未覆盖 FYP 或搜索 + 推荐的组合暴露;七天协议中账号历史可能累积;各条件不仅措辞不同、话题与意图亦不同,替代医学查询本就在寻求替代医学内容,框架差距部分反映其召回的内容池,需配对改写设计才能分离;LLM 生成的查询可能遗漏真实患者与照护者词汇;一周窗口无法捕捉时间变异;设计中缺少无定向搜索者条件。
- 评注(本报告的阅读观察,非作者结论):
① “阶段无差异”是未检出而非等价性证明:主模型聚类单位为 30 个账号与 84 条查询,积极治疗主效应区间宽达 [0.58, 2.24];而附录 D 混合模型中替代医学 × 积极治疗 OR = 1.32 [1.18, 1.47]、病友叙事 × 积极治疗 OR = 0.62 [0.44, 0.89],区间均不含 1。作者以变分贝叶斯区间偏窄为由只作方向参考,但“平台完全不区分阶段”这一治理论断引用时宜保留余地。
② 查询随机截距标准差(1.14)远大于账号(0.09),结合单条查询 0%–87.9% 的离散,暴露变异主要落在查询层面,与作者“查询级保护”的建议相互印证。
③ 设计上用“只表达不信任、不点名疗法”的查询来排除主题相关性解释,但正文未单独报告这类查询的错误信息率,该论证缺少直接数字支撑。
④ 未报告人工标注者人数与人工间信度;去重分析与 GEE 两项稳健性检验正文未给数值。 - 资助与版本:抓取文本中未见资助说明;本文为 arXiv v1 工作论文,标注“subject to revision”。
🧠 IRMaD 思维导图
mindmap
root((乳癌搜索错误信息审计))
I 引言
越来越多人上网查癌症
既有审计多盯推荐流
搜索由用户主动表达
只描述内容未测暴露
乳腺癌尚无研究
R 问题
RQ1 问法差异
RQ2 就诊阶段差异
RQ3 排名分布
RQ4 评论区差异
M 方法
三乘二傀儡账号实验
30个新账号 84条查询
病友帖子驱动生成查询
9020条结果 7199条相关
看图模型盲评截图
人工50条 kappa 0.75
双向聚类逻辑回归
R 结果
替代医学约五成四
医学信息仍有6至7%
OR 17.64 p小于0.001
阶段无差异 p=0.703
前十位89.5%含错误
评论区35.9对9.7
a 讨论
关键是立场非白话
专业词汇不能免疫
不分阶段即安全缺口
清理召回池而非首屏
评论区纠错提示
D 结论
问法强关联暴露
搜索应与推荐并审
模型辅助人工把关
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。