🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
被确诊癌症的人和他们的家属,往往会在网上寻找答案。社交媒体因此成了一个特殊的空间:既有真实有用的经验交流和情感支持,也混杂着大量不靠谱的说法。
这件事的后果比一般的谣言严重得多。关于癌症的错误信息可能让人推迟治疗、放弃有效的方案,甚至去尝试有毒的偏方。更麻烦的是,这类内容在网上往往比正经的科普更容易被转发和讨论。
那么研究者是怎么应对的呢?过去的做法基本是给每条内容贴一个标签:真,或者假。
可现实远比这复杂。设想有人在论坛上写:“我听说化疗其实会加速扩散,是真的吗?”——这句话算不算错误信息?它没有断言什么,它在提问;发帖的人可能只是害怕,也可能是在传播怀疑。再比如有人分享亲身经历,里面九成是真的,只有一句判断错了。真假二分这把尺子,量不出这些差别。
② 研究问题(要回答什么?)
作者要解决的问题可以概括为一句话:能不能给癌症错误信息造一套更细的分类体系,并且让它在十几万条帖子的规模上真正跑得起来?
这拆成三个具体任务。第一,造一套多维度的分类框架——不只问真假,还要问:这条内容属于哪一类扭曲?危险程度多高?发帖者是在支持它、反驳它,还是在困惑地追问?它讲的是筛查、治疗,还是别的?
第二,检验大模型能不能替人做这件事。因为让肿瘤科医生手工读十几万条帖子完全不现实,可这套细分类又需要专业判断,所以必须弄清楚:给模型看几个专家标好的例子,它能不能学会这种细活?
第三,把框架真正用起来,看看癌症错误信息在真实社区里到底长什么样、集中在哪里。
③ 研究方法(怎么做的?)
第一步是收数据。作者在专家建议下选了四种癌症——乳腺癌、肺癌、结肠癌、前列腺癌,找到对应的 24 个 Reddit 子社区,通过历史存档接口抓取,原始共 243538 条帖子。剔除空帖、少于五个词的短帖、机器人账号发的内容,以及已删除的帖子后,剩下 134219 条。
第二步是造分类表。他们和领域专家一起设计了七个维度:是否含错误信息、涉及筛查还是治疗、发帖是在求助还是在分享、属于七种扭曲形式中的哪一种(比如虚假关联、误导性内容、伪造内容)、危险等级高中低、发帖者的立场是接受还是反驳还是追问、以及内容主题属于八类中的哪一类。
第三步是找专家标样本。因为错误信息在总量里占比很低,随机抽样会抽出一堆无关内容,浪费专家时间。作者先用几个大模型初筛,只保留四个模型意见一致的帖子,从中各取 200 条正例和 200 条负例,凑成 400 条的平衡标注集。标注工作由两位执业肿瘤科医生完成,他们同时也是本文作者。
第四步是挑模型。作者把 OpenAI、Claude、Gemini、Llama、Gemma、Qwen 等多个家族的模型都测了一遍,比较零样本和少样本两种提示方式,最后用一批留出的帖子做泛化检验,挑出表现最稳的那一个,去标注剩下的十三万多条。
④ 结果(发现了什么?)
专家标注的一致性、模型能否替代专家、以及全量数据的分布,三层结果依次展开,每一层都有出乎意料之处。
第一层,专家自己也难以完全一致。两位医生在“这条是不是错误信息”上的一致性很高(Cohen κ 达到 0.84),但越往细里走分歧越大:主题 0.60,立场 0.49,扭曲类型 0.46,而危险等级只有 0.28。这本身就是一个发现——判断一条信息有多危险,专家之间也未必看法相同。
第二层,大模型能胜任,但要给例子。在最基本的真假判断上,多个模型零样本就能达到 0.93 的 F1;只给一两个例子后,最好的组合达到 0.94,在留出的 62 条帖子上更是拿到 0.952。真正的差别出现在细维度上:判断扭曲类型时,模型零样本的 F1 只有 0.12,给四个例子后跳到 0.74;危险等级从 0.22 升到 0.52。
第三层,也是最反直觉的一层。在 133998 条帖子里,模型识别出 7949 条含错误信息,约占 6%。比例不高,但绝对数量可观。
发帖者的立场是
困惑追问,而非明确认同
主题是诊断与筛查
不是偏方神药
不实的替代疗法
只占很小一块
换句话说,大众想象中的“癌症谣言等于神奇偏方”,与真实数据不符。Reddit 上真正流行的,是围绕着乳腺 X 光检查、肠镜、化疗副作用的怀疑与困惑,以及对常规治疗安全性的不信任(占 37%)。
社区之间的差异也很大:前列腺癌社区的错误信息比例是 10.3%,肺癌社区 8.2%,而肠镜社区只有 3.5%。
⑤ 讨论(这些发现说明什么?)
这些结果对平台治理提出了一个相当棘手的难题。
最难处理的内容,恰恰不是那些明目张胆的假话。数据里占主导的是困惑式的讨论——有人把亲身经历和半真半假的判断混在一起说,有人只是在害怕中提问。你很难说这样一条帖子该被删除:它可能确实在传播错误认知,但它同时也是一个病人在寻求帮助。
作者由此指出一个平衡难题:在以同伴支持为规范的社区里,管得太严会压制正当的健康担忧,管得太松则会让误导性说法慢慢变成社区常识。所以他们主张,内容治理框架应该同时看类型、立场、风险和对话意图,而不是只看真假。
另一个值得记住的判断是:普遍程度不等于危害程度。数据里 73% 的错误信息被判为低风险,但少数高风险内容——劝人放弃循证治疗、推荐未经证实的干预——才是真正会造成伤害的。检测系统如果只按数量排序,恰好会漏掉最该管的那一小撮。
还有一点值得研究者自己警惕:那些一致性最低的维度(风险、立场、扭曲类型),也正是模型表现最差的维度。这说明分歧不只来自模型能力,更来自这些判断本身就带有主观性。
⑥ 结论(最终结论 + 启示)
这项研究交付了三样东西:一套七维度的癌症错误信息分类体系、一份由肿瘤科医生标注的数据集,以及一次十三万余条帖子规模的实证分析。
它最有价值的结论,是纠正了一个流行的印象。网络上的癌症错误信息,主流并不是耸人听闻的神奇疗法,而是围绕诊断、筛查和常规治疗安全性的不信任与困惑。由于早发现和及时治疗对癌症预后至关重要,哪怕是这类看起来温和的怀疑,也可能实实在在地影响一个人要不要去做检查。
作者也交代了局限:数据只来自 Reddit,用户偏年轻、偏英语世界,且抓取的都是相对有管理的专门社区,因此很可能低估了普通社区里错误信息的普遍程度和极端程度。此外,大规模标注最终仍由模型完成,模型的偏差会传递到结论里。
对健康传播实践而言,它给出的建议很具体:与其反复辟谣那些明显的偏方,不如把力气放在直接回应人们对检查和治疗的恐惧与不信任上。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
社交媒体已重塑个体寻求与交换健康信息的方式,在癌症社区中尤为关键——患者常处于高度不确定、情绪脆弱与复杂医疗决策之中。与此同时,平台也在传播癌症相关错误信息,且此类内容往往获得不成比例的高互动量(Loeb et al., 2024; Johnson et al., 2022)。暴露于关于预防、筛查、诊断或治疗的误导性信息,可能延误就医、降低循证干预的依从性,并提高有害或无效疗法的采用率。
既有研究已记录了大量线上癌症错误信息类型(未经证实的疗法、膳食干预、补充剂、神奇疗法、针对药企与医疗机构的阴谋叙事),也分析了使其具说服力的修辞策略(情感叙事、轶事证据、不信任框架)。然而该领域仍缺少一个可用于大规模刻画的统一计算框架:现有研究多依赖定性分析、小规模数据集,或无法捕捉框架化与修辞表达的二元标签。其后果是,捏造性主张、误导性解读、轶事证据与语境化的不确定性之间的重要区分始终未被充分探索(Wardle & Derakhshan, 2017)。
本文的三项贡献是:(1)提出用于建模在线癌症错误信息的多维分类体系;(2)构建并发布覆盖四大 Reddit 癌症社区的专家标注数据集;(3)在近 13.5 万条帖子规模上给出计算分析,揭示超越二元检测的语言学、主题与语境模式。
I. Theoretical Framework & Hypotheses(理论框架与假设)
分类体系并非从零构造,而是把既有的错误信息类型学(Wardle 2017;Wardle & Derakhshan 2017)与健康传播行为理论(Lambert & Loiselle 2007 的信息寻求 / 分享)以及立场检测研究(Küçük & Can 2020)接合到癌症语境中,共七个互补维度:
| 维度 | 类别 | 理论依据 |
|---|---|---|
| 是否含错误信息 | 是 / 否 / 不明 | Chou et al. (2018) 的健康错误信息定义:关于癌症风险因素、预防、诊断或治疗的虚假、误导或缺乏科学支持且可能导致有害后果的主张 |
| 癌症阶段 | 预防与筛查 / 治疗 / 其他 | 错误信息对预防行为与治疗依从性的下游后果不同(Nagler 2014) |
| 信息类型 | 寻求 / 分享 / 两者 / 皆非 | 健康传播行为区分(Lambert & Loiselle 2007) |
| 错误信息类型 | 讽刺或戏仿、虚假关联、误导性内容、错误语境、冒名内容、捏造内容、篡改内容 | Wardle 类型学,区分欺骗与扭曲的机制 |
| 风险等级 | 低 / 中 / 高 | 危害不仅取决于事实准确性,还取决于可操作性、可信度、传播潜力与剥削性(Sehat et al., 2024) |
| 对错误信息的立场 | 接受、接受+追问、反驳、反驳+追问、追问、其他 | 立场检测;混合类别取自 Pessianzadeh & Rezapour (2025),以刻画在线健康讨论的模糊性 |
| 错误信息主题 | 成因风险与预防、诊断与筛查、常规治疗的安全与有效性、未经证实或替代疗法、阴谋与机构不信任、道德宗教与意识形态、医疗自主与医疗自由、其他 | Kata (2010) 的健康错误信息主题划分 |
核心主张:癌症错误信息不应仅被理解为不准确的内容,而应被理解为具修辞说服力的话语——即便信息质量低,它仍能获取高互动。
M. Materials & Methods(材料与方法)
- 数据采集:经领域专家咨询选定四类癌症(乳腺、肺、结肠、前列腺),确定 24 个相关 subreddit;经 Arcticshift(Pushshift 历史存档接口)检索,原始 243538 条帖子。清洗规则:剔除空帖、词数少于 5 的帖、自动账号(如 AutoModerator)内容、以及标记为删除或移除的帖子(保护用户隐私),得最终语料 134219 条。
- 分层抽样构建标注集:因健康错误信息的基础发生率低,完全随机抽样会产出以非错误信息为主的样本、浪费稀缺的专家标注资源。流程为:先以开源模型
Qwen对子集做有 / 无错误信息初筛;再用GPT-5.4、GPT-5.2、Claude-Haiku-4.5对所有被 Qwen 判为错误信息的帖子、以及一份非错误信息的随机样本进行复判,仅保留四个模型标签完全一致者;从该池中各抽 200 条正 / 负例,构成 400 条平衡标注集。 - 专家标注:由本文两位作者完成,二人均为执业肿瘤科医生与癌症照护领域专家。采用层级式标注流程:先判定是否含错误信息,仅对判为“是”的帖子继续标注其余维度。工具为
Potato(Pei et al., 2022),配有定义各类别的详细码本。实际完成标注 221 / 400 条。 - 分类实验设计:与标注流程同构的层级化建模。任务 1 为错误信息判定,任务 2-7 为其余六个维度。模型覆盖 OpenAI、Claude、Gemini、
Meta-Llama-3.1-8B、gemma-4-31B-it、Qwen3.6-27B等多个家族。 - 提示策略:零样本(仅给任务指令与错误信息定义);少样本
k ∈ [1,5],每档包含 k 条正例与 k 条负例;两种设定下均另测思维链(CoT)提示,要求模型解释判断依据,并在判为错误信息时抽取支持该判断的具体文本证据。 - 数据划分:仅保留两位标注者一致的实例。任务 1 划分为:11 条用于提示词开发与少样本示例选择,130 条用于模型评估与选型,62 条作为留出测试集检验泛化性。
- 评价与生成设置:指标为精确率、召回率、
F1、真正率(TPR)与真负率(TNR);所有实验temperature = 0以保证确定性输出,其余生成参数取各 API 默认值。 - 叙事抽取:对模型抽取的证据句应用
LLooM(Lam et al., 2024),归纳反复出现的错误信息叙事主题。
R. Results(结果)
1. 标注者间一致性(Cohen's κ,221 条)
| 任务 | κ | 解读 |
|---|---|---|
| 任务 1:是否含错误信息 | 0.84 | 强可靠性 |
| 任务 3:信息类型 | 0.69 | 较高 |
| 任务 7:错误信息主题 | 0.60 | 较高 |
| 任务 2:癌症阶段 | 0.50 | 中等 |
| 任务 6:立场 | 0.49 | 中等 |
| 任务 4:错误信息类型 | 0.46 | 中等 |
| 任务 5:风险等级 | 0.28 | 评估潜在严重性与现实后果内含高度主观性 |
2. 错误信息判定(任务 1)
- 零样本:
GPT-5.5与Gemini 3.0 Flash并列最佳,F1 = 0.93;前者各指标最均衡,后者敏感度突出(TPR = 0.98)。多个模型达F1 ≈ 0.92;GPT-5.4-nano、GPT-4.1-nano、Meta-Llama-3.1-8B等小模型表现更弱且不稳定。 - 少样本:普遍带来一致提升,尤以小模型与此前不稳定的变体获益最大。最高 F1 = 0.94,由多个模型达成(GPT-5.5 在 k=1 与 k=3、GPT-5.2 在 k=1、GPT-5 在 k=1 与 k=4、GPT-4o 在 k=1、GPT-4.1 在 k=3、GPT-5-mini 在 k=5)。
GPT-5.5在全部 k 值上保持 0.92-0.94,稳定性最佳。 - 泛化检验(62 条留出集,仅评估验证集 F1 达 0.94 的模型):
GPT-5配 k=1 少样本最优——F1 = 0.952,精确率 0.95、召回率 0.95、TPR 0.96、TNR 0.95,据此选定为大规模标注模型。
3. 各维度分类性能(GPT-5 与 Gemini-3-Flash)
| 任务 | 最佳模型 / 设定 | 零样本 F1 | 最佳 F1 |
|---|---|---|---|
| 癌症阶段 | Gemini-3-Flash,2-4 shot | — | 0.96 |
| 错误信息主题 | GPT-5,多数设定 | — | 0.94 |
| 信息类型 | Gemini-3-Flash,各设定稳定 | — | 0.86-0.88 |
| 立场 | GPT-5,2-shot | — | 0.84 |
| 错误信息类型 | Gemini-3-Flash,4-shot | 0.12 | 0.74 |
| 风险等级 | Gemini-3-Flash,2-shot | 0.22 | 0.52 |
语义区分清晰的任务性能最高;少样本的最大增益出现在最细腻的维度上,印证了上下文示例对复杂错误信息范畴的必要性。
4. 全量标注结果(n = 133998):识别出 7949 条含错误信息的帖子,约占语料 6%。各维度分布:
- 癌症阶段:治疗相关占 41%,为最大类别,显示误导性主张集中在治疗决策与照护管理环节。
- 信息类型:同时包含寻求与分享的帖子占 45%,表明错误信息常在互动式讨论中扩散——用户一边求助一边分享未经核实的经验或主张。
- 错误信息类型:误导性内容 19%、冒名内容 10%、捏造内容 10% 为主要类别。
- 风险等级:低风险占 73%,中高风险较少见。
- 立场:追问式话语占 63%,显著高于明确接受(12%)与明确反驳(7%)——错误信息更多经由不确定、困惑与探索性讨论浮现,而非直接背书。
- 主题:诊断与筛查主张占 42%、常规治疗的安全性与有效性占 37%;未经证实或替代疗法仅占 10%。
5. 社区层面差异:高流量社区中,r/ProstateCancer 错误信息比例最高(10.3%),其次 r/lungcancer(8.2%)、r/coloncancer(7.1%);r/Prostatitis(2.0%)与 r/colonoscopy(3.5%)较低。若干小众社区比例极高——r/ProstateCancer_AS 51.4%、r/askcoloncancerdoctors 50%、r/ProstateTreatment 31.8%——但样本量有限,须谨慎解读。跨维度看,错误信息高度集中在同一批活跃社区中。
6. 叙事分析:LLooM 归纳出的主导主题为未经支持的治疗建议、替代疗法、劝阻循证照护;其余为扭曲的医学信息、与科学共识相悖的主张,以及围绕诊断、筛查与手术决策的误导内容。
a / D. Discussion & Conclusion(讨论与结论)
- 低发生率不等于低影响:6% 对应 7949 条帖子。在癌症社区中,即便有限的接触也可能影响治疗认知、筛查决策与对常规照护的态度,尤其当错误信息嵌入在个人经历与同伴建议之中。这凸显了多维建模的必要性——低发生率但高影响的叙事会被二元或以流行度为中心的方法系统性忽略。
- 不确定性导向话语带来的治理难题:尽管多数癌症 subreddit 相对专门且有活跃管理,错误信息仍通过对话式、不确定性导向的话语持续存在——轶事经历、对常规治疗的不信任、对医学证据的误读。这类内容混合了个人经验与部分真相,而非明确的假陈述,因而极难治理。在以同伴支持与开放对话为规范的社区中,过度治理会压制正当的健康关切,治理不足则会让误导性叙事在支持性讨论中被正常化。作者据此主张语境敏感的治理框架,同时考量错误信息类型、立场、风险等级与对话意图。
- 部分维度的固有主观性:一致性最低与模型表现最弱的维度高度重合(风险严重性、立场、错误信息类型),这些维度需要对意图、模糊性、修辞框架与潜在行为后果作出主观判断。分歧不仅源于事实层面的不确定,也源于语境解释与危害感知的差异。多维错误信息分析在标注与建模复杂度上,本质上远高于二元检测任务。
- 风险与危害不等同于流行度:73% 被判为低风险,但少数高风险内容(劝阻循证治疗、推广未经证实的干预)才是主要危害来源。检测与治理系统应按语境严重性与潜在行为后果排序,而非把所有错误信息等量齐观;同时低风险内容的累积效应仍可能助长不信任、困惑与治疗犹豫。
- 对健康传播实践的启示:错误信息主要围绕诊断、筛查与常规癌症治疗的安全性,而非替代疗法或神奇疗法。关于乳腺 X 光检查、结肠镜、化疗、放疗或治疗副作用的误导性主张,可能影响筛查参与率、治疗依从性与对临床医生的信任。鉴于早发现与及时治疗对癌症预后的决定性作用,公共卫生与临床传播策略应直接回应不确定、治疗恐惧与不信任,而非仅做事实纠正。
- 局限:(a)数据仅来自 Reddit,用户偏年轻、技术参与度高、以英语为主,跨人口、文化与语言的外推受限;不同平台(Facebook、TikTok、YouTube、封闭患者社群)的错误信息动态与治理实践差异显著。(b)语料聚焦于相对受管理且主题聚焦的专门癌症 subreddit,可能低估通用型、政治极化或弱治理社区中错误信息的普遍程度、多样性与极端程度。(c)大规模标注最终由 LLM 完成,模型偏差会传递至下游结论。
🧠 IRMaD 思维导图
mindmap
root((Reddit癌症错误信息分类))
I 引言
癌症患者上网找答案
错误信息可能延误治疗
这类内容互动量反而更高
既有研究只贴真假标签
R 问题
困惑式提问算不算错误信息
半真半假的经历怎么归类
能否造一套多维分类体系
大模型能否替专家做细活
M 方法
四种癌症二十四个子社区
原始24万条清洗后13.4万条
七个维度的分类框架
多模型初筛再分层抽样
两位肿瘤科医生标注四百条
零样本与少样本对比
六十二条留出集测泛化
R 结果
专家在风险等级上分歧最大
判定真假的F1可达0.952
扭曲类型从0.12跳到0.74
错误信息约占百分之六
追问式立场占六成三
诊断与筛查主题占四成二
替代疗法只占一成
前列腺癌社区比例最高
a 讨论
最难治理的不是明目张胆的假话
管太严会压制正当健康担忧
普遍程度不等于危害程度
主观维度模型也学不好
D 结论
主流不是神奇偏方而是不信任
七维框架与数据集将开放
样本偏向受管理的专门社区
传播策略应直面恐惧与不信任
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。