arXiv 预印本 · 2026 · SMU 与 A*STAR 联合实验室 · 46 万会话图 / 1360 万节点预训练 · 代码开源

ValueGraph:以道德价值信号引导的图预训练用户表征框架

Yitong Han, Wei Gao, Yi Zhao 等 6 人 · arXiv 预印本 · 新加坡管理大学 / 新加坡科技研究局 A*STAR · 2026 · arXiv: 2609.00057
原题:ValueGraph: Value-Signal Guided Graph Pre-training for Contextualized User Representation
Open Access 新颖度 0.74

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

社交媒体研究里有一项基础工作叫做用户表征:把一个人发过的内容和互动关系,压缩成一串数字。之后不管是做立场判断、推荐、还是识别水军,都建立在这串数字上面。

目前主流的做法有个共同的前提假设:互动相似的人,应该是相似的人。你和我都在同一条新闻下面评论了,系统就认为我们俩比较像。

但这个假设有个明显的漏洞。作者举了一个很有说服力的例子:两个人在同一个热点事件下争得不可开交,恰恰说明他们观点完全相反。可在“互动相似”的逻辑下,系统会把他们当成一类人。

这个错误的后果不只是推荐得不准。论文指出,新闻推荐系统如果把“共同关注”误当成“共同偏好”,就会反复给这两个人推同类内容,强化同质化的信息暴露,甚至放大极化和极端化

所以作者认为,好的用户表征不能只看看得见的行为——说了什么、在哪互动,还得抓住行为背后看不见的驱动因素

② 研究问题(要回答什么?)

作者要解决的核心问题是:能不能给用户表征模型补上一个“为什么这么说”的维度。

他们的抓手是心理学里一个成熟的理论,叫做道德基础理论。这个理论认为人的道德判断可以拆解成若干个基本维度,比如关爱与伤害、公平与欺骗、忠诚与背叛、权威与颠覆、圣洁与堕落。论文用的是十个维度。

但这里有个绕不开的难题,也是论文最值得称道的地方:用模型推断出来的“价值观”其实相当不准。你不可能靠几条帖子就断定一个人真实的道德取向。

于是作者提出的问题变成了一个方法论问题:一个已知有噪声、不可靠的信号,能不能仍然被用好

他们的答案很有意思——不要把它当成标签,而要把它当成一种相对约束。也就是说,不去断言“这个人是重视公平的”,只利用“这两个人在价值倾向上比那两个人更接近”这种相对关系

③ 研究方法(怎么做的?)

整个框架分两个阶段,可以理解成先学结构,再调价值

第一阶段 · 打地基。研究者把社交媒体上的对话组织成图:每个帖子是一个节点,谁回复谁就连一条边。然后用一种遮盖重建的方式训练——故意把一部分节点的内容盖住,让模型根据上下文猜回来。这个过程逼着模型学会从对话结构里提取信息,也让它对社交媒体上的噪音文本更有抵抗力。

第二阶段 · 加价值引导。这一步分几个动作:

为什么非要两个一起用?作者的解释很到位。对比损失只管两两之间谁近谁远,管不了整个空间的全局形状。而聚类损失有个危险的毛病:它会自我强化——把现有的结构继续放大,而不管这个结构是不是真的有意义。两个单独用都不稳定,合在一起才能互相制约。作者还专门证明了两条定理,说明这两个目标分别如何塑造嵌入空间。

预训练语料相当大:来自 Reddit 和 Twitter 的对话,处理后共 461198 张会话图,约 1360 万个节点3990 万条边

④ 结果(发现了什么?)

实验在两个任务上验证,结果显示加入价值信号带来了稳定的提升,而且消融实验的结论尤其有说服力。

立场检测提升明显
在 RumourEval19 上宏平均 F1 从最强基线的 0.59 提到 0.71
水军识别同样有效
纯文本设定下宏平均 F1 从 54.8 提到 64.3,召回率从 62.5 提到 81.0
两个损失缺一不可
单用任一个都不稳定,
只用聚类损失时准确率升但宏 F1 反降

先看立场检测。在 MT_CSD 数据集上,准确率 0.63、宏平均 F1 0.58,比最强的图预训练基线分别相对提升 5% 和 5.5%。在 RumourEval19 上提升更大:准确率 0.77、宏平均 F1 0.71,相对最强的语言模型基线提升 20.3%,相对最强的图基线提升 57.8%。

有一个细节值得单独说:作者拿 GPT-5.4 做了纯文本基线,结果它大体只和其他非大模型基线打平。这说明在这类任务上,光有强大的语言理解能力不够,对话结构信息是不可替代的

再看水军识别。这里的实验设计很规范:每组跑五次不同随机种子,报告均值和标准差。结论是在各种模型上替换成 ValueGraph 的表征都能提升。提升最戏剧化的一例是 BotGAT 在文本加网络设定下,准确率从 47.4 跳到 73.1,马修斯相关系数从 −0.6 跳到 47.8。

不过作者在这里表现得相当诚实,主动指出了一个规律:当输入信息已经很丰富时,提升幅度和显著性都会下降。在同时具备用户特征、帖子、简介和网络结构的完整设定下,显著性明显减弱,因为强大的档案和图特征已经主导了决策边界。作者的辩护是:由于 ValueGraph 编码器完全没有用水军标签训练过,也没做下游微调,所以哪怕在特征丰富的场景下仍有增益,就说明价值信号确实补充了新信息。

消融实验最能说明设计的合理性,也印证了作者事先的推断。在 MT_CSD 上只加聚类损失,准确率从 41.2 升到 50.4,宏平均 F1 却从 40.7 掉到 34.3——这是典型的“模型学会了偏向多数类”。只加对比损失同样不理想。而完整模型达到 63.0 和 58.0,两项都大幅领先。

⑤ 讨论(这些发现说明什么?)

这项研究方法论上最值得学习的地方,是它如何对待一个不可靠的信号

作者从头到尾都非常克制。他们反复强调,MoralBERT 输出的十维向量不是用户真实价值观的金标准,它的用处来自用户之间的相对差异,而不是任何单条预测的准确性。基于这个定位,他们才选择用对比学习和聚类这类只依赖相对关系的方法,而不是直接把价值向量当特征喂进去。这是一个把理论假设和方法选择对齐得很好的例子。

从传播学角度看,这项工作触及了一个真实的社会问题。作者在开头就点明了动机:推荐系统如果把“共同关注”误读成“共同偏好”,就会把立场对立的人塞进同一个信息茧房,助长极化。加入价值维度,本质上是给系统一个区分“为什么互动”的能力。

论文的定性分析也提供了一点直观理解。作者对比了两条帖子:一个水军账号发的是充满指责、堆砌话题标签、道德立场极其单一的内容;而一个真人账号写的是“对所爱之人生气,和不再爱他,不是一回事吧?”这样有对话性、对语境敏感的表达。作者认为这种道德表达方式上的差异正是价值信号能帮上忙的地方。

伦理声明写得相当规范,也值得注意。作者明确表示:本研究不推断用户的真实心理价值观;结果应被理解为特定数据集上的发现;不应在缺乏适当保障的情况下用于个体层面的画像或决策。他们会发布代码和处理脚本,但不会转发原始社交媒体内容或任何可识别个人身份的信息

需要客观看待的局限也有几条。研究只用了帖子与回复关系,没有用关注或好友关系——作者解释这是为了让评测更通用,因为这类关系依赖具体平台且常常拿不到。价值信号完全依赖 MoralBERT 的质量,误差会传导。此外,多数实验提升虽然一致但幅度不算大,在信息最充分的设定下更是如此。

⑥ 结论(最终结论 + 启示)

这项研究的结论可以概括为一句话:有噪声但有理论支撑的价值信号,可以作为有效的辅助引导,改善用户建模——而且无需宣称预测了用户的真实价值观

四项主要贡献分别是:提出以价值信号引导的图预训练框架;设计了把遮盖重建、对比学习与聚类结合起来的分层目标;给出机制层面的理论分析,刻画价值相似性保持与簇的紧凑分离;并在立场检测与水军识别两个任务上验证了效果。

对计算传播学研究者来说,这项工作的启发有两层。表层是:把成熟的社会科学理论转化成可计算的归纳偏置,是有回报的——道德基础理论在这里不是装饰,而是实实在在提供了区分能力。

更深一层的启发关于研究态度:面对测不准但又重要的构念,与其假装测准了,不如老老实实承认它有噪声,然后设计出只依赖其可靠部分的方法。这个思路对很多社会科学的计算研究都适用。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

用户表征学习是社交媒体分析、推荐系统与个性化 AI 的核心,需将用户内容与互动映射为稠密表示以支持画像、推荐、立场检测与社会影响分析,并要求泛化至未见用户与演变中的社会语境。

既有方法多从文本、视觉内容或网络结构学习表征,并以自监督或图目标优化。这些目标普遍假设内容暴露相似或图邻域相似的用户应有相似嵌入。论文指出该假设的关键缺陷:互动上的相似并不必然意味着驱动用户行为的潜在因素相似——用户可能因共同暴露、争议性或平台动力学而参与同一事件,却表达实质不同的动机与态度;当社会语境变化时,这种表层相似会变得脆弱。

作者给出的后果论证具有直接的传播学意义:依赖互动相似度的新闻推荐系统可能把共同暴露或争议驱动的互动误认为共享偏好或价值,从而向立场相反的用户反复推荐同类内容,强化同质化信息暴露并可能放大极化或极端化动力学

为此论文采用道德基础理论(MFT)作为理论基础,通过聚合 MoralBERT 输出的帖子级道德分数得到十维用户级道德特征向量,称为价值信号(value signals),并以之作为辅助监督线索来正则化图预训练。

I. Theoretical Framework & Hypotheses(理论框架与假设)

要素设定理论依据与判定
理论选型在 Hofstede 文化维度、MFT、Schwartz 基本价值理论中选择 MFT三条理由:可捕捉日常语言中表达的道德判断,适合社媒分析;从文本抽取道德立场的有效性已获实证验证;提供结构化且可解释的道德维度
价值信号定义十个道德基础:care / harm / fairness / cheating / loyalty / betrayal / authority / subversion / purity / degradation由十个独立微调的 MoralBERT 分类器给出 [0,1] 概率,按用户聚合
核心认识论立场推断出的十维向量不被当作用户价值观的金标准它是有噪但更稳健的道德框架信号,其效用来自用户间的相对差异而非帖子级预测的精确性;因此只用作软约束
定理 1价值信号相似性保持L_user 在由 h(·) 构造的固定正负集下收敛,则对采样用户对,学到的嵌入相似度被鼓励保持价值信号相似度所诱导的序关系sim(h(u),h(ũ))↑ ⇒ sim(z_u,z_ũ)↑
定理 2簇的紧凑性与分离性紧凑项最小化 ‖z_u − c_ℓu‖₂;间隔项惩罚质心距离低于 m 的质心对,从而促进簇间分离

“contextualized” 的界定:本文中该词特指联合建模用户文本内容与其在会话图中的互动语境所学得的表征,而非仅指上下文相关的词嵌入。

M. Materials & Methods(材料与方法)

R. Results(结果)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((价值信号引导用户表征))
    I 引言
      用户表征是下游任务基础
      互动相似不等于动机相似
      同事件争吵者立场相反
      误读会强化同质信息
      可能放大极化
    R 框架
      采用道德基础理论
      十个道德维度
      价值向量不是心理真值
      只用相对差异作软约束
      定理一 保持相似序关系
      定理二 簇紧凑且分离
    M 方法
      帖子为点 回复为边
      掩码重建学结构抗噪
      MoralBERT 打分再按人取均值
      百分位法取正负样本
      高斯核算相似度
      对比损失拉近价值相近者
      聚类损失约束全局几何
      两损失互为正则
      预训练 46 万图 1360 万点
    R 结果
      MT_CSD 准确率零点六三
      谣言数据宏 F1 零点七一
      相对图基线提升五成七
      GPT-5.4 仅与基线持平
      水军召回自 62.5 升至 81.0
      BotGAT 相关系数由负转正
      单用聚类损失宏 F1 反降
      完整模型全面领先
    a 讨论
      特征充分时增益缩小
      编码器未用标签训练
      水军道德表达重复极化
      不推断个人真实价值
      不得用于个体画像
    D 结论
      有噪信号也能被用好
      社科理论可作归纳偏置
      结构信息不可被文本替代

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。