ICWSM 2026 · 计算社会科学旗舰会议 · 三数据集实证验证 · 开放获取论文集

让语言驱动关系网:用大模型智能体模拟观点与社交连边的共同演化

Chenhao Gu, Ling Luo, Zainab Razia Zaidi 等 4 人 · Proceedings of the 20th International AAAI Conference on Web and Social Media (ICWSM 2026) · 2026 · DOI: 10.1609/icwsm.v20i1.42677
原题:Language-Grounded Co-evolution of Opinions and Ties: Paired Rewiring with Large Language Model Agents
Open Access 新颖度 0.80

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

在社交平台上,有两件事一直在同时发生:你的看法在变,你的关注列表也在变。你看到一些内容,态度悄悄挪动了一点;同时你取关了几个人,又关注了几个新的。这两件事互相推动——你关注谁决定你看到什么,你看到什么又反过来影响你关注谁。回音室、极化群体,就是这么一圈圈转出来的。

研究这个循环,过去有两条路,可惜各有各的残缺。

第一条是方程式模型。它把一个人的观点简化成一个数字,比如 −1 表示完全反对、+1 表示完全支持,再用公式算出这个数字怎么被邻居拉动、什么时候该断开一条边。这类模型结构清楚、机制明确,但它丢掉了最要紧的东西——人是被语言说服的,不是被数字说服的。你取关某个人,可能是因为他说话太刻薄,而不是因为“意见分值差了 0.7”。

第二条是让大模型来扮演用户。这类模拟能生成非常像真的帖子,语言细节丰富,但它们往往不管网络结构怎么变,也很少拿真实数据去核对——好看,但不知道准不准。

所以缺的是一个把两边接起来的东西:让语言既解释、又驱动观点和关系的共同演化,并且拿真实网络去检验它。

② 研究问题(要回答什么?)

作者提出三个问题:

第三个问题尤其值得注意。它把一个学术模拟直接和现实中的平台治理接上了:如果一个参数就能决定网络是走向撕裂还是走向融合,那这个参数在现实里对应的就是平台的推荐策略。

③ 研究方法(怎么做的?)

框架的核心设计叫成对换线:每次调整关系时,用户先取关一个人,再关注一个人,连边总数保持不变。这个约束不是为了省事,而是模拟一个很真实的限制——人的社交注意力是有限的,多关注一个人,通常意味着少看另一个人。这样一来,网络只改变形状,不改变规模,前后才好和真实数据比。

整个模拟像这样运转:每一轮,随机选一个用户“刷一下信息流”——只能看到有限的几条来自关注对象的内容,这一步模拟了人的注意力上限。大模型根据他看到的内容和他自己以前发过的帖子,写一条新帖子,反映他更新后的态度。接着,以概率 p 决定他这一轮要不要动关注列表;如果动,就从现有关注里挑一个取关,再从五个候选人里挑一个关注。取关和关注的判断都由大模型做出,而且必须说明理由。

数据用了三份真实数据集:新冠疫苗话题(推特)、俄乌战争话题(2022 年 8 月的 100 万条英文推文)、以及 2024 年美国大选(去中心化平台 Bluesky)。每份数据都用 k-核分解挑出最活跃的约 1000 个用户,用约 6000 条推文起步,跑 2000 步,每个模型跑 5 次取平均。

参与比较的有五个大模型:GPT-4o Mini、Gemini、Mistral、DeepSeek-V3、Qwen2-72B;对照组是传统方程式模型,还有一个“完全随机换线”的下限基准。所有模型都用各自 API 的默认参数(温度 1.0、top-p 1.0),不做任何针对性调优,以免把模型本身的差异和调参技巧混在一起。

④ 结果(发现了什么?)

发现一:大模型模拟出来的网络,比方程式模型更像真的。

评价方式是把模拟出的网络和真实网络在四个指标上比对,看误差有多大——模块度(社群分得有多开,是回音室强度的标志)、聚类系数(朋友的朋友也是朋友的程度)、平均路径长度(信息传得快不快)、同配性(观点相近的人是不是更容易连起来)。误差越小越好。

新冠数据 · 模块度误差
方程式 0.064
→ Qwen 0.026
误差降一半以上
俄乌数据 · 路径长度误差
方程式 0.132
→ Mistral 0.051
降约三分之二
俄乌 · 立场翻转准确率
方程式 40.9%
→ Qwen 45.7%
Bluesky · 立场准确率
方程式 39.6%
→ Gemini 44.8%

方程式模型的典型毛病是把模块度算得过高——也就是夸大了极化,同时低估局部连接。作者还特别说明了立场准确率的算法:如果把所有用户都算进去,准确率能到 80–90%,但那是假象——因为绝大多数人本来就不会改变立场,模型只要“什么都不变”就能拿高分。所以他们只统计那些真的改变了立场的人,这是一个严苛得多的标准。方程式模型在这个标准下基本“躺平”,靠惯性混分。

发现二:不同大模型的“社交性格”确实不一样。

把所有模型放在完全相同的处境下做同一批决定,结果两个模型在同一步同时选中相同的取关对象相同的关注对象,概率只有约 30%。有意思的是,“取关谁”的一致性明显高于“关注谁”(0.58–0.74 对 0.44–0.55)——大家对“谁该被踢掉”意见比较统一,对“该接纳谁”则各有各的想法。

更耐人寻味的是,模型之间形成了小圈子:DeepSeek 和 Qwen 最像(取关一致度 0.737),Gemini 和 OpenAI 是另一组。作者指出,这个分组恰好和模型的国别来源吻合(前者来自中国,后者来自美国),并谨慎地提出:训练数据里的文化语境,可能确实影响了模型的社交判断。

发现三:模型说得出自己为什么这么做。作者把模型给出的理由归入五个维度:关系(互不互动)、情绪(语气友善还是刻薄)、使用与满足(有没有用、新不新鲜)、道德(涉及权利、问责等价值判断)、信息质量(可靠、冗余还是含糊)。结果各家风格分明:Mistral 偏重实用与道德,OpenAI 偏重情绪,Qwen 偏重关系,Gemini 则各项都很均衡保守。而且这些偏好在三份数据集里保持一致,说明是模型自身的稳定倾向,而不是数据集造成的巧合。

发现四,也是最有政策意味的:换线的频率和推荐策略,直接决定网络会不会撕裂。

参数 p(多久重新考虑一次关注列表)越大,模块度下降得越快——也就是极化越弱;p 越小,回音室越牢固。三份数据各自最贴合现实的 p 值差别很大:Bluesky 只需 0.03,新冠 0.2,俄乌高达 0.5

推荐策略的影响更直观。作者比了五种“给你推荐谁”的方式,最终网络的模块度是:推荐内容最相似的人 0.745(回音室最强)> 推荐朋友的朋友 0.711 > 推荐内容最不相似的人 0.694 > 随机 0.689 > 推荐网络上最远的人 0.679(最不极化)。

但在立场极化这个指标上出现了一个值得警惕的结果:“朋友的朋友”推荐带来的立场极化增幅最大——而这恰恰是现实平台里最常见、看起来最无害的推荐逻辑。相反,把人连到网络上最遥远的角落,降极化效果最强。

附加案例:一次新闻冲击。在第 500 步注入一条外部新闻,正面新闻让平均态度上移;负面新闻竟然也让平均态度上移。原因是这个网络里支持疫苗的人本来就占多数,遇到负面信息,多数派反而更起劲地发声支持,把负面框架的直接影响给盖过去了。结构上,两种冲击都让模块度下降(社群边界暂时松动)、聚类系数上升(局部抱得更紧),且负面新闻的扰动更强,但都没有引起网络的根本重组。

⑤ 讨论(这些发现说明什么?)

这项工作真正的贡献,不在于“用大模型做模拟”这件事本身——那已经有不少人做了——而在于它同时守住了三件容易顾此失彼的事:语言的真实感、网络结构的约束、以及拿真实数据检验。

最值得社会科学研究者注意的是那个动机分类。传统的智能体模型有一个根本困境:你可以让模拟结果和现实对得很准,但你无法知道模型内部“为什么”这么做,它终究是个黑箱。这篇文章的做法是让模型把理由说出来,再用一套透明的关键词规则把这些自然语言理由归入五个有理论来源的维度。于是模拟第一次同时具备了数量上的拟合可解释的机制。当然,这些“理由”是模型自我报告的,未必等同于它内部真正的计算过程——但至少它们在三份数据集上表现稳定,这本身就是一个可用的信号。

另一个不容易被注意但很关键的发现,是那个“朋友的朋友”悖论。在结构指标上,这种推荐策略看起来相当温和,远不如“推荐内容最像你的人”那么极端;可一旦看立场极化,它的增幅反而最大。这意味着:只看网络形状来评估一个推荐算法是不够的,形状温和的机制完全可能在观点层面造成最严重的固化。这对平台的算法审计有直接含义。

作者对模型偏差也相当坦诚。在一个纯模拟实验里,ChatGPT 倾向于把网络推向两极对立,而 Gemini 倾向于制造共识——即使被明确要求生成反疫苗内容,Gemini 也常常写出中性甚至支持的文字。正是因为这个问题,作者放弃了直接用 −1 到 1 的观点分值驱动模型,改为提供用户的历史推文让模型自己推断。这是一个诚实且重要的方法论选择:它承认了对齐训练会污染社会模拟的结果。

局限同样明确。把 GPT-4o Mini 的模拟和真实网络逐帧对照会发现,模拟倾向于把社群之间的距离压缩,出现“结构平滑”和部分去极化,而真实网络的社群边界更清晰、同质性更持久。也就是说,这类模拟目前系统性地低估了现实中的分裂程度。此外,每份数据只保留了约 1000 名最活跃用户,规模有限;跨模型比较用的是各家 API 默认参数,未做调优。

⑥ 结论(最终结论 + 启示)

这项研究给出的核心结论是:把“换关注”这个决定交给大模型来做,模拟出来的社交网络比传统方程式模型更接近现实,而且模型还能说出它为什么这么做。

在三份真实数据(新冠疫苗、俄乌战争、2024 美国大选)上,大模型在模块度、同配性等关键结构指标上的误差普遍低于方程式基线——例如新冠数据的模块度误差从 0.064 降到 0.026;在只统计“真的改变了立场的人”这一严苛标准下,立场预测准确率也更高(俄乌数据 45.7% 对 40.9%)。没有哪个模型全面领先,各有所长,作者因此建议考虑组合使用。

但对更广泛的读者来说,最该带走的是治理层面的那条线索:换线频率 p 和推荐候选策略,是两个可以直接调节极化程度的“旋钮”。低频率对应放任自流,回音室会越结越硬;高频率对应强干预,能促进混合。而“推荐朋友的朋友”这种看起来最自然的做法,在立场极化上的负面效果反而最大。这把一个抽象的模拟参数,翻译成了平台每天都在做的具体选择。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

议题源流。在线社交网络是观点与结构同时演化的动态系统:用户生成反映其立场的内容,同时通过取关/关注调整社会连带。数十年的意见动力学与网络科学研究表明,同质性(homophily)三元闭包(triadic closure)选择性接触(selective exposure)共同塑造社群的形成与固化;而这些过程在现实中又被信息流、推荐系统与有限的“注意力预算”所中介。

文献空白(两侧各缺一半)。方程式模型提供清晰抽象与可识别机制(同质性、影响强度、连边规则),但将观点表示为数值、把连边决策表示为参数化函数,丢弃了真正支配在线互动的语义;② LLM 驱动的模拟捕捉语言细微差别、能生成逼真帖子,却往往不对网络演化施加约束,且极少针对真实结构数据做验证,仅停留于叙事合理性。缺失的是一种统一处理:让语言既解释又驱动内容、观点与连带的耦合演化,并接受经验网络的检验。

本研究四项贡献。语言接地的共演化:单一框架内由 LLM 同时承担观点更新、内容生成与换线;② 三领域经验验证:在真实数据上就多项网络指标定量比较模拟网络与观测网络,并评估立场动态;③ 可解释动机:分析 LLM 为其取关–关注决策给出的解释,提炼出跨数据集稳定的动机类别;④ 可控性:证明全局换线概率与候选筛选策略是可调的显式控制参数。

I. Theoretical Framework & Hypotheses(理论框架与假设)

系统在时刻 t 表示为有向图 G(t) = (V, E(t)),用户 i 的出邻居集为 N_i(t) = {j | (i,j) ∈ E(t)},持有随时间演化的观点 O_i(t)

观点演化由影响函数 f 给出:O_i(t+1) = f( O_i(t), {O_j(t) | j ∈ N_i(t)} )

网络换线由兼容函数 g 给出。每一步以全局换线概率 p ∈ [0,1] 触发;触发时执行成对操作
j⁻ = argmin_{j ∈ N_i(t)} g(O_i(t), O_j(t))j⁺ = argmax_{j ∈ C_i(t)} g(O_i(t), O_j(t))
E(t+1) = E(t) ∪ {(i, j⁺)} \ {(i, j⁻)},其中 C_i(t) 为非邻居候选集。

实例化影响函数 f兼容函数 g观点表示
方程式基线O_i + (1/|N_i|)·Σ w_ij (O_j − O_i)1 − |O_i − O_j|数值 O_i ∈ [−1, 1]
LLM 实例化f = LLM(T_o(C_i, C_j))g = LLM(T_r(C_i, C_j))文本内容历史 C_i

内容生成:y_i(t) ~ LLM( T_g(C_i, {C_j | j ∈ N_i(t)}) )。三类模板 T_o(观点动力学)、T_r(换线)、T_g(生成)共享统一结构,仅替换任务与输入上下文,采用标准化 + 思维链两条提示原则,以最小化提示诱导的变异。作者强调 LLM 实例化与方程式模型互补而非替代

换线动机的五维分类(本文首创)Tie(互惠、缺乏互动等关系性考量)· Affect(情感基调,含正向共鸣与负向敌意)· UGT(使用与满足:新颖性、情境相关性等工具性价值)· Moral(政策、问责、权利等价值框架)· InfoQuality(可靠性、冗余度、清晰度判断)。理论来源包括 Granovetter(1973)的连带理论与 Haidt & Graham(2007)的道德基础理论。

M. Materials & Methods(材料与方法)

R. Results(结果)

数据集模型Modularity ↓Avg. Clustering ↓Avg. Path Length ↓Assortativity ↓Stance % ↑
COVID-19Random-Rewire0.11600.02810.42860.106133.21
Equation0.06430.02120.29520.069633.65
Qwen0.02590.00710.25760.033233.84
Mistral0.02780.00980.25800.032140.49
UkraineEquation0.03470.01410.13170.090640.95
Mistral0.01930.00720.05110.084241.21
Qwen0.01940.00690.06810.080645.71
BlueskyEquation0.02640.01540.01650.002339.58
Qwen0.01590.00770.03580.008936.97
Gemini0.01940.00410.04080.010244.83
策略ModularityAvg. Clustering立场极化 ΔP(相对随机基线)
TF nearest(文本最近)0.7450.0670较大下降但方差高、不稳定
FoF(朋友的朋友)0.7110.0557增幅最大
TF farthest(文本最远)0.6940.0374接近中性、温和稳定
Random(随机基线)0.6890.0287
Structural-farthest(结构最远)0.6790.0288降幅最大
指标无冲击基线正面新闻(相对变化)负面新闻(相对变化)
Modularity0.560−0.0034−0.0055
Avg. Clustering0.041+0.0038+0.0052
Avg. Path Length3.948+0.0125+0.0305
Assortativity−0.272+0.0024+0.0004

两类冲击均使模块度下降(社群边界暂时弱化)、聚类系数上升(局部互动更密),负面新闻引发的结构扰动更强,但幅度均属温和,未导致网络的根本性重组。

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((观点与连边共演化))
    I 引言
      观点与关注同时在变
      方程式模型丢掉语义
      LLM 模拟不管结构
      也很少对真实数据验证
    R 问题
      RQ1 能否统一模拟共演化
      RQ2 不同模型是否有差异
      RQ3 能否用参数控制结构
    M 方法
      成对换线 边数守恒
      LLM 负责更新生成与换线
      三数据集 新冠 俄乌 大选
      k 核抽取约 1000 用户
      五模型对比 方程式基线
      2000 步 每模型跑五次
      仅统计立场转变者
    R 结果
      模块度误差 0.064 降至 0.026
      路径误差 0.132 降至 0.051
      立场准确率 45.7 对 40.9
      跨模型全同仅约三成
      取关比关注更一致
      深求与千问最相似
      动机五维剖面稳定
      p 越大极化越弱
      朋友的朋友极化最强
      结构最远降极化最优
      负面新闻反致支持上升
    a 讨论
      同时具备拟合与机制
      看形状评估算法不够
      对齐训练污染模拟
      模拟低估现实分裂
    D 结论
      语言驱动模拟更准更可解释
      p 与推荐策略是治理旋钮
      建议模型集成使用

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。