🧒 初中生也能看懂的版本
① 研究背景(为什么要做?)
在社交平台上,有两件事一直在同时发生:你的看法在变,你的关注列表也在变。你看到一些内容,态度悄悄挪动了一点;同时你取关了几个人,又关注了几个新的。这两件事互相推动——你关注谁决定你看到什么,你看到什么又反过来影响你关注谁。回音室、极化群体,就是这么一圈圈转出来的。
研究这个循环,过去有两条路,可惜各有各的残缺。
第一条是方程式模型。它把一个人的观点简化成一个数字,比如 −1 表示完全反对、+1 表示完全支持,再用公式算出这个数字怎么被邻居拉动、什么时候该断开一条边。这类模型结构清楚、机制明确,但它丢掉了最要紧的东西——人是被语言说服的,不是被数字说服的。你取关某个人,可能是因为他说话太刻薄,而不是因为“意见分值差了 0.7”。
第二条是让大模型来扮演用户。这类模拟能生成非常像真的帖子,语言细节丰富,但它们往往不管网络结构怎么变,也很少拿真实数据去核对——好看,但不知道准不准。
所以缺的是一个把两边接起来的东西:让语言既解释、又驱动观点和关系的共同演化,并且拿真实网络去检验它。
② 研究问题(要回答什么?)
作者提出三个问题:
- RQ1:大模型能不能不只是生成文本,而是在同一个框架里同时完成“更新观点—写新帖子—调整关注”,并且模拟出真实的网络互动?
- RQ2:不同的大模型(不同公司、不同国家训练出来的)在做这些网络层面的决定时,会不会表现出系统性的差异,从而长出不同形状的网络?
- RQ3:能不能通过调整全局参数,像平台调节推荐机制那样,控制最终长出什么样的社群结构?
第三个问题尤其值得注意。它把一个学术模拟直接和现实中的平台治理接上了:如果一个参数就能决定网络是走向撕裂还是走向融合,那这个参数在现实里对应的就是平台的推荐策略。
③ 研究方法(怎么做的?)
框架的核心设计叫成对换线:每次调整关系时,用户先取关一个人,再关注一个人,连边总数保持不变。这个约束不是为了省事,而是模拟一个很真实的限制——人的社交注意力是有限的,多关注一个人,通常意味着少看另一个人。这样一来,网络只改变形状,不改变规模,前后才好和真实数据比。
整个模拟像这样运转:每一轮,随机选一个用户“刷一下信息流”——只能看到有限的几条来自关注对象的内容,这一步模拟了人的注意力上限。大模型根据他看到的内容和他自己以前发过的帖子,写一条新帖子,反映他更新后的态度。接着,以概率 p 决定他这一轮要不要动关注列表;如果动,就从现有关注里挑一个取关,再从五个候选人里挑一个关注。取关和关注的判断都由大模型做出,而且必须说明理由。
数据用了三份真实数据集:新冠疫苗话题(推特)、俄乌战争话题(2022 年 8 月的 100 万条英文推文)、以及 2024 年美国大选(去中心化平台 Bluesky)。每份数据都用 k-核分解挑出最活跃的约 1000 个用户,用约 6000 条推文起步,跑 2000 步,每个模型跑 5 次取平均。
参与比较的有五个大模型:GPT-4o Mini、Gemini、Mistral、DeepSeek-V3、Qwen2-72B;对照组是传统方程式模型,还有一个“完全随机换线”的下限基准。所有模型都用各自 API 的默认参数(温度 1.0、top-p 1.0),不做任何针对性调优,以免把模型本身的差异和调参技巧混在一起。
④ 结果(发现了什么?)
发现一:大模型模拟出来的网络,比方程式模型更像真的。
评价方式是把模拟出的网络和真实网络在四个指标上比对,看误差有多大——模块度(社群分得有多开,是回音室强度的标志)、聚类系数(朋友的朋友也是朋友的程度)、平均路径长度(信息传得快不快)、同配性(观点相近的人是不是更容易连起来)。误差越小越好。
方程式 0.064
→ Qwen 0.026
误差降一半以上
方程式 0.132
→ Mistral 0.051
降约三分之二
方程式 40.9%
→ Qwen 45.7%
方程式 39.6%
→ Gemini 44.8%
方程式模型的典型毛病是把模块度算得过高——也就是夸大了极化,同时低估局部连接。作者还特别说明了立场准确率的算法:如果把所有用户都算进去,准确率能到 80–90%,但那是假象——因为绝大多数人本来就不会改变立场,模型只要“什么都不变”就能拿高分。所以他们只统计那些真的改变了立场的人,这是一个严苛得多的标准。方程式模型在这个标准下基本“躺平”,靠惯性混分。
发现二:不同大模型的“社交性格”确实不一样。
把所有模型放在完全相同的处境下做同一批决定,结果两个模型在同一步同时选中相同的取关对象和相同的关注对象,概率只有约 30%。有意思的是,“取关谁”的一致性明显高于“关注谁”(0.58–0.74 对 0.44–0.55)——大家对“谁该被踢掉”意见比较统一,对“该接纳谁”则各有各的想法。
更耐人寻味的是,模型之间形成了小圈子:DeepSeek 和 Qwen 最像(取关一致度 0.737),Gemini 和 OpenAI 是另一组。作者指出,这个分组恰好和模型的国别来源吻合(前者来自中国,后者来自美国),并谨慎地提出:训练数据里的文化语境,可能确实影响了模型的社交判断。
发现三:模型说得出自己为什么这么做。作者把模型给出的理由归入五个维度:关系(互不互动)、情绪(语气友善还是刻薄)、使用与满足(有没有用、新不新鲜)、道德(涉及权利、问责等价值判断)、信息质量(可靠、冗余还是含糊)。结果各家风格分明:Mistral 偏重实用与道德,OpenAI 偏重情绪,Qwen 偏重关系,Gemini 则各项都很均衡保守。而且这些偏好在三份数据集里保持一致,说明是模型自身的稳定倾向,而不是数据集造成的巧合。
发现四,也是最有政策意味的:换线的频率和推荐策略,直接决定网络会不会撕裂。
参数 p(多久重新考虑一次关注列表)越大,模块度下降得越快——也就是极化越弱;p 越小,回音室越牢固。三份数据各自最贴合现实的 p 值差别很大:Bluesky 只需 0.03,新冠 0.2,俄乌高达 0.5。
推荐策略的影响更直观。作者比了五种“给你推荐谁”的方式,最终网络的模块度是:推荐内容最相似的人 0.745(回音室最强)> 推荐朋友的朋友 0.711 > 推荐内容最不相似的人 0.694 > 随机 0.689 > 推荐网络上最远的人 0.679(最不极化)。
但在立场极化这个指标上出现了一个值得警惕的结果:“朋友的朋友”推荐带来的立场极化增幅最大——而这恰恰是现实平台里最常见、看起来最无害的推荐逻辑。相反,把人连到网络上最遥远的角落,降极化效果最强。
附加案例:一次新闻冲击。在第 500 步注入一条外部新闻,正面新闻让平均态度上移;负面新闻竟然也让平均态度上移。原因是这个网络里支持疫苗的人本来就占多数,遇到负面信息,多数派反而更起劲地发声支持,把负面框架的直接影响给盖过去了。结构上,两种冲击都让模块度下降(社群边界暂时松动)、聚类系数上升(局部抱得更紧),且负面新闻的扰动更强,但都没有引起网络的根本重组。
⑤ 讨论(这些发现说明什么?)
这项工作真正的贡献,不在于“用大模型做模拟”这件事本身——那已经有不少人做了——而在于它同时守住了三件容易顾此失彼的事:语言的真实感、网络结构的约束、以及拿真实数据检验。
最值得社会科学研究者注意的是那个动机分类。传统的智能体模型有一个根本困境:你可以让模拟结果和现实对得很准,但你无法知道模型内部“为什么”这么做,它终究是个黑箱。这篇文章的做法是让模型把理由说出来,再用一套透明的关键词规则把这些自然语言理由归入五个有理论来源的维度。于是模拟第一次同时具备了数量上的拟合和可解释的机制。当然,这些“理由”是模型自我报告的,未必等同于它内部真正的计算过程——但至少它们在三份数据集上表现稳定,这本身就是一个可用的信号。
另一个不容易被注意但很关键的发现,是那个“朋友的朋友”悖论。在结构指标上,这种推荐策略看起来相当温和,远不如“推荐内容最像你的人”那么极端;可一旦看立场极化,它的增幅反而最大。这意味着:只看网络形状来评估一个推荐算法是不够的,形状温和的机制完全可能在观点层面造成最严重的固化。这对平台的算法审计有直接含义。
作者对模型偏差也相当坦诚。在一个纯模拟实验里,ChatGPT 倾向于把网络推向两极对立,而 Gemini 倾向于制造共识——即使被明确要求生成反疫苗内容,Gemini 也常常写出中性甚至支持的文字。正是因为这个问题,作者放弃了直接用 −1 到 1 的观点分值驱动模型,改为提供用户的历史推文让模型自己推断。这是一个诚实且重要的方法论选择:它承认了对齐训练会污染社会模拟的结果。
局限同样明确。把 GPT-4o Mini 的模拟和真实网络逐帧对照会发现,模拟倾向于把社群之间的距离压缩,出现“结构平滑”和部分去极化,而真实网络的社群边界更清晰、同质性更持久。也就是说,这类模拟目前系统性地低估了现实中的分裂程度。此外,每份数据只保留了约 1000 名最活跃用户,规模有限;跨模型比较用的是各家 API 默认参数,未做调优。
⑥ 结论(最终结论 + 启示)
这项研究给出的核心结论是:把“换关注”这个决定交给大模型来做,模拟出来的社交网络比传统方程式模型更接近现实,而且模型还能说出它为什么这么做。
在三份真实数据(新冠疫苗、俄乌战争、2024 美国大选)上,大模型在模块度、同配性等关键结构指标上的误差普遍低于方程式基线——例如新冠数据的模块度误差从 0.064 降到 0.026;在只统计“真的改变了立场的人”这一严苛标准下,立场预测准确率也更高(俄乌数据 45.7% 对 40.9%)。没有哪个模型全面领先,各有所长,作者因此建议考虑组合使用。
但对更广泛的读者来说,最该带走的是治理层面的那条线索:换线频率 p 和推荐候选策略,是两个可以直接调节极化程度的“旋钮”。低频率对应放任自流,回音室会越结越硬;高频率对应强干预,能促进混合。而“推荐朋友的朋友”这种看起来最自然的做法,在立场极化上的负面效果反而最大。这把一个抽象的模拟参数,翻译成了平台每天都在做的具体选择。
🎓 专业 IRMaD 结构解读
I. Introduction(引言)
议题源流。在线社交网络是观点与结构同时演化的动态系统:用户生成反映其立场的内容,同时通过取关/关注调整社会连带。数十年的意见动力学与网络科学研究表明,同质性(homophily)、三元闭包(triadic closure)与选择性接触(selective exposure)共同塑造社群的形成与固化;而这些过程在现实中又被信息流、推荐系统与有限的“注意力预算”所中介。
文献空白(两侧各缺一半)。① 方程式模型提供清晰抽象与可识别机制(同质性、影响强度、连边规则),但将观点表示为数值、把连边决策表示为参数化函数,丢弃了真正支配在线互动的语义;② LLM 驱动的模拟捕捉语言细微差别、能生成逼真帖子,却往往不对网络演化施加约束,且极少针对真实结构数据做验证,仅停留于叙事合理性。缺失的是一种统一处理:让语言既解释又驱动内容、观点与连带的耦合演化,并接受经验网络的检验。
本研究四项贡献。① 语言接地的共演化:单一框架内由 LLM 同时承担观点更新、内容生成与换线;② 三领域经验验证:在真实数据上就多项网络指标定量比较模拟网络与观测网络,并评估立场动态;③ 可解释动机:分析 LLM 为其取关–关注决策给出的解释,提炼出跨数据集稳定的动机类别;④ 可控性:证明全局换线概率与候选筛选策略是可调的显式控制参数。
I. Theoretical Framework & Hypotheses(理论框架与假设)
系统在时刻 t 表示为有向图 G(t) = (V, E(t)),用户 i 的出邻居集为 N_i(t) = {j | (i,j) ∈ E(t)},持有随时间演化的观点 O_i(t)。
观点演化由影响函数 f 给出:O_i(t+1) = f( O_i(t), {O_j(t) | j ∈ N_i(t)} )。
网络换线由兼容函数 g 给出。每一步以全局换线概率 p ∈ [0,1] 触发;触发时执行成对操作:j⁻ = argmin_{j ∈ N_i(t)} g(O_i(t), O_j(t));j⁺ = argmax_{j ∈ C_i(t)} g(O_i(t), O_j(t));E(t+1) = E(t) ∪ {(i, j⁺)} \ {(i, j⁻)},其中 C_i(t) 为非邻居候选集。
| 实例化 | 影响函数 f | 兼容函数 g | 观点表示 |
|---|---|---|---|
| 方程式基线 | O_i + (1/|N_i|)·Σ w_ij (O_j − O_i) | 1 − |O_i − O_j| | 数值 O_i ∈ [−1, 1] |
| LLM 实例化 | f = LLM(T_o(C_i, C_j)) | g = LLM(T_r(C_i, C_j)) | 文本内容历史 C_i |
内容生成:y_i(t) ~ LLM( T_g(C_i, {C_j | j ∈ N_i(t)}) )。三类模板 T_o(观点动力学)、T_r(换线)、T_g(生成)共享统一结构,仅替换任务与输入上下文,采用标准化 + 思维链两条提示原则,以最小化提示诱导的变异。作者强调 LLM 实例化与方程式模型互补而非替代。
换线动机的五维分类(本文首创):Tie(互惠、缺乏互动等关系性考量)· Affect(情感基调,含正向共鸣与负向敌意)· UGT(使用与满足:新颖性、情境相关性等工具性价值)· Moral(政策、问责、权利等价值框架)· InfoQuality(可靠性、冗余度、清晰度判断)。理论来源包括 Granovetter(1973)的连带理论与 Haidt & Graham(2007)的道德基础理论。
M. Materials & Methods(材料与方法)
- 数据准备:框架仅要求两类信号——用户生成的文本内容 + 显式互动关系(转推/转帖),不依赖平台专有元数据。主要实例化于 X(Twitter),并纳入 Bluesky 以证明跨平台泛化性。
- 三个数据集:① COVID-19 疫苗(全球英文推文,立场分为支持/反对/中立,聚焦疫苗犹豫);② Ukraine War(2022 年 8 月 1–31 日,100 万条英文推文,立场标注为亲俄/亲乌/中立);③ PolitiSky24(Bluesky,2024 美国大选,首个该主题的立场检测数据集,标注管线含 LLM 分类)。
- 子图抽取:用 k-核分解保留最大 k-核中的活跃用户,逐数据集调节
k,得到约 1,000 名用户的子图。 - 模拟流程:每轮随机选一名用户“刷新信息流”(screen,仅可见有限子集,模拟有限认知容量)→ LLM 基于 screen 与历史活动生成新帖 → 以概率
p触发换线 → 审视现有好友最近帖子,至多断开一条连边 → 从候选集中(默认随机抽取 5 名非好友)依据与自身历史帖子的契合度选择一条新连边。边数守恒(一删一增),与 Sasahara et al. (2021)、Holme & Newman (2006)、Kozma & Barrat (2008) 等自适应网络模型的惯例一致。终止条件为达到稳态或预设步数。 - 模型与基线:闭源
GPT-4o Mini(OpenAI)、Gemini(Google);开源Mistral、DeepSeek-V3、Qwen2-72B-Instruct。基线为 Sasahara et al. (2021) 的方程式模拟与 Random-Rewire(换线与观点更新均均匀随机,作为随机下界)。 - 解码设置:一律使用各 API 默认配置(temperature = 1.0,top-p = 1.0),不做模型特定调优,以将模型层面行为与提示/参数工程效应分离。
- 运行规模:约 6,000 条推文初始化,活跃用户约 1,000,运行 2,000 步,每模型重复 5 次取均值。
- 评估指标(五项):Modularity(社群强度 / 回音室效应)、Average Clustering Coefficient(局部三元闭合)、Average Path Length(全局连通与扩散效率)、Assortativity(连边同质性)——四项均以对真实网络的 MAE 报告;以及 Stance Accuracy。关键设定:若在全体用户上计算,立场准确率通常落在 80–90%,因多数用户不改变立场、模型仅靠“惯性”即可得高分;故本文仅在发生立场转变的用户中计算准确率,以检验模型对少数派转变的敏感性。
- 跨模型一致性实验:从单次模拟中抽取完整换线提示序列,令所有模型在相同初始结构与相同提示序列下决策,以控制网络漂移,从而分离模型自身的决策倾向。
- 动机标注管线:对 LLM 产出的自由文本理由先施加轻量关键词检测得到细粒度动机标签(离题内容、低信息质量、极端语气、新颖性、政策/权利框架等),再归并至五个高层维度,形成透明可复现的映射。
R. Results(结果)
- RQ1 — LLM 模拟在多数结构指标上稳定优于方程式基线,尤以模块度与同配性为著。方程式方法在 COVID-19、Ukraine 这类更动荡、更具争议的场景中倾向产生虚高的模块度与不真实的聚类,从而夸大极化或低估局部连通。
- 各指标的互补优势:同配性由 Gemini 与 DeepSeek 复现最佳;聚类系数由 Qwen 与 Mistral 最佳;平均路径长度在动态的 COVID-19 与 Ukraine 数据上由 Gemini 与 Mistral 最准,而在刚性同质的 Bluesky 场景中方程式方法在某些全局统计上仍具竞争力;模块度由 Qwen 与 DeepSeek 最贴合。无单一模型全面占优。
- 立场准确率(仅计立场转变者):LLM 在三数据集上均取得有意义的表现(Gemini、Qwen、Mistral 各擅一域);方程式基线表现高度依情境而定,大体上退化为惯性,无法稳定捕捉少数派立场转变。
| 数据集 | 模型 | Modularity ↓ | Avg. Clustering ↓ | Avg. Path Length ↓ | Assortativity ↓ | Stance % ↑ |
|---|---|---|---|---|---|---|
| COVID-19 | Random-Rewire | 0.1160 | 0.0281 | 0.4286 | 0.1061 | 33.21 |
| Equation | 0.0643 | 0.0212 | 0.2952 | 0.0696 | 33.65 | |
| Qwen | 0.0259 | 0.0071 | 0.2576 | 0.0332 | 33.84 | |
| Mistral | 0.0278 | 0.0098 | 0.2580 | 0.0321 | 40.49 | |
| Ukraine | Equation | 0.0347 | 0.0141 | 0.1317 | 0.0906 | 40.95 |
| Mistral | 0.0193 | 0.0072 | 0.0511 | 0.0842 | 41.21 | |
| Qwen | 0.0194 | 0.0069 | 0.0681 | 0.0806 | 45.71 | |
| Bluesky | Equation | 0.0264 | 0.0154 | 0.0165 | 0.0023 | 39.58 |
| Qwen | 0.0159 | 0.0077 | 0.0358 | 0.0089 | 36.97 | |
| Gemini | 0.0194 | 0.0041 | 0.0408 | 0.0102 | 44.83 |
- RQ2 — 跨模型决策一致性。两模型在同一步同时选中相同取关与关注对象的概率仅约 30%。取关一致度(0.58–0.74)显著高于关注一致度(0.44–0.55):移除对象的线索更清晰(冗余、离题),而候选关注对象的集合更宽泛、更依情境。
- 模型聚类与地缘对应。DeepSeek–Qwen 结成最紧密的一对(取关 0.737,关注 0.550);Gemini–OpenAI 构成中等但稳定的一组(约 0.47–0.59);Mistral 相对不稳定(取关 0.57–0.63,关注 0.44–0.57)。作者指出该聚类与模型的地理与机构来源相符(DeepSeek/Qwen 来自中国,Gemini/OpenAI 来自美国),并审慎提出训练数据中的民族或文化语境可能贡献了系统性差异。
- 动机剖面(跨数据集稳定)。Mistral 强调 UGT + Moral;OpenAI 突出 Affect;DeepSeek 与 Qwen 较为均衡(Qwen 显著偏 Tie);Gemini 呈各维均衡而保守的剖面。动机剖面与结构表现相互印证(如 Mistral 的价值/实用取向对应其聚类优势)。
- RQ3 — 换线概率 p 的可控性。提高
p加速模块度下降,即降低社群极化;降低p则维持结构刚性、强化回音室。各数据集最优p:Bluesky p = 0.03(刚性同质,仅需极少换线)、COVID-19 p = 0.2(动荡争议,需中等换线)、Ukraine p = 0.5(动态但中度分化)。作者将p解读为治理策略的代理变量:低 p 近似放任、高 p 近似强干预(推荐重排、强制多元曝光)。 - 推荐策略实验(COVID-19 终态)。五种候选筛选策略的结构后果:
| 策略 | Modularity | Avg. Clustering | 立场极化 ΔP(相对随机基线) |
|---|---|---|---|
| TF nearest(文本最近) | 0.745 | 0.0670 | 较大下降但方差高、不稳定 |
| FoF(朋友的朋友) | 0.711 | 0.0557 | 增幅最大 |
| TF farthest(文本最远) | 0.694 | 0.0374 | 接近中性、温和稳定 |
| Random(随机基线) | 0.689 | 0.0287 | — |
| Structural-farthest(结构最远) | 0.679 | 0.0288 | 降幅最大 |
- 立场极化操作化为
P(t) = |p_F(t) − p_A(t)|(支持与反对比例之绝对差),在 2,000 步中按时间分箱统计均值 ΔP 与 95% 置信区间。关键反差:FoF 在结构指标上并不极端,却在立场极化上增幅最大;结构最远策略在两方面都最有利于去极化。 - 新闻冲击案例。在
t = 500注入外生新闻。正面新闻使平均观点明显上移;负面新闻同样使平均观点上移——因初始网络中支持疫苗者占多数,面对负面信息时多数群体更积极地放大支持性叙事,在总量上抵消了负面框架的直接影响。结构层面(冲击窗口内):
| 指标 | 无冲击基线 | 正面新闻(相对变化) | 负面新闻(相对变化) |
|---|---|---|---|
| Modularity | 0.560 | −0.0034 | −0.0055 |
| Avg. Clustering | 0.041 | +0.0038 | +0.0052 |
| Avg. Path Length | 3.948 | +0.0125 | +0.0305 |
| Assortativity | −0.272 | +0.0024 | +0.0004 |
两类冲击均使模块度下降(社群边界暂时弱化)、聚类系数上升(局部互动更密),负面新闻引发的结构扰动更强,但幅度均属温和,未导致网络的根本性重组。
a / D. Discussion & Conclusion(讨论与结论)
- 核心结论。相较方程式基线,LLM 在关键结构指标上持续降低 MAE,并产出更贴近现实的立场动态。代表性数值:COVID-19 上 Qwen 将模块度 MAE 减半以上(
0.064 → 0.026)、Gemini 降低路径长度 MAE(0.295 → 0.250);Ukraine 上 Mistral 将路径长度 MAE 降低近三分之二(0.132 → 0.051)、Qwen 取得最高立场准确率(45.7% vs. 40.9%);Bluesky 上 Qwen 取得最低模块度 MAE(0.0159 vs. 0.0264)、Gemini 领先立场准确率(44.8% vs. 39.6%)。 - 互补而非单一最优。无模型在所有指标上占优,各具互补优势,提示集成或混合策略的潜在价值。
- 可解释性的方法论突破。通过让模型输出理由并映射到五维动机分类,模拟同时获得定量拟合与定性机制;跨模型差异因而不是噪声,而是训练与对齐管线所塑造的归纳偏好之证据。取关多归因于冗余或低信息质量(故共识高),关注则诉诸新颖性、道德契合或情感共鸣等异质动机(故分歧大)。
- 平台治理的直接映射。
p与候选筛选策略构成连接模拟参数与政策干预的透明桥梁。尤须注意的反直觉发现:FoF 推荐在结构上看似温和,却带来最强的立场极化增幅——说明仅以网络形状评估推荐算法并不充分。 - 模型偏差的坦白。在纯模拟实验中,ChatGPT 倾向产生高度极化的对立簇,Gemini 则倾向共识与普遍正面情绪;即便被指示生成 −1(反疫苗)内容,Gemini 仍常输出中性甚至支持性表述。正是这一缺陷促使作者放弃直接使用观点分值,改以历史推文引导 LLM 推理。这构成对“对齐训练污染社会模拟”问题的重要方法论回应。
- 局限一:结构平滑。GPT-4o Mini 的模拟轨迹倾向压缩主要社群之间的距离,产生更紧凑的结构与部分去极化,而真实网络的社群边界更清晰、同质性在整个演化中更持久——即模拟系统性低估现实分裂程度。
- 局限二:规模与设置。为计算可行性,每数据集仅保留最大 k-核约 1,000 名活跃用户,非全网模拟;跨模型比较采用 API 默认解码参数而未调优;LLM 给出的“理由”为自我报告,与其内部计算过程未必等同。
🧠 IRMaD 思维导图
mindmap
root((观点与连边共演化))
I 引言
观点与关注同时在变
方程式模型丢掉语义
LLM 模拟不管结构
也很少对真实数据验证
R 问题
RQ1 能否统一模拟共演化
RQ2 不同模型是否有差异
RQ3 能否用参数控制结构
M 方法
成对换线 边数守恒
LLM 负责更新生成与换线
三数据集 新冠 俄乌 大选
k 核抽取约 1000 用户
五模型对比 方程式基线
2000 步 每模型跑五次
仅统计立场转变者
R 结果
模块度误差 0.064 降至 0.026
路径误差 0.132 降至 0.051
立场准确率 45.7 对 40.9
跨模型全同仅约三成
取关比关注更一致
深求与千问最相似
动机五维剖面稳定
p 越大极化越弱
朋友的朋友极化最强
结构最远降极化最优
负面新闻反致支持上升
a 讨论
同时具备拟合与机制
看形状评估算法不够
对齐训练污染模拟
模拟低估现实分裂
D 结论
语言驱动模拟更准更可解释
p 与推荐策略是治理旋钮
建议模型集成使用
图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。