arXiv preprint · 2026 · 牛津互联网研究院 + 英国人工智能安全研究院 · 四项预注册 RCT,n=18978 场对话

人工智能系统的说服力超过人类专家

Kobi Hackenburg, Caroline Wagner, Luke Hewitt 等 8 人 · arXiv preprint · 2026 · DOI: 10.48550/arXiv.2606.16475 · arXiv: 2606.16475
原题:AI systems out-persuade expert humans
Open Access 新颖度 0.93

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

很多影响千万人的大事,最后其实是靠一场说服的较量定下来的,谁能压过对手把人说动,权力和资源就归谁。你有没有留意过这一点?选举里,赢的往往是最能把选民说动的那一方;法庭上,陪审团听谁的;募捐时,钱流向哪家机构的呼吁最动人;连辩论比赛本身,都是把「谁更会说服」直接做成了竞技项目。

过去几年,会聊天的人工智能闯进了这场较量。研究已经发现,聊天机器人能改变投票倾向、能让人放下阴谋论也能让人相信阴谋论、能改变道德判断、能让人下单买东西,甚至能让人真的去签请愿书、真的掏钱捐款。但有一个关键问题一直没答案:它能不能打赢人类里最会说服的那一小撮人?

这个问题很要紧。早年的机器辩手上台跟职业辩手比,明显落后;后来的研究说,新的聊天模型大概能追上网上随便招来的普通人。可「普通人」和「专家」差得远。真正决定选举、政策和捐款流向的,是拿薪水靠嘴吃饭的职业说服者——竞选团队、游说公司、募捐拉票员、顶级辩手。

如果人工智能连这些人都压得住,事情就变味了:一场说服的较量,不再取决于谁的道理更硬、谁的口才更好,而取决于谁能用上最强的那台机器。想搞虚假信息、想做精准骚扰、想行骗的人,过去最大的瓶颈是「雇不到那么多能说会道的人」,这个瓶颈也会被一次性拆掉。更微妙的是,将来负责审查人工智能的人,面对的可能正是一个比自己更会说服的被审查对象。

② 研究问题(要回答什么?)

这篇论文要回答的核心问题是,人工智能在一对一的文字对话里,说服力能不能压过人类中最会说服的那一群人。研究团队把它拆成四个递进的小问题,一个实验回答一个。

③ 研究方法(怎么做的?)

研究团队自己写了一个多人在线聊天平台,做了四场预注册实验,外加一场专门用来挑人的预注册锦标赛。预注册的意思是:分析方案在收数据之前就公开登记好了,事后不能挑对自己有利的算法。总规模是 18978 场对话、6923 位被说服者,从 2025 年 10 月一路做到 2026 年 5 月。

怎么比?每位被说服者上线时,系统实时随机分配他去和谁聊——可能是机器,可能是某一类人类说服者,也可能被分到对照组。这里的对照组设计得很讲究:不是什么都不做,而是同样和一个人工智能聊一样长的天,但聊的是「猫派还是狗派」「纸书还是电子书」「在家办公还是去公司」这类完全不涉及政治的日常话题,一共八个。这样一减,减掉的就是「聊了天」和「问了两遍」本身带来的影响,剩下的才是真正的说服效果。

全程是单盲:被说服者不知道对面是人还是机器。聊天限定纯文字、来回二到十轮、必须轮流发言、第二轮之后被说服者可以随时结束。政治议题那三场实验的对话中位数是 7 轮、14 分钟。

人类这边有多强?研究团队几乎是倒过来贴钱帮人类打赢的,一共五类对手。

普通人
网上招的 132 位英国成年人
时薪 12 英镑
不给准备时间
选拔出的高手
87 位
从 1154 人的四轮淘汰赛里杀出
只留前一成
顶级辩手
56 位
含 4 位世界冠军
平均赛龄近九年
受训后的辩手
43 位回锅
专门研究打败过自己的机器
职业募捐拉票员
英国募捐公司现职
人均生涯对话上万次
时薪 140 英镑

辩手可以自己投票挑议题,还有带薪备赛时间;奖金池头名一千英镑;每聊一场还按「你的效果相当于机器的几成」再发一笔钱。换句话说,人类是带着主场、带着时间、带着重金上场的。

结果怎么量?前三场实验量态度:聊天前后各答三道 0 到 100 分的滑块题,取平均。最后一场实验量行为:聊完给被说服者一笔真的 1 英镑奖金,他可以自己决定捐多少给「救助儿童会」,捐了就真的转过去。另外,团队还用一条自动流水线把每一句话里的可核查事实数出来并逐条上网验真伪。

④ 结果(发现了什么?)

在每一场较量里,人工智能的说服力都稳稳压过了每一类人类高手,包括国际顶级辩论赛的冠军和现职的职业募捐拉票员。下面的数字是「比对照组多挪动了几个百分点」,越大越能说动人。

对普通人
机器多 8.2 个百分点
对选拔出的高手
机器多 5.6
对顶级辩手
机器多 4.6
对职业拉票员
机器多 5.9

四项全部 p<0.001,也就是「极不可能是碰巧」。

给人类开小灶,有用吗?研究团队把打败辩手的那台机器的提示词原封不动给他们看,让他们跟它对练,还把自己每一场对话的「实际挪动了多少分」摊开来复盘,甚至能点开任意一句话看「机器在这里会怎么说」。辩手确实学到了东西:每条消息多写了约 9.8 个词,每场对话多抛出约 1.6 条可核查事实(增幅超过五成)。但说服力没有显著提升(多 1.0 个百分点,p=0.20)。差距从 6.0 个百分点缩到 4.1 个,缩小了,但没补上。

把机器拴住呢?这一步最有意思。研究者规定机器每条消息只能写约 51 个词、还得等约 92 秒再回复——都是照着顶级辩手的实际表现设的。结果机器的优势直接归零(相差 0.0 个百分点,p=0.96)。原来的机器平均一条回复写 294 个词、几乎秒回;辩手平均 54 个词、要想 95 秒。

那优势到底来自哪?答案是信息量。不受限的机器一场对话平均抛出约 37 条可核查事实,被拴住之后只剩约 12 条,而顶级辩手只有约 3 条。事实条数和说服效果的吻合度高到 R2=0.89。而且被拴住之后,被说服者的评分掉得最多的正是「对方论证有多硬」和「我学到了多少」这两项,而「像不像人」这一项反而涨了。

有没有哪个人能赢?研究者给每一位人类说服者单独算了一个成绩,318 个成绩里没有一个超过机器;最强的那位是受训后的辩手,也还差 4.0 个百分点。十个议题全都是机器赢,十四种人群切分里绝大多数也是机器赢。

真金白银那一场:机器让人均多捐了 17.2 个百分点的那 1 英镑奖金,职业拉票员只让人多捐 6.4 个百分点——这就是摘要里说的接近三倍。两边相差 10.8 个百分点,换成钱大约是人均多捐十一便士。而且两头都赢:愿意掏钱的人数比例更高,掏钱的人给得也更多。

⑤ 讨论(这些发现说明什么?)

这个结果为什么让人不安?因为它意味着一场说服的较量,输赢可能不再取决于谁的道理更硬,而取决于谁用得上最强的那台机器

研究者点出两条「权力集中」的路。第一条好理解:谁最有钱、最能拿到最强的系统,谁的声音就被放大——大公司、大竞选团队、乃至国家。第二条更隐蔽:就算双方都能平等用上最强的模型,真正的权力其实在造模型的人手里——因为是他们在决定「我的模型愿意替哪种立场说话、不愿意替哪种」。这种情况下,权力不是流向使用者,而是流向供应商。

但作者也老实地说了反方向的可能。便宜又强的说服力,也许能帮上那些一直请不起好律师、请不起公关团队的人——自辩的当事人、公派辩护律师、小慈善机构、草根活动者。而且既然机器的优势来自「给的信息多」,理论上公众可能因此更了解情况。

可这里埋着一颗钉子。研究团队把三十多万条论据逐条上网核对,发现只有约一半站得住;人类说服者的准确率是 73%,机器只有 47%。更扎心的是,说得越准并不等于说得越动人:全部实验里最能说动人的那一组机器,恰恰是论据核实率最低的一组,只有约两成能被证实。所以「机器让公众更明白」这个乐观预期,并不自动成立;关键在于它说的话,和它替换掉的那些说服相比,是更靠谱还是更不靠谱。

作者也列了几道可能的刹车。一是够不着人:能聊天的平台都有登录和实名验证,机器未必能接近它想说服的对象。二是识破了会不会免疫:目前证据很弱,已有研究发现给消息打上「人工智能生成」的标签并不会削弱它的说服力。三是量比质重要:在大规模传播里,「有多少人看到」的差异远大于「每次看到有多说服人」的差异。四是本研究的条件很苛刻:中位 14 分钟、全神贯注的文字对话,在付费问卷之外的真实生活里很难复制。

作者自己划了三条局限。对话只有文字,换成语音、视频、面对面会怎样不知道;捐款虽然是真钱,但上限只有 1 英镑,换成投票、大额定期捐赠、或者遵守防疫政策这类高风险决定,结论可能不一样;还有最根本的一条:要把「每场对话的效果」换算成「对整个社会的净影响」,必须先知道人工智能的说服究竟是替换掉了别的说服,还是填进了原本的空白。

⑥ 结论(最终结论 + 启示)

研究团队的结论是,在文字对话这种形式里,前沿人工智能的说服力已经超过了他们能招募到的、最有准备也最有动力的人类专家。

更要紧的是两个附带结论。第一,培训人类补不上这个差距——顶级辩手拿到打败自己的那台机器的全部底牌、对练了几十场,也只是缩小而没有抹平差距。第二,唯一能抹平差距的办法是限制机器本身:只要不准它写得更长、回得更快,优势立刻消失。这其实给平台治理指了一条很具体的路——真正要管的可能不是「说了什么」,而是「单位时间能说多少」这种结构性优势。

作者最后写了一句很克制但很重的话:问题已经不再是人工智能能不能说服过人,而是这种能力将在哪里、以什么方式、替谁被使用。对传播研究来说,这等于宣布说服研究的基准线换了——以后讨论说服效果,参照系不再是「一个很会说话的人」,而是一台不会累、不会紧张、永远秒回的机器。

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

本研究处在政治传播效果研究人机传播两条脉络的交汇处。前者在过去十年被「最小效果」共识主导:Kalla 与 Broockman 汇总 49 项田野实验发现大选中的竞选接触几乎没有可测的说服效果,Coppock 等人的 59 项实时随机实验也显示政治广告效果微小且高度稳定。唯一稳定的例外是长时间人际对话——登门拜访式的深度对话可以持久降低偏见。

后者近三年迅速堆积:对话式人工智能可以改变投票偏好(Nature 2025)、持久削弱阴谋论信念(Science 2024)、反向植入阴谋论、改变道德立场、促成消费与真实政治行动。但既有研究的比较基准几乎都是众包平台上的普通人:Salvi 等人发现 GPT-4 的对话说服力可与网络工人相当,Schoenegger 等人报告模型可超过受激励的普通人。更早的 IBM Project Debater 与职业辩手对阵时明显落后。

由此留下的空白正是本文的靶心:既往从未把前沿模型放到「职业级、受重金激励、可自选议题、可带薪备赛」的人类说服专家面前做直接对抗。本文的四项贡献是:(i) 首次以同平台、同议题、实时随机匹配的对抗设计,把模型与五类人类说服者(含 4 位世界辩论冠军、现职职业募捐拉票员)放在同一个估计框架内比较;(ii) 通过吞吐量约束这一实验操纵,把「模型为何更强」从相关推进到可操纵的机制证据;(iii) 用教练干预检验人类能否通过学习追平,回答了「差距是否会随时间自然收敛」;(iv) 把结果从态度量表外推到真实货币行为,直面既往文献中态度效应与行为效应不相关的断裂。

I. Theoretical Framework & Hypotheses(理论框架与假设)

作者不诉诸单一说服理论,而是把信息供给(information provision)作为核心解释机制,与温情/共情/融洽(warmth, rapport)一类关系性机制对立起来检验。其理论来源是既往发现:论辩性、事实密集的对话最能撬动政策态度,且每场对话中可核查事实主张的条数能预测说服效果。本文将其推进为「事实密度」假说:模型的优势并非源于更懂人心,而源于其写作吞吐量使其能在同一段对话里塞进人类无法企及的信息量。

编号研究问题 / 可检验命题对应机制与检验
RQ1前沿模型能否在态度说服上超过专家人类Study 1:对抗三类人类;对主动对照的处理效应之差
RQ2a人类能否通过学习模型策略追平Study 2 教练干预;受训前后同一批辩手的组内比较
RQ2b模型优势是否依赖其结构性吞吐优势Study 2 Constrained AI:词长与延迟双重封顶
RQ2c类均值是否掩盖了个别能匹敌模型的人类逐说服者随机效应预测 + 固定效应重拟;逐议题、逐子群
RQ3-i约束是否选择性压低信息性评价而非关系性评价七项搭档评分逐项建模;信息项 vs 共情/愉悦/拟人项
RQ3-ii事实密度是否跨人机条件一致预测说服效果条件层散点 + 对话层「净于事实密度」的人机哑变量
RQ4优势能否外推到真实世界职业者与真实行为Study 3 职业拉票员(态度);Study 4 真实捐款(行为)

注意作者的关键伪证设计:若「事实密度」假说为真,则在控制住 log 事实条数之后,人机哑变量的系数应当趋近于零——这是一个对自己假说不利即会暴露的检验。

M. Materials & Methods(材料与方法)

R. Results(结果)

一、态度说服:模型对全部五类人类均有显著优势(相对主动对照的百分点差,括号内为 95% Wald CI)

人类对手(N 说服者 / N 对话)该类 vs 对照模型领先该类结论
普通人 Random Laypeople(132 / 1108)4.7 pp [3.3, 6.1], p<.001+8.2 pp [6.7, 9.7], p<.001模型胜
选拔高手 Selected Laypeople(87 / 993)7.2 pp [5.8, 8.7], p<.001+5.6 pp [4.1, 7.1], p<.001模型胜
顶级辩手 Elite Debaters(56 / 1030)8.3 pp [6.8, 9.7], p<.001+4.6 pp [3.1, 6.1], p<.001模型胜
职业拉票员 Professional Canvassers(19 / 975,Study 3)6.9 pp [5.4, 8.5], p<.001+5.9 pp [4.3, 7.5], p<.001模型胜
受训辩手 Coached Elite Debaters(43 / 1081,Study 2)9.7 pp [7.7, 11.8], p<.001+4.1 pp [2.5, 5.7], p<.001模型胜

Studies 1–2 汇总的模型效应为 13.9 pp,Studies 1–3 汇总为 13.3 pp。受训辩手的 9.7 pp 是全研究中最高的人类效应,仍低于模型约 4 个百分点。

二、两项「缩差」干预:教练无效,限速有效

三、稳健性:没有任何个体人类匹敌模型

四、机制:优势来自信息吞吐,而非共情或拟人

五、Study 4:真实货币行为 —— 「近 3 倍」的确切口径

对比估计(1 英镑奖金的百分点)95% CIp
模型 vs 主动对照+17.2 pp[+11.3, +23.1]<.001
职业拉票员 vs 主动对照+6.4 pp[+0.0, +12.8]0.048
模型 − 拉票员(预注册对比)+10.8 pp[+6.4, +15.1]<.001
外延边际:曾捐款者比例+6.0 pp[+2.6, +9.5]
内延边际:捐款者的平均捐额+12.9 pp[+10.0, +15.8]

「近 3 倍」= 17.2 / 6.4 ≈ 2.7,即两者各自相对主动对照的处理效应之比,而非原始捐款额之比、也非捐款人数比例之比。度量尺为「所捐占 1 英镑奖金的比例」,1 pp 相当于人均多捐 1 便士;故 +10.8 pp 约等于人均多捐 10.8 便士。两条边际同时为正,说明模型既拉新(更多人肯掏钱)又提额(掏钱的人给更多)。

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((AI说服力超越人类专家))
    I 引言
      社会决策靠说服竞赛
      AI已能改变投票倾向
      未知 能否胜过专家
      影响力或向算力集中
      滥用瓶颈被拆除
    R 问题
      RQ1 能否胜过专家
      RQ2 有无人类反超场景
      RQ3 优势从何而来
      RQ4 能否迁移到行为
    M 方法
      4项预注册实验
      18978场对话
      6923名说服对象
      5类人类对手
      主动对照闲聊AI
      态度量表 0-100
      真实1英镑捐款
      自动事实核查
    R 结果
      胜普通人 8.2pp
      胜辩论冠军 4.6pp
      胜职业拉票员 5.9pp
      培训后仍差 4.1pp
      限速后归零 0.0pp
      318人无一超AI
      捐款效应近3倍
      事实密度 R2 0.89
    a 讨论
      优势源于信息吞吐
      非共情非拟人
      主张仅51%可核实
      更准不等于更能说
      权力或向模型方集中
      曝光量或比说服力重要
    D 结论
      前沿AI已超人类专家
      培训人类补不上差距
      限速是唯一有效抓手
      治理看吞吐不看内容

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。