arXiv 预印本 · 2026 · 技术治理 × 计算方法 · 4323 条治理参与记录 · 数据与代码全开放

用智能体分析智能体基础设施:DAO 与公司制 AI 协议治理的大模型比较研究管线

Yutian Wang, Luyao Zhang · arXiv 预印本 (cs.CY) · 2026 · arXiv: 2606.26203
原题:Agentic Analysis for Agentic Infrastructure: An LLM-Powered Pipeline for Comparative Governance of DAO and Corporate AI Protocols
Open Access 新颖度 0.78

🧒 初中生也能看懂的版本

① 研究背景(为什么要做?)

现在有一类新东西正在快速铺开,叫做 AI 智能体协议。你可以把它理解成 AI 之间的“普通话”——不同公司做的 AI 助手,要想互相认出对方、谈条件、协作干活,就得先约定一套共同的规矩。

这套规矩听起来很技术,但它其实是基础设施级别的权力。谁定规矩,谁就决定了未来这些 AI 能做什么、不能做什么、出了问题找谁负责。可到底是谁在定这些规矩,学术界研究得非常少。

这篇论文挑了两个正在制定的标准来对照,它们解决的技术问题几乎完全一样,治理方式却是两个极端:

这就构成了一个天然的对照实验:同样的技术难题,一边是理想中的去中心化,一边是公司主导的层级制。作者想看看,前者是不是真的比后者更平等。

② 研究问题(要回答什么?)

论文的总问题非常直白:相比公司式的层级治理,一个人人可进的去中心化社区,真的实现了更高程度的去中心化吗

作者把它拆成三个层层递进的小问题:

这里有一个很重要的方法论意识。作者知道,两个社区都是开源项目,开源本身就有很多共同习气。所以他们必须小心地把“开源社区的通病”“治理形式造成的差别”区分开来,否则结论就不成立。

③ 研究方法(怎么做的?)

这项研究的方法本身就是论文的主要贡献之一:作者搭了一条可复用的自动化流水线,让大模型来做过去必须靠人工完成的编码工作。

数据来自两个项目的公开记录。原始记录一共 6030 条,作者清掉了两类噪音:正文少于二十个字符的(多半是系统通知和自动消息),以及被认证为机器人账号发的。最终保留 4323 条——其中 ERC-8004 只有 142 条,Google A2A 有 4181 条。

每条记录都被打上四类标签:发言者所属机构、论证类型、立场、共识信号。做标注的是一个叫 MiniMax-M2.5 的模型,前一百零九位主要贡献者的机构归属还额外做了人工复核

话题分析用了两套互相印证的方法。一套是无监督的 BERTopic,把文本变成向量再聚成十九个话题;另一套是让大模型做归纳式主题分析,产出十九个人能读懂的主题标签。两套方法都算了一个叫 JS 散度的指标——你可以把它理解成“两个社区聊的东西差多远”,零表示完全一样,一表示完全不重叠。

网络分析是三层递进的,每一层都在前一层上加信息:

衡量不平等用的是基尼系数,跟衡量贫富差距是同一个指标:零表示人人参与度相同,越接近一表示互动越集中在少数人手里。

④ 结果(发现了什么?)

研究得出了一个相当反直觉的结论:两种体制在参与不平等和社区破碎程度上几乎一样,真正被治理形式改变的是大家讨论什么。

不平等程度几乎相同
互动集中度基尼系数:开放社区 0.804,公司主导 0.779
两边都是少数人主导。
谈论的东西差别很大
信任与安全话题:开放社区占 34.5%,公司主导只占 4.0%,相差 30.5 个百分点
开放社区反而更同质
共识网密度 0.1480.082
开放社区内部意见一致得多。

先看话题层面。两个社区的主要话题差距用 JS 散度衡量分别是 0.288 和 0.216,属于中等但确实存在的分化。方向非常清楚:开放社区把三分之一以上的精力放在信任与安全机制上——也就是“这个协议应该是什么、凭什么可信”;而公司主导那边把精力铺在文档示例、协议版本、传输机制、流式通信这些怎么把东西做出来发出去的问题上。作者的概括很精辟:一边讨论的是建什么、为什么建,另一边讨论的是怎么建、怎么交付

还有一个有意思的细节:公司主导的社区,流程性论证的比例几乎是开放社区的两倍(25.4% 对 13.9%)。作者的解读是,公司治理带来了实实在在更重的协调开销

再看网络层面,这里出现了论文最重要的发现。两个社区的互动集中度基尼系数几乎一样高。前三名贡献者在开放社区占了 32.3% 的互动,在公司社区占 14.9%。更关键的是,两边都检测不出显著的核心—边缘结构,社区都高度破碎:开放社区被分成 46 个小群,公司社区分成 358 个。公司社区里有 333 人(占 43.2%)是完全孤立的,从没和别人在同一个帖子里说过话。

作者特别指出,机构标签完全预测不了互动结构——两边的机构模块度都是负数。也就是说,人们并不是按公司抱团讨论的。

最出人意料的是共识网络。理论上开放社区应该更多元,可实际上它的共识密度几乎是公司社区的两倍。作者认为这是一个警号:小圈子更容易形成群体思维

最后一个数字很能说明分工差异。每个话题被多少人分担,用基尼系数衡量,公司社区是 0.453,开放社区只有 0.085。意思是公司那边每个话题都有一小撮专人负责,分工明确;开放社区则是大家都在聊同几件事。而且两边的话题重叠系数是 1.0——开放社区讨论的每一个话题,在公司社区里都能找到。

⑤ 讨论(这些发现说明什么?)

作者给出的核心判断是一句很有分量的话:去中心化更多是一种设计,而不是一个事实

他们把开放社区的问题叫做中心化悖论。表面上谁都能进来发言,但日常决定根本不投票。于是“哪个提案算成熟了”“哪条反对意见算实质性的”“什么程度算达成了大致共识”这些判断权,就悄悄集中到少数几个人手里。而且因为没有正式的层级来分配决策权,反而更容易形成群体思维——这正好解释了前面看到的共识密度偏高。

作者用一句话概括:准入权利上的去中心化是真的,但日常决策权会集中到那些有时间、有声望、能一直待在场子里的人身上

他们还认真回应了一个可能的质疑:会不会两边的相似只是因为都是开源项目?作者给了两条反驳。第一,话题分化那么明显,不可能用开源习气解释,那是治理形式造成的。第二,如果只是规模效应,那么开放社区的共识密度应该更低才对,可实际结果正好相反。所以他们给了一个分层的结论:开源发布决定了参与不平等和社区破碎这个底色,治理形式则决定了这些倾斜的参与投向哪些话题、谁积累起非正式的权威

关于“谁在决定未来方向”,作者的回答很不客气:两边都是一小群精英,只是公司这边的守门人是企业代表,开放社区那边是“留在场子里的人”。他们认为 DAO 模式更深的风险不是出现精英——任何持续的讨论都会出现精英——而是在缺乏正式问责结构的情况下,这种影响力通过声望运作,对外人不透明,新人也很难挑战

论文里最值得决策者记住的一句话是:讨论问责的社区会把问责设计进架构,讨论速度的社区会把速度设计进架构。今天在论坛上聊什么,会一路传导进将来部署的系统里。

局限也讲得很清楚。第一,两边样本量极不对称——142 条对 4181 条,低频话题的置信区间很宽。第二,公司那边的委员会会议、内部设计评审、伙伴谈判都发生在公开仓库之外,所以论文观察到的集中度可能低估了其核心成员之间的真实讨论。

⑥ 结论(最终结论 + 启示)

这项研究给出的最终答案是:开放的准入并不会自动带来分散的权力。把门打开和把权力分出去,是两件不同的事。

作者据此给出三条相当具体的建议。对标准制定组织:开放准入必须配上程序性问责机制,否则开放只是形式。对协议设计者:要把“议程本身”当成一个设计对象来看待——因为没被讨论到的话题会直接变成默认设置,所以定期审计“我们没在聊什么”,和审计“我们在聊什么”同样重要。对采用标准的实践者和政策制定者:光看规范文本不够,还要去读它的讨论记录,因为塑造了这些规则的价值判断,往往从规则本身是读不出来的。

更长远地看,当 AI 智能体从实验室原型走向关键基础设施时,这些发生在上游的讨论选择,就变成了整个社会的选择

🎓 专业 IRMaD 结构解读

I. Introduction(引言)

随着 AI 智能体协议的扩散,其互操作标准的治理结构在经验层面严重欠缺研究。核心问题是:谁控制着自主智能体跨组织边界发现、协商与协调所依循的规则?该问题位于人工智能与制度设计的交叉处,但标准得以协商的公共话语长期难以在规模上被研究——既有工作以固定类目的人工编码为主,同时限制了主题发现与大规模文本的结构分析。

本文以一条大模型驱动的比较管线填补该空白,整合自动化标注、神经主题建模与多层网络分析,并在两个标准上验证:ERC-8004(无许可、链上,属以太坊改进提案体系,依 EIP-1 生命周期推进,以论坛参与者与 EIP 编辑的大致共识推进,无正式投票、实现无需许可)与 Google A2A(由谷歌发起,2025 年 6 月捐赠予 Linux 基金会,现由八席技术指导委员会治理,成员全部为企业代表)。

两个协议处理同一技术问题(AI 智能体跨系统通信),治理过程又均在 GitHub 或论坛上公开,因此二者的比较隔离出治理形式对“谁参与”与“讨论什么”的影响,构成一个准自然的对照设计。

I. Theoretical Framework & Hypotheses(理论框架与假设)

编号研究问题对应分析层与判定
RQ相较公司层级制,无许可 DAO 的治理结构是否真正实现了更高程度的去中心化总问题;由下列三个子问题合成回答
RQ1决策架构:两种体制的正式决策程序、准入权利与权威结构有何差异依官方文档重建治理机制并绘制决策流图
RQ2话语构成:治理形式如何塑造参与话语的主题与论证构成监督式论证类型 + BERTopic + Thematic-LM,以 JSD 度量跨案分化
RQ3关系网络:治理形式如何塑造共同参与联结、共识与冲突结构、以及行动者—主题的协作分工三层网络:SNA / DNA / 社会语义二模网

关键识别关切(构成性 vs. 规制性):作者预设的对立解释是“两案的趋同仅源于共享的开源社区规范而非治理形式”。论文以两条证据分层拆解该竞争假设:其一,主题分化的量级无法归约为开源规范,它反映的是提出标准(协议是什么)交付实现(如何构建)之间的构成性—规制性区分;其二,若仅是规模效应,无许可社区的共识密度应更低,而观测结果恰好相反。由此得出分层结论:开源发布确立了高参与不平等与破碎社区结构的基线,治理形式则重新导向这种倾斜参与投注于哪些主题、以及哪些行动者积累非正式权威

M. Materials & Methods(材料与方法)

R. Results(结果)

a / D. Discussion & Conclusion(讨论与结论)

🧠 IRMaD 思维导图

I 引言 R 研究问题/假设 M 方法 R 结果 a 讨论 D 结论
mindmap
  root((智能体协议的治理))
    I 引言
      谁定 AI 互操作规则
      标准治理少有实证
      两案同题不同制
      开放论坛对企业委员会
    R 问题
      RQ 无许可是否更去中心
      RQ1 决策架构差异
      RQ2 话语构成差异
      RQ3 关系网络差异
      须排除开源通性解释
    M 方法
      6030 条清洗为 4323 条
      大模型标注四类字段
      人工复核前 109 位
      BERTopic 与主题归纳双验
      JS 散度度量分化
      三层网络递进分析
    R 结果
      度基尼 0.804 对 0.779
      两案均无显著核心边缘
      信任安全 34.5 对 4.0
      流程论证 25.4 对 13.9
      共识密度 0.148 对 0.082
      主题重叠系数为一
      A2A 四成参与者孤立
    a 讨论
      去中心化是设计非事实
      日常决策权悄然集中
      小圈子更易群体思维
      精英不可免 问责可建
      议程决定架构价值
    D 结论
      开放准入不等于分权
      议程本身是设计对象
      审计没被讨论的话题
      读规范也要读审议记录

图:本研究的 IRMaD 思维导图。蓝色 I 引言;橙色 R 研究问题;绿色 M 方法; 橙色 R 结果;紫色 a 讨论;红色 D 结论。