计数副本还是溯源原始来源:度量大模型多智能体系统对复述证据的加权行为
原文网页:https://arxiv.org/html/2610.06192v1
PDF链接:https://arxiv.org/pdf/2610.06192v1
arXiv编号:arXiv:2610.06192v1 [cs.AI]
摘要
基于大语言模型构建的多智能体系统会频繁对观测信息进行复述:消息转发、共享黑板重复发布、多轮讨论循环传播。负责汇总信息的聚合模块应当统计独立信息源,而不是统计消息副本数量。本文将模型输出的后验概率换算为「独立观测读数」单位,定义副本权重(copy weight)指标:权重KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲w=0\)代表聚合器只统计原始来源;KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲w=1\)代表把每一条复述消息都当作全新观测;该指标可以在任意代价函数下推导隐含决策。
本文搭建三套测试环境,固定底层真实证据,仅改变证据被复述的形式:具备精确贝叶斯预言机的受控消息日志、附带副本的网页文档、四套通信协议下由大模型智能体团队生成交互日志。在三家厂商的4个主流模型上实验发现:一条被转发的副本仅等效于0.06(\rho=0.14(\rho=0.26(\rho=0.40‑0.71)0.49)0.32)0.42份全新独立观测读数,该现象主要源于部分回复会直接把每一条陈述都当作新证据。在仅有1份原始观测、但被复述3次的日志中,5%(\rho=0.14(\rho=0.26(\rho=0.40‑0.71)0.49)0.32)40%的模型输出信念会触发提前决策,而理想贝叶斯预言机不会做出该行为。在受控日志上副本计数倾向最强/最弱的模型,在网页副本、智能体生成日志上也保持一致趋势。
在聚合器系统提示中增加一段说明副本贡献规则,可将受控日志上副本权重降低至0.08及以下;在通信协议层面增加引用规则,要求智能体引用原始读数而非复述内容,可将信念引发的提前决策率从11.2%降至1.1%,同时保留真实多源证据带来的佐证增益。
关键词
多智能体系统;大模型智能体;信息聚合;证据溯源;证据复述;通信协议
目录
- 引言
- 副本证据的度量方法
- 2.1 存在复述证据时的信息聚合
- 2.2 读数证据单位与副本权重
- 2.3 从信念推导决策行为
- 2.4 模型行为与通信协议的解耦假设
- 测试环境与实验模型
- 3.1 T1受控消息日志测试集
- 3.2 T2网页证据测试集
- 3.3 T3智能体团队日志测试集
- 3.4 被测模型与统计方案
- 三套测试环境下的副本计数行为
- 4.1 所有模型均会给副本分配一定证据权重
- 4.2 权重跟随被复述的数值,而非记录条目数量
- 4.3 副本计数大多属于“全有(\rho=0.14(\rho=0.26(\rho=0.40‑0.71)0.49)0.32)全无”混合模式
- 4.4 副本会造成错误提前决策
- 4.5 网页文档场景同样存在副本计数问题
- 4.6 智能体团队默认会大量复述证据
- 决策前消除副本影响的两类方案
- 5.1 在聚合器侧做副本归并
- 5.2 在通信协议源头消除复述
- 5.3 真实多源佐证证据不会被方案破坏
- 相关工作
- 结论
- 附录简要说明
1 引言
以火星车仿真任务举例:智能体A1读取传感器S1得到沙尘暴观测并上报;智能体A2、A3直接转发该报告。交互日志中出现3条沙尘暴相关消息,但物理上只对应1次传感器真实测量。
大模型多智能体系统中该场景十分普遍:转发链路传递观测、共享黑板反复发布信息、圆桌辩论循环传播观点、层级团队向上汇总摘要、检索返回同一文档的近重复条目。聚合模块(裁判、规划器、路由、最终回答模块)需要判断:复述的消息究竟应当占有多大证据权重。
概率论给出明确结论:单纯复述已有观测不会增加新证据;后验概率只取决于独立原始来源集合,和该证据被复述多少次无关。分布式估计领域将该问题称为数据乱伦(data incest)。人类也会犯同类推理错误;传统分布式聚合算法可以通过已知拓扑规避该问题,但大模型聚合器只接收自由文本,溯源信息写在文本字段里,需要模型自行理解处理。重复文本本身就会影响大模型输出;放到多智能体系统中,引出三个核心研究问题:
- 一条复述副本,等效于多大比例的全新独立观测;
- 该权重是否会改变最终决策;
- 该行为是模型本身固有属性,还是通信协议带来的产物。
本文提出以独立读数为单位的量化度量方式:把模型输出概率换算成等价的独立观测数量;定义副本权重w ww:KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲w=0\)代表只认原始来源,KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲w=1\)代表把每一条复述都当作全新观测。该度量从模型输出信念中计算得到,不依赖人为设定决策阈值,可以推导出任意代价结构下隐含的决策行为。
搭建三套测试环境,固定底层真实证据,仅改变证据被复述的形式:
- T1:受控消息日志,配备精确贝叶斯预言机;
- T2:网页文档,附加重复、转载、摘要副本;
- T3:4种通信协议生成的大模型智能体交互日志。
主要贡献:
- 提出副本权重度量与分解框架,不固定决策阈值,可区分模型本身行为与通信协议带来的复述数量。
- 在三套测试环境完成诊断实验:模型会给转发副本分配证据权重;权重取决于文本中数值被复述的次数,而非日志记录条数;部分回复会直接把复述当作全新观测,造成仅有1份证据时就触发提前决策;不同模型副本计数倾向在三套测试环境保持一致。
- 两套可行的副本归并方案:①聚合器侧增加提示声明副本贡献规则;②协议层增加引用规则,让智能体引用原始观测而非复述;两种方案均可以抑制副本带来的虚假证据,同时保留多条独立真实观测的佐证效果。
2 副本证据的度量方法
2.1 存在复述证据时的信息聚合
隐式二值状态Y ∈ { + 1 , − 1 } Y\in\{+1,-1\}Y∈{+1,−1},先验概率为KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲1/2\)。传感器s ss输出观测x s ∈ { + 1 , − 1 } x_s\in\{+1,-1\}xs∈{+1,−1},P ( x s = Y ) = q s P(x_s=Y)=q_sP(xs=Y)=q<