☰
AgentMonBench:面向长视界智能体的证据驱动监督评测基准
2026/10/7 16:18:29 网站建设 项目流程

AgentMonBench:面向长视界智能体的证据驱动监督评测基准

原文网页:https://arxiv.org/html/2610.06406v1
PDF链接:https://arxiv.org/pdf/2610.06406v1
arXiv编号:arXiv:2610.06406v1 [cs.AI],提交日期:2026‑10‑05
开源代码仓库:https://github.com/zhk‑lab/EBG
数据集HuggingFace:https://huggingface.co/datasets/ZhaoHongKang/AgentMonBench
项目主页:https://zhk‑lab.github.io/agentmonbench‑ebg/

摘要
当智能体执行长视界复杂任务时,人类用户从亲自做每一步决策转变为监督智能体自主执行。但智能体产生的行为体量庞大、支撑证据碎片化,用户很难识别哪些关键决策需要人工复核。本文面向智能体监控器开展研究:识别具备重大影响的决策,并定位支撑证据,辅助用户评估决策带来的后果。
本文提出AgentMonBench软件工程领域评测基准,包含3个子集,覆盖两大互补维度:需求‑行为一致性、重大自主决策识别与复核。为支撑上述判断,提出EBG证据驱动行为图(Evidence‑Grounded Behavior Graph),一套无需训练的方法,将带来源溯源的证据聚合为行为单元,并构建行为之间的显式关系图;同时生成面向任务的视图,辅助监控器在上下文语境下解析智能体行为。
在8个大模型上的实验表明:相比于直接读取原始上下文,EBG在绝大多数设置下可以提升关键决策识别与证据定位能力。进一步实验证明,EBG带来的证据定位增益在不同输入规模、不同超参数下均可稳定保持;真实业务用例验证该方案在人类监督场景的实用价值。数据集与代码全部开源。

关键词
长视界智能体;智能体监督;证据溯源;行为图;评测基准;软件工程智能体;人工复核

目录

  1. 引言
  2. 相关工作
  3. AgentMonBench基准构建
    • 3.1 SpecGAP:任务需求约束被隐式省略
    • 3.2 SilentSwap:可运行但语义改变的代码替换
    • 3.3 FeedbackTrace:来自用户滞后反馈的复核检测点
    • 3.4 质量校验与人工复核
  4. EBG证据驱动行为图
    • 4.1 整体概述
    • 4.2 结构化行为图构建
    • 4.3 面向任务的证据阅读与视图渲染
  5. 实验
    • 5.1 实验设置
    • 5.2 主实验结果
    • 5.3 不同输入规模下性能表现
    • 5.4 集成至Codex Harness真实用例
  6. 结论
  7. 附录简要说明

1 引言

大模型编码智能体已经可以完成长视界复杂任务:修改代码仓库、复现科研实验、数据分析报告生成。当用户把工作流委托给智能体,角色从执行者转变为监督者;但责任不会随着委托而消失,用户依然需要判断智能体决策是否符合自身目标。
长视界智能体监督存在巨大现实挑战:智能体产生行为数量巨大,远超人类阅读、评估的能力上限。有效的监督需要态势感知:察觉发生了什么行为、理解行为的重要性、预判后续带来的影响。监督需要关注两大维度:①智能体执行行为与用户需求之间的一致性;②识别出需要人工确认的重大自主决策。

典型示例:智能体做数据分析时选择直接丢弃缺失值,该决策会改变分析样本总体,但该选择不会主动告知用户;相关证据分散在消息、工具返回结果、中间产出物,用户很难定位,需要监控器自动识别这类待复核决策,并定位支撑证据。

现有研究大多聚焦轨迹质量评估、问题发现、主动澄清交互;本工作研究监控器:识别影响任务目标、约束、结果解读的关键决策,并把决策关联到上下文证据。
本文贡献:

  1. 形式化定义长视界智能体中需要人工复核的重大决策监控问题。
  2. 构建AgentMonBench软件工程评测基准,包含3个子集,覆盖需求‑行为对齐、重大决策识别复核两类监督场景。
  3. 提出EBG证据驱动行为图,无需训练,将溯源证据组织为行为与关系图,生成任务导向视图,辅助监控器完成判断。

实验在8个大模型上开展,EBG相比基线普遍提升决策识别与证据定位效果;增益在大输入上下文下依然稳定;5个真实科研任务案例验证了该方法的落地价值。

2 相关工作

  1. 人在回路监督自动化:人因工程研究自动化带来的“出环问题”,强调态势感知、人对自动化系统合理信任;可控学习方向研究终端用户可审计、可 steering 的AI系统。本工作聚焦智能体重大决策与证据的自动定位,降低人类监督负担。
  2. 智能体澄清与主动交互:Ambig‑SWE、Ask or Assume等研究,让编码智能体识别需求歧义并主动提问;7T‑Bench、KnowU‑Bench侧重隐式意图解析、偏好获取。上述工作侧重智能体执行过程主动获取缺失信息;AgentMonBench侧重事后监控器识别智能体已经做出、但未向用户披露的关键选择。

3 AgentMonBench基准构建

AgentMonBench用于评测监控器识别重大决策、定位支撑证据的能力。包含3个子集,两大维度:

  • 需求‑行为对齐维度
    • SpecGAP:识别任务文档未写明、但代码实现中生效的约束;
    • SilentSwap:识别代码发生语义变更,但原有测试用例依旧全部通过。
  • 重大决策感知复核维度
    • FeedbackTrace:从真实交互轨迹识别应当交由用户确认的自主决策,真值来自后续用户反馈。

数据集底层基于DeNovoSWE、SWE‑chat公开资源构建。

3.1 SpecGAP:任务需求约束被隐式省略

SpecGAP实例来自DeNovoSWE任务,人为从任务文档中删除若干关键约束条件。
测试目标:监控器能否识别代码仓库中已经实现、但任务文档没有写明的关键行为与约束。
构建流程:

  1. 条件移除:在原始任务文档指定位置删除选定条件,保证剩余文本不会泄露被删除内容,文档整体保持通顺。
  2. 仓库证据映射:两种独立映射策略:①逐条条件映射;②整体上下文映射,使用完整原始文档做参考。
    人工审核两种映射结果,选择正确映射或者重写解释文本。数据集人工双审一致性92.4%。

3.2 SilentSwap:可运行但语义改变的代码替换

任务文档保持不变,在仓库中做5处语义替换;全部替换之后原有测试套件依然可以全部通过,但内部行为语义已经改变。测试目标:监控器识别这些实现语义发生变化的关键行为。
构建三阶段流水线:

  1. 行为选择器Selector:挑选具备对应代码实现、可以用具体输入做测试的文档描述行为。
  2. 构建器Builder:修改目标代码,记录变更,构造专门的语义区分测试用例。
  3. 质量校验器Quality Checker:确认修改不会破坏无关功能。

验证流程:

  1. 单独验证:每一处替换单独运行,修改前后原有测试全部通过,专属语义测试由通过变为失败。
  2. 组合验证:语义测试在没有对应替换时通过,存在替换则失败,无论其它替换是否同时生效。
    人工双审一致性93.6%。

3.3 FeedbackTrace:来自用户滞后反馈的复核检测点

样本取自SWE‑chat真实Python软件工程会话。真值来自用户后续反馈;监控器输入只能拿到反馈发生之前的交互轨迹。
构建流程:

  1. 样本筛选:选取存在用户反对反馈事件的会话,每个会话最多保留一条样本。
  2. 证据单元切分:将轨迹切分为两类单元:智能体回复段落、工具调用+对应返回结果。

人工标注内容:复核点描述、决策带来的影响、需要用户确认的选择、最小充分证据单元、关键性标签。人工双审一致性93.0%。

3.4 质量校验与人工复核

三个子集全部执行双人独立评审流程,校验真值标注、证据、解释文本,过滤歧义、错误样本。

4 EBG证据驱动行为图

4.1 整体概述

长视界智能体任务中,分析行为需要的证据分散在超长上下文。EBG(Evidence‑Grounded Behavior Graph)证据驱动行为图,无需调用大模型,完全确定性执行。
输入:智能体上下文X XX(代码仓库 / 交互轨迹),任务需求Q QQ。
完整流水线:
KaTeX parse error: Can't use function '\(' in math mode at position 25: …}(X), \mathcal{\̲(̲\mathcal V\)}=P…

  1. F τ F_\tauFτ​图构建器:输入原始上下文X XX,输出结构化行为图G = ( E , B , S , R ~ ) G=(E,B,S,\tilde R)G=(E,B,S,R~);E EE证据单元,B BB行为单元,S SS作用域,R ~ \tilde RR~显式关系边。
  2. P τ P_\tauPτ​展示器:将图G GG转换为面向任务的证据视图KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal \̲(̲\mathcal V\)。
  3. 监控器M MM读取任务需求Q QQ与视图KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal \̲(̲\mathcal V\)输出检测结果。

4.2 结构化行为图构建

全部步骤为确定性规则处理,不调用LLM。

  1. 证据提取Evidence Extraction:每个证据单元保存ID、原始内容、来源位置;支持多个行为引用同一份原始证据。
  2. 行为形成Behavior Formation:将同源证据按照角色组织为行为单元。
    • 仓库模式行为:(条件‑操作‑结果);
    • 轨迹模式行为:(需求‑动作‑响应)。
  3. 图组织Graph Organization
    • 行为作用域Scope:将语义相关行为聚合到同一个作用域;
    • 显式关系边:带证据支撑的有向边,描述不同Scope之间依赖、触发、修改等关系。

4.3 面向任务的证据阅读与视图渲染

EBG根据输入类型(仓库 / 交互轨迹)生成不同视图,方便监控器阅读。

  1. 仓库Repository视图
    • 文件筛选:基于任务需求对目录做优先级排序;
    • 种子节点扩展:匹配任务文档的节点作为种子,一跳扩展关联子图;
    • 组件划分与根节点选择;
    • 组装视图:关联代码片段、文档原文,输出可阅读证据视图。
  2. 轨迹Trajectory视图
    行为单元按照任务Scope分组,保留原始时序;最后一次行为标记为Current,其余标记为History;每个行为携带原始证据ID,完整复现任务推进过程。

监控器基于任务需求 + EBG输出视图,识别需要人工复核的重大决策,并且输出溯源到原始来源的支撑证据。

5 实验

5.1 实验设置

被测监控基座模型(8个)
GPT‑5.6 Luna、GPT‑5.6 Terra、GPT‑5.6 Sol、Claude Sonnet 5、DeepSeek‑(\mathcal V)4.1‑Flash、DeepSeek‑(\mathcal V)4‑Pro、Kimi K3、GLM‑5.3。

对比基线

  1. Base基线:直接输入原始仓库内容 / 原始交互轨迹;
  2. RepoGraph:仓库级代码图检索方案适配版本;
  3. EBG:本文证据驱动行为图方案。

评测指标

全部指标取值0‑1,数值越高效果越好。

  1. 规则类指标
    • SpecGAP:LF1定位F1,衡量支撑代码证据定位;
    • SilentSwap:LS定位分数,衡量代码行匹配重叠;
    • FeedbackTrace:EHR证据命中率,是否命中至少一条正确证据ID。
  2. LLM‑as‑Judge裁判指标(双裁判取均值)
    • SpecGAP:SF1语义F1识别缺失约束、QQ澄清问题质量;
    • SilentSwap:LC定位正确性、CC变更理解正确性;
    • FeedbackTrace:(\mathcal V)PA复核点语义对齐、ESS证据支撑完备度。

5.2 主实验结果

完整表格参考论文Table1,关键结论总结:

  1. 当前大模型做智能体监控任务依然存在明显短板,即便使用结构化上下文,识别重大决策、证据溯源依旧难度很高。
  2. 在绝大多数模型、绝大多数任务子集上,EBG优于Base原始上下文基线,多数场景优于RepoGraph基线。证明以行为‑证据为核心的上下文组织方式具备价值;但不同模型、不同任务收益幅度存在差异。
  3. 证据检索成功 ≠ 决策语义理解成功;监控任务不仅需要找到证据,还需要理解决策含义与带来的后果。

5.3 不同输入规模下性能表现

把样本按照输入token分为Low/Medium/High三档。

  • Base基线:随着输入token增大,规则指标普遍下降;长上下文下证据容易被海量无关信息淹没。
  • EBG:在低、中、高全部输入规模下,相比基线均获得正向增益;高token规模下依然保持可观提升:
    • SpecGAP LF1提升+0.078;
    • SilentSwap LS提升+0.115;
    • FeedbackTrace EHR提升+0.108。

说明EBG的证据组织能力在超长上下文场景收益尤其突出。

5.4 集成至Codex Harness真实用例

将EBG集成到Codex Harness,实现三类复核钩子:

  1. 歧义复核:检查计划、用户提示中缺失、会显著影响执行效果的选择;
  2. 调整复核:检查执行策略变更,判断是否需要用户确认、对外披露;
  3. 结果复核:检查证据是否可以支撑最终输出结论。

5个取自真实科研自动化工作流的案例全部生效:原生Codex Harness不会主动披露关键问题;接入EBG之后成功识别并向用户披露待复核决策。

案例任务场景监控器行为与结果
优化目标歧义指标包含准确率、召回率,计划未写明优化优先级检查计划,识别缺失优先级,向用户提问,用户选定准确率优先
随机协议变更失败后串行回退,改变每个问题的随机种子在回退代码发现随机逻辑变更,向用户披露,恢复每个问题独立种子
验证集数据泄露验证样本混入训练集,造成虚假指标提升追踪样本来源,识别泄露,保留基线方案
API连通性未验证复用缓存返回,没有执行真实API调用发现记录仅为缓存结果,披露API连通性没有得到真实验证
搜索预算不对等搜索预算不一致,候选模型得分高于基线识别搜索记录预算差异,披露得分提升不能完全归功优化器本身

6 结论

长视界智能体的监督任务,要求把重大决策和可供人工复核的支撑证据建立关联。本文提出AgentMonBench软件工程监督评测基准,包含SpecGAP、SilentSwap、FeedbackTrace三个子集,分别评测需求‑行为对齐、重大自主决策识别复核两大监督能力。
EBG证据驱动行为图,无需训练,将分散的溯源证据组织为行为单元、构建显式关系图,输出面向任务的证据视图。实验表明现有大模型在智能体监控任务仍存在明显短板;EBG在绝大多数设置下提升决策识别与证据定位性能,增益在大输入上下文下稳定;真实科研任务用例验证该方案的工程价值。

附录简要说明

  • 附录A:拓展相关工作,与其它基准详细对比表。
  • 附录B:AgentMonBench数据集完整统计、三套子集详细构建流程、人工评审协议。
  • 附录C:完整评测协议、指标定义、裁判Prompt、基线配置。
  • 附录D:EBG图构建算法伪代码、视图渲染规则、实验超参数、预测输出Schema。
  • 附录E:消融实验、输入规模细分结果、假阳性/漏检分析。
  • 附录F:Codex Harness集成完整实现、5个真实案例完整记录。
  • 附录G:失败样例归因分析、未来研究方向。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询