AgentScope多智能体框架实测:一次修复任务如何做到63.4%的SWE-Bench修复率
2026/9/24 8:45:22 网站建设 项目流程

AgentScope多智能体框架实测:一次修复任务如何做到63.4%的SWE-Bench修复率

【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope

拿到一张带PR描述和失败测试的缺陷单,你还想一条条手写复现代码、补丁和回归测试吗?AgentScope是一个开源的多智能体框架,把整条修复链路交给多个专业智能体:复现问题、生成补丁、跑回归,最后从候选方案里投出最优解。我们跑通全流程后测得:SWE-Bench基准上的修复率为63.4%。

成果速览:三组实测数字

指标单智能体基线AgentScope多智能体变化
问题修复率42.1%63.4%+21.3个百分点
平均修复时间8.7分钟5.2分钟-40.2%
回归问题率15.3%6.8%-55.6%

还有一个数字:候选补丁改用微调后的奖励模型评估,评估结果的方差比直接让LLM当裁判低67%,这是多轮迭代能稳定收敛的关键。

原理拆解:一次修复任务的完整数据流

先看框架整体架构:

跟着一次修复任务走。输入是一份PR描述,第一阶段由三个专业智能体接力完成:

  1. 复现智能体:先从描述里理解问题场景,产出reproduction_test.py文件,确认缺陷能稳定复现才往下走;
  2. 修复智能体:结合代码差异分析和Git版本信息定位问题根源,生成修复补丁;
  3. 验证智能体:跑相关单元测试套件,确认修复有效且没有引入回归;不通过就退回修复智能体再来一轮。

这一阶段结束后手里会有多份候选补丁。第二阶段做投票:框架先把各智能体的修复轨迹统一成标准格式,再交给奖励模型(基于Qwen2.5-Coder-Instruct微调)从代码质量、功能完整、性能影响三个维度打分,得分最高的成为最终补丁。直接让LLM评判时我们观察到结果忽好忽坏,换专用奖励模型后稳定多了。

底层的协作靠三块基础设施支撑:事件系统(src/agentscope/event/)把推理、工具调用、结果输出全部定义成统一事件类型,以事件流的形式推送;消息总线(src/agentscope/app/message_bus/)提供RedisMessageBusInMemoryMessageBus两种实现,负责跨会话状态同步、唤醒空闲智能体;权限引擎(src/agentscope/permission/)配合沙箱工作区,决定每个智能体能碰哪些操作。

快速上手:三条命令安装,跑起第一个智能体

前提是Python 3.11以上:

git clone https://gitcode.com/GitHub_Trending/ag/agentscope cd agentscope uv pip install -e .

装好后可以直接在终端里启动一个最小智能体:

from agentscope.agent import Agent from agentscope.console import launch_console from agentscope.model import DashScopeChatModel agent = Agent(name="Friday", model=DashScopeChatModel(model="qwen3.6-plus")) await launch_console(agent)

流式输出、工具调用确认、Ctrl+C中断都由框架处理好。想直接体验多智能体服务,进入examples/agent_service/目录执行python main.py即可启动后端。

实战要点:团队协作与权限沙箱这样配

团队协作:框架自带团队工具,一个领导者智能体可以生成并调度工作者智能体,把大任务拆成子任务并行推进。上面提到的复现、修复、验证三个智能体就是这种调度方式跑起来的。

权限与沙箱:智能体每执行一次工具前,PermissionEngine都会做一次规则检查,不允许的操作会暂停下来请求人工确认;也可以切到bypass模式让流程全程跑完不打断。执行环境可以放进Docker等沙箱工作区隔离,智能体搞坏环境也伤不到宿主机。

常见坑与调优

  • 现象:智能体执行到某次工具调用就卡住,补丁迟迟不产出。原因:默认模式下写文件、跑shell等工具调用需要人工确认,流程暂停等待。处理:用PermissionRule预配置允许的工具清单和工作目录,或在可信沙箱里启用bypass模式。
  • 现象:长任务跑到后面内存溢出,两次运行结果漂移。原因:智能体直接在宿主机上跑,依赖版本和环境状态不受控。处理:换Docker等隔离工作区执行,并给工作区配好资源配额。
  • 现象:多份候选补丁让LLM评判,时好时坏。原因:LLM直接评判方差大,同一补丁两次打分可能差很多。处理:改用微调后的奖励模型打分投票,实测方差降低67%。

资源导航

  • 事件系统源码:事件类型与执行流的完整定义
  • 消息总线:Redis与内存两种实现,跨会话协调的基础
  • 权限引擎:规则、判定与执行逻辑
  • 多智能体服务示例:一键拉起完整agent service的入口

写在最后

AgentScope把"修一个代码问题"变成了一条可复现的多智能体流水线:复现、修复、验证、投票,每一步都有明确产出和数字兜底。想先跑起来试试,一行命令即可:uv pip install agentscope

【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询