【导语:近日,腾讯混元团队联合中国人民大学高瓴人工智能学院等机构推出并开源了PlanningBench,这是一个面向大语言模型规划能力评测与训练的可扩展、可验证数据生成框架,将对大模型规划能力发展产生重要影响。】
腾讯混元团队联合相关机构推出并开源的PlanningBench,从真实规划场景出发,系统抽象任务、约束与难度因素,构建了覆盖30 + 规划任务类型的数据生成与验证体系。它既能评测模型是否真的“会规划”,也能为规划能力训练提供稳定、可迁移的奖励信号。
PlanningBench形成了一整套能力闭环,具有多方面显著特性。在场景覆盖上,它从真实规划场景出发,覆盖日程排布、资源分配等六大类任务,包含30 + 具体规划任务类型,避免模型只在单一领域“刷题”。
在约束体系方面,将规划难度拆解为任务结构、约束层级等多种因素,使数据生成能围绕真实难点进行控制。同时,每条实例都配套checklist,可用于评估模型输出是否满足多种条件,也可为强化学习提供奖励信号。
它还能区分局部合规与全局成功,关注Avg - pass和All - pass,能识别“看似大部分正确但整体不可执行”的计划,适合诊断大模型在复杂约束下的真实规划能力。并且基于其可验证数据进行训练,能提升模型在未见过规划基准和通用指令跟随任务上的表现。
PlanningBench的核心是一个约束驱动的闭环合成流程。这一流程为其数据生成与验证体系提供了关键支撑,确保整个框架能够高效、准确地运行,从而更好地实现对大模型规划能力的评测与训练。
编辑观点:PlanningBench的开源为大语言模型规划能力的评测与训练提供了新的有效工具,其全面的能力闭环和核心流程有望推动大模型在规划领域的发展,提升大模型的规划能力和应用效果。