☰
UltraData-RL-2609 Math数据集入门:3.2万道竞赛级数学题与答案匹配验证机制
2026/9/25 14:54:42 网站建设 项目流程

UltraData-RL-2609 Math数据集入门:3.2万道竞赛级数学题与答案匹配验证机制

【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609

正在为数学强化学习挑选训练数据?UltraData-RL-2609 Math数据集是 OpenBMB 开源的可验证奖励(Verifiable Reward)强化学习数据,Math 切片收录32,412 道竞赛级数学题——每题都有唯一参考答案,模型输出与答案做答案匹配即可自动判定对错,是 RLVR(可验证奖励 RL)后训练的"即插即用"语料。

🧭 先认识 UltraData-RL-2609 是什么

UltraData-RL-2609 是 UltraData 平台 L0-L4 分级数据框架中的L3 精炼数据,专为 MiniCPM5-2B 等端侧模型的后训练 RL 阶段构建。整个数据集共85,995 条样本,覆盖四个方向:

方向样本数占比结果如何验证
Math📐32,41237.7%与ground_truth做答案匹配
Code23,66527.5%沙箱执行测试用例
Long-Context18,04621.0%答案匹配 + 上下文支撑校验
Knowledge11,87213.8%答案匹配
合计85,995100%

其中Math 是占比最大、验证方式最纯粹的切片:答案唯一、机器可判定,奖励信号零人工成本。这也是本文聚焦它的原因。

📦 Math 数据集文件结构:4 个分片共 3.2 万题

Math 切片存放在 data/Math/ 目录,按 JSONL 分片存储,每行一条题目:

文件样本数
Math_part-1-of-4.jsonl10,000
Math_part-2-of-4.jsonl10,000
Math_part-3-of-4.jsonl10,000
Math_part-4-of-4.jsonl2,412
合计32,412

题目从哪里来?Math 切片由 DAPO-Math-17k、DeepScaleR 和 DeepMath-103K 三个公开可验证数学 RL 数据集取并集,再统一改写为简答题形式。选择题、判断题、证明题、多问题和依赖图片的题目已在构建流水线中全部剔除——留下来的都是"算出一个答案"的题。

题面难度分布很广:从"13 支铅笔 3 块橡皮 1 美元"的小学生应用题,到代数数域的 Galois 扩张、线性代数向量空间维数等竞赛与研究生水平题目。

🧾 样本格式:统一的五字段 JSONL 结构

每条样本包含 5 个字段,直接看一条真实样例(来自 data/Math/Math_part-1-of-4.jsonl 第一行):

{ "uuid": "Math_00001", "query": "Oscar buys 13 pencils and 3 erasers for $1.00. …\nPlease reason step by step, and put your final answer within \boxed{}.", "ground_truth": "10", "source": "UltraData-RL-2609", "domain": "Math" }
字段说明
uuid全局唯一 ID,格式为Math_序号
query完整题面,末尾统一追加"把最终答案放入\boxed{}"的指令
ground_truth参考答案(字符串)
source数据来源
domain固定为Math

💡 两个值得注意的设计:

  1. \boxed{}统一答案抽取约定:所有题面都要求模型把最终答案放进\boxed{},训练时只需正则抽取该表达式,再与ground_truth比对即可得到 0/1 奖励,无需 LLM 判分。
  2. 答案形式已被标准化:数值(10)、代数式(4\sqrt{5})、分数(\dfrac{2}{5})、区间([0,1])、特值(Yes/No)等,均可自动匹配。

⚙️ 核心机制:答案匹配如何判定奖励

Math 切片的"奖励可信"来自构建流水线(详见 README_ZH.md 的六阶段流程)中的三道关卡:

第 1 关 · 可验证性过滤—— 只保留答案唯一、可自动校验的题。答案不唯一或无法机器抽取的样本直接出局。

第 2 关 · 多模型共识校验—— 由多个独立模型重新求解每道题,按共识确认参考答案;没有共识的题直接丢弃,绝不猜测。同时 LLM Judge 会审核"题目—答案"的一致性,剔除题答不符的脏数据。

第 3 关 · 难度校准(不碰标签)—— 在 RL 初始化 checkpoint 上对每题多次 rollout,估算经验通过率,然后按通过率分流:

通过率处理策略原因
= 1(全对)❌ 移除已完全掌握,无梯度信号
0 < p < 1(可学习区间)✅ 保留最有学习价值
= 0 且标签已确认合法✅ 保留交给在线动态采样调控频率

⚠️ 关键原则:难度筛选只改采样权重,从不修改参考答案标签——保证了奖励信号可追溯。

🚀 新手快速开始:3 行代码加载 Math 数据

使用 Hugging Facedatasets库,config 名固定为Math:

from datasets import load_dataset ds = load_dataset("openbmb/UltraData-RL-2609", "Math", split="train") print(ds[0]["query"][:300]) # 查看题面 print(ds[0]["ground_truth"]) # 查看参考答案

加载后即可按uuid定位任意样本、按\boxed{}抽取模型答案做匹配验证。若需本地克隆数据,仓库地址:https://gitcode.com/OpenBMB/UltraData-RL-2609。

📈 为什么 Math 切片值得用:真实提升效果

数学题是 RLVR 最"干净"的奖励来源——对错判定不依赖主观评分,训练信号稳定。实际效果上,以 UltraData-RL-2609 为训练集的JustRL II实验中:

  • 📊AIME 2025 得分在约 300 步 RL 内从 61 提升到 81
  • 🏆 最终基于该数据完成训练的 MiniCPM5-2B 在 AIME 2025 达到86

⚠️ 使用注意与许可

  • 许可:项目按 Apache 2.0 发布,但上游数据集的 MIT / CC BY / CC BY-SA 条款对派生内容继续适用;禁止未经书面授权的原样转载或商业化再打包。
  • 静态标签:构建时的难度过滤与在线采样权重不作为字段发布,只保留最终入选样本。
  • 去污范围:仅覆盖构建时已知的公开评测集;引入新基准前建议自行去污检测。

总结:UltraData-RL-2609 的 Math 切片 = 3.2 万道答案唯一的竞赛级数学题 +\boxed{}统一抽取 + 多模型共识背书的标签 + 难度校准。对想做数学 RLVR 后训练的新手来说,这是一份开箱即用、奖励机制透明的完整语料。

【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询