UltraData-RL-2609 Math数据集入门:3.2万道竞赛级数学题与答案匹配验证机制
【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609
正在为数学强化学习挑选训练数据?UltraData-RL-2609 Math数据集是 OpenBMB 开源的可验证奖励(Verifiable Reward)强化学习数据,Math 切片收录32,412 道竞赛级数学题——每题都有唯一参考答案,模型输出与答案做答案匹配即可自动判定对错,是 RLVR(可验证奖励 RL)后训练的"即插即用"语料。
🧭 先认识 UltraData-RL-2609 是什么
UltraData-RL-2609 是 UltraData 平台 L0-L4 分级数据框架中的L3 精炼数据,专为 MiniCPM5-2B 等端侧模型的后训练 RL 阶段构建。整个数据集共85,995 条样本,覆盖四个方向:
| 方向 | 样本数 | 占比 | 结果如何验证 |
|---|---|---|---|
| Math📐 | 32,412 | 37.7% | 与ground_truth做答案匹配 |
| Code | 23,665 | 27.5% | 沙箱执行测试用例 |
| Long-Context | 18,046 | 21.0% | 答案匹配 + 上下文支撑校验 |
| Knowledge | 11,872 | 13.8% | 答案匹配 |
| 合计 | 85,995 | 100% |
其中Math 是占比最大、验证方式最纯粹的切片:答案唯一、机器可判定,奖励信号零人工成本。这也是本文聚焦它的原因。
📦 Math 数据集文件结构:4 个分片共 3.2 万题
Math 切片存放在 data/Math/ 目录,按 JSONL 分片存储,每行一条题目:
| 文件 | 样本数 |
|---|---|
| Math_part-1-of-4.jsonl | 10,000 |
| Math_part-2-of-4.jsonl | 10,000 |
| Math_part-3-of-4.jsonl | 10,000 |
| Math_part-4-of-4.jsonl | 2,412 |
| 合计 | 32,412 |
题目从哪里来?Math 切片由 DAPO-Math-17k、DeepScaleR 和 DeepMath-103K 三个公开可验证数学 RL 数据集取并集,再统一改写为简答题形式。选择题、判断题、证明题、多问题和依赖图片的题目已在构建流水线中全部剔除——留下来的都是"算出一个答案"的题。
题面难度分布很广:从"13 支铅笔 3 块橡皮 1 美元"的小学生应用题,到代数数域的 Galois 扩张、线性代数向量空间维数等竞赛与研究生水平题目。
🧾 样本格式:统一的五字段 JSONL 结构
每条样本包含 5 个字段,直接看一条真实样例(来自 data/Math/Math_part-1-of-4.jsonl 第一行):
{ "uuid": "Math_00001", "query": "Oscar buys 13 pencils and 3 erasers for $1.00. …\nPlease reason step by step, and put your final answer within \boxed{}.", "ground_truth": "10", "source": "UltraData-RL-2609", "domain": "Math" }| 字段 | 说明 |
|---|---|
uuid | 全局唯一 ID,格式为Math_序号 |
query | 完整题面,末尾统一追加"把最终答案放入\boxed{}"的指令 |
ground_truth | 参考答案(字符串) |
source | 数据来源 |
domain | 固定为Math |
💡 两个值得注意的设计:
\boxed{}统一答案抽取约定:所有题面都要求模型把最终答案放进\boxed{},训练时只需正则抽取该表达式,再与ground_truth比对即可得到 0/1 奖励,无需 LLM 判分。- 答案形式已被标准化:数值(
10)、代数式(4\sqrt{5})、分数(\dfrac{2}{5})、区间([0,1])、特值(Yes/No)等,均可自动匹配。
⚙️ 核心机制:答案匹配如何判定奖励
Math 切片的"奖励可信"来自构建流水线(详见 README_ZH.md 的六阶段流程)中的三道关卡:
第 1 关 · 可验证性过滤—— 只保留答案唯一、可自动校验的题。答案不唯一或无法机器抽取的样本直接出局。
第 2 关 · 多模型共识校验—— 由多个独立模型重新求解每道题,按共识确认参考答案;没有共识的题直接丢弃,绝不猜测。同时 LLM Judge 会审核"题目—答案"的一致性,剔除题答不符的脏数据。
第 3 关 · 难度校准(不碰标签)—— 在 RL 初始化 checkpoint 上对每题多次 rollout,估算经验通过率,然后按通过率分流:
| 通过率 | 处理策略 | 原因 |
|---|---|---|
| = 1(全对) | ❌ 移除 | 已完全掌握,无梯度信号 |
| 0 < p < 1(可学习区间) | ✅ 保留 | 最有学习价值 |
| = 0 且标签已确认合法 | ✅ 保留 | 交给在线动态采样调控频率 |
⚠️ 关键原则:难度筛选只改采样权重,从不修改参考答案标签——保证了奖励信号可追溯。
🚀 新手快速开始:3 行代码加载 Math 数据
使用 Hugging Facedatasets库,config 名固定为Math:
from datasets import load_dataset ds = load_dataset("openbmb/UltraData-RL-2609", "Math", split="train") print(ds[0]["query"][:300]) # 查看题面 print(ds[0]["ground_truth"]) # 查看参考答案加载后即可按uuid定位任意样本、按\boxed{}抽取模型答案做匹配验证。若需本地克隆数据,仓库地址:https://gitcode.com/OpenBMB/UltraData-RL-2609。
📈 为什么 Math 切片值得用:真实提升效果
数学题是 RLVR 最"干净"的奖励来源——对错判定不依赖主观评分,训练信号稳定。实际效果上,以 UltraData-RL-2609 为训练集的JustRL II实验中:
- 📊AIME 2025 得分在约 300 步 RL 内从 61 提升到 81
- 🏆 最终基于该数据完成训练的 MiniCPM5-2B 在 AIME 2025 达到86
⚠️ 使用注意与许可
- 许可:项目按 Apache 2.0 发布,但上游数据集的 MIT / CC BY / CC BY-SA 条款对派生内容继续适用;禁止未经书面授权的原样转载或商业化再打包。
- 静态标签:构建时的难度过滤与在线采样权重不作为字段发布,只保留最终入选样本。
- 去污范围:仅覆盖构建时已知的公开评测集;引入新基准前建议自行去污检测。
总结:UltraData-RL-2609 的 Math 切片 = 3.2 万道答案唯一的竞赛级数学题 +\boxed{}统一抽取 + 多模型共识背书的标签 + 难度校准。对想做数学 RLVR 后训练的新手来说,这是一份开箱即用、奖励机制透明的完整语料。
【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考