面试-在Math、LiveCodeBench、IFBench上的评测
2026/9/12 20:45:52 网站建设 项目流程

project-3:Faker-1-0.5B / MiniCPM5-2B 在 MATH-500 / LiveCodeBench v6 / IFBench 上的官方口径评测

对象:Faker-1-0.5B(基座,Qwen2.5-0.5B 全参数复刻)+ MiniCPM5-2B(chat)。
所有 prompt 与判分逻辑均为官方仓库逐行移植(硬编码),无自创口径;全部为确定性规则判分,不需要大模型 judge。

统一口径(6 个脚本逐项核对一致)

口径依据
解码greedy(do_sample=False,等价官方温度 0)IFBench 官方 README:生成用温度 0
加载faker=fp16 基座直接续写;minicpm=bf16 + chat template +enable_thinking=False+ 过滤token_type_idsdemo-1 已验证路径;官方对思考模型即"多生成后剥离思考链",关链等价且为本机稳定路径
生成长度max_new_tokens=1024(IFBench / MATH-500)、2000(LCB,官方--max_tokens默认值)官方默认
停止符LCB=###(官方--stop默认);MATH-500 faker=Problem:(官方 minerva until);其余自然 EOS官方默认;另在文本层再截一次(官方 vllm stop 语义:输出不含停止符)
批量batch=1 单流为基准口径;3 个支持--batch_size N(左 padding、pad=eos、greedy 不变,结果 json 记录 batch_size)PPU 批量路径历史不稳,batch=1 保底可回退
断点续跑生成逐条落盘results/gen/*.jsonl,重跑只补缺;生成完毕则跳过模型加载、纯 CPU 判分
判分全部确定性规则(程序验证器 / 正则+sympy / 沙箱执行),无 LLM judge

一、IFBench 评估方法(300 题,指令遵循)

官方来源:allenai/IFBench 仓库(commit 1c40f0c1)的ifbench/验证器包 +evaluation_lib.py;数据 allenai/IFBench_test。

1. 数据与 prompt

  • 每条样本 ={prompt, instruction_id_list, kwargs}:prompt 是 WildChat 改写出的完整指令(约束文字已嵌在 prompt 里),instruction_id_list是该 prompt 附带的 1~3 个可验证约束 id(如keywords:existencecount:word_count_range),kwargs是各约束的参数(如{"keywords": ["cat","dog"]})。
  • prompt 原样输入:faker 直接续写;minicpm 作为单条 user 消息(官方 generate_responses 的 chat 用法)。共 300 条,25 类经典 IFEval 约束 + 58 类 OOD 约束。

2. 判分流程(逐条 prompt)

对每条 prompt: 对其每个约束 (instruction_id, kwargs): 1. checker = INSTRUCTION_DICT[instruction_id](instruction_id) # 83 个官方验证器类 2. checker.build_description(**kwargs) # 注入参数; parquet 空位为 null, 先过滤

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询