EEMD-LSTM时间序列预测实战:从IMF分解到TensorFlow建模
2026/9/12 22:01:52
对象:Faker-1-0.5B(基座,Qwen2.5-0.5B 全参数复刻)+ MiniCPM5-2B(chat)。
所有 prompt 与判分逻辑均为官方仓库逐行移植(硬编码),无自创口径;全部为确定性规则判分,不需要大模型 judge。
| 项 | 口径 | 依据 |
|---|---|---|
| 解码 | greedy(do_sample=False,等价官方温度 0) | IFBench 官方 README:生成用温度 0 |
| 加载 | faker=fp16 基座直接续写;minicpm=bf16 + chat template +enable_thinking=False+ 过滤token_type_ids | demo-1 已验证路径;官方对思考模型即"多生成后剥离思考链",关链等价且为本机稳定路径 |
| 生成长度 | max_new_tokens=1024(IFBench / MATH-500)、2000(LCB,官方--max_tokens默认值) | 官方默认 |
| 停止符 | LCB=###(官方--stop默认);MATH-500 faker=Problem:(官方 minerva until);其余自然 EOS | 官方默认;另在文本层再截一次(官方 vllm stop 语义:输出不含停止符) |
| 批量 | batch=1 单流为基准口径;3 个支持--batch_size N(左 padding、pad=eos、greedy 不变,结果 json 记录 batch_size) | PPU 批量路径历史不稳,batch=1 保底可回退 |
| 断点续跑 | 生成逐条落盘results/gen/*.jsonl,重跑只补缺;生成完毕则跳过模型加载、纯 CPU 判分 | — |
| 判分 | 全部确定性规则(程序验证器 / 正则+sympy / 沙箱执行),无 LLM judge | — |
官方来源:allenai/IFBench 仓库(commit 1c40f0c1)的ifbench/验证器包 +evaluation_lib.py;数据 allenai/IFBench_test。
{prompt, instruction_id_list, kwargs}:prompt 是 WildChat 改写出的完整指令(约束文字已嵌在 prompt 里),instruction_id_list是该 prompt 附带的 1~3 个可验证约束 id(如keywords:existence、count:word_count_range),kwargs是各约束的参数(如{"keywords": ["cat","dog"]})。对每条 prompt: 对其每个约束 (instruction_id, kwargs): 1. checker = INSTRUCTION_DICT[instruction_id](instruction_id) # 83 个官方验证器类 2. checker.build_description(**kwargs) # 注入参数; parquet 空位为 null, 先过滤