☰
LongCat AMO-Bench 实测:用 TaoToken 统一 Key 跑通 LLM 数学上限评测配置
2026/9/25 18:08:22 网站建设 项目流程

1. 为什么 AIME 刷到 90 分之后,评测反而没意义了

如果你最近在跑数学推理评测,大概率会遇到一个尴尬局面:AIME24/25 上头部模型的正确率已经摸到 90% 以上,几个模型分数挤在一起,谁强谁弱根本分不出来。更麻烦的是,AIME、HMMT 这些题库早就公开了,模型有没有在训练阶段"见过"这些题,你没法证伪。评测分数看着漂亮,但作为技术选型依据,参考价值在快速缩水。

LongCat 团队发布的 AMO-Bench 就是冲着这个饱和困境来的。它包含 50 道竞赛专家原创题,难度对标甚至超过 IMO,官方给出的 SOTA 成绩只有 52.4%,绝大多数模型正确率低于 40%。换句话说,这套基准重新把区分度拉开了。对开发者来说,问题从"要不要测"变成了"怎么在本地把评测流程跑通"。

这篇就聚焦一件事:用 TaoToken 的统一 Key 和 API 通道,在本地把 AMO-Bench 的评测配置搭起来,包括 settings.json / config.toml 骨架、CC Switch 和 Cline 的接入片段,最后用一道 AIME 样例验证请求链路是否真的通了。适合已经在做 LLM 评测、想换一套更高难度基准的开发者,也适合刚接触数学推理评测、想先跑通一条最小链路的人。

2. TaoToken 在评测链路里扮演什么角色

做数学评测最烦的不是写评测脚本,而是模型接入层。AMO-Bench 官方实验覆盖了 26 个模型,闭源开源都有,如果你每个模型都单独申请 Key、单独维护一套 SDK 调用,光配置就能耗掉半天。TaoToken 在这里的价值是提供一个统一的 API 通道:一个 Key 走多家模型,接口格式兼容主流协议,评测脚本不用为每个模型改一遍调用逻辑。

具体到 AMO-Bench 场景,你需要的能力有三块:一是能稳定发起长输出请求(AMO-Bench 高难度题的平均输出 token 超过 35K,短超时配置会直接截断);二是能切换不同模型做横向对比;三是能拿到结构化的返回,方便后续用 Math-Verify 做答案等价性校验。TaoToken 的 API 端点https://taotoken.net/api兼容 OpenAI 风格调用,评测脚本里改 base_url 和 model 字段就能切换,这是最省事的地方。

先拿到 Key。访问 API Keys 管理页创建:https://taotoken.net/console/api-keys?utm_source=taotoken_aicg_blog_end&utm_content=api_keys&utm_campaign=rewrite

创建后复制保存,后面所有配置都围绕这个 Key 展开。如果你还没决定用哪个模型跑评测,可以先去模型对话页面试几道题,感受一下不同模型在长推理上的表现差异:https://taotoken.net/models?utm_source=taotoken_aicg_blog_end&utm_content=model_chat&utm_campaign=rewrite

3. 可复制的评测配置骨架

这一节给三份配置:一份通用 settings.json,一份 config.toml,再加 CC Switch 和 Cline 的接入片段。你可以按自己用的工具挑。

3.1 settings.json 骨架

这份配置适合直接喂给基于 OpenAI SDK 的评测脚本。关键点是max_tokens要给足,AMO-Bench 的题需要长逻辑链,给 8K 会大量截断。

{ "provider": "taotoken", "base_url": "https://taotoken.net/api", "api_key": "sk-你的TaoToken密钥", "model": "gpt-5-thinking", "max_tokens": 65536, "temperature": 0.0, "timeout": 600, "retry": { "max_attempts": 3, "backoff_seconds": 5 }, "eval": { "benchmark": "AMO-Bench", "answer_format": "boxed", "verify_tool": "math-verify", "samples_per_question": 32 } }

temperature设 0 是为了评测可复现,samples_per_question对应官方 AVG@32 的采样策略。timeout给到 600 秒,因为高难度题单次推理可能跑几分钟。

3.2 config.toml 骨架

如果你用的是 Rust 或 Python 的 toml 配置体系,这份可以直接用:

[provider.taotoken] base_url = "https://taotoken.net/api" api_key = "sk-你的TaoToken密钥" default_model = "deepseek-v3.1-thinking" [request] max_tokens = 65536 temperature = 0.0 timeout_seconds = 600 [request.retry] max_attempts = 3 backoff_seconds = 5 [benchmark.amo_bench] dataset_path = "./data/amo-bench" answer_format = "boxed" verify_tool = "math-verify" num_samples = 32 concurrency = 4

concurrency别开太高,长输出请求并发多了容易触发限流,4 到 8 之间比较稳。

3.3 CC Switch 配置片段

CC Switch 用来在多个模型配置间快速切换,做横向评测时很顺手。在它的配置里加一段:

{ "name": "TaoToken-AMO", "base_url": "https://taotoken.net/api", "api_key": "sk-你的TaoToken密钥", "models": [ "gpt-5-thinking", "deepseek-v3.1-thinking", "qwen3-235b-a22b-thinking" ], "default_model": "gpt-5-thinking" }

切换模型时只改default_model,评测脚本不用动。

3.4 Cline 接入片段

Cline 里配置自定义 API 提供商,填这几个字段:

{ "apiProvider": "openai-compatible", "baseUrl": "https://taotoken.net/api", "apiKey": "sk-你的TaoToken密钥", "modelId": "deepseek-v3.1-thinking", "maxTokens": 65536 }

Cline 适合边跑评测边看推理过程,调试 prompt 格式时比纯脚本直观。

4. 跑通一道 AIME 样例并校验结果

配置搭好后,先用一道题验证链路。下面这段 Python 脚本发一道 AIME 风格的题,要求模型按\boxed{}格式输出答案,然后用 math-verify 校验。

import os from openai import OpenAI from math_verify import parse, verify client = OpenAI( base_url="https://taotoken.net/api", api_key=os.environ["TAOTOKEN_API_KEY"], ) prompt = """Solve the following problem. Put your final answer in \\boxed{}. Find the number of positive integers n such that n^2 + 3n + 2 is divisible by 7. Show your reasoning step by step.""" resp = client.chat.completions.create( model="deepseek-v3.1-thinking", messages=[{"role": "user", "content": prompt}], max_tokens=65536, temperature=0.0, ) output = resp.choices[0].message.content print("模型输出长度:", len(output)) gold = "\\boxed{5}" parsed_model = parse(output) parsed_gold = parse(gold) print("校验结果:", verify(parsed_gold, parsed_model))

跑之前先导出 Key:

export TAOTOKEN_API_KEY="sk-你的TaoToken密钥"

预期结果:脚本打印出模型输出长度(高难度题通常在几千到几万字符),最后一行校验结果: True表示答案等价性校验通过。如果输出被截断,检查max_tokens是否给够;如果校验报错,先看模型有没有按\boxed{}格式输出,格式不对 math-verify 解析会失败。

这一步跑通,说明从 Key 到 API 通道到评测校验的整条链路是通的,接下来把题目换成 AMO-Bench 数据集批量跑就行。

5. 本篇常见错排查

报错 401 Unauthorized:Key 没读到或复制时带了空格。检查环境变量TAOTOKEN_API_KEY是否导出成功,echo $TAOTOKEN_API_KEY看一眼。Key 管理页在 https://taotoken.net/console/api-keys?utm_source=taotoken_aicg_blog_end&utm_content=api_keys&utm_campaign=rewrite

输出被截断,答案不完整:max_tokens给小了。AMO-Bench 高难度题平均输出超 35K token,建议直接给 65536。同时确认timeout不低于 300 秒。

math-verify 校验一直 False:先打印模型原始输出,看有没有\boxed{}。有些模型会输出\boxed{5}之外的格式,比如答案:5,这种情况要么在 prompt 里强调格式,要么在解析前做一次正则提取。

并发跑批量评测时大量超时:concurrency调低到 2 到 4,长输出请求对并发很敏感。另外确认 retry 配置生效,偶发超时能自动重试。

切换模型后结果异常:检查 CC Switch 或 Cline 里的modelId是否和 TaoToken 支持的模型名一致,拼写错误会直接报模型不存在。模型列表可以在模型对话页确认。

评测脚本报连接错误:确认 base_url 是https://taotoken.net/api,不要多加路径后缀。接入文档里有完整的端点说明:https://taotoken.net/doc?utm_source=taotoken_aicg_blog_end&utm_content=doc&utm_campaign=rewrite

6. 长期跑评测和 Agent 编码的配置建议

如果你不只是跑一次 AMO-Bench,而是要把数学评测做成持续跟踪的流程,或者顺手用同一套 Key 做 Agent 编码任务,可以考虑 Coding Plan。它适合长期、高频的调用场景,省去每次单独配 Key 的麻烦:https://taotoken.net/coding-plan?utm_source=taotoken_aicg_blog_end&utm_content=coding_plan&utm_campaign=rewrite

实际跑下来,AMO-Bench 的评测成本主要在输出 token 上,一道题动辄几万 token,批量跑 50 题乘以 32 次采样,量不小。建议先用samples_per_question=1跑一轮冒烟测试,确认链路和格式都对,再放开到 32 次采样。另外把模型原始输出落盘保存,math-verify 校验失败时能回溯,比重新跑一遍省事得多。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询