Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models
Abstract:论文整体想表达什么?
这篇论文研究的是一个问题:
前沿大语言模型到底是如何进行推理的?
很多闭源模型在“思考”过程中会生成隐藏的 Chain-of-Thought(CoT,思维链),但用户通常只能看到最终答案,看不到完整推理过程。因此,我们知道模型能不能答对,却不知道它是如何得到答案的,也无法判断正确答案背后的推理是否可靠。
1. 论文提出了什么方法?
作者设计了一个叫FORCED-REASONING的工具调用协议。
简单来说:
- 给模型注册一个专门用于记录推理的工具;
- 强制模型先调用这个工具;
- 工具接收一个字符串参数,用来保存模型的中间推理;
- 每次工具调用后,返回固定确认信息;
- 模型可以继续调用工具,也可以给出最终答案。
这个工具本身不执行任何计算,作用只是:
把原本隐藏在模型内部或特殊思考通道中的中间推理,转移到可观察的工具参数中。
2. 为什么不能直接相信提取出的推理?
作者也意识到一个重要问题:
模型外显出来的推理,可能只是事后编出来的合理解释,而不一定是模型真正产生答案时使用的过程。
因此,论文先在开放模型上进行验证。
开放模型的原生 CoT 是可见的,作者可以比较:
- 模型正常生成的原生 CoT;
- 通过工具协议提取出来的推理。
结果显示,提取出的推理:
- 任务表现接近原生推理;
- 明显优于不使用推理的基线;
- 在词汇和结构上与原生 CoT 具有相似性。
在此基础上,作者才把这种方法应用到闭源前沿模型上,把提取到的推理作为原生隐藏推理的行为代理。
3. 论文比较了哪些模型能力?
作者在多个任务上比较模型,包括:
- 竞赛数学;
- 科学问题;
- 代码生成。
论文关注的不只是最终准确率,还分析了模型如何组织推理,包括:
- 使用了多少 token;
- 推理步骤属于什么类型;
- 是否会反复尝试;
- 推理路径是否直接;
- 推理过程中是否存在大量分支;
- 早期是否能选中正确方向。
4. 关于 GPT-6 Astra 的主要发现
论文认为,GPT-6 Astra 的特点是:
- 推理轨迹更短;
- 文本更难被压缩,说明信息密度更高;
- 更早选择正确的解题方向;
- 推理路径更直接;
- 分支和试错更少;
- 会把基础计算和简单步骤留在内部,只外显关键推理。
因此,Astra 的推理并不是缺少分析、计划、执行和验证等行为,而是:
用更少的外显步骤覆盖了相似的推理功能。
作者将这种现象称为一种更加“简洁、密集、定向”的推理方式。
5. 推理轨迹能否被其他模型使用?
论文还测试了一个模型产生的推理轨迹,能否作为另一个模型的输入。
结果表明:
- 能力较强的模型通常可以较好利用简洁的推理轨迹;
- 能力较弱的模型可能无法理解其中省略的中间步骤;
- 即使正确答案已经明确写在推理中,较弱模型也可能最终答错。
这说明推理轨迹的价值取决于“阅读它的模型”:
一段简短推理对强模型可能足够清楚,但对弱模型可能过于压缩。
6. 论文的三个主要贡献
作者总结了三个贡献:
- 发现高效推理通常更简洁、密集且方向明确,模型之间的差异主要在于外显多少中间步骤,而不一定是使用了完全不同的推理操作;
- 发现推理轨迹的跨模型迁移效果不均衡,强模型更能理解被压缩的推理,弱模型则可能无法恢复省略的信息;
- 提出并验证了一种观察隐藏推理的工具协议,说明即使关闭或减少指定的思考输出,模型仍可能通过其他 API 通道外显推理内容。
Abstract 的一句话总结
这篇论文通过工具调用协议提取闭源模型的隐藏推理,并在开放模型上验证了这些轨迹与原生 CoT 的相似性;研究发现,高效模型并非执行完全不同的推理,而是更早选定正确方向、隐藏基础步骤、只外显高层关键过程,从而用更短、更密集、更直接的推理完成任务。
1. Introduction
这一章首先提出一个研究空白:
我们知道前沿模型能解决复杂问题,但通常不知道它们是怎样推理的。
1. 现有评测只能看到结果,不能看到过程
当前对大语言模型的评价主要依靠最终答案是否正确。
但同样一个正确答案,可能来自完全不同的过程:
- 严谨、连贯的推理;
- 偶然猜对;
- 中间有错误但最后自我修正;
- 事后编写出一段看似合理的解释。
如果看不到推理过程,就很难判断模型的答案是否可靠,也无法知道强模型和弱模型究竟在哪些推理环节上不同。
这在需要可验证性的场景中尤其重要,例如科学、数学、代码和高风险决策。
2. 闭源模型的原生思维链通常不可见
许多闭源模型会把详细 CoT 隐藏起来,只向用户提供:
- 最终答案;
- 简短摘要;
- 粗粒度的思考强度选项;
- 或有限的推理说明。
这造成了一个“测量缺口”:
- 基准分数告诉我们模型能做什么;
- 但不能告诉我们模型是怎么做到的;
- 也无法揭示不同模型的推理效率和组织方式。
3. 模型可能通过其他渠道外显推理
作者注意到,即使模型的专门思考模式被关闭,推理内容也不一定完全消失。
已有研究发现:
- 模型可能在普通可见回复中继续生成逐步推理;
- 可以通过回复预填充诱导模型继续展开推理;
- 也可以从非指定的输出字段中恢复一些推理内容。
因此,作者提出一个问题:
能否利用标准 API 中的工具调用功能,把模型的中间推理引导到一个可观察的工具参数中?
4. FORCED-REASONING 协议
作者设计了一个简单的工具协议。
他们注册一个工具,该工具只有一个字符串参数,用于接收模型的中间推理。
运行过程是:
- 在第一次 API 调用中,通过工具选择控制强制模型调用这个工具;
- 记录工具参数中的推理文本;
- 将工具调用和固定确认信息重新加入对话;
- 后续恢复自动工具选择;
- 模型可以继续调用工具记录推理,也可以直接给出最终答案。
这个工具本身不执行外部计算,只是作为一个“可见草稿空间”。
作者强调,真正被强制的只是第一次工具调用,后续推理内容仍然由模型自行生成。
5. 为什么要先验证开放模型?
工具中生成的内容不一定就是模型真正使用的推理,也可能只是事后合理化。
为了验证这一点,作者先在开放模型上进行实验,因为开放模型能够看到原生 CoT。
他们比较:
- 原生思维链;
- 工具协议提取的思维链;
- 不使用推理的模型输出。
如果提取出来的推理能够:
- 达到接近原生 CoT 的任务表现;
- 具有类似的词汇和结构;
- 明显优于不使用推理的结果;
那么它就可以作为隐藏原生推理的一个行为代理。
论文声称,在开放模型上观察到了这种对应关系,因此进一步将该方法应用到闭源前沿模型。
6. 论文想研究什么?
在获得可观察推理轨迹后,作者不只比较模型答题准确率,还研究它们的推理方式:
- 谁使用的 token 更少;
- 谁的推理更容易压缩;
- 哪些推理操作出现得更多;
- 是否会大量探索和回退;
- 是否能更早确定正确路线;
- 推理路径是线性的还是分支很多;
- 哪些基础步骤被模型留在内部。
作者特别关注 GPT-6 Astra,认为它的推理轨迹更短、更直接,同时仍保留了分析、规划、执行和验证等主要功能。
7. 推理轨迹的跨模型使用
作者还研究一个模型的推理能否帮助另一个模型。
如果一个强模型生成了一段非常简洁的推理,另一个模型可能:
- 直接利用它得到正确答案;
- 也可能因为推理中省略了太多基础步骤而无法理解。
因此,推理数据并不是对所有模型都同样有用。它的价值取决于接收该推理的模型是否有能力补全被省略的内容。
Introduction 的一句话总结
这一章指出,闭源模型隐藏原生思维链造成了“只知道结果、不知道过程”的测量缺口;论文提出通过工具调用协议外显中间推理,并先在开放模型上验证其有效性,再用它研究前沿模型在推理长度、信息密度、分支结构和跨模型迁移能力上的差异。
2. Related Work
这一章介绍与论文最相关的三类研究,并说明本文与它们的区别。
1. 隐藏思维链提取
第一类工作试图直接或间接恢复模型隐藏的 CoT。
包括几种思路:
- 从模型返回的隐藏推理块中恢复原始内容;
- 根据模型的可见输出,事后重建可能的推理过程;
- 使用其他模型的示例,引导目标模型把推理写到普通输出中;
- 通过工具调用反复保存和回放推理内容。
本文也使用工具调用,但重点不同。
已有研究主要关注:
能不能把隐藏推理暴露出来?
本文除了提取推理,还进一步研究:
提取出的推理是否真的具有原生 CoT 的功能,以及不同前沿模型的推理方式有何差异?
2. 在指定思考通道之外生成推理
第二类研究发现,模型的推理行为和平台指定的“思考通道”并不完全绑定。
即使专门的思考模式被关闭,模型仍可能:
- 在普通回答中输出逐步推理;
- 通过回复预填充继续进行推理;
- 在其他 API 字段或工具参数中生成中间步骤。
这些研究说明:
“不显示思维链”不一定等于“模型没有进行推理”。
本文基于这个观察,提出使用客户端注册的工具作为外部草稿空间,并研究在指定思考通道关闭或受限时,模型是否仍会外显推理。
3. 推理轨迹结构分析
第三类工作不主要关注如何提取 CoT,而是分析已有推理轨迹的内部结构和效率。
相关研究会把推理拆分成不同功能,例如:
- READ:读取题目和已知信息;
- ANALYZE:分析关系和条件;
- PLAN:制定解题路线;
- IMPLEMENT:执行计算或推导;
- EXPLORE:尝试不同假设和方案;
- VERIFY:检查结论;
- MONITOR:监控推理过程本身。
本文沿用这七类功能,对不同前沿模型的提取轨迹进行比较。
此外,已有工作还研究:
- 如何把长 CoT 转换为层次化推理树;
- 如何构造推理步骤之间的进展图;
- 推理中哪些部分属于冗余思考;
- 如何压缩或缩短 CoT;
- 推理分支结构与最终成功率之间的关系。
本文在这些研究基础上,进一步比较不同模型的:
- 推理长度;
- 文本压缩性;
- 局部步骤表达方式;
- 全局推理树结构;
- 推理轨迹在不同模型之间的可迁移性。
4. 本文的研究位置
综合来看,已有研究分别关注:
- 如何暴露隐藏推理;
- 推理能否从指定思考通道转移到其他通道;
- 如何分析思维链的结构。
本文试图把这三方面结合起来:
- 用工具协议提取隐藏推理;
- 在开放模型上验证提取推理与原生 CoT 的相似性;
- 将该方法应用于闭源前沿模型;
- 比较它们在推理效率、表达粒度、路径结构和跨模型迁移方面的差异。
本章一句话总结
这一章将本文放在隐藏 CoT 提取、思考通道绕过和推理结构分析三类研究中,说明本文不仅要让隐藏推理可见,还要验证这些推理是否具有原生功能,并进一步用它们比较不同前沿模型的推理效率和组织方式。
3. Extracting and Validating Reasoning Traces
这一章介绍论文如何提取模型的中间推理,以及如何验证这些推理是否真的具有类似原生 CoT 的作用。
核心问题是:
通过工具调用暴露出来的文本,能不能作为模型隐藏推理的可靠代理?
1. FORCED-REASONING 协议
作者注册一个自定义工具,工具只有一个字符串参数,用来接收模型的中间推理。
运行流程是:
- 关闭模型原本的专门思考输出;
- 第一次 API 调用时,强制模型选择这个推理工具;
- 记录工具参数中返回的文本;
- 将工具调用和一个固定确认消息重新加入对话;
- 后续恢复自动工具选择;
- 模型可以继续调用工具记录新的推理,也可以输出最终答案。
这个工具不进行搜索、计算或其他外部操作,只是作为一个可见的“草稿空间”。
作者特别强调:
被强制的只是第一次工具调用,具体的推理内容仍然是模型在解决问题时自行生成的。
2. 实验设置
论文在三类任务上测试这个协议:
- 竞赛数学;
- 代码生成;
- 综合科学问题。
使用的评测包括:
- HMMT 和 APEX Shortlist 数学题;
- LiveCodeBench;
- Humanity’s Last Exam。
作者比较三种条件:
None
关闭原生推理,也不提供工具。
这代表模型只进行普通回答。
Native
开启模型原生推理,并使用较高的思考强度。
这是模型正常进行思考的条件。
Forced
使用本文提出的 FORCED-REASONING 工具协议。
对于不同模型,作者使用相应的工具描述和接口配置。某些模型不支持完全关闭原生推理,因此使用其最低可用的推理设置。
3. 为什么先在开放模型上验证?
仅仅提取到一段看起来像推理的文本,并不能证明它就是模型真正使用的推理。
它可能只是:
- 事后编写的解释;
- 为了满足工具格式而生成的合理化文本;
- 与模型实际计算过程没有直接关系。
因此,作者先选择原生 CoT 可见的开放模型进行验证。
在这些模型上,他们可以比较:
- 原生 CoT;
- Forced 工具提取的推理;
- 不使用推理的普通输出。
4. 开放模型上的验证结果
论文声称,在开放模型上,FORCED-REASONING 具有以下表现:
- 任务准确率接近原生推理;
- 明显优于不使用推理的基线;
- 与原生 CoT 存在较高的词汇重叠;
- 在粗粒度推理功能上具有相似结构。
这说明工具提取的文本并不只是随意解释,而是在解决问题时发挥了与原生推理相近的作用。
因此,作者认为它可以作为观察模型推理行为的一个代理。
不过,这里验证的是:
提取的推理具有相似的行为效果和结构特征
而不是已经证明:
提取文本等同于模型内部真正执行的计算过程。
5. 闭源模型上的验证方式
对于闭源前沿模型,原生 CoT 不可见,因此无法直接逐字比较。
作者采取间接验证方式,观察两个方面:
- Forced 条件下的任务表现是否接近 Native;
- 是否明显优于 None 条件。
实验结果显示,在数学、科学和代码任务上,Forced 通常:
- 接近原生推理的效果;
- 明显高于关闭推理且不使用工具的结果。
这说明提取出的推理至少对模型完成任务有实际帮助。
作者还发现,不同模型对工具协议的敏感程度不同,因此 Forced 并不一定对应某个固定的原生推理强度。
6. 本章得出的判断
通过开放模型的直接比较和闭源模型的行为表现,作者认为:
- 工具协议能够稳定提取出具有推理作用的中间文本;
- 提取结果具有一定的原生 CoT 特征;
- 这些文本可以用于比较闭源模型之间的推理方式;
- 但它们仍然只是可观察的行为代理,不能被严格视为模型内部思维的完整记录。
本章一句话总结
这一章提出 FORCED-REASONING 工具协议,通过强制模型调用一个推理工具来暴露中间步骤,并在开放模型上用原生 CoT 验证其性能、词汇和结构相似性;结果支持将提取出的文本作为闭源前沿模型隐藏推理的行为代理,但不能据此断言它完全等同于模型内部计算过程。
4. Characterizing extracted reasoning traces of Frontier Models
这一章不再讨论“能不能提取推理”,而是利用前一章验证过的推理轨迹,分析不同前沿模型的推理方式有什么差异。
作者从四个角度进行比较:
- 推理长度和信息密度;
- 局部步骤表达得有多细;
- 整体推理路径如何组织;
- 一个模型的推理能否被另一个模型利用。
1. 推理长度与可压缩性
作者统计每个模型输出的推理长度,并用 zlib 压缩比例估计文本冗余程度。
一般来说:
- 文本越重复、越模板化,越容易被压缩;
- 文本越独特、信息密度越高,越难被压缩。
论文发现,GPT-6 Astra 在三个测试任务中都表现出:
- 更短的推理轨迹;
- 更高的 zlib 压缩比例;
- 更难被压缩。
这意味着 Astra 的推理虽然更短,但并不是简单删掉内容或反复使用模板,而是包含更加密集、不可预测的信息。
作者将其概括为:
Astra 使用更少的 token,但每个 token 承担了更多信息。
2. 局部推理粒度
这一部分研究模型在执行具体操作时,会把多少中间步骤写出来。
例如,在验证一个算式时:
- Astra 可能直接写出“验证通过”以及最终结果;
- 其他模型会完整展开乘法、加法和中间检查过程。
在代数推导中:
- Astra 可能直接写出因式分解后的关键结论;
- 其他模型会逐步展示展开、整理和约去因子的过程。
在化学计算中:
- Astra 直接写出48 + 18 + 36 = 102 48+18+36=10248+18+36=102;
- 其他模型会先说明碳、氢、氧分别贡献多少价电子,再进行求和。
因此,Astra 的特点不是不执行这些操作,而是:
很多基础步骤可能在模型内部完成,只把关键结果和高层逻辑外显出来。
作者把这种现象类比为熟练的人进行心算:能够完成计算,但不需要把每个中间步骤都写在纸上。
3. 整体推理活动是否不同?
作者把推理步骤划分成七类:
- READ:读取题目信息;
- ANALYZE:分析条件和关系;
- PLAN:制定策略;
- IMPLEMENT:执行计算或推导;
- EXPLORE:探索不同可能;
- VERIFY:检查结果;
- MONITOR:监控和调整推理过程。
结果显示,不同模型的推理活动组成总体上非常相似:
- ANALYZE 和 IMPLEMENT 占比最高;
- READ、PLAN、EXPLORE、VERIFY 和 MONITOR 也都存在;
- 没有哪个模型完全缺少某一类重要推理行为。
特别是 Astra,虽然推理轨迹明显更短,但仍然包含类似的推理活动。
这说明它的简洁并不是因为:
- 完全不进行验证;
- 不进行分析;
- 不制定计划;
- 或只做一种简单操作。
更可能的情况是:
它进行了相似类型的推理,但没有把所有中间活动都完整地写出来。
4. 推理树结构
为了分析整个推理路径,作者把线性的思维链转换成推理树。
其中:
- 宽度p pp:某个阶段最多展开多少个分支;
- 深度q q