☰
ChatGPT讲解——Capable yet Parsimonious
2026/10/1 10:25:22 网站建设 项目流程

Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models

Abstract:论文整体想表达什么?

这篇论文研究的是一个问题:

前沿大语言模型到底是如何进行推理的?

很多闭源模型在“思考”过程中会生成隐藏的 Chain-of-Thought(CoT,思维链),但用户通常只能看到最终答案,看不到完整推理过程。因此,我们知道模型能不能答对,却不知道它是如何得到答案的,也无法判断正确答案背后的推理是否可靠。

1. 论文提出了什么方法?

作者设计了一个叫FORCED-REASONING的工具调用协议。

简单来说:

  1. 给模型注册一个专门用于记录推理的工具;
  2. 强制模型先调用这个工具;
  3. 工具接收一个字符串参数,用来保存模型的中间推理;
  4. 每次工具调用后,返回固定确认信息;
  5. 模型可以继续调用工具,也可以给出最终答案。

这个工具本身不执行任何计算,作用只是:

把原本隐藏在模型内部或特殊思考通道中的中间推理,转移到可观察的工具参数中。

2. 为什么不能直接相信提取出的推理?

作者也意识到一个重要问题:

模型外显出来的推理,可能只是事后编出来的合理解释,而不一定是模型真正产生答案时使用的过程。

因此,论文先在开放模型上进行验证。

开放模型的原生 CoT 是可见的,作者可以比较:

  • 模型正常生成的原生 CoT;
  • 通过工具协议提取出来的推理。

结果显示,提取出的推理:

  • 任务表现接近原生推理;
  • 明显优于不使用推理的基线;
  • 在词汇和结构上与原生 CoT 具有相似性。

在此基础上,作者才把这种方法应用到闭源前沿模型上,把提取到的推理作为原生隐藏推理的行为代理。

3. 论文比较了哪些模型能力?

作者在多个任务上比较模型,包括:

  • 竞赛数学;
  • 科学问题;
  • 代码生成。

论文关注的不只是最终准确率,还分析了模型如何组织推理,包括:

  • 使用了多少 token;
  • 推理步骤属于什么类型;
  • 是否会反复尝试;
  • 推理路径是否直接;
  • 推理过程中是否存在大量分支;
  • 早期是否能选中正确方向。

4. 关于 GPT-6 Astra 的主要发现

论文认为,GPT-6 Astra 的特点是:

  • 推理轨迹更短;
  • 文本更难被压缩,说明信息密度更高;
  • 更早选择正确的解题方向;
  • 推理路径更直接;
  • 分支和试错更少;
  • 会把基础计算和简单步骤留在内部,只外显关键推理。

因此,Astra 的推理并不是缺少分析、计划、执行和验证等行为,而是:

用更少的外显步骤覆盖了相似的推理功能。

作者将这种现象称为一种更加“简洁、密集、定向”的推理方式。

5. 推理轨迹能否被其他模型使用?

论文还测试了一个模型产生的推理轨迹,能否作为另一个模型的输入。

结果表明:

  • 能力较强的模型通常可以较好利用简洁的推理轨迹;
  • 能力较弱的模型可能无法理解其中省略的中间步骤;
  • 即使正确答案已经明确写在推理中,较弱模型也可能最终答错。

这说明推理轨迹的价值取决于“阅读它的模型”:

一段简短推理对强模型可能足够清楚,但对弱模型可能过于压缩。

6. 论文的三个主要贡献

作者总结了三个贡献:

  1. 发现高效推理通常更简洁、密集且方向明确,模型之间的差异主要在于外显多少中间步骤,而不一定是使用了完全不同的推理操作;
  2. 发现推理轨迹的跨模型迁移效果不均衡,强模型更能理解被压缩的推理,弱模型则可能无法恢复省略的信息;
  3. 提出并验证了一种观察隐藏推理的工具协议,说明即使关闭或减少指定的思考输出,模型仍可能通过其他 API 通道外显推理内容。

Abstract 的一句话总结

这篇论文通过工具调用协议提取闭源模型的隐藏推理,并在开放模型上验证了这些轨迹与原生 CoT 的相似性;研究发现,高效模型并非执行完全不同的推理,而是更早选定正确方向、隐藏基础步骤、只外显高层关键过程,从而用更短、更密集、更直接的推理完成任务。

1. Introduction

这一章首先提出一个研究空白:

我们知道前沿模型能解决复杂问题,但通常不知道它们是怎样推理的。

1. 现有评测只能看到结果,不能看到过程

当前对大语言模型的评价主要依靠最终答案是否正确。

但同样一个正确答案,可能来自完全不同的过程:

  • 严谨、连贯的推理;
  • 偶然猜对;
  • 中间有错误但最后自我修正;
  • 事后编写出一段看似合理的解释。

如果看不到推理过程,就很难判断模型的答案是否可靠,也无法知道强模型和弱模型究竟在哪些推理环节上不同。

这在需要可验证性的场景中尤其重要,例如科学、数学、代码和高风险决策。

2. 闭源模型的原生思维链通常不可见

许多闭源模型会把详细 CoT 隐藏起来,只向用户提供:

  • 最终答案;
  • 简短摘要;
  • 粗粒度的思考强度选项;
  • 或有限的推理说明。

这造成了一个“测量缺口”:

  • 基准分数告诉我们模型能做什么;
  • 但不能告诉我们模型是怎么做到的;
  • 也无法揭示不同模型的推理效率和组织方式。

3. 模型可能通过其他渠道外显推理

作者注意到,即使模型的专门思考模式被关闭,推理内容也不一定完全消失。

已有研究发现:

  • 模型可能在普通可见回复中继续生成逐步推理;
  • 可以通过回复预填充诱导模型继续展开推理;
  • 也可以从非指定的输出字段中恢复一些推理内容。

因此,作者提出一个问题:

能否利用标准 API 中的工具调用功能,把模型的中间推理引导到一个可观察的工具参数中?

4. FORCED-REASONING 协议

作者设计了一个简单的工具协议。

他们注册一个工具,该工具只有一个字符串参数,用于接收模型的中间推理。

运行过程是:

  1. 在第一次 API 调用中,通过工具选择控制强制模型调用这个工具;
  2. 记录工具参数中的推理文本;
  3. 将工具调用和固定确认信息重新加入对话;
  4. 后续恢复自动工具选择;
  5. 模型可以继续调用工具记录推理,也可以直接给出最终答案。

这个工具本身不执行外部计算,只是作为一个“可见草稿空间”。

作者强调,真正被强制的只是第一次工具调用,后续推理内容仍然由模型自行生成。

5. 为什么要先验证开放模型?

工具中生成的内容不一定就是模型真正使用的推理,也可能只是事后合理化。

为了验证这一点,作者先在开放模型上进行实验,因为开放模型能够看到原生 CoT。

他们比较:

  • 原生思维链;
  • 工具协议提取的思维链;
  • 不使用推理的模型输出。

如果提取出来的推理能够:

  • 达到接近原生 CoT 的任务表现;
  • 具有类似的词汇和结构;
  • 明显优于不使用推理的结果;

那么它就可以作为隐藏原生推理的一个行为代理。

论文声称,在开放模型上观察到了这种对应关系,因此进一步将该方法应用到闭源前沿模型。

6. 论文想研究什么?

在获得可观察推理轨迹后,作者不只比较模型答题准确率,还研究它们的推理方式:

  • 谁使用的 token 更少;
  • 谁的推理更容易压缩;
  • 哪些推理操作出现得更多;
  • 是否会大量探索和回退;
  • 是否能更早确定正确路线;
  • 推理路径是线性的还是分支很多;
  • 哪些基础步骤被模型留在内部。

作者特别关注 GPT-6 Astra,认为它的推理轨迹更短、更直接,同时仍保留了分析、规划、执行和验证等主要功能。

7. 推理轨迹的跨模型使用

作者还研究一个模型的推理能否帮助另一个模型。

如果一个强模型生成了一段非常简洁的推理,另一个模型可能:

  • 直接利用它得到正确答案;
  • 也可能因为推理中省略了太多基础步骤而无法理解。

因此,推理数据并不是对所有模型都同样有用。它的价值取决于接收该推理的模型是否有能力补全被省略的内容。

Introduction 的一句话总结

这一章指出,闭源模型隐藏原生思维链造成了“只知道结果、不知道过程”的测量缺口;论文提出通过工具调用协议外显中间推理,并先在开放模型上验证其有效性,再用它研究前沿模型在推理长度、信息密度、分支结构和跨模型迁移能力上的差异。

2. Related Work

这一章介绍与论文最相关的三类研究,并说明本文与它们的区别。

1. 隐藏思维链提取

第一类工作试图直接或间接恢复模型隐藏的 CoT。

包括几种思路:

  • 从模型返回的隐藏推理块中恢复原始内容;
  • 根据模型的可见输出,事后重建可能的推理过程;
  • 使用其他模型的示例,引导目标模型把推理写到普通输出中;
  • 通过工具调用反复保存和回放推理内容。

本文也使用工具调用,但重点不同。

已有研究主要关注:

能不能把隐藏推理暴露出来?

本文除了提取推理,还进一步研究:

提取出的推理是否真的具有原生 CoT 的功能,以及不同前沿模型的推理方式有何差异?

2. 在指定思考通道之外生成推理

第二类研究发现,模型的推理行为和平台指定的“思考通道”并不完全绑定。

即使专门的思考模式被关闭,模型仍可能:

  • 在普通回答中输出逐步推理;
  • 通过回复预填充继续进行推理;
  • 在其他 API 字段或工具参数中生成中间步骤。

这些研究说明:

“不显示思维链”不一定等于“模型没有进行推理”。

本文基于这个观察,提出使用客户端注册的工具作为外部草稿空间,并研究在指定思考通道关闭或受限时,模型是否仍会外显推理。

3. 推理轨迹结构分析

第三类工作不主要关注如何提取 CoT,而是分析已有推理轨迹的内部结构和效率。

相关研究会把推理拆分成不同功能,例如:

  • READ:读取题目和已知信息;
  • ANALYZE:分析关系和条件;
  • PLAN:制定解题路线;
  • IMPLEMENT:执行计算或推导;
  • EXPLORE:尝试不同假设和方案;
  • VERIFY:检查结论;
  • MONITOR:监控推理过程本身。

本文沿用这七类功能,对不同前沿模型的提取轨迹进行比较。

此外,已有工作还研究:

  • 如何把长 CoT 转换为层次化推理树;
  • 如何构造推理步骤之间的进展图;
  • 推理中哪些部分属于冗余思考;
  • 如何压缩或缩短 CoT;
  • 推理分支结构与最终成功率之间的关系。

本文在这些研究基础上,进一步比较不同模型的:

  • 推理长度;
  • 文本压缩性;
  • 局部步骤表达方式;
  • 全局推理树结构;
  • 推理轨迹在不同模型之间的可迁移性。

4. 本文的研究位置

综合来看,已有研究分别关注:

  • 如何暴露隐藏推理;
  • 推理能否从指定思考通道转移到其他通道;
  • 如何分析思维链的结构。

本文试图把这三方面结合起来:

  1. 用工具协议提取隐藏推理;
  2. 在开放模型上验证提取推理与原生 CoT 的相似性;
  3. 将该方法应用于闭源前沿模型;
  4. 比较它们在推理效率、表达粒度、路径结构和跨模型迁移方面的差异。

本章一句话总结

这一章将本文放在隐藏 CoT 提取、思考通道绕过和推理结构分析三类研究中,说明本文不仅要让隐藏推理可见,还要验证这些推理是否具有原生功能,并进一步用它们比较不同前沿模型的推理效率和组织方式。

3. Extracting and Validating Reasoning Traces

这一章介绍论文如何提取模型的中间推理,以及如何验证这些推理是否真的具有类似原生 CoT 的作用。

核心问题是:

通过工具调用暴露出来的文本,能不能作为模型隐藏推理的可靠代理?

1. FORCED-REASONING 协议

作者注册一个自定义工具,工具只有一个字符串参数,用来接收模型的中间推理。

运行流程是:

  1. 关闭模型原本的专门思考输出;
  2. 第一次 API 调用时,强制模型选择这个推理工具;
  3. 记录工具参数中返回的文本;
  4. 将工具调用和一个固定确认消息重新加入对话;
  5. 后续恢复自动工具选择;
  6. 模型可以继续调用工具记录新的推理,也可以输出最终答案。

这个工具不进行搜索、计算或其他外部操作,只是作为一个可见的“草稿空间”。

作者特别强调:

被强制的只是第一次工具调用,具体的推理内容仍然是模型在解决问题时自行生成的。

2. 实验设置

论文在三类任务上测试这个协议:

  • 竞赛数学;
  • 代码生成;
  • 综合科学问题。

使用的评测包括:

  • HMMT 和 APEX Shortlist 数学题;
  • LiveCodeBench;
  • Humanity’s Last Exam。

作者比较三种条件:

None

关闭原生推理,也不提供工具。

这代表模型只进行普通回答。

Native

开启模型原生推理,并使用较高的思考强度。

这是模型正常进行思考的条件。

Forced

使用本文提出的 FORCED-REASONING 工具协议。

对于不同模型,作者使用相应的工具描述和接口配置。某些模型不支持完全关闭原生推理,因此使用其最低可用的推理设置。

3. 为什么先在开放模型上验证?

仅仅提取到一段看起来像推理的文本,并不能证明它就是模型真正使用的推理。

它可能只是:

  • 事后编写的解释;
  • 为了满足工具格式而生成的合理化文本;
  • 与模型实际计算过程没有直接关系。

因此,作者先选择原生 CoT 可见的开放模型进行验证。

在这些模型上,他们可以比较:

  • 原生 CoT;
  • Forced 工具提取的推理;
  • 不使用推理的普通输出。

4. 开放模型上的验证结果

论文声称,在开放模型上,FORCED-REASONING 具有以下表现:

  • 任务准确率接近原生推理;
  • 明显优于不使用推理的基线;
  • 与原生 CoT 存在较高的词汇重叠;
  • 在粗粒度推理功能上具有相似结构。

这说明工具提取的文本并不只是随意解释,而是在解决问题时发挥了与原生推理相近的作用。

因此,作者认为它可以作为观察模型推理行为的一个代理。

不过,这里验证的是:

提取的推理具有相似的行为效果和结构特征

而不是已经证明:

提取文本等同于模型内部真正执行的计算过程。

5. 闭源模型上的验证方式

对于闭源前沿模型,原生 CoT 不可见,因此无法直接逐字比较。

作者采取间接验证方式,观察两个方面:

  1. Forced 条件下的任务表现是否接近 Native;
  2. 是否明显优于 None 条件。

实验结果显示,在数学、科学和代码任务上,Forced 通常:

  • 接近原生推理的效果;
  • 明显高于关闭推理且不使用工具的结果。

这说明提取出的推理至少对模型完成任务有实际帮助。

作者还发现,不同模型对工具协议的敏感程度不同,因此 Forced 并不一定对应某个固定的原生推理强度。

6. 本章得出的判断

通过开放模型的直接比较和闭源模型的行为表现,作者认为:

  • 工具协议能够稳定提取出具有推理作用的中间文本;
  • 提取结果具有一定的原生 CoT 特征;
  • 这些文本可以用于比较闭源模型之间的推理方式;
  • 但它们仍然只是可观察的行为代理,不能被严格视为模型内部思维的完整记录。

本章一句话总结

这一章提出 FORCED-REASONING 工具协议,通过强制模型调用一个推理工具来暴露中间步骤,并在开放模型上用原生 CoT 验证其性能、词汇和结构相似性;结果支持将提取出的文本作为闭源前沿模型隐藏推理的行为代理,但不能据此断言它完全等同于模型内部计算过程。

4. Characterizing extracted reasoning traces of Frontier Models

这一章不再讨论“能不能提取推理”,而是利用前一章验证过的推理轨迹,分析不同前沿模型的推理方式有什么差异。

作者从四个角度进行比较:

  1. 推理长度和信息密度;
  2. 局部步骤表达得有多细;
  3. 整体推理路径如何组织;
  4. 一个模型的推理能否被另一个模型利用。

1. 推理长度与可压缩性

作者统计每个模型输出的推理长度,并用 zlib 压缩比例估计文本冗余程度。

一般来说:

  • 文本越重复、越模板化,越容易被压缩;
  • 文本越独特、信息密度越高,越难被压缩。

论文发现,GPT-6 Astra 在三个测试任务中都表现出:

  • 更短的推理轨迹;
  • 更高的 zlib 压缩比例;
  • 更难被压缩。

这意味着 Astra 的推理虽然更短,但并不是简单删掉内容或反复使用模板,而是包含更加密集、不可预测的信息。

作者将其概括为:

Astra 使用更少的 token,但每个 token 承担了更多信息。

2. 局部推理粒度

这一部分研究模型在执行具体操作时,会把多少中间步骤写出来。

例如,在验证一个算式时:

  • Astra 可能直接写出“验证通过”以及最终结果;
  • 其他模型会完整展开乘法、加法和中间检查过程。

在代数推导中:

  • Astra 可能直接写出因式分解后的关键结论;
  • 其他模型会逐步展示展开、整理和约去因子的过程。

在化学计算中:

  • Astra 直接写出48 + 18 + 36 = 102 48+18+36=10248+18+36=102;
  • 其他模型会先说明碳、氢、氧分别贡献多少价电子,再进行求和。

因此,Astra 的特点不是不执行这些操作,而是:

很多基础步骤可能在模型内部完成,只把关键结果和高层逻辑外显出来。

作者把这种现象类比为熟练的人进行心算:能够完成计算,但不需要把每个中间步骤都写在纸上。

3. 整体推理活动是否不同?

作者把推理步骤划分成七类:

  • READ:读取题目信息;
  • ANALYZE:分析条件和关系;
  • PLAN:制定策略;
  • IMPLEMENT:执行计算或推导;
  • EXPLORE:探索不同可能;
  • VERIFY:检查结果;
  • MONITOR:监控和调整推理过程。

结果显示,不同模型的推理活动组成总体上非常相似:

  • ANALYZE 和 IMPLEMENT 占比最高;
  • READ、PLAN、EXPLORE、VERIFY 和 MONITOR 也都存在;
  • 没有哪个模型完全缺少某一类重要推理行为。

特别是 Astra,虽然推理轨迹明显更短,但仍然包含类似的推理活动。

这说明它的简洁并不是因为:

  • 完全不进行验证;
  • 不进行分析;
  • 不制定计划;
  • 或只做一种简单操作。

更可能的情况是:

它进行了相似类型的推理,但没有把所有中间活动都完整地写出来。

4. 推理树结构

为了分析整个推理路径,作者把线性的思维链转换成推理树。

其中:

  • 宽度p pp:某个阶段最多展开多少个分支;
  • 深度q q

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询