众所周知,从 o1 开始,北美头部两家模型厂商的推理模型都出于安全原因,不再把完整的思维链(raw chain-of-thought)直接交给客户端,而是展示给用户一个 summary of CoT

但其实这种轨迹中的原始 thinking 具备很高“蒸馏”价值,能直接提升模型的智能水平、影响模型的 thinking token efficiency。但用户只能拿到一个加密过后的 thinking 的 signature(通常为一个很长的带无序数字和字母的字符串)

有没有机会从这个 signature 恢复出原始的 CoT?对于这个问题的原理,下文进行了一些研究和实验

报告如下(基于实验仓库 AI 自动生成)


1. Introduction

现在两家头部厂商的推理模型都不再把完整的思维链(raw chain-of-thought, CoT)直接交给客户端:

本研究要回答的问题很直接:

  1. 这些加密载荷到底是什么?里面装了什么?
  2. 多轮对话回传它们时,服务端在做什么?
  3. 能否借"replay"(把加密载荷原样回传)还原被隐藏的思维链?——即对两家模型的思维链做一次"hack"。