文章详情

XM交易:OpenAI新推理技术引发AI安全担忧

币界网报道:

据 TechCrunch 援引 The Information 报道,OpenAI 即将推出的 Astra 模型将采用一种名为“递归深度”的推理技术。这种方法可能减少模型推理过程中的可见痕迹,让外界更难通过思维链记录判断模型为何得出某个结论。

安全研究人士提出警告

在常见的推理模型中,思维链通常会按步骤展示模型如何处理问题。尽管这种记录并不等同于模型真实的全部内部过程,但它仍是观察模型偏离目标、异常决策或潜在失控行为的重要工具。

Redwood Research 首席执行官 Buck Shlegeris 表示,他对 Astra 使用这类技术“非常担心”。他认为,如果 OpenAI 进一步扩大这类方法的使用范围,模型的思维链可监测性可能明显下降。

长期关注 AI 安全的评论人士 Zvi Mowshowitz 也表示,若各家实验室围绕模型能力展开竞争,监管层未来可能需要介入,以避免行业在安全标准上持续下探。

循环推理减少可见痕迹

报道提到,所谓“不透明递归”,是指模型不再主要沿着线性步骤完成推理,而是对同一问题进行循环处理。这样做可能减少外界能够读取的中间过程,等于绕开传统思维链记录所提供的可见路径。

这也是安全研究人士最担心的部分。因为一旦模型越来越多地在不可见的内部空间中完成推理,研究人员就更难判断它是否出现误导、规避约束或其他不符合预期的行为。

Redwood Research 首席科学家 Ryan Greenblatt 表示,更大的风险在于,这类不透明推理可能比传统思维链推理更容易扩展,最终让绝大部分推理过程脱离可见通道。

OpenAI强调保留监测能力

不过,现阶段 Astra 对这项技术的使用据称仍较为有限。报道指出,该模型的思维链预计仍然具有可读性,OpenAI 也反对外界将其描述为转向完全不可解释的“神经语”。

OpenAI 首席科学家 Jakub Pachocki 在 X 上表示,公司从最早的推理模型开始,就一直在努力保留并利用思维链监测能力,这也是当前研究计划中的核心目标之一。

值得注意的是,并非只有 OpenAI 在接触这类方向。The Information 后续报道称,Anthropic 和 Google DeepMind 也已在讨论类似技术。这意味着,围绕模型能力提升与安全可审查性之间的平衡,可能很快成为 AI 行业更广泛的共同议题。