文章详情

XM交易:Anthropic公开AI实验室三组内部指标:3万代理、十亿次决策与6%安全算力意味着什么

币界网报道:

Anthropic在9月17日提出一套观察前沿AI开发速度的指标,试图回答外界长期看不到的三个问题:AI在多大程度上参与下一代AI研发;公司能否监控内部代理的行动;计算资源究竟有多少用于安全工作。公司同时给出内部快照,包括最常用研发平台在2026年8月任一时刻约有3万个代理运行,在线监控当月检查超过十亿次决策,以及一周样本中约6%的AI研发算力被归类为安全工作。

这些数字不是监管审计结论,也不是行业统一标准。研发自动化指数由Anthropic自己设计,并大量使用Claude整理任务和评分;代理监控只覆盖所描述的主要内部平台;算力分配则来自7月13日至20日的一周快照。官方把它们定位为原型测量,希望未来由独立第三方验证并在不同实验室之间形成可比口径。

从“AI帮助研究员”到“AI领导研发”,需要先知道自动化发生在哪里

Anthropic构建了R&D Automation Index。团队从Slack和内部文档抽样整理约1.5万个细粒度研发任务,再组织成包含542个节点、378个叶子任务的层级树。每类任务按Epoch AI提出的六级尺度评分:从AL0没有AI参与,到AL5完全自主,中间依次包括轻度使用、辅助、协作和主导。最后再按人员在各项任务上投入的时间估算权重。

这比统计员工发送了多少条Claude消息更接近实际工作,因为一条消息可能只是改写句子,也可能完成一次实验设计。但方法仍有局限。任务树冻结在特定时期,若员工因AI出现而转向全新工作,旧篮子未必能捕捉;重要性用人时代理,也不能衡量某项少量工作对模型能力的巨大影响;评分模型又来自被评估公司的自有系统。

Anthropic让相关领域员工在不知道模型证据和结论的情况下独立评分。官方称模型与人类给出完全相同等级的比例为59%,人类之间完全一致只有35%;模型与人类相差不超过一级的比例为97%。这些结果表明边界判断本来就主观,也说明“AI协作”与“AI主导”不能被包装成精确物理量。指数更适合观察同一口径随时间变化,而不是用一个分数宣布已经实现自主研发。

公司希望公开AI参与研发的程度,是因为模型加速自身开发可能缩短人类理解和干预的时间。自动化提高也可能带来更多安全实验和测试,不能只被解释为风险。关键是能力研发和监督能力是否同步增长,以及当代理开始选择研究方向、委派子任务时,人类是否仍掌握明确的停止条件。

100%监控覆盖不等于100%发现问题,安全算力占比也不是安全成果

Anthropic把代理监督分为在线与离线两层。在线监控在动作执行前检查,针对复制模型权重等快速且不可逆的风险;离线监控事后阅读活动,寻找可能缓慢发展、能够补救的失配迹象。官方称主要内部平台的代理动作100%经过在线监控,也全部进入离线系统。8月十亿多次决策中约0.002%被在线监控阻止,约等于每4.7万次一次。

离线系统每周标记约10万份记录,再由多个分类器排除误报和进行初审,最高优先级约50项升级到人工审查。总体上,每千份记录约有一至两份进入进一步查看。低阻止率可以说明大多数动作未触发规则,也可能反映监控漏检或任务风险低,不能单独证明代理几乎不会越权。评估监控质量还需公开已知攻击被捕获的比例、误报率、人工复核时延和事后发现的漏网事件。

算力方面,Anthropic分析一周工作负载,并把主要目的在提高安全性、可解释性或系统安全的运行归类为安全工作。结果显示,AI研发算力中约6%用于安全;在AI驱动的AI研发算力中,约12%用于安全。公司称定义采取保守口径:同时促进能力和安全的任务算作一般研发,安全分类器的另一部分可比算力没有计入。

即便如此,算力占比不能衡量安全成果。一个高效分类器用更少芯片完成更多检查,会让比例下降,却可能提高实际安全;一次大型前沿训练会让分母猛增,也不代表安全团队突然缩减。工作标签和自动分类还可能出错,不同公司若自行定义“安全”,很容易得到无法比较的数字。

这套指标真正有价值的方向,是建立连续时间序列,并交给独立机构核验。研发自动化可观察AI是否从辅助走向主导;监控覆盖、延迟和升级率可观察监督能否跟上代理规模;算力分配可观察公司在能力与安全之间的资源选择。三者必须结合看,任何单项都不应成为安全宣传分数。

Anthropic披露的是实验室内部生产过程的一角。3万代理说明AI已深度进入研发,但不等于3万名独立研究员;十亿次监控决策说明监督规模巨大,但不等于没有漏检;6%安全算力说明资源可被分类,却不等于风险已经得到解决。下一步更重要的是统一定义、定期更新、第三方验证,以及在指标恶化时明确会触发什么限制。只有数字能够改变决策,透明度才不只是一次展示。