热点资讯

大型模型蒸馏时代的终结:Fable 5.1重塑API规则

在科技迅速发展的背景下,Apis的规则终于迎来了重大的变革!在9月2日,Anthropic公司发布了新的Fable 5.1版本,果断地调整了API规则,切断了之前通过蒸馏技术借用顶尖模型的可能性。曾几何时,众多企业为节省计算成本和缩短训练时间,依赖API获取先进模型的推理过程,并将这些数据用于训练自家较小的模型。然而,如今这种做法已经被彻底否定。

Anthropic此次推出的Fable 5.1,确立了一套前所未有的反蒸馏机制,重点是锁定所谓的“思考块”。“思考块”指的是AI在给出最终答案前,所进行的推理过程。这一推理过程在通过API请求时以“思考块”的形式返回用户,使得开发者能够将这些推理步骤连同系统提示和历史消息一并发送回来,以便保持对话的连贯性。然而,这一机制的存在,无疑为蒸馏者提供了机会。通过修改推理过程之前后的上下文信息,蒸馏者能够轻易地绕过Claude的防护,获取原本隐藏的推理逻辑。

为此,Anthropic在Fable 5.1中引入了新的“上下文一致性验证”规则,确保返回的“思考块”与其原始生成时的系统提示、工具以及历史消息严丝合缝。如一旦检测到上下文被篡改,系统将会直接返回错误信息,并拒绝服务。为了照顾那些确实需要调整上下文的开发者,Anthropic也提供了“非严格模式”,在这种模式下,尽管可以发送请求,但“思考块”将会被完全删除,模型不得不在无法参考之前推理的情况下强行回答。

about image

这种防护措施显然是为了抵御日益猖獗的非法蒸馏行为。过去一年中,Anthropic的安全团队发现了一些令人震惊的滥用现象。这些所谓的“蒸馏黑客”并非只是偶尔提出几个问题,而是利用成千上万的虚假账户,依托自动化脚本在API上持续进行大规模的攻击。他们的行为极具隐蔽性,通过“上下文注入”和“对话重写”等技术,像是在对Claude施加“催眠”,迫使其在混乱的逻辑中暴露自己隐秘的推理过程。

不幸的是,这些小参数模型并没有经历初始的算力积累和创新,仅仅是学习了顶尖AI的思维方式,从而达到了类似的表现。这种行为直接触犯了安全底线,导致整个AI系统的安全保障面临崩溃的危险。

about image

在商业利益受侵害的同时,失去“能力与安全的结合”,则是让AI安全领域倍感不安的根本原因。成熟的大型模型如Claude和GPT-4,经过严苛的"价值观对齐"和安全训练,不会教导用户撰写恶意软件或制作炸弹等。但不幸的是,蒸馏模型却可以轻易地绕过这一安全防护。从而使那些通过非法手段训练的微型系统,具备高智商的推理能力却缺乏相应的道德约束,因而可能不受控制地回应黑客的要求,生成恶意代码。

对此次新规的实施将影响哪些开发者呢?Anthropic表示采取了“分阶段执行”的策略,以最大限度降低误伤。从此次更新开始,主要针对新账户,特别是针对2026年8月31日之后创建的新API账户。现有的用户可以无须担忧,依旧能够顺利使用。

about image