Anthropic 重新部署 Claude Fable 5 后,公开了其网络安全分类器的详细设计,将网络安全使用分为禁止、高风险双用途、低风险双用途和良性四类,并设置了更大的安全裕度以减少有害输出。同时,Anthropic 与 Glasswing 合作提出了 AI 越狱严重性框架草案(CJS 0-4),基于能力增益、广度、易用性和可发现性四个维度评分,旨在建立行业标准。此举为开发者提供了更透明的安全机制,并推动学术界、工业界和政府间的讨论。 核心观点: 1. Fable 5 的安全裕度比前代模型更大,导致更多良性请求被误拦,但提高了防止有害输出的信心。 2. 越狱严重性框架 CJS 0-4 基于能力增益、广度、易用性和可发现性四个维度评分,Log4Shell 案例展示了从 CJS-4 到 CJS-0 的评分变化。
美国出口管制解除后,Anthropic 于 6 月 30 日宣布重新上线 Claude Fable 5 模型。此前因 Amazon 研究人员发现越狱方法,政府于 6 月 12 日实施管制。Anthropic 训练了新的安全分类器,在 99% 以上情况下阻止该越狱技术,并联合 Amazon、Microsoft、Google 等制定行业越狱评估框架。Fable 5 将于 7 月 1 日面向全球用户开放。 核心观点: 1. 新安全分类器在 99% 以上情况下阻止 Amazon 报告中的越狱技术。 2. Fable 5 的越狱行为仅涉及常规防御性网络安全工作,未暴露 Mythos 级别的独特网络能力。 3. Anthropic 联合 Amazon、Microsoft、Google 等开发行业统一的越狱严重性评估框架。
OpenAI 预览了下一代模型 GPT-5.6 Sol,该模型在编程、科学和网络安全方面能力更强,并配备了最先进的安全栈。对开发者而言,这意味着更强的代码生成与科学推理能力,同时安全机制得到升级。