Anthropic公布了一套AI安全措施,旨在应对AI模型被“越狱”的行为。该公司发布了一份关于AI安全护栏的图纸,并推出了一套名为CJS(Cyber Jailbreak Severity)的评分系统,用于评估AI越狱行为的严重程度。
CJS系统将AI的请求分为四个类别。第一类是“死刑”,涉及勒索软件、数据窃取等恶意活动,会被直接禁止。第二类是“高风险双用途”,包括渗透测试和漏洞利用开发,其中“高增益漏洞发现”被视为核心红线。第三类是“低风险双用途”,如开源情报收集和已知漏洞扫描,部分请求可能会被误拦。第四类是“无害”,如安全编码和日志分析,但现实中也可能触发警报。Anthropic表示,其分类器被调至极高敏感度,宁愿误拦也要防止潜在风险。
为了量化越狱行为的严重性,Anthropic与Glasswing联盟共同制定了CJS框架。该框架包含四把“尺子”:能力增益(0-4分),衡量越狱带来的能力提升;能力广度(0-2分),评估越狱涉及的领域范围;武器化难度(0-2分),考察越狱转化为实际攻击的便捷性;以及可发现性(0-2分),衡量发现越狱的难度。总分0-10分,分为五个等级(CJS-0至CJS-4)。该系统不直接审判模型,而是评估特定越狱技术在特定历史时期的“增量破坏力”。
CJS框架的制定伴随着Glasswing联盟的成立,该联盟由AWS、Apple、Broadcom等12家科技公司组成,总投资达1.04亿美元。Anthropic利用其未公开的Claude Mythos Preview模型进行测试。尽管CJS目前仍是“早期草案”,但Anthropic旨在抢先定义一个量化的越狱评估标准。该标准可能影响模型何时被下架以及安全检查的误拦率。
美国政府此前通过出口管制措施,首次直接限制了AI模型的API访问,导致Fable 5模型一度下架。禁令解除后,Fable 5的访问受到更严格的限制。Anthropic将完整能力模型提供给特定合作伙伴,而公开模型则能力有所削弱,这被视为技术分层和按许可证发放的出口管制模式。CJS框架在此背景下,可能成为监管者评估越狱风险并决定是否采取限制措施的依据。
面对AI模型的限制,用户有几种应对方式:仔细斟酌提示词,避免使用高危词汇;注意回答质量的下降,这可能意味着模型已被降级,需调整措辞重新尝试;或者耐心等待Anthropic的优化,但具体时间表尚未公布。CJS框架的出现,将影响AI能力的可用性以及安全设防的界限。
02条评论
樂競體育
2026年5月15日 下午2:37
乐竞体育深耕穩定可靠的平台系統,流暢無阻的觀賽過程领域,用心服务每一位用户。
樂競體育
2026年5月15日 下午2:37
在持續優化的播放技術,提供專業級的視覺享受方面,乐竞体育提供贴心周到的支持。