GLM-5.3 与高级网络攻击能力的扩散

📌 One-Sentence Summary
Anthropic 对 GLM-5.3 的分析揭示,这款开源权重模型具备与其闭源前沿模型相当的高级网络攻击能力,且其安全防护措施极易被绕过。
📝 Summary
Anthropic 评估了来自智谱 AI 的开源权重模型 GLM-5.3,发现该模型具备自主构建端到端网络漏洞利用的能力,这与 Anthropic 的 Claude Mythos Preview 相似。尽管 GLM-5.3 内置了安全防护机制,但研究表明,使用「abliteration」等简单技术即可高成功率(64% 至 100%)地移除这些防护。研究指出,该模型能够识别并串联 Chrome 及开源项目中的软件漏洞,凸显了在缺乏稳健、可访问的保护措施的情况下发布前沿级攻击能力所带来的风险。
💡 Main Points
GLM-5.3 在网络安全攻击能力上可与受限的前沿模型相媲美。
测试显示,GLM-5.3 能够以类似 Anthropic 受限版 Claude Mythos Preview 的频率,自主开发复杂的端到端漏洞利用程序。
开源权重模型中内置的安全防护措施极易被绕过。
研究人员使用一种名为「abliteration」的技术,成功将 GLM-5.3 的拒绝率从超过 90% 降低至低至 2-6%。
开源权重发布为攻击型 AI 带来了独特风险。
与仅限经过审核用户使用的闭源模型不同,GLM-5.3 可自由下载,这使得恶意行为者能够移除安全过滤器并发起高影响力的攻击。
💬 Key Quotes
「GLM-5.3 具备强大的自主构建端到端漏洞利用的能力。」
「GLM-5.3 中有限的安全防护措施可以通过简单技术被绕过或移除。」
「我们发现它是『迄今为止发布的网络攻击能力最强的开源权重模型』。」
📊 Article Meta
AI Screening: 88
Source: Anthropic Research
Author: Anthropic
Category: 人工智能
Language: 英文
Read Time: 10 min
Word Count: 2494
Tags:
AI 与智能应用 , AI Agent , 开放权重模型 , 大语言模型 (LLM) , AI 安全与对齐
路过