
Anthropic近日宣布,将向符合条件的客户开放此前仅限内部使用的Claude安全工具套件,包括Skills、Claude Harness和威胁模型构建器等。这些工具此前在Claude Mythos Preview中发挥了关键作用,如今作为Project Glasswing项目的一部分向更广泛的安全研究社区开放。
此次开放的工具套件涵盖了AI安全研究的多个核心环节。Skills工具可以帮助研究者定义和测试AI模型在特定场景下的行为边界,Claude Harness则提供了一套标准化的模型评估框架,而威胁模型构建器能够自动生成针对AI系统的攻击场景,帮助团队在部署前发现潜在风险。Anthropic还同步发布了一个开源漏洞披露仪表板,集中展示了Mythos Preview期间发现的所有安全漏洞。
Project Glasswing的扩展计划也在推进中。Anthropic表示将把该项目开放给更多合作伙伴,这意味着未来将有更多安全研究人员能够直接参与Claude模型的安全测试和改进工作。这种开放策略在AI行业中并不多见,大多数公司倾向于将安全工具作为内部资产严格保密。
从行业影响来看,Anthropic的这一举措可能会推动整个AI安全领域的标准化进程。当更多研究者能够使用统一的工具进行安全评估,不同模型之间的安全性对比将变得更加客观和透明。这对于监管机构制定AI安全标准也具有重要的参考价值。
总体而言,Anthropic开放安全工具的举措体现了AI安全研究的开放共享理念。在AI能力快速发展的当下,只有让更多力量参与安全研究,才能真正构建起可靠的AI防线。