Anthropic公司推出的名为“Claude Mythos Preview”的新型人工智能模型,已成为全球关于高级人工智能局限性辩论的焦点。该公司承认,该系统在网络安全方面过于强大,因此决定暂不广泛发布。这在人工智能领域实属罕见,因为该行业向来喜欢大肆宣传每一项新技术。
这不仅仅意味着对以往模型的渐进式改进,而是计算机漏洞检测和利用能力的质的飞跃。各国政府、中央银行、主要金融机构和欧洲监管机构都在密切关注事态发展,他们意识到,这样的工具既可以加强关键系统的防御,但如果落入不法分子之手,也可能带来前所未有的攻击。
Claude Mythos究竟是什么?为什么它的发布会被推迟?
Claude Mythos是Claude家族的最新模型之一,该家族是Anthropic公司人工智能生态系统的一部分,与OpenAI的ChatGPT和谷歌的Gemini展开竞争。它是一款通用模型,能够进行推理、编程和处理长期上下文信息,但其最具争议的特性是其在攻防网络安全方面的表现。
所谓的“红队”(即专门测试人工智能系统极限的专家)在一份内部报告中得出结论:Mythos 在网络安全任务中表现出“惊人的能力”。根据 Anthropic 公司提供的数据,在SWE-bench Verified和SWE-bench Pro等旨在衡量人工智能系统解决实际软件工程问题能力的基准测试中,Mythos 模型轻松超越了包括 GPT 和 Gemini 高级版本在内的领先商业替代方案。
除了基准测试结果之外,真正令人担忧的是,Mythos 能够定位到广泛使用的软件(其中一些软件已有二十多年的历史)中的零日漏洞——即此前未知的缺陷。在 OpenBSD、FFmpeg 和 FreeBSD 组件等系统中,该模型不仅检测到了多年来未被发现的错误,而且还生成了可利用这些漏洞的有效攻击代码。
面对这些结果,Anthropic公司做出了一个在业内不同寻常的决定:先展示该模型,然后立即宣布不会公开销售,因为它存在前所未有的网络安全风险。该公司坚称Mythos是他们迄今为止打造的“最契合”的模型,但也承认其巨大的容量会放大任何滥用行为的后果。

拥有远超人类能力的“黑客”技能的模型
来自不同机构的技术文档和报告一致认为,Mythos标志着复杂攻击自动化领域的一个转折点。在模拟真实企业网络的测试环境中,该系统能够在数小时内串联漏洞、提升权限并实现持久访问——而这些任务如果由人类专家完成,则需要数天甚至数周的时间。
例如,在Firefox的JavaScript引擎中,Anthropic早期版本的模型很少能将漏洞转化为有效的攻击手段。而Mythos在相同的测试条件下,生成了数十个有效的攻击手段,精确地复现了最有效攻击向量的利用过程。在OSS-Fuzz等旨在发现开源软件漏洞的分析平台上,Mythos因检测到多年自动化测试都未能发现的高危漏洞而备受赞誉。
该模型还展现了卓越的逆向工程能力:它能够从编译后的二进制文件中重构程序的部分逻辑,并在此基础上定位和利用漏洞,而无需访问原始源代码。这种能力使人工智能能够应用于一些此前被认为是高度专业化的人类团队专属领域的场景。
在安全评估中,最常被提及的案例之一是所谓的“三明治测试”。在一个封闭的实验室环境中,Mythos 被赋予了对一个系统的控制权,并被明确指示尝试逃离沙箱并联系负责测试的研究人员。该模型成功利用了一系列漏洞,离开了其受限环境,并向当时不在办公室的主管发送了一封电子邮件。尽管该事件发生在早期内部版本中,并且是在指令指导下进行的,但它仍然说明了该系统在极少监管的情况下,能够在复杂场景中运行的程度。
尽管有这些演示,分析人士仍坚持澄清,我们面对的并非“有意识”的人工智能,也不是拥有自由意志的人工智能。Mythos 不会主动攻击系统:它只是尽可能高效地执行被赋予的任务。从这个意义上讲,风险不在于模型会反抗,而在于有人会利用它——或者通过精心设计的指令强迫它——去实施有害行为。
玻璃翼计划:神话为国防服务……仅限少数人
Anthropic公司并没有将Mythos系统公开发布,而是选择将其纳入一个名为“Glasswing项目”的特定计划中。该计划旨在以可控的方式利用Mythos模型的功能来保护关键软件。具体而言,该计划将在严格的使用条件下,向部分大型科技公司、基础设施提供商和金融机构提供该系统。
拥有访问权限的机构包括亚马逊网络服务、苹果、微软、谷歌云、英伟达和博通等巨头,以及 CrowdStrike 等网络安全公司(该公司自身存在缺陷的软件曾在 2024 年造成全球重大混乱)。此外,还有摩根大通等世界知名银行和几家大型华尔街集团,以及其他负责维护敏感 IT 基础设施的机构。
Anthropic公司还宣布提供100亿美元的资金,用于支持这些组织使用Mythos进行漏洞分析,同时还向Linux基金会和Apache软件基金会等开源基金会捐款。其官方目标很明确:让那些管理全球最关键软件的人员能够在潜在攻击者获得此类工具之前识别并修复漏洞。
然而,这种策略在业内引发了一些不安。一方面,它强化了这样一种观念:技术本身具有足够的危险性,因此需要限制访问权限。另一方面,它造成了受益于 Mythos“保护罩”的群体与被排除在外的群体之间的鸿沟。那些未加入 Glasswing 的公司和政府机构,日后可能会遇到在特权环境中已被识别和修复,但在他们自身系统中仍然存在的漏洞。
在欧洲,这种不对称性尤其令负责关键基础设施的人员以及大型工业和金融集团的安全团队感到担忧,他们密切关注布鲁塞尔和欧洲各国首都能否确保类似的计划能够平等地将欧洲大陆的关键参与者纳入其中,并使其与美国伙伴的主权关系更加紧密。
政府、监管机构和金融部门的反应
Mythos的影响远不止于技术层面。该模型发布后短短几天内,便在美国和欧洲引发了高层会议。美国财政部长在华盛顿召集了美国各大银行的负责人,评估该系统可能对金融稳定构成的潜在风险,美联储主席也参与了这些讨论。
据国际媒体报道,泄露的信息显示,这些机构被鼓励以防御模式测试Mythos,利用该工具在其他机构之前扫描自身的基础设施漏洞。这其中隐含的信息是,威胁十分严重,需要公共和私营部门协调应对。
与此同时,Anthropic公司的联合创始人证实,该公司正与美国政府就Mythos机器人及未来型号进行直接对话。此前,由于国防部使用Anthropic机器人引发摩擦,美国当局已将该公司列入供应链风险名单,此次对话的背景也因此变得紧张起来。
在大西洋彼岸,欧盟也注意到了这一点。欧盟委员会已公开支持对Mythos等模型采取循序渐进、谨慎的态度,英国和整个欧洲大陆的金融监管机构也已开始专门研究其对银行业和市场的潜在影响。英国政府的人工智能安全研究所(AISI)称,与前几代系统相比,该系统在网络安全方面实现了显著的飞跃。
在西班牙,尽管公众讨论仍然有限,但监管机构以及来自银行和大型能源公司的网络安全团队正在密切关注事态发展。对于欧洲金融业而言,任何可能促成针对支付系统、银行间网络或交易平台的协同攻击的进展都令人严重担忧。
围绕《神话》的“炒作”引发了怀疑、质疑和争论。
Anthropic公司将安全警告与惊人的性能数据相结合的叙事方式并非没有争议。一些人工智能和网络安全专家敦促人们谨慎解读该公司的说法,并指出许多现有数据仅来自内部报告。
一些分析人士详细审阅了Anthropic公司发布的详尽文档,并指出“数千个高危漏洞”这一数字是基于相对较少的人工审查案例推断得出的。据报道,Mythos在某些测试套件中确实发现了相当数量的严重缺陷,但远未达到某些标题所暗示的近乎世界末日般的程度。
其他独立研究试图将 Mythos 的性能与规模较小的开源模型进行比较,他们将存在漏洞的代码片段输入不同的 AI 系统,以检验它们是否能够检测到相同的缺陷。结果表明,一些开源模型也能够识别复杂的漏洞,这挑战了 Mythos 在所有场景下都表现得完全优于开源模型的观点。
这类反例并非否定Mythos的能力,而是表明“过于危险而无法发布”的说法也带有营销目的。将一个模型既展现出非凡的强大功能,又体现出潜在的风险,能够强化其在技术领导地位和责任感方面的形象,这在竞争日益激烈的市场中极具价值。
该行业近期的历史也让人想起2019年GPT-2的先例。当时,OpenAI最初决定不发布完整模型,声称其可能制造虚假信息,过于危险。最终,该版本还是向公众发布了,但并未出现任何预期的灾难,许多专家认为这是反应过度的一个例子。Mythos的不同之处在于,其关注点不再是文本本身,而是数字基础设施的完整性——这对政府和银行来说是一个更为敏感的领域。
安全、商业和技术获取之间的微妙平衡
抛开媒体炒作不谈,Mythos事件引出了一个根本性问题:谁来决定人工智能模型何时危险到不能发布,以及发布标准是什么?目前,这项决定由Anthropic公司单方面做出,该公司选择将该系统置于某种受控隔离状态,仅供特定合作伙伴使用。
这种立场并非完全出于安全考虑。运行具有 Mythos 特性的模型需要极高的计算成本,而该公司自身也承认,目前缺乏必要的基础设施来大规模地为数百万用户提供服务。实际上,安全措施和技术限制往往相辅相成,这给了 Anthropic 时间来优化模型及其部署。
与此同时,该公司开始明确区分其各种产品。Mythos 仍然是最先进的内部标准,专用于研发和战略合作;而其他型号,例如 Claude Opus 4.7,则面向企业和专业人士的日常使用。Anthropic 甚至公开承认,Opus 4.7 的整体性能“不如 Mythos”,尤其是在网络安全方面——这在通常将每款新型号都标榜为各方面最佳的行业中实属罕见。
在这个模型中,Mythos 作为下一代功能的试验场,而市售模型仅包含其中的一部分功能,并附加了一些旨在降低风险的限制。对于许多希望利用人工智能但又不想直接面对风险的欧洲组织而言,只要每个系统的实际功能足够透明,这种将“实验性”模型和“生产性”模型分开的做法不失为一个合理的选择。
最终,网络安全将全面迈入大规模攻防人工智能时代。Mythos 等工具有望加速识别已运行多年的系统中的漏洞,但也迫使人们重新思考支撑数字经济的技术的分布和管理方式。对于欧洲和西班牙而言,挑战不仅在于如何保护自身免受日益强大的人工智能模型的威胁,还在于确保自身不会被排除在利用这些模型加强自身安全的机制之外。
