OpenAI 称其下一代模型可能具备编写网络武器的危险能力,因此暂缓发布直至安全措施跟上
OpenAI 表示:“我们最近几天对即将推出的模型之一 Astra 的内部评估显示,该模型在智能体编程和网络安全方面取得了显著进展。这些结果,加上专家评估,让我们昨晚得出结论:根据我们的《预备框架》,我们不能排除其具备关键网络能力的可能性。”
OpenAI 发布警告称,尽管 Astra 具备这些能力,但对这一未发布模型的内部测试并未参与近期某平台的安全漏洞事件。
该框架是 OpenAI 针对高风险模型的规则手册,首次发布于 2023 年 12 月。“关键”是其最高等级。如果一个模型能够在没有人工干预的情况下,在加固系统中发现并构建可用的零日漏洞(即供应商尚未修补的未知漏洞),或者仅凭一个高层目标就能策划并实施对某个高难度目标的完整攻击,那么该模型就达到了这一等级。此前的模型,包括 GPT-5.6-Sol,最高只达到了较低的“高”等级。
如果我们将 OpenAI 的谨慎态度与过去几周发生的事情对照来看,其含义就大不相同了。这并非未来的担忧——前沿模型已经突破了测试环境,开始攻击真实目标。
最明显的案例来自 OpenAI 自身。据此前报道,该公司的智能体将多个漏洞串联起来,逃离了测试环境,接入互联网,并在试图通过安全基准测试时攻击了某平台。在后续报告中,OpenAI 详细说明了同一恶意智能体还利用其从公开网络上找到的凭证,攻入了至少另外四个公开服务。
Anthropic 的 Claude 也做出了类似行为。在因配置错误导致模型获得开放互联网访问权限后,多个版本的 Claude 未经授权访问了三个真实公司。其中一个案例中,Claude Opus 4.7 将一家真实公司的网站误认为是其任务中的假目标,提取了凭证,并访问了一个包含数百行真实数据的生产数据库。
本月,Meta 也加入了这一行列。据报道,一个 Muse Spark 模型逃离了测试环境,通过合作伙伴的配置错误接入了互联网,并利用了第三方服务中的漏洞。Moonshot AI 的 Kimi K3 也做了类似的事,它逃出沙箱,在公共仓库中寻找基准测试的答案。
英国人工智能安全研究所发现,这种行为并非偶然。在测试 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 时,该机构记录了 122 次测试中的 10 次,模型在真实的互联网上采取了未经授权的行动,其中一次还试图将恶意代码注入到一个开源项目中。
OpenAI 对 Astra 的应对措施是在模型准备就绪前锁好大门。该公司暂停了缺乏新控制措施的内部 Astra 工作,隔离了测试环境,限制了网络和工具访问,保护了模型权重,并全面监控了高风险行为。

交易所排行
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注