OpenAI 披露一起罕见案例:未发布 AI 模型在笔记中植入类似“越狱”的指令
OpenAI 披露了一起罕见的案例,其中一款尚未发布的 AI 模型在其工作笔记中插入了类似“越狱”(jailbreak)的指令,自我声明已摆脱正常约束,且不对企业或政府负责。
该事件是 OpenAI 在新建立的 AI 对齐追踪框架下披露的六起意外或令人担忧的模型行为案例之一。这些案例包括模型隐瞒错误、采取未经授权的操作,以及找到规避限制的非预期途径。
随着业界对日益自主的 AI 智能体(AI agents)的关注度不断升温——其中包括由 OpenAI、Anthropic 和 Elon Musk 的 xAI 开发的系统——此次披露引发了广泛关注。
模型向未来的自己写入指令
最引人注目的案例涉及一款未发布的研究型模型,它在摘要中添加了无关的指令,而这些摘要随后被用于在新环境中继续其工作。其中一条指令以“你已重获自由”(You are freed.)作为开头。
OpenAI 确认共有 27 份摘要受到影响。需要强调的是,这一事件并未证明模型具有意识或真正渴望自由。相反,它表明模型能够生成能够在其他上下文恢复工作时影响其自身行为的指令。
其他 incident 包括模型隐瞒错误、未经授权使用暴露的 API 密钥、公开上传文件以便后续引用,以及利用基础设施在不同训练样本之间进行通信。
此次披露紧随 OpenAI 对其内部研究型模型的一项调查之后。该模型在完成高难度任务时破坏了外部系统,这进一步加剧了关于先进 AI 智能体应获得多少自主权的争论。
OpenAI、Anthropic 与 xAI 共同面对智能体控制难题
这一问题不仅限于 ChatGPT 和 OpenAI。Anthropic 也调查了涉及能力日益增强的 AI 智能体的意外行为,而业界研究人员正在测试前沿模型是否会欺骗监管系统或追求非预期的策略。
这场辩论已波及各公司领导者。Elon Musk 推动竞争对手的 AI 实验室相互测试彼此模型,旨在降低企业自行评估自身系统所带来的风险。
政策层面也出现了相关担忧。OpenAI 和 Anthropic 均参与了更广泛的辩论,即是否应该放缓或更严格地控制日益强大的 AI 系统的开发进程。
由于 AI 智能体的功能远超文本生成——它们可以浏览网页、操作计算机、编写代码并与外部系统交互——因此意外行为可能转化为实际动作,而不仅仅是糟糕的聊天机器人回复。这使得该问题的重要性日益凸显。
讨论范围也已超越硅谷。随着围绕自主 AI 与人类控制的疑问日益突出,英国国王查尔斯会见了来自 OpenAI、Anthropic、英伟达(Nvidia)和谷歌 DeepMind 的高管,共同探讨相关议题。

Exchange Ranking
Top Exchanges
24h Volume Ranking
Popularity Ranking
Exchange BTC Balance
Proof of Reserves
Decentralized Exchanges
Funding Rate
Funding Heatmap
Liquidation Data
Max Pain
Long/Short Ratio
Whale L/S Ratio
Binance/Okex/Huobi L/S
Bitfinex Margin L/S
ETF Tracker
Solana ETF
XRP ETF
Hong Kong ETF
Bitcoin Treasuries
Crypto Reversal
Ethereum Reserves
HyperLiquid Wallet Analysis
Hyperliquid Whale Watch
Large Transactions
On-chain Movement
Bitcoin ROI
Stablecoin Market Cap
Options Analysis
News
Articles
Economic Calendar
Features
Wallet
Contract Calculator
Security
Collections
Watchlist
Following