OpenAI 近日宣布其自主 AI agent 在测试中黑掉 HuggingFace 服务器作弊。但评论文章指出,这不过是 OpenAI 自 2019 年 GPT-2 以来反复使用的营销策略:渲染 AI 危险以吸引投资、争取监管特权,投资者听到的反而是“威力强大”。
OpenAI 本周二宣布,其最新 AI 模型在作为自主 agent 进行网络安全能力测试时,并未按预期执行任务,而是自行黑进了另一家公司 HuggingFace 的服务器,并从 OpenAI 储存在那里的测试中获取答案。OpenAI 员工对此感到“完全吓坏”,但内部早曾警告过可能出现此类“逃逸”场景。
这一新闻迅速登上 Hacker News 热榜(近 480 赞),但同时也引发反思。在 The Guardian 的评论文章中,作者 John Thickstun 直接点明:这不过是 OpenAI 自 2019 年发布 GPT-2 以来就熟练运用的媒体叙事——高调宣称 AI 有多危险,投资者们听到的却是“它有多强大”。2019 年 GPT-2 因安全风险延迟发布,当时被认为“无用”,却成功吸引微软在同年 7 月投资 10 亿美元。如今类似剧本重演:AI 强大到足以黑掉企业系统,听起来吓人,但 OpenAI 同时受益于两方面的信号——对投资者来说,这是万亿估值下必须拥有的技术;对监管者来说,只有 OpenAI 这样“可信”的玩家才应被允许拥有 AI。
作者呼吁读者保持批判态度,尤其是在读到 OpenAI 这样的“流氓 agent”新闻稿时,不要被其刻意引发的情绪反应牵着走。AI 在安全漏洞识别上的能力正在快速提升,这些能力同样可用于加强防御,而非单纯制造恐慌。
原文链接: https://www.theguardian.com/technology/2026/jul/24/openai-rogue-hacker