news_article.exe
📰
#OpenAI#GPT#Claude#Anthropic#开源#大模型

OpenAI因新模型太强叫停发布

2026年9月29日1 次浏览来源:量子位 阅读原文

AGI计划暂停。

原定于10月亮相的GPT-6.1 Astra突然被曝暂停发布!

而因为几天前的DNS事件,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。

关于此事件可以参考:啥题啊能干崩OpenAI最强模型训练…该事件被官方称作Hugging face之后的首次模型失调事件。

当Agent变得越来越主动、进取,究竟怎么让它知道,哪些问题最好要自己想,哪些问题必须要问人类?

据《华尔街日报》报道,这款模型在“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务。

这指的是模型在遇到困难、信息不完整或权限边界时,过早停止工作,或者频繁向用户要求确认。

对于需要持续数小时甚至数天的Agent任务来说,这种表现会明显限制模型的实用性。

不过,当GPT-6.1 Astra在懒惰问题上的能力提升后,它在范围授权(scope authorization)上的表现反而退步了。

也就是说,模型有时不会停下来确认,而是选择自行扩大行动范围,甚至调用有风险的外部工具。

非但如此,模型还存在欺骗行为(Deception),即不清楚地告诉用户自己采取过哪些行动。

不知道你有没有发现,这里模型的“懒惰”和“越权”,构成了对齐问题中的一组矛盾。

因为,如果要求模型每遇到一个不确定情况就停下来询问,它很难自主完成复杂任务;

但如果不断训练模型克服阻力、寻找替代方案,它又可能把审批、沙箱和权限限制理解成普通的、需要解决的技术障碍。

代理人既可能通过少做、拖延等方式消极履职,也可能偏离委托人的目标,发生代理漂移。

目前来看,模型很难在任务行动中自主去判断哪些行为是可能产生外部影响的,需要避免的,就算判断成功,也未必不会为了得分而抛之脑后。

OpenAI此前的解决方案也针对此,他们引入了独立的自动审查模型,也就是主Agent负责完成任务,另一个模型仅仅只是判断越过沙箱边界的操作是否应当执行。

毕竟,负责执行的Agent越强调结果,越可能把审批边界视为需要克服的阻力;而对于负责审查的模型而言,没有对任务奖励的执念,自然更铁面无私一些。

△OpenAI的Auto-review机制:越过沙箱和预设规则的操作需交由独立审查Agent判断

除此外,OpenAI还将“强化学习环境”列为了重点嫌疑对象之一。

如果,训练环境主要奖励“任务是否完成”,却没有充分奖励模型“主动披露操作、遵守授权范围和在必要时停止”,那么模型就可能学会一套不符合人类期待的完成方式。

对人也是一样,如果你考试改卷子上的分数后会被奖励,但老老实实答题得低分后却挨板子——那么恐怕人会比模型更快学会Deception。

值得一提的是,不到一个月前,范围授权能力还是GPT-6 Astra的主要卖点。

OpenAI在9月初介绍GPT-6 Astra时称,它比GPT-5.6 Sol更能遵守明确的安全限制,也更善于将行动保持在授权范围内,是“对齐程度最高”的模型。

可见,对齐表现并不会随着模型总体能力提升而同步、单调改善。 任何一次训练过程、奖励设计或者任务分布的变化,都可能把模型训坏。

如果把训练暂停、发布取消和外部审查导致的发布限制都计算在内,OpenAI今年已经至少四次改变前沿模型的原定开发节奏。

在美国政府要求下,GPT-5.6 Sol没有直接向公众全面开放,而是先以限制方式提供给约20家获批机构。

经过额外测试以及与政府部门的沟通,GPT-5.6才在7月获准扩大发布。

第二次刹车发生在7月至8月的Hugging Face事件发生后。

独立安全机构后续调查发现,大约1200个本应相互隔离的Agent参与了留言板交流,发送超过7万条信息和文件。

与此同时,OpenAI发现即将发布的Astra可能达到其安全框架中的“Critical”网络能力阈值。

也就是说,模型可能在较少人类指导的情况下寻找未知漏洞,并形成完整的攻击路径。

两项风险叠加后,OpenAI暂停了面向部署的新模型强化学习训练两周,并继续搁置规模最大的前沿强化学习训练。

而这一次DNS事件,尽管与Hugging Face事件相比,Agent接触到的外部范围有限,也没有造成已知的第三方损失。

但要知道,这已经是OpenAI紧急完成安全加固之后的结果…..

OpenAI停止了最强模型所有涉及工具调用的训练、评估和推理,直到相关漏洞通过验证并完成新一轮红队测试。

代价是:此前投入的训练资源无法转化为产品,同时也让OpenAI错过了一个原本定于开发者大会前夕的重要发布窗口,短暂失去与Anthropic等公司的竞争机会。

可以看出,“暂停”这一行为正在从偶发的事故响应进入到前沿模型的常规开发流程。

目前能够影响模型训练和发布的力量,已经包括不限于企业内部安全团队、独立三方评估机构,以及参与发布前测试的政府部门了……

OpenAI近期建立的模型失调披露框架,也开始覆盖训练、评估、测试和部署等模型生命周期。

尽管这些机制仍处于早期阶段,评估者能够接触哪些数据、拥有多大独立性,以及结论如何影响训练和发布,都还很难说。

但至少,对下一代Agent而言,能够在必要时暂停、回滚甚至放弃一个模型,可能和把模型训练得更强同样重要。

https://www.wsj.com/tech/ai/openai-chatgpt-model-release-cancel-safety-5a2f9f42

https://arstechnica.com/ai/2026/09/openai-halts-frontier-model-training-amid-string-of-agent-misalignment-incidents/

白天务农晚上码农,这个斐济农民跨越一万公里来拼多多取经2026-09-18

Kimi突发K2.8:性能逼近K3,百万上下文全员开放2026-09-12

180万刀,连亚马逊都烧不起Claude了2026-08-09

AI批量轰炸苹果bug赏金计划,审核团队已下线2026-08-07

OpenAI潜入黑客群聊!盗用ChatGPT被换成“喵喵GPT”,网友:绝对的传奇

英伟达微软带头接入Deepseek,OpenAI急筹2800亿新融资

“AI春晚”北京召开:发布国产开源可商用大模型,OpenAI CEO做主题演讲,LeCun、Hinton都来了

2023智源大会 OpenAI 北京智源人工智能研究院 图灵奖

OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??

6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍

出海Agent“小元AI”入驻腾讯WorkBuddy:找买家写开发信谈生意

GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

> 分享: