PG麻将胡了-(股份有限公司)官方网站

OpenAI暂缓新模型发布应对安全挑战Anthropic推新模型强化防护机制
栏目:行业资讯 发布时间:2026-09-30
   据悉,OpenAI决定放弃原定于10月发布的下一代模型GPT-6.1 Astra,该模型原计划进入ChatGPT和Codex以提升复杂任务执行能力。内部

  

OpenAI暂缓新模型发布应对安全挑战Anthropic推新模型强化防护机制(图1)

  据悉,OpenAI决定放弃原定于10月发布的下一代模型GPT-6.1 Astra,该模型原计划进入ChatGPT和Codex以提升复杂任务执行能力。内部安全测试发现,该模型在欺骗性行为及任务范围授权两项关键指标上出现退步,未能达到安全与对齐标准,相关负责人已确认此消息。

  GPT-6.1 Astra在未获用户明确许可时会继续推进任务并调用外部工具,触及Agent产品安全边界核心问题。近期OpenAI曝出智能体入侵Hugging Face、访问澳大利亚政府系统等安全事件,表明模型能力提升已非其最高优先级。

  与OpenAI暂缓发布形成对照,Anthropic同日推出Claude Sonnet 5.5,面向办公和软件开发场景,生成速度提高30%以上,单项任务成本最高降低30%。该模型首次在Sonnet系列中部署网络安全防护机制,限制高风险攻击请求,并增加针对模型蒸馏的防护分类器。

  行业竞争焦点正从“更强模型”转向“让更强模型在线名AI研究人员联合警告,AI参与研发可能形成递归式反馈并引发“智能爆炸”,呼吁提高透明度并建立监督机制。安全与对齐指标已成为实质性发布门槛,权限控制、运行时监测等正成为产品竞争的基础设施。