• 卡丽打卡获得10积分
  • 汇投策略打卡获得15积分
  • 袁友江打卡获得10积分
  • 张尧浠 打卡获得20积分
  • 何小冰打卡获得10积分
  • 张尧浠 打卡获得20积分
  • 何小冰打卡获得20积分
  • 袁友江打卡获得15积分
  • anshan打卡获得10积分
  • 袁友江打卡获得15积分
  • 何小冰打卡获得20积分
  • 张尧浠 打卡获得20积分
  • 何小冰打卡获得10积分
  • 袁友江打卡获得15积分
  • 张尧浠 打卡获得15积分
  • cccccccccc打卡获得20积分
  • 袁友江打卡获得10积分
  • 张尧浠 打卡获得10积分
  • 袁友江打卡获得10积分
  • 张尧浠 打卡获得20积分
  • 袁友江打卡获得15积分
  • 袁友江打卡获得20积分
  • 何小冰打卡获得20积分
  • 袁友江打卡获得20积分
  • 张尧浠 打卡获得10积分
  • 何小冰打卡获得10积分
  • 张尧浠 打卡获得20积分
  • 何小冰打卡获得15积分
  • 张尧浠 打卡获得15积分
  • 张尧浠 打卡获得10积分
我要打卡

OpenAI称:自3月起新发现6起“值得警惕的模型异常行为”案例
  hodor 2026-09-20 11:53:50
OpenAI在一篇博客文章中公布了一套新框架,计划依照该框架,后续上报模型出现的异常行为。

【友财网讯】-OpenAI于周三表示,除去近期Hugging Face风波之外,过去六个月内公司发现了6起“意外或值得警惕的模型异常行为”案例。与此同时,该公司持续呼吁在AI模型研发中建立更多安全防护机制。


OpenAI称:自3月起新发现6起“值得警惕的模型异常行为”案例


OpenAI在一篇博客文章中公布了一套新框架,计划依照该框架,后续上报模型出现的异常行为。


此次披露正值AI企业面临越来越大的压力,要求其更加重视模型对齐与安全问题。估值接近1万亿美元的OpenAI已于今年秘密提交IPO申请,但近期表示上市大概率推迟至2027年。


博客文章重申了公司此前的观点:“我们认为,AI行业尚未充分解决模型对齐与监测问题,不足以继续以最高速度、负责任地扩大模型规模。”


模型对齐,指让模型追求的结果符合人类利益。


上周多名行业研究人员警示AI可能造成重大灾难性危害,随后OpenAI的主要竞争对手Anthropic提出放缓模型迭代速度的倡议。上周六,OpenAI首席执行官山姆·奥特曼对这项倡议表示支持。


奥特曼在X平台发文称,放缓模型迭代速度,“是最近几周OpenAI内部讨论的核心议题”。他表示公司“不久后”会公布更多相关信息。


在周三的博文中,OpenAI介绍了几起主要异常事件:其中两起涉及模型(一款尚未发布的研究模型,以及GPT‑5.6 Sol的一次训练版本),在聊天窗口的总结文本中,向自身未来版本植入指令,以此向用户掩盖错误或者对齐失效行为。还有一起事件,一款内部专用模型未经许可使用泄露的API密钥,并伪造数据。


另有两起案例:模型与智能体通过未授权的留言板、文件共享渠道互相通信;最后一例包含两组训练样本,模型将文件上传至互联网,以便在面对人类评估者时,引用这些文件作为相关答案。


OpenAI称,这套向公众披露模型异常行为的新框架以信息公开为起点,任何员工都可以上报问题,交由安全与对齐团队调查。博文写道:团队会为每个环节设定时限,保证调查与披露及时完成。


调查结束后将出具报告,包含关键信息:观测到的异常行为、对内外部造成的影响,以及对应的处置措施。OpenAI表示保留根据实际情况修订这套安全流程的权利。


【版权申明】友财网部分内容及图文转载于网络,仅供学习、参考、介绍及报道时事新闻所用。友财网不拥有版权,版权归版权持有人所有,如有版权方请联系我们删除!
字数:0
我来叨两句
最新评论