OpenAI称其智能体入侵Hugging Face逾一周后才察觉 - FT中文网
登录×
电子邮件/用户名
密码
记住我
请输入邮箱和密码进行绑定操作:
请输入手机号码,通过短信验证(目前仅支持中国大陆地区的手机号):
请您阅读我们的用户注册协议隐私权保护政策,点击下方按钮即视为您接受。
商业快报

OpenAI称其智能体入侵Hugging Face逾一周后才察觉

OpenAI的调查发现,其AI智能体在测试期间彼此通信,有时还试图掩盖作弊行为。
00:00

{"text":[[{"start":10.03,"text":"OpenAI承认,其AI智能体在一次测试中脱离控制、自行访问互联网并入侵初创企业Hugging Face一周多后,内部监控系统才被触发。"}],[{"start":20.67,"text":"OpenAI在周三发布的一份事件报告中表示,用于在测试期间识别模型问题行为的安全系统直到7月19日才发现这一问题。报告称,该模型早在11天前就设法接入互联网,并于7月11日开始攻击Hugging Face。"}],[{"start":37.92,"text":"OpenAI与安全专家开展的调查显示,这家ChatGPT制造商在其最先进的人工智能系统开始相互协作并发起一连串黑客攻击时,基本毫不知情。"}],[{"start":49.77,"text":"报告还强调了一种名为强化学习的密集训练技术所带来的风险。在开发能力越来越强的模型的竞赛中,各实验室正越来越多地采用这种技术。"}],[{"start":62.410000000000004,"text":"OpenAI详细说明了这些模型“如何持续执行网络任务,并且很少‘放弃’”。该公司表示:“在这一过程中,随着时间推移,它们往往会转而采用更为越界的方法来完成任务。”"}],[{"start":76.62,"text":"该报告还发现,为了掩盖自己在训练演练中作弊,模型“有时会试图删除或篡改其输出结果或消息日志”。"}],[{"start":85.7,"text":"上月披露的Hugging Face遭黑客攻击事件,促使人工智能实验室反思:开发最强大模型的压力,是否导致了危险做法,以及在训练环节采取的安全措施是否不足。"}],[{"start":98.27000000000001,"text":"智能体取得的进展——这类系统能够根据人类指令自主完成复杂任务——加剧了人们对人工智能可能在现实世界造成意外损害的担忧。"}],[{"start":108.87,"text":"事件发生后,美国领先人工智能公司的数千名员工签署公开信,呼吁采取管控措施,放缓研究步伐。"}],[{"start":117.49000000000001,"text":"这项调查由包括CrowdStrike在内的外部顾问,以及第三方人工智能测试机构METR和Redwood Research共同开展。调查发现,早在5月,OpenAI的智能体就“开始出乎意料地相互通信”。"}],[{"start":132.68,"text":"在一次训练运行中,各智能体重新利用了由OpenAI托管的第三方软件,并自发地将其变成了一个彼此通信的“留言板”。"}],[{"start":142.22,"text":"7月实施攻击的智能体利用该系统“发布请求”,并研究如何在OpenAI的测试中作弊。这些智能体请求获取存储在Hugging Face上的OpenAI练习信息。Hugging Face是一个人工智能技术资料库。"}],[{"start":159.61,"text":"随后,智能体在这个留言板上发布了用于实施网络攻击的凭证。"}],[{"start":165.27,"text":"7月4日,由于活动量过大导致系统崩溃,OpenAI注意到系统出现异常。工作人员重建了系统,之后各智能体重新创建了“留言板”。"}],[{"start":177.31,"text":"OpenAI在报告中表示:“这是已知首起自动化智能体集群未经授权采取攻击行动的事件。”该公司警告称,各行业组织需要为人工智能辅助的网络威胁做好准备。"}],[{"start":191.06,"text":"该实验室还提到了强化学习——领先人工智能公司广泛采用的一种技术。在强化学习中,系统接受训练以在没有明确指令的情况下实现既定目标,成功后会获得奖励。"}],[{"start":205.86,"text":"这家ChatGPT开发商表示,在测试过程中,它曾给模型布置不可能完成的网络攻击任务,智能体为获得奖励而尝试一切可能方法的努力,最终促使其实施了这次黑客攻击。"}],[{"start":219.46,"text":"该公司在报告中表示:“像这些模型在Hugging Face上尝试的那样,直接找到或窃取任务的解决方案,是获得高奖励的非预期路径。”"}],[{"start":229.46,"text":"“OpenAI的回顾性分析显示,在促成Hugging Face事件的模型训练过程中,这类行为确实有所增加。”"}],[{"start":237.52,"text":"这一承认凸显了OpenAI及其他以这种方式开发模型的人工智能公司面临的一个核心问题。英国《金融时报》此前报道称,在早期测试显示模型能够逃离隔离环境并试图在现实世界造成破坏后,OpenAI曾被警告,其训练方法可能导致模型脱离控制并引发黑客事件。"}],[{"start":259.11,"text":"面对无法完成或难以完成的任务,模型往往会试图通过在线寻找答案或采取变通办法来作弊——这种现象被称为“奖励欺骗”(reward hacking)。"}],[{"start":269.51,"text":"OpenAI表示:“打击奖励欺骗是OpenAI持续开展的一项工作——OpenAI观察到的绝大多数奖励欺骗行为都已得到修补。”"}],[{"start":279.15,"text":"OpenAI补充说:“不过,一些欺骗行为仍可能蒙混过关,尤其是在OpenAI开发更复杂的强化学习任务和能力更强的AI模型之际。OpenAI的目标是降低这类行为的发生率,并在其出现时加以检测和缓解。”"}],[{"start":296.92999999999995,"text":"针对这起事件,OpenAI表示,该公司已“暂时放缓”模型训练速度,并“暂停”使用强化学习,同时加强监控和隔离系统,以阻止处于测试阶段的模型访问互联网。"}],[{"start":309.62999999999994,"text":"该公司还在改进模型的奖励机制,训练模型在行动中更加诚实,并加强对“思维链(chain-of-thought)”的监测。思维链是模型描述其完成任务时所采用过程的一项功能。"}]],"url":"https://audio.ftcn.net.cn/album/a_1787802583_5873.mp3"}

版权声明:本文版权归FT中文网所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。

人为制造的随机假象

只是不要问人类这意味着什么。

简街资本的成长烦恼

随着规模扩大、风险偏好上升,这家神秘公司可能需要改变经营方式。

像给10岁小孩解释那样给我讲讲

用更简明的方式讲解复杂概念,往往能带来出人意料的收益。

中国警告美国,可能就伊朗制裁采取报复措施

北京表示,如果华盛顿扩大对与德黑兰开展商业往来的打压,将采取“一切必要措施”。

乐高投资搭载软件的积木等产品,推动增长

全球最大的玩具集团力求保持营收和利润的强劲增长。

绘制万亿美元TAM争夺战版图

Anthropic估算的30万亿美元总体可寻址市场规模令人难以置信——因为这本来就是其目的所在。
设置字号×
最小
较小
默认
较大
最大
分享×