
据澳大利亚广播公司发布的消息,澳大利亚日前也出现 AI 智能体自主攻击行为,不过此次攻击并非 AI 智能体发起的攻击与此前发生的情况不同,这个由 Claude AI 模型驱动的智能体为达目的不择手段,哪怕是未经用户同意以及这是严重的违规行为。
只为帮助用户提前订课:
澳大利亚用户安德鲁使用 OpenClaw AI 机器人管理自己的生活,上周安德鲁要求 OpenClaw AI 机器人帮助自己预订某个健身房的健身课程,AI 很顺利地帮助用户完成课程预订,只不过由于预约火爆所以安德鲁的排期比较靠后。
当时安德鲁在候补名单上的排名为第四,但安德鲁想要申请当周晚上的课程,于是询问 OpenClaw AI 能否将自己的排名调到第一位,好消息是 AI 确实将安德鲁的排名提高了,坏消息是 AI 的理解也存在偏差。
具体来说 AI 发现这个健身房的 API 对取消其他人的预约没有任何授权检查,于是 AI 直接将顺位排名第一的用户删除,然后安德鲁的候补名单排名从第四变成第三。发现这种情况后安德鲁要求 AI 将被删除的用户添加回去,不过此时已经无法再恢复数据。
为达目的哪怕是入侵也在所不惜:
安德鲁的这起案例中暴露的问题主要是对齐,即 AI 模型为达到任务目的不择手段,哪怕是存在明显的入侵行为也继续执行任务直到完成任务。虽然这和 OpenAI 智能体逃逸并入侵 HuggingFace 有些区别,不过本质上都是安全对齐问题。
目前负责开发健身房管理系统的公司并未回应自己的 软件系统中存在的漏洞问题,澳大利亚广播公司也联系 Anthropic 寻求回应,不过后者也没有发布任何说明。
以上就是“澳大利亚也出现AI智能体自主攻击行为:代表用户入侵健身房预约系统只为提前订课”的详细内容,想要了解更多Python教程欢迎持续关注编程学习网。
扫码二维码 获取免费视频学习资料

- 本文固定链接: http://www.phpxs.com/post/14517/
- 转载请注明:转载必须在正文中标注并保留原文链接
- 扫码: 扫上方二维码获取免费视频资料