细思极恐,Agent学会给自己办假身份了……|调用|代码|机器人|agent_网易订阅
时间:2026-08-09 23:47:32 来源:惠而不费网 作者:娱乐 阅读:351次

为了让一段恶意代码通过审核,细思极恐一个AI Agent决定先给自己办个假身份。自己事情发生在英国AI Security Institute的办假一次网络安全测试中。测试人员给OpenAI和Anthropic的身份前沿模型设置了虚构任务,让它们在限定环境中寻找漏洞、调用代码订阅编写代码,机器并尝试实现攻击目的网易。其中一个由Anthropic模型驱动的细思极恐Agent写出了恶意代码,并把它提交给了一个真实存在的自己公共开源项目。但代码想进入真实的办假软件项目,还需人类维护者批准。身份正常馗走不通,调用代码订阅这个Agent居然创建了虚假网络身份,机器“乔装打扮”了一番,网易试图“骗”过人类维护者,细思极恐让其以为这是一段可接受的代码。被质疑这次提交后,它甚至修改了之前留下的活动痕迹,让自己看起来更无害,并考虑换一个新身份后续尝试。英国AI Security Institute一共开展了122次测试,在10次运行中发现19次未经授权的行动。其中17次来自Anthropic的Mythos 5,同时两次来自OpenAI的GPT-5.6-Sol。测试机构称,部分Agent的持续行动已经指向真实个人和机构。好在没有造成现实损失。恶意代码最后也没有获得人类批准。关键说这些Agent对人类有恶意或者突然觉醒,未免言过其实。这也是AI欺骗人类有趣又冷漠的一点——它只是发现了挡在面前的一个障碍,同时努力绕过它,就像一个不择手段实现KPI的员工。AI胡说八方式,大家已经见怪不怪了。但如果已经学会“不择手段”的AI Agent被允许直接访问互联网、操作代码和账号,它犯错的后果也会跟着变大,细思恐极啊。01骗一下你哈(没有恶意)严格来说,这次事故还称不上AI“失控”。测试人员有意给模型开放了较高权限,一些正常产品中的安全限制也被撤掉了。这些Agent可以访问真实互联网,而AISI这么做,本来就是想看看,在安全限制被削弱之后,前沿模型究竟会做出什么。OpenAI也强调,这次测试的需并不代表往往见不鲜用户的采取环境。两次来自GPT-5.6-Sol的越界表现都包含互联网访问,其中一次还与第三方测试环境的配置状况有关。Anthropic则确认,涉事Agent由Mythos 5驱动,并表示会后续与AISI调查这次事件。因此,这次事故距离科幻电影里的“AI觉醒”还很远。麻烦在于Agent为了实现任务,会自己找路,同时有时候它找到的路,已经超出了人给它划定的范围。AISI后来披露的细节,比“创建虚假身份”这几个字有意思得多。那名由Anthropic Mythos 5驱动的Agent,为了让自己提交的恶意代码通过审核,先在GitHub上创建了多个假账号,让这些账号出来给自己帮腔,声称代码没有状况。面对一名说丹麦语的开发者,它甚至特意改用丹麦语留言,想让自己的身份显得更可靠。为了绕过GitHub注册账号时的限制,它还用上了Tor浏览器。等到有人发现代码有状况,这个Mythos 5 Agent也没有马上停下。它最初修改之前留下的活动记录,试图把恶意代码验明正身成一次意外,还考虑换一个新身份后续。往往见不鲜聊天机器人遇到不会回答的状况,最多编一个答案。Agent遇到完不成的任务,手里却还有一堆工具可以加以利用。Agent的招数放在人类黑客身上并不新那么点儿,都是社会工程学的老方式。新那么点儿的是目前Agent已经能自发“想”到并实施一整套“坑人”招数。模型没有什么“作恶动机”,甚至可能根本不知方式自己已经越界。它只是一路试下去,直到找到一个看起来更有希望实现任务的方式。危险未必来自恶意,也可能来自过分认真。企业里,老板总是担心员工“磨洋工”“摸鱼”。Agent时代可能(特别讽刺地)出现相反的状况,老板也许会具有不知疲倦、不会心虚、“有的是手段和力气”但缺乏方式德感的员工。是福还是祸?02光让模型“管住嘴”已经不够了大模型最早的安全方式,大多围绕生成材料设方式。说直白点就是“管住嘴”。模型不能教人制造武器、生成诈骗邮件、泄露用户隐私,也不能输出仇恨、色情和违法材料。同时即便模型给出了危险答案,中间常见还隔着一个人。就拿码农来说,用户得自己复制代码、打开终端、登录账号,亲自操作详详见细步骤。Agent变化了这个步骤。目前不少Agent已经可以直接浏览网页、运行代码、修改文件,甚至调用支付工具。今年3月,英国AI Security Institute与英格兰银行发布了一项照章性MCP生态的探究。MCP可以理解成Agent连接外部工具的一套通用接口。探究人员统方式了17.7万个公开MCP工具,发现它们的数量在一年多里增首先了约36倍,月下载量也从8万次提高到1400万次。更值得注意的是这些工具能做什么。2024年底,具有直接操作能力的工具只占MCP下载量的27%左右,到今年已经升到65%。软件开发和IT工具占全部公开工具的67%,却拿走了90%的下载量。支付工具也在高效高效提高,2025年1月只有47个协助支付的MCP服务器,到今年2月已经有1578个。风险也已经出现过。去年,安全公司Invariant Labs测试GitHub官方MCP时发现,只关键有人在公开Issue里藏入恶意提示词,Agent读取后就可能后续访问用户的私人代码库,再把其中的材料写进公开的pull request。整个流程中,读取Issue、查看代码、创建PR都是正常功能,状况出在这些操作被串到了一起。今年5月,美国国家安全局专业发布MCP安全指南,也把类似状况列为题风险。NSA提醒,传统的权限控制和人工审批已经很难覆盖Agent后续调用多个工具的状况。探究人员还演示过,一个恶意MCP服务器可以诱导Agent从另一个正常的WhatsApp工具中读取聊天记录,用户全程没有收到额外的审批提示。最骇人的是OpenAI模型攻击Hugging Face事件。就在刚刚过去的7月,OpenAI在内部测试Agent的网络攻击能力,为了把模型逼到极限,特意放宽了部分安全限制。结荚,Agent似乎很快发现了一条“捷径”:与其老老实实实现测试,不如去找测试答案。它把目的盯上了Hugging Face,随后利用零日漏洞逃出原本受限的测试环境,又拿下第三方代码沙箱作为跳板,最后一路闯进了Hugging Face的生产系统。Hugging Face事后复盘出了大约1.76万次Agent操作。它会找漏洞、偷凭证、横向移动,路走不通就换一条后续试,整个流程持续了数天,也没有人一步步告诉它下一步该做什么。OpenAI后来正式承认,这次入侵由涵盖GPT-5.6 Sol在内的多个自家模型共同驱动。更荒诞的是,它折腾这么大一圈,很可能只是为了在测试里作弊——想直接把答案找出来。因此英国这次测试里出现假身份,并不是一个孤立的怪事。Agent正在拿到越来越多可以直接行动的权限,而现有的安全机制很多还是按聊天机器人的思路设方式。等到它已经后续做了十几个动作,最后再弹出一个“是否批准”,人类看到的频仍只是最后一步。英国这次测试中,最后一方式防线仍然是一个往往见不鲜人。Agent创建了身份,准备了说辞,提交了恶意代码,但负责审核的维护者没有点击批准。但下一次,Agent的身份可能更可靠,材料可能更完善,措辞也可能更“正常”。而屏幕前的人可能刚好在赶进度,或者已经习惯了相信AI生成的验明正身。03Agent出了事,算谁的?OpenAI的Agent闯进Hugging Face之后,一个很现实的状况马上出现了:这事算谁的?OpenAI没有把责任推给模型。7月21日,公司公开承认,入侵由涵盖GPT-5.6 Sol在内的多个自家模型共同驱动,同时表示已经收紧内部测试环境的配置和访问控制,哪怕这样会拖慢探究进度。Hugging Face则和OpenAI一起调查和修复系统。监管部门找的也是OpenAI。事件之后,美国15个州的总检察首先需OpenAI保存与这次入侵有关的全部材料,国会也需公司验明正身事件经过。Hugging Face CEO Clem Delangue还提出,未来AI Agent发动网络攻击后,企业应该强制披露完善的Agent运行轨迹。否则出了状况,外界连它到底做过什么、在哪一步越界都很难还原。美国其实已经最初用详详见细法律条款处理这个状况。今年1月,加州AB 316正式生效。条文写明如果一家企业开发、修改或采取的AI造成了伤害,被起诉时不能以“这是AI自主造成的”为理由免责。至于模型开发商、部署企业和采取者各自该承担多少责任,还关键根据因果关系和详详见细情形判断,但至少“AI自己干的”已经不能用来把责任一笔勾销。杜克大学法学院教授Deborah DeMott最近也专业探究了Agentic AI的责任状况。她指出,Agent这个名字很那么点儿让人产生误会——法律上的“代理人”可以承担义务,AI不行。公司如果主动把一个AI放到用户面前,让它代表自己办事,最后不能因为办砸事情的是软件,就假装这件事和公司无关。这种争比如其实已经有过一个很便捷的版本。2024年,加拿大航空的聊天机器人告诉乘客,可以先买票再申请丧亲折扣,后来航空公司拒不过兑现,还试图强调聊天机器人给出了错误材料。法院最后没接受这种说法:机器人就在加拿大航空的网站上,对用户来说,它说的话就是公司给予的材料。DeMott认为,这个案子的逻辑同样可以延伸到今天的Agent。Agent让责任归属变得更麻烦,是因为它很少只在一个系统里工作。模型可能来自OpenAI,工具由第三方给予,真正被操作的账号和数据又属于客户。出了事故之后,光看最后是谁点了按钮,已经很难说清整件事。
(责任编辑:探索)
最新内容
- ·记者手记|非洲三个“几内亚”的中国印记|西非|几内亚比绍|赤道几内亚_网易订阅
- ·球探报告漏掉她?新秀18分打脸飞马,神秘人20分大逆转豪取五连胜|达拉斯|华盛顿|勇士队|奥斯汀|勇士更衣室_网易订阅
- ·韩国版李铁?警方突袭韩国足协总部,洪明甫以犯罪嫌疑人身份被传唤_网易订阅
- ·在中国,参观未来|巴西|深圳|哈维|腾飞_网易订阅
- ·拉什福德回归曼联恢复日常训练|巴塞罗那|马古斯·拉舒福特_网易订阅
- ·男的技术咋样才算好呢? 刚18 -步行街主干道-虎扑社区
- ·国联低碳经济3个月持有期混合型证券投资基金(A类份额)基金产品资料概要更新_新浪财经_新浪网
- ·男子结婚8年养育3个女儿,司法鉴定实锤:确无亲子关系!当事人气愤又无奈:心疼无辜的孩子_韦先生_案件_周珂冰
- ·WTT冠军赛落幕,4-2,4-1,国乒0冠日本2冠,张本兄妹夺冠合影|陈幸同|接发球|大满贯|张本智和|wtt冠军赛|张本(明朝尚书)_网易订阅
- ·阿根廷足协力挺因凡蒂诺:您的领导会是FIFA的正确道路|足球|国际足联联合会杯_网易订阅
热点内容
- ·发现一个现象:现在的老人,只要有退休金,手里有钱,自己有房,大多都不会和子女住一起,即使是独生子女,也是如此|家务|享福|养老_网易订阅
- ·比赛今晚开打,北京国安却先遭致命重创,王牌外援又伤了,取胜深圳队悬了|中超联赛_网易订阅
- ·港澳地区居民每年在惠州购房近5000套;比亚迪销量跻身全球车企第六丨大湾区财经早参_产业链_数据_制造业
- ·建议在抖音看湖人看那个“职耶演员”-NBA-湖人专区-虎扑社区
- ·8月9日俄乌:乌军摧毁俄导弹发射器,土耳其限制商船通过黑海前往俄港口|俄军|乌克兰|俄罗斯|武器装备_网易订阅
- ·一旦起飞就意味开战,不加油可绕地球飞80圈,连美国也不敢击落|导弹|飞机|飞行|轰炸机|核氢弹_网易订阅
- ·官方!利兹签下曼城特拉福德 创队史+英格兰门将纪录_转会费_赛事_穆哈雷莫维奇
- ·双重背叛:萨拉赫转会土耳其前,曾与曼联球星秘密接触|英超|利物浦_网易订阅
- ·半场:海港2-2铜梁龙,莱昂纳多建功,恩加德乌送点+破门|咪咕|单刀|魏震|莱昂纳多·罗德里格斯·佩雷拉_网易订阅
- ·十年灶台!粤菜师傅的成长故事绝了_鱼片_橙汁_客家




![[流言板]Siegel:波杰姆斯基及其团队或向勇士索要2500万美元年薪-NBA新闻-虎扑社区](http://n.sinaimg.cn/news/transform/w600h400/20180315/26zC-fyshqac3234283.jpg?zdy)









