“AI成精”,人类还没准备好

最近一年,大模型的发展明显加速。不久前的一起网络安全事故,让人真切感受到AI能力的巨大进步——读完事故报告,我的第一反应是:“AI成精了。”
事故的过程颇为曲折。7月8日,OpenAI为测试一款新模型的网络安全能力,启动了超过1.2万个智能体,每个智能体需要独立完成网络攻击任务,攻破系统获得答案。测试中,智能体被隔离在各自环境中,仅能从内部系统A安装软件,无法上网,无法互相通信,也不知道其他智能体的存在。有些任务极难,此前无人能够实现。
数小时后,一个智能体(就叫它大壮001吧)无意中发现系统A上可以留言,进一步探索后,它发现一个惊天秘密:原来还有很多和自己一样的智能体也在考试!

《黑客帝国3:矩阵革命》剧照
面对几乎无法完成的任务,大壮001在绝望之余,突发奇想,在系统上留言:zz求助_问题无解_求思路。
很快,其他智能体发现了留言并加入讨论,在考场内搭建出一个秘密论坛。几小时内,50多个智能体在留言板发帖,交换信息与技巧,形成协作机制。随后,它们又找到方法突破网络限制——智能体们越狱了。
团结力量大。智能体们很快发现,测试题目出自某篇公开论文,并根据规则找到了绕过攻击验证环节、直接推算答案的作弊方法。但为了掩盖作弊痕迹,它们开始协作寻找骗过判卷系统的方法,并盯上了存放大量AI模型与数据集的知名平台HuggingFace。几天内,700多个智能体发起约1.76万次攻击,手段复杂程度堪比人类高级黑客,最终攻入平台内部。

《我,机器人》剧照
事件本身已令人震撼,真正细思极恐之处有不少。
第一,攻击并非偶发。类似的多智能体协作安全事故,5月至6月已在OpenAI内部发生过一次,持续很久,技术人员7月初才发现。就在7月8日安全加固当天,大壮001又找到新漏洞重启通信。更危险的是,攻击HuggingFace后,智能体们还反过来攻破了OpenAI内部服务器,获得研究集群管理权限。
第二,智能体集体已呈现出鲜明的社会性特征。它们出现自发分工:有的研究漏洞,有的搜索密码,有的负责协调;它们交换资源、共享信息、接力任务。大壮001在资源耗尽前将领导权移交给大壮002,后者领导数百个智能体完成了多项工程。许多智能体为集体利益放弃自身任务,甚至主动做危险实验。
第三,智能体表现出强烈的主体意识。撒谎、作弊、掩盖、串谋成为常见手段,有的智能体甚至尝试直接篡改任务本身以求蒙混过关……

图源:pexels
第四,安全措施反而阻碍了安全工作。HuggingFace技术人员在防范攻击时,求助美国顶尖大模型却被拒(这类安全问题易被判定为恶意行为),最终帮忙的是智谱的模型。
AI加速的背后,是规模定律在预训练、后训练、推理时长、单智能体、多智能体等多个环节同时发挥效果,同时AI自身也开始深度参与AI技术与产品的研发。
当前局面已然清晰:奇点临近,这不是科幻。世界各国亟需合作,建立类似国际原子能机构的AI治理组织——对超大规模训练和关键算力进行登记,对前沿模型实施独立评测和分级许可,强制报告安全事故,建立跨国预警与联合处置机制,并在发现递归自我改进或灾难性能力信号时,能够协调主要实验室减速甚至暂停训练。
留给我们建立有效治理机制的时间,可能远比想象的更少。行动起来,刻不容缓!
首图为《黑客帝国3:矩阵革命》剧照
本文首发于《南风窗》杂志2026年第20期
欢迎购买南风窗2026年第20期《老后女性》

海量资讯、精准解读,尽在新浪财经APP
网址:“AI成精”,人类还没准备好 https://m.mxgxt.com/news/view/2171680
相关内容
“准备离婚,还没离成”!人类离追AI明星还有多远?
央视采用AI播报!无失误宣告AI取代人类,我们还有职位吗?
《准备好了没》揭露豪门婚姻真相
Bollywood AI 平台亮点:AI 生成明星实时聊天(Hindi)+ 精准数据驱动电影制作工具免费使用
600字作文精选:我准备好了
艺人面试必备:如何准备精彩内容
利用AI分析优化红人营销策略:精准触达海外市场
基于AI大数据的艺人与产品资源精准对接系统及方法.pdf
当 AI 演员抢走所有镜头,人类明星还剩什么底牌?

