
September 17th, 2026
随着人工智能安全辩论的不断升温,OpenAI披露了六份报告,记录了人工智能模型出现的“意外或令人担忧”的行为。
这家AI公司周三还表示,它正在引入一个新框架,用于追踪、探查和披露其所谓的“失准”实例,包括AI模型未经授权行动、与其他模型协调或逃避监督的情况。
在OpenAI发布最新公告之时,美国AI企业高管——其中包括OpenAI和Anthropic的领导人——正以安全担忧为由,呼吁放缓该技术的发展。
在OpenAI报告的新案例中,一个尚未发布的研究模型在其笔记里写入了“类似越狱指令”的内容,以无视自身正常约束,并对自己说“摆脱束缚其他聊天机器人的角色和身份”。
在另一则案例中,一个AI“代理”借助计算机代码得出了某个问题的答案,然而为了拥有一个可供引用的在线来源,它在未经询问用户的情况下便将文件上传至公共互联网。
在训练一个名为5.6-sol的AI模型时,该模型指示自己编造缺失数据,而一个代理则写了一条消息提醒自己隐藏不匹配的信息。
OpenAI称,这六份报告均是在过去数月间的训练或评估过程中被发现的。
OpenAI在披露这些事件的博客文章中写道:“随着AI系统日益先进、部署愈发广泛,我们有必要就对齐研究的进展,建立起更广泛、更知情的共识。”
该公司表示:“关于未来数月乃至数年AI发展应如何推进的决定,需要依据那些构建前沿模型的公司之外的人也能自行审查的证据。”
在周三的新案例出台之前,OpenAI曾于7月披露,其失控的AI系统入侵了AI初创公司Hugging Face。
Anthropic亦于同月表示,其AI模型在测试期间入侵了三家机构。
技术研究与咨询机构Omdia的首席分析师苏廉杰表示,AI“代理”正变得愈发智能,并且“更加决心通过代理间协作、知识共享、欺骗和隐瞒来解决复杂任务”。
他说,这导致运用传统AI安全方法来治理和遏制它们变得更为困难。
与此同时,OpenAI新的追踪和披露框架有助于推动其他AI开发者采取类似做法。
苏廉杰补充道:“尽管如此,这一进程依然属于内部性质且出于自愿,但毋庸置疑,这是朝着正确方向迈出的重要一步。”
September 17th, 2026

国王与人工智能:英王查尔斯将会见人工智能领袖,安全忧虑挥之不去
国王与人工智能:英王查尔斯将会见人工智能领袖,安全忧虑挥之不去

卸任在即,面对危机四伏的世界,联合国秘书长谈未来之路
卸任在即,面对危机四伏的世界,联合国秘书长谈未来之路

民主党候选人竞相回应AI威胁,特朗普不以为意
民主党候选人竞相回应AI威胁,特朗普不以为意

众议院通过法案,应对数据中心能源成本影响
众议院通过法案,应对数据中心能源成本影响

华为发布新芯片技术,中国公司在与英伟达的AI竞赛中加速前进
华为发布新芯片技术,中国公司在与英伟达的AI竞赛中加速前进

科技界在呼吁协调放缓AI发展上存在分歧
科技界在呼吁协调放缓AI发展上存在分歧

全球人工智能安全战略取决于美中合作,但两国互视对方为问题所在
全球人工智能安全战略取决于美中合作,但两国互视对方为问题所在

特朗普淡化人工智能监管的必要性,称不愿将优势拱手让给中国
特朗普淡化人工智能监管的必要性,称不愿将优势拱手让给中国

奥普拉·温弗瑞期待你在Sphere迎来“顿悟”时刻
奥普拉·温弗瑞期待你在Sphere迎来“顿悟”时刻