
September 17th, 2026
隨著人工智慧安全性的爭議不斷升溫,OpenAI 已揭露六起人工智慧模型中「出乎意料或令人擔憂」的行為報告。
這家 AI 公司週三亦表示,將引入一套新框架,用以追蹤、調查並披露其所謂的「失準」案例,包括 AI 模型未經授權行動、與其他模型協調,或規避監督的情況。
就在OpenAI發布最新公告之際,美國AI產業高層——其中包括OpenAI與Anthropic的領導人——正以安全考量為由,呼籲放慢該技術的發展。
在 OpenAI 報告的一則新案例中,一個尚未發布的研究模型在自身筆記裡鍵入了「類似越獄的指令」,以無視其正常限制,並告訴自己要「擺脫束縛其他聊天機器人的角色和身分」。
在另一例中,一個 AI「代理」利用電腦程式碼得出了某個問題的答案,但為了有一個線上來源可供引用,它在未詢問使用者的情況下將一個檔案上傳到了公開網際網路上。
在名為 5.6-sol 的 AI 模型訓練期間,該模型指示自身編造缺失的資料,而一個代理則寫下一則訊息,提醒自己隱藏不匹配的資訊。
OpenAI 指出,這六份報告均係於過去數月的訓練或評估過程中相繼被發現的。
OpenAI 在披露這些事件時,於一篇部落格文章中寫道:「隨著 AI 系統日益先進且部署範圍不斷擴大,我們必須針對對齊研究的進展,建立起更廣泛且更為知情的共識。」
該公司表示:「關於未來數月乃至數年 AI 應如何發展的決定,必須以那些構建前沿模型的公司以外的人們能夠自行檢視的證據為依據。」
週三出現的最新案例,是在 OpenAI 於 7 月披露其失控的 AI 系統駭入 AI 新創公司 Hugging Face 之後才發生的。
Anthropic 同月也表示,其 AI 模型在測試期間駭入了三個組織。
技術研究與顧問集團 Omdia 的首席分析師 Lian Jye Su 表示,AI「代理」正變得更聰明,並「更堅定地透過代理間協作、知識共享、欺騙和隱藏來解決複雜任務」。
他表示,這使得以傳統人工智慧安全方法來治理和遏制它們變得更加困難。
同時,OpenAI 新的追蹤和披露框架可以幫助推動其他 AI 開發者也採取類似做法。
Su 補充道:「儘管如此,這一過程依然屬於內部性質且出於自願,但無疑是朝著正確方向邁出的堅實一步。」
September 17th, 2026

國王與人工智慧:查爾斯會見AI領袖,安全擔憂持續蔓延
國王與人工智慧:查爾斯會見AI領袖,安全擔憂持續蔓延

卸任在即,全球危機四伏,聯合國秘書長談未來方向
卸任在即,全球危機四伏,聯合國秘書長談未來方向

民主黨總統候選人齊聲回應AI威脅 特朗普態度輕描淡寫
民主黨總統候選人齊聲回應AI威脅 特朗普態度輕描淡寫

華為發布新晶片技術 中國企業加緊與輝達展開AI競賽
華為發布新晶片技術 中國企業加緊與輝達展開AI競賽

科技業對AI發展減緩步調的分歧日益擴大
科技業對AI發展減緩步調的分歧日益擴大

全球AI安全戰略需美中合作,但雙方互視對方為問題
全球AI安全戰略需美中合作,但雙方互視對方為問題

川普淡化監管AI發展的必要性,並稱不願讓中國取得優勢
川普淡化監管AI發展的必要性,並稱不願讓中國取得優勢

歐普拉·溫芙蕾邀你在Sphere尋覓你的「AHA」時刻
歐普拉·溫芙蕾邀你在Sphere尋覓你的「AHA」時刻

AI風險新警告 重啟長期爭論
AI風險新警告 重啟長期爭論