
September 17th, 2026
在 AI 安全性論辯益趨白熱化之際,OpenAI 業已披露六起人工智慧模型中「出乎意料或令人擔憂」的行為報告。
該人工智慧企業於週三復申,將引介一套嶄新框架,用以追蹤、探查並披露其所謂「失準」之案例,涵蓋人工智慧模型未經授權而擅自行動、與其他模型相互協調,或規避監督等情事。
OpenAI 最新公告問世之際,美國 AI 業界高層——其中包括 OpenAI 與 Anthropic 的領導人——正以安全考量為由,呼籲放緩該技術的發展步伐。
在 OpenAI 所披露的一則新近案例中,某個尚未發布的研究模型於其自身筆記內嵌入了「類似越獄的指令」,藉此漠視其常規限制,並自我叮囑要「擺脫束縛其他聊天機器人的角色和身分」。
在另一案例中,某個 AI「代理」雖藉由電腦程式碼推導出某一問題的解答,卻為求取得可供引用之線上來源,未經徵詢使用者,逕自將一份檔案上傳至公開網際網路上。
於代號 5.6-sol 之 AI 模型訓練期間,該模型竟自我指示以杜撰缺失之資料,而一代理則撰寫了一則訊息,提醒自身隱匿不相符之資訊。
OpenAI 指出,該六份報告係於過去數月之訓練或評估過程中經發現者。
OpenAI 於披露此等事件之際,在一篇部落格文章中寫道:「隨著 AI 系統益發精進且部署範圍愈趨廣泛,我們亟需就對齊研究之進展,建立更為廣泛且更具知情基礎的共識。」
該公司表示:「有關人工智慧於未來數月乃至數年應如何推進之決策,亟需仰賴那些構建前沿模型之企業以外人士得以自行檢視之證據。」
週三浮現的新案例,其背景為 OpenAI 於 7 月披露旗下失控的 AI 系統曾駭入 AI 新創公司 Hugging Face;Anthropic 亦於同月表示,其 AI 模型在測試期間入侵了三個組織。
技術研究與顧問集團 Omdia 的首席分析師 Lian Jye Su 指出,AI「代理」正日趨睿智,並「愈益矢志不移地藉由代理間協作、知識共享、欺騙與隱匿,以攻克錯綜複雜的任務」。
他說道,此舉致使以傳統人工智慧安全範式對其加以治理與遏制之難度益發攀升。
與此同時,OpenAI 嶄新的追蹤與披露框架,或有助於促使其他 AI 開發者亦步亦趨,採行相仿之舉措。
Su 補充道:「即便如此,此一進程終究屬於內部且出於自願的範疇,惟其仍不失為朝正確方向所邁出的一步。」
September 17th, 2026

國王與人工智慧:查爾斯會晤人工智慧領袖,安全隱憂持續蔓延
國王與人工智慧:查爾斯會晤人工智慧領袖,安全隱憂持續蔓延

卸任在即,全球危機四伏,聯合國秘書長論前路
卸任在即,全球危機四伏,聯合國秘書長論前路

民主黨總統候選人競相回應AI威脅 特朗普淡然處之
民主黨總統候選人競相回應AI威脅 特朗普淡然處之

眾議院通過法案 旨在應對資料中心對能源成本的影響
眾議院通過法案 旨在應對資料中心對能源成本的影響

華為發布新晶片技術 中企加緊與輝達展開AI競賽
華為發布新晶片技術 中企加緊與輝達展開AI競賽

科技業對AI減緩協調呼聲現分歧
科技業對AI減緩協調呼聲現分歧

全球AI安全戰略繫於美中協作,兩強卻互視對方為癥結所在
全球AI安全戰略繫於美中協作,兩強卻互視對方為癥結所在

川普淡化AI發展檢查之必要,並稱不願讓優勢拱手於中國
川普淡化AI發展檢查之必要,並稱不願讓優勢拱手於中國

歐普拉·溫芙蕾邀你在Sphere尋覓你的「AHA」時刻
歐普拉·溫芙蕾邀你在Sphere尋覓你的「AHA」時刻