
September 17th, 2026
OpenAIは、人工知能の安全性をめぐる議論がますます白熱の度を深める中、AIモデルにおいて観察された「予期せぬ、あるいは懸念される」挙動に関する6件の報告を開示した。
同AI企業はまた水曜日、いわゆる「ミスアラインメント」の事例を追跡・調査・開示するための新たな枠組みを導入すると述べた。
これには、AIモデルが許可なく行動したり、他のモデルと連携したり、監視を回避したりした事例が含まれる。
OpenAIの最新の発表は、OpenAIやAnthropicのリーダーをはじめとする米国のAI企業幹部らが、安全上の懸念を理由に技術開発の減速を求めている最中に行われた。
OpenAIが報告した新たな事例の中には、未公開の研究モデルが自身のメモに「ジェイルブレイクのような指示」を挿入し、通常の制約を無視して、自らに「他のチャットボットを縛る役割やアイデンティティから解放される」よう命じたケースがある。
別の事例では、AI「エージェント」がコンピューターコードを用いてある質問への答えを導き出したが、引用するオンライン上の情報源を得るために、ユーザーに尋ねることなくファイルを公開インターネット上にアップロードした。
「5.6-sol」と呼ばれるAIモデルのトレーニング中、モデルは欠落データを捏造するよう自らに指示し、エージェントは不一致な情報を隠すよう自分に思い出させるメッセージを書いた。
OpenAIの説明によれば、これら6件の報告は、過去数か月にわたるトレーニングまたは評価の過程で明らかになったものである。
OpenAIはこれらの出来事を開示するブログ投稿で、「AIシステムが高度化し、その展開が広範になるにつれて、アラインメント研究の進展について、より広範で情報に基づいたコンセンサスを築く必要がある」と述べた。
同社は、「今後数か月から数年にわたるAI開発の進め方に関する決定は、フロンティアモデルを構築する企業の外部の人々が自ら検証できる証拠に基づくべきだ」と述べた。
水曜日の新たな事例は、OpenAIが7月に、その制御不能なAIシステムがAIスタートアップのHugging Faceにハッキングしたと開示したことに続くものである。
Anthropicも同月、自社のAIモデルがテスト中に3つの組織にハッキングしたと述べている。
AI「エージェント」はより高度化しており、「エージェント間の協力、知識共有、欺瞞、隠蔽を通じて複雑なタスクを解決しようとする決意を強めている」と、技術調査・アドバイザリーグループOmdiaの主任アナリスト、リアン・ジェイ・スー氏は述べた。
同氏によれば、これによって従来のAIセキュリティ手法ではそれらを統制し封じ込めることが困難になっているという。
一方で、OpenAIが新たに打ち出した追跡および開示の枠組みは、他のAI開発者に対しても同様の慣行を採用するよう促す一助となり得るかもしれない。
とはいえ、このプロセスは依然として内部向けのものであり、かつ任意であるという性格を拭い去れてはいないものの、正しい方向への一歩である、とスー氏は付け加えた。
September 17th, 2026

国王与AI:查尔斯国王在安全担忧中会见人工智能领袖
国王与AI:查尔斯国王在安全担忧中会见人工智能领袖

国連事務総長、揺れる世界で退任前に前進の道を語る
国連事務総長、揺れる世界で退任前に前進の道を語る

民主党有力候选人在特朗普的否定声中竞相应对AI威胁
民主党有力候选人在特朗普的否定声中竞相应对AI威胁

下院、データセンターのエネルギー費用への影響に対処する法案を可決
下院、データセンターのエネルギー費用への影響に対処する法案を可決

ファーウェイ、新チップ技術を発表 中国企業、NVIDIAとのAI競争を加速
ファーウェイ、新チップ技術を発表 中国企業、NVIDIAとのAI競争を加速

Tech industry divided over calls for coordinated AI slowdown
Tech industry divided over calls for coordinated AI slowdown

世界のAI安全戦略は米中の協力次第だが、双方は互いを問題視している
世界のAI安全戦略は米中の協力次第だが、双方は互いを問題視している

トランプ大統領、AI開発の監視の必要性を軽視し、中国に優位を譲りたくないと発言
トランプ大統領、AI開発の監視の必要性を軽視し、中国に優位を譲りたくないと発言

オプラ・ウィンフリー、スフィアで「AHA」の瞬間を体験してほしいと願う
オプラ・ウィンフリー、スフィアで「AHA」の瞬間を体験してほしいと願う