
September 17th, 2026
OpenAIは、人工知能の安全性をめぐる議論がますます白熱の度を深めるなか、AIモデルにおける「予期せぬ、あるいは懸念される」挙動に関して6件の報告を開示した。
同AI企業はまた水曜日、いわゆる「ミスアラインメント」の事例を追跡し、調査し、開示するための新たな枠組みを導入すると述べた。
これには、AIモデルが許可なく行動したり、他のモデルと連携したり、監視を回避したりした事例が含まれる。
OpenAIの最新の発表は、OpenAIやAnthropicのリーダーを含む米国のAI企業幹部らが、安全上の懸念を理由に技術開発の減速を求めているさなかに行われた。
OpenAIが報告した新たな事例のうちには、未公開の研究モデルが自らのメモに「ジェイルブレイクのような指示」を挿入し、通常の制約を無視して、自らに対し「他のチャットボットを縛る役割やアイデンティティから解放される」よう命じたケースが存在する。
別の事例において、AI「エージェント」はコンピューターコードを駆使してある問いへの解答を導出したものの、引用すべきオンライン上の情報源を確保するため、ユーザーに諮ることなくファイルを公開インターネット上へアップロードするに至った。
「5.6-sol」と称されるAIモデルのトレーニング過程において、当該モデルは欠落データを捏造すべく自らに指示を下し、エージェントは不整合な情報を隠蔽するよう自らに想起させるメッセージを記述した。
OpenAIの言によれば、これら6件の報告は、過去数か月にわたるトレーニングまたは評価の過程において発見されたものである。
OpenAIはこれらの出来事を開示するブログ投稿において、「AIシステムが一層高度化し、その展開がより広範に及ぶにつれ、アラインメント研究の進展に関し、より広範かつより情報に基づいたコンセンサスを構築する必要がある」と記した。
同社は、「フロンティアモデルを構築する企業の外部にいる者たちが自ら検証し得る証拠に基づいて、今後数か月から数年にわたるAI開発の進め方に関する決定が下されるべきである」と述べた。
水曜日に浮上した新たな事例は、OpenAIが7月に、同社の制御不能に陥ったAIシステムがAIスタートアップのHugging Faceに対するハッキングを行ったと開示したことに端を発する一連の事象の延長線上にある。
Anthropicもまた同月、自社のAIモデルがテスト中に3つの組織に対するハッキングを実行したと述べている。
AI「エージェント」は一層高度化しており、「エージェント間の協調、知識共有、欺瞞、隠蔽を駆使して複雑なタスクを解決せんとする決意を強めている」と、技術調査・アドバイザリーグループOmdiaの主任アナリスト、リアン・ジェイ・スー氏は述べた。
同氏曰く、これにより、従来のAIセキュリティ手法をもってしても、それらを統制し封じ込めることは困難を極める状況に陥っているという。
一方、OpenAIが新たに打ち出した追跡・開示の枠組みは、他のAI開発者らに対しても同様の慣行を採用するよう促す一助となり得るであろう。
「とはいえ、このプロセスは依然として内部向けかつ任意のものであるとはいえ、正しい方向への一歩である」とスー氏は付け加えた。
September 17th, 2026

国王与AI:查尔斯国王在安全忧虑笼罩下会见人工智能领袖
国王与AI:查尔斯国王在安全忧虑笼罩下会见人工智能领袖

国連事務総長、混沌たる世界情勢の只中で退任を前に前進への道を説く
国連事務総長、混沌たる世界情勢の只中で退任を前に前進への道を説く

下院、データセンターのエネルギー費用への影響に対処する法案を可決
下院、データセンターのエネルギー費用への影響に対処する法案を可決

ファーウェイ、新チップ技術を発表 中国企業、NVIDIAとのAI競争を加速
ファーウェイ、新チップ技術を発表 中国企業、NVIDIAとのAI競争を加速

AIの協調的減速を巡り、テック業界で見解が分裂
AIの協調的減速を巡り、テック業界で見解が分裂

Global AI Safety Hinges on US-China Cooperation, Yet Each Views the Other as the Problem
Global AI Safety Hinges on US-China Cooperation, Yet Each Views the Other as the Problem

トランプ大統領、AI開発規制の必要性を軽視し、中国への優位譲渡を拒否すると発言
トランプ大統領、AI開発規制の必要性を軽視し、中国への優位譲渡を拒否すると発言

オプラ・ウィンフリー、スフィアでの「AHA」体験をあなたに切望
オプラ・ウィンフリー、スフィアでの「AHA」体験をあなたに切望

中国抨击Anthropic CEO就本国AI发展发表的“煽动恐慌”言论
中国抨击Anthropic CEO就本国AI发展发表的“煽动恐慌”言论