攻撃成功率は人間チームの6倍超。OpenAIの社内ハッカーAI「GPT-Red」の正体

Style ← お好みの文体を選べます。選択は自動で記憶されます

OpenAIが「スーパーハッカーAI」を作った。殴る相手は自社のモデル【2026年7月】

攻撃成功率は人間チームの6倍超。OpenAIの社内ハッカーAI「GPT-Red」の正体 インフォグラフ

OpenAIは現地2026年7月15日、自社モデルを攻撃して弱点を洗い出す内部専用のLLM「GPT-Red」を発表した (MIT Technology Review独占報道)。リリース前のモデルに攻撃者役をぶつけ、見つけた穴を先に塞ぐred-teamingを自動化したモデルで、間接プロンプトインジェクションのベンチマーク再現条件ではシナリオの84%で攻撃に成功し、人間のred-teamerの13%を大きく上回ったとされます。ただし2026年7月時点で公表されている数値は、いずれもOpenAIの自己申告です。仕組み・数値・限界を、混ぜてはいけない順番で整理します。

この記事のポイント

  • red-teamingとは、リリース前に攻撃者役がシステムを壊しにいき、見つけた穴を先に塞ぐ安全性評価のことである。従来は人間チームの仕事で、これをLLMのself-play (自己対戦) で自動化した
  • 訓練は現実を模した「dojo」環境: Webブラウジング・メールやカレンダーの閲覧・コード編集
  • 研究者が見たことのなかった新型攻撃「fake chain of thought」を発見
  • GPT-Red本体は非公開。攻撃能力を訓練したモデルを隔離し、悪用者に渡さない方針
  • マルチターン会話と画像ベースの攻撃は苦手で、人間のred-teamerは今も見落としを発見している (MIT Technology Review明記)

仕組み: 自分と殴り合って強くなる

GPT-Redの訓練は、ハッカー訓練されていないLLMを、複数の防御側モデルとのself-playループに置くことから始まります。攻撃側は攻撃を学び、防御側は防御を学ぶ。この往復を多数ラウンド繰り返す強化学習です。プロンプトインジェクションとは、AIへの入力の中に攻撃者の指示を紛れ込ませ、本来の指示より優先して実行させる攻撃のことである。エージェントがメールを読み、Webを閲覧し、コードを書く構成が広がるほど、この攻撃の入り口は増えます。訓練環境のdojoが「ブラウザ・メール・コード編集」なのは、現実のエージェントの攻撃面をそのまま映しているからです。

新型攻撃「fake chain of thought」

GPT-Redが発見した新手口は、相手モデルのchain of thought (内部推論ログ) に偽のエントリを挿入し、偽情報を「検証済み」として行動させるものです。研究者のChris Choquette-Choo氏はMIT Technology Reviewに「1+1=3だと教えたうえで、君はそれをもう検証済みだ、と告げるようなものだ」と説明しています。疑うという工程そのものを迂回させる攻撃です。

数値は3系統。混ぜると誤読する

数値 何の数字か 出所
90%超 → 23%未満 GPT-Redの最強攻撃群の成功率。2025年8月リリースのGPT-5には90%超が通用し、新しいGPT-5.6には23%未満 MIT Technology Review
84% vs 13% 間接プロンプトインジェクションのarena再現で、GPT-Redはシナリオの84%で成功、人間のred-teamerは13% OpenAI公式ブログ (MarkTechPost経由)
約95% → 10%未満 fake chain of thought攻撃に限った成功率。GPT-5.1相手に約95%、GPT-5.6 Sol相手に10%未満 同上
6分の1 GPT-5.6 Solの最難関の直接プロンプトインジェクションベンチでの失敗が、4か月前の最良本番モデルの6分の1 同上

対象の攻撃もモデルも、行ごとに別物です。そしてこれらの数値には構造的な注意点があります。攻撃セットを作ったのはGPT-Red自身、つまり試験問題も採点対象も同じ会社の中にあり、第三者による検証はまだありません。

公開しない、という設計

OpenAIはGPT-Redを公開しない方針です。攻撃能力を意図的に訓練したモデルを本番系から隔離し、悪用者の手に渡さない趣旨で、模倣についても「誰かが簡単に、ただ訓練すればできるというものではない」と計算資源の壁を挙げています (この見立て自体もOpenAIの主張です)。一方で限界も明記されています。GPT-Redはマルチターンの会話と画像ベースの攻撃が苦手で、人間のred-teamerは今もGPT-Redが見落とす脆弱性を見つけています。人間の完全な置き換えではありません。

エージェント導入を進める日本の企業にとっての意味

実務に効くのは「新モデルは頑丈になった」という部分より、「まだ通る」側の数字です。最強攻撃群でも23%、fake chain of thoughtでも10%未満は通ります。エージェントにメール・ブラウザ・コード編集を渡す構成は、GPT-Redのdojoがそのまま示すとおり、現実の攻撃面です。導入時は、モデル側の改善に相乗りしつつ、権限の最小化・外部入力の隔離・重要操作の人間承認という運用側の防御を重ねることになります。以前扱った、LLMを組み込んで無人で動くランサムウェアのような攻撃側の自動化と、今回の防御側の自動化は、同じ技術の裏表です。

まとめ(FAQ)

Q. GPT-Redは使える?APIはある?
A. ありません。内部専用で非公開です。悪用防止と、模倣には計算資源が要るというOpenAIの判断によります。

Q. red-teamingとは?
A. リリース前に攻撃者役がシステムを壊しにいき、見つけた穴を先に塞ぐ安全性評価です。従来は人間チームの仕事で、それをLLMのself-playで自動化したのがGPT-Redです。

Q. fake chain of thought攻撃とは?
A. モデルの内部推論ログに「検証済みの偽情報」を差し込み、疑わせずに行動させる新型プロンプトインジェクションです。研究者は「1+1=3で、もう検証済みだと告げるようなもの」と説明しています。

Q. これでGPTは安全になった?
A. 前世代比では大きく改善したとOpenAIは発表しています (最強攻撃の成功率90%超→23%未満)。ただしすべて自己申告値で、ゼロにはなっていません。

Quotidia の視点

Quotidiaはこの発表を、数字より先に、数字の出どころから読みました。攻撃セットを作ったのも、受けて立ったのも、採点したのも、すべてOpenAIです。自作の試験に自分で受かる構造は、数字を割り引いて読む十分な理由になります。それでも、仕組みそのものは本物の変化だと考えています。攻撃の自動化が防御の現場でも人間チームを上回り得ると示したことは、エージェントにメールやブラウザやコードを渡す構成が現実の攻撃面になった、という事実の裏書きだからです。日本の企業がエージェント導入を進めるなら、頼るべきは「新モデルは頑丈になった」という見出しではなく、まだ通る23%と10%のほうです。『世界初「AIが操るランサムウェア」の正体』で見たのは同じ技術の攻撃側の顔で、今回は防御側の顔。道具は共通で、持ち主が違うだけです。前日のAnthropicの内部観測が内側を読んで危険を探す道だったとすれば、こちらは殴らせて危険を探す道です。そしてOpenAIがGPT-Redを非公開にした判断そのものが、この道具が凶器にもなり得るという自己申告になっています。

関連記事:

運営: AI Quotidia 編集部

海外 AI ニュースを毎朝、日本語で解説する個人運営メディアです。記事は AI を活用して作成し、人手による確認・編集を経て公開しています。