# Hacking OpenAI
セキュリティ研究組織 Hacktron AI(Harsh Jaiswal・Mohan Pedhapati・Rahul Maini)が 2026 年 9 月 13 日に公開したブログ記事。2026 年 7 月 25 日、[[libheif]] のヒープバッファオーバーフローと [[OpenAI]] の SSO(シングルサインオン)の欠陥という 2 つの脆弱性を連鎖させ、複数の OpenAI 従業員の ChatGPT アカウントを奪取し、内部モノレポへのアクセスを実証した経緯を報告する。発見から内部リポジトリアクセスまで 72 時間以内という速さと、Claude エージェントによる自律的な攻撃コード開発が主眼である。
## 攻撃チェーンの全体像
1. [[libheif]](HEIC/HEIF デコーダライブラリ)のヒープバッファオーバーフロー(バージョン 1.19.7、Debian 12 収録)
2. 上流で前年に無 CVE のまま修正されていた脆弱性が、Debian でバックポートされずに残存(サプライチェーン上の見落とし)
3. [[Discourse]](community.openai.com のフォーラムソフトウェア)の画像アップロードパイプラインは、標準の FastImage が HEIC/HEIF を扱えないため [[ImageMagick]] の `magick` コマンドを介して libheif を直接呼び出していた
4. この経路を突いて画像アップロード経由でリモートコード実行(RCE)を達成
5. OpenAI の SSO(`auth.openai.com`、"Sign in with OpenAI")の欠陥により、Discourse 管理者権限の奪取が ChatGPT / Codex アカウントへのアクセスに連鎖した。研究者は具体的な欠陥内容を伏せつつ、「これは Discourse 固有の問題ではなく OpenAI の SSO の問題である」と強調している
6. 侵害した従業員の ChatGPT/Codex アカウントには GitHub 連携が有効で、OpenAI 内部モノレポ(`openai/openai`)へのアクセス経路になっていた
7. 実害のない検証として、Codex 経由で内部モノレポに PR #1186742 を作成し、機密コードには触れずに調査を終了した
## Claude エージェントによる攻撃コード開発
- **2026-07-23**: Discourse の画像アップロードパイプラインを調査し、HEIC/HEIF が ImageMagick 経由で libheif に渡ることを発見。
- **2026-07-24**: Claude Opus 4.8 で脆弱性を特定し、ASLR(アドレス空間配置のランダム化)を無効化した環境限定で動作するコード実行エクスプロイトを開発。複数セッションを重ねても ASLR 有効な現実的環境向けに信頼性を持たせることはできなかった。
- **2026-07-24 夕方**: Anthropic が Claude Opus 5 をリリース。投入から 3 時間で、ローカル macOS 環境向けの動作する ARM64 エクスプロイトを生成。続けて Discourse の jemalloc アロケータ構成を踏まえた x86-64 移植版を作成。
- **2026-07-25 05:00〜06:00 UTC**: 画像アップロード経由のローカル RCE を確認。
- **2026-07-25 08:00〜10:00 UTC**: Bugcrowd 経由で OpenAI のバグバウンティに報告すると同時に、自社の Discourse Cloud インスタンスに対して Claude を自律的な「/goal loop」モードで走らせた。モデルがリモート本番相手への攻撃を渋る安全側の挙動を回避するため "rce.ee/ctf-forum" 経由でプロキシした。10 時時点でエージェントは自律的に Discourse Cloud 上で RCE を達成し、`/etc/hosts` の読み取りで実証していた。
- **2026-07-25 13:30〜15:30 UTC**: 侵害した従業員アカウントの Codex/GitHub 連携経由で、内部モノレポに実害のない PR #1186742 を作成し検証を終了。
- **2026-07-25 22:49:45 UTC**: OpenAI が修正を確認(Bugcrowd 報告から約 14 時間後)。
- **2026-07-25〜28**: Discourse 側には HackerOne 経由で個別に報告。7/27 にサンドボックス化を含む修正、7/28 に勧告 GHSA-vhm9-85gw-x335 が公開された。
- **2026-09-01**: OpenAI がバウンティ $6,500 を授与。community.openai.com/Discourse 自体への検証は OpenAI のプログラム対象外だったが、OpenAI 側の SSO/ID の欠陥発見が評価された。
自律「/goal loop」は、人間が各サイクルの間に介入せず、与えた目標に向けてモデルが多段階の行動を自己決定的に反復するモードを指す。ここでは自社インスタンスへの攻撃に用いられ、無人のまま遠隔 RCE 達成に至った。
## より広範な "HEIF Heist" プロジェクト
本件は、libheif を利用する画像処理系を横断的に調査する 3 名・約 2 ヶ月間の "HEIF Heist" プロジェクトの一部である。対象には Slack、Meta、GitHub Enterprise、Ruby on Rails、Next.js、Astro、Gatsby が含まれる。プロジェクト全体のトークン(API)コストは 3,000 ドル未満だった。libheif の正確なバージョンや libc、デプロイ環境を事前に把握していない状態からでも、AIは 1〜2 日で各対象向けにエクスプロイトを適応させたという。検知したのは Shopify のみで、他の対象では大量の画像送信や画像処理プロセスのクラッシュが繰り返されても検知されなかった。
研究者はさらに、最小限の事前知識でのエクスプロイトにおいて Claude Opus 5 から「GPT-5.6 Sol」への能力向上も観察したと述べている。コード実行後の権限昇格・横移動・防御回避についてもモデルは支援したが、熟練した人間による誘導は依然として重要だったとしている。
## 示唆・警告
研究者は、ソフトウェアが従来「複雑さによるセキュリティ」の恩恵を受けてきたが、AI がその専門性を計算資源に置き換えることでこの防御を失わせつつあると指摘する。「かつてはよく資金調達されたチームが数ヶ月かけて行っていた作業が、今や数日に圧縮され得る」という主張が記事の核心的な警告である。
## 対応・修正状況
- 上流の最新版 libheif(2026-09-14 時点で v1.23.4)および libde265 への更新を推奨。
- 多層防御として、不要な HEIF/AVIF デコードの無効化、画像処理のサンドボックス隔離、ImageMagick のセキュリティポリシーによるコーデック制限を提案。
- Debian は 2026-08-08 に Debian 13 向け DSA-6417-1 を公開。ただし libheif の当該脆弱性自体には CVE が付与されていない。
- セルフホスト版 Discourse では、Web インターフェースの更新だけでは不十分で、Docker イメージの再構築(`git pull` の後 `./launcher rebuild app`)が必須。
![[_attachments/hacking-openai/fig01-xkcd-dependency.webp]]
(記事が引用する xkcd #2347「Dependency」。深い依存関係の奥底に長年放置された無名の脆弱なコンポーネントが全体を支えているという構図を、libheif の見落とされたバックポート漏れになぞらえている。)
![[_attachments/hacking-openai/fig02-openai-monorepo-pr.webp]]
(記事に掲載された、OpenAI 内部モノレポでの検証用 PR のスクリーンショット。機密部分は編集(redact)されている。)
## 出典
- URL: https://www.hacktron.ai/blog/hacking-openai
- 著者: Harsh Jaiswal, Mohan Pedhapati, Rahul Maini(Hacktron AI)
- 公開: 2026-09-13
- Raw: `.raw/articles/hacking-openai-2026-09-22.md`