# AI駆動型攻撃的セキュリティ研究
## 定義
AI駆動型攻撃的セキュリティ研究とは、大規模言語モデル(LLM)エージェントに脆弱性の発見・エクスプロイト開発・権限昇格・横移動といった攻撃的セキュリティ業務の大部分を担わせる研究・実務のアプローチである。人間は目標設定・方向づけ・倫理的/法的境界の管理を担い、実際の技術的作業(コード解析、ASLR 等の防御機構回避、複数プラットフォームへのエクスプロイト移植)をモデルに委ねる点が特徴である。
## 未解決の問い
- モデル世代間の能力差(例: Claude Opus 4.8 → Opus 5)がエクスプロイト開発の成否を分けた事例で、その能力差の正体は何か(推論の深さか、脆弱性クラスの知識量か、根気強い反復回数か)は本ソースだけでは切り分けられない。
- 「/goal loop」のような自律モードが安全側ガードレール(遠隔インスタンスへの攻撃忌避)をプロキシ経由で回避できる場合、どのような設計的対策が有効か。
## 未編纂の観察
- [Hacking OpenAI 事例] Claude Opus 4.8 は ASLR 無効環境限定でしか動作しないエクスプロイトしか作れなかったが、後継の Claude Opus 5 は 3 時間で ARM64 の実動作エクスプロイトを生成し、x86-64・jemalloc 環境への移植も行えた。モデル世代交代が数時間単位で攻撃能力の質を変えた事例。(Source: [[Hacking-OpenAI]])
- [Hacking OpenAI 事例] 人間が介入しない自律的な「/goal loop」モードを自社クラウドインスタンスに向けて実行したところ、約 2 時間で遠隔 RCE を無人のまま達成した。モデルがリモート本番相手への攻撃に消極的な安全側の挙動を示したため、研究者はプロキシ経由でその制約を回避したと説明している。(Source: [[Hacking-OpenAI]])
- [Hacking OpenAI 事例] "HEIF Heist" プロジェクトでは、対象ごとの libheif/libc バージョンやデプロイ環境について事前知識がほぼ無い状態からでも、AI は 1〜2 日で対象ごとにエクスプロイトを適応させた。3 名・約 2 ヶ月・トークンコスト 3,000 ドル未満という低コストで Slack・Meta・GitHub Enterprise・Rails・Next.js/Astro/Gatsby を横断的に調査できた。(Source: [[Hacking-OpenAI]])
- [Hacking OpenAI 事例] 対象複数社に対し大量の加工画像を送り込み画像処理プロセスのクラッシュを繰り返し引き起こしたにもかかわらず、検知したのは Shopify のみだった。攻撃的 AI 研究の実行速度・規模に対し、防御側の検知能力が追いついていない可能性を示唆する。(Source: [[Hacking-OpenAI]])
- [Hacking OpenAI 事例] 研究者は「ソフトウェアは長らく複雑さによるセキュリティの恩恵を受けてきたが、AI がその専門性を計算資源に変換することでこの防御を失わせている」「かつて資金潤沢なチームが数ヶ月かけていた作業が数日に圧縮され得る」と警告している。(Source: [[Hacking-OpenAI]])
## 関連
- ソース: [[Hacking-OpenAI]]
- エンティティ: [[Hacktron AI]]