# Measuring the Pace of AI Development Anthropic Institute が公開した、AI モデル開発の進展ペースを客観的に測定・公開するための測定フレームワークと社内実測値の報告。フロンティア AI の開発速度調整([[@2026__DarioAmodei__We Must Pace the Frontier|Pacing the Frontier]])に関する社会的議論を踏まえ、モデルが何を行えるか(能力評価)だけでなく、「モデルがどのように作られているか(製造プロセスと自律化度)」を客観的に追跡する 3 つの指標を提示している。 ## 主要な主張 1. **AI主導のモデル R&D の急拡大**: Anthropic 社内のモデル研究開発タスクにおいて、Claude が主導(AI leads)する割合が 2026年2月の 1% 未満から、2026年8月には 26% へと急増した。 2. **客観的タスク分類フレームワーク**: 2026年7月の社内業務からサンプリングした約 15,000 件のタスク構造を固定ベースラインとし、タスクごとの人間の関与度を「人間主導」「AI協調(AI collaborates)」「AI主導(AI leads)」に分類して自律化の進捗度を指標化。 3. **エージェント監視の計量化**: 社内では毎日約 30,000 体のエージェントが稼働。セーフティモニターによってフラグされたアクションは 0.002%(約 50,000 アクションに 1 回)にとどまるが、マルチエージェント間の委譲が深まるにつれて個別監視からカスケード監視への転換が求められる。 4. **計算資源(Compute)配分の可視化**: フロンティア学習、推論サービング、および安全性・アライメント研究(モデル内部監査、誤整列耐性テスト、デプロイ安全性評価)への計算資源配分を公開・追跡する意義を提唱。 5. **[[Recursive Self-Improvement|再帰的自己改善(RSI)]] への近接度監視**: AI が自律的に次世代の後継モデルを構築する RSI への近接度を社会に可視化し、フロンティア開発のペーシング(速度制限やガバナンス)の判断材料とする。 --- ## 1. AI主導の AI 研究開発(AI-led AI R&D)の測定 フロンティアラボ自身が次世代モデルの構築に AI をどの程度活用しているかを追跡する。 ![[_attachments/measuring-pace-of-ai-development/fig01-claude-rd-tasks.png]] Anthropic 社内のモデル R&D タスクにおいて Claude が主導する割合の推移。2026年2月の 1% 未満から 2026年8月には 26% に達した。 ### 測定手法とタスク階層ツリー - **固定タスクバスケットの構築**: - 2026年7月の各週において、モデル R&D ループを構成する全社部門から従業員の 20% を無作為サンプリング。 - Claude リサーチエージェントが Slack や社内ドキュメントの作業記録を精査し、約 15,000 件の粒度の細かいタスクをボトムアップで抽出。 - さらに Claude を用いてこれらを階層ツリーに体系化。深さの異なる 542 ノード(うち 378 が末端リーフ)を生成し、これを「固定バスケット」として凍結(freeze)。 - リーフノードの具体例には「評価プラットフォームの欠陥診断と修正」「強化学習サンドボックスの外部通信制御とネットワークポリシー」「サービングインシデントのポストモーテム」などが含まれる。 - **自律化度評価**: - 各ノードについて、Claude エージェントが社内での実施状況(担当者、使用ツール、AI の関与度)を調査。 - 独立した Claude 判定モデルが証拠を読み、Epoch AI が提唱したスケールに準拠して自動化レベルを判定。 - `Human leads`: 人間が主体で作業し、AI は補助にとどまる。 - `AI collaborates`: 人間と AI が対等に協調し、主要なステップを分担。 - `AI leads`: AI エージェントが方針立案・実装・検証の大部分を自律的に遂行し、人間は高レベルの承認のみを行う。 この指標により、モデル開発のパイプライン自体が AI に移行するスピードが測定可能となる。 --- ## 2. エージェント監視(Agent Oversight)の測定 エージェントが長時間自律稼働し、エージェント同士がタスクを委譲し合う構造が常態化する中での安全監視メトリクス: ### 実運用での統計値 - **稼働規模**: 2026年8月時点で毎日約 30,000 体の自律・半自律エージェントが Anthropic 社内で稼働。 - **セーフティフラグ率**: 安全モニタリングシステムが検知した問題アクションは全体の 0.002%(約 50,000 アクション中 1 件)。 - **人間の介入頻度**: 現在のところ重大な逸脱は極めて稀であり、人間レビューアーによる介入率は低い水準に留まっている。 ### 多エージェント時代の課題 - **個別監査から連携監査へ**: 単一エージェントの暴走はルールベースや分類器で抑止可能だが、複数エージェントが協調して方針決定を行う連鎖的プロセスでは、個々のステップが正当に見えても全体として意図しない方向に進む創発的リスクが存在する。 - **オートメーション・バイアスの排除**: エージェントの成功率が高まるにつれて人間の監視が形骸化しやすくなるため、無作為サンプリングによる深掘り監査プロトコルを義務付けている。 --- ## 3. 計算資源配分(Compute Allocation)の測定 ラボが保有するフロンティア計算資源がどのような目的に投じられているかの分類: 1. **フロンティアモデル事前学習 / 事後学習**: 能力スケーリングへの直接投資。 2. **推論サービング**: ユーザーおよび社内エージェントの日常稼働への割り当て。 3. **安全性・アライメント研究**: - 自然言語オートエンコーダを用いた内部思考(hidden thoughts)の解釈性監査。 - 報酬ハッキングや自己保存バイアスを研究するための意図的な誤整列モデル生物(model organisms)の訓練。 - RSP(Responsible Scaling Policy)に基づく自律性・サイバー攻撃・CBRN リスク評価テスト。 これらを定期報告することで、AI 開発者が安全性と能力向上のどちらに実質的な資本・電力を投じているかが社会的に透明化される。 --- ## 4. ガバナンスと政策へのインプリケーション Dario Amodei が提唱した「フロンティアのペーシング(Pacing the Frontier)」において、各国政府や国際機関が規制や協調を行うための前提条件は「各社がどのような速度で自動化を進めているかの共通尺度」である。本記事で提示された測定ツール群は、単なる能力ベンチマーク(何ができるか)を補完し、AI が自己進化サイクルに入る手前で警鐘を鳴らすための客観的センサーとして設計されている。 ## 出典 - 原本: [[.raw/articles/measuring-pace-of-ai-development-2026-09-19.md]] - 元記事: [Anthropic Institute: Measuring the Pace of AI Development](https://www.anthropic.com/institute/measuring-pace-of-ai-development)