# IBM Research AIOps/SRE エージェント研究の主要機関。[[Stratus]] 一次論文([[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]])で所属 `†` として明記された。 - STRATUS の IBM Research 側共著者: [[Saurabh Jha]]・Yu Deng・Rohan Arora・Noah Zheutlin・Bhavya Bhavya。残る 5 名は [[University of Illinois Urbana-Champaign]](Jiaqi Pan は [[Tsinghua University]] 兼)。STRATUS は **UIUC × IBM Research** の連携成果。 - [[ITBench]]([[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]], ICML'25)は IBM Research × [[University of Illinois Urbana-Champaign]] の連携成果で、計 41 名中大半が IBM 所属。equal-contribution リードは [[Saurabh Jha]]・[[Rohan Arora]]・Yuji Watanabe。[[AIOpsLab]] → [[ITBench]] → [[Stratus]] の SRE エージェント評価系譜に一貫して関与。 - ITBench と STRATUS で重複する IBM Research 共著者は [[Saurabh Jha]]・[[Rohan Arora]]・Yu Deng・Noah Zheutlin・Bhavya Bhavya。同じチームがベンチマーク([[ITBench]])と評価対象エージェント([[Stratus]])の双方を作る構図。 - 本研究(両論文とも)は IBM-Illinois Discovery Accelerator Institute (IIDAI) の助成と NSF CNS-2145295 の支援を受ける(謝辞)。 - オブザーバビリティの文脈では、IBM Research India がマルチクラウド・エッジ環境向けの軽量メトリクスフロープロセッサ [[PMF]](Programmable Metric Flows)を開発し IEEE CLOUD 2024 で発表した([[@2024__IEEE CLOUD__Enabling Programmable Metric Flows]])。全著者(Aishwariya Chakraborty、Chander Govindarajan、Kavya Govindarajan、Priyanka Naik、Seep Goel)が IBM Research India 所属。 - AIOps/SRE 文脈にとどまらず、GPU/HPC の信頼性研究にも関与する。GPU Resilience 論文([[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]], SC 2025)の共著者 [[Saurabh Jha]]・Chandra Narayanaswami・Daby Sow が IBM Research に所属する。(Source: [[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]]) - IBM Research India のオブザーバビリティ系統では [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices|KIMetrix]](Singal+ arXiv 2025)で、エントロピー + 相互情報量 + AIMD によるマイクロサービス向けメトリクス選定を提案。著者 6 名のうち [[Akanksha Singal]] が [[IIIT Delhi]] と共同所属、残る 5 名([[Divya Pathak]]・[[Kaustabha Ray]]・[[Felix George]]・[[Mudit Verma]]・[[Pratibha Moogi]])は IBM Research India 単独所属。([[PMF]] と合わせ IBM Research India のオブザーバビリティ系列を形成)。(Source: [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices]]) - AIOps のアラートノイズ削減領域では、Karan Bhukar・Harshit Kumar・Seema Nagar・[[Pooja Aggarwal]](IBM India Research Laboratory)と [[Rohan Arora]]・Ruchi Mahindru・Amit Paradkar(IBM T.J. Watson Research Center)が連名で ICSE-SEIP 2024 に Dynamic-X-Y を発表([[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps]])。教師なし移動平均エンベロープ手法で各メトリクス・サービスに個別 ASP を自動学習し、アラートノイズを最大 61.53% 削減。IBM India と Watson Research Center の横断連携を示す事例。 - マイクロサービスの障害箇所特定(CLOUD 2022): [[Jesus Rios]]・[[Saurabh Jha]]・[[Larisa Shwartz]] が FSF(Faulty Service Finder)を発表。分散トレーシングを用いた教師なし因果推論により、Train-Ticket の 68 件全障害を完全箇所特定。ログのみ手法(平均 loss 10.84)に対し loss=0 を達成。(Source: [[@2022__IEEE CLOUD__Localizing and Explaining Faults in Microservices Using Distributed Tracing]]) - マイクロサービスの因果的レイテンシモデル化(AAAI 2025 Workshop AICT): [[Christopher Lohse]]・Diego Tsutsumi・Amadou Ba(IBM Research Europe, Dublin)と Pavithra Harsha・Chitra Subramanian・Martin Straesser([[IBM T.J. Watson Research Center]])が、制約付き因果発見でマイクロサービスのレイテンシ因果グラフを観測データのみから発見するフレームワークを発表。PCMCI+ が再現率100%を達成。(Source: [[@2025__AAAI Workshop AICT__Causal Discovery for Cloud Microservice Architectures]]) - VM とコンテナの性能比較(ISPASS 2015): Austin Research Laboratory の Wes Felter・Alexandre Ferreira・Ram Rajamony・Juan Rubio が、Docker 1.0 と KVM を同一 Intel Sandy Bridge-EP サーバ上で体系的に比較([[@2015__ISPASS__An Updated Performance Comparison of Virtual Machines and Linux Containers]])。コンテナがほぼ全ベンチマークで VM と同等以上の性能を示すことを定量化し、IaaS でのコンテナ採用を後押しした。 ## 関連 - 本ソース: [[@2022__IEEE CLOUD__Localizing and Explaining Faults in Microservices Using Distributed Tracing]] / [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices]] / [[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]] / [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]] / [[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]] / [[@2024__IEEE CLOUD__Enabling Programmable Metric Flows]] / [[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps]] / [[@2025__AAAI Workshop AICT__Causal Discovery for Cloud Microservice Architectures]] - 関与プロダクト: [[ITBench]] / [[Stratus]] / [[PMF]] / [[KIMetrix]] - 所属研究者: [[Saurabh Jha]] / [[Rohan Arora]] - 連携機関: [[University of Illinois Urbana-Champaign]] / [[Tsinghua University]] - 関連 MOC: [[LLM4SRE - MOC]] / [[Project AI4SRE - MOC]] - 歴史的拠点: [[IBM T.J. Watson Research Center]](ホーソーン、NY — 2012 年以前の ITSM・モニタリング研究時代の中心拠点。[[Florian Pinel]]・[[Larisa Shwartz]] が在籍し [[@2012__NOMS__Optimizing System Monitoring Configurations for Non-Actionable Alerts|NOMS 2012]] を発表)