# IBM Research
AIOps/SRE エージェント研究の主要機関。[[Stratus]] 一次論文([[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]])で所属 `†` として明記された。
- STRATUS の IBM Research 側共著者: [[Saurabh Jha]]・Yu Deng・Rohan Arora・Noah Zheutlin・Bhavya Bhavya。残る 5 名は [[University of Illinois Urbana-Champaign]](Jiaqi Pan は [[Tsinghua University]] 兼)。STRATUS は **UIUC × IBM Research** の連携成果。
- [[ITBench]]([[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]], ICML'25)は IBM Research × [[University of Illinois Urbana-Champaign]] の連携成果で、計 41 名中大半が IBM 所属。equal-contribution リードは [[Saurabh Jha]]・[[Rohan Arora]]・Yuji Watanabe。[[AIOpsLab]] → [[ITBench]] → [[Stratus]] の SRE エージェント評価系譜に一貫して関与。
- ITBench と STRATUS で重複する IBM Research 共著者は [[Saurabh Jha]]・[[Rohan Arora]]・Yu Deng・Noah Zheutlin・Bhavya Bhavya。同じチームがベンチマーク([[ITBench]])と評価対象エージェント([[Stratus]])の双方を作る構図。
- 本研究(両論文とも)は IBM-Illinois Discovery Accelerator Institute (IIDAI) の助成と NSF CNS-2145295 の支援を受ける(謝辞)。
- オブザーバビリティの文脈では、IBM Research India がマルチクラウド・エッジ環境向けの軽量メトリクスフロープロセッサ [[PMF]](Programmable Metric Flows)を開発し IEEE CLOUD 2024 で発表した([[@2024__IEEE CLOUD__Enabling Programmable Metric Flows]])。全著者(Aishwariya Chakraborty、Chander Govindarajan、Kavya Govindarajan、Priyanka Naik、Seep Goel)が IBM Research India 所属。
- AIOps/SRE 文脈にとどまらず、GPU/HPC の信頼性研究にも関与する。GPU Resilience 論文([[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]], SC 2025)の共著者 [[Saurabh Jha]]・Chandra Narayanaswami・Daby Sow が IBM Research に所属する。(Source: [[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]])
- IBM Research India のオブザーバビリティ系統では [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices|KIMetrix]](Singal+ arXiv 2025)で、エントロピー + 相互情報量 + AIMD によるマイクロサービス向けメトリクス選定を提案。著者 6 名のうち [[Akanksha Singal]] が [[IIIT Delhi]] と共同所属、残る 5 名([[Divya Pathak]]・[[Kaustabha Ray]]・[[Felix George]]・[[Mudit Verma]]・[[Pratibha Moogi]])は IBM Research India 単独所属。([[PMF]] と合わせ IBM Research India のオブザーバビリティ系列を形成)。(Source: [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices]])
- AIOps のアラートノイズ削減領域では、Karan Bhukar・Harshit Kumar・Seema Nagar・[[Pooja Aggarwal]](IBM India Research Laboratory)と [[Rohan Arora]]・Ruchi Mahindru・Amit Paradkar(IBM T.J. Watson Research Center)が連名で ICSE-SEIP 2024 に Dynamic-X-Y を発表([[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps]])。教師なし移動平均エンベロープ手法で各メトリクス・サービスに個別 ASP を自動学習し、アラートノイズを最大 61.53% 削減。IBM India と Watson Research Center の横断連携を示す事例。
- マイクロサービスの障害箇所特定(CLOUD 2022): [[Jesus Rios]]・[[Saurabh Jha]]・[[Larisa Shwartz]] が FSF(Faulty Service Finder)を発表。分散トレーシングを用いた教師なし因果推論により、Train-Ticket の 68 件全障害を完全箇所特定。ログのみ手法(平均 loss 10.84)に対し loss=0 を達成。(Source: [[@2022__IEEE CLOUD__Localizing and Explaining Faults in Microservices Using Distributed Tracing]])
- マイクロサービスの因果的レイテンシモデル化(AAAI 2025 Workshop AICT): [[Christopher Lohse]]・Diego Tsutsumi・Amadou Ba(IBM Research Europe, Dublin)と Pavithra Harsha・Chitra Subramanian・Martin Straesser([[IBM T.J. Watson Research Center]])が、制約付き因果発見でマイクロサービスのレイテンシ因果グラフを観測データのみから発見するフレームワークを発表。PCMCI+ が再現率100%を達成。(Source: [[@2025__AAAI Workshop AICT__Causal Discovery for Cloud Microservice Architectures]])
- VM とコンテナの性能比較(ISPASS 2015): Austin Research Laboratory の Wes Felter・Alexandre Ferreira・Ram Rajamony・Juan Rubio が、Docker 1.0 と KVM を同一 Intel Sandy Bridge-EP サーバ上で体系的に比較([[@2015__ISPASS__An Updated Performance Comparison of Virtual Machines and Linux Containers]])。コンテナがほぼ全ベンチマークで VM と同等以上の性能を示すことを定量化し、IaaS でのコンテナ採用を後押しした。
- 時系列基盤モデル研究にも関与する。この系統をさらに遡ると、[[Vijay Ekambaram]]・Arindam Jati・Neelamadhav Gantayat 等(IBM Research)と [[Santosh Palaskar]]・Nandyala Hemachandra・Narayan Rangaraj([[IIT Bombay]])が発表した [[AutoMixer]](IAAI-24、[[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]])がある。AutoEncoder によるチャネル圧縮の事前学習と [[TSMixer]] 微調整を組み合わせ、ビジネス KPI と IT イベントを融合した BizITObs データの多変量予測で SOTA 比 11-15% の MSE 改善を達成した。IIT Bombay × IBM Research の連携成果であり、Vijay Ekambaram は TSMixer 自体の著者でもある。(Source: [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]])
- この起点の後、Vijay Ekambaram・Arindam Jati・Pankaj Dayama・Sumanta Mukherjee・Nam H. Nguyen・Wesley M. Gifford・Chandra Reddy・Jayant Kalagnanam(全員 IBM Research)が発表した超軽量(1Mパラメータから)予測特化モデル [[Tiny Time Mixers (TTM)]](NeurIPS 2024、[[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]])が続く。軽量 TSMixer バックボーンに adaptive patching・diverse resolution sampling・resolution prefix tuning を組み込み、1M パラメータで 311M パラメータの Moirai_L 等を上回るゼロショット予測を達成した。(Source: [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]])
- 同じ著者陣(Vijay Ekambaram・Subodh Kumar・Arindam Jati・Sumanta Mukherjee・Tomoya Sakai・Pankaj Dayama・Wesley M. Gifford・Jayant Kalagnanam、全員 IBM Research)が超軽量(1Mパラメータ)診断タスク特化モデル [[TSPulse]] を発表し、ICLR 2026 に採択された([[@2026__ICLR__TSPulse - Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis]])。TSPulse は [[Tiny Time Mixers (TTM)]] の TSMixer バックボーンを継承しつつ、予測専用だった TTM を分類・補完・異常検知・類似検索の4診断タスクへ拡張した後継であり、AIOps/SRE 系統とは独立した IBM Granite 時系列モデル系統(TTM → TSPulse)を形成する。(Source: [[@2026__ICLR__TSPulse - Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis]])
- ソフトウェアテスト分野では、AIOps/SRE系統より10年ほど早い時期からクラウドアプリケーションのデプロイ品質保証に関与していた。[[Alexander Tarvo]]・Peter F. Sweeney・Nick Mitchell・V. T. Rajan・Matthew Arnold・Ioana Baldini(全員 IBM Research, Yorktown Heights)が、自動カナリアテストツール [[CanaryAdvisor]] をISSTA'15でデモ発表([[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]])。非パラメトリック統計仮説検定によりベースラインとカナリアのメトリクス差を判定する設計は、後年のIBM Research AIOps研究群(アラート抑制・根本原因分析等)に先行する、統計的手法による運用品質保証の初期の事例である。
- AIOps/SRE・GPU/HPC 信頼性研究に加え、OS/カーネル拡張研究にも関与する。[[Hubertus Franke]]・[[Jonas Pfefferle]](Yorktown Heights)が [[Columbia University]] と共同で Linux ページキャッシュの eBPF カスタマイズフレームワーク [[cache_ext]] を開発した([[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]]、SOSP 2025 で発表、ACM TOCS 2026 に拡張出版)。本研究は IBM の資金支援を受けた。(Source: [[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]])
- [[Hubertus Franke]] は同じく Columbia University のチーム(Georgios Liargkovas・Mihir Nitin Joshi・Kostis Kaffes)と、LLM を意味論的推論器としてオンライン OS チューニングに組み込む TuxBot も共著している([[@2026__arXiv__TuxBot - Semantic-Aware Online OS Tuning with Large Language Models]])。cache_ext と TuxBot は IBM Research × Columbia University の OS/カーネル研究連携の 2 つの成果。(Source: [[@2026__arXiv__TuxBot - Semantic-Aware Online OS Tuning with Large Language Models]])
- システム研究の評価方法論にも早くから関与していた。[[Aaron B. Brown]](IBM Research)は [[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]](HotOS 2005)の筆頭著者として、システム研究論文を科学・工学・芸術の3次元で評価する枠組みを提案した。同論文は可用性ベンチマーク研究(Brown & Patterson, USENIX 2000)を出発点に、性能指標に偏った評価への問題提起を行っている。(Source: [[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]])
- LLM 推論インフラのオートスケーリング領域にも関与する。[[Abhishek Malvankar]]・Lionel Villard・Mohammed Abdi・Evgeny Shindin・Braulio Dumba・Vishakha Ramani・Asser Tantawi・Tamar Eilam(いずれも IBM Research)が、[[University of Bologna]] の Tommaso Sgreccia と共同で Workload Variant Autoscaler(WVA)を発表した([[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]]、arXiv 2026)。WVA は Kubernetes ネイティブ分散 LLM 推論フレームワーク [[llm-d]] と共同設計され、KV キャッシュ利用率・キュー長という推論エンジン内部の飽和シグナルに基づく headroom ベースのグローバルオートスケーリングを行う。200 基の H100 GPU を持つ実機 OpenShift クラスタでの検証を含み、HPA 比で有効スループット最大 37% 改善・リクエスト失敗数 10 分の 1 を達成した。(Source: [[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]])
- ネットワーク可観測性の文脈では、Yorktown Heights の Hasibul Jamil(University at Buffalo とのインターンシップ)・Abdul Alim・Laurent Schares・Pavlos Maniotis・Ali Sydney・Abdullah Kayi・[[Bengi Karacali]] が、IBM Research Lab Haifa の Liran Schour と共同で、AI 学習クラスタの ECMP ハッシュ衝突起因のネットワークパス不均衡を可視化するツール FlowTracer を発表した([[@2024__arXiv__FlowTracer - A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters]]、arXiv 2024、IEEE ICC 2025 採録と報告)。RoCE/TCP フローをホップバイホップで受動追跡し、新指標 Flow Imbalance Metric(FIM)で ECMP と静的ルーティングの不均衡を定量比較する。R-Pingmesh 等の能動プロービング系 RDMA 監視ツールとは異なり、実運用トラフィックを受動監視する点が特徴。(Source: [[@2024__arXiv__FlowTracer - A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters]])
## 関連
- 本ソース: [[@2024__arXiv__FlowTracer - A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters]] / [[@2022__IEEE CLOUD__Localizing and Explaining Faults in Microservices Using Distributed Tracing]] / [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices]] / [[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]] / [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]] / [[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]] / [[@2024__IEEE CLOUD__Enabling Programmable Metric Flows]] / [[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps]] / [[@2025__AAAI Workshop AICT__Causal Discovery for Cloud Microservice Architectures]] / [[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]] / [[@2026__arXiv__TuxBot - Semantic-Aware Online OS Tuning with Large Language Models]] / [[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]] / [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]] / [[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]] / [[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]]
- 関与プロダクト: [[ITBench]] / [[Stratus]] / [[PMF]] / [[KIMetrix]] / [[cache_ext]] / [[Tiny Time Mixers (TTM)]] / [[TSPulse]] / [[CanaryAdvisor]] / [[llm-d]]
- 所属研究者: [[Saurabh Jha]] / [[Rohan Arora]] / [[Hubertus Franke]] / [[Jonas Pfefferle]] / [[Alexander Tarvo]] / [[Aaron B. Brown]] / [[Abhishek Malvankar]] / [[Hasibul Jamil]] / [[Bengi Karacali]]
- 連携機関: [[University of Illinois Urbana-Champaign]] / [[Tsinghua University]] / [[Columbia University]] / [[University of Bologna]]
- 関連 MOC: [[LLM4SRE - MOC]] / [[Project AI4SRE - MOC]]
- 歴史的拠点: [[IBM T.J. Watson Research Center]](ホーソーン、NY — 2012 年以前の ITSM・モニタリング研究時代の中心拠点。[[Florian Pinel]]・[[Larisa Shwartz]] が在籍し [[@2012__NOMS__Optimizing System Monitoring Configurations for Non-Actionable Alerts|NOMS 2012]] を発表)