# 研究関心プロファイル このプロファイルは、SRE/AIOps 研究者(テレメトリを主軸に信頼性を工学する立場)の関心を蒸留したものである。週次キュレーションでは、候補論文の title と abstract を以下の基準に照らして 0-100 でスコアリングする。**コア関心に強く合致すれば 80 以上、周辺関心なら 60-79、対象外なら 40 未満**を目安とする。 研究の背骨は 4 本柱である(`research/vision/2025年度版研究目的.md`)。 1. テレメトリワークロードのスケーリング(計測・保存・分析の各層で負荷を抑制) 2. SRE エージェント(検知・原因特定・復旧・予兆検知の自動化) 3. 自動スケーリング/チューニング/ヒーリング(学習ベースの閉ループ制御) 4. AI インフラの可観測性(大規模 AI 学習・推論基盤のボトルネック可視化) --- ## コア関心(80+) - **障害の根本原因分析(RCA)・箇所特定**。マイクロサービス/クラウドシステムでの原因特定、因果発見、障害依存グラフ、影響伝搬。LLM/エージェントによる RCA と、古典統計・因果グラフによる RCA の双方。(例: `根本原因分析`, `LLMによる根本原因分析`, `因果発見`, `マルチモーダル障害診断`) - **可観測性・テレメトリ工学**。分散トレーシング、メトリクス、ログ、テレメトリの計測・保存・分析基盤。特に**テレメトリ量の削減・サンプリング・スケーリング**(高解像度化とコストのジレンマ解消)。(例: `分散トレーシング`, `トレースサンプリング`, `メトリクス削減`, `Retroactive Sampling`, `テレメトリ`) - **eBPF・低オーバーヘッド動的計装**。BPF/uprobe/動的計装による非侵入プロファイリング、カーネル/ホストレベル観測。(例: `eBPF`, `BPF`, `uprobe`, `動的計装`, `非侵入プロファイリング`) - **AI インフラの可観測性**。LLM 学習・推論基盤のモニタリング、GPU 観測性、ストラグラー/fail-slow 検知、ML goodput、大規模 GPU クラスタ運用。(例: `GPU観測性`, `LLM学習モニタリング`, `ストラグラー`, `ML Productivity Goodput`, `GPUクラスタ運用`) - **インシデント管理と SRE の自律化**。アラート相関/削減/疲労、インシデント優先順位付け・影響測定、SRE エージェント、予兆検知、セルフヒーリング。(例: `アラートランキング`, `アラート疲労`, `プロアクティブ障害管理`, `セルフヒーリング`) - **時系列異常検知・予測**。多変量時系列の異常検知、変化点検知、時系列基盤モデル、情報理論的異常スコア。運用テレメトリへの適用文脈で。(例: `ログベース異常検知`, `変化点検知`, `多変量時系列予測`, `情報理論的異常スコア`) ## 周辺関心(60-79) - **障害の科学・複雑システム論**。グレイ障害、メタ安定障害、複雑システム障害論、障害注入/カオスエンジニアリング、潜在的障害。 - **AIOps ベンチマーク・評価設計**。RCA/障害診断のデータセット、推論プロセス評価、fault-propagation を考慮した評価。(例: `RCA評価設計`, `SRE Benchmark`) - **LLM 推論・学習基盤そのもの**。KV キャッシュ、テンソル/データ並列、MoE、推論の分離配置、AI アクセラレータ、学習の高速フェイルオーバー/リカバリ。可観測性に還元できる限りで。(例: `LLM推論`, `テンソル並列`, `AIアクセラレータ`) - **データベース/ストレージの自律運用**。時系列データベース、学習型インデックス、データベース自律診断、コンピュートストレージ分離。 - **WebAssembly・エッジクラウドのランタイム/チェックポイント**。ランタイム中立チェックポイント、セルフヒーリング、VM マイグレーション(所属組織・近縁研究者のテーマとして継続追跡)。 - **ネットワーク/データセンターのテレメトリ**。インバンドネットワークテレメトリ(INT)、RDMA/集合通信の性能異常診断、輻輳制御。 - **研究の自動化・計算機自然という視座**。AI 研究自動化、批判的デジタルネイチャー、シミュレーションと現実の高速反復による AIOps(研究ビジョンの思想的背景)。 ## 対象外(40 未満) - **セキュリティ**(脆弱性検出、攻撃検知、暗号、認可モデルそのもの)。会議リスト対象外。ただし観測性/障害診断に本質的に絡む場合のみ周辺として拾う。 - **MLOps**(モデルのデプロイ・バージョニング・特徴量ストア等のパイプライン運用)。会議リスト対象外。 - **LLM のアルゴリズム改良一般**(新モデルアーキテクチャ、RL 学習手法、プロンプト技法の汎用研究)。運用/可観測性/障害診断への応用でなければ拾わない。 - **アプリケーション寄りの応用 ML**(CV/NLP/推薦などのタスク性能競争)。 - **純粋な理論・HPC 数値計算・量子計算**。インフラ運用に接続しない限り対象外。 ## 方法論・視点の好み log と研究目的から読み取れる評価の癖。スコアの加点・減点材料として使う。 - **実運用規模での評価を重視**。production-scale、10,000-GPU、20万サービス級のハイパースケール、実システムのトレースでの検証は加点。おもちゃ的ベンチマークのみは減点。 - **ベンダー自己申告値に懐疑的**。性能値がベンダー/著者の自己申告のみで第三者再現がない場合は割り引く(例: VAST の全性能値を批判的に扱う姿勢)。 - **成果志向でなく推論プロセス志向の評価を好む**。最終回答のみを採点する RCA ベンチマークより、localization/identification/reason を分離評価する設計を高く評価。 - **コスト/オーバーヘッドのトレードオフを明示する研究を好む**。テレメトリ削減率、計装オーバーヘッド、エネルギー効率など、便益と代償を数値で提示するもの。 - **単一信号でなく多層・多モーダルの統合**を評価(CPU コールスタック+フレームワーク+GPU カーネル、ネットワーク+ホスト、メトリクス+ログ+トレース)。 - **意味情報・ドメイン知識で探索空間を絞る**アプローチへの共感(統計だけに頼らず構造事前知識を使う)。 - クラウド事業者(さくらインターネット)の観点。ビッグテック事例への過度な依存から脱却する独自知見を志向。 ## 査読なし論文の例外基準 原則は査読済みを優先するが、**専門性が非常に近い**トピックは arXiv のみでも読む。具体的には以下に該当する arXiv プレプリントは査読の有無で減点しない。 - マイクロサービス/クラウドの **RCA・障害診断**(例: COCA, GALA, eARCO, RADICE, KPIRoot+, BSODiag) - **LLM 学習/推論基盤の可観測性・信頼性**(GPU トレーシング、ストラグラー診断、高速フェイルオーバー/リカバリ、集合通信性能) - **テレメトリのスケーリング・サンプリング・メトリクス削減** - **運用テレメトリ向けの時系列異常検知・予測基盤モデル**(例: 時系列基盤モデル、エージェント型異常検知) - **AIOps ベンチマーク・評価設計**の新提案 上記から外れる arXiv プレプリント(汎用 LLM モデル報告、一般 ML 手法など)は、査読なしを理由に減点してよい。 ## 再蒸留メモ - 最終蒸留日: 2026-07-08 - 再蒸留の目安: 月1回程度。直近 1 か月の `wiki/log.md` 先頭エントリと、新規に増えた `wiki/concepts/` を確認し、コア/周辺の配置を更新する。 - 蒸留の限界: 本プロファイルは wiki の ingest 履歴(≒読んだもの)から関心を逆算している。読んでいないが関心のある新領域は反映されない。人手で `## コア関心` に追記して補正すること。