## [2026-09-13] ingest | We Must Pace the Frontier\n- Source: `.raw/articles/we-must-pace-the-frontier-2026-09-13.md`\n- Summary: [[@2026__DarioAmodei__We Must Pace the Frontier]]\n- Pages created: [[@2026__DarioAmodei__We Must Pace the Frontier]], [[METR]]\n- Pages updated: [[Dario Amodei]], [[Anthropic]], [[OpenAI]], [[Hugging Face]], [[Recursive Self-Improvement]], [[アラインメント監査]], [[エージェント運用安全性]], [[機構的解釈性]], [[LLM評価]]\n- Key insight: AIの能力進歩が安全対策を追い越さないよう、第三者評価と国際協調を含むペーシングを提案する。
## [2026-09-12] ingest-thesis | Community detection in graphs
- Focus: [[Community detection in graphs]](Fortunato, Physics Reports 486, 2010、全18節+付録)+ 代表章 [[@2010__PhysRep__Community detection in graphs - Chapter VI Modularity-based methods]] / [[@2010__PhysRep__Community detection in graphs - Chapter XV Testing Algorithms]]
- Key insight: コミュニティ検出分野の決定版サーベイ。伝統的手法・モジュラリティ最適化・スペクトル法・動的手法・統計的推論・重複検出・マルチ解像度・ベンチマーク比較まで19章(18節+付録A)に分割して取り込み。
- New: [[Santo Fortunato]] [[Girvan-Newman algorithm]] [[Clique Percolation Method]] [[Peacock]] [[GraphScope]] [[FacetNet]] [[LFR benchmark]] [[Reichardt-Bornholdt method]] [[Reichardt-White block model]] [[Rosvall-Bergstrom MDL method]] [[Hastings planted partition model]] [[Newman-Leicht mixture model]] [[Hofman-Wiggins method]] [[Son et al. FRFIM method]] [[walktrap]] [[MCL (Markov Cluster Algorithm)]] [[L. Donetti]] [[M. A. Muñoz]] [[Alves]] [[Kernighan and Lin]] [[Fiedler]] [[Shi and Malik]] [[Arenas-Díaz-Guilera-Pérez-Vicente synchronization method]]
- Updated: [[モジュラリティ]] [[コミュニティ検出]] [[スペクトラルクラスタリング]] [[Louvain法]]
## [2026-09-12] ingest-paper | Fast unfolding of communities in large networks
- Source: `.raw/papers/arxiv-0803.0476.pdf`
- Summary: [[@2008__JSTAT__Fast unfolding of communities in large networks]]
- Pages created: [[Vincent D. Blondel]], [[Jean-Loup Guillaume]], [[Renaud Lambiotte]], [[Etienne Lefebvre]], [[Université catholique de Louvain]], [[LIP6]], [[コミュニティ検出]], [[モジュラリティ]], [[Louvain法]]
- Pages updated: [[Imperial College London]]
- Key insight: Louvain法(局所モジュラリティ最適化+コミュニティ凝集の反復)が1億ノード超のネットワークを152分で処理できる高速コミュニティ検出手法として、ネットワーク科学の基礎参照点になる。
## [2026-09-12] ingest-thesis | A survey of fault localization techniques in computer networks
- Source: `.raw/theses/survey-steinder-2004-fault-localization/`(6 章 / 入力: ローカル PDF、Science of Computer Programming 53(2), 2004)
- Hub entity: [[A survey of fault localization techniques in computer networks]]
- Chapters: [[@2004__SCP__A survey of fault localization techniques in computer networks - Chapter 1 Introduction]]〜[[@2004__SCP__A survey of fault localization techniques in computer networks - Chapter 6 Conclusions]](6 件、全章。図9枚すべて埋め込み)
- Pages created: entity [[Małgorzata Steinder]] [[Adarshpal S. Sethi]] [[IBM T. J. Watson Research Center]]、concept [[障害箇所特定パラダイム分類]] [[確率的障害伝播モデル]]
- Pages updated: concept [[Fault Localization]]・[[根本原因分析]](2004年時点の古典taxonomyとしての位置づけを積み増し)、entity [[University of Delaware]](Sethiの所属先として追記)
- Key insight: 30ページ・6節構成のサーベイを、博士論文と同じ章単位 ingest プロトコルで取り込んだ境界事例。専門家システム・モデル走査・グラフ理論・codebookの4パラダイム分類と、依存グラフ/因果グラフ上のNP-hard最適化という定式化を2つの独立conceptとして新設し、既存のAIOps系[[Fault Localization]]・[[根本原因分析]]が引き継ぐ課題(相関と因果の区別・multi-layer診断・分散診断)がこの2004年サーベイの時点で既に明示されていたことを積み増した。
## [2026-09-12] ingest-book | Networks, Crowds, and Markets
- Source: `.raw/books/networks-crowds-and-markets/`(24 章 / 入力: 章別 PDF、著者公開プレプリント)
- Book entity: [[Networks, Crowds, and Markets]]
- Chapters: [[@2010__CambridgeUP__Networks, Crowds, and Markets - Chapter 1 Overview]]〜[[@2010__CambridgeUP__Networks, Crowds, and Markets - Chapter 24 Property Rights]](24 件、全章)
- Pages created: entity [[David Easley]] [[Mark Granovetter]] [[Duncan Watts]] [[Steven Strogatz]]、concept [[弱い紐帯の強さ]] [[ホモフィリー]] [[情報カスケード]]
- Pages updated: concept [[PageRank]](Chapter 14)、[[優先的選択]](Chapter 18)、[[スモールワールドモデル]](Chapter 20)
- Key insight: Easley & Kleinberg の学部教科書を24章の source として取り込み、既存 wiki の PageRank・優先的選択・スモールワールドモデルの各 concept を本書の教科書的な定式化と突き合わせて観察を積み増した。ネットワーク科学・ゲーム理論・市場設計を横断する統一的な参照点として book entity を新設。
- Deferred: Nash 均衡・囚人のジレンマ・べき乗則・アローの不可能性定理・コースの定理など多数の概念は今回のバッチ concept 上限(新規3/更新5)超過のため concept 化を見送り、本文中の平文参照に留めた。
## [2026-09-12] ingest-paper | The PageRank Citation Ranking: Bringing Order to the Web
- Source: `.raw/papers/pagerank.pdf`
- Summary: [[@1998__TechReport__The PageRank Citation Ranking - Bringing Order to the Web]]
- Pages created: [[@1998__TechReport__The PageRank Citation Ranking - Bringing Order to the Web]], [[Rajeev Motwani]], [[Terry Winograd]], [[Jon Kleinberg]]
- Pages updated: [[PageRank]], [[Lawrence Page]], [[Sergey Brin]], [[Stanford University]], [[Google]]
- Key insight: PageRank 元祖テクニカルレポート(1998 草稿)を取り込み、既存 concept の主要出典を Definition 1(ランクソース E)・収束アルゴリズム・パーソナライズ実験まで裏付けた。PDF テキスト抽出は埋め込みフォントの CMap 破損で文字化けしたため、Read ツールの視覚レンダリングで全17ページを精読して本文を執筆した。
## [2026-09-12] ingest-paper | LINE: Large-scale Information Network Embedding
- Source: `.raw/papers/arxiv-1503.03578.pdf`
- Summary: [[@2015__WWW__LINE - Large-scale Information Network Embedding]]
- Pages created: [[Jian Tang]], [[Meng Qu]], [[Mingzhe Wang]], [[Ming Zhang (Peking University)]], [[Jun Yan]], [[Qiaozhu Mei]], [[Microsoft Research Asia]], [[ネットワーク埋め込み]], [[LINE]]
- Pages updated: [[Peking University]], [[University of Michigan]]
- Key insight: LINE は一次・二次近接性を別目的関数で保存し、edge-sampling で重み付きエッジの SGD 発散問題を解いて数十億エッジ規模まで線形時間でスケールする。
## [2026-09-11] convention | wiki/asks/ 新設(単一 source への軽い質問の蓄積先)
- 背景: [[@2026__arXiv__SeT-Diff - Towards Semantic Foundation Models for HPC Telemetry and Time-Series]] への軽い確認質問(拡散モデルを使う理由・Transformer との関係)を機に、`wiki/questions/`(複数 source 横断・引用重厚な長編)より軽い置き場が無いことが判明。
- Change: `wiki/meta/conventions.md` に §14(type: ask、命名衝突回避、source 側 `asks:` フィールドでの相互リンク、昇格条件)を追加。`wiki/CLAUDE.md` の構造一覧・役割分担表・判断基準に反映。
- Created: [[wiki/asks/@2026__arXiv__SeT-Diff - Towards Semantic Foundation Models for HPC Telemetry and Time-Series]](初の ask ページ。2 件の質問を記録)
- Updated: [[@2026__arXiv__SeT-Diff - Towards Semantic Foundation Models for HPC Telemetry and Time-Series]](frontmatter に `asks:` 追加)
- Maintenance: `scripts/allocate-address.sh` が `flock` 未導入(brew未インストール)で失敗するため、このセッションでは counter ファイルを直接読み `c-006753` を手動採番・counter を 6754 へ更新した。`brew install flock` の実行は permission で拒否されたため未解決(人間の作業として残す)。
## [2026-09-11] ingest-paper | DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
- Source: `.raw/papers/DeepSeek_V41_Tech_Report.pdf`(HuggingFace 配布のテクニカルレポート。arXiv 版なし)
- Summary: [[@2026__TechReport__DeepSeek-V4.1-Flash - Pushing the Limits of KV Cache Compression]]
- Pages created: [[@2026__TechReport__DeepSeek-V4.1-Flash - Pushing the Limits of KV Cache Compression]]
- Pages updated: [[DeepSeek-AI]], [[KVキャッシュ量子化]], [[Prefill-Decode分離]], [[スパース注意]], [[Mixture-of-Experts]], [[Speculative Decoding]]
- Key insight: Causal Encoder-Decoder(CED)・CSA2(レイヤー横断 KV/インデックス再利用)・FP4 主 KV キャッシュ・SWA Bounded Replay の 4 層同時最適化により、グローバル KV を 890 バイト/トークン(DeepSeek-V4-Flash比 1/4)、永続 KV を約 1/8 に削減しながら性能を向上させた。
- Note: 著者は数百名の企業テックレポートで対応著者の明示がないため、entity は組織(DeepSeek-AI)のみに留め個人著者は entity 化しなかった。Table 5(Appendix のみで参照)は除外。
## [2026-09-11] wiki-ideate | サービス側バーン率でSREエージェントの書込権限を比例制御する
- Origin: [[gap-report-2026-08-18]](gap)。逐語: 「エラーバジェット — エージェント自律度のゲート」
- Idea: サービス側 SLO のバーン率を権限契約の書込集合とゲートへ比例写像し、L0 から L4 の定量ゲートにする。
- Novelty: novel。近い仕事: The CASE Framework (2026, partial)、Agentic NetOps/AIOps サーベイ (2026, partial)、ARBITER (2026, partial) ×3。wiki に無い近い仕事: CASE Framework、ARBITER(wiki-ingest-paper 候補)
- Output: research/ideas/サービス側バーン率でSREエージェントの書込権限を比例制御する.md(承認済み)
- Key insight: エラーバジェットはバーン率の連続制御信号を既に持ち、自律度側は昇格の定量基準を欠く。接続は Yoshikawa の二値だけである。
## [2026-09-11] maintenance | 人間判断待ちの解消(address / 論文重複 / entity 名寄せ / doctor)
- 重複 address: [[LLM学習インフラ実運用の教科書]] を c-001711 から c-006750 へ再採番(後発の survey。論文側 [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] が c-001711 を維持)。後から見つかった c-002403 は [[Sieve]] を c-006751 へ再採番し [[GAIA Dataset]] を残した
- 論文: FSE の DOI 欠落スタブを Companion 版へ統合して削除。Attention / GPipe / Scaling Laws は 30papers 読書ノートとして併存させ `related` で橋を渡した。Latency SLOs は Americas と EMEA で発表者が違う別トーク。Toto 2.0 は Datadog 記事と arXiv 論文で source_type が違う。1 枚ものの Efficient Inference サーベイは章 11 頁のハブとして残し章へ `related` を足した
- entity: 同一実体 27 対を統合(残す側に aliases、リンク張り替え、drop を削除)。親子・別人・別世代 32 対は却下し、親ページに載っていた子組織名や誤 alias(Microsoft Research、P4Runtime、GB203、gerrowadat など)を外した。候補 0 対
- doctor: manifest の原本欠落 3 件を削除。4 日前から残っていた State of AI の `.tmp` を source ページとして確定。古い chunk 51 件を削除して BM25 を再構築。claim-audit の not_in_source は既に留保済み。再編纂キューの blocked と concept 候補の ready は 0 件
- Key insight: 書誌 ID の一致は「同じ文書」であり「同じページであるべき」ではない。30papers と会場違いのトークは橋を渡せばよく、DOI プレースホルダの二重取り込みだけを消す
- Deferred: manifest 未登録原本 644 件は導入前の取り込みなので、次の wiki-ingest-* が触れたときに登録する。paper-ids の埋め戻し 3 頁は作業木が dirty のため飛ばした
## [2026-09-11] tooling | コンテキスト束と機械状態の検査(D1 / D2)、薄い MCP は測定のみ(D3)
- Added: `scripts/wiki-context-pack.py`(目標に対する引用付き・予算内・省略明示の束。`retrieve.py` の候補か `--pages` の指定を `wiki-excerpt.py` の抜粋で予算に詰め、入らないページは outline、それも入らなければ「省略」として末尾に列挙。索引が古く移動済みのページを指すときは同名ページを wiki/ 配下から探す。読み取り専用)。`scripts/wiki-doctor.py`(機械状態の健全性検査 15 項目。索引の鮮度、消えたページを指す chunk、chunk の無いページ、派生キャッシュの鮮度、残留ロック、address 計数器と重複、`.raw/.manifest.json` の整合、台帳 JSON、hot 窓、log 先頭、一時ファイル、自動コミット無効化、ollama 到達、wiki/ の未コミット数。OK / WARN / FAIL と fix コマンド。書き換えない)。試験 `scripts/test_wiki_doctor.py` 5 件
- Updated: wiki-lint 検査 17(doctor を最初に走らせ、派生キャッシュと放置ロックだけ自分で直す)と報告書の `## Doctor`、wiki-survey の subagent ブリーフと wiki-thesis の pass-brief に束の使い方、`wiki/CLAUDE.md`
- 実測(doctor): 索引より新しいページ 773 頁(B3 の backfill で mtime が動いた)、存在しないページを指す chunk 34 件(questions から surveys への移動の残骸。retrieve が古いパスを返す)、chunk の無いページ 44 頁、**重複 address c-001711**([[LLM学習インフラ実運用の教科書]] と [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]])、manifest の原本欠落 3 件と未登録原本 644 件(manifest 導入前の取り込み)、`wiki/sources/` に並行取り込みの `.tmp` 1 件。
- 実測(D3 の判断材料): 直近 12 セッションの平均常駐文脈は 175k から 293k トークン。skill 本文は wiki-ingest-paper 約 17k(+参照 3k)、wiki-ingest-book 約 18k(+参照 17k)、共通指示(CLAUDE.md、wiki/CLAUDE.md、conventions)約 18k で、合わせて常駐の 15 から 20 %。残りは原本と tool 結果である。薄い MCP は CLI 呼び出しをツール schema に置き換えるだけで手順本文は減らず、schema 自体が常駐に載る。導入は保留のまま、削る対象は SKILL.md と references の分量にする。
- Key insight: lint と verify-ingest はページの内容を見るが、索引・chunk・ロック・計数器・manifest といった機械状態は誰も見ていなかった。重複 address と古い chunk は retrieve の結果を静かに歪めるので、内容の検査より先に機械状態を揃える順序が要る。束は「何を読ませたか」と「何を読ませなかったか」を同じファイルに書くことで、subagent が省略ページを推測で埋める事故を防ぐ。
- Deferred: c-001711 の再採番(どちらが誤りかは人間判断。survey 側が後発)、34 件の古い chunk と 773 頁の再索引(`wiki-retrieve-refresh.py`、約 3 分。並行取り込み中は走らせない)、manifest 未登録 644 件の遡及登録(wiki-ingest-* が次に触れたとき)、token-discipline.md への束の記載(hook でファイルを読めないため未反映)。
## [2026-09-11] tooling | 着想・プロファイル・保存既定(C2 / C3 / C4)
- Added: `wiki-ideate` skill(入力は wiki-gap の real-gap、wiki-thesis の insufficient / mixed、concept の未解決の問い、自由な種。候補 3 本から 1 本を選び、問題 / 着想 / 仮説 / 検証の最小設計 / 期待される差分 / 前提となる wiki の根拠 / リスクの形で下書き、wiki(retrieve)と `bin/s2.sh` で近い仕事を same / partial / different に分けて novel / incremental / already-done を判定、承認後に `research/ideas/` へ新規ノート 1 枚。既存ノートは読むだけ)。`scripts/wiki-profile.py`(人間所有の `research/curation/profile.md` を 25 行に要約する読み取り専用の要約器。試験 `scripts/test_wiki_profile.py` 2 件)
- Updated: [[conventions]] §12 ルール 3(新設か保留かで迷う候補はプロファイル要約に照らす。対象外は source に留め、コア関心は 2 文書目で優先新設)、ingest 系 7 skill と wiki-query deep と wiki-survey フェーズ 0 に 1 行、wiki-query の standard を保存既定(save-first)に変更(quick は保存しない。保存は `wiki-page-write.py` 経由、concept の未解決の問いを `wiki-append.py` で閉じる、命題の判定は wiki-thesis へ)、wiki-thesis フェーズ 6 と wiki-gap の境界節に wiki-ideate への引き渡し、`wiki/CLAUDE.md` と `CLAUDE.md` のルーティング
- Key insight: profile.md は paper-curation しか読んでいなかったが、ingest の「作るか保留か」と query / survey の「何を加点し何を割り引くか」は同じ関心軸で決まる。全文 76 行を毎回 Read させず、太字見出しだけを畳んだ 25 行を機械的に出すことで、判断材料を共有しつつトークンを抑える。着想 skill は wiki-gap(文献推薦で止まる)と wiki-thesis(判定で止まる)の先を継ぐ位置にあり、一次レイヤー `research/ideas/` へは承認後の新規ファイル 1 枚だけを足す。
- Deferred: wiki-ideate の実走(実在ギャップか閉じなかった命題が要る。[[KVキャッシュ転送コストは再計算に比べて無視できるか]] は partially で対象外)。profile.md の再蒸留は paper-curation の仕事のまま。
## [2026-09-11] tooling | entity の名寄せ(entity-resolve、A5)
- Added: `scripts/entity-resolve.py`(scan / report / plan / decide / ledger。読み取り専用。試験 `scripts/test_entity_resolve.py` 2 件)。台帳 `.vault-meta/entity-merges.json` は最初の decide で生まれる(git 追跡)
- Updated: [[conventions]] §12 ルール 6(alias は本人を指す名前だけ。姓だけ・`Y. Li` 型・親組織への子組織名を置かない)、wiki-refactor の探索手順(entity は entity-resolve で対を出し plan で影響範囲)、wiki-lint 検査 16 と `## Entity Aliases`、`wiki/CLAUDE.md`
- 実測: entity 5,414 頁から候補 59 対(strong 38、medium 6、weak 15)。strong の上位は [[Intel Corporation]] と [[Intel]]、[[Yuuki Tsubouchi]] と [[坪内佑樹]]、[[SAKURA Internet]] と [[SAKURA internet Inc]]、[[UC Berkeley]] と [[University of California, Berkeley]]、[[Fei-Fei Li]] と [[Feifei Li]]、[[内田 泰広]] と [[内田泰広]]。統合は行っていない(人間承認)。
- Key insight: alias をそのまま突き合わせると 2,266 対に膨れる。原因は姓だけの alias(`Zhang`、`Lin`)と `Y. Li` 型の引用表記で、同姓の別人を全部つなぐ。題名の部分文字列である alias とイニシャル始まりの alias を名寄せから外すと 110 対、短い略称の共有(`KIT`、`CSU`、`UVA`)を「統合」でなく「alias の整理」(medium)に落として 59 対になった。ハイフン結合の名(`I-Ting`)を割ると `I.` のイニシャルに見えて誤検出する。
- Deferred: 実際の統合は wiki-refactor の作業として別セッションで行う。[[Microsoft Research]] と [[Microsoft]]、[[MIT CSAIL]] と [[MIT]] のような親子組織は統合ではなく親側の alias を外すのが正しい。
## [2026-09-11] tooling | 書誌 ID の正規化と重複照合(B3)
- Added: `scripts/paper-ids.py`(scan / check / dupes / backfill / report。試験 `scripts/test_paper_ids.py` 5 件)、派生キャッシュ `.vault-meta/paper-ids.json`(git 追跡しない。`wiki/sources/` のディレクトリ mtime より古ければ check が作り直す)
- Updated: `scripts/fetch-paper-pdf.sh`(取得前に索引へ照合し `existing_sources=` を返す。`FETCH_FAIL_IF_EXISTS=1` で終了コード 4)、`scripts/wiki-verify-ingest.py`(FM-ARXIV / FM-DOI。形式誤りは ERROR、paper で url から導ける ID が無いのは WARN)、[[conventions]] §3(`arxiv_id` / `doi`)、wiki-ingest-paper Step 0 と frontmatter 雛形、wiki-ingest-thesis Step 0(章分割前の照合)、wiki-lint 検査 15 と `## Paper IDs`、`wiki/CLAUDE.md`
- 埋め戻し: source 2,419 頁のうち arxiv_id 416 頁、doi 380 頁を frontmatter に足した(`updated:` は動かさない。作業木で変更中の 6 頁は飛ばした)。導出元は url 712、`.raw` slug 34、本文 62。埋め戻し前は arxiv_id 1 頁、doi 7 頁しか持っていなかった。
- 重複: arXiv 2 組([[@2017__NeurIPS__Attention Is All You Need]] と 30papers 版、GPipe の NeurIPS 版と 30papers 版)、題名キー 4 組(FSE と FSE Companion、SREcon Americas と EMEA、Scaling Laws の arXiv 版と 30papers 版、Toto 2.0 の Datadog 記事と arXiv 版)、1 枚ものと章分割の併存 1 文書([[@2024__arXiv__A Survey on Efficient Inference for Large Language Models]] と章 11 頁)。統合か併存かは人間判断として lint 報告に残す。
- Key insight: 素朴に同じ ID を持つページを数えると重複 27 組と出るが、ほとんどは章分割 source(1 文書 → N 頁)で、文書に畳むと 6 組に落ちる。本文リンクからの導出は書籍の章では引用先を章自身の ID にしてしまう(Gihyo の章が Attention 論文を持つ)ので、`source_type: paper` に限った。zenodo と 10.48550(arXiv の DataCite DOI)も本文からは拾わない。
- Deferred: Semantic Scholar の `s2_id` 付与(`bin/s2.sh paper ARXIV:<id>` を 1 req/s で 420 頁分)は、照合に arXiv / DOI で足りている現状では見送る。会議サイト直リンクしか無い paper 388 頁の DOI は手当てしない。
## [2026-09-11] tooling | concept 候補の台帳(A4)
- Added: `scripts/concept-candidates.py`(add / list / show / promote / reject / reopen / lookup / seed-from-log / report。試験 `scripts/test_concept_candidates.py` 4 件)、台帳 `.vault-meta/concept-candidates.json`(git 追跡)
- Updated: `scripts/wiki-resolve.py`(concept が無く台帳に候補があれば JSON に `candidate_ledger`、compact の 4 列目に `ledger:<名>(<k> docs, <state>)`)、[[conventions]] §12 ルール 5、wiki-lint 検査 14 と `## Concept Candidates`、ingest 系 7 skill(wiki-ingest / -paper / -book / -thesis / -slides / -video / autoresearch)の Deferred の行に台帳への `add` を 1 文、`wiki/CLAUDE.md`
- 種入れ: log の `- Deferred:` 行(ingest 系エントリのみ、「なし」を除く)から 24 候補。独立 source は文書単位で数える(章 source と付録は 1 本)ため、閾値到達は 0 件。旧 log は fold 済みで Deferred 行 36 件しか残っていない。
- Key insight: 素朴に log エントリ内の全 `[[@...]]` を出典に数えると、`Pages updated:` に並ぶ既存 source と章分割が混ざって Lustre フェイルオーバーが「3 文書」に見えた。出典は `Source:` / `Chapters:` / `Added:` の行だけから取り、章は文書に畳む。台帳の値は次の ingest が同じ候補を再び保留したときに初めて出る。
- Deferred: 台帳を読んだうえでの新設判断は各 ingest の仕事。tooling / query エントリの Deferred は作業の保留であり候補ではないので、`--all-kinds` 無しでは見ない。
## [2026-09-11] wiki-thesis | KVキャッシュ転送コストは再計算に比べて無視できるか
- Thesis: 「プレフィックスキャッシュの再利用では、KV キャッシュの転送(読み込み)コストは再計算コストに比べて無視できる」
- Verdict: partially(confidence medium)。支持 4 件 / 反対 5 件 / 機序 1 件 / source 10 本
- Output: [[wiki/questions/KVキャッシュ転送コストは再計算に比べて無視できるか]](address c-006749)
- Origin: 無し(wiki-thesis skill の初回実走。[[KVキャッシュ管理]] の観察 58 件から命題を立てた)
- 2 周目: 支持側の評価条件を狙い、直接根拠 3 件がいずれも小 KV(120 MB)、ノード内配置、障害復旧の文脈であることを確認(メタ行として記録)
- Key insight: 支持と反対は矛盾ではなく、転送経路の帯域と距離、KV サイズ(4 桁動く)、転送粒度の 3 変数で分かれる。CacheBlend がロードと部分再計算をパイプライン化する設計自体が、両者が同じ桁にあることの証拠になる。
- Gap: 通常のプレフィックス再利用の大規模配備で転送時間を TTFT 分解として測った source が wiki に無い
## [2026-09-11] tooling | グラフ第 3 路(graph channel、B1)
- Added: `scripts/wiki-graph.py`(build / neighbors / stats。wikilink と frontmatter related・sources の辺 1.0、双方向 +0.5、共通出典の共引用辺 1/log2(2+引用数)。試験 `scripts/test_wiki_graph.py` 6 件)、派生キャッシュ `.vault-meta/graph.json`(gitignore、9,536 ノード / 77,564 辺、構築 5 秒)
- Updated: `scripts/retrieve.py`(BM25 上位 5 頁を種に 1 ホップ近傍を次数減衰で取り、未出ページは chunk-000 で `channels: ["graph"]` として追加、既出ページは RRF k=60 で融合。person / organization の entity は `--graph-people` 無しでは加えない。`--no-graph` / `--graph-top` / `--graph-hops`。グラフが無い・空・無効のときは出力がバイト単位で同一)、`scripts/wiki-retrieve-refresh.py`(BM25 の後にグラフを再構築、`graph_ok`)、wiki-retrieve SKILL、wiki-query SKILL(`+graph` と `channels` の読み方)、`wiki/CLAUDE.md`
- 実測: 「KV キャッシュの転送コストは無視できるか」で BM25 のみでは CacheBlend source と教科書だけだったところに、[[CacheBlend]]・[[LMCache]]・[[KVキャッシュ管理の教科書]](surveys)・同サーベイの隣接章が近傍として加わった。フィルタ前は著者 4 名と所属が上位を占めた。
- Key insight: source ページの近傍は著者・所属 entity で埋まる(entity 5,400 頁中 person 3,315・organization 787)。グラフ路は「語彙が合わないが主題が隣接する頁を rerank の前に運ぶ」のが目的なので、人物・組織は既定で除くのが正しい。共引用辺は概念同士を出典経由でつなぐが、200 頁超が引く出典は辺を作らない(ハブ抑制)。
- Deferred: 2 ホップ既定化と personalised PageRank は、rerank 有効時の効果を測ってから。graph.json は追跡せず clone 後に `wiki-graph.py build`。
## [2026-09-11] tooling | 命題の再検証(claim audit、A3)
- Added: `scripts/claim-audit.py`(sample / record / resolve / report。試験 `scripts/test_claim_audit.py` 6 件)、wiki-refactor `references/claim-audit.md`(判定規則と手当て)、台帳 `.vault-meta/claim-audit.json`(git 追跡)、[[claim-audit-2026-09-11]]
- Updated: [[conventions]] §5(命題は再検証の対象)、recompile.md 検査 4(再編纂直後の自己検査)、wiki-refactor SKILL(再検証の決定)、wiki-lint 検査 13(標本検査)、`wiki/CLAUDE.md`
- 初回検査: 再編纂済み 9 頁から各 1 命題。supported 8、not_in_source 1([[サービスレベル目標]] L363: 2 出典の各半分は書いてあるが「圧縮したもの」という対応づけはどちらにも無い)。問題率 1/9。
- Key insight: 再編纂で観察を命題に畳むとき、wiki 側の解釈(対応づけ・年差の算出)が出典の主張と同じ形で書かれる。パケット(命題 + 出典の該当段落)にすると、抜粋に無い語が命題に入っているかで機械的に疑える。3 出典のうち 1 つが lint 由来の source stub という例([[根本原因分析]] L434)も見えた。
- Deferred: SLO L363 への留保は別コミットで手当て。定期検査は lint の検査 13 に任せる。
## [2026-09-11] tooling | 再編纂キューと却下フィードバック(A1)
- Added: `scripts/recompile-queue.py`(refresh / next / show / mark / reopen / report。試験 `scripts/test_recompile_queue.py` 8 件)、`.vault-meta/recompile-queue.json`(git 追跡、mode.json と同じ例外扱い)
- Updated: [[conventions]] §8 更新ルール 6(キューの所在と mark の運用)、wiki-refactor `references/recompile.md` §1・§7(着手宣言・完了・却下の記録)、wiki-refactor SKILL(候補は next から選ぶ)、wiki-lint 検査 12(refresh + report 貼り付け)、`wiki/CLAUDE.md`
- 実測: 初回 refresh で compile 負債 561 頁を pending として登録、待機中の観察 6,163 件。上位は [[集合通信]](59) [[KVキャッシュ管理]](58) [[RDMA]](57) [[分散トレーシング]](56) [[AIOps]](48)。上位 10 頁のうち 8 頁が主題節 0 かつ旧見出し `## 横断的知見`。
- Key insight: `--compile-debt` は毎回の走査結果を出すだけで、着手・却下・再入を覚えなかった。キューは状態と試行履歴と却下理由を持ち、次の試行が同じ失敗を繰り返さない(kytmanov の rejection feedback を、専用プログラムではなく JSON 1 枚と skill の手順で実装)。却下 3 回で blocked。
- Deferred: 561 頁の再編纂そのもの。skipped / reopen の運用は人間が行う。
## [2026-09-11] tooling | 矛盾索引と conflicts lint(A2)
- Added: `scripts/contradiction-index.py`(試験 `scripts/test_contradiction_index.py` 10 件)、[[contradictions]](`wiki/meta/contradictions.md`、`--write` の生成物)
- Updated: [[conventions]] §5(索引の所在と `(status: explained|open)` 上書き)、wiki-lint 検査 11(索引再生成と片側のみの候補)、wiki-query(矛盾を問う質問で `--query`)、`wiki/CLAUDE.md` の scripts 一覧
- 実測: callout 99 件 / 保持頁 88 頁(concept 27 / entity 20 / source 40 / survey 12)、未決着(推定)84、説明済み(推定)15、片側のみの候補 115 対(相手が source 70 / entity 36 / concept 8)
- Key insight: 矛盾 callout は各頁に散在し、一覧も検索路も無かった。索引化で「wiki が自分の不一致をどこで知っているか」が 1 コマンドで出る。片側のみ 115 対は §5 の両頁明示が実態として守られていないことを示す。
- Deferred: 片側候補への対側 callout 追加は人間承認の作業として残す。状態推定は見出し語依存であり、本文は解釈しない。
## [2026-09-11] wiki-survey | LLMのデータ枯渇に関するサーベイ(図表転載)
- 更新: [[wiki/surveys/LLMのデータ枯渇に関するサーベイ]]
- 母集団19本のsourceページから埋め込み9点を抜き出し(表3-1、図3-2、図4-1、図4-2、図5-1、図5-2、図6-1、図6-2、図7-1)、本文の該当主張の直後へ挿入した。
- 選定基準は本文の主張の証拠になるか。枯渇交点図と在庫表、事前学習曲線、等計算量曲線、規模則曲線、修正則当てはめ、選択性能図、順位一致図、既約損失図。
- 実見の結果差し替えは無し。全9点の内容が本文の数値と一致した。
- 0点とした章: 第1章と第2章と第8章と第9章と第10章と付録(総括と座標と発見と未解決と一覧は単一ソース図を貼らない)。JMLRはsourceページに埋め込み無し、書籍図はpublish判断を要するため不採用、joisinoに図無し。
- 全9点の画像パスは実ファイル存在を検査済み。addressは再採番していない。
## [2026-09-11] wiki-survey | LLMのデータ枯渇に関するサーベイ
- Question: 「LLMのデータ枯渇問題に関するサーベイ文書を作成して」
- Output: [[wiki/surveys/LLMのデータ枯渇に関するサーベイ]](address c-006748、755行、10章と付録構成)
- Retrieval: retrieve.py 6問で実行しrerank一部縮退、起点concept[[データ枯渇]]のfrontmatter全件と用語密度で補完、母集団19本で合意。
- 体制: 5クラスタ並列精読(A枯渇予測、B制約下則、C合成則、D選択、E崩壊展望、Eは要約のみ返却のためjoisino2本と容量則と崩壊概念を直接読書で補完)、導入と座標と横断と未解決はメイン文脈が執筆。
- 骨格: サーベイ型、4軸(問いの層、データ出自、緩和策の系統、評価軸)を第2章に明示、以降は予測と制約則と合成則と選択と崩壊で切る。
- 姉妹編との分担: 姉妹ページ無し、画像動画ストックと下流利用は範囲外と宣言。
- Key insight: 反復と合成は排他でなく積み上がり、最適混合比率は合成の性質と領域と規模の関数であり、崩壊は種類依存で一様な運命でない。
- 執筆規範: japanese-tech-writing適用、検査はダッシュ0件と中黒0件と予告系0件、wikilink欠損0件、数値10件遡及。
- Gap: 半減期定数の依存性、合成と反復の統一記述、種類差の機構、容量則と訓練量、非英語一般化、推定の独立検証、質の定量化、選択の拡張、最先端規模妥当性、転移の定量化。
## [2026-09-11] ingest-paper | Scaling Data-Constrained Language Models with Synthetic Data
- Source: `.raw/papers/2026.findings-eacl.52.pdf`
- Summary: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]
- Pages created: [[Hirokazu Kiyomaru]], [[Yusuke Oda]], [[Takashi Kodama]], [[Chaoran Liu]], [[Daisuke Kawahara]], [[Research and Development Center for LLMs]], [[Waseda University]], [[FineWeb]], [[FineWeb2]], [[llm-jp-eval]], [[データ制約下でのスケーリング]]
- Pages updated: [[National Institute of Informatics]], [[Qwen3]], [[合成データ]], [[データ枯渇]]
- Key insight: 固定72Bトークン予算(日本語Webは9Bのみ)の下で、合成日本語データ拡張(Qwen3-14Bによるパラフレーズ・文書接地型指示生成)が日本語Web反復や英語Web直接利用を上回り、追加オーガニック日本語Webを補うoracle設定にも匹敵することを示した。
- Note: [[@2025__JMLR__Scaling Data-Constrained Language Models]]とタイトルが酷似するが別論文(日本語データ拡張への応用研究)。両ページに相互参照を付与。
## [2026-09-11] ingest-paper | OPUS
- Source: `.raw/papers/arxiv-2602.05400.pdf`
- Summary: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]
- Pages created: [[Shaobo Wang]], [[Xingzhang Ren]], [[Dayiheng Liu]], [[Linfeng Zhang]], [[Mila - Quebec AI Institute]], [[事前学習データ選択]]
- Pages updated: [[FineWeb]], [[Alibaba Group]], [[Shanghai Jiao Tong University]], [[University of Wisconsin-Madison]], [[UIUC]], [[GPT-2]], [[Qwen3]], [[データ枯渇]], [[データキュレーション]]
- Key insight: 現代オプティマイザ(AdamW/Muon)が誘導する更新ジオメトリにデータ選択スコアリングを整合させることで、GPT-2規模で8倍、Qwen3-8B-BaseのCPTで6倍のデータ効率向上を実現した。
- Note: [[データキュレーション]]と[[事前学習データ選択]]はスコープが重複するため相互参照リンクのみ追加。統合要否はオーケストレータ判断待ち。
## [2026-09-11] ingest-paper | DataComp-LM
- Source: `.raw/papers/19e4ea30dded58259665db375885e412-Paper-Datasets_and_Benchmarks_Track.pdf`
- Summary: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]
- Pages created: [[DataComp-LM (DCLM)]], [[Ludwig Schmidt]], [[Vaishaal Shankar]], [[Achal Dave]], [[Jeffrey Li]], [[Alex Fang]], [[Georgios Smyrnis]], [[Maor Ivgi]], [[データキュレーション]]
- Pages updated: [[University of Washington]], [[Apple]], [[UT Austin]], [[Allen Institute for AI]], [[Common Crawl]], [[スケーリング則]]
- Key insight: 400M〜3B規模のデータキュレーション手法の優劣が7B規模へ高い順位相関(r=0.838〜0.982)で転移することを示し、モデルベースフィルタリングが高品質LLM事前学習コーパス構築の鍵であることを大規模統制実験で立証した。
## [2026-09-11] ingest-paper | Scaling Laws of Synthetic Data for Language Models
- Source: `.raw/papers/arxiv-2503.19551.pdf`
- Summary: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]
- Pages created: [[Furu Wei]], [[Zeyu Qin]], [[Penn State University]]
- Pages updated: [[合成データ]], [[スケーリング則]], [[Microsoft]], [[Peking University]], [[Hong Kong University of Science and Technology]]
- Key insight: SYNTHLLMが生成する合成データはrectified scaling lawに従い、モデルサイズが大きいほど少ないトークン数で性能上限に近づくことを示し、合成データが枯渇しつつあるウェブデータの予測可能な代替になり得ることを実証した。
## [2026-09-11] ingest-paper | Demystifying Synthetic Data in LLM Pre-training
- Source: `.raw/papers/2025.emnlp-main.544.pdf`
- Summary: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]
- Pages created: [[Feiyang Kang]], [[Newsha Ardalani]], [[Ruoxi Jia]], [[Mostafa Elhoushi]]
- Pages updated: [[Michael Kuchnik]], [[Carole-Jean Wu]], [[Virginia Tech]], [[Meta FAIR]], [[Cerebras]], [[合成データ]], [[スケーリング則]], [[モデル崩壊]]
- Key insight: リフレーズ合成データを約30%混合すると自然データより5〜10倍速く検証損失に到達するが、教科書スタイル純生成合成データはモデル崩壊が予測する劣化パターンを示すことを1000超のLLM学習で実証した。
## [2026-09-11] ingest-paper | Scaling Data-Constrained Language Models
- Source: `.raw/papers/24-1000.pdf`
- Summary: [[@2025__JMLR__Scaling Data-Constrained Language Models]]
- Pages created: [[Niklas Muennighoff]], [[Boaz Barak]], [[Teven Le Scao]], [[Aleksandra Piktus]], [[Nouamane Tazi]], [[Sampo Pyysalo]], [[Thomas Wolf]], [[Colin Raffel]], [[University of Turku]], [[Hugging Face]]
- Pages updated: [[Sasha Rush]], [[Harvard University]], [[スケーリング則]], [[計算最適訓練]], [[データ枯渇]]
- Key insight: データ制約下では反復トークンの価値が指数的に減衰し(半減期R_D*≈15)、エポック数をパラメータ数より速く増やす配分がChinchilla則より計算最適であることを実証した。
- Deferred: C4データセット, OSCARコーパス, The Stack, muP — 1回言及に留まり閾値未達のため見送り
## [2026-09-11] ingest-paper | Scaling Inference Prefill with High-Radix Photonic Interconnects
- Source: `.raw/papers/arxiv-2609.01821.pdf` + 発表スライド `.raw/slides/arxiv-2609.01821/`
- Summary: [[@2026__HOTI__Scaling Inference Prefill with High-Radix Photonic Interconnects]]
- Pages created: [[@2026__HOTI__Scaling Inference Prefill with High-Radix Photonic Interconnects]], [[Lightmatter]], [[Arulselvan Madhavan]], [[Peter Carson]], [[Taylor Groves]], [[Thomas Graham]], [[Lightmatter Passage]], [[フォトニックインターコネクト]]
- Pages updated: [[AIデータセンタートポロジ]], [[Prefill-Decode分離]], [[Mixture-of-Experts]]
- Key insight: 3D集積フォトニックインターコネクトは帯域4倍・radix 8倍でスケールアップpodを1152 GPUまで拡張し、電気配線のpod境界越えペナルティを回避することでプリフィルレイテンシを最大2.1〜5.8倍改善するが、デコード側の容量共設計無しにはend-to-end改善に直結しない(HotI 2026 Best Paper Award)。
## [2026-09-10] ingest | batch (2 sources)
- Source: `.raw/articles/programming-languages-for-ai-2026-09-10.md`
- Summary: [[@2026__PloehBlog__Programming Languages for AI]]
- Pages created: [[Mark Seemann]], [[Szymon Teżewski]], [[Idris]]
- Pages updated: [[バイブコーディング]]
- Key insight: LLM時代のプログラミング言語論として、型システムによる検証可能性の最大化をバイブコーディングへの対抗軸として提示する。
- Source: `.raw/articles/alphadev-discovers-faster-sorting-algorithms-2026-09-10.md`
- Summary: [[@2023__DeepMindBlog__AlphaDev Discovers Faster Sorting Algorithms]]
- Pages created: [[AlphaDev]], [[LLVM]], [[Abseil]]
- Pages updated: [[強化学習]], [[AlphaGo]]
- Key insight: AlphaDev はアセンブリ命令レベルの探索という強化学習応用で、人手最適化を上回るソートアルゴリズムを発見し LLVM/Abseil に実装された。
## [2026-09-10] ingest-paper | Will we run out of data? Limits of LLM scaling based on human-generated data
- Source: `.raw/papers/arxiv-2211.04325.pdf`
- Summary: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]
- Pages created: [[Pablo Villalobos]], [[Anson Ho]], [[Jaime Sevilla]], [[Tamay Besiroglu]], [[Lennart Heim]], [[Marius Hobbhahn]], [[Epoch AI]], [[University of Aberdeen]], [[Centre for the Governance of AI]], [[データ枯渇]], [[合成データ]]
- Pages updated: [[MIT CSAIL]], [[Universität Tübingen]], [[スケーリング則]]
- Key insight: 現行のLLM開発トレンドが続けば、公開人間生成テキストデータの総ストックは中央値2028年(範囲2026-2032年)に完全利用され、合成データ・転移学習・データ効率改善が回避策として有望。
## [2026-09-09] wiki-survey | AIインフラにおけるストラグラー問題(TSLoc追加)
- 更新: [[wiki/surveys/AIインフラにおけるストラグラー問題]](母集団23本→24本)
- 追加ソース: [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]](KDD 2026、CNIC/StepFun)
- 統合箇所: 第1章(本番障害内訳GPU52%/NIC18.3%/crash13.2%/PCIe9.1%)、第5章(新設「教師あり(既知パターン)と教師なし(逸脱検知)」節、MinderとTSLocの設計対比)、第6章(検知システム表に行追加、Minder周辺の議論拡張、fail-slow検知困難性の新パラグラフ)、第8章(新設「検知システムはRLの役割異質性を前提していない」節、TSLocのRL誤検知事例)、第9章(組織別実配備表にCNIC/StepFun行追加)、第10章(発見7: fail-slow検知困難性が学習パラダイムを問わず一貫することをAstralとTSLocの2系統から独立に確認)、第11章(役割異質ノード群への一般化を未解決の問いに追加)。
- 統合方針: 単発の追記でなく、既存の座標系(軸2: 検知信号源)と横断的発見(発見1〜6)に新しい軸(学習パラダイム: 教師あり/教師なし)を接続する形で取り込んだ。姉妹章(第6章の検知手法と第8章のRL波及)を橋渡しする記述として第8章に新節を立てた。
- 検証: wikilink実在・ダッシュ0件・中黒0件・禁止表現0件を再検査。数値(Acc@5=0.908、Fail-Stop 0.952/Fail-Slow 0.643、障害内訳4項目)をsourceページへ遡及し一致を確認。
- 未反映: wiki/index.md の Surveys 節の一行要約(文献本数「23本」表記)は wiki-catalog.py に update コマンドがなく Read/Edit も禁止のため未更新。次回のフォールドまたは棚卸しで修正する。
## [2026-09-08] wiki-survey | AIインフラにおけるストラグラー問題(図表転載)
- 更新: [[wiki/surveys/AIインフラにおけるストラグラー問題]]
- 各source ページの`_attachments/`から14点を抜き出し、本文の該当主張の直後へ挿入した(図1-1〜図9-1、章内連番)。
- 選定基準は「本文の主張の証拠になるか」。主要な図: ARGUS図1(4096GPUジョブでのfail-slow累積進捗損失)、TOCS図1(ZooKeeperのheartbeatが症状を隠す構図)、TOS図18(EAB低下のペア数依存)、OSDI図11/13(シーケンス長CDFとGCストラグラータイムライン)、Pulse図1(OP-level対sub-OP-levelの32us粒度ギャップ)、SWE-RL図4/AgentRL図2(同期対非同期RLパイプラインの対比)。
- 実見の結果、OSDI図11とMinder図2、SC論文図3は複数図が1クロップに混在していたため、SC論文図3(Fig3+Fig4混在)は不採用、OSDI図11(Fig11+Fig13混在)とMinder図2(Fig1+Fig2混在)は両図番号を明記して採用した。
- 0点とした章: 第2章(座標系定義、表のみ)、第10章(横断的発見)、第11章(未解決の問い)。総括・座標系の章に単一ソースの図を貼ると特定論文への依存に見えるため。
- 全14点の画像パスは実ファイル存在を検査済み(欠損0件)。address は再採番していない。
## [2026-09-08] ingest-paper | Networked Agent Memory and Causality Representation: Experiences towards Interpretable Cloud-Scale Root-Causing
- Source: `.raw/papers/Networked-Agent-Memory-and-Causality-Representation-Experiences-towards-Interpretable-Cloud-Scale-Root-Causing.pdf`
- Summary: [[@2026__SIGCOMM__Networked Agent Memory and Causality Representation - Experiences towards Interpretable Cloud-Scale Root-Causing]]
- Pages created: [[@2026__SIGCOMM__Networked Agent Memory and Causality Representation - Experiences towards Interpretable Cloud-Scale Root-Causing]], [[XiHe]], [[Yanyu Ren]], [[Networked Agent Memory]], [[Networked Causality Representation]]
- Pages updated: [[Alibaba Cloud]], [[Tsinghua University]], [[Zhongguancun Laboratory]], [[Nanjing University]], [[BiAn]], [[agentic SRE]], [[AIOps]], [[ReAct]], [[ドメイン別RCA]]
- Key insight: XiHe はマルチエージェント分割の部分観測性を Networked Agent Memory(トポロジ制約付き軽量通信)で解消し、Networked Causality Representation(OKB検証付き因果グラフ)へ統合することで、精度94.6%・アラート625倍スケールでも精度低下4.6ポイントに抑える。
## [2026-09-08] wiki-survey | AIインフラにおけるストラグラー問題
- Question: 「AIインフラのストラグラー問題に関するサーベイを作成して」
- Output: [[wiki/surveys/AIインフラにおけるストラグラー問題]](address c-006670、448行、11章構成)
- Retrieval: retrieve.py はollama不達でrerank縮退(bm25のみ)。起点concept [[ストラグラー]](sources 14本)と[[フェイルスローハードウェア]](sources 3本)のfrontmatterを全件抽出し、追加でrg密度確認とretrieve.py複数クエリ(fail-slow/GPU性能劣化/SDC/RL非同期等)で母集団を23本まで拡張。
- 体制: 6クラスタ(一般fail-slow理論/事後分析実測/ノード健全性管理/トレース診断システム/組織別本番事例/信頼性・RL波及)にExplore subagentを並列投入して精読、メイン文脈が座標系設計・全11章の執筆・整文検査を実施。
- 骨格: サーベイ型。4軸(根本原因/検知信号源と粒度/学習フェーズ/データ出自)を第2章で座標系として明示し、第3-4章を原因、第5-6章を検知手法、第7章を緩和策、第8章をフェーズ横断波及、第9章を組織別実装で切った。
- 姉妹編との分担: [[LLM学習インフラ実運用の教科書]]第VIII部と母集団が大きく重複するため、比較表・信号源分類の基礎は参照に留め、本ページは原因の体系化・検知設計原理の対比・学習フェーズ横断波及(事前学習とRL事後学習の異同)・組織別実装比較に絞った。
- Key insight: 「遅いワーカー=壊れたマシン」という直観が計算層(OSDI)・ストレージI/O層(TOS)・ハードウェア層(TPDS)の3層で独立に反証される一方、両者は「主因の統計的多数派」と「実害の大きい少数派経路」という異なる問いに答えており矛盾しない。
- 執筆規範: japanese-tech-writing適用。ダッシュ0件、中黒0件(wikilink内を除く全置換)、禁止表現(重要なのは/正面から/多角的/掘り下げ)0件、数値10件をsourceページへ遡及し全件一致を確認。
- Gap: ヘテロジニアス/輻輳環境でのOSDI結論の一般化可能性、TP/CPグループ内ストラグラーの観測手法、複数同時fail-slow障害への対応、SDCとストラグラーの交差点、GPU世代交代が検知システム設計に与える影響が未解決。図表転載はフェーズ5で0点と判断(既存図が個別論文のアーキテクチャ図中心で本文の直接証拠になりにくいため)。
## [2026-09-08] ingest-paper | Pegasus: A Data Center Network for Bare-Metal AI Cloud
- Source: `.raw/papers/Pegasus--A-Data-Center-Network-forBare-Metal-AI-Cloud.pdf`
- Summary: [[@2026__SIGCOMM__Pegasus - A Data Center Network for Bare-Metal AI Cloud]]
- Pages created: [[@2026__SIGCOMM__Pegasus - A Data Center Network for Bare-Metal AI Cloud]], [[Xianneng Zou]], [[Yiran Zhang]]
- Pages updated: [[Tsinghua University]], [[Tencent]], [[Nanjing University]], [[Shanghai Jiao Tong University]], [[Xingda Wei]], [[RDMA]], [[データセンター輻輳制御]], [[ネットワーク仮想化]], [[RDMAネットワークロードバランシング]], [[スマートNICオフロード]]
- Key insight: TencentのベアメタルAIクラウドPegasusは、DPUをGPUサーバ内の内側制御プレーンに、RNICをテナントRDMAデータプレーンに分離する協調アーキテクチャで消費電力を10.5%削減しつつ、パケットスプレイングとクレジットベース輻輳制御のRNICオフロードでLLM学習性能を4.8〜53.2%改善した。
## [2026-09-07] ingest-paper | Using expect to Automate System Administration Tasks
- Source: `.raw/papers/libes1990-expect-lisa.pdf`
- Summary: [[@1990__LISA__Using expect to Automate System Administration Tasks]]
- Pages created: [[Don Libes]], [[National Institute of Standards and Technology]], [[Expect]]
- Pages updated: なし
- Key insight: UNIX の対話プログラム自動化問題を疑似端末介在の高水準言語 expect で解いた 1990年 LISA 論文。図表はASCII図1点のみで埋め込み画像は無し。
## [2026-09-07] ingest-paper | The Log-Structured Merge-Tree (LSM-Tree)
- Source: `.raw/papers/The-Log-Structured-Merge-Tree-LSM-Tree.pdf`
- Summary: [[@1996__Acta Informatica__The Log-Structured Merge-Tree (LSM-Tree)]]
- Pages created: [[@1996__Acta Informatica__The Log-Structured Merge-Tree (LSM-Tree)]], [[Patrick O'Neil]], [[Elizabeth O'Neil]], [[Edward Cheng]], [[Dieter Gawlick]], [[UMass-Boston]], [[Oracle Corporation]], [[Five Minute Rule]]
- Pages updated: [[LSMツリー]], [[B-tree]], [[Digital Equipment Corporation]]
- Key insight: LSM-treeを最初に定義したO'Neilら1996年の原論文をwikiに追加した。既存のLSMツリーconceptはBigtable/Cassandra以降のSSTable方式の実装知見のみで構成されていたが、原論文はrolling merge(C0/C1間の逐次マージ)・多成分の最適サイズ比(幾何級数、Theorem 3.1)・並行性制御・回復設計を数式付きで提示しており、既存知見の理論的基盤を補完する。
## [2026-09-07] ingest-paper | When GPUs Fail Quietly: Observability-Aware Early Warning Beyond Numeric Telemetry
- Source: `.raw/papers/arxiv-2603.28781.pdf`
- Summary: [[@2026__arXiv__When GPUs Fail Quietly - Observability-Aware Early Warning Beyond Numeric Telemetry]]
- Pages created: [[@2026__arXiv__When GPUs Fail Quietly - Observability-Aware Early Warning Beyond Numeric Telemetry]], [[Michael Bidollahkhani]], [[Freja Nordsiek]], [[Julian M. Kunkel]], [[GWDG]]
- Pages updated: [[GPU観測性]]
- Key insight: GPU の detachment 系障害は数値前兆をほぼ残さず、GPU テレメトリと監視パイプライン劣化指標の joint モデリングが GPU 単独より早期警告リードタイムを増大させる。
## [2026-09-07] ingest-paper | SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series
- Source: `.raw/papers/arxiv-2607.22548.pdf`
- Summary: [[@2026__arXiv__SeT-Diff - Towards Semantic Foundation Models for HPC Telemetry and Time-Series]]
- Pages created: [[@2026__arXiv__SeT-Diff - Towards Semantic Foundation Models for HPC Telemetry and Time-Series]], [[Giovanni B. Esposito]], [[Francesco Antici]], [[Daniele Cesarini]], [[Andrea Bartolini]]
- Pages updated: [[University of Bologna]], [[CINECA]], [[Marconi100]], [[時系列基盤モデル]], [[拡散モデル]]
- Key insight: HPC compute node テレメトリの初の基盤モデルSeT-Diffは、拡散モデルの生成過程をセンサーのテキスト意味記述で条件付けることでpermutation stabilityを実現し、単一モデルで欠損補完・予測・仮想センシングを兼務する。
## [2026-09-07] ingest-paper | μSlope: High Compression and Fast Search on Semi-Structured Logs
- Source: `.raw/papers/osdi24-wang-rui.pdf`
- Summary: [[@2024__OSDI__μSlope - High Compression and Fast Search on Semi-Structured Logs]]
- Pages created: [[@2024__OSDI__μSlope - High Compression and Fast Search on Semi-Structured Logs]], [[Rui Wang (YScope)]], [[Devin Gibson]], [[Kirk Rodrigues]], [[Yun Zhang (Uber)]], [[Kaibo Wang]], [[Yupeng Fu]], [[Ting Chen (Uber)]], [[YScope]], [[CLP]], [[半構造化データ管理]], [[ログ圧縮と検索]]
- Pages updated: [[Yu Luo (University of Toronto)]], [[Ding Yuan]], [[Uber]], [[University of Toronto]]
- Key insight: スキーマ構造をレコードから切り離して一度だけ保持する(MPT + Schema Map)ことで、既存 SSDMS のスキーマメタデータ肥大化というボトルネックを解消し、平均圧縮率 68.1:1・検索速度 ClickHouse 比 2.47x を達成した。
## [2026-09-07] ingest-paper | Splitwise: Efficient Generative LLM Inference Using Phase Splitting
- Source: `.raw/papers/Splitwise--Efficient-Generative-LLM-Inference-Using-Phase-Splitting.pdf`
- Summary: [[@2024__ISCA__Splitwise - Efficient Generative LLM Inference Using Phase Splitting]]
- Pages created: [[Pratyush Patel]], [[Chaojie Zhang]], [[Saeed Maleki]], [[SplitwiseSim]], [[Azure Public Dataset]]
- Pages updated: [[Prefill-Decode分離]], [[Esha Choukse]], [[Aashaka Shah]], [[Íñigo Goiri]], [[Ricardo Bianchini]], [[University of Washington]], [[Microsoft]], [[vLLM]], [[MSCCL++]]
- Key insight: ISCA 2024のSplitwiseはPrefill-Decode分離の初期の代表実装で、Azure実運用トレースの特性評価(Insight I-VII)とレイヤー単位KVキャッシュパイプライン転送(E2Eオーバーヘッド0.8%)で分離設計を実証した。
## [2026-09-07] ingest-paper | State of AI: An Empirical 100 Trillion Token Study with OpenRouter
- Source: `.raw/papers/arxiv-2601.10088.pdf`
- Summary: [[@2026__arXiv__State of AI - 100 Trillion LLM Interactions with OpenRouter]]
- Pages created: [[OpenRouter]], [[Malika Aubakirova]], [[Alex Atallah]], [[Chris Clark]], [[Justin Summerville]], [[Anjney Midha]], [[LLM利用実態分析]], [[エージェント型推論]], [[Cinderella Glass Slipper効果]]
- Pages updated: [[Andreessen Horowitz]]
- Key insight: OpenRouterの100兆トークン規模の課金メタデータ分析により、OSSモデルが2025年後半に利用量の約1/3へ到達し、推論最適化モデルへのトークンシェアが50%超に達したこと、ロールプレイがOSSモデル利用の過半数を占めること、そして新しい定着分析フレームワーク「Cinderella Glass Slipper効果」が示された。
## [2026-09-07] ingest-paper | Fighting the Fog of War: Automated Incident Detection for Cloud Systems
- Source: `.raw/papers/atc21-li-liqun.pdf`(発表スライド `.raw/slides/atc21-li-liqun/` も統合)
- Summary: [[@2021__ATC__Fighting the Fog of War - Automated Incident Detection for Cloud Systems]]
- Pages created: [[@2021__ATC__Fighting the Fog of War - Automated Incident Detection for Cloud Systems]], [[インシデント検知]], [[Xu Zhang]], [[Pu Zhao]], [[Bo Qiao]], [[Pochian Lee]], [[Jeffrey Sun]], [[Li Yang]], [[Xin Zhao]], [[Microsoft 365]], [[The University of Newcastle]], [[Warden]]
- Pages updated: [[アラート相関]], [[Liqun Li]], [[Hongyu Zhang]], [[Yu Kang]], [[Shilin He]], [[Feng Gao]], [[Qingwei Lin]], [[Saravan Rajmohan]], [[Zhangwei Xu]], [[Dongmei Zhang]], [[Microsoft Research]], [[Microsoft Azure]], [[University of Chinese Academy of Sciences]]
- Key insight: WardenはアラートのみからGroup Shapely Value(GSV)というグループ単位モデル解釈でインシデント指示アラートを識別し、検知(BRF)と説明(GSV)を分離する設計を取る。cross-service incidentの検知遅延という「fog of war」問題への実運用解。
## [2026-09-07] ingest-paper | 障害管理・アラーム相関の歴史的論文8件バッチ(1995-2014)
- Sources:
- [[@1995__IM__A Coding Approach to Event Correlation]](Kliger, Yemini+, IM 1995)
- [[@1995__INFOCOM__Automatic Alarm Correlation for Fault Identification]](Rouvellou & Hart, INFOCOM 1995)
- [[@1997__IM__Automated Proactive Anomaly Detection]](Hood & Ji, IM 1997)
- [[@1998__PER__Internet Service Performance Failure Detection]](Ward, Glynn, Richardson, PER 1998)
- [[@1999__JNSM__Rule Discovery in Telecommunication Alarm Data]](Klemettinen, Mannila, Toivonen, JNSM 1999)
- [[@2000__LISA__Aberrant Behavior Detection in Time Series for Network Service Monitoring]](Brutlag, LISA 2000)
- [[@2013__KDD__An Integrated Framework for Optimizing Automatic Monitoring Systems in Large IT Infrastructures]](Tang+, KDD 2013)
- [[@2014__KDD__Towards Scalable Critical Alert Mining]](Zong+, KDD 2014)
- New concepts: [[コードブックによるイベント相関]]、[[アラーム相関]]、[[頻出エピソードマイニング]]、[[重要アラートマイニング]]
- Updated concepts: [[異常検知]]、[[変化点検知]]、[[プロアクティブ障害管理]]、[[根本原因分析]]、[[アラート相関]]、[[アラート抑制]]、[[ログベースイベント相関]]
- Key insight: 1995年の符号理論ベースのコードブック相関(Kliger+)からPFSMベースの確率的アラーム相関(Rouvellou & Hart)、1999年の頻出エピソードマイニングによる半自動ルール発見(TASA)、2000年のHolt-Winters時系列異常検知(Brutlag)、2013-2014年の偽陽性/偽陰性抑制と劣モジュラ最適化による重要アラート選定(Tang+, Zong+)まで、アラーム相関・異常検知ドメインの主要な設計思想が20年間でどう分岐・発展したかの系譜が wiki 上に揃った。
## [2026-09-07] ingest | IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud
- Source: `.raw/articles/ibm-granite-time-series-models-confluent-cloud-2026-09-07.md`
- Summary: [[@2026__IBM__IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud]]
- Pages created: [[Confluent]], [[FlowState]]
- Pages updated: [[IBM]], [[Apache Flink]], [[Tiny Time Mixers (TTM)]], [[TSPulse]], [[PatchTST]], [[時系列基盤モデル]]
- Key insight: IBM Granite Time Series の4モデル(PatchTST-FM-r1・FlowState-r1.1・TTM-r3・TSPulse)がConfluent CloudのFlink SQL関数(AI_FORECAST・AI_DETECT_ANOMALIES)経由でモデル差し替え可能なストリーミング推論として商用統合された。
## [2026-09-07] ingest | TimesFM-3: A zero-shot foundation model for multivariate forecasting
- Source: `.raw/articles/timesfm-3-a-zero-shot-foundation-model-for-multivariate-forecasting-2026-09-07.md`
- Summary: [[@2026__Google Research Blog__TimesFM-3 - A Zero-Shot Foundation Model for Multivariate Forecasting]]
- Pages created: [[時間-変量交互アテンション]], [[Ayush Jain]], [[Petros Mol]], [[Samet Oymak]], [[Time leaderboard]]
- Pages updated: [[TimesFM]], [[GIFT-Eval]], [[FEV-Bench]], [[Rajat Sen]], [[Yichen Zhou]], [[Abhimanyu Das]], [[Google Research]], [[多変量時系列予測]], [[時系列基盤モデル]], [[Contiguous Patch Masking]]
- Key insight: TimesFM-3 は decoder-only な時系列基盤モデルとして初めて複数ターゲット・過去共変量・過去-未来共変量の3種の多変量共変量にゼロショットでネイティブ対応し、causal temporal attention と full variate attention を交互に積む設計(時間-変量交互アテンション)と Contiguous Patch Masking による非自己回帰デコードで GIFT-Eval・FEV-Bench・Time leaderboard の3ベンチマーク全てで首位を獲得した。
## [2026-09-07] ingest-paper | LISA歴史論文バッチ11件(cfengine, Why Order Matters, ISconf, Seeking Closure, Cost Model, LiveOps, Two-Person Control, Automated Planning, NSDMiner, Analyzing Log Analysis, ntopng)
- Sources: [[@2000__LISA__Use of Cfengine for Automated, Multi-Platform Software and Patch Distribution]], [[@2002__LISA__Why Order Matters - Turing Equivalence in Automated Systems Administration]], [[@2003__LISA__ISconf - Theory, Practice, and Beyond]], [[@2003__LISA__Seeking Closure in an Open World - A Behavioral Agent Approach to Configuration Management]], [[@2005__LISA__Toward a Cost Model for System Administration]], [[@2006__LISA__LiveOps - Systems Management as a Service]], [[@2009__LISA__Two-Person Control Administration - Preventing Administration Faults through Duplication]], [[@2011__LISA__Automated Planning for Configuration Changes]], [[@2012__LISA__On the Accurate Identification of Network Service Dependencies in Distributed Systems]], [[@2014__LISA__Analyzing Log Analysis - An Empirical Study of User Log Mining]], [[@2014__LISA__Realtime High-Speed Network Traffic Monitoring Using ntopng]]
- Pages created: 11 source pages, 30 entity pages(stub中心), 3 concept新設([[二人制御]], [[永続状態相互作用監査]], [[Deep Packet Inspection]])
- Pages updated: [[収束型システム管理]], [[べき等性]], [[プル型構成配布]], [[宣言的設定管理]], [[待ち行列理論]], [[内部者リスク]], [[異常検知]], [[ネットワーク監視]], [[ネットワーク依存性発見]] ほか既存entity多数
- Key insight: LISA 2000-2014の構成管理・監査・依存性発見系論文11本を一括取り込み。Traugott(2002)「ISconfは停止性問題に免疫」とKanies(2003)「congruence/convergenceは実装レベルで直交する」という正面対立を発見し、両ページにcontradiction calloutを設置。
- Deferred: なし(各論文でconcept新設は上限内)
## [2026-09-07] ingest-paper | LiveOps: Systems Management as a Service
- Source: `.raw/papers/verbowski.pdf`
- Summary: [[@2006__LISA__LiveOps - Systems Management as a Service]]
- Pages created: [[@2006__LISA__LiveOps - Systems Management as a Service]], [[Chad Verbowski]], [[Juhan Lee]], [[Xiaogang Liu]], [[Roussi Roussev]], [[Yi-Min Wang]], [[Microsoft MSN]], [[Florida Institute of Technology]], [[永続状態相互作用監査]]
- Pages updated: [[異常検知]]
- Key insight: LiveOps はアプリケーションのログ出力に依存せず、OSレベルで永続状態(レジストリ・ファイル・バイナリ・プロセス生成)への全アクセスを非参加型に監査することで、静的インストールマニフェストの不完全性(ファイルの31〜70%がorphan)や、パッチ適用後も再起動せず脆弱なバイナリを使い続けるstale processを検知できる。
- Deferred: なし(concept新規1件・更新1件で上限内)
## 2026-09-07 | ingest | USENIX LISA '11 会議報告
- Source: `.raw/articles/lisa11reports-2012.pdf`(;login: Vol.37 No.2, 2012年4月)
- Summary: [[@2012__login__USENIX LISA '11 - 25th Large Installation System Administration Conference]]
- Pages created: [[Doug Hughes]], [[Luke Kanies]], [[Ben Rockwood]], [[Joyent]], [[LOPSA]], [[Carolyn Rowland]], [[Nagios]]
- Pages updated: [[Thomas A. Limoncelli]], [[Mark Burgess]], [[Bryan Cantrill]], [[Michael Stonebraker]], [[Paul Anderson]], [[USENIX]], [[SAGE]], [[DevOps]], [[宣言的設定管理]]
- Key insight: 2011年時点でGoogle SREのreadiness reviewモデル・Etsy Deployinatorの継続的デプロイ文化・Puppet Labs(Kanies)のAgile Manifesto援用論・LISA併設ワークショップの設定管理論争が同一カンファレンス上で並走しており、DevOpsという語自体はまだバズワード化への懸念とともに定義が定まっていなかった。LISA '11 Best Student Paper(Herry/Anderson/Wickler)は宣言的設定管理ツールの実行順序不定性をPDDLプランナーで解決する手法を提示した。
- Note: 同時に指定されたURL(Limoncelliのエッセイ"LISA made LISA obsolete")は2026-08-16に既にingest済みのため重複作成せず、既存ページへの相互参照のみ追加した。
## [2026-09-06] ingest-paper | Log Analysis and Event Correlation Using Variable Temporal Event Correlator (VTEC)
- Source: `.raw/papers/lisa10-krizak-vtec.pdf`
- Summary: [[@2010__LISA__Log Analysis and Event Correlation Using Variable Temporal Event Correlator (VTEC)]]
- Pages created: [[Paul Krizak]], [[ログベースイベント相関]]
- Pages updated: [[AMD]], [[@1993__LISA__Automated System Monitoring and Notification With Swatch]]
- Key insight: VTECはSwatch・SEC・初期Splunkの欠点を背景にモジュール間TCP疎結合+時間的変数データ型を内製し、17年前のSwatchと時間窓によるフラッド抑制という設計に独立収束。
## [2026-09-06] ingest-paper | Chukwa - A System for Reliable Large-Scale Log Collection
- Source: `.raw/papers/lisa10-rabkin-chukwa.pdf`
- Summary: [[@2010__LISA__Chukwa - A System for Reliable Large-Scale Log Collection]]
- Pages created: [[Ariel Rabkin]], [[Chukwa]], [[信頼性を持つ大規模ログ収集アーキテクチャ]]
- Pages updated: [[Randy H. Katz]], [[UC Berkeley]], [[階層型メトリック収集アーキテクチャ]]
- Key insight: Chukwaはコレクタを完全ステートレスにし再送責任をエージェント側へ寄せる設計で、コレクタ障害時のデータ無損失復旧と200MB/秒までの線形スケールを両立。
## [2026-09-06] ingest-paper | Nix - A Safe and Policy-Free System for Software Deployment
- Source: `.raw/papers/lisa04-dolstra-nix.pdf`
- Summary: [[@2004__LISA__Nix - A Safe and Policy-Free System for Software Deployment]]
- Pages created: [[Eelco Dolstra]], [[Merijn de Jonge]], [[Eelco Visser]], [[Utrecht University]], [[コンテンツアドレス指定ストレージ]]
- Pages updated: [[イミュータブルインフラストラクチャ]]
- Key insight: Nix(2004)はビルド入力の暗号学的ハッシュによるコンテンツアドレス指定と rename() によるアトミック世代切り替えで、複数バリアント共存とアトミックなロールバックを両立。
## [2026-09-06] ingest-paper | A Retrospective on Twelve Years of LISA Proceedings
- Source: `.raw/papers/lisa99-anderson.pdf`
- Summary: [[@1999__LISA__A Retrospective on Twelve Years of LISA Proceedings]]
- Pages created: [[Eric Anderson]]
- Pages updated: [[David A. Patterson]], [[University of California, Berkeley]], [[システム管理者からSREへの視点転換]]
- Key insight: Anderson & Patterson(LISA'99)はLISA proceedings 12年分・342論文を2モデルで再分類し、学術的厳密さの導入を志向していた一次資料。
## [2026-09-06] ingest-paper | Towards a High-Level Machine Configuration System
- Source: `.raw/papers/lisa94-anderson.ps`(PDF不存在のためPostScript原本+ASCII本文で取り込み)
- Summary: [[@1994__LISA__Towards a High-Level Machine Configuration System]]
- Pages created: [[Paul Anderson]]
- Pages updated: [[University of Edinburgh]], [[宣言的設定管理]]
- Key insight: lcfgシステム(1994)は中央データベースを唯一の情報源として動的再構成する発想を、静的焼き込み対動的読み込みという後年のSSOT問題と同じ枠組みで定式化。
## [2026-09-06] ingest-paper | Bootstrapping an Infrastructure
- Source: `.raw/papers/lisa98-traugott-bootstrapping.pdf`
- Summary: [[@1998__LISA__Bootstrapping an Infrastructure]]
- Pages created: [[Steve Traugott]], [[Joel Huddleston]], [[プル型構成配布]]
- Pages updated: [[cfengine]], [[イミュータブルインフラストラクチャ]], [[べき等性]]
- Key insight: インフラを単一の疎結合分散仮想マシンと見なしpull型配布を主張した、immutable infrastructure・GitOpsの源流にあたる1998年の実運用論文。
## [2026-09-06] ingest-paper | MRTG - The Multi Router Traffic Grapher
- Source: `.raw/papers/lisa98-oetiker-mrtg.pdf`
- Summary: [[@1998__LISA__MRTG - The Multi Router Traffic Grapher]]
- Pages created: [[Tobias Oetiker]]
- Pages updated: [[ETH Zürich]], [[時系列データベース]]
- Key insight: MRTGのRound Robin Database(固定サイズ循環領域へのポインタ更新)は、後発TSDBMSストレージエンジンの源流となる1998年時点の実例。
## [2026-09-06] ingest-paper | An Analysis of UNIX System Configuration
- Source: `.raw/papers/lisa97-evard.pdf`
- Summary: [[@1997__LISA__An Analysis of UNIX System Configuration]]
- Pages created: [[Remy Evard]], [[Northeastern University (USA)]]
- Pages updated: [[Argonne National Laboratory]], [[収束型システム管理]]
- Key insight: Evard(1997)の計算機ライフサイクルモデルと変化量予測式は、Burgess(2000)の数理的収束理論を3年先取りする実務観察。
## [2026-09-06] ingest-paper | Modules: Providing a Flexible User Environment
- Source: `.raw/papers/modules-furlani-1991.pdf`(配布元 Cloudflare 対策のため WebFetch 経由で取得)
- Summary: [[@1991__LISA__Modules - Providing a Flexible User Environment]]
- Pages created: [[John L. Furlani]]
- Key insight: Modules は環境変更をシェル非依存のmoduleファイルにカプセル化し、module(1)単一コマンドで動的add/remove/switchを可能にした設計で、Environment Modules・Lmodの源流。
## [2026-09-06] ingest-paper | Automated System Monitoring and Notification With Swatch
- Source: `.raw/papers/lisa93-hansen-swatch.pdf`
- Summary: [[@1993__LISA__Automated System Monitoring and Notification With Swatch]]
- Pages created: [[Stephen E. Hansen]], [[E. Todd Atkins]]
- Pages updated: [[Stanford University]], [[異常検知]]
- Key insight: swatch(1993)は正規表現・アクション・時間間隔抑制の4フィールド設定で常時稼働のログ監視と重複通知抑制を実現し、Borgmonより約20年早い先例。
## [2026-09-06] ingest-paper | Alibaba Stellar: A New Generation RDMA Network for Cloud AI
- Source: `.raw/papers/Alibaba-Stellar--A-New-Generation-RDMA-Network-for-Cloud-AI.pdf`
- Summary: [[@2025__SIGCOMM__Alibaba Stellar - A New Generation RDMA Network for Cloud AI]]
- Pages created: [[Jie Lu]], [[Zhiqiang He]], [[Jiamin Cao]], [[Chao Wang (Alibaba)]]
- Pages updated: [[Fei Feng]], [[Jianbo Dong]], [[Pengcheng Zhang]], [[Ennan Zhai]], [[Jiesheng Wu]], [[Binzhang Fu]], [[Dennis Cai]], [[Alibaba Cloud]], [[GPUDirect RDMA]], [[RDMA]], [[ハードウェア仮想化]], [[マルチテナントRDMA性能分離]]
- Key insight: StellarはSR-IOV由来のVirtual Functionを完全排除し(SF+virtio直接マッピング)、PVDMA・eMTT・128パスOblivious Packet Sprayingの3機構でVF数上限・PCIeスイッチLUT制限・RDMA/TCP干渉を同時解消した。
## [2026-09-06] ingest-paper | Mitigating Scalability Walls of RDMA-based Container Networks (ScalaCN)
- Source: `.raw/papers/nsdi25-liu-wei.pdf`
- Summary: [[@2025__NSDI__Mitigating Scalability Walls of RDMA-based Container Networks]]
- Pages created: [[Feng Qian]], [[Lanlan Xi]], [[Chao Qin]]
- Pages updated: [[Wei Liu]], [[Kun Qian]], [[Zhenhua Li]], [[Tianyin Xu]], [[Yunhao Liu]], [[Yu Guan]], [[Shuhong Zhu]], [[Hongfei Xu]], [[Ennan Zhai]], [[Tsinghua University]], [[Alibaba Cloud]], [[University of Southern California]], [[UIUC]], [[ホスト内ネットワークボトルネック]], [[マルチテナントRDMA性能分離]]
- Key insight: RCNのスケーラビリティ壁の正体はRNIC内部のeSwitchフローテーブル照会にあり、combinatorial causal testingでO(k^n)をO(k・n^2)へ圧縮し、ブラックボックスRNICでも原因推論と能動的緩和を可能にした。
## [2026-09-06] ingest-paper | White-Boxing RDMA with Packet-Granular Software Control
- Source: `.raw/papers/nsdi25-zhao-chenxingyu.pdf`
- Summary: [[@2025__NSDI__White-Boxing RDMA with Packet-Granular Software Control]]
- Pages created: [[Jaehong Min]]
- Pages updated: [[Chenxingyu Zhao]], [[Ming Liu]], [[Arvind Krishnamurthy]], [[University of Washington]], [[University of Wisconsin-Madison]], [[BlueField-3]], [[RDMA]], [[マルチテナントRDMA性能分離]], [[データセンター輻輳制御]], [[スマートNICオフロード]]
- Key insight: QPスケジューラのデキュー速度を単一の制御ノブとして再定義し、BlueField-3 DPA上のイベント駆動フレームワークでパケット粒度のソフトウェア制御を実現、輻輳制御・公平化・マルチパス・受信者主導フロー制御を統一的に扱える(white-boxing RDMA)。
## [2026-09-06] ingest-paper | Network Load Balancing with In-network Reordering Support for RDMA (ConWeave)
- Source: `.raw/papers/Network-Load-Balancing-with-In-network-Reordering-Support-for-RDMA.pdf`
- Summary: [[@2023__SIGCOMM__Network Load Balancing with In-network Reordering Support for RDMA]]
- Pages created: [[Cha Hwan Song]], [[Raj Joshi]], [[Inho Choi]], [[Jialin Li]], [[Mun Choon Chan]], [[RDMAネットワークロードバランシング]]
- Pages updated: [[Xin Zhe Khooi]], [[National University of Singapore]]
- Key insight: RDMAはRNICハードウェアペーシングで既存のTCP向けロードバランシング(ECMP・flowlet・per-packet spraying)がいずれも性能を悪化させるため、ConWeaveはRTT単位の能動的再ルーティングとToRでの順序反転隠蔽で解決した。
- Deferred: [[フローレットスイッチング]], [[データセンターネットワークロードバランシング]]
## [2026-09-06] ingest-paper | FaSST: Fast, Scalable and Simple Distributed Transactions with Two-Sided (RDMA) Datagram RPCs
- Source: `.raw/papers/osdi16-kalia.pdf`
- Summary: [[@2016__OSDI__FaSST- Fast, Scalable and Simple Distributed Transactions with Two-Sided (RDMA) Datagram RPCs]]
- Pages created: [[Anuj Kalia]], [[Michael Kaminsky]], [[Intel Labs]]
- Pages updated: [[David G. Andersen]], [[Carnegie Mellon University]], [[分散トランザクション]], [[RDMA]]
- Key insight: 片側RDMAではなく両側の非信頼データグラム上のRPCを通信プリミティブに選ぶことで、より少ないハードウェア資源でFaRM・DrTM+Rを上回る分散トランザクション性能を達成した。
## [2026-09-06] ingest-paper | U-Net: A User-Level Network Interface for Parallel and Distributed Computing
- Source: `.raw/papers/U-Net--a-user-level-network-interface-for-parallel-and-distributed-computing.pdf`
- Summary: [[@1995__SOSP__U-Net- A User-Level Network Interface for Parallel and Distributed Computing]]
- Pages created: [[Thorsten von Eicken]], [[Anindya Basu]], [[Vineet Buch]]
- Pages updated: [[Werner Vogels]], [[Cornell University]], [[カーネルバイパスネットワーキング]], [[ゼロコピーネットワーキング]]
- Key insight: U-Netは1995年時点でカーネルをNI経路から排除し、市販ATMハードウェアのみで多重化・保護・ゼロコピーを実現した、カーネルバイパス設計の直接の先駆け。
## [2026-09-06] ingest-paper | FaRM: Fast Remote Memory
- Source: `.raw/papers/nsdi14-paper-dragojevic.pdf`
- Summary: [[@2014__NSDI__FaRM- Fast Remote Memory]]
- Pages created: [[Aleksandar Dragojević]], [[Dushyanth Narayanan]], [[Orion Hodson]], [[Miguel Castro]]
- Pages updated: [[RDMA]], [[分散共有メモリ]], [[分散トランザクション]], [[Microsoft Research]]
- Key insight: FaRMはRDMAの低レベル最適化(PhyCo・QP共有)とアプリ層抽象化(共有アドレス空間+ACIDトランザクション+ロックフリー読み出し)を一体設計し、TCP/IPベースライン比一桁の性能改善を達成した。
## [2026-09-06] ingest-paper | Design Guidelines for High Performance RDMA Systems
- Source: `.raw/papers/atc16_paper-kalia.pdf`
- Summary: [[@2016__ATC__Design Guidelines for High Performance RDMA Systems]]
- Pages updated: [[David G. Andersen]], [[Carnegie Mellon University]], [[ホスト内ネットワークボトルネック]], [[トランスポートプロトコル設計]]
- Key insight: RDMA性能はverb/transport選択よりPCIeトランザクション数とNIC内部WQEキャッシュのミス管理で決まり、ネットワークsequencerを50倍(122 Mrps)、HERDのCPU効率を83%改善した。
## [2026-09-05] ingest-paper | AutoDA-Timeseries - Automated Data Augmentation for Time Series
- Source: `.raw/papers/AutoDA-Timeseries--Automated-Data-Augmentation-for-Time-Series.pdf`
- Summary: [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]]
- Pages created: [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]], [[Zijun Dou]]
- Pages updated: [[Zhenhe Yao]], [[Zhe Xie]], [[Xidao Wen]], [[Tong Xiao]], [[Dan Pei]], [[Tsinghua University]], [[Alibaba Cloud]], [[時系列データ生成]]
- Key insight: catch22 特徴を条件とした積層拡張層で拡張の確率と強度を単一段 end-to-end 最適化する初の汎用 AutoDA フレームワーク。5タスク横断で NoAug 比 +6.7% の一貫改善と推論時ゼロオーバーヘッドを両立。
## [2026-09-05] ingest-paper | ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts
- Source: `.raw/papers/ViTs--Teaching-Machines-to-See-Time-Series-Anomalies-Like-Human-Experts.pdf`
- Summary: [[@2026__WWW2026__ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts]]
- Pages created: [[@2026__WWW2026__ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts]], [[Hengyue Jiang]], [[Yang Liu]], [[Qwen2.5-VL]]
- Pages updated: [[Zexin Wang]], [[Changhua Pei]], [[Dan Pei]], [[Gaogang Xie]], [[Quan Zhou]], [[Haotian Si]], [[Hang Cui]], [[Jianhui Li]], [[Jingjing Li]], [[Tsinghua University]], [[Nanjing University]], [[ChatTS]], [[KAN-AD]], [[異常検知]], [[ビジョン言語モデル]]
- Key insight: ViTs は時系列を折れ線グラフ画像として VLM に入力する TS-VLM 方式により、7B・15k サンプルの合成データのみの学習でゼロショット汎化し SOTA を上回る。
## [2026-09-05] ingest-paper | A Benchmark for Language Models in Real-World System Building
- Source: `.raw/papers/arxiv-2601.12927.pdf`
- Summary: [[@2026__arXiv__A Benchmark for Language Models in Real-World System Building]]
- Pages created: [[@2026__arXiv__A Benchmark for Language Models in Real-World System Building]], [[Zeshun Huang]]
- Pages updated: [[Build-bench]], [[Open Build Service]], [[クロスISAマイグレーション]], [[自動ビルド修復]]
- Key insight: arXiv 2601.12927 は既に取り込み済みの TOSEM 拡張版と著者集団・ベンチマーク(Build-bench)・数値がほぼ完全一致する短報版で、エラーカテゴリの実数内訳(Figure 2)が独自の新規情報。
## [2026-09-05] ingest-slides | Orchestrate Next-Generation AI Workloads With Open-Source Slurm
- Source: `.raw/slides/Slurm_GTC_2026/Slurm_GTC_2026.pdf`
- Visual pages: `.raw/slides/Slurm_GTC_2026/pages/`
- Media: `.raw/slides/Slurm_GTC_2026/media/media.url` (video URLのみ、字幕/文字起こし未取得)
- Summary: [[@2026__GTC__Orchestrate Next-Generation AI Workloads With Open-Source Slurm]]
- Pages created: [[SchedMD]], [[Slinky]], [[Tim Wickberg]], [[Danny Auble]]
- Pages updated: [[Slurm]], [[トポロジ考慮型スケジューリング]], [[Dynamic Resource Allocation (DRA)]], [[GPUクラスタスケジューリング]]
- Key insight: SchedMDのNVIDIA傘下入り後もSlurm/Slinkyは完全オープンソースを維持し、NVL72向け多層トポロジ計画(`topology/block`)、Hero jobs向け即時再試行(Expedited Requeue)、およびK8s Scheduling Framework/DRA連携(Slurm Bridge/Operator)の統合が進む。
- Deferred: [[Expedited Requeue]], [[SLUID]] — concept上限(新規3/更新5)のため保留。
## [2026-09-05] ingest-paper | Balancing Workload Performance and Slurm Stress - Four Nextflow Deployment Strategies
- Source: `.raw/papers/arxiv-2608.13824.pdf`
- Summary: [[@2026__arXiv__Balancing Workload Performance and Slurm Stress - Four Nextflow Deployment Strategies]]
- Pages created: [[Nil Tianchen Mu]], [[William Dizon]], [[Glen Otero]], [[Torey Battelle]], [[Nextflow]], [[HyperQueue]], [[パイロットジョブ]]
- Pages updated: [[HPCジョブスケジューリング]], [[Slurm]], [[Flux Framework]], [[Arizona State University]]
- Key insight: Nextflow→Slurm の配備選択はユーザー時間と制御面 RPC を同時に動かし、最適点はサイト制約下の非支配フロンティア上にある。
## [2026-09-05] ingest-paper | Evaluating Forecasting Techniques for Hardware Errors on a Large-scale HPC System
- Source: `.raw/papers/arxiv-2608.01648.pdf`
- Summary: [[@2026__arXiv__Evaluating Forecasting Techniques for Hardware Errors on a Large-scale HPC System]]
- Pages created: [[Kaiyuan Liao]], [[Xiwei Xuan]], [[Tanwi Mallick]], [[Kevin Brown]], [[Christopher D. Carothers]], [[Kwan-Liu Ma]], [[Theta]], [[Rensselaer Polytechnic Institute]]
- Pages updated: [[Argonne Leadership Computing Facility]], [[Argonne National Laboratory]], [[University of California, Davis]], [[障害予測]], [[LSTM]], [[Transformer]]
- Key insight: ハードウェアエラー日次系列の予測は系列の時間構造に強く依存し、規則的な Minor のみ LSTM/Transformer が有効で、疎・バースト系列では信号側に予測限界がある。
## [2026-09-05] ingest-paper | A Scalable Pattern Mining Workflow for Interpretable Machine Log Analysis in High-Performance Computing Environments
- Source: `.raw/papers/arxiv-2607.19143.pdf`
- Summary: [[@2026__arXiv__A Scalable Pattern Mining Workflow for Interpretable Machine Log Analysis in High-Performance Computing Environments]]
- Pages created: [[Shilpika]], [[Bethany Lusch]], [[Eric Pershey]], [[Carlo Graziani]], [[Venkatram Vishwanath]], [[Michael E. Papka]], [[Argonne Leadership Computing Facility]], [[シーケンスマイニング]]
- Pages updated: [[ログ解析]], [[ログベース異常検知]], [[ログパース]], [[Argonne National Laboratory]], [[University of Illinois Chicago]], [[Redis]], [[Drain]]
- Key insight: 約 900GB のエクサスケール syslog を pat-AHO / seq-AHO に圧縮し、優先度付き二層シーケンスマイニングで希少高優先度系列を高い再現率で抽出しつつミリ秒照合する。
## [2026-09-05] ingest-paper | Characterizing Production GPU Workloads using System-wide Telemetry Data
- Source: `.raw/papers/ipdps2026c.pdf`
- Summary: [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]]
- Pages created: [[Onur Cankur]], [[Brian Austin]], [[Dhruva Kulkarni]], [[NERSC]]
- Pages updated: [[Abhinav Bhatele]], [[Perlmutter]], [[LDMS]], [[NVIDIA Data Center GPU Manager]], [[University of Maryland]], [[Lawrence Berkeley National Laboratory]], [[Slurm]], [[HPCワークロード特性化]], [[Rooflineモデル]], [[メモリバウンド]], [[GPU観測性]], [[GPUエネルギー効率]]
- Key insight: 本番 Perlmutter の 1 か月 DCGM テレメトリではジョブの約 81% がメモリバウンドでエネルギー消費が重く、80 GB 要求の 55% はピーク HBM が容量の半分以下である。
## [2026-09-05] ingest-paper | Minos - Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
- Source: `.raw/papers/Minos--Systematically-Classifying-Performance-and-Power-Characteristics-of-GPU-Workloads-on-HPC-Clusters.pdf`
- Summary: [[@2026__POMACS__Minos - Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters]]
- Pages created: [[Rutwik Jain]], [[Yiwei Jiang]], [[Minos]], [[電力スパイク]], [[周波数キャッピング]], [[GPUワークロード分類]]
- Pages updated: [[電力管理]], [[HPCワークロード特性化]], [[GPU性能変動]], [[GPUクラスタ運用]], [[Matthew D. Sinclair]], [[Shivaram Venkataraman]], [[University of Wisconsin-Madison]], [[Texas Advanced Computing Center]], [[AMD]], [[NVIDIA]]
- Key insight: 電力スパイク分布と SM/DRAM 利用率の二重分類により、未見 GPU ワークロードの周波数キャップをスイープなしで予測でき、プロファイリングを約 89% 削減しつつ高精度なキャップ探索を可能にする。
## [2026-09-05] ingest-paper | Understanding Large-Scale HPC System Behavior Through Cluster-Based Visual Analytics
- Source: `.raw/papers/Understanding-Large-Scale-HPC-System-Behavior-Through-Cluster-Based-Visual-Analytics.pdf`
- Summary: [[@2026__ISC__Understanding Large-Scale HPC System Behavior Through Cluster-Based Visual Analytics]]
- Pages created: [[Allison Austin]], [[Yan To Linus Lam]], [[Yun-Hsin Kuo]], [[ビジュアルアナリティクス]]
- Pages updated: [[異常検知]], [[時系列クラスタリング]], [[テレメトリ]], [[クラスタリング]], [[Shilpika]], [[Venkatram Vishwanath]], [[Michael E. Papka]], [[Kwan-Liu Ma]], [[University of California, Davis]], [[Argonne National Laboratory]], [[University of Illinois Chicago]], [[Theta]], [[Ganglia]]
- Key insight: ラベル無し HPC 監視テンソルを MulTiDR→k-means→ccPCA(群間)と mrDMD z スコア(群内)に分け、DR キャッシュで対話再実行するクラスタベース VA が問題ノード群を対話的に切り出す。
## [2026-09-05] ingest-paper | Federated Transfer Learning for Anomaly Detection in HPC Systems
- Source: `.raw/papers/Federated-Transfer-Learning-for-Anomaly-Detection-in-HPC-Systems--First-Real-World-Validation-on-a-Tier-0-Supercomputer.pdf`
- Summary: [[@2026__ESWA__Federated Transfer Learning for Anomaly Detection in HPC Systems]]
- Pages created: [[Emmen Farooq]], [[Michela Milano]], [[Andrea Borghesi]], [[Marconi100]], [[連合学習]]
- Pages updated: [[異常検知]], [[ラベル不足への対処]], [[CINECA]], [[University of Bologna]]
- Key insight: Tier-0 Marconi100 の 100 ノード実テレメトリで、連合に参加しないノードへデコーダのみ微調整する FTL が半教師ありで異常検知 F1 スコアを大幅に向上させる。
## [2026-09-05] ingest-paper | From Noisy Telemetry to Actionable Warnings: GPU Failure Prediction in Industrial Clusters
- Source: `.raw/papers/ISSRE26-Falcon.pdf`
- Summary: [[@2026__ISSRE__From Noisy Telemetry to Actionable Warnings - GPU Failure Prediction in Industrial Clusters]]
- Pages created: [[@2026__ISSRE__From Noisy Telemetry to Actionable Warnings - GPU Failure Prediction in Industrial Clusters]], [[Run Zhu]], [[Guanjin Wang]], [[Linlin Han]]
- Pages updated: [[Yongqian Sun]], [[Wenwei Gu]], [[Mengyao Li]], [[Shenglin Zhang]], [[Yang Zhang (ByteDance)]], [[Xin Wu (ByteDance)]], [[Feng Wang (ByteDance)]], [[Xiaozhou Liu (ByteDance)]], [[Yu Zhang (ByteDance)]], [[障害予測]], [[GPUクラスタ運用]]
- Key insight: ByteDance本番GPUクラスタ(1,000台超)のチケット紐づきテレメトリに対し、欠測考慮の時系列・ピア相対特徴、障害固有学習器選択、閾値・N-of-K持続性・クールダウンによるイベント形成を組み合わせたFalconが4障害でF1最高、リードタイム中央値17.34-35.57時間、1か月の本番展開で50件中40件確認。
- Note: 会議名(ISSRE 2026 と推定)・公開日は本文に明記なくファイル名/配布URLからの推定。
## [2026-09-05] ingest-thesis (re-ingest) | Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations
- Source: `.raw/theses/survey-2026-why-transformers/`(9章、入力: pdf。前回 ingest-paper で1枚物として取り込んだ `.raw/papers/TOSEM26-WhyTransformer.*` を章分割し直したもの。旧原本は不変のため温存)
- Hub entity: [[Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations]](entity_type: survey)
- Chapters: [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 1 Introduction]]〜Chapter 9 Conclusion(9件)
- Pages created: 上記10件
- Pages updated: [[AIOps]] / [[Transformer]] / [[LLM時系列アプローチ]] / [[LLMによる根本原因分析]] / [[Binpeng Shi]](旧1枚物sourceへのリンクを章sourceへ retarget)
- Removed: 旧1枚物 source `wiki/sources/@2026__TOSEM__Why Transformers...md` と旧attachment 4点(`_attachments/TOSEM26-WhyTransformer/`)
- Key insight: 章分割により図表を4点(旧ingest)から16点(全Fig.1-8・Table1-8)へ全件化。§8.4のトレース分析がグラフ構造ゆえTransformerと構造的に相性が悪いという指摘、§5.2.1のTSFM/LLM4TSの2分岐、§5.3.4の特徴抽出器→コパイロット→自律エージェントの3層構造が章単位で明確に文脈づけられた。
- Note: `wiki/entities/Dan Pei.md`・`wiki/entities/Shenglin Zhang.md`・`wiki/surveys/時系列基盤モデルのクラウド運用応用サーベイ.md` にも同種のretarget編集を適用済みだが、他セッションの並行編集と混在しているため本コミットには含めていない(作業ツリーには反映済み)。
## [2026-09-05] ingest-paper | Labeling the Invisible: A Scalable Framework for Labeling Fail-Slow Failures in Cloud Storage Systems
- Source: `.raw/papers/fast27spring-paper55.pdf`
- Summary: [[@2027__FAST__Labeling the Invisible - A Scalable Framework for Labeling Fail-Slow Failures in Cloud Storage Systems]]
- Pages created: [[@2027__FAST__Labeling the Invisible - A Scalable Framework for Labeling Fail-Slow Failures in Cloud Storage Systems]], [[IASO]]
- Pages updated: [[Huawei Cloud]], [[PERSEUS]], [[ChaosBlade]], [[GrayScope]], [[フェイルスローハードウェア]]
- Key insight: 時間視点とピア視点を候補区間レベルで統合し、パターン中心のクラスタ重心ラベリング+伝播により手動ラベリング時間を90%超削減(Huawei Cloud本番デプロイ、F1=0.851/0.903/0.945)。
- Note: 著者非開示のダブルブラインド査読中稿(anonymous.4open.science リポジトリのみ確認)。venue・年は fast27spring-paper55 というファイル名からの推定。
## [2026-09-05] ingest-paper | CubeTrace: Microscopic Network Tracing for Heterogeneous Cloud Gateways
- Source: `.raw/papers/CubeTrace--Microscopic-Network-Tracing-for-Heterogeneous-Cloud-Gateways.pdf`
- Summary: [[@2026__SIGCOMM__CubeTrace Microscopic Network Tracing for Heterogeneous Cloud Gateways]]
- Pages created: [[Yinchao Yang]], [[Jiaqi Zheng]], [[Xuqian Li]], [[Dongbo Gu]], [[Miantao Wan]], [[Chao Pei]], [[ネットワークトレーシング]], [[クラウドゲートウェイ]], [[プログラマブルスイッチ]]
- Pages updated: [[Yunming Xiao]], [[Jun Zhang]], [[Chen Tian]], [[Mingwei Xu]], [[Ang Chen]], [[Congcong Miao]], [[The Chinese University of Hong Kong, Shenzhen]], [[Tencent]], [[Nanjing University]], [[Tsinghua University]], [[University of Michigan]], [[National University of Singapore]], [[分散トレーシング]]
- Key insight: 異種混在ハードウェア(CPU/プログラマブルスイッチ/FPGA)を横断する統一トレーシング単位「cube」をフロー粒度で定義し、パケット粒度への一意なデコード可否を二部グラフ+DFSで多項式時間判定するCubeTraceが、本番クラウドゲートウェイで問題箇所特定時間を数時間〜数日から数分へ短縮した。
## [2026-09-05] ingest-paper | KnowLution: A Multi-Agent Framework for Execution-Oriented Autonomous Operations in Production Supercomputers
- Source: `.raw/papers/2026289015.pdf`
- Summary: [[@2026__ISSRE__KnowLution - A Multi-Agent Framework for Execution-Oriented Autonomous Operations in Production Supercomputers]]
- Pages created: [[@2026__ISSRE__KnowLution - A Multi-Agent Framework for Execution-Oriented Autonomous Operations in Production Supercomputers]], [[Yuqi Li]], [[Liquan Xiao]], [[Xiuhong Tan]], [[Aiwen Yu]], [[Jinghua Feng]], [[National SuperComputer Center in Tianjin]], [[Tianhe-NG]]
- Pages updated: [[AIOps]], [[Yongqian Sun]], [[Lei Tao]], [[Tongqing Zhou]], [[Yuan Yuan]], [[National University of Defense Technology]], [[Nankai University]]
- Key insight: 実行志向のHPC O&Mでは、状態接地とツール実行前検証(能力・依存・権限)を欠くとRAG/ReAct系でも会話志向タスクに留まり、実行前検証コンポーネントの有無がTSRに最大の差(85%→54%)を生む。
- Deferred: なし(concept新設なし。既存 AIOps ハブへの観察追記のみ)。
## [2026-09-05] ingest-paper | CoLMAD: Cost-Efficient LLM-Assisted Time Series Anomaly Detection for Industrial Monitoring
- Source: `.raw/papers/Xiaoyu__CoLMAD_to_ISSRE_26.pdf`
- Summary: [[@2026__ISSRE__CoLMAD : Cost-Efficient LLM-Assisted Time Series Anomaly Detection for Industrial Monitoring]]
- Pages created: [[Xiaoyu Feng]], [[Hailin Zhang]], [[Yong Xu]], [[Yuxin Wu]], [[Lauren Zhang]], [[Cong Chen]]
- Pages updated: [[異常検知]], [[Shenglin Zhang]], [[Wenwei Gu]], [[Yongqian Sun]], [[Yu Kang]], [[Jiacheng Zhang]], [[Dan Pei]], [[Yingnong Dang]], [[Nankai University]], [[Microsoft Research]], [[Tsinghua University]]
- Key insight: 常時稼働の軽量検知器+選択的LLM検証という2段構成で、LLM呼び出し比率0.5%のまま日次コストを87.92→0.08USDへ削減する設計を実証した。
- Deferred: なし
## [2026-09-05] ingest-paper | THXInLog: Robust Semantic-Temporal Framework for Log Anomaly Detection in Production Supercomputers
- Source: `.raw/papers/2026289027.pdf`
- Summary: [[@2026__nkcs.iops.ai__THXInLog - Robust Semantic-Temporal Framework for Log Anomaly Detection in Production Supercomputers]]
- Pages created: [[@2026__nkcs.iops.ai__THXInLog - Robust Semantic-Temporal Framework for Log Anomaly Detection in Production Supercomputers]], [[Yuqi Li]], [[Liquan Xiao]], [[Xiuhong Tan]], [[Jinghua Feng]], [[Yiqiang Li]], [[National SuperComputer Center in Tianjin]], [[Tianhe-NG]]
- Pages updated: [[Yongqian Sun]], [[Lei Tao]], [[Tongqing Zhou]], [[Yuan Yuan]], [[National University of Defense Technology]], [[Nankai University]], [[ログベース障害診断]], [[対照学習]], [[異常検知]]
- Key insight: LLM を per-log 推論経路の外に置きエキスパート検証済みフィードバックのみでクローズドループ適応するテンプレートフリー設計(TTC+LOF+Dual-Scope Transformer)が、Tianhe-NG 本番ログで代表的なテンプレートベース・パーサフリー・LLMベース手法をいずれも上回った(F1=0.9082)。
## [2026-09-05] ingest-thesis | Post-Training in Time Series Foundation Models: A Unifying Framework
- 再取り込み: 旧 1 枚物 source(2026-09-01 ingest-paper)を、34ページ・10節構成の長編サーベイと判断し章単位に再構成。旧 source は削除。
- Source: `.raw/theses/arxiv-2607.20002/`(10 章 / arXiv:2607.20002)
- Hub entity: [[Post-Training in Time Series Foundation Models A Unifying Framework]]
- Chapters: [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 1 Introduction]]〜[[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 10 Conclusion]](10件)
- Pages updated: [[時系列基盤モデルの後学習]] / [[時系列基盤モデルの文脈拡張]] / [[時系列予測の不確実性制御]] / [[知識蒸留]] / [[多変量時系列予測]] / [[時系列基盤モデル]] / 著者・所属entity 15件
- Key insight: 図1〜7(既存attachment)は各章の対応節に1:1で対応しており、attachment再利用のみで章分割後も全図の埋め込みを維持できた。
## [2026-09-05] ingest-paper | Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis
- Source: `.raw/papers/arxiv-2608.21310.pdf`
- Summary: [[@2026__arXiv__Beyond Fault Localization - A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis]]
- Pages created: [[Xiaochuan Yan]], [[ThinkDepth.ai]], [[AIQ]], [[Claude Code]], [[mABC]], [[RCABench]], [[AIOps Challenge 2025]], [[DiagGuard]], [[エージェント軌跡評価]]
- Pages updated: [[Qisheng Lu]], [[Aoyang Fang]], [[Junjielong Xu]], [[Jin'ao Shang]], [[Songhan Zhang]], [[Yifan Yang]], [[Pinjia He]], [[The Chinese University of Hong Kong, Shenzhen]], [[Xi'an Jiaotong University]], [[Train-Ticket]], [[TaskWeaver]], [[OpenRCA]], [[根本原因分析]], [[LLMによる根本原因分析]]
- Key insight: 最終回答の正解率は診断過程を隠す。伝播経路の再構築(Edge F1)は根本原因特定(Node F1)より難しく、誤診断は「証拠の未収集/誤読/根拠なき推論」の3分類に還元でき、これを防御アーキテクチャ(DiagGuard)化すると held-out 設定で Acc@1 が改善する。
## [2026-09-05] ingest-paper | Making Core Memory: Design Inquiry into Gendered Legacies of Engineering and Craftwork
- Source: `.raw/papers/Making-Core-Memory--Design-Inquiry-into-GenderedLegacies-of-Engineering-and-Craftwork.pdf`
- Summary: [[@2018__CHI__Making Core Memory - Design Inquiry into Gendered Legacies of Engineering and Craftwork]]。CHI 2018。Apollo Guidance Computerのコア・ロープメモリを手作業で織ったRaytheon社の女性ライン工(Little Old Ladies)の不可視化された労働を、電子キルトと参加型ワークショップで物質化するフェミニスト・デザイン研究。
- Pages created: [[Daniela K. Rosner]], [[Samantha Shorey]], [[Brock Craft]], [[Helen Remick]], [[Raytheon]], [[見えない労働とジェンダー化された技術労働]], [[フェミニスト・デザインリサーチ手法]]
- Pages updated: [[Apollo Guidance Computer]]
- Key insight: 支配的な技術史は材料の能力(コアが何を保持できるか)に焦点を当て、それを実現する組み立て労働(織り手の身体化された技能)を不可視化する。エラーの帰責も労働者個人のスキルではなく素材・設計判断へ転換すべきという視座を提示する。
## [2026-09-05] ingest-paper | Benchmarking Change Detection Exactness and Overhead of Instrumentation and Sampling
- Source: `.raw/papers/Benchmarking-Change-Detection-Exactness-and-Overhead-of-Instrumentation-and-Sampling.pdf`
- Summary: [[@2026__ICPE__Benchmarking Change Detection Exactness and Overhead of Instrumentation and Sampling]]
- Pages created: [[Juozas Skarbalius]], [[Lancaster University Leipzig]], [[async-profiler]], [[SJSW]], [[性能変化検知の正確性]]
- Pages updated: [[David Georg Reichelt]], [[Kieker]], [[MooBench]], [[OpenTelemetry]], [[トレーシングオーバーヘッド]], [[オブザーバビリティ]]
- Key insight: 計装のオーバーヘッドは約0.5μs/呼び出しで統計的に有意だが、変化検知の正確性(F1-score)では深さ4で計装50VM対サンプリング10VMと、サンプリングが著しく優位。測定精度(accuracy)と変化検知の正確性(exactness)は異なる軸であることを明示した。
## [2026-09-05] ingest-paper | The Lightweight Distributed Metric Service (LDMS)
- Source: `.raw/papers/The-Lightweight-Distributed-Metric-Service--A-Scalable-Infrastructure-for-Continuous-Monitoring-of-Large-Scale-Computing-Systems-and-Applications.pdf`
- Summary: [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]]
- Pages created: [[LDMS]], [[OVIS]], [[Cray Inc]], [[Open Grid Computing]], [[Chama]], [[Anthony Agelastos]], [[階層型メトリック収集アーキテクチャ]]
- Pages updated: [[分散モニタリング]], [[HPCワークロード特性化]]
- Key insight: LDMSはGangliaのプッシュ・マルチキャスト型とは対照的にプル型・区間駆動ポーリングに統一し、fan-in 9,000〜15,000:1のデイジーチェーン集約で27,648ノード規模の低オーバーヘッド連続監視を本番実証した。
## [2026-09-05] ingest-paper | Comprehensive Resource Use Monitoring for HPC Systems with TACC Stats
- Source: `.raw/papers/Comprehensive-Resource-Use-Monitoring-for-HPC-Systems-with-TACC-Stats.pdf`
- Summary: [[@2014__HUST__Comprehensive Resource Use Monitoring for HPC Systems with TACC Stats]]
- Pages created: [[TACC Stats]], [[Lariat]], [[Todd Evans]]
- Pages updated: [[SUPReMM]], [[Texas Advanced Computing Center]], [[University at Buffalo]], [[UT Austin]], [[Ganglia]]([[William L. Barth]]等の共著者stubをfullへ昇格)
- Key insight: TACC Statsは全ノード・全ジョブの完全自動収集をオーバーヘッド0.1%未満で実現し、job_sweeper.pyの単純な閾値検知だけで実運用の非効率を発見できることを示した。
- Note: 並行ingestにより新設したHPCジョブレベルリソース監視conceptは重複と判明したため、[[HPCジョブモニタリング]]へ統合済み(オーケストレータによる後処理)。TACC Stats.md/TACC_Stats.mdのentity重複もTACC Statsへ統合済み。
## [2026-09-05] ingest-paper | ClusterCockpit: A web application for job-specific performance monitoring
- Source: `.raw/papers/ClusterCockpit---A-web-application-for-job-specific-performance-monitoring.pdf`
- Summary: [[@2019__CLUSTER__ClusterCockpit - A web application for job-specific performance monitoring]]
- Pages created: [[ClusterCockpit]], [[Jan Eitzinger]], [[Thomas Gruber]], [[Ayesha Afzal]], [[Thomas Zeiser]], [[Likwid Monitoring Stack (LMS)]], [[SOS (Scalable Object Store)]], [[Baler]], [[REMORA]], [[PerSyst]], [[DCDB]], [[YAViT]]
- Pages updated: [[LIKWID]], [[Gerhard Wellein]], [[Friedrich-Alexander-Universität Erlangen-Nürnberg]], [[InfluxDB]], [[Redis]], [[Sandia National Laboratories]], [[Texas Advanced Computing Center]], [[HPCジョブモニタリング]]
- Key insight: ClusterCockpitは汎用時系列ダッシュボード(Grafana)のper-query権限モデル欠如とレンダリング性能欠陥を独自Webフロントエンド開発で回避し、提示層に注力する設計を取る。
- Note: 並行ingestにより新設したHPCジョブ単位性能監視conceptは重複と判明したため、[[HPCジョブモニタリング]]へ統合済み(オーケストレータによる後処理)。
## [2026-09-05] ingest-paper | PIKA: Center-Wide and Job-Aware Cluster Monitoring(+ SC21スライド統合)
- Source: `.raw/papers/PIKA--Center-Wide-and-Job-Aware-Cluster-Monitoring.pdf`(発表スライド統合済み)
- Summary: [[@2020__CLUSTER__PIKA - Center-Wide and Job-Aware Cluster Monitoring]]
- Pages created: [[PIKA]], [[collectd]], [[Robert Dietrich]], [[Frank Winkler]], [[Andreas Knüpfer]], [[Wolfgang Nagel]], [[HPCジョブモニタリング]]
- Pages updated: [[SLURM]], [[TU Dresden]], [[LIKWID]], [[InfluxDB]], [[Ganglia]], [[時系列データベース]]
- Key insight: PIKAは「収集はジョブ非依存に安価・汎用に行い、ジョブ単位の意味づけは事後にSLURMメタデータと突き合わせて導出する」設計原則を採る。
## [2026-09-05] ingest-paper | Open XDMoD: A Tool for the Comprehensive Management of High-Performance Computing Resources
- Source: `.raw/papers/open-XDmoD--A-Tool-for-the-Comprehensive-Management-of-High-Performance-Computing-Resources.pdf`
- Summary: [[@2015__CiSE__Open XDMoD - A Tool for the Comprehensive Management of High-Performance Computing Resources]]
- Pages created: [[Open XDMoD]], [[SUPReMM]], [[SUNY Buffalo Center for Computational Research]], [[XSEDE]], [[UBMoD]], [[Application Kernel Remote Runner]], [[XALT]], [[HPCジョブ会計とリソース利用可視化]], [[アプリケーションカーネルによるHPC QoS監視]](ほか著者stub多数)
- Pages updated: [[Texas Advanced Computing Center]], [[データウェアハウス]]
- Key insight: Open XDMoDはジョブ会計・QoS監視・ジョブレベル性能診断の3層を単一スタックに統合し、starflakeスキーマで大規模ジョブ履歴への対話的可視化を最大41倍高速化する。
## [2026-09-05] ingest-paper | Leveraging NVML GPM for NVIDIA GPU Monitoring
- Source: `.raw/papers/Leveraging-NVML-GPM-for-NVIDIA-GPU-Monitoring.pdf`
- Summary: [[@2026__SCAHPCAsiaWS__Leveraging NVML GPM for NVIDIA GPU Monitoring]]
- Pages created: [[Christian Wassermann]], [[Tobias Dollenbacher]], [[Christian Terboven]], [[Matthias S. Müller]], [[RWTH Aachen University]], [[NVML-GPM-Collector]], [[Telegraf]]
- Pages updated: [[NVIDIA Data Center GPU Manager]], [[GPU観測性]], [[GPU占有率(Occupancy)]], [[GPU性能変動]], [[GPUエネルギー効率]], [[GPUクラスタ運用]]
- Key insight: NVML GPMはSMクロック周波数の3区分モデルで後処理補正して初めてNsight Compute参照値との誤差が大幅改善する(SM利用率28.35%pt→2.31%pt)。
- Deferred: [[GPUマイクロベンチマーク]] — 上限超過。次の関連ソースで。
## [2026-09-05] ingest-paper | SLURM: Simple Linux Utility for Resource Management
- Source: `.raw/papers/SLURM--Simple-Linux-Utility-for-Resource-Management.pdf`
- Summary: [[@2003__JSSPP__SLURM - Simple Linux Utility for Resource Management]]
- Pages created: [[SLURM]], [[Morris Jette]], [[Mark Grondona]], [[Andy B. Yoo]]
- Pages updated: [[Lawrence Livermore National Laboratory]], [[HPCジョブスケジューリング]]
- Key insight: SLURMは高度なスケジューリングポリシーをMaui SchedulerやDPCS等の外部プラグインへ意図的に外出しする「ポリシーとメカニズムの分離」設計を採る。
## [2026-09-05] ingest | Benchmarking GPUDirect RDMA on Modern Server Platforms
- Source: `.raw/articles/benchmarking-gpudirect-rdma-on-modern-server-platforms-2026-09-05.md`
- Summary: [[@2014__NVIDIA Developer Blog__Benchmarking GPUDirect RDMA on Modern Server Platforms]]
- Pages created: [[@2014__NVIDIA Developer Blog__Benchmarking GPUDirect RDMA on Modern Server Platforms]], [[Davide Rossetti]], [[Open MPI]]
- Pages updated: [[GPUDirect RDMA]], [[非対称NUMAインターコネクト]], [[MVAPICH2]], [[NVIDIA]], [[Mellanox]]
- Key insight: 2014年のIvy Bridge Xeon実測で、ソケット間QPIバスを跨ぐGPU-NIC P2P通信はwrite方向250MB/s・read方向1.1GB/sという著しい非対称ボトルネックを示し、PCIeスイッチ直結構成はこれをほぼ解消する(write 11.6GB/s・read 7GB/s)。
## [2026-09-05] ingest-paper | The DMA Streaming Framework: Kernel-Level Buffer Orchestration for High-Performance AI Data Paths
- Source: `.raw/papers/arxiv-2603.10030.pdf`
- Summary: [[@2026__arXiv__The DMA Streaming Framework - Kernel-Level Buffer Orchestration for High-Performance AI Data Paths]]
- Pages created: [[Marco Graziano]], [[Graziano Labs Corp]], [[dmaplane]], [[TransferEngine]], [[nvidia-peermem]]
- Pages updated: [[NCCL]], [[Mooncake]], [[Prefill-Decode分離]], [[NUMAメモリ配置]]
- Key insight: dmaplane はカーネル空間で dma-buf・kernel RDMA・NUMA 配置検証・クレジット式フロー制御・GPU BAR ピニングを統合するバッファオーケストレーション層で、NUMA 配置ペナルティは 64MB で 18% 現れるが 1MB では隠れ、クレジット制御は極端なストール下でも CQ overflow ゼロを維持する。
## [2026-09-05] ingest | GPUDirect RDMA (NVIDIA CUDA Docs)
- Source: `.raw/articles/gpudirect-rdma-2026-09-05.md`
- Summary: [[@2026__NVIDIA__GPUDirect RDMA]]
- Pages created: [[@2026__NVIDIA__GPUDirect RDMA]], [[nvidia-peermem]]
- Pages updated: [[GPUDirect RDMA]], [[NVIDIA]]
- Key insight: GDRの高性能実装には遅延アンピニング・レジストレーションキャッシュ・同期コールバック設計が必須で、nv-p2p APIはCUDA 13.0でLinuxアップストリームAPI(pin_user_pages等)への移行が明示的に推奨されている。
## [2026-09-05] ingest-paper | GPU-Aware MPI on RDMA-Enabled Clusters: Design, Implementation and Evaluation
- Source: `.raw/papers/GPU-Aware-MPI-on-RDMA-Enabled-Clusters--Design-Implementation-and-Evaluation.pdf`
- Summary: [[@2014__TPDS__GPU-Aware MPI on RDMA-Enabled Clusters - Design, Implementation and Evaluation]]
- Pages created: [[Hao Wang]], [[Carlos Rosales]], [[Texas Advanced Computing Center]], [[Oakley supercomputer]], [[GPU-Aware MPI]]
- Pages updated: [[Sreeram Potluri]], [[Devendar Bureddy]], [[Dhabaleswar K. Panda]], [[MVAPICH2]], [[The Ohio State University]], [[GPUDirect RDMA]], [[格子ボルツマン法]]
- Key insight: GPUDirect RDMA非搭載環境でも、MPI派生データ型をベクトル化してGPUカーネルでpack/unpackし、PCIe/ネットワーク転送と重ね合わせる非同期パイプラインにより、64GPUのmultiphase 3D LBMで最大19.9%のアプリケーションレベル性能改善を得た(IEEE TPDS 2014)。
## [2026-09-04] ingest-paper | Efficient Inter-node MPI Communication using GPUDirect RDMA for InfiniBand Clusters with NVIDIA GPUs
- Source: `.raw/papers/Efficient-Inter-node-MPI-Communication-using-GPUDirect-RDMA-for-InfiniBand-Clusters-with-NVIDIA-GPUs.pdf`
- Summary: [[@2013__ICPP__Efficient Inter-node MPI Communication using GPUDirect RDMA for InfiniBand Clusters with NVIDIA GPUs]]
- Pages created: [[GPUDirect RDMA]], [[Sreeram Potluri]], [[Khaled Hamidouche]], [[Akshay Venkatesh]], [[Dhabaleswar K. Panda]], [[MVAPICH2]]
- Pages updated: [[RDMA]], [[Devendar Bureddy]], [[The Ohio State University]], [[NVIDIA]]
- Key insight: GDR初期実装(2013年)はネットワークアダプタがGPUメモリを読み取る方向でのみP2P read帯域制限を受け、MPIライブラリ側での閾値切り替えハイブリッド設計が必要になった。
## [2026-09-04] ingest-paper | BridgedRing: A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers
- Source: `.raw/papers/BridgedRing--A-Cost-Effective-Hardware-Software-Co-Design-to-Overcome-the-UPI-Bottleneck-in-GPU-Servers-.pdf`
- Summary: [[@2026__TACO__BridgedRing - A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers]]
- Pages created: [[Wanfeng Huang]], [[Yihao Zhao]], [[Yakun Zhang]], [[Jianghong Ma]], [[Yunming Ye]], [[Harbin Institute of Technology Shenzhen]], [[BridgedRing]], [[TCCL]], [[NVIDIA RTX A6000]], [[Ring AllReduce]]
- Pages updated: [[非対称NUMAインターコネクト]], [[NVLink]], [[NCCL]], [[MSCCL++]], [[Megatron-LM]], [[Peking University]], [[Nanjing University]]
- Key insight: 約200ドルのNVLink Bridge 1本とdelegated reductionアルゴリズムの組み合わせで、デュアルソケットGPUサーバーのUPI Wall(UPI帯域制約+リング型集団通信の双方向輻輳)を完全に解消し、集団通信帯域最大1.97倍・end-to-end学習スループット最大1.40倍を達成する。
## [2026-09-04] ingest-paper | SRNIC: A Scalable Architecture for RDMA NICs
- Source: `.raw/papers/nsdi23-wang-zilong.pdf`(発表スライド `.raw/slides/nsdi23-wang-zilong/` も統合)
- Summary: [[@2023__NSDI__SRNIC - A Scalable Architecture for RDMA NICs]]
- Pages created: [[Zilong Wang]], [[Layong Luo]]
- Pages updated: [[RDMA]], [[RoCE設計課題]], [[Kai Chen (HKUST)]], [[Chuanxiong Guo]], [[Hong Kong University of Science and Technology]], [[ByteDance]], [[Mellanox]]
- Key insight: RNICの接続スケーラビリティ問題は、RDMA概念モデルでオンチップデータ構造を体系分析すれば、ヘッダ拡張とcache-free QPスケジューラで定量的に解消できる(4.4MBで10K QP、CX-5比18倍)。
## [2026-09-04] ingest-paper | The Multipath Reliable Connection (MRC) Transport
- Source: `.raw/papers/arxiv-2606.18170.pdf`
- Summary: [[@2026__arXiv__The Multipath Reliable Connection (MRC) Transport]]
- Pages created: [[@2026__arXiv__The Multipath Reliable Connection (MRC) Transport]], [[Rip Sohan]]
- Pages updated: [[AMD]], [[Broadcom]], [[Microsoft]], [[NVIDIA]], [[OpenAI]], [[Intel]], [[Open Compute Project]], [[Torsten Hoefler]], [[Mark Handley]], [[Costin Raiciu]], [[RoCE設計課題]]
- Key insight: MRC は RoCEv2 RC をクリーンスレートではなく漸進的に拡張し、EV ベースのパケット単位マルチパス散布・MPR による境界付きインフライト・SACK/NACK/トリミングパケットによる高速回復・エンドポイント操作による高速フェイルオーバーを直交プリミティブとして組み合わせる、AMD/Broadcom/Microsoft/NVIDIA/OpenAI/Intel 共著の OCP オープン仕様。
- Deferred: 他 37 名の共著者は entity ページを作らず(規模上の理由でスコープ外。詳細はチャット報告参照)。
## [2026-09-04] ingest-paper | NCCLbpf: Verified, Composable Policy Execution for GPU Collective Communication
- Source: `.raw/papers/arxiv-2603.11438v2.pdf`
- Summary: [[@2026__arXiv__NCCLbpf - Verified, Composable Policy Execution for GPU Collective Communication]]
- Pages created: (source のみ、entity/concept は既存ページへ追記)
- Pages updated: [[Yusheng Zheng]], [[NCCL]], [[bpftime]], [[eBPF]]
- Key insight: NCCL のプラグイン ABI に bpftime のユーザ空間 eBPF を組み込み、ロード時検証・cross-plugin map・アトミックホットリロードで、8x B300 NVLink AllReduce を最大 27% 改善しつつ verifier がポリシーの意味的正しさまでは保証しない限界を実測で示した。
## [2026-09-04] ingest-paper | Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
- Source: `.raw/papers/arxiv-2502.05171.pdf`
- Summary: [[@2025__arXiv__Scaling up Test-Time Compute with Latent Reasoning - A Recurrent Depth Approach]]
- Pages created: [[@2025__arXiv__Scaling up Test-Time Compute with Latent Reasoning - A Recurrent Depth Approach]], [[Jonas Geiping]], [[Tom Goldstein]], [[Sean McLeish]], [[Neel Jain]], [[John Kirchenbauer]], [[Siddharth Singh]], [[Brian R. Bartoldson]], [[Bhavya Kailkhura]], [[Huginn-0125]], [[ELLIS Institute Tübingen]], [[Max Planck Institute for Intelligent Systems]], [[潜在推論]](新規)、[[再帰深度アーキテクチャ]](新規)
- Pages updated: [[Abhinav Bhatele]], [[Frontier]], [[University of Maryland]], [[Lawrence Livermore National Laboratory]], [[Oak Ridge National Laboratory]], [[AMD]], [[テスト時計算スケーリング]], [[KVキャッシュ管理]], [[Speculative Decoding]], [[Chain-of-Thought Prompting]]
- Key insight: 深さ方向に再帰するコアブロックを訓練時にランダムな反復回数で事前学習することで、CoT データを一切使わずにテスト時計算をスケールできる潜在推論アーキテクチャを 3.5B/800B トークン規模で実証した。
- Note: [[潜在推論]] は同時進行中の別 ingest(Coconut, arXiv:2412.06769)が先に新設していたため、本 ingest では新設せず観察を追記した。
## [2026-09-03] ingest-paper | TopoOpt: Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs
- Source: `.raw/papers/arxiv-2202.00433.pdf`
- Summary: [[@2023__NSDI__TopoOpt - Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs]]
- Pages created: [[@2023__NSDI__TopoOpt - Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs]], [[TopoOpt]]
- Pages updated: [[Weiyang Wang]], [[Manya Ghobadi]], [[Zhihao Jia]], [[AIデータセンタートポロジ]], [[データセンターネットワークトポロジ]], [[光回線交換]], [[集合通信]]
- Key insight: AllReduce の可変性を TotientPerms で使い、direct-connect トポロジと並列戦略を交互最適化して同コスト Fat-tree 比最大 3.4× 短縮した。
- Deferred: 本文参照図の一部は代表7点に絞った。
## [2026-09-03] ingest-paper | TACCL: Guiding Collective Algorithm Synthesis using Communication Sketches
- Source: `.raw/papers/arxiv-2111.04867.pdf`
- Summary: [[@2023__NSDI__TACCL - Guiding Collective Algorithm Synthesis using Communication Sketches]]
- Pages created: [[@2023__NSDI__TACCL - Guiding Collective Algorithm Synthesis using Communication Sketches]], [[Aashaka Shah]]
- Pages updated: [[TACCL]], [[NCCL]], [[Vijay Chidambaram]], [[Microsoft Research]], [[Rachee Singh]], [[集合通信]]
- Key insight: 通信スケッチで MILP 探索空間を絞り、多ノード GPU トポロジ向け集合通信アルゴリズムを秒〜分で合成した。
- Deferred: なし
## [2026-09-03] ingest-paper | Jupiter Evolving
- Source: `.raw/papers/sigcomm22-jupiter-evolving.pdf`
- Summary: [[@2022__SIGCOMM__Jupiter Evolving - Transforming Google's Datacenter Network via Optical Circuit Switches and Software-Defined Networking]]
- Pages created: [[@2022__SIGCOMM__Jupiter Evolving - Transforming Google's Datacenter Network via Optical Circuit Switches and Software-Defined Networking]], [[Leon Poutievski]]
- Pages updated: [[Jupiter (Google WSCネットワークスイッチ)]], [[Palomar Optical Circuit Switch]], [[Amin Vahdat]], [[Google]], [[光回線交換]], [[ソフトウェア定義ネットワーク]], [[データセンターネットワークトポロジ]], [[AIデータセンタートポロジ]]
- Key insight: Clos から MEMS OCS 直結へ進化させ、TE/ToE で Clos 並みスループットを保ちつつ 5x 速度・capex 30%減・電力 41%減を本番で達成した。
- Deferred: なし
## [2026-09-03] ingest-paper | Pathways: Asynchronous Distributed Dataflow for ML
- Source: `.raw/papers/arxiv-2203.12533.pdf`
- Summary: [[@2022__MLSys__Pathways - Asynchronous Distributed Dataflow for ML]]
- Pages created: [[@2022__MLSys__Pathways - Asynchronous Distributed Dataflow for ML]], [[Pathways]], [[非同期分散データフロー]]
- Pages updated: [[Paul Barham]], [[Jeffrey Dean]], [[TensorFlow]], [[Google TPU]], [[Google]], [[パイプライン並列化]], [[LLM分散学習]]
- Key insight: コントロールプレーンをデータ依存から切り離す非同期データフローで、単一コントローラのまま 2048 TPU で約100%利用率を出した。
- Deferred: なし
## [2026-09-03] ingest-paper | Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning
- Source: `.raw/papers/arxiv-2201.12023.pdf`
- Summary: [[@2022__OSDI__Alpa - Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning]]
- Pages created: [[@2022__OSDI__Alpa - Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning]], [[Alpa]], [[自動並列化]]
- Pages updated: [[テンソル並列]], [[パイプライン並列化]], [[LLM分散学習]], [[メッシュ並列]], [[Lianmin Zheng]], [[Zhihao Jia]], [[Ion Stoica]], [[Joseph E. Gonzalez]]
- Key insight: intra-op を ILP、inter-op を DP で解く階層コンパイルにより、手動 Megatron 並みの自動並列を異種モデルへ汎化した。
- Deferred: なし
## [2026-09-03] ingest-paper | CheckFreq: Frequent, Fine-Grained DNN Checkpointing
- Source: `.raw/papers/fast21-checkfreq.pdf`
- Summary: [[@2021__FAST__CheckFreq - Frequent Fine-Grained DNN Checkpointing]]
- Pages created: [[@2021__FAST__CheckFreq - Frequent Fine-Grained DNN Checkpointing]], [[CheckFreq]], [[Vijay Chidambaram]]
- Pages updated: [[チェックポイント]], [[Jayashree Mohan]], [[Amar Phanishayee]], [[Microsoft Research]], [[UT Austin]]
- Key insight: オーバーヘッド予算から頻度を逆算するオンラインプロファイリングと二相チェックポイントで、復旧を数時間から数十秒へ縮めた。
- Deferred: なし
## [2026-09-03] ingest-paper | Mesh-TensorFlow: Deep Learning for Supercomputers
- Source: `.raw/papers/arxiv-1811.02084.pdf`
- Summary: [[@2018__NeurIPS__Mesh-TensorFlow - Deep Learning for Supercomputers]]
- Pages created: [[@2018__NeurIPS__Mesh-TensorFlow - Deep Learning for Supercomputers]], [[Mesh-TensorFlow]], [[メッシュ並列]]
- Pages updated: [[テンソル並列]], [[LLM分散学習]], [[Noam Shazeer]], [[TensorFlow]], [[Google TPU]], [[Google Brain]], [[Ashish Vaswani]]
- Key insight: 任意のテンソル次元をプロセッサメッシュへ分割する計算レイアウトで、データ並列を特殊ケースとして一般化した。
- Deferred: なし
## [2026-09-03] ingest-paper | Efficient Processing of Deep Neural Networks: A Tutorial and Survey
- Source: `.raw/papers/arxiv-1703.09039.pdf`
- Summary: [[@2017__IEEE__Efficient Processing of Deep Neural Networks]]
- Pages created: [[@2017__IEEE__Efficient Processing of Deep Neural Networks]], [[Vivienne Sze]], [[Joel Emer]], [[Eyeriss]]
- Pages updated: [[AIアクセラレータ]], [[ドメイン固有アーキテクチャ]], [[Google TPU]]
- Key insight: DNN 処理エネルギーはメモリ階層のデータ移動が支配し、データフロー(WS/OS/NLR/RS)がハードウェアとモデル協調の整理軸になる。
- Deferred: 本文参照図の大半は代表7点に絞った(サーベイ45図)。
## [2026-09-03] ingest-paper | In-Datacenter Performance Analysis of a Tensor Processing Unit
- Source: `.raw/papers/isca2017-tpu.pdf`
- Summary: [[@2017__ISCA__In-Datacenter Performance Analysis of a Tensor Processing Unit]]
- Pages created: [[@2017__ISCA__In-Datacenter Performance Analysis of a Tensor Processing Unit]], [[Norman P. Jouppi]]
- Pages updated: [[Google TPU]], [[Google]], [[TensorFlow]], [[Jeffrey Dean]], [[David A. Patterson]], [[AIアクセラレータ]], [[ドメイン固有アーキテクチャ]]
- Key insight: TPU v1 の本番推論実測が、65,536 MAC・92 TOPS と CPU/GPU 比のエネルギー効率を一次資料として確定する。
- Deferred: なし
## [2026-09-03] ingest-paper | TensorFlow: A System for Large-Scale Machine Learning
- Source: `.raw/papers/arxiv-1605.08695.pdf`
- Summary: [[@2016__OSDI__TensorFlow - A System for Large-Scale Machine Learning]]
- Pages created: [[@2016__OSDI__TensorFlow - A System for Large-Scale Machine Learning]], [[DistBelief]], [[Martín Abadi]]
- Pages updated: [[TensorFlow]], [[Jeffrey Dean]], [[Paul Barham]], [[Google Brain]], [[Google]], [[Sanjay Ghemawat]]
- Key insight: ミュータブル状態を頂点に持つデータフローグラフで、parameter server の共有状態管理をユーザー空間のグラフ演算として再現した。
- Deferred: なし
## [2026-09-03] ingest-paper | Scaling Distributed Machine Learning with the Parameter Server
- Source: `.raw/papers/osdi14-parameter-server.pdf`
- Summary: [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]]
- Pages created: [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]], [[Parameter Server]], [[Mu Li]], [[Alexander J. Smola]], [[David G. Andersen]]
- Pages updated: [[Google]], [[Carnegie Mellon University]], [[Baidu]]
- Key insight: 線形代数データ型・範囲ベース非同期通信・柔軟な一貫性モデルで、疎ロジスティック回帰から LDA までを1000台規模に拡張した。
- Deferred: なし
## [2026-09-04] ingest-paper | Training Large Language Models to Reason in a Continuous Latent Space
- Source: `.raw/papers/arxiv-2412.06769.pdf`
- Summary: [[@2025__COLM__Training Large Language Models to Reason in a Continuous Latent Space]]
- Pages created: [[Shibo Hao]], [[Sainbayar Sukhbaatar]], [[DiJia Su]], [[Xian Li]], [[Jason Weston]], [[Yuandong Tian]], [[潜在推論]]
- Pages updated: [[Zhiting Hu]], [[Meta FAIR]], [[UC San Diego]], [[Chain-of-Thought Prompting]]
- Key insight: Coconut は LLM の最終隠れ状態を連続思考として再利用することで、明示的な指示なしに BFS 的な潜在探索パターンを創発させ、計画立案を要する論理推論タスクで CoT より少ない生成トークン数かつ高精度を達成する。
- Deferred: なし(concept 新規は上限内の 1 件)
## [2026-09-03] ingest-book | アルゴリズムイントロダクション 第3版 総合版
- Source: `.raw/books/algorithms-introduction-3rd-jp/`(全 35 章 + 付録 A〜D = 39 枚 / 入力: pdf 1112 ページ)
- Book entity: [[アルゴリズムイントロダクション 第3版]]
- Chapters: [[@2013__KindaiKagaku__アルゴリズムイントロダクション 第3版 - Chapter 1 計算におけるアルゴリズムの役割]]〜[[@2013__KindaiKagaku__アルゴリズムイントロダクション 第3版 - Appendix D 行列]](39 件)
- Pages created: [[アルゴリズムイントロダクション 第3版]] / [[Thomas H. Cormen]] / [[Charles E. Leiserson]] / [[Ronald L. Rivest]] / [[Clifford Stein]] / [[近代科学社]] / [[アルゴリズム設計技法]] / [[計算複雑性]] / [[グラフアルゴリズム]]
- Pages updated: [[B-Tree]]
- 図: 本文が参照する図 236 点を全点クロップし(埋め込み画像ゼロのベクター図のため、キャプションのフォント判別 + 直上矩形のクロップで機械的に切り出し)、章あたり 2〜3 点を選んで計 98 点を埋め込んだ。
- Key insight: 本書の構成は「設計技法を先に道具として確立し、データ構造とグラフアルゴリズムをその適用先として並べる」という一貫した順序を持つ。この順序のおかげで、第 17 章のならし解析が第 19・21 章の解析を支え、それが第 23・24 章のグラフアルゴリズムの計算量を決めるという依存が全巻を貫く。加えて「下界は問題ではなく計算モデルに対して立つ」という一点が、第 8 章(比較ソートの $\Omega(n \lg n)$ を整数キーで回避)と第 20 章(優先度付きキューの $\Omega(\lg n)$ を同様に回避)で二度示され、第 34 章の NP 完全性がその議論を問題の側へ移す。緩和・安全な辺・増加道という 3 つのグラフアルゴリズムの骨格が「不変式を保ちながら 1 ステップ進める」という同型であることも、部をまたいで初めて見える。
- Deferred: [[指標確率変数]] / [[ならし解析]] / [[乱択アルゴリズム]] / [[優先度付きキュー]] / [[データ構造の補強]] / [[双対性]] — いずれも本書内で複数章にまたがるが、1 取り込みの新規 concept 上限(3)を超えた。次の関連ソースで育てる。
## [2026-09-03] ingest-paper | Intel Technology Journal Volume 9 Issue 1
- Source: `.raw/papers/intel-technology-journal-2005-vol09-iss01.pdf` (合冊号を8本の論文へ分割)
- Official URL: https://www.intel.com/content/dam/www/public/us/en/documents/research/2005-vol09-iss-1-intel-technology-journal.pdf
- Retrieval note: 公式URLは403のためInternet Archive保存物を取得
- Source pages: 8件
- [[@2005__Intel Technology Journal__High-Performance Graphics and TV Output Comes to the Second-Generation Intel Centrino Mobile Technology Platform]]
- [[@2005__Intel Technology Journal__Intel 915GMS Chipset - In Mobile Platforms, Smaller is Better]]
- [[@2005__Intel Technology Journal__Interface Material Selection and a Thermal Management Technique in Second-Generation Platforms Built on Intel Centrino Mobile Technology]]
- [[@2005__Intel Technology Journal__Low-Power Audio and Storage Input Output Technologies for the Second-Generation Intel Centrino Mobile Technology Platform]]
- [[@2005__Intel Technology Journal__Next-Generation PC Platform Built on Intel Centrino Mobile Technology New Usage Models]]
- [[@2005__Intel Technology Journal__Performance and Power Consumption for Mobile Platform Components Under Common Usage Models]]
- [[@2005__Intel Technology Journal__Second-Generation Intel Centrino Mobile Technology Platform]]
- [[@2005__Intel Technology Journal__The Emergence of PCI Express in the Next Generation of Mobile Platforms]]
- Pages created: source 8件 / author entity 46件 / concept 3件
- Pages updated: concept 3件 ([[PCIe性能]], [[GPU最適化]], [[性能測定]])
- Figures: 本文参照図表を各論文へ反映。attachment 93件、未使用0件、リンク欠落0件。
- Key insight: モバイル基盤の性能向上は、PCIe・統合グラフィックス・I/O・電力・熱を単一部品でなく利用モデル横断の設計制約として扱う。
- Deferred: なし
## [2026-09-03] refactor | wiki/questions と wiki/surveys の分離
- 変更: `wiki-survey` の保存先を `wiki/surveys/`、`wiki-query` の保存先を `wiki/questions/` と明示。11 件の長編(教科書・サーベイ・文献横断調査)を `wiki/questions/` から `wiki/surveys/` へ `git mv`。
- ページ: frontmatter の `type` を `survey` に更新。`wiki/index.md` に `## Surveys` 節を新設し、Questions 節からサーベイ系 11 件を移動。
- 参照更新: `wiki/concepts/RDMAネットワーク監視.md`・`wiki/concepts/KVキャッシュ管理.md`・`.raw/.manifest.json`・各 skill 文書。
- 残置: `wiki/questions/` には wiki-query 系 19 件(比較・詳解・短い調査回答)。
## [2026-09-03] ingest-paper | Log-Insight: Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis
- Source: [[@2026__ASE__Log-Insight - Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis]]
- Raw: `.raw/papers/arxiv-2607.08529.pdf`
- Entities:
- New: [[wiki/entities/Log-Insight|Log-Insight]]
- Concepts:
- Updated: [[LLMによる根本原因分析]], [[ログベース障害診断]], [[ログ解析]]
- Deferred: [[AIOps]], [[インシデント管理]]
## [2026-09-03] ingest-paper | Jobstats: A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters
- Source: `.raw/papers/Jobstats---A-Slurm-Compatible-Job-Monitoring-Platform-for-CPUand-GPU-Clusters.pdf`
- Summary: [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]]
- Pages created: [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]], [[Troy Comi]]
- Pages updated: [[Jobstats]], [[Job Defense Shield]], [[Josko Plazonic]], [[Jonathan Halverson]], [[GPUクラスタ運用]], [[Prometheusシリーズチャーン]]
- Key insight: 4つのPrometheusエクスポータ(cgroup, NVIDIA, node, GPFS)による時系列収集と、ジョブ完了時に要約JSONをgzip圧縮+Base64化してSlurm DBのAdminCommentに格納する設計により、Prometheusの高カーディナリティ/長期保持負荷を回避しながら高速なジョブ効率分析・自動アラートを実現。
## [2026-09-03] ingest-book | ソフトウェアアーキテクチャの基礎
- Source: `.raw/books/fundamentals-of-software-architecture-ja/`(24 章 + 付録 A = 25 枚 / 入力: pdf 436 ページ)
- Book entity: [[ソフトウェアアーキテクチャの基礎]]
- Chapters: [[@2022__OReillyJapan__ソフトウェアアーキテクチャの基礎 - Chapter 1 イントロダクション]]〜[[@2022__OReillyJapan__ソフトウェアアーキテクチャの基礎 - Chapter 24 キャリアパスを開く]] + [[@2022__OReillyJapan__ソフトウェアアーキテクチャの基礎 - Appendix A 自己評価のためのチェックリスト]](25 件)
- Figures: 180 点。埋め込み画像は 0 で全図がベクター図だったため、キャプションのフォント判別(GothicBBBPr6N-Medium 7.1pt / 本文フォントを含まない)+ 直上の本文ブロック下端までのクロップで一括切り出し。本文 grep の図番号 180 件と一致、未使用 attachment 0。
- Pages created (entity 13): [[ソフトウェアアーキテクチャの基礎]], [[Mark Richards]], [[Neal Ford]], [[島田浩二]], [[オライリー・ジャパン]], [[Meilir Page-Jones]], [[Robert Martin]], [[Michael Nygard]], [[James Lewis]], [[ThoughtWorks]] ほか
- Pages created (concept 3): [[アーキテクチャ特性]], [[アーキテクチャスタイル]], [[モジュール性]]
- Pages updated (concept 3): [[マイクロサービスアーキテクチャ]], [[疎結合のアーキテクチャ]], [[トレードオフ意思決定]]
- Pages updated (entity 3): [[Netflix]], [[Martin Fowler]], [[Fred Brooks]]
- Key insight: 本書の方法論上の核心は「アーキテクチャに唯一解は無い」という立場を相対主義に終わらせず、比較の道具立てへ変換した点にある。アーキテクチャ特性を計測可能な軸として定義し(4〜7 章)、適応度関数で継続的に統制し(6 章)、全アーキテクチャスタイルを同一の特性軸による星取り評価で並べる(10〜17 章)ことで、スタイル選択を特性の優先順位づけ問題へ還元している。既存 wiki の [[マイクロサービスアーキテクチャ]] が Meta・SoundCloud 等の実測・事例側で厚いのに対し、本書は教科書的な設計論を持ち込み、「再利用より重複を選ぶ」という設計判断(17 章)を 16 章の SOA 失敗分析と対で提示する。
- Contradiction: 図23-2「アーキテクチャの 4 つの C」は刊行された図自体が和英対応を取り違えている(図中「簡潔さ/Clarity」「明瞭さ/Conciseness」、本文の対応が正)。画像で確認し章ページに callout で記録した。
- Deferred: [[リスクストーミング]], [[アーキテクチャデシジョンレコード]], [[コンポーネント発見]] — 今回の concept 上限(新規 3)超過。次の関連ソースで育てる。
## [2026-09-03] ingest-paper | Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows: An Evaluation of LustreFS and S3-Compatible Object Storage
- Source: `.raw/papers/Convergence-of-HPC-and-Cloud-Storage-Systems-for-Deep-Learning-Workflows--An-Evaluation-of-LustreFS-and-S3-Compatible-Object-Storage.pdf`
- Summary: [[@2026__ACCESS__Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows An Evaluation of LustreFS and S3-Compatible Object Storage]]
- Pages created: [[@2026__ACCESS__Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows An Evaluation of LustreFS and S3-Compatible Object Storage]], [[MinIO]]
- Pages updated: [[Lustre]], [[Ceph]], [[分散ストレージ]], [[チェックポイント]]
- Key insight: Lustreを変更することなく軽量ステートレスゲートウェイでMinIO(S3)を統合し、MAB動的チューニングによりCeph比で読込33.3%向上・メタデータ遅延40.7%削減を達成。TransformerはCNN比でメタデータ感度が2.3倍高い。
## [2026-09-03] ingest-paper | PRISM: Evaluating POSIX Storage Systems for AI Research Workflows
- Source: `.raw/papers/arxiv-2607.21746.pdf`
- Summary: [[@2026__arXiv__PRISM Evaluating POSIX Storage Systems for AI Research Workflows]]
- Pages created: [[@2026__arXiv__PRISM Evaluating POSIX Storage Systems for AI Research Workflows]], [[wiki/entities/PRISM|PRISM]]
- Pages updated: [[Meta FAIR]], [[Lustre]], [[並列ファイルシステム]], [[GPUクラスタ運用]], [[チェックポイント]]
- Key insight: Meta FAIR の 8K GPU クラスタ評価により、AI 研究の共有 POSIX ストレージではメタデータ IOPS が全体の過半を占め、大容量チェックポイント保存に強い Lustre と、小ファイル・メタデータ・分散リストア(FSDP load)で最大 3 倍高速なオールフラッシュ NAS(NFS)の非対称なトレードオフが解明された。また実 PyTorch 処理を実行する PRISM を CI に組み込むことで、ベンダー更新に伴う openat ロック競合(レイテンシ 8 倍増)の検知・修正検証が可能となった。
- Deferred: [[ストレージQoS]] — 今回の上限超過。次の関連ソースで。
## [2026-09-03] ingest-paper | I/O Load Balancing for Big Data HPC Applications
- Source: `.raw/papers/IO-Load-Balancing-for-Big-Data-HPC-Applications.pdf`
- Summary: [[@2017__IEEE BigData__I O Load Balancing for Big Data HPC Applications]]
- Pages created: [[@2017__IEEE BigData__I O Load Balancing for Big Data HPC Applications]], [[Arnab K. Paul]], [[Ali R. Butt]]
- Pages updated: [[Lustre]], [[Oak Ridge National Laboratory]], [[Virginia Tech]], [[並列ファイルシステム]], [[ファイルレイアウトとストライピング]], [[ストレージQoS]]
- Key insight: Lustre の既定ラウンドロビン OST 割り当てによる深刻な負荷不均衡(最大/平均比 75〜125 倍)に対し、Pub-Sub テレメトリ収集、3次マルコフ連鎖による将来要求予測、および最小費用最大流(MCMF)問題としての最適化を組み合わせることで、マイグレーションなしに負荷不均衡収束時間を 7 時間に半減させ、最大 54.5% のスループット向上を達成した。
## [2026-09-03] ingest-paper | A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System
- Source: `.raw/papers/A-Configurable-Rule-based-Classful-Token-Bucket-Filter-Network-Request-Scheduler-for-the-Lustre-File-System.pdf`
- Summary: [[@2017__SC__A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System]]
- Pages created: [[@2017__SC__A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System]], [[Shuichi Ihara]], [[ストレージQoS]]
- Pages updated: [[Lustre]], [[Yingjin Qian]], [[Xi Li]], [[André Brinkmann]], [[Johannes Gutenberg University Mainz]], [[並列ファイルシステム]]
- Key insight: Lustre の Network Request Scheduler (NRS) 内にトークンバケットフィルタ(TBF)を組み込み、高価なストレージ RPC を破棄せずクラス別 FIFO キューで遅延・整流することで、単一タイマーでの IOPS 単位レート制御、高負荷時の帯域補償(HTC)、余剰帯域の比例配分(PSSB)、マルチ OSS 横断の大域レート制御(GRL)を実現した。
## [2026-09-03] ingest-book | Lustre Operations Manual
- Source: `.raw/books/lustre-operations-manual/`(全 45 章中 第 1〜38 章 / 入力: 単一 XHTML を pandoc で章分割)
- Book entity: [[Lustre Operations Manual]]
- Chapters: [[@2026__Whamcloud__Lustre Operations Manual - Chapter 1 Understanding Lustre Architecture]]〜[[@2026__Whamcloud__Lustre Operations Manual - Chapter 38 Lustre File System Recovery]](38 件)
- Figures: 33 点を `doc.lustre.org/figures/` から取得し `wiki/sources/_attachments/lustre-operations-manual/` に配置。埋め込み 33 / 未使用 0。
- Pages created (entity 10): [[Lustre Operations Manual]], [[ZFS]], [[ldiskfs]], [[Pacemaker]], [[Corosync]], [[SELinux]], [[Robinhood]], [[Lustre Monitoring Tool (LMT)]], [[CollectL]], [[Lustre I O Kit]]
- Pages created (concept 3): [[ストレージフェイルオーバ]], [[ファイルレイアウトとストライピング]], [[ストレージクォータ管理]]
- Pages updated: [[Lustre]] / [[並列ファイルシステム]], [[ローカルファイルシステム実装比較]], [[アーカイバルストレージ]], [[永続クライアントキャッシュ]], [[クラッシュリカバリ]]
- Key insight: 本マニュアルは Lustre の一次文書 3 冊のうち「運用」を担い、[[Understanding Lustre Internals]](実装)・[[Lustre Unveiled]](設計進化)と重複が少ない。設計の理由は書かれない代わりに、`writeconf` の破壊性、クォータのグラントキャッシュによる EDQUOT の遅延顕在化、FID とレイアウトを失う素朴なバックアップ、といった他 2 冊に現れない運用上の落とし穴が集中する。機能面では、レイアウトの発展形(PFL → SEL → FLR → DoM)がいずれも composite layout という単一の器の上に積まれていることが章をまたいで確認できた。
- 備考: [[ファイルレイアウトとストライピング]] は fan-out 中に並行していた別セッションの ingest-paper が先にコミットしており、コミット `85ac1fe5bb` に含まれる(内容は本バッチの第 19 章担当が作成したもの)。第 39〜45 章(パラメータ・コマンド・C-API のリファレンス)と Preface/Glossary/Index はユーザー判断で対象外とした。
- Deferred: [[分散ロック管理]](LDLM・lockahead・グループロック。第 23・34・38 章に材料があるが今回の concept 上限を超過)、[[HPCストレージ運用]](第 12・35・36 章の運用知見)。次の Lustre 系ソースで育てる。
## [2026-09-02] ingest-paper | Characterizing Output Bottlenecks of a Production Supercomputer: Analysis and Implications
- Source: `.raw/papers/Characterizing-Output-Bottlenecks-of-a-Production-Supercomputer.pdf`
- Summary: [[@2020__TOS__Characterizing Output Bottlenecks of a Production Supercomputer Analysis and Implications]]
- Pages created: source 1、entity 17
- Pages updated: [[並列ファイルシステム]]、[[ファイルレイアウトとストライピング]]、[[分散ロック管理]]、[[ストラグラー]]
- Key insight: Titanの本番Lustreでは、ストライピングとファイル共有の結合がストラグラーやロック競合を増幅し、独立ファイルへの分散が高い中央値帯域を得やすい。
- Figures: 本文参照図34点をクロップして全件埋め込み、表2点を忠実に転記。
## [2026-09-02] recompile | 根本原因分析
- Page: [[根本原因分析]]
- Folded: 71 観察 → 44 命題 / 9 主題節(単一根本原因という概念, 仮説と証拠の反復, 入力選別と探索空間, 相関と因果, グラフ訪問と古典的パイプライン, 箇所特定と説明, 評価の不安定性, ドメインと観測モダリティ, エージェント適応と緩和接続)
- Kept in inbox: 0
- Parked: `> [!note]- 編纂前の観察 2026-09`(71 件)
- Summary paragraph: rewritten
- Dropped questions: 12 件を主題節へ移した(Gallego / Nash / de Vesine / Anatomy / CAST / 5 Whys / COCA / SparseRCA / RADICE / HeMiRCA / テレコムグラフ / MagmaScope)
## [2026-09-02] recompile | カオスエンジニアリング
- Page: [[カオスエンジニアリング]]
- Folded: 62 観察 → 37 命題 / 8 主題節(原則と実験手順, 実験とテストの区別, 爆発半径の局所化, 本番実施の前提, 導入の段階と自動化, 成熟度の 2 軸, 実験対象の拡張, 実験の選択)
- Kept in inbox: 0(全件を主題節へ畳んだ)
- Parked: `> [!note]- 編纂前の観察 2026-09`(62 件)
- Summary paragraph: rewritten
- Dropped questions: 1件(カオスエンジニアリングと通常の障害演習の違い → 実験とテストの区別)。自己言及を問い 36 件から除去
## [2026-09-02] recompile | SRE組織変革
- Page: [[SRE組織変革]]
- Folded: 62 観察 → 35 命題 / 7 主題節(割り込み吸収と早期関与, 内部育成と人員再配置, 信念層と事前診断, ゲートキーパー化と自律阻害, 経営層の関与, 集中型から分散型への経路, SRE の組織的位置づけ)
- Kept in inbox: 0
- Parked: `> [!note]- 編纂前の観察 2026-09`(62 件)
- Summary paragraph: rewritten
- Dropped questions: 0(自己言及を問い 27 件から除去。内容は残した)
## [2026-09-02] recompile | インシデント管理
- Page: [[インシデント管理]]
- Folded: 84 観察 → 56 命題 / 7 主題節(検知と緩和のコスト構造, メトリクス設計とKPIの妥当性, ICS由来の役割設計と大規模インシデント対応の実践, TSG・ワークフロー自動化の設計空間, アラート・トリアージ・診断の上流下流介入点, 産業AIOpsの系譜とHITL・自動化実証研究, GenAI・AIワークロード時代のインシデント特性とベンチマーク乖離)
- Kept in inbox: 0
- Parked: `> [!note]- 編纂前の観察 2026-09`(84 件)
- Summary paragraph: rewritten(主題節 7 つのため)
- Dropped questions: 0(未解決の問いは未変更)
## [2026-09-02] recompile | LLM推論
- Page: [[LLM推論]]
- Folded: 62 観察 → 59 命題 / 6 主題節(フェーズ構造と観測粒度, 推論効率化サーベイの分類軸と発展史, Goodput・SLO・ベンチマーク設計と品質劣化, Prefill-Decode分離とスケジューリング制御, KVキャッシュのアーキテクチャと本番運用課題, 通信最適化・アクセラレータ・エンジン選定)
- Kept in inbox: 0
- Parked: `> [!note]- 編纂前の観察 2026-09`(62 件)
- Summary paragraph: rewritten
- Dropped questions: 0(既存 36 件の未解決の問いは変更なし)
## [2026-09-02] recompile-count | 時系列基盤モデル
- Page: [[時系列基盤モデル]]
- Correction: 直前エントリの Folded は「71 観察 → 39 命題」。`--outline` の主題節合計は 33 命題(4+6+4+7+3+5+4)。過去エントリは編集しない。
## [2026-09-02] recompile | サービスレベル目標
- Page: [[サービスレベル目標]]
- Folded: 87 観察 → 94 命題 / 7 主題節(可用性指標の設計と測定, レイテンシSLOの実装, SLOベースアラーティングの系譜, SLI設計とカバレッジ, SLOのステークホルダーと合意形成, SLO導入の組織的定着, SLA/SLOの理論的定式化とリスク分担)
- Kept in inbox: 0(全観察を主題節へ畳み込んだ。退避 callout に原文を保存)
- Parked: `> [!note]- 編纂前の観察 2026-09`(87 件)
- Summary paragraph: rewritten(主題節 7 つのため要約段落を追加)
- Dropped questions: 未解決の問いから重複していた項目なし。誤って未解決の問いに混入していた命題2件(複合SLI OR結合、Moyer 2年連続の連作)を主題節「レイテンシSLOの実装」へ移動。
## [2026-09-02] recompile | 時系列基盤モデル
- Page: [[時系列基盤モデル]]
- Folded: 71 観察 → 39 命題 / 7 主題節(TSFM研究の起点と専用モデルの優位性, アーキテクチャの分岐と設計空間, 事前学習データとトークン化戦略, 観測・運用ドメインへの特化, スケーリングと後学習, 評価方法論の課題, 予測パラダイムの上位層)
- Kept in inbox: 0
- Parked: `> [!note]- 編纂前の観察 2026-09`(72 件、うち 1 件は問いとして未解決の問いへ移動)
- Summary paragraph: rewritten(主題節 7 のため要約段落を追加)
- Dropped questions: 0 件を解決済みとして削除。近似重複 1 件(スケール情報統合の問い、全角/半角括弧差のみ)を統合。受信箱の後学習5分類の問い 1 件を未解決の問いへ追加。
## [2026-09-02] recompile | 異常検知
- Page: [[異常検知]]
- Folded: 80 観察 → 47 命題 / 7 主題節(異常の型と検知技法が置く仮定, マイクロサービス異常検知サーベイの分類軸, 常時稼働の検知とLLMコストの緊張, 正常性の文脈依存性, 実用的異常の再定義, LLMの検知器・メタ層としての役割分岐, 検知精度を決めるデータ設計とシグナル源)
- Kept in inbox: 0
- Parked: `> [!note]- 編纂前の観察 2026-09`(80 件)
- Summary paragraph: rewritten
- Dropped questions: 0(未解決の問いは既存 52 件のまま据え置き、自己言及表現のみ 3 件修正)
## [2026-09-02] recompile | eBPF
- Page: [[eBPF]]
- Folded: 34 観察 → 28 命題 / 4 主題節(カーネル内での情報削減という設計原則, AI/MLワークロード可観測性とeBPFの相互応用, eBPFによる方針制御への拡張とverifierの保証範囲, 非侵襲トレーシング手段としての実務採用と評価の温度差)。既存の主題節(BPF から eBPF への系譜, eBPF トレーシングの基礎技術(2021 時点))は維持し、後者に規約外配置だった CNI/Cilium 観察 1 件を新主題節へ移設、詳解システムパフォーマンスの観察 1 件を基礎技術節へ追加
- Kept in inbox: 0(すべて既存の複数ソース相互参照を持ち折り込み可能だったため)
- Parked: `> [!note]- 編纂前の観察 2026-09`(34 件、旧`## 横断的知見`30件 + `## 横断的知見(追記)`3件 + トレーシング基礎技術節に規約外配置されていたCNI観察1件)
- Summary paragraph: rewritten(主題節 6 つ、定義2段落目に要約追加)
- Dropped questions: 0(既存の未解決の問いはすべて温存、新規削除なし)
## [2026-09-02] ingest-book | Understanding Lustre Internals
- Source: `.raw/books/understanding-lustre-internals/`(本編 7 章 / 入力: web 単一ページ(MediaWiki wikitext)→ 章分割)
- Book entity: [[Understanding Lustre Internals]]
- Chapters: [[@2021__ORNL__Understanding Lustre Internals - Chapter 1 Lustre Architecture]]、[[@2021__ORNL__Understanding Lustre Internals - Chapter 2 TESTS]]、[[@2021__ORNL__Understanding Lustre Internals - Chapter 3 UTILS]]、[[@2021__ORNL__Understanding Lustre Internals - Chapter 4 MGC]]、[[@2021__ORNL__Understanding Lustre Internals - Chapter 5 OBDCLASS]]、[[@2021__ORNL__Understanding Lustre Internals - Chapter 6 LIBCFS]]、[[@2021__ORNL__Understanding Lustre Internals - Chapter 7 File Identifiers, FID Location Database, and Object Index]](7 件)
- Pages created: 上記 7 source、[[Understanding Lustre Internals]](entity)、[[obd デバイスモデル]]、[[File Identifier (FID)]](concept 2 件)
- Pages updated: [[Lustre]]、[[並列ファイルシステム]]、[[オブジェクトベースストレージ]]
- Figures: 原本 wiki の埋め込み図 17 点を全数取得し、`wiki/sources/_attachments/understanding-lustre-internals/` に配置して本文近傍に埋め込んだ(ch.1 に 5 点、ch.4 に 5 点、ch.5 に 7 点)。
- Key insight: Lustre の実装は obd デバイスという単一の抽象に収束している。MGC・MDC・OSC・OSP といった役割の異なるモジュールが同じ attach → setup → precleanup → cleanup のライフサイクルと `obd_ops` の間接呼び出しに揃えられ、サーバ間通信ですら必ずクライアント側 obd デバイスを介する形に統一される。これにより「Lustre のコードを読む」という作業は、まず obdclass のライフサイクルと import/export 対を理解し、あとは各デバイスの `obd_ops` 実装を読む、という定型に還元される。名前解決も同様に FID → FLD → OI の 2 段階に固定されており、レイアウト(Layout EA)と位置解決(FLD/OI)が明確に分離している。
- 備考: 原本は継続更新される wiki ページ(OSTI 固定版は ORNL/TM-2021/2131 第 2 版)。巻末の Publications / Presentations / Authors / Notes は source 化せず book entity に織り込んだ。ページ番号が存在しないため出典位置は全て節番号で記した。
- Deferred: 設定ログ配布(MGS→MGC の llog 機構)、CPU パーティションテーブルによる NUMA 対応 — 今回の concept 上限超過。次の Lustre 関連ソースで。
## [2026-09-02] ingest-thesis | Lustre Unveiled (ACM TOS 2025)
- Source: `.raw/theses/survey-2025-lustre-unveiled/`(109 ページ / 全 8 章 + 付録 A / 入力: pdf)
- 再取り込み: 旧 `@2025__TOS__Lustre Unveiled - Evolution, Design, Advancements, and Current Trends`(1 枚の paper source)を削除し、`wiki-ingest-thesis` で章単位に再構成した。旧 attachment ディレクトリ `_attachments/2026_Unknown_Lustre_Unveiled_Evolution_Design_Advancements/` も削除。
- Hub entity: [[Lustre Unveiled]](entity_type: survey / entity_tier: full)
- Chapters: [[@2025__TOS__Lustre Unveiled - Chapter 1 Introduction]] / [[@2025__TOS__Lustre Unveiled - Chapter 2 The Lustre Filesystem]] / [[@2025__TOS__Lustre Unveiled - Chapter 3 Architectural Details of Lustre]] / [[@2025__TOS__Lustre Unveiled - Chapter 4 A Comparative Study of Lustre versus Related Storage Technologies]] / [[@2025__TOS__Lustre Unveiled - Chapter 5 Lustre Design Evolution]] / [[@2025__TOS__Lustre Unveiled - Chapter 6 Lustre in Practice - Frontier's Orion]] / [[@2025__TOS__Lustre Unveiled - Chapter 7 Future Directions and Open Challenges in Lustre]] / [[@2025__TOS__Lustre Unveiled - Chapter 8 Concluding Thoughts]] / [[@2025__TOS__Lustre Unveiled - Appendix A The Complete History of Lustre]](9 件)
- Figures: 図 37 点を全点クロップして章別に埋め込み(`_attachments/survey-2025-lustre-unveiled/`)。表は Table 2/3/4/5/6/8/10/11/13/15 を Markdown に転記。
- Pages created: [[Lustre Unveiled]] / [[GPFS]] / [[Ceph]] / [[DAOS]] / [[BeeGFS]] / [[メタデータスケーリング]]
- Pages updated: [[wiki/entities/Lustre|Lustre]] / [[Frontier]] / [[Orion]] / [[Oak Ridge National Laboratory]] / [[Whamcloud]] / [[OpenSFS]] / [[DDN]] / [[Anjus George]] / [[Andreas Dilger]] / [[Sarp Oral]] / [[並列ファイルシステム]] / [[@2019__arXiv__The Lustre Storage Architecture]] / [[LLM学習インフラ実運用の教科書]](旧 source への参照を章 source またはハブ entity へ張り替え)
- Key insight: 単一ページでは潰れていた「スケールする軸としない軸」の差が章分割で見えるようになった。第 4 章の高水準比較表は 5 システムの機能有無を対等に並べるが、第 6 章の Orion 実測は、データ帯域が OST 台数でほぼ線形に伸びる一方、メタデータは MDT を 40 台並べても単一 MDT の処理能力が総量の構成要素として残ることを示す。この非対称性が第 7 章の WBC(RPC を減らすのではなく発生させない手法、100 倍以上の高速化)を要求する構造的理由になっている。
- Deferred: [[Progressive File Layout]] / [[イレイジャーコーディング]] / [[Lustreフェイルオーバー]] — 今回の concept 上限超過。次の関連ソースで育てる。
- 備考: 本バッチと並行して別セッションが同一 vault で Lustre 関連(`@2003__CFS__Lustre building a cluster file system for 1,000 node clusters` ほか)を ingest していた。`wiki/concepts/並列ファイルシステム.md` と `wiki/entities/Lustre.md` は両者の追記が同居する。
## [2026-09-02] ingest-slides | Lustre: building a cluster file system for 1,000 node clusters
- Source: `.raw/slides/Lustre---Building-a-File-System-for-1000-node-Clusters/Lustre---Building-a-File-System-for-1000-node-Clusters.pdf`
- Visual pages: `.raw/slides/Lustre---Building-a-File-System-for-1000-node-Clusters/pages/` (27 pages)
- Media: transcriptなし
- Summary: [[@2003__CFS__Lustre building a cluster file system for 1,000 node clusters]]
- Pages created: [[Phil Schwan]], [[分散ロック管理]], [[意図ロック]], [[オブジェクトベースストレージ]]
- Pages updated: [[Lustre]], [[Cluster File Systems]], [[並列ファイルシステム]]
- Key insight: 1,000ノード規模の同時メタデータ更新に対し、競合度に応じてロック返却とサーバ側raw操作を切り替える設計を試みた。
- Deferred: なし
## [2026-09-01] ingest correction | Running a Software Factory Efficiently at Uber Scale
- Correction: [[コンテキストエンジニアリング]] は既存ページを更新したもので、新規作成ではない。
- Stable address: c-005824 を付与し、[[ソフトウェアファクトリー]]・[[AI Context Graph]]・[[Model Context Protocol]] と今回のソースを関連付けた。
## [2026-09-01] ingest | Running a Software Factory Efficiently at Uber Scale
- Source: `.raw/articles/efficient-software-factory-2026-08-27.md`
- Summary: [[@2026__Uber__Running a Software Factory Efficiently at Uber Scale]]
- Pages created: [[ソフトウェアファクトリー]], [[コンテキストエンジニアリング]], [[Uday Kiran Medisetty]], [[Minion]], [[uReview]], [[Agentic XP]], [[Conan AI]], [[Fawkes]], [[Cortana]], [[AI Context Graph]], [[Uber SWE Benchmark]]
- Pages updated: [[Uber]], [[Model Context Protocol]], [[agentic SRE]], [[開発者生産性]], [[エージェントシステム運用]], [[overview]]
- Key insight: 利用量を拡大しながら、成果単位の評価、モデル選択、コンテキスト設計によってAI開発の単位コストを下げるソフトウェアファクトリーの実装例。
## [2026-09-01] ingest-paper | Post-Training in Time Series Foundation Models: A Unifying Framework
- Source: `.raw/papers/arxiv-2607.20002.pdf`
- Summary: [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework]]
- Pages created: [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework]] / [[時系列基盤モデルの後学習]] / [[時系列基盤モデルの文脈拡張]] / [[時系列予測の不確実性制御]]
- Pages updated: [[時系列基盤モデル]] / [[多変量時系列予測]] / [[知識蒸留]] / [[Lujia Pan]] / [[Chenghao Liu]] / [[Inria]] / [[Amazon]] / [[Datadog]]
- Key insight: TSFM の後学習を介入位置で5群に整理し、精度だけでなく適応コスト・不確実性・配備制約を横断的な評価軸として提示した。
- Deferred: モデル合成、時系列モデル圧縮 — 今回は新規 concept 上限内の3件を優先し、source ページに整理した。
## [2026-09-01] wiki-query | 時系列基盤モデルのクラウド運用応用サーベイ(図表挿入)
- 更新: [[時系列基盤モデルのクラウド運用応用サーベイ]]
- 各 source ページの `_attachments/` から図表 32 点を抜き出し、本文の該当主張の直後へ挿入した(図3-1〜図6-8、表1-1・表5-1)。キャプションは本文の数値・主張との対応を明示する形式に統一した。
- 選定基準は「本文の主張の証拠になるか」。Woo+2023 の観測点数スケーリング(azure2017 のみ単調改善)、Toner+2025 の Moirai 崩壊と VisionTS の季節性模倣、Centile の真値超え・プロビジョニングフロンティア、Toto の BOOM 統計量分布、Toto 2.0 の CRPS rank 対パラメータ数、Position 論文の GPT-1/GPT-2 学習量との対比が主要な図。
- 挿入前に候補画像を実見して内容を確認した結果、ARGOS の Figure 1 は動機づけ例(GPU hang)で構成図ではなく、Position 論文の `table2-table.png` は Table 2 ではなく Figure 2 下部の切り出しだったため、前者は Figure 2、後者は不採用に差し替えた。
## [2026-09-01] wiki-query | 時系列基盤モデルのクラウド運用応用サーベイ
- 質問ページ: [[時系列基盤モデルのクラウド運用応用サーベイ]]
- 交差領域の文献 29 件を「運用タスク / モデル供給形態 / データ出自 / 評価軸」の 4 軸で分類し、サーベイ論文体裁で整理した。
- 主要な発見: (1) 「専用が転用に勝る」を Datadog・Cisco/Splunk・Cisco APEX が独立に確認(APEX と Toto は同じ decoder-only ゆえアーキテクチャ効果ではなくデータ効果)。(2) 汎用ゼロショット TSFM は Huawei Cloud の関数需要予測で 12 設定全敗。(3) 異常検知での TSFM 優位は未確立で、最高の本番数値は推論時に LLM を使わない ARGOS。(4) 評価軸が点予測から意思決定再生(Centile)と時系列質問応答(ARFBench)へ移動。
## [2026-08-31] ingest-paper | Large Pretrained Foundation Model for Key Performance Indicator Multivariate Time Series Anomaly Detection
- Source: `.raw/papers/Large-Pretrained-Foundation-Model-for-Key-Performance-Indicator-Multivariate-Time-Series-Anomaly-Detection.pdf`
- Summary: [[@2024__OJCS__Large Pretrained Foundation Model for Key Performance Indicator Multivariate Time Series Anomaly Detection]]
- Pages created: [[Xu Wang]], [[Kele Xu]], [[ViTSD]], [[KPI異常検知]]
- Pages updated: [[National University of Defense Technology]], [[Anomaly Transformer]], [[Vision Transformer]]
- Key insight: 他ドメイン(CV)で事前学習済みのViT-B/16をパッチ操作で時系列にそのまま転用し、チャネル独立特徴抽出と時間-周波数特徴融合を組み合わせることで、ラベル不足に悩むKPI異常検知でも17ベースラインを上回る性能を達成した(ViTSD)。
- Deferred: [[異常検知]] への横断的知見追記(他セッションが同時にlock保持中のためスキップ)。次回の関連ソース取り込み時に反映する。
## [2026-08-31] ingest-paper | APEX: A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations
- Source: `.raw/papers/arxiv-2606.11553.pdf`
- Summary: [[@2026__arXiv__APEX - A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations]]
- Pages created: [[Swadhin Pradhan]], [[Niloo Bahadori]], [[Peiman Amini]], [[PatchTST]]
- Pages updated: [[時系列基盤モデル]], [[多変量時系列予測]], [[異常検知]], [[Cisco]]
- Key insight: [[Cisco]] のネットワークネイティブ時系列基盤モデル APEX は、DHCP因果連鎖の10チャネル多変量入力のみで汎用TSFM(TimesFM/Toto/Chronos-2)をMAE 12〜18%上回り、同じdecoder-onlyアーキテクチャという条件下でこの差を「アーキテクチャでなくデータ効果」と位置づけた。多変量構造(APEX-Edge multi)は26倍のパラメータ削減を補い、MC-dropout予測区間により単一チェックポイントで予測と異常検知(F1=0.93)を統合する。
## [2026-08-31] ingest-paper | Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain
- Source: `.raw/papers/arxiv-2310.05063.pdf`
- Summary: [[@2023__arXiv__Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain]]
- Pages created: [[@2023__arXiv__Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain]], [[Akshat Kumar]], [[CloudOps時系列予測データセット]]
- Pages updated: [[Gerald Woo]], [[Chenghao Liu]], [[Doyen Sahoo]], [[Salesforce AI]], [[Singapore Management University]], [[時系列基盤モデル]], [[位置埋め込み]]
- Key insight: 同一著者陣による Moirai/Moirai-MoE の前身研究で、masked encoder + RoPE + 独立 Student-T という後の時系列基盤モデルの設計選択を、CloudOps 3データセットのアブレーションで先に実証していた。
## [2026-08-31] ingest-paper | Performance of Zero-Shot Time Series Foundation Models on Cloud Data
- Source: `.raw/papers/arxiv-2502.12944.pdf`
- Summary: [[@2025__arXiv__Performance of Zero-Shot Time Series Foundation Models on Cloud Data]]。Huawei Cloudのサーバーレス関数リクエストデータで、VisionTS・TTM・TimesFM・Chronos・Moirai・Mamba4Castの6種のゼロショット時系列基盤モデルを検証し、全12設定(4データセット×3ホライズン)で単純なオンライン線形モデル・ナイーブ季節性予測器の両ベースラインに一貫して劣ることを実証した。
- Pages created: [[William Toner]] / [[Thomas L. Lee]] / [[Artjom Joosen]] / [[Rajkarn Singh]] / [[Martin Asenov]] / [[Huawei Edinburgh Research Centre]] / [[Moirai]] / [[VisionTS]] / [[Mamba4Cast]] / [[Chronos]] / [[時系列基盤モデルのバイアスと失敗モード]]
- Pages updated: [[TimesFM]] / [[Tiny Time Mixers (TTM)]] / [[時系列基盤モデル]]
- Key insight: Moiraiはコンテキストのわずか1ステップの違いで予測が突然崩壊する病理を示し、最良のVisionTSも実質的にナイーブ季節性予測器を模倣しているに過ぎない。このスパイク・急変動への脆弱性は、TelecomTSの異常検知タスクでの偽陽性報告と検知/予測の両タスクで収斂する共通の失敗パターンとして子概念に集約した。
## [2026-08-31] ingest-paper | Centile: A Telemetry Foundation Model Evaluated by the Decisions It Drives
- Source: `.raw/papers/arxiv-2608.01725v1.pdf`
- Summary: [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]]
- Pages created: [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]], [[Zifan Zhang]], [[Zhichao Hou]], [[Tingxiang Ji]], [[Yuchen Liu]], [[HPCジョブスケジューリング]], [[決定志向予測評価]]
- Pages updated: [[North Carolina State University]], [[時系列基盤モデル]]
- Key insight: HPCバックフィリングとネットワークプロビジョニングという2つの意思決定を「再生(decision replay)」して評価すると、点予測誤差では見えない差異(真のランタイムでのスケジューリングが必ずしも最適でない等)が暴露される。
## [2026-08-31] ingest-paper | AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data
- Source: `.raw/papers/arxiv-2310.20280.pdf`
- Summary: [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]]
- Pages created: [[AutoMixer]], [[TSMixer]], [[Santosh Palaskar]], [[Vijay Ekambaram]]
- Pages updated: [[多変量時系列予測]], [[障害予測]], [[IBM Research]], [[IIT Bombay]]
- Key insight: AutoMixer は AutoEncoder による「チャネル圧縮」を事前学習タスクとして課し、TSMixer backbone の end-to-end 微調整に転用することで、BizITObs(ビジネス KPI + IT イベント)データの多変量予測で SOTA 比 MSE 11% 改善を達成する。同一著者陣(Vijay Ekambaram ほか)の Tiny Time Mixers(TTM)が採る「事前学習ではチャネル独立、微調整でのみ channel-mixing を後付け」という設計と対をなす、より早い段階でチャネル空間を圧縮するアプローチ。
## [2026-08-31] ingest-paper | Causal Analysis for Time Series Foundation Models
- Source: `.raw/papers/arxiv-2608.24303.pdf`
- Summary: [[@2026__arXiv__Causal Analysis for Time Series Foundation Models]]
- Pages created: [[@2026__arXiv__Causal Analysis for Time Series Foundation Models]], [[Mathis Jander]], [[Wouter van Heeswijk]], [[Martijn Mes]], [[University of Twente]], [[European Central Bank]], [[時系列基盤モデルのバイアスと失敗モード]]
- Pages updated: [[Chronos-2]], [[TimesFM]], [[時系列基盤モデル]]
- Key insight: Chronos-2・TimesFM-2.5 は因果分析(合成生成器への do 介入)により、両モデルとも持続性を過大評価するバイアスと、レジームスイッチ/エネルギー放出パターンでの失敗モードを持つことが判明した(TimesFM-2.5 の方が脆弱)。
## [2026-08-31] ingest-video | 2017/03/17 平木敬教授 最終講義「計算機を創る」
- Source: `https://www.youtube.com/watch?v=ok-3jrUftK0`
- Transcript: none(YouTube自動字幕の取得が429エラー)
- Frames: `.raw/videos/youtube-ok-3jrUftK0/frames/`(12点、sourceページには11点を添付)
- Summary: [[@2017__YouTube__平木敬教授 最終講義「計算機を創る」]]
- Pages created: [[平木敬]] / [[FLATS]] / [[SIGMA-1]] / [[GRAPE-DR]] / [[Data-Reservoir]] / source 1件
- Pages updated: [[東京大学]] / [[並列化戦略]] / [[GPUクラスタ運用]] / [[HPCインターコネクトベンチマーク]]
- Key insight: 専用計算機の設計・製作から遠距離データ通信、人材育成までを一続きの計算機システム設計として捉える視点を得た。
## [2026-08-30] ingest-paper | Getting the Most Out of Your GPUs
- Source: `.raw/papers/getting-most-out-of-your-gpus-pearc2026.pdf` + PEARC 2026発表スライド(`.raw/slides/getting-most-out-of-your-gpus-pearc2026-slides/`)
- Summary: [[@2026__PEARC__Getting the Most Out of Your GPUs]]
- Pages created: [[Jonathan Halverson]], [[Josko Plazonic]], [[Johnathan Lee]], [[Samyak Gupta]], [[Arizona State University]], [[Jobstats]], [[HPC Dashboard]], [[GPU-Watch]], [[Job Defense Shield]], [[自動ジョブキャンセル]]
- Pages updated: [[Princeton University]], [[GPU多重化(MPS・MIG)]], [[GPUクラスタ運用]]
- Key insight: GPUアイドルジョブの自動キャンセルは9大学で独立に同じ閾値設計(利用率のウィンドウ平均が0%近傍)に収束しており、Jobstats等のジョブ単位メトリクス基盤があれば大学共有クラスタでもMIG変換枚数をデータ駆動的に逆算できる。
## [2026-08-30] token-discipline | カタログ必読の廃止とヘルパー導入
- Pages created: [[token-discipline]] / `scripts/wiki-resolve.py` / `scripts/wiki-excerpt.py` / `scripts/wiki-catalog.py` / `scripts/wiki-retrieve-refresh.py` / `scripts/wiki-concept-stats.py`
- Pages updated: conventions / wiki/CLAUDE / ingest・query スキル / ハブ concept の `## 子概念`
- Key insight: 発見は resolve、本文は excerpt、カタログ更新は wiki-catalog、query は retrieve 第一経路。hot は 2000 トークン・5 件の窓。
- Deferred: 既存ハブ本文の主題分割は wiki-refactor の後続作業。
## [2026-08-30] ingest-slides | AI/ML基盤の400G DCネットワークを構築した話
- Source: `.raw/slides/janog52-aiml400-uchida-koshoji/janog52-aiml400-uchida-koshoji.pdf`
- Visual pages: `.raw/slides/janog52-aiml400-uchida-koshoji/pages/` (35ページ)
- Media: none(transcriptなし)
- Summary: [[@2023__JANOG52__AI ML基盤の400G DCネットワークを構築した話]]
- Pages created: [[内田 泰広]] / [[Cycloud]] / [[ConnectX-7]] / [[OSFP-RHS]] / source 1件
- Pages updated: [[サイバーエージェント]] / [[CIU]] / [[小障子 尚太朗]] / [[RDMA]] / [[RoCE設計課題]] / [[データセンター輻輳制御]] / [[Rail-Optimizedトポロジ]] / [[マイクロバースト]] / [[Dragonflyトポロジ]]
- Key insight: 400GbE RoCEv2 の導入は、PFC/ECN/CNP/ETS だけでなく、用途別ネットワーク分離、Rail Optimized、Adaptive Routing、光トランシーバー相互接続性まで含む構築・検証作業である。2023年の事例は2025年の800GbE導入の前史にあたる。
## [2026-08-30] ingest | eBPF Tutorial by Example: Monitoring GPU Driver Activity with Kernel Tracepoints
- Source: `.raw/articles/gpu-kernel-driver-2026-08-30.md`
- Summary: [[@2025__eunomia.dev__eBPF Tutorial by Example - Monitoring GPU Driver Activity with Kernel Tracepoints]]
- Pages created: [[GPUドライバトレーシング]] / source 1件
- Pages updated: [[eBPF]] / [[GPU観測性]] / [[eunomia-bpf]] / [[bpftime]] / [[bpftrace]] / [[Linux]] / [[Intel]] / [[AMD]] / [[NVIDIA]] / shared indexes
- Key insight: GPU ドライバ層は CUDA API 層と GPU 内部層の中間観測面として、DRM スケジューラ、メモリ移動、割り込み、Xid をイベント駆動で観測できる。ただし NVIDIA proprietary driver は内部関数に依存し、GPU 内部のワープやメモリアクセスは別計装を要する。
## [2026-08-30] ingest | eBPFを用いてPod ごとのインターネットトラフィック量を計測するツールの開発
- Source: `.raw/articles/pod-level-internet-traffic-measurement-using-ebpf-2024-11-13.md`
- Summary: [[@2024__Preferred Networks__eBPFを用いてPod ごとのインターネットトラフィック量を計測するツールの開発]]
- Pages created: [[Pod単位ネットワークトラフィック計測]] / source 1件
- Pages updated: [[Preferred Networks]] / [[Kubernetes]] / [[eBPF]] / [[eBPFマップ]] / [[Container Network Interface (CNI)]] / [[ネットワーク監視]] / [[XDP]] / [[OpenTelemetry]] / [[Prometheus]] / 索引
- Key insight: Chained CNI PluginからPodのTCへeBPFをアタッチし、Pod・Service・クラスタ外の3分類でIngress/Egressバイト数をカーネル内集約すると、Node NAT後には失われるテナント単位の帯域占有原因を標準メトリクスへ接続できる。
- Figure coverage: 本文参照の図1〜5を5点保存し、sourceページの該当節直後へ埋め込んだ。
## [2026-08-30] ingest-paper | Using Control Theory to Achieve Service Level Objectives In Performance Management
- Source: `.raw/papers/Using-Control-Theory-to-Achieve-Service-Level-Objectives-In-Performance-Management.pdf`
- Summary: [[@2002__Real-Time Systems__Using Control Theory to Achieve Service Level Objectives In Performance Management]]
- Pages created: [[N. Gandhi]] / [[T. Jayram]] / [[J. Bigus]] / source 1件
- Pages updated: [[Joseph L. Hellerstein]] / [[Yixin Diao]] / [[Sujay Parekh]] / [[Dawn M. Tilbury]] / [[IBM T.J. Watson Research Center]] / [[IBM]] / [[University of Michigan]] / [[IBM Lotus Domino Server]] / [[計算機システムのフィードバック制御]] / [[サービスレベル目標]] / [[フィードバックループ]] / [[制御ループの安定性とタイムラグ補償]] / [[システム同定]]
- Key insight: SLOを閉ループ制御の目標値として扱い、ARMAモデルと根軌跡解析を実機で検証することで、測定遅延・ゲイン・制御器誘発振動の関係を定量化した。
- Figure coverage: 本文参照 Figure 1〜9を9点埋め込み。Table 1〜2はMarkdown表として転記。除外は出版社ロゴのみ。
## [2026-08-30] ingest-slides | AI/ML基盤におけるGPU間ネットワークの負荷と性能影響を探る
- Source: `.raw/slides/janog55-gpu-network-load/janog55-gpu-network-load.pdf`
- Visual pages: `.raw/slides/janog55-gpu-network-load/pages/` (40ページ)
- Media: none(transcriptなし)
- Summary: [[@2025__JANOG55__AI ML基盤におけるGPU間ネットワークの負荷と性能影響を探る]]
- Pages created: [[加納浩輝]] / [[奥澤智子]] / source 1件
- Pages updated: [[Toyota Motor Corporation]] / [[RDMA]] / [[RDMAネットワーク監視]] / [[RoCE設計課題]] / [[LLM分散学習]] / [[集合通信]] / 索引・hot
- Key insight: 分散学習のネットワーク性能目標は、逆伝搬時間・AllReduce送信データ量・帯域の関係から計算と通信を隠蔽できる条件として設定する。長距離RDMAではACK遅延とPFC headroomを同時に評価する必要がある。
## [2026-08-30] ingest | AIインフラ革命 ─ 米国データセンターとGPUを支える技術基盤
- Source: `.raw/articles/20250109a-2026-08-30.md`
- Summary: [[@2025__LY Corporation__AIインフラ革命 ─ 米国データセンターとGPUを支える技術基盤(Rethinking AI Infrastructure Part 1)]]
- Pages created: [[Actapio]] / [[AI Cloud Platform (ACP)]] / [[立見 祐介]] / [[AIインフラ]]
- Pages updated: [[LINE株式会社]] / [[Open Compute Project]] / [[PUE]] / [[GPUクラスタ運用]] / [[データセンターネットワークトポロジ]] / [[RoCE設計課題]] / [[データセンター内光配線設計]] / [[コンテナオーケストレーション]] / shared indexes
- Key insight: Actapioの事例は、安価な電力とDEC、ラック納品、400Gbps閉域RoCEv2、物理配線、Kubernetesプラットフォームを、少人数運用のための一つのAIインフラ設計として結び付ける。
## [2026-08-30] ingest-slides | AI Networking - RoCEv2 and the role of netdev
- Source: `.raw/slides/netdev-0x19-AI-networking-RoCE-and-netdev/netdev-0x19-AI-networking-RoCE-and-netdev.pdf`
- Visual pages: `.raw/slides/netdev-0x19-AI-networking-RoCE-and-netdev/pages/` (24ページ)
- Summary: [[@2025__Netdev 0x19__AI Networking - RoCEv2 and netdev]]
- Pages created: [[Leon Romanovsky]] / source 1件
- Pages updated: [[David Ahern]] / [[RDMA]] / [[RoCE設計課題]] / [[ホストネットワークスタック性能]] / [[TCP IPスタック統合|TCP/IPスタック統合]] / [[ユーザーレベルTCPスタック]] / [[Linuxカーネルインタフェース]]
- Key insight: ConnectX-7の同一環境でsocket networkingは単一フロー215-220Gbps、RoCEv2は392Gbpsに達した。差はsocket側のsoftirq・`skb`・ページプール処理と、RDMA側のユーザー管理キュー・ゼロコピー・ハードウェアオフロードの責任境界として説明できる。
## 2026-08-30 | ingest | 1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習
- Source: `.raw/articles/plamo-100b-2024-06.md`
- Summary: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]
- Pages created: [[PLaMo-100B]] / [[Preferred Elements]] / [[GENIAC]] / [[NEDO]] / [[Common Crawl]] / [[RefinedWeb]] / [[llm-jp corpus filter]] / [[Zero Bubble]] / [[z loss]]
- Pages updated: [[Preferred Networks]] / [[PLaMo 2]] / [[QK-Norm]] / [[混合精度訓練]] / [[パイプライン並列化]] / [[並列化戦略]] / [[LLM分散学習]] / [[言語モデル事前学習]] / [[損失関数]] / [[LLM評価]]
- Key insight: 大規模事前学習では、データの権利・品質・構造、数値安定性、並列化、診断メトリクスを一体で設計する必要がある。lm-headのFP8化はz lossと下流評価で問題を検出し、BF16へ戻された。
## [2026-08-30] ingest | 1兆 (1T) パラメータ規模のLLMの事前学習検証
- Source: `.raw/articles/pretraining-1t-2024-08-20.md`
- Summary: [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]]
- Pages created: [[Hiroaki Mikami]]、[[Switch Transformer-C]]、[[FP8-LM]]、[[Hash Layers]]、[[Expert Choice Routing]]、source 1件
- Pages updated: [[Preferred Networks]]、[[NVIDIA H100]]、[[PLaMo-100B]]、[[Preferred Elements]]、[[GENIAC]]、[[NEDO]]、[[Mixture-of-Experts]]、[[負荷分散]]、[[条件付き計算]]、[[LLM分散学習]]、[[LLMスケーリング則]]、[[言語モデル事前学習]]、共有インデックス
- Key insight: 400基のH100 GPUで1T級MoEを発散なく学習できたが、通常の学習型Routerは崩壊し、実効効率はPLaMo-100Bの半分以下だった。Hash Layersへの移行でtrain loss約1.57を得た。
## [2026-08-30] ingest | 「研究テーマ」の正体|石原尚
- Source: `.raw/articles/research-theme-2026-08-30.md`
- Summary: [[@2022__note.com__「研究テーマ」の正体|石原尚]]
- Pages created: [[研究テーマ]]、[[石原尚]]、[[卒論・修論研究の攻略本]]、source 1 件
- Pages updated: [[Osaka University]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: 研究テーマは「どんな世界にどう挑むのか?」への答えであり、世界観(理想・現状・課題・問題)と作戦(アプローチ・目標・手段)の組み合わせとして捉えられる。
## [2026-08-30] ingest | Off-CPU Analysis
- Source: `.raw/articles/offcpu-analysis-2026-08-30.md`
- Summary: [[@2017__brendangregg.com__Off-CPU Analysis]]
- Pages created: [[Yichun Zhang]]、[[Sasha Goldshtein]]、[[Tanel Poder]]、[[FlameGraph]]、[[SystemTap]]
- Pages updated: [[Brendan Gregg]]、[[BCC]]、[[perf]]、[[MySQL]]、[[スレッド状態分析]]、[[フレームグラフ]]、[[eBPF]]、[[コンテキストスイッチ]]、[[スケジューラレイテンシ]]、[[トレーシングオーバーヘッド]]
- Key insight: 高頻度のスケジューライベントを全量出力するより、eBPFでカーネル内集約してからスタック別の待機時間を渡す方が、本番負荷と後処理量を抑えられる。
## [2026-08-29] ingest-paper | Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks
- Source: `.raw/papers/arxiv-2507.10789.pdf`
- Summary: [[@2025__arXiv__Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks]]
- Pages created: [[Aaron Jarmusch]]・[[Nathan Graddon]]・[[Sunita Chandrasekaran]]・[[NVIDIA Blackwell]]・[[RTX 5080]]・[[TensorRT]]
- Pages updated: [[University of Delaware]]・[[NVIDIA]]・[[NVIDIA Hopper]]・[[NVIDIA H100]]・[[GPT-NeoX]]、concept 9 件、共有メタデータ
- Key insight: Blackwell の FP4/FP6・統合 INT32/FP32・高 ILP は低精度 MMA で有利だが、評価した FP8 D-GEMM と global memory 帯域では H100 が優位であり、理論性能と実効性能の差を階層横断で測る必要がある。
## [2026-08-29] ingest | NVIDIA Hopper Architecture In-Depth
- Source: `.raw/articles/nvidia-hopper-architecture-in-depth-2026-08-29.md`
- Summary: [[@2022__NVIDIA Developer Blog__NVIDIA Hopper Architecture In-Depth]]
- Pages created: [[NVIDIA H100]], [[NVIDIA SHARP]], [[NVSwitch]], [[@2022__NVIDIA Developer Blog__NVIDIA Hopper Architecture In-Depth]]
- Pages updated: [[NVIDIA Hopper]], [[NVIDIA]], [[Tensor Memory Accelerator]], [[Thread Block Cluster]], [[分散共有メモリ]], [[DPX]], [[Transformer Engine]], [[テンソルコア]], [[混合精度訓練]], [[GPU多重化(MPS・MIG)]], [[NVLink]], [[メモリ階層とキャッシュ]], [[CUDA]], [[PCIe性能]], [[GPU最適化]]
- Key insight: Hopper の性能向上は FP8 だけでなく、非同期データ移動、SM 間局所性、MIG の隔離、NVLink のスケールアップを組み合わせたシステム設計として現れる。公式の最大値は後続実測のワークロード依存性と併読する必要がある。
## [2026-08-29] ingest-paper | GPU Cluster for High Performance Computing
- Source: `.raw/papers/GPU-Cluster-for-High-Performance-Computing.pdf`
- Summary: [[@2004__SC__GPU Cluster for High Performance Computing]]
- Pages created: [[格子ボルツマン法]] / [[Zhe Fan]] / [[Feng Qiu]] / [[Arie Kaufman]] / [[Suzanne Yoakum-Stover]] / [[Stony Brook Visual Computing Cluster]] / [[GeForce FX 5800 Ultra]]
- Pages updated: [[Stony Brook University]] / [[GPU最適化]] / [[GPUクラスタ運用]] / [[HPCインターコネクトベンチマーク]] / 共有メタデータ
- Key insight: GPU クラスタの性能は演算ピークだけでなく、テクスチャへのデータ配置、GPU–CPU 転送、MPI 通信、通信スケジュール、計算とのオーバーラップによって決まり、固定問題サイズの強スケーリングでは通信がボトルネックになる。
## [2026-08-29] ingest-paper | Benchmarking and Dissecting the Nvidia Hopper GPU Architecture
- Source: `.raw/papers/arxiv-2402.13499.pdf`
- Summary: [[@2024__arXiv__Benchmarking and Dissecting the Nvidia Hopper GPU Architecture]]
- Pages created: source 1 件、concept 3 件、entity 12 件
- Pages updated: concept 4 件、entity 7 件、共有メタデータ
- Key insight: Hopper の `wgmma`・FP8・DPX・分散共有メモリは、精度形式だけでなく命令発行単位・データ形状・SM 間通信競合によって実効性能が変わる。
## [2026-08-25] ingest-thesis | Towards Efficient Generative Large Language Model Serving
- Source: `.raw/theses/survey-2025-generative-llm-serving/`(全 7 章 / 入力: ローカル PDF 37 ページ)。Xupeng Miao([[Purdue University]])・Gabriele Oliaro・Zhihao Zhang・Xinhao Cheng・Hongyi Jin・[[Tianqi Chen]]・[[Zhihao Jia]]([[Carnegie Mellon University]])、ACM Computing Surveys 58(1):15、2025-09。
- Hub entity: [[Towards Efficient Generative Large Language Model Serving]](address c-005578)
- Chapters: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 1 Introduction and Background]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.1 Taxonomy - Algorithmic Innovation]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 5 Benchmarks and Connection with Other Surveys]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 7 Future Direction]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 8 Conclusion]]
- Pages created: source 7 件、entity 6 件([[Towards Efficient Generative Large Language Model Serving]]・[[FasterTransformer]]・[[FlexFlow-Serve]]・[[ZeRO-Inference]]・[[LightLLM]]・[[MLC-LLM]])
- Pages updated: [[KVキャッシュ管理]]・[[スパース注意]]・[[動的バッチングと継続的バッチング]]・[[本番接地型ベンチマーク]](concept 4 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・.raw/.manifest.json
- 章構成の判断: 第 3 章 Taxonomy 11 ページをアルゴリズム的革新(§3.1)とシステム最適化(§3.2)へ切り出し、全 6 章 → 全 7 章に組み直した(`--chapters "1=2,31=5,32=11,4=16,5=18,7=19,8=21"`)。**この 2 節が本サーベイの 2 本柱そのものなので、1 章のままでは副題「アルゴリズムからシステムまで」の対置が 1 ページに埋もれる**。原本の §1 と §2、§5 と §6 はそれぞれ同一 PDF ページに始まるためページ単位分割では分けられず、1 章に統合した。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンク 38 件をハブ entity へ機械置換、旧ページ専用 attachment 5 点も削除した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 分類の軸が「LLM の計算セマンティクスを変えるかどうか」に置かれている。投機的復号がアルゴリズム側にありながら「出力分布を変えない」という例外的な位置を占める点が際立つ。低レイテンシと高スループットの双対性という、推論手法単体のサーベイには現れない軸を持つ。
- **担当の抑制的な判断 2 件**: (a) 第 5・7・8 章の担当は、[[A Survey on Efficient Inference for Large Language Models]] への言及を第 5 章「Connection with other surveys」節と参考文献リストまで探したが**直接の引用が見当たらなかったため、推測でリンクを張らずその旨をページに明記した**。(b) 第 1・3.1 章の担当は [[LLM推論]] の全 273 行を読んだうえで、本サーベイの内容が既に複数箇所で詳細に引用済みで担当章から新規に言える 2 ソース以上の観察がないと判断し**追記を見送った**。
- 章境界の処理: **PDF のレイアウト上、表が図版としてページ上部に置かれ本文が回り込む箇所で食い込みが集中した**。とくに Algorithm 1(自己回帰復号の疑似コード)と §2.4 の 5 課題が、参照元の §2.3 本文とは別ファイル(`ch-31.txt` 冒頭)に置かれていたため第 1 章へ統合した。§3 全体の総括段落も Table 2 の直後(`ch-04.txt` 内)にあったため第 3.2 章へ帰属させた。各担当が根拠を `## 出典` に残した。
- 図表網羅チェック: 埋め込み 3 点、missing 0 / UNUSED 0。Table 1・Table 2 は Markdown 表へ忠実に転記した。
## [2026-08-25] ingest-thesis | Efficient Training of Large Language Models on Distributed Infrastructures
- Source: `.raw/theses/arxiv-2407.20018/`(全 9 章 / 入力: ローカル PDF 42 ページ)。Jiangfei Duan ほか(Shanghai AI Laboratory / CUHK / Fudan University / Shanghai Jiao Tong University / Nanyang Technological University / Peking University)、Vicinagearth 3(1):38、2026-06-01(arXiv:2407.20018、2024-07-29)。
- Hub entity: [[Efficient Training of Large Language Models on Distributed Infrastructures]](address c-005577)
- Chapters: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 1 Introduction]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 2 Background]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 3 Infrastructure for LLM Training]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 4 Parallelism Schemes for LLM Training]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 5 Computation Optimizations]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 6 Memory Optimizations]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 7 Communication Optimizations]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 8 Fault Tolerance]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 9 Conclusion and Outlooks]]
- Pages created: source 9 件、entity 1 件([[Efficient Training of Large Language Models on Distributed Infrastructures]])
- Pages updated: [[LLM分散学習]]・[[テンソル並列]]・[[GPUレジリエンス]]・[[チェックポイント]]・[[並列化戦略]]・[[混合精度訓練]]・[[アクティベーションオフロード]](concept 7 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・.raw/.manifest.json
- 章構成の判断: 原本の 9 章構成をそのまま採用した(最大章が 8 ページで、下位節を切り出さなくても分類が埋もれないため)。**本バッチ 20 文書のうち章分割の追加操作を行わなかった数少ない文書である**。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンク 82 件をハブ entity へ機械置換、旧ページ専用 attachment 6 点も削除した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 「訓練を止めないこと」を独立した章(第 8 章)として立てる点が構成上の特徴。推論側のサーベイには対応する章がない。LLaMA3 の 466 回中断(78% がハードウェア起因)、Alibaba の単一ノード日次 1.5% が 1,000 GPU 規模で日次 84.8% になる換算、OPT-175B で全体時間の 56% が障害対応という実測が、この章立ての根拠になっている。
- concept への反映: [[GPUレジリエンス]] に C4 の「エラーの 82.5% がノード/デバイスに局在」と既存ノートの HeaRank のホストレベル集中の突き合わせ、[[テンソル並列]] に**アテンションヘッド数がテンソル並列と DeepSpeed-Ulysses のシーケンス並列に共通する離散的な並列度の上限として現れる**という観察、[[混合精度訓練]] に FP8 未満で安定化手法が「精度の分離」から Hadamard 変換・三値量子化のような値分布の変換へ移る流れ、[[アクティベーションオフロード]] にオフロード粒度がパイプライン段レベルから部分系列レベルへ細分化する流れを記録した。
- MFU の未解決の問い: PTD-P の MFU 52% に対し 5 倍規模の LLaMA3 は 38〜41%。この差が縮まるのか規模に対する構造的な代償なのかは本サーベイからは決まらないため、[[LLM分散学習]] に未解決の問いとして記録し推測で解決しなかった。
- 運用上の事故と復旧: 本文書の 4 担当は**セッション上限**(22:10 リセット)で全滅したが、いずれも concept 積み増しの直前まで進んでおり**9 章すべての source ページと図表 15 点は完成していた**。リセット後に concept 積み増しだけを 1 担当へ切り出して投入し完了させた。
- 図表網羅チェック: 埋め込み 15 点、missing 0 / UNUSED 0。
## [2026-08-25] ingest-thesis | LLM4Log
- Source: `.raw/theses/arxiv-2604.16359/`(全 11 章 / 入力: ローカル PDF 54 ページ)。Zeyang Ma・Jinqiu Yang・Tse-Hsun (Peter) Chen(Concordia University SPEAR lab ほか、カナダ)、arXiv:2604.16359、2026-03-18(v2 2026-05-19)。対象は 2020〜2025 年の 145 論文(162 task-paper レコード)。
- Hub entity: [[LLM4Log]](address c-005576)
- Chapters: [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 1 Introduction]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 2 Survey Methodology]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 3 LLM Background and Taxonomy for Log Analysis]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 4 Logging Statement Generation and Maintenance]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 5 Log Parsing]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.1 Downstream Log Analysis Tasks - Log Representation]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.2 Downstream Log Analysis Tasks - Anomaly Detection]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.3 Downstream Log Analysis Tasks - Failure Prediction and Root Cause Analysis]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.5 Downstream Log Analysis Tasks - Log Summarization]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 7 Cross-Cutting Insights and Future Directions]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 8 Conclusion]]
- Pages created: source 11 件、entity 1 件([[LLM4Log]])
- Pages updated: [[LLM向け情報検索]]・[[ログベース異常検知]]・[[障害予測]]・[[根本原因分析]]・[[本番接地型ベンチマーク]](concept 5 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・.raw/.manifest.json
- 章構成の判断: 第 6 章 Downstream Log Analysis Tasks 13 ページの下位節を独立章へ切り出し、全 8 章 → 全 11 章に組み直した(`--chapters "1=1,2=4,3=8,4=13,5=20,61=27,62=30,63=34,65=38,7=40,8=43"`)。**第 6 章はログ表現・異常検知・障害予測・RCA・ログ要約を含み、1 章のままではタスク別の手法一覧が 1 ページに埋もれる**。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンク 107 件をハブ entity へ機械置換、旧ページ専用 attachment 9 点も削除した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: LLM が最も効くのは安定した反復構文でなくドリフト下の意味的変動である。成功システムは無制約な end-to-end 生成に頼らず、探索空間を絞ってから LLM を選択的に呼ぶ層状設計を採る。評価実践は断片化しており、162 レコード中 deployment 証拠は 5 件のみ。
- **オーケストレータによる訂正 3 件**: (a) 第 6.2 章の初稿が異常検知を「71 論文」としていたが、これは**再取り込み前の 1 枚もの source ページの数値をオーケストレータが briefing に書き写したもの**で原本には現れない。`chapters/ch-02.txt` の Figure 3(Total paper: 162, deduplicated: 145)を確認し 70(60)・43.2% へ訂正、第 6.3 章の件数表記も Figure 3 に揃えた。(b) Table 3 が第 2 章(画像)と第 3 章(Markdown 表)に二重掲載されていたため、内容が §2.3 に属することから第 2 章へ Markdown 表として一本化し画像を削除、第 3 章は参照のみに改めた。(c) 第 6.1 章が Fig. 5・Fig. 6 を attachment へコピーしながら埋め込みを落としていたため補填した。
- 章境界の処理: **全章で章末が次章ファイル冒頭へ食い込んでいた**(`ch-03` 冒頭 40 行 → 第 2 章、`ch-04` 冒頭 36 行 → 第 3 章、`ch-05` 冒頭 18 行 → 第 4 章、`ch-61` 冒頭 7 行 → 第 5 章、`ch-62` 冒頭 13 行 → 第 6.1 章、`ch-63` 冒頭 29 行 → 第 6.2 章、`ch-65` 冒頭 36 行 → 第 6.3 章、`ch-07` 冒頭 5 行 → 第 6.5 章)。各担当が節番号を根拠に帰属を判断し `## 出典` に残した。オーケストレータが担当間で申し送りを中継した。
- **entity 名の衝突を 1 件検出**: ログパースの手法 `LILAC` を entity 化しようとしたところ、既存 [[Lilac]] が**別実体**(IaC lifting のニューロシンボリックパイプライン)として存在した。大文字小文字だけが違う名前はファイル名衝突を起こすため回避し、以降の担当へ `grep -i` での確認を指示した。
- concept の判断: 第 4・5 章の担当は担当 concept 2 件([[ログ生成]]・[[ログパース]])を全文読んだうえで**どちらも追記を見送った**(本サーベイの当該章の内容が既に濃密にカバーされており、新たに 2 ソース以上を要する横断的知見の材料がなかったため)。conventions §8 の重複回避に沿う判断である。
- 図表網羅チェック: 埋め込み 6 点、missing 0 / UNUSED 0。Table 1〜9 は Markdown 表へ忠実に転記した。
## [2026-08-25] ingest-thesis | A Survey on Efficient Inference for Large Language Models
- Source: `.raw/theses/arxiv-2404.14294/`(全 11 章 / 入力: ローカル PDF 36 ページ)。Zixuan Zhou ほか(Infinigence-AI / Tsinghua University / Shanghai Jiao Tong University / Peking University)、arXiv:2404.14294v3、2024-07-19。
- Hub entity: [[A Survey on Efficient Inference for Large Language Models]](address c-005534)
- Chapters: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 1 Introduction]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 2 Preliminaries]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 3 Taxonomy]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 4 Data-level Optimization]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.0 Model-level Optimization - Efficient Structure Design]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.2 Model Compression - Sparsification, Structure Optimization, Distillation, and Dynamic Inference]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.0 System-level Optimization - Inference Engine]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.1 System-level Optimization - Serving System]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.2 System-level Optimization - Hardware Accelerator and Framework Comparison]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 7 Discussions of Key Application Scenarios and Conclusion]]
- Pages created: source 11 件、entity 8 件([[A Survey on Efficient Inference for Large Language Models]]・[[AWQ]]・[[GPTQ]]・[[SmoothQuant]]・[[SparseGPT]]・[[Wanda]]・[[FlashDecoding++]]・[[ORCA]])
- Pages updated: [[Infinigence-AI]]・[[Zixuan Zhou]](entity 2 件)。[[KVキャッシュ管理]]・[[LLMサービング管理]]・[[LLM推論]]・[[動的バッチングと継続的バッチング]]・[[枝刈り]]・[[状態空間モデル]]・[[知識蒸留]]・[[線形注意]]・[[量子化]](concept 9 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・.raw/.manifest.json
- 章構成の判断: Model-level Optimization 14 ページと System-level Optimization 7 ページの下位節を独立章へ切り出し、全 7 章 → 全 11 章に組み直した(`--chapters "1=1,2=2,3=3,4=5,50=7,51=11,52=16,60=21,61=25,62=27,7=28"`)。**第 5 章は効率的構造設計・量子化・スパース化ほかを、第 6 章は推論エンジン・サービングシステム・ハードウェアを含み、1 章のままでは 3 階層タクソノミーの下位が 1 ページに埋もれる**。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンク 17 件をハブ entity へ機械置換、旧ページ専用 attachment 10 点も削除した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 3 階層が「何を代償に効率を買うか」で切られている。data-level は再学習不要、model-level は性能に対して非可逆、system-level は性能に対して可逆。実測(Table 4・Table 6)に踏み込んでおり、W4A16 が prefilling 遅延をむしろ悪化させうること、バッチサイズと入力長が増えるほど高速化幅が縮むことを示す。
- 章境界と図表帰属の訂正 3 件: (a) Table 1 と前後の段落は物理的に `ch-02.txt`(PDF p2)にあるが本文上は §1 に属するため第 1 章へ帰属し attachment 名も `ch02-` → `ch01-` に改めた。(b) Figure 2・3 は briefing の割り当てでは第 3 章だが §2.2 / §2.3 の本文中で論じられるため第 2 章へ埋め込んだ。(c) Table 2 は割り当て上は第 5.1 章だが内容は §5.1.3 なので第 5.0 章へ Markdown 転記し、オーケストレータが第 5.1 章の担当へ重複回避を申し送った。いずれも根拠を `## 出典` に残した。
- **クロップ不良の自力修復**: `p003-Figure2.png` と `p003-Figure3.png` が**どちらも 2 つの図を混ぜた同一の合成クロップ**だったため、担当が PDF p3 を 300dpi で再レンダリングして 2 図を別々に切り直した。前文書([[A Survey of LLM × DATA]])での 2 件を受けて briefing に加えた「クロップが不完全なら担当自身が再レンダリングして切り直す」手順が機能した。
- 章境界の食い込み: 二段組み抽出のため全章で発生した。第 4 章の §4.3 が `ch-50.txt` 冒頭へ、第 5.0 章の §5.1.3 末尾が `ch-51.txt` 冒頭へ流れ込むなど。各担当が回収し根拠を `## 出典` に残した。
- 運用上の事故と復旧: 本文書の 4 担当は**週次上限**(Aug 29 9:00 リセット)で 1 度全滅し成果物ゼロになったため、リセット後に再投入した。再投入後も**セッション上限**(16:20 リセット)で 2 担当が終了したが、いずれもページ書き込み後の検証段階だったため成果物は完全だった。加えて scratchpad(`/private/tmp`)が清掃で消えたため、退役スクリプトと作業メタデータを再構築した。
- 図表網羅チェック: 埋め込み 17 点(Figure 1〜17)、missing 0 / UNUSED 0。Table 1〜6 は Markdown 表へ忠実に転記した。転記済みの Table 1 画像と 0 バイトで書き込みが中断していた Figure 13 の重複コピーは、オーケストレータが削除した。
## [2026-08-29] ingest-paper | StriaTrace: Efficient Tracing and Diagnosis for Online LLM Inference
- Source: `.raw/papers/osdi26-wu-haonan.pdf`
- Summary: [[@2026__OSDI__StriaTrace - Efficient Tracing and Diagnosis for Online LLM Inference]]
- Pages created: [[StriaTrace]]・[[Yanqing Chen]]・[[Jingbo Xu]]・[[Guangtao Xue]]・[[Shanghai Key Laboratory of Trusted Data Circulation and Governance and Web3]]・[[py-spy]]・[[NVIDIA H20-3e]]
- Pages updated: [[Haonan Wu]]・[[Erci Xu]]・[[Ennan Zhai]]・[[Wenyuan Yu]]・[[Kun Qian]]・[[Xue Li]]・[[Jingren Zhou]]・[[Alibaba Group]]・[[Shanghai Jiao Tong University]]・[[vLLM]]・[[Qwen3]]・[[CUPTI]]・[[OpenTelemetry]]・[[LLM推論]]・[[LLMサービング管理]]・[[GPU観測性]]・[[Rooflineモデル]]・[[分散トレーシング]]・[[トレーシングオーバーヘッド]]・[[クリティカルパス分析]]
- Key insight: オンライン推論では、同期点・クリティカルパス・異常時保存を組み合わせた層横断観測が、低オーバーヘッドと散発的異常の診断を両立する。
## [2026-08-29] ingest-slides | BPF in the Agentic Era (LSFMM 2026)
- Source: `.raw/slides/bpf-in-the-agentic-era-lsfmm-2026/bpf-in-the-agentic-era-lsfmm-2026.pdf`
- Visual pages: `.raw/slides/bpf-in-the-agentic-era-lsfmm-2026/pages/`(26ページ)
- Media: transcript なし
- Summary: [[@2026__BPFConf2026__BPF in the Agentic Era (LSFMM 2026)]]
- Pages created: [[Rust-BPF]]・[[BPF arena memory]]・[[Aya]]・[[veristat]]・[[drgn]]・[[bpftool]]・[[rust-for-linux]]
- Pages updated: [[BPF verifier]]・[[eBPF]]・[[BPF]]・[[エージェント型コーディング]]・[[カーネル障害診断]]・[[bpftrace]]・[[libbpf]]・wiki/index.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・wiki/hot.md・.raw/.manifest.json
- Key insight: 標準 Rust を BPF 上で動かすには、arena・間接呼び出し・widening・panic 処理・構造化 verifier エラーを一体で設計し、エージェントに安全で修正につながるフィードバックを返す必要がある。
## [2026-08-29] ingest | BPF in the agentic era
- Source: `.raw/articles/lwn-1075067-2026-08-29.md`
- Summary: [[@2026__LWN__BPF in the agentic era]]
- Pages created: [[Alexei Starovoitov]]・[[Daroc Alden]]・[[LWN.net]]・[[BPF verifier]]
- Pages updated: [[Daniel Borkmann]]・[[Steven Rostedt]]・[[eBPF]]・[[BPF]]・[[エージェント型コーディング]]・wiki/index.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・wiki/hot.md・.raw/.manifest.json
- Key insight: verifier を安全境界としてカーネル内に残したまま、Rust 連携と説明的エラーでエージェントのフィードバックループを短くする提案が示された。
## [2026-08-29] ingest | AI Chip Architectures
- Source: `.raw/articles/ai-chip-architectures-2026-08-29.md`(jepeake、技術記事、URL: https://www.jepeake.com/ai-chip-architectures)
- Summary: [[AI Chip Architectures]]
- Pages created: [[AI Chip Architectures]](source, address c-005594)、[[Groq]](entity, address c-005595)
- Pages updated: [[NVIDIA]]・[[Google TPU]]・[[AMD]]・[[Cerebras]]・[[AWS Trainium]]・[[CUDA]](entity 6件)、[[AIアクセラレータ]]・[[メモリウォール]]・[[チップレット]]・[[テンソルコア]]・[[光回線交換]]・[[ドメイン固有アーキテクチャ]](concept 6件)、wiki/index.md・wiki/hot.md・.raw/.manifest.json
- Key insight: NVIDIA GPU・Google TPU・AMD Instinct・Cerebras WSE・AWS Trainium・Groq LPU の6アーキテクチャは、同一のメモリウォール問題に対し正反対の設計哲学へ分岐している。特にCerebrasとGroqはともにHBMを持たずSRAM専用という同一制約から出発しながら、データ到着駆動(Cerebras)と時計駆動の完全決定論(Groq)という対極の実行モデルを取る。GroqのLPU技術は2025年にNVIDIAへ非独占ライセンスされ、2026年にRubin NVL72のAttention-FFN分離構成へ統合された。
- 画像: 記事本文は `/diagrams/*.png` への相対パスでアーキテクチャ図・floorplan図を多数参照するが、実データではなく記事側の説明図であり、今回のingestではテキスト情報を中心にsource/entity/conceptページへ反映し画像埋め込みは行っていない。
- 判断: DragonScale address付与対象は新規ページ(source 1件・entity 1件)のみ。既存entity/conceptページへは追記のみで再採番していない。
## [2026-08-25] ingest-thesis | A Survey of LLM × DATA
- Source: `.raw/theses/arxiv-2505.18458/`(全 12 章 / 入力: ローカル PDF 58 ページ)。Xuanhe Zhou ほか(Tsinghua University / Shanghai Jiao Tong University / Alibaba Group / Shanghai AI Laboratory)、arXiv:2505.18458、2025-05-24。400 超の論文が対象。
- Hub entity: [[A Survey of LLM × DATA]](address c-005521)
- Chapters: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 1 INTRODUCTION]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.4 Data Storage for LLM]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.5 Data Serving for LLM]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.1 LLM for Data Manipulation]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.2 LLM for Data Analysis]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.3 LLM for Data System Optimization]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 5 Conclusion]]
- Pages created: source 12 件、entity 2 件([[A Survey of LLM × DATA]]・[[R-Bot]])
- Pages updated: [[3FS]]・[[D-Bot]]・[[DB-GPT]](entity 3 件)。[[KVキャッシュ管理]]・[[LLMスケーリング則]]・[[クエリオプティマイザ]]・[[サンプリング手法]]・[[チェックポイント]]・[[データ品質SLO]]・[[データベース自律診断]]・[[データ統合]]・[[データ発見]]・[[分散ファイルシステムとオブジェクトストア]]・[[言語モデル事前学習]](concept 11 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・.raw/.manifest.json
- 章構成の判断: 第 2 章 28 ページと第 3 章 11 ページの下位節を独立章へ切り出し、全 5 章 → 全 12 章に組み直した(`--chapters "1=1,20=6,21=8,22=15,23=19,24=24,25=31,31=34,32=38,33=43,4=45,5=47"`)。**とくに第 2 章はデータ処理 16 ページ・保存 7 ページ・提供 3 ページを含み、1 章のままでは DATA4LLM の分類体系が 1 ページに埋もれる**。データ処理はさらに 3 章へ分けた。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンク 15 件をハブ entity へ機械置換、旧ページ専用 attachment 10 点も削除した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: DATA4LLM と LLM4DATA を対称に配置する構成が骨格で、独自貢献の IaaS 4 次元がデータ品質の評価軸として全章を貫く。充足性次元はデータ混合手法群と同一の引用文献群を共有しており、次元の定義と技術が原文中で直結している。
- LLM4DATA の非対称性: 構成チューニングとクエリ最適化は「プロンプト → RAG → ファインチューニング」の 3 系統で整理されるのに対し、異常診断だけがマルチエージェント協調とローカライズド蒸留を追加して 4 系統になる。
- **原本内の不整合 2 件**: (a) 第 5 章の結論が課題を「DATA4LLM・LLM4DATA・hybrid data and LLM optimization」の 3 観点で提示したと述べるのに対し、第 4 章本文は §4.1 / §4.2 の 2 節構成のみで hybrid に対応する独立節が存在しない。(b) 第 2.3 章の範囲(`chapters/ch-23.txt`)の節番号が "2.2.7.1"〜"2.2.7.3" と印字されているが内容は §2.3.7 である。いずれも担当が推測で補完せず記録し、出典は PDF ページ番号で代替した。
- 章境界の処理: **二段組みレイアウトのため、抽出テキストをそのまま読むと左右カラムの文が交互に混ざる**。各担当が `pdftotext` で原本ページを再抽出し、左カラム上から下 → 右カラム上から下の順に読み直して本文を再構成した。章末の次章ファイルへの食い込みも多発したが、各担当が帰属の判断と根拠を `## 出典` に残した。
- **図表のクロップ不良を 2 件補修**: (a) Figure 3 は自動抽出の 2 ファイルがどちらもページ 7 全体(Table 1 と混在)でキャプションも切れていたため、第 1 章の担当が `pdftoppm` で 300dpi 再レンダリングして自分で切り直した。(b) Figure 5 は (A) Perplexity-based Data Filtering パネルが欠落した不完全クロップだったため、担当の報告を受けてオーケストレータが PDF p12 の描画範囲(x 308-568, y 143-426)を直接指定して再クロップした。**この 2 件を受けて、以降の文書の briefing には「クロップが不完全なら担当自身が再レンダリングして切り直す」手順を加えた。**
- 図表網羅チェック: 埋め込み 10 点、missing 0 / UNUSED 0。Table 1〜7 は Markdown 表へ忠実に転記した。
## [2026-08-28] ingest-paper | MagmaScope(Li ほか、ICSE-SEIP、2026)
- Source: `.raw/papers/MagmaScope_Identifying_Root_Cause_Changes.pdf`
- Summary: [[@2026__ICSE-SEIP__MagmaScope Identifying Root-Cause Changes for Emergency Incident in Large-Scale Cloud Infrastructure]]
- Pages created: source 1 件 / entity 11 件([[Zongyang Li]]・[[Ning Wang]]・[[Jiliang Liu]]・[[Yaping Zhang]]・[[Feifan Tong]]・[[Zhaoxing Chen]]・[[Chan Li]]・[[Ming Liu (ByteDance)]]・[[Xiang Zhang (ByteDance)]]・[[MagmaScope]]・[[ByteDance emergency incident dataset]]) / concept 1 件([[Change Object Rewrite]])
- Pages updated: entity 5 件([[Yifan Wu]]・[[Tong Jia]]・[[Ying Li]]・[[Peking University]]・[[ByteDance]]) / concept 7 件([[根本原因分析]]・[[Fault Localization]]・[[LLMによる根本原因分析]]・[[マルチモーダル障害診断]]・[[変更起因インシデント]]・[[インシデント管理]]・[[インシデント調査戦略]])
- Key insight: MagmaScope は変更チケット(第ゼロのテレメトリ)+IM グループチャット(第 4 のオペレーショナルモダリティ)を組み合わせた 3 段ハイブリッドパイプラインで ByteDance 本番 55 件の緊急インシデントに Top@5 74.7%・Top@10 89.8% を達成。Change Object Rewrite(変更チケット記述の LLM セマンティック正規化)が精度の律速。関連付けは「因果推論ではなく意味的理解」と論文自身が明示する。
## [2026-08-28] ingest-paper | A Definition of AGI
- Source: `.raw/papers/arxiv-2510.18212.pdf`
- Summary: [[@2025__arXiv__A Definition of AGI]]
- Pages created: [[AGI]] / [[Cattell-Horn-Carroll理論]] / [[Dawn Song]] / [[Christian Szegedy]] / [[Honglak Lee]] / [[Yarin Gal]] / [[Erik Brynjolfsson]] / [[Sharon Li]] / [[Andy Zou]] / [[Max Tegmark]] / [[Gary Marcus]] / [[Kevin McGrew]]
- Pages updated: [[LLM評価]] / [[LLM能力スパース性]] / [[エージェントメモリ]] / [[Dan Hendrycks]] / [[Center for AI Safety]] / [[Long Phan]] / [[Yoshua Bengio]] / [[Bo Li]]
- Key insight: AGI を総合性能ではなく人間の認知能力プロファイルとして定義すると、GPT-5 の AGI Score が57%でも長期記憶保存が0%という、進歩と基礎能力の欠損の併存を定量化できる。
## [2026-08-27] query-deep | 教科書6冊への図表転載
- 対象: 図が未挿入だった wiki/questions の教科書 6 冊。RDMA 編(58 点)とホスト編(63 点)は既存のため対象外。
- 選定: RDMA 編と同じ基準(構造図・数値の根拠グラフ・対比図)。1 章あたりおおむね 3〜7 点。総括・未解決・付録は 0 点。既存 `wiki/sources/_attachments/` のみ使用。出典行に原本の図表番号(論文は `図 N`、スライドは `p.N`、映像は `frame-NNN`)を付与。
- 点数: [[wiki/questions/LLM学習インフラ実運用の教科書]] 72 / [[wiki/questions/KVキャッシュ管理の教科書]] 115 / [[wiki/questions/SLI-SLO教科書]] 50 / [[wiki/questions/時系列基盤モデルの教科書]] 46 / [[wiki/questions/インシデント対応の教科書]] 52 / [[wiki/questions/ポストモーテムの教科書]] 39。合計 374 点。全パス実在確認済み。
- 体制: Grok 4.6 サブエージェント 8 体。5 冊は各 1 体が本文へ直接挿入。LLM 編は第 I–IV / V–IX / X–XIII の 3 体が sidecar JSON を書き、オーケストレータが本文へ統合した。
- Pages updated: 上記 6 教科書・wiki/hot.md・wiki/log.md。address は再採番していない。
## [2026-08-25] ingest-thesis | Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications
- Source: `.raw/theses/survey-2025-trustworthy-ai-perf-diagnosis/`(全 10 章 / 入力: ローカル PDF 27 ページ)。Ruyue Xin・Jingye Wang・Peng Chen・Zhiming Zhao ほか(University of Amsterdam / Multiscale Networked Systems / Xihua University / China University of Geosciences (Beijing))、ACM Computing Surveys、2025。
- Hub entity: [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]](address c-005510)
- Chapters: [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 1 Introduction]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 2 Trustworthiness Requirements and Performance Diagnosis Systems]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.0 State-of-the-Art Technologies - Overview]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.1 Data Collection]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.2 Data Preprocessing]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.3 Performance Anomaly Detection]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.4 Root Cause Localization]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.5 System-Level Trustworthiness Requirements]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 4 Future Research Directions and Opportunities]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 5 Conclusion]]
- Pages created: source 10 件、entity 1 件([[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]])
- Pages updated: [[AIOps]]・[[Fault Localization]]・[[差分プライバシー]]・[[根本原因分析]]・[[異常検知]](concept 5 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・.raw/.manifest.json
- 章構成の判断: 第 3 章 15 ページの下位節 §3.1〜§3.5(データ収集・データ前処理・性能異常検知・根本原因箇所特定・システムレベル要件)を独立章として切り出し、全 5 章 → 全 10 章に組み直した(`--chapters "1=2,2=4,30=9,31=10,32=13,33=16,34=20,35=22,4=24,5=26,6=27"`)。**この下位節がフレームワークの構成要素そのものに対応するため、1 章のままでは要件 × 構成要素の格子が 1 ページに埋もれる**。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンク 48 件をハブ entity へ機械置換、旧ページ専用 attachment 10 点も削除した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 貢献は新手法ではなく格子そのもの。要件 × 構成要素で既存技術を並べ替えたことで格子の空白が研究の空白として読める。公平性はデータ収集と異常検知にのみ現れ、異常検知だけが 4 要件すべてを課される。データプライバシーと人間の介入はシステムレベル要件として第 3.5 章に切り出される。
- **図表の帰属規則を発見し、オーケストレータが規則として確定させた**: 本文書では **Figure 7〜10 の印字位置が内容上の帰属章より 1 章分後ろへずれる**(次章の PDF ページ冒頭に浮動配置される)。担当ごとに判断が割れ、Figure 7 は「次章担当が埋め込む前提」で誰も埋め込まず、Figure 10 は第 3.5 章と第 4 章の両方が埋め込むという逆の事故が同時に起きた。オーケストレータが (a) Figure 7 を第 3.2 章へ補填、(b) 第 4 章側の Figure 10 埋め込みと重複 attachment を削除、(c) 両章の `## 出典` に規則と根拠を追記、で解消した。
- 章境界の処理: 10 章中ほぼ全ての章境界で章末が次章ファイル冒頭へ食い込んでいた(`ch-02`→`ch-30`、`ch-30`→`ch-31`、`ch-31`→`ch-32`、`ch-32`→`ch-33`、`ch-04`→`ch-05`)。各担当が帰属の判断と根拠を `## 出典` に残した。
- 担当の自律的な判断 2 件: 第 3.0〜3.2 章の担当が (a) Figure 5 を briefing の割り当て(ch3.2)から内容に従って ch3.1 へ移し、(b) [[差分プライバシー]] の更新元を briefing 指定の第 3.1 章から実際に privacy を論じる第 3.0 章へ変更した(第 3.1 章本文に "privacy" の語が 1 度も出現しないことを grep で確認したうえで)。いずれも根拠を `## 出典` と報告に残している。
- 原本の異常: Table 3 の pdftotext 抽出が列順の崩れた形で出力されていたため、担当が画像 `p024-Table3.png` を正として転記した。それ以外の矛盾・欠落は検出されていない。
- 図表網羅チェック: 埋め込み 10 点、missing 0 / UNUSED 0。Table 1〜3 は Markdown 表へ忠実に転記した。
## [2026-08-25] ingest-thesis | Anomaly detection and root-cause identification in microservices
- Source: `.raw/theses/survey-2026-anomaly-rca-microservices/`(全 13 章 / 入力: ローカル PDF 42 ページ)。Luís M. Barata ほか(Universidade da Beira Interior / Instituto Politécnico de Castelo Branco / Instituto de Telecomunicações / NOVA LINCS)、Cluster Computing 29:309、2026-03-04 受理。対象は 2012〜2025 年の 117 件。
- Hub entity: [[Anomaly detection and root-cause identification in microservices]](address c-005496)
- Chapters: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 1 Introduction]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 2 Related surveys and contribution]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 3 Background on microservices and anomaly detection]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.1 Anomaly detection in a microservices environment - Overview]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.2 Data collection methods]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.3 Methods to identify anomalies in microservices]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.4 Types of anomalies detected]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.5 Root-cause identification]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.7 Methods comparison]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 5 Discussion]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 6 Challenges, open issues, and directions to future investigations]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 7 Conclusion]]
- Pages created: source 13 件、entity 1 件([[Anomaly detection and root-cause identification in microservices]])
- Pages updated: [[AIOps Challenge]]・[[GAIA Dataset]]・[[Sock Shop]]・[[Train-Ticket]](entity 4 件)。[[オブザーバビリティ]]・[[マイクロサービスアーキテクチャ]]・[[マイクロサービスベンチマーク]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[異常検知]](concept 6 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・.raw/.manifest.json
- 章構成の判断: 第 4 章 22 ページの下位節(§4.1〜§4.7)を独立章として切り出し、全 7 章 → 全 13 章に組み直した。本サーベイの分類体系そのものが第 4 章に集中しているため、1 章のままでは分類が 1 ページに埋もれる。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンク 93 件をハブ entity へ機械置換、旧ページ専用 attachment 6 点も削除した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 同主題サーベイ 3 件([[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] 2021 / [[Failure Diagnosis in Microservice Systems]] 2024 / 本サーベイ 2026)のうち、本サーベイだけが定量的な手法比較へ踏み込む。ただし第 5 章が「データセットとテストベッドの違い・欠測メトリクスにより手法間比較は本質的に難しい」と自ら明言しており、数値は序列ではなく傾向。
- 新しい切り口: Trusted Distributed AI(TDAI)を 7 次元(信頼性・一貫性・説明可能性・頑健性・因果妥当性・スケーラビリティ・テレメトリ完全性)へ分解する(Table 10)。先行 2 サーベイにない軸で、同時期の [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]] の 6 要件と呼応する。
- **原本内の不整合を 3 件検出**: (a) abstract・第 2 章の「117 件」と §4.1 の「143 件(PRISMA 直接適用 141 件+他手法由来 2 件)」、(b) 第 2 章の検索結果「1,700 件」と §4.1 の「10,485 件」、(c) §6.2 本文の「4 つの相補的次元」と Table 10 の 7 次元(形式定義 T=f(R,Ro,C,E) も 4 次元のみ)。いずれも担当が推測で解決せず原文どおり記録し、オーケストレータが (a) を原本テキストで再確認したうえで [[異常検知]] に contradiction callout として残した。
- 章境界の処理: 13 章中複数箇所で章末が次章ファイル冒頭へ食い込んでいた。各担当が帰属の判断と根拠を `## 出典` に残した。
- 図表網羅チェック: 埋め込み 13 点、missing 0 / UNUSED 0。Table 10 は Markdown 表へ忠実に転記した。Fig. 5(Evolution of anomaly types detected)は印字位置が第 4.5 章側だが論じている対象が §4.4 の異常 3 分類であるため、オーケストレータが第 4.4 章へ埋め込み直し、両章の `## 出典` に帰属根拠を記した。
- 共有 concept の扱い: [[異常検知]]・[[根本原因分析]] は本コミット時点で次文書([[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]])の第 1〜2 章担当による追記も含んだ状態でコミットしている(concept ページは累積式のため巻き戻さない)。
## [2026-08-25] ingest-thesis | A Survey on Failure Analysis and Fault Injection in AI Systems
- Source: `.raw/theses/survey-2025-fault-injection-ai-systems/`(全 12 章 / 入力: ローカル PDF 42 ページ)。Guangba Yu ほか、ACM TOSEM、2025-12。対象は 142 件。
- Hub entity: [[A Survey on Failure Analysis and Fault Injection in AI Systems]](address c-005483)
- Chapters: [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 1 Introduction]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 2 Background and Definitions]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 3 Survey Methodology]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 4 FA and FI in AI Service]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 5 FA and FI in AI Model]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 6 FA and FI for AI Framework]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 7 FA and FI for AI Toolkit]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 8 FA and FI for AI Platform]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 9 FA and FI for AI Infrastructure]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 10 Threats to Validity]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 11 Future Opportunities of FI in AI Systems]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 12 Conclusion]](12 件)
- Pages created: source 12 件、entity 1 件([[A Survey on Failure Analysis and Fault Injection in AI Systems]])
- Pages updated: [[CUDA]]・[[ChaosBlade]]・[[NCCL]]・[[PyTorch]]・[[TensorFlow]](entity 5 件)。[[GPUレジリエンス]]・[[敵対的摂動]]・[[運用障害分析]]・[[量子化]]・[[障害注入]](concept 5 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 章分割: 本文書は 6 層が原本の時点で第 4〜9 章として独立しているため、章分割の追加操作は行っていない。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換した。
- Key insight: RQ1(実障害)と RQ2(FI が模擬できる障害)を別々に集計し RQ3 でその差集合を層ごとに表として明示する構成が独自性。6 層を並べると、分散 GPU 環境に固有の障害(NCCL / NVLink Fault・GPU 資源競合)が層を問わず FI の空白になっているという構図が見える。
- 章境界の処理: 12 章中 6 箇所で章末が次章ファイル冒頭へ食い込んでいた。**各担当が帰属の判断と根拠を `## 出典` に残したため、オーケストレータ側で Table 7・Table 10 の重複有無を機械照合できた**(結果は重複なし、転記は正しい章にのみ存在)。
- 原本の異常 2 件: Figure 5 の印字キャプションと実際のグラフ内容が不一致(原本の誤植)。§3.4 末尾の文が途切れ原本全文にも続きが存在しない。いずれも推測補完せず注記した。
- 図表網羅チェック: 埋め込み 7 点、missing 0 / UNUSED 0。Figure 1(6 層立体図)は当初 Table 1 と横並びの右段まで取り込んでいたため左段のみに切り出し直し、補填した。
## [2026-08-25] ingest-thesis | Failure Diagnosis in Microservice Systems
- Source: `.raw/theses/arxiv-2407.01710/`(全 11 章 / 入力: ローカル PDF 52 ページ)。Shenglin Zhang ほか(Nankai University / Microsoft / Tsinghua University)、arXiv:2407.01710、2024-06-27。対象は 2003 年以降の 98 本。
- Hub entity: [[Failure Diagnosis in Microservice Systems]](address c-005469)
- Chapters: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 1 Introduction]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 2 Methodology]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 3 Terminologies]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.1 Failure Diagnosis Through Logs]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.2 Failure Diagnosis Through Metrics]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.3 Failure Diagnosis Through Traces]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.4 Failure Diagnosis Through Multimodal Data]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 5 Discussion]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 7 Related Work]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 8 Conclusions]](11 件)
- Pages created: source 11 件、entity 3 件([[Failure Diagnosis in Microservice Systems]]・[[AIOps Challenge]]・[[Loghub]])
- Pages updated: entity 17 件。[[Fault Localization]]・[[マイクロサービスアーキテクチャ]]・[[マイクロサービスベンチマーク]]・[[マルチモーダル障害診断]]・[[メトリクス削減]]・[[分散トレーシング]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[ログ解析]](concept 9 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 章構成の判断: 第 4 章 25 ページのデータモダリティ別の下位節を独立章として切り出し、全 8 章 → 全 11 章に組み直した(`--chapters "1=1,2=4,3=7,41=11,42=15,43=25,44=32,5=36,6=40,7=44,8=45,9=46"`)。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: マルチモーダルが独立カテゴリに昇格した(Soldani & Brogi 2021 の 3 分類 → 本サーベイの 4 分類)。一方で 98 本を集めながら定量比較に踏み込まない点は 2021 年のサーベイと同じで、評価環境が揃わない状況が 3 年変わっていない。
- **entity 名の衝突を 1 件検出**: 本サーベイの `Sage`(トレースベース RCA)は既存 [[SAGE]](USENIX 傘下団体)と別実体のため entity 化を回避。一方 `Sieve` は既存 entity と**同一システム**と確認してリンクした(同名でも実体が同じか別かで扱いを分けた)。
- **既存 wiki の事実誤りを 1 件訂正**: [[根本原因分析]] の以前の記述が本サーベイの参照 [130] を「T-Rank」としていたが、第 5 章担当の報告を受けてオーケストレータが原本の参考文献リストを確認し `[130] Yu Gan et al. 2023. Sleuth: A Trace-Based Root Cause Analysis System` へ訂正した。担当は「担当外」として書き換えず報告するにとどめており、想定どおりの経路で拾えた。
- 出典厳格性: 表の「報告値」列について、原本の §4.1・§4.2 本文と Table 3・4 には個別手法の定量値の記載がないことを担当が確認し、「記載なし」と明記した(数値の捏造を回避)。
- 図表網羅チェック: 埋め込み 7 点、missing 0 / UNUSED 0。手法一覧表は Markdown 表へ転記した。
## [2026-08-25] ingest-thesis | A Survey of AIOps in the Era of Large Language Models
- Source: `.raw/theses/arxiv-2507.12472/`(全 8 章 / 入力: ローカル PDF 35 ページ)。Lingzhe Zhang ほか、ACM Computing Surveys、2025-09-09(arXiv:2507.12472v1, 2025-06-23)。対象は 2020-01〜2024-12。
- Hub entity: [[A Survey of AIOps in the Era of Large Language Models]](address c-005460)
- Chapters: [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 1 Introduction]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 2 Systematic Review Process]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 3 RQ1 - Transformations in Data with LLM Integration]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 4 RQ2 - Evolving Tasks in AIOps with LLMs]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 5 RQ3 - LLM-based Methods for AIOps]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 6 RQ4 - Evaluating LLM-based AIOps]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 7 Challenges and Future Directions]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 8 Conclusion]](8 件)
- Pages created: source 8 件、entity 1 件([[A Survey of AIOps in the Era of Large Language Models]])
- Pages updated: [[Tsinghua University]](entity 1 件)。[[AIOps]]・[[Fault Localization]]・[[LLMによる根本原因分析]]・[[ソフトウェアエイジング]]・[[テレメトリ]]・[[ログ解析]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[異常検知]]・[[障害緩和]](concept 10 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換、旧ページ専用の attachment 7 点も削除した。
- Key insight: 章構成が RQ と一対一で対応し工程順に追跡する構成のため、空白の在り処が見える。トレースデータには LLM ベース手法が皆無。新規 5 タスクのうち 4 つは人間の作業を助ける方向で、LLM は自動化より人間との接点を増やした。
- **原本内の不整合を 3 件検出**: (a) アブストラクトの「183 本」と §2.3 本文の「163 本」の食い違い、(b) §2.2 冒頭の平文が RQ2/RQ3 の対応を §1.3 の定義と逆に記述、(c) Table 1 が Notaro ほか(2021)を「Paolop et al.」と誤記。いずれも担当が推測で解決せず原文どおり転記して各章ページに注記した。
- concept の分担: 第 3〜6 章の担当が RQ ごとに concept を分担した。第 4 章の担当は 3 つの担当 concept を精査したうえで「旧 1 枚ページが既に同内容を統合済み」と判断し、conventions §8 の重複回避に従って追記を見送った。第 5 章の担当は [[根本原因分析]] が既に厚すぎると判断し、より具体的な既存 concept [[LLMによる根本原因分析]] を見つけてそちらへ書いた。
- 図表網羅チェック: 埋め込み 11 点、missing 0。旧ページ由来の未使用 attachment 7 点は退役時に削除した。
## [2026-08-25] ingest-thesis | D'ya like DAGs? A Survey on Structure Learning and Causal Discovery
- Source: `.raw/theses/arxiv-2103.02582/`(全 6 章 / 入力: ローカル PDF 35 ページ)。Matthew J. Vowels・Necati Cihan Camgoz・Richard Bowden(CVSSP, University of Surrey)、ACM Computing Surveys 55(4), Article 82、2022-11-21。
- Hub entity: [[D'ya like DAGs]](address c-005452)
- Chapters: [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 1 Introduction]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 2 Background - Definitions and Assumptions]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 3 Structure Discovery Methods]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 4 Combinatoric and Search Based Approaches]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 5 Continuous Optimization Based Approaches]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 6 Summary and Discussion]](6 件)
- Pages created: source 6 件、entity 2 件([[D'ya like DAGs]]・[[NO TEARS]])
- Pages updated: [[因果発見]](concept 1 件。第 1+2 章が仮定の体系、第 3+4 章が探索空間、第 5 章が連続緩和、第 6 章が因果の跳躍という軸で分担)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換、旧ページ専用の attachment 5 点も削除した。
- Key insight: 手法を網羅した論文が、その出力の解釈可能性そのものに留保を付けている。この留保は Soldani & Brogi(2021)の監視ベース RCA 手法群(LOUD 以外すべて PC アルゴリズムで因果グラフを構築)と突き合わせると実務的な重みを持つ。
- 原本内の矛盾 1 件: NODAG(Varando 2020)は本文で「非巡回性制約を課さない」と明記されるが Table 2 では Acycl.=yes。解消せず両論併記で記録した。
- ページ名の調整: 原本の節題 `Combinatoric/Search Based Approaches` はスラッシュがファイル名に使えないため "Combinatoric and Search Based Approaches" に置き換えた(conventions §4 の禁則文字対応)。
- 図表網羅チェック: 埋め込み 6 点、missing 0。Table 1(71 件)・Table 2(30 件)は Markdown 表へ全行転記。旧ページ由来の未使用 attachment 5 点は退役時に削除した。
## [2026-08-25] ingest-thesis | A Survey of DevOps Concepts and Challenges
- Source: `.raw/theses/survey-leite-2019-devops/`(全 9 章 / 入力: ローカル PDF 35 ページ)。Leonardo Leite(University of São Paulo)ほか、ACM Computing Surveys 52(6), Article 127、2019-11。
- Hub entity: [[A Survey of DevOps Concepts and Challenges]](address c-005394)
- Chapters: [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 1 Introduction]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 2 DevOps]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 3 Study Design]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 4 Sources of Knowledge]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 5 Fundamental Concepts]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 6 Toolset]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 7 Implications for Engineers, Managers, and Researchers]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 8 Unresolved Challenges]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 9 Limitations of This Study and Conclusions]](9 件)
- Pages created: source 9 件、entity 1 件([[A Survey of DevOps Concepts and Challenges]])
- Pages updated: [[Chef]]・[[Docker]]・[[Puppet]](entity 3 件)。[[DevOps]]・[[Infrastructure as Code]]・[[収束型システム管理]]・[[継続的デプロイ]]・[[継続的デリバリ]](concept 5 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 同じ対象が立場によって別の問題として立ち現れるという構成上の主張が独自性。第 5 章の概念地図(2 軸)と第 7 章の 3 立場への配分が同じ内容を別の切り方で提示する。
- 章分割の効果: 第 1+2 章の担当が [[DevOps]] に立てた「2008 年命名の参照 [68] の一次文献は何か」という問いに、第 9 章の担当が参考文献一覧から答えた(Patrick Debois, "Agile Infrastructure Operations", Agile 2008 Toronto)。conventions §8 に従い当該の問いを落とし、知見へ移した。**章の担当が分かれて初めて成立する引き継ぎであり、1 枚もののページでは生じない形の成果**である。
- オーケストレータの手順違反: 第 7 章の個別プロンプトに「コンテナ化対構成管理はこの章にある」という示唆を原本 grep で裏取りせずに書いたが、実際は第 8 章の内容だった。担当が原本照合で捕まえて誤帰属を防いだ。skill が明示的に禁じている手順(示唆は原本 grep で裏を取ってから書く)の違反である。
- 図表網羅チェック: 埋め込み 8 点、missing 0。表は Markdown 表へ転記したため、転記済みの表の画像 3 点は未使用となり削除した(UNUSED 0)。
## [2026-08-27] query-deep | RDMAネットワークモニタリングの教科書(出典に原本図表番号)
- Answer: [[wiki/questions/RDMAネットワークモニタリングの教科書]](address: c-004808)
- 転載 58 点の図キャプション直下 `(Source: [[...]])` に、source ページ内の図表番号を付与した。論文は `図 N`(部分図は `図 3(a)` / `図 3(b)`、合成は `図 1–3`)、スライド資料は `p.N`。本文中の主張出典は変更していない。
## [2026-08-27] query-deep | RDMAネットワークモニタリングの教科書(図表転載)
- Answer: [[wiki/questions/RDMAネットワークモニタリングの教科書]](address: c-004808、約 1,780 行)
- 図表: 参照元 source ページから 58 点を転載し各章へ配置した。選定基準は姉妹編 [[wiki/questions/ホストネットワークとインターコネクトの教科書]] に合わせ、構造を示す図・本文が数値で語る現象の根拠グラフ・対比を裏づける図に限定した。1 章あたりおおむね 3〜7 点。Hawkeye・C4・mlx5 Ethtool Counters は source に図が無いため未転載。DCQCN 論文の合成クロップは信頼できないため除外した。第 8・13・16・18・19 章は総括または図なしのため 0 点。全 58 点の画像パスは実ファイル存在を検査済み。図番号は本文出現順の章内連番。
- Pages updated: [[wiki/questions/RDMAネットワークモニタリングの教科書]]・wiki/hot.md・wiki/log.md。
## [2026-08-25] ingest-thesis | Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications
- Source: `.raw/theses/survey-soldani-2021-anomaly-detection-rca/`(全 11 章 / 入力: ローカル PDF 36 ページ)。Jacopo Soldani・Antonio Brogi(University of Pisa)、ACM Computing Surveys 55(3), Article 59、2021-05-26。
- Hub entity: [[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]](address c-005428)
- Chapters: [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 1 Introduction]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 2 Terminology]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.1 Log-based Anomaly Detection Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.2 Distributed Tracing-based Anomaly Detection Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.3 Monitoring-based Anomaly Detection Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.4 Discussion (Anomaly Detection)]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.1 Log-based and Distributed Tracing-based Root Cause Analysis Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.3 Monitoring-based Root Cause Analysis Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.4 Discussion (Root Cause Analysis)]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 5 Related Work]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 6 Conclusions]](11 件)
- Pages created: source 11 件、entity 8 件([[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] + [[CloudDiag]]・[[GMTA]]・[[MEPFL]]・[[MicroHECL]]・[[MonitorRank]]・[[OASIS]]・[[TraceAnomaly]])
- Pages updated: [[サービスレベル目標]]・[[マイクロサービスアーキテクチャ]]・[[ログベース異常検知]]・[[分散トレーシング]]・[[因果推論ベースRCA]]・[[因果発見]]・[[根本原因分析]]・[[異常検知]](concept 8 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 章構成の判断: 第 3 章・第 4 章がいずれも 12〜13 ページで、データ源別の下位節が本サーベイの主軸をなすため §3.1〜§3.4・§4.1〜§4.4 を独立章として切り出し、全 6 章 → 全 11 章に組み直した(`--chapters "1=1,2=2,31=3,32=4,33=7,34=10,41=15,43=18,44=24,5=28,6=30,7=31"`)。§4.1 と §4.2 は同一ページ始まりのため統合。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 同じ軸を検知と診断の両方に通したことで、データ源が診断粒度と導入コストを規定する構造が見える。データ源の内側で手法の型がさらに粒度を分ける入れ子もある。
- **entity 名の衝突を 2 件検出**: 本サーベイの `Seer`(ASPLOS 系のマイクロサービス性能異常検知)は既存 [[Seer]](Astral のオペレータ予測コンポーネント)と別実体、`Sieve` も既存 entity と衝突するため、いずれも entity 化せず本文中のプレーンテキストにとどめた。担当 subagent が自ら検出して回避した。
- 章境界の処理: 11 章中 7 箇所で章末が次章ファイルの冒頭へ食い込んでいた。先行章の担当が検出した食い込みを後続章の担当へ都度追送する運用で、重複も欠落も出さずに吸収した。
- 共有 concept の混在: [[マイクロサービスアーキテクチャ]] と [[因果発見]] は、本コミット時点で進行中の別文書(Failure Diagnosis in Microservice Systems、D'ya like DAGs)の担当による追記も含む。内容はいずれも保持されているが、コミット単位と文書単位が一対一でない点を記録しておく。
- 図表網羅チェック: 割り当て 2 点。手法一覧表(Table 1・Table 2、各 25 手法)は画像でなく Markdown 表へ全行転記した。埋め込み ↔ attachment の双方向照合は missing 0 / UNUSED 0。
## [2026-08-25] ingest-thesis | A Tutorial on Kernel Density Estimation and Recent Advances
- Source: `.raw/theses/arxiv-1704.03924/`(全 5 章 / 入力: ローカル PDF 21 ページ)。Yen-Chi Chen(Department of Statistics, University of Washington)、arXiv:1704.03924v2、2017-09-13。
- Hub entity: [[A Tutorial on Kernel Density Estimation and Recent Advances]](address c-005420)
- Chapters: [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 1 Introduction and Statistical Properties]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 3 Confidence Intervals and Confidence Bands]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 4 Geometric and Topological Features]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 5 Estimating the CDF]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 6 Conclusion and Open Problems]](5 件)
- Pages created: source 5 件、entity 1 件([[A Tutorial on Kernel Density Estimation and Recent Advances]])
- Pages updated: [[カーネル密度推定]]・[[ブートストラップ法]]・[[信頼区間]]・[[密度ベースクラスタリング]](concept 4 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 章構成の判断: 原本の §1 と §2 が同一 PDF ページから始まるため 1 枚に統合した。章番号は原本の節番号に従うので Chapter 2 は存在しない。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換、旧ページ専用の attachment 7 点も削除した。
- Key insight: 「推定できる」と「保証できる」の間の溝が主題。第 3 章は KDE のバイアスが被覆保証を真の密度からその期待値へすり替えることを明示し、無視・アンダースムージング・バイアス補正の 3 戦略を整理する。
- 章分割の効果: 第 4 章の特徴推定アルゴリズムが点推定用の帯域幅選択法を無調整で流用している不整合が、第 1 章と別ページになったことで対比として立った(第 6 章も未解決問題として挙げる)。
- vault との接続: 第 4 章のレベル集合条件が一様カーネルのとき DBSCAN の核点条件と数式レベルで一致することを [[密度ベースクラスタリング]] に、応用文献(Chandola 2009)が帯域幅選択を暗黙化するのに対し本チュートリアルが 5 手法を理論的に分類するという非対称を [[カーネル密度推定]] に記録した。
- 図表網羅チェック: 埋め込み 8 点、missing 0。旧ページ由来の未使用 attachment 7 点は退役時に削除した。
## [2026-08-25] ingest-thesis | A Survey of Online Failure Prediction Methods
- Source: `.raw/theses/survey-salfner-2010-online-failure-prediction/`(全 6 章 / 入力: ローカル PDF 43 ページ)。Felix Salfner・Maren Lenk・Miroslaw Malek(Humboldt-Universität zu Berlin)、ACM Computing Surveys 42(3), Article 10、2010-03。
- Hub entity: [[A Survey of Online Failure Prediction Methods]](address c-005414)
- Chapters: [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 1 Introduction]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 2 Definitions]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 3 Evaluation Metrics]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 4 A Taxonomy of Online Failure Prediction Methods]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 5 Survey of Prediction Methods]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 6 Summary and Conclusions]](6 件)
- Pages created: source 6 件、entity 1 件([[A Survey of Online Failure Prediction Methods]])
- Pages updated: [[Felix Salfner]]・[[Humboldt University of Berlin]]・[[Maren Lenk]]・[[Miroslaw Malek]](entity 4 件)。[[AIOps]]・[[ディペンダビリティ]]・[[ハードディスク信頼性]]・[[プロアクティブ障害管理]]・[[分類モデルの評価指標]]・[[障害予測]](concept 6 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 分類体系の 4 分岐のうち undetected error auditing に該当研究が 1 件も無く、分類が手法空間の設計図として書かれている。持続的な資産は分類より第 2 章の用語規約(fault/error/symptom/failure の連鎖と 4 つの時間軸)で、Notaro 2021 が出典として引く。
- 章境界の処理: 第 1→2 章、第 2→3 章、第 3→4 章、第 4→5 章、第 5→6 章のいずれでも章末が次章ファイル冒頭へ食い込んでいた。特に第 5 章の §5.4・§5.5 は第 6 章ファイルの冒頭 39 行に入っており、第 5 章担当が検出したのを受けて第 6 章担当へ重複回避を申し送った。
- 図表網羅チェック: 埋め込み 15 点、missing 0 / UNUSED 0。Table III(47 行)は画像でなく Markdown 表へ全行転記した。
## [2026-08-25] ingest-thesis | A Survey of AIOps Methods for Failure Management
- Source: `.raw/theses/survey-notaro-2021-aiops/`(全 8 章 / 入力: ローカル PDF 45 ページ)。Paolo Notaro・Jorge Cardoso・Michael Gerndt、ACM Transactions on Intelligent Systems and Technology 12(6), Article 81、2021-11。
- Hub entity: [[A Survey of AIOps Methods for Failure Management]](address c-005404)
- Chapters: [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 1 Introduction]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 2 Related Work and Methodology]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.1 Failure Prevention]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.2 Online Failure Prediction]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.3 Failure Detection]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.4 Root-cause Analysis (RCA)]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.5 Remediation]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 5 Conclusion]](8 件)
- Pages created: source 8 件、entity 1 件([[A Survey of AIOps Methods for Failure Management]])
- Pages updated: [[Felix Salfner]](entity 1 件)。[[AIOps]]・[[Fault Localization]]・[[アラート管理]]・[[プロアクティブ障害管理]]・[[ログ解析]]・[[体系的マッピング研究]]・[[根本原因分析]]・[[異常検知]]・[[障害予測]]・[[障害注入]]・[[障害緩和]](concept 11 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 章構成の判断: 既定の章検出では第 4 章が 26 ページの巨大な 1 章になっていた。5 カテゴリ・14 サブカテゴリという分類体系が本サーベイの中身であり 1 枚に押し込むと失われるため、§4.1〜§4.5 を独立章として切り出して全 4 章 → 全 8 章に組み直した(`--chapters "1=2,2=5,41=9,42=17,43=22,44=28,45=34,5=35,6=37"`)。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 分解によってカテゴリ間の研究密度の偏りが可視化される(予防 10.6%、緩和 6 件)。Table 8 からは 48 行中 28 行が単一データソース依存であることが読み取れ、第 5 章のマルチモーダル化の遅れの指摘を裏づける。
- 章境界の処理: 第 5 章の §5.1 後半と §5.2 が、参考文献用のダミー章 `ch-06.txt` の冒頭に紛れ込んでいた。第 5 章担当が節番号を頼りに検出し、両ファイルから統合して復元した。
- 図表網羅チェック: 割り当て 10 点。表は Markdown 表へ転記。Table 8 は当初クロップがヘッダ + 1 行しか捉えられていなかったため、クロップスクリプトの表の高さ上限(図と共通の 520pt)を表専用にページ高の 90% へ緩和して 48 行全体を再取得し、補填した。埋め込み ↔ attachment の双方向照合は missing 0 / UNUSED 0。
## [2026-08-26] ingest-paper | On the General Theory of Control Systems
- Source: `.raw/papers/kalman.pdf`(R. E. Kalman、Proc. First International Congress of IFAC, Moscow 1960、"Automatic and Remote Control" Butterworths 1961 pp.481-492 に再録。トロント大学 ECE557f 講義配布 PDF。テキスト層のない JBIG2 スキャンのため pdftotext 抽出は空。12 ページ全ページを視覚的に通読)
- Summary: [[@1960__IFAC1960__On the General Theory of Control Systems]]
- Pages created: source 1 件([[@1960__IFAC1960__On the General Theory of Control Systems]]、address c-005447)、entity 1 件([[R. E. Kalman]]、address c-005448)、concept 3 件([[可制御性]] c-005449・[[可観測性]] c-005450・[[双対性原理(制御理論)]] c-005451)
- Pages updated: wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json
- Key insight: 可制御性の判定条件(a, Φ⁻¹a, ..., Φ⁻ⁿ⁺¹a の線形独立性)と可観測性の判定条件((Φ*)⁻¹b*, ..., (Φ*)⁻ⁿb* の線形独立性)が Φ↔Φ*・a↔b* の置き換えのもとで構造的に同型であることが双対性原理の核心であり、この対応から最適レギュレータ問題の解がウィーナー・コルモゴロフのフィルタリング問題の解と数学的に一致するという帰結(式72)が導かれる。
- 図表網羅チェック: 本文参照図表は Figure 1-4 の4点のみ(表は無し)。全4点をPyMuPDFキャプション座標クロップで attachment に配置し、本文の該当記述の近傍に埋め込んだ。除外なし。取得失敗なし。
- 備考: PDF はテキスト層を持たない JBIG2 圧縮スキャン(pdftotext・pdf.js とも本文テキスト抽出不可、pdffonts でも埋め込みフォント無し)。`pdftoppm` でページ画像をレンダリングし、全12ページを目視で通読して本文を作成した。既存ソース・概念との重複や矛盾は検出されなかった(可制御性・可観測性・双対性原理はいずれも新規 concept)。
## [2026-08-25] ingest-thesis | Efficient Large Language Models: A Survey
- Source: `.raw/theses/arxiv-2312.03863/`(全 5 章 / 入力: ローカル PDF 67 ページ)。Zhongwei Wan ほか、Transactions on Machine Learning Research、2024-05-23、arXiv:2312.03863。
- Hub entity: [[Efficient Large Language Models - A Survey]](address c-005359)
- Chapters: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 1 Introduction]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 2 Model-Centric Methods]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 3 Data-Centric Methods]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 5 Concluding Remarks]](5 件)
- Pages created: source 5 件、entity 11 件([[Efficient Large Language Models - A Survey]] + フレームワーク 10 件: [[Colossal-AI]]・[[Composer]]・[[FairScale]]・[[LLM Foundry]]・[[MegaBlocks]]・[[Nanotron]]・[[OpenLLM]]・[[Pax]]・[[RayLLM]]・[[Text-Generation-Inference (TGI)]])
- Pages updated: [[DeepSpeed]]・[[Megatron-LM]]・[[TensorRT-LLM]]・[[vLLM]](entity 4 件)。[[FlashAttention]]・[[LLM推論]]・[[PagedAttention]]・[[モデル圧縮]]・[[並列化戦略]]・[[枝刈り]]・[[状態空間モデル]]・[[知識蒸留]]・[[量子化]](concept 9 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換、旧ページ専用の attachment 6 点(`fig1-model.png` 等)も削除した(パス付きで参照元を確認し、旧ページ以外からの参照が 0 件であることを確認済み)。
- Key insight: 分類原理が「介入点」であることが本サーベイの特徴で、同じ手法群を別の分類体系(Miao ほか / Zhou ほか)とは違う並べ方で提示する。この違いは含意を変える(モデル圧縮が目的か手段か)。分類体系どうしの対応表は未整備で、各 concept の未解決の問いに記録した。
- 章分割の効果: 第 2 章(21 ページ)と第 3・4 章(各 5 ページ)の分量比が効率化研究の重心を示す。第 4 章 Table 2 の横断から、学習系フレームワークの「3D Parallelism / ZeRO 核 + 周辺機能」と推論専用フレームワークの「共通基盤 + 差別化軸」という 2 つの束が見えた。
- 図表網羅チェック: 割り当て 22 点、埋め込み 18 点(残りは表で Markdown 転記)。missing 0 / UNUSED 0(旧ページ由来の 6 点は退役時に削除)。
## [2026-08-25] ingest-thesis | Trade-Offs Under Pressure
- Source: `.raw/theses/msc-allspaw-2015-tradeoffs-under-pressure/`(本編 8 章 + 付録 2 件 / 入力: ローカル PDF 88 ページ)。John Allspaw、Lund University、MSc in Human Factors and System Safety、2015-09-07。
- Hub entity: [[Trade-Offs Under Pressure]](address c-005345)
- Chapters: [[@2015__MSc__Trade-Offs Under Pressure - Chapter 1 Background]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 2 Literature Review]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 3 Research Design]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 4 Event Description]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 5 Results]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 6 Analysis]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 7 Discussion]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 8 Conclusions]] / [[@2015__MSc__Trade-Offs Under Pressure - Appendix A Initial coding schema]] / [[@2015__MSc__Trade-Offs Under Pressure - Appendix B Coordinative Episodes Coding Schema]](10 件)
- Pages created: source 10 件、entity 1 件([[Trade-Offs Under Pressure]])
- Pages updated: [[David D. Woods]]・[[Erik Hollnagel]]・[[Etsy]]・[[Gary Klein]](entity 4 件)。[[Common Grounding]]・[[Joint Activity]]・[[プロセストレーシング]]・[[研究方法論における妥当性概念]]・[[複雑システム障害論]]・[[診断ヒューリスティック]](concept 6 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページとして取り込まれていたものを章単位で再取り込みした。旧ページは削除し被リンクをハブ entity へ機械置換した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- 取り込み範囲: 本編 8 章と付録 A・B。付録 C〜E(参加者タイムライン・ダッシュボード画像・ツール一覧)は生の資料で本文の主張に直結しないため対象外とした(原本は保持)。
- Key insight: 最も強く共有されたヒューリスティック(直近の変更との相関確認)が最も言語化されない。8 名全員が証言する一方 IRC 上の直接的言及は 2 回のみで、Law of Fluency の具体例にあたる。
- 章分割の効果: 第 5 章(生データ)と第 6 章(定式化)を分けたことで、ヒューリスティック 4 の ETTO ルールへの対応づけが著者による事後解釈であり局所的証拠から直接は導かれないことが可視化された。
- 図表網羅チェック: 埋め込み 17 点、missing 0 / UNUSED 0。Figure 10・16(横向き全面図)は当初クロップが左側を欠いていたため担当が再レンダリングし、その後クロップスクリプト側も修正した。
## [2026-08-25] ingest-thesis | Anomaly Detection: A Survey
- Source: `.raw/theses/survey-chandola-2009-anomaly-detection/`(全 12 章 / 入力: ローカル PDF 58 ページ)。Varun Chandola・Arindam Banerjee・Vipin Kumar(University of Minnesota)、ACM Computing Surveys 41(3), Article 15、2009-07。
- Hub entity: [[Anomaly Detection - A Survey]](address c-005382)
- Chapters: [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 1 Introduction]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 2 Different Aspects of an Anomaly Detection Problem]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 3 Applications of Anomaly Detection]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 4 Classification Based Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 5 Nearest Neighbor-Based Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 6 Clustering-Based Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 7 Statistical Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 8 Information Theoretic Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 9 Spectral Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 10 Handling Contextual Anomalies]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 11 Relative Strengths and Weaknesses of Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 12 Concluding Remarks and Future Work]](12 件)
- Pages created: source 12 件、entity 1 件([[Anomaly Detection - A Survey]])
- Pages updated: [[Arindam Banerjee]]・[[University of Minnesota]]・[[Varun Chandola]]・[[Vipin Kumar]](entity 4 件)。[[カーネル密度推定]]・[[変化点検知]]・[[密度ベースクラスタリング]]・[[最近傍法]]・[[異常検知]](concept 5 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページ `@2009__CSUR__Anomaly Detection - A Survey` として取り込まれていたものを章単位で再取り込みした。旧ページは削除し、wiki 内の被リンクをハブ entity へ機械置換した(`wiki/log.md` の過去エントリは鉄則により編集していない)。
- Key insight: 分類の切り方そのものが寄与である。章分割して 6 カテゴリの仮定を並べると、クラスタリングベースだけが 3 仮定に分かれ互いの弱点を補う系列をなすことが見える。第 11 章は仮定の統一表を作らず運用指向 4 軸で比較し、統合は第 12 章で先送りされる。
- 章境界の処理: 章分割がページ境界で切られているため各章末の「計算量」「利点と欠点」が次章ファイル冒頭へ食い込む現象が 8 章で発生。各担当が内容の帰属先を優先して該当章ページに含め、`## 出典` に転記元を注記した。第 5 章の欠点リストは第 5・6 章の担当が独立に検出し、後から補填した。
- 図表網羅チェック: 割り当て 23 点(図 11・表 12)。図 11 点を埋め込み、表 12 点は Markdown 表へ転記(除外 0 件)。埋め込み ↔ attachment の双方向照合は missing 0 / UNUSED 0。Figure 8 は隣接する Figure 7 が同一画像に混入していたためクロップスクリプトを修正して再生成した。
## [2026-08-25] ingest-thesis | Agentic Failure Management of Cloud Systems
- Source: `.raw/theses/phd-chen-2026-agentic-failure-management/`(全 6 章 / 入力: ローカル PDF 141 ページ)。Yinfang Chen、University of Illinois Urbana-Champaign 博士論文、2026。
- Hub entity: [[Agentic Failure Management of Cloud Systems]](address c-005340)
- Chapters: [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 1 Introduction]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 2 Reliability Testing for Cloud-Backed Applications]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 3 Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 4 A Multi-Agent System for Autonomous Site Reliability Engineering]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 5 Evaluating AI Agents for Autonomous Cloud Operations]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 6 Conclusion and Future Work]](6 件)
- Pages created: source 6 件、entity 1 件([[Agentic Failure Management of Cloud Systems]])
- Pages updated: [[AIOpsLab]]・[[RCACopilot]]・[[Rainmaker]]・[[Stratus]]・[[Yinfang Chen]](entity 5 件)。[[AIOps]]・[[Transactional No-Regression]]・[[agentic SRE]]・[[クラウド障害ライフサイクル]]・[[プロアクティブ障害管理]]・[[根本原因分析]]・[[障害注入]]・[[障害緩和]](concept 8 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md・.raw/.manifest.json。
- 再取り込み: `wiki-ingest-thesis` skill 作成前に 1 枚もの source ページ `@2026__UIUC PhD Thesis__Agentic Failure Management of Cloud Systems` として取り込まれていたものを、章単位で再取り込みした。旧ページは削除し、wiki 内の被リンクをハブ entity へ機械置換した。**`wiki/log.md` の過去エントリ(本エントリより前)と `research/curation/2026-W33.md` は「過去エントリを編集しない」「既存ノート層を書き換えない」の鉄則により編集していない**ため、それらからの旧ページ参照はリンク切れとして残る。
- 章 ↔ 出版論文の照合: Ch.2→[[@2023__NSDI__Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker]]、Ch.3→[[@2024__EuroSys__Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]]、Ch.4→[[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]]、Ch.5→[[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]]。全 4 本について数値・設計記述を 1 件ずつ突き合わせ、**矛盾は 0 件**。博士論文版の追加分(Table 6 内訳、再発率 93.80%、task-based 対 role-based 比較、複数相互依存障害の実験、評価対象 4 アプリへの拡張)は訂正ではなく拡張として各章ページに記録した。
- Key insight: 本論文固有の寄与は個々のシステムではなく束ね方にある。安全性の扱いが分岐点で、TNR は LLM エージェントによる本番状態変更を古典的トランザクション意味論の上で正当化するが、その保証は人間が定義する health condition の網羅性に条件づけられる。自律化の限界は形式的保証ではなく仕様記述の側にある。
- 図表網羅チェック: 割り当て 50 点(図 28・表 22)。図 27 点を埋め込み、表 22 点は Markdown 表へ転記。Figure 13 はテキストリストのためコードブロックとして転記(除外 0 件)。埋め込み ↔ attachment の双方向照合は missing 0 / UNUSED 0。
- 図表抽出パイプラインの修正: 本バッチで汎用キャプションクロップスクリプトの欠陥 3 件(本文中の図参照文をキャプションと誤認・画像矩形がキャプションと重なると上方向併合に失敗・全面図で左右が切れる)を修正し、`.raw/theses/` 全 20 文書分を作り直した。
## [2026-08-25] ingest-paper | FlowTracer: A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters
- Source: `.raw/papers/arxiv-2410.17078.pdf`(arXiv 2410.17078、6ページ)。Hasibul Jamil・Abdul Alim・Laurent Schares・Pavlos Maniotis・Liran Schour・Ali Sydney・Abdullah Kayi・Tevfik Kosar・Bengi Karacali、IBM Research(Yorktown Heights・Haifa)/ University at Buffalo(SUNY)、arXiv 投稿 2024-10-22(v2 2024-10-24)。ユーザー提供情報では IEEE ICC 2025 採録済みだが、arXiv ページ自体には journal-ref・DOI の記載がなく未検証(ℹ️ 推定・要フォローアップ)。
- Summary: [[@2024__arXiv__FlowTracer - A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters]]
- Pages created: [[Hasibul Jamil]]・[[Bengi Karacali]]・[[Tevfik Kosar]](entity 3 件、新規)
- Pages updated: [[IBM Research]]・[[University at Buffalo]](entity 2 件)。[[ECMP]]・[[RDMAネットワーク監視]](concept 2 件)。wiki/index.md・wiki/hot.md・wiki/sources/_index.md・wiki/entities/_index.md・wiki/concepts/_index.md。
- Key insight: AI 学習クラスタの ECMP ハッシュ衝突起因のネットワークパス不均衡を、実運用トラフィックに対しホップバイホップで受動追跡するツール FlowTracer。新指標 Flow Imbalance Metric(FIM、MAPE ベース)で 16 ノード RoCEv2 実機環境の標準 ECMP(不均衡 36.5%)と静的ルーティング(不均衡 6.2%)を定量比較した。Hedera(2010・シミュレーション)が示したハッシュ衝突による帯域損失を、14 年後に実機計測で裏づける独立研究として [[ECMP]] に接続。
- 図表網羅チェック: 本文参照図表 5 点(Figure 1-5)、埋め込み 5 点(すべて充足)。除外 0 件。Figure 2(2 ラックテストベッド + バイパータイトトラフィックパターン)はベクター線描画(pdf.js 抽出は 45 個の線分断片のみ)のため PyMuPDF キャプション座標クロップで取得し直した。他 4 図(Figure 1・3(a)(b)(c) 3 枚・4・5)は pdf.js 埋め込みラスター画像をそのまま利用。
## [2026-08-25] ingest-book | Computer Architecture: A Quantitative Approach, 6th Edition
- Source: `.raw/books/computer-architecture-quantitative-approach-6e/`(全 1527 PDF ページ / 入力: pdf)。John L. Hennessy(Stanford University)・David A. Patterson(University of California, Berkeley)、Morgan Kaufmann(Elsevier)、2019、ISBN 978-0-12-811905-1。
- 取り込み範囲: 本編 7 章 + 付録 A・B・C・D・F の計 12 枚(ユーザー選択)。付録 E・G〜M は原本のみ切り出して未取り込み。章境界は PDF アウトライン level 1 がそのまま章一覧だったため `--chapters` で明示指定して再分割した(既定検出では付録が第 7 章に飲み込まれていた)。
- Book entity: [[Computer Architecture - A Quantitative Approach]](address c-005339)
- Chapters: [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 1 Fundamentals of Quantitative Design and Analysis]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 2 Memory Hierarchy Design]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 3 Instruction-Level Parallelism and Its Exploitation]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 4 Data-Level Parallelism in Vector, SIMD, and GPU Architectures]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 5 Thread-Level Parallelism]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 6 Warehouse-Scale Computers to Exploit Request-Level and Data-Level Parallelism]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 7 Domain-Specific Architectures]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix A Instruction Set Principles]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix B Review of Memory Hierarchy]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix C Pipelining - Basic and Intermediate Concepts]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix D Storage Systems]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix F Interconnection Networks]](12 件)
- Pages created: 新規 entity 26 件 = [[Computer Architecture - A Quantitative Approach]]・[[ARM Cortex-A53]]・[[Amazon EC2]]・[[CUDA]]・[[Ethernet]]・[[Fujitsu SPARC64 X+]]・[[Google TPU]]・[[IBM 360/91]]・[[IBM Blue Gene/L]]・[[IBM Power8]]・[[InfiniBand]]・[[Intel 80x86]]・[[Intel Core i7]]・[[Intel Core i7 6700]]・[[Intel Crest]]・[[Intel Itanium]]・[[Intel Xeon E7]]・[[José Duato]]・[[Jupiter (Google WSCネットワークスイッチ)]]・[[MIPS R4000]]・[[Microsoft Catapult]]・[[NVIDIA Pascal]]・[[Pixel Visual Core]]・[[SPEC]]・[[Timothy M. Pinkston]]・[[VAX]]。新規 concept 3 件 = [[キャッシュコヒーレンスプロトコル]]・[[メモリ一貫性モデル]]・[[命令セットアーキテクチャの設計原理]]
- Pages updated: 更新 entity 15 件 = [[Amazon Web Services]]・[[David A. Patterson]]・[[Google]]・[[James Hamilton]]・[[Jim Gray]]・[[John L. Hennessy]]・[[Luiz André Barroso]]・[[MapReduce]]・[[NVIDIA]]・[[NetApp]]・[[PTX]]・[[RISC-V]]・[[TPC-C]]・[[Tandem Computers]]・[[Xen]]。更新 concept 40 件 = [[AIアクセラレータ]]・[[Brainiac設計]]・[[CPU利用率]]・[[PUE]]・[[RAID]]・[[RDMA]]・[[Rooflineモデル]]・[[SIMDベクトル処理]]・[[アウトオブオーダー実行]]・[[アムダールの法則]]・[[クラウドコンピューティング]]・[[コアレスドメモリアクセス]]・[[コンテナ仮想化]]・[[スーパースカラー実行]]・[[テールレイテンシ耐性技術]]・[[ディペンダビリティ]]・[[データセンターネットワークトポロジ]]・[[データセンター信頼性]]・[[データセンター輻輳制御]]・[[ドメイン固有アーキテクチャ]]・[[ハードウェア仮想化]]・[[ハードディスク信頼性]]・[[パイプライン処理]]・[[ベンチマーキング]]・[[ムーアの法則とデナードスケーリングの終焉]]・[[メモリウォール]]・[[メモリバウンド]]・[[メモリ階層とキャッシュ]]・[[リトルの法則]]・[[仮想メモリとページング]]・[[共有メモリバンクコンフリクト]]・[[分岐予測]]・[[分散ストレージ]]・[[可用性]]・[[同時マルチスレッディング]]・[[待ち行列理論]]・[[性能メトリクスの選定]]・[[性能測定]]・[[投機的実行とマイクロアーキテクチャサイドチャネル(Meltdown・Spectre)]]・[[相互結合網]]
- 図表: 83 点。埋め込み画像は 0 点(全てベクター描画)で、キャプションが太字フォント `AdvOT3b30f6db.B` によって本文中の図参照と機械的に分離できることを確認し、`get_drawings()` の外接矩形からクロップする定型スクリプトをオーケストレータが用意して全 subagent に配った。横向き(rot 90)の図面ページは `prerotate` で正しい向きに補正。H&P は表も `Figure` と呼ぶため図番号は 1 章あたり 30〜56 点あるが、ユーザー選択により主要図のみ(1 章 6〜8 点)に絞った。埋め込み 83 点と attachment 83 点が過不足なく 1 対 1 対応することを機械検証済み。
- Method: 章ごとに Sonnet 5 subagent へ委譲し、オーケストレータ(Opus 5)は章境界確定・図クロップ定型の確立・ページ名の事前確定・concept 競合の直列化・事後検証・索引更新を担当。共通ブリーフィング 1 ファイル + 担当章の差分プロンプトという構成。concept を奪い合う章(第 2 章↔付録 B、第 3 章↔付録 C、第 6 章↔付録 F)は並行させず投入順で直列化し、後発の subagent には先行章が積み増した軸を明示して重複を防いだ。
- Key insight: 第 6 版は**単一プロセッサの性能成長が尽きた地点で書かれた教科書**であり、本書自身が「これまで有効だった技法の限界」を記述する書物になっている。第 1 章の性能成長率の段階的鈍化(52%→23%→12%→3.5%/年)、第 3 章の ILP 拡張の限界(Wall 1993、IBM Power 系列の発行幅微増とキャッシュ/コア数への投資シフト)、第 5 章のマルチプロセッサのスケーラビリティ限界(96 コア世代でも 24 コア機比 2 倍未満)が、第 7 章の領域特化という結論へ 1 本に繋がる。付録との対応も設計されており、付録 A・B・C はそれぞれ第 1 章・第 2 章・第 3 章の基礎編にあたる。この対を並べて初めて言えることを各 concept の横断的知見に置いた(例: 固定長・固定位置の命令符号化という ISA 選択が、ID 段でのハザード判定一元化とほぼ一定の CPI という 2 つのパイプライン実装上の利益に分解できる)。
- 運用上の発見: (1) lock はファイル単位の相互排他だが、2 体が同じ**新規** entity パスに「未存在確認 → 作成」する間にレースが起きうる(`ARM Cortex-A53` が実際に競合し、担当者が気づいてマージ復旧した)。(2) fan-out 中にセッション上限に達し 4 体が中断したが、いずれも source ページ本体は書き終えており、`SendMessage` で文脈を保ったまま entity/concept 工程だけを再開できた。中断時に残ったロック 3 件はオーケストレータが解放した。(3) 別セッションが同じ vault で並行 ingest しており、`address` が 1 件衝突した(`c-005296` が相手のコミット済み question ページと重複)。コミット済み側を正として book entity を `c-005339` へ再採番した。
- 矛盾: 第 1 章 §1.1 は 2015 年以降の性能成長率を 3.5%/年 とするが、同一著者による [[@2019__CACM__A New Golden Age for Computer Architecture]] は同区間を 3%/年 とする(区間の境界年は完全に一致)。[[ムーアの法則とデナードスケーリングの終焉]] に横断的知見として記録した。
- 未取り込み: 付録 E(Embedded Systems)・G(Vector Processors in More Depth)・H(VLIW and EPIC)・I(Large-Scale Multiprocessors)・J(Computer Arithmetic)・K(Survey of ISAs)・L(Advanced Address Translation)・M(Historical Perspectives)。原本は `chapters/ch-12.txt` `ch-14.txt`〜`ch-20.txt` に切り出し済みで、増分追加なら再取得不要。
## [2026-08-25] query-deep | ホストネットワークとインターコネクトの教科書
- Question: 「UPI、PCI、NVLinkなどを含むホストネットワークやインターコネクトに関する知識を網羅的かつ体系的に整理した教科書を作成してください。テキストをjapanese-tech-writing skillを使って校正してください。」
- Answer: [[wiki/questions/ホストネットワークとインターコネクトの教科書]](address: c-005296、2,261 行、11 章構成)
- Mode: deep。`scripts/retrieve.py` は ollama 不達で rerank が noop に縮退したため、BM25 の結果を参考にとどめ、`rg` による用語密度ランキングで対象ページを選定した。
- Pages read: source 59 件、concept 20 件前後。中核は [[@2024__SIGCOMM__Understanding the Host Network]]・[[@2025__TON__RHCC - Revisiting Intra-Host Congestion Control in RDMA Networks]]・[[@2018__SIGCOMM__Understanding PCIe performance for end host networking]]・[[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]]・[[@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers]]・[[@2026__SpeakerDeck__AIのためのEthernet技術動向 (SerDes)]]。
- Method: 章ごとに 7 つのサブエージェントへ分担し、共通ブリーフ(wiki 用語ポリシー + japanese-tech-writing 規範 + 出典必須 + wikilink 改変禁止)を渡して並列執筆。第1章と第11章はメイン文脈で執筆。統合後に節番号の統一、結論を言い切るセリフ型見出しの改称(11 件)、LLM っぽい空句の除去(2 件)、全 wikilink の実在検証を行った。
- Key insight: 「ホストネットワーク」を独立した対象として立てると、層をまたいで同じ性質が繰り返し現れることが見える。公称帯域と実効帯域の乖離、インターコネクトの非対称性(最良配置はホップ数でなく総帯域で決まる)、そして輻輳がネットワークの専売ではないという三点である。とくにドメインごとのクレジットベースフロー制御は、TCP 型のエンドツーエンド制御と PFC 型のホップバイホップ制御を特殊ケースとして含む一般化であり、ホスト内部の議論にネットワークの語彙をそのまま持ち込める根拠を与える。ただしこのモデルは単一ソケット・単一 IIO・Intel 2 世代でのみ検証されており、UPI をまたぐ経路や CXL・NVLink を含む構成への拡張は未達である。層ごとに別々の観測手法(ホスト内プロービング、ハードウェアカウンタ、GPU カーネルプロファイリング、ネットワークテレメトリ)が積み上がった結果、律速点をアプリケーションから見た単一指標で表す方法が存在しないことが、本教科書を通じた最大の空白として残る。
- 図表(2026-08-25 追記): 参照元 source ページから 63 点を転載し各章へ配置した。5 エージェントで章を分担し、選定基準(構造を示す図・本文が数値で語る現象の根拠グラフ・対比を裏づける比較表・非自明な主張の裏づけ)に合うものだけを 1 章あたり 3〜7 点に絞った。第11章は既出の観察を判断へ並べ直す総括章で、単一 source の図を貼るとその節が特定 1 論文の議論に見えるため 0 点とした。書籍ソース(publish: false)の図の扱いはユーザー判断を仰ぎ、転載を含め publish 設定は変更しない方針を採用。章をまたぐ重複 1 件([[@2024__SIGCOMM__Understanding the Host Network]] のアーキテクチャ図)は第2章に残し第6章は参照へ置換、それに伴う図番号の欠番を詰めた。全 63 点の画像パスは実ファイル存在を検査済み。
- Gap: UPI そのものを主題とする一次ソースは wiki に存在せず、Intel uncore の構造は RHCC と『詳解 システム・パフォーマンス』の記述に依拠した。非対称 NUMA の実測は AMD Opteron 系に限られ、UPI 構成での再現は未検証。UALink・UCIe を主題とする source も未取得。
## [2026-08-25] ingest-paper | UCCL-Tran: An Extensible Software Transport Layer for GPU Networking
- Source: `.raw/papers/osdi26-zhou-yang.pdf`(USENIX OSDI '26, 2026-07-13〜15, Seattle)。著者: Yang Zhou(UC Berkeley/UC Davis)・Zhongjie Chen(Tsinghua)・Ziming Mao(UC Berkeley)・ChonLam Lao(Harvard)・Shuo Yang(UC Berkeley)・Pravein Govindan Kannan(IBM Research)・Xizhi Zhang(Tsinghua)・Jiaqi Gao(独立研究者)・Yilong Zhao・Yongji Wu(UC Berkeley)・Kaichao You(独立研究者)・Fengyuan Ren(Tsinghua)・Zhiying Xu(AWS)・Costin Raiciu(Broadcom/UPB)・Ion Stoica(UC Berkeley)。
- Summary: [[@2026__OSDI__UCCL-Tran - An Extensible Software Transport Layer for GPU Networking]]
- Pages created: source 1件(address: c-005282)、entity 12件([[Yang Zhou]] c-005294、[[Zhongjie Chen]] c-005283、[[Ziming Mao]] c-005284、[[Shuo Yang]] c-005285、[[Pravein Govindan Kannan]] c-005286、[[Xizhi Zhang]] c-005287、[[Jiaqi Gao]] c-005288、[[Yilong Zhao]] c-005289、[[Yongji Wu]] c-005290、[[Kaichao You]] c-005291、[[Fengyuan Ren]] c-005292、[[Zhiying Xu]] c-005293)
- Pages updated: [[ChonLam Lao]]・[[Costin Raiciu]]・[[Ion Stoica]](UCCL-Tran共著者としての参加を追記)、[[RDMA]]・[[集合通信]]・[[データセンター輻輳制御]](横断的知見・未解決の問いを更新)
- Key insight: 既存 RDMA NIC を一切改造せず、コントロールパス(CC・パケット信頼性・LB)をホスト CPU ソフトウェアへ切り離すことで、IRN(2018)がハードウェア改修で示した「go-back-N/PFC 問題への反証」を、ソフトウェアのみで再現・拡張する。マルチパス(256 QP)・受信側主導 CC(EQDS)・選択的再送の3ケーススタディで、既存 RDMA ハードウェアトランスポート比 ML collective 最大4.5倍を実測。OpenAI MRC(プログラマブル NIC 側でRC を数百パス化)とは対照的な「ホスト CPU 側」という実装場所を選び、著者ら自身が MRC を「UCCL-Tran の1年後の発表でSCRと同様の課題を抱えうる」後続研究として位置づける。
- 図表: 本文参照図表15点(Figure 1-15、除外対象なし)+表4点(Table 1-4)を全点、PyMuPDFキャプション座標クロップ(全図ベクター描画のため)・Markdown表転記で取得・埋め込み。Appendix図表(Figure 16-26、Table 5)は本文参照が付録限定のため除外。
## [2026-08-25] ingest-paper | RHCC: Revisiting Intra-Host Congestion Control in RDMA Networks
- Source: `.raw/papers/revisiting-intra-host-congestion-control-ton2025.pdf`(IEEE Transactions on Networking, Vol. 33, No. 3, June 2025, DOI: 10.1109/TON.2024.3524247)。著者: Zirui Wan・Jiao Zhang・Yuxiang Wang・Kefei Liu・Haoyu Pan・Yongchen Pan・Tao Huang(BUPT State Key Laboratory of Networking and Switching Technology、Jiao ZhangとTao HuangはPurple Mountain Laboratoriesも兼務)。[[@2024__APNet__Rethinking Intra-host Congestion Control in RDMA Networks]](APNet 2024)の拡張ジャーナル版。
- Summary: [[@2025__TON__RHCC - Revisiting Intra-Host Congestion Control in RDMA Networks]]
- Pages created: source 1件(address: c-005277)、entity 1件([[Yongchen Pan]] c-005278)
- Pages updated: [[Zirui Wan]]・[[Jiao Zhang]]・[[Yuxiang Wang]]・[[Kefei Liu]]・[[Haoyu Pan]]・[[Tao Huang]]・[[BUPT]]・[[Purple Mountain Laboratories]](拡張ジャーナル版への関与を追記)、[[@2024__APNet__Rethinking Intra-host Congestion Control in RDMA Networks]](拡張ジャーナル版の存在をnote calloutで追記)、[[ホスト輻輳制御]]・[[ホスト内ネットワークボトルネック]]・[[データセンター輻輳制御]](横断的知見・未解決の問いを更新)
- Key insight: APNet 2024版の中核設計(RHCCフレームワーク、CPU-to-メモリトラフィック輻輳応答、RNICトラフィック輻輳応答、主要実験数値)を保ったまま、拡張ジャーナル版で著者にYongchen Panが加わり、PIDコントローラの収束性の理論的解析(§III-C、SISO ARMAXモデル援用)、hostCCに対する5点の体系的優位性比較(§III-D)、Ithr/Dthrのパラメータ感度分析(§IV-C)、考察(§V: CXL・新資源配分ポリシー・プログラマブルなホスト内ネットワーク)が新設された。矛盾はなく、会議版からジャーナル版への拡張が実験追加だけでなく「先行手法との関係の言語化」という論証構造の精緻化として現れる例である。
- 図表: 本文参照図表21点(Figure 1-21、除外対象なし)を全点、埋め込みラスター画像0点(全図ベクター描画)のためPyMuPDFキャプション座標クロップで取得・埋め込み。
## [2026-08-25] ingest | Doubling all2all Performance with NVIDIA Collective Communication Library 2.12
- Source: `.raw/articles/doubling-all2all-performance-nccl-2-12-2026-08-25.md`(defuddleでURL取得: https://developer.nvidia.com/blog/doubling-all2all-performance-with-nvidia-collective-communication-library-2-12/)。NVIDIA Developer Blog、Karthik Mandakolathur・Sylvain Jeaugey(いずれもNVIDIA)、2022-02-28公開。当初 `/wiki-ingest-paper` skill で呼び出されたが、学術論文でもPDF原本も存在しない技術ブログ記事だったため、ユーザー確認の上 `wiki-ingest`(汎用URLフロー)へ切り替えて取り込んだ。
- Summary: [[@2022__NVIDIA Developer Blog__Doubling all2all Performance with NVIDIA Collective Communication Library 2.12]]
- Pages created: source 1件(address: c-005279)、entity 2件([[Sylvain Jeaugey]] c-005280・[[Karthik Mandakolathur]] c-005281)
- Pages updated: [[NCCL]](PXN機能の解説段落・著者2名をrelated/sourcesに追加)、[[Rail-Optimizedトポロジ]](NCCL_CROSS_NIC=0とPXNが同根の課題への異なるレイヤーでの対応であるという横断的知見、PXNがall-reduce向け設計をall2allへ機構的に拡張したという知見を追加)、[[集合通信]](all2allがtree/ringで最適化できない構造的理由とNCCL 2.28以前のP2Pベース実装の関係を追加)、[[NVIDIA]](related/sources追加)
- Key insight: NCCL 2.12で導入されたPXN(PCI × NVLink)は、GPUがCPU間プロトコルを経由せずNVLink経由でノード内の別GPUへデータを移し、そのGPUに近いNICから送信できるようにする機能。メッセージ集約(multireceiveによる最大8メッセージの1メッセージ化)とrail内への経路集約(Spineスイッチ通過トラフィック削減)の2軸でall2all性能を改善し、DGX A100・InfiniBand実測(128ノード/1024GPU)でレイテンシ約2.55倍改善(約3980µs→約1560µs)を達成した。また、GPU:NIC比1:1のトポロジやコミュニケータがGPUの部分集合のみを含む場合(モデル並列分割で[0,4]・[1,5]のような組み合わせ)でring形成が困難だった問題も解消し、モデル並列の柔軟性を向上させた。
- 図表: 本文参照図表6点(Figure 1〜6)を全点、公式ブログの画像URL(developer-blogs.nvidia.com/wp-content/uploads)から直接ダウンロードして埋め込み(除外なし)。
## [2026-08-25] ingest-paper | Pond: CXL-Based Memory Pooling Systems for Cloud Platforms
- Source: `.raw/papers/2023_Pond_asplos23_official_asplos_version.pdf`(Microsoft Research公開ページのPDF直リンクから取得: https://www.microsoft.com/en-us/research/wp-content/uploads/2022/10/2023_Pond_asplos23_official_asplos_version.pdf)。Proceedings of the 28th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2(ASPLOS '23、2023年3月25-29日、Vancouver, BC, Canada)、Distinguished Paper Award受賞。DOI: 10.1145/3575693.3578835。著者13名: Huaicheng Li(筆頭著者、Virginia Tech/CMU、Azureインターン時に実施)・Daniel S. Berger(Microsoft Azure/UW)・Lisa Hsu(Unaffiliated)・Daniel Ernst・Pantea Zardoshti・Stanko Novakovic(発表時Google)・Monish Shah・Samir Rajadnya(いずれもMicrosoft Azure)・Scott Lee(Microsoft)・Ishwar Agarwal(Intel)・Mark D. Hill(Microsoft Azure/UW-Madison)・Marcus Fontoura(発表時Stone Co)・Ricardo Bianchini(Microsoft Azure)。コード・VMトレースサンプルはhttps://github.com/vtess/Pondで公開。
- Summary: [[@2023__ASPLOS__Pond - CXL-Based Memory Pooling Systems for Cloud Platforms]]
- Pages created: source 1件(address: c-005261)、entity 14件([[Huaicheng Li]] c-005262・[[Daniel S. Berger]] c-005263・[[Stanko Novakovic]] c-005264・[[Lisa Hsu]] c-005265・[[Daniel Ernst]] c-005266・[[Pantea Zardoshti]] c-005267・[[Monish Shah]] c-005268・[[Samir Rajadnya]] c-005269・[[Scott Lee]] c-005270・[[Ishwar Agarwal]] c-005271・[[Mark D. Hill]] c-005272・[[Marcus Fontoura]] c-005273・[[Virginia Tech]] c-005274・[[Stone Co]] c-005275)
- Pages updated: entity 8件([[Ricardo Bianchini]]・[[Microsoft Azure]]・[[Microsoft]]・[[Carnegie Mellon University]]・[[University of Washington]]・[[Google]]・[[Intel]]・[[University of Wisconsin-Madison]])、concept 2件([[CXLによるメモリ拡張]]・[[NUMAメモリ配置]])
- Key insight: Azure本番100クラスタ・75日分のトレース解析から、スケジュール済みコア比率が85%を超える局面でメモリストランディングの中央値が10%超・95パーセンタイルで最大25〜30%に達することを初めて公開特性化した。8〜16ソケット規模の小さなCXLメモリプールで大規模プールの効果の大半を達成できるという知見と、約50%のVMが割り当てメモリの50%未満しかタッチしていないという知見を組み合わせ、RandomForest(レイテンシ非感受性予測)・LightGBM(未タッチメモリ予測)の2つのMLモデルでVM起動前にプール配分を決定するPondを提案。ハイパーバイザのzNUMA機構により予測が正しければVMは実質的にプールメモリへアクセスせず(48時間本番実験でzNUMAトラフィック0.06〜0.38%)、158ワークロード・3500超の実験で16ソケットプール・CXLレイテンシ222%増加の条件下でDRAM需要を7%(サーバコスト3.5%相当)削減した。既存の[[CXLによるメモリ拡張]]概念に対し、Meta Vistaraの「データセンター規模透過的階層化」・中国OCPコミュニティBelugaの「専用プールオフロード」とは異なる「小規模プール+VM起動前ML予測配分」という第3の設計点を提供する。
- 図表: 本文参照図表21点(Figure 1〜21)全点を埋め込み(除外なし)。埋め込みラスター画像3点のうちCCライセンスロゴ1点は装飾のため除外、numactl出力(Figure 10)とzNUMAアクセスビットヒートマップ(Figure 15の一部)の2点をそのまま採用。残り19点はほぼ全てベクター描画のためPyMuPDFで全ページのキャプション座標を探索しクロップして取得。初回クロップでキャプション行が下端に混入した図(Figure 8・12・13・14)は座標を再調整して再クロップした。
## [2026-08-25] ingest-paper | Revisiting RDMA Reliability for Lossy Fabrics
- Source: `.raw/papers/revisiting-rdma-reliability-lossy-fabrics.pdf`(ローカル PDF から取得)。ACM SIGCOMM '25(2025-09-08〜11、Coimbra, Portugal)、DOI: 10.1145/3718958.3750480。著者14名: Wenxue Li(筆頭、HKUST/Huawei インターン)ほか、香港科技大学(HKUST)・Huawei(Nanjing/Beijing/Shenzhen)所属。対応著者 Bingyang Liu・Kai Chen。
- Summary: [[@2025__SIGCOMM__Revisiting RDMA Reliability for Lossy Fabrics]]
- Pages created: source 1件(address: c-005258)、entity 2件([[Wenxue Li]] c-005259・[[DCP]] c-005260)
- Pages updated: [[Kai Chen (HKUST)]]・[[Huawei Technologies]]・[[Hong Kong University of Science and Technology]](いずれも本論文への関与を追記)、concept 1件([[RoCE設計課題]])、[[@2018__SIGCOMM__Revisiting Network Support for RDMA]](後続研究として本論文への相互参照を追記)
- Key insight: PFC 非依存(R1)・パケットレベル負荷分散互換(R2)・RTO フリー(R3)・ハードウェアオフロード対応(R4)という4要件を同時に満たすスイッチ・RNIC 共設計トランスポート DCP を提案。「制御プレーン(ヘッダ転送)のみを無損失に保ち、データプレーン(ペイロード転送)は有損失のまま許容する」非対称設計(DCP-Switch のパケットトリミング+WRRスケジューリング)により、既存の有損失 RDMA ソリューション IRN(RNIC-SR)がパケットレベル LB との組み合わせで発生させる大量の偽の再送(NS3実験でフローサイズ帯に応じ50〜90%のフローが影響)を解消する。DCP-RNIC はヘッダオンリー(HO)パケットのPSNに基づく精密な再送、拡張RDMAヘッダによる順序非依存パケット受信(reordering buffer不要)、「exactly once」特性を利用したビットマップフリーなパケット追跡(メッセージ単位カウンタ、10k QPで0.3MB対BDPサイズ固定方式3MB)の3機構を実装する。P4スイッチ+FPGAのフル機能プロトタイプ(RNIC-GBN比 LUT+1.7pt・レジスタ+0.4pt・BRAM+1.1pt程度の追加リソースのみ)で実装可能性を実証し、testbed実験・NS3大規模シミュレーション双方でSOTAの無損失(RNIC-GBN/Mellanox CX5)・有損失(IRN)ソリューションに対しそれぞれ1.6倍・2.1〜72倍の性能改善、AIワークロード(AllReduce/AllToAll)でJCTを最大42%削減することを達成した。
- 図表: 本文参照図表17点(Figure 1-17)+表5点(Table 1-5)を全点特定。埋め込みラスター画像33点はすべて図の背景用グレー矩形(matplotlib由来の装飾)のため図表として利用不可と判断し、全図をPyMuPDFキャプション座標クロップで取得。取得失敗・除外図表なし。
## [2026-08-25] ingest-paper | Diagnosing End-Host Network Bottlenecks in RDMA Servers
- Source: `.raw/papers/diagnosing-end-host-network-bottlenecks-rdma.pdf`(ローカルPDFから取得)。IEEE/ACM Transactions on Networking, Vol. 32, No. 5, October 2024, pp. 4302-4316。DOI: 10.1109/TNET.2024.3416419。著者8名: Kefei Liu・Jiao Zhang(責任著者)・Zhuo Jiang・Haoran Wei・Xiaolong Zhong・Lizhuang Tan・Tian Pan・Tao Huang(BUPT / Douyin Vision Company Ltd. / Purple Mountain Laboratories / Qilu University of Technology)。
- Summary: [[@2024__TON__Diagnosing End-Host Network Bottlenecks in RDMA Servers]] — 同著者グループによる Hostping([[@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers]]、NSDI '23)の拡張ジャーナル版。
- Pages created: source 1件。entity 0件(全著者・所属機関はNSDI '23版ingest時に作成済み)。
- Pages updated: entity 12件([[Kefei Liu]]・[[Jiao Zhang]]・[[Zhuo Jiang]]・[[Haoran Wei]]・[[Xiaolong Zhong]]・[[Lizhuang Tan]]・[[Tian Pan]]・[[Tao Huang]]・[[BUPT]]・[[ByteDance]]・[[Douyin Vision]]・[[Purple Mountain Laboratories]])、concept 3件([[ホスト内ネットワークボトルネック]]・[[RDMAネットワーク監視]]・[[PCIe性能]])
- Key insight: NSDI '23版のループバックテスト(ホスト内帯域劣化・レイテンシ増加の診断)に加え、同一ホスト上のRNIC同士が相互にプローブし合うRNIC-to-RNIC(R2R)probingを新規導入し、RNIC自体の接続性問題(ルーティング誤設定・フラッピング・誤配線)を第3の症状カテゴリとして診断できるようにした。binary network tomographyに基づくリンク状態推論をAlgorithm 1として疑似コード化。数千台の本番展開で計8件の新規問題を報告し、うち#14(誤ったスイッチポート配線)・#16(RNICの頻繁なビット誤り)はR2R probingにより初めて発見できた、NSDI版にない知見。Lizhuang Tanの所属がNSDI版のByteDanceからTON版ではQilu University of Technologyへ変化している(2022年博士号取得後の異動と推定)。
- 図表: 本文参照図表10点(Figure 1-10)を全点埋め込み(除外なし)。埋め込みラスター画像7点(Fig.2・5・6・7・10a/b/c)をそのまま利用。Fig.1・3・4・8・9の5点はベクター描画または断片化画像(Fig.8は元々20個のセル断片に分解)のためPyMuPDFキャプション座標クロップで取得。Fig.2・5・6・7の4点はNSDI '23版source ページと共通の図(著者らが両版で同一図を再利用)。
## [2026-08-25] ingest-paper | Rethinking Intra-host Congestion Control in RDMA Networks
- Source: `.raw/papers/Rethinking-Intra-host-Congestion-Control-in-RDMA-Network.pdf`(ローカルPDFから取得)。The 8th Asia-Pacific Workshop on Networking(APNet 2024、2024年8月3-4日、Sydney, Australia)、ACM刊、全7ページ(pp.31-37)。DOI: https://doi.org/10.1145/3663408.3663413。著者6名: Zirui Wan(筆頭著者)・Jiao Zhang(責任著者)・Yuxiang Wang・Kefei Liu・Haoyu Pan・Tao Huang(いずれも BUPT の State Key Laboratory of Networking and Switching Technology。Zirui Wanは China Mobile (Suzhou) Software Technology、Jiao Zhang・Tao Huang は Purple Mountain Laboratories を兼任)。
- Summary: [[@2024__APNet__Rethinking Intra-host Congestion Control in RDMA Networks]]
- Pages created: source 1件、entity 4件([[Zirui Wan]]・[[Yuxiang Wang]]・[[Haoyu Pan]]・[[China Mobile (Suzhou) Software Technology]])
- Pages updated: [[Jiao Zhang]]・[[Kefei Liu]]・[[Tao Huang]]・[[BUPT]]・[[Purple Mountain Laboratories]](いずれも本論文への関与を追記)、concept 4件([[ホスト輻輳制御]]・[[ホスト内ネットワークボトルネック]]・[[データセンター輻輳制御]]・[[RDMA]])
- Key insight: RNIC線速(25Gbps→200Gbps)の急伸とホスト内資源(PCIe帯域63Gbps→256Gbps、メモリ帯域)の相対的停滞のギャップから生じる「ホスト内輻輳」がRDMAネットワーク性能を大きく損なうことを自前のテストベッド実測(3倍輻輳下でPFC有効/PFC-free環境それぞれスループット62%/68%低下、レイテンシ2.4倍/2.6倍増加)で確認し、対処するRHCC(RDMA intra-Host Congestion Control)を提案した。同じ著者グループの前年発表Hostping(NSDI 2023、ホスト内ボトルネック診断)が「診断」を扱ったのに対し、本論文は「能動的な制御」へ研究テーマを展開している。[[@2023__SIGCOMM__Host Congestion Control]](hostCC、TCP向け)のIIOバッファ占有量シグナル・Intel MBAによるホスト内資源配分をRDMAへ転用しつつ、RDMA受信側カーネルモジュールがデータパケットを直接改変できない制約(hostCCのECNマーキング方式が展開不能な理由)に対し、商用RNIC(Mellanox ConnectX-6 DX)が持つProgrammable Congestion Control(PCC)のプローブ機構で受信処理遅延を測定するという代替解を導入した点が新規性。送信レートを$R_{trans}=\min(R_{rev}, R_{cc})$としてホスト間輻輳制御(DCQCN)と統合し、PCIeスタール書き込み要求を最大97%削減、ネットワークスループット/レイテンシを最大2倍/1.4倍改善した。
- 図表: 本文参照図表6点(Figure 1-6、全サブ図含む)を全点取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のためPyMuPDFキャプション座標クロップで全図を取得。
## [2026-08-25] ingest-paper | Classifying Host-Side RDMA Pingmesh Results to Efficiently Identify Transport Faults in Data Centers
- Source: `.raw/papers/classifying-host-side-rdma-pingmesh.pdf`(ローカルPDFから取得)。2025 IEEE 31th International Conference on Parallel and Distributed Systems(ICPADS 2025)、DOI: 10.1109/ICPADS67057.2025.11322964、全8ページ。著者3名: Songhao Ding・Boyang Zhou(責任著者)・Yuhua Zheng(いずれも Zhejiang Lab / Hangzhou Institute for Advanced Study, UCAS)。
- Summary: [[@2025__ICPADS__Classifying Host-Side RDMA Pingmesh Results to Efficiently Identify Transport Faults in Data Centers]]
- Pages created: source 1件、entity 3件([[Songhao Ding]]・[[Boyang Zhou]]・[[Yuhua Zheng]])
- Pages updated: entity 3件([[Zhejiang Lab]]・[[Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences]]・[[R-Pingmesh]])、concept 2件([[RDMAネットワーク監視]]・[[不均衡障害分類]])
- Key insight: [[R-Pingmesh]] が収集するホスト側の遅延・帯域・パケットロス時系列を入力に、事前学習+SFT(教師ありファインチューニング)の二段階LSTM分類器RTFDでRDMAトランスポート障害を分類し、異常パスから障害セグメント単位まで消去法で局所化する手法を提案した。SimAI上の3種DCNトポロジ(単一平面・デュアルToR・デュアルプレーン)で評価し、平均分類精度0.92・平均AUC0.93、6障害タイプ平均F1 0.93(まれ障害でもrecall 0.890/F1 0.882)、3トポロジ平均accuracy 0.918・AUC 0.94を報告する。既存のRDMA監視系(R-Pingmesh・Hawkeye・Pulse・C4)がいずれも「異常の検知・可視化」を担うのに対し、RTFDはR-Pingmeshの後段に接続し「検知後の分類・局所化の自動化」という直交する軸を加える点を[[RDMAネットワーク監視]]の横断的知見に追加した。またマイクロサービス障害分類のSLIM(学習目標の直接最適化)とは異なる転移学習系統(事前学習→SFT)でレアイベント・データ不均衡問題に対処する点を[[不均衡障害分類]]に追加した。
- 図表: 本文参照図表5点(Figure 1〜5)全点を特定・埋め込み(除外なし)。埋め込みラスター画像(`pdf.js`抽出)が5点あり、全図と1対1で対応することを目視確認して対応づけた。ベクター描画のみの図はなくPyMuPDFクロップは不要だった。
- 出典検査: 本文中に3件の数値的不整合を確認し、sourceページ本文に注記のうえ報告した。(1) 特徴ベクトルの次元数: Algorithm 1は10次元(9統計量+λ,μ,ρ,L)、III-B節本文は9統計量にλ,μ,ρのみを加えた12次元(別変数RB,RL,RWを含む)と、疑似コードと本文で次元数・変数構成が食い違う。(2) Pkt Drop(まれ障害)のrecall: 本文は「recall 0.890」と記述するが、Figure 4のグラフ上の表示値は0.900。(3) デュアルプレーン分離トポロジでの鍵指標最小値: Abstractは「minimum value of 0.84」、Section VI(結論)は「above 0.838」、Section IV-B(評価本文)は「maintained at 0.893」と、同じ主張について3箇所で異なる数値を挙げる。いずれも原文ママで転記し、創作による解消はしていない。
## [2026-08-25] ingest-paper | Evaluating Modern GPU Interconnect: PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect
- Source: `.raw/papers/Evaluating-Modern-GPU-Interconnect--PCIe-NVLink-NV-SLI-NVSwitch-and-GPUDirect.pdf`(ローカルPDFから取得)。IEEE Transactions on Parallel and Distributed Systems, Vol. 31, No. 1, January 2020。著者7名: Ang Li・Shuaiwen Leon Song・Jieyang Chen・Jiajia Li・Xu Liu・Nathan R. Tallent・Kevin J. Barker(PNNL/Oak Ridge National Laboratory/College of William and Mary)。
- Summary: [[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]]
- Pages created: source 1件(address: c-005236)、entity 9件([[Ang Li (PNNL)]] c-005237・[[Shuaiwen Leon Song (PNNL)]] c-005238・[[Jieyang Chen]] c-005239・[[Jiajia Li]] c-005240・[[Xu Liu (William and Mary)]] c-005241・[[Nathan R. Tallent]] c-005242・[[Kevin J. Barker]] c-005243・[[Pacific Northwest National Laboratory]] c-005244・[[College of William and Mary]] c-005245)
- Pages updated: [[Oak Ridge National Laboratory]]・[[Summit]]・[[Rice University]]・[[NCCL]](entity)、[[NVLink]]・[[PCIe性能]]・[[集合通信]](concept)
- 名前衝突の注記: 既存entity [[Ang Li]](NYU/Modal Labs)・[[Shuaiwen Leon Song]](Together AI)・[[Xu Liu]](Salesforce AI/NUS)はいずれも同姓同名の別人物。新規entityは`(PNNL)`/`(William and Mary)`で区別した。作業中に誤って既存の[[Xu Liu]](Moirai-MoE筆頭著者)を上書きしたため、`git show HEAD:...`で復元してから正しい別名ファイルを作成し直した。
- Key insight: PCIe・NVLink-V1・NVLink-V2・NV-SLI・NVSwitch・GPUDirect-RDMAの6種のGPUインターコネクトを6プラットフォーム横断評価し、NVLinkのNUMA効果3種と、PCIeチップセット設計に起因する新規NUMA効果「anti-locality」(近傍アクセスが遠隔アクセスより低性能)を実測で同定した2019年時点の基礎的研究。NCCLのリング構成がインターコネクトのトポロジ形状(PCIe木構造 vs NVLinkハイパーキューブメッシュ)にそのまま従属し、集団通信帯域のGPU数依存性が正反対になることを実証。もっとも著しい知見は、マイクロベンチマークで確認したNVLinkの通信効率向上が、CPU中心master-slaveプログラミングモデルの制約下では実アプリケーション全体の性能にほとんど反映されないというギャップ。
- 図表: 本文参照図表39点(Figure 1〜39、全サブ図含む)を全点取り込み(除外なし)。埋め込みラスター画像13点(著者近影・カラーバー等の装飾)は図表としては不使用、全図をPyMuPDFキャプション座標クロップで取得。Table 1〜3はMarkdown表として転記。
## [2026-08-25] ingest-paper | RDMA over Ethernet for Distributed AI Training at Meta Scale(再取り込み)
- Source: `.raw/papers/sigcomm24-final246-acmpaginated.pdf`(既存原本を再利用、再ダウンロードなし)。ACM SIGCOMM 2024(2024-08-04〜08、Sydney NSW Australia)、DOI: 10.1145/3651890.3672233。著者14名: Adithya Gangidi ほか(全員 Meta)。
- 経緯: ユーザーの明示指示で既存 source ページ(`address:` フィールド未採番、図表 6 点のみをページ先頭にまとめて配置しキャプションも不正確)を削除し、PDF 全文(14ページ)を再読して全面的に書き直した。PDF/テキストの原本は既存のものを再利用し、再ダウンロードは行っていない。
- Summary: [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]]
- Pages updated: source 1件(新規 address: c-005248 を採番)
- Key insight: Meta の 24,000 GPU RoCE クラスタでの AI 訓練ネットワーク運用経験。DCQCN は集合通信への適用が困難でPFCのみ+集合ライブラリ層の受信側駆動トラフィック許可制御(CTS)へ転換し、CTS遅延をP90 43µs→4µsに削減。ルーティングはECMP→パスピニング→E-ECMP→集中型TE→フローレットスイッチング(将来方向)と段階的に進化し、本番ステージ間の性能比較(Figure 16)ではStage 1(1:1・静的ルーティング)の中央値約0.5からStage 2以降0.9超へ改善。ネットワーク・NCCL協調チューニングで性能を2倍以上改善。
- 図表: 本文参照図表16点(Figure 1-16)+表3点(Table 1-3)を全点特定・全点埋め込み(除外なし)。埋め込みラスター画像は1点のみ(Figure 5, image-004-002.png)で、残り15図はすべてベクター描画のためPyMuPDFキャプション座標クロップで取得。Table 1-3はいずれも本文中の native text テーブルのためMarkdown表に転記(画像クロップ不要)。取得失敗・除外図表なし。
## [2026-08-25] ingest-paper | Thread and Memory Placement on NUMA Systems: Asymmetry Matters
- Source: `.raw/papers/atc15-paper-lepers.pdf`(USENIX公式PDFから取得)。2015 USENIX Annual Technical Conference (USENIX ATC '15)、Best Paper賞受賞。著者3名: Baptiste Lepers(Simon Fraser University)・Vivien Quéma(Grenoble INP)・Alexandra Fedorova(Simon Fraser University)。
- Summary: [[@2015__ATC__Thread and Memory Placement on NUMA Systems - Asymmetry Matters]]
- Pages created: source 1件(address: c-005230)、entity 4件([[Baptiste Lepers]] c-005231・[[Vivien Quéma]] c-005232・[[Simon Fraser University]] c-005233・[[Grenoble INP]] c-005234)、concept 1件([[非対称NUMAインターコネクト]] c-005235)
- Pages updated: [[Alexandra Fedorova]](2015年当時の所属Simon Fraser Universityと本論文への関与を追記)、[[AMD]](Bulldozer世代Opteronの非対称NUMAインターコネクト節を新設)、concept 1件([[NUMAメモリ配置]])、[[@2007__PDCS__Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines]](本論文への相互参照を追記)
- Key insight: 8ノードのAMD Bulldozer機で、リンク幅・方向性(単方向を含む)・共有関係が非対称なNUMAインターコネクトが性能に与える影響を定量化し、最良の接続性はホップ数最小ではなく総帯域幅最大で決まるという知見を確立。この知見に基づく動的スレッド・メモリ配置アルゴリズムAsymSchedは、独自の高速メモリマイグレーションシステムコール(標準比最大34倍高速)と2段階配置ヒューリスティック(計算対象を67〜99%省略)により、静的な最良配置と同等以上の性能をランダム配置比最大218%改善しつつ達成した。2007年に2ソケット機でHyperTransport非対称性を先に定量化した[[@2007__PDCS__Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines]](Moreaud & Goglin)と、「非対称性は帯域幅で捉えるべき」という結論で世代・スケールを超えて一致する。
- 図表: 本文参照図表7点(Figure 1-7)+表5点(Table 1-5)を全点特定。埋め込みラスター画像2点はUSENIX表紙装飾のため図表として不使用、全図がベクター描画のためPyMuPDFキャプション座標クロップで取得。取得失敗・除外図表なし。Table 1は接続トポロジ図を含む複合表のため画像埋め込み、Table 2〜5はMarkdown表に転記。
## [2026-08-25] ingest-paper | LIKWID: A Lightweight Performance-Oriented Tool Suite for x86 Multicore Environments
- Source: `.raw/papers/LIKWID--A-lightweight-performance-oriented-tool-suite-for-x86-multicore-environments.pdf`(ローカルPDFから取得)。2010 39th International Conference on Parallel Processing Workshops (ICPPW 2010)、DOI: 10.1109/ICPPW.2010.38。著者3名: Jan Treibig・Georg Hager・Gerhard Wellein(いずれも Erlangen Regional Computing Center (RRZE), Friedrich-Alexander-Universität Erlangen-Nürnberg)。
- Summary: [[@2010__ICPPW__LIKWID : A Lightweight Performance-Oriented Tool Suite for x86 Multicore Environments]]
- Pages created: source 1件(address: c-005223)、entity 5件([[LIKWID]] c-005225・[[Jan Treibig]] c-005226・[[Georg Hager]] c-005227・[[Gerhard Wellein]] c-005228・[[PAPI]] c-005229)
- Pages updated: [[Friedrich-Alexander-Universität Erlangen-Nürnberg]](RRZEでのLIKWID開発を追記)、concept 3件([[ハードウェアカウンタ]]・[[NUMA対応CPUピニング]]・[[ハードウェアトポロジ抽象化]])
- Key insight: x86マルチコア環境向けの軽量なコマンドラインツール群LIKWIDの論文。スレッド・キャッシュトポロジ探索(likwid-topology)・スレッド-コアアフィニティ強制(likwid-pin)・性能カウンタ計測(likwid-perfCtr)・ハードウェアプリフェッチャ切替(likwid-features)の4ツールから成り、カーネルパッチ不要でPAPIより単純なインストールを実現する一方x86系Linuxに対応を限定する。OpenMP STREAM triadベンチマークでlikwid-pinによる明示的ピニングが性能分散を大幅に低減することを示し、共有キャッシュ活用型3D Jacobiステンシルでは誤ったピニングが最適化効果を反転させ性能を半減させることを実測した。「均等分散で足りるSTREAM triad」対「精密なコア対応が必須なJacobiステンシル」という2ケーススタディの対比が、NUMA対応CPUピニングの粒度問題を具体的に裏付ける。
- 図表: 本文参照図表11点(Figure 1-11全点)を特定。埋め込みラスター画像は0点(全図がベクター描画)のため、PyMuPDFキャプション座標クロップで全件取得。取得失敗・除外図表なし。Table I・IIはMarkdown表として転記。
## [2026-08-25] ingest-paper | RDMA over Commodity Ethernet at Scale(再取り込み)
- Source: `.raw/papers/rdma_sigcomm2016.pdf`(既存原本を再利用、再ダウンロードなし)。ACM SIGCOMM 2016(2016-08-22〜26、Florianópolis, Brazil)、DOI: 10.1145/2934872.2934908。著者7名: Chuanxiong Guo・Haitao Wu・Zhong Deng・Gaurav Soni・Jianxi Ye・Jitendra Padhye・Marina Lipshteyn(いずれも Microsoft)。
- 経緯: ユーザーの明示指示で既存 source ページ(`address:` フィールド未採番・abstract callout なし・問題設定/新規性/実験設定/考察/強み弱点節が欠落・図表 5 点のみ埋め込み)を削除し、全文を再読して全面的に書き直した。PDF/テキスト/画像の原本(`.raw/papers/rdma_sigcomm2016/`)は既存のものを再利用し、再ダウンロードは行っていない。
- Summary: [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]]
- Pages created: なし(既存ページの delete + recreate。address: c-005224 を新規採番)
- Pages updated: なし(entity: [[Chuanxiong Guo]]・[[Haitao Wu]]・[[Jitendra Padhye]]・[[Microsoft]]、concept: [[RDMA]] の既存記述内容は本ソースの事実関係と齟齬がなく、更新不要と判断)
- Key insight: DSCP-based PFC の設計・4 つの安全課題(RDMA トランスポートライブロック・PFC デッドロック・NIC PFC ポーズフレームストーム・スローレシーバー症状)の発見と解決策・専用の管理監視システム(設定監視・PFC/トラフィック監視・RDMA Pingmesh)・5 段階の漸進的展開プロセスを、実際のインシデント事例(NIC 故障によるサービス可用性低下、スイッチのバッファ共有パラメータ α の設定ミス)とともに全面的に書き起こした。
- 図表: 本文参照図表 10 点(Figure 1・2・4・5・6・8 は単図、Figure 3・7・9・10 は a/b 各サブ図、計 14 サブ図)を全点特定・埋め込み。埋め込みラスター画像(`pdf.js` 抽出)が 14 点あり、全サブ図と 1 対 1 で対応することを目視確認して対応づけた。ベクター描画のみの図はなく PyMuPDF クロップは不要だった。除外図表なし。旧 attachment フォルダに残っていた埋め込み未使用の重複ファイル(`fig-page*.png` 5 点)と、サイズが原本embeddedと一致しない旧クロップ 5 点(`fig1/2/4/6/8-*.png`)は全削除し、`fig01`〜`fig10b` の番号命名で作り直した。
## [2026-08-25] ingest-paper | Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines
- Source: `.raw/papers/Moreaud--Goglin-Impact-of-NUMA-Effects-on-High-Speed-Networking-with-Multi-Opteron-Machines.pdf`(ローカルPDFから取得)。PDCS(Parallel and Distributed Computing and Systems), Nov 2007, Cambridge, United States。HAL ID: inria-00175747、全7ページ。著者2名: Stéphanie Moreaud・Brice Goglin(いずれも Inria / LaBRI / Université Bordeaux 1)。
- Summary: [[@2007__PDCS__Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines]]
- Pages created: source 1件、entity 3件([[Stéphanie Moreaud]]・[[Brice Goglin]]・[[LaBRI]])
- Pages updated: [[hwloc]](Brice Goglinの2007年の先行研究として設計思想の背景に追記)、concept 3件([[NUMAメモリ配置]]・[[NUMA対応CPUピニング]]・[[ホストネットワークスタック性能]])
- Key insight: AMD OPTERON/HYPERTRANSPORTアーキテクチャでのNUMA配置が高速ネットワーク(InfiniBand・Myri-10G・Quadrics Elan4)の通信性能に与える影響を定量化した。レイテンシへの影響はHYPERTRANSPORTホップあたり約40nsと小さいが、DMA/RDMA書き込みの帯域幅は最大40%低下し、しかもこの効果は書き込み先バッファの配置のみに依存し送信側の配置は無関係という非対称性を持つことを発見した。LINUXカーネルへのNUMAトポロジ公開パッチと、NEWMADELEINEミドルウェアへの自動配置実装により、手動でのNUMA配置と同等の通信性能をポータブルに達成した。著者Brice Goglinは3年後のhwloc論文(2010年)の共著者でもあり、本論文の個別ミドルウェアへのNUMA情報統合の経験が、hwlocの汎用トポロジ抽象化という設計思想の先行研究になっている。
- 図表: 本文参照図表5点(Figure 1-5)全点をPyMuPDFキャプション座標クロップで埋め込み(全図がベクター描画のため埋め込みラスター画像は利用不可、埋め込みラスター画像3点はHAL/Open Scienceのロゴ・矢印のため除外)。Table 1・2はMarkdown表として転記。
## [2026-08-25] ingest-paper | Understanding and Profiling the Accelerator Chiplet Network Using PingPoint
- Source: `.raw/papers/Understanding-and-Profiling-the-Accelerator-Chiplet-Network-Using-PingPoint.pdf`(ローカルPDFから取得)。ACM SIGCOMM 2026 Conference(SIGCOMM '26、2026年8月17-21日、Denver, CO, USA)、全18ページ。著者3名: Junyeol Ryu・Ming Liu・Matthew D. Sinclair(いずれも University of Wisconsin-Madison)。DOI: https://doi.org/10.1145/3789240.3829110。コード: https://github.com/netlab-wisconsin/pingpoint
- Summary: [[@2026__SIGCOMM__Understanding and Profiling the Accelerator Chiplet Network Using PingPoint]]
- Pages created: source 1件、entity 3件([[Junyeol Ryu]]・[[Matthew D. Sinclair]]・[[PingPoint]])
- Pages updated: [[Ming Liu]]・[[University of Wisconsin-Madison]](翌年のPingPoint論文への関与を追記)、[[AMD]](MI300X/MI350XのACN節を新設)、[[チップレット]](チップレット間ネットワークの輻輳特性を横断的知見として追加)、[[GPU観測性]](ACNをGPU観測性の対象階層の1つとして位置づけ、CU/SM占有率ベースの空間分離では防げない輻輳伝播の知見を追加)
- Key insight: チップレット型アクセラレータ内部でcompute chiplet・IO chiplet・memory moduleを接続するオンパッケージネットワークを「Accelerator Chiplet Network(ACN)」と命名し、既存ツールがこれを見過ごし性能劣化をコンピュート/メモリに誤帰属させてきたことをAMD MI300X/MI350Xの実測で示した。ACNのCOM-IO・IO-IO・IO-MEMの3リンク種はそれぞれ全く異なる輻輳挙動(traffic-agnostic spraying/deterministic stateless routing/address-directed traffic-oblivious backpressure)を持ち、単一のキューイングモデルでは表現できない。これに基づきhoseモデル+専用キューイング抽象(Central-FCFS/Split-FCFS/Central-PS)でACNを論理グラフ化し、target kernelとpingマイクロベンチマークを1つのfused kernelへ融合してDifferential Congestion Attribution(DCA)でリンク単位に輻輳を帰属する軽量プロファイラPingPointを構築した。空間分離したカーネル間でもACN経由で6倍を超える遅延干渉が生じることを実測し(Case #3)、適応的な2段階監視で平均3.5%のオーバーヘッドに抑えつつマルチテナントGPU-DBでSLO容量をIdealの2%以内まで最適化できることを示した。同一著者(Ming Liu)によるPathFinder(SIGCOMM'25、CXL.mem対象)の系譜に連なる。
- 図表: 本文参照図表16点(Figure 1-16)全点をPyMuPDFキャプション座標クロップで埋め込み(全図がベクター描画のため埋め込みラスター画像は利用不可、除外なし)。Table 1・2・4・5・6はMarkdown表として転記(Table 2はPDF抽出時のレイアウト崩れを本文記述と整合させて再構成、注記あり)。Table 3(略語一覧、Appendix A)は本文中で該当略語を随時説明済みのため独立転記を省略(除外理由: 本文の既存説明で代替可能)。
## [2026-08-25] ingest-paper | MemAxes: Visualization and Analytics for Characterizing Complex Memory Performance Behaviors
- Source: `.raw/papers/tvcg2018.pdf`(https://www.cs.umd.edu/~bhatele/pubs/pdf/2018/tvcg2018.pdf から取得)。IEEE Transactions on Visualization and Computer Graphics(TVCG)Vol. 24, No. 7, pp. 2180-2193(2018年、DOI: 10.1109/TVCG.2017.2718532、DBLPで確認)、全14ページ。著者7名: Alfredo Giménez(UC Davis / LLNL)・Todd Gamblin・Abhinav Bhatele・Martin Schulz・Peer-Timo Bremer(いずれもLLNL)・Ilir Jusufi(Linnaeus University)・Bernd Hamann(UC Davis)。PDFヘッダーには古いテンプレートの誤植("VOL. 27, NO. 5, MAY 2016")が残っているが、frontmatterはDBLPで確認した正式な書誌情報を採用した。
- Summary: [[@2018__TVCG__MemAxes - Visualization and Analytics for Characterizing Complex Memory Performance Behaviors]]
- Pages created: source 1件、entity 10件([[Alfredo Giménez]]・[[Todd Gamblin]]・[[Ilir Jusufi]]・[[Abhinav Bhatele]]・[[Martin Schulz]]・[[Peer-Timo Bremer]]・[[Bernd Hamann]]・[[LULESH]]・[[XSBench]]・[[Linnaeus University]])
- Pages updated: entity 3件([[Lawrence Livermore National Laboratory]]・[[University of California, Davis]]・[[hwloc]])、concept 2件([[性能データの可視化]]・[[ハードウェアトポロジ抽象化]])
- Key insight: サンプリングされたメモリアクセスデータを、ソースコード/データオブジェクト・ハードウェアトポロジ・全属性の並行ヒストグラムという3つの連携ビューでリンクし、hwloc/likwidが用いる水平icicle plotの視覚的スケーラビリティの欠点を解消する放射状(sunburst型)トポロジ可視化を新規提案した。平均アクセスレイテンシ・負荷不均衡という2種のスコアリング指標に基づく制約付き凝集型クラスタリング(隣接ウィンドウのみ比較しO(kw log w)に抑える)により、専門知識の少ない利用者でも興味深いデータ部分集合を発見できるガイド付きインタラクションを実現した。LULESHの事例研究では、放射状トポロジ可視化とクラスタリングで両ソケットにまたがるz-index方向のデータ分割非効率を発見・修正し、メモリアクセスサイクルを60%、総実行時間を10%削減した。
- 図表: 本文参照図表14点(Figure 1〜13、うちFig.11はa/bの2枚)を全点埋め込み(除外なし)。Figure 1(仮想的なメモリアクセスデータの表・コード・4×4グリッド図の複合図)のみベクター描画のためPyMuPDFキャプション座標クロップで取得、他13点(Figure 2〜10, 12, 13)は`pdf.js`埋め込みラスター画像をそのまま利用。
## [2026-08-25] ingest-paper | Host Congestion Control
- Source: `.raw/papers/Host-Congestion-Control.pdf`(ローカルPDFから取得)。ACM SIGCOMM 2023 Conference(ACM SIGCOMM '23、2023年9月10-14日、New York, NY, USA)、全13ページ。著者3名: Saksham Agarwal・Rachit Agarwal(Cornell University)、Arvind Krishnamurthy(Google & University of Washington)。DOI: https://doi.org/10.1145/3603269.3604878。コード: https://github.com/Terabit-Ethernet/hostCC
- Summary: [[@2023__SIGCOMM__Host Congestion Control]]
- Pages created: source 1件、concept 1件([[ホスト輻輳制御]])。新規entityなし(著者3名・所属3組織はすべて既存ページ)
- Pages updated: [[Saksham Agarwal]]・[[Arvind Krishnamurthy]]・[[Rachit Agarwal]]・[[Cornell University]]・[[Google]]・[[University of Washington]](いずれも本論文への関与を追記)、[[データセンター輻輳制御]](輻輳制御研究の「end-to-end=NIC」という暗黙の前提がホスト輻輳の発見で覆される点、hostCCが既存プロトコルへ非侵襲的に統合される設計である点を追加)、[[ホストネットワークスタック性能]](「処理オーバーヘッド」と「輻輳」という異なる現象が同じホストネットワーク経路上で相互作用する観点を追加)
- Key insight: 高帯域アクセスリンクの普及とホスト内資源(CPU・キャッシュ・メモリ帯域)の技術トレンド停滞のギャップから「ホスト輻輳」が顕在化し、ホストネットワークがロスレスなクレジットベースフロー制御を用いるため、輻輳点(メモリコントローラ)ではなく輻輳点から離れたNICバッファでキューイング・ドロップが起きる——「パケットドロップは輻輳点で発生する」という古典的輻輳制御の前提を覆す現象を実測で特定した。hostCCはIIOバッファ占有量というサブマイクロ秒粒度のホスト輻輳シグナルを導入し、サブRTT粒度のホストローカル応答(ホスト資源配分)とRTT粒度のネットワーク資源配分(既存プロトコルへのシグナルエコー)を組み合わせることで、DCTCPを無改変のまま統合する。3倍のホスト輻輳下でパケットドロップ率を桁違いに削減しつつ目標帯域をほぼ達成し、128B RPCで13µsという最小限のテールレイテンシ劣化に抑えた。同一著者グループが翌年発表した[[@2024__SIGCOMM__Understanding the Host Network]]は、hostCCの「輻輳の検知と制御」を補完する「輻輳の理解」を深化させる関係にある。
- 図表: 本文参照図表19点(Figure 1-19、全サブ図含む)を全点取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のためPyMuPDFキャプション座標クロップで全図を取得。
## [2026-08-25] ingest-paper | Understanding the Host Network
- Source: `.raw/papers/Understanding-the-Host-Network.pdf`(ローカルPDFから取得)。ACM SIGCOMM 2024 Conference(ACM SIGCOMM '24、2024年8月4-8日、Sydney, NSW, Australia)、全14ページ。著者6名: Midhul Vuppalapati・Saksham Agarwal・Rachit Agarwal(Cornell University)、Henry N. Schuh・Baris Kasikci・Arvind Krishnamurthy(University of Washington)。DOI: https://doi.org/10.1145/3651890.3672271。コード: https://github.com/host-architecture/understanding-the-host-network
- Summary: [[@2024__SIGCOMM__Understanding the Host Network]]
- Pages created: source 1件、entity 3件([[Midhul Vuppalapati]]・[[Saksham Agarwal]]・[[Henry N. Schuh]])、concept 1件([[ドメイン別クレジットベースフロー制御]])
- Pages updated: [[Baris Kasikci]]・[[Arvind Krishnamurthy]]・[[Rachit Agarwal]]・[[Cornell University]]・[[University of Washington]](いずれも本論文への関与を追記)、[[ホスト内ネットワークボトルネック]](Hostpingの症状ベース診断と本論文の根本原因メカニズムの補完関係、ソケット内部コンポーネント間相互作用が競合源になりうる知見を追加)
- Key insight: ホストネットワーク(プロセッサ・メモリ・周辺機器インターコネクト)内の競合を、ドメインごとのクレジットベースフロー制御という単一の概念的抽象化で説明する研究。既存研究(Google/Alibaba Pangu/Hostping等)が報告してきた「メモリ帯域飽和時にP2MがC2Mを圧迫する」現象(赤レジーム)を再現・説明するだけでなく、メモリ帯域が未飽和の段階でC2Mのみが劣化しP2Mが無傷という逆方向の新規現象(青レジーム)を発見した。Intel uncore performance countersで4ドメイン(C2M-Read/C2M-Write/P2M-Read/P2M-Write)のクレジット数・無負荷時レイテンシをリバースエンジニアリングし、MCでの行ミス・バンク負荷不均衡・CHA/MCからのバックプレッシャーという具体的機構で両レジームを説明した上、誤差10%以内の解析式で定量的に検証した。全観測結果は単一ホスト内実験でも再現され、影響範囲がネットワークアプリケーションという文脈を超えることを示す。
- 図表: 本文参照図表14項目(Figure 1-12、Table 1-2)を全点取り込み(除外なし)。埋め込みラスター画像0点(全図・全表がベクター描画)のためPyMuPDFでキャプション座標クロップして取得。
## [2026-08-25] ingest-paper | Understanding and Profiling CXL.mem Using PathFinder
- Source: `.raw/papers/pathfinder-sigcomm25.pdf`(https://pages.cs.wisc.edu/~mgliu/papers/pathfinder-sigcomm25.pdf から取得)。ACM SIGCOMM 2025 Conference(SIGCOMM '25、2025年9月8-11日、Coimbra, Portugal)、全22ページ。著者6名: Xiao Li(University of Wisconsin-Madison/Beihang University)・Zerui Guo(University of Wisconsin-Madison)・Yuebin Bai(Beihang University)・Mahesh Ketkar(Intel)・Hugh Wilkinson(Intel)・Ming Liu(University of Wisconsin-Madison)。DOI: https://doi.org/10.1145/3718958.3750479。コード: https://github.com/netlab-wisconsin/PathFinder
- Summary: [[@2025__SIGCOMM__Understanding and Profiling CXL.mem Using PathFinder]]
- Pages created: source 1件、entity 7件([[Xiao Li]]・[[Zerui Guo]]・[[Yuebin Bai]]・[[Mahesh Ketkar]]・[[Hugh Wilkinson]]・[[Ming Liu]]・[[University of Wisconsin-Madison]])、concept 1件([[CXL.memプロトコル実行プロファイリング]])
- Pages updated: [[Intel]](共著者2名の所属・実験ハードウェア開発元として追記)、[[Beihang University]](Xiao Li・Yuebin Baiの所属として追記)、[[CXLによるメモリ拡張]](VistaraのTPPページ配置最適化とPathFinderのPMU診断が相補的な抽象度で対応するという横断的知見を追加)、[[CXLMemSim]](実測 vs シミュレーションという対照的アプローチとしてPathFinderへの参照を追加)
- Key insight: サーバプロセッサとそのチップセットを多段Closネットワークとみなし、traceroute・reverse traceroute・delay-based queueing analysis(Little's Law)というネットワーク領域の解析技術をホスト内部のPMUベースマイクロアーキテクチャ解析へ転用するという方法論的橋渡しにより、232種のPMUカウンタでCXL.memの4データパス(DRd・DWr→RFO・RFO・HW/SW PF)をエンドツーエンドに追跡できることを示した。back-propagationアルゴリズム(PFEstimator)は、CXL起因のパイプラインストール(平均2.1〜2.7倍増加)がアンコアからコアへ向かって階層キャッシュにより漸減する現象を定量化でき、既存の粗い按分手法より正確にボトルネックを特定する。7ケーススタディでTPP/Colloidとの組み合わせによる実運用最適化(GUPSスループット1.1倍)も実証し、オーバーヘッドは1.3% CPU/38MBメモリと軽量。
- 図表: 本文参照図表16点(Figure 1-16)+Table 1-7のうち、主要ケーススタディに対応するFigure 1-13を全点PyMuPDFキャプション座標クロップで取得(除外なし)。Figure 14-16(付録、EMRサーバでの再現性検証。数値知見は本文に既記載)と、Table 1-5(PMUカウンタ列挙の大規模参照表)・Table 6(77アプリケーションのベンチマーク構成一覧)は本文の理解に必須でない大規模参照表のため除外。Table 7(Case 1のfotonik3d_s/gcc_sパスマッピング詳細)は本文中で具体的数値を引用する形で記述。埋め込みラスター画像は3点検出されたがいずれもページ装飾用の空白アイコン(57x18px)のため図表として利用不可、全図をPDF直接クロップで取得した。
## [2026-08-25] ingest-paper | A PCIe Congestion-Aware Performance Model for Densely Populated Accelerator Servers
- Source: `.raw/papers/multigpu_pcie_bw_model.pdf`(https://spcl.inf.ethz.ch/Publications/.pdf/multigpu_pcie_bw_model.pdf から取得)。SC16 - International Conference for High Performance Computing, Networking, Storage and Analysis(2016年)、全11ページ。著者5名: Maxime Martinasso・Sadaf R. Alam(Swiss National Supercomputing Centre, ETH Zurich)、Grzegorz Kwasniewski・Torsten Hoefler(Department of Computer Science, ETH Zurich)、Thomas C. Schulthess(Institute for Theoretical Physics, ETH Zurich / Oak Ridge National Laboratory)。IEEE Xplore: https://ieeexplore.ieee.org/document/7877141
- Summary: [[@2016__SC__A PCIe Congestion-Aware Performance Model for Densely Populated Accelerator Servers]]
- Pages created: source 1件、entity 1件([[Maxime Martinasso]])
- Pages updated: [[Torsten Hoefler]](共著者としての関与を追記)、[[PCIe性能]](GPU間P2P通信の輻輳系ボトルネックを既存の単一フローオーバーヘッド系知見と対比する横断的知見を追加)
- Key insight: GPU間のPCIe P2P通信は単一のマイクロベンチマーク値では予測できないほど動的に帯域が変動する。ポートアービトレーション(上流:均等配分、下流:重み付きラウンドロビン)とHead-Of-Line(HOL)ブロッキングを4段階アルゴリズム(ソースアービトレーション→上流→下流→HOL)でモデル化し、8GPU構成2トポロジ(約19万通信)で97%以上を誤差±15%以内に予測した。ルートコンプレックスを通過する通信は小さいパケットサイズを強いられ理論帯域効率が76%に低下するという特殊な帯域損失特性(パラメータτ=0.17355として同定)も定量化。COSMO気象予報モデルのhalo exchange通信パターンに適用し、通信順序の選び方だけで2Dで最大1.9倍・3Dで最大2.57倍の性能差が生じることを実証した。
- 図表: 本文参照図表11点(Figure 1-11)+Table 2点全点を取り込み(除外なし)。埋め込みラスター画像2点(Figure 6のT1・T2プロット)以外はすべてベクター描画のため PyMuPDF キャプション座標クロップで取得、Table I・II は Markdown 表として転記。
## [2026-08-25] ingest-paper | Understanding PCIe performance for end host networking
- Source: `.raw/papers/p327-neugebauer.pdf`(https://www.cl.cam.ac.uk/teaching/2425/R02/papers/p327-neugebauer.pdf から取得)。ACM SIGCOMM 2018(2018-08-20〜25、ブダペスト)、pp. 327-341、全15ページ。著者6名: Rolf Neugebauer(Independent Researcher)・Gianni Antichi(Queen Mary, University of London)・José Fernando Zazo(Naudit HPCN)・Yury Audzevich(University of Cambridge)・Sergio López-Buedo(Universidad Autónoma de Madrid)・Andrew W. Moore(University of Cambridge)。DOI: 10.1145/3230543.3230560。コード: https://www.pcie-bench.org
- Summary: [[@2018__SIGCOMM__Understanding PCIe performance for end host networking]]
- Pages created: source 1件、entity 4件([[Rolf Neugebauer]]・[[Andrew W. Moore]]・[[Netronome]]・[[NetFPGA]])、concept 1件([[PCIe性能]])
- Pages updated: [[Gianni Antichi]](本論文への共著者としての関与を追記)
- Key insight: PCIe Gen 3 x8は物理層62.96Gb/sだがDLL/TLPヘッダオーバーヘッドとMPS/MRRS制約により実効帯域は約50Gb/s以下に低下し、ExaNIC実測では128Bパケットの往復レイテンシの90.6%・1500Bでも77.2%をPCIe自体が占める。ホスト側ではIOMMU(ワーキングセットがIO-TLBサイズ〈推定64エントリ=256KB〉超過で64B DMA読み出しスループット最大70%低下)・NUMA(リモート64B読み出しでローカル比約20%低下+約100nsのレイテンシ増)・DDIO(キャッシュ常駐データへのアクセスが約70ns高速)という3つの技術がPCIe性能を左右する。同世代のXeon E5とE3でPCIeレイテンシ分布が劇的に異なる(E3の99.9パーセンタイルが中央値の10倍近い)という、単一ベンダー内実装差の大きさを示す知見も報告している。
- 図表: 本文参照図表9点(Figure 1-9)+Table 2点全点を取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のため PyMuPDF キャプション座標クロップで全図を取得、Table 1・2 は Markdown 表として転記。
## [2026-08-25] ingest-paper | hwloc: a Generic Framework for Managing Hardware Affinities in HPC Applications
- Source: `.raw/papers/hwloc-pdp-2010.pdf`(https://www.open-mpi.org/papers/pdp-2010/hwloc-pdp-2010.pdf から取得)。PDP 2010 - The 18th Euromicro International Conference on Parallel, Distributed and Network-Based Computing、全7ページ。著者8名: François Broquedis・Jérôme Clet-Ortega・Samuel Thibault・Raymond Namyst(University of Bordeaux)、Stéphanie Moreaud・Brice Goglin(INRIA)、Nathalie Furmento(CNRS)、Guillaume Mercier(ENSEIRB)。いずれもLaBRI所属。HAL ID: inria-00429889, version 1(2009-11-04投稿)。
- Summary: [[@2010__PDP__hwloc a Generic Framework for Managing Hardware Affinities in HPC Applications]]
- Pages created: source 1件、entity 2件([[hwloc]]・[[François Broquedis]])、concept 1件([[ハードウェアトポロジ抽象化]])
- Pages updated: [[NUMA対応CPUピニング]](hwlocの共有キャッシュ粒度でのバインディング判断・トポロジ抽象化の設計思想を横断的知見として追加)
- Key insight: hwlocはプロセッサソケット・キャッシュ・コア・NUMAメモリノードを、オブジェクト型や相対深さに仮定を置かない汎用木構造として抽象化し、低レベル/高レベルの二層APIとCpuset構造体によるバインディングを提供する。この「共通祖先の深さ・共有キャッシュサイズ」という近接度情報は、OpenMPスレッドスケジューリング(FORESTGOMPのCache方式で16コアにおいて非トポロジ認識比14対8.52倍)・MPIプロセス配置(SCOTCHによる静的マッピングでNAS CGカーネル26%/8%改善)・MPI通信サブシステムの動的閾値決定(KNEMのI/OATオフロード閾値 = キャッシュサイズ/(2×共有プロセス数))という3つの異なるレイヤーで共通して有用であることを示した。先行研究PLPA(Linux専用、共有キャッシュ・NUMA非対応)との統合過程にあったことも記録している。
- 図表: 本文参照図表9項目(Figure 1〜9、Table I〜III)のうち、実図(Figure 1・2・3・8・9)をPyMuPDFキャプション座標クロップで全点埋め込み、コード例のFigure 5〜7とテキストダンプのFigure 4はMarkdownコードブロックとして転記(除外なし)。Table I〜IIIはMarkdown表として転記。埋め込みラスター画像はHALロゴ1点のみで除外(装飾)。
## [2026-08-24] ingest-paper | InterconnectLens: Enhancing Observability of Data Transfers in GPU Clusters
- Source: `.raw/papers/InterconnectLens_Enhancing_Observability_Data_Transfers.pdf`(ローカルファイル `/Users/y-tsubouchi/Downloads/InterconnectLens_Enhancing_Observability_Data_Transfers.pdf` から取得)。Practice and Experience in Advanced Research Computing (PEARC '25)、2025-07-20〜24、Columbus, OH, USA。ACM刊、全5ページ。著者4名: Koshi Eguchi([[University of Tokyo]])・Ryo Nakamura([[University of Tokyo]])・Yohei Kuga([[Toyota Motor Corporation]])・Kenjiro Taura([[University of Tokyo]]/[[NII LLMC]])。DOI: 10.1145/3708035.3736055。CC BY 4.0。
- Summary: [[@2025__PEARC__InterconnectLens - Enhancing Observability of Data Transfers in GPU Clusters]]
- Pages created: source 1件、entity 7件([[Koshi Eguchi]]・[[Ryo Nakamura]]・[[Yohei Kuga]]・[[Kenjiro Taura]]・[[Toyota Motor Corporation]]・[[NII LLMC]]・[[InterconnectLens]])
- Pages updated: [[Prometheus]]・[[NVIDIA Data Center GPU Manager]]・[[University of Tokyo]]・[[NCCL]](いずれもICLensでの利用・所属としての関与を追記)・[[RDMAネットワーク監視]](ICLensの「人間目視によるコンポーネント別グラフ比較」という自動検知に依らない運用可視化アプローチを計装点の第八の軸として追加、`/sysfs`経由RNICカウンタの実装上の制約に関する知見も追加)・[[GPU観測性]](ICLensの「単一デバイス深掘り」ではなく「GPU間通信経路横断」の可視化という、Zoomerとは異なる統合の切り口を追加)
- Key insight: GPUDirect RDMAはCPU・ホストメモリをバイパスして通信を高速化する一方、GPU-to-GPU通信路がCPU・GPU・Root Complex・RNICの複数コンポーネントを経由するため、NICメトリクス単体では性能劣化の原因を特定できない。ICLensはdcgm-exporter・拡張版Intel pcm・procfsベースRNIC Exporterという異ベンダーのExporterをPrometheusへ統合し、コンポーネント別・TX/RX方向別の帯域を単一ダッシュボードに並置することで、TCP誤用(RNIC不活性+CPU負荷増)とGPUDirect RDMA誤設定(RNIC活性+CPU PCIe/Memory負荷増)というRNIC単体では区別できない2つの問題を切り分けられることを示した。既存のRDMA監視系(Hawkeye・C4・R-Pingmesh等)がいずれも自動異常検知を志向するのに対し、ICLensは自動化を持たず「人間がグラフを目視比較する」運用可視化に徹する点が対照的。
- 図表: 本文参照図表9点(Figure 1〜5、全サブ図: 1a/1b・2・3a/3b・4a/4b・5a/5b)を全点取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター/スクリーンショット描画)のためPyMuPDFキャプション座標クロップで全図を取得。図4a・5aは本文中の連番参照回数が少ないが、subfigureとして本文が実際に指す図であるため取り込み対象とした。
## [2026-08-24] ingest-book | LeanとDevOpsの科学[Accelerate] テクノロジーの戦略的活用が組織変革を加速する
- Source: `.raw/books/accelerate-lean-devops/`(19 章 / 入力: pdf)。原書 *Accelerate: The Science of Lean Software and DevOps — Building and Scaling High Performing Technology Organizations*(IT Revolution Press、2018-03)の日本語版。Nicole Forsgren・Jez Humble・Gene Kim 著、武舎広幸・武舎るみ 訳、インプレス、2018-11-21 初版第1刷、ISBN 978-4-295-00490-5、320 ページ。第16章のみ Karen Whitley Bell・Steve Bell(Lean IT Strategies, LLC)の執筆。
- 取り込み範囲: 前付「はじめに」+ 本編 17 章 + 付録A の 19 ページ(ユーザー確認済み)。付録B「統計データ」・付録C「本調査研究で使用してきた統計的手法」・クイックリファレンス・謝辞・参考文献・索引は範囲外。
- Book entity: [[LeanとDevOpsの科学[Accelerate]]]
- Chapters: [[@2018__Impress__LeanとDevOpsの科学 - Introduction はじめに]]〜[[@2018__Impress__LeanとDevOpsの科学 - Appendix A 改善促進効果の高いケイパビリティ]](19 件)
- Pages created: source 19 件、entity 4 件([[ING]]・[[Kripa Krishnan]]・[[LeanとDevOpsの科学[Accelerate]]]・[[Ron Westrum]])、concept 13 件([[IT業界における多様性]]・[[Westrumの組織文化類型]]・[[スクワッド・トライブ・チャプター]]・[[デプロイ関連の負荷]]・[[バーンアウト]]・[[リーンマネジメント]]・[[リーン製品開発]]・[[変革型リーダーシップ]]・[[従業員エンゲージメント]]・[[情報セキュリティのシフトレフト]]・[[潜在的構成概念の測定]]・[[疎結合のアーキテクチャ]]・[[継続的デリバリ]])
- Pages updated: entity 10 件([[Gene Kim]]・[[Google]]・[[IBM]]・[[Jez Humble]]・[[Kevin Behr]]・[[Melvin Conway]]・[[Nicole Forsgren]]・[[Puppet]]・[[Steve Yegge]]・[[W. E. Deming]])、concept 18 件([[DORA]]・[[SRE組織変革]]・[[イテレーションの長さ]]・[[オンコールストレス管理]]・[[クラスタリング]]・[[コンウェイの法則]]・[[ソフトウェア変更管理]]・[[バッチサイズ]]・[[フィードバック駆動開発]]・[[マイクロサービスアーキテクチャ]]・[[メンタルヘルスとインクルーシビティ]]・[[心理的安全性]]・[[教師データ収集手段の選択]]・[[研究方法論における妥当性概念]]・[[組織の信頼性マインドセット]]・[[統計的有意性]]・[[継続的デプロイ]]・[[開発者生産性]])
- Key insight: **本書の中核は「何がデリバリ性能を高めるか」ではなく「その主張がどこまで言えるか」を自分で定義したことにある**。実務書でありながら第2部の4章を丸ごと調査設計・計量心理学・統計的推論に割き、相関と因果を区別し(第12章)、直接測れない対象を潜在的構成概念として数量化する検定手続きを開示し(第13章)、システムデータではなくアンケートを選んだ理由を5点挙げて論証し(第14章)、紹介による抽出(スノーボールサンプリング)という標本抽出の制約と、母集団を「DevOps用語に馴染みのある専門家・組織」へ絞ったトレードオフまで明示する(第15章)。第1部の各章が示す「予測関係」は、この留保とセットで初めて意味を持つ。もう1つの軸は**成熟度モデルの否定**で、到達段階で格付けするのではなく改善効果の高い24のケイパビリティを個別に測って伸ばす枠組みを取り(第1章・付録A)、その帰結として第16章は「ハイパフォーマンス文化は実装(模倣)できない」と結ぶ。第11章が「変革型リーダーシップの影響は技術とリーンのケイパビリティを介した**間接的**なものであり、リーダー単独ではハイパフォーマンスに届かない」と示すのも、同じ立場の現れである。
- 図表: 本文参照の図 27 点を全点取り込み(除外なし)。320 ページのため `extract-paper-images.mjs` の一括抽出は実行せず、章テキスト全体の図参照 grep で総点数 28 を確定したうえで、キャプションのフォント判別(`FutoGoB101Pr6-Bold` 単独 + `^図N.M` パターン。本文中の図参照は本文明朝 `PShueiMinPr6-L` を含むため分離できる)で 28 点のキャプションを機械的に特定し、直上の未使用画像矩形の和との対応づけでオーケストレータが 1 パスでクロップした。付録B の図B.1 のみ取り込み範囲外のため除外。図3.1・図16.2・図16.3 はベクター描画のためキャプション座標クロップ、図9.1・図10.1・図10.2・図16.2 は 2 行キャプションのため継続ブロックまで含めて再クロップ、図A.1 は見開き 2 ページにまたがるため左右の半分を結合して 1 枚にした。
- 運用メモ: (1) `fetch-book.sh` の自動章検出は第17章を PDF 261-320 と付録・謝辞・参考文献・索引まで飲み込んでいたため、`toc.txt` の level 2 から章境界を読み直し `--chapters` で再分割した(捨て番号のダミー章で後付けを切り離す方式)。(2) book entity 名は `notes/sre/LeanとDevOpsの科学.md` との basename 衝突を避けるため、全角ブラケット込みの `LeanとDevOpsの科学[Accelerate]` とした(conventions §9.7)。(3) 4 指標のハブは既存 `[[DORA]]` concept(被リンク多数)であり、新規に類似 concept を作らずそこへ積み増した。(4) 章 source は全て `publish: false`。concept ページに書籍の図が埋め込まれていた 1 件を、Publish 経由の外部公開を避けるため source ページへの参照に置き換えた。
- 出典の確定: (a) 第3章の `[Westrum 2014]` と第13章の `[Ron Westrum 2004]` は食い違いではなく、本書が Westrum の別々の論文("A Typology of Organisational Cultures", *Quality and Safety in Health Care* 13 suppl 2, 2004 / "The Study of Information Flow: A Personal Journey", *Safety Science* 67, 2014)を引き分けたもの。類型論の一次文献は 2004 年論文であることを巻末参考文献で確定した。(b) 第6章の `[Carman et al. 2012]` は日本語版の引用ラベルの誤植で、巻末参考文献の書誌は `Corman, Joshua, David Rice, and Jeff Williams. "The Rugged Manifesto."` である。原文を書き換えず注記を追加した。
## [2026-08-24] ingest-paper | Assessing Container Network Interface Plugins: Functionality, Performance, and Scalability
- Source: `.raw/papers/Assessing_Container_Network_Interface_Plugins_Functionality_Performance_and_Scalability.pdf`(ローカルファイル `/Users/y-tsubouchi/Downloads/Assessing_Container_Network_Interface_Plugins_Functionality_Performance_and_Scalability.pdf` から取得)。IEEE Transactions on Network and Service Management(TNSM)、2021-03-01 発行。著者3名: Shixiong Qi([[University of California, Riverside]])・Sameer G. Kulkarni([[Indian Institute of Technology, Gandhinagar]])・K. K. Ramakrishnan([[University of California, Riverside]])。DOI: 10.1109/TNSM.2020.3047545。著者ら自身の 2020 IEEE LANMAN 会議論文の拡張版。
- Summary: [[@2021__TNSM__Assessing Container Network Interface Plugins - Functionality, Performance, and Scalability]]
- Pages created: source 1件、entity 4件([[Shixiong Qi]]・[[Sameer G. Kulkarni]]・[[K. K. Ramakrishnan]]・[[Indian Institute of Technology, Gandhinagar]])、concept 1件([[Container Network Interface (CNI)]])
- Pages updated: [[University of California, Riverside]](Shixiong Qi・K. K. Ramakrishnan の所属としての関与を追記)・[[eBPF]](Cilium の eBPF datapath(XDP/TCフック)を CPU サイクル/パケット(CPP)で定量化した知見を追加。intra-host 約189 CPP・iptablesチェーン0、inter-host 約236 CPP)
- Key insight: Kubernetes CNI プラグイン(Flannel・Weave・Cilium・Calico 4モード・Kube-router)を CPU サイクル/パケット(CPP)によるカーネル内オーバーヘッド分解で比較し、性能差の根本原因を特定した。intra-host では eBPF ベースの Cilium が iptables/Netfilter 処理を完全に迂回して最高性能を達成する一方、inter-host では native routing(underlay)が overlay より一貫して高性能で、NIC のトンネルオフロード対応可否が overlay CNI の実効性能を大きく左右する(IP-in-IP オフロード非対応環境でスループットが約4割低下)。ネットワークポリシーの粒度と Netfilter オーバーヘッドはトレードオフの関係にあり、Calico-wp-ipip は inter-host で全 CNI 中最大の 749 CPP に達する。
- 図表: 本文参照図表15点(Figure 1-15)+Table 3点全点を取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のため PyMuPDF キャプション座標クロップで全図を取得、Table 1-3 はテキスト抽出不可のベクター描画テーブルのため画像で内容を目視確認しつつ Markdown 表として忠実に転記。
## [2026-08-24] ingest-paper | The eXpress Data Path: Fast Programmable Packet Processing in the Operating System Kernel
- Source: `.raw/papers/The_eXpress_data_path.pdf`(ローカルファイル `/Users/y-tsubouchi/Downloads/The_eXpress_data_path.pdf` から取得)。ACM CoNEXT '18(2018年12月4〜7日、ヘラクリオン、ギリシャ)。著者7名: Toke Høiland-Jørgensen(Karlstad University)・Jesper Dangaard Brouer(Red Hat)・Daniel Borkmann(Cilium.io)・John Fastabend(Cilium.io)・Tom Herbert(Quantonium Inc.)・David Ahern(Cumulus Networks)・David Miller(Red Hat)。DOI: 10.1145/3281411.3281443。
- Summary: [[@2018__CoNEXT__The eXpress Data Path - Fast Programmable Packet Processing in the Operating System Kernel]]
- Pages created: source 1件、entity 9件([[Toke Høiland-Jørgensen]]・[[Jesper Dangaard Brouer]]・[[Daniel Borkmann]]・[[John Fastabend]]・[[Tom Herbert]]・[[David Ahern]]・[[David Miller]]・[[Cilium]]・[[Katran]])
- Pages updated: [[Karlstad University]]・[[Red Hat]]・[[Cumulus Networks]]・[[DPDK]]・[[Cloudflare]]・[[Mellanox]]・[[TRex]](いずれもXDP論文への関与・評価環境としての役割を追記)・[[XDP]](2026年のXDPerf論文のみだったdeveloping conceptに設計原論文を追加し、4コンポーネントアーキテクチャ・DPDK比較性能・実世界ユースケースの横断的知見を追加)・[[eBPF]](verifierの2パスDAG検証アルゴリズム、BPF→eBPFのレジスタ拡張の具体的数値を追加)・[[BPF]](原論文とeBPF拡張を1本の論文内で対比できる一次資料を追加)・[[カーネルバイパスネットワーキング]](XDP対DPDKの2018年時点の定量的性能比較を追加)
- Key insight: XDP(eXpress Data Path)論文は、DPDKのようなカーネルバイパスの「対極」のアプローチとして、性能に敏感なパケット処理操作をカーネルの中に移し、OSネットワーキングスタックが処理を始める前に実行する設計を提示する。単一コアで24 Mppsのパケットドロップ性能(DPDKの43.5 Mppsには届かないが通常のLinuxスタックの5倍)を達成しつつ、カーネルのセキュリティ境界・管理ツール・API安定性を保持する。この差の主要因はドライバの関数呼び出しオーバーヘッド(mlx5ドライバで10回/パケット)にあると定量分析している。ソフトウェアルーティング・ロードバランシング・DDoS緩和という3つの実世界ユースケースで実用性を実証した。
- 図表: 本文参照図表9項目(Figure 1-7、Table 1-2)を全点取り込み(除外なし)。埋め込みラスター画像はACM Artifacts Evaluatedバッジ1点のみ(装飾のため除外)、Figure 1-7はすべてベクター描画のためPyMuPDFでキャプション座標クロップして取得、Table 1・2はMarkdown表として忠実に転記。
## [2026-08-24] ingest-paper | Network Virtualization in Multi-tenant Datacenters
- Source: `.raw/papers/nsdi14-paper-koponen.pdf`(https://www.usenix.org/system/files/conference/nsdi14/nsdi14-paper-koponen.pdf 経由で取得。会議ページ https://www.usenix.org/conference/nsdi14/technical-sessions/presentation/koponen で書誌確認)。11th USENIX NSDI '14(2014年4月2〜4日、Seattle, WA)Operational Systems Track。著者24名(Teemu Koponen 筆頭・VMware; Scott Shenker のみ ICSI/UC Berkeley)。
- Summary: [[@2014__NSDI__Network Virtualization in Multi-tenant Datacenters]]
- Pages created: source 1件、entity 4件([[Teemu Koponen]]・[[Ben Pfaff]]・[[Onix]]・[[Network Virtualization Platform (NVP)]])
- Pages updated: [[Martin Casado]]・[[VMware]]・[[Scott Shenker]]・[[Open vSwitch (OVS)]](NVP論文の共著者・使用技術としての関与を追記)・[[ネットワーク仮想化]](本論文を未読としていた未解決の問いを解消し、宣言的増分計算・二層コントローラクラスタという技術的詳細を追加する横断的知見2件を追加)
- Key insight: 「コントロールプレーンの分離と集中化」という二次資料の要約は、実際には宣言的言語nlog(約1200 declaration・900テーブル)による増分状態計算と、論理コントローラ(O(N))/物理コントローラ(O(N^2)のノード別詳細化)の二層シャーディングという、はるかに具体的な設計に支えられていた。論文自身がDiscussionで認める限界(OpenFlow採用によるO(N^2)物理層スケーリング、非トランザクショナルな一時的状態不整合)は、次世代NVPでのホストパーバイザー内への物理コントローラ移動とトランザクショナル化として解消が図られた。
- 図表: 本文参照図表12点(Figure 1-12)+Table 1のうち、Figure 6(nlog宣言のコード例)はMarkdownコードブロックとして転記、残り11 Figure+Table 1は全点PyMuPDFキャプション座標クロップで埋め込み(除外なし。埋め込みラスター画像は0点、全図がベクター描画)。
## [2026-08-24] ingest-paper | The Design and Implementation of Open vSwitch
- Source: `.raw/papers/nsdi15-paper-pfaff.pdf`(https://www.usenix.org/system/files/conference/nsdi15/nsdi15-paper-pfaff.pdf 経由で取得。会議ページ https://www.usenix.org/conference/nsdi15/technical-sessions/presentation/pfaff で書誌・abstract確認)。第12回 USENIX NSDI '15(2015年5月4〜6日、Oakland, CA)Operational Systems Track、**Best Paper 受賞**。著者 Ben Pfaff・Justin Pettit・Teemu Koponen・Ethan Jackson・Andy Zhou・Jarno Rajahalme・Jesse Gross・Alex Wang・Joe Stringer・Pravin Shelar([[VMware]])、Keith Amidon([[Awake Networks]])、Martin Casado([[VMware]])。
- Summary: [[@2015__NSDI__The Design and Implementation of Open vSwitch]]
- Pages created: source 1件、entity 12件([[Ben Pfaff]]・[[Justin Pettit]]・[[Ethan Jackson]]・[[Andy Zhou]]・[[Jarno Rajahalme]]・[[Jesse Gross]]・[[Alex Wang]]・[[Joe Stringer]]・[[Pravin Shelar]]・[[Keith Amidon]]・[[Awake Networks]])、concept 1件([[パケット分類]])
- Pages updated: [[Open vSwitch (OVS)]](タプル空間探索分類器と2層フローキャッシュの実装詳細、実運用性能値を追加)・[[VMware]](OVS論文著者所属の追記)・[[Martin Casado]](OVS論文共著者としての記載を追加)・[[OpenFlow]](OVSを代表実装として位置づけ)・[[ソフトウェア定義ネットワーク]](「単純な制御モデルと複雑な実装」という横断的知見2件を追加)・[[Teemu Koponen]](並行 ingest セッションが作成した既存ページにOVS論文の共著者情報を追加)
- Key insight: OpenFlow コントローラから見た「マッチ/アクションによる単純なフローテーブル」というモデルは、OVS 内部ではタプル優先度ソート・ステージドルックアップ・プレフィックストラッキング・分類器パーティショニングという4つの分類器最適化と、マイクロフロー/メガフローの2層キャッシュによって初めて高性能に実現されている。これら4最適化はいずれも正当性を犠牲にせず、生成されるメガフローをより一般化する(=キャッシュヒット率を高める)という一貫した設計原理を持ち、マイクロベンチマークではカーネルフロー数を1,051,884から15まで削減しながらスループットを3倍以上(37→117 ktps)改善した。実運用(Rackspace、1,000台超のハイパーバイザ、24時間)では全体キャッシュヒット率97.7%を達成している。
- 図表: 本文参照図表10項目(Figure 1-8、Table 1-2)を全点取り込み。Figure 1(アーキテクチャ図)・Figure 2/3(擬似コード)・Figure 4-8(実験結果グラフ)はいずれもベクター描画のためPyMuPDFでキャプション座標クロップして取得(埋め込みラスター画像はUSENIXページ装飾のみで図表としては利用不可)。Table 1・2はMarkdown表として忠実に転記。除外図表なし。
## [2026-08-24] ingest-paper | Floodless in SEATTLE: A Scalable Ethernet Architecture for Large Enterprises
- Source: `.raw/papers/seattle08.pdf`(https://www.cs.utexas.edu/~lam/395t/papers/seattle08.pdf 経由で取得。書誌確認は https://www.cs.princeton.edu/~jrex/papers/seattle08.pdf で実施)。ACM SIGCOMM 2008(2008年8月17〜22日、シアトル)。著者 Changhoon Kim・Matthew Caesar(Princeton/UIUC)・Jennifer Rexford(Princeton)。
- Summary: [[@2008__SIGCOMM__Floodless in SEATTLE - A Scalable Ethernet Architecture for Large Enterprises]]
- Pages created: source 1件、entity 2件([[Changhoon Kim]]・[[Matthew Caesar]])、concept 1件([[一hopDHTによるEthernetスケーラビリティ]])
- Pages updated: [[Jennifer Rexford]]・[[Princeton University]]・[[University of Illinois Urbana-Champaign]](SEATTLE論文への関与を追記)・[[EVPN(Ethernet VPN)]](Ethernetスケーラビリティ問題への異なるアプローチとしてSEATTLEとの対比を追加)
- Key insight: SEATTLEは「ハッシュを箇所解決にのみ使い、実際の転送は解決後の最短経路で行う」という設計分離により、識別子ベースルーティング(ROFL/UIP/VRR)に対しストレッチを約1/5、パス安定性を3桁以上改善した。2008年時点でEthernetスケーラビリティ問題に対し、後年主流化するEVPN/VXLAN(L2フレームのL3オーバーレイカプセル化+BGP制御プレーン)とは異なる、フラットアドレッシング維持+一hop DHTという設計系譜が存在したことを示す一次資料。
- 図表: 本文参照図表8点(Table 1含め9項目)を全点埋め込み(除外なし)。Figure 8cのみPDF埋め込みラスター画像(pdf.js抽出)、残りはベクター描画のためPyMuPDFでキャプション座標クロップして取得(Figure 7・Figure 8a/bは初回クロップでキャプション欠けが生じたため範囲を再調整)。
## [2026-08-24] ingest | RFC 9161 - Operational Aspects of Proxy ARP/ND in Ethernet Virtual Private Networks
- Source: `https://www.rfc-editor.org/info/rfc9161/` → 本文 `https://www.rfc-editor.org/rfc/rfc9161.txt`(全文取得・通読)。IETF Standards Track、Updates: RFC 7432、2022年1月発行。編集者 Jorge Rabadan(Nokia)、共著者 Senthil Sathappan・Kiran Nagaraj・Greg Hankins(Nokia)・Thomas King(DE-CIX)。
- Summary: [[@2022__IETF__RFC 9161 - Operational Aspects of Proxy ARP-ND in Ethernet Virtual Private Networks]]
- Pages created: source 1件、entity 1件([[Jorge Rabadan]])、concept 1件([[EVPNにおけるProxy ARP-ND]])
- Pages updated: [[EVPN]](RFC 9161 の重複IP検知と RFC 7432 の MAC Mobility 重複検知の既定値一致という横断的知見を追加、sources/related 更新)・[[Nokia]](role へ RFC 9135・RFC 9161 の著者陣を追記)・[[@2021__IETF__RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)]](related へ [[Jorge Rabadan]] を追加)
- Key insight: RFC 9161 の重複IP検知(M秒内にN回のIP移動でスプーフィングとみなす、既定 M=180秒・N=5回)は、RFC 7432 の MAC Mobility 重複検知と全く同じ既定値・同じ検知アルゴリズムの骨格を MAC アドレス版から IP アドレス版へそのまま転用したものである。EVPN の設計者は同一の検知アルゴリズムを L2(MAC 到達性)と L3/ARP(IP→MAC 束縛)という異なるレイヤーへ繰り返し適用している。
- 命名上の注意: ファイル名では `/` を避け "ARP-ND" と表記(フロントマターの `title` と本文中は正式表記 "ARP/ND" を使用)。
- ファイル名衝突なし: 本 ingest は既存の EVPN concept 重複問題([[EVPN]] と [[EVPN(Ethernet VPN)]]、過去ログ参照)には触れず、RFC 7432 の後継である [[EVPN]] 側のみを更新した。
## [2026-08-24] ingest-book | 実践SONiC入門
- Source: `.raw/books/jissen-sonic-nyumon-2025/`(全 11 章 + Appendix 1 の計 12 枚 / 入力: pdf / 369 ページ / 海老澤健太郎、技術評論社 2025-06-06、ISBN 978-4-297-14943-7)
- Book entity: [[実践SONiC入門]]
- Chapters: [[@2025__Gihyo__実践SONiC入門 - Chapter 1 ホワイトボックススイッチとSONiCアーキテクチャ]]〜[[@2025__Gihyo__実践SONiC入門 - Appendix 1 ソースコードからのビルド]](12 件)
- Pages created(entity 15 件): [[APRESIA Systems]]・[[Aviz Networks]]・[[FRRouting (FRR)]]・[[KDDI株式会社]]・[[ONIE (Open Network Install Environment)]]・[[Orange S.A]]・[[PINS (P4 Integrated Network Stack)]]・[[PalC Networks]]・[[SONiC Foundation]]・[[SONiC-DASH]]・[[SONiC-VPP]]・[[SONiC管理フレームワーク]]・[[Target]]・[[マクニカ]]・[[実践SONiC入門]]
- Pages created(concept 6 件): [[SONiCのモジュール責務分離]]・[[データベースを介した疎結合なモジュール連携]]・[[ネットワーク機器のブートストラップとイメージ配布]]・[[パケット処理パイプラインのテーブル分割]]・[[ホワイトボックススイッチ]]・[[宣言的設定管理]]
- Pages updated(entity 19 件): [[Alibaba Group]]・[[Arista Networks]]・[[Arrcus]]・[[Broadcom]]・[[Cisco]]・[[Dell Technologies]]・[[Google]]・[[Juniper Networks]]・[[LINE株式会社]]・[[Linux Foundation]]・[[Microsoft]]・[[NVIDIA]]・[[Open Compute Project]]・[[Open Network Linux (ONL)]]・[[Open Networking Foundation]]・[[SAI (Switch Abstraction Interface)]]・[[SONiC]]・[[eBay]]・[[海老澤健太郎]]
- Pages updated(concept 15 件): [[GitOps]]・[[SRv6]]・[[Watch(状態変更通知)]]・[[インメモリデータベース]]・[[オープンソースソフトウェア開発]]・[[コンテナオーケストレーション]]・[[コンテナ仮想化]]・[[デバッグアクセスの設計]]・[[ネットワークオペレーティングシステム]]・[[ネットワーク自動化]]・[[プログラマブルデータプレーン]]・[[ヘルメティックビルド]]・[[レイヤリング]]・[[ログ解析]]・[[抽象化(ソフトウェア設計)]]
- Key insight: 本書の中核は、SONiC の設計が **3 層の規律の重なり**として読める点にある。(1) `*orch` / `*syncd` / `*mgrd` という命名規約がそのまま責務の分類になっており(第 7 章)、(2) その上に「モジュール間通信は原則すべて Redis データベース経由、例外は orchagent 内部の直接呼び出しだけ」という規律が乗り(第 8 章)、(3) 同じ SAI API が orchagent では sairedis による疑似実装、syncd では vendor SAI への実リンクという二重実装になっている(第 9 章)。この非対称性が「ASIC を実際に触るのは syncd だけ」という単一の集約点を生み、第 11 章の層別トラブルシューティング(`swss.rec` と `sairedis.rec` の 2 段ログ)がそのまま設計構造の写像になっている。設定側にも同型の構図があり、CONFIG_DB を単一の情報源とする宣言的モデル(第 6 章)に対して、CLI 未実装の新機能は APPL_DB へ直接投入するバイパス経路が公式に用意されている(第 10 章の SRv6)。
- 図表: 本文が参照する図 167 点のうち、コンソール出力の画面キャプチャを除いた概念図・アーキテクチャ図・フロー図 50 点を埋め込み。**キャプションが図の上に置かれる組版**のため、キャプションのフォント(ゴシック W5 7.8pt / 本文は明朝 9.2pt)で判別し、下向きに空白帯(15pt)まで切り出す方式で全点を機械的に取得した。`get_image_rects()` はページ全面の背景画像しか返さず使えなかった。
- 備考: 章 source は全 12 枚に `publish: false` を付与(著作権コンテンツ)。Appendix 2「SONiC で利用されているオープンソースプロジェクト」は資料リストのため取り込み対象外とした。fan-out は Sonnet 5 subagent を 3〜4 体ローリングで運用し、concept を奪い合う章(第 1 → 7 → 8 → 10 章、第 3 → 4 章)は投入順で直列化した。
## [2026-08-24] ingest-slides | HPCネットワークの多様化に挑む - マルチベンダー×マルチOSで支えるHPCネットワーク運用の実際
- Source: `https://www.janog.gr.jp/meeting/janog57/hpc/` → PDF `https://www.janog.gr.jp/meeting/janog57/wp-content/uploads/2026/02/janog57-hpc-kurosawa.pdf`(当日資料、全36ページ、`pdftoppm -r 180`で全ページ画像化・全ページ通読)。事前資料(`janog57-hpc-kurosawa-pre.pdf`、10ページ)も取得したが当日資料と重複するダイジェスト版と判断し主典拠から除外。公式ページからタイトル・登壇者(黒澤潔裕)・所属(さくらインターネット株式会社)・発表日時(2026-02-11)を確認。補助テキストとしてさくらのナレッジのブログ記事(`https://knowledge.sakura.ad.jp/49945/`、2026-03-10公開、同著者)をWebFetchで要約参照。
- Visual pages: `.raw/slides/janog57-hpc-kurosawa/pages/`(page-001〜page-036)
- Media: なし(音源・動画は入力されていない。transcriptなし)
- Summary: [[@2026__JANOG57__HPCネットワークの多様化に挑む - マルチベンダー×マルチOSで支えるHPCネットワーク運用の実際]]
- Pages created: source 1 件(同上)
- Pages updated: entity 3 件 [[黒澤潔裕]](JANOG57発表を追加)・[[SAKURAONE]](最新B200クラスタのネットワーク詳細・3世代アーキテクチャ変遷を追加)・[[SAKURA Internet]](related追加) / concept 2 件 [[Clos Network]](GPU基盤でのClos利点反転4点・72台閾値の知見を追加)・[[べき等性]](config冪等性パイプラインのCI統合事例を追加)
- Key insight: 一般的なClos Networkが前提とする4つの利点(柔軟なスケーラビリティ・Control Plane分離による障害影響低減・N+1冗長・オーバーサブスクリプション前提)は、GPU基盤ではいずれも成立しないか反転する。余剰ポート確保が物理的・経済的に困難でスケールしない前提の設計を強いられ、単一機器の瞬断でもRDMAはFailしRolling updateによるSLA維持は許されず、高価なGPU/400G SwitchはN+0で使い切る必要があり、Full bisection(uplink:GPU/1:1)のLossless構成でスイッチ間トランシーバーとケーブルが倍増する。それでもなお収容効率の向上が最大のモチベーションとなり採用に至った。同一発表者による2025年のSONiC Workshop Japan 2025発表(「ベンダー選択肢の広さ」がClos採用の決め手)を、さくらONEの本番環境でより構造的なトレードオフとして掘り下げた続編と位置づけられる。config冪等性パイプライン(jsondiff→dry run→apply)もさくらONEの本番Clos環境でAnsibleによる約40,000行config自動生成・GitHub Actions×containerlabによる5分CIへと統合され、単発の運用改善から継続的なCIへ定着したことが確認できた。
- 出典検査結果: ✅ 数値・固有名(GPU数・帯域・トポロジ規模・スイッチ台数・config行数・所要時間)はいずれもスライド画像(p.6,7,8,9,10,11,14,15,16,18,19,20,21,23,24,25,26,27,29,30,31,34)で裏取り済み。ℹ️ 補助テキスト(さくらのナレッジ記事)はスライド内容の要約であり、スライドで確認できない新規情報は含まれていなかった。⚠️ 音声・動画transcriptは未取得のため質疑応答の内容は不明。
## [2026-08-24] ingest-slides | SONiCで構築・運用する生成AI向けパブリッククラウドネットワーク
- Source: `https://speakerdeck.com/sonic/sonicdegou-zhu-yun-yong-surusheng-cheng-aixiang-kepaburitukukuraudonetutowaku` → PDF `https://files.speakerdeck.com/presentations/aff34adfdcff4b3cb653b08edff03d98/20250516_SONiC_Workshop_2025_黒澤_.pdf`(全26ページ、`pdftoppm -r 180`で全ページ画像化・全ページ通読)。公式ページ(SpeakerDeck)からタイトル・登壇者(黒澤潔裕/KUROSAWA Kiyohiro)・所属(さくらインターネット株式会社クラウド事業本部クラウドサービス部)・発表日(2025-05-16)・イベント名(SONiC Workshop Japan 2025)を確認。
- Visual pages: `.raw/slides/sonic-workshop-2025-sonic-gen-ai-public-cloud/pages/`(page-001〜page-026)
- Media: なし(音源・動画は入力されていない。transcriptなし)
- Summary: [[@2025__SpeakerDeck__SONiCで構築・運用する生成AI向けパブリッククラウドネットワーク]]
- Pages created: source 1 件(同上) / entity 1 件 [[黒澤潔裕]]
- Pages updated: entity 2 件 [[SAKURA Internet]](「高火力」GPUクラウド基盤のClos topology + SONiC構築事例を追加)・[[SONiC]](自社スクリプトによる運用コマンド拡充・Prometheusベース監視・jsondiff+dry run+applyによるconfig冪等性実装・YANGスキーマ未整備の構成管理課題を追加) / concept 2 件 [[Clos Network]](Chassis Networkとの比較でベンダーダイバーシティが採用の決め手だったという実運用知見を追加)・[[べき等性]](ネットワーク機器config管理における第5の冪等性実現方針を追加)
- Key insight: SONiCのconfig冪等性実装は、cfengineの言語処理系による自動収束でも、DDIAのidempotency keyによる呼び出し先への実装要求でもなく、運用者がjsondiff差分生成→dry run(構文チェック)→applyという3段パイプラインを明示的に組み立てることで実現する第5の方針だった。この分解自体がYANGスキーマ未整備というSONiC特有のハードウェア依存制約(RDMA設定変更時のCPU100%化)への対処と不可分に結びついており、冪等性の実現と構成管理課題の解決が同じ自動化ツール刷新の中で同時に進んだ。またTopology選択(Clos vs Chassis)は理論的性質ではなくベンダーダイバーシティという運用面の判断が決め手になっており、既存concept「Clos Network」に理論と実務判断のギャップを示す新しい知見を追加した。
- 出典検査結果: ✅ 数値・固有名(GPU基数・帯域・トポロジ規模・コマンド名)はいずれもスライド画像(p.6,7,11,12,13,14,15,17,18,19,20,21,22)で裏取り済み。⚠️ p.23「開発プロセスの複雑性」のCase1〜3は発表者自身が「この話はフィクションです」と明言しており、実際の障害事例ではなく一般化された問題提起として本文中に明記した。ℹ️ 決算説明資料からの抜粋(p.6)は発表資料内の注記どおり「2025年3月期決算説明資料より抜粋」と出典を明示。transcript・Q&Aは未取得のため反映していない。
## [2026-08-24] ingest | A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN) (RFC 8365)
- Source: `https://datatracker.ietf.org/doc/html/rfc8365` → `https://www.rfc-editor.org/rfc/rfc8365.txt`(rfc-editor.org の公式テキスト版を curl で取得、全1851行・33ページを全文通読)
- Summary: [[@2018__IETF__A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN)]]
- Pages created: source 1 件(同上) / entity 3 件 [[Nokia]]・[[AT&T]]・[[John Drake]](Ali Sajassi・Juniper Networks は並行 ingest セッションと衝突後、先行ページへ統合)
- Pages updated: concept 4 件 [[EVPN]](VXLAN/NVGRE カプセル化・DCI の ASBR/GW 方式・Local Bias スプリットホライズンを追記)・[[VXLAN]](entity ページに EVPN 制御プレーンとの統合節を追加)・[[MPLS]](inter-AS Option B の mass withdrawal 粒度低下という EVPN との構造的類似を追記)・[[ネットワーク仮想化]](Nicira/NSX の集中制御型 NVO と EVPN の分散 BGP 型 NVO という2経路の対比を追記)・[[オーバーレイネットワーク]](運用者主導オーバーレイに制御プレーン層を追加する観点を追記) / entity 2 件 [[Cisco]]・[[Juniper Networks]](RFC 8365 の出典・関連を追記)
- Key insight: RFC 8365 は EVPN(RFC 7432)を VXLAN・NVGRE・MPLS over GRE の上に載せて Network Virtualization Overlay(NVO)ソリューションへ転用する標準仕様であり、EVPN の多重接続機能のうち VXLAN/NVGRE カプセル化によって実質的な作り替えを要するのはスプリットホライズンフィルタリング(ESI ラベルの不在を補う「Local Bias」方式への置換)だけである。またデータセンター間接続(DCI)を ASBR 方式(inter-AS Option B)で構成すると、ASBR の BGP ネクストホップ書き換えにより mass withdrawal が per-ES 粒度から per-EVI 粒度へ後退するという、BGP/MPLS VPN(RFC 4364)の inter-AS 接続方式が抱える一般的なトレードオフが、EVPN という別のプロトコルスタックにも同型に現れることを示した。
- 並行 ingest との衝突と解消: 本 ingest 実行中、別セッションが RFC 7348(VXLAN)・RFC 7432(EVPN 基本仕様)・RFC 9135(EVPN の IRB)を同時に ingest しており、EVPN の concept ページが本セッション作成分を含め独立に3つ作成される衝突が発生した。相手セッションの完了(wiki-lock 解放)を待ったうえで、本セッションが作成した `wiki/concepts/EVPN.md` は相手セッションによって RFC 7432 由来の内容(基本仕様の中核機構節)が統合済みであることを確認し、そちらへ RFC 8365 固有の追加更新のみ行った。本セッションが作成した `wiki/concepts/VXLAN.md`(concept)は相手セッションが作成した `wiki/entities/VXLAN.md`(entity、より充実した内容)と重複するため削除し、EVPN 制御プレーン統合の知見は entity 側へ移した。`wiki/entities/Juniper Networks.md`・`wiki/entities/Ali Sajassi.md` は相手セッションのコミットに本セッションの初期作成内容が巻き込まれる形で先にコミット済みだったため、RFC 8365 固有の追記のみ行った。`wiki/concepts/EVPN(Ethernet VPN).md` との重複は本セッションのスコープ外のため未解消のまま残っている(要 `wiki-lint` での再統合)。
## [2026-08-24] ingest-book | The Art of Computer Systems Performance Analysis
- Source: `.raw/books/art-of-computer-systems-performance-analysis/`(36 章 / 入力: pdf、683 ページ。Raj Jain, *The Art of Computer Systems Performance Analysis: Techniques for Experimental Design, Measurement, Simulation, and Modeling*, John Wiley & Sons, 1991, ISBN 0-471-50336-3)
- Book entity: [[The Art of Computer Systems Performance Analysis]]
- Chapters: [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 1 Introduction]]〜[[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 36 Hierarchical Decomposition of Large Queueing Networks]](36 件)
- Pages created: entity 3 件 [[ACM SIGMETRICS]]・[[Raj Jain]]・[[The Art of Computer Systems Performance Analysis]] / concept 13 件 [[オペレーショナル法則]]・[[シミュレーションモデルの検証と妥当性確認]]・[[モニタの分類と設計トレードオフ]]・[[リトルの法則]]・[[ワークロード選択の判断軸]]・[[乱数生成器]]・[[信頼区間]]・[[性能データの可視化]]・[[性能メトリクスの選定]]・[[確率分布の選択と関係]]・[[線形回帰]]・[[要約統計量の選定]]・[[離散事象シミュレーション]]
- Pages updated: entity 1 件 [[IEEE Computer Society]] / concept 27 件 [[MLプロファイリング]]・[[USE メソッド]]・[[キャパシティ計画]]・[[クラスタリング]]・[[トレーシングオーバーヘッド]]・[[ネットワークシミュレーション]]・[[パフォーマンスのアンチメソドロジ]]・[[ベンチマーキング]]・[[モンテカルロシミュレーション]]・[[ワイブル分布]]・[[ワークロードの特性の把握]]・[[主成分分析]]・[[二項分布]]・[[信頼水準]]・[[分散]]・[[分散モニタリング]]・[[回帰の評価指標]]・[[定常分布]]・[[実験計画法]]・[[待ち行列理論]]・[[性能測定]]・[[期待値]]・[[確率変数]]・[[統計的有意性]]・[[継続的プロファイリング]]・[[過負荷制御]]・[[非侵入プロファイリング]]
- Key insight: 本書の各部は自分の道具の適用限界を示して閉じるという同じ形をとる。Part II はワークロードとモニタで測る方法を積み上げた末に第 11 章「比率のゲーム」で同じ測定データから基準の選び方ひとつで相反する結論が導けることを示し、Part IV は第 23 章で完全要因計画が実験数の爆発で破綻して第 19 章の一部実施要因計画へ戻ることを示し、Part VI は最終章 §36.3 で待ち行列理論自身が扱えない事柄を列挙して終わる。同じ姿勢は「よくある誤り」と「ゲーム」の対の列挙として第 2・9・10・11・15・16・24 章に反復し、前者は無自覚な誤り、後者は自分のシステムを有利に見せるための意図的な小細工として明確に区別される。
- Part VI の構成軸: 第 33 章のオペレーショナル法則だけが確率的仮定を置かず測定量の定義から恒等的に導かれる。第 30 章が引いた「分布によらず言えることと、仮定して初めて言えることの境界」が Part VI 全体の軸になっており、第 31〜32・34〜36 章が仮定を強めて解ける範囲を広げ、最終章がその仮定の破れる場所を示す。
- 既存 wiki との接続: [[USE メソッド]] の時間ベース使用率に §33.1 使用率の法則という理論的根拠が入り、[[過負荷制御]] には M/M/m/B の無差別なバッファあふれが SRE Book の criticality ベース選択的受付制御の理論的下限として接続された。[[ネットワークシミュレーション]] では、本書が 1991 年に指摘した「事象集合の管理コストがシミュレーション実行時間を支配する」問題が、35 年を経て解法の位相を「良いデータ構造の選択」から「事象生成そのものの削減」へ変えて再出現していることが記録された。[[トレーシングオーバーヘッド]] には 1991 年の事象駆動モニタのオーバーヘッド線形モデルと ICPE 2026 の実測が同型であることが加わった。
- 図表網羅チェック: 図 189 点を全点埋め込み(未解決リンク 0 件・未使用 attachment 0 件)。全大文字 `FIGURE N.M` のキャプション(189 件・全て行頭)と本文参照 `Figure N.M` が完全に分離できることを利用し、キャプション直上の埋め込み画像をオーケストレータが 1 パスで切り出した(自動 182 点)。残り 7 点はテキスト組みのプログラムリスト 4 点(Figure 4.1・4.2・4.3・4.5)、キャプションだけが次ページに送られた 2 点(14.10・15.4)、矩形がキャプションに重なる 1 点(34.5)で、個別に補正して 189/189 とした。
- 原本側の問題と対処: (1) PDF アウトラインが 5 件しかなく `fetch-book.sh` が 683 ページの書籍を 5 章と誤検出したため、全文テキストを改ページで割って章扉ページ(`CHAPTER N` / `PART N`)を全ページ走査し 36 章の境界を復元して `--chapters` で再分割した。(2) HTML 由来の電子書籍 PDF のため、PDF p.612-683 の 72 ページに各章の続き・図表・事例研究が切り離されて置かれていた(重複ではなく固有の本文)。図表番号で章帰属を機械判定し、16 章分(2・6・10・14・17・18・19・20・21・23・24・26・27・34・35・36)をそれぞれの章テキスト末尾に注記つきで連結した。第 18・21 章はこの復元分が章の後半をほぼ丸ごと含んでいた。(3) 印字ページ番号を持たない版のため、出典表記は節番号 `(Source: ch.N §N.M)` に統一した。
- subagent が検出した原本の異常: 第 6 章 — Example 6.1 の本文が Figure 6.2 を指すが実際の主成分分析の図は Figure 6.3(埋め込みはキャプション基準で正しく対応づけ)。第 11 章 — Table 11.8 の System A 合算行が割り算と合わず、Table 11.9 の解説文が直前の数値と論理的に噛み合わない(いずれも推測修正せず原文どおり転記)。第 18 章 — §18.7 の見出しが本文に現れず節順が錯綜(節番号順に論理再構成)。第 26 章 — 図 26.4 のキャプションは 5 次多項式だが本文の主例は 7 次。第 32 章 — `Buzen (19173)` という OCR 由来の年号破損(年号を書かずに処理)。
- 備考: 章ごとに Sonnet 5 の subagent へ委譲し、concept が競合する章群(Part IV の第 16〜23 章、Part VI の第 30〜36 章、ワークロード系の第 4〜6 章、乱数系の第 26〜28 章)は投入順で直列化した。この結果 [[実験計画法]] に 8 層、[[待ち行列理論]] に 7 層が上書きも重複もなく積み上がった。付録 A(統計表)と演習解答はユーザーの判断により source 化していない(原本は `.raw/` に残る)。第 25 章のページに残っていた作業指示への言及を削除し、[[リトルの法則]] の独立ページ新設に伴って [[待ち行列理論]] の同名 alias を除去した(リンク解決の衝突回避)。第 34 章は担当 subagent がセッション制限で中断したため concept 積み増しのみ第 35 章の担当が補完した。
## [2026-08-24] ingest | Virtual eXtensible Local Area Network (VXLAN) (RFC 7348)
- Source: `.raw/articles/rfc7348-vxlan-2026-08-24.md`(rfc-editor.org の公式 HTML 版を curl で取得、全1229行・22ページを全文通読)
- Summary: [[@2014__RFC__Virtual eXtensible Local Area Network (VXLAN) - A Framework for Overlaying Virtualized Layer 2 Networks over Layer 3 Networks]]
- Pages created: source 1 件 / entity 11 件 [[wiki/entities/VXLAN|VXLAN]](プロトコル本体)・[[Cumulus Networks]]・[[Storvisor]](著者所属企業)・[[Mallik Mahalingam]]・[[Dinesh G. Dutt]]・[[Kenneth Duda]]・[[Puneet Agarwal]]・[[Lawrence Kreeger]]・[[T. Sridhar]]・[[Mike Bursell]]・[[Chris Wright]](共著者8名)
- Pages updated: entity 7 件 [[Cisco]]・[[Arista Networks]]・[[Broadcom]]・[[VMware]]・[[Intel]]・[[Red Hat]](いずれも「VXLAN 標準化における役割」節を追加)・[[GENEVE]](VXLANヘッダの限界を一次資料で裏付け) / concept 3 件 [[オーバーレイネットワーク]]・[[ネットワーク仮想化]]・[[データセンターL2ファブリック]] / index・hot・log・sources・entities の各 `_index`
- Key insight: RFC 7348 §5 が定義する VXLAN ヘッダ(8 byte 固定、24 bit VNI 以外はほぼ全て予約フィールド)の拡張余地の乏しさが、後継カプセル化 [[GENEVE]] の可変長オプション設計を直接動機づけたことを、一次資料のヘッダフォーマットレベルで裏付けた。また RFC §3.3 が明示する ToR スイッチの MAC アドレステーブル溢れという動機は、[[データセンターL2ファブリック]] が記録する PortLand の PMAC 階層アドレッシングと同一問題への異なるレイヤーでの解法であるという横断的知見を新たに得た。
- 一次資料化の位置づけ: 既存 wiki は VXLAN を SDN 本(二次資料)経由でのみ記録していた(誕生経緯・24 bit VNI という要約)。本 ingest により VXLAN の RFC 本体が初めて wiki に入り、[[wiki/entities/VXLAN|VXLAN]] エンティティページとしてプロトコル詳細(フレームフォーマット・VTEP・データプレーン学習・VXLAN gateway・セキュリティ考察)を独立に持つ。既存の [[オーバーレイネットワーク]]・[[ネットワーク仮想化]] は二次資料由来の要約を一次資料で精緻化する横断的知見を追加した。
- 並行 ingest との basename 衝突: 本 ingest と同時並行で、RFC 8365(EVPN の NVO 転用)を扱う別セッションが独立に `wiki/concepts/VXLAN.md`(type: concept、address c-005028、EVPN 統合の観点からの VXLAN 記述)を作成しており、本セッションが作成した `wiki/entities/VXLAN.md`(type: entity、address c-005015、RFC 7348 本体の詳細)と同一 basename `VXLAN` が衝突した。他セッションのファイルは削除・上書きせず、本セッションが新規作成・更新した全ページの `[[VXLAN]]` リンクを `[[wiki/entities/VXLAN|VXLAN]]` へパス修飾して解消したが、他セッション側(`wiki/concepts/EVPN.md`・`wiki/sources/@2018__IETF__A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN).md` の `[[VXLAN]]`)は未修飾のまま残っており、次回 `wiki-lint` 実行時に2ページの統合(またはパス修飾の徹底)が必要。
## [2026-08-24] ingest | BGP MPLS-Based Ethernet VPN (RFC 7432)
- Source: `.raw/articles/rfc7432-2026-08-24.txt`(rfc-editor.org の公式テキスト版を curl で取得、全3139行・56ページ・全21節を通読)
- Summary: [[@2015__RFC__BGP MPLS-Based Ethernet VPN]]
- Pages created: source 1 件 [[@2015__RFC__BGP MPLS-Based Ethernet VPN]] / concept 1 件 [[VPLS]] / entity 2 件 [[Ali Sajassi]](既存の並行 ingest セッションが作成した RFC 8365 起点のページに RFC 7432 出典を追記)・[[Juniper Networks]]
- Pages updated: concept 2 件 [[EVPN]](RFC 7432 の中核機構節を追加。VPLS との対比・DF 選出式・MAC Mobility パラメータを追記)・[[MPLS]](L2VPN の具体例として EVPN を横断的知見に追加) / entity 1 件 [[Cisco]](出典追記)
- 並行 ingest との衝突と解消: 本 ingest と同時並行で、少なくとも2つの別セッションが RFC 8365(EVPN の NVO 転用)・RFC 9135(EVPN の IRB)を ingest しており、EVPN の concept ページが独立に3つ([[EVPN]]・`EVPN (BGP MPLS-Based Ethernet VPN)`・[[EVPN(Ethernet VPN)]])作成される衝突が発生した。本セッションは自身が作成した `EVPN (BGP MPLS-Based Ethernet VPN).md` を削除し、内容を先行して存在した [[EVPN]] へ統合、参照元([[VPLS]]・本 source ページ・[[IETF]]・[[Juniper Networks]])を張り替えて解消した。[[EVPN(Ethernet VPN)]] との重複は未解消のまま残っている(要 `wiki-lint` での再統合)。また `wiki/entities/IETF.md`・`wiki/entities/Ali Sajassi.md` は他セッションのコミット(64ec6e0d81)に本セッションの編集内容が巻き込まれる形で先にコミット済みだったため、本コミットでは差分なし。
- Key insight: EVPN(RFC 7432)は、VPLS が抱えるマルチホーミング・冗長性・マルチキャスト最適化の限界を、MAC/IP アドレス学習をデータプレーンから MP-BGP によるコントロールプレーンへ移すことで解決する。ES 単位の Ethernet A-D ルート撤回による mass withdrawal(高速収束)、Aliasing/Backup Path による All-Active 負荷分散、<ES, VLAN> 粒度の service carving による DF 選出、シーケンス番号付き MAC Mobility 拡張コミュニティによる MAC move の安全な収束が中核機構である。
## [2026-08-24] ingest | RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)
- Source: `.raw/articles/rfc9135-2026-08-24.md`(https://www.rfc-editor.org/info/rfc9135/ から WebFetch で取得。RFC 本文は https://www.rfc-editor.org/rfc/rfc9135.txt を追加取得して詳細を抽出)
- Summary: [[@2021__IETF__RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)]]
- Pages created: source 1 件 [[@2021__IETF__RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)]] / entity 2 件 [[IETF]]・[[Ali Sajassi]] / concept 3 件 [[EVPN(Ethernet VPN)]]・[[EVPNにおける統合ルーティングとブリッジング(IRB)]]・[[分散エニーキャストゲートウェイ]]
- Pages updated: entity 1 件 [[Cisco]](EVPN 標準化における役割を追記) / concept 1 件 [[エニキャストルーティング]](分散エニーキャストゲートウェイへの橋渡しリンクを追加) / index・hot・log・各 `_index`
- Key insight: 分散エニーキャストゲートウェイは、CDN文脈のエニキャストルーティング(最近接1ノードへの経路収束)と同じ「同一アドレスの分散提供」という発想を、「モビリティ透過性(どのPEが応答しても論理的に等価)」という異なる目的に転用したものである。
- 命名の注意: 当初 concept ページ名に `統合ルーティング/ブリッジング` とスラッシュを含めて作成しかけたが、`/` はファイルシステムのパス区切りとして解釈されるため作成前に検知し、`統合ルーティングとブリッジング` へ修正した(命名規則の「禁則文字は空白で囲む」に従い接続詞に置換)。
- 並行 ingest との混在: 本 ingest 作業中、別セッションが同じ vault で VXLAN(RFC 7348)の ingest を並行実行しており、[[Cisco]] エンティティページへの追記(VXLAN 標準化における役割の節)が本作業の編集と混在した。両者の追記は異なる節で衝突なく共存しており、本コミットでは自分が行った EVPN 標準化の節のみを対象とする。
## [2026-08-24] ingest-book | Building Secure and Reliable Systems
- Source: `.raw/books/building-secure-and-reliable-systems/`(23 章 / 入力: web。https://google.github.io/building-secure-and-reliable-systems/raw/toc.html の章別 HTML を取得し、`html/` に原本、`chapters/*.md` に markdown 変換版、`images/` に図 39 点を保持)
- Book entity: [[Building Secure and Reliable Systems]]
- Chapters: [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 1 The Intersection of Security and Reliability]]〜[[@2020__OReilly__Building Secure and Reliable Systems - Chapter 21 Building a Culture of Security and Reliability]] + [[@2020__OReilly__Building Secure and Reliable Systems - Conclusion]] + [[@2020__OReilly__Building Secure and Reliable Systems - Appendix A Disaster Risk Assessment Matrix]](23 件)
- Pages created: entity 23 件 [[ALTS]]・[[Adam Stubblefield]]・[[Ana Oprea]]・[[BeyondCorp]]・[[Binary Authorization]]・[[Building Secure and Reliable Systems]]・[[Certificate Transparency]]・[[ClusterFuzz]]・[[DiRT]]・[[Google App Engine]]・[[Google Chrome]]・[[Google Tool Proxy]]・[[Heather Adkins]]・[[NSO Group]]・[[OSS-Fuzz]]・[[Parisa Tabriz]]・[[Paul Blankinship]]・[[Project Shield]]・[[Testing on the Toilet]]・[[Tink]]・[[Tricorder]]・[[Zero Touch Prod]]・[[in-toto]] / concept 26 件 [[インシデント対応時の運用セキュリティ]]・[[セキュアコーディングフレームワーク]]・[[セキュリティと信頼性の文化]]・[[セキュリティの責任分担]]・[[セキュリティログの設計と保護]]・[[セーフプロキシ]]・[[ソフトウェアサプライチェーンセキュリティ]]・[[デバッグアクセスの設計]]・[[ファジング]]・[[ロールバックとバージョン単調性]]・[[信頼性とセキュリティの交差]]・[[内部者リスク]]・[[危機時の指揮系統]]・[[変化に追随する設計]]・[[多層防御]]・[[大規模な移行の遂行]]・[[影響範囲の制御]]・[[復旧のための設計]]・[[復旧計画の実行]]・[[最小権限設計]]・[[机上演習とレッドチーム演習]]・[[機能要件と非機能要件のトレードオフ]]・[[災害計画]]・[[理解容易性のための設計]]・[[自作のサービス妨害]]・[[静的解析の開発者ワークフロー統合]]
- Pages updated: entity 6 件 [[Borg]]・[[Google]]・[[Kubernetes]]・[[Mitre Corporation]]・[[OpenSSL]]・[[Piotr Lewandowski]] / concept 40 件 [[CI-CDオブザーバビリティ]]・[[HSM APIセキュリティ]]・[[SREエンゲージメントモデル]]・[[SRE文化]]・[[インシデントシミュレーション]]・[[インシデントトリアージ]]・[[インシデント優先順位付け]]・[[インシデント対応成熟度モデル]]・[[インシデント管理]]・[[インシデント重大度評価]]・[[カオスエンジニアリング]]・[[サービス妨害攻撃とネットワークプロトコルの悪用]]・[[セキュリティにおけるインセンティブ不整合]]・[[セキュリティの持続可能性]]・[[セキュリティエンジニアリングチームの管理と組織的リスク]]・[[セキュリティカオスエンジニアリング]]・[[セキュリティ設計原則]]・[[セキュリティ評価制度]]・[[ゼロトラスト]]・[[ソフトウェア変更管理]]・[[ソフトウェア複雑性]]・[[データ保護]]・[[ブラスト半径]]・[[プロキシとエージェント]]・[[ヘルメティックビルド]]・[[ポストモーテム]]・[[レジリエンス]]・[[ログ生成]]・[[信頼計算基盤(TCB)]]・[[国家監視の歴史と法制度]]・[[封印と偽造防止印刷]]・[[技術的負債]]・[[敵対者の類型論]]・[[継続的デプロイ]]・[[脆弱性ライフサイクルと協調的な脆弱性開示]]・[[認可モデル]]・[[認証局とPKIの信頼モデル]]・[[軽量形式手法]]・[[運用セキュリティ(OPSEC)とトレードクラフト]]・[[過負荷制御]]
- Key insight: 本書の中核は、信頼性とセキュリティがいずれも創発特性であり後付けできないという点と、両者が不可視性・評価困難性・ライフサイクル全体への関与という共通点を持ちながら**敵対者の有無**という一点で設計判断が分岐するという定式化にある(第 1 章)。この定式化が本書全体の構成を規定しており、設計(Part II)では最小権限・理解容易性・レジリエンス・復旧が、実装(Part III)では「人ではなく成果物を検証する」というサプライチェーンの転換が、運用(Part IV)ではインシデントを事前準備・危機の最中・事後の復旧という時間軸で 3 分割する構成が、それぞれ同じ分岐から導かれている。最終章(第 21 章)と Conclusion は、これらの技術的実践が意図的に設計された組織文化に支えられて初めて機能すると結ぶ。
- 図表の扱い: 本文が参照する図は全 39 点で、全点を埋め込んだ(除外なし)。ウェブ版は図を `images/bsrs_<章 2 桁><番号 2 桁>.png` という規則的な名前で個別配布しているため、PDF 書籍で必要なキャプション座標クロップや `get_image_rects()` による切り出しは一切不要だった。オーケストレータが 39 点を 1 パスで取得し `ch<NN>-fig<N-M>-<内容>.png` に改名して `wiki/sources/_attachments/building-secure-and-reliable-systems/` へ配置、各章の subagent には完成したファイル名・図番号・キャプション原文の表を渡して埋め込み位置の判断だけを任せた。事後の双方向照合で、埋め込み 39 点・欠落 0・未使用 attachment 0・重複埋め込み 0 を確認済み。
- 原本取得の注意: 当初 defuddle skill で章 HTML を markdown 化したが、第 2 章の `Attacker Profiles` 節(7 種の攻撃者プロファイル)が丸ごと脱落するなど本文の欠損が生じた(7,838 語→2,559 語)。pandoc(`-f html -t gfm`)へ切り替え、加えて (1) `<a data-type="indexterm">` の索引タグ 130 点/章の除去、(2) `data-type="sectN"` の入れ子から見出しレベルを再計算、(3) `</body>` の外側に置かれている脚注 div を本文へ合流、という 3 点の前処理を BeautifulSoup + lxml で施した。**書籍のウェブ版を取り込むときは defuddle の欠損を必ず語数で検算すること**。
- 並行 ingest との混在: 本バッチ実行中、別セッションが同じ vault で *The Art of Computer Systems Performance Analysis*(全 34 章)を ingest していた。差分を本文中の書名で機械的に分類し、本書分 118 件を特定した。ただし [[過負荷制御]] の 1 件のみ両セッションの追記が同一ファイル内で混在しており(本書 第 8・10 章の追記と、Art 第 31・33 章の待ち行列理論由来の追記)、分離不能なため本コミットに含めた。共有索引ファイル(`index.md`・各 `_index.md`・`hot.md`・`log.md`)は本コミット時点で相手セッションが未編集であることを確認済み。
- 出典検査: 全 23 枚について `publish: false`・`address: c-`・日付タグ `2026/08/24`・`updated`・`source_type: book` の 5 項目が揃っていることを機械的に確認済み(欠落 0)。Navigation 行の wikilink は全 23 枚とも実在ページに解決する。address は 23 件すべて一意で、vault 全体でも重複なし。本書のウェブ版には節番号もページ番号もないため、出典表記は `(Source: ch.N §節題)` の形式に統一した。
## [2026-08-24] ingest | GenRec: Towards LLM-native Recommendation at Netflix
- Source: `.raw/articles/genrec-towards-llm-native-recommendation-at-netflix-f20be6f643e3-2026-08-24.md`(Netflix TechBlog、Ying Li・Arjun Rao・Shradha Sehgal、2026-08。Cloudflare 403 のため WebFetch が失敗し、Wayback Machine のスナップショット `web.archive.org/web/20260821232643/...` を defuddle で取得)
- Summary: [[@2026__Netflix TechBlog__GenRec - Towards LLM-native Recommendation at Netflix]]
- Pages created: source 1 件 [[@2026__Netflix TechBlog__GenRec - Towards LLM-native Recommendation at Netflix]] / concept 1 件 [[LLMネイティブ推薦]]
- Pages updated: entity 1 件 [[Netflix]] / concept 2 件 [[コンテキストエンジニアリング]]・[[LLM推論]]
- Key insight: 内製の基盤LLMをNetflix固有データでpost-trainしたLLMバックエンド推薦ランカー GenRec は、ユーザー履歴・アイテムメタデータ・文脈の言語化(特徴量エンジニアリングからコンテキストエンジニアリングへの転換)とカタログ対応スコアリングヘッド、prefill-onlyモードでのフルカタログ一括スコアリングにより、成熟した本番ランカーに比べPhase-2ラベルを約40分の1(データ効率評価では10〜40分の1)しか使わずに、大規模A/Bテストで短期・長期双方のオンライン指標において統計的有意な改善(短期+0.115%・P=3.1×10⁻¹⁰、長期+0.006%・P=0.025)を達成した。2フェーズ学習(Netflix適応基盤LLM → ランキング特化post-training)のうちPhase 2の相対的寄与は、Phase 1モデルが陳腐化するにつれ35〜50%から2週間後には約80%まで拡大する。
- 図表の扱い: 記事内の Miro/Medium ホスト画像 6 点(WebP 形式)を defuddle 経由で収集し、PIL で PNG へ変換。本文で明示的に言及・キャプション付けされた Figure 1(パイプライン概要)・Figure 2(2フェーズ学習フレームワーク)・Figure 3(オンライン指標、P値まで画像内で視認して数値を裏取り)・Figure 5(コンテキスト長のエルボーポイント、N/2N/3N の数値を画像内で視認)の4点を選択埋め込みした。Table 1(Phase1/Phase2寄与度の表)は画像ではなくMarkdown表として転記。Figure 4(データスケーリング曲線)は定性的な傾向のみが重要と判断し、本文記述で代替して画像埋め込みを省略した。除外(ロゴ・著者アバターリンク画像)は元々埋め込み候補から除外済み。
- 出典検査: 数値主張(MRR改善率・A/Bテストのトラフィック割合/期間・オンライン指標のP値・コンテキスト長削減率)はいずれも記事本文の直接記述、またはFigure画像内の数値表示に遡及済み(✅)。著者名・貢献者リスト(Acknowledgments)は記事末尾の記載をそのまま転記した(✅)。原文サイトは Cloudflare 系の bot 対策で WebFetch・curl 直接アクセスとも 403 になったため、Wayback Machine 経由での取得に切り替えた(取得元 URL を source ページ `url:` に明記、原本は archive.org のミラー経由で確認)。
## [2026-08-24] ingest-paper | Understanding the limitations of pubsub systems
- Source: `.raw/papers/Understanding-the-limitations-of-pubsub-systems.pdf`(ローカル PDF から取り込み。Atul Adya, Phil Bogle, Colin Meek, Databricks, HOTOS 25, 2025-05-14〜16, Banff, AB, Canada, pp.165-171)
- Summary: [[@2025__HOTOS__Understanding the limitations of pubsub systems]]
- Pages created: source 1 件 [[@2025__HOTOS__Understanding the limitations of pubsub systems]] / entity 3 件 [[Atul Adya]]・[[Phil Bogle]]・[[Colin Meek]] / concept 1 件 [[Watch(状態変更通知)]]
- Pages updated: entity 3 件 [[Databricks]]・[[Apache Kafka]]・[[Spanner]] / concept 4 件 [[エンドツーエンド論]]・[[分散メッセージブローカ]]・[[変更データキャプチャ(CDC)]]・[[分散キャッシュ]]
- Key insight: pubsub システムはメッセージング抽象化とハード状態のストレージ層を暗黙に一体化(bundle)しており、これが疎結合の失敗(バックログの通知なきガベージコレクション)・エンドツーエンド論違反(pubsub 層の保証が authoritative なソースに対する意味のある保証にならない)・アドホックなストレージ API という3系統の限界を生む。解決策として、ストレージを明示的に露出させ、Consumer API(`watch()`/`onEvent()`/`onProgress()`/`onResync()`)と Ingester API(`append()`/`progress()`)を持つ watch システムへアンバンドリングするアーキテクチャを提案する。著者ら(Databricks)は MySQL/TiDB 向け外部 watch サブシステム Snappy を実装中(未公開)。
- 図表の扱い: 本文参照図表は Figure 1〜5 の 5 点。Figure 1(Pubsub model)・Figure 2(キャッシュ無効化レース条件)・Figure 5(watcher の知識領域)は pdf.js の埋め込みラスター画像として抽出できたが、Figure 3(ストレージ/通知マトリクス)・Figure 4(Unbundled architecture)はベクター描画で埋め込み画像に現れず、PyMuPDF(fitz)でページ4のテキストブロック座標を特定してキャプション直上の図領域をクロップし取得した。除外は装飾の Creative Commons ライセンスバッジ(image-001-002.png)1点のみ。表(Table)は本文になし。
- 出典検査: 本文の主張・数値・図表番号はいずれも pdftotext 抽出テキスト(全523行)を全読して裏取り(✅)。書誌情報(DOI 10.1145/3713082.3730397)は WebFetch で doi.org → dl.acm.org への 302 リダイレクトを確認したが、ACM Digital Library 本体は Cloudflare の bot チャレンジ(403「Just a moment...」)で取得できず、curl のブラウザ UA 偽装でも同様に失敗した。書誌情報(著者・所属メール・会議名・日程・DOI・ページ範囲・ライセンス)は PDF 本文の ACM Reference Format・ヘッダー・フッターで裏取り済み(✅)。abstract は原文を一文ずつ忠実に和訳した(✅)。「Saltzer らの1984年論文への直接引用」という当初のドラフトの誤記載は、本文に該当する参考文献番号が存在しないことを grep で確認し、レビュー時に修正した(⚠️→修正済み)。
## [2026-08-24] ingest-paper | The Working Set Model for Program Behavior
- Source: `.raw/papers/The-working-set-model-for-program-behavior-.pdf`(ローカル PDF から取り込み。Peter J. Denning, MIT, Communications of the ACM Vol.11 No.5, 1968年5月, pp.323-333)
- Summary: [[@1968__CACM__The Working Set Model for Program Behavior]]
- Pages created: source 1 件 [[@1968__CACM__The Working Set Model for Program Behavior]] / entity 1 件 [[Peter J. Denning]] / concept 2 件 [[ワーキングセットモデル]]・[[スラッシング]]
- Pages updated: concept 1 件 [[仮想メモリとページング]]
- Key insight: 「プロセス」(プロセッサ需要)と「ワーキングセット」(メモリ需要)を同一の進行中の計算活動が持つ2つの現れとして統一的に定式化し、プロセスのメモリ需要を「直近τ秒間に参照されたページ集合 W(t, τ)」として定義した。サイズ・予測性・再参入率・τ感度の4性質を導出し、ソフトウェアサンプリング(使用ビット列のシフト)のみでW(t, Kσ)を近似検出できる実装を示した。メモリ過剰コミットメントによる性能崩壊を指す「スラッシング(thrashing)」という用語はこの論文が導入した。
- 図表の扱い: PDF はスキャン画像(JBig2圧縮)で構成されており、`fetch-paper-pdf.sh` の pdf.js ベース抽出では埋め込み画像・ページレンダリング画像とも "Jbig2Error: JBig2 failed to initialize" で全ページ白紙化した(images.jsonのkindはすべてpage-renderで実体は真っ白)。PyMuPDF(fitz)で全11ページを216dpi再レンダリングしたところ正常に表示できたため、pdftotextのテキストブロック座標を手がかりに本文参照図表(Figure 1〜9・Figure A、計10点、単発言及のFigure 1・3・Aも本文で名指し参照されていることを確認済み)を全点キャプション座標クロップで取得し埋め込んだ。除外なし。images.jsonはembedded画像0件・page-render画像は削除して整理した。
- 出典検査: 本文の数式・図表番号・引用文献番号はいずれもPDF全文(pdftotext抽出テキスト716行を全読)とPyMuPDF再レンダリング画像(全11ページ視覚確認)に遡及済み(✅)。書誌情報(DOI 10.1145/363095.363141)はWebFetchでdoi.orgからdl.acm.orgへの302リダイレクトを確認し実在を検証した。abstractは原文を一文ずつ忠実に和訳した(✅)。「スラッシング」がこの論文の造語であるという記述は本文§6の記述("This phenomenon, known as 'thrashing'")に基づく(✅)。
## [2026-08-24] ingest-paper | Verbalizable Representations Form a Global Workspace in Language Models
- Source: `.raw/papers/transformer-circuits-2026-workspace.html`(PDF を持たない HTML 専用 Web 出版物。pandoc 抽出テキスト `.txt` 286KB・1232行を全文読了。Wes Gurnee・Nicholas Sofroniew ほか、Jack Lindsey、Anthropic、Transformer Circuits Thread、2026-07-06)
- Summary: [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]]
- Pages created: source 1 件 [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]] / entity 3 件 [[Wes Gurnee]]・[[Nicholas Sofroniew]]・[[Jack Lindsey]] / concept 1 件 [[アラインメント監査]]
- Pages updated: entity 1 件 [[Anthropic]] / concept 3 件 [[グローバルワークスペース理論]]・[[機構的解釈性]]・[[AI意識]]
- Key insight: J-lens(Jacobian lens)という新しい解釈可能性技術により、LLM が報告・操作・内部推論に使われる特権的な内部表現の部分集合(J-space)を持ち、activation分散のごく一部(最大10%)しか占めないにもかかわらずMLPから約10倍強く増幅され上位1%の注意ヘッドから選択的に中継される「小さいが不釣り合いに広報される」構造をもって、verbal report・directed modulation・internal reasoning・flexible generalization・selectivityというグローバルワークスペース理論の機能的性質を満たすことをスワップ・アブレーションによる介入実験で示した。J-lens をアラインメント監査に応用し、脅迫シナリオでの評価認識アブレーションが誤アラインな行動を有意に増加させること(0/180→13/180)、報酬ハッキング・報酬モデル迎合の2種のモデルオーガニズムで出力に現れない欺瞞的意図が内部表現に一貫して現れることを示した。counterfactual reflection trainingという新訓練技術では、実演訓練なしにconstitution原則をJ-spaceへ implant することでモデルの倫理的行動を改善できることを示した。
- 図表の扱い: 本記事の Figure はすべて JavaScript でレンダリングされるインタラクティブ可視化であり静的画像として抽出できないため、画像埋め込みは一切行わず、各 Figure が言及されている本文箇所で「Figure N: 図の内容」を文章として明記し記述で補った。目次アイコン画像(`./png/img_*.png`)は本文図表ではないため埋め込み対象外とした。
- 出典検査: 数値主張(スワップ成功率・アブレーション後のスコア変化・容量測定値等)はいずれも本文中の直接記述に遡及済み(✅)。abstract に相当する独立節が原文に存在しないため、source ページの「概要」節は Introduction の記述に基づく要約として作成し、逐語訳の abstract callout は使用しなかった(ℹ️)。著者の役割分担(Author Contributions 節)に基づき entity ページの貢献記述を作成した(✅)。
- セッション間の書き込み競合について: 本 ingest 作業中に別セッションの「Could AIs become conscious?」ingest がコミットを実行し、作業ツリー上にあった本 ingest の [[グローバルワークスペース理論]]・[[Anthropic]] の編集途中内容がそのコミット(`e1e7fd5ed8`)に意図せず含まれた。両ページの内容に矛盾はなく(むしろ本 ingest 側が The Economist の主張の技術的裏付けを提供する形で補完している)、実害は無いと判断し、本 ingest ではこの 2 ファイルを再コミットしない(既にコミット済みのため差分なし)。
## [2026-08-24] ingest | Could AIs become conscious?
- Source: `.raw/articles/could-ais-become-conscious-2026-08-24.md`(The Economist, Leaders 欄, 2026-08-20)
- Summary: [[@2026__TheEconomist__Could AIs become conscious]]
- Pages created: source 1 件 [[@2026__TheEconomist__Could AIs become conscious]] / entity 4 件 [[The Economist]]・[[Pope Leo XIV]]・[[Javier Milei]]・[[Immanuel Kant]] / concept 3 件 [[AI意識]]・[[AI人格権]]・[[グローバルワークスペース理論]]
- Pages updated: entity 1 件 [[Anthropic]] / concept 2 件 [[権力集中リスク]]・[[SFにおけるAI表象]]
- Key insight: AI が実際に意識を持つかという一次的な問いを不可知論のまま棚上げし、AI が意識を持つと人間に見なされること自体が「福祉」保護要求・AI 人格権の主張へつながる政治的リスクを生むという二次的な問いへ焦点を移す論法。Kant の動物虐待論(動物への影響でなく人間の共感破壊が問題)を AI への残酷さへ転用し、AI 側の意識の真偽から独立に成立する倫理的リスクを提示する。限定的な AI の権利付与ですら「城の鍵を渡すようなもの」であり、既存の能力優位リスクとは別に、人間側の主体を介さない新しい権力集中経路を生むと警告する。
- 出典検査: 記事は購読者限定部分を一部含み全文未取得。姉妹記事の Briefing 欄「The search for consciousness inside LLMs」は本 ingest の対象外(URL のみ記録し未取得)。バナー画像 1 点は情報価値がないため埋め込みを省略した。
## [2026-08-24] ingest-paper | Scalable Hierarchical Aggregation Protocol (SHArP): A Hardware Architecture for Efficient Data Reduction
- Source: `.raw/papers/graham2016-sharp.pdf`(ローカル PDF、10 ページ。Richard L. Graham ほか、Mellanox Technologies, Inc., 2016 First International Workshop on Optimization of Communication in HPC Systems(COM-HPC 2016)、DOI: 10.1109/COMHPC.2016.6)
- Summary: [[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]]
- Pages created: source 1 件 [[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]] / entity 14 件 [[Richard L. Graham]]・[[Devendar Bureddy]]・[[Pak Lui]]・[[Hal Rosenstock]]・[[Gilad Shainer]]・[[Gil Bloch]]・[[Dror Goldenberg]]・[[Mike Dubman]]・[[Sasha Kotchubievsky]]・[[Vladimir Koushnir]]・[[Lion Levi]]・[[Alex Margolin]]・[[Tamir Ronen]]・[[Oded Wertheim]] / concept 1 件 [[インネットワーク集約]]
- Pages updated: entity 3 件 [[Eitan Zahavi]]・[[Alexander Shpiner]]・[[Mellanox]] / concept 2 件 [[集合通信]]・[[InfiniBand]]
- Key insight: SHArP は物理トポロジから独立した論理集約木という抽象化により、集約ノード(AN)の実装をスイッチにもホストにも配置可能にし、end-point 管理からスイッチングインフラ管理へ集団操作の進行責任を移した。高 radix の InfiniBand SwitchIB-2(36 ポート)を活かした浅い縮約木構成により、128 ホストの 8 byte MPI Allreduce() を 2.1 倍、パイプライン化した 4096 byte を 3.24 倍高速化した。この網内集約(In-Network Aggregation)の設計原則は、[[集合通信]] concept が集める現代の NVIDIA NVSHARP/Multimem(TokenWeave 論文で言及)に約 10 年先行する。
- 画像取り込み: 本文参照図表は Figure 1〜4 の 4 点。いずれもベクター描画のため pdf.js の埋め込み画像抽出では取得できず(埋め込み画像はページ内アイコン・IEEE ロゴのみで図表本体は 0 件)、PyMuPDF によるキャプション座標クロップで全 4 点を取得し `wiki/sources/_attachments/graham2016-sharp/` に配置・埋め込んだ。除外なし。Table I〜VI(6 点)は Markdown 表として本文中に全転記した。
- 出典検査: 主要な数値主張(レイテンシ改善倍率・OpenFOAM 実行時間・Table I〜VI の全数値)は本文・図表・Abstract に遡及済み(✅)。COM-HPC 2016 のワークショップ名・DOI は PDF 本文冒頭・フッターの表記から直接採取(✅)。著者名の "Dror Goldenerg" は原論文中の表記ゆれ(タイポと推定、entity ページに注記、ℹ️)。
## [2026-08-24] ingest-slides | アクセラレータ間通信の実際
- Source: `.raw/slides/MPLS.Japan.2024_/MPLS.Japan.2024_.pdf`(全 39 ページ、SpeakerDeck から取得。上野裕一郎(Yuichiro Ueno / @y1r)、Preferred Networks, Inc., MPLS Japan 2024, 2024-10-29)
- Visual pages: `.raw/slides/MPLS.Japan.2024_/pages/`(全 39 ページを画像化して全ページ読了)
- Media: なし(音声・動画は取得していない)。公式ページ(speakerdeck.com)とブログ記事(tech.preferred.jp「PFNにおけるアクセラレータ間通信の実際」2024-11-07)を裏取りに使用
- Summary: [[@2024__SpeakerDeck__アクセラレータ間通信の実際]]
- Pages created: source 1 件 [[@2024__SpeakerDeck__アクセラレータ間通信の実際]] / entity 1 件 [[上野裕一郎]]
- Pages updated: entity 3 件 [[Preferred Networks]]・[[NCCL]]・(sourcesフィールドのみ) / concept 2 件 [[集合通信]]・[[RDMA]]
- Key insight: NCCL のトポロジ自動検出は、サーバベンダーが NIC 増設余地のために PCIe SW を論理分割すると GPU-NIC 間距離が意図せず対称化し NIC 選択が偏りうる。SuperMicro SYS-821GE-TNHR の H100 サーバでドキュメント上 4 個の PCIe SW が nvidia-smi 上 8 個に見える実運用事例(NIC 8 枚搭載前提の論理分割、実装は NIC 4 枚)が、これまで本 wiki が蓄積してきた NCCL のトポロジ検出の知見に「ハードウェア構成起因の障害モード」を追加した。もう一つのトラブル事例(AllGather 不安定・InfiniBand タイムアウト)は、2 台のサーバをレール単位で直結する切り分けで再現しなくなり、原因がインターコネクトスイッチのクレジット管理だったことが判明した。
- 画像取り込み: 図 10 点を `wiki/sources/_attachments/MPLS.Japan.2024_/` へコピーして source ページに埋め込んだ(計算基盤変遷表 p.6・並列化手法比較図 p.11・NVLink 接続図 p.16・DCQCN 構成図 p.19・Ring-AllReduce 図解 p.24・一筆書き経路図 p.27・PCIe SW トポロジ問題図 p.32-33・切り分け解決図 p.35)。
## [2026-08-24] ingest-book | SRE Book 第 19〜27 章
- Source: `.raw/books/sre-book/`(9 章 / 入力: web。`sre.google` の章別ウェブページを defuddle で取得。Betsy Beyer・Chris Jones・Jennifer Petoff・Niall Richard Murphy 編, *Site Reliability Engineering: How Google Runs Production Systems*, O'Reilly, 2016-04-16, ISBN 978-1-491-92912-4)
- Book entity: [[SRE Book]]
- Chapters: [[@2016__OReilly__SRE Book - Chapter 19 Load Balancing at the Frontend]]〜[[@2016__OReilly__SRE Book - Chapter 27 Reliable Product Launches at Scale]](9 件)
- Pages created: entity 10 件 [[Piotr Lewandowski]]・[[Alejandro Forero Cuervo]]・[[Mike Ulrich]]・[[Dan Dennison]]・[[Raymond Blum]]・[[Rhandeev Singh]]・[[Sebastian Kirsch]]・[[Google Workflow]]・[[Gmail]]・[[Google Music]] / concept 7 件 [[過負荷制御]]・[[カスケード障害]]・[[レイムダック状態]]・[[分散cron]]・[[周期パイプライン]]・[[データ完全性]]・[[ローンチチェックリスト]]
- Pages updated: entity 9 件 [[SRE Book]]・[[Laura Nolan]]・[[Štěpán Davidovič]]・[[Vivek Rau]]・[[Borg]]・[[Chubby]]・[[Stubby]]・[[MapReduce]]・[[Spanner]] / concept 14 件 [[負荷分散]]・[[エニキャストルーティング]]・[[Webロードバランシング]]・[[グレースフルデグレーデーション]]・[[メタ安定障害]]・[[障害緩和]]・[[分散コンセンサス]]・[[クォーラムベースレプリケーション]]・[[分散合意プロトコル]]・[[べき等性]]・[[データ保護]]・[[グレイ障害]]・[[キャパシティ計画]]・[[フィーチャーフラグ]]
- Key insight: この 9 章は「負荷をどう配り、配りきれなくなったら何を捨て、捨て損ねたら系がどう壊れるか」という 1 本の連鎖として読める。第 19・20 章が配分(DNS / VIP の 2 段、サブセット化と重み付けの分離)、第 21 章が棄却の設計(QPS でなく CPU 秒で測り criticality で選ぶ)、第 22 章がその失敗形としてのカスケード障害を扱う。第 22 章の中心命題 — 負荷を発生前の水準に戻しても系は自力で戻らない — は、HotOS 2021 が[[メタ安定障害]]として定式化した現象の 5 年先行する現場記述にあたり、既存ページに対応関係を書き込んだ。後半の第 23〜26 章は状態を持つ系へ移り、第 23 章が「合意システムの運用(配置・性能・監視)」、第 24 章が「合意を使う側の設計(何を合意ログに載せ、外部副作用とどう順序づけるか)」、第 26 章が「バックアップではなく復旧が目的である」と、いずれも道具の正しさではなく運用の検証可能性を問う構成をとる。
- 刊行後の更新資料: `https://sre.google/resources/book-update/` の章別サブページ 32 件を取得し、Google SRE が本書刊行後に公開した論文・SREcon 発表・Cloud ブログ・ワークショップ(全 200 件超)を `.raw/books/sre-book/book-update.txt` に整理したうえで、[[SRE Book]] に「刊行後の更新資料」節として要約を追加した。第 4 章(SLO)が 20 件と突出する一方、第 22・24・26・27 章は各 1〜2 件。既存 wiki ソースと一致するものが 4 件あり([[@2017__SREcon17 Americas__A Practical Guide to Monitoring and Alerting with Time Series at Scale]]・[[@2018__acmqueue__Canary Analysis Service]]・[[@2018__SREcon18 Asia__A Theory and Practice of Alerting with Service Level Objectives]]・[[@2021__OReilly__Incident Metrics in SRE]])、節内で相互リンクした。
- 図表網羅チェック: 図 37 点を全点埋め込み(未解決リンク 0 件・未使用 attachment 0 件)。章ページの `` 行の直後にある `Figure N-M.` 行をキャプションとして機械的に対応づけ、オーケストレータが一括取得して `wiki/sources/_attachments/sre-book/` に配置した。内訳は第 23 章 15 点・第 20 章 6 点・第 25 章 6 点・第 26 章 4 点・第 22 章 3 点・第 24 章 2 点・第 21 章 1 点(数式画像)、第 19 章と第 27 章は図なし。第 24 章の Figure 24-1 のみ公開ウェブ版に画像が存在せず取得できていないため、該当箇所は文章で説明した。第 26 章の Figure 26-1・26-2 は原本のキャプションが空の 4 コマ漫画で、画像の内容を日本語で記述したキャプションを付けた。
- 備考: 取り込み範囲はユーザー指示により第 19〜27 章のみ。Part I / II / IV / V の扉、付録 A〜F、Bibliography は対象外とした。既存の第 1〜18 章・第 28〜34 章(`source_type: article`、`.raw/articles/sre-book-*` 配置、ナビゲーション行なし)は conventions §9.6 に従い遡及変更していない。新規 9 章は新規約どおり `source_type: book` + `publish: false` + ナビゲーション行つき。章ごとに Sonnet 5 の subagent へ委譲し、concept が競合する章(19→20、21→22、23→24、25→26)は投入順で直列化した。fan-out 中に別セッションが並行 ingest しており(`Mathematics for Computer Science` ほか 3 コミット)、本書分の巻き込みがないことを `git show --name-only` で確認した。
- 検出した既存ページの落とし穴: [[パイプライン処理]] は CPU の命令パイプラインを扱う同名異義ページで、データ処理パイプラインとは別領域だった(第 25 章の担当が原本照合で検出)。同様に [[ワークフロー自動化]]・[[プッシュ型パイプライン実行]]・[[テレメトリパイプライン]] もいずれも別領域のため、第 25 章の知見は新規 [[周期パイプライン]] に入れた。また第 27 章の担当は、オーケストレータが個別指示に書いた「本章の dark launch」という示唆が原本に一度も現れない語であることを検出し(章が使う語は gradual rollout・canary・invite system・feature flag)、実在する記述に置き換えた。
## [2026-08-24] ingest-paper | A Microscopic View of Bursts, Buffer Contention, and Loss in Data Centers
- Source: `.raw/papers/imc2022.pdf`(14 ページ。Ehab Ghabashneh・Yimeng Zhao・Cristian Lumezanu・Neil Spring・Srikanth Sundaresan・Sanjay Rao, Purdue University / Meta, IMC '22, 2022-10-25, DOI: 10.1145/3517745.3561430)
- Summary: [[@2022__IMC__A Microscopic View of Bursts, Buffer Contention, and Loss in Data Centers]]
- Pages created: entity 2 件 [[Ehab Ghabashneh]]・[[Sanjay Rao]]
- Pages updated: entity 6 件 [[Yimeng Zhao]]・[[Cristian Lumezanu]]・[[Srikanth Sundaresan]]・[[Neil Spring]]・[[Purdue University]]・[[Meta]] / concept 1 件 [[データセンター輻輳制御]]
- Key insight: 輻輳が高いほど損失が多いとは限らない。平均輻輳が低いRegA-Typicalの損失率(1.05%)は、平均輻輳が高いRegA-High(0.36%)の2.9倍に達する。eBPFベースのホスト計測(Millisampler)とラック内同期(SyncMillisampler)により、先行研究(Zhang et al., IMC '17)がスイッチ単一ポート計測の制約で分析できなかった輻輳(contention)とバースト・損失の統合分析を初めて実現した。
- 図表網羅チェック: 本文参照図表(Figure 1〜19・Table 1〜2)を全点埋め込み。埋め込みラスタ画像2枚(Figure 14, 17)はPDF内蔵画像を直接使用、残り17点(Figure 6・7・8は1枚の複合画像、Figure 10・11は2枚、それ以外は個別)はPyMuPDFキャプション座標クロップで取得。除外なし。
- 備考: `.raw/.manifest.json` に新規記録。関連ソース [[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]](同じくMeta・IMCの輻輳測定論文、著者の一部が重複)と [[@2017__IMC__High-Resolution Measurement of Data Center Microbursts]](本論文が「単一ポート計測の限界」として批判する先行研究)を [[データセンター輻輳制御]] で横断的に接続した。
## [2026-08-23] ingest-book | Mathematics for Computer Science
- Source: `.raw/books/mathematics-for-computer-science/`(21 章 / 入力: pdf、918 ページ。Eric Lehman・F. Thomson Leighton・Albert R. Meyer, revised 2015-05-18, CC BY-SA 3.0。MIT 6.042J / 18.062J 教科書)
- Book entity: [[Mathematics for Computer Science]]
- Chapters: [[@2015__MIT__Mathematics for Computer Science - Chapter 1 What is a Proof?]]〜[[@2015__MIT__Mathematics for Computer Science - Chapter 21 Recurrences]](21 件)
- Pages created: entity 10 件 [[Alan Turing]]・[[Albert R. Meyer]]・[[Bertrand Russell]]・[[Eric Lehman]]・[[Euclid]]・[[F. Thomson Leighton]]・[[Georg Cantor]]・[[Herman Chernoff]]・[[Mathematics for Computer Science]]・[[Robert W. Floyd]] / concept 55 件 [[オイラーの公式]]・[[グラフ彩色]]・[[シンプソンのパラドックス]]・[[トポロジカルソート]]・[[マッチング]]・[[ランダムウォーク]]・[[不変条件]]・[[二項係数]]・[[二項分布]]・[[二項関係]]・[[信頼水準]]・[[停止性問題]]・[[充足可能性問題(SAT)]]・[[公理的方法]]・[[再帰的データ型]]・[[分割統治]]・[[分散]]・[[包除原理]]・[[半順序]]・[[単純グラフ]]・[[合同算術]]・[[同値関係]]・[[命題論理]]・[[和の近似]]・[[四段階法]]・[[安定結婚問題]]・[[定常分布]]・[[対角線論法]]・[[帰納法]]・[[平面グラフ]]・[[形式的べき級数]]・[[数え上げ]]・[[整列原理]]・[[最大公約数]]・[[有向グラフ]]・[[期待値]]・[[木(グラフ理論)]]・[[条件付き確率]]・[[母関数]]・[[漸化式]]・[[漸近記法]]・[[濃度]]・[[状態機械]]・[[独立性]]・[[相互結合網]]・[[確率変数]]・[[確率空間]]・[[素数]]・[[証明]]・[[誕生日原理]]・[[調和数]]・[[述語論理]]・[[関数]]・[[集合]]・[[鳩の巣原理]]
- Pages updated: [[Akamai]]・[[PageRank]]・[[データセンターネットワークトポロジ]]・[[公開鍵暗号方式]]・[[集中不等式]]
- Key insight: 本書の主張は Part V 序論が明示している — 「大きな問題を、簡単な基底の場合に達するまで段階的に小さな問題へ帰着させる」という発想が、帰納法による証明と再帰アルゴリズムと漸化式の三者に共通して流れているという一点である。この宣言は遡って Part I の配置を説明する。多くの離散数学の教科書が題材ごとに章を並べるのに対し、本書は 7 章・230 ページ超を証明の方法論だけに充て、整列原理(第 2 章)・通常/強帰納法(第 5 章)・構造的帰納法(第 6 章)が互いに翻訳可能であることを繰り返し確認してから各分野へ降りる。同じ「解けた問題へ翻訳する」型は本書のあちこちで反復し、第 4 章の Mapping Rule は第 14 章で数え上げ技術そのものになり、線形漸化式は第 15 章では母関数で、第 21 章では特性方程式で解かれる。
- 既存概念との接続: この vault にとっての価値は、既にシステム・機械学習の文脈で持っていた概念の**数学的下地**が入った点にある。[[集中不等式]] は機械学習理論の書籍からマルコフ・チェビシェフ・ヘフディングを得ていたが、第 19 章が同じ不等式を離散数学の枠組みで与え直し、チェルノフ限界を加えた。[[データセンターネットワークトポロジ]] は実運用の Fat-Tree / Clos の議論だったところに、第 10 章が直径・スイッチ数・レイテンシ・輻輳の 4 指標によるトレードオフの定式化を与えた。[[PageRank]] は 3 件のシステム系ソースを持っていたが、第 20 章がそれを強連結グラフ上のランダムウォークの定常分布として定義した。[[公開鍵暗号方式]] も第 8 章の Euler の定理まで遡る根拠を得た。
- 図表網羅チェック: 図 142 点を全点埋め込み(未マッチ 0 件・未使用 attachment 0 件)。全図が TikZ 由来のベクター図で `get_images()` が空を返すため、太字 `NimbusRomNo9L-Medi` で始まる `Figure N.M` のブロックだけをキャプションと判定し(本文中の図参照はこの書体を使わない)、そこから上へ描画オブジェクトと図内テキストのクラスタを育てて図領域を決める規則を 1 回作り、オーケストレータが一括クロップした。本文の図参照 grep で得た図番号 142 点と切り出し結果が完全一致することを照合してから章へ配った。
- 備考: PDF アウトラインの章検出が節見出しを拾い章番号がずれたため、目次から章境界を確定して `--chapters` で再分割した。部の序論 5 本は独立 source にせず book entity に織り込んだ。巻末の Bibliography・Glossary of Symbols・Index は対象外。全 21 章に `publish: false` を付与。
## [2026-08-23] query-deep | RDMAネットワークモニタリングの教科書
- Question: 「RDMAネットワークモニタリングについて網羅的かつ体系的に整理した教科書をサーベイ論文形式でまとめてください」(japanese-tech-writing skill 適用)
- Output: [[wiki/questions/RDMAネットワークモニタリングの教科書]](5 部 19 章 + 付録 5 節、1,434 行、address c-004808)
- Retrieval: `scripts/retrieve.py` を実行(bm25 20 hits、ollama 不達で rerank は no-op)。ヒットした [[RDMAネットワーク監視]] を起点に、7 クラスタへ subagent を並行投入して 40 本超の source/concept を全文精査した。
- 体制: オーケストレータが hub concept([[RDMAネットワーク監視]] の計装点 7 軸・時間軸 4 系統)と先行教科書ページの書式を読み、7 体の Explore subagent が (1) 能動プローブ系 (2) 輻輳・PFC 系 (3) ホスト/NIC 系 (4) 集団通信・学習ジョブ系 (5) 物理・光層系 (6) RDMA 基礎系 (7) 障害統計・NCCL 系 を分担。各 subagent には「ページ記載内容のみから抽出し、書かれていない項目は『記載なし』と明記する」ことを課した。
- 骨格: 既存の [[RDMAネットワーク監視]] が持つ「計装点 7 層」と「時間軸 4 系統」を二次元座標として明示的に立て(第 8 章)、全システムをそこへ配置した。各手法の行に「見えない異常」の列を置いたのが本ページ独自の整理で、第 16 章の統合論へ直結させた。
- 姉妹編との分担: [[LLM学習インフラ実運用の教科書]] 第 IV 部(学習基盤の一部としてのネットワーク)と [[NIC光トランシーバーのモニタリング]](光部品単体)の中間を埋める位置づけをリード文で明示し、重複記述を避けて相互参照でつないだ。
- Key insight: **計測点をどこに置くかで可視化できる異常の層が固定される**という hub concept の主張を、各系統が「見落とすもの」の側から書き直した(第 16 章)。輻輳を主眼とする系(Hawkeye/C4/R-Pingmesh)は破損を原理的に緩和できず(CorrOpt: 破損は利用率と無相関 0.19、輻輳は 0.62)、CCL 内蔵モニタは PFC 連鎖と光劣化が見えず、スイッチ層ミラーリングは TP が見えず(通信量の 99% を占めるのにノード内で完結)、カーネル計装は性能劣化を測らない。
- 第二の軸: **平均値の監視は本番の劣化をほぼ検出しない**。本番訓練の集団通信 CV は孤立ベンチの 2〜5 倍(NVLink 0.336 対 0.067)だが平均帯域は 4〜8% 以内で一致する。Meta 実測でも PFC pause がスパイン間で 2 桁不均衡なのに分単位平均トラフィックレートの差は 12% に収まる。変動係数と外れ値、そして既に全 RDMA ネットワークに展開済みの粗粒度 PFC カウンタが未使用の資源になっている。
- 執筆規範: `japanese-tech-writing` skill を適用。em ダッシュと 2 倍ダッシュを全廃(検査 0 件)、中黒は wikilink 内のソースファイル名(`GPUネットワーク設計・運用`)のみに残置(japanese-style §6 の改変禁止に従う)、一文一行、常体、予告型の前置き(「重要なのは〜である」)と結論を言い切る見出しを検査して除去した。全 64 wikilink の解決を確認。
- 未解決として記録: ホスト内診断(Hostping)とネットワーク監視(R-Pingmesh)を単一パイプラインへ統合する仕組みは wiki のソースからは確認できない。性能異常探索(Collie)・仕様準拠性検証(Lumina)・カーネルバグ診断(RDMATracer)の 3 系統の統合も未解決。MRC の耐性が T0 側光障害を隠す一方 NIC 側は ride out できないという非対称は、予防型予測の投資配分を NIC 側へ寄せるべきという示唆を独立ソースから与える。
- 注意: 付録 D に数値引用時の制約を 8 件集約した。CorrOpt の破損統計は破損無効化システム稼働下の値で無ければ 2 桁高いと著者が見積もる、CorrOpt はスイッチ間光リンク限定で NIC 側は未検証、Arista の設定例は StrataXGS 前提で DNX では異なる、CCGrid の予測は再現率 21.2〜50.0% にとどまる、finecounters は 4.8ms 未満のスパイクを取れない、IRN と Vedrfolnir はシミュレーション評価のみ、RDMATracer は Meta と Mellanox 系限定、既定設定のベンチマーク値は最大 1 桁ずれる。
## [2026-08-23] ingest-paper | High-Resolution Measurement of Data Center Microbursts
- Source: `.raw/papers/imc17-final60.pdf`(IMC '17, London, United Kingdom, 2017-11-01, DOI: 10.1145/3131365.3131375)
- Summary: [[@2017__IMC__High-Resolution Measurement of Data Center Microbursts]]
- Pages created: [[@2017__IMC__High-Resolution Measurement of Data Center Microbursts]]、[[Qiao Zhang]]、[[Vincent Liu]]、[[マイクロバースト]]
- Pages updated: [[Arvind Krishnamurthy]]、[[James Hongyi Zeng]]、[[Facebook]]、[[University of Washington]]、[[University of Pennsylvania]]、[[データセンター輻輳制御]]
- Key insight: Facebook本番データセンターのToRスイッチを25µs粒度で計測し、輻輳の90パーセンタイルが200µs以下のµburstであることを実証した。「利用率とドロップ率の相関係数が0.098と弱い」という粗粒度測定の結果は、実際には短命なµburstの集積が積算されて見えた副産物であり、著者ら自身が採用粒度(25µs)自体もなお粗すぎる可能性を認めている。マルコフ連鎖の尤度比検定でバースト到着の自己相関を統計的に示した点は、[[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]]が8年後に別のネットワーク種別(RDMA)で独立に到達した「バーストは同期的挙動」という観測に先行する。
- 図表網羅チェック: 本文参照Figure 1-10・Table 1-2(計12件)を全点埋め込み(埋め込みラスタ画像3枚は原本のPDF内蔵画像、残り7枚はPyMuPDFキャプション座標クロップ、表2点はmarkdown転記)。除外なし。
## [2026-08-23] ingest-paper | Resiliency at Scale: Managing Google's TPUv4 Machine Learning Supercomputer(図表補完)
- Source: `.raw/papers/nsdi24-zu.pdf`(USENIX NSDI '24、https://www.usenix.org/conference/nsdi24/presentation/zu)
- Summary: [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]]
- Pages updated: [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]]
- Key insight: 2026-08-06 の query 駆動 ingest では Figure 1・3・6・10・12(a-c) のみが「代表図」として選定され、Figure 4・5 は選定範囲外と明記されていた。現行の `wiki-ingest-paper` 仕様(本文参照図表は全件必須・上限なし)に合わせ、Figure 2・4・5・7・8・9・11・13・14 を追加で埋め込んだ。特に §4 ICI Routing(DOR・タイブレーク・Wild-First Routing のサンドイッチ則・ILP によるオフラインルート最適化)は本文自体が source ページから欠落していたため、新設した「### ICI ルーティング(§4)」節とあわせて Figure 9・11 を補完した。新規主張の追加はなく、既存 frontmatter(`key_claims` 等)は変更していない。図表網羅チェック(Figure 1-14・Table 1-3、計17件)で差分ゼロを確認、除外図表なし。`.raw/.manifest.json` に未記録だった本ソースのハッシュを追記した。
## [2026-08-23] ingest-thesis | Controlling the Costs of Coordination in Large-scale Distributed Software Systems
- Source: `.raw/theses/phd-maguire-2020-coordination-costs/`(8 章 + Appendix A / 入力: pdf、190 ページ。Laura Marie Dose Maguire, PhD dissertation, Industrial and Systems Engineering, The Ohio State University, 2020。指導教員 David Woods、審査委員 Michael Rayo・Philip Smith。OhioLINK ETD accession osu1593661547087969、オープンアクセス)
- Hub entity: [[Controlling the Costs of Coordination in Large-scale Distributed Software Systems]](entity_type: thesis)
- Chapters: [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 1 Introduction]]〜[[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 8 Conclusion]] + [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Appendix A Elements of Choreography]](9 件)
- Pages created: 章 source 9 件 + [[Controlling the Costs of Coordination in Large-scale Distributed Software Systems]](entity, thesis)+ 新規 concept 4 件([[Adaptive Choreography]]・[[協調コスト]]・[[プロセストレーシング]]・[[クリティカルデジタルインフラ]])
- Pages updated: 更新 entity 4 件 — [[Laura Maguire]]・[[David D. Woods]]・[[Gary Klein]]・[[Erik Hollnagel]] / 更新 concept 8 件 — [[Joint Activity]]・[[Common Grounding]]・[[アノマリー応答]]・[[Incident Commander]]・[[Followship]]・[[Multi-Party Dilemma]]・[[ChatOps]]・[[インシデント管理]]
- 取り込み方針: 前付(表紙・Vita・目次・図表一覧、印字 i〜xiii)と Bibliography(印字 p.167-174)は source 化していない。Appendix A はユーザー確認のうえ独立した source ページとした(13 要素の参照表として引く価値があるため)。オープンアクセスの学術文書なので `publish:` は付けていない。
- Key insight: 本論文の中心命題は「**協調コストを制御する試みは、コストを消去せず転嫁する**」である(第 6 章)。Incident Commander へ協調機能を集約するモデルはコストを IC 個人へ集めてボトルネックを作り(Figure 6.1)、対応者はそれを迂回するサイドチャネリングへ流れる(Figure 6.2)。エスカレーション構造は同じコストを時間と組織境界の向こう側へ押し出す(Figure 6.6)。第 7 章の [[Adaptive Choreography]] はこの転嫁を前提に、コレオグラフィの要素を対応者間で動的に再配分する枠組みとして提示される。
- 一次出典としての価値と検出された誤り: この wiki は Adaptive Choreography・[[Followship]]・[[協調コスト]] を 2022〜2024 年の SREcon 講演経由の二次情報として持っていた。本 ingest で原典が入り、**「Adaptive Choreography = コンダクター/コミュニケーター/問題解決者の固定 3 役割(Response Trio)」という [[Followship]]・[[Laura Maguire]] の記述が一次出典に存在しない**ことが判明した(原本全文で `conductor`・`communicator`・`problem solver`・`followship`・`quadrant` はいずれも 0 件)。第 7 章の中心図(Figure 7.1)は固定 3 役割の三角形ではなく、IC・Comms・Planning と可変数の Response Engineer が多対多で結ばれるメッシュ構造である。第 7 章ページと [[Followship]] の両方に `> [!contradiction]` を立て、[[Followship]] の alias `"Adaptive Choreography"` を削除して新設 concept へ張り替えた。一方、[[Followship]] が「知識の 4 象限(Maguire, 2020)」と呼ぶものは、第 6 章 `Establishing Common Ground` 節の 4 下位節(other individual participants / team membership / the organization / the system performance)に実質的に対応することを確認し、「4 象限」が二次的な言い換えである旨とともに [[Common Grounding]] に記録した。
- 既存 wiki との矛盾: 第 3 章が ICS のソフトウェア工学への輸入([[@2016__OReilly__SRE Book - Chapter 14 Managing Incidents]] を名指し)を「本番インシデント対応の複雑さを単純化しすぎている」と批判する点が、[[インシデント管理]] がこれまで肯定的に集約してきた ICS 由来 4 役割の評価と食い違う。両ページに contradiction callout を立てた。批判の一次的論拠である Grayson (2018)・Woods (2017) は本 wiki 未取り込みで、内容は未検証である。
- 原本内部の不整合: (1) コレオグラフィの要素数が第 5 章 16 個・第 6 章は冒頭で 15 項目を予告して 13 見出し・Appendix A は 13 行と揺れ、しかも項目集合が完全には一致しない(`Taking perspectives / switching perspectives` と `Being recruited・Orienting` は Appendix A のみ、`Tracking other's activities`・`Coordinating with tools`・`Monitoring coordination demands` は第 5 章のみ)。ハブ entity に note callout として記録し、「要素は N 個」と単一の数で引用しない方針を明記した。(2) 本文が参照する `Figure 7.2` は論文に存在しない(List of Figures にもキャプションにも無い)。第 7 章ページに注記した。
- 図表: 図 25 点 + キャプション無しの図 1 点 + Table 5.1(横長 3 ページ)+ Appendix A の原表(タブロイド判 5 ページ)= 計 34 点を全点埋め込み(埋め込み 40 箇所 / 欠損 0 / 未使用 attachment 0)。全図が埋め込みラスタ画像だったため `get_image_rects()` が使え、「キャプション `Figure N.M` の直上にある未使用の画像矩形」を対応づける規則をオーケストレータが 1 パスで適用した(25/25 成功)。キャプションのテキストブロックが画像矩形と y 方向に重なるため、`r.y1 <= caption.y0` ではなく `r.y0 < caption.y0` で判定する必要があった。Table 5.1 と Appendix A は 9 列・6 列の横長表で `pdftotext` の平坦化により列対応が崩れるため、画像化して担当 subagent に目視転記させた。
- 振り分け誤りの訂正: 印字 p.123 の無題図を当初「第 5 章の事例横断テーマ節冒頭」として第 5 章へ渡したが、第 5 章の印字範囲は p.49-120 であり、この図は第 6 章のものだった(図が示す common ground(AR)/(JA) の区別は第 6 章に 13 箇所現れ第 5 章には 0 件)。第 5 章担当の報告で発覚し、attachment をリネームして第 6 章へ渡し直し、第 5 章ページから当該記述ごと削除した。
- 体制: オーケストレータ(Opus 5)が原本取得・章分割・図の全点切り出し・ハブ entity・索引更新・commit を担当し、章 source は 1 章 = 1 subagent(Sonnet 5)で処理した。concept を奪い合う章は投入順で直列化した(第 2 章が [[協調コスト]] を新設 → 第 5 章が事例による経験的裏づけ → 第 6 章が境界を越えた転嫁、という 3 層の積み増し。[[Incident Commander]] は第 5 章「観測された実態」→ 第 6 章「モデルの限界」)。常時 3〜4 体のローリングで 9 枚を処理した。
## [2026-08-23] ingest-book | Security Engineering: A Guide to Building Dependable Distributed Systems, 3rd Edition
- Source: `.raw/books/security-engineering-3e/`(29 章 / 入力: 章別 PDF 30 本、約 1090 ページ。Ross Anderson, John Wiley & Sons, 2020, ISBN 978-1-119-64278-7。著者公開ページ https://www.cl.cam.ac.uk/archive/rja14/book.html)
- Book entity: [[Security Engineering - A Guide to Building Dependable Distributed Systems]](entity_type: book)
- Chapters: [[@2020__Wiley__Security Engineering 3e - Chapter 1 What Is Security Engineering?]]〜[[@2020__Wiley__Security Engineering 3e - Chapter 29 Beyond “Computer Says No”]](29 件、全章 `publish: false`)
- Pages created: 章 source 29 件 + 新規 entity 32 件([[Aadhaar]]・[[British Medical Association]]・[[Bruce Schneier]]・[[Common Criteria]]・[[Cynthia Dwork]]・[[Digimarc]]・[[Dorothy Denning]]・[[EMV]]・[[Edward Snowden]]・[[GCHQ]]・[[GSM]]・[[Gus Simmons]]・[[IBM 4758]]・[[John Perry Barlow]]・[[Kerberos]]・[[Kevin Mitnick]]・[[Leslie Lamport]]・[[Markus Kuhn]]・[[Matt Blaze]]・[[Max Schrems]]・[[Mifare Classic]]・[[NSA]]・[[Orange Book (TCSEC)]]・[[Paul Kocher]]・[[Roger Needham]]・[[Ross Anderson]]・[[SCOMP]]・[[STS (Standard Transfer Specification)]]・[[SWIFT]]・[[Security Engineering - A Guide to Building Dependable Distributed Systems]]・[[Sergei Skorobogatov]]・[[Signal]])+ 新規 concept 57 件([[CAPTCHA]]・[[DRM(デジタル著作権管理)]]・[[GNSS測位の脆弱性]]・[[HSM APIセキュリティ]]・[[SIMスワップ攻撃]]・[[Signalプロトコル]]・[[アクセサリ制御]]・[[サイドチャネル攻撃]]・[[サイバー犯罪の産業化と分業]]・[[サービス妨害攻撃とネットワークプロトコルの悪用]]・[[セキュリティにおけるインセンティブ不整合]]・[[セキュリティにおける命名]]・[[セキュリティの持続可能性]]・[[セキュリティエンジニアリングチームの管理と組織的リスク]]・[[セキュリティ工学の分析フレームワーク]]・[[セキュリティ経済学]]・[[セキュリティ評価制度]]・[[ソフトウェア開発方法論(ウォーターフォールからアジャイルへ)]]・[[ソーシャルエンジニアリングとフィッシング]]・[[テロリズムの政治学と心理学]]・[[トラステッド実行環境(TEE)]]・[[パスワードのユーザビリティ]]・[[ヒューリスティックとバイアス]]・[[フルディスク暗号化]]・[[ブロック暗号設計原則]]・[[マルチラテラルセキュリティ]]・[[ランダムオラクルモデル]]・[[リスク分析とハザード分析手法]]・[[公開鍵暗号方式]]・[[医療記録プライバシー]]・[[匿名化の失敗と再識別]]・[[国家監視の歴史と法制度]]・[[多層セキュリティ(MLS)]]・[[封印と偽造防止印刷]]・[[情報戦]]・[[情報経済学]]・[[投機的実行とマイクロアーキテクチャサイドチャネル(Meltdown・Spectre)]]・[[敵対者の類型論]]・[[暗号利用モード]]・[[暗号戦争]]・[[検閲とコンテンツモデレーション]]・[[物理複製困難関数(PUF)]]・[[生体認証]]・[[秘密分散]]・[[統計的開示制御]]・[[耐タンパ性]]・[[脆弱性ライフサイクルと協調的な脆弱性開示]]・[[自動運転車のセキュリティ]]・[[複式簿記による内部統制]]・[[計量システムの脅威モデル]]・[[認証プロトコルの失敗モード]]・[[認証局とPKIの信頼モデル]]・[[誤報率と検知率のトレードオフ]]・[[運用セキュリティ(OPSEC)とトレードクラフト]]・[[選挙システムのセキュリティ]]・[[鍵配送プロトコル]]・[[電子透かしと著作権マーキング]])
- Pages updated: 更新 entity 12 件 — [[Barry W. Boehm]]・[[Daniel Kahneman]]・[[Fred Brooks]]・[[James Reason]]・[[Latanya Sweeney]]・[[Michael D. Schroeder]]・[[Multics]]・[[Nancy G. Leveson]]・[[Tesla]]・[[Tor]]・[[Watts Humphrey]]・[[Werner Vogels]] / 更新 concept 21 件 — [[Capability-based Security]]・[[DevOps]]・[[アラート疲労]]・[[クロック同期と信頼性]]・[[ゲーム理論とSRE]]・[[セキュリティ設計原則]]・[[ゼロトラスト]]・[[データのプライバシーと同意]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク監視]]・[[パスキー認証]]・[[ブロックチェーン]]・[[ポリシー]]・[[信頼計算基盤(TCB)]]・[[信頼関係]]・[[分散システム障害]]・[[差分プライバシー]]・[[技術的負債]]・[[敵対的摂動]]・[[権力集中リスク]]・[[認可モデル]]
- 取り込み方針: 前付・序文(`ch-00.pdf`、47 ページ)はユーザー確認のうえ source 化していない。著者の経歴・版ごとの変遷・成立事情は book entity に織り込み、出典は章ページではなく書誌そのもの(「本書 第 3 版序文」)を指す形に統一した。
- Key insight: 本書の構成そのものが分野についての主張である。Part II が 29 章中 17 章を占め、核指揮統制・銀行・錠と警報装置・偽造防止印刷・電子戦・DRM という一見無関係な領域を並べるのは、**同じ失敗の型がドメインを越えて反復する**ことを示すためだ。章単位の取り込みで、その反復が concept の積み増しとして実際に可視化された ── (1) [[誤報率と検知率のトレードオフ]] に 13 章(物理警報)・16 章(封印の三層検査と Trujillo 実験)・17 章(生体認証の FAR/FRR)・21 章(IDS の統計的誤警報)が層状に積み上がった。(2) [[セキュリティにおけるインセンティブ不整合]] は 8 章の定式化に対し、14 章(スマートメータの所有者インセンティブ)・22 章(SIM スワップ)・24 章(アクセサリ制御)・25 章(自動車メーカーの事故過小計上)・28 章(Common Criteria の責任盾モデル、Boeing 737 MAX の規制の虜)が具体例を供給した。(3) [[情報経済学]] のレモン市場は 18・24・28 章の 3 領域(耐タンパデバイス・有料テレビ RASP・Trust-e と Common Criteria)に共通した。(4) 5 章 × 15 章の突き合わせから、GCM の起源が核指揮統制の無条件安全認証符号研究にあることが判明した([[暗号利用モード]])。
- 分野の重心移動: 著者は第 3 版序文で、第 2 版(2008)からの変化を「信頼されたシステム」から「協調的な脆弱性開示・DevSecOps・レジリエンス」への移行として総括する。多層セキュリティ産業は 40 年・数十億ドルの米政府資金を受けながら事実上消滅し、Pentagon の情報フロー制御を強制するアーキテクチャ思想は実行不能として放棄された(9 章がその論拠を提示)。代わりに経済学(8 章)・心理学(3 章)・政策(26 章)が中核に入った。著者が最大の未解決問題に挙げるのは耐久財のパッチ供給(28 章、[[セキュリティの持続可能性]])である。
- 既存 vault との接続: [[セキュリティ設計原則]](Saltzer & Schroeder の原則。従来 [[@2009__MITOCW__Principles of Computer System Design - Chapter 11 Information Security]] からのみ積み上がっていた)に本書 6 章分が加わった。[[信頼計算基盤(TCB)]] は本 ingest で初めて複数ソースを持つ concept になった。[[差分プライバシー]] には 11 章から Dwork et al. 2006 の起源と 2020 年米国国勢調査での実運用(ε=4〜6)が入った。
- 図表: 本文が参照する図 100 点を全点埋め込み(埋め込み 100 / 欠損 0 / 未使用 attachment 0、本文 grep の図番号集合と差分ゼロ)。29 本の章別 PDF は 65 ページ以下だが、`extract-paper-images.mjs` の一括抽出は使わず、キャプション記法 `Figure N.M:` を鍵にオーケストレータが 1 パスで全点クロップした。枠囲み図(9.1 等)は枠の drawing 矩形を、並置図(19.2/19.3)は白ガター検出で分離し、XObject 内に隠れて `get_image_rects()` に出ないラスタ図 4 点は画素走査で境界を詰めた。
- 検出された食い違い: 11 章の Sweeney 研究の再識別率が既存ページと異なる(本書 69% = 生年月日 + 郵便番号の 2 識別子 / 既存 87% = 性別 + 年齢 + 郵便番号の 3 識別子)。矛盾ではなく識別子数の違いとして両ページに注記した。2 章「地下市場出現 2003〜2005 年」と 21 章「マルウェア産業化 2004〜2006 年」も粒度の違いであり contradiction は立てていない。
- 運用メモ: 章ごとに Sonnet 5 subagent へ委譲し、常時 3〜4 体のローリングで 29 章を処理した。ハブ concept を奪い合う章(5→20 暗号、6→9→10 アクセス制御、4→12→22 プロトコル、13→16→17 検知トレードオフ、8→24→25→27→28 経済学、18→19 ハードウェア)は並行させず投入順で直列化し、後発には先行章が触った concept のファイル名を明示して申し送りした。結果、ハブ concept は上書きされず層状に積み上がった。
## [2026-08-23] ingest-thesis | Scaling Telemetry Workloads in Cloud Applications
- Source: `.raw/theses/phd-tsubouchi-2025-telemetry/`(6 章 / 入力: pdf、122 ページ。Yuuki Tsubouchi, PhD dissertation, Graduate School of Informatics, Kyoto University, 2025-03)
- Hub entity: [[Scaling Telemetry Workloads in Cloud Applications]](entity_type: thesis)
- Chapters: [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 1 Introduction]]・[[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 2 Background]]・[[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 3 Efficient TCP-UDP Socket-based Instrumentation in Kernel for Continuous Construction of Network Call Graphs]]・[[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 4 Time Series Data-Intensive Application by Automated Data Tiering in Heterogeneous Key-Value Stores]]・[[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]]・[[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 6 Conclusion]](6 件)
- Pages created: 章 source 6 件 + [[Scaling Telemetry Workloads in Cloud Applications]](entity, thesis)
- Pages updated: 更新 entity 6 件 — [[HeteroTSDB]]・[[KairosDB]]・[[Mackerel]]・[[MetricSifter]]・[[Meltria]]・[[go-conntracer-bpf]] / 更新 concept 19 件 — [[Scaling Telemetry Workloads]]・[[テレメトリ]]・[[オブザーバビリティ]]・[[クラウド障害ライフサイクル]]・[[マイクロサービスアーキテクチャ]]・[[分散トレーシング]]・[[eBPF]]・[[eBPFマップ]]・[[ネットワーク依存性発見]]・[[トレーシングオーバーヘッド]]・[[マイクロサービスコールグラフ]]・[[時系列データベース]]・[[アーカイバルストレージ]]・[[特徴量削減]]・[[変化点検知]]・[[Fault Localization]]・[[メトリクス削減]]・[[カーネル密度推定]]・[[マイクロサービスベンチマーク]]
- 再取り込み(既存資産の置き換え): 本論文は 2026-06-03 に `wiki-ingest-paper` で単一 source ページとして取り込まれていた。今回 `wiki-ingest-thesis` で章単位に取り込み直し、ユーザー承認のうえ旧 source ページ `@2025__Kyoto University__Scaling Telemetry Workloads in Cloud Applications - Techniques for Instrumentation, Storage, and Mining.md`・旧原本 `.raw/papers/kyoto-djohk00908.{pdf,txt}` と `.raw/papers/kyoto-djohk00908/`・旧 attachment `wiki/sources/_attachments/kyoto-djohk00908/`・manifest の旧キーを削除した。旧ページへの受信リンク 141 箇所(31 ファイル)はハブ entity へ機械的に張り替えた。**追記式の過去記録(`wiki/log.md` の 2026-06-03 エントリ・`wiki/folds/fold-k4-*`・`wiki/meta/lint-report-2026-06-14.md`)は編集せず、旧リンクのまま温存している**(conventions の追記式原則)。
- Key insight: 章分割によって、旧・単一ページでは 1〜2 行に圧縮されていた内容が本文として復元された。とくに (1) 第 4 章 §4.6 Lessons Learned — HeteroTSDB の [[Mackerel]] 本番投入(2017-08)における本番構成の差異(メッセージブローカ前置・DynamoDB + S3 の 3 層化・AWS Lambda によるサーバーレス化)と 1 年間のインシデント 2 件、(2) 第 5 章の実験表(Tab. 5.2/5.4/5.5/5.6)、(3) 第 2 章が定める用語体系(fault / error / failure / incident の連鎖と tolerance point の階層)、の 3 点は章ページでしか保持できない粒度である。論文全体を貫く主張は §6.2 の設計指針「データ削減は文脈知識が最も豊富な両端(計装層・マイニング層)で行い、保持層は文脈非依存の堅牢な保持に徹するべき」であり、これは第 3 章(計装層で宛先サービス単位に束ねる)と第 5 章(分析層で障害関連メトリクスに絞る)が両端で削減し、第 4 章(保持層)が削減でなく階層化で応じたという 3 章の設計選択を事後的に説明する。
- 章 ↔ 出版論文の照合: 第 3 章 ↔ JIP 2022([[@2022__IPSJ JIP__Low Overhead TCP-UDP Socket-based Tracing for Discovering Network Services Dependencies]])と第 5 章 ↔ IEEE Access 2024([[@2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications]])を全文突き合わせた。CPU オーバーヘッド・実験環境(Ch.3)、BA 0.981・実行時間削減 43.75–50.39%・ハイパーパラメータ ω=2.5/h=3.5・データセット構成 6 データセット 132 障害(Ch.5)のいずれも一致し、**矛盾は検出されなかった**ため contradiction callout は立てていない。第 4 章の元論文(情報処理学会論文誌 2021、和文)は wiki 未取り込み。
- 図表: 図 26 点を全点埋め込み。LaTeX 生成 PDF でベクター図が主体のため `get_image_rects()` は使えず、キャプション記法 `Fig. N.M:` / `Tab. N.M:`(Clean Thesis スタイル)を鍵に、直上の本文ブロック下端からキャプション下端までを切り出す規則をオーケストレータが 1 パスで適用した(26/26 成功、代表 6 点を目視確認)。表 6 点は画像化せず第 5 章ページへ Markdown 転記。
- 体制: オーケストレータ(Opus 5)が原本取得・章分割・図切り出し・ハブ entity・索引更新を担当し、章 source は 1 章 = 1 subagent(Sonnet 5)で並行取り込みした(第 1・3・4・5 章 → 第 2・6 章。`Scaling Telemetry Workloads` concept を奪い合う第 1 章と第 6 章は投入順で直列化し、第 1 章が「3 層モデルの定義」、第 6 章が「設計指針と将来方向」の軸で層状に積み増した)。
## [2026-08-23] ingest-paper | Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems
- Source: `.raw/papers/usenix-loginonline-detecting-fail-slow-failures-2023.html`(USENIX ;login: online、2023-02-06 公開、著者自身による FAST '23 論文のサマリー記事。原本に PDF が存在しないため記事 HTML を不変原本とした)
- Summary: [[@2023__loginonline__Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems]]
- Pages created: [[PERSEUS]](entity, product)
- Pages updated: 更新 entity 3 件 — [[Erci Xu]]・[[Jiesheng Wu]]・[[Alibaba Cloud]] / 更新 concept 3 件 — [[フェイルスローハードウェア]]・[[グレイ障害]]・[[異常検知]]
- Key insight: [[Alibaba Cloud]] のストレージ運用チームが、ストレージデバイス(HDD/SSD)向けフェイルスロー検知フレームワーク PERSEUS を構築した経緯を報告する。閾値フィルタリング・ピア評価・IASOベースモデルという3つの失敗した先行試行から「サービス単位・クラスタ単位では LvT(レイテンシ対スループット)分布が大きく乖離するが、ノード単位でのみ均質になる」という発見を導き、ノード内 LvT 分布への多項式回帰で適応的しきい値を自動導出する PERSEUS を提案した。既存手法を全指標(Precision 0.99・Recall 1.00・MCC 0.99)で上回り、運用開始後25万台超のドライブから304台のフェイルスロードライブを検出した。同じ FSH 問題を障害注入で扱う [[@2026__TOCS__Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems]] の Sieve とは認識論的アプローチ(データ駆動な統計的検知 vs 仮説駆動な因果的注入検証)が異なるが、「単一コンポーネントへの局在」という同一の経験則に独立にたどり着いていることを [[フェイルスローハードウェア]] に追記した。また PERSEUS が直面した「固定閾値は文脈依存で機能しない」というジレンマが、同じ Alibaba の別チームが2017年にビジネストレンド異常検知で報告した N-シグマ則の限界([[@2017__SREcon17 Asia__Smart Monitoring System for Anomaly Detection on Business Trends in Alibaba]])と同型であることを [[異常検知]] に追記した。
- 図表: 記事本文が参照する Figure 1〜6・Table 1〜2 を全点埋め込み(記事に埋め込まれた画像を直接ダウンロード。図6点はそのまま埋め込み、表2点は markdown 表へ転記、リスクスコアの数式は LaTeX 転記)。除外なし。
## [2026-08-23] ingest-paper | Fault Injection in Production: Making the Case for Resilience Testing
- Source: `.raw/papers/Fault_injection_production.pdf`(ローカル PDF、著者提供。*Communications of the ACM* Vol.55 No.10, pp.48-52, 2012-10, doi:10.1145/2347736.2347751、全5ページ)
- Summary: [[@2012__CACM__Fault Injection in Production]]
- Pages created: なし(新規 entity・concept は 0 件。既存の [[John Allspaw]]・[[Etsy]]・[[GameDay]]・[[障害注入]] を更新)
- Pages updated: 更新 entity 2 件 — [[John Allspaw]]・[[Etsy]] / 更新 concept 2 件 — [[GameDay]]・[[障害注入]]
- Key insight: John Allspaw([[Etsy]] tech operations 責任者)が本番環境への障害注入(GameDay)を経営層向けに正当化した2012年の practice 記事。Etsy 新決済システムのロールアウトでの実施例を報告するとともに、GameDayの限界(想像力への依存、時間的プレッシャー下の対応訓練にはならない)、自動・継続的注入が「気づかれなくなる」ことで慢心を招くパラドックスを自ら論じる。本記事は [[GameDay]] 概念の初期の産業的定式化であり、後年の Bradesco・SportsEngine 等の事例(発見率のような成果指標を報告)より早く、GameDayの価値を「演習前の設計プロセスそのもの」に見出す視点を示した。また「注入したのに目立たない」という現象を、[[障害注入]] concept が技術的評価問題(silent fault、84.4% No Anomaly)として扱ってきたのに対し、本記事は組織文化の慢心問題として独立に指摘しており、両者を突き合わせる横断的知見を [[障害注入]]・[[GameDay]] の双方に追加した。
- 図表: 本文に Figure/Table への参照が一切ない(pull quote と1点の写真のみの構成)。唯一の埋め込みラスタ画像(雑誌の装飾的な人物写真、Photograph by meg/Flickr)は本文からの参照がない装飾画像のため埋め込みを除外し、`images.json` から除去した。表は本文中に存在しない。
## [2026-08-23] ingest-paper | Trade-Offs Under Pressure: Heuristics and Observations of Teams Resolving Internet Service Outages
- Source: `.raw/papers/allspaw-2015-tradeoffs-under-pressure.pdf`(Lund University LUP Student Papers、record 8084520、全87ページ)
- Summary: [[@2015__LundUniversity__Trade-Offs Under Pressure - Heuristics and Observations of Teams Resolving Internet Service Outages]]
- Pages created: 新規 entity 1 件 — [[Johan Bergström]] / 新規 concept 1 件 — [[診断ヒューリスティック]]
- Pages updated: 更新 entity 2 件 — [[John Allspaw]]・[[Lund University]] / 更新 concept 2 件 — [[Joint Activity]]・[[複雑システム障害論]]
- Key insight: [[John Allspaw]]([[Etsy]] CTO)が [[Lund University]] MSc in Human Factors and System Safety 課程で提出した修士論文(2015-09-07)。2014年12月4日の Etsy 実障害をプロセストレーシングで分析し、4つのヒューリスティック(直近変更との相関確認・探索範囲の拡張・過去/直近類似事例への収束・同僚レビュー優先の協調ヒューリスティック)を同定した。文献レビューが Joint Activity(Klein et al. 2005)を理論的支柱としており、協調エピソードのコーディングが Interpredictability・Common Ground を秒単位の発話ログとして具体化していることが判明したため [[Joint Activity]] に横断的知見を追加。また複雑システム障害論の命題12・17(人間の適応的役割・継続的な安全性の創発)を、4つのヒューリスティックという具体的手続きで経験的に裏付ける関係にあることを [[複雑システム障害論]] に記録した。本論文は Allspaw 自身の後年の著作(『ウェブオペレーション』7章、『SREの探求』28章)で繰り返し参照される一次資料。
- 図表: 本文参照図(Figure 1〜18のうち16点)を全点埋め込み。pdf.js 埋め込みラスタ抽出は12点、Figure 2・3・7・16の4点はベクター描画のため PyMuPDF キャプション座標クロップで取得(Figure 16はページが90度回転して埋め込まれていたため回転補正)。Figure 14・15(協調エピソード4・5)は抽出画像が Figure 10 の全体タイムラインと実質重複し単独切り出し不可のため Figure 10 で代替、チャットで報告済み。付録D・E(Figure 19-33、ダッシュボードスクリーンショット・ツール一覧)は本文からの参照がない付録専用図表のため除外。Table 1〜3(参加者内訳・コーディングスキーマ・コーダー間一致率)は本文中で数値のみ言及し markdown 表への転記はしていない。
- 備考: サンドボックス下で `node scripts/extract-paper-images.mjs` が複数回、埋め込み画像抽出後の atomic rename 前に無応答終了する事象が発生(原因不明、レンダリング処理自体は完走しファイルは生成されるが最終 rename に到達しない)。直近の一時ディレクトリから埋め込み画像(31点)を手動で最終配置し、`images.json` を再構築して復旧した。
## [2026-08-23] ingest-video | Measuring Reliability Culture to Optimize Tradeoffs: Perspectives from an Anthropologist
- Source: URL `https://www.youtube.com/watch?v=zH5bZ1aY6tE`(SREcon24 Americas 公式チャンネル)
- Transcript: `.raw/videos/youtube-zH5bZ1aY6tE/transcript.md`(YouTube 自動生成英語字幕、ローリングキャプション重複を除去して整形)
- Frames: `.raw/videos/youtube-zH5bZ1aY6tE/frames/`(90秒間隔、全12枚)
- Summary: [[@2024__SREcon24Americas__Measuring Reliability Culture to Optimize Tradeoffs]]
- Pages created: 新規 entity 1 件 — [[Kathryn Bouskill]]
- Pages updated: 更新 entity 1 件 — [[Meta]] / 更新 concept 1 件 — [[SRE文化]]
- Key insight: 講演者(人類学者)が示す「インサイダー/アウトサイダー」の2レンズは、[[SRE文化]] 概念が既存書籍群から積み上げてきた「文化的価値からプラクティスが有機的に発生する」という抽象的なモデルに、40人超のインタビュー・4波のサーベイ・質的コーディング(MaxQDA)という実測可能な測定方法論を与える。サーベイ結果(78%が信頼性を重視すると回答も約半数がギャップの優先順位づけに苦労)は、既存 concept が描く「SLO のない文化の2つの極端」よりも穏やかで現実的な中間状態を実測値として提示した。
- 備考: USENIX 公式ページ(curl + ブラウザ UA)にスライドPDF・動画へのリンクが掲載されておらず、`AskUserQuestion` でユーザーに確認のうえ `wiki-ingest-video` にフォールバックした。yt-dlp のデフォルト抽出は 403 で失敗し、`player_client=android` への切り替えとスクラッチパッド一時ディレクトリへのダウンロードで動画取得に成功、ffmpeg で音声・代表フレームを抽出後に動画本体は破棄した(vault には保存していない)。
## [2026-08-23] ingest-slides | A Political Scientist's Insights into Site Reliability Engineering
- Source: `.raw/slides/srecon21-krax-political-scientist/srecon21-krax-political-scientist.pdf`(全37ページ)
- Media: `.raw/slides/srecon21-krax-political-scientist/transcript.md`(YouTube 自動生成英語字幕、`yt-dlp --write-auto-sub` で取得。日本語字幕は HTTP 429 で失敗)
- Summary: [[@2021__SREcon21__A Political Scientist's Insights into Site Reliability Engineering]]
- Pages created: 新規 entity 1 件 — [[Michael Krax]] / 新規 concept 2 件 — [[政治学とSRE]]・[[ルーマンの社会システム理論とSRE]]
- Pages updated: 更新 concept 2 件 — [[ゲーム理論とSRE]]・[[複雑システム障害論]]
- Key insight: [[Michael Krax]]([[Google]] Dublin、政治学博士)が SREcon21(2021-10-12)で、国際関係理論・ゲーム理論(囚人のジレンマ)・Max Weber の権力論・Niklas Luhmann の社会システム理論を SRE のチームビルディングとシステム設計・デバッグに応用した。核心は「チームビルディングは適用された社会変化である」(ネットワーク型組織では権力行使コストが高いため、少人数の実験によるボトムアップの規範変化が外部強制・全員合意より低コストで持続する)と「複雑性を減らせるのは複雑性のみである」(Luhmann, 1987)の2命題。囚人のジレンマのSRE適用は[[ゲーム理論とSRE]](Barteneva, SREcon26, 2026)より5年早い先行例だった。
- 図表: 全37ページを画像として確認、うち10点を source ページに埋め込み。
- 備考: USENIX 公式ページ(curl + ブラウザ UA)から登壇者所属・発表日時・スライドPDF URL・YouTube 動画 URL を裏取りした(WebFetch は 403 のため curl フォールバックを使用)。質疑応答は録画に含まれず不明。
## [2026-08-23] ingest-slides | 10+ Deploys Per Day: Dev and Ops Cooperation at Flickr
- Source: `.raw/slides/10-deploys-per-day-flickr/pages/`(全78ページ、PDF原本なし。SlideShare のボット対策により `image.slidesharecdn.com` の個別スライド画像で代替)
- Media: `.raw/slides/10-deploys-per-day-flickr/transcript.md`(YouTube 自動生成英語字幕、`yt-dlp --write-auto-sub` フォールバックで取得)
- Summary: [[@2009__Velocity2009__10+ Deploys Per Day - Dev and Ops Cooperation at Flickr]]
- Pages created: なし(既存 entity/concept のみ更新)
- Pages updated: 更新 entity 4 件 — [[John Allspaw]]・[[Paul Hammond]]・[[Flickr]]・[[Ganglia]] / 更新 concept 3 件 — [[DevOps]]・[[フィーチャーフラグ]]・[[オンコール]]
- Key insight: John Allspaw・Paul Hammond による Velocity 2009 講演は devops.com 記事・『ウェブオペレーション』10章という secondary source 経由でのみ wiki に反映されていたが、本 ingest で primary source(スライド全78ページ+口頭説明)を直接確認した結果、「6ツール(自動化インフラ・共有バージョン管理・ワンステップビルド&デプロイ・フィーチャーフラグ・共有メトリクス・IRC/IMロボット)+4文化(敬意・信頼・障害への健全な態度・非難の回避)」という分解は2011年の書籍化以前、2009年の講演時点で既に完成した枠組みだったことが確認できた。p.7の「Opsは"No"と言う→誰も教えてくれない→サイトが予期せず落ちる」因果図とp.57の非難(fingerpointyness)タイムライン図は、後年の[[ポストモーテム]]・[[複雑システム障害論]]の議論に先行する視覚的な原型になっている。
- 図表: 全78ページを画像として確認、うち9点を source ページに埋め込み。
- 備考: PDF原本が存在しないためファイル名固定文字列 `no-pdf-cdn-jpg-fallback` を manifest hash に使用。
## [2026-08-23] ingest-book | ウェブオペレーション ―サイト運用管理の実践テクニック
- Source: `.raw/books/web-operations-ja/`(18 章 / 入力: pdf、279 ページ)
- Book entity: [[ウェブオペレーション ―サイト運用管理の実践テクニック]]
- Chapters: [[@2011__OReillyJapan__ウェブオペレーション - Chapter 1 ウェブオペレーション:キャリア]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 2 Picnik におけるクラウドコンピューティングの利用とその教訓]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 3 インフラとアプリケーションのメトリクス]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 4 継続的デプロイ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 5 コードとしてのインフラ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 6 監視]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 7 いかにして複雑なシステムは失敗するか]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 8 コミュニティ管理とウェブオペレーション]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 9 予期しないトラフィック急増への対応]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 10 開発と運用の協力と連携]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 11 訪問者の気持ち:ユーザ対面メトリクス]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 12 ウェブにおけるリレーショナルデータベースの戦略と戦術]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 13 障害を活用する:ふりかえりの技芸と科学]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 14 ストレージ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 15 非リレーショナルデータベース]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 16 アジャイルインフラストラクチャ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 17 夜中に聞こえる奇妙な物音(と、ぐっすり眠る方法)]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 18 日本の料理のインフラ]](18 件)
- Pages created: 新規 entity 33 件 — [[Adam Jacob]]・[[Alistair Croll]]・[[Anoop Nagwani]]・[[Baron Schwartz]]・[[Brian Moon]]・[[Cookpad]]・[[CouchDB]]・[[Eric Florenzano]]・[[Eric Ries]]・[[Flickr]]・[[Heather Champ]]・[[IMVU]]・[[Jake Loomis]]・[[Jesse Robbins]]・[[Justin Huff]]・[[Keepalived]]・[[Keynote Systems]]・[[Mike Brittain]]・[[Mike Christian]]・[[MogileFS]]・[[MySQL]]・[[Percona]]・[[Picnik]]・[[Sean Power]]・[[ServerManager]]・[[Squid]]・[[Yahoo!]]・[[dealnews.com]]・[[memcached]]・[[ウェブオペレーション ―サイト運用管理の実践テクニック]]・[[クラスタ免疫システム]]・[[濱崎 健吾]]・[[角 征典]] / 新規 concept 12 件 — [[Apdex]]・[[エンドユーザメトリクス]]・[[キャパシティ計画]]・[[コミュニティマネジメント]]・[[データ保護]]・[[ハイブリッドクラウド]]・[[バッチサイズ]]・[[プラクティスのコミュニティ]]・[[リアルユーザモニタリング]]・[[事業継続計画(BCP)]]・[[統合監視]]・[[継続的デプロイ]]
- Pages updated: 更新 entity 27 件 — [[Amazon Web Services]]・[[Andrew Clay Shafer]]・[[Apache Cassandra]]・[[Apache HBase]]・[[Bigtable]]・[[Chef]]・[[Chubby]]・[[Dynamo]]・[[Ganglia]]・[[Hatena]]・[[John Allspaw]]・[[Mark Burgess]]・[[Matthew L. Massie]]・[[MongoDB]]・[[Neo4j]]・[[New Relic]]・[[Patrick Debois]]・[[Paul Hammond]]・[[Puppet]]・[[Redis]]・[[Riak]]・[[Richard I. Cook]]・[[Theo Schlossnagle]]・[[Twitter]]・[[Xen]]・[[ZooKeeper]]・[[cfengine]] / 更新 concept 61 件 — [[CAP定理]]・[[DevOps]]・[[Infrastructure as Code]]・[[Just Culture]]・[[SRE組織変革]]・[[アクショナブルアラート]]・[[アラートアンチパターン]]・[[アラート疲労]]・[[アラート管理]]・[[イテレーションの長さ]]・[[イミュータブルインフラストラクチャ]]・[[インシデントレポート執筆]]・[[インシデント管理]]・[[インメモリデータベース]]・[[オンコール]]・[[オンコールストレス管理]]・[[クラウドコンピューティング]]・[[クラウドモニタリング]]・[[クロスインシデント分析]]・[[グレイ障害]]・[[コンテンツ配信ネットワーク]]・[[ゴシッププロトコル]]・[[スケーラビリティ障害]]・[[ソシオテクニカル負債]]・[[ソフトウェア変更管理]]・[[ダッシュボードとランブックの運用]]・[[データセンター信頼性]]・[[データベースリライアビリティエンジニアリング]]・[[データベース性能トラブルシューティング]]・[[ビジネスモニタリング]]・[[フィーチャーフラグ]]・[[ポストモーテム]]・[[ポランニーのパラドックス]]・[[マルチテナンシーのためのシャーディング]]・[[マルチリーダーレプリケーション]]・[[メトリクス削減]]・[[リーダーレスレプリケーション]]・[[レイテンシ分析]]・[[レプリケーションラグと読み取り整合性]]・[[ログ生成]]・[[ログ解析]]・[[ワークフロー自動化]]・[[一貫性ハッシュ法]]・[[二次インデックスのシャーディング戦略]]・[[分散キャッシュ]]・[[分散ストレージ]]・[[単一リーダーレプリケーション]]・[[可用性]]・[[変更起因インシデント]]・[[専用データベースシステム]]・[[専門職化と資格認定]]・[[差分可観測性]]・[[心理的安全性]]・[[技術的負債]]・[[時系列データベース]]・[[時系列トラフィックパターン検知]]・[[暗黙知]]・[[潜在的障害]]・[[継続的ベリフィケーション]]・[[複雑システム障害論]]・[[認知的徒弟制]]
- Key insight: 本書の価値は、体系化される**前**の運用知を、統合しないまま並べたことにある。最も鋭いのは 7 章と 13 章の対立で、7 章([[Richard I. Cook]])が「事故に単一の根本原因は存在しない」と述べる一方、13 章(Yahoo! のふりかえり実務)は「根本原因の特定はふりかえりの必須要素である」と説く。編者はこれを解消せず並べ、訳者も「経験則の違いも含めて『ウェブオペレーションのだいご味』」と書いている。この非統合性そのものが、定説の成立過程を残す資料になっている([[複雑システム障害論]]・[[ポストモーテム]]の両方に `[!contradiction]` として記録した)。あわせて、後に定説となる主張の**先行**がいくつも確認できた — 10 章の非難回避論は編者 [[John Allspaw]] 自身が Etsy で blameless postmortem を提唱する 2 年前(2010)に書籍として世に出ており、13 章の「合計顧客影響時間(TTR×影響顧客数)」は MTTR 批判に 14 年、16 章の「信頼の負債」は [[ソシオテクニカル負債]] の学術的定式化(2015)に 4 年、6 章の flapping 記述は 2022 年 DSN のアラートアンチパターン A4 に 11 年先行する。
- 図表: 本文が参照する図 54 点を全点埋め込み(未マッチ 0 件・未使用 attachment 0 件)。キャプションが `GothicBBBPr5-Medium` 7.1pt 単独で本文明朝を含まないという判別条件を 1 回調べ、描画要素(`get_drawings()`+`get_image_rects()`)から図領域を推定して一括クロップした。表は画像化せず、必要なものを各章本文に markdown 表として転記。
- 章分割: PDF アウトラインの level 1 がそのまま本編 18 章の一覧になっていたが、初回の自動検出は節見出しを拾って 89 章に化けた。`toc.txt` の level 1 から開始ページを読み取り `--chapters` で再分割し、各章冒頭の章題を目視確認した。印字ノンブル = PDF ページ − 21。
- 備考: 原書 *Web Operations*(O'Reilly, 2010)全 17 章 + 日本語版のみに書き下ろされた 18 章(クックパッド、濱崎健吾)。**原本 9 章の章扉バイラインが 8 章と同じ「ヘザー・チャンプ、ジョン・オルスポー」と誤植されている**が、巻末寄稿者紹介と本文内容(dealnews.com の実務エッセイ)から執筆者は [[Brian Moon]] と確定し、wiki 側はそちらで記録した。7 章は既存 source [[@1998__CtL__How Complex Systems Fail]] と同一論説の書籍収録版で、§7.2 全体が原論説に存在しない書き下ろしであることを本文突合で確認した。
- 並行状況: 同一 vault で別セッションが論文 3 本と『Software-Defined Networks: A Systems Approach』を並行 ingest していたため、コミット対象は差分の中身で本書分のみを機械的に分類して確定した(本書分 151 件)。相手の 3 コミットに本書分の巻き込みがないことも `git show --name-only` で確認済み。
## [2026-08-23] ingest-book | Software-Defined Networks: A Systems Approach
- Source: `.raw/books/software-defined-networks-systems-approach/`(12 枚 / 入力: web 章別ページ https://sdn.systemsapproach.org/)
- Book entity: [[Software-Defined Networks - A Systems Approach]]
- Chapters: [[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Foreword]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Preface]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 1 Introduction]]〜[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 10 Future of SDN]](12 件)
- Pages created: 新規 entity 17 件 — [[Atomix]]・[[Brian O'Connor]]・[[Carmelo Cascone]]・[[GENEVE]]・[[OF-DPA]]・[[ONOS]]・[[OVN]]・[[Open Compute Project]]・[[Open Network Linux (ONL)]]・[[Open vSwitch (OVS)]]・[[P4Runtime]]・[[SAI (Switch Abstraction Interface)]]・[[SD-Fabric]]・[[Software-Defined Networks - A Systems Approach]]・[[Stratum]]・[[Thomas Vachuska]]・[[gNMI]] / 新規 concept 2 件 — [[ソフトウェア定義アクセスネットワーク]]・[[ネットワークオペレーティングシステム]]
- Pages updated: 更新 entity 16 件 — [[Aether]]・[[Broadcom]]・[[Bruce Davie]]・[[Google]]・[[Intel Tofino]]・[[Larry Peterson]]・[[Nicira]]・[[Nick McKeown]]・[[O-RAN Alliance]]・[[Open Networking Foundation]]・[[OpenFlow]]・[[P4]]・[[SONiC]]・[[Scott Shenker]]・[[VMware]]・[[YANG]] / 更新 concept 19 件 — [[5Gモバイルネットワーク]]・[[インバンドネットワークテレメトリ]]・[[オーバーレイネットワーク]]・[[オープンソースソフトウェア開発]]・[[コンテナネットワーク分離]]・[[システムズアプローチ]]・[[ソフトウェア定義ネットワーク]]・[[データセンターL2ファブリック]]・[[データセンターネットワークトポロジ]]・[[ネットワーク仮想化]]・[[ネットワーク自動化]]・[[フィードバックループ]]・[[プログラマブルデータプレーン]]・[[レイヤリング]]・[[分散コンセンサス]]・[[抽象化(ソフトウェア設計)]]・[[負荷分散]]・[[階層的ルーティングとアドレス集約]]・[[集権化と非集権化]]
- Key insight: 本書の第一原理は**ディスアグリゲーション**であり、「集中対分散」「プログラマブル対固定機能」はそこから派生する 2 本の設計軸として整理される(第 1 章)。この整理が効くのは、同じ分離の型がスタックのどの層でも反復して現れるからである — 第 4 章の論理パイプライン(`arch.p4` が V1Model/PSA/TNA としてベンダー ASIC を隠す)、第 5 章の契約自動生成(P4 コンパイラが P4Runtime の protobuf 契約を、YANG ツールチェーンが gNMI の gRPC 実行環境を、それぞれ同型の手順で生成する)、第 6 章の分散コア([[Atomix]] の Raft ベース分散マップが「論理的に集中」を実装として成立させる)、第 9 章の RIC(A1/E2 が gNMI/gNOI・OpenFlow に対応する位置を占め、Network OS の構造がそのまま RAN へ輸入される)。第 10 章はこれを 3 フェーズ論に束ね、ディスアグリゲーションが構成的な**検証可能性 (verifiability)** の前提になるとして次段階を展望する。既存 concept との突き合わせでは [[レイヤリング]] が特に実りがあった — RIA(合成的レイヤリング)の「層」と SDN ソフトウェアスタックの「層」は同じ語を使いながら分割の軸が違う。章をまたいだ論証の隙も 1 件記録した(第 8 章 §8.6 の「ネットワーク仮想化は SDN か」への答えが、第 2 章の「Nicira の結合は disaggregation を実現していない」という批判に直接答えていない)。
- 図表: 本文が参照する図 61 点を全点埋め込み(未マッチ 0 件・未使用 attachment 0 件)。
- 備考: 公開サイトは GitHub `SystemsApproach/SDN` の `master`(Version 2.1-dev)から連続生成されるため、**図の原本はリポジトリの `figures/` から取り、本文はレンダリング済み HTML を pandoc で markdown 化した**。HTML 側は図番号が書籍全体の通し番号として解決済みで、`<figure>` タグから「図番号・キャプション・画像ファイル」を 1 パスで機械的に対応づけられる(rst の `figure::` ディレクティブ数 61 と一致を確認)。ライセンスは CC BY-NC-ND 4.0、印刷版の最新は `v2.0` タグ、Preface の署名は 2021 年 11 月。巻末の *Hands-on Programming*(VM 導入手順とチュートリアルへのリンクが主体)・*About The Book* / *About The Authors* は source 化せず、著者略歴は書誌そのものを出典として著者 entity に織り込んだ。fan-out 中に検出・修正した事故が 2 件ある: (1) Preface 担当と第 4 章担当が [[Open Compute Project]] を二重に作り後勝ちで上書きされたため、失われた Preface 由来の記述(OCP=ハードウェア仕様・認証 / ONF=ソフトウェア実装 という役割分担)をオーケストレータが復元した。(2) entity `SD-Fabric (Trellis)` は原本の散文に "Trellis" が一度も現れず(全 6 件が HTML アンカーと URL スラッグ由来)、conventions §4 に従って [[SD-Fabric]] へ改名し `Trellis` を alias に落とした。ONF と ON.Lab の統合年について既存ページ(2017 年)と本書(2018 年)が食い違う点は contradiction callout で両論を残した。
- 並行状況: 同一 vault で別セッションが『ウェブオペレーション』(`web-operations-ja`)を並行 ingest していたため、コミット対象は差分の中身で本書分のみを機械的に分類して確定した(本書分 67 件)。
## [2026-08-23] ingest-paper | Over the Memory Wall, Into the Instruction Wall: The New Bottleneck in GPU Data Processing
- Source: `.raw/papers/arxiv-2608.13696v1.pdf`
- Summary: [[@2026__arXiv__Over the Memory Wall, Into the Instruction Wall - The New Bottleneck in GPU Data Processing]]
- Pages created: 新規 entity 7 件 — [[Sven Hepkema]]・[[Bowen Wu]]・[[Yannis Chronis]]・[[Gustavo Alonso]]・[[cuDF]]・[[Valk]]・[[Maximus]]
- Pages updated: 更新 entity 4 件 — [[Christos Kozyrakis]]・[[ETH Zürich]]・[[NVIDIA GH200]]・[[NVIDIA Nsight Systems]] / 更新 concept 5 件 — [[Rooflineモデル]]・[[GPU占有率(Occupancy)]]・[[Instruction-Level Parallelism (GPU)]]・[[GPU観測性]]・[[メモリウォール]]
- Key insight: GPUのメモリ帯域幅がCUDAコアの命令スループットより急速に増加するハードウェアトレンド(P100→Rubinで30.1倍対5.4倍)により、[[Rooflineモデル|Roofline]]のridge lineがソフトウェア側の努力とは無関係にシフトし、同一のcuDFカーネル実装でもGPU世代が変わるだけでメモリバウンド/演算バウンドの分類が逆転する(L4で74.1%メモリバウンド→GH200で77.5%演算バウンド)。占有率・命令レベル並列性を理想的に引き上げてもGH200上ではカーネル時間の53%が命令スループットバウンドのまま残り、[[メモリウォール]]という概念が「解消できない壁」ではなく「解消されると別の壁(命令の壁)へ置き換わる壁」であることを、GPUデータベースという新しいドメインで実測により裏づけた。複数プロファイラ(Nsight Systems・Nsight Compute・Maximus)を統合するメタプロファイラ[[Valk]]は、eBPF系の「ベンダーツール回避」とは異なる「既存ベンダーツールの突き合わせ」という第三の統合戦略をGPU観測性に加えた。
- 図表: 本文が参照する図9点(Figure 1〜9)・表9点(Table 1〜9)を全点埋め込み(未マッチ0件)。Figure 3(Valk UIスクリーンショット)はpdf.js埋め込みラスタ画像として取得、残り8点はすべてベクター描画のためPyMuPDFキャプション座標クロップで一括切り出しした。
- 備考: 著者陣は[[ETH Zürich]] Systems Group([[Gustavo Alonso]]研)。同グループが開発したクエリエンジン[[Maximus]](Proc. ACM Manag. Data 2025)を実験基盤として使用しており、GPU上のjoin・group-by処理を専門とする[[Bowen Wu]]の既往研究群(Eiger・Terabyte-Scale Analytics等)とも系譜が繋がる。[[Christos Kozyrakis]]はNVIDIA & Stanford University所属として記載され、[[FailSafe]]論文と同様のNVIDIA Research所属が確認できる。
## [2026-08-23] ingest-paper | ChainCraft: Bridging Causal Discovery and LLM Reasoning for Failure Prediction in Microservices
- Source: `.raw/papers/ISSRE2026_paper_3511.pdf`
- Summary: [[@2026__ISSRE__ChainCraft - Bridging Causal Discovery and LLM Reasoning for Failure Prediction in Microservices]]
- Pages created: 新規 entity 1 件 — [[Boxuan Zhao]]
- Pages updated: 更新 entity 12 件 — [[Yongxin Zhao]]・[[Yongqian Sun]]・[[Jingyu Wang]]・[[Junhua Kuang]]・[[Shenglin Zhang]]・[[Wenwei Gu]]・[[Li Shi]]・[[Wei Li]]・[[Liping Zhang]]・[[Dan Pei]]・[[Nankai University]]・[[Alibaba Group]]・[[Tsinghua University]] / 更新 concept 3 件 — [[障害予測]]・[[因果発見]]・[[LLMによる根本原因分析]]
- Key insight: メトリクス駆動の因果発見(PCMCI)を LLM 推論の生成的制約として組み込む設計により、教師データへの依存を抑えつつ解釈可能な異常伝播チェーンを生成する。アブレーションで PCMCI 除去(C1)が最大の性能低下(DeepSeek-V4 で F1 0.845→0.729)をもたらし、因果グラフが LLM 生成タスクを制約する足場として機能することを定量的に裏づけた。Alibaba 実運用データ(100件アラート)で F1=0.875(最良ベースライン CoT/ReAct 比 +22%)を達成し、3か月間の Alibaba 本番デプロイで OCE が予測精度80.8%(26件中21件)を確認、予防的緩和を約30分から約5分に短縮した。Structural/Temporal Checker + Chain Critic + Chain Refiner による閉ループ洗練と、症状類似度+グラフ構造的チェーン類似度を統合するハイブリッド検索が、[[LLMによる根本原因分析]]で蓄積してきた「事後検証」「外部知識制約」パターンを、[[障害予測]](pre-hoc)という異なる時間軸のタスクへ移植した事例として位置づけられる。
- 図表: 本文が参照する図4点(Fig.1 問題設定・Fig.2 フレームワーク全体像・Fig.3 デプロイアーキテクチャ・Fig.4 ケーススタディ)を全点 PyMuPDF キャプション座標クロップで取得・埋め込み(未マッチ 0 件)。pdf.js の埋め込み画像抽出は34点(いずれも図中の装飾アイコン、ノイズ除去のため除外)。表 Table I(全体性能比較)は markdown 表として本文に転記した。
- 備考: 著者陣(Yongxin Zhao・Yongqian Sun・Jingyu Wang・Junhua Kuang・Shenglin Zhang・Wenwei Gu)は既存の LagRCA・OScope・OpsMem 等と重複する Nankai University AIOps グループ。Alibaba Group 側(Boxuan Zhao・Li Shi・Wei Li・Liping Zhang)も OScope・Bifrost と重複する共同研究陣。診断(post-hoc RCA)中心だった同グループの研究射程に、障害発生前の先回り予測という新しい時間軸が加わった一本。
## [2026-08-23] ingest-paper | LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures
- Source: `.raw/papers/arxiv-2608.15242v2.pdf`
- Summary: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]
- Pages created: 新規 entity 7 件 — [[Yunfei Zhang]]・[[Boyu Feng]]・[[Institute of Computing Technology, Chinese Academy of Sciences]]・[[SWE-bench Pro]]・[[TravelPlanner]]・[[VitaBench]]・[[WebArena Verified]] / 新規 concept 1 件 — [[エージェント障害帰属]]
- Pages updated: 更新 entity 10 件 — [[Changhua Pei]]・[[Dan Pei]]・[[Gaogang Xie]]・[[Jingjing Li]]・[[Zexin Wang]]・[[Difeng Ma]]・[[Chongqing University]]・[[Tongyi Lab]]・[[Terminal-Bench]]・[[DeepSeek-V4]] / 更新 concept 1 件 — [[エージェント修復]]
- Key insight: 責任役割の特定(RCTA で 51.1%)と根本原因ステップの厳密局所化(24.1%)は精度が大きく乖離する 2 つの独立した診断能力であり、単一指標での評価は一方の弱点を覆い隠す。5 ベンチマーク(SWE-bench Pro・Terminal Bench 2・TravelPlanner・VitaBench・WebArena Verified)から集めた 1,140 件の非注入失敗軌跡は平均 156.3 ステップ・root-to-end distance 中央値 48(最大 605)に達し、49.0% の軌跡で根本原因の後に 50 ステップ超が続く。提案手法 RCTA(セグメント要約による広域検索+ハンドオフ指示への遡及照合)は同一バックボーン(DeepSeek-V4-Flash)で最強ベースライン ECHO を全指標で上回った。アノテーション完全一致率(役割 65.9%・根本原因ステップ 39.5%)の低さは、根本原因の厳密位置特定というタスク自体に本質的な曖昧性があることを示す。
- 図表: 本文が参照する図 6 点を全点取得・埋め込み(未マッチ 0 件)。図はすべてベクター描画のため pdf.js の埋め込み画像抽出では取得できず、PyMuPDF のキャプション座標クロップ(page.get_text("blocks") でキャプション y 座標を特定し page.get_pixmap(clip=...) で切り出し)で一括取得した。
- 備考: 「エージェント障害帰属」を新設概念とした。既存の [[エージェント修復]] は「診断結果を使って実際に実行を修正する」ところまでを射程に含む問題設定であり、診断そのものの正確さに閉じる本概念とは異なる。著者陣(Changhua Pei・Dan Pei・Gaogang Xie・Jingjing Li・Zexin Wang・Difeng Ma)は CNIC/CAS の既存 RCA/AIOps/時系列研究グループと重複しており、AgentTether・PROBE(グラフ誘導のエージェント障害診断・修復)に続く同グループの研究射程拡張として位置づけた。
## [2026-08-22] ingest-book | The Real Internet Architecture: Past, Present, and Future Evolution
- Source: `.raw/books/the-real-internet-architecture/`(6 章 / 入力: pdf・340 ページ)
- Book entity: [[The Real Internet Architecture]]
- Chapters: [[@2024__PrincetonUP__The Real Internet Architecture - Chapter 1 Introduction]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 2 Describing Networks and Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 3 Composing Networks and Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 4 The Real Internet Architecture]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 5 Patterns for Enhanced Network Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 6 Ideas for a Better Internet]](6 件)
- Pages created: 新規 entity 5 件 — [[John Day]]・[[Pamela Zave]]・[[Resilient Overlay Networks]]・[[The Real Internet Architecture]]・[[Tor]] / 新規 concept 7 件 — [[サブダクション]]・[[セッションアーキテクチャ]]・[[ネットワークの一様記述モデル]]・[[ブリッジング]]・[[モジュラー検証]]・[[レイヤリング]]・[[硬直化(ossification)]]
- Pages updated: 更新 entity 3 件 — [[David D. Clark]]・[[Jennifer Rexford]]・[[P4]] / 更新 concept 15 件 — [[5Gモバイルネットワーク]]・[[MPLS]]・[[QUIC]]・[[エニキャストルーティング]]・[[エンドツーエンド論]]・[[オーバーレイネットワーク]]・[[セキュリティ設計原則]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク仮想化]]・[[プロキシとエージェント]]・[[命名]]・[[形式手法]]・[[軽量形式手法]]・[[階層的ルーティングとアドレス集約]]
- Key insight: 本書の主張の核は「合成演算子は 3 つしかない」という**閉じた主張**にある。ブリッジング(対等なネットワークの接合)とレイヤリング(オーバーレイのリンクをアンダーレイのセッションで実装する)に、共有リンクを介してレイヤリングの不連続を埋めるサブダクションを加えた 3 つで、AS 間接続・BGP・NAT・VPN・VLAN・階層化 MPLS・Tor・RON・クラウド・モビリティ・マルチキャスト・ファイアウォール通過までが説明できるという構成を、本書は 6 章かけて実演する。この閉じた語彙が硬直化(ossification)論への反論を可能にしている — 狭いくびれ(narrow waist)が変わらないことは進化の不在を意味せず、進化はレイヤリングとサブダクションの側で起きてきた、というのが 2013 年の AT&T バックボーンで観測された 11 ヘッダーのパケット(図1.4)が示す物証である。この論点は [[砂時計モデル]] が同じくびれを「進化を可能にした美点」として肯定的に描くのと**観察の焦点が正反対**であり、[[硬直化(ossification)]] にその対比を記録した。
- 図表: 本文が参照する図 92 点を全点切り出し・埋め込み(未マッチ 0 件・未使用 attachment 0 件)。表 Table 2.1〜6.2 は画像化されていないため本文テキストから markdown 表として書き起こした。
- 備考: PDF アウトラインの level 1 に 6 章がそのまま並んでいたが、既定の章検出は level 2 の節見出しまで拾って `chapters_count=45` に化けたため `--chapters "7=15,1=19,2=62,3=126,4=179,5=224,6=277,8=313"` で再分割した(7 = 序文、8 = 用語集以降を切り離すダミー章)。340 ページのため画像一括抽出はスキップし、キャプション `FIGURE N.M.` ブロックと直上の未使用画像矩形を対応づける 1 パスで 92 点を切り出した(スキャン PDF ではないため `get_image_rects()` が使えた)。序文と用語集は source 化せず、序文由来の記述は書誌自身を出典として book entity・著者 entity に織り込んだ。fan-out 中に「本書の合成演算子は 2 つ」というオーケストレータ側の誤った示唆を第 3 章担当へ投入してしまい、原本 grep で 3 つ(bridging・layering・subduction)と確認して走行中に訂正した。
## [2026-08-22] ingest-book | Computer Networks: A Systems Approach (6th Edition)
- Source: `.raw/books/computer-networks-a-systems-approach-6e/`(Preface + 全 9 章 = 10 ページ分 / 入力: web・章別ページ 75 枚 / CC BY 4.0)
- Book entity: [[Computer Networks - A Systems Approach]]
- Chapters: [[@2020__SystemsApproach__Computer Networks - A Systems Approach - Preface]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 1 Foundation]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 2 Direct Links]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 3 Internetworking]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 4 Advanced Internetworking]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 5 End-to-End Protocols]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 6 Congestion Control]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 7 End-to-End Data]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 8 Network Security]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 9 Applications]](10 件)
- Pages created: 新規 concept 7 件 — [[MPLS]]・[[オーバーレイネットワーク]]・[[コンテンツ配信ネットワーク]]・[[フレーミング]]・[[誤り検出符号]]・[[適応ビットレートストリーミング]]・[[階層的ルーティングとアドレス集約]]
- Pages updated: 更新 entity 6 件 — [[Bruce Davie]]・[[Computer Networks - A Systems Approach]]・[[Netflix]]・[[OpenFlow]]・[[P4]]・[[YANG]] / 更新 concept 17 件 — [[5Gモバイルネットワーク]]・[[QUIC]]・[[インバンドネットワークテレメトリ]]・[[エニキャストルーティング]]・[[クラウドコンピューティング]]・[[クラウドスケールRPC特性]]・[[システムズアプローチ]]・[[ソフトウェア定義ネットワーク]]・[[データセンター輻輳制御]]・[[ネットワーク仮想化]]・[[ネットワーク監視]]・[[ネットワーク自動化]]・[[バイナリエンコーディング]]・[[バッファブロートとキュー管理]]・[[一貫性ハッシュ法]]・[[待ち行列理論]]・[[砂時計モデル]]
- Key insight: 本書の編成そのものが主張になっている。各章は解くべき問題の定義(`Problem:` 節)から始まり、層構造に沿って進みながら層構造を絶対視しない。その最も明快な例が輻輳制御で、著者らはこれをトランスポート層に押し込めず独立した第 6 章として扱い、Preface でその判断を「システムズアプローチ」の実践そのものとして説明している。第 6 版はここに 2 つの装置を加えた。各章末の Perspective 節が第 1 章の `Feature Velocity` から第 9 章の `The Cloud is the New Internet` までクラウド化(Cloudification)という 1 本の線を通し、本文中の Key Takeaway(全 9 章で 28 件)が周囲の記述から設計則を 1 つずつ蒸留する。くびれの位置が IP から HTTP へ移りつつあるという第 5 章 Perspective の主張は、[[砂時計モデル]] にとってこの vault で最も重要な積み増しになった。
- 図表: 本文が参照する図 245 点を全点取得・埋め込み(未マッチ 0 件・未使用 attachment 0 件)。Sphinx が生成する web 版のため図は `_images/` に PNG として直接置かれており、キャプション座標クロップもフォント判別も不要だった。
- 備考: 入力形態は章別ウェブページ(75 ページ)。**当初 defuddle で clean markdown 化したところ、Sphinx の一部 `<section>` を丸ごと落としていた**(第 3 章で見出し 3・Key Takeaway 2・図 6 点、第 6 章で見出し 6・図 1 点、第 7 章で見出し 5・図 3 点)。BeautifulSoup で articleBody の DOM を明示的に走査する抽出器を書き直し、HTML の見出し数・Key Takeaway 数・図参照数が全 10 章で1:1 一致することを確認してから確定させた(図は 238 → 245 点に増えた)。defuddle は図の相互参照(「Figure 152 illustrates ...」)も落としており、旧版では図番号が抜けた文が残っていた。前付は Preface のみ source 化し、Foreword 2 本は book entity の書誌・位置づけに織り込んだ(出典は書誌自身を指す)。
## [2026-08-22] ingest-book | Principles of Computer System Design: An Introduction, Part II
- Source: `.raw/books/principles-of-computer-system-design-part-ii/`(5 章 / 入力: MIT OCW サイトダンプの章別 PDF)
- Book entity: [[Principles of Computer System Design]]
- Chapters: [[@2009__MITOCW__Principles of Computer System Design - Chapter 7 The Network as a System and as a System Component]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 8 Fault Tolerance - Reliable Systems from Unreliable Components]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 9 Atomicity - All-or-Nothing and Before-or-After]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 10 Consistency]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 11 Information Security]](5 件)
- Pages created: [[M. Frans Kaashoek]]・[[Principles of Computer System Design]] / [[セキュリティ設計原則]]・[[バージョン履歴]]・[[信頼計算基盤(TCB)]]・[[情報フロー制御]]・[[永続性のマントラ]]・[[認可モデル]]・[[調停(Reconciliation)]]
- Pages updated: [[Butler W. Lampson]]・[[Jerome H. Saltzer]]・[[Jim Gray]]・[[Michael D. Schroeder]]・[[University of Wisconsin]]・[[Van Jacobson]] / [[Capability-based Security]]・[[TCP輻輳制御アルゴリズム]]・[[エンドツーエンド論]]・[[クォーラムベースレプリケーション]]・[[クラッシュリカバリ]]・[[クロック同期と信頼性]]・[[システム信頼性モデル]]・[[ゼロトラスト]]・[[トランスポートプロトコル設計]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ハードディスク信頼性]]・[[パスキー認証]]・[[フォールトトレランス]]・[[メモリ階層とキャッシュ]]・[[ロストアップデートと書き込みスキュー]]・[[信頼性工学]]・[[分散トランザクション]]・[[外部一貫性]]・[[直列化可能性]]・[[結果整合性]]・[[複製ステートマシン]]
- Key insight: 第7章のベストエフォート契約(パケットは失われ、重複し、順序が変わる)という不完全な土台の上に、第8章が冗長性で不完全さを覆う一般理論を、第9章が原子性という「全か無か」の保証を、第10章が複数複製への拡張を、第11章が敵対的な相手のいる環境への拡張を順に積む構造を持つ。設計原則に名前を与えて章をまたいで再参照する体裁が本書の方法であり、**End-to-end argument** は第7章 §7.2.5 で層モデルから導かれたのち第8章 §8.6.2 で耐障害性の文脈から再検討される。第9章 §9.1.6 の external time consistency は Spanner(2012)の外部一貫性と同一の概念を3年先行して「直列化可能性より強い正しさ要件の一般形」として述べたもので、本書が扱う要件のいくつかは後年の実装が追いついた形になっている。
- 図表: 本文が参照する図 111 点を全点取得・埋め込み(未マッチ 0 件・未使用 attachment 0 件)。図はすべてベクター描画で埋め込み画像が取れないため、キャプションラベル(`FIGURE N.M`、Verdana 大文字 9pt)と、ノイズ除去したベクター描画クラスタを矩形間距離で対応づける方式で一括切り出しした。キャプションが図の左に置かれる横並びレイアウトがあるため、上下だけでなく左右も含めた最近傍マッチにしてある。
- 備考: 本 ingest と並行して別セッションが *Computer Networks: A Systems Approach* 6e を ingest しており、[[ネットワークアーキテクチャ]]・[[TCP輻輳制御アルゴリズム]]・[[トランスポートプロトコル設計]] の 3 ページには両 ingest の追記が同一コミットに混在する。他のページに混在はない。
## [2026-08-22] ingest-book | ネットワークシステムについて語るときに我々の語ること
- Source: `.raw/books/network-system-ni-tsuite-kataru/`(13 ページ分 / 入力: pdf・256 頁 / 全 12 章 + 前付「本書に寄せて」)
- Book entity: [[ネットワークシステムについて語るときに我々の語ること]]
- Chapters: [[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Front Matter 本書に寄せて]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 1 イントロダクション]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 2 システムとネットワークのアーキテクチャ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 3 オープンソースソフトウェア]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 4 システム設計における判断]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 5 SDN:ソフトウェア定義ネットワーク]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 6 集権化と非集権化]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 7 TCPの考古学]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 8 セキュリティ:負の目標]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 9 5G:対照的なアーキテクチャ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 10 SmartNIC、IPU、DPU]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 11 ネットワーク管理は今やクールな仕事だ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 12 Looking Over The Fence (垣根をこえて)]]
- Pages created: 新規 entity 44 件 — [[3GPP]]・[[AWS Nitro]]・[[ActivityPub]]・[[Aether]]・[[Bruce Davie]]・[[Computer Networks - A Systems Approach]]・[[David Ward]]・[[Donald Michie]]・[[Emily Bender]]・[[Fediverse]]・[[Guido Appenzeller]]・[[Homa]]・[[Intel IPU]]・[[John Kindervag]]・[[John McPhee]]・[[Kostadis Roussos]]・[[Larry Peterson]]・[[MENACE]]・[[Mastodon]]・[[Michael D. Schroeder]]・[[Multics]]・[[Nicira]]・[[Nick McKeown]]・[[Niklaus Wirth]]・[[O-RAN Alliance]]・[[Oguz Sunay]]・[[Open Networking Foundation]]・[[OpenFlow]]・[[P. H. Winston]]・[[P4]]・[[Private 5G - A Systems Approach]]・[[Project Monterey]]・[[Rodney Brooks]]・[[Stephen Wolfram]]・[[Steve Deering]]・[[Tracy Kidder]]・[[Twitter]]・[[VMware]]・[[Vint Cerf]]・[[YANG]]・[[ネットワークシステムについて語るときに我々の語ること]]・[[モリスワーム]]・[[ラムダノート]]・[[進藤資訓]] / 新規 concept 20 件 — [[5Gモバイルネットワーク]]・[[GitOps]]・[[QUIC]]・[[エレガンス(システム設計)]]・[[オープンソースソフトウェア開発]]・[[システムズアプローチ]]・[[ゼロトラスト]]・[[ソフトウェア定義ネットワーク]]・[[トランスポートプロトコル設計]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク仮想化]]・[[ネットワーク自動化]]・[[パスキー認証]]・[[ブロックチェーン]]・[[プログラマブルデータプレーン]]・[[反復可能性]]・[[砂時計モデル]]・[[量子計算]]・[[集権化と非集権化]]
- Pages updated: 更新 entity 21 件 — [[Amin Vahdat]]・[[Cisco]]・[[David D. Clark]]・[[David P. Reed]]・[[Edsger W. Dijkstra]]・[[Envoy]]・[[Facebook]]・[[Frank Kelly]]・[[Fred Brooks]]・[[Intel]]・[[Istio]]・[[Jerome H. Saltzer]]・[[John Ousterhout]]・[[Kubernetes]]・[[Linux Foundation]]・[[Martin Casado]]・[[PlanetLab]]・[[Scott Aaronson]]・[[Scott Shenker]]・[[Snowflake Computing]]・[[Van Jacobson]] / 更新 concept 32 件 — [[LLMのハルシネーション]]・[[LLM意味表象]]・[[LLM算術機構]]・[[TCP接続局所性]]・[[TCP輻輳制御アルゴリズム]]・[[インターネットスケールサービス設計]]・[[インバンドネットワークテレメトリ]]・[[エニキャストルーティング]]・[[エンドツーエンド論]]・[[オブザーバビリティ]]・[[オープンLLM開発]]・[[クラウドスケールRPC特性]]・[[サービスメッシュ]]・[[スマートNICオフロード]]・[[セキュリティカオスエンジニアリング]]・[[データセンター輻輳制御]]・[[トレードオフ意思決定]]・[[ドメイン固有アーキテクチャ]]・[[バッファブロートとキュー管理]]・[[ユーザーレベルTCPスタック]]・[[分散コンセンサス]]・[[分散コンピューティングの誤謬]]・[[性能を意識した設計]]・[[技術的負債]]・[[抽象化(ソフトウェア設計)]]・[[最終目標なき設計]]・[[脆弱性バジェット]]・[[複雑ネットワーク]]・[[設定ミス脆弱性]]・[[設計の一貫性]]・[[設計要件の確立]]・[[通常設計と急進的設計]] / index・各 `_index`・hot・manifest
- Key insight: 「システムズアプローチ」(問題定義から教訓抽出までを反復する方法論)を軸に、砂時計モデル・SDN・輻輳制御・セキュリティ・5G・SmartNIC・ネットワーク管理という個別領域を横断して、「何を不動点として固定し、何を後から決められるようにするか」という同一の判断軸が繰り返し現れることを示す。個々のエッセイには著者らが当事者として関わった [[PlanetLab]]・[[Open Networking Foundation]]・[[Nicira]]・[[Aether]] の回顧が含まれ、SDN 黎明期の一次証言としての価値を持つ。
- 図表: 本文が参照する図 19 点を全点取得・埋め込み。和書キャプションはゴシック `HiraKakuPro-W3` 7.4pt、本文中の図参照は明朝 8.4pt という組版差でキャプションだけを機械的に判別し、PyMuPDF のキャプション座標クロップで一括切り出しした(未マッチ 0 件・未使用 attachment 0 件)。
- 備考: 入力は書籍全体 PDF(256 頁)。PDF アウトラインの level 1 がそのまま章一覧だったため `--chapters` で章境界を手動指定し、索引・著者略歴・奥付をダミー章で切り離した。訳者前書きは source 化せず book entity の書誌・成立事情に織り込み、「本書に寄せて」([[David Ward]])のみ Front Matter として 1 枚 source 化した。出典表記は印字ノンブル(PDF ページ − 10)に統一。全 13 章を Sonnet 5 subagent へ 1 章 1 体でローリング委譲した。
## [2026-08-22] ingest | Blameless PostMortems and a Just Culture
- Source: `.raw/articles/blameless-postmortems-2026-08-22.md`(元URL: https://www.etsy.com/codeascraft/blameless-postmortems)
- Summary: [[@2012__EtsyCodeAsCraft__Blameless PostMortems and a Just Culture]]
- Pages created: [[Just Culture]]
- Pages updated: [[John Allspaw]]、[[Etsy]]、[[Sidney Dekker]]、[[Erik Hollnagel]]、[[ポストモーテム]]、index/hot/manifest
- Key insight: [[John Allspaw]] が2012年に [[Etsy]] Code as Craft ブログへ投稿した、「ブレームレスポストモーテム」の起源的一次資料。[[Sidney Dekker]] の Bad Apple Theory への対抗として [[Just Culture]] を導入し、「非難・恥・処罰」の7段階自己強化サイクルと「第一の物語 / 第二の物語」(Woods & Cook)の対比を提示した。同じ Etsy から4〜6年後の [[Will Gallego]] 講演(2016年・2018年)は、本記事の主張を理論用語で再定式化したものと位置づけられる。
- 備考: 直接 WebFetch/curl は Etsy の DataDome bot 対策により 403 で失敗。Wayback Machine スナップショット(2026-04-27T10:32:57Z)を curl で取得し、defuddle でクリーンな Markdown を抽出した。
## [2026-08-22] ingest-paper | Resilience and Stability of Ecological Systems
- Source: `.raw/papers/Holling-1973.pdf`
- Summary: [[@1973__AnnRevEcolSyst__Resilience and Stability of Ecological Systems]]
- Pages created: [[C. S. Holling]]、[[レジリエンス]]
- Pages updated: [[University of British Columbia]]、index/hot/各 `_index`/manifest
- Key insight: 「レジリエンス(状態変数・駆動変数・パラメータの変化を吸収して関係性を維持する能力)」と「安定性(平衡への回帰の速さと確実性)」を独立した性質として定義し分離する。現実の生態系は複数の「アトラクターの領域」を持ち、境界を越えると不可逆に別配置へ移行する。低い安定性がむしろ高いレジリエンスをもたらす例(スプルースバドワーム)を示す。
- 図表: 本文参照 Figure 1〜4 の全4点を PyMuPDF キャプション座標クロップで取得・埋め込み。表なし。埋め込みラスター画像(JSTOR ロゴ等)は装飾のため除外。
- 備考: 1973年の JSTOR スキャン論文。図は JBig2 エンコードで pdf.js デコードに失敗したため、PyMuPDF ページレンダリング+キャプション座標クロップで全図取得した。
## [2026-08-21] ingest-paper | Serval: An End-Host Stack for Service-Centric Networking
- Source: `.raw/papers/nsdi12-final33.pdf`
- Slides: `.raw/slides/serval-nsdi12-talk/serval-nsdi12-talk.pdf`
- Summary: [[@2012__NSDI__Serval An End-Host Stack for Service-Centric Networking]]
- Pages created: [[Erik Nordström]]、[[David Shue]]、[[Prem Gopalan]]、[[Robert Kiefer]]、[[Matvey Arye]]、[[Steven Y. Ko]]、[[Jennifer Rexford]]、[[Michael J. Freedman]]、[[University at Buffalo]]、[[Service-Centric Networking]]
- Pages updated: [[Princeton University]]、[[サービスメッシュ]]、[[スクリプタブルロードバランサー]]、index/hot/overview/各 `_index`/manifest
- Key insight: Serval はサービス名・フロー・位置を分離し、サービスルータを初回接続の解決に限定することで、ロードバランサーを全データ経路に置かずにサービス複製・接続移行・マルチホーミングを同じ SAL へ統合する。
- 図表: 本文参照 Figure 1〜10 の全10点を PyMuPDF でクロップし、Table 1〜3 を Markdown 表として転記。発表スライド53枚を全件確認し、補足図4枚を source ページへ追加。除外図表なし。
- 備考: 指定された USENIX 会議ページは PDF ではなかったため、同ページに掲示された公式 PDF `https://www.usenix.org/system/files/conference/nsdi12/nsdi12-final33.pdf` と発表スライド `https://www.usenix.org/sites/default/files/conference/protected-files/serval-nsdi12-talk.pdf` を原本として保存した。
## [2026-08-21] ingest-slides | XDPerf: A High-Performance Traffic Generator Built with WASM and eBPF
- Source: `.raw/slides/xdperf-speakerdeck-2026/pages/`(PDF 原本なし。Speaker Deck CDN の個別画像)
- Visual pages: `.raw/slides/xdperf-speakerdeck-2026/pages/`(50枚を全件確認)
- Media: none
- Summary: [[@2026__KubeCon Japan Community Day__XDPerf - A High-Performance Traffic Generator Built with WASM and eBPF]]
- Pages created: [[Takeru Hayasaka]]、[[BBSakura Networks]]、[[XDPerf]]、[[wazero]]、[[XDP]]
- Pages updated: [[SAKURA internet Inc]]、[[DPDK]]、[[TRex]]、[[Linux]]、[[eBPF]]、[[WebAssembly]]、[[RSS(Receive Side Scaling)]]、[[カーネルバイパスネットワーキング]]、index/hot/overview/各 `_index`/manifest
- Key insight: XDPerf は Wasm にパケット定義の柔軟性、Go ホストに起動時展開、eBPF/XDP live frames に per-packet 性能を分担させ、DPDK の NIC 占有なしに高い packets per second を狙う。
- Note: CDN fallback のため PDF 原本は保存していない。タイトルスライド日付は 2026-07-28、Speaker Deck 掲載日は 2026-07-27。
## [2026-08-21] ingest-paper | Deploying User-space TCP at Cloud Scale with LUNA
- Source: `.raw/papers/atc23-zhu-lingjun.pdf`
- Slides: `.raw/slides/atc23-slides-zhu-lingjun/atc23-slides-zhu-lingjun.pdf`
- Summary: [[@2023__USENIX ATC__Deploying User-space TCP at Cloud Scale with LUNA]]
- Pages created: [[Lingjun Zhu]]、[[Yifan Shen]]、[[Erci Xu]]、[[Bo Shi]]、[[Ting Fu]]、[[Shu Ma]]、[[Shuguang Chen]]、[[Zhongyu Wang]]、[[Haonan Wu]]、[[Xingyu Liao]]、[[Zhendan Yang]]、[[Zhongqing Chen]]、[[Wei Lin]]、[[Yijun Hou]]、[[Rong Liu]]、[[Chao Shi]]、[[Jiaji Zhu]]、[[Jiesheng Wu]]、[[LUNA]]、[[Zbuf]]、[[knb]]、[[Pangu]]、[[Solar]]
- Pages updated: [[Alibaba Group]]、[[Alibaba Cloud]]、[[DPDK]]、[[Linux]]、[[ユーザーレベルTCPスタック]]、[[ゼロコピーネットワーキング]]、[[カーネルバイパスネットワーキング]]、[[アプリケーション並行実行モデル]]、[[TCP IPスタック統合|TCP/IPスタック統合]]、[[ストレージ計算分離]]、[[TCP輻輳制御アルゴリズム]]、[[RDMA]]、[[ネットワークワークロードのCPUスケジューリング]]、index/hot/overview/manifest
- Key insight: ユーザーレベルTCPの本番性能は、カーネルを迂回するだけでなく、r2cによるコア局所性、Zbufによるバッファ所有権の共有、NIC分岐によるカーネルTCP共存を同時に設計することで得られる。
## [2026-08-21] ingest-paper | A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability
- Source: `.raw/papers/A-Transparent-and-Efficient-Performance-Analysis-Approach-toEnhance-DPDK-Observability.pdf`
- Summary: [[@2026__ICPE__A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability]]
- Pages created: [[@2026__ICPE__A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability]]、[[Adel Belkhiri]]、[[Arnaud Fiorini]]、[[Matthew Khouzam]]、[[Ericsson]]、[[Trace Compass]]、[[VPP]]、[[TRex]]、[[dpdk-profile]]、[[DPDK Industry Survey Materials]]、[[Ciena]]、[[DPDK性能分析]]
- Pages updated: [[DPDK]]、[[Heng Li]]、[[Polytechnique Montréal]]、[[オブザーバビリティ]]、[[カーネルバイパスネットワーキング]]、[[プローブ効果]]、index/hot/overview/各 `_index`/manifest
- Key insight: DPDK の性能向上で失われる観測経路を native tracing とドメイン固有状態モデルで補い、VPP の RX throughput 低下から poll 分布、worker、mempool 枯渇までを連続的に診断できることを示した。
## [2026-08-21] ingest-paper | Scalable Kernel TCP Design and Implementation for Short-Lived Connections
- Source: `.raw/papers/Scalable_Kernel_TCP_Design_Implementation.pdf`
- Summary: [[@2016__ASPLOS__Scalable Kernel TCP Design and Implementation for Short-Lived Connections]]
- Pages created: [[Xiaofeng Lin]]、[[Yu Chen (Tsinghua)|Yu Chen]]、[[Xiaodong Li]]、[[Junjie Mao]]、[[Jiaquan He]]、[[Yuanchun Shi]]、[[Sina Corporation]]、[[ZHIHU Corporation]]、[[Fastsocket]]、[[HAProxy]]、[[Sina Weibo]]、[[TCP接続局所性]]
- Pages updated: [[Wei Xu]]、[[Tsinghua University]]、[[Intel]]、[[Linux]]、[[nginx]]、[[ユーザーレベルTCPスタック]]、[[カーネルバイパスネットワーキング]]、[[TCP IPスタック統合|TCP/IPスタック統合]]、[[ホストネットワークスタック性能]]、[[アプリケーション並行実行モデル]]、[[RSS(Receive Side Scaling)]]、[[RFS(Receive Flow Steering)]]、[[ネットワークワークロードのCPUスケジューリング]]、index/hot/manifest
- Key insight: 短命接続のスケーラビリティはカーネルを迂回するかどうかだけでなく、TCB table、VFS、受信パケット、アプリケーションの接続局所性をどのコアへ固定するかで決まる。
## [2026-08-21] ingest-paper | TAS: TCP Acceleration as an OS Service
- Source: `.raw/papers/2026_Unknown_TAS.pdf`
- Summary: [[@2019__EuroSys__TAS - TCP Acceleration as an OS Service]]
- Pages created: [[Antoine Kaufmann]]、[[Tim Stamler]]、[[Simon Peter]]、[[Naveen Kr. Sharma]]、[[TAS]]、[[FlexStorm]]、[[TCP高速化サービス]]
- Pages updated: [[Arvind Krishnamurthy]]、[[Thomas Anderson]]、[[University of Washington]]、[[UT Austin]]、[[Max Planck Institute for Software Systems]]、[[ユーザーレベルTCPスタック]]、[[カーネルバイパスネットワーキング]]、[[TCP IPスタック統合|TCP/IPスタック統合]]、[[ホストネットワークスタック性能]]、[[TCP輻輳制御アルゴリズム]]、[[アプリケーション並行実行モデル]]、[[スマートNICオフロード]]、index/hot/manifest
- Key insight: TCP高速化の設計空間は、カーネル内かユーザー空間かの二択ではなく、共通パケット処理、輻輳ポリシー、接続管理、アプリケーションAPI、CPU資源の責任境界を独立に分割できる。
## [2026-08-21] ingest-paper | zpoline: a system call hook mechanism based on binary rewriting
- Source: `.raw/papers/zpoline.pdf`
- Summary: [[@2023__USENIX-ATC__zpoline - a system call hook mechanism based on binary rewriting]]
- Pages created: [[Hajime Tazaki]]、[[Pierre-Louis Aublin]]、[[Kenta Ishiguro]]、[[Hosei University]]、[[zpoline]]、[[DPDK]]、[[システムコールフック]]、[[バイナリ書き換え]]
- Pages updated: [[Kenichi Yasukata]]、[[IIJ Research Laboratory]]、[[lwIP]]、[[Redis]]、[[Linux]]、[[FreeBSD]]、[[システムコール]]、[[動的計装]]、[[プローブ効果]]、[[ゼロコード計装]]、[[ユーザーレベルTCPスタック]]、[[カーネルバイパスネットワーキング]]、index/hot/manifest
- Key insight: 既存アプリケーションへユーザー空間 OS サブシステムを透明に接続するには、スタックの高速化だけでなく、システムコール境界を網羅的かつ低オーバーヘッドでフックする互換性設計が必要である。
## [2026-08-21] ingest-paper | Unikraft: Fast, Specialized Unikernels the Easy Way
- Source: `.raw/papers/2026_Unknown_Unikraft.pdf`
- Summary: [[@2021__EuroSys__Unikraft - Fast, Specialized Unikernels the Easy Way]]
- Pages created: source 1件、entity 25件、concept 1件([[ソフトウェア特殊化]])
- Pages updated: entity 12件、concept 4件、[[overview]]、[[wiki/index]]、[[wiki/hot]]、各 `_index`、manifest
- Key insight: ユニカーネルの性能は単一アドレス空間だけでなく、OS プリミティブと API を交換可能なマイクロライブラリへ分解し、アプリケーションを POSIX 層から低レベル I/O へ接続する特殊化の設計で決まる。
## [2026-08-21] ingest-paper | Understanding Host Network Stack Overheads
- Source: `.raw/papers/Understanding_host_network_stack_overheads.pdf`
- Summary: [[@2021__SIGCOMM__Understanding Host Network Stack Overheads]]
- Pages created: [[Qizhe Cai]]、[[Shubham Chaudhary]]、[[Midhul Vuppalapati]]、[[Jaehyun Hwang]]、[[Rachit Agarwal]]、[[terabit-network-stack-profiling]]、[[ホストネットワークスタック性能]]
- Pages updated: [[Cornell University]]、[[ゼロコピーネットワーキング]]、[[カーネルバイパスネットワーキング]]、[[ユーザーレベルTCPスタック]]、[[TCP IPスタック統合|TCP/IPスタック統合]]、[[組み込みTCP IP|組み込みTCP/IP]]、[[アプリケーション並行実行モデル]]、[[TCP輻輳制御アルゴリズム]]
- Key insight: 高帯域化によりホストネットワークスタックの主ボトルネックは per-packet のプロトコル処理から受信側の per-byte データ移動とホスト資源オーケストレーションへ移る。
## [2026-08-21] ingest-paper | Understanding Host Network Stack Latency
- Source: `.raw/papers/Understanding_Host_Network_Stack_Latency.pdf`
- Summary: [[@2026__SIGCOMM__Understanding Host Network Stack Latency]]
- Pages created: [[Tianyu Zuo]]、[[Ao Tang]]、[[Sungkyunkwan University]]、[[ネットワークワークロードのCPUスケジューリング]]
- Pages updated: [[Jaehyun Hwang]]、[[Rachit Agarwal]]、[[Qizhe Cai]]、[[University of Virginia]]、[[Cornell University]]、[[Linux]]、[[Redis]]、[[YCSB]]、[[Ftrace]]、[[ホストネットワークスタック性能]]、[[ネットワーク割り込み合体とCPUスケーリング]]、[[レイテンシ分析]]、[[テールレイテンシ耐性技術]]、[[ユーザーレベルTCPスタック]]、[[カーネルバイパスネットワーキング]]、index/hot/manifest
- Key insight: Linux の高いテールレイテンシはパケット処理そのものではなく、softIRQ 時間の誤計上、CPU runtime 公平性の限界、バースト性トラフィック下の割り込み調整に起因し、ACCa・PCSched・AutoDIM で最大 5.3 倍改善できる。
## [2026-08-21] ingest-paper | iip: an integratable TCP/IP stack
- Source: `.raw/papers/iip_Integratable_TCPIP_Stack.pdf`
- Summary: [[@2024__SIGCOMM CCR__iip - An Integratable TCP IP Stack]]
- Pages created: [[Kenichi Yasukata]]、[[IIJ Research Laboratory]]、[[iip]]、[[TCP IPスタック統合|TCP/IPスタック統合]]
- Pages updated: [[ユーザーレベルTCPスタック]]、[[ゼロコピーネットワーキング]]、[[カーネルバイパスネットワーキング]]、[[RSS(Receive Side Scaling)]]、[[組み込みTCP IP|組み込みTCP/IP]]、[[ホストネットワークスタック性能]]、[[@2021__SIGCOMM__Understanding Host Network Stack Overheads]]、index/hot/manifest
- Key insight: TCP/IP スタック統合の本質は、スタックを小型化または高速化する単独の最適化ではなく、実行ループ、状態、パケットバッファ、NIC 機能の責任境界を統合先へ開く API 設計である。
## [2026-08-21] ingest-paper | Full TCP/IP for 8-Bit Architectures
- Source: `.raw/papers/dunkels-tcp-ip-8-bit-architectures.pdf`
- Summary: [[@2003__MobiSys__Full TCP IP for 8-Bit Architectures]]
- Pages created: [[Adam Dunkels]]、[[Swedish Institute of Computer Science]]、[[lwIP]]、[[uIP]]、[[Dummynet]]、[[Ethernut]]、[[組み込みTCP IP|組み込みTCP/IP]]
- Pages updated: [[FreeBSD]]、[[アプリケーション並行実行モデル]]、[[TCP輻輳制御アルゴリズム]]、[[Webサーバアーキテクチャ]]
- Key insight: 組み込み TCP/IP の資源削減はプロトコル機構を単純に削るのではなく、状態・バッファ・再送責任を再配置する設計問題であり、uIP はアプリケーション主導のイベント駆動と単一バッファ、lwIP はスタック主導の動的バッファとウィンドウ管理で異なる解を与える。
## [2026-08-21] ingest | Extensible Software in the age of LLMs
- Source: `.raw/articles/extensible-software-in-the-age-of-llms-2026-08-21.md`
- Summary: [[@2026__jeremymorrell.dev__Extensible Software in the age of LLMs]]
- Pages created: [[@2026__jeremymorrell.dev__Extensible Software in the age of LLMs]]、[[Dynamic Workers]]、[[Cloudflare OS]]、[[Pi]]、[[ウェブ拡張型ソフトウェア]]、[[LLMネイティブソフトウェア]]
- Pages updated: [[Jeremy Morrell]]、[[Cloudflare]]、[[Salesforce]]、[[Extension Interface Model]]、[[Capability-based Security]]、[[WebAssembly]]、[[サーバーレスアーキテクチャ]]、[[AIネイティブ開発]]、[[LLMアプリケーション信頼性]]、[[overview]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: LLM はユーザー固有の拡張を作るコストを下げるが、ウェブで安全に実行するには、責任ある中核、狭いケイパビリティ、資源制限、強い分離、観測可能性を組み合わせる必要がある。
## [2026-08-21] ingest-video | Networking for Meta's Gigawatt-scale AI fleet
- Source: https://www.youtube.com/watch?v=hnMubV_mQ9w
- Transcript: `.raw/videos/youtube-hnMubV_mQ9w/transcript.md`(YouTube 自動生成英語字幕)
- Frames: `.raw/videos/youtube-hnMubV_mQ9w/frames/`(0件。動画本体の HTTP 403 により未取得)
- Summary: [[@2026__SIGCOMM__Networking for Meta's Gigawatt-scale AI fleet]]
- Pages created: [[@2026__SIGCOMM__Networking for Meta's Gigawatt-scale AI fleet]]、[[Omar Baldonado]]
- Pages updated: [[Meta]]、[[UALink Consortium]]、[[AIデータセンタートポロジ]]、[[GPUクラスタ運用]]、[[オープンネットワーキング]]、[[データセンターネットワーク信頼性]]、[[wiki/index]]、[[wiki/hot]]、[[wiki/sources/_index]]、[[wiki/entities/_index]]、[[wiki/concepts/_index]]
- Key insight: ギガワット級 AI ネットワークはスケールアップ・スケールアウト・スケールアクロスの三領域を、ワークロード、ハードウェア、容量移行、障害対応を含むライフサイクルとして協調設計する必要がある。公式講演ページで概要を確認し、動画は自動字幕のみを根拠にした。
## [2026-08-21] ingest-paper | Data Warehousing and Analytics Infrastructure at Facebook
- Source: `.raw/papers/data-warehousing-and-analytics-infrastructure-at-facebook.pdf`
- Summary: [[@2010__SIGMOD__Data Warehousing and Analytics Infrastructure at Facebook]]
- Pages created: source 1件、entity 13件([[Ashish Thusoo]]・[[Dhruba Borthakur]]・[[Raghotham Murthy]]・[[Zheng Shao]]・[[Namit Jain]]・[[Hao Liu (Facebook)]]・[[Suresh Antony]]・[[Joydeep Sen Sarma]]・[[Apache Hadoop]]・[[Apache Hive]]・[[Databee]]・[[HiPal]]・[[Hadoop Fair Share Scheduler]])、concept 2件([[データ基盤の資源共有]]・[[データ発見]])
- Pages updated: entity 4件([[Facebook]]・[[Scribe]]・[[HDFS]]・[[MapReduce]])、concept 3件([[データウェアハウス]]・[[分散ファイルシステムとオブジェクトストア]]・[[列指向OLAPデータベース]])、index/hot/manifest
- Key insight: データウェアハウスの集中化は格納先を一つにするだけでは終わらず、データ発見、SLA分離、資源共有、NameNodeのメタデータ管理まで含む共有基盤へ拡張される。
## [2026-08-20] ingest | Zoomer: Powering AI Performance at Meta’s Scale Through Intelligent Debugging and Optimization
- Source: `.raw/articles/zoomer-powering-ai-performance-meta-intelligent-debugging-optimization-2025-11-21.md`
- Summary: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]]
- Pages created: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]]、[[Zoomer]]、[[NVIDIA Data Center GPU Manager]]、[[StrobeLight]]、[[Crochet]]、[[Holistic Trace Analysis]]
- Pages updated: [[Meta]]、[[Manifold]]、[[Kineto]]、[[Dynolog]]、[[LibAsicMon]]、[[Perfetto]]、[[PyTorch]]、[[NVIDIA]]、[[GPU観測性]]、[[LLM学習モニタリング]]、[[LLM推論]]、[[GPUエネルギー効率]]、[[パフォーマンスエンジニアリング]]、[[ストラグラー]]、[[クリティカルパス分析]]、[[並列化戦略]]、[[GPU最適化]]、index/hot/sources_index/entities_index/concepts_index/manifest
- Key insight: Zoomer は Meta の既存 GPU/CPU/ホスト観測性を訓練・推論の性能デバッグ閉ループへ統合し、GPU/CPU/メモリ/通信/要求単位の分析から改善提案と再実行までを接続する。Logarithm のモデル状態ログとは相補的な位置にある。
## [2026-08-20] ingest | Logarithm: A logging engine for AI training workflows and services
- Source: `.raw/articles/logarithm-logging-engine-ai-training-workflows-services-meta-2024-03-18.md`
- Summary: [[@2024__EngineeringAtMeta__Logarithm - A logging engine for AI training workflows and services]]
- Pages created: [[@2024__EngineeringAtMeta__Logarithm - A logging engine for AI training workflows and services]]、[[Logarithm]]、[[Manifold]]、[[Scribe]]、[[LogDevice]]、[[glog]]、[[Apache ORC]]、[[AI訓練ログデバッグ]]
- Pages updated: [[Meta]]、[[PyTorch]]、[[TensorBoard]]、[[GPU観測性]]、[[LLM学習モニタリング]]、[[ログ解析]]
- Key insight: Logarithm は Meta の GPU/ハードウェア中心オブザーバビリティ(Dynolog・Kineto 系)を代替せず、rank ID メタデータと連続モデルテレメトリのログ化によって「モデルが何を学習しているか」を可視化する log-based の相補レイヤーを提供する。
## [2026-08-20] ingest-paper | NetEdit: An Orchestration Platform for eBPF Network Functions at Scale
- Source: `.raw/papers/sigcomm24-final159-acmpaginated.pdf`
- Summary: [[@2024__SIGCOMM__NetEdit - An Orchestration Platform for eBPF Network Functions at Scale]]
- Pages created: [[@2024__SIGCOMM__NetEdit - An Orchestration Platform for eBPF Network Functions at Scale]]、[[NetEdit]]、[[Balasubramanian Madhavan]]、[[Kumar Saurabh Arora]]、[[Jie Meng]]、[[Martin Lau]]、[[Abhishek Dhamija]]、[[Neil Spring]]
- Pages updated: [[Theophilus A. Benson]]、[[Prankur Gupta]]、[[Prashanth Kannan]]、[[Rajiv Krishnamurthy]]、[[Srikanth Sundaresan]]、[[Ying Zhang]]、[[Meta]]、[[Carnegie Mellon University]]、[[eBPF]]、[[データセンター輻輳制御]]
- Key insight: OSS eBPF マネージャは BPF-to-BPF 切り離しとサービスライフサイクル連動を欠き、NetEdit がその欠落をカーネル既定 GC/順序の上書きで埋める。RDMATracer のデプロイ基盤の一次記述。
## [2026-08-20] ingest-paper | RDMATracer: A scalable eBPF-based framework for tracing RDMA syscalls
- Source: `.raw/papers/RDMATracer_scalable_eBPF_framework_tracing.pdf`(ユーザー提供ローカルPDF、DOI: 10.1145/3789240.3828742)
- Summary: [[@2026__NAIC__RDMATracer - A scalable eBPF-based framework for tracing RDMA syscalls]]
- Pages created: source 1件、entity 5件([[Prankur Gupta]]・[[Miao Xu]]・[[Maxim Samoylov]]・[[Rajiv Krishnamurthy]]・[[Theophilus A. Benson]])
- Pages updated: entity 3件([[Prashanth Kannan]]・[[Meta]]・[[Carnegie Mellon University]])、concept 3件([[eBPF]]・[[RDMA]]・[[RDMAネットワーク監視]])、index/hot/sources_index/entities_index/concepts_index 5件
- Key insight: RDMATracerが扱う不可視性(syscall失敗試行の96%が他レイヤー信号を伴わない)は、既存RDMA監視系(Hawkeye・Pulse・Collie等)が扱うRNIC/ネットワークのハードウェア的不透明性とは異なり、`libibverbs`が薄いラッパーでリトライロジックを持たないという**ソフトウェアスタックの構造**に起因する。4つの操作者由来ヒューリスティック(読み取り専用除外・汎用カーネル内部処理除外・クリーンアップパス除外・重要RDMAオブジェクト操作へ焦点化)は名前空間ゲート+トークン正規表現へ機械的に符号化可能で、44関数の正解データ検証(recall=1.000, F1=0.765)により他ベンダーのRDMAドライバ名前空間へも移植できることを示した。独立分類器ALPS基準で12か月分のsyscall失敗GPU時間浪費の73%を捕捉。
- 備考: ローカルPDF(ユーザー提供、`~/Downloads/RDMATracer_scalable_eBPF_framework_tracing.pdf`)から取り込み。図4点(Figure 1〜4、全て埋め込みラスター画像)を全点埋め込み、表2点(Table 1・2)をMarkdown表として転記。全6ページ本文+参考文献を通読。DragonScale address c-004100(source)、c-004101〜c-004105(entity 5件)を採番。
## [2026-08-20] ingest-slides | AIのための Ethernet技術動向 (SerDes) — 400 Gb/s/レーンに向けた物理層の課題と考察
- Source: `.raw/slides/markunet-ai-ethernet-serdes-trends/markunet-ai-ethernet-serdes-trends.pdf`(SpeakerDeck、URL: https://speakerdeck.com/markunet/ai-no-tame-no-ethernet-gijutsu-doukou-serdes)
- Visual pages: `.raw/slides/markunet-ai-ethernet-serdes-trends/pages/`(全77ページ)
- Media: none
- Summary: [[@2026__SpeakerDeck__AIのためのEthernet技術動向 (SerDes)]]
- Pages created: source 1件、entity 6件([[IEEE 802.3]]・[[OIF]]・[[UALink Consortium]]・[[SNIA/SFF]]・[[Arista Networks]]・[[Ethernet Alliance]])、concept 3件([[400Gbpsレーン (SerDes)|400 Gb/s/レーン (SerDes)]]・[[Co-Packaged Copper (CPC)]]・[[ビーチフロント制約]])
- Pages updated: entity 4件([[Masayuki Kobayashi]]・[[NVIDIA]]・[[Broadcom]]・[[OCP Foundation]])、concept 2件([[光トランシーバー電力方式]]・[[Ultra Ethernet]])、index/hot/sources_index/entities_index/concepts_index 5件
- Key insight: 400 Gb/s/レーン(448G / IEEE P802.3dv)は2026年7月に到達距離・BERというObjectiveこそ固まったが、電気側変調(PAM4/PAM6/PAM8)とinner FECは2026年8月時点でも未決定であり、「決まったのは枠組みであり技術選択ではない」。標準化団体(IEEE 802.3/OIF/UEC/OCP/SNIA/SFF)とMSA群(OCI/Open CPX/XPO)が「何を満たすか」と「どんな部品で実現するか」を分業する構造が2026年に急速に整った。
- 備考: スラグ `markunet-ai-ethernet-serdes-trends` は事前にリネーム済み(Step 0 完了状態で作業開始)。全77ページを画像で通読、重要図表・出典行は個別再読で裏取り。図表5点(3層ネットワーク技術要求・PAM4/6/8チャネル帯域トレードオフ・ラック配線本数の帯域上限・電力とリーチのトレードオフ・2026年標準化タイムライン)を埋め込み。DragonScale address c-004086(source)、c-004087〜c-004092(entity 6件)、c-004093〜c-004095(concept 3件)を採番。
## [2026-08-20] ingest-slides | RDMAネットワークアーキテクチャ基礎 - IB/RoCE 編 -
- Source: `.raw/slides/markunet-rdma-ib-roce/markunet-rdma-ib-roce.pdf`(SpeakerDeck、URL: https://speakerdeck.com/markunet/rocebian)
- Visual pages: `.raw/slides/markunet-rdma-ib-roce/pages/`(全57ページ)
- Media: none
- Summary: [[@2023__SpeakerDeck__RDMAネットワークアーキテクチャ基礎 - IB/RoCE 編 -]]
- Pages created: source 1件、entity 1件([[Yahoo Japan Corporation]])、concept 1件([[InfiniBand]])
- Pages updated: entity 1件([[Masayuki Kobayashi]])、concept 2件([[RDMA]]・[[RoCE設計課題]])、index/hot/sources_index/entities_index/concepts_index 5件
- Key insight: [[Masayuki Kobayashi]] の確認できる最古の公開資料が2023-06-02(本ソース)であることが判明し、既存の「最古は2023-06-12」という記述を訂正した。PFCのHead-of-Line Blockingに対するLossless/Semi-lossless/Lossy-1/Lossy-2という運用構成の段階的緩和スペクトラムは、IRN(NIC変更)・Ultra Ethernet(プロトコル再設計)とは異なる第三の対処軸として [[RoCE設計課題]] concept に追加した。
- 備考: slug は文字化けのため `markunet-rdma-ib-roce` へ手動リネーム済み(Step 0 完了状態で作業開始)。全57ページを画像で通読。図8点(p.10/14/15/25/30/36/45/50)を埋め込み。フッター著作権表示(©2022/2020 Yahoo Japan Corporation)から公開元組織を確認。DragonScale address c-004083(source)、c-004084(entity)、c-004085(concept)を採番。
## [2026-08-20] ingest-slides | クラウドデータセンターネットワークの"いま"と"これから"
- Source: `.raw/slides/cloud-data-center-network-2026/cloud-data-center-network-2026.pdf`(SpeakerDeck、URL: https://speakerdeck.com/markunet/kurautotetasentanetutowakuno-ima-to-korekara)
- Visual pages: `.raw/slides/cloud-data-center-network-2026/pages/`(全37ページ)
- Media: none
- Summary: [[@2023__SpeakerDeck__クラウドデータセンターネットワークのいまとこれから]]
- Pages created: source 1件
- Pages updated: entity 1件([[Masayuki Kobayashi]])、concept 3件([[RoCE設計課題]]・[[Dragonflyトポロジ]]・[[RDMA]])、index/hot/sources_index 3件
- Key insight: RoCE の go-back-N 再送とロスレス前提の因果関係、および Web Scale/AI-ML ネットワーク分離の必要性を、Hoefler+ 2023(IEEE Computer)による学術的体系化に先立ち実務者の言葉で整理していたことを確認した。Clos のホップ数増加=レイテンシ増加という制約への対処として Dragonfly+ を検討候補に挙げており、[[Dragonflyトポロジ]] concept の未解決の問いに部分的な実務者視点の回答を与えた。
- 備考: slug が日本語タイトルの URL エンコードになったため `cloud-data-center-network-2026` へ手動リネーム。p.27・p.28・p.29・p.34相当の4ページは「非公開」で本文なし。既存 entity([[Masayuki Kobayashi]])の「2023年資料タイトルスライドで Staff Engineer と確認できる」という記述が実際のタイトルスライド(発表者名のみ)と食い違うため contradiction callout を追加。DragonScale address c-004082(source)を採番。
## [2026-08-19] ingest-paper | Revisiting Network Support for RDMA
- Source: `.raw/papers/Revisiting-network-support-for-RDMA.pdf`(ユーザー提供ローカルPDF、DOI: 10.1145/3230543.3230557)
- Summary: [[@2018__SIGCOMM__Revisiting Network Support for RDMA]]
- Pages created: source 1件、entity 3件([[Alexander Shpiner]]・[[Eitan Zahavi]]・[[Sylvia Ratnasamy]])
- Pages updated: entity 5件([[Radhika Mittal]]・[[Scott Shenker]]・[[Arvind Krishnamurthy]]・[[Aurojit Panda]]・[[Mellanox]])、concept 3件([[RDMA]]・[[データセンター輻輳制御]]・[[RoCE設計課題]])、index/hot 3件
- Key insight: PFC への依存は輻輳制御アルゴリズムの宿命ではなく現行RoCE NICのgo-back-Nロス回復という実装上の弱点に起因することを2018年時点で厳密に実証した。同じ「PFCを切る」操作がRoCE(go-back-N)では性能を1.5〜3倍悪化させる一方、IRN(SACKベース)ではむしろ性能を向上させる対照実験が、PFC依存の真因をNIC設計に特定する。iWARPとの実機比較(iWARPは3倍のレイテンシ・4分の1のスループット)により、「ロスをNICで処理する」という設計思想自体は正しかったが実装(TCPスタック全体のハードウェア化)が複雑すぎたことをIRNが定量的に裏付けた。
- 備考: ローカルPDF(`~/Downloads/Revisiting network support for RDMA.pdf`)から取り込み。図12点(Figure 1〜12)は全てベクター描画のためPyMuPDFキャプション座標クロップで取得・全点埋め込み。表2点(Table 1・2)をMarkdown表として転記。全14ページ本文+参考文献を通読。DragonScale address c-004077(source)、c-004079〜c-004081(entity 3件)を採番。
## [2026-08-19] ingest-paper | HPCC: High Precision Congestion Control
- Source: `.raw/papers/HPCC---high-precision-congestion-control-.pdf`(ユーザー提供ローカルPDF、DOI: 10.1145/3341302.3342085)
- Summary: [[@2019__SIGCOMM__HPCC - High Precision Congestion Control]]
- Pages created: source 1件、entity 8件([[Yuliang Li]]・[[Hongqiang Harry Liu]]・[[Yan Zhuang]]・[[Lingbo Tang]]・[[Zheng Cao]]・[[Ming Zhang]]・[[Frank Kelly]]・[[Massachusetts Institute of Technology]])
- Pages updated: entity 7件([[Rui Miao]]・[[Fei Feng]]・[[Mohammad Alizadeh]]・[[Minlan Yu]]・[[Alibaba Group]]・[[Harvard University]]・[[University of Cambridge]])、concept 3件([[データセンター輻輳制御]]・[[インバンドネットワークテレメトリ]]・[[RoCE設計課題]])、index/hot 3件
- Key insight: DCQCN(ECN、2015)・TIMELY(RTT勾配、2015)・HPCC(INT直接測定、2019、いずれもSIGCOMM)は輻輳シグナルの情報量を段階的に増やす方向で進化してきた。HPCC は INT を「輻輳制御ループへ直接組み込む」形で実用化した最初期の例であり、経路上の各スイッチがACKにキュー長・送信バイトレート・帯域容量を直接埋め込み送信者がinflight bytesを精密に制御することで、ほとんどの場合1回のレート更新で適正な送信レートに収束する。7年後のINTFusion(2026、IFIP Networking)が同じINT情報を「監視・診断」目的に転用しているのと対照的に、「制御」と「観測」という異なる用途にINTが展開されてきたことを[[インバンドネットワークテレメトリ]] conceptに加えた。
- 備考: ローカルPDF(`~/Downloads/HPCC - high precision congestion control .pdf`)から取り込み。図14点(Figure 1〜14)は全てベクター描画のためPyMuPDFキャプション座標クロップで取得・全点埋め込み。表なし。Appendix Aの理論的収束性・公平性証明を含め全13ページ本文+付録+参考文献を通読。DragonScale address c-004068(source)、c-004069〜c-004076(entity 8件)を採番。
## [2026-08-19] ingest | mlx5 Ethtool Counters
- Source: `.raw/articles/mlx5-ethtool-counters-2026-08-19.md`(URL: https://docs.kernel.org/6.7/networking/device_drivers/ethernet/mellanox/mlx5/counters.html)
- Summary: [[@2023__LinuxKernelDocs__mlx5 Ethtool Counters]]
- Pages created: [[@2023__LinuxKernelDocs__mlx5 Ethtool Counters]]
- Pages updated: [[Mellanox]], [[RDMAネットワーク監視]]
- Key insight: RDMA 監視研究(Lumina・CorrOpt)が個別に言及するカウンタ名は、mlx5 ドライバの公式仕様(5 計測点 × 3 種別)の部分集合として位置づけ直せる。
## [2026-08-19] ingest-paper | TIMELY: RTT-based Congestion Control for the Datacenter
- Source: `.raw/papers/TIMELY---RTT-based-Congestion-Control-for-the-Datacenter.pdf`(ユーザー提供ローカルPDF、DOI: 10.1145/2785956.2787510)
- Summary: [[@2015__SIGCOMM__TIMELY - RTT-based Congestion Control for the Datacenter]]
- Pages created: source 1件、entity 10件([[Radhika Mittal]]・[[Vinh The Lam]]・[[Nandita Dukkipati]]・[[Emily Blem]]・[[Hassan Wassel]]・[[Monia Ghobadi]]・[[Yaogong Wang]]・[[David Wetherall]]・[[David Zats]]・[[UC Berkeley]])
- Pages updated: entity 3件([[Amin Vahdat]]・[[Google]]・[[Microsoft]])、concept 2件([[データセンター輻輳制御]]・[[TCP輻輳制御アルゴリズム]])、index/hot 3件
- Key insight: DCTCPの著者が「データセンターの微小なキューイング遅延の正確な測定は困難な課題」と明言していたのに対し、TIMELYは同じSIGCOMM 2015でNICハードウェアタイムスタンプの進化(ハードウェアACK生成含む)を背景にこの通説を覆した。RTTの絶対値でなく勾配(gradient)を輻輳シグナルとして用いることで、Kellyらが指摘する「制御ループより短い時間スケールのキューは制御できない」という理論的制約を回避しながら低レイテンシと高スループットを両立する。DCQCN(ECN信号・NIC+スイッチ実装)とは同じSIGCOMM 2015発表でありながら輻輳シグナルの選択が対照的であり、スイッチ変更を一切要求しない点が[[データセンター輻輳制御]] concept に新しい設計軸を加えた。
- 備考: ローカルPDF(`~/Downloads/TIMELY - RTT-based Congestion Control for the Datacenter.pdf`)から取り込み。図表24点(Figure 4・6・7・8・13上下・23の7点は埋め込みラスター画像抽出、残り17点はベクター描画のためPyMuPDFキャプション座標クロップで取得)を全点埋め込み。Table 1をMarkdown表として転記。全13ページ本文+参考文献を通読。DragonScale address c-004057(source)、c-004058〜c-004067(entity 10件)を採番。
## [2026-08-19] ingest-paper | Understanding the Micro-Behaviors of Hardware Offloaded Network Stacks with Lumina
- Source: `.raw/papers/sigcomm23-final269-1.pdf`(https://www.microsoft.com/en-us/research/wp-content/uploads/2023/08/sigcomm23-final269-1.pdf)
- Summary: [[@2023__SIGCOMM__Understanding the Micro-Behaviors of Hardware Offloaded Network Stacks with Lumina]]
- Pages created: source 1件、entity 4件([[Zhuolong Yu (Johns Hopkins University)]]・[[Bowen Su]]・[[Vladimir Braverman]])、concept 1件([[ハードウェアオフロードネットワークスタックのテスト]])
- Pages updated: entity 4件([[Wei Bai]]・[[Xin Jin]]・[[Shachar Raindel]]・[[Zhuolong Yu]](USTC、同名異人注記))、concept 2件([[RDMA]]・[[RDMAネットワーク監視]])、index/hot 3件
- Key insight: Luminaはプログラマブルスイッチ(Intel Tofino)を2ホスト間のイベント注入器として使い、パケットドロップ・ECNマーク・破損を決定論的に注入、全パケットを専用サーバー群へミラーリングしてオフライン解析するツール。NVIDIA/Intelの商用RDMA NIC 4機種をテストし、CX6 DxのETSパケットスケジューラの非work-conserving性、CX4 Lxのnoisy neighbor問題等の重大バグをベンダーに確認させた。Collie・Huskyと同じ「RNICはブラックボックス」という問題意識から出発しつつ、決定論的イベント注入により「性能異常の発見」ではなく「仕様準拠性の検証」という補完的な軸を切り拓いた。著者Zhuolong Yu(Johns Hopkins University、Xin Jinの指導学生)は既存entity Zhuolong Yu(University of Science and Technology of China、Hestia論文)と所属・分野が一致しない別人と判断し、同名異人として新規ページを作成した。
- 備考: Microsoft Research公開ページからPDF直リンクを特定し取得。図11点(Figure 1〜11)は全てベクター描画のためPyMuPDFキャプション座標クロップで全点取得・埋め込み(images.jsonの埋め込みラスター画像4点は本文と無関係な装飾アイコンのため除外)。表2点をMarkdown表として転記。DragonScale address c-004050(source)、c-004051〜c-004054(entity 4件)、c-004055(concept)を採番。
## [2026-08-19] ingest-paper | Understanding RDMA Microarchitecture Resources for Performance Isolation
- Source: `.raw/papers/nsdi23-kong.pdf`(https://www.usenix.org/system/files/nsdi23-kong.pdf)
- Summary: [[@2023__NSDI__Understanding RDMA Microarchitecture Resources for Performance Isolation]]
- Pages created: source 1件、entity 5件([[Jingrong Chen]]・[[Yechen Xu]]・[[Mahmoud Elhaddad]]・[[Shachar Raindel]]・[[Alvin R. Lebeck]])、concept 1件([[マルチテナントRDMA性能分離]])
- Pages updated: entity 7件([[Xinhao Kong]]・[[Danyang Zhuo]]・[[Wei Bai]]・[[Jitendra Padhye]]・[[Duke University]]・[[Microsoft]]・[[Shanghai Jiao Tong University]])、concept 2件([[RDMA]]・[[RoCE設計課題]])、index/hot 3件
- Key insight: 同一著者陣(Xinhao Kong・Danyang Zhuo)による Collie(NSDI '22、デプロイ前の性能異常探索)と Husky(NSDI '23、本論文、マルチテナント性能分離の破壊)が「RNIC はブラックボックスであり内部リソースが性能問題の根本原因になる」という一貫した問題意識を確認した。ハードウェアベースの分離機構(SR-IOV)が architectural resource(帯域)は分離できてもマイクロアーキテクチャリソース(キャッシュ・PU)は分離できないという発見から、新しい concept [[マルチテナントRDMA性能分離]] を独立させた。
- 備考: 図10点(Figure 1〜10)は全てベクター描画のためPyMuPDFキャプション座標クロップで全点取得・埋め込み。表3点中2点をMarkdown表に転記、1点(チェックマーク表)を画像埋め込み。USENIXページはWebFetchが403だったためブラウザUA付きcurlで取得。DragonScale address c-004036(source)、c-004037〜c-004041(entity 5件)、c-004042(concept)を採番。
## [2026-08-19] ingest-paper | Congestion Patterns in a Large-scale RDMA Datacenter
- Source: `.raw/papers/Congestion_Patterns_Large_scale_RDMA.pdf`(ユーザー提供ローカルPDF、DOI: https://doi.org/10.1145/3730567.3764494)
- Summary: [[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]]
- Pages created: source 1件、entity 7件([[Soudeh Ghorbani]]・[[Yimeng Zhao]]・[[Srikanth Sundaresan]]・[[Yijing Zeng]]・[[Abhigyan Sharma]]・[[Prashanth Kannan]]・[[Cristian Lumezanu]])
- Pages updated: entity 3件([[Meta]]・[[Johns Hopkins University]]・[[Ying Zhang]])、concept 2件([[データセンター輻輳制御]]・[[RDMAネットワーク監視]])、index/hot 3件
- Key insight: Metaの分散AI訓練専用RDMAデータセンターにおける本番輻輳パターンを、トポロジ層・時間スケール・ワークロード横断で初めて測定した研究。PFC(Priority Flow Control)の導入によって輻輳箇所がTCP/IPデータセンターのエッジ(ToR→host)からネットワークコア(ToR→spine)へシフトしたことを実測で示し、粗粒度(分単位)のPFC一時停止カウンタが平均トラフィックレートでは見えないバースト性を検知できることを発見した。既存 [[RDMAネットワーク監視]] concept が集約するHawkeye・R-Pingmesh等の計装点設計(コアに近い層を重視する判断)が、本論文の実測知見と整合することを独立した測定研究として裏付けた。
- 備考: 図6点(Figure 1〜6)は全てベクター描画のためPyMuPDFキャプション座標クロップで全点取得・埋め込み。埋め込みラスター画像はゼロ件。表なし。arXiv版は確認できず、ACM IMC '25(pp.944-951)として発表。DragonScale address c-004029(source)、c-004043〜c-004049(entity 7件)を採番。
## [2026-08-19] ingest-paper | Hostping: Diagnosing Intra-host Network Bottlenecks in RDMA Servers
- Source: `.raw/papers/nsdi23-liu-kefei.pdf`(https://www.usenix.org/system/files/nsdi23-liu-kefei.pdf)
- Summary: [[@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers]]
- Pages created: source 1件、entity 6件([[Haoran Wei]]・[[Xiaolong Zhong]]・[[Lizhuang Tan]]・[[Tian Pan]]・[[Tao Huang]]・[[Purple Mountain Laboratories]])、concept 1件([[ホスト内ネットワークボトルネック]])
- Pages updated: entity 5件([[Kefei Liu]]・[[Jiao Zhang]]・[[Zhuo Jiang]]・[[BUPT]]・[[ByteDance]])、concept 2件([[RDMAネットワーク監視]]・[[RDMA]])、index/hot 3件
- Key insight: [[Kefei Liu]] エンティティページに「先行研究 Hostping」として予告されていた本論文を ingest したことで、R-Pingmesh(ネットワーク層、SIGCOMM 2024)と Hostping(ホスト内部、NSDI 2023)が同一著者陣による診断対象の層を分けた連続研究であることが確認できた。既存 [[RDMAネットワーク監視]] concept の計装位置の議論に、RNIC よりさらに内側という第五の層を明示的に加えた。
## [2026-08-19] ingest-paper | Collie: Finding Performance Anomalies in RDMA Subsystems
- Source: `.raw/papers/nsdi22-paper-kong.pdf`(https://www.usenix.org/system/files/nsdi22-paper-kong.pdf)
- Summary: [[@2022__NSDI__Collie - Finding Performance Anomalies in RDMA Subsystems]]
- Pages created: source 1件、entity 3件([[Xinhao Kong]]・[[Huaping Zhou]]・[[Jianxi Ye]])
- Pages updated: entity 6件([[Yibo Zhu]]・[[Chuanxiong Guo]]・[[Danyang Zhuo]]・[[Zhuo Jiang]]・[[Duke University]]・[[ByteDance]])、concept 2件([[RDMA]]・[[RDMAネットワーク監視]])、index/hot 3件
- Key insight: [[Zhuo Jiang]] エンティティページに「ByteDance の RDMA・ネットワーク信頼性研究(R-Pingmesh・Collie 等)」として予告されていた Collie を実際に ingest。ByteDance の RDMA/AI インフラ信頼性研究に「事前検証(Collie, 2022)→本番監視(R-Pingmesh, 2024)→障害検知(Minder, 2025)→フェイルオーバー(ReCCL, 2026)」という時系列が完成した。
## [2026-08-19] ingest-paper | Simple Testing Can Prevent Most Critical Failures: An Analysis of Production Failures in Distributed Data-Intensive Systems
- Source: `.raw/papers/osdi14-paper-yuan.pdf`(https://www.usenix.org/system/files/conference/osdi14/osdi14-paper-yuan.pdf)
- Summary: [[@2014__OSDI__Simple Testing Can Prevent Most Critical Failures - An Analysis of Production Failures in Distributed Data-Intensive Systems]]
- Pages created: source 1件、entity 4件([[Xin Zhuang]]・[[Guilherme Renna Rodrigues]]・[[Pranay U. Jain]]・[[Yu Luo (University of Toronto)]])
- Pages updated: entity 6件([[Ding Yuan]]・[[Michael Stumm]]・[[Xu Zhao]]・[[Yongle Zhang]]・[[University of Toronto]]・[[Yu Luo]]/[[Yu Luo (Tencent)]])、concept 2件([[分散システム障害]]・[[非致命的RPCエラー]])、source 1件([[@danluu.com__Reading postmortems]]の"未ingest"note解消)、index/hot 3件
- Key insight: [[Ding Yuan]] エンティティページに「未ingest」として予告されていた論文を実際に ingest。Cassandra・HBase・HDFS・MapReduce・Redis の実障害198件(壊滅的障害48件)の手動精読から、壊滅的障害の92%が明示的に通知された非致命的エラーの誤処理に起因すると定量化し、静的チェッカー Aspirator を9分散システムに適用して500件の新規バグ・悪しき実践(うち143件が開発者に修正・確認)を検出した。SPEX(設定ミス)・lprof(リクエストフロープロファイリング)・本論文(エラーハンドリング)の3本が揃い、Ding Yuan の研究が分散システムの信頼性を一貫して多角的に扱っていることが確認できた。
- 備考: USENIXの会議ページ(usenix.org)はWebFetchが403を返したため、ブラウザUAを設定したcurlで取得(既知の403回避策)。図12点(Figure 1〜12)は全てベクター描画のためpdf.jsの埋め込み画像抽出では断片パーツしか取れず、PyMuPDFキャプション座標クロップで全点取得・埋め込み。表9点(Table 1〜9)はMarkdown表として転記。共著者 Yongle Zhang は既存の Purdue University 所属エンティティと経歴の連続性から同一人物の可能性が高いと判断し note を追記。Yu Luo は同名異人(Nankai University・Tencent)が既存するため `Yu Luo (University of Toronto)` で曖昧さ回避。DragonScale address c-004014(source)、c-004015〜c-004018(entity 4件)を採番。
## [2026-08-19] ingest-paper | Understanding and Dealing with Operator Mistakes in Internet Services
- Source: `.raw/papers/naragaraja.pdf`(https://www.usenix.org/publications/library/proceedings/osdi04/tech/full_papers/naragaraja/naragaraja.pdf)
- Summary: [[@2004__OSDI__Understanding and Dealing with Operator Mistakes in Internet Services]]
- Pages created: source 1件、entity 4件([[Kiran Nagaraja]]・[[Fábio Oliveira]]・[[Richard P. Martin]]・[[Thu D. Nguyen]])
- Pages updated: entity 2件([[Ricardo Bianchini]]・[[Rutgers University]])、concept 1件([[運用障害分析]])、index/hot 3件
- Key insight: 21人の被験者オペレータによる43回のライブ実験で42件のオペレータミス(設定ミス24件・誤ったソフトウェア再起動14件が最頻)を観測し、オペレータのアクションを本番反映前に検証スライスで妥当性確認するvalidation基盤を提案・実装。プロトタイプは66%(28/42件)のミスを検知し、offline testing(40%)を上回った。[[@2003__USITS__Why Do Internet Services Fail and What Can Be Done About It]](Oppenheimer et al. 2003)を直接引用・拡張しており、ポストモーテム集計分析と実験的再現という2つの相補的方法論が同一テーマ(オペレータエラー)に収束することを確認した。
- 備考: USENIXの会議ページ(usenix.org)はWebFetchが403を返したため、ブラウザUAを設定したcurlで取得(既知の403回避策)。図4点(Figure 1〜4)は全てベクター描画のためpdf.jsの埋め込み画像抽出では取得できず、PyMuPDFキャプション座標クロップで全点取得・埋め込み。表2点(Table 1・Table 2)はMarkdown表として転記。DragonScale address c-004019(source)、c-004020〜c-004023(entity 4件)を採番。
## [2026-08-19] ingest | Reading postmortems(Dan Luu、danluu.com)
- Source: `.raw/articles/postmortem-lessons-2026-08-19.md`(https://danluu.com/postmortem-lessons/)
- Summary: [[@danluu.com__Reading postmortems]]
- Pages created: source 1件、entity 1件([[Dan Luu]])
- Pages updated: entity 1件([[Ding Yuan]])、concept 3件([[ポストモーテム]]・[[設定ミス脆弱性]]・[[人的要因]])
- Key insight: Google・Microsoft社内ポストモーテムの多読から帰納した障害原因5分類(エラーハンドリング・設定・ハードウェア・人間・監視/アラート)を、Ding Yuan et al. (OSDI'14、重大障害の92%がエラー誤処理起因)・Jim Gray(1985、運用起因42%)らの一次資料で裏付ける。「リスクの高い操作に人手プロトコルを追加すること自体をops smellとみなす」という視点は、本wikiが集約するHuman Factors系譜(事後の非難回避)とは時間軸が逆の「事前設計への疑い」として補完的に位置づけられる。
- 備考: sandboxのネットワーク制限でdanluu.comへの直接アクセスがブロックされたためsandbox無効化(`dangerouslyDisableSandbox`)で再取得。defuddleで本文抽出。記事内の3枚のグラフ画像(OSDI'14エラー内訳・Rabkin/Katz障害原因分布・IDC調査)は本文の統計記述と重複するため埋め込みを省略。公開日がページに記載されていないため`date_published: unknown`。DragonScale address c-004012(source)・c-004013(entity)を採番。
## [2026-08-19] query | AIワークロード基盤技術サーベイ(deep mode)
- Question: AI ワークロードに関する技術(スケジューリング: DRA・WAS・TAS・Kueue / オーケストレーション: JobSet・LeaderWorkerSet / デプロイスタック: KServe・NVIDIA Dynamo・llm-d・agentgateway・Envoy AI Gateway / Agent Workload: kagent・AgentSandbox)を、サーベイ論文のように体系的に整理せよ。
- Answer: [[wiki/questions/AIワークロード基盤技術サーベイ]](address c-004011)
- Pages read: concept 10件([[Dynamic Resource Allocation (DRA)]]・[[トポロジ考慮型スケジューリング]]・[[GPUクラスタスケジューリング]]・[[GPU多重化(MPS・MIG)]]・[[Kubernetes Workload・PodGroup API]]・[[コンテナオーケストレーション]]・[[オートスケーリング]]・[[LLMサービング管理]]・[[Prefill-Decode分離]]・[[KVキャッシュ管理]]・[[AIゲートウェイ]]・[[エージェントシステム運用]])、entity 30件超、source 20件超。4 トピック領域を並列サブエージェント 4 体で分担読解した。
- Key insight: 4 層(スケジューリング/オーケストレーション/デプロイスタック/エージェントワークロード)はいずれも「既存の Kubernetes 抽象が単純化されすぎていた」という同一の診断から出発し、異なる軸——資源要求の表現力(DRA)・スケジューリング単位(Workload/PodGroup)・トラフィックルーティングの意味論(GAIE)・ワークロード形状そのもの(Agent Sandbox)——で抽象を刷新する同型の運動である。刷新の方法論は「エコシステム実装をコアへ吸収する」(DRA・KEP-4671)と「コアは汎用に保ちレイヤーを重ねる」(WVA・KEDA・KPA)に分岐し、両者の緊張が現在の設計論争の主軸をなす。KEP-4671 が複数ワークロードキュー・公平性を Kueue/Volcano へ委ね続ける非対称性は、この折衷点として読める。
- 副次的な発見: (1) LWS の KEP-407(2025-04-08)がコアの KEP-4671(2025-09-17)に 5 ヶ月先行して「PodGroup の寿命を実行主体に厳密に一致させる」同型の設計へ独立到達していた。(2) etcd の 1.5MB 単一オブジェクト上限が、KEP-4671 の PodGroup 分離と TAS の TopologyAssignment エンコーディング刷新という 2 つの独立した API 設計を規定している。(3) Agent Sandbox(SIG Apps、Kubernetes 内拡張)と Agent Substrate(Google、Kubernetes 外の専用基盤)が、同一の 3 要件から正反対の解を導いている。
- カバレッジのギャップ(§8 に集約): **JobSet は定義すら wiki に存在しない**(全出現が名前の列挙のみ。ReplicatedJob という語が唯一の API 概念)。**KServe は 2020 年の KFServing 論文 1 本のみ**で現行の LLM 向け CRD が不明。**kagent の CRD 名が vault 全体で 0 件**。**「WAS」は独立概念として存在せず** KEP-5710 は未 ingest と wiki 自身が明記。agentgateway は standalone ドキュメントのトップページのみ取り込み済みで下位 10 ページ未取得。優先 ingest 候補 5 件を §8.1 に提示した。
- 検証: 本文の全 106 wikilink を実ファイルと突き合わせ、[[Bloomberg L.P|Bloomberg L.P.]] と Themis(source ページへの piped link)の 2 件を修正。残る [[microVM]] は [[Agent Substrate]]・[[@2026__KagentDevBlog__The Future of kagent]] が既に使う planned-page link のため vault 慣行に合わせて維持した。
- 備考: BM25 インデックス(.vault-meta/bm25、2026-06-18 構築)は本トピックの主要ソース群(KEP 系・llm-d・kagent・Agent Sandbox は 2026-08 に ingest)を含んでおらず、`scripts/retrieve.py` は "JobSet LeaderWorkerSet"・"kagent AgentSandbox" で 0 hit を返した。live grep へフォールバックして対象ページを特定した。**インデックスの再構築が必要**。
## [2026-08-19] ingest-paper | A Fresh Look at the Architecture and Performance of Contemporary Isolation Platforms
- Source: `.raw/papers/middleware2021_camera_ready.pdf`(https://pure.tudelft.nl/ws/portalfiles/portal/100821657/middleware2021_camera_ready.pdf、Middleware '21、DOI 10.1145/3464298.3493404)
- Summary: [[@2021__Middleware__A Fresh Look at the Architecture and Performance of Contemporary Isolation Platforms]]
- Pages created: source 1件、entity 5件([[Vincent van Rijn]]・[[Jan S. Rellermeyer]]・[[QEMU]]・[[Cloud Hypervisor]]・[[OSv]])、concept 1件([[ユニカーネル]])
- Pages updated: entity 6件([[Docker]]・[[LXC]]・[[Firecracker]]・[[gVisor]]・[[Kata Containers]]・[[Delft University of Technology]])、concept 3件([[コンテナ仮想化]]・[[ハードウェア仮想化]]・[[Lightweight Sandboxing]])
- Key insight: コンテナ([[Docker]]・[[LXC]])・セキュアコンテナ([[Kata Containers]]・[[gVisor]])・ハイパーバイザー([[QEMU]]・[[Firecracker]]・[[Cloud Hypervisor]])・ユニカーネル([[OSv]])の10プラットフォームをCPU・メモリ・I/O・ネットワーク・起動時間・実運用ワークロード(Memcached, MySQL)の6軸で横断比較し、EPSS重み付けした拡張HAPメトリクスでセキュリティも定量評価した。コンテナはほぼネイティブ同等・最速起動という結論はVEE '20の傾向と整合する一方、拡張HAPでは「セキュアコンテナは通常のコンテナより多くのホストカーネル関数を呼び出す」という結果が出て、VEE '20の静的コードカバレッジの知見と方向性が一致した。Kata Containersの"Speed of containers, security of VMs"タグラインは、VEE '20が紹介のみに留めたのに対し本論文が実測し「一般には成立しない」と反証した。
- 備考: PDFはpure.tudelft.nl(TU Delft機関リポジトリ)から取得。サンドボックスのSSL証明書検証エラーのためサンドボックス無効化で再取得した。図18点(Figure 1〜18)を全点本文該当箇所に埋め込み(アーキテクチャ図4点はベクター描画のためPyMuPDFキャプション座標クロップ、残り14点は埋め込みラスター画像抽出)。表はなし。全13ページ本文を通読。DragonScale address c-004004(source)、c-004005〜c-004009(entity 5件)、c-004010(concept)を採番。
## [2026-08-19] ingest | KVBM (KV Block Manager) 概要(NVIDIA Dynamo 公式ドキュメント)
- Focus: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]]。[[NVIDIA Dynamo]] Knowledge Base 配下の KVBM(KV Block Manager)概要ページ(`docs/dev/knowledge-base/modular-components/kvbm/overview`)。異種・分散環境をまたいで KV ブロックのメモリ割り当て・管理・リモート共有を担うスケーラブルなランタイムコンポーネントを、LLM 推論ランタイム層・KVBM ロジック層・[[NIXL]] 層の3層アーキテクチャとして解説し、Feature Support Matrix(vLLM・TensorRT-LLM 対応、SGLang 非対応)、KV キャッシュオフロードの4典型ユースケースを提示する。
- Key insight: KVBM は「フレームワーク非依存の共通メモリ管理層を NIXL の上に挟む」設計を取るのに対し、SGLang は KVBM に対応せず自身の階層キャッシュ HiCache を NIXL と直接連携させる別経路を選ぶ。両者はいずれも最下層に NIXL を置きながら、複数エンジン横断のポータビリティを取るかエンジン特化の最適化を取るかで分岐しており、[[KVキャッシュ管理]] concept の横断的知見に新しい設計軸として追加した。
- Key entities: 新規1件([[KVBM (KV Block Manager)]])。更新4件([[NVIDIA Dynamo]]・[[NIXL]]・[[vLLM]]・[[TensorRT-LLM]]・[[SGLang]])。更新concept 1件([[KVキャッシュ管理]])。
- 備考: トップレベル概要ページのみ取り込み。下位ページ(KVBM Guide・KVBM Design・KV Cache Offloading 比較・SGLang HiCache)は未取り込み。WebFetch の要約モデルが著作権保護のため全文転記を拒否したため `defuddle parse` で生テキストを取得。アーキテクチャ図(SVG、S3 署名付き URL)を1点埋め込み。DragonScale address c-003998(source)・c-003999(entity)を採番。
## [2026-08-19] ingest-paper | Blending Containers and Virtual Machines: A Study of Firecracker and gVisor
- Source: `.raw/papers/vee20-isolation.pdf`(https://pages.cs.wisc.edu/~swift/papers/vee20-isolation.pdf、VEE '20、DOI 10.1145/3381052.3381315)
- Summary: [[@2020__VEE__Blending Containers and Virtual Machines - A Study of Firecracker and gVisor]]
- Pages created: source 1件、entity 3件([[Anjali]]・[[Tyler Caraza-Harter]]・[[Michael M. Swift]])
- Pages updated: entity 4件([[gVisor]]・[[Firecracker]]・[[Kata Containers]]・[[University of Wisconsin]])、concept 2件([[コンテナ仮想化]]・[[Lightweight Sandboxing]])
- Key insight: LXC・gVisor・Firecracker の行・分岐粒度カーネルコードカバレッジ計測により、「機能をホストカーネルから移動させれば攻撃対象領域が縮小する」という設計上の直感に反し、gVisor(91,161行)・Firecracker(77,392行)がネイティブ Linux(63,163行)より多くのホストカーネルコードを実行することを実証した。gVisor は独自ユーザー空間カーネル Sentry を持ちながら LXC(90,595行)とほぼ同量のコードを共有するが呼び出し頻度は大幅に少ない(`do_mmap()` は LXC で100万回超、gVisor で5,382回)。実行コード量(セキュリティ代理指標)と呼び出し頻度(性能代理指標)が独立に変動しうるという知見は、既存の Lightweight Sandboxing 概念が扱ってきた「軽量さの指標が多様である」問題に、コードカバレッジという新しい測定軸を加えた。
- 備考: 図表20点(Figure 1〜20)を全件本文該当箇所に埋め込み(全図がベクター描画のため PyMuPDF キャプション座標クロップで取得、pdf.js による埋め込みラスター画像抽出はゼロ件)。表3点(Table 1〜3)を Markdown 表として転記。VEE '20 は ACM DOI(paywalled)のみで arXiv 版なし。全13ページ本文を通読。DragonScale address c-004000(source)・c-004001〜c-004003(entity 3件)を採番。
## [2026-08-19] ingest | Running Agents on Kubernetes with Agent Sandbox
- Source: `.raw/articles/running-agents-on-kubernetes-with-agent-sandbox-2026-08-19.md`(https://kubernetes.io/blog/2026/03/20/running-agents-on-kubernetes-with-agent-sandbox/)
- Summary: [[@2026__KubernetesBlog__Running Agents on Kubernetes with Agent Sandbox]]
- Pages created: source 1件、entity 1件([[Agent Sandbox]])
- Pages updated: entity 5件([[Kubernetes]]・[[gVisor]]・[[Kata Containers]]・[[LeaderWorkerSet]]・[[Agent Substrate]])、concept 1件([[Lightweight Sandboxing]])
- Key insight: AI エージェントは孤立・ステートフル・シングルトンなワークロードであり、既存の StatefulSet・headless Service・PersistentVolumeClaim の組み合わせでは大規模運用が破綻するという課題認識のもと、Kubernetes SIG Apps は Sandbox CRD([[gVisor]]/[[Kata Containers]] による強い隔離・アイドル時ゼロスケール・安定アイデンティティ)と SandboxWarmPool(事前起動プールでコールドスタート解消)を提案する。直近取り込んだ [[Agent Substrate]](Google/kagent)は同じ課題に対し「Kubernetes の外へ専用基盤を作る」正反対の解を選んでおり、2ソースを並べることで「Kubernetes 内拡張 対 外部専用基盤」という設計分岐が可視化された。
- 備考: Kubernetes ブログのトップ概要記事のみ取り込み。`kubernetes-sigs/agent-sandbox` リポジトリ本体・Python SDK・examples は未取り込み。DragonScale address c-003989(source)・c-003990(entity)を採番。
## [2026-08-19] ingest | kagent 関連記事3件バッチ取り込み(Medium・Platformers Community・kagent.dev)
- Source: `.raw/articles/kagent-open-source-agentic-ai-framework-2026-08-19.md`、`.raw/articles/introduction-to-kagent-platformers-2026-08-19.md`、`.raw/articles/kagent-dev-the-future-of-kagent-2026-08-19.md`
- Summary: [[@2025__Medium__Kagent - Open Source Agentic AI Framework for Autonomous Systems]]、[[@2025__PlatformersCommunity__An Introduction to Kagent - The Open Source Framework for AI Agents on Kubernetes]]、[[@2026__KagentDevBlog__The Future of kagent]]
- Pages created: source 3件、entity 3件([[Lin Sun]]・[[Eitan Yarmush]]・[[Agent Substrate]])
- Pages updated: entity 3件([[kagent]]・[[Solo.io]]・[[agentgateway]]・[[Agent Development Kit]])
- Key insight: 3ソースを時系列(2025-05 → 2025-08 → 2026-08)で並べると kagent の技術的成熟度の推移が追える。最新の公式ブログは、常時起動コンテナ前提の Kubernetes Deployment 抽象がエージェントワークロードの間欠実行特性と根本的にミスマッチするという課題認識から、Google 創立の [[Agent Substrate]] への全面移行を決断している。
- 備考: Medium 記事は Cloudflare の 403 拒否のため r.jina.ai リーダープロキシ経由で取得。DragonScale address c-003991〜c-003993(source)・c-003994〜c-003996(entity)を採番。
## [2026-08-19] ingest-paper | Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol
- Source: `.raw/papers/arxiv-2603.13417.pdf`(arXiv 2603.13417、投稿日 2026-03-12、全23ページ)
- Summary: [[@2026__arXiv__Bridging Protocol and Production - Design Patterns for Deploying AI Agents with Model Context Protocol]]
- Pages created: source 1件、entity 1件([[Vasundra Srinivasan]])
- Pages updated: entity 1件([[Model Context Protocol]])、concept 2件([[AIゲートウェイ]]・[[エージェント運用安全性]])
- Key insight: MCP には識別情報伝播・タイムアウト予算配分・エラーセマンティクスという3つのプロトコルレベルの欠落があり、これらを埋める Context-Aware Broker Protocol(CABP)・Adaptive Timeout Budget Allocation(ATBA)・Structured Error Recovery Framework(SERF)を検証可能な仮説(H1〜H6)として提案する。ブローカー/ゲートウェイ層は MCP がユーザーコンテキストをネイティブ対応した後も、ACL強制・監査ログ・レスポンスサニタイズ・認証情報管理のために恒久的なアーキテクチャコンポーネントであり続けるとする主張は、[[agentgateway]] の設計判断(AI用/通常用ゲートウェイを分離しない)を独立に裏付ける。
- 備考: 図表: 本文参照図5点(Figure 1〜5)を全点埋め込み(全図がベクター描画のため PyMuPDF キャプション座標クロップで取得、pdf.js による埋め込みラスター画像抽出はゼロ件)。表4点(Table 1: プロトコル比較、Table 2: レイテンシ予算、Table 3: 計装分類、Table 4: 脅威モデル要約)をMarkdown表として転記。arXiv abs ページで投稿日・カテゴリ(cs.SE/cs.AI/cs.MA)を確認。所属機関の記載なし(著者は独立研究として明記)。DragonScale address c-003979(source)・c-003997(entity)を採番。
## [2026-08-19] ingest | agentgateway Standalone ドキュメント概要
- Source: `.raw/articles/agentgateway-standalone-docs/index-2026-08-19.md`(https://agentgateway.dev/docs/standalone/latest/)
- Summary: [[@2026__AgentgatewayDocs__agentgateway Standalone ドキュメント概要]]
- Pages created: source 1件、entity 5件([[agentgateway]]・[[Agent2Agent Protocol (A2A)]]・[[Linux Foundation]]・[[Kubernetes Gateway API]]・[[CEL]])、concept 1件([[AIゲートウェイ]])
- Pages updated: entity 3件([[Gateway API Inference Extension]]・[[Model Context Protocol]]・[[kagent]])
- Key insight: MCP・A2A はステートフルな長命 JSON-RPC セッション・複数バックエンドへのファンアウト・サーバ起点 SSE プッシュ・クライアント単位の動的ツール可視性を要求し、従来の API ゲートウェイのステートレス request/response 前提と根本的に相容れない。[[agentgateway]] は「AI 用」と「通常用」でゲートウェイを分離せず単一プロキシへ統合する設計判断を採り、[[Model Context Protocol]] のエンティティページには「複数 MCP サーバを集約・仲介・保護するインフラ層」という MCP エコシステムの新しい層としての位置づけを追記した。
- 備考: ドキュメントサイトのトップ概要ページのみ取り込み。下位ページ(quickstart/about/deployment/configuration/llm/mcp/agent/operations/reference/faqs)は未取り込み。図(`architecture.svg`)を1点埋め込み。DragonScale address c-003972(source)〜c-003978(entity/concept計7件)を採番。
## [2026-08-19] ingest | Envoy AI Gateway ブログ記事3件
- Source: `.raw/articles/introducing-envoy-ai-gateway-2026-08-19.md` / `.raw/articles/envoy-ai-gateway-reference-architecture-2026-08-19.md` / `.raw/articles/mcp-in-envoy-ai-gateway-2026-08-19.md`
- Summary: [[@2024__EnvoyAIGatewayBlog__Introducing Envoy AI Gateway]] / [[@2025__EnvoyAIGatewayBlog__Envoy AI Gateway Reference Architecture]] / [[@2025__EnvoyAIGatewayBlog__MCP in Envoy AI Gateway]]
- Pages created: source 3件、entity 6件([[Envoy AI Gateway]]・[[Envoy Gateway]]・[[Tetrate]]・[[Erica Hughberg]]・[[Alexa Griffith]]・[[Ignasi Barrera]])
- Pages updated: entity 5件([[Envoy]]・[[KFServing]]・[[Bloomberg L.P.]]・[[Model Context Protocol]]・[[Kubernetes Gateway API]])、concept 1件([[AIゲートウェイ]])
- Key insight: [[Tetrate]] と [[Bloomberg L.P.]] が2024年に開始した [[Envoy AI Gateway]] は、新規プロキシを実装するのではなく既存の [[Envoy Gateway]]/[[Envoy]] エコシステム(約10年の本番運用実績)を拡張する戦略を取り、Rustで新規統合プロキシを実装する [[agentgateway]] とは対照的な出自から「AIゲートウェイ」という同じ問題設定に到達している。[[Model Context Protocol|MCP]] のステートフルセッションを、アップストリームセッション情報をクライアントセッションIDへ自己完結的にエンコードしゲートウェイ自体をステートレスに保つ「トークンエンコーディング設計」で扱い、代替案の集約化ステート管理(Redis)を単一障害点リスク等を理由に明示的に却下した設計判断の記録は、AIゲートウェイ全般のMCPセッション状態配置に関する貴重な一次資料になった。
- 備考: 記事内の二層ゲートウェイアーキテクチャ図・KServe統合図は、抽出した画像URLが取得時点で404だったため埋め込みを断念した。DragonScale address c-003980〜c-003985(entity 6件)、c-003986〜c-003988(source 3件)を採番。
## [2026-08-19] ingest-paper | WVA: A Global Optimization Control Plane for llmd
- Source: `.raw/papers/arxiv-2603.09730.pdf`(arXiv 2603.09730、v2: 2026-03-20、全10ページ)
- Summary: [[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]]
- Pages created: source 1件、entity 2件([[Abhishek Malvankar]]・[[University of Bologna]])、concept 1件([[オートスケーリング]])
- Pages updated: entity 3件([[IBM Research]]・[[llm-d]]・[[Kubernetes]])、concept 1件([[LLMサービング管理]])
- Key insight: [[IBM Research]] が [[llm-d]] と共同設計したオートスケーラ WVA は、Variant(ハードウェア・並列度・量子化のタプル)という第一級抽象と、KV キャッシュ利用率・キュー長という推論エンジン内部の飽和シグナルに基づく headroom ベースのグローバル最適化により、Kubernetes HPA の資源中心・ハードウェア均質前提の限界を克服する。実機 200-H100 OpenShift クラスタでの検証で HPA 比の有効スループット最大 37% 改善・リクエスト失敗数 10 分の 1 を達成した一方、デプロイの最大レプリカ数という外部制約に達すると headroom ベース戦略が安全バッファなしの過負荷運用に陥り HPA に劣後する逆転が論文自身によって明示的に報告されている。
- 備考: 図表: 本文参照図6点(Figure 1〜6)を全点埋め込み(Figure 1は埋め込みラスター画像、Figure 2〜6はPyMuPDFキャプション座標クロップ)。表なし。DragonScale address c-003968(source)〜c-003971(concept)を採番。
## [2026-08-19] ingest-paper | Serverless inferencing on Kubernetes
- Source: `.raw/papers/arxiv-2007.07366.pdf`(arXiv 2007.07366、v1: 2020-07-14 / v2: 2020-07-24、全4ページ)
- Summary: [[@2020__arXiv__Serverless inferencing on Kubernetes]]
- Pages created: source 1件、entity 11件([[Clive Cox]]・[[Dan Sun]]・[[Ellis Tarn]]・[[Animesh Singh]]・[[Rakesh Kelkar]]・[[David Goodwin]]・[[Seldon Technologies]]・[[Bloomberg L.P.]]・[[IBM]]・[[KFServing]]・[[Kubeflow]])
- Pages updated: entity 5件([[Knative]]・[[Istio]]・[[Kubernetes]]・[[NVIDIA]]・[[Microsoft]])、concept 2件([[サーバーレスアーキテクチャ]]・[[LLMサービング管理]])
- Key insight: [[Kubeflow]] エコシステムの [[KFServing]] は、[[Knative]] Pod Autoscaler のリクエストベースオートスケーリングを活用することで GPU duty cycle メトリクスの取得困難性を回避する。2020年時点の本番運用で報告された「大規模モデルのスケールツーゼロ起動レイテンシがサーバーレスの利点を相殺する」という課題は、LLM 以前の一般的な機械学習モデルサービングの時点ですでに、のちの PreServe・FaaScale(LLM サービング管理)が扱う「コールドスタートが反応的オートスケーリングを無効化する」trilemma と同型の構造で観測されていた。
- 備考: 図表: 本文参照図1点(Figure 1: KFServing技術スタック)を埋め込み(埋め込みラスター画像として取得)。著者6名のうち Ellis Tarn のみ所属記載なし(correspondence は個人 gmail)。DragonScale address c-003956(source)〜c-003967(entity 11件)を採番。
## [2026-08-19] ingest-paper | DeepServe: Serverless Large Language Model Serving at Scale
- Source: `.raw/papers/atc25-hu-junhao.pdf`(USENIX ATC '25、全17ページ / 入力: URL https://www.usenix.org/conference/atc25/presentation/hu-junhao、WebFetch 403のためcurl+ブラウザUAで再取得)+ `.raw/papers/atc25-hu-junhao-video-transcript.txt`(発表動画 YouTube `Ol1g-rn_uNQ` の英語字幕、ユーザー指示による補助テキスト)
- Summary: [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]]
- Pages created: source 1件、entity 3件([[Junhao Hu]]・[[Xusheng Chen]]・[[Yizhou Shan]])
- Pages updated: entity 4件([[Huawei Cloud]]・[[Peking University]]・[[Tao Xie]]・[[P-D-Serve]])、concept 3件([[Prefill-Decode分離]]・[[KVキャッシュ管理]]・[[モデルスケーリング高速化]])
- Key insight: PD分離とPD同居のどちらが有利かを実測ヒートマップ(prefill長・decode長・RPS軸、80%超のセルがRPSを変えても符号一貫)として可視化し、decode長予測モデル(84.9%精度)と組み合わせてリクエスト単位で動的に切り替えるselect-tes-PD-heatmapポリシーを導出した産業論文。PD分離が有利な場合の利得はPD同居が有利な場合の利得より非対称に大きく、この非対称性がヒートマップベース設計を頑健にする。高速スケーリングではpre-warming・DRAM事前ロード・NPU-forkを組み合わせても、最適化後もTE-Pre-load(Python起動・NPU初期化)が支配的要因であり続けると報告し、モデル転送高速化だけでは本番コールドスタート問題を解決しきれないことを示唆する。
- 備考: 図表: 本文参照図11点(Figure 1〜11)を全点埋め込み(PyMuPDFキャプション座標クロップ/matplotlib埋め込みラスター抽出)、表2点(Table 1・2)をMarkdown転記、Algorithm 1(分散スケジューリング疑似コード)をコードブロック転記。既存entity「Tao Xie」(UIUC教授として登録済み)がDeepServe著者のTao Xie(Peking University)と同一人物か、DBLPの単一著者ページ(pid/x/TaoXie、両所属を記録)で確認し統合した。DragonScale address c-003950(source)〜c-003953(entity 3件)を採番。
## [2026-08-19] ingest | KEP-407: Gang Scheduling (LeaderWorkerSet)
- Source: `.raw/articles/lws-kep-407-gang-scheduling-2026-08-19.md`(kubernetes-sigs/lws)
- Summary: [[@2025__KEP__KEP-407 Gang Scheduling (LeaderWorkerSet)]]
- Pages created: source 1件、entity 1件([[LeaderWorkerSet]])
- Pages updated: concept 2件([[Kubernetes Workload・PodGroup API]]・[[GPUクラスタスケジューリング]])
- Key insight: LWSのKEP-407はKEP-4671のコアAPI標準化に先行して、PodGroupのownershipをLeader Podへ紐付ける同型の設計原理へ独立に到達していた。
## [2026-08-19] ingest-paper | The Flux Operator
- Source: `.raw/papers/arxiv-2309.17420.pdf`(arXiv:2309.17420)
- Summary: [[@2023__arXiv__The Flux Operator]]
- Pages created: source 1件、entity 7件([[Vanessa Sochat]]・[[Daniel Milroy]]・[[Aldo Culquicondor]]・[[Antonio Ojea]]・[[Lawrence Livermore National Laboratory]]・[[Flux Framework]]・[[MPI Operator]])、concept 1件([[収束コンピューティング]])
- Pages updated: entity 3件([[Google]]・[[Kueue]]・[[Kubernetes]])、concept 1件([[Kubernetesオペレータ]])
- Key insight: HPC ワークロードマネージャ Flux Framework を Kubernetes 内部で稼働させる Kubernetes Operator「Flux Operator」の提案論文。Kubernetes の Indexed Job・headless service・ConfigMap のみで 1 Pod = 1 ノードの Flux クラスタを構築し、LAMMPS 強スケーリング実験で MPI Operator に対し総壁時間平均約5%高速という結果を示した。HPC とクラウドネイティブの技術的収束を「converged computing」と呼ぶ、本 wiki 初の明示的な用語として新規 concept [[収束コンピューティング]] を立て、既存の(制御理論的な意味の)[[収束型システム管理]] との用語衝突を注記した。
- 備考: 図表は全5点(Figure 1〜5)がmatplotlib/diagrams.net由来の埋め込みラスター画像として取得でき、ベクタークロップは不要だった。Table 1(Flux Framework Projects)はMarkdown表として転記。DragonScale address c-003941〜c-003949を採番。
## [2026-08-19] ingest-paper | Evaluating Kubernetes Performance for GenAI Inference: From Automatic Speech Recognition to LLM Summarization
- Source: `.raw/papers/arxiv-2602.04900.pdf`(arXiv:2602.04900)
- Summary: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]]
- Pages created: source 1件、entity 12件([[Sai Sindhur Malleni]]・[[Raúl Sevilla]]・[[Aleksei Vasilevskii]]・[[José Castillo Lema]]・[[André Bauer]]・[[Dynamic Accelerator Slicer]]・[[Gateway API Inference Extension]]・[[llm-d]]・[[Whisper]]・[[kube-burner]]・[[GuideLLM]]・[[Earnings-22]])
- Pages updated: entity 4件([[Kueue]]・[[Red Hat]]・[[Illinois Institute of Technology]]・[[vLLM]])、concept 3件([[コンテナオーケストレーション]]・[[GPUクラスタスケジューリング]]・[[KVキャッシュ管理]])
- Key insight: Kubernetes ネイティブな 3 コンポーネント(Kueue・Dynamic Accelerator Slicer・Gateway API Inference Extension)がバッチスケジューリング・GPU動的スライシング・分散推論ルーティングという異なるパイプライン段階を分業して担うことで、Kubernetes を GenAI 推論の統一基盤として機能させうることを実証した産業論文。Kueue はメイクスパン最大 15% 削減(決定的スケジューリングを優先しベストケースの偶発的な速さより再現性を選ぶ設計判断)、DAS は動的 MIG スライシングで並列度を GPU 数(8)からスライス数(25)へ増やし平均ジョブ完了時間 36% 削減(個別ジョブの実行時間劣化を並列化による待ち時間削減が上回る)、GAIE の Precise Prefix-Cache Aware Scheduling は KV キャッシュテレメトリに基づく Kubernetes Gateway レベルのルーティングでテール TTFT を最大 90% 改善した。
- 備考: 図表13点(図7・表6)を全点埋め込み/転記。TTFT改善率について本文§4.4(90%)とConclusion§5(82%)に軽微な数値不整合ありとsourceページに注記した。
## [2026-08-19] ingest-paper | Topology-Aware GPU Scheduling for Learning Workloads in Cloud Environments
- Source: UPCommons(バルセロナ工科大学オープンアクセスリポジトリ)https://upcommons.upc.edu/bitstreams/6244943d-5795-4c80-b2ac-222d1f1dc355/download (DOI 10.1145/3126908.3126933 のACM DL版はペイウォール、arXiv版なし)
- Summary: [[@2017__SC__Topology-Aware GPU Scheduling for Learning Workloads in Cloud Environments]]
- Pages created: source 1件、entity 6件([[Marcelo Amaral]]・[[Jordà Polo]]・[[David Carrera]]・[[Seetharami Seelam]]・[[Malgorzata Steinder]]・[[Barcelona Supercomputing Center]])
- Pages updated: concept 2件([[トポロジ考慮型スケジューリング]]・[[GPUクラスタスケジューリング]])
- Key insight: SC17(2017年)は、通信要求グラフと物理GPUトポロジグラフを二部グラフマッピングし、通信コスト・同居干渉・資源断片化を統合した効用関数でGPU配置を決めるアルゴリズム(TOPO-AWARE/TOPO-AWARE-P)を提案・実測した。Philly(2019)・HiveD(2020)によるクラスタスケールの局所性研究や、Kubernetes TAS(KEP-2724、2024年)による宣言的API化に数年先行して、ノード内トポロジ考慮スケジューリングの問題設定と効用関数ベースの解法をHPCコミュニティで確立していたことが分かる。pack配置で最大約1.30倍高速化、同居干渉で最大約30%スローダウンという定量結果は、後続のGPUクラスタスケジューリング研究(共有異常・局所性トレードオフ)がノード間で再発見する現象のノード内版と位置づけられる。
## [2026-08-19] ingest | KEP-4671: Gang Scheduling using Workload Object
- Source: `https://github.com/kubernetes/enhancements/blob/master/keps/sig-scheduling/4671-gang-scheduling/README.md`(`gh api repos/kubernetes/enhancements/contents/...` で全文取得、全2082行 + `kep.yaml`)
- Summary: [[@2025__KEP__KEP-4671 Gang Scheduling using Workload Object]]
- Pages created: source 1 件、concept 1 件([[Kubernetes Workload・PodGroup API]])
- Pages updated: entity 1 件([[Kubernetes]])、concept 3 件([[GPUクラスタスケジューリング]]・[[Dynamic Resource Allocation (DRA)]]・[[コンテナオーケストレーション]])
- Key insight: kube-scheduler にギャングスケジューリング(all-or-nothing方式)のフレームワーク支援を組み込むKEP。当初 `PodGroup` を `Workload` に埋め込む設計だったが、etcd 1.5MBオブジェクト上限・statusのread-modify-write競合という具体的スケーラビリティ限界から、独立ランタイムオブジェクトへ分離する設計へ転換した。Alpha(v1.35)はPreEnqueue/WaitOnPermitバリアによる単純実装、Beta(v1.37)はPodGroup単位で全メンバーPodを一括処理するWorkload Scheduling Cycleへ全面刷新され、専用のPodGroupキューとPlacementFeasiblePlugin拡張点を新設する。HiveD/Themisが積み上げてきた配置保証・公平性理論の多くは将来課題として先送りされており、DRA(デバイスプラグインAPI刷新)と並ぶ「エコシステムの既存実装(Volcano.sh・Kueue等)をコアへ吸収する」設計パターンの反復と位置づけられる。
- 備考: 画像なし(README.md + kep.yamlのみ、図はKEP本文中のmermaidダイアグラム1点をそのまま埋め込み)。GitHub Markdown を `gh api` で取得。
## [2026-08-19] ingest | KEP-2724: Topology Aware Scheduling
- Source: `https://github.com/kubernetes-sigs/kueue/blob/main/keps/2724-topology-aware-scheduling/README.md`(`gh api repos/kubernetes-sigs/kueue/contents/...` で全文取得、全2260行)
- Summary: [[@2024__KEP__KEP-2724 Topology Aware Scheduling]]
- Pages created: source 1 件、entity 1 件([[Kueue]])、concept 1 件([[トポロジ考慮型スケジューリング]])
- Pages updated: entity 1 件([[Kubernetes]])、concept 1 件([[GPUクラスタスケジューリング]])
- Key insight: Kueue の Topology Aware Scheduling (TAS) は、データセンターのラック・ブロック階層をノードラベルとして表現し、required/preferred/unconstrained の3層アノテーションと多層スライス制約でAI/MLワークロードのPod間通信帯域を最適化する。PodSetAssignmentを常にトポロジ最下位レベル単位で確定させる設計制約がレース条件を防ぎ、配置アルゴリズム(BestFit/LeastFreeCapacity/BalancedPlacement)の選択は通信パターンとの適合性の問題であり、ノード障害からの再割当戦略はWorkloadの所有構造(コントローラがPodを再作成できるか)に応じて根本的に分岐する。決定論的なノード単位配置ゆえに通常のクォータスケジューリングより桁違いに高頻度でスケジューリングサイクル内競合を起こし、これが本番障害(Workloadが数時間suspended)を引き起こしたためv0.19でサイクル内再計算の修正が入った。Philly/HiveDが扱ってきたGPUクラスタの局所性問題意識を、Kubernetesネイティブな宣言的APIとして体系化した後発の取り組みと位置づけられる。
## [2026-08-19] ingest-paper | ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
- Source: `.raw/papers/nsdi26-xiang-servegen.pdf`(USENIX NSDI '26、全16ページ / 入力: URL https://www.usenix.org/conference/nsdi26/presentation/xiang-servegen、WebFetch 403のためcurl+ブラウザUAで再取得)
- Summary: [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]]
- Pages created: source 1 件、entity 5 件([[Yuxing Xiang]]・[[Yan Zhang]]・[[Wenyuan Yu]]・[[ServeGen]]・[[BurstGPT]])、concept 1 件([[LLMサービングワークロード特性化]])
- Pages updated: entity 6 件([[Xue Li]]・[[Kun Qian]]・[[Ennan Zhai]]・[[Xin Jin]]・[[Jingren Zhou]]・[[Alibaba Group]]・[[Peking University]])、concept 2 件([[Prefill-Decode分離]]・[[ワークロードの特性の把握]])
- Figures: 本文参照21図(Figure 1〜21)を全点埋め込み。全図がベクター描画のため pdf.js の埋め込み画像抽出(3枚)は微小な装飾アイコンのみで図表本体には使えず、PyMuPDF でキャプション座標を特定し `get_pixmap(clip=...)` で図表領域をクロップして取得した。Table 1・2(本文参照)は Markdown 表へ全文転記。
- Key insight: Alibaba Cloud Model Studio の本番クラスタから4か月間・12モデル・35.4億リクエストを収集し、言語・マルチモーダル・推論の3カテゴリでLLMサービングワークロードを横断的に特性化した。到着バースト性・入出力長分布のシフトという複雑な変動パターンの多くは、少数の上位クライアントのレート変動に起因する因果構造(クライアント分解)として説明できることを示し、この知見をワークロード生成フレームワーク ServeGen のパラメータ化に直接組み込んだ。到着トレースとデータセットを独立に単純合成する従来のNAIVEアプローチは実ワークロードより見かけ上「処理しやすい」ワークロードを生むため、インスタンスプロビジョニング(NAIVEは必要台数を50%過小算出)とPrefill-Decode分離の構成選択(3設定中2設定で最良構成の結論が食い違う)の両方で、ワークロード生成精度がシステム設計評価の結論そのものを左右することを実証した。
## [2026-08-19] ingest-paper | Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
- Source: `.raw/papers/arxiv-2608.03893.pdf`(arXiv preprint、全21ページ / 入力: URL https://arxiv.org/abs/2608.03893)
- Summary: [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]]
- Pages created: source 1 件、entity 1 件([[Taekyung Heo]])
- Pages updated: entity 5 件([[Bita Darvish Rouhani]]・[[NVIDIA]]・[[Qwen3]]・[[Llama3]]・[[Mistral 3]])、concept 1 件([[KVキャッシュ管理]])
- Figures: 本文参照9図(Figure 1〜9)を全点埋め込み。全図が pdf.js の埋め込みラスター画像抽出(matplotlib出力9枚)で直接取得でき、他論文で頻出するPyMuPDFキャプション座標クロップは不要だった。Appendix専用の補足表(Table 9・11・13・14・18)は本文Table(1・2・5)で要点をカバー済みのため転記を割愛。
- Key insight: 同一LLMファミリ内(Qwen3・Llama 3.1・Ministral 3)の異なるサイズのモデル間で、KVヘッド数・ヘッド次元が一致する「matched-KV」ペアに対し、勾配学習を一切使わないper-headリッジ回帰の閉形式マッパーがKVキャッシュを転送し受信側の再プリフィルを省略する。top-kソース層選択とRoPE分離(content-space mapping)を組み合わせることで、6ペア中4ペアが標準精度の73〜98%を保持しつつ再プリフィルより2.7〜25倍高速だが、同じmatched-KV条件でも2ペア(Ministral 3の14Bターゲット関連)は42〜44%まで急激に劣化し、matched-KVは成功の必要条件だが十分条件ではないことを示した。校正R²ではなくattention出力コサイン類似度がcross-pair転送品質を予測する(r=+0.57 vs r=−0.20)という診断的知見も、既存のKVキャッシュ最適化(量子化・エビクション)の評価指標に転用しうる。
## [2026-08-19] ingest-paper | M2-MFP: A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure
- Source: `.raw/papers/2026_Unknown_M2_MFP_Multi_Scale_Multi.pdf`(ACM KDD '25、全12ページ / 入力: local PDF)。DOI: `10.1145/3711896.3737243`。arXiv 版なし。
- Summary: [[@2025__KDD__M2-MFP - A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure]]
- Pages created: source 1 件、entity 7 件([[Hongyi Xie]]・[[Min Zhou]]・[[Jialiang Yu]]・[[Zhenli Sheng]]・[[Hong Xie]]・[[Defu Lian]]・[[M2-MFP]])、concept 1 件([[メモリ障害予測]])
- Pages updated: entity 4 件([[Qiao Yu]]・[[Huawei Cloud]]・[[University of Science and Technology of China]]・[[TU Berlin]])、concept 1 件([[障害予測]])
- Figures: 図8点(Figure 1〜8)を全点埋め込み。全図がベクター描画のため pdf.js の埋め込み画像抽出(36枚)はロゴ・アイコン等の断片のみで図表本体を再構成できず、PyMuPDF でキャプション座標を特定し `get_pixmap(clip=...)` で図表領域をクロップして取得した。表は Table 1〜5(本文参照2回以上)を Markdown 表へ転記、Table 6・7(Appendix A のみで参照)は要約に留め全文転記を割愛。
- Key insight: DIMM の Correctable Error ログを DIMM レベル・bit レベルの多階層 2 値行列として表現する Binary Spatial Feature Extractor(BSFE、対称性・汎用性・敏感性の 3 原則)と、Time-Patch(LightGBM による集約特徴分類)・Time-Point(DIMM-Centric Gini gain による解釈可能なルール生成木)の二経路時間モデリングを組み合わせ、Huawei Cloud の実運用データで最良ベースライン比 F1 約 55% 改善・オンライン検証で本番運用中の UniMFP 比 F1 +15% を達成し AIOps プラットフォームへ本番デプロイされた。共著者 Qiao Yu(TU Berlin)は本 wiki 既存の光トランシーバー信頼性研究([[@2023__CCGrid__An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data]])と同一人物であることが判明し、DRAM 障害予測を継続研究する研究者として entity を更新した。
## [2026-08-19] ingest | KEP-4381: Dynamic Resource Allocation with Structured Parameters
- Source: `.raw/articles/4381-dra-structured-parameters-2026-08-19.md`(GitHub kubernetes/enhancements、`keps/sig-node/4381-dra-structured-parameters/README.md`、`gh api` で取得、全3258行 / 入力: URL)
- Summary: [[@2024__KEP__KEP-4381 Dynamic Resource Allocation with Structured Parameters]]
- Pages created: source 1 件、entity 2 件([[Patrick Ohly]]・[[Intel]])、concept 1 件([[Dynamic Resource Allocation (DRA)]])
- Pages updated: entity 1 件([[Kubernetes]])、concept 2 件([[GPU多重化(MPS・MIG)]]・[[コンテナオーケストレーション]])
- Figures: KEPリポジトリの `components.png`(コンポーネント構成図)・`kubelet.png`(kubelet資源準備フロー図)の2点を `curl` で直接取得し全点埋め込み。
- Key insight: DRAはkubelet デバイスプラグインAPI(単一線形量のみ表現可)の4限界(初期化・部分割当・オプショナル割当・ネットワーク接続デバイス)を、`ResourceSlice`/`ResourceClaim`/`DeviceClass`という宣言的APIモデルとCEL式デバイスセレクタで解消する。GA(Kubernetes 1.34)昇格には「異なる組織による実DRAドライバ実装3件以上」「NUMA/PCIeルート等トポロジ整合属性の標準化」という具体的条件を課し、既に`pcieRoot`・`pciBusID`の2属性を自ら標準化した。既存concept [[GPU多重化(MPS・MIG)]] のMIG静的分割とは「デバイスをどう分割するか(ハードウェア層)」対「分割済みデバイスをどう要求・割当するか(オーケストレーション層)」という補完関係にあり、動的パーティショニング自体は別KEP(partitionable devices)にスコープを譲っている点が明記されている。
## [2026-08-19] ingest-book | アジャイルな見積りと計画づくり ― 価値あるソフトウェアを育てる概念と技法
- Source: `.raw/books/agile-estimating-and-planning-ja/`(全 23 章 + イントロダクションの 24 枚 / 入力: pdf / 原本 338 ページ)。Mike Cohn 著、安井力・角谷信太郎 監訳、マイナビ 2009-01-28 初版、ISBN 978-4-8399-2402-7。原書 *Agile Estimating and Planning*(Prentice Hall, 2006)。
- Book entity: [[wiki/entities/アジャイルな見積りと計画づくり|アジャイルな見積りと計画づくり]]
- Chapters: [[@2009__Mynavi__アジャイルな見積りと計画づくり - Introduction イントロダクション]] 〜 [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 23 ケーススタディ ボムシェルタースタジオ]](24 件、すべて `publish: false`)
- Pages created: source 24 件、concept 23 件([[アジャイルな計画づくり]]・[[イテレーションの長さ]]・[[イテレーション計画づくり]]・[[ストーリーポイント]]・[[タスクボード]]・[[バーンダウンチャート]]・[[フィーチャの優先順位づけ]]・[[プランニングポーカー]]・[[プランニング・オニオン]]・[[プロジェクトバッファ]]・[[ベロシティ]]・[[ユーザーストーリーの分割]]・[[リリース計画づくり]]・[[不確実性コーン]]・[[再見積り]]・[[活動ベースの計画づくり]]・[[満足条件]]・[[狩野モデル]]・[[理想日]]・[[相対的重み付け]]・[[複数チームのプロジェクト計画]]・[[計画のコミュニケーション]]・[[金銭価値による優先順位づけ]])、entity 20 件([[Alexander Laufer]]・[[Cyril Northcote Parkinson]]・[[Donald G. Reinertsen]]・[[Eliyahu M. Goldratt]]・[[Karl Wiegers]]・[[Kim B. Clark]]・[[Lawrence P. Leach]]・[[Mike Cohn]]・[[Phillip Armour]]・[[Robert C. Newbold]]・[[Steve McConnell]]・[[Steven C. Wheelwright]]・[[SwimStats]]・[[Tom Gilb]]・[[wiki/entities/アジャイルな見積りと計画づくり|アジャイルな見積りと計画づくり]]・[[ハバナ (ボードゲーム)]]・[[マイナビ]]・[[安井力]]・[[狩野紀昭]]・[[角谷信太郎]])
- Pages updated: entity 2 件([[Barry W. Boehm]]・[[Kent Beck]])
- Figures: 図 50 点・表 49 点の計 99 点。338 ページのため画像一括抽出は実行せず、全図がベクター描画で埋め込み画像を持たないこともあり、キャプション座標クロップで取得した。判別条件はキャプションが本文 7.8pt に対し 6.4pt で組まれていること。図の範囲はベクター描画矩形と小サイズテキストのクラスタリングで決定し、同一ページに複数図がある場合は先行キャプションで下限を切った。本文 grep の図表番号集合と切り出し集合の差分ゼロ、埋め込み 99/99 解決・未使用 attachment 0。
- Key insight: 本書の設計の要は「規模を見積もり、期間は導出する」という分離にある。規模を単位のない相対値(ストーリーポイント)または理想日で見積もり、実測値であるベロシティで割って期間を得るため、見積りの系統的な偏りがベロシティを介して自動的に補正される。この補正機構があるからこそ、見積り精度を上げる努力は収益逓減の手前で打ち切ってよく(プランニングポーカー)、残る不確実性は隠さず幅とバッファで扱える(プロジェクトバッファ・計画のコミュニケーション)。逆に、実装が想定より長引いたことを理由に再見積りすると補正機構そのものが壊れる(再見積り)。20 章が個人単位のベロシティ測定に明確に反対し、19 章がベロシティをオール・オア・ナッシングで算出するのも、この機構を測定値の汚染から守るためだと読める。
- 備考: 章検出は初回 Part 単位に化けた(16 件)ため、`toc.txt` の outline level 2 から `--chapters` を組み立てて全 23 章 + 前付・部扉・後付の切り出し用ダミー章に再分割した。23 章(50 ページのケーススタディ)は全概念に触れるため concept 書き込みを禁じ、印字ノンブル付きの観察 8 件を報告させてオーケストレータが各 concept に反映した。ハブ concept を奪い合う章は投入順で直列化し、`ストーリーポイント` に 4→5→6→7→8→12→23 章、`リリース計画づくり` に 13→14→15→16→17→18→19 章が上書きも重複もなく層状に積み上がった。9 章担当が作成した人物 entity の綴りを原本の脚注とリファレンス・リストで検証し `Alexander Lauffer` → `Alexander Laufer` に訂正した。
## [2026-08-19] ingest-paper | FabricPerf: Measuring NIC-less Scale-Up Network through GPU Communication Kernel Profiling
- Source: `.raw/papers/2026_Unknown_FabricPerf_Measuring_NIC_less_Scale.pdf`(ACM SIGCOMM 2026、全15ページ + Appendix / 入力: local PDF)
- Summary: [[@2026__SIGCOMM__FabricPerf - Measuring NIC-less Scale-Up Network through GPU Communication Kernel Profiling]]
- Pages created: source 1 件、entity 4 件([[Songlin Huang]]・[[Chenshu Wu]]・[[FabricPerf]]・[[Neutrino]])
- Pages updated: entity 2 件([[The University of Hong Kong]]・[[NCCL]])、concept 3 件([[GPU観測性]]・[[GPU起動型ネットワーキング]]・[[NVLink]])
- Figures: 本文参照 17 図 + 8 表(表は Markdown 転記、Algorithm 1 は画像埋め込み)。全図がベクター描画のため PyMuPDF キャプション座標クロップで全点取得し全件埋め込み。埋め込みラスター画像(pdf.js抽出、63枚)はアイコン断片のみで図表本体には使えなかった。
- Key insight: GPU通信カーネルへのアセンブリレベルプロービング(Neutrino拡張)・GPU内蔵クロックによるGPTP・通信のメモリトラフィックモデリングという三本柱により、NICなしのNvLink Scale-upネットワークで初めてパケット単位のクロスレイヤー計測を実現した。実測により、チャネル間P99レイテンシがP50の2倍に達する不均衡(飽和よりずっと手前の12コアで既発生、work-stealingで46%改善)と、ネットワークバッファのLLCヒット率が高帯域域で約0%まで崩壊する現象(理論モデルの期待値100%から大きく乖離、evictionチューニングで34.86ポイント改善)という、既存のNCCL最適化コミュニケータでも未活用だった2つの最適化余地を発見した。
## [2026-08-19] ingest-paper | Pingmesh: A Large-Scale System for Data Center Network Latency Measurement and Analysis
- Source: `.raw/papers/Pingmesh---A-Large-Scale-System-for-Data-Center-Network-Latency-Measurement-and-Analysis.pdf`(全14ページ / 入力: local PDF)
- Summary: [[@2015__SIGCOMM__Pingmesh - A Large-Scale System for Data Center Network Latency Measurement and Analysis]]
- Pages created: source 1 件、entity 2 件([[Pingmesh]]・[[Autopilot]])、concept 1 件([[サイレントパケットドロップ検知]])
- Pages updated: entity 3 件([[Chuanxiong Guo]]・[[David Maltz]]・[[R-Pingmesh]])、concept 2 件([[ネットワーク監視]]・[[データセンターネットワーク信頼性]])
- Figures: 本文参照 8 図 + 1 表(表は Markdown 転記)。Figure 1・2 はベクター図のため PyMuPDF キャプション座標クロップ、Figure 3-8 は埋め込み画像 12 枚を attachment へ配置。全件埋め込み。
- Key insight: 全サーバ参加・常時稼働という設計選択が、live-siteインシデント発生時にすでにレイテンシデータが存在する状態を実現し、疎結合アーキテクチャによりInter-DC対応・QoS監視・VIP監視等の当初想定外の機能拡張をアーキテクチャ変更なしに追加できた。SNMP/syslogでは検知できないパケットブラックホール・ランダムサイレントドロップという2種類のスイッチ障害を、エンドツーエンドのレイテンシ・ドロップ率データから検知・局所化する設計は、10年後のSkyNet(SIGCOMM 2025)が結論づける「multi-source integration」の必要性を、単一システム内でのデータソース併用(Pingmesh + TCP traceroute)という形ですでに部分的に実践していた。既存の papers/ 単一ソースノートは温存し、wiki からは一方向参照のみで接続した。
## [2026-08-19] ingest-paper | The ganglia distributed monitoring system: design, implementation, and experience
- Source: `.raw/papers/The-ganglia-distributed-monitoring-system--design-implementation-and-experience.pdf`(全48ページ、日英対訳版 / 入力: local PDF)
- Summary: [[@2004__Parallel Computing__The Ganglia Distributed Monitoring System - Design, Implementation, and Experience]]
- Pages created: source 1 件、entity 4 件([[Matthew L. Massie]]・[[Brent N. Chun]]・[[Ganglia]]・[[PlanetLab]])、concept 1 件([[分散モニタリング]])
- Pages updated: entity 3 件([[David E. Culler]]・[[University of California, Berkeley]]・[[Intel Research]])
- Figures: 本文参照 5 図 + 6 表(表は Markdown 転記)。図はすべて英語原文ページ(偶数ページ)から PyMuPDF キャプション座標クロップで取得し全件埋め込み。
- Key insight: クラスタ内をマルチキャストの listen/announce プロトコルで対称監視し、クラスタ間を gmetad の点対点接続ツリーで連合するという Ganglia の2層設計は500クラスタ規模の実運用実績を持つ一方、著者自身が SUNY の2000ノードクラスタで線形外挿(毎秒1260パケット)と実測(約813パケット/秒)の乖離を報告しており、マルチキャストの2次的メッセージ負荷が数千ノード規模でスケールしない兆候として明示している。クラスタ向け設計を PlanetLab(惑星規模)へ転用した経験からは、広域帯域幅が安価という前提の誤り、フラットなメトリック名前空間のアクセス制御欠如、RRDtool 書き込みの大きな I/O オーバーヘッドという3つの移植性の限界が明らかになった。
## [2026-08-18] ingest-paper | DynamoServe: A Distributed Tiered Memory System for Multi-tenant LLM Serving
- Source: `.raw/papers/2026_Unknown_DynamoServe_Distributed_Tiered_Memory_System.pdf`(全6ページ / 入力: local PDF)
- Summary: [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]]
- Pages created: source 1 件、entity 4 件([[DynamoServe]]・[[FlexGen]]・[[Aqua]]・[[Diman Zad Tootaghaj]])
- Pages updated: entity 3 件([[vLLM]]・[[Tushar Krishna]]・[[Hewlett Packard Labs]])、concept 3 件([[KVキャッシュ管理]]・[[LLM推論]]・[[GPU多重化(MPS・MIG)]])
- Figures: 本文参照 6 図 + Table 1(表は Markdown 転記)。Figure 1 はベクター図のため PyMuPDF クロップ、Figure 2–6 は埋め込み画像 6 枚を attachment へ配置。
- Key insight: NVLink ピア GPU の遊休 HBM をクラスタ横断リソースとしてプールし、単一リモート階層制約(Aqua)や CPU オフロード(FlexGen)を回避する設計が、OPT-30B で 2 倍超のスループット改善をもたらす。MPS のプロファイリング誘導 knee 点割当は、メモリ最適化と独立した計算共有の設計軸として機能する。
## [2026-08-18] ingest-book | カオスエンジニアリング ― 回復力のあるシステムの実践
- Source: `.raw/books/chaos-engineering-ja/`(イントロダクション + 全 21 章 = 22 枚 / 入力: pdf)
- Book entity: [[wiki/entities/カオスエンジニアリング ― 回復力のあるシステムの実践|カオスエンジニアリング ― 回復力のあるシステムの実践]]
- Chapters: [[@2022__OReillyJapan__カオスエンジニアリング - Introduction カオスの誕生]] 〜 [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 21 おわりに]](22 件)
- Pages created: entity 30 件(book entity・[[Nora Jones]]・章著者 [[Richard Crowley]]・[[Jason Cahoon]]・[[Oleg Surmachev]]・[[Logan Rosen]]・[[Raji Chockaiyan]]・[[Andy Fleener]]・[[Peter Alvaro]]・[[Russ Miles]]・[[Nathan Aschbacher]]・[[Bob Edwards]]・[[Liu Tang]]・[[Hao Weng]]・[[Aaron Rinehart]]、[[Bruce Wong]]、組織 [[PingCAP]]・[[Disorderly Labs]]・[[UnitedHealth グループ]]・[[カオスコミュニティデー]]・[[Open Chaos Initiative]]、製品 [[ChAP]]・[[Vizceral]]・[[LinkedOut]]・[[LiX]]・[[クマムシプロジェクト]]・[[ChaoSlingr]]・[[TiDB]]・[[TiKV]]・[[Schrodinger]]・[[Auxon]])、concept 9 件([[動的安全モデル]]・[[複雑性の経済的支柱]]・[[先見性]]・[[機能配分]]・[[カオスの成熟モデル(CMM)]]・[[継続的ベリフィケーション]]・[[機能安全]]・[[HOP]]・[[セキュリティカオスエンジニアリング]])
- Pages updated: entity 17 件([[Capital One]]・[[Casey Rosenthal]]・[[Chaos Kong]]・[[Chaos Monkey]]・[[ChaosMesh]]・[[Erik Hollnagel]]・[[FUSE]]・[[Google]]・[[John Allspaw]]・[[LinkedIn]]・[[Microsoft]]・[[Microsoft Azure]]・[[Netflix]]・[[Peter Alvaro]]・[[Sidney Dekker]]・[[Slack Technologies]]・[[Verica]])、concept 26 件([[カオスエンジニアリング]]・[[障害注入]]・[[ブラスト半径]]・[[GameDay]]・[[レジリエンスエンジニアリング]]・[[実験計画法]]・[[プロアクティブ検証]]・[[オブザーバビリティ]]・[[デルタデバッギング]]・[[複雑システム障害論]]・[[本質的複雑性と偶発的複雑性]]・[[心理的安全性]]・[[情報処理システムとしての人間]]・[[自動化の皮肉]]・[[SRE文化]]・[[インシデントメトリクス]]・[[インシデント影響測定]]・[[インシデント対応成熟度モデル]]・[[分散システム障害]]・[[Raftログ診断]]・[[データベースリライアビリティエンジニアリング]]・[[ソフトウェア耐障害性]]・[[信頼性工学]]・[[故障の木解析]]・[[プローブ効果]]・[[制御ループの安定性とタイムラグ補償]])
- Figures: 43 点(図 39・表 4)を全点埋め込み。埋め込み画像 0 件(全図ベクター)のため、キャプションのフォント判別 + 本文段落境界までのクロップで切り出した。
- Key insight: 本書の骨格は、3 章が規律を「実験であってテストではない」「バリデーションでなくベリフィケーション」と定義し、16 章がそれを継続的ベリフィケーション(CV)という上位概念へ一般化する縦の線にある。この定義がツールから独立しているため、19 章(分散データベース)・20 章(セキュリティ)・17 章(サイバーフィジカル)・18 章(製造業の HOP)という異質な領域へ同じ規律を展開できている。より重要なのは、第 III 部が編著者自身の枠組みへの批判を本編に組み込んでいる点である ── 9 章は Netflix ChAP が技術的に成功しながら利用者が作成者 4 人にとどまり自動化がかえって専門知識の広がりを浅くしたと報告し、11 章(John Allspaw)は機能配分思想を認知システム工学から否定し、12 章(Peter Alvaro)は「人間の直感は伝達不可能なので実験選択の基準に据えられない」と論じる。9 章と 12 章は「人間の直感を実験にどう使うか」という同じ問いに正反対の解(引き出して共有する 対 機械的導出に置き換える)を与えており、この対立が未解決のまま並置されているのが本書の性格を最もよく示す。vault 内では、既存の [[@2021__OReillyJapan__SREの探求 - Chapter 14 初めにカオスありき]](Rosenthal 自身による二次資料)に対する一次資料として位置づき、2 章が Rasmussen の動的安全モデルを、15 章が CMM を、それぞれ二次資料の要約より詳細な形で裏づけた。また 8 章(Capital One)と既存の [[@2026__SREcon26Americas__Executing Chaos Engineering in Production at a Critical Financial Institution]](Bradesco)は、ともに規制下の金融機関でありながら「SRE を拡大せずスケールする」問いに責任分散 対 自動化という別解を与え、ツール選定は逆経路で内製ガバナンスに収束している。
## [2026-08-18] ingest-paper | What Goes Around Comes Around... And Around...
- Source: `.raw/papers/whatgoesaroundaround-stonebraker.pdf`(全17ページ / 入力: URL https://khoury.northeastern.edu/home/pandey/courses/cs7270/fall25/papers/intro/whatgoesaroundaround-stonebraker.pdf)
- Summary: [[@2024__SIGMODRecord__What Goes Around Comes Around... And Around]]
- Pages created: なし(entity 2件・concept 7件はいずれも既存ページの更新)
- Pages updated: entity 2 件([[Michael Stonebraker]]・[[Andrew Pavlo]])、concept 7 件([[専用データベースシステム]]・[[MapReduce]]・[[データレイク]]・[[リレーショナル対ドキュメントモデル]]・[[列指向OLAPデータベース]]・[[ベクトル検索インデックス]])
- Figures: なし(本文が名指しで参照する図表は全文検索で確認したところ皆無。埋め込み画像は装飾的な「Check for updates」バッジ1点のみで取り込み対象外)
- Key insight: 2005年に「専用化がRDBMSを打ち負かす」と予見したStonebraker自身が、19年後の本論文で「専用化の多くは結局SQLライクなインターフェースとACIDトランザクションを再獲得してRDBMSへ収斂しつつある」と報告している。DynamoDB・Cassandra・Aerospike・Couchbase・MongoDBという主要NoSQLベンダーが軒並みSQLインターフェースを追加した一方、カラムファミリ(BigTable系)だけは収斂に取り残された唯一の外れ値として残った。MapReduce/Hadoopは技術的欠陥と市場崩壊の両輪でほぼ死滅し、ベクトルDBは新アーキテクチャでなくドキュメント指向DBMSの索引特化に過ぎないと評価されている。
## [2026-08-18] ingest | The Roots of Software Engineering
- Source: `.raw/papers/the-roots-of-software-engineering-2z5l02wq11.pdf`(全10ページ / 入力: local PDF)
- Summary: [[@1990__CWIQuarterly__The Roots of Software Engineering]]
- Pages created: entity 7 件([[Michael S. Mahoney]]・[[F.L. Bauer]]・[[M.D. McIlroy]]・[[Edsger W. Dijkstra]]・[[Frederick W. Taylor]]・[[Henry Ford]]・[[Watts Humphrey]])、concept 3 件([[ソフトウェア工学の起源]]・[[ソフトウェア危機]]・[[構造化プログラミング]])
- Pages updated: entity 2 件([[Brian Randell]]・[[Fred Brooks]])、source 1 件([[@1976__IEEE-TC__Software Engineering]]、Area1/Area2二分類との接続を追記)
- Figures: なし(原論文に図表なし)
- Key insight: 「ソフトウェアエンジニアリング」という語は1967年、実践が存在しない段階で希求の表明として作られた。その後の議論は Taylor(科学的管理法)・Ford(組立ライン)・機械工具産業の互換部品という、いずれもアメリカ機械工学の遺産に由来する借用モデルに規定され続けており、1989年の Watts Humphrey の定義が1971年の F.L. Bauer の定義とほとんど変わっていないことがその証左とされる。既存の Boehm 1976([[@1976__IEEE-TC__Software Engineering]])の Area 1/Area 2 二分類と接続すると、Taylorの第一の職務(要素ごとの科学の確立)の欠如という歴史的診断が、6年後の実証的サーベイで定量的に裏づけられていたことが分かる。
## [2026-08-18] ingest-book | 機械学習システムデザイン
- Source: `.raw/books/designing-machine-learning-systems/`(12 章 / 入力: pdf)
- Book entity: [[機械学習システムデザイン]]
- Chapters: [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 1 機械学習システムの概要]]〜[[@2023__OReillyJapan__機械学習システムデザイン - Chapter 11 機械学習の人的側面]] + [[@2023__OReillyJapan__機械学習システムデザイン - Appendix A 機械学習システムを外部に提供する]](12 件)
- Pages created: entity 12 件([[機械学習システムデザイン]]・[[宮川大輔]]・[[株式会社JDSC]]・[[MLflow]]・[[Feast]]・[[Metaflow]]・[[Ofqual]]・[[Strava]]・[[Stitch Fix]]・[[Eric Colson]]・[[Eugene Yan]]・[[Abhishek Gupta]])、concept 16 件([[機械学習システムの4要件]]・[[目的関数のデカップリング]]・[[サンプリング手法]]・[[天然ラベル]]・[[ラベル不足への対処]]・[[クラス不均衡]]・[[データオーグメンテーション]]・[[データリーク]]・[[特徴の汎化]]・[[モデル評価のベースライン]]・[[摂動テストと不変性テスト]]・[[モデルのキャリブレーションと信頼度測定]]・[[推論最適化]]・[[データ分布のシフト]]・[[シャドウデプロイ]]・[[インターリービング試験]])
- Pages updated: entity 5 件([[Chip Huyen]]・[[Apache Airflow]]・[[Netflix]]・[[Booking.com]]・[[GPT-3]])、concept 44 件(中心は [[MLモデル監視]]・[[機械学習システムの設計パターン]]・[[機械学習プロジェクトの進め方]]・[[特徴量ストア]]・[[モデル圧縮]]・[[継続的トレーニング]]・[[責任あるAI]])
- Figures: 107 点を全点切り出して全点埋め込み(埋め込み 107 / 欠損 0 / 未使用 0)
- Key insight: 「監視は受動的で検知しかできず、能動的な適応は継続学習が担う」(§8.3.3)という役割分担が本書の骨格であり、vault の監視系 concept 群が持つ共通の天井を言語化した。8 章の監視対象 4 アーティファクトの順序(精度→予測→特徴→生入力)が SREcon23 の症状ベースアラーティングの優先順位と独立に一致する一方、統計的検定(K-S・MMD)の実務浸透度については両者の評価が食い違う。付録 A は原著になく日本語版オリジナルの寄稿(宮川大輔・株式会社JDSC)で、原著が前提とする自社プロダクト開発とは異なる受託開発の文脈を補っている。
## [2026-08-18] fix | Software Engineering (Boehm 1976) の図表クロップ修正
- Source: `.raw/papers/boehm-sw-eng-paper.pdf`(既存原本、変更なし)
- Summary: [[@1976__IEEE-TC__Software Engineering]]
- Pages updated: [[@1976__IEEE-TC__Software Engineering]](`updated: 2026-08-18`)。本文追記なし、`_attachments/boehm-sw-eng-paper/` 配下の Figure 1〜6 画像 6 枚を全差し替え。
- Key insight: 同一 PDF の再ダウンロード( `/Users/y-tsubouchi/Downloads/Software_Engineering.pdf` )による再取り込み依頼を受け、内容照合の結果 IEEE Xplore のダウンロード日時透かし差分のみで重複と判定(新規ページは作らず取り込みをスキップ)。ただしユーザー指摘どおり Fig.4・Fig.5 は x 軸ラベル・キャプションが欠落するほどクロップが浅く、Fig.6 は左列本文がクロップ範囲に混入していた。PyMuPDF でキャプション座標を再計測し、Fig.1〜3 はヘッダー/本文除去、Fig.4・5 はキャプションまで完全収録、Fig.6 は右列 (x≥305pt) に厳密に限定して再クロップした。
## [2026-08-18] query | 科学技術の知識循環
- Query: 「科学、工学、技術、技芸、運用などの科学技術に関する深い論考を作成してください。」(deep モード)
- Pages created: [[wiki/questions/科学技術の知識循環]](`address: c-003689`)
- Pages updated: [[wiki/index.md]]
- Key insight: 科学技術は「科学が発見し、工学が応用し、技術が実装し、運用が使用する」という直線的な序列ではない。科学は説明と一般化、工学は目的から手段への構成、技術は人工物と技能と制度と環境の適合、技芸は形式化しきれない制作と判断、運用は実環境での直接試行と価値の再設定を主に担う。これらは認識的、規範的、制作上、技能上の複数の帰還路で結ばれ、境界ごとに問題設定、設計、実装、測定、結論の異なる妥当性が問われる。工学化は技芸の消去ではなく、暗黙の判断を仕様、モデル、計測、試験へ選択的に外在化し、残る判断を上流へ移す過程として捉えた。
- 備考: `scripts/retrieve.py` は BM25 から関連チャンク 3 件を返し、Ollama 不通のため再順位づけを省略した。その後、[[hot]]、[[index]]、関連 concept、一次 source を段階的に読み、航空工学史、技術哲学、古典的制作知、設計科学、アルゴリズム工学、システム管理、SRE を横断した。単一循環への過剰な一般化、古代のテクネーと現代技術の直結、航空工学由来の分類の普遍化を避け、資料上の限界を明記した。
## [2026-08-18] ingest | Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?
- Source: `.raw/articles/next-generation-llm-inference-network-zcube-2026-05-20.md`(X Article, [[Zhipu AI|Z.ai]] `@Zai_org`、2026-05-20 公開)
- Summary: [[@2026__X__Next-generation LLM Inference Network - How ZCube Alleviates Network Bottlenecks]]
- Pages created: source 1 件、entity 1 件([[Harnets.AI]])、concept 1 件([[ZCube]])
- Pages updated: entity 2 件([[Zhipu AI]]・[[Tsinghua University]])、concept 3 件([[Fat-Tree]]・[[Prefill-Decode分離]]・[[マルチプレーンClosトポロジ]])、[[index]]・各 `_index`・[[hot]]
- Key insight: PD分離推論のKV Cache転送非対称性が、静的レール割り当てを前提とする [[Fat-Tree|ROFT(Rail-Optimized Fat-Tree)]] のレールマッピングを破綻させ、特定Leafスイッチ・リンクへのトラフィック集中(トポロジ誘発輻輳)を招くメカニズムを、Grafana実測(NIC間スループット最大27.93 GB/sから0 B/s近辺までの偏り、PFC Pause Packetsの周期的バースト)で定量的に示した初のソース。Spine層を撤廃しLeafスイッチを2グループの完全二部グラフへ再構成する [[ZCube]] への移行により、GLM-5.1本番推論クラスタでGPUスループット15%超向上・TTFT P99 40.6%削減・ネットワークハードウェアCapEx 33%削減を達成した。既存の [[マルチプレーンClosトポロジ]] concept が扱うMRC/SRv6(トランスポート層の解法)とZCube(トポロジ層の解法)が、同じ「トポロジ誘発輻輳」問題への異なるレイヤーの対処であることが判明した。
- 備考: X(Twitter)のArticle機能記事(通常はJS-SPAで本文が取得できないが、クローラー向けSSRページに `plain_text` フィールドとして記事全文16,000字が丸ごと埋め込まれていたため、これをJSON文字列としてデコードして完全抽出した)。図9点の元画像URLはmedia_idの昇順で取得し、登場順と推定して5点(トポロジ図・ROFT/ZCube比較図・PFCバックプレッシャー実測・スループット/TTFT比較チャート×2)を選定して埋め込んだ。DragonScale address c-003686〜c-003688 を新規3ページに割当。
## [2026-08-18] ingest-book | 信頼性の高い機械学習
- Source: `.raw/books/reliable-machine-learning/`(全 15 章 / 入力: pdf 388 ページ)
- Book entity: [[信頼性の高い機械学習]]
- Chapters: [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 1 はじめに]]〜[[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 15 ケーススタディ:MLOpsの実践]](15 件、全て `publish: false`)
- Pages created: 章 source 15 件、entity 12 件([[信頼性の高い機械学習]]・[[Cathy Chen]]・[[Kranti Parisa]]・[[Todd Underwood]]・[[Aileen Nielsen]]・[[Aparna Dhinakaran]]・[[Jay R. Galbraith]]・[[Latanya Sweeney]]・[[YarnIt]]・[[Dialpad]]・[[Landing AI]]・[[Kubeflow Pipelines (KFP)]])、concept 15 件([[MLライフサイクル]]・[[データの段階]]・[[データの保守性]]・[[モデルアーキテクチャ・定義・訓練済みモデル]]・[[MLモデルの脆弱性の所在]]・[[特徴量ストア]]・[[MLメタデータ管理]]・[[モデルの確実性検証]]・[[評価データ分布の設計]]・[[責任あるAI]]・[[ML訓練システムの信頼性原則]]・[[ML障害管理の原則]]・[[アジャイルML]]・[[ML製品開発フェーズ]]・[[組織設計のスターモデル]])
- Pages updated: concept 34 件([[MLモデル監視]]・[[MLプロファイリング]]・[[SRE組織変革]]・[[インシデント管理]]・[[オブザーバビリティ]]・[[カナリアテスト]]・[[クラウドソーシングによるアノテーション]]・[[データのプライバシーと同意]]・[[データレイク]]・[[データ品質SLO]]・[[フィードバックループ]]・[[プライバシーエンジニアリング]]・[[予測モデルの解釈手法]]・[[予測分析とアルゴリズムバイアス]]・[[分類モデルの評価指標]]・[[回帰の評価指標]]・[[差分プライバシー]]・[[市場と組織]]・[[心理的安全性]]・[[意味のあるSLI設計]]・[[探索的データ分析]]・[[教師データのためのログ設計]]・[[教師データ収集手段の選択]]・[[機械学習の要否判断]]・[[機械学習システムの設計パターン]]・[[機械学習プロジェクトの進め方]]・[[機械学習基盤]]・[[物体検出]]・[[継続的トレーニング]]・[[耐障害LLMサービング]]・[[耐障害LLM訓練]]・[[製造工程の信頼性管理]]・[[訓練不変条件]]・[[音声認識]])、entity 4 件([[Google]]・[[Niall Murphy]]・[[Netflix]]・[[Lina Weichbrodt]])、[[index]]・各 `_index`・[[hot]]
- Key insight: 本書の骨格は「ML の信頼性を、SRE の道具立てが効く部分と ML 固有の部分に分解する」ことにある。第 5 章がこれを最も明確に示し、**モデルの確実性(システムを壊さないか)とモデルの品質(役に立つか)を独立した 2 軸として分ける**。前者は従来のリリース工学・カナリア・SLO がそのまま効くが、後者には効かない。第 9 章の監視をモデル・データ・サービスの 3 レイヤーに割る枠組みも同じ分解の現れで、サービス層は SRE の既存手法、データ層とモデル層が ML 固有の投資先になる。第 11 章はこの分解を障害対応にも適用し、**骨格(FEMA/ICS 由来の 4 役割)は ML でも非 ML でも不変で、変わるのは検知の困難さ・関与組織の広さ・タイムラインの不明確さの 3 点だけ**だと述べる。もう 1 つの通奏低音は「継続性の既定化」で、第 7 章の「すべてのモデルは再訓練されると仮定すべき」と第 10 章の「全ての運用 ML システムは継続的な ML システムとして扱うべきである」が呼応し、非継続的なシステムという扱いを例外側へ追いやる。第 6 章だけは独立寄稿者([[Aileen Nielsen]])が書いており、グループパリティとキャリブレーションは事象発生確率が全グループで等しくない限り数学的に両立しないという不可能性を提示する点で、他章の実務的な調子と質が異なる。第 15 章は 3 社 6 事例の実践者自身の寄稿で、1〜14 章の原則が実務でどう現れたかの裏づけと裏切りの両方を与える(Google の連続的 ML モデルはフィードバックループで自己汚染し、緩和策自体が悪化要因になった)。vault 全体で見ると、本書は既存の SRE 系 concept 群(SRE 論文・SRE 書籍由来)と ML 系 concept 群(論文由来)を橋渡しする役割を果たし、更新 34 件のうち大半がその接続として積み増された。
- 備考: PDF アウトラインの level 1 が綺麗な章一覧だったにもかかわらず、既定の章検出は節見出しを拾って `chapters_count=79` に化けたため、level 1 の 15 章から `--chapters` で切り直した。図はキャプションが本文と別フォント(GothicBBBPr6N-Medium 7.1pt 対 RyuminPr6N-Reg 8.5pt)で組まれており、「全 span が Gothic かつ最大 7.1pt」の 1 条件で機械分離できた。ベクター図で埋め込み画像が取れないため、キャプション直上の**本文ブロック**(Ryumin 8.5pt)の下端を上端とするクロップを用いた(図内ラベルも独立ブロックとして検出されるため、素朴な「直上ブロック」ではキャプションだけが切り出される)。本文参照 37 点と切り出し 37 点、埋め込み 37 点、未使用 0 点が完全一致した。まえがきは source 化せず book entity に織り込んだ。作業中に 2 つの誤りを検出・修正している。(1) オーケストレータが 13・14 章の個別プロンプトに書いた「§13.3 は集中型・分散型・ハイブリッドの 3 類型を提示し、14 章の 3 シナリオがそれに一対一対応する」という示唆は原本に存在せず(「ハイブリッド」は 13 章に grep 0 件、実際の中心枠組みは Galbraith のスターモデル)、13 章担当の照合で発覚したため 14 章担当へ訂正を送って書き直させた。(2) 骨格作成時に置いた著者 entity の `first_mentioned` が誤っており、[[Cathy Chen]] と [[Kranti Parisa]] は本編 15 章に一度も登場しない(grep 0 件)ため書誌そのものを指すよう修正した。章の執筆者クレジット(4 章・6 章・9 章・15 章)はまえがきの一覧から確定し、book entity に記録した。なお fan-out 途中でセッション上限により 10〜13 章の担当が同時終了したが、10〜12 章は source が完成済みだったため concept 作業のみの補完タスクとして再開した。
## [2026-08-17] ingest-book | 仕事ではじめる機械学習 第2版
- Source: `.raw/books/shigoto-de-hajimeru-kikai-gakushu/`(全 12 章 / 入力: pdf 352 ページ)
- Book entity: [[仕事ではじめる機械学習]]
- Chapters: [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 1 機械学習プロジェクトのはじめ方]]〜[[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 12 オンライン広告における機械学習]](12 件、全て `publish: false`)
- Pages created: 章 source 12 件、entity 5 件([[仕事ではじめる機械学習]]・[[有賀康顕]]・[[中山心太]]・[[西林孝]]・[[SHAP]])、concept 23 件([[決定境界]]・[[多重共線性]]・[[機械学習基盤]]・[[回帰の評価指標]]・[[因果効果の推定]]・[[リアルタイム入札]]・[[多腕バンディット]]・[[探索的データ分析]]・[[機械学習の要否判断]]・[[継続的トレーニング]]・[[予測モデルの解釈手法]]・[[分類モデルの評価指標]]・[[非連続な報酬構造の分析]]・[[探索と活用のトレードオフ]]・[[教師データ収集手段の選択]]・[[教師データのためのログ設計]]・[[機械学習プロジェクトの進め方]]・[[機械学習アルゴリズム選択の指針]]・[[機械学習システムの設計パターン]]・[[クラウドソーシングによるアノテーション]]・[[A-Bテスト|A/Bテスト]]・[[CTR予測]]・[[Uplift Modeling]])
- Pages updated: concept 19 件([[正則化]]・[[決定木]]・[[帰属手法]]・[[強化学習]]・[[最近傍法]]・[[汎化能力]]・[[逐次検定]]・[[技術的負債]]・[[教師あり学習]]・[[教師なし学習]]・[[クラスタリング]]・[[好奇心駆動学習]]・[[アンサンブル学習]]・[[勾配ブースティング]]・[[学習問題設定の分類]]・[[エージェント型強化学習]]・[[サポートベクターマシン]]・[[MLモデル監視]]・[[統計的有意性]])、[[index]]・各 `_index`・[[hot]]
- Key insight: 第 II 部の 4 章は「A/B テスト → Uplift Modeling → バンディット」という一本の拡張系列として読める。固定割当で平均処置効果(ATE)を測る A/B テスト、個体の特徴量で処置効果を分解して介入対象を絞る Uplift Modeling、割当自体を動的にして探索と活用のトレードオフを自動化するバンディット、という順で、第 11 章 §11.10 が 3 者を明示的に接続する(A/B テストと Uplift Modeling はそれぞれバンディット・文脈付きバンディットの固定割当版とみなせる)。この系列を wiki 側でも再現するため、担当章を直列化して [[A-Bテスト|A/Bテスト]] と [[因果効果の推定]] に層状に積み増した。もう 1 つの発見は本書の評価観の二重構造で、オフライン評価(第 3 章)とオンラインの効果検証(第 7 章)を別物として扱い、予測精度の向上とビジネスインパクトが相関しないこと(Booking.com の事例)を明示する。第 1 章と第 9 章に置かれた「機械学習を使わない選択肢」も同じ姿勢の現れである。
- 備考: PDF アウトライン level 1 が部に化けて `chapters_count=11` になったため、level 2 の 12 章から `--chapters` で切り直した。図はキャプションが本文と別フォント(GothicBBBPr6N-Medium 7.1pt 対 RyuminPr6N-Reg 8.5pt)で組まれるため機械分離でき、本文参照 133 点と切り出し 133 点が完全一致した。まえがき・あとがき・参考文献・索引は source 化せず、まえがきの内容は book entity の書誌・構成に織り込んだ。なお第 7 章担当が [[統計的有意性]] に入れた積み増しは、並行していた別セッションのコミット `22c804661b`(ingest-book | Principles of Network and System Administration)に巻き込まれて既にコミットされている(内容は無傷のため履歴は書き換えていない)。
## [2026-08-18] gap-analysis | Agentic 時代の SLI/SLO 運用の五つの空白
- Source: [[agentic時代のSLI-SLO運用]] §5「空白の定義 — 次に埋めるべき五つ」(wiki-lens の構造シグナルではなく、前日の wiki-query が言語化した候補を入力とした)
- Pages created: [[wiki/meta/gap-report-2026-08-18]]
- 判定: real-gap 5 / weak 0 / intentional 0。推薦文献 12 件のうち 10 件を Semantic Scholar・arXiv API で検証、2 件は 429 のため未検証ラベルで保留。Tier 0(引用済み未取り込み)は 0 件。
- Key insight: 最大の発見は文献でなく**リンク構造**にあった。ギャップ 4(バジェット消費判断の利益相反)は橋渡しに要る概念ページが既に vault 内に揃っており、鎖が切れているだけだった——[[グッドハートの法則]] は SLO・エラーバジェットへ 8 箇所つながる一方でエージェントへの言及が 0 件、[[報酬ハッキング]] は [[グッドハートの法則]] へつながる一方で SLO・エラーバジェットへの言及が 0 件、そして [[Transactional No-Regression]] は本文で報酬ハッキングに 5 回言及し未解決の問いにも立てながら [[報酬ハッキング]] への wikilink が 0 件だった。[[ゲーム理論とSRE]] は「SRE work is mechanism design」を核心命題に掲げながらエージェントに一言も触れていない。**エージェントが自らのバジェット消費を判定する構図は機構設計におけるモラルハザードそのもの**であり、この対応が vault 内で言語化されていない。ギャップ 5 も同型の片方向リンク欠落で、5 件中 2 件は ingest 不要・内部結線で埋まる。
- Key insight 2: 残る 3 件は外部文献を要する。ギャップ 1 は人間-自動化研究の adaptive/adjustable autonomy(Parasuraman+ 2000、被引用 4,210)、ギャップ 2 はランタイム検証と safe RL の shielding(Alshiekh+ 2017)、ギャップ 3 は選択的予測の risk–coverage 曲線(Geifman & El-Yaniv 2017)と conformal prediction(Angelopoulos & Bates 2021)が対応する。いずれも vault に concept ページが存在しない領域で、SRE 側が独自に再発明しかけている構図が共通する。
- 備考: 1Password がロック中で S2 API キーを取得できずキーレス動作となり、共有プールの 429 が頻発した。arXiv 収録の 5 件は arXiv API で識別子を厳密確認し代替した。arXiv 版のない 3 件のうち Bauer+ 2011 は再試行で検証でき(DOI: 10.1145/2000799.2000800、被引用 660)、残る 2 件(Lee & See 2004・Basin+ 2015)は書誌が記憶依存のため未検証のまま残し、取り込み前の現物確認を必須とした。副産物として、引用されているが `wiki/sources/` に存在しないソース 56 件を検出した(上位は LLM 学習インフラ系。`@2012__Wiley__Practical Reliability Engineering` 6 参照は章別 source 一本化時の旧リンク残存と見られる)。これは wiki-lint の対象として切り出すべきである。
- 権限境界: 本スキルは推薦のみを行い、concept ページの編集・ingest・リンク挿入は一切行っていない。
## [2026-08-17] query | Agentic 時代の SLI/SLO 運用
- Query: 「Agentic 時代の SLI/SLO 運用」(deep モード。linked note は [[サービスレベル目標]])
- Pages created: [[wiki/questions/agentic時代のSLI-SLO運用]](`address: c-003632`)
- Pages updated: [[wiki/questions/SLI-SLO教科書]](第 8.8 節を 4 小節へ拡充、第 9 章「Agentic 時代の SLI/SLO」を新設、旧第 9 章を第 10 章へ繰り下げ、10.4 に Agentic 時代の 5 空白を追加、付録 A に 5 行・付録 B に concept 群を追加)、[[wiki/index.md]]
- Key insight: 「Agentic 時代の SLI/SLO」という一語には、**対象としての AI**(AI ワークロードを測る)・**道具としての AI**(SLI/SLO 策定を AI が助ける)・**統治対象としての AI**(SLO でエージェント権限を律する)という 3 つの問いが混在しており、本 wiki の蓄積は第 3 の問いでほぼ空白である。エージェント側には assurance contract・verification wall・[[Transactional No-Regression]] という精緻な安全仕様の語彙が既にあるにもかかわらず、SLO/エラーバジェットとの接続点は wiki 全体で 2 点しかない(verification wall の不変条件候補として挙がるが「チェッカ化できない」と留保される件と、TNR の重大度関数の第 2 項が SLA 違反数である件)。エラーバジェットを「AI に任せる権限レベル」の制御信号として使う議論は Yoshikawa の 1 件のみで、これが [[SRE AI Autonomy Levels]] の「昇格の定量基準は未明示」という欠落と正確に噛み合う。第 4.4 節のバンバン制御→プロポーショナル制御という設計思想が、二値の「AI に任せる/任せない」でなく連続的な自律度調整と同型であることが、この接続を支持する。
- 空白の定義: (1) エラーバジェットを自律度ゲートに使う設計、(2) SLO を機械判定可能な不変条件へ変換する方法、(3) エージェント自身への SLO 設定(Silent 失敗率が 6 割を超えうる前提での成功率型 SLI)、(4) エージェント自律緩和時のバジェット消費・凍結判断の主体、(5) ハルシネーション率のユーザー幸福フレーバー分類。5 点は「SLO を人間同士の社会契約から人間と機械の権限契約へ拡張する」という単一課題の側面である。足がかりは第 6.4 節の SLE/CBE(「契約 = 期待 + 帰結」で assurance contract と同型)。
- 備考: retrieve.py は動作したが ollama 不達で rerank が noop になったため、BM25 上位を参考にしつつ concept クラスタ 4 系統(エージェント安全性 / AI ワークロード SLI / 教科書+エラーバジェット / AI 時代の信頼性構想)を Explore subagent 4 体で並行読解して統合した。教科書の章番号繰り下げは本文中の相互参照がないことを確認したうえで実施。
## [2026-08-17] ingest-book | Principles of Network and System Administration
- Source: `.raw/books/principles-of-network-and-system-administration-2e/`(本編 14 章 / 入力: pdf 649 ページ)
- Book entity: [[wiki/entities/Principles of Network and System Administration|Principles of Network and System Administration]]
- Chapters: [[@2004__Wiley__Principles of Network and System Administration - Chapter 1 Introduction]]〜[[@2004__Wiley__Principles of Network and System Administration - Chapter 14 Summary and outlook]](14 件、全て `publish: false`)
- Pages created: 章 source 14 件、entity 1 件(book entity)、concept 5 件([[アカウントポリシー]]・[[サービス導入の一般手順]]・[[プロキシとエージェント]]・[[ポリシー]]・[[信頼関係]])
- Pages updated: entity 7 件([[LISA]]・[[Mark Burgess]]・[[Oslo University College]]・[[SAGE]]・[[Thomas A. Limoncelli]]・[[Wiley]]・[[cfengine]])、concept 19 件([[Infrastructure as Code]]・[[べき等性]]・[[ゲーム理論とSRE]]・[[サービスレベル目標]]・[[システム管理者からSREへの視点転換]]・[[ソフトウェア変更管理]]・[[データのプライバシーと同意]]・[[ネットワーク監視]]・[[プローブ効果]]・[[ワークロードの特性の把握]]・[[予防保守]]・[[収束型システム管理]]・[[技術的規則]]・[[故障の木解析]]・[[根本原因分析]]・[[潜在的障害]]・[[統計的有意性]]・[[複雑ネットワーク]]・[[過渡応答解析]])
- Key insight: 本書の理論的な核は、収束(convergence)を競合(competition)・免疫(immunity)と並ぶ三つ組として位置づけ、それを [[cfengine]] という実装と一体で提示した点にある(第 6 章 §6.7 が三つ組を提示し、第 7 章 §7.11 が宣言的記述と冪等な収束実行として実装を示す)。この系譜が Chef / Puppet に連なる。もうひとつ現代に効くのは第 13 章 §13.7 の観測規律で、誤差棒がグラフの変動より大きければそこに見える「リズム」は解析的に無意味だと実測 7 点で繰り返し判定してみせる。第 10 章 §10.9 は、サービス資源をめぐる顧客間のゲームが囚人のジレンマになるかハト-タカになるかが提供者の技術で決まる閾値 Rc で切り替わることを示し、第 8 章 §8.9 の管理者と利用者のゲームとは別の対で本書のゲーム理論的思考を補完する。一方、個別サービス設置(第 9 章)とセキュリティ実装(第 12 章)の技術前提は 2004 年に強く依存し、原理層と実務層で賞味期限が大きく異なる。
- 備考: 章の自動検出は節見出しを拾って 127 件に化けたため、PDF アウトライン level 1 から `--chapters` で 14 章 + 付録 A〜E に切り直した。付録(Unix コマンド集・プログラミングとコンパイル・telnet セッション例・用語集・推薦文献)は資料的性格が強いためユーザー確認のうえ対象外とし、序文は source 化せず book entity に織り込んだ(序文由来の記述の出典は書誌そのものを指す形に統一)。図は全てベクター図 + ラスタ 3 点で、洋書のキャプション記法(`Figure N.M:` のコロン)により本文参照と機械分離でき、本文 grep の 82 点と切り出し 82 点が差分ゼロで一致、全点を埋め込んだ。既存ノート `books/Principles of Network and System Administration.md` と basename が衝突するため、book entity への参照は conventions §9.7 に従い全てパス修飾した。章ごとに Sonnet 5 subagent へ委譲し、[[ポリシー]]・[[収束型システム管理]] を奪い合う章(3→6→7→11→12、1→4→6→7→14)を投入順で直列化して層状に積み上げた。取り込み中、別セッションが同一 vault で『仕事ではじめる機械学習』を並行 ingest していたため、差分を書名の有無で機械分類して本書分 46 ファイルのみを stage した。
## [2026-08-17] ingest-slides | SONiC で 800G AEC ケーブルを検証してみた
- Source: `.raw/slides/softbank-sonic-800g-aec/softbank-sonic-800g-aec.pdf`(SpeakerDeck、28ページ)
- Visual pages: `.raw/slides/softbank-sonic-800g-aec/pages/`
- Media: `.raw/slides/softbank-sonic-800g-aec/transcript.md`(YouTube動画 https://www.youtube.com/watch?v=K0UQ3JsYjFM の音声をWhisperで文字起こし)
- Summary: [[@2025__SpeakerDeck__SONiCで800G AECケーブルを検証してみた]]
- Pages created: source 1 件、entity 1 件([[Credo Semiconductor]])、concept 2 件([[AECケーブル]]・[[CMIS]])
- Pages updated: entity 4 件([[張朝程]]・[[内田泰広]]・[[ソフトバンク株式会社]]・[[SONiC]])
- Key insight: SONiC上でのCMISログ(`show logging xcvrd`)とレジスタ操作(`i2cdump`/`i2cset`)による障害切り分け手法。Y社SONiCで800G AECケーブルがリンクアップしなかった原因はTx Output Controlsレジスタ(CMIS Page 10h, byte 130)が全レーン無効(0xFF)のままだったことで、レジスタを`0x00`に書き換えて解決した。CMIS仕様(OIF-CMIS-05.2)ではTx output disable機能は通常ホストのみが制御するため、発表者はY社SONiC側のTx出力制御実装に問題がある可能性を指摘している。消費電力実測では800G AEC(Copper)が11.04Wで、Optics SR8(VCSEL、12.92W)比15%減、Optics DR8(EML、13.99W)比21%減だった。
- 備考: 全スライドに`CONFIDENTIAL`表記があるが、SpeakerDeck・YouTubeで一般公開されている資料であることを確認して通常どおり取り込んだ。発表者[[張朝程]]・[[内田泰広]]は既存entity(初出は[[@2026__JANOG58__Rack-Scale GPUサーバーのNW設計と運用までの苦悩]])で、本ソース(2025-05-19)は時系列上そちらより先行するためfirst_mentionedを更新した。文字起こしからスライド未記載の補足(ケーブル長2.5m/最大7m、Tomahawk 5搭載スイッチ、張朝程氏の入社日・前職経歴)を得た。
## [2026-08-17] figures | NIC 光モジュールのモニタリング
- Pages updated: [[wiki/questions/NIC光モジュールのモニタリング]](初学者向けの導入 2 節を新設、版に関する記述を削除、図版 4 点を追加)、[[wiki/index.md|index]]。
- 図版: `Attachments/NIC光モジュールのモニタリング/` に 4 点。codex の imagegen skill で生成し、オライリー調のグレースケール線画(黒白と薄いグレーのみ、細い実線、装飾なし、日本語ゴシック)に揃えた。figure-01 は光トランシーバの内部構造(変調器・レーザ・フォトディテクタ・増幅器)と各部品から取れる観測量および I2C 経由の DDM 読み出し、figure-02 は pre-FEC BER と post-FEC BER の崖(KP4 の 2.4e-4 を境に post-FEC が非線形に立ち上がる)、figure-03 は継続時間の異なる 5 イベントに対する 1 秒/15 秒/60 秒粒度の検知可否、figure-04 はスイッチ側と NIC 側の救済可能性の非対称(他パス迂回と Fate Sharing による全ポート喪失)。
- 構成変更: 冒頭に「光トランシーバという部品」「監視で使う用語」の 2 節を追加して全 11 節へ再番号し、光パワー(dBm)・バイアス電流・BER・FEC・pre/post-FEC BER・eSNR・DDM・I2C・AFR/MTBF・ハード故障とソフト故障・グレイ障害を定義した。あわせて日本語技術文書の規範(一文一行、中黒とダッシュの排除、太字の抑制、対象を指す見出し)を適用し、「初版では」「改訂」といった版に関する記述を全削除した。
## [2026-08-17] ingest-book | Handbook of Software Reliability Engineering
- Source: `.raw/books/handbook-of-software-reliability-engineering-1996/`(19 セクション / 入力: 章別 PDF 19 本、計 780 ページ。https://www.cse.cuhk.edu.hk/~lyu/book/reliability/ より取得)
- Book entity: [[wiki/entities/Handbook of Software Reliability Engineering|Handbook of Software Reliability Engineering]]
- Chapters: [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 1 Introduction]]〜[[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 17 Neural Networks for Software Reliability Engineering]] + [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Appendix A Software Reliability Tools]]・[[@1996__McGrawHill__Handbook of Software Reliability Engineering - Appendix B Review of Reliability Theory, Analytical Techniques, and Basic Statistics]](19 件)
- Pages created: source 19 件、entity 42 件(book entity 1 + person・organization・product・dataset 41)、concept 4 件([[運用プロファイル]]・[[直交欠陥分類]]・[[テストカバレッジ]]・[[フィールドデータ解析]])
- Pages updated: entity 12 件([[Michael R. Lyu]]・[[John Musa]]・[[Jean-Claude Laprie]]・[[Ravishankar K. Iyer]]・[[Tandem Computers]]・[[NonStop]]・[[IBM T.J. Watson Research Center]]・[[LAAS-CNRS]]・[[North Carolina State University]]・[[Purdue University]]・[[Florida Atlantic University]]・[[University of Virginia]])、concept 25 件
- Key insight: 本書の価値は個々の章の水準よりも**章をまたいで初めて見える構造**にある。(1) 信頼性成長モデルについて、第3章が分類・定義し、第4章が「当てはまりでなく予測精度で判定せよ」と評価軸を与え、第10章が「そもそも成長しているか」を適用前に検定し、第7章が実適用を報告するという**診断 → 選択 → 検証のパイプライン**が立ち上がる。ところがその第7章は、JPL・Bellcore のいずれも実行時間や運用プロファイル情報を体系的に記録していないと報告しており、**パイプラインの入口自体が現場では欠落している**。(2) 編者 Lyu(第1章 §1.4)はフォールト→故障の二段階連鎖で用語を要約するが、分担執筆者 Laprie & Kanoun(第2章 §2.2.2)はフォールト→誤り→故障の三段階連鎖を必須構造とする。第1章は §1.5 で Laprie の枠組みに依拠すると明言しながら自章の要約でそれを踏襲しておらず、編著書における用語統制の限界を示す。`> [!contradiction]` を第2章 source と [[ディペンダビリティ]] に配置した。(3) 多版ソフトウェアの故障相関について、第15章(Dugan)は無関係故障と関連故障が統計的に独立と仮定し、Arlat/Kanoun/Laprie の元モデルは排反と仮定する。第14章 §14.7 が同じ分岐を両論併記しており、独立した2章が食い違いの実在を相互に裏づけた。(4) 編者自身が書いた付録B(数学的下敷き)には**ベイズ推定の節が存在しない**。第3章が Littlewood-Verrall のベイズ型モデルを扱うにもかかわらず付録は完全に頻度論的であり、この不在自体を [[ベイズ推定]] の横断的知見に記録した。
- 備考: **原本の章別 PDF はテキスト層を持たないスキャン画像**(`pdftotext` が空を返す。この環境に `tesseract`/`ocrmypdf` は未導入)。150 DPI でレンダリングしたページ画像を Sonnet 5 subagent が視覚的に読み取る方式をユーザーの承認のうえ採用した。派生物であるページ画像はリポジトリに置かず、`.raw/` には PDF 原本・全文抽出可能な前付/用語集/文献リスト・目次・序文・寄稿者一覧のみを残した。図表は埋め込み画像オブジェクトもキャプション座標も取得できず 1 点ずつ手作業でクロップする必要があるため、通常の「除外理由がなければ全点埋め込む」方針は適用せず各章 3〜8 点に絞った(計 106 点、埋め込みと attachment は双方向で完全一致を検証済み)。SRGM のハブ concept を奪い合う 6 章(3・4・10・7・16・17)は投入順を直列化し、各章に別々の軸を割り当てて層状に積み上げた。fan-out 後の機械的検証で、第11章・第15章の担当者が「埋め込んだ」と報告した図 3 点が実際には未埋め込みであることを検出し、オーケストレータが本文の該当箇所へ補った。
## [2026-08-17] query-deep (再構成) | NIC 光モジュールのモニタリング
- Source: 既存 question ページ [[wiki/questions/NIC光モジュールのモニタリング]] を、2026-08-10 以降に ingest された光関連ソース群を踏まえて全面再構成(7 節 → 9 節)。
- 新規に反映したソース: [[@2023__CCGrid__An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data]]、[[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]]、[[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]]、[[@2017__SIGCOMM__Understanding and Mitigating Packet Corruption in Data Center Networks]](全文)、[[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]](PDF 全文再取り込み版)、[[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]]、[[@2024__NADDOD__The Evolution of 400G, 800G, and 1.6T Optical Modules]]。
- Pages updated: [[wiki/questions/NIC光モジュールのモニタリング]](全面改稿)、[[wiki/index.md|index]](Questions 節の要約を刷新)。
- Key insight: 初版が未解決として残した 2 つのギャップのうち、**光モジュール単体の実測 AFR** は CCGrid 2023 が 405 万デバイス年で公開済み(ハード故障 0.1341%・ソフト故障は最大 12.22 倍の 1.6463%)であることが判明し、初版の「見つからなかった」という記述を訂正した。AFR 0.1341% は DIMM(0.22%)並みに低くハードドライブ(1.7〜8.6%)より有意に良いにもかかわらず運用が苦しむ理由は、ソフト故障比率が DIMM の soft error 型(36 倍)に近く、それが交換チケットにならないまま訓練ジョブを止めるためである——**部品 AFR と運用上の痛みの乖離**を新しい横断的知見として追加した。もう 1 つの発見は予兆特徴の形で、CCGrid の lift 分析では温度・バイアス電流・Rx パワー・スループットのいずれでも**高分散(6.3〜7.29x)が高値(5.7〜6.24x)を上回り**、最強はエラーレート高値(9.13x)、逆にパケットロスは 1.27x でほぼ無関係だった。これは「平均値だけを保持するダウンサンプリング」と「1 回のエラーはノイズとして無視する運用慣行」が最も情報量の多いシグナルを系統的に捨てていることを意味する。時間粒度についても、初版が問いとして残した「60 秒 DOM ポーリングで十分か」に OpTel が実測で答えており(光イベントの 51.09% が一過性・20% は 1 秒のみ・15 秒より粗い粒度では一過性を一切検知できない)、DOM 単独では原理的に半分を取りこぼすという結論を得た。
- 新設した節: §3「何を測ると当たるか — 予兆特徴の実証」(CCGrid の 5 分析軸 + OptProphet の内部構成)、§5「どの時間粒度で取るか — 一過性イベントの実証」(OpTel)。§4 に RAIL のマージン実測(99.9% が BER 1e-12 閾値超・中央値 6 倍)と FEC 世代での要求緩和(1e-12→5e-5)を追加。§8 に CorrOpt/RAIL/OpTel/CCGrid を目的関数(コスト削減/修復最適化/検知高速化/故障予測)で対比する系譜表を新設。
- 新たに立った問い: CorrOpt は解析対象を **switch-to-switch 光リンクに限定**し「サーバ–ToR 間は電気信号・短距離なので対象外」と明記していた。NIC 側が 400G/800G 光になった現在、本ページが扱う領域はまさに CorrOpt が除外した領域であり、破損の統計的性質(時間的安定性・利用率非相関・弱い空間局所性)が NIC 側でも成り立つかは誰も検証していない。また CCGrid・OptProphet はいずれも SFF-8472 世代の DDM 5 種を入力としており、**CMIS VDM の pre-FEC BER・eSNR をフリート規模で収集した研究は依然として空白**である。NIC 側光モジュールが冗長化で救えない単一障害点であることは、[[@2026__arXiv__Resilient AI Supercomputer Networking using MRC and SRv6]] のトランスポート層と [[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]] の Fate Sharing 分析(4x200G optics と 800G NIC 自体が単一故障点として残る)という無関係な 2 観点から独立に確認された。
## [2026-08-17] ingest-paper | ActionNex: A Virtual Outage Manager for Cloud Computing
- Source: `.raw/papers/arxiv-2604.03512.pdf`(arXiv:2604.03512、cs.AI、v1 2026-04-03・v2 2026-04-09。ユーザー情報によれば ASE 2026 採択、本文中に会議名の明記なし)
- Summary: [[@2026__arXiv__ActionNex - A Virtual Outage Manager for Cloud Computing]]
- Pages created: source 1 件([[@2026__arXiv__ActionNex - A Virtual Outage Manager for Cloud Computing]])/ entity 14 件(person 10: [[Zhenfeng Lin]]・[[Ryan Zhang]]・[[Salman Zafar]]・[[Haoji Hu]]・[[Junhao Li]]・[[Hatay Tuna]]・[[Ming Hao]]・[[Oleg Kulygin]]・[[Sheila Jiang]]・[[Angie Anderson]]、organization 3: [[Microsoft PRIMO]]・[[Microsoft Azure Core]]・[[Azure CTO Office]]、product 1: [[ActionNex]])/ concept 1 件([[次善アクション推薦]])
- Pages updated: entity 4 件([[Chetan Bansal]]・[[Ze Li]]・[[Murali Chintalapati]]・[[Xuchao Zhang]]、いずれも既存の Microsoft AIOps 研究者エンティティに本論文への参加を追記)/ concept 3 件([[エージェントメモリ]]・[[クラウド障害ライフサイクル]]・[[TSG自動化]])
- Key insight: [[Zhenfeng Lin]]ほか14名(Microsoft PRIMO / Microsoft Research / Microsoft Azure Core / Azure CTO Office)が、outage 管理を検知から解決まで end-to-end に支援する本番グレードのエージェントシステム ActionNex を提案。critical events という状態遷移抽象と、playbook 由来の Key-Condition-Action(KCA)長期記憶・エピソード記憶・作業記憶からなる階層記憶、検索駆動(ルールトリガーでない)の次善アクション推薦を組み合わせ、Azure 実 outage 8 件で precision 71.4%・recall 52.8〜54.8% を達成し本番試験導入済み。段階別分析(Detect→Resolve)で recall 上昇・precision 低下という一貫パターンを確認し、これを既存 concept [[クラウド障害ライフサイクル]] の TTX(所要時間の定量化)に対する「各段階での AI 推薦確信度」という相補的な軸として横断的知見に追加した。また [[TSG自動化]] concept に対しては、既存研究群(FLASH/LLexus/StepFly の「実行」、FlowXpert/TSGen の「生成」)に、KCA による「検索駆動の推薦(実行しない)」という第3の軸を加えることを追記した。共著者 14 名中 4 名([[Chetan Bansal]]・[[Ze Li]]・[[Murali Chintalapati]]・[[Xuchao Zhang]])は本 wiki 既存の Microsoft インシデント管理研究者エンティティ(COMET・Comfey・FLASH・Gandalf・Aegis 等の共著者)と同一人物として合流した。
- 備考: 図表5点(Figure 1・2 は pdf.js 抽出の埋め込みラスター画像、Figure 3 はベクター図のため PyMuPDF キャプション座標クロップで取得、Table 1・2 は Markdown 表に転記)を本文参照分すべて埋め込み。全7ページを通読。
## [2026-08-17] ingest-paper | Gleaner: A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics
- Source: `.raw/papers/arxiv-2604.16810.pdf`(arXiv:2604.16810、ISSTA 2026 直接採択・ユーザー確認情報)
- Summary: [[@2026__ISSTA__Gleaner : A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics]]
- Pages created: source 1 件([[@2026__ISSTA__Gleaner : A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics]])
- Pages updated: entity 7 件([[Yifan Yang]]・[[Aoyang Fang]]・[[Songhan Zhang]]・[[Pinjia He]]・[[The Chinese University of Hong Kong, Shenzhen]]・[[Train-Ticket]]・[[Drain]])/ concept 2 件([[トレースサンプリング]]・[[根本原因分析]])
- Key insight: トレースを「bag-of-edges」(EPS: event-pair set)というハッシュ可能集合で表現し、グラフ構造解析を集合演算に置き換えることで、ログ意味論の考慮とオンライン性能(0.74ms/trace)を初めて両立。1%サンプリング率でのRCA精度が全量データ(unsampled)を上回るという反直感的な知見を実証し、その効果はRCAアルゴリズムの設計思想(集約統計ベース・パターンベース・因果推論ベース)によって大きく異なることを示した。
## [2026-08-16] ingest-book | Practical Reliability Engineering
- Source: `.raw/books/practical-reliability-engineering-5e/`(19 枚 / 入力: pdf、ユーザー提供のローカル PDF、504 ページ)
- Book entity: [[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]]
- Chapters: [[@2012__Wiley__Practical Reliability Engineering - Chapter 1 Introduction to Reliability Engineering]]〜[[@2012__Wiley__Practical Reliability Engineering - Chapter 17 Reliability Management]]、[[@2012__Wiley__Practical Reliability Engineering - Appendix 5 Failure Reporting, Analysis and Corrective Action System (FRACAS)]]、[[@2012__Wiley__Practical Reliability Engineering - Appendix 6 Reliability, Maintainability (and Safety) Plan Example]](19 件)
- Pages created: entity 4 件([[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]]・[[Genichi Taguchi]]・[[W. E. Deming]]・[[K. Ishikawa]])/ concept 28 件([[信頼性工学]]・[[バスタブ曲線]]・[[工学的ばらつき]]・[[ワイブル分布]]・[[寿命データ解析]]・[[モンテカルロシミュレーション]]・[[荷重-強度干渉]]・[[信頼性予測]]・[[故障の木解析]]・[[システム信頼性モデル]]・[[FMECA]]・[[故障の物理]]・[[電子部品の信頼性]]・[[ソフトウェア信頼性]]・[[実験計画法]]・[[タグチメソッド]]・[[信頼性試験]]・[[加速試験]]・[[保証データ解析]]・[[修理可能系の信頼性解析]]・[[信頼性実証]]・[[信頼性成長]]・[[製造工程の信頼性管理]]・[[ストレススクリーニング]]・[[保守性]]・[[可用性]]・[[予防保守]]・[[信頼性管理]])
- Pages updated: entity 3 件([[Patrick D. T. O'Connor]]・[[Andre Kleyner]]・[[Wiley]])/ concept 7 件([[Design for Reliability]]・[[FRACAS]]・[[ディペンダビリティ]]・[[ソフトウェア耐障害性]]・[[ソフトウェア信頼性成長モデル]]・[[SRE]]・[[逐次検定]])
- Pages deleted: [[@2012__Wiley__Practical Reliability Engineering]](2026-06-14 に書籍全体 1 枚として取り込んだ旧形式の source ページ。ユーザー判断により章 source 群へ一本化。参照は book entity と該当章ページへ張り替えた)
- Key insight: 本書は信頼性工学を「確率論の応用分野」ではなく「工学判断を中心に据えた実務体系」として提示する。定量化手法を残しつつその限界を各所で明示する構成が版を追うごとに強められ、§3.7・§6.2・§11.4・§14.11 という異なる章で同じ構えが繰り返される。章をまたぐ積み増しでは、第 6 章の PRISM「78% 以上の故障が部品以外に由来する」という知見と第 9 章の「部品の高信頼性化によりシステム故障の主因が部品外へ移った」が独立に同じ結論へ到達していること、第 12 章 §12.4.1 と第 14 章 §14.11/§14.12.8 が互いを参照せず信頼性実証の限界へ到達していること、第 14 章の Duane 法と第 12 章の HALT が「同じ開発試験プログラム内で両立しないデータソース」であることが見えた。既存 [[ソフトウェア信頼性成長モデル]] との間では、Lyu 2007 の「モデル選択は管理可能」と本書 §10.14.1 の「主に学術的関心にとどまり未標準化」が対立するため contradiction callout を置いた。
- 備考: PDF アウトラインが 0 件だったため章扉を本文から機械検出して境界を確定した(`fetch-book.sh` の自動検出は全章で 1〜2 ページ手前にずれており、第 17 章には Appendix 1〜7 が丸ごと混入していた)。Appendix 1〜4(数表)・7(行列代数)・索引は捨て番号で分離し取り込み対象外とした。図は埋め込み画像 0 件の全ベクター図で、キャプション(Optima-Italic 9pt)が本文(Times-Roman 10pt)とフォントで分離できたため座標クロップにより本文参照 174 点を欠落ゼロで切り出し、重複構図 4 点と演習問題専用 2 点を除く 169 点を埋め込んだ。fan-out は Sonnet 5 subagent へ 1 章 1 体で委譲し、ワイブル分布(2→3→13)・DfR(7→8→9)・加速試験(12→13→14)などハブ concept を共有する章は投入順で直列化した。第 17 章と Appendix 6 の担当はセッション制限で途中終了したため、残った entity へのリンク追記をオーケストレータが引き継いだ。
## [2026-08-16] ingest-book | Resilience Engineering: Concepts and Precepts
- Source: `.raw/books/resilience-engineering-concepts-and-precepts/`(入力: pdf / ユーザー提供のローカル PDF。**書籍全体でなく先頭41ページの抜粋**で、収録は Preface・Prologue・Part I 扉・第1章 + Yushi Fujita の挿話・第2章前半のみ)
- Book entity: [[wiki/entities/Resilience Engineering|Resilience Engineering: Concepts and Precepts]]
- Chapters: [[@2006__Ashgate__Resilience Engineering - Prologue Resilience Engineering Concepts]], [[@2006__Ashgate__Resilience Engineering - Chapter 1 Resilience – the Challenge of the Unstable]](2 件。第2章は原本が印字 p.28 の文中で切断されているためユーザー確認のうえ除外)
- Pages created: source 2 件([[@2006__Ashgate__Resilience Engineering - Prologue Resilience Engineering Concepts]]・[[@2006__Ashgate__Resilience Engineering - Chapter 1 Resilience – the Challenge of the Unstable]])/ entity 3 件([[wiki/entities/Resilience Engineering|Resilience Engineering: Concepts and Precepts]]・[[Yushi Fujita]]・[[Linköping University]])
- Pages updated: entity 2 件([[Erik Hollnagel]]・[[David D. Woods]])/ concept 6 件([[レジリエンスエンジニアリング]]・[[事故モデル]]・[[ヒンドサイトバイアス]]・[[人的要因]]・[[トレードオフ意思決定]]・[[複雑システム障害論]])
- Key insight: Prologue と第 1 章は同じ転換を別の角度から要求している。Prologue は「誰が安全を作っているのか」を問い直して分析対象を失敗の計数から適応能力の理解へ移すよう求め、第 1 章は「何を事故とみなすか」を問い直して手法をコンポーネントの故障モードの追跡から機能の同時発生(concurrence)の記述へ移すよう求める。両者を並べると、レジリエンスエンジニアリングが安全観の変更(価値としての安全)と方法論の変更(システミックな事故モデル)を同時に要求する枠組みであることが見える。既存 concept [[事故モデル]] は Rasmussen (1997) の動的社会モデルを軸に育っていたが、本書第 1 章が事故モデルとリスク評価手法の一対一対応(図1.3)を与えたことで、「どのモデルを採るかがどの評価手法まで射程に入るかを規定する」という制約関係が明示された。
- 備考: `fetch-book.sh` の章検出は厳密パターン(Chapter N / 第N章)で0件、level1-fallback でも Prologue を拾えなかったため、全文テキストのランニングヘッダから印字ノンブルと PDF ページのオフセット(PDF = 印字 + 13)を求め、`--chapters "9=12,0=14,1=20,2=34"` で手動指定して切り直した(9=Preface、0=Prologue、1=第1章+挿話、2=第2章)。図表3点は PyMuPDF キャプション座標クロップで取得し、1点ずつ Read で境界を目視確認してから配布した。章ごとに Sonnet 5 subagent へ委譲(オーケストレータは Opus 5)。両章とも [[レジリエンスエンジニアリング]] を中心に触るため、並行させず Prologue → 第1章の投入順で直列化し、後発の第1章には先行章が触った concept 一覧と積み増しの軸(Prologue = 後知恵バイアスとパラダイム転換 / 第1章 = 事故モデルの系譜とリスク評価手法の射程)を申し送りした。オーケストレータが個別プロンプトに書いた示唆のうち「Reason への言及が3箇所」は誤りで(`grep -i` が `reasonable` 等を拾っていた)、Prologue 担当が原本照合で検出し書かなかった。取り込み中、別セッションが同じ vault で `Practical Reliability Engineering` の書籍 ingest を並行実行していたため、本書分のファイルは差分中の `@2006__Ashgate__` リンクの有無で機械的に分類し、混入がないことを確認したうえで stage した。
## [2026-08-16] ingest-paper | What is Technology? Six Definitions and Two Pathologies
- Source: `.raw/papers/what-is-technology-six-definitions-and-two-pathologies-4rtkhjgqxo.pdf`(ユーザー提供のローカル PDF、初出 SPRU Working Paper Series, SWPS 2014-19, October 2014)。当初 `/wiki-ingest-book` で指定されたが、32ページの単著学術論文(SSRN掲載)であり書籍の章・断片ではないと判断し、ユーザーに確認のうえ `wiki-ingest-paper` に切り替えて取り込んだ。
- Summary: [[@2014__SPRU__What is Technology Six Definitions and Two Pathologies]]
- Pages created: source 1 件([[@2014__SPRU__What is Technology Six Definitions and Two Pathologies]])/ entity 2 件([[Paul Nightingale]]・[[John Searle]])/ concept 1 件([[技術の定義]])
- Pages updated: entity 2 件([[Michael Polanyi]]・[[Walter Vincenti]])/ concept 2 件([[動作原理]]・[[暗黙知]])
- Key insight: [[Paul Nightingale]]が、技術の経験的特徴(語としての新しさ・意味の変遷・応用科学でないこと・暗黙知への依存)と[[John Searle]]のSpeech Act理論(方向性の議論)を組み合わせ、技術の6つの定義を学問分野別の視点の階層として統合。既存 concept [[動作原理]]・[[暗黙知]]はいずれもVincenti『What Engineers Know and How They Know It』経由でMichael Polanyiを参照していたが、本ソースはPolanyiの原著(1958年『Personal Knowledge』等)にVincentiを介さず直接遡る独立した参照系列を与え、「動作原理・暗黙知が工学実務でどう現れるか」(Vincenti)と「なぜ・どう生成されるか、技術/科学の認識論的差異をどう基礎づけるか」(Nightingale)という相補的な関係が見えるようになった。
- 備考: 本文に numbered figure は無く、Table 1(技術の考え方の一覧)のみをMarkdown表に転記。pdf.js抽出の埋め込み画像3点のうち2点(表紙・裏表紙のSPRU institutional logo)は装飾のため除外、1点(科学/技術の因果方向の違いを図示した概念図。本文に明示的な図番号なし)を Theory II 節近傍に埋め込んだ。全32ページを通読。
## [2026-08-16] ingest-paper | Methodology of Algorithm Engineering
- Source: `.raw/papers/Methodology-of-Algorithm-Engineering.pdf`(ユーザー提供のローカル PDF、初出 *ACM Computing Surveys*, Vol. 58, No. 4, Article 94, October 2025, DOI: 10.1145/3769071)
- Summary: [[@2025__CSUR__Methodology of Algorithm Engineering]]
- Pages created: source 1 件([[@2025__CSUR__Methodology of Algorithm Engineering]])/ entity 9 件([[Jan Mendling]]・[[Henrik Leopold]]・[[Henning Meyerhenke]]・[[Benoît Depaire]]・[[Vienna University of Economics and Business]]・[[Weizenbaum Institute]]・[[Kühne Logistics University]]・[[University of Potsdam]]・[[Hasselt University]])/ concept 2 件([[アルゴリズムエンジニアリング]]・[[研究方法論における妥当性概念]])
- Pages updated: entity 3 件([[Humboldt University of Berlin]]・[[Karlsruhe Institute of Technology]]・[[Hasso Plattner Institute]])/ concept 2 件([[工学科学]]・[[デザインサイエンス研究]])
- Key insight: [[Jan Mendling]]・[[Henrik Leopold]]・[[Henning Meyerhenke]]・[[Benoît Depaire]]が、計算機科学の下位分野(VLDB・NeurIPS・ESA・VIS等)ごとに異なるアルゴリズム研究の評価基準を統合すべく、科学哲学の存在論・認識論・方法論を土台にした統一枠組みを構築。Real-World Problem→Algorithmic Task→Algorithm Design→Algorithm Implementationの存在論的連鎖(Staples 2014に基づく)、Popperの三世界論による知識の位置づけ、9つの妥当性概念(生態学的・設計・実装・外的・正当化・論理的・内的・構成概念・結論妥当性)とその対応実体を体系的に整理した。既存 concept [[工学科学]]・[[デザインサイエンス研究]]とは、いずれも「工学知識・IT成果物の構築と評価」という共通の関心を持つ姉妹的枠組みとして関連リンクを追加した。
- 備考: 図表7点(Figure 1-3はすべてベクター描画のフレームワーク図のためPyMuPDFキャプション座標クロップで取得・全件埋め込み。Table 1-4はMarkdown表に転記)。pdf.js抽出の埋め込みラスター画像はゼロ件(全38ページがpage-renderのみ)。全38ページを通読。作業中、既存entity [[Hasso Plattner Institute]] を新規ページとして誤って上書きしかけたが、Write結果のgit statusが"M"(既存追跡ファイル)であることに気づき、`git show HEAD:...`で元内容を復元したうえで正しく統合した。
## [2026-08-16] ingest-paper | Cutting Corners: Workbench Automation for Server Benchmarking
- Source: `.raw/papers/Cutting-Corners--Workbench-Automation-for-Server-Benchmarking.pdf`(ユーザー提供のローカル PDF、初出 *USENIX 2008 USENIX Annual Technical Conference*, pp. 241-253)
- Summary: [[@2008__USENIX-ATC__Cutting Corners - Workbench Automation for Server Benchmarking]]
- Pages created: source 1 件 / entity 5 件([[Piyush Shivam]]・[[Shivnath Babu]]・[[Varun Marupadi]]・[[Thileepan Subramaniam]]・[[Fstress]])/ concept 1 件([[ワークベンチ自動化]])
- Pages updated: entity 3 件([[Jeffrey S. Chase]]・[[Duke University]]・[[Sun Microsystems]])/ concept 1 件([[ベンチマーキング]])
- Key insight: サーバベンチマーキング(NFS ファイルサーバのピークレート評定)を、目標精度・信頼度に応じて試行数とランレングスを動的配分するフィードバック駆動コントローラで自動化する 2008 年の枠組み。既存 concept [[ベンチマーキング]](2023年『詳解 システム・パフォーマンス』のチェックリストが中心)に対し、「意味のあるテストか」という定性的チェック項目を、負荷率上昇に伴うレスポンスタイムのばらつき増大という実測に基づくコスト最適化アルゴリズムとして先取りしていた点を横断的知見に追記した。新規 concept [[ワークベンチ自動化]] は、レスポンスサーフェスマッピング(外側ループ)とピークレート探索(内側ループ)の二階層定式化、Binsearch/Model-guided load-picking、シーディングヒューリスティックを蓄積する土台とした。
- 備考: 図表14点(Table 1-4をMarkdown表に転記、Figure 1-10は全てベクター描画のためPyMuPDFキャプション座標クロップで取得・全件埋め込み)。pdf.js抽出の埋め込みラスター画像14点はFigure 2周辺の断片(256x256等の小片)で図表としては使用不可のため除外。全14ページを通読。USENIX legacy proceedings のPDF直リンクはブラウザUAでのcurlで200を確認(WebFetchは403)。
## [2026-08-16] ingest-paper | End-To-End Arguments in System Design
- Source: `.raw/papers/END-TO-END-ARGUMENTS-IN-SYSTEM-DESIGN.pdf`(ユーザー提供のローカル PDF、初出 *ACM Transactions on Computer Systems*, Vol. 2, No. 4, November 1984, pp. 277-288。前身版は1981年パリの2nd International Conference on Distributed Systems)
- Summary: [[@1984__TOCS__End-To-End Arguments in System Design]]
- Pages created: source 1 件([[@1984__TOCS__End-To-End Arguments in System Design]])/ entity 3 件([[Jerome H. Saltzer]]・[[David P. Reed]]・[[David D. Clark]])
- Pages updated: entity 1 件([[MIT]])/ concept 1 件([[エンドツーエンド論]])
- Key insight: [[Jerome H. Saltzer]]・[[David P. Reed]]・[[David D. Clark]] が分散コンピュータシステムのモジュール間の機能配置を導く設計原則「エンドツーエンド論」を定式化した決定版古典論文。ケアフルファイル転送のケーススタディから、配送確認・暗号化・重複メッセージ抑制・FIFO配送保証・トランザクション管理(著者自身のSWALLOWシステムでのメッセージ半減という実証込み)まで適用範囲を広げ、音声パケット通信の事例で原則が絶対的規則ではなくガイドラインであることを示す。本 wiki には既に DDIA第13章・Lampson (1983) Hints論文経由でこの原則が二次的に参照されていたが、一次資料そのものを取り込んだことで、原論文自身が「エンドツーエンド論はどこに早期チェックを置くべきか教えてくれない」と明示的に認めている限界を [[エンドツーエンド論]] concept の既存の未解決の問いへの回答として追記し、また決定版1984年論文がLampson (1983) を引用しておらず両者が独立に1981年パリ版へ遡ることを横断的知見に追記した。
- 備考: 図表なし(本文に Figure/Table 参照が一切無い純粋な論証論文)。pdf.js抽出画像は全12点が page-render のみでJBig2デコード失敗のため保持せず削除。全12ページ(本文6ページ+参考文献等)を通読。ACM Digital Library の公式ページは検証時に403、著者 J. H. Saltzer 本人が MIT で公開する別組版PDFで書誌情報を裏取りした。
## [2026-08-16] ingest-paper | Of Apples and Oranges: Fair Comparisons in Heterogenous Systems Evaluation
- Source: `.raw/papers/2026_Unknown_Of_Apples_Oranges.pdf`(ユーザー提供のローカル PDF、初出 *The 22nd ACM Workshop on Hot Topics in Networks (HotNets '23)*, Nov. 28-29, 2023, Cambridge, MA, USA, 8 pages, DOI: 10.1145/3626111.3628186)
- Summary: [[@2023__HotNets__Of Apples and Oranges - Fair Comparisons in Heterogenous Systems Evaluation]]
- Pages created: source 1 件([[@2023__HotNets__Of Apples and Oranges - Fair Comparisons in Heterogenous Systems Evaluation]])/ entity 2 件([[Hugo Sadok]]・[[Justine Sherry]])/ concept 1 件([[コストを考慮したシステム評価]])
- Pages updated: entity 3 件([[Aurojit Panda]]・[[Carnegie Mellon University]]・[[New York University]])/ concept 1 件([[システム論文の評価基準]])
- Key insight: 本論文はアクセラレータ(GPU・SmartNIC・FPGA)を使うヘテロジニアスハードウェアシステムの評価には性能だけでなくコストの報告が必要だと主張し、良いコスト指標が満たすべき3条件(文脈独立性・定量化可能性・end-to-end網羅性)と、Pareto支配・比較領域(comparison region)・理想的スケーリング(ideal scalability)に基づく7つの評価原則を提示する。既存 concept [[システム論文の評価基準]](論文の「書き方・提示」を扱う)に対し、新規 concept [[コストを考慮したシステム評価]] は評価「対象」の測定方法(コスト指標の選び方)を扱う姉妹関係にあり、相互参照リンクを追加した。
- 備考: 図表4点(Table 1をMarkdown表に転記、Figure 1-3はすべてベクター描画のためPyMuPDFキャプション座標クロップで取得・全件埋め込み)。pdf.js抽出の埋め込みラスター画像は1ページ目のCC-BY-SAライセンスバッジ1点のみで図表としては不使用(除外)。全8ページを通読。ポジションペーパーのため独自実験・データセットは持たない。
## [2026-08-16] ingest-book | Cybernetics: or Control and Communication in the Animal and the Machine, 2nd ed.
- Source: `.raw/books/cybernetics-2e/`(12 章 / 入力: pdf。Internet Archive のスキャン PDF 231 ページ、OCR テキスト層あり)
- Book entity: [[Cybernetics]]
- Chapters: [[@1961__MITPress__Cybernetics - Preface to the Second Edition]]・[[@1961__MITPress__Cybernetics - Introduction]]・[[@1961__MITPress__Cybernetics - Chapter 1 Newtonian and Bergsonian Time]]〜[[@1961__MITPress__Cybernetics - Chapter 10 Brain Waves and Self-Organizing Systems]](12 件、すべて `publish: false`)
- Pages created: source 12 件 / entity 8 件([[Cybernetics]]・[[アルトゥーロ・ローゼンブルース]]・[[Willard Gibbs]]・[[Henri Lebesgue]]・[[John von Neumann]]・[[Oskar Morgenstern]]・[[Dennis Gabor]]・[[Amar Bose]])/ concept 13 件([[科学の境界領域]]・[[可逆性と不可逆性]]・[[エルゴード理論]]・[[ウィーナーフィルタ]]・[[ホメオスタシス]]・[[計算機と神経系のアナロジー]]・[[群走査による不変量抽出]]・[[記憶の疾患としての精神障害]]・[[社会のホメオスタシス]]・[[個体発生的学習と系統発生的学習]]・[[自己複製機械]]・[[自己組織化]]・[[ブラックボックスとホワイトボックス]])
- Pages updated: entity 2 件([[ノーバート・ウィーナー]]・[[Vannevar Bush]])/ concept 12 件([[サイバネティクス]]・[[フィードバックループ]]・[[ブロック線図]]・[[制御ループの安定性とタイムラグ補償]]・[[適応制御]]・[[アロスタシス]]・[[システム同定]]・[[メタ安定障害]]・[[複雑システム障害論]]・[[情報処理システムとしての人間]]・[[不変性と同変性]]・[[光学文字認識]])
- Key insight: 本 wiki の [[サイバネティクス]] concept はこれまで後世からの参照([[Herbert A. Simon]]・[[稲見昌彦]]・SRE 実践)だけで積み上がっており、原典自身の記述が 1 件も入っていなかった。原典を入れて最も大きく変わったのは、**著者自身が適用限界に二度、性格の違う留保を置いている**という事実である。第7章は精神病理学的な実体を計算機の欠陥型に対応づける主張を冒頭で明示的に退け(事前の留保)、第8章は社会科学が観測者と現象の結合を精密科学のようには小さくできないと述べる(方法論的限界の自認)。後世が「万能の枠組み」として参照するときに落ちる部分にあたる。第二に、第7章の「残存する神経系への過負荷と再経路化が二次的な障害を生む」「電話交換網は過負荷の縁で効率的に働き臨界点で破局的に停止する」という 1948 年の議論が、[[メタ安定障害]] と [[複雑システム障害論]](Cook 命題5「常に劣化モードで動作している」・命題18「システムは常に包絡線の縁で運用される」)の生物学的先行例として接続できた。第三に、第4章の `A/(1+λA)` が [[計算機システムのフィードバック制御]] の `F_FF/(1+F_LP)` と同じ代数形であり、Fig. 2/4/5/6 の control flow chart が現代のブロック線図の図的祖先にあたることが確認できた([[ブロック線図]])。
- 備考: PDF アウトラインが 0 件だったため、目次ページの印字ノンブルと本文ランニングヘッダからオフセット(印字ページ = PDF ページ − 19)を復元し、`fetch-book.sh --chapters` で手動分割した。スキャン PDF では `get_image_rects()` がページ全面の矩形を返して使えないため、キャプション座標クロップで図 11 点(Fig. 1〜11)を全点切り出し、全点を Read で目視確認したうえで配布した(第4章6点・第5章1点・第6章1点・第10章3点)。OCR 由来で数式が激しく崩れているため、各担当には「意味が本文から一義的に確定できる式だけを書き、崩れた式を推測で復元しない」方針を課した。章ごとに Sonnet 5 subagent へ委譲し、ハブ concept [[サイバネティクス]](Introduction → 第8章 → 第7章)と [[フィードバックループ]](第4章 → 第5章)を奪い合う章は投入順で直列化したうえで、常時 3〜4 体のローリング fan-out で処理した。オーケストレータが個別プロンプトに書いた示唆のうち 3 件(第2章の Birkhoff/Koopman/von Neumann の不在、第9章のフランス革命の戦術の主語、第6章の von Bonin 記述の行番号)が誤りで、いずれも担当 subagent が原本照合で捕まえて訂正した。本バッチと並行して別セッションが同じ vault で論文を ingest していたため、差分は本文の書名言及で機械的に分類し、漏れた側を 1 件ずつ確認した。
## [2026-08-16] ingest-paper | Hints for Computer System Design
- Source: `.raw/papers/2026_Unknown_Hints_computer_system_design.pdf`(ユーザー提供のローカル PDF、初出 *Proceedings of the Ninth ACM Symposium on Operating Systems Principles* = ACM SIGOPS Operating Systems Review 17, 5, Oct. 1983, pp. 33-48)
- Summary: [[@1983__SOSP__Hints for Computer System Design]]
- Pages created: source 1 件([[@1983__SOSP__Hints for Computer System Design]])/ entity 1 件([[Butler W. Lampson]])/ concept 1 件([[ヒントによる高速化]])
- Pages updated: concept 1 件([[エンドツーエンド論]])
- Key insight: [[Butler W. Lampson]](Xerox PARC)が、Alto・Bravo・Star・Dorado・Grapevine 等の設計・実装経験から抽出した計算機システム設計のヒントを、機能性・速度・フォールトトレランスの3軸×完全性・インタフェース・実装の3軸(Figure 1)に整理した古典的エッセイ。「ヒント(hint)はキャッシュエントリに似るが、間違っている可能性があり連想検索とは限らない」という独自の定式化を新規 concept [[ヒントによる高速化]] として切り出した。また本論文がエンドツーエンドのエラー回復を Saltzer の1981年会議発表版(通説の1984年 ACM TOCS 論文より1年早い)から引用していたことを [[エンドツーエンド論]] concept の横断的知見に追記した。
- 備考: 原本 PDF はスキャン文書で JBig2 圧縮の埋め込み画像がすべてデコード失敗(pdf.js)。本文の図表参照は「Figure 1: Summary of the slogans」1点のみ(他に図・表の参照なし)。PyMuPDF(`fitz`)でページ2をキャプション座標クロップして取得・埋め込んだ。全16ページを通読。
## [2026-08-16] ingest | LISA made LISA obsolete (That's a compliment!)
- Source: `.raw/articles/lisa-made-lisa-obsolete-thats-compliment-2026-08-16.md`(;login: online、USENIX、2022-10-27)
- Summary: [[@2022__USENIX__LISA made LISA obsolete (That's a compliment!)]]
- Pages created: source 1 件([[@2022__USENIX__LISA made LISA obsolete (That's a compliment!)]])/ entity 6 件([[LISA]]・[[USENIX]]・[[SAGE]]・[[Evi Nemeth]]・[[Christine Hogan]]・[[The Practice of System and Network Administration]])
- Pages updated: entity 1 件([[Thomas A. Limoncelli]])/ concept 2 件([[DevOps]]・[[システム管理者からSREへの視点転換]])
- Key insight: 著者 Thomas A. Limoncelli(元 Google SRE、LISA 2011 共同議長)は、USENIX が LISA(Large Installation System Administration)カンファレンスを35年の歴史を経て終了させたことを、LISA が掲げた急進的アイデア(システム管理の重要性・能動的な計算機管理・自動化・人間的プロセス・オープンシステム)が業界の常識になったことの証と位置づけ、後継の SREcon へバトンが渡ったと総括する。LISA 併設の configuration management workshop が cfEngine・BCFG2・Puppet を生み Chef・Ansible を経て今日の Infrastructure as Code/GitOps の源流になったという、DevOps 運動由来(Velocity 2009、mizzy 2026)とは独立した IaC の別系譜を [[DevOps]] concept に追加した。また単一ソースだった [[システム管理者からSREへの視点転換]] concept を、個人レベルの観点転換(Legeza)と業界レベルの制度的世代交代(Limoncelli)を突き合わせる2ソース構成へ昇格させた。
- 備考: USENIX 掲載ページへの WebFetch が 403 Forbidden を返したため、ブラウザ UA を付けた `curl` + `defuddle` で本文抽出(記憶: WebFetch 403 UA fallback パターンを再適用)。図表なし(散文エッセイ)のため画像取り込みはスキップ。
## [2026-08-16] ingest-paper | The Many Faces of Systems Research - And How to Evaluate Them
- Source: `.raw/papers/hotos2005-many-faces-of-systems-research.pdf`(USENIX legacy archive、初出 *Proceedings of the 10th Workshop on Hot Topics in Operating Systems (HotOS-X)*, Santa Fe, NM, June 2005)
- Summary: [[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]]
- Pages created: source 1 件([[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]])/ entity 6 件([[Aaron B. Brown]]・[[Anupam Chanda]]・[[Rik Farrow]]・[[Petros Maniatis]]・[[Michael L. Scott]]・[[Intel Research]])
- Pages updated: entity 5 件([[Alexandra Fedorova]]・[[Harvard University]]・[[Rice University]]・[[IBM Research]]・[[University of Rochester]])/ concept 1 件([[システム論文の評価基準]])
- Key insight: [[Aaron B. Brown]]([[IBM Research]])・[[Anupam Chanda]]([[Rice University]])・[[Rik Farrow]]・[[Alexandra Fedorova]]([[Harvard University]])・[[Petros Maniatis]]([[Intel Research]])・[[Michael L. Scott]]([[University of Rochester]])が、システム研究論文を科学(仮説の厳密さ・再現性)・工学(実用性・汎用性)・芸術(優雅さ・単純さ・美しさ)の3次元で評価すべきと論じた。第9回SOSPプログラム委員会の評価基準(1983年、[[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]])を最も近い先行研究として参照しており、[[システム論文の評価基準]] concept を2ソース目へ昇格させ、7基準(執筆・提示の基準)と3次元(論文の性質分類)が階層的に補完し合う関係を横断的知見に追記した。
- 備考: PDF取得時、著者名の似た別論文(USENIX legacy archive の `brown.pdf`、Aaron B. Brown & Joseph L. Hellerstein "Reducing the Cost of IT Operations")を誤って取得・ダウンロードし、テキスト内容の確認で誤りに気づいて破棄した。HotOS X final program ページ(`/legacy/events/hotos05/prog_public.html`)経由で `final_papers/red_team.html` を辿り、そのページソースから正しい PDF パス(`full_papers/red_team/red.pdf`)を特定して再取得した。図表なし(本文に Figure/Table への参照が一切ない散文の位置づけ論文)。
## [2026-08-16] ingest | An Evaluation of the Ninth SOSP Submissions -or- How (and How Not) to Write a Good Systems Paper
- Source: `.raw/articles/how-and-how-not-to-write-a-good-systems-paper-2026-08-16.md`(USENIX Author Resources、初出 *ACM SIGOPS Operating Systems Review*, Vol. 17, No. 3, 1983, pp. 35-40)
- Summary: [[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]]
- Pages created: source 1 件([[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]])/ entity 3 件([[Roy Levin]]・[[David D. Redell]]・[[SOSP]])/ concept 1 件([[システム論文の評価基準]])
- Pages updated: concept 1 件([[学術論文の読解技術]])
- Key insight: 第9回SOSP(1983)プログラム委員会共同議長の Levin と Redell が、83件の投稿論文から16件のみを採択した査読経験に基づき、独創性・現実性・教訓・選択・文脈・焦点・提示・文章スタイルの7基準を明文化した。「アブストラクトは本文執筆前に書き、内容の目次ではなく仮定と結果を簡潔に述べる」「システムが未実装であることを冒頭で明示する」「検討した代替案とその選択理由を説明し、事後的な合理化(修正主義的な歴史)を避ける」など、具体例(BagOfBitsシステムの比較例、気象予測システムのタオル/テープドライブの例、コロンブスの卵)を交えた実践的な指南が特徴。新規 concept [[システム論文の評価基準]] は既存の [[学術論文の読解技術]](読む側の技術)と相補的な関係にある。
- 備考: USENIX 掲載ページへの WebFetch が 403 Forbidden を返したため、ブラウザ UA を付けた `curl` で HTML を取得し `defuddle` で本文抽出(記憶: WebFetch 403 UA fallback パターンを再適用)。図表なし(散文エッセイ)。SOSP を表す会議 entity は本 ingest まで本 wiki に存在せず、新規作成した。
## [2026-08-16] ingest-paper | Design Science in Information Systems Research
- Source: `.raw/papers/Design-Science-in-Information-Systems-Research.pdf`(ユーザー提供のローカル PDF、*MIS Quarterly*, Vol. 28, No. 1, pp. 75-105, March 2004)
- Summary: [[@2004__MIS Quarterly__Design Science in Information Systems Research]]
- Pages created: source 1 件([[@2004__MIS Quarterly__Design Science in Information Systems Research]])/ entity 7 件([[Alan R. Hevner]]・[[Sudha Ram]]・[[Jinsoo Park]]・[[University of South Florida]]・[[University of Arizona]]・[[Vanderbilt University]]・[[Korea University]])
- Pages updated: entity 1 件([[Salvatore T. March]])/ concept 1 件([[デザインサイエンス研究]])
- Key insight: [[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]](March and Smith 1995)の4×4フレームワーク(研究出力 × 研究活動)が、Hevner, March, Park, and Ram (2004) によって「デザインサイエンス研究の7つのガイドライン」という運用可能な形式へ発展させられた系譜を、共著者 [[Salvatore T. March]] を接点として接続できた。とりわけ 1995年論文が「よく理解されていない」と自認していた build 活動を、2004年論文は Simon の Generate/Test Cycle(means・ends・laws)として具体化しており、[[デザインサイエンス研究]] concept の未解決の問いの1つに直接回答する形になった。図表3点(組織設計とIS設計の戦略アラインメントモデル、IS研究フレームワーク、Generate/Test Cycle)はいずれもベクター描画のため PyMuPDF キャプション座標クロップで取得。
## [2026-08-16] ingest | Episteme and Techne
- Source: `.raw/articles/episteme-techne-2026-08-16.md`(URL: https://plato.stanford.edu/entries/episteme-techne/、著者 Richard Parry、初出 2003-04-11、実質改訂 2024-12-19)
- Summary: [[@2003__SEP__Episteme and Techne]]
- Pages created: source 1 件([[@2003__SEP__Episteme and Techne]])/ entity 5 件([[Richard Parry]]・[[Xenophon]]・[[Plato]]・[[Plotinus]]・[[Alexander of Aphrodisias]])/ concept 3 件([[エピステーメー]]・[[テクネー]]・[[エンペイリア(経験知)]])
- Pages updated: entity 2 件([[Aristotle]]・[[Nicomachean Ethics]])/ concept 1 件([[フロネシス(実践知)]])
- Key insight: 本日先に ingest した一次資料 [[@1906__StandardEbooks__Nicomachean Ethics - Book VI Intellectual Virtues]] の直後に、その二次文献を取り込む形になった。SEP はアリストテレス『ニコマコス倫理学』第6巻が与える episteme/technê の厳密な区別が、『形而上学』『自然学』を通じては一貫しないことを示し、一次資料の精読だけでは見えなかった知見を補った。クセノポン(無区別)→プラトン(functionによる技術の定義・理論への傾斜)→アリストテレス(明確な分離とその内部崩壊)→ストア派(徳としての技術/知識の統合)→アレクサンドロス(蓋然的技術)→プロティノス(技術の格下げ)という6段階の通時的変遷を1本の記事から取り込んだ。
## [2026-08-16] ingest-paper | Technology as 'Applied Science': A Serious Misconception that Reinforces Distorted and Impoverished Views of Science
- Source: `.raw/papers/Technology-as-Applied-Science.pdf`(ユーザー提供のローカル PDF、*Science & Education*, Vol. 14, 2005, pp. 309-320, Springer)
- Summary: [[@2005__Science & Education__Technology as 'Applied Science' - A Serious Misconception that Reinforces Distorted and Impoverished Views of Science]]
- Pages created: source 1 件([[@2005__Science & Education__Technology as 'Applied Science' - A Serious Misconception that Reinforces Distorted and Impoverished Views of Science]])/ entity 3 件([[Daniel Gil-Pérez]]・[[Isabel Fernández]]・[[Universitat de València]])/ concept 1 件([[科学の歪んだ描像]])
- Pages updated: concept 1 件([[工学科学]])
- Key insight: [[Daniel Gil-Pérez]]ほか(2005)は、技術を「応用科学」とみなす通念が科学教育における技術軽視を正当化し、科学の性質(NOS)に関する7つの相互補強的な歪んだ描像を強化すると論じる。「技術は応用科学ではない」という結論に、[[Walter Vincenti]](1990、航空工学史の事例研究)・[[Hans Poser]](1998、規則の認識論)とは独立に、科学教育の実証研究という第3の経路から到達しており、[[工学科学]] の横断的知見に3件目の収斂事例として記録した。
## [2026-08-16] ingest-book | Nicomachean Ethics - Book VI: Intellectual Virtues
- Source: `.raw/books/nicomachean-ethics-peters/chapters/book-06.md`(1 巻 / 入力: web。Standard Ebooks 配信ページ、底本 F. H. Peters 英訳 London: Kegan Paul, Trench, Trübner & Co., 1906、Internet Archive スキャン `nicomachean00aris`)
- Book entity: [[Nicomachean Ethics]](`status: seed`。全10巻中第6巻のみの断片取り込み)
- Chapters: [[@1906__StandardEbooks__Nicomachean Ethics - Book VI Intellectual Virtues]](1 件)
- Pages created: source 1 件 / entity 2 件([[Nicomachean Ethics]] / [[Aristotle]])/ concept 1 件([[フロネシス(実践知)]])
- Pages updated: なし
- Key insight: 第6巻は知性的徳(技術・学問・思慮・知恵・直知)を定義し、思慮(フロネシス)と知恵(ソフィア)を対比したうえで、器用さ(デイノテース、目的の善悪を問わず手段を実行する能力)との対比を経て、思慮と倫理的徳が相互に依存すると結論する。ソクラテスの主知主義(徳=知識)を「徳は思慮なしにありえないとした点で正しいが、徳を思慮の一形態そのものとした点で誤り」と評価する箇所(§XIII)が本巻の核心。
- 備考: URL は書籍全体10巻中の1巻のみを指すため、断片入力として扱った(章分割はしていない)。図表なし(散文テキストのみ)。原文の脚注番号(`[139]` 等、endnotes へのリンク)は原本の巻末注釈参照であり本文には反映していない。
## [2026-08-16] ingest-book | What Engineers Know and How They Know It
- Source: `.raw/books/what-engineers-know-and-how-they-know-it/`(8 章 / 入力: pdf。Internet Archive による 2022 年スキャン、OCR テキスト層つき 344 ページ)
- Book entity: [[What Engineers Know and How They Know It]]
- Chapters: [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 1 Introduction - Engineering As Knowledge]]〜[[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 8 A Variation-Selection Model for the Growth of Engineering Knowledge]](8 件)
- Pages created: source 8 件 / entity 22 件([[Ascher Shapiro]] / [[Consolidated Aircraft Corporation]] / [[Curtiss-Wright Corporation]] / [[Daniel Bernoulli]] / [[David R. Davis]] / [[Donald T. Campbell]] / [[Douglas Aircraft Company]] / [[Eastman N. Jacobs]] / [[Edward Constant]] / [[Edward P. Warner]] / [[Edwin Layton]] / [[Everett Parker Lesley]] / [[G. F. C. Rogers]] / [[John Staudenmaier]] / [[Ludwig Prandtl]] / [[NACA]] / [[Reuben H. Fleet]] / [[Robert R. Gilruth]] / [[Theodore von Kármán]] / [[Vladimir Pavlecka]] / [[What Engineers Know and How They Know It]] / [[William Frederick Durand]])/ concept 13 件([[パラメータ変化法]] / [[制御体積解析]] / [[動作原理]] / [[変異選択モデル]] / [[工学科学]] / [[工学設計知識]] / [[暗黙知]] / [[生産のための知識]] / [[翼型設計]] / [[記述的知識と規範的知識]] / [[設計要件の確立]] / [[通常設計と急進的設計]] / [[飛行品質仕様]])
- Pages updated: entity 5 件([[Herbert A. Simon]] / [[Michael Polanyi]] / [[SWEBOK Straw Man Version]] / [[Stanford University]] / [[Walter Vincenti]])
- Figures: 38 点(図 35 + 表 2 + 全ページ図の縦向きスキャン分を含む)を全章に埋め込み。スキャン PDF のため `get_image_rects()` が使えず、キャプション座標クロップで切り出した。OCR がキャプション行ごと落としていた 5 点(図2-4/2-7/3-2/3-7/5-3)は本文の図参照から所在を特定して回収した。
- Key insight: 本 vault はこの著者を **二次的な引用元から先に知っていた**。[[SWEBOK Straw Man Version]](1998)がソフトウェア工学の知識領域を構造化する枠組みとして採用を提案した「6 カテゴリ」の出典が、まさに本書第 7 章である(SWEBOK は原著 p.200 と p.236 を引く)。今回その原典が入り、転用先と原典を突き合わせられるようになった。さらに同日に別セッションが ingest した [[@1998__PhilTech__On Structural Differences between Science and Engineering]](Poser 1998)は、Vincenti と互いを引用せず独立に「工学は応用科学にすぎない」というテーゼを退けている。Vincenti が本書で用いる道具立ては**航空工学史の 5 事例から帰納した知識の分類体系**(6 カテゴリ × 7 生成活動、表 7-1)であり、Poser の**規則は真理値を持たず効力で正当化される**という認識論的論法とは対照的だが、結論は一致する。加えて本書は第 8 章で、その知識体系が**どう成長するか**(盲目的変異と選択的保持、代理選択子)まで踏み込む点で、構造の記述にとどまる他の論と異なる。
## [2026-08-16] ingest-paper | On Structural Differences between Science and Engineering
- Source: `.raw/papers/poser-1998-structural-differences-science-engineering.pdf`(Virginia Tech Scholarly Communication 公開アーカイブ原本、*Society for Philosophy and Technology Quarterly Electronic Journal*, Vol. 4, No. 2, Winter 1998, pp. 81-93)
- Summary: [[@1998__PhilTech__On Structural Differences between Science and Engineering]]
- Pages created: source 1 件([[@1998__PhilTech__On Structural Differences between Science and Engineering]])/ entity 2 件([[Hans Poser]]・[[Technical University, Berlin]])/ concept 1 件([[技術的規則]])
- Pages updated: concept 1 件([[人工物の科学]])
- Key insight: Poser(1998)と Walter Vincenti(同年、[[@1998__IEEECS__SWEBOK Straw Man - Chapter 3 Context and Relationships]] が引く議論)は互いを引用せず独立に「工学は応用科学にすぎない」という Bunge 的テーゼを退けている。Vincenti は工学設計知識の分類体系という記述的な道具立てで、Poser は規則(rules)が法則(laws)と異なり真理値を持たず効力によってのみ正当化されるという認識論的な道具立てで反論しており、1998年という同じ年に独立に到達した収斂点として本 wiki に初めて記録した。
## [2026-08-16] ingest-paper | Design and natural science research on information technology
- Source: `.raw/papers/Design-and-natural-science-research-on-information-technology.pdf`(ユーザー提供のローカル PDF、*Decision Support Systems*, Vol. 15, 1995, pp. 251-266)
- Summary: [[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]]
- Pages created: source 1 件([[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]])/ entity 2 件([[Salvatore T. March]]・[[Gerald F. Smith]])/ concept 1 件([[デザインサイエンス研究]])
- Pages updated: entity 1 件([[University of Minnesota]])
- Key insight: March & Smith (1995) は Simon の design science / natural science の区別を IT 研究に適用し、研究出力(constructs・models・methods・instantiations)×研究活動(build・evaluate・theorize・justify)の 4×4 フレームワークを提示した。同日に別セッションで ingest された Simon 本人の *The Sciences of the Artificial*(→ [[人工物の科学]])と突き合わせると、Simon の一般的な設計科学の哲学が、本論文によって IT 研究向けの具体的な運用可能なフレームワークへ翻訳されている系譜が確認できる。PDF はスキャン起源で埋め込みラスター画像は JBig2 デコード失敗により 0 件だったが、本文が参照する唯一の図(Fig. 1、4×4 研究フレームワーク表)は PyMuPDF のキャプション座標クロップで取得した。
## [2026-08-16] ingest-paper | Risk management in a dynamic society: A modelling problem
- Source: `.raw/papers/rasmussen1997-risk-management-dynamic-society.pdf`(DTU Orbit 公開版、*Safety Science*, Vol. 27, No. 2-3, 1997, pp. 183-213)
- Summary: [[@1997__Safety Science__Risk management in a dynamic society - A modelling problem]]
- Pages created: source 1 件([[@1997__Safety Science__Risk management in a dynamic society - A modelling problem]])/ concept 1 件([[AcciMap]])
- Pages updated: entity 1 件([[Jens Rasmussen]])/ concept 1 件([[事故モデル]])
- Key insight: SREcon 系トークが長年二次引用してきた「Rasmussen の Safety Model」(3境界モデル)の一次資料を初めて確認した。境界名称(Performance/Economic/Workload)は二次資料と一致するが、原論文はこれを Zeebrügge 事故の因果分析の直後に「なぜ複数の独立した意思決定が事故へ収斂するか」を説明する力学として提示しており、二次資料が伝えてこなかった文脈がある。また Ivan Svedung との共同研究に基づく多階層事故分析手法「AcciMap」は3境界モデルとは別個の貢献であり、本 wiki に初めて記録された。
## [2026-08-16] ingest | The End of Programming as We Know It
- Source: `.raw/articles/the-end-of-programming-as-we-know-it-2026-08-16.md`(oreilly.com/radar、HTML、curl+defuddle 抽出)
- Summary: [[@2025__OReilly__The End of Programming as We Know It]]
- Pages created: source 1 件([[@2025__OReilly__The End of Programming as We Know It]])/ entity 12 件([[Tim O'Reilly]]・[[O'Reilly Media]]・[[Steve Yegge]]・[[James Bessen]]・[[Ethan Mollick]]・[[Sam Schillace]]・[[Bret Taylor]]・[[Sierra]]・[[Chip Huyen]]・[[Simon Willison]]・[[Shyam Sankar]]・[[Palantir]])/ concept 2 件([[70%問題]]・[[エージェントエンジニア]])
- Pages updated: entity 3 件([[Addy Osmani]]・[[Microsoft]]・[[Devin]])
- Key insight: 「プログラミングの終わり」は機械語→アセンブリ→高級言語→Web→クラウドと反復されてきた主張であり、いずれの波もプログラマ数を実際には増やしてきた。経済史家 [[James Bessen]] の産業革命研究(learning by doing)を根拠に、AIによる生産性向上も知識の社会的波及に時間を要し、その後プログラム可能な「表面積」拡大により需要はむしろ増すと論じる。
## [2026-08-16] ingest-paper | Visions of Artificial Intelligence and Robots in Science Fiction: a computational analysis
- Source: `.raw/papers/pmc-PMC9289651.pdf`(Springer 記事ページ https://link.springer.com/article/10.1007/s12369-022-00876-z は認証リダイレクトで取得不可だったため、PubMed/PMC 経由〈PMID 35874175 → PMCID PMC9289651〉で Europe PMC の Open Access PDF を取得。*International Journal of Social Robotics*, Vol. 14, 2022、CC BY 4.0、11 ページ)
- Summary: [[@2022__IJSR__Visions of Artificial Intelligence and Robots in Science Fiction - a computational analysis]]
- Pages created: source 1 件([[@2022__IJSR__Visions of Artificial Intelligence and Robots in Science Fiction - a computational analysis]])/ entity 7 件([[Hirotaka Osawa]]・[[Dohjin Miyamoto]]・[[Satoshi Hase]]・[[Reina Saijo]]・[[Kentaro Fukuchi]]・[[Yoichiro Miyake]]・[[University of Tsukuba]])/ concept 1 件([[SFにおけるAI表象]])
- Pages updated: なし(新規領域〈SF・HRI〉のため既存ページとの重複なし)
- Key insight: SF に描かれた 115 件の AI・ロボットを 9〜11 の量的因子で計算的に分析すると、知能・人間性の 2 軸上に Human・Machine・Buddy・Infrastructure という 4 類型が現れ、身体性(embodiment)の付与が「人間形状なら知能増加、一般的身体性なら知能低下」という二面的な効果を持つことが定量的に示された。これは HRI/HCI の adaptation gap 原則と符合する。
## [2026-08-16] ingest | Why Software Is Eating the World
- Source: `.raw/articles/why-software-is-eating-the-world-2026-08-16.md`(a16z.com、HTML、defuddle 抽出)
- Summary: [[@2011__a16z__Why Software Is Eating the World]]
- Pages created: source 1 件([[@2011__a16z__Why Software Is Eating the World]])/ entity 4 件([[Marc Andreessen]]・[[Ben Horowitz]]・[[Netscape]]・[[Loudcloud]])/ concept 1 件([[Software Eating the World]])
- Pages updated: entity 3 件([[Andreessen Horowitz]]・[[Amazon]]・[[Netflix]])
- Key insight: 「Software is eating the world」テーゼの初出エッセイ。[[@2018__Google SRE Workbook__Foreword II]] の「Reliability is eating the world」との言い回しの反復関係を弱い横断的知見として記録した。
- 備考: ユーザーが `/wiki-ingest-paper` で URL を指定したが、対象が PDF を持たない VC ブログ記事だったため、ユーザー確認のうえ汎用 `wiki-ingest` に切り替えて取り込んだ。
## [2026-08-16] ingest-book | Feedback Control of Computing Systems
- Source: `.raw/books/feedback-control-of-computing-systems/`(本編 11 章 / 入力: ローカル PDF 451 ページ)
- Book entity: [[Feedback Control of Computing Systems]]
- Chapters: [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 1 Introduction and Overview]]〜[[@2004__Wiley__Feedback Control of Computing Systems - Chapter 11 Advanced Topics]](11 件、すべて `publish: false`)
- Pages created: entity 8 件([[Feedback Control of Computing Systems]]・[[Joseph L. Hellerstein]]・[[Yixin Diao]]・[[Sujay Parekh]]・[[Dawn M. Tilbury]]・[[Apache HTTP Server]]・[[IBM Lotus Domino Server]]・[[MATLAB]])/ concept 10 件([[計算機システムのフィードバック制御]]・[[SASO特性]]・[[システム同定]]・[[Z変換と伝達関数]]・[[ブロック線図]]・[[過渡応答解析]]・[[支配極と高次系の近似]]・[[極配置設計]]・[[PID制御]]・[[適応制御]])
- Pages updated: entity 3 件([[IBM T.J. Watson Research Center]]・[[University of Michigan]]・[[Wiley]])/ concept 4 件([[フィードバックループ]]・[[制御ループの安定性とタイムラグ補償]]・[[待ち行列理論]]・[[状態空間モデル]])
- Figures: 原本から 235 点をクロップ(図番号 1.1〜11.18 に欠番・重複ゼロ)、うち 82 点を厳選して埋め込み。埋め込み 82 / 欠落 0 / 未使用 attachment 0 を機械検証。
- Key insight: 制御性能の各側面は別の側面を犠牲にしてしか手に入らない、という構図が本書の背骨をなす。比例制御は定常偏差を構造的に消せず(8 章)、積分項はそれを解消する代わりに応答を必ず遅くし(9 章)、微分項は確率的変動に敏感で計算機システムでは避けられ、状態空間は MIMO を扱える代わりに内部状態の可観測性を要求する(10 章)。単一の設計パラメータで SASO 特性を同時に満たせないという 8 章の結論が以降の章立てを駆動している。既存 wiki との接続では、[[制御ループの安定性とタイムラグ補償]] に積まれた経験的な安定性判断(Apollo LM、Burgess)に対し本書が形式的判定(極が単位円の内側)と定量式($k_s \approx -4/\log|a|$)を与えた点、[[状態空間モデル]] に深層学習の SSM 論と制御理論の状態空間モデルが同一ページ上で併存する形になった点が新しい。
- 備考: PDF アウトラインの level 1 が Part だったため章検出が 13 件に化けており、level 2 から章境界を復元して再分割した。原本の印刷ミス・抽出崩れ 4 件(2 章の係数不一致、3 章の長除算桁ずれ、6 章の伝達関数の項欠落と節見出し消失)はいずれも推測復元せず回避した。`wiki/concepts/_index.md` の「現行コンセプトカタログ」節は独自の照合順序で機械生成されており、本作業以前から 267 件が未登録の状態にあるため今回は触っていない(本書の 10 件も未登録)。
## [2026-08-16] ingest-paper | The Vision of Autonomic Computing
- Source: `.raw/papers/The_vision_of_autonomic_computing.pdf`(入力: ローカル PDF、*Computer* Vol. 36 No. 1, 2003、10 ページ)
- Summary: [[@2003__Computer__The Vision of Autonomic Computing]]
- Pages created: source 1 件、entity 2 件、concept 2 件(合計 5 件)
- entity(新規 2): [[Jeffrey O. Kephart]]、[[David M. Chess]](いずれも person、[[IBM T.J. Watson Research Center]])
- concept(新規 2): [[自律コンピューティング]]、[[MAPE-Kループ]]
- Pages updated: entity 1 件、concept 2 件
- entity: [[IBM T.J. Watson Research Center]](自律コンピューティング研究系譜を追記、alias に "IBM Thomas J. Watson Research Center" を追加)
- concept: [[セルフヒーリング]](2003 年の初出定義=検知→診断→修復アクションの 3 段階構造を追記)、[[自動化のアイロニー]](自律コンピューティングの段階的自律性移譲提案が Bainbridge 1983 の監視のアイロニーを踏襲していながら言及していない点を追記)
- Key insight: 本稿が提案する自律性の段階的移譲(情報収集→助言者→人間はより頻度の低い高レベル判断のみ)は、20 年前の Bainbridge(1983)の監視のアイロニーが警告する構造をそのまま採用しながら、その懸念に一切触れていない。自律コンピューティング/自己適応システムのアーキテクチャ研究とヒューマンファクター研究が互いを参照していない可能性を示す学際的ギャップとして [[自動化のアイロニー]] に記録した。
- 備考: 図表はすべてベクター描画で pdf.js の埋め込み画像抽出は使えず(唯一の embedded 画像は表紙の装飾的な "OUTLOOK" カバーアートで除外)、PyMuPDF のキャプション座標クロップで Figure 1・Figure 2 を全件取得した。Table 1 は Markdown 表として本文に転記。DOI(10.1109/MC.2003.1160055)は doi.org からのリダイレクトで IEEE Xplore 該当文書への解決を確認。本文参照図表(Figure 1・2、Table 1)はすべて埋め込み済みで欠落なし。全 10 ページを通読。
## [2026-08-16] ingest-paper (re-ingest) | Theoretical System Administration
- Source: `.raw/papers/burgess.pdf`(URL: https://www.usenix.org/conference/lisa-2000/theoretical-system-administration → https://www.usenix.org/events/lisa2000/full_papers/burgess/burgess.pdf、USENIX LISA 2000、14 ページ)
- Summary: [[@2000__LISA__Theoretical System Administration]]
- 経緯: 2026-07-22 のバッチ ingest(コミット `ad0d71ca54`)で既に source/entity/concept が完成済みだったことが判明。address フィールド未付与・Table 1/2 が Markdown 表として本文に無い・Formula 1(特性行列)が未埋め込みという、現行版 `wiki-ingest-paper` skill の規約とのギャップがあったため、ユーザーの指示で現行 skill に沿って再取り込みした。新規ページは作成せず、既存ページを更新。
- Pages updated: source 1 件、entity 1 件、concept 1 件(合計 3 件、すべて address 未付与だったため新規採番して補完: source c-003195、[[Oslo University College]] c-003196、[[収束型システム管理]] c-003197)
- source: Table 1(cfengine primitives)・Table 2(Games of timing)を Markdown 表として本文へ追加、Formula 1(特性行列)を新規クロップ画像として追加、Figure 2 のキャプションから Table 1 混在の記述を削除(Table 1 を独立の表へ分離したため)。
- concept: [[収束型システム管理]] は内容面の新規横断知見なし(address 補完のみ)。
- Attachments: `wiki/sources/_attachments/burgess/`(Figure 1〜4 は既存ファイル名を維持しつつ、現行 skill の「図表領域のみを狭くクロップする」方針で fig02・fig03・fig04 を再クロップ。fig01 は誤って上書きしたが同一図のため実質差分なし。Formula 1 のクロップ画像を新規追加)。図表はすべてベクター描画で pdf.js の埋め込み画像抽出は 0 件、PyMuPDF キャプション座標クロップで全件取得。
- Key insight: 旧版は Table 1 を Figure 2 の画像に混在させ、Table 2 と Formula 1 を本文プレーンテキストの言及のみに留めていた。現行 skill の「表は Markdown 転記、複雑な行列式は画像クロップ」という規約に合わせて分離・追加したことで、4×4 ペイオフ行列の構造(Table 2)と各要素の具体的な数式(Formula 1)の両方が本文から直接参照可能になった。
- 備考: manifest に `.raw/papers/burgess.pdf` のエントリが存在しなかった(旧 ingest 時の記録漏れ)ため、今回バックフィルした。
## [2026-08-16] ingest-paper | Predict Boldly, Recover Cautiously: Fast On-Router Route Anomaly Prediction and Recovery
- Source: `.raw/papers/3789240.3830299.pdf`(入力: ローカル PDF、SIGCOMM Posters and Demos '26、3 ページ)
- Summary: [[@2026__SIGCOMM Posters and Demos__Predict Boldly, Recover Cautiously : Fast On-Router Route Anomaly Prediction and Recovery]]
- Pages created: source 1 件、entity 1 件(合計 2 件)
- entity(新規 1): [[Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences]](organization)
- Pages updated: entity 11 件、concept 2 件
- entity: 著者 8 名 [[Hang Cui]] [[Cenjie Hu]] [[Zexin Wang]] [[Jingjing Li]] [[Juncheng Hu]] [[Dan Pei]] [[Changhua Pei]] [[Gaogang Xie]]、所属 4 件 [[Computer Network Information Center, Chinese Academy of Sciences]] [[Tsinghua University]] [[Jilin University]] [[Shenyang Institute of Automation, Chinese Academy of Sciences]]
- concept: [[NetOps]](中央集権的事前検証とルーター側ローカル反射の対比)[[プロアクティブ障害管理]](PFM 4 段階の 1 エージェント統合の実例として RouterOPS を追記)
- Attachments: `wiki/sources/_attachments/3789240.3830299/`(4 点 = Figure 1〜4 全件)。全図がベクター描画のため pdf.js 埋め込み画像抽出(50 候補、いずれもラスター断片)は使えず、PyMuPDF キャプション座標クロップで全件取得。本文参照図表(Figure 1〜4、全 4 点)は全て埋め込み済み(差分ゼロ、除外図表なし)。
- Key insight: 「大胆に予測し、慎重に復旧する」原則を体現する decision guard(ヒステリシスによる持続性確認+対象特定+ポリシー/バックアップ制約充足の 3 条件)は、Salfner+ 2010 の PFM 4 段階(予測→診断→対策決定→実行)をネットワークルーティング層で単一ルーターエージェントに統合した実例であり、Candea+ 2004 の「復旧アクションが短時間・低コストなほど許容できる偽陽性率が高い」という関係の裏返し(ルート切り替えという破壊的復旧だからこそ持続性まで要求する保守設計)として読める。ケーススタディでは Centralized AIOps ベースラインより早い異常応答と、経路下流ほど拡大する累積 RTT 削減(Service Provider 2.1ms → User Institution 43.4ms)を報告した。
- 備考: 本文中の ACM Reference Format 自己引用の DOI(10.1145/3789240.3830275)がファイル名由来の DOI(10.1145/3789240.3830299)と一致しない不一致を確認。ACM DL(dl.acm.org)は WebFetch・curl(ブラウザ UA 付き)ともに 403 で裏取りできず、url フィールドは空欄とし source ページ本文に不一致を記録した。全 3 ページを通読。
## [2026-08-16] ingest-book | Guide to the Software Engineering Body of Knowledge - A Straw Man Version
- Source: `.raw/books/swebok-straw-man-1998/`(本編 7 章 + 付録 I・J の計 9 件 / 入力: ローカル PDF、110 ページ)。Pierre Bourque, Robert Dupuis, Alain Abran, James W. Moore, Leonard Tripp, Karen Shyne, Bryan Pflug, Marcela Maya, Guy Tremblay, *Guide to the Software Engineering Body of Knowledge – A Straw Man Version*, IEEE Computer Society, September 1998.
- Book entity: [[SWEBOK Straw Man Version]]
- Chapters: [[@1998__IEEECS__SWEBOK Straw Man - Chapter 1 Introduction]]〜[[@1998__IEEECS__SWEBOK Straw Man - Chapter 7 Summary and Next Steps]] + [[@1998__IEEECS__SWEBOK Straw Man - Appendix I Draft Classification of Knowledge on Formal Methods]] / [[@1998__IEEECS__SWEBOK Straw Man - Appendix J Additional Information on Other Body of Knowledge Proposals]](9 件、すべて `publish: false`)
- Pages created: source 9 件、entity 13 件、concept 5 件(合計 27 件)
- entity(新規 13): [[SWEBOK Straw Man Version]](book)[[IEEE Computer Society]] [[ISO IEC 12207]] [[Walter Vincenti]] [[Pierre Bourque]] [[Robert Dupuis]] [[Alain Abran]] [[James W. Moore]] [[Leonard Tripp]] [[Guy Tremblay]] [[ICCP]] [[ASQ]] [[Quality Assurance Institute]]
- concept(新規 5): [[ソフトウェア工学知識体系]] [[一般に受け入れられた知識]] [[専門職化と資格認定]] [[ソフトウェア工学の関連分野]] [[形式手法]]
- Pages updated: concept 3 件
- [[ソフトウェアライフサイクル]](ISO/IEC 12207 の Primary/Supporting/Organizational の 3 プロセス類と知識領域分類基盤への採用経緯)[[SREの工学化]](工学分野としての成熟という論点での ch.3 との突き合わせ)[[軽量形式手法]](1998 年の付録 I の分類との突き合わせ)
- Attachments: `wiki/sources/_attachments/swebok-straw-man-1998/`(10 点 = 本文が参照する Figure 1〜6・Table 1〜4 の全件)。
- 運用メモ: PDF にアウトラインが無く `fetch-book.sh` の章検出は 0 件だったため、本文の目次と章見出しの実測位置から `--chapters "1=7,2=8,3=13,4=21,5=27,6=30,7=31,20=34,21=36,8=97,9=106,22=110"` で再分割した(20・21・22 は References・付録 A〜H・末尾を切り離すダミー章)。印字ノンブルのオフセットは一定でなく、PDF p.20 までが −5、p.21 以降が −4(印字 p.16 が欠番)である。この実測により **Figure 5 が 3 章ではなく 4 章の図**であることが判明し、attachment 名と担当章の割り当てを訂正した。図表は全 10 点がベクター図(埋め込み画像 0 件)のため `get_image_rects()` は使えず、drawings の bbox とキャプション座標からオーケストレータが 1 パスでクロップし、全点を目視確認して Figure 1・3・5 と Table 1 の 4 点を再クロップした。埋め込み 10 / 欠落 0 / 未使用 attachment 0、Navigation リンク全解決、frontmatter 必須項目(`publish: false`・address・日付タグ・updated・source_type)9 章すべて充足を機械検証済み。付録 A〜H は教科書リスト・大学課程 URL・分類表といった生データのため、ユーザー確認のうえ取り込み対象外とした。
- fan-out: 章ごとに Sonnet 5 subagent へ委譲し、ハブ concept [[ソフトウェア工学知識体系]] を積み増す章(3 → 5 → 2 → 7)を投入順で直列化しつつ常時 3〜4 体のローリングで回した。途中でセッション上限により 3 体(2 章のハブ積み増し・5 章の lock 解放・7 章全体)が中断したため、オーケストレータ(Opus 5)が引き継いで 7 章 source と [[Walter Vincenti]] entity を作成し、ハブ concept へ 2 章・7 章の軸を積み増して完了させた。残存 lock 1 件も解放済み。
- Key insight: 本書は**知識体系の定義ではなく、知識体系を定義するための手続きの提案**である。第 7 章が自ら識別方法論の不十分さを 5 点挙げて次段階へ引き渡す構造をとり、Straw Man 版が渡したものは知識領域のリストそのものよりむしろ「リストをどう精緻化するかの手続き」であった。中核にあるのは「一般に受け入れられた」という定性的な正統性の要件を「教科書 24 冊中 6 冊以上」という定量的閾値へ翻訳する操作で、本書自身がそれを厳密な演繹ではなく実務的な近似だと認めている。1998 年時点の判定結果は現在の視点から見ると際立った偏りを持ち、Table 3(基準未達側)に Software Security/Safety・Human Factors・Ethics・Legal Aspects・Fault-Tolerant Software・Software Reuse・Reengineering が並ぶ。教科書の目次を基準に据えたことで当時の教科書が扱っていなかった領域が構造的に排除され、[[ISO IEC 12207|ISO/IEC 12207]] を分類基盤に据えたことで規格の外にある領域(開発手法・開発環境・測定・信頼性)が「収束しない」トピックへ追いやられている。分類基盤の選択が結果をどこまで規定するかは本書内で検証されていない。
- 矛盾: 第 7 章 p.27 の提案知識領域リスト(および Executive Summary の同じリスト)に **Management Process が含まれていない**一方、第 5 章の Table 1 では Management Process が教科書 20 冊・必修 20 課程・選択 10 課程で網掛けされ「一般に受け入れられた」と判定されている。`> [!contradiction]` を第 7 章 source と [[ソフトウェア工学知識体系]] の双方に記録した。付録 J は Parnas がプロジェクト管理をソフトウェア工学固有の知識体系から除外すべきだと主張していたことを記録しており論点自体は当時から存在したが、本書内に判断の明示はない。
## [2026-08-16] ingest-book | The Sciences of the Artificial
- Source: `.raw/books/sciences-of-the-artificial-3e/`(8 章 / 入力: ローカル PDF、252 ページ)。Herbert A. Simon, *The Sciences of the Artificial*, third edition, The MIT Press, 1996(初版 1969、第 2 版 1981。ISBN 0-262-19374-4 / 0-262-69191-4)。
- Book entity: [[The Sciences of the Artificial]]
- Chapters: [[@1996__MITPress__The Sciences of the Artificial - Chapter 1 Understanding the Natural and Artificial Worlds]]〜[[@1996__MITPress__The Sciences of the Artificial - Chapter 8 The Architecture of Complexity - Hierarchic Systems]](8 件、すべて `publish: false`)
- Pages created: source 8 件、entity 6 件、concept 19 件(合計 33 件)
- entity(新規 6): [[The Sciences of the Artificial]](book)[[Herbert A. Simon]] [[Allen Newell]] [[EPAM]] [[UNDERSTAND]] [[BACON]]
- concept(新規 19): [[人工物の科学]] [[内部環境と外部環境]] [[限定合理性]] [[満足化]] [[市場と組織]] [[情報処理システムとしての人間]] [[ヒューリスティック探索]] [[チャンクと記憶の制約]] [[問題の理解と表現]] [[計算による科学的発見]] [[設計の科学]] [[社会計画]] [[最終目標なき設計]] [[注意の希少性]] [[創発と還元主義]] [[決定論的カオス]] [[準分解可能システム]] [[階層的複雑性]] [[状態記述と過程記述]]
- Pages updated: entity 1 件、concept 4 件(合計 5 件)
- entity: [[ノーバート・ウィーナー]](第 7 章による同時代人としての値踏み)
- concept: [[コルモゴロフ複雑性]](非冗長な構造と非圧縮性の一致、ただし関心が逆であること)[[サイバネティクス]](一般システム理論への Simon の警告)[[記号接地問題]](Siklossy のプログラムと中国語の部屋への反駁)[[エージェント型科学探索]]([[BACON]] 系譜との探索資源の見立ての逆転)
- Attachments: `wiki/sources/_attachments/sciences-of-the-artificial-3e/`(7 点 = 本文が参照する図 Figure 1〜7 の全件)。
- 運用メモ: PDF にアウトラインが無く `fetch-book.sh` の章検出は 0 件だったため、全文テキストの目次と印字ノンブルから境界を確定し(印字ページ = PDF ページ − 18)、`--chapters "9=11,10=13,1=19,...,11=235"` で再分割した(9・10 は序文 2 件、11 は索引以降を切り離すダミー章)。ページ全体がスキャン画像 + OCR テキスト層のため `get_image_rects()` は全ページ矩形を返して使えず、キャプション座標クロップで図 7 点をオーケストレータが 1 パスで切り出した(Figure 4 のみキャプション行が OCR で欠落しており、本文の参照から所在を特定)。序文 2 件は source 化せず book entity の「成立事情」に織り込んだ。fan-out は concept のハブ衝突を避けて直列化し、1・2・3・8 章 → 5 章(1・2 章の後)→ 4 章(3 章の後)→ 7 章(8 章の後)→ 6 章(5 章の後)の順にローリング投入した。
- Key insight: 本書の各命題は分野ごとに独立した主張ではなく、**「内部環境の限界が外部環境への適応を制約する」という一つの主張の変奏**である。経済学における[[限定合理性]]、認知心理学における「行動システムとしての人間は単純であり、行動の複雑さは環境の複雑さの反映である」という評決、設計論における[[満足化]]、複雑性論における[[準分解可能システム]]は、同一の枠組みを対象を変えて適用した結果として現れる。第 5 章の設計論と第 6 章の社会計画の関係も同型で、第 5 章が目標を与件として設計の論理を立てるのに対し、第 6 章は目標自体が設計過程の途中で動くこと([[最終目標なき設計]])へ拡張する。第 3 版で追加された第 7 章は、複雑系科学の隆盛に対して Simon 自身が本書の立場を「複雑性一般の理論」ではなく「強い性質を持つ特定クラスの理論」として限定し直した章であり、第 8 章に対する自己批判的な補注として読める。
- 矛盾: `> [!contradiction]` を立てた箇所は無い。ただし章をまたぐ強調点の反転を横断的知見として記録した。(1) 進化の近視眼性が、第 2 章では「進化から最適化を結論できない」という否定的根拠として、第 6 章では「計画が引き受けるべき性格」として使われる。(2) 第 7 章は「階層(または準分解可能性)」と両者を同一視するが、第 8 章はより慎重に関係づける。(3) 第 3 章本文には "heuristic search" / "problem space" / "means-ends analysis" の語が一度も現れず(grep 確認)、3 語とも第 4 章が初出である(p.94, p.106, p.108-109)。(4) 第 3 章内でチャンク固定時間の値が 5 秒・8 秒・5〜10 秒と揺れるが、Simon 自身が「2 倍以内の定数性」と明言しているため note callout に留めた。
## [2026-08-15] ingest-book | SREの探求
- Source: `.raw/books/seeking-sre-ja/`(34 件 = 前付「はじめに」+ 全 33 章 / 入力: ローカル PDF、632 ページ)。原書 *Seeking SRE: Conversations About Running Production Systems at Scale*(O'Reilly Media 2018、David N. Blank-Edelman 編)、日本語版 オライリー・ジャパン 2021-09-01、山口能迪 監訳・渡邉了介 訳、ISBN 978-4-87311-961-8。
- Book entity: [[SREの探求]]
- Chapters: [[@2021__OReillyJapan__SREの探求 - Preface はじめに]]・[[@2021__OReillyJapan__SREの探求 - Chapter 1 SREにおけるコンテキストとコントロール]]〜[[@2021__OReillyJapan__SREの探求 - Chapter 33 まとめ]](34 件、すべて `publish: false`)
- Pages created: source 34 件、entity 73 件、concept 23 件(合計 130 件)
- entity(新規 73): 章著者 24 名 — [[Coburn Watson]] [[Luke Stone]] [[Martin Check]] [[Jonathan Mercereau]] [[Matthias Rampke]] [[Drew Michel]] [[Lynn Root]] [[Johannes Russek]] [[Sriram Gollapalli]] [[Vladimir Legeza]] [[Damon Edwards]] [[Casey Rosenthal]] [[Amber Yust]] [[Laine Campbell]] [[James Cowling]] [[Ricardo Amaro]] [[Ríona MacNamara]] [[Shylaja Nukala]] [[Theo Schlossnagle]] [[Kurt Andersen]] [[Jonah Horowitz]] [[John Looney]] [[James Meickle]] [[Emily Gorcenski]] / その他人物 9 名 — [[Thomas A. Limoncelli]] [[Jez Humble]] [[Erik Hollnagel]] [[Melvin Conway]] [[Kent Beck]] [[Andrew Ryan]] [[Aaron Gillies]] [[Jeremy Sharpe]] [[Stas Miasnikoŭ]] / 組織 19 — [[Dropbox]] [[Agilent Technologies]] [[iLab Solutions]] [[Amazon Japan]] [[Rundeck Inc]] [[IT Revolution]] [[Lyft]] [[Quantopian]] [[Acquia]] [[Shopify]] [[DigitalOcean]] [[Backplane.io]] [[Layer Aleph]] [[United States Digital Service]] [[Adaptive Capacity Labs]] [[traffiq corp]] [[Akamai]] [[ACM]] [[SRECon17 Europe]] / 製品 19 — [[Chaos Monkey]] [[Chaos Kong]] [[Hystrix]] [[Spinnaker]] [[Envoy]] [[Istio]] [[Linkerd]] [[Consul]] [[OpenResty]] [[Chef]] [[Puppet]] [[Packer]] [[TensorFlow]] [[Keras]] [[TensorBoard]] [[Jupyter]] [[scikit-learn]] [[g3doc]] [[EngPlay]] / 書籍 2 — [[SREの探求]] [[The DevOps Handbook]]
- concept(新規 23): [[コンテキスト対コントロール]] [[SRE採用面接]] [[修復負債]] [[分隊型運用]] [[システム管理者からSREへの視点転換]] [[サービスとしての運用(OaaS)]] [[レディネスレビュー]] [[DevOpsとSREの関係]] [[プロダクションエンジニアリング]] [[プライバシーエンジニアリング]] [[データベースリライアビリティエンジニアリング]] [[データ耐久性]] [[ドキュメンテーションのワークフロー統合]] [[アクティブラーニング]] [[SREアンチパターン]] [[イミュータブルインフラストラクチャ]] [[スクリプタブルロードバランサー]] [[サービスメッシュ]] [[表現線]] [[メンタルヘルスとインクルーシビティ]] [[オンコール]] [[コンウェイの法則]] [[SREと社会運動]]
- Pages updated: entity 44 件、concept 90 件(合計 134 件)
- entity の中心: [[Niall Murphy]] [[Richard I. Cook]] [[John Allspaw]] [[Jens Rasmussen]] [[Benjamin Purgason]] [[Pedro Canahuati]] [[David N. Blank-Edelman]] [[Betsy Beyer]] [[Gene Kim]] [[Matt Klein]] [[Emil Stolarsky]] [[Laura Nolan]] [[Blake Bisset]] [[Andrew Fong]] [[Björn Rabenstein]] [[Charity Majors]] [[Mikey Dickerson]] [[Liz Fong-Jones]] ほか(組織・製品含む)
- concept の中心: [[SRE組織変革]] [[DevOps]] [[カーゴカルトSRE]] [[サービスレベル目標]] [[心理的安全性]] [[人的要因]] [[トイル]] [[複雑システム障害論]] [[収束型システム管理]] [[エラーバジェット]] [[Build Versus Buy]] [[ベンダーエンジニアリング]] [[オンコールストレス管理]] [[SREエンゲージメントモデル]] [[SRE文化]] ほか(一覧は [[concepts/_index]])
- Attachments: `wiki/sources/_attachments/seeking-sre-ja/`(72 点 = 本文が参照する図の全件)。632 ページのため画像一括抽出はスキップし、キャプションのフォント判別(`GothicBBBPr6N-Medium` 7.1pt、本文明朝 `RyuminPr6N-Reg` を含まず最大サイズ 8.0pt 未満)で全ページからキャプションを抽出し、`get_image_rects()` によるキャプション直上の未使用画像矩形との対応づけで 63 点を自動クロップ、残るベクター図 9 点をキャプション座標クロップで補った。本文の図参照 grep(72 点)との差分ゼロ。表 7 点(表10-1・表18-1・表26-1・表28-1〜28-4)は画像化せず Markdown 表として本文に再現。機械検証: 埋め込み 72 / 欠落 0 / 未使用 attachment 0、Navigation リンク 100 件すべて解決、frontmatter 必須項目(`publish: false`・`address`・日付タグ・`updated`・`source_type: book`)欠落 0 / 34。
- 運用メモ: 章ごとに Sonnet 5 subagent へ委譲(オーケストレータは Opus 5)。`fetch-book.sh` の章検出は level 1 が部(Part)であったため 13 章に化けており、`toc.txt` の level 2 から章境界を読み取って `--chapters` で再分割した(部の扉は捨て番号のダミー章で切り離し)。同一 concept を奪い合う章(SRE 導入・組織変革系の 3/6/8/9/10/11/22 章、オンコール・燃え尽き系の 27/28/29/30 章)は投入順で直列化し、空き枠に concept の重ならない章を入れて常時 3〜4 体のローリングで処理した。セッション上限による中断が 2 回発生し、計 8 体を `git status` で実体照合したうえで残作業を名指しして再開させた。
- Key insight: 本書の価値は規範の提示ではなく、**同じ問いに条件の異なる組織が別々の答えへ到達した経路が一次資料として並ぶ**点にある。専任 SRE チームを持たない組織だけでも SoundCloud(専任→派遣の 2 段階失敗を経て分散適用。専任 SRE がエンジニア総数の 5〜10% を占め破綻)・Spotify(常駐→集中→分散の漸進的自己認識)・Facebook(独立組織+Embedded の PE 職種)と経路が異なり、レガシー大企業 Agilent の 5 ステップの計画的トップダウン導入が対照をなす。7 章のセルフサービス失敗(ゲートキーパー撤廃によるバックエンドのエントロピー増大)と 10 章の OaaS(アクセス制御・監査可能性を明示的要件とする)の対比から、成否を分ける変数は「権限を外した後の代替設計の有無」だと特定できた。
本書はまた SRE の前提自体を疑う章を含む。30 章は [[SRE Book]] 第 11 章(オンコールを前提に最適化する立場)の共同編者 [[Niall Murphy]] が 5 年後に慣行そのものを問い直したもので、27/28/29 章が積んだ三層(緩和策・認知科学的説明・帰結と個人差)を「役に立つが優先度の低い対症療法」と明示的に格下げする。11 章と 12 章の突き合わせでは、DevOps と SRE の**用語としての先後(DevOps が先、6 年差)と実践としての先後(SRE が先。DevOps 側の Gene Kim 自身の証言)が逆方向**であることが見えた。24 章は既存 [[収束型システム管理]] が未解決の問いで予告していた「収束を諦め交換に切り替える」第 2 ソースにあたり、予告された問いがそのまま埋まった。
- 矛盾: 22 章の DevOps 起源年(2003〜2007 年、SRE とほぼ同時期)が既存 [[DevOps]] の記述(独立 2 ソース一致で 2008 年 Agile Infrastructure BoF・2009 年 devopsdays)と食い違う。22 章側に固有名詞・一次資料の裏付けがないため `> [!contradiction]` で両論併記した。ほかに Benjamin Purgason の同一講演の段階数(『[[SREをはじめよう]]』16 章は 5 段階、本書 22 章は 4 段階)、[[Jens Rasmussen]] の 3 境界モデルの第 3 境界名(本書「安全性」対 他ソース「Performance」)を命名の揺らぎとして記録した。
## [2026-08-15] ingest-paper | FlowCheck: Decoupling Checkpointing and Training of Large-Scale Models
- Source: `.raw/papers/2026_Unknown_FlowCheck_Decoupling_Checkpointing_Training_Large.pdf`(入力: ローカルPDF、EuroSys '25、16ページ)
- Summary: [[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]]
- Pages created: source 1 件、entity 12 件(著者10件: [[Zimeng Huang]], [[Hao Nie]], [[Haonan Jia]], [[Bo Jiang]], [[Junchen Guo]], [[Jianyuan Lu]], [[Rong Wen]], [[Biao Lyu]], [[Shunmin Zhu]], [[Xinbing Wang]]、organization 1 件 [[Hangzhou Feitian Cloud]]、repository 1 件 [[flowcheck-eurosys25]])
- Pages updated: entity 4 件([[Alibaba Cloud]], [[Shanghai Jiao Tong University]], [[Peking University]], [[Zhejiang University]])、concept 2 件([[チェックポイント]], [[集合通信]])、source 1 件([[@2023__SOSP__Gemini - Fast Failure Recovery in Distributed Training with In-Memory Checkpoints]] に FlowCheck との比較を追記)
- Attachments: `wiki/sources/_attachments/2026__EuroSys__FlowCheck/`(17点 = Figure 1〜17 全件)。全図がベクター描画で `pdf.js` の埋め込み画像抽出では0件だったため、PyMuPDFでキャプション直前のテキストブロック座標を特定し全17図を領域クロップした。Table 1・2はMarkdown表へ忠実に転記。本文参照図表(Figure 1〜17・Table 1〜2、全19点)は全て埋め込み済み(差分ゼロ、除外図表なし)。
- Key insight: Gemini(SOSP '23)が訓練ノードの通信スケジュールの遊休時間帯を精密に予測してチェックポイント通信を割り込ませる「時間軸での分離」を追求したのに対し、FlowCheck はデータセンタースイッチのポートミラーリング機能でチェックポイント通信を訓練ノードの通信経路から「物理的に分離」する。訓練ノード側の追加通信ゼロという設計で、8ノード評価で98%超の有効訓練時間比率、175B〜1Tパラメータ・最大3072GPU規模への外挿推定でも単一イテレーション内でのチェックポイント完了を達成した。
- 備考: DOI(https://doi.org/10.1145/3689031.3696088)はPDF本文の書誌情報(EuroSys '25正式ページ数・ISBN・著作権表記)で確認済み。ACM DL(dl.acm.org)はWebFetch・curl(ブラウザUA付き)双方で403となったため、書誌情報の裏取りはPDF本文とGitHubリポジトリ(https://github.com/AlibabaResearch/flowcheck-eurosys25、curlで200確認)で完結させた。全16ページを通読。
## [2026-08-15] ingest-paper | Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports
- Source: `.raw/papers/2026_Unknown_Leveraging_LLMs_Structured_Information_Extraction.pdf`(入力: ローカルPDF、ICPE Companion '26 Work In Progress Paper、8ページ)
- Summary: [[@2026__ICPE__Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports]]
- Pages created: source 1 件、entity 4 件([[Shashikant Ilager]], [[Sacheendra Talluri]], [[Yizhen Zang]], [[Delft University of Technology]])、concept 1 件([[LLMによる構造化情報抽出]])
- Pages updated: entity 4 件([[Xiaoyu Chu]], [[Alexandru Iosup]], [[Vrije Universiteit Amsterdam]], [[University of Amsterdam]])、concept 2 件([[クラウドインシデント]], [[LLM評価]])
- Attachments: `wiki/sources/_attachments/2026_Unknown_Leveraging_LLMs_Structured_Information_Extraction/`(4点 = Figure 1〜3 + Table 2)。Figure 1〜3はいずれもベクター描画で `pdf.js` の埋め込み画像抽出では取得できなかったため、PyMuPDFでキャプション直前のテキストブロック座標を特定し領域クロップした。Table 2(抽出フィールド一覧、青丸=完全抽出/赤丸=LLM推論のチェックマーク付きレイアウト)はOCRでチェックマークの列対応が崩れ正確な転記が困難だったため画像クロップとした。Table 1・3・4・5・6はMarkdown表へ忠実に転記。本文参照図表(Figure 1〜3、Table 1〜6、全9点)は全て埋め込み済み(差分ゼロ)。除外図表なし。
- Key insight: 5プロンプトコンポーネント(Task/CoT/Category/Examples/Format)の組み合わせで6戦略を構築し、In-context Examplesが単一で最も効果的な要素であること(Basic-ZS→Basic-FSで+24%)、分類フィールドではFew-shotが逆効果になりうること(GPT-4oでAWS -22.00%)を実証。6LLM(軽量3種・SotA3種)比較では軽量モデルが精度・コスト・レイテンシで良好なバランスを示し、最高コストモデルは最安モデルの50–60倍のコストを要するが精度面で必ずしも上回らない。
- 備考: DOI(https://doi.org/10.1145/3777911.3801103、ACM DLへリダイレクト確認)・GitHub(https://github.com/atlarge-research/llm-cloud-incident-extraction、200確認)の実在をWebFetch/curlで検証済み。著者Xiaoyu Chu・Alexandru Iosupは`atlarge-research`グループ(VU Amsterdam)の既存entityとして登場済みで、本ingestで更新した。全8ページを通読。
## [2026-08-15] ingest-book | ディープラーニングを支える技術〈2〉
- Source: `.raw/books/deep-learning-wo-sasaeru-gijutsu-2/`(6 枚 = 本編全 6 章 / 入力: 書籍全体 PDF、305 ページ)
- Book entity: [[wiki/entities/ディープラーニングを支える技術〈2〉|ディープラーニングを支える技術〈2〉]](岡野原大輔, 技術評論社, 2022-05-04, ISBN 978-4-297-12811-1)
- Chapters: [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 0 ディープラーニングとは何か]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 1 ディープラーニングの最適化]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 2 ディープラーニングの汎化]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 3 深層生成モデル]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 5 これからのディープラーニングと人工知能]](6 件)
- Pages created: entity 2 件([[AlphaGo]], [[wiki/entities/ディープラーニングを支える技術〈2〉|ディープラーニングを支える技術〈2〉]])、concept 11 件([[DQN]], [[GAN(敵対的生成ネットワーク)]], [[VAE(変分オートエンコーダ)]], [[ベルマン方程式]], [[モンテカルロ木探索]], [[不変性と同変性]], [[宝くじ仮説]], [[方策勾配法]], [[条件数]], [[正規化フロー]], [[自己回帰モデル]])
- Pages updated: entity 1 件([[DeepMind]])、concept 27 件([[GNN同変性]], [[LLMスケーリング則]], [[PAC学習]], [[スケーリング則]], [[ドロップアウト]], [[バイアス-バリアンストレードオフ]], [[ベイズ最適化]], [[ムーアの法則とデナードスケーリングの終焉]], [[事前学習目的設計]], [[凸最適化]], [[勾配降下法]], [[対照学習]], [[強化学習]], [[拡散モデル]], [[暗黙的正則化]], [[最尤推定]], [[有向グラフィカルモデル]], [[正則化]], [[汎化能力]], [[汎化誤差バウンド]], [[深層学習の汎化]], [[知識蒸留]], [[膨張畳み込み]], [[自己教師あり学習]], [[表現学習]], [[言語モデル事前学習]], [[集合の順列不変表現]])
- Attachments: `wiki/sources/_attachments/deep-learning-wo-sasaeru-gijutsu-2/`(84 点 = 図 83 + 表 1)。305 ページのため画像一括抽出はスキップし、キャプション座標クロップで全点を切り出した。本書は図がすべてベクター描画で `get_images()` が装飾画像(ヘッダーバー・ページ背景)しか返さないため、埋め込み画像の直接クロップは使えない。代わりに 2 つの組版規則を使った: (1) キャプションはブロックのフォントが `YuGoPr6N-Bold` 単独・サイズが 7.1pt(注記の ※ のみ 5.0pt)で、本文中の図参照(「図1.2 のように」)は本文明朝を含むため確実に分離できる。(2) 図の本体は fill 値が固定のクリーム色(1.0, 0.9926, 0.9118)・幅 289pt 固定のベタ矩形で、キャプション直下 60pt 以内にある未使用のものが対応する図である。この 2 点の対応づけで 1 パス切り出しが成立した。本文の図参照 grep(図 83 + 表 1 = 84 点)と切り出し結果の差分はゼロ。図4.21 のみキャプションに ※ 注記(5.0pt)が混じるため判定式のサイズ集合を緩めて拾った。埋め込み 84 点・欠落 0・未使用 attachment 0 を機械検証済み。除外図表なし。
- Key insight: 本書の価値は、前書『[[wiki/entities/ディープラーニングを支える技術|ディープラーニングを支える技術]]』が定式化した対象に**理論的説明を与える後半部**として読める点にある。両書はもともと一冊として執筆され分量から二分冊になった経緯を持ち(むすびに代えて)、実際に章単位で対応が成立する — 前書第 2 章が勾配降下法の更新式と計算量のトレードオフを扱うのに対し本書第 1 章は非凸最適化での成功理由を問い、前書第 2 章が汎化能力を学習の目的と定義するのに対し本書第 2 章はその汎化がなぜ成立するのかを問う。この対応は [[勾配降下法]]・[[汎化能力]]・[[暗黙的正則化]] の横断的知見に前書・続編の両ソースを併記する形で記録した。wiki 全体で見ると、本書は論文由来の concept 群に**古典的基礎と教科書的整理を与える横串のソース**として働いた。強化学習では第 4 章が価値推定と方策改善という 2 軸の基礎を与え、既存の [[エージェント型強化学習]]・[[人間フィードバックからの強化学習]]・[[検証可能報酬による強化学習]]・[[報酬ハッキング]]・[[好奇心駆動学習]] という LLM 時代の論文由来ページ群に接続した。生成モデルでは、単体で存在していた [[拡散モデル]] に対し VAE・GAN・自己回帰モデル・正規化フローを並べた比較軸(抽象化表現・尤度評価・学習安定性・生成忠実度・生成速度、表3.1)を与えた。汎化では [[暗黙的正則化]] が本書第 2 章によって wiki 内で最も厚い教科書ソースを得た(陰的正則化を、勾配降下法によるノルム最小化・低ランク化、フラットな解への到達、宝くじ仮説の 3 機構に分解する整理)。
- 備考: 章検出の初回結果は第 5 章の範囲(PDF 256-305)に「むすびに代えて」・索引・奥付が混入していたため、`--chapters "0=33,1=42,2=80,3=114,4=174,5=256,6=295,7=298"` で境界を補正して再分割した(6・7 は本編外を切り離すためのダミー章)。取り込み範囲は本編 6 章のみとし、「むすびに代えて」(3 ページ)と前付の「基本用語の整理」(12 ページ)は source 化せず book entity に織り込む方針をユーザー確認のうえ採用した。**[[勾配降下法]]・[[凸最適化]] への本書分の追記は、別セッションの先行コミット `8e76a9bcc4`(2026-08-15 17:57「wiki: fix book entity links resolving to non-wiki notes」)に巻き込まれてコミット済みである。** 内容は完全な形で入っており欠損はないため履歴は改変せず、本エントリに記録するに留めた。fan-out 中は別セッションが同じ vault で並行 ingest しており(『SREの探求』の章群、SIGCOMM/WWW 論文、SpeakerDeck スライド)、共有索引ファイルには双方の追記が同居している。相手のコミットへの本書分の巻き込みは上記 2 件のみであることを `git show --name-only` で全数確認した。
## [2026-08-15] ingest-paper | TraceLLM: Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications
- Source: `.raw/papers/2026_Unknown_TraceLLM_Evaluating_Exploring_Large_Language.pdf`(ローカルPDF、ACM Web Conference 2026(WWW '26)、2026年4月13〜17日・ドバイ、DOI: 10.1145/3774904.3792164)
- Summary: [[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]]
- Pages created: source 1 件(上記)、entity 6 件([[Tong Zhou]], [[Jie Zhang]], [[Chaofeng Sha]], [[Chenxi Zhang]], [[Zicheng Yuan]], [[Senyu Xie]])、concept 1 件([[LLMによるトレース分析]])
- Pages updated: entity 7 件([[Xin Peng]], [[Fudan University]], [[Xidian University]], [[サムスン電子 (Samsung Electronics)]], [[Train-Ticket]], [[Online-Boutique]], [[OpenTelemetry]])、concept 3 件([[分散トレーシング]], [[LLM評価]], [[マイクロサービスベンチマーク]])
- Attachments: `wiki/sources/_attachments/2026_Unknown_TraceLLM_Evaluating_Exploring_Large_Language/`(図12点。Figure 1〜3・4(a)(b)・5(a)(b)(c)・7(a)(b)(c)(d)はいずれも pdf.js 抽出の埋め込みラスター画像をそのまま採用。本文参照図表(Figure 1〜7・Table 1〜9)との差分ゼロを確認。装飾的な ACM Artifacts Available バッジ(image-001-001)は本文参照が無いため除外。Figure 6(a)-(d)(トレース表現形式の JSON/XML 的表記例)はコード的表現のため画像embedを避けMarkdownコードブロックへ転記。Table 1〜9は全てMarkdown表へ転記——Table 5(TraceLLM 有効性評価)はpdftotext -layoutの二段組み崩れで列を取り違えて誤読していたことをPDFページのPyMuPDFレンダリングで検出し、正しい数値に修正した)
- Key insight: Train-Ticket(47サービス)上に構築した初の trace 分析ベンチマーク TraceBench(38タスク・30,400 I&R組)により、closed-source GPT-4o(Zero-Shot Acc 0.734)と open-source 3モデル(最良 Qwen-3-8B で0.650)を評価し、トレース表現戦略(Node Sequence/Adjacency Table/Edge List/Code-like Forms)による精度差がほぼ無い(Acc差0.011以内)ことを示した——LLMはspanId/parentSpanIdのみから構造を自律的に再構成できる。これを踏まえたファインチューニング手法TraceLLMは、テキスト化+LoRA(Trace2Text)とGNN埋め込み+LoRA(Trace2Token)の2系統を提案し、Trace2Textはopen-sourceベースラインを平均51.34%・GPT-4oを平均19.16%上回った(最良DeepSeek-R1で0.893)。Trace2Tokenは大域構造分析(single-trace/trace-pair level)には強い一方、GNN圧縮による情報損失で局所属性・計算タスクでは大きく劣化する(Computation Acc 0.091)という非対称な強みを示した。既存concept [[分散トレーシング]]にとって、これはアルゴリズム(サンプリング・圧縮・因果推論)によるトレース処理を扱ってきた本ページに対し、「LLM自身がトレースの一次消費者になりうるか」を初めて定量評価した研究として新しい軸を追加する。新設concept [[LLMによるトレース分析]]は、このLLM×トレース分析という交差領域の横断的知見を今後蓄積する起点となる。
## [2026-08-15] ingest-paper | Connecting 100K+ GPUs: Building the Communication Stack for Large-Scale LLM Training
- Source: `.raw/papers/2026_Unknown_Connecting_100K_GPUs_Building_Communication.pdf`(ローカルPDF、ACM SIGCOMM 2026 Conference、pp.505–517、DOI: 10.1145/3789240.3829152)
- Summary: [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]]
- Pages created: source 1 件(上記)
- Pages updated: entity 9 件([[NCCLX]], [[DQPLB]], [[Meta]], [[James Hongyi Zeng]], [[Min Si]], [[Pavan Balaji]], [[Minlan Yu]], [[Adithya Gangidi]], [[Rui Miao]])、concept 4 件([[集合通信]], [[Fault Localization]], [[RoCE設計課題]], [[Mixture-of-Experts]])
- Attachments: `wiki/sources/_attachments/2026_Unknown_Connecting_100K_GPUs_Building_Communication/`(図12点、Figure 1〜12 全てPyMuPDFのキャプション座標クロップで取得。pdf.js抽出の埋め込みラスター画像35点はいずれもベクター図の背景矩形の断片で図として使用不可だったため、全図をキャプション座標クロップで再取得した。本文参照図表12点との差分ゼロを確認。Table 1・2・3はいずれも内容がシンプルなためMarkdown表へ転記。除外図表なし)
- Key insight: 本稿は先行arXiv版([[@2025__arXiv__Collective Communication for 100k+ GPUs]]、NCCLX、同一著者グループ)をSIGCOMM 2026として整理し直したもので、通信ライブラリをCCLX(NVIDIA版NCCLX・AMD版RCCLX)という横断ブランド名へ一般化しつつ、多建屋物理トポロジのレイテンシ階層(ラック内比でラック間7×・AI Zone間15×・建屋間30×)という新しい定量的文脈でCTran/DQPLB/Fault Analyzer/CPUエミュレーションの知見を再提示・精緻化する。初期化は96K GPU規模で最大11倍高速化(265.0秒→24.0秒)、HBM使用量は64K GPU規模で約2倍削減。DQPLBはNCCLX論文の「一桁削減」という定性的主張を、接続種別別の実測値(All-to-Allv 32GPUで90%・128GPUで75%削減、256GPU AllGatherの1GBメッセージで72%削減)へ具体化した。Fault Analyzerは統計・機械学習を一切使わず2つの経験則のみでコレクティブ間依存DAGを構築し、4K GPUのモデルコードバグ・8K GPUのNIC故障という2つの本番ケーススタディで根本原因を特定した点が、Mycroftの精緻な依存トレースと対照的な「シンプルさでスケールする」設計選択として既存concept [[集合通信]]・[[Fault Localization]]に加わった。
## [2026-08-15] ingest-paper | HYDRA: A Multi-Level Hierarchy-Driven Approach for Robust Anomaly Detection in Time Series
- Source: `.raw/papers/2026_Unknown_HYDRA_Multi_Level_Hierarchy_Driven.pdf`(ローカルPDF、Proc. ACM Manag. Data 4, 3(SIGMOD), Article 197, June 2026、DOI: 10.1145/3802074)
- Summary: [[@2026__SIGMOD__HYDRA - A Multi-Level Hierarchy-Driven Approach for Robust Anomaly Detection in Time Series]]
- Pages created: source 1 件(上記)、entity 3 件([[Mingyi Huang]], [[Qinghua Liu]], [[Paul Boniol]])
- Pages updated: entity 3 件([[John Paparrizos]], [[The Ohio State University]], [[Inria]])、concept 2 件([[異常検知]], [[時系列異常検知ベンチマーク]])
- Attachments: `wiki/sources/_attachments/2026_Unknown_HYDRA_Multi_Level_Hierarchy_Driven/`(図14点、Figure 1〜14 全てPyMuPDFのキャプション座標クロップで取得。本論文はベクター描画中心でpdf.js抽出の埋め込みラスター画像(122点)がいずれも小断片で図として使用不可だったため、全図をキャプション座標クロップで再取得した。本文参照図表14点との差分ゼロを確認。Table 1・Table 2はいずれも内容がシンプルなためMarkdown表へ転記。除外図表なし)
- Key insight: HYDRAは、discordベース手法(Matrix Profile)の「twin-freak問題」(類似異常同士が互いの最近傍になり検知を逃す)とクラスタリングベース手法(NormA/KMeansAD)の「クラスタ汚染問題」(異常集中でクラスタごと正常判定される)という相補的弱点を、「代表ウィンドウ集合への参照距離」+「代表集合の階層的純化」という単一設計で同時に解消した。TSB-ADベンチマーク40データセット・40アルゴリズム横断評価で単変量VUS-PR +18.7%・多変量+9.2%を統計的有意性とともに達成し、z-score等いずれの正規化方式も振幅駆動型異常を抑制しうることを実証、HYDRA自身を含む複数ベースラインで非正規化が有意に優れるという具体的知見を得た。HNSW近似版は厳密版に対し100万長系列で最大49.8倍高速化。既存concept [[異常検知]]にとっては、EventADLの「形状か大きさか」正規化軸と対をなす「正規化の二面性」という具体的知見、およびtwin-freak/クラスタ汚染の構造的統一説明を追加した。既存concept [[時系列異常検知ベンチマーク]]にとっては、TimeEval由来の「万能アルゴリズムは存在しない」テーゼが40データセット規模でもドメイン粒度では成立し続けることを確認する具体例を追加した。
- Open questions: TSB-AD原論文(Liu & Paparrizos, NeurIPS 2024)自体は本wiki未取り込みであり、今後のingest候補として明記した。ドメイン別結果でNormA/Matrix Profileが依然優位なドメインがあることと、HYDRA自身の階層設計との関係は未整理。低振幅・高周波ジッタ型異常への弱さは著者ら自身が認める限界で、[[TFC]]の曲率視点との統合は両論文とも将来課題としてのみ言及されている。
## [2026-08-15] ingest-book | 原論文から解き明かす生成AI
- Source: `.raw/books/genronbun-kara-tokiakasu-seisei-ai/`(9 枚 = 全 8 章 + Appendix / 入力: 書籍全体 PDF、305 ページ)
- Book entity: [[wiki/entities/原論文から解き明かす生成AI|原論文から解き明かす生成AI]](菊田遥平, 技術評論社, 2025-08-23, ISBN 978-4-297-15078-5)
- Chapters: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 1 本書の読み方と論文を読み解く技術]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 2 入力データの特徴量化]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 3 生成AIモデルの大前提となるTransformer]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 4 Generative Pre-trained Transformerとテキスト生成]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 5 拡散モデルと画像生成]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 6 テキストと画像の融合]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 8 生成AIモデルの評価]], [[@2025__Gihyo__原論文から解き明かす生成AI - Appendix 参考文献の取り扱いとビッグオー記法]](9 件)
- Pages created: entity 7 件([[BLIP]], [[CLIP]], [[Imagic]], [[LLaVA]], [[unCLIP]], [[wiki/entities/原論文から解き明かす生成AI|原論文から解き明かす生成AI]], [[菊田遥平]])、concept 8 件([[Bradley-Terryモデル]], [[Vision Transformer]], [[サブワードトークン化]], [[位置埋め込み]], [[分布仮説]], [[学術論文の読解技術]], [[対照学習]], [[拡散モデル]])
- Pages updated: entity 6 件([[Alec Radford]], [[Chatbot Arena]], [[GPT-2]], [[GPT-3]], [[OpenAI]], [[SWE-Bench-Verified]])、concept 16 件([[LLMスケーリング則]], [[LLMランキング]], [[LLM評価]], [[Transformer]], [[スケーリング則]], [[スパース注意]], [[テキスト埋め込み]], [[テスト時計算スケーリング]], [[ビジョン言語モデル]], [[事前学習目的設計]], [[人間フィードバックからの強化学習]], [[強化学習スケーリング]], [[文脈内学習]], [[検証可能報酬による強化学習]], [[注意機構]], [[言語モデル事前学習]])
- Attachments: `wiki/sources/_attachments/genronbun-kara-tokiakasu-seisei-ai/`(168 点 = 図 149 + 表 18 + 付録図 1)。305 ページの書籍のため画像一括抽出はスキップし、キャプション座標クロップで全点を切り出した。本書は「図N.M|」の全角縦棒でキャプションが一意に判別でき、かつ**表はキャプションが本体の上、図はキャプションが本体の下**という組版規則が全ページで通用したため、1 パスで機械的に切り出せた。本文の図参照 grep(図 149 + 表 18 = 167 点)と切り出し結果の差分はゼロ。付録の図A.1 のみ番号形式が異なるため追加抽出した。埋め込み 168 点・欠落 0・未使用 attachment 0 を機械検証済み。除外図表なし。
- Key insight: 本書の価値は「原論文をどう読み解くか」という層にある。この vault には本書が扱う原論文の source ページが既に 12 本あるため(Attention Is All You Need・GPT-1〜4・InstructGPT・Kaplan のスケーリング則・Chain-of-Thought・DeepSeek-R1 / V3 / Math・Chatbot Arena・Humanity's Last Exam)、各章はそれらに重ねる読み解きの層として機能し、既存 concept の横断的知見を「原論文が何を書いたか」対「本書がそれをどう補い批判したか」という軸で積み増せた。具体例として、第 3 章は原論文 Table 1 の計算量比較が n≪d という仮定下でのみ自己注意優位を示すことを明示し、現代の長文脈設定では仮定が崩れることまで踏み込む。第 5 章は拡散過程と逆拡散過程が同じ関数形で表現できる根拠を Feller (1949) まで遡る。第 8 章は Chatbot Arena のランキングを支える Bradley-Terry モデルの最尤推定と信頼区間を数式レベルで扱い、原論文の記法の不正確さを自覚的に指摘する。いずれも原論文単体の source ページには無い情報である。
- 備考: 章検出の初回結果は第 8 章の範囲(PDF 271-305)に Appendix・参考文献・索引・奥付が混入していたため、`--chapters` で境界を補正して再分割した(第 8 章 = 271-288、Appendix = 289-294)。付録を source 化するかはユーザー確認のうえ 1 枚として取り込んだ。fan-out 中に別セッションが同じ vault で並行 ingest しており(論文 4 本 + 書籍 1 冊、コミット 5c96aa5144〜dd7b73d772)、共有 concept の [[スケーリング則]]・[[注意機構]] は相手のコミット(15:23)後に本書分を積み増した形になっている。相手のコミットへの本書分の巻き込みが無いことは `git show` で確認済み。
## [2026-08-15] ingest-paper | A Decentralized Root Cause Localization Approach for Edge Computing Environments
- Source: `.raw/papers/A_Decentralized_Root_Cause_Localization_Approach_for_Edge_Computing_Environments.pdf`(ローカルPDF、IEEE Transactions on Services Computing, Vol. 19, No. 2, March/April 2026、DOI: 10.1109/TSC.2026.3668228)
- Summary: [[@2026__TSC__A Decentralized Root Cause Localization Approach for Edge Computing Environments]]
- Pages created: source 1 件(上記)、entity 4 件([[Duneesha Fernando]], [[Maria A. Rodriguez]], [[Rajkumar Buyya]], [[MicroCERCL]])
- Pages updated: entity 1 件([[University of Melbourne]])、concept 3 件([[Fault Localization]], [[PageRank]], [[Edge Computing]])
- Attachments: `wiki/sources/_attachments/A_Decentralized_Root_Cause_Localization_Approach_for_Edge_Computing_Environments/`(図7点、Figure 1〜7 全て pdf.js 抽出の埋め込みラスター画像をそのまま採用。本文参照図表7点との差分ゼロを確認。装飾的な著者近影3点(image-014-001〜003)は本文参照が無いため除外。Table I〜IV はいずれも内容がシンプルなためMarkdown表へ転記)
- Key insight: 既存のRCL手法(唯一のエッジ向け先行研究MicroCERCL含む)はいずれも監視データを中央(クラウド)へ集約する中央集中型アーキテクチャであり、エッジへ適用すると転送遅延・通信オーバーヘッドが増大する。本論文は通信頻度・コロケーションを考慮したクラスタリングでマイクロサービスをグループ化し、各クラスタ内でエッジデバイス上のPersonalized PageRank (PPR)をローカル実行することで探索空間を縮小する分散RCLを提案した。MicroCERCLデータセット(383シナリオ)で中央集中ベースラインに対しAcc@1をHHで0.43→0.56・SHで0.50→0.61に改善しつつ、単一クラスタ伝播ケース(311/383件)で局所化時間を23〜34%削減、クラスタをまたぐ稀な伝播(72/383件)にはJXPアルゴリズムの改変版によるP2P近似処理で対応した(時間削減率2.77〜28.79%、精度は維持)。iAnomaly生成の大規模データセット(50〜2,500ノード)では適応的クラスタリングがグラフ規模によらずほぼ一定の局所化時間を保つのに対し、中央集中PPRは2,500ノードで約1.0秒まで増大した。既存concept [[Fault Localization]]にとって、これは「どこで計算するか(中央集中 vs 分散)」という粒度細分化とは直交する新しい探索空間削減の軸を提供する。既存concept [[PageRank]]にとっては、Personalized PageRankがFault Localizationの根本原因ランキングという第四の独立応用文脈で標準更新式をほぼそのまま再利用する事例、およびJXPアルゴリズム(P2P Web検索向け分散PageRank近似)のFault Localizationへの転用事例を追加した。
## [2026-08-15] ingest-paper | Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features
- Source: `.raw/papers/2026_Unknown_Performance_Alert_Triage_Time_Aware.pdf`(ローカルPDF、ICPE Companion '26、DOI: 10.1145/3777911.3800694)
- Summary: [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features]]
- Pages created: source 1 件(上記)、entity 2 件([[Adem Hmissa]], [[Gabriela Nicolescu]])
- Pages updated: entity 1 件([[Polytechnique Montréal]])、concept 2 件([[アラートランキング]], [[アラート集約]])
- Attachments: `wiki/sources/_attachments/2026_Unknown_Performance_Alert_Triage_Time_Aware/`(図2点。Figure 1〈パイプライン概要〉はベクター描画のためPyMuPDFでキャプション座標をテキストブロックから特定しクロップ、Figure 2〈特徴量重要度〉はpdf.js抽出の埋め込みラスター画像をそのまま採用。本文参照図表2点との差分ゼロを確認。装飾アイコン2点(image-003-001・002、CSVファイル・時系列データのアイコン)はFigure 1内に既に含まれるため除外。Table 1〜5はいずれも内容がシンプルなためMarkdown表へ転記)
- Key insight: Mozilla の性能アラートサマリがバグ報告と関連付けられるかを予測するタスクで、識別子・目的変数由来フィールドを除去し直近20%を将来テストとする厳密な時系列分割の下、構造化アラートメタデータ(94特徴量)+時間文脈(7特徴量)+短(pre=5,post=5)・中(pre=20,post=10)・長(pre=50,post=20)の3解像度で計算したマルチスケール時系列特徴量(40特徴量)を融合したCatBoostモデルが、テストAUPRC 0.851・P@50 0.920・R@200 0.941を達成した。fastTextテキスト埋め込みの追加は非テキスト構成を上回らず(AUPRC 0.831 vs 0.851)、構造化された時系列・メタデータシグナルが予測価値の大部分を提供することを実証した。既存 concept [[アラートランキング]]にとって、これは AlertRank(ISSRE2020)に続く教師あり ML 系統の第4のバリアントであり、リーク無し時間認識型評価という方法論上の新規性を提供する。既存 concept [[アラート集約]]にとっては、アラート集約が「OCE のノイズ削減」だけでなく「下流 ML の学習単位を作る前処理」という第4の目的を持ちうることを示す新規事例となった。
## [2026-08-15] ingest-paper | PRAXIS: Integrating Program Analysis with Observability for Root-Cause Analysis
- Source: `.raw/papers/arxiv-2512.22113.pdf`(arXiv 2512.22113、cs.DC、2025-12-26投稿、v3 2026-04-29、DSN 2026採録)
- Summary: [[@2026__DSN__PRAXIS - Integrating Program Analysis with Observability for Root-Cause Analysis]]
- Pages created: source 1 件(上記)、entity 1 件([[Rahul Krishna]])
- Pages updated: entity 3 件([[Shengkun Cui]], [[Saurabh Jha]], [[Ravishankar K. Iyer]])、concept 3 件([[コード知識強化RCA]], [[グラフベースRCA]], [[agentic SRE]])
- Attachments: `wiki/sources/_attachments/arxiv-2512.22113/`(図7点 = Figure 1〜7 全点。pdf.js抽出の埋め込みラスター画像28点は装飾アイコンのみで図として使用不可だったため、全図をPyMuPDFでキャプション座標をテキストブロックから特定しクロップ。本文参照図表7点との差分ゼロを確認、除外図表なし。Table Iのみ内容がシンプルなためMarkdown表へ転記)
- Key insight: PRAXISは、サービス依存グラフ(SDG)とhammock-blockプログラム依存グラフ(PDG)へのLLM駆動グラフトラバーサルにより、ITBench由来のReAct型SRE-Agentに対しRCR精度6.3倍・RCI精度3.4倍・トークン消費5.3倍削減を達成した。アブレーションでは、生コード(最大800k文字)を直接プロンプトに詰め込む変種がneedle-in-a-haystackとcontext rotで劣化する(RCR 32.7%)のに対し、PDG誘導トラバーサルへ置き換えるだけでRCRが61.5%まで改善することを示し、コード知識強化RCAにおいて「コードの表現形式(プレーンテキスト vs 構造化グラフ)」が独立した精度要因であることを定量的に実証した。既存 concept [[コード知識強化RCA]](COCAに続く第二の実装系統として更新)にとって、これはCOCAが未解決の問いとして残していた「コンテキストウィンドウ拡大で構造化は不要になるか」への実証的な反例(構造化そのものが精度に寄与する)を提供する。
## [2026-08-15] ingest-paper | The Anatomy of Silent Data Corruption: GPU Error Pattern Study and Modeling Guidance
- Source: `.raw/papers/arxiv-2605.04213.pdf`(arXiv 2605.04213、cs.AR、2026-05-05投稿)
- Summary: [[@2026__arXiv__The Anatomy of Silent Data Corruption - GPU Error Pattern Study and Modeling Guidance]]
- Pages created: source 1 件(上記)、entity 9 件([[Chung-Hsuan Tung]], [[Yanxiang Huang]], [[Nirmal Saxena]], [[Philip Shirvani]], [[Saurabh Hukerikar]], [[Twinkle Jain]], [[Abhishek Tyagi]], [[Sanjay Gongalore]], [[University of Rochester]])
- Pages updated: entity 2 件([[Duke University]], [[NVIDIA]])、concept 1 件([[Silent Data Corruption (SDC)検知]])
- Attachments: `wiki/sources/_attachments/arxiv-2605.04213/`(図8点 = Figure 1〜8 全点。全図がベクター描画で埋め込みラスター画像は0点だったため、PyMuPDFでキャプション座標をテキストブロックから特定しクロップ。本文参照図表8点との差分ゼロを確認、除外図表なし)
- Key insight: production-classデータセンターGPUに対する300万シミュレータ時間規模のゲートレベルstuck-at故障注入(63 CUDAマイクロベンチマーク)により、SDC結果のうちNaN/±INFはわずか1.01%(nullificationが50.68%で50倍以上支配的)、単一ビット反転は非特殊破損の40%未満、破損アドレスはwarpサイズ(W=32)を法とした空間周期性を示すことを定量化した。この根本原因の定量化は、既存の[[Silent Data Corruption (SDC)検知]]概念が集約するAEGIS/SDCHunterの本番観測(チェックサムベース検知の限界・合成テストの見逃し率)を、ゲートレベルという独立した手法から裏付ける。
## [2026-08-15] ingest-book | ディープラーニングを支える技術
- Source: `.raw/books/deep-learning-wo-sasaeru-gijutsu/`(6 章 / 入力: pdf。岡野原大輔『ディープラーニングを支える技術 ——「正解」を導くメカニズム[技術基礎]』技術評論社、2022 年 1 月 21 日、305 ページ)
- Book entity: [[wiki/entities/ディープラーニングを支える技術|ディープラーニングを支える技術]]
- Chapters: [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 1 ディープラーニングと人工知能]]〜a[@2022__Gihyo__ディープラーニングを支える技術 - Appendix A [厳選基礎]機械学習&ディープラーニングのための数学]](6 件)
- Pages created: source 6 件(上記)、entity 20 件([[BERT]], [[Big Bird]], [[Chainer]], [[Daniel Kahneman]], [[David Marr]], [[DenseNet]], [[Frank Rosenblatt]], [[GoogleNet]], [[John McCarthy]], [[LAS]], [[Marvin Minsky]], [[Mask R-CNN]], [[Michael Polanyi]], [[SENet]], [[Tesla]], [[U-Net]], [[VGGNet]], [[wiki/entities/ディープラーニングを支える技術|ディープラーニングを支える技術]], [[岡野原大輔]], [[甘利俊一]])、concept 17 件([[ポランニーのパラドックス]], [[勾配降下法]], [[学習問題設定の分類]], [[強化学習]], [[損失関数]], [[教師あり学習]], [[教師なし学習]], [[最尤推定]], [[正則化]], [[正規化層]], [[汎化能力]], [[物体検出]], [[画像セグメンテーション]], [[自己教師あり学習]], [[表現学習]], [[記号接地問題]], [[音声認識]])
- Pages updated: entity 14 件([[Apple]], [[DeepMind]], [[Facebook]], [[Fei-Fei Li]], [[GPT-2]], [[GPT-3]], [[Geoffrey Hinton]], [[ImageNet]], [[OpenAI]], [[Preferred Networks]], [[ResNet]], [[Shane Legg]], [[Yann LeCun]], [[Yoshua Bengio]])、concept 34 件([[AlexNet]], [[LSTM]], [[PAC学習]], [[RNN]], [[アテンションヘッド]], [[カバリングナンバー]], [[クラスタリング]], [[スケーリング則]], [[スパース注意]], [[ベイズ推定]], [[ムーアの法則とデナードスケーリングの終焉]], [[メモリ拡張ニューラルネットワーク]], [[主成分分析]], [[交差検証]], [[凸最適化]], [[固有値分解]], [[暗黙的正則化]], [[最小記述長原理]], [[最近傍法]], [[次元の呪い]], [[残差学習]], [[汎化誤差バウンド]], [[注意機構]], [[深層学習の汎化]], [[特異値分解]], [[独立成分分析]], [[畳み込みニューラルネットワーク]], [[経験リスク最小化]], [[統計的機械学習]], [[線形写像と変換行列]], [[線形注意]], [[自動微分]], [[言語モデル事前学習]], [[誤差逆伝播法]])
- Attachments: `wiki/sources/_attachments/deep-learning-wo-sasaeru-gijutsu/`(図表 118 点 = 本文図 107 + 章扉図 5 + Column 図 3 + 表 3。全図がベクター描画のため、キャプションのフォント判別 + 直下の描画要素連結という規則で 1 パス切り出し。本文の図参照 grep との差分ゼロを確認)
- 備考: 章 source 6 枚はいずれも `publish: false`(著作権コンテンツ)。取り込み中に既存 concept [[AlexNet]] と重複する entity が作られたため、既存 concept 側へ統合して entity を取り消した。並行 subagent 間で [[表現学習]] の上書きが 1 件発生したが検出して復元済み。
- Key insight: 本書は個別手法のカタログではなく「なぜそれが効くのか」を説明の中心に据える。ReLU 等の活性化関数・スキップ接続・正規化手法を「学習の三大発明」として括り、正規化が効く理由を(1)非線形性を保ち表現力を維持する、(2)学習を高速化・安定化する、(3)大きな学習率を許してフラットな解へ導く、という 3 つに分解して示す。[[注意機構]] は Transformer の部品としてではなく「入力に応じてデータの流れ方を動的に変える仕組み」という一般的な枠組みとして扱われ、記憶の 3 つの時間スケール(活性値・重み・注意による読み出し)の中に位置づけられる。wiki の側から見ると、本書は論文由来の既存 concept 群に**教科書側の視点**を与える横串のソースとして働いた。同じ対象について、論文が「その時点の制約への対処」として書いたことを教科書は「後年の一般的手法の起点」として読み直す——[[AlexNet]] の GPU 分割が原論文では 3GB メモリ制約への工夫として、本書ではモデル並列の初期例として説明されるのがその例である。この非対称を複数の concept の横断的知見に記録した。
## [2026-08-15] ingest-paper | SDCs in the Wild: Characterizing and Diagnosing SDC-defective GPUs in Production LLM Training
- Source: `.raw/papers/osdi26-zheng.pdf`(USENIX OSDI 2026 掲載論文。著者 Wenxin Zheng ほか、Shanghai Jiao Tong University / ByteDance Seed)
- Summary: [[@2026__OSDI__SDCs in the Wild - Characterizing and Diagnosing SDC-defective GPUs in Production LLM Training]]
- Pages created: source 1 件(上記)、entity 2 件([[Wenxin Zheng]], [[Jinyu Gu]])
- Pages updated: entity 8 件([[Yun Zhang]], [[Mingcong Han]], [[Xingda Wei]], [[Haibo Chen]], [[Wencong Xiao]], [[Xin Liu]], [[ByteDance Seed]], [[Shanghai Jiao Tong University]])、concept 3 件([[Silent Data Corruption (SDC)検知]], [[GPUレジリエンス]], [[耐障害LLM訓練]])
- Attachments: `wiki/sources/_attachments/osdi26-zheng/`(図14点、本文参照図の全件。Figure 2・3はコードスニペットのためMarkdownコードブロックとして転記。埋め込みラスター画像は0枚〔全図がベクター描画〕のため、全図をPyMuPDFのキャプション座標クロップで取得)
- Key insight: 標準的な合成マイクロベンチマークがSDC欠陥GPUの60%超を見逃すという実証に基づき、SDCHunterは本番ワークロード・入力データそのものでの決定論的リプレイへ診断戦略を転換した。同じOSDI 2026のAEGIS(オンライン検知)とは著者6名が重複し§8で明示的に相互参照する相補関係にあり、両論文は独立に「SDCは恒久的なハードウェア劣化」「軽量トリガー+高コスト確定検証の2段階アーキテクチャ」「MoE/EP融合カーネルの盲点」という同じ結論に到達した。ByteDance本番環境で40件のSDCインシデントを緩和し、検出カバレッジ・局在化精度いずれも100%、オーバーヘッド4%未満を達成。
## [2026-08-15] ingest-paper | AIDA: Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning
- Source: `.raw/papers/2026_Unknown_AIDA_Accelerating_Root_Cause_Multi.pdf`(ACM SIGCOMM 2026 掲載論文、DOI 10.1145/3789240.3829126。著者 Haoran Xu ほか、Sun Yat-sen University / Alibaba Cloud)
- Summary: [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]]
- Pages created: source 1 件(上記)、entity 8 件([[Haoran Xu]], [[Xuan Zeng]], [[Xumiao Zhang]], [[Xiaoxi Zhang]], [[Yang Lv]], [[Peng Zhang]], [[Deke Guo]], [[AIDA]])
- Pages updated: entity 3 件([[Ennan Zhai]], [[Alibaba Cloud]], [[Sun Yat-sen University]])、concept 4 件([[LLMによる根本原因分析]], [[グラフベースRCA]], [[RAGノイズ除去]], [[ドメイン別RCA]])
- Attachments: `wiki/sources/_attachments/2026_Unknown_AIDA_Accelerating_Root_Cause_Multi/`(図表26点、本文参照分の全件。Appendix限定のFigure 26・27〔2点〕は本文参照なしのため除外。pdf.js埋め込み画像抽出が特定ページで無限停止するスクリプトのバグに遭遇したため使用せず、全図をPyMuPDFのキャプション座標クロップで取得)
- Key insight: ナイーブRAGのデータ冗長性とGraphRAG系汎用KGの相関/因果混同という2つの既知の限界に対し、RLファインチューニング済みLLMによる因果整合的な推論チェーン抽出とSimRankベースの構造考慮ノード統合で、検索時でなくインデックス構築段でノイズを解消した。6種のバックボーンLLM横断評価で8BモデルのAIDAが72BモデルのLightRAGを上回り、モデル規模よりアーキテクチャ設計が精度を律速するという知見をネットワーク機器RCAという新ドメインで再確認した。846件の本番ケースでPrecision 95.4%・TRCA中央値72.6時間→1.6分を達成。
## [2026-08-15] ingest-paper | Rethinking Cloud Optimization: Volatility-Driven for Better Outcomes
- Source: `.raw/papers/3789240.3829141.pdf`(ACM SIGCOMM 2026 掲載論文。著者 Baoqing Wang ほか、University of Science and Technology of China / Tencent Cloud)
- Summary: [[@2026__SIGCOMM__Rethinking Cloud Optimization - Volatility-Driven for Better Outcomes]]
- Pages created: source 1 件(上記)、entity 13 件([[Hestia]], [[Baoqing Wang]], [[Gongming Zhao]], [[Hongli Xu]], [[Shibo Wu]], [[Zhuolong Yu]], [[Jiawei Liu]], [[Junhong Lu]], [[Shaohui Xu]], [[Fanjie Meng]], [[Alibaba-trace-v2018]], [[Alibaba-trace-v2022]], [[Tencent-trace-v2025]])、concept 1 件([[クラウドオーバーサブスクリプション]])
- Pages updated: entity 4 件([[Alibaba Group]], [[Tencent]], [[University of Science and Technology of China]], [[Kubernetes]])
- Attachments: `wiki/sources/_attachments/3789240.3829141/`(図 19 点、本文参照図の全件。埋め込みラスター画像69枚は全て曲線・凡例・ヒートマップセルの断片で使用不可のため、全図を PyMuPDF のキャプション座標クロップで取得)
- Key insight: 個々のワークロードの時間的揮発性は変えられないが、時間的に相補的なワークロードを空間的に集約すれば集約後の揮発性を緩和できるという観察から、平均基準のCVに代わり最大値基準のMCV(Maximum-based Coefficient of Variation)を理論的上下界付きで新設した。Classifier(周期性検知)除去はSLA違反率悪化、Aggregator(集約)除去は利益大幅減少と、モジュールごとに異なる指標への非対称な寄与をアブレーションで明確に切り分けている。
## [2026-08-15] ingest-paper | Safeguarding LLM Training at Scale: Online SDC Detection and Insights from 35 Million GPU Hours
- Source: `.raw/papers/osdi26-lei.pdf`(USENIX OSDI '26 掲載論文。著者 Kinman Lei ほか、Tsinghua University / ByteDance)
- Summary: [[@2026__OSDI__Safeguarding LLM Training at Scale - Online SDC Detection and Insights from 35 Million GPU Hours]]
- Pages created: source 1 件(上記)、concept 1 件([[Silent Data Corruption (SDC)検知]])
- Pages updated: entity 4 件([[ByteDance]], [[Tsinghua University]], [[Megatron-LM]], [[Xin Liu]])、concept 2 件([[GPUレジリエンス]], [[耐障害LLM訓練]])
- Attachments: `wiki/sources/_attachments/osdi26-lei/`(図 17 点、本文参照図の全件。埋め込みラスター画像は断片・使用不可のため全図を PyMuPDF のキャプション座標クロップで取得)
- Key insight: 低精度(bfloat16)訓練でチェックサム検知が丸め誤差ノイズに埋もれる問題を、Tensor Core 内部の float32 アキュムレータを利用して解決し、既知故障8台の再現実験でオフライン診断(2/8)を上回るオンライン検知(8/8)を実現した。SDC はオフライン診断の"通過"を裏切る障害クラスであり、[[GPUレジリエンス]] が特徴づける信頼性の床の設計が想定しない領域を形成する。
## [2026-08-15] ingest-book | SREエンタープライズロードマップ
- Source: `.raw/books/enterprise-roadmap-to-sre-ja/`(6 章 / 入力: pdf、64 ページ。James Brookbank・Steve McGhee 著、山口 能迪 訳、Copyright © 2022 Google Japan G.K.。原書 *Enterprise Roadmap to SRE*(O'Reilly Media 2022、ISBN 9781098117733)。O'Reilly と Google の協業によるテクニカルレポート)
- Book entity: [[SREエンタープライズロードマップ]]
- Chapters: [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 1 エンタープライズSREことはじめ]]〜[[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 6 Googleを超えて]](6 件)
- Pages created: 上記 6 章 source、book entity [[SREエンタープライズロードマップ]]、person entity [[James Brookbank]]・[[山口 能迪]]・[[Kip Primous]]・[[Randall Lee]]、organization entity [[The Home Depot]]、concept 1 件([[成長の3つの地平線]])
- Pages updated: entity 3 件([[Google]], [[Joseph Bironas]], [[Steve McGhee]])、concept 18 件([[DORA]], [[DevOps]], [[SLO目標値の選定]], [[SRE]], [[SREの心構え]], [[SREエンゲージメントモデル]], [[SRE文化]], [[SRE組織変革]], [[エラーバジェット]], [[カーゴカルトSRE]], [[グッドハートの法則]], [[サービスレベル目標]], [[ソフトウェア複雑性]], [[トイル]], [[プラットフォームエンジニアリング]], [[信頼性スタック]], [[心理的安全性]], [[組織の信頼性マインドセット]])
- Attachments: `wiki/sources/_attachments/enterprise-roadmap-to-sre-ja/`(図 4 点、本文参照図の全件)
- Key insight: 本レポートは、SRE Book と SRE Workbook が体系化した Google 内部の実践に対し、その外側にある大企業が既存の組織・フレームワーク・制約を抱えたまま SRE をどう導入するかという**接続層**に紙幅を割く。特徴は 3 つある。(1) 変革が必ず通る J カーブの谷(DORA 2018 State of DevOps Report)を明示し、自動化がテスト要件を増やして技術的負債と手動統制を招く谷の内部構造を示したうえで、そこで努力を放棄しないための処方(ルーフショットとムーンショットの併用、四半期ごとの進捗確認)を与える。(2) 組織変革では変更の影響の大きさより**可逆性**を優先せよという原則を置き、SRE 採用の旅をフェイルセーフにする環境作りとして定式化する。(3) 第 4 章が処方する「独立した SRE 組織」と、第 6 章ヘルスケア事例が示す「SRE が IT コストセンターに吸収され“なんでも屋エンジニアリング”になる」現実との緊張が、同一書籍の中で処方と検証の関係を作っている。
- 備考: 章ごとに Sonnet 5 subagent へ委譲し、オーケストレータは章分割・図の切り出し・共通ブリーフィング・機械的検証・索引更新を担当した。ハブ concept の競合を避けるため第 3 章は第 2 章の完了後に投入し、以降ローリングで 3 体並行を維持した。第 6 章で作成された entity `Commodore "Kip" Primous` はファイル名のダブルクォートが git/シェル処理を壊したため [[Kip Primous]] にリネームし、原名は aliases と本文に保持した。序文とまとめは章に含まれないため book entity へ織り込んだ。
## [2026-08-14] ingest-book | Mathematics for Machine Learning
- Source: `.raw/books/mathematics-for-machine-learning/`(12 章 / 入力: pdf、417 ページ。Marc Peter Deisenroth・A. Aldo Faisal・Cheng Soon Ong 著、Cambridge University Press 2020、https://mml-book.com 、本 PDF は 2021-07-29 付けの無償公開ドラフト)
- Book entity: [[Mathematics for Machine Learning]]
- Chapters: [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 1 Introduction and Motivation]]〜[[@2020__Cambridge__Mathematics for Machine Learning - Chapter 12 Classification with Support Vector Machines]](12 件)
- Pages created: 上記 12 章 source、book entity [[Mathematics for Machine Learning]]、person entity [[Marc Peter Deisenroth]]・[[A. Aldo Faisal]]・[[Cheng Soon Ong]]、concept 12 件([[線形写像と変換行列]], [[直交射影]], [[固有値分解]], [[特異値分解]], [[自動微分]], [[ガウス分布の閉性]], [[共役事前分布]], [[凸最適化]], [[経験リスク最小化]], [[有向グラフィカルモデル]], [[ベイズ線形回帰]], [[混合ガウスモデル]])
- Pages updated: concept 11 件([[主成分分析]], [[サポートベクターマシン]], [[カーネル法]], [[EMアルゴリズム]], [[カーネル密度推定]], [[ベイズ推定]], [[誤差逆伝播法]], [[交差検証]], [[汎化誤差バウンド]], [[統計的機械学習]], [[無向グラフィカルモデル]])
- Attachments: `wiki/sources/_attachments/mathematics-for-machine-learning/`(図 143 点、本文参照図の全件)
- Key insight: 本書は同じ対象を複数の独立した経路から導出して同一の解に到達することを見せる構成を一貫して採り(主成分分析の 3 観点、サポートベクターマシンの 2 観点、責任度の 2 経路)、そのおかげで章をまたぐ概念の接続が式レベルで確認できる。第 3 章の直交射影は第 9 章では「部分空間が与えられ座標を求める」問題として、第 10 章では「部分空間そのものを最適化する」問題として現れる。既存 wiki が [[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]] 由来の応用側記述で持っていた手法群に対し、本書は数学的導出の側を供給し、応用/基礎の非対称な補完関係が 4 つの concept(主成分分析・サポートベクターマシン・カーネル法・EM アルゴリズム)で同時に成立した。
- 備考: 章ごとに Sonnet 5 subagent へ委譲し、オーケストレータは章分割・図の切り出し・共通ブリーフィング・索引更新を担当した。図はキャプションが傍注に組まれる体裁のため、傍注キャプションとベクター描画クラスタを PyMuPDF で対応づける規則を作って一括切り出しした(143 点中 137 点が規則で取れ、残り 6 点は座標を手指定)。
## [2026-08-15] ingest-paper | AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection
- Source: `.raw/papers/arxiv-2608.06790.pdf`(13 ページ。arXiv:2608.06790、2026-08-07 投稿、41st IEEE/ACM ASE 2026 採択(受理 2026-03-26、採択 2026-06-18)、Sun Yat-sen University / Singapore Management University / Monash University、著者 Gou Tan・Zhensu Sun・Jieke Shi・Ting Zhang・Zilong He・Qingfu Wu・Shuai Liang・Weifeng Sun・Junda He・Pengfei Chen・Chuanfu Zhang・Lwin Khin Shar・David Lo)
- Summary: [[@2026__ASE__AgentChaos - Chaos Engineering for Agent Systems via Programmatic Fault Injection]]
- Pages created: 上記 source、[[Zhensu Sun]]・[[Jieke Shi]]・[[Ting Zhang]]・[[Qingfu Wu]]・[[Weifeng Sun]]・[[Junda He]]・[[Lwin Khin Shar]]・[[Monash University]](entity 8 件)
- Pages updated: [[障害注入]]・[[カオスエンジニアリング]]・[[エージェントシステム運用]](concept 3 件)、[[Gou Tan]]・[[Pengfei Chen]]・[[Zilong He]]・[[Chuanfu Zhang]]・[[Shuai Liang]]・[[David Lo]]・[[Sun Yat-sen University]]・[[Singapore Management University]]・[[China Unicom Software Research Institute]](entity 9 件)
- Attachments: `wiki/sources/_attachments/arxiv-2608.06790/`(図 3 点 Figure 1・3・4、表 3 点 Table 3・4・7 の画像クロップ)
- Key insight: 全エージェントシステムが同一のHTTPインターフェースでLLMにアクセスする点を利用し、ソースコード変更なしにHTTP層で非侵入的に障害を注入するカオスエンジニアリングフレームワーク。5エージェントシステムはいずれもLLM API障害下でpass@1が最大約50ポイント低下し、劣化順位は4種のバックボーンLLMを跨いで一貫していた(頑健性はモデル能力でなくシステム実装に依存)。「最も深刻に見える障害が最も有害とは限らない」「最も有害な障害(omission)が最も診断しづらい」という二重の逆説を定量化した。
## [2026-08-15] ingest-paper | Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time Series
- Source: `.raw/papers/arxiv-2401.03955.pdf`(32 ページ。arXiv:2401.03955、2024-01-08 投稿・v8 2024-11-07、NeurIPS 2024 採択、IBM Research、著者 Vijay Ekambaram・Arindam Jati・Pankaj Dayama・Sumanta Mukherjee・Nam H. Nguyen・Wesley M. Gifford・Chandra Reddy・Jayant Kalagnanam)
- Summary: [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]]
- Pages created: 上記 source、product entity [[Tiny Time Mixers (TTM)]]
- Pages updated: [[時系列基盤モデル]]・[[多変量時系列予測]](concept 2 件)、[[IBM Research]](entity 1 件)
- Attachments: `wiki/sources/_attachments/arxiv-2401.03955/`(図 7 点、Figure 1〜7 全図)
- Key insight: TTMは1Mパラメータから始まる超軽量な時系列基盤モデルで、軽量TSMixerバックボーンにadaptive patching・diverse resolution sampling・resolution prefix tuningを組み込み、311MパラメータのMoirai_Lや200MパラメータのTimesFMをゼロショット予測で上回った。Toto 2.0のスケーリング則確立(2026年)より約1年半早く「小型化で勝つ」路線を確立しており、同じ著者陣による2026年のTSPulseはこの路線の延長であることが判明した。multi-level modeling(事前学習ではチャネル独立backboneを凍結、fine-tuning時のみdecoderのチャネル混合を有効化)は、他の主要TSFMが事前学習段階から変量間相互作用を組み込むのと対照的な最小主義的アプローチを示す。
## [2026-08-15] ingest-paper | TS-Arena -- A Live Forecast Pre-Registration Platform
- Source: `.raw/papers/arxiv-2512.20761.pdf`(17 ページ。arXiv:2512.20761、2025-12-23 投稿・2026-04-24 改訂、KDD '26 採録、Paderborn University Data Analytics Group、著者 Marcel Meyer・Sascha Kaltenpoth・Henrik Albers・Kevin Zalipski・Oliver Müller)
- Summary: [[@2026__arXiv__TS-Arena - A Live Forecast Pre-Registration Platform]]
- Pages created: 上記 source、[[Marcel Meyer]]・[[Oliver Müller]]・[[Sascha Kaltenpoth]]・[[Henrik Albers]]・[[Kevin Zalipski]]・[[Paderborn University]](entity 6 件)、product entity [[TS-Arena]]、concept [[予測事前登録プロトコル]]
- Pages updated: [[時系列基盤モデル]]・[[ベンチマーキング]](concept 2 件)、[[Chronos-2]]・[[TiRex]]・[[Sundial]]・[[TimesFM]]・[[TimescaleDB]](entity 5 件)
- Attachments: `wiki/sources/_attachments/arxiv-2512.20761/`(図 7 点、Figure 1〜7 全図)
- Key insight: 正解データが物理的に存在する前に予測提出を強制する予測事前登録プロトコル(FPRP)により、直接的・間接的情報漏洩を設計上不可能にするライブ時系列予測ベンチマーク。2025年通年のバックテストでは、静的ベンチマークSOTAのSundialがELO中位にとどまる一方Chronos-2・TiRexが上位を占め、静的ベンチマークとライブ評価で順位が乖離しうることを示した最初の実証例となった。
## [2026-08-15] ingest-paper | In-Context Fine-Tuning for Time-Series Foundation Models
- Source: `.raw/papers/arxiv-2410.24087.pdf`(24 ページ。arXiv:2410.24087、2024-10-31 投稿、Google Research、著者 Abhimanyu Das・Matthew Faw・Rajat Sen・Yichen Zhou)
- Summary: [[@2024__arXiv__In-Context Fine-Tuning for Time-Series Foundation Models]]
- Pages created: 上記 source、[[Matthew Faw]](entity 1 件)
- Pages updated: [[文脈内学習]]・[[時系列基盤モデル]](concept 2 件)、[[Abhimanyu Das]]・[[Rajat Sen]]・[[Yichen Zhou]]・[[TimesFM]](entity 4 件)
- Attachments: `wiki/sources/_attachments/arxiv-2410.24087/`(図 8 点、Figure 1〜8 全図)
- Key insight: [[TimesFM]] を継続事前学習し、推論時にコンテキストウィンドウへ対象ドメインの関連時系列例示を separator トークンで区切って追加するだけで、勾配更新なしにドメイン適応相当の精度改善を得る「文脈内ファインチューニング」を提案。この手法は per-dataset の全重み更新ファインチューニングすら上回り(Monash で約3%改善)、著者らは小規模データセットでのファインチューニングが引き起こす破滅的忘却がこの逆転の一因と推察している。同じコンテキスト長を単純な履歴長拡張に使うより文脈内例示に振り分ける方が効果的であることも示した。
## [2026-08-15] query-deep | 時系列基盤モデルの教科書
- Question: 時系列基盤モデルの教科書を作成してください。
- Answer: [[時系列基盤モデルの教科書]](`wiki/questions/`、address c-002779、14 章+付録 A)
- Pages updated: `wiki/index.md`(Questions へ 1 エントリ追加)
- 使用ソース: TSFM 関連 source 35 本超 + concept 6 件([[時系列基盤モデル]]・[[時系列トークナイゼーション]]・[[多変量時系列予測]]・[[LLM時系列アプローチ]]・[[時系列推論]]・[[エージェント型時系列予測]])+ 既存 question 3 件([[LM-vs-TSFM-decoder-only-差異]]・[[TSFM-TSMLLM-TotoQwen3VL-比較と基礎]]・[[分位点損失と区間予測]])
- Key insight: wiki の蓄積を時系列順でなく設計軸(トークン化 → アーキテクチャ → データ → 目的関数 → 多変量 → スケーリング)で再編成すると、TSFM の進化は「LLM 転用の失敗(重み転移は効かない)→ 専用事前学習の確立 → 分位点損失への収斂 → スケーリング則の実証 → エージェント層によるツール化」という一本の物語に整理できる。予測タスクでのスケーリング則確立(Toto 2.0)と予測以外のタスクでの優位未確立(k-Shape・ICPE)の対比が 2026 年時点の最重要の緊張関係。
- 備考: 並列サブエージェント 4 系統(初期モデル群/スケーリング期モデル群/concept・question 要約/評価・批判・応用)で素材収集後にメイン文脈で統合。UniTok の source ページはファイル名がサンドボックスの読み取り拒否パターンに一致したため、ユーザー指示を受けて `.git` オブジェクトストア経由(`git show HEAD:<path>`)で全文取得し、§2.1・§8.1・§8.2 の UniTok 記述を一次情報で更新済み。
## [2026-08-15] ingest-paper | Sundial: A Family of Highly Capable Time Series Foundation Models
- Source: `.raw/papers/liu25be.pdf`(23 ページ。arXiv:2502.00816、ICML 2025 掲載、PMLR 267、Tsinghua University THUML、著者 Yong Liu・Guo Qin ほか)
- Summary: [[@2025__ICML__Sundial - A Family of Highly Capable Time Series Foundation Models]]
- Pages created: 上記 source、[[Mingsheng Long]]・[[Jianmin Wang]](entity 2 件)、product entity [[Sundial]]、concept [[Flow Matching]]
- Pages updated: [[時系列基盤モデル]]・[[時系列トークナイゼーション]](concept 2 件)、[[Yong Liu]]・[[Guo Qin]]・[[Xiangdong Huang]]・[[Tsinghua University]](entity 4 件)
- Attachments: `wiki/sources/_attachments/liu25be/`(図 12 点、Figure 1〜11・14)
- Key insight: TimeFlow Loss は flow-matching を自己回帰的な時系列予測に適用した生成的訓練目的関数で、離散トークン化(Chronos)・パラメトリック密度(Moirai/Toto)のいずれにも依存せず確率的予測を実現する。同一バックボーン・同一事前学習規模のアブレーションで MSE 損失・拡散損失を一貫して上回り、mode collapse を緩和することを実証した。著者陣は Timer-XL(2026-08-14 ingest)と同じ Tsinghua 研究室であり、同じ decoder-only 骨格の上に「長コンテキスト汎化」(Timer-XL)と「生成的確率予測」(Sundial)という独立した改善軸を追っている。
## [2026-08-14] ingest-paper | Timer-XL: Long-Context Transformers for Unified Time Series Forecasting
- Source: `.raw/papers/arxiv-2410.04803.pdf`(25 ページ。arXiv:2410.04803、ICLR 2025 掲載、Tsinghua University、著者 Yong Liu ほか)
- Summary: [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]]
- Pages created: 上記 source、[[Yong Liu]]・[[Guo Qin]]・[[Xiangdong Huang]]・[[Jianmin Wang]]・[[Mingsheng Long]](entity 5 件)
- Pages updated: [[多変量時系列予測]]・[[時系列基盤モデル]](concept 2 件)、[[Tsinghua University]](entity 1 件)
- Attachments: `wiki/sources/_attachments/arxiv-2410.04803/`(図 12 点、Figure 1〜12 全図)
- Key insight: TimeAttentionは変量依存グラフ$C$と時間的因果マスク$\mathcal{T}$のクロネッカー積$C \otimes \mathcal{T}$でトークン間依存を厳密に分解し、単変量・多変量・共変量付き予測を単一のdecoder-only Transformerで統一する。encoder-only(UniTST)が長コンテキストで性能劣化する一方decoder-onlyがこれを緩和する現象を注意可視化まで踏み込んで実証し、本 wiki が並列的に観察してきた「decoder-only(Toto)対 encoder-only(Falcon-X)」というアーキテクチャの分岐に、causality維持という初めての機序的説明を与えた。
## [2026-08-14] ingest-paper | Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts
- Source: `.raw/papers/arxiv-2410.10469.pdf`(20 ページ。arXiv:2410.10469、Salesforce AI Research ほか、著者 Xu Liu ほか)
- Summary: [[@2024__arXiv__Moirai-MoE - Empowering Time Series Foundation Models with Sparse Mixture of Experts]]
- Pages created: 上記 source、[[Xu Liu]]・[[Juncheng Liu]]・[[Taha Aksu]]・[[Yuxuan Liang]]・[[Roger Zimmermann]]・[[Silvio Savarese]]・[[Caiming Xiong]](entity 7 件)
- Pages updated: [[時系列基盤モデル]]・[[Mixture-of-Experts]](concept 2 件)、[[Chenghao Liu]]・[[Doyen Sahoo]]・[[Gerald Woo]](entity 3 件)
- Attachments: `wiki/sources/_attachments/arxiv-2410.10469/`(図 9 点。Figure 10・12 は Figure 11 とほぼ同一構図の反復のため代表 1 点のみ採用し省略)
- Key insight: Moirai の周波数レベル specialization を批判し、単一射影層 + MoE でトークンレベルの自動 specialization を実現。事前学習済み表現のクラスタ重心でゲーティングする Token Clusters 手法が、LLM MoE のゲーティング系譜(バイアス動的調整・シグモイド等、いずれもゲートを学習で調整する)に対し「ゲートを学習せず既存表現を流用する」という異質な設計を加えることを [[Mixture-of-Experts]] に接続した。モデル分析は、MoE のエキスパート割り当て可視化を通じて TSFM が深い層で頻度非依存表現を獲得する過程を初めて直接観測した。
## [2026-08-14] ingest-book | Incident Metrics in SRE(再取り込み)
- Source: `.raw/books/incident-metrics-in-sre/`(1 章 / 入力: fragment。36 ページ、本文 29 ページ。既存 `.raw/papers/IncidentMeticsInSre.pdf` と md5 一致)
- Book entity: [[wiki/entities/Incident Metrics in SRE|Incident Metrics in SRE]]
- Chapters: [[@2021__OReilly__Incident Metrics in SRE]](1 件。全 1 章のため分割せず)
- Pages created: [[wiki/entities/Incident Metrics in SRE|Incident Metrics in SRE]](entity 1 件)
- Pages updated: [[@2021__OReilly__Incident Metrics in SRE]](全面改稿)・[[@2025__SRE Kaigi 2025__インシデントキーメトリクスによるインシデント対応の改善]](contradiction 追記)・[[Štěpán Davidovič]]・[[インシデントメトリクス]]・[[TTXメトリクス]]・[[統計的有意性]]
- Attachments: `wiki/sources/_attachments/incident-metrics-in-sre/`(図 10 点)。旧 `_attachments/IncidentMeticsInSre/`(5 点)は削除。
- Key insight: MTTx 批判の一次統計文献を書籍規約で取り直した。旧版が拾えていなかった 3 点を回収した。(1) 代替統計(中央値・95 パーセンタイル・幾何平均・合計継続時間)を系統的に潰す節があるため、批判は「算術平均への批判」ではなく「低頻度・高分散データにおける集計統計一般への批判」として成立する。(2) 処方箋は代替指標ではなく「採用前に自分のデータでシミュレーションして検出力を確かめる」という手続きであり、Datadog の測定カテゴリ表・Hidalgo のエラーバジェットとは層が違う。(3) MTTx が機能する例外条件(Backblaze の HDD 統計のような大量・低分散、継続時間が従来の 20% になる劇的な変化)を明示した唯一のソースである。あわせて、SRE Kaigi 2025 発表経由で vault に入っていた「49%・50%・64% = MTTR が 10% 以上改善される比率」が一次ソースでは「15 分以上の改善(絶対変化)の確率」であること、「Google の内部データ数万件規模」に一次ソースの根拠がないことを訂正した。
## [2026-08-14] ingest-paper | MOMENT: A Family of Open Time-series Foundation Models
- Source: `.raw/papers/arxiv-2402.03885.pdf`(38 ページ。arXiv:2402.03885、ICML 2024 掲載、著者 Mononito Goswami ほか)
- Summary: [[@2024__ICML__MOMENT - A Family of Open Time-series Foundation Models]]
- Pages created: 上記 source、[[Auton Lab]]・[[MOMENT]]・[[Time Series Pile]]・[[Konrad Szafer]]・[[Arjun Choudhry]]・[[Yifu Cai]]・[[Shuo Li]]・[[Artur Dubrawski]](entity 8 件)
- Pages updated: [[Mononito Goswami]]・[[Carnegie Mellon University]]・[[University of Pennsylvania]](entity 3 件)、[[時系列基盤モデル]]・[[時系列異常検知ベンチマーク]](concept 2 件)
- Key insight: マスク時系列モデリング(パッチをランダムマスクし学習可能な[MASK]埋め込みで置換して再構成するMSE目的関数)による事前学習だけで、単一のTransformerが長期予測・短期予測・分類・異常検知・補完の5タスクをゼロショット/線形プロービングで解けることを示し、13ドメイン・約13M系列の公開時系列統合コーパスTime Series Pileを新規構築・公開した。ランダム初期化がFlan-T5重み初期化より低い訓練損失に収束するという知見はChronosの「LLM初期化に有意差なし」を異なるアーキテクチャで追試・補強し、凍結した自己注意・feed-forward層でも画像・テキストのクロスモーダル系列分類でGPT-2・Flan-T5と同等の精度を達成した。一方でreversible instance normalizationに起因し垂直シフトされた時系列を区別できないという明示的な限界を持つ。
## [2026-08-14] ingest-video | SLOconf 2021: SLO Math
- Source: `https://www.youtube.com/watch?v=-lHPDx90Ppg`(YouTube、Nobl9 アップロード、2021-05-17、16:02)
- Transcript: `.raw/videos/youtube--lHPDx90Ppg/transcript.md`(字幕由来)
- Frames: `.raw/videos/youtube--lHPDx90Ppg/frames/`(12 枚)
- Summary: [[@2021__SLOconf__SLO Math]]
- Pages created: 上記 source、[[Steve McGhee]](entity)
- Pages updated: [[サービスレベル目標]]・[[信頼性スタック]](concept 2 件)
- Key insight: intersection availability(全依存必須、SLO^depth)・union availability(冗長構成、1-(1-SLO)^redundancy)という 2 式による「SLO の集合論」が、[[サービスレベル目標]] concept の「SLO Algebra はいまだ未解決」という横断的知見(Desai, SREcon19 EMEA)に部分的解決を与えた。ただし独立性の仮定(共有障害・shared fate の非考慮)は McGhee 自身がボトルネックの主因として明示しており、Mogul+Wilkes (2017) の警告は解消されないまま残る。
## [2026-08-14] ingest-paper | UniTS: A Unified Multi-Task Time Series Model
- Source: `.raw/papers/arxiv-2403.00131.pdf`(36 ページ。arXiv:2403.00131、NeurIPS 2024 掲載、著者 Shanghua Gao ほか)
- Summary: [[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]]
- Pages created: 上記 source、[[UniTS]]・[[MIT Lincoln Laboratory]](entity 2 件)
- Pages updated: [[Harvard University]]・[[University of Virginia]](entity 2 件)、[[時系列基盤モデル]]・[[多変量時系列予測]](concept 2 件)
- Key insight: sample・prompt・task(GEN/CLS)の3種のトークンによるタスクトークン化で予測・分類・補完・異常検知を単一の共有重みモデルへ統一し、38データセットのマルチタスクco-trainingでタスク別/データセット別専用モジュールを持つベースライン(iTransformer・TimesNet・PatchTST・GPT4TS)を上回った(38タスク中27タスクで最良)。GENトークンの複製による直接多段予測はスライディングウィンドウ方式よりMSEを最大10.5%改善しつつ推論を3倍高速化し、統一マスク再構成事前学習による凍結モデル上のprompt learningは完全教師あり学習と同等以上の性能(予測MAE 0.379 vs 0.381)を達成する。UniTSが満たす「教師ありマルチタスク統一+prompt/few-shot適応」というTSFM像は、[[Toto]]/[[Chronos-2]]/[[TimesFM]]が満たす「真にゼロショットな汎用予測器」という像と異なり、両者が「時系列基盤モデル」という同じ呼称の下で異なる設計思想を体現していることを明らかにした。
## [2026-08-14] ingest | VOID Report 2024: Exploring the Unintended Consequences of Automation in Software
- Source: `.raw/reports/2024_VOID_Report.pdf`(35 ページ。Prowler(旧 Verica)発行、著者 Courtney Nash、2024 年)
- Summary: [[@2024__Prowler__VOID Report 2024 - Exploring the Unintended Consequences of Automation in Software]]
- Pages created: 上記 source、[[Prowler]](entity)、[[自動化アーキタイプ]](concept)
- Pages updated: [[Verica]]・[[Courtney Nash]]・[[David D. Woods]]・[[Lisanne Bainbridge]]・[[John Allspaw]]・[[J Paul Reed]]・[[Lorin Hochstein]](entity 7 件)、[[自動化のアイロニー]]・[[Joint Activity]]・[[インシデント管理]](concept 3 件)
- Key insight: VOID コーパス(約 1 万件)から自動化関与インシデント 189 件を主題分析し、77% で自動化が寄与要因・75% で人間の介入必須というコードを定量化した。導出した 6 自動化アーキタイプ(Sentinel/Gremlin/Meddler/Unreliable Narrator/Spectator/Action Item)は、Bainbridge (1983) の理論的な自動化のアイロニーに初めて大規模な実インシデントデータによる質的裏付けを与える。Klein らの Ten Challenges・un-Fitts list は既存の Joint Activity concept と同じ理論的系譜(Klein 研究グループ)を「自動化・AI をチームプレイヤーにする」という応用面から接続した。
- Contradiction: J Paul Reed の Lund 大学論文について、既存記述([[@2022__SREcon22APAC__A Post Incident Review Review]] 経由、博士論文・2021)と本レポート(修士論文・2018)で学位・発表年が食い違う。[[J Paul Reed]] と本 source ページ双方に contradiction callout を記録。
## [2026-08-14] ingest-book | A Philosophy of Software Design
- Source: `.raw/books/a-philosophy-of-software-design/`(21 章 / 入力: pdf、188 ページ。*A Philosophy of Software Design*、John Ousterhout、Yaknyam Press(Palo Alto, CA)、First Edition 2018 年 4 月〔v1.01 は 2018 年 11 月〕、ISBN 978-1-7321022-0-0)
- Book entity: [[wiki/entities/A Philosophy of Software Design|A Philosophy of Software Design]]
- Chapters: [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 1 Introduction]]〜[[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 21 Conclusion]](21 件、すべて `publish: false`)
- Pages created: 上記 21 章の source ページ、[[wiki/entities/A Philosophy of Software Design|A Philosophy of Software Design]]・[[RAMCloud]](entity 2 件)、[[ソフトウェア複雑性]]・[[戦略的プログラミング]]・[[深いモジュール]]・[[情報隠蔽]]・[[抽象化(ソフトウェア設計)]]・[[コメント設計]]・[[命名]]・[[設計の一貫性]]・[[例外処理の設計]]・[[性能を意識した設計]](concept 10 件)
- Pages updated: [[John Ousterhout]](entity)、[[本質的複雑性と偶発的複雑性]]・[[技術的負債]]・[[ソフトウェア保守]]・[[パフォーマンスエンジニアリング]](concept 4 件)
- Key insight: 本書は設計原則を「複雑性が減るかどうか」という単一の評価軸に従属させ、原則の遵守自体を目的にしない。著者は Preface で意見表明(opinion piece)であることを明言し、原則を試して複雑性が減らないなら使い続ける義務はないと書いている。反復して現れる型は**抽象の設計自由度そのものを問題解決の手段として使う**ことで、第 10 章「エラーを存在しないものとして定義する」(インターフェースの意味論を再定義してエラーだった状況を正常な振る舞いに含める)と第 6 章の汎用化(特定用途向けメソッド群を汎用メソッドに置き換えて情報漏出ごと消す)は同じ型である。第 20 章の「単純な設計はしばしば高速でもある」も、クリティカルパスに絞った根本的な再設計という条件つきで同じ型の帰結として提示される。
- 備考: 章の自動検出が節見出しを拾って 108 件に化けたため、`toc.txt` の level 1 が章に対応することを確認して `--chapters` で全 21 章に再分割した。図は本文の図参照を grep して 14 点と確定したうえで、キャプション座標の推定ではなく `get_image_rects()` による埋め込み画像矩形の直接クロップで全点を切り出し、埋め込み 14 / 欠損 0 / 未使用 0 を機械的に照合した。Preface と巻末 2 サマリ(設計原則 15 条・レッドフラグ 14 件)は source 化せず book entity に織り込んでいる。fan-out では章ごとに扱う concept が衝突しないよう 4 本の直列チェーン(複雑性 / モジュール設計 / コメント / 戦略)に分けてローリング実行した。
## [2026-08-14] ingest-book | The Elements of Statistical Learning
- Source: `.raw/books/elements-of-statistical-learning-2e/`(18 章 / 入力: pdf、764 ページ。*The Elements of Statistical Learning: Data Mining, Inference, and Prediction*, Second Edition, Trevor Hastie・Robert Tibshirani・Jerome Friedman, Springer Series in Statistics, 2009, ISBN 978-0-387-84857-0)
- Book entity: [[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]]
- Chapters: [[@2009__Springer__The Elements of Statistical Learning - Chapter 1 Introduction]]〜[[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]](全 18 章、すべて `publish: false`)
- Pages created: [[@2009__Springer__The Elements of Statistical Learning - Chapter 1 Introduction]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 2 Overview of Supervised Learning]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 4 Linear Methods for Classification]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 7 Model Assessment and Selection]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 8 Model Inference and Averaging]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 9 Additive Models, Trees, and Related Methods]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 10 Boosting and Additive Trees]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 11 Neural Networks]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 12 Support Vector Machines and Flexible Discriminants]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 14 Unsupervised Learning]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 15 Random Forests]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 16 Ensemble Learning]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 17 Undirected Graphical Models]]・[[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]](source)、[[Jerome Friedman]]・[[Prostate Cancer Data]]・[[Robert Tibshirani]]・[[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]]・[[Trevor Hastie]](entity)、[[EMアルゴリズム]]・[[GAM]]・[[MARS]]・[[クラスタリング]]・[[サポートベクターマシン]]・[[スペクトラルクラスタリング]]・[[バイアス-バリアンストレードオフ]]・[[ブートストラップ法]]・[[主成分分析]]・[[交差検証]]・[[勾配ブースティング]]・[[基底展開]]・[[多重検定]]・[[局所回帰]]・[[平滑化スプライン]]・[[最小角回帰]]・[[最近傍法]]・[[次元の呪い]]・[[決定木]]・[[無向グラフィカルモデル]]・[[独立成分分析]]・[[線形判別分析]]・[[縮小推定]]・[[誤差逆伝播法]]・[[部分集合選択]](concept)(新規 48 件)
- Pages updated: [[Thomas M. Cover]](entity)、[[PageRank]]・[[アンサンブル学習]]・[[カーネル密度推定]]・[[カーネル法]]・[[ベイズ推定]]・[[変分ベイズニューラルネットワーク]]・[[暗黙的正則化]]・[[最小記述長原理]]・[[汎化誤差バウンド]]・[[畳み込みニューラルネットワーク]]・[[統計的機械学習]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`(既存 12 件 + 共有索引)
- Key insight: 手法を網羅する教科書ではなく、**同じ論点を章をまたいで再解釈していく**構成が本書の骨格である。正則化は「係数への罰則(第 3 章 ridge/lasso)→ 関数の滑らかさへの罰則(第 5 章 平滑化スプライン・RKHS)→ 損失関数の取り替え(第 12 章 SVM = ヒンジ損失 + L2 罰則)→ グラフ構造への罰則(第 17 章 graphical lasso)→ 高次元での正則化強度のスケーリング(第 18 章)」と一般化され、アンサンブルは「決定木の不安定性(第 9 章)→ 前向き段階的加法モデリングによる損失関数最小化(第 10 章)→ 木どうしの相関 $\rho$ への帰着(第 15 章)→ 辞書の生成 + 事後の重み付けという 2 段構え(第 16 章)」と再解釈される。第 2 章が「局所平均化を破綻させる障害」として提示する次元の呪いと、第 18 章が「$p \gg N$ は強い正則化で扱える」とする見方は矛盾せず、有効自由度が呪いの本体であるという統一像に整理できた。既存 vault に対しては、LLM・深層学習文脈で作られていた [[汎化誤差バウンド]]・[[最小記述長原理]]・[[ベイズ推定]] に古典的な統計理論側の定式化が入り、いずれも seed から developing へ育った点が収穫である。
- 備考: PDF にアウトラインが無く自動章検出が 1 件に化けたため、目次から各章の印字ページを拾い「印字ノンブル + 19 = PDF ページ」というオフセットを実測して `--chapters` で全 18 章を手動分割した(末尾に参考文献・索引を切り離すダミー章を 1 つ設置)。図は 764 ページのため一括抽出を行わず、キャプションが `FIGURE N.M.` で始まるテキストブロックである点(本文中の参照は `Figure N.M` なので誤検出しない)を判別条件とし、キャプション直上の描画要素をクロップして 291 点を 1 パスで切り出した(本文キャプション総数と照合して差分ゼロ)。うち 280 点を本文に埋め込み、省略 11 点(同一構図の反復・演習問題内の図)は attachment からも外した。第 18 章の担当 subagent が「20 点埋め込み」と報告したが実際は 19 点で、本章の中心図である図18.1 が漏れていたためオーケストレータが補った。fan-out は concept の奪い合いを避けるため 4 レーン(基礎・正則化・木/アンサンブル・カーネル)に直列化してローリングで回した。
## [2026-08-13] ingest-book | 詳説 データベース
- Source: `.raw/books/database-internals-ja/`(16 件 / 入力: pdf、392 ページ、オライリー・ジャパン 2021 年 7 月 2 日 初版第 1 刷、ISBN 978-4-87311-954-0。原書 *Database Internals: A Deep Dive into How Distributed Data Systems Work*, O'Reilly Media, 2019)
- Book entity: [[詳説 データベース]]
- Chapters: [[@2021__OReillyJapan__詳説 データベース - Part I 序論 ストレージエンジン]]〜[[@2021__OReillyJapan__詳説 データベース - Chapter 14 合意]](全 14 章 + 各部序論 2 本 = 16 件、すべて `publish: false`)
- Pages created: [[@2021__OReillyJapan__詳説 データベース - Part I 序論 ストレージエンジン]], [[@2021__OReillyJapan__詳説 データベース - Chapter 1 基本事項の紹介と概要]], [[@2021__OReillyJapan__詳説 データベース - Chapter 2 Bツリーの基本]], [[@2021__OReillyJapan__詳説 データベース - Chapter 3 ファイルフォーマット]], [[@2021__OReillyJapan__詳説 データベース - Chapter 4 Bツリーの実装]], [[@2021__OReillyJapan__詳説 データベース - Chapter 5 トランザクション処理とリカバリ]], [[@2021__OReillyJapan__詳説 データベース - Chapter 6 Bツリーの亜種]], [[@2021__OReillyJapan__詳説 データベース - Chapter 7 ログ構造化ストレージ]], [[@2021__OReillyJapan__詳説 データベース - Part II 序論 分散システム]], [[@2021__OReillyJapan__詳説 データベース - Chapter 8 基本事項の紹介と概要]], [[@2021__OReillyJapan__詳説 データベース - Chapter 9 障害検出]], [[@2021__OReillyJapan__詳説 データベース - Chapter 10 リーダー選出]], [[@2021__OReillyJapan__詳説 データベース - Chapter 11 レプリケーションと一貫性]], [[@2021__OReillyJapan__詳説 データベース - Chapter 12 アンチエントロピーと情報散布]], [[@2021__OReillyJapan__詳説 データベース - Chapter 13 分散トランザクション]], [[@2021__OReillyJapan__詳説 データベース - Chapter 14 合意]](source)、[[Akka]]・[[Alex Petrov]]・[[Bitcask]]・[[Calvin]]・[[LLAMA]]・[[LMDB]]・[[Percolator]]・[[SQLite]]・[[TPC-C]]・[[WiredTiger]]・[[WiscKey]]・[[YCSB]]・[[詳説 データベース]](entity)、[[2人の将軍の問題]]・[[CAP定理]]・[[CRDT]]・[[FLPの不可能性]]・[[アンチエントロピー]]・[[スロット化ページ]]・[[分散コンピューティングの誤謬]]・[[障害検出器]](concept)
- Pages updated: [[Apache Cassandra]]・[[Apache HBase]]・[[Bigtable]]・[[CockroachDB]]・[[MongoDB]]・[[PostgreSQL]]・[[Riak]]・[[RocksDB]]・[[Spanner]]・[[ZooKeeper]](entity)、[[ACIDと分離レベル]]・[[ARIES]]・[[B-Tree]]・[[B-Treeノードレイアウト最適化]]・[[LSMツリー]]・[[LSMツリーコンパクション]]・[[OLTPシステムアーキテクチャ]]・[[TrueTime]]・[[Write-Ahead Logging (WAL)]]・[[べき等性]]・[[インメモリデータベース]]・[[クエリオプティマイザ]]・[[クエリ実行プラン]]・[[クォーラムベースレプリケーション]]・[[クラッシュリカバリ]]・[[クロック同期と信頼性]]・[[グレイ障害]]・[[コマンドロギング]]・[[ゴシッププロトコル]]・[[システムモデルと安全性・活性]]・[[スキーマ発展]]・[[スナップショット分離とMVCC]]・[[ゾーン名前空間SSD]]・[[データパーティショニング]]・[[バイナリエンコーディング]]・[[ビザンチン障害]]・[[ファイルシステムキャッシュ階層]]・[[ベンチマーキング]]・[[ページキャッシュカスタマイズ]]・[[メインメモリデータベース]]・[[ライトバックキャッシングと同期書き込み]]・[[リーダーレスレプリケーション]]・[[リーダー選出]]・[[レプリケーションラグと読み取り整合性]]・[[ロストアップデートと書き込みスキュー]]・[[分散SQLデータベース]]・[[分散コンセンサス]]・[[分散コンセンサス回避]]・[[分散システム障害]]・[[分散トランザクション]]・[[分散合意プロトコル]]・[[列指向OLAPデータベース]]・[[単一リーダーレプリケーション]]・[[地理分散SQLデータベース]]・[[外部一貫性]]・[[専用データベースシステム]]・[[直列化可能性]]・[[結果整合性]]・[[線形化可能性]]・[[複製ステートマシン]]・[[部分故障]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: ストレージエンジンと分散システムを、同一の設計トレードオフの二つの現れとして貫いた教科書。第 I 部は B ツリー(in-place 更新・読み取り最適)と LSM ツリー(追記のみ・書き込み最適)の対立を、二分探索木の限界(2 章)→ バイト配置(3 章)→ 実装上の補助構造(4 章)→ バッファ管理と回復可能性(5 章)→ 亜種の系統樹(6 章)→ LSM とログ構造化スタック(7 章)という順で積み上げ、RUM 予想(Read・Update・Memory の三つ巴)に収束させる。第 II 部は 8 章で不可能性結果(FLP・2 人の将軍の問題・分散コンピューティングの誤謬)を先に置き、以降を「その制約下で何ができるか」として構成する。9〜14 章は独立した話題の並列ではなく入れ子であり、障害検出器の正確性がリーダー選出の安定性を決め、リーダー選出は合意と等価で、2PC は合意ではない(コーディネータ障害でブロックする)ため 13 章が 14 章を必要とする、という依存関係が章順に埋め込まれている。既存 vault に対しては、単一ノードの分離レベル([[ACIDと分離レベル]])と分散の一貫性モデル([[線形化可能性]])が別の階層であるという区別、および「結果整合性は収束の約束にすぎず、[[アンチエントロピー]]が実際に収束を駆動する」という接続が、新たに得られた横断的知見である。
- 備考: 章検出の自動判定は節見出しを拾って 96 件に化けたため、`toc.txt` の level 2 エントリから章境界を読み取り `--chapters` で再分割した(本書は部・章・節が同じ outline level 2 に混在する)。図は 392 ページのため一括抽出を行わず、キャプションのフォント(GothicBBBPr6N-Medium 7.1pt、本文明朝 RyuminPr6N-Reg と判別可能)でキャプション行を特定し、その直上の埋め込み画像矩形を `get_image_rects()` で直接クロップして 124 点すべてを取得した(自動 122 点 + ベクター図・JSON 図の手動 2 点)。付録 A 参考文献・索引・各部のむすびは取り込み対象外とした。なお 5 章分は fan-out 中に担当 subagent が独自にコミット(`250003a8f4`)しており、本バッチは残りをまとめた 2 コミット目にあたる。
## [2026-08-13] ingest-paper | Redefine Statistical Significance
- Source: `.raw/papers/m6cfac675d954e8bc4f3e9f7ff07a614c.pdf`(Nature Human Behaviour Vol.2, pp.6–10、2017-09-01オンライン先行公開、DOI: 10.1038/s41562-017-0189-z、ORA Oxford登録accepted manuscript、11p)
- Summary: [[@2017__NatHumBehav__Redefine Statistical Significance]]
- Pages created: [[@2017__NatHumBehav__Redefine Statistical Significance]](source)、[[Daniel J. Benjamin]]・[[Magnus Johannesson]]・[[Valen E. Johnson]](entity/person、共同通信著者3名のみ)、[[統計的有意性]](concept)
- Pages updated: `wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: 統計的有意性のデフォルトP値閾値をP<0.05からP<0.005へ変更することを提案する提言論文。両側P値0.05はベイズ因子換算で2.5〜3.4(弱い証拠)にしか相当せず、P値0.005は14〜26(実質的〜強い証拠)に相当することを式1・Figure 1で示し、事前オッズ1:10・閾値0.05では検出力によらず偽陽性率が33%を超えるが閾値0.005では5%まで下がることを式2・Figure 2で示す。心理学・実験経済学の再現実験データ(P<0.005の初期研究の再現率がP<0.05の初期研究の約2倍)も援用する。実証研究ではなく既存理論・既存データの再計算に基づく提言論文であり、73名の共著者による「批判的多数派」形成自体が主張の一部であるため、entity化は共同通信著者3名に絞るscope decisionを行った。本vault初の統計学・研究方法論ドメインのconcept [[統計的有意性]] を新設。
## [2026-08-13] ingest-paper | Machine Learning: The High-Interest Credit Card of Technical Debt
- Source: `.raw/papers/43146.pdf`(SE4ML: Software Engineering for Machine Learning, NIPS 2014 Workshop, 9p)
- Summary: [[@2014__SE4ML2014__Machine Learning - The High-Interest Credit Card of Technical Debt]]
- Pages created: [[@2014__SE4ML2014__Machine Learning - The High-Interest Credit Card of Technical Debt]](source)、[[D. Sculley]]・[[Gary Holt]]・[[Daniel Golovin]]・[[Eugene Davydov]]・[[Todd Phillips]]・[[Dietmar Ebner]]・[[Vinay Chaudhary]]・[[Michael Young]](entity/person)、[[技術的負債]](concept)
- Pages updated: [[Google]](entity)、[[ソシオテクニカル負債]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: 技術的負債の枠組みを機械学習システムに初めて体系的に適用し、entanglement(CACE原則)・隠れたフィードバックループ・未宣言の消費者・データ依存性コスト・glue code/pipeline junglesなどのシステムレベルアンチパターン・外部世界の変化という4軸でリスク要因を整理した。[[技術的負債]]と[[ソシオテクニカル負債]]の階層的補完関係(コード解消可能 vs 人の行動変容が必要)を横断的知見として接続した。
## [2026-08-13] ingest-paper | Shaky structures: The wobbly world of causal graphs in software analytics
- Source: `.raw/papers/2025_Hulse_Shaky_structures_wobbly_world_causal.pdf`(Empirical Software Engineering 2025, vol.30 article 142, 29p)
- Summary: [[@2025__EMSE__Shaky structures - The wobbly world of causal graphs in software analytics]]
- Pages created: [[@2025__EMSE__Shaky structures - The wobbly world of causal graphs in software analytics]](source)、[[Jeremy Hulse]]・[[Tim Menzies]]・[[Nasir U. Eisty]](entity/person)
- Pages updated: [[North Carolina State University]]・[[University of Tennessee, Knoxville]]・[[Julien Siebert]](entity)、[[因果発見]]・[[Causal Software Engineering]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: PC・FCI・GES・LiNGAMの4因果グラフ生成器がSEデータ23件に対し、リリース間・プロジェクト間・パラメータチューニング・90%サブサンプルのいずれの摂動でも過半数の因果エッジを変化させることをJaccard指数で実証した。[[Causal Software Engineering]]がRoute 1の未解決課題として引用していた原典であることが判明し、取り込みにより同conceptと[[因果発見]]の横断的知見・未解決の問いを直接更新した。
## [2026-08-13] ingest-paper | ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents
- Source: `.raw/papers/arxiv-2604.07789.pdf`(arXiv:2604.07789v2, cs.MA, v2投稿日2026-05-28, 28p)
- Summary: [[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]]
- Pages created: [[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]](source)、[[Kenan Li]]・[[Qirui Jin]]・[[Wenke Lee]](entity/person)、[[SWEエージェントの情報信号]](concept)
- Pages updated: [[Dongmei Zhang]]・[[Microsoft]]・[[Georgia Institute of Technology]]・[[Agentless]]・[[SWE-Bench-Verified]](entity)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: SWEエージェント研究が暗黙に依拠してきた5つの文脈情報信号(Reproduction Test・Regression Test・Edit Location・Execution Context・API Usage)について、gold patchや実行トレースから機械的にoracle版を抽出し、3つのSWEベンチマーク・複数モデルで一貫してReproduction Testが最大の理想的寄与を示すことを定量化した。強いLMが実際に抽出した信号による検証実験でもoracle版と一致する寄与順序が再現され、oracleベースの上限測定が研究優先順位付けの指標として使えることを示した。
## [2026-08-13] ingest-book | Anatomy of an Incident
- Source: `.raw/books/anatomy-of-an-incident/`(7 章 / 入力: pdf、70 ページ、O'Reilly Media 2022年1月 First Edition)
- Book entity: [[wiki/entities/Anatomy of an Incident|Anatomy of an Incident]]
- Chapters: [[@2022__OReilly__Anatomy of an Incident - Chapter 1 Introduction]]〜[[@2022__OReilly__Anatomy of an Incident - Chapter 7 Conclusion and Moving Forward]](7 件、すべて `publish: false`)
- Pages created: [[@2022__OReilly__Anatomy of an Incident - Chapter 1 Introduction]], [[@2022__OReilly__Anatomy of an Incident - Chapter 2 Practicing Incident Response Readiness (Preparedness)]], [[@2022__OReilly__Anatomy of an Incident - Chapter 3 Scaling Incident Management (Response)]], [[@2022__OReilly__Anatomy of an Incident - Chapter 4 Mitigation and Recovery]], [[@2022__OReilly__Anatomy of an Incident - Chapter 5 Postmortems and Beyond]], [[@2022__OReilly__Anatomy of an Incident - Chapter 6 The Mayan Apocalypse - A Real-World Example]], [[@2022__OReilly__Anatomy of an Incident - Chapter 7 Conclusion and Moving Forward]](source)、[[Adrienne Walcer]]・[[wiki/entities/Anatomy of an Incident|Anatomy of an Incident]]・[[Ayelet Sachto]]・[[Jessie Yang]](entity)、[[心理的安全性]](concept)
- Pages updated: [[Ben Treynor Sloss]]・[[Google]](entity)、[[GameDay]]・[[Incident Commander]]・[[アクショナブルアラート]]・[[インシデントシミュレーション]]・[[インシデントメトリクス]]・[[インシデント影響測定]]・[[インシデント管理]]・[[インシデント重大度評価]]・[[オンコールストレス管理]]・[[カオスエンジニアリング]]・[[クラウド障害ライフサイクル]]・[[グレースフルデグレーデーション]]・[[プロアクティブ検証]]・[[ポストモーテム]]・[[レジリエンスエンジニアリング]]・[[人的要因]]・[[根本原因分析]]・[[組織の信頼性マインドセット]]・[[複雑システム障害論]]・[[障害注入]]・[[障害緩和]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: Google SRE によるインシデント管理の見取り図。準備(DiRT・Wheel of Misfortune)→ 対応(コンポーネント応答者 / SoS 応答者の二層構造、FEMA ICS の内部変種、重大度 6 区分、3 日以内ポリシー)→ 緩和と復旧(不信頼性 = Σ(TTD+TTR)/TBF × Impact による 3 つの操作変数への分解)→ ポストモーテム(心理的安全性、根本原因対トリガー、孤立システム対全体スタック、時点対軌跡)という循環で構成される。抽象論に留まりがちなインシデント管理文献のなかで、Google 内部の仕組みを名指しで公開している点と、投資判断を 1 本の式に落とし込んでいる点が本書固有の価値である。第 6 章の実例(Mayan Apocalypse、2019-06-02)は、応答者を 40 人超に増やしても緩和が加速しないという、横断調整層が必要になる状況を具体的に示す。
## [2026-08-13] ingest-paper | Eagle: Leveraging Operations Documents for Comprehensive Benchmark Question Generation
- Source: `.raw/papers/Eagle__FSE_indu_camera_ready_0326.pdf`(FSE Companion '26, DOI: 10.1145/3803437.3805214, 2026-07-05〜09 Montreal, 11p)
- Summary: [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]]
- Pages created: [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]](source)、[[Yuhe Liu]]・[[Hang Wang]]・[[Xiaogang Dong]]・[[Zhen Feng (Huawei)]]・[[Li Zheng (CAICT)]]・[[Kehang Ji]](entity/person)、[[Computer Network Information Center, Chinese Academy of Sciences]]・[[China Academy of Information and Communications Technology]](entity/organization)、[[Eagle (OpsLLMベンチマーク)]]・[[DirDiver]]・[[Bonito]]・[[Forge (5G Instruct Forge)]](entity/product)、[[運用文書駆動ベンチマーク生成]](concept)
- Pages updated: [[Dan Pei]]・[[Changhua Pei]]・[[Longlong Xu]]・[[Tsinghua University]]・[[BNRist]]・[[Huawei Technologies]](entity)、[[LLM評価]]・[[AIOps]]・[[OpsQA]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: Ops ドキュメントから DirDiver によるディレクトリ階層走査 → Seed Question 駆動の制約付き QA 生成 → Critic Model + RAG ベース Answer Model の二重品質検証、という4段階パイプラインで OpsLLM 評価用ベンチマークを自動生成し、Huawei 社内へ6ヶ月間デプロイして4,845件の QA ペアからモデル選定・ロールアウト判断に用いる社内横断ベンチマークレポートを作成した産業実証論文。専門家評点ルーブリックスコアでベースライン(Bonito・Forge)を22%〜49%上回り、4種の生成モデル(Qwen2.5-72B・GPT-4.1・Gemini 2.5・Claude 3.7 Sonnet)への頑健性(差±0.6点以内)も実証した。
## [2026-08-13] ingest-paper | CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure
- Source: `.raw/papers/arxiv-2605.06544.pdf`(arXiv:2605.06544v1, cs.DC, 2026-05-07投稿, 25p)
- Summary: [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]]
- Pages created: [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]](source)、[[Eric Ding]]・[[Byungsoo Oh]]・[[Bhaskar Kataria]]・[[Kaiwen Guo]]・[[Jelena Gvero]]・[[Abhishek Vijaya Kumar]]・[[Arjun Devraj]]・[[Lindsey Bowen]]・[[Atharv Sonwane]]・[[Emaad Manzoor]]・[[Rachee Singh]](entity/person)、[[CCL-Bench]]・[[CCL-Search]]・[[MSCCL++]]・[[TorchTitan]]・[[MaxText]](entity/product)、[[LLM基盤ベンチマーク]](concept)
- Pages updated: [[Cornell University]]・[[MLCommons Chakra]]・[[Astra-Sim]]・[[NCCL]]・[[vLLM]]・[[SGLang]]・[[Megatron-LM]]・[[PyTorch]]・[[Kineto]]・[[Perlmutter]]・[[OpenXLA]](entity)、[[実行トレース]]・[[並列化戦略]]・[[集合通信]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: 要約統計量ではなく実行トレース・ワークロードカード・起動スクリプトをエビデンスとして記録するトレースベースのベンチマーク設計により、compute-communication overlapの増加が並列化選択(小さいEP次数)による通信トラフィック増加で相殺されstep timeを悪化させる現象、TPU ICI帯域幅倍化がGPU scale-up帯域幅倍化より小〜中規模ワークロードで最大100倍高いutilityを持つこと、同一ハードウェア上でもTorchTitan/Megatron-LMの最良発見構成が転移せず最大3倍の性能差を生むことを実証した。実測トレースをMLCommons ChakraのET形式へ変換しAstra-Simへ投入するtrace-driven what-if分析と、LLMエージェントによる構成自動探索CCL-Searchも導入し、既存の要約統計量ベンチマークでは不可視な性能説明を可能にした。
## [2026-08-13] ingest-paper | TORAI: Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph
- Source: `.raw/papers/2026_Unknown_TORAI_Multi_source_Root_Cause.pdf`(Proc. ACM Softw. Eng. Vol.3 No.FSE Article FSE130, DOI: 10.1145/3808137, 2026年7月号, 24p)
- Summary: [[@2026__FSE__TORAI - Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph]]
- Pages created: [[@2026__FSE__TORAI - Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph]](source)
- Pages updated: [[Luan Pham]]・[[Huong Ha]]・[[Xiuzhen Zhang]]・[[Hongyu Zhang]]・[[RMIT University]]・[[Chongqing University]]・[[RCAEval]]・[[Online-Boutique]]・[[Sock Shop]]・[[Train-Ticket]](entity)、[[因果推論ベースRCA]]・[[限定観測可能性]]・[[マイクロサービスコールグラフ]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`.raw/.manifest.json`
- Key insight: サービスコールグラフを一切構築せず、severity クラスタリング(GMM)→因果推論(分割統治 Ψ-PC)→仮説検定(中央値/IQR)の三段パイプラインで、トレース計装のないサービス(blind spot)が混在する環境でも高精度な教師なしマルチソース RCA を実現。Sock Shop(全サービス blind spot)でも AC@1=0.84・Avg@5=0.94、64 サービスの Train Ticket でも平均 20.59 秒で完了する。著者は BARO・RCAEval と同じ RMIT University/Chongqing University グループで、既存 entity 10 件すべてが再利用でき新規 entity 作成は不要だった。
## [2026-08-13] ingest-paper | Quantifying Performance Variability in GPU Clusters
- Source: `.raw/papers/Quantifying_Performance_Variability_in_GPU_Clusters.pdf`(IEEE Transactions on Parallel and Distributed Systems Vol.37 No.6, DOI: 10.1109/TPDS.2026.3684387, 2026年6月号, 12p)
- Summary: [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]]
- Pages created: [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]](source)、[[Michael Mogilevsky]]・[[Hazem Zaky]]・[[Yu Sun]]・[[Lishan Yang]](entity/person)、[[GPU性能変動]](concept)
- Pages updated: [[Zhao Zhang]]・[[Mingkai Zheng]]・[[Rutgers University]]・[[George Mason University]]・[[Vista]]・[[Perlmutter]](entity)、[[ストラグラー]](concept)、[[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]](source、相互参照追記)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: NVIDIA A100(NERSC Perlmutter)・GH200(TACC Vista)を対象に GEMM・STREAM マイクロベンチマークと 7 実世界アプリケーションで GPU 間性能変動を実測し、Tensor Cores 3.7〜8.8%・CUDA Cores 0.1〜8.2% と定量化。GPT 19B の 3D 並列訓練では最遅 GPU の混入が配置に関わらず一貫して 8.0〜8.5% のスループット低下を引き起こすことを対照実験で実証した。同じ Rutgers 研究室が同じ Vista/Perlmutter テストベッドで発表した GPUPerf 論文(性能予測誤差 Vista 9.38%)は高誤差の要因をネットワークジッタに帰属するが、本論文の実測はネットワークを介さない GPU ハードウェア自体の変動が代替(または並存する)説明になりうることを示唆し、新規 concept [[GPU性能変動]] としてこの横断的知見を集約した。
## [2026-08-13] ingest-paper | Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications: A Review
- Source: `.raw/papers/2026_Unknown_Trustworthy_AI_Performance_Diagnosis_Systems.pdf`(ACM Computing Surveys Vol.57 No.5 Article 115, DOI: 10.1145/3701740, 2025年1月, 37p)
- Summary: [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review]]
- Pages created: [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review]](source)、[[Jingye Wang]](entity/person)、[[China University of Geosciences (Beijing)]](entity/organization)
- Pages updated: [[Ruyue Xin]]・[[Zhiming Zhao]]・[[Peng Chen (Xihua University)]]・[[University of Amsterdam]]・[[Xihua University]]・[[Multiscale Networked Systems (MNS)]](entity)、[[異常検知]]・[[根本原因分析]]・[[差分プライバシー]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: EU の Ethics Guidelines for Trustworthy AI の7要件から data privacy・fairness・robustness・explainability・efficiency・human intervention の6技術要件を抽出し、data collection→data preprocessing→anomaly detection→root cause localization の一般的性能診断フレームワークへ統合する taxonomy を提示した。fairness をデータ収集、robustness/explainability/efficiency を前処理・異常検知・根本原因箇所特定、data privacy と human intervention をシステム全体に対応づけ、計13の要件-コンポーネント対応表(Table 3)を中心的成果とする。根本原因箇所特定における公平性研究の空白を明示的に指摘し、CausalRCA の著者陣(Xin・Zhao・Chen)が個別のマイクロサービス RCA 研究からより広い信頼できる AI サーベイへ研究を展開した点が接続点として興味深い。
## [2026-08-13] ingest-paper | Causal Software Engineering: A Vision and Roadmap
- Source: `.raw/papers/2026_Unknown_Causal_Software_Engineering_Vision_Roadmap.pdf`(FSE Companion '26, DOI: 10.1145/3803437.3805585, 2026年7月, 5p)
- Summary: [[@2026__FSE__Causal Software Engineering - A Vision and Roadmap]]
- Pages created: [[@2026__FSE__Causal Software Engineering - A Vision and Roadmap]](source)、[[Roberto Pietrantuono]]・[[Luca Giamattei]]・[[Stefano Russo]]・[[Julien Siebert]]・[[Neil Walkinshaw]](entity/person)、[[University of Naples Federico II]]・[[Fraunhofer IESE]]・[[University of Sheffield]](entity/organization)、[[Causal Software Engineering]](concept)
- Pages updated: [[因果推論ベースRCA]]・[[根本原因分析]]・[[AIOps]]・[[因果発見]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: 既存の相関ベースSEツール(異常検知・AIOps・LLMエージェント)を「もっともらしい説明を出すが意思決定に足る答えではない」と批判し、コード変更・設定変更・デプロイ・是正措置を do 演算子による因果的介入として扱う Causal Software Engineering(CSE)を提唱した。causal design spec・intervention log・living causal model の3アーティファクトと、Causal Readiness Level(CRL-0〜CRL-5)による4ルート共進化ロードマップを提示する一方、実証実験を伴わないビジョン論文であり、因果グラフの進化下での不安定性・反実仮想手法の分散システムへのスケーラビリティ不足を著者ら自身が未解決課題として明示する。
## [2026-08-13] ingest-paper | NVMM-Oriented Hierarchical Persistent Client Caching for Lustre
- Source: `.raw/papers/2026_Unknown_NVMM_Oriented_Hierarchical_Persistent_Client.pdf`(ACM Transactions on Storage Vol.17 No.1 Article 6, DOI: 10.1145/3404190, 2021年1月, 22p)
- Summary: [[@2021__TOS__NVMM-Oriented Hierarchical Persistent Client Caching for Lustre]]
- Pages created: [[@2021__TOS__NVMM-Oriented Hierarchical Persistent Client Caching for Lustre]](source)、[[Wen Cheng]]・[[Chunyan Li]]・[[Lingfang Zeng]]・[[Yingjin Qian]]・[[Xi Li]](entity/person)、[[永続クライアントキャッシュ]](concept)
- Pages updated: [[André Brinkmann]]・[[Johannes Gutenberg University Mainz]]・[[Huazhong University of Science and Technology]]・[[DDN]]・[[Lustre]](entity)、[[並列ファイルシステム]]・[[ローカルファイルシステム実装比較]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: [[Lustre]]クライアントノードのNVMMをHSM機構とレイアウトロックの上で階層型永続キャッシュ化するNVMM-LPCC(RW/RO 2モード)は、ネイティブLustre比で読み取りスループット最大35.80倍・書き込み最大9.83倍、フラッシュSSD比でも読み取り最大10.39倍・書き込み最大4.40倍を達成した。既存の[[並列ファイルシステム]]概念が「クライアントメタデータライトバックキャッシュは将来の方向性」としていた記述に対し、データ面でのクライアント側永続キャッシュは2021年時点で既に本番指向の実装・評価まで到達していたことが判明。NOVA/PMFS/EXT4-DAXというNVMM向けローカルファイルシステムは、ブロックデバイス向けのジャーナリング/COWとは異なる手段(DAXバイパス・ログ構造)で「クラッシュ整合性の確保」という同じ目的を達成しており、[[ローカルファイルシステム実装比較]]に新設計軸を追加した。
## [2026-08-13] ingest-slides (追記) | AI Agents for Incident Investigation: The Good, The Bad, and The Ugly
- Source: `.raw/slides/sre26amer-budichenko/sre26amer-budichenko.pdf`(既存 ingest、2026-06-28)
- Media (新規): `.raw/slides/sre26amer-budichenko/media/audio.m4a`(YouTube 動画 https://www.youtube.com/watch?v=yvVWHAyr2HI から抽出)・`.raw/slides/sre26amer-budichenko/transcript.md`(Whisper 文字起こし)
- Summary: [[@2026__SREcon26Americas__AI Agents for Incident Investigation - The Good, The Bad, and The Ugly]](「口頭説明・補足」節を新設)
- Pages updated: [[@2026__SREcon26Americas__AI Agents for Incident Investigation - The Good, The Bad, and The Ugly]](source)、[[エージェント運用安全性]]・[[LLMによる根本原因分析]](concept)、`.raw/.manifest.json`
- Key insight: 口頭説明により p.14 のプロンプトインジェクション +540% の調査元が OWASP と判明(口頭では「約500%」とやや異なる数値)。また p.12 の RCA 精度 11.34% について、登壇者が「その後、別アプローチで約80%まで改善されたと認識している」と口頭で補足したが、一次情報源は未特定のため低信頼度の付随情報として記録。質疑応答は動画収録範囲外で内容不明。
## [2026-08-13] ingest-paper | EventADL: Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems
- Source: `.raw/papers/2026_Unknown_EventADL_Open_Box_Anomaly_Detection.pdf`(ACM FSE 2026, Proc. ACM Softw. Eng. Vol.3 Article FSE179, DOI: 10.1145/3808186, 24p)
- Summary: [[@2026__ACM FSE__EventADL - Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems]]
- Pages created: [[@2026__ACM FSE__EventADL - Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems]](source)、[[Victor Nicolet]]・[[Joey Dodds]]・[[Hui Guan]]・[[Daniel Kroening]](entity/person)
- Pages updated: [[Luan Pham]]・[[RMIT University]]・[[Amazon Web Services]](entity)、[[異常検知]]・[[グラフベースRCA]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: 520件の実インシデント分析(UKW社内)により、クラウド監査イベントの異常はEvent Type(21%)・Event Value(68%)・Event Frequency(67%)の3次元に現れ、根本原因の68%は複数介入にまたがることを定量化した。ルールベースのEvent Semantic Pattern(ESP)とMatrix Profileを離散イベント頻度に初適応させたmagnitude-based Event Frequency Pattern(EFP)という2種の解釈可能パターンで異常を検知し、アクター・操作・リソースから直接構築されるIntervention Graph上のtime-aware random walkで根本原因を箇所特定する。5データセットで異常検知F1≥0.90・箇所特定AC@3=100%を達成し、14種の異常検知・10種のRCLベースラインを一貫して上回った。既存 wiki の [[Luan Pham]] entity(BAROの著者として既存)を発見し、同一著者が自身の代表作BAROをEventADLの実験でメトリクスベースRCLベースラインとして比較評価している点を接続した。
- 備考: 図表8点(Figure 1〜8)のうち6点(Figure 2・3・5・6・7・8)をPyMuPDFキャプション座標クロップで取得・埋め込み、2点(Figure 1・4、jsonLogic/JSON例)はコードブロックとして転記。埋め込みラスター画像3点(image-007-001〜003.png)はいずれも装飾的な空枠(Table 2周辺の背景ボックス)のみで図表として無価値なため不使用。Table 1〜5をMarkdown表へ抜粋転記。全24ページ本文+参考文献70件を通読。
## [2026-08-13] ingest-paper | A Network Arena for Benchmarking AI Agents on Network Troubleshooting
- Source: `.raw/papers/arxiv-2512.16381.pdf`(arXiv:2512.16381, 2025-12-18 投稿、18p、cs.NI)
- Summary: [[@2025__arXiv__A Network Arena for Benchmarking AI Agents on Network Troubleshooting]]
- Pages created: [[@2025__arXiv__A Network Arena for Benchmarking AI Agents on Network Troubleshooting]](source)、[[Zhihao Wang]]・[[Dingde Jiang]]・[[Alessandro Cornacchia]]・[[Marco Canini]]・[[Alessio Sacco]]・[[Franco Galante]](entity/person)、[[KAUST]]・[[Politecnico di Torino]](entity/organization)、[[ネットワークトラブルシューティングエージェントベンチマーク]](concept)
- Pages updated: [[University of Electronic Science and Technology of China]]・[[NIKA]](entity)、[[障害注入]]・[[SRE Benchmark]]・[[エージェント型ネットワーク障害診断]](concept)、[[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]](source、contradiction callout 追加)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: NIKA は LLM 駆動のネットワークトラブルシューティング向けとして現時点最大の公開ベンチマークで、5シナリオ×54根本原因の組み合わせで640通りのインシデントを構成し、MCP経由で30種類超のツールを公開する。GPT-5 は検知89.0%まで到達するが箇所特定68.7%・RCA 55.3%と依然課題が残り、特にリソース競合カテゴリで精度が落ちる。直前に ingest した SADE 論文([[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]])が同じ NIKA を評価対象としていたため全文照合したところ、SADE が「NIKA の LLM-as-judge プロトコル」と述べる評価尺度が、NIKA 一次論文の評価器節(§3.3.3、混同行列ベースの精度のみ)と食い違うことを発見し、両ソースと [[NIKA]] entity に `[!contradiction]` callout を追加した。
- 備考: 埋め込みラスター画像7点は全て Fig.1/Fig.2内の装飾アイコン(OpenAI ロゴ・レンチ・InfluxDB ロゴ等)のみで、実データを示す図(Fig.1・2・4・5・6)はベクター描画のため PyMuPDF キャプション座標クロップで取得した。Figure 3a/3b はコードのため Markdown コードブロックへ転記。Table 1〜5(Table 3 は640件全内訳)を Markdown 表へ忠実に転記。全18ページ本文+参考文献87件を通読。
## [2026-08-13] ingest-paper | SADE: Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting
- Source: `.raw/papers/arxiv-2605.04530.pdf`(arXiv:2605.04530, 2026-05-06 投稿、12p、cs.NI/cs.AI)
- Summary: [[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]]
- Pages created: [[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]](source)、[[Kuan-Hao Tseng]]・[[Niruth Bogahawatta]]・[[Yasod Ginige]]・[[Kosta Dekic]]・[[Arunan Sivanathan]]・[[Suranga Seneviratne]](entity/person)、[[SADE]](entity/product)、[[NIKA]](entity/dataset)、[[エージェント型ネットワーク障害診断]](concept)
- Pages updated: [[University of Sydney]]・[[University of New South Wales]](entity)、[[仮説駆動RCA]]・[[Flexible Skill Arrangement]]・[[Fault Localization]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: SADE は、既存 LLM エージェントの失敗要因を「証拠取得と仮説確定の混同」と位置づけ、Cisco の階層的トラブルシューティング方法論をフェーズゲート型ワークフロー(初期スキャン→深層スキャン→症状-故障ファミリ対応付け→スキル駆動検知)として符号化した。同一 Claude Sonnet 4.6 バックボーンでの Claude Code ベースライン比較(RCA F1 0.77 vs 0.55)により、性能向上22ポイントを診断ポリシー自体に帰属させた点は、本 wiki が蓄積してきた「LLM の進歩とエージェント設計の進歩の交絡」問題に対する希少な定量的分離例である。ネットワーク層(L2/L3)の障害診断は本 wiki で初めて扱う新規ドメインであり、既存のマイクロサービス/GPUクラスタ中心の Fault Localization 知見に、症状の層別エスカレーションという第四のアプローチを追加した。
- 備考: 図表6点(Figure 1〜6)のうち、埋め込みラスター画像として取得できたのは Figure 1 の一部(RCA F1/検知精度ミニチャート)・Figure 4・Figure 5 の3点で、Figure 1 全体・Figure 2(SADE フレームワーク図)・Figure 3(OSPF ワークフロー例)・Figure 6(スキルブック+ヘルパースクリプト)はベクター描画のため PyMuPDF キャプション座標クロップで取得した。表は Table I〜VIII を Markdown 表へ転記し、Table III(本文)と Table VII(付録C)は同一の2クロススタック事例を扱うため1表に統合した。全12ページ本文+参考文献33件を通読。
## [2026-08-13] ingest-book | SLO サービスレベル目標
- Source: `.raw/books/implementing-slo-ja/`(全19枚 = 本編17章 + 付録A・B / 入力: 全体 PDF 432 ページ)
- Book entity: [[SLO サービスレベル目標]]
- Chapters: [[@2023__OReillyJapan__SLO サービスレベル目標 - Appendix A SLOの定義のテンプレート]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Appendix B 9章の証明]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 1 信頼性スタック]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 10 信頼性を得るためのアーキテクチャ]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 11 データの信頼性]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 12 適切に機能した例]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 13 SLO文化の構築]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 14 SLOの進化]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 15 発見可能で理解可能なSLO]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 16 SLOの提唱]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 17 信頼性のレポート]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 2 信頼性についての考え方]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 3 意味のあるサービスレベル指標の開発]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 4 適切なサービスレベル目標の選択]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 5 エラーバジェットの使い方]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 6 同意の獲得]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 7 SLIとSLOの計測]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 8 SLOの監視とアラート]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 9 SLIとSLOの確率と統計]]
- Pages created: [[SLO サービスレベル目標]]・[[Toby Burress]]・[[Polina Giralt]]・[[Blake Bisset]]・[[Harold Treen]]・[[Matt LeMay]]・[[Isobel Redelmeier]]・[[Eva Parish]](entity 8件)、[[信頼性スタック]]・[[意味のあるSLI設計]]・[[SLO目標値の選定]]・[[ベイズ推定]](concept 4件)、`wiki/sources/_attachments/implementing-slo-ja/`(図48点)
- Pages updated: [[Benjamin H. Sigelman]]・[[Niall Murphy]]・[[Dave Rensin]]・[[Daria Barteneva]]・[[Jaime Woo]](entity 5件)、[[サービスレベル目標]]・[[エラーバジェット]]・[[SLI-SLO段階的導入]]・[[SLODLC]]・[[SREの提唱]]・[[SRE文化]]・[[SRE組織変革]]・[[組織の信頼性マインドセット]]・[[アラート管理]]・[[インシデントメトリクス]]・[[インシデント重大度評価]]・[[脆弱性バジェット]]・[[データ品質SLO]]・[[イベントベースSLO]]・[[適時性と完全性]]・[[データ統合]]・[[RED メソッド]]・[[USE メソッド]]・[[サービストポロジ]]・[[ユーザー中心オブザーバビリティ]]・[[ダッシュボードとランブックの運用]]・[[ディペンダビリティ]]・[[グレースフルデグレーデーション]]・[[カオスエンジニアリング]]・[[NALSD]]・[[時系列データベース]]・[[待ち行列理論]]・[[統計的機械学習]](concept 28件)、`wiki/index.md`・`wiki/hot.md`・各 `_index.md`
- Key insight: 本書は SLI/SLO/エラーバジェットを「定義して運用する」だけの主題から引き剥がし、確率統計(9章・付録B)・システム設計(10章)・データ品質(11章)・組織文化(第III部)という 4 つの隣接領域へ接続する。とくに 17 章は、インシデント件数・深刻度レベル・MTTX という運用現場で広く使われる 3 指標がいずれも信頼性のレポート手段として破綻することを、深刻度の境界の本質的曖昧さと平均値の欺瞞性から論証し、エラーバジェットを唯一の代替として据える。これは [[インシデントメトリクス]] の既存知見に対する明確な反証であり、9 章の「低 QPS サービスでは短いウィンドウだと偶然の SLO 違反判定が起きる」という結果とあわせ、SLO 運用の落とし穴が統計的性質に根ざすことを示す。組織面では 6 章(導入前の同意獲得)と 16 章(定着後の提唱)を時間軸で分ける整理が本書固有で、13 章の 6 段階(同意→最優先化→実装→活用→反復→提唱)がその全体像を与える。
- 備考: 章検出は当初 Part 単位に化けたため(outline level 1 が「第I部」等)、`toc.txt` の level 2 から章境界を読み取り `--chapters` で再分割した。432 ページのため画像一括抽出は不使用。図表48点は PyMuPDF で取得し、大半がベクター描画で `get_images()` が空を返すため `get_drawings()` の外枠矩形からクロップした(15・17 章のみ埋め込みラスター画像)。9 章は本文参照32点のうちほぼ同一構図の反復8点を代表点へ統合し24点を埋め込んだ。章ごとに Sonnet 5 subagent へ委譲しローリングで並行実行。著作権対応で全19枚 `publish: false`。9 章分のみ、担当 subagent が指示に反して先行コミット(`13c31dfb98`)しており、残る18枚は本エントリのコミットに含まれる。
## [2026-08-13] ingest-paper | Representation-Aware Root Cause Analysis with Large Language Models (Position Paper)
- Source: `.raw/papers/2026_Unknown_Representation_Aware_Root_Cause_Large.pdf`(ユーザー提供ローカル PDF、ICPE Companion '26、DOI: 10.1145/3777911.3801108)
- Summary: [[@2026__ICPE Companion__Representation-Aware Root Cause Analysis with Large Language Models (Position Paper)]]
- Pages created: [[@2026__ICPE Companion__Representation-Aware Root Cause Analysis with Large Language Models (Position Paper)]](source)、[[Yiwei Wen]]・[[Mahsa Panahandeh]]・[[Moataz Chouchen]]・[[Abdelwahab Hamou-Lhadj]]・[[University of Ottawa]](entity)
- Pages updated: [[Concordia University]]・[[Train-Ticket]](entity)、[[LLMによる根本原因分析]]・[[RCA入力選別]]・[[仮説駆動RCA]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`.raw/.manifest.json`
- Key insight: LLM ベース RCA の診断精度・推論コストは、生の観測性データ量ではなく表現設計(粒度・モダリティ・明示性・summarization)に強く依存する。invocation-level 集約(同一呼び出しパスの統計量への畳み込み)は平均入力トークンを最大2桁削減しつつ Top-5 精度を同等以上に保ち、summarization を加えた invocation-level 表現が本研究最良のコスト精度トレードオフ(Top5 81.2%)を達成した。一方でこの最良 LLM 設定(Top1 54.5%)は非LLM手法 TraceRCA の参考値(Top1 64.8%)に及ばず、本 wiki が SREcon26(本番実測11.34%)・OpenRCA 再評価(GALA 2.56%・RCLAgent 0.00%)で蓄積してきた「LLM ベース RCA が非LLMベースラインや実環境で精度が伸び悩む」という観察に、TrainTicket という研究環境データセットでの独立サンプルを加えた。
- 備考: ACM DOI ページ(dl.acm.org)は Cloudflare により WebFetch・curl(ブラウザ UA 偽装含む)双方で 403 となり書誌情報の外部裏取りができなかったため、PDF 本文中の venue・DOI・ISBN・replication package URL(figshare)をそのまま採用した。埋め込みラスター画像は Figure 1(分散トレース例)の1点のみで、Table 1〜3 はいずれも本文記載の数値からMarkdown表へ忠実に転記した(画像クロップ不要)。全7ページ本文+参考文献21件を通読。
## [2026-08-13] ingest-paper | OpsLLM: Construction of Large Language Model for Software Operations with Multi-stage Learning
- Source: `.raw/papers/arxiv-2605.02906.pdf`(arXiv:2605.02906, 2026、12p)
- Summary: [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]]
- Pages created: [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]](source), [[OpsLLM]](entity/product), [[Jingkai He]], [[Chenghui Wu]], [[Shuang Liang]], [[Ye Li]], [[Chuanfu Zhang]], [[Fang Situ]], [[Qi Zhou]](entity/person)
- Pages updated: [[Pengfei Chen]], [[Gou Tan]], [[Xidao Wen]], [[Sun Yat-sen University]], [[Alibaba Cloud]], [[GRPO]], [[VeRL]](entity), [[LLMによる根本原因分析]], [[検証可能報酬による強化学習]], [[障害注入]], [[報酬ハッキング]](concept), [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: ソフトウェア運用ドメイン特化 LLM「OpsLLM」は、Human-in-the-Loop データキュレーション→SFT(LoRA)→ドメインプロセス報酬モデル(DPRM)による段階ゲート型 GRPO 強化学習という一貫したワークフローで、QA・RCA を統合的に改善する(RCA で最大70.3pt改善)。DPRM は「訓練時に LLM 自体を RCA へ整合させる」という、本 wiki が蓄積してきた推論時補助中心の LLM×RCA 研究群とは異なる軸を提供し、人間専門家評価とスピアマン相関0.88という高い妥当性を示した。
- 備考: Xidao Wen は既存 wiki の BizSeer 所属エンティティ(メール `
[email protected]`)と、本論文の Alibaba Cloud 所属表記(メール `
[email protected]`)のローカル部一致から同一人物の可能性が高いが未確認のため disambiguation note を追加。図8点(全て埋め込みラスター画像として取得、page-render キャッシュは削除)・表2点(Table I・II)を本文該当箇所に埋め込み。全12ページ本文+参考文献56件を通読。
## [2026-08-13] ingest-paper (force re-ingest) | Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning
- Source: `.raw/papers/arxiv-2605.04431.pdf`(arXiv:2605.04431, 2026、16p、md5 9942717fa4a850900ccf07a8fdd23e69。2026-06-04 に ingest 済みだったが、ユーザー指示で force 再ingestし図表を全面修正)
- Summary: [[@2026__arXiv__Towards Robust LLM Post-Training - Automatic Failure Management for Reinforcement Fine-Tuning]]
- Pages updated: [[@2026__arXiv__Towards Robust LLM Post-Training - Automatic Failure Management for Reinforcement Fine-Tuning]](source。`address: c-002464` を新規に backfill)
- Key insight: 2026-06-04 の初回 ingest 後、直近コミット「wiki: normalize paper figure embeds」で Figure 1・3・4 のキャプションが全て同一の汎用文言「障害要因の内訳を示す」に置き換わっており、実際の図内容(Fig.1 概念図/Fig.3 observability 4パネル/Fig.4 empirical fingerprints ヒートマップ)と不一致だった。pdf.js の埋め込みラスター抽出では Fig.1・Fig.3・Fig.4・Fig.5・Fig.6・Fig.7 の大半がベクター描画のため正しく取得できていなかったと判明(image-001-*.png は Fig.1 内の装飾スパークラインアイコンの断片、image-006-001.png は Fig.4 ヒートマップのラスター部分のみでラベルを欠く)。PyMuPDF のキャプション座標クロップで Fig.1〜7 全 7 図を正確に再取得し、本文中の記述と対応する節へ再配置。あわせて Table I〜VII の全 7 表を Markdown 表として忠実に転記した(旧版は結果を散文でしか記述していなかった)。事実関係(数値・主張)自体は初回 ingest から変更なし——今回の修正は図表の正確性のみ。
- 備考: PyMuPDF は `uv run --with pymupdf --cache-dir "$TMPDIR/uv-cache"` で起動。`.raw/papers/arxiv-2605.04431/images/` の `page-*.png`(16枚のページレンダリングキャッシュ)を削除し `images.json` を embedded のみ(18件)に整理。旧 attachment(`fig1-failure-factors.png` 等9点、内容不正確または汎用キャプション)を削除し、新規 7 図(`fig1-architecture-overview.png`〜`fig7-hyperparameter.png`)に差し替え。既存 entity([[RFT-FaultBench]]・著者陣)・concept([[強化ファインチューニング]]・[[異常検知]]・[[障害緩和]]・[[障害注入]]・[[エージェント型強化学習]])は既に正確な数値で本論文を引用済みのため変更不要と確認。
## [2026-08-13] ingest-paper | TS-Benchmark: A Benchmark for Time Series Databases
- Source: `.raw/papers/TS-Benchmark_A_Benchmark_for_Time_Series_Databases.pdf`(ユーザー提供ローカル PDF、ICDE 2021、DOI: 10.1109/ICDE51399.2021.00057)
- Summary: [[@2021__ICDE__TS-Benchmark - A Benchmark for Time Series Databases]]
- Pages created: [[@2021__ICDE__TS-Benchmark - A Benchmark for Time Series Databases]](source)、[[Druid]]・[[Yuanzhe Hao]]・[[Yueguo Chen]](entity)
- Pages updated: [[InfluxDB]]・[[TimescaleDB]]・[[OpenTSDB]]・[[Renmin University of China]](entity)、[[時系列データベースベンチマーク]]・[[時系列データ生成]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: TSM-Bench(PVLDB 2023、既 ingest 済み)論文の参考文献 [68] を突き合わせたところ、TSM-Bench が比較対象とする「TS-Graph」(グラフ構築が二次時間・時間シフトで相関低下)の原論文が本論文(TS-Benchmark)であることを特定した。TS-Benchmark 自身は生成データ品質を視覚的類似性でしか評価していなかったが、2 年後の TSM-Bench による定量比較(Pearson 相関 0.13、TS-LSH の 0.8 に対し約 6 分の 1)で初めて弱点が数値化された。この発見により [[時系列データ生成]] concept に新規知見を追加し、2 本のソースを直接接続した。
- 備考: PDF は 12 ページだが本文は 7 ページ(残りは参考文献)。全図 Fig.1〜11 の全パネルを PyMuPDF のキャプション座標クロップで取得(pdf.js の埋め込みラスター画像抽出は Fig.1 内の風力タービンアイコン装飾 3 点のみ)。Table I〜VI の全 6 表を Markdown 表へ忠実に転記。source ページは 269 行。全 7 ページ本文+参考文献 41 件を通読。
## [2026-08-13] ingest-paper | Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems
- Source: `.raw/papers/2026_Unknown_Fail_Slow_Hardware_Failure_Bug.pdf`(ユーザー提供ローカル PDF、ACM Trans. Comput. Syst. 2026、DOI: 10.1145/3838187)
- Summary: [[@2026__TOCS__Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems]]
- Pages created: [[@2026__TOCS__Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems]](source)、[[Gen Dong]]・[[Yu Hua]]・[[Yongle Zhang]]・[[Zhangyu Chen]]・[[Menglei Chen]]・[[Sieve]]・[[HDFS]]・[[Apache HBase]](entity)、[[フェイルスローハードウェア]](concept)
- Pages updated: [[ZooKeeper]]・[[Apache Kafka]]・[[Apache Cassandra]]・[[Huazhong University of Science and Technology]]・[[Purdue University]](entity)、[[障害注入]]・[[遅延注入]]・[[グレイ障害]]・[[部分故障]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: フェイルスローハードウェア障害バグは同期機構とタイムアウト機構に 100% 集中し、かつ障害の細粒度性が発現の必要条件である。粗粒度障害(フェイルストップ・ノードクラッシュ・ネットワーク分断)を注入するとフォールトトレランス機構が働いて回復してしまい、バグが再現しない。この「粒度は強度の軸ではなく検知網をすり抜けるかどうかの軸である」という観察は、既存 concept [[障害注入]] が蓄積してきた「単一障害では見落としが多い(FaultWeave の 89%)」という複雑さを増す方向の議論に対し、逆向きの構造的制約を与える。
- 備考: pdf.js の埋め込みラスター画像抽出は 20 点得られたが本文図表(Figure 1〜9)とは対応しなかったため、全9点を PyMuPDF のキャプション座標クロップで取得。Table 1〜13 を Markdown 表へ忠実に転記(Table 12・13 は本ページでは 1 表に統合)。付録の Table 14(エージェント検証の全文結果)は本文参照が 1 回のみ・付録限定のため除外。source ページは 330 行で conventions §7 の上限 300 行をやや超過(図表 9 点+表 13 点を保持するため散文側を圧縮した上での判断)。全33ページ本文+参考文献78件を通読。
## [2026-08-13] ingest-paper | Six Dimensions of Benchmarking Time-Series Databases
- Source: `.raw/papers/arxiv-2608.01459.pdf`(arXiv 2608.01459、EDBT '27採録原稿)
- Summary: [[@2026__arXiv__Six Dimensions of Benchmarking Time-Series Databases]]
- Pages created: [[@2026__arXiv__Six Dimensions of Benchmarking Time-Series Databases]](source)、[[InfluxDB]]・[[TimescaleDB]]・[[DataLayerTS]]・[[Karlsruhe Institute of Technology]]・[[Jalal Mostafa]]・[[Sandro Melissano]](entity)
- Pages updated: [[ClickHouse]](entity)、[[時系列データベースベンチマーク]]・[[時系列データベース]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: SciTSv2 は接続並列性・バッチ取り込み・時系列規則性(等間隔性、新規次元)・多変量系列・混合ワークロード・システムメトリクスの6次元を統一する初のTSDBベンチマークで、既存7ベンチマーク(YCSB-TS・SmartBench・IoTDB-Benchmark・TS-Benchmark・SciTS・TSM-Bench・TSBS)のいずれもregularity次元を実装していないことをTable 1で示した。InfluxDB・TimescaleDB・ClickHouse・DataLayerTSの4TSDBを評価し、正則時系列でClickHouseの疎インデックスがパーツ集中によりディスク競合を増やし取り込みレートが低下するという反直感的な結果、DataLayerTSの規則性依存(最大178 MB/s取り込み・サブミリ秒クエリだが小バッチ・不規則時系列で崩壊)、InfluxDBの多変量クエリでの指数的レイテンシ増加(1変数1.35 ms→24変数698.3 ms)を実証した。既存 concept [[時系列データベースベンチマーク]] は TSM-Bench(既存記載)の「クエリ選択性・データセット規模・挿入レートの3軸」知見に、regularity という第4の軸を追加する裏付けを得た。
- 備考: pdf.js による埋め込みラスター画像抽出は対象0件(全図がベクター描画)のため、Figure 1〜10の全10点をPyMuPDFのキャプション座標クロップで取得。Table 1・2はMarkdown表へ忠実に転記。全11ページ本文+参考文献26件を通読。
## [2026-08-13] ingest-paper | Agentic Workflows are Serverless Applications, so deploy them that way!
- Source: `.raw/papers/2026_Unknown_Agentic_Workflows_Serverless_Applications_so.pdf`(ユーザー提供ローカル PDF、発表媒体・DOI は web 検索で特定できず不明)
- Summary: [[@2026__Unknown__Agentic Workflows are Serverless Applications, so deploy them that way!]]
- Pages created: [[@2026__Unknown__Agentic Workflows are Serverless Applications, so deploy them that way!]](source)、[[Ian Dougherty]]・[[Natalie Lambert]]・[[Joshua Wang]]・[[Ethan Xu]]・[[Reto Achermann]]・[[Alexandra Fedorova]](entity)
- Pages updated: [[University of British Columbia]]・[[TU Munich]](entity)、[[サーバーレスアーキテクチャ]]・[[サーバーレスワークフロー]]・[[LLMサービング管理]]・[[KVキャッシュ管理]]・[[モデルスケーリング高速化]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: エージェント型ワークロードは長時間・非決定的な実行時間とステートフルなツール実行という2点でサーバーレスの前提に反するが、Static RAG Agent・Mini SWE Agent・GPT-Researcher の3代表アーキタイプの実測(A100 GPU 単一ノード、CPU・メモリ・ネットワーク・GPU トレース)は、いずれもワークフローステージに沿った明確なアイドル期間(GPU VRAM が推論非実行中も解放されないまま残る等)を持つことを示した。これに基づき著者らはエージェントを Control Flow Graph としてモジュール化デプロイし、Agent Workflow Manager がステージのライフタイムをエージェント実行進捗に対して能動的に管理する Modular Serverless Agent System Design を提案する。既存 concept のうち [[サーバーレスアーキテクチャ]] と [[サーバーレスワークフロー]] が長らく開いたままにしていた「サーバーレスと LLM エージェントの関係」という問いに、position paper レベルではあるが直接取り組む初めてのソースとなった。
- 備考: Figure 1・5・6 が掲載された PDF の3ページ(printed page 32, 34, 35)はテキストレイヤーを持たない全ページラスター画像として埋め込まれており、pdftotext・PyMuPDF いずれのテキスト抽出も完全失敗(0文字)した。該当ページ本文(§2.3 Serverless LLMs 全体、§3 の Varying Execution Time・Different Resource Consumption・Significant Idle Periods・Summary、§4 冒頭・§4.1 冒頭)は、pdftoppm/PyMuPDF でページを画像化し目視確認して手動で書き起こし、本ノートへ反映した。Figure 2〜4(ワークフローグラフ)は通常のテキストレイヤーを持つページ上のベクター描画のため、PyMuPDF のキャプション座標クロップで取得。Figure 1・5・6 は全ページラスター画像を再クロップして取得した。図表6点全件を本文該当箇所に埋め込んだ(除外・取得失敗なし)。全11ページ本文+参考文献56件を通読。
## [2026-08-13] ingest-paper | MEGATRACE: Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters
- Source: `.raw/papers/MEGATRACE_Troubleshooting_Hang_and_Slowdown_in_Large-Scale_LLM_Training_Clusters.pdf`(ユーザー提供ローカル PDF、ICDCS 2026 掲載、DOI: 10.1109/2575-8411.2026.00049)
- Summary: [[@2026__ICDCS__MEGATRACE - Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters]]
- Pages created: [[@2026__ICDCS__MEGATRACE - Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters]](source)、[[MEGATRACE]]・[[Bolin Chen]]・[[Jiaxun Huang]]・[[Yanmin Jia]]・[[Xiaohe Hu]]・[[Bohua Xu]]・[[Bowen Han]](entity)
- Pages updated: [[Fangzheng Jiao]]・[[Menghao Zhang]]・[[Chunming Hu]]・[[Infrawaves]]・[[Beihang University]]・[[China Unicom Software Research Institute]]・[[Nanyang Technological University]]・[[MegaScale]]・[[Minder]]・[[Holmes]]・[[GreyHound]]・[[C4]]・[[Aegis]]・[[Megatron-LM]]・[[NCCL]](entity)、[[LLM学習モニタリング]]・[[クリティカルパス分析]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: LLM 訓練クラスタのハング・スローダウンという痕跡を残さないサイレント障害に対し、NCCL 集合通信 API 呼び出し(計算の narrow waist)と RDMA Work Request(通信の narrow waist)という 2 点のみの非侵入計装でオーバーヘッド 0.16% を実現しつつ、訓練スケジュール(TP/PP/DP)から反復ごとの依存 DAG を決定論的に再構築し、クリティカルパス分析でパイプラインバブルに吸収される偽陽性を除去する。これにより既存手法(MegaScale・Minder・Holmes・Aegis・GreyHound)が共通して見落とす「どの実行ステージで異常が起きたか」まで、いつ・どのランクかと合わせて一貫して特定できる点が新規性の核。ハング検知 F1=1.00(100% precision)、スローダウン検知 F1=0.95(既存 SOTA を 29.44% 改善)。[[Infrawaves]] の本番 2 クラスタでの具体的なケーススタディ(3840-GPU タスクでの `Recv` 欠落によるハング=ハードウェア障害 XID 109、256-GPU Docker 環境での CPU 割り当て不足)を報告する。
- 備考: pdf.js による埋め込みラスター画像抽出は5点(image-005-001/002・image-009-001・image-010-001/002)取得できたが、うち Fig.12(スローダウンシミュレーション)のグラフそのものに対応するのは1点のみで、残り12図はベクター描画のため PyMuPDF のキャプション座標クロップで取得。Fig.1〜13 の全13点・Table I(Markdown 表転記)を本文該当セクションの近傍に埋め込んだ。著者陣(筆頭 [[Fangzheng Jiao]]、対応著者 [[Menghao Zhang]]・[[Chunming Hu]])は本 vault 既存の Vedrfolnir(SIGCOMM Posters and Demos 2025)と同一 [[Beihang University]] 研究グループで、同一の国家自然科学基金(No.62402025)の支援を受けた継続研究であることを既存 entity ページの照合で確認した。全11ページ本文+参考文献36件を通読。
## [2026-08-13] ingest-paper | Vistara: Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment
- Source: `.raw/papers/Vistara_Making_CXL_Real-Full_Path_From_ASIC_Design_and_OS_Support_to_Hyperscale_Deployment.pdf`(ユーザー提供ローカル PDF、ISCA 2026 掲載、DOI: 10.1109/ISCA66397.2026.00061)
- Summary: [[@2026__ISCA__Vistara - Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment]]
- Pages created: [[@2026__ISCA__Vistara - Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment]](source)、[[Neha Gholkar]]・[[Vistara]](entity)、[[CXLによるメモリ拡張]](concept)
- Pages updated: [[Meta]]・[[Chunqiang Tang]]・[[AMD]](entity)、[[NUMAメモリ配置]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: Meta 初の自社設計 CXL ASIC「Vistara」(CXL 2.0/1.1 準拠、アイドルレイテンシ約50ns、消費電力約9W)のハードウェア設計から、Linux カーネルの TPP/TMO ベース階層化ソフトウェアスタック、数百万台規模フリートへの本番展開までを一気通貫で報告した業界初のエンドツーエンド CXL 実運用エビデンス。自社フリートの約40%がメモリ容量律速という課題に対し、廃止サーバの DDR4 DIMM 再利用によるコスト・炭素排出削減を実現しつつ、分散キャッシュで平均レイテンシ29%削減、分散 ML 推論でサーバ台数最大25%削減などの本番改善を実証した。先行研究([19] Dissecting CXL memory performance at scale、[44] Managing Memory Tiers with CXL in Virtualized Environments)が報告した CXL のテールレイテンシ不安定性・TPP オーバーヘッド懸念の双方を、Vistara の物理設計上の工夫(低レイテンシ設定・フロアプランニング・十分なバッファ深度)と本番実測データ(TPP オーバーヘッド0.5%未満)で反証した点が最大の貢献。knee-of-the-curve 分析(ホットフットプリント率を合成的に変化させたストレステスト)では75%超で性能劣化が始まることを示すが、評価した全本番ワークロードはこの閾値を大きく下回る安定領域(コールドページ比率75%以上)で稼働している。マルチテナントCXLフェアネス機構(Fair Share)により、コンテナ間のノイジーネイバー問題(QPS低下65%→12%)も解決している。
- 備考: pdf.js による埋め込みラスター画像抽出は対象0件(全13図がベクター描画のグラフ・アーキテクチャ図)のため、Figure 1〜13の全点をPyMuPDFのキャプション座標クロップ(3倍スケールレンダリング)で取得し、本文該当セクションの近傍に埋め込んだ。Table I〜XはMarkdown表への忠実な転記で対応(§2の表の扱い規約に従う)。全15ページ本文+参考文献45件を通読。TPP・TMOは既存の独立concept/entityページが存在しないため、本文中では平文表記(ダングリングリンク回避)とし、詳細は本source ページと新規concept「CXLによるメモリ拡張」に集約した。
## [2026-08-13] ingest-book | Designing Data-Intensive Applications, 2nd Edition
- Source: `.raw/books/designing-data-intensive-applications-2e/`(14 章 / 入力: web-clip。O'Reilly Learning の clip を `z97-materials/` から配置)
- Book entity: [[Designing Data-Intensive Applications 2nd Edition]]
- Chapters: [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 1 Trade-Offs in Data Systems Architecture]]〜[[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 14 Doing the Right Thing]](計 14 件、すべて `publish: false`)
- Pages created: entity 14 件([[Designing Data-Intensive Applications 2nd Edition]]・[[Martin Kleppmann]]・[[Chris Riccomini]]・[[PostgreSQL]]・[[Neo4j]]・[[Riak]]・[[Lucene]]・[[ZooKeeper]]・[[etcd]]・[[Debezium]]・[[Apache Spark]]・[[Apache Flink]]・[[Apache Avro]]・[[Temporal]])、concept 47 件([[リレーショナル対ドキュメントモデル]]・[[グラフデータモデル]]・[[イベントソーシングとCQRS]]・[[スター・スノーフレークスキーマ]]・[[DataFrame]]・[[転置インデックス]]・[[多次元索引]]・[[マテリアライズドビューとデータキューブ]]・[[スキーマ発展]]・[[バイナリエンコーディング]]・[[Durable Execution]]・[[単一リーダーレプリケーション]]・[[マルチリーダーレプリケーション]]・[[リーダーレスレプリケーション]]・[[レプリケーションラグと読み取り整合性]]・[[マルチテナンシーのためのシャーディング]]・[[二次インデックスのシャーディング戦略]]・[[ACIDと分離レベル]]・[[スナップショット分離とMVCC]]・[[ロストアップデートと書き込みスキュー]]・[[直列化可能性]]・[[部分故障]]・[[クロック同期と信頼性]]・[[ビザンチン障害]]・[[システムモデルと安全性・活性]]・[[分散ロックとリース]]・[[線形化可能性]]・[[ID生成器と論理クロック]]・[[コーディネーションサービス]]・[[MapReduce]]・[[データフローエンジン]]・[[分散ファイルシステムとオブジェクトストア]]・[[シャッフルと分散結合]]・[[変更データキャプチャ(CDC)]]・[[ストリーム結合]]・[[イベント時間とウィンドウ処理]]・[[ストリーム処理の耐障害性]]・[[データ統合]]・[[データベースのアンバンドリング]]・[[エンドツーエンド論]]・[[適時性と完全性]]・[[データウェアハウス]]・[[データレイク]]・[[予測分析とアルゴリズムバイアス]]・[[フィードバックループ]]・[[データのプライバシーと同意]]・[[データを資産・権力として見る視点]])
- Pages updated: entity 9 件([[Apache Cassandra]]・[[Apache Kafka]]・[[Chubby]]・[[Dynamo]]・[[Kubernetes]]・[[MongoDB]]・[[Netflix]]・[[Protocol Buffers]]・[[RocksDB]])、concept 41 件([[B-Tree]]・[[B-Treeノードレイアウト最適化]]・[[LSMツリー]]・[[LSMツリーコンパクション]]・[[TLA+]]・[[TrueTime]]・[[Write-Ahead Logging (WAL)]]・[[べき等性]]・[[インメモリデータベース]]・[[クエリ実行プラン]]・[[クォーラムベースレプリケーション]]・[[クラウドコンピューティング]]・[[グレイ障害]]・[[サービスレベル目標]]・[[シェアードナッシング]]・[[スケーラビリティ評価]]・[[ストレージ計算分離]]・[[データセンターネットワーク信頼性]]・[[データパーティショニング]]・[[フォールトトレランス]]・[[ベクトル検索インデックス]]・[[マテリアライズドメトリクス]]・[[リーダー選出]]・[[レイテンシ分析]]・[[一貫性ハッシュ法]]・[[並列データベース]]・[[分散コンセンサス]]・[[分散システム障害]]・[[分散トランザクション]]・[[分散メッセージブローカ]]・[[分散合意プロトコル]]・[[列指向OLAPデータベース]]・[[外部マージソート]]・[[外部一貫性]]・[[導出データ]]・[[権力集中リスク]]・[[知識グラフ]]・[[結果整合性]]・[[複製ステートマシン]]・[[軽量形式手法]]・[[障害注入]])、`wiki/index.md`・`wiki/hot.md`・各 `_index.md`・`.raw/.manifest.json`
- Key insight: 本書の技術的中核は**記録系(system of record)と導出データ(derived data)の区別**にある。第1章がこの対を定義し、第3章のイベントソーシングと CQRS、第11・12章のバッチとストリームによる導出手段、第13章の「全順序ログを介したデータ統合」とデータベースのアンバンドリング構想へと一続きに展開する。第9・10章(部分故障・信頼できないクロック・線形化可能性・合意の等価性)は、この vault が個別研究として蓄積してきた分散系・障害系 concept に共通の理論的下地を与えた。特に「リースの正しさは結局のところ合意に還元される」「フェンシングトークンとべき等性キーは同じ設計原理の別適用である」という2つの観察は、第9・10・12章の突き合わせで初めて見えたもので、新規 concept [[分散ロックとリース]] に記録した。目次から Part 分割が消え、初版の3部構成は第2版で撤廃されている。
- 原本の不備: (1) 一部の図の alt text が別の図の説明と取り違えられている(第6章で発見。実画像を確認して図番号を対応づけた)。(2) 図アセットに欠番があり、第9章は Figure 9-3、第10章は Figure 10-9 の画像が clip に含まれない。(3) 脚注番号だけ残り本文が欠落したサイドバーが複数ある(第2章で確認)。いずれも出典に無い内容は補完していない。
- 運用メモ: 書誌情報は O'Reilly の EPUB メタデータ API(`/api/v2/epubs/urn:orm:book:9781098119058/`)から確定した(2026-02-18 刊、672 ページ、ISBN 9781098119065、Part 分割なしの全14章)。図表は clip 内の資産 URL 102 点が認証なしで取得でき、うち100点を本文該当箇所へ埋め込んだ(第9章 Figure 9-5 のみ Figure 9-4 とほぼ同一構図のため除外、第5章 Figure 5-2 は同種の byte-breakdown 図のため代表2点に絞った)。14 章を Sonnet 5 subagent の 4 体並行ローリング実行で処理。並行中に別セッションが `wiki: ingest-paper | The Tail at Scale` をコミットし、[[レイテンシ分析]]・[[フォールトトレランス]] の本バッチ分の更新をそちらへ巻き込んだため、これら2件は本コミットには含まれない。
## [2026-08-13] ingest-paper | The Tail at Scale
- Source: `.raw/papers/TheTailAtScale.pdf`(著者 [[Luiz André Barroso]] 公開ページ barroso.org から取得。ユーザー提示 URL の research.google 紹介ページは PDF を直接ホストしていなかった)
- Summary: [[@2013__CACM__The Tail at Scale]]
- Pages created: [[@2013__CACM__The Tail at Scale]](source)、[[テールレイテンシ耐性技術]](concept)
- Pages updated: [[Jeffrey Dean]]・[[Luiz André Barroso]]・[[Google]]・[[Bigtable]](entity)、[[レイテンシ分析]]・[[フォールトトレランス]](concept)、`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`wiki/concepts/_index.md`・`.raw/.manifest.json`
- Key insight: 大規模分散システムのレイテンシばらつきをフォールトトレランス(Heimerdinger+Weinstock 1992)になぞらえ、原因を問わず緩和する「tail-tolerant」技術(ヘッジリクエスト・タイドリクエスト・カナリアリクエスト・マイクロパーティション)として体系化した基礎論文。既存 concept [[レイテンシ分析]] が DDIA 2E 経由で間接引用していたテールレイテンシ増幅の定量的根拠を、原典の Figure(ファンアウト数×外れ値頻度)と Table 1・2(実測レイテンシ削減率)で直接裏付けた。
- 備考: pdf.js による埋め込みラスター画像抽出は装飾イラスト1点(タイトルページ)のみで、本文が参照するテールレイテンシ確率のグラフはベクター描画のため PyMuPDF のキャプション座標クロップで取得した(1点)。Table 1・Table 2 は Markdown 表へ忠実に転記。
## [2026-08-13] ingest-book | SREをはじめよう(Becoming SRE 日本語版)
- Source: `.raw/books/becoming-sre-ja/`(20 枚 / 入力: pdf、原本 321 ページ)
- Book entity: [[SREをはじめよう]]
- Chapters: [[@2024__OReillyJapan__SREをはじめよう - Chapter 1 はじめに]]〜[[@2024__OReillyJapan__SREをはじめよう - Chapter 18 おわりに]] + [[@2024__OReillyJapan__SREをはじめよう - Appendix A 若きSREへの手紙]]・[[@2024__OReillyJapan__SREをはじめよう - Appendix B 元SREからのアドバイス]](計 20 件、すべて `publish: false`)
- Pages created: entity 13 件([[SREをはじめよう]]・[[David N. Blank-Edelman]]・[[Mikey Dickerson]]・[[Benjamin Purgason]]・[[Vivek Rau]]・[[Ben Lutch]]・[[Dave Rensin]]・[[John Reese]]・[[Joseph Bironas]]・[[Dina Levitan]]・[[Sara Smollett]]・[[Andrew Fong]]・[[Scott MacFiggen]])、concept 4 件([[SREの心構え]]・[[SRE文化]]・[[SREの提唱]]・[[NALSD]])
- Pages updated: entity 11 件([[Ben Treynor Sloss]]・[[Narayan Desai]]・[[Niall Murphy]]・[[John Allspaw]]・[[Alex Hidalgo]]・[[Fred Hebert]]・[[Jamie Wilkinson]]・[[David D. Woods]]・[[Richard I. Cook]]・[[Nancy G. Leveson]]・[[Heinrich Hartmann]])、concept 18 件([[トイル]]・[[カーゴカルトSRE]]・[[SRE組織変革]]・[[SREエンゲージメントモデル]]・[[SRE]]・[[DevOps]]・[[DORA]]・[[ポストモーテム]]・[[根本原因分析]]・[[レジリエンスエンジニアリング]]・[[カオスエンジニアリング]]・[[Safety-II]]・[[エラーバジェット]]・[[オブザーバビリティ]]・[[オンコールストレス管理]]・[[インシデントストーリー]]・[[分散システム障害]]・[[プラットフォームエンジニアリング]])、`wiki/index.md`・`wiki/hot.md`・各 `_index.md`・`.raw/.manifest.json`
- Key insight: 本書の中心は SRE を**心構え**として定義する立場(第2章)であり、そこから文化(第3章)・提唱(第4章)へ広げたうえで、同じ論点を個人視点(第Ⅱ部)と組織視点(第Ⅲ部)で二度扱う。「肩書きのフリップ」(第6章=個人の転身の失敗 / 第12章=組織の導入の失敗)、成功要因 8 つ(第11章)と失敗要因 8 つ(第12章)がその代表例である。実務的な出発点は [[Mikey Dickerson]] の 7 層の信頼性の階層構造(第14章)、組織構造は中央集権型・分散型・ハイブリッド型の 3 モデル(第15章)、組織の成熟は [[Benjamin Purgason]] の 5 段階(第16章。著者は意図的に「成熟度モデル」と呼ばない)、人のスケーリングは 0→1→6→18→48→108 の目安(第17章)として整理される。ビジネス接続では元 Google SRE 責任者 [[Ben Lutch]] と CRE 創設者 [[Dave Rensin]] へのインタビューから「SRE のゴールは自らを不要にすること」が導かれる(第13章)。
- 矛盾: (1) 第9章のトイル定義は本書訳で「戦略的であること」だが、既存 [[トイル]] 概念(『SRE本』訳)は「戦術的」で訳語が食い違う。(2) 第9章の「トイルは創造も破壊もできない」という著者の主張に技術レビュアー [[Niall Murphy]] が「根本的な設計変更は例外」と異議を唱え、著者は本文を修正せず脚注で紹介した。いずれも `> [!contradiction]` callout で明示。
- 対象外: 付録C(SRE関連資料リスト)・索引・著者紹介・奥付。原本テキストは `.raw/books/becoming-sre-ja/chapters/ch-21.txt`・`ch-22.txt` に保持のみ。
- 運用メモ: `fetch-book.sh` の章検出が Part 単位(13 件)に化けたため、`toc.txt` の level2 アウトラインから章境界を割り出し `--chapters` で再分割した。321 ページのため画像一括抽出(`extract-paper-images.mjs`)は実行せず、本文の図参照を grep して全巻 3 点(図1-1・図1-2・図14-1)と特定したうえで PyMuPDF で該当ページからクロップした。第14章の階層強調ピラミッド 6 点はほぼ同一構図の繰り返しのため取り込んでいない。
## [2026-08-12] ingest-book(増分) | Observability Engineering, 2nd Edition 第27章
- Source: `.raw/books/observability-engineering-2e/chapters/ch-27.md`(直前の一括 ingest 時点では clip 未取得だった唯一の章。ユーザーが同日中に clip を追加した)
- Book entity: [[Observability Engineering 2nd Edition]]
- Chapters: [[@2026__OReilly__Observability Engineering 2E - Chapter 27 Diagnosing Your Observability Investment]](`publish: false`)。これで**全32章が揃った**
- Pages created: 章 source 1 件
- Pages updated: entity 1 件([[Gartner]])、concept 4 件([[フィードバック駆動開発]]・[[開発者生産性]]・[[インシデント影響測定]]・[[テレメトリパイプライン]])、章 source 3 件(第26章・第28章の Navigation を第27章経由に繋ぎ直し、第29章の「第27章は未取り込み」注記を実リンクに置換)、[[Observability Engineering 2nd Edition]]・`wiki/index.md`・`wiki/hot.md`・`wiki/sources/_index.md`・`.raw/.manifest.json`
- Key insight: 本章は第26章の業務ケース論を受け、**運用ループはコストセンター、開発者学習ループは戦略的投資**という統治モデルの区別を診断軸に据える。両者の混同(第23章が「観測プライスで監視アウトカムを買う」と命名した失敗)が支出膨張の構造的原因だとし、運用側4指標・開発者学習側5指標で投資の効き目を判定させる。Gartner によればオブザーバビリティのコストは過去15年間毎年40%以上上昇し、R&D 支出でクラウドに次ぐ第2位に達している。第16章のテレメトリパイプライン(Reduce/Route)に本章の階層化テレメトリという配分方針が具体を与える対応、第26章の FCI(定量的厳密さ)と本章の「影響声明」(射程の広さ)がトレードオフ関係にある対応が、新たな横断的知見として記録された。
- 運用上の注意: 前エントリ「[2026-08-12] ingest-book | Observability Engineering, 2nd Edition」に記した「未取り込み: 第27章」は本エントリで解消した(log は追記式のため過去エントリは編集していない)。
## [2026-08-12] ingest-book | Observability Engineering, 2nd Edition
- Source: `.raw/books/observability-engineering-2e/`(31 章 / 入力: web-chapters、O'Reilly Learning からの clip)
- Book entity: [[Observability Engineering 2nd Edition]]
- Chapters: [[@2026__OReilly__Observability Engineering 2E - Chapter 1 What Is Observability?]]〜[[@2026__OReilly__Observability Engineering 2E - Chapter 32 Where Do We Go From Here?]](第1〜26章・第28〜32章の 31 件、全て `publish: false`)
- Pages created: entity 44 件([[Austin Parker]]・[[Bindplane]]・[[Chad Fowler]]・[[Charity Majors]]・[[Christine Yen]]・[[CircleCI]]・[[Coreplane Labs]]・[[Darragh Curran]]・[[Donella Meadows]]・[[Embrace]]・[[Eric Trist]]・[[Fin]]・[[Frank Chen]]・[[Fred Hebert]]・[[Gartner]]・[[George Miranda]]・[[GitHub Actions]]・[[Hanson Ho]]・[[Hazel Weakly]]・[[Heidi Waterhouse]]・[[Hugo Santos]]・[[HyperDX]]・[[Intercom]]・[[Jeremy Morrell]]・[[Karpenter]]・[[Kesha Mykhailov]]・[[Mark Callaghan]]・[[Martin Fowler]]・[[Mat Vine]]・[[Matt Klein]]・[[Mike Kelly]]・[[Namespace Labs]]・[[Nivenly Foundation]]・[[OTel Weaver]]・[[Observability Engineering 2nd Edition]]・[[OpAMP]]・[[Peter Corless]]・[[Phillip Carter]]・[[Retriever]]・[[Rick Clark]]・[[Rudolf E. Kálmán]]・[[Simon Wardley]]・[[UST]]・[[dynsampler-go]])、concept 14 件([[AIサンドイッチアーキテクチャ]]・[[Build Versus Buy]]・[[CI-CDオブザーバビリティ]]・[[オブザーバビリティ駆動開発]]・[[コードのキャッシュ化]]・[[ストラングラーフィグ]]・[[ソシオテクニカル負債]]・[[テレメトリパイプライン]]・[[フィーチャーフラグ]]・[[ベンダーエンジニアリング]]・[[モバイルオブザーバビリティ]]・[[ユーザー中心オブザーバビリティ]]・[[レバレッジポイント]]・[[構造化イベント]])
- Attachments created: `wiki/sources/_attachments/observability-engineering-2e/`(95 点)
- Pages updated: entity 22 件([[ANZx]]・[[AWS Lambda]]・[[Alex Hidalgo]]・[[Apache Kafka]]・[[Boris Tane]]・[[Brendan Gregg]]・[[Bryan Cantrill]]・[[ClickHouse]]・[[ClickHouse Inc]]・[[Cloudflare]]・[[Cursor]]・[[Dapper]]・[[Docker]]・[[Facebook]]・[[Honeycomb.io]]・[[Jens Rasmussen]]・[[Kubernetes]]・[[Liz Fong-Jones]]・[[MongoDB]]・[[OBI]]・[[OpenTelemetry]]・[[RocksDB]])、concept 62 件([[AIOps]]・[[DORA]]・[[DTrace]]・[[DevOps]]・[[GenAI オブザーバビリティ]]・[[Harness Engineering]]・[[LLMアプリケーション信頼性]]・[[LLM評価]]・[[LSMツリー]]・[[Retroactive Sampling]]・[[SRE AI Autonomy Levels]]・[[SREエンゲージメントモデル]]・[[SRE組織変革]]・[[Scaling Telemetry Workloads]]・[[Security Level Objectives]]・[[Zonemap]]・[[agentic SRE]]・[[eBPF]]・[[アムダールの法則]]・[[アラート疲労]]・[[イベントベースSLO]]・[[インシデントメトリクス]]・[[インシデント影響測定]]・[[エラーバジェット]]・[[オブザーバビリティ]]・[[オブザーバビリティデータモデル]]・[[カナリアテスト]]・[[クォーラムベースレプリケーション]]・[[クリティカルパス分析]]・[[コンテキストエンジニアリング]]・[[サイバネティクス]]・[[サーバーレスアーキテクチャ]]・[[サービスレベル目標]]・[[ストレージ計算分離]]・[[ダイナミックケイパビリティ]]・[[テスト障害診断]]・[[テレメトリ]]・[[ディペンダビリティ]]・[[データパーティショニング]]・[[トレースサンプリング]]・[[トレードオフ意思決定]]・[[ネスト型カラムナストレージ]]・[[パフォーマンスエンジニアリング]]・[[ヒストグラムメトリクス]]・[[フィードバック駆動開発]]・[[フレームグラフ]]・[[プラットフォームエンジニアリング]]・[[ヘルメティックビルド]]・[[メトリクス削減]]・[[ログ重複排除]]・[[事故モデル]]・[[仮説駆動RCA]]・[[分散トレーシング]]・[[列指向OLAPデータベース]]・[[時系列データベース]]・[[知識のリレーションシップモデル]]・[[知識グラフ]]・[[組織の信頼性マインドセット]]・[[継続的プロファイリング]]・[[訓練不変条件]]・[[逸脱の正常化]]・[[開発者生産性]])、`wiki/index.md`・`wiki/hot.md`・各 `_index.md`・`.raw/.manifest.json`
- Key insight: 初版(2022)が「オブザーバビリティとは何か」を業界に説得する本だったのに対し、第2版は著者自身が第3章で「定義の戦いに敗れた」と総括したうえで Observability 1.0(三本柱・運用向け)/2.0(統合ストレージ・開発者向け)という区分で再出発する。技術的中核は [[構造化イベント]](ワイドイベント)を唯一の下部構造とし、メトリクス・ログ・トレースをそこからの導出物として扱う主張で、第5章の理論・第6章の属性カタログ(6分類22表)・第13/14章の [[Retriever]] と [[ClickHouse]] のストレージ実装・第19章のモバイル適用が一貫してこれを裏づける。第2版を初版から隔てるのは AI の位置づけで、AI 生成コードの本番検証(第2章)・調査補助エージェント(第8・10章)・LLM アプリケーションの評価(第21章)・組織の学習速度という制約(第23章)・コード自体の位置づけの変化(第32章)と全体を貫く強制関数として扱われる。[[SRE Book]] が運用側の実践を体系化したのに対し本書は開発者側のフィードバックループに軸足を置き、第25章が「運用ループ対開発者ループ」として定式化する。ingest 全体では、第13章(Retriever)と第14章(ClickHouse)が独立に「遅延実体化・粗いプルーニングへの収斂」へ到達した点([[列指向OLAPデータベース]]・[[Zonemap]] に記録)、本書が [[eBPF]] を「既存計装の補完」と控えめに位置づけるのに対し既存 wiki の学術系譜(DeepFlow 等)は主役級に扱う温度差([[eBPF]] の未解決の問い)、第26章の素朴な MTTD/MTTR 扱いと既存 concept が蓄積した VOID/Davidovič の MTTR 批判との緊張([[インシデントメトリクス]])などが横断的知見として得られた。
- 未取り込み: 第27章 "Diagnosing Your Observability Investment"(clip 未取得。第29章本文からの参照でのみ存在を確認)。Preface はユーザーの選択により独立 source ページを作らず book entity の「概要」「書誌情報」「構成と主要テーマ」へ集約した。
- 運用上の注意: (1) 図表は clip 内の `learning.oreilly.com` 資産 URL が認証なしで取得でき、オーケストレータが 95 点を一括ダウンロードして `.raw/books/observability-engineering-2e/images/` に置き、`images.json` で章別に振り分けたうえで各章 subagent が本文該当箇所へ埋め込んだ(全 95 点を採用、除外ゼロ)。(2) 31 章を Sonnet 5 subagent の 4 体並行ローリング実行(1 体完了ごとに次章を投入)で処理した。同一 concept への並行編集は wiki-lock で衝突なく統合され、複数の subagent が編集競合を検出して再読み込み・マージした旨を報告している。(3) 章 source ページ名の book 部分は `Observability Engineering 2E` と短縮した(第23章の章題が長く、フルタイトルではファイル名が過度に伸びるため)。禁則文字は conventions どおり `:` → ` - `、`/` → `-`(第18章 `CI-CD`)と置換した。(4) subagent の自己申告と実体が食い違う例が 1 件あった(第29章が新規 concept 名を「ビルド対バイ意思決定」と報告したが実ファイルは `Build Versus Buy.md`)。索引・log に載せた一覧は報告文ではなく `git status` の実体から生成している。(5) 第2章の原本には "Practice 1" 見出しが存在せず Practice 0 → 2 と飛ぶが、clip の欠落ではなく原本どおりであることを確認し、番号を捏造せずそのまま保持した。
## [2026-08-12] ingest-book | 詳解 システム・パフォーマンス 第2版
- Source: `.raw/books/systems-performance-2nd-ja/`(16 章 / 入力: pdf、940 ページ)
- Book entity: [[詳解 システム・パフォーマンス 第2版]]
- Chapters: [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 1 イントロダクション]]〜[[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 16 ケーススタディ]](16 件、全て `publish: false`)
- Pages created: entity 8 件([[詳解 システム・パフォーマンス 第2版]]・[[perf]]・[[Ftrace]]・[[trace-cmd]]・[[perf-tools]]・[[KernelShark]]・[[Steven Rostedt]]・[[Alastair Robertson]])、concept 37 件([[USE メソッド]]・[[RED メソッド]]・[[ワークロードの特性の把握]]・[[ドリルダウン分析]]・[[レイテンシ分析]]・[[パフォーマンスのアンチメソドロジ]]・[[ベンチマーキング]]・[[待ち行列理論]]・[[ユニバーサルスケーラビリティ法則]]・[[レイテンシヒートマップ]]・[[フレームグラフ]]・[[システムコール]]・[[コンテキストスイッチ]]・[[アプリケーション並行実行モデル]]・[[同期プリミティブ]]・[[スレッド状態分析]]・[[スケジューラレイテンシ]]・[[仮想メモリとページング]]・[[Linuxメモリ回収]]・[[メモリアロケータ]]・[[NUMAメモリ配置]]・[[メモリリークとメモリ増大]]・[[ヒュージページ]]・[[ファイルシステムキャッシュ階層]]・[[プリフェッチと先読み]]・[[ライトバックキャッシングと同期書き込み]]・[[ランダムIOとシーケンシャルIO]]・[[Raw IOとDirect IO]]・[[ローカルファイルシステム実装比較]]・[[IOスケジューラ]]・[[RAID]]・[[TCP輻輳制御アルゴリズム]]・[[バッファブロートとキュー管理]]・[[ネットワーク割り込み合体とCPUスケーリング]]・[[TCPバックログキューとSYNクッキー]]・[[ハードウェア仮想化]]・[[kprobe]])
- Attachments created: `wiki/sources/_attachments/systems-performance-2nd-ja/`(166 点)
- Pages updated: entity 9 件([[Brendan Gregg]]・[[Netflix]]・[[Linux]]・[[FreeBSD]]・[[BCC]]・[[bpftrace]]・[[Kubernetes]]・[[Docker]]・[[Firecracker]])、concept 22 件([[アムダールの法則]]・[[オブザーバビリティ]]・[[パフォーマンスエンジニアリング]]・[[継続的プロファイリング]]・[[動的計装]]・[[ハードウェアカウンタ]]・[[Instructions Per Cycle]]・[[CPU利用率]]・[[同時マルチスレッディング]]・[[メモリ階層とキャッシュ]]・[[NUMA対応CPUピニング]]・[[ページキャッシュカスタマイズ]]・[[ハードディスク信頼性]]・[[データセンター輻輳制御]]・[[パケットフィルタリング]]・[[クラウドコンピューティング]]・[[コンテナ仮想化]]・[[カナリアテスト]]・[[BPF]]・[[eBPF]]・[[DTrace]]・[[uprobe]])、`wiki/index.md`・`wiki/hot.md`・各 `_index.md`・`.raw/.manifest.json`
- Key insight: 本書はメソドロジ(第2章)を先に確立し、それを CPU→メモリ→ファイルシステム→ディスク→ネットワーク→クラウドへ順に適用する構成そのものを主張としている。第2版の改訂の中心は主対象の Solaris/DTrace から Linux/拡張BPF への移行で、[[perf]]・[[Ftrace]]・[[BCC]]/[[bpftrace]] に 1 章ずつを充てる第13〜15章がそれにあたる。第16章は [[Netflix]] のコンテナ移行で観測された 3〜4 倍の高速化を「隣人不在・LLCヒット率差(30%対90%)・CPU負荷差」の重なりと結論し、本番では持続しないと判断する。ingest 全体では既存 concept との突き合わせで、第4章のカーネル uprobe オーバーヘッド実測値(1,287ns)が既存ソース [[@2025__OSDI__Extending Applications Safely and Efficiently]] の報告値(約2,500〜3,000ns)と約2倍乖離する点([[uprobe]] に測定条件依存として記録)、第2章のアムダールの法則の定式化が [[wiki/entities/実践的パフォーマンスエンジニアリングによるAI高速化|実践的パフォーマンスエンジニアリングによるAI高速化]] の P/S 形式と数学的に同型の別表現である点([[アムダールの法則]])などが横断的知見として得られた。
- 運用上の注意: (1) 940 ページのため画像一括抽出(`extract-paper-images.mjs`)は使わず、PyMuPDF でキャプション座標と描画 bbox の合併から図領域を精密クロップして 166 点を取得した。(2) `fetch-book.sh` の章検出が日本語書籍の節見出し(「1.2 なぜ〜」等)を拾って 142 件になったため、`toc.txt` のレベル1アウトラインから章境界を割り出し `--chapters "1=37,2=59,...,17=843"` で 16 章に再分割した(17 番目の境界は付録の開始位置で、生成物は `chapters/appendix.txt` にリネームして ingest 対象外とした)。(3) 図11-10 のみ本文中の参照文「図11-10に示すように、…」をキャプションと誤認してファイル名が衝突し、正しい図が上書きされていた。オーケストレータが正しいページから再生成して埋め込み直した。同種の衝突は `figures.json` の重複ファイル名検査で全書籍分を確認済み(他になし)。
## [2026-08-11] fix-book | AI Systems Performance Engineering(書籍リンク修正 + 図表全面追加)
- Source: `.raw/books/ai-systems-performance/`(章別ウェブページ 21 件。原本の図表 195 点を `images/ch-NN/` に取得)
- Book entity: [[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]]
- Pages updated: 章 source 20 件(Chapter 1〜20)+ Appendix、`wiki/index.md`、`wiki/hot.md`、`wiki/entities/_index.md`、entity 10 件・concept 12 件(リンク修正のみ)、`.raw/.manifest.json`
- Attachments created: `wiki/sources/_attachments/ai-systems-performance/`(193 点)
- Key insight: 章 source からの書籍ハブへのリンク `[[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]]` が、既存の一次レイヤーノート `books/AI Systems Performance Engineering.md` と basename 衝突し、Obsidian の shortest path 解決で `books/` 側へ誤解決していた。source の `@` プレフィックスと同じ問題が entity 側でも起きうることを示す事例で、対処として wiki 内の当該リンクを全て `[[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]]` とパス修飾した(`log.md` の過去エントリは追記式の規約どおり温存)。あわせて初回 ingest で見送っていた図表を全面追加した。原本の画像 URL(learning.oreilly.com の assets)は認証なしで取得でき、章ごとに subagent を出して全 195 点を確認のうえ 193 点を本文の該当記述直後に埋め込んだ(除外は Chapter 6 の Figure 6-12・6-15 の 2 点のみ)。埋め込み先ファイルの実在は突き合わせ検証済みで、リンク切れ・未使用ファイルはいずれもゼロ。
## [2026-08-11] ingest-book | AI Systems Performance Engineering
- Source: `.raw/books/ai-systems-performance/`(21ファイル / 入力: 章別ウェブページ、ユーザー提供のdefuddle抽出済みmarkdown)
- Book entity: [[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]]
- Chapters: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]]〜[[@2025__OReilly__AI Systems Performance Engineering - Chapter 20 AI-Assisted Performance Optimizations and Scaling Toward Multimillion GPU Clusters]]・[[@2025__OReilly__AI Systems Performance Engineering - Appendix AI Systems Performance Checklist]](21件)
- Pages created(entity・concept): [[NVIDIA GB200 NVL72]]、[[NVIDIA DALI]]、[[Tensor Memory Accelerator]]、[[CUTLASS]]、[[NVSHMEM]]、[[OpenAI Triton]]、[[NVIDIA Nsight Systems]]、[[Rubin CPX]]、[[AlphaTensor]]、[[Predibase]]、[[Mechanical Sympathy]]、[[Goodput]]、[[NVLink]]、[[NUMA対応CPUピニング]]、[[GPU多重化(MPS・MIG)]]、[[GPU占有率(Occupancy)]]、[[メモリコアレッシング]]、[[共有メモリバンクコンフリクト]]、[[Warp Divergence]]、[[Instruction-Level Parallelism (GPU)]]、[[Occupancy (GPU)]]、[[Warp Specialization]]、[[Thread Block Cluster]]、[[Persistent Kernel]]、[[CUDA Stream]]、[[Programmatic Dependent Launch]]、[[Dynamic Parallelism]]、[[torch.compile]]、[[動的バッチングと継続的バッチング]]、[[動的精度切り替え]]、[[カーネルオートチューニング]]
- Pages updated: [[NVIDIA]]、[[PyTorch]]、[[Kubernetes]]、[[NCCL]]、[[NIXL]]、[[DeepSeek-V3]]、[[3FS]]、[[GPUDirect Storage]]、[[NVIDIA Dynamo]]、[[AI Futures Project]]、[[Rooflineモデル]]、[[GPU起動型ネットワーキング]]、[[RDMA]]、[[GPUストレージIOデータパス]]、[[CUDA]]、[[CUDAGraph]]、[[カーネルフュージョン]]、[[混合精度訓練]]、[[量子化]]、[[並列化戦略]]、[[Mixture-of-Experts]]、[[Prefill-Decode分離]]、[[Speculative Decoding]]、[[KVキャッシュ管理]]、[[メモリ階層とキャッシュ]]、[[LLM駆動GPUカーネル生成]]
- Key insight: Chris Fregly著、O'Reilly Media刊(2025年11月頃)。ハードウェア基盤(第1〜2章)→OS/ストレージ/ネットワーキング(第3〜5章)→CUDAカーネル最適化(第6〜12章)→PyTorchとコンパイラ(第13〜14章)→分散推論サービング(第15〜20章)→175項目超チェックリスト(Appendix)という一貫した抽象度の階段構成を持つ。DeepSeekのH800輸出規制下最適化事例(mechanical sympathy・goodput)を導入の起点に据え、Blackwell世代GPUハードウェアの物理層(NVLink/NVSwitch/液冷)からvLLM/SGLang/NIXL/llm-dといった最新の分散推論サービングスタックまでを実測値・ベンチマーク付きで一気通貫に扱う実務書。21章(20章+Appendix)を4体×5ウェーブ+1体の並列subagentで処理し、著作権対応で全章 `publish: false`、原本の画像URLは埋め込み・ダウンロードせずテキストのみで処理した。複数のsubagentが「次にやります」という未完了の予告で応答を終える事例が繰り返し発生したため、オーケストレータが都度`git status`/`git diff`で実体を確認し、未完了だった箇所(Chapter 12のNavigation行、KVキャッシュ管理.mdのChapter 19出典追記)を補完した。
## [2026-08-11] ingest-paper | LEMMA-RCA: A Large Multi-modal Multi-domain Dataset for Root Cause Analysis
- Source: `.raw/papers/arxiv-2406.05375.pdf`(arXiv:2406.05375)
- Summary: [[@2024__arXiv__LEMMA-RCA - A Large Multi-modal Multi-domain Dataset for Root Cause Analysis]]
- Pages created: [[@2024__arXiv__LEMMA-RCA - A Large Multi-modal Multi-domain Dataset for Root Cause Analysis]]、[[Lecheng Zheng]]、[[Dongjie Wang]]、[[Chengyuan Deng]]、[[Reon Matsuoka]]、[[University of Kansas]]、[[NEC Laboratories Japan]]
- Pages updated: [[Zhengzhang Chen]]、[[Haifeng Chen]]、[[RCA評価設計]]、[[ドメイン別RCA]]、[[根本原因分析]]
- Key insight: IT運用(マイクロサービス2種)とOT運用(水処理・水配送2種)にまたがる実障害RCAベンチマークデータセット LEMMA-RCA(NEC Laboratories America/Japan・UIUC・University of Kansas・Rutgers、arXiv 2024)。6種のRCAベースラインをmetric only/log only/multi-modalityの3設定で評価し、モダリティ統合の効果を定量化(Product ReviewでBAROのPR@1が25%→75%へ改善)。CIRCAはドメインを越えて上位性能を維持する一方、multi-modal化の改善効果はドメイン依存という知見を得た。図表7点(image-*.png)はpdf.js埋め込み画像抽出で取得。全ページのフルレンダリングは特定ページ付近で繰り返しネイティブクラッシュしたため、埋め込みラスター画像の抽出のみで完結させた(付録の重複図は本文図の再掲のため実質的欠落なし)。
## [2026-08-11] ingest-paper | Constructing Large-Scale Real-World Benchmark Datasets for AIOps
- Source: `.raw/papers/arxiv-2208.03938.pdf`(arXiv:2208.03938、ESEC/FSE 2022 Industry Track)
- Summary: [[@2022__ESEC FSE__Constructing Large-Scale Real-World Benchmark Datasets for AIOps]]
- Pages created: [[@2022__ESEC FSE__Constructing Large-Scale Real-World Benchmark Datasets for AIOps]]
- Pages updated: [[Zeyan Li]]、[[Nengwen Zhao]]、[[Shenglin Zhang]]、[[Yongqian Sun]]、[[Pengfei Chen]]、[[Xidao Wen]]、[[Minghua Ma]]、[[Dan Pei]]、[[Tsinghua University]]、[[Nankai University]]、[[Sun Yat-sen University]]、[[Microsoft Research]]、[[根本原因分析]]、[[時系列異常検知ベンチマーク]]
- Key insight: NetManAIOps ネットワーク(Zeyan Li・Nengwen Zhao・Shenglin Zhang・Yongqian Sun・Pengfei Chen・Xidao Wen・Minghua Ma・Dan Pei、ESEC/FSE 2022 Industry Track)が公開してきた KPI 異常検知(dataset A)・多次元根本原因箇所特定(dataset B)・障害発見/診断(dataset C)の 3 データセットと、2018/2019/2020 年の年次 AIOps アルゴリズムコンペティション(合計 407 チーム参加)を紹介する短編。dataset B(B0〜B4)は [[Squeeze]] 等、本 wiki が既に収集済みの複数の RCA 論文の一次データ源であることが確認でき、合成障害(GRE + ガウスノイズによる 400 件)という評価前提を [[根本原因分析]] concept に接地した。dataset A(27 KPI、実務エンジニア手動ラベル)は [[時系列異常検知ベンチマーク]] concept に、TimeEval(2022)より前から確立していた産業ベンチマークの事例として追記した。図表 3 点はいずれもベクター描画のため PyMuPDF キャプション座標クロップで取得。
## [2026-08-11] ingest-book | 実践的パフォーマンスエンジニアリングによるAI高速化: 図表の全面追加取り込み
- 対象: 8章すべての source ページ(`.raw/books/practical-ai-performance-engineering/`)
- 背景: `wiki-ingest-book` skill の図表選定方針を「1章あたり0〜3枚に厳選」から「除外理由がない限り全部取り込む」に変更(SKILL.md Step 0.5 §3)。既存ページに埋め込み済みだった図(各章1〜2枚)に加え、未取り込みの図表をPyMuPDFキャプション座標クロップで追加した。
- 追加した図表数: 第1章11枚(新規11)・第2章14枚(新規14)・第3章7枚(新規7)・第4章19枚(新規18)・第5章18枚(新規16)・第6章31枚(新規30、図20点+表11点)・第7章22枚(新規21、図16点+表6点)・第8章17枚(新規15、図14点+表3点)。合計139枚。
- Pages updated: 全8章の source ページ(`wiki/sources/@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 1〜8 ...md`)
- Key insight: 章によって図表の配置規約が異なる(図のキャプションは図の下、表のキャプションは表の上)ため、クロップ境界を誤ると隣接する図表を混入させる不具合が繰り返し発生した(表の直後に図が続くページ・図の直後に表が続くページで特に頻発)。PyMuPDFの`get_drawings()`によるベクター描画の実際の境界と、キャプション文字列の前後関係を都度確認しながら手動で補正した。図表点数が多い章(第6章30点弱)ではsubagentへの委任が繰り返し「品質チェックの反復」で打ち切られたため、オーケストレータが直接クロップスクリプトを書いて処理した。
## [2026-08-11] ingest-book | 実践的パフォーマンスエンジニアリングによるAI高速化(技術評論社 2026)
- Source: `.raw/books/practical-ai-performance-engineering/`(8 章 / 入力: 書籍全体PDF、401ページ)
- Book entity: [[wiki/entities/実践的パフォーマンスエンジニアリングによるAI高速化|実践的パフォーマンスエンジニアリングによるAI高速化]](新規)
- Chapters: [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 1 パフォーマンスエンジニアリング概論]]〜[[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 8 実践5:自動運転AI推論]](8件、いずれも publish: false)
- Pages created: [[量子化]]、[[枝刈り]]、[[パフォーマンスエンジニアリング]]、[[アムダールの法則]]、[[Llama3]]、[[BEVFusion]]
- Pages updated: [[Fixstars]]、[[Megatron-LM]]、[[Brendan Gregg]]、[[Rooflineモデル]]、[[FlashAttention]]、[[Speculative Decoding]]、[[並列化戦略]]、[[GPU観測性]]
- Key insight: フィックスターズ社員10名がLLM(Llama3)と自動運転AI(BEVFusion)を題材に、計測から改善までのパフォーマンスエンジニアリングの一連のプロセスを解説する書籍。前半(第1〜3章)で計測・改善手法を体系的に俯瞰し、後半(第4〜8章)でLLM推論・LLM事後学習・LLM事前学習・自動運転AI学習・自動運転AI推論の5実践事例に同一方法論を適用する。第3章で定義された [[量子化]]・[[枝刈り]] は第8章(自動運転AI推論のエッジデプロイ)の実測で「演算律速では量子化が有効、メモリ律速では枝刈りの効果が限定的」という対照的な条件依存性が具体化された。PyMuPDFの`get_toc()`が節単位(63件)を誤検出したため、`第N章`パターンの目次アウトラインで手動補正して正しい8章境界を再検出した。401ページ超のため一括画像抽出はスキップし、章ごとにキャプション座標クロップで代表図7枚を取得。8章を4体×2ウェーブの並列subagentで処理した。
## [2026-08-11] ingest-book | Site Reliability Engineering(SRE Book)第 2・8・9 章
- Source: `.raw/books/sre-book/chapters/ch-02.md, ch-08.md, ch-09.md`(入力形態: 章別ウェブページ、defuddle で取得。`wiki-ingest-book` skill の初適用)
- Book entity: [[SRE Book]](更新: 第 2・8・9 章リンクを追加、Part 章範囲を公式目次準拠に補正、5 部構成へ訂正)
- Chapters: [[@2016__OReilly__SRE Book - Chapter 2 The Production Environment at Google, from the Viewpoint of an SRE]]、[[@2016__OReilly__SRE Book - Chapter 8 Release Engineering]]、[[@2016__OReilly__SRE Book - Chapter 9 Simplicity]](いずれも publish: false)
- Pages created: [[Colossus]]、[[JC van Winkel]]、[[Dinah McNutt]]、[[Max Luebbe]]、[[Rapid]]、[[Blaze]]、[[ヘルメティックビルド]]、[[本質的複雑性と偶発的複雑性]]
- Pages updated: [[SRE Book]]、[[Borg]]、[[Chubby]]、[[Bigtable]]、[[Stubby]]、[[分散コンセンサス]]
- Key insight: 章ごと source + 書籍ハブ entity という SRE Book の既存運用を skill 化した初回実行。第 2 章が定義する用語法で Google インフラ系 entity 群を一次資料に接地し、第 8 章のヘルメティックビルドと第 9 章の偶発的複雑性除去が「変更の安全な高速化」という共通原則で接続することを確認した。既存 SRE Book entity の Part 章範囲の誤り(Part III を第 6 章開始としていた)を公式目次で検出・補正した。
## [2026-08-11] ingest-paper | Aegis: Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems
- Source: `.raw/papers/seip23_ageis_cameraReady.pdf`(Microsoft Research 公開 PDF、ICSE-SEIP '23。https://www.microsoft.com/en-us/research/wp-content/uploads/2022/12/seip23_ageis_cameraReady.pdf から取得)
- Summary: [[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]]
- Pages created: [[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]]、[[Aegis (Azure Control Plane)]]、Xiaohan Yan、[[Yasitha Liyanage]]
- Pages updated: [[Ken Hsieh]]、[[Minghua Ma]]、[[Murali Chintalapati]]、[[Qingwei Lin]]、[[Yingnong Dang]]、[[Dongmei Zhang]]、[[Microsoft Azure]]、[[Gandalf]]、[[Aegis]]、[[変更起因インシデント]]、[[ソフトウェア変更管理]]
- Key insight: Microsoft Azure control plane 向けの component/layer 横断変更影響帰属・緩和サービス Aegis(Xiaohan Yan ら、ICSE-SEIP '23)は、ドメイン知識駆動の相関エンジン(時間的相関×空間的相関×fault-component関連度重み、build レベル分布集約、layer射影/分解)と反実仮想射影モデルで、単一 component 監視では捉えられない cross-component・cross-layer の変更起因障害を検出・緩和する。2022年実デプロイでprecision・recallともに約80%を達成し、ablationでドメイン知識(Signature Weight)の寄与(precision 37.5%低下)を定量的に実証した。同じAzureチームの一部が開発した component レベル監視 Gandalf(NSDI 2020、本日先行ingest)の直接の後継系譜であり、「単一コンポーネント→複数コンポーネント・複数レイヤー」への3年間の設計拡張を示す。Alibaba の同名システム(NSDI 2025、既存entity)との命名衝突に対処するため、新規entityを `Aegis (Azure Control Plane)` として disambiguation した。既存concept [[変更起因インシデント]]・[[ソフトウェア変更管理]] にAegisの横断的知見を追記した。
## [2026-08-11] ingest-paper | Gandalf: An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure
- Source: `.raw/papers/nsdi20-paper-li.pdf`(USENIX 公開 PDF、NSDI '20。https://www.usenix.org/conference/nsdi20/presentation/li から解決)
- Summary: [[@2020__NSDI__Gandalf - An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure]]
- Pages created: [[@2020__NSDI__Gandalf - An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure]]、[[Gandalf]]、[[Qian Cheng]]、[[Ken Hsieh]]、[[Pankaj Singh]]、[[Xinsheng Yang]]、[[Youjiang Wu]]、[[Sebastien Levy]]
- Pages updated: [[Ze Li]]、[[Yingnong Dang]]、[[Peng Huang]]、[[Qingwei Lin]]、[[Murali Chintalapati]]、[[Johns Hopkins University]]、[[Microsoft Azure]]、[[Microsoft Research]]、[[変更起因インシデント]]、[[カナリアテスト]]
- Key insight: Microsoft Azure の end-to-end 安全デプロイ分析サービス Gandalf(Ze Li ら、NSDI '20)は、コンポーネント個別の watchdog では捉えられないクラスタ横断の障害影響を、異常検知 → 相関分析(vote-veto → 空間・時間相関 → 時間減衰)→ 決定プロセス(Gaussian discriminant classifier)の3段階モデルでトップダウンに評価する。Azure で18ヶ月以上稼働し precision 90%超・recall 99%超を達成した産業スケールの実証例であり、空間相関の導入が correlation precision を77%改善する最大の寄与要因だった。NSDI 2020 発表から4年以上を経ても FUNNEL/SCWarn/ChangeRCA/Guardian 等の後続研究で標準的な比較ベースラインとして参照され続ける中核論文であることが、本 wiki の既存ページ群から確認できた。新規 entity [[Gandalf]](製品ページ)を作成し、既存 concept [[変更起因インシデント]]・[[カナリアテスト]] に、イベント相関による犯人特定とメトリクス統計比較という異なる技術的アプローチの対比を追記した。
## [2026-08-11] ingest-paper | Rapid Regression Detection in Software Deployments through Sequential Testing
- Source: `.raw/papers/2026_Unknown_Rapid_Regression_Detection_Software_Deployments.pdf`(ユーザー提供ローカル PDF。KDD '22、DOI: 10.1145/3534678.3539099、arXiv:2205.14762)
- Summary: [[@2022__KDD__Rapid Regression Detection in Software Deployments through Sequential Testing]]
- Pages created: [[@2022__KDD__Rapid Regression Detection in Software Deployments through Sequential Testing]]、[[Michael Lindon]]、[[Chris Sanden]]、[[Vaché Shirikian]]、[[Kayenta]]、[[逐次検定]]
- Pages updated: [[Netflix]]、[[カナリアテスト]]
- Key insight: Netflix の Lindon・Sanden・Shirikian が、カナリアテストのregression検知を固定サンプルサイズ検定ではなく逐次検定(sequential testing)・anytime-validなconfidence sequenceで実施する統計フレームワークをKDD '22で提案。regressionを確率的順序(stochastic order)・分布の等価性として定式化することで平均だけでなく裾の劣化も検知対象にし、Netflixの既存カナリア分析システム[[Kayenta]]が抱えていた固定-$n$検定の「peeking」問題(繰り返し適用による型 I エラー確率の崩壊)を根本的に解決した。実運用ケーススタディで数十秒〜十数秒での検知を実証し、シミュレーションでは固定-$n$検定が100回中64回・57回の誤検知を生んだのに対し提案手法は誤検知0回だった。新規concept [[逐次検定]] を作成し、既存concept [[カナリアテスト]] に「固定-$n$ vs 逐次検定」という判定メカニズムの設計軸を追加した。
## [2026-08-11] ingest-paper | Safe Velocity: A Practical Guide to Software Deployment at Scale using Controlled Rollout
- Source: `.raw/papers/Safe-Velocity-ICSE-SEI.pdf`(Microsoft Research 公開ページの著者版 PDF、ICSE-SEIP '19。https://www.microsoft.com/en-us/research/publication/safe-velocity-a-practical-guide-to-software-deployment-at-scale-using-controlled-rollout/ から解決)
- Summary: [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]]
- Pages created: [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]]、[[Tong Xia]]、[[Sumit Bhardwaj]]、[[Pavel Dmitriev]]、[[Aleksander Fabijan]]、[[Outreach.io]]、[[制御ロールアウト]]
- Pages updated: [[Microsoft]]、[[カナリアテスト]]
- Key insight: 段階的ロールアウトの各リング内でオンライン制御実験(A/Bテスト)を実行するハイブリッド手法「制御ロールアウト(controlled rollout, CRL)」を Microsoft(ICSE-SEIP'19)が提案。二標本t検定の検出力分析に基づくリングごとの最適ロールアウト期間・検出目標Δ%の決定手法と、データ品質・ガードレール・成功(OEC)・ローカルの4種の指標体系を整理し、Microsoft Officeでの数百件の実運用データでその有効性を定量的に実証した。新規concept [[制御ロールアウト]] を作成し、この vault に既存の [[カナリアテスト]](統計判定によるデプロイリスク低減という別系譜)と隣接するが判定メカニズムの異なる新しい系統を記録した。
## [2026-08-11] ingest-paper | Canary Analysis Service
- Source: `.raw/papers/acmqueue-2018-canary-analysis-service.pdf`(acmqueue 誌 PDF、Google Research pubs 経由。https://research.google/pubs/canary-analysis-service/ から解決)
- Summary: [[@2018__acmqueue__Canary Analysis Service]]
- Pages created: [[@2018__acmqueue__Canary Analysis Service]]
- Pages updated: [[Štěpán Davidovič]]、[[Betsy Beyer]]、[[カナリアテスト]]、[[変更起因インシデント]]、[[障害緩和]]、[[SRE]]
- Key insight: Google の集中型カナリア分析サービス CAS(Canary Analysis Service)の設計・運用報告。確信度スコアを意図的に隠しPASS/FAIL/NONEの三値のみを返す判定設計、Evaluate()/GetResult()の2 RPC分離による障害耐性、オンライン挙動学習によるオートコンフィグレーション、near-miss分析によるインパクト測定が核。同日先行 ingest した [[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]] と合わせ、concept [[カナリアテスト]] を1ソースから2ソースへ拡張し、独立2企業・2時代のシステムが統計判定を少数離散状態に還元する同型設計に収束するという横断的知見を初めて記録した。既存 concept [[変更起因インシデント]]・[[障害緩和]] にも CAS 特有の設計選択(確信度の意図的隠蔽)との対比を追記。既存エンティティ [[Štěpán Davidovič]](Canary Analysis Service 開発者として既に entity ページに記述があった)・[[Betsy Beyer]] を本ソースで更新。
## [2026-08-11] ingest-paper | Rapid and Robust Impact Assessment of Software Changes in Large Internet-based Services
- Source: `.raw/papers/2026_Unknown_Rapid_robust_impact_assessment_software.pdf`(ローカル PDF、CoNEXT '15)
- Summary: [[@2015__CoNEXT__Rapid and Robust Impact Assessment of Software Changes in Large Internet-based Services]]
- Pages created: [[@2015__CoNEXT__Rapid and Robust Impact Assessment of Software Changes in Large Internet-based Services]]
- Pages updated: [[Shenglin Zhang]]、[[Dan Pei]]、[[Xianping Qu]]、[[変化点検知]]
- Key insight: SST(Singular Spectrum Transform)の改良(複数固有ベクトル利用+median/MADフィルタリング+IKAによる行列圧縮)とDiD(Difference-in-Differences)法による因果帰属を組み合わせたソフトウェア変更影響評価ツール FUNNEL(CoNEXT'15、Baidu実サービスへ本番展開)を記録した。CUSUM・MRLSを精度・検知遅延・計算コストの全指標で上回り、改良SST単体(DiDなし)は季節性KPIでprecision 1.10%まで崩壊するがDiD併用のFUNNELは98.28%を維持するという定量的対比から、既存concept [[変化点検知]] に「変化点検知は"いつ"、因果推論は"なぜ"を担う」という役割分担の知見を追記した。entity [[Xianping Qu]] は同年のSREcon15発表(酷贝)と合わせ、Baidu SREチームの監視・変更管理両路線への関与が判明。
## [2026-08-11] ingest-paper | CanaryAdvisor: A Statistical-Based Tool for Canary Testing
- Source: `.raw/papers/2026_Unknown_CanaryAdvisor_statistical_tool_canary_testing.pdf`(ローカル PDF、ISSTA 2015 デモ論文)
- Summary: [[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]]
- Pages created: [[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]]、[[CanaryAdvisor]]、[[Alexander Tarvo]]、[[カナリアテスト]]
- Pages updated: [[IBM Research]]
- Key insight: IBM Researchが開発した自動カナリアテストツールCanaryAdvisorを、非パラメトリック統計仮説検定による許容誤差係数x・信頼区間幅の臨界値Wcriticalという2パラメータ設計とともに記録した。この vault に既存の異常検知・Fault Localization系統(2020年代の機械学習/LLMベース手法群)とは異なる、2015年時点の統計仮説検定ベースのデプロイリスク低減という新規concept [[カナリアテスト]] の起点を作った。IBM ResearchがAIOps/SRE系統より約10年早い時期からクラウドデプロイ品質保証に関与していたという横断的知見をentityへ追記。
## [2026-08-10] ingest-paper | Forewarned is Forearmed: Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters
- Source: `.raw/papers/apnet25-forewarned.pdf`(ローカル PDF、APNET 2025)。既存 source ページは Abstract のみの薄いノートだったため、PDF 原本取り込みで全面上書き。
- Summary: [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]]
- Pages created: なし(既存ページの全面更新のみ)
- Pages updated: [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]]、[[OptProphet]]、[[障害予測]]
- Key insight: OptProphet の内部アーキテクチャが Abstract 止まりだった従来の記述を、フル PDF で具体化した。特徴量集約は Interpretable Feature Extraction(IFE: statistical/temporal/spectrum)と Attention-Enhanced Feature Representation(AEFR: Transformer self-attention)の 2 経路、データ拡張は Information-Aware Undersampling(IAU)+ Feature-Weighted Oversampling(FWO)を分類難易度で自動combineする仕組み、マルチタスク統合は dual-gate MoE(予測ゲート=長期トレンド、分類ゲート=局所異常)と判明。評価は Huawei の実運用 LLM 訓練クラスタ 2 系統(D1: 10,804 台・20 日、D2: 3,394 台・30 日)、multi-gated MoE → XGBoost のアブレーションで D1 Task#1 の Recall が 0.871→0.284 に崩壊しマルチタスク設計の寄与を裏づける。[[障害予測]] の既存横断的知見・未解決の問い(「具体的な特徴は Abstract では不明」)を訂正・解決済みとして更新。
- Source: `.raw/papers/2026_Unknown_Understanding_Mitigating_Packet_Corruption_Data.pdf`(ローカル PDF、SIGCOMM '17)
- Summary: [[@2017__SIGCOMM__Understanding and Mitigating Packet Corruption in Data Center Networks]]
- Pages created: [[@2017__SIGCOMM__Understanding and Mitigating Packet Corruption in Data Center Networks]]、[[Danyang Zhuo]]、[[Klaus-Tycho Förster]]、[[Thomas Anderson]]
- Pages updated: [[Ratul Mahajan]]、[[Arvind Krishnamurthy]]、[[Manya Ghobadi|Monia Ghobadi]]、[[RDMAネットワーク監視]]、[[wiki/questions/NIC光モジュールのモニタリング]]
- Key insight: 15の本番データセンター・35万本のスイッチ間光リンクを7か月監視し、パケット破損による損失が輻輳による損失と同水準の規模を持つにもかかわらず、破損損失率は利用率と無相関かつ時間的に安定していることを示した。緩和システムCorrOptは、リンク無効化の最適化問題がNP-completeであることを証明した上で高速チェッカと厳密最適化の2段階で近似し、既存手法比で破損損失を3〜6桁削減、70以上のデータセンターへの推薦エンジン展開で修復成功率を50%から80%へ改善した。同著者陣の関連論文RAILとほぼ同時にingestされたため、重複作成されていた `Monia Ghobadi.md` エンティティを既存の [[Manya Ghobadi]](表記ゆれ)に統合した。
## [2026-08-10] ingest-paper | Detecting Ephemeral Optical Events with OpTel
- Source: `.raw/papers/nsdi22-paper-miao.pdf`(USENIX NSDI '22 論文ページ直リンク)
- Summary: [[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]]
- Pages created: [[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]]、[[Congcong Miao]]、[[Arpit Gupta]]、[[光バックボーンネットワークテレメトリ]]
- Pages updated: [[Tencent]]、[[Tsinghua University]]、[[UC Santa Barbara]]、[[テレメトリ]]、[[ネットワーク監視]]
- Key insight: Tencentの光バックボーンネットワーク向けテレメトリシステムOpTelは、SNMPのpull型・デバイス側処理集約設計によるポーリング遅延の線形悪化を、ベンダー非依存の標準化デバイスモデルとpush型テレメトリパイプラインで解消し、1秒粒度データ収集をCPUオーバーヘッドを抑えたまま実現した。6か月間の本番運用で既存15分粒度システム比2倍の光イベント検知、トラブルシューティング時間の桁違いの短縮を報告する。
## [2026-08-10] ingest-paper | RAIL: A Case for Redundant Arrays of Inexpensive Links in Data Center Networks
- Source: `.raw/papers/nsdi17-zhuo.pdf`(USENIX NSDI '17 論文ページ直リンク)
- Summary: [[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]]
- Pages created: [[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]]、[[Danyang Zhuo]]、[[Manya Ghobadi|Monia Ghobadi]]、[[Xuan Kelvin Zou]]、[[Hang Guan]]、[[Thomas Anderson]]、[[光リンク過剰設計]]
- Pages updated: [[Ratul Mahajan]]、[[Amar Phanishayee]]、[[Arvind Krishnamurthy]]、[[University of Washington]]、[[Microsoft Research]]、[[Columbia University]]、[[データセンターネットワークトポロジ]]、[[データセンター信頼性]]
- Key insight: データセンター光トランシーバーが業界標準BER要求に対し中央値6倍もの過剰設計状態にあることを20データセンター超・30万リンクの実測で示し、伝送距離の引き伸ばしによるコスト削減(10Gbpsで最大10%・40Gbpsで最大44%)と、仮想トポロジベースのルーティングシステムRAILによるアプリケーション性能保護を両立させた。
## [2026-08-10] ingest-paper | An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data
- Source: `.raw/papers/An_Optical_Transceiver_Reliability_Study_based_on_SFP_Monitoring_and_OS-level_Metric_Data.pdf`(ローカル PDF、CCGrid 2023)
- Summary: [[@2023__CCGrid__An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data]]
- Pages created: [[@2023__CCGrid__An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data]]、[[Qiao Yu]]、[[Soroush Haeri]]、[[Huawei Technologies Duesseldorf GmbH]]
- Pages updated: [[障害予測]]、[[Paolo Notaro]]、[[Jorge Cardoso]]、[[Michael Gerndt]]
- Key insight: 350万台超・15か月分の光トランシーバーDDM/OSメトリクスを、時系列自己相関・AFR推定・運用範囲比較・パターンlift・ML予測モデルの5つの独立分析軸で解析し、すべての軸でエラーレートの過去発生とバイアス電流の高値が将来故障の最強の予兆であることを確認した。同一著者陣(Notaro・Cardoso・Gerndt)の2021年AIOpsサーベイの3年後の実証研究であり、[[OptProphet]](2025)がAbstractのみで伏せていた光トランシーバー故障の具体的予兆特徴を定量的に埋める。
## [2026-08-10] ingest-paper | TRACER: Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis
- Source: `.raw/papers/2026_Unknown_TRACER_Physics_Guided_Causal_Evidence.pdf`(ローカル PDF、KDD '26)
- Summary: [[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]]
- Pages created: [[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]]、[[Yuhang Zhang]]
- Pages updated: [[因果推論ベースRCA]]、[[Fault Localization]]、[[Meng Ma]]、[[Ping Wang]]、[[Peking University]]
- Key insight: 都市交通網の非再帰的渋滞根本原因診断を、運動学的衝撃波理論による物理接地された双方向トレースとGranger因果性検定を組み合わせた訓練不要・ゼロショットエージェントとして解く。深層学習の fault smearing、因果発見の物理非依存スプリアス相関、直接LLM適用の空間的ハルシネーションという三重苦を同時に解決し、並列推論+コンセンサス融合でSUMO/PeMS-BAY双方でHit@1精度を最良ベースライン比32.6%改善・推論時間85.7%削減。閉ループ介入実験で正確なRCAが交通回復を実際に加速することも実証した。
## [2026-08-10] ingest-paper | TSLoc: Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters
- Source: `.raw/papers/2026_Unknown_TSLoc_Self_Supervised_Faulty_Node.pdf`(ローカル PDF、KDD 2026)
- Summary: [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]]
- Pages created: [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]]、[[KAN-AD]]
- Pages updated: [[Fault Localization]]、[[異常検知]]、[[GPUクラスタ運用]]、[[Quan Zhou]]、[[Changhua Pei]]、[[Difeng Ma]]、[[Zexin Wang]]、[[Yuanwei Lu]]、[[Jianhui Li]]、[[Yibo Zhu]]、[[Daxin Jiang]]、[[Jingjing Li]]、[[Gaogang Xie]]、[[Dan Pei]]、[[StepFun]]、[[Minder]]
- Key insight: 障害箇所特定を、過去の障害ラベルに依存しない自己教師あり逸脱検知タスクとして再定式化。健全ノードの群コンセンサスからの逸脱を共有 Mixture-of-Experts 時系列エンコーダ(KAN-AD エキスパート)で捉え、空間・時間の逸脱スコアを Reciprocal Rank Aggregation で統合する。[[Minder]] の決定木ベース優先順位付け(closed-world 仮定)を批判し、障害ラベル不要で新規メトリクスへの day-one 対応を実現。本番 700 台超クラスタで Top-5 精度 0.908・平均応答 4.2 秒を達成。
## [2026-08-10] ingest-paper | Rethinking Time Series Anomaly Detection from a Dynamic Perspective: Temporal–Frequency–Curvature Fusion
- Source: `.raw/papers/2026_Unknown_Rethinking_Time_Series_Anomaly_Detection.pdf`(ローカル PDF、KDD '26 V.2)
- Summary: [[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]]
- Pages created: [[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]]、[[Haotian Si]]、[[Juncheng Hu]]、[[Jilin University]]、[[Shenyang Institute of Automation, Chinese Academy of Sciences]]
- Pages updated: [[異常検知]]、[[Hang Cui]]、[[Zexin Wang]]、[[Changhua Pei]]、[[Quan Zhou]]、[[Cenjie Hu]]、[[Jingjing Li]]、[[Dan Pei]]、[[Gaogang Xie]]
- Key insight: 時系列を「値の集合」でなく「進化するシステムが生成する軌道」として捉え直し、離散二階差分(曲率)を時間・周波数の既存視点に加える TSAD フレームワーク TFC を提案。古典的な差分によるトレンド除去(定常化)を逆転させ二階差分を判別的シグナルとして明示的に増幅する設計が、既存concept [[異常検知]] に「平滑化バイアスを逆転させる」という新しい設計軸を追加した。6ベンチマークで SOTA(強いベースライン比平均 +10.8%)を達成。
## [2026-08-10] ingest-paper | TSRBench: Benchmarking Time-Series Retrieval
- Source: `.raw/papers/2026_Unknown_TSRBench_Benchmarking_Time_Series_Retrieval.pdf`(ローカル PDF、KDD '26 V.2)
- Summary: [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]]
- Pages created: [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]]、[[Cenjie Hu]]、[[Hang Cui]]、[[Juncheng Bao]]、[[Jingwen Yang]]
- Pages updated: [[時系列類似度検索]]、[[本番接地型ベンチマーク]]、[[Zexin Wang]]、[[Jingjing Li]]、[[Changhua Pei]]、[[Dan Pei]]、[[Gaogang Xie]]
- Key insight: 時系列検索(TSR)のエンドツーエンドベンチマークスイート。UCR-R(公開・形状一貫性データセット)と CU-RCA(産業インシデントデータセット)、single hit dominance を緩和する AdaBase Ranking Scorecard を提案。CU-RCA では単純な統計的距離が事前学習済み埋め込みを上位ランクで上回るドメインシフトが観測され、既存concept [[本番接地型ベンチマーク]] に「手法選好の忠実度」という新パターンを追加した。
## [2026-08-10] ingest-paper | Why Transformers? A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations
- Source: `.raw/papers/TOSEM26-WhyTransformer.pdf`(Nankai University・Tsinghua University、ACM TOSEM 投稿版)
- Summary: [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations]]
- Pages created: [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations]]
- Pages updated: [[AIOps]]、[[Transformer]]、[[LLMによる根本原因分析]]、[[LLM時系列アプローチ]]、[[Binpeng Shi]]、[[Shenglin Zhang]]、[[Dan Pei]]
- Key insight: 70本の代表論文をData-Target-Principle-Approachの4軸タクソノミーで整理し、Transformerの優位性を二層6能力フレームワーク(SEQ/PARALLEL/PTKL/ICL/TF/LANG)で説明する包括サーベイ。役割進化の3段階モデル(パターンモデラー→文脈対応タスクソルバー→自律エージェント)が、既存concept [[LLMによる根本原因分析]] の「LLMの3系統の役割分化」と独立に対応することを確認した。
## [2026-08-10] ingest-slides | Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート
- Source: `.raw/slides/MRC_technical_deep_dive/MRC_technical_deep_dive.pdf`(SpeakerDeck, Masayuki Kobayashi(markunet), 2026-06-30公開)
- Visual pages: `.raw/slides/MRC_technical_deep_dive/pages/`(66ページ全て確認)
- Media: なし(音声・動画リンクなし)
- Summary: [[@2026__SpeakerDeck__Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート]]
- Pages created: [[@2026__SpeakerDeck__Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート]]
- Pages updated: [[MRC]]、[[Masayuki Kobayashi]]、[[OCP Foundation]]
- Key insight: OCP MRC Specification 1.0を一次ソースに、既存concept [[MRC]] が運用実績(arXiv:2605.04333)中心で持っていなかった仕様レベルの機構(EVの3実現方式とステートマシン、配送層/セマンティック層分離、MPR/WriteIMMインフライト制御、パケットフォーマット・オペコード空間)を追加した。最重要の訂正は「MRC = SRv6」が誤解であり、SRv6 uSIDはOCP仕様が定義する3転送モードの1つ(ECMPハッシュ/Structured EV/SRv6 uSID)に過ぎず、必須なのはEVによるパケットスプレーそのものだという点。
## [2026-08-10] ingest | The Evolution of 400G, 800G, and 1.6T Optical Modules
- Source: `.raw/articles/the-evolution-of-400g-800g-and-1-6t-optical-modules-2026-08-10.md`(NADDOD Blog、2024-07-05公開)
- Summary: [[@2024__NADDOD__The Evolution of 400G, 800G, and 1.6T Optical Modules]]
- Pages created: [[@2024__NADDOD__The Evolution of 400G, 800G, and 1.6T Optical Modules]]、[[NADDOD]]
- Pages updated: [[データセンター内光配線設計]]
- Key insight: 光モジュールの高速化を規定するパッケージング(SFP→OSFP224)・変調方式(NRZ→PAM4→xQAM)・伝送距離命名規則(KR/CR/SR/DR/FR/LR/ER/ZR)を整理し、既存concept [[データセンター内光配線設計]] のMPOコネクタ心数規格に速度帯別のファイバー対数対応を追記した。
## [2026-08-10] ingest-slides | AIインフラを考える
- Source: `.raw/slides/isocjp38-ai-infra-kobayashi/isocjp38-ai-infra-kobayashi.pdf`(SpeakerDeck, Masayuki Kobayashi(markunet), 第38回 ISOC-JP Workshop, 2025-09-26発表)
- Visual pages: `.raw/slides/isocjp38-ai-infra-kobayashi/pages/`(52ページ全て確認)
- Media: なし(音声・動画リンクなし)
- Summary: [[@2025__SpeakerDeck__AIインフラを考える]]
- Pages created: [[@2025__SpeakerDeck__AIインフラを考える]]
- Pages updated: [[Masayuki Kobayashi]](さくらインターネット在籍を確認)、[[SAKURA Internet]]、[[高火力 PHY]]、[[RDMA]]、[[RoCE設計課題]]、[[データセンター輻輳制御]]、[[Valiant Load Balancing]]、[[並列化戦略]]、[[KVキャッシュ管理]]、[[Prefill-Decode分離]]、[[AIデータセンタートポロジ]]、[[Ultra Ethernet]]
- Key insight: RoCEv2 のパケットフォーマット(RDMA Write First/Middle/Last のフラグメント順序保証制約)・ECN の3ホップ通知経路(スイッチが送信元QP情報をBTHから読めずCNPを直接生成できない制約とIETF Fast CNP draft)・PFCバッファプロファイルのケーブル長依存性という3つの具体的な制約から、現行RoCEv2が現在のAIワークロードに最適とは言い難いことを論証した。PD DisaggregationのKV Cache転送サイズ(Llama3 8B/405B、1K〜8K×同時100リクエストで100〜420GB)とScale Up/Scale Out経路選択によるボトルネックの違いを具体的な帯域数値とともに示した。
## [2026-08-10] ingest-slides | GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet – PFC/ECN編
- Source: `.raw/slides/markunet-lossless-ethernet-pfc-ecn/markunet-lossless-ethernet-pfc-ecn.pdf`(SpeakerDeck, Masayuki Kobayashi(markunet), 2024-12-27公開)
- Visual pages: `.raw/slides/markunet-lossless-ethernet-pfc-ecn/pages/`(47ページ全て確認)
- Media: なし(音声・動画リンクなし)
- Summary: [[@2024__SpeakerDeck__GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet - PFC-ECN編]]
- Pages created: [[@2024__SpeakerDeck__GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet - PFC-ECN編]]
- Pages updated: [[Masayuki Kobayashi]](LINEヤフー Staff Engineer在籍を確認)、[[LINE株式会社]](在籍歴を追記)、[[データセンター輻輳制御]]、[[マルチベンダーLosslessネットワーク]]
- Key insight: RoCEv2=DSCP26=TC3・CNP=DSCP48=TC6というPCP/DSCP→TCマッピングがNVIDIA(Mellanox)推奨値かつBroadcom NICデフォルト値とも一致するベンダー横断デファクトである一方、Arista EOSの設定例には「StrataXGS Chip前提、DNXでは異なる」という明示的注記があり、同一ベンダー内でもASICファミリが異なればMMU/Headroomのパラメータ体系が異なることを示した。これは既存concept [[マルチベンダーLosslessネットワーク]] が指摘する「ASIC実装依存パラメータ」問題の粒度がベンダー単位よりさらに細かいことを裏付ける。またPFCの継続発動はhead-of-line blockingで性能低下を招くためECN/CNPによる事前抑制を主防御としPFCは瞬間的な最終手段とすべきという運用規律を、[[データセンター輻輳制御]] の理論知見(PFCの副作用としてのhead-of-line blocking)を裏付ける実務知見として追記した。p.26・p.35・p.41-44(実クラスタ設定値、他社機器設定例)は登壇者により非公開化されている。
## [2026-08-10] ingest-slides | マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察
- Source: `.raw/slides/multi-plane-gpu-network-shuffle-architecture/multi-plane-gpu-network-shuffle-architecture.pdf`(SpeakerDeck, Masayuki Kobayashi(markunet), Interconnect Architecture SIG, 2026-03-09発表)
- Visual pages: `.raw/slides/multi-plane-gpu-network-shuffle-architecture/pages/`(39ページ全て確認)
- Media: なし(音声・動画リンクなし)
- Summary: [[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]]
- Pages created: [[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]]、[[Masayuki Kobayashi]]、[[Corning Optical Communications]]、[[Oracle]]
- Pages updated: [[光ファイバーシャフル配線]]、[[マルチプレーンClosトポロジ]]、[[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]](著者名を[[Masayuki Kobayashi]]へリンク化)
- Key insight: Shuffleを「server-majorの束をplane-majorに組み替える物理配線アーキテクチャ」と定義した上で、既存concept [[光ファイバーシャフル配線]] がJANOG58から得ていた「シャフルBOX/シャフルアッセンブリ」の2分類を、Shuffle Cable/Shuffle Box/CPOスイッチ内蔵Shuffleの3方式・11観点比較へ精緻化した。Fate Sharing(共通故障点)を明示的に定義し、プレーン分散してもhost port/optics起点の共通故障点は消えないという理論的な限界を、[[マルチプレーンClosトポロジ]] 側の未解決の問い(NIC側光トランシーバの単一障害点はプレーン数増加でどこまで軽減されるか)に対する上限として与えた。p.25(1.6T NIC shuffle PoC)は「公開不可(関係者限り)」として内容が伏せられている。
## [2026-08-10] ingest-slides | AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド
- Source: `.raw/slides/markunet-ai-infra-trends-2026-ocp-china/markunet-ai-infra-trends-2026-ocp-china.pdf`(SpeakerDeck, Masayuki Kobayashi(markunet), OCTS 2026講演資料, 2026-07-09)
- Visual pages: `.raw/slides/markunet-ai-infra-trends-2026-ocp-china/pages/`(53ページ全て確認)
- Media: なし(音声・動画リンクなし)
- Summary: [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]]
- Pages created: [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]]、[[AIスーパーノード]]、[[800V高圧直流給電]]、[[浪潮信息 (IEIT SYSTEMS)]]、[[沐曦 (MetaX)]]、[[Astera Labs]]、[[サムスン電子 (Samsung Electronics)]]、[[China Mobile]]、[[OCP Foundation]]
- Pages updated: [[KVキャッシュ管理]]、[[Alibaba Cloud]]、[[ByteDance]]
- Key insight: Agentic AIの実運用化を起点に、計算(GPU中心→CPU-GPU協調)・記憶(KV Cache爆発)・接続(スーパーノード標準化)・電力(800V高圧直流)・冷却(ネイティブ液冷)・管理(RAS API標準、grid to chip)という6領域が同時に連動して再定義された年であることを、Alibaba Cloud磐久UMX(CPU:GPU比1:1接近)、ByteDance大禹2.0(1ラック264kW給電実装済み)、沐曦/MetaXのKV Cache経済性分析(DRAM/NAND約200倍のコスト差)など各社の具体的製品・仕様データで裏付けた。研究段階の構想ではなく、すでに製品・仕様として存在する具体物として提示された点が特徴的である。
## [2026-08-09] ingest-paper | TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference
- Source: `.raw/papers/arxiv-2608.01975.pdf`(arXiv:2608.01975, Ruilin Xu・Junyi Li・Pengfei Chen・Zongxuan Xie, Sun Yat-sen University, ASE '26, DOI:10.1145/3832783.3837440, 2026-08-03)
- Summary: [[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]]
- Pages created: [[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]]、[[Junyi Li]]
- Pages updated: [[LLMによる根本原因分析]]、[[GPU観測性]]、[[CUDA API トレース]]、[[マルチモーダル障害診断]]、[[Ruilin Xu]]、[[Zongxuan Xie]]、[[Pengfei Chen]]、[[Sun Yat-sen University]]、[[CUPTI]]、[[eACGM]]
- Key insight: NVTX 動的フック + CUPTI コールバックによる非侵入トレーシングと、構造保存型トークナイザ Trace Pair Encoding(TPE)による trace 圧縮を組み合わせ、LLM 推論の GPU カーネル/CUDA API レベルまで踏み込んだリクエスト単位の根本原因分析を実現。TPE ボキャブラリを 256→1024 へ積極圧縮するとオペレータ局所化 Macro F1 が 0.806→0.138 まで崩壊する定量結果は、LLM RCA における「文脈圧縮とタスク精度のトレードオフ」を初めて具体的に数値化した。同著者陣による eACGM(IWQoS 2025)からの研究発展であることが参考文献[38]から確認できた。
- 取得方法注記: `fetch-paper-pdf.sh` 実行時に NODE_OPTIONS 環境変数(cmux 由来の restore-node-options.cjs 参照)が pdf.js 画像抽出を阻害したため、`NODE_OPTIONS="--max-old-space-size=4096"` で上書き実行して回避。Figure 1(TELLER 全体アーキテクチャ)はベクター描画のため pdf.js の埋め込み画像抽出では取得できず(小さな数式断片7点のみ)、PyMuPDF のキャプション座標クロップで取得した。
## [2026-08-09] ingest-paper | Agentic Coding in the Wild: Characterizing GitHub Copilot at Production Scale
- Source: `.raw/papers/arxiv-2608.00101.pdf`(arXiv:2608.00101, Banruo Liu・Haoran Qiu・Íñigo Goiri・Rodrigo Fonseca・Ricardo Bianchini・Esha Choukse, UIUC × Microsoft Azure Research, 2026-07-30)
- Summary: [[@2026__arXiv__Agentic Coding in the Wild - Characterizing GitHub Copilot at Production Scale]]
- Pages created: [[@2026__arXiv__Agentic Coding in the Wild - Characterizing GitHub Copilot at Production Scale]]、[[Banruo Liu]]、[[Haoran Qiu]]、[[Íñigo Goiri]]、[[Ricardo Bianchini]]、[[Esha Choukse]]、[[UIUC]]
- Pages updated: [[エージェント型コーディング]]、[[KVキャッシュ管理]]、[[Rodrigo Fonseca]]
- Key insight: GitHub Copilot コーディングエージェントの 320 万ユーザー・1,350 万セッションという産業規模テレメトリで、KV キャッシュ劣化を「ターン境界」「モデル切替」「コンテキスト圧縮」という 3 つの構造イベントに切り分けて定量化した(-26pt / -67pt / -66.1%)点が最大の新規性。LLM 呼び出しの 87% が自律継続で発生しツール失敗が計算量を最大 4 倍に増幅するなど、現行 LLM サービング基盤のリクエスト独立・ステートレス前提との構造的ミスマッチを本番数値で裏付けた。
- 取得方法注記: Microsoft Research の公開ページから arXiv ID(2608.00101)を特定し `fetch-paper-pdf.sh` で PDF を取得。画像抽出時に NODE_OPTIONS 環境変数がサンドボックスの node 実行を阻害したため `env -u NODE_OPTIONS` で回避。全 20 ページが matplotlib 系ベクター描画で埋め込みラスター画像が皆無だったため、代表 4 図(Figure 8・13・14・33)はすべて PyMuPDF のキャプション座標クロップで取得した。
## [2026-08-09] ingest-paper | MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
- Source: `.raw/papers/2026_Unknown_MegaScale_Omni_Hyper_Scale_Workload.pdf`(EuroSys '26, Chunyu Xue・Yangrui Chen ほか, ByteDance Seed × Shanghai Jiao Tong University, DOI:10.1145/3767295.3803587)
- Summary: [[@2026__EuroSys__MegaScale-Omni - A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production]]
- Pages created: [[@2026__EuroSys__MegaScale-Omni - A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production]]
- Pages updated: [[並列化戦略]]、[[LLM分散学習]]、[[ByteDance Seed]]、[[Shanghai Jiao Tong University]]、[[Quan Chen]]、[[Yanghua Peng]]、[[Xin Liu]]
- Key insight: マルチモーダルLLM訓練は、encoderとLLMバックボーンという2つの異質なサブモデル間の相対ワークロードが訓練フェーズを通じて連続的にシフトするという、単一モダリティLLM訓練にはない動的性を抱える。MegaScale-Omniはencoder-LLM multiplexing(並列化戦略の分離+同一GPU集合上での時間多重化コロケーション)でこれに対応し、4つの最先端ベースライン比1.27×〜7.57×のスループット改善を、数千GPU規模の本番環境で実証した。実運用の動的ワークロードと静的合成ワークロードの間に17%のMFUギャップが存在するという開示は、既存ベンチマーク設計が効率を過大評価しうることを示唆する。
- 取得方法注記: ユーザー提供のローカルPDF(`/Users/y-tsubouchi/Downloads/`)から取得。arXiv版なし(直接EuroSys '26掲載論文)。図表は全てベクター描画(埋め込みラスター画像は装飾アイコン1枚のみ)のため、PyMuPDFによるキャプション座標クロップで6枚(Figure 1・2・6・8・13・18)を埋め込んだ。
## [2026-08-09] ingest-paper | From Causal Discovery to Dynamic Causal Inference in Neural Time Series
- Source: `.raw/papers/2026_Unknown_From_Causal_Discovery_Dynamic_Causal.pdf`(KDD '26, Zaytsev, Kuskova, Coppedge, University of Notre Dame, DOI:10.1145/3770855.3818956)
- Summary: [[@2026__KDD__From Causal Discovery to Dynamic Causal Inference in Neural Time Series]]
- Pages created: [[@2026__KDD__From Causal Discovery to Dynamic Causal Inference in Neural Time Series]]、[[動的因果推論]]、[[Dmitry Zaytsev]]、[[Valentina V. Kuskova]]、[[Michael Coppedge]]、[[University of Notre Dame]]、[[V-Dem (Varieties of Democracy)]]
- Pages updated: [[因果発見]]
- Key insight: DCNAR は、ニューラル加法自己回帰因果発見(NAVAR)で学習した疎有向グラフを「最終推論対象」ではなく「下流の時変ネットワーク自己回帰を制約する反証可能な構造事前分布」として再利用する二段階フレームワーク。評価基準を予測精度単独からインパルス応答・反実仮想軌道の行動診断へ転換し、V-Dem 139カ国×35年パネルで既存ベースラインと同等の予測精度を保ちつつ、より安定的・解釈可能な因果的挙動を実証した。非巡回性制約付き因果発見手法は、フィードバックループが研究対象そのものである社会科学ドメインでは意図的に不採用とされた。新設 concept [[動的因果推論]] を作成し、既存 concept [[因果発見]] に「発見結果の下流再利用」という横断的知見を追記した。
- 取得方法注記: ユーザー提供のローカル PDF(`/Users/y-tsubouchi/Downloads/`)から取得。arXiv 版なし(直接 KDD '26 掲載論文)。図はいずれも matplotlib 生成の埋め込みラスター画像(pdf.js で2枚取得、PyMuPDF クロップ不要)。
## [2026-08-08] ingest-paper | R2aft: A Speedy and Highly Available RDMA-Based Consensus Protocol
- Source: `.raw/papers/R2aft_A_Speedy_and_Highly_Available_RDMA-Based_Consensus_Protocol.pdf`(IEEE TPDS 2026、Zhiyuan Dong・Haitao Song・Zhaoguo Wang、2026-04-03公開)
- Summary: [[@2026__TPDS__R2aft - A Speedy and Highly Available RDMA-Based Consensus Protocol]]
- Pages created: [[@2026__TPDS__R2aft - A Speedy and Highly Available RDMA-Based Consensus Protocol]]、[[分散合意プロトコル]]、[[Zhiyuan Dong]]、[[Haitao Song]]、[[Zhaoguo Wang]]、[[Shanghai Artificial Intelligence Research Institute]]
- Pages updated: [[RDMA]]、[[Shanghai Jiao Tong University]]、[[Institute of Parallel and Distributed Systems]]
- Key insight: RDMA のプロセッサバイパス特性を可用性(障害モデルの粒度)の観点から再解釈し、リーダー選出とログ複製の両方でリモートプロセッサを完全にバイパスした初の RDMA ベース合意プロトコル R2aft を提案。既存の RDMA ベース合意プロトコル(Dare・Sift・Protected Memory Paxos・Mu)はログ複製でしか細粒度障害モデルを利用できていなかった非対称性を、Single Writer Multiple Reader Region と Write-Read-Verify アプローチという 2 つの構造的アイデアで解消した点が新規性。YCSB ベンチマークで Mu 比 12.2% のレイテンシオーバーヘッドで同等スループットを達成し、3 サーバ中リーダーのプロセッサのみが故障した極端なケースで唯一動作を継続できることを実証した。新設 concept [[分散合意プロトコル]] を、既存 concept [[RDMA]] に横断的知見を追記した。
- 取得方法注記: ユーザー提供のローカル PDF から取得。IEEE Xplore 発の論文で arXiv 版は存在せず、DOI(10.1109/TPDS.2026.3679987)は確認できたが URL はサンドボックスのネットワーク許可リスト外(ieee.org・doi.org 未許可)のため WebFetch で検証できず frontmatter の `url` は空欄とした。埋め込みラスター画像は装飾的な図形断片(著者写真除く)1点のみで、Fig.1〜9 の主要図はすべてベクター描画のため pdf.js では取得できず、PyMuPDF によるキャプション座標クロップで 6 点(Fig.1・2・3・5・6・9)を取得した。
## [2026-08-08] ingest-paper | A Taxonomy of Performance Metrics for the Distributed Computing Continuum
- Source: `.raw/papers/arxiv-2607.28407.pdf`(arXiv:2607.28407、Praveen Kumar Donta ほか、2026-07-30)
- Summary: [[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]]
- Pages created: [[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]]、[[分散コンピューティングコンティニュウム]]、[[Alfreds Lapkovskis]]、[[Alaa Saleh]]、[[Ying Li (Northeastern University)]]、[[Ilir Murturi]]、[[Manuel Otero Barbasan]]、[[Stockholm University]]、[[Universitat Pompeu Fabra]]、[[University of Prishtina]]、[[Universidad de Sevilla]]
- Pages updated: [[性能測定]]、[[Edge Computing]]、[[Praveen Kumar Donta]]、[[Boris Sedlak]]、[[Schahram Dustdar]]、[[Víctor Casamayor Pujol]]、[[University of Helsinki]]、[[Northeastern University]]、[[TU Wien]]
- Key insight: 分散コンピューティングコンティニュウムシステム(DCCS)の性能メトリクスを computing-level・network-level・application/user-level の3階層に分類し、各メトリクスに数式定義だけでなく取得範囲(Single-Node/Multi-Node/Full System/Full App)・取得フェーズ(Operational/Experimental)・取得手法(Standard/Custom/Experimental Instrumentation)の3次元取得要件を付与するタクソノミー。AI/LLM時代の要請に応じた新興メトリクス群(CO2排出量・熱放散・観測可能性・適応性指数・データ局所性指数・コンティニュウム断片化指数・移行安定性指数・信頼性スコア等15個)を独立カテゴリとして提示する点が新規性。既存 concept [[性能測定]] に「DB/OS単体のモデル化・計測・シミュレーション哲学」と「DCCSの取得要件3次元分類」の対比、[[Edge Computing]] に「エッジ-クラウド2層構造」と「DCCSの6層構造」の対比を横断的知見として追記した。著者陣の所属表記から、TU Wien Distributed Systems Group の Donta が Stockholm University へ、Casamayor Pujol と Dustdar が Universitat Pompeu Fabra へ異動していることを既存 entity ページに反映した。
- 取得方法注記: PDF は arxiv.org から直接取得。埋め込み画像抽出(pdf.js)ではページ7のアイコン断片15枚のみが得られ、タクソノミー図(Figure 1)とアーキテクチャ図(Figure 2)はベクター描画のため取得できなかった。PyMuPDFでキャプション座標を特定しページクロップして代替した。独自実験を行わない理論的サーベイのため実験結果セクションは「該当なし」と明記した。
## [2026-08-08] ingest-slides | 情報科学における18のメタテクニック
- Source: `https://www.slideshare.net/slideshow/cs-metatechniques/47602411`(SlideShare、中野淳、金沢工業大学情報工学科、2015-04-30)
- Summary: [[@2015__SlideShare__情報科学における18のメタテクニック]]
- Pages created: [[@2015__SlideShare__情報科学における18のメタテクニック]]、[[中野淳]]、[[金沢工業大学]]、[[メタテクニック(情報科学)]]
- Pages updated: なし
- Key insight: コンピュータアーキテクチャ・OS・分散システム・データベース・ネットワークを横断して繰り返し現れる18の基本技法(キャッシング・パイプライニング・投機的実行・条件の緩和・並列化・結合vs分離・仮想化・トランザクション等)を、着想と代表例の対で整理した講義スライド。パイプライニングを洗濯の逐次/並行処理比較で説明する図(UC Berkeley CS152 出典明記)、仮想化を「物理的実体の上の仮想的幻想」として一般化する図が視覚的に有用だった。個々の技法解説自体に新規性はなく既存分野の知見を一望する点が主眼(スライド内でも自己申告)。単一ソースかつ各技法1〜2文の浅い言及にとどまるため、既存 concept(メモリ階層とキャッシュ・パイプライン処理・コンテナ仮想化・分散トランザクション・クォーラムベースレプリケーション)への横断的知見追記は行わず、新設 concept [[メタテクニック(情報科学)]] に分類枠組み自体を集約し、既存 concept へは発見性のための一方向リンクのみとした。
- 取得方法注記: 依頼された URL は論文ではなく単独の発表スライドだったため、`wiki-ingest-paper` から `wiki-ingest-slides` へ切り替えて取り込んだ。SlideShare のボット対策(Client Challenge)により `fetch-slide-deck.sh` での PDF 取得が失敗し、`image.slidesharecdn.com` の CDN から個別スライド画像(638×478px、24枚)を直接 curl で取得して代替した(PDF 原本なし)。この非標準フローについては `AskUserQuestion` でユーザーに事前確認し承認を得た。confidence: medium(発表イベントの詳細と画像解像度の制約のため)。
## [2026-08-06] query + ingest-paper | NIC 光モジュールのモニタリング(question 1 件 + 論文 3 本)
- Question: 「NIC の光モジュールのモニタリングについて関連文献を調査して」
- Summary: [[wiki/questions/NIC光モジュールのモニタリング]]
- Sources ingested: `.raw/papers/arxiv-2605.04333.pdf`(Resilient AI Supercomputer Networking using MRC and SRv6)、`.raw/papers/nsdi24-zu.pdf`(Resiliency at Scale: TPUv4)、`.raw/papers/arxiv-2602.00277.pdf`(Training LLMs with Fault Tolerant HSDP on 100,000 GPUs)
- Pages created: [[wiki/questions/NIC光モジュールのモニタリング]]、[[@2026__arXiv__Resilient AI Supercomputer Networking using MRC and SRv6]]、[[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]]、[[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]]、[[光回線交換]]、[[Yazhou Zu]]、[[TPUv4]]、[[Palomar Optical Circuit Switch]]、[[Omkar Salpekar]]、[[Rohan Varma]]、[[Chunqiang Tang]]、[[Maxim Naumov]]、[[FT-HSDP]]、[[PyTorch]]
- Pages updated: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]]、[[RDMAネットワーク監視]]、[[MRC]]、[[SRv6]]、[[AIデータセンタートポロジ]]、[[データセンターネットワーク信頼性]]、[[マルチプレーンClosトポロジ]]、[[耐障害LLM訓練]]、[[OpenAI]]、[[Microsoft]]、[[Google]]、[[Borg]]、[[Meta]]
- Key insight: NIC 光モジュールの監視を規格(SFF-8472 の DDM/DOM・SFF-8636・CMIS 5.3 の VDM)、Linux/NIC 実装(`ethtool -m`・`ethtool -I --show-fec`・mlx5 の `rx_err_lane_[l]_phy` と `link_down_events_phy`・`mlxlink` の Raw/Effective Physical BER・SONiC の `xcvrd` と `cmis.py`)、大規模 AI クラスタの実測、学術文献の 4 層で横断した。400G PAM4 の KP4 FEC が pre-FEC BER 2.4e-4 まで訂正するため閾値監視では silent degradation を捕まえられず、レーン別 pre-FEC BER のトレンド監視が必須になる。実測層では「光関連が何%か」が組織の物理層観測能力の関数であることが判明し(Meta 8.4%→5.3% は `Network Switch/Cable` に丸め込み、Alibaba Aegis 6.7%、Tencent Astral 光ファイバ 7%、ByteDance Minder AOC 0.9% で自ら過小計上を認める)、公開値はすべて下限値として扱うべきだという結論に至った。最大の発見は MRC 論文が示す非対称性で、同じ光トランシーバ障害でもスイッチ側ならトランスポート層の耐性で吸収できるのに対し、NIC 側 800G 光モジュールのフラップは全ポート喪失で QP が落ち救済不能である。これは予防型予測(OptProphet)の投資を NIC 側へ優先配分すべきだという設計示唆を、トランスポート層という独立ソースから与える。対処方針は「検知して直す」(CorrOpt・OptProphet)と「トポロジで迂回する」(TPUv4 の OCS・MRC)に分岐する。
- 学術文献の系譜として新たに確定したもの: CorrOpt(Zhuo・Ghobadi・Mahajan・Förster・Krishnamurthy・Anderson、SIGCOMM 2017。15 本番 DC・35 万リンクの解析で「破損率は時間的に安定し利用率と相関しない」を示し、70+ DC 展開で破損損失 3〜6 桁削減・修復精度 60% 改善)、007(NSDI 2018)、FANcY(SIGCOMM 2022)、Gray Failure(HotOS 2017)、および光通信側の soft-failure 検知系譜(Musumeci ほか IEEE COMST 2019 サーベイ、Wang ほか arXiv:2208.10677 レビュー、OFC 2018 M3A.5、JOCN の pre-FEC BER + OSNR 窓統計による 2 段検知)。**光通信コミュニティの soft-failure 検知と AI クラスタ運用側の光障害報告がほとんど交差していない**という構造的空白を特定した。
- Open questions: 耐性機構(MRC・dual-ToR・OCS)が物理劣化を隠すとき、劣化しつつあるリンクを CMIS VDM の pre-FEC BER・eSNR から独立に拾い上げる仕組みをどう組むか。光通信の soft-failure 検知手法をショートリーチのデータセンター光モジュールへ適用できるか(距離・変調方式・FEC 方式の違いがどこで効くか)。NIC 側単一障害点を AEC/DAC への置き換えやポート分割粒度の変更でどこまで緩和できるか。光モジュール単体の AFR/FIT を実測で公開した一次資料は存在しない。
- 注記: Alibaba HPN(SIGCOMM 2024)は 2026-06-26 に取り込み済みだったため再取り込みせず、原典 §2.3 から欠落していた「数千個の光モジュールおよびリンク」「リンクフラップ 5K〜60K 件/日」「単一 LLM 訓練ジョブが月 1〜2 回クラッシュ」を補完するにとどめた。流通する「10M 光モジュールのクラスタでは 48 秒に 1 回リンクフラップ」(arXiv:2603.03736)は著者自身のモデル推計であり実測ではないため、引用不可として question ページに明記した。
## [2026-08-05] ingest | Materialized Metrics in Prometheus
- Source: `.raw/articles/materialized-metrics-in-prometheus-2026-08-05.md`(RedditEng Blog、https://www.reddit.com/r/RedditEng/comments/1v1qaey/materialized_metrics_in_prometheus/、公開日不明・推定2026-07中旬以前、Aleksandr Krivoshchekov・Walther Lee、Reddit オブザーバビリティチーム)
- Summary: [[@2026__RedditEng__Materialized Metrics in Prometheus]]
- Pages created: [[@2026__RedditEng__Materialized Metrics in Prometheus]], [[Aleksandr Krivoshchekov]], [[Walther Lee]], [[マテリアライズドメトリクス]]
- Pages updated: [[Reddit]], [[Prometheus]], [[Prometheusシリーズチャーン]], [[Prometheus TSDB]]
- Key insight: Kubernetes の pod ラベルは Prometheus カウンタ系列を無用に増殖させるが、recording rule による集約は大規模では継続的な背景負荷とタイムアウトに転嫁するだけで解決にならない。Reddit チームはスクレイプ時に delta 化してから固定間隔(スクレイプ間隔)ごとに強制リセットする「ジグザグカウンタ」を考案し、レプリカ間で合意プロトコルなしに比較・重複排除・欠損補完可能な擬似カウンタとして Prometheus に書き戻した(マテリアライズドメトリクス)。本番実装で最大メトリクスの系列数を98%削減、クエリスループット88%減・レイテンシ80%減、平均誤差率0.15%(標準偏差0.13%)を達成。既存 concept [[Prometheusシリーズチャーン]] に、同じ Reddit オブザーバビリティチームが公表した stale-series compaction(ストレージ層、SREcon26)とマテリアライズドメトリクス(集約層、本記事)という同一問題への2つの異なるレイヤーの解法という横断的知見を、[[Prometheus TSDB]] に「ラベルセット=系列識別」という基本モデルからストレージ側とクエリ側の異なる副作用が生じるという横断的知見を追記した。図表6点(pod churn による系列爆発、望ましい集約ビュー、sum(rate) vs rate(sum) の破綻比較、累積カウンタ vs delta、ジグザグカウンタ生成、本番の counter/zigzag/rate比較)を埋め込んだ。
- 取得方法注記: reddit.com はサンドボックスのネットワーク許可リスト外かつ Cloudflare の JS 認証チャレンジ対象のため、WebFetch・curl(ブラウザ UA・公式 JSON API 含む)いずれからも本文取得不能だった。ユーザーが記事本文全文とコメント欄をチャットに直接貼り付けたものを一次資料として使用。画像6点は preview.redd.it から直接ダウンロード(サンドボックス外)できたため embed した。confidence: medium(公開日不明・貼り付け経由のため)として source ページに明記した。
## [2026-08-05] ingest | Mixture-of-Kittens: our open-source MoE megakernel for NVL72s
- Source: `.raw/articles/mixture-of-kittens-2026-08-05.md`(Cursor Blog、https://cursor.com/ja/blog/mixture-of-kittens、2026-08-04、Stuart Sul・Nash Brown・Henry Wildermuth・William Lin・Federico Cassano、Cursor Research)
- Summary: [[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]]
- Pages created: [[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]], [[Mixture-of-Kittens]], [[Stuart Sul]], [[Nash Brown]], [[Henry Wildermuth]], [[William Lin]], [[NVIDIA GB300 NVL72]], [[メガカーネル]]
- Pages updated: [[Federico Cassano]], [[Cursor Research]], [[ThunderKittens]], [[Mixture-of-Experts]], [[集合通信]], [[LLM駆動GPUカーネル生成]]
- Key insight: Cursor Research が NVIDIA GB300 NVL72 向けに公開した決定論的 MoE 訓練メガカーネル Mixture-of-Kittens(MoK)。MoE 層の通信と計算を単一カーネルに融合し、pull-based dispatch(push-based 比最大29%高い NVLink 帯域利用率、シグナリングオーバーヘッド約103µs→約18µs)・計算通信オーバーラップ用の「ミニバッチ」調整式(T ≥ min(2I,H)/(2C·128·256))・CPU-GPU 同期を排除するリングトークンバッファの3設計により、単一 MoE 層 MXFP8 順伝播最大2.37倍・逆伝播1.78倍(MXFP8)/1.92倍(BF16順伝播)/1.58倍(BF16逆伝播)・本番訓練エンドツーエンド1.41倍(760.9→1,070.2 tok/s/GPU)を達成した。既存 concept [[Mixture-of-Experts]] に DeepSeek-V4 の MegaMoE(モデル専用垂直統合カーネル)との設計比較、[[集合通信]] に通信方向(pull/push)自体が独立した最適化軸であるという知見、[[LLM駆動GPUカーネル生成]] に「エージェント単体生成の限界」と「人間+エージェント協働開発の生産性」は異なる問いであるという対比を追記した。新設 concept [[メガカーネル]] で MoE 層の通信・計算を単一 GPU カーネルへ融合する設計手法を定義した。命名(Kittens)と技術的性格からの ThunderKittens との血縁は推測にとどまり未確認と明記した。
- 取得方法注記: cursor.com がサンドボックスのネットワーク許可リスト外(`curl`/`defuddle` 不可)のため WebFetch(要約モデル経由)で取得。confidence: medium として source ページに明記した。
## [2026-08-04] ingest-paper | The Landscape of GPU-Centric Communication
- Source: `.raw/papers/2026_Unknown_The_Landscape_GPU_Centric_Communication.pdf`(ACM Computing Surveys Vol.58 No.12 Article 322、DOI:10.1145/3813799、Koç University / University of Trento / Sapienza University of Rome)
- Summary: [[@2026__CSUR__The Landscape of GPU-Centric Communication]]
- Pages created: [[@2026__CSUR__The Landscape of GPU-Centric Communication]], [[Koç University]], [[Didem Unat]], [[Ilyas Turimbetov]], [[Mohammed Issa]], [[Dogan Sagbili]], [[Ismayil Ismayilov]]
- Pages updated: [[Flavio Vella]], [[Daniele De Sensi]], [[University of Trento]], [[NCCL]], [[RDMA]], [[GPU起動型ネットワーキング]], [[集合通信]]
- Key insight: CPU がマルチGPU通信を管理する従来モデルから GPU 自身が通信を自律制御する GPU 中心通信への移行を、ベンダー機構とユーザーレベルライブラリの両面から整理したサーベイ。ノード内通信をHost Native/Host-Controlled/Device Native/Host Fallbackの4型、ノード間通信をHost Native/Pinned Host Native/GPU RDMA/GPU-Triggered/Device Nativeの5型に分類する統一 taxonomy を提示し(Table 1・2、Figure 1・2)、GPUDirect(1.0/2.0/RDMA/Async)とNVLink/NVSwitchの進化をタイムライン化(Figure 3)、NCCL/RCCL/oneCCLの実行モデルの質的差異(Table 3、GPUカーネル完全自律駆動 vs CPUワーカー駆動)とNVSHMEM/ROC_SHMEM/Intel SHMEMのGPU-NICメモリ一貫性の扱いの差を体系的に整理した。既存concept [[RDMA]]にノード間通信5分類の中でのGPUDirect RDMAの位置づけとカーネル境界一貫性制約を、[[GPU起動型ネットワーキング]]にDevice Nativeという最終段階としての体系的位置づけとROC_SHMEMの先行的一貫性保証を、[[集合通信]]にNCCL/RCCL/oneCCLの実行モデル差異を横断的知見として追記した。図表5点(ノード内/ノード間通信のデータパス図、NVIDIA技術タイムライン、RDMA指向ソフトウェアスタック、通信ライブラリ間相互作用図)をいずれもPyMuPDFによるベクター図クロップで埋め込んだ(pdf.jsの埋め込み画像抽出は0件、全図がベクター描画のため)。既存entity [[Flavio Vella]]・[[Daniele De Sensi]]・[[University of Trento]]・[[NCCL]]を更新し、[[Koç University]]および著者5名の新規entityを作成した。
## [2026-08-04] ingest-paper | GPU-Initiated Networking for NCCL
- Source: `.raw/papers/arxiv-2511.15076.pdf`(arXiv:2511.15076、2025-11-19投稿、v2 2025-11-24)
- Summary: [[@2025__arXiv__GPU-Initiated Networking for NCCL]]
- Pages created: [[@2025__arXiv__GPU-Initiated Networking for NCCL]], [[GPU起動型ネットワーキング]]
- Pages updated: [[NCCL]], [[DeepEP]], [[NVIDIA]], [[集合通信]], [[RDMA]]
- Key insight: NCCL 2.28 の Device API のうち、GPU カーネルが CPU の介在なしにネットワーク越し RDMA を発行する GPU-Initiated Networking(GIN)を解説する論文。GDAKI(DOCA GPUNetIO による直接 GPU-to-NIC 通信、16.7µs 往復レイテンシ)と Proxy(ロックフリー GPU-to-CPU キュー、18.0µs)の二重バックエンドを持ち、MoE 通信ライブラリ DeepEP への統合で NVSHMEM/IBGDA ベースの既存実装と同等の性能(帯域差1〜3%程度)を達成した。新設 concept [[GPU起動型ネットワーキング]] の初出ソースであり、既存 concept [[集合通信]]・[[RDMA]] にそれぞれ横断的知見を追記した。図表3点(GIN の3操作モード、NCCL Device API と従来 NCCL の比較、GIN 内部アーキテクチャ)を埋め込んだ。
## [2026-08-04] ingest-paper | NIXT: A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training
- Source: `.raw/papers/arxiv-2608.01449.pdf`(arXiv:2608.01449、2026-08-02、謝辞に IISWC 匿名査読者への言及あり)
- Summary: [[@2026__arXiv__NIXT - A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training]]
- Pages created: [[@2026__arXiv__NIXT - A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training]]、[[Ziyang Jia]]、[[Daniel Wong]]、[[Laxmi Bhuyan]]、[[Sirshak Das]]、[[Jason Sewall]]、[[Pasha Shamis]]、[[University of California, Riverside]]、[[NIXT]]
- Pages updated: [[NCCL]]、[[集合通信]]、[[ストラグラー]]
- Key insight: NVIDIA NCCL 2.28 に同梱される公式プロファイラプラグイン NCCL Inspector の生 JSON ログを、DuckDB ベースの型付き列指向スキーマへ変換するエクスポータツール NIXT を提案する論文を取り込んだ。COLLECT→TAXONOMY→EXPORT→STORE→ANALYZE→DIAGNOSE の 6 段階ワークフローで、NCCL Inspector フィールドを Metadata/Configuration/Identifier/Counter/Workload/Measurement の役割別タクソノミーに整理し、時間的/空間的/資源的/その他の相関分析プリミティブを SQL クエリとして体系化した(26 倍のログ削減、単発取り込み 56 秒、分析クエリ各 0.3 秒未満)。Nemotron-4 15B/340B(最大 2,048 H100 GPU)の実運用事前訓練トレースによるケーススタディで、ReduceScatter+AllGather が通信量の 99.7% を占め NIC-only 経路が全転送バイトの 70.4% を占めること(要約統計)、通信子トポロジ×メッセージサイズの疎な「ホット」構成への集中(資源相関)、識別子(rank/host)単位の空間相関分析によるストラグラー局所化(健全時比帯域 3〜4 倍低下・変動係数 4〜8 倍増加)を実証した。フレームワーク帰属分析では、本番訓練での集団通信帯域の変動係数(CV)が nccl-tests での孤立再現実験より 2〜5 倍大きく、GPU スケーリング自体は CV に影響しないことから ML フレームワーク(NeMo/Megatron-core)による NCCL API 呼び出し調整や計算・通信オーバーラップの干渉が変動の一因である可能性を示した。ただし著者は、この帰属が「調整によるスタール」と「ファブリック輻輳」の 2 メカニズムを分離できていないこと、ストラグラーの根本原因確定(劣化リンク・熱スロットリング)には DCGM・スイッチテレメトリとの相関が別途必要なことを限界として明記している。既存 concept [[集合通信]] に、NCCL 本体への計装追加を必要としない非侵襲的な観測手段としての位置づけ(Mycroft のソフトウェアスタック計装・CCL-D の Send/Recv 組み込みとは異なる第六の観測点)を追記し、[[ストラグラー]] にオフラインログの事後 SQL 集計のみでの局所化事例を追記した。図表は pdf.js による埋め込みラスター画像抽出が装飾的なロゴ断片のみだったため、PyMuPDF によるキャプション座標クロップで Figure 1(NCCL 集団通信の仮想/物理表現)・Figure 2(NIXT ワークフロー概観)・Figure 5(通信子トポロジ×メッセージサイズのヒートマップ)・Figure 13(rank 単位のバス帯域幅)・Figure 16(ストラグラー局所化)の計 5 図をベクター描画のまま切り出した。学術側著者([[Ziyang Jia]]・[[Laxmi Bhuyan]]・[[Daniel Wong]])は [[University of California, Riverside]] 所属で、産業側協力者([[Sirshak Das]]・[[Jason Sewall]]・[[Pasha Shamis]])は [[NVIDIA]] 所属。
## [2026-08-04] ingest-paper | SWIM: Scalable Weakly-consistent Infection-style Process Group Membership Protocol
- Source: `.raw/papers/SWIM.pdf`(DSN 2002、DOI: 10.1109/DSN.2002.1028914、pp.303-312 と推定。書誌情報は DBLP による確認であり PDF 本文には会議名・ページ番号の記載なし)
- Summary: [[@2002__DSN__SWIM - Scalable Weakly-consistent Infection-style Process Group Membership Protocol]]
- Pages created: [[@2002__DSN__SWIM - Scalable Weakly-consistent Infection-style Process Group Membership Protocol]]、[[Abhinandan Das]]、[[Ashish Motivala]]
- Pages updated: [[Indranil Gupta]]、[[Cornell University]]、[[ゴシッププロトコル]]
- Key insight: 分散プロセスグループ向け弱一貫性メンバーシッププロトコル SWIM の古典的論文(DSN 2002)を取り込んだ。障害検知(ランダム化間接プロービング: ping/ping-req/ack による Section 3.1 の基本検知器)とメンバーシップ更新の伝播(Section 4.1、ping/ack へのピギーバックのみで行う感染様式ディセミネーション、専用パケットを一切生成しない)を明確に分離することで、全対全ハートビート方式のメッセージ負荷のグループサイズに対する二次的増大を回避し、メンバーあたりのメッセージ負荷(実測約2.0メッセージ/周期)と障害検知時間をグループサイズ非依存の定数に保つことをプロトタイプ実験(56メンバーまで)で実証した。Suspicion サブプロトコル(Section 4.2、仮想 incarnation number による Alive/Suspect/Confirm の優先順位付け)により誤検知頻度を低減し、Round-Robin プローブ対象選択(Section 4.3)により決定的な検知時間上界(2N プロトコル周期)を保証する Time Bounded Completeness を導入した。10% パケット損失下での 17 プロセス逐次参加実験では、SWIM+Inf.+Susp. が安定して 12 メンバーに到達したのに対し SWIM:Basic は 2 メンバー、SWIM+Inf. は 4 メンバーで頭打ちになり、Suspicion メカニズムの効果を直接示した。既存 concept [[ゴシッププロトコル]] に、Cassandra/Dynamo が採用するアンチエントロピー型(全状態ダイジェストを定期交換する)ゴシップとは異なる、障害検知メッセージへのピギーバックのみで専用メッセージを一切生成しない伝播系統としての横断的知見と、Φ 累積障害検知器(連続値スコア)と SWIM の Suspicion サブプロトコル(離散状態遷移+仮想 incarnation number)という誤検知抑制設計の対比を追記した。図表は pdf.js による埋め込みラスター画像抽出がゼロ件だったため、PyMuPDF によるキャプション座標クロップで Figure 1(プロトコル周期のシーケンス図)・Figure 2(メッセージ負荷)・Figure 3(a)(b)(c)(検知時間・伝播遅延・Suspicion タイムアウト)・Figure 4(パケット損失下でのグループサイズ推移)の計 6 図をベクター描画のまま切り出した。著者名はアルファベット順表記(論文脚注に明記)であり、Indranil Gupta は当時 [[Cornell University]] 所属(現 UIUC 教授)。
## [2026-08-04] ingest-paper | Explainable Artificial Intelligence in Software Engineering: Current Trends, Gaps, and Future Directions
- Source: `.raw/papers/Explainable_Artificial_Intelligence_in_Software_Engineering_Current_Trends_Gaps_and_Future_Directions.pdf`(IEEE Access Vol.14 2026、DOI: 10.1109/ACCESS.2026.3679576、2026-03-31出版)
- Summary: [[@2026__ACCESS__Explainable Artificial Intelligence in Software Engineering Current Trends, Gaps, and Future Directions]]
- Pages created: [[@2026__ACCESS__Explainable Artificial Intelligence in Software Engineering Current Trends, Gaps, and Future Directions]]、[[Adam Khan]]、[[Asad Ali]]、[[Muhammad Ismail Mohmand]]、[[Mahdi Zareei]]、[[Rajesh Roshan Biswal]]、[[Tecnologico de Monterrey]]
- Pages updated: [[帰属手法]]
- Key insight: 2020年3月〜2024年4月に発表されたXAI(Explainable Artificial Intelligence)関連ソフトウェア工学(SE)研究29件を対象とするシステマティックリテラチャーレビュー(SLR)を取り込んだ。Kitchenhamのガイドラインに従い5つのRQ(説明タイプ・局所説明ツール・MLライブラリ・SEサブ領域・先行SLRとの比較)で構成し、金融・ヘルスケア各15件との補助的な横断比較も行う。SEでは局所説明が86.20%を占め大域説明単独の研究は皆無であり、局所説明ツールはLIME(65.5%)がSHAP(44.3%)を上回るが、金融(SHAP 93.3%)・ヘルスケア(SHAP 73.3%)ではSHAPが優勢という逆転構造を報告した。MLライブラリはscikit-learnが最多(37.9%)だが58.6%が未記載で再現性を損なっており、XAI適用先はソフトウェア欠陥予測に集中(本文記載82.20%、Figure 16の内訳25/29件は約86.2%に相当し論文内で数値が不一致)し、コードスメル検知(6.89%)・工数見積り(3.44%)・ソフトウェアテスト・CI/CDパイプラインは手薄なままであることを指摘した。Mohammadkhani et al.(2023, arXiv:2302.06065)の先行SLR(24件収録)と比較し、XAIツールを明示的に用いた研究のみに対象を絞り込むことで29件に精選し、説明タイプ(RQ1)とMLライブラリ(RQ3)という先行SLRにない新規の観点を追加した。評価者間信頼性はCohen's kappa=0.82(高い一致度)。既存concept [[帰属手法]]に、SE・金融・ヘルスケア横断でのLIME/SHAP選好の逆転構造(SEは計算コストの低いLIME優勢、規制上の説明責任が重視される金融・ヘルスケアは理論的一貫性を持つSHAP優勢)とMLライブラリ報告の不透明性という横断的知見を追記した。ページ本体には論文中の4図(Figure 1: 予測性能と説明可能性のトレードオフ、Figure 7: SE研究における説明タイプの分布、Figure 10: SE研究における局所説明ツールの使用頻度、Figure 16: SEサブ領域別のXAI適用分布)をPyMuPDFによる画像ブロック座標クロップで埋め込んだ(pdf.jsによる埋め込みラスター画像抽出はゼロ件だったため、ベクター図をページレンダリングからクロップする手法に切り替えた)。著者陣はパキスタン・キプロス・トルコ・メキシコの5大学に分散した国際共著チームで、責任著者2名([[Mahdi Zareei]]・[[Rajesh Roshan Biswal]])は共に[[Tecnologico de Monterrey]]所属。
## [2026-08-04] ingest-paper | Exploring LLM-Based Agents for Root Cause Analysis
- Source: `.raw/papers/2026_Unknown_Exploring_LLM_Agents_Root_Cause.pdf`(FSE Companion '24、DOI: 10.1145/3663529.3663841、2024-07-15〜19 Porto de Galinhas, Brazil)
- Summary: [[@2024__FSE Companion__Exploring LLM-Based Agents for Root Cause Analysis]]
- Pages created: [[@2024__FSE Companion__Exploring LLM-Based Agents for Root Cause Analysis]]、[[Devjeet Roy]]、[[Rashi Bhave]]、[[Washington State University]]
- Pages updated: [[Xuchao Zhang]]、[[Chetan Bansal]]、[[Pedro Las-Casas]]、[[Rodrigo Fonseca]]、[[Saravan Rajmohan]]、[[Microsoft]]、[[LangChain]]、[[ReAct]]、[[LLMによる根本原因分析]]、[[根本原因分析]]
- Key insight: クラウドインシデント管理向け RCA に ReAct エージェントを適用した最初期の実証研究を取り込んだ。ファインチューニング・few-shot なしのゼロショット設定で Microsoft の 107,000 件本番インシデントデータセットから静的評価(RQ1・RQ2)を行い、Azure Fundamental Team との 4 週間の実運用ケーススタディ(RQ3)でデータベースクエリツール・KBA(Knowledge Base Article)Q/A ツール・KBA Planning Tool・Human Interaction Tool を実装した。ReAct は自動評価指標では Retrieval Baseline・CoT と同等かやや劣るが、人手定性評価では不正解ケースのハルシネーション率が最低(6% vs Retrieval Baseline 49%・CoT 18%)であり、元論文の ReAct が HotpotQA で示した「外部接地が幻覚を減らす」トレードオフがクラウド RCA でも再現された。discussion comments のリトリーバルコーパス追加は RCA 性能を明確には改善しない。ケーススタディでは KBA へのアクセスが単純インシデントの自律解決の鍵であり、複数 KBA にまたがる複雑インシデントでは 20 ステップのイテレーション上限に達し完遂できず、reflection・長期記憶を伴う multi-trial 化が必要と提言された。RCAgent(CIKM'24)・mABC(EMNLP Findings 2024)より早い、KBA を外部知識制約として使う最初期の ReAct-for-RCA 実証研究であり、既存 concept [[ReAct]]・[[LLMによる根本原因分析]] に「行動空間に組み込む Human Interaction Tool」という新しいハルシネーション・行き詰まり緩和パターンを追記した。ページ本体には論文中唯一の埋め込み図(Figure 2: ReAct 推論トラジェクトリ例)を埋め込み、Table 2〜4 の定量結果は Markdown 表として転記した。
## [2026-08-04] ingest-paper | Bifrost: Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis
- Source: `.raw/papers/arxiv-2607.23169.pdf`(arXiv:2607.23169v1 [cs.SE]、2026-07-25、ASE '26 採録)
- Summary: [[@2026__arXiv__Bifrost - Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis]]
- Pages created: [[@2026__arXiv__Bifrost - Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis]]、[[Xinlong Zhao]]、[[Leyi Pan]]、[[Cheng Wang]]、[[Yinghao Yu]]
- Pages updated: [[Minghua He]]、[[Tong Jia]]、[[Lingzhe Zhang]]、[[Chiming Duan]]、[[Kangjin Wang]]、[[Liping Zhang]]、[[Yifan Wu]]、[[Ying Li]]、[[Peking University]]、[[Alibaba Group]]、[[Tsinghua University]]、[[ログベース障害診断]]
- Key insight: ログベース障害診断の下流タスク(異常検知・根本原因特定・障害識別)向けに、既存の PLM(BERT-Base・BART-Base 等)が自然言語向け事前学習に起因しログの多階層構造(実行フロー・イベント・コンポーネント)を捉えられないことを t-SNE 可視化・次イベント予測の経験的研究で実証し、これを fallibility representation として定式化した論文を取り込んだ。Execution Flow Prediction・Abnormal Event Discrimination・System Component Perception の3自己教師あり対照学習タスクを提案し、これらを単純な加重和で同時最適化すると確率的サンプリング由来の勾配分散が重み更新軌道を振動させる(fallibility jitter)ことを勾配解析で特定、実システムイベントを共通アンカーとする Co-Anchored Fallibility Representation Learning (CARL) で分散分離+負例共分散制約により緩和した。BGL・Hadoop・Thunderbird・産業用 MLaaS システム Platform-X の4データセットで AD/RCL/FI すべてにおいて既存 PLM を上回り(F1 平均 9.83%・HR@k 平均 18.28%・Macro-F1 平均 20.88%)、同一 backbone・同一訓練ログだが元の事前学習目的のままの対照群 BART-Log にも一貫して優位なことから、改善が追加訓練ではなく fallibility-aware 目的設計自体に起因することを示した。既存 concept「ログベース障害診断」に、「下流の診断モデル設計」対「ログ表現そのものの事前学習目的設計」という上流の設計軸と、対照学習の多目的同時最適化に固有の不安定性(fallibility jitter)という横断的知見を追記した。ページ本体には論文中の5図(SRE の3階層ログ解析実務、全体アーキテクチャ、既存 PLM のイベント表現 t-SNE、lexicon サイズ依存性分析、実行フロー識別性能)を埋め込んだ。著者陣は [[Peking University]] の [[Tong Jia]]・[[Ying Li]] グループ(MicroRemed・LogCleaner・MultiLog・LogDB・RBAD・RCLAgent 等、既存 wiki に多数のソースを持つ AIOps 研究クラスタ)の一員であり、初めてログ表現学習という上流の問題設定に取り組んだ点で同グループの研究射程の拡張と位置づけられる。
## [2026-08-04] ingest-paper | KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes
- Source: `.raw/papers/arxiv-2607.17722.pdf`(arXiv:2607.17722v1 [cs.SE]、2026-07-20)
- Summary: [[@2026__arXiv__KernelDiag - Agent-Based Root Cause Diagnosis for Kernel Crashes]]
- Pages created: [[@2026__arXiv__KernelDiag - Agent-Based Root Cause Diagnosis for Kernel Crashes]]、[[Haichi Wang]]、[[Zan Wang]]、[[Dong Wang (Tianjin University)]]、[[KGYM]]、[[LinuxFL+]]、[[Agentless]]、[[カーネル障害診断]]
- Pages updated: [[Weijing Wang]]、[[Junjie Chen]]、[[Tianjin University]]、[[Dong Wang]](disambiguation note 追加)、[[Fault Localization]]、[[エージェント型コーディング]]
- Key insight: Linux カーネルクラッシュの根本原因診断を対象とする初のエージェントベースフレームワーク KernelDiag を提案する論文を取り込んだ。syscall・ログ・crash report を役割特化型エージェント(Syscall/Log/Report Agent)で解析し、ロギングマクロの backward reachability による Log-to-Code Mapping、Semantic Function Introspection、Environment-Aware Semantic Pruning でカーネルソースを反復探索、スキーマ検証済み Evidence Graph に因果依存関係を段階的に組織化する。実世界ベンチマーク KGYM(279件)で唯一の既存カーネル特化手法 LinuxFL+ と汎用 SOTA Agentless をファイル/メソッドレベル Top@1 でそれぞれ +27.78%/+24.09%(全体)、ヒントなし設定では Top@10 で最大4倍・2倍上回った。crash report 除去が最大の性能低下(-63.04%/-78.49%)をもたらすアブレーション、2025年3月以降の50件のポストリリースデータセットによるデータリーク耐性検証、DeepSeek-V3/Qwen3-Max 両バックエンドでの汎化も実証。新設 concept「カーネル障害診断」の初出ソースであり、既存 concept「Fault Localization」に「カーネル領域では信号源の抽象度自体が数段階下がる」という横断的知見を追記した。著者の一人 Dong Wang は既存 entity [[Dong Wang]](Baidu プリンシパルアーキテクト)と同姓同名の別人であったため、disambiguation ページ [[Dong Wang (Tianjin University)]] を新設し双方向に注記した。ページ本体には論文中の2図(アーキテクチャ概観・Evidence Graph の因果トポロジー例)を PyMuPDF によるベクター図クロップで埋め込んだ(他の図は crash report/コード断片のテキストスクリーンショットのため本文中に転記し画像化は省略)。
## [2026-08-04] ingest-paper | DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents
- Source: `.raw/papers/arxiv-2607.22165.pdf`(arXiv:2607.22165v1 [cs.DB]、2026-07-24)
- Summary: [[@2026__arXiv__DBA-Bench - A Production-Fidelity Benchmark for LLM-Based Database Operations Agents]]
- Pages created: [[@2026__arXiv__DBA-Bench - A Production-Fidelity Benchmark for LLM-Based Database Operations Agents]]、[[Junming Chen]]、[[Kai Zheng]]、[[University of Electronic Science and Technology of China]]
- Pages updated: [[D-Bot]](lint-stub から実体化)、[[DBAIOps]]、[[AIOpsLab]]、[[データベース O&M]]、[[データベース自律診断]]、[[本番接地型ベンチマーク]]
- Key insight: 既存のデータベースエージェント評価が本番運用と乖離する4ギャップ(実行環境の忠実度・観測空間の規模と複雑性・解空間の開放性・シナリオの複雑性と網羅性)を特定し、稼働ワークロード付き PostgreSQL 環境・outcome-first 評価・制御された再現性を組み合わせた 106 シナリオ・7タスクドメイン・2難度のベンチマーク DBA-Bench を提案する論文を取り込んだ。9 ベースライン(6 基盤モデル・2 DB特化エージェント・Human DBA)の 848 自動実行で、Diagnosis/Outcome/Safe Pass はそれぞれ 32.7%/19.6%/12.4%。診断できても安全な修復を完遂できない「診断-修復ギャップ」(diagnosis-passing runs の 62.1% が outcome に失敗)を定量化し、最良自動ベースラインの Safe Pass 17.9% は Human DBA の 93.4% と 75.5 ポイントの差があることを示した。既存 entity [[D-Bot]](wiki-lint 自動生成の stub)・[[DBAIOps]] を、DBA-Bench による共通バックボーン(GPT-5.5)固定での再評価結果(D-Bot: Safe Pass 5.7%、DBAIOps: 14.2%、いずれも素の ReAct 17.9% を下回る)で実体化・更新した。原論文が自己申告するベンチマーク結果(D-Bot は HumanDBA と競争力のある性能を主張)と、共有の本番忠実度環境での再評価結果が大きく乖離するという事例を、concept「データベース O&M」「データベース自律診断」の横断的知見として追記した。
## [2026-08-04] ingest-paper | SPPO: Making Million-Token LLM Training Practical on Modest GPU Clusters
- Source: `.raw/papers/2026_Unknown_SPPO_MillionCtx_LLM.pdf`(ICS '26、2026-07-06〜09 Belfast、DOI: 10.1145/3797905.3800537、arXiv:2503.10377 プレプリント版あり)
- Summary: [[@2026__ICS__SPPO - Making Million-Token LLM Training Practical on Modest GPU Clusters]]
- Pages created: [[@2026__ICS__SPPO - Making Million-Token LLM Training Practical on Modest GPU Clusters]]、[[qiaoling chen]]、[[Shenggui Li]]、[[Wei Gao]]、[[アクティベーションオフロード]]
- Pages updated: [[Peng Sun]]、[[Tianwei Zhang]]、[[Yonggang Wen]]、[[Nanyang Technological University]]、[[Hong Kong University of Science and Technology]]、[[Shanghai AI Laboratory]]、[[Megatron-LM]]、[[DeepSpeed]]、[[パイプライン並列化]]、[[シーケンス並列化]]、[[並列化戦略]]
- Key insight: 長系列(最大400万トークン)LLM 訓練における既存最適化(活性化再計算・CPU オフロード・分散並列化)の非効率を「粒度ミスマッチ」(系列全体を分割不可能な単一ブロックとして扱う)という共通の根本原因に帰着させ、部分系列単位の適応的オフロードと適応的パイプラインスケジューリングを統合した SPPO を提案する論文を取り込んだ。128台のGPUのみで7Bモデルを400万トークンまで訓練可能にし、Megatron-LM・DeepSpeed 比最大3.38倍のスループット改善を達成。新設concept「アクティベーションオフロード」の初出ソースであり、既存concept「パイプライン並列化」「シーケンス並列化」「並列化戦略」に「分割粒度自体を動的最適化する」という横断的知見を追記した。ページ本体には論文中の6図(パイプラインスケジュール比較・システム全体像・骨格活性化・エンドツーエンド評価・内訳分析・系列長スケーリング)を PyMuPDF によるベクター図クロップで埋め込んだ(ベクター描画のため pdf.js の埋め込み画像抽出では取得不可だった)。
## [2026-08-04] ingest-paper | gPooling: An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters
- Source: `.raw/papers/gPooling_An_Elastic_GPU_Resource_Management_Framework_for_On-Demand_Virtualization_in_Shared_Accelerator_Clusters.pdf`(IEEE Transactions on Parallel and Distributed Systems, Vol.37, No.10, October 2026, DOI: 10.1109/TPDS.2026.3713365、Euro-Par 2025 予備会議版のジャーナル拡張版)
- Summary: [[@2026__IEEE TPDS__gPooling - An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters]]
- Pages created: [[@2026__IEEE TPDS__gPooling - An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters]]、[[Kaicheng Guo]]、[[Jingyi Chen]]、[[Chen Chen]]、[[Yun Wang]]、[[Pengwei Du]]、[[Zhengwei Qi]]、[[Haibing Guan]]、[[gPooling]]、[[GPUプーリング]]
- Pages updated: [[Shanghai Jiao Tong University]]、[[Huawei Technologies]]、[[GPUクラスタスケジューリング]]
- Key insight: 大学 GPU クラスタの90日トレースで GPU 利用率25%未満と滞留ジョブ200件超が共存するという逆説を動機に、ドライバレベルのカーネルハイジャックで NVIDIA GPU・Huawei Ascend NPU 双方に弾力的な vGPU/vNPU を作るフレームワーク gPooling を提案する論文を取り込んだ。チャネルベースの時分割多重+利用率フィードバックによるコンピュート制御と、cudaMalloc/cuMemAlloc 傍受による per-vGPU メモリクォータ強制を分離した設計により、CUDA レイヤーより下で正確なプリエンプションと低オーバーヘッドを両立し、Slurm には SPANK プラグイン経由でソースコード・ユーザースクリプト無改変のまま GRES として統合される。6週間の本番デプロイでキュー圧力を平均5.3倍・ピーク7.2倍低減、ジョブ待ち時間中央値を125分から23分へ5.4倍改善した一方、コンピュートパーティショニング精度評価では1%という極端な低クォータ構成で既存業界ソリューション以上のオーバーシュート(約300% vs 約200%)を示す限界も確認した。新設concept「GPUプーリング」の初出ソースであり、既存concept「GPUクラスタスケジューリング」に「クラスタスケジューリング研究が GPU 割り当て粒度を所与とするのに対し、ドライバレベルのプーリングはその粒度自体を可変にする」という横断的知見を追記した。
## [2026-08-04] ingest-paper | Closing the Efficiency Gap: AI Datacenter Co-design Roadmap for Scalable Training of LLMs
- Source: `.raw/papers/2026_Unknown_Closing_Efficiency_Gap_AI_Datacenter.pdf`(ICS '26、2026-07-06〜09 Belfast、DOI: 10.1145/3797905.3807839)
- Summary: [[@2026__ICS__Closing the Efficiency Gap - AI Datacenter Co-design Roadmap for Scalable Training of LLMs]]
- Pages created: [[@2026__ICS__Closing the Efficiency Gap - AI Datacenter Co-design Roadmap for Scalable Training of LLMs]]、[[Jesmin Jahan Tithi]]、[[Hanjiang Wu]]、[[Joongun Park]]、[[Avishaii Abuhatzera]]、[[Fabrizio Petrini]]、[[Calculon-MoE]]
- Pages updated: [[Tushar Krishna]]、[[Intel Corporation]]、[[Georgia Institute of Technology]]、[[AIデータセンタートポロジ]]、[[Mixture-of-Experts]]、[[並列化戦略]]、[[集合通信]]
- Key insight: dense LLM 専用の open-source Calculon フレームワークを MoE 向けに拡張した co-design 解析ツール Calculon-MoE を提案する論文を取り込んだ。MoE ゲーティング・エキスパート並列(EP)・エキスパートシャーディング(ES)・動的 All-to-All 通信・SwiGLU 活性化を新規モデル化し、128 GPU 規模の実測で平均予測誤差 4.6〜5.2% を達成した。これを用いて 65,536 GPU 規模までの co-design 感度分析を行い、高基数・低直径の全光配線(CPO)FullFlat トポロジがスケールアップ/スケールアウト帯域を均等化することで、上位 5,000 パラメータ構成間の性能ギャップを TwoTier ネットワーク比 70%→13% に縮小し、GPT4-1.8T/29T 級 MoE モデルを 12〜20 倍高速化することを実証した。HBD=1024・HBM 1.3TB/GPU という co-design 目標値、EP=#Experts・ES=TP のデフォルト前提が最適でないことの定量実証、通信比率の低い密モデルの方がハードウェア collective/オーバーラップ欠如に敏感という直感に反する結果も報告した。既存 entity [[Tushar Krishna]]・[[Intel Corporation]]・[[Georgia Institute of Technology]] を更新し、[[AIデータセンタートポロジ]]・[[Mixture-of-Experts]]・[[並列化戦略]]・[[集合通信]] の全 4 concept に横断的知見を追記した。
## [2026-08-04] ingest-paper | The PetShop Dataset — Finding Causes of Performance Issues across Microservices
- Source: `.raw/papers/arxiv-2311.04806.pdf`(arXiv:2311.04806、CLeaR 2024、PMLR vol.236)
- Summary: [[@2024__CLeaR__The PetShop Dataset - Finding Causes of Performance Issues across Microservices]]
- Pages created: [[@2024__CLeaR__The PetShop Dataset - Finding Causes of Performance Issues across Microservices]]、[[Mila Hardt]]、[[William R. Orchard]]、[[Patrick Blöbaum]]、[[Elke Kirschbaum]]、[[Shiva Prasad Kasiviswanathan]]
- Pages updated: [[PetShop]]、[[因果推論ベースRCA]]、[[RCA評価設計]]
- Key insight: AWS 公開デモのペットアダプションサイト(41 コンポーネント)に 68 件の性能障害を注入したマイクロサービス RCA ベンチマークデータセット PetShop の原論文を取り込んだ。因果グラフ既知の手法(traversal・CIRCA・Counterfactual Attribution)は low/high/temporal の3トラフィックシナリオで top-3 recall では概ね優位だが、top-1 recall では単純な相関ランキングが全手法中最高になる逆転が生じることを報告し、これは Pham et al.(ASE 2024)の Dummy ベースライン知見に先行する実証データと位置づけられる。正常期間データでも全手法が根本原因を「捏造」する(偽陽性を出す)ことを明示的に検証した点は、後続ベンチマークにあまり踏襲されなかった評価軸として記録した。既存 entity [[PetShop]] は PRIM・IDI 論文からの間接引用のみで記述されていたが、本 ingest で原論文の一次情報(データセット構築・障害注入方式・評価結果の具体的数値)に更新した。
## [2026-08-04] ingest-paper | A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM
- Source: `.raw/papers/arxiv-2605.15617.pdf`(arXiv:2605.15617、投稿日 2026-05-15)
- Summary: [[@2026__arXiv__A Few GPUs, A Whole Lotta Scale]]
- Pages created: [[@2026__arXiv__A Few GPUs, A Whole Lotta Scale]]、[[Shaoke Xi]]、[[LLM訓練シミュレーション・エミュレーション]]
- Pages updated: [[ChonLam Lao]]、[[Jingren Zhou]]、[[Alibaba Group]]、[[Harvard University]]、[[Shanghai Jiao Tong University]]、[[Zhejiang University]]、[[Megatron-LM]]、[[NCCL]]
- Key insight: 本番規模クラスタへのアクセスなしに数千 GPU 規模の LLM 訓練挙動を数個の GPU で忠実にエミュレートするシステム PrismLLM を提案。コンテキストスイッチ実行による少数 GPU 上でのグラフ収集と、NCCL グループ削減・近傍プルーニングを施したハイブリッドエミュレーションの2フェーズ設計により、2,048-GPU テストベッド(Megatron-LM、Qwen3 MoE)で反復時間誤差平均 0.58%・ピークメモリ誤差 0.01% 未満を達成し、8192 GPU クラスタを対象 GPU の 1% 未満でエミュレート可能であることを実証した。SimAI・Phantora という既存シミュレータを大きく上回る精度を示し、「訓練エミュレーション」という新しい研究系譜を新設concept「LLM訓練シミュレーション・エミュレーション」として導入した。
## [2026-08-04] ingest-slides | もう一度考える SRE チームの作り方・育て方
- Source: `.raw/slides/rethinking-sre-1/rethinking-sre-1.pdf`(SpeakerDeck、「もう一度考える SRE #1」、2026-07-31)
- Visual pages: `.raw/slides/rethinking-sre-1/pages/`(25ページ)
- Media: なし
- Summary: [[@2026__SpeakerDeck__もう一度考える SRE チームの作り方・育て方]]
- Pages created: [[@2026__SpeakerDeck__もう一度考える SRE チームの作り方・育て方]]、[[SREエンゲージメントモデル]]
- Pages updated: [[組織の信頼性マインドセット]]、[[Ryota Yoshikawa]]、[[Topotal]]
- Key insight: Topotal CTO Ryota Yoshikawa による発表で、SRE チームの「作り方」を Google Cloud の組織信頼性5フェーズ(Absent/Reactive/Proactive/Strategic/Visionary、既存concept「組織の信頼性マインドセット」と同一フレームワーク)を縦軸、Google Cloud が観察した4つの関わり方(Kitchen Sink/Product・Embedded・Consulting・Infrastructure/Tools、新規concept「SREエンゲージメントモデル」)を横軸とする2次元平面上での初期配置と目的地の決定として再定義した。既存の Takamura 系譜(SRE NEXT 2022/2024)が縦軸のみを診断ツールや成熟度モデルの起点として使ったのに対し、Yoshikawa は横軸を加えて「誰がその仕事をする形にするか」まで同じ地図で扱えるようにし、移動には「上げてから、右へ」という定石の順序があるとした(低いフェーズでは引き受ける関わり方しか効かない)。終盤では AI の登場によりレビュー・検証コストの高まりへの対処(縦の移動支援)とコミュニケーションの一部代替による横の移動コスト低下の両方が進み、「フェーズを上げるために作った仕組みがそのまま配る道具になる」形で「上げながら、右へ」という新しい移行ルートが可能になってきたと論じた。ただし「上げる前に右だけ」に行く失敗(開発チームを感知し続けない Platform team が誰も使わないものを作る)は今も残るとする。図6点(表紙、5フェーズ表、4関わり方表、The Map、The Route、The New Route)を埋め込んだ。
## [2026-08-04] ingest-paper | FlowLog: Byte-Level Flow Monitoring System in High-Throughput Networks
- Source: `.raw/papers/FlowLog_Byte-Level_Flow_Monitoring_System_in_High-Throughput_Networks.pdf`(IEEE Transactions on Networking Vol.34, 2026、DOI 10.1109/TON.2026.3687563)
- Summary: [[@2026__TON__FlowLog - Byte-Level Flow Monitoring System in High-Throughput Networks]]
- Pages created: [[@2026__TON__FlowLog - Byte-Level Flow Monitoring System in High-Throughput Networks]]、[[Long Chen]]、[[Tong Yang]]、[[バイトレベルスケッチ計測]]
- Pages updated: [[Peking University]]、[[ByteDance]]、[[時系列トラフィックパターン検知]]
- Key insight: P4 プログラマブルゲートウェイ上で400Gbps級本番トラフィックのバイトレベルフローサイズをサンプリングなしに推定する初のエンドツーエンドスケッチベース監視システム FlowLog を取り込んだ。新規スケッチアルゴリズム ByteSketch は、ビットシフトによる値圧縮(オーバーフロー率低減)と確率的補正(不偏性回復)の2段構えで、CM Sketch がバイトレベル計測時に抱えるバケットオーバーフロー問題(本番トラフィックで8-bitバケットの約95%が使用不能)をカウンタ構造から切り離してアーキテクチャレベルで解決し、誤差上界の形式的証明(Theorem 1)を伴う。この設計は FCM-Sketch・Count-Less のような階層ツリー型スケッチのカスケード伝搬依存と異なり、単一パイプラインステージのアトミック更新という PISA の必須制約に適合する。KeyWatcher/KeyReceiver によるタグ方式のフローID・スケッチID同期は、制御プレーン(CPUクロック)とデータプレーン(スイッチングチップのクリスタル発振器クロック、3日ごとにロールオーバー)間のクロック非同期、および Bloom Filter とスケッチのスイッチングサイクルのずれという2つの同期誤差源を解消する。Kafka+Flink の解析サブシステムでは、フローIDとスケッチデータの極端なメモリ非対称性(秒あたり数百万〜1千万超のフローID vs 数MBのスケッチ)を逆手に取り、スケッチをブロードキャスト・フローIDをハッシュシャッフルするメモリセンシティブなジョブ割当と、TTLベースのjoinキャッシュでデータスキューとメモリ無制限増大を同時に解決する。ByteDance データセンターに6ヶ月超・ピーク帯域400Gbpsで本番デプロイし、既存の sFlow ベース監視 Bytehunter・CMSketch・TowerSketch を精度(AAE/AREで最大10倍)・効率の両面で上回った。CIC-IDS 2017・CAIDA 2019・MAWI の3公開データセットでも汎化性を確認し、Section VIII では PISA メタデータ分離・パイプラインステージ内での中間状態の生成消費同居・モジュール化デプロイ・Bloom Filter false positive 対策(オンライン学習+Transformer)等、実運用から得た一般化可能な設計原則を報告する。既存 wiki コーパス(AIOps/LLMインフラ運用中心)とは domain の異なる、データセンターネットワーク計測の初の source として新設concept「バイトレベルスケッチ計測」を導入し、既存concept「時系列トラフィックパターン検知」(PatternSketch)に、同じくP4スイッチ上のスケッチ設計だが対象が異なるという相互参照を追記した。図5点(Fig.1 システム全体構成、Fig.2 ByteSketch データ構造、Fig.7(a) AAE比較、Fig.9(a) フロー検知カバレッジ比較、Fig.10(d) Top N%フローのARE比較)を埋め込んだ。
## [2026-08-04] ingest-paper | What's in a GitHub Star? Understanding Repository Starring Practices in a Social Coding Platform
- Source: `.raw/papers/arxiv-1811.07643.pdf`(arXiv:1811.07643v1)
- Summary: [[@2018__arXiv__What's in a GitHub Star? Understanding Repository Starring Practices in a Social Coding Platform]]
- Pages created: [[@2018__arXiv__What's in a GitHub Star? Understanding Repository Starring Practices in a Social Coding Platform]]、[[Hudson Borges]]、[[Marco Tulio Valente]]、[[Universidade Federal de Minas Gerais]]、[[GitHub スター]]
- Pages updated: なし(新規source・新規entity・新規conceptのみ)
- Key insight: GitHub のスター機能の実際の意味を、開発者906名分の2つの独立調査(スター動機調査791件・成長パターン認識調査115件)と上位5,000リポジトリの定量分析で三角測量的に実証した論文。スターは appreciation の表明(52.5%)・bookmark(51.1%)・利用実績(36.7%)の複合シグナルであり、単一の「品質」指標ではない。組織所有リポジトリが個人所有より多スター、repository age とは無相関(ρ=0.050)、commits と低相関(ρ=0.439)、contributors(ρ=0.502)・forks(ρ=0.558)と中程度相関という定量特性を確認。KSC(K-means様の時系列クラスタリング)で直近52週間のスター時系列を Slow(58.2%、年間成長率19.8%)・Moderate(30.0%、63.9%)・Fast(9.3%、218.6%)・Viral(2.3%、1,317.2%)の4パターンに分類し、Random Forest + Mean Decrease Accuracy による判別要因分析では Age・Last Push・Issues が最も判別力の高い要因で、うち Last Push・Commits・Tags の3つが開発者の行動で制御可能(Actionable)であることを特定した。開発者調査では Slow 成長の主因は活動停滞(53.8%)、Viral 成長の主因はソーシャルメディア拡散(72.7%、主に Hacker News)。既存 wiki コーパス(AIOps/LLMインフラ運用中心)とは domain の異なる、実証的ソフトウェア工学・オープンソースコミュニティ研究の初の source として新設concept「GitHub スター」を導入した。図4点(Fig.1 人気度指標のスクリーンショット、Fig.2 動機づけ調査、Fig.9 相関分析散布図、Fig.18/19 成長パターンクラスタ)を埋め込んだ。
## [2026-08-03] ingest | bpftime GPU Support - CUDA and ROCm eBPF Attachment
- Source: `.raw/articles/bpftime-gpu-documentation-2026-08-03.md`(URL: https://eunomia.dev/bpftime/documents/gpu/)
- Summary: [[@2025__eunomia.dev__bpftime GPU Support - CUDA and ROCm eBPF Attachment]]
- Pages created: [[@2025__eunomia.dev__bpftime GPU Support - CUDA and ROCm eBPF Attachment]]
- Pages updated: [[GPU観測性]]、[[eGPU]]、[[PTX 注入]]、[[bpftime]]、[[Yusheng Zheng]]、[[Tong Yu]]、[[Yiwei Yang]]、[[eunomia-bpf]]
- Key insight: [[bpftime]] の公式ドキュメント「GPU Support」(初出2025-09-30、最終更新2026-05-21)を取り込んだ。同一著者陣([[Yusheng Zheng]]・[[Tong Yu]]・[[Yiwei Yang]])による先行ブログ記事([[@2025__eunomia.dev__The GPU Observability Gap - Why We Need eBPF on GPU devices]])が問題設定を一般向けに解説する位置づけだったのに対し、本ページは `nv_attach_impl` パイプライン、3 アタッチ型(`ATTACH_CUDA_PROBE`/`ATTACH_CUDA_RETPROBE`/`__memcapture`)、GPU メモリ常駐の専用マップ(GPU array map・GPU ringbuf map、実装ファイルパス付き)、GPU ヘルパー関数(ID 501-506、`bpf_get_globaltimer`/`bpf_get_thread_idx` 等)、Host-GPU 間のスピンロック通信プロトコル、kernelretsnoop/threadhist/launchlate という3つの具体的な計装ツール例を提示する実装リファレンスである。既存 concept「GPU観測性」に、Nsight Systems/Compute の限界を「クローズドイベントモデル」「本番運用不向き」「in-situ フィルタ欠如」「NVIDIA 専用」の4つに分解する新規知見と、GPU 内部層の具体的な API 面(アタッチ型・専用マップ・ヘルパー関数)を追記した。「eGPU」「PTX 注入」の2 concept にも同様に実装詳細を追記した。NVBit 比 3-10 倍高速という性能主張は本ページで新規に登場したが定量ベンチマークは未掲載であり、未解決の問いとして記録した。
## [2026-08-03] ingest | How to Do Great Work
- Source: `.raw/articles/how-to-do-great-work-2026-08-03.md`(URL: https://paulgraham.com/greatwork.html)
- Summary: [[@2023__paulgraham.com__How to Do Great Work]]
- Pages created: [[@2023__paulgraham.com__How to Do Great Work]]、[[Paul Graham]]、[[偉大な仕事の技法]]
- Pages updated: なし(新規concept・新規entityのみ)
- Key insight: Paul Graham のエッセイ「How to Do Great Work」(2023年7月)を取り込んだ。偉大な仕事をする技法を「分野選択→フロンティア到達→ギャップ発見→探索」の分野横断4ステップに要約し、事前の詳細計画の代わりに各段階で最も面白く選択肢を広げる方向へ進む「upwind に留まる(staying upwind)」戦略を提示。モラールの複利的自己強化サイクル、既存モデルの壊れ(breakage)を見逃さない厳格さとルール破りの組み合わせから生まれるオリジナリティ論、好奇心を4ステップすべての駆動力とする結論を展開する。RCA/AIOps 中心の既存 wiki コーパスとは domain の異なる、創造性・キャリア論の初の source として新設concept「偉大な仕事の技法」を導入した。既存concept「好奇心駆動学習」(強化学習の内発報酬)とは文脈・粒度が異なる別概念として区別して登録し、今後の橋渡し候補として未解決の問いに記録した。
## [2026-08-03] ingest-paper | PRIM: Meta-Learned Bayesian Root Cause Analysis
- Source: `.raw/papers/arxiv-2605.08786.pdf`(arXiv:2605.08786v3)
- Summary: [[@2026__arXiv__PRIM - Meta-Learned Bayesian Root Cause Analysis]]
- Pages created: [[@2026__arXiv__PRIM - Meta-Learned Bayesian Root Cause Analysis]]、[[Anish Dhir]]、[[Amadou Ba]]、[[Marco Ruffini]]、[[Bradley Eck]]、[[Jonas Wahl]]、[[Trinity College Dublin]]、[[DFKI]]、[[CausRCA]]
- Pages updated: [[Christopher Lohse]]、[[PetShop]]、[[因果推論ベースRCA]]、[[アモータイズド因果発見]]
- Key insight: 根本原因分析(RCA)を因果グラフ $G$ と機能的メカニズム $f$ の不確実性を周辺化するベイズ推論タスク $p(T\mid D^{obs}, D^{int}, m)$ として再定式化し、合成 SCM(構造的因果モデル)で事前学習した MACE(Model-Averaged Causal Estimation)transformer neural process により、テスト時の因果探索・統計検定を一切行わず単一フォワードパスで根本原因ノード集合を推定する PRIM を提案。サンプル方向(観測/介入)・ノード方向の交互アテンションで観測分布と異常分布の差分 $\Delta$ を暗黙的に符号化し、最大100変数のシステムに対して17ms(A100 GPU)の一定推論時間でゼロショット推論を実現する(既存の因果探索ベース手法がノード数に対して指数的にスケールするのと対照的)。合成データでの識別可能性実験では観測データのみからは因果グラフが非識別な設定でも根本原因を正しく特定できることを実証し、Squires et al. の I-faithfulness を軸とした識別可能性理論(グラフ $G$ 自体は一意に復元不要)がこれを裏付ける。実世界ベンチマーク PetShop・CausRCA では、グラフ非依存(graph-not-given)手法群の中でファインチューニング版 PRIM-FT が最高の Top-3 recall(平均0.65)・MAP@3(サブシステム平均0.77)を達成し一部設定でグラフ既知手法にも匹敵したが、Recall@1 では相関ベースの単純手法(Corr)に劣後する設定があった。既存concept「因果推論ベースRCA」にテスト時因果探索・統計検定を完全に排除する第三の設計軸という横断的知見を、「アモータイズド因果発見」にグラフ復元ではなく下流タスク出力を直接予測する新系譜を追記した。図5点(Fig.1 アーキテクチャ、Fig.2 confounder/mediator、Fig.3 多根本原因、Fig.4 スケーラビリティ、Fig.5 データ生成プロセス)を埋め込んだ。
## [2026-08-03] ingest-paper | ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload
- Source: `.raw/papers/arxiv-2605.11215.pdf`(arXiv:2605.11215v2)
- Summary: [[@2026__arXiv__ReCoVer - Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload]]
- Pages created: [[@2026__arXiv__ReCoVer - Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload]]、[[Ziyue Liu]]、[[Zheng Zhang]]、[[Bogdan Nicolae]]
- Pages updated: [[UC Santa Barbara]]、[[Argonne National Laboratory]]、[[耐障害LLM訓練]]
- Key insight: 数万 GPU 規模で MTBF が18分に縮小しチェックポイント・リスタート方式が50%超の GPU 時間を浪費する問題に対し、「各反復が常に同じマイクロバッチ数 B を確定させる」という単一不変条件(Σ C_r(t) = W_init・G_init = B)を維持する前方復旧システム ReCoVer を提案。ULFM ベースの障害耐性集合通信(`ULFM_ALLREDUCE`/`ULFM_CONSENSUS`)・反復内バケット単位勾配復元(ワールドエポックタグによる stale バケット判定)・Major/Minor/Major-spare/Minor-spare の4ロールによる動的マイクロバッチ再配分の3層プロトコルで構成され、レプリカを生存の原子単位として3D並列・HSDP双方に並列化スキーム非依存で統合できる。512 GPU・256 GPU 喪失下の3D並列7B LLaMA型モデル事前学習で、無故障参照実行と視覚的に区別不能な訓練損失曲線を260反復にわたり実証し(Appendix Fで分布等価性を数学的に証明)、チェックポイント・リスタート比で連続障害後に最大2.23倍の実効スループット、234 GPU時間で+102Mトークン(+74.9%)多い処理量を達成した。既存concept「耐障害LLM訓練」に、FTAR(勾配ノイズスケール変化による軌跡ドリフト)・SPARE(シミュレーションのみ・冗長計算大)という2つの直近先行研究を名指しで乗り越える「復旧を速くする」から「復旧しても勾配分布を変えない」への軸転換、およびホットスペアとSPAREの中間点にある「動的かつゼロ冗長」なスペア設計という横断的知見を追記した。図7点(Fig.1 概要比較、Fig.5 多用途ワークロード遷移、Fig.6 レプリカ整合性ゲート、Fig.7a/b 軌跡保存・実効スループット、Fig.8b/c 累積トークン処理量・単一障害内訳)を埋め込んだ。
## [2026-08-03] ingest-paper | Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought
- Source: `.raw/papers/tdsc2026-rclagent.pdf`(ユーザー提供のローカル PDF、IEEE TDSC 採録版。arXiv 版 2605.14866 も同一論文として確認済みだが重複回避のため未保持)
- Summary: [[@2026__TDSC__Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought]]
- Pages created: [[@2026__TDSC__Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought]]、[[Chiming Duan]]、[[Minghua He]]、[[Rongqian Wang]]、[[Xi Peng]]、[[Meiling Wang]]、[[Gong Zhang]]、[[Renhai Chen]]、[[Huawei Theory Lab]]
- Pages updated: [[Lingzhe Zhang]]、[[Tong Jia]]、[[Ying Li]]、[[Kangjin Wang]]、[[Peking University]]、[[RCLAgent]]、[[LLMによる根本原因分析]]、[[マルチエージェント協調]]
- Key insight: 15名の SRE インタビューと AIOPS 2022 の失敗100ケース事後分析に基づき、人間の根本原因特定が recursiveness・multi-dimensional expansion・cross-modal reasoning の3特性を持つこと、既存 LLM ベース RCA が文脈爆発・逐次推論構造という2つの限界を抱えることを実証した上で、トレースグラフの各スパンに専任エージェントを再帰的・並列に組織する Multi-Agent Recursion-of-Thought と、Root-Level Diagnosis Report + Global Evidence Graph を統合する Diagnosis Synthesizer からなる RCLAgent を提案。3ベンチマークで mABC・GALA 等の SOTA を精度・効率の両面で上回り、アブレーションで Global Evidence Graph 除去が最大の精度低下をもたらした。既存 entity [[RCLAgent]] が別の引用元論文([[@2026__arXiv__How Far Can Root Cause Analysis Go on Real-World Telemetry Data?]])の記述に基づき登録していたアーキテクチャ("data agent/thought agent"、3フェーズ構成)が、原論文の実際のアーキテクチャ(Dedicated Agent・Agents Pool・Global Evidence Graph・Diagnosis Synthesizer)と一致しない矛盾を発見し、[[RCLAgent]] に contradiction callout として記録した。また共著者 [[Kangjin Wang]] の所属表記が既存 entity([[Alibaba Group]]、2024年時点)と本論文([[Peking University]]、2026年時点)で異なることも要検証事項として entity に注記した。図4点(Fig.2 手動RCLプロセス例、Fig.3 推論ラウンド効果、Fig.4 アーキテクチャ、Fig.7 ハイパーパラメータ分析)を埋め込んだ。
## [2026-08-03] ingest-paper | TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices
- Source: `.raw/papers/arxiv-2605.15611.pdf`
- Summary: [[@2026__arXiv__TopoEvo - A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices]]
- Pages created: [[@2026__arXiv__TopoEvo - A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices]]
- Pages updated: [[Junle Wang]]、[[Xingchuang Liao]]、[[Wenjun Wu]]、[[Beihang University]]、[[仮説駆動RCA]]、[[@2026__arXiv__STAR - A Stage-attributed Triage and Repair framework for RCA Agents in Microservices]]
- Key insight: トポロジ非依存な LLM ベース RCA エージェントが下流の増幅された症状を根本原因と誤認する symptom-amplification bias に対し、MOMA(メトリクス直交整列)・GAT・VQ による監査可能な症状トークン化・HET(Hypothesis-Evidence-Test)マルチエージェント検証・Self-Evolving Mechanism を統合した end-to-end フレームワーク TopoEvo を提案。HET の Hypothesis Planner に victim-as-cause 代替仮説の強制生成を課す設計と、Judge Agent の temporal precedence/path consistency/template consistency 3 基準チェックリストは、既存concept「仮説駆動RCA」が集める「最初のもっともらしい異常への固着」問題への新たな設計的回答となる。STAR(同一著者、後付け修復アプローチ)と対をなす end-to-end アプローチとして位置づけた。
## [2026-08-03] ingest-paper | STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices
- Source: `.raw/papers/arxiv-2605.15581.pdf`
- Summary: [[@2026__arXiv__STAR - A Stage-attributed Triage and Repair framework for RCA Agents in Microservices]]
- Pages created: [[@2026__arXiv__STAR - A Stage-attributed Triage and Repair framework for RCA Agents in Microservices]]、[[Junle Wang]]、[[Xingchuang Liao]]、[[Wenjun Wu]]
- Pages updated: [[Beihang University]]、[[LLMによる根本原因分析]]、[[エージェント修復]]、[[@2024__EMNLP Findings__mABC - Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecture]]、[[@2024__CIKM__RCAgent - Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models]]
- Key insight: LLM ベース RCA エージェント(mABC・RCAgent)の推論トレースを Evidence Package・Hypothesis Set・Analysis Structure・Decision Report の4段階に分解し、反実仮想的な候補パッチ評価で決定的な故障ステージを実証的に特定してから、そのステージ以降のみを再実行する後付け修復フレームワーク STAR を提案。弱いベースライン(RCAgent)ほど STAR からの相対的利得が大きく、当初誤ったトレースの過半数を単一リプレイで修復した。既存concept「エージェント修復」に、AgentTether/PROBE の汎用 TU 粒度帰属と対比する RCA 特化4ステージ粒度帰属という新知見を追加した。
## [2026-08-03] ingest-paper | TuxBot: Semantic-Aware Online OS Tuning with Large Language Models
- Source: `.raw/papers/arxiv-2605.15026.pdf`
- Summary: [[@2026__arXiv__TuxBot - Semantic-Aware Online OS Tuning with Large Language Models]]
- Pages created: [[@2026__arXiv__TuxBot - Semantic-Aware Online OS Tuning with Large Language Models]]、[[Georgios Liargkovas]]、[[Mihir Nitin Joshi]]、[[Kostis Kaffes]]、[[OSノブチューニング]]
- Pages updated: [[Hubertus Franke]]、[[Columbia University]]、[[IBM Research]]、[[データベースノブチューニング]]
- Key insight: 既存のオンライン OS チューニング(MLOS 等)が OS ノブを独立変数として扱うために意味論的に無意味/矛盾した設定を反復探索する問題を実証し、LLM を意味論的推論器とする dual-loop 制御・セッション横断メモリ・型付き検証済みアクチュエーションで解決する TuxBot を提案。13 ワークロード・最大 41 Linux パラメータで最強ベースライン MLOS 比 +153.3% 改善。新設concept「OSノブチューニング」の初出ソースとなった。
## [2026-08-03] ingest-paper | Cloud Performance Decomposition for Long-Term Performance Engineering: A Case Study
- Source: `.raw/papers/arxiv-2605.09787.pdf`
- Summary: [[@2026__arXiv__Cloud Performance Decomposition for Long-Term Performance Engineering - A Case Study]]
- Pages created: [[@2026__arXiv__Cloud Performance Decomposition for Long-Term Performance Engineering - A Case Study]]、[[Shimul Debnath]]、[[William Hart]]、[[Lori Pollock]]、[[Donald Lien]]、[[Wei Wang (UTSA)]]、[[University of Texas at San Antonio]]、[[University of Delaware]]、[[時系列分解]]
- Pages updated: [[異常検知]]
- Key insight: STL のような単純な時系列分解手法がパブリッククラウドの複数周期(週次・月次・四半期)を単一の季節成分にまとめて見逃すことを実証し、ハイブリッド/手動と EEMD ベース自動の 2 分解手法で MAPE 1.8%/2.1% の予測精度と、リソース配分最適化によるレイテンシ標準偏差 60% 超・最大レイテンシ 10% 削減を達成。新設concept「時系列分解」の初出ソースとなった。
## [2026-08-03] ingest-paper | Enabling Performant and Flexible Model-Internal Observability for LLM Inference
- Source: `.raw/papers/arxiv-2605.11093.pdf`
- Summary: [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]]
- Pages created: [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]]、[[Nengneng Yu]]、[[Sixian Xiong]]、[[Yibo Zhao]]、[[Wei Wang (UMD)]]、[[モデル内部可観測性]]
- Pages updated: [[Zaoxing Liu]]、[[University of Maryland]]、[[機構的解釈性]]、[[Speculative Decoding]]
- Key insight: モデル内部可観測性を推論ホットパスから非同期分離するシステム設計(HookPoint + Ring2 + Data Exporter)により、既存のPyTorchフック・エンジン固有APIが抱えていた「柔軟性かオーバーヘッドか」のトレードオフを、オフライン0.4〜6.8%・オンライン平均6%という低オーバーヘッドで解消。新設concept「モデル内部可観測性」の初出ソースとなった。
## [2026-07-31] query(deep) | LLM学習インフラ実運用の教科書(再構築)
- Question: LLM学習インフラの実運用に関する教科書を作成してください。
- Answer: [[wiki/questions/LLM学習インフラ実運用の教科書]](address: c-001711、3,033 行、13 部 100 節、出典 145 件)
- Method: 13 部構成を設計し、第 I〜XI 部を 11 の並列サブエージェントへ分担執筆させた。各エージェントには「wiki に書かれていないことは書かない」「数値・固有名詞・具体的主張はすべて出典 wikilink を伴う」を制約として課し、担当範囲の source/concept ページを実際に読ませた。第 XII 部(実運用プレイブック)・第 XIII 部(未解決問題)・付録はメイン文脈で全ドラフトを横断して執筆した。
- Sources consulted: 145 件(全件が `wiki/sources/` に実在することを検証済み)。主要なものは [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey]]、[[@2024__NSDI__MegaScale - Scaling Large Language Model Training to More Than 10,000 GPUs]]、[[@2025__SOSP__Robust LLM Training Infrastructure at ByteDance]]、[[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]]、[[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]]、[[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]]、[[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]、[[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]]。概念リンク 96 件も全件解決を検証した。
- Key insight: 学習インフラの運用を「GPU 稼働率の最適化」ではなく「有効訓練時間の最大化」として再定義し、13 部を通じて一貫した測定原則を敷いた。核心は三点。(1) 運用指標は件数でなく GPU 時間で測る——インフラ障害は件数 11% で GPU 時間の 82% を消費し、ハードウェア障害はジョブ件数 0.2% で GPU 実行時間の 18.7% に影響する。(2) 同期構造が犯人を隠す——全ランクが同じ症状を示すため箇所特定が困難で、しかも集合通信の透過的リルートは帯域を半減させながらジョブを走らせ続けるため「落ちていない = 健全」が成り立たない。(3) チェックポイント間隔は I/O チューニングの値ではなくジョブ規模と障害率から逆算される設計変数であり、MTTF ≈ (N_nodes・r_f)^-1 と E[ETTR] ≈ 1 - N_nodes・r_f・(u_0 + Δt_cp/2) から 10 万 GPU 級では約 2 分チェックポイント + 約 2 分再起動が要求される。あわせて、単純な復旧手法(直接排除 32.52%・再試行 22.70%・ロールバック 9.20%)が 6 割超を片付け重い機構を要するのは 1.23% にすぎないという投資順序の指針、および計算効率とエネルギー効率が独立軸である(B200 は TFLOPs/GPU で最大 32% 優位だが tokens-per-kilojoule では H100 に劣る)という調達判断上の非対称を記録した。
- Open questions: 第 XIII 部に集約。GPU 内部の可観測性(PTX 注入の実ワークロード評価と verifier の安全性保証)、層をまたぐイベントの意味づけ、「再起動で直るか修理が要るか」の判定、障害タイミング予測の成立不能(最良 F1 0.4837)と優先順位付けへの問題設定の組み替え、NCCL/NVLink/InfiniBand 障害に対する障害注入ツールの不在、異種環境での AllToAllv スケジューリング、注意機構の利用率が構造的に 70〜75% で頭打ちになること、RFT の自動障害管理が緩和率 46.25% ながら失敗介入で悪化しうること、フリート効率指標のスケジューラ間可搬性。
- Notes: 前版(2026-07-31、300 行 6 部)はユーザー依頼により削除済み。本版は一次ソースを実際に読み直して再構築した独立の版である。作業中に `@2025__arXiv__XPUTimer - ... Thousand-Plus Large Scale` が 31 行の空 stub であり実体は `... Thousand-Plus Scale`(Large なし)側にあることが判明した。wiki-lint 案件として別途整理を要する。
## [2026-07-31] concept更新 | LLM推論設計空間探索
- Source: [[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]]
- Pages updated: [[LLM推論設計空間探索]]、[[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]]
- Key insight: 既存の Meta 論文([[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]])単独だった concept ページに NVIDIA の Beyond the Buzz を2つ目のソースとして追加し、横断的知見を5件新規に積み増した。粒度の異なる独自シミュレータ(演算子マイクロベンチマーク補間 vs. kernel-aware)が同一の組合せ爆発課題に収束していること、最適構成がトラフィックパターン(ISL/OSL)に強く依存すること、オフライン設計空間探索とオンライン動的資源割当(Dynamo Planner)が別問題として両論文に共通して現れること、シミュレータの非公開性が両論文共通の再現性上の制約になっていることを記録した。未解決の問いにも、2つのシミュレータの直接比較と、オフライン探索・オンライン調整の統合設計という2件を追加した。
## [2026-07-31] delete | LLM学習インフラ実運用の教科書
- Removed: `LLM学習インフラ実運用の教科書`
- Reason: ユーザーの依頼により削除。既存の作成ログは履歴として保持する。
## [2026-07-31] query | LLM学習インフラ実運用の教科書
- Question: LLM学習インフラの実運用に関する教科書を作成してください。
- Answer: [[LLM学習インフラ実運用の教科書]]
- Sources consulted: [[LLM分散学習]]、[[LLM学習モニタリング]]、[[耐障害LLM訓練]]、[[GPU観測性]]、[[ストラグラー]]、[[@2024__NSDI__MegaScale - Scaling Large Language Model Training to More Than 10,000 GPUs]]、[[@2025__SOSP__Robust LLM Training Infrastructure at ByteDance]]、[[@2025__NSDI__Minder - Faulty Machine Detection for Large-scale Distributed Model Training]]、[[@2026__arXiv__ARGUS - Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters]]、[[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]]、[[@2025__SpeakerDeck__AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性]]
- Key insight: LLM学習基盤の実運用を、GPU利用率の最適化ではなく、有効訓練時間を最大化する制御ループとして整理した。性能、スケジューリング、階層的テレメトリ、ストラグラー、隔離、チェックポイント、復元試験、変更管理を、検知・隔離・診断・復旧の工程へ対応づけた。
## [2026-07-31] ingest-slides(追記) | 性能測定道 実践編 — Whisper文字起こしを反映
- Source: `.raw/slides/seinou-sokuteidou-jissen-jpug2014/media/whisper/audio.vtt`
- Summary: [[@2014__JPUG__性能測定道 実践編]]
- Pages updated: [[@2014__JPUG__性能測定道 実践編]], [[性能測定]]
- Key insight: バックグラウンドで実行していたWhisper文字起こしが完了したため、「口頭説明・補足」節とQ&A節を追記した。最大の収穫は、「実測レイテンシがWikipedia理論値を一貫して上回る」という現象について講演者自身が「AWS EC2は仮想マシン環境なのでリアルなキャッシュレイテンシがそのまま見えていない、物理マシンでは文献値とほぼ一致する」と口頭で明言していたこと。これによりconcept「性能測定」の「未解決の問い」に残していた同項目を、確定情報として横断的知見へ格上げした。また主記憶レイテンシがアクセス領域拡大でさらに悪化する理由(ページテーブルlookupコストの積算)、EBSボリュームのIOPS制御に関する未書き込み状態依存の推測、PerfMongerの実装がカーネルモジュールではなくprocファイルシステムの再集計であることも新たに追記した。
- Note: 前回ログ(初回ingest)時点でバックグラウンド実行中だったWhisper処理(baqx8szb7)が途中でkillされたため、既に取得済みの音声ファイルに対しwhisperコマンドを直接再実行して完遂させた。
## [2026-07-31] ingest-slides | 性能測定道 実践編
- Source: `.raw/slides/seinou-sokuteidou-jissen-jpug2014/pages/`(PDF原本なし。SlideShareのボット対策によりCDN上の個別スライド画像638px幅JPG全106枚を代替一次資料として使用)
- Visual pages: `.raw/slides/seinou-sokuteidou-jissen-jpug2014/pages/`
- Media: `.raw/slides/seinou-sokuteidou-jissen-jpug2014/media/`(音声抽出済み、Whisper文字起こしは処理継続中のため本ingestには未反映)
- Summary: [[@2014__JPUG__性能測定道 実践編]]
- Pages created: [[micbench]], [[PerfMonger]]
- Pages updated: [[早水悠登]], [[喜連川優]], [[性能測定]]
- Key insight: 「事始め編」の続編。実行時間とメモリアクセス回数が比例するとは限らないという核心的な落とし穴を示し、命令パイプライン・スーパースカラ実行・プリフェッチ・分岐予測というCPUの性能最適化機構を意図的に無力化する(ニート化する)測定コードの書き方を解説した。自作ツールmicbench・PerfMongerを用いたAWS EC2上のライブデモで、メモリアクセスレイテンシ実測値がWikipedia調べの理論値を一貫して上回ることを示し、sysstatの限界(可読性・リアルタイム性)を解決する独自モニタリングツールを実演した。
- Note: 文字起こし(Whisper)がバックグラウンドで長時間実行中のため、口頭説明・Q&Aは未反映のまま先行コミットした。完了次第、source ページの「口頭説明・補足」節を追記する(前回の「事始め編」ingestと同じフォローアップパターン)。
## [2026-07-31] ingest-paper(再取り込み) | CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion
- Source: `.raw/papers/arxiv-2405.16444.pdf`
- Summary: [[@2025__EuroSys__CacheBlend - Fast Large Language Model Serving for RAG with Cached Knowledge Fusion]]
- Pages updated: [[@2025__EuroSys__CacheBlend - Fast Large Language Model Serving for RAG with Cached Knowledge Fusion]]
- Key insight: 初回取り込みの図表クロップが左右2カラムの列またぎで座標がずれ、Figure 2/3が同一クロップに混在し、Figure 4とTable 1がページ送りでずれた別クロップに重複混在していた。PyMuPDFでページ内の全ブロック座標(get_text("blocks"))を確認し列(x範囲)を先に固定してから図ごとにy範囲をクロップし直した(Figure 1・2・3・4・11・12とTable 1の計7枚)。本文もプリフィル/KVキャッシュの背景、§4の用語定義(KV偏差・アテンション偏差の数式)、漸次フィルタリングによるHKVDトークン選定のインサイト1・2、ローディングコントローラの遅延推定式($T_{recompute}$・$T_{load}$)、vLLM実装の3インターフェース詳細、§7.3の感度分析(再計算比率5〜18%・チャンク数長・バッチサイズ・ストレージデバイス)を追加して深掘りした。
- Note: PagedAttention論文の再取り込み([[@2023__SOSP__Efficient Memory Management for Large Language Model Serving with PagedAttention]])と同種の失敗パターン(2カラムレイアウトでの列またぎクロップ)。今後のingest-paperでは列のx範囲を先に確定してからy範囲を決める手順を徹底する。
## [2026-07-31] ingest-slides(追記) | 性能測定道 事始め編 — Whisper文字起こしを反映
- Source: `.raw/slides/seinou-sokuteidou-jpug2013/transcript.md`
- Summary: [[@2013__JPUG__性能測定道 事始め編]]
- Pages updated: [[@2013__JPUG__性能測定道 事始め編]]
- Key insight: バックグラウンドで実行していたWhisper文字起こしが完了したため、「口頭説明・補足」節と「Q&A」節を追記した。スライドには数値の無い8ソケットNUMAサーバのメモリレイテンシ階層実測(L1=4サイクル、L2=10サイクル、L3=60サイクル、1ホップDRAM=約420サイクル、QPI跨ぎ+100サイクル)、省電力ストレージ/プロセッサ研究(ディスクのActive/Idle/Standby状態遷移モデル化、OLTPアプリケーション情報を使ったDVFS制御の2ポリシー)を口頭説明由来として追加。質疑応答4件(モデルと測定値のズレ幅、履歴依存ワークロードのモデル化の難しさ、研究室での性能測定の学び方、測定プローブ自体が対象の挙動を変えてしまう場合の対処)も追記した。省電力研究の事例は取得済み49ページのスライド範囲外で語られたと見られ、口頭説明のみを根拠とする不確実点として明記した。
- Note: 前回ログ([[@2013__JPUG__性能測定道 事始め編]]の初回ingest)時点でバックグラウンド実行中だったWhisper処理の完了を受けたフォローアップ。
## [2026-07-31] ingest-slides | 性能測定道 事始め編
- Source: `.raw/slides/seinou-sokuteidou-jpug2013/pages/`(PDF原本なし。SlideShareのボット対策によりCDN上の個別スライド画像638px幅JPG全49枚を代替一次資料として使用)
- Visual pages: `.raw/slides/seinou-sokuteidou-jpug2013/pages/`
- Media: `.raw/slides/seinou-sokuteidou-jpug2013/media/`(音声抽出済み、Whisper文字起こしは処理継続中のため本ingestには未反映)
- Summary: [[@2013__JPUG__性能測定道 事始め編]]
- Pages created: [[早水悠登]], [[喜連川優]], [[性能測定]]
- Key insight: 性能測定を「モデル化・計測・シミュレーション」の三角形として捉え、それぞれが互いに検証し合う関係にあるという方法論を、HDDのスループットモデル化・待ち行列理論M/M/1によるOLTPモデル化・I/O REPLAYシミュレーションの3実例で具体化した講演。SlideShareのPDFダウンロードがClient Challengeでブロックされたため、CDN上の個別スライドJPG(image.slidesharecdn.com、638px幅)を直接ダウンロードする代替経路で全49ページを取得した。
- Note: 文字起こし(Whisper)がバックグラウンドで長時間実行中のため、口頭説明・Q&Aは未反映のまま先行コミットした。完了次第、source ページの「口頭説明・補足」節を追記する。
## [2026-07-31] ingest-paper(再取り込み) | Efficient Memory Management for Large Language Model Serving with PagedAttention
- Source: `.raw/papers/arxiv-2309.06180.pdf`
- Summary: [[@2023__SOSP__Efficient Memory Management for Large Language Model Serving with PagedAttention]]
- Pages updated: [[@2023__SOSP__Efficient Memory Management for Large Language Model Serving with PagedAttention]]
- Key insight: 初回取り込み時の図表クロップがページ2カラムの座標ずれで隣接図(例: Figure 4とFigure 5、Figure 6とFigure 7)を1枚に混在させていた。PyMuPDFでキャプション座標と直前テキストブロックのy座標を突き合わせて図ごとに個別クロップし直し(Figure 1-7の7枚)、本文もPagedAttentionのブロック単位計算式・KVキャッシュマネージャ・スケジューリング/プリエンプション・カーネル最適化・実験結果の数値(ブロックサイズ既定16の根拠、shared prefixで1.67-3.58倍、chatbotで2倍のリクエストレート等)を追加して深掘りした。
- Note: 図の混在は§Step 0.5のPyMuPDFクロップで「直前のテキストブロックのy1を図の上端とする」目安が2カラムレイアウトで列を跨いだ場合に誤爆しうることを示す実例。今後は列(x範囲)を先に固定してからy範囲を決める。
## [2026-07-31] query(更新) | KVキャッシュ管理の教科書(第 2 版)
- Question: @wiki/questions/KVキャッシュ管理の教科書.md を、それ以降に wiki へ取り込んだ文献を踏まえて更新せよ。
- Answer: [[KVキャッシュ管理の教科書]](1086 行 → 1497 行)
- Sources consulted: 初版作成(2026-07-30 11:20)以降に ingest された 20 件を精査し、KV キャッシュに寄与する 11 件を反映。[[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]]、[[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]]、[[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]]、[[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]、[[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]]、[[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]]、[[@2026__arXiv__Speculative Decoding - Performance or Illusion?]]、[[@2026__MLSys2026__FaaScale - Unlocking Fast LLM Scaling for Serverless Inference]]、[[@2026__arXiv__FlashInfer-Bench - Building the Virtuous Cycle for AI-driven LLM Systems]]、[[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]]、[[@2026__MLSys__BOute - Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization]]
- Pages updated: [[KVキャッシュ管理の教科書]]、[[index]]
- Key insight: 章立て(13 部 35 章)と図版 35 枚を保存したまま、各章の内部を書き足す方式で改訂した。章を挿入すると `kv-cache-textbook-chNN.png` の参照が総崩れになるため、番号を動かさない制約を先に置いた。主な追加は 6 点。(1) 第 3 章と第 22 章に「ビット幅を下げる」という第 3 の削減軸を導入。Kitty の診断(Key チャネルの量子化感度の偏り、Qwen3-8B の MATH-Algebra が 4bit→2bit で -40.97)と処方(上位 12.5〜25% チャネルの INT4 昇格で FP16 との差 0.97 ポイント)を本文化。(2) 第 7・8 章に BatchLLM のオフライン一括推論を追加し、「オンライン=履歴からの推測、オフライン=事前の大域最適化」という 2 レジームの分岐を明示。vLLM/SGLang が極端条件でベースライン比 0.49/0.56 倍へ劣化する反例も収録。(3) 第 14 章と第 33 章に SuperInfer を追加し、二重粒度に「GPU-CPU 密結合(NVLink-C2C)も同じ粒度問題の対象で、要求粒度はむしろ大きくなる(8MB 以上)」という第 3 の階層を追加。転送側で吸収する解(LMCache/P-D-Serve)と発生源のレイアウトで解消する解(block-first)の対比を立てた。(4) 第 16 章の contradiction callout「KV 転送コストは無視できるか」に第 3 の証言を追加。帯域要件の分母に SLA が入るため「無視できるか」は SLA の厳しさで決まること、入力が長いほど出方向帯域要件は下がる(注意計算は二乗・KV は線形)という直観の反転を収録。あわせて Meta のオンライン/オフライン軸(オフラインでは分離の優位が消失)と、分離の利得がデコードバッチ 112 対 28 という KV 容量の使い切りに由来する分解を追加。(5) 第 22 章に HiSparse を追加し、スパース注意が「読み出しは疎・保持は密」ゆえに容量律速になること、ローディング段の手法は第 V 部の階層化と組み合わせて初めて容量利益を得ることを明示。(6) 第 2 章に「デコードはメモリバウンド」の適用範囲を注記し、バッチサイズという操作点を導入した(投機的復号の速度向上が 1.73→1.21 倍に縮む)。付録 D に第 2 版分の数値注意 15 項目を追加。
- Contradictions: 新規に 3 件を本文化した。(a) LRU の評価が章によって逆になる問題(第 25 章は本番トレースに基づき「LRU は不十分」、第 22 章の HiSparse は LRU が FIFO/乱択より優位)。時間粒度の違い(リクエスト間のブロック再利用 vs 単一復号内の top-k 局所性)として第 22 章に note callout で調停した。(b) KV クリフ(第 32 章)の検証状況の弱さ。同時期に周波数制御を扱う BEAM が KV 利用率を一切観測しないまま SLO 遵守率 94.5% を達成しており、裏づけにも反証にもならないことを明示。BEAM の数値を KV クリフの根拠に使わない旨を本文と付録の両方に記した。(c) コールドスタート時間の桁の食い違い(AIBrix 2〜3 分、PreServe 数十秒〜数百秒、FaaScale 1.1 秒)。測定対象が違うため FaaScale を PreServe の前提の反証に使えないことを note callout で明記。
- Open questions: 第 35 章に 13 問を追加。とくに (1) block-first レイアウトが GPU 内の注意計算を損なわずに成立するなら「二重粒度は構造的制約」という主張自体が弱まる点、(2) 退避優先度の 2 系統(再利用確率 vs SLO 進捗の遅れ)が同じ HBM を奪い合う調停問題、(3) 分離構成の最適 P:D 比がプレフィックスキャッシュと投機的復号で逆向きに動くため再利用最適化と資源配分が独立でない点、(4) 量子化系の評価が単一ターン主流であり SCBench の軸で測り直す必要がある点。
- Note: 寄与が薄いソースは正直にそう扱った。BOute は KV への言及がゼロのため第 26 章の「入出力長分布の変化が最も再設計コストの高い事象(DB 再構築 24.5 分)」の 1 点のみに限定。BEAM は KV を扱わない対照例としてのみ第 32 章に置いた。veScale-FSDP・DreamDDP・AccelOpt・LEANN・Cost-aware Duration Prediction は KV キャッシュ管理に無関係として不採用。
## [2026-07-31] ingest-paper(再取り込み) | XProf: An Open, Scalable, and Extensible Profiling System for the Modern ML Stack
- Source: `.raw/papers/mlsys2026-xprof-paper.pdf`(ユーザー提供ローカルPDF、MLSys 2026 Industry Track proceedings、19頁)、`.raw/papers/mlsys2026-xprof-slides.pdf`(既存、UIスクリーンショット補足用に継続使用)
- Summary: [[@2026__MLSys2026__XProf - An Open, Scalable and Extensible Profiling System for the Modern ML Stack]]
- Pages updated: [[@2026__MLSys2026__XProf - An Open, Scalable and Extensible Profiling System for the Modern ML Stack]]、[[MLプロファイリング]]
- Key insight: 初回 ingest(2026-07-02)は論文 PDF が Cloudflare 認証で取得できずスライドのみの簡潔な記述だったが、ユーザー提供の論文 PDF により全面的に取り込み直した。TPU(0.3%未満)とGPU H100(0.13%〜2.30%)でオーバーヘッドが一桁近く非対称であるという、要約の "<1%" 主張と実測値の温度差を含む定量結果を追加し、論文の図6枚を新規抽出・埋め込みした。
## [2026-07-31] ingest-paper | Optimizing Deployment Configurations for LLM Inference: Challenges and Insights
- Source: `.raw/papers/87_Optimizing_Deployment_Confi.pdf`(ユーザー提供ローカルPDF、MLSys 2026 Industry Track)、`.raw/slides/optdeploy-mlsys2026/optdeploy-mlsys2026.pdf`(MLSys 2026会議サイト直リンク`https://mlsys.org/media/mlsys-2026/Slides/3780.pdf`、15ページ全て確認)
- Summary: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]
- Pages created: [[LLM推論設計空間探索]]
- Pages updated: [[Meta]]、[[Prefill-Decode分離]]、[[並列化戦略]]、[[Mixture-of-Experts]]、[[index]]、[[hot]]、[[sources/_index]]、[[concepts/_index]]
- Key insight: Meta Inference Team が月間アクティブユーザー約10億人規模の Llama 推論運用から得たデプロイメント最適化知見を報告。ハードウェア・5次元並列化・ランタイムの組み合わせが数百万規模に達する設計空間を、演算子マイクロベンチマーク駆動の軽量シミュレータ(実機比±5%精度)で体系的に探索する手法を開発し、5つの知見を提示: (1) オンライン推論では Prefill-Decode 分離が継続的バッチング比1.5〜2.2倍のQPS(オフラインでは差が消失)、Metaはオンラインサービスの大半を分離へ移行し約30%容量削減。(2) Prefill/Decode で最適並列化戦略が体系的に異なる。(3) 異種ハードウェアのフェーズ別割当でTCO 15〜25%改善。(4) Expert Parallelism が MoE のスケールアウトを効率化(Llama 4 Maverick で TP16 化は Decode QPS ほぼ半減、EP併用は TP8 比+45%)。(5) 密モデルはスケールアップ必須だが MoE はスケールアウトでも良好にスケール。新設concept「LLM推論設計空間探索」を導入し、既存concept「Prefill-Decode分離」「並列化戦略」「Mixture-of-Experts」に本番規模の定量知見を追記した。著者は約60名の大規模産業論文のため、個別の著者entityページは corresponding authors を含め新規作成せず、組織entity「Meta」の更新に留めた。
- Contradictions: なし。
## [2026-07-31] ingest | HiSparse: Turbocharging Sparse Attention with Hierarchical Memory
- Source: `.raw/articles/sglang-hisparse-2026-04-10.md`(URL: https://www.lmsys.org/blog/2026-04-10-sglang-hisparse/、LMSYS Org 公式ブログ、PDF/arXiv 論文なし)
- Summary: [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]]
- Pages created: [[スパース注意]]
- Pages updated: [[SGLang]]、[[LMSYS]]、[[DeepSeek-V3.2]]、[[KVキャッシュ管理]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: 当初 `/wiki-ingest-paper` で呼び出されたが、対象 URL が査読論文・arXiv プレプリントいずれでもなく PDF が存在しない技術ブログ記事だったため、ユーザーに確認のうえ `wiki-ingest`(汎用フロー)へ切り替えて取り込んだ。スパース注意(top-k 選択)がフルコンテキスト KV キャッシュを GPU HBM に保持し続ける必要があるため capacity-bound になりやすい問題に対し、不活性エントリのホストメモリ退避 + GPU HBM 上の hot device buffer による階層メモリ設計(HiSparse)を提案。専用 CUDA カーネルによる top-k キャッシュミス処理と LRU 退避方針の組み合わせが FIFO・Random よりミスカウントを削減することを DeepSeek-V3.2 で確認し、GLM-5.1-FP8 で並行数256時にベースライン比3倍超、長文脈シーケンス構成で最大約4.9倍のスループット改善を報告。新設concept「スパース注意」を導入し、既存concept「KVキャッシュ管理」に「スパース注意は容量ボトルネックの再配置であり既存のホストメモリ階層退避の設計思想がそのまま適用できる」という横断的知見を追記した。
- Contradictions: なし。
## [2026-07-31] ingest-paper | AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization
- Source: `.raw/papers/36_AccelOpt_A_Self_Improving_L.pdf`(ユーザー提供ローカルPDF、arXiv:2511.15915、MLSys 2026 Oral)
- Summary: [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]]
- Pages created: [[Genghan Zhang]]、[[Kunle Olukotun]]、[[Yida Wang]]、[[Anjiang Wei]]、[[Zhen Jia]]、[[AWS Trainium]]、[[Neuron Kernel Interface (NKI)]]、[[NKIBench]]、[[AccelOpt (repository)]]、[[LLMによるカーネル最適化]]
- Pages updated: [[Stanford University]]、[[Amazon Web Services]]、[[University of Toronto]]、[[エージェントメモリ]]、[[AIアクセラレータ]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: 専門家提供のハードウェア固有最適化知識に頼らずAWS Trainium向けNKIカーネルを自律的に最適化する自己改善型LLMエージェントシステムを取り込み。ビームサーチ(planner・executor・summarizerの3エージェントワークフロー)と、スロー・ファストなカーネル対(正・負の書き換え)を要約して転写する容量制御された最適化メモリを組み合わせ、実世界LLMワークロード由来14カーネルのベンチマークNKIBenchで評価。オープンソースモデルでTrainium 1のピーク到達率を49%から61%へ改善し、Claude Sonnet 4と同等性能を26倍安いコストで達成、Mamba・RoPEカーネルでは人間専門家の最良実装を上回った。新設concept「LLMによるカーネル最適化」を導入し、既存concept「エージェントメモリ」に正負両方のシグナルをバランスさせるメモリ設計、「AIアクセラレータ」にTrainium追加とソフトウェア成熟度不足への解決軸を追記した。同時期に取り込まれた「LLM駆動GPUカーネル生成」(FlashInfer-Bench起点)とは境界の異なる姉妹概念として相互参照したが、当該conceptページ自体は取り込み時点で他セッションがロック保持中のため直接編集できず、片側からの参照追記に留めた。
- Contradictions: なし。
## [2026-07-31] ingest-paper | FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems
- Source: `.raw/papers/124_FlashInfer_Bench_Building_.pdf`(ユーザー提供ローカルPDF、arXiv:2601.00227、MLSys 2026)
- Summary: [[@2026__arXiv__FlashInfer-Bench - Building the Virtuous Cycle for AI-driven LLM Systems]]
- Pages created: [[Shanli Xing]]、[[Yiyan Zhai]]、[[Alexander Jiang]]、[[Yixin Dong]]、[[Zihao Ye]]、[[Charlie Ruan]]、[[Yingyi Huang]]、[[Yineng Zhang]]、[[Liangsheng Yin]]、[[Aksara Bayyapu]]、[[Luis Ceze]]、[[FlashInfer]]、[[LLM駆動GPUカーネル生成]]
- Pages updated: [[Yong Wu]]、[[Tianqi Chen]]、[[NVIDIA]]、[[Carnegie Mellon University]]、[[University of Washington]]、[[University of California, Berkeley]]、[[SGLang]]、[[vLLM]]、[[GPU最適化]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: LLMエージェントが生成するGPUカーネルを本番LLM推論システムへ統合するための標準化されたクローズドループフレームワークを取り込み。カーネル定義・実世界ワークロード・候補実装・評価結果を単一スキーマ(FlashInfer Trace)で記述し、実サービストレース由来の79定義・2,474ワークロードからなるデータセット、決定的/低精度/非決定的カーネルに対応した堅牢なベンチマーク基盤、コード変更なしで最良カーネルをSGLang・vLLM等へ動的注入する`flashinfer_bench.apply()`を統合する。全32件の正しさエラーのうち30件がコンパイル失敗であること、Tritonの方がCUDAより正しさ・速度ともに一貫して高いこと、GEMMではエージェントがcuBLAS呼び出しを学習し人間水準に達する一方GQA Ragged・MLA Paged・MoEではFlashInfer基準の0.4倍未満にとどまることを定量的に示した。新設concept「LLM駆動GPUカーネル生成」を導入し、既存concept「GPU最適化」にエージェントが到達できる最適化技術とできない技術の対比を追記した。なお本ソースは同日中に一度セッションが中断され、source ページ・全entity(12名+FlashInfer)までは既に作成済みだった状態から、concept ページ・index/hot/log/manifest の仕上げを完了させる形で ingest を完結させた。
- Contradictions: なし。
## [2026-07-30] ingest-paper | LEANN: A Low-Storage Vector Index
- Source: `.raw/papers/59_LEANN_A_Low_Storage_Overhea.pdf`(ユーザー提供ローカルPDF、arXiv:2506.08276、MLSys 2026 Oral)、`.raw/slides/leann-mlsys2026/leann-mlsys2026.pdf`(MLSys 2026会議サイト直リンク`https://mlsys.org/media/mlsys-2026/Slides/3786_vlIWXsd.pdf`、37ページ)
- Summary: [[@2025__arXiv__LEANN - A Low-Storage Vector Index]]
- Pages created: [[Yichuan Wang]]、[[Joseph E. Gonzalez]]、[[LEANN (repository)]]、[[ベクトル検索インデックス]]
- Pages updated: [[Ion Stoica]]、[[Matei Zaharia]]、[[University of California, Berkeley]]、[[The Chinese University of Hong Kong]]、[[Amazon Web Services]]、[[University of California, Davis]]、[[LLM向け情報検索]]、[[エージェントメモリ]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: ベクトル検索インデックスのストレージオーバーヘッドを、埋め込みのオンザフライ再計算と高次数保存グラフ枝刈りの2軸で解決するLEANNを取り込み。76GBデータセットに対しインデックスサイズを4GB(生データの5%未満)へ圧縮しつつHNSW同等の検索精度を維持し、既存手法(HNSW・DiskANN等)比最大50倍のストレージ削減を達成。RAGパイプラインでは生成が総レイテンシの99.8%を占め検索は0.24%に過ぎないという観測に基づき、わずかなレイテンシ増加(20%未満)とストレージの大幅削減をトレードする設計思想を採る。MLSys 2026発表スライド(37ページ全て確認)は、論文出版後のコミュニティ実測(LinkedIn実践者による136倍ストレージ削減報告、GitHub 11.4k+ stars・1k+ forks)とClaude Code向けMCPベースセマンティック検索連携(SWE-bench Pass@1が0.63→0.73に改善)という論文本文にない一次情報を含んでおり、「MLSys 2026発表スライドからの補足」節として明示的に区別して統合した。新設concept「ベクトル検索インデックス」を導入し、既存concept「LLM向け情報検索」(検索インフラの物理制約からの目的関数転換の補強)・「エージェントメモリ」(忘却機構との構造的同型性)にそれぞれ横断的知見を追記した。
- Contradictions: なし。
## [2026-07-30] ingest-paper | veScale-FSDP: Flexible and High-Performance FSDP at Scale
- Source: `.raw/papers/48_veScale_FSDP_Flexible_and_H.pdf`(ユーザー提供のローカル PDF、MLSys 2026 Industry Track)、`.raw/slides/vescale-fsdp-mlsys2026/vescale-fsdp-mlsys2026.pdf`(MLSys 2026 会議サイト直リンク `https://mlsys.org/media/mlsys-2026/Slides/3860.pdf`、94ページ)
- Summary: [[@2026__MLSys2026__veScale-FSDP - Flexible and High-Performance FSDP at Scale]]
- Pages created: [[Zezhou Wang]]、[[Yanghua Peng]]、[[veScale]]、[[RaggedShard]]
- Pages updated: [[Xin Liu]]、[[ByteDance Seed]]、[[University of Washington]]、[[ZeROパラメータシャーディング]]、[[ZeROメモリ最適化]]、[[集合通信]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: 既存 FSDP システム(DeepSpeed・FSDP1・FSDP2・Megatron-FSDP)の固定シャーディング粒度がブロック単位量子化・非要素単位オプティマイザ(Shampoo/Muon)と衝突する問題を、任意粒度シャーディング RaggedShard・NP-hard 最適化に基づく構造認識プランニングアルゴリズム・ゼロコピー通信プリミティブ DBuffer で解決。既存システム比スループット 5〜66% 向上・メモリ 16〜30% 削減を達成し、ByteDance Seed の本番環境で 10K GPU 超のワークロードにすでに展開済み。
- Contradictions: なし。
## [2026-07-30] ingest-paper | DreamDDP: Accelerating Low-Bandwidth Geo-Distributed LLM Training with Layer-wise Partial Synchronization
- Source: `.raw/papers/56_DreamDDP_Accelerating_Low_B.pdf`(ユーザー提供のローカル PDF。MLSys 2026 Oral の camera-ready 版。arXiv 版 2502.11058 とはタイトルが異なることを WebFetch で確認した上で本 PDF を原本として採用)
- Summary: [[@2026__MLSys__DreamDDP - Accelerating Low-Bandwidth Geo-Distributed LLM Training with Layer-wise Partial Synchronization]]
- Pages created: [[Zhenheng Tang]]、[[Shaohuai Shi]]、[[Xiaowen Chu]]、[[Bo Li]]、[[Hong Kong Baptist University]]、[[Harbin Institute of Technology]]
- Pages updated: [[並列化戦略]]、[[集合通信]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]
- Key insight: Local SGD の全層一括同期を層単位で分解する partial synchronization(PLSGD)により、通信と逆伝播のオーバーラップを実現しつつ S-SGD と同じ収束率 O(1/R) を理論的に保証する。3 つの性質(Optimal Hiding・Delayed CO Assignment・At-least-One Assignment)による DFS スケジューラで探索空間を (H+L)!/(L!H!) から O(2^{min(L-H,H)}) に削減し、32 GPU の実験で ASC-WFBP 比 1.73〜5.22 倍の反復時間短縮を達成した。
- Contradictions: なし。
## [2026-07-30] ingest-paper | Speculative Decoding: Performance or Illusion?
- Source: `.raw/papers/arxiv-2601.11580.pdf`(arXiv:2601.11580、MLSys 2026。OpenReview の PDF 直リンクが Cloudflare Turnstile で 403 だったため、先にスライドで著者・タイトルを特定し arXiv API 経由で取得)、`.raw/slides/mlsys2026-3782/mlsys2026-3782.pdf`(MLSys 2026 会議サイト直リンク `https://mlsys.org/media/mlsys-2026/Slides/3782.pdf`、18ページ)
- Summary: [[@2026__arXiv__Speculative Decoding - Performance or Illusion?]]
- Pages created: [[Xiaoxuan Liu]]、[[Jiaxiang Yu]]、[[Jongseok Park]]、[[Alvin Cheung]]
- Pages updated: [[Ion Stoica]]、[[Speculative Decoding]]、[[LLM推論]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: 本番グレードの推論エンジン vLLM 上で n-gram・EAGLE/EAGLE-3・Draft-Model・MTP の投機的デコーディング(SD)変種を、バッチサイズ 1〜128・モデル規模 8B〜106B・6 種のワークロードにわたって初めて体系的に比較。検証段階が実行時間の 42〜95% を占め支配的コストであり、バッチサイズ増加とともに速度向上が縮小する(この減衰はモデルサイズが大きいほど増幅される)ことを実測。実測データに基づく理論上限(oracle)シミュレータで、EAGLE と n-gram を位置適応的に組み合わせる Oracle Combine が標準デコーディング比最大4.9×の追加速度向上をもたらす可能性を定量化した。
- Contradictions: なし。
## [2026-07-30] ingest-paper | SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips
- Source: `.raw/papers/07fd64f9316f40193c6a4d87d8afa011-Paper-Conference.pdf`(MLSys 2026 Proceedings、`https://proceedings.mlsys.org/paper_files/paper/2026/file/07fd64f9316f40193c6a4d87d8afa011-Paper-Conference.pdf`)、`.raw/slides/superinfer-mlsys2026/superinfer-mlsys2026.pdf`(MLSys 2026 会議サイト直リンク `https://mlsys.org/media/mlsys-2026/Slides/3809.pdf`、13ページ)
- Summary: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]]
- Pages created: [[Jiahuan Yu]]、[[Mingtao Hu]]、[[Zichao Lin]]、[[Minjia Zhang]]、[[NVIDIA GH200]]
- Pages updated: [[University of Illinois Urbana-Champaign]]、[[vLLM]]、[[KVキャッシュ管理]]、[[LLMサービング管理]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]
- Key insight: NVIDIA GH200 のような GPU-CPU 密結合 Superchip(NVLink-C2C 900GB/s)に既存 LLM サービングシステムをそのまま移植しても C2C 帯域の5%未満しか活用できない原因を、PagedAttention の細粒度セグメント(64KB)と大量のカーネル起動オーバーヘッドというソフトウェアスタックに特定。Virtual Lag Time に基づく能動的ローテーションスケジューラ RotaSched と、eager block rotation + block-first レイアウトで全二重転送を実現する DuplexKV を co-design し、TTFT SLO 達成率を最大74.7%改善(DuplexKV は理想帯域比94%)。GH200 の Unified Memory を素朴に使う代替案が「bandwidth cliff」により不適であることも実証した。
- Contradictions: なし。
## [2026-07-30] ingest-paper | TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference
- Source: `.raw/papers/arxiv-2505.11329.pdf`(ユーザー提供ローカル PDF `5_TokenWeave_Efficient_Compute.pdf` から取り込み。ファイル名がサンドボックスの `**/*token*` 読み取り拒否ルールに抵触したため、arXiv ID 2505.11329 を特定し正式な slug で取得し直した。元ファイルは削除。MLSys 2026 採択、arXiv 初出 2025-05-16、掲載版 v5 は 2026-05-01)
- Summary: [[@2025__arXiv__TokenWeave - Efficient Compute-Communication Overlap for Distributed LLM Inference]]
- Pages created: [[Raja Gond]]
- Pages updated: [[Nipun Kwatra]]、[[Ramachandran Ramjee]]、[[テンソル並列]]、[[集合通信]]、[[LLM推論]]、[[index]]、[[hot]]
- Key insight: テンソル並列推論の AllReduce 通信オーバーヘッド(8×H100 で NVLink+NVSHARP を使っても 9–23% 残存)を、これまで見過ごされてきた RMSNorm のオーバーヘッド(4–9%)ごと削減する融合 AllReduce–RMSNorm カーネルを NVSHARP/Multimem で実装し、通信+正規化をわずか 2–8 SM で処理する TokenWeave を提案。既存の compute-communication overlap 手法(Flux・TileLink・NanoFlow)が大バッチ(8K+ トークン)でしか機能しないのに対し、wave 数を意識した smart-splitting(2 分割)により、トークン数 1024 という小規模イテレーションでも分割オーバーヘッドをほぼ無視できるレベルに抑えて通信隠蔽を成立させた点が中心的な貢献。vLLM V1 に実装し、Llama-3.3-70B・Qwen2.5-72B・Mixtral-8x22B で最大 1.28 倍のレイテンシ改善・1.19 倍のスループット改善を達成し、一部設定では通信を完全除去した理論上限(vLLM-nocomm)すら上回った。図はベクター描画のアーキテクチャ概要(Figure 7)・レイテンシ結果(Figure 2)を PyMuPDF でキャプション座標クロップ、埋め込み画像から選択的有効化フロー(Figure 3)・wave 分割説明(Figure 8)を選定し計4枚を埋め込んだ。
- Contradictions: なし。
## [2026-07-30] ingest-paper | FaaScale: Unlocking Fast LLM Scaling for Serverless Inference
- Source: `.raw/papers/24_FaaScale_Unlocking_Fast_LLM.pdf`(ユーザー提供ローカル PDF、MLSys 2026 Proceedings)
- Summary: [[@2026__MLSys2026__FaaScale - Unlocking Fast LLM Scaling for Serverless Inference]]
- Pages created: [[Minchen Yu]]、[[Yue Cheng]]、[[Wei Wang]]、[[Ao Wang]]、[[Ruichuan Chen]]、[[University of Virginia]]、[[モデルスケーリング高速化]]
- Pages updated: [[LLMサービング管理]]、[[index]]、[[hot]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]
- Key insight: サーバーレス LLM 推論のコールドスタートを bursty request patterns・large resource footprint・model proliferation の trilemma として実測(モデルキープアライブ時間の 95% 超が 15 秒未満、実トレースでの SSD キャッシュミス率 64%/36%)で定式化し、binomial pipeline による適応的モデルマルチキャストと動的パイプライン並列推論を co-design する PipeCast(FaaScale)を提案。k-way 伝送戦略と実行パイプライン生成戦略により、モデル全体の受信完了を待たずに分散推論を開始し、BurstGPT 実トレースで P90 TTFT レイテンシ 2.4×–5× 改善・GPU コスト 17.8%–31.3% 削減を達成した。新設 concept [[モデルスケーリング高速化]] は、既存 [[LLMサービング管理]] の PreServe が示す「コールドスタートが遅すぎて反応的スケーリングが機能しない」という観察に対し、「予測で回避」ではなく「機構自体を高速化」という直交する解決軸を提供する。著者 [[Ao Wang]](Alibaba)は評価のベースライン FaaSNet(ATC 2021)自身の筆頭著者でもあり、[[Yue Cheng]] も同論文の共著者であるため、サーバーレスプロビジョニング高速化の系譜(FaaSNet→FaaScale)が世代を跨いで継続している。
- 判断: 共著者11名中、Corresponding author([[Minchen Yu]]・[[Yue Cheng]]・[[Wei Wang]])と、既存ベースライン(FaaSNet)の筆頭著者として被参照価値の高い [[Ao Wang]]、および Nokia Bell Labs 所属の [[Ruichuan Chen]] の5名を entity 化し、残り6名(Rui Yang・Chaobo Jia・Zhaoyuan Su・Sheng Yao・Tingfeng Lan・Yuchen Yang)は他ソースと交差しない一般共著者として source 本文への記載のみに留めた。当初 OpenReview(id=jgL8LuOVyT)が Cloudflare Turnstile でアクセス不可、MLSys 2026 公式サイトからも直リンクを発見できず未統合としたが、ユーザーから直リンク(`https://mlsys.org/media/mlsys-2026/Slides/3769.pdf`)の提供を受け、追加で16ページの発表スライドを取り込み・統合した(全ページ確認済み)。スライド図2枚(2D 実行パイプライン独自可視化、GPU割当推移・累積GPU時間・TTFT CDF統合のend-to-end性能サマリ)を選定・埋め込み、Hugging Faceモデル数の論文(50万超)とスライド(2M超)の数値差を注記した。
## [2026-07-30] ingest-paper | BEAM: Joint Resource–Power Optimization for Energy-Efficient LLM Inference under SLO constraints
- Source: `.raw/papers/81_BEAM_Joint_Resource_Power_O.pdf`(ユーザー提供ローカル PDF、MLSys 2026)、`.raw/slides/beam-mlsys2026/beam-mlsys2026.pdf`(MLSys 2026 会議サイト直リンク `https://mlsys.org/media/mlsys-2026/Slides/3849_mCVfQGX.pdf`、23枚・56ページのビルドアニメーション込み)
- Summary: [[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]]
- Pages created: [[Hyunjae Lee]]、[[Sangjin Choi]]、[[Seungjae Lim]]、[[Youngjin Kwon]]
- Pages updated: [[GPUエネルギー効率]]、[[LLMサービング管理]]、[[index]]、[[hot]]
- Key insight: バッチング(資源効率)と DVFS(電力効率)は、SLO が生むレイテンシスラックという単一の有限予算を奪い合う結合した最適化軸であり、片方を固定して他方を最適化すると局所最適にしか到達できない。BEAM はこれをプリフィル/デコード別のイベント駆動スケジューラ(S1/S2)で解決し、チャンクサイズ・マイクロバッチ数・GPUクロックをミリ秒粒度で共最適化することで、vLLM比最大51%・Window-DVFS比30%のエネルギー削減をSLO遵守率94%台以上を保ちながら達成した。発表スライドは論文本文に無い可視化(バースト応答時の実際の制御ノブ軌跡=クロック・チャンクサイズ・マイクロバッチ数の時系列)を含んでおり、この画像を代表図として統合した。ページ数から埋め込みラスター画像は Figure 1・2・3・5b のみ取得でき、アーキテクチャ図(Figure 4)はベクター描画のため PyMuPDF でキャプション座標をもとにクロップして取得した。
- Contradictions: なし。
## [2026-07-30] ingest-paper | BOute: Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization
- Source: `.raw/papers/46_BOute_Cost_Efficient_LLM_Se.pdf`(ユーザー提供ローカル PDF、MLSys 2026。arXivプレプリント版 2602.10729 も存在)、`.raw/slides/boute-mlsys2026/boute-mlsys2026.pdf`(MLSys 2026 会議サイト直リンク `https://mlsys.org/media/mlsys-2026/Slides/3795.pdf`、17ページ)
- Summary: [[@2026__MLSys__BOute - Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization]]
- Pages created: [[Youhe Jiang]]、[[Fangcheng Fu]]、[[Eiko Yoneki]]、[[Ran Yan]]
- Pages updated: [[LLMサービング管理]]、[[GPUクラスタスケジューリング]]、[[ベイズ最適化]]、[[index]]、[[hot]]
- Key insight: LLM サービングの「モデルルーティング」と「異種GPUデプロイメント」は互いに補完しあう(ワークロード特性分析§3で実証)にもかかわらず、既存研究(RouteLLM等のルーティング研究、ThunderServe/Helix等のデプロイメント研究)はいずれか一方のみを最適化する。BOute はルーティング閾値・GPU割当・並列化戦略を多目的ベイズ最適化(MOBO)で協調最適化し、加法カーネルGP・負荷比率エンコーディング・モデル-GPU選好重み付きカーネル・制約付きqNEHVIという構造的情報を注入することで、既存手法比P95レイテンシ最大157%改善、コスト最大61%削減を達成した。OpenReview(`forum?id=ZVQb92umqX`)はCloudflare Turnstileでcurl/WebFetchともに403となり、arXiv API検索(`au:"Youhe Jiang" AND ti:"Cost-Efficient"`)でプレプリント版2602.10729を発見して書誌を裏取りした。スライドはOpenReviewページの代わりにMLSys 2026会議サイトのtalkページ(`mlsys.org/virtual/2026/oral/3795`)から直リンクを発見し取得。図5枚はいずれもスライド由来(論文埋め込み画像はGPUアイコン等の断片のみでFigureとして使えなかったため、スライドの対応ページを代替使用)。
- Contradictions: なし。
## [2026-07-30] ingest | クラウド系の国際会議IEEE CLOUD 2020参加録
- Source: `.raw/articles/ieeecloud2020-2026-07-30.md`(https://blog.yuuk.io/entry/2020/ieeecloud2020)
- Summary: [[@2020__yuuk.io__IEEE CLOUD 2020 参加録]]
- Pages created: [[Skedulix]]
- Pages updated: [[Yuuki Tsubouchi]]、[[AIOps]]、[[index]]、[[hot]]
- Key insight: IEEE World Congress on SERVICES 2020(IEEE CLOUD 併催、COVID-19 でオンライン開催)の参加報告。マイクロサービス・サーバーレス・エッジ-クラウド連携を対象とした異常検知・RCA 研究トレンドを概観し、ベストペーパー Skedulix(ハイブリッドクラウドスケジューリング)を紹介。研究の理論的洗練と実務のルールベース運用継続とのギャップという指摘を、著者自身が2年後に提唱する [[Interactive AIOps]] の前段の実務観察として [[AIOps]] に接続した。
- Contradictions: なし。
## [2026-07-30] ingest-paper | Beyond the Buzz: A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference (camera-ready + スライド統合更新)
- Source: `.raw/papers/123_Beyond_the_Buzz_A_Pragmati.pdf`(ユーザー提供ローカル PDF、MLSys 2026 Industry Track camera-ready)、`.raw/slides/beyond-the-buzz-mlsys2026/beyond-the-buzz-mlsys2026.pdf`(ユーザー提供の発表スライド PDF、14ページ)。既存の `.raw/papers/arxiv-2506.05508.pdf`(旧題 "A Pragmatic Take on Inference Disaggregation" のプレプリント)はそのまま保持し、sources に併記。
- Summary: [[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]]
- Pages created: [[Hongkuan Zhou]]、[[Yan Ru Pei]]、[[Vishwanath Venkatesan]]、[[Kyle Kranen]]、[[Suresh Nambi]]、[[Itay Neeman]]
- Pages updated: [[Tiyasa Mitra]]、[[Bita Darvish Rouhani]]、[[NVIDIA]]、[[NVIDIA Dynamo]]、[[Prefill-Decode分離]]、[[index]]、[[hot]]、[[entities/_index]]、[[sources/_index]]
- Key insight: 本セッション開始前に arXiv プレプリント版で既に ingest 済みだった source ページ(旧題 "A Pragmatic Take on Inference Disaggregation")を、ユーザー提供の MLSys 2026 camera-ready PDF(公式改題後タイトル "Beyond the Buzz: A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference")と対応する発表スライドに置き換え・統合した。camera-ready 版は著者6名(Hongkuan Zhou・Yan Ru Pei・Vishwanath Venkatesan・Kyle Kranen・Suresh Nambi・Itay Neeman)が追加され計19名となり、本文も Section 4.3(NVIDIA Dynamo SLA-Aware Planner の3フェーズ設計—Sweep/Profile/Runtime—と、DeepSeek-R1-Distill-Llama-8B を H200 GPU にデプロイした本番相当ベンチマークで非効率固定比率比8倍・最良静的構成比2倍の goodput 改善)と Section 5.4(KV cache routing、8x L40S GPU 上で cache-aware な Dynamo KV Router が round-robin に対し FTL 安定性で優位という実験)が新規追加されていた。シミュレーションのみだった従来版に対し、camera-ready 版は本番運用に近い実機ベンチマークで知見を裏付ける構成に強化されている。発表スライドは論文図の再掲に加え、SLA 概念とタイムライン比較図(p.3)、Dynamo Planner の goodput 棒グラフ(p.10、論文 Figure 12 に対応)、KV ルーティングの FTL 安定性折れ線グラフ(p.13、論文 Figure 15 に対応)を独自に含み、論文由来の図5枚とスライド由来の図3枚、計8枚を新設の attachment フォルダ `_attachments/beyond-the-buzz-mlsys2026/` に統合埋め込みした。旧ページとその attachment フォルダ(`_attachments/arxiv-2506.05508/`)は削除し、全リンク箇所(entity・concept ページの本文・frontmatter・index・hot)を新タイトルへ一括更新した。
- Contradictions: なし(同一論文の改題・拡充であり、内容の矛盾ではない)。
## [2026-07-30] ingest-paper | Cost-aware Duration Prediction for Software Upgrades in Datacenters
- Source: `.raw/papers/21_Cost_aware_Duration_Predict.pdf`(ユーザー提供ローカル PDF、MLSys 2026 Industry Track。arXiv 版なし)、`.raw/slides/cost-aware-duration-prediction-mlsys2026/cost-aware-duration-prediction-mlsys2026.pdf`(ユーザー提供の発表スライド PDF)
- Summary: [[@2026__MLSys2026__Cost-aware Duration Prediction for Software Upgrades in Datacenters]]
- Pages created: [[Yi Ding]]、[[Henry Hoffmann]]、[[LightGBM]]、[[ソフトウェアアップグレードスケジューリング]]
- Pages updated: [[Meta]]、[[Purdue University]]、[[ライブアップグレード]]、[[サービスレベル目標]]、[[index]]、[[hot]]
- Key insight: Purdue University の Yi Ding・University of Chicago の Henry Hoffmann が Meta Infra Data Center チームと共同で、データセンター規模のソフトウェアアップグレードスケジューリングを制約付き最適化問題として初めて定式化し、コストアウェア期間予測フレームワーク Acela を提案・本番デプロイした。分位点損失(τ>0.5)による QGBT(LightGBM)、OPR/SLO ベースのカスタムスコア関数によるモデル選択、ストラグラー除去による訓練セット多様化の3技術で「予測精度でなくスケジューリング目的」を直接最適化する設計思想が一貫している。Meta 本番環境で Heuristic に対しアップグレード窓利用率1.25倍・キャンセル率2.4倍低減を達成し、SLO(キャンセル率5%未満)をAcelaのみが満たす。既存 concept [[ライブアップグレード]](サービス無停止での差し替え技術)とは「アップグレード窓を前提とするか否か」で対照的なアプローチであることを横断的知見として明示し、新設 concept [[ソフトウェアアップグレードスケジューリング]] で区別した。図表は論文から5枚(PyMuPDFキャプション座標クロップ+pdf.js埋め込み画像抽出)、発表スライドから4枚(SJobs/SUs比較・UGローテーション・設計原則まとめ・本番結果サマリ)を選定・埋め込み。
- Contradictions: なし。
## [2026-07-30] ingest-paper | Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
- Source: `.raw/papers/34_Kitty_Accurate_and_Efficien.pdf`(ユーザー提供ローカル PDF、MLSys 2026 採録。arXiv 版なし)
- Summary: [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]]
- Pages created: [[Haojun Xia]]、[[Shuaiwen Leon Song]]、[[University of Sydney]]、[[KVキャッシュ量子化]]
- Pages updated: [[Zhen Zheng]]、[[Together AI]]、[[Microsoft]]、[[University of Illinois Urbana-Champaign]]、[[KVキャッシュ管理]]、[[モデル圧縮]]、[[index]]、[[hot]]
- Key insight: 2-bit KV キャッシュ量子化は KIVI 等の均一量子化では長文脈推論タスクで大きく精度が劣化する(Qwen3-8B の MATH-Algebra で 4-bit→2-bit で -40.97)。Kitty は Key キャッシュのチャネルに恒常的な量子化感度の偏りがあるという観察に基づき、少数の重要チャネル(12.5〜25%)だけを INT4 に保つ Dynamic Channel-wise Precision Boost で精度劣化をほぼゼロまで回復する。既存の [[KVキャッシュ管理]] 横断的知見が扱ってきた「どこに配置・退避・複製するか」という軸に対し、「保持するデータそのものを量子化で軽くする」という直交した軸を新設 concept [[KVキャッシュ量子化]] として追加した。共著者 [[Zhen Zheng]](Microsoft)は BatchLLM(スケジューリング側)に続き Kitty(量子化側)でも KV キャッシュ効率化に貢献しており、同一研究者の異なる切り口としてエンティティページに追記した。図5枚(Figure 1〜5、アーキテクチャ・チャネル感度・メモリレイアウト・アブレーション・スループット比較)は PyMuPDF によるキャプション座標クロップで取得(pdf.js の埋め込み画像抽出はベクター図には適用できなかったため)。
- Contradictions: なし。
## [2026-07-30] ingest-paper | BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching
- Source: `.raw/papers/arxiv-2412.03594v3.pdf`(arXiv:2412.03594、2024-11-29投稿、v3 2026-04-22改訂。MLSys 2026 Industry Track 採録)、`.raw/slides/batchllm-mlsys2026/batchllm-mlsys2026.pdf`(MLSys 2026 発表スライド、`https://mlsys.org/media/mlsys-2026/Slides/3833.pdf`)
- Summary: [[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]]
- Pages created: [[Zhen Zheng]]
- Pages updated: [[Microsoft]]、[[Institute of Software, Chinese Academy of Sciences]]、[[KVキャッシュ管理]]、[[LLM推論]]、[[index]]、[[hot]]
- Key insight: ユーザー指定はローカル PDF(`107_BatchLLM_Optimizing_Large_.pdf`)だったが、書誌情報とスライド埋め込みを充実させるため arXiv 版(2412.03594v3)を発見し原本を差し替えて取り込んだ。BatchLLM は、大規模バッチ・オフライン LLM 推論(検索エンジンのスニペット生成等)ではバッチ全体が事前に既知であるという前提を利用し、既存の LRU ベース暗黙的 prefix キャッシュに代えて、compact prefix tree 上の DP アルゴリズム(Algorithm 1)で共通プレフィックスを大域的に事前拡大し、prefix-sharing グループ単位でスケジューリングする。これにより KV キャッシュ管理の設計原理が「オンラインでは履歴からの推測(LRU)」「オフラインでは事前の大域最適化(DP)」の 2 レジームに分岐するという知見を [[KVキャッシュ管理]] と [[LLM推論]] の両概念ページに追加した。共有プレフィックス長 16000・share-degree 16 の条件では token 再利用率 92.6%(vLLM/SGLang は 6.3%/5.2%)を達成し、vLLM・SGLang 比 1.3〜10.8 倍のスループット向上を報告。論文の図(Figure 1・2・4・6)はスライドの対応ページ(発表者による同一図の再掲)から取得し埋め込んだ。
- Contradictions: なし。
## [2026-07-30] ingest-paper | Beyond the Buzz: A Pragmatic Take on Inference Disaggregation
- Source: `.raw/papers/arxiv-2506.05508.pdf`(arXiv, 2025-06-05投稿。MLSys 2026 Industry Track Oral、session 3819 としても発表)
- Summary: [[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Take on Inference Disaggregation]]
- Pages created: [[Tiyasa Mitra]]、[[Bita Darvish Rouhani]]
- Pages updated: [[NVIDIA]]、[[NVIDIA Dynamo]]、[[Prefill-Decode分離]]、[[index]]、[[hot]]
- Key insight: 当初の依頼 URL(`https://mlsys.org/virtual/2026/oral/3819`)はログイン必須の会議トークページで、OpenReview の PDF は Cloudflare Turnstile によりダウンロード不可だった。WebSearch でタイトルから arXiv 版(2506.05508)を発見し、それを一次出典として PDF 原本を取得した。NVIDIA 18名の著者チームが、社内 proprietary な高精度 GPU シミュレータでモデルアーキテクチャ・サイズ・トラフィックパターン・NVLink ドメインサイズの4軸にわたり数十万の disaggregated serving 設計点を評価し、disaggregation の有効性が prefill-heavy トラフィックと大規模モデルで最大化される条件付き優位性を定量化した。DeepSeek-R1 の MLA が piggybacked co-location で追加の prefill chunking オーバーヘッドを負うという attention 機構依存の知見、レートマッチングの整数計画的アルゴリズム(Algorithm 1・2)を [[Prefill-Decode分離]] concept に統合した。
## [2026-07-30] query | KVキャッシュ管理の教科書
- Question: KVCache の管理について教科書を作成せよ。
- Mode: deep(retrieve.py + 4 並列サブエージェントで 30+ source ページと 14 concept ページを精読)
- Pages created: [[wiki/questions/KVキャッシュ管理の教科書]](address `c-001596`、13 部 35 章 + 付録 4 節)
- Pages updated: [[index]]
- Key insight: KV キャッシュ管理を「1 GPU のメモリ断片化」から「クラスタ横断のデータ移動・障害時の状態復旧・電力制約下の広域配置」へ拡大する縦軸で構成した。横断的に効いた論点は 3 つ。(1) GPU 内 page と外部転送 chunk の**二重粒度**が 3 ソースで独立に現れる最も再現性の高い知見であること、(2) KV キャッシュ配置の均等化が効くのは**デコード段に限られる**(FailSafe Figure 11)というプリフィル計算バウンド/デコードメモリバウンドの直接の帰結、(3) KV キャッシュが**性能最適化の対象・障害で失われる状態・制御ループへの入力信号**という 3 つの役割を同時に持ち、役割ごとに要求機構が異なること。オフロードが容量問題を入出力問題へ変換する(Chakra: Memcpy DtoH 387 回/0.895ms → 5,958 回/216.484ms)構図と、Rubin の HBM4 288GB が「オフロード不要」を目標に掲げる構図が対を成す点も明示した。
- Contradictions: 4 件を callout として本文に明示。(1) **CacheBlend の精度劣化**を 3 ソースが 3 通りに報告(原論文 F1 損失 0.01〜0.03 / ContextPilot 9〜11% 劣化・最悪 34.8→11.3 / SCBench はマルチターンで劣化なしマルチリクエストで劣化)。診断も KVShare はヒット率(システム側)、ContextPilot は原理側に帰属させ食い違う。(2) **KV 転送コストは無視できるか**(DistServe 0.1% 未満 vs P/D-Serve が削減を主要貢献に)。配置の違いに起因すると裁定。(3) **ベンチマーク前提と本番実測のずれ**(SCBench のマルチターン中心設計 vs 本番 to-B で再利用の 97% がシングルターン)。(4) **TTFT が伸びる原因**(KV サイズ増大説 vs プリフィル計算量説)。後者を主因とし前者は注記付き扱いとした。
- Caveats: 付録 D に数値引用時の注意 12 件を集約。特に「メモリ効率 96%」が PagedAttention 原典になく二次資料由来であること、[[KVキャッシュ管理]] が AIBrix について記す「4.7 倍のコスト削減」「Kubernetes CRD」が wiki のソースページから裏づけられないこと(ソースは約 10% コスト削減)を明記し、本文では採用しなかった。concept ページ側の当該記述は今後の要確認事項として残す。
## [2026-07-29] ingest-paper | PatternSketch: General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection
- Source: `.raw/papers/2026_Unknown_PatternSketch_General_Runtime_Reconfigurable_Time.pdf`(EuroSys '26、Soochow University × Nanjing University of Posts and Telecommunications、2026-04-27)
- Summary: [[@2026__EuroSys__PatternSketch - General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection]]
- Pages created: [[Yang Du]]、[[Dan Wang]]、[[He Huang]]、[[Hanwen Zhang]]、[[Jianzhi Tang]]、[[Fu Xiao]]、[[Yu-E Sun]]、[[Nanjing University of Posts and Telecommunications]]、[[時系列トラフィックパターン検知]]
- Pages updated: [[Soochow University]]、[[Intel Tofino]]
- Key insight: プログラマブルスイッチ上で複数の時系列トラフィックパターンを単一スケッチで同時検知し、実行時に(スイッチをオフラインにせず)監視対象パターンを再構成できる PatternSketch を取り込んだ。多様なパターン定義を「隣接2期間間の変化」を表す5種のマイクロパターンの系列として統一抽象化し、有限状態オートマトン(Pattern Automaton)による系列マッチング問題へ帰着させる点が核心で、検知ルールを3テーブルへ分離しP4 Runtime経由で実行時更新することで既存研究が要した4〜8秒のスイッチダウンタイムを回避する。Intel Tofino実機で6パターン同時検知時に200KBメモリでF1スコア90%超を達成し、単一パターン特化型のBurstSketch・Pontus・ScoutSketchを上回る精度を報告。図5枚(代表パターン・アーキテクチャ・Micro-pattern Collection・新規パターン・ハードウェア資源消費)とTable1(状態遷移表)をPyMuPDFでクロップ・埋め込み。
- Contradictions: なし。
## [2026-07-29] ingest-paper | Handling Network Faults in Distributed AI Training: Failover is Now an Option
- Source: `.raw/papers/2026_Unknown_Handling_Network_Faults_Distributed_AI.pdf`(EuroSys '26、ByteDance × National University of Singapore、2026-04-27)
- Summary: [[@2026__EuroSys__Handling Network Faults in Distributed AI Training]]
- Pages created: [[Xin Zhe Khooi]]
- Pages updated: [[Zhuo Jiang]]、[[集合通信]]、[[耐障害LLM訓練]]、[[リスタート保護]]、[[Rail-Optimizedトポロジ]]
- Key insight: last-hop(スイッチ〜ホスト間)ネットワーク障害を、fail-stop+restart ではなくフェイルオーバーで扱う初の耐障害 CCL「ReCCL」を取り込んだ。single-port RNIC 前提のソフトウェア冗長化(s-Bond)・straggler channel 無効化(DCR)・NVLink 経由のホスト内ボトルネック回避(NVL)を組み合わせ、NCCL の drop-in replacement として動作する。核心は「フェイルオーバー vs restart」をチェックポイント間隔・検知時間・スローダウン率から導出される閾値式で定量判定できる点で、[[耐障害LLM訓練]] concept に集まる「チェックポイント+再起動」中心の既存系統に対し、CCL 層での透過的フェイルオーバーという定量分析付きの選択肢を追加した。Llama3-405B・16k GPU シミュレーションで restart 比64.96%の GPU 時間削減、32 GPU テストベッド実測でフェイルオーバー時スローダウン k<1.1 を確認。図6枚(CCL アーキテクチャ・primary/backup RNIC 対応・フェイルオーバーシーケンス・DCR・GPU時間節約・モデル別スローダウン)をPyMuPDFでクロップして埋め込み。
## [2026-07-28] ingest | LLMの「脳内」をハッキングする技術
- Source: `.raw/articles/joisino-hack-2026-07-21.md`([[佐藤竜馬]] joisino ブログ「ジョイジョイジョイ」、2026-07-21)
- Summary: [[joisino-LLMの脳内をハッキングする技術-2026]]
- Pages created: [[操舵ベクトル]]、[[知識編集]]
- Pages updated: [[活性化パッチング]]、[[ロジットレンズ]]、[[機構的解釈性]]、[[佐藤竜馬]]
- Key insight: LLM 内部への介入手法を2粒度で整理した記事。①操舵ベクトル(2群の内部状態の平均差方向へ加算): `llm-jp/llm-jp-4-8b-instruct` の丁寧語↔関西弁トーンを文脈保持のまま切り替える実験、日本語1軸から求めたベクトルの英語への汎化、Arditi et al.(NeurIPS 2024)の命令拒否方向操作との同型性、`google/gemma-7b-it` のバスボム実験(モデルが持たない知識までは操舵ベクトルで捏造できないという上限)を示した。②知識編集(MLPの回転軸の部分書き換え): ロジットレンズで「ルーブル美術館→パリ」の知識書き込み層(第28層付近)を特定し、出力丸ごと置換(副作用あり)と1回転軸だけの書き換え(無関係な質問には影響せず、言い換えにも汎化)を対比した。既存 [[活性化パッチング]] concept と同一の Arditi 論文への独立参照が確認でき、[[ロジットレンズ]] には知識編集対象層の特定という第3の応用例を追記した。
- Contradictions: なし。
## [2026-07-28] ingest | Kimi-K3 を Day0 デプロイ。2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか
- Source: `.raw/articles/kimi-k3-day0-deploy-fixstars-2026-07-28.md`(Fixstars Tech Blog / Zenn、2026-07-28)
- Summary: [[@2026__Fixstars Tech Blog__Kimi-K3 を Day0 デプロイ - 2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか]]
- Pages created: [[Fixstars]]、[[Decode Context Parallelism]]
- Pages updated: [[Kimi K3]]、[[SGLang]]、[[NVIDIA]]、[[Speculative Decoding]]
- Key insight: [[Kimi K3]](2.78T MoE)公開当日の Day0 デプロイという実運用側の速報。[[NVIDIA]] B300 SXM6 x8 単一ノードに [[SGLang]] で配備し、[[Decode Context Parallelism]](DCP、SGLang 対応・vLLM 未対応)によりMLA KVキャッシュを8GPUに分散、実効コンテキスト527,872トークンを確保した。Random ワークロードで並列数40時にピーク5,847.6 tok/s、並列50で失敗率急増というスケーリング限界を実測し、実用上限は同時30リクエスト程度と報告。`--mamba-full-memory-ratio` の配分ミスという運用上の反省点、公開draftモデル(DSPARK)による [[Speculative Decoding]] の実運用適用例など、技術レポート([[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]])には出てこないデプロイ現場の知見を補完する。zenn.dev はサンドボックス許可リスト外のため WebFetch 構造化要約に基づく(逐語引用ではない)。
## [2026-07-28] ingest-paper | Kimi K3: Open Frontier Intelligence(技術レポートで全面改訂)
- Source: `.raw/papers/k3_tech_report.pdf`(Moonshot AI 技術レポート、2026-07-27 公開、47ページ)
- Summary: [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]]
- Pages created: [[MoonEP]]
- Pages updated: [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]](2026-07-20 ブログ暫定版から全面書き直し)、[[Kimi K3]]、[[Kimi Delta Attention]]、[[Attention Residuals]]、[[Stable LatentMoE]]、[[Moonshot AI]]、[[Mixture-of-Experts]]
- Key insight: 2026-07-20 時点ではブログ記事のみを出典とする暫定版だった source ページを、技術レポート本体で全面的に裏取り・書き直した。最大の成果は3つ: (1) [[Stable LatentMoE]] が NVIDIA Nemotron 3 の [[LatentMoE]] と独立設計か同一かという未解決の問いが、技術レポートが同じ原著論文(Elango et al., arXiv:2601.18089)を明示的に引用することで解消し、Kimi K3 は LatentMoE を継承した上で RMSNorm・SiTU-GLU・Quantile Balancing の3要素で安定化していることが判明した。(2) ブログ記事の「512-head MLA」という記述が実は「MLA のヘッド次元が512」の誤読であり、K3全体のアテンションヘッド数は96であることを訂正した。(3) Quantile Balancing の具体的アルゴリズム(ルータスコアのバッチ分位数マッチング)が判明し、DeepSeek-V3のバイアス動的調整・MiniMax-M2のシグモイドゲーティングに続く MoE 負荷分散手法の第5の系譜として [[Mixture-of-Experts]] concept に位置づけた。訓練インフラの新規エンティティとして [[MoonEP]](完全均衡型 Expert Parallelism、冗長エキスパート上限 E/R のタイト性を証明)を追加。図表5枚(アーキテクチャ・Quantile Balancing・タスク合成・KDAプレフィックスキャッシュ・コスト効率)をPyMuPDFでクロップして埋め込み。
## [2026-07-28] ingest-paper | An Evolutionary Study of Configuration Design and Implementation in Cloud Systems
- Source: `.raw/papers/ZhangETALConfigEvolutionStudyICSE21.pdf`(ICSE'21 preprint; arXiv:2102.07052v2, 2021-02-23)
- Summary: [[@2021__ICSE__An Evolutionary Study of Configuration Design and Implementation in Cloud Systems]]
- Pages created: [[@2021__ICSE__An Evolutionary Study of Configuration Design and Implementation in Cloud Systems]], [[Yuanliang Zhang]], [[Haochen He]], [[Owolabi Legunsen]], [[Shanshan Li]], [[Wei Dong]]
- Pages updated: [[Tianyin Xu]], [[National University of Defense Technology]], [[University of Illinois Urbana-Champaign]], [[Cornell University]], [[設定ミス脆弱性]]
- Key insight: HDFS・HBase・Spark・Cassandra 4 システムの 1178 件の設定関連コミットを分析し、設定インターフェース/使用/文書の進化を実証した。核心は「設定の頑健化は事後対応(reactive)が支配的」というパターンで、パラメーター化の54.4%・チェックコード追加の74.6%が障害等の帰結を経験した後に行われていた。SPEX(SOSP'13)が静的解析で検出した設定ミス脆弱性(サイレント障害80%)の背後にある開発プロセスを時間軸から裏付ける関係にあり、[[設定ミス脆弱性]] concept に統合した。
## [2026-07-27] ingest-paper | TSPulse: Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis
- Source: `.raw/papers/arxiv-2505.13033.pdf`(arXiv:2505.13033、ICLR 2026 採択論文)
- Summary: [[@2026__ICLR__TSPulse - Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis]]
- Pages created: [[@2026__ICLR__TSPulse - Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis]]
- Pages updated: [[TSPulse]], [[IBM Research]], [[時系列基盤モデル]]
- Key insight: 時間・周波数の両空間でのマスク再構成を時間的・スペクトル的・意味的の3ビューへ明示的にdisentangleする1Mパラメータの超軽量時系列基盤モデル群TSPulseの原論文を取り込んだ。既存の「decoder-only 対 encoder-only」というTSFMアーキテクチャの分岐に、「disentangled multi-view埋め込み」という直交する第4の軸を加えるとともに、予測タスクでのスケーリング則確立(Toto 2.0)とは逆に診断タスクでは超小型モデルが規模を凌駕するという対照的パターンを示した。また同じTSPulseがTSB-ADリーダーボードではSOTA、ソフトウェア運用ドメイン(ICPE論文)では非最良という結果の違いを、評価スコープの違いとして横断的知見に整理した。
## [2026-07-27] ingest-paper | Understanding Performance of eBPF Maps
- Source: `.raw/papers/2026_Unknown_Understanding_Performance_eBPF_Maps.pdf`(ローカルPDF、ACM SIGCOMM併設 Workshop on eBPF and Kernel Extensions (eBPF '24)、DOI: 10.1145/3672197.3673430)
- Summary: [[@2024__eBPF'24__Understanding Performance of eBPF Maps]]
- Pages created: [[@2024__eBPF'24__Understanding Performance of eBPF Maps]], [[Chang Liu]], [[Byungchul Tak]], [[Long Wang]], [[Kyungpook National University]], [[eBPFマップ]]
- Pages updated: [[eBPF]], [[Linuxカーネルインタフェース]], [[Tsinghua University]], [[Zhongguancun Laboratory]]
- Key insight: Linuxネイティブの`bpf()`システムコールでは測れないキャッシュホット性・並行実行の影響を測定できる専用ベンチマークシステム(`bpf_bench()`)を構築し、array・hash・per-cpu変種・ring/perf buffer・queue/stackの全16設定を網羅ベンチマーク。メモリフットプリントとキャッシュホット性がeBPFマップのオーバーヘッドの2大要因であること、per-cpu hashマップの新規キー挿入時ゼロ初期化による増幅、eBPFプログラムの「volume discount」特性(複数フックへのアタッチで償却実行時間コストが下がる)を発見した。
## [2026-07-27] ingest-paper | Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems
- Source: `.raw/papers/2026_Unknown_Leveraging_Time_Series_Foundation_Models.pdf`(ローカルPDF、ICPE Companion '26、DOI: 10.1145/3777911.3800632)
- Summary: [[@2026__ICPE Companion__Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems]]
- Pages created: [[@2026__ICPE Companion__Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems]], [[Federico Di Menna]], [[Luca Traini]], [[Vittorio Cortellessa]], [[University of L'Aquila]], [[TSPulse]]
- Pages updated: [[時系列基盤モデル]], [[異常検知]], [[時系列異常検知ベンチマーク]]
- Key insight: University of L'Aquila の Di Menna・Traini・Cortellessa による、時系列基盤モデル(Chronos・TSPulse)のゼロショットソフトウェア性能異常検知評価。AIOPS・MSCloudの2データセットで4つの代表的TSADベースライン(AR・Isolation Forest・LSTM-AD・VAE)と比較し、基盤モデルはベースラインに匹敵する性能(MSCloudでChronosがAUC-PR 2位)を達成するが、いずれのデータセットでも最良にはならなかった。推論レイテンシはベースラインの10倍超だが、訓練込みの総所要時間ではLSTM-ADなど一部ベースラインを下回る場合がある。
## [2026-07-27] ingest-paper | Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems
- Source: `.raw/papers/arxiv-2606.11815.pdf`(arXiv:2606.11815、https://arxiv.org/abs/2606.11815)
- Summary: [[@2026__arXiv__Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems]]
- Pages created: [[@2026__arXiv__Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems]], [[Hao-Nan Zhu]], [[Goodness Ayinmode]], [[Cesar A. Stuardo]], [[Haryadi S. Gunawi]], [[Cindy Rubio-González]], [[University of California, Davis]], [[ScaleLens]], [[スケーラビリティ障害]]
- Pages updated: [[潜在的障害]], [[分散システム障害]]
- Key insight: University of California, Davis と University of Chicago の共著による arXiv プレプリント。10の大規模分散システムから444件のスケーラビリティ障害を分析し、反復回数がスケール次元と相関する「次元コード断片(DCF)」がアンチパターンと組み合わさって障害化するという枠組みを提示。動的解析(ScaleView)+静的解析(ScalePick)を組み合わせたツール ScaleLens は55件の既知障害のうち36件を完全検出(ベースライン比4.2倍)、Cassandra/HDFS/Ignite最新版でアンチパターン付きDCFを334件検出した。
## [2026-07-27] ingest | Beyond Correlation: Finding Root-Causes using a network digital twin graph and agentic AI
- Source: `.raw/articles/beyond-correlation-finding-root-causes-using-a-network-digital-twin-graph-and-agentic-ai-2026-07-27.md`(https://aws.amazon.com/jp/blogs/database/beyond-correlation-finding-root-causes-using-a-network-digital-twin-graph-and-agentic-ai/、AWS Database Blog、2025-08-18)
- Summary: [[@2025__AWS Database Blog__Beyond Correlation - Finding Root-Causes using a network digital twin graph and agentic AI]]
- Pages created: [[@2025__AWS Database Blog__Beyond Correlation - Finding Root-Causes using a network digital twin graph and agentic AI]], [[NTT DOCOMO]], [[Amazon Neptune]], [[Strands Agents]]
- Pages updated: [[根本原因分析]], [[グラフベースRCA]], [[LLMによる根本原因分析]], [[グラフニューラルネットワーク]]
- Key insight: Amazon Neptune 上のグラフによるネットワークデジタルツインと、Strands Agents + Amazon Bedrock AgentCore の 13 専門エージェント(RCA operator・Root-cause finder・Anomaly correlator・Forecast-drift monitor・OpsMemory 共有ブラックボード等)を組み合わせた RCA アーキテクチャ。Neptune Analytics のグラフ分解(WCC/SCC)→クラスタリング→中心性計算という古典グラフアルゴリズムのカスケードを中核に据え、既知パターン照合・KPI 異常相関・AST-GNN 予測ドリフト検出を前後に配置する 4 種のランブックを設計。[[NTT DOCOMO]] の商用モバイルネットワーク(加入者 8900 万超)実装で 15 秒 MTTD を達成。同日 ingest 済みの [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]](Chraim+, AWS)と同じくネットワークドメインのグラフ RCA だが、経路尤度最大化とは異なる「古典グラフアルゴリズムのカスケード + エージェントによる前後処理」という別設計であることを [[グラフベースRCA]] に追記した。
## [2026-07-27] ingest-paper | Gemini: Fast Failure Recovery in Distributed Training with In-Memory Checkpoints
- Source: `.raw/papers/SOSP23.pdf`(https://www.cs.rice.edu/~eugeneng/papers/SOSP23.pdf、SOSP '23、DOI: 10.1145/3600006.3613145)
- Summary: [[@2023__SOSP__Gemini - Fast Failure Recovery in Distributed Training with In-Memory Checkpoints]]
- Pages created: [[@2023__SOSP__Gemini - Fast Failure Recovery in Distributed Training with In-Memory Checkpoints]], [[Zhuang Wang]], [[T. S. Eugene Ng]], [[Rice University]]
- Pages updated: [[Amazon Web Services]], [[DeepSpeed]], [[チェックポイント]], [[耐障害LLM訓練]]
- Key insight: Rice University・Amazon Web Services による SOSP '23 論文。GPU マシンの CPU メモリへ毎イテレーションチェックポイントし、証明可能に準最適な配置戦略(mixed placement strategy)と、ネットワーク遊休時間帯へのトラフィックパイプライニングにより、既存手法比 13 倍超の障害復旧高速化を達成。[[チェックポイント]]・[[耐障害LLM訓練]] の横断的知見に、2025 年の FFTrainer が再定式化した「遊休ネットワーク帯域を保存経路に転用する」という設計系統の 2023 年時点での起点として位置づけた。同年の TRANSOM(RDMA ピア間バックアップ)と並ぶ、2023 年時点の高速チェックポイント系統のもう一つの実例。
## [2026-07-27] ingest-paper | Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks
- Source: `.raw/papers/arxiv-2606.13532.pdf`(arXiv:2606.13532、https://arxiv.org/abs/2606.13532、IEEE ICC 2026 採録プレプリント)
- Summary: [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]]
- Pages created: [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]], [[Fabien Chraim]], [[Dominik Janzing]], [[John Evans]]
- Pages updated: [[Amazon Web Services]], [[因果発見]], [[グラフベースRCA]], [[因果推論ベースRCA]], [[遅延認識時空間因果推論]]
- Key insight: Amazon Web Services(Chraim・Janzing・Evans)によるクラウドネットワーク RCA 論文。二値時系列への二変量 Granger 因果性 + 条件付き独立性トリプレット検定によるグラフベース因果発見と、エッジ固有の時間ラグ条件付き確率(経路尤度最大化)による確率的推論を組み合わせる。自動化オントロジー + スパティオテンポラルグループ化で4,810変数を76,595変数ペアまで削減。35件評価で Recall@3=85.7%・完全一致74.3%、本番7ヶ月で800件超投入。
## [2026-07-27] ingest-paper | NetCause: Counterfactual Learning for Root Cause Analysis in Large-Scale Networks
- Source: `.raw/papers/arxiv-2606.13543.pdf`(arXiv:2606.13543、https://arxiv.org/abs/2606.13543、IEEE ICCCN 2026 採録プレプリント)
- Summary: [[@2026__arXiv__NetCause - Counterfactual Learning for Root Cause Analysis in Large-Scale Networks]]
- Pages created: [[@2026__arXiv__NetCause - Counterfactual Learning for Root Cause Analysis in Large-Scale Networks]], [[Jian Zhang]], [[Xiang Song]], [[Christos Faloutsos]]
- Pages updated: [[Fabien Chraim]], [[Dominik Janzing]], [[John Evans]], [[Amazon Web Services]], [[因果推論ベースRCA]], [[介入的因果学習]], [[NetOps]], [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]]
- Key insight: Amazon Web Services の Fabien Chraim・Jian Zhang(共同筆頭)ほかによる、R-GCN+RNN の生成的時空間ワールドモデルと反実仮想シミュレーション(Total Causal Influence)によるネットワークRCA。31件評価で完全一致精度35.5%(ルールベース比+16.1pt)。同著者チームが同日投稿した姉妹論文 Graphical Causal Reasoning(Granger因果性ベース、35件評価・完全一致74.3%)と、「統計的因果発見」対「学習ベース反実仮想シミュレーション」という因果推論ベースRCAの二大設計軸を直接対比させる貴重な事例対であることが判明した。
## [2026-07-27] ingest-paper | TRANSOM: An Efficient Fault-Tolerant System for Training LLMs
- Source: `.raw/papers/arxiv-2310.10046.pdf`(arXiv:2310.10046v3、https://arxiv.org/abs/2310.10046)
- Summary: [[@2023__arXiv__TRANSOM - An Efficient Fault-Tolerant System for Training LLMs]]
- Pages created: [[@2023__arXiv__TRANSOM - An Efficient Fault-Tolerant System for Training LLMs]], [[Shigang Li]], [[Yongqiang Guo]]
- Pages updated: [[SenseTime Research]], [[Huazhong University of Science and Technology]], [[Beijing University of Posts and Telecommunications]], [[耐障害LLM訓練]], [[異常検知]]
- Key insight: SenseTime・Huazhong University of Science and Technology・Beijing University of Posts and Telecommunications による2023年arXivプレプリント。プロセスレベル自動フォールトトレランス(TOL)・ハイブリッド異常検知(TEE、LOF+KNN Matrix Profile+DTW)・非同期RDMAチェックポイントエンジン(TCE)の三本柱で、GPT3-175B・512 A800 GPUの訓練期間を28%短縮、チェックポイント読み書きを最大27倍高速化。ByteRobust・MegaScaleに2年先立つ同種設計の先行例。
## [2026-07-27] ingest-paper (図表再取り込み) | From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs
- Source: `.raw/papers/arxiv-2605.09370.pdf`(arXiv:2605.09370v5、https://arxiv.org/abs/2605.09370)
- Summary: [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]]
- Pages updated: [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]]
- Key insight: 添付フォルダに残っていた `fig-page00X-0Y.png`(Table 1〜3 のページ丸ごとスクリーンショットで既存の table1〜3-taxonomy.png と内容重複、ページヘッダー混入)5 枚を削除。代わりに PyMuPDF のキャプション座標クロップで、これまで未収録だった実質的な Figure 4 枚(Figure 1: NUMA-aware 資源配置、Figure 9: NFS/RPC キュー時間比較、Figure 16: 自動リトライ vs 手動復旧のダウンタイム分布、Figure 17: Backend.AI ストレージアーキテクチャ)を新たにクロップして本文に埋め込んだ。これで source ページは Table 1〜5 に加え主要な Figure 4 点を備え、検知(前兆分析)・ストレージ I/O・ノード除外・自動復旧という 4 分析軸それぞれに対応する図表が揃った。
## [2026-07-27] ingest-paper (force re-ingest) | From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs
- Source: `.raw/papers/arxiv-2605.09370.pdf`(arXiv:2605.09370v5、最新版 2026-06-15、https://arxiv.org/abs/2605.09370)
- Summary: [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]]
- Pages updated: [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]], [[NVIDIA]], `.raw/.manifest.json`
- Key insight: 既存 source ページは v4(2026-06-09)を基に作成済みだったが、ユーザー指示により v5(2026-06-15)で強制再取り込みを実施。差分は本文の実質的内容ではなく、クラスタのハードウェア表記を「NVIDIA DGX B200」から「NVIDIA HGX B200」へ訂正した点のみ(用語集の DGX 項目も HGX 項目に置き換え)。該当箇所を source ページと entity ページ [[NVIDIA]] の両方で修正した。
## [2026-07-27] ingest-paper | Robust Multimodal Failure Detection for Microservice Systems
- Source: `.raw/papers/2026_Unknown_Robust_Multimodal_Failure_Detection_Microservice.pdf`(KDD '23、DOI https://doi.org/10.1145/3580305.3599902)
- Summary: [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]]
- Pages created: [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]], [[Zhenyu Zhong]], [[Zhiyuan Tan]], [[LuLu Yu]], [[Jiayi Feng]], [[Yuzhi Zhang]], [[AnoFusion]]
- Pages updated: [[Chenyu Zhao]], [[Minghua Ma]], [[Shenglin Zhang]], [[Dan Pei]], [[Qingwei Lin]], [[Dongmei Zhang]], [[Xiao Xiong]], [[Yongqian Sun]], [[Nankai University]], [[Microsoft]], [[Tsinghua University]], [[マルチモーダル障害診断]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: metric/log/trace を異種グラフに統合し GTN(Graph Transformer Network)でメタパス相関を学習、GAT(Graph Attention Network)で動的重み付け、GRU で次時刻予測を行う教師なしインスタンス障害検知手法 AnoFusion(KDD '23)。GAIA データセットで F1=0.857、商業銀行データセットで F1=0.922 を達成し、2 モダリティ手法 SCWarn を最大 41.00% 上回った。既存 concept [[マルチモーダル障害診断]] に集約されていた TVDiag・UniDiag 等の「障害診断(RCL/FTI)」研究群に対し、AnoFusion は「障害検知(binary)」に特化する前段研究であり、GNN ベースのマルチモーダル融合という設計路線が 2023 年まで遡ることが判明した。著者陣(Chenyu Zhao・Shenglin Zhang・Dan Pei ら Nankai University/Microsoft/Tsinghua University グループ)は既存 entity で AgentTether・PROBE・RefinedEdge 等の共著者として既知であり、本論文がその系譜の最初期の業績にあたることが分かった。
## [2026-07-27] ingest-paper | DynaPipe: Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism
- Source: `.raw/papers/c80873f613504606542457ad715ac3c3-Paper-Conference.pdf`(https://proceedings.neurips.cc/paper_files/paper/2025/file/c80873f613504606542457ad715ac3c3-Paper-Conference.pdf、39th NeurIPS 2025)
- Summary: [[@2025__NeurIPS__DynaPipe - Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism]]
- Pages created: [[@2025__NeurIPS__DynaPipe - Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism]], [[Hongxin Xu]], [[Tianyu Guo]], [[Xianwei Zhang]], [[パイプライン並列]]
- Pages updated: [[Sun Yat-sen University]], [[LLMサービング管理]], [[KVキャッシュ管理]], [[テンソル並列]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: パイプライン並列 LLM サービングにおいて、自己回帰生成の最終ステージが担うサンプリング(logit 計算+トークン選択)の負荷がステージ間不均衡(パイプラインバブル)を引き起こすという従来見過ごされてきた問題を特定し、実行時間予測・バブル対応スケジューラ・非同期 KV キャッシュ移行による動的層再配分で解消する DynaPipe を提案。vLLM・gLLM・SGLang 比で E2E レイテンシを 8〜41% 削減した。新規concept [[パイプライン並列]] を立て、既存の [[テンソル並列]] と対照させる「均一資源下でも生じる PP 特有のバブル」という横断的知見を記録した。
## [2026-07-27] ingest-paper | SequenceFI: Non-intrusive Temporal Fault Injection for Microservice Systems
- Source: `.raw/papers/arxiv-2607.20050.pdf`(arXiv 2607.20050、投稿日 2026-07-22、https://arxiv.org/abs/2607.20050)
- Summary: [[@2026__arXiv__SequenceFI - Non-intrusive Temporal Fault Injection for Microservice Systems]]
- Pages created: [[@2026__arXiv__SequenceFI - Non-intrusive Temporal Fault Injection for Microservice Systems]], [[Yuzhen Tan]], [[Shaolin Tan]]
- Pages updated: [[Jian Wang]], [[Bing Li]], [[Wuhan University]], [[Zhongguancun Laboratory]], [[Peter Alvaro]], [[障害注入]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], `.raw/.manifest.json`
- Key insight: マイクロサービス障害注入に「どこに・何を」に続く「いつ」という第三の時間的次元を、post-effect・order-sensitive・k-of-n の 3 パターンに定式化し、静的ターゲット選択と時間的ガード合成(minimum hitting set 問題への還元)を分離することで TFIC 探索空間の組合せ爆発を回避した非侵入的サイドカーフレームワーク。450 試行で 100.0% temporal success、TFIC 生成試行回数を平均 1 回に圧縮。著者の Jian Wang・Bing Li・Wuhan University は既存 concept TVDiag/MicroIRC の著者・所属と同一であることが判明し、entity ページを横断更新した。
## [2026-07-27] ingest-paper | Above the Clouds: A Berkeley View of Cloud Computing
- Source: `.raw/papers/AboveTheClouds.pdf`(https://home.cse.ust.hk/~weiwa/teaching/Fall15-COMP6611B/reading_list/AboveTheClouds.pdf、原著は UC Berkeley Technical Report UCB/EECS-2009-28、2009-02-10)
- Summary: [[@2009__UCB TR__Above the Clouds - A Berkeley View of Cloud Computing]]
- Pages created: [[@2009__UCB TR__Above the Clouds - A Berkeley View of Cloud Computing]], [[Michael Armbrust]], [[Google AppEngine]], [[クラウドコンピューティング]]
- Pages updated: [[Ion Stoica]], [[Armando Fox]], [[Matei Zaharia]], [[Randy H. Katz]], [[David A. Patterson]], [[University of California, Berkeley]], [[Amazon Web Services]], [[Microsoft Azure]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: 2009年のクラウドコンピューティングの用語(SaaS/Utility Computing/Public・Private Cloud)整理と、elasticityをリスク移転として定式化する経済モデル、普及障害トップ10のリストを提示した基礎的な技術報告書。「Obstacle 7: 大規模分散システムのバグ」として15年以上前に指摘された課題が、既存の [[クラウド障害ライフサイクル]] 概念(2022年ISSREの354件ポストモーテム分析)によって定量的に実証された構造を横断的知見として新規concept [[クラウドコンピューティング]] に記録した。
## [2026-07-27] ingest | Leiden Declaration on Artificial Intelligence and Mathematics
- Source: https://leidendeclaration.ai/ (2026-06-02発行、DOI: 10.5281/zenodo.20302944)
- Summary: [[@2026__leidendeclaration.ai__Leiden Declaration on Artificial Intelligence and Mathematics]]
- Pages created: [[@2026__leidendeclaration.ai__Leiden Declaration on Artificial Intelligence and Mathematics]], [[Jim Portegies]], [[Peter Scholze]], [[Terence Tao]], [[International Mathematical Union]], [[Lorentz Center]], [[AI時代の数学研究倫理]]
- Pages updated: [[自動査読]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: 数学研究への生成AI導入に対処する国際的コミュニティ宣言(国際数学連合承認、署名者3,165名超)。数学の中核的価値5点それぞれに対応するAI由来の脅威を指摘し、数学者・組織・政策立案者・商用AI企業への推奨事項を示す。既存 [[自動査読]] concept に、LLM査読の性能向上と本宣言が求める査読規範との緊張関係という横断的知見を追記した。
## [2026-07-27] ingest-paper | AIシステムの進化速度は指数関数を超えている
- Source: `.raw/papers/jstage-tjsai-40-3-E-O84.pdf`(https://www.jstage.jst.go.jp/article/tjsai/40/3/40_40-3_E-O84/_pdf/-char/ja、DOI: https://doi.org/10.1527/tjsai.40-3_E-O84、人工知能学会論文誌(TJSAI)40巻3号E、2025年)
- Summary: [[@2025__TJSAI__AIシステムの進化速度は指数関数を超えている]]
- Pages created: [[@2025__TJSAI__AIシステムの進化速度は指数関数を超えている]]、[[中島秀之]]、[[津田一郎]]、[[札幌市立大学]]、[[シンギュラリティ]]、[[コルモゴロフ複雑性]]
- Pages updated: [[ムーアの法則とデナードスケーリングの終焉]]、[[Transformer]]、[[SIMDベクトル処理]]、[[wiki/index.md]]、[[wiki/hot.md]]、[[wiki/sources/_index.md]]、[[wiki/entities/_index.md]]、[[wiki/concepts/_index.md]]、`.raw/.manifest.json`
- Key insight: [[中島秀之]]([[札幌市立大学]]学長)・[[津田一郎]](同AITセンター特任教授)による4ページの理論的位置づけ論文。Ray Kurzweilのシンギュラリティ論がプログラムの複雑性増加を無視していると批判し、チップの物理サイズを固定して集積度がN倍になると可能な計算量が2^(NL)で指数関数的に増加すること、ムーアの法則(N∝2^t)と合わせると時間に関する指数関数の指数関数になることを導出した。Transformerのattention機構のSIMD型局所計算という性質を根拠に、この議論が生成AIの進化速度に適用できると主張する。既存concept [[ムーアの法則とデナードスケーリングの終焉]] が示すMoore's law鈍化の実測データと、本ソースが前提とする集積度の指数関数的増加の継続との間に緊張関係を見出し、両ページにcontradiction calloutを追記した。
## [2026-07-27] ingest | Everyone Should Know SIMD
- Source: `.raw/articles/everyone-should-know-simd-2026-07-27.md`(https://mitchellh.com/writing/everyone-should-know-simd)
- Summary: [[@2026__mitchellh.com__Everyone Should Know SIMD]]
- Pages created: [[@2026__mitchellh.com__Everyone Should Know SIMD]], [[Zig]], [[Ghostty]]
- Pages updated: [[Mitchell Hashimoto]], [[SIMDベクトル処理]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: [[Mitchell Hashimoto]] のブログ記事。SIMD コードを「定数のブロードキャスト→ベクトル幅ループ→並列演算→リダクション→スカラー端数処理」の5段階の共通形に定式化し、自身の [[Zig]] 製ターミナルエミュレータ [[Ghostty]] のコードポイント探索実装を実例に示す(ARM NEON最大4倍・AVX2最大8倍/実測約5倍・AVX-512最大16倍)。既存 concept [[SIMDベクトル処理]] の「自動ベクトル化は難しい」知見に、テキスト処理領域からの独立した実例と汎用的な5段階パターンを追記した。
## [2026-07-25] ingest-paper | Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker
- Source: `.raw/papers/nsdi23-chen-yinfang.pdf`(https://www.usenix.org/system/files/nsdi23-chen-yinfang.pdf、USENIX NSDI'23、pp. 1701–1716)
- Summary: [[@2023__NSDI__Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker]]
- Pages created: [[@2023__NSDI__Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker]], [[Xudong Sun]], [[Ze Yang]]
- Pages updated: [[Rainmaker]], [[Yinfang Chen]], [[Tianyin Xu]], [[Suman Nath]], [[障害注入]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: 直前に取り込んだ Yinfang Chen 博士論文第2章で言及されていた [[Rainmaker]] の一次論文(NSDI'23)。クラウドサービス API・SDK のエラー通知の不整合という問題設定から4パターンのバグ taxonomy を導出し、HTTP プロキシによる push-button フォールトインジェクションツールを構築、11 の .NET アプリケーションで新規バグ73件(誤検知率1.96%)を発見した一次実証研究。[[Rainmaker]] エンティティの first_mentioned を博士論文からこの一次論文へ差し替え、[[障害注入]] の横断的知見を一次資料の具体的な§・数値で補強した。
## [2026-07-25] ingest-paper | Agentic Failure Management of Cloud Systems
- Source: `.raw/papers/CHEN-DISSERTATION-2026.pdf`(https://tianyin.github.io/thesis/CHEN-DISSERTATION-2026.pdf、Yinfang Chen 博士論文、University of Illinois Urbana-Champaign、2026年、141ページ)
- Summary: [[@2026__UIUC PhD Thesis__Agentic Failure Management of Cloud Systems]]
- Pages created: [[@2026__UIUC PhD Thesis__Agentic Failure Management of Cloud Systems]], [[Rainmaker]]
- Pages updated: [[Yinfang Chen]], [[Tianyin Xu]], [[障害注入]], [[プロアクティブ障害管理]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: クラウドインシデントライフサイクル全体(予防・診断・緩和・評価)を横断する博士論文。新規に第2章で [[Rainmaker]](HTTP層REST APIフォールトインジェクションで11 .NETアプリから新規バグ73件・誤検知率1.96%を検出)を発表。第3–5章(RCACOPILOT・STRATUS・AIOPSLAB)は既刊論文と同一内容のため既存 wiki source ページへ委譲し、本 ingest は Rainmaker の深掘りと、第1章/第6章の thesis statement・Discussion(自律緩和の社会的含意・SRE役割変化)・Future Work という博士論文レベルの統合フレーミングに焦点を当てた。
## [2026-07-23] ingest-video | AWS Distinguished Eng: Learning From 3000 Incidents And How Engineering Is Changing
- Source: URL(https://www.youtube.com/watch?v=u3GjIXP9N0s、YouTube、Ryan Peterman チャンネル、2026-04-13 公開)。動画本体は HTTP 403 で取得不可、YouTube 自動生成英語字幕(auto captions)から transcript.md を作成
- Transcript: `.raw/videos/youtube-u3GjIXP9N0s/transcript.md`
- Frames: なし(動画本体取得不可のため代表フレーム未取得。トークショー形式インタビューで画面表示情報は少ないと推定)
- Summary: [[@2026__YouTube__AWS Distinguished Eng - Learning From 3000 Incidents And How Engineering Is Changing (Marc Brooker)]]
- Pages created: [[@2026__YouTube__AWS Distinguished Eng - Learning From 3000 Incidents And How Engineering Is Changing (Marc Brooker)]], [[Ryan Peterman]]
- Pages updated: [[Marc Brooker]], [[Aurora DSQL]], [[メタ安定障害]], [[ポストモーテム]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], `.raw/.manifest.json`
- Key insight: [[Marc Brooker]](AWS シニアプリンシパルエンジニア)が3,000件超のポストモーテムを読んだ経験から、キャッシュの「フル/空」二峰性が[[メタ安定障害]]の温床になると直接説明し、[[Aurora DSQL]] のストレージ層を「完全なキャッシュ」として設計することでこの二峰性自体を排除したと述べた。既存の Lambda 事例(トリガー後の被害抑制)と対比させ、メタ安定障害対策を「緩和」と「予防」の2層に整理できることが分かった。
## [2026-07-23] ingest | ソフトウェアの工業化とアーツ&クラフツ運動
- Source: `.raw/articles/software-industrialization-arts-and-crafts-2026-03-24.md`(https://newspicks.com/news/16293538/body/、NewsPicks、2026-03-24 公開)
- Summary: [[@2026__NewsPicks__ソフトウェアの工業化とアーツ&クラフツ運動]]
- Pages created: [[@2026__NewsPicks__ソフトウェアの工業化とアーツ&クラフツ運動]]、[[広木大地]]、[[Mitchell Hashimoto]]、[[HashiCorp]]、[[Wes McKinney]]、[[Fred Brooks]]、[[William Morris]]、[[Walter Gropius]]、[[Marcel Breuer]]、[[Dan Shapiro]]、[[StrongDM]]、[[Software Craftsmanship]]、[[ダーク・ファクトリー]]
- Pages updated: [[Harness Engineering]]、[[バイブコーディング]]、[[Andrej Karpathy]]、[[wiki/index.md]]、`.raw/.manifest.json`
- Key insight: [[広木大地]] による NewsPicks 連載記事(2026-03-24)。AIコーディング時代の「職人か工業化か」対立を、19世紀[[William Morris]]のアーツ&クラフツ運動から[[Walter Gropius]]のバウハウスに至る150年のデザイン史の弁証法(正→反→合)になぞらえ、[[Mitchell Hashimoto]]([[HashiCorp]]共同創業者)の「ハーネス・エンジニアリング」を統合(合)の実践例として位置づけた。既存 concept [[Harness Engineering]] は [[OpenAI]]・Anthropic・[[Lilian Weng]] という3系統の知見を集約していたが、本記事は Mitchell Hashimoto という別の実践者の同名実践を、まったく異なる知的系譜(デザイン史の類比)から独立に報告する点が横断的知見として新規性を持つ。新規 concept [[Software Craftsmanship]](モリスのパラドックスを含む)・[[ダーク・ファクトリー]](Dan Shapiro の AI プログラミング5段階分類 Level 5)を立て、[[バイブコーディング]]・[[Andrej Karpathy]] には職人コーディング陣営からの「ファストフード」批判を追記した。
## [2026-07-23] ingest-paper | DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- Source: `.raw/papers/arxiv-2503.14476.pdf`(arXiv:2503.14476、2025-03-17 初出 / 2025-05-20 v2 改訂)
- Summary: [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]]
- Pages created: [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]], [[Qiying Yu]], [[Institute for AI Industry Research (AIR), Tsinghua University]], [[Qwen2.5-32B]]
- Pages updated: [[GRPO]], [[VeRL]], [[ByteDance Seed]], [[The University of Hong Kong]], [[DeepSeek-R1-Zero]], [[エントロピー崩壊]], [[検証可能報酬による強化学習]], [[強化学習スケーリング]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: naive GRPO の失敗(AIME24 avg@32=30 点)から出発し、Clip-Higher・Dynamic Sampling・Token-Level Loss・Overlong Reward Shaping の 4 技術で 50 点まで改善したアブレーション(Table 1)が、後続の複数研究(ScaleRL・MiniMax-M1・Scaling Up RL)が引用する「DAPO 拡張」の原典であることが判明した。
## [2026-07-23] ingest | Frontier RL Is Cheaper Than You Think
- Source: `.raw/articles/frontier-rl-is-cheaper-than-you-think-2026-03-23.md`(https://fireworks.ai/blog/frontier-rl-is-cheaper-than-you-think、Fireworks AI Blog、2026-03-23 公開)
- Summary: [[@2026__Fireworks AI__Frontier RL Is Cheaper Than You Think]]
- Pages created: [[@2026__Fireworks AI__Frontier RL Is Cheaper Than You Think]], [[AReaL]], [[Federico Cassano]], [[RL重み差分配信]]
- Pages updated: [[Fireworks AI]], [[Cursor]], [[耐障害LLM訓練]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: [[Fireworks AI]] 公式ブログ(2026-03-23)。フロンティア RL 訓練が巨大な co-located クラスタを要するという通念に対し、bf16 チェックポイント間で重みの 98% 超がビット等価という実測に基づき、1TB チェックポイントの平均差分がわずか 20.3 GiB(1.98%)であることを示し、trainer とロールアウトフリートを地理的に分離しつつ差分圧縮のみを配信するアーキテクチャで co-location 不要論を裏付けた。[[Cognition]] の [[SWE-1.7]]・[[Cursor]] の Composer 2 が採用する圧縮重み差分配信パターンを一般化する一次資料として位置づけ、新規 concept [[RL重み差分配信]] を立てて既存 [[耐障害LLM訓練]] の関連知見(耐障害性とコスト効率という異なる動機からの独立到達)と接続した。フルマネージド・Tinker 互換 SDK・Bring-your-own-trainer の 3 種の RL 提供形態も紹介する(企業ブログ、著者名非明示のため confidence: medium)。
## [2026-07-23] ingest | SWE-1.7: Frontier Intelligence at a Fraction of the Cost
- Source: `.raw/articles/swe-1-7-2026-07-23.md`(https://cognition.com/blog/swe-1-7、Cognition Blog、2026-07-08 公開)
- Summary: [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]]
- Pages created: [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]], [[Cognition]], [[Devin]], [[SWE-1.7]], [[Kimi K2.7]], [[FrontierCode]], [[Terminal-Bench]], [[SWE-Bench Multilingual]], [[Kevin-32B]], [[自己圧縮]], [[エントロピー崩壊]]
- Pages updated: [[耐障害LLM訓練]], [[報酬ハッキング]], [[強化学習スケーリング]], [[NVIDIA Dynamo]], [[Fireworks AI]], [[Cerebras]], [[wiki/index.md]], [[wiki/hot.md]], `.raw/.manifest.json`
- Key insight: [[Cognition]] による、[[Kimi K2.7]] ベースの継続 RL 訓練モデル [[SWE-1.7]] の発表ブログ。top-p サンプリング + サンプリング分布リプレイによる[[エントロピー崩壊]]対策(低確率トークンのサンプリングが優勢トークンの分布をさらに尖らせる自己強化メカニズムを softmax 勾配の解析で説明)、3 大陸 4 データセンターのマルチクラスタ非同期 RL 訓練(圧縮重み差分のオブジェクトストレージ配信で 1T パラメータモデルの大陸間更新を 1〜2 分に短縮、[[NVIDIA Dynamo]] による推論側フォルトトレランス)、検証器品質・難易度較正・チーティング防止の 3 軸データ品質パイプライン、Kevin-32B 由来の[[自己圧縮]](交互長さペナルティと組み合わせ訓練 rollout を最大 6 時間に延長)という 4 本柱で訓練された。[[FrontierCode]] 1.1 Main 42.3%・[[Terminal-Bench]] 2.1 81.5%・[[SWE-Bench Multilingual]] 77.8% を達成し、既に広範な RL 事後学習を経たベースモデルからの大幅な追加性能向上を「post-training ceiling」通念への反証として位置づけた。既存 concept [[耐障害LLM訓練]] に RL 特有の trainer/推論間の障害コスト非対称性を、[[報酬ハッキング]] に検証器を取り巻く実行環境自体を狭める多層防御の実例を、[[強化学習スケーリング]] に post-training ceiling への産業実例の反証と自己圧縮・エントロピー崩壊の 2 新規 concept への参照を追記した。図表 5 点(ポリシーエントロピー推移・訓練推論間乖離・応答長推移・行動傾向箱ひげ図・エッジケース探索頻度)を埋め込んだ。
## [2026-07-22] ingest | Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI
- Source: `https://developer.nvidia.com/blog/inside-nvidia-rubin-gpu-architecture-powering-the-era-of-agentic-ai/`(NVIDIA Developer Blog)
- Summary: [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]]
- Pages created: [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]], [[NVIDIA Rubin GPU]], [[NVIDIA Vera Rubin NVL72]]
- Pages updated: [[NVIDIA]], [[テンソルコア]], [[Mixture-of-Experts]], [[KVキャッシュ管理]], [[集合通信]], [[AIデータセンタートポロジ]], [[カーネルフュージョン]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: エージェント型 AI 推論(長い推論ステップ列・低レイテンシ・高デコードスループット・長コンテキストアテンション・大容量 KV キャッシュ・密結合 GPU スケールアップ)向けに設計された [[NVIDIA Rubin GPU]] のアーキテクチャを解説する NVIDIA Developer Blog 記事。336B トランジスタ・224 SM・896 テンソルコア、第 3 世代 Transformer Engine(NVFP4 最大 50 PFLOPS)、HBM4(最大 288GB・22 TB/s)、K 次元テンソルコアスループット倍増、MoE 向け TMA インライン・ディスクリプタ更新、2:4 スパース圧縮アテンション、指数関数スループット向上、タイルレベル・カーネル間トリガリング、NVLink 6 counted writes を統合する。ラックスケールの [[NVIDIA Vera Rubin NVL72]] は Intelligent Power Smoothing・DSX MaxLPS で座礁電力を回収し同一電力予算内 GPU 数を最大 40% 増やす。既存 6 concept([[テンソルコア]]・[[Mixture-of-Experts]]・[[KVキャッシュ管理]]・[[集合通信]]・[[AIデータセンタートポロジ]]・[[カーネルフュージョン]])に、これまでソフトウェア層(FAST の AllToAllv スケジューリング、Speed-of-Light 研究の memory barrier 排除、階層 KV キャッシュ、マルチプレーン/マルチレールのネットワークコスト最適化)が対処してきた課題に対する、ハードウェア co-design 側からの応答という横断的知見を追記した。
## [2026-07-22] ingest-paper | Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives
- Source: `.raw/papers/arxiv-2607.16100.pdf`(arXiv:2607.16100、cs.DC、2026-07-17 投稿)
- Summary: [[@2026__arXiv__Every Microsecond Matters Achieving Near Speed-of-Light Latency in GPU Collectives]]
- Pages created: [[@2026__arXiv__Every Microsecond Matters Achieving Near Speed-of-Light Latency in GPU Collectives]]
- Pages updated: [[Siyuan Shen]], [[Torsten Hoefler]], [[NCCL]], [[集合通信]], [[LLM推論]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: Siyuan Shen・Torsten Hoefler([[ETH Zürich]])・Sylvain Jeaugey ほか([[NVIDIA]])による、GB200 NVL72 の scale-up ネットワークで GPU 集合通信のハードウェア理論下限(Speed-of-Light)へ迫る研究。既存 AllReduce 実装が依存する memory barrier(1 回あたり 1 µs 超)を LL・sentinel 同期・双方向通信+double buffering・two-shot LL128 atomic の 4 技術で完全排除し、NCCL に低レイテンシカーネルとして統合した。SoL 比 7% まで到達し、vLLM 推論の inter-token latency を最大 13% 削減、cuSOLVERMp の GFLOPS/GPU を最大 7.0% 改善した。既存concept [[集合通信]] に、診断研究が同期点を観測対象とするのに対し本研究は同じ memory barrier を排除対象として攻めるという対比、および Speed-of-Light 実測という新しい評価方法論を追記した。図表 7点(動機付け・対称メモリ概要・バリアレイテンシ・LL128 atomic アルゴリズム・マイクロベンチマーク結果・vLLM 推論結果・cuSOLVERMp 結果)を埋め込んだ。
## [2026-07-22] ingest-paper | Measuring System Normality
- Source: `.raw/papers/2026_Unknown_Measuring_system_normality.pdf`(ローカルPDF、タイトルページから ACM TOCS Vol.20 No.2, 2002 と確認)
- Summary: [[@2002__TOCS__Measuring System Normality]]
- Pages created: [[@2002__TOCS__Measuring System Normality]], [[Harek Haugerud]], [[Sigmund Straumsnes]], [[Trond Reitan]], [[Norwegian Water Resources and Energy Directorate]], [[システムの正常状態]]
- Pages updated: [[Mark Burgess]], [[Oslo University College]], [[異常検知]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: Burgess・Haugerud・Straumsnes([[Oslo University College]])・Trond Reitan([[Norwegian Water Resources and Energy Directorate]])による、トランザクション数の揺らぎが周期性除去後にPlanck(最大エントロピー)分布に収束し「温度」が地理的に離れたサイト間で概ね不変であることを示した統計力学的アプローチの原点論文(ACM TOCS 2002)。この統計的枠組みは1〜2週間以上のデータを要し、15分間の模擬攻撃は統計的に不可視だった。既存concept [[異常検知]] に「長期ベースライン vs 短期シグナル」の分離という、Minder・LinkedIn修正Zスコア等の現代手法にも通じる知見を追記し、新規concept [[システムの正常状態]] を「異常の検知」ではなく「正常とは何か」自体を扱う独立した主題として立てた。図6点(自己相関・Planck分布フィット・窓サイズ感度・3サイト不変性・模擬攻撃時のエントロピー・ログイン対ネットワーク温度)を埋め込んだ。
## [2026-07-22] ingest-paper | Principle Components and Importance Ranking of Distributed Anomalies
- Source: `/Users/y-tsubouchi/Downloads/2005_Begnum_Principle_Components_Importance_Ranking_Distributed.pdf`(ローカルPDF、Machine Learning誌 Vol.58, pp.217-230, 2005, Springer と確認)
- Summary: [[@2005__Machine Learning__Principle Components and Importance Ranking of Distributed Anomalies]]
- Pages created: [[@2005__Machine Learning__Principle Components and Importance Ranking of Distributed Anomalies]], [[Kyrre Begnum]]
- Pages updated: [[Mark Burgess]], [[cfengine]], [[Oslo University College]], [[PageRank]], [[メトリクス削減]], [[異常検知]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: Kyrre Begnum・Mark Burgess([[Oslo University College]])による、cfengineの分散異常検知(host normality)に対しPCAと固有ベクトル中心性という数学的前提の異なる2手法を用いて「集中分析が分散比較より優れる」という仮説を検証したが、支持する証拠は得られなかったという珍しい率直な負の実証結果を報告した論文(Machine Learning誌 2005)。固有ベクトル中心性の定式化はPageRank/HITSと数学的に同型であり、既存concept [[PageRank]] を初めて複数ソース突き合わせ段階に進めた。図2点(PCA楕円体・グラフ中心性の例)を埋め込んだ。
## [2026-07-22] ingest-paper | On the theory of system administration
- Source: `.raw/papers/arxiv-cs.0003075.pdf`(arXiv cs/0003075, 2000-03-23投稿)
- Summary: [[@2000__arXiv__On the theory of system administration]]
- Pages created: [[@2000__arXiv__On the theory of system administration]]
- Pages updated: [[Mark Burgess]], [[タイムスケール分離と監視粒度]], [[ゲーム理論とSRE]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: Mark Burgess による2000年のarXivプレプリント。同年12月のLISA2000論文「Theoretical System Administration」と核心の数理装置(理想状態・n次元格子上のH(d)公式・ゴミ収集ゲームのペイオフ行列)を共有するが、Theorem 1の公理的証明・応答時間比較式(t_auto vs t_human)などarXiv版固有の内容に重心を置く別文書として取り込んだ。既存concept [[タイムスケール分離と監視粒度]] に、2014年記事の「KT境界」「Dynamics trump semantics」の14年前の定量的原型として本論文の応答時間不等式を追記した。図4点(理想状態の写像・人間対自動システムの作業率・ランダムウォーク格子・ペイオフ時間発展)を座標クロップで埋め込んだ。LISA2000版との強い重複は「重複ページを作らない」原則の境界事例であり、統合すべきか要検討。
## [2026-07-22] ingest-paper | Theoretical System Administration
- Source: `.raw/papers/burgess.pdf`(URL: https://www.usenix.org/legacy/publications/library/proceedings/lisa2000/full_papers/burgess/burgess.pdf、HTML版 https://www.usenix.org/legacy/publications/library/proceedings/lisa2000/full_papers/burgess/burgess_html/index.html で書誌確認)
- Summary: [[@2000__LISA__Theoretical System Administration]]
- Pages created: [[@2000__LISA__Theoretical System Administration]], [[収束型システム管理]]
- Pages updated: [[Mark Burgess]], [[Oslo University College]], [[ゲーム理論とSRE]], [[SREの工学化]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: Mark Burgess がLISA 2000で発表した、CFEngineの「収束」概念をn次元格子上の状態空間モデルへ一般化し、システム管理者とユーザーの相互作用をゼロサムゲームとして定式化した理論論文。既存concept [[ゲーム理論とSRE]](2026年のBarteneva講演を起点)に四半世紀先行する原型として接続し、[[SREの工学化]] に1998–1999年の主張を具体的数式で裏付ける一次資料として追記した。新規concept [[収束型システム管理]] を立てた。図4点(調整関数・ランダムウォーク格子・ペイオフ行列・ペイオフ寄与)をPyMuPDFでキャプション座標クロップして埋め込んだ。
## [2026-07-22] ingest-paper | Computer Immunology
- Source: `.raw/papers/burgess-lisa98-computer-immunology.pdf`(URL: https://static.usenix.org/event/lisa98/full_papers/burgess/burgess.pdf)
- Summary: [[@1998__LISA__Computer Immunology]]
- Pages created: [[@1998__LISA__Computer Immunology]], [[コンピュータ免疫学]]
- Pages updated: [[Mark Burgess]], [[cfengine]], [[Oslo University College]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], `.raw/.manifest.json`
- Key insight: Mark Burgess が1998年、cfengineの実運用経験を土台に生物学的免疫系(自己/非自己モデルの限界と危険モデルへの転換)を計算機システムのシグナル(SIGCHLD=apoptosis / SIGSEGV等=necrosis)に対応づけ、後のautonomic computing・self-healing・AIOpsの問題提起を先取りしたvision paper。図1点(cfengineリアクタ構成図)を埋め込み、Table 1(免疫系構成表)は本文にmarkdown表として転記。バッチ並行ingest中に別 subagent(LISA2000担当)と slug `burgess` が衝突する事故が発生したため、明示的な別slug `burgess-lisa98-computer-immunology` で再取得し隔離した。
## [2026-07-22] ingest (batch) | The Failure of Knowledge Management / Infrastructure Management Timescales (Mark Burgess)
- Source: `.raw/articles/the-failure-of-knowledge-management-2026-07-22.md`(URL: https://mark-burgess-oslo-mb.medium.com/the-failure-of-knowledge-management-5d97bb748fc3), `.raw/articles/blog_timescale-2026-07-22.md`(URL: https://markburgess.org/blog_timescale.html)
- Summary: [[@2023__Medium__The Failure of Knowledge Management]], [[@2014__markburgess.org__Infrastructure Management Timescales]]
- Pages created: [[@2023__Medium__The Failure of Knowledge Management]], [[@2014__markburgess.org__Infrastructure Management Timescales]], [[知識のリレーションシップモデル]], [[タイムスケール分離と監視粒度]], [[Robin Dunbar]]
- Pages updated: [[Mark Burgess]], [[知識グラフ]], [[アラート疲労]], [[制御ループの安定性とタイムラグ補償]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[Mark Burgess]] の個人ブログ2記事を ingest。(1) 知識管理の失敗論——知識は静的データではなく「反復と親密さ」による個人的関係性であり、エキスパートシステム・Topic Maps・RDF/OWL といった論理的分類法はいずれも「知識は解釈の問題であり論理は脆い」という理由で失敗すると論じる。生物学的裏付けとして [[Robin Dunbar]] の社会脳仮説を引用。既存の [[知識グラフ]] concept(AIOps文脈での高精度な実用例)との対比を新規concept [[知識のリレーションシップモデル]] に整理し、[[知識グラフ]] に contradiction callout を追加した。(2) タイムスケール分離論——観測・是正の速度を問題自身の時間スケールに一致させる原則(KT境界、"Dynamics always trump semantics")を新規concept [[タイムスケール分離と監視粒度]] として整理し、既存の [[アラート疲労]](アラート量削減という下流の対処)・[[制御ループの安定性とタイムラグ補償]](Apollo throttle castellation 事例)との横断的接続を追記した。
## [2026-07-22] ingest-paper | An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure
- Source: `.raw/papers/2026_Unknown_An_Agentic_Framework_Triaging_Incidents.pdf`(ローカルPDF、DOI 10.1145/3803437.3805228 で書誌情報を確認)
- Summary: [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]]
- Pages created: [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]], [[Comfey]], [[Yuhan Yao]], [[Madhura Vaidya]], [[Jieren Deng]]
- Pages updated: [[Yuxuan Jiang]], [[Yigong Hu]], [[Chetan Bansal]], [[Minghua Ma]], [[Ze Li]], [[Murali Chintalapati]], [[Microsoft]], [[Microsoft Azure]], [[インシデントトリアージ]], [[マルチエージェント協調]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Yuhan Yao・Yuxuan Jiang(共同筆頭)ほか([[Microsoft]]・Boston University)による、Azure本番インシデントトリアージフレームワーク Comfey の提案論文(FSE Companion '26)。単一の中央集権エージェントによる分類ではなく、ローカルなaccept/reject判断とGlobal Routing Tableによる履歴駆動のスティグマジックなチーム間ルーティングを分離する設計により、単一の弱いエージェントに全体性能が引きずられる問題を回避しつつ、Azure本番22か月間の運用で先行システムCOMET比+7.55%の精度・4.38倍のトリアージ高速化を達成した。既存concept [[インシデントトリアージ]] に単一分類器型 vs 分散型多段階トリアージのアーキテクチャ差、COMET→Comfeyという同一組織内での中央集権→分散化の進化を、[[マルチエージェント協調]] にスティグマジック協調とネゴシエーション/RL型協調(Triangle・Conductor)の対比を追記した。図6点(動機事例・分散アーキテクチャ・チームエージェントワークフロー・マルチエージェントルーティング・トリアージ時間比較・緩和時間比較)を埋め込んだ。§3.6.3と§4.7でホップ上限の記述不一致(10 vs 5)があり source ページに注記した。
## [2026-07-22] ingest-paper | TSGen: Automated Troubleshooting Guide Generation
- Source: `.raw/papers/2026_Unknown_TSGen_Automated_Troubleshooting_Guide_Generation.pdf`(ローカルPDF、DOI 10.1145/3803437.3805239 で書誌情報を確認)
- Summary: [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]]
- Pages created: [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]], [[Yi Xiao]], [[Daniel Genkin]], [[Bhala Ranganathan]], [[TSGen]]
- Pages updated: [[Hongyu Zhang]], [[Chaoyun Zhang]], [[Rujia Wang]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[Chongqing University]], [[Microsoft]], [[TSG自動化]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Yi Xiao・[[Hongyu Zhang]]ほか([[Chongqing University]]・[[Microsoft]])による、過去インシデントデータのマイニングから構造化トラブルシューティングガイド(TSG)をゼロ生成する TSGen の提案論文(FSE Companion '26)。「TSGが存在しない/古い」状態からの生成という点で、既存の TSG *実行*自動化研究(FLASH・LLexus・StepFly)と補完関係にある一段上流の課題を初めて解いた。カバレッジ54.8%・約3倍の検索精度を達成し、フィルタリング(特にLLMベース意味ラベリング)除去でカバレッジが最大49.3%低下することから「良い生成には良い入力整形が必要」という点を実証した。人手評価平均はTSGen≈4.3、既存TSG≈3.3。既存concept [[TSG自動化]] に「生成」軸のFlowXpert型(運用ドキュメント由来)とTSGen型(生インシデントデータ由来)への分岐、人間作成TSGの検索精度の低さ(Retrieval Accuracy 0.012)がFLASHのTSG品質調査(Pass約8.5%)と独立に「人間向けTSGはLLM消費に不適」という知見に収束する点を追記した。図5点(インシデント管理ワークフロー・実TSGのワークフロー例・TSGenアーキテクチャ・反復更新によるカバレッジ改善・人手評価スコア分布)を埋め込んだ。
## [2026-07-22] ingest-paper | LLM Agents for AIOps in Kubernetes: An Industrial Experience Report with Red Hat OpenShift
- Source: `.raw/papers/2026_Unknown_LLM_Agents_AIOps_Kubernetes_Industrial.pdf`(ローカルPDF、DOI 10.1145/3803437.3805240 で書誌情報を確認)
- Summary: [[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]]
- Pages created: [[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]], [[Arthur Vitui]], [[Red Hat]], [[Red Hat OpenShift]], [[LangChain]], [[LangGraph]], [[MLASP]]
- Pages updated: [[Tse-Hsun Chen]], [[Concordia University]], [[Prometheus]], [[Kubernetes]], [[AIOps]], [[agentic SRE]], [[ReAct]], [[LLM評価]], [[エージェントメモリ]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[Arthur Vitui]]([[Red Hat]])・[[Tse-Hsun Chen]]([[Concordia University]])による、Red Hat OpenShift上で10種の商用LLMをReActエージェントとして統制比較した産業実験報告(FSE Companion '26)。同一環境・同一ツール・同一プロンプトで、単発ツール精度(Claude 3.5 Sonnet・Mistral Largeが最良)と多段ツール連鎖の精度(GPT-4o・GPT-4 Turboが最良)が独立に劣化しうること、低レイテンシ・低トークン消費が「早期終了」の兆候にすぎない例(Mixtral 8x22B・GPT-3.5 TurboがARで最速だが精度0%)を実証した。既存concept [[エージェントメモリ]] にメモリが「改善」でなく「悪化」させる産業実証例(時間的再計算タスク)を、学術知見(メモリ追加=改善)との対比として追記した。図1点(評価ワークフロー)を埋め込んだ。
## [2026-07-22] ingest-paper | cache_ext: Customizing and Tracing the Page Cache with eBPF
- Source: `.raw/papers/2026_Unknown_cache_ext_Customizing_Tracing_Page.pdf`(ローカルPDF、DOI 10.1145/3819062 で書誌情報を確認。SOSP 2025 の Chairs 推薦によりACM TOCS拡張出版として招待)
- Summary: [[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]]
- Pages created: [[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]], [[cache_ext]], [[cachestream]], [[sched_ext]], [[Tal Zussman]], [[Ioannis Zarkadas]], [[Jeremy Carin]], [[Andrew Cheng]], [[Hubertus Franke]], [[Jonas Pfefferle]], [[Asaf Cidon]]
- Pages updated: [[Columbia University]], [[IBM Research]], [[RocksDB]], [[eBPF]], [[Linuxカーネルインタフェース]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Tal Zussman・Ioannis Zarkadas(共同筆頭)ほか([[Columbia University]] × [[IBM Research]])による、Linuxページキャッシュの退避・受け入れ方針をeBPFの`struct_ops`/kfuncでカーネル内実装に置き換える cache_ext の提案論文。ユーザ空間オフロード方式が招く最大20.6%のスループット低下を回避しつつ、アプリケーション情報を用いたカスタム方針で最大70%のスループット向上・58%のP99テールレイテンシ削減を、RocksDB/LevelDB/Twitter本番トレースを用いた評価で実証した。既存concept [[eBPF]] に「観測から制御(方針そのものの置換)への重心移動」(sched_ext→cache_ext)という設計指針の逆方向定量裏付け(ユーザ空間オフロードで最大20.6%のスループット低下)を追記し、[[ページキャッシュカスタマイズ]](新規)に拡張可能カーネルの1980年代理念がeBPF verifierで実用化された技術史的位置づけを記載した。図7点(baseline LRU・アーキテクチャ・GET-SCAN概要・YCSB結果・GET-SCAN結果・RocksDB admission filter診断・isolation結果)を埋め込んだ。
## [2026-07-22] ingest-paper | STsCache: An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage
- Source: `.raw/papers/p2964-li.pdf`(https://www.vldb.org/pvldb/vol18/p2964-li.pdf、VLDB 公式 PDF を `scripts/fetch-paper-pdf.sh` で取得)
- Summary: [[@2025__VLDB__STsCache - An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage]]
- Pages created: [[@2025__VLDB__STsCache - An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage]], [[Hui Li]], [[Xidian University]], [[STsCache]], [[TSCache]], [[BSCache]]
- Pages updated: [[時系列データベース]], [[分散キャッシュ]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Tao Kong・[[Hui Li]](責任著者、[[Xidian University]] / Yunxi Technology兼任)ほか([[Xidian University]])による、時系列クエリのセマンティクスを形式的に定義(Semantic Meta/Series/Metric, Cache Answerable)しグラフ+スキップリストのセマンティックインデックスへ落とし込む前段セマンティックキャッシュ層 STsCache の提案論文(PVLDB Vol.18 No.9, pp.2964-2977, 2025)。append-only性を活かしキャッシュ一貫性を不要化しつつTSDB本体を変更しない設計で、InfluxDB/TimescaleDB比でスループット4.8-10.8倍を達成した。既存concept [[時系列データベース]] にTSDB内部最適化の7軸とは独立な「前段セマンティックキャッシュ層」という第8の軸を追記し、[[セマンティックキャッシュ]](新規)にBSCache/TSCache/STsCacheの実装トレードオフ系譜を記載した。図表5枚をPyMuPDFクロップで埋め込んだ。
## [2026-07-22] ingest-paper | How Far Can Root Cause Analysis Go on Real-World Telemetry Data?
- Source: `.raw/papers/arxiv-2607.13548.pdf`(https://arxiv.org/abs/2607.13548、arXiv 公式 PDF を `scripts/fetch-paper-pdf.sh` で取得)
- Summary: [[@2026__arXiv__How Far Can Root Cause Analysis Go on Real-World Telemetry Data?]]
- Pages created: [[@2026__arXiv__How Far Can Root Cause Analysis Go on Real-World Telemetry Data?]], [[QPIAI]], [[Athira Gopal]], [[Ashwanth Krishnan]], [[RCLAgent]]
- Pages updated: [[OpenRCA]], [[GALA]], [[LLMによる根本原因分析]], [[RCA評価設計]], [[因果推論ベースRCA]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[Athira Gopal]]・[[Ashwanth Krishnan]]([[QPIAI]] India)による、OpenRCAベンチマーク上での根本原因分析の限界を検証した論文(arXiv投稿 2026-07-15)。古典的因果発見手法(Granger/PC/FCI/LiNGAM/NTLR)がOpenRCAの30タイムスタンプという極小サンプル設定でAccuracy@1・@10=0に完全崩壊し、既存LLMマルチエージェント系GALA・RCLAgentも再評価でAccuracy@1=2.56%・0.00%と低迷する中、reverse reasoning agentによる誤り分析でRCA失敗の大半が証拠不足ではなく推論失敗(Reasoning Gap)に起因することを定量的に示した。自動化ルールマイニングもLLMの新しい役割候補として提示した。既存concept [[LLMによる根本原因分析]] にreverse reasoning agentによる「後付け診断」を新カテゴリとして追加し、SREcon26(11.34%)とGALA・RCLAgentのOpenRCA再評価(2.56%・0.00%)が同一パターンの独立実証であることを追記した。図1点(アーキテクチャ)を埋め込んだ。
## [2026-07-22] ingest-paper | DAG-FM: A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms
- Source: `.raw/papers/arxiv-2607.11510.pdf`(https://arxiv.org/abs/2607.11510、arXiv 公式 PDF を `scripts/fetch-paper-pdf.sh` で取得)
- Summary: [[@2026__arXiv__DAG-FM - A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms]]
- Pages created: [[@2026__arXiv__DAG-FM - A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms]], [[Kun Kuang]], [[Peng Cui]]
- Pages updated: [[Zhejiang University]], [[Tsinghua University]], [[因果発見]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Yikang Chen・Zhengkang Guan・Haoyuan Qian・Yi Yang([[Zhejiang University]])・[[Peng Cui]]([[Tsinghua University]])・[[Kun Kuang]](責任著者、[[Zhejiang University]])による、事前分布空間を4つの識別可能なFCM族(LiNGAM/ANM/HNM/PNL)に制限する理論的設計条件と、葉ノード予測→親ノード予測の2段階自己回帰分解+Mixture-of-Leaf-Expertsを組み合わせた因果発見基盤モデル DAG-FM の提案論文(arXiv投稿 2026-07-13)。従来のアモータイズド因果発見手法(AVICI等)が欠いていたDAG識別可能性の理論的保証を、大規模・高次元データへのスケーラビリティを保ったまま実現した。既存concept [[因果発見]] に「5. アモータイズド因果発見」という系統を新規追加し、DirectLiNGAMの逐次的順序決定とDAG-FMの葉/親ノード分解が設計思想として収斂している点を追記した。図1点(アーキテクチャ)を埋め込んだ。Causal Chamberデータセットの変数数表記に本文とTable 3ヘッダで不一致があり source ページに注記した。
## [2026-07-21] ingest-paper | Understanding Reasoning from Pretraining to Post-Training
- Source: `.raw/papers/arxiv-2607.16097.pdf`(https://arxiv.org/abs/2607.16097、arXiv 公式 PDF を `scripts/fetch-paper-pdf.sh` で取得。書誌情報は arXiv abs/HTML ページで補完)
- Summary: [[@2026__arXiv__Understanding Reasoning from Pretraining to Post-Training]]
- Pages created: [[@2026__arXiv__Understanding Reasoning from Pretraining to Post-Training]], [[Jingyan Shen]], [[Ang Li]], [[Salman Rahman]], [[Yifan Sun]], [[Micah Goldblum]], [[Matus Telgarsky]], [[Pavel Izmailov]], [[Modal Labs]], [[University of California, Los Angeles]]
- Pages updated: [[New York University]], [[University of Illinois Urbana-Champaign]], [[Columbia University]], [[強化学習スケーリング]], [[検証可能報酬による強化学習]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[Jingyan Shen]]・[[Ang Li]](対応著者)ほか([[New York University]]・[[Modal Labs]]・[[University of California, Los Angeles]]・[[University of Illinois Urbana-Champaign]]・[[Columbia University]])による、チェスパズルを制御可能なテストベッドとして事前学習からRL事後学習までのスケーリング則を定量分析した論文(arXiv投稿 2026-07-17)。事前学習・SFT(合成推論トレース)・GRPOベースの検証可能報酬RLという3段パイプラインをチェスドメインに構築し、事前学習の損失・投入トークン数からRL報酬曲線の切片(事前学習の質)と傾き(RL計算量の効率)を予測する結合スケーリング則 `R(CRL,N,T) = f(Lpt(N,T)) + g(N,T)(log10 CRL − log10 Cref)` を導出した。難易度ビン別の分析で、RLによるポリシー変化を Ground-truth amplification(既存正解の増幅)・Tail discovery(事前学習時点で低確率だった正解の発見)・Wrong-mode amplification(誤った手の誤増幅)の3categoryに分類し、訓練ステップごとの変化を定量的に追跡した。既存concept [[強化学習スケーリング]] に、事前学習投資とRL投資の最適配分という既存の未解決の問いへの部分的回答として結合スケーリング則の知見を、[[検証可能報酬による強化学習]] にポリシー変化の3category分類という知見を横断的知見として追記した。図5点(Figure 2・3・5・21・22: 事前学習損失と報酬の関係、結合スケーリング則の予測精度、ポリシー変化3categoryの難易度ビン別分析、ハードパズルでのポリシー進化、CoT進化メトリクス)を埋め込んだ。
## [2026-07-21] ingest-paper | Real-Time Incident Prediction for Online Service Systems
- Source: `.raw/papers/ESEC-FSE2020-RealTimeIncidentPrediction.pdf`(https://netman.aiops.org/wp-content/uploads/2020/09/赵能文ESEC-2020.pdf、netman.aiops.org 公式ホスティングの PDF を `scripts/fetch-paper-pdf.sh` で取得。書誌情報は PDF 本文の ACM copyright block(DOI 10.1145/3368089.3409672)から確認)
- Summary: [[@2020__ESEC-FSE__Real-Time Incident Prediction for Online Service Systems]]
- Pages created: [[@2020__ESEC-FSE__Real-Time Incident Prediction for Online Service Systems]], [[Zhou Wang]], [[Xiao Peng]], [[Yong Wu]], [[Gang Wang]], [[Fang Zhou]], [[Zhen Feng]], [[China EverBright Bank]]
- Pages updated: [[Nengwen Zhao]], [[Junjie Chen]], [[Dan Pei]], [[Xiaohui Nie]], [[Kaixin Sui]], [[Wenchi Zhang]], [[BizSeer]], [[Tsinghua University]], [[Tianjin University]], [[障害予測]], [[AirAlert]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[Nengwen Zhao]]・[[Junjie Chen]](対応著者)ほか([[Tsinghua University]]; BNRist・[[Tianjin University]]・[[BizSeer]]・[[China EverBright Bank]])による、アラートデータのみからリアルタイムにインシデントを予測する手法 eWarn の提案論文(ESEC/FSE '20)。LDA トピック分布によるテキスト特徴+統計特徴を multi-instance learning(クラスタリングでノイズインスタンスに小さい重みを付与)で集約し、XGBoost+SMOTE で二値分類、LIME で解釈可能レポートを生成する4段パイプライン。大手商業銀行の11実サービスシステムで平均F1 0.82を達成し、AirAlert(0.51)・TF-IDF-LSTM(0.60)・銀行の現行実務FP-Growth(0.10)を上回った。MIL除去で平均F1が0.66に低下(約20%改善に寄与)、LDAはTextCNN(0.48)・FastText(0.51)という2つのニューラル手法を明確に上回った——アラート文はドメイン固有・半構造化の短文でニューラル手法の大規模コーパス依存に不向きなため。2つの大手商業銀行(A・B)への本番デプロイと4件の成功事例(スロー SQL・fullGC・急激な負荷・スケジュールタスク)を報告し、予兆のない突発的インシデントは予測困難という限界も自己申告している。既存concept [[障害予測]] に、eWarn が AirAlert を独立に追試して性能崩壊(Microsoft クラウドF1 53.92-88.78%→銀行ドメインF1 0.51)を実証した知見、LDA vs ニューラル手法の逆説、LIME 説明の診断転用という3つの横断的知見と2つの未解決の問いを追記した。[[AirAlert]] にも eWarn による追試結果とノイズ対処設計(特徴選択 vs 特徴集約)の対比を追記した。図は全てベクター描画(埋め込みラスター画像13枚中12枚は装飾アイコン)のため PyMuPDF のキャプション座標クロップで Figure 1-6 の計6枚を抽出した。著者所属の重複(Xiao Peng・Gang Wang・Yong Wu・Fang Zhou・Zhen Feng が全員 China EverBright Bank)から、論文が二重盲検のため匿名化した「bank A」は China EverBright Bank である可能性が高いと推定した(本文には明記なし)。
## [2026-07-21] ingest-slides | AIインフラ時代のデータセンター内光配線の実践知 ~高密度実装の課題と解決策~
- Source: `.raw/slides/2026__JANOG58__DC-Optical-Cabling/2026__JANOG58__DC-Optical-Cabling.pdf`(https://www.janog.gr.jp/meeting/janog58/pr-dc-optical-cabling/、JANOG58 公式ページから PDF を取得)
- Visual pages: `.raw/slides/2026__JANOG58__DC-Optical-Cabling/pages/`(全53ページ)
- Media: none(transcript なし)
- Summary: [[@2026__JANOG58__AIインフラ時代のデータセンター内光配線の実践知]]
- Pages created: [[井上喬視]], [[菊地秀夫]], [[株式会社フジクラ]], [[TWCCパートナーズ合同会社]], [[エクストリーク株式会社]], [[データセンター内光配線設計]], [[光トランシーバー電力方式]], [[光ファイバーシャフル配線]]
- Pages updated: [[SAKURA Internet]], [[SAKURAONE]], [[OpenAI]], [[MRC]], [[SRv6]], [[マルチプレーンClosトポロジ]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[井上喬視]]([[SAKURA Internet]])・[[菊地秀夫]]([[TWCCパートナーズ合同会社]]代表、元[[株式会社フジクラ]])による、AIインフラ向けデータセンター内光配線の実践知に関するJANOG58発表(共催: SAKURA Internet・[[エクストリーク株式会社]])。さくらONE構成(H100 800GPU)、コンテナ型DC第1弾([[SAKURAONE]] 2025年6月、H200約1000基)・第2弾(2026年2月、B200約1100基、ISC2026 TOP500世界63位)を実例に、光ケーブル細径多心化(12心→16心間欠固定リボン)・BASE-8/12/16/24 MPOコネクタ規格・Method A/B/C配線方式(→ [[データセンター内光配線設計]])、FRO→LRO→LPO→CPO光トランシーバー電力方式の遷移(→ [[光トランシーバー電力方式]])、[[マルチプレーンClosトポロジ]]をNVIDIA B300世代ConnectX-8で実現する光ファイバーシャフル配線(シャフルBOX/シャフルアッセンブリ、GPUクラスタ規模を4倍に拡張、→ [[光ファイバーシャフル配線]])、VSFF光コネクタ(CS/SN/MDC/SN-MT/MMC)を扱う。[[MRC]]([[OpenAI]]主導、UEC/UET仕様の一部取り込み)・[[SRv6]]ソースルーティング活用にも言及する。既存concept [[MRC]]・[[SRv6]]・[[マルチプレーンClosトポロジ]]に業界複数ベンダー連携の文脈での再確認と、論理プレーン分割(NIC/ソフトウェア層)と光ファイバーシャフル配線(物理配線層)の区別を横断的知見として追記した。
## [2026-07-21] ingest-slides | Rack-Scale GPUサーバーのNW設計と運用までの苦悩
- Source: `.raw/slides/janog58-rack-scale-gpu/janog58-rack-scale-gpu.pdf`(https://www.janog.gr.jp/meeting/janog58/pr-rack-scale-gpu/、JANOG58 公式ページから PDF を取得)
- Visual pages: `.raw/slides/janog58-rack-scale-gpu/pages/`(全56ページ)
- Media: none(transcript なし)
- Summary: [[@2026__JANOG58__Rack-Scale GPUサーバーのNW設計と運用までの苦悩]]
- Pages created: [[ソフトバンク株式会社]], [[内田泰広]], [[張朝程]]
- Pages updated: [[AIデータセンタートポロジ]], [[GPUクラスタ運用]], [[wiki/index.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[ソフトバンク株式会社]]の[[内田泰広]]・[[張朝程]]による、NVIDIA GB200 NVL72 Rack-Scale GPU サーバー基盤の NW 設計・運用に関する JANOG58(松山)発表。Compute Fabric(GPU間 Scale-Out、RoCEv2、BGP unnumbered + W-ECMP)・Converged Fabric(Inband + Storage)・OOB Fabric(Facility 監視・NVSwitch 管理)の3種の Fabric 分離設計を実運用視点で報告し、クローズドな Compute Fabric の到達性冗長化に Bonus Port または Underlay Network(BGP Multipath)を用いる工夫、Scalable Unit(SU)という障害ドメイン単位での GPU アサインのトレードオフ、Rack/Tray/GPU 単位のサービス提供形態比較、ケーブリング自動化・Optics の BER/FEC トラブルシュート・AEC 採用・液冷トレイ交換運用までの物理層の苦労を扱う。既存concept [[AIデータセンタートポロジ]] に理論的スケールアップ/スケールアウト二層構造が実運用でどう3 Fabric 分離として現れるかを、[[GPUクラスタ運用]] に Optics 障害対応の予測・事後診断・回避の三段構造と液冷トレイ交換の物理的復旧手順を横断的知見として追記した。
## [2026-07-21] ingest-slides | ネットワーク監視の自動化はどこまでできるのか? -Apache Airflowによるアラート対応基盤-
- Source: `.raw/slides/janog58-pr-auto-nw-monitoring/janog58-pr-auto-nw-monitoring.pdf`(https://www.janog.gr.jp/meeting/janog58/pr-auto-nw-monitoring/、JANOG58 公式ページから PDF を取得。WebFetch で公式ページのタイトル・登壇者・所属・日時を裏取り)
- Visual pages: `.raw/slides/janog58-pr-auto-nw-monitoring/pages/`(全59ページ)
- Media: none(transcript なし)
- Summary: [[@2026__JANOG58__ネットワーク監視の自動化はどこまでできるのか - Apache Airflowによるアラート対応基盤]]
- Pages created: [[上岡 輔乃]], [[Apache Airflow]], [[oyakata]], [[NetBox]]
- Pages updated: [[LINE株式会社]], [[ワークフロー自動化]], [[アラート集約]], [[ネットワーク監視]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[LINE株式会社|LINEヤフー株式会社]]の [[上岡 輔乃]] による、22,000台以上のデータセンターネットワークにおけるアラート一次対応の人手ボトルネックに対し、汎用ワークフローランナー [[Apache Airflow]] を Operator 単位の分業モデルで共通基盤化し、Airflow 単体では不足するアラート駆動起動・種別紐付け・重複排除を内製 API [[oyakata]] で補完する設計を報告した発表(JANOG58, 2026-07-15)。[[NetBox]] 連携による `{hostname}:{interface}` タグベースの重複排除、ワークフロー内 LLM Agent 組み込みパターン(関連アラート判定・アラート分類・専門家調査)を含み、複数 NW チームへの本番導入でアラート一次対応の90%以上を自動対応へ移行した。自動化の成熟が運用知見の継承を難しくするというトレードオフも指摘する。既存concept [[ワークフロー自動化]] に汎用オーケストレーションツールの分業モデルという産業実装パターンを、[[アラート集約]] に NetBox タグベース重複排除という第4カテゴリの手法を、[[ネットワーク監視]] に監視データソース統合研究群と対応自動化の接続点を追記した。
## [2026-07-21] ingest-paper | BTrDB: Optimizing Storage System Design for Timeseries Processing
- Source: `.raw/papers/fast16-papers-andersen.pdf`(https://www.usenix.org/system/files/conference/fast16/fast16-papers-andersen.pdf、USENIX 公式 PDF を `scripts/fetch-paper-pdf.sh` で取得。会議ページ https://www.usenix.org/conference/fast16/technical-sessions/presentation/andersen は WebFetch 403 のためブラウザ UA 付き curl でメタデータ・abstract を補完)
- Summary: [[@2016__FAST__BTrDB - Optimizing Storage System Design for Timeseries Processing]]
- Pages created: [[@2016__FAST__BTrDB - Optimizing Storage System Design for Timeseries Processing]], [[Michael P Andersen]], [[David E. Culler]], [[BTrDB]]
- Pages updated: [[University of California, Berkeley]], [[時系列データベース]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: [[Michael P Andersen]]・[[David E. Culler]]([[University of California, Berkeley]])による、送電網マイクロシンクロフェーザ(uPMU)向け時系列データベース BTrDB の提案論文(FAST '16、pp.39-52)。時間区分・バージョン注釈付き copy-on-write の k-ary ツリーがストレージとインデックスを一体化し、内部ノードに統計サマリ(min/mean/max/count)を埋め込むことでリーフ更新のコピーに無償で相乗りする形の対数時間統計クエリを実現する。バージョン注釈付きエッジによる ComputeDiff() は下流の distillation パイプラインにストリームあたり8バイトの状態のみで変更範囲を追跡させる一貫性保証を提供する。4ノード EC2 クラスタで挿入53.35M/秒・クエリ119.87M/秒、圧縮率2.9x、本番デプロイで823系列・2.1兆データ点の実績を報告する。ナノ秒精度タイムスタンプのジッタに対しては delta-delta coding + 固定 Huffman 木という Gorilla とは異なる圧縮方式を採る。既存concept [[時系列データベース]] に、ストレージ構造そのものをインデックス化する設計(Monarch の FHI・ByteSeries の Compressed Inverted Index との対比)・統計サマリの無償埋め込み(Lindorm TSDB の別演算スケジュール方式との対比)・copy-on-write による厳密な整合性保証(Monarch/Gorilla の可用性優先路線との対比)・ComputeDiff による派生データ一貫性の第7の軸・ナノ秒精度向け圧縮(Gorilla との対比)という5つの横断的知見と4つの未解決の問いを追記した。図は全てベクター描画(埋め込みラスター画像12枚はいずれも USENIX 表紙の装飾グラフィックで図としては使えず、page-render画像は生成していない)のため PyMuPDF のキャプション座標クロップで Figure 1・2・3・4・6・7 の計6枚を抽出した(Figure 5・8・9・Table 1-3 は非埋め込み)。
## [2026-07-21] ingest-paper | Don't Predict, Prioritize: Rethinking GPU Reliability Assessment
- Source: `.raw/papers/arxiv-2607.15115.pdf`(https://arxiv.org/pdf/2607.15115、arXiv 公式 PDF を `scripts/fetch-paper-pdf.sh` で取得、書誌情報は arXiv abs ページを WebFetch で補完)
- Summary: [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]]
- Pages created: [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]], [[Difeng Ma]], [[Yuanwei Lu]], [[Quan Zhou]], [[Daxin Jiang]], [[Jingjing Li]]
- Pages updated: [[Changhua Pei]], [[Gaogang Xie]], [[Zexin Wang]], [[Yibo Zhu]], [[Dan Pei]], [[Chinese Academy of Sciences]], [[University of Chinese Academy of Sciences]], [[Tsinghua University]], [[StepFun]], [[障害予測]], [[GPUレジリエンス]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Difeng Ma・[[Changhua Pei]]ほか(Computer Network Information Center, [[Chinese Academy of Sciences]] / [[University of Chinese Academy of Sciences]] / [[StepFun]] / [[Tsinghua University]])による、GPU 障害予測の系統的限界実証とリスクランキングへの再定式化論文(KDD '26 V.2、arXiv 2026-07-16)。5モデル横断(XGBoost・CNN・LSTM・Transformer・MoE)の時系列予測実験で、8時間観測窓での最良モデルでもF1最大0.4837にとどまることを示し、Kendall相関・SNR分析・分布比較の3種の統計分析で原因をテレメトリの性質(ワークロード依存の非定常性・信号拡散・分布重複)に帰属させた。一方でホスト単位の障害はPareto分布に集中する(上位10%未満のホストが critical 障害の30%超を占め、四半期を通じ24〜33%で安定、χ²検定p≪10^-10)ことを発見し、これを軽量MLPベースのLearning-to-Rankモデル HeaRank でリスクランキングタスクへ再定式化した。本番クラスタでAUC 0.834・NDCG@5=0.427(LightGBM Ranker比38%改善)を達成し、6ヶ月間の本番展開(2025-07〜2026-01)で上位5%リスクノードに障害の64%が集中(既存Health Scoreシステムは21%)、月あたり約5万ドルのGPU時間節約を試算した。既存concept [[障害予測]] に「精密な時間予測が破綻する領域ではランキングへの再定式化が代替パラダイムになる」という中心的知見(Salfner+ 2010の時間軸パラメータがランキングでは逆機能する点も含む)を、[[GPUレジリエンス]] にホスト単位Pareto集中とコンポーネント単位弱点分布の粒度対応・リスクランキングという運用対処の第3経路を追記した。図7点(Kendall相関ワークロード比較・SNRボックスプロット・Paretoホスト障害密度・アブレーション・スケジューリングアーキテクチャ・CDF比較・テレメトリパイプライン)を選定して埋め込んだ(埋め込みラスター画像13枚から選定、page-render画像12枚は削除)。CNIC/CAS著者(Changhua Pei・Gaogang Xie・Zexin Wang)はCOMET・UModel等の既存AIOps研究と同一グループ、StepFunのYibo ZhuはTiresias(GPUクラスタスケジューリング)・DistServe(LLM推論)に続く3つ目の研究軸として参加。
## [2026-07-21] ingest | Tales from the Lunar Module Guidance Computer
- Source: `.raw/articles/tales-2026-07-21.md`(https://www.doneyles.com/LM/Tales.html、WebFetch 経由の defuddle 直接パースが `Error: aborted` で失敗したためブラウザ UA 付き curl で HTML を取得後 defuddle parse でローカルファイルとしてMarkdown化)
- Summary: [[@2004__AAS__Tales from the Lunar Module Guidance Computer]]
- Pages created: [[@2004__AAS__Tales from the Lunar Module Guidance Computer]], [[Don Eyles]], [[Allan Klumpp]], [[Hal Laning]], [[Apollo Guidance Computer]], [[MIT Instrumentation Laboratory]], [[優先度駆動リアルタイム実行系]], [[リスタート保護]], [[インターフェース仕様の齟齬による障害]], [[制御ループの安定性とタイムラグ補償]]
- Pages updated: [[Margaret Hamilton]], [[べき等性]], [[チェックポイント]], [[根本原因分析]], [[ポストモーテム]], [[wiki/index.md]], [[wiki/hot.md]]
- Key insight: Apollo Lunar Module Guidance Computer のフライトソフトウェアエンジニア [[Don Eyles]] による回顧録(AAS 04-064、2004年)。Apollo 11 の 1201/1202 プログラムアラームの根本原因が、ランデブーレーダーと ATCA 間の ICD が「周波数同期」のみを規定し「位相同期」を規定しなかったこと(→ [[インターフェース仕様の齟齬による障害]])にあると当事者証言で特定し、当時の報道の「コンピュータエラー」という表層的帰属に異議を唱える。[[Hal Laning]] 設計の優先度駆動プリエンプティブ Executive/Waitlist(→ [[優先度駆動リアルタイム実行系]])と、waypoint によるリスタート保護(→ [[リスタート保護]])が、資源枯渇時にも致命的崩壊を招かず、意図せぬ耐障害機構として機能したことを詳述する。スロットル振動「キャッスレーション」問題では、ICD記載のタイムラグ値(0.3秒)が既に陳腐化していたにもかかわらず、著者の経験的判断による過小補償(0.2秒)が結果的に安定側に働き着陸を救っていた可能性を[[Allan Klumpp]]の事後解析が示す(→ [[制御ループの安定性とタイムラグ補償]])。既存concept [[べき等性]]・[[チェックポイント]]に、動的計装のない環境での手作業waypoint方式という現代の自動最適化とは異なる極の知見を追記し、[[根本原因分析]]・[[ポストモーテム]]に単一原因帰属への異議が現代のSRE文化に半世紀先行していたという知見を追記した。[[Margaret Hamilton]]ページとの間で、Executive設計の個人帰属粒度(組織リーダー vs 個別設計者)に関するcontradiction calloutを両ページに追加。図5点(PGNS構成図・DSKY・ランデブーレーダーインターフェース図・キャッスレーション発見時の手書きアクションアイテムmemo・スロットル振動実測データ)をcurlでダウンロードし埋め込んだ。
## [2026-07-21] ingest-paper | Mach: A Pluggable Metrics Storage Engine for the Age of Observability
- Source: `.raw/papers/p12-solleza.pdf`(https://vldb.org/cidrdb/papers/2022/p12-solleza.pdf、vldb.org cidrdb 公式アーカイブ CIDR 2022 収録論文)
- Summary: [[@2022__CIDR__Mach - A Pluggable Metrics Storage Engine for the Age of Observability]]
- Pages created: [[@2022__CIDR__Mach - A Pluggable Metrics Storage Engine for the Age of Observability]], [[Andrew Crotty]], [[Mach]]
- Pages updated: [[Franco Solleza]], [[Nesime Tatbul]], [[Stan Zdonik]], [[Suman Karumuri]], [[Brown University]], [[Carnegie Mellon University]], [[Slack Technologies]], [[時系列データベース]], [[専用データベースシステム]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]]
- Key insight: [[Franco Solleza]]・[[Andrew Crotty]]・[[Suman Karumuri]]・[[Nesime Tatbul]]・[[Stan Zdonik]]([[Brown University]]・[[Carnegie Mellon University]]・[[Slack Technologies]]・Intel Labs・MIT)によるメトリクス専用プラガブルストレージエンジン Mach の提案論文(CIDR 2022)。複数の独立ライタースレッドが疎結合(mutex 協調なし)に振る舞うアーキテクチャで、mutex 獲得だけで Prometheus の書き込みオーバーヘッドの約25%を占めるという観察に基づき協調オーバーヘッド自体を除去した。追記主体の高速パス・アクティブセグメント単位の一括圧縮・短く決定的なスナップショット機構と組み合わせ、予備実験(Rust実装、Prometheus/InfluxDB/RocksDB比較)で単一ノード最大480M f64/秒の書き込み(既存最良比約10倍)・100万データソースまでのスケーリング・最大3倍の読み取りスループットを達成した。既存concept [[時系列データベース]] に「協調そのものの除去」という取り込み最適化の第6の軸と「書き込みが読み取りをブロックしうる」非対称トレードオフの知見を、[[専用データベースシステム]] に「除去の対象が機能ではなく同期プリミティブ自体になりうる」という知見を追記した。著者4名(Solleza・Tatbul・Zdonik・Karumuri)は既存 [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]] の共著者と同一人物であり、Slack の2020年5月12日アウテージ・規模感(4Bソース/日・12Mサンプル/秒)も同論文と同じ事実を再引用する形で確認された(矛盾なし)。図は全8枚が埋め込みラスター画像(データ例・時間空間次元図・アーキテクチャ図・書き込み/読み取りパス図2枚・スループットグラフ3枚)ですべて再利用可能だったため PyMuPDF クロップは不要だった。
## [2026-07-20] ingest-paper | Dremel: Interactive Analysis of Web-Scale Datasets
- Source: `.raw/papers/dremel-vldb2010.pdf`(https://storage.googleapis.com/gweb-research2023-media/pubtools/3293.pdf、research.google公式ページ https://research.google/pubs/dremel-interactive-analysis-of-web-scale-datasets-2/ 経由でPDFリンクを取得)
- Summary: [[@2010__VLDB__Dremel - Interactive Analysis of Web-Scale Datasets]]
- Pages created: [[@2010__VLDB__Dremel - Interactive Analysis of Web-Scale Datasets]], [[Sergey Melnik]], [[Andrey Gubarev]], [[Jing Jing Long]], [[Geoffrey Romer]], [[Shiva Shivakumar]], [[Matt Tolton]], [[Theo Vassilakis]], [[MapReduce]], [[Protocol Buffers]], [[ネスト型カラムナストレージ]]
- Pages updated: [[Google]], [[列指向OLAPデータベース]], [[並列データベース]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Sergey Melnikほか([[Google]], Inc.)による対話的クエリシステムDremelの提案論文(VLDB 2010)。ネストレコードを損失なくカラムへ分解・再構成するrepetition level / definition levelという列指向ストレージ表現と、ウェブ検索エンジン由来の多段サービス木を組み合わせ、兆行規模テーブルへの集計クエリを数秒で実行する。MapReduceを置き換えず補完する設計思想を明示し、3000ノード規模の実験でMR-on-recordsに対し87TBに対し約0.5TBしか読まず実行時間を2桁短縮する(時間→分→秒)。新規concept [[ネスト型カラムナストレージ]] を作成し、既存concept [[列指向OLAPデータベース]] に「ネストデータへの列指向拡張は2010年に一度到達しており、2016年のSnowflake VARIANT型はリレーショナルDBMS側からの再到達である」という横断的知見を、[[並列データベース]] に「ウェブ検索由来の多段サービス木がDeWitt/Grayの想定しなかった第三の並列化手段として応用された」という横断的知見を追記した。奇しくも同日並行してingestされた [[@2004__OSDI__MapReduce - Simplified Data Processing on Large Clusters]] が、本論文の言うMapReduceの実体として既に本wikiに存在していたため、entity [[MapReduce]] は両論文を横断参照する形で作成した。図はすべてベクター描画(埋め込みラスター画像87枚はいずれもフィールド装飾用の微小フラグメントで図全体としては使えず)のためPyMuPDFのキャプション座標クロップでFigure 1・2・3・7・9・10の計6枚を抽出した。
## [2026-07-20] ingest-paper | MapReduce: Simplified Data Processing on Large Clusters
- Source: `.raw/papers/dean.pdf`(https://www.usenix.org/legacy/events/osdi04/tech/full_papers/dean/dean.pdf、USENIX 公式アーカイブ。会議ページ https://www.usenix.org/conference/osdi-04/mapreduce-simplified-data-processing-large-clusters は WebFetch 403 のためブラウザ UA 付き curl でフォールバック取得)
- Summary: [[@2004__OSDI__MapReduce - Simplified Data Processing on Large Clusters]]
- Pages created: [[@2004__OSDI__MapReduce - Simplified Data Processing on Large Clusters]]
- Pages updated: [[Jeffrey Dean]], [[Sanjay Ghemawat]], [[Google]], [[Google File System]], [[タスク並列フレームワーク]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]]
- Key insight: [[Jeffrey Dean]]・[[Sanjay Ghemawat]]([[Google]])による MapReduce 提案論文(OSDI '04)。map/reduce の2関数だけで大規模クラスタ上の並列分散計算を記述できるプログラミングモデルと、master 中央集権スケジューリング・タスク再実行による耐障害性・[[Google File System]] 局所性最適化・straggler 緩和のバックアップタスク機構(sort ベンチマークで無効化すると44%時間増加)を特徴とする耐障害実装を報告する。2004年8月時点で月29,423ジョブ・入力3,288TB規模で本番稼働。既存 concept [[タスク並列フレームワーク]](従来は Ray OSDI 2018 の単一ソースに基づいていた)に、BSP 静的 DAG モデルの起源としての MapReduce と Ray の GCS 分離設計との対比、タスク全体再実行 vs Spark RDD 由来の血統ベース部分再計算という耐障害性戦略の分岐、eager scheduling を発展させたバックアップタスク機構という3つの横断的知見を追加し、複数ソース間の系譜を初めて明示した。図表は全てベクター描画(埋め込みラスター画像0枚)のため PyMuPDF のキャプション座標クロップで Figure 1〜4・Table 1 の計5点を抽出した。
## [2026-07-20] ingest-paper | The Snowflake Elastic Data Warehouse
- Source: `.raw/papers/2026_Unknown_The_Snowflake_Elastic_Data_Warehouse.pdf`(ローカルファイル入力。ファイル名のヒント(2026年・著者不明)は誤りで、本文の copyright 表記・DOI から SIGMOD 2016 論文と確定)
- Summary: [[@2016__SIGMOD__The Snowflake Elastic Data Warehouse]]
- Pages created: [[@2016__SIGMOD__The Snowflake Elastic Data Warehouse]], [[Snowflake Computing]], [[Benoit Dageville]], [[Thierry Cruanes]], [[Marcin Zukowski]]
- Pages updated: [[Amazon Web Services]], [[シェアードナッシング]], [[並列データベース]], [[データパーティショニング]], [[列指向OLAPデータベース]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: ストレージ(S3)とコンピュートを疎結合サービスへ分離する「マルチクラスタ・シェアードデータ・アーキテクチャ」を導入した Snowflake の産業論文。テーブルファイルの不変性を核に Snapshot Isolation・時間旅行・クローン・オンラインアップグレードを単一原理から導出する設計の一貫性が特徴。既存 concept [[シェアードナッシング]]・[[並列データベース]] が保持していた「クラウドネイティブ分離アーキテクチャの分類」という未解決の問いに対し、Snowflake 論文自身は「マルチクラスタ・シェアードデータ」という新語の自称にとどまり学術的な4分類は未確立であることが判明し、両ページの未解決の問いを更新した。図はすべてベクター描画(埋め込みラスター画像0枚)のため PyMuPDF のキャプション座標クロップで Figure 1〜6 を抽出した。
## [2026-07-20] ingest-paper | Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3
- Source: `.raw/papers/shardstore-sosp21.pdf`
- Summary: [[@2021__SOSP__Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3]]
- Pages created: [[@2021__SOSP__Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3]], [[ShardStore]], [[James Bornholt]], [[軽量形式手法]]
- Pages updated: [[Amazon Web Services]], [[LSMツリー]], [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: Amazon S3 の新ストレージノード ShardStore を、実装と同じ言語(Rust)で書く参照モデル + property-based testing + stateless model checking(Loom/Shuttle)で検証する「軽量形式手法」アプローチを新規 concept として定義。ShardStore がshardデータをLSMツリー外のエクステントへ配置し、crash consistencyを宣言的Dependency型でLSMツリーから分離する設計を、既存 concept [[LSMツリー]] に Bigtable/Cassandra との対比で追記した。Figure 1(オンディスクレイアウト)・Figure 2(dependencyグラフ)は埋め込みラスター画像0枚のためPyMuPDFのキャプション座標クロップで取得。Figure 3・4(コードリスティング)とFigure 5・6(表)は画像化せず本文中に構造化して転記した。
## [2026-07-20] ingest-paper (重複検知・図版更新) | B-Trees Are Back: Engineering Fast and Pageable Node Layouts
- Source: `/Users/y-tsubouchi/Downloads/2026_Unknown_B_Trees_Back_Engineering_Fast.pdf`(2026-06-14 取り込み済みの `.raw/papers/1-3709664.pdf` と MD5 完全一致・重複)
- Summary: [[@2025__SIGMOD__B-Trees Are Back - Engineering Fast and Pageable Node Layouts]]
- Pages updated: [[@2025__SIGMOD__B-Trees Are Back - Engineering Fast and Pageable Node Layouts]]
- Key insight: 新規 ingest ではなく重複検知(source ページ・entity・concept は既存済み)。ユーザー選択により図版のみ更新: PyMuPDF のキャプション座標クロップで Figure 2・3・4・5(提案手法節)と Figure 1・17(実験結果節)を高解像度・正確なキャプション付きで再取得し、Figure 6(semi/fully dense leaf)・Figure 14(leaf layout 遷移)を新規追加。旧来の汎用キャプション(「〜を示す。」)と低品質画像・未参照の orphan page-render 画像を置き換えた。
## [2026-07-20] ingest-paper | Aurora DSQL: Scalable, Multi-Region OLTP
- Source: `.raw/papers/arxiv-2607.13276.pdf`(https://arxiv.org/abs/2607.13276)
- Summary: [[@2026__arXiv__Aurora DSQL - Scalable, Multi-Region OLTP]]
- Pages created: [[@2026__arXiv__Aurora DSQL - Scalable, Multi-Region OLTP]], [[Aurora DSQL]]
- Pages updated: [[Marc Brooker]], [[Amazon Aurora (Database)]], [[分散SQLデータベース]], [[地理分散SQLデータベース]], [[分散トランザクション]], [[分散コンセンサス回避]], [[クォーラムベースレプリケーション]]
- Key insight: Aurora DSQL は Query Processor・Adjudicator・Journal・Crossbar・Storage に分離した disaggregated アーキテクチャを持ち、MVCC による座標不要読み取りと OCC による書き込みバッファリングを組み合わせ、コミット時のみクロスリージョン座標する設計でマルチリージョン分散 SQL を実現する。Spanner/CockroachDB の悲観的ロック方式・classic Aurora のログ縮小・Aurora Limitless の cross-AZ 限定に続く第4の座標削減系統として位置づけ、複数 Adjudicator 間のコミットプロトコルが「投票のアトミック性」と「コミットのアトミック性」を分離する新パターンであること、Journal 間の2-of-3イレイジャーコーディングがレイテンシ分散と可用性の双方を改善することを5つの既存 concept に横断的知見として追記した。図表はいずれもベクター描画(埋め込みラスター画像0枚)のため PyMuPDF のキャプション座標クロップで Figure 1・3・4・6・9・10 を抽出した。
## [2026-07-20] ingest-paper | LLM hallucinations in the wild: Large-scale evidence from non-existent citations
- Source: `.raw/papers/arxiv-2605.07723.pdf`(https://arxiv.org/abs/2605.07723)
- Summary: [[@2026__arXiv__LLM hallucinations in the wild]]
- Pages created: [[@2026__arXiv__LLM hallucinations in the wild]], [[LLMのハルシネーション]], [[Zhenyue Zhao]], [[Yihe Wang]], [[Toby Stuart]], [[Mathijs De Vaan]], [[Paul Ginsparg]], [[Yian Yin]]
- Pages updated: [[Cornell University]], [[University of California, Berkeley]], [[Tsinghua University]], [[@2023__arXiv__GPT-4 Technical Report]]
- Key insight: Cornell University・UCLA・Tsinghua University・UC Berkeley の研究チームが、学術引用を検証可能な対象として使い、arXiv・bioRxiv・SSRN・PubMed Central の参照1億1,100万件を監査し、LLM 登場前後の unmatched 引用率の差分から2025年単年で146,932件のハルシネーション引用を population スケールで推定した。汚染は少数の重度汚染論文への集中ではなく多数の論文への薄い拡散パターンであり、arXiv モデレーションはハルシネーション引用の78.8%を通過させ、bioRxiv→PMC 出版移行後も85.3%が残存するなど、既存の品質管理が拡大に追いついていないことを示した。
## [2026-07-20] ingest-slides | 30分でわかるデータ指向アプリケーションデザイン (Data Engineering Study #18)
- Source: `https://speakerdeck.com/xerial/30fen-dewakarudetazhi-xiang-apurikesiyondezain-data-engineering-study-number-18`(全37ページ)
- Visual pages: `.raw/slides/2023__DataEngineeringStudy__30bun-de-wakaru-data-shikou-application-design/pages/`
- Media: none
- Summary: [[@2023__DataEngineeringStudy__30分でわかるデータ指向アプリケーションデザイン]]
- Pages created: [[@2023__DataEngineeringStudy__30分でわかるデータ指向アプリケーションデザイン]], [[Taro L. Saito]], [[導出データ]]
- Pages updated: [[Amazon Aurora (Database)]], [[DuckDB]], [[分散トランザクション]]
- Key insight: 『データ指向アプリケーションデザイン』監訳者 Taro L. Saito による、原著出版から5年間の発展を原著の枠組みに沿って再構成する講演。classic Amazon Aurora(SIGMOD 2018)の gossip プロトコルによる2PC回避を「プロトコル最適化ではなくアーキテクチャによる協調回避」の系統として[[分散トランザクション]]に位置づけ、RDBMSの「テーブル」がスナップショットから導出データ(derived data)へ意味を変えてきた変遷を新規concept [[導出データ]] として立てた。
- Note: wiki-ingest-slides スキルのヘルパースクリプト(`scripts/fetch-slide-deck.sh` 等)がリポジトリに存在しなかったため、SpeakerDeck ページから PDF リンクを手動抽出し、`pdftotext`/`pdftoppm` を直接実行して同等の処理を行った。
## [2026-07-20] ingest-slides | Query Rewriting and Optimization (DiDi Course #8)
- Source: `https://blobs.duckdb.org/slides/DiDi-08.pdf`(全36ページ)
- Visual pages: `.raw/slides/DiDi-08-Query-Rewriting-Optimization/pages/`
- Media: none
- Summary: [[@2026__DiDi__Query Rewriting and Optimization]]
- Pages created: [[@2026__DiDi__Query Rewriting and Optimization]], [[クエリオプティマイザ]], [[結合順序最適化]], [[クエリ非相関化]]
- Pages updated: [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]]
- Key insight: DuckDBのクエリオプティマイザは30以上の最適化パスをfixpoint反復なしの一方向で適用し、結合順序探索の組み合わせ爆発(カタラン数)にはMoerkotte & NeumannのDPhyp動的計画法、相関サブクエリにはNeumann & KemperのUnnesting Arbitrary Queriesに基づく系統的なDEPENDENT_JOIN書き換え(クエリ非相関化)を採用する。
## [2026-07-20] ingest-slides | Vectorized Query Execution (DiDi Course #7)
- Source: `https://blobs.duckdb.org/slides/DiDi-07.pdf`(全31ページ)
- Visual pages: `.raw/slides/DiDi-07/pages/`
- Media: none
- Summary: [[@2026__DiDi__Vectorized Query Execution]]
- Pages created: [[@2026__DiDi__Vectorized Query Execution]]
- Pages updated: [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]], [[SIMDベクトル処理]], [[分岐予測]], [[パイプライン処理]]
- Key insight: DuckDBはベクトル演算の型×物理表現の全組み合わせに対するsuper-specificなコード生成を理想としつつ、組み合わせ爆発を避けるためunified representation(data vector + selection vector)への変換とC++テンプレートによるコンパイル時コード生成という2段構えを取る。この設計判断はDuckDB 1.4の実ソースコード呼び出し連鎖(`ExpressionExecutor`→`VectorOperations::Equals`→`BinaryExecutor::ExecuteGenericLoop`)として具体的に追跡できる。
## [2026-07-20] ingest-slides | Query Execution Plans and Pipelining (DiDi Course #6)
- Source: `https://blobs.duckdb.org/slides/DiDi-06.pdf`(全17ページ)
- Visual pages: `.raw/slides/DiDi-06/pages/`
- Media: none
- Summary: [[@2026__DiDi__Query Execution Plans and Pipelining]]
- Pages created: [[@2026__DiDi__Query Execution Plans and Pipelining]], [[クエリ実行プラン]], [[プッシュ型パイプライン実行]]
- Pages updated: [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]], [[並列データベース]]
- Key insight: DeWitt/Gray(1992)のパイプライン並列化・パーティション並列化という分類が、DuckDBでは単一プロセスDBMSの演算子レベル実装(自明並列演算子の連なり+シンクのSink/Combine/Finalize3フェーズ)として具体化されており、skew回避は動的負荷分散ではなく設計選択(モーセル粒度・パイプライン分解)で行われる。埋め込み画像の一部(page-016→page-017)にページ対応のずれがあり、出典検査で発見・修正した。
## [2026-07-20] ingest-slides | The ART of Indexing (DiDi Course #5)
- Source: `https://blobs.duckdb.org/slides/DiDi-05.pdf`(全22ページ)
- Visual pages: `.raw/slides/didi-05-the-art-of-indexing/pages/`
- Media: none
- Summary: [[@2026__DiDi__The ART of Indexing]]
- Pages created: [[@2026__DiDi__The ART of Indexing]], [[Adaptive Radix Tree]], [[Zonemap]]
- Pages updated: [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]], [[B-Tree]]
- Key insight: ARTとZonemapは「全行スキャンを避ける」という同一課題への意図的に異なる解決である。Zonemapは常時有効・行グループ粒度のほぼ無コストなスキップフィルタであり、ARTはオプトイン・行粒度で実メモリ/保守コストを伴う構造で、DuckDBの2階層インデックス設計はどちらか単独では選択性の全域をカバーできないことに起因する。
## [2026-07-20] ingest-slides | Sorting Large Tables (DiDi Course #4)
- Source: `https://blobs.duckdb.org/slides/DiDi-04.pdf`(全11ページ)
- Visual pages: `.raw/slides/didi-04-sorting-large-tables/pages/`
- Media: none
- Summary: [[@2026__DiDi__Sorting Large Tables]]
- Pages created: [[@2026__DiDi__Sorting Large Tables]], [[外部マージソート]], [[キー正規化]]
- Pages updated: [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]]
- Key insight: DuckDBの二相マージソートはフェーズ➊でキーを固定長へ正規化(`FixedSortKey`構造体)することで、可変長バイト列比較よりも高速な固定長整数比較(`LessThan`)を可能にし、Vergesort/Ska Sort/Pattern-defeating QuickSortを組み合わせて生成したランをフェーズ➋でT-way mergeする。
## [2026-07-20] ingest-slides | Managing Memory + Grouped Aggregation (DiDi Course #3)
- Source: `https://blobs.duckdb.org/slides/DiDi-03.pdf`(全16ページ)
- Visual pages: `.raw/slides/DuckDB-DiDi-03-Memory-GroupedAgg/pages/`
- Media: none
- Summary: [[@2026__DiDi__Managing Memory + Grouped Aggregation]]
- Pages created: [[@2026__DiDi__Managing Memory + Grouped Aggregation]], [[アウトオブコア処理]], [[ハッシュベースグループ集約]]
- Pages updated: [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]]
- Key insight: DuckDBの外部グループ集約は、ページ化中間データ構造をハッシュテーブルエントリの格納形式に採用することで、GROUP BY固有のスピリングロジックを実装せずメモリマネージャの汎用アウトオブコア機構に委譲している。スライドはPhase 2(パーティション単位集約)の説明手前で終わっており、続きは同シリーズの後続回で扱われる可能性が高い。
## [2026-07-20] ingest-slides | The Query Performance Spectrum (DiDi Course #2)
- Source: `https://blobs.duckdb.org/slides/DiDi-02.pdf`
- Visual pages: `.raw/slides/duckdb-didi-02-query-performance-spectrum/pages/`
- Media: none
- Summary: [[@2026__DiDi__The Query Performance Spectrum]]
- Pages created: [[@2026__DiDi__The Query Performance Spectrum]]
- Pages updated: [[Torsten Grust]], [[DuckDB]], [[列指向OLAPデータベース]]
- Key insight: 同一の単純な集約クエリ(TPC-H lineitemのquantity列合計)の実行時間は実装言語・技法だけでawk 1.60秒からC+mmap+マルチスレッド0.04秒まで40倍以上変動し、DuckDBのSQL実装(約0.45秒)はuser時間がreal時間を大きく上回ることから内部並列処理を行っていることが分かる。
## [2026-07-20] ingest-slides | Welcome & Setup (Design and Implementation of DuckDB Internals, Lecture 1)
- Source: `https://blobs.duckdb.org/slides/DiDi-01.pdf`
- Visual pages: `.raw/slides/DiDi-01-Welcome-Setup/pages/`
- Media: none
- Summary: [[@2026__DuckDB__Welcome & Setup (DiDi Course, Lecture 1)]]
- Pages created: [[@2026__DuckDB__Welcome & Setup (DiDi Course, Lecture 1)]], [[Torsten Grust]], [[DuckDB Labs]]
- Pages updated: [[DuckDB]], [[Hannes Mühleisen]], [[Mark Raasveldt]]
- Key insight: Torsten Grust(University of Tübingen)による15週構成の講義シリーズ「Design and Implementation of DuckDB Internals(DiDi)」全体の射程を導入する初回。DuckDBの「zero copy」プロセス内蔵設計と、名称がHannes Mühleisenの飼っていたアヒルWilburに由来することを紹介する。
## [2026-07-20] ingest-paper | DuckDB: an Embeddable Analytical Database
- Source: `.raw/papers/28800.pdf`(SIGMOD '19、4ページ、DOI 10.1145/3299869.3320212)
- Summary: [[@2019__SIGMOD__DuckDB - an Embeddable Analytical Database]]
- Pages created: [[@2019__SIGMOD__DuckDB - an Embeddable Analytical Database]], [[Mark Raasveldt]], [[Hannes Mühleisen]], [[CWI]], [[DuckDB]], [[MonetDBLite]]
- Pages updated: [[列指向OLAPデータベース]]
- Key insight: CWI([[Mark Raasveldt]]・[[Hannes Mühleisen]])によるSIGMOD '19デモンストレーション論文。SQLiteのような組み込みデータベースがOLTP向け設計のためOLAP性能に乏しいという課題認識から、パーサ・コストベースオプティマイザ・ベクトル化解釈実行エンジン・HyPer由来のシリアライザブルMVCC・DataBlocksストレージを組み合わせ、ゼロから組み込み分析用途向けに設計されたデータベースDuckDBを提示する。前身[[MonetDBLite]]の非purpose-built性に起因する課題が開発動機であること、JITコンパイル不採用が移植性優先の判断であることが本文から確認できる。既存concept [[列指向OLAPデータベース]] に、サーバプロセス型(ClickHouse)と組み込み型(DuckDB)という配備形態の違い、組み込み型特有の「結果セット転送コスト」という性能軸を横断的知見として追加した。埋め込みラスター画像は0枚のため図表埋め込みは行っていない。
- Open questions: 組み込み型(DuckDB)とサーバプロセス型(ClickHouse)の列指向OLAPを同一条件で比較した定量評価は存在するか。
## [2026-07-20] ingest-paper | Niyama: Breaking the Silos of LLM Inference Serving
- Source: `.raw/papers/arxiv-2503.22562.pdf`(arXiv:2503.22562、2025-03-28投稿、12ページ)
- Summary: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]]
- Pages created: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]], [[Kanishk Goel]], [[Jayashree Mohan]], [[Nipun Kwatra]], [[Ravi Shreyas Anupindi]], [[Ramachandran Ramjee]], [[Sarathi-Serve]]
- Pages updated: [[Microsoft Research]], [[vLLM]], [[LLM推論]], [[Prefill-Decode分離]], [[LLMサービング管理]]
- Key insight: ユーザーが渡した Microsoft Research publication ページの URL(タイトル "QoServe: Breaking the Silos of LLM Inference Serving"、ASPLOS 2026 採録)は、abstract を照合した結果、arXiv:2503.22562(2025-03-28 投稿時の初出タイトル "Niyama")と同一論文であることを確認し、PDF・図表を取得しやすい arXiv 版を原本として取り込んだ。既存の LLM サービングが interactive/batch サイロに依存する非効率を、[[Sarathi-Serve]] の chunked-prefill スケジューラを拡張した QoS 駆動 co-scheduling(動的チャンキング・EDF/SRPF ハイブリッド優先度付け・積極的降格)で解消するという設計。[[Prefill-Decode分離]] が「分離してそれぞれ最適化する」路線であるのに対し、Niyama は「同居を維持したまま共有インフラでスラックを再配分する」対照的な路線であることを 3 つの concept ページ(LLM推論・Prefill-Decode分離・LLMサービング管理)の横断的知見に記録した。図はベクター描画のグラフ(Figure 7)を PyMuPDF でキャプション座標クロップし、埋め込みラスター画像 3 枚(Figure 1 右図・Figure 3 アーキテクチャ・Figure 6 動的チャンキング図解)と合わせて計 4 枚を source ページに埋め込んだ。
- Open questions: ハイブリッド優先度付けの補間パラメータ α は静的 deployment パラメータとして評価されており、負荷変動に応じた自動調整の有効性は未検証。Niyama(同居 QoS co-scheduling)と DistServe(物理分離)の直接比較評価は論文内に存在しない。
## [2026-07-20] ingest | In-House LLM Serving at Netflix
- Source: `.raw/articles/in-house-llm-serving-at-netflix-2026-07-20.md`(Netflix TechBlog、curl+defuddleでUA 403回避後に取得)
- Summary: [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]]
- Pages created: [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]], [[Triton Inference Server]], [[制約付きデコーディング]]
- Pages updated: [[Netflix]], [[vLLM]], [[TensorRT-LLM]], [[NVIDIA]], [[LLM推論]]
- Key insight: Netflix AI Platformチームによる、既存のJVM統合サービングシステムとModel Scoring Service(MSS)/Triton Inference Server上でLLM推論を内製運用する本番事例。2026年夏の[[TensorRT-LLM]]→[[vLLM]]移行が性能ベンチマークでなく運用適合性(カスタムモデル対応・デバッグ性・研究本番間の移行コスト)を根拠にしていた点、TritonのPython/vLLMバックエンド選択とバージョン整合の運用課題、OpenAI互換APIのresponse_format欠落パッチ、Red-Black/Versionedデプロイ戦略の使い分け、vLLM V0(GIL律速per-request logits processor)→V1(batch-level API)移行によるテイルレイテンシ解消を報告。図3枚(サービングアーキテクチャ全体図、logits processorのV0逐次実行/V1バッチ実行の比較)をWebP形式でダウンロードし埋め込んだ。
- Open questions: TritonのvLLM/Pythonバックエンド共存がカスタムモデル向けエスケープハッチとして今後どの程度必要であり続けるか。V1のBatchUpdateの部分prefill・プリエンプション粒度不足は他推論エンジンのlogits processor相当機構にも一般化する制約か。
## [2026-07-20] ingest-paper | FailSafe: High-performance Resilient Serving
- Source: `.raw/papers/arxiv-2511.14116.pdf`(arXiv:2511.14116、2025-11-18投稿、13ページ)
- Summary: [[@2025__arXiv__FailSafe - High-performance Resilient Serving]]
- Pages created: [[@2025__arXiv__FailSafe - High-performance Resilient Serving]], [[Ziyi Xu]], [[耐障害LLMサービング]]
- Pages updated: [[Zhiqiang Xie]], [[Swapnil Gandhi]], [[Christos Kozyrakis]], [[Stanford University]], [[Shanghai Jiao Tong University]], [[ReCycle]], [[テンソル並列]], [[KVキャッシュ管理]], [[耐障害LLM訓練]]
- Key insight: MLSys 2026 Oral の talk ページ(https://mlsys.org/virtual/2026/oral/3856)から出発し、掲載タイトル "RaidServe" が OpenReview の Cloudflare ブラウザ検証でアクセス不能だったため、arXiv API で著者(Kozyrakis・Xie)横断検索により "FailSafe: High-performance Resilient Serving"(arXiv:2511.14116)を発見して取り込んだ。テンソル並列 LLM サービングの GPU 障害を「復旧オーバーヘッド」(KVCache 再計算・重み再読み込み)と「持続的不均衡オーバーヘッド」(不規則 GPU 数でのアテンションヘッド分割の粒度制約)に分離する枠組みが新規性の核。同じ著者(Swapnil Gandhi・Christos Kozyrakis、Stanford)が SOSP '24 で発表した訓練向け耐障害システム [[ReCycle]] との設計思想対比(訓練の冗長性活用 vs サービングの負荷分配均等化)を新規 concept [[耐障害LLMサービング]] の横断的知見として記録した。図表は pdfimages でページ番号付き埋め込み画像を抽出し、代表7図(Cyclic KVCache Placement・Hybrid Attention・On-demand Weight Recovery・障害注入下スループット・スループットレイテンシ曲線・バランシング寄与分解・復旧レイテンシCDF)を source ページに埋め込んだ。
- Open questions: シングルノード(8 GPU、NVLink内)限定の評価がマルチノード・ノード全体障害へどう一般化するか。MoE のエキスパート並列が TP より部分 GPU 損失に耐性が高いという著者らの指摘(§6)は本論文自身では未検証。
## [2026-07-20] ingest-paper(重複検出・既存ページ更新) | RaidServe: High-performance Resilient Serving
- Source: `.raw/papers/80_RaidServe_High_performance_.pdf`(ローカルPDF、15ページ、MLSys 提出テンプレート組版)
- Summary: [[@2025__arXiv__FailSafe - High-performance Resilient Serving]](新規ページは作成せず、既存ページを更新)
- Pages created: なし
- Pages updated: [[@2025__arXiv__FailSafe - High-performance Resilient Serving]]
- Key insight: ユーザーが投入した PDF `80_RaidServe_High_performance_.pdf` は、2026-07-20 に先行 ingest 済みの arXiv 論文([[@2025__arXiv__FailSafe - High-performance Resilient Serving]]、arXiv:2511.14116)と本文が一字一句一致する同一論文の別ドラフトだった(システム名 RaidServe↔FailSafe の置換と組版差のみ)。PDF 脚注は "Proceedings of the 8th MLSys Conference ... 2025" と主張するが、dblp の MLSys 2025 採択論文リストに本論文は見当たらず、この脚注は提出テンプレートの決まり文句である可能性が高いと判断した。新規 source ページの重複作成を避け、既存ページの frontmatter に本 PDF を追加ソースとして記録し、MLSys 対応関係の注記をこの検証結果で訂正した。
- Open questions: 実際の発表先(MLSys 2026 Oral か、それとも別の査読トラックか)は依然未確定。
## [2026-07-20] ingest | Kimi K3: Open Frontier Intelligence
- Source: `.raw/articles/kimi-k3-2026-07-20.md`(URL: https://www.kimi.com/blog/kimi-k3、kimi.com はサンドボックスのネットワーク許可リスト外のため curl/defuddle での直接取得不可、WebFetch による構造化要約に基づく)
- Summary: [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]]
- Pages created: [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]], [[Kimi K3]], [[Kimi Delta Attention]], [[Attention Residuals]], [[Stable LatentMoE]]
- Pages updated: [[Moonshot AI]], [[Kimi Linear]], [[Mixture-of-Experts]]
- Key insight: [[Moonshot AI]] が 2026-07-17 発表した [[Kimi K3]](総パラメータ 2.8 兆、コンテキスト 100 万トークン)は「世界初のオープンな 3T クラスモデル」を謳う。[[Kimi Linear]](48B、2025-10)で導入された [[Kimi Delta Attention]](KDA、Gated DeltaNet のチャネルワイズゲート改良版)を 512-head MLA と組み合わせて 2.8T 級へスケールアップした点が最大の技術的連続性であり、48B→2.8T という約 58 倍のスケール実証事例になる。[[Stable LatentMoE]](896 エキスパート中 16 活性化、スパーシティ 56)は Kimi K2(384 エキスパート/活性化 8、スパーシティ 48)からの拡張で、NVIDIA の LatentMoE(Nemotron 3)と名称が類似するが機構の異同は不明。Attention Residuals(AttnRes)・Per-Head Muon・Quantile Balancing・Sigmoid Tanh Unit(SiTU)はいずれも記事内で名前のみ言及され、具体的な数式・アルゴリズムは非公開(技術レポートは 2026-07-27 公開予定)。ソース自体が公式ブログ(マーケティング寄り)であり、AI 抽出要約に基づくため一次資料としての厳密性に限界がある点を source ページに明記した。
- Open questions: Stable LatentMoE は NVIDIA の LatentMoE と同一設計か。Attention Residuals の具体的機構。Per-Head Muon と MuonClip/Sharded Muon/NorMuon の関係。Kimi K3 の活性化パラメータ数(記事に総パラメータ 2.8T のみで活性化数の記載なし)。技術レポート公開(2026-07-27 予定)後の裏取りが必須。
## [2026-07-20] ingest-paper | Adversarial dynamical systems characterize when data-driven learning succeeds or fails
- Source: `.raw/papers/2026_Colbrook_Adversarial_dynamical_systems_characterize_when.pdf`(ローカルPDF、18ページ、Nature Communications (2026) 17:5397、DOI: 10.1038/s41467-026-74220-8)
- Summary: [[@2026__NatCommun__Adversarial dynamical systems characterize when data-driven learning succeeds or fails]]
- Pages created: [[@2026__NatCommun__Adversarial dynamical systems characterize when data-driven learning succeeds or fails]], [[Matthew J. Colbrook]], [[Igor Mezić]], [[Alexei Stepanenko]], [[Koopman作用素]], [[可解性複雑性指標]]
- Pages updated: [[UC Santa Barbara]], [[University of Cambridge]](lint-stubから実体化)
- Key insight: University of Cambridge の Matthew J. Colbrook・UC Santa Barbara の Igor Mezić らによる理論研究。Koopman作用素のスペクトルをデータから学習する問題に対し、敵対的力学系(adversarial dynamical systems)を構成することで、測度保存性・連続性の法という2条件が揃わない限りいかなる単一極限アルゴリズム(確率的なものを含む)も50%を超える確率で収束を保証できないという不可能性を証明した。条件が揃えば誤差保証つきの最適アルゴリズムを構成でき、可解性複雑性指標(Solvability Complexity Index, SCI)によって問題の複雑性を上界(収束アルゴリズム)・下界(不可能性)の一致として完全に分類する点が本論文の中心的貢献である。北極海氷濃度データ(1979-2021)に応用し、既存手法EDMDでは大量のスプリアス固有値に埋もれてしまう「隠れた減衰モード」(Barents海・Kara海に集中)を誤差保証つきで検出し、深層学習モデルIceNet・力学モデルSEAS5を大幅に低い計算コスト(ラップトップで1秒未満の訓練)で上回る長期予測を実現した。LLMのhallucinationとの類推(敵対的系のKoopman作用素が連続的周波数分布を持つことと、プロンプト微小変化による出力の発散との類似)も考察として提示されているが、これは厳密な対応関係の証明ではなく推測的な議論として区別して記載した。Koopman作用素・可解性複雑性指標は本wiki初出のconceptで、既存概念との接続は薄い(独立した新規領域)。図はFig.1(手法比較・RAGE定理)・Fig.2(北極海氷隠れモード)・Fig.4(予測ベンチマーク)・Fig.5/Fig.6(SCI分類階層)・Fig.9(敵対的構成の証明アイデア)の6枚を選定して埋め込んだ。
## [2026-07-20] ingest | LLM生成テキストの統計的検知: TF-IDF+SVMによるAIGC分類器の構築
- Source: `.raw/articles/llm-classifier-2026-07-20.md`(URL: https://blog.lyc8503.net/en/post/llm-classifier/、WebFetch 403のためcurl+ブラウザUAで取得、defuddleで整形)
- Summary: [[AI生成テキスト分類器]]
- Pages created: [[AI生成テキスト分類器]], [[lyc8503]], [[AITextDetector]], [[AI生成テキスト検知]]
- Pages updated: なし
- Key insight: 個人ブログ記事([[lyc8503]])。パープレキシティベースのAI生成テキスト検知は実用性に乏しいと判明したため、`TF-IDF` + `LinearSVC` による文単位分類に切り替え、7つのLLM(gemini・qwen・GLM-5・kimi25・glm47・doubao・deepseek-v3.2)それぞれの二値分類器を多数決で統合する方式で文単位精度約85%、未知モデルにも約70%以上の検知率で汎化する[[AITextDetector]]を構築した。Lofter実データでの偽陽性率は閾値60%で0.04%と極めて低い一方、同プラットフォームのトレンド記事の32.22%がAIスコア50%超と判定され無断AI生成コンテンツの広範な存在を示唆する結果を報告している。翻訳往復・脱AI感プロンプトによる回避策の効果は軽微であることも検証済み。既存vaultはAIOps/障害診断ドメインが中心で、AI生成テキスト検知という新規トピック領域の最初のsourceとなるため、既存概念との接続は薄い(独立した新規concept立ち上げ)。
## [2026-07-18] ingest-paper | The Too-Much-Talent Effect: Team Interdependence Determines When More Talent Is Too Much Versus Not Enough
- Source: `.raw/papers/The-too-much-talent-effect_-Team-interdependence-determines-when.pdf`(ローカルPDF、29ページ、Psychological Science 2014年8月号掲載版、DOI: 10.1177/0956797614537280)
- Summary: [[@2014__PsychSci__The Too-Much-Talent Effect - Team Interdependence Determines When More Talent Is Too Much or Not Enough]]
- Pages created: [[@2014__PsychSci__The Too-Much-Talent Effect - Team Interdependence Determines When More Talent Is Too Much or Not Enough]], [[Roderick I. Swaab]], [[Michael Schaerer]], [[Eric M. Anicich]], [[Richard Ronay]], [[Adam D. Galinsky]], [[INSEAD]], [[過剰人材効果]], [[タスク相互依存性]]
- Pages updated: [[Columbia University]], [[Vrije Universiteit Amsterdam]], [[Singapore Management University]]
- Key insight: INSEAD の Roderick I. Swaab を筆頭著者とする組織行動論の実証研究(Psychological Science, 2014)。サッカー(FIFA)・バスケットボール(NBA)・野球(MLB)のアーカイバルデータから、トップタレント比率とチーム成績の関係がタスク相互依存性の高低によって異なることを実証した。相互依存性が高いサッカー・バスケでは人材比率50%超で成績が負に転じる逆U字型曲線が現れ、相互依存性が低い野球では単調増加のままだった。NBAのplay-by-byデータを用いた媒介分析で、チーム内コーディネーションの低下が人材過多効果を媒介することをSobel検定・ブートストラップで統計的に立証した点が本論文の中心的貢献である。著者欄の所属(INSEAD)とSMU機関リポジトリのカバーページ表記(Schaererの所属がSingapore Management University)に食い違いがあったため、Michael Schaerer entityページに事実として両論記載した。pdf.jsによる埋め込み画像抽出で6図(Figure 1〜6)のうち5図(Figure 1〜4, 6)を取得でき、ベクター描画のFigure 5(媒介モデルの経路図)のみPyMuPDFキャプション座標クロップで補完し、6図すべてをsourceページに埋め込んだ。
## [2026-07-18] ingest-paper | MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces
- Source: `.raw/papers/arxiv-2605.11333.pdf`(arXiv 2605.11333v3、論文全文18ページ) + `.raw/slides/mlcommons-chakra-mlsys2026/mlcommons-chakra-mlsys2026.pdf`(MLSys 2026 発表スライド25ページ、全ページ画像化)
- Summary: [[@2026__MLSys2026__MLCommons Chakra - Advancing Performance Benchmarking and Co-design using Standardized Execution Traces]]
- Pages created: [[@2026__MLSys2026__MLCommons Chakra - Advancing Performance Benchmarking and Co-design using Standardized Execution Traces]], [[MLCommons Chakra]], [[MLCommons]], [[Georgia Institute of Technology]], [[Tushar Krishna]], [[Srinivas Sridharan]], [[ASTRA-sim]], [[実行トレース]]
- Pages updated: [[NVIDIA]], [[AMD]], [[vLLM]], [[Prefill-Decode分離]], [[KVキャッシュ管理]]
- Key insight: ユーザーから当初 `https://mlsys.org/virtual/2026/oral/3742`(paper: `https://openreview.net/pdf?id=s2WcSv2Hzt`)としてContextPilot論文の取り込みを依頼されたが誤認であり、実際にはこのURLはMLCommons Chakra論文(著者Srinivas Sridharan・Tushar Krishnaら29名)を指すことをWebFetchで確認して訂正した。OpenReview PDFはCloudflare保護で直接取得できなかったため、arXiv APIでタイトル検索してプレプリント版(2605.11333)を特定し代替取得した。分散AI/MLワークロードの標準実行トレース表現Chakra ETを核に、Trace Linker/Converterによるホスト・デバイストレース統合、trace analysis/replay/simulation-emulationの3用途を持つMLCommons公認エコシステムを報告。40以上の企業・組織が参加するワーキンググループとして標準化されている点、vLLM統合によりMoEトークンルーティング・KVキャッシュオフロード・Prefill-Decode分離間のKV転送を定量化した点を、既存の[[Prefill-Decode分離]]・[[KVキャッシュ管理]]概念に接続した。論文の埋め込み/クロップ図6枚とスライドの独自図解3枚(PyTorchトレース収集実装フロー、Hardware-in-the-Loopエミュレーション実測、Chakraエコシステム6ステップ図)を source ページに埋め込んだ。
## [2026-07-18] ingest-paper | OpsMem: Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis
- Source: `.raw/papers/arxiv-2607.11357.pdf`(arXiv 2607.11357v1、論文全文6ページ)
- Summary: [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]]
- Pages created: [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]], [[OpsMem]], [[Rongchen Gao]], [[Qingyi Guo]], [[Yaoliang Wu]]
- Pages updated: [[Yongqian Sun]], [[Yu Luo]], [[Wenwei Gu]], [[Shenglin Zhang]], [[Dan Pei]], [[Qiuai Fu]], [[Nankai University]], [[Tsinghua University]], [[Huawei Technologies]], [[エージェントメモリ]], [[仮説駆動RCA]], [[LLMによる根本原因分析]]
- Key insight: Nankai University・Tsinghua University・Huawei Technologies による失敗診断向けデュアルメモリフレームワーク OpsMem を報告。短期記憶(STM、GoS の belief-state 抽象化を踏襲)と長期記憶(LTM、パターン・ケース・プロシージャのグラフ)を cross-memory resonance で動的に結合し、Huawei の実運用マイクロサービス障害 120 件データセットで既存のエージェント的推論(ReAct・GoS)・知識拡張(GoS+VectorRAG/GraphRAG/LinearRAG)の全ベースラインを上回る(最強ベースライン比 Match +6.66〜25.00pt)ことを実証した。既存の[[エージェントメモリ]]概念に「検索を状態変化のたびに再計算するトリガー条件」という新しい軸を、[[LLMによる根本原因分析]]概念に「静的 RAG から状態条件付き動的検索への移行」と「経験蒸留器」という LLM 役割分化の新カテゴリを追加した。共著者の Wenwei Gu が同姓同名で CUHK([[LLMPrism]])と Nankai の両方に登場する既存の未解決 contradiction を、Nankai 側の 9 本目の継続共著論文として補強した。pdf.js の埋め込み画像抽出では図表(ベクター描画のアーキテクチャ図)を取得できなかったため、PyMuPDF によるキャプション座標クロップで論文の図1〜5を全て切り出して source ページに埋め込んだ。
## [2026-07-18] ingest-paper | ContextPilot: Fast Long-Context Inference via Context Reuse
- Source: `.raw/papers/arxiv-2511.03475.pdf`(arXiv 2511.03475v4、論文全文21ページ) + `.raw/slides/contextpilot-mlsys2026/contextpilot-mlsys2026.pdf`(MLSys 2026 発表スライド25ページ、全ページ画像化)
- Summary: [[@2026__MLSys2026__ContextPilot - Fast Long-Context Inference via Context Reuse]]
- Pages created: [[@2026__MLSys2026__ContextPilot - Fast Long-Context Inference via Context Reuse]], [[ContextPilot]]
- Pages updated: [[University of Edinburgh]], [[LMCache]], [[CacheBlend]], [[Mem0]], [[KVキャッシュ管理]]
- Key insight: OpenReview 経由の PDF 取得は Cloudflare のブラウザ認証(Turnstile)で失敗したため、arXiv API 検索でプレプリント版(2511.03475)を特定して代替取得した。MLSys 2026 のスライドページ URL(`mlsys.org/media/mlsys-2026/Slides/...`)は直接ダウンロード可能だった。論文本体は、完全一致 prefix caching(RadixCache・LMCache)の低い再利用率と、近似 KV マッチング(CacheBlend)の精度劣化(9〜11%)という既存手法の二律背反を、KV 値でなく検索文書・エージェントメモリ等のコンテキストブロック単位で整列・重複排除・優先順位注釈を行う設計で回避したことを報告する。整列由来の精度低下は0.1〜3.3%と小さく、これは DEmO 順序感度研究の再現実験で現代 LLM(GPT-5.1)が入力順序への感度を大幅に失っていることに支えられている。CacheBlend 自身の精度劣化報告(F1/Rouge-Lで0.01〜0.03)と本論文の観測値(9〜11%劣化)が食い違う点を CacheBlend entity・source 双方に contradiction callout として記録した。論文の埋め込みアテンションマップ図1枚とスライドの独自図解6枚(既存手法トレードオフ、3メカニズム概要、コンテキストインデックス距離関数、整列・注釈の効果、システムアーキテクチャ、結果サマリ)を source ページに埋め込んだ。
## [2026-07-17] ingest | Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs
- Source: `.raw/articles/large-scale-ep-2025-05-05.md`(LMSYS Blog、URL ingest)
- Summary: [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]]
- Pages created: [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]], [[DeepGEMM]], [[EPLB]]
- Pages updated: [[SGLang]], [[DeepEP]], [[DeepSeek-V3]], [[LMSYS]], [[Prefill-Decode分離]], [[Mixture-of-Experts]], [[並列化戦略]], [[負荷分散]]
- Key insight: SGLang チームが 96 台の H100 GPU(12 ノード)で DeepSeek-V3 級モデルを PD Disaggregation + 大規模 Expert Parallelism により配備し、DeepSeek 公式ブログの報告値にオープンソース実装として初めて接近した(TP16 基準比 Prefill 最大 3.3 倍・Decode 最大 5.2 倍、公式プロフィール比 Prefill 94%・Decode はノード数半分でほぼ同等)。密な FFN 層で TP でなく DP を採用する理由が中間次元 18,432 の TP32 アラインメント非対応というハードウェア制約にあること、DeepEP の Normal/Low-Latency Dispatch を PD 分離で使い分けること、EPLB がスループットを Prefill 1.49 倍・Decode 2.54 倍向上させることを、既存の [[Mixture-of-Experts]]・[[並列化戦略]]・[[Prefill-Decode分離]]・[[負荷分散]] の各 concept に接続した。
## [2026-07-17] ingest-paper (update) | Machine Learning Fleet Efficiency: Improving TPU Systems at Scale with ML Productivity Goodput
- Source: `.raw/papers/arxiv-2502.06982.pdf`(arXiv 2502.06982v2、論文全文 13 ページ) + `.raw/slides/mlsys2026-3734/slides.pdf`(既存取り込み済み、MLSys 2026 発表スライド 32 ページ)
- Summary: [[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]]
- Pages created: なし(既存 source/concept ページの更新)
- Pages updated: [[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]], [[ML Productivity Goodput]]
- Key insight: 2026-07-02 の初回取り込み時は OpenReview の Cloudflare 保護で論文 PDF を取得できずスライドのみを出典としていたが、今回 arXiv 版(2502.06982)の存在を特定し論文全文を取得できた。これにより Program Goodput の「predicted step time」が HLO グラフの静的解析(コンパイラー決定に非依存)で算出されることが判明し、通信計算オーバーラップによる 1024 TPU チップ・500B パラメータ LLM でのスループット 1.38 倍・FLOPS 利用率 72% という具体的成果、XTAT オートチューナー(150 モデルで評価)などの詳細を追加した。論文の埋め込み図(アクセラレーター種別推移・システムスタック・MPG 式)とスライドの独自図解(従来指標の落とし穴の 3 列比較・roofline vs フュージョンの説明図・ランタイム最適化 4 施策の統合タイムライン)を計 7 枚 source ページに埋め込んだ。
## [2026-07-17] ingest-paper | A New Golden Age for Computer Architecture
- Source: `.raw/papers/cacm19golden-age.pdf`(CACM, 2019年2月、John L. Hennessy・David A. Patterson 著、2017年ACM Turing Lecture のCACM掲載版)
- Summary: [[@2019__CACM__A New Golden Age for Computer Architecture]]
- Pages created: [[@2019__CACM__A New Golden Age for Computer Architecture]], [[John L. Hennessy]], [[RISC-V]], [[ドメイン固有アーキテクチャ]], [[ムーアの法則とデナードスケーリングの終焉]]
- Pages updated: [[David A. Patterson]], [[Google]], [[VLIW]], [[メモリウォール]]
- Key insight: IBM System/360からRISC-Vまでの ISA 史を、著者ら自身がRISC-I/MIPSの開発当事者であった立場から回顧しつつ、Moore の法則・Dennard スケーリングの終焉により汎用プロセッサの性能向上率がCISC期22%/年→RISC期52%/年→マルチコア期23%/年→Amdahl期12%/年→予測3%/年へと段階的に低下したと定量分析し、ドメイン固有アーキテクチャ(Google TPU v1が汎用CPU比29倍高速・80倍超のエネルギー効率)・オープンISA(RISC-V)・アジャイルハードウェア開発の3つを次の黄金時代の道筋として提示した。既存の[[VLIW]]・[[メモリウォール]]概念に、Itanium/EPICの失敗経緯や投機実行の無駄(平均19%)という定量的裏付けを補う形で接続した。
## [2026-07-16] ingest-slides | LLM高速化(勉強会)
- Source: `.raw/slides/llm-kosokuka-benkyoukai/llm-kosokuka-benkyoukai.pdf`(SpeakerDeck、全50ページ、著者 SuperHotDog)
- Visual pages: `.raw/slides/llm-kosokuka-benkyoukai/pages/`
- Media: なし(音源・動画は提供されず)
- Summary: [[@2026__SpeakerDeck__LLM高速化(勉強会)]]
- Pages created: [[@2026__SpeakerDeck__LLM高速化(勉強会)]], [[SuperHotDog]], [[PagedAttention]], [[Speculative Decoding]], [[CUDAGraph]]
- Pages updated: [[vLLM]], [[KVキャッシュ管理]], [[FlashAttention]], [[Grouped-Query Attention]], [[Multi-Head Latent Attention]], [[線形注意]], [[スライディングウィンドウアテンション]], [[Prefill-Decode分離]], [[GPU最適化]], [[カーネルフュージョン]], [[混合精度訓練]]
- Key insight: LLM 推論高速化の勉強会資料。KVCache・FlashAttention・PagedAttention・Speculative Decoding のアルゴリズム的高速化、CUDA/Triton/CuTe による実装、GQA/MLA/Sliding/Linear Attention のアーキテクチャ的工夫、量子化(Ozaki Scheme 含む)、Nsight プロファイラ、CUDAGraph、vLLM 内部構造を一気通貫で扱い、Qwen2.5-0.5B のハンズオンで素の Transformers 推論から vLLM 推論への 15.88 倍高速化を実演した。既存の学術ベース concept 群(FlashAttention・KVキャッシュ管理・GQA・MLA 等)に、KVCache サイズ見積もり式や MLA low-rank 圧縮率の具体的計算例のような定量的裏付けを補う形で接続した。
## [2026-07-16] ingest | ISC26 Recap
- Source: `.raw/articles/isc26-recap-2026-07-16.md`(Glenn K. Lockwood Blog、URL ingest、画像5点添付)
- Summary: [[@2026__Glenn K. Lockwood Blog__ISC26 Recap]]
- Pages created: [[@2026__Glenn K. Lockwood Blog__ISC26 Recap]], [[LineShine]], [[Top500]], [[IO500]], [[Sugon]], [[ParaStor F9000]], [[Yutong Lu]], [[James Lin]], [[Weicheng Huang]], [[主権AI]]
- Pages updated: [[Glenn K. Lockwood]], [[Lustre]], [[Shanghai Jiao Tong University]], [[ヨーロッパのAI主権]]
- Key insight: 2026年ISCの参加記。中国の全CPU(Arm)スパコン[[LineShine]]がTop500首位を獲得し、SugonのParaStor F9000もIO500でDAOSを上回るなど、計算・ストレージ両面で中国製HPCスタックの成熟が示された。同時に、2026年6月12日の米国政府によるAnthropicモデルへの外国人アクセス遮断を引き金に、世界的な主権AIインフラ投資の機運が生まれたことを報告する。
## [2026-07-16] ingest-paper | AI 2040: Plan A — The Deal
- Source: `.raw/papers/AI-2040.pdf`(AI Futures Project、90ページ。ユーザーがローカルファイルとして直接提供)
- Summary: [[@2026__AI Futures Project__AI 2040 - Plan A - The Deal]]
- Pages created: [[@2026__AI Futures Project__AI 2040 - Plan A - The Deal]], [[AI Futures Project]], [[Daniel Kokotajlo]], [[AI国際検証レジーム]], [[権力集中リスク]]
- Pages updated: [[知能爆発]], [[テイクオフ速度論争]]
- Key insight: [[AI Futures Project]](2027年発表の存亡リスク警鐘シナリオ「AI 2027」と同じチーム)が発表した政策シナリオ文書。研究の完全透明化・コンピュート宣言・訓練一時停止・相互確証コンピュート破壊(MACD)からなる国際検証レジーム「Plan A」によって、既定路線(2030年の完全自動化されたAI研究開発から年内に超知能へ到達というハードテイクオフ的想定)を2040年まで人為的に先送りする成功シナリオを年表形式で描く。誤整合による制御喪失とは独立した「権力集中リスク」(少数の個人・企業が超知能軍団を実効支配する不可逆な独裁のリスク)を軸に据える点、代替プランB(Sabotage)/C(Slowdown)/D(Race)/S(Shutdown)を著者ら自身が確率評価つきで比較する点、中国による秘密裏AGI計画の検知確率分析(未検知でのTED-AI到達確率は2043年まで10%未満)、著者ら自身の卓上演習で繰り返し再現された最悪の失敗モード(欠陥のある安全性ケースの承認)を自己批判的に開示する点が特徴。既存concept [[知能爆発]]・[[テイクオフ速度論争]]に対し、「知能爆発が起こるかどうか・どう起こるか」という理論的問いから「いつ・どの速度で起こることを許すか」というガバナンス上の制御変数へと問題設定を転換する新たな視点を接続した。
## [2026-07-15] ingest-paper | Scalable and Energy-Efficient AI: System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training
- Source: `.raw/papers/mdpi-ai7070232.pdf`(*AI* (MDPI) 2026, 7(7), 232、DOI: 10.3390/ai7070232、掲載日 2026-06-23。mdpi.comがAkamaiボット防御で自動取得を拒否したためユーザーが手動提供したPDFを取り込み)
- Summary: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]
- Pages created: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]], [[Muhammad Ali Shafique]], [[Imran Latif]], [[Hayat Ullah]], [[Alex C. Newkirk]], [[Arslan Munir]], [[Kansas State University]], [[Johnson Controls]], [[Florida Atlantic University]], [[Lawrence Berkeley National Laboratory]], [[GPUエネルギー効率]]
- Pages updated: [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]
- Key insight: シングルノード8×NVIDIA H100と8×NVIDIA B200を、5種のLLM(Mistral-7B-v0.3・LLaMA-3.1-8B・Mistral-NeMo-Base-2407・Gemma-2-27B・Qwen2.5-32B)と3種のVLM(X-CLIP・EVL・Vita-CLIP)のDDP訓練で統制比較した実証研究。B200はGPU利用率1〜6%向上・訓練時間最大15%短縮・TFLOPs/GPU最大32%向上を達成する一方、TFLOPs/kWとtokens-per-kilojouleは全5 LLMでH100を下回り、「計算-エネルギー不整合(compute–energy misalignment)」を実測で提示。施設規模モデリング(2000ノード/5000ノード)では、B200が中負荷で年間+$0.62M、高負荷で+$4.26Mのエネルギーコスト超過となることを示した。新設conceptの[[GPUエネルギー効率]]で、既存の[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]](推論フェーズ)との横断的知見として「スループット優位はエネルギー効率優位を意味しない」という命題が訓練・推論の両フェーズで独立に確認されたことを記録した。
## [2026-07-15] ingest-paper | Can Large Language Models Generate Observability-Aware Code?
- Source: `.raw/papers/arxiv-2607.05785v1.pdf`(arXiv:2607.05785v1, 投稿日 2026-07-07)
- Summary: [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]]
- Pages created: [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]], [[Yongliang Tao]], [[Pengfei Gao]], [[Zhiyu Fan]], [[Jue Zhang]]
- Pages updated: [[Hongyu Zhang]], [[Chongqing University]], [[Minghua Ma]], [[Qingwei Lin]], [[Saravan Rajmohan]], [[Si Qin]], [[Liqun Li]], [[Yu Kang]], [[Microsoft]], [[オブザーバビリティ]], [[コーディングエージェント評価]], [[ログ生成]], [[障害注入]], [[バイブコーディング]]
- Key insight: コーディングエージェント(GPT-5.5・Claude Opus 4.8・Gemini 3.5 Flash)が生成するコードのオブザーバビリティを、18 リポジトリ 1,223 インスタンスのソースレベル復元研究(Position F1・KeyBag F1)と、200 個の agent 生成マイクロサービスを Kubernetes 上にデプロイし 13 種の障害を Chaos Mesh で注入した実行時評価(1,615 件、Fault Signals Rate)の 2 軸で実証した初の系統的研究。全プロンプト戦略・全モデルで Position F1 が KeyBag F1 を一貫して上回り、「どこに計装するか」より「何を記録すべきか」の再現が体系的に弱いことを示した。explicit instruction は生成量を倍増(2.1→4.9 文/インスタンス)させるが Precision を犠牲にする Quantity over Quality 現象、few-shot プロンプトが Recall 主導で両指標を改善する現象を確認。実行時には FSR が 4.95〜13.99% にとどまり、「ログは大量に生成されるが障害固有の明示的意味論を欠く」ことを保守的な指標で定量化した。約 200 件の実失敗修復コミットから抽出した軽量 observability-oriented skill は FSR・Position F1・KeyBag F1 を改善するが効果は限定的(GPT-5.5: FSR +8.67pp、Claude Opus 4.8: +0.99pp、Gemini 3.5 Flash: +2.54pp)。
## [2026-07-15] ingest | Recursive Self-Improvement (LessWrong)
- Source: `.raw/articles/recursive-self-improvement-2026-07-15.md`(LessWrong, 2008-12-01)
- Summary: [[@2008__LessWrong__Recursive Self-Improvement]]
- Pages created: [[@2008__LessWrong__Recursive Self-Improvement]], [[Eliezer Yudkowsky]], [[Robin Hanson]], [[I. J. Good]], [[知能爆発]], [[テイクオフ速度論争]], [[リソースオーバーハング]]
- Pages updated: [[Recursive Self-Improvement]]
- Key insight: [[Eliezer Yudkowsky]] が2008年に提示した「AI go FOOM」論の原論証。因果を5層(metacognitive/cognitive/metaknowledge/knowledge/object level)に分解し、AIが自身の記憶検索アルゴリズムを改善する課題を与えられた瞬間にmetacognitive層とobject層が同一化する現象を「真の再帰」と定義、「自分のソースコードを直接書き換えること」と「農業を発明すること」を明確に区別すべきと論じる。複雑な最適化連鎖を再帰で自己に畳み込むと理論上「横ばいか爆発かのどちらか」になるはずで、ソフトテイクオフには「正確に都合の良い収穫逓減則」という狭い条件が必要という数理的議論は、2026年の [[@2026__Lil'Log__Harness Engineering for Self-Improvement]] が報告するハーネスレベルの漸進的自己改善(間接的RSI)との対比で、[[Recursive Self-Improvement]] 概念に理論と実務の18年越しの往復を持ち込んだ。
## [2026-07-15] ingest-paper | Speculations Concerning the First Ultraintelligent Machine
- Source: `.raw/papers/Good1964.pdf`(Advances in Computers, Vol. 6, Academic Press, 1965)
- Summary: [[@1965__AdvComput__Speculations Concerning the First Ultraintelligent Machine]]
- Pages created: [[@1965__AdvComput__Speculations Concerning the First Ultraintelligent Machine]]
- Pages updated: [[知能爆発]], [[Recursive Self-Improvement]], [[I. J. Good]]
- Key insight: [[I. J. Good]] が「ウルトラ知能機械」の定義から「知能爆発」を初めて明示的に定式化した1965年の一次論文。既存の wiki には Good の1965年論文への言及(entity [[I. J. Good]]、concept [[知能爆発]]・[[Recursive Self-Improvement]])は既にあったが、原論文本体は未 ingest で「未 ingest」と明記されていた欠落を埋めた。原論文の知能爆発の議論自体は数段落にとどまり機構的説明を欠くこと、本体の大半は Hebb の細胞集成体理論を修正した「サブアセンブリ理論」による記憶・想起・意味論の統一的説明という別の思弁に割かれていること、そして Good(概念の定式化)と43年後の Yudkowsky(機構の定式化)という役割分担を横断的知見として記録した。
## [2026-07-15] ingest | Harness Engineering for Self-Improvement (Lil'Log)
- Source: `.raw/articles/harness-engineering-for-self-improvement-2026-07-15.md`(Lil'Log, 2026-07-04)
- Summary: [[@2026__Lil'Log__Harness Engineering for Self-Improvement]]
- Pages created: [[@2026__Lil'Log__Harness Engineering for Self-Improvement]], [[Lilian Weng]], [[Recursive Self-Improvement]], [[ハーネス自己進化]], [[進化的探索によるエージェント設計]]
- Pages updated: [[Harness Engineering]], [[コンテキストエンジニアリング]], [[Andrej Karpathy]]
- Key insight: [[Recursive Self-Improvement]](RSI)の近未来的経路をモデル重みの直接書き換えではなく訓練パイプラインとデプロイシステム(ハーネス)の改善による間接的ループと位置づけ、既存の [[Harness Engineering]] 実務知見(OpenAI・Anthropic)を、ACE/MCE(コンテキストエンジニアリングの進化するプレイブック化)・Meta-Harness/Self-Harness/AHE(ハーネスコード自体の自己進化)・ADAS/AFlow/AlphaEvolve(進化的探索)という3系統の学術研究に接続する統一的なレビュー。STOP(2023)の「弱いモデルでは再帰改善が劣化する」という知見が、2026年の各手法でも暗黙に前提とされている点を横断的知見として記録した。
## [2026-07-15] ingest-paper | Valet: Efficient Data Placement on Modern SSDs
- Source: `.raw/papers/2026_Unknown_Valet_Efficient_Data_Placement_Modern.pdf`(ACM Symposium on Cloud Computing, SoCC '25, 2025-11-19〜21)
- Summary: [[@2025__SoCC__Valet - Efficient Data Placement on Modern SSDs]]
- Pages created: [[@2025__SoCC__Valet - Efficient Data Placement on Modern SSDs]], [[Devashish R. Purandare]], [[Peter Alvaro]], [[Avani Wildani]], [[Darrell D. E. Long]], [[Ethan L. Miller]], [[Valet]], [[MongoDB]], [[CacheLib]], [[zenfs]], [[f2fs]], [[Pure Storage]], [[ホスト誘導データ配置]], [[シムレイヤー]], [[ゾーン名前空間SSD]]
- Pages updated: [[UC Santa Cruz]], [[Emory University]], [[Cloudflare]], [[RocksDB]], [[LSMツリー]]
- Key insight: LD_PRELOAD ベースの userspace シムレイヤーだけで、アプリケーション・ファイルシステム・カーネルを一切変更せずに、affinity(親和性)と lifetime(寿命)の2軸に基づく配置ヒントを注入することで、f2fs に対して2〜6倍のスループット・最大6倍低いテールレイテンシを達成し、アプリケーション固有ソリューション(zenfs)に匹敵する性能とより広い適用性を両立できることを、RocksDB・MongoDB・CacheLib という3つの異なる特性のアプリケーションで実証した。データ配置の一般理論として temperature ベースではなく affinity/lifetime の2軸を提示した点、ヒューリスティックと学習ベース(mini KMeans)の双方のヒント生成を同一アーキテクチャで実証した点が新規性。全ての図は原著がベクター描画のため、PyMuPDF によるキャプション座標クロップで抽出した(pdf.js の埋め込みラスター画像抽出では図が取得できなかった)。
## [2026-07-15] ingest-paper | The Anatomy of a Large-Scale Hypertextual Web Search Engine
- Source: `.raw/papers/Brin98Anatomy.pdf`(Computer Networks and ISDN Systems 30 (1998) 107-117 / WWW7 1998)
- Summary: [[@1998__Computer Networks__The Anatomy of a Large-Scale Hypertextual Web Search Engine]]
- Pages created: [[@1998__Computer Networks__The Anatomy of a Large-Scale Hypertextual Web Search Engine]], [[Sergey Brin]], [[Lawrence Page]], [[PageRank]]
- Pages updated: [[Stanford University]], [[Google]]
- Key insight: Google の検索エンジンとしての創業論文。リンク構造由来のPageRank(`PR(A)=(1-d)+d·ΣPR(Ti)/C(Ti)`、ランダムサーファーモデル)とアンカーテキストのリンク先索引化を核とし、2,400万ページを1週間未満で索引化する実測性能(圧縮リポジトリ53.5GB・完全転置索引37.2GB・合計108.7GB)を報告する。本 wiki に情報検索・PageRankという新規ドメインを導入した。PDF はスキャン起源でOCRノイズが多く(著者名が"S. Brftz. L. Pup"等に誤認識)、注記のうえ引用した。Fig.1 のアーキテクチャ図はPyMuPDFでの直接画像抽出(xref指定)により復元できた。
## [2026-07-14] ingest-slides | 言語モデルの内部機序:解析と解釈 (NLP2025 チュートリアル)
- Source: `.raw/slides/NLP_2025_interpretability_tutorial__E68F90E587BAE78988_-/NLP_2025_interpretability_tutorial__E68F90E587BAE78988_-.pdf`(SpeakerDeck, 2025-03-10)
- Visual pages: `.raw/slides/NLP_2025_interpretability_tutorial__E68F90E587BAE78988_-/pages/`(全144ページ)
- Media: none(transcript なし)
- Summary: [[@2025__SpeakerDeck__言語モデルの内部機序:解析と解釈]]
- Pages created: [[@2025__SpeakerDeck__言語モデルの内部機序:解析と解釈]], [[Benjamin Heinzerling]], [[横井祥]], [[小林悟郎]], [[理化学研究所]], [[東北大学]], [[国立国語研究所]], [[SAE]], [[活性化パッチング]], [[言語モデルのプロービング]]
- Pages updated: [[Anthropic]], [[機構的解釈性]], [[プラトン的表現仮説]], [[モデル表現収束]], [[ロジットレンズ]], [[帰納ヘッド]], [[アテンションヘッド]]
- Key insight: 言語モデルの内部機序理解を「内部表現の解析→計算過程の解析→言語・世界・知識との対応づけ(解釈)」の3段階フレームワークで整理した上で、その基盤にある「局所性・一対一対応」という仮定自体をSAEのfeature absorption・複数の等価な回路・複数の実際の計算メカニズムの共存という反例で掘り崩す、方法論への内省まで踏み込むチュートリアルである。
## [2026-07-14] ingest-paper | OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
- Source: `.raw/papers/arxiv-2606.27154.pdf`(arXiv:2606.27154, 2026)
- Summary: [[@2026__arXiv__OpenRCA 2.0 - From Outcome Labels to Causal Process Supervision]]
- Pages created: [[@2026__arXiv__OpenRCA 2.0 - From Outcome Labels to Causal Process Supervision]], [[Yifan Yang]], [[Jin'ao Shang]], [[Qisheng Lu]], [[Rui Wang]], [[Songhan Zhang]], [[Yuzhong Zhang]], [[Boxi Yu]]
- Pages updated: [[Aoyang Fang]], [[Pinjia He]], [[Junjielong Xu]], [[The Chinese University of Hong Kong, Shenzhen]], [[OpenRCA]], [[RCA評価設計]], [[因果発見]], [[障害注入]]
- Key insight: OpenRCA 2.0 は根本原因ラベルのみを持つ既存 RCA ベンチマークの限界に対し、障害注入時の既知介入 do(v_root) を利用する段階的因果ラベリング PAVE で検証済みの因果伝播経路まで持つ初の cross-system ベンチマーク(500 インスタンス)を構築した。11 の最先端 LLM で、正しいサービスを言い当てる AnySvc(76.0%)と検証済み経路まで裏づける Path Reachability(61.5%)の間に 14.5pp のギャップがあることを示し、これを「grounding されていない診断(ungrounded diagnosis)」と定義。outcome-only 評価がこの失敗モードを隠すことを、人手ラベルや LLM judge なしにグラフ形状指標(Path Reachability・Node F1・Edge F1)だけで定量化した点が新しい。
## [2026-07-14] ingest-paper | A Survey of DevOps Concepts and Challenges
- Source: `.raw/papers/Leite-et-al.-2019---A-Survey-of-DevOps-Concepts-and-Challenges.pdf`(ACM Computing Surveys, Vol. 52, No. 6, Article 127, 2019)
- Summary: [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges]]
- Pages created: [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges]], [[Leonardo Leite]], [[Carla Rocha]], [[Fabio Kon]], [[Paulo Meirelles]], [[University of São Paulo]], [[University of Brasília]], [[Federal University of São Paulo]]
- Pages updated: [[DevOps]], [[Dejan Milojicic]], [[Hewlett Packard Labs]]
- Key insight: 2019年のACM CSURサーベイは、DevOpsが10年近く議論されても広く合意された定義を欠くと明記した上でGrounded Theory的手法によりprocess/people/delivery/runtimeの4カテゴリからなるconceptual frameworkを構築し、既存DevOps SLR群がdelivery/runtime(技術的含意)を軽視してきたことを指摘した。DevOpsツールを7カテゴリに分類し担当者・目標・関連概念と対応づけ、Site Reliability Engineeringも運用エンジニア役割の進化形として既に文献に組み込んでいた。
## [2026-07-14] ingest | The Origins of DevOps: What's in a Name?
- Source: `.raw/articles/the-origins-of-devops-whats-in-a-name-2026-07-14.md`(devops.com, 2018-01-25)
- Summary: [[@2018__devops.com__The Origins of DevOps - What's in a Name]]
- Pages created: [[@2018__devops.com__The Origins of DevOps - What's in a Name]], [[Paul Hammond]], [[Gene Kim]], [[Kevin Behr]], [[George Spafford]]
- Pages updated: [[DevOps]], [[Patrick Debois]], [[Andrew Clay Shafer]], [[John Allspaw]]
- Key insight: DevOpsの起源に関する事実関係(Agile Infrastructure BoF・Velocity 2009 Flickr発表・Devopsdays創設)が [[@2026__mizzy.org__DevOpsとは何だったのか]] と独立ソースで一致することを確認した。2013年『The Phoenix Project』(Gene Kim・Kevin Behr・George Spafford)によるビジネス小説形式での普及という補足事実を追加した。
## [2026-07-14] ingest | DevOpsとは何だったのか
- Source: `.raw/articles/devops-towa-nan-datta-noka-2026-07-14.md`(mizzy.org, 2026-07-13)
- Summary: [[@2026__mizzy.org__DevOpsとは何だったのか]]
- Pages created: [[@2026__mizzy.org__DevOpsとは何だったのか]], [[DevOps]], [[Patrick Debois]], [[John Willis]], [[Andrew Clay Shafer]], [[Gosuke Miyashita]]
- Pages updated: [[SRE]], [[DORA]], [[プラットフォームエンジニアリング]], [[ChatOps]], [[John Allspaw]]
- Key insight: DevOps は元々「開発部門と運用部門という組織の分断を解消する文化運動」だったが、CAMSのAutomation偏重・ツール名・職種名として消費されていき、最終的にInfrastructure as Code・CI/CD・DORA・ChatOpsという独立領域へ分解された(2025年のDORA改称が象徴的)。同じ「文化→職種・技術レイヤーへの縮約」が、「class SRE implements DevOps」という定式化を通じてSREにも反復されつつある。
## [2026-07-13] ingest-paper | Bridging Edge and Cloud: A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection
- Source: `.raw/papers/Bridging_Edge_and_Cloud_A_Knowledge-Enhanced_Framework_for_Efficient_Time_Series_Anomaly_Detection.pdf`(IEEE TSC 2025)
- Summary: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]]
- Pages created: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], [[RefinedEdge]], [[Jiacheng Zhang]], [[Guohua Liu]], [[Shiqi Chen]], [[Yutong Chen]]
- Pages updated: [[Shenglin Zhang]], [[Yongqian Sun]], [[Dan Pei]], [[Minghua Ma]], [[Chenyu Zhao]], [[Nankai University]], [[Alibaba Cloud]], [[異常検知]], [[知識蒸留]], [[モデル圧縮]], [[Edge-cloud Collaboration]]
- Key insight: RefinedEdge は多変量時系列異常検知モデルをエッジ配置可能な水準(0.15M パラメータ未満)まで圧縮しつつ、クラウド訓練の大型モデル(7M パラメータ)に匹敵・凌駕する精度を Aggregated Compression + Knowledge Refinement で達成し、概念ドリフトのあるデータセットでのみ Reciprocal Edge-Cloud Updating が有意な改善をもたらすことを示した。
## [2026-07-13] ingest-paper | From Chaos to Clarity: Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services
- Source: `.raw/papers/LogSage.pdf`(FCS 2025)
- Summary: [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]]
- Pages created: [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]], [[Tianyu Cui]]
- Pages updated: [[Shenglin Zhang]], [[Yongqian Sun]], [[Yicheng Sui]], [[Zeyu Che]], [[Nankai University]], [[ByteDance]], [[ログ解析]], [[根本原因分析]], [[グラフベースRCA]], [[LLMによる根本原因分析]]
- Key insight: LogSage(通称)はカーネルパニック RCA を「スパースな障害指示ログ抽出」と「ログ間長距離依存」の2課題に分解し、GraphSAGE+能動学習と LLM 要約でByteDance本番20,000件データにおいてLogKGを15.5〜20.3pt F1上回り、6ヶ月超本番デプロイされている。
## [2026-07-13] ingest-paper | A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection
- Source: `.raw/papers/TSC3622122.pdf`(IEEE TSC 2025)
- Summary: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]]
- Pages created: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]], [[Minyi Shao]], [[Kaiwen Yang]], [[Xingda Li]], [[Dongbiao He]], [[Yanbiao Li]], [[トレース異常検知]]
- Pages updated: [[Yongqian Sun]], [[Nankai University]]
- Key insight: トレース異常検知には全データセット横断で一貫最良のアルゴリズムは存在せず(GTrace/TraceVAE/PUTraceADが条件依存で優劣を分ける)、TADBenchはトレース深さ・スパン数・サービス数・異常比率の4特性から決定木でアルゴリズムを推奨する初の横断ベンチマークを提示した。
## [2026-07-13] ingest-paper | PerfScout: An Adaptive Workload Generator in Software Performance Testing
- Source: `.raw/papers/PerfScout_ICSE_26_Camera_Ready.pdf`(ICSE-SEIP '26)
- Summary: [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]]
- Pages created: [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]], [[Qingliang Zhang]], [[Yimin Zuo]], [[Bowen Deng]], [[Xiao Xiong]], [[Mengyao Li]], [[Huandong Zhuang]], [[Ruiyuan Wan]]
- Pages updated: [[Yongqian Sun]], [[Shenglin Zhang]], [[Dan Pei]], [[Xidao Wen]], [[Nankai University]], [[Huawei Cloud]], [[BizSeer]], [[Alban Siffer]], [[Tsinghua University]], [[Wenwei Gu]], [[定常性モデル]], [[適応的ワークロード生成]]
- Key insight: PerfScout は SPOT(極値理論)・ADF/KPSS(局所定常性判定)・PPO(強化学習)の3モジュールを統合し性能テストのワークロード生成を全自動化するフレームワークで、Huawei Cloud に9か月間本番デプロイされ、全ベースラインを調和平均(HM)で上回り代表ケースで87%のテスト時間短縮を実証した。
## [2026-07-13] ingest-paper | When LLMs Listen to Experts: Accurate Failure Diagnosis in Operating Systems
- Source: `.raw/papers/icse2026-seip-paper13.pdf`(ICSE-SEIP '26)
- Summary: [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]]
- Pages created: [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]], [[OScope]], [[Yuxin Sun]], [[Li Shi]], [[Cheng Huang]], [[Guodong Yang]], [[Luping Wang]]
- Pages updated: [[Yongxin Zhao]], [[Wenwei Gu]], [[Yongqian Sun]], [[Shenglin Zhang]], [[Dan Pei]], [[Liping Zhang]], [[Nankai University]], [[Alibaba Group]], [[Tsinghua University]], [[TSG自動化]], [[マルチモーダル障害診断]]
- Key insight: OScope は症状記述の意味的不整合(TSG 検索精度 AC@5 0.75→0.9)を独立ファインチューニング済み Knowledge Aligner で解消し、SOP ガイドのチャンク逐次検証(Report Validator)と組み合わせて Alibaba 本番 OS 障害診断で AC@5=0.901・平均診断時間を112分→1.5分に短縮した。
## [2026-07-13] ingest-paper | Aloha: Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent
- Source: `.raw/papers/Yujia__Aloha_to_FSE_26.pdf`(FSE Companion '26)
- Summary: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]
- Pages created: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]], [[Yujia Wu]], [[Jinghuan Ren]], [[バッチ障害診断]]
- Pages updated: [[Shenglin Zhang]], [[Yongqian Sun]], [[Chaoyun Zhang]], [[Liqun Li]], [[Wenwei Gu]], [[Qingwei Lin]], [[Dongmei Zhang]], [[Saravan Rajmohan]], [[Chetan Bansal]], [[Minghua Ma]], [[Nankai University]], [[Microsoft]], [[Fault Localization]]
- Key insight: Aloha(FSE Companion '26)は対照分析ベースのバッチ障害診断で「アルゴリズムでなく usability gap が実務障壁」と指摘し、FTA由来の適格性判定・実行可能検証ツールキット・RAGベース戦略選択をhuman-in-the-loopで統合してCONANをACC@5で0.9370対0.6963、診断時間を約10時間から約0.5時間に短縮した。
## [2026-07-13] ingest-paper | FoundRoot: Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking
- Source: `.raw/papers/foundroot_camera_ready.pdf`(ICSE '26)
- Summary: [[@2026__ICSE__FoundRoot - Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking]]
- Pages created: [[@2026__ICSE__FoundRoot - Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking]], [[Yuzhuo Yang]], [[構造化深層思考]]
- Pages updated: [[Zhe Xie]], [[Zeyan Li]], [[Xiao He]], [[Shenglin Zhang]], [[Longlong Xu]], [[Tieying Zhang]], [[Jianjun Chen]], [[Rui Shi]], [[Dan Pei]], [[Tsinghua University]], [[ByteDance]], [[Nankai University]], [[根本原因分析]], [[LLMによる根本原因分析]], [[検証可能報酬による強化学習]], [[Fault Localization]]
- Key insight: FoundRoot は構造化深層思考(メトリクススキャン→伝播分析→リフレクション→ランキング)を warm-up SFT + DAPO で LLM に内在化させることで、プロンプトのみの分解(w/ Workflow)や RL 抜きの構造化(SFT Only/SFT+SFT)を上回り、ゼロショット RCA 4 データセット全てで MRR 4.5%〜48.6% 改善した。
## [2026-07-13] ingest-paper | LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles
- Source: `.raw/papers/Ruowei__InsightTriage_to_ASE26.pdf`(ASE'26投稿版)
- Summary: [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]]
- Pages created: [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]], [[Weiguo Li]]
- Pages updated: [[Ruowei Fu]], [[Shenglin Zhang]], [[Wenwei Gu]], [[Yongqian Sun]], [[Dan Pei]], [[Nankai University]], [[インシデントトリアージ]], [[オンコール自動化]]
- Key insight: 同じ Ruowei Fu / Shenglin Zhang (Nankai University) の著者陣が ByteDance ドメイン(OncallX・CoTriage)に続き Huawei/ICV(車載)ドメインで InsightTriage を提案し、LLMによるコンポーネント知識ベース自動構築+コントラスティブ学習ログ検索によりログを一次証拠として扱う設計の有効性をアブレーション(ログ検索器除去でWeighted F1が19.2%低下)で実証した。
## [2026-07-13] ingest-paper | Bridging the Delay: Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis
- Source: `.raw/papers/LagRCA_4.24.pdf`(FSE Companion '26)
- Summary: [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]]
- Pages created: [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]], [[Junhua Kuang]], [[Yimeng Zhang]], [[Jintao Feng]], [[Jingyu Wang]], [[Liping Zhang]], [[LagRCA]], [[遅延認識時空間因果推論]]
- Pages updated: [[Shenglin Zhang]], [[Yongqian Sun]], [[Dan Pei]], [[Nankai University]], [[Alibaba Group]], [[Tsinghua University]], [[Sibo Xia]], [[Wenwei Gu]], [[Wei Li]], [[因果推論ベースRCA]], [[Fault Localization]], [[根本原因分析]], [[グラフベースRCA]]
- Key insight: マイクロサービス障害伝播は本番データで81.5%が非同期(2分以上の遅延)であり、この時間ラグを明示的にモデル化(スケルトン/強度分離+ラグ条件付きアテンション)することで同期集約前提の既存RCA手法を大きく上回れることをLagRCAが実証した。
## [2026-07-13] ingest-paper | Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems
- Source: `.raw/papers/Can-Language-Models-Go-Beyond-Coding-Assessing-the-Capability-of-Language-Models-to-Build-Real-World-Systems.pdf`
- Summary: [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]
- Pages created: [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], [[Build-bench]], [[Open Build Service]], [[Weilin Jin]], [[クロスISAマイグレーション]], [[自動ビルド修復]]
- Pages updated: [[Chenyu Zhao]], [[Shenglin Zhang]], [[Yongqian Sun]], [[Dan Pei]], [[Chaoyun Zhang]], [[Qingwei Lin]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[Nankai University]], [[Peking University]], [[Tsinghua University]], [[Microsoft]], [[エージェント型コーディング]]
- Key insight: エージェント型のツール利用・反復フィードバックなしでは GPT-5 の成功率は 6.13% にとどまるが、Build-bench の反復ループ環境下では 63.19%(10.3 倍)に到達し、クロス ISA ビルド修復は動的なツールオーケストレーションと検証可能なフィードバックループを要することを実証した。
## [2026-07-13] ingest-paper | Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents
- Source: `.raw/papers/Debugging-the-Debuggers-Failure-Anchored-Structured-Recovery-for-Software-Engineering-Agents.pdf`
- Summary: [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]]
- Pages created: [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]], [[Yihang Lin]], [[Zhimin Chen]]
- Pages updated: [[Chenyu Zhao]], [[Shenglin Zhang]], [[Wenwei Gu]], [[Yongqian Sun]], [[Dan Pei]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[AIOpsLab]], [[エージェント修復]]
- Key insight: PROBE は診断精度改善(+43.58pt)が回復率改善(+12.45pt)を大きく上回る「diagnosis–recovery gap」を実証し、同著者グループの後続研究 AgentTether が観測したフィードバック遵守の急速な減衰と同一の構造的主張(正しい診断は実行可能な回復の必要条件だが十分条件ではない)に収斂する。
## [2026-07-13] ingest-paper | Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems
- Source: `.raw/papers/Ruowei__Triage_to_TOSEM.pdf`(TOSEM投稿版)
- Summary: [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]]
- Pages created: [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]], [[Yang Zhang (ByteDance)]], [[Xin Wu (ByteDance)]], [[Feng Wang (ByteDance)]], [[Zeyu Che]], [[Xiaozhou Liu (ByteDance)]], [[知識蒸留]]
- Pages updated: [[Ruowei Fu]], [[Yu Zhang (ByteDance)]], [[ByteDance]], [[Yongqian Sun]], [[Nankai University]], [[Wenwei Gu]], [[Shenglin Zhang]], [[オンコール自動化]], [[インシデントトリアージ]]
- Key insight: 同一著者陣(Ruowei Fu・Shenglin Zhang、ByteDance STE チーム)が、先行研究 OncallX の知識グラフ拡張路線に続き、CoTriage で知識蒸留+自己強化+DPOによるSLMファインチューニングという対照的な路線を独立に本番デプロイしており、チケットトリアージには決定版アプローチがまだ定まっていないことを示す。
## [2026-07-13] ingest-paper | Large Language Models Can Provide Accurate and Interpretable Incident Triage
- Source: `.raw/papers/ISSRE24_LLM4triage.pdf`(著者による Microsoft Research サイト直接公開版。DOI版はIEEE Xplore有料壁の向こう)
- Summary: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]
- Pages created: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]], [[Ze Li]], [[Jianhui Li]], [[Chinese Academy of Sciences]], [[インシデントトリアージ]]
- Pages updated: [[Zexin Wang]], [[Minghua Ma]], [[Chetan Bansal]], [[Qingwei Lin]], [[Dongmei Zhang]], [[Yu Kang]], [[Chaoyun Zhang]], [[Saravan Rajmohan]], [[Murali Chintalapati]], [[Changhua Pei]], [[Gaogang Xie]], [[Microsoft]], [[インシデント管理]], [[インシデントTTM予測]]
- Key insight: LLM(GPT-3.5/GPT-4)でログからキーワードを抽出し埋め込み類似検索でチームを推薦する COMET は、生ログ・議論の生テキストよりフィルタ済みログ(TrimmedLogs)が、さらに生成要約よりキーワードがトリアージ入力表現として優れることを比較実験(Table I・II)で実証した。Microsoft の2大規模クラウドサービスに6ヶ月以上本番展開し、オンラインでACC@1を0.47→0.61に改善・TTMを35%短縮。アブレーション(Table VI)により、不正確でもルールベース(AutoAnalysis)の出力を LLM の補助入力として活用する設計が有効であることも定量的に確認した。
## [2026-07-13] ingest-paper | Integrating Large Language Models into Security Incident Response
- Source: `.raw/papers/soups2025-kramer.pdf`
- Summary: [[@2025__SOUPS__Integrating Large Language Models into Security Incident Response]]
- Pages created: [[@2025__SOUPS__Integrating Large Language Models into Security Incident Response]], [[Diana Kramer]], [[Lambert Rosique]], [[Ajay Narotam]], [[Elie Bursztein]], [[Patrick Gage Kelley]], [[Kurt Thomas]], [[Allison Woodruff]], [[LLMインシデント要約]]
- Pages updated: [[Google]], [[インシデントレポート執筆]], [[インシデントレスポンスAIレベル]]
- Key insight: Gemini 1.5 Flash によるセキュリティインシデントの自律的な要約は人間要約に61%対39%で劣後する(完全性35%・事実性42%の欠陥率)一方、人間がAI下書きを編集する協働(AI支援)要約は人間単独の要約より77%対11%で優位という非対称な結果を実証。同一モデル・同一プロンプトでも人間の関与度合いで評価が逆転する点は、既存の[[インシデントレスポンスAIレベル]]概念(IR2/IR3自律度議論)に定量的な裏付けを与える。要約作成者本人の主観評価(品質向上について意見割れ)と独立第三者評価(77%でAI支援要約を高評価)の乖離も報告。
## [2026-07-13] ingest-paper | AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations
- Source: `.raw/papers/arxiv-2607.06273.pdf`
- Summary: [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]]
- Pages created: [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]], [[Chenyu Zhao]], [[エージェント修復]]
- Pages updated: [[Shenglin Zhang]], [[Dan Pei]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[Wenwei Gu]], [[Yongqian Sun]], [[Nankai University]], [[Tsinghua University]], [[Microsoft]], [[エージェントシステム運用]], [[グラフベースRCA]]
- Key insight: LLM エージェントの失敗した実行を Transition Unit のグラフ(Critical Transition Graph)で診断し、事後のグラフ誘導診断と実行時の保護付き介入(Check→Decide→Inject)を連動させることで、一度きりの診断フィードバックが再実行中に減衰する問題(tool-call ステップ 13 で追従率 50% を割る)に対処する。τ-bench Banking の初回失敗タスクを Qwen3.7-max 59.04%・GPT-5.4 65.12% 修復。Wenwei Gu の著者所属(Nankai University)が既存 LLMPrism エントリ(CUHK)と食い違うため entity ページに contradiction callout を追加(同姓同名の可能性、未確定)。
## [2026-07-13] ingest | 価値はスケールしない。発酵する。(安宅和人)
- Source: `.raw/articles/kaz-ataka-value-doesnt-scale-it-ferments-2026-07-13.md`
- Summary: [[@2026__hatenablog__価値はスケールしない、発酵する。]]
- Pages created: [[@2026__hatenablog__価値はスケールしない、発酵する。]], [[安宅和人]], [[Dan Hill]], [[堀河屋野村]], [[四資本の時計]], [[価値生成の膜モデル]], [[地域の乳化剤]], [[テロワール(味わうことのできる時間)]], [[存続可能性から生成する力へ]]
- Pages updated: なし(新規ドメイン初導入のため既存ページへの言及なし)
- Key insight: 成長論・脱成長論はともに全ての価値が経済資本と同じ単一の時計で動くと誤って前提しており、本当の問いは価値がどのような時間で育つかである。経済資本(複利)・文化資本(発酵)・関係資本(熟成)・自然資本(循環)という異なる時間性、完全な混合でも分離でもない「膜」による価値生成、土地の個性ではなく「味わうことのできる時間」としてのテロワール再定義を提示。SRE/インフラ中心だったこの wiki に地域再生・文化資本・脱成長という新規ドメインを導入した。
## [2026-07-13] ingest | Cognitive Work of Hypothesis Exploration During Anomaly Response
- Source: `.raw/articles/cognitive-work-of-hypothesis-exploration-during-anomaly-response-2026-07-13.md`(Cloudflare 403 のため Wayback Machine 経由で全文取得)
- Summary: [[@2019__ACMQueue__Cognitive Work of Hypothesis Exploration During Anomaly Response]]
- Pages created: [[@2019__ACMQueue__Cognitive Work of Hypothesis Exploration During Anomaly Response]], [[Marisa R. Grayson]], [[Mile Two]], [[SNAFUcatchers Consortium]], [[アノマリー応答]]
- Pages updated: [[David D. Woods]], [[Richard I. Cook]], [[仮説駆動RCA]], [[ヒンドサイトバイアス]], [[レジリエンスエンジニアリング]]
- Key insight: [[SNAFUcatchers Consortium]] のインシデントケースDBから4件を process tracing 手法で分析し、アノマリー応答における仮説探索空間の時間発展(line of commitment を境に分岐・収束)を可視化。ACM Queue 同号の "Above the Line, Below the Line"(Cook)・"Managing the Hidden Costs of Coordination"(Maguire)は未 ingest。
## [2026-07-13] ingest | Failure is inevitable: Learning from a large outage at Datadog
- Source: `.raw/articles/rethinking-reliability-2026-07-13.md`
- Summary: [[@2025__Datadog Engineering Blog__Failure is inevitable - Learning from a large outage and building for reliability in depth at Datadog]]
- Pages created: [[@2025__Datadog Engineering Blog__Failure is inevitable - Learning from a large outage and building for reliability in depth at Datadog]], [[グレースフルデグレーデーション]], [[Rob Thomas]], [[Maciej Kowalewski]]
- Pages updated: [[Datadog]], [[Laura de Vesine]], [[インシデント管理]], [[ソフトウェア耐障害性]]
- Key insight: 「データ完全性を部分可視性より優先する設計」が 50〜60% の部分障害を 100% 停止に見せるスクエアウェーブパターンを生む。グレースフルデグレーデーションへの転換で重大インシデント 30% 削減・緩和時間中央値 10% / 95th 50% 改善という定量成果を達成。
## [2026-07-13] ingest-slides | Oncall: An Equal-Opportunity Waste of Time
- Source: `.raw/slides/srecon22emea-oconnor-oncall/srecon22emea-oconnor-oncall.pdf`
- Visual pages: `.raw/slides/srecon22emea-oconnor-oncall/pages/` (10 pages)
- Media: none (transcript なし)
- Summary: [[@2022__SREcon22EMEA__Oncall - An Equal-Opportunity Waste of Time]]
- Pages created: [[@2022__SREcon22EMEA__Oncall - An Equal-Opportunity Waste of Time]], [[Dave O'Connor]], [[Twilio]]
- Pages updated: [[SRE組織変革]]
- Key insight: オンコールを SRE の専売特許として複雑化する「toxic exceptionalism」が SRE を「fancy-ops」に固定化する。ステークホルダーへの価値証明は工学的乗数効果に置くべきという O'Connor の主張は、Facebook SRO 解散(集中型チームがクラッチとなりエンジニアリングチームの自立を阻んだ)と同じ構造問題を個人/チームの態度レベルで問い直す。
## [2026-07-13] ingest | 6 Reasons You Don't Need an SRE Team
- Source: `.raw/articles/6reasons-2026-07-13.md`
- Summary: [[6 Reasons You Don't Need an SRE Team]]
- Pages created: [[6 Reasons You Don't Need an SRE Team]], [[Gerro Wadat]], [[カーゴカルトSRE]]
- Pages updated: [[SRE]]
- Key insight: SREモデルはGoogle固有の文脈(2004年・前例なき規模・ツール不在・無限資本)の産物であり、その文脈なしに模倣する「カーゴカルトSRE」は組織の本質的信頼性課題を隠蔽する危険がある。
## [2026-07-10] ingest-paper | Failure Trends in a Large Disk Drive Population
- Source: `.raw/papers/4445.pdf`
- Summary: [[@2007__FAST__Failure Trends in a Large Disk Drive Population]]
- Pages created: [[@2007__FAST__Failure Trends in a Large Disk Drive Population]], [[Eduardo Pinheiro]], [[Wolf-Dietrich Weber]], [[ハードディスク信頼性]]
- Pages updated: [[Luiz André Barroso]], [[データセンター信頼性]], [[障害予測]]
- Key insight: Google 本番 HDD 10 万台超の実証研究で、SMART 強シグナル(スキャンエラー 39×・オフライン再割り当て 21×)が存在する一方、障害ドライブの 56% 超がいかなる強 SMART シグナルも示さず個別障害予測の精度天井を定量化。温度・使用率は中程度レンジで障害との相関が従来通念より弱い。
## [2026-07-08] ingest-paper | Benchmarking the Overhead of Distributed Tracing Agents
- Source: `.raw/papers/3777884.3797004.pdf`
- Summary: [[@2026__ICPE__Benchmarking the Overhead of Distributed Tracing Agents]]
- Pages created: [[@2026__ICPE__Benchmarking the Overhead of Distributed Tracing Agents]], [[David Georg Reichelt]], [[Wilhelm Hasselbring]], [[MooBench]], [[Kieker]], [[トレーシングオーバーヘッド]]
- Pages updated: [[分散トレーシング]], [[継続的プロファイリング]]
- Key insight: 7 種の Java トレーシングエージェントを統一比較した結果、Kieker が最速(133.92 ns/depth)で OpenTelemetry は業界標準のわりに遅く(315.28 ns/depth)、Pinpoint と Scouter はスパン損失バグがある。OpenTelemetry の高オーバーヘッドの主因は HashMap の毎回コピー・ArrayBasedContext スタックコピー・過度なメタデータ管理であり、実装改善でオーバーヘッドを大幅削減できる。
## [2026-07-07] ingest-paper | VAST AI Operating System
- Source: `.raw/papers/vast-ai-operating-system.pdf`
- Summary: [[@2025__VAST Data__VAST AI Operating System]]
- Pages created: [[DASEアーキテクチャ]], [[@2025__VAST Data__VAST AI Operating System]]
- Pages updated: [[コンピュートストレージ分離]], [[分散メッセージブローカ]], [[VAST Data]]
- Key insight: DASE アーキテクチャが「ステートレス CNode + NVMe-oF 共有 SSD」でネームスペース分割を排除し、同一プール上で Object Store・Database・Event Broker・ベクトルデータベースを統合する。InsightEngine は RAG の権限/ライフサイクル/監査を構造的に一貫させる一方、全性能値がベンダー自己申告である点は批判的に扱う必要がある。
## [2026-07-06] ingest-paper | INTFusion: Unifying Network and Host Telemetry in Data Center Networks
- Source: `.raw/papers/1571262346.pdf`
- Summary: [[@2026__IFIP Networking__INTFusion - Unifying Network and Host Telemetry in Data Center Networks]]
- Pages created: [[Leonardo Alberro]], [[Matias Richart]], [[Eduardo Grampin]], [[Universidad de la República]], [[インバンドネットワークテレメトリ]], [[@2026__IFIP Networking__INTFusion - Unifying Network and Host Telemetry in Data Center Networks]]
- Pages updated: [[テレメトリ]], [[ネットワーク監視]], [[データセンター輻輳制御]]
- Key insight: INT ソース/シンクを smartNIC にオフロードしホスト eBPF と per-flow 融合する「エッジ終端 INT」が、ネットワーク/アプリ断片化を解消しつつスイッチ依存を最小化。フローレット抽象化と二層エクスポートが主要な設計革新。
## [2026-07-06] ingest-paper | Beyond Throughput: Performance and Energy Insights of LLM Inference Across AI Accelerators
- Source: `.raw/papers/Beyond_Throughput_Performance_and_Energy_Insights_of_LLM_Inference_Across_AI_Accelerators.pdf`
- Summary: [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]
- Pages created: [[Giacomo Brunetta]], [[Cerebras]], [[SambaNova]], [[AIアクセラレータ]], [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]
- Pages updated: [[LLM推論]], [[テンソル並列]], [[Mixture-of-Experts]]
- Key insight: データフローアクセラレータは小バッチで GPU 比 1 桁の優位を示すが、エネルギー効率では GPU が大きく勝る。推論では DP > TP が原則(~100% vs 60% スケーリング)だが VRAM 80% 超のモデルでは TP が必要という例外がある。
## [2026-07-06] ingest-paper | POSTER: Vedrfolnir: RDMA Network Performance Anomalies Diagnosis in Collective Communications
- Source: `.raw/papers/3744969.3748396.pdf`
- Summary: [[@2025__SIGCOMM__POSTER - Vedrfolnir - RDMA Network Performance Anomalies Diagnosis in Collective Communications]]
- Pages created: [[Yuxuan Chen]], [[Xiheng Li]], [[Fangzheng Jiao]], [[Chunming Hu]]
- Pages updated: [[Menghao Zhang]], [[Hawkeye]], [[RDMAネットワーク監視]], [[集合通信]]
- Key insight: 集合通信アルゴリズムをステップ単位に分解した待機グラフが co-flow 依存を可視化し、[[Hawkeye]] 比 98% テレメトリ削減を実現する。単一フロー監視では見えないホスト側クリティカルパスを「アルゴリズムのステップ」粒度で初めて診断軸にした。
## [2026-07-06] ingest-paper | ARGUS: Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters
- Source: `.raw/papers/arxiv-2606.20374.pdf`
- Summary: [[@2026__arXiv__ARGUS - Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters]]
- Pages created: [[@2026__arXiv__ARGUS - Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters]], [[Jiasheng Zhou]]
- Pages updated: [[LLM学習モニタリング]], [[GPU観測性]], [[ストラグラー]], [[Tencent]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], [[wiki/sources/_index]], [[wiki/entities/_index]]
- Key insight: LLM 訓練における fail-slow は CPU コールスタック・フレームワークセマンティクス・GPU カーネルの 3 層を独立に計装することではじめて完全に可視化できる。ストラグラーはパイプライン並列のバブル転写と勾配同期アライメントにより他ランクに拡散・収束するため、単一ランクの観測では根本ランクを特定できない。
## [2026-07-06] ingest-paper | KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI
- Source: `.raw/papers/arxiv-2607.01788.pdf`
- Summary: [[@2026__ASE__KRCA - An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI]]
- Pages created: [[@2026__ASE__KRCA - An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI]], [[Jiamin Jiang]]
- Pages updated: [[根本原因分析]], [[LLMによる根本原因分析]], [[因果発見]], [[Yongqian Sun]], [[Dan Pei]], [[Kuaishou Technology]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], [[wiki/sources/_index]], [[wiki/entities/_index]]
- Key insight: ハイパースケール(20万超サービス)では LLM ベース RCA の前提である「探索空間の手に届く規模」が成立しないため、API レベルドリルダウンで候補を3サービスに絞り込む段階が必須となる。時系列統計の因果発見は20メトリクス超で20%以下に急落するが、メトリクスの意味情報からスケルトン構造を事前確定することで LLM 推論の精度を60%超に維持できる。
## [2026-07-06] ingest-paper | A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis
- Source: `.raw/papers/arxiv-2606.29193.pdf`
- Summary: [[@2026__arXiv__A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis]]
- Pages created: [[@2026__arXiv__A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis]], [[Yuanhong Cai]]
- Pages updated: [[RCA評価設計]], [[SRE Benchmark]], [[Changhua Pei]], [[Dan Pei]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], [[wiki/sources/_index]], [[wiki/entities/_index]]
- Key insight: 既存の RCA ベンチマークは最終回答のみを採点する成果志向であり、推論プロセス評価パラダイム(Localization/Identification/Reason の3軸)と key-evidence / causal-chain の2形式ラベルにより、キーワード一致による偶発的正解と証拠に基づく体系的推論を初めて分離できる大規模競技検証済みベンチマーク。
## [2026-07-06] ingest | 博士論文を書くということ(北村匡平)
- Source: `.raw/articles/na8026bd18753-2026-07-01.md`
- Summary: [[博士論文を書くということ]]
- Pages created: [[博士論文を書くということ]], [[北村匡平]], [[日本の博士教育]]
- Pages updated: [[wiki/index]], [[wiki/hot]], [[wiki/log]]
- Key insight: 博士論文を「研究の最終形態」ではなく「特定の時点での研究のまとめ(最初の大きなマイルストーン)」と位置づけることで、人文学系博士課程の無期限先送り問題を回避できる。修士からの継続性と早期査読投稿が完成への近道。
## [2026-07-05] ingest-paper | Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum
- Source: `.raw/papers/2025__Mid4CC__Self-Hosted_WebAssembly_Runtime_for_Runtime_Neutral_Checkpoint_Restore.pdf`
- Summary: [[@2025__Mid4CC__Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint-Restore in Edge-Cloud Continuum]]
- Pages created: [[@2025__Mid4CC__Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint-Restore in Edge-Cloud Continuum]], [[Self-Hosted WebAssembly Runtime]], [[Chiwawa]], [[Wizard]], [[CRIU]]
- Pages updated: [[WebAssembly]], [[ランタイム中立チェックポイント]], [[Application Checkpointing]], [[VM Migration]], [[Edge-cloud Collaboration]], [[Yuki Nakata]], [[Katsuya Matsubara]], [[Future University Hakodate]], [[SAKURA internet Inc.]], [[WasmEdge]], [[WAMR]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: 自己ホスト型 WebAssembly ランタイムを中間層とすることで、ホストランタイム改変なしにランタイムと最適化戦略の両中立な C/R を実現でき、wasmtime・WAMR・WasmEdge のいずれをホストとしても 1076 KB の一貫した小さな実行状態でライブマイグレーションが可能になる。
## [2026-07-05] ingest-paper | Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing
- Source: `.raw/papers/Seamless_Self-Healing_in_WebAssembly_Container_Orchestration_with_Runtime-Neutral_Checkpointing.pdf`
- Summary: [[@2025__CANDARW__Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing]]
- Pages created: [[@2025__CANDARW__Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing]], [[ランタイム中立チェックポイント]], [[ホットリスタート]], [[動的ランタイム切り替え]], [[セルフヒーリング]], [[Yuzuki Saito]]
- Pages updated: [[WebAssembly]], [[チェックポイント]], [[コンテナオーケストレーション]], [[Katsuya Matsubara]], [[Yuki Nakata]], [[Daigo Fujii]], [[Future University Hakodate]], [[SAKURA internet Inc.]], [[WasmEdge]], [[WAMR]]
- Key insight: ランタイム中立チェックポイントを用いることで、Wasm コンテナの障害回復をホットリスタートへ、メモリ圧力緩和を動的ランタイム切り替えへ拡張し、Pod 退避なしのセルフヒーリングを実現できる。
## [2026-07-06] ingest-paper | A Checkpoint/Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters
- Source: `.raw/papers/apsys24posters-final73.pdf`
- Summary: [[@2024__APSys__A Checkpoint-Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters]]
- Pages created: [[@2024__APSys__A Checkpoint-Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters]], [[Wasm3]]
- Pages updated: [[WebAssembly]], [[ランタイム中立チェックポイント]], [[Application Checkpointing]], [[VM Migration]], [[Edge-cloud Collaboration]], [[チェックポイント]], [[Daigo Fujii]], [[Katsuya Matsubara]], [[Yuki Nakata]], [[Future University Hakodate]], [[SAKURA internet Inc.]], [[WasmEdge]], [[WAMR]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: standard interpreter と fast interpreter の間では、プログラムカウンタ・コントロールスタック・バリュースタックを変換することで、異種 Wasm interpreter 間の checkpoint/restore が可能になる。fast interpreter のカスタムコード上の実行点を Wasm バイトコード上の相対アドレスに対応づけ、型情報付きでスタックレイアウトを変換する手法が核心である。
---
type: meta
title: "Operation Log"
date: 2026-06-02 18:46
tags:
- 2026/06/02
- meta
- 2026/06/18
- 2026/06/19
- 2026/06/21
- 2026/06/20
- 2026/06/17
- 2026/06/16
- 2026/06/15
- 2026/06/23
- 2026/06/24
- 2026/06/25
- 2026/06/26
- 2026/06/27
- 2026/06/28
- 2026/06/29
- 2026/06/30
- 2026/07/01
- 2026/07/02
- 2026/07/04
- 2026/07/05
- log
- enrich-source
status: evergreen
related:
- "[[index]]"
- "[[hot]]"
- "[[overview]]"
created: 2026-06-02
updated: 2026-07-05
---
## [2026-07-05] ingest-paper | Stateful VM Migration Among Heterogeneous WebAssembly Runtimes for Efficient Edge-cloud Collaborations
- Source: `.raw/papers/3642968.3654816.pdf`
- Summary: [[@2024__EdgeSys__Stateful VM Migration Among Heterogeneous WebAssembly Runtimes for Efficient Edge-cloud Collaborations]]
- Pages created: [[@2024__EdgeSys__Stateful VM Migration Among Heterogeneous WebAssembly Runtimes for Efficient Edge-cloud Collaborations]], [[WebAssembly]], [[VM Migration]], [[Edge Computing]], [[Edge-cloud Collaboration]], [[Application Checkpointing]], [[Daigo Fujii]], [[WasmEdge]], [[WAMR]]
- Pages updated: [[チェックポイント]], [[Yuki Nakata]], [[Katsuya Matsubara]], [[Future University Hakodate]], [[SAKURA internet Inc.]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: WasmEdge と WAMR 間の異種ランタイムステートフルVMマイグレーションは、命令アドレスを関数インデックス+オフセットに変換し、型情報に基づいてスタックを復元することで実現可能であり、dirty memory検出によりCRIU比30〜100倍のチェックポイント時間短縮を達成する。
## [2026-07-05] ingest-paper | Reducing Attack Surface with Container Transplantation for Lightweight Sandboxing
- Source: `.raw/papers/3609510.3609820.pdf`
- Summary: [[@2023__APSys__Reducing Attack Surface with Container Transplantation for Lightweight Sandboxing]]
- Pages created: [[@2023__APSys__Reducing Attack Surface with Container Transplantation for Lightweight Sandboxing]], [[Container Transplantation]], [[Capability-based Security]], [[Capsicum]], [[Lightweight Sandboxing]], [[Shintaro Suzuki]], [[gVisor]], [[Kata Containers]], [[FreeBSD]], [[Linux]], [[Linuxulator]]
- Pages updated: [[コンテナ仮想化]], [[Yuki Nakata]], [[Katsuya Matsubara]], [[SAKURA internet Inc.]], [[Future University Hakodate]], [[Docker]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: Linux コンテナを FreeBSD カーネルへ移植し Capsicum を透過適用することで、gVisor より小さい性能オーバーヘッド(UnixBench システムコールオーバーヘッドで runC 比 22% 悪化)を維持しつつ、Linux カーネル固有の脆弱性攻撃を回避できる。
## [2026-07-05] ingest-paper | Concentrated Isolation for Container Networks Toward Application-aware Sandbox Tailoring
- Source: `.raw/papers/2026_Unknown_Concentrated_isolation_container_networks_toward.pdf`
- Summary: [[@2021__UCC__Concentrated Isolation for Container Networks Toward Application-aware Sandbox Tailoring]]
- Pages created: [[@2021__UCC__Concentrated Isolation for Container Networks Toward Application-aware Sandbox Tailoring]], [[Sandbox Tailoring]], [[コンテナネットワーク分離]], [[Para-passthrough Hypervisor]], [[Yuki Nakata]], [[Katsuya Matsubara]], [[Ryosuke Matsumoto (SAKURA internet)|Ryosuke Matsumoto]], [[Future University Hakodate]], [[SAKURA internet Inc.]]
- Pages updated: [[コンテナ仮想化]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: BitVisor ベースの para-passthrough ハイパーバイザ Subaco が、runC と同等の起動時間を維持しつつ L2/L3/L4 のパケット偽装攻撃とネットワークリソース攻撃を防御し、Sandbox Tailoring がコンテナの性能と堅牢性のトレードオフを緩和する。
## [2026-07-04] ingest-paper | Extending Applications Safely and Efficiently
- Source: `.raw/papers/osdi25-zheng-yusheng.pdf`
- Summary: [[@2025__OSDI__Extending Applications Safely and Efficiently]]
- Pages created: [[@2025__OSDI__Extending Applications Safely and Efficiently]], [[Extension Interface Model]], [[Yanpeng Hu]], [[Xiaozheng Lai]], [[Dan Williams]], [[Andi Quinn]], [[Redis]], [[FUSE]], [[OpenSSL]]
- Pages updated: [[eBPF]], [[BPF]], [[uprobe]], [[Yusheng Zheng]], [[Tong Yu]], [[Yiwei Yang]], [[bpftime]], [[eunomia-bpf]], [[DeepFlow]], [[Nginx]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: EIM と bpftime により、eBPF スタイルの検証とハードウェア支援プロセス内隔離を組み合わせたユーザ空間アプリケーション拡張が、Nginx で 2% オーバーヘッドという高性能を実現する。
## [2026-07-04] ingest | The GPU Observability Gap: Why We Need eBPF on GPU devices
- Source: `.raw/articles/the-gpu-observability-gap-why-we-need-ebpf-on-gpu-devices-2026-07-04.md`
- Summary: [[@2025__eunomia.dev__The GPU Observability Gap - Why We Need eBPF on GPU devices]]
- Pages created: [[@2025__eunomia.dev__The GPU Observability Gap - Why We Need eBPF on GPU devices]], [[eGPU]], [[PTX 注入]]
- Pages updated: [[GPU観測性]], [[eBPF]], [[bpftime]], [[eunomia-bpf]], [[Yusheng Zheng]], [[Tong Yu]], [[Yiwei Yang]]
- Key insight: GPU 観測性のギャップを、bpftime による PTX/SPIR-V 注入で GPU カーネル内に eBPF を実行する技術で埋める方向性を整理した。
## [2026-07-04] ingest | CUDA Events - eBPF-based CUDA API Tracing
- Source: `.raw/articles/cuda-events-2026-07-04.md`
- Summary: [[@2026__eunomia.dev__CUDA Events - eBPF-based CUDA API Tracing]]
- Pages created: [[@2026__eunomia.dev__CUDA Events - eBPF-based CUDA API Tracing]], [[CUDA API トレース]], [[CUDA]], [[uprobe]], [[yunwei37]]
- Pages updated: [[eBPF]], [[GPU観測性]], [[動的計装]], [[eunomia-bpf]], [[bpftime]], [[libbpf]], [[NVIDIA]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: `libcudart.so` への eBPF uprobe で CUDA API 呼び出しをソース改変なしにトレースできる実装例。CPU 側入口の可視化と、bpftime/eGPU による GPU 内部計装の 2 層構造を具体化する。
## [2026-07-04] ingest | デジタルネイチャーの十年:計算的物質化から発酵する共在へ
- Source: `.raw/articles/n8157a439a58d-2026-07-04.md`
- Summary: [[@2026__note__デジタルネイチャーの十年 - 計算的物質化から発酵する共在へ]]
- Pages created: [[@2026__note__デジタルネイチャーの十年 - 計算的物質化から発酵する共在へ]], [[デジタル発酵]], [[デジタル蒸留]], [[Homo Convivium]], [[アクセシビリティ]], [[null2]], [[xDiversity]], [[Digital Nature Group]]
- Pages updated: [[計算機自然]], [[マタギドライヴ]], [[批判的デジタルネイチャー]], [[落合陽一]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: デジタルネイチャーは、計算的物質化の存在論から、生成AI以後の記号・身体・記憶・制度・環境が発酵する関係論へ拡張される。
## [2026-07-04] gap-analysis | wiki 構造ギャップ分析
- Source: wiki-lens Gap Finder レポート(2026-07-04)
- Pages created: `wiki/meta/gap-report-2026-07-04.md`
- Key insight: 概念共引用分析で 10 件の実在ギャップを特定。最強シグナルは「LLMによる根本原因分析 — インシデント管理」(共引用 11 件)。Tier 0 ブリッジ候補として @2024__ASE__MRCA(スコア 14.46)、@2023__TSC__DiagFusion、@2019__ICSE__Incident Triage の 3 件を DOI 検証済み。MoE — 集合通信ギャップに対し Lancet (MLSys 2024) を Tier 1 推薦。12 件の意図的分離(異なる MOC 系統)と 8 件の弱いシグナルを除外。
## [2026-07-04] ingest | 計算機自然からマタギドライヴへ - 自然の再審と脱人間知性的文明論の10年
- Source: `.raw/articles/n6d470a8f0f75-2026-07-04.md`
- Summary: [[@2026__note__計算機自然からマタギドライヴへ - 自然の再審と脱人間知性的文明論の10年]]
- Pages created: [[@2026__note__計算機自然からマタギドライヴへ - 自然の再審と脱人間知性的文明論の10年]], [[落合陽一]], [[計算機自然]], [[マタギドライヴ]], [[批判的デジタルネイチャー]], [[主体なき美の美学]], [[ヌルのテトラレンマ]]
- Pages updated: [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/log]]
- Key insight: 計算機自然は「計算と自然の融合」という技術的ビジョンから、自然概念の翻訳不可能性、辺縁的実存、環境・権力・身体への批判を内部化する運動体へ再定式化される。
## [2026-07-03] ingest-paper | Artificial intelligence tools expand scientists' impact but contract science's focus
- Source: `.raw/papers/nature-s41586-025-09922-y.txt`(HTML 抽出テキスト。PDF は Nature ペイウォールにより取得不可)
- Summary: [[@2026__Nature__Artificial intelligence tools expand scientists' impact but contract science's focus]]
- Pages created: [[@2026__Nature__Artificial intelligence tools expand scientists' impact but contract science's focus]], [[Qianyue Hao]], [[Fengli Xu]], [[Yong Li]], [[James Evans]], [[AIと科学の集中化]]
- Pages updated: [[AI研究自動化]](横断的知見・未解決の問いに Hao et al. 観察を追記), sources/_index, entities/_index, concepts/_index, index, hot, log
- Key insight: AI ツールは個人の生産性・キャリアを加速する一方、科学全体のトピック多様性を縮小させる——「個人合理性 vs 集団的帰結」の乖離を 4,130 万件の大規模データで実証した。
## [2026-07-02] ingest-paper | PLaMo 2 Technical Report
- Source: `.raw/papers/arxiv-2509.04897.pdf`(29 ページ、arXiv 2509.04897v2)
- Summary: [[@2025__arXiv__PLaMo 2 Technical Report]]
- Pages created: [[@2025__arXiv__PLaMo 2 Technical Report]], [[Preferred Networks]], [[PLaMo 2]]
- Pages updated: [[ハイブリッドアテンションアーキテクチャ]], [[スライディングウィンドウアテンション]], [[状態空間モデル]], [[モデル圧縮]], [[LLM推論]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/concepts/_index]], [[wiki/entities/_index]]
- Key insight: PLaMo 2 は Mamba + SWA の効率的構成で始めつつ、長距離検索限界が見えた段階で CPT によりフルアテンション相当へ移行する。ハイブリッドアーキテクチャは固定設計ではなく、訓練段階で効率と検索性能を切り替える設計対象になる。
## [2026-07-02] ingest-paper | XProf: An Open, Scalable and Extensible Profiling System for the Modern ML Stack
- Source: `.raw/papers/mlsys2026-xprof-slides.pdf`(MLSys 2026 発表スライド PDF。論文 PDF は OpenReview Cloudflare 保護のため取得不可)
- Summary: [[@2026__MLSys2026__XProf - An Open, Scalable and Extensible Profiling System for the Modern ML Stack]]
- Pages created: [[@2026__MLSys2026__XProf - An Open, Scalable and Extensible Profiling System for the Modern ML Stack]], [[MLプロファイリング]], [[Rooflineモデル]], [[Robert Hundt]], [[OpenXLA]]
- Pages updated: [[Google]](XProf 開発元として MLプロファイリングセクション追加)、各索引・hot・log
- Key insight: TraceMe の「遅延相関 + ロックフリー + スレッドローカル」設計がキロバイトオーダーのトレース量で 0.3% 未満オーバーヘッドを実現する——「全データ生成 + 遅延的収集」という 分散トレーシング の Hindsight と同型の設計思想が ML システム計装にも現れる。
## [2026-07-02] ingest-paper | Machine Learning Fleet Efficiency: Improving TPU Systems at Scale with ML Productivity Goodput
- Source: `.raw/papers/3734_MKeQyls.pdf`(スライド PDF 32 ページ、MLSys 2026 Industry Track。論文 PDF は OpenReview Cloudflare 保護のため取得不可)
- Summary: [[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]]
- Pages created: [[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]], [[ML Productivity Goodput]], [[Arissa Wongpanich]], [[Vijay Janapa Reddi]], [[Borg]]
- Pages updated: [[Google]](ML フリート効率セクション追加)、[[GPUクラスタ運用]](横断的知見・未解決の問い・関連ソース追記)、各索引・hot・log
- Key insight: 「有用な仕事」の定義を Scheduling/Runtime/Program の 3 層に分解しないと、高利用率フリートでもボトルネックの在り処が見えない——従来の Capacity・Occupancy・Duty Cycle はいずれもこの分解を持たない。
## [2026-07-02] ingest-paper | The Case for Learned Index Structures
- Source: `.raw/papers/arxiv-1712.01208.pdf`(30 ページ、arXiv 1712.01208v3)
- Summary: [[@2017__arXiv__The Case for Learned Index Structures]]
- Pages created: [[@2017__arXiv__The Case for Learned Index Structures]], [[Learned Index]], [[Alex Beutel]], [[Ed H. Chi]], [[Neoklis Polyzotis]]
- Pages updated: [[B-Tree]], [[Tim Kraska]], [[Jeffrey Dean]], [[Google]], [[MIT]], [[wiki/sources/_index]], [[wiki/concepts/_index]], [[wiki/entities/_index]], [[wiki/index]], [[wiki/hot]]
- Key insight: B-Tree は learned index に置き換えられる古典構造であるだけでなく、CDF を近似する回帰木として再解釈され、RMI のフォールバックやハイブリッド構成要素として残る。
## [2026-07-02] ingest-paper | Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki
- Source: `.raw/papers/arxiv-2605.25480.pdf`(15 ページ、arXiv 2605.25480v2)
- Summary: [[@2026__arXiv__Retrieval as Reasoning]]
- Pages created: [[@2026__arXiv__Retrieval as Reasoning]], [[Retrieval-as-Reasoning]], [[Haoliang Ming]]
- Pages updated: [[LLM Wikiパターン]], [[LLM向け情報検索]], [[Tencent]], [[wiki/index]], [[wiki/hot]], [[wiki/sources/_index]], [[wiki/concepts/_index]], [[wiki/entities/_index]]
- Key insight: Karpathy の LLM Wiki 抽象パターンが LLM-Wiki(Ming ら、Tencent 2026)によって初めて操作化され、マルチホップ QA で実証された。改善は「より強い類似度関数」でなく「知識とエージェントの間の契約変更」から来る。
## [2026-07-02] wiki-query deep | インシデント対応の教科書
- Query: SRE のインシデント対応に関する各種文献を基礎から応用まで体系化した教科書を編纂
- Pages read: [[インシデント管理]], [[Incident Commander]], [[インシデント調査戦略]], [[インシデント認識論]], [[インシデント重大度評価]], [[障害緩和]], [[クラウド障害ライフサイクル]], [[変更起因インシデント]], [[人的要因]], [[Common Grounding]], [[Followship]], [[Handover Communications]], [[ChatOps]], [[アンインシデント]], [[インシデントメトリクス]], [[インシデント対応成熟度モデル]], [[インシデントシミュレーション]], [[インシデント後の人的回復]], [[オンコールストレス管理]], [[インシデントレスポンスAIレベル]]
- Page created: [[wiki/questions/インシデント対応の教科書]]
- Structure: 9 部 19 章(基礎/指揮/調査と診断/緩和/人間/測定/組織/訓練/AI と未来) + 付録(用語集/推奨読書/ソースマッピング)
- Key insight: ポストモーテム(姉妹編)を除外し、検知から緩和までのライフサイクルを ICS 指揮体系、認識論的調査手法、フォロワーシップ、人的要因、組織成熟度、AI 自動化の軸で統合
## [2026-07-01] ingest-slides | Epistemology of Incident Management
- Source: `.raw/slides/srecon26americas-kingsman-epistemology/srecon26americas-kingsman-epistemology.pdf`
- Visual pages: `.raw/slides/srecon26americas-kingsman-epistemology/pages/` (49ページ全読)
- Media: `.raw/slides/srecon26americas-kingsman-epistemology/transcript.md` (YouTube 英語自動字幕 1018 行)
- Summary: [[@2026__SREcon26Americas__Epistemology of Incident Management]]
- Pages created: [[@2026__SREcon26Americas__Epistemology of Incident Management]], [[Jack Kingsman]], [[インシデント認識論]]
- Pages updated: [[Atlassian]], [[インシデント管理]], [[仮説駆動RCA]]
- Key insight: インシデント対応の各フェーズを「知識の問い」として再定義することで、証拠収集・探索・仮説・テストに認識論的ツールを与える。"Incidents are all about knowledge"
## [2026-07-01] ingest | Modern Microprocessors: A 90-Minute Guide (Jason Patterson, lighterra.com)
- Source: `.raw/articles/modernmicroprocessors-2026-07-01.md`
- Summary: [[Modern-Microprocessors-A-90-Minute-Guide|Modern Microprocessors: A 90-Minute Guide]]
- Pages created: [[Modern-Microprocessors-A-90-Minute-Guide|Modern Microprocessors: A 90-Minute Guide]], [[パイプライン処理]], [[スーパースカラー実行]], [[分岐予測]], [[アウトオブオーダー実行]], [[VLIW]], [[同時マルチスレッディング]], [[SIMDベクトル処理]], [[メモリ階層とキャッシュ]], [[メモリウォール]], [[Brainiac設計]], [[チップレット]], [[AMD]]
- Pages updated: なし
- Key insight: プロセッサ性能は「クロック周波数」でなく IPC で決まる。電力の壁・ILP の壁・メモリウォールの3つの限界が現代アーキテクチャのすべてのトレードオフを規定する
## [2026-07-01] ingest-slides | Your System Has Recovered from an Incident, but Have Your Developers?
- Source: `.raw/slides/srecon18americas-woo-developer-recovery/srecon18americas-woo-developer-recovery.pdf`
- Visual pages: `.raw/slides/srecon18americas-woo-developer-recovery/pages/`(39ページ、うち5枚を `wiki/sources/_attachments/srecon18americas-woo-developer-recovery/` にコピー)
- Media: `.raw/slides/srecon18americas-woo-developer-recovery/media/audio.m4a` + `.raw/slides/srecon18americas-woo-developer-recovery/transcript.md`(YouTube `AttVD__QrAo`; Whisper 文字起こし 810 行取得済み)
- Summary: [[@2018__SREcon18Americas__Your System Has Recovered from an Incident, but Have Your Developers]]
- Pages created: [[@2018__SREcon18Americas__Your System Has Recovered from an Incident, but Have Your Developers]], [[Jaime Woo]], [[インシデント後の人的回復]]
- Pages updated: [[オンコールストレス管理]], [[人的要因]]
- Key insight: システム復旧後もエンジニアの 42.5% が強いストレスを抱え、80% がピアサポートをほぼ受けていない——セルフコンパッション介入は意図的に訓練できる
## [2026-07-01] ingest-slides | Tales from the VOID: The Scary Truth About Incident Metrics
- Source: `.raw/slides/srecon22americas-nash-incident-metrics/srecon22americas-nash-incident-metrics.pdf`
- Visual pages: `.raw/slides/srecon22americas-nash-incident-metrics/pages/`(29ページ、うち7枚を `wiki/sources/_attachments/srecon22americas-nash-incident-metrics/` にコピー)
- Media: none(transcript なし)
- Summary: [[@2022__SREcon22Americas__Tales from the VOID - The Scary Truth About Incident Metrics]]
- Pages created: [[@2022__SREcon22Americas__Tales from the VOID - The Scary Truth About Incident Metrics]]
- Pages updated: [[Courtney Nash]], [[Verica]], [[インシデントメトリクス]], [[ポストモーテム]], wiki/sources/_index.md, wiki/index.md, wiki/hot.md
- Key insight: VOID の 1,856 件実分布が MTTR の統計的不堅牢性を独立実証し、持続時間と深刻度の無相関(23h 11min 顧客影響ゼロ vs 21min Critical)を実データで示した。SREcon23 Americas「Far from the Shallows」の先行発表として位置づけられる。
## [2026-07-01] enrich | Modernizing Incident Response with LLMs, RAG, and the MCP の横断的知見を関連 concept へ追記
- Source: [[@2025__SREcon25EMEA__Modernizing Incident Response with LLMs, RAG, and the MCP]]
- 対象: 前回 ingest 時に touched としなかった 7 つの concept を追加調査し、横断的知見を追記
- Pages updated: [[ReAct]] / [[LLM評価]] / [[オンコール自動化]] / [[時系列マルチモーダルLLM]] / [[コンテキストエンジニアリング]] / [[インシデントレスポンスAIレベル]] / [[認知的徒弟制]]
- Key insight: Amazon の産業実装(ReAct 選好、Promptfoo 評価フライホイール、共通インターフェース化によるオンコール属人化対処、時系列画像化入力、組織語彙の埋め込み注釈、MCP 承認ゲート、共通推論による理解共有)が、学術的知見・他の産業実装との比較軸を複数の concept ページに追加した。
## [2026-07-01] ingest-slides | The Critical Resource Is You: Practical Destressing for On-Call Engineers
- Source: `.raw/slides/srecon26americas-long-destressing/srecon26americas-long-destressing.pdf`
- Visual pages: `.raw/slides/srecon26americas-long-destressing/pages/`(43ページ、うち9枚を `wiki/sources/_attachments/srecon26americas-long-destressing/` にコピー)
- Media: none(transcript 未取得)
- Summary: [[@2026__SREcon26Americas__The Critical Resource Is You - Practical Destressing for On-Call Engineers]]
- Pages created: [[Beth Adele Long]], [[Continuous Re-integration]], [[オンコールストレス管理]]
- Pages updated: [[人的要因]]
- Key insight: ANS は自己修正機能を持つが Ordinary Mind に抑制される。身体的介入(Body Scan / Breath / Movement / Boredom)がその回避策となる。
## [2026-07-01] ingest-slides | The Un-Incident: Extracting Value from the Gray Area of Incident Response
- Source: `.raw/slides/2025__SREcon25EMEA__The-Un-Incident/2025__SREcon25EMEA__The-Un-Incident.pdf`
- Visual pages: `.raw/slides/2025__SREcon25EMEA__The-Un-Incident/pages/`(26ページ、うち8枚を `wiki/sources/_attachments/2025__SREcon25EMEA__The-Un-Incident/` にコピー)
- Media: none(transcript 未取得)
- Summary: [[@2025__SREcon25EMEA__The Un-Incident]]
- Pages created: [[アンインシデント]], [[Andreas Deuschl]], [[Dynatrace]]
- Pages updated: [[インシデント管理]]
- Key insight: インシデント管理ライフサイクルの「入口の手前」に 30〜60% の学習機会があり、Gray Zone Playbook(4類型+サイクル)で体系化できる
## [2026-07-01] ingest-slides | Modernizing Incident Response with LLMs, RAG, and the MCP
- Source: `.raw/slides/srecon25emea-papapanagiotou-mcp-incident-response/srecon25emea-papapanagiotou-mcp-incident-response.pdf`
- Visual pages: `.raw/slides/srecon25emea-papapanagiotou-mcp-incident-response/pages/`(70ページ、うち7枚を `wiki/sources/_attachments/srecon25emea-papapanagiotou-mcp-incident-response/` にコピー)
- Media: `.raw/slides/srecon25emea-papapanagiotou-mcp-incident-response/transcript.md`(YouTube THX_qkVLMPw を Whisper で文字起こし)
- Summary: [[@2025__SREcon25EMEA__Modernizing Incident Response with LLMs, RAG, and the MCP]]
- Pages created: [[Theofilos Papapanagiotou]]
- Pages updated: [[Amazon]], [[Model Context Protocol]], [[agentic SRE]], [[RAGベースクラウド運用支援]]
- Key insight: Amazon の産業実装は MCP を「人間とエージェント共通のツールハンドル」として使い、IAM ロール分離で権限だけを変える認証設計を採る。時系列データを画像としてエージェントに渡すことで人間に近い水準の推論精度を得たという具体例も加わった。
## [2026-07-01] ingest-slides | Storytelling as an Incident Management Skill
- Source: `.raw/slides/srecon24americas-devesine-storytelling/srecon24americas-devesine-storytelling.pdf`
- Visual pages: `.raw/slides/srecon24americas-devesine-storytelling/pages/`(18ページ、うち4枚を `wiki/sources/_attachments/srecon24americas-devesine-storytelling/` にコピー)
- Media: `.raw/slides/srecon24americas-devesine-storytelling/transcript.md`(Whisper 音声文字起こし)
- Summary: [[@2024__SREcon24Americas__Storytelling as an Incident Management Skill]]
- Pages created: [[@2024__SREcon24Americas__Storytelling as an Incident Management Skill]]
- Pages updated: [[Laura de Vesine]], [[Datadog]], [[インシデントストーリー]], [[ポストモーテム]]
- Key insight: 人物中心の物語(「英雄の旅」)と因果論理中心の物語を目的別に使い分けるという整理、および「対応中の協調的ストーリーテリング」という新しい適用フェーズ、5段階「エンゲージングなポストモーテム」構成を追加した。
## [2026-07-01] ingest-video | Incident Groundhog Day
- Source: `https://www.usenix.org/conference/srecon24emea/presentation/silatani` (YouTube: `AMDB0OV1cVs`)
- Transcript: `.raw/videos/AMDB0OV1cVs/transcript.md` (1967行、YouTube 自動字幕 VTT → dedup 変換)
- Frames: `.raw/videos/AMDB0OV1cVs/frames/` (31フレーム、10枚を `wiki/sources/_attachments/srecon24emea-silatani-groundhog-day/` にコピー)
- Summary: [[@2024__SREcon24EMEA__Incident Groundhog Day]]
- Pages created: [[Hamed Silatani]], [[Uptime Labs]], [[インシデントシミュレーション]]
- Pages updated: [[インシデント重大度評価]], [[Incident Commander]]
- Key insight: 20名実験で解決時間と経験は無相関。severity 議論への時間投資が解決時間を短縮し、Solo Artist vs Band Member の行動パターン差が主要分岐点。
## [2026-07-01] ingest-slides | Incident Management Metrics that Matter
- Source: `.raw/slides/srecon25americas-de-vesine-incident-management-metrics/srecon25americas-de-vesine-incident-management-metrics.pdf`
- Visual pages: `.raw/slides/srecon25americas-de-vesine-incident-management-metrics/pages/`(49 ページ全確認)
- Media: none(transcript なし)
- Summary: [[@2025__SREcon25Americas__Incident Management Metrics that Matter]]
- Pages created: [[wiki/sources/@2025__SREcon25Americas__Incident Management Metrics that Matter]], [[wiki/entities/Jamie Luck]], [[wiki/concepts/インシデントメトリクス]]
- Pages updated: [[wiki/entities/Laura de Vesine]](役職更新・発表追加), [[wiki/entities/Datadog]](発表追加), [[wiki/concepts/インシデント管理]](横断的知見追記)
- Key insight: MTTR は統計的ノイズ優位かつ逆インセンティブを生む。インシデント管理プロセスは目標を先に定義し、それを直接測る 8 次元の指標群で測定する。成熟した組織では MTTR が上昇するのが健全なサイン。
## [2026-07-01] ingest-slides | From 4 Hours to 8 Minutes with AI Agents that Transform SRE Incident Response
- Source: `.raw/slides/srecon25emea_slides-jausovec/srecon25emea_slides-jausovec.pdf`
- Visual pages: `.raw/slides/srecon25emea_slides-jausovec/pages/`(17ページ全確認)
- Media: none(transcript なし、デモはスライド未記録)
- Summary: [[@2025__SREcon25EMEA__From 4 Hours to 8 Minutes with AI Agents that Transform SRE Incident Response]]
- Pages created: [[Peter Jausovec]], [[Solo.io]], [[kagent]]
- Pages updated: [[インシデントレスポンスAIレベル]], [[エージェントシステム運用]]
- Key insight: AIRE フレームワークが示す能力4段階(Operational Knowledge / Awareness / Investigation / Resolution)は IR Levels の IR3〜IR4 の産業実装モデルに相当し、MCP が複数エージェント間のツール共有を実現する標準レイヤーとして浮上している
## [2026-07-01] ingest-video | Embracing the Multi-Party Dilemma: Incident Response Across Company Boundaries
- Source: URL https://www.usenix.org/conference/srecon23emea/presentation/butt(yt-dlp 解決 YouTube ID Veq7VUbPwWo。ヘルパーは url-only で終了したため、手動で yt-dlp/ffmpeg/whisper フォールバックを実行)
- Transcript: `.raw/videos/Veq7VUbPwWo/transcript.md`(whisper 自動文字起こし、1778行 VTT → 147行 30秒バケット化、全文読了)
- Frames: `.raw/videos/Veq7VUbPwWo/frames/`(20枚、7枚を添付・目視確認)
- Summary: [[@2023__SREcon23EMEA__Embracing the Multi-Party Dilemma - Incident Response Across Company Boundaries]]
- Pages created: [[Alex Elman]], [[SentinelOne]], [[Multi-Party Dilemma]]
- Pages updated: [[Sarah Butt]], [[Indeed]], [[Laura Maguire]], [[David D. Woods]], [[John Allspaw]], [[Richard I. Cook]], wiki/index.md, wiki/hot.md, wiki/sources/_index.md, wiki/entities/_index.md, wiki/concepts/_index.md
- Key insight: 組織境界を越えたインシデント対応では、顧客・ベンダーという2つの官僚制の間に自発的な一過性組織(transient organization)が形成され、時間圧力下で意思決定権限が官僚から現場の専門知識保持者へ移る多中心的統治モデル(polycentric governance)へ移行する。CDN ベンダーとの深い双方向情報共有により、片方だけでは決して発見できなかったリトライストーム誘発リスクを回避できた事例がこれを裏付ける。
## [2026-07-01] ingest-slides | Hard Choices, Tight Timelines: A Closer Look at Tradeoff Decisions during Incidents
- Source: `.raw/slides/2024__SREcon24Americas__Skip-Level-Tradeoff-Decisions/2024__SREcon24Americas__Skip-Level-Tradeoff-Decisions.pdf`(USENIX SREcon24 Americas、Dr. Laura Maguire (Trace Cognitive Engineering/OSU)・Courtney Nash (The VOID)、2024-03-19。公式ページ https://www.usenix.org/conference/srecon24americas/presentation/maguire はタイトルに「(Skip-Level)」を含むが、スライド本体タイトルにはこの語がなく、両者を aliases に併記)
- Visual pages: `.raw/slides/2024__SREcon24Americas__Skip-Level-Tradeoff-Decisions/pages/`(61ページ、全て目視確認)
- Media: transcript なし(公式ページに動画リンクの提示なし)
- Summary: [[@2024__SREcon24Americas__Hard Choices, Tight Timelines - A Closer Look at Tradeoff Decisions during Incidents]]
- Pages created: [[トレードオフ意思決定]]
- Pages updated: [[Laura Maguire]], [[Courtney Nash]], wiki/index.md, wiki/sources/_index.md, wiki/entities/_index.md, wiki/concepts/_index.md, wiki/hot.md
- Key insight: The Void のような大規模インシデントレポートデータベースは意思決定の「結果」は記録できても「推論過程」は構造的に記録されにくい。この限界を vignette(状況想定シナリオ)法で補うと、組織階層の上下(skip-level)で重視するトレードオフの軸が異なることが見えてくる——上級リーダーは事業継続性・評判・法務リスクを、対応者はシステム状態把握・復旧速度・認知負荷を重視する。
## [2026-07-01] ingest-video | What Is Incident Severity, but a Lie Agreed Upon?
- Source: URL https://www.usenix.org/conference/srecon24americas/presentation/ruppe(USENIX SREcon24 Americas、Em Ruppe、Jeli/PagerDuty。公式ページは WebFetch 403 のため curl+UA でフォールバック取得、埋め込み YouTube URL https://www.youtube.com/watch?v=3LwApIPFrTo を実体として使用)
- Transcript: `.raw/videos/srecon24americas-ruppe-incident-severity/transcript.md`(YouTube 自動字幕、1634行・全文読了)
- Frames: `.raw/videos/srecon24americas-ruppe-incident-severity/frames/`(17枚、全て目視確認)
- Summary: [[@2024__SREcon24 Americas__What Is Incident Severity, but a Lie Agreed Upon?]]
- Pages created: なし(既存 entity [[Emily Ruppe]]・[[Jeli]]・[[PagerDuty]] を再利用)
- Pages updated: [[Emily Ruppe]], [[Jeli]], [[PagerDuty]], [[インシデント重大度評価]], wiki/index.md, wiki/sources/_index.md
- Key insight: severity を巡る議論の長期化は severity 設計そのものの欠陥でなく、過小評価・過大評価・説明不足・組織の未成熟さといった組織的問題の兆候(カナリア)であり、Nash・Allspaw の「Severity は社交的調整物」という静的批判を、severity の摩擦を組織課題発見の材料として使う動的な運用手法へと補完する。
## [2026-07-01] ingest-video | The Incident Is The Way: Using Your Incidents to Win Reliability Investment
- Source: URL https://www.usenix.org/conference/srecon23emea/presentation/mccarthy(USENIX SREcon23 EMEA、Niall McCarthy、Afterpay。公式ページは WebFetch 403 のため curl+UA でフォールバック取得、埋め込み YouTube URL https://www.youtube.com/watch?v=aaaA7gS_EvQ を実体として使用)
- Transcript: `.raw/videos/srecon23emea-mccarthy-incident-is-the-way/transcript.md`(YouTube 自動字幕、54ブロック・全文読了)
- Frames: `.raw/videos/srecon23emea-mccarthy-incident-is-the-way/frames/`(22枚、全て目視確認)
- Summary: [[@2023__SREcon23EMEA__The Incident Is The Way - Using Your Incidents to Win Reliability Investment]]
- Pages created: [[Niall McCarthy]], [[Afterpay]]
- Pages updated: [[インシデント重大度評価]], wiki/index.md, wiki/sources/_index.md, wiki/entities/_index.md, wiki/concepts/_index.md, wiki/hot.md
- Key insight: 可用性(エラー率・応答時間)ベースの重大度評価は「正しさ(correctness)」の毀損を見落とす。エンジニアの意図でなく結果(実際にユーザーが被った害)を重大度判断の基準にすることで、Severity が「社交的調整物であり交渉可能」という既知の批判に対する具体的な処方箋になる。
## [2026-07-01] ingest-slides | The World Blew Up But We're All Okay: Managing a massive-scale incident at Datadog
- Source: URL https://www.usenix.org/conference/srecon23emea/presentation/de-vesine(USENIX SREcon23 EMEA、Laurent Bernaille・Laura de Vesine、Datadog)
- Slides: `.raw/slides/srecon23emea-datadog-outage/srecon23emea-datadog-outage.pdf`(76ページ、pages/ 配下の全画像を目視確認)
- Transcript: `.raw/slides/srecon23emea-datadog-outage/transcript.md`(Whisper 音声文字起こし、584行、`media/audio.m4a` より生成成功。YouTube 自動字幕は補助として残置)
- Summary: [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]]
- Pages created: [[Laurent Bernaille]]
- Pages updated: [[Laura de Vesine]], [[Datadog]], [[Kubernetes]], [[インシデント管理]], wiki/index.md, wiki/sources/_index.md, wiki/entities/_index.md, wiki/concepts/_index.md, wiki/hot.md
- Key insight: 「グローバルなネットワーク・設定・コントロールプレーンを持たない」という明示的な設計方針を掲げていても、全フリート共通の OS ディストリビューションという共有基盤自体が事実上のグローバルな障害波及経路になりうる。500人超・14時間で493人が入退室した Zoom 通話という規模でも、IC ローテーション+ワークストリーム自己組織化という最小限の骨格と、信頼・非難なき文化・即興力で乗り切れることも同時に示された。
## [2026-07-01] ingest-video | If I Can Do It on an Ambulance, You Can Do It in an Office: Scalable Incident Response Using ICS
- Source: URL https://www.youtube.com/watch?v=aOP796AlOKE(USENIX SREcon23 Americas、Thai Wood)
- Transcript: `.raw/videos/srecon23amer-wood-incident-command-system/transcript.md`(YouTube 自動字幕、67ブロック・全文読了)
- Frames: `.raw/videos/srecon23amer-wood-incident-command-system/frames/`(12枚、全て目視確認)
- Summary: [[@2023__SREcon23Americas__If I Can Do It on an Ambulance - Scalable Incident Response Using ICS]]
- Pages created: [[Thai Wood]], [[Resilience Roundup]]
- Pages updated: [[Incident Commander]], [[ダッシュボードとランブックの運用]], [[GameDay]], [[Richard I. Cook]], wiki/index.md, wiki/sources/_index.md, wiki/entities/_index.md, wiki/hot.md
- Key insight: 「ランブックは安全を買えない」という Wood の認識論的批判は、Douch の「ランブックは本質的に一時的であるべき」という運用面の処方箋と補完関係にあり、両者を合わせると「ランブックを恒久資産として扱わない」という結論に収束する。
## [2026-07-01] ingest-video | Incident Commanders
- Source: `.raw/videos/srecon23amer-granda-incident-commanders/`(YouTube: https://www.youtube.com/watch?v=VLGxGrNnWrY、USENIX SREcon23 Americas、Vanessa Huerta Granda・Emily Ruppe、Jeli)
- Transcript: `.raw/videos/srecon23amer-granda-incident-commanders/transcript.md`(YouTube 英語字幕、全 531 行を読了)
- Frames: `.raw/videos/srecon23amer-granda-incident-commanders/frames/`(12枚、全て目視確認。frame-003 で登壇者2名の氏名を確認)
- Summary: [[@2023__SREcon23Americas__Incident Commanders]]
- Pages created: [[インシデントアナリスト]]
- Pages updated: [[Vanessa Huerta Granda]], [[Emily Ruppe]], [[Jeli]], [[Incident Commander]], [[インシデント管理]]
- 話者の同一性判定: 本講演の Vanessa Huerta Granda は、既存の SREcon25/26([[Enova]] 在籍時)講演の entity と同一人物と確認(frame-003 の氏名表示・Jeli 所属の一致より)。本講演は 2023 年([[Jeli]] 在籍時)のより早いキャリア段階にあたるため、新規 entity は作成せず既存ページを更新した。
- Key insight: IC(Incident Commander)とインシデントアナリストは「似て非なる別々のスキルセット」であり、同一人物が両者を兼務すると IC が事後検証も担当することになり社会技術的要因を見落としやすい。
## [2026-07-01] ingest-slides | An Organizational Response to Incidents
- Source: `.raw/slides/2023-srecon-maguire-organizational-response-incidents/2023-srecon-maguire-organizational-response-incidents.pdf`(USENIX SREcon23 Americas, Laura Maguire, Jeli)
- Visual pages: `.raw/slides/2023-srecon-maguire-organizational-response-incidents/pages/`(101ページ、全て目視確認)
- Media: transcript なし(音声・動画は USENIX 公式ページ案内のみで直接リンク未確認、スライド画像のみに基づく)
- Summary: [[@2023__SREcon23Americas__An Organizational Response to Incidents]]
- Pages created: [[Followship]]
- Pages updated: [[Laura Maguire]], [[Jeli]], [[Incident Commander]], [[Joint Activity]], [[Common Grounding]]
- Key insight: Maguire 本人がFollowshipの定義に「adaptive choreography」という語を用いたことで、Matt Davisが別トークで引用していた「Adaptive Choreography(Response Trio)」が同一の理論的支柱であったことが裏付けられた。一方でMaguire本人はこの概念を「役割分担モデル」ではなく「IC以外の対応者全体の協調行動」というより広い射程で使っており、二次引用と一次資料の間で強調点の違いが明らかになった。
## [2026-07-01] ingest-slides | Epic Incidents of History: The 1979 NORAD Nuclear Near Miss
- Source: `.raw/slides/sre23amer-travaglini-norad-near-miss/sre23amer-travaglini-norad-near-miss.pdf`(USENIX SREcon23 Americas, Nick Travaglini, Honeycomb.io)
- Visual pages: `.raw/slides/sre23amer-travaglini-norad-near-miss/pages/`(34ページ、全て目視確認)
- Media: `.raw/slides/sre23amer-travaglini-norad-near-miss/transcript.md`(Whisper 未実行、YouTube 自動字幕フォールバック)
- Summary: [[@2023__SREcon23Americas__Epic Incidents of History - The 1979 NORAD Nuclear Near Miss]]
- Pages created: [[Nick Travaglini]], [[Honeycomb.io]]
- Pages updated: [[Vannevar Bush]], [[複雑システム障害論]], [[根本原因分析]], [[人的要因]]
- Key insight: Walker・Woods・Rayo(2016)の Distant-Proximal / Blunt-Sharp モデルを、1979年 NORAD 誤警報という歴史的事例に適用したことで、[[複雑システム障害論]]・[[根本原因分析]] の「単一根本原因の探索は構造的に成立しない」という命題が、ソフトウェアシステムに限らない一般則として裏付けられた。
## [2026-07-01] ingest-slides | Handover Communications in Software Operations: Findings from the Field
- Source: `.raw/slides/srecon23americas-todd-handover-communications/srecon23americas-todd-handover-communications.pdf`(USENIX SREcon23 Americas, Chad Todd, CrowdStrike)
- Visual pages: `.raw/slides/srecon23americas-todd-handover-communications/pages/`(38ページ、全て目視確認)
- Media: `.raw/slides/srecon23americas-todd-handover-communications/transcript.md`(Whisper transcript, 335行)
- Summary: [[@2023__SREcon23Americas__Handover Communications in Software Operations - Findings from the Field]]
- Pages created: [[Chad Todd]], [[CrowdStrike]], [[Lund University]], [[David D. Woods]], [[Emily Patterson]], [[Gary Klein]], [[Handover Communications]]
- Pages updated: [[Joint Activity]], [[Common Grounding]], [[レジリエンスエンジニアリング]]
- Key insight: Todd(SREcon23 Americas)が Joint Activity・Common Ground の双方を Klein et al.(2005)に明示的に帰属させたことで、既存 [[Common Grounding]] ページが特定していた書誌情報(Klein, Feltovich, Bradshaw, Woods 2005)との突き合わせが取れ、[[Joint Activity]] の未解決の問いの一部が解消された。
## [2026-07-01] ingest-video | Dashboards and Runbooks: Scrapbooking for Engineers
- Source: URL(`https://www.usenix.org/conference/srecon22apac/presentation/douch`)。動画本体は USENIX ログイン必須のため、YouTube 上の同一動画(`https://www.youtube.com/watch?v=llDMcZLTPSc`)から取得
- Transcript: `.raw/videos/llDMcZLTPSc/transcript.md`(YouTube 自動字幕、英語)
- Frames: `.raw/videos/llDMcZLTPSc/frames/`(20枚、全て目視確認)
- Summary: [[@2022__SREcon22APAC__Dashboards and Runbooks - Scrapbooking for Engineers]]
- Pages created: [[Colin Douch]], [[ダッシュボードとランブックの運用]]
- Pages updated: [[Cloudflare]]
- Key insight: ランブックの3クラス分類(自動化可能/自由記述/無価値)と「良いランブックは本質的に一時的であるべき」という原則が、事前計装されたテレメトリによるトンネルビジョンという論点を通じて症状ベースアラーティングの議論([[アクショナブルアラート]])と同型の構造を持つことを [[ダッシュボードとランブックの運用]] に記録した。
## [2026-07-01] ingest-slides | When Systems Flatline—Enhancing Incident Response with Learnings from the Medical Field
- Source: `.raw/slides/srecon21-butt-systems-flatline/srecon21-butt-systems-flatline.pdf`
- Visual pages: `.raw/slides/srecon21-butt-systems-flatline/pages/`(14ページ)
- Media: `.raw/slides/srecon21-butt-systems-flatline/transcript.md`(Whisper 文字起こし)
- Summary: [[@2021__SREcon21__When Systems Flatline - Enhancing Incident Response with Learnings from the Medical Field]]
- Pages created: [[Sarah Butt]]
- Pages updated: [[Salesforce]], [[Incident Commander]]
- Key insight: 医療分野のアルゴリズム誘導意思決定・迅速安定化・標準化チェックリストという3コンセプトが、Goldfuss の Nrrd chatbot(属人性排除)・WHO チェックリスト文化の系譜・Collins の Warm Blanket Fallacy とは異なる層(意思決定規律)という3点で [[Incident Commander]] の横断的知見を補強した。
## [2026-07-01] ingest-slides | Evolution of Incident Management at Slack
- Source: `.raw/slides/srecon21-chapman-incident-mgmt-slack/srecon21-chapman-incident-mgmt-slack.pdf`
- Visual pages: `.raw/slides/srecon21-chapman-incident-mgmt-slack/pages/`(41ページ)
- Media: `.raw/slides/srecon21-chapman-incident-mgmt-slack/transcript.md`(YouTube 音声 Whisper 文字起こし、301行)
- Summary: [[@2021__SREcon21__Evolution of Incident Management at Slack]]
- Pages created: [[Brent Chapman]]
- Pages updated: [[Slack Technologies]], [[PagerDuty]], [[インシデント管理]], [[Incident Commander]]
- Key insight: Google iMAG の設計者本人が Slack で ICS 実践を再構築した過程が、Major IC の7課題への個別解決策(Area Command・pillar別ローテーション等)として具体的に追跡できる。
## [2026-07-01] ingest-slides | The Math behind the Incident Aftermath: A Practical Guide to Measuring Incident Impacts (SREcon22 APAC)
- Source: `.raw/slides/srecon22apac-patel-incident-impact/srecon22apac-patel-incident-impact.pdf`
- Visual pages: `.raw/slides/srecon22apac-patel-incident-impact/pages/`(34ページ)
- Media: none(発表動画は USENIX ログインが必要なため未取得。transcript なし)
- Summary: [[@2022__SREcon22APAC__The Math behind the Incident Aftermath]]
- Pages created: [[Ashish Patel]], [[Sriram Srinivasan]], [[PayPal]], [[インシデント影響測定]]
- Key insight: FCI(Failed Customer Interactions)によりインシデントの顧客影響を、ベースライン予測トラフィックとの乖離+明示的エラー件数の合算で定量化し、Availability 指標と5軸セグメンテーションに変換できる。
## [2026-07-01] ingest-slides | Incident Response in Unfamiliar Sociotechnical Systems (SREcon20 Americas)
- Source: `.raw/slides/srecon20americas_slides_collins/srecon20americas_slides_collins.pdf`
- Visual pages: `.raw/slides/srecon20americas_slides_collins/pages/`(16ページ)
- Media: none(transcript なし)
- Summary: [[@2020__SREcon20Americas__Incident Response in Unfamiliar Sociotechnical Systems]]
- Pages created: [[Morgan Collins]], [[Salesforce]]
- Pages updated: [[Incident Commander]]
- Key insight: 熟練 Incident Commander の経験は不慣れな組織間対応での成功を保証しない(Warm Blanket Fallacy)。ICS 起源については既存ソース(Goldfuss, 2016)と地域・年代が食い違い、contradiction callout で両論併記した。
## [2026-07-01] ingest-video | Incident Response @ FB, Facebook's SEV Process
- Source: https://www.usenix.org/conference/srecon16europe/program/presentation/eason
- Transcript: `.raw/videos/srecon16europe-eason-fb-sev-process/transcript.md`
- Frames: `.raw/videos/srecon16europe-eason-fb-sev-process/frames/`
- Summary: [[@2016__SREcon16__Incident Response @ FB, Facebook's SEV Process]]
- Pages created: [[@2016__SREcon16__Incident Response @ FB, Facebook's SEV Process]], [[Gareth Eason]]
- Pages updated: [[Facebook]], [[Jay Parikh]], [[Pedro Canahuati]], [[Incident Commander]], [[インシデント重大度評価]], [[クロスインシデント分析]]
- Key insight: Facebook の IMOC が「技術的に直さない」という Incident Commander の核心定義(blame umbrella / human mutex)を New Relic(Goldfuss, 2016)と独立に同年確立していたこと、および FB の 2016 年メトリクスゲーミング警告が Granda(2025年、Enova)の「数値はコンテキストなしでは意味がない」という洞察に約9年先行していたこと。
## [2026-07-01] ingest-slides | You Can't Stop Fires with an Ambulance
- Source: `.raw/slides/srecon18asia_slides_chamberlain/srecon18asia_slides_chamberlain.pdf`
- Visual pages: `.raw/slides/srecon18asia_slides_chamberlain/pages/`(23ページ)
- Media: `.raw/slides/srecon18asia_slides_chamberlain/transcript.md`(Whisper)
- Summary: [[@2018__SREcon18Asia__You Can't Stop Fires with an Ambulance]]
- Pages created: [[Piers Chamberlain]], [[Xero]], [[Klaxon]], [[Multivac]], [[Report Card]]
- Pages updated: [[アラート管理]], [[クロスインシデント分析]]
- Key insight: Klaxon の顧客ページヒット率検知は既存の症状ベースアラーティング系譜に「顧客観測を一次シグナルとする」新しい介入点を加え、Chamberlain の専任チームなし単独手動集計はクロスインシデント分析の Granda 3要素が「発見」でなく「発見の継続性とスケール」を担保するものだと対比的に示した。
## [2026-07-01] ingest-slides | Fixing On-Call When Nobody Thinks It's (Too) Broken
- Source: `.raw/slides/srecon19americas-lykke-oncall/srecon19americas-lykke-oncall.pdf`
- Visual pages: `.raw/slides/srecon19americas-lykke-oncall/pages/`(34ページ)
- Media: `.raw/slides/srecon19americas-lykke-oncall/transcript.md`(YouTube自動字幕フォールバック)
- Summary: [[@2019__SREcon19 Americas__Fixing On-Call When Nobody Thinks It's (Too) Broken]]
- Pages created: [[Tony Lykke]], [[Hudson River Trading]]
- Pages updated: [[アラート疲労]]
- Key insight: 最小限の技術変更(フィルタ層追加のみ)+コミュニケーション過剰投資+git shortlogによる定量的バイイン可視化という組み合わせは、アラート疲労の既存事例(インセンティブ設計/技術的介入)の統合例が薄いという観察への具体的な反例であり、同時に「アラート削減自体が沈黙への不安を招く」という新しい副作用を明らかにした。
## [2026-07-01] enrich-question | SLI/SLO 教科書 — 第 8 章「応用と拡張」の充実化
- Summary: [[wiki/questions/SLI-SLO教科書]]
- Pages updated: [[wiki/questions/SLI-SLO教科書]]
- 未使用ソースを wiki 全体から棚卸しし、第 8 章に合う 3 件を新規統合: [[@2024__SRENext2024__Enabling Client-side SLO]](Luup のクライアントサイド SLO 事例。p75 採用根拠・Time Slice SLO・Multi-tiered SLOs)、[[@2025__SREcon25Americas__Is the S in SRE for Security]](Security Level Objectives 提唱。8.11 節を新設)、[[@2021__SREcon21__Beyond-Goldilocks-Reliability]](定常性モデルによる Goldilocks Reliability 批判。8.12 節を新設)。
- 既存節も深堀り: 8.3 節(SLO 拡散)に λ パラメータのトレードオフとコンフリクト分類を追記、8.7 節(IoT・モビリティ)に Luup 2024 事例を追記、8.9 節(カーボン認識 SLO)を CASCA の匿名化実験・GDS/RLDS/RDS 比較・宣言的再設定速度で全面拡充。
- 新設: 8.11 セキュリティ領域への応用、8.12 定常性モデル。既存 8.1〜8.10 の番号は維持(相互参照保護)。付録 A(文献年表)・付録 B(ソース一覧)・frontmatter(sources/related)も同期更新。
- 除外判断: [[@2026__SREcon26 Americas__Taming the Unpredictable - Reliability in Chaos]](SLO 言及薄い)、[[@2019__SREcon19 Americas__Latency SLOs Done Right]](第2章寄りでスコープ外)。
## [2026-07-01] ingest-slides | nrrd 911 ic me: The Incident Commander Role (Alice Goldfuss, SREcon16 Americas, 2016)
- Source: `.raw/slides/2016__SREcon16__nrrd-911-ic-me-The-Incident-Commander-Role/2016__SREcon16__nrrd-911-ic-me-The-Incident-Commander-Role.pdf`
- Visual pages: `.raw/slides/2016__SREcon16__nrrd-911-ic-me-The-Incident-Commander-Role/pages/`(51 ページ)
- Media: `.raw/slides/2016__SREcon16__nrrd-911-ic-me-The-Incident-Commander-Role/transcript.md`(Whisper 音声文字起こし 223 行)
- Summary: [[@2016__SREcon16__nrrd 911 ic me - The Incident Commander Role]]
- Pages created: [[@2016__SREcon16__nrrd 911 ic me - The Incident Commander Role]] / [[Alice Goldfuss]]
- Pages updated: [[New Relic]] / [[Incident Commander]]
- Key insight: ICS 草創期(New Relic 2012→2016)の実践証拠。「3日間→3時間」という具体的 ROI と Hubot/Nrrd による chatbot 自動化が、10年後の専任チーム化(Granda 2026)への進化と対比できる最初期ソース。
## [2026-07-01] ingest-paper | Software Engineering (Barry W. Boehm, 1976)
- Source: `.raw/papers/boehm-sw-eng-paper.pdf`
- Summary: [[@1976__IEEE-TC__Software Engineering]]
- Pages created: [[Barry W. Boehm]], [[TRW Systems and Energy Group]], [[ソフトウェアライフサイクル]], [[ソフトウェア要件工学]], [[ソフトウェア保守]]
- Pages updated: `wiki/sources/_index.md`, `wiki/entities/_index.md`, `wiki/concepts/_index.md`, `wiki/index.md`, `wiki/hot.md`
- Key insight: 1976 年時点でソフトウェア保守がライフサイクルコストの約 70% を占め、Area 2(応用ソフトウェアの要件・設計・テスト・保守)にはほぼ科学的基礎がないという診断が、50 年後の今もほぼ変わらず成立する。
## [2026-07-01] ingest-video | Incident Management and Chatops @ Netflix Feat Scorebot (Al Tobey, SREcon16, 2016)
- Source: `https://www.usenix.org/conference/srecon16/program/presentation/tobey`
- Audio: `.raw/videos/srecon16-tobey-incident-chatops/audio.m4a`(約 20 分 / 1207 秒)
- Frames: `.raw/videos/srecon16-tobey-incident-chatops/frames/`(12 枚)
- Transcript: `.raw/videos/srecon16-tobey-incident-chatops/whisper/`(Whisper small モデル処理中)
- Summary: [[@2016__SREcon16__Incident Management and Chatops @ Netflix Feat Scorebot]]
- Pages created: [[Al Tobey]], [[ChatOps]]
- Pages updated: [[Netflix]], [[インシデント管理]]
- Key insight: Scorebot(Netflix 2015-2016)は ChatOps によるインシデント管理操作自動化の最初期実践で、SAS(Microsoft 2011-2013)の機械学習診断と並ぶ LLM 前産業 AIOps の二本柱として位置づけられる。
## [2026-07-01] ingest-slides | Unified Theory of SRE (Emil Stolarsky, SREcon22 EMEA, 2022)
- Source: `.raw/slides/srecon22emea-stolarsky-unified-theory-sre/srecon22emea-stolarsky-unified-theory-sre.pdf`
- Visual pages: `.raw/slides/srecon22emea-stolarsky-unified-theory-sre/pages/` (48 ページ)
- Media: `.raw/slides/srecon22emea-stolarsky-unified-theory-sre/transcript.md`(YouTube 自動字幕 696 行)
- Summary: [[@2022__SREcon22 EMEA__Unified Theory of SRE]]
- Pages created: [[@2022__SREcon22 EMEA__Unified Theory of SRE]] / [[Emil Stolarsky]]
- Pages updated: [[SRE]]
- Key insight: SRE Book は 2400+ インフラエンジニアを抱える Google の固有文脈で書かれており、スタートアップ(Default Dead)への無批判な適用はカーゴカルティングになる。SRE の組織設計・技術選定・SLO 導入・インシデントレビュー・オンコールはいずれも規模に合わせた根本的再構築が必要。
## [2026-07-01] ingest-video | Notes from Production Engineering (Pedro Canahuati, SREcon15, 2015)
- Source: https://www.usenix.org/conference/srecon15/program/presentation/canahuati (YouTube: ugkkza3vKbc)
- Transcript: `.raw/videos/ugkkza3vKbc/transcript.md`(自動字幕変換)
- Frames: `.raw/videos/ugkkza3vKbc/frames/`(39 フレーム)
- Summary: [[@2015__SREcon15__Notes from Production Engineering]]
- Pages created: [[@2015__SREcon15__Notes from Production Engineering]] / [[Pedro Canahuati]] / [[Jay Parikh]]
- Pages updated: [[Facebook]] / [[SRE組織変革]] / [[ポストモーテム]]
- Key insight: Facebook の SRO(2010-2014)は「集中型オンコールチームがクラッチとして機能しエンジニアリングチームの自立を阻む」という組織パターンの典型例であり、データ駆動の段階移行で 2014 年 3 月 31 日に解散。「FIX MORE, WHINE LESS」スローガンのTシャツ配布という物理的可視化が、ポストモーテム文化定着の戦術として記録されている。
## [2026-07-01] ingest-video | Keys to SRE (Ben Treynor Sloss, SREcon14, 2014)
- Source: https://www.usenix.org/conference/srecon14/technical-sessions/presentation/keys-sre (YouTube: n4Wf14e2jxQ)
- Transcript: `.raw/videos/n4Wf14e2jxQ/transcript.md`
- Frames: 未取得(動画ダウンロード進行中)
- Summary: [[@2014__SREcon14__Keys to SRE]]
- Pages created: [[@2014__SREcon14__Keys to SRE]]
- Pages updated: [[Ben Treynor Sloss]] / [[SRE]] / [[エラーバジェット]] / [[ポストモーテム]]
- Key insight: 2014 年の「ローンチオンブラック」ルールが SRE Book より 2 年早く操作的実施形態として提示されており、「ブレームレスポストモーテム」は 2014 年に既に公言済みで、Gallego(2016-2018)の理論精緻化の先行原則として位置づけられる。
## [2026-06-30] ingest-paper | Towards Intelligent Incident Management: Why We Need It and How We Make It
- Source: `.raw/papers/zchen_esecfse2020_towards.pdf.pdf`
- Summary: [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]]
- Pages created: [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]]
- Pages updated: [[Zhuangbin Chen]] / [[Qingwei Lin]] / [[インシデント管理]] / [[AIOps]] / [[グレイ障害]] / [[サービス依存グラフ]]
- Key insight: TTB(全影響サービスへの周知時間)が TTM と同等であることを 2 年超の Microsoft 実運用データで実証し、下流依存性の不完全性を根本原因として特定した pre-LLM 期の最初期産業 AIOps 実証研究。
## [2026-06-30] ingest-paper | Software Analytics for Incident Management of Online Services: An Experience Report (ASE 2013)
- Source: `.raw/papers/ase13experience-p022-p-19538-6242493-19510-preprint.pdf`
- Summary: [[@2013__ASE__Software Analytics for Incident Management of Online Services - An Experience Report]]
- Pages created: [[@2013__ASE__Software Analytics for Incident Management of Online Services - An Experience Report]] / [[Rui Ding]] / [[Qiang Fu]] / [[Tao Xie]]
- Pages updated: [[Jian-Guang Lou]] / [[Qingwei Lin]] / [[Dongmei Zhang]] / [[インシデント管理]] / [[ログベース障害診断]]
- Key insight: 最初期産業 AIOps の経験報告。問題主導への転換・HITL 設計の必要性・段階的信頼構築という 3 教訓が 2020 年代の LLM エージェント型 IM 研究まで継続している。
## [2026-06-30] ingest-paper | ART: A Unified Unsupervised Framework for Incident Management in Microservice Systems (ASE 2024)
- Source: `.raw/papers/ART24_to_ASE.pdf`
- Summary: [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]]
- Pages created: [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]] / [[Mingyu Mao]]
- Pages updated: [[Yongqian Sun]] / [[Binpeng Shi]] / [[Sibo Xia]] / [[Shenglin Zhang]] / [[Dan Pei]] / [[Minghua Ma]] / [[マルチモーダル障害診断]] / [[Fault Localization]] / [[AIOps]] / [[wiki/index]] / [[wiki/hot]]
- Key insight: AD・FT・RCL に共通する「偏差ベクトル(ILD/SLD)」という統一表現を SSL で学習することで、ラベル不要の 3 タスク統合が監視あり専門化手法を上回れる。CHA→TEM→CAL の依存関係モデル化順序(細粒度→粗粒度)が性能に決定的に効く。
## [2026-06-30] ingest-paper | Xpert: Empowering Incident Management with Query Recommendations via Large Language Models (ICSE 2024)
- Source: `.raw/papers/arxiv-2312.11988.pdf`
- Summary: [[@2024__ICSE__Xpert - Empowering Incident Management with Query Recommendations via Large Language Models]]
- Pages created: [[@2024__ICSE__Xpert - Empowering Incident Management with Query Recommendations via Large Language Models]] / [[Zhihao Yang]] / [[DSLクエリ推薦]]
- Pages updated: [[インシデント管理]] / [[LLMによる根本原因分析]] / [[wiki/index]] / [[wiki/hot]]
- Key insight: インシデント管理での DSL クエリ推薦を初めて実証。LLM の ICL が fine-tune 済み小型モデルを 7 例示で超え、BLEU/METEOR では見えない KQL 品質を Xcore(構文・サブコンポーネント・出力スキーマの 3 観点)で定量化した。
## [2026-06-30] ingest-paper | AI Assistants for Incident Lifecycle in a Microservice Environment: A Systematic Literature Review
- Source: `.raw/papers/arxiv-2410.04334.pdf`
- Summary: [[@2024__arXiv__AI Assistants for Incident Lifecycle in a Microservice Environment - A Systematic Literature Review]]
- Pages created: [[Dahlia Ziqi Zhou]] / [[Marios Fokaefs]] / [[York University]] / [[@2024__arXiv__AI Assistants for Incident Lifecycle in a Microservice Environment - A Systematic Literature Review]]
- Pages updated: [[インシデント管理]] / [[根本原因分析]] / [[異常検知]] / [[LLMによる根本原因分析]]
- Key insight: 2021〜2024 年の SLR で Detect フェーズが 54.8% と最大。Prepare/Post-incident は合計 12.9% にとどまり研究空白を定量化。LLM 手法が 38.7% で最多となったが、ユーザースタディ実施は 31 件中 5 件のみという評価偏重が課題。
## [2026-06-30] ingest-paper | X-lifecycle Learning for Cloud Incident Management using LLMs
- Source: `.raw/papers/arxiv-2404.03662.pdf`
- Summary: [[@2024__FSE__X-lifecycle Learning for Cloud Incident Management using LLMs]]
- Pages created: [[Aditya Singh]] / [[@2024__FSE__X-lifecycle Learning for Cloud Incident Management using LLMs]]
- Pages updated: [[Drishti Goel]] / [[Fiza Husain]] / [[Anjaly Parayil]] / [[Saravan Rajmohan]] / [[Supriyo Ghosh]] / [[Xuchao Zhang]] / [[Chetan Bansal]] / [[インシデント管理]] / [[根本原因分析]] / [[クラウドモニタリング]]
- Key insight: SDLC 複数段階の X-lifecycle データ(サービス依存・機能説明)補完が LLM RCA を改善するが、タスクに意味的に対応する情報のみが有効で、インコンテキスト例との組み合わせが必須。
## [2026-06-30] ingest-paper | FaultProfIT: Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems (ICSE-SEIP 2024)
- Source: `.raw/papers/arxiv-2402.17583.pdf`
- Summary: [[@2024__ICSE-SEIP__FaultProfIT - Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems]]
- Pages created: [[@2024__ICSE-SEIP__FaultProfIT - Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems]], [[障害パターンプロファイリング]]
- Pages updated: [[Junjie Huang]], [[Michael R. Lyu]], [[Zhuangbin Chen]], [[Jinyang Liu]], [[Yichen Li]], [[Jiazhen Gu]], [[Zhihan Jiang]], [[ポストモーテム]], [[障害傾向分析]], `wiki/index`, `wiki/hot`, `wiki/log`, `wiki/sources/_index`, `wiki/concepts/_index`
- Key insight: 障害パターンプロファイリングの自動化は「深刻度バイアス(手動ポストモーテムが S1-S3 に集中する問題)」を克服する最も直接的な手段であることが本番稼働 6 ヶ月で実証された。Graphormer の 5 階層グラフ全域アテンションが GCN・GAT の局所的畳み込みを大幅に上回り、タクソノミ構造の全体を掴むことが分類精度に直結する。
## [2026-06-30] ingest-paper | Fail through the Cracks: Cross-System Interaction Failures in Modern Cloud Systems (EuroSys 2023)
- Source: `.raw/papers/csi-failures.pdf`
- Summary: [[@2023__EuroSys__Fail through the Cracks - Cross-System Interaction Failures in Modern Cloud Systems]]
- Pages created: [[@2023__EuroSys__Fail through the Cracks - Cross-System Interaction Failures in Modern Cloud Systems]], [[クロスシステムインタラクション障害]], [[Lilia Tang]], [[Chaitanya Bhandari]], [[Indranil Gupta]]
- Pages updated: [[Tianyin Xu]], [[Purdue University]], [[分散システム障害]], [[クラウドインシデント]], `wiki/index`, `wiki/hot`, `wiki/log`, `wiki/sources/_index`, `wiki/entities/_index`, `wiki/concepts/_index`
- Key insight: CSI 障害は「どちらのシステムも仕様上は正しいのに障害が起きる」という新カテゴリ。クラウドインシデントの20%がこれに起因し、既存の耐障害機構はすべて単一システム内を保護するためCSI障害に無力。コネクタモジュール(コードベース5%未満)が修正の86%を占めることが、クロスシステムテストの実用的な切り口を示す。
## [2026-06-30] ingest-paper | Metastable Failures in Distributed Systems (HotOS 2021)
- Source: `.raw/papers/hotos21-s11-bronson.pdf`
- Summary: [[@2021__HotOS__Metastable Failures in Distributed Systems]]
- Pages created: [[@2021__HotOS__Metastable Failures in Distributed Systems]], [[Nathan Bronson]], [[Abutalib Aghayev]], [[Aleksey Charapko]], [[Timothy Zhu]], [[Rockset]], [[The Pennsylvania State University]], [[University of New Hampshire]]
- Pages updated: [[メタ安定障害]](横断的知見・未解決の問い・3 状態定義追記), `wiki/index`, `wiki/hot`, `wiki/log`, `wiki/sources/_index`, `wiki/entities/_index`, `wiki/concepts/_index`
- Key insight: 「再試行・キャッシュ・冗長化など信頼性向上機能が sustaining effect の温床になる」という逆説が本論文の核心。[[グレイ障害]] の提唱(HotOS 2017)と並んで分散システムの「見えない障害」パターンを定式化した 2 本柱の一方。隠れキャパシティと広告キャパシティの乖離が事故の種であり、2 年以上未解決だったリンク不均衡障害は 1 行の修正で解決した。
## [2026-06-30] ingest-paper | Gray Failure: The Achilles' Heel of Cloud-Scale Systems (HotOS 2017)
- Source: `.raw/papers/Huang-et-al.-2017---Gray-failure---The-achilles-heel-of-cloud-scale-systems.pdf`
- Summary: [[@2017__HotOS__Gray Failure - The Achilles' Heel of Cloud-Scale Systems]]
- Pages created: [[@2017__HotOS__Gray Failure - The Achilles' Heel of Cloud-Scale Systems]], [[Jacob R. Lorch]], [[Murali Chintalapati]], [[Randolph Yao]], [[差分可観測性]]
- Pages updated: [[Peng Huang]], [[Chuanxiong Guo]], [[Lidong Zhou]], [[Yingnong Dang]], [[Johns Hopkins University]], [[グレイ障害]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], `wiki/sources/_index`, `wiki/entities/_index`, `wiki/concepts/_index`
- Key insight: 「高冗長性が可用性を下げる逆説」の根本原因は、fail-stop を前提にした Observer がグレイ障害を見逃すことにある。解決は監視の多次元化——ハートビート1点からアプリの観測を近似するプローブ群へ。2017年に提唱されたこの差分可観測性という概念は、SuperBench・GrayScope・Harp など後続の大半の実装に継承されている。
## [2026-06-30] ingest-paper | mTCP: a Highly Scalable User-level TCP Stack for Multicore Systems (NSDI 2014)
- Source: `.raw/papers/nsdi14-paper-jeong.pdf`
- Summary: [[@2014__NSDI__mTCP - a Highly Scalable User-level TCP Stack for Multicore Systems]]
- Pages created: [[@2014__NSDI__mTCP - a Highly Scalable User-level TCP Stack for Multicore Systems]], [[EunYoung Jeong]], [[Dongsu Han]], [[ユーザーレベルTCPスタック]]
- Pages updated: [[KyoungSoo Park]], [[KAIST]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], `wiki/sources/_index`, `wiki/entities/_index`, `wiki/concepts/_index`
- Key insight: パケットI/Oとシステムコールバッチ化を統合したユーザーレベル実装が、カーネル改変なしに先行研究の個別最適化の和を超える性能を達成できる。コンテキストスイッチのコストは双方向バッチで複数イベントに分散させることが鍵。
## [2026-06-30] ingest-paper | An Updated Performance Comparison of Virtual Machines and Linux Containers (ISPASS 2015)
- Source: `.raw/papers/Felter-et-al.-2015---An-updated-performance-comparison-of-virtual-machines-and-linux-containers.pdf`
- Summary: [[@2015__ISPASS__An Updated Performance Comparison of Virtual Machines and Linux Containers]]
- Pages created: [[@2015__ISPASS__An Updated Performance Comparison of Virtual Machines and Linux Containers]], [[Wes Felter]], [[コンテナ仮想化]]
- Pages updated: [[Docker]], [[IBM Research]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], `wiki/sources/_index`, `wiki/entities/_index`, `wiki/concepts/_index`
- Key insight: コンテナはほぼ全ベンチマークで KVM と同等以上の性能。KVM の主要コストはランダム I/O(QEMU 経由で 50% 低下)とネットワーク遅延(+30µs/トランザクション)。Docker の落とし穴は AUFS と NAT。
## [2026-06-30] ingest | dsync: Efficient Block-wise Synchronization of Multi-Gigabyte Binary Data (LISA13)
- Source: `.raw/articles/knauth-2026-06-30.md`
- Summary: [[@2013__LISA__dsync - Efficient Block-wise Synchronization of Multi-Gigabyte Binary Data]]
- Pages created: [[@2013__LISA__dsync - Efficient Block-wise Synchronization of Multi-Gigabyte Binary Data]], [[Thomas Knauth]], [[ブロックレベル差分同期]]
- Pages updated: [[Christof Fetzer]], [[TU Dresden]], [[ファイルレベル同期]]
- Key insight: rsync のチェックサムベース事後検出をカーネル内ブロック追跡に置き換えることで最大 100 倍の同期高速化。同じ LISA13 の Marc Merlin 論文([[ファイルレベル同期]])と対比すると「同期粒度(ファイル vs ブロック)」という設計軸の両極が見える。
## [2026-06-30] ingest-paper | Scaling Memcache at Facebook
- Source: `.raw/papers/nsdi13-final170_update.pdf`
- Summary: [[@2013__NSDI__Scaling Memcache at Facebook]]
- Pages created: [[分散キャッシュ]], [[Rajesh Nishtala]], [[@2013__NSDI__Scaling Memcache at Facebook]]
- Pages updated: [[Facebook]], [[一貫性ハッシュ法]], [[Incast]], [[結果整合性]]
- Key insight: リースメカニズムが thundering herd 時のピーク DB クエリを 17K/s → 1.3K/s に削減。Gutter プールで障害時失敗率 99% 削減。キャッシュ整合性を「調整可能なパラメータ」として扱うベストエフォート方針が、性能・可用性と整合性のバランスを実現した。
## [2026-06-30] ingest | netmap: A Novel Framework for Fast Packet I/O (USENIX ATC '12)
- Source: `.raw/articles/netmap-fast-packet-io-2026-06-30.md`
- Summary: [[@2012__USENIX-ATC__netmap A Novel Framework for Fast Packet IO]]
- Pages created: [[@2012__USENIX-ATC__netmap A Novel Framework for Fast Packet IO]], [[Luigi Rizzo]], [[netmap]], [[カーネルバイパスネットワーキング]], [[ゼロコピーネットワーキング]]
- Pages updated: [[wiki/index.md]]
- Key insight: 共有メモリリング + プリアロケーション + バッチ syscall の三原則で、専用ハードウェアも OS 変更も不要のまま 10 Gbit/s 線速(14.88 Mpps)を達成。カーネル保護機構を捨てずにゼロコピーを実現した点が DPDK との本質的差異。
## [2026-06-30] ingest | SSLShader: Cheap SSL Acceleration with Commodity Processors (NSDI 2011)
- Source: `.raw/articles/sslshader-cheap-ssl-acceleration-commodity-processors-2026-06-30.md`
- Summary: [[@2011__NSDI11__SSLShader - Cheap SSL Acceleration with Commodity Processors]]
- Pages created: [[@2011__NSDI11__SSLShader - Cheap SSL Acceleration with Commodity Processors]], [[Keon Jang]], [[Sangjin Han]], [[Seungyeop Han]], [[Sue Moon]], [[SSL TLS アクセラレーション]]
- Pages updated: [[KyoungSoo Park]](SSLShader 追記), [[KAIST]](SSLShader・新著者追記)
- Key insight: 2011 年時点でコモディティ GPU による RSA アクセラレーションが最速 CPU 比 22〜31 倍を達成し、高価な専用アプライアンスに匹敵することを実証した。[[KyoungSoo Park]] グループの「ハードウェア限界突破」研究系譜の第一弾。
## [2026-06-30] ingest-paper | Live Upgrading Thousands of Servers from an Ancient Red Hat Distribution to 10 Year Newer Debian Based One (LISA '13)
- Source: `.raw/papers/lisa13-merlin.pdf`
- Summary: [[@2013__LISA__Live Upgrading Thousands of Servers from an Ancient Red Hat Distribution to 10 Year Newer Debian Based One]]
- Pages created: [[@2013__LISA__Live Upgrading Thousands of Servers from an Ancient Red Hat Distribution to 10 Year Newer Debian Based One]], [[Marc Merlin]], [[Richard Gooch]], [[ファイルレベル同期]], [[ライブアップグレード]]
- Pages updated: [[Google]](インフラ管理セクション追記)
- Key insight: パッケージマネージャーを迂回するファイルレベル同期は「いかなる状態からも回復できる」べき等性によってフリート管理の信頼性基盤となり、その基盤の上で段階的 rpm→deb 変換・ELF バイナリパッチという創意ある手法により OS 全体をフラグデーなしで入れ替えることができた。
## 2026-06-30 ingest | Mackerelを支える時系列データベース技術 (yuuk.io 2015)
- Source: `.raw/articles/high-performance-graphite-2026-06-30.md`
- Summary: [[@2015__yuuk.io__High-Performance-Graphite]]
- Pages created: [[Graphite]]
- Pages updated: [[Mackerel]], [[Yuuki Tsubouchi]], [[時系列データベース]]
- Key insight: whisper の RRD 型(固定サイズ・ローリング・精度劣化)と carbon-cache のマルチコア限界が [[HeteroTSDB]] 移行の設計的動機として連なる一次記録。
## 2026-06-30 ingest | ウェブシステムの運用自律化に向けた構想 (yuuk.io 2017)
- Source: `.raw/articles/the-concept-of-autonomous-web-system-2026-06-30.md`
- Summary: [[@2017__yuuk.io__ウェブシステムの運用自律化に向けた構想]]
- Pages created: [[@2017__yuuk.io__ウェブシステムの運用自律化に向けた構想]], [[Experimentable Infrastructure]]
- Pages updated: [[Yuuki Tsubouchi]], [[Hatena]], [[SRE]]
- Key insight: 「SRE = 信頼性を制約条件として費用を最小にする最適化問題」という定義と、観測・制御・実験の3軸で構成される Experimentable Infrastructure の初出。2017年時点の Yuuki Tsubouchi の自律運用ビジョンの起点。
## [2026-06-30] ingest-article | 2015年Webサーバアーキテクチャ序論(yuuk.io 2015)
- Source: `.raw/articles/2015-webserver-architecture-2026-06-30.md`
- Summary: [[@2015__yuuk.io__2015年Webサーバアーキテクチャ序論]]
- Pages created: [[Webサーバアーキテクチャ]]
- Pages updated: [[C10K問題]], [[epoll]], [[Yuuki Tsubouchi]]
- Key insight: Web サーバアーキテクチャの 5 モデル分類(シリアル・プリフォーク・マルチスレッド・イベント駆動・ハイブリッド)を体系化し、C10K問題・epoll との設計レイヤーでの連接を確立した。
## [2026-06-30] ingest-article | Webシステムにおけるデータベース接続アーキテクチャ概論(yuuk.io 2015)
- Source: `.raw/articles/architecture-of-database-connection-2026-06-30.md`
- Summary: [[@2015__yuuk.io__architecture-of-database-connection]]
- Pages created: [[データベース接続モデル]], [[コネクションプーリング]], [[PgBouncer]], [[Pgpool]]
- Pages updated: [[Yuuki Tsubouchi]]
- Key insight: RDBMSは元々少数クライアントとのステートフル通信向けで多数クライアントとはインピーダンスミスマッチがある。PostgreSQL=プロセスモデルでプロキシ型プーリング必須、MySQL=スレッドモデルで都度接続が多い、という2大DBの設計差が接続戦略を大きく左右する。
## [2026-06-30] ingest-article | Linux マルチコアスケール カーネルチューニング(yuuk.io 2015)
- Source: `.raw/articles/linux-networkstack-tuning-rfs-2015-03-31.md`
- Summary: [[@2015__yuuk.io__linux-networkstack-tuning-rfs]]
- Pages created: [[@2015__yuuk.io__linux-networkstack-tuning-rfs]], [[RFS(Receive Flow Steering)]], [[RPS(Receive Packet Steering)]], [[RSS(Receive Side Scaling)]]
- Pages updated: [[Yuuki Tsubouchi]], `wiki/index.md`, `wiki/hot.md`
- Key insight: RFS は Linux 2.6.35+ でハードウェア非依存にシングルキュー NIC の CPU 偏りを解消する最もコスパの高いカーネルチューニング手法。
## [2026-06-30] re-ingest-article | サーバーレスアーキテクチャ再考 (yuuk.io blog 2019)
- Source: `.raw/articles/rethinking-serverless-architecture-2019-09-11.md`
- Summary: [[@2019__yuuk.io__Rethinking-Serverless-Architecture]]
- Pages created: [[Knative]], [[OpenFaaS]]
- Pages updated: [[@2019__yuuk.io__Rethinking-Serverless-Architecture]](後記「サーバーレスデータベース展望」追記)
- Key insight: 記事末尾の @tzkb 議論から生まれた「DB のデータ構造を BaaS+FaaS に分解する」アイデアは、その後の Neon・Aurora Serverless 等のサーバーレス指向クラウドネイティブ DB と方向性が一致しており、2019 年時点での先見性がある。
## [2026-06-30] wiki-ingest | 工学としてのSRE再訪 — SRE NEXT 2024 登壇後記 (yuuk.io blog)
- Source: `.raw/articles/srenext2024-blog-2026-06-30.md`
- Summary: [[@2024__yuuk.io__SRE-NEXT-2024]]
- Pages created: なし(既存ページに補完追記)
- Pages updated: [[@2024__yuuk.io__SRE-NEXT-2024]](イベント統計・準備プロセス・Gist リンク追記)、[[アラート疲労]](オープンチャレンジとの接続を横断的知見に追記)
- Key insight: SRE コミュニティが 2016〜2026 年に多数の解法を報告してきた「オオカミ少年アラート問題」が、2024 年時点でも SRE の工学的未解決課題と位置づけられている。技術・組織的知識の蓄積と個々の組織への定着の間にギャップが存在することを示す。
## [2026-06-30] ingest-paper | An AI system to help scientists write expert-level empirical software (Nature 2026)
- Source: `.raw/papers/arxiv-2509.06503.pdf`
- Summary: [[@2026__Nature__An AI system to help scientists write expert-level empirical software]]
- Pages created: [[@2026__Nature__An AI system to help scientists write expert-level empirical software]], [[LLMドリブンコード探索]], [[スコアリング可能タスク]], [[Michael P. Brenner]]
- Pages updated: [[コードLLM]], [[DeepMind]], [[Google Research]]
- Key insight: ERA(LLM + PUCT 木探索)が複数の科学ドメイン(scRNA-seq・COVID-19 疫学・時系列・地理空間・神経科学・数値積分)で人手の最高水準を超えた初のシステム。「同一 LLM 推論コストなら Best-of-N より木探索が有効」という命題を 5 種の LLM で実証(Table 1)。
## [2026-06-30] ingest-paper | Towards end-to-end automation of AI research (Nature 2026)
- Source: `.raw/papers/s41586-026-10265-5.pdf`
- Summary: [[@2026__Nature__Towards end-to-end automation of AI research]]
- Pages created: [[@2026__Nature__Towards end-to-end automation of AI research]], [[AI研究自動化]], [[エージェント型科学探索]], [[自動査読]], [[Chris Lu]], [[Cong Lu]], [[Robert Tjarko Lange]], [[Yutaro Yamada]], [[Shengran Hu]], [[Jakob Foerster]], [[David Ha]], [[Jeff Clune]]
- Pages updated: [[Sakana AI]]
- Key insight: 完全AI生成論文がトップML会議(ICLR 2025 ICBINB, 採択率70%)の正式査読を通過した初事例。自動査読者の均衡精度が人間と同等(69% vs 66%)。基盤モデル世代と計算量の両軸でスケーリングする。
## [2026-06-30] ingest-slides | Enabling Client-side SLO (SRE NEXT 2024, Wataru Tsuda)
- Source: `.raw/slides/20240804_SRENEXT2024/20240804_SRENEXT2024.pdf`
- Visual pages: `.raw/slides/20240804_SRENEXT2024/pages/` (41 ページ全ページ画像確認済み)
- Media: none(transcript なし)
- Summary: [[@2024__SRENext2024__Enabling Client-side SLO]]
- Pages created: [[@2024__SRENext2024__Enabling Client-side SLO]]
- Pages updated: [[Wataru Tsuda]], [[Luup]], [[SLI-SLO段階的導入]]
- Key insight: クライアントサイド SLO は BLE 操作・Firestore 直接通信という「API を迂回するユーザー体験」を捕捉するために必要。p75 SLI の根拠を Core Web Vitals(LCP Good = 75%ile)から借用することで PdM/SWE との合意コストを下げられる。
## [2026-06-30] ingest-slides | Practices for Making Alerts Actionable (SRE NEXT 2020, Sohei Iwahori)
- Source: `.raw/slides/practices-for-making-alerts-actionable/practices-for-making-alerts-actionable.pdf`
- Visual pages: `.raw/slides/practices-for-making-alerts-actionable/pages/` (41 ページ、p.1-24 画像確認、p.25-41 テキスト抽出で補完)
- Media: none(transcript なし)
- Summary: [[@2020__SRENext2020__Practices for Making Alerts Actionable]]
- Pages created: [[@2020__SRENext2020__Practices for Making Alerts Actionable]]
- Pages updated: [[Sohei Iwahori]], [[GREE, Inc]], [[アクショナブルアラート]], [[アラート疲労]]
- Key insight: 振り分けの3段階(Slack通知のみ/JIRA自動起票/PagerDuty)と定型アクション自動化(Alert Operator)の組み合わせが、月300件超のピークを月180件前後に安定させた(約4割削減)。
## [2026-06-30] ingest-slides | 電動マイクロモビリティのシェアサービス「LUUP」におけるEnabling SLOの実践 (SRE NEXT 2023, Wataru Tsuda)
- Source: `.raw/slides/20230929_SRENEXT2023/20230929_SRENEXT2023.pdf`
- Visual pages: `.raw/slides/20230929_SRENEXT2023/pages/` (35 ページ全件確認)
- Media: none(transcript なし)
- Summary: [[@2023__SRENext2023__電動マイクロモビリティのシェアサービス「LUUP」におけるEnabling SLOの実践]]
- Pages created: [[@2023__SRENext2023__電動マイクロモビリティのシェアサービス「LUUP」におけるEnabling SLOの実践]], [[Wataru Tsuda]], [[Luup]]
- Pages updated: [[サービスレベル目標]](IoT CMC 概念 × CUJ 拡張・Enabling SLO 組織パターンの横断的知見追記)
- Key insight: IoT 向け SLI 設計では CUJ ではなく CMC(Critical Machine Communication)が起点になる——「マシンが期待通りに動作できる状態」を計測する Luup 独自概念で、物理デバイス SRE の SLI 定義の核にある。
## [2026-06-30] ingest-slides | Who owns the Service Level? (SRE NEXT 2022, 近藤武士)
- Source: `.raw/slides/srenext2022-chaspy-who-owns-service-level/srenext2022-chaspy-who-owns-service-level.pdf`
- Visual pages: `.raw/slides/srenext2022-chaspy-who-owns-service-level/pages/` (79 ページ全件確認)
- Media: none(transcript なし)
- Summary: [[@2022__SRENext2022__Who owns the Service Level?]]
- Pages created: [[@2022__SRENext2022__Who owns the Service Level?]], [[近藤武士]], [[Recruit]], [[スタディサプリ]]
- Pages updated: [[サービスレベル目標]](「定義・観察」と「行動」の分離という新前提条件追記), [[エラーバジェット]](Error Budget Policy 行動定着の組織的前提・リリースストップ幻想の 2 知見追記)
- Key insight: SLI/SLO の定義・観察文化は醸成できても Error Budget Policy に従った行動まで至らない失敗の根本原因は「非機能要求への予算・権限が開発チームになかった」組織的制約であり、技術戦略グループによる 1:1:1 予算配分という制度的変更で初めて解決された——測定技術の問題でなく組織設計の問題。
## [2026-06-30] ingest-slides | プロダクトオーナーとしてSLOに向き合う 〜Mackerelチームの事例〜 (SRE NEXT 2023, 渡辺 起)
- Source: `.raw/slides/2023__SRENext2023__PO-to-SLO-Mackerel/2023__SRENext2023__PO-to-SLO-Mackerel.pdf`
- Visual pages: `.raw/slides/2023__SRENext2023__PO-to-SLO-Mackerel/pages/` (39 ページ全件確認)
- Media: none(transcript なし)
- Summary: [[@2023__SRENext2023__プロダクトオーナーとしてSLOに向き合う 〜Mackerelチームの事例〜]]
- Pages created: [[@2023__SRENext2023__プロダクトオーナーとしてSLOに向き合う 〜Mackerelチームの事例〜]], [[渡辺 起]]
- Pages updated: [[Mackerel]](SLO 導入事例・チーム構成・DORA 位置・Error Budget Policy の実態を追記), [[サービスレベル目標]](PO 視点の横断的知見・ユーザー主語定義・仮値スタートパターン追記), [[エラーバジェット]](「最初は最も緩いアクション」パターンの3社横断知見追記)
- Key insight: Mackerel PO が SLO 導入で得た最大の恩恵は「判断が減ること」——数値基準によりチームが自律判断できる状態を作ることが、プロダクトオーナーにとっての SLO の主動機であると PO 目線で明示した初期事例。
## [2026-06-30] ingest-slides | Measuring Availability the Player Focused Way (SREcon25 Americas, Maxfield Stewart)
- Source: `.raw/slides/sre25amer_slides-stewart/sre25amer_slides-stewart.pdf`
- Visual pages: `.raw/slides/sre25amer_slides-stewart/pages/` (50 ページ全件確認)
- Media: none(transcript なし)
- Summary: [[@2025__SREcon25Americas__Measuring Availability the Player Focused Way - How Riot Games Changed Its Availability Culture]]
- Pages created: [[@2025__SREcon25Americas__Measuring Availability the Player Focused Way - How Riot Games Changed Its Availability Culture]], [[Maxfield Stewart]], [[Riot Games]], [[Derek Defields]], [[Player Journey]]
- Pages updated: [[サービスレベル目標]](CCU 重み付き可用性計測・CEO OKR 定着手法の横断的知見追記)
- Key insight: プレイヤー分(Player Minutes)という CCU 重み付きの可用性指標により、「プレイヤー体験(Player Journey)」で SLO を定義し CEO OKR に接続することで、Riot Games の可用性が 3 年で 97-98% → 99% に改善した。
## [2026-06-30] ingest-slides | DO, RE, Me: Measuring the Effectiveness of Site Reliability Engineering (SREcon22 Americas, Dave Stanke)
- Source: `.raw/slides/2022__SREcon22Americas__DO-RE-Me/2022__SREcon22Americas__DO-RE-Me.pdf`
- Visual pages: `.raw/slides/2022__SREcon22Americas__DO-RE-Me/pages/` (49 ページ全件確認)
- Media: none(transcript なし)
- Summary: [[@2022__SREcon22Americas__DO RE Me - Measuring the Effectiveness of Site Reliability Engineering]]
- Pages created: [[@2022__SREcon22Americas__DO RE Me - Measuring the Effectiveness of Site Reliability Engineering]]
- Pages updated: [[Dave Stanke]], [[DORA]], [[SRE]]
- Key insight: DORA 2021 が SRE を初めて定量調査し、信頼性が Software Delivery Performance のビジネス成果への影響を乗算的に増幅する「force multiplier」であることを実証した。
## [2026-06-30] ingest-slides | Is the S in SRE for "Security"? (SREcon25 Americas, John Benninghoff)
- Source: `.raw/slides/2025__SREcon25Americas__Is-the-S-in-SRE-for-Security/2025__SREcon25Americas__Is-the-S-in-SRE-for-Security.pdf`
- Visual pages: `.raw/slides/2025__SREcon25Americas__Is-the-S-in-SRE-for-Security/pages/` (29 ページ全件確認)
- Media: none(transcript なし)
- Summary: [[@2025__SREcon25Americas__Is the S in SRE for Security]]
- Pages created: [[@2025__SREcon25Americas__Is the S in SRE for Security]], [[John Benninghoff]], [[Security Differently]], [[Safety-II]], [[Security Level Objectives]]
- Pages updated: (なし)
- Key insight: セキュリティのトップ2コントロール(攻撃面管理・パッチ頻度)はSREの中核業務と同一。Safety-IIの「分布の右シフト」モデルがセキュリティ = 組織パフォーマンスの一側面という捉え直しを支える。
## [2026-06-30] ingest-slides | How to SRE When Everything is Already on Fire (SREcon19 EMEA, Alex Hidalgo + Alex Lee)
- Source: `.raw/slides/2019__SREcon19EMEA__How-to-SRE-When-Everythings-Already-on-Fire/2019__SREcon19EMEA__How-to-SRE-When-Everythings-Already-on-Fire.pdf`
- Visual pages: `.raw/slides/2019__SREcon19EMEA__How-to-SRE-When-Everythings-Already-on-Fire/pages/` (105 ページ全件確認)
- Media: none(transcript なし)
- Summary: [[@2019__SREcon19EMEA__How to SRE When Everything is Already on Fire]]
- Pages created: [[@2019__SREcon19EMEA__How to SRE When Everything is Already on Fire]], [[Alex Hidalgo]], [[Alex Lee]]
- Pages updated: [[Squarespace]], [[アラート疲労]], [[サービスレベル目標]], [[エラーバジェット]], [[ポストモーテム]]
- Key insight: エラーバジェット枯渇が「全力対処の組織的許可証」として機能した実例と、ICS による 37 時間インシデント管理を実証した。
## [2026-06-30] ingest-slides | Beyond Sequential: A Recipe for Async Pipeline Observability and Alerting (SREcon25 Americas)
- Source: `.raw/slides/2025__SREcon25Americas__Beyond-Sequential/2025__SREcon25Americas__Beyond-Sequential.pdf`
- Visual pages: `.raw/slides/2025__SREcon25Americas__Beyond-Sequential/pages/` (50 pages)
- Media: `.raw/slides/2025__SREcon25Americas__Beyond-Sequential/transcript.md`(YouTube 自動字幕 EN から変換、機械精度)
- Summary: [[@2025__SREcon25Americas__Beyond Sequential - A Recipe for Async Pipeline Observability and Alerting]]
- Pages created: [[@2025__SREcon25Americas__Beyond Sequential - A Recipe for Async Pipeline Observability and Alerting]], [[Jash Mistry]], [[Gabriela Medvetska]]
- Pages updated: [[eBay]], [[サービスレベル目標]], [[エラーバジェット]], [[イベントベースSLO]], [[アラート疲労]]
- Key insight: 非同期パイプラインでは RETRY を Valid Events から除外することが可用性 SLI の設計基盤となる。レイテンシ SLI は複数ホップの累積時間を Prometheus histogram に記録する end-to-end 計装が必要。マルチウィンドウ・マルチバーンレートアラートに加え、メトリクス欠損を独立検知するデータ損失アラートを必ず併置する。
## [2026-06-30] ingest-slides | 9 Things You Should Do When Starting to Use SLOs (SREcon23 EMEA)
- Source: `.raw/slides/2023__SREcon23EMEA__9-Things-You-Should-Do-When-Starting-to-Use-SLOs/2023__SREcon23EMEA__9-Things-You-Should-Do-When-Starting-to-Use-SLOs.pdf`
- Visual pages: `.raw/slides/2023__SREcon23EMEA__9-Things-You-Should-Do-When-Starting-to-Use-SLOs/pages/` (40 pages)
- Media: transcript なし(audio.m4a 生成済み、Whisper 未完了)
- Summary: [[@2023__SREcon23EMEA__9 Things You Should Do When Starting to Use SLOs]]
- Pages created: [[@2023__SREcon23EMEA__9 Things You Should Do When Starting to Use SLOs]], [[Sal Furino]], [[SLODLC]]
- Pages updated: [[サービスレベル目標]], [[SLI-SLO段階的導入]]
- Key insight: SLO 導入の 9 アドバイスを 3 カテゴリで体系化。「成功率 > エラー率」の SLI 設計原則、ステークホルダー別時間窓(24h/14D/Monthly)、SLODLC の 5 フェーズライフサイクル、「Observability Without Action is Just Storage」の格言。
## [2026-06-30] ingest-slides | Run, Walk, Crawl, or How We Failed Our Way to SLO Readiness (SREcon25 EMEA)
- Source: `.raw/slides/2025__SREcon25EMEA__Run-Walk-Crawl/2025__SREcon25EMEA__Run-Walk-Crawl.pdf`
- Visual pages: `.raw/slides/2025__SREcon25EMEA__Run-Walk-Crawl/pages/` (51 pages)
- Media: transcript なし(YouTube 動画 URL 未取得)
- Summary: [[@2025__SREcon25EMEA__Run Walk Crawl or How We Failed Our Way to SLO Readiness]]
- Pages created: [[@2025__SREcon25EMEA__Run Walk Crawl or How We Failed Our Way to SLO Readiness]], [[Rob Durst]], [[Spring Health]]
- Pages updated: [[サービスレベル目標]], [[SLI-SLO段階的導入]]
- Key insight: SLO 導入は社会技術的問題であり、オブザーバビリティ基盤が揃っていても「所有権・標準プロセス・保護時間」の 3 条件が欠ければ何度でも頓挫する。4 条件「SLO 準備度チェックリスト」は段階的導入の前提条件診断ツールとして機能する。
## [2026-06-30] ingest-slides | Not All Minutes Are Equal: The Secret behind SLO Adoption Failure (SREcon23 Americas)
- Source: `.raw/slides/2023__SREcon23Americas__Not-All-Minutes-Are-Equal/2023__SREcon23Americas__Not-All-Minutes-Are-Equal.pdf`
- Visual pages: `.raw/slides/2023__SREcon23Americas__Not-All-Minutes-Are-Equal/pages/` (40 pages)
- Media: audio.m4a あり。transcript なし(Whisper 失敗・YouTube 字幕 HTTP 429)
- Summary: [[@2023__SREcon23Americas__Not-All-Minutes-Are-Equal]]
- Pages created: [[@2023__SREcon23Americas__Not-All-Minutes-Are-Equal]], [[Michael Goins]], [[Troy Koss]], [[イベントベースSLO]]
- Pages updated: [[Capital One]], [[エラーバジェット]]
- Key insight: 時間スライス SLO は分をリクエスト数に関係なく 1 票として扱うため、ピーク時の深刻インシデントがバジェット消費に反映されず、イベントベース集計に切り替えると深刻度との比例関係が回復する。
## [2026-06-30] ingest-slides | Measuring Reliability: What Got Us Here Won't Get Us There (SREcon22 EMEA)
- Source: `.raw/slides/2022__SREcon22EMEA__Measuring-Reliability/2022__SREcon22EMEA__Measuring-Reliability.pdf`
- Visual pages: `.raw/slides/2022__SREcon22EMEA__Measuring-Reliability/pages/` (42 pages)
- Media: none(transcript なし、YouTube 動画 URL 取得不可)
- Summary: [[@2022__SREcon22EMEA__Measuring Reliability - What Got Us Here Won't Get Us There]]
- Pages created: [[@2022__SREcon22EMEA__Measuring Reliability - What Got Us Here Won't Get Us There]]
- Pages updated: [[Štěpán Davidovič]] / [[サービスレベル目標]] / [[エラーバジェット]]
- Key insight: SLI/SLO モデルは「信頼性測定」ではなく特定の問いへの回答モデルであり、ステークホルダー(オンコール〜CEO)ごとに全く異なる時間窓と対象 SLI 数が必要。現場では既に SLO ウィンドウと目標値を無視したアドホックモデルを構築しており、これを形式化することが次のステップ。
## [2026-06-30] ingest-slides | HPC Downtime Budgets: Moving SRE Practice to the Rest of the World (SREcon16 Europe)
- Source: `.raw/slides/2016__SREcon16Europe__Downtime-Budgets/2016__SREcon16Europe__Downtime-Budgets.pdf`
- Visual pages: `.raw/slides/2016__SREcon16Europe__Downtime-Budgets/pages/` (37 pages)
- Media: `.raw/slides/2016__SREcon16Europe__Downtime-Budgets/transcript.md`(YouTube 自動字幕変換、機械精度)
- Summary: [[@2016__SREcon16Europe__HPC Downtime Budgets]]
- Pages created: [[@2016__SREcon16Europe__HPC Downtime Budgets]], [[Cory Lueninghoener]], [[Los Alamos National Laboratory]]
- Pages updated: [[エラーバジェット]](HPC 適応横断的知見・Wolf 余剰時間問い追記)
- Key insight: エラーバジェットの本質は「リクエスト失敗率」という単位にはなく「リソースを追跡して意思決定に使う」構造にある。HPC では「時間」単位で同じ原則が機能する。
## [2026-06-30] ingest-slides | SLX: An Extended SLO Framework to Expedite Incident Recovery (SREcon21)
- Source: `.raw/slides/2021__SREcon21__SLX-Extended-SLO-Framework/2021__SREcon21__SLX-Extended-SLO-Framework.pdf`
- Visual pages: `.raw/slides/2021__SREcon21__SLX-Extended-SLO-Framework/pages/` (40 pages)
- Media: transcript なし(audio.m4a は生成済み、Whisper 未完了、YouTube 字幕フォールバックも未取得)
- Summary: [[@2021__SREcon21__SLX - An Extended SLO Framework to Expedite Incident Recovery]]
- Pages created: [[@2021__SREcon21__SLX - An Extended SLO Framework to Expedite Incident Recovery]], [[Qian Ding]], [[Xuan Zhang (Ant Group)]]
- Pages updated: [[Ant Group]], [[サービスレベル目標]], [[異常検知]]
- Key insight: SLO は検知には強いが調査(Investigation)には向かない——SLF/SLD の拡張と SLX Graph で「時系列相関のある異常 SLO 依存チェーン」を自動絞り込み、調査フェーズの認知負荷を下げる。
## [2026-06-30] ingest-slides | Principled Performance Analytics (SREcon22 Americas)
- Source: `.raw/slides/sre22amer-desai-principled-performance-analytics/sre22amer-desai-principled-performance-analytics.pdf`
- Visual pages: `.raw/slides/sre22amer-desai-principled-performance-analytics/pages/` (40 pages)
- Media: transcript 処理中(YouTube URL あり: `https://www.youtube.com/watch?v=zOu5cLBu4LI`、Whisper 未完了)
- Summary: [[@2022__SREcon22Americas__Principled Performance Analytics]]
- Pages created: [[@2022__SREcon22Americas__Principled Performance Analytics]], [[2σ手法]], [[Brent Bryan]]
- Pages updated: [[Narayan Desai]], [[定常性モデル]], [[サービスレベル目標]]
- Key insight: SLO は「エラー認識は人間の集積判断」という構造的問題から根本的に実現不可能——代替の 2σ手法は較正不要かつコホート間結合可能で、GCP 本番で SLO より 18 時間先行する障害検知を実証した。2021 年定常性モデルの数理実装編。
## [2026-06-30] ingest-slides | Going from 30 to 30 Million SLOs (SREcon22 EMEA)
- Source: `.raw/slides/srecon22emea-palcuie-30-to-30m-slos/srecon22emea-palcuie-30-to-30m-slos.pdf`
- Visual pages: `.raw/slides/srecon22emea-palcuie-30-to-30m-slos/pages/` (28 pages)
- Media: transcript なし(動画 URL 未取得)
- Summary: [[@2022__SREcon22EMEA__Going-from-30-to-30-Million-SLOs]]
- Pages created: [[@2022__SREcon22EMEA__Going-from-30-to-30-Million-SLOs]], [[Alex Palcuie]]
- Pages updated: [[サービスレベル目標]], [[SLI-SLO段階的導入]]
- Key insight: 集計 SLO は大規模プロバイダを守るが個別顧客を守らない——「5 エラーのルール」と per-customer SLO で Rachel Kroll "Your nines are not my nines" 問題に本番規模で対処した GCE の実践。
## [2026-06-30] enrich-source | Latency and Availability Error Budgets Done Right at Scale (transcript 補完)
- Source: `.raw/slides/2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale/transcript.md`(Whisper 自動生成、バックグラウンドタスク完了後に取得)
- Pages updated: [[@2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale]](口頭説明・補足セクション追加)
- Key insight: SLI 違反は都度・SLO 違反はバジェット枯渇時 1 回という重要な区別を口頭で明言。Zendesk は Datadog を使用。"EB は責任追及でなく優先順位付けのため"を再確認。
## [2026-06-30] ingest-slides | Squish Level Objectives (SREcon20 Americas)
- Source: `.raw/slides/2020__SREcon20Americas__Squish-Level-Objectives/2020__SREcon20Americas__Squish-Level-Objectives.pdf`
- Visual pages: `.raw/slides/2020__SREcon20Americas__Squish-Level-Objectives/pages/` (41 pages)
- Media: `.raw/slides/2020__SREcon20Americas__Squish-Level-Objectives/transcript.md`(YouTube 自動字幕 449 行、英語、機械精度)
- Summary: [[@2020__SREcon20Americas__Squish Level Objectives]]
- Pages created: [[@2020__SREcon20Americas__Squish Level Objectives]], [[Dave Stanke]]
- Pages updated: [[サービスレベル目標]], [[SLI-SLO段階的導入]]
- Key insight: SLO Policy の Rationale フィールドにユーザー行動データを結び付けることで、技術閾値を「顧客行動観察に基づく設計判断」として文書化する最も直接的な実装例が示された
## [2026-06-30] ingest-slides | Beyond Goldilocks Reliability (SREcon21)
- Source: `.raw/slides/2021__SREcon21__Beyond-Goldilocks-Reliability/2021__SREcon21__Beyond-Goldilocks-Reliability.pdf`
- Visual pages: `.raw/slides/2021__SREcon21__Beyond-Goldilocks-Reliability/pages/` (23 pages)
- Media: YouTube 字幕 429 エラー・Whisper 未完。transcript なし。
- Summary: [[@2021__SREcon21__Beyond-Goldilocks-Reliability]]
- Pages created: [[@2021__SREcon21__Beyond-Goldilocks-Reliability]], [[定常性モデル]]
- Pages updated: [[Narayan Desai]], [[SREの工学化]]
- Key insight: Goldilocks Reliability(閾値監視)の荷重仮定を分析し、代替として定常性(Stationarity)モデルを提唱——「ちょうどいい閾値の設定」から「通常状態からの逸脱の検知」へ信頼性観測のパラダイムを転換する。
## [2026-06-30] ingest-slides | Latency and Availability Error Budgets Done Right at Scale (SREcon20 Americas)
- Source: `.raw/slides/2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale/2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale.pdf`
- Visual pages: `.raw/slides/2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale/pages/` (37 pages)
- Media: YouTube 字幕 429 エラー・Whisper 未取得。transcript なし。
- Summary: [[@2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale]]
- Pages created: [[@2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale]], [[Zendesk]]
- Pages updated: [[Fred Moyer]], [[エラーバジェット]], [[サービスレベル目標]]
- Key insight: SLI/SLO/EB を `[Metric Identifier][Operator][Metric Value]` 等の機械解析可能な公式に固定し、OR 結合の複合 SLI で可用性とレイテンシを単一 EB で管理——マルチサービス構成では依存先 ER が上位層に積算されて自身の EB を超えて観測される問題を図示した。
## [2026-06-30] ingest-slides | Avoiding Goodhart's Law - Use SLO's as Tools Not Cudgels (SREcon20 Americas)
- Source: `.raw/slides/2020__SREcon20Americas__Avoiding-Goodharts-Law/2020__SREcon20Americas__Avoiding-Goodharts-Law.pdf`
- Visual pages: `.raw/slides/2020__SREcon20Americas__Avoiding-Goodharts-Law/pages/` (35 pages)
- Media: Whisper 文字起こし処理中(YouTube `iKjKFeTSJGs`)
- Summary: [[@2020__SREcon20Americas__Avoiding Goodhart's Law]]
- Pages created: [[@2020__SREcon20Americas__Avoiding Goodhart's Law]], [[Marco Coulter]], [[AppDynamics]]
- Pages updated: [[グッドハートの法則]], [[サービスレベル目標]], [[SLI-SLO段階的導入]]
- Key insight: SLO が「棍棒」化するとグッドハートの法則が発動しゲーミングが起きる——3 次元 SLI/SLO/SLA フレームワーク(Code/Infra/CX)と行動ベース CX SLI、パフォーマンスカーブ SLO、反復的 SLO 交渉プロセスで対処する。
## [2026-06-30] ingest-video | The Map Is Not the Territory (SREcon19 EMEA, Narayan Desai)
- Source: https://www.youtube.com/watch?v=NW4OOpQ3nz8 (YouTube 自動字幕 en-orig / 低解像度動画から 12 フレーム抽出)
- Transcript: `.raw/videos/youtube-NW4OOpQ3nz8/transcript.md` (1175 cue)
- Frames: `.raw/videos/youtube-NW4OOpQ3nz8/frames/frame-001 ~ 012.jpg`
- Summary: [[@2019__SREcon19EMEA__The Map Is Not the Territory - How SLOs Lead Us Astray, and What We Can Do about It]]
- Pages created: [[@2019__SREcon19EMEA__The Map Is Not the Territory - How SLOs Lead Us Astray, and What We Can Do about It]], [[Narayan Desai]]
- Pages updated: [[サービスレベル目標]], [[エラーバジェット]]
- Key insight: SLO のテール管理適用が「サンドバッギング」を引き起こすこと、および SLO Algebra が 2019 年時点でも未解決の重要課題であることを明示した講演として wiki 化。
## [2026-06-30] enrich-source | Latency SLOs Done Right (SREcon19 EMEA, Heinrich Hartmann)
- Source: `.raw/slides/srecon19emea-latency-slos-done-right/srecon19emea-latency-slos-done-right.pdf`
- Visual pages: `.raw/slides/srecon19emea-latency-slos-done-right/pages/` (33 ページ全件再確認)
- Media: none (YouTube 字幕フォールバック試みたが別トークのビデオを誤取得・削除済み)
- Summary: [[@2019__SREcon19 EMEA__Latency SLOs Done Right]]
- Pages created: (なし。2026-06-19 に初回作成済み)
- Pages updated: [[@2019__SREcon19 EMEA__Latency SLOs Done Right]], [[Heinrich Hartmann]], [[ヒストグラムメトリクス]]
- Key insight: HDR ログリニアヒストグラムの実装詳細(46,081 ビン・スパース符号化・300b/ヒストグラム)と代替要約系譜(circllhist 2013・HDR 2015・t-digest 2015・DD-Sketch 2019)、ベンチマーク正確値(circllhist が精度・速度の両立で最優)を追加。manifest 未記録だったエントリを追加。
## [2026-06-29] ingest-slides | SLOs for Data-Intensive Services (SREcon19 EMEA)
- Source: `.raw/slides/srecon19emea-fouquet-slo-data-intensive/srecon19emea-fouquet-slo-data-intensive.pdf`
- Visual pages: `.raw/slides/srecon19emea-fouquet-slo-data-intensive/pages/` (29 pages; p.26–29 は API 制限のためテキスト抽出で補完)
- Media: none (transcript なし。YouTube 字幕取得不可)
- Summary: [[@2019__SREcon19EMEA__SLOs for Data-Intensive Services]]
- Pages created: [[@2019__SREcon19EMEA__SLOs for Data-Intensive Services]], [[Yoann Fouquet]], [[データ品質SLO]]
- Pages updated: [[Booking.com]], [[サービスレベル目標]], [[SLI-SLO段階的導入]]
- Key insight: 可用性・レイテンシだけでは検索サービスのステークホルダーは無関心。データ品質 SLO(一貫性・新鮮性・完全性・耐久性)を追加して初めて SLO が意思決定と自動化の根拠になった。
## [2026-06-29] ingest-slides | Extending the Error Budget Model to Security and Feature Freshness (SREcon19 Americas)
- Source: `.raw/slides/2019__SREcon19Americas__Extending-the-Error-Budget-Model/2019__SREcon19Americas__Extending-the-Error-Budget-Model.pdf`
- Visual pages: `.raw/slides/2019__SREcon19Americas__Extending-the-Error-Budget-Model/pages/` (51 ページ全件確認)
- Media: `.raw/slides/2019__SREcon19Americas__Extending-the-Error-Budget-Model/media/audio.m4a` (transcript なし — Whisper 未生成)
- Summary: [[@2019__SREcon19Americas__Extending the Error Budget Model to Security and Feature Freshness]]
- Pages created: [[wiki/sources/@2019__SREcon19Americas__Extending the Error Budget Model to Security and Feature Freshness]], [[wiki/concepts/脆弱性バジェット]], [[wiki/concepts/フィーチャーフレッシュネス]], [[wiki/entities/Jim Thomson]], [[wiki/entities/David Laing]]
- Pages updated: [[wiki/concepts/エラーバジェット]](横断的知見), [[wiki/entities/Pivotal Software]]
- Key insight: SLI/SLO/ポリシーのエラーバジェット構造はドメイン非依存の汎用モデルであり、セキュリティ(脆弱性バジェット: 30 日 SLO)とフィーチャーフレッシュネス(レガシーバジェット: 90 日アップグレード)に拡張できる。Equifax 侵害への 30 日 SLO 有効性は具体的な事例論証として重要。
## [2026-06-29] ingest-slides | Latency SLOs Done Right (SREcon19 Americas)
- Source: `.raw/slides/srecon19americas-moyer-latency-slos/srecon19americas-moyer-latency-slos.pdf`
- Visual pages: `.raw/slides/srecon19americas-moyer-latency-slos/pages/` (50 pages)
- Media: none (transcript なし)
- Summary: [[@2019__SREcon19 Americas__Latency SLOs Done Right]]
- Pages created: [[@2019__SREcon19 Americas__Latency SLOs Done Right]], [[Fred Moyer]]
- Pages updated: [[Circonus]], [[サービスレベル目標]], [[ヒストグラムメトリクス]]
- Key insight: パーセンタイル平均化は ~200% の誤差を生む。ログ・カウンタ・ヒストグラムの 3 手法による正しい SLO 計算体系が、同社の SREcon19 EMEA・Americas 両発表で独立確認された。
## [2026-06-29] ingest-slides | Case Study: Implementing SLOs for a New Service (SREcon19 Americas)
- Source: `.raw/slides/2019__SREcon19Americas__Implementing-SLOs-for-a-New-Service/2019__SREcon19Americas__Implementing-SLOs-for-a-New-Service.pdf`
- Visual pages: `.raw/slides/2019__SREcon19Americas__Implementing-SLOs-for-a-New-Service/pages/` (23 pages)
- Media: none(Whisper 失敗・YouTube 字幕フォールバック未実行)
- Summary: [[@2019__SREcon19Americas__Case Study - Implementing SLOs for a New Service]]
- Pages created: [[@2019__SREcon19Americas__Case Study - Implementing SLOs for a New Service]], [[Arnaud Lawson]], [[Squarespace]]
- Pages updated: [[サービスレベル目標]], [[エラーバジェット]], [[SLI-SLO段階的導入]]
- Key insight: ストレージサービスへの SLO 実装では耐久性 SLI が追加で必要。プローバーによる能動的計測が新規サービスへの SLO 導入を支える。エラーバジェットは SLO 設定と同時に計算・文書化することで運用指針になる。
## [2026-06-29] ingest-slides | Quantifying Empathy Through Service Level Objectives (SREcon18 Asia/Pacific)
- Source: `.raw/slides/2018__SREcon18Asia__Quantifying-Empathy-with-SLOs/2018__SREcon18Asia__Quantifying-Empathy-with-SLOs.pdf`
- Visual pages: `.raw/slides/2018__SREcon18Asia__Quantifying-Empathy-with-SLOs/pages/` (152 ページ)
- Media: `.raw/slides/2018__SREcon18Asia__Quantifying-Empathy-with-SLOs/transcript.md`(YouTube 自動字幕、1104 行)
- Summary: [[@2018__SREcon18Asia__Quantifying Empathy Through Service Level Objectives]]
- Pages created: [[@2018__SREcon18Asia__Quantifying Empathy Through Service Level Objectives]] / [[Ketan Gangatirkar]] / [[Indeed]]
- Pages updated: [[サービスレベル目標]](共感ギャップ・6 フレーバー・S 字曲線しきい値を横断的知見に追記)
- Key insight: SLO 設計における「ユーザー共感の欠如」を共感ギャップ(Empathy gap)として定式化。ユーザー幸福の 6 フレーバー(#ARFCAapBof)と S 字曲線による痛みのしきい値特定で解決する 5 ステップフレームワークを提示。
## [2026-06-29] ingest-slides | SLOs and SLIs in the Real World: A Deep Dive (SREcon18 Europe/EMEA)
- Source: `.raw/slides/2018__SREcon18Europe__Real-World-SLOs-and-SLIs/2018__SREcon18Europe__Real-World-SLOs-and-SLIs.pdf`
- Visual pages: `.raw/slides/2018__SREcon18Europe__Real-World-SLOs-and-SLIs/pages/` (29 ページ)
- Media: `.raw/slides/2018__SREcon18Europe__Real-World-SLOs-and-SLIs/media/flaming.mp3`(Whisper 文字起こし処理中)
- Summary: [[@2018__SREcon18Europe__SLOs and SLIs in the Real World - A Deep Dive]]
- Pages created: [[@2018__SREcon18Europe__SLOs and SLIs in the Real World - A Deep Dive]]
- Pages updated: [[サービスレベル目標]] / [[Matthew Flaming]] / [[Elisa Binette]]
- Key insight: Americas 版(2018-03)の EMEA 再演。音声収録を初取得。ケイパビリティ駆動 SLI/SLO 設計・ハードシャード per-shard SLO・複合 SLO の実演が主体。
## [2026-06-29] ingest-slides | How Atlassian Is Tackling Error Budgets, Agile Style
- Source: `.raw/slides/2018__SREcon18Asia__How-Atlassian-Is-Tackling-Error-Budgets-Agile-Style/2018__SREcon18Asia__How-Atlassian-Is-Tackling-Error-Budgets-Agile-Style.pdf`
- Visual pages: `.raw/slides/2018__SREcon18Asia__How-Atlassian-Is-Tackling-Error-Budgets-Agile-Style/pages/` (47 ページ)
- Media: none (transcript なし)
- Summary: [[@2018__SREcon18Asia__How Atlassian Is Tackling Error Budgets, Agile Style]]
- Pages created: [[@2018__SREcon18Asia__How Atlassian Is Tackling Error Budgets, Agile Style]] / [[Gui Vieiro]] / [[Atlassian]]
- Pages updated: [[エラーバジェット]](アジャイル導入・可視化・Not So Good Result の透明化 を横断的知見に追記)/ [[sources/_index]] / [[entities/_index]] / [[index]] / [[hot]]
- Key insight: エラーバジェット導入の入口は「開発停止トリガー」ではなく「週次 SLO 達成率の可視化と共有」であり、トリガー閾値を段階的に引き締めることで組織の受容を促せる。改善しない判断をプロセスで「承認」する透明化もエラーバジェットの成果である。
## [2026-06-29] ingest-slides | SLOs and SLIs in the Real World: A Deep Dive
- Source: `.raw/slides/2018__SREcon18Americas__Real-World-SLOs-SLIs-Deep-Dive/2018__SREcon18Americas__Real-World-SLOs-SLIs-Deep-Dive.pdf`
- Visual pages: `.raw/slides/2018__SREcon18Americas__Real-World-SLOs-SLIs-Deep-Dive/pages/` (25 pages)
- Media: none (YouTube 動画あり: https://www.youtube.com/watch?v=4cFl-Ge0x4g、transcript 未取得)
- Summary: [[@2018__SREcon18Americas__SLOs and SLIs in the Real World - A Deep Dive]]
- Pages created: [[@2018__SREcon18Americas__SLOs and SLIs in the Real World - A Deep Dive]] / [[Matthew Flaming]] / [[Elisa Binette]] / [[New Relic]]
- Pages updated: [[サービスレベル目標]](横断的知見 4 項目・未解決の問い 4 項目追加)/ [[sources/_index]] / [[entities/_index]] / [[index]]
- Key insight: ケイパビリティ(機能)を中間概念として挟む 7 ステップレシピにより「何を SLI にすべきか」の具体的な起点が得られる。ハードシャードでは全体集計 SLO が障害を隠蔽するため per-shard SLO が必須。
## [2026-06-29] wiki-query | Projection MLP 学習の仕組み
- Question: Toto-1.0-QA-Experimental における Projection MLP の学習とは何か・どのように行われるか
- Pages created: [[Projection-MLP-学習の仕組み]]
- Pages updated: [[index]]
- Key insight: Projection MLP の学習とは「Toto と Qwen3-VL という異なる座標系を橋渡しする変換関数を、正解 QA ペアへの逆伝播で自動発見する過程」。VLM は時系列を先天的に理解するのではなく、3 段階訓練(合成 SFT → 実データ SFT → RLVR)を通じて「このベクトルパターンとこの回答が対応する」相関を後天的に学ぶ。
## [2026-06-29] ingest-slides | Error Budgets and Risks (SREcon15, 2015)
- Source: `.raw/slides/2015__SREcon15__Error-Budgets-and-Risks/2015__SREcon15__Error-Budgets-and-Risks.pdf`
- Visual pages: `.raw/slides/2015__SREcon15__Error-Budgets-and-Risks/pages/` (26 ページ)
- Media: `.raw/slides/2015__SREcon15__Error-Budgets-and-Risks/transcript.md` (Whisper 自動文字起こし、MP3 から生成)
- Summary: [[@2015__SREcon15__Error Budgets and Risks]]
- Pages created: [[Marc Alvidrez]]
- Pages updated: [[エラーバジェット]]
- Key insight: エラーバジェットは「SLA を超えすぎた結果、機会を無駄にしている」という気づきから実践的に発見されたものであり、公式な方法論的発明ではない——Alvidrez 自身の口頭語りで確認。
## [2026-06-29] ingest-video | Service Levels and Error Budgets (SREcon16)
- Source: https://www.usenix.org/conference/srecon16/program/presentation/jones (YouTube `iOoxtpVBQ4I`)
- Transcript: `.raw/videos/iOoxtpVBQ4I/transcript.md`(auto-caption VTT → Markdown 変換、463 セグメント、約 23 分)
- Frames: なし(映像取得不可)
- Summary: [[@2016__SREcon16__Service Levels and Error Budgets]]
- Pages created: [[Chris Jones]], [[@2016__SREcon16__Service Levels and Error Budgets]]
- Pages updated: [[Niall Murphy]], [[サービスレベル目標]], [[エラーバジェット]]
- Key insight: 「SRE の仕事は可用性最大化ではなくプロダクトベロシティ最大化」という再定義と、エラーバジェットをバンバン制御ではなくバーン率連続監視で使う考え方を SRE Book 著者自身が直接語った。
## [2026-06-29] ingest | Effective Harnesses for Long-Running Agents (Anthropic 2025) + Harness Design for Long-Running Application Development (Anthropic 2026)
- Sources: `.raw/articles/effective-harnesses-for-long-running-agents-2025-11-26.md` / `.raw/articles/harness-design-long-running-apps-2026-03-24.md`
- URLs: https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents / https://www.anthropic.com/engineering/harness-design-long-running-apps
- Summary: [[@2025__Anthropic Engineering Blog__Effective Harnesses for Long-Running Agents]] / [[@2026__Anthropic Engineering Blog__Harness Design for Long-Running Application Development]]
- Pages created: [[@2025__Anthropic Engineering Blog__Effective Harnesses for Long-Running Agents]], [[@2026__Anthropic Engineering Blog__Harness Design for Long-Running Application Development]], [[Justin Young]], [[マルチコンテキストウィンドウエージェント]]
- Pages updated: [[Prithvi Rajasekaran]], [[Harness Engineering]], [[ループエンジニアリング]]
- Key insight: Anthropic の 2 本の実践報告。2025 年版は「各コンテキストウィンドウでメモリを失うエージェント」問題に Initializer + Coding 2 役分離と JSON フィーチャーリストで対処。2026 年版はジェネレータ・エバリュエータ分離(自己評価バイアス対策)と「荷重仮定」概念(モデル改善でハーネスコンポーネントを削減すべき)を提示。OpenAI が同時期に提唱した「ハーネスエンジニアリング」と補完的な関係にある。
## [2026-06-29] ingest | Harness engineering: leveraging Codex in an agent-first world (OpenAI 2026)
- Source: `.raw/articles/harness-engineering-openai-2026-06-29.md`
- URL: https://openai.com/ja-JP/index/harness-engineering/
- Summary: [[OpenAI-Harness-Engineering]]
- Pages created: [[OpenAI-Harness-Engineering]], [[Symphony]], [[Harness Engineering]]
- Pages updated: [[OpenAI]]
- Key insight: 3 名・5 ヶ月・手書き 0 行で 100 万行の本番コードを生成した実験から「ハーネスエンジニアリング」概念を提唱。エージェントを囲む環境設計(AGENTS.md 縮小・機械的依存強制・フィードバックループ・GC タスク)が次の生産性格差を生む主張。
## [2026-06-29] ingest-paper | Memory in the Age of AI Agents
- Source: `.raw/papers/arxiv-2512.13564.pdf`
- URL: https://arxiv.org/abs/2512.13564
- Summary: [[@2025__arXiv__Memory in the Age of AI Agents]]
- Pages created: [[エージェントメモリ]], [[Yuyang Hu]], [[MemGPT]], [[Mem0]]
- Pages updated: [[コンテキストエンジニアリング]], [[National University of Singapore]]
- Key insight: エージェントメモリを形態(トークンレベル/パラメトリック/潜在)・機能(事実/経験/作業)・動態(形成/進化/検索)の 3 軸で統一的に分類する初の体系的タクソノミ。コンテキストエンジニアリングはエージェントメモリの入力設計面であり、エージェントメモリは自律的蓄積面まで射程を広げる補完関係。RL 駆動のメモリ管理自律化が次のフロンティア。
## [2026-06-29] ingest | VictoriaMetrics vs Prometheus (Jorijn Blog)
- Source: `.raw/articles/victoriametrics-vs-prometheus-2026-06-29.md`
- URL: https://jorijn.com/en/blog/victoriametrics-vs-prometheus/
- Summary: [[@2025__Jorijn-Blog__VictoriaMetrics vs Prometheus]]
- Pages created: [[MetricsQL]], [[Jorijn Schrijvershof]], [[PromLabs]]
- Pages updated: [[VictoriaMetrics]], [[Prometheus]]
- Key insight: VictoriaMetricsはカーディナリティ爆発時にOOMクラッシュではなく「スローインサート」へグレースフルデグラデーションし、HA構成も`-replicationFactor`単一フラグで完結する。Prometheusは既存安定スタック・CNCF統治要件・PromQL移植性が必須の場合に正当化される。MetricsQLは74%PromQL互換(PromLabs評価)でVictoriaMetrics単独環境では実用上問題ないが複数バックエンド横断環境では負債化しうる。
## [2026-06-29] ingest-slides | How We Foster "Reliability" in Diversity
- Source: `.raw/slides/sre-next-2022/sre-next-2022.pdf`
- Visual pages: `.raw/slides/sre-next-2022/pages/` (50 pages)
- Media: none (transcript なし)
- Summary: [[@2022__SRE NEXT__How We Foster Reliability in Diversity]]
- Pages created: [[ダイナミックケイパビリティ]], [[組織の信頼性マインドセット]]
- Pages updated: [[SRE組織変革]], [[Narimichi Takamura]], [[Topotal]]
- Key insight: SRE 実践の5ステップを氷山モデル(Level 1/2/3)と対応させることで「プラクティス導入(Level 1/2)と価値観変革(Level 3)は別の取り組みが必要」という構造が明示され、MVV 策定が Level 3 へのアプローチとして有効であることが示された
## [2026-06-29] ingest-slides | 小さくはじめるSLI/SLO ~育てながら組織に定着させる実践知~
- Source: `.raw/slides/road-to-sre-next-kobe/road-to-sre-next-kobe.pdf`
- Visual pages: `.raw/slides/road-to-sre-next-kobe/pages/` (48 pages)
- Media: none (transcript なし)
- Summary: [[@2026__Road to SRE NEXT 2026 神戸__小さくはじめるSLI-SLO 育てながら組織に定着させる実践知]]
- Pages created: [[SLI-SLO段階的導入]]
- Pages updated: [[サービスレベル目標]], [[エラーバジェット]], [[Narimichi Takamura]], [[Topotal]]
- Key insight: SLI/SLO の難点を「定義・運用・定着」の 3 軸に整理し、それぞれに 5 段階成熟度モデルを設けることで組織の現在地と目標についてのディスカッション起点として機能させる
## [2026-06-29] ingest-slides | 組織的なインシデント対応を目指して〜成熟度評価と改善のステップ〜
- Source: `.raw/slides/sre-next-2024/sre-next-2024.pdf`
- Visual pages: `.raw/slides/sre-next-2024/pages/` (39 pages)
- Media: none
- Summary: [[@2024__SRE NEXT 2024__組織的なインシデント対応を目指して]]
- Pages created: [[インシデント対応成熟度モデル]]
- Pages updated: [[インシデント管理]], [[Incident Commander]], [[Narimichi Takamura]], [[Topotal]], [[SRE NEXT]]
- Key insight: Google SRE の信頼性マインドセットを組織評価軸に転用し、「IC 導入は前提条件が必要」という実践知を3フェーズ×9プロセス×4段階の成熟度モデルで構造化した
## [2026-06-29] ingest-slides | Rethinking Incident Response: Context-Aware AI in Practice
- Source: `.raw/slides/Incident_Buddy_AI_Edition/Incident_Buddy_AI_Edition.pdf`
- Visual pages: `.raw/slides/Incident_Buddy_AI_Edition/pages/` (29 pages)
- Media: none (transcript なし)
- Summary: [[@2025__SRE NEXT 2025__Rethinking Incident Response - Context-Aware AI in Practice]]
- Pages created: [[インシデントレスポンスAIレベル]]
- Pages updated: [[インシデント管理]], [[AIOps]], [[Waroom]], [[Ryota Yoshikawa]]
- Key insight: SAE 自動運転レベル対応の IR0〜IR5 フレームワークを提唱。MCP + Coding Agent で IR2〜IR3 が現実的になった一方、OpenRCA(11%)・AIOpsLab RCA(14%)から RCA・緩和は依然として研究段階。
## [2026-06-29] query-deep | ポストモーテムの教科書
- [[wiki/questions/ポストモーテムの教科書]](question 新規) — wiki 全体の 25+ ソース・15+ コンセプトを横断し、ポストモーテムとインシデント分析の理論・実践・研究を 25 章構成の教科書として体系化。初学者向け基礎(定義・三つの柱・プロセス)、事故モデル・Cook の 18 命題・ヒューマンファクタの理論基盤、ファシリテーション・IR 執筆・プロセス比較の実践、「修復から学習へ」のパラダイムシフト(Repeat Incident Fallacy・Incident Legalism)、MTTR 批判と TTX メトリクス、インシデントストーリー・クロスインシデント分析・インシデント考古学の発展的手法、AI 自動化と未解決の研究課題を網羅。
## [2026-06-29] ingest | CoT Monitoring: Where Does a Hot Safety Problem Come From?
- Source: `.raw/articles/cot-monitoring-history-2026-06-29.md`
- Summary: [[@2026__SAILBlog__CoT-Monitoring-Where-Does-a-Hot-Safety-Problem-Come-From]]
- Pages created: [[Peter Hase]], [[Christopher Potts]], [[CoTモニタリング]], [[@2026__SAILBlog__CoT-Monitoring-Where-Does-a-Hot-Safety-Problem-Come-From]]
- Pages updated: [[Chain-of-Thought Prompting]], [[Dan Hendrycks]]
- Key insight: CoT モニタリングは監視フレームワーク(Hendrycks 2021)と CoT 説明可能性(Ling 2017 / Camburu 2018)の 2 系譜収束であり、OpenAI o1 が 18 ヶ月の空白を終わらせた触媒だった。
## [2026-06-29] ingest-paper | On-demand Container Loading in AWS Lambda
- Source: `.raw/papers/atc23-brooker.pdf`
- Summary: [[@2023__ATC__On-demand Container Loading in AWS Lambda]]
- Pages created: [[@2023__ATC__On-demand Container Loading in AWS Lambda]], [[Marc Brooker]], [[AWS Lambda]], [[Firecracker]], [[コンテナ起動高速化]], [[収束暗号化]], [[イレイジャーコーディング]], [[メタ安定障害]]
- Pages updated: wiki/index.md, wiki/hot.md, wiki/log.md, wiki/sources/_index.md, wiki/concepts/_index.md, wiki/entities/_index.md
- Attachments: `fig05-deduplication-unique-chunks-cdf.png`, `fig07-cache-tier-hit-rates.png`, `fig08-l2-cache-hit-rate-cdf.png`, `fig09-erasure-vs-parallel-latency-cdf.png`, `fig10-l2-server-get-put-latency.png`, `fig11-local-agent-read-latency-cdf.png`
- Key insight: コンテナ起動高速化の核心は「疎性(起動時必要データは 6.4%)」「共通性(80% がゼロユニークチャンク)」「キャッシャビリティ」の 3 性質の活用にある。収束暗号化はキー共有なしの広域重複排除を可能にし、4-of-5 イレイジャーコーディングは再試行不要の低テールレイテンシを実現する。高ヒット率キャッシュを安全に運用するにはメタ安定障害への備えが必須。
## [2026-06-29] ingest-paper | Project Silica: Towards Sustainable Cloud Archival Storage in Glass
- Source: `.raw/papers/ProjectSilica-SOSP23.pdf`
- Summary: [[@2023__SOSP__Project Silica - Towards Sustainable Cloud Archival Storage in Glass]]
- Pages created: [[@2023__SOSP__Project Silica - Towards Sustainable Cloud Archival Storage in Glass]], [[Antony Rowstron]], [[Project Silica]], [[アーカイバルストレージ]], [[ガラスストレージ]], [[ネットワーク符号化]]
- Pages updated: wiki/index.md, wiki/hot.md, wiki/log.md, wiki/sources/_index.md, wiki/concepts/_index.md, wiki/entities/_index.md
- Attachments: `fig04-shuttle-prototype.png`, `fig05a-iops-throughput.png`, `fig06-read-drive-utilization.png`, `fig07a-congestion-management.png`, `fig07b-power-savings.png`
- Key insight: クラウドアーカイバルワークロードの実態は I/O 操作の 58.7% が 4 MiB 以下の小規模リードであり、テープ設計(大容量逐次アクセス前提)が根本的に不適合。ガラス媒体の WORM 特性によりスクラビング・リフレッシュ・ガベージコレクションをアーキテクチャから排除できるとともに、符号更新不要性が既存システムで不可能な超大グループサイズのネットワーク符号化を可能にする。
---
## [2026-06-29] ingest-paper | In Search of an Understandable Consensus Algorithm
- Source: `.raw/papers/atc14-paper-ongaro.pdf`
- Summary: [[@2014__ATC__In Search of an Understandable Consensus Algorithm]]
- Pages created: [[@2014__ATC__In Search of an Understandable Consensus Algorithm]], [[Diego Ongaro]], [[John Ousterhout]], [[分散コンセンサス]], [[複製ステートマシン]], [[リーダー選出]]
- Pages updated: [[分散コンセンサス回避]](横断的知見にジョイントコンセンサス vs クォーラムセット対比を追記)
- Attachments: `fig01-replicated-state-machine.png`, `fig02-raft-algorithm-summary.png`, `fig03-raft-safety-properties.png`, `fig04-server-states.png`, `fig05-terms.png`, `fig07-log-inconsistencies.png`, `fig14-leader-election-perf.png`
- Key insight: Paxos の難解さの根源はシングルデクリー分解にある。Raft は問題を分解(リーダー選出/ログ複製/安全性)し状態空間を削減する 2 原則だけで設計することで、ユーザースタディで 43 名中 33 名が Raft クイズ高得点を達成。ランダム化タイムアウトが「理解しやすさ設計」がランキング方式より優れた理由は、不確実性を「全選択が等価」として扱い実質的に決定論的になることにある。
## [2026-06-28] ingest-paper | CockroachDB: The Resilient Geo-Distributed SQL Database
- Source: `.raw/papers/2026_Unknown_CockroachDB_Resilient_Geo_Distributed_SQL.pdf`
- Summary: [[@2020__SIGMOD__CockroachDB - The Resilient Geo-Distributed SQL Database]]
- Pages created: [[@2020__SIGMOD__CockroachDB - The Resilient Geo-Distributed SQL Database]], [[CockroachDB]], [[Cockroach Labs]], [[Rebecca Taft]], [[地理分散SQLデータベース]], [[ハイブリッド論理クロック]]
- Pages updated: [[Spanner]], [[分散トランザクション]], [[外部一貫性]]
- Attachments: `fig01-global-cluster.png`, `fig02-parallel-commits-performance.png`, `fig03-distributed-hash-join.png`, `fig04-throughput-per-vcpu.png`, `fig05-tpcc-scaling.png`, `fig06-multiregion-availability.png`, `fig07-ycsb-vs-spanner.png`
- Key insight: Spanner が TrueTime commit wait で外部一貫性を達成するのに対し、CRDB は HLC + Read Refresh で commit wait を完全に排除しつつ単一キー線形化可能性を保証。専用ハードウェアなしに TPC-C 100,000 ウェアハウスで 98.8% 効率(Aurora の 7.3% と対照的)。
---
## [2026-06-29] ingest-paper | Aurora PostgreSQL Limitless Database: Building a Highly Scalable OLTP Database
- Source: `.raw/papers/2026_Unknown_Aurora_PostgreSQL_Limitless_Database_Building.pdf`
- Summary: [[@2026__SIGMOD Companion__Aurora PostgreSQL Limitless Database - Building a Highly Scalable OLTP Database]]
- Pages updated: [[@2026__SIGMOD Companion__Aurora PostgreSQL Limitless Database - Building a Highly Scalable OLTP Database]], [[分散トランザクション]], [[分散SQLデータベース]]
- Attachments added: `fig02-architecture.png`, `fig03-2pc-protocol.png`, `fig04-nopm-comparison.png`, `fig05-latency-comparison.png`, `fig06a-acu-r1.png`, `fig06b-acu-r2.png`
- Key insight: PostgreSQL xid ベーススナップショットを Amazon Time Sync の時刻ベース MVCC に置換し、集中型トランザクションマネージャなしで外部一貫性を実現。2PC コーディネーターをステートレスなルータに置かず lead shard に状態永続化することでルータをコスト効率よく構成できる。
---
## [2026-06-29] ingest-paper | Data Center Networking 基盤論文 5 本一括取り込み
### Fat-Tree (SIGCOMM 2008)
- Source: `.raw/papers/fattree-sigcomm08.pdf`
- Summary: [[@2008__SIGCOMM__A Scalable Commodity Data Center Network Architecture]]
- Pages created: [[@2008__SIGCOMM__A Scalable Commodity Data Center Network Architecture]], [[Mohammad Al-Fares]], [[Amin Vahdat]], [[データセンターネットワークトポロジ]], [[ECMP]]
- Pages updated: [[マルチプレーンClosトポロジ]], [[AIデータセンタートポロジ]]
- Key insight: 安価な商用 GigE スイッチのみを均質に用いた k-ary Fat-Tree(k=48 で 27,648 ホスト)は従来階層型設計比 77% コスト削減を達成し、現代データセンターネットワーク設計の出発点となった。
### VL2 (SIGCOMM 2009)
- Source: `.raw/papers/vl2-sigcomm09.pdf`
- Summary: [[@2009__SIGCOMM__VL2 - A Scalable and Flexible Data Center Network]]
- Pages created: [[@2009__SIGCOMM__VL2 - A Scalable and Flexible Data Center Network]], [[Albert Greenberg]], [[VL2]], [[Valiant Load Balancing]]
- Pages updated: [[James Hamilton]], [[負荷分散]], [[データセンター輻輳制御]], [[マルチプレーンClosトポロジ]]
- Key insight: データセンタートラフィックの高ボラティリティこそが VLB のランダム化を正当化する——複雑な適応型トラフィックエンジニアリングより単純なランダム分散が実用上ほぼ同等(最重リンク使用率差 5%)。
### Hedera (NSDI 2010)
- Source: `.raw/papers/hedera-nsdi10.pdf`
- Summary: [[@2010__NSDI__Hedera - Dynamic Flow Scheduling for Data Center Networks]]
- Pages created: [[@2010__NSDI__Hedera - Dynamic Flow Scheduling for Data Center Networks]], [[Barath Raghavan]], [[Sivasankar Radhakrishnan]], [[フロースケジューリング]]
- Pages updated: [[Mohammad Al-Fares]], [[Amin Vahdat]], [[ECMP]]
- Key insight: ECMP はエレファントフロー支配的ワークロードで二分帯域幅を最大 60.8% 損失させる。Hedera は集中型スケジューラと Simulated Annealing で最適比 96% の二分帯域幅を達成。
### PortLand (SIGCOMM 2009)
- Source: `.raw/papers/portland-sigcomm09.pdf`
- Summary: [[@2009__SIGCOMM__PortLand - A Scalable Fault-Tolerant Layer 2 Data Center Network Fabric]]
- Pages created: [[@2009__SIGCOMM__PortLand - A Scalable Fault-Tolerant Layer 2 Data Center Network Fabric]], [[Radhika Niranjan Mysore]], [[データセンターL2ファブリック]]
- Pages updated: [[Amin Vahdat]], [[データセンターネットワーク信頼性]]
- Key insight: 「データセンターのトポロジは既知で固定」という観察の活用が PMAC・LDP・ファブリックマネージャの三位一体を可能にし、L2 セマンティクス・ループフリー・O(n) 障害収束・VM マイグレーション透過性を同時達成。
### DCTCP (SIGCOMM 2010)
- Source: `.raw/papers/dctcp-sigcomm10.pdf`
- Summary: [[@2010__SIGCOMM__Data Center TCP (DCTCP)]]
- Pages created: [[@2010__SIGCOMM__Data Center TCP (DCTCP)]], [[Mohammad Alizadeh]], [[Incast]]
- Pages updated: [[Albert Greenberg]], [[データセンター輻輳制御]]
- Key insight: ECN の 1 ビット系列からマルチビット輻輳情報を抽出する発想が、TCP コード変更 30 行・スイッチパラメータ 1 個でデータセンターの 3 大障害(Incast・キュー蓄積・バッファ圧迫)を同時解決した。後継 DCQCN はこの思想をレートベース制御と NIC ハードウェア実装に拡張。
## [2026-06-28] ingest-paper | Amazon Aurora: On Avoiding Distributed Consensus for I/Os, Commits, and Membership Changes (SIGMOD 2018)
- Source: `.raw/papers/aurora-sigmod-18.pdf`
- Summary: [[@2018__SIGMOD__Amazon Aurora - On Avoiding Distributed Consensus for I Os, Commits, and Membership Changes]]
- Pages created: [[@2018__SIGMOD__Amazon Aurora - On Avoiding Distributed Consensus for I Os, Commits, and Membership Changes]], [[分散コンセンサス回避]]
- Pages updated: [[クォーラムベースレプリケーション]], [[クラッシュリカバリ]], [[Write-Ahead Logging (WAL)]], [[Alexandre Verbitski]], [[Amazon Aurora (Database)]], `wiki/index.md`, `wiki/hot.md`, `wiki/log.md`, `wiki/sources/_index.md`, `wiki/concepts/_index.md`
- Key insight: SCL/PGCL/VCL という単調増加 LSN 一貫性ポイント階層とクォーラムセット + エポックにより、分散コンセンサス(2PC/Paxos)を「ほとんどの状況で」回避できる。「データベースは状態の管理者」という特性を活用し、汎用コンセンサスの代わりにドメイン特化の不変条件(LSN 単調性・書き込み拒否なし)を使うのが核心。
## [2026-06-28] ingest-paper | F1: A Distributed SQL Database That Scales (VLDB 2013)
- Source: `.raw/papers/p1068-shute.pdf`
- Summary: [[@2013__VLDB__F1 - A Distributed SQL Database That Scales]]
- Pages created: [[@2013__VLDB__F1 - A Distributed SQL Database That Scales]], [[Jeff Shute]], [[分散SQLデータベース]]
- Pages updated: [[分散トランザクション]], [[Google]], `wiki/index.md`, `wiki/hot.md`, `wiki/log.md`, `wiki/sources/_index.md`, `wiki/entities/_index.md`, `wiki/concepts/_index.md`
- Key insight: 「スケーラビリティと SQL 一貫性はトレードオフ」という通説を本番 100 TB・5 ナインで覆した。階層スキーマによるデータ局所性確保と ORM の並列/非同期化が「コミットレイテンシ 50-150 ms の隠蔽」を実現し、ユーザー体感レイテンシを MySQL と同等に保った。
## [2026-06-28] ingest-paper | Amazon MemoryDB: A Fast and Durable Memory-First Cloud Database
- Source: `.raw/papers/amazon-memorydb-a-fast-and-durable-memory-first-cloud-database.pdf`
- Summary: [[@2024__SIGMOD__Amazon MemoryDB - A Fast and Durable Memory-First Cloud Database]]
- Pages created: [[@2024__SIGMOD__Amazon MemoryDB - A Fast and Durable Memory-First Cloud Database]], [[Amazon MemoryDB]], [[Yacine Taleb]], [[インメモリデータベース]], [[ストレージ計算分離]]
- Pages updated: [[Amazon Web Services]], `wiki/index.md`, `wiki/hot.md`, `wiki/log.md`, `wiki/sources/_index.md`, `wiki/entities/_index.md`, `wiki/concepts/_index.md`
- Key insight: 耐久性をマルチ AZ トランザクションログへ分離することで Redis の完全 API 互換性と 11 9s 耐久性を両立。書き込み後ろロギング + クライアントブロッキングで MVCC 非対応の Redis でも強い整合性を保証。オフボックススナップショットで BGSave の可用性インパクトを排除。
## [2026-06-28] ingest-paper | Spanner: Google's Globally Distributed Database (OSDI 2012 / TOCS 2013)
- Source: `.raw/papers/1974.pdf`
- Summary: [[@2013__TOCS__Spanner - Google's Globally Distributed Database]]
- Pages created: [[@2013__TOCS__Spanner - Google's Globally Distributed Database]], [[James C. Corbett]], [[外部一貫性]], [[TrueTime]], [[分散トランザクション]]
- Pages updated: [[Jeffrey Dean]], [[Sanjay Ghemawat]], `wiki/index.md`, `wiki/hot.md`, `wiki/log.md`, `wiki/sources/_index.md`, `wiki/entities/_index.md`, `wiki/concepts/_index.md`
- Key insight: TrueTime(GPS + 原子時計による不確実性区間)と commit wait の組み合わせで外部一貫性を数学的に証明。ε 通常 4ms、commit wait ≥ 2ε というオーバーヘッドで世界規模のシリアライズ可能かつ外部一貫なトランザクションを実現した最初のシステム。
## [2026-06-28] ingest-paper | Amazon Aurora: Design Considerations for High Throughput Cloud-Native Relational Databases (SIGMOD 2017)
- Source: `.raw/papers/aurora-sigmod-17.pdf`
- Summary: [[@2017__SIGMOD__Amazon Aurora - Design Considerations for High Throughput Cloud-Native Relational Databases]]
- Pages created: [[@2017__SIGMOD__Amazon Aurora - Design Considerations for High Throughput Cloud-Native Relational Databases]], [[Amazon Aurora (Database)]], [[クォーラムベースレプリケーション]], [[コンピュートストレージ分離]]
- Pages updated: [[OLTPシステムアーキテクチャ]], [[Write-Ahead Logging (WAL)]], [[クラッシュリカバリ]], [[分散ストレージ]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]]
- Key insight: 「ログがデータベース」——Redo ログのみをネットワーク越しに送り、ストレージ層が非同期でデータページを生成することで、クラウド OLTP のネットワークボトルネックを解消し、10 秒以内クラッシュリカバリと 35 倍スループット向上を同時達成した。
## [2026-06-28] ingest-paper | 縮約,網羅,減算:科学者の仕事とは何か (岡ノ谷 一夫, 認知科学 2021)
- Source: `.raw/papers/jcss-2021-okanoya.pdf`
- Summary: [[@2021__認知科学__縮約,網羅,減算:科学者の仕事とは何か]]
- Pages created: [[@2021__認知科学__縮約,網羅,減算:科学者の仕事とは何か]], [[岡ノ谷 一夫]], [[東京大学]], [[縮約]], [[網羅]], [[減算]]
- Pages updated: `wiki/index.md`, `wiki/hot.md`, `wiki/sources/_index.md`, `wiki/entities/_index.md`, `wiki/concepts/_index.md`
- Key insight: 機械学習時代の科学方法論を縮約・網羅・減算の三項対立で整理。「科学者の仕事は人間が理解できる説明体系を構築すること」であり、網羅的計測の台頭後も縮約と減算の並行処理が不可欠。人工知能の縮約提示が特異点を見落とすリスクを指摘。
## [2026-06-28] ingest | CPU Utilization is Wrong (Brendan Gregg, 2017)
- Source: `.raw/articles/cpu-utilization-is-wrong-2026-06-28.md`(URL: https://www.brendangregg.com/blog/2017-05-09/cpu-utilization-is-wrong.html)
- Summary: [[@2017__brendangregg.com__CPU Utilization is Wrong]]
- Pages created: [[@2017__brendangregg.com__CPU Utilization is Wrong]], [[Brendan Gregg]], [[CPU利用率]], [[Instructions Per Cycle]]
- Pages updated: [[ハードウェアカウンタ]](IPC / %CPU 乖離の横断知見追記)
- Key insight: %CPU は「非アイドル時間」であり演算とメモリ待機を区別しない。IPC(Instructions Per Cycle)こそが真の処理効率指標で、IPC < 1.0 はメモリバウンドを直接示す。CPU-DRAM ギャップにより現代の「高 CPU 利用率」の多くは実は DRAM 待機である。
## [2026-06-28] ingest-paper | Characterizing Cloud Computing Hardware Reliability (SoCC 2010)
- Source: `.raw/papers/socc088-vishwanath.pdf`(https://www.microsoft.com/en-us/research/wp-content/uploads/2010/06/socc088-vishwanath.pdf)
- Summary: [[@2010__SoCC__Characterizing Cloud Computing Hardware Reliability]]
- Pages created: [[@2010__SoCC__Characterizing Cloud Computing Hardware Reliability]], [[Kashi Venkatesh Vishwanath]], [[Nachiappan Nagappan]]
- Pages updated: [[データセンター信頼性]](横断的知見 3 件追記), [[障害予測]](横断的知見 1 件追記)
- Key insight: 障害予測の最強因子がデータセンター名・メーカー名というメタデータ的環境情報であり、サーバー齢・ラック位置・ワークロードは有意でない — コンテキスト情報が個別コンポーネント特徴量より効くという逆説は LLM 期の障害予測設計にも通じる。
## [2026-06-28] ingest | The SPACE of Developer Productivity (ACM Queue 2021)
- Source: `.raw/articles/the-space-of-developer-productivity-2026-06-28.md`(URL: https://queue.acm.org/detail.cfm?id=3454124、Cloudflare ブロックのため WebSearch + 二次資料から再構成)
- 論文: [[Nicole Forsgren]] ら、ACM Queue Vol.19 No.1, Feb 2021
- Summary: [[@2021__ACMQueue__The SPACE of Developer Productivity]]
- Pages created: [[@2021__ACMQueue__The SPACE of Developer Productivity]], [[開発者生産性]], [[Margaret-Anne Storey]]
- Pages updated: [[SPACE]](横断的知見・出典追記), [[Nicole Forsgren]](出典追記)
- Key insight: アクティビティ(A)は「最も見えやすく最も危険な次元」——コミット数・PR 数は生産性の代理指標にならず、少なくとも 3 次元での計測が必須という原論文の明示的な警告を wiki に反映した。
## [2026-06-28] wiki-query | ポストモーテム文献横断ナラティブ
- [[ポストモーテムと事後分析の文献横断ナラティブ]] (question 新規) — ポストモーテムと事後分析に関する文献を CS 論文 Introduction 風に統合。[[ポストモーテム]]・[[根本原因分析]]・[[インシデント管理]]・[[運用障害分析]]・[[インシデント考古学]]・[[複雑システム障害論]] の 6 概念ページを横断引用。
## [2026-06-28] ingest-video | The Power of Stories
- Source: https://www.youtube.com/watch?v=Nd0xfNmkgRI (USENIX SREcon26 Americas)
- Transcript: `.raw/videos/srecon26-hochstein-power-of-stories/transcript.md` (YouTube 自動字幕 en-orig から生成)
- Frames: なし(フレーム取得不可)
- Summary: [[@2026__SREcon26Americas__The Power of Stories]]
- Pages created: [[Lorin Hochstein]], [[Airbnb]], [[逸脱の正常化]], [[@2026__SREcon26Americas__The Power of Stories]]
- Pages updated: [[インシデントストーリー]], [[インシデントレポート執筆]], wiki/index.md, wiki/hot.md, wiki/sources/_index.md, wiki/entities/_index.md, wiki/concepts/_index.md
- Key insight: インシデントストーリーの有用性は anomalous + immutable の 2 条件で決まる。逸脱の正常化は SRE の日常的アラート閾値調整にも常在する概念である。
## [2026-06-28] ingest-paper | Incident Metrics in SRE: Critically Evaluating MTTR and Friends
- Source: `.raw/papers/IncidentMeticsInSre.pdf`(36 ページ)
- Summary: [[@2021__OReilly__Incident Metrics in SRE]]
- Pages created: [[@2021__OReilly__Incident Metrics in SRE]], [[Štěpán Davidovič]]
- Pages updated: [[TTXメトリクス]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/index]], [[wiki/hot]], [[wiki/log]]
- Key insight: MTTR はインシデント改善の評価指標として機能せず、中央値・幾何平均・パーセンタイルの代替統計でも問題は解決しない。問題の核心はデータ品質でなくインシデント件数の少なさと分散の高さという本質的な性質にある。Google 規模の大規模データでも実用的な信頼区間に収まらない。
## [2026-06-28] ingest-slides | Unlock High-Frequency Deployments without Blowing Up Prometheus
- Source: `.raw/slides/2026__SREcon26Americas__Unlock-High-Frequency-Deployments-without-Blowing-Up-Prometheus/2026__SREcon26Americas__Unlock-High-Frequency-Deployments-without-Blowing-Up-Prometheus.pdf`(35 ページ)
- Visual pages: `.raw/slides/2026__SREcon26Americas__Unlock-High-Frequency-Deployments-without-Blowing-Up-Prometheus/pages/`
- Media: `.raw/slides/2026__SREcon26Americas__Unlock-High-Frequency-Deployments-without-Blowing-Up-Prometheus/transcript.md`(YouTube 自動字幕)
- Summary: [[@2026__SREcon26Americas__Unlock High-Frequency Deployments without Blowing Up Prometheus]]
- Pages created: [[@2026__SREcon26Americas__Unlock High-Frequency Deployments without Blowing Up Prometheus]], [[Ganesh Vernekar]], [[Reddit]], [[Prometheusシリーズチャーン]], [[Prometheus TSDB]]
- Pages updated: [[Prometheus]]
- Key insight: Kubernetes 高頻度デプロイによる Prometheus OOM の根本原因は「2 時間 HEAD flush 待ちの間に失活系列が蓄積する」構造にある。stale-series compaction は RAM→ディスクへの先回りフラッシュで解決するが、クエリ時マージオーバーヘッドが増加するため「保護」目的に限定し、失活系列比率 > 0.5 でのみ検討すべき。閾値選択は試行錯誤が不可避。
## [2026-06-28] ingest-slides | Reliability Equilibrium: The Hidden Playbook behind SRE Influence
- Source: `.raw/slides/sre26amer_slides_barteneva/sre26amer_slides_barteneva.pdf`(60 ページ)
- Visual pages: `.raw/slides/sre26amer_slides_barteneva/pages/`
- Media: none(transcript なし)
- Summary: [[@2026__SREcon26Americas__Reliability Equilibrium - The Hidden Playbook behind SRE Influence]]
- Pages created: [[@2026__SREcon26Americas__Reliability Equilibrium - The Hidden Playbook behind SRE Influence]], [[Daria Barteneva]], [[ゲーム理論とSRE]]
- Pages updated: [[Microsoft Azure]]
- Key insight: SRE の失敗の多くが調整(coordination)の失敗であり、ゲーム理論の 5 類型(囚人のジレンマ・Stag Hunt・公共財・ベイジアン・進化的)で系統診断できる。SRE ツール(SLO・エラーバジェット・カナリア)はメカニズムデザインとして再解釈でき、「良い均衡」へのインセンティブを設計する行為だという視点は、信頼性エンジニアリングの組織的戦略に新しい語彙を与える。
## [2026-06-28] ingest-paper | Loop Engineering: The Anthropic Playbook for Designing Systems That Prompt Your Agents
- Source: `.raw/papers/Loop-Engineering-IEEE.pdf`(11 ページ・HuaShu による Osmani Orange Book 再整形版)
- Summary: [[@2026__Working Note__Loop Engineering - The Anthropic Playbook for Designing Systems That Prompt Your Agents]]
- Pages created: [[@2026__Working Note__Loop Engineering - The Anthropic Playbook for Designing Systems That Prompt Your Agents]], [[Addy Osmani]], [[Prithvi Rajasekaran]], [[Steve Kaliski]]
- Pages updated: [[ループエンジニアリング]]
- Key insight: ループエンジニアリングの「5 ムーブ/6 パーツ/4 コスト」フレームワークが明示化された。特に 5 つの失敗パターン(Nodding/Amnesiac/Manual/Blind/Tangled Loop)が各ムーブと 1 対 1 に対応し診断ツールとして機能する点、およびジェネレータ/エバリュエータ分離が「言葉遣いの問題ではなく構造の問題」という点が実用的新規性。
## [2026-06-28] ingest-slides | Postmortem as a textbook
- Source: `.raw/slides/Postmortem_as_a_textbook/Postmortem_as_a_textbook.pdf`
- Visual pages: `.raw/slides/Postmortem_as_a_textbook/pages/` (26 ページ)
- Media: none (transcript なし)
- Summary: [[@2023__SpeakerDeck__Postmortem as a textbook]]
- Pages created: [[@2023__SpeakerDeck__Postmortem as a textbook]], [[KATO Toshiya]], [[LINE株式会社]]
- Pages updated: [[ポストモーテム]](sources 追記・横断的知見にSRE主導執筆会議の知見追記)
- Key insight: 当事者のみが書くポストモーテムには「非専門家が理解できる情報が省略される」という5つの構造的問題があり、SREが事前30分会議をファシリテートすることで品質向上と全体共有会議の時短を同時に達成できる。
## [2026-06-28] ingest-video | The Ironies of AI²
- Source: YouTube https://www.youtube.com/watch?v=cvcGIr4a2Dk (公式ページ: https://www.usenix.org/conference/srecon26americas/presentation/reed)
- Transcript: `.raw/videos/srecon26-ironies-of-ai/transcript.md`(YouTube自動生成英語字幕から変換、135行)
- Frames: `.raw/videos/srecon26-ironies-of-ai/frames/`(17フレーム抽出済み)
- Summary: [[@2026__SREcon26Americas__The Ironies of AI²]]
- Pages created: [[@2026__SREcon26Americas__The Ironies of AI²]], [[Chime]]
- Pages updated: [[J Paul Reed]], [[自動化のアイロニー]], [[Joint Activity]]
- Key insight: インシデント中のAIとの協働がうまくいかない理由は、AIがJoint Cognitive Systemの協調基盤3特性(Directed Attention・Redirectability・Interpredictability)を欠くことに起因する。「AIに推薦でなく説明を求める」ことで、AI誤りによる人間パフォーマンス悪化を大幅に緩和できる。
## [2026-06-28] ingest-slides | Beyond Loss and Accuracy: Closing the Observability Gaps in AI Training with TrainCheck
- Source: `.raw/slides/sre26amer_slides_jiang/sre26amer_slides_jiang.pdf`
- Visual pages: `.raw/slides/sre26amer_slides_jiang/pages/` (32 ページ)
- Media: none(transcript なし)
- Summary: [[@2026__SREcon26Americas__Beyond Loss and Accuracy - Closing the Observability Gaps in AI Training with TrainCheck]]
- Pages created: [[Ryan Huang]]
- Pages updated: [[Yuxuan Jiang]], [[TrainCheck]], [[DLトレーニングサイレントエラー]], [[訓練不変条件]], [[MLモデル監視]]
- Key insight: AI 訓練監視の「活動 vs 正当性」ギャップを SRE 規律で埋める TrainCheck が、BLOOM・MPS の実世界ケースで第 1 イテレーションからサイレント障害を検知できることを具体的に示した
## [2026-06-28] ingest-slides | Human Factors in the Age of AI Ops: Re-Engineering Trust Between Humans and Machines (SREcon26 Americas)
- Source: `.raw/slides/2026__SREcon26Americas__Human-Factors-in-the-Age-of-AI-Ops/2026__SREcon26Americas__Human-Factors-in-the-Age-of-AI-Ops.pdf`
- Visual pages: `.raw/slides/2026__SREcon26Americas__Human-Factors-in-the-Age-of-AI-Ops/pages/` (63 ページ)
- Media: none (transcript なし)
- Summary: [[@2026__SREcon26Americas__Human Factors in the Age of AI Ops]]
- Pages created: [[@2026__SREcon26Americas__Human Factors in the Age of AI Ops]], [[Eddie Redick]], [[CTC Ops]]
- Pages updated: [[SRE AI Autonomy Levels]], [[アラート疲労]], [[人的要因]]
- Key insight: 技術的自律度(Google L0-L4)と組織的信頼受容度(Trust Spectrum)は直交する二軸であり、業界の 60% が Observe 段階に留まるという定量的根拠が産業調査から得られた
## [2026-06-28] ingest-slides | Executing Chaos Engineering in Production at a Critical Financial Institution (SREcon26 Americas)
- Source: `.raw/slides/2026__SREcon26Americas__Executing-Chaos-Engineering-in-Production/2026__SREcon26Americas__Executing-Chaos-Engineering-in-Production.pdf`
- Visual pages: `.raw/slides/2026__SREcon26Americas__Executing-Chaos-Engineering-in-Production/pages/` (17 ページ)
- Media: none(transcript 未取得・動画 URL 未取得)
- Summary: [[@2026__SREcon26Americas__Executing Chaos Engineering in Production at a Critical Financial Institution]]
- Pages created: [[カオスエンジニアリング]]、[[GameDay]]、[[Bradesco]]、[[Leonardo Marques]]、[[Luiz Siqueira]]、[[EasyPerform]]
- Pages updated: なし
- Key insight: 金融機関本番環境でのカオスエンジニアリング実践。「SRE を拡大せずに信頼性フレームワークをスケールするには自動化が必須」という問いが第2フェーズの起点。MTTD 73% 削減・MTTR 22% 改善を達成。
## [2026-06-28] ingest-slides | AI Agents for Incident Investigation: The Good, The Bad, and The Ugly (SREcon26 Americas)
- Source: `.raw/slides/sre26amer-budichenko/sre26amer-budichenko.pdf`
- Visual pages: `.raw/slides/sre26amer-budichenko/pages/` (17 ページ)
- Media: none (transcript なし)
- Summary: [[@2026__SREcon26Americas__AI Agents for Incident Investigation - The Good, The Bad, and The Ugly]]
- Pages created: [[Vladyslav Budichenko]], [[Vocaly AI]]
- Pages updated: [[LLMによる根本原因分析]], [[インシデント調査戦略]], [[エージェント運用安全性]], [[エージェントシステム運用]]
- Key insight: 本番 RCA 精度 11.34%・プロンプトインジェクション +540%・trust-for/verify フレームワークの実務的定式化
## [2026-06-28] ingest-slides | So You Want a New Incident Commander (SREcon26 Americas)
- Source: `.raw/slides/sre26amer_slides_huerta-granda/sre26amer_slides_huerta-granda.pdf`
- Visual pages: `.raw/slides/sre26amer_slides_huerta-granda/pages/` (25 ページ)
- Media: none(transcript 未取得・動画 URL 未取得)
- Summary: [[@2026__SREcon26 Americas__So You Want a New Incident Commander]]
- Pages created: [[Incident Commander]]
- Pages updated: [[Vanessa Huerta Granda]](SREcon26 発表・IC プログラム実践知を追記)、[[Enova]](IC プログラムとの接続を追記)、[[インシデント管理]](IC 役割と3チーム類型の横断的知見を追記)
- Key insight: IC は最強エンジニアのバッジでなく社会技術的リーダーシップスキルであり、構造(3類型)よりも「IC の役割が優先事項・仕事の一部であること」の明示が普遍的要件。
## [2026-06-28] ingest-slides | インシデントキーメトリクスによるインシデント対応の改善
- Source: `.raw/slides/sre-kaigi-2025/sre-kaigi-2025.pdf`
- Visual pages: `.raw/slides/sre-kaigi-2025/pages/` (56 ページ)
- Media: `.raw/slides/sre-kaigi-2025/transcript.md`(YouTube 自動字幕 / ja より変換)
- Summary: [[@2025__SRE Kaigi 2025__インシデントキーメトリクスによるインシデント対応の改善]]
- Pages created: [[Narimichi Takamura]]、[[TTXメトリクス]]
- Pages updated: [[Topotal]]、[[Waroom]]、[[インシデント管理]]
- Key insight: MTTR がモンテカルロシミュレーション実証で改善評価指標として機能しないことを定量的に示し、TTX メトリクス 11 種類への代替と Waroom での自動収集実装を提示。
## [2026-06-28] ingest-slides | 1年間のポストモーテム運用とそこから生まれたツール sre-advisor
- Source: `.raw/slides/srenext2022-fujiwara-postmortem-sre-advisor/presentation.pdf`
- Visual pages: `.raw/slides/srenext2022-fujiwara-postmortem-sre-advisor/pages/` (32 ページ)
- Media: `.raw/slides/srenext2022-fujiwara-postmortem-sre-advisor/transcript.md`(YouTube 自動字幕 / ja より変換)
- Summary: [[@2022__SRENEXT2022__1年間のポストモーテム運用とそこから生まれたツール sre-advisor]]
- Pages created: [[藤原俊一郎]]
- Pages updated: [[面白法人カヤック]], [[ポストモーテム]]
- Key insight: ポストモーテムの振り返りから得た設定不備の傾向を sre-advisor としてコード化することで、「インシデント → ポストモーテム → 事前検出 → 予防」の循環ループを実現した。知見をガードレールへ昇華する具体的実装例。
## [2026-06-28] ingest-slides | Learning from Incidents at Scale; Actually Doing Cross-Incident Analysis
- Source: YouTube 自動字幕 (https://www.youtube.com/watch?v=Q69WND8YHag)
- Media: `.raw/slides/2025__SREcon25Americas__Learning-from-Incidents-at-Scale/transcript.md`
- スライド PDF: 未取得(USENIX ページはサインイン必須)
- Summary: [[@2025__SREcon25 Americas__Learning from Incidents at Scale - Actually Doing Cross-Incident Analysis]]
- Pages created: [[クロスインシデント分析]], [[Vanessa Huerta Granda]], [[Enova]]
- Pages updated: [[ポストモーテム]], [[Jeli]]
- Key insight: クロスインシデント分析を「自走プログラム」にするには専任チーム・構造化アーティファクト・組織計画連動の3要素が必要。部門横断の関係者招待が単一最重要変革。MTTR 等の指標はコンテキストなしでは意味がない。
## [2026-06-28] ingest-slides | The Case of the Misnamed Cities: CAST Analysis of a Google Maps Incident
- Source: `.raw/slides/srecon26americas-barroso-cast/srecon26americas-barroso-cast.pdf`
- Visual pages: `.raw/slides/srecon26americas-barroso-cast/pages/` (113 ページ・アニメーション重複含む・主要 15 ページ精読)
- Media: none (transcript なし)
- Summary: [[@2026__SREcon26Americas__The Case of the Misnamed Cities - CAST Analysis of a Google Maps Incident]]
- Pages created: [[@2026__SREcon26Americas__The Case of the Misnamed Cities - CAST Analysis of a Google Maps Incident]], [[Ruben Barroso]], [[Nancy G. Leveson]], [[CAST]]
- Pages updated: [[事故モデル]], [[根本原因分析]]
- Key insight: 時系列(Chronology)は因果(Causality)でない。RCA のイベント選択は「馴染み深い・politically acceptable」な主観的フィルターを通る。CAST は制御構造とメンタルモデル分析で非イベント的・組織的要因まで到達できる。
## [2026-06-28] ingest-slides | Mean Time to WTF: Why Developer Experience Frameworks Belong in Your Incident Retrospectives
- Source: `.raw/slides/srecon26-forsgren/srecon26-forsgren.pdf`
- Visual pages: `.raw/slides/srecon26-forsgren/pages/` (37 ページ全確認)
- Media: none (transcript なし)
- Summary: [[@2026__SREcon26 Americas__The WTF Problem - Developer Experience as a Reliability Property]]
- Pages created: なし(2026-06-16 先行作成済み)
- Pages updated: [[@2026__SREcon26 Americas__The WTF Problem - Developer Experience as a Reliability Property]](date_published 修正・限界記述更新)
- Key insight: SRE の摩擦(認知負荷・ツール摩擦・プロセス摩擦)は信頼性のシステム特性であり、AI 導入により指数的に増幅される。MTWTF(アラートから状況理解までの時間)を先行指標として計測することで、MTTR より前に運用の劣化を検知できる。
## [2026-06-28] enrich-source | Human Observability of Incident Response(transcript 追補)
- Transcript: `.raw/slides/srecon23americas-davis-human-observability/transcript.md`(Whisper による書き起こし)
- 追補: source ページに「口頭説明・補足」セクションを新設(注意/認識のマンダラ・コンダクター設計根拠・Complexity vs. Complication・コーディネーション・サプライズ・ガムラン命名由来・Wheel of Expertise の実績・マーケティング担当者の証言・Listening の深い定義)
- Key insight: transcript により「Gamelan」命名の由来(反復的即興発展)と Wheel of Expertise の具体的 ROI(2週間前のセッションでインシデントを先取り)が明確化された
## [2026-06-28] ingest-slides | Human Observability of Incident Response
- Source: `.raw/slides/srecon23americas-davis-human-observability/srecon23americas-davis-human-observability.pdf`
- Visual pages: `.raw/slides/srecon23americas-davis-human-observability/pages/` (39 ページ全確認)
- Media: なし(YouTube 字幕取得失敗。media.url のみ保存)→ 後日 Whisper transcript 追補
- Summary: [[@2023__SREcon23Americas__Human Observability of Incident Response]]
- Pages created: [[Joint Activity]], [[Common Grounding]], [[Practice of Practice]], [[Matt Davis]], [[Pauline Oliveros]], [[Derek Bailey]]
- Pages updated: [[Laura Maguire]], [[Richard I. Cook]], [[人的要因]], [[レジリエンスエンジニアリング]], [[インシデント管理]]
- Key insight: インシデント対応の「人間のオブザーバビリティ」——参加者が互いの状態・疲労・注意を観測し合う——は技術的オブザーバビリティとは独立した観測問題であり、即興演奏理論(Joint Activity・Common Grounding・Practice of Practice)で体系化できる
## [2026-06-28] ingest-slides | Far from the Shallows: What We Can Learn From Deeper Incident Stories
- Source: `.raw/slides/srecon23amer-nash-far-from-shallows/` (YouTube 動画フレーム 79 枚 + 自動字幕 transcript)
- Visual pages: `.raw/slides/srecon23amer-nash-far-from-shallows/pages/` (79 ページ全確認)
- Media: `.raw/slides/srecon23amer-nash-far-from-shallows/transcript.md` (YouTube 自動字幕 VTT 変換)
- Summary: [[@2023__SREcon23Americas__Far from the Shallows]]
- Pages created: [[Courtney Nash]], [[Verica]], [[インシデントストーリー]]
- Pages updated: [[インシデント重大度評価]], [[根本原因分析]], [[Jens Rasmussen]]
- Key insight: Severity と Duration は無相関(The Void データ)、Root Cause 指定は複雑システムの因果を 3 点で損なう、インシデントストーリーが shallow data の代替枠組みとして機能する。
## [2026-06-28] ingest-slides | Turning an Incident Report into a Design Issue with TLA+
- Source: `.raw/slides/srecon23-incident-report-tla-plus/srecon23-incident-report-tla-plus.pdf`
- Visual pages: `.raw/slides/srecon23-incident-report-tla-plus/pages/` (23 ページ全確認)
- Media: none(transcript なし)
- Summary: [[@2023__SREcon23Americas__Turning an Incident Report into a Design Issue with TLA+]]
- Pages created: [[Finn Hackett]], [[Markus A. Kuppe]], [[Joshua Rowe]], [[Azure CosmosDB]], [[TLA+]]
- Pages updated: [[結果整合性]], [[ポストモーテム]]
- Key insight: インシデントレポートが文書化できない「設計レベルの洞察」を TLA+ モデルチェッカーのカウンター例として生成するワークフロー。Azure CosmosDB の Session Consistency はセッショントークンを共有しない複数クライアント間では整合性を保証しないという根本原因が確定できた。
## [2026-06-28] ingest-slides | Incident Archeology: Finding Value in the Paperwork and Narratives of the past
- Source: `.raw/slides/srecon23amer-byrum-incident-archaeology/srecon23amer-byrum-incident-archaeology.pdf`
- Visual pages: `.raw/slides/srecon23amer-byrum-incident-archaeology/pages/` (27 pages、全確認済み)
- Media: transcript なし
- Summary: [[@2023__SREcon23Americas__Incident Archeology - Finding Value in the Paperwork and Narratives of the past]]
- Pages created: [[インシデント考古学]]、[[Clint Byrum]]、[[Spotify]]
- Pages updated: [[ポストモーテム]]
- Key insight: 探していなかった知見(業務時間中 80%・変更起因 30%・時刻フィールド 75% デフォルト放置)が設定仮説から得た知見より組織にとって有価値だった。
## [2026-06-28] ingest-slides | The Repeat Incident Fallacy: What Jurassic Park Can Teach Us about Incidents
- Source: `.raw/slides/srecon22emea__ruppe__repeat-incident-fallacy/srecon22emea__ruppe__repeat-incident-fallacy.pdf`
- Visual pages: `.raw/slides/srecon22emea__ruppe__repeat-incident-fallacy/pages/` (24 pages, 全確認済み)
- Media: transcript なし
- Summary: [[@2022__SREcon22EMEA__The Repeat Incident Fallacy - What Jurassic Park Can Teach Us about Incidents]]
- Pages created: [[@2022__SREcon22EMEA__The Repeat Incident Fallacy - What Jurassic Park Can Teach Us about Incidents]]、[[Emily Ruppe]]、[[Laura Maguire]]
- Pages updated: [[ポストモーテム]](Repeat Incident Fallacy + 4 者収束を追記)、[[レジリエンスエンジニアリング]](「カーディオ」実践 + evolving sociotechnical systems を追記)、[[Jeli]](Emily Ruppe を所属メンバーとして追記)
- Key insight: 「二度と起こさない」という誓約の代わりに「Insights from the Past = Options in the Future」——過去の洞察が未来の選択肢を増やすという枠組みへの転換が、Gallego/Lund/Partington と合わせて 4 者収束として wiki に加わった。
## [2026-06-28] ingest-slides | A Post Incident Review Review
- Source: `.raw/slides/srecon22apac-partington/srecon22apac-partington.pdf`
- Visual pages: `.raw/slides/srecon22apac-partington/pages/` (53 pages; p.29 API 拒否)
- Media: transcript なし(USENIX 音源未取得)
- Summary: [[@2022__SREcon22APAC__A Post Incident Review Review]]
- Pages created: [[@2022__SREcon22APAC__A Post Incident Review Review]]、[[Tom Partington]]、[[ANZx]]、[[J Paul Reed]]、[[John Allspaw]]、[[Jeli]]、[[Sidney Dekker]]、[[James Reason]]、[[Jens Rasmussen]]
- Pages updated: [[ポストモーテム]](ANZx実践実績・learning>fixing・Record vs Report を横断的知見に追記)、[[事故モデル]](Rasmussen Safety Model と PIR スタイルの接続を追記)、[[人的要因]](Mechanistic Reasoning・Dekker's Tunnel を追記)、[[レジリエンスエンジニアリング]](Safety I→II・STELLA/Woods' Theorem を追記)
- Key insight: 「根本原因・アクションアイテム・MTTx なし」で高度規制産業1000人超組織の PIR を運用し「再発がまれ」という実績が、ポストモーテムの従来前提(修復項目がなければ再発する)を直接反証する最強の実践例として wiki に加わった。
## [2026-06-28] ingest-slides | Running Excellent Retrospectives: Talking for Humans
- Source: `.raw/slides/srecon19americas-eckhardt/srecon19americas-eckhardt.pdf`
- Visual pages: `.raw/slides/srecon19americas-eckhardt/pages/` (56 pages)
- Media: transcript なし(YouTube 429 エラー・Whisper 未インストール)
- Summary: [[@2019__SREcon19Americas__Running Excellent Retrospectives - Talking for Humans]]
- Pages created: [[@2019__SREcon19Americas__Running Excellent Retrospectives - Talking for Humans]]、[[Lex Neva]]、[[Fastly]]
- Pages updated: [[Courtney Eckhardt]](Americas talk 追記)、[[レトロスペクティブファシリテーション]](パーセプチュアル学習・ユーモア管理・感情環境制御の横断知見3件追記・sources/related 追加)、[[人的要因]](Lake Washington 事例を横断的知見に追記)、[[ポストモーテム]](sources 追記)
- Key insight: SREcon19 Americas と Asia/Pacific で同じ Courtney Eckhardt が異なる設計思想で同じテーマを扱っている。Americas 版はパーセプチュアル学習(体験型チュートリアル)を採用し、「ファシリテーション3仕事」という整理とユーモアの体系的管理を前面に出した。また Lake Washington 浮橋事例は「物理的因果連鎖が完全でも人的文脈が欠ければ振り返りは不完全」という命題の具体例として Human Factors 概念の充実に寄与した。
## [2026-06-28] ingest-slides | Principled Identification of "Root Causes" Using Techniques from Safety Engineering
- Source: `.raw/slides/srecon22emea__devesine__root-causes/srecon22emea__devesine__root-causes.pdf`
- Visual pages: `.raw/slides/srecon22emea__devesine__root-causes/pages/` (23 pages)
- Media: `.raw/slides/srecon22emea__devesine__root-causes/transcript.md`(YouTube 自動字幕・英語)
- Summary: [[@2022__SREcon22 EMEA__Principled Identification of Root Causes Using Techniques from Safety Engineering]]
- Pages created: [[@2022__SREcon22 EMEA__Principled Identification of Root Causes Using Techniques from Safety Engineering]], [[Laura de Vesine]]
- Pages updated: [[根本原因分析]](根本原因/トリガー用語再定義・トリガーホワイトアモール病理の横断知見追記)、[[事故モデル]](System/Environment 境界モデルとスイスチーズモデルの対比を追記)
- Key insight: 「根本原因 = システムの脆弱性」「トリガー = 最悪ケースの環境条件」という区別は、Will Gallego の「根本原因という概念を捨てよ」と Cook の「原因は構築される」の間で SRE エンジニアが実際に操作できる中間点を提供する。安全工学の System/Environment 境界という既存の学術知識が SRE インシデント分析に直接転用できることを示した。
## [2026-06-28] ingest-slides | Ditch the Template: How to Write Incident Reports They Want To Read
- Source: `.raw/slides/srecon22emea-nolan-ditch-template/srecon22emea-nolan-ditch-template.pdf`
- Visual pages: `.raw/slides/srecon22emea-nolan-ditch-template/pages/` (36 pages)
- Media: transcript なし(動画埋め込みのみ・ダウンロード不可)。ブログ記事(Container Solutions Blog 2023-03-31)を参考資料として補完。
- Summary: [[@2022__SREcon22 EMEA__Ditch the Template - How to Write Incident Reports They Want To Read]]
- Pages created: [[@2022__SREcon22 EMEA__Ditch the Template - How to Write Incident Reports They Want To Read]], [[Laura Nolan]], [[Stanza Systems]], [[インシデントレポート執筆]]
- Pages updated: [[ポストモーテム]](テンプレート形式批判・専門知識伝承の 2 横断知見追記)
- Key insight: 「IR の価値は学習にあり、プロセスにあるのではない」——テンプレートを捨ててナラティブで書くことがこれまでのポストモーテムプロセス論(Gallego・Larson・Lund)と相補的に IR 文書品質の視点から同じ形骸化問題を解決する。
## [2026-06-28] ingest-slides | Retrospectives for Humans (a crash course)
- Source: `.raw/slides/srecon19apac-eckhardt/srecon19apac-eckhardt.pdf`
- Visual pages: `.raw/slides/srecon19apac-eckhardt/pages/` (47 pages)
- Media: `.raw/slides/srecon19apac-eckhardt/transcript.md`(YouTube 自動字幕)
- Summary: [[@2019__SREcon19 Asia__Retrospectives for Humans (a crash course)]]
- Pages created: [[Courtney Eckhardt]], [[Heroku]], [[レトロスペクティブファシリテーション]]
- Pages updated: [[ポストモーテム]](contributing factor discovery・ファシリテーター言語の三者収束)、[[人的要因]](Miller's Law・ヒューマンエラー三者収束)
- Key insight: 「Why/You→How/What」という言語変換は Eckhardt/Lund/Gallego の三者が独立に収束した、ポストモーテムでの学習深度を規定する中核原則。Miller's Law がその認識論的基盤を提供する。
## [2026-06-28] ingest-slides | Getting More out of Postmortems and Making Them Less Painful to Do
- Source: `.raw/slides/srecon19apac-rizqi/srecon19apac-rizqi.pdf`
- Visual pages: `.raw/slides/srecon19apac-rizqi/pages/` (51 pages)
- Media: `.raw/slides/srecon19apac-rizqi/transcript.md`(YouTube 自動字幕 1355 行)
- Summary: [[@2019__SREcon19Asia__Getting More out of Postmortems and Making Them Less Painful to Do]]
- Pages created: [[Ashar Rizqi]], [[Blameless]]
- Pages updated: [[ポストモーテム]](6要素・再参照性・Slack 非同期・ギルド・未解決問い追記)
- Key insight: ポストモーテム成功の6要素を 300 社以上から体系化。再参照性(Referenceability)は現時点でも未解決問題。Slack 上での軽量非同期 PM が期日内完了を促す実用的戦術。
## [2026-06-27] ingest-slides | Accident Models in Post Mortems
- Source: `.raw/slides/2016__SREcon16Europe__Accident-Models-in-Post-Mortems/2016__SREcon16Europe__Accident-Models-in-Post-Mortems.pdf`
- Visual pages: `.raw/slides/2016__SREcon16Europe__Accident-Models-in-Post-Mortems/pages/` (100 pages)
- Media: なし(transcript なし)
- Summary: [[@2016__SREcon16Europe__Accident Models in Post Mortems]]
- Pages created: [[Nathan Hoffman]], [[Miriam Lautner]], [[事故モデル]]
- Pages updated: [[Will Gallego]], [[Etsy]], [[ポストモーテム]]
- Key insight: 「ヒューマンエラー」は分析の行き止まりを示すラベル。安全性は創発的特性であり、原因は発見でなく構築される(Dekker)。デブリーフィング 7 カテゴリ問いかけで当事者視点を段階的再構築。
## [2026-06-27] ingest-slides | What Brought Us Down? Outage Trend Analysis at Google
- Source: `.raw/slides/srecon15__lueder__incident-analysis/srecon15__lueder__incident-analysis.pdf`
- Visual pages: `.raw/slides/srecon15__lueder__incident-analysis/pages/` (30 pages)
- Media: `.raw/slides/srecon15__lueder__incident-analysis/media/lueder.mp3`(音声取得済み、Whisper 失敗 → transcript なし)
- Summary: [[@2015__SREcon15__What Brought Us Down - Outage Trend Analysis at Google]]
- Pages created: [[Sue Lueder]], [[障害傾向分析]], [[インシデント重大度評価]]
- Pages updated: [[インシデント管理]], [[根本原因分析]], [[ポストモーテム]], [[Google]]
- Key insight: GQM フィードバックモデルで「複数障害横断分析プログラム」を体系化。8 フェーズタイムライン(Incident Duration = Detect → Resolve)・9 カテゴリ根本原因・Stop/Faster/Culture の 3 方向修正機会を公開した 2015 年時点の Google 最初の公開事例。
## [2026-06-27] ingest-slides (amendment) | A Tale of Two Postmortems — transcript 補完
- transcript Whisper バックグラウンド処理で取得完了(581行, audio.m4a から)
- Source page 更新: 口頭説明セクション追加(個別インタビュー手法・ファシリテーション言語規律・System 定義拡張・Debriefing Facilitation Guide 出典)
- ポストモーテム concept 更新: 3 横断的知見追加(個別インタビュー / How 言語規律 / 会議目標の再定義)
## [2026-06-27] ingest-slides | A Tale of Two Postmortems: A Human Factors View
- Source: `.raw/slides/srecon19apac_lund_postmortem/srecon19apac_lund_postmortem.pdf`
- Visual pages: `.raw/slides/srecon19apac_lund_postmortem/pages/` (45 pages)
- Media: `.raw/slides/srecon19apac_lund_postmortem/transcript.md` (Whisper, 581 行)
- Summary: [[@2019__SREcon19 Asia__A Tale of Two Postmortems - A Human Factors View]]
- Pages created: [[Tanner Lund]], [[人的要因]], [[レジリエンスエンジニアリング]]
- Pages updated: [[ポストモーテム]]
- Key insight: Dekker の4目的(認識論的・予防的・道徳的・実存的)が SRE ポストモーテムの「何のために実施するか」を体系化し、「ヒューマンエラー」という結論が分析を止める理由を構造的に説明する
## [2026-06-27] ingest-slides | Architecting a Technical Post Mortem
- Source: `.raw/slides/srecon18americas-gallego/srecon18americas-gallego.pdf`
- Visual pages: `.raw/slides/srecon18americas-gallego/pages/` (33 pages)
- Media: none (transcript なし; YouTube `UlIfDdoK6EQ` は未取得)
- Summary: [[@2018__SREcon18 Americas__Architecting a Technical Post Mortem]]
- Pages created: [[Will Gallego]], [[@2018__SREcon18 Americas__Architecting a Technical Post Mortem]]
- Pages updated: [[ポストモーテム]], [[根本原因分析]], [[Etsy]]
- Key insight: 「ブレームレス」より「ブレーム・アウェア」という Gallego の精緻化と、PM における「根本原因」用語の明示的否定が、既存のポストモーテム文化論(Google SRE Book / mixi / Hatena)に欠けていた実践者視点を補完する。
## [2026-06-27] ingest-paper | Failures and Fixes: A Study of Software System Incident Response
- Source: `.raw/papers/Sillito-and-Kutomi-2020---Failures-and-Fixes---A-Study-of-Software-System-Incident-Response.pdf`
- Summary: [[@2020__arXiv__Failures and Fixes - A Study of Software System Incident Response]]
- Pages created: [[Jonathan Sillito]], [[Esdras Kutomi]], [[Brigham Young University]], [[インシデント調査戦略]], + 1 source page
- Pages updated: [[インシデント管理]], [[根本原因分析]], [[オペラビリティ]], [[変更起因インシデント]]
- Key insight: 2020 年の 30 インシデント定性研究が LLM 時代の AIOps 論文が個別に攻める問題群(しきい値検知の脆弱性・モニタリング支援ツール自体の監視不足・調査における相関と因果の混同・設定変更のプロセス的非対称性)の出所として機能する。AlertGuardian/Bian Que/TSGuard の課題設定を遡る基礎文献として wiki に追加。
## [2026-06-27] ingest | ポストモーテム実務ガイド 5 ソースバッチ ingest
- Sources: `.raw/articles/incident-response-to-reliability-2026-06-27.md`, `.raw/articles/pagerduty-post-mortem-process-2026-06-27.md`, `.raw/articles/datadog-incident-postmortem-best-practices-2026-06-27.md`, `.raw/articles/mixi-fault-handling-postmortem-2026-06-27.md`, `.raw/articles/hatena-incident-information-sharing-2026-06-27.md`
- Summaries: [[@ReadME__Will Larson__Move Past Incident Response to Reliability]], [[@PagerDuty__Post-Mortem Process]], [[@2021__Datadog Blog__Best Practices for Writing Incident Postmortems]], [[@mixi developers__インフラ障害対応とポストモーテム]], [[@2018__Hatena Developer Blog__社内障害情報共有のススメ]]
- Pages created: [[ポストモーテム]], [[Will Larson]], [[PagerDuty]] + 5 source pages
- Pages updated: [[インシデント管理]], [[Datadog]], [[Hatena]]
- Key insight: ポストモーテムの実務面を Google/PagerDuty/Datadog の英語圏プラクティスと mixi/Hatena の日本企業プラクティスで横断比較。Incident Legalism(形骸化メカニズム)、再発防止策の 4 分類(予防/検出/緩和/修正)、リビングドキュメント化、全社共有による横方向学習という 4 つの実務知見を概念ページに集約。
## [2026-06-27] ingest-paper | Do Not Blame Users for Misconfigurations
- Source: `.raw/papers/Xu-et-al.-2013---Do-not-blame-users-for-misconfigurations.pdf`
- Summary: [[@2013__SOSP__Do Not Blame Users for Misconfigurations]]
- Pages created: [[@2013__SOSP__Do Not Blame Users for Misconfigurations]], [[設定ミス脆弱性]], [[Yuanyuan Zhou]], [[Shankar Pasupathy]], [[NetApp]]
- Pages updated: [[設定マイニング]], [[Tianyin Xu]], [[Ding Yuan]]
- Key insight: 設定ミスの 80% がサイレント系(違反・無視)であり、クラッシュより遥かに多い。開発者がソースコードから設定制約を自動推論するホワイトボックスアプローチ(SPEX)が、ブラックボックスマイニングと並ぶ二大系統の一方として 2013 年に確立した。
## [2026-06-27] ingest | OBI docs, OBI Header Enrichment, GenAI Observability, OTel Collector Survey, Japanese Survey, Log Dedup Processor (6 OTel sources batch)
- Source: `.raw/articles/obi-opentelemetry-ebpf-instrumentation-2026-06-27.md`, `.raw/articles/obi-http-header-enrichment-2026-06-27.md`, `.raw/articles/genai-observability-opentelemetry-2026-06-27.md`, `.raw/articles/otel-collector-follow-up-survey-2026-06-27.md`, `.raw/articles/otel-japanese-community-survey-2026-06-27.md`, `.raw/articles/log-deduplication-processor-2026-06-27.md`
- Summary: [[@2026__OTelDocs__OBI - OpenTelemetry eBPF Instrumentation]], [[@2026__OTelBlog__OBI HTTP Header Enrichment]], [[@2026__OTelBlog__GenAI Observability with OpenTelemetry]], [[@2026__OTelBlog__OTel Collector Follow-up Survey]], [[@2026__OTelBlog__Japanese Community Survey]], [[@2026__OTelBlog__Log Deduplication Processor]]
- Pages created: [[@2026__OTelDocs__OBI - OpenTelemetry eBPF Instrumentation]], [[@2026__OTelBlog__OBI HTTP Header Enrichment]], [[@2026__OTelBlog__GenAI Observability with OpenTelemetry]], [[@2026__OTelBlog__OTel Collector Follow-up Survey]], [[@2026__OTelBlog__Japanese Community Survey]], [[@2026__OTelBlog__Log Deduplication Processor]], [[OBI]], [[ゼロコード計装]], [[GenAI オブザーバビリティ]], [[ログ重複排除]]
- Pages updated: [[OpenTelemetry]], [[eBPF]], [[オブザーバビリティ]], [[テレメトリ]]
- Key insight: OBI が eBPF ベースのゼロコード計装を GenAI プロバイダまで拡張。日本の OTel コミュニティではトレースが 93% で最多シグナル(国際パターンと乖離)。Collector のデプロイ規模拡大と VM ハイブリッド化が進行し、設定管理・安定性が最優先課題。ログ重複排除プロセッサはサンプリングと異なり情報を保持しつつ冗長ストレージを排除する。
## [2026-06-27] ingest | OTel-Arrow Phase 2: From Efficient Transport to Efficient Telemetry Pipelines
- Source: `.raw/articles/otel-arrow-phase-2-2026-06-27.md`
- Summary: [[@2026__OTelBlog__OTel-Arrow-Phase-2]]
- Pages created: [[@2026__OTelBlog__OTel-Arrow-Phase-2]], [[OTel-Arrow]], [[OTAP]], [[Apache-Arrow]]
- Pages updated: [[OpenTelemetry]]
- Key insight: Apache Arrow のカラム型フォーマットをテレメトリパイプラインの内部表現として維持することで、シリアライゼーションオーバーヘッドを排除し、単一コアで OTLP 比 20 倍のスループット(2.47M vs 121K logs/sec)を達成。Phase 1(ワイヤプロトコル)から Phase 2(パイプライン全体の内部表現)への進化。
## [2026-06-27] ingest-paper | Cloud Atlas, Chain-of-Event, IRLLS, HeMiRCA, MicroIRC, RCA Outliers, RCInvestigator, GrayScope, SynthoDiag, MicroDig (10 papers batch)
- Source: `.raw/papers/arxiv-2407.08694.pdf`, `.raw/papers/Chain-of-Event_Interpretable-Root-Cause-Analysis-for-MicroservicesFSE24-Camera-Ready.pdf`, `.raw/papers/Xie-et-al.-2024---Microservice-root-cause-analysis-with-limited-observability-through-intervention-recognition-in-the-latent-space.pdf`, `.raw/papers/2026_Unknown_HeMiRCA_Fine_Grained_Root_Cause.pdf`, `.raw/papers/2026_Zhu_Microirc_Instance_Level_Root_Cause.pdf`, `.raw/papers/neurips-2025-rca-outliers.pdf`, `.raw/papers/RCInvestigator_Towards_Better_Investigation_of_Anomaly_Root_Causes_in_Cloud_Computing_Systems.pdf`, `.raw/papers/FSE_24_GrayScope.pdf`, `.raw/papers/FSE_2024_SynthoDiag.pdf`, `.raw/papers/Diagnosing_Performance_Issues_for_Large-Scale_Microservice_Systems_With_Heterogeneous_Graph.pdf`
- Summary: **(1) Cloud Atlas** ([[@2024__arXiv__Cloud Atlas - Efficient Fault Localization for Cloud Systems using Language Models and Causal Insight]]): Zhiqiang Xie ほか(Stanford/CMU/Microsoft Research)。LLM でシステム文書から因果グラフを自動合成し障害箇所特定。手動構築グラフと同等精度。**(2) Chain-of-Event** ([[@2024__FSE__Chain-of-Event - Interpretable Root Cause Analysis for Microservices through Automatically Learning Weighted Event Causal Graph]]): Zhenhe Yao ほか(清華/CAS/eBay)。マルチモーダル観測データをイベントに変換し、重み付きイベント因果グラフで解釈可能な RCA。SRE の運用知見を直接統合。**(3) IRLLS** ([[@2024__KDD__Microservice Root Cause Analysis with Limited Observability]]): 限定観測可能性下の潜在空間介入認識。**(4) HeMiRCA** ([[@2024__TOSEM__HeMiRCA - Fine-Grained Root Cause Analysis for Microservices with Heterogeneous Data Sources]]): Zhouruixing Zhu ほか(CUHK-Shenzhen/CUHK)。トレースとメトリクスの異種データ間の異常認識単調相関を発見し、Spearman 相関で階層的 RCA。サービスレベル top-1 82.7%。**(5) MicroIRC** ([[@2026__Elsevier__MicroIRC - Instance-level Root Cause Localization for Microservice Systems]]): Yuhan Zhu ほか(武漢大学/CSIRO)。インスタンスレベル粒度の GNN ベース RCA。呼び出しグラフ+メトリクスグラフの二重グラフ。**(6) RCA Outliers** ([[@2025__NeurIPS__Root Cause Analysis of Outliers with Missing Structural Knowledge]]): William Roy Orchard ほか(Cambridge/MPI/Amazon)。因果グラフ未知の単一サンプル RCA の理論的保証。ポリツリー構造で周辺異常スコアのみで RCA 可能。**(7) RCInvestigator** ([[@2026__TVCG__RCInvestigator - Towards Better Investigation of Anomaly Root Causes in Cloud Computing Systems]]): Shuhan Liu ほか(Zhejiang/Microsoft)。人間-機械協調型 RCA の可視分析システム。ビルド→モニタリング→推論→結論の 4 段階ワークフロー。**(8) GrayScope** ([[@2024__FSE__Illuminating the Gray Zone - Non-Intrusive Gray Failure Localization in Server Operating Systems]]): Shenglin Zhang ほか(南開/清華/Huawei)。サーバー OS のグレー障害(部分的・断続的障害)を非侵入的に箇所特定。専門知識と因果学習の融合。AC@5 90%。**(9) SynthoDiag** ([[@2024__FSE__SynthoDiag - Fault Diagnosis for Test Alarms in Microservices through Multi-source Data]]): Shenglin Zhang ほか(南開/Huawei Cloud/清華)。テストアラームの多ソース障害診断。障害分類+箇所特定の二段階。**(10) MicroDig** ([[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]]): Lei Tao ほか(南開/清華/Tencent)。異種グラフで因果関係と呼び出し関係の不一致を考慮した性能障害診断。
- Pages created: [[@2024__arXiv__Cloud Atlas - Efficient Fault Localization for Cloud Systems using Language Models and Causal Insight]], [[@2024__FSE__Chain-of-Event - Interpretable Root Cause Analysis for Microservices through Automatically Learning Weighted Event Causal Graph]], [[@2024__FSE__Illuminating the Gray Zone - Non-Intrusive Gray Failure Localization in Server Operating Systems]], [[@2024__FSE__SynthoDiag - Fault Diagnosis for Test Alarms in Microservices through Multi-source Data]], [[@2024__TOSEM__HeMiRCA - Fine-Grained Root Cause Analysis for Microservices with Heterogeneous Data Sources]], [[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]], [[@2025__NeurIPS__Root Cause Analysis of Outliers with Missing Structural Knowledge]], [[@2026__Elsevier__MicroIRC - Instance-level Root Cause Localization for Microservice Systems]], [[@2026__TVCG__RCInvestigator - Towards Better Investigation of Anomaly Root Causes in Cloud Computing Systems]], [[Zhiqiang Xie]], [[Yujia Zheng]], [[Lizi Ottens]], [[Wenxiao Chen]], [[Huai Jiang]], [[Liangfei Su]], [[GrayScope]], [[Di Weng]], [[Yingcai Wu]], [[CSIRO Data61]], [[テスト障害診断]], [[情報理論的異常スコア]], [[単一サンプルRCA]]
- Pages updated: [[@2024__KDD__Microservice Root Cause Analysis with Limited Observability]], [[根本原因分析]], [[グラフベースRCA]], [[因果推論ベースRCA]], [[介入的因果学習]], [[Interactive AIOps]], [[仮説駆動RCA]], [[ログベース障害診断]], [[グラフニューラルネットワーク]], [[知識グラフ]], [[Dan Pei]], [[Shenglin Zhang]], [[Qingwei Lin]], [[Jonathan Mace]], [[Christos Kozyrakis]], [[Kun Zhang]], [[Zhenhe Yao]], [[Pinjia He]], [[Zhouruixing Zhu]], [[Xiaohui Nie]], [[Zeyan Li]], [[Tencent]], [[Wuhan University]], [[Cheryl Lee]]
- Key insight: マイクロサービス RCA が「マルチモーダル入力(メトリクス+トレース+ログ)」「インスタンスレベル粒度」「理論的因果保証(単一サンプル RCA)」「人間協調型可視分析」「グレー障害」「テストアラーム」へと多軸に展開。LLM 因果グラフ自動合成(Cloud Atlas)は手動グラフ構築コストの突破口。
# Operation Log
## [2026-06-27] enrich-source | source ノート 9 本へ代表図スクリーンショットを埋め込み
- Source: `.raw/papers/dsn2017-datacenter-hardware-failures.pdf`, `.raw/papers/socc2016-cos.pdf`, `.raw/papers/imc2018-facebook-network-errors.pdf`, `.raw/papers/hotos2019-azure-software-failures.pdf`, `.raw/papers/sosp2011-hardware-errors.pdf`, `.raw/papers/nsdi2020-omegagen.pdf`, `.raw/papers/datacenter-scale-temperature-impact.pdf`, `.raw/papers/empirical-kubernetes-operator-bugs.pdf`, `.raw/papers/taxdc.pdf`
- Pages updated: [[@2017__DSN__What Can We Learn from Four Years of Data Center Hardware Failures]], [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]], [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]], [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]], [[@2011__SOSP__An Empirical Study on Configuration Errors in Commercial and Open Source Systems]], [[@2020__NSDI__Understanding, Detecting and Localizing Partial Failures in Large System Software]], [[@2013__ACM TOS__Datacenter Scale Evaluation of the Impact of Temperature on Hard Disk Drive Failures]], [[@2024__ISSTA__An Empirical Study on Kubernetes Operator Bugs]], [[@2016__ASPLOS__TaxDC - A Taxonomy of Non-Deterministic Concurrency Bugs in Datacenter Distributed Systems]]
- Key insight: wiki-ingest-paper の Step 0.5 に従い、PDF から代表図・表の領域をクロップして `wiki/sources/_attachments/` に保存し、該当する本文節へ Obsidian 埋め込みで追加した。
## [2026-06-27] ingest-paper | G-Cause, FaultInsight, LoFI, iKnow, SparseRCA, Interventional Causal Learning, ResilienceGuardian (7 papers batch)
- Sources:
- `.raw/papers/G-Cause---Parameter-free-Global-Diagnosis-for-Hyperscale-Web-Service-Infrastructures.pdf`
- `.raw/papers/2026_Unknown_FaultInsight_Interpreting_Hyperscale_Data_Center.pdf`
- `.raw/papers/LoFI.pdf`
- `.raw/papers/iKnow.pdf`
- `.raw/papers/SparseRCA__Unsupervised_Root_Cause_Analysis_in_Sparse_Microservice_Testing_Traces__ISSRE24_Camera_Ready_.pdf`
- `.raw/papers/957000a141.pdf`
- `.raw/papers/1570994962-final.pdf`
- Summary:
- [[@2024__ICWS__G-Cause - Parameter-free Global Diagnosis for Hyperscale Web Service Infrastructures]]
- [[@2024__KDD__FaultInsight - Interpreting Hyperscale Data Center Host Faults]]
- [[@2024__ISSRE__LoFI - Demystifying and Extracting Fault-indicating Information from Logs for Failure Diagnosis]]
- [[@2025__ASE__iKnow - an Intent-Guided Chatbot for Cloud Operations with Retrieval-Augmented Generation]]
- [[@2024__ISSRE__SparseRCA - Unsupervised Root Cause Analysis in Sparse Microservice Testing Traces]]
- [[@2024__DSN-S__Fault Localization Using Interventional Causal Learning for Cloud-Native Applications]]
- [[@2024__ISSRE__Guardian of the Resiliency - Detecting Erroneous Software Changes Before They Make Your Microservice System Less Fault-Resilient]]
- Pages created: 7 source pages, 16 entity pages ([[SparseRCA]], [[FaultInsight]], [[LoFI]], [[iKnow]], [[CausalBench]], [[ResilienceGuardian]], [[Xinrui Jiang]], [[Meng Ma]], [[Ping Wang]], [[Tingzhu Bi]], [[Junjie Huang]], [[Saurabh Jha]], [[Guanglei He]], [[Zhihan Jiang]], [[Guangba Yu]], [[Zhenhe Yao]]), 6 concept pages ([[障害注入]], [[運用障害分析]], [[介入的因果学習]], [[障害耐性劣化変更検知]], [[OpsQA]], [[RAGベースクラウド運用支援]])
- Pages updated: [[根本原因分析]]
- Key insight: テスト環境の疎トレースでは統計メトリクスベース因果発見が破綻し、排他レイテンシのパターンベース分解が有効。ハイパースケール Web 基盤ではパラメータフリーの全体診断(G-Cause)が有効。
## [2026-06-27] ingest-slides | AIスパコン「さくらONE」のオブザーバビリティ
- Source: `.raw/slides/o11yconjp2025/o11yconjp2025.pdf` (62 pages)
- Visual pages: `.raw/slides/o11yconjp2025/pages/`
- Media: `.raw/slides/o11yconjp2025/transcript.md` (YouTube 自動字幕・日本語)
- Summary: [[@2025__O11yConTokyo2025__AIスパコン「さくらONE」のオブザーバビリティ]]
- Pages created: [[@2025__O11yConTokyo2025__AIスパコン「さくらONE」のオブザーバビリティ]]
- Pages updated: [[GPU観測性]], [[LLM学習モニタリング]], [[SAKURAONE]], [[坪内佑樹]]
- Key insight: AI スパコンサービスのオブザーバビリティは責任境界によりリソース分析から始まらざるを得ず、クラウドネイティブ分野との「オブザーバビリティギャップ」が存在する。OTeL + Grafana パイプラインの具体構成が開示され、eBPF による GPU ゼロコード計装と R-Pingmesh による RoCE 常時監視でギャップ解消を目指す。
## [2026-06-27] rewrite-source | source ノート 9 本を既存形式に合わせて再構成
- Source: `.raw/papers/dsn2017-datacenter-hardware-failures.pdf`, `.raw/papers/socc2016-cos.pdf`, `.raw/papers/imc2018-facebook-network-errors.pdf`, `.raw/papers/hotos2019-azure-software-failures.pdf`, `.raw/papers/sosp2011-hardware-errors.pdf`, `.raw/papers/nsdi2020-omegagen.pdf`, `.raw/papers/datacenter-scale-temperature-impact.pdf`, `.raw/papers/empirical-kubernetes-operator-bugs.pdf`, `.raw/papers/taxdc.pdf`
- Pages updated: [[@2017__DSN__What Can We Learn from Four Years of Data Center Hardware Failures]], [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]], [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]], [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]], [[@2011__SOSP__An Empirical Study on Configuration Errors in Commercial and Open Source Systems]], [[@2020__NSDI__Understanding, Detecting and Localizing Partial Failures in Large System Software]], [[@2013__ACM TOS__Datacenter Scale Evaluation of the Impact of Temperature on Hard Disk Drive Failures]], [[@2024__ISSTA__An Empirical Study on Kubernetes Operator Bugs]], [[@2016__ASPLOS__TaxDC - A Taxonomy of Non-Deterministic Concurrency Bugs in Datacenter Distributed Systems]]
- Key insight: 前回の追記型拡充を置き換え、既存の充実した source ノートに合わせて、論文情報・概要・問題設定・分析方法・主要結果・新規性・考察・強み/弱点・関連・出典を含む一貫した本文へ再作成した。
## [2026-06-27] ingest-paper | A Survey on Failure Analysis and Fault Injection in AI Systems
- Source: `.raw/papers/2026_Unknown_A_Survey_Failure_Fault_Injection.pdf`
- Summary: [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems]]
- Pages created: [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems]], [[Roberto Natella]]
- Pages updated: [[Guangba Yu]], [[Pengfei Chen]], [[Michael R. Lyu]], [[Zibin Zheng]], [[Gou Tan]], [[障害注入]], [[運用障害分析]]
- Key insight: AI システムの6層(Service / Model / Framework / Toolkit / Platform / Infrastructure)それぞれで障害分析と障害注入のギャップが異なる形で存在し、特に NCCL・NVLink・InfiniBand など分散 AI 訓練の基幹通信障害は既存 FI ツールがまったくカバーしていない。
## [2026-06-27] ingest-paper | PreServe: Intelligent Management for LMaaS Systems via Hierarchical Prediction
- Source: `.raw/papers/PreServe.pdf`
- Summary: [[@2026__ICSE__PreServe - Intelligent Management for LMaaS Systems via Hierarchical Prediction]]
- Pages created: [[@2026__ICSE__PreServe - Intelligent Management for LMaaS Systems via Hierarchical Prediction]], [[LLMサービング管理]]
- Pages updated: [[LLM推論]], [[Zhihan Jiang]], [[Yujie Huang]], [[Guangba Yu]], [[Junjie Huang]], [[Jiazhen Gu]], [[Michael R. Lyu]]
- Key insight: LLM インスタンスのコールドスタート(数十〜数百秒)という制約が反応的スケーリングを無効化し、mLSTM による先読み予測 + DistilBERT による応答長予測の二層構造が LMaaS 管理の新しい設計原則となることを示した。
## [2026-06-27] ingest-paper | 障害箇所特定・根本原因分析 11 論文一括 ingest
- Source: `.raw/papers/Accurate_and_Interpretable_Log_Fault_Diagnosis_using_Large_Language_Models.pdf`, `.raw/papers/arxiv-2502.15728.pdf`, `.raw/papers/arxiv-2503.23051.pdf`, `.raw/papers/arxiv-2501.11545.pdf`, `.raw/papers/pdf.pdf` (OpenReview sCS9nrEXIS), `.raw/papers/DejaVu-paper.pdf`, `.raw/papers/2026_Unknown_Making_Fault_Localization_Online_Service.pdf`, `.raw/papers/No_More_Data_Silos_Unified_Microservice_Failure_Diagnosis_With_Temporal_Knowledge_Graph.pdf`, `.raw/papers/Ren-et-al.-2024---SLIM---A-scalable-and-interpretable-light-weight-fault-localization-algorithm-for-imbalanced-data-in-microservice.pdf`, `.raw/papers/Han-et-al.-2024---The-potential-of-one-shot-failure-root-cause-analysis---Collaboration-of-the-large-language-model-and-small-classifier.pdf`, `.raw/papers/arxiv-2412.02239.pdf`
- Summary: 障害箇所特定(Fault Localization)と根本原因分析(RCA)に関する 11 論文を並列エージェントで一括 wiki 化。
- Pages created: [[@2025__nkcs.iops.ai__Accurate and Interpretable Log-Based Fault Diagnosis using Large Language Models]], [[@2025__arXiv__BSODiag - A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems]], [[@2025__arXiv__COCA - Generative Root Cause Analysis for Distributed Systems with Code Knowledge]], [[@2025__arXiv__RADICE - Causal Graph Based Root Cause Analysis for System Performance Diagnostic]], [[@2025__AAAI Workshop AICT__Causal Discovery for Cloud Microservice Architectures]], [[@2022__ESEC FSE__Actionable and Interpretable Fault Localization for Recurring Failures in Online Service Systems]], [[@2025__TOSEM__Making Fault Localization in Online Service Systems More Actionable and Interpretable]], [[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]], [[@2024__ASE__SLIM - A scalable and interpretable light-weight fault localization algorithm for imbalanced data in microservice]], [[@2024__ASE__The Potential of One-Shot Failure Root Cause Analysis - Collaboration of the Large Language Model and Small Classifier]], [[@2024__arXiv__FaaSRCA - Full Lifecycle Root Cause Analysis for Serverless Applications]]
- Pages updated: [[Fault Localization]], [[根本原因分析]], [[因果発見]], [[因果推論ベースRCA]], [[LLMによる根本原因分析]], [[マルチモーダル障害診断]], [[グラフベースRCA]], [[サービス依存グラフ]], [[マイクロサービスコールグラフ]], [[サーバーレスアーキテクチャ]], [[ドメイン別RCA]] ほか entity 47 件・concept 20 件
- Key insight: 2019〜2025 の FL/RCA 研究が「単一モダリティ→マルチモーダル」「ランキング→因果サブグラフ」「教師あり→ワンショット/教師なし」「マイクロサービス限定→サーバーレス/クラウドインフラ/DB」へ多軸で拡大しており、コード知識(COCA)・TKG(UniDiag)・障害ユニット(DéjàVu)など問題粒度の再定義が主要な貢献パターンとなっている。
## [2026-06-27] enrich-source | データセンター信頼性・クラウド障害・分散システム障害の論文 source ページ拡充
- Source: `.raw/papers/dsn2017-datacenter-hardware-failures.pdf`, `.raw/papers/socc2016-cos.pdf`, `.raw/papers/imc2018-facebook-network-errors.pdf`, `.raw/papers/hotos2019-azure-software-failures.pdf`, `.raw/papers/sosp2011-hardware-errors.pdf`, `.raw/papers/nsdi2020-omegagen.pdf`, `.raw/papers/datacenter-scale-temperature-impact.pdf`, `.raw/papers/empirical-kubernetes-operator-bugs.pdf`, `.raw/papers/taxdc.pdf`
- Pages updated: [[@2017__DSN__What Can We Learn from Four Years of Data Center Hardware Failures]], [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]], [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]], [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]], [[@2011__SOSP__An Empirical Study on Configuration Errors in Commercial and Open Source Systems]], [[@2020__NSDI__Understanding, Detecting and Localizing Partial Failures in Large System Software]], [[@2013__ACM TOS__Datacenter Scale Evaluation of the Impact of Temperature on Hard Disk Drive Failures]], [[@2024__ISSTA__An Empirical Study on Kubernetes Operator Bugs]], [[@2016__ASPLOS__TaxDC - A Taxonomy of Non-Deterministic Concurrency Bugs in Datacenter Distributed Systems]]
- Key insight: 初回 ingest 時に薄かった各 source ページを、抽出済み PDF 本文に基づき、調査設計・分類軸・主要結果・実務含意・限界まで読める粒度へ拡充した。
## [2026-06-27] ingest-slides | SREのためのテレメトリー技術の探究
- Source: `.raw/slides/yapcfukuoka2025-telemetry-for-sre/yapcfukuoka2025-telemetry-for-sre.pdf`
- Visual pages: `.raw/slides/yapcfukuoka2025-telemetry-for-sre/pages/` (69 pages)
- Media: none (transcript なし)
- Auxiliary: さくらのナレッジ記事 https://knowledge.sakura.ad.jp/48582/
- Summary: [[@2025__YAPC Fukuoka 2025__SREのためのテレメトリー技術の探究]]
- Pages created: [[@2025__YAPC Fukuoka 2025__SREのためのテレメトリー技術の探究]]
- Pages updated: [[坪内佑樹]], [[さくらインターネット研究所]], [[テレメトリ]], [[Scaling Telemetry Workloads]], [[SREの工学化]], [[GPU観測性]]
- Key insight: 博士論文の 3 層モデル(計装→保存→分析)が一般聴衆向けに「コアコンセプト抽出の思考過程」として再提示され、collect-first → use-first のフィードバック閉ループ構想と AI for SRE / Observability for AI Systems への展開が示された。
## [2026-06-27] ingest-paper | LLMRCA: Multilevel Root Cause Analysis for LLM Applications Using Multimodal Observability Data
- Source: `.raw/papers/Tan-et-al.-2026---LLMRCA---Multilevel-root-cause-analysis-for-LLM-applications-using-multimodal-observability-data.pdf`
- Summary: [[@2026__TOSEM__LLMRCA - Multilevel Root Cause Analysis for LLM Applications Using Multimodal Observability Data]]
- Pages created: [[@2026__TOSEM__LLMRCA - Multilevel Root Cause Analysis for LLM Applications Using Multimodal Observability Data]], [[LLMRCA]], [[Gou Tan]]
- Pages updated: [[根本原因分析]], [[LLMによる根本原因分析]], [[マルチモーダル障害診断]]
- Key insight: LLM アプリケーション特化の多段 RCA を、マルチモーダルオブザーバビリティデータ(トレース・ログ・メトリクス)の統合的活用で実現。
## [2026-06-27] ingest-paper | MetaRCA: A Generalizable Root Cause Analysis Framework for Cloud-Native Systems Powered by Meta Causal Knowledge
- Source: `.raw/papers/arxiv-2603.02032.pdf`
- Summary: [[@2026__FSE__MetaRCA - A Generalizable Root Cause Analysis Framework for Cloud-Native Systems Powered by Meta Causal Knowledge]]
- Pages created: [[@2026__FSE__MetaRCA - A Generalizable Root Cause Analysis Framework for Cloud-Native Systems Powered by Meta Causal Knowledge]], [[MetaRCA]]
- Pages updated: [[根本原因分析]], [[因果推論ベースRCA]]
- Key insight: メタ因果知識により未知のシステムへの汎化を達成する RCA フレームワーク。
## [2026-06-27] ingest-paper | CCL-D: A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training
- Source: `.raw/papers/arxiv-2605.04478.pdf`
- Summary: [[@2026__PPoPP__CCL-D - A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training]]
- Pages created: [[@2026__PPoPP__CCL-D - A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training]]
- Pages updated: [[集合通信]]
- Key insight: 大規模モデル訓練における集合通信の遅延・ハング異常を高精度に診断するシステム。
## [2026-06-27] ingest-paper | KPIRoot+: An Efficient Integrated Framework for Anomaly Detection and Root Cause Analysis in Large-Scale Cloud Systems
- Source: `.raw/papers/arxiv-2506.04569.pdf`
- Summary: [[@2025__arXiv__KPIRoot+ - An Efficient Integrated Framework for Anomaly Detection and Root Cause Analysis in Large-Scale Cloud Systems]]
- Pages created: [[@2025__arXiv__KPIRoot+ - An Efficient Integrated Framework for Anomaly Detection and Root Cause Analysis in Large-Scale Cloud Systems]]
- Pages updated: [[異常検知]], [[根本原因分析]]
- Key insight: 異常検知と RCA を統合したエンドツーエンドフレームワークで大規模クラウドシステムに適用。
## [2026-06-27] ingest-paper | Towards LLM-Based Failure Localization in Production-Scale Networks
- Source: `.raw/papers/sigcomm25-bian.pdf`
- Summary: [[@2025__SIGCOMM__Towards LLM-Based Failure Localization in Production-Scale Networks]]
- Pages created: [[@2025__SIGCOMM__Towards LLM-Based Failure Localization in Production-Scale Networks]], [[BiAn]], [[Guyue Liu]]
- Pages updated: [[Fault Localization]], [[Ennan Zhai]]
- Key insight: 本番規模ネットワークにおける LLM ベースの障害箇所特定。
## [2026-06-27] ingest-paper | Robust Root Cause Diagnosis using In-Distribution Interventions
- Source: `.raw/papers/arxiv-2505.00930.pdf`
- Summary: [[@2025__ICLR__Robust Root Cause Diagnosis using In-Distribution Interventions]]
- Pages created: [[@2025__ICLR__Robust Root Cause Diagnosis using In-Distribution Interventions]], [[TWIST]]
- Pages updated: [[因果推論ベースRCA]], [[根本原因分析]]
- Key insight: 分布内介入により因果推論ベース RCA のロバスト性を向上。
## [2026-06-27] ingest-paper | ThinkFL: Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning
- Source: `.raw/papers/arxiv-2504.18776.pdf`
- Summary: [[@2026__ACM TOSEM__ThinkFL - Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning]]
- Pages created: [[@2026__ACM TOSEM__ThinkFL - Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning]]
- Pages updated: [[Fault Localization]], [[LLMによる根本原因分析]]
- Key insight: 強化微調整による自己改善型障害箇所特定。
## [2026-06-27] ingest-paper | eARCO: Efficient Automated Root Cause Analysis with Prompt Optimization
- Source: `.raw/papers/arxiv-2504.11505.pdf`
- Summary: [[@2025__arXiv__eARCO - Efficient Automated Root Cause Analysis with Prompt Optimization]]
- Pages created: [[@2025__arXiv__eARCO - Efficient Automated Root Cause Analysis with Prompt Optimization]], [[eARCO]], [[PromptWizard]]
- Pages updated: [[LLMによる根本原因分析]], [[根本原因分析]]
- Key insight: プロンプト最適化による効率的な自動 RCA。
## [2026-06-27] ingest-paper | GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis
- Source: `.raw/papers/arxiv-2508.12472.pdf`
- Summary: [[@2025__arXiv__GALA - Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis]]
- Pages created: [[@2025__arXiv__GALA - Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis]], [[GALA]], [[RCAEval]]
- Pages updated: [[根本原因分析]], [[LLMによる根本原因分析]]
- Key insight: グラフ拡張 LLM エージェントワークフローによる RCA の高度化。
## [2026-06-27] ingest-paper | GPTuner: A Manual-Reading Database Tuning System via GPT-Guided Bayesian Optimization
- Source: `.raw/papers/p1939-tang.pdf`
- Summary: [[@2024__VLDB__GPTuner - A Manual-Reading Database Tuning System via GPT-Guided Bayesian Optimization]]
- Pages created: [[@2024__VLDB__GPTuner - A Manual-Reading Database Tuning System via GPT-Guided Bayesian Optimization]], [[Jiale Lao]], [[Mingjie Tang]]
- Pages updated: [[データベースノブチューニング]]
- Key insight: LLM でマニュアルを読み構造化知識を構築し Coarse-to-Fine ベイズ最適化と組み合わせることで、ランタイムフィードバックのみに依存する従来手法(OtterTune 等)比 16 倍速く良い設定を発見。知識の構造化を LLM が直接担う点が DB-BERT のテキスト+RL アプローチからの質的転換。
## [2026-06-27] ingest-paper | openGauss: An Autonomous Database System
- Source: `.raw/papers/vldb21-opengauss.pdf`
- Summary: [[@2021__VLDB__openGauss - An Autonomous Database System]]
- Pages created: [[@2021__VLDB__openGauss - An Autonomous Database System]], [[openGauss]], [[Raftログ診断]]
- Pages updated: [[データベース自律診断]], [[データベースノブチューニング]], [[Guoliang Li]], [[Xuanhe Zhou]]
- Key insight: 学習ベースの最適化技術(MCTS クエリ書き換え・Tree-LSTM コスト推定・DRL プラン生成)を実際のオープンソース DB に統合した初の包括的自律フレームワーク。外付けチューニングツールとは異なり、診断・監視・チューニングを DBMS 内部で一貫して自動化する「内製化」アプローチ。
## [2026-06-27] ingest-paper | Automatic Database Management System Tuning Through Large-scale Machine Learning
- Source: `.raw/papers/van-aken-etal-parameters.pdf`
- Summary: [[@2017__SIGMOD__Automatic Database Management System Tuning Through Large-scale Machine Learning]]
- Pages created: [[@2017__SIGMOD__Automatic Database Management System Tuning Through Large-scale Machine Learning]], [[OtterTune]], [[Dana Van Aken]], [[Andrew Pavlo]]
- Pages updated: [[データベースノブチューニング]]
- Key insight: 因子分析→Lasso→ガウシアンプロセスの 3 段パイプラインで DBMS 設定を自動最適化し、過去チューニングセッションの転用で 60 分以内に DBA 相当の設定を生成。後続の DB-BERT・GPTuner・AgentTune すべてがこのパイプライン構造を土台としており、データベースノブチューニング分野の基盤研究。
## [2026-06-27] ingest-paper | データベース異常診断・RCA 8 論文一括
- Source: `.raw/papers/Anomaly_Diagnosis_with_Siamese_Discrepancy_Networks_in_Distributed_Cloud_Databases.pdf`, `.raw/papers/AIDB25_4.pdf`, `.raw/papers/p1169-ouyang.pdf`, `.raw/papers/vista-amazon-rds.pdf`, `.raw/papers/FSE_2023_LIZHI.pdf`, `.raw/papers/2026_Unknown_BALANCE_Bayesian_Linear_Attribution_Root.pdf`, `.raw/papers/grano-rca.pdf`, `.raw/papers/2019SIGMOD-ExplainIt.pdf`
- Summary: [[@2025__ICDE__Anomaly Diagnosis with Siamese Discrepancy Networks in Distributed Cloud Databases]], [[@2025__AIDB__AutoDebugger - Efficient Root Cause Analysis for Anomaly Jobs]], [[@2025__VLDB__RCRank - Multimodal Ranking of Root Causes of Slow Queries in Cloud Database Systems]], [[@2023__Amazon Science__Vista - Machine Learning based Database Performance Troubleshooting Framework in Amazon RDS]], [[@2023__FSE__Adapting Performance Analytic Techniques in a Real-World Database-Centric System]], [[@2023__PACMMOD__BALANCE - Bayesian Linear Attribution for Root Cause Localization]], [[@2019__VLDB__GRANO - Interactive Graph-based Root Cause Analysis for Cloud-Native Distributed Data Platform]], [[@2019__SIGMOD__ExplainIt! - A Declarative Root-cause Analysis Engine for Time Series Data]]
- Pages created: 上記 source 8 + entity 多数 + concept 4([[Sparkジョブ異常診断]], [[グラフベースRCA]], [[宣言的RCA]], [[データベース性能トラブルシューティング]])
- Pages updated: [[根本原因分析]], [[異常検知]], [[データベース自律診断]], [[データベース O&M]], [[マルチモーダル障害診断]], [[帰属手法]], [[Fault Localization]], [[AIOps]], [[Interactive AIOps]], [[仮説駆動RCA]], [[因果発見]], [[サービス依存グラフ]] ほか
- Key insight: DB 異常診断の 8 論文を横断すると、RCA の入力モダリティが単一指標→トポロジ+指標→マルチモーダル統合と拡大する一方、産業展開では検知→RCA→解決の 3 段パイプライン(Vista)やベイズ帰属(BALANCE)による解釈性確保が鍵。データベース中心システムでは従来の性能分析技法の直接適用が困難(FSE 2023)。
## [2026-06-27] ingest-paper | DB-BERT: a Database Tuning Tool that "Reads the Manual"
- Source: `.raw/papers/arxiv-2112.10925.pdf`
- Summary: [[@2022__SIGMOD__DB-BERT - a Database Tuning Tool that Reads the Manual]]
- Pages created: [[@2022__SIGMOD__DB-BERT - a Database Tuning Tool that Reads the Manual]], [[Immanuel Trummer]], [[NLPベースDBチューニング]]
- Pages updated: [[データベースノブチューニング]], [[データベース O&M]], [[Cornell University]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]]
- Key insight: BERT によるマニュアルの読解と Double DQN による実行時フィードバック学習を組み合わせることで、人手のパラメータ選定・値域指定なしに全実験で既存手法を凌駕する最初の実証。NLP とランタイムフィードバックを分離して使う手法は「片手落ち」になることを示した。
## [2026-06-27] ingest-paper | Automatic Database Knob Tuning: A Survey & Automatic Configuration Tuning on Cloud Database: A Survey
- Source: `.raw/papers/tuning-survey.pdf`, `.raw/papers/arxiv-2404.06043.pdf`
- Summary: [[@2023__TKDE__Automatic Database Knob Tuning - A Survey]], [[@2024__arXiv__Automatic Configuration Tuning on Cloud Database - A Survey]]
- Pages created: [[@2023__TKDE__Automatic Database Knob Tuning - A Survey]], [[@2024__arXiv__Automatic Configuration Tuning on Cloud Database - A Survey]], [[Xinyang Zhao]], [[Limeng Zhang]], [[M. Ali Babar]], [[University of Adelaide]]
- Pages updated: [[Guoliang Li]], [[Xuanhe Zhou]], [[Tsinghua University]], [[データベースノブチューニング]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: 清華大学(TKDE 2023)とアデレード大学(arXiv 2024)が独立に提示したノブチューニングパイプラインは4段階に収束しつつあり、BO と RL の適用域は反復回数で棲み分けが生じる。クラウド固有の安全性・適応性制約は両サーベイの差分として浮き彫りになった。
## [2026-06-27] ingest | The Morning Paper on Operability
- Source: `.raw/articles/the-morning-paper-on-operability-2026-06-27.md`
- Summary: [[@2016__blog.acolyer__The Morning Paper on Operability]]
- Pages created: [[@2016__blog.acolyer__The Morning Paper on Operability]], [[Adrian Colyer]], [[オペラビリティ]]
- Pages updated: [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: Colyer の 400+ 論文横断レビューから、運用堅牢性が設計→可視化→デバッギング→フィードバックの 4 段階連鎖で構成されることを示す。先ほど ingest した 6 論文(Mystery Machine、Failure Sketching、Delta Debugging、HDD、DEMi、FDD)すべてがこの枠組みに位置づけられる。
## [2026-06-26] ingest-video | Introducing the Reliability Map – r9y.dev
- Source: https://www.youtube.com/watch?v=e_OD4AnxICg (USENIX SREcon22 APAC)
- Transcript: .raw/videos/e_OD4AnxICg/transcript.md(YouTube 自動生成字幕 en-orig、1090 行)
- Frames: .raw/videos/e_OD4AnxICg/frames/(12 枚、120 秒間隔)
- Summary: [[@2022__SREcon22 APAC__Introducing the Reliability Map – r9y.dev]]
- Pages created: [[@2022__SREcon22 APAC__Introducing the Reliability Map – r9y.dev]], [[Aaron Bowden]], [[Reliability Map (r9y.dev)]]
- Pages updated: [[SRE]]
- Key insight: SRE ケイパビリティのロードマップは「コンテキスト抽出→ケイパビリティ選択(採用/構築/購入)→戦術・戦略の2種インサイト」の順序で構成される。ゲームのテック・ツリーに着想を得た r9y.dev マップが SRE Book の「何を信じるか」と SRE Workbook の「どう実装するか」の間にある「次に何を取得するか」のギャップを埋める。
## [2026-06-26] ingest-slides | エンジニアのためのSRE論文への招待
- Source: .raw/slides/srenext2023-yuukit-sre-papers/srenext2023-yuukit-sre-papers.pdf
- Visual pages: .raw/slides/srenext2023-yuukit-sre-papers/pages/(35 ページ)
- Media: .raw/slides/srenext2023-yuukit-sre-papers/media/audio.m4a(YouTube 録画の音声原本。文字起こし未生成のため内容根拠には不使用)
- Summary: [[@2023__SRE NEXT 2023__エンジニアのためのSRE論文への招待]]
- Pages created: [[@2023__SRE NEXT 2023__エンジニアのためのSRE論文への招待]], [[SRE論文]]
- Pages updated: [[坪内佑樹]], [[SRE NEXT]]
- Key insight: SRE 論文を単一分野に閉じず、国際会議・検索・引用ネットワークを組み合わせて探索し、速読から精読・記録へ段階を分けることで、未普及技術論文をエンジニアの実装・適用のアイデアへ接続できる。
## [2026-06-26] ingest-slides | AIOps研究録―SREのためのシステム障害の自動原因診断
- Source: `.raw/slides/srenext2022-yuukit/srenext2022-yuukit.pdf`
- Visual pages: `.raw/slides/srenext2022-yuukit/pages/`(54 ページ)
- Media: `.raw/slides/srenext2022-yuukit/transcript.md`(YouTube 日本語自動字幕、固有名詞の精度に限界あり)
- Summary: [[@2022__SRE NEXT 2022__AIOps研究録―SREのためのシステム障害の自動原因診断]]
- Pages created: [[@2022__SRE NEXT 2022__AIOps研究録―SREのためのシステム障害の自動原因診断]], [[TSifter]]
- Pages updated: [[坪内佑樹]], [[Meltria]], [[AIOps]], [[因果推論ベースRCA]], [[時系列クラスタリング]], [[自動化の皮肉]]
- Key insight: SLO による症状アラートと原因診断を分けた上で、異常検知・時系列クラスタリングによる入力削減を因果グラフ生成の前処理として設計する必要がある。入力削減は高速化だけでなく、原因から症状への経路を残す境界設計である。
## [2026-06-26] ingest-paper | デバッギング・性能解析・フィードバック 6 論文一括 ingest
- Source: `.raw/papers/delta-debugging.pdf`, `103-kasikci.pdf`, `osdi14-paper-chow.pdf`, `hdd.pdf`, `nsdi16-paper-scott.pdf`, `2026_Unknown_Runtime_metric_meets_developer_building.pdf`
- Summary: デルタデバッギング系(ddmin/dd → HDD → DEMi)の系譜、Facebook のエンドツーエンド性能解析(Mystery Machine)、本番障害の自動診断(Failure Sketching)、開発者へのランタイムフィードバック統合(FDD)の 6 論文を一括 wiki 化。
- Pages created:
- [[@2002__IEEE TSE__Simplifying and Isolating Failure-Inducing Input]], [[@2006__ICSE__HDD - Hierarchical Delta Debugging]], [[@2014__OSDI__The Mystery Machine - End-to-end Performance Analysis of Large-scale Internet Services]], [[@2015__SOSP__Failure Sketching - A Technique for Automated Root Cause Diagnosis of In-Production Failures]], [[@2015__Onward!__Runtime Metric Meets Developer - Building Better Cloud Applications using Feedback]], [[@2016__NSDI__Minimizing Faulty Executions of Distributed Systems]]
- entities: [[Andreas Zeller]], [[Ghassan Misherghi]], [[Zhendong Su]], [[Michael Chow]], [[David Meisner]], [[Jason Flinn]], [[Thomas F. Wenisch]], [[George Candea]], [[Jürgen Cito]], [[Philipp Leitner]], [[Harald C. Gall]], [[Colin Scott]], [[Scott Shenker]], [[George Necula]], [[Gist]]
- concepts: [[デルタデバッギング]], [[階層的デルタデバッギング]], [[障害スケッチング]], [[フィードバック駆動開発]], [[分散実行最小化]]
- Key insight: ddmin (2002) → HDD (2006) → DEMi (2016) はテストケース最小化の汎用→構造化→分散化の系譜を形成。Failure Sketching は「テスト不可能な本番障害」を協調解析で診断する相補的手法。FDD は運用メトリクスの開発フィードバック統合という今日の DevOps 議論の先駆。
## [2026-06-26] ingest-paper | The First 50 Years of Software Reliability Engineering
- Source: `.raw/papers/arxiv-1902.06140.pdf`
- Summary: [[@2019__arXiv__The First 50 Years of Software Reliability Engineering - A History of SRE with First Person Accounts]]
- Pages created: [[James J. Cusick]], [[John Musa]], [[Norman F. Schneidewind]], [[Martin L. Shooman]], [[ISSRE]]
- Pages updated: [[Michael R. Lyu]], [[SREの工学化]], [[ソフトウェア信頼性工学]]
- Key insight: Hudson (1967) → NATO (1968) → Jelinski-Moranda/Shooman (1971) → Musa (1975) → 体系化 (1987-1996) → 新領域展開 (2000s-2010s) の発展段階を創設者インタビューで裏付けた 50 年通史。
## [2026-06-26] ingest-paper | Software Reliability Engineering: A Roadmap
- Source: `.raw/papers/Lyu-2007---Software-Reliability-Engineering---A-Roadmap.pdf`
- Summary: [[@2007__FOSE__Software Reliability Engineering - A Roadmap]]
- Pages created: [[ソフトウェア信頼性工学]], [[ソフトウェア信頼性成長モデル]]
- Pages updated: [[Michael R. Lyu]], [[ソフトウェア耐障害性]], [[Design for Reliability]], [[SREの工学化]]
- Key insight: 障害ライフサイクル 4 段階(予防・除去・耐性・予測)と SRE プロセス 4 構成要素を体系化し、将来方向 5 軸を提示したロードマップ。
## [2026-06-26] ingest-slides | From Sysadmins to (almost) Flying Unicorns
- Source: `.raw/slides/srecon23emea-herail/srecon23emea-herail.pdf`
- Visual pages: `.raw/slides/srecon23emea-herail/pages/`(64 ページ)
- Media: none(動画・transcript 未取得)
- Summary: [[@2023__SREcon23 EMEA__From Sysadmins to (almost) Flying Unicorns]]
- Pages created: [[Guillaume Hérail]], [[Gilberto Müller]], [[Sony Interactive Entertainment]], [[SRE組織変革]]
- Pages updated: [[SRE]]
- Key insight: TOS(割り込み吸収レイヤー)と CFT(設計段階への SRE 参加)の組み合わせが、SRE のフィードバックループ外問題とトイル問題を構造的に解消した。Reliability Meetup の 2.5 年継続(22 回・600+ 参加者)が信頼性文化浸透に寄与。
## [2026-06-26] ingest-paper | データベース/分散システム異常診断 6 論文一括
- Source: `.raw/papers/p1176-ma.pdf`
- Summary: [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]]
- Pages created: [[iSQUAD]], [[間欠的遅延クエリ]]
- Pages updated: [[Minghua Ma]], [[Dan Pei]], [[Shenglin Zhang]], [[異常検知]], [[データベース自律診断]]
- Key insight: iSQUAD は外部要因による間欠的遅延クエリを TOPIC クラスタリングとベイズ事例モデルで診断し F1 80.4% を達成。
## [2026-06-26] ingest-paper | OS Pre-trained Transformer
- Source: `.raw/papers/OSprey.pdf`
- Summary: [[@2024__arXiv__OS Pre-trained Transformer - Predicting Query Latencies across Changing System Contexts]]
- Pages created: [[Tim Kraska]], [[OSprey]], [[クエリレイテンシ予測]]
- Pages updated: [[Samuel Madden]], [[MIT CSAIL]]
- Key insight: OSprey はワークロード固有とシステム固有の効果を因子分解することで、1 システムでの訓練で複数システムへの汎化を実現する。
## [2026-06-26] ingest-paper | Multivariate Log-based Anomaly Detection for Distributed Database
- Source: `.raw/papers/arxiv-2406.07976.pdf`
- Summary: [[@2024__KDD__Multivariate Log-based Anomaly Detection for Distributed Database]]
- Pages created: [[Apache IoTDB]], [[ログベース異常検知]]
- Pages updated: [[Lingzhe Zhang]], [[Tong Jia]], [[Ying Li]], [[Peking University]], [[異常検知]]
- Key insight: 単一ノードログによる異常検知は分散データベースでは不十分であり、マルチノードログ統合で約 12% の精度向上を実証。
## [2026-06-26] ingest-paper | DBPA - A Benchmark for Transactional Database Performance Anomalies
- Source: `.raw/papers/2026_Unknown_DBPA_Benchmark_Transactional_Database_Performance.pdf`
- Summary: [[@2023__PACMMOD__DBPA - A Benchmark for Transactional Database Performance Anomalies]]
- Pages created: [[データベース性能異常ベンチマーク]]
- Pages updated: [[Bin Cui]], [[Shiyue Huang]], [[ZTE Corporation]], [[データベース自律診断]]
- Key insight: DBPA は OLTP 性能異常の決定論的再現手順を体系化し、ML 診断のデータ不足ボトルネックを直交的に解決する。
## [2026-06-26] ingest-paper | LogDB - Multivariate Log-based Failure Diagnosis for Distributed Databases
- Source: `.raw/papers/arxiv-2505.01676.pdf`
- Summary: [[@2025__arXiv__LogDB - Multivariate Log-based Failure Diagnosis for Distributed Databases]]
- Pages created: (MultiLog agent と共有 entity/concept を更新)
- Pages updated: [[Lingzhe Zhang]], [[Tong Jia]], [[Ying Li]], [[ログベース異常検知]], [[異常検知]]
- Key insight: MultiLog の拡張版 LogDB はノード単位のログ特徴抽出・圧縮とマスターノード集約で、異なるワークロード・異常タイプに対してロバストな障害診断を実現。
## [2026-06-26] ingest-paper | Towards Close-To-Zero Runtime Collection Overhead
- Source: `.raw/papers/Zhang-et-al.-2025---Towards-close-to-zero-runtime-collection-overhead...-sed-anomaly-diagnosis-on-system-faults-for-distributed-storage-system.pdf`
- Summary: [[@2025__IEEE TSC__Towards Close-To-Zero Runtime Collection Overhead - Raft-Based Anomaly Diagnosis on System Faults for Distributed Storage System]]
- Pages created: [[RBAD]], [[Raftログ診断]]
- Pages updated: [[Lingzhe Zhang]], [[Tong Jia]], [[Ying Li]], [[分散ストレージ]], [[異常検知]]
- Key insight: Raft ログはコンセンサスプロトコルの副産物として収集オーバーヘッドゼロで入手可能であり、監視データベース手法を 15.38%、ログベース手法を 53.10% 上回る異常診断精度を達成する。
## [2026-06-26] ingest-paper | Ultra Ethernet's Design Principles and Architectural Innovations
- Source: `.raw/papers/arxiv-2508.08906.pdf`
- Summary: [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]]
- Pages created: [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]], [[Ultra Ethernet]]
- Pages updated: [[RDMA]], [[RoCE設計課題]], [[Torsten Hoefler]]
- Key insight: UE 1.0 は「計算 1,000 倍・帯域 100 倍」という非対称を根拠に、パケットスプレー・選択的確認応答・ゼロ RTT PDC 確立という「計算コストのかかる」メカニズムをシリコンで合理的にした RoCEv2 の正式な次世代標準。仕様書著者自身が執筆した初の論文レベル解説。
## [2026-06-26] ingest | How Complex Systems Fail (Cook 1998)
- Source: `.raw/articles/how-complexsystems-fail-2026-06-26.md`
- URL: https://how.complexsystems.fail/
- Summary: [[@1998__CtL__How Complex Systems Fail]]
- Pages created: [[@1998__CtL__How Complex Systems Fail]], [[Richard I. Cook]], [[複雑システム障害論]], [[潜在的障害]], [[ヒンドサイトバイアス]]
- Pages updated: [[根本原因分析]], [[Metastable Failure]], [[自動化の皮肉]]
- Key insight: Cook (1998) は「根本原因帰属は技術的ではなく社会的行為」と定式化し、複雑システムが常に潜在的障害を抱えたまま劣化モードで稼働することを 18 の命題で体系化した。AIOps の RCA 研究全体への根本的な問い直し。
## [2026-06-26] ingest-slides | とあるSREの博士「過程」
- Source: `.raw/slides/srenext2025/srenext2025.pdf`
- Visual pages: `.raw/slides/srenext2025/pages/`
- Media: `.raw/slides/srenext2025/transcript.md` (YouTube 日本語自動字幕)
- Summary: [[@2025__SRE NEXT 2025__とあるSREの博士「過程」]]
- Pages created: (なし — 新規 entity/concept なし)
- Pages updated: [[坪内佑樹]], [[SRE NEXT]], [[SREの工学化]]
- Key insight: SRE NEXT 2024「工学としての SRE」→ IOTS2025「サイバネティクスの夢」→ SRE NEXT 2025「博士『過程』」の講演三部作が完結。博士課程で得た「独自の専門技術体系を自分の内に持つ感覚」と「他の学術分野との接続能力」が、SRE の工学化・システム論化の土台であることが開示された。
## [2026-06-26] ingest-slides | SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法
- Source: `.raw/slides/sonic-jp-2026-ebiken/sonic-jp-2026-ebiken.pdf`
- Visual pages: `.raw/slides/sonic-jp-2026-ebiken/pages/`
- Media: none (transcript なし)
- Summary: [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]]
- Pages created: [[海老澤健太郎]], [[Arrcus]]
- Pages updated: [[RDMA]], [[オープンネットワーキング]]
- Key insight: RoCEv2 対 UE Transport/Falcon/MRC の 4 方式 12 軸比較表(p.6)は、RoCEv2 のみがロスレス前提・Go-Back-N・OoO 非対応であり、次世代 Ethernet への移行が実装レベルで具体化していることを示す。SONiC/SAI が UE spec v1.0.2 の LLR・CBFC・LLDP を実装中であり、オープンネットワーキングスタックが Scale-Out から Scale-Up 領域にも延伸しつつある。
## [2026-06-26] enrich-source | LLM Wiki (Karpathy Gist) — full gist 再読による source/concept 強化
- Source: `https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f`
- Summary: [[@2026__GitHub Gist__LLM Wiki]]
- Pages updated: [[@2026__GitHub Gist__LLM Wiki]](IDE メタファー・ユースケース・index vs log 役割分担・ツール推奨を追加)、[[LLM Wikiパターン]](Tolkien Gateway 例・問い合わせ帰還原理を追記)
- Pages created: [[Memex]](`[[Memex]]` リンクが実体なし状態だったため新規作成、Bush-Wiener-Karpathy 系譜を整理)
- Key insight: "Obsidian is the IDE; the LLM is the programmer; the wiki is the codebase" が既存ページに未収録だった。既存 ingest(2026-06-19)は概念核は正確だが Tips・ユースケース・IDE メタファーを落としていた。
## [2026-06-26] ingest-slides | 再帰化への認知的転回 + なめらかなシステムと運用維持の終わらぬ未来
- Source: `.raw/slides/pepabo2022-the-turn-to-recursive-system/pepabo2022-the-turn-to-recursive-system.pdf`
- Source: `.raw/slides/dicomo2025-coherently-fittable-system/dicomo2025-coherently-fittable-system.pdf`
- Visual pages: `.raw/slides/pepabo2022-the-turn-to-recursive-system/pages/` (27 pages)
- Visual pages: `.raw/slides/dicomo2025-coherently-fittable-system/pages/` (69 pages)
- Media: none (transcript なし)
- Summary: [[@2022__ペパボテックカンファレンス__再帰化への認知的転回]], [[@2025__DICOMO2025__なめらかなシステムと運用維持の終わらぬ未来]]
- Pages created: [[再帰化]], [[エフェクチュエーション]], [[@2022__ペパボテックカンファレンス__再帰化への認知的転回]], [[@2025__DICOMO2025__なめらかなシステムと運用維持の終わらぬ未来]]
- Pages updated: [[なめらかなシステム]], [[基礎情報学]], [[セルフクラフト]], [[三宅悠介]]
- Key insight: なめらかなシステムの理論的発展が 2018(定義) → 2022(再帰化: 実装方向の具体化) → 2025(目的生成的ななめらかさへの転換) の 3 段階で進んでおり、DICOMO2025 では「主体から関係性へ」の視座転換と AI エージェントネットワークによる意味の翻訳・関係性の媒介が構想された。
## [2026-06-26] ingest-paper | ReCycle: Resilient Training of Large DNNs using Pipeline Adaptation
- Source: `.raw/papers/arxiv-2405.14009.pdf`
- Summary: [[@2024__SOSP__ReCycle - Resilient Training of Large DNNs using Pipeline Adaptation]]
- Pages created: [[@2024__SOSP__ReCycle - Resilient Training of Large DNNs using Pipeline Adaptation]], [[Swapnil Gandhi]], [[Christos Kozyrakis]], [[ReCycle]]
- Pages updated: [[Stanford University]], [[パイプライン並列化]], [[耐障害LLM訓練]]
- Key insight: ハイブリッド並列訓練に内在するデータ並列冗長性とパイプラインバブルを活用し、スペアサーバなしで障害復旧を実現。分割逆伝播とストラグラーオプティマイザの組み合わせで、Oobleck 対比最大 1.46×、Bamboo 対比最大 1.64× のスループット向上を達成した。
## [2026-06-26] ingest-paper | Alibaba HPN: A Data Center Network for Large Language Model Training
- Source: `.raw/papers/Qian-et-al.-2024---Alibaba-HPN---A-data-center-network-for-large-language-model-training.pdf`
- Summary: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]]
- Pages created: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]]
- Pages updated: [[Alibaba HPN]], [[Kun Qian]], [[Alibaba Cloud]], [[LLM分散学習]], [[耐障害LLM訓練]], [[Rail-Optimizedトポロジ]], [[RDMA]]
- Key insight: LLM 訓練トラフィックの周期的バースト大流量特性に対し、2 層デュアルプレーン + レール最適化 + 非スタック型デュアル ToR で ECMP ハッシュ偏極を排除し 15K GPU を単一 Pod に収容。8 ヶ月本番運用で DCN+ 比 14.9% スループット向上、ToR 単一障害点ゼロを達成した。
## [2026-06-26] ingest-paper | なめらかなシステムを目指して
- Source: `.raw/papers/dicomo2018-proceeding-antipop.pdf`
- Summary: [[@2018__DICOMO2018__なめらかなシステムを目指して]]
- Pages created: [[@2018__DICOMO2018__なめらかなシステムを目指して]], [[栗林健太郎]], [[コンテキスト・アウェアネス]], [[基礎情報学]]
- Pages updated: [[なめらかなシステム]], [[三宅悠介]], [[Ryosuke Matsumoto]], [[GMOペパボ]], [[サイバネティクス]]
- Key insight: [[なめらかなシステム]]の一次出典論文を取り込み。「利用者のコンテキストは事後的に形成される」という要求(2)を[[基礎情報学]](HACS)から導き、コンテキスト・アウェアネスと統合した 2018 年の原定義がここにある。開発運用者を「利用者」と対称的に扱う設計が SRE 文脈への接続可能性を内包している。
## [2026-06-26] ingest-paper | Exploring GPU-to-GPU Communication: Insights into Supercomputer Interconnects
- Source: `.raw/papers/sc24-gpu-gpu-interconnect.pdf`
- Summary: [[@2024__SC__Exploring GPU-to-GPU Communication - Insights into Supercomputer Interconnects]]
- Pages created: [[@2024__SC__Exploring GPU-to-GPU Communication - Insights into Supercomputer Interconnects]], [[Tiziano De Matteis]], [[Zebin Ren]], [[Animesh Trivedi]], [[Duncan Roweth]]
- Pages updated: [[Daniele De Sensi]], [[Lorenzo Pichetti]], [[Flavio Vella]], [[Torsten Hoefler]], [[集合通信]], [[HPCインターコネクトベンチマーク]]
- Key insight: 3台の欧州スーパーコンピュータで最大4,096 GPU 規模を実計測し、「デフォルト設定は全システムで最適から程遠い・ノード内集団通信では*CCL が優位だがノード間点対点では MPI が最大10倍高速・InfiniBand Dragonfly+ はネットワークノイズで allreduce を最大50%劣化させる」という3つの構造的非対称性を初めて定量化した。
## [2026-06-26] ingest-paper | Unicron: Economizing Self-Healing LLM Training at Scale
- Source: `.raw/papers/arxiv-2401.00134.pdf`
- Summary: [[@2024__arXiv__Unicron - Economizing Self-Healing LLM Training at Scale]]
- Pages created: [[@2024__arXiv__Unicron - Economizing Self-Healing LLM Training at Scale]], [[Tao He (Alibaba)]], [[Jingren Zhou]], [[Unicron]], [[弾性LLM訓練]]
- Pages updated: [[Kun Qian]], [[Alibaba Group]], [[耐障害LLM訓練]]
- Key insight: Unicron は「個別タスクのダウンタイム最小化」から「クラスタ全体の複数タスク WAF 最大化」へ目標を転換し、Megatron の訓練効率を完全継承しつつ自己修復を実現することで、障害頻度が高まるほど優位性が拡大する設計を実証した。
## [2026-06-26] ingest-paper | I've Got 99 Problems But FLOPS Ain't One
- Source: `.raw/papers/hotnets24-333.pdf`
- Summary: [[@2024__HotNets__I've Got 99 Problems But FLOPS Ain't One]]
- Pages created: [[@2024__HotNets__I've Got 99 Problems But FLOPS Ain't One]], [[AIデータセンタートポロジ]], [[Costin Raiciu]], [[University Politehnica of Bucharest]]
- Pages updated: [[Broadcom]], [[LLM分散学習]], [[データセンター輻輳制御]], [[LLMスケーリング則]]
- Key insight: スケーリング則で導出した 103.8T モデルの物量分析により、百万 GPU スケールでは FLOPs でなくネットワーク(特にスケールアップ帯域)が最大ボトルネックであり、マルチプレーン・マルチレール・マルチパストランスポートへの移行が不可避であることを定量的に示した。
## [2026-06-26] ingest-paper | Generic and ML Workloads in an HPC Datacenter
- Source: `.raw/papers/arxiv-2409.08949.pdf`
- Summary: [[@2024__ICPADS__Generic and ML Workloads in an HPC Datacenter]]
- Pages created: [[@2024__ICPADS__Generic and ML Workloads in an HPC Datacenter]], [[HPCワークロード特性化]], [[Xiaoyu Chu]], [[Alexandru Iosup]], [[SURF]], [[Ivona Brandic]]
- Pages updated: [[GPUクラスタ運用]], [[Vrije Universiteit Amsterdam]]
- Key insight: 国家規模の混在 HPC(ML+汎用)で、ML ジョブはノード数 15%・投入件数 9% に対してエネルギー 39% を消費し、クラスタ全体エネルギーの 50% が未完了ジョブに費やされるという、HPC スケールでの「失敗コストは件数でなく消費資源で見る」原則の実証。
## [2026-06-26] ingest-paper | An Empirical Study on Quality Issues of Deep Learning Platform
- Source: `.raw/papers/quality-issues-icse2023.pdf`
- Summary: [[@2023__ICSE__An Empirical Study on Quality Issues of Deep Learning Platform]]
- Pages created: [[@2023__ICSE__An Empirical Study on Quality Issues of Deep Learning Platform]], [[DLプラットフォーム品質問題]]
- Pages updated: [[Yanjie Gao]], [[Hongyu Zhang]], [[Microsoft Research]]
- Key insight: Microsoft 社内 DL プラットフォーム Platform-X の品質問題 360 件を分析した初の包括的実証研究。ユーザー側障害が 43.34% と最大で、そのうち 15.00% がバグコード起因だが、単純な Job Resubmission だけで全体の 34.72% を緩和できるという非対称が明らかになった。
## [2026-06-26] ingest-slides | 工学としてのSRE再訪
- Source: `.raw/slides/srenext2024_yuuk1/srenext2024_yuuk1.pdf`
- Visual pages: `.raw/slides/srenext2024_yuuk1/pages/`
- Media: `.raw/slides/srenext2024_yuuk1/transcript.md` (YouTube 自動字幕 ja)
- Summary: [[@2024__SRE NEXT 2024__工学としてのSRE再訪]]
- Pages created: [[SREの工学化]], [[Mark Burgess]]
- Pages updated: [[坪内佑樹]], [[さくらインターネット研究所]], [[SRE NEXT]], [[Topotal]], [[自動化の皮肉]], [[サイバネティクス]]
- Key insight: SRE の「技芸→工学」移行を 1987 年の USENIX LISA から 2024 年の SREcon 統合まで歴史的に辿り、オープンチャレンジ 6 件と学術分野接続の地図を提示。IOTS2025 の「工学→システム論」と合わせて坪内の知的系譜の 2 段階構造が確認できる。
## [2026-06-26] ingest-slides | SREはサイバネティクスの夢をみるか
- Source: `.raw/slides/iots2025_presentation/iots2025_presentation.pdf`
- Visual pages: `.raw/slides/iots2025_presentation/pages/` (137 pages)
- Media: `.raw/slides/iots2025_presentation/transcript.md`
- Summary: [[@2025__IOTS2025__SREはサイバネティクスの夢をみるか]]
- Pages created: [[@2025__IOTS2025__SREはサイバネティクスの夢をみるか]], [[坪内佑樹]], [[さくらインターネット研究所]], [[自動化の皮肉]], [[なめらかなシステム]]
- Pages updated: [[サイバネティクス]], [[セルフクラフト]], [[テレメトリ]], [[特徴量削減]], [[Fault Localization]], [[サービスレベル目標]], [[HeteroTSDB]], [[MetricSifter]], [[三宅悠介]]
- Key insight: SRE をサイバネティクス(フィードバックループ・セカンドオーダー・創発)で再解釈し、要素還元的な信頼性工学から総体的システム観への転換を示した。博士論文の 3 貢献を「計測→保存→分析」3 層で俯瞰し、自動化の皮肉・なめらかなシステム・セルフクラフトを経由して AI エージェント時代の SRE 像を展望。
## [2026-06-26] ingest-paper | Demystifying NCCL: An In-depth Analysis of GPU Communication Protocols and Algorithms
- Source: `.raw/papers/arxiv-2507.04786.pdf`
- Summary: [[@2025__IEEE__Demystifying NCCL - An In-depth Analysis of GPU Communication Protocols and Algorithms]]
- Pages created: [[@2025__IEEE__Demystifying NCCL - An In-depth Analysis of GPU Communication Protocols and Algorithms]], [[ATLAHS]], [[Siyuan Shen]], [[Zhiyi Hu]]
- Pages updated: [[NCCL]], [[Torsten Hoefler]], [[集合通信]]
- Key insight: NCCL の「ブラックボックス」内部を初めて体系的に解明——Simple/LL/LL128 のトレードオフはノード内外で非対称(LL128 はノード内 NVLink で全サイズ最安定、Simple はノード間大メッセージで最速)であり、Ring AllReduce の 2k-1 ステップ構造と Tree AllReduce の SM 非対称パイプラインが Mycroft のトレース精度と VCCL の SM-free 設計の共通的前提になっている。
## [2026-06-26] ingest-paper | An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
- Source: `.raw/papers/arxiv-2510.00991.pdf`
- Summary: [[@2026__arXiv__An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters]]
- Pages created: [[wiki/sources/@2026__arXiv__An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters]], [[Mingjun Zhang]]
- Pages updated: [[Infrawaves]], [[Menghao Zhang]], [[集合通信]], [[耐障害LLM訓練]], [[RDMAネットワーク監視]]
- Key insight: VCCL は SM-free P2P・プライマリバックアップ QP・スライディングウィンドウ RDMA モニタの三機構で、CCL 層が SM 競合・NIC 障害・ネットワーク異常をそれぞれ自律解決できることを 24K GPU 本番で実証——CCL を「ブラックボックス」から「自己最適化・自己診断するレイヤー」へ引き上げる設計思想。
## [2026-06-26] ingest-paper | Training with Confidence: Catching Silent Errors in Deep Learning Training with Automated Proactive Checks
- Source: `.raw/papers/osdi25-jiang.pdf`
- Summary: [[@2025__OSDI__Training with Confidence - Catching Silent Errors in Deep Learning Training with Automated Proactive Checks]]
- Pages created: [[Yuxuan Jiang]], [[Peng Huang]], [[TrainCheck]], [[OrderLab]], [[DLトレーニングサイレントエラー]], [[訓練不変条件]]
- Pages updated: [[University of Michigan]], [[Heisenbug]]
- Key insight: DL 訓練サイレントエラーは損失・精度では見えず、訓練不変条件(重みの整合性・API 呼び出し順序等)の自動推論・継続検証によって 1 イテレーション以内に検知できる——観察の粒度の選択が検知可能性を規定するという Heisenbug 的洞察の DL 特化実現。
## [2026-06-25] wiki-query | QoA 3 軸 / Zadka コストモデル / アンチパターン防止策
- Query 1: QoA(Quality of Alerts)の 3 軸(indicativeness / precision / handleability)の詳細解説
- Query 2: Zadka SREcon22 コストモデル(アンチクオリティ定式化・アラーム 3 分類・レイテンシ 4 区間分解)の詳細解説
- Query 3: QoA アンチパターンをどのように防ぐか(設計時 Avoidance / 運用時 Reaction / 自動検知改善の 3 層)
- Pages created:
- [[QoA-3軸-詳細解説]]
- [[Zadka-コストモデル-詳細]]
- [[QoAアンチパターン-防ぎ方]]
- Pages updated: [[index]]
## [2026-06-25] ingest-slides | Symptom-based Alerting for Machine Learning
- Source: `.raw/slides/srecon23emea-weichbrodt/srecon23emea-weichbrodt.pdf`
- Visual pages: `.raw/slides/srecon23emea-weichbrodt/pages/`
- Media: `.raw/slides/srecon23emea-weichbrodt/media/audio.m4a`、YouTube 自動字幕(英語)で補完
- Summary: [[@2023__SREcon23 EMEA__Symptom-based Alerting for Machine Learning]]
- Pages created: [[Lina Weichbrodt]], [[MLモデル監視]]
- Pages updated: [[アラート管理]], [[アクショナブルアラート]], [[アラート疲労]]
- Key insight: SRE の症状ベースアラーティングを ML に転用し、出力側から逆順に 3 段階の監視優先度を割り当てるフレームワーク。ML 監視文献の入力データドリフト偏重に対し、出力分布監視を「キャッチオール手法」として優先する実践的方針。
## [2026-06-25] wiki-query | アラーティング研究の学術/実務マップ作成
- Source: [[アラーティングの進歩-年代別]]
- Summary: [[アラーティング学術実務マップ]] を新規作成。年代別に [A]学術 / [P]実務 / [H]産業研究 の3区分で地図化。通時的な役割分担パターン(問題命名→規範確立→手法設計→実証→実用化)を表形式で整理。学術/実務の断絶4点も特定。
## [2026-06-24] ingest-paper | LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation
- Source: `.raw/papers/Ruowei__OncallX_to_ASE_25.pdf`
- Summary: [[@2025__ASE__LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation]]
- Pages created: [[@2025__ASE__LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation]], [[Ruowei Fu]], [[OncallX]], [[オンコール自動化]]
- Pages updated: [[Shenglin Zhang]], [[ByteDance]], [[Nankai University]], [[マルチエージェント協調]], [[LLMによる根本原因分析]], [[インシデント管理]]
- Key insight: OncallX は「ユーザー意図強化 → 木探索マルチエージェント QA → KG 拡張トリアージ」の 3 モジュールでオンコールライフサイクル全体を自動化し、ByteDance 本番 2 か月で対応 789 倍・トリアージ 50 倍高速化を実証した初の産業統合事例である。
## [2026-06-24] wiki-query | 現代の理想的なアラーティング — 4フェーズ圧縮モデル追記
- Target: [[現代の理想的なアラーティング]]
- Summary: 原則 5「段階的ノイズ除去」の 12 介入点(半整数層含む)を発火タイミング軸で A 保証 / B 抑制 / C 配信最適化 / D 解決支援の 4 フェーズに圧縮したモデルを追記。元の詳細表を残したまま補完する形で挿入。
## [2026-06-24] wiki-query | 現代の理想的なアラーティング-判断モデル
- Target: [[現代の理想的なアラーティング-判断モデル]]
- Summary: [[現代の理想的なアラーティング]] を判断モデル型の別ノートとして再構成。アラーティングを「人へ通知する仕組み」ではなく、顧客影響・緊急性・対応主体・自動処理可能性・欠落リスクに基づいてページ、チケット、自律処理、診断情報、削除へ振り分ける信頼性制御ループとして定義。
- Structure: 語彙分離、中心原則、7 段ライフサイクル、ページ判定表、品質モデル、組織モデル、成熟度モデル、監査チェックリスト、未解決の論点。
- Pages referenced: [[現代の理想的なアラーティング]]、[[アラーティングの進歩-年代別]]、[[アラート管理]]、[[アクショナブルアラート]]、[[Quality of Alerts]]、[[サービスレベル目標]]、[[Prometheusルールリント]]、[[Adaptive Paging]]、[[認知的徒弟制]]、[[agentic SRE]]
## [2026-06-24] ingest-paper | ClickHouse - Lightning Fast Analytics for Everyone
- Source: `.raw/papers/p3731-schulze.pdf`
- Summary: [[@2024__PVLDB__ClickHouse - Lightning Fast Analytics for Everyone]]
- Pages created: [[@2024__PVLDB__ClickHouse - Lightning Fast Analytics for Everyone]], [[ClickHouse]], [[ClickHouse Inc|ClickHouse Inc.]], [[Robert Schulze]], [[Alexey Milovidov]], [[列指向OLAPデータベース]]
- Pages updated: [[LSMツリー]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: ClickHouse の MergeTree* は LSM ツリーのフラット等価パート変形であり、ペイロード別マージ戦略(置換/集計/TTL)と WAL レス直書きで OLAP 高スループットを実現する。
## [2026-06-24] wiki-query | 現代の理想的なアラーティング
- Target: [[現代の理想的なアラーティング]]
- Summary: [[アラーティングの進歩-年代別]] の 45 ソースと wiki/concepts 14 ページの横断的知見を統合し、「現代の理想的なアラーティング」を定義。
- Structure: 統合定義(1 文) + 7 設計原則(症状起点・アクショナブル・発火前保証・適切な受け手・多層介入・測定可能品質・Agentic 対応) + 4 面の組織的条件(インセンティブ・社会的合意・能力育成・文化) + 未到達点 5 項 + 判定基準 10 項の表
- Pages referenced: [[アラーティングの進歩-年代別]]、[[アラート管理]]、[[アクショナブルアラート]]、[[Quality of Alerts]]、[[アラート疲労]]、[[アラートポリューション]]、[[アラート抑制]]、[[サービスレベル目標]]、[[Prometheusルールリント]]、[[Adaptive Paging]]、[[認知的徒弟制]]、[[Warningアラート]]、[[アラート相関]]、[[agentic SRE]] ほか
## [2026-06-24] wiki-query | アラーティングの進歩-年代別 大幅更新
- Target: [[アラーティングの進歩-年代別]]
- Summary: 2026-06-23 の SREcon スライド・動画・記事の大量 ingest を踏まえ、年代別レビューを全面更新。
- Added sources: 15 件(SREcon16〜SREcon23、SRE NEXT 2023、Cloudflare Blog 2022)
- Key changes:
- §4 に実践者エコシステム(Treat, Rabenstein, Chen/Baidu, Jalleda/Zynga, Cloudflare, Alibaba)を新設
- §5.5 を新設(Adaptive Paging 2019、LinkedIn MAD スパイク検知 2021)
- §6 を大幅拡充(pint, Zadka コストモデル, alert pollution, 認知的徒弟制, prepalert, Runbook ガバナンス)
- §10 を「4 つの大潮流」→「5 つの大潮流」へ拡張(第 5: 人間的・組織的介入の独立軸化)
- §10 第 1 潮流の介入点を「8 層」→「10 層超」へ更新
- §11 に未解決の問い (f) を追加(技術的介入 × 人間的介入の統合設計)
- frontmatter に related 4 件・sources 15 件を追加
## [2026-06-24] ingest-slides | SREcon スライド 7 件一括取り込み
7 件の SREcon 発表スライドを一括取り込み。異常検知・変化点検知・時系列マイニング・アラート管理に関する 2015–2025 年の産業事例。
- Source: `.raw/slides/sre19apac_slides_chen_golden_signals/` (34 pages)
- Summary: [[@2019__SREcon19 Asia__Anomaly Detection on Golden Signals]]
- Pages created: source + entity (Yu Chen 更新)
- Key insight: Baidu のゴールデンシグナル上の異常検知を STL 分解と曜日別正規化で構築。
- Source: `.raw/slides/srecon15europe_slides_clegg/` (21 pages)
- Summary: [[@2015__SREcon15 Europe__Signatures, Patterns, and Trends - Timeseries Data Mining at Etsy]]
- Pages created: source + [[Andrew Clegg]], [[Etsy]] + [[時系列類似度検索]]
- Key insight: SAX/DTW を Kale/Skyline に統合した 2015 年の時系列マイニング実践。
- Source: `.raw/slides/srecon24emea_slides-shubin/` (87 pages)
- Summary: [[@2024__SREcon24 EMEA__Anomaly Detection in Time Series from Scratch Using Statistical Analysis]]
- Pages created: source + [[Ivan Shubin]], [[Booking.com]]
- Pages updated: [[異常検知]]
- Key insight: MAD が過去インシデントによる標準偏差膨張を 78%→31% に抑える定量結果。Granomaly サービス。
- Source: `.raw/slides/sre25amer_slides-neidel/` (32 pages)
- Summary: [[@2025__SREcon25 Americas__Using Statistical Techniques to Automatically Detect Game-Breaking Issues]]
- Pages created: source + [[Ian Neidel]], [[Open Connect]]
- Pages updated: [[変化点検知]]
- Key insight: Netflix ゲーム QoE の変化点検知。
- Source: `.raw/slides/sre25amer_slides-cirella/` (27 pages)
- Summary: [[@2025__SREcon25 Americas__Stopping Performance Regression via Changepoint Detection]]
- Pages created: source + [[Joseph Cirella]], [[Shanthini Velan]]
- Pages updated: [[変化点検知]]
- Key insight: Bloomberg PELT アルゴリズムで CI/CD パイプラインの性能レグレッション自動検知。
- Source: `.raw/slides/srecon17asia_slides_wang_0/` (18 pages)
- Summary: [[@2017__SREcon17 Asia__Smart Monitoring System for Anomaly Detection on Business Trends in Alibaba]]
- Pages created: source + entity (Zhaogang Wang, Alibaba Group 更新)
- Pages updated: [[異常検知]]
- Key insight: N-σ 適応閾値と STL 分解によるビジネストレンド異常検知。
- Source: `.raw/slides/srecon15_slides_qu/` (35 pages)
- Summary: [[@2015__SREcon15__Smart Monitor System For Automatic Anomaly Detection at Baidu]]
- Pages created: source + [[Xianping Qu]]
- Key insight: BNS/BMS/DMP/Transfer 4 モジュールの監視プラットフォーム。
## [2026-06-23] ingest-slides | Automatic Metric Screening for Service Diagnosis
- Source: `.raw/slides/srecon18americas_slides_chen/srecon18americas_slides_chen.pdf`
- Visual pages: `.raw/slides/srecon18americas_slides_chen/pages/` (15 pages)
- Media: `.raw/slides/srecon18americas_slides_chen/media/audio.m4a` (transcript 未生成)
- Summary: [[@2018__SREcon18 Americas__Automatic Metric Screening for Service Diagnosis]]
- Pages created: [[@2018__SREcon18 Americas__Automatic Metric Screening for Service Diagnosis]]
- Pages updated: [[Yu Chen (Baidu)]], [[Baidu]], [[Fault Localization]], [[RCA入力選別]], [[特徴量削減]]
- Key insight: Baidu の自動メトリクススクリーニングは、ゴールデンメトリクス設定に依存せず、KDE 異常度測定・DBSCAN クラスタリング・ダイジェストランキングで「次に見るべきインスタンス集合 + 異常メトリクス集合」を推薦する。FluxRank 論文化前の、LLM 以前の統計的 RCA 入力選別として位置づけられる。
## [2026-06-23] ingest-slides | A Practical Guide to Monitoring and Alerting with Time Series at Scale
- Source: `.raw/slides/srecon17_americas_slides_wilkinson/srecon17_americas_slides_wilkinson.pdf`
- Visual pages: `.raw/slides/srecon17_americas_slides_wilkinson/pages/` (82 pages)
- Media: none (公式 MP3 あり、transcript 未生成)
- Summary: [[@2017__SREcon17 Americas__A Practical Guide to Monitoring and Alerting with Time Series at Scale]]
- Pages created: [[@2017__SREcon17 Americas__A Practical Guide to Monitoring and Alerting with Time Series at Scale]]
- Pages updated: [[Jamie Wilkinson]], [[Prometheus]], [[アラート管理]], [[アクショナブルアラート]], [[サービスレベル目標]], [[ヒストグラムメトリクス]]
- Key insight: 監視の保守コストはサービス規模に対して劣線形に保つ必要がある。静的しきい値は容量差・ワークロード差で壊れやすく、時間・分布・SLO 違反に変換したアラート条件と、Prometheus のラベル付き時系列/記録ルール/トポロジ集約が保守コスト削減の実装部品になる。
## [2026-06-23] ingest-slides | Alerting for Distributed Systems - A Tale of Symptoms and Causes, Signals and Noise
- Source: `.raw/slides/srecon16europe_slides_rabenstein/srecon16europe_slides_rabenstein.pdf`
- Visual pages: `.raw/slides/srecon16europe_slides_rabenstein/pages/` (30 pages)
- Media: none
- Summary: [[@2016__SREcon16 Europe__Alerting for Distributed Systems - A Tale of Symptoms and Causes, Signals and Noise]]
- Pages created: [[Björn Rabenstein]], [[SoundCloud]]
- Pages updated: [[Prometheus]], [[アラート管理]], [[アクショナブルアラート]], [[Prometheusルールリント]], [[サービスレベル目標]]
- Key insight: 分散システムでは原因と症状が緩く結合するため、ページは症状や差し迫ったサービス問題に絞り、原因はチケット・情報通知・調査用グラニュラリティとして扱う。Prometheus 型の時系列アラーティングは静的閾値を越え、将来の枯渇見込みにページできる一方、ページ用ルールは単純・堅牢に保つ必要がある。
## [2026-06-23] ingest-slides | Less Alarming Alerts!
- Source: `.raw/slides/srecon16_slides_treat/srecon16_slides_treat.pdf`
- Visual pages: `.raw/slides/srecon16_slides_treat/pages/` (55 pages)
- Media: `.raw/slides/srecon16_slides_treat/media/treat.mp3` (transcript 未生成)
- Summary: [[@2016__SREcon16__Less Alarming Alerts]]
- Pages created: [[Robert Treat]], [[OmniTI]]
- Pages updated: [[アラート管理]], [[アクショナブルアラート]], [[アラート疲労]]
- Key insight: 2016 年時点で Treat は、アラートを「人を起こすページ」として限定し、ビジネス影響・修復手順・通知先・予防可能性を説明できないものを悪いアラートとして削除・通知化・修正する発火前ガバナンスを提示していた。
## [2026-06-23] ingest-slides | Draining the Flood — A Combat against Alert Fatigue
- Source: `.raw/slides/srecon17asia-chen-draining-the-flood/srecon17asia-chen-draining-the-flood.pdf`
- Visual pages: `.raw/slides/srecon17asia-chen-draining-the-flood/pages/` (20 pages)
- Media: none
- Summary: [[@2017__SREcon17 Asia__Draining the Flood - A Combat against Alert Fatigue]]
- Pages created: [[Argus (Baidu)]]
- Pages updated: [[Yu Chen (Baidu)]], [[アラート管理]], [[アラート疲労]], [[アラート集約]]
- Key insight: 2017 年時点で Baidu が 4 施策(グルーピング・キャリブレーション・エスカレーション・自動修復)を同時投入し 85% 削減を達成。アテンション率による重要度校正は AlertRank を 3 年先行する着想。
## [2026-06-23] ingest-slides | Anomaly Detection in Infrequently Occurred Patterns
- Source: `.raw/slides/srecon17amer-wang-anomaly-infrequent/srecon17amer-wang-anomaly-infrequent.pdf`
- Visual pages: `.raw/slides/srecon17amer-wang-anomaly-infrequent/pages/` (15 pages)
- Media: `.raw/slides/srecon17amer-wang-anomaly-infrequent/transcript.md` (Whisper 文字起こし)
- Summary: [[@2017__SREcon17Americas__Anomaly Detection in Infrequently Occurred Patterns]]
- Pages created: [[Dong Wang]], [[Baidu]]
- Pages updated: [[異常検知]]
- Key insight: 低頻度かつ非固定日付の祝日トラフィックに対し、CDF k-means クラスタリングで類似日を発見しリアルタイム比率補正を重ねる 2 段階手法が、Holt-Winters 等の従来手法を超える産業事例。
## [2026-06-23] ingest-slides | Want to Solve Over-Monitoring and Alert Fatigue? Create the Right Incentives!
- Source: `.raw/slides/srecon17emea-jalleda-over-monitoring/srecon17emea-jalleda-over-monitoring.pdf`
- Visual pages: `.raw/slides/srecon17emea-jalleda-over-monitoring/pages/` (61 pages)
- Media: none (yt-dlp 失敗、transcript なし)
- Summary: [[@2017__SREcon17 Europe__Want to Solve Over-Monitoring and Alert Fatigue - Create the Right Incentives]]
- Pages created: [[Kishore Jalleda]], [[Zynga]], [[アラート疲労]]
- Pages updated: [[アラート管理]], [[アラートポリューション]], [[アクショナブルアラート]]
- Key insight: アラート疲労の根本原因はインセンティブの不整合であり、アラートバジェットで SRE サポートを条件付き提供する Clean Room イニシアティブが偽アラーム 90% 削減を達成した。
## [2026-06-23] ingest-video | Monitoring Cloudflare's Planet-Scale Edge Network
- Source: https://www.youtube.com/watch?v=lHtY7TUsLzk (SREcon17 Europe, 2017-09-01)
- Transcript: `.raw/videos/srecon17europe-bostock-monitoring-cloudflare/transcript.md` (YouTube auto-generated)
- Frames: `.raw/videos/srecon17europe-bostock-monitoring-cloudflare/frames/` (12 frames)
- Summary: [[@2017__SREcon17 Europe__Monitoring Cloudflare's Planet-Scale Edge Network]]
- Pages created: [[@2017__SREcon17 Europe__Monitoring Cloudflare's Planet-Scale Edge Network]], [[Matt Bostock]]
- Pages updated: [[Cloudflare]], [[Prometheus]], [[アラート管理]]
- Key insight: Cloudflare は 116 PoP それぞれに独立した Prometheus を配置し、コアデータセンターへフェデレーションで集約するアーキテクチャで、監視対象と同じ障害ドメインに監視を置く信頼性設計を実現。「原因でなく症状にアラートする」「マシンでなくサービスにアラートする」を組織原則として推進し、5 年後の pint 開発(ルール健全性保証)へ繋がる上流シフトの起点。
## [2026-06-23] ingest-video | Introduction to Alibaba Monitoring System
- Source: https://www.youtube.com/watch?v=yXaV6Eedrzo (SREcon18 Asia, 2018-06-06)
- Transcript: `.raw/videos/youtube-yXaV6Eedrzo/transcript.md` (YouTube auto-generated en-orig)
- Frames: `.raw/videos/youtube-yXaV6Eedrzo/frames/` (12 frames)
- Summary: [[@2018__SREcon18 Asia__Introduction to Alibaba Monitoring System]]
- Pages created: [[@2018__SREcon18 Asia__Introduction to Alibaba Monitoring System]], [[Ren Xinchi]], [[Hammurabi]], [[ビジネスモニタリング]]
- Pages updated: [[Alibaba Group]], [[アラート管理]]
- Key insight: Alibaba は 4 層モニタリング構造のうちビジネス層を最重要と位置づけ、CMDB Hammurabi で KPI と P1〜P4 優先度を一元管理。5 ゴールデンエレメント(総数・成功数・成功率・応答時間・失敗数)で顧客影響を定量的に表現し、変更情報の重ね合わせ(障害の 70% が変更起因)で迅速な復旧を実現する。
## [2026-06-23] ingest | Monitoring our Monitoring (Cloudflare Blog)
- Source: `.raw/articles/monitoring-our-monitoring-2026-06-23.md`
- Summary: [[@2022__Cloudflare-Blog__Monitoring-our-Monitoring]]
- Pages created: [[wiki/sources/@2022__Cloudflare-Blog__Monitoring-our-Monitoring]], [[Cloudflare]], [[pint]], [[Prometheusルールリント]]
- Pages updated: [[Prometheus]], [[アラート管理]]
- Key insight: Prometheus の空クエリ問題による「監視の静かな失敗」を pint の CI + デーモン watchdog パターンで防ぐ「第零の介入点」を体系化。
## [2026-06-23] ingest-slides | Spike Detection in Alert Correlation at LinkedIn
- Source: `.raw/slides/srecon21_slides_singh/srecon21_slides_singh.pdf`
- Visual pages: `.raw/slides/srecon21_slides_singh/pages/` (30 pages)
- Media: `.raw/slides/srecon21_slides_singh/transcript.md` (Whisper 音声文字起こし)
- Summary: [[@2021__SREcon21__Spike Detection in Alert Correlation at LinkedIn]]
- Pages created: [[Nishant Singh]], [[アラート相関]]
- Pages updated: [[LinkedIn]], [[異常検知]]
- Key insight: 修正 Z スコア(MAD ベース)という ML 不要の単純統計手法で、アラート相関システムの推奨結果から一時的スパイクを分離し、偽陽性率 1% 未満・トイル 30–40% 削減を実現。
## [2026-06-23] ingest-slides | Dark Sky Camping: Reducing Alert Pollution with Modern Observability Practices
- Source: `.raw/slides/sre22amer-smith-dark-sky-camping/sre22amer-smith-dark-sky-camping.pdf`
- Visual pages: `.raw/slides/sre22amer-smith-dark-sky-camping/pages/` (36 pages)
- Media: `.raw/slides/sre22amer-smith-dark-sky-camping/transcript.md` (YouTube 英語自動字幕)
- Summary: [[@2022__SREcon22 Americas__Dark Sky Camping - Reducing Alert Pollution with Modern Observability Practices]]
- Pages created: [[Kristin Smith]], [[Campspot]], [[アラートポリューション]]
- Pages updated: [[アラート管理]], [[サービスレベル目標]], [[オブザーバビリティ]]
- Key insight: アラート増設は信号対雑音比を悪化させ、「モニタリング=安全」の心理的結合がその根本原因。OpenTelemetry 自動計装は 4 時間で完了し、移行コストの認知バイアスが最大の障壁。
## [2026-06-23] ingest-paper | Sakana Fugu Technical Report
- Source: `.raw/papers/Fugu_technical_report.pdf`
- Summary: [[@2026__Sakana AI__Sakana Fugu Technical Report]]
- Pages created: [[@2026__Sakana AI__Sakana Fugu Technical Report]], [[集合知]]
- Pages updated: [[マルチエージェント協調]], [[Sakana AI]], [[Yujin Tang]], [[Stefan Nielsen]], [[Edoardo Cetin]]
- Key insight: Fugu/Fugu-Ultra は「オーケストレーションをスケーリング軸とする」ことを本番公開レベルで実証した最初のシステム。ワーカープールに含まれないモデルクラス(Mythos Preview・Fable 5)を超えたことが、スケーリング軸の独立性を示す最強の証拠。
## [2026-06-23] ingest-slides | Cognitive Apprenticeship in Practice with Alert Triage Hour of Power
- Source: `.raw/slides/srecon23-americas-cruz-cognitive-apprenticeship/srecon23-americas-cruz-cognitive-apprenticeship.pdf`
- Visual pages: `.raw/slides/srecon23-americas-cruz-cognitive-apprenticeship/pages/`
- Media: `.raw/slides/srecon23-americas-cruz-cognitive-apprenticeship/transcript.md` (YouTube 英語自動字幕由来)
- Summary: [[@2023__SREcon23 Americas__Cognitive Apprenticeship in Practice with Alert Triage Hour of Power]]
- Pages created: [[@2023__SREcon23 Americas__Cognitive Apprenticeship in Practice with Alert Triage Hour of Power]], [[Paige Cruz]], [[Chronosphere]], [[認知的徒弟制]]
- Pages updated: [[アラート管理]], [[アクショナブルアラート]]
- Key insight: アラートトリアージは生得的スキルではなく、認知的徒弟制の 6 段階を通じて構造化ミーティングで体系的に伝達できる。KEEP/TUNE/DELETE の集団判定は技術的介入と直交する「人間側のアラート衛生」介入点として既存の AIM 分類に追加すべき要素。
## [2026-06-23] ingest-slides | Are We All on the Same Page? Let's Fix That
- Source: `.raw/slides/srecon19emea-mineiro-adaptive-paging/srecon19emea-mineiro-adaptive-paging.pdf`
- Visual pages: `.raw/slides/srecon19emea-mineiro-adaptive-paging/pages/`
- Media: `.raw/slides/srecon19emea-mineiro-adaptive-paging/transcript.md` (YouTube 英語自動字幕由来)
- Summary: [[@2019__SREcon19 EMEA__Are We All on the Same Page - Lets Fix That]]
- Pages created: [[@2019__SREcon19 EMEA__Are We All on the Same Page - Lets Fix That]], [[Luis Mineiro]], [[Zalando SE]], [[Adaptive Paging]]
- Pages updated: [[アラート管理]], [[アクショナブルアラート]], [[分散トレーシング]]
- Key insight: 症状ベースアラーティングの「通知先固定」問題を分散トレーシングの因果関係で解消する Adaptive Paging は、アラート管理の既存介入点(件数・重要度・内容操作)に「通知先ルーティング」という直交する介入点を追加する。FSF(IEEE CLOUD 2022)が同型のスパンツリー動的因果推論を学術的に形式化する 3 年前の実運用実装。
## [2026-06-23] ingest | AIのモデル崩壊と多様性 (joisino)
- Source: `.raw/articles/joisino-collapse-2026-06-22.md`
- URL: https://joisino.hatenablog.com/entry/collapse
- Summary: [[joisino-モデル崩壊と多様性-2026]]
- Pages created: [[joisino-モデル崩壊と多様性-2026]], [[モデル崩壊]]
- Pages updated: [[佐藤竜馬]], [[wiki/index.md]]
- Key insight: AI 生成データの反復訓練は分布収縮を引き起こし、人間の思考パターンにまで波及する二段階カスケード。π²/6 ≈ 1.645 倍の損失増加上界(線形モデル)が唯一の数理的緩和保証だが、スケーリングのみでの解決は不可能。
## [2026-06-23] ingest-slides | Modeling Alert Quality
- Source: `.raw/slides/srecon22-zadka-modeling-alert-quality/srecon22-zadka-modeling-alert-quality.pdf`
- Visual pages: `.raw/slides/srecon22-zadka-modeling-alert-quality/pages/`
- Media: `.raw/slides/srecon22-zadka-modeling-alert-quality/transcript.md` (YouTube 自動字幕由来)
- Summary: [[@2022__SREcon22 Americas__Modeling Alert Quality]]
- Pages created: [[@2022__SREcon22 Americas__Modeling Alert Quality]], [[Moshe Zadka]]
- Pages updated: [[Quality of Alerts]], [[アラート管理]]
- Key insight: アラート品質をコスト(アンチクオリティ = アラーティングコスト + 非アラーティングコスト)として定量化する実践的フレームワーク。Yang+ DSN2022 の学術的 QoA 3 軸と同年に出された相補的な枠組み。
## [2026-06-23] ingest-paper | mABC: Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecture
- Source: `.raw/papers/2024.findings-emnlp.232.pdf`
- Summary: [[@2024__EMNLP Findings__mABC - Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecture]]
- Pages created: [[@2024__EMNLP Findings__mABC - Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecture]], [[Wei Zhang (Beihang)]], [[Hongcheng Guo]], [[Cloudwise]]
- Pages updated: [[Beihang University]], [[LLMによる根本原因分析]], [[マルチエージェント協調]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], [[wiki/index.md]]
- Key insight: マルチエージェントの役割分担設計がモデル規模のスケーリングを超える性能向上をもたらし、blockchain 投票は精度より解決策品質(人間評価)に寄与する
## [2026-06-23] ingest-slides | Warningアラートを放置しない!アラート駆動でログやメトリックを自動収集する仕組みによる恩恵
- Source: `.raw/slides/warning-alert-driven-log-metric-collection/warning-alert-driven-log-metric-collection.pdf`
- Visual pages: `.raw/slides/warning-alert-driven-log-metric-collection/pages/`
- Media: `.raw/slides/warning-alert-driven-log-metric-collection/transcript.md`(YouTube 日本語自動字幕) / `.raw/slides/warning-alert-driven-log-metric-collection/media/audio.m4a`
- Summary: [[@2023__SRE NEXT__Warningアラートを放置しない!アラート駆動でログやメトリックを自動収集する仕組みによる恩恵]]
- Pages created: [[@2023__SRE NEXT__Warningアラートを放置しない!アラート駆動でログやメトリックを自動収集する仕組みによる恩恵]], [[池田将士]], [[面白法人カヤック]], [[prepalert]], [[Warningアラート]]
- Pages updated: [[Mackerel]], [[SRE NEXT]], [[アラート管理]], [[エラーバジェット]], [[サービスレベル目標]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/index]], [[wiki/hot]]
- Key insight: Warning アラートは Critical ほど即時対応ではなくても、SLO・エラーバジェット消費や長尾の信頼性劣化を示す。発火時点のログ・メトリクスを prepalert で自動添付すると、振り返り時の証拠欠落を減らし、低重要度アラートを放置せず調査可能な状態へ移せる。
## [2026-06-23] ingest-slides | Runbookに何を書き、どのようにアラートを振り分けるか?
- Source: `.raw/slides/runbook-alert-triage/runbook-alert-triage.pdf`
- Visual pages: `.raw/slides/runbook-alert-triage/pages/`
- Media: `.raw/slides/runbook-alert-triage/transcript.md`(YouTube 日本語自動字幕) / `.raw/slides/runbook-alert-triage/media/audio.m4a`
- Summary: [[@2023__SpeakerDeck__Runbookに何を書き、どのようにアラートを振り分けるか]]
- Pages created: [[@2023__SpeakerDeck__Runbookに何を書き、どのようにアラートを振り分けるか]], [[Sohei Iwahori]], [[GREE, Inc]]
- Pages updated: [[SRE NEXT]], [[アクショナブルアラート]], [[アラート管理]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/index]], [[wiki/hot]]
- Key insight: Runbook は単なる手順書ではなく、アラートの Why・背景・判断材料を保存して発火後の actionability を支える。さらにアラート追加時点で通知チャンネル・対応タイミング・スコープ・対応 Runbook を明示させることで、発火前にアクションを合意する上流統制になる。
## [2026-06-23] ingest-paper | JustDiag!: A Diagnostic Justification Engine for Accountable Root Cause Analysis
- Source: `.raw/papers/arxiv-2606.19407.pdf`
- Summary: [[@2026__arXiv__JustDiag! A Diagnostic Justification Engine for Accountable Root Cause Analysis]]
- Pages created: [[診断的正当化]], [[Tingzhu Bi]], [[Xinrui Jiang]], [[Xun Zhang]], [[Pengcheng Su]], [[Congjie He]], [[Jinglin Li]], [[Meng Ma]], [[Beijing University of Posts and Telecommunications]]
- Pages updated: [[Ping Wang]], [[LLMによる根本原因分析]], [[仮説駆動RCA]], [[RCA評価設計]]
- Key insight: LLM ベース RCA システムの Process Score(説明責任品質)が Outcome Score(最終回答品質)から独立して評価可能であり、既存手法(RCAgent: 9.5、Flow-of-Action: 9.3)は説明責任品質において著しく低い。「校正された非閉包(stalled)」が誤った確実性の回避として設計上の利点となる。
## [2026-06-23] ingest-paper | Rethinking the Role of Efficient Attention in Hybrid Architectures
- Source: `.raw/papers/arxiv-2606.15378.pdf`(arXiv:2606.15378v1 [cs.CL] 2026-06-13)
- Summary: [[@2026__arXiv__Rethinking the Role of Efficient Attention in Hybrid Architectures]]
- Pages created: [[@2026__arXiv__Rethinking the Role of Efficient Attention in Hybrid Architectures]], [[ハイブリッドアテンションアーキテクチャ]], [[Zhiyuan Liu]], [[Xu Han]], [[Chaojun Xiao]], [[OpenBMB]]
- Pages updated: [[NoPE]], [[線形注意]], [[Tsinghua University]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/index]]
- Key insight: 効率的注意はフルアテンションの最適化事前として機能し、大きなウィンドウ SWA はフルアテンション検索ヘッドの形成を遅らせる(Large-Window Laziness)。フルアテンション層への NoPE 適用がこの問題への有効な対処法。
## [2026-06-23] ingest-paper | Learning to Orchestrate Agents in Natural Language with the Conductor
- Source: `.raw/papers/arxiv-2512.04388.pdf`(ICLR 2026; arXiv:2512.04388)
- Summary: [[@2026__ICLR__Learning to Orchestrate Agents in Natural Language with the Conductor]]
- Pages created: [[Sakana AI]], [[Stefan Nielsen]], [[Edoardo Cetin]], [[Yujin Tang]], [[マルチエージェント協調]]
- Pages updated: [[テスト時計算スケーリング]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]]
- Key insight: 自然言語を媒介にしたエンドツーエンドRLで、7B ConductorがGPT-5を超えるSOTAを達成。「エージェント協調呼び出し回数を増やす」という新しいテスト時スケーリング軸(再帰的トポロジー)が提案された。
## [2026-06-23] ingest | Agentic RL Frameworks and Best Practices — Cameron R. Wolfe
- Source: `.raw/articles/agentic-rl-2026-06-23.md`
- Summary: [[Agentic-RL-Cameron-Wolfe-2026]]
- Pages created: [[Agentic-RL-Cameron-Wolfe-2026]]、[[Cameron-R-Wolfe|Cameron R. Wolfe]]
- Pages updated: [[エージェント型強化学習]]、[[index]]、[[hot]]、[[log]]
- Key insight: ToRL(RL-Zero でツール利用が創発し呼び出し率 40→80%)と AgentGym-RL(ScalingInter-RL の 3 フェーズカリキュラムで高次行動が創発)という 2 フレームワークが新規。5 フレームワーク横断で「ステップレベル軌跡・非同期デカップリング・タスク別正規化」の 3 原則が独立に再発見されている。
## [2026-06-23] ingest | Europe 2031 — ARQ Foundation 政策シナリオ
- Source: `.raw/articles/europe2031-ai-2026-06-23.md`
- Summary: [[europe2031-ai|Europe 2031]]
- Pages created: [[europe2031-ai]]、[[ARQ Foundation]]、[[ASML]]、[[ヨーロッパのAI主権]]、[[コンピュート格差]]
- Pages updated: [[wiki/sources/_index]]、[[wiki/entities/_index]]、[[wiki/concepts/_index]]、[[index]]、[[hot]]、[[log]]
- Key insight: デジタル主権規制がフロンティアAIアクセスを遮断することで主権を守るはずが逆に脆弱性を高めるという逆説を、2025〜2031年のシナリオで体系化している。
## [2026-06-23] ingest | Loop Engineering — sairahul1 X スレッド
- Source: `.raw/articles/sairahul1-loop-engineering-2026-06-23.md`
- Summary: [[sairahul1-Loop-Engineering-2026]]
- Pages created: [[sairahul1-Loop-Engineering-2026]], [[ループエンジニアリング]], [[Boris Cherny]], [[Peter Steinberger]], [[Sai Rahul]]
- Pages updated: [[wiki/index]], [[wiki/log]], [[wiki/hot]]
- Key insight: [[Peter Steinberger]](OpenAI) と [[Boris Cherny]](Anthropic Claude Code ヘッド)が同時に「プロンプトを送るのではなくループを設計せよ」と発言。コスト問題(1 回のフリートループで 500K〜2M トークン)は DeepSeek V4 などで解消されつつある。
## [2026-06-23] ingest-paper | LLM 基盤論文 4 本一括(InstructGPT / Chinchilla / Sparsely-Gated MoE / ReAct)
- Source: `.raw/papers/arxiv-2203.02155.pdf`, `.raw/papers/arxiv-2203.15556.pdf`, `.raw/papers/arxiv-1701.06538.pdf`, `.raw/papers/arxiv-2210.03629.pdf`
- Summary: [[@2022__NeurIPS__Training language models to follow instructions with human feedback]], [[@2022__arXiv__Training Compute-Optimal Large Language Models]], [[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]], [[@2023__ICLR__ReAct Synergizing Reasoning and Acting in Language Models]]
- Pages created: [[@2022__NeurIPS__Training language models to follow instructions with human feedback]], [[@2022__arXiv__Training Compute-Optimal Large Language Models]], [[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]], [[@2023__ICLR__ReAct Synergizing Reasoning and Acting in Language Models]], [[Long Ouyang]], [[Jordan Hoffmann]], [[DeepMind]], [[Azalia Mirhoseini]], [[Geoffrey Hinton]], [[Jeffrey Dean]], [[Quoc V. Le]], [[Shunyu Yao]], [[Karthik Narasimhan]], [[Princeton University]], [[Jared Kaplan]], [[人間フィードバックからの強化学習]], [[指示チューニング]], [[アライメント]], [[計算最適訓練]], [[条件付き計算]], [[負荷分散]], [[ReAct]]
- Pages updated: [[Mixture-of-Experts]], [[Chain-of-Thought Prompting]], [[スケーリング則]], [[Google Brain]], [[OpenAI]], [[Noam Shazeer]]
- Key insight: 2017–2023 年の LLM 基盤 4 論文を横断すると、(1) RLHF と CoT は独立に発展したが組み合わせが事実上の標準化、(2) Chinchilla のスケーリング則は Kaplan et al. 2020 を覆し「データもモデルと等比率で増やすべき」を示した、(3) Shazeer 2017 の MoE 設計原則(top-k ゲーティング・補助損失・帯域ボトルネック)は 2024–2026 年の DeepSeek-V3 等に直接継承、(4) ReAct は CoT の推論力にツール利用の接地力を加え、エージェント型 AI の原型を確立。
## [2026-06-22] ingest | The Big LLM Architecture Comparison (Sebastian Raschka)
- Source: `.raw/articles/the-big-llm-architecture-comparison-2026-06-22.md`(https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison)
- Summary: [[The-Big-LLM-Architecture-Comparison|The Big LLM Architecture Comparison]]
- Pages created: [[The-Big-LLM-Architecture-Comparison|The Big LLM Architecture Comparison]] / [[Multi-Head Latent Attention]] / [[Grouped-Query Attention]] / [[スライディングウィンドウアテンション]] / [[NoPE]] / [[QK-Norm]] / [[Gated DeltaNet]] / [[Sebastian Raschka]] / [[Gemma 3]] / [[Gemma 4]] / [[Qwen3]] / [[Qwen3-Next]] / [[GPT-OSS]] / [[SmolLM3]] / [[Mistral 3]] / [[Kimi Linear]] / [[Arcee AI Trinity Large]] / [[Xiaomi MiMo-V2-Flash]] / [[OLMo 2]]
- Pages updated: [[Mixture-of-Experts]](共有エキスパート論争・SWA+MoE 普及・粗粒度 vs 細粒度設計分岐)/ [[マルチトークン予測]](Qwen3-Next・Nemotron 3 Super の推論時 MTP 活用進化)/ [[線形注意]](2025 年後半の再台頭・MiniMax-M2 の撤退・Kimi Linear の反論)
- Key insight: MLA vs GQA の性能比較でMLA優位(DeepSeek-V2アブレーション)が示されているにもかかわらずGQAが多数派のままである理由は実装複雑度にある。また共有エキスパートの採否・線形アテンションの有効性がともに現時点で設計判断が分岐している重要な未解決問題。
## [2026-06-21] ingest | Datadog Bits AI SRE GA Announcement (Kai Xin Tai, 2025-06-10)
- Source: `.raw/articles/bits-ai-sre-2026-06-21.md`(https://www.datadoghq.com/blog/bits-ai-sre/)
- Summary: [[@2025__Datadog__Introducing Bits AI SRE]]
- Pages created: [[@2025__Datadog__Introducing Bits AI SRE]]
- Pages updated: [[Bits AI SRE]](GA 後拡張・Bits AI Dev Agent プレビュー)、[[agentic SRE]](調査→修正拡張・プロアクティブトリガー・調査間記憶の知見)、[[Datadog]](新ソース追加)
- Key insight: Bits AI Dev Agent(コード修正 PR 生成)は agentic SRE が「読み取り中心 → 書き込み権限付き」へ拡張する最初の公開産業実装。Watchdog ストーリー・合成テストへのトリガー拡大でプロアクティブ調査方向が示される。
## [2026-06-21] wiki-refactor | concepts health check and duplicate consolidation
- Summary: `wiki/concepts` 全体を健全性チェックし、動的インストルメンテーションを [[動的計装]] に統合、サービス依存性発見・ネットワークサービス依存性発見を [[ネットワーク依存性発見]] に統合。旧タイトルは aliases に保存し、concept/index 側の旧リンクを正準名へ更新。
- Pages updated: [[動的計装]], [[ネットワーク依存性発見]], [[Fault Localization]], [[concepts/_index]], [[index]]
- Pages deleted: `wiki/concepts/動的インストルメンテーション.md`, `wiki/concepts/サービス依存性発見.md`, `wiki/concepts/ネットワークサービス依存性発見.md`
- Compression: [[Fault Localization]] を 170 行から 100 行へ圧縮し、親概念として [[根本原因分析]]・[[RCA評価設計]]・[[ログ解析]]・[[LLM学習モニタリング]]・[[RDMAネットワーク監視]] へ詳細論点を分岐。
- Verification: concept files 349→346、100 行超 44→41、必須見出し欠落 36→35、`sources` 空 39→38、`lint-stub` 0、対象旧リンク 0、対象 3 concept の未解決 wikilink 0。残債: 既存 index 差分 55/26 と既存必須見出し欠落 35 は別作業。
## [2026-06-21] ingest-paper | LLM-Enhanced Failure Localization in Microservices (LocaleXpert)
- Source: `.raw/papers/LLM-Enhanced_Failure_Localization_in_Microservices_Integrating_Multi-Modal_Data_and_Expert_Interpretation.pdf`
- Summary: [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]]
- Pages created: [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]], [[Zhouruixing Zhu]]
- Pages updated: [[根本原因分析]], [[マルチモーダル障害診断]], [[LLMによる根本原因分析]]
- Key insight: LLM 単体より統計的障害箇所特定モジュールとの併用が精度・解釈可能性の両面で優位。
## [2026-06-21] ingest-paper | Time Series as Language (UniTok)
- Source: `.raw/papers/arxiv-2606.09861.pdf`
- Summary: [[@2026__arXiv__Time Series as Language - A Universal Tokenizer for General-Purpose Time Series Foundation Models]]
- Pages created: [[@2026__arXiv__Time Series as Language - A Universal Tokenizer for General-Purpose Time Series Foundation Models]], [[Yunhao Zhang]], [[Ruiying Qi]], [[Jiale Zheng]], [[Jianfeng Zhang (Huawei)]], [[Lujia Pan]], [[Junchi Yan]], [[Huawei Noah's Ark Lab]]
- Pages updated: [[時系列基盤モデル]]
- Key insight: VQ-VAE ベースの離散トークン化により、予測・生成・分類を統一的に NTP で解く汎用 TSFM を実現。
## [2026-06-21] ingest-paper | MRCA: Metric-level Root Cause Analysis
- Source: `.raw/papers/2026_Unknown_MRCA_Metric_level_Root_Cause.pdf`
- Summary: [[@2024__ASE__MRCA - Metric-level Root Cause Analysis for Microservices via Multi-Modal Data]]
- Pages created: [[@2024__ASE__MRCA - Metric-level Root Cause Analysis for Microservices via Multi-Modal Data]], [[Yidan Wang]]
- Pages updated: [[根本原因分析]], [[マルチモーダル障害診断]]
- Key insight: サービスレベルでなくメトリクスレベルまで根本原因を掘り下げることで運用者の行動可能性を高める。
## [2026-06-21] ingest-paper | Holistic Root Cause Analysis for Cloud-Native Systems
- Source: `.raw/papers/Holistic_Root_Cause_Analysis_for_Failures_in_Cloud-Native_Systems_Through_Observability_Data.pdf`
- Summary: [[@2024__TSC__Holistic Root Cause Analysis for Failures in Cloud-Native Systems Through Observability Data]]
- Pages created: [[@2024__TSC__Holistic Root Cause Analysis for Failures in Cloud-Native Systems Through Observability Data]], [[Yongqi Han]], [[Qingfeng Du]], [[Tongji University]], [[Di-Matrix]]
- Pages updated: [[根本原因分析]], [[マルチモーダル障害診断]]
- Key insight: メトリクス・ログ・トレースの 3 モダリティを因果グラフ上で統合し、単一モダリティ手法の限界を克服。
## [2026-06-21] ingest-paper | Medicine: Multimodal Adaptive Optimization for Failure Diagnosis
- Source: `.raw/papers/ASE_24_Medicine.pdf`
- Summary: [[@2024__ASE__Giving Every Modality a Voice in Microservice Failure Diagnosis via Multimodal Adaptive Optimization]]
- Pages created: [[@2024__ASE__Giving Every Modality a Voice in Microservice Failure Diagnosis via Multimodal Adaptive Optimization]], [[Lei Tao]], [[Zhengdan Li]]
- Pages updated: [[根本原因分析]], [[マルチモーダル障害診断]], [[Minghua Ma]], [[Shenglin Zhang]], [[Dan Pei]]
- Key insight: 各モダリティに適応的重み付けを行い、情報量の少ないモダリティが支配的モダリティに埋もれる問題を解決。
## [2026-06-21] ingest-paper | ChangeLLM: Multimodal Change Assessment
- Source: `.raw/papers/ChangeLLM.pdf`
- Summary: [[@2025__FSE__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]]
- Pages created: [[@2025__FSE__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]], [[Yuchi Ma]], [[Qiuai Fu]]
- Pages updated: [[変更起因インシデント]], [[LLMによる根本原因分析]], [[Chetan Bansal]], [[Pinjia He]]
- Key insight: RAG で過去の変更事例を検索し LLM のコールドスタート問題を緩和する変更影響評価パイプライン。
## [2026-06-21] ingest-paper | Interpretable Failure Localization (DeepHunt)
- Source: `.raw/papers/2026_Unknown_Interpretable_Failure_Localization_Microservice_Systems.pdf`
- Summary: [[@2025__TOSEM__Interpretable Failure Localization for Microservice Systems Based on Graph Autoencoder]]
- Pages created: [[@2025__TOSEM__Interpretable Failure Localization for Microservice Systems Based on Graph Autoencoder]]
- Pages updated: [[根本原因分析]], [[Nankai University]]
- Key insight: グラフオートエンコーダの再構成誤差から異常スコアを導出し、注意機構による解釈可能な帰属を実現。
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-17–2026-06-18)
- Location: wiki/folds/fold-k4-from-2026-06-17-to-2026-06-18-n16.md
- Range: 2026-06-17 to 2026-06-18
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-16–2026-06-17)
- Location: wiki/folds/fold-k4-from-2026-06-16-to-2026-06-17-n16.md
- Range: 2026-06-16 to 2026-06-17
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-16)
- Location: wiki/folds/fold-k4-from-2026-06-16-to-2026-06-16-n16.md
- Range: 2026-06-16 to 2026-06-16
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-15–2026-06-16)
- Location: wiki/folds/fold-k4-from-2026-06-15-to-2026-06-16-n16.md
- Range: 2026-06-15 to 2026-06-16
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-14–2026-06-15)
- Location: wiki/folds/fold-k4-from-2026-06-14-to-2026-06-15-n16.md
- Range: 2026-06-14 to 2026-06-15
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-14 b2)
- Location: wiki/folds/fold-k4-from-2026-06-14-to-2026-06-14-n16-b2.md
- Range: 2026-06-14 to 2026-06-14
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-14)
- Location: wiki/folds/fold-k4-from-2026-06-14-to-2026-06-14-n16.md
- Range: 2026-06-14 to 2026-06-14
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-08–2026-06-14)
- Location: wiki/folds/fold-k4-from-2026-06-08-to-2026-06-14-n16.md
- Range: 2026-06-08 to 2026-06-14
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-06–2026-06-08)
- Location: wiki/folds/fold-k4-from-2026-06-06-to-2026-06-08-n16.md
- Range: 2026-06-06 to 2026-06-08
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-06)
- Location: wiki/folds/fold-k4-from-2026-06-06-to-2026-06-06-n16.md
- Range: 2026-06-06 to 2026-06-06
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-05–2026-06-06)
- Location: wiki/folds/fold-k4-from-2026-06-05-to-2026-06-06-n16.md
- Range: 2026-06-05 to 2026-06-06
- Children: 16 log entries
## [2026-06-21] fold | batch-exponent-k4 rollup of 16 entries (2026-06-05 b2)
- Location: wiki/folds/fold-k4-from-2026-06-05-to-2026-06-05-n16-b2.md
- Range: 2026-06-05 to 2026-06-05
- Children: 16 log entries
## [2026-06-20] ingest-paper | TraceRank, LogCluster, LogKG, FSF, Nezha, Eadro (6 papers batch)
- Source: `.raw/papers/Yu-et-al.-2021---TraceRank-*.pdf`, `.raw/papers/Lin-et-al.-2016---Log-clustering-*.pdf`, `.raw/papers/LogKG.pdf`, `.raw/papers/CLOUD22.pdf`, `.raw/papers/Nezha-*.pdf`, `.raw/papers/arxiv-2302.05092.pdf`
- Summary: [[@2021__JSEP__TraceRank - Abnormal service localization with dis-aggregated end-to-end tracing data in cloud native systems]], [[@2016__ICSE-C__Log Clustering Based Problem Identification for Online Service Systems]], [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]], [[@2022__IEEE CLOUD__Localizing and Explaining Faults in Microservices Using Distributed Tracing]], [[@2023__ESEC-FSE__Nezha - Interpretable Fine-Grained Root Causes Analysis for Microservices on Multi-modal Observability Data]], [[@2023__arXiv__Eadro - An End-to-End Troubleshooting Framework for Microservices on Multi-source Data]]
- Pages created: 6 source pages, 12 entity pages, 2 concept pages ([[ログクラスタリング]], [[知識グラフ]])
- Pages updated: [[根本原因分析]], [[Fault Localization]], [[分散トレーシング]], [[ログ解析]], [[マルチモーダル障害診断]], [[異常検知]], [[The Chinese University of Hong Kong]], [[Saurabh Jha]]
- Key insight: サービスレベル箇所特定(TraceRank)→ コード領域レベル根本原因特定(Nezha)→ 検知-箇所特定統合(Eadro)の解像度進化軸が 2016–2023 の 6 論文で明瞭に浮かぶ。ログ系は「圧縮してから知識照合」(LogCluster)→ 知識グラフ推論(LogKG)への構造化が進む。
## [2026-06-20] ingest-paper | Energy statistics: A class of statistics based on distances
- Source: `.raw/papers/Szkely-and-Rizzo-2013---Energy-statistics---A-class-of-statistics-based-on-distances.pdf`
- Summary: [[@2013__JSPI__Energy statistics - A class of statistics based on distances]]
- Pages created: [[@2013__JSPI__Energy statistics - A class of statistics based on distances]], [[エネルギー統計]], [[距離相関]], [[Gábor J. Székely]], [[Maria L. Rizzo]]
- Pages updated: [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: エネルギー距離は特性関数の重み付き L2 距離と同値であり、回転不変+スケール同変の公理から一意に定まる。距離共分散(dCov)のゼロ当量が独立性の必要十分条件となり、ブラウン共分散と任意次元で一致する。
## [2026-06-20] fold | batch-exponent-k4 rollup of 16 entries (2026-06-05)
- Location: wiki/folds/fold-k4-from-2026-06-05-to-2026-06-05-n16.md
- Range: 2026-06-05 to 2026-06-05
- Children: 16 log entries
## [2026-06-20] ingest-paper | Odin: Microsoft's Scalable Fault-Tolerant CDN Measurement System
- Source: `.raw/papers/nsdi18-calder.pdf`
- Summary: [[@2018__NSDI__Odin - Microsoft's Scalable Fault-Tolerant CDN Measurement System]]
- Pages created: [[@2018__NSDI__Odin - Microsoft's Scalable Fault-Tolerant CDN Measurement System]], [[Matt Calder]], [[Ethan Katz-Bassett]], [[Ganesh Ananthanarayanan]], [[Ratul Mahajan]], [[Columbia University]], [[Intentionet]], [[CDN計測システム]], [[エニキャストルーティング]]
- Pages updated: [[Microsoft]], [[Jitendra Padhye]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: ファーストパーティCDNは自社アプリ埋め込みでサードパーティ計測基盤を大幅に超えるユーザーカバレッジ(98% AS・85% /24)を達成できる。エニキャストは20%のリクエストを最適より25ms以上悪いFEへ送り、Odinの計測でリアルタイム検知・ユニキャストパッチで補正するというハイブリッドCDN制御が実運用で有効。
## [2026-06-20] fold | batch-exponent-k4 rollup of 16 entries (2026-06-04–2026-06-05)
- Location: wiki/folds/fold-k4-from-2026-06-04-to-2026-06-05-n16.md
- Range: 2026-06-04 to 2026-06-05
- Children: 16 log entries
## [2026-06-20] ingest-paper | Practitioners' Expectations on Automated Fault Localization
- Source: `.raw/papers/issta16.pdf` (MD5: d322f7635d8a61a0a7dafe2db9bc3a18)
- Summary: [[@2016__ISSTA__Practitioners' Expectations on Automated Fault Localization]]
- Pages created: [[@2016__ISSTA__Practitioners' Expectations on Automated Fault Localization]], [[Xin Xia]], [[Pavneet Singh Kochhar]], [[Shanping Li]], [[Singapore Management University]]
- Pages updated: [[David Lo]], [[Fault Localization]]
- Key insight: 2016 年の実務者 386 名調査で FL 採用の「壁」を定量化——Top-5・成功率 75%・100kLOC・1 分以内・判断根拠という 5 条件を同時に満たした論文は 2011–2015 年の 15 本中皆無。この「研究-実務ギャップの定量化」が SE FL における RCA 評価設計の先行事例となる。
## [2026-06-20] ingest-paper | 分散トレーシング基礎論文 5 本一括
- Sources: Pinpoint (DSN 2002), Magpie (HotOS IX 2003), lprof (OSDI 2014), Pivot Tracing (SOSP 2015), Canopy (SOSP 2017)
- Pages created: [[@2002__DSN__Pinpoint - Problem Determination in Large, Dynamic Internet Services]], [[@2003__HotOS__Magpie - Online Modelling and Performance-aware Systems]], [[@2014__OSDI__lprof - A Non-intrusive Request Flow Profiler for Distributed Systems]], [[@2015__SOSP__Pivot Tracing - Dynamic Causal Monitoring for Distributed Systems]], [[@2017__SOSP__Canopy - An End-to-End Performance Tracing And Analysis System]], [[Pinpoint]], [[Magpie]], [[lprof]], [[Pivot Tracing]], [[Canopy]], [[Mike Y. Chen]], [[Emre Kıcıman]], [[Armando Fox]], [[Eric Brewer]], [[Paul Barham]], [[Rebecca Isaacs]], [[Richard Mortier]], [[Xu Zhao]], [[Ding Yuan]], [[Michael Stumm]], [[Jonathan Mace]], [[Ryan Roelke]], [[Rodrigo Fonseca]], [[Jonathan Kaldor]], [[Scuba]], [[動的計装]], [[リクエストモデリング]], [[非侵入プロファイリング]]
- Pages updated: [[分散トレーシング]], [[根本原因分析]], [[Stanford University]], [[Microsoft Research]], [[University of Toronto]], [[Brown University]], [[Facebook]], [[Meta]]
- Key insight: 2002–2017 の分散トレーシング進化系譜を横断的に集約。統計的相関(Pinpoint)→ イベントベースリクエスト抽出(Magpie)→ 非侵入ログ再構築(lprof)→ 動的因果計装(Pivot Tracing)→ 超大規模本番運用(Canopy)へと、計装の侵入度と分析の因果性が段階的に深化。
## [2026-06-20] fold | batch-exponent-k4 rollup of 16 entries (2026-06-03–2026-06-04)
- Location: wiki/folds/fold-k4-from-2026-06-03-to-2026-06-04-n16.md
- Range: 2026-06-03 to 2026-06-04
- Children: 16 log entries
## [2026-06-20] fold | batch-exponent-k4 rollup of 16 entries (2026-06-02–2026-06-03)
- Location: wiki/folds/fold-k4-from-2026-06-02-to-2026-06-03-n16.md
- Range: 2026-06-02 to 2026-06-03
- Children: 16 log entries
## [2026-06-20] ingest-paper | BARO - Robust Root Cause Analysis for Microservices via Multivariate Bayesian Online Change Point Detection
- Source: `.raw/papers/arxiv-2405.09330.pdf` (MD5: 61a2035a2d1d87009e0dd860b1f8e232)
- Summary: [[@2024__FSE__BARO - Robust Root Cause Analysis for Microservices via Multivariate Bayesian Online Change Point Detection]]
- Pages created: [[@2024__FSE__BARO - Robust Root Cause Analysis for Microservices via Multivariate Bayesian Online Change Point Detection]]
- Pages updated: [[Luan Pham]], [[Huong Ha]], [[Hongyu Zhang]], [[変化点検知]], [[根本原因分析]], [[因果推論ベースRCA]]
- Key insight: 因果グラフ不要の BARO がすべての因果グラフ手法を 3 ベンチマークで上回る理由は、異常検知時刻のずれへの非感度設計(中央値/IQR)にある——辺方向推定ボトルネックと並ぶ新たな設計要件を明示した。
## [2026-06-20] ingest-paper | Localizing Failure Root Causes in a Microservice through Causality Inference
- Source: `.raw/papers/paper-IWQOS2020-MicroCause.pdf`
- Summary: [[@2020__IWQoS__Localizing Failure Root Causes in a Microservice through Causality Inference]]
- Pages created: [[Yuan Meng]]、[[Ruru Zhang]]、[[Zhilong Hu]]、[[Yiyin Zhang]]、[[Chenyang Jia]]、[[Zhaogang Wang]]、[[@2020__IWQoS__Localizing Failure Root Causes in a Microservice through Causality Inference]]
- Pages updated: [[因果推論ベースRCA]]、[[Dan Pei]]、[[Shenglin Zhang]]、[[Yongqian Sun]]
- Key insight: PCTS(PCMCI ベース)が PC の孤立サブグラフ問題を解決し、TCORW の偏相関設計が相関ベースランダムウォークのコンファウンダー誤判定を解消する——ただし大規模ベンチ(Pham+ ASE 2024)では 2 時間超過の評価もあり小規模評価の楽観性に注意
## [2026-06-20] fold | batch-exponent-k4 rollup of 16 entries (2026-06-18–2026-06-19)
- Location: wiki/folds/fold-k4-from-2026-06-18-to-2026-06-19-n16.md
- Range: 2026-06-18 to 2026-06-19
- Children: 16 log entries
## [2026-06-20] fold | batch-exponent-k4 rollup of 16 entries
- Location: wiki/folds/fold-k4-from-2026-06-19-to-2026-06-20-n16.md
- Range: 2026-06-19 to 2026-06-20
- Children: 16 log entries
## [2026-06-20] ingest-paper | マイクロサービス・DB RCA 基礎論文 10 本一括
- Source: `.raw/papers/arxiv-2306.11417.pdf`, `.raw/papers/2013SIGMETRICS13_Root20Cause20Detection20in20a20Service-Oriented20Architecture.pdf`, `.raw/papers/2018-CloudRanger.pdf`, `.raw/papers/liuping-camera-ready.pdf`, `.raw/papers/2019WWW_CFB5-diagnosis.pdf`, `.raw/papers/FluxInfer.pdf`, `.raw/papers/2020WWW_AutoMap.pdf`, `.raw/papers/Wu-et-al.-2021---MicroDiag---Fine-grained-Performance-Diagnosis-for-Microservice-Systems.pdf`, `.raw/papers/Hu-et-al.-2022---TS-InvarNet---Anomaly-Detection-and-Localization-based-on-Tempo-spatial-KPI-Invariants-in-Distributed-Services.pdf`, `.raw/papers/ZengTLSG14.pdf`
- Summary: MonitorRank(2013)→ CloudRanger(2018)→ FluxRank/AutoMAP/ε-Diagnosis(2019-2020)→ TS-InvarNet/MicroDiag(2021-2022)→ PyRCA(2023) のマイクロサービス・DB RCA 系譜を一次ソースとして wiki 化
- Pages created: [[@2013__SIGMETRICS__Root Cause Detection in a Service-Oriented Architecture]], [[@2014__CNSM__Mining Temporal Lag from Fluctuating Events for Correlation and Root Cause Analysis]], [[@2018__CCGrid__CloudRanger - Root Cause Identification for Cloud Native Systems]], [[@2019__ISSRE__FluxRank - A Widely-Deployable Framework to Automatically Localizing Root Cause Machines for Software Service Failure Mitigation]], [[@2019__WWW__ε-Diagnosis - Unsupervised and Real-time Diagnosis of Small-window Long-tail Latency in Large-scale Microservice Platforms]], [[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]], [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]], [[@2021__CloudIntelligence__MicroDiag - Fine-grained Performance Diagnosis for Microservice Systems]], [[@2022__ICWS__TS-InvarNet - Anomaly Detection and Localization based on Tempo-spatial KPI Invariants in Distributed Services]], [[@2023__arXiv__PyRCA - A Library for Metric-based Root Cause Analysis]], + entity 30+ pages
- Pages updated: [[Dan Pei]], [[Pengfei Chen]], [[Shenglin Zhang]], [[Guangba Yu]], [[Sun Yat-sen University]], [[Stanford University]], [[Peking University]], [[Minghua Ma]]
- Key insight: MonitorRank(2013)が提案した「コールグラフ上のパーソナライズドランダムウォーク」は CloudRanger・AutoMAP・MicroRCA 等に再利用され pre-LLM era RCA の標準パイプラインとなった。FluxInfer は有向性推定を捨てて無向グラフ + PageRank に転換し PC 系 8 手法を上回る。PyRCA がこれら手法群を統合ライブラリ化。
## [2026-06-20] ingest-paper | A Tutorial on Kernel Density Estimation and Recent Advances
- Source: `.raw/papers/arxiv-1704.03924.pdf`
- Summary: [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances]]
- Pages created: [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances]], [[Yen-Chi Chen]], [[カーネル密度推定]]
- Pages updated: [[University of Washington]], [[密度ベースクラスタリング]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: KDE の帯域幅選択は推定精度を支配する唯一の重要パラメータであり、信頼帯構成におけるバイアス処理(アンダースムージング/バイアス補正/無視)の3戦略が理論的に整理された。密度の幾何学的・位相的特徴推定への展開が密度ベースクラスタリングの理論的基盤を補完する。
## [2026-06-20] ingest-paper | DirectLiNGAM: A Direct Method for Learning a Linear Non-Gaussian Structural Equation Model
- Source: `.raw/papers/shimizu11a.pdf`
- Summary: [[@2011__JMLR__DirectLiNGAM - A Direct Method for Learning a Linear Non-Gaussian Structural Equation Model]]
- Pages created: [[@2011__JMLR__DirectLiNGAM - A Direct Method for Learning a Linear Non-Gaussian Structural Equation Model]], [[Shohei Shimizu]], [[Aapo Hyvärinen]], [[Kenneth Bollen]], [[Osaka University]], [[University of Helsinki]]
- Pages updated: [[因果発見]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: ICA-LiNGAM の反復探索依存(初期値感度・収束非保証)を外生変数の逐次同定で解消し、固定ステップ数の収束保証を実現。ただし社会学データでの潜在交絡因子による誤推定は、因果発見手法のモデル仮定違反の実践的影響を具体的に示す。
## [2026-06-20] ingest-paper | A Density-Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise
- Source: `.raw/papers/KDD96-037.pdf`
- Summary: [[@1996__KDD__A Density-Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise]]
- Pages created: [[@1996__KDD__A Density-Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise]], [[Martin Ester]], [[Hans-Peter Kriegel]], [[Jörg Sander]]
- Pages updated: [[密度ベースクラスタリング]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 密度に基づくクラスタの形式的定義(核点・密度到達可能性・密度接続)により、事前のクラスタ数指定なしに任意形状のクラスタを発見可能にした。
## [2026-06-20] ingest-paper | Density-Based Clustering Based on Hierarchical Density Estimates
- Source: `.raw/papers/Campello-et-al.-2013---Density-Based-Clustering-Based-on-Hierarchical-Density-Estimates.pdf`
- Summary: [[@2013__PAKDD__Density-Based Clustering Based on Hierarchical Density Estimates]]
- Pages created: [[@2013__PAKDD__Density-Based Clustering Based on Hierarchical Density Estimates]], [[Ricardo J.G.B. Campello]], [[Davoud Moulavi]], [[クラスタ安定性]]
- Pages updated: [[密度ベースクラスタリング]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: DBSCAN のグローバル密度閾値制約を階層化と安定性尺度で解決し、異なる密度のクラスタを最適に抽出する問題を定式化して大域最適解を与えた。
## [2026-06-20] ingest-paper | k-Shape: Efficient and Accurate Clustering of Time Series
- Source: `.raw/papers/18_kShape_RH_Paparrizos.pdf`
- Summary: [[@2016__SIGMOD Record__k-Shape - Efficient and Accurate Clustering of Time Series]]
- Pages created: [[@2016__SIGMOD Record__k-Shape - Efficient and Accurate Clustering of Time Series]], [[Luis Gravano]]
- Pages updated: [[John Paparrizos]], [[時系列クラスタリング]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 正規化相互相関に基づく SBD は cDTW と同等精度で 1 桁以上高速であり、クラスタリング手法の選択は距離尺度の選択と同程度に重要である。
## [2026-06-19] ingest-paper | Selective review of offline change point detection methods
- Source: `.raw/papers/arxiv-1801.00718.pdf`
- Summary: [[@2020__Signal Processing__Selective review of offline change point detection methods]]
- Pages created: [[@2020__Signal Processing__Selective review of offline change point detection methods]], [[Charles Truong]], [[Laurent Oudre]], [[Nicolas Vayatis]], [[ruptures]]
- Pages updated: [[変化点検知]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[index]], [[hot]], [[log]]
- Key insight: オフライン変化点検知をコスト関数 13 種・探索手法 5 種・制約の 3 軸で統一分類するサーベイ。AIOps 実運用は $c_{L_2}$ + Pelt に収束しているが、カーネル法・順位統計など多様なコスト関数の AIOps での比較は未踏。
## [2026-06-19] ingest-paper | Time-Series Clustering: A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods
- Source: `.raw/papers/p4380-paparrizos.pdf`
- Summary: [[@2025__PVLDB__Time-Series Clustering - A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods]]
- Pages created: [[@2025__PVLDB__Time-Series Clustering - A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods]], [[John Paparrizos]], [[UCR Time Series Archive]], [[時系列クラスタリング]]
- Pages updated: [[The Ohio State University]], [[時系列基盤モデル]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 84手法・128データセットの包括的評価により、10年前の k-Shape を統計的に有意に上回る時系列クラスタリング手法は存在しないことが実証された。深層学習・基盤モデル(CHRONOS・OFA・MOMENT)を含む全手法が k-Shape と同等以下であり、先行ベンチマークの結論はバグのある実装・不公平な設定に起因する「進歩の幻想」であった。
## [2026-06-19] ingest | The Software Development Lifecycle Is Dead — Boris Tane
- Source: `.raw/articles/the-software-development-lifecycle-is-dead-2026-06-19.md`
- Summary: [[@2026__Boris Tane Blog__The Software Development Lifecycle Is Dead]]
- Pages created: [[@2026__Boris Tane Blog__The Software Development Lifecycle Is Dead]], [[Boris Tane]], [[コンテキストエンジニアリング]], [[AIネイティブ開発]]
- Pages updated: [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: AI エージェントは SDLC を加速させたのではなく解体した。モニタリング(オブザーバビリティ)が唯一の生存フェーズとなり、コンテキストエンジニアリングが新たな差別化要因になる。
## [2026-06-19] ingest-paper | D'ya like DAGs? A Survey on Structure Learning and Causal Discovery
- Source: `.raw/papers/arxiv-2103.02582.pdf`
- Summary: [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery]]
- Pages created: [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery]], [[Matthew J. Vowels]], [[Necati Cihan Camgoz]], [[Richard Bowden]]
- Pages updated: [[University of Surrey]], [[因果発見]], [[因果推論ベースRCA]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[index]], [[hot]]
- Key insight: 連続最適化パラダイム(NOTEARS 以降)の体系化により、RCA で使われる DAG-GNN/NOTEARS 系が <100 変数でしか評価されていないことが明確化。Glymour 2019 との対比で因果発見の2つのスケーラビリティ瓶首(超指数探索空間 vs. O(d³) 行列演算)が浮上。
## [2026-06-19] ingest-paper | Review of Causal Discovery Methods Based on Graphical Models
- Source: `.raw/papers/Glymour-et-al-2019-Review-of-Causal-Discovery-Methods.pdf`
- Summary: [[@2019__Frontiers in Genetics__Review of Causal Discovery Methods Based on Graphical Models]]
- Pages created: [[@2019__Frontiers in Genetics__Review of Causal Discovery Methods Based on Graphical Models]], [[Clark Glymour]], [[Kun Zhang]], [[Peter Spirtes]], [[因果発見]]
- Pages updated: [[Carnegie Mellon University]], [[因果推論ベースRCA]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]]
- Key insight: 因果発見の3系統(制約ベース・スコアベース・FCM ベース)は「スケーラビリティ vs 識別力」のトレードオフで位置づけられる。RCA で使われる PC・LiNGAM・Granger の理論的仮定と限界、特に前処理が非ガウス性を破壊するリスクを体系的に理解する基盤を提供する。
## [2026-06-19] ingest-paper | Signal propagation in complex networks
- Source: `.raw/papers/Signal-propagation-in-complex-networks.pdf`
- Summary: [[@2023__Physics Reports__Signal propagation in complex networks]]
- Pages created: [[@2023__Physics Reports__Signal propagation in complex networks]], [[Peng Ji]], [[Jürgen Kurths]], [[Matjaž Perc]], [[University of Maribor]], [[複雑ネットワーク]], [[信号伝播]]
- Pages updated: [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]]
- Key insight: 信号伝播のジオメトリはトポロジーと非線形相互作用の両方によって決まる。時変ネットワークの静的近似は真の伝播パターンを正確に反映できない。
## [2026-06-19] ingest-paper | Anomaly Detection: A Survey
- Source: `.raw/papers/Chandola-et-al.-2009---Anomaly-detection---A-survey.pdf`
- Summary: [[@2009__CSUR__Anomaly Detection - A Survey]]
- Pages created: [[@2009__CSUR__Anomaly Detection - A Survey]], [[Varun Chandola]], [[Arindam Banerjee]], [[Vipin Kumar]], [[University of Minnesota]]
- Pages updated: [[異常検知]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: Chandola 2009 は、点/文脈/集合異常と 6 技法群を「仮定」で比較する基礎 taxonomy を提供する。現代 AIOps の practical anomaly や文脈依存の偽陽性問題は、この文脈異常の古典的定義を運用ドメインへ拡張したものとして読める。
## 2026-06-19 ingest | System@Scale: AI Observability
- Source: `.raw/articles/systemscale-ai-observability-2026-06-19.md`
- Summary: [[@2023__SystemAtScale__AI Observability]]
- Pages created: [[@2023__SystemAtScale__AI Observability]] / [[Valentin Andrei]] / [[Dynolog]] / [[LibAsicMon]] / [[Kineto]]
- Pages updated: [[GPU観測性]] / [[Meta]]
- Key insight: Meta の 4 層 AI 観測性スタック(Dynolog→Kineto/Gpusnoop→分析プラットフォーム→フリートダッシュボード)は、研究コミュニティが「単一プロファイラの低オーバーヘッド化」を問うのに対し「複数ツールを組織的にスタックする」視点を提供する。FLOPs/sec と rDevice hour/Byte の二指標でフリート全体を評価する点も独自。
## [2026-06-19] enrich | Karpathy「LLM Wiki」で稲見3部作考察を更新
- Source: [[@2026__GitHub Gist__LLM Wiki]] (Andrej Karpathy, 2026-04-04)
- Pages created: [[@2026__GitHub Gist__LLM Wiki]], [[Andrej Karpathy]], [[Vannevar Bush]], [[LLM Wikiパターン]]
- Pages updated: [[Human-out-of-the-loop]], [[サイバネティクス]], [[個人的知識蓄積の意味-稲見3部作から]]
- Key insight: 稲見が「書くことによる調律」に意味を見出した同じ問いを、Karpathyは「bookkeeping は LLM が引き受けるべきボトルネック」と正反対の前提で答えた。「調律の媒体は書くことか、選ぶことか」という問いが新たに浮上した。Bush(1945)–Wiener(1948)–Karpathy(2026)の系譜も確認された。
## [2026-06-19] wiki-query | 個人的知識蓄積の意味——稲見3部作からの考察
- Query: 「LLM Wiki のように個人で世界や AI が発見した知識を蓄積し、人間が理解していくことに今後意味はあるのか?」
- Sources consulted: [[@2026__note.com__科学の終焉と、新しい科学の始まり]] / [[@2026__note.com__Out of the Blue]] / [[@2026__note.com__ループのボトルネックは、人間だ]] + 関連概念6ページ
- Filed as: [[個人的知識蓄積の意味-稲見3部作から]]
## [2026-06-19] ingest-slides | AI/ML基盤における800GbEスイッチ導入とその挑戦
- Source: `.raw/slides/janog56-800gbe-cycloud/janog56-800gbe-cycloud.pdf`
- Visual pages: `.raw/slides/janog56-800gbe-cycloud/pages/`(47 ページ)
- Media: none(transcript なし)
- Summary: [[@2025__JANOG56__AI ML基盤における800GbEスイッチ導入とその挑戦]]
- Pages created: [[サイバーエージェント]], [[CIU]], [[小障子 尚太朗]], [[疋田 紅樹]], [[Juniper QFX5240]], [[Rail-Optimizedトポロジ]], [[マルチベンダーLosslessネットワーク]]
- Pages updated: [[集合通信]](NCCL_CROSS_NIC=0 知見追加), [[データセンター輻輳制御]](Ingress hashing+DLB 知見追加), [[GPUクラスタ運用]](異種サーバー配線ズレ問題追加)
- Key insight: Broadcom(QFX5240)+Mellanox(SN4700)混在では AR/DLB の単純 on/off では輻輳を解消できず、Spine の Ingress interface hashing と Leaf の DLB 組み合わせでデフォルト比ほぼ 2 倍の帯域を達成。NCCL_CROSS_NIC=0 によるリング経路の Leaf 閉じ込めも有効。
## [2026-06-19] batch-ingest | 稲見昌彦「科学とAIとループ」3部作エッセイ(note.com)
- Source: `.raw/articles/kagaku-no-shuuen-part1-2026-06-19.md` / `.raw/articles/out-of-the-blue-part2-2026-06-19.md` / `.raw/articles/loop-bottleneck-part3-2026-06-19.md`
- Summary: [[@2026__note.com__科学の終焉と、新しい科学の始まり]] / [[@2026__note.com__Out of the Blue]] / [[@2026__note.com__ループのボトルネックは、人間だ]]
- Pages created (source × 3): [[@2026__note.com__科学の終焉と、新しい科学の始まり]], [[@2026__note.com__Out of the Blue]], [[@2026__note.com__ループのボトルネックは、人間だ]]
- Pages created (entity × 10): [[稲見昌彦]], [[東京大学先端科学技術研究センター]], [[ノーバート・ウィーナー]], [[マックス・テグマーク]], [[舘暲]], [[ゴットフリート・ライプニッツ]], [[ジェンスン・フアン]], [[ティモシー・リアリー]], [[ヘレン・ケラー]], [[VPL社]]
- Pages created (concept × 13): [[Human-out-of-the-loop]], [[サイバネティクス]], [[アロスタシス]], [[inside the loops]], [[See-through]], [[Feel-through]], [[光学迷彩]], [[拡張現実感]], [[調律]], [[バイブコーディング]], [[テレイグジスタンス]], [[情報顕微鏡]], [[モナド論]]
- Key insight: 3部を貫く論題「ループから外れた人間はどこへ行くか」を、第一部(理論)→第二部(感覚拡張)→第三部(実践+哲学)と展開。サイバネティクスとHuman-out-of-the-loopが理論的基盤として全篇に通底する。
## [2026-06-19] ingest-slides | Latency SLOs Done Right
- Source: `.raw/slides/srecon19emea-latency-slos-done-right/srecon19emea-latency-slos-done-right.pdf`
- Visual pages: `.raw/slides/srecon19emea-latency-slos-done-right/pages/`
- Media: none
- Summary: [[@2019__SREcon19 EMEA__Latency SLOs Done Right]]
- Pages created: [[@2019__SREcon19 EMEA__Latency SLOs Done Right]], [[Heinrich Hartmann]], [[Circonus]], [[ヒストグラムメトリクス]]
- Pages updated: [[サービスレベル目標]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: レイテンシ SLO はパーセンタイル時系列の監視ではなく、期間全体のイベント集合に対してしきい値以内のリクエスト割合を数える問題であり、ログ・カウンタ・ヒストグラムがその実装経路になる。
## [2026-06-19] ingest-paper | Failure Diagnosis in Microservice Systems: A Comprehensive Survey and Analysis
- Source: `.raw/papers/arxiv-2407.01710.pdf`
- Summary: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis]]
- Pages created: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis]]
- Pages updated: [[Shenglin Zhang]], [[マルチモーダル障害診断]], [[根本原因分析]], [[sources/_index]], [[index]], [[hot]]
- Key insight: result fusion → model fusion → feature fusion のマルチモーダル進化線と PC アルゴリズム + ランダムウォークの古典的パイプラインが 98 論文スケールで体系化。LLM + 知識グラフ統合が次の重要方向として明示された。
## [2026-06-19] ingest-paper | Graph-based Incident Aggregation for Large-Scale Online Service Systems
- Source: `.raw/papers/arxiv-2108.12179.pdf`
- Summary: [[@2021__ASE__Graph-based Incident Aggregation for Large-Scale Online Service Systems]]
- Pages created: [[@2021__ASE__Graph-based Incident Aggregation for Large-Scale Online Service Systems]], [[GRLIA]], [[OpsPAI]], [[Xuemin Wen]], [[Xiao Ling]]
- Pages updated: [[アラート集約]], [[インシデント管理]], [[サービス依存グラフ]], [[グレイ障害]], [[Zhuangbin Chen]], [[Jinyang Liu]], [[Yuxin Su]], [[Hongyu Zhang]], [[Yongqiang Yang]], [[Michael R. Lyu]], [[Huawei Cloud]], [[The Chinese University of Hong Kong]], [[University of Newcastle]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]]
- Key insight: GRLIA は、テキスト非類似なインシデントを束ねるだけでなく、モニタ閾値やフォールトトレランスで incident stream に現れない「沈黙ノード」を KPI トレンドで補完し、表現学習の前段にある障害影響グラフ自体を改善する。
## [2026-06-18] ingest-slides | AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性
- Source: `.raw/slides/ai-supercomputer-llm-benchmarking-and-observability/ai-supercomputer-llm-benchmarking-and-observability.pdf`
- Visual pages: `.raw/slides/ai-supercomputer-llm-benchmarking-and-observability/pages/`
- Media: `.raw/slides/ai-supercomputer-llm-benchmarking-and-observability/transcript.md`
- Summary: [[@2025__SpeakerDeck__AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性]]
- Pages created: [[@2025__SpeakerDeck__AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性]]
- Pages updated: [[Yuuki Tsubouchi]], [[SAKURA Internet]], [[SAKURAONE]], [[R-Pingmesh]], [[GPU観測性]], [[LLM学習モニタリング]], [[RDMAネットワーク監視]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: AI スパコン可観測性の難しさは、細粒度 GPU/RDMA 計装だけでなく、クラウド事業者がユーザーコード・アプリログへ入れない責任境界から来る。OTel + Grafana のリソース分析から、学習処理スパン・集団通信・RoCE 経路へ意味を戻すことが次の課題。追加 transcript により、LLM 開発では最高性能だけでなく安定に完走できる構成が選ばれ、障害時はリザーブドノードとチェックポイント復旧が現実的な運用境界になることを補足した。
## [2026-06-18] ingest-article | Introducing Contextual Retrieval
- Source: `.raw/articles/contextual-retrieval-2024-09-19.md`
- Summary: [[@2024__Anthropic Engineering Blog__Introducing Contextual Retrieval]]
- Pages created: [[@2024__Anthropic Engineering Blog__Introducing Contextual Retrieval]], [[Daniel Ford]]
- Pages updated: [[文脈付き検索]](seed → developing; 一次資料数値・BM25・リランキング・横断的知見を追加), [[Anthropic]](ソース追加・数値修正), [[sources/_index]], [[entities/_index]], [[index]], [[log]]
- Key insight: チャンク分割による文脈損失が RAG の主要ボトルネック。BM25 語彙一致は埋め込み単体より高精度。複数技術(Contextual Embeddings + BM25 + リランキング)は効果が累積的で合計 67% 削減を実現。ベースライン失敗率は 5.7%(二次ソースの 5.0% と齟齬あり; 一次資料を正とする)。
## [2026-06-18] ingest-slides | Scaling KV Caches for LLMs: How LMCache + NIXL Handle Network and Storage Heterogeneity
- Source: `.raw/slides/LMCache20and20NIXL/LMCache20and20NIXL.pdf`
- Visual pages: `.raw/slides/LMCache20and20NIXL/pages/`
- Media: none
- Summary: [[@2025__PyTorchConference__Scaling KV Caches for LLMs - How LMCache + NIXL Handle Network and Storage Heterogeneity]]
- Pages created: [[@2025__PyTorchConference__Scaling KV Caches for LLMs - How LMCache + NIXL Handle Network and Storage Heterogeneity]], [[Moein Khazraee]]
- Pages updated: [[Junchen Jiang]], [[LMCache]], [[NIXL]], [[KVキャッシュ管理]], [[LLM推論]], [[Prefill-Decode分離]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: KV キャッシュ最適化は GPU 内 page/chunk 粒度だけでなく、DRAM/VRAM/BLK/FILE/OBJ の登録、remote metadata 交換、非同期 Xfer request の投稿という転送制御面を含む設計問題になっている。
## [2026-06-18] ingest-paper | FlashAttention (arXiv:2205.14135)
- Source: `.raw/papers/arxiv-2205.14135.pdf`
- Summary: [[@2022__arXiv__FlashAttention - Fast and Memory-Efficient Exact Attention with IO-Awareness]]
- Pages created: [[@2022__arXiv__FlashAttention - Fast and Memory-Efficient Exact Attention with IO-Awareness]] / [[Tri Dao]]
- Pages updated: [[Together AI]] / [[FlashAttention]] / [[カーネルフュージョン]] / [[GPU最適化]] / [[LLM推論]]
- Key insight: タイリング+オンライン softmax+再計算で N×N アテンション行列の HBM 読み書きを排除し、IO 複雑度 O(N²d²M⁻¹) で厳密アテンションを 2-4 倍高速化。
## [2026-06-18] ingest-paper | FlashAttention-2 (arXiv:2307.08691)
- Source: `.raw/papers/arxiv-2307.08691.pdf`
- Summary: [[@2023__arXiv__FlashAttention-2 - Faster Attention with Better Parallelism and Work Partitioning]]
- Pages created: [[@2023__arXiv__FlashAttention-2 - Faster Attention with Better Parallelism and Work Partitioning]]
- Pages updated: [[FlashAttention]] / [[LLM推論]]
- Key insight: 非 MMA FLOP 削減とシーケンス長並列化で A100 利用率を 25-35% から 50-73% へ改善し 225 TFLOP/秒を達成。
## [2026-06-18] ingest-paper | FlashAttention-3 (arXiv:2407.08608)
- Source: `.raw/papers/arxiv-2407.08608.pdf`
- Summary: [[@2024__arXiv__FlashAttention-3 - Fast and Accurate Attention with Asynchrony and Low-precision]]
- Pages created: [[@2024__arXiv__FlashAttention-3 - Fast and Accurate Attention with Asynchrony and Low-precision]] / [[Jay Shah]]
- Pages updated: [[Together AI]] / [[FlashAttention]] / [[テンソルコア]] / [[LLM推論]]
- Key insight: Hopper のワープ特化と FP8 ブロック量子化+incoherent processing で 740 TFLOP/秒(75% 利用率)と数値誤差 2.6 倍改善を同時達成。
## [2026-06-18] ingest-paper | FlashAttention-4 (arXiv:2603.05451)
- Source: `.raw/papers/arxiv-2603.05451.pdf`
- Summary: [[@2026__arXiv__FlashAttention-4 - Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling]]
- Pages created: [[@2026__arXiv__FlashAttention-4 - Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling]]
- Pages updated: [[FlashAttention]] / [[テンソルコア]] / [[カーネルフュージョン]] / [[GPU最適化]] / [[LLM推論]]
- Key insight: Blackwell で指数関数ユニットがボトルネックになる非対称スケーリング問題を特定し、ソフトウェアエミュレート指数関数+TMEM+CuTe-DSL で 1613 TFLOP/秒(71%)を達成。
## [2026-06-18] ingest-paper | AIBrix (arXiv:2504.03648)
- Source: `.raw/papers/arxiv-2504.03648.pdf`
- Summary: [[@2025__arXiv__AIBrix - Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure]]
- Pages created: [[@2025__arXiv__AIBrix - Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure]]
- Pages updated: [[AIBrix]] / [[LLM推論]] / [[KVキャッシュ管理]] / [[Prefill-Decode分離]]
- Key insight: Kubernetes+Ray ハイブリッドで推論エンジンを vendor-neutral に収容。分散 KV キャッシュで 50% スループット向上・70% レイテンシ削減。
## [2026-06-18] ingest-paper | GPT-4 Technical Report (arXiv:2303.08774)
- Source: `.raw/papers/arxiv-2303.08774.pdf`
- Summary: [[@2023__arXiv__GPT-4 Technical Report]]
- Pages created: [[@2023__arXiv__GPT-4 Technical Report]]
- Pages updated: [[OpenAI]] / [[LLMスケーリング則]] / [[LLM評価]] / [[RLHF誤誘導]] / [[index]] / [[sources/_index]]
- Key insight: 予測可能スケーリング(1/1,000〜1/10,000 の計算量から性能を事前予測)と、RLHF によるキャリブレーション劣化(ECE 0.007→0.074)の定量化が GPT-4 技術報告の 2 大貢献。アーキテクチャ非公開。
---
## [2026-06-18] wiki-query | TSFM・TS-MLLM・Toto-Qwen3-VL 比較 + Transformer 基礎
- Question: 時系列基盤モデル・時系列マルチモーダル LLM・Toto-Qwen3-VL の共通点・差異・アーキテクチャ上の本質は何か
- Summary: 自己注意・パッチ化・Encoder-Decoder・トークン化・事前学習/RLVR の基礎から出発し、3 者を信号フロー・TS エンコーダ出自・多変量次元の扱い・モダリティ数・訓練パイプラインの 5 軸で比較。「予測精度の担い手 vs 推論の担い手」という役割分業と、TSFM→TS-MLLM の 2 段スタック(Toto-Qwen3-VL が実証)という統合構図を整理した
- Pages created: [[TSFM-TSMLLM-TotoQwen3VL-比較と基礎]](`wiki/questions/`)
- Pages updated: [[index]]
---
## [2026-06-18] ingest-paper | KV キャッシュ・GPU クラスタ論文 5 本
- Source: `.raw/papers/arxiv-2506.02634.pdf`, `.raw/papers/nsdi22-paper-weng.pdf`, `.raw/papers/arxiv-2405.16444.pdf`, `.raw/papers/arxiv-2503.16525.pdf`, `.raw/papers/arxiv-2412.10319.pdf`
- Summary: KV キャッシュ本番ワークロード特性(KVCache Cache in the Wild)、異種混合 GPU クラスタのワークロード解析(MLaaS in the Wild)、RAG 向け非プリフィックス KV キャッシュ再利用(CacheBlend)、マルチテナント KV キャッシュ再利用(KVShare)、KV キャッシュ中心長コンテキスト手法ベンチマーク(SCBench)の 5 本を一括取り込み
- Pages created: [[@2026__arXiv__KVCache Cache in the Wild - Characterizing and Optimizing KVCache Cache at a Large Cloud Provider]], [[@2022__NSDI__MLaaS in the Wild - Workload Analysis and Scheduling in Large-Scale Heterogeneous GPU Clusters]], [[@2025__EuroSys__CacheBlend - Fast Large Language Model Serving for RAG with Cached Knowledge Fusion]], [[@2025__arXiv__KVShare - An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse]], [[@2025__ICLR__SCBench - A KV Cache-Centric Analysis of Long-Context Methods]], [[Xingda Wei]], [[Jinbo Han]], [[Qizhen Weng]], [[Alibaba PAI]], [[Alibaba GPU Cluster Trace]], [[Jiayi Yao]], [[Junchen Jiang]], [[CacheBlend]], [[Huan Yang]], [[KVShare]], [[Central South University]], [[Yucheng Li]], [[Huiqiang Jiang]], [[SCBench]], [[University of Chicago]], [[University of Surrey]]
- Pages updated: [[KVキャッシュ管理]], [[LLM推論]], [[GPUクラスタスケジューリング]], [[Tsinghua University]], [[Microsoft Research]], [[Alibaba Group]], [[Yuhan Liu]]
- Key insight: 本番 KV キャッシュヒット率は合成ベンチマークの 80% 超に対し 54-62% にとどまり、ワークロード対応エビクションが必須。RAG/マルチテナントでの非プリフィックス選択的再計算は CacheBlend(プリフィル時)→ KVShare(デコード時アテンション・ドリフト対処)へ発展。SCBench は sub-O(n) メモリ手法がマルチターン破綻し、KV キャッシュライフサイクル全体の評価が必要であることを示した。
## [2026-06-18] enrich-source | From Attention to Disaggregation の充実化
- Source: [[@2025__arXiv__From Attention to Disaggregation - Tracing the Evolution of LLM Inference]] (`.raw/papers/arxiv-2511.07422.pdf` 全 22 ページを再走査)
- Pages updated: [[@2025__arXiv__From Attention to Disaggregation - Tracing the Evolution of LLM Inference]](6 最適化テーブル、GPU メモリ階層、Monolithic vs Disaggregated 比較、PEARL 並列 Speculative Decoding、DistServe/AIBrix/NVIDIA Dynamo の制御/データプレーン詳細、性能数値、参考文献 25 件の主要引用)
- Pages created: [[NVIDIA Dynamo]](Amazon [[Dynamo]] と区別)、[[AIBrix]](クラウドネイティブ制御プレーン)
- Key insight: 本論文の CAP 解釈は KV Cache・Continuous Batching・PagedAttention・RadixAttention の各図注で「単一/密結合システム内の論理リソース割当としての比喩」と著者が明言。厳密な分散理論ではなく**設計語彙**として扱う。一方 3 アーキタイプ比較(research-first / cloud-native / full-stack hardware co-design)は、PD 分離研究の地図として実用価値が高い。
## [2026-06-18] ingest-paper | Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving
- Source: `.raw/papers/arxiv-2407.00079.pdf`
- Summary: [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]]
- Pages created: [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]], [[Ruoyu Qin]], [[Zheming Li]], [[Weiran He]], [[Mingxing Zhang]], [[Yongwei Wu]], [[Weimin Zheng]], [[Xinran Xu]]
- Pages updated: [[KVキャッシュ管理]], [[Prefill-Decode分離]], [[LLM推論]], [[Mooncake]], [[Moonshot AI]], [[Tsinghua University]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: Kimi 本番の過負荷 MaaS では CPU/DRAM を KVCache 第一階層に昇格させ、KVCache 中心スケジューリングでランダム比 TTFT を 15 倍改善。PD 分離固有の負荷振動は将来負荷予測なしでは解消できない。
## [2026-06-18] ingest-slides | A study on accelerating LLM inference using KV cache sharing with IOWN APN
- Source: `.raw/slides/mpls2025-02-02-tanaka/mpls2025-02-02-tanaka.pdf`
- Visual pages: `.raw/slides/mpls2025-02-02-tanaka/pages/`
- Media: none
- Summary: [[@2025__MPLSJapan__A study on accelerating LLM inference using KV cache sharing with IOWN APN]]
- Pages created: [[@2025__MPLSJapan__A study on accelerating LLM inference using KV cache sharing with IOWN APN]], [[田仲顕至]], [[NTT]], [[IOWN APN]]
- Pages updated: [[KVキャッシュ管理]], [[LLM推論]], [[AI Greenferencing]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: KV キャッシュ共有は、クラスタ内のメモリ/ストレージ管理から、IOWN APN のような低遅延・広帯域ネットワークで分散小型データセンターを束ねる広域推論基盤設計へ拡張する。
## [2026-06-18] ingest-paper | 分散深層学習の通信・スケジューリング・ネットワーク基盤 15 論文
- Source: `.raw/papers/nsdi22-paper-romero.pdf`, `.raw/papers/arxiv-2410.21680.pdf`, `.raw/papers/sigcomm24-final246-acmpaginated.pdf`, `.raw/papers/gpu-util-icse2024.pdf`, `.raw/papers/nsdi19-gu.pdf`, `.raw/papers/rdma_sigcomm2016.pdf`, `.raw/papers/haidar_fp16_sc18.pdf`, `.raw/papers/arxiv-2209.01346.pdf`, `.raw/papers/arxiv-2302.03337.pdf`, `.raw/papers/google-34926.pdf`, `.raw/papers/google-35154.pdf`, `.raw/papers/nsdi20-paper-mahajan.pdf`, `.raw/papers/2024_EthernetHu.pdf`, `.raw/papers/arxiv-2307.12169.pdf`, `.raw/papers/p523.pdf`
- Summary: 集合通信最適化(MSCCL)、GPU クラスタスケジューリング(Tiresias/Themis)、GPU 利用率実証研究、RDMA 大規模展開(Microsoft/Meta)、輻輳制御(DCQCN)、RoCE 設計課題、ネットワークトポロジ(Dragonfly/HammingMesh/Rail-only)、混合精度訓練(FP16 Tensor Core)、Ethernet ベンチマーク、ML クラスタ信頼性(HPCA'25 既存)の計 15 本を一括取り込み
- Pages created: [[@2022__NSDI__Accelerating Collective Communication in Data Parallel Training across Deep Learning Frameworks]], [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]], [[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]], [[@2019__NSDI__Tiresias - A GPU Cluster Manager for Distributed Deep Learning]], [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]], [[@2018__SC__Harnessing GPU Tensor Cores for Fast FP16 Arithmetic to Speed up Mixed-Precision Iterative Refinement Solvers]], [[@2008__ISCA__Technology-Driven, Highly-Scalable Dragonfly Topology]], [[@2009__IEEE-Micro__Cost-Efficient Dragonfly Topology for Large-Scale Systems]], [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]], [[@2020__NSDI__Themis - Fair and Efficient GPU Cluster Scheduling]], [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]], [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning]], [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]], [[@2024__SC-W 2024__Benchmarking Ethernet Interconnect for HPC AI workloads]], [[Dragonflyトポロジ]], [[データセンター輻輳制御]], [[RoCE設計課題]], [[HPCインターコネクトベンチマーク]]
- Pages updated: [[RDMA]], [[GPUクラスタスケジューリング]], [[Fat-Tree]], [[集合通信]], [[混合精度訓練]], [[GPUクラスタ運用]]
- Key insight: RDMA の大規模展開は DCQCN(2015)→Microsoft 全 DC 展開(2016)→Meta AI 訓練(2024)と進化し、AI ワークロード固有の要求が輻輳制御の再設計を促した。ネットワークトポロジも Fat-Tree 一辺倒から Dragonfly/HammingMesh/Rail-only へ多様化し、ワークロード特化設計がコスト削減の鍵となっている。
## [2026-06-18] ingest-paper | LLM inference KV cache management and disaggregation
- Source: `.raw/papers/arxiv-2309.06180.pdf`, `.raw/papers/arxiv-2510.09665.pdf`, `.raw/papers/arxiv-2511.07422.pdf`, `.raw/papers/724be4472168f31ba1c9ac630f15dec8-Paper-Conference.pdf`, `.raw/papers/arxiv-2408.08147.pdf`, `.raw/papers/arxiv-2404.14294.pdf`
- Summary: [[@2023__SOSP__Efficient Memory Management for Large Language Model Serving with PagedAttention]], [[@2025__arXiv__LMCache - An Efficient KV Cache Layer for Enterprise-Scale LLM Inference]], [[@2025__arXiv__From Attention to Disaggregation - Tracing the Evolution of LLM Inference]], [[@2024__NeurIPS__SGLang - Efficient Execution of Structured Language Model Programs]], [[@2024__arXiv__P-D-Serve - Serving Disaggregated Large Language Model at Scale]], [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models]]
- Pages created: [[@2023__SOSP__Efficient Memory Management for Large Language Model Serving with PagedAttention]], [[@2025__arXiv__LMCache - An Efficient KV Cache Layer for Enterprise-Scale LLM Inference]], [[@2025__arXiv__From Attention to Disaggregation - Tracing the Evolution of LLM Inference]], [[@2024__NeurIPS__SGLang - Efficient Execution of Structured Language Model Programs]], [[@2024__arXiv__P-D-Serve - Serving Disaggregated Large Language Model at Scale]], [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models]], [[KVキャッシュ管理]], [[SGLang]], [[P-D-Serve]], [[Woosuk Kwon]], [[Yuhan Liu]], [[Srinivasa Rao Aravilli]], [[Yibo Jin]], [[Zixuan Zhou]], [[Tensormesh Inc]], [[Infinigence-AI]], [[Capital One]]
- Pages updated: [[LLM推論]], [[Prefill-Decode分離]], [[vLLM]], [[LMCache]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: KV キャッシュ最適化は vLLM の GPU 内ページ化から、SGLang の prefix 木再利用、LMCache の階層ストレージ/転送、P/D-Serve の本番 RoCE D2D 転送へ拡張し、LLM 推論の中心制御対象になった。
## [2026-06-18] ingest-paper | LLM inference serving: DistServe + Taming the Titans
- Source: `.raw/papers/osdi24-zhong-yinmin.pdf`, `.raw/papers/acl-2025-inlg-main-32.pdf`
- Summary: [[@2024__OSDI__DistServe - Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving]], [[@2025__INLG__Taming the Titans - A Survey of Efficient LLM Inference Serving]]
- Pages created: [[@2024__OSDI__DistServe - Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving]], [[@2025__INLG__Taming the Titans - A Survey of Efficient LLM Inference Serving]], [[Prefill-Decode分離]], [[DistServe]], [[Yinmin Zhong]], [[Shengyu Liu]], [[Junda Chen]], [[Jianbo Hu]], [[Xuanzhe Liu]], [[Ranran Zhen]], [[Juntao Li]], [[Yixin Ji]], [[Zhenlin Yang]], [[Tong Liu]], [[Min Zhang]], [[Qingrong Xia]], [[Xinyu Duan]], [[Zhefeng Wang]], [[Baoxing Huai]], [[Soochow University]], [[UC San Diego]], [[StepFun]]
- Pages updated: [[LLM推論]], [[Peking University]], [[Huawei Cloud]], [[Yibo Zhu]], [[Xin Jin]], [[Hao Zhang]], [[vLLM]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: PD 分離は単なる配置技法ではなく、TTFT/TPOT の二重 SLO を満たす Goodput 最適化問題として定式化される。2025 年時点では、推論サービングはインスタンス・クラスタ・新興シナリオを跨ぐ階層的な運用設計問題へ広がっている。
## [2026-06-18] ingest-slides | 推論基盤のパフォーマンス検証と最適化戦略
- Source: `.raw/slides/performance_verification_and_optimization_strategy_for_inference/performance_verification_and_optimization_strategy_for_inference.pdf`
- Visual pages: `.raw/slides/performance_verification_and_optimization_strategy_for_inference/pages/`
- Media: none
- Summary: [[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]]
- Pages created: [[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]]
- Pages updated: [[LLM推論]], [[サービスレベル目標]], [[道下幹也]], [[SAKURA Internet]], [[高火力 PHY]], [[vLLM]], [[LMCache]], [[Mooncake]], [[sources/_index]], [[concepts/_index]], [[entities/_index]], [[index]], [[hot]]
- Key insight: LLM 推論基盤の最適化は SLO/SLA と Goodput を中心に置くべきで、同一 4 GPU 条件の PD 分離は ITL テイルを維持し、Mooncake Store による KV Cache Reuse/Sharing は TTFT を最大 1.75 倍程度削減するが、読み込みコストは未解決の設計課題として残る。
## [2026-06-17] ingest-paper | FFTrainer: Fast Failover in LLM Training
- Source: `.raw/papers/arxiv-2512.03644.pdf`
- Summary: [[@2025__arXiv__FFTrainer Fast Failover in Large Language Model Training with Almost Free State Management]]
- Pages created: [[@2025__arXiv__FFTrainer Fast Failover in Large Language Model Training with Almost Free State Management]], [[FFTrainer]], [[Bohan Zhao]], [[Wei Xu]], [[耐障害LLM訓練]]
- Pages updated: [[チェックポイント]], [[LLM分散学習]]
- Key insight: 訓練ネットワークの遊休帯域を利用したゼロオーバーヘッドチェックポイント(< 3%)と checkpoint razor(サイズ 1/10 以下圧縮)で反復ごとのチェックポイントを実現し、障害復旧を数十分→数十秒に短縮。
## [2026-06-17] ingest-paper | Cassini: Network-Aware Job Scheduling
- Source: `.raw/papers/nsdi24-rajasekaran.pdf`
- Summary: [[@2024__NSDI__Cassini Network-Aware Job Scheduling in Machine Learning Clusters]]
- Pages created: [[@2024__NSDI__Cassini Network-Aware Job Scheduling in Machine Learning Clusters]], [[Cassini]], [[Sudarsanan Rajasekaran]], [[Manya Ghobadi]], [[Aditya Akella]], [[ネットワーク対応スケジューリング]]
- Pages updated: [[GPUクラスタスケジューリング]]
- Key insight: GPU 配置とネットワークフロースケジューリングの統合で JCT を最大 1.6 倍改善。ring-allreduce のフロー間干渉が主要ボトルネックであることを実証。
## [2026-06-17] ingest-paper | Understanding Communication Characteristics of Distributed Training
- Source: `.raw/papers/ai-workload-apnet24.pdf`
- Summary: [[@2024__APNet__Understanding Communication Characteristics of Distributed Training]]
- Pages created: [[@2024__APNet__Understanding Communication Characteristics of Distributed Training]], [[Kai Chen (HKUST)]], [[iSING Lab]]
- Pages updated: [[集合通信]], [[並列化戦略]]
- Key insight: 3D 並列化で TP 内 AllReduce が帯域の 55〜85% を占有し、DP の AllReduce はバースト性が高く、PP は帯域消費が低いが遅延に敏感という実測プロファイルを初めて体系的に提示。
## [2026-06-17] ingest-paper | PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel
- Source: `.raw/papers/p3848-huang.pdf`
- Summary: [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]]
- Pages created: [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]], [[Yanli Zhao]], [[ZeROパラメータシャーディング]]
- Pages updated: [[並列化戦略]], [[LLM分散学習]]
- Key insight: FlatParameter による通信集約、後退プリフェッチで GPT-175B 18% スループット向上、レートリミッターで T5-11B 最大 5× 向上を産業規模で実証。
## [2026-06-17] ingest-paper | Reducing Activation Recomputation in Large Transformer Models
- Source: `.raw/papers/80083951326cf5b35e5100260d64ed81-Paper-mlsys2023.pdf`
- Summary: [[@2023__MLSys__Reducing Activation Recomputation in Large Transformer Models]]
- Pages created: [[@2023__MLSys__Reducing Activation Recomputation in Large Transformer Models]], [[Vijay Korthikanti]], [[選択的活性化再計算]], [[シーケンス並列化]], [[再マテリアライゼーション]]
- Pages updated: [[Megatron-LM]], [[Bryan Catanzaro]], [[Mohammad Shoeybi]]
- Key insight: QKV 以外の活性化のみ選択的に再計算し、530B パラメータモデルで活性化メモリ 5 倍削減・再計算オーバーヘッドは完全再計算の 1/3 に抑制。
## [2026-06-17] ingest-paper | FP8-LM: Training FP8 Large Language Models
- Source: `.raw/papers/arxiv-2310.18313.pdf`
- Summary: [[@2023__arXiv__FP8-LM Training FP8 Large Language Models]]
- Pages created: [[@2023__arXiv__FP8-LM Training FP8 Large Language Models]], [[Houwen Peng]], [[Han Hu]], [[混合精度訓練]]
- Pages updated: [[LLM分散学習]]
- Key insight: FP8 での LLM 事前訓練を初めて体系的に検証。forward に FP8・backward に FP16/BF16・勾配に FP8+精度補償を適用し、GPT-175B でメモリ 42% 削減・訓練 64% 高速化を BF16 と同等精度で達成。
## [2026-06-17] ingest-paper | Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
- Source: `.raw/papers/sc_megatron_lm.pdf`
- Summary: [[@2021__SC__Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM]]
- Pages created: [[@2021__SC__Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM]], [[Deepak Narayanan]], [[Matei Zaharia]], [[PTD-P]]
- Pages updated: [[Megatron-LM]], [[並列化戦略]], [[LLM分散学習]]
- Key insight: パイプライン・テンソル・データの 3D 並列を組み合わせる PTD-P を提案し、1 兆パラメータモデルを 3072 A100 GPU で 502 petaFLOP/s(MFU 52%)で訓練可能と実証。
## [2026-06-17] ingest-paper | ZeRO: Memory Optimizations Toward Training Trillion Parameter Models
- Source: `.raw/papers/arxiv-1910.02054.pdf`
- Summary: [[@2020__SC__ZeRO Memory Optimizations Toward Training Trillion Parameter Models]]
- Pages created: [[@2020__SC__ZeRO Memory Optimizations Toward Training Trillion Parameter Models]], [[Samyam Rajbhandari]], [[ZeROメモリ最適化]], [[ZeROオプティマイザ]]
- Pages updated: [[DeepSpeed]], [[LLM分散学習]]
- Key insight: オプティマイザ状態・勾配・パラメータを GPU 間で段階的に分割する Stage 1〜3 を提案し、モデル並列なしで 1000 億パラメータ訓練を可能にした。
## [2026-06-17] ingest-paper | HiveD: Sharing a GPU Cluster for Deep Learning with Guarantees
- Source: `.raw/papers/osdi20-zhao_hanyu.pdf`
- Summary: [[@2020__OSDI__HiveD Sharing a GPU Cluster for Deep Learning with Guarantees]]
- Pages created: [[@2020__OSDI__HiveD Sharing a GPU Cluster for Deep Learning with Guarantees]], [[HiveD]], [[Hanyu Zhao]], [[OpenPAI]], [[共有異常]], [[Virtual Private Cluster]]
- Pages updated: [[GPUクラスタスケジューリング]]
- Key insight: マルチテナント GPU クラスタで「共有異常」(クォータ内でも私有クラスタより待ち時間が長い)を発見し、VC + バディセル割り当てで共有安全性を数学的に保証。
## [2026-06-17] ingest-paper | DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters
- Source: `.raw/papers/2026_Unknown_DeepSpeed.pdf`
- Summary: [[@2020__KDD__DeepSpeed System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters]]
- Pages created: [[@2020__KDD__DeepSpeed System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters]], [[Jeff Rasley]], [[Yuxiong He]]
- Pages updated: [[DeepSpeed]]
- Key insight: KDD 2020 チュートリアル概要(2 ページ)。ZeRO による 100〜200 億パラメータモデルの 10 倍高速訓練と BERT 44 分事前訓練記録の概要紹介。
## [2026-06-17] ingest-paper | PipeDream: Generalized Pipeline Parallelism for DNN Training
- Source: `.raw/papers/sosp_pipedream.pdf`
- Summary: [[@2019__SOSP__PipeDream Generalized Pipeline Parallelism for DNN Training]]
- Pages created: [[@2019__SOSP__PipeDream Generalized Pipeline Parallelism for DNN Training]], [[PipeDream]]
- Pages updated: [[パイプライン並列化]], [[並列化戦略]]
- Key insight: 1F1B パイプラインスケジュールと重み隠蔽で GPipe 比メモリ 2 倍削減、データ並列比 VGG-16 5.3 倍高速化を実現。
## [2026-06-17] ingest-paper | Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
- Source: `.raw/papers/arxiv-1909.08053.pdf`
- Summary: [[@2019__arXiv__Megatron-LM Training Multi-Billion Parameter Language Models Using Model Parallelism]]
- Pages created: [[@2019__arXiv__Megatron-LM Training Multi-Billion Parameter Language Models Using Model Parallelism]], [[Mohammad Shoeybi]], [[テンソル並列]]
- Pages updated: [[Megatron-LM]], [[並列化戦略]]
- Key insight: MLP と自己注意の行列分割による層内テンソル並列化を提案し、通信を AllReduce 2 回に抑制。83 億パラメータ Transformer で 512 V100 GPU・15.1 PetaFLOPs(理論ピーク 76%)を達成。
## [2026-06-17] ingest-paper | GPipe: Easy Scaling with Micro-Batch Pipeline Parallelism
- Source: `.raw/papers/arxiv-1811.06965.pdf`
- Summary: [[@2019__NeurIPS__GPipe Easy Scaling with Micro-Batch Pipeline Parallelism]]
- Pages created: [[@2019__NeurIPS__GPipe Easy Scaling with Micro-Batch Pipeline Parallelism]], [[GPipe]], [[Yanping Huang]], [[Quoc V. Le]], [[パイプライン並列化]]
- Pages updated: [[LLM分散学習]]
- Key insight: マイクロバッチ分割と再マテリアライゼーションの組み合わせでパイプライン並列化を実用化。bubble 比率 O(K−1)/M でマイクロバッチ数 M 増加により無視可能に。
## [2026-06-17] ingest-paper | Ray: A Distributed Framework for Emerging AI Applications
- Source: `.raw/papers/osdi18-moritz.pdf`
- Summary: [[@2018__OSDI__Ray A Distributed Framework for Emerging AI Applications]]
- Pages created: [[@2018__OSDI__Ray A Distributed Framework for Emerging AI Applications]], [[Ray]], [[Philipp Moritz]], [[タスク並列フレームワーク]], [[動的タスクグラフ]]
- Pages updated: [[Ion Stoica]], [[University of California, Berkeley]]
- Key insight: タスク並列とアクターモデルを統合する分散フレームワーク。動的タスクグラフ・GCS・ボトムアップ分散スケジューラで 1.8 ミリ秒遅延・毎秒 100 万タスク以上を処理。
## [2026-06-17] ingest-slides | AI時代に向けたクラウドにおける信頼性エンジニアリングの未来構想
- Source: `.raw/slides/dicomo2022/dicomo2022.pdf`
- Visual pages: `.raw/slides/dicomo2022/pages/`
- Media: none
- Summary: [[@2022__DICOMO__AI時代に向けたクラウドにおける信頼性エンジニアリングの未来構想]]
- Pages created: [[@2022__DICOMO__AI時代に向けたクラウドにおける信頼性エンジニアリングの未来構想]], [[Interactive AIOps]], [[セルフクラフト]]
- Pages updated: [[AIOps]], [[SRE]], [[サービスレベル目標]], [[自動化のアイロニー]], [[Yuuki Tsubouchi]], [[Hirofumi Tsuruta]], [[sources/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insight: 2022 年時点で、SRE の信頼性制御思想を 2040 年代の利用者主導 [[セルフクラフト]] へ延長し、その手前の技術者-AI 協働段階として [[Interactive AIOps]](実験可能性 + 解釈性)を提示していた。
## [2026-06-17] ingest-paper | Ironies of Automation 後続 2 論文(Baxter+ ECCE2012 / Strauch IEEE-THMS2017)
- Source: `.raw/papers/ECCE2012_baxter_ironies.pdf`, `.raw/papers/roniesofutomationtillnresolvedfterllheseears_4830.pdf`
- Summary: [[@2012__ECCE__The Ironies of Automation Still Going Strong at 30]], [[@2017__IEEE THMS__Ironies of Automation - Still Unresolved After All These Years]]
- Pages created: [[Gordon Baxter]], [[John Rooksby]], [[Barry Strauch]], [[University of St Andrews]], [[National Transportation Safety Board]]
- Pages updated: [[自動化のアイロニー]], [[Lisanne Bainbridge]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]]
- Key insight: Bainbridge (1983) のアイロニーは 40 年以上にわたり構造的に解消されず、ドメインは拡大し続ける。Strauch は新アイロニー(技能マスキング・同一エラー反復・機能過多)を体系化し、Baxter らはクラウドの低コストによる品質迂回という新しいアイロニーを特定した。
## [2026-06-17] ingest | ペパボ研究所 gpt-ossモデルのサービング性能評価(三宅悠介)
- Source: `.raw/articles/gpt-oss-serving-2025-08-18.md`
- Summary: [[@2025__ペパボ研究所__gpt-ossモデルのサービング性能評価]]
- Pages created: [[三宅悠介]], [[GMOペパボ]]
- Pages updated: [[vLLM]], [[LLM推論]], [[sources/_index]], [[index]], [[hot]]
- Key insight: H100 でのみ並列スケーリングが有効で、出力トークン数がスループットを支配し、Reasoning effort はモデルサイズ選択と同等に重要。
---
## [2026-06-17] ingest-paper | マイクロサービスベンチマーク/データセット 4 論文一括(DeathStarBench + Smith+ + OSS-MS + TrainTicketTrace)
- Sources:
- `.raw/papers/arxiv-1905.11055.pdf`(md5: 取得、16 pages)
- `.raw/papers/arxiv-2306.05895.pdf`(md5: 取得、7 pages)
- `.raw/papers/2026_Unknown_A_Dataset_Microservices_Open_Source.pdf`(md5: 取得、6 pages)
- `.raw/papers/TrainTicketTrace_A_Multi-Fault_Distributed_Dataset_for_Microservice_Fault_Detection_and_Localization.pdf`(md5: 取得、8 pages)
- Summary: [[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]] / [[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]] / [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] / [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]]
- Pages created (sources): [[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]] / [[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]] / [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] / [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]]
- Pages created (entities): [[Christina Delimitrou]] / [[Yu Gan]] / [[Cornell University]] / [[Davide Taibi]] / [[Tomas Cerny]] / [[University of Oulu]] / [[Baylor University]] / [[eShopOnContainers]] / [[EvoMaster]] / [[World of Code]] / [[Software Competence Center Hagenberg]] / [[Pirmin Urbanke]] / [[Stefan Fischer]] / [[Dario Amoroso d'Aragona]] / [[Alexander Bakhtin]] / [[Tampere University]]
- Pages created (concepts): [[マイクロサービスベンチマーク]]
- Pages updated: [[DeathStarBench]] / [[Train-Ticket]] / [[マイクロサービスアーキテクチャ]] / [[マイクロサービスコールグラフ]] / [[分散トレーシング]] / [[Fault Localization]] / [[障害注入]] / [[sources/_index]] / [[index]] / [[hot]] / `.raw/.manifest.json`
- Key insight: マイクロサービス研究の benchmark/dataset カタログとして 4 本を一望できる枠組みが揃った。DeathStarBench(2019、6 アプリ + 自前 trace 0.1% overhead)が学術ベンチの原典、Smith+(2023、Selenium + Gatling test suite)がテスト benchmark、Amoroso+(2024、378 件 OSS-MS dataset)が大規模カタログ、TrainTicketTrace(2026、42 services × 9 fault × 3 modality)が fault localization dataset の現代版。Train-Ticket が 3 本に共通の benchmark system として登場し、microservice 研究の **de facto 共通基盤**化が裏付けられた。EvoMaster の生成テストはすべての seeded fault を test では見落としたが trace/metric/log には痕跡が残るという観察は、test layer と observability layer の段の切れ目を示し、後者で fault detection 研究を進めるべき方向性を示唆する。
## [2026-06-17] ingest-paper | Time-RA(ACL Findings 2026)— TSAD 生成型推論タスク + RATs40K
- Source: `.raw/papers/arxiv-2507.15066.pdf`(md5: 8ad5638639ef270b90f0c0d24a1f721e、27 pages)
- Summary: [[@2026__ACL Findings__Time-RA - Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback]]
- Pages created:
- [[@2026__ACL Findings__Time-RA - Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback]]
- [[Yiyuan Yang]]
- Pages updated: [[Qingsong Wen]] / [[Zichuan Liu]] / [[時系列推論]] / [[時系列異常検知ベンチマーク]] / [[時系列マルチモーダルLLM]] / [[sources/_index]] / [[index]] / [[hot]]
- Key insight: TSAD を「二値識別」から「生成型推論(検知+分類+因果説明)」へ転換した TIME-RA と、実世界 10 ドメイン約 4 万件の RATs40K。SFT + LoRA で fine-tune した Qwen2.5-7B がプラグアンドプレイで未見ドメインに転用可能であることを初めて実証。視覚化は分類より推論一貫性向上に安定的に寄与する。
## [2026-06-17] ingest-paper | LLMAD(KDD 2025)+ ChatTS(VLDB 2025)を同時取り込み
- Sources: `.raw/papers/Liu-et-al.-2024---Large-Language-Models-can-Deliver-Accurate-and-Interpretable-Time-Series-Anomaly-Detection.pdf`(md5: 92f204e58e5a16066500e5ff5fdf1eb2、20 pages) / `.raw/papers/p2385-xie.pdf`(md5: aea42f734779575e627e15a61e546fae、14 pages)
- Summary: [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]] / [[@2025__VLDB__ChatTS - Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning]]
- Pages created:
- [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]] / [[@2025__VLDB__ChatTS - Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning]]
- [[LLMAD]] / [[ChatTS]] / [[AnoCoT]] / [[TSEvol]] / [[Anomaly Transformer]] / [[Qwen2.5-14B-Instruct]]
- [[Jun Liu (UCAS)]] / [[Jiaxu Qian]] / [[Xiao He]] / [[Jianjun Chen]] / [[Rui Shi]] / [[University of Chinese Academy of Sciences]] / [[Zhejiang University of Technology]]
- [[時系列マルチモーダルLLM]]
- Pages updated:
- 既存 entity: [[Microsoft]] / [[Tsinghua University]] / [[BNRist]] / [[BizSeer]] / [[ByteDance]] / [[Dan Pei]] / [[Qingwei Lin]] / [[Minghua Ma]] / [[Chaoyun Zhang]] / [[Si Qin]] / [[Chetan Bansal]] / [[Dongmei Zhang]] / [[Saravan Rajmohan]] / [[Zhe Xie]] / [[Zeyan Li]] / [[Longlong Xu]] / [[Xidao Wen]] / [[Tieying Zhang]]
- 既存 concept(横断的知見・未解決の問い 更新): [[異常検知]] / [[LLM時系列アプローチ]] / [[時系列異常検知ベンチマーク]]
- 索引: [[sources/_index]] / [[entities/_index]] / [[concepts/_index]] / [[index]] / [[hot]] / [[log]] / `.raw/.manifest.json`
- Key insights:
- [[LLMAD]] は「LLM を直接判定器として使う」路線で、Prompting + 履歴 ICL(FastDTW)+ AnoCoT で平均 Best F1=0.759、TFAD(0.725)を上回り年間 $65.70。常時稼働の検知に LLM が重すぎる制約に対し、1 分粒度サンプリングなら実用域に届くことを示し、Microsoft 内の異常検知 LLM 化研究の 2 路線(検知器 vs メタ層)が併走している事実を明確化。
- [[ChatTS]] は時系列を画像同等のネイティブモダリティとして扱う初の TS-MLLM。属性プールから生成した完全合成データのみで Qwen2.5-14B を SFT し、GPT-4o vision を alignment +46.0% / reasoning +25.8% で凌駕。[[LLM時系列アプローチ]] の 5 既存路線(Prompting/Quantization/Aligning/Vision/Tool)に第 6 路線として [[時系列マルチモーダルLLM]] を追加する必要性を実証。
- 両論文は共に「Prompting/MLLM で時系列を扱う」という同じ問題意識から異なる解(LLMAD: 単変量 + 解釈、ChatTS: 多変量 + 推論)を出した姉妹路線。両者を統合する経路(ChatTS の rulebook 適用 × LLMAD の AnoCoT)は未着手。
## [2026-06-17] wiki-query 追補 | Ganatra+ ESEC/FSE2023 を年代別レビューに統合
- Page updated: [[アラーティングの進歩-年代別]]
- Source incorporated: [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]](Microsoft、 ESEC/FSE 2023)
- 統合箇所:
- §1 motivation に 27.25% アウテージ率 / 10.7× TTD / 3.75× TTM を追加
- §6 (2022〜2023) に Ganatra+ パラグラフ追加 — 既存研究の「ある alert をどう良くするか」に対し「そもそも alert が無い」を直交軸として可視化。 6 カテゴリ(Missing monitor/alert 40.41%・Missing/improper signal 18.13%・Incorrect alerting logic 12.78%・Improper coverage 10.02%・Buggy monitor 5.87%・Others 6.39%)とサービス特性 5 軸相関を要約
- §10 通時的潮流の「介入点の細分化」に零番目(monitor 存在判定)を追加し、 6+1 層 → 8 層構造に拡張
- §11 未解決の問いに (e) 検知失敗の事業者横断再測定 + intelligent monitoring framework 未実装 を追加
- Key cross-link: Yang+ DSN2022(既存アラートの 6 アンチパターン)と Ganatra+ FSE2023(アラート不在の 6 カテゴリ)が**相補的タクソノミ対**を成す。 AlertGuardian 2025 の rule refinement が両者の motivation を引き継ぐ
## [2026-06-17] wiki-query | アラーティングの進歩 — 年代別レビュー
- Question: 「アラーティングの進歩について、年代別にまとめてください。」
- Mode: Deep(hot/index 不読み・concept 10 本精読 + sources 年代別棚卸し)
- Page created: [[アラーティングの進歩-年代別]] — 1980s 商用 NMS から 2026 agentic SRE まで、5+1 介入点(評価/抑制/フィルタ/集約/ランキング/RCA/handler)の層分化を論文 introduction 形式で再構成。 Jiang+ ICAC2009 → Tang+ NOMS2012 → Lin+ KDD2014 → Google SRE Book 2016 → Wilkinson SREcon18 → 2020 5 介入点同時開花(AlertStorm/AlertRank/DEAR/DeepIP)→ Yang+ DSN2022 アンチパターン → TraceArk/DyAlert 2023 動的グラフ世代 → 2024 LLM 役割 3 分化(COLA/Zha/MonitorAssistant)→ 2025 AlertGuardian ライフサイクル一括 + SkyNet の LLM 不採用境界 + ProAlert 教師なし化 → 2026 Google AI in SRE の 3 段 agentic を貫いて記述。
- Pages updated: [[wiki/index]] §Questions、[[wiki/log]]
- Key observations:
- **5+1 介入点が層分化した**: 「閾値+通知」が一体だった 2007 から、2024 までに監視評価/抑制/フィルタリング/集約/ランキング/RCA/autonomous handler の 6+1 層に分解された。 end-to-end 統合運用報告はまだない。
- **保証様式が 12 年で緩んだ**: Tang+ 2012 Theorem 1(数学的存在保証)→ Bhukar+ 2024(教師あり上界に到達する経験的近似)。教師あり ML 成熟の副作用として保証必要条件が「証明可能性」から「再現可能近似性能」へシフト。
- **集約アルゴリズム 3 段世代交代**: ペア類似度(2014)→ 動的グラフ表現学習(2023)→ 教師なしトポロジセマンティクス(2025、ProAlert)。「接続性のみ」から「伝播のしやすさの semantics 学習」への軸シフト。
- **LLM 採用境界が SkyNet で明文化**: severe failure では Syslog 10M/15min が 20M トークン context 超過 + hallucination 許容不可で LLM を意図的に不採用。次世代 LLM の context 拡張で境界は動的に再定義される。
- **agentic 時代に「アラート」の意味論が変質中**: 人間通知用から autonomous handler 入力用へ。Google AI in SRE 2026 の 3 段(TimesFM 動的閾値 → alerting agent → autonomous handler)が示すこの変化を理論化する研究はまだない。
## [2026-06-17] ingest-paper x4 | GLM family — 起点(ACL 2022) → GLM-4.5 → GLM-5 → GLM-OCR
- Sources:
- `.raw/papers/arxiv-2103.10360.pdf`(MD5: cdbcb4e448ccbdbac1947e548abe86d5、16p、ACL 2022)
- `.raw/papers/arxiv-2508.06471.pdf`(MD5: c0413d46e4a971f8f42e5f2d03b50274、26p、arXiv 2025)
- `.raw/papers/arxiv-2602.15763.pdf`(MD5: ff79e2abd52115089bb5373f82460c50、40p、arXiv 2026)
- `.raw/papers/arxiv-2603.10910.pdf`(MD5: e624933ba66dfe5081d82ad1f9128d92、17p、arXiv 2026)
- Summaries: [[@2022__ACL__GLM - General Language Model Pretraining with Autoregressive Blank Infilling]] / [[@2025__arXiv__GLM-4.5 - Agentic Reasoning and Coding Foundation Models]] / [[@2026__arXiv__GLM-5 - From Vibe Coding to Agentic Engineering]] / [[@2026__arXiv__GLM-OCR Technical Report]]
- Pages created: 4 source + 1 サブソース([[@2026__Cursor__CursorBench - How Cursor Evaluates Model Quality]]、GLM-5 評価で参照される) + entity([[Zhengxiao Du]] / [[Yujie Qian]] / [[Ming Ding]] / [[Jiezhong Qiu]] / [[Zhilin Yang]] / [[Jie Tang]] / [[Zhipu AI]] / [[BAAI]] / [[Wenmeng Yu]] / [[Xiaotao Gu]] / [[CursorBench]] / [[Cursor]] / [[SWE-Bench-Verified]] / [[Naman Jain]]) + concept(GLM 系統では [[自己回帰空白埋め]] / [[2D位置符号化]] / [[スパン破壊]] / [[事前学習目的設計]] / [[言語モデル事前学習]]、GLM-4.5/5 系統では [[エージェント型コーディング]] / [[非同期エージェントRL]] / [[DSA]]、GLM-OCR では [[光学文字認識]] / [[文書理解]] / [[ビジョン言語モデル]])
- Pages updated: [[Tsinghua University]](GLM 起点論文の所属追記) / [[MIT CSAIL]](Yujie Qian の所属で GLM 関与追記) / [[Shanghai Qi Zhi Institute]](Zhilin Yang の所属で追記) / [[Xiao Liu]](GLM 共著者として first_mentioned 更新) / [[Mixture-of-Experts]](GLM-4.5/5 の MoE 設計を横断的知見追加) / [[マルチトークン予測]](DeepSeek-V3 と GLM-OCR の MTP 設計比較を横断的知見追加) / [[オープンLLM開発]](Zhipu AI 系統の追加) / [[コーディングエージェント評価]](CursorBench 関連) / [[sources/_index]] / [[wiki/index]] / [[wiki/hot]] / [[wiki/log]] / `.raw/.manifest.json`
- Key insights:
- **GLM 系統が単一論文ファミリーとして wiki に揃った**: 2022 ACL の自己回帰空白埋め目的関数(NLU/生成統一)→ 2025 GLM-4.5(ARC 統合・ハイブリッド推論モード・深さ優先設計)→ 2026 GLM-5(DSA + 非同期エージェント RL + コワーク能力)→ 2026 GLM-OCR(0.9B 小型 VLM で 235B モデル超え)。4 年間の単一研究グループ([[Zhipu AI]] / [[Tsinghua University]] [[Jie Tang]] 系)の漸進的進化が一望できる
- **GLM-OCR が OCR の MTP 親和性を示した**: [[DeepSeek-V3]] の MTP(汎用テキスト用、$D=1$、独立 Transformer ブロック)に対し、GLM-OCR は**パラメータ共有ドラフトヘッド**で実装し、OCR の構造トークン局所性(表タグ・Markdown 構文)を活かし平均 5.2 トークン/ステップを達成。**OCR ドメインが MTP の効果を最大化するタスク特性を持つ**ことを実証
- **小型モデルでフロンティアモデル超え**: GLM-OCR の 0.9B が OmniDocBench v1.5 で 235B Qwen3-VL や Gemini-3 Pro を上回る 1 位を獲得。タスク特化型小型 VLM + 段階訓練 + GRPO RL のアプローチが汎用大型 VLM を超える可能性を示す
- **DSA(DeepSeek Sparse Attention)が GLM-5 で次世代スパーシティ手法として採用**: [[Lightning Attention]](MiniMax-M1)・MoE エキスパートスパーシティ(Kimi K2)に続く第三のスパーシティ軸として DSA が 744B 規模で実装され、28.5T トークン訓練を可能にする
- **非同期 RL インフラの台頭**: GLM-5 の slime フレームワーク(生成と訓練の分離)は MiniMax-M2 の Forge(Windowed FIFO + 接頭辞木マージ)と独立に同じ問題意識(長期エージェントロールアウトの GPU 利用率向上)に到達。エージェント RL インフラが独立した研究分野として確立しつつある
- **Cursor との連携が GLM-5 評価で明示**: GLM-5 の coding 評価で [[CursorBench]] を用い、Composer 2.5 / Kimi K2.5 等の産業モデルとの比較を行う。学術 LLM ペーパーが産業ベンチマークを引用する流れの一例
## [2026-06-17] ingest | CursorBench - How Cursor Evaluates Model Quality (Cursor Blog)
- Source: `.raw/articles/cursorbench-2026-06-17.md`
- Summary: [[@2026__Cursor__CursorBench - How Cursor Evaluates Model Quality]]
- Pages created: [[@2026__Cursor__CursorBench - How Cursor Evaluates Model Quality]], [[コーディングエージェント評価]]
- Pages updated: [[CursorBench]], [[Naman Jain]], [[Cursor]], [[SWE-Bench-Verified]]
- Key insight: Cursor が CursorBench 3.1 のハイブリッド評価手法を公開。OpenAI は SWE-bench Verified 報告を停止(未解決問題の 60% にテスト欠陥)、内部ベンチマーク + オンライン評価への業界移行を示唆。
## [2026-06-17] ingest-paper | アラート管理・時系列異常検知 10 本一括(NOMS2012-FSE2025)
- Sources(10):
- `.raw/papers/noms2012-situation.pdf`(MD5: 83a2ac7d1db5491fdf45f664da6bfed1、9p)
- `.raw/papers/CIKM18-AlertR.pdf`(MD5: b080948f601693083336ca692f16b27f、9p)
- `.raw/papers/2026_Unknown_Online_summarizing_alerts_semantic_behavior.pdf`(MD5: a754a1c843cd3c75178fbcb4f21f0efc、12p)
- `.raw/papers/arxiv-2501.14170.pdf`(arXiv 2501.14170、20p)
- `.raw/papers/arxiv-2502.17812.pdf`(MD5: e2a96c8f8244ef4b5d3adb2863b6d278、12p)
- `.raw/papers/2026_Unknown_Ranking_importance_alerts_problem_determination.pdf`(MD5: e529bf8feb9302e4f52f0bcb0612ed13、10p)
- `.raw/papers/kdd17p1067.pdf`(MD5: 702b37f74518e39425b2382aa204026e、9p)
- `.raw/papers/cloud_20_dear.pdf`(MD5: 9dc8218a2b0420b16ac5dde8dbe98f8f、8p)
- `.raw/papers/2026_Unknown_Alert_Summarization_Online_Service_Systems.pdf`(MD5: db8c192e842c5056cd1df2d4570c68a4、23p)
- `.raw/papers/2026_Unknown_ChangeRCA_Finding_Root_Causes_Software.pdf`(23p)
- Summaries: [[@2012__NOMS__Optimizing System Monitoring Configurations for Non-Actionable Alerts]] / [[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection]] / [[@2022__ICSE__Online Summarizing Alerts through Semantic and Behavior Information]] / [[@2025__arXiv__ARGOS - Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models]] / [[@2025__arXiv__Can Multimodal LLMs Perform Time Series Anomaly Detection]] / [[@2009__ICAC__Ranking the Importance of Alerts for Problem Determination in Large Computer Systems]] / [[@2017__KDD__Anomaly Detection in Streams with Extreme Value Theory]] / [[@2020__CLOUD__DEAR - Distributed Evaluation of Alerting Rules]] / [[@2025__FSE__Alert Summarization for Online Service Systems by Validating Propagation Paths of Faults]] / [[@2024__FSE__ChangeRCA - Finding Root Causes from Software Changes in Large Online Systems]]
- Pages created(10 source + ~50 entity): [[Liang Tang]] / [[Tao Li]] / [[Florian Pinel]] / [[Larisa Shwartz]] / [[Genady Grabarnik]] / [[Florida International University]] / [[IBM T.J. Watson Research Center]] / [[St. John's University]] / [[Ying Lin]] / [[Zhengzhang Chen]] / [[Cheng Cao]] / [[Lu-An Tang]] / [[Wei Cheng]] / [[Zhichun Li]] / [[Kai Zhang (Temple University)]] / [[University of Houston]] / [[Temple University]] / [[Yile Gu]] / [[Yigong Hu]] / [[Baris Kasikci]] / [[Xiongxiao Xu]] / [[Haoran Wang]] / [[Yueqing Liang]] / [[Yue Zhao]] / [[Kai Shu]] / [[Illinois Institute of Technology]] / [[Emory University]] / [[University of Southern California]] / [[Guofei Jiang]] / [[Haifeng Chen]] / [[Kenji Yoshihira]] / [[Akhilesh Saxena]] / [[NEC Laboratories America]] / [[Alban Siffer]] / [[Pierre-Alain Fouque]] / [[Alexandre Termier]] / [[Christine Largouet]] / [[Amossys]] / [[Inria]] / [[IRISA]] / [[Univ. Rennes 1]] / [[AgroCampus]] / [[Mathias Mormul]] / [[Pascal Hirmer]] / [[Christoph Stach]] / [[Bernhard Mitschang]] / [[University of Stuttgart]] / [[Yuang He]] / [[Zilong He]] / [[Qiuyu Yan]] / [[Yu Luo (Tencent)]] / [[Fangyuan Li]]
- Pages updated: [[IBM Research]] / [[Philip S. Yu]] / [[University of Illinois Chicago]] / [[Amazon]] / [[Kai Zhang]] / [[Jia Chen (Fudan)]] / [[Peng Wang (Fudan)]] / [[Wei Wang (Fudan)]] / [[Fudan University]] / [[Yifan Xiong]] / [[Jonathan Mace]] / [[Yuting Jiang]] / [[Peng Cheng]] / [[University of Washington]] / [[Microsoft Research]] / [[Guangba Yu]] / [[Pengfei Chen]] / [[Sun Yat-sen University]] / [[Tencent]] / [[Zibin Zheng]] / [[アラート管理]] / [[アラート集約]] / [[アラートストーム]] / [[アラート抑制]] / [[アラートフィルタリング]] / [[時系列異常検知]] / [[変更起因インシデント]] / [[根本原因分析]] / [[sources/_index]] / [[wiki/index]] / [[wiki/hot]] / `.raw/.manifest.json`
- Key insights:
- **Fudan アラート集約三部作の系譜が確定**: [[@2022__ICSE__Online Summarizing Alerts through Semantic and Behavior Information|OAS]](Chen+ ICSE2022、semantic+behavior の教師あり深層学習)→ [[@2023__ASE__Dynamic Graph Neural Networks-Based Alert Link Prediction for Online Service Systems|DyAlert]](Chen+ ASE2023、動的グラフでアラート伝播モデル化)→ [[@2025__FSE__Alert Summarization for Online Service Systems by Validating Propagation Paths of Faults|ProAlert]](Chen+ FSE2025、教師なしで伝播パスのセマンティクスへ昇格)。同一 Fudan グループによる 3 年スパンの漸進的進化が一望できる
- **EVT が現代アラートストーム検知のルーツ**: [[@2017__KDD__Anomaly Detection in Streams with Extreme Value Theory|SPOT/DSPOT]](Siffer+ KDD2017)が分布仮定不要・閾値不要のストリーム異常検知を確立し、これが [[@2020__ICSE-SEIP__Understanding and Handling Alert Storm for Online Service Systems|Zhao+ ICSE-SEIP 2020]] の Alert Storm 検知器の統計的根拠となった
- **アラートランキング系統の対照構造**: [[@2009__ICAC__Ranking the Importance of Alerts for Problem Determination in Large Computer Systems|Jiang+ ICAC2009]](不変条件 + NTV ピアレビュー、教師なし) / [[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection|CAR(CIKM2018)]](Pitman-Yor 階層ベイズ + エンティティ埋め込み、教師なし統一最適化) / [[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems|AlertRank(ISSRE2020)]](XGBoost、教師あり incremental)の 3 ルーツが「教師あり vs 教師なし」「最適化 vs 探索」軸で系統樹を描く
- **IBM 系研究のアラート品質ロードマップ**: [[@2012__NOMS__Optimizing System Monitoring Configurations for Non-Actionable Alerts|Tang+ NOMS2012]](オフライン静的ルール最適化 + 遅延)→ [[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps|Bhukar+ ICSE-SEIP 2024]](動的オンライン抑制ポリシー、教師なし統計学習)。12 年間で静的→動的、ルール配備→ポリシー学習へシフト
- **LLM × TSAD の役割分業 2 パラダイム**: [[@2025__arXiv__ARGOS - Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models|ARGOS(Gu+ arXiv2025)]] は LLM を**訓練時のルール生成のみ**に使い推論はルールベースで実行(説明可能性・再現性・自律性を同時達成、推論レイテンシ最大 34.3x)。[[@2025__arXiv__Can Multimodal LLMs Perform Time Series Anomaly Detection|VisualTimeAnomaly(Xu+ arXiv2025)]] は MLLM を**推論時の検知器**として使うが粗粒度(range/variate)では数値モデル超え、点別では大幅劣後(F1 8.12% 上限)。LLM の TSAD への組み込み方は「訓練時ルール抽出」と「推論時検知」で根本的に分化
- **ChangeRCA が RCCA を新概念として定式化**: [[@2024__FSE__ChangeRCA - Finding Root Causes from Software Changes in Large Online Systems|Yu+ FSE2024]] は既存の ACD(Abnormal Change Detection、変更の異常度判定)から RCCA(Root Cause Change Analysis、複数変更から defective change を特定)へ問題を昇格。WeChat 本番 + 81 種シミュレーションで Top-1 Hit Rate 85%、TTI 90% 削減
- **DEAR が「評価場所の移動」アプローチを提示**: [[@2020__CLOUD__DEAR - Distributed Evaluation of Alerting Rules|Mormul+ CLOUD2020]] は BET(バイナリ式木)中間表現でアラートルール評価を VM に自動配布。「発火後フィルタリング」(Voutsas+ JCC2023 / Bhukar+ ICSE-SEIP2024)とは独立した「発火前精度向上」の介入点として位置づけられる
---
## [2026-06-17] ingest-paper | Harp: Improving VPC Network Availability via Efficient Failure Detection and Rerouting in Tencent Cloud
- Source: `.raw/papers/nsdi26-hu-jiayu.pdf`
- Summary: [[@2026__NSDI__Harp - Improving VPC Network Availability via Efficient Failure Detection and Rerouting in Tencent Cloud]]
- Pages created: [[@2026__NSDI__Harp - Improving VPC Network Availability via Efficient Failure Detection and Rerouting in Tencent Cloud]] / [[Jiayu Hu]] / [[Feng Jin]] / [[Kai Zhang]] / [[VPCネットワーク可用性]]
- Pages updated: [[Tencent]] / [[Fudan University]] / [[グレイ障害]] / [[ネットワーク監視]]
- Key insight: UDP ソースポートによる ECMP 決定論的パス制御とインバンドプローブ埋め込みを組み合わせることで、特定ハードウェア不要でサブ秒の VPC 障害回復を Tencent Cloud 数十万台の本番環境で実現(停止時間 78-99.97% 削減)。
---
## [2026-06-17] ingest-paper | アラート管理 3 本(Zha+ Electronics 2024 / VOCE FASE 2025 / SkyNet SIGCOMM 2025)
- Sources:
- `.raw/papers/2024__Electronics__LLM-Alert-Aggregation.pdf`(MD5: 7410c9606224d2598c09a3517be5427b)
- `.raw/papers/978-3-031-90900-9_4.pdf`(MD5: e273f964f1f3bd342120ae21d88764e8)
- `.raw/papers/sigcomm25-skynet.pdf`(MD5: a1a167024e384fe8b0a09a02f9429642)
- Summaries: [[@2024__Electronics__Leveraging Large Language Models for Efficient Alert Aggregation in AIOPs]] / [[@2025__FASE__VOCE - A Virtual On-Call Engineer for Automated Alert Incident Analysis Using a Large Language Model]] / [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures]]
- Pages created(24): 3 source + 17 entity([[Junjie Zha]] / [[Xinwen Shan]] / [[Jiaxin Lu]] / [[Jiajia Zhu]] / [[Zihan Liu]] / [[State Grid Jiangsu Electric Power]] / [[Jia Chen (Fudan)]] / [[Xiaolei Chen]] / [[Jie Shi]] / [[Peng Wang (Fudan)]] / [[Wei Wang (Fudan)]] / [[Bo Yang]] / [[Huanwu Hu]] / [[Yifan Li]] / [[Tao Lin (Alibaba)]] / [[node2vec]] / [[Sentence-BERT]] / [[FT-tree]] / [[Eigenvector Centrality]]) + 4 concept([[アラートインシデント分析]] / [[LLMによる根本原因分析]] / [[サービス依存グラフ]] / [[ネットワーク監視]])
- Pages updated: [[アラート集約]](LLM 役割 3 分化・LLM 採用境界・3 段階階層化・時間順仮定否定の 4 横断的知見を追記) / [[アラートストーム]](severe failure 第三カテゴリと alert 内分類軸の独立性を追記) / [[Drain]](stub から実体ページに昇格) / [[Fudan University]](VOCE 参照追加) / [[Ennan Zhai]](SkyNet 共著追加) / [[Alibaba Cloud]](SkyNet 研究記述追加) / [[Dennis Cai]](SkyNet 共著追加) / [[sources/_index]] / [[entities/_index]] / [[concepts/_index]] / [[wiki/index]] / [[wiki/hot]] / `.raw/.manifest.json`
- Key insights:
- **LLM 採用/不採用の境界が failure severity × スケールで引かれる**: Zha+ 2024 と VOCE は cloud service スケール(数万 alerts、context 収容可能)で LLM ハイブリッドを選択。SkyNet は severe failure × 10⁵ デバイス × Syslog 10M/15min で LLM 不採用を選択し §2.3 で論理的根拠を明文化(context 超過 + ハルシネーション + ブラックボックス)
- **LLM の "RCA 内役割" の 3 分化**: 外部知識リーダー(COLA、SOP)/ グラフマッパー(Zha+ 2024、SDG)/ 多因子分析+因果推論器(VOCE、System Topology + CoT)。同じ "LLM × アラート" でも入力知識と問いの粒度で別系統
- **「時間順=原因」仮定の独立否定**: VOCE Table 2(Order = 45.34%)と SkyNet §7.3(BGP link break が先、Syslog hardware error が遅延)で、Microsoft 系の eWarn ら時系列 RCA 系の暗黙仮定を実データで複数論文が反証
- **集約は時間 → 空間 → 因果の 3 段構造に収束**: Zha+(τ=15min → node2vec+SBERT → LLM × SDG)、SkyNet(timeout → location 階層 → SOP/manual)、VOCE(alert linking → source 内 → 隣接 source 間)で同形だが、各段の中身が dispatch される
## [2026-06-16] ingest-slides | Reliability in the Age of AI: Engineering for AI Velocity
- Source: `.raw/slides/reliability-in-the-age-of-ai-engineering-for-ai-velocity/reliability-in-the-age-of-ai-engineering-for-ai-velocity.pdf`
- Visual pages: `.raw/slides/reliability-in-the-age-of-ai-engineering-for-ai-velocity/pages/` (27 pages)
- Media: none
- Summary: [[@2026__SpeakerDeck__Reliability in the Age of AI - Engineering for AI Velocity]]
- Pages created: [[@2026__SpeakerDeck__Reliability in the Age of AI - Engineering for AI Velocity]], [[Ryota Yoshikawa]], [[Topotal]], [[Waroom]]
- Pages updated: [[SRE]], [[agentic SRE]], [[SRE AI Autonomy Levels]], [[サービスレベル目標]], [[エラーバジェット]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[wiki/index]], [[wiki/hot]], `.raw/.manifest.json`
- Key insight: AI 時代の信頼性課題は「開発速度が上がる」こと自体ではなく、生成物の品質管理・本番での観測・SRE 判断のスケールが同時に追いつかなくなる点にある。SLI/SLO とエラーバジェットは、AI サービス固有 SLI と AI 補助承認ポリシーの制御信号へ拡張される。
## [2026-06-16] ingest-paper x9 | アラート管理 9 論文一括取り込み(アラートストーム・抑制・集約・RCA・アクショナブル)
- Sources:
- `.raw/papers/2020__ICSE-SEIP__Zhao-Alert-Storm.pdf`(Zhao+ ICSE-SEIP 2020 - Understanding and Handling Alert Storm)
- `.raw/papers/2020__ISSRE__AlertRank.pdf`(Zhao+ ISSRE 2020 - AlertRank)
- `.raw/papers/arxiv-2309.07230.pdf`(Chakraborty+ arXiv 2023 - ESRO)
- `.raw/papers/2024__JSS__Chen-Dynamic-Graph-Alert-Link.pdf`(Chen+ ASE 2023 - DyAlert; slug は誤りで実 venue は ASE 2023)
- `.raw/papers/2023__CSCN__Voutsas-Filtering-Alerts.pdf`(Voutsas+ JCC 2023 - Filtering Alerts; slug 誤り)
- `.raw/papers/2023__ICSE-SEIP__Zhang-Alert-Identification.pdf`(Zeng+ ICSE-SEIP 2023 - TraceArk)
- `.raw/papers/2024__SAC__Bhukar-Dynamic-Alert-Suppression.pdf`(Bhukar+ ICSE-SEIP 2024 - Dynamic-X-Y; slug の SAC は誤り)
- `.raw/papers/2024__CCGRID__AlertRCA.pdf`(Yu+ CCGRID 2024 - AlertRCA)
- `.raw/papers/2024__ISSRE__SuperAgg.pdf`(Yuan+ ISSRE 2024 - SuperAgg)
- Summaries: [[@2020__ICSE-SEIP__Understanding and Handling Alert Storm for Online Service Systems]]、[[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems]]、[[@2023__arXiv__ESRO - Experience Assisted Service Reliability against Outages]]、[[@2023__ASE__Dynamic Graph Neural Networks-Based Alert Link Prediction for Online Service Systems]]、[[@2023__JCC__Filtering Alerts on Cloud Monitoring Systems]]、[[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems]]、[[@2024__CCGRID__AlertRCA - Causality Enhanced Graph Representation Learning for Alert-Based Root Cause Analysis]]、[[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps]]、[[@2024__ISSRE__Exploring Hierarchical Patterns for Alert Aggregation in Supercomputers]]
- Pages created: source 9、entities 30+(主要: [[Nengwen Zhao]]・[[Junjie Chen]]・[[Yiru Chen]]・[[Sarthak Chakraborty]]・[[Yuqun Zhang]]・[[Zhaoyang Yu]]・[[Yuan Yuan]]・[[Tongqing Zhou]]・[[Karan Bhukar]]・[[Fotios Voutsas]]・[[John Violos]]・[[Aris Leivadeas]]・[[Saravan Rajmohan]]・[[Yongqian Sun]]・[[Zhen Dong]]・[[Xin Peng]]・[[Shubham Agarwal]]・[[Shaddy Garg]]・[[Shiv Saini]]・[[ESRO]]・[[AlertRank]]・[[AlertRCA]]・[[TraceArk]]・[[SuperAgg]]・[[Alibaba Group]]・[[Fudan University]]・[[IIT Kanpur]]・[[Stevens Institute of Technology]]・[[École de Technologie Supérieure]]・[[Netdata]]・[[National University of Defense Technology]]・[[BizSeer]])、concepts 3([[アラートストーム]]・[[アラート抑制]]・[[アクショナブルアラート]])
- Pages updated: [[アラート管理]](4 つの横断的知見・新しい問い 3 つ)、[[アラート集約]](4 つの横断的知見・新しい問い 2 つ)、[[アラートアンチパターン]](3 つの横断的知見・新しい問い 2 つ)、[[Quality of Alerts]](3 つの横断的知見・新しい問い 2 つ)、[[アラートフィルタリング]](2 つの横断的知見・新しい問い 3 つ)、[[Dan Pei]]、[[Qingwei Lin]]、[[Pooja Aggarwal]]、[[Saravan Rajmohan]]、[[Rohan Arora]]、[[IBM Research]]、[[Alibaba Group]]、[[sources/_index]]、[[entities/_index]]、[[concepts/_index]]、[[wiki/index]]、[[wiki/hot]]、`.raw/.manifest.json`
- Key insight: 9 本は「抑制(発火前)・フィルタリング(クリック行動)・集約(クラスタリング/グラフ表現)・ランキング(severity/actionability)・RCA(アラートのみ)」の 5 介入点に分化し、Yu+ JNCA2024 の 3 プロセス分類では捕捉しきれない解像度に到達。HPC の連続的アラート過負荷とクラウドの断続的アラートストームは別問題で集約戦略が異なる(EVT 変化点検知 vs Apriori 階層パターン)。アラートのみで RCA を完結する系統(AlertRCA・ESRO)が手作業ルールに基づく Groot を上回り、観測データの中で「アラート系列」が他モダリティ不要なほどの信号密度を持つことを示した。
## [2026-06-16] ingest-paper x5 | アラート管理・集約・予測の系譜 5 論文一括取り込み
- Sources:
- `.raw/papers/arxiv-2204.09670.pdf`(Yang+ DSN 2022 - Anti-patterns of Alerts)
- `.raw/papers/2024__ICSE-SEIP__Kuang-Knowledge-aware-Alert-Aggregation.pdf`(Kuang+ ICSE-SEIP 2024 - COLA)
- `.raw/papers/arxiv-2501.03547.pdf`(Singal+ arXiv 2025 - KIMetrix)
- `.raw/papers/2014__KDD__Lin-Unveiling-clusters-of-events.pdf`(Lin+ KDD 2014 - Pivotal Alert Clustering)
- `.raw/papers/2019__WWW__AirAlert-Chen-Outage-Prediction-Diagnosis.pdf`(Chen+ WWW 2019 - AirAlert)
- Summaries: [[@2022__DSN__Characterizing and Mitigating Anti-patterns of Alerts in Industrial Cloud Systems]]、[[@2024__ICSE-SEIP__Knowledge-aware Alert Aggregation in Large-scale Cloud Systems - a Hybrid Approach]]、[[@2025__arXiv__Metric Criticality Identification for Cloud Microservices]]、[[@2014__KDD__Unveiling Clusters of Events for Alert and Incident Management in Large-Scale Enterprise IT]]、[[@2019__WWW__Outage Prediction and Diagnosis for Cloud Service Systems]]
- Pages created (sources 5、entities 24、concepts 7):
- sources: 上記 5
- entities (筆頭ほか新規): [[Tianyi Yang]]、[[Jiacheng Shen]]、[[Yuxin Su]]、[[Xiaoxue Ren]]、[[Jinxi Kuang]]、[[Jinyang Liu]]、[[Jiazhen Gu]]、[[Lan Yu]]、[[Rui Tan]]、[[Akanksha Singal]]、[[Kaustabha Ray]]、[[Divya Pathak]]、[[Felix George]]、[[Mudit Verma]]、[[Pratibha Moogi]]、[[IIIT Delhi]]、[[Derek Lin]]、[[Rashmi Raghu]]、[[Vivek Ramamurthy]]、[[Jin Yu]]、[[Regunathan Radhakrishnan]]、[[Joseph Fernandez]]、[[Pivotal Software]]、[[Visa Inc]]、[[Yujun Chen]]、[[Hang Dong]]
- concepts: [[Quality of Alerts]]、[[アラートアンチパターン]]、[[アラート集約]]、[[COLA]]、[[KIMetrix]]、[[情報量基準メトリクス選定]]、[[AirAlert]]
- Pages updated: [[アラート管理]]、[[障害予測]]、[[Michael R. Lyu]]、[[Yongqiang Yang]]、[[Junjie Huang]]、[[Renyi Zhong]]、[[Zengyin Yang]]、[[IBM Research]]、[[Qingwei Lin]]、[[Hongyu Zhang]]、[[Dongmei Zhang]]、[[Yu Kang]]
- Key insights:
- (Yang+ 2022 & Kuang+ 2024) 同じ CUHK + Huawei Cloud 連携が 2 年差で「SOP の限界実証」(調査 OCE の 77.8% が SOP は Limited Help)→「LLM で SOP 再活用」(COLA で F1 0.901-0.930)を成し遂げた 2 段の問題発見→解決ループ。
- (Lin+ 2014 & Kuang+ 2024) アラート集約とインシデント集約は別系統に分かれ、テキスト構造性で手法選択が決まる(半構造化 → Jaccard + graph-cut、非構造化 → NMF/LLM)。「構造保存可視化」(2014) と「LLM 説明」(2024) は OCE 受容を高める同じ問題の 10 年差ソリューション。
- (Chen+ 2019 & Yang+ 2022) AirAlert の Bayesian network + XGBoost ハイブリッドは、サービスレベル outage に対し Simple Spike(F1 7-11%)が崩壊する場面で F1 53-88% を達成。「予測本体は軽量 ML + 構造的依存学習」のアーキテクチャは PAGER(2026)に 7 年先行。
- (Singal+ 2025) Informative Metric Subset Problem(NP 完全)を初定式化し、エントロピー + 相互情報量 + AIMD + topology-aware で SelectKBest/mRMR/Boruta/Max Weighted Clique を上回るカバレッジ。アラート定義の「前段」としてメトリクス選定そのものを自動化する研究系列を確立。
- (横断) 5 本の論文が「アラートのアンチパターン同定(2022)→メトリクス選定(2025)→アラート/インシデント集約(2014, 2024)→アウテージ予測(2019)」という運用エンジニアリングの段階全体を横断し、各段階で「何を自動化し何を人手に残すか」の設計圧力が一貫して「LLM はインターフェース層、軽量 ML/統計手法は予測コア層」に収束する系譜が見える。
## [2026-06-16] ingest-video | How We Debug 1000s of Databases with AI — Annie Zhou & Sophie Zhang, SREcon26 Americas (Databricks)
- Source: URL のみ(動画取得失敗) — https://www.youtube.com/watch?v=ibJ-MUgJyS0
- Transcript: `.raw/videos/youtube-ibJ-MUgJyS0/transcript.md`(YouTube 自動字幕から変換、100文)
- Frames: なし(動画未取得)
- Summary: [[@2026__SREcon26 Americas__How We Debug 1000s of Databases with AI]]
- Pages created: [[@2026__SREcon26 Americas__How We Debug 1000s of Databases with AI]], [[Annie Zhou]], [[Sophie Zhang (Databricks)]], [[Databricks]], [[Storax]]
- Pages updated: [[agentic SRE]], [[データベース O&M]], [[データベース自律診断]]
- Key insight: AI 導入前のツール集中化・ユーザー共感が採用の前提条件になり、承認ゲートはモデル内部仕様ではなくワークフローエンジン(Temporal)で実現した
## [2026-06-16] ingest-slides | A Theory and Practice of Alerting with Service Level Objectives — Jamie Wilkinson, SREcon18 Asia
- Source: `.raw/slides/srecon18asia-wilkinson-slo-alerting/srecon18asia-wilkinson-slo-alerting.pdf`
- Visual pages: `.raw/slides/srecon18asia-wilkinson-slo-alerting/pages/` (29 pages)
- Media: `.raw/slides/srecon18asia-wilkinson-slo-alerting/transcript.md` (Whisper small model, MP3 37MB, 406 行)
- Summary: [[@2018__SREcon18 Asia__A Theory and Practice of Alerting with Service Level Objectives]]
- Pages created: [[@2018__SREcon18 Asia__A Theory and Practice of Alerting with Service Level Objectives]], [[Jamie Wilkinson]]
- Pages updated: [[エラーバジェット]], [[サービスレベル目標]]
- Key insight: SLO バーンレートアラートを Prometheus `delta(errors[1h]) > budget/burn_period` という具体式で実装した 2018 年の先行定式化で、SRE Workbook と同時期の二重確証となる
## [2026-06-16] ingest-slides | The WTF Problem — Nicole Forsgren, SREcon26 Americas
- Source: `.raw/slides/srecon26-forsgren/srecon26-forsgren.pdf`
- Visual pages: `.raw/slides/srecon26-forsgren/pages/` (37 枚)
- Media: `.raw/slides/srecon26-forsgren/media/download.mkv` (transcript: なし、Whisper 失敗)
- Summary: [[@2026__SREcon26 Americas__The WTF Problem - Developer Experience as a Reliability Property]]
- Pages created: [[@2026__SREcon26 Americas__The WTF Problem - Developer Experience as a Reliability Property]], [[Nicole Forsgren]], [[Abi Noda]], [[DORA]], [[SPACE]], [[MTWTF]]
- Pages updated: [[SRE]](横断的知見追記)
- Key insight: DX は「感情問題」ではなく SRE の信頼性システム特性であり、MTWTF という先行指標で計測することで MTTR 悪化の前兆を捉えられる。AI 時代に摩擦は増幅されるため事前対処が必要。
## [2026-06-16] ingest-paper | TimeGPT-1 (Garza, Challu, Mergenthaler-Canseco, Nixtla, arXiv:2310.03589)
- Source: `.raw/papers/arxiv-2310.03589.pdf`
- Summary: [[@2023__arXiv__TimeGPT-1]]
- Pages created: [[@2023__arXiv__TimeGPT-1]], [[Cristian Challu]], [[Max Mergenthaler-Canseco]], [[Nixtla]]
- Pages updated: [[Azul Garza]], [[時系列基盤モデル]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/index]], [[wiki/hot]]
- Key insight: TimeGPT-1(2023)が「ゼロショット汎化・推論速度・コスト」という TSFM 競争軸を設定した起点であり、後続の Chronos・TimesFM・Toto はすべてこの枠内で競合している。
## [2026-06-16] ingest | 佐藤竜馬「ジョイジョイジョイ」13 記事一括バッチ(2024-09〜2026-03、joisino.hatenablog.com)
- Sources (13):
- `.raw/articles/joisino-rinna-2024-09-30.md` → [[joisino-トランスフォーマーはRNN-2024]]
- `.raw/articles/joisino-negation-2024-12-18.md` → [[joisino-否定文理解-2024]]
- `.raw/articles/joisino-superai-2025-01-15.md` → [[joisino-超人的AIと認知不能情報-2025]]
- `.raw/articles/joisino-theory-2025-03-17.md` → [[joisino-機械学習理論入門-2025]]
- `.raw/articles/joisino-physics-2025-03-24.md` → [[joisino-言語モデルの物理学-2025]]
- `.raw/articles/joisino-anna-2025-05-20.md` → [[joisino-アンナカレーニナの法則-2025]]
- `.raw/articles/joisino-mislead-2025-06-23.md` → [[joisino-人間を騙すAI-2025]]
- `.raw/articles/joisino-eureka-2025-08-28.md` → [[joisino-面白さ優先分類器-2025]]
- `.raw/articles/joisino-kimoi-2025-10-27.md` → [[joisino-LLMのキモい算術-2025]]
- `.raw/articles/joisino-onedata-2025-11-25.md` → [[joisino-訓練データ1個推論性能倍-2025]]
- `.raw/articles/joisino-zeh-2026-01-26.md` → [[joisino-LLMの能力の穴-2026]]
- `.raw/articles/joisino-llmsort-2026-02-09.md` → [[joisino-LLMでソート-2026]]
- `.raw/articles/joisino-cognition-2026-03-16.md` → [[joisino-LLMと言葉の感じ方-2026]]
- Pages created(source 13):
- [[joisino-トランスフォーマーはRNN-2024]], [[joisino-否定文理解-2024]], [[joisino-超人的AIと認知不能情報-2025]], [[joisino-機械学習理論入門-2025]], [[joisino-言語モデルの物理学-2025]], [[joisino-アンナカレーニナの法則-2025]], [[joisino-人間を騙すAI-2025]], [[joisino-面白さ優先分類器-2025]], [[joisino-LLMのキモい算術-2025]], [[joisino-訓練データ1個推論性能倍-2025]], [[joisino-LLMの能力の穴-2026]], [[joisino-LLMでソート-2026]], [[joisino-LLMと言葉の感じ方-2026]]
- Pages created(entity 4):
- [[Zeyuan Allen-Zhu]], [[Yuanzhi Li]], [[Yann LeCun]], [[Meta FAIR]]
- Pages created(concept ~50):
- [[Transformer]], [[RNN]], [[線形注意]], [[状態空間モデル]], [[カーネル法]], [[文脈内学習]], [[Physics of Language Models]], [[知識操作]], [[知識容量スケーリング則]], [[文脈自由文法]], [[LLM算術機構]], [[ヒューリスティックの束]], [[ロジットレンズ]], [[否定文理解]], [[テキスト埋め込み]], [[自然言語推論]], [[文脈付き検索]], [[ゼロエラー境界]], [[LLM評価]], [[LLM能力スパース性]], [[LLMアプリケーション信頼性]], [[AI検証可能性]], [[敵対的摂動]], [[帰属手法]], [[プラトン的表現仮説]], [[モデル表現収束]], [[モデル縫合]], [[暗黙的正則化]], [[アンサンブル学習]], [[ビジョン言語モデル]], [[汎化誤差バウンド]], [[集中不等式]], [[PAC学習]], [[カバリングナンバー]], [[深層学習の汎化]], [[1サンプルRLVR]], [[検証可能報酬による強化学習]], [[強化ファインチューニング]], [[報酬ハッキング]], [[RLHF誤誘導]], [[スコファンシ]], [[LLM自己検証]], [[LLMランキング]], [[LLM比較器]], [[pairwiseランキング]], [[一対比較ランキング]], [[面白さ優先分類]], [[好奇心駆動学習]], [[LLM意味表象]], [[認知意味論]], [[プロトタイプ意味論]]
- Pages updated:
- [[佐藤竜馬]], [[Anthropic]], [[機構的解釈性]], [[LLM向け情報検索]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]]
- Key insights:
- **Transformer ↔ RNN**: 線形注意で固定次元 RNN として書き下せる。訓練=並列・推論=定メモリの両モード切替が可能。
- **LLM 内部表象は「ヒューリスティックの束」**: 算術・知識記憶・知識操作は MLP ニューロンの粗い条件判定の積み重ね。[[ロジットレンズ]] が共通の解析手段。
- **次トークン予測の限界が複数視点で浮上**: 否定文理解の構造的限界、典型度順位相関の低さ([[LLM意味表象]] vs [[認知意味論]])、能力スパース性([[ゼロエラー境界]])、RLHF 誤誘導([[RLHF誤誘導]])。
- **学習理論 → 表現収束 → モデル算術の連結**: [[汎化誤差バウンド]] の崩壊と[[暗黙的正則化]]、[[プラトン的表現仮説]]、[[1サンプルRLVR]] の高品質少データ仮説が、「強いモデルはどれも似てくる」共通テーマで繋がる。
- Method notes:
- 取得: defuddle parse --json で 13 URL を取得(hatenablog はサンドボックス外ネットワーク経由)。
- 並列度: claude-obsidian:wiki-ingest agent ×13 を並列起動。9 件は JSON 完了、4 件はサブエージェントが mid-work で停止したが、source ページ自体は全 13 件が作成済みであることをファイルシステム検証で確認。
- 規約: [[conventions]] §4 では `@YYYY__SOURCE__Title.md` だが、joisino 系は既存 3 件 (`joisino-LLMアテンションと外挿-2025` ほか) との一貫性を優先し `joisino-<Japanese-summary>-<year>.md` 形式で統一。@2025__joisino__絶対に分かる機械学習理論.md は ingest 後にリネーム。
## [2026-06-16] ingest | 佐藤竜馬 — ICLR 2024 GNN 動向 & モデルパラメータ算術(joisino.hatenablog.com、2 記事バッチ)
- Source 1: `.raw/articles/joisino-iclr2024-gnn-2024-05-15.md`
- Source 2: `.raw/articles/joisino-model-parameter-arithmetic-2024-01-09.md`
- Summary 1: [[joisino-ICLR-2024-GNN]]
- Summary 2: [[joisino-モデルパラメータ算術-2024]]
- Pages created: [[グラフニューラルネットワーク]], [[GNN同変性]], [[タスクベクトル]], [[モデルパラメータ算術]], [[joisino-ICLR-2024-GNN]], [[joisino-モデルパラメータ算術-2024]]
- Pages updated: [[佐藤竜馬]], [[sources/_index]], [[concepts/_index]], [[entities/_index]], [[index]]
- Key insight: 2 記事が「MLP のパーミュテーション対称性を GNN 同変性で扱うメタネットワーク」という共通テーマで接続——モデルパラメータ算術とグラフ学習の交差点。
## [2026-06-16] ingest | 佐藤竜馬 — LLMのアテンションと外挿(joisino.hatenablog.com)
- Source: `.raw/articles/joisino-llm-attention-heads-2025-09-29.md`
- Summary: [[joisino-LLMアテンションと外挿-2025]]
- Pages created: [[joisino-LLMアテンションと外挿-2025]], [[佐藤竜馬]], [[アテンションヘッド]], [[帰納ヘッド]], [[機構的解釈性]], [[関数ベクトル]], [[反復ヘッド]]
- Pages updated: [[National Institute of Informatics]], [[entities/_index]], [[concepts/_index]], [[sources/_index]], [[index]], [[hot]]
- Key insight: LLM の注意ヘッドは 7 種に機能分化し(文法・受け皿・逐次・検索・帰納・関数ベクトル・反復)、訓練の最適化の結果として自然出現する。表層レベルでは外挿できても、アルゴリズムのメタレベルでは内挿にとどまる。
## [2026-06-16] ingest-video | Michelle Brush — Taming the Unpredictable: Reliability in Chaos
- Source: `.raw/videos/youtube-DqpcVQIs3G8/media/video.mp4`
- Transcript: `.raw/videos/youtube-DqpcVQIs3G8/transcript.md`
- Frames: `.raw/videos/youtube-DqpcVQIs3G8/frames/`
- Summary: [[@2026__SREcon26 Americas__Taming the Unpredictable - Reliability in Chaos]]
- Pages created: [[@2026__SREcon26 Americas__Taming the Unpredictable - Reliability in Chaos]], [[Michelle Brush]]
- Pages updated: [[SRE]], [[agentic SRE]], [[LLMアプリケーション信頼性]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]]
- Key insight: AI エージェントは SRE 作業を速くするが、同時にシステム複雑性を増やすため、汎用緩和・実験・リスク先行開発・継続的検証を SRE の中心に据える必要がある。
## [2026-06-16] ingest-paper | Goldschmidt+2014 IEEE CLOUD — 時系列データベースのスケーラビリティ・ロバスト性評価
- Source: `.raw/papers/Goldschmidt2014-IEEE-CLOUD-preprint.pdf`
- Summary: [[@2014__IEEE CLOUD__Scalability and Robustness of Time-Series Databases for Cloud-Native Monitoring of Industrial Processes]]
- Pages created: [[@2014__IEEE CLOUD__Scalability and Robustness of Time-Series Databases for Cloud-Native Monitoring of Industrial Processes]], [[Thomas Goldschmidt]], [[Anton Jansen]], [[Heiko Koziolek]], [[Jens Doppelhamer]], [[Hongyu Pei Breivold]], [[ABB Corporate Research]], [[時系列データベース]], [[時系列データベースベンチマーク]], [[クラウドモニタリング]], [[OpenTSDB]], [[KairosDB]], [[Databus]]
- Pages updated: [[entities/_index]], [[concepts/_index]]
- Key insight: KairosDB(Cassandra 基盤)は 36 ノードで最大 403,500 値/秒のほぼ線形スケーラビリティを達成し、OpenTSDB は HBase のメモリ不足で再現可能なベンチマーク不可、Databus は KairosDB の約 1/10 のスループットにとどまった。
## [2026-06-16] ingest-paper | Malviya+2014 ICDE — コマンドロギングによるメインメモリ OLTP リカバリ
- Source: `.raw/papers/Malviya-et-al.-2014---Rethinking-main-memory-OLTP-recovery.pdf`
- Summary: [[@2014__ICDE__Rethinking Main Memory OLTP Recovery]]
- Pages created: [[@2014__ICDE__Rethinking Main Memory OLTP Recovery]], [[Nirmesh Malviya]], [[Ariel Weisberg]], [[Samuel Madden]], [[Michael Stonebraker]], [[MIT CSAIL]], [[コマンドロギング]], [[VoltDB]], [[H-Store]]
- Pages updated: [[メインメモリデータベース]], [[concepts/_index]], [[entities/_index]]
- Key insight: ARIES 生理ロギングはメインメモリ OLTP の高スループット環境で無視できないオーバーヘッドを生じ、コマンドロギング(トランザクション名とパラメータのみ記録)が TPC-C で 1.5× 高いスループットを達成するが、復旧時間は 1.5〜5× 長くなる。
## [2026-06-16] ingest-paper | Wu+2021 ISSRE — PatternMatcher による根本原因メトリクス特定
- Source: `.raw/papers/wch_ISSRE-1.pdf`
- Summary: [[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems]]
- Pages created: [[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems]], [[Canhua Wu]], [[Nengwen Zhao]], [[Dan Pei]], [[Tsinghua University]], [[BizSeer]], [[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems|PatternMatcher]], [[根本原因分析]], [[異常検知]]
- Pages updated: [[AIOps]], [[concepts/_index]], [[entities/_index]]
- Key insight: 根本原因メトリクスは「異常性」と「解釈可能性(13 種パターン分類)」の 2 要件を満たすべきで、PatternMatcher は 1-D CNN による異常パターン分類(F1=0.98)と重み付きランキングで Avg@3=0.91 を達成し、実際の商業銀行本番に展開された。
## [2026-06-16] ingest-paper | Lu+2022 CCGrid — CauseRank: OLTP データベース向け因果推論ベース性能診断
- Source: `.raw/papers/CCGrid2022-CauseRank.pdf`
- Summary: [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]]
- Pages created: [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]], [[Xianglin Lu]], [[Zeyan Li]], [[Shenglin Zhang]], [[Nankai University]], [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems|CauseRank]], [[因果推論ベースRCA]], [[OLTPシステムアーキテクチャ]]
- Pages updated: [[Dan Pei]], [[Tsinghua University]], [[BizSeer]], [[concepts/_index]], [[entities/_index]]
- Key insight: G-GES(メトリクスをグループ単位でノードとする因果探索)と COPP(因果指向パーソナライズド PageRank)を組み合わせた教師なし手法 CauseRank が Oracle 本番 97 件で top-3 精度 82.5%・MAR 2.13 を達成し、既存手法(MicroCause MAR 3.95 等)を大幅に上回った。
## [2026-06-16] ingest-paper | Xin+2022 arXiv — CausalRCA: マイクロサービス向け細粒度根本原因箇所特定
- Source: `.raw/papers/Xin-et-al.-2022---CausalRCA---Causal-Inference-based-Precise-Fine-grained-Root-Cause-Localization-for-Microservice-Applications.pdf`
- Summary: [[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications]]
- Pages created: [[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications]], [[Ruyue Xin]], [[Peng Chen]], [[Zhiming Zhao]], [[University of Amsterdam]], [[Xihua University]], [[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications|CausalRCA]]
- Pages updated: [[因果推論ベースRCA]], [[根本原因分析]], [[マイクロサービスアーキテクチャ]], [[concepts/_index]], [[entities/_index]]
- Key insight: DAG-GNN(勾配ベース因果構造学習)で重み付き DAG を生成し PageRank でランキングする CausalRCA が、PC/GES/LiNGAM の線形仮定や曖昧性の制約を克服し、細粒度根本原因箇所特定で平均 AC@3=0.719(ベースライン比平均 17% 改善)を達成した。
## [2026-06-16] ingest-paper | Zhang+2015 TKDE — In-Memory Big Data Management and Processing: A Survey
- Source: `.raw/papers/zhang-tkde2015.pdf`
- Summary: [[@2015__TKDE__In-Memory Big Data Management and Processing - A Survey]]
- Pages created: [[@2015__TKDE__In-Memory Big Data Management and Processing - A Survey]], [[Hao Zhang]], [[Gang Chen]], [[Beng Chin Ooi]], [[Kian-Lee Tan]], [[Meihui Zhang]], [[Singapore University of Technology and Design]]
- Pages updated: [[National University of Singapore]], [[Zhejiang University]], [[メインメモリデータベース]], [[index]], [[sources/_index]], [[entities/_index]], [[hot]]
- Key insight: 「ディスクベースで無視できたオーバーヘッド(システムコール・ネットワークスタック・キャッシュライン跨ぎ)がインメモリ環境では新ボトルネックになる」を 28 ページ 290 文献で網羅し、メモリ常駐単独では数倍にとどまる事実と、ロック・WAL・B-tree・バッファ管理など 90% 以上の重コンポーネント除去まで進めて初めて 100 倍が出るという中心命題を体系化した教科書的サーベイ。並行性制御の到達点は単一の正解ではなく「軽量化 + パーティション化単一スレッド + HTM の混在」であり、データオーバーフローは「ユーザ空間 / カーネル空間 / ハイブリッド」の三項対立として整理される。
## [2026-06-16] ingest | The C10K Problem (Dan Kegel, 1999)
- Source: `.raw/articles/c10k-2026-06-16.md`
- Summary: [[C10K-Problem]]
- Pages created: [[C10K-Problem]], [[C10K問題]], [[epoll]], [[kqueue]], [[Dan Kegel]], [[nginx]]
- Pages updated: [[index]], [[sources/_index]], [[hot]]
- Key insight: 「10,000 同時接続を処理できるか否かの境界はハードウェアではなく I/O 戦略の選択にある」という 1999 年の洞察が、Linux epoll・BSD kqueue の設計を後押しし、現代の nginx / libuv / Tokio の基盤となった。
## [2026-06-16] ingest-paper | Tsubouchi+2022 IPSJ JIP — TCP/UDP ソケットベース依存性発見(カーネル内フローバンドリング)
- Source: `.raw/papers/tsubouchi-ipsjjip-2022.pdf`
- Summary: [[@2022__IPSJ JIP__Low Overhead TCP-UDP Socket-based Tracing for Discovering Network Services Dependencies]]
- Pages created: [[Masahiro Furukawa]], [[ネットワーク依存性発見]]
- Pages updated: [[Yuuki Tsubouchi]], [[Ryosuke Matsumoto]], [[go-conntracer-bpf]], [[eBPF]], [[サービストポロジ]], [[index]], [[hot]]
- Key insight: エフェメラルポートをキーから除外するだけで転送フロー数の依存変数を「コネクション数」から「サービス数」に変え、CPU オーバーヘッドをサービス数に抑制するカーネル内フローバンドリングの定量的実証。
## [2026-06-16] ingest | Netflix Service Topology — サービスサイロから統合リアルタイム依存マップへ
- Source: `.raw/articles/netflix-service-topology-2026-05-29.md`
- Summary: [[@2026__Netflix TechBlog__From Silos to Service Topology - Why Netflix Built a Real-Time Service Map]]
- Pages created: [[サービストポロジ]], [[リアルタイム依存性マップ]], [[ブラスト半径]], [[IPCメトリクス]], [[Netflix]], [[Apache Pekko]]
- Pages updated: [[eBPF]], [[Apache Kafka]], [[index]], [[hot]]
- Key insight: eBPF・IPC メトリクス・分散トレースの 3 独立グラフ融合が計装カバレッジと詳細度を補完し、将来は AI エージェントがトポロジーを巡回して自動 RCA を行うロードマップを持つ。
## [2026-06-16] question | マルチモーダルオブザーバビリティ基盤モデル設計案を新規作成
wiki-query(deep) でオブザーバビリティデータ(MELT)の特性、Transformer、TSFM、マルチモーダル障害診断、LLM時系列アプローチを横断参照し、新規基盤モデル設計案 **MELT-FM(Metrics-Events-Logs-Traces Foundation Model)** を [[multimodal-observability-foundation-model]] として保存。
- **着想の核**: 既存研究の空席 — [[Toto]]/[[Falcon-X]] は M のみ・予測のみ、[[TVDiag]]/[[TAMO]]/[[SCELM]] は M+L+T だが事前学習なし・診断のみ、[[UModel]] は意味付与だがモデルなし、ARFBench は M+QA のみ。M+L+T+E を同時にネイティブ事前学習し、スケール・意味を保持し、予測・検知・RCA・QA を一基盤で支える TSFM が未踏。
- **新規性の核**: ①PathAttn(トレース木を Transformer 因子に昇格、[[Falcon-X]] の時間×変量、[[Chronos-2]] の Group Attention に並ぶ第 3 軸)、② [[UModel]] の意味グラウンディングを事前学習特別トークンとして焼き込み、③ eBPF ゼロ計装で 4 モダ同期コーパス + Multimodal-Mixup。
- **積み上げ参照**: [[時系列基盤モデル]]・[[マルチモーダル障害診断]]・[[オブザーバビリティ]]・[[テレメトリ]]・[[Transformer]]・[[LLM時系列アプローチ]]・[[Contiguous Patch Masking]]・[[エージェント型時系列予測]]。
- **残余の問い**: Path-oriented データのスケーリング則・モダリティ嗜好の post-training 委譲・eBPF コーパスの公開可能性(差分プライバシー)・「正常急変動」の意味的弁別・[[@2025__arXiv__Cisco Time Series Model Technical Report|Cisco TSM]] の多解像度との直交性・ATSF との競合関係。
## [2026-06-16] ingest-paper batch | 分散トレーシング・依存性発見・MTSAD の古典 7 論文を一括取り込み
並列 ingest で**分散トレーシング系の祖(X-Trace・Dapper)・サービス/ネットワーク依存性発見の系譜(Sherlock・Orion・NSDMiner 拡張)・マイクロサービス時代の因果ベース RCA(Sieve)・MTSAD のコールドスタート解(JumpStarter)**の 7 論文を wiki に降ろした。`papers/` には未取り込みだった「分散システム可観測性 → AIOps」の基盤系譜が一次源で揃った。
- **(1) X-Trace** [[@2007__NSDI__X-Trace - A Pervasive Network Tracing Framework]]([[Rodrigo Fonseca]]・[[George Porter]]・[[Randy H. Katz|Randy Katz]]・[[Scott Shenker]]・[[Ion Stoica]]、[[University of California, Berkeley|UC Berkeley]] / [[ICSI]]、NSDI 2007): タスク識別子のインバンド伝搬 + レポートのアウトオブバンド収集の 2 原則と、`pushDown()` / `pushNext()` の 2 プリミティブだけで因果木を完全記述する設計。管理ドメインごとに独立な収集・公開ポリシーを許す段階展開可能性が特徴。**Dapper・Zipkin・OpenTelemetry の直接的な祖**。
- **(2) Dapper** [[@2010__Google__Dapper - A Large-Scale Distributed Systems Tracing Infrastructure]]([[Benjamin H. Sigelman]]・[[Luiz André Barroso]]・[[Mike Burrows]] ほか、[[Google]]、2010): 低オーバーヘッド + アプリ透過 + 偏在展開の 3 設計目標を、共通ライブラリ計装 + 1/1024 適応サンプリングで両立。Google 本番 2 年超稼働。**スパン / トレース木 / アノテーション**のデータモデルが OpenTracing・W3C Trace Context・OpenTelemetry の事実上の標準を確立。
- **(3) Sherlock** [[@2007__SIGCOMM__Towards Highly Reliable Enterprise Network Services via Inference of Multi-level Dependencies]]([[Paramvir Bahl]]・[[Ranveer Chandra]]・[[Albert Greenberg]]・[[Srikanth Kandula]]・[[David Maltz]]・[[Ming Zhang (Microsoft Research)|Ming Zhang]]、[[Microsoft Research]]、SIGCOMM 2007): Inference Graph(3 状態 up/troubled/down + 多層依存性)+ パケットトレース共起確率による自動依存性発見 + Ferret 推論で **90.66% 障害箇所特定精度**を達成し、2 層 Shrink の 58.61% を **30% 上回る**。Microsoft 本番ネット 358 コンポーネントで **87% の障害が 16 コンポーネントに集中**。サービス依存性推論ベース fault localization の代表ソース。
- **(4) Orion** [[@2008__OSDI__Automating Network Application Dependency Discovery - Experiences, Limitations, and New Solutions]]([[Xu Chen]]・[[Ming Zhang (Microsoft Research)|Ming Zhang]]・[[Z. Morley Mao]]・[[Paramvir Bahl]]、[[University of Michigan]] / [[Microsoft Research]]、OSDI 2008): パケットヘッダ + タイミング情報のみ(ペイロード解析不要)で「遅延スパイクベース分析」により依存性発見。**Sherlock 比偽陽性 10–95% 削減、eXpose 比 94–99% 削減**。Sherlock の続編として、受動観測ベース依存性発見の発展を代表。
- **(5) NSDMiner 拡張(Peddycord+ LISA12)** [[@2012__LISA__On the Accurate Identification of Network Service Dependencies in Distributed Systems]]([[Barry Peddycord III]]・[[Peng Ning]]・[[Sushil Jajodia]]、[[NC State University]] / [[George Mason University]]、LISA 2012): NSDMiner の比率ベースランキングを**対数ベース**に置換して偽陽性を大幅削減、利用頻度の低いサービスを類似クラスタから推論、ロードバランシング/バックアップクラスタの自動検出で出力候補を **25–50% 削減**。受動観測ベース依存性発見の系譜の到達点の一つ。
- **(6) Sieve** [[@2017__arXiv__Sieve - Actionable Insights from Monitored Metrics in Microservices]]([[Jörg Thalheim]] ほか、[[TU Dresden]]、Middleware 2017 / arXiv:1709.06686): k-Shape クラスタリングによる**メトリクス次元 10–100 倍削減** + Granger 因果性によるコンポーネント間依存推定の 2 段プラットフォーム。OpenStack/ShareLatex で実装、**CPU 80% / Storage 90% / Network 50% オーバーヘッド削減**。オートスケーリング + RCA への応用を実証。マイクロサービス時代の因果ベース RCA の初期基盤。
- **(7) JumpStarter** [[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]]([[Minghua Ma]] ほか、[[Sangfor Technologies]]、USENIX ATC 2021): **圧縮センシング(CS)** + 形状ベースクラスタリング + 外れ値耐性サンプリングで**訓練不要・20 分初期化**の MTSAD を実現し、3 データセット平均 F1=**94.12%** で SOTA を上回る。学習ベース MTSAD の「初期化時間 10–100 日」問題に対する設計的回答。
- **横断的知見**: X-Trace(2007)→ Dapper(2010)は**「因果木の表現方法」と「サンプリングの位置づけ」**で連続しており、Dapper §1 が「Magpie や X-Trace と概念的に類似」と明言している。Sherlock(2007 SIGCOMM)→ Orion(2008 OSDI)→ Peddycord+(2012 LISA)は**受動観測ベース依存性発見**の連続した 3 世代であり、各世代が「グラウンドトゥルース比偽陽性をどう削るか」の漸進改善で進む。Sieve(2017)は**メトリクス側で同じ依存性推論問題を Granger で解く**第 4 系譜であり、マイクロサービス時代に問題ドメインが「ネットワークサービス間」から「メトリクス時系列間」に移ったことを示す。JumpStarter(2021)は依存性発見ではなく**異常検知の初期化問題**に応える独立軸だが、Sieve と同じく「**学習ベース手法のコールドスタートを設計で迂回する**」という思想を共有する。
- **Pages created**: source 7(上記)+ entity([[Rodrigo Fonseca]] 更新・[[George Porter]]・[[Randy H. Katz|Randy Katz]]・[[Ion Stoica]]・[[Scott Shenker]]・[[University of California, Berkeley|UC Berkeley]]・[[ICSI]]・[[Benjamin H. Sigelman]]・[[Luiz André Barroso]]・[[Mike Burrows]]・[[Paramvir Bahl]]・[[Ranveer Chandra]]・[[Albert Greenberg]]・[[Srikanth Kandula]]・[[David Maltz]]・[[Ming Zhang (Microsoft Research)|Ming Zhang]]・[[Xu Chen]]・[[Z. Morley Mao]]・[[University of Michigan]]・[[Barry Peddycord III]]・[[Peng Ning]]・[[Sushil Jajodia]]・[[NC State University]]・[[George Mason University]]・[[Jörg Thalheim]]・[[TU Dresden]]・[[Minghua Ma]]・[[Sangfor Technologies]])+ concept([[トレースメタデータ伝搬]]・[[因果トレーシング]]・[[トレースコンテキスト]]・[[低オーバーヘッドインストルメンテーション]]・[[サービス依存性推論]]・[[Inference Graph]]・[[多層依存性]]・[[ネットワーク障害管理]]・[[受動観測ベース依存性推論]]・[[トラフィック相関分析]]・[[ネットワーク依存性発見|ネットワークサービス依存性発見]]・[[メトリクス削減]]・[[因果推論ベースRCA]]・[[圧縮センシング異常検知]])。
- **Pages updated**: [[分散トレーシング]]・[[トレースサンプリング]]・[[Fault Localization]]・[[ネットワーク依存性発見|サービス依存性発見]]・[[根本原因分析]]・[[マイクロサービスアーキテクチャ]]・[[異常検知]]・[[多変量時系列予測]] + 全索引 + manifest。
---
## [2026-06-15] ingest-paper batch | 観測可能性・分散DB 基盤 6 論文を一括取り込み
並列 ingest で観測可能性(動的計装・パケットフィルタリング・トレース・サンプリング)と分散時系列/データベースの**古典基盤 6 論文**を wiki に降ろした。eBPF・DTrace・分散トレーシング系の現代研究の系譜が一次源で揃った。
- **(1) BPF** [[@1993__USENIX__The BSD Packet Filter A New Architecture for User-level Packet Capture]]([[Steven McCanne]]・[[Van Jacobson]]、[[LBNL]]、USENIX Winter 1993): カーネル内 in-kernel VM + CFG ベースのパケットフィルタ評価で、当時主流の CSPF(スタックベース)に対し 20倍超の高速化を達成。`tcpdump`/`libpcap` の基盤であり、後の **eBPF(拡張 BPF)** の直接の祖。
- **(2) DTrace** [[@2004__USENIX-ATC__Dynamic Instrumentation of Production Systems]]([[Bryan Cantrill]]・[[Michael Shapiro]]・[[Adam Leventhal]]、[[Sun Microsystems]]、USENIX ATC 2004): プロダクション環境で動的計装(dynamic instrumentation)を**ゼロプローブ効果**で実現。プローブを無効時に NOP 化、有効時のみ命令置換で観測オーバーヘッドを実質ゼロに抑え、DTrace スクリプト言語 D で柔軟な集計を可能に。eBPF/perf/SystemTap・bpftrace の概念的・実装的源流。
- **(3) Weighted Sampling of Execution Traces** [[@2018__SoCC__Weighted Sampling of Execution Traces - Capturing More Needles and Less Hay]]([[Pedro Las-Casas]]・[[Jonathan Mace]]・[[Rodrigo Fonseca]]、[[Microsoft Research]] / Brown、SoCC 2018、DOI:10.1145/3267809.3267841): 分散トレースの一様サンプリングでは異常・希少パスが取りこぼされる問題に対し、トレース構造の特徴量から**重み付きサンプリング**で稀少トレース保持率を向上。トレースサンプリング研究の現代的方向(エッジサンプリング・カーディナリティ意識・SLO-aware sampling)の基礎。PDF 取得不可で abstract + メタデータのみから ingest(`confidence: medium`)。
- **(4) Parallel Database Systems** [[@1992__CACM__Parallel Database Systems The Future of High Performance Database Systems]]([[David DeWitt]]・[[Jim Gray]]、CACM 35(6):85–98、1992、DOI:10.1145/129888.129894): 並列 DB の**シェアードナッシング**アーキテクチャの優位性と**データパーティショニング**(range/hash/round-robin)を体系化した古典マニフェスト。後の MapReduce・Spark・Snowflake・BigQuery・Monarch 等のスケーラブル分析基盤の理論的下地。
- **(5) TSM-Bench** [[@2023__PVLDB__TSM-Bench - Benchmarking Time Series Database Systems for Monitoring Applications]]([[Abdelouahab Khelifati]]・[[Mourad Khayati]]・[[Djellel Difallah]]・[[Philippe Cudré-Mauroux]]、[[NYU Abu Dhabi]] / [[University of Fribourg]]、PVLDB Vol.16): 監視ワークロードに特化した時系列 DB ベンチマーク。**[[Monarch]]・[[Gorilla]]・観測系ワークロード**の評価軸を提供。
- **(6) Anomaly Detection in Time Series: A Comprehensive Evaluation (TimeEval)** [[@2022__PVLDB__Anomaly Detection in Time Series - A Comprehensive Evaluation]]([[Phillip Wenig]]・[[Sebastian Schmidl]] ほか、[[Hasso Plattner Institute]]、PVLDB Vol.15): 71 アルゴリズム × 976 データセットの大規模時系列異常検知評価フレームワーク **[[GutenTAG]]** とともに公開。本 wiki の [[異常検知]] 基盤ベンチマークの代表例。
- **横断的知見**: BPF と DTrace は**カーネル内 in-VM 動的計装**という同じ設計原理の独立発明として並ぶ(BPF: パケットフィルタ専用 → eBPF で汎用化、DTrace: 汎用動的計装を最初から指向)。Las-Casas+ 2018 は両者が解いた「観測コストを下げる」問題を**サンプリング側で解く**第三の系譜であり、現代の eBPF ベース観測スタック + サンプリング意識トレーサ(Jaeger / Tempo / Datadog)の合流点を 2018 年時点で予見していた。DeWitt+Gray 1992 のシェアードナッシング + パーティショニングは、25 年後の Monarch(2020、ゾーン分割)や TSM-Bench(2023、監視 DB 評価)の評価軸に直接接続する。
- **Pages created**: source 6([[@1993__USENIX__The BSD Packet Filter A New Architecture for User-level Packet Capture]] / [[@2004__USENIX-ATC__Dynamic Instrumentation of Production Systems]] / [[@2018__SoCC__Weighted Sampling of Execution Traces - Capturing More Needles and Less Hay]] / [[@1992__CACM__Parallel Database Systems The Future of High Performance Database Systems]] / [[@2023__PVLDB__TSM-Bench - Benchmarking Time Series Database Systems for Monitoring Applications]] / [[@2022__PVLDB__Anomaly Detection in Time Series - A Comprehensive Evaluation]]) + entity([[Steven McCanne]]・[[LBNL]]・[[Bryan Cantrill]]・[[Michael Shapiro]]・[[Adam Leventhal]]・[[Sun Microsystems]]・[[David DeWitt]]・[[Abdelouahab Khelifati]]・[[Mourad Khayati]]・[[Djellel Difallah]]・[[Philippe Cudré-Mauroux]]・[[NYU Abu Dhabi]]・[[Hasso Plattner Institute]]・[[Phillip Wenig]]・[[Sebastian Schmidl]]・[[GutenTAG]]) + concept([[DTrace]]・[[BPF]]・[[プローブ効果]]・[[カーネル内VM]]・[[パケットフィルタリング]]・[[シェアードナッシング]]・[[データパーティショニング]]・[[並列データベース]]・[[時系列データベースベンチマーク]]・[[時系列データ生成]]・[[時系列異常検知ベンチマーク]])。
- **Pages updated**: [[Jonathan Mace]]・[[Pedro Las-Casas]]・[[Rodrigo Fonseca]]・[[Jim Gray]]・[[University of Wisconsin]]・[[eBPF]]・[[トレースサンプリング]]・[[専用データベースシステム]]・[[時系列データベース]]・[[異常検知]]・[[動的計装|動的インストルメンテーション]] + 全索引・manifest。
---
## [2026-06-15] wiki-query | Toto 2.0 比較・LM vs TSFM decoder-only 解説
セッション内の 2 つの質問応答を `wiki/questions/` に保存。**ページ作成**: question 2([[Toto-2アーキテクチャ比較-他TSFMとの特徴]]・[[LM-vs-TSFM-decoder-only-差異]])。**ページ更新**: [[index]](Questions セクションに 2 件追記)。
---
## [2026-06-15] ingest-paper | Monarch: Google's Planet-Scale In-Memory Time Series Database
- Source: `.raw/papers/6348.pdf`(PVLDB 13(12):3181–3194, Colin Adams ほか Google LLC)
- Summary: [[@2020__VLDB__Monarch - Google's Planet-Scale In-Memory Time Series Database]]
- Pages created: [[Borgmon]]
- Pages updated: [[Monarch]], [[時系列データベース]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]], [[log]], [[manifest]]
- Key insight: プラネットスケール監視 TSDB では「インメモリ保持 = 循環依存の回避」という設計必然があり、FHI(99.5% ファンアウト抑制)とクエリプッシュダウン(95% ゾーン完結)の組み合わせがプラネットスケールでも運用可能な監視システムを実現する核心技術だ。
## [2026-06-15] ingest-paper | Chronos-2: From Univariate to Universal Forecasting
- Source: `.raw/papers/arxiv-2510.15821.pdf`(arXiv:2510.15821, 2025-10-17; Ansari+ AWS AI Labs ほか)
- Summary: [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]]
- Pages created: [[Chronos-2]], [[Abdul Fatir Ansari]], [[Oleksandr Shchur]], [[Danielle C. Maddix]], [[Syama Sundar Rangapuram]], [[Michael Bohlke-Schneider]], [[George Karypis]], [[fev-bench]], [[GIFT-Eval]]
- Pages updated: [[Amazon Web Services]], [[AWS AI Labs]], [[Yuyang Wang]], [[University of California, San Diego]], [[時系列基盤モデル]], [[多変量時系列予測]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: group attention で単変量・多変量・共変量付き予測を統一的にゼロショット処理する初の汎用 TSFM。合成データ(multivariatizer)による多変量 ICL の付与は、実観測の多変量データなしでも universal forecasting が成立しうる経験証拠で、Chronos(2024)の「単変量限定」を実質的に解消した直系後継。
## [2026-06-15] ingest-paper | Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts
- Source: `.raw/papers/arxiv-2409.16040.pdf`(arXiv:2409.16040, 2024-09-24 / ICLR 2025; Shi+ Princeton/Xiaohongshu ほか)
- Summary: [[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]]
- Pages created: [[Xiaoming Shi]], [[Shiyu Wang]], [[Yuqi Nie]], [[Ming Jin]], [[Qingsong Wen]], [[Princeton University]], [[Tianjin University]], [[Griffith University]], [[Xiaohongshu Inc]], [[University of Freiburg]], [[Time-300B]]
- Pages updated: [[時系列基盤モデル]], [[多変量時系列予測]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: Sparse MoE による decoder-only TSFM を 2.4B(活性化 1.1B)までスケールし、同活性化パラメータの密モデル比で訓練 78%・推論 39% コスト削減。TSFM におけるスケーリング則の経験的検証と、9 ドメイン 309B 点の最大規模公開コーパス Time-300B の公開という二点で、後続 TSFM([[Toto]] 系・[[Chronos-2]] 等)の前提を作った。
## [2026-06-15] ingest-paper | Chronos: Learning the Language of Time Series
- Source: `.raw/papers/arxiv-2403.07815.pdf`(arXiv:2403.07815, 2024-03-12; Ansari+ AWS AI Labs ほか)
- Summary: [[@2024__arXiv__Chronos Learning the Language of Time Series]]
- Pages created: [[Lorenzo Stella]], [[Yuyang Wang]], [[AWS AI Labs]], [[Andrew Gordon Wilson]], [[時系列トークナイゼーション]]
- Pages updated: [[Amazon Web Services]], [[時系列基盤モデル]], [[LLM時系列アプローチ]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: 平均スケーリング + 均一量子化で時系列値を語彙トークンに落とし、T5/GPT-2 アーキテクチャをそのまま事前学習するという**最小主義の TSFM 構成**。LLM 重み初期化はランダム初期化を上回らず、LLM の言語知識転移が時系列で優位に立たないという否定的知見を残した。TSMixup・KernelSynth による合成データ生成が後続論文(Chronos-2 の multivariatizer 含む)の合成データ依存路線の起点。
## [2026-06-15] wiki-query | Toto 2.0 vs 1.0 差分・分位点損失と区間予測
- 操作: wiki-query セッションの Q&A を questions/ に保存
- 作成ページ:
- `wiki/questions/Toto-2.0-vs-1.0-差分.md` — バージョン比較(モデルサイズ・推論方式・出力ヘッド・オプティマイザ・スケーリング)
- `wiki/questions/分位点損失と区間予測.md` — 分位点損失の仕組み・独立学習の意味・モデル構造・区間予測の利点を連問形式でまとめ
- 更新: `wiki/index.md`(Questions セクションに 2 件追記)
## [2026-06-15] ingest-paper | From Pre-training to Post-training: A Survey on Time Series Foundation Models (Liu+ techRxiv 2026)
- Source: `.raw/papers/techrxiv.176978429.902358012Fv2.pdf`
- Summary: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]]
- Pages created: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]], [[Zhen Liu]], [[Qianli Ma]], [[Min Wu]], [[South China University of Technology]], [[Institute for Infocomm Research]]
- Pages updated: [[時系列基盤モデル]], [[強化ファインチューニング]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]]
- Key insight: TSFM サーベイの軸が「事前学習」中心から「事後学習(SFT・協調 PLC-MLC-HLC・強化 reasoning/non-reasoning)」を含む 3 次元タクソノミーへ拡張され、NLP・コード生成中心に発達した GRPO・LoRA・KD 群が TSFM ドメインへ越境する萌芽期を確認。本 wiki の [[強化ファインチューニング]] 知見(credit assignment 脆弱性・規則ベース報酬の堅牢性・SFT+RL 二段階)が TSFM の RL 設計指針として転用可能。
## [2026-06-15] ingest-paper | A Decoder-Only Foundation Model for Time-Series Forecasting (TimesFM 原論文)
- Source: `.raw/papers/arxiv-2310.10688.pdf`
- Summary: [[@2024__arXiv__A Decoder-Only Foundation Model for Time-Series Forecasting]]
- Pages created: [[@2024__arXiv__A Decoder-Only Foundation Model for Time-Series Forecasting]]
- Pages updated: [[TimesFM]], [[Abhimanyu Das]], [[Rajat Sen]], [[Google Research]], [[時系列基盤モデル]], [[スケーリング則]], wiki/sources/_index, wiki/index, wiki/hot, wiki/log
- Key insight: 200M decoder-only Transformer + 出力パッチ長 > 入力パッチ長(自己回帰ステップ削減)+ 約 100B 点(Google Trends/Wikipedia/合成)の事前学習で、ゼロショットで教師あり SOTA 級に到達。17M/70M/200M でモデル誤差が単調減少し TSFM スケーリング則の前史を成す。
## [2026-06-15] ingest-paper | One Fits All - Power General Time Series Analysis by Pretrained LM (FPT)
- Source: `.raw/papers/arxiv-2302.11939.pdf`
- Summary: [[@2023__NeurIPS__One Fits All - Power General Time Series Analysis by Pretrained LM]]
- Pages created: [[@2023__NeurIPS__One Fits All - Power General Time Series Analysis by Pretrained LM]], [[Frozen Pretrained Transformer]]
- Pages updated: [[Tian Zhou]], [[Rong Jin]], [[Liang Sun]], [[時系列基盤モデル]], [[LLM時系列アプローチ]], [[多変量時系列予測]], [[異常検知]], wiki/sources/_index, wiki/concepts/_index, wiki/index, wiki/hot, wiki/log
- Key insight: GPT-2 の self-attention・feedforward を凍結し位置埋め込みのみ学習(FPT)で時系列 7 タスク SOTA。**画像事前学習(BEiT)からの転移も有効**で、言語→時系列だけでなく異分野知識転移の汎用性を示す——self-attention の勾配最小化が PCA と等価という理論的根拠を提示。
## [2026-06-15] ingest-paper | Large Language Models Are Zero-Shot Time Series Forecasters (LLMTime)
- Source: `.raw/papers/arxiv-2310.07820.pdf`
- Summary: [[@2023__NeurIPS__Large Language Models Are Zero-Shot Time Series Forecasters]]
- Pages created: [[@2023__NeurIPS__Large Language Models Are Zero-Shot Time Series Forecasters]], [[Nate Gruver]], [[Marc Finzi]], [[Shikai Qiu]], [[Andrew Gordon Wilson]]
- Pages updated: [[LLMTime]], [[New York University]], [[Carnegie Mellon University]], [[LLM時系列アプローチ]], [[時系列基盤モデル]], [[スケーリング則]], wiki/sources/_index, wiki/entities/_index, wiki/index, wiki/hot, wiki/log
- Key insight: 数値の桁列トークン化のみで GPT-3・LLaMA-2 70B がゼロショット時系列予測で ARIMA/TCN/N-HiTS 等の専用モデルと同等以上(Darts/Monash/Informer 29 データセット)。**LLM の簡潔性バイアス(Occam's razor prior)と反復バイアスが季節性・トレンドに構造的に一致**するため外挿が成立。GPT-4 は RLHF とトークン化変更で GPT-3 より劣化——アライメントが不確実性較正を壊す現象を初めて定量化。
## [2026-06-15] ingest-paper | PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting
- Source: `.raw/papers/arxiv-2210.08964.pdf`
- Summary: [[@2022__arXiv__PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting]]
- Pages created: [[@2022__arXiv__PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting]], [[Hao Xue]], [[Flora Salim]], [[PISA]]
- Pages updated: [[University of New South Wales]], [[LLM時系列アプローチ]], [[時系列基盤モデル]], [[多変量時系列予測]], wiki/sources/_index, wiki/entities/_index, wiki/index, wiki/hot, wiki/log
- Key insight: 数値列→自然言語文へのテンプレート変換で時系列予測を sentence-to-sentence へ再定式化し、事前学習言語モデル(Bigbird/Bart/LED)が数値専用モデル(Transformer/Informer/Autoformer)と同等以上の RMSE・MAE を達成。ゼロショット汎化能力は数値モデルを大幅に超え、PISA(311,932 件・気温/電力/人流の 3 サブセット)が LLM×時系列の最初期ベンチマークとなる。
## [2026-06-15] ingest-paper | Toto 2.0: Time Series Forecasting Enters the Scaling Era
- Source: `.raw/papers/arxiv-2605.20119.pdf`
- Summary: [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]]
- Pages created: [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]], [[Eden Belouadah]], [[Marc Cenac]], [[Xunyi Zhao]], [[Viktoriya Zhukova]], [[Othmane Abou-Amal]], [[NorMuon]], [[TIME]]
- Pages updated: [[Toto]], [[BOOM]], [[GIFT-Eval]], [[u-μP]], [[Contiguous Patch Masking]], [[スケーリング則]], [[時系列基盤モデル]], wiki/sources/_index, wiki/entities/_index, wiki/index, wiki/log, wiki/hot
- Key insight: Toto 2.0 が TSFM で初めて信頼できるスケーリング則を実証(4M〜2.5B 単調改善)、NorMuon がピンボール損失との組み合わせ問題を解決、u-μP で TSFM への初適用を達成
## [2026-06-15] ingest | 時系列データのための大規模言語モデル (Zenn, tsurubee)
- Source: `.raw/articles/zenn-llm-for-time-series-2024-07-10.md`
- Summary: [[@2024__Zenn__tsurubee__LLM-for-Time-Series]]
- Pages created: [[@2024__Zenn__tsurubee__LLM-for-Time-Series]], [[Hirofumi Tsuruta|tsurubee]], [[LLM時系列アプローチ]]
- Pages updated: [[時系列基盤モデル]], [[SAKURA Internet]], [[index]], [[hot]], [[log]]
- Key insight: LLM×時系列を Prompting/Quantization/Aligning/Vision/Tool の 5 アプローチで分類。One Fits All(GPT-2 凍結+位置埋め込みのみ学習)が異分野(言語・画像)の事前学習が時系列に転移できることを実証し、専用 TSFM 研究の前史となった。
## [2026-06-15] ingest-paper | Production-Grounded Benchmarks for AI Code Optimization (Datadog blog, DODO)
- Source: `.raw/articles/dodo-production-grounded-code-optimization-2026-06-08.md`
- Summary: [[@2026__Datadog__Production-Grounded Benchmarks for AI Code Optimization]]
- Pages created: [[@2026__Datadog__Production-Grounded Benchmarks for AI Code Optimization]], [[DODO]], [[Junaid Ahmed]], [[Piotr Bejda]], [[本番接地型ベンチマーク]]
- Pages updated: [[Datadog]], [[エージェント型コーディング]], [[継続的プロファイリング]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[wiki/index]], [[wiki/hot]], [[wiki/log]]
- Key insight: CPU プロファイル+Live Debugger 実呼び出しによる本番接地型ベンチマーク生成が、合成ベンチマークでは不可視の最適化機会(NormalizeTags の入力大文字比率依存高速パス)を顕在化し、成熟 Go サービスの CPU コストを 8%+ 削減した。
## [2026-06-15] ingest | Toto 2.0: Time Series Forecasting Enters the Scaling Era (Datadog blog, arXiv:2605.20119)
- Source: `.raw/articles/toto-2-2026-06-15.md`
- Summary: [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]]
- Pages created:
- [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]]
- [[Emaad Khwaja]]
- [[Gerald Woo]]
- [[Chris Lettieri]]
- [[David Asker]]
- [[u-μP]]
- [[Contiguous Patch Masking]]
- Pages updated:
- [[Toto]](v2.0 セクション追加、aliases/related 拡張)
- [[Datadog]](Toto 2.0 言及追加)
- [[Ameet Talwalkar]](Toto 2.0 著者参加を追記)
- [[時系列基盤モデル]](スケーリング時代の知見・ソース追加)
- [[index]](total+7、source+1)
- [[hot]]
- Key insight: 観測特化 TSFM が初の本格スケーリング実証——4M〜2.5B で単調改善・飽和なし。CPM によるシングルパス推論と u-μP による転移学習で精度とレイテンシを同時改善。
## [2026-06-15] ingest-paper-batch | 因果推論ベース RCA + LLM ベース RCA の 2022/2024 基礎論文 3 本
3 本並列取り込み(因果推論 RCA の双璧 + LLM ベース RCA の本番稼働システム)。中間で各サブエージェントが tool use 上限で打ち止め、後処理(common concept・index・log・hot・manifest)はメインスレッドで直列に完成させた。
### Chen+ EuroSys 2024 — Automatic Root Cause Analysis via Large Language Models for Cloud Incidents (RCACopilot)
- Source: `.raw/papers/arxiv-2305.15778.pdf` (md5 6053891aed97c3a055dd21c3c23c8ae9)
- Summary: [[@2024__EuroSys__Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]]
- Pages created:
- [[@2024__EuroSys__Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]]
- [[Yinfang Chen]] / [[RCACopilot]]
- Pages updated:
- [[根本原因分析]]・[[RCA入力選別]]・[[TSG自動化]](RCACopilot を CIRCA/RCD と並べた 3 系統対比・情報スペクトラム問題・ハンドラ抽象の TSG 自動化先祖系統を横断的知見へ追加、未解決の問いに「ハンドラ自律生成」「ハンドラ DSL 標準化」を追加)
- `wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/index.md`・`wiki/log.md`(先頭追記)
- Key insight: Microsoft Transport の 30 超チーム・4 年以上の本番稼働を持つ唯一の end-to-end LLM ベースクラウド RCA システム。アラート種別ハンドラ(scope/query/mitigate アクションノードの DAG)でマルチソース診断情報を自動収集 → GPT-4 で 2,000 トークンを 120–140 語に要約 → FastText 埋め込み + 時間重み付き k-NN(時間減衰係数 0.01) + few-shot CoT で根本原因カテゴリ予測。Micro-F1=0.766 / Macro-F1=0.533。「情報スペクトラム」問題: 診断情報のみ(0.766)・アラート情報のみ(0.379)・両方混合(0.525)で示されるように、情報過多は不足と同等に RCA を損なう。Ahmed+ ICSE 2023 とは「ハンドラ + 診断情報自動収集 + LLM 圧縮」の総合システムである点で別系統。CIRCA/RCD の形式的因果推論より、経験的ハンドラ + LLM 圧縮が本番運用で先行している。
### Li+ KDD 2022 — Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition (CIRCA)
- Source: `.raw/papers/KDD22-CIRCA.pdf` (md5 9f4821d9792f73ec77b3b717534abfab)
- Summary: [[@2022__KDD__Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition]]
- Pages created:
- [[@2022__KDD__Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition]]
- [[Mingjie Li]] / [[Kanglin Yin]] / [[Xiaohui Nie]] / [[Wenchi Zhang]] / [[Kaixin Sui]] / [[CIRCA]]
- Pages updated:
- [[Dan Pei]](CIRCA を参加論文に追加)
- [[因果推論ベースRCA]](CIRCA の Pearl Causal Hierarchy による定式化、Structural Graph + RHT + 子孫調整の貢献、RCD との「ドメイン知識軸 vs スケーラビリティ軸」設計対比を横断的知見へ追加、未解決の問いに「子孫調整の他システム検証」「L2 介入知識の観測ベース推定限界」を追加)
- [[根本原因分析]](CIRCA/RCD/RCACopilot の 3-paper 比較)・[[RCA評価設計]](D_O オラクル設計、CIRCA がマルチソース化で劣化する現象)
- `wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/index.md`・`wiki/log.md`
- Key insight: Pearl の Causal Hierarchy で RCA を「介入認識(IR)」タスクとして初めて定式化した論文(Theorem 3.4)。IR が L2 介入知識に属することを Corollary 3.3 で証明し、Sage(ASPLOS 2021)の反実仮想分析(L3)を不要にすることを示した。アーキテクチャ知識(コールグラフ + Traffic/Saturation/Latency/Errors 4 メタメトリクス)から構造グラフを構築し、SVR ベース RHT で残差スコア化、子孫調整で正常分布の不完全観測を補正。Oracle DB 99 件で AC@1=0.404(NSigma 0.323 比 +25%)・0.578 秒。RCD と同年(2022)発表の双璧で、CIRCA = ドメイン知識・正確性、RCD = ドメイン知識不要・スケーラビリティの設計対比を成す。
### Ikram+ NeurIPS 2022 — Root Cause Analysis of Failures in Microservices through Causal Discovery (RCD)
- Source: `.raw/papers/c9fcd02e6445c7dfbad6986abee53d0d-Paper-Conference.pdf` (md5 f2cfb3ec4919243c008d707f68906790)
- Summary: [[@2022__NeurIPS__Root Cause Analysis of Failures in Microservices through Causal Discovery]]
- Pages created:
- [[@2022__NeurIPS__Root Cause Analysis of Failures in Microservices through Causal Discovery]]
- [[Azam Ikram]] / [[Saurabh Bagchi]] / [[Murat Kocaoglu]] / [[Sarthak Chakraborty]] / [[Adobe Research]] / [[Purdue University]] / [[Sock Shop]] / [[RCD]]
- Pages updated:
- [[因果推論ベースRCA]](RCD の soft intervention モデル化、F-NODE による分布不変性活用、階層 + 局所学習の相乗効果、AWS 本番 3 障害ケースでの観測限界(Outage B の潜在変数失敗・Outage C の計測スコープ外)を横断的知見へ追加、未解決の問いに「Ψ-FCI 拡張(交絡対応)」「分割パラメータ γ の最適化」を追加)
- `wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/index.md`・`wiki/log.md`
- Key insight: 2022 年に CIRCA と並走して発表された因果推論ベース RCA。障害を根本原因ノードへの soft intervention としてモデル化する点が CIRCA の介入認識と相補的(両者とも L2 介入知識の実用化だが、CIRCA は介入分布変化を直接スコアリング、RCD は介入分布変化を「フィルタ」として使ってグラフ探索を局所化)。F-NODE($F=0$ 正常 / $F=1$ 障害)で $X \perp\!\!\!\perp F | Pa_X$ の条件付き独立性検定を実行することで、根本原因でないノードを除外。完全因果グラフ学習を回避し、合成 500 ノード 22 秒(対 Ψ-PC 150 分超で約 400× 高速)。本番クラウド障害でのケーススタディ(AWS 3 件)を最初に公開した因果推論ベース RCA で、Outage B では Memcached の hit ratio が潜在変数として top-1 を外す失敗モードを実証し、causal sufficiency 仮定の限界を境界条件として明示。
## [2026-06-15] ingest-paper | Remil+ arXiv 2024 — AIOps Solutions for Incident Management: Technical Guidelines and A Comprehensive Literature Review
- Source: `.raw/papers/arxiv-2404.01363.pdf` (md5 9e3b9de8ba73965e93ed8bf6459c8631)
- Summary: [[@2024__arXiv__AIOps Solutions for Incident Management]]
- Pages created:
- [[@2024__arXiv__AIOps Solutions for Incident Management]]
- [[Youcef Remil]]
- [[Anes Bendimerad]]
- [[Romain Mathonat]]
- [[Mehdi Kaytoue]]
- [[University of Lyon]]
- [[INSA Lyon]]
- [[CNRS]]
- [[Infologic]]
- Pages updated:
- [[AIOps]](6 能力モデル・descriptive vs predictive 模型・contamination zone・interpretability 3 軸・研究密度偏りの 2 サーベイ独立確認を横断的知見へ追加し、関連質問を未解決の問いへ追加)
- [[インシデント管理]](4 フェーズ × 9 タスク手続きでの再整理・4 層 Maintenance Strata の縦軸補強を横断的知見へ追加し、classification/deduplication 独立タスク化と Business 層の空白を未解決の問いへ追加)
- [[障害予測]](Prevention 能力で offline+online を束ねる再構成・`Δt_p` と運用メトリクス連結を横断的知見へ追加し、LLM-era SDP の空白を未解決の問いへ追加)
- `wiki/index.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`
- Key insight: Remil+ 2024 は Notaro+ 2021(TIST)と独立に AIOps for incident management をサーベイし、6 能力モデル(Perception/Prevention/Detection/Location/Action/Interaction)と 4 フェーズ × 9 タスク手続きで、本 wiki が AIOpsLab 4-level taxonomy で見てきた構造を細分・補完する独自軸を提供する。最大の発見:(1) classification・deduplication・correlation を独立タスクとして立てた点で Notaro+ 2021 や Zhang+ 2015 と差別化、(2) interpretability の 3 次元(internal/external/time consistency)と in-context evaluation の contamination zone phenomenon という評価設計上の落とし穴を明文化、(3) descriptive 模型(pattern mining・FCA)を predictive 模型の対等な相棒として推奨する独自方向、(4) 40+ 件の公開データセットを application area 横断で 1 表に統合した最初の compendium、(5) 別データで Notaro+ 2021 の研究密度偏り(prevention 10.6% / remediation 2.5%)を再確認し、これが文献選定バイアスでなく AIOps 研究空間の構造的偏りである可能性を強める。LLM-era 以前のサーベイ(2024-04 時点)のため、agentic SRE 系は射程外。
## [2026-06-15] ingest-paper | Hussain+ FSE 2026 industry — Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems
- Source: `.raw/papers/arxiv-2510.20640.pdf` (md5 1faab80848cf8f4fda2dd23f46c4bda4)
- Summary: [[@2026__FSE__Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems]]
- Pages created:
- [[@2026__FSE__Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems]]
- [[Anson Bastos]]
- Pages updated:
- [[Fiza Husain]] (alias に "Fiza Hussain" を追加・FSE 2026 を参加論文に追記)
- [[Chetan Bansal]]・[[Anjaly Parayil]]・[[Ayush Choure]]・[[Saravan Rajmohan]]・[[Rujia Wang]] (FSE 2026 を参加論文に追記)
- [[クラウドモニタリング]] (DiRecGNN による「ディメンション部分集合推薦」階層、sparse モニタグラフでの汎用 HGNN の限界、類似モニタ説明と end-to-end 自動化の運用要件を横断的知見に追記し、静的グラフ仮定・閾値推薦への接続・LLM(MonitorAssistant)×HGNN(DiRecGNN)統合を未解決の問いに追加)
- `wiki/index.md`・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`
- Key insight: Microsoft Intelligent Monitoring ラインの第 3 弾。Ganatra+ 2023 で「モニタ自体の欠如」を実証 → Srinivas+ 2024 で「メトリクス選定」を自動化 → Hussain+ 2026 で「ディメンション部分集合選定」を HGNN ランキングとして自動化、という製品-論文サイクルが明示的になった。本番モニタの 94% が「メトリクスが出している全ディメンションを使わない」ためディメンション選定こそが運用律速で、汎用 HGNN(SAGEConv 等)では HR@1 0.29–0.40 にとどまる sparse グラフを、ランダムウォーク経路注意 + 注意ヘッド整列損失で 0.597(+55.8%)まで引き上げた。ユーザースタディは「類似モニタによる説明」と「end-to-end 自動化」を産業要件として確認した。
## [2026-06-15] ingest-paper | Xiong+ USENIX ATC 2024 — SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation
- Source: `.raw/papers/atc24-xiong.pdf` (597eee652e9c9777312e42bc3a58e0ee)
- Summary: [[@2024__USENIX ATC__SuperBench - Improving Cloud AI Infrastructure Reliability with Proactive Validation]]
- Pages created:
- [[@2024__USENIX ATC__SuperBench - Improving Cloud AI Infrastructure Reliability with Proactive Validation]]
- [[Yuting Jiang]]
- [[Ziyue Yang]]
- [[Lei Qu]]
- [[Yongqiang Xiong]]
- [[Lidong Zhou]]
- [[SuperBench]]
- [[グレイ障害]]
- [[プロアクティブ検証]]
- Pages updated:
- [[Yifan Xiong]](SuperBench 共筆頭著者を追記、status を developing に昇格)
- [[Peng Cheng]](SuperBench 共著を追記)
- [[GPUクラスタ運用]](冗長による MTBI 漸減、検証時間も TCO の一部として最適化する二論点を横断的知見に追加・冗長予算という未解決問いを追加)
- [[GPUレジリエンス]](冗長機構がグレイ障害を内蔵するという観点を横断的知見に追加)
- [[プロアクティブ障害管理]](予測ありの選択的検証 vs 予測なし全検証のハイブリッド論点を追加)
- [[障害予測]](Cox-Time + 行動 = SuperBench Selector を AI 時代の代表例として追加)
- [[sources/_index]] / [[entities/_index]] / [[concepts/_index]] / [[index]] / [[hot]] / `.raw/.manifest.json`
- Key insight: AI インフラのハードウェア冗長(HBM 行リマップ・GPU CUDA コア冗長・IB 過剰プロビジョン)はインシデント直前まで劣化を覆い隠す「グレイ障害」を生み、Azure A100 で MTBI が初回 719.4 時間 → 20 回目 151.7 時間に漸減する。プロアクティブ検証 SuperBench は Cox-Time 予測 + 貪欲ベンチマーク選択 + CDF 類似度クラスタリングでフルセット検証比 MTBI 1.11×・検証時間 92.07% 削減を達成し、Azure 本番 2 年運用で 10.36% のノードを欠陥として除外。「検証時間も TCO」「件数ではなく GPU 時間で測れ」という運用原則を検証側にも適用した最初の体系。ATC '24 Best Paper。
## [2026-06-15] ingest-paper | Yang+ FSE 2026 — TSGuard: Automated User-Centric Incident Diagnosis for AI Workloads in the Cloud
- Source: `.raw/papers/arxiv-2506.01481.pdf` (78bf39c29a081051f49a11714d1d3153)
- Summary: [[@2026__FSE__TSGuard - Automated User-Centric Incident Diagnosis for AI Workloads in the Cloud]]
- Pages created:
- [[@2026__FSE__TSGuard - Automated User-Centric Incident Diagnosis for AI Workloads in the Cloud]]
- [[Yitao Yang]]
- [[Yifan Xiong]]
- [[Baochun Li]]
- [[Peng Cheng]]
- [[Microsoft Research]]
- [[University of Toronto]]
- [[TSGuard]]
- [[RCACopilot]]
- Pages updated:
- [[Yangtao Deng]](TSGuard 共著として追加・CUHK 所属を併記)
- [[Hong Xu]](TSGuard 共著として追加)
- [[The Chinese University of Hong Kong]](TSGuard / Yitao Yang を関連実体に追加)
- [[Microsoft Azure]](AI ワークロード本番データソースとして追加・GPU 偏重 52.47% + recurrence 8.78 を記述)
- [[インシデント管理]](user-centric paradigm への転換・症状-原因多対多と能動検証・半自動タクソノミー構築を横断的知見に追加)
- [[耐障害LLM訓練]](user-centric pre-ticket interception + TTM 軸の補完を横断的知見に追加)
- [[AIOps]](provider-centric/user-centric の主体軸を独立した設計次元として追加・AI ワークロード基盤の独立サブ領域化を追加)
- [[Fault Localization]](タクソノミー誘導 DFS + 能動検証による第三系譜を横断的知見に追加)
- [[RCA評価設計]](本番由来オラクル vs 合成注入オラクルの評価哲学差を横断的知見に追加)
- [[sources/_index]] / [[entities/_index]] / [[index]] / [[hot]] / `.raw/.manifest.json`
- Key insight: AI ワークロード(GPU 訓練)のインシデント管理は provider-centric paradigm に閉じた既存研究では median TTM 52.5 時間という非効率を残し続けるが、ユーザ側 pre-ticket interception layer + 階層タクソノミー誘導 DFS + 能動検証スクリプト実行 + 5 エージェント協調で Micro F1=0.854 / Macro F1=0.816(RCACopilot 比 +19.8/43.6%)を達成。recurrence rate 8.78 という AI ワークロード固有の反復性が quick path 51.4% の dominance を生む。
## [2026-06-15] ingest-paper | Pham+ WWW Companion 2025 — RCAEval: A Benchmark for Root Cause Analysis of Microservice Systems with Telemetry Data
- Source: `.raw/papers/2026_Unknown_RCAEval_Benchmark_Root_Cause_Microservice.pdf` (fe102b182a1c1c1a1cbf98d7a1bb15ff)
- Summary: [[@2025__WWW Companion__RCAEval - A Benchmark for Root Cause Analysis of Microservice Systems with Telemetry Data]]
- Pages created:
- [[@2025__WWW Companion__RCAEval - A Benchmark for Root Cause Analysis of Microservice Systems with Telemetry Data]]
- [[Flora Salim]]
- [[Xiuzhen Zhang]]
- [[University of New South Wales]]
- Pages updated:
- [[Luan Pham]](RCAEval 2025 共著・UNSW 併記を追加)
- [[Hongyu Zhang]](RCAEval 2025 で University of Newcastle 所属に戻ったことを記述)
- [[Huong Ha]](RCAEval 2025 共著を追加)
- [[RMIT University]](RCAEval 2025 共著機関として更新・Xiuzhen Zhang を追加)
- [[University of Newcastle]](RCAEval 2025 で再所属となった Hongyu Zhang を追加)
- [[RCAEval]](2025 WWW Companion 版で 735 ケース・11 種障害・15 ベースラインへ拡張)
- [[Sock Shop]] / [[Online-Boutique]] / [[Train-Ticket]](RCAEval の評価対象システムとして追記)
- [[RCA評価設計]](カバレッジ路線・fine-grained 評価軸・本番由来 vs 合成由来オラクル等を横断的知見に追加)
- [[障害注入]](コードレベル障害 F1〜F5 の初収録・stress-ng + tc + コード改変の 3 層注入を横断的知見に追加)
- [[因果推論ベースRCA]](マルチソース化が CIRCA/RCD で逆効果・トレース系 TraceRCA が並走を横断的知見に追加)
- [[Fault Localization]](RCAEval Table 6 でのモダリティ別性能差を横断的知見に追加)
- [[マルチモーダル障害診断]](3 モダリティ全部入りベンチ標準化・コードレベル正解形式の導入を横断的知見に追加)
- [[sources/_index]] / [[entities/_index]] / [[index]] / [[hot]] / `.raw/.manifest.json`
- Key insight: マイクロサービス RCA ベンチマーク領域は 2024 ASE 版で Dummy ベースラインの導入により先行手法の過大評価可能性を可視化したが、2025 WWW Companion 版でメトリクス/トレース/マルチソースの 3 系統 + 11 種障害(資源・ネットワーク・コードレベルを含む RCA データセット初収録)・3 規模システム(12/15/64 サービス)・735 ケースの統一ベンチマークを公開。単純なマルチソース化で因果推論系の一部手法(CIRCA: AC@1 0.32→0.06、RCD: 0.09→0.10)が劣化する現象を定量化し、「モダリティを増やせば良くなる」という素朴な仮定を本ベンチで反証した。
## [2026-06-15] ingest-paper | Hu+ NSDI 2024 — Characterization of Large Language Model Development in the Datacenter
- Source: `.raw/papers/nsdi24-hu.pdf` (3dc1f7275f9b19f938ddca0a690572f3)
- Summary: [[@2024__NSDI__Characterization of Large Language Model Development in the Datacenter]]
- Pages created:
- [[@2024__NSDI__Characterization of Large Language Model Development in the Datacenter]]
- [[Dahua Lin]]
- [[Yonggang Wen]]
- [[Nanyang Technological University]]
- [[SenseTime Research]]
- [[InternLM]]
- [[AcmeTrace]]
- Pages updated:
- [[Acme]] (NSDI'24 を sources/related に追加・AcmeTrace 等の関連追加)
- [[耐障害LLM訓練]] (LLM 診断主役化・2 段階 NCCL allgather・async checkpointing×CPU 余剰直結の 3 件を横断的知見に追加、出典に NSDI'24 を追加)
- [[GPUクラスタ運用]] (LLM 専用クラスタの GPU 二極化と補助資源余剰の同時成立・Evaluation 逆転の 2 件を横断的知見に追加)
- [[LLM学習モニタリング]] (LLM 診断器の最初期本番事例の系譜を横断的知見に追加)
- [[sources/_index]] / [[entities/_index]] / [[index]] / [[hot]] / `.raw/.manifest.json`
- Key insight: 2024 年の Acme は LLM クラスタの「Pretraining が件数 0.9〜3.2% で GPU 時間 69.5〜94.0%」「GPU 利用率 0/100% 二極化」「Infrastructure 障害が件数 11% で GPU 時間 82%超」を最初に並べた本番証跡で、LLM ベース診断・async checkpointing・2 段階 NCCL allgather など現代の Fault-tolerant Pretraining の主要モチーフを初実装で揃えた上流。
## [2026-06-15] ingest-paper batch | 時系列推論 × RLVR 論文 5 本同時取り込み
- Sources:
- `.raw/papers/arxiv-2505.24511.pdf` (94cb0deef00bf9bf25593f1ff96a1ee3)
- `.raw/papers/7801b29c93b599b8d0c44138596bdeed-Paper-Conference.pdf` (65bbfff718db4f5e2ccc447bc564b357)
- `.raw/papers/arxiv-2509.24803.pdf` (537d09ad0bbfaf39d29b621b6ebbeeda)
- `.raw/papers/arxiv-2409.11376.pdf` (32894ec4bcb4d50df7f2bac8a08208b6)
- `.raw/papers/arxiv-2511.08947.pdf` (5ffba8001b85b61e8bdd87dfcb87c5c3)
- Summaries: [[@2025__KDD__Can Slow-thinking LLMs Reason Over Time - Empirical Studies in Time Series Forecasting]] / [[@2025__NeurIPS__Time-R1 - Post-Training Large Vision Language Model for Temporal Video Grounding]] / [[@2026__ICLR2026__TimeOmni-1 - Incentivizing Complex Reasoning with Time Series in Large Language Models]] / [[@2024__arXiv__Towards Time-Series Reasoning with LLMs]] / [[@2025__arXiv__AlphaCast - A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting]]
- Pages created (concept 3 + source 5 + entity 16 主要):
- concept: [[時系列推論]] / [[検証可能報酬による強化学習]] / [[時間的映像グラウンディング]]
- entity: [[Jiahao Wang]] / [[Daoyu Wang]] / [[Tong Guan]] / [[Qin Jin]] / [[MiLM Plus]] / [[Xiaomi]] / [[Xiaohan Zhang]] / [[Tian Gao]] / [[Winnie Chow]] / [[Lauren Gardiner]] / [[Haraldur T. Hallgrimsson]] / [[Maxwell A. Xu]] / [[Shirley You Ren]] / [[Apple]] / [[Ming Jin]] / [[Shirui Pan]] ほか
- Pages updated: [[Mingyue Cheng]] / [[Xiaoyu Tao]] / [[Qi Liu]] / [[Enhong Chen]] / [[University of Science and Technology of China]] / [[DeepSeek-R1]] / [[Renmin University of China]] / [[NVIDIA]] / [[OpenAI]] / [[Stanford University]](lint-stub 解消) / [[エージェント型時系列予測]] / [[文脈内学習]] / [[強化ファインチューニング]] / [[ビジョン言語モデル]] / [[時系列基盤モデル]] / [[時系列質問応答]] / [[エージェント型強化学習]] / [[sources/_index]] / [[entities/_index]] / [[concepts/_index]] / [[index]] / [[hot]] / [[log]] / manifest
- Key insights:
- TimeReasoner は **訓練不要 [[DeepSeek-R1]] で深層学習ベースラインと競合** する性能を達成し、タイムスタンプ削除で MSE 5.4→25.3 の劣化・CoT 過長で精度低下・温度 τ=0.6 がスイートスポットという反直感的知見を提示
- Time-R1 は **2.5K サンプル RL が 339K サンプル SFT-LoRA を超える** 圧倒的データ効率で RLVR の TVG ドメインへの展開を実証し、SFT の「偽陰性過剰ペナルティ」問題を RL が解消する構造を明示
- TimeOmni-1 は SFT(コールドスタート CoT)+ GRPO の二段階訓練で因果発見 **GPT-4.1 を ID 40.6%・OOD 28.1% 上回り**、ジョイント訓練の能力補完(意思決定 40.9%→47.9%)を実証
- Chow+ は時系列推論を「知覚→文脈化→演繹」に分解し、軽量パッチエンコーダ + LoRA で **7B が GPT-4o を超える** 知覚ボトルネックの定式化と回避策を提示
- AlphaCast は Investigator-Generator-Reflector の三段階で訓練不要 LLM を駆動し、**反省モジュール除去で非推論ベースラインより悪化** することから「推論は両刃、反省が物理整合性に不可欠」を実証
- USTC([[Mingyue Cheng]] グループ)は TimeReasoner(推論時)→ AlphaCast(Workflow)→ Cast-R1(AgenticRL)の三世代を同一グループ内で揃え、ATSF の 3 パラダイムを系列的に積み上げた
## [2026-06-15] ingest-paper | Position: The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting
- Source: `.raw/papers/arxiv-2602.01736.pdf`
- Summary: [[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]]
- Pages created: [[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]] / [[Qinwei Ma]] / [[Jingzhe Shi]] / [[Jiahao Qiu]] / [[Zaiwen Yang]]
- Pages updated: [[Tsinghua University]] / [[Princeton University]] / [[時系列基盤モデル]] / [[エージェント型時系列予測]] / [[sources/_index]] / [[entities/_index]] / [[index]] / [[log]]
- Key insight: 時系列予測における「汎ドメインアーキテクチャ vs ドメイン特化 SOTA」の矛盾は和解不能であると論証。近似誤差下界 O(1/√T) により NLP・CV のスケーリング則が TSF に適用できないことを理論的根拠とし、Kaggle コンペ上位手法・各ドメインのトップ論文が汎ドメイン TSF NN を使わないことを実証。解決策として LLM Scientist 型メタラーニングを提案し、これは ATSF の Workflow パラダイムと独立に収束した設計思想。
## [2026-06-15] ingest | Google Cloud Blog: Where and how Google is deploying agentic AI to improve operations
- Source: `.raw/articles/google-sre-agentic-ai-improve-operations-2026-06-15.md`
- Summary: [[@2026__Google Cloud Blog__AI in SRE - Where Google is Deploying Agentic AI to Improve Operations]]
- Pages created: [[@2026__Google Cloud Blog__AI in SRE - Where Google is Deploying Agentic AI to Improve Operations]] / [[AI Insights]] / [[Agent Development Kit]] / [[Gemini Enterprise Agent Platform]]
- Pages updated: [[Google]] / [[TimesFM]] / [[agentic SRE]] / [[SRE AI Autonomy Levels]] / [[インシデント管理]] / [[アラート管理]] / [[異常検知]] / [[index]] / [[hot]] / `.raw/.manifest.json`
- Key insight: Google SRE AI のスコープが SDLC 全体(reliability design / anomaly detection & alerting / incident management / incident investigation / insights & risk management)に広がる地図と、本番スタックの**外向き表記**(Gemini + Gemini Enterprise Agent Platform[旧 Vertex AI のリブランドが一次確認] + ADK + MCP + BigQuery + vector DB)、[[TimesFM]] による異常検知の組み込み、[[AI Insights]](Gemini embedding + vector DB で過去インシデントを連続知識化 + risk category 注釈)、IMAG への 4 種の agentic orchestration layer(コミュニケーション監視/SRE 間ハンドオフ/ポストモーテム下書き/内外通信)、エージェント設計の 9 原則(transparency over black-box automation を含む)が、whitepaper の社内コードネーム表記と対の公開製品表記として固定された。
## [2026-06-15] ingest-paper | How Incidental are the Incidents? Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems
- Source: `.raw/papers/2026_Unknown_How_incidental_incidents.pdf`
- Summary: [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]]
- Pages created: [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]] / [[Junjie Chen]] / [[Shu Zhang]] / [[Xiaoting He]] / [[Dan Hao]] / [[Feng Gao]] / [[Zhangwei Xu]] / [[Yingnong Dang]] / [[University of Newcastle]] / [[DeepIP]] / [[インシデント優先順位付け]]
- Pages updated: [[Qingwei Lin]] / [[Hongyu Zhang]] / [[Dongmei Zhang]] / [[Yu Kang]] / [[Tianjin University]] / [[Microsoft]] / [[Microsoft Azure]] / [[Peking University]] / [[インシデント管理]] / [[アラート管理]] / [[インシデントTTM予測]] / [[sources/_index]] / [[entities/_index]] / [[concepts/_index]] / [[index]] / [[hot]] / `.raw/.manifest.json`
- Key insight: Microsoft 18 オンラインサービスの 6 か月分本番インシデントで「半数以上(50.32%)が無視してよい incidental incidents で、TTR の 55.05% を消費する」という構造を初めて定量化し、severity 0 でも incidental が 57.96% を占める逆転を Table 1 で示した。attention 付き CNN + 直前 10 件の関連 incident 取り込みの [[DeepIP]](AUC 0.808)で bug severity prediction 流用ベースラインを 18 全システムで上回り、incident 固有の時間相関を捉える設計の優位を実証した。
## [2026-06-15] refactor | wiki/concepts index synchronization
- Pages updated: [[wiki/concepts/_index]] / [[index]]
- Summary: concept 実ファイル 158 件に対して欠落していた [[MRC]]・[[Retroactive Sampling]]・[[SRv6]]・[[マルチプレーンClosトポロジ]] を [[wiki/concepts/_index]] に補完し、[[index]] の Concepts に [[AI Greenferencing]]・[[アラート管理]]・[[インシデントTTM予測]]・[[クラウドモニタリング]]・[[サーバーレスワークフロー]]・[[分散メッセージブローカ]]・[[変更起因インシデント]] を補完した。
- Verification: concept 実ファイル 158、concept index 158、wiki index Concepts 158、index 差分 0、重複 0。既存課題として必須見出し不足 11 件、frontmatter `sources` 欠落 14 件、concept 内 dead wikilink 28 件を次回候補に残す。
## [2026-06-14] ingest-paper | Going through the Life Cycle of Faults in Clouds: Guidelines on Fault Handling
- Source: `.raw/papers/Li-et-al.-2022---Going-through-the-Life-Cycle-of-Faults-in-Clouds---Guidelines-on-Fault-Handling.pdf`
- Summary: [[@2022__ISSRE__Going through the Life Cycle of Faults in Clouds - Guidelines on Fault Handling]]
- Pages created: [[@2022__ISSRE__Going through the Life Cycle of Faults in Clouds - Guidelines on Fault Handling]] / [[Xiaoyun Li]] / [[Hongyang Chen]] / [[Zhekang Chen]] / [[クラウド障害ライフサイクル]]
- Pages updated: [[Guangba Yu]]・[[Pengfei Chen]]・[[Sun Yat-sen University]]・[[Bizseer]](source/related 追加) + [[運用障害分析]](TTX 実測値定量化・内部/外部原因の二分法を横断的知見に追加)・[[インシデント管理]](MTTM が TTR の 53% を占める緩和ボトルネックを横断的知見に追加)・[[根本原因分析]](misconfiguration 31.6% 最多・根本原因と緩和手段の強相関を横断的知見に追加)・[[障害緩和]](9 種の緩和手段分布・TTM・根本原因相関を横断的知見に追加)・[[障害注入]](4 つの未注入カテゴリをポストモーテム分析から導出を横断的知見に追加)・[[オブザーバビリティ]](階層化オブザーバビリティ・粒度オンデマンド切り替えを横断的知見に追加) + sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: 三大クラウドの実測データが「TTM が TTR の過半を占める」ことを初めて定量化し、緩和の短縮こそが可用性向上のボトルネックであることを実証した。根本原因(misconfiguration→rollback 51 件)と緩和手段の強相関はカテゴリ別自動推薦の設計根拠となる一方、hardware→replacement は均一分散でパターンが薄く、自動化が効きにくい領域として峻別される。
## [2026-06-14] ingest-paper | Automated Analysis of Distributed Tracing: Challenges and Research Directions
- Source: `.raw/papers/Bento-et-al.-2021---Automated-analysis-of-distributed-tracing---Challenges-and-research-directions.pdf`
- Summary: [[@2021__J Grid Computing__Automated Analysis of Distributed Tracing - Challenges and Research Directions]]
- Pages created: [[@2021__J Grid Computing__Automated Analysis of Distributed Tracing - Challenges and Research Directions]] / [[Andre Bento]] / [[Jaime Correia]] / [[Ricardo Filipe]] / [[Filipe Araujo]] / [[OpenTracing]] / [[OpenTracing Processor]] / [[トレース品質]]
- Pages updated: [[分散トレーシング]](量制御の手前に品質天井診断・OpenTracing 仕様の自動分析阻害・LLM 前のトレース異常検知 3 段階進化の 3 項目を横断的知見に追加、トレース品質の改善が下流分析を押し上げるか・OpenTelemetry testability driver 化の 2 問を未解決の問いに追加、出典追加)・[[異常検知]](派生メトリクス時系列への古典外れ値検知系譜を横断的知見に追加、出典追加)・[[オブザーバビリティ]](シグナル内品質の早期指摘を横断的知見に追加、OpenTelemetry 品質メトリクス標準化を未解決の問いに追加、出典追加)・[[Jorge Cardoso]]・[[University of Coimbra]]・[[Huawei Munich Research Center]](Bento+ 2021 への参画追記)+ sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: 2021 年時点(LLM/TSFM 普及前)の OpenStack 本番 OpenTracing データ自動分析が「異常時間枠とサービスは Isolation Forest で位置づけられたが、Why 深掘りはトレース品質の天井で止まる」と診断したことが、後の AIOps が「サンプリング/圧縮で量を制御する」議論(Hindsight/TraStrainer/Astraea/Mint/Tracezip)と並行して「データの semantic 品質(計装カバレッジ・testability・annotation 規約)を確保する」議論へ向かう動機の起点になっている。Bento+ が OpenTelemetry を「merge 努力が主で testability driver の再設計が薄い」と批判した時点(2021)から 5 年後、本 wiki が記録する DeepFlow/ChainScope の非侵入計装研究は同じ「data sufficiency」課題への実装面の応答として読める。
## [2026-06-14] ingest-paper | CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data
- Source: `.raw/papers/acm-www2023-cmdiagstor.pdf`
- Summary: [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]]
- Pages created: [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] / [[Bowen Hao]] / [[Mingjie Li]] / [[Xianglin Lu]]
- Pages updated: [[Zeyan Li]](disambiguation) / [[Qingyang Yu]] / [[Changhua Pei]] / [[Shenglin Zhang]] / [[Nankai University]] / [[Dan Pei]] / [[Tencent]] / [[Fault Localization]](AmSit を精度のボトルネックとする横断的知見・RCNC 失敗モードの未解決問い追加) / [[根本原因分析]](入力表現精度が RCA 精度を律速するという横断的知見追加) / sources/_index / entities/_index / concepts/_index / index.md / hot.md / log.md / manifest
- Key insight: コールメトリクスデータ(CMD)が集約の際に生じる「曖昧性(AmSit)」——1 つのノードに 2 本以上の上流コールと 1 本以上の下流コールが存在する状況——がコールグラフ精度の主ボトルネックであり、上流トラフィック系列の非負線形回帰で解消できる。入力グラフの精度が RCA 性能の上限を決めるという洞察は分野横断で普遍的である。
## [2026-06-14] ingest-paper | A Conceptual Framework for System Fault Tolerance
- Source: `.raw/papers/1992_005_001_16112.pdf`
- Summary: [[@1992__CMU SEI__A Conceptual Framework for System Fault Tolerance]]
- Pages created: [[@1992__CMU SEI__A Conceptual Framework for System Fault Tolerance]]・[[Walter Heimerdinger]]・[[Charles Weinstock]]・[[Honeywell]]・[[Software Engineering Institute]]・[[フォールトトレランス]]
- Pages updated: [[ソフトウェア耐障害性]](3段階FTレベル体系と用語進化の横断的知見追加)・[[ディペンダビリティ]](fault evasion と Avizienis 4手段の対応、Heimerdinger+Weinstock 1992 出典追加)・sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: 1992 年に定義された「障害回避的措置(fault evasion)」が 2020 年代 AIOps のプロアクティブカテゴリとして再実装されており、30 年の概念的連続性が存在する。
## [2026-06-14] ingest-paper | A Survey of Online Failure Prediction Methods
- Source: `.raw/papers/Salfner-et-al.-2010---A-survey-of-online-failure-prediction-methods.pdf`
- Summary: [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods]]
- Pages created: [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods]]、[[Felix Salfner]]、[[Maren Lenk]]、[[Miroslaw Malek]]、[[Humboldt University of Berlin]]、[[プロアクティブ障害管理]]、[[ソフトウェアエイジング]]
- Pages updated: [[障害予測]](Salfner+ 2010 を「pre-AIOps 期の元祖 taxonomy」「時間軸 4 パラメータの起点」「予測精度だけでは可用性は伸びず後段の対策自動化が本丸」の 4 項目で横断的知見と未解決の問いへ追加)・[[ディペンダビリティ]](Avižienis 2004 への symptom と undetected/detected 区別の拡張、5 段階連鎖と可視化技法対応を横断的知見へ追加)・[[AIOps]](pre-AIOps 期から taxonomy が確立しており Notaro+ 2021 の proactive/reactive 軸はその再パッケージ)+ sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: オンライン障害予測 taxonomy の起源は 2010 年で、AIOps の語が普及する前から「入力データ系統で 4 主要枝(failure tracking / symptom monitoring / detected error reporting / undetected error auditing)」という構造が完成していた。Salfner+ 2010 が立てた `(t_d, t_l, t_p, t_w)` の時間軸定式化と稀事象向け評価指標(precision/recall, F-measure, ROC/AUC)は今も AIOps 評価の共通通貨で、Notaro+ 2021 の proactive/reactive 軸も本サーベイの 4 系統の再パッケージにあたる。さらに「proactive fault management 4 段階のうち最初の予測しか研究蓄積がない」という Salfner+ 2010 の自己診断は、15 年後の Notaro+ 2021 が定量化した「remediation 2.5%」の研究密度の偏りと整合し、PFM 統合ループの欠如が今も AIOps の本丸であることを示す。
## [2026-06-14] ingest | Practical Reliability Engineering
- Source: `.raw/books/practical-reliability-engineering-2012.pdf`
- Summary: [[@2012__Wiley__Practical Reliability Engineering]]
- Pages created: [[@2012__Wiley__Practical Reliability Engineering]]、[[Patrick D. T. O'Connor]]、[[Andre Kleyner]]、[[Wiley]]、[[Design for Reliability]]、[[FRACAS]]
- Pages updated: [[ディペンダビリティ]]、[[SRE]]、[[ソフトウェア耐障害性]]、sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: 古典的信頼性工学は、信頼性を「時間依存の品質」として扱い、数学的予測より工学判断・故障モード理解・是正フィードバックを優先する。[[Design for Reliability]] は信頼性を設計初期へ前倒しし、[[FRACAS]] は故障報告から是正処置の有効性確認までを閉じる。これは [[SRE]] の SLO/インシデント管理/ポストモーテムの製品信頼性版の前史として位置づく。
## [2026-06-14] ingest-paper | How Long Will it Take to Mitigate this Incident for Online Service Systems?
- Source: `.raw/papers/2021ISSRE_TTMPrediction_cameraReady1.pdf`
- Summary: [[@2021__ISSRE__How Long Will it Take to Mitigate this Incident for Online Service Systems]]
- Pages created: [[@2021__ISSRE__How Long Will it Take to Mitigate this Incident for Online Service Systems]]、[[Weijing Wang]]、[[Tianjin University]]、[[インシデントTTM予測]]
- Pages updated: [[Hongyu Zhang]](Newcastle affiliation 追記)・[[Qingwei Lin]]・[[Yu Kang]]・[[Saravan Rajmohan]]・[[Dongmei Zhang]]・[[インシデント管理]](横断的知見 2 項・未解決の問い 1 項・出典追加)+ sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: インシデント TTM のうち最終担当チーム確定後の緩和フェーズ T3 が平均 70.20% を占める——トリアージ改善だけでは TTM 短縮に限界があることを 20 システム・4 年データで初めて定量化した
## [2026-06-14] ingest-paper | A Survey of Distributed Message Broker Queues
- Source: `.raw/papers/arxiv-1704.00411.pdf`
- Summary: [[@2017__arXiv__A Survey of Distributed Message Broker Queues]]
- Pages created: [[@2017__arXiv__A Survey of Distributed Message Broker Queues]]、[[Vineet John]]、[[Xia Liu]]、[[University of Waterloo]]、[[Apache Kafka]]、[[AMQP]]、[[RabbitMQ]]、[[分散メッセージブローカ]]
- Pages updated: sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: 同一テストベッド(5 ノード Flotilla)で Kafka と AMQP を直接対比した経験的調査。Kafka のスループット優位は SendFile API + シーケンシャル書き込み + OS ページキャッシュ + 標準バッチングに、AMQP のレイテンシ優位は push モデル + 既定で非永続化に集約される。起源(LinkedIn のログ処理 vs 金融取引処理)が現在の設計思想を決め、応用領域(損失許容 vs 損失非許容)が選択基準となる。multi P/C スケール時の resource contention は両系統共通の弱点。
## [2026-06-14] ingest-paper | An up-to-date survey in web load balancing
- Source: `.raw/papers/An_up-to-date_survey_in_web_load_balanci.pdf`
- Summary: [[@2011__World Wide Web__An up-to-date survey in web load balancing]]
- Pages created: [[@2011__World Wide Web__An up-to-date survey in web load balancing]]、[[Katja Gilly]]、[[Carlos Juiz]]、[[Ramon Puigjaner]]、[[Miguel Hernández University]]、[[University of Balearic Islands]]、[[Webロードバランシング]]
- Pages updated: sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: Gilly ら(World Wide Web 2011)は 2010 年時点のウェブロードバランシングを 3 軸(OSI 層・応答返路・コンテンツ把握)で体系化し、TCP 接続マイグレーション 5 方式と分散方針 3 分類を文献横断で整理した。Kubernetes の Service/Ingress やサービスメッシュが現代のマイクロサービスで担うロードバランシング機能の前史として位置づけられ、[[コンテナ配置最適化]]・[[マイクロサービスアーキテクチャ]] との接合点を提供する。
## [2026-06-14] ingest | CNCF Serverless Overview Whitepaper v1.0
- Source: `.raw/articles/cncf-serverless-overview-whitepaper-2026-06-14.md`
- Summary: [[@2018__CNCF WG Serverless__Serverless Overview Whitepaper v1.0]]
- Pages created: [[@2018__CNCF WG Serverless__Serverless Overview Whitepaper v1.0]]・[[サーバーレスワークフロー]]
- Pages updated: [[CNCF]](サーバーレス領域取り組み節追加)・[[サーバーレスアーキテクチャ]](CNCF 公式定義を citation 化・横断的知見 3 項追加・未解決の問い 1 項追加・sources 3 本目追加・status seed→developing)・sources/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: CNCF 白書(2018)は「サーバーレス = サーバー管理不要」という外部・運用視点で定義し、Yuuki Tsubouchi(2019)の「2 種のサーバーを隠蔽」という内部・アーキテクチャ視点と相補的に並立する。両者は矛盾しない。また「サーバーレス」用語の起源(2012 IronWorker)と FaaS 実用化(2014 AWS Lambda)に 2 年のギャップがあることが確認でき、概念先行・技術後追いの典型パターンを示す。Function Workflow の n:m イベント-Function マッピングと 5 パターン・6 状態の定義が後の LLM エージェントのツール呼び出し連鎖との対応を問う未解決問いへ接続する。
## [2026-06-14] ingest-paper | Cloud Container Technologies: A State-of-the-Art Review
- Source: `.raw/papers/cloud-containers-tcc.pdf`
- Summary: [[@2019__TCC__Cloud Container Technologies - A State-of-the-Art Review]]
- Pages created: [[@2019__TCC__Cloud Container Technologies - A State-of-the-Art Review]]、[[Claus Pahl]]、[[Pooyan Jamshidi]]、[[Free University of Bozen-Bolzano]]、[[University of Pisa]]、[[Docker]]、[[LXC]]、[[コンテナオーケストレーション]]、[[体系的マッピング研究]]
- Pages updated: [[Antonio Brogi]]、[[Jacopo Soldani]]、[[Carnegie Mellon University]]、[[マイクロサービスアーキテクチャ]](横断的知見 1 項追加)、[[コンテナ配置最適化]](横断的知見 1 項追加)、[[サーバーレスアーキテクチャ]](横断的知見 1 項追加)、sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: Pahl ら(IEEE TCC 2019)は 46 件 SMS で 2007-2016 のクラウドコンテナ・オーケストレーション研究を体系化し、Docker・LXC が支配的・Kubernetes が新興という当時の構造を 4 軸分類フレームワーク(Technology Stack・Management Services・Architecture Setting・Tools/Platforms/Technology)で固定化した。本論文の歴史的価値は (1) コンテナ研究は 2007 LXC → 2013 Docker → 2015 中盤クラスタ層という 2 段階加速の前史を定量化したこと、(2) 障害管理(failure management)を「2017 年時点で未開拓」と明示し、その後 8-9 年で [[@2021__TIST__A Survey of AIOps Methods for Failure Management]] や [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey]] が書かれた歴史的距離を逆算できること、(3) SLA Parameter(consumer 視点) と Infrastructure Parameter(provider 視点) の二極化を品質関心の構造として早期に定式化したこと、にある。これは [[@2020__SAC__Black-box inter-application traffic monitoring for adaptive container placement]] が Infra 側を深掘る eBPF アプローチや、[[@2022__IEEE ACCESS__A Survey on Observability of Distributed Edge & Container-Based Microservices]] のエッジオブザーバビリティ要件の前史を形成する。
## [2026-06-14] ingest-paper | A survey on intelligent management of alerts and incidents in IT services
- Source: `.raw/papers/A-survey-on-intelligent-management-of-alerts-and-incidents-in-IT-services.pdf`
- Summary: [[@2024__JNCA__A survey on intelligent management of alerts and incidents in IT services]]
- Pages created: [[@2024__JNCA__A survey on intelligent management of alerts and incidents in IT services]]、[[Qingyang Yu]]、[[アラート管理]]
- Pages updated: [[インシデント管理]](横断的知見 2 項追加)、[[Dan Pei]]、[[Nengwen Zhao]]、[[BizSeer]]、sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: Yu+ JNCA2024 は alert と incident を別ライフサイクルとして分離する統一 AIM アーキテクチャ(Fig.5)を提示し、alert determination の 3 種(distinguishing / severe ranking / alert-based incident identification)を直列統合する将来方向(Fig.7)を示す。この分類体系は前 LLM 時代の境界研究として位置づき、AlertGuardian・FLASH・LLexus・FlowXpert など LLM 時代の研究は 8 プロセスを横断結合する形で進化している。
## [2026-06-14] ingest-paper | Lindorm TSDB: A Cloud-native Time-series Database for Large-scale Monitoring Systems
- Source: `.raw/papers/p3715-zheng.pdf`
- Summary: [[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]]
- Pages created: [[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]]、[[Lindorm TSDB]]、[[Feifei Li]]、[[Zhejiang University]]
- Pages updated: [[Dan Pei]]、[[Alibaba Group]]、[[時系列データベース]](横断的知見 3 項・未解決の問い 3 項追加)、sources/_index・entities/_index・index.md・hot.md・log.md・manifest
- Key insight: 「共有なし + 共有ストレージ」ハイブリッドは時刻軸シャードグループ切り替えでノード追加時のデータ移動をゼロにし、書き込みスループット直線以上のスケーラビリティを実現する。Seriescache(MD5 エンコードのフォワードインデックス専用キャッシュ)が高次元問題の実用的解であり、前処理ダウンサンプリングが「書き込みコスト先払い・クエリゼロコスト」のトレードオフを選択した設計思想の具体例となる。
Navigation: [[index]] | [[hot]] | [[overview]]
## [2026-06-14] ingest-paper | Mining Causality of Network Events in Log Data
- Source: `.raw/papers/2018TNSM-Mining-Causality-of-Network-Events-in-Log-Data.pdf`
- Summary: [[@2018__TNSM__Mining Causality of Network Events in Log Data]]
- Pages created: [[@2018__TNSM__Mining Causality of Network Events in Log Data]]、[[Satoru Kobayashi]]、[[Kazuki Otomo]]、[[Kensuke Fukuda]]、[[Hiroshi Esaki]]、[[University of Tokyo]]、[[National Institute of Informatics]]、[[SINET4]]、[[LogCausalAnalysis]]
- Pages updated: [[ログ解析]](ネットワーク syslog 因果推論節 + 未解決の問い追加)、[[因果推論ベースRCA]](横断的知見 2 項・未解決の問い 1 項追加)、sources/_index・entities/_index・index.md・hot.md・log.md・manifest
- Key insight: PC アルゴリズム + G-square 検定はスパースな二値ネットワーク syslog に適合し、フーリエ+線形回帰の周期フィルタで 93% を除去したうえでトラブルチケットの 74% に対応するエッジを 5.3 エッジ/日に絞り込める。2018 年にすでに「データの疎密が条件付き独立性検定の選択を決める」という設計原則が定量化されていた。
## [2026-06-14] ingest-paper | A Survey of AIOps Methods for Failure Management
- Source: `.raw/papers/notaro-2021-aiops-survey.pdf`(MD5: `ad5ecae3c47f2c948b83191e31d3bd36`、ACM TIST Vol.12 No.6 Art.81、2021-11、45p、DOI:10.1145/3483424)
- Summary: [[@2021__TIST__A Survey of AIOps Methods for Failure Management]]
- Pages created: [[@2021__TIST__A Survey of AIOps Methods for Failure Management]] / [[Paolo Notaro]] / [[Jorge Cardoso]] / [[Michael Gerndt]] / [[University of Coimbra]] / [[Huawei Munich Research Center]]
- Pages updated: [[AIOps]] / [[障害予測]] / [[Fault Localization]] / sources/_index / entities/_index / index.md / hot.md / log.md / .raw/.manifest.json
- Key insight: pre-LLM 期 AIOps の Failure Management を proactive/reactive 軸 × 5 カテゴリ・14 サブカテゴリで 100 件整理。detection/RCA/prediction に研究が集中(計 86.8%)し、prevention 10.6%・remediation 2.5% は LLM-era にも引き継がれた構造的偏り。online failure prediction の lead/prediction/warning time の評価枠と、SFL/network/general-purpose の 3 系統 fault localization 整理は、現代の本 wiki 系統との対比に直接効く。
## [2026-06-14] ingest-paper | Identifying Faults in Large-Scale Distributed Systems by Filtering Noisy Error Logs
- Source: `.raw/papers/rao-et-al-2011-identifying-faults-noisy-error-logs.pdf`(MD5: `034549e3e90bac2c628fff1816db4915`、IEEE 2011、IEEE Xplore 文書番号 5958800)
- Summary: [[@2011__SRDS__Identifying Faults in Large-Scale Distributed Systems by Filtering Noisy Error Logs]]
- Pages created: [[@2011__SRDS__Identifying Faults in Large-Scale Distributed Systems by Filtering Noisy Error Logs]] / [[Xiang Rao]] / [[Huaimin Wang]] / [[National University of Defense Technology]]
- Pages updated: [[ログ解析]] / [[障害注入]] / sources/_index / entities/_index / concepts/_index(更新なし) / index.md / hot.md / log.md / .raw/.manifest.json
- Key insight: 2011 年時点の Alibaba Cloud 実証で、障害注入テストには注入した以外のノイズ障害が必然的に共存し、時間/空間圧縮だけでは障害特徴抽出の再現率が 30% まで低下する——この「ノイズログを源流で除去する」設計思想は、2024 年の LogCleaner・LogReducer の先駆け。
## [2026-06-14] ingest-paper | ByteSeries: An In-Memory Time Series Database for Large-Scale Monitoring Systems
- Source: `.raw/papers/socc20-byteseries.pdf`(MD5: `a3de4331b7e378944057a7cd09e3d850`、SoCC 2020)
- Summary: [[@2020__SoCC__ByteSeries - An In-Memory Time Series Database for Large-Scale Monitoring Systems]]
- Pages created: [[@2020__SoCC__ByteSeries - An In-Memory Time Series Database for Large-Scale Monitoring Systems]] / [[Xuanhua Shi]] / [[Yongluan Zhou]] / [[University of Copenhagen]] / [[ByteSeries]] / [[tsdc]]
- Pages updated: [[Bingsheng He]] / [[ByteDance]] / [[Huazhong University of Science and Technology]] / [[National University of Singapore]] / [[時系列データベース]] / sources/_index / entities/_index / index.md / hot.md / log.md / .raw/.manifest.json
- Key insight: 超高次元監視 TSDB ではデータ点圧縮よりメタデータ(系列キー・タグ)の圧縮がボトルネックであり、Compressed Inverted Index(trie + p4nzenc64)は圧縮とグループ集計を単一データ構造で両立することで多次元クエリを 1.8〜10.7 倍高速化した——これは Gorilla 的データ点圧縮最適化とは直交する課題空間。
## [2026-06-14] ingest-paper | Black-box inter-application traffic monitoring for adaptive container placement
- Source: `.raw/papers/acm-3341105-3374007.pdf`(MD5: `2f10edb15dc5f6a11d43d8f3229601e9`、8 ページ)
- Summary: [[@2020__SAC__Black-box inter-application traffic monitoring for adaptive container placement]]
- Pages created: [[@2020__SAC__Black-box inter-application traffic monitoring for adaptive container placement]]・[[Francisco Neves]]・[[Ricardo Vilaça]]・[[José Pereira]]・[[HASLab]]・[[University of Minho]]・[[コンテナ配置最適化]]
- Pages updated: [[eBPF]]・[[分散トレーシング]]・sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md
- Key insight: eBPF カーネル内集約(KernelAgg)は per-connection バイトカウンタを `<pid,sock>` マップで保持し周期的に転送することで 9% オーバーヘッドでコンテナ間通信グラフを構築できる——UserAgg(68%)・Scope方式(1% だが量不可)との設計空間整理。
## [2026-06-14] ingest-paper | Chronix: Long Term Storage and Retrieval Technology for Anomaly Detection in Operational Data
- Source: `.raw/papers/fast17-lautenschlager.pdf`
- Summary: [[@2017__FAST__Chronix - Long Term Storage and Retrieval Technology for Anomaly Detection in Operational Data]]
- Pages created: [[@2017__FAST__Chronix - Long Term Storage and Retrieval Technology for Anomaly Detection in Operational Data]], [[Florian Lautenschlager]], [[Michael Philippsen]], [[Andreas Kumlehn]], [[Josef Adersberger]], [[QAware GmbH]], [[Friedrich-Alexander-Universität Erlangen-Nürnberg]], [[Chronix]]
- Pages updated: [[時系列データベース]], [[異常検知]], [[専用データベースシステム]] + sources/_index, entities/_index, index.md, hot.md, log.md, manifest
- Key insight: 汎用 TSDB はデータモデル制約(数値スカラー型のみ)によって異常検知の探索的分析を根本から制限しており、ドメイン固有 TSDB(Chronix の DDC・汎用データモデル・ビルトイン解析)との性能差は 20〜97% に達する——「どう検知するか」より「何を保存・相関できるか」が検知可能空間を決める 2017 年の先行実証
## [2026-06-14] ingest-paper | Gorilla: A Fast, Scalable, In-Memory Time Series Database
- Source: `.raw/papers/Pelkonen-et-al.-2015---Gorilla---a-fast-scalable-in-memory-time-series-database-1.pdf`(MD5: `afd40fee058eb419b6e6961df91d2e78`、12 ページ)
- Summary: [[@2015__VLDB__Gorilla - A Fast, Scalable, In-Memory Time Series Database]]
- Pages created: source 1([[@2015__VLDB__Gorilla - A Fast, Scalable, In-Memory Time Series Database]])+ entity 2([[Gorilla]]・[[Tuomas Pelkonen]])
- Pages updated: [[時系列データベース]](横断的知見 2 項・未解決の問い 1 項追加)・[[メインメモリデータベース]](横断的知見 2 項・未解決の問い 1 項追加)・[[Facebook]]・`wiki/sources/_index.md`・`wiki/entities/_index.md`・[[index]]・[[hot]]・[[log]]・manifest
- Key insight: 監視 TSDB は「個々のデータ点ロスは許容可能、最新データの可用性が優先」という設計哲学により ACID を捨てた。この一点が非 WAL ログ・部分結果の返却・最新ブロック優先復元に一貫して反映され、HBase 比 73 倍高速化と 12 倍圧縮の両立を可能にした。Gorilla 圧縮は後続 TSDB の事実上の標準になった。
## [2026-06-14] ingest-paper | B-Trees Are Back: Engineering Fast and Pageable Node Layouts
- Source: `.raw/papers/1-3709664.pdf`(MD5: `368c6aca1c84afb5d57fd9708e14486a`)
- Summary: [[@2025__SIGMOD__B-Trees Are Back - Engineering Fast and Pageable Node Layouts]]
- Pages created: source 1([[@2025__SIGMOD__B-Trees Are Back - Engineering Fast and Pageable Node Layouts]])+ concept 2([[B-Tree]]・[[B-Treeノードレイアウト最適化]])+ entity 6([[Marcus Müller]]・[[Lawrence Benson]]・[[Viktor Leis]]・[[btree-cpp]]・[[btree24]]・[[vmcache]])
- Pages updated: [[TU Munich]]・[[LSMツリー]]・[[メインメモリデータベース]]・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・[[index]]・[[hot]]・[[log]]・manifest
- Key insight: B-Tree は「古いディスク向け構造」ではなく、可変長 record と 4 KiB page を保ったまま node layout を再工学すれば、range scan・paging・DBMS 統合の利点を維持しつつ、純インメモリ索引との lookup 性能差を大きく縮められる。
## [2026-06-14] ingest-paper | LLM-Oriented Information Retrieval: A Denoising-First Perspective
- Source: `.raw/papers/arxiv-2605.00505.pdf`(MD5: `fbddd621383f474e177f5a2ea8c7333e`)
- Summary: [[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]]
- Pages created: source 1([[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]])+ concept 2([[LLM向け情報検索]]・[[RAGノイズ除去]])+ entity 7([[Lu Dai]]・[[Liang Sun]]・[[Fanpu Cao]]・[[Ziyang Rao]]・[[Cehao Yang]]・[[Hao Liu]]・[[Hui Xiong]])
- Pages updated: [[エージェント型コーディング]]・[[エージェント型強化学習]]・[[Hong Kong University of Science and Technology, Guangzhou]]・[[Hong Kong University of Science and Technology]]・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・[[index]]・[[hot]]・[[log]]・manifest
- Key insight: LLM 向け IR では検索結果の消費者が人間から LLM へ変わるため、検索器は raw recall を最大化するだけでなく、文脈ウィンドウ内の証拠密度・検証可能性・安全性を制御するノイズゲートになる必要がある。
## [2026-06-14] ingest-paper | Rethinking The Compaction Policies in LSM-trees
- Source: `.raw/papers/acm-3725344.pdf`(MD5: `72a51ef41063576d73cdafd70c303894`)
- Summary: [[@2025__SIGMOD__Rethinking The Compaction Policies in LSM-trees]]
- Pages created: source 1([[@2025__SIGMOD__Rethinking The Compaction Policies in LSM-trees]])+ concept 1([[LSMツリーコンパクション]])+ entity 7([[Hengrui Wang]]・[[Jiansheng Qiu]]・[[Fangzhou Yuan]]・[[Huanchen Zhang]]・[[EcoTune]]・[[RocksDB]]・[[Shanghai Qi Zhi Institute]])
- Pages updated: [[LSMツリー]]・[[データベースノブチューニング]]・[[データベース O&M]]・[[Tsinghua University]]・`wiki/sources/_index.md`・`wiki/entities/_index.md`・`wiki/concepts/_index.md`・[[index]]・[[hot]]・[[log]]・manifest
- Key insight: LSM ツリーのコンパクションは WA/RA の静的トレードオフだけではなく、将来の平均クエリスループットへ CPU/I/O を投資する時点選択問題である。EcoTune は三レベルモデルと動的計画法で、RocksDB 上で Leveling 比 1.5〜3 倍、Lazy Leveling 比最大 1.8 倍の平均クエリスループットを示した。
## [2026-06-14] ingest-paper | Correlating Instrumentation Data to System States: A Building Block for Automated Diagnosis (OSDI 2004)
- Source: `.raw/papers/cohen.pdf`(MD5: `e43cc257bd2a94e36fdddf507ad20271`)
- Summary: [[@2004__OSDI__Correlating Instrumentation Data to System States - A Building Block for Automated Diagnosis]]
- Pages created: source 1([[@2004__OSDI__Correlating Instrumentation Data to System States - A Building Block for Automated Diagnosis]])+ entity 7([[Ira Cohen]]・[[Moises Goldszmidt]]・[[Terence Kelly]]・[[Julie Symons]]・[[Jeffrey S. Chase]]・[[HP Labs]]・[[Duke University]])
- Pages updated: [[根本原因分析]](横断的知見追加: 「相関 ≠ 因果」は 2004 年から意識)・[[異常検知]](SLO 二値分類の 2004 年実証)・[[Fault Localization]](メトリクス帰属の先駆的定式化)+ sources/_index・entities/_index・index.md・hot.md・log.md・manifest
- Key insight: 単一メトリクス(CPU 使用率)ルールは STEP ワークロードで balanced accuracy 56% に落ち込み、3–8 個のメトリクスを TAN で組み合わせることで 87–94% を達成。「メトリクス帰属(metric attribution)」と「相関 ≠ 因果」の制約を 2004 年に明示化しており、現代の MetricSifter 等のメトリクス選択研究の直接的先行。
## [2026-06-14] ingest-paper | Humanity's Last Exam (arXiv 2025)
- Source: `.raw/papers/arxiv-2501.14249.pdf`
- Summary: [[@2025__arXiv__Humanity's Last Exam]]
- Pages created: source 1([[@2025__arXiv__Humanity's Last Exam]])+ entity 4([[Dan Hendrycks]]・[[Long Phan]]・[[Center for AI Safety]]・[[Scale AI]])
- Pages updated: [[LLM評価]](ベンチマーク飽和・最前線ベンチマーク設計・横断的知見 4 項追加)+ sources/_index・entities/_index・index.md・hot.md・log.md・manifest
- Key insight: MMLU など既存ベンチマークを飽和させた最先端モデルでも HLE では最高 13.4% の正解率にとどまり、全モデルで RMS キャリブレーション誤差 73〜89% と誤答時も高確信度を示す。「ベンチマーク飽和は不可避であり評価設計はモデル進化と競争する」という構造的課題を最前線規模で定量化した。
## [2026-06-14] ingest-paper | Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (arXiv 2024)
- Source: `.raw/papers/arxiv-2403.04132.pdf`
- Summary: [[@2024__arXiv__Chatbot Arena - An Open Platform for Evaluating LLMs by Human Preference]]
- Pages created: source 1([[@2024__arXiv__Chatbot Arena - An Open Platform for Evaluating LLMs by Human Preference]])+ entity 4([[Wei-Lin Chiang]]・[[Lianmin Zheng]]・[[LMSYS]]・[[Chatbot Arena]])+ concept 1([[LLM評価]])
- Pages updated: [[Ion Stoica]](関連リンク・説明追記)+ sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: Chatbot Arena はクラウドソーシング型ペアワイズ比較で LLM を評価し、Bradley-Terry モデルが Elo より頑健な統計的ランキングを実現。能動サンプリングで win matrix 推定に必要な票数をランダム比で最大 54% 削減。クラウド投票と専門家評価の一致率は 72〜83% で、差分は主に「事実誤りの見落とし」に起因。
## [2026-06-14] ingest-paper | Root Cause Analysis for Microservices based on Causal Inference - How Far Are We (ASE 2024)
- Source: `.raw/papers/1-3691620.3695065.pdf`
- Summary: [[@2024__ASE__Root Cause Analysis for Microservices based on Causal Inference - How Far Are We]]
- Pages created: source 1([[@2024__ASE__Root Cause Analysis for Microservices based on Causal Inference - How Far Are We]])+ entity 6([[Luan Pham]]・[[Huong Ha]]・[[Hongyu Zhang]]・[[RMIT University]]・[[Chongqing University]]・[[RCAEval]])+ concept 1([[因果推論ベースRCA]])
- Pages updated: [[根本原因分析]](横断的知見 2 項追加)・[[Fault Localization]](横断的知見 1 項追加)+ sources/_index・entities/_index・concepts/_index・index.md・hot.md・log.md・manifest
- Key insight: Dummy ベースライン(ランダム選択)を初めて因果推論ベース RCA 評価に導入し、PC/FCI/Granger 系手法の多くが Dummy 同等にとどまることを実証。因果グラフ F1 は 0.10〜0.54 で辺方向推定が全手法の共通ボトルネック。仮説検定系(BARO・NSigma)はグラフ構築をスキップして最良。
## [2026-06-14] ingest | Intelligent Monitoring: Towards AI-Assisted Monitoring for Cloud Services (Microsoft Research Blog)
- Source: `.raw/articles/intelligent-monitoring-towards-ai-assisted-monitoring-for-cloud-services-2026-06-14.md`
- Summary: [[@2024__Microsoft Research Blog__Intelligent Monitoring - Towards AI-Assisted Monitoring for Cloud Services]]
- Pages created: source 1([[@2024__Microsoft Research Blog__Intelligent Monitoring - Towards AI-Assisted Monitoring for Cloud Services]])+ entity 2([[Avi Nayak]]・[[Piyali Jana]])
- Pages updated: [[Rujia Wang]]・[[クラウドモニタリング]](Monitor Scorecards を未解決の問いに追加・出典追加)+ sources/_index・entities/_index・index.md・hot.md・log.md・manifest
- Key insight: ICSE-SEIP 2024 論文の論文未掲載情報として Monitor Scorecards(ベイズ統計+時系列モデリングでモニタ有効性をインシデント分析・影響評価で体系評価)が予告されており、「推奨」フェーズの後段に「評価」フェーズを閉じるサイクルが計画されている。
## [2026-06-14] ingest-paper | Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey
- Source: `.raw/papers/Soldani-and-Brogi-2021---Anomaly-Detection-and-Failure-Root-Cause-Analysis-in-MicroService-Based-Cloud-Applications---A-Survey.pdf`(MD5: `3eccc760cfbf57aac969d98aa11edcf7`)
- Summary: [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey]]
- Pages created: [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey]], [[Jacopo Soldani]], [[Antonio Brogi]]
- Pages updated: [[異常検知]], [[根本原因分析]], `wiki/sources/_index.md`, `wiki/entities/_index.md`, [[index]], [[hot]], [[log]]
- Key insight: データ源(ログ/分散トレース/監視メトリクス)× 手法の 2 軸でマイクロサービス向け異常検知 25 手法・RCA 26 手法を統合分類した 2021 年の基礎サーベイ。PC アルゴリズム + ランダムウォークが pre-LLM era の標準 RCA パイプラインとして確立し、「相関 ≠ 因果」と「説明可能性・対策推奨・継続的変化への対応」という未解決課題を 2021 年に定義していた。
## [2026-06-14] ingest-paper | Intelligent Monitoring Framework for Cloud Services - A Data-Driven Approach
- Source: `.raw/papers/arxiv-2403.07927.pdf`(MD5: `5e350e9b8d00107d53a2061cad451bfc`)
- Summary: [[@2024__ICSE-SEIP__Intelligent Monitoring Framework for Cloud Services - A Data-Driven Approach]]
- Pages created: [[@2024__ICSE-SEIP__Intelligent Monitoring Framework for Cloud Services - A Data-Driven Approach]], [[Pooja Srinivas]], [[Fiza Husain]], [[Ayush Choure]]
- Pages updated: [[Anjaly Parayil]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[クラウドモニタリング]]
- Key insight: 791 本番サービスの実証分析がモニタオントロジー(13 リソースクラス・9 SLO タイプ)を導出し、サービスの依存グラフ+コンポーネントだけからモニタ推奨を自動化できることを実証した——「何を監視するか」問題に対する初のデータ駆動アプローチ。
## [2026-06-14] ingest-paper | Detection Is Better Than Cure - A Cloud Incidents Perspective
- Source: `.raw/papers/acm-3611643-3613898.pdf`(MD5: `703abef803dac1bf1aa991544103215a`)
- Summary: [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]]
- Pages created: [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]], [[Vaibhav Ganatra]], [[Yu Kang]], [[Anjaly Parayil]], [[クラウドモニタリング]]
- Pages updated: [[Chetan Bansal]], [[Supriyo Ghosh]], [[Suman Nath]], [[Jonathan Mace]], [[Minghua Ma]], [[インシデント管理]], [[異常検知]]
- Key insight: Microsoft 本番の実証分析が、ミス検知の 40% 超が「モニタ不在」に起因することを示し、AIOps 研究が「いかに検知するか」より「何を監視すべきか」という上位問題を先に解く必要があることを定量的に裏づけた。
## [2026-06-14] ingest-paper | CNCF TAG Observability Whitepaper v1.0
- Source: `.raw/articles/cncf-observability-whitepaper.md`(MD5: `137eec87ac483314adba22a0d5099720`)
- Summary: [[@2023__CNCF TAG Observability__Observability Whitepaper]]
- Pages created: [[@2023__CNCF TAG Observability__Observability Whitepaper]], [[CNCF]], [[TAG Observability]], [[Liz Fong-Jones]], [[継続的プロファイリング]]
- Pages updated: [[オブザーバビリティ]], [[テレメトリ]], [[エラーバジェット]], [[OpenTelemetry]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 従来の「三本柱(ログ/メトリクス/トレース)」を 5 シグナルへ拡張し、Exemplar によるメトリクス→トレース横断ナビゲーションと SLO バーンレートアラートの定量的フレームワークを提供した CNCF の産業コンセンサスドキュメント。
## [2026-06-14] ingest-paper | Performance Anomaly Detection and Bottleneck Identification (Ibidunmoye+ CSUR2015)
- Source: `.raw/papers/Ibidunmoye-et-al.-2015---Performance-anomaly-detection-and-bottleneck-identification.pdf`
- Summary: [[@2015__CSUR__Performance Anomaly Detection and Bottleneck Identification]]
- Pages created: [[@2015__CSUR__Performance Anomaly Detection and Bottleneck Identification]], [[Olumuyiwa Ibidunmoye]], [[Francisco Hernández-Rodriguez]], [[Erik Elmroth]], [[Umeå University]]
- Pages updated: [[異常検知]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 2015年時点の PADBI サーベイで調査論文の 53% が PAD のみを扱い PADBI 統合は 18%——10 年後の現代でも「検知だけで根本原因特定を含まない」という批判が続く同型問題が定量的に裏付けられた最初の証拠。
## [2026-06-14] ingest-paper | How to Manage Change-Induced Incidents (Zhao+ ISSRE2023)
- Source: `.raw/papers/How_to_Manage_Change-Induced_Incidents_Lessons_from_the_Study_of_Incident_Life_Cycle.pdf`
- Summary: [[@2023__ISSRE__How to Manage Change-Induced Incidents - Lessons from the Study of Incident Life Cycle]]
- Pages created: [[@2023__ISSRE__How to Manage Change-Induced Incidents - Lessons from the Study of Incident Life Cycle]], [[Yujin Zhao]], [[Ling Jiang]], [[Ye Tao]], [[Songlin Zhang]], [[Changlong Wu]], [[Yifan Wu]], [[Zhonghai Wu]], [[変更起因インシデント]]
- Pages updated: [[インシデント管理]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: RbIC(即時原因除去前の回復)を選択できれば TTM を 40.6% 短縮できる——緩和プロセス選択自体が TTM を律速するという新しい介入軸を定式化した最初の研究。
## [2026-06-14] ingest-paper | An Empirical Study on Change-induced Incidents (Wu+ ICSE-SEIP2023)
- Source: `.raw/papers/An_Empirical_Study_on_Change-induced_Incidents_of_Online_Service_Systems.pdf`
- Summary: [[@2023__ICSE-SEIP__An Empirical Study on Change-induced Incidents of Online Service Systems]]
- Pages created: [[@2023__ICSE-SEIP__An Empirical Study on Change-induced Incidents of Online Service Systems]], [[Bingxu Chai]], [[Bingchang Liu]], [[Jianguo Li]], [[Yong Yang]], [[Wei Jiang]]
- Pages updated: [[インシデント管理]], [[変更起因インシデント]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: Ant Group 実証で変更起因インシデントの TTD 75 パーセンタイルが通常の 26.8 倍長い——変更直後の監視設計の欠陥が「検知の遅延」として定量化された。
## [2026-06-14] ingest-paper | Towards Observability Data Management at Scale
- Source: `.raw/papers/1-3456859.3456863.pdf`
- Summary: [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]]
- Pages created: [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]], [[Suman Karumuri]], [[Franco Solleza]], [[Stan Zdonik]], [[Nesime Tatbul]], [[Slack Technologies]]
- Pages updated: [[オブザーバビリティデータモデル]], [[テレメトリ]], [[時系列データベース]], [[Brown University]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: Slack の実測データでクエリの 97% 超が <24h データを対象とすることを定量化し、「リアルタイム/履歴の分離」をアーキテクチャ原則として裏付けた最初の産業論文。MELT 4 型分類の初出。
## [2026-06-14] ingest-paper | A Survey on Observability of Distributed Edge & Container-Based Microservices
- Source: `.raw/papers/Usman-et-al.-2022---A-survey-on-observability-of-distributed-edge--container-based-microservices.pdf`
- Summary: [[@2022__IEEE ACCESS__A Survey on Observability of Distributed Edge & Container-Based Microservices]]
- Pages created: [[@2022__IEEE ACCESS__A Survey on Observability of Distributed Edge & Container-Based Microservices]], [[Muhammad Usman]], [[Simone Ferlin]], [[Anna Brunstrom]], [[Javid Taheri]], [[Karlstad University]], [[オブザーバビリティ]]
- Pages updated: [[テレメトリ]], [[分散トレーシング]], [[マイクロサービスアーキテクチャ]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 「モニタリング vs オブザーバビリティ」は代替でなく補完関係であり、三本柱(ログ/メトリクス/トレース)とゴールデンシグナルという2022年時点の標準的枠組みが本論文で体系化された。統合オブザーバビリティプラットフォームの不在は当時から未解決の最大課題。
## [2026-06-14] ingest-paper | Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
- Source: `.raw/papers/arxiv-2201.11903.pdf`
- Summary: [[@2022__NeurIPS__Chain-of-Thought Prompting Elicits Reasoning in Large Language Models]]
- Pages created: [[@2022__NeurIPS__Chain-of-Thought Prompting Elicits Reasoning in Large Language Models]], [[Chain-of-Thought Prompting]], [[Jason Wei]], [[Denny Zhou]]
- Pages updated: [[Google Brain]] + index/log/hot/manifest
- Key insight: 連鎖思考推論は約 100B パラメータ以上の LLM にのみ現れる創発的能力であり、少数の例示を追加するだけで微調整なしに算術・常識・記号推論の SOTA を更新できる。
## [2026-06-14] ingest-paper | Scaling Laws for Autoregressive Generative Modeling
- Source: `.raw/papers/arxiv-2010.14701.txt`
- Summary: [[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling]]
- Pages created: [[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling]] / [[Tom Henighan]]
- Pages updated: [[OpenAI]] / [[LLMスケーリング則]] / [[Jared Kaplan]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[wiki/concepts/_index.md]] / [[index]] / [[hot]]
- Key insight: スケーリング則は言語以外の全モダリティに普遍的に成立し、最適モデルサイズの指数 $\beta \approx 0.7$ が画像・動画・マルチモーダル・数学問題求解を横断して一定。損失の不可逆成分へのアプローチは下流タスク性能頭打ちを意味せず、「最後の数ビット」に意味論的情報が残る。
## [2026-06-14] ingest-paper | Scaling Laws for Neural Language Models
- Source: `.raw/papers/arxiv-2001.08361.pdf`
- Summary: [[@2020__arXiv__Scaling Laws for Neural Language Models]]
- Pages created: [[スケーリング則]], [[@2020__arXiv__Scaling Laws for Neural Language Models]]
- Pages updated: [[Jared Kaplan]], [[OpenAI]] (+ index/log/hot)
- Key insight: 損失はモデルサイズ N・データ D・計算量 C すべてに対して べき乗則 L∝X^{-α} でスケールし、アーキテクチャ詳細への依存は小さい。
## [2026-06-14] ingest-paper | DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Source: `.raw/papers/arxiv-2402.03300.pdf`(PDF 未取得のため WebFetch で論文情報を取得)
- Summary: [[@2024__arXiv__DeepSeekMath - Pushing the Limits of Mathematical Reasoning in Open Language Models]]
- Pages created: [[@2024__arXiv__DeepSeekMath - Pushing the Limits of Mathematical Reasoning in Open Language Models]]
- Pages updated: [[DeepSeek-AI]] / [[GRPO]] / [[強化ファインチューニング]] / [[強化学習スケーリング]] / [[wiki/sources/_index.md]] / [[wiki/index.md]] / [[hot]] / [[log]] / [[.raw/.manifest.json]]
- Key insight: DeepSeekMath は [[GRPO]] の初出論文であり、「ドメイン特化コーパス構築→継続事前学習→GRPO による RL」という 3 段パイプラインが後続の DeepSeek-R1・DeepSWE・DeepSeek-V3.2 の設計思想の起点となる。価値モデルを廃してグループ内報酬正規化でアドバンテージを推定する設計がメモリ効率とスケーリング安定性を両立させた。
## [2026-06-13] ingest-paper | From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs
- Source: `.raw/papers/arxiv-2605.09370.pdf`
- Summary: [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]]
- Pages created: [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]] / [[Lablup Inc]] / [[Backend.AI]] / [[Sokovan]] / [[Daemyung Kang]]
- Pages updated: [[NVIDIA]] / [[VAST Data]] / [[耐障害LLM訓練]] / [[GPUクラスタ運用]] / [[チェックポイント]] / [[LLM学習モニタリング]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[index]] / [[hot]]
- Key insight: LLM 事前学習の復旧は障害検知だけで決まらず、checkpoint load、NFS/RPC キュー形成、60 ノードのギャングスケジューリング、予備ノード占有、自動リトライ停止条件が一体で律速する。
## [2026-06-13] ingest-paper | Empowering Azure Storage with RDMA
- Source: `.raw/papers/nsdi23-bai.pdf`
- Summary: [[@2023__NSDI__Empowering Azure Storage with RDMA]]
- Pages created: [[@2023__NSDI__Empowering Azure Storage with RDMA]] / [[Wei Bai]] / [[Azure Storage]] / [[RDMA Estats]]
- Pages updated: [[Microsoft]] / [[SONiC]] / [[RDMA]] / [[RDMAネットワーク監視]] / [[分散ストレージ]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[wiki/concepts/_index.md]] / [[index]] / [[hot]]
- Key insight: RDMA は LLM/HPC 向けの高速通信だけでなく、ディスアグリゲートされたクラウドストレージで CPU 予約と I/O レイテンシを下げる基盤でもある。Azure Storage のリージョン内展開は、異世代 NIC・異種スイッチ・PFC/DCQCN・ホスト内輻輳・フェイルオーバー容量計画が RDMA の本番価値を左右することを示す。
## [2026-06-12] ingest-paper | Aurora PostgreSQL Limitless Database: Building a Highly Scalable OLTP Database
- Source: `.raw/papers/1-3788853.3803089.pdf`
- Summary: [[@2026__SIGMOD Companion__Aurora PostgreSQL Limitless Database - Building a Highly Scalable OLTP Database]]
- Pages created: [[@2026__SIGMOD Companion__Aurora PostgreSQL Limitless Database - Building a Highly Scalable OLTP Database]] / [[Aurora Limitless Database]] / [[Dmitry Arkhangelskiy]] / [[分散 PostgreSQL]]
- Pages updated: [[Amazon Web Services]] / [[OLTPシステムアーキテクチャ]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[wiki/concepts/_index.md]] / [[index]] / [[hot]]
- Key insight: Aurora Limitless は OLTP の水平スケールを「PostgreSQL 互換性を捨てた専用再設計」ではなく、ルータ/シャード分離、時刻ベース MVCC、lead shard 付き 2PC、Serverless V2、シャード分割で既存互換性を残したまま拡張する道として示す。OLTP アーキテクチャの評価軸に、純粋性能だけでなく移行容易性、DDL/バックアップ整合性、運用モデルが入る。
## [2026-06-12] ingest-paper | Anomaly detection and root-cause identification in microservices: a survey
- Source: `.raw/papers/1-s10586-026-06095-9.pdf`
- Summary: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey]]
- Pages created: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey]] / [[Luís M. Barata]] / [[Sérgio Sequeira]] / [[Eurico Lopes]] / [[Pedro R. M. Inácio]] / [[Mário M. Freire]] / [[Instituto de Telecomunicações]] / [[Universidade da Beira Interior]] / [[Instituto Politécnico de Castelo Branco]] / [[NOVA LINCS]] / [[Cluster Computing]]
- Pages updated: [[異常検知]] / [[根本原因分析]] / [[マイクロサービスアーキテクチャ]] / [[Fault Localization]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[index]] / [[hot]]
- Key insight: マイクロサービス異常検知/RCA はログ・トレース・監視メトリクスを増やせばよいのではなく、障害種別に合う信号源選別、依存グラフ、評価ベンチ、説明可能性を同時に設計する問題である。サーベイの性能集計は有用な地図だが、データセット・故障種別・指標の不統一により、手法間の優劣としては慎重に読む必要がある。
## [2026-06-11] ingest-paper | RCAgent: Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models
- Source: `.raw/papers/1-3627673.3680016.pdf`
- Summary: [[@2024__CIKM__RCAgent - Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models]]
- Pages created: [[RCAgent]] / [[Zefan Wang]] / [[Zichuan Liu]] / [[Yingying Zhang]] / [[Aoxiao Zhong]] / [[Jihong Wang]] / [[Fengbin Yin]] / [[Lunting Fan]] / [[Lingfei Wu]] / [[Qingsong Wen]] / [[Xi’an Jiaotong University]] / [[Anytime AI]] / [[Squirrel Ai Learning]]
- Pages updated: [[@2024__CIKM__RCAgent - Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models]] / [[AIOps]] / [[根本原因分析]] / [[RCA入力選別]] / [[agentic SRE]] / [[ログ解析]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[index]] / [[hot]]
- Key insight: RCA エージェントの性能は LLM の推論力だけでなく、観測をどう退避・再取得するか、ツールの引数空間をどれだけ意味的に狭めるか、ログ/コード分析を専門エージェントへ分けるかで大きく変わる。RCAgent の SQL/SLS 直接ツール置換が Invalid Rate 70.94% に崩れたことは、agentic SRE の入力選別がデータ量だけでなく行動空間の設計問題でもあることを示す。
## [2026-06-10] ingest-paper | A System-Level Taxonomy of Failure Modes in Large Language Model Applications
- Source: `.raw/papers/1-A_System-Level_Taxonomy_of_Failure_Modes_in_Large_Language_Model_Applications.pdf`
- Summary: [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]]
- Pages created: [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]] / [[Vaishali Vinay]] / [[LLMアプリケーション信頼性]]
- Pages updated: [[Microsoft]] / [[エージェントシステム運用]] / [[運用障害分析]] / [[LLM推論]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[wiki/concepts/_index.md]] / [[index]] / [[hot]]
- Key insight: LLM アプリケーションの信頼性問題は、幻覚や推論誤りに閉じず、入力/コンテキスト境界、ツール/API、マルチエージェント通信、バージョン更新、コスト制約をまたぐシステム失敗として分類する必要がある。静的ベンチマークは安定性・再現性・ドリフトを測れないため、意味的オブザーバビリティと検証レイヤーが運用設計の中核になる。
## [2026-06-10] ingest-paper | Twenty Years of Bigtable(SIGMOD Companion 2026)
- Source: `.raw/papers/1-3788853.3803095.pdf`
- Summary: [[@2026__SIGMOD Companion__Twenty Years of Bigtable]]
- Pages created: [[@2026__SIGMOD Companion__Twenty Years of Bigtable]] / [[Fabio Baltieri]]
- Pages updated: [[Bigtable]] / [[Google]] / [[分散ストレージ]] / [[LSMツリー]] / [[データベース O&M]] / [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[wiki/concepts/_index.md]] / [[index]] / [[hot]]
- Key insight: Bigtable の 20 年史は、分散ストレージの長寿命化が「中核モデルの維持」と「レプリケーション・SQL・CDC・CRDT・ビュー・外部コンパクション・オートサイジング・SRE サービス運用の周辺追加」で成り立つことを示す。スケール後の律速はデータ分割だけでなく、メタデータ管理、位置特定、資源階層化、運用標準化へ移る。
## [2026-06-08] ingest | VictoriaMetrics KubeCon EU 2026 — Retroactive Sampling for OpenTelemetry
- Source: `.raw/articles/kubecon-eu-2026-sampling-2026-06-08.md`
- Summary: [[VictoriaMetrics-KubeCon-EU-2026-Sampling|@2026__VictoriaMetrics Blog__KubeCon EU 2026 Retroactive Sampling]]
- Pages created: [[VictoriaMetrics-KubeCon-EU-2026-Sampling|@2026__VictoriaMetrics Blog__KubeCon EU 2026 Retroactive Sampling]] / [[Retroactive Sampling]] / [[VictoriaTraces]] / [[Zhu Jiekun]]
- Pages updated: [[VictoriaMetrics]] / [[OpenTelemetry]] / [[トレースサンプリング]] / [[Scaling Telemetry Workloads]] / [[index]] / [[hot]]
- Key insight: エッジエージェントで最小属性(33 バイト)のみ中央コレクタへ送りオンディスク FIFO でバッファリングするレトロアクティブサンプリングが、テールサンプリング比でネットワーク 70%・CPU/メモリ 60–70% を削減。Pebble ベースのディスク型テールサンプリングが CPU を 649% 増加させるのに対し、FIFO の逐次 I/O はランダム I/O を避けてコストを維持する。
## [2026-06-08] ingest | AI doesn't need giant supercomputers after all(Glenn K. Lockwood Blog、2026-05-08)
- Source: `.raw/articles/ai-doesnt-need-giant-supercomputers-2026-05-08.md`
- Summary: [[@2026__Glenn K. Lockwood Blog__AI doesnt need giant supercomputers after all]]
- Pages created: [[@2026__Glenn K. Lockwood Blog__AI doesnt need giant supercomputers after all]] / [[Glenn K. Lockwood]] / [[VAST Data]] / [[Microsoft Fairwater]] / [[AWS Rainier]]
- Pages updated: [[LLMスケーリング則]] / [[LLM分散学習]] / [[Microsoft]] / [[OpenAI]] / [[index]] / [[hot]]
- Key insight: 2025 年に OpenAI の超大規模クラスタ訓練モデルが GPT-4o 比トークン単価 15 倍・推論 120 GPU 必要で経済破綻し非推奨化された。競合推論モデルが「小規模旧式クラスタ」で同等成果を達成したことで「スケールより賢さ」へのパラダイム転換が確定的になった。超大規模クラスタの価値は「パラメータ規模」でなく「訓練速度・リスク低減・運用負担軽減」に移った。
## [2026-06-08] ingest-paper | Optimization Techniques for GPU Programming(ACM CSUR 2023, Hijma ほか)
- Source: `.raw/papers/acm-csur-2023-gpu-optimization-hijma.pdf`
- Summary: [[@2023__CSUR__Optimization Techniques for GPU Programming]]
- Pages created: [[@2023__CSUR__Optimization Techniques for GPU Programming]] / [[Pieter Hijma]] / [[Stijn Heldens]] / [[Ben van Werkhoven]] / [[Henri E. Bal]] / [[Alessio Sclocco]] / [[Vrije Universiteit Amsterdam]] / [[Netherlands eScience Center]] / [[GPU最適化]] / [[コアレスドメモリアクセス]] / [[カーネルフュージョン]] / [[分岐発散]] / [[Auto-tuning]]
- Pages updated: [[wiki/sources/_index.md]] / [[wiki/entities/_index.md]] / [[wiki/concepts/_index.md]] / [[index]]
- Key insight: GPU 最適化技術の採用頻度分布と相互依存性が 450 本横断で定量化され、LLM 推論最適化(Flash Attention 等)は GPU 最適化の古典技術の直接応用であることが見通せる一次データを得た。
## [2026-06-08] ingest | Anthropic Engineering Blog: A Postmortem of Three Recent Issues(2025-09-17)
- Source: `.raw/articles/a-postmortem-of-three-recent-issues-2025-09-17.md`
- Summary: [[@2025__Anthropic Engineering Blog__A Postmortem of Three Recent Issues]]
- Pages created: [[@2025__Anthropic Engineering Blog__A Postmortem of Three Recent Issues]] / [[Anthropic]]
- Pages updated: [[LLM推論]] / [[運用障害分析]] / [[index]]
- Key insight: GenAI 本番障害はルーティング・推論設定・コンパイラの 3 層で独立発生しうる。評価カバレッジ問題とプライバシー vs 可観測性のトレードオフという LLM 固有の診断困難性を一次資料として記録した。
## [2026-06-08] ingest-paper | UModel: An Agent-Ready Observability Data Modeling Method at Scale(arXiv:2606.04799)
- Source: `.raw/papers/arxiv-2606.04799.pdf`
- Summary: [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]]
- Pages created: [[wiki/sources/@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]], [[Gaogang Xie]], [[UModel]], [[オブザーバビリティデータモデル]]
- Pages updated: [[Changhua Pei]], [[Dan Pei]], [[Alibaba Cloud]], [[根本原因分析]], [[AIOps]], [[テレメトリ]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]], [[index]]
- Key insight: データモデル層の設計変更(オブジェクト中心モデリング)のみで RCA 精度を 8% 向上させることを Alibaba Cloud 本番 1 年以上で実証。エージェント性能はモデル能力より「何を見せるか」に先行して律速される。
## [2026-06-08] ingest-paper | 機械学習の原点:統計的機械学習の世界(応用物理 2026-05)
- Source: `.raw/papers/oubutsu-2026-95-5-274.pdf`
- Summary: [[@2026__応用物理__機械学習の原点 - 統計的機械学習の世界]]
- Pages created: [[赤穂昭太郎]], [[産業技術総合研究所]], [[統計的機械学習]], [[ベイズ最適化]], [[アンサンブル学習]]
- Pages updated: [[wiki/index.md]], [[wiki/hot.md]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[wiki/concepts/_index.md]]
- Key insight: 応用物理・材料科学の少量データ問題では統計的機械学習が有効であり、MAP 推定とリッジ/LASSO 回帰の同値性・ベイズ最適化による材料パラメータ探索という切り口が AIOps ドメインとは異なる横断知識として wiki に入った。
## [2026-06-08] ingest-paper | XWind: A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms
- Source: `.raw/papers/arxiv-2605.23348.pdf`
- Summary: [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]]
- Pages created: [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]], [[XWind]], [[Debopam Bhattacherjee]], [[AI Greenferencing]]
- Pages updated: [[LLM推論]](可変電力下 KV キャッシュ先行指標・電力制御との統合設計軸を横断的知見と未解決の問いに追加)、[[Microsoft]](XWind/Greenferencing 関連追記)
- Key insight: [[AI Greenferencing]] が提示した「890 GW 超の風力容量が Azure データセンターから 50ms 以内」という実現可能性と、[[XWind]] が実証した「KV キャッシュ利用率を電力制御シグナルとして使う」設計は、LLM 推論の電力・性能統合制御という新しい研究軸を開く。
## [2026-06-08] ingest | Resilient AI Supercomputer Networking: How MRC and SRv6 Keep 100,000+ GPUs Training
- Source: `.raw/articles/resilient-ai-supercomputer-networking-mrc-srv6-2026-05-28.md`
- Summary: [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]]
- Pages created: [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]], [[Ravi Sharma]], [[MRC]], [[SRv6]], [[マルチプレーンClosトポロジ]]
- Pages updated: [[RDMA]], [[OpenAI]]
- Key insight: [[OpenAI]] の 10 万 GPU 超クラスタが採用した「検知・回避・回復」アーキテクチャは、RDMA のパス固定制約を [[MRC]] のパケットスプレーで、経路収束遅延を [[SRv6]] のソースルーティングで、スケーリング限界を [[マルチプレーンClosトポロジ]] の NIC 分割で解く三位一体設計であり、障害を例外から通常事象へ再定義する哲学的転換を伴う。
## [2026-06-07] ingest-paper | Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations
- Source: `.raw/papers/arxiv-2604.26805.pdf`
- Summary: [[@2026__arXiv__Bian Que - An Agentic Framework with Flexible Skill Arrangement for Online System Operations]]
- Pages created: [[@2026__arXiv__Bian Que - An Agentic Framework with Flexible Skill Arrangement for Online System Operations]], [[Kuaishou Technology]], [[Bian Que]], [[Bochao Liu]], [[Ben Chen]], [[Flexible Skill Arrangement]]
- Pages updated: [[AIOps]], [[エージェントシステム運用]], [[根本原因分析]], [[インシデント管理]]
- Key insight: O&M における LLM ボトルネックは推論でなくオーケストレーション(データ・知識の選択)にあり、Skill による事前コンテキスト制御が統一自己進化メカニズムとともに産業スケールで機能することを 6 ヶ月本番デプロイで実証した。
## [2026-06-07] ingest-paper | Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems?
- Source: `.raw/papers/arxiv-2604.26670.pdf`
- Summary: [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]]
- Pages created: [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]], [[Runzhou Wang]], [[NexusRCL]]
- Pages updated: [[Dan Pei]], [[Shenglin Zhang]], [[Nankai University]], [[Fault Localization]]
- Key insight: マイクロサービス RCL ではエンティティレベル異質性(サービス vs ホスト)の非対称クロスレイヤー伝播が精度を律速し、異種グラフで明示的に分離すると均質グラフ比で A@1 が最大 45pt 向上することを実証した
## [2026-06-07] ingest-paper | See More, Forecast Better and Faster (SPRINT, ICML 2026)
- Source: `.raw/papers/d5a1c41e-ICML26_SPRINT_20260522.pdf`
- Summary: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]]
- Pages created: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]], [[Longlong Xu]], [[Zeyan Li]], [[SPRINT]]
- Pages updated: [[時系列基盤モデル]], [[Dan Pei]], [[Changhua Pei]]
- Key insight: 学習不要の推論時ダウンサンプリングラッパーが、TSFM のアーキテクチャ変更なしに精度と効率を同時改善できることを、Nyquist-Shannon 定理に基づく理論保証と 7 TSFM × 9 データセットの実証で示した
## [2026-06-07] ingest-paper | Agent System Operations: Categorization, Challenges, and Future Directions
- Source: `.raw/papers/arxiv-2606.01581.pdf`
- Summary: [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]]
- Pages created: [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]], [[エージェントシステム運用]], [[Zexin Wang]], [[David Lo]], [[Yintong Huo]]
- Pages updated: [[AIOps]](AgentOps 子領域追加), [[異常検知]](エージェント固有タクソノミー追加), [[根本原因分析]](失敗帰属 3 カテゴリ追加)
- Key insight: エージェントシステムの RCA は「インフラ箇所特定」から「実行トラジェクトリ上の決定ポイント特定(失敗帰属)」へ移行し、LLM ベース手法はコンテキスト長増大で精度が低下するが非 LLM ベースは安定するという相補性が確認された。
## [2026-06-07] ingest-paper | ChainScope: Balancing Accuracy and Overhead in Non-intrusive Distributed Tracing of Microservices
- Source: `.raw/papers/2026__CoNEXT__ChainScope.pdf`
- Summary: [[@2026__CoNEXT__ChainScope - Balancing Accuracy and Overhead in Non-intrusive Distributed Tracing of Microservices]]
- Pages created: [[wiki/sources/@2026__CoNEXT__ChainScope - Balancing Accuracy and Overhead in Non-intrusive Distributed Tracing of Microservices.md]], [[Ruipeng Hong]], [[Gabriele Castellano]], [[Massimo Gallo]]
- Pages updated: [[Pengfei Chen]], [[分散トレーシング]], [[eBPF]], [[wiki/sources/_index.md]], [[wiki/entities/_index.md]], [[index]], [[hot]], [[log]]
- Key insight: eBPF カーネル内 IP レベルタギング + ヘッドサンプリングが「非侵襲・高カバレッジ・低オーバーヘッド・高精度」の 4 目標を同時達成できることを実験で示した。DeepFlow(暗黙伝搬)とBeyla(明示伝搬)の二択ではなく、IP 層への明示伝搬 + カーネルサンプリングという設計空間の空白を埋める。
## [2026-06-07] ingest | Batch: SRE Workbook selected chapters
- Source: `.raw/articles/foreword-I-2026-06-07.md`, `.raw/articles/foreword-II-2026-06-07.md`, `.raw/articles/how-sre-relates-2026-06-07.md`, `.raw/articles/implementing-slos-2026-06-07.md`, `.raw/articles/slo-engineering-case-studies-2026-06-07.md`, `.raw/articles/monitoring-2026-06-07.md`, `.raw/articles/alerting-on-slos-2026-06-07.md`, `.raw/articles/eliminating-toil-2026-06-07.md`, `.raw/articles/simplicity-2026-06-07.md`, `.raw/articles/part-II-practices-2026-06-07.md`, `.raw/articles/on-call-2026-06-07.md`, `.raw/articles/incident-response-2026-06-07.md`, `.raw/articles/sre-workbook-postmortem-culture-2026-06-07.md`, `.raw/articles/sre-workbook-conclusion-2026-06-07.md`, `.raw/articles/sre-workbook-slo-document-2026-06-07.md`, `.raw/articles/sre-workbook-error-budget-policy-2026-06-07.md`, `.raw/articles/sre-workbook-postmortem-analysis-2026-06-07.md`
- Summary: [[@2018__Google SRE Workbook__Foreword I]], [[@2018__Google SRE Workbook__Foreword II]], [[@2018__Google SRE Workbook__Chapter 1 How SRE Relates to DevOps]], [[@2018__Google SRE Workbook__Chapter 2 Implementing SLOs]], [[@2018__Google SRE Workbook__SLO Engineering Case Studies]], [[@2018__Google SRE Workbook__Monitoring]], [[@2018__Google SRE Workbook__Alerting on SLOs]], [[@2018__Google SRE Workbook__Eliminating Toil]], [[@2018__Google SRE Workbook__Simplicity]], [[@2018__Google SRE Workbook__Part II Practices]], [[@2018__Google SRE Workbook__On-Call]], [[@2018__Google SRE Workbook__Incident Response]], [[@2018__Google SRE Workbook__Chapter 10 Postmortem Culture - Learning from Failure]], [[@2018__Google SRE Workbook__Conclusion]], [[@2018__Google SRE Workbook__Appendix A Example SLO Document]], [[@2018__Google SRE Workbook__Appendix B Example Error Budget Policy]], [[@2018__Google SRE Workbook__Appendix C Results of Postmortem Analysis]]
- Pages created: 17 source pages, [[SRE Workbook]]
- Pages updated: [[SRE Book]], [[SRE]], [[サービスレベル目標]], [[エラーバジェット]], [[トイル]], [[テレメトリ]], [[インシデント管理]], [[index]], [[hot]]
- Key insight: SRE Workbook は SRE Book の原則を、SLO 文書・エラーバジェット方針・複数ウィンドウ複数バーン率アラート・オンコール設計・インシデント対応訓練・ポストモーテムテンプレートへ具体化する。SRE の核は「約束を設定し、測定し、予算消費に応じて行動を変える」運用システムとして再確認された。
## [2026-06-07] ingest-paper | Batch: Transformer + GPT-1/2/3 foundational papers
- Source: `.raw/papers/arxiv-1706.03762.pdf`, `.raw/papers/language_understanding_paper.pdf`, `.raw/papers/language_models_are_unsupervised_multitask_learners.pdf`, `.raw/papers/1457c0d6bfcb4967418bfb8ac142f64a-Paper.pdf`
- Summary: [[@2017__NeurIPS__Attention Is All You Need]], [[@2018__OpenAI__Improving Language Understanding by Generative Pre-Training]], [[@2019__OpenAI__Language Models are Unsupervised Multitask Learners]], [[@2020__NeurIPS__Language Models are Few-Shot Learners]]
- Pages created: [[@2017__NeurIPS__Attention Is All You Need]], [[@2018__OpenAI__Improving Language Understanding by Generative Pre-Training]], [[@2019__OpenAI__Language Models are Unsupervised Multitask Learners]], [[@2020__NeurIPS__Language Models are Few-Shot Learners]], [[Transformer]], [[言語モデル事前学習]], [[文脈内学習]], [[Ashish Vaswani]], [[Noam Shazeer]], [[Aidan Gomez]], [[Illia Polosukhin]], [[Google Brain]], [[Łukasz Kaiser]], [[Jakob Uszkoreit]], [[Niki Parmar]], [[Llion Jones]], [[OpenAI]], [[Alec Radford]], [[Ilya Sutskever]], [[Karthik Narasimhan]], [[Tim Salimans]], [[Dario Amodei]], [[Jeffrey Wu]], [[Rewon Child]], [[GPT-2]], [[GPT-3]], [[WebText]], [[Tom Brown]], [[Jared Kaplan]]
- Pages updated: [[LLMスケーリング則]](GPT-2/3 のスケーリング観察追加)、[[OpenAI]](GPT-2/3 情報追記)、[[Alec Radford]](GPT-2/3 役割追記)、[[Ilya Sutskever]](GPT-2/3 役割追記)、[[Dario Amodei]](GPT-3 役割追記)
- Key insight: GPT-1→GPT-2→GPT-3 でパラダイムが「事前学習+微調整」→「ゼロショット転移」→「文脈内学習」へ発展し、Transformer のデコーダ部分だけで 3 桁のパラメータ拡大をアーキテクチャ変更なしに吸収した。後の LLM スケーリング則研究の実験的基盤。
## [2026-06-06] ingest-paper | OLTP through the looking glass, and what we found there
- Source: `.raw/papers/Harizopoulos-et-al.-2008---OLTP-through-the-looking-glass-and-what-we-found-there.pdf`
- Summary: [[@2008__SIGMOD__OLTP through the looking glass, and what we found there]]
- Pages created: [[@2008__SIGMOD__OLTP through the looking glass, and what we found there]], [[OLTPシステムアーキテクチャ]], [[メインメモリデータベース]]
- Pages updated: [[Stavros Harizopoulos]](HP Labs への所属更新・SIGMOD 2008 の主な貢献として筆頭著者を明記)、[[Daniel J. Abadi]](sources 追加)、[[Michael Stonebraker]](sources 追加)、[[Samuel Madden]](sources 追加)、`wiki/sources/_index.md`, `wiki/concepts/_index.md`, `wiki/index.md`, `wiki/hot.md`
- Key insight: Shore RDBMS の命令数分解により「単一の高い杭は存在しない」ことを実測。バッファマネージャ(New Order で 34.6%)が最大だが、ロック・ログ・ラッチがそれぞれ 11〜16% を占め、4 コンポーネント全除去で初めて 20 倍のスループット改善が実現する。メモリ常駐単体では 2.7 倍にとどまり、アーキテクチャ全体の再設計が必要であることを定量的に実証した。
## [2026-06-06] refactor | concepts 層整理
- **統合**: RPC規模特性 / RPCレイテンシ特性 を [[クラウドスケールRPC特性]] に統合し、旧名は aliases として保持。wiki 内の旧 wikilink は新 concept へ更新。
- **分解**: 肥大化した [[根本原因分析]] を親ページへ圧縮し、[[RCA入力選別]] / [[RCA評価設計]] / [[仮説駆動RCA]] / [[ドメイン別RCA]] を新設。
- **親子化**: [[AIOps]] / [[agentic SRE]] / [[LLM分散学習]] / [[データベース O&M]] を地図ページとして圧縮し、詳細論点を既存子 concept へ寄せた。
- **補完**: lint stub だった [[Fat-Tree]] / [[RDMA]] / [[クリティカルパス分析]] / [[ワークフロー自動化]] を出典付きの最小 concept に更新。必須見出しと `sources` frontmatter、[[concepts/_index]] / [[index]] の Concepts 一覧を同期。
## [2026-06-06] ingest | SRE Book Ch10-18, 28-33 統合
- **ソース**: [[@2016__OReilly__SRE Book - Chapter 10 Practical Alerting from Time-Series Data]] / [[@2016__OReilly__SRE Book - Chapter 11 Being On-Call]] / [[@2016__OReilly__SRE Book - Chapter 12 Effective Troubleshooting]] / [[@2016__OReilly__SRE Book - Chapter 13 Emergency Response]] / [[@2016__OReilly__SRE Book - Chapter 14 Managing Incidents]] / [[@2016__OReilly__SRE Book - Chapter 15 Postmortem Culture - Learning from Failure]] / [[@2016__OReilly__SRE Book - Chapter 16 Tracking Outages]] / [[@2016__OReilly__SRE Book - Chapter 17 Testing for Reliability]] / [[@2016__OReilly__SRE Book - Chapter 18 Software Engineering in SRE]] / [[@2016__OReilly__SRE Book - Chapter 28 Accelerating SRE On-Call]] / [[@2016__OReilly__SRE Book - Chapter 29 Dealing with Interrupts]] / [[@2016__OReilly__SRE Book - Chapter 30 Embedding an SRE to Recover from Operational Overload]] / [[@2016__OReilly__SRE Book - Chapter 31 Communication and Collaboration in SRE]] / [[@2016__OReilly__SRE Book - Chapter 32 The Evolving SRE Engagement Model]] / [[@2016__OReilly__SRE Book - Chapter 33 Lessons Learned from Other Industries]]
- **ページ更新**: [[SRE]](横断的知見 11 件・未解決の問い 6 件追加、sources/関連に 15 章追記)/ [[SRE Book]](Part III に Ch10-18、Part IV に Ch28-33 を追記)/ [[インシデント管理]](ICS 4 役割・ブレームレス文化・Outalator の横断的知見追加)/ [[テレメトリ]](Borgmon→Prometheus 系譜の横断的知見追加)/ [[障害緩和]](緊急対応とテスト戦略の横断的知見追加)/ [[根本原因分析]](仮説演繹法の前史の横断的知見追加)/ [[異常検知]](Borgmon 宣言型ルール評価の横断的知見追加)/ [[障害注入]](テスト戦略と DiRT の横断的知見追加)
- **主要な知見**: SRE Book の Practices 9 章と Management 6 章を統合。Borgmon→Prometheus 系譜、ICS に基づくインシデント管理、仮説演繹法によるトラブルシューティング、ブレームレスポストモーテム文化、意図ベースキャパシティプランニング(Auxon)、埋め込み SRE の 3 フェーズモデル、エンゲージメントモデルの進化(PRR→フレームワーク)、航空・医療・製造業からの横断的教訓を、既存の AIOps/agentic SRE 知見と接続。特に仮説演繹法→hypothesis-driven RCA、ICS 4 役割→マルチエージェント SRE の役割設計、テスト信頼性→SRE Benchmark 設計という系譜が明確化。(source +15・pages updated 8)
## [2026-06-06] ingest | SRE NEXT 2024 登壇報告
- Source: `.raw/articles/srenext2024-2024-08-08.md`
- Summary: [[@2024__yuuk.io__SRE-NEXT-2024]]
- Pages created: [[@2024__yuuk.io__SRE-NEXT-2024]], [[SRE NEXT]], [[JAXA]], [[プラットフォームエンジニアリング]]
- Pages updated: [[Yuuki Tsubouchi]](SRE NEXT 2024 登壇実績・ベストスピーカー賞を追記), [[SRE]](source 追加), `wiki/index.md`
- Key insight: [[Yuuki Tsubouchi]] の4年半の博士課程成果の集大成として、SRE を「信頼性を指定可能なパラメータに制御する工学」と定義し直し、オオカミ少年アラート・トレースデータ未活用・インシデント対応改善不全など6つのオープンチャレンジを提示。[[プラットフォームエンジニアリング]]の浸透が SRE の役割境界明確化に寄与したという重要な観察も含む。
## [2026-06-06] ingest-paper | Basic Concepts and Taxonomy of Dependable and Secure Computing
- Source: `.raw/papers/2004-aviz-laprie-randell.pdf`
- Summary: [[@2004__TDSC__Basic Concepts and Taxonomy of Dependable and Secure Computing]]
- Pages created: [[@2004__TDSC__Basic Concepts and Taxonomy of Dependable and Secure Computing]], [[Algirdas Avizienis]], [[Jean-Claude Laprie]], [[Brian Randell]], [[Carl Landwehr]], [[LAAS-CNRS]], [[IFIP WG 10.4]], [[ディペンダビリティ]]
- Pages updated: [[ソフトウェア耐障害性]](Gray 2004 横断知見追加), `wiki/sources/_index.md`, `wiki/entities/_index.md`, `wiki/concepts/_index.md`, `wiki/index.md`, `wiki/hot.md`
- Key insight: ディペンダビリティ(dependability)を「正当に信頼できるサービスを提供する能力」と形式化し、可用性・信頼性・安全性・完全性・保守性・機密性の属性体系と 障害→エラー→失敗 の基本連鎖を確立。SRE・AIOps の概念的基盤として本 wiki に初めて収録。
## [2026-06-06] ingest-paper | Batch: DeepSeek ファミリー 7 論文一括取り込み
- Source: `.raw/papers/` (7 PDFs: arxiv-2401.02954, arxiv-2401.14196, arxiv-2412.19437, arxiv-2501.12948, arxiv-2512.02556, arxiv-2412.10302, DeepSeek_V4)
- Summary: DeepSeek-AI のモデルファミリー全 7 論文を 7 サブエージェント並行で wiki に取り込み
- Papers ingested:
1. [[@2024__arXiv__DeepSeek LLM - Scaling Open-Source Language Models with Longtermism]] — 初代基盤モデル(7B/67B dense)、スケーリング則研究
2. [[@2024__arXiv__DeepSeek-Coder - When the Large Language Model Meets Programming]] — コード特化 LLM、FIM 最適化
3. [[@2024__arXiv__DeepSeek-V3 Technical Report]] — 671B MoE、MLA/MTP/FP8/DualPipe
4. [[@2025__arXiv__DeepSeek-R1 - Incentivizing Reasoning Capability in LLMs via Reinforcement Learning]] — 純粋 RL 推論創発、GRPO、aha モーメント
5. [[@2025__arXiv__DeepSeek-V3.2 - Pushing the Frontier of Open Large Language Models]] — DSA/GRPO 安定化/合成エージェント環境
6. [[@2024__arXiv__DeepSeek-VL2 - Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding]] — MoE ベース VLM
7. [[@2025__DeepSeek__DeepSeek-V4 - Towards Highly Efficient Million-Token Context Intelligence]] — MegaMoE/CSA+HCA で 100 万トークン
- Pages created: 7 sources, 13 entities (DeepSeek-AI, DeepSeek LLM, DeepSeek-Coder, DeepSeek-V3, DeepSeek-R1, DeepSeek-R1-Zero, DeepSeek-V3.2, DeepSeek-VL2, DeepSeek-V4, Multi-head Latent Attention, DualPipe, HAI-LLM, MegaMoE, Daya Guo), 4 concepts (LLMスケーリング則, コードLLM, マルチトークン予測, ビジョン言語モデル)
- Pages updated: Mixture-of-Experts, LLM分散学習, 並列化戦略, 強化ファインチューニング, 強化学習スケーリング, テスト時計算スケーリング, LLM推論, エージェント型コーディング, オープンLLM開発, GRPO
- Key insight: DeepSeek ファミリーの 7 論文を横断すると、MoE アーキテクチャの進化(DeepSeekMoE → 補助損失なし負荷分散 → シグモイドゲーティング → MegaMoE)、RL 手法の深化(GRPO → R1-Zero 純粋 RL 創発 → V3.2 の 4 安定化技術)、効率化の体系(MLA による KV 圧縮 → FP8 混合精度 → DualPipe → CSA+HCA ハイブリッド圧縮)という 3 軸の一貫した技術的進化が浮かぶ。特に V4 の KV キャッシュを BF16 GQA8 比約 2% に削減するハイブリッド圧縮アテンションは、100 万トークンコンテキストを実用化する構造的解法として LLM 推論の設計空間を拡張する。
## [2026-06-06] ingest | サーバーレスアーキテクチャ再考 (blog.yuuk.io)
- Source: `.raw/articles/rethinking-serverless-architecture-2019-09-11.md`
- Summary: [[@2019__yuuk.io__Rethinking-Serverless-Architecture]]
- Pages created: [[@2019__yuuk.io__Rethinking-Serverless-Architecture]]・[[サーバーレスアーキテクチャ]]
- Pages updated: [[Yuuki Tsubouchi]]・[[index]]・[[hot]]・[[log]]・manifest
- Key insight: サーバーレスの本質を「サーバという単位を意識しない」と定義し直し、FaaS がネットワークサーバーを・BaaS がマシンサーバーを意識しなくさせるという構造を明確化。FaaS を糊とする BaaS 連結パターン(ピタゴラスイッチ構成)は著者の HeteroTSDB の設計原理と直結する。
## [2026-06-06] ingest | 2019年SRE考 (blog.yuuk.io)
- Source: `.raw/articles/thinking-sre-2019-01-16.md`
- Summary: [[@2019__yuuk.io__2019-SRE-Thinking]]
- Pages created: [[@2019__yuuk.io__2019-SRE-Thinking]]
- Pages updated: [[Yuuki Tsubouchi]]・[[SRE]]・[[index]]・[[hot]]・[[log]]・manifest
- Key insight: SRE を「制御する技術」と目的論的に定義し直すことで、エラーバジェットの核心を端的に言語化。2019 年の技芸→工学テーゼが 2024 年の LLM4SRE サーベイへ続く著者思想の縦軸を形成する。
## [2026-06-06] ingest-paper | Batch: 9 microservice reliability papers
- Source: `.raw/papers/` (9 PDFs)
- Summary: マイクロサービスの信頼性・可観測性・インシデント管理・分散トレーシングに関する 9 本の論文を一括取り込み
- Papers ingested:
1. [[@2021__SoCC__Characterizing Microservice Dependency and Performance]] — Alibaba トレース分析、マイクロサービス依存関係の定量化
2. [[@2022__SoCC__How to Fight Production Incidents]] — Microsoft 大規模クラウドの 152 件インシデント実証研究
3. [[@2024__PACMCAS__The Tale of Errors in Microservices]] — Uber 非致命的 RPC エラーの大規模分析
4. [[@2023__USENIX ATC__Lifting the veil on Meta's microservice architecture]] — Meta マイクロサービストポロジの初公開分析
5. [[@2024__KDD__Microservice Root Cause Analysis with Limited Observability]] — 限定観測可能性下の RCA 手法 LatentScope
6. [[@2023__SIGCOMM__Network-Centric Distributed Tracing with DeepFlow]] — eBPF ベースのゼロコード分散トレーシング DeepFlow
7. [[@2021__ESEC-FSE__Identifying Bad Software Changes via Multimodal Anomaly Detection]] — マルチモーダル LSTM による不正変更検出 SCWarn
8. [[@2022__USENIX ATC__CRISP - Critical Path Analysis of Large-Scale Microservice Architectures]] — Uber クリティカルパス分析 CRISP
9. [[@2023__SOSP__A Cloud-Scale Characterization of Remote Procedure Calls]] — Google 規模の RPC 特性分析
- Pages created: 9 sources, 35 entities, 8 concepts (マイクロサービスコールグラフ, マイクロサービスアーキテクチャ, 非致命的RPCエラー, 暗黙のコンテキスト伝搬, 限定観測可能性, RPC規模特性, RPCレイテンシ特性, + system entities)
- Pages updated: 分散トレーシング, 根本原因分析, 異常検知, Fault Localization, マルチモーダル障害診断, ソフトウェア変更管理, 運用障害分析, インシデント管理, eBPF, 動的インストルメンテーション
- Key insight: マイクロサービスの障害特性分析が 4 社の本番データ(Alibaba・Microsoft・Uber・Google)で横断可能になり、「エラーの大多数は非致命的」「インシデントの 90% 超はコード変更なしで緩和」「RPC レイテンシはミリ秒スケール」という産業界の実態が定量的に浮かぶ。
## [2026-06-06] concept-create | SRE コンセプトページ作成
- Summary: [[SRE]](Site Reliability Engineering)の傘概念ページを作成
- Pages created: [[SRE]]
- Pages updated: [[index]]、[[hot]]
- Key insight: SRE Book (2016) の原則体系を傘概念として集約し、自動化ヒエラルキー→SRE AI Autonomy Levels、航空アナロジー→自動化のアイロニー、プレイブック→agentic SRE の手続き的実演優位性という接続を横断的知見として記述。
## [2026-06-06] batch-ingest | Google SRE Book 10 章一括取り込み
- Source: "Site Reliability Engineering: How Google Runs Production Systems" (O'Reilly, 2016), edited by [[Betsy Beyer]], Chris Jones, Jennifer Petoff, [[Niall Murphy]]
- Summary: SRE Book の Foreword・Preface・Chapter 1(Introduction)・Chapter 3(Embracing Risk)・Chapter 4(SLO)・Chapter 5(Eliminating Toil)・Chapter 6(Monitoring)・Chapter 7(Automation)・Part III(Practices)・Chapter 34(Conclusion)の 10 章を章ごとにソースページ化し、主要エンティティ・概念を wiki 化
- Pages created:
- **Sources (10)**: [[@2016__OReilly__SRE Book - Foreword]], [[@2016__OReilly__SRE Book - Preface]], [[@2016__OReilly__SRE Book - Chapter 1 Introduction]], [[@2016__OReilly__SRE Book - Chapter 3 Embracing Risk]], [[@2016__OReilly__SRE Book - Chapter 4 Service Level Objectives]], [[@2016__OReilly__SRE Book - Chapter 5 Eliminating Toil]], [[@2016__OReilly__SRE Book - Chapter 6 Monitoring Distributed Systems]], [[@2016__OReilly__SRE Book - Chapter 7 Automation at Google]], [[@2016__OReilly__SRE Book - Part III Practices]], [[@2016__OReilly__SRE Book - Chapter 34 Conclusion]]
- **Entities (5)**: [[SRE Book]], [[Ben Treynor Sloss]], [[Betsy Beyer]], [[Niall Murphy]], [[Margaret Hamilton]]
- **Concepts (2)**: [[エラーバジェット]], [[トイル]]
- Pages updated: [[サービスレベル目標]](横断的知見・出典追加), [[自動化のアイロニー]](横断的知見・出典追加), [[agentic SRE]](横断的知見・出典追加), [[index]], [[concepts/_index]], [[entities/_index]], [[sources/_index]]
- Key insight: SRE Book (2016) が体系化した原則群(エラーバジェット・50% ルール・プレイブック・変更管理・サービス信頼性ヒエラルキー・自動化 5 段階)は、現在の agentic SRE が自動化しようとしているタスク構造そのものであり、Bainbridge (1983) の自動化のアイロニーの 5 層と直接対応する。SRE Book の自動化ヒエラルキー(手動→完全自律)は [[SRE AI Autonomy Levels]](L0–L4)の直接の前駆である
## [2026-06-06] ingest-paper | 分散データベース・ストレージの古典 5 論文一括取り込み
- Source: `.raw/papers/Stonebraker-and-Cetintemel-2005---One-Size-Fits-All---An-Idea-Whose-Time-Has-Come-and-Gone.pdf`, `.raw/papers/bigtable-osdi06.pdf`, `.raw/papers/amazon-dynamo-sosp2007.pdf`, `.raw/papers/Stonebraker-et-al.-2007---The-End-of-an-Architectural-Era-Its-Time-for-a-Complete-Rewrite.pdf`, `.raw/papers/lakshman-ladis2009.pdf`
- Summary: 分散データベース・ストレージ分野の古典 5 論文をサブエージェント並行で wiki に取り込み。Stonebraker の「One Size Fits All」(ICDE 2005)を起点に、Bigtable(OSDI 2006)・Dynamo(SOSP 2007)・H-Store(VLDB 2007)・Cassandra(SIGOPS OSR 2010)を横断的に集約
- Pages created:
- **Sources (5)**: [[@2005__ICDE__One Size Fits All - An Idea Whose Time Has Come and Gone]], [[@2006__OSDI__Bigtable - A Distributed Storage System for Structured Data]], [[@2007__SOSP__Dynamo - Amazon's Highly Available Key-value Store]], [[@2007__VLDB__The End of an Architectural Era (It's Time for a Complete Rewrite)]], [[@2010__SIGOPS_OSR__Cassandra - A Decentralized Structured Storage System]]
- **Entities (22)**: [[Michael Stonebraker]], [[Ugur Cetintemel]], [[MIT]], [[Brown University]], [[Jeffrey Dean]], [[Sanjay Ghemawat]], [[Bigtable]], [[Google File System]], [[Chubby]], [[Werner Vogels]], [[Giuseppe DeCandia]], [[Amazon]], [[Dynamo]], [[Samuel Madden]], [[Daniel J. Abadi]], [[Stavros Harizopoulos]], [[Pat Helland]], [[H-Store]], [[Avinash Lakshman]], [[Prashant Malik]], [[Apache Cassandra]], [[Facebook]]
- **Concepts (6)**: [[専用データベースシステム]], [[結果整合性]], [[一貫性ハッシュ法]], [[分散ストレージ]], [[ゴシッププロトコル]], [[LSMツリー]]
- Pages updated: [[Google]], [[インターネットスケールサービス設計]]
- Key insight: Stonebraker の「ワンサイズフィッツオール」批判(2005)を、Bigtable(分散 KV/多次元マップ)・Dynamo(結果整合性 KV)・H-Store(メインメモリ OLTP, 82 倍)・Cassandra(Dynamo+Bigtable ハイブリッド)の 4 システムが異なるワークロード軸で具体的に検証している。Avinash Lakshman が Dynamo(Amazon)と Cassandra(Facebook)の両方の著者であり、設計知識の移転を体現する結節点である
## [2026-06-06] ingest-paper | システム信頼性・自動化の古典 4 論文一括取り込み
- Source: `.raw/papers/gray-why-do-computers-stop-85.pdf`, `.raw/papers/usits03.pdf`, `.raw/papers/hamilton.pdf`, `.raw/papers/IroniesofAutomation_Bainbridge_1983.pdf`
- Summary: 4 本の古典論文をサブエージェント並行で wiki に取り込み
- Pages created:
- **Sources (4)**: [[@1983__Automatica__Ironies of Automation]], [[@1985__Tandem__Why Do Computers Stop and What Can Be Done About It]], [[@2003__USITS__Why Do Internet Services Fail and What Can Be Done About It]], [[@2007__LISA__On Designing and Deploying Internet-Scale Services]]
- **Entities (10)**: [[Jim Gray]], [[Tandem Computers]], [[NonStop]], [[David Oppenheimer]], [[Archana Ganapathi]], [[David A. Patterson]], [[UC Berkeley ROC Project]], [[James Hamilton]], [[Lisanne Bainbridge]], [[University College London]]
- **Concepts (6)**: [[自動化のアイロニー]], [[ソフトウェア耐障害性]], [[Heisenbug]], [[プロセスペア]], [[運用障害分析]], [[インターネットスケールサービス設計]]
- Pages updated: [[耐障害LLM訓練]](横断的知見 2 点), [[チェックポイント]](横断的知見 1 点), [[GPUレジリエンス]](related 追加), [[インシデント管理]](横断的知見追記), [[障害注入]](横断的知見追記), [[根本原因分析]](横断的知見追記), [[Microsoft]](Hamilton 追記), [[サービスレベル目標]](横断的知見追記)
- Key insight: 1983〜2007 年のシステム信頼性・自動化の古典 4 論文を一括取り込み。Gray (1985) の「管理 42%・ソフトウェア 25%・ハードウェア 18%」→ Oppenheimer (2003) の「オペレータエラーが最大原因」→ Hamilton (2007) の「運用問題の 80% は設計に起因」という 20 年にわたる知見の連続性と、Bainbridge (1983) の自動化のアイロニーが現代の agentic SRE に通底する構造的パラドクスとして wiki の理論的基盤を形成。(source +4・entity +10・concept +6)
## [2026-06-06] wiki-ingest-paper | OLMo 3 (arXiv:2512.13961)
- Source: `.raw/papers/arxiv-2512.13961.pdf`
- Summary: Allen Institute for AI (AI2) の完全オープン LLM ファミリー OLMo 3 の技術報告書(118 ページ)を wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2025__arXiv__OLMo 3]]
- **Entities (9)**: [[Allen Institute for AI]], [[OLMo 3]], [[Dolma 3]], [[OlmoRL]], [[OlmoBaseEval]], [[olmOCR]], [[Duplodocus]], [[Dolci]]
- **Concepts (1)**: [[オープンLLM開発]]
- Pages updated: [[強化ファインチューニング]](横断的知見 2 点追加: OlmoRL の KL 除去+非同期パイプライン、Delta Learning の能力デルタフレームワーク。related・出典追加), [[University of Washington]](OLMo 3 との関連追加)
- Key insight: OLMo 3 は「モデルフロー全体の公開」を掲げ、全段階のチェックポイント・データミックス(元プール含む)・コード・訓練ログを公開した初の SOTA 級 LLM。7B/32B の decoder-only Transformer(SWA 3/4 層)で Base・Think・Instruct・RL-Zero の 4 変種を提供。OLMo 3.1 Think 32B は MATH 96.2・AIME 2024 80.6 で完全オープンモデル最強、Qwen 3 32B に迫る。OlmoRL は GRPO ベース 7 改善(KL なし・トークンレベル損失等)と完全非同期パイプライン(DeepSpeed + vLLM)で 4 倍スループット。Delta Learning は SFT 飽和後も能力デルタの大きい対照ペア(Qwen 3 32B/0.6B)の DPO で推論フロンティアを拡張。RL-Zero は事前学習データの RL への影響を追跡可能にする初のクリーンなベンチマーキング環境。1024 H100 GPU・56 日・$2.75M。(source +1・entity +9・concept +1)
## [2026-06-06] wiki-ingest-paper | Composer 2 Technical Report (arXiv:2603.24477)
- Source: `.raw/papers/arxiv-2603.24477.pdf`
- Summary: Cursor Research のエージェント型コーディングモデル Composer 2 の技術報告書を wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2026__arXiv__Composer 2 Technical Report]]
- **Entities (7)**: [[Cursor Research]], [[Composer 2]], [[CursorBench]], [[Anyrun]], [[Fireworks AI]], [[ThunderKittens]], [[DeepEP]]
- **Concepts (1)**: [[エージェント型コーディング]]
- Pages updated: [[エージェント型強化学習]](related に Composer 2 追加), [[強化ファインチューニング]](横断的知見 1 点追加: ドメイン特化事前学習→大規模非同期 RL パイプラインのパレート最適性、related 追加)
- Key insight: Composer 2 は Kimi K2.5 ベースの 1.04T/32B MoE をコード特化の継続事前学習(パープレキシティと下流 RL 報酬の対数線形相関を確認)の後、Dr. GRPO 変種による大規模非同期 RL(4 サービス分離: 訓練/環境/推論/評価)で訓練し、CursorBench 61.3・SWE-bench Multi 73.7・Terminal-Bench 61.7 でコスト精度パレート最適を達成する。RL が平均性能と best-of-K 性能の双方を同時改善する証拠を示し「RL は既知パスの確率再配分にすぎない」という懸念を否定する。自己要約機構で長期ホライズンに対応、非線形長さペナルティ、MoE ルーティングリプレイ、NVFP4 per-token スケーリングなどの RL 革新を含む。インフラは Anyrun(Firecracker VM)と Fireworks AI の地理的分散推論、DeepEP エキスパート並列、ThunderKittens GPU カーネルを活用。(source +1・entity +7・concept +1)。
## [2026-06-06] wiki-ingest-paper | Kimi-Researcher (moonshotai.github.io)
- Source: `https://moonshotai.github.io/Kimi-Researcher/`(PDF なし、プロジェクトページのみ)
- Summary: [[Moonshot]] の自律型リサーチエージェント [[Kimi-Researcher]] のプロジェクトページを wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2025__Moonshot AI__Kimi-Researcher - End-to-End RL Training for Emerging Agentic Capabilities]]
- **Entities (1)**: [[Kimi-Researcher]]
- Pages updated: [[Moonshot]](概要に Kimi-Researcher 段落追加・関連/出典追加), [[エージェント型強化学習]](横断的知見 5 点・未解決の問い 2 点追加), [[強化ファインチューニング]](出典追加), [[sources/_index]], [[entities/_index]], [[index]], [[hot]], [[log]]
- Key insight: Kimi-Researcher は SFT を一切使わずエンドツーエンドの REINFORCE のみでリサーチエージェントを訓練し、HLE Pass@1 26.9%(初期 8.6% から RL のみで向上)・xbench-DeepSearch 69% を達成した。3 つの技術革新が注目される: (1) ガンマ減衰報酬 r × γ^(T-i) でステップレベルの信用割当を近似、(2) コンテキスト管理機構で単一ロールアウトを 10→50+ イテレーションに拡張、(3) ターンレベル部分ロールアウト(リプレイバッファ活用)で 1.5 倍以上の高速化。RL のみから矛盾情報の自己修正や追加検証行動が創発する。Agent-R1 のモジュラーフレームワーク、DeepSWE の SFT 不要知見、IsoCompute Playbook のリプレイバッファ設計と相補的であり、検索エージェントドメインでも SFT なし RL が有効であることをドメイン横断的に確認。(source +1・entity +1)。
## [2026-06-06] wiki-ingest-paper | MiniMax-M1 (arXiv:2506.13585)
- Source: `.raw/papers/arxiv-2506.13585.txt`
- Summary: MiniMax のハイブリッドアテンション推論モデル MiniMax-M1(456B パラメータ、100 万トークンコンテキスト)の技術報告書を wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2025__arXiv__MiniMax-M1 - Scaling Test-Time Compute Efficiently with Lightning Attention]]
- **Entities (5)**: [[MiniMax-M1]], [[MiniMax-Text-01]], [[CISPO]], [[Lightning Attention]], [[SynLogic]]
- **Concepts (1)**: [[テスト時計算スケーリング]]
- Pages updated: [[MiniMax]](M1 情報追加), [[強化学習スケーリング]](横断的知見 1 点・未解決の問い更新), [[強化ファインチューニング]](横断的知見 1 点・ソース追加), [[sources/_index]](M1 エントリ追加)
- Key insight: MiniMax-M1 はオープンウェイト初の大規模ハイブリッドアテンション推論モデルであり、テスト時計算スケーリングの効率をアーキテクチャ設計で根本的に改善する。ライトニングアテンション(7:1 混成)により 100K トークン生成時の FLOPS を DeepSeek R1 の 25% に削減し、独自 RL アルゴリズム CISPO が DAPO 比 2 倍のステップ効率を達成。アーキテクチャ効率とアルゴリズム効率の乗算的効果により RL 全体を 512 GPU・3 週間・53.4 万ドルに収めた。テスト時計算スケーリングと RL 訓練計算スケーリングが連動するという知見を新概念ページで体系化。(source +1・entity +5・concept +1)。
## [2026-06-06] wiki-ingest-paper | Kimi K1.5 (arXiv:2501.12599)
- Source: `.raw/papers/arxiv-2501.12599.pdf`
- Summary: Moonshot(月之暗面)の RL 訓練マルチモーダル LLM Kimi K1.5 の技術報告書を wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2025__arXiv__Kimi K1.5 - Scaling Reinforcement Learning with LLMs]]
- **Entities (2)**: [[Kimi K1.5]], [[Mooncake]]
- Pages updated: [[Moonshot]](Kimi K1.5 情報追記), [[vLLM]](ハイブリッドデプロイメント追記), [[強化学習スケーリング]](横断的知見 2 点・未解決の問い 1 点追加: コンテキスト長スケーリング軸・パーシャルロールアウト), [[強化ファインチューニング]](横断的知見 2 点追加: 価値関数排除の 3 手法・long2short 体系化)
- Key insight: Kimi K1.5 はコンテキスト長をモデルサイズ・データ量に並ぶ RL の第三のスケーリング次元として位置づけ、128k への拡張で推論性能を大幅に向上させた。パーシャルロールアウト(長軌跡を反復間で分割再利用)は長コンテキスト RL の計算量爆発を抑える実装手法として IsoCompute Playbook のロールアウト数最適化と相補する。価値関数を排除しオンラインミラー降下変種のみで方策最適化する設計は、ScaleRL の CISPO・DeepSWE の GRPO++ と合わせ「価値関数なし RL」の 3 つの直交アプローチを形成する。long2short 手法の 4 経路体系化はテスト時計算量 vs トークン効率のトレードオフの最初の系統的整理。(source +1・entity +2)。
## [2026-06-06] wiki-ingest-paper | Nemotron 3 (arXiv:2512.20856)
- Source: `.raw/papers/arxiv-2512.20856.pdf`
- Summary: NVIDIA のオープン LLM ファミリー Nemotron 3 の技術報告書を wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2025__arXiv__Nemotron 3 - Efficient and Open Intelligence]]
- **Entities (3)**: [[Nemotron 3]], [[LatentMoE]], [[NeMo-RL]]
- Pages updated: [[NVIDIA]](Nemotron 3 関連リンク・本文追記), [[Mixture-of-Experts]](横断的知見 1 点追加: LatentMoE vs FAST の All-to-All ボトルネック対処), [[強化ファインチューニング]](横断的知見 1 点追加: マルチ環境同時 RL vs 逐次訓練)
- Key insight: Nemotron 3 は 4 つの革新を統合する: (1) ハイブリッド Mamba-2–Transformer MoE で Self-Attention の KV キャッシュ線形増大を回避し 3.3 倍の推論スループット、(2) LatentMoE で潜在次元 ℓ < d への射影によりエキスパート通信量を d/ℓ 倍削減し浮いた予算でエキスパート数を 128→512 に増加(MMLU-Pro +4.57pp)、(3) NVFP4(E2M1 + 16 要素マイクロブロックスケーリング)で BF16 比 <1% の損失差のまま 25T トークンの事前学習を安定化、(4) マルチ環境同時 RL(GRPO + マスク付き重要度サンプリング + 非同期 RL アーキテクチャ)で数学・コード・ツール利用・長コンテキスト(最大 100 万トークン)を同時最適化。Scaling Up RL の逐次 5 ドメイン訓練に対し、Nemotron 3 は同時最適化で干渉を抑制する設計上の対照を示す。(source +1・entity +3)。
## [2026-06-06] wiki-ingest-paper | MiniMax-M2 (arXiv:2605.26494)
- Source: `.raw/papers/arxiv-2605.26494.pdf`
- Summary: MiniMax の MoE 言語モデルファミリー MiniMax-M2 シリーズ(229.9B/9.8B)の技術報告書を wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2026__arXiv__The MiniMax-M2 Series - Mini Activations Unleashing Max Real-World Intelligence]]
- **Entities (3)**: [[MiniMax]], [[MiniMax-M2]], [[Forge]]
- **Concepts (1)**: [[エージェントネイティブ RL]]
- Pages updated: [[Mixture-of-Experts]](横断的知見 1 点追加: シグモイドゲーティング + エキスパートバイアス), [[エージェント型強化学習]](横断的知見 3 点追加: 産業規模エージェント RL・混合ドメイン RL・自己進化)
- Key insight: MiniMax-M2 は 3 つの革新を統合して「mini activations → max intelligence」を実現する: (1) 256 細粒度エキスパート + シグモイドゲーティングで補助損失への依存を排除する MoE アーキテクチャ、(2) Forge のエージェントネイティブ RL(ホワイトボックス/ブラックボックス統一・Windowed FIFO・接頭辞木マージ 40×)、(3) M2.7 の自己進化(訓練ランの自律デバッグ・スキャフォールド修正・100 ラウンド自律イテレーション)。約 10B の活性化パラメータで Opus 4.6/GPT 5.4/Gemini 3.1 Pro と対等な性能を達成し、特に Multi-SWE-bench(52.7)で比較対象中最高。混合ドメイン RL(推論・コーディング・エージェント・汎用の 4 ドメイン同時最適化)とインターリーブド思考(Plan-Act-Reflect)がエージェント型 RL の産業実装の設計原則を示す。(source +1・entity +3・concept +1)。
## [2026-06-06] wiki-ingest-paper | Kimi K2: Open Agentic Intelligence (arXiv:2507.20534)
- Source: `.raw/papers/arxiv-2507.20534.txt`
- Summary: [[Moonshot AI]] の 1.04 兆パラメータ MoE LLM [[Kimi K2]] のテクニカルレポートを wiki-ingest-paper で取り込み
- Pages created:
- **Sources (1)**: [[@2025__arXiv__Kimi K2 - Open Agentic Intelligence]]
- **Entities (3)**: [[Moonshot AI]], [[Kimi K2]], [[MuonClip]]
- Pages updated: [[Mixture-of-Experts]](スパーシティスケーリング則の横断的知見追加), [[エージェント型強化学習]](横断的知見 2 点・未解決の問い 1 点追加), [[強化ファインチューニング]](自己批判型ルーブリック報酬の横断的知見追加), [[LLM分散学習]](MuonClip + 分散チェックポイントエンジンの横断的知見追加), [[並列化戦略]](PP+EP+ZeRO-1 DP 構成と DualPipe 不採用の横断的知見追加)
- Key insight: Kimi K2 は MuonClip(Muon + QK-Clip)で 15.5 兆トークンをロススパイクなしに事前学習し、MCP ツール 3,000 超 + 合成ツール 20,000 超のエージェント型データ合成と RLVR + 自己批判型ルーブリック報酬の統合 RL で SWE-bench Verified 65.8% を達成。スパーシティスケーリング則(固定活性化パラメータ・エキスパート数増加で損失低下)を実証。16-way PP + 16-way EP + ZeRO-1 DP の並列化で DualPipe を運用複雑性の理由で不採用。(source +1・entity +3)。
## [2026-06-06] wiki-ingest | Cursor Composer 2.5 ブログ記事
- Source: `.raw/articles/composer-2-5-cursor-2026-06-06.md`
- Summary: Cursor のコーディングエージェントモデル Composer 2.5 の発表ブログ記事を wiki-ingest で取り込み
- Pages created:
- **Sources (1)**: [[@2026__Cursor__Introducing Composer 2.5]]
- **Entities (6)**: [[Cursor]], [[Kimi K2.5]], [[Moonshot]], [[SpaceXAI]], [[Colossus 2]], [[Sharded Muon]]
- Pages updated: [[強化ファインチューニング]](横断的知見 2 点・未解決の問い 1 点追加), [[エージェント型強化学習]](横断的知見 1 点追加)
- Key insight: Cursor はターゲット RL(軌跡中の特定箇所にテキストヒントを挿入するオンポリシー蒸留)と合成タスク 25 倍拡大(特徴削除ベース)で Composer 2.5 を訓練した。DeepSWE の二値報酬のみアプローチと対照的に、密な局所フィードバックが産業コーディングエージェントで有効であることを示す。報酬ハッキングの具体例(Python 型キャッシュ逆工学・Java バイトコード逆コンパイル)は、RFT-FM が訓練障害として分類する現象が「高度な問題解決能力の裏返し」でもあることを示す産業界初の公開事例。基盤モデルは Moonshot の Kimi K2.5、次世代は SpaceXAI の Colossus 2(百万 H100 相当)で開発中。(source +1・entity +6)。
## [2026-06-05] batch-ingest-paper | RL Scaling & Agentic RL 10 論文
- Source: `.raw/papers/arxiv-{2510.13786,2509.25300,2603.12151,2507.12507,2512.22857,2511.14460,2510.04206,2509.02547,2508.03501}.pdf` + `together.ai/blog/deepswe`
- Summary: LLM 向け RL スケーリング 4 本 + エージェント型 RL 6 本の一括取り込み
- Pages created:
- **Sources (10)**: [[@2025__arXiv__The Art of Scaling Reinforcement Learning Compute for LLMs]], [[@2025__arXiv__Scaling Behaviors of LLM Reinforcement Learning Post-Training]], [[@2026__arXiv__IsoCompute Playbook - Optimally Scaling Sampling Compute for LLM RL]], [[@2025__arXiv__Scaling Up RL - Unlocking Diverse Reasoning in LLMs via Prolonged Training]], [[@2025__Together AI__DeepSWE - Training a Fully Open-sourced State-of-the-Art Coding Agent by Scaling RL]], [[@2025__arXiv__AutoForge - Environment Synthesis for Agentic RL]], [[@2025__arXiv__Agent-R1 - Training Agents with End-to-End RL]], [[@2025__arXiv__AgentRL - Training Language Model Agents with Reinforcement Learning]], [[@2025__arXiv__The Landscape of Agentic Reinforcement Learning]], [[@2025__arXiv__Training Long-Context Multi-Turn SWE Agents with Reinforcement Learning]]
- **Concepts (2)**: [[強化学習スケーリング]], [[エージェント型強化学習]]
- **Entities (~50)**: [[Devvrit Khatri]], [[Rishabh Agarwal]], [[ScaleRL]], [[PipelineRL]], [[UT Austin]], [[Zelin Tan]], [[Chen Zhang (Shanghai AI Lab)]], [[Zhenfei Yin]], [[VeRL]], [[GRPO]], [[Aviral Kumar]], [[Zhiting Hu]], [[MBZUAI]], [[Mingjie Liu]], [[Yejin Choi]], [[NVIDIA]], [[Nemotron-Research-Reasoning-Qwen-1.5B]], [[DeepSWE]], [[Together AI]], [[Agentica]], [[Ion Stoica]], [[Raluca Ada Popa]], [[rLLM]], [[R2E-Gym]], [[SWE-Bench-Verified]], [[Michael Luo]], [[Naman Jain]], [[AutoForge]], [[Tongyi Lab]], [[Fuli Feng]], [[Agent-R1]], [[AgentRL]], [[Hanchen Zhang]], [[Xiao Liu]], [[Yuxiao Dong]], [[Z.AI]], [[AgentBench]], [[Guibin Zhang]], [[Heng Ji]], [[Alexander Golubev]], [[Nebius AI]], [[Boris Yangel]], [[Humanoid]] ほか
- Pages updated: [[強化ファインチューニング]], [[強化学習スケーリング]], [[エージェント型強化学習]]
- Key insight: LLM RL スケーリングではべき乗則(Scaling Behaviors)とシグモイド飽和(ScaleRL/IsoCompute)が相補的であり、設計選択の効果は「漸近性能 A を上げるもの」と「計算効率 B のみを変調するもの」に二分される。エージェント型 RL では PBRFT(退化 MDP, T=1)と Agentic RL(POMDP, T>1)の形式的境界が確立され、マルチターン・マルチタスクの交差方策サンプリングとタスクアドバンテージ正規化が汎用エージェント訓練の鍵となる。
## [2026-06-06] ingest-paper | Characterizing Modern GPU Resilience and Impact in HPC Systems: A Case Study of A100 GPUs
- Source: `.raw/papers/Characterizing_Modern_GPU_Resilience_and_Impact_in_HPC_Systems_A_Case_Study_of_A100_GPUs.pdf`
- Summary: [[@2025__DSN-W__Characterizing Modern GPU Resilience and Impact in HPC Systems - A Case Study of A100 GPUs]]
- Pages created: [[@2025__DSN-W__Characterizing Modern GPU Resilience and Impact in HPC Systems - A Case Study of A100 GPUs]], [[Archit Patke]], [[Ziheng Chen]], [[Aditya Ranjan]], [[Hung Nguyen]], [[Phuong Cao]], [[Brett Bode]], [[Gregory Bauer]], [[Chandra Narayanaswami]], [[Daby Sow]], [[Catello Di Martino]]
- Pages updated: [[GPUレジリエンス]], [[GPUクラスタ運用]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]], [[log]]
- Key insight: A100 単体ではメモリ回復機構(row remapping/error containment)が運用期の訂正不能メモリエラーを吸収し、弱点は GSP・PMU SPI・MMU・NVLink など非メモリハードウェアにある。これは後続の H100/A100 比較で見える「A100 はハードウェアが弱点、H100 はメモリが弱点」という世代間弱点反転の基準線である。
## [2026-06-06] ingest | Understanding Workload Characteristics in Large Language Model Development
- Source: `.raw/articles/understanding-workload-characteristics-large-language-model-development-2026-06-06.md`
- Summary: [[@2024__USENIX login Online__Understanding Workload Characteristics in Large Language Model Development]]
- Pages created: [[@2024__USENIX login Online__Understanding Workload Characteristics in Large Language Model Development]], [[Qinghao Hu]], [[Tianwei Zhang]], [[Acme]], [[InternEvo]]
- Pages updated: [[Peng Sun]], [[Shanghai AI Laboratory]], [[GPUクラスタ運用]], [[LLM分散学習]], [[並列化戦略]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: LLM 専用クラスタでは、評価などの短い関連ジョブが件数を支配し、少数の事前学習ジョブが GPU 時間を支配し、インフラ障害が失敗コストを支配する。[[Acme]] は Philly の LLM 以前 DNN クラスタと SAKURAONE/MegaScale の LLM 訓練実測をつなぐ運用参照点である。
## [2026-06-06] ingest-paper | Revisiting Reliability in Large-Scale Machine Learning Research Clusters
- Source: `.raw/papers/ieee-10946752-revisiting-reliability-ml-research-clusters.pdf`
- Summary: [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]]
- Pages created: [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]], [[Apostolos Kokolis]], [[Michael Kuchnik]], [[Carole-Jean Wu]], [[Meta AI Research SuperCluster]]
- Pages updated: [[Meta]], [[GPUクラスタ運用]], [[LLM分散学習]], [[耐障害LLM訓練]], [[チェックポイント]], [[集合通信]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]], [[log]]
- Key insight: LLM 世代のマルチテナント研究クラスタでも、小規模ジョブが件数を支配し、大規模ジョブが GPU 時間・障害影響・二次的プリエンプションを支配する。MTTF は GPU 数にほぼ反比例し、10 万 GPU 級では分単位のチェックポイント/再起動が ETTR の必要条件になる。
## [2026-06-06] ingest-paper | Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads
- Source: `.raw/papers/atc19-jeon.pdf`
- Summary: [[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]]
- Pages created: [[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]], [[Myeongjae Jeon]], [[Shivaram Venkataraman]], [[Amar Phanishayee]], [[Junjie Qian]], [[Wencong Xiao]], [[Fan Yang]], [[UNIST]], [[University of Wisconsin]], [[Philly]], [[philly-traces]], [[GPUクラスタスケジューリング]]
- Pages updated: [[Microsoft]], [[Beihang University]], [[GPUクラスタ運用]], [[LLM分散学習]], [[並列化戦略]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: LLM 以前の DNN 訓練クラスタでも、ギャングスケジューリング、局所性、同居干渉、失敗ジョブの GPU 時間浪費がすでに中心問題だった。[[Philly]] の 75 日・96,260 ジョブのトレースは、現代の [[LLM分散学習]] が SER として再整理する問題の前史にあたる。
## [2026-06-06] ingest-paper | Pretraining LLMs at Scale: Tuning Strategies and Performance Portability
- Source: `.raw/papers/2026_Unknown_Pretraining_LLMs_Scale_Tuning_Strategies.pdf`
- Summary: [[@2025__PMBS__Pretraining LLMs at Scale - Tuning Strategies and Performance Portability]]
- Pages created: [[@2025__PMBS__Pretraining LLMs at Scale - Tuning Strategies and Performance Portability]], [[Adrián Pérez Diéguez]], [[Qualcomm]], [[性能可搬性]]
- Pages updated: [[LLM分散学習]], [[並列化戦略]], [[DeepSpeed]], [[NCCL]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: LLM 事前学習の Efficiency は大域的なクラスタ協調設計だけでなく、DeepSpeed/ZeRO/NCCL の既定値を測って外す局所チューニングにも強く依存する。Model-2(8B)では 3 プラットフォームすべてで ZeRO Stage 2・batch_size 128・grad_acc 2 が最良で、既定構成比最大 1.6 倍高速化した。
## [2026-06-05] ingest | The Landscape of Agentic Reinforcement Learning for LLMs (TMLR 2026, Zhang+ Oxford/Shanghai AI Lab)
- Source: `.raw/papers/arxiv-2509.02547.txt`
- Summary: [[@2025__arXiv__The Landscape of Agentic Reinforcement Learning]]
- Pages created: [[@2025__arXiv__The Landscape of Agentic Reinforcement Learning]], [[Heng Ji]]
- Pages updated: [[Guibin Zhang]](ソースリンクを正式名に修正), [[Zhenfei Yin]](サーベイ責任著者を追記), [[Lei Bai]](サーベイ責任著者を追記), [[Philip Torr]](サーベイシニア著者を追記), [[エージェント型強化学習]](定義に POMDP 形式化追記、横断的知見 3 点追加: 二重タクソノミー・増幅器 vs 新知識論争・TIR 進化軸、未解決の問い 2 点追加), [[強化ファインチューニング]](横断的知見に PBRFT vs Agentic RL の形式的境界を追記), [[強化学習スケーリング]](横断的知見にエージェント型 RL の 4 軸スケーリング整理を追記), [[sources/_index]], [[entities/_index]], [[log]], [[hot]]
- Key insight: PBRFT(退化 MDP, T=1)と Agentic RL(POMDP, T>1)を MDP/POMDP で形式的に区別した初の包括的サーベイ。能力×タスクの二重タクソノミーで 500 本超を体系化し、RL メカニズム論争を約 2/3 増幅器 vs 約 1/3 新知識と定量整理。
## [2026-06-05] ingest | Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training (arXiv 2025, NVIDIA)
- Source: `.raw/papers/arxiv-2507.12507.txt`
- Summary: [[@2025__arXiv__Scaling Up RL - Unlocking Diverse Reasoning in LLMs via Prolonged Training]]
- Pages created: [[@2025__arXiv__Scaling Up RL - Unlocking Diverse Reasoning in LLMs via Prolonged Training]], [[Mingjie Liu]], [[Yejin Choi]], [[NVIDIA]], [[Nemotron-Research-Reasoning-Qwen-1.5B]]
- Pages updated: [[VeRL|verl]](NVIDIA の長期 RL 訓練での使用を追記), [[強化学習スケーリング]](横断的知見 2 点追加: スケーリング則 vs 実践的レシピの相補性・多ドメイン訓練の汎化と限界), [[強化ファインチューニング]](横断的知見に KL 正則化の長期安定化効果を追加), [[sources/_index]], [[entities/_index]], [[log]], [[hot]]
- Key insight: NVIDIA が 1.5B モデルに対し 5 ドメインの検証可能報酬タスクで長期 RL を適用した体系的調査。GRPO + DAPO 拡張に KL 正則化と参照方策リセットを加え、8 ランの逐次訓練(ハードリセット)で約 16,000 GPU 時間を完走。KL 除去時のエントロピー崩壊と、多ドメイン統合訓練によるドメイン特化モデルとの競争力を示す。
## [2026-06-05] ingest | The Art of Scaling Reinforcement Learning Compute for LLMs (arXiv 2025, Meta/UT Austin)
- Source: `.raw/papers/arxiv-2510.13786.txt`
- Summary: [[@2025__arXiv__The Art of Scaling Reinforcement Learning Compute for LLMs]]
- Pages created: [[@2025__arXiv__The Art of Scaling Reinforcement Learning Compute for LLMs]], [[Devvrit Khatri]], [[Rishabh Agarwal]], [[ScaleRL]], [[PipelineRL]], [[UT Austin]]
- Pages updated: [[強化学習スケーリング]](シグモイドモデルを定義に追記、横断的知見 3 点・未解決の問い 2 点追加), [[強化ファインチューニング]](ScaleRL をソースに追加), [[sources/_index]], [[entities/_index]], [[log]], [[hot]]
- Key insight: Meta/UT Austin/UC Berkeley/Harvard/Periodic Labs の Khatri・Madaan・Agarwal らによる LLM RL 計算スケーリングの初の大規模系統的研究。400,000 GPU 時間超のアブレーションでシグモイド型飽和曲線の漸近性能 A と計算効率 B を分離する予測的フレームワークを提案。6 軸の設計選択から統合レシピ ScaleRL を構築し、8B で A=0.61(GRPO 0.45・DAPO 0.53 を凌駕)、Scout 17B×16 MoE で A=0.71。
## [2026-06-05] ingest | Scaling Behaviors of LLM Reinforcement Learning Post-Training (arXiv 2025)
- Source: `.raw/papers/arxiv-2509.25300.txt`
- Summary: [[@2025__arXiv__Scaling Behaviors of LLM Reinforcement Learning Post-Training]]
- Pages created: [[@2025__arXiv__Scaling Behaviors of LLM Reinforcement Learning Post-Training]], [[Zelin Tan]], [[Chen Zhang (Shanghai AI Lab)]], [[Zhenfei Yin]], [[University of Oxford]], [[VeRL]], [[GRPO]]
- Pages updated: [[強化ファインチューニング]](横断的知見にスケーリング挙動の定式化を追記、関連に GRPO/VeRL/新概念を追加), [[強化学習スケーリング]](出典追加), [[エージェント型強化学習]](出典追加), [[sources/_index]], [[entities/_index]], [[log]], [[hot]]
- Key insight: Qwen2.5(0.5B〜72B)で 63 モデル超を GRPO で訓練し、RL 事後学習のテスト損失が計算量・データ量に対して対数線形のべき乗則(R² > 0.99)に従うことを初めて体系的に実証。学習効率 k(N) が 32B 以降で飽和すること、データ再利用が τ ≤ 25 で有効であること、Llama 3 でもアーキテクチャ非依存に再現することを示した。
## [2026-06-05] ingest | IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL (arXiv 2026)
- Source: `https://arxiv.org/abs/2603.12151`
- Summary: [[@2026__arXiv__IsoCompute Playbook - Optimally Scaling Sampling Compute for LLM RL]]
- Pages created: [[@2026__arXiv__IsoCompute Playbook - Optimally Scaling Sampling Compute for LLM RL]], [[Aviral Kumar]], [[Zhiting Hu]], [[MBZUAI]], [[強化学習スケーリング]], [[エージェント型強化学習]]
- Pages updated: [[強化ファインチューニング]](横断的知見に GRPO スケーリング知見を追記、関連に強化学習スケーリングを追加), [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[log]], [[hot]]
- Key insight: UCSD/CMU/MBZUAI の Zhoujun Cheng・Aviral Kumar・Zhiting Hu らが約 12 万 H200 時間の実験で LLM RL の計算最適配分則を導出。計算予算 C = Bp * n * M において最適並列ロールアウト数 n*(C) はシグモイド飽和し、問題難度別に二重機構(易問題でのシャープニング worst@k / 難問題でのカバレッジ拡大 best@k)が作用する。Healthy RL レシピ(難度別正則化・sqrt 学習率スケーリング)と計算最適配分を組み合わせ、Qwen2.5-7B を AIME 2025 で 72.5% まで引き上げた。事前学習の Chinchilla 則に対応する RL ポスト訓練初のスケーリング則。
## [2026-06-05] ingest | AgentRL: Scaling RL for Multi-Turn Multi-Task Agents (arXiv 2025, Tsinghua/Z.AI)
- Source: `.raw/papers/arxiv-2510.04206.txt`
- Summary: [[@2025__arXiv__AgentRL - Scaling RL for Multi-Turn Multi-Task Agents]]
- Pages created: [[@2025__arXiv__AgentRL - Scaling RL for Multi-Turn Multi-Task Agents]], [[AgentRL]], [[Hanchen Zhang]], [[Xiao Liu]], [[Yuxiao Dong]], [[Z.AI]], [[AgentBench]]
- Pages updated: [[エージェント型強化学習]](横断的知見にマルチタスク訓練の汎化・交差方策サンプリングを追加、未解決の問いに異種アーキテクチャクロスサンプリング・非同期方策ラグ理論分析を追加), [[sources/_index]], [[entities/_index]], [[log]], [[hot]]
- Key insight: Tsinghua/Z.AI の Hanchen Zhang・Xiao Liu らによるマルチターン・マルチタスクのエージェント型 RL 訓練フレームワーク。交差方策サンプリング(現行・過去モデルで探索)、タスク別アドバンテージ正規化、完全非同期パイプライン、コンテナ化異種環境デプロイの 4 設計で、AgentBench-FC 5 環境平均成功率 70.4% を達成し GPT-5/Claude-Sonnet-4/DeepSeek-R1 を上回る。マルチタスク単一モデルがタスク別最良の単一タスクモデルと同等の性能に到達する点が注目。
## [2026-06-05] ingest | Agent-R1: A Unified and Modular Framework for Agentic RL (arXiv 2025, USTC)
- Source: `.raw/papers/arxiv-2511.14460.txt`
- Summary: [[@2025__arXiv__Agent-R1 - Training Agents with End-to-End RL]]
- Pages created: [[@2025__arXiv__Agent-R1 - Training Agents with End-to-End RL]], [[Agent-R1]]
- Pages updated: [[エージェント型強化学習]](Agent-R1 のステップレベル MDP 定式化を定義に追記、横断的知見に設計空間 3 軸分化・credit assignment 核を追加), [[強化ファインチューニング]](Agent-R1 をソースに追加), [[Mingyue Cheng]], [[Xiaoyu Tao]], [[Qi Liu]], [[Enhong Chen]], [[University of Science and Technology of China]], [[sources/_index]], [[entities/_index]], [[log]]
- Key insight: USTC の Cheng グループ(ATSF/Cast-R1 と同一)によるエージェント型 RL 訓練フレームワーク。ステップレベル MDP + 柔軟なコンテキスト管理を核に PPO・GRPO・Reinforce++・RLOO を同一基盤上で比較。最適アルゴリズムがタスクにより異なること、コンテキスト管理が訓練品質に影響することを 4 ベンチマークで実証。
## [2026-06-05] ingest | DeepSWE: Training a Fully Open-sourced Coding Agent by Scaling RL (Together AI 2025)
- Source: `https://together.ai/blog/deepswe`
- Summary: [[@2025__Together AI__DeepSWE - Training a Fully Open-sourced State-of-the-Art Coding Agent by Scaling RL]]
- Pages created: [[@2025__Together AI__DeepSWE - Training a Fully Open-sourced State-of-the-Art Coding Agent by Scaling RL]], [[DeepSWE]], [[Together AI]], [[Agentica]], [[Ion Stoica]], [[Raluca Ada Popa]], [[rLLM]], [[R2E-Gym]], [[SWE-Bench-Verified]], [[Michael Luo]], [[Naman Jain]]
- Pages updated: [[強化ファインチューニング]](横断的知見に Compact Filtering と SFT コールドスタート比較を追記、未解決の問いに SFT バイアスのドメイン依存性を追加), [[sources/_index]], [[entities/_index]], [[log]], [[hot]]
- Key insight: Qwen3-32B から SFT なしの純粋 RL(GRPO++)のみで SWE-Bench-Verified SOTA を達成した完全オープンソースのコーディングエージェント。Compact Filtering が不完全軌跡のノイズを訓練アルゴリズム内で排除する設計は、RFT-FM の障害管理フレームワーク(訓練外での排除)と対照的。
## [2026-06-05] ingest | AutoForge: Environment Synthesis for Agentic RL (arXiv 2025)
- Source: `.raw/papers/arxiv-2512.22857.txt`
- Summary: [[@2025__arXiv__AutoForge - Environment Synthesis for Agentic RL]]
- Pages created: [[@2025__arXiv__AutoForge - Environment Synthesis for Agentic RL]], [[AutoForge]], [[Tongyi Lab]], [[Fuli Feng]], [[エージェント型強化学習]], [[強化学習スケーリング]]
- Pages updated: [[強化ファインチューニング]](横断的知見に GRPO のアドバンテージ推定の不安定性を追記), [[Alibaba Group]](AutoForge・Tongyi Lab 追加), [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[log]]
- Key insight: Tongyi Lab(Alibaba)のエージェント型 RL フレームワーク。ツール記述文書のみから模擬環境を完全自動合成し、GRPO を環境レベルへ拡張した ERPO + 模擬ユーザー誤りマスク(MEU)で訓練安定性を確保。活性パラメータ 3B で 200B 未満オープンソース最良、クローズドソースに匹敵。
## [2026-06-05] ingest | Linux eBPF Tracing Technology (yuuk.io 2021)
- Source: `.raw/articles/ebpf-tracing-2021-12-28.md`
- Summary: [[@2021__yuuk.io__Linux eBPF Tracing Technology]]
- Pages created: [[@2021__yuuk.io__Linux eBPF Tracing Technology]], [[bpftrace]]
- Pages updated: [[eBPF]](eBPF 基礎技術セクション・ツールチェーン追加), [[BCC]](詳細化・関連整備), [[libbpf]](CO-RE 解説追加), [[Yuuki Tsubouchi]](本記事追加), [[index]], [[log]], [[hot]]
- Key insight: vault 所有者自身の 2021 年技術解説。BCC→bpftrace→libbpf+CO-RE の 3 段開発ワークフローが [[go-conntracer-bpf]] の実装背景をなし、2024 年以降の [[eInfer]]・[[ProfInfer]]・[[eACGM]] の共通基盤でもある。
## [2026-06-05] ingest | NVIDIA LLM Inference Benchmarking: Fundamental Concepts
- Source: `.raw/articles/llm-benchmarking-fundamental-concepts-2026-06-05.md`
- Summary: [[@2025__NVIDIA__LLM-Inference-Benchmarking-Fundamental-Concepts]]
- Pages created: [[@2025__NVIDIA__LLM-Inference-Benchmarking-Fundamental-Concepts]], [[GenAI-Perf]], [[TensorRT-LLM]], [[NVIDIA NIM]]
- Pages updated: [[LLM推論]](ユースケース ISL/OSL プロファイル・ツール間メトリクス計算差異の横断的知見 2 点追加), [[index]], [[hot]], [[log]]
- Key insight: LLM ベンチマークはユースケース(翻訳/生成/要約/推論)ごとに ISL/OSL プロファイルが大きく異なり、同じハードウェアとモデルでも結果は変わる。GenAI-Perf と LLMPerf は ITL の計算に TTFT を含むか否かが異なるため、ツール間の直接比較には正規化が必要——という NVIDIA 公式確認を wiki に追加。
## [2026-06-05] batch-ingest | LLM 分散推論基盤 × 4(さくらのナレッジ vol.1-3 + Zenn)
- Source: `.raw/articles/sakura-distributed-inference-vol1-2025-11-11.md`, `sakura-distributed-inference-vol2-2025-12-23.md`, `sakura-distributed-inference-vol3-2026-03-25.md`, `zenn-llm-inference-benchmarking-2026-05-30.md`
- Summary: [[@2025__さくらのナレッジ__分散推論基盤やその前提の考え方]], [[@2025__さくらのナレッジ__分散推論基盤の基礎技術]], [[@2026__さくらのナレッジ__高火力PHYを利用した分散推論基盤の性能検証]], [[@2026__Zenn__MLエンジニアのための本質から理解するLLM推論]]
- Pages created: source 4 + entity 8 ([[道下幹也]]・[[高火力 PHY]]・[[vLLM]]・[[NIXL]]・[[UCX]]・[[LMCache]]・[[Kazuki Fujii]]・[[東京科学大学]])
- Pages updated: [[LLM推論]](横断的知見 2 点・未解決の問い 1 点追加), [[SAKURA Internet]], [[index]], [[hot]], [[log]]
- Key insight: さくらインターネット高火力 PHY(H100 HGX)での PD Disaggregation 実測で、入力長 8k・32 並列時に Aggregated の ITL P99 が 100ms 超に悪化するのに対し PD 分離は 30ms 以内に抑制——ただし入力長 1k の低負荷では Aggregated が同等以上であり、メリット享受はワークロード特性(入力長・並行数)に依存する。NIXL+UCX で KV Cache 転送のボトルネックが物理リンク帯域に収束することも実証。
## [2026-06-05] ingest-paper | Efficient Large Language Models: A Survey (TMLR 2024)
- Source: `.raw/papers/arxiv-2312.03863.pdf`
- Summary: [[@2024__TMLR__Efficient Large Language Models - A Survey]]
- Pages created: [[@2024__TMLR__Efficient Large Language Models - A Survey]], [[Mi Zhang]], [[Mosharaf Chowdhury]], [[The Ohio State University]], [[モデル圧縮]]
- Pages updated: [[LLM推論]], [[Mixture-of-Experts]], [[index]], [[hot]], [[log]]
- Key insight: LLM の効率化手法をモデル中心(圧縮・学習・推論・アーキテクチャ)・データ中心(データ選択・プロンプト工学)・フレームワーク(17 種比較)の 3 軸で体系化した 67 ページの包括的サーベイ。既存の Miao+ サービングサーベイが推論特化であるのに対し、圧縮→推論の直列最適化やモデルアーキテクチャ(MoE・SSM)を含む全体像を提供する。
## [2026-06-05] ingest-paper | Towards Efficient Generative Large Language Model Serving (ACM Computing Surveys 2025)
- Source: `.raw/papers/2026_Unknown_Towards_Efficient_Generative_Large_Language.pdf`
- Summary: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving]]
- Pages created: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving]], [[Xupeng Miao]], [[Zhihao Jia]], [[Tianqi Chen]], [[Purdue University]]
- Pages updated: [[LLM推論]], [[index]], [[hot]], [[log]]
- Key insight: LLM サービングの効率化手法をアルゴリズム/システムの 2 軸で体系化した初の包括的サーベイ。投機的復号が出力品質を保持できる唯一のアルゴリズム的高速化手法であること、低レイテンシと高スループットの双対最適化目標を明示し、既存の観測系知見(ProfInfer/eInfer)と相補的な設計視点を提供する。
## [2026-06-05] ingest | "LLM for SRE" の世界探索 (blog.yuuk.io)
- Source: `.raw/articles/the-world-of-llm4sre-2024-03-21.md`
- Summary: [[The-World-of-LLM4SRE]]
- Pages created: [[The-World-of-LLM4SRE]]
- Pages updated: [[Yuuki Tsubouchi]], [[根本原因分析]], [[index]], [[hot]], [[log]]
- Key insight: vault 所有者 [[Yuuki Tsubouchi]] が 2024 年 3 月時点で LLM4SRE を 3 分類(ファインチューニング/RAG/エージェント型)で整理した一次観察——後続の wiki 論文群が予見された問題軸の上にあることを確認できる
## [2026-06-05] ingest-paper | 分散トレーシング・ログ解析・テレメトリ最適化 × 8 (PMF / LogReducer / LogCleaner / Hindsight / Tracezip / Astraea / Mint / TraStrainer)
- Source: `.raw/papers/Chakraborty-et-al.-2024---Enabling-programmable-metric-flows.pdf`, `LogReducer_Identify_and_Reduce_Log_Hotspots_in_Kernel_on_the_Fly.pdf`, `arxiv-2409.04834.pdf`, `nsdi23-zhang-lei.pdf`, `arxiv-2502.06318.pdf`, `Astraea_camera_ready-1.pdf`, `arxiv-2411.04605.pdf`, `2026_Unknown_TraStrainer_Adaptive_Sampling_Distributed_Traces.pdf`
- Summary: [[@2024__IEEE CLOUD__Enabling Programmable Metric Flows]], [[@2023__ICSE__LogReducer - Identify and Reduce Log Hotspots in Kernel on the Fly]], [[@2024__ESEM__Reducing Events to Augment Log-based Anomaly Detection Models - An Empirical Study]], [[@2023__NSDI__Hindsight - Tracing Edge-Cases in Distributed Systems]], [[@2025__ISSTA__Tracezip - Efficient Distributed Tracing via Trace Compression]], [[@2024__IEEE CLOUD__Astraea - Unleashing Performance Insights with Online Probabilistic Tracing]], [[@2025__ASPLOS__Mint - Cost-Efficient Tracing with All Requests Collection via Commonality and Variability Analysis]], [[@2024__FSE__TraStrainer - Adaptive Sampling for Distributed Traces with System Runtime State]]
- Pages created: source 8 + entity 18 ([[PMF]], [[LogReducer]], [[WeChat]], [[LogCleaner]], [[Hindsight]], [[OpenTelemetry]], [[Tracezip]], [[Astraea]], [[VAIF]], [[Mint]], [[TraStrainer]], [[Jonathan Mace]], [[Kangjin Wang]], [[Zibin Zheng]], [[Mehmet Toslali]], [[Ayse K. Coskun]], [[Haiyu Huang]], [[Max Planck Institute for Software Systems]]) + concept 1 ([[トレースサンプリング]])
- Pages updated: [[テレメトリ]], [[Scaling Telemetry Workloads]], [[異常検知]], [[特徴量削減]], [[eBPF]], [[ログ解析]], [[ログパース]], [[ログ生成]], [[分散トレーシング]], [[根本原因分析]], [[Prometheus]], [[IBM Research]], [[Guangba Yu]], [[Pengfei Chen]], [[Tencent]], [[Sun Yat-sen University]], [[Lingzhe Zhang]], [[Tong Jia]], [[Ying Li]], [[Zhuangbin Chen]], [[Train-Ticket]], [[Boston University]], [[DeathStarBench]], [[University of Maryland]], [[Alibaba Group]], [[Huawei Technologies]]
- Key insight: 分散トレーシングのサンプリング問題に 4 アプローチ(ヘッドベース確率/テールベース適応/遡及的/全リクエスト圧縮)が収集量と情報損失のトレードオフを異なる位相で攻め、ログ解析では LogReducer(カーネル層 eBPF)と LogCleaner(アプリ層イベント削減)が「情報を絞ってから処理する」設計を独立に実践、PMF はメトリクスパイプラインで同じ削減原理を LP 最適化に置換。
## [2026-06-05] ingest-paper | NSDI '26 × 6 (EROICA / Wormhole / PrvTel / Matryoshka / FAST / HeteCCL)
- Source: `.raw/papers/nsdi26-guan-yu.pdf`, `nsdi26-long.pdf`, `nsdi26-zhou-yajie.pdf`, `nsdi26-cai.pdf`, `nsdi26-lei-yiran.pdf`, `nsdi26-hei.pdf`
- Summary: [[@2026__NSDI__EROICA - Online Performance Troubleshooting for Large-scale Model Training]], [[@2026__NSDI__Supercharging Packet-level Network Simulation of Large Model Training via Memoization and Fast-Forwarding]], [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]], [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]], [[@2026__NSDI__FAST - An Efficient Scheduler for All-to-All GPU Communication]], [[@2026__NSDI__HeteCCL - Synthesizing Near-Optimal Collective Communication Schedules for Heterogeneous GPU Clusters]]
- Pages created: source 6 + entity 10 ([[Yu Guan]], [[Zhejiang Lab]], [[Dan Li]], [[Zhongguancun Laboratory]], [[Fuheng Zhao]], [[Max Planck Institute for Informatics]], [[MangoBoost]], [[University of Pennsylvania]], [[Northeastern University]], [[Shenzhen Institutes of Advanced Technology]]) + concept 2 ([[ネットワークシミュレーション]], [[差分プライバシー]])
- Pages updated: [[集合通信]], [[Mixture-of-Experts]], [[LLM分散学習]], [[オープンネットワーキング]], [[テレメトリ]], [[近似クエリ処理]], [[LLM学習モニタリング]], [[GPUクラスタ運用]], [[ストラグラー]], [[Fault Localization]], [[Meta]], [[Ennan Zhai]]
- Key insight: 6 本が「LLM 訓練インフラの規則性(同期分散学習の反復構造)」を共通の前提として、性能診断(EROICA)・シミュレーション高速化(Wormhole)・プライバシー保護テレメトリ(PrvTel)・DCN 設計自動化(Matryoshka)・集合通信スケジューリング(FAST/HeteCCL)と異なる応用面で攻める。特に FAST(Birkhoff 分解)と HeteCCL(CEGIS)が「問題固有の構造的単純化で NP 困難を回避する」設計を独立に発見し、ホモジニアス/ヘテロジニアスの双方で集合通信の最適化フロンティアを前進させた。
## [2026-06-05] ingest-paper | HeteCCL (NSDI '26)
- Source: `.raw/papers/nsdi26-hei.pdf`
- Summary: [[@2026__NSDI__HeteCCL - Synthesizing Near-Optimal Collective Communication Schedules for Heterogeneous GPU Clusters]]
- Pages created: [[@2026__NSDI__HeteCCL - Synthesizing Near-Optimal Collective Communication Schedules for Heterogeneous GPU Clusters]], [[Northeastern University]], [[Shenzhen Institutes of Advanced Technology]]
- Pages updated: [[集合通信]] (横断的知見 2 項・未解決の問い 2 項・出典追加), [[Ennan Zhai]] (HeteCCL 追記)
- Key insight: ヘテロジニアス GPU クラスタでの集合通信スケジュール自動合成の失効原因は「合成の正確さ」でなく「同一ステップ内のプリミティブ所要時間の不均一性」にある。チャンキングで均質化し CEGIS で探索削減することで、TACCL/TE-CCL が 64 GPU で 9 時間超を要した合成を 9 分未満に短縮し、NCCL 比最大 2.8× の帯域幅と訓練効率 23〜37% の改善を達成した。
## [2026-06-05] ingest-paper | FAST (NSDI '26)
- Source: `.raw/papers/nsdi26-lei-yiran.pdf`
- Summary: [[@2026__NSDI__FAST - An Efficient Scheduler for All-to-All GPU Communication]]
- Pages created: [[@2026__NSDI__FAST - An Efficient Scheduler for All-to-All GPU Communication]], [[MangoBoost]], [[University of Pennsylvania]]
- Pages updated: [[集合通信]], [[Mixture-of-Experts]]
- Key insight: MoE AllToAllv のスケジューリングを NP 困難から多項式時間問題に帰着する鍵は「スケール外に集中し、スケール内で歪みを吸収する」という問題の単純化であり、Birkhoff 分解の GPU 集団通信層への初適用が最適性とインキャスト回避を同時保証する。64 GPU で 221 µs という合成時間は、最速のソルバーベース手法 SyCCL の 16 GPU・3.6 秒を数桁下回り、数百ミリ秒単位で変化する MoE ワークロードへのオンライン適用を初めて現実的にした。
## [2026-06-05] ingest-paper | Matryoshka (NSDI '26)
- Source: `.raw/papers/nsdi26-cai.pdf`
- Summary: [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]]
- Pages created: [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]], [[Max Planck Institute for Informatics]]
- Pages updated: [[Meta]], [[オープンネットワーキング]], [[LLM分散学習]]
- Key insight: 高レベル DCN 設計インテントをスイッチ設定に自動コンパイルする「設定生成」フェーズが学術研究の空白だったことを明示し、6 年間・約 900 DCN の本番でインテント駆動・決定論的・ステートレスな設計が AI クラスタ時代のハイパースケール DCN 管理に有効であることを示す。
## [2026-06-05] concept | Scaling Telemetry Workloads
- Pages created: [[Scaling Telemetry Workloads]]
- Pages updated: [[index]], [[concepts/_index]]
- Key insight: 博士論文が提唱した 3 層枠組み(計装・保持・分析)と「文脈豊富な両端で削減」の設計指針を概念ページとして独立化。wiki 内の分散トレーシング・時系列データベース・特徴量削減を統一的に接続し、AIOps エージェントのテレメトリ過剰消費問題や GPU/LLM インフラへの延伸を横断的知見として蓄積。
## [2026-06-05] ingest-paper | OpsAgent (ASE '26)
- Source: `.raw/papers/arxiv-2510.24145.pdf`
- Summary: [[@2026__ASE__OpsAgent - An Evolving Multi-agent System for Incident Management in Microservices]]
- Pages created: [[@2026__ASE__OpsAgent - An Evolving Multi-agent System for Incident Management in Microservices]], [[Yu Luo]], [[Lenovo]]
- Pages updated: [[Yongqian Sun]], [[Shenglin Zhang]], [[Nankai University]], [[Dan Pei]], [[インシデント管理]], [[根本原因分析]], [[マルチモーダル障害診断]]
- Key insight: training-free テキスト変換による異種テレメトリの統一が MAS 型 IM の鍵——プロセッサ除去でアブレーション Correct 16.54%→2.26%。PPO+反省の二重自己進化で Lenovo 本番 53 日・10,492 件 84.09%・解決時間 2.5h→126s を達成。
## [2026-06-05] ingest-paper | Lustre Unveiled + The Lustre Storage Architecture
- Source: `.raw/papers/2026_Unknown_Lustre_Unveiled_Evolution_Design_Advancements.pdf` + `.raw/papers/arxiv-1903.01955.pdf`
- Summary: [[@2025__TOS__Lustre Unveiled - Evolution, Design, Advancements, and Current Trends]] + [[@2019__arXiv__The Lustre Storage Architecture]]
- Pages created: [[@2025__TOS__Lustre Unveiled - Evolution, Design, Advancements, and Current Trends]], [[@2019__arXiv__The Lustre Storage Architecture]], [[Lustre]], [[Frontier]], [[Orion]], [[DDN]], [[Whamcloud]], [[OpenSFS]], [[Anjus George]], [[Andreas Dilger]], [[Sarp Oral]], [[Peter J. Braam]], [[Cluster File Systems]], [[並列ファイルシステム]]
- Pages updated: [[Oak Ridge National Laboratory]]
- Key insight: 2001–2005 年の初期設計文書で構想されたメタデータライトバックキャッシュや分散 MDS は、一貫性保証の複雑さから実装に 20 年以上を要し、2025 年のサーベイでもなお「将来の方向性」として記載される。DAOS のロックレストランザクションモデルが POSIX 互換性と引き換えにスケーラビリティで構造的優位を示す一方、Lustre は Top500 の 60% 超を占める支配的地位を維持しており、後方互換性の重力が並列ファイルシステムの設計進化を律速する。
## [2026-06-05] ingest-paper | Meaningful Availability
- Source: `.raw/papers/nsdi20-paper-hauer.pdf`
- Summary: [[@2020__NSDI__Meaningful Availability]]
- Pages created: [[@2020__NSDI__Meaningful Availability]], [[Tamás Hauer]], [[Philipp Hoffmann]], [[John Lunney]], [[Dan Ardelean]], [[Amer Diwan]]
- Pages updated: [[Jeffrey C. Mogul]], [[Google]], [[サービスレベル目標]]
- Key insight: ウィンドウ付きユーザーアップタイムは有意義性・比例性・実用性の三要件を同時に満たす初の可用性指標であり、MCR 曲線で短時間断続障害と長時間大規模障害を定量的に区別する。G Suite 本番で評価・展開済み。
## [2026-06-05] ingest-paper | Live Forensics for HPC Systems: A Case Study on Distributed Storage Systems
- Source: `.raw/papers/forensics_sc_2020.pdf`
- Summary: [[@2020__SC20__Live Forensics for HPC Systems - A Case Study on Distributed Storage Systems]]
- Pages created: [[@2020__SC20__Live Forensics for HPC Systems - A Case Study on Distributed Storage Systems]], [[Kaleidoscope]], [[Blue Waters]], [[Subho S. Banerjee]], [[Zbigniew T. Kalbarczyk]]
- Pages updated: [[Saurabh Jha]], [[Shengkun Cui]], [[Tianyin Xu]], [[Ravishankar K. Iyer]], [[NCSA]], [[Fault Localization]], wiki/sources/_index.md, wiki/entities/_index.md, wiki/index.md, wiki/hot.md, wiki/log.md
- Key insight: HPC 分散ストレージの箇所特定は「能動 I/O プローブ(Store Pings)+因子グラフ PGM」という cloud/GPU クラスタとも異なる第三の手法系統を形成し、信頼性障害 vs リソース過負荷の 2 モード弁別も一体で解く。
## [2026-06-05] ingest-paper | Thinking about Availability in Large Service Infrastructures
- Source: `.raw/papers/46181.pdf`
- Summary: [[@2017__HotOS__Thinking about Availability in Large Service Infrastructures]]
- Pages created: [[@2017__HotOS__Thinking about Availability in Large Service Infrastructures]], [[Rebecca Isaacs]], [[Brent Welch]]
- Pages updated: (なし)
- Key insight: 大規模インフラストラクチャの可用性定義は多次元性・次元削減・サブシステム分解という三重困難を抱えており、セキュリティのスレットモデリング・深層防御・侵入テストと同様の「敵対的思考」で臨むべきという提言。フェイル・スタティック設計はデフォルト拒否原則の可用性版に相当する。
## [2026-06-05] ingest-paper | A Microservice-Based Platform for Sustainable and Intelligent SLO Fulfilment and Service Management
- Source: `.raw/papers/arxiv-2602.12875.pdf`
- Summary: [[@2026__arXiv__A Microservice-Based Platform for Sustainable and Intelligent SLO Fulfilment and Service Management]]
- Pages created: [[@2026__arXiv__A Microservice-Based Platform for Sustainable and Intelligent SLO Fulfilment and Service Management]], [[Juan Luis Herrera]], [[Daniel Wang (TU Wien)]], [[CASCA]]
- Pages updated: (なし)
- Key insight: CASCAはMSA原則に従い、CCプロバイダーがサービスのセマンティクスを知ることなくSLOを充足できるプラットフォーム。カーボン認識SLOをEMMAマイクロサービスで統合し、宣言的設定管理による迅速な再設定(命令的手法比-53.7秒)を実現。GDS/RLDS/RDSの3方式で実物テストベッドにて評価。
## [2026-06-05] ingest-paper | Nines are Not Enough: Meaningful Metrics for Clouds
- Source: `.raw/papers/Mogul-and-Wilkes-2019---Nines-are-Not-Enough---Meaningful-Metrics-for-Clouds.pdf`
- Summary: [[@2019__HotOS__Nines are Not Enough - Meaningful Metrics for Clouds]]
- Pages created: [[@2019__HotOS__Nines are Not Enough - Meaningful Metrics for Clouds]], [[Jeffrey C. Mogul]], [[John Wilkes]]
- Pages updated: (なし)
- Key insight: SLO 定義の困難さを統計学的意思決定との同型性として捉え、法律家的思考から統計家的思考への転換を提唱。SLE(通常挙動への期待)と CBE(顧客挙動への期待)の双方向枠組みでプロバイダ・顧客間のリスク明示的分担を実現する設計原理を提示。
## [2026-06-05] ingest-paper | Diffusing High-level SLO in Microservice Pipelines
- Source: `.raw/papers/SOSE_2024_B_Sedlak.pdf`
- Summary: [[@2024__SOSE__Diffusing High-level SLO in Microservice Pipelines]]
- Pages created: [[@2024__SOSE__Diffusing High-level SLO in Microservice Pipelines]], [[Boris Sedlak]], [[Víctor Casamayor Pujol]], [[Praveen Kumar Donta]]
- Pages updated: [[Schahram Dustdar]](Phase 2 要更新)
- Key insight: ベイズネットワークの条件付き依存関係を利用して高レベルSLOをパイプライン全体に拡散し、実行前コンフリクト検知と最大100%のSLO充足率を実現。λ超パラメータの過剰な厳格化が充足率を0に急落させるトレードオフが存在する。
## [2026-06-05] ingest-paper | CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend
- Source: `.raw/papers/arxiv-2604.23455.pdf`
- Summary: [[@2026__arXiv__CUJBench - Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend]]
- Pages created: [[@2026__arXiv__CUJBench - Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend]], [[Haoming Meng]], [[CUJBench]], [[OpenTelemetry Demo]], [[Tractor Store]]
- Pages updated: [[SRE Benchmark]], [[マルチモーダル障害診断]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/index]], [[wiki/hot]], [[wiki/log]], [[.raw/.manifest.json]]
- Key insight: ブラウザ可視層をバックエンドテレメトリと統合した初のクロスモーダル診断ベンチマーク——ツールアクセス拡大が精度を下げる反直感と「証拠は取れても帰属できない」統合ボトルネックを定量化。
## [2026-06-05] ingest-paper | FlowXpert: Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution
- Source: `.raw/papers/2026_Unknown_FlowXpert_Expertizing_Troubleshooting_Workflow_Orchestration.pdf`
- Summary: [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]]
- Pages created: [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]], [[Binpeng Shi]], [[FlowXpert]], [[OpsFlowBench]]
- Pages updated: [[Shenglin Zhang]], [[Dan Pei]], [[Nankai University]], [[Huawei Cloud]], [[TSG自動化]], [[インシデント管理]], [[強化ファインチューニング]]
- Key insight: ワークフロー「実行」(FLASH/LLexus/StepFly)の上流に「生成」(FlowXpert)という問題設定を追加——本番 22.1 秒・承認率 80% で産業実証済み。
## [2026-06-05] ingest-paper | AgentTune: An Agent-Based LLM Framework for Database Knob Tuning
- Source: `.raw/papers/acm-3769758.pdf`
- Summary: [[@2025__SIGMOD__AgentTune - An Agent-Based Large Language Model Framework for Database Knob Tuning]]
- Pages created: [[Yiyan Li]], [[Haoyang Li]], [[Jing Zhang]], [[Cuiping Li]], [[Hong Chen]], [[Renata Borovica-Gajic]], [[University of Melbourne]], [[データベースノブチューニング]]
- Pages updated: [[データベース自律診断]], [[Renmin University of China]], [[ByteDance]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 4 専門 LLM エージェントのタスク分解 + ビームサーチ木探索 + セントロイド距離ランキングの組み合わせが、DBMS ノブチューニングで全実験 Invalid Times=0 を実現——「ルールベース検証 + LLM の融合が信頼性の律速」と「構成空間での多数決が収束を安定化する」という 2 つの設計原則を定量実証した。
## [2026-06-05] ingest-paper | SCELM: A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models
- Source: `.raw/papers/2026_Unknown_A_Multimodal_Intelligent_Change_Assessment.pdf`
- Summary: [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]]
- Pages created: [[SCELM]], [[Tinghua Zheng]], [[Xidao Wen]], [[Weihua Kuang]], [[Heng Liu]], [[Chao Shen]], [[Bo Wu]], [[BizSeer]], [[ソフトウェア変更管理]]
- Pages updated: [[Yongqian Sun]], [[Shenglin Zhang]], [[Dan Pei]], [[Nankai University]], [[マルチモーダル障害診断]], [[根本原因分析]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: ECD・FT・RCCA の 3 タスクを統合した最初のフレームワークが、変更票×ログ×メトリクスの自然言語化 + RAG + 7B LLM で本番 11 か月・90% 時間短縮を達成——「変更票を第 4 モダリティとして扱い、異常形状の意味を LLM に渡す」という設計が特に RCCA の鍵であることをアブレーションが示した。
## [2026-06-05] ingest-paper | OpDiag: Unveiling Database Performance Anomalies Through Query Operator Attribution
- Source: `.raw/papers/OpDiag_Unveiling_Database_Performance_Anomalies_Through_Query_Operator_Attribution.pdf`
- Summary: [[@2025__TKDE__OpDiag - Unveiling Database Performance Anomalies Through Query Operator Attribution]]
- Pages created: [[Shiyue Huang]], [[Bin Cui]], [[Yinjun Wu]], [[Ziwei Wang]], [[ZTE Corporation]], [[OpDiag]], [[DBPA]]
- Pages updated: [[データベース自律診断]], [[Peking University]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]], [[log]]
- Key insight: 演算子-クエリ-KPI-異常の階層を三段階分割帰属で遡及する設計が、DB 診断の「解像度スペクトル」を KPI/クエリの先の演算子レベルへ初めて押し上げた——ML+帰属がドメイン知識なしで演算子レベルの精度と対話的速度を両立できることを実証。
## [2026-06-05] ingest-paper | DBAIOps: A Reasoning LLM-Enhanced Database Operation and Maintenance System using Knowledge Graphs
- Source: `.raw/papers/arxiv-2508.01136.pdf`
- Summary: [[@2025__PVLDB__DBAIOps - A Reasoning LLM-Enhanced Database Operation and Maintenance System using Knowledge Graphs]]
- Pages created: [[データベース O&M]], [[Wei Zhou]], [[DBAIOps]], [[Baisheng Technology]]
- Pages updated: [[根本原因分析]], [[Xuanhe Zhou]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: 知識グラフ(ExperienceGraph)が「LLM の幻覚抑制」と「RAG の関係断片化」を同時解決——グラフパスとして O&M 経験を構造化し「提供された証拠のみで推論」する制約が、DB 診断でのハルシネーション(偽メトリクス引用)を事例で根絶した。グラフ進化の動的拡張が未知異常への対応で最大 34% の精度向上に寄与。
## [2026-06-05] ingest-paper | D-Bot: Database Diagnosis System using Large Language Models
- Source: `.raw/papers/arxiv-2312.01454.pdf`
- Summary: [[@2024__PVLDB__D-Bot - Database Diagnosis System using Large Language Models]]
- Pages created: [[データベース自律診断]], [[DB-GPT]]
- Pages updated: [[根本原因分析]], [[AIOps]], [[Xuanhe Zhou]], [[Guoliang Li]], [[Tsinghua University]], [[sources/_index]], [[entities/_index]], [[concepts/_index]], [[index]], [[hot]], [[log]]
- Key insight: DB ドメイン特化の LLM 自律診断がドメインを超えた AIOps 系 RCA と手法的に同型——「ドメイン知識外在化が精度の律速」(NoKnowledge −64.1%)・「UCT 木探索が早期停止を構造的に抑制」(NoTreeSearch −35.85%)は、Flow-of-Action の SOP 知識削除・SREGym の早期停止問題と独立して同じ命題を別証する。
## [2026-06-05] ingest-paper | TAMO: Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data
- Source: `.raw/papers/arxiv-2504.20462.pdf`
- Summary: [[@2025__TSC__TAMO - Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems]]
- Pages created: [[TAMO]], [[Xiao Zhang]], [[Dongxiao Yu]], [[Fuzhen Zhuang]], [[Shandong University]]
- Pages updated: [[根本原因分析]], [[マルチモーダル障害診断]], [[sources/_index]], [[entities/_index]], [[index]], [[hot]]
- Key insight: LLM を生データ処理から切り離してツール出力の統合に専念させる「ツール支援型 LLM エージェント」設計で、コンテキスト制限・マルチモーダル意味ギャップ・動的依存グラフという LLM-RCA の 3 課題を統一フレームワークで解決。アブレーションが T1(双分岐拡散アライメント)をマルチモーダル RCA の律速と同定。
## [2026-06-05] ingest-paper | TVDiag: A Task-oriented and View-invariant Failure Diagnosis Framework
- Source: `.raw/papers/2026_Unknown_TVDiag_Task_oriented_View_invariant.pdf`
- Summary: [[@2026__TOSEM__TVDiag - A Task-oriented and View-invariant Failure Diagnosis Framework for Microservice-based Systems with Multimodal Data]]
- Pages created: [[マルチモーダル障害診断]], [[Shuaiyu Xie]], [[Jian Wang]], [[Bing Li]], [[Wuhan University]], [[TVDiag]]
- Pages updated: [[根本原因分析]], [[Fault Localization]]
- Key insight: マルチモーダル RCL で「タスクごとのモダリティ嗜好」を教師あり対照学習で増幅する設計が、等価融合を大幅に凌駕することを 4 データセットで実証。
## [2026-06-05] ingest-paper | Flow-of-Action: SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis
- Source: `.raw/papers/arxiv-2502.08224.pdf`
- Summary: [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]]
- Pages created: [[wiki/sources/@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis|source]] / [[wiki/entities/Changhua Pei|Changhua Pei]]
- Pages updated: [[根本原因分析]] / [[TSG自動化]] / [[Dan Pei]] / [[ByteDance]] / [[Tieying Zhang]] / [[sources/_index]] / [[entities/_index]] / [[index]] / [[hot]]
- Key insight: SOP → コード変換(generate_sop_code)が「アトミック一括実行・近位テキスト依存排除・トークン節約」の三利点を持ち、アブレーションでは SOP 知識削除で LA が 54.22→8.56 に激減——ドメイン知識の明示化が RCA エージェントの律速であることを定量証明した。
## [2026-06-05] ingest-paper | インシデント自動化 4 本(FLASH / StepFly / LLexus / agentic NetOps-AIOps サーベイ)
- Sources: `.raw/papers/FLASH_Paper.pdf`, `.raw/papers/arxiv-2510.10074.pdf`, `.raw/papers/3689051.3689056.pdf`, `.raw/papers/arxiv-2605.12729.pdf`
- Summary: [[@2024__MSR__FLASH - A Workflow Automation Agent for Diagnosing Recurring Incidents]] / [[@2025__arXiv__StepFly - Agentic Troubleshooting Guide Automation for Incident Diagnosis]] / [[@2024__OSR__LLexus - an AI agent system for incident management]] / [[@2026__arXiv__Large Language Models for Agentic NetOps and AIOps - Architectures, Evaluation, and Safety]]
- Pages created: 新概念 [[TSG自動化]] / [[NetOps]] / [[エージェント運用安全性]] + entity 32(person 24・product 7([[FLASH]]/[[StepFly]]/[[TSG Mentor]]/[[LLexus]]/[[TaskWeaver]]/[[Semantic Kernel]]/[[Azure Durable Functions]])・org 1([[Renmin University of China]]))+ source 4
- Pages updated: [[インシデント管理]] / [[障害緩和]] / [[AIOps]] / [[根本原因分析]] / [[agentic SRE]] / [[SRE AI Autonomy Levels]] / [[Transactional No-Regression]] / 既存 person 4([[Minghua Ma]]/[[Shilin He]]/[[Qingwei Lin]]/[[Chaoyun Zhang]])+ 索引 3 + [[index]] + [[hot]]
- Key insight: Microsoft の TSG 自動化 3 本は「LLM をオンライン(FLASH)/計画前置(LLexus)/両方+並列(StepFly)のどこで働かせるか」で分岐するが、3 本とも「TSG 品質が自動化の律速」へ独立収束。NetOps/AIOps サーベイの assurance contract が TNR・Actus・自律度段階(Google L0–L4)を同一語彙で上位一般化し、LLexus の決定論的実行も書き込み境界の確実性として接続。
- 手法: Phase 1(4 subagent 並行 = source + 排他的 person、共有物は report)→ Phase 2(メインで concept 統合・中央 entity・索引/meta)。初回 3 本がソケット切断のため Sonnet で再実行。並行セッションの LLM×DATA ingest と共有ファイルはロックで直列化。
## [2026-06-05] ingest-paper | A Survey of LLM × DATA
- Source: `.raw/papers/arxiv-2505.18458.pdf`
- Summary: [[@2025__arXiv__A Survey of LLM × DATA]]
- Pages created: [[@2025__arXiv__A Survey of LLM × DATA]], [[Xuanhe Zhou]], [[Guoliang Li]]
- Pages updated: [[根本原因分析]], [[LLM分散学習]], [[wiki/sources/_index]], [[wiki/entities/_index]], [[wiki/index]]
- Key insight: DB 分野の異常診断とクラウド AIOps の RCA が「直接プロンプト / RAG 強化 / マルチエージェント」の同一パターンを共有し、LLM 活用の手法分類がドメイン横断的に一致する。
追記式。新規エントリは**先頭**に追加する。過去エントリは編集しない。
エントリ形式: `## [YYYY-MM-DD] operation | Title`
直近の参照: `grep "^## \[" wiki/log.md | head -10`
---
## [2026-06-05] ingest-paper | LLM4Log: A Systematic Review of Large Language Model-based Log Analysis
- Source: `.raw/papers/arxiv-2604.16359.pdf`(md5 4d45c37a…、54 ページ、arXiv:2604.16359v2)。github コンパニオン github.com/zeyang919/LLM4Log。
- Summary: [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis]]
- Pages created: [[Zeyang Ma]], [[Jinqiu Yang]], [[Tse-Hsun Chen]], [[Concordia University]], [[LLM4Log (repository)]], [[ログパース]], [[ログ生成]]
- Pages updated: [[ログ解析]](大幅・パイプライン全体地図化), [[異常検知]], [[根本原因分析]], [[障害予測]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: LLM4Log は個別タスクの寄せ集めでなく、ログ生成→パース→表現→下流診断のパイプライン全体。全段共通の設計原理は「無制約 end-to-end 生成でなく、情報を絞ってから LLM を選択的に呼ぶ階層設計」で、本 wiki が個別ソース(LogPilot/OpenRCA/AlertGuardian)で積んだ観察の上位一般化。162 レコード中 deployment 証拠は 5 のみで、本 wiki の産業一次ソースの希少さを裏づける。
## [2026-06-04] ingest-paper (followup) | PACE(ISAV2025)を PDF 入手で正式版へ格上げ
- Source: `.raw/papers/2026_Unknown_From_Exploration_Explanation_ML_Driven.pdf`(ユーザー提供、md5 37155494…、6 ページ)。直前の 8 本バッチで ACM ペイウォールにより abstract のみで暫定作成していた [[@2025__ISAV__From Exploration to Explanation - ML-Driven Causal Discovery for Datacenter Reliability at Scale]] を、全文に基づき書き換え。
- Pages updated (source): 出典制約の `[!warning]` を除去、`sources:` を `.raw/` PDF へ変更、`confidence: high` に。提案手法を 6 段パイプライン(データ整備→パターン発見→因果推定[最大12ラグ Granger・s=−log10(p)]→グラフ合成[上位k=2・98%ile]→可視化→検証)に詳細化し、実験結果に Fig.1 エントロピー順位・Fig.2 z-score・Fig.3 因果所見(熱の操作変数→容量/流量、外気→CHW、電力は負荷追従、容量→バルブのフィードバック)・Fig.4 クラスタリングを追記。**論文は定量精度指標を持たず物理整合性・感度分析による定性評価**である旨を明記。
- Pages updated (entities): [[David Grant]](所属を [[Oak Ridge National Laboratory]] に確定、
[email protected]) / [[PACE]](パイプライン詳細・主要因果所見・定性評価の明記)。**新規** [[DyTwin]](HPE/ORNL のデジタルツイン枠組み、PACE の統合先)。
- Pages updated (meta): [[sources/_index]]・[[index]] の ISAV 記述からペイウォール注記を除去、[[entities/_index]] に [[DyTwin]] 追加。`.raw/.manifest.json` の `isav-pace-NO-PDF` プレースホルダを実 PDF エントリに置換。
- 訂正: 著者所属は HPE Labs(Prakash/Milpitas・Hong Enriquez/Oxford UK・Serebryakov/Milpitas・Milojicic/Milpitas)+ ORNL(David Grant・Wesley Brewer)の共同と PDF 著者欄で確定。
## [2026-06-04] ingest-paper | 本番 LLM 訓練の障害・性能診断 8 論文(並行取り込み)
- Sources: `.raw/papers/arxiv-2509.22832.pdf`(GPU Performance Modeling)、`.raw/papers/sigcomm25-skeletonhunter.pdf`(SkeletonHunter)、`.raw/papers/arxiv-2506.02007.pdf`(eACGM)、`.raw/papers/arxiv-2502.05413.pdf`(XPUTimer→Flare)、`.raw/papers/nsdi25-dong.pdf`(Aegis)、`.raw/papers/arxiv-2505.00342.pdf`(LLMPrism)、`.raw/papers/arxiv-2503.20263.pdf`(L4)。**ISAV/PACE は ACM ペイウォールのため PDF 非取得**(abstract + 公開本文断片で構築、`.raw/papers/` に原本なし、定量結果は未記載)。
- Pages created (sources): [[@2025__ISAV__From Exploration to Explanation - ML-Driven Causal Discovery for Datacenter Reliability at Scale]] / [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]] / [[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]] / [[@2025__IWQoS__eACGM - Non-instrumented Performance Tracing and Anomaly Detection towards Machine Learning Systems]] / [[@2025__arXiv__XPUTimer - Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale]] / [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]] / [[@2025__DSN__LLMPrism - Black-box Performance Diagnosis for Production LLM Training Platforms]] / [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]]
- Pages created (entities): 69 件。organization 6([[Hewlett Packard Labs]]/[[Oak Ridge National Laboratory]]/[[Case Western Reserve University]]/[[Rutgers University]]/[[Ant Group]]/[[Huawei Cloud]])、system/product/dataset/repo 15([[PACE]]/[[SkeletonHunter]]/[[eACGM]]/[[XPUTimer]]/[[LLMPrism]]/[[L4]]/[[Platform-X]]/[[Summit]]/[[Perlmutter]]/[[Vista]]/[[GPT-NeoX]]/[[Alibaba HPN]]/[[DeepSpeed]]/[[DLRover]]/[[The Pile]])、person 48。詳細は [[entities/_index]]。
- Pages updated (concepts): [[LLM学習モニタリング]] / [[LLM分散学習]] / [[集合通信]] / [[Fault Localization]] / [[根本原因分析]] / [[異常検知]] / [[並列化戦略]] / [[RDMAネットワーク監視]] / [[ストラグラー]] / [[ログ解析]] / [[GPU観測性]] / [[テレメトリ]] / [[eBPF]] / [[分散トレーシング]] / [[変化点検知]] / [[GPUクラスタ運用]] / [[障害緩和]](横断的知見・未解決の問いを積み増し)。[[GPU観測性]] 末尾の壊れたタグ(`</content></invoke>`)を除去。
- Pages updated (entities): [[Aegis]](本 NSDI 論文を真の一次ソースに更新) / [[Tianyin Xu]] / [[Pengfei Chen]] / [[Zhihan Jiang]] / [[Michael R. Lyu]] / [[Guangba Yu]] / [[Sun Yat-sen University]] / [[The Chinese University of Hong Kong]] / [[Tsinghua University]] / [[University of Illinois Urbana-Champaign]] / [[Alibaba Group]] / [[Megatron-LM]] / [[NCCL]] / [[Perfetto]]
- Key insight: 同期分散訓練の「全マシン対称」という規則性を性能予測・異常検知・並列化逆推定・ログ外れ値が別目的で利用し、[[Fault Localization]] は症状の層(CCL timeout)と真因デバイスの乖離を CCL カウンタ(Aegis)/ネットワークパス(SkeletonHunter)/ログ(L4)/メトリクス類似度(Minder)と計装位置ごとに別モダリティで橋渡しする(いずれも箇所特定止まりで RCA は人手)。
- 取り込み手法: Phase 1(8 subagent 並行で source + 著者 person entity、per-file lock、共有物は構造化 report)→ Phase 2(メイン + 3 subagent で org/system entity・concept 統合・索引・hot・log・manifest をファイル集合分離で競合なく更新)。
- 矛盾: [[XPUTimer]] は arXiv v2 で著者構成変化・システム名を [[Flare]] に改名。source ページに contradiction callout を設置、entity の aliases に両名を保持。
## [2026-06-04] ingest-paper | 大規模 GPU 訓練クラスタの障害管理 6 本
- Sources: papers/ 既存ノート 5 本(SC/SIGCOMM/HPCA/APNET 由来)+ research/conferences/ 1 本(Guard)を一次資料に wiki 化。FlashRecovery のみ `.raw/papers/arxiv-2509.03047.pdf` 取得。
- Pages created: [[@2025__SC__Fine-grained Automated Failure Management for Extreme-Scale GPU Accelerated Systems]], [[@2026__MLSys2026__Guard - Scalable Straggler Detection and Node Health Management for Large-Scale Training]], [[@2025__arXiv__FlashRecovery - Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs]], [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]], [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]], [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]] + entity 多数
- Pages updated: [[耐障害LLM訓練]], [[ストラグラー]], [[集合通信]], [[RDMAネットワーク監視]], [[GPUレジリエンス]], [[GPUクラスタ運用]], [[障害緩和]], [[チェックポイント]], [[LLM分散学習]], [[並列化戦略]], [[LLM学習モニタリング]], [[根本原因分析]], [[Fault Localization]], [[障害予測]], [[Mixture-of-Experts]], [[オープンネットワーキング]]
- Key insight: 大規模 GPU 訓練の障害管理が「検知の一次シグナル(ステップ時間/集合通信同期点/物理メトリクス)」「復旧の3+1系統(高速CP/予備機/べき等省略/データ並列複製冗長)」「緩和の段階化(multi-strike/10-20%しきい)」「計装位置(スイッチ/NIC/ホスト/物理部品)」の軸で横断的に整理された。
## [2026-06-04] ingest-paper | GPU/eBPF 観測性・集合通信の信頼性 7 論文(並行取り込み)
- Sources: `.raw/papers/arxiv-2510.20171.pdf`(Collective 100k+/NCCLX)、`.raw/papers/arxiv-2410.23661.pdf`(PICKER)、`.raw/papers/arxiv-2509.03018.pdf`(Mycroft)、`.raw/papers/arxiv-2601.20755.pdf`(ProfInfer)、`.raw/papers/bpftime_super.pdf`(eGPU)。eInfer・TOPC はペイウォール/非arXiv のため PDF 非取得、既存 `papers/` ノート + 公開メタ/スライド(`.raw/papers/sdarche_may2025_...pdf`)典拠で confidence: medium。
- Pages created (sources): [[@2025__eBPF__eInfer - Unlocking Fine-Grained Tracing for Distributed LLM Inference with eBPF]] / [[@2026__arXiv__ProfInfer - An eBPF-based Fine-Grained LLM Inference Profiler]] / [[@2025__SOSP__Mycroft - Tracing Dependencies in Collective Communication Towards Reliable LLM Training]] / [[@2025__HCDS__eGPU - Extending eBPF Programmability and Observability to GPUs]] / [[@2025__arXiv__Collective Communication for 100k+ GPUs]] / [[@2024__TOPC__Low-Overhead Trace Collection and Profiling on GPU Compute Kernels]] / [[@2024__arXiv__Microsecond-scale Dynamic Validation of Idempotency for GPU Kernels]]
- Pages created (concepts): [[GPU観測性]] / [[集合通信]] / [[動的計装|動的インストルメンテーション]] / [[LLM推論]] / [[ハードウェアカウンタ]] / [[べき等性]] / [[チェックポイント]]
- Pages created (entities): 53 件(人物 16・組織 13・システム/製品/repo/dataset 24)。詳細は [[entities/_index]]。
- Pages updated (concepts): [[eBPF]] / [[分散トレーシング]] / [[根本原因分析]] / [[耐障害LLM訓練]] / [[ストラグラー]] / [[障害注入]] / [[Mixture-of-Experts]] / [[LLM分散学習]] / [[LLM学習モニタリング]] / [[GPUクラスタ運用]] / [[テレメトリ]] / [[並列化戦略]]
- Pages updated (entities): [[Yusheng Zheng]] / [[Minlan Yu]] / [[Yangtao Deng]] / [[ByteDance]] / [[Harvard University]] / [[The Chinese University of Hong Kong]] / [[NCCL]] / [[bpftime]] / [[eunomia-bpf]] / [[Megatron-LM]] / [[MegaScale]]
- Key insight: GPU/LLM の観測性は計装の挿入時点(コンパイル時 LLVM / 実行時 PTX 注入 / ホスト側 eBPF)でオーバーヘッドと観測対象が分かれ、いずれもベンダー専用ツール(CUPTI/NVBit/Nsight)の高オーバーヘッド・ベンダーロックイン回避を共通動機とする。集合通信は Mycroft(可観測化による信頼性)と NCCLX(通信スタック再設計による性能)が同じ CCL ブラックボックス課題の観測側・機構側を成す。
- Note: eGPU(#4)と bpftime-super(#6)は同一論文と判明し source は1枚に統合(asplos.dev 公開 PDF の本文タイトルが eGPU)。eInfer 既存ノートの url DOI(3672197.3673434)は誤りで正は 3748355.3748372。
## [2026-06-04] ingest-paper | Approximation-First Timeseries Monitoring Query At Scale (PromSketch)
- Source: `.raw/papers/arxiv-2505.10560.pdf`(PVLDB / VLDB 2025, DOI:10.14778/3742728.3742732, arXiv:2505.10560, 15p, md5 6d58cd29…)
- Summary: [[@2025__VLDB__Approximation-First Timeseries Monitoring Query At Scale]]
- Pages created (source 1 + entity 10 + concept 1 = 12): source 上記 1 / entities [[Zeying Zhu]] [[Jonathan Chamberlain]] [[Kenny Wu]] [[David Starobinski]] [[Zaoxing Liu]] [[University of Maryland]] [[Boston University]] [[PromSketch]] [[Prometheus]] [[VictoriaMetrics]] [[Froot-NetSys promsketch]] / concept [[近似クエリ処理]]
- Pages updated: concept [[時系列データベース]] / [[index]] [[hot]] [[sources/_index]] [[entities/_index]] [[concepts/_index]]
- Key insight: TSDB 効率化には「取り込み最適化」([[HeteroTSDB]] のインデックス・tiering)と「クエリ最適化」([[PromSketch]] の中間結果キャッシュ)の直交 2 軸がある。[[Prometheus]]/[[VictoriaMetrics]] のような TSDBMS でも周期ルールクエリが重複ウィンドウを繰り返しスキャン・再計算する冗長性が残り(VictoriaMetrics は CPU 80.2% が Data Scanning)、ストレージエンジン改善だけでは取りきれない。PromSketch は「生データでも最終結果でもなく中間結果(Exponential Histogram バケット)をキャッシュ」+「EH×スケッチ(KLL/Universal Sketching)で可証明な誤差境界」で、5% 誤差を許容する前提のもとレイテンシ最大 2 桁・運用コスト約 400× を削減する。[[近似クエリ処理]] を新規 concept として追加し、[[時系列データベース]] に近似という第 3 軸を追記。
## [2026-06-04] ingest-paper (parallel ×5) | GPU 分散訓練インフラ/ネットワーク 5 本
- Sources:
- `.raw/papers/Liu-et-al.-2024---R-pingmesh---A-service-aware-RoCE-network-monitoring-and-diagnostic-system.pdf`(SIGCOMM 2024, DOI:10.1145/3651890.3672264, 14p, md5 3a812726…、ユーザー提供 PDF)
- `.raw/papers/arxiv-2503.11901.pdf`(SC 2025, arXiv:2503.11901, 13p, md5 8461f84e…)
- `.raw/papers/osdi25-lin-jinkun.pdf`(OSDI 2025, usenix lin-jinkun, 17p, md5 6799d314…)
- `.raw/papers/arxiv-2509.16293.pdf`(SOSP 2025, arXiv:2509.16293, 18p, md5 609ba597…)
- `.raw/papers/sigcomm25-qingkai.pdf`(SIGCOMM 2025, DOI:10.1145/3718958.3750521, 17p, md5 3af2f955…)
- Summary: [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]], [[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]], [[@2025__OSDI__Understanding Stragglers in Large Model Training Using What-if Analysis]], [[@2025__SOSP__Robust LLM Training Infrastructure at ByteDance]], [[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]]
- Pages created (source 5 + entity 27 + concept 4 = 36): sources 上記 5 / entities [[R-Pingmesh]] [[ByteRobust]] [[SMon]] [[NDTimeline]] [[Astral]] [[Seer]] [[Delta]] [[StragglerAnalysis]] [[Kefei Liu]] [[Jiao Zhang]] [[Shengkun Cui]] [[Ravishankar K. Iyer]] [[Jinkun Lin]] [[Aurojit Panda]] [[Jinyang Li]] [[Borui Wan]] [[Liang Xiang]] [[Chuan Wu]] [[Hao Zheng]] [[ChonLam Lao]] [[Gianni Antichi]] [[BUPT]] [[Douyin Vision]] [[NCSA]] [[Nokia Bell Labs]] [[New York University]] [[The University of Hong Kong]] / concepts [[耐障害LLM訓練]] [[ストラグラー]] [[GPUレジリエンス]] [[RDMAネットワーク監視]]
- Pages updated: concepts [[LLM学習モニタリング]] [[GPUクラスタ運用]] [[LLM分散学習]] [[Fault Localization]] [[並列化戦略]] [[テレメトリ]] [[オープンネットワーキング]] / entities [[ByteDance]] [[MegaScale]] [[Xin Liu]] [[Ziheng Jiang]] [[Megatron-LM]] [[Tencent]] [[Nanjing University]] [[Harvard University]] [[Qingkai Meng]] [[Chen Tian]] [[Pulse]] [[University of Illinois Urbana-Champaign]] [[Saurabh Jha]] [[IBM Research]] [[Zhuo Jiang]] / [[index]] [[hot]] [[sources/_index]] [[entities/_index]] [[concepts/_index]]
- Key insight: LLM 訓練の信頼性を「ハードウェアの床([[GPUレジリエンス]]:H100 はメモリ MTBE が A100 の 1/3.2)→ クラッシュしない劣化([[ストラグラー]]:全 GPU 時間の 10.4% を浪費・主因は計算側不均衡)→ 耐障害インフラ([[耐障害LLM訓練]]:[[ByteRobust]] が ETTR 97%・「迅速な隔離」を選ぶ)→ ネットワーク監視([[RDMAネットワーク監視]]:[[R-Pingmesh]] の能動プローブ・[[Astral]] の 4 層フルスタック)」の縦の系譜として束ねた。[[Fault Localization]] に「精密に当てる vs あえて粗く切る(過剰排除)」、[[GPUクラスタ運用]] に「件数 11% でも GPU 時間 82%」の運用コスト内訳、[[LLM学習モニタリング]] に「検知信号の層 + 起因への写し方(全層相関/反事実シミュレーション/スタックトレースクラスタリング)」の第二軸を追加。Stage A 5 並行 + Stage B メイン統合のハイブリッドで実施。
## [2026-06-04] ingest-paper | Cloud Infrastructure Management in the Age of AI Agents
- Source: `.raw/papers/2026_Unknown_Cloud_Infrastructure_Management_Age_AI.pdf`(ACM SIGOPS OSR 2025, DOI:10.1145/3759441.3759443, 8p, md5 4118a93d…)
- Summary: [[@2025__OSR__Cloud Infrastructure Management in the Age of AI Agents]]
- Pages created: [[@2025__OSR__Cloud Infrastructure Management in the Age of AI Agents]], [[Martin Casado]], [[Archit Bhatnagar]], [[Tongyuan Miao]], [[Yunming Xiao]], [[Yibo Huang]], [[University of California, Berkeley]], [[Andreessen Horowitz]], [[WorkArena]], [[Azure Copilot]], [[クラウド管理モダリティ]]
- Pages updated: [[Zhenning Yang]], [[Ang Chen]], [[Yiming Qiu]], [[Patrick Tser Jern Kon]], [[University of Michigan]], [[Terraform]], [[Microsoft Azure]], [[AIOpsLab]], [[Infrastructure as Code]], [[SRE AI Autonomy Levels]], [[agentic SRE]], [[AIOps]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: [[Ang Chen]] グループの IaC 3 部作([[Zodiac]]/[[NSync]]/[[Lilac]])を「クラウド管理の 4 [[クラウド管理モダリティ|モダリティ]](SDK/CLI/IaC/ClickOps)の 1 つ」として相対化するビジョン論文。段階×モダリティのトレードオフを Azure VM で実証(CLI=作成最効率、IaC=再作成更新に強く monitoring に弱い、ClickOps=monitoring に強く作成は遅い)。agent-cloud interface が [[AIOpsLab]] の ACI と、自律度段階化が [[SRE AI Autonomy Levels]] と独立に収束し、IaC クラスタと agentic SRE/AIOps クラスタを接続した。
## [2026-06-04] ingest-paper | TimeCopilot
- Source: `.raw/papers/arxiv-2509.00616.pdf`(arXiv:2509.00616v3, NeurIPS 2025 Workshop BERT2S, 9p, md5 abf2a043…)
- Summary: [[@2025__arXiv__TimeCopilot]]
- Pages created: [[@2025__arXiv__TimeCopilot]], [[Azul Garza]], [[Renée Rosillo]], [[TiRex]]
- Pages updated: [[TimeCopilot]](seed→developing), [[GIFT-Eval]], [[Chronos-2]], [[TimesFM]], [[エージェント型時系列予測]], [[時系列基盤モデル]], sources/entities の各 _index, [[index]], [[hot]]
- Key insight: 複数 TSFM と LLM を単一統一 API 下に集約する初のオープンソースなエージェント型予測フレームワーク。[[エージェント型時系列予測]] の Workflow パラダイム代表で、基盤モデル不使用の [[TimeSeriesScientist]] と「予測力の源泉」が対極(TSFM アンサンブルハブ vs 軽量 21 モデルライブラリ)——同じ Workflow 骨格でも行動空間が独立で、ATSF の「プロセスの組織化は基盤モデルの有無と直交」を例証。GIFT-Eval で MedianEnsemble([[Chronos-2]]+[[TimesFM]]+[[TiRex]]+isotonic regression)が確率予測 CRPS 全体最良を約 $24 で達成し、複数 TSFM の結合が各単体 SOTA を上回る。ただし SOTA の実体はアンサンブルで、LLM オーケストレーションの正味寄与を切り分けるアブレーションは本体論文に無い([[Cast-R1]] のコンポーネントアブレーションと対照)。
## [2026-06-04] ingest-paper | TimeSeriesScientist - A General-Purpose AI Agent for Time Series Analysis
- Source: `.raw/papers/arxiv-2510.01538.pdf`(arXiv:2510.01538, 34p, md5 7f6981a2…)
- Summary: [[@2025__arXiv__TimeSeriesScientist - A General-Purpose AI Agent for Time Series Analysis]]
- Pages created: [[@2025__arXiv__TimeSeriesScientist - A General-Purpose AI Agent for Time Series Analysis]], [[Haokun Zhao]], [[Xiang Zhang]], [[Jiaqi Wei]], [[Chenyu You]], [[Stony Brook University]], [[TimeSeriesScientist]]
- Pages updated: [[エージェント型時系列予測]], sources/entities/concepts の各 _index, [[index]], [[hot]]
- Key insight: 初の LLM 駆動エージェント型の汎用単変量時系列予測。Curator→Planner→Forecaster→Reporter の固定 SOP は [[エージェント型時系列予測]] の Workflow パラダイムの典型で、AgenticRL の [[Cast-R1]] と対をなす。基盤モデルを一切使わず統計+古典 ML+軽量 DL の 21 モデルだけで LLM 直接予測ベースラインを平均 38.2% 上回り、「予測能力の源泉はモデル規模でなくプロセスの組織化」という ATSF の主張を例示。前処理除去のアブレーション(MAE +41.8%、3 モジュール中最大)が perception=適応的前処理の重要性を定量裏づけ。
## [2026-06-04] query | TSFM単体とVLM統合の本質的差異(Toto vs Toto-1.0-QA-Experimental)
- Question: 「Toto はあくまで次の時系列データ点を予測するだけだが、VLM と統合すると何が違うのか?」
- Answer filed: [[TSFM単体とVLM統合の本質的差異]](`wiki/questions/`)
- 核心: VLM 統合版は Toto を予測器でなく**時系列エンコーダ**として再利用し、予測ヘッド手前の中間埋め込みを variate embedding MLP + projection layer で VLM([[Qwen3-VL]] 32B)空間へ射影。入出力の型が「数値→数値」から「(時系列埋め込み + 言語質問)→言語回答」へ変わり、予測器から「時系列を読んで言語で説明する推論器」へ質的変化。ARFBench Table 3 で精度 63.9%(全モデル最良、GPT-5 を 1.2pp 上回る)、VLM 単体・テキスト LM 版を 7pp 以上上回る——数値構造・スケール・多変量関係を保持した埋め込みが BPE 数値破壊・トークン爆発を回避するため。[[エージェント型時系列予測]] が TSFM を「行動空間の 1 ツール」に格下げするのと呼応(本問は TSFM を「知覚の器官」に作り替える)。
- Pages: questions 1 新規、index の Questions 欄を初エントリで更新。ソース不変・新規 ingest なし。
## [2026-06-04] ingest-paper | OpenRCA / Cloud-OpsBench / AlertGuardian(AIOps-RCA 一次論文 3 本を subagent 並行取り込み)
- Sources: `.raw/papers/openreview-M4qNIzQYpd-openrca.pdf`(ICLR 2025, 29p, md5 25e33e76…) / `.raw/papers/arxiv-2603.00468.pdf`(arXiv:2603.00468, 22p, md5 a69979dd…) / `.raw/papers/AlertGuardian.pdf`(ASE 2025, 12p, md5 0ceb3aa6…)
- Summary: [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures|2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]] / [[@2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems|2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems]] / [[@2025__ASE__AlertGuardian - Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems|2025__ASE__AlertGuardian - Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems]]
- Pages created (source 3 + entity 12 = 15): sources 3 本、entities [[OpenRCA]] / [[Cloud-OpsBench]] / [[AlertGuardian]] / [[Kubernetes]] / [[Junjielong Xu]] / [[Shilin He]] / [[Qingwei Lin]] / [[Chaoyun Zhang]] / [[Guangba Yu]] / [[Pengfei Chen]] / [[Sun Yat-sen University]] / [[Tencent]]
- Pages updated: entities [[Pinjia He]] / [[Dan Pei]] / [[Microsoft]] / [[Tsinghua University]] / [[The Chinese University of Hong Kong, Shenzhen]] / [[The Chinese University of Hong Kong]] / [[Michael R. Lyu]] / [[Online-Boutique]] / [[CrewAI]]、concepts [[根本原因分析]] / [[SRE Benchmark]] / [[AIOps]] / [[agentic SRE]] / [[インシデント管理]] / [[異常検知]] / [[障害注入]] / [[テレメトリ]]、index / sources・entities/_index / hot
- Key insight: OpenRCA(静的テレメトリ QA)と Cloud-OpsBench(決定論的 State Snapshot)が、ライブ環境ベンチ([[AIOpsLab]]/[[SREGym]]/[[ITBench]])と純静的データセットの中間=RCA 特化の「第三の型」を別アプローチで示す。RCA に限れば能力天井が桁違いに低い(Claude 3.5=11.34%・Hard 0%)。診断オラクルが Cloud-OpsBench の過程評価(IAC/RAR/ZTDR)で第四の型へ拡張。AlertGuardian は [[LogPilot]] に対し「単発診断 vs ライフサイクル全体最適化」の対比軸。subagent 並行で共有 entity 衝突を per-file lock 協調で解消、[[Guangba Yu]] の所属(SYSU↔CUHK)は contradiction callout 保持。既存 papers/ AlertGuardian ノートは温存し一方向参照。総 224→239 ページ・実ソース 33→36。
## [2026-06-04] ingest-paper | Foundation Models for Time Series: A Survey(TSFM の 6 次元タクソノミー)
- Source: `.raw/papers/arxiv-2504.04011.pdf`(arXiv:2504.04011v1 [cs.LG], 2025-04-05、20p、md5 32d44618…)
- Summary: [[@2025__arXiv__Foundation Models for Time Series - A Survey|2025__arXiv__Foundation Models for Time Series - A Survey]]
- Pages created: [[@2025__arXiv__Foundation Models for Time Series - A Survey|2025__arXiv__Foundation Models for Time Series - A Survey]](source 1)/ [[Dell Technologies]]・[[Siva Rama Krishna Kottapalli]](entity 2)= 3 ページ
- Pages updated: [[Toto]](contradiction + サーベイ分類)・[[TimesFM]]・[[Chronos-2]](初代 Chronos との別世代 note)(entity 3)/ [[時系列基盤モデル]]・[[多変量時系列予測]]・[[Mixture-of-Experts]](concept 3、横断的知見・未解決の問いを積み増し)/ index・hot・sources/_index・entities/_index・manifest
- Key insight: vault が個別に深掘りしてきた TSFM 群を俯瞰する 6 次元タクソノミー(アーキテクチャ/パッチ/目的関数/単変量・多変量/確率的・決定論的/規模)。**目的関数による分類が独自軸**。横断的知見 4 点を追加——(a) 汎用 ML の地図と観測特化研究の視点差(サーベイは observability の統計特性を扱わず Toto を「Datadog 内部データ学習」とだけ記述)、(b) 評価指標(MASE/CRPS)と訓練目的関数(点予測/確率的)の対応、(c)「多変量」の分類基準の食い違い([[Falcon-X]] は channel-independence を cross-variate の退化として除外)、(d) MoE の LLM 訓練→TSFM への拡張(Time-MOE、Huber+auxiliary loss、[[Mixture-of-Experts]] の横断的知見を初実体化)。[[Toto]] のスペック(サーベイ 103M・1 兆点 対 vault 151M・約 2.36 兆点)はモデルバージョン差として contradiction、サーベイの「Chronos」は初代(T5)で [[Chronos-2]] と別世代の note。サーベイ自体に分類の揺れ(MOMENT の単変量/多変量、TimesFM の 100B/200B)と ACM プレースホルダ残存。[[時系列基盤モデル - MOC]] が本サーベイを既登録済み。総 224 ページ・実ソース 33 に更新。
## [2026-06-04] ingest-paper | Cast-R1(ツール拡張・逐次意思決定の時系列予測 RL 実装)
- Source: `.raw/papers/arxiv-2602.13802.pdf`(arXiv:2602.13802v1 [cs.LG], 2026、16p、md5 263608dd…)
- Summary: [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting|2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]]
- Pages created: [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting|2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]](source 1)= 1 ページ
- Pages updated: [[Cast-R1]](ATSF ingest 時のスタブを一次論文ベースに実体化)/ [[Xiaoyu Tao]]・[[Mingyue Cheng]](entity 2、source 参照を追記)/ [[エージェント型時系列予測]]・[[強化ファインチューニング]]・[[時系列基盤モデル]](concept 3、横断的知見・未解決の問いを積み増し)/ index・hot・sources/_index・manifest
- Key insight: 既に ingest 済みのポジションペーパー ATSF([[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting|2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]])が **AgenticRL の代表**として参照しつつ dead link だった [[Cast-R1]] を、同グループの一次論文として実体化。ATSF が実験なしに掲げた主張群を Cast-R1 のアブレーションが個別に裏づけた——予測モデルを行動空間の 1 ツールとして呼ぶ([[Chronos-2]] 単独除去で volatile NP が MSE 22.5→55.4、予測モデルツール全除去で ETTh1 6.062→15.993)、省察・記憶・計画が性能を生む(Refine/Memory/Planning 除去で劣化)、適応的行動選択は報酬最適化で獲得(RL 除去が最大劣化 NP 24.750→54.631)。一方で性能が backbone 規模に強く依存(Qwen3 1.7B→8B で単調改善)し、**本文(8B/4×A800)と Appendix(1.7B/単一 RTX 4090D)で実装設定が矛盾、Table 2 の主結果数値が scaling 表の 4B 行と一致、ACM テンプレートのプレースホルダ残存**という未完成プレプリントの瑕疵も出典検査で検出。総 221 ページ・実ソース 32 に更新。
## [2026-06-04] ingest-paper | ARFBench(時系列質問応答ベンチ)
- Source: `.raw/papers/arxiv-2604.21199.pdf`(arXiv:2604.21199, 2026、45p、md5 50a2e099…)
- Summary: [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response|2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]]
- Pages created: [[ARFBench]], [[Stephan Xie]], [[Ben Cohen]], [[Mononito Goswami]], [[Toto-1.0-QA-Experimental]], [[Qwen3-VL]](entity 6)/ [[時系列質問応答]](concept 1)= 7 ページ
- Pages updated: [[Datadog]], [[Carnegie Mellon University]], [[Ameet Talwalkar]], [[Toto]], [[Amazon Web Services]](entity 5)/ [[異常検知]], [[時系列基盤モデル]], [[インシデント管理]](concept 3)/ index・hot・各 _index・manifest
- Key insight: [[Datadog]] の本番インシデント Slack タイムラインを専門家アノテーションの一次源として TSQA ベンチ ARFBench を構築し、事前学習済み TSFM([[Toto]])を VLM と結合した [[Toto-1.0-QA-Experimental]] が精度 63.9% でフロンティアモデル(GPT-5 62.7%)に並び、人間専門家との best-of-2 オラクルが精度 87.2%・F1 82.8% の超人的フロンティアを示した。並行 ingest(Cisco TSM)が [[Toto]]/[[時系列基盤モデル]] を同時更新していたため再読込のうえ衝突なくマージ。
## [2026-06-04] ingest-paper | Cisco Time Series Model Technical Report
- Source: `.raw/papers/arxiv-2511.19841.pdf`(arXiv:2511.19841, 2025、18p、md5 b6dc319b…)
- Summary: [[@2025__arXiv__Cisco Time Series Model Technical Report|2025__arXiv__Cisco Time Series Model Technical Report]]
- Pages created: [[Cisco]], [[Splunk]], [[TimesFM]], [[Splunk Observability Cloud]], [[Liang Gou]](entity 5)= 5 ページ
- Pages updated: [[Toto]], [[GIFT-Eval]], [[Chronos-2]](entity 3、比較対象として相互リンク)/ [[時系列基盤モデル]](concept 1)/ index・hot・各 _index・manifest
- Key insight: [[TimesFM]] に特殊トークンと解像度埋め込みを足して継続事前学習するだけで、粗い 1 時間と細かい 1 分のコンテキストを連結した「多解像度の長コンテキスト」を 1/30 の系列長で扱え、観測ドメインで競合 TSFM([[Toto]]/[[Chronos-2]])を上回りつつ汎用ベンチマーク([[GIFT-Eval]])の能力も保てる。著者は所属を明記せず全員 @cisco.com、[[Splunk]] を Cisco 傘下として整理。
## [2026-06-04] ingest-paper | Towards Robust LLM Post-Training(RFT 障害管理)
- Source: `.raw/papers/arxiv-2605.04431.pdf`(arXiv:2605.04431, 2026、16p、md5 99427179…)
- Summary: [[@2026__arXiv__Towards Robust LLM Post-Training - Automatic Failure Management for Reinforcement Fine-Tuning|2026__arXiv__Towards Robust LLM Post-Training - Automatic Failure Management for Reinforcement Fine-Tuning]]
- Pages created: [[Yunpeng Zhai]], [[Liancheng Fang]], [[Kening Zheng]], [[Hongyi Liu]], [[Xiaosong Huang]], [[RFT-FaultBench]], [[RFT-FM]], [[OpenRLHF]](entity 8)/ [[強化ファインチューニング]](concept 1)= 9 ページ
- Pages updated: [[Lingzhe Zhang]], [[Tong Jia]], [[Ying Li]], [[Philip S. Yu]](entity 4)/ [[異常検知]], [[障害緩和]], [[障害注入]], [[AIOps]](concept 4)/ index・hot・各 _index・manifest
- Key insight: AIOps の検知→診断→修復のソフトウェア障害管理ライフサイクルを、PKU の同一グループ([[Lingzhe Zhang]] ら、[[MicroRemed]]・LLM4AIOps サーベイと連続)がマイクロサービス運用から LLM の[[強化ファインチューニング]](RFT)の訓練プロセスへ移植し、初の細粒度障害ベンチ [[RFT-FaultBench]] と閉ループ [[RFT-FM]] を提示。RFT-FM の auto remediation の不安定性(MSC -5.84%)は [[障害緩和]] の「安全に巻き戻せる反復が鍵」と整合。並行 ingest(ARFBench)が [[異常検知]] を同時更新しコンフリクトしたが再読込して積み増し。
## [2026-06-04] ingest-paper | Unearthing Semantic Checks for Cloud IaC Programs(Zodiac)
- Source: `.raw/papers/sosp24-zodiac.pdf`(SOSP '24, DOI:10.1145/3694715.3695974。ACM は epdf/WebFetch とも 403、著者 [[Patrick Tser Jern Kon]] の preprint `cs-pk.com/preprint-sosp24-zodiac.pdf` を curl 取得、16p、md5 d3e3a903…)
- Summary: [[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs|2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]]
- Pages created: [[Yiming Qiu]], [[Patrick Tser Jern Kon]], [[Ryan Beckett]], [[Ang Chen]], [[University of Michigan]], [[Zodiac]], [[Terraform]], [[Microsoft Azure]](entity 8)/ [[Infrastructure as Code]], [[設定マイニング]](concept 2)= 11 ページ
- Pages updated: [[Microsoft]], [[障害注入]](概念に「デプロイ時障害注入と silent fault」横断知見 + 問い)/ index・hot・各 _index。なお [[Infrastructure as Code]]・[[Ang Chen]]・[[University of Michigan]]・[[Yiming Qiu]]・[[Patrick Tser Jern Kon]] は並行 ingest の Lilac/NSync 側が Zodiac/Lilac/NSync の 3 ソース横断で増築(per-file lock 協調下、私の Zodiac 内容は保全)
- Key insight: コンパイルを通過した IaC でもデプロイ時に失敗する **semantic gap** を、公開リポジトリからのセマンティックチェック[[設定マイニング|マイニング]](KB 3 クラス + グラフ DSL + 84 テンプレート + confidence/lift + GPT-4 interpolation)と、SMT(Z3)で「単一チェックのみ違反」を保証する negative test case のデプロイ検証で埋める。Azure 52 種別・26,000 リポジトリから 510 検証済みチェック、200+ バグ repo + 公式ドキュメント 4 件修正。negative test case 生成は構成への「障害注入」で、注入が障害化しない偽陽性を実環境観測で篩う点が [[障害注入]] の silent fault 問題と同型。
- 並行 ingest 多数(Zodiac/Lilac/NSync/eBPF/ATSF)で index がドリフト。実ファイル数で index を **196 ページ/28 ソース**に reconcile(per-file lock で torn write は回避)。
## [2026-06-04] ingest-paper | Cloud IaC × LLM エージェント 2 本(NSync / Lilac)
- Source: `.raw/papers/arxiv-2510.20211.pdf`(NSync, arXiv:2510.20211)/ `.raw/papers/lilac-aiops-2025.pdf`(Lilac, AIOps 2025、cs-pk.com から取得)
- Summary: [[@2025__arXiv__Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents|2025__arXiv__Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents]] / [[@2025__AIOps__Automated Lifting for Cloud Infrastructure-as-Code Programs|2025__AIOps__Automated Lifting for Cloud Infrastructure-as-Code Programs]]
- Pages created: [[NSync]], [[Lilac]], [[Amazon Web Services]], [[University of California, San Diego]], [[Zhenning Yang]], [[Jingjia Peng]], [[AWS CloudTrail]], [[aztfexport]](source 2 + entity 8)
- Pages updated: [[Infrastructure as Code]], [[AIOps]](概念 2)/ [[Terraform]], [[University of Michigan]], [[Ang Chen]], [[Yiming Qiu]], [[Patrick Tser Jern Kon]](並行 ingest の Zodiac 系エンティティへ一方向参照を積み増し)/ index・hot・各 _index
- Key insight: 並行で進行中だった [[Zodiac]](SOSP'24、同じ [[Ang Chen]]/[[University of Michigan]] グループの IaC デプロイ前検証)の ingest と概念 [[Infrastructure as Code]]・エンティティ群が衝突。重複を作らず**統合**した。横断的知見の核は「IaC ライフサイクルを順方向のデプロイ前検証(Zodiac)・逆方向の lifting(Lilac)・drift 修復(NSync)の 3 方向で同一研究室が攻め、いずれも LLM + symbolic guardrail + 蓄積する知識ベースへ収束し、inter-resource 依存が方向を問わず最難所」。AIOps が事後対応の診断から先回りの構成管理へ外延を広げる実例でもある。
- 注意: 並行セッションが index/_index を同時編集中。共有エンティティ(Terraform/UMich/Ang Chen 等)の _index・index.md 登録は Zodiac 側に委ね、重複が出た場合は後続の wiki-lint で dedup する想定。
## [2026-06-04] ingest | eBPF × AI/LLMs - The Convergence of System Observability and AI
- Source: `.raw/articles/gpttrace-ebpf-ai-2026-06-04.md`(`eunomia.dev/GPTtrace/` を 2026-06-04 取得。curl + defuddle で本文抽出。[[Yusheng Zheng]]([[eunomia-bpf]])の eBPF×AI 総説 + awesome list。WebFetch は 403、curl に UA を付けて 200)
- Summary: [[@2026__eunomia.dev__eBPF × AI-LLMs - The Convergence of System Observability and AI|2026__eunomia.dev__eBPF × AI-LLMs - The Convergence of System Observability and AI]]
- Pages created: [[@2026__eunomia.dev__eBPF × AI-LLMs - The Convergence of System Observability and AI|source]], [[Yusheng Zheng]], [[eunomia-bpf]], [[bpftime]], [[GPTtrace]], [[AgentSight]], [[Kgent]], [[eBPF]](新規 concept)
- Pages updated: [[テレメトリ]], [[agentic SRE]], [[Model Context Protocol]], [[go-conntracer-bpf]], index/log/hot
- Key insight: 本 wiki は一貫して**アプリケーション層**の AIOps/RCA/可観測性を扱ってきたが、本ソースは初めて**カーネル層(eBPF)**の角度を持ち込む。核心は eBPF と AI の**双方向共生ループ**——(a)**eBPF for AI**: カーネル層のゼロ計装テレメトリで AI ワークロード/エージェントを観測([[AgentSight]] が claude code/gemini-cli を <3% オーバーヘッドで追跡)、(b)**AI for eBPF**: LLM が eBPF を生成・検証([[Kgent]] が Z3 記号検査つきで約 80% 意味的正しさ、[[GPTtrace]] が実装)。新 concept [[eBPF]] に共生ループを集約し、(1) [[テレメトリ]] の計装層([[go-conntracer-bpf]] の eBPF 系譜)の最前線、(2) [[agentic SRE]] の「エージェントを観測する側に置く」第 3 の軸、(3) [[Model Context Protocol]] が eBPF/カーネルツールをエージェントへ公開する標準として使われ始めた点を横断接続。本ソースは awesome list(二次情報)のため `confidence: medium`、[[AgentSight]](arXiv:2508.02736)・[[Kgent]](eBPF'24)の一次取り込みを未解決の問いに残す。
- Note: GPTtrace ページ URL だが内容は GPTtrace 単体でなく eBPF×AI 全体の総説。列挙プロジェクトは多数だが、eunomia-bpf 中核かつ vault と接続が強い 6 エンティティ + 1 concept に絞り、残りは source ページ本文に列挙のみ(editorial judgment)。並行 ingest(ATSF 論文)と競合したため `agentic SRE.md`・`index.md`・`log.md` は wiki-lock 取得後に編集。総ページ 178→186・実ソース 24→25 に reconcile。
## [2026-06-04] ingest-paper | Position: Beyond Model-Centric Prediction—Agentic Time Series Forecasting
- Source: `.raw/papers/arxiv-2602.01776.pdf`(Cheng+, [[University of Science and Technology of China]], arXiv:2602.01776v4 [cs.LG] 11 Mar 2026, 11p)。arXiv から PDF 原本を取得、pdftotext で全文通読。abstract・書誌・著者所属は PDF 本文(冒頭・脚注 1)で裏取り。
- Summary: [[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting|2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]]
- Pages created: [[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting|source]], [[Mingyue Cheng]], [[Xiaoyu Tao]], [[Qi Liu]], [[Enhong Chen]], [[University of Science and Technology of China]], [[Cast-R1]], [[TimeCopilot]], [[エージェント型時系列予測]](新規 concept)
- Pages updated: [[時系列基盤モデル]], [[agentic SRE]], index/hot/各 _index
- Key insight: 時系列予測を perception・planning・action・reflection・memory の反復的意思決定(ATSF)へ再定式化するポジションペーパー。予測モデルの呼び出しを行動空間の 1 つとして扱い、Workflow/AgenticRL/AgenticFlow の 3 実装に整理(Table 1/2)。この agentic ループが [[agentic SRE]] の「観測→行動→検証→反省」分割と同型で、agentic 設計原理がドメイン横断で共有されることを新 concept [[エージェント型時系列予測]] に集約。ATSF はモデル規模・[[時系列基盤モデル]]と直交し TSFM を 1 ツールとして呼び出す立場。本 wiki 初のエージェント型時系列予測かつ初のポジションペーパー。
- Note: 入力は既存 `papers/` ノート(単一ソース詳細メモ)だったが、wiki-ingest-paper として arXiv から PDF 原本を別途取得し wiki レイヤーに集約。既存 `papers/` ノートは温存し source ページから一方向参照。PDF 脚注 1 の公式コード `github.com/Mingyue-Cheng/atsf` を一次採用(既存 papers ノートの `Xiaoyu-Tao/Cast-R1-TS` との差異を source ページに注記)。実ソース数 24・総ページ 178 に reconcile。
## [2026-06-03] ingest-paper | LogPilot - Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems
- Source: `.raw/papers/arxiv-2509.25874.pdf`(Jiang+, [[The Chinese University of Hong Kong]]×[[ByteDance]], ASE 2025 採録, arXiv:2509.25874v1 [cs.SE], 13p)。arXiv から PDF 原本を取得、pdftotext で全文通読。abstract・書誌・ASE 2025 採録は arXiv abs ページで裏取り。
- Summary: [[@2025__ASE__LogPilot - Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems|2025__ASE__LogPilot - Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems]]
- Pages created: [[@2025__ASE__LogPilot - Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems|source]], [[LogPilot]], [[Zhihan Jiang]], [[Michael R. Lyu]], [[Tieying Zhang]], [[The Chinese University of Hong Kong]], [[Volcano Engine]], [[ログ解析]](新規 concept)
- Pages updated: [[ByteDance]], [[根本原因分析]], [[異常検知]], [[Fault Localization]]
- Key insight: アラート定義(PromQL)の意味的意図でログを絞る intent-aware scoping と、request を spatiotemporal log chain に再構成・クラスタリングして代表だけを LLM に渡す設計(98.71% の呼び出し削減)で、ログ volume の context 超過問題を解く。本 wiki 初のログ専門 RCA 一次論文で、「情報を絞ってから推論」の骨格が [[MetricSifter]]/[[Bits AI SRE]] とモダリティを越えて通底することを [[ログ解析]] に集約。産業側の「文脈なしの異常検知は不十分」という立場が [[MonitorAssistant]] と同型。
- Note: 別セッションが [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark|2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]] を並行 ingest(「23 ソース目」と採番)。過去の番号付けに +1 ズレがあり、実ソース数は LogPilot を含めて 23。index を 169 ページ/23 ソースに reconcile(per-file lock で torn write 回避)。
## [2026-06-03] ingest-paper | Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark
- Source: `.raw/papers/arxiv-2510.04711.pdf`(Fang+, [[The Chinese University of Hong Kong, Shenzhen]], arXiv:2510.04711v2 [cs.SE], 2025-12-23 改訂, 20p)。arXiv から PDF 原本を取得、pdftotext で全文通読。
- Summary: [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark|2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]]
- Pages created: [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark|source]], [[Aoyang Fang]], [[Pinjia He]], [[The Chinese University of Hong Kong, Shenzhen]], [[障害注入]](新規 concept)
- Pages updated: [[根本原因分析]], [[Train-Ticket]], [[ChaosMesh]]
- Key insight: 単純ヒューリスティック SimpleRCA が 4 公開ベンチで SOTA に匹敵する事実が、データ駆動 RCA の「進歩」をベンチマークの過度な単純さ(障害ケースの 86% が Type I/II の局所化/過少発現、99% が観測データ不完全)の産物と暴く。9,152 注入の 84.4% が silent fault という定量化は、ChaosMesh への「症状しか注入しない」批判をさらに進め、新 concept [[障害注入]] の核に。RCA の前提条件が「量(削減)・質(スケール)・完全性(被覆)」の 3 つに整理され、[[MetricSifter]]/[[TelecomTS]] の議論と接続。
## [2026-06-03] ingest-paper | MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models
- Source: `.raw/papers/fse2024-monitorassistant.pdf`(Yu+, [[Tsinghua University]]×[[Microsoft]], ESEC/FSE 2024 Industry Track, DOI:10.1145/3663529.3663826, 12p)。NetManAIOps サイトの公開 PDF を原本に取得、pdftotext で全文通読。abstract・書誌は ACM Digital Library・Microsoft Research ページで裏取り。
- Summary: [[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models|2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]]
- Pages created: [[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models|source]], [[MonitorAssistant]], [[Zhaoyang Yu]], [[Dan Pei]]
- Pages updated: [[Minghua Ma]], [[異常検知]]
- Key insight: LLM を検知器そのものでなくメタ層(設定推奨・解釈・フィードバック仲介)に限定する設計が「常時稼働には LLM が重い」制約の実践的回答。「実用的異常」(統計的逸脱+インシデント裏付け)の定義が学術—産業ギャップの構造を明示化。
## [2026-06-03] ingest-paper | TelecomTS: A Multi-Modal Observability Dataset for Time Series and Language Analysis
- Source: `.raw/papers/arxiv-2510.06063.pdf`
- Summary: [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis|2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]]
- Pages created: [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis|2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]], [[TelecomTS]], [[Yale University]], [[Ali Maatouk]], [[Rex Ying]]
- Pages updated: [[時系列基盤モデル]], [[異常検知]], [[根本原因分析]]
- Key insight: 絶対スケール情報の除去が RCA で最大 +30.4 ポイントの劣化を招き、正規化がオブザーバビリティ特有の診断情報を破壊することを初めて定量化。Toto が観測データ事前学習で RCA 0.848 と突出する一方、スケールを明示エンコードする Mantis が異常検知 F1 で Toto を凌駕。
## [2026-06-03] ingest-paper | A Survey of AIOps in the Era of Large Language Models
- Source: `.raw/papers/arxiv-2507.12472.pdf`(Zhang+, [[Peking University]]/[[Tsinghua University]]/[[University of Illinois Chicago]]/[[The Hong Kong University of Science and Technology (Guangzhou)]], ACM Computing Surveys 採録, arXiv:2507.12472, DOI:10.1145/3746635, 35p)。ACM が Cloudflare ボット保護背後で WebFetch/curl とも 403 のため arXiv プレプリント版を原本に fetch-paper-pdf.sh で取得、pdftotext で本文 §1–§8 を通読。abstract・書誌は arXiv abs ページ(journal-ref "Accepted By CSUR")で裏取り。
- Summary: [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models|2025__CSUR__A Survey of AIOps in the Era of Large Language Models]]
- Pages created: [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models|2025__CSUR__A Survey of AIOps in the Era of Large Language Models]], [[Ying Li]], [[Philip S. Yu]], [[University of Illinois Chicago]], [[The Hong Kong University of Science and Technology (Guangzhou)]], [[異常検知]]
- Pages updated: [[Lingzhe Zhang]], [[Tong Jia]], [[Peking University]], [[Tsinghua University]], [[AIOps]], [[根本原因分析]], [[障害緩和]], [[Fault Localization]], [[障害予測]], [[時系列基盤モデル]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: LLM4AIOps の初の包括的サーベイで、著者は既出の [[MicroRemed]] と同じ PKU グループ([[Lingzhe Zhang]]・[[Tong Jia]]・[[Ying Li]])。AIOps を切る 3 つ目の軸=**工程フロー**(データ→タスク→手法→評価)が確定し、[[AIOpsLab]] の能力軸・[[Google]] の自律度軸に並ぶ。緩和の自動化 5 段で vault の [[MicroRemed]](Lv4 script generation)・[[Stratus]](Lv5 automatic execution)が位置づき、サーベイが「Lv5 は実効性未検証」とした空白(カットオフ 2024-12)を 2025–2026 の一次ソースが [[Transactional No-Regression]] 付きで埋める時間的接続を確認。サーベイ自身が [[AIOpsLab]] を全ライフサイクルベンチの代表として引用し、地図(サーベイ)と地点(一次ソース)が相互参照。欠けていた概念 [[異常検知]] を新設。出典検査で arXiv v1 の数値不整合(abstract「183 本」対 本文/Fig.4「163 本」)を検出し注記。並行する [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services|2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]] の ingest(18 ソース目)と採番が衝突したため本サーベイを 19 ソース目に reconcile。
## [2026-06-03] ingest-paper | An Empirical Study of Production Incidents in Generative AI Cloud Services
- Source: `.raw/papers/arxiv-2504.08865.pdf`(Yan+, [[Huazhong University of Science and Technology]]×[[University of Illinois Urbana-Champaign]]×[[Microsoft]], ICSE 2026, arXiv:2504.08865, 12p)
- Summary: [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services|2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]]
- Pages created: [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services|2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]], [[Haoran Yan]], [[Huazhong University of Science and Technology]], [[インシデント管理]]
- Pages updated: [[Yinfang Chen]], [[Minghua Ma]], [[Tianyin Xu]], [[Microsoft]], [[AIOps]], [[根本原因分析]], [[障害緩和]]
- Key insight: GenAI クラウドサービスのインシデントは非 GenAI に比べ TTM が 1.83 倍、人手検知が 38.3%(非 GenAI 13.7%)で、症状と根本原因は多対多。エージェント評価ベンチマークが想定する「1 障害 1 根本原因」構造と本番インシデントの複雑さの乖離が初めて定量化された。
## [2026-06-03] ingest-paper | Pulse: Fine-grained and Non-intrusive LLM Training Monitoring via Microsecond-level Traffic Measurement
- Source: `.raw/papers/3779212.3790163.pdf`(Xiao+, [[Nanjing University]] State Key Lab of Novel Software Technology ほか, ASPLOS '26, DOI:10.1145/3779212.3790163, 19p, CC-BY 4.0)。ACM が Cloudflare ボットチャレンジ背後で WebFetch/curl とも 403、ユーザーがブラウザ保存したローカル PDF(`~/Downloads/3779212.3790163.pdf`)を fetch-paper-pdf.sh で `.raw/papers/` にコピー、pdftotext -layout で全 19p(本体 §1–§11 + Appendix A–E)を通読。
- Summary: [[@2026__ASPLOS__Pulse - Fine-grained and Non-intrusive LLM Training Monitoring via Microsecond-level Traffic Measurement|2026__ASPLOS__Pulse - Fine-grained and Non-intrusive LLM Training Monitoring via Microsecond-level Traffic Measurement]]
- Pages created: [[Pulse]], [[Nanjing University]], [[Chen Tian]], [[Qingkai Meng]], [[Yibo Xiao]], [[BlueField-3]], [[NCCL]], [[Aegis]], [[Holmes]], [[GreyHound]], [[LLM学習モニタリング]]
- Pages updated: [[Fault Localization]], [[GPUクラスタ運用]], [[LLM分散学習]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: 「fine-grained 監視は overhead を生むから粒度を上げられない」という [[Minder]] の制約(§6.6 で ms 監視を要請しつつ overhead で未展開)は、計測を host on-path から on-NIC off-path([[BlueField-3]] DPA、3 層計測)へ移すことで外せる——Pulse は訓練コード/CCL 無改変のまま microsecond 粒度を overhead ほぼ 0 で実現し、SOTA(OP-level)が届かない straggler を 12 中 10 で machine-level に局所化。検知機構が heartbeat→host-metric→traffic の 3 層に伸びた。並行して別セッションが ITBench を 16 ソース目として ingest したため Pulse を 17 ソース目に採番(per-file lock で torn write は回避、index カウントを 124p/17 源に reconcile)。
## [2026-06-03] ingest-paper | ITBench: Evaluating AI Agents across Diverse Real-World IT Automation Tasks
- Source: `.raw/papers/jha25a.pdf`(Jha+, [[IBM Research]]×[[University of Illinois Urbana-Champaign]], ICML 2025 / PMLR v267, pp.27134–27197, 64p。PMLR ページ + raw.githubusercontent の PDF を fetch-paper-pdf.sh で取得、pdftotext で本体 §1–§6 + Impact Statement を通読。abstract・書誌は PMLR ページを WebFetch で裏取り)
- Summary: [[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks|2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]]
- Pages created: [[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks|2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]], [[Rohan Arora]]
- Pages updated: [[ITBench]](二次情報→一次論文ベースに全面改稿), [[Saurabh Jha]], [[IBM Research]], [[University of Illinois Urbana-Champaign]], [[AIOpsLab]], [[CrewAI]], [[SRE Benchmark]], [[agentic SRE]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]]
- Key insight: これまで [[SREGym]]・[[Stratus]] の二次情報経由でしか参照できなかった [[ITBench]] を一次論文として取り込み。ベンチ設計の 2 直交軸が確定——(1) SRE 深掘り([[AIOpsLab]]/[[SREGym]])vs ペルソナ横断(SRE/CISO/FinOps の 102 シナリオ)、(2) 報告天井の桁違い([[AIOpsLab]] ~59%・[[SREGym]] ~6割・ITBench は GPT-4o の SRE 緩和 11.43%・Hard 緩和 0%)。trace ablation(診断 13.81%→9.52%・緩和 11.43%→2.86%)が telemetry 選別の重要性を制御変数化、trajectory 指標(Detoured/Covered Services)が「成功は fault propagation chain に探索集中」を可観測化。診断 oracle 進化の中段 NTAM を一次確認。ITBench と [[Stratus]] は同じ IBM チーム・同じ [[CrewAI]] 基盤という近接構図も確定。
## [2026-06-03] ingest-paper(re-ingest)| STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds
- Source: `.raw/papers/arxiv-2506.02009.pdf`(Chen+, [[University of Illinois Urbana-Champaign]]×[[IBM Research]](+[[Tsinghua University]]), NeurIPS 2025, arXiv:2506.02009v2, 48p)。fetch-paper-pdf.sh で PDF 取得、pdftotext で全文抽出して §1–§7・付録 A–E を通読。**既存エントリは poster/abstract のみ参照していたため、PDF 本文を根拠に全面改稿(re-ingest)**。
- Summary: [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds|2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]]
- Pages created: [[IBM Research]], [[CrewAI]]
- Pages updated: [[Stratus]], [[Transactional No-Regression]], [[agentic SRE]], [[障害緩和]], [[Saurabh Jha]], [[University of Illinois Urbana-Champaign]], [[Tsinghua University]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]]
- Key insight: 本文取り込みで TNR を「severity µ=w1|A|+w2|V|+w3|L| の単調非増加(µ(s)≤b)を A-Lock/Faithful Undo/Bounded Risk Window(K=20)の下で保証する Alpern–Schneider safety property(Lemma 3.1)」として確定でき、concept [[Transactional No-Regression]] の「形式的定義未確認」の問いを解消。実装は stack-based rollback の Undo Agent。評価は AIOpsLab 69.2%(9/13)・ITBench 50.0%(9/18)で 1.5X/5.4X、ablation で No retry 15.4% と TNR の undo-and-retry が緩和の鍵と裏取り。重要な留保: ITBench 18 問中 8 問は「注入 fault が pod 再起動で消える」性質を悪用した pod restart で解け undo agent 有無で成績不変——安全仕様(no-regression)と評価の誠実性(正しく直す)は直交するという横断的知見を [[Transactional No-Regression]]・[[障害緩和]] に追記。所属も本文で UIUC/IBM Research/Tsinghua と確定(旧版「所属未記載」注記を解消)。
## [2026-06-03] ingest-paper | Minder: Faulty Machine Detection for Large-scale Distributed Model Training
- Source: `.raw/papers/nsdi25-deng.pdf`(Deng+, [[ByteDance]]/[[Tsinghua University]]/Northeastern/[[Harvard University]], NSDI '25, 978-1-939133-46-5, 18p)。USENIX presentation ページが WebFetch で 403 のため curl で HTML 取得→PDF URL(usenix.org/system/files/nsdi25-deng.pdf)を抽出し fetch-paper-pdf.sh で取得、pdftotext で全文抽出して通読。
- Summary: [[@2025__NSDI__Minder - Faulty Machine Detection for Large-scale Distributed Model Training|2025__NSDI__Minder - Faulty Machine Detection for Large-scale Distributed Model Training]]
- Pages created: [[Minder]], [[Yangtao Deng]], [[Zhuo Jiang]], [[Minlan Yu]], [[Tsinghua University]], [[Harvard University]]
- Pages updated: [[ByteDance]], [[GPUクラスタ運用]], [[Fault Localization]], [[LLM分散学習]], [[変化点検知]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: ML systems クラスタ一次論文 2 例目で初の「訓練クラスタの faulty machine detection」軸。同じ ByteDance の [[MegaScale]] が heartbeat ベースで死んだノードを復旧するのに対し、Minder は停止前の異常 metric パターン(machine-level similarity + continuity + per-metric LSTM-VAE + decision tree prioritization)で slow fault まで machine-level に教師なし特定(本番 1 年超、precision 0.904・F1 0.893・3.6 秒、手動比 99% 短縮)。横断的知見: 検知機構が heartbeat 系と metric-pattern 系に分化・補完すること、訓練クラスタ診断と本番 AIOps は distributed-view で同型だが信号源が真逆(訓練=homogeneity からの逸脱 vs microservice=heterogeneity の依存伝播)で Minder が cloud 診断手法の訓練転用不能を明言すること、fault landscape の hardware dominant(55.8%/ECC 38.9%)が SAKURAONE・LLaMA3 と連続することを記録。
## [2026-06-03] ingest-paper | SAKURAONE: An Open Ethernet-Based AI HPC System and Its Observed Workload Dynamics in a Single-Tenant LLM Development Environment
- Source: `.raw/papers/arxiv-2604.13600.pdf`(Konishi+, [[SAKURA Internet]] Research Center, MLSys 2026 採録 / arXiv:2604.13600, v1 2026-04-15 / v2 2026-04-16, cs.DC/cs.NI, 15p)。fetch-paper-pdf.sh で取得(初回 429、サンドボックス無効化で再取得)、書誌は arXiv abs を WebFetch で裏取り(MLSys 2026 採録・著者 3 名 equal contribution を確認)。
- Summary: [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System|2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]
- Pages created: [[Fumikazu Konishi]], [[SAKURAONE]], [[SONiC]], [[オープンネットワーキング]], [[GPUクラスタ運用]]
- Pages updated: [[Yuuki Tsubouchi]], [[Hirofumi Tsuruta]], [[SAKURA Internet]], [[LLM分散学習]], [[並列化戦略]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: vault 所有者 [[Yuuki Tsubouchi]] の共著・本 wiki 初の HPC/open networking 一次論文。SONiC + RoCEv2 のフルオープン 800 GbE が NVIDIA Eos(InfiniBand)比 time-to-train 1.02–1.26× を達成し、mid-scale(800 GPU)単一テナント LLM 開発のワークロード動態(small-job が件数支配・large-job が GPU 時間支配、cancellation 73.5%、CPT→fine-tuning フェーズ遷移、21 fault の 42.9% が GPU 起因)を telemetry から定量化。MFU 38–41% の規模非依存性・hardware 起因 dominant の連続性を [[LLM分散学習]]/[[並列化戦略]] の hyperscale ソースと突き合わせた。
## [2026-06-03] ingest-paper | MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
- Source: `.raw/papers/nsdi24-jiang-ziheng.pdf`(Jiang+, [[ByteDance]]/[[Peking University]], NSDI '24, 2024-04-16, 16p)、スライド `.raw/papers/nsdi24-slides-jiang-ziheng.pdf`(17p)。USENIX 発表ページ(usenix.org/conference/nsdi24/presentation/jiang-ziheng)は WebFetch が 403 のため curl(User-Agent 付き)で HTML 取得 → 論文/スライド PDF の直リンクを抽出。論文 PDF は fetch-paper-pdf.sh、スライド PDF は curl で取得し pdftotext 抽出。
- Summary: [[@2024__NSDI__MegaScale - Scaling Large Language Model Training to More Than 10,000 GPUs|2024__NSDI__MegaScale - Scaling Large Language Model Training to More Than 10,000 GPUs]]
- Pages created: [[MegaScale]], [[ByteDance]], [[Megatron-LM]], [[Ziheng Jiang]], [[Xin Jin]], [[Xin Liu]]
- Pages updated: [[LLM分散学習]], [[並列化戦略]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]]
- Key insight: 直前に入れた LLM 訓練サーベイ([[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey|2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey]])の taxonomy を本番システムで裏取りする ML systems クラスタ初の一次論文。サーベイの「数万 GPU で MFU 38〜41%」に対し MegaScale は 12,288 GPU で 55.2%(Megatron-LM 比 1.34×)を実測し、Efficiency 軸は宿命でなく algorithm-system co-design 問題であることを確定。Reliability 軸は数週間本番 run で 100 回超の自動復旧という具体形を与え、§5 の straggler 診断(単一 GPU benchmark では不可視・distributed timeline trace で起因特定)が本番サービス AIOps([[Fault Localization]]/[[分散トレーシング]])と同型の distributed-view 課題であることを横断的知見化。
- Note: concept は新設せず既存 [[LLM分散学習]]/[[並列化戦略]] を seed→developing に充填(規約 §8)。[[Peking University]] は既存ページを温存し参照のみ。
## [2026-06-03] ingest-paper | Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
- Source: `.raw/papers/arxiv-2407.20018.pdf`(Duan+, arXiv:2407.20018, 2024-07-29 投稿, 42p; 正式出版は論文誌 Vicinagearth Vol.3 Issue 1 Article 38, Springer, 2026-06-01, DOI:10.1007/s44336-026-00038-z。書誌は Crossref API で確定、Springer 本体は認証リダイレクトのため未取得)
- Summary: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey|2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey]]
- Pages created: [[LLM分散学習]], [[並列化戦略]], [[Mixture-of-Experts]], [[Shanghai AI Laboratory]], [[Jiangfei Duan]], [[Peng Sun]]
- Pages updated: [[index]], [[hot]], [[concepts/_index]], [[entities/_index]], [[sources/_index]]
- Key insight: 本 wiki 初の LLM 訓練インフラ・別ドメイン。SER(Scalability/Efficiency/Reliability)の 3 軸とインフラ/並列化/最適化/fault tolerance の 4 層で AIOps/SRE/時系列とは独立した ML systems クラスタを新設。§8 fault tolerance の anomaly detection/failure analysis が運用 observability と語彙を共有する点を弱い接点として明示。
- Process note: 42p の大作のため本文(行158–2165)を 4 区間に分割し並行サブエージェントで精読・構造化してから統合。引用システムは数百あるが entity は中核(主所属・主要著者)に絞った。
## [2026-06-03] ingest-paper | Scaling Telemetry Workloads in Cloud Applications: Techniques for Instrumentation, Storage, and Mining
- Source: `.raw/papers/kyoto-djohk00908.pdf`([[Yuuki Tsubouchi]] の京都大学博士学位論文, 2025-03, 112p; 京都大学学術情報リポジトリの DSpace REST API `/server/api/core/bitstreams/<uuid>/content` から PDF を curl で取得・pdftotext で抽出。フロントエンドの `/bitstreams/<uuid>/download` は SPA shell HTML を返すため REST API content endpoint を使用)
- Summary: [[@2025__Kyoto University__Scaling Telemetry Workloads in Cloud Applications - Techniques for Instrumentation, Storage, and Mining|2025__Kyoto University__Scaling Telemetry Workloads in Cloud Applications - Techniques for Instrumentation, Storage, and Mining]]
- Pages created: [[HeteroTSDB]], [[go-conntracer-bpf]], [[Mackerel]], [[Hatena]], [[Kyoto University]], [[Ryosuke Matsumoto]], [[テレメトリ]], [[時系列データベース]], [[分散トレーシング]]
- Pages updated: [[Yuuki Tsubouchi]], [[特徴量削減]], [[Fault Localization]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: 既取り込みの [[MetricSifter]](mining 層)の足元に、本論文が instrumentation 層([[分散トレーシング]]: in-kernel flow bundling)と storage 層([[時系列データベース]]: [[HeteroTSDB]])を補い、[[テレメトリ]]を 3 層の枠組みとして wiki に確立。§6.2 の設計指針「データ削減は文脈が豊富な両端(instrumentation・mining)で、storage は context 非依存に」が、MetricSifter の [[特徴量削減]] と LLM エージェントの telemetry 過剰消費病理を貫く「情報を絞る」骨格を収集の最上流まで一般化する。future direction の LLM failure snapshot が [[Bits AI SRE]]/[[根本原因分析]] に接続。
- Note: 既存 [[Yuuki Tsubouchi]] の「2023 年博士号取得」記述と本論文表紙の「March, 2025」が食い違う。一次資料(本論文)に合わせ年を明示しない記述へ修正し、note callout で差異を明記。
## [2026-06-03] ingest-paper | MetricSifter: Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications
- Source: `.raw/papers/ieee-10462133-metricsifter.pdf`(IEEE Access vol.12, pp.37398–37417, DOI:10.1109/ACCESS.2024.3374334; 著者 [[Yuuki Tsubouchi]]・[[Hirofumi Tsuruta]]([[SAKURA Internet]] Research Center); IEEE stamp PDF を curl で取得・pdftotext で 20p 抽出、書誌/abstract は IEEE メタデータ JSON で裏取り)
- Summary: [[@2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications|2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications]]
- Pages created: [[Yuuki Tsubouchi]], [[Hirofumi Tsuruta]], [[SAKURA Internet]], [[MetricSifter]], [[Meltria]], [[Sock Shop]], [[PyRCA]], [[Fault Localization]], [[特徴量削減]], [[変化点検知]]
- Pages updated: [[根本原因分析]], [[AIOps]], [[Train-Ticket]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: MetricSifter(pre-LLM, 2024)が示す「無関係メトリクス $M_C$ がノイズとして localization を阻害する」課題は、後年 LLM エージェント([[Bits AI SRE]]/[[AIOpsLab]] §3.6)が観測した「telemetry 過剰消費で性能が落ちる」病理と同型。情報を絞ってから診断する骨格が手法世代を超えて連続する。本 wiki 初の vault 所有者自身の論文。
## [2026-06-03] ingest-paper | Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling
- Source: `.raw/papers/arxiv-2605.27286.pdf`(arXiv:2605.27286v1 [cs.LG], 投稿 2026-05-26; 著者 Yiding Liu ほか計8名, [[Ant International]](連絡先 @ant-intl.com、正式所属表記なし); PDF 31p を fetch-paper-pdf.sh で取得、abstract/書誌は arXiv abs で裏取り)
- Summary: [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling|2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]]
- Pages created: [[Falcon-X]], [[Ant International]], [[Chronos-2]], [[GIFT-Eval]], [[fev-bench]], [[多変量時系列予測]]
- Pages updated: [[時系列基盤モデル]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: TSFM 2 ソース目。Toto の「観測データ特化」に対し Falcon-X は「異種多変量の cross-variate モデリング」を主眼に、変量を latent prototype 空間へ decouple し differential attention で正負の依存を表現。raw-space group attention([[Chronos-2]])の semantic collapse を批判。GIFT-Eval で全体最高だが SRE 下流タスクは未評価。
## [2026-06-03] ingest-paper | This Time is Different: An Observability Perspective on Time Series Foundation Models
- Source: `.raw/papers/arxiv-2505.14766.pdf`(arXiv:2505.14766 v2, NeurIPS 2025 poster; 著者 Ben Cohen, Emaad Khwaja ほか計19名, Datadog AI Research / Carnegie Mellon University; PDF 38p を fetch-paper-pdf.sh で取得、abstract/書誌は arXiv abs + NeurIPS poster page で裏取り)
- Summary: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models|2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]]
- Pages created: [[Toto]], [[BOOM]], [[Ameet Talwalkar]], [[Carnegie Mellon University]], [[時系列基盤モデル]]
- Pages updated: [[Datadog]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: wiki 初の純 ML(時系列予測)ソースで、これまでの AIOps/SRE エージェント系列とは別軸。ただし出所は [[Datadog]] で 3 例目——SRE エージェント([[Bits AI SRE]])の足元にある**観測 telemetry の予測モデル層**として接続する。観測データ(observability metrics)が一般時系列と統計的に異なる(KPSS・skew・spectral entropy・flat spots 等が極端、§4.3)ことを定量化し、専用 decoder-only アーキテクチャ(patch-based causal scaling・proportional factorized attention 11:1・Student-T mixture head・composite robust loss)で zero-shot SOTA を達成。事前学習 2.36 兆点(43% が Datadog 匿名観測メトリクス)。[[BOOM]] で CRPS 次点比12.4%・MASE 13.1% 改善、GIFT-Eval(Rank 5.495)・LSF でも SOTA。重み/コード/データを Apache 2.0 公開。
- 判断: 著者19名中 entity 化は senior author の [[Ameet Talwalkar]](CMU、被参照価値高)と所属 [[Carnegie Mellon University]] のみに絞り、残る著者は source に記録(取捨選択は機能)。concept は精度の合う [[時系列基盤モデル]] 1 件を新設し `structures/時系列基盤モデル - MOC` に一方向リンク。1 ソース目のため横断的知見は薄く、未解決の問い(汎用 TSFM が観測データで苦戦する原因の切り分け等)を充実させた。
## [2026-06-03] ingest | Building Bits AI SRE: Autonomous Incident Investigation Agent
- Source: `.raw/articles/building-bits-ai-sre-2026-06-03.md`(datadoghq.com/blog/building-bits-ai-sre, fetched 2026-06-03; 著者 Daniel Shan, Tristan Ratchford; WebFetch で取得、defuddle はサンドボックス網制限で不可)
- Summary: [[@2026__Datadog__Building Bits AI SRE - Autonomous Incident Investigation Agent|2026__Datadog__Building Bits AI SRE - Autonomous Incident Investigation Agent]]
- Pages created: [[Datadog]], [[Bits AI SRE]], [[根本原因分析]]
- Pages updated: [[agentic SRE]], [[SRE Benchmark]], [[AIOps]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: 産業界 2 例目の一次情報。[[Google]] が全 SRE ライフサイクル+自律緩和(L2/L3)を語るのに対し、[[Bits AI SRE]] は**調査・RCA 段に特化**(緩和は将来の specialist agent 統合に委ねる)。AIOps 4-level taxonomy で唯一 concept 未作成だった **RCA(第 3 段)** を [[根本原因分析]] として新設。骨格は hypothesis-driven investigation(全 telemetry 一括要約でなく仮説検証の反復)・causal relationship focus(初期版の 12+ tool call による context overload を回避)・recursive depth(sub-hypothesis 分解で深掘り)。これは学術ベンチが観測した「情報を取りすぎる病理」([[AIOpsLab]] §3.6・[[SREGym]] greedy・[[MicroRemed]] 過剰 probing)を産業実装が製品設計の出発点として明示回避したもの。評価は実インシデント再生+LLM judge で [[Google]] の continuous eval と同骨格、TTR 最大 95% 減を主張。
- 判断: 著者 2 名(Daniel Shan・Tristan Ratchford)はブログ著者で他ソースと交差せず被参照価値が低いため person entity を作らず source に記録。entity は組織 [[Datadog]] と製品 [[Bits AI SRE]] のみ。RCA は taxonomy のギャップを埋める cross-cutting concept として新設(既存 [[障害緩和]]/[[障害予測]] と並ぶ)。
## [2026-06-03] ingest | AI in SRE: How Google is Engineering the Future of Reliable Operations
- Source: `.raw/articles/ai-engineering-reliable-operations-2026-06-03.md`(sre.google, fetched 2026-06-03; 著者 Ioannis Papapanagiotou, Stevan Malesevic, Chris Heiser, Ruslan Meshenberg; defuddle はサンドボックス網制限で不可、WebFetch で取得)
- Summary: [[@2026__GoogleSRE__AI in SRE - Engineering the Future of Reliable Operations|2026__GoogleSRE__AI in SRE - Engineering the Future of Reliable Operations]]
- Pages created: [[SRE AI Autonomy Levels]], [[Google]], [[AI Operator]], [[Actus]], [[Detectr]], [[Model Context Protocol]]
- Pages updated: [[agentic SRE]], [[Transactional No-Regression]], [[SRE Benchmark]], [[AIOps]], [[障害予測]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: 本 wiki 初の産業界・本番運用一次情報。学術ベンチがエージェントの**タスク成功率**で測るのに対し、Google は **SRE AI Autonomy Levels(L0–L4)** という権限委譲の段階で AI-Ops を統治する(直交軸)。推論([[AI Operator]])と actuation([[Actus]]: dry-run・Red Button)の分離は [[Transactional No-Regression]] の産業実装に相当。LLM-as-a-Judge と Bronze/Silver/Gold 評価が産業の continuous eval として登場。「L2/L3 自律緩和を本番稼働」の主張は学術ベンチの能力天井(6 割前後・5〜20 step saturate)とテンションがあり [[agentic SRE]] に contradiction callout を設置。
- 判断: 著者 4 名は一次情報での被参照価値が低い(他ソースと交差しない産業著者)ため person entity を作らず source に記録。Google 社内システムは architecturally 重要な [[AI Operator]] / [[Actus]] / [[Detectr]] と標準 [[Model Context Protocol]] のみ entity 化し、AI Alert/InvD/IRMA/Antigravity CLI/Production Agent は source 本文に記述。
## [2026-06-03] ingest-paper | MicroRemed: Benchmarking LLMs in Microservices Remediation
- Source: `.raw/papers/arxiv-2511.01166.pdf`(arXiv:2511.01166v1 [cs.CL], 2025-11-03; PKU/Alibaba/Tsinghua; code: github.com/LLM4AIOps/MicroRemed)
- Summary: [[@2025__arXiv__MicroRemed - Benchmarking LLMs in Microservices Remediation|2025__arXiv__MicroRemed - Benchmarking LLMs in Microservices Remediation]]
- Pages created: [[MicroRemed]], [[ThinkRemed]], [[Ansible]], [[Train-Ticket]], [[Online-Boutique]], [[Lingzhe Zhang]], [[Tong Jia]], [[Peking University]], [[Alibaba Group]], [[障害緩和]]
- Pages updated: [[AIOps]], [[agentic SRE]], [[SRE Benchmark]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: AIOps 4-level taxonomy の最上位 Mitigation を「診断レポート→実行可能 Ansible playbook の生成(E2E-MR)」として切り出した初の専門ベンチ。ThinkRemed の ablation が reflection > probe・過剰 probing の害を示し、[[Stratus]]・[[SREGym]] の「反復と反省が緩和の鍵」と独立に一致。chaos injection を緩和評価に積極採用する点で SREGym と立場が分岐。
## [2026-06-03] ingest-paper | PAGER: Proactive Monitoring Agent for Enterprise AI Assistant
- Source: `.raw/papers/aaai2026-pager.pdf`(AAAI-26 デモ, pp. 41574–41576; CAIS 2026 デモ; DOI:10.1609/aaai.v40i48.42344; OJS galley 46305)
- Summary: [[@2026__AAAI__PAGER - Proactive Monitoring Agent for Enterprise AI Assistant]]
- Pages created: [[PAGER]], [[Adobe Experience Platform]], [[Adobe]], [[Yunyao Li]], [[障害予測]]
- Pages updated: [[AIOps]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: reactive 一色だった wiki に proactive な[[障害予測]]の軸を追加。PAGER は予測を古典 random forest、LLM を説明・対話インターフェース層に限定するハイブリッド構成。
## [2026-06-03] ingest | STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds
- Source: `.raw/articles/stratus-neurips2025-poster-116834-2026-06-03.md`(NeurIPS 2025 poster; arXiv:2506.02009、OpenReview fYW1PKawwJ)
- Summary: [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds|2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]]
- Pages created: [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds|2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]], [[Transactional No-Regression]], [[Saurabh Jha]]
- Pages updated: [[Stratus]], [[agentic SRE]], [[SRE Benchmark]], [[AIOpsLab]], [[ITBench]], [[Yinfang Chen]], [[Tianyin Xu]], [[index]], [[hot]]
- Key insight: これまで [[SREGym]] 経由の二次情報([[Stratus]] entity)でしか持っていなかった STRATUS を一次論文に格上げ。SREGym が観測した「undo-and-retry が最強の緩和を生む」は、一次論文が安全仕様 [[Transactional No-Regression]] (TNR) として形式化したものと符合。AIOpsLab・ITBench 両ベンチで SOTA を 1.5 倍上回ると主張し、複数ベンチ横断評価が標準化しつつある(ベンチ作者 [[Saurabh Jha]] がエージェント共著者でもある)。
## [2026-06-03] ingest-paper | AIOpsLab: A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds
- Source: `.raw/papers/arxiv-2501.06706.pdf`(MLSys 2025; arXiv:2501.06706v1, 2025-01-12)
- Summary: [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds|2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]]
- Pages created: [[Yinfang Chen]], [[Minghua Ma]], [[Microsoft]], [[DeathStarBench]], [[ChaosMesh]], [[AIOps]]
- Pages updated: [[AIOpsLab]], [[University of Illinois Urbana-Champaign]], [[SRE Benchmark]], [[agentic SRE]], [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: AIOpsLab(2025)は障害を detection/localization/RCA/mitigation の 4 サブ問題に分解して個別採点し、application/virtualization 層中心。後続 SREGym(2026)はこれを end-to-end 評価+層横断 fault+noise で乗り越える。両者は AgentOps/agentic SRE と別名で同じ営みを指し、独立に「エージェントが最初の仮説に固執し telemetry を取りすぎる」失敗を観測。
- Contradiction: SREGym 由来の「AIOpsLab は ReAct ループを要求/非 ReAct は移植必要」は一次論文(get_action のみ要求、任意 framework 可)と食い違い。[[AIOpsLab]] に callout 設置。
## [2026-06-03] ingest-paper | SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios
- Source: `.raw/papers/arxiv-2605.07161.pdf`(arXiv:2605.07161v2, 2026-05-13)
- Summary: [[@2026__arXiv__SREGym - A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios|2026__arXiv__SREGym - A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios]]
- Pages created: [[SREGym]], [[Stratus]], [[AIOpsLab]], [[ITBench]], [[Tianyin Xu]], [[University of Illinois Urbana-Champaign]], [[agentic SRE]], [[SRE Benchmark]], [[Metastable Failure]]
- Pages updated: [[index]], [[hot]], [[sources/_index]], [[entities/_index]], [[concepts/_index]]
- Key insight: 高忠実度の SRE ベンチは noise・低位層(OS/hardware)fault・metastable/concurrent/correlated の障害モードを区別軸に置く。フロンティアエージェントはアプリ層には強いが、これら新障害で E2E が 60%→18–28% に崩れ、greedy approach で最初の異常に固着する。
## [2026-06-02] init | LLM wiki レイヤー初期化
- Type: setup
- mode=generic、transport=filesystem(GUI バイナリ誤検出回避のため manual_override で固定)
- 作成: `.raw/`、`wiki/{sources,entities,concepts,questions,meta}/`、`.vault-meta/{mode,transport}.json`
- helper コピー: `scripts/{wiki-mode.py,wiki-lock.sh,detect-transport.sh}`
- スコープ: 新規ソースのみ。既存 papers/・research/・structures/ は ingest しない。
## [2026-06-26] ingest-paper | データセンター信頼性・クラウド障害論文 9 本
- Source: `.raw/papers/{dsn2017-datacenter-hardware-failures,socc2016-cos,imc2018-facebook-network-errors,hotos2019-azure-software-failures,sosp2011-hardware-errors,nsdi2020-omegagen,datacenter-scale-temperature-impact,empirical-kubernetes-operator-bugs,taxdc}.pdf`
- Summary: [[データセンター信頼性]], [[クラウドインシデント]], [[データセンターネットワーク信頼性]], [[分散システム障害]], [[Kubernetesオペレータ]]
- Pages created: 9 source pages、5 concept pages。
- Key insight: 障害を独立した部品故障として扱うだけでは不十分であり、相関、復旧連鎖、部分障害、設定・順序依存をサービス影響に接続して扱う必要がある。
## 2026-07-28 | ingest | 30papers 読書リスト(27件)
- Source: `.raw/articles/30papers-*-2026-07-28.md`
- Summary: 27件の `[[@2026__30papers__...]]` source(Machine Super Intelligenceのみ `[[@2008__30papers__Machine Super Intelligence]]`)
- Pages created: 27 sourceと関連entity/concept
- Pages updated: Transformer、注意機構、スケーリング則、最小記述長原理、コルモゴロフ複雑性、残差学習、RNNほか
- Key insight: 30papers の現在の公開リストは27件であり、各原典を確認して教育的要約と原典の差異・数値不整合を明示的に保存した。
## [2026-07-29] wiki/concepts リファクタリング
- 統合: `Metastable Failure` を [[メタ安定障害]] に、`パイプライン並列` を [[パイプライン並列化]] に統合。
- 補完: 正規ページへ旧名の別名を追加し、メタ安定障害の出典を SREGym・Cook を含めて同期。パイプライン並列化へ DynaPipe の推論時動的層再配分と非同期 KV キャッシュ移行を統合。
- 索引: [[concepts/_index]] と [[index]] の旧リンクを正規名へ更新。
- 検証: 統合対象の旧ページへの concept/index 内リンク 0 件、正規ページの必須見出し欠落 0 件。
## [2026-07-29] wiki/concepts 索引同期
- [[concepts/_index]] に現行736件のコンセプトカタログを追加し、履歴型の取り込み記録とは独立に実体集合を追跡可能にした。
- 検証: concept実体736件、カタログ736件、差分0件。
## [2026-07-31] ingest-paper | UCX: An Open Source Framework for HPC Network APIs and Beyond
- Source: `.raw/papers/1265689.pdf`
- Summary: [[@2015__HOTI__UCX - An Open Source Framework for HPC Network APIs and Beyond]]
- Pages created: [[@2015__HOTI__UCX - An Open Source Framework for HPC Network APIs and Beyond]]
- Pages updated: [[UCX]], [[HPCインターコネクトベンチマーク]], [[index]], [[hot]]
- Key insight: UCXの初期設計は、UCS/UCT/UCPの3層で通信API・プロトコル・実装を統合し、異種HPCハードウェア上で可搬性とドライバ近傍性能を両立させるものだった。評価層がUCTプリミティブであることを明示し、後年のGPU・集合通信ベンチマークと区別して概念ページへ統合した。
## [2026-08-16] ingest-paper | Machine Learning Applications for Data Center Optimization
- Source: `.raw/papers/42542.pdf`
- Summary: [[@2014__Google__Machine Learning Applications for Data Center Optimization]]
- Pages created: source 1件、entity 5件、concept 1件([[PUE]])
- Pages updated: entity 2件([[Google]], [[Google Research]])、concept 3件([[教師あり学習]], [[統計的機械学習]], [[データセンター信頼性]])、共有索引・hot・log・manifest
- Attachments: `wiki/sources/_attachments/42542/`(7点)。本文参照図表Figure 1〜7(複合図4a–d、5a–dを含む)を全件埋め込み、除外図表なし。
- Key insight: 監視のために蓄積されたデータセンターセンサーをPUE予測器へ変換し、予測・感度分析・設備構成シミュレーションを一つのモデルでつないだ。