# Concepts Index ### 2026-09-13 ingest | We Must Pace the Frontier\n- 更新 concept: [[Recursive Self-Improvement]], [[アラインメント監査]], [[エージェント運用安全性]], [[機構的解釈性]], [[LLM評価]]\n ### 2026-09-12 ingest-paper | Fast unfolding of communities in large networks\n- 新規 concept: [[コミュニティ検出]], [[モジュラリティ]], [[Louvain法]]\n ### 2026-09-12 ingest-book | Networks, Crowds, and Markets - 新規 concept: [[弱い紐帯の強さ]] [[ホモフィリー]] [[情報カスケード]] - 更新 concept: [[PageRank]] [[優先的選択]] [[スモールワールドモデル]] ### 2026-09-11 ingest-paper | データ制約スケーリング・合成データ 論文6本バッチ - 新規concept: [[データキュレーション]], [[データ制約下でのスケーリング]], [[事前学習データ選択]] - 更新concept: [[スケーリング則]], [[合成データ]], [[データ枯渇]], [[モデル崩壊]] - Note: [[データキュレーション]]と[[事前学習データ選択]]はスコープが重複。統合要否は要検討。 ### 2026-09-11 ingest-paper | Scaling Inference Prefill with High-Radix Photonic Interconnects\n- 新規 concept: [[フォトニックインターコネクト]]\n- 更新: [[AIデータセンタートポロジ]], [[Prefill-Decode分離]], [[Mixture-of-Experts]]\n ### 2026-09-10 ingest-paper | Will we run out of data? - 新規 concept: [[データ枯渇]], [[合成データ]] - 更新 concept: [[スケーリング則]] ### 2026-09-08 ingest-paper | Networked Agent Memory and Causality Representation - 新規 concept: [[Networked Agent Memory]], [[Networked Causality Representation]] ### 2026-09-07 ingest-paper | Using expect to Automate System Administration Tasks - 新規 concept: [[Expect]] ### 2026-09-07 ingest-paper | The Log-Structured Merge-Tree (LSM-Tree) - 新規 concept: [[Five Minute Rule]] ### 2026-09-07 ingest-paper | μSlope: High Compression and Fast Search on Semi-Structured Logs - 新規 concept: [[半構造化データ管理]], [[ログ圧縮と検索]] ### 2026-09-07 ingest-paper | Splitwise: Efficient Generative LLM Inference Using Phase Splitting\n- 更新: [[Prefill-Decode分離]]\n ### 2026-09-07 ingest-paper | State of AI: An Empirical 100 Trillion Token Study with OpenRouter - 新規 concept: [[LLM利用実態分析]], [[エージェント型推論]], [[Cinderella Glass Slipper効果]] ### 2026-09-07 ingest-paper | Fighting the Fog of War (Warden)\n- 新規 concept: [[インシデント検知]]\n- 更新: [[アラート相関]]\n ### 2026-09-07 ingest-paper | 障害管理・アラーム相関の歴史的論文8件(1995-2014) - 新規concept: [[コードブックによるイベント相関]], [[アラーム相関]], [[頻出エピソードマイニング]], [[重要アラートマイニング]] - 更新concept: [[異常検知]], [[変化点検知]], [[プロアクティブ障害管理]], [[根本原因分析]], [[アラート相関]], [[アラート抑制]], [[ログベースイベント相関]] ### 2026-09-07 ingest | TimesFM-3: A zero-shot foundation model for multivariate forecasting - New concept: [[時間-変量交互アテンション]] - Updated concept: [[多変量時系列予測]], [[時系列基盤モデル]], [[Contiguous Patch Masking]] ### 2026-09-07 ingest-paper | LISA歴史論文バッチ11件 - 新規concept: [[二人制御]], [[永続状態相互作用監査]], [[Deep Packet Inspection]] - 更新: [[収束型システム管理]] [[べき等性]] [[プル型構成配布]] [[宣言的設定管理]] [[待ち行列理論]] [[内部者リスク]] [[異常検知]] [[ネットワーク監視]] [[ネットワーク依存性発見]] ### 2026-09-07 ingest-paper | LiveOps: Systems Management as a Service (LISA'06)\n- 新規 concept: [[永続状態相互作用監査]]\n- 更新 concept: [[異常検知]](非参加型PS監査の系譜として観察追加)\n ### 2026-09-06 ingest-paper | LISA歴史論文バッチ10件(4 new) - 新規 concept: [[プル型構成配布]] / [[コンテンツアドレス指定ストレージ]] / [[信頼性を持つ大規模ログ収集アーキテクチャ]] / [[ログベースイベント相関]] - 更新: [[異常検知]] / [[収束型システム管理]] / [[時系列データベース]] / [[イミュータブルインフラストラクチャ]] / [[べき等性]] / [[宣言的設定管理]] / [[システム管理者からSREへの視点転換]] / [[階層型メトリック収集アーキテクチャ]] ### RDMA基盤論文8件ingest(2026-09-06 ingest-paper) - 新規concept: [[RDMAネットワークロードバランシング]](ConWeave由来) - 更新: [[RDMA]], [[分散共有メモリ]], [[分散トランザクション]], [[カーネルバイパスネットワーキング]], [[ゼロコピーネットワーキング]], [[ホスト内ネットワークボトルネック]], [[トランスポートプロトコル設計]], [[マルチテナントRDMA性能分離]], [[データセンター輻輳制御]], [[スマートNICオフロード]], [[GPUDirect RDMA]], [[ハードウェア仮想化]] ### 2026-09-05 ingest-slides | Orchestrate Next-Generation AI Workloads With Open-Source Slurm - 更新 concept: [[トポロジ考慮型スケジューリング]], [[Dynamic Resource Allocation (DRA)]], [[GPUクラスタスケジューリング]] ### 2026-09-05 ingest-paper | 7 HPC Papers\n- 7件の新規コンセプト(パイロットジョブ、シーケンスマイニング、電力スパイク、周波数キャッピング、GPUワークロード分類、ビジュアルアナリティクス、連合学習)を追加\n ### 2026-09-05 ingest-paper | CubeTrace: Microscopic Network Tracing for Heterogeneous Cloud Gateways - 新規 concept: [[ネットワークトレーシング]], [[クラウドゲートウェイ]], [[プログラマブルスイッチ]] ### 2026-09-05 ingest-paper | CoLMAD\n- 更新 concept: [[異常検知]](常時稼働の検知とLLMコストの緊張・LLMの検知器/メタ層役割分岐に観察追加)\n ### 2026-09-05 ingest-paper | Beyond Fault Localization\n- 新規 concept: [[エージェント軌跡評価]]\n ### 2026-09-05 ingest-paper | Making Core Memory - 新規 concept: [[見えない労働とジェンダー化された技術労働]]・[[フェミニスト・デザインリサーチ手法]] ### 2026-09-05 ingest-paper | Benchmarking Change Detection Exactness and Overhead of Instrumentation and Sampling - 新規 concept: [[性能変化検知の正確性]] - 更新: [[トレーシングオーバーヘッド]], [[オブザーバビリティ]] ### 2026-09-05 ingest-paper | HPCクラスタ監視系7本 - 新規concept: [[HPCジョブモニタリング]](PIKA・ClusterCockpit・Jobstats・TACC Statsを横断するハブ) / [[HPCジョブ会計とリソース利用可視化]] / [[アプリケーションカーネルによるHPC QoS監視]] / [[階層型メトリック収集アーキテクチャ]] - 更新: [[HPCジョブスケジューリング]] / [[GPU観測性]] / [[GPU占有率(Occupancy)]] / [[GPU性能変動]] / [[GPUエネルギー効率]] / [[GPUクラスタ運用]] / [[データウェアハウス]] / [[時系列データベース]] / [[分散モニタリング]] / [[HPCワークロード特性化]] - 注記: 並行ingestにより一時的に重複新設された HPCジョブレベルリソース監視・HPCジョブ単位性能監視 の2conceptは、オーケストレータが [[HPCジョブモニタリング]] へ統合し削除した。 ### 2026-09-05 ingest-paper | The DMA Streaming Framework - 更新: [[Prefill-Decode分離]], [[NUMAメモリ配置]] ### 2026-09-05 ingest | GPUDirect RDMA (NVIDIA CUDA Docs) - New concept: [[nvidia-peermem]] - Updated: [[GPUDirect RDMA]] ### 2026-09-05 ingest-paper | GPU-Aware MPI on RDMA-Enabled Clusters\n- 新規 concept: [[GPU-Aware MPI]]\n ### 2026-09-04 ingest-paper | Efficient Inter-node MPI Communication using GPUDirect RDMA - 新規 concept: [[GPUDirect RDMA]] ### 2026-09-04 ingest-paper | BridgedRing: A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers - 新規 concept: [[Ring AllReduce]] - 更新 concept: [[非対称NUMAインターコネクト]], [[NVLink]] ### 2026-09-04 ingest-paper | SRNIC: A Scalable Architecture for RDMA NICs - 更新: [[RDMA]], [[RoCE設計課題]] ### 2026-09-04 ingest-paper | The Multipath Reliable Connection (MRC) Transport - 更新: [[RoCE設計課題]](MRC の位置づけを追記) ### 2026-09-04 ingest-paper | Scaling up Test-Time Compute with Latent Reasoning - 新規 concept: [[再帰深度アーキテクチャ]] - 更新 concept: [[潜在推論]](既存, 他ingestと競合したため観察のみ追記)、[[テスト時計算スケーリング]]、[[KVキャッシュ管理]]、[[Speculative Decoding]]、[[Chain-of-Thought Prompting]] ### 2026-09-03 ingest-paper | ML systems 11本 - 新規 concept: [[Parameter Server]], [[メッシュ並列]], [[自動並列化]], [[非同期分散データフロー]] - 更新: [[AIアクセラレータ]], [[ドメイン固有アーキテクチャ]], [[テンソル並列]], [[パイプライン並列化]], [[LLM分散学習]], [[チェックポイント]], [[集合通信]], [[光回線交換]], [[ソフトウェア定義ネットワーク]], [[データセンターネットワークトポロジ]], [[AIデータセンタートポロジ]] ### 2026-09-04 ingest-paper | Training Large Language Models to Reason in a Continuous Latent Space - 新規 concept: [[潜在推論]] - 更新 concept: [[Chain-of-Thought Prompting]] ### 2026-09-03 ingest-book | アルゴリズムイントロダクション 第3版 総合版\n- 新規 concept 3 件: [[アルゴリズム設計技法]] / [[計算複雑性]] / [[グラフアルゴリズム]] — いずれも本書の複数章の突き合わせから主題節を立てて新設\n- 更新 concept: [[B-Tree]] — 第 18 章の 1 パス方式と DBMS 実装の事後分割の対比を追記\n ### 2026-09-03 ingest-paper | 性能測定 - 更新: [[性能測定]] ### 2026-09-03 ingest-paper | GPU最適化 - 更新: [[GPU最適化]] ### 2026-09-03 ingest-paper | PCIe性能 - 更新: [[PCIe性能]] ### 2026-09-03 ingest-paper | 統合グラフィックス - 新規 concept: [[統合グラフィックス]] ### 2026-09-03 ingest-paper | 熱管理 - 新規 concept: [[熱管理]] ### 2026-09-03 ingest-paper | 電力管理 - 新規 concept: [[電力管理]] ### 2026-09-03 ingest-paper | Jobstats - 更新 concept: [[GPUクラスタ運用]], [[Prometheusシリーズチャーン]] ### 2026-09-03 ingest-book | ソフトウェアアーキテクチャの基礎 - 新規 concept: [[アーキテクチャ特性]], [[アーキテクチャスタイル]], [[モジュール性]] - 更新 concept: [[マイクロサービスアーキテクチャ]], [[疎結合のアーキテクチャ]], [[トレードオフ意思決定]] ### 2026-09-03 ingest-paper | Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows\n- 更新 concept: [[分散ストレージ]], [[チェックポイント]]\n ### 2026-09-03 ingest-paper | PRISM: Evaluating POSIX Storage Systems for AI Research Workflows\n- 更新 concept: [[並列ファイルシステム]], [[GPUクラスタ運用]], [[チェックポイント]]\n ### 2026-09-03 ingest-paper | A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System\n- 新規 concept: [[ストレージQoS]]\n- 更新 concept: [[並列ファイルシステム]]\n ### 2026-09-03 ingest-book | Lustre Operations Manual - 新規 concept 3 件: [[ストレージフェイルオーバ]]、[[ファイルレイアウトとストライピング]]、[[ストレージクォータ管理]] - 既存 concept 5 件を更新: [[並列ファイルシステム]]、[[ローカルファイルシステム実装比較]]、[[アーカイバルストレージ]]、[[永続クライアントキャッシュ]]、[[クラッシュリカバリ]] ### 2026-09-02 ingest-paper | Characterizing Output Bottlenecks of a Production Supercomputer - 更新 concept: [[並列ファイルシステム]]、[[ファイルレイアウトとストライピング]]、[[分散ロック管理]]、[[ストラグラー]] ### 2026-09-02 ingest-book | Understanding Lustre Internals\n- 新規 concept: [[obd デバイスモデル]], [[File Identifier (FID)]]\n- 更新: [[並列ファイルシステム]], [[オブジェクトベースストレージ]]\n ### 2026-09-02 ingest-thesis | Lustre Unveiled\n- 新規 concept: [[メタデータスケーリング]]\n- 更新: [[並列ファイルシステム]](高水準比較と実測の非対称性、メタデータ手法の分離)\n ### 2026-09-02 ingest-slides | Lustre: building a cluster file system for 1,000 node clusters - 新規 concept: [[分散ロック管理]] / [[意図ロック]] / [[オブジェクトベースストレージ]] - 更新: [[並列ファイルシステム]] ### 2026-09-01 ingest correction | Running a Software Factory Efficiently at Uber Scale - [[コンテキストエンジニアリング]] は既存 concept の更新。新規 concept は [[ソフトウェアファクトリー]] のみ。 ### 2026-09-01 ingest | Running a Software Factory Efficiently at Uber Scale - New concepts: [[ソフトウェアファクトリー]], [[コンテキストエンジニアリング]] - Updated concepts: [[agentic SRE]], [[開発者生産性]], [[エージェントシステム運用]] ### 2026-09-01 ingest-paper | Post-Training in Time Series Foundation Models: A Unifying Framework - 新規 concept: [[時系列予測の不確実性制御]] ### 2026-09-01 ingest-paper | Post-Training in Time Series Foundation Models: A Unifying Framework - 新規 concept: [[時系列基盤モデルの文脈拡張]] ### 2026-09-01 ingest-paper | Post-Training in Time Series Foundation Models: A Unifying Framework - 新規 concept: [[時系列基盤モデルの後学習]] ### 2026-08-31 ingest-paper | APEX\n- 更新: [[時系列基盤モデル]] / [[多変量時系列予測]] / [[異常検知]]\n ### 2026-08-31 ingest-paper | Large Pretrained Foundation Model for KPI Multivariate Time Series Anomaly Detection - 新規 concept: [[KPI異常検知]] - 更新 concept: [[Vision Transformer]](異常検知への更新は他セッションのlock中のためDeferred) ### 2026-08-31 ingest-paper | Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain\n- 新規 concept: [[CloudOps時系列予測データセット]]\n- 更新: [[時系列基盤モデル]], [[位置埋め込み]]\n ### 2026-08-31 ingest-paper | Performance of Zero-Shot Time Series Foundation Models on Cloud Data - 新規 concept: [[時系列基盤モデルのバイアスと失敗モード]] ### 2026-08-31 ingest-paper | Centile: A Telemetry Foundation Model Evaluated by the Decisions It Drives - 新規 concept: [[HPCジョブスケジューリング]], [[決定志向予測評価]] - 更新: [[時系列基盤モデル]] ### 2026-08-31 ingest-paper | AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data - 新規 concept: [[AutoMixer]], [[TSMixer]] - 更新 concept: [[多変量時系列予測]], [[障害予測]] ### 2026-08-31 ingest-paper | Causal Analysis for Time Series Foundation Models - 新規 concept: [[時系列基盤モデルのバイアスと失敗モード]] ### 2026-08-31 ingest-video | 2017/03/17 平木敬教授 最終講義「計算機を創る」 - 更新 concept 3 件: [[並列化戦略]]・[[GPUクラスタ運用]]・[[HPCインターコネクトベンチマーク]]。専用計算機の設計、計算と通信の重なり、遠距離TCP性能を既存の並列計算・クラスタ運用・通信評価の知見へ接続した。 ### 2026-08-30 ingest-paper | Getting the Most Out of Your GPUs\n- 新規 concept: [[自動ジョブキャンセル]]\n- 更新: [[GPU多重化(MPS・MIG)]], [[GPUクラスタ運用]]\n ### 2026-08-30 token-discipline | ハブ concept の子概念セクション - 50KB 超または 250 行超のハブへ `## 子概念` を `related` の既存 concept リンクから機械追記。本文の知見は移していない。 ### 2026-08-30 ingest | eBPFを用いてPod ごとのインターネットトラフィック量を計測するツールの開発 - 新規 concept: [[Pod単位ネットワークトラフィック計測]]。Pod・Service・クラスタ外の3分類とIngress/Egressの方向別に、TC/eBPF MapでPodの帯域利用量を集計する設計を整理。 - 更新 concept 5件: [[eBPF]]・[[eBPFマップ]]・[[Container Network Interface (CNI)]]・[[ネットワーク監視]]・[[XDP]]。Podインターフェイスを計測点にする理由、CNIライフサイクル、per-CPU配列、TCとXDPの役割分担を追記。 ### 2026-08-30 ingest-slides | AI/ML基盤の400G DCネットワークを構築した話 - 更新 concept 6 件: [[RDMA]]・[[RoCE設計課題]]・[[データセンター輻輳制御]]・[[Rail-Optimizedトポロジ]]・[[マイクロバースト]]・[[Dragonflyトポロジ]]。400GbE Lossless RoCEv2 の用途別ネットワーク分離、PFC/ECN/CNP/ETS、Rail Optimized、Adaptive Routing、物理部材検証、Dragonfly の将来課題を接続。 - 既存の JANOG56 800GbE 事例と突き合わせ、2023年の400GbE構築が2025年の800GbE導入の前史にあたることを記録。 ### 2026-08-30 ingest | eBPF Tutorial by Example: Monitoring GPU Driver Activity with Kernel Tracepoints - 新規 concept: [[GPUドライバトレーシング]]。DRM スケジューラの共通トレースポイントと Intel i915/AMDGPU の固有イベント、NVIDIA proprietary driver の kprobe/Xid を整理し、CUDA API 層・GPU ドライバ層・GPU 内部層の相関を未解決の問いとして記録。 - 更新 concept: [[eBPF]]・[[GPU観測性]]。eBPF の共通フックとドライバ ABI の可搬性を分離し、GPU ドライバ層を API 層と GPU 内部層の中間観測面として追加。 ### 2026-08-30 ingest-paper | Using Control Theory to Achieve Service Level Objectives In Performance Management - 更新 concept 5 件: [[計算機システムのフィードバック制御]]・[[サービスレベル目標]]・[[フィードバックループ]]・[[制御ループの安定性とタイムラグ補償]]・[[システム同定]]。SLOを閉ループの目標値として扱う設計、ARMAによるブラックボックス同定、ゲイン・センサ遅延・振動の関係を、既存の制御理論・SRE・タイムラグ事例へ接続。 ### 2026-08-30 ingest-slides | AI/ML基盤におけるGPU間ネットワークの負荷と性能影響を探る - 更新 concept 5 件: [[RDMA]]・[[RDMAネットワーク監視]]・[[RoCE設計課題]]・[[LLM分散学習]]・[[集合通信]]。計算・通信オーバーラップ、AllReduceの通信量推定、Message Sizeの階層、マイクロバースト可視化、長距離RDMAのACK遅延とPFC headroomを追記。 ### 2026-08-30 ingest | AIインフラ革命 ─ 米国データセンターとGPUを支える技術基盤 - 新規 concept 1 件: [[AIインフラ]]。施設の電力・冷却からGPUラック、RoCEv2 Clos、光配線、Kubernetesプラットフォームまでを一体の設計対象として整理。 - 更新 concept 5 件: [[PUE]]・[[GPUクラスタ運用]]・[[データセンターネットワークトポロジ]]・[[RoCE設計課題]]・[[データセンター内光配線設計]]。PUE、物理配置、閉域GPU網、配線作業性、SFP相互運用性を追記。 ### 2026-08-30 ingest-slides | AI Networking - RoCEv2 and the role of netdev - 更新 concept 5 件: [[RDMA]]・[[RoCE設計課題]]・[[ホストネットワークスタック性能]]・[[TCP IPスタック統合|TCP/IPスタック統合]]・[[Linuxカーネルインタフェース]]。RoCEv2の性能を、PFC/Go-Back-Nだけでなく、netdevの制御モデル、IB verbsのハードウェアデータ経路、Linux TCPのゼロコピー拡張との責任境界として整理。 ### 2026-08-30 ingest | 1兆 (1T) パラメータ規模のLLMの事前学習検証 - 新規 concept 2 件: [[Hash Layers]]・[[Expert Choice Routing]]。学習しないハッシュ割り当てとエキスパート主導の容量固定ルーティングを整理。 - 更新 concept 6 件: [[Mixture-of-Experts]]・[[負荷分散]]・[[条件付き計算]]・[[LLM分散学習]]・[[LLMスケーリング則]]・[[言語モデル事前学習]]。1T級MoEのRouter崩壊、低精度オプティマイザ状態、220 TFLOP/s/GPUの実効効率、外挿から外れたtrain lossを反映。 ### 2026-08-30 ingest | 1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習 - 新規 concept 2 件: [[Zero Bubble]]・[[z loss]]。パイプラインバブル削減と数値安定性・学習診断メトリクスを整理。 - 更新 concept 8 件: [[QK-Norm]]・[[混合精度訓練]]・[[パイプライン並列化]]・[[並列化戦略]]・[[LLM分散学習]]・[[言語モデル事前学習]]・[[損失関数]]・[[LLM評価]]。 ### 2026-08-30 ingest | 「研究テーマ」の正体|石原尚 - New concept: [[研究テーマ]]。研究テーマを、理想・現状・課題・問題からなる世界観と、アプローチ・目標・手段からなる作戦の組み合わせとして整理した。 ### 2026-08-30 ingest | Off-CPU Analysis - Updated concepts: [[スレッド状態分析]]・[[フレームグラフ]]・[[eBPF]]・[[コンテキストスイッチ]]・[[スケジューラレイテンシ]]・[[トレーシングオーバーヘッド]] - off-CPU時間を、I/O・ロック・スリープ・プリエンプションを含むスケジューラ起点の待機時間として整理し、on-CPU分析との補完関係、eBPFカーネル内集約、要求同期フィルタ、フレームグラフ可視化を各概念へ接続した。 ### 2026-08-29 ingest | NVIDIA Hopper Architecture In-Depth - 更新 concept 11 件: [[テンソルコア]]・[[GPU最適化]]・[[Thread Block Cluster]]・[[分散共有メモリ]]・[[DPX]]・[[混合精度訓練]]・[[GPU多重化(MPS・MIG)]]・[[NVLink]]・[[メモリ階層とキャッシュ]]・[[CUDA]]・[[PCIe性能]]。 - Hopper の公式仕様を、FP8/Transformer Engine、非同期データ移動、SM 間局所性、MIG の隔離、NVLink Switch System のスケールアップという横断的な設計軸へ接続した。 ### 2026-08-29 ingest-paper | Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks - 更新 concept 9 件: [[GPUマイクロベンチマーク]]・[[GPU最適化]]・[[性能測定]]・[[テンソルコア]]・[[メモリ階層とキャッシュ]]・[[Instruction-Level Parallelism (GPU)]]・[[混合精度訓練]]・[[量子化]]・[[LLM推論]]。GB203 の FP4/FP6、命令発行、キャッシュ階層、FP8 GEMM、推論電力の知見を追記。 ### 2026-08-29 ingest-paper | GPU Cluster for High Performance Computing - 新規 concept 1 件: [[格子ボルツマン法]]。D3Q19/BGK による規則格子流体計算、GPU テクスチャ写像、サブドメイン通信、都市汚染物質拡散を整理。 - 更新 concept 3 件: [[GPU最適化]]・[[GPUクラスタ運用]]・[[HPCインターコネクトベンチマーク]]。データ配置、GPU–CPU 転送、通信/計算オーバーラップ、弱スケーリング/強スケーリングの観点を追記。 ### 2026-08-29 ingest-paper | Benchmarking and Dissecting the Nvidia Hopper GPU Architecture - 新規 concept 3 件: [[GPUマイクロベンチマーク]]・[[分散共有メモリ]]・[[DPX]]。Hopper の命令レベル測定、SM-to-SM 通信、動的計画法向け加速を整理。 - 更新 concept 4 件: [[テンソルコア]]・[[GPU最適化]]・[[性能測定]]・[[メモリ階層とキャッシュ]]。`wgmma`・FP8・電力制約・GPU メモリ階層の知見を追記。 ### 2026-08-29 ingest | BPF in the agentic era / BPF in the Agentic Era (LSFMM 2026) - 新規 concept 3 件: [[BPF verifier]]・[[Rust-BPF]]・[[BPF arena memory]]。BPF の安全境界、Rust の標準機能、arena 型メモリ、エージェント向けフィードバックを整理。 - 更新 concept 4 件: [[eBPF]]・[[BPF]]・[[エージェント型コーディング]]・[[カーネル障害診断]]。verifier の説明可能性、Rust-BPF、ライブカーネルデバッグとの接続を追記。 ### 2026-08-28 ingest-paper | MagmaScope(Li ほか、ICSE-SEIP、2026) - 新規 concept 1 件: [[Change Object Rewrite]](変更チケット記述を LLM で意味的に標準化する前処理技法。不整合・断片的な変更記述を有効な相関可能形式に変換するセマンティック正規化層) - 更新 concept 7 件: [[根本原因分析]]・[[Fault Localization]]・[[LLMによる根本原因分析]]・[[マルチモーダル障害診断]]・[[変更起因インシデント]]・[[インシデント管理]]・[[インシデント調査戦略]] - 主要な横断知見: MagmaScope は「安価な候補空間圧縮→高コスト文脈推論」という繰り返し観察されるアーキテクチャパターンを変更チケット+IM チャットで実装。IM チャットを第 4 のオペレーショナルモダリティとして定量化した。その関連付けは「因果推論ではなく意味的理解」と明示される。 ### 2026-08-28 ingest-paper | A Definition of AGI - 新規 concept 2 件: [[AGI]](十分な教育を受けた成人の認知的な多様性と熟達度に基づく定義)・[[Cattell-Horn-Carroll理論]](人間の認知能力を広い能力・狭い能力へ分解する階層モデル) - 更新 concept 3 件: [[LLM評価]](単一ベンチマークから認知プロファイルへ評価単位を拡張)・[[LLM能力スパース性]](領域間の能力偏りを追加)・[[エージェントメモリ]](長期記憶保存とコンテキスト再提示の区別) ### 2026-08-25 ingest-thesis | A Survey on Failure Analysis and Fault Injection in AI Systems(Yu ほか、ACM TOSEM、2025) - 更新 concept 5 件: [[GPUレジリエンス]]・[[敵対的摂動]]・[[運用障害分析]]・[[量子化]]・[[障害注入]] - [[障害注入]] は第 1〜3 章が 6 層の枠組みを、第 4〜9 章が各層の中身を、第 10〜12 章が未解決の問いを分担して積み増した。[[GPUレジリエンス]] には**サーベイのソフトウェア/シミュレーション FI ツール群と本番 LLM 学習クラスタの実測統計との方法論的断絶**、[[量子化]] には**DeepMutation++ の精度削減演算子が高速化目的の量子化と「同じ操作・正反対の目的」**という対比が入った。 ### 2026-08-25 ingest-thesis | Failure Diagnosis in Microservice Systems(Zhang ほか、arXiv、2024) - 更新 concept 9 件: [[Fault Localization]]・[[マイクロサービスアーキテクチャ]]・[[マイクロサービスベンチマーク]]・[[マルチモーダル障害診断]]・[[メトリクス削減]]・[[分散トレーシング]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[ログ解析]] - [[マルチモーダル障害診断]] に融合の 3 系統(result / model / feature)が入った。**[[根本原因分析]] の既存記述の事実誤り(参照 [130] を T-Rank としていたが原本では Sleuth)を、第 5 章担当の報告を受けてオーケストレータが原本の参考文献リストで裏取りして訂正した。** ### 2026-08-25 ingest-thesis | A Survey of AIOps in the Era of Large Language Models(Zhang ほか、ACM CSUR、2025) - 更新 concept 10 件: [[AIOps]]・[[Fault Localization]]・[[LLMによる根本原因分析]]・[[ソフトウェアエイジング]]・[[テレメトリ]]・[[ログ解析]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[異常検知]]・[[障害緩和]] - 第 3〜6 章の担当が RQ ごとに concept を分担した(RQ1 → [[テレメトリ]]・[[ログ解析]]、RQ2 → タスク系 concept、RQ3 → [[LLMによる根本原因分析]]、RQ4 → [[分類モデルの評価指標]])。**[[分類モデルの評価指標]] には Salfner 2010 が確立した混同行列ベースの体系から 15 年で測るべき対象そのものが変わったという変遷**が入った。 ### 2026-08-25 ingest-thesis | D'ya like DAGs? A Survey on Structure Learning and Causal Discovery(Vowels ほか、ACM CSUR、2022) - 更新 concept 1 件: [[因果発見]](第 1+2 章が仮定の体系、第 3+4 章が組合せ探索の探索空間、第 5 章が非巡回性の連続緩和、第 6 章が「因果の跳躍」批判という軸で分担して積み増した) - **本サーベイの「因果の跳躍」批判は、実務側の RCA 手法群と突き合わせると重い**。Soldani & Brogi(2021)§4.3.3 によれば監視メトリクスから根本原因を特定する手法群は LOUD を除く全手法が PC アルゴリズムで因果グラフを構築しており、本サーベイの批判はまさにその出力を「根本原因」と呼ぶ前提に向けられている。 ### 2026-08-25 ingest-thesis | A Survey of DevOps Concepts and Challenges(Leite ほか、ACM CSUR、2019) - 更新 concept 5 件: [[DevOps]]・[[Infrastructure as Code]]・[[収束型システム管理]]・[[継続的デプロイ]]・[[継続的デリバリ]] - [[DevOps]] は第 5 章(概念地図・一次担当)・第 1+2 章(定義と由来)・第 6 章(概念とツールの対応)・第 7 章(3 立場への視点分割)・第 8 章(未解決の問い)が軸を分けて積み増した。**第 1+2 章の担当が立てた「2008 年命名の一次文献 [68] は何か」という問いに、第 9 章の担当が参考文献一覧から答えた**(Patrick Debois, Agile 2008 Toronto)ため、該当の問いを解決済みとして落とし知見へ移した。 ### 2026-08-25 ingest-thesis | Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications(Soldani & Brogi、ACM CSUR、2021) - 更新 concept 8 件: [[サービスレベル目標]]・[[マイクロサービスアーキテクチャ]]・[[ログベース異常検知]]・[[分散トレーシング]]・[[因果推論ベースRCA]]・[[因果発見]]・[[根本原因分析]]・[[異常検知]] - [[異常検知]] に「データ源が検知できる異常の型・粒度・導入コストを規定する」軸が入り、**Chandola 2009 の「手法が置く仮定」軸と直交する**ことが横断的知見として立った。あわせて説明可能性の 16 年の変遷(Chandola 2009 に無し → 本サーベイが未解決課題として言語化 → 2025 年 Trustworthy AI レビューが要件として形式化)も記録した。 ### 2026-08-25 ingest-thesis | A Tutorial on Kernel Density Estimation and Recent Advances(Yen-Chi Chen、arXiv、2017) - 更新 concept 4 件: [[カーネル密度推定]]・[[ブートストラップ法]]・[[信頼区間]]・[[密度ベースクラスタリング]] - [[密度ベースクラスタリング]] に **DBSCAN の核点条件が一様カーネル KDE のレベル集合条件と数式レベルで一致する**という発見が入った(Chandola 2009 サーベイの DBSCAN 記述との突き合わせ)。[[カーネル密度推定]] には第 1 章(収束率・帯域幅選択)・第 3 章(信頼帯のバイアス)・第 4 章(特徴推定時の帯域幅条件)・第 6 章(未解決問題)が軸を分けて積み増した。 ### 2026-08-25 ingest-thesis | A Survey of Online Failure Prediction Methods(Salfner・Lenk・Malek、ACM CSUR、2010) - 更新 concept 6 件: [[AIOps]]・[[ディペンダビリティ]]・[[ハードディスク信頼性]]・[[プロアクティブ障害管理]]・[[分類モデルの評価指標]]・[[障害予測]] - [[ディペンダビリティ]] に第 2 章の用語規約(fault/error/symptom/failure の連鎖と 4 つの時間軸)が入り、[[障害予測]] に第 4 章の階層的分類体系が入った。[[障害予測]] では Notaro 2021(予測の対象で分類)と Salfner 2010(観測経路で分類)の切り口の違いが横断的知見として立った。 ### 2026-08-25 ingest-thesis | A Survey of AIOps Methods for Failure Management(Notaro・Cardoso・Gerndt、ACM TIST、2021) - 更新 concept 11 件: [[AIOps]]・[[Fault Localization]]・[[アラート管理]]・[[プロアクティブ障害管理]]・[[ログ解析]]・[[体系的マッピング研究]]・[[根本原因分析]]・[[異常検知]]・[[障害予測]]・[[障害注入]]・[[障害緩和]] - 第 4.1〜4.5 章の担当が 5 カテゴリそれぞれに対応する concept を分担して積み増した([[プロアクティブ障害管理]]・[[障害予測]]・[[異常検知]]・[[根本原因分析]]/[[Fault Localization]]・[[障害緩和]]/[[アラート管理]])。[[AIOps]] は第 1・2 章の担当が分類体系の軸で扱った。 ### 2026-08-25 ingest-thesis | Efficient Large Language Models: A Survey(Zhongwei Wan ほか、TMLR、2024) - 更新 concept 9 件: [[FlashAttention]]・[[LLM推論]]・[[PagedAttention]]・[[モデル圧縮]]・[[並列化戦略]]・[[枝刈り]]・[[状態空間モデル]]・[[知識蒸留]]・[[量子化]] - 第 1 章が「介入点による 3 分類」という分類原理の軸を、第 2 章がモデル圧縮 4 手法の圧縮率と精度劣化のトレードオフ軸を、第 4 章がフレームワークの機能セット軸を、それぞれ [[LLM推論]]・[[モデル圧縮]] に重複しない形で積み増した。 ### 2026-08-25 ingest-thesis | Trade-Offs Under Pressure(John Allspaw、Lund University 修士論文、2015) - 更新 concept 6 件: [[Common Grounding]]・[[Joint Activity]]・[[プロセストレーシング]]・[[研究方法論における妥当性概念]]・[[複雑システム障害論]]・[[診断ヒューリスティック]] - [[診断ヒューリスティック]] には第 5 章(生データとしての観察)・第 6 章(定式化と使用パターン)・第 7 章(訓練とツール設計への還流)の担当が軸を分けて積み増した。[[プロセストレーシング]] では Maguire(2020)博士論文との方法論比較(単一事例 1 件 対 62→14→5 件のコーパス)が立った。 ### 2026-08-25 ingest-thesis | Anomaly Detection: A Survey(Chandola・Banerjee・Kumar、ACM CSUR、2009) - 更新 concept 5 件: [[カーネル密度推定]]・[[変化点検知]]・[[密度ベースクラスタリング]]・[[最近傍法]]・[[異常検知]] - [[異常検知]] には第 4〜9 章の担当が技法カテゴリごとに「置いている仮定」を層状に積み増した(分類ベース→最近傍→クラスタリング→統計的→情報理論的→スペクトル)。第 11 章がこの比較節を締め、第 4 章が立てた「横断比較表の宿題」を解決済みとして落とした。 ### 2026-08-25 ingest-thesis | Agentic Failure Management of Cloud Systems(Yinfang Chen、UIUC 博士論文、2026) - 更新 concept 8 件: [[AIOps]]・[[Transactional No-Regression]]・[[agentic SRE]]・[[クラウド障害ライフサイクル]]・[[プロアクティブ障害管理]]・[[根本原因分析]]・[[障害注入]]・[[障害緩和]] - 章ごとに軸を分けて積み増した(第 3 章=LLM 推論の RCA 適合、第 4 章=診断から緩和へ閉じる条件、第 5 章=ベンチマークによる RCA 性能測定、第 6 章=RCACopilot の位置づけ)。[[Transactional No-Regression]] は第 4 章が一次出典として形式定義と保証範囲を厚く積み増した。 ### 2026-08-25 ingest-paper | Understanding and Profiling CXL.mem Using PathFinder - 新規 concept 1 件: [[CXL.memプロトコル実行プロファイリング]](サーバプロセッサを多段Closネットワークとみなし、traceroute・reverse traceroute・Little's Lawキューイング解析といったネットワーク領域のトラフィック解析技術をホスト内部のPMUベースマイクロアーキテクチャ解析に転用するPathFinderの手法群)。 - 更新 concept 1 件: [[CXLによるメモリ拡張]](VistaraのTPPベースページ配置最適化とPathFinderのPMUベース診断が「どこにページを置くか」と「なぜCXLが遅いか」という相補的な抽象度で対応するという横断的知見を追加)。 ### 2026-08-24 ingest-paper | The Design and Implementation of Open vSwitch - 新規 concept 1 件: [[パケット分類]](タプル空間探索分類器と、OVSが実装するタプル優先度ソート・ステージドルックアップ・プレフィックストラッキング・分類器パーティショニングという4つのキャッシュ意識最適化)。 - 更新 concept 1 件: [[ソフトウェア定義ネットワーク]](OpenFlowの単純な制御モデルと、それを支えるOVS実装側の複雑さとの対比という横断的知見を追加)。 ### 2026-08-24 ingest-slides | SONiCで構築・運用する生成AI向けパブリッククラウドネットワーク - 更新 concept 2 件: [[Clos Network]](Chassis Networkとの比較で、採用理由が理論的性質よりベンダーダイバーシティにあるという実運用知見を追加)・[[べき等性]](ネットワーク機器configのjsondiff+dry run+applyパイプラインという、cfengine/DDIAとも異なる第5の冪等性実現方針を追加)。 ### 2026-08-24 ingest | RFC 8365 - A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN) - 更新 concept 4 件: [[EVPN]](VXLAN/NVGRE カプセル化における Local Bias スプリットホライズン、DCI の GW/ASBR 方式と mass withdrawal 粒度低下を追加)・[[MPLS]](inter-AS Option B の mass withdrawal 粒度低下という EVPN との構造的類似)・[[ネットワーク仮想化]](Nicira/NSX の集中制御型 NVO と EVPN の分散 BGP 型 NVO の対比)・[[オーバーレイネットワーク]](運用者主導オーバーレイに制御プレーン層を追加)。 - 更新 entity(product) 1 件: [[VXLAN]](EVPN 制御プレーンとの統合節を追加)。 ### 2026-08-24 ingest | RFC 7432 - BGP MPLS-Based Ethernet VPN - 新規 concept 1 件: [[VPLS]] — MPLS 上でデータプレーン学習によりマルチ拠点を単一 LAN として接続する EVPN の前身 L2VPN。マルチホーミング・冗長性・マルチキャスト最適化の限界を持つ。 - 更新 concept 2 件: [[EVPN]](RFC 7432 の中核機構——ES/ESI・4 ルートタイプ・DF 選出の service carving・MAC Mobility——を統合。並行 ingest セッションが作成していた重複ページを解消して統合)・[[MPLS]](L2VPN 構築の具体例として EVPN を追記)。 ### 2026-08-24 ingest | RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN) - [[EVPN(Ethernet VPN)]] — BGP を制御プレーンとする MPLS/NVO 上のマルチホーミング L2 VPN。Route Type 2/5 と BGP 拡張コミュニティを核とする。 - [[EVPNにおける統合ルーティングとブリッジング(IRB)]] — EVPN 上でサブネット間ルーティングとブリッジングを PE で統合処理する Symmetric/Asymmetric の2モード。 - [[分散エニーキャストゲートウェイ]] — 全 PE が同一のエニーキャスト IP/MAC でデフォルトゲートウェイとして応答し、ホストのモビリティ透過性を実現する仕組み。 ### 2026-08-21 ingest-paper | Serval: An End-Host Stack for Service-Centric Networking 新規 concept 1件: [[Service-Centric Networking]](サービスをホストやインターフェースから分離し、ServiceID・FlowID・IP アドレスと SAL で接続・解決・移行を扱うネットワーク設計)。 既存 2件を更新: [[サービスメッシュ]](SAL とサイドカープロキシの制御/データプレーン分離を比較)・[[スクリプタブルロードバランサー]](初回接続だけをサービスルータで解決し後続データを直接転送する対照例を追加)。 ### 2026-08-21 ingest-slides | XDPerf: A High-Performance Traffic Generator Built with WASM and eBPF 新規 concept 1件: [[XDP]](NIC ドライバ層で eBPF を実行する Linux の早期ネットワークパス)。 既存 4件を更新: [[eBPF]](観測・方針置換に加えた高速パケット生成のデータプレーン)・[[WebAssembly]](Wasm を性能クリティカルな送信経路の柔軟性境界へ使う応用)・[[カーネルバイパスネットワーキング]](DPDK と XDP の責任境界比較)・[[RSS(Receive Side Scaling)]](フロー多様性と受信キュー分散)。 ### 2026-08-21 ingest-paper | A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability 新規 concept 1件: [[DPDK性能分析]](DPDK native tracing、状態再構築、DPDK 固有メトリクス、Trace Compass 可視化を統合する性能診断領域)。 既存 3件を更新: [[オブザーバビリティ]](カーネルバイパス環境での内部状態観測)・[[カーネルバイパスネットワーキング]](性能経路と観測責任の分離)・[[プローブ効果]](DPDK tracepoint の burst 償却と約2%推定)。 ### 2026-08-21 ingest-paper | Deploying User-space TCP at Cloud Scale with LUNA 新規 concept 0件。 既存 9件を更新: [[ユーザーレベルTCPスタック]](本番展開されたLUNAのr2c・Zbuf・カーネルTCP共存)・[[ゼロコピーネットワーキング]](Zbufの所有権と全経路ゼロコピー)・[[カーネルバイパスネットワーキング]](NIC共存と制御プレーン分離)・[[アプリケーション並行実行モデル]](batch-r2cとinline-r2c)・[[TCP IPスタック統合|TCP/IPスタック統合]](API・実行ループ・バッファ・NIC分岐の責任境界)・[[ストレージ計算分離]](分離ストレージのフロントエンドネットワーク)・[[TCP輻輳制御アルゴリズム]](NewReno・Cubic・HPCCのサービス依存性)・[[RDMA]](TCPとRDMAの採否条件)・[[ネットワークワークロードのCPUスケジューリング]](r2cのコア局所性と停止時のリスク)。 ### 2026-08-21 ingest-paper | Scalable Kernel TCP Design and Implementation for Short-Lived Connections 新規 concept 1件: [[TCP接続局所性]](NIC 割り込み、TCP 状態、受信パケット、アプリケーションを同じ CPU コアへ固定し、キャッシュバウンスと共有競合を減らす設計)。 既存 8件を更新: [[ユーザーレベルTCPスタック]](カーネル内で接続局所性を実現する対案)・[[カーネルバイパスネットワーキング]](バイパスなしの局所化)・[[TCP IPスタック統合|TCP/IPスタック統合]](VFS・状態所有コアの責任境界)・[[ホストネットワークスタック性能]](短命接続の共有状態ボトルネック)・[[アプリケーション並行実行モデル]](Per-Core Process Zone)・[[RSS(Receive Side Scaling)]](RSS と接続局所性の差)・[[RFS(Receive Flow Steering)]](RFS と RFD の比較)・[[ネットワークワークロードのCPUスケジューリング]](局所性と公平性の補完関係)。 ### 2026-08-21 ingest-paper | Unikraft: Fast, Specialized Unikernels the Easy Way 新規 concept 1件: [[ソフトウェア特殊化]](OS プリミティブ、API、I/O 経路をアプリケーションのワークロードに合わせて選択・削除・置換する設計)。 既存 4件を更新: [[ユニカーネル]](Unikraft のマイクロライブラリ方式と OSv との互換性・特殊化軸の比較)・[[メモリアロケータ]](アロケータ選択をブート・実行時性能の構成要素として追記)・[[カーネルバイパスネットワーキング]](uknetdev と DPDK の責任境界・性能比較)・[[システムコール]](syscall shim による保護境界コストの削減)。 ### 2026-08-21 ingest-paper | zpoline: a system call hook mechanism based on binary rewriting 新規 concept 2件: [[システムコールフック]](システムコール境界で観測・遮断・変更・エミュレーションを行う方式群)・[[バイナリ書き換え]](機械語命令を置換してソース変更なしに実行経路を変える技術)。 既存 6件を更新: [[システムコール]](命令そのものをメモリ上でフックする方式)・[[動的計装]](観測からシステムコール挙動変更への拡張)・[[プローブ効果]](フック機構の実測オーバーヘッド)・[[ゼロコード計装]](観測と置換の区別)・[[ユーザーレベルTCPスタック]](既存アプリケーションへの透明な接続)・[[カーネルバイパスネットワーキング]](カーネルバイパスと互換性境界の関係)。 ### 2026-08-21 ingest-paper | TAS: TCP Acceleration as an OS Service 新規 concept 1件: [[TCP高速化サービス]](TCP共通処理を専用CPUまたは専用実行コンポーネントへ分離し、制御ポリシー・接続管理・例外処理を別経路へ残す設計パターン)。 既存 7件を更新: [[ユーザーレベルTCPスタック]](mTCPとの比較、POSIX互換とACK・輻輳制御強制)・[[カーネルバイパスネットワーキング]](DPDKを使いつつOSサービス側へ信頼境界を残す構成)・[[TCP IPスタック統合|TCP/IPスタック統合]](iipとの責任境界の対比)・[[ホストネットワークスタック性能]](短RPCの共通処理分離と後続Linux資源管理との補完関係)・[[TCP輻輳制御アルゴリズム]](方針と強制の分離、レートベースDCTCP)・[[アプリケーション並行実行モデル]](専用fast path/slow pathとキュー協調)・[[スマートNICオフロード]](NICへ移す前のソフトウェア分割案)。 ### 2026-08-21 ingest-paper | Understanding Host Network Stack Latency 新規 concept 1件: [[ネットワークワークロードのCPUスケジューリング]](CPU runtime だけでなく、softIRQ、要求数、パケット到着、接続局所性を考慮するネットワーク向け公平性・割り込み調整の設計問題)。 既存 6件を更新: [[ホストネットワークスタック性能]](平均 CPU コストとテールレイテンシの支配要因の分岐)・[[ネットワーク割り込み合体とCPUスケーリング]](DIM と AutoDIM のワークロード依存性)・[[レイテンシ分析]](`rx_sched` と処理区間の分離)・[[テールレイテンシ耐性技術]](根本原因修正とテールのマスクの補完関係)・[[ユーザーレベルTCPスタック]](Linux の比較条件と接続・バッチ設計)・[[カーネルバイパスネットワーキング]](バイパスと CPU 公平性の分離)。 ### 2026-08-21 ingest-paper | Understanding Host Network Stack Overheads 新規 concept 1件: [[ホストネットワークスタック性能]](100 Gbps 級リンクで、データコピー、DCA キャッシュ、NUMA、フロー競合、集約、スケジューリングが形成するホスト側ボトルネックの分析領域)。 既存 7件を更新: [[ゼロコピーネットワーキング]](per-packet 処理削減後の受信側 per-byte コピーの支配性)・[[カーネルバイパスネットワーキング]](バイパス後も残る NUMA・キャッシュ・資源配分問題)・[[ユーザーレベルTCPスタック]](カーネル外 TCP/IP とホスト資源認識の補完関係)・[[TCP IPスタック統合|TCP/IPスタック統合]](固定処理ループを避ける責任境界の測定的根拠)・[[組み込みTCP IP|組み込みTCP/IP]](小型機器と高帯域ホストに共通する責任再配置)・[[アプリケーション並行実行モデル]](長短フロー混在とネットワーク認識型 CPU スケジューリング)・[[TCP輻輳制御アルゴリズム]](受信側ボトルネック下で輻輳制御方式差が小さい条件)。 ### 2026-08-21 ingest-paper | iip: an integratable TCP/IP stack 新規 concept 1件: [[TCP IPスタック統合|TCP/IPスタック統合]](TCP/IP 処理を既存の OS、ランタイム、NIC、メモリ管理、アプリケーション実行モデルへ組み込む際の責任境界と性能機構の設計問題)。 既存 5件を更新: [[ユーザーレベルTCPスタック]](固定的なコアローカル実行モデルに対する iip の選択可能な API)・[[ゼロコピーネットワーキング]](netmap と iip のデータ所有権の違い、ワークロード依存の損益)・[[カーネルバイパスネットワーキング]](カーネルバイパスと実行モデルの独立性)・[[RSS(Receive Side Scaling)]](TCP 接続状態のコア局所化)・[[組み込みTCP IP|組み込みTCP/IP]](uIP/lwIP と iip の責任再配置の連続性)。 ### 2026-08-21 ingest-paper | Full TCP/IP for 8-Bit Architectures 新規 concept 1件: [[組み込みTCP IP|組み込みTCP/IP]](限られたコード領域と RAM でホスト間相互運用性を保つ組み込み TCP/IP の設計領域)。 既存 3件を更新: [[アプリケーション並行実行モデル]](イベント駆動 API とメインループを、資源制約下の TCP/IP 実装へ接続)・[[TCP輻輳制御アルゴリズム]](uIP の単一未確認セグメントと lwIP の輻輳制御の対比)・[[Webサーバアーキテクチャ]](組み込みウェブサーバーのイベント駆動モデル)。 ### 2026-08-21 ingest | Extensible Software in the age of LLMs 新規 concept 2件: [[ウェブ拡張型ソフトウェア]](LLM でユーザー固有の拡張作成コストを下げ、責任ある中核・狭いケイパビリティ・強い実行分離を組み合わせるウェブアプリケーション設計)・[[LLMネイティブソフトウェア]](自然言語からユーザー拡張を生成・再読み込み・共有する製品モデル)。 既存 6件を更新: [[Extension Interface Model]](EIM の最小権限モデルを LLM 生成コードへ接続)・[[Capability-based Security]](狭い関数参照によるウェブ拡張の安全境界)・[[WebAssembly]](WASM + WASI を多言語対応とケイパビリティ付与の実行候補として位置づけ)・[[サーバーレスアーキテクチャ]](FaaS の接続点をユーザー拡張へ開く設計)・[[AIネイティブ開発]](開発文化と製品アーキテクチャの差分)・[[LLMアプリケーション信頼性]](生成拡張コードを本番コンポーネントとして扱う信頼性)。 ### 2026-08-21 ingest-video | Networking for Meta's Gigawatt-scale AI fleet 新規 concept なし。既存 4 件を更新。 - [[AIデータセンタートポロジ]] — Scale Up/Scale Out の二層モデルに、Meta の Scale Across(拠点・地域・クラウド間)を第三領域として追加。Scale Outside との命名差、電力・光ファイバー・長距離レイテンシー・容量移行の制約を整理。 - [[GPUクラスタ運用]] — ワークロード動態をネットワーク設計へ渡す必要性と、障害リンク迂回・無停止更新・物理交換を含むライフサイクル運用を追加。 - [[オープンネットワーキング]] — 標準 Ethernet の Scale-Up/Scale-Out への拡張と、ベンダロックイン回避だけでなく技術・容量移行を速める価値を追加。 - [[データセンターネットワーク信頼性]] — 障害後の経路回復に加え、稼働中更新・物理交換・長時間訓練ジョブ継続を信頼性の評価対象へ追加。 ### 2026-08-21 ingest-paper | Data Warehousing and Analytics Infrastructure at Facebook 新規concept 2件: [[データ基盤の資源共有]](アドホック分析と期限付きバッチを共通基盤へ収容する資源配分・隔離問題)・[[データ発見]](表・列の意味、系譜、専門利用者を組み合わせたデータ利用可能性の形成)。 既存3件を更新: [[データウェアハウス]](集中化後に必要となるデータ発見・SLA・資源共有の層)・[[分散ファイルシステムとオブジェクトストア]](HDFSの複製数・局所性・NameNodeメタデータ制約)・[[列指向OLAPデータベース]](PAXベース行列圧縮をMapReduce基盤へ適用する例)。 ### Zoomer: Powering AI Performance at Meta’s Scale Through Intelligent Debugging and Optimization(Meta Engineering Blog, 2025-11-21)(2026-08-20 ingest) - 新規 concept 作成なし。既存 concept 9 件を更新: [[GPU観測性]](GPU/CPU/ホスト/通信/要求単位の信号を統合する本番性能プラットフォームへの拡張)・[[LLM学習モニタリング]](障害検知から性能説明・改善実行までの閉ループ)・[[LLM推論]](要求単位 QPS 最適化と GPU/ホストトレースの統合)・[[GPUエネルギー効率]](訓練時間・電力の同時削減という Meta 自己報告)・[[パフォーマンスエンジニアリング]](測定→分析→実装→検証の自動運用ループ)・[[ストラグラー]](rank 比較分析の本番統合)・[[クリティカルパス分析]](訓練トレースから改善再実行への接続)・[[並列化戦略]](N 次元並列化の実行時フィードバック)・[[GPU最適化]](カーネル外のホスト・通信・サービング設定まで含む全体最適)。 ### A Fresh Look at the Architecture and Performance of Contemporary Isolation Platforms(van Rijn & Rellermeyer, Middleware 2021)(2026-08-19 ingest-paper) 新規 concept 1 件: [[ユニカーネル]](シングルアドレス空間ライブラリOS。動的ELFリンカによりモード切り替えを回避する設計と、代表実装OSvの拡張HAPメトリクス上の少なさ・ハイパーバイザー依存性を起点concept化)。既存3件を更新: [[コンテナ仮想化]](10プラットフォーム横断比較による「隔離強度と性能のトレードオフ」問いの大枠解決、VEE'20とのHAP傾向の一致、virtio-fsによるI/O改善実証を追記)、[[ハードウェア仮想化]](QEMU・Firecracker・Cloud Hypervisorの成熟度別オーバーヘッド実測、Kata ContainersのNVDIMMによるメモリペナルティ回避事例を追記)、[[Lightweight Sandboxing]](拡張HAPメトリクスによるgVisor・Kata Containersの高スコア、Kata Containersの"Speed of containers, security of VMs"タグライン破綻の実証を追記)。 ### 2026-08-19 ingest-paper | Serverless inferencing on Kubernetes(Clive Cox+, ICML 2020 ワークショップ) 新規concept作成なし。既存2件を更新: [[サーバーレスアーキテクチャ]](KFServingを具体的なKnativeベースML推論サーバーレス実装として追記。2020年時点のGPUオートスケーリング困難性・大規模モデルコールドスタート・数百〜数千小規模モデル多重化という未解決課題が、CNCF白書の一般論を先取りしていたことを追記)、[[LLMサービング管理]](PreServe/FaaScaleが扱う「コールドスタートが反応的オートスケーリングを無効化する」trilemmaが、LLM以前の2020年時点でKFServingの本番運用報告としてすでに同型の構造で観測されていたことを追記)。 ### 2026-08-19 ingest-paper | Topology-Aware GPU Scheduling for Learning Workloads in Cloud Environments(Marcelo Amaral+, SC17) 新規concept作成なし。既存2件を更新: [[トポロジ考慮型スケジューリング]](KEP-2724 TASに7年先行するノード内グラフマッピング型の原型として横断的知見を追記、宣言的制約 vs. 効用関数最適化の対比)、[[GPUクラスタスケジューリング]](Philly/HiveDより約2年早いノード内トポロジ考慮の先行例として、局所性問題意識がHPC単一ノード→クラスタスケール→宣言的APIへ一般化した経路を追記)。 ### 2026-08-19 ingest-book | アジャイルな見積りと計画づくり(マイナビ 2009、全 7 部 23 章) 新規 concept 23 件。本 wiki で手薄だったアジャイル開発のプロジェクト計画領域を一括で立ち上げた。同一書籍の章を独立ソースとして扱い、章をまたいだ突き合わせを `## 横断的知見` に積み上げている(ハブ concept には 5〜6 章分が層状に積まれた)。 - **計画づくりの原理**: [[アジャイルな計画づくり]](本書のハブ。成果物としての「計画」ではなく活動としての「計画づくり」を重視する立場。1・2・3・22・Introduction の 5 ソースが積み増し) / [[活動ベースの計画づくり]](本書が批判する従来型。遅れは伝播するが早さは伝播しない、マルチタスク化の代償) / [[プランニング・オニオン]](複数レベルの計画づくりの階層) / [[満足条件]](リリース計画とイテレーション計画を駆動するフィードバックループ) / [[不確実性コーン]](プロジェクトの進行にしたがって見積り誤差が狭まる) - **規模の見積り**: [[ストーリーポイント]](単位を持たない相対値。4・5・6・7・8・12・23 章が積み増し) / [[理想日]](理想時間を単位とする規模の見積り) / [[プランニングポーカー]](専門家の意見・対比・分割を合成した技法) / [[再見積り]](相対的な規模の判断が変わったときだけ行う) / [[ベロシティ]](1 イテレーションで完了したポイントの合計。16・19・20・21・23 章が積み増し) - **価値と優先順位**: [[フィーチャの優先順位づけ]](金銭価値・コスト・新しい知識・リスクの 4 要素。9・10・11・12 章が積み増し) / [[金銭価値による優先順位づけ]](NPV・IRR・回収期間・割引回収期間) / [[狩野モデル]](当たり前/線形/魅力的の 3 分類とアンケートによる判定) / [[相対的重み付け]](専門家判断による代替手法) / [[ユーザーストーリーの分割]](5 系統の切り口と 2 つの禁則) - **スケジュール**: [[リリース計画づくり]](6 ステップの標準手順。13・14・15・16・17・18・19 章が積み増し) / [[イテレーション計画づくり]](ベロシティ駆動とコミットメント駆動。14・15・20 章が積み増し) / [[イテレーションの長さ]](決定の 7 要因と「2×6+1」サイクル) / [[プロジェクトバッファ]](フィーチャバッファとスケジュールバッファ、二乗和平方根法) / [[複数チームのプロジェクト計画]](合流バッファ・移動する先読み範囲) - **トラッキングと共有**: [[バーンダウンチャート]](リリース単位は残ポイント、イテレーション単位は残作業時間と縦軸が異なる) / [[タスクボード]](6 列構成と 1 人 1 枚のサインアップ) / [[計画のコミュニケーション]](期日は幅や確度を添えて伝える) ### The ganglia distributed monitoring system: design, implementation, and experience(Matthew L. Massie+, Parallel Computing 2004)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[分散モニタリング]](クラスタ内をマルチキャストベースの listen/announce プロトコルで対称的に監視し、クラスタ間は点対点接続ツリーで階層的に連合・集約するという Ganglia の2層設計を起点に、スケーラビリティ・ロバスト性・拡張性・管理可能性・ポータビリティ・オーバーヘッドという設計課題を定式化する概念ページ)。 ### Cutting Corners: Workbench Automation for Server Benchmarking(Piyush Shivam+, USENIX ATC 2008)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[ワークベンチ自動化]](共有ハードウェアプール上でサーバベンチマーキング実験集合を自動計画・実行するアプローチ。外側ループ=レスポンスサーフェスマッピング、内側ループ=ピークレート探索の二階層定式化、Binsearch/Model-guided load-picking、シーディングヒューリスティック)。 - 更新 concept 1 件: [[ベンチマーキング]] — 「意味のあるテストか」という定性的チェック項目を、負荷率依存の分散に基づくコスト最適化アルゴリズムとして2008年時点で先取りしていた点を横断的知見に追加。 ### Episteme and Techne(Richard Parry、Stanford Encyclopedia of Philosophy、2003/2024改訂)(2026-08-16 ingest) - 新規 concept 3 件: [[エピステーメー]](必然的対象の論証知。アリストテレスが厳密に定義するが、自身の他著作では用語が混用される) / [[テクネー]](制作〈poiêsis〉にかかわる知。機能〈ergon〉による個別化、経験〈empeiria〉からの区別) / [[エンペイリア(経験知)]](個別事例の反復から得る知。テクネーに劣るとされるが実務では優位なこともある)。本 wiki 2件目の古典哲学(classical philosophy)領域の concept。 - 更新 concept 1 件: [[フロネシス(実践知)]] — 単一ソース状態から脱し、テクネーとの区別の論拠の詳細化(SEP §3)と、ストア派によるフロネシスの再解釈(徳の一元的基盤への転換、SEP §4)を横断的知見に追加。 ### 2026-08-16 ingest-book | Feedback Control of Computing Systems(IEEE Press / John Wiley & Sons 2004、全 3 部 11 章) 新規 10 件 / 更新 4 件。同一 concept を扱う章は投入順で直列化し、章ごとに異なる軸で層状に積み増した。 **新規 concept(10 件)** - [[計算機システムのフィードバック制御]](1・8・11 章) — 計算機システムの資源管理をフィードバック制御問題として定式化する枠組みそのもの。制御系の構成要素、開ループ対閉ループ、比例制御の構造的限界、線形・決定的・時不変という仮定の緩和までを 3 章から層状に積み上げた本書のハブ concept。 - [[SASO特性]](1・8 章) — 安定性(stability)・精度(accuracy)・整定時間(settling time)・オーバーシュート(overshoot)。第 1 章が制御目標としての定義を与え、第 8 章が閉ループ極による定量化($-4/\log r$、$r^{\pi/|\theta|}$)を与える。 - [[システム同定]](2 章) — 入出力データから動的モデルのパラメータを推定する手続き。スコープ指定 → 実験計画 → 最小二乗回帰 → モデル評価の 4 段階と、動作点まわりの線形化、RMSE・$R^2$・相関係数・残差プロットによる評価。 - [[Z変換と伝達関数]](3 章) — 離散時間信号の Z 変換、差分方程式から伝達関数への変換、極と零点、最終値定理、BIBO 安定性。本書が連続時間の Laplace 変換ではなく離散時間の Z 変換を選ぶ理由も含む。 - [[ブロック線図]](4 章) — 構成要素の伝達関数を箱で表し信号の流れを矢印で表す図法。直列・並列・フィードバック結合の変換規則と、閉ループ伝達関数 $F_R = F_{FF}/(1+F_{LP})$ への代数的簡約。 - [[過渡応答解析]](5・6 章) — 動的システムの時間応答を初期条件応答・インパルス応答・ステップ応答という基本入力で特徴づける枠組み。定常ゲイン、整定時間、極の値と収束の速さの対応。第 5 章が一次系、第 6 章が高次系。 - [[支配極と高次系の近似]](3・6 章) — 複数の極を持つ系の応答が絶対値最大の極(支配極)に主に決まる性質と、それを使った高次系の低次近似。複素極が生む振動とオーバーシュート、零点による極の相殺、非最小位相系。 - [[極配置設計]](8・9・10 章) — 閉ループ極を望ましい位置に配置してゲインを決める設計法。第 8 章が SISO の根軌跡、第 9 章が設計パラメータ複数化、第 10 章が状態空間・MIMO への拡張と LQR との思想的対比。 - [[PID制御]](9 章) — 比例項・積分項・微分項の組み合わせ。積分項が定常偏差を消す仕組みと応答が遅くなる代償、微分項が計算機システムで使いにくい理由、PI/PD/PID の使い分け、離散時間での実装形。 - [[適応制御]](11 章) — 対象の特性が時間や動作点で変わる状況でコントローラのパラメータを実行時に変える制御。設計時に作り込み実行時は切り替えのみのゲインスケジューリングと、実行時に同定とゲイン再計算の両方を行う自己調整レギュレータの対比。 **更新 concept(4 件)** - [[フィードバックループ]] — 本書が与える古典制御理論に基づく形式的な定式化という軸で横断的知見を追記(1 章)。 - [[制御ループの安定性とタイムラグ補償]] — 極が単位円の内側にあるかで安定性が決まるという形式的基準と、整定時間が極から定量的に導けることを、一次系(5 章)と高次系(6 章)の 2 つの軸で追記。既存ソースの経験的判断との対比を明示。 - [[待ち行列理論]] — 既存ソースが定常特性を扱うのに対し、本書が同じ M/M/1/K の動特性を差分方程式でモデル化するという突き合わせを追記(2 章)。 - [[状態空間モデル]] — 既存は深層学習の SSM(Mamba/RWKV 等)論。上書きせず `## 制御理論における状態空間モデル` 節を新設し、MIMO・伝達関数モデルとの相互変換・可制御性/可観測性(7 章)と、状態フィードバック則・precompensator・LQR(10 章)を積み増した。 ### 2026-08-15 ingest-book | SREの探求(Seeking SRE、オライリー・ジャパン 2021、全 4 部 33 章) 新規 23 件 / 更新 90 件。34 章を並行取り込みしたため、同一 concept に複数章から層状に積み増している。 **新規 concept(23 件)** - [[コンテキスト対コントロール]](1 章) — 意思決定の責任とともに情報を渡す「コンテキスト駆動型」と、プロセス・権限制限で結果を強制する「コントロールベース」という SRE 実践の統治モデルの対比。エラーバジェットがどちらに属するかで [[SRE Book]] と Coburn Watson の見方が分かれる。 - [[SRE採用面接]](2 章) — 11 段階の採用ファネル、電話選考/オンサイト/在宅回答課題の 3 段階、「暫定の候補者像」に基づく interview loop 設計、ブラインド書類選考によるバイアス対策。 - [[修復負債]](4 章) — インシデントから生じた未完の修復作業を負債として追跡する指標。実在の修復負債と、RCA 不徹底を検出する仮想修復負債の 2 種。 - [[分隊型運用]](7 章) — Spotify の Ops-in-Squads。中央 SRE チームを置かず、オンコールと運用責任を開発分隊が持つ。成立にはツール・ドキュメンテーション/教育・賛同の 3 条件が要る。 - [[システム管理者からSREへの視点転換]](9 章) — コンポーネント別 SLA・外部依存の信頼性上限・1 分粒度のローリングウィンドウ可用性計算を通じた 11 ステップの移行手順。 - [[サービスとしての運用(OaaS)]](10 章) — サイロ間の引き継ぎとチケット駆動型キューを、アクセス制御と監査可能性を要件に含む完全なセルフサービスで置き換える設計パターン。機能横断型・開発運用分離型のいずれの組織モデルとも互換。 - [[レディネスレビュー]](11 章) — Google の LRR(ローンチ)/HRR(引き継ぎ)。欠陥数・アラート・モニタリング・アーキテクチャ・デプロイ・ハイジーンの 6 項目とコンプライアンス評価で SRE の関与条件を定める。 - [[DevOpsとSREの関係]](12 章) — 34 か国 1,165 人のアンケートが示す 7 つの説明軸(実装関係・役割対アプローチ・成熟度移行・Limoncelli モデル・用語先後・組織事情・相補的反応)。単一の結論に収斂しないこと自体が内容。 - [[プロダクションエンジニアリング]](13 章) — Facebook の PE 職種。集中型報告構造+分散型配属構造、SWE との完全なオンコール共有、コードを書いた者がオンコール所有者という原則。 - [[プライバシーエンジニアリング]](15 章) — 信頼性と共通の目標を持ちつつ、障害が不可逆であるため SLA の帰結モデル(事後清算)が適用できない領域。防護・強化・消火の 3 分類。 - [[データベースリライアビリティエンジニアリング]](16 章) — DBA の番人モデルを「データの保護・大規模セルフサービス・データベースは特別ではない」の 3 原則で再定義する枠組み。リカバリ可能性の 4 構成要素。 - [[データ耐久性]](17 章) — 可用性から独立した信頼性の側面。マルコフモデルによる推定は上限にすぎず、現実の脅威は「知らないでいることを知らない」相関障害。分離・保護・検証・自動化の 4 本柱。 - [[ドキュメンテーションのワークフロー統合]](19 章) — ドキュメントをコードと同じソース管理・レビュー・ツールチェーンへ載せる方式。構造品質より機能品質を優先し、容赦なく刈り込む。 - [[アクティブラーニング]](20 章) — 受動的講義に代わる能動的学習。Wheel of Misfortune・Incident Manager カードゲーム・SRE Classroom という 3 種の教材。 - [[SREアンチパターン]](23 章) — SRE 業界が繰り返し陥る 18 個の型を、名前・症状・処方箋の共通形式で体系化したもの。看板の掛け替え、ヒューマンエラー帰責、プッシュ型強制など。 - [[イミュータブルインフラストラクチャ]](24 章) — 実行中インスタンスを一切変更せず交換のみで更新する方式。[[収束型システム管理]]の放棄という対立軸を持ち、永続データ層とイテレーションレイテンシに代償が出る。 - [[スクリプタブルロードバランサー]](25 章) — Lua 等でリクエスト処理を書けるロードバランサー。宣言型設定とカスタム C 実装の中間解として、シャード対応ルーティング・無停止デプロイ・スロットリングを可能にする。 - [[サービスメッシュ]](26 章) — サイドカープロキシによるサービス間通信の抽象化。[[スクリプタブルロードバランサー]]と同一問題の集中/分散スペクトラムの両端をなす。 - [[表現線]](28 章) — Richard Cook の line of representation。運用者が直接触れられない実システムと、それを表す表示の間の境界。SRE の認知的作業を分析する概念装置。 - [[メンタルヘルスとインクルーシビティ]](29 章) — 燃え尽き(短期的ストレス反応)と精神疾患・神経発達障害(慢性的状態)を区別し、インクルージョンを組織の構造的責任として扱う枠組み。フルスタックインクルーシビティ(ライフサイクル 10 段階)。 - [[オンコール]](30 章) — 慣行そのものの正当性を論点化する concept。[[SRE Book]] 第 11 章(運用として最適化する立場)と本書 30 章(慣行自体を疑う立場)を、同一人物 [[Niall Murphy]] の視座転換として対比。 - [[コンウェイの法則]](31 章) — 組織のコミュニケーション構造がシステム構造に写像される法則。組織図とシステムフロー図の乖離が診断の出発点になる。 - [[SREと社会運動]](32 章) — SRE の計測・危機対応・フォローアップ管理のスキルと社会運動の組織化の類比。セントポール原則とインシデント管理原則の対応。 **主要な更新(90 件のうち、複数章から層状に積み増したもの)** - [[SRE組織変革]](更新) — 本書だけで 4 つの導入経路が並んだ。SoundCloud(専任→派遣の 2 段階失敗を経て分散適用)・Spotify(常駐→集中→分散の漸進的自己認識)・Facebook(独立組織+Embedded の PE)・Agilent(レガシー大企業への計画的トップダウン)。7 章のセルフサービス失敗と 10 章の OaaS の対比から、**成否を分ける変数は「権限を外した後の代替設計の有無」**であることを特定。 - [[DevOps]](更新) — 11 章により「class SRE implements DevOps」(実装としての階層関係)とは**逆向き**の軸を追加(Gene Kim 自身が「DevOps パターンの多くは Google の SRE が先駆者」と認める証言)。12 章により、**用語としての先後(DevOps が先、6 年差)と実践としての先後(SRE が先)が逆方向**であることを整理。22 章の DevOps 起源年(2003〜2007 年)が既存 2 ソース(2008 年 BoF・2009 年 devopsdays)と食い違う点は `> [!contradiction]` で両論併記。 - [[カーゴカルトSRE]](更新) — 3 章の「名前だけの SRE」批判(原書 2018 年、Gerro Wadat 2023 や『SREをはじめよう』2024 に先行)、6 章の 2 段階失敗、23 章のアンチパターン 1/18 という対の名前を追加。 - [[サービスレベル目標]](更新) — 21 章の SLA(外部複数当事者)/SLO(内部単独当事者)の区別、9 章の日次可用性計算(21 章の 3 方式のどれに当たるか)、5 章の「ベンダー SLA 交渉に自社 SLI/SLO を持ち込む」戦術、15 章の「SLA の帰結モデルは不可逆なプライバシー障害に適用不可」を追加。9・21・5 章の監訳注が三重に一致することも確認。 - [[心理的安全性]](更新) — 27 章の 6 構造的要因、23 章の「寄与要因」語彙(Anatomy of an Incident より早い用例)、32 章のセントポール原則が異なる領域から同型の結論(役割明確化が混沌時の集中を可能にする)に至る点を追加。 - [[オンコールストレス管理]](更新) — 27 章の緩和策(6 人以上のローテーション・代休・シフト単位報酬・訓練)、29 章の EEOC 不可欠職務 3 要因/オプトイン方式、30 章がそれら全体を「役に立つが優先度が低い対症療法」と格下げする第八の層を追加。 - [[トイル]](更新) — 6・10・15・16 章からの積み増しに加え、29 章の「**トイル削減をメンタルヘルス対策の万能薬としない**」という批判、10 章の「エンジニアリング破産」を追加。 - [[複雑システム障害論]](更新) — 28 章で**著者 Cook 自身が自著理論(1998)を「SRE の仕事全体を覆うには狭すぎる」と自己限定**。14 章の「複雑さは減らせずナビゲートすべき」と 31 章の「複雑さは昇進淘汰圧で恒常的に再生産される」が補完関係にあることを記録。 - [[収束型システム管理]](更新) — Burgess 2000 の収束理論に対し、24 章が「収束を諦め交換に切り替える」第 2 ソースとなり、**既存ページが未解決の問いで予告していた将来 ingest が実現**。 - [[Build Versus Buy]](更新) / [[ベンダーエンジニアリング]](更新) — 5 章(原書 2018)の build/buy/adopt 3 択と PrOpEx/AbEx 区分が Rick Clark の 2×2 マトリクスに先行し、また 2026 年ソース由来の[[ベンダーエンジニアリング]]と同じ実践を 8 年早く用語化せず記述していた歴史的先行関係を記録。 - [[人的要因]](更新) — 27 章(現象+緩和策)・28 章(キャリブレーション問題と JCS 理論による説明)・29 章(帰結と個人差の軸、責任の所在)が**三層構造**をなすことを記録。 - [[エラーバジェット]](更新) — 1 章で Coburn Watson が「コントロールベース寄り」の例として語る一方、SRE Book/SREcon16 の Jones は「プロポーショナル制御による自己統制」(コンテキスト寄り)として描く**視点差**を記録。 - **その他の更新** — [[SRE]] [[SRE文化]] [[SREの提唱]] [[SREの心構え]] [[SREエンゲージメントモデル]] [[組織の信頼性マインドセット]] [[プラットフォームエンジニアリング]] [[開発者生産性]] [[技術的負債]] [[ソシオテクニカル負債]] [[ソフトウェアライフサイクル]] [[オペラビリティ]] / [[インシデントメトリクス]] [[TTXメトリクス]] [[ポストモーテム]] [[根本原因分析]] [[インシデントシミュレーション]] [[インシデント認識論]] [[インシデントアナリスト]] [[Handover Communications]] [[GameDay]] [[アラート疲労]] [[アラートアンチパターン]] / [[カオスエンジニアリング]] [[ブラスト半径]] [[フォールトトレランス]] [[レジリエンスエンジニアリング]] [[Joint Activity]] [[トレードオフ意思決定]] [[自動化の皮肉]] [[自動化のアイロニー]] [[逸脱の正常化]] [[認知的徒弟制]] [[複雑ネットワーク]] [[レバレッジポイント]] / [[SLO目標値の選定]] [[意味のあるSLI設計]] [[イベントベースSLO]] [[ヒストグラムメトリクス]] / [[マイクロサービスアーキテクチャ]] [[サービス依存グラフ]] [[ゼロコード計装]] [[コンテナオーケストレーション]] [[Webロードバランシング]] [[マルチテナンシーのためのシャーディング]] [[待ち行列理論]] / [[データ耐久性]]関連の [[イレイジャーコーディング]] [[RAID]] [[ハードディスク信頼性]] [[Silent Data Corruption (SDC)検知]] [[分散ストレージ]] [[クォーラムベースレプリケーション]] [[単一リーダーレプリケーション]] [[セルフヒーリング]] [[データセンター信頼性]] [[データベース O&M]] [[スキーマ発展]] / [[制御ロールアウト]] [[カナリアテスト]] [[ヘルメティックビルド]] [[ライブアップグレード]] [[ソフトウェアエイジング]] [[変更起因インシデント]] [[ダッシュボードとランブックの運用]] / [[AIOps]] [[教師あり学習]] [[教師なし学習]] [[強化学習]] [[決定木]] [[勾配降下法]] [[誤差逆伝播法]] [[損失関数]] [[学習問題設定の分類]] [[異常検知]] [[障害予測]] / [[差分プライバシー]] [[データのプライバシーと同意]]。 ### 2026-08-14 ingest-book | Incident Metrics in SRE(O'Reilly 2021、単章レポート・再取り込み) - [[インシデントメトリクス]](更新) — MTTR の統計的問題に具体的な数値(38%/40%/20%、49%/50%/64%、19%/23%/10%)を補い、代替統計(中央値・95 パーセンタイル・幾何平均・合計)がいずれも解決しないこと、MTTx が機能する例外条件(Backblaze の HDD 統計・劇的な変化)を追記。横断的知見に「3 つの処方箋は指標を増やす/統合する/検定するという異なる層にある」「代替統計を系統的に潰したのは Davidovič だけ」「企業規模による解決も否定されている」の 3 件、未解決の問いに「エラーバジェットによる一元的処方は統計的批判を免れるか」を追加。 - [[TTXメトリクス]](更新) — SRE Kaigi 2025 発表由来の「49%・50%・64%」の条件が一次ソースと食い違う点を `> [!contradiction]` callout で明示。Google データの規模記述を一次ソースの記述(「先の検定で用いた 1,000 件より多い」)に合わせて訂正。横断的知見に「フェーズ分解は Davidovič の処方の一部にすぎず、ユーザースタディと並置されている」「TTX に分解しても統計的問題そのものは残る」の 2 件を追加。 - [[統計的有意性]](更新) — 単一ソース状態から脱し、横断的知見に「閾値の締め上げ(P<0.005 提案)と緩め(α = .10)が正反対の方向から『αは問題の中心ではない』という同じ帰結を指す」「正規性の前提をシミュレーションで事前検査する実務手順」の 2 件を追加。 ### 2026-08-13 ingest-paper | Redefine Statistical Significance(Nature Human Behaviour 2017) - [[統計的有意性]](新規) — 帰無仮説有意性検定におけるP値閾値の定義と、P値・ベイズ因子・偽陽性率の関係を扱うconcept。本vaultでは初の統計学・研究方法論ドメインのconceptであり、単一ソースからの初出のため横断的知見はまだ薄いが、今後の統計・再現性関連論文の取り込みで育てる土台として作成した。 ### 2026-08-13 ingest-paper | NVMM-Oriented Hierarchical Persistent Client Caching for Lustre(ACM ToS 2021) - [[永続クライアントキャッシュ]](新規) — 並列ファイルシステムのクライアントノードに高速永続ストレージ(SSD/NVMM)をキャッシュとして組み込む設計。永続性・統一名前空間・データ一貫性の3要件と、RW/ROの2キャッシュモードを定義。 - [[並列ファイルシステム]](更新) — 「クライアントメタデータライトバックキャッシュは将来の方向性」という既存記述に対し、データ面でのクライアント側永続キャッシュは既に2021年時点で本番指向の実装まで到達していたという横断的知見を追記。 - [[ローカルファイルシステム実装比較]](更新) — NOVA/PMFS/EXT4-DAXというNVMM向けローカルファイルシステム群を新セクションとして追加。ブロックデバイス向け最適化(ジャーナリング・COW)とNVMM向け最適化(DAXバイパス・ログ構造)という異なる系統でも「クラッシュ整合性の確保」という共通目的を持つという横断的知見を追記。 ### 2026-08-13 ingest-paper | The Tail at Scale(CACM 2013) - [[テールレイテンシ耐性技術]](新規) — ヘッジリクエスト・タイドリクエスト・カナリアリクエスト・マイクロパーティション等、tail-tolerant 技術群を集約。フォールトトレランスとのアナロジーで定義。(concept / distributed / latency) - [[レイテンシ分析]](更新) — DDIA が間接引用していたテールレイテンシ増幅の定量的根拠を原典から直接確認し、ファンアウト数×外れ値頻度の定量モデルを追記。 - [[フォールトトレランス]](更新) — tail-tolerant 技術を6アクション(検知・診断・封じ込め・マスキング・補償・修復)の枠組みに照らし、「補償・マスキング」のレイテンシ版として位置づける横断的知見を追記。 ### 2026-08-11 ingest-book | AI Systems Performance Engineering(全20章+Appendix) - [[Mechanical Sympathy]](新規) — ハードウェア特性を理解した上でソフトウェアを設計するという書籍全体の中心思想(第1章)。 - [[Goodput]](新規) — 有効スループット指標。DeepSeekのDualPipe最適化事例で導入(第1章)。 - [[NVLink]](新規) — GPU間高帯域相互接続。GB200 NVL72の中核技術(第2章)。 - [[NUMA対応CPUピニング]](新規) — CPU-GPUトポロジを意識したプロセス配置手法(第3章)。 - [[GPU多重化(MPS・MIG)]](新規) — GPU共有・分割実行の2方式(第3章)。 - [[GPU占有率(Occupancy)]](新規) — SM上のアクティブwarp比率とレイテンシ隠蔽の関係(第6・8章)。 - [[メモリコアレッシング]](新規) — グローバルメモリアクセスパターンの最適化(第7章)。 - [[共有メモリバンクコンフリクト]](新規) — 共有メモリアクセスの競合回避(第7章)。 - [[Warp Divergence]](新規) — warp内分岐による実行効率低下(第8章)。 - [[Instruction-Level Parallelism (GPU)]](新規) — GPUカーネル内の命令レベル並列性(第8章)。 - [[Occupancy (GPU)]](新規) — GPU占有率の英語別ページ(第8章、既存の[[GPU占有率(Occupancy)]]と関連)。 - [[Warp Specialization]](新規) — warpごとに異なる役割を割り当てるカーネル設計(第10章)。 - [[Thread Block Cluster]](新規) — 複数SM間のオンチップデータ共有機構(第10章)。 - [[Persistent Kernel]](新規) — カーネル再起動を避け常駐実行させる設計(第10章)。 - [[CUDA Stream]](新規) — カーネル間・ホスト-デバイス間の非同期実行制御(第11章)。 - [[Programmatic Dependent Launch]](新規) — カーネル間の依存関係を明示する起動機構(第11章)。 - [[Dynamic Parallelism]](新規) — デバイス側からのカーネル起動によるホスト往復排除(第12章)。 - [[torch.compile]](新規) — PyTorchのJITコンパイル機構(第14章)。 - [[動的バッチングと継続的バッチング]](新規) — 推論サービングのリクエストバッチング手法(第16章)。 - [[動的精度切り替え]](新規) — GPUメモリ圧に応じた実行時KVキャッシュ量子化切り替え(第19章)。 - [[カーネルオートチューニング]](新規) — Tritonの`@triton.autotune`等によるカーネル構成の自動探索(第14章)。 - [[Rooflineモデル]]・[[GPU起動型ネットワーキング]]・[[RDMA]]・[[GPUストレージIOデータパス]]・[[CUDA]]・[[CUDAGraph]]・[[カーネルフュージョン]]・[[混合精度訓練]]・[[量子化]]・[[並列化戦略]]・[[Mixture-of-Experts]]・[[Prefill-Decode分離]]・[[Speculative Decoding]]・[[KVキャッシュ管理]]・[[メモリ階層とキャッシュ]]・[[LLM駆動GPUカーネル生成]](更新) — 全20章+Appendixの実測事例・技法を既存の横断的知見に追記(既存concept)。 ### 2026-08-11 ingest-book | 実践的パフォーマンスエンジニアリングによるAI高速化(全8章) - [[量子化]](新規) — 重み・活性値を低ビット数値形式へ変換しメモリ・演算量を削減する技法。混合精度量子化・量子化パラメータ・QAT/PTQ・混合精度学習を整理(第3章)。第8章(自動運転AI推論のエッジデプロイ)の実測から、演算律速では量子化が最も効く(処理時間12.0%短縮)という横断的知見を追加。 - [[枝刈り]](新規) — 重みのうち寄与の小さい部分を除去する技法。非構造化/構造化枝刈り・NVIDIA Ampere 2:4疎性を整理(第3章)。第8章の実測から、メモリ律速下では効果が限定的(1.3%短縮)という条件依存性を横断的知見に追加、[[量子化]]との対比を記録。 - [[パフォーマンスエンジニアリング]](新規) — ISO/IEC 25010の性能効率性をプロダクトライフサイクル全体で継続的に保証する全体最適の実践として定義(第1章)。 - [[アムダールの法則]](新規) — 並列化対象を絞り込むための計測の基本戦略として整理(第2章)。 - [[Rooflineモデル]]・[[FlashAttention]]・[[Speculative Decoding]]・[[並列化戦略]]・[[GPU観測性]](更新) — 第2〜4章の実測事例を既存の横断的知見に追記(既存concept)。 ### 2026-08-11 ingest-book | SRE Book(第 2・8・9 章) - [[ヘルメティックビルド]](新規) — ビルド環境から独立し既知バージョンのツール・依存のみで成果物を再現する自己完結ビルド方式。[[Rapid]]・[[Blaze]] の設計原則。 - [[本質的複雑性と偶発的複雑性]](新規) — Brooks の区別。SRE は偶発的複雑性の持ち込みに抵抗し継続的に除去する。 - [[分散コンセンサス]](更新) — [[Chubby]] の Paxos + マスタ選出の 2 層構成を Raft 論文と突き合わせた横断的知見を追記。 ### 2026-08-11 ingest-paper | Gandalf: An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure - [[変更起因インシデント]](更新) — Gandalf のイベント相関ベースの犯人特定(vote-veto → 空間・時間相関 → 時間減衰)を CAS のメトリクス統計比較と対比。コンポーネントオンボーディング時のデータスキーマ強制がモニター未設定問題(46.2%)への先回り対処である点を追記。未解決の問いに、進行中ロールアウト前提の相関分析手法と完了済み変更対応の RCCA 系手法の使い分け指針を追加。 - [[カナリアテスト]](更新) — Gandalf の「n 対 1 の犯人特定」問題設定を CanaryAdvisor・CAS の「1対1のペア比較」と対比する横断的知見を追記。 ### 2026-08-09 ingest-paper | Agentic Coding in the Wild: Characterizing GitHub Copilot at Production Scale - [[エージェント型コーディング]](更新) — 本番トレース(GitHub Copilot、1,350万セッション)の 6 ワークフローアーキタイプ(Deep-loop read・LLM-only・Multi-cycle edit 等)が SWE-bench/CursorBench 系ベンチマークの単一スカラー評価とは異なる多様性を示すこと、「訓練-テスト環境の一致」原則がサービング基盤設計にも同型に適用されるべきという知見を追記。未解決の問いに、本番ワークフロー分布と RL 訓練データ分布のずれを追加。 - [[KVキャッシュ管理]](更新) — ターン境界・モデル切替・コンテキスト圧縮という 3 つの構造イベント別のキャッシュ劣化定量値(-26%/-67%/-66.1%)、ターン間アイドル時間分布と Aliyun トレースの短命 KV ブロック寿命との対応、ユーザーアーキタイプ間 50 倍のキャッシュミスコスト格差を追記。 ### 2026-08-06 query + ingest-paper | NIC 光モジュールのモニタリング(MRC+SRv6 / TPUv4 / FT-HSDP) - [[光回線交換]](新規) — 光信号を電気変換せずミラーで方路切替する回線交換方式。TPUv4 が 48 台の OCS で 6,144 本の光 ICI リンクをキューブ単位に動的再構成し、ホスト可用性要件を 99.9% から 99% へ緩和する事例を核に定義。 - [[RDMAネットワーク監視]](更新) — 「NIC 側光モジュールは計装点 4 層のどこにも救われない最後の物理単一障害点であり、これが予防型検知の必要性を非対称に高める」「SRv6 の静的経路は能動プロービングに経路の曖昧性ゼロという新しい実装選択肢を加える」の 2 知見を追記。未解決の問いに、耐性機構が物理劣化を隠す構図、NIC 側光設計による緩和、「検知して直す」対「トポロジで迂回する」の分岐を追加。 - [[MRC]] / [[SRv6]] / [[マルチプレーンClosトポロジ]](更新) — 光トランシーバのグリッチをトランスポート層の耐性で吸収する実測と、その限界(NIC 側は吸収不能)を追記。 - [[AIデータセンタートポロジ]] / [[データセンターネットワーク信頼性]](更新) — OCS ベースの再構成可能トポロジと、光 ICI ケーブルの日次故障率 0.005% を追記。 - [[耐障害LLM訓練]](更新) — 32K GPU の障害内訳(`Network Switch/Cable` 5.3%、有効訓練時間 95〜97%)と Llama 3 世代との対比を追記。 ### 2026-08-04 ingest-paper | Bifrost: Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis - [[ログベース障害診断]](更新) — 「診断モデルの設計」対「ログ表現そのものの事前学習目的設計」という、より上流の設計軸を追記。対照学習の多目的同時最適化が引き起こす fallibility jitter という固有の不安定性と、共有アンカー(CARL)による緩和策も追加。 ### 2026-08-04 ingest-paper | SPPO: Making Million-Token LLM Training Practical on Modest GPU Clusters - [[アクティベーションオフロード]](新規) — 逆伝播に必要な中間活性化を CPU メモリへ一時退避し必要時に再ロードすることで GPU メモリ消費を削減する手法。SPPO を起点に、粒度ミスマッチ(系列全体単位のオフロードが転送を粗くする)・部分系列単位の適応的オフロード比率(sequence-aware offloading)・アクセス頻度に応じた2レベル活性化管理を集約。 - [[パイプライン並列化]](更新) — 長系列訓練でマイクロバッチ数が1に収束し1F1Bが素朴なスケジュールに退化する問題に対し、部分系列単位の多重化系列分割(multiplexing sequence partitioning)でバブル隣接部分のみシーケンス並列化を局所適用しバブルを埋める手法を横断的知見に追記。 - [[シーケンス並列化]](更新) — Korthikanti+ 2023 の恒常的シーケンス並列化(テンソル並列の穴を埋める通信最適化)に対し、SPPO がバブル隣接部分系列にのみ局所適用する「パイプラインスケジューリングの補助的道具」としての新しい適用パターンを追記。 - [[並列化戦略]](更新) — 並列化「次元」の配置最適化(MegaScale・SAKURAONE 等)に対し、系列を何個の部分系列に割るかという「分割粒度」自体を動的最適化するという新しい軸を SPPO から追記。 ### 2026-08-04 ingest-paper | What's in a GitHub Star? - [[GitHub スター]](新規) — GitHub リポジトリの人気度指標としてのスター機能。appreciation・bookmark・利用実績の複合シグナルという定義、組織所有優位・age無相関などの定量特性、Slow/Moderate/Fast/Viral の4成長パターンを集約。既存 wiki コーパス(AIOps/LLMインフラ中心)とは domain の異なる、実証的ソフトウェア工学の初の source として新設。 ### 2026-08-03 ingest | How to Do Great Work - [[偉大な仕事の技法]](新規) — Paul Graham のエッセイを起点に、偉大な仕事をする技法の4ステップ(分野選択・フロンティア到達・ギャップ発見・探索)、「upwind に留まる」戦略、モラールの複利的サイクル、好奇心駆動のオリジナリティ論を集約。既存の [[好奇心駆動学習]](強化学習の内発報酬)とは文脈・粒度が異なる別概念として登録。 ### 2026-08-03 ingest-paper | PRIM: Meta-Learned Bayesian Root Cause Analysis - [[因果推論ベースRCA]](更新) — ベイズ的因果メタ学習(prior-fitted networks / MACE transformer neural process)によるテスト時因果探索・統計検定の完全排除という第三の設計軸として PRIM を追記。大規模グラフでの一定推論時間(17ms)と Recall@1 でのトレードオフ、識別可能性理論の統一的再定式化を横断的知見に追加。 - [[アモータイズド因果発見]](更新) — 「グラフ $G$ 自体を予測する」系譜に対し、下流タスク出力(根本原因集合 $T$)を直接予測する PRIM を新系譜として追加。識別可能性要件の緩和とグラフ復元系との比較という未解決の問いを追記。 ### 2026-08-03 ingest-paper | Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought - [[LLMによる根本原因分析]](更新) — トレースグラフのトポロジに沿ったスパン単位の文脈分解(RCLAgent)を「LLM の文脈爆発対策」の第4の軸として追記。Global Evidence Graph 除去アブレーション(平均MRR 69.73%→56.90%)、既存 entity [[RCLAgent]] の記述と原論文の食い違いの発見、バックボーン依存性の知見を追加。 - [[マルチエージェント協調]](更新) — トレースグラフの構造自体を協調トポロジとして流用する「グラフ同型な役割分担」を、mABC の機能軸役割分担・Comfey の履歴軸ルーティングと並ぶ第4の協調様式として追記。 ### 2026-08-03 ingest-paper | TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices - [[仮説駆動RCA]](更新) — symptom-amplification bias(下流の増幅された症状を根本原因と誤認する固着)に対し、Hypothesis Planner に victim-as-cause 代替仮説の強制生成を課すという設計対策、および temporal precedence・path consistency・template consistency の 3 基準チェックリストによる仮説検証(JustDiag の主張レベル裁定と同型)を横断的知見に追記。アブレーションで検証ステップの除去が最大の性能低下(AC@1 で 15〜16pt)をもたらすという定量結果も追記。 ### 2026-08-03 ingest-paper | TuxBot: Semantic-Aware Online OS Tuning with Large Language Models - [[OSノブチューニング]](新規) — スケジューラ・電力・メモリ・I/O にまたがる OS 実行時制御ノブを稼働中アプリケーション性能改善のために調整するオンライン制御ループ。TuxBot(LLM を意味論的推論器とする dual-loop 制御・セッション横断メモリ・型付き検証済みアクチュエーション)を起点に導入。 - [[データベースノブチューニング]](更新) — OS ノブと DB ノブが「独立変数として扱うと破綻する」という同型の失敗構造を共有すること、両ドメインとも LLM を候補設定の意味論的推論器として使う方向に収束しつつあることを横断的知見に追記。 ### 2026-08-03 ingest-paper | Cloud Performance Decomposition for Long-Term Performance Engineering - [[時系列分解]](新規) — クラウド性能トレースをトレンド・季節サイクル・ノイズに分離する統計手法。STL の単一季節成分限界と、ハイブリッド/手動 vs. EEMD 自動の予測精度 vs. 断続性保持のトレードオフを起点に導入。 - [[異常検知]](更新) — Twitter・Meta の STL 前処理利用が単一季節成分しか分離できない限界を持つことを、複数周期の明示的分離という [[時系列分解]] の観点から追記。 ### 2026-08-03 ingest-paper | Enabling Performant and Flexible Model-Internal Observability for LLM Inference - [[モデル内部可観測性]](新規) — LLM推論の内部状態(残差ストリーム・注意パターン・MLP活性化等)を実行時に取得・分析可能にするシステム上の性質。DMI-Lib(HookPoint + Ring2 + Data Exporter)を起点に、可観測性を推論の補助機能ではなく独自の性能制約を持つ第一級プリミティブとして定式化する視点を導入。 - [[機構的解釈性]](更新) — 解析専用実装(TransformerLens等)から本番推論パスでの直接観測(DMI-Lib)へ移行する方向性を、Qwen3-0.6BでのDuplicate Token/attention-sinkパターンの単一パス同定を根拠に追記。 - [[Speculative Decoding]](更新) — EAGLE-3の内部特徴活用を可観測性システムの動機付けユースケースとして分析。vLLM 0.17.0のEAGLE-3向け補助隠れ状態公開機能がprefill限定・投機的デコーディング専用結合である実装制約を追記し、「内部状態の活用」と「汎用可観測性」が独立した設計軸であることを整理。 ### 2026-07-31 性能測定道 事始め編 (JPUG 第27回) ingest-slides - [[性能測定]](新規) — 性能測定をモデル化・計測・シミュレーションの3つの基本形に分解し、互いに検証し合う関係として捉える方法論。HDDシーケンシャルリードのモデル化、待ち行列理論M/M/1によるOLTPシステムのモデル化、I/O REPLAYによるシミュレーションを実例に導入。 ### 2026-07-31 Optimizing Deployment Configurations for LLM Inference (MLSys 2026 Industry Track) ingest-paper - [[LLM推論設計空間探索]](新規) — モデル・ハードウェア・並列化・ランタイム構成が数百万規模に達する LLM 推論デプロイメントの設計空間を、実測ベンチマーク駆動の軽量シミュレータ(実機比±5%精度)で体系的に探索する手法。Meta の月間10億ユーザー規模の本番運用実測を起点に導入。組合せ爆発の規模感、継続的バッチング/分離推論でQPS算出式が異なる点、探索空間刈り込み、投機的デコード/MoEルーティングの動的モデル化を横断的知見として集約。 - [[Prefill-Decode分離]](更新) — Meta の本番実測で、オンライン推論では分離が継続的バッチング比1.5〜2.2倍のQPSを達成する一方、オフラインでは差が消失するという SLO 有無による有効性の反転を追記。フェーズ別並列化の独立性という KV 転送コストとは別の分離の便益、約30%容量削減という本番移行の定量値も追加。 - [[並列化戦略]](更新) — 推論では Prefill/Decode でフェーズごとに最適並列化次数が体系的に異なる(Prefill=PP4-TP2、Decode=TP8+大バッチ)という本番実測を追記。異種ハードウェアへのフェーズ割当が並列化戦略の意思決定と不可分であること(TCO 15〜25%改善)も追加。 - [[Mixture-of-Experts]](更新) — Expert Parallelism が MoE のスケールアウトを効率化する本番規模の定量実証(iso-parameter比較でDense比EP併用が+16%、Llama 4 Maverickの128エキスパートでTP4DP4-TP4EP4がTP8比+45%)を追記。密モデルはスケールアップ必須だがMoEはスケールアウトでも良好にスケールする1.8T規模の実証、エキスパート負荷予測モデル間の最大3.5倍コスト差も追加。 ### 2026-07-31 HiSparse: Turbocharging Sparse Attention with Hierarchical Memory ingest - [[スパース注意]](新規) — top-k 選択で KV キャッシュの一部のみに注意を向ける手法。計算量削減とは裏腹にフルコンテキストの KV キャッシュを GPU HBM に保持し続ける必要があり capacity-bound になりやすいという課題を軸に導入。HiSparse(ホストメモリ退避 + hot device buffer による階層メモリ設計)を起点とする。 - [[KVキャッシュ管理]](更新) — スパース注意は容量削減ではなく容量ボトルネックの再配置であり、既存のホストメモリ階層退避の設計思想がそのまま適用できるという横断的知見を追記。 ### 2026-07-31 AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization ingest-paper - [[LLMによるカーネル最適化]](新規) — LLM エージェントが探索・生成・評価のループを自律的に回してアクセラレータカーネルを改善する研究領域。AccelOpt(ビームサーチ+自己改善メモリ、AWS Trainium 対象)を起点に導入。同時期に取り込まれた「LLM駆動GPUカーネル生成」(FlashInfer-Bench 起点、GPU の Triton/CUDA パイプライン特化)と姉妹概念として相互参照。 - [[エージェントメモリ]](更新) — AccelOpt の最適化メモリ(正・負の書き換えをバランスさせる設計、容量 ExpN と更新積極性 TopK のコスト効率トレードオフ)を、コード最適化ドメインに特有のテスト時学習の一形態として追記。 - [[AIアクセラレータ]](更新) — AWS Trainium を新規追加。「新興アクセラレータのソフトウェア成熟度不足はカーネル最適化知識の欠如にまで及ぶ」という観察に対し、AccelOpt が LLM でその知識ギャップを埋める解決軸を提示することを追記。 ### 2026-07-31 FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems ingest-paper - [[LLM駆動GPUカーネル生成]](新規) — LLM エージェントによる GPU カーネル自律生成・検証・実運用統合の概念。FlashInfer-Bench(標準スキーマ FlashInfer Trace・堅牢ベンチマーク・動的置換 apply())を起点に導入。コンパイル失敗が正しさエラーの大半を占めること、Triton/CUDA の正しさ・性能トレードオフ、エージェントによるライブラリ呼び出し学習、反復改良と独立サンプリングの言語依存的優劣を横断的知見として集約。 - [[GPU最適化]](更新) — LLM エージェントが人間の GPU 最適化技術カタログのうちどの技術に自動的に到達できているか(Triton のコンパイラ任せ最適化)、どの技術が依然として人間の介入を要するか(CUDA での手動メモリ管理・命令選択)を対比する横断的知見を追記。 ### 2026-07-30 LEANN: A Low-Storage Vector Index ingest-paper - [[ベクトル検索インデックス]](新規) — ベクトル検索のANNSインデックス(埋め込み+グラフメタデータ)のストレージ効率化を扱う概念。LEANN(オンザフライ再計算+高次数保存グラフ枝刈り)を起点に導入。 - [[LLM向け情報検索]](更新) — LEANNの「生成がレイテンシの99.8%を支配し検索は0.24%」という実測を、LLM向けIRの目的関数転換(検索順位→生成への因果的効用)を物理層(ストレージ・レイテンシ予算)から補強する事例として追記。 - [[エージェントメモリ]](更新) — LEANNの「頻繁にアクセスされる要素を厚く保持し稀な要素は再計算する」設計原理を、エージェントメモリの忘却機構(時間減衰・重要度ベース)と構造的に同型のトレードオフとして横断的知見に追記。 ### 2026-07-30 クラウド系の国際会議IEEE CLOUD 2020参加録 ingest - [[AIOps]](更新) — 2020年時点の国際会議観測(IEEE CLOUD 2020参加報告)として、「研究の理論的洗練 vs 実務のルールベース運用継続」というギャップが LLM-era 以前から一貫して存在していたことを示す横断的知見を追記。 ### 2026-07-30 Beyond the Buzz: A Pragmatic Take on Inference Disaggregation (MLSys 2026 Oral) ingest-paper - [[Prefill-Decode分離]](更新) — NVIDIA の数十万設計点シミュレーションにより、disaggregation の有効性がモデルアーキテクチャ・サイズ・トラフィックパターンの3軸で条件付けられることを定量化。MLA vs. GQA による co-location chunking オーバーヘッドの違い、整数計画的レートマッチングアルゴリズムを追記。 ### 2026-07-29 wiki/concepts リファクタリング - [[メタ安定障害]] — `Metastable Failure` を統合。HotOS 2021・Lambda・SREGym・Cook の出典と、潜在的障害論との横断的知見を同期。 - [[パイプライン並列化]] — `パイプライン並列` を統合。GPipe・ReCycle の訓練知見と DynaPipe の推論時動的層再配分を同一概念へ集約。 ### 2026-07-27 Understanding Performance of eBPF Maps (eBPF '24) ingest-paper - [[eBPFマップ]](新規) — array・hash・per-cpu変種・ring/perf buffer・queue/stack の性能特性。メモリフットプリントとキャッシュホット性が主要因、per-cpu hash のゼロ初期化増幅。 - [[eBPF]](更新) — eBPFマップ自体の性能特性(メモリフットプリント・キャッシュホット性依存、「volume discount」特性)を追記し、本wikiが観察してきた「情報を最上流で絞る」設計指針への実装レベルの根拠として位置づけた。 - [[Linuxカーネルインタフェース]](更新) — eBPF マップの「大規模転送」性質を ring buffer/perf buffer 間の実測比較で具体化し、未解決の問いを更新。 ### 2026-07-27 Robust Multimodal Failure Detection for Microservice Systems (KDD 2023) ingest-paper - [[マルチモーダル障害診断]](更新) — AnoFusion(GTN+GAT による GNN ベースマルチモーダル融合)を、TVDiag・UniDiag 等の「診断(RCL/FTI)」研究に先立つ「検知(binary)」研究として系譜に追加。SCWarn との直接比較によるトレース追加の定量効果を追記。 ### 2026-07-22 Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI ingest - [[テンソルコア]](更新) — Rubin の K 次元テンソルコアスループット倍増・指数関数スループット向上を横断的知見に追記。 - [[Mixture-of-Experts]](更新) — Rubin の TMA インライン・ディスクリプタ更新による MoE 重み移動のハードウェア co-design を追記。 - [[KVキャッシュ管理]](更新) — Rubin HBM4(288GB)によるオフロード不要化の可能性を追記。 - [[集合通信]](更新) — Rubin NVLink counted writes と Speed-of-Light 研究の対比を追記。 - [[AIデータセンタートポロジ]](更新) — Vera Rubin NVL72 の電力 co-design(Intelligent Power Smoothing・DSX MaxLPS)を追記。 - [[カーネルフュージョン]](更新) — Rubin のタイルレベル・カーネル間トリガリングをフュージョンの代替解として追記。 ### 2026-07-22 LLM Agents for AIOps in Kubernetes ingest-paper - [[AIOps]](更新) — Red Hat OpenShift 上の 10 モデル横断 ReAct エージェント比較(精度×レイテンシ×トークン消費量の 3 軸)、MLASP の reactive 統合に関する横断的知見・未解決の問いを追記。 - [[agentic SRE]](更新) — 統制実験によるモデル比較知見とメモリが正確性を悪化させる実証例を横断的知見に追記。 - [[ReAct]](更新) — 産業実装での多モデル横断比較(Mixtral 8x22B を除く全モデルが ReAct 原則に従うが AR 精度は 0〜100% に分散)、メモリ付与による正確性悪化の知見を追記。 - [[LLM評価]](更新) — ツール利用エージェント評価における精度×レイテンシ×トークン消費量の 3 軸評価とモデルファミリー間の verbosity 差を横断的知見に追記。 - [[エージェントメモリ]](更新) — メモリが「改善」でなく「悪化」させる産業実証例(時間的再計算タスク)を横断的知見に追記。学術知見(メモリ追加=改善)との対比を記録。 ### 2026-07-21 BTrDB ingest-paper - [[時系列データベース]](更新) — [[BTrDB]](FAST '16)を追加し、ストレージ構造そのものをインデックス化する設計(Monarch の FHI・ByteSeries の Compressed Inverted Index との対比)、統計サマリの無償埋め込み(Lindorm TSDB の別演算スケジュール方式との対比)、copy-on-write による厳密な整合性保証(Monarch/Gorilla の可用性優先路線との対比)、ComputeDiff による派生データ一貫性の第7の軸、ナノ秒精度向け delta-delta+Huffman 圧縮(Gorilla のデルタ・オブ・デルタ圧縮との対比)を横断的知見に追記。 ### 2026-07-21 Tales from the Lunar Module Guidance Computer ingest - [[優先度駆動リアルタイム実行系]](新規) — 可変長ジョブに優先度を与えプリエンプティブに実行するリアルタイムOS方式(Executive/Waitlist)。ボックスカー式executiveとの対比を定義。[[@2004__AAS__Tales from the Lunar Module Guidance Computer]]を軸に記録。(real-time-systems / scheduling / fault-tolerance) - [[リスタート保護]](新規) — waypointによるチェックポイントでリスタート時にジョブを直近waypointから再開する設計。TLOSSによる資源枯渇の自己修復効果を横断的知見に記録。(fault-tolerance / idempotency / checkpointing) - [[インターフェース仕様の齟齬による障害]](新規) — ICDのような接続仕様が制約の一部だけを記述し統合時に予期しない相互作用を招く障害クラス。「コンピュータエラー」という表層的帰属への異議を定義。(root-cause-analysis / postmortem / fault-tolerance) - [[制御ループの安定性とタイムラグ補償]](新規) — フィードバック制御のアクチュエータ応答遅延補償の精度が系の安定性を左右する設計課題。throttle castellation 事例を定義。(control-systems / fault-tolerance / apollo) - [[べき等性]](更新) — 手作業waypoint方式(Apollo)による静的コード規約でのべき等性確保を横断的知見に追記。 - [[チェックポイント]](更新) — 手作業waypoint方式がシステムレベル最適化以前の保存範囲選別の原型であるという横断的知見を追記。 - [[根本原因分析]](更新) — Apollo 11の「コンピュータエラー」表層帰属への異議が現代AIOps以前の実例であるという横断的知見を追記。 - [[ポストモーテム]](更新) — 単一原因ラベルへの異議がSRE文化としての「根本原因」用語否定に半世紀先行する当事者実践であるという横断的知見を追記。 ### 2026-07-20 Managing Memory + Grouped Aggregation (DiDi #03) リンク切れ修正 - [[アウトオブコア処理]](新規) — [[DuckDB]]のメモリ階層・統一メモリ管理(非ページ/ページ/ベーステーブルバッファリング)・スピリング/アンピン/エビクションを定義。[[@2026__DiDi__Managing Memory + Grouped Aggregation]]を軸に、ページ化中間データのポインタ付け替え機構を記録。(database / memory-management) - [[ハッシュベースグループ集約]](新規) — `HASH_GROUP_BY`によるハッシュテーブル構築・線形プロービング・`PERFECT_HASH_GROUP_BY`、および外部グループ集約の2フェーズ設計(スレッドローカル事前集約→パーティション単位集約)を定義。[[@2026__DiDi__Managing Memory + Grouped Aggregation]]を軸に記録。(database / query-execution) ### 2026-07-20 Sorting Large Tables (DiDi #04) ingest-slides - [[外部マージソート]](新規) — [[DuckDB]]の二相マージソート戦略(フェーズ➊スレッドローカルソート、フェーズ➋T-wayマージ)を定義。[[@2026__DiDi__Sorting Large Tables]]を軸に、主記憶を超えるテーブルへのディスクスピル設計を記録。(database / sorting) - [[キー正規化]](新規) — 型ディスパッチ・NULL処理・辞書式順序を単一の`<`比較に置き換える固定長キー(`FixedSortKey`)設計を定義。[[@2026__DiDi__Sorting Large Tables]]を軸に、`create_sort_key()`によるユーザレベル公開を記録。(database / sorting) ### 2026-07-20 FailSafe ingest-paper - [[耐障害LLMサービング]](新規) — テンソル並列 LLM サービングにおける GPU 障害後の「復旧オーバーヘッド」と「持続的な計算・メモリ不均衡」を区別する概念。[[@2025__arXiv__FailSafe - High-performance Resilient Serving]] を軸に、同じ Stanford チームが[[耐障害LLM訓練]]の ReCycle からサービングへ焦点を移した経緯を横断的知見として記録。(distributed / machine-learning / fault-tolerance) - [[テンソル並列]](更新) — 不規則な GPU 数でのアテンションヘッド単位の不均衡と、Cyclic KVCache Placement・Hybrid Attention による prefill/decode 段階別の緩和効果を横断的知見に追記。 - [[KVキャッシュ管理]](更新) — ホストメモリ退避が「再利用キャッシュ」と「障害復旧バックアップ」の二重目的で使われる観察、および KVCache 配置が耐障害性の観点からも設計対象になるという知見を追記。 - [[耐障害LLM訓練]](更新) — 同一著者チーム(Gandhi・Kozyrakis)による ReCycle(訓練)と FailSafe(サービング)の設計思想対比を横断的知見に追記。 ### 2026-07-18 OpsMem ingest-paper - [[エージェントメモリ]](更新) — OpsMem の STM/LTM グラフメモリを代表的システム表に追加し、cross-memory resonance を「検索のトリガー条件」という新しい軸として横断的知見に追記。 - [[仮説駆動RCA]](更新) — OpsMem の STM(belief-state グラフ、GoS 由来)と LTM(運用経験)の結合を、仮説保持・検証の拠り所という観点で横断的知見に追記。 - [[LLMによる根本原因分析]](更新) — 静的 RAG(VectorRAG/GraphRAG/LinearRAG)から状態条件付き動的検索(CMR)への移行、および LTM consolidation による「経験蒸留器」という新しい LLM 役割分化を横断的知見に追記。 ### 2026-07-18 MLCommons Chakra ingest-paper - [[実行トレース]](新規) — 分散AI/MLワークロードの計算・メモリ・通信操作と依存関係を記録するグラフベース標準表現。[[MLCommons Chakra]]を軸に定義。(distributed / benchmarking) - [[Prefill-Decode分離]](更新) — Chakraのtrace-basedによるvLLM PD分離構成のper-layer KV転送レイテンシ実測(Send/Recv非対称性)を横断的知見に追記。 - [[KVキャッシュ管理]](更新) — Chakraによる標準トレースを使ったKVキャッシュオフロードコストのベンダー非依存な定量化を横断的知見に追記。 ### 2026-07-15 Scalable and Energy-Efficient AI ingest-paper - [[GPUエネルギー効率]](新規) — TFLOPs/kW・tokens-per-kilojouleで表される「計算-エネルギー不整合(compute-energy misalignment)」を軸とする概念。[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]](訓練)と[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]](推論)を突き合わせ、スループット優位とエネルギー効率優位が独立であることを横断的知見として記録。(gpu / energy / llm / aiinfra) ### 2026-07-15 Speculations Concerning the First Ultraintelligent Machine ingest-paper - [[知能爆発]](更新) — 提唱者 [[I. J. Good]] の一次論文([[@1965__AdvComput__Speculations Concerning the First Ultraintelligent Machine]])を追加し、Good(概念の定式化)と Yudkowsky(機構の定式化)の40年以上を隔てた役割分担を横断的知見に追記。 - [[Recursive Self-Improvement]](更新) — 概念の起源となった1965年原論文を出典に追加。 ### 2026-07-14 言語モデルの内部機序:解析と解釈 ingest-slides - [[SAE]](新規) — Sparse Autoencoderによる辞書学習。ゴールデンゲートブリッジ特徴とfeature absorptionの限界を扱う。(machine-learning / llm / interpretability) - [[活性化パッチング]](新規) — Activation Patchingによる因果的介入。時間軸方向操作・拒否方向操作等の実例を集約。(machine-learning / llm / interpretability) - [[言語モデルのプロービング]](新規) — 教師ありプローブによる内部表現の解析。構文木・地理座標・数値属性の実例を集約。(machine-learning / llm / interpretability) - [[機構的解釈性]](更新) — 4手法群(注意パターン観察・語彙空間射影・出力影響度測定・Circuit Analysis)の全体像と、「局所性・一対一対応」前提への懐疑を追記。 - [[プラトン的表現仮説]](更新) — 言語モデル対ヒト脳(in silico/in vivo)の収束議論を追記。 - [[モデル表現収束]](更新) — 緯度経度プローブ・CIELAB色空間同型性による収束の追加証拠を追記。 - [[ロジットレンズ]](更新) — 層単位の予測トークン推移可視化と非英語処理時の中間層挙動の観察を追記。 - [[帰納ヘッド]](更新) — 帰納ヘッド出現タイミングとICLスコア向上タイミングの一致という訓練ダイナミクスの実測を追記。 - [[アテンションヘッド]](更新) — attention sink現象の詳細メカニズム(massive activations)、緩和策、注意重み解釈可能性論争、IOI回路を追記。 ### 2026-07-10 Failure Trends in a Large Disk Drive Population ingest - [[ハードディスク信頼性]](新規) — Google 本番 10 万台超 HDD の実証研究(FAST 2007)を基盤に、AFR パターン・SMART シグナルの予測力と限界・温度/使用率との相関を集約。(storage / reliability / hardware / smart) - [[データセンター信頼性]](更新) — 温度・使用率の弱い相関と SMART 限界の定量化(Pinheiro et al. 2007)を横断的知見に追記。 - [[障害予測]](更新) — SMART シグナルなしの障害ドライブが 56% 超という予測精度の天井を定量化した先駆的実証として横断的知見に追記。 ### 2026-07-08 Benchmarking the Overhead of Distributed Tracing Agents ingest - [[トレーシングオーバーヘッド]](新規) — Java トレーシングエージェントが被監視アプリに追加する実行時レイテンシ。Kieker 133.92 ns/depth から inspectIT 656.79 ns/depth まで 5 倍の差。5 タスク(TIME/METADATA/CALL-TREE/MEMORY/QUEUE)で根本原因を分類。 - [[分散トレーシング]](更新) — エージェント実装選択でオーバーヘッドが 5 倍変わること・Pinpoint/Scouter のスパン損失バグによる傾きの偽装、eBPF vs Java エージェントの比較閾値の未解決問いを追記。 - [[継続的プロファイリング]](更新) — async-profiler のフレームグラフによるエージェント実装ボトルネック特定の横断的知見を追記。 ### 2026-07-07 VAST AI Operating System ingest - [[DASEアーキテクチャ]](新規) — Disaggregated and Shared Everything: ステートレス CNode と NVMe-oF 接続の DBox による単一非分割ネームスペースを実現する分散ストレージ設計パラダイム。(storage / ai-infrastructure / distributed) - [[コンピュートストレージ分離]](更新) — NVMe-oF が分離のレイテンシ障壁を低下させる観察と VAST DASE の横断的知見を追記。未解決の問いに Shared-Everything のスケール限界を追加。 - [[分散メッセージブローカ]](更新) — VAST Event Broker の「ストレージ側消去符号化でレプリカ不要」設計の横断的知見と未解決の問いを追記。 ### 2026-07-06 A Checkpoint/Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters (APSys 2024 Poster) ingest - [[WebAssembly]]・[[ランタイム中立チェックポイント]]・[[Application Checkpointing]]・[[VM Migration]]・[[Edge-cloud Collaboration]]・[[チェックポイント]](更新) — standard interpreter と fast interpreter の間でプログラムカウンタ・コントロールスタック・バリュースタックを変換する異種 interpreter 間 C/R の知見を横断的知見・未解決の問い・関連に追記。 ### 2026-07-05 Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum (Mid4CC ’25) ingest - [[Self-Hosted WebAssembly Runtime]](新規) — Wasm 自身にコンパイルしたランタイムを中間層として用い、ホストランタイムの差異と最適化戦略の差異を吸収する概念。 - [[WebAssembly]]・[[ランタイム中立チェックポイント]]・[[Application Checkpointing]]・[[VM Migration]]・[[Edge-cloud Collaboration]](更新) — Chiwawa による自己ホスト型 C/R の知見を横断的知見・未解決の問い・関連に追記。 ### 2026-07-05 Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing (CANDARW 2025) ingest - [[ランタイム中立チェックポイント]](新規) — 特定のランタイム実装に依存しない中間形式でアプリケーション状態を保存・復元し、異種 Wasm ランタイム間移行を可能にするチェックポイント技術。 - [[ホットリスタート]](新規) — チェックポイントからの復元によりコールドスタートを回避する高速な障害回復手法。 - [[動的ランタイム切り替え]](新規) — 実行状態を保持したまま異なる Wasm ランタイム間でワークロードを移行し、メモリ圧力を緩和する技術。 - [[セルフヒーリング]](新規) — 障害を検知し自動的に回復する能力。本論文ではランタイム中立チェックポイントを用いた状態保持型回復を提案。 - [[WebAssembly]](更新) — WasmEdge と WAMR 間の動的切り替えとホットリスタートの知見を横断的知見・未解決の問いに追記。 - [[チェックポイント]](更新) — ランタイム中立チェックポイントによる異種ランタイム間マイグレーションの知見を横断的知見・未解決の問いに追記。 - [[コンテナオーケストレーション]](更新) — Wasm コンテナにおけるホットリスタートと動的ランタイム切り替えの知見を横断的知見・未解決の問いに追記。 ### 2026-07-05 Container Transplantation (APSys ’23) ingest - [[Container Transplantation]]・[[Capability-based Security]]・[[Capsicum]]・[[Lightweight Sandboxing]](新規) — Linux コンテナを FreeBSD へ移植し Capsicum を透過適用する軽量サンドボックス化の概念群。 - [[コンテナ仮想化]](更新) — Container Transplantation と Sandbox Tailoring の比較を横断的知見に追記。 ### 2026-07-05 Stateful VM Migration Among Heterogeneous WebAssembly Runtimes (EdgeSys ’24) ingest - [[WebAssembly]]・[[VM Migration]]・[[Edge Computing]]・[[Edge-cloud Collaboration]]・[[Application Checkpointing]](新規) — WasmEdge と WAMR 間の異種ランタイムステートフルVMマイグレーションに関連する概念群。(webassembly / edge-computing / virtualization / migration) - [[チェックポイント]](更新) — dirty memory検出によるチェックポイントサイズ削減と、異種ランタイム間の状態変換を横断的知見・未解決の問いに追記。 ### 2026-07-05 Subaco (UCC 2021) ingest - [[Sandbox Tailoring]](新規) — リソースごとに異なる隔離強度の手法を組み合わせるコンテナサンドボックス設計思想。 - [[コンテナネットワーク分離]](新規) — 共有ホスト OS 上のコンテナ間ネットワーク通信を保護する隔離技術。 - [[Para-passthrough Hypervisor]](新規) — 実デバイスを見せつつ特定デバイス I/O を傍受する薄いハイパーバイザアーキテクチャ。 - [[コンテナ仮想化]](更新) — Subaco による Sandbox Tailoring の知見を横断的知見・未解決の問いに追記。 ### 2026-07-04 OSDI'25 Extending Applications Safely and Efficiently ingest - [[Extension Interface Model]](新規) — ソフトウェア拡張の相互接続性と安全性をリソース/ケイパビリティで細粒度に指定するモデル。開発時仕様とデプロイ時仕様の 2 段階構成。(operating-systems / ebpf / security) - [[eBPF]]・[[BPF]]・[[uprobe]](更新) — ユーザ空間 eBPF ランタイム bpftime によるアプリケーション拡張への適用、uprobe のカーネル/ユーザ空間実行のオーバーヘッド差を横断的知見に追記。 ### 2026-07-04 The GPU Observability Gap ingest - [[eGPU]](新規) — eBPF プログラムを GPU カーネル内部で実行させる技術・パラダイム。bpftime による PTX/SPIR-V 注入で稼働中カーネルに計装を埋め込む。(ebpf / gpu / observability) - [[PTX 注入]](新規) — NVIDIA GPU の中間アセンブリ表現 PTX への動的計装コード挿入。eGPU の実装基盤。(gpu / instrumentation) - [[GPU観測性]]・[[eBPF]]・[[bpftime]](更新) — 既存 GPU ツールの 3 類型整理と、eBPF on GPU の位置づけを横断的知見に追記。 ### 2026-07-04 CUDA Events - eBPF-based CUDA API Tracing ingest - [[CUDA API トレース]](新規) — `libcudart.so` への uprobe/uretprobe で CUDA API 呼び出しを非侵襲に可視化する手法。ホスト側入口の可視化として、GPU 内部計装(eGPU/bpftime)と補完する。(ebpf / cuda / gpu-observability) - [[CUDA]](新規) — NVIDIA の GPU 汎用並列コンピューティングプラットフォーム・プログラミングモデル。(gpu / parallel-computing) - [[uprobe]](新規) — ユーザ空間関数の入口/出口に eBPF プログラムを動的アタッチする仕組み。(ebpf / tracing) - [[eBPF]]・[[GPU観測性]]・[[動的計装]](更新) — CPU 側 CUDA API トレースの実装例と、ホスト側/デバイス内計装の 2 層構造を横断的知見に追記。 - [[デジタル発酵]](新規) — 人間の記号、身体経験、記憶、作品、制度、儀礼、データセットが、モデル・共同体・プラットフォーム・エネルギーシステムの中で変質する過程。(ai-ethics / media-art) - [[デジタル蒸留]](新規) — 発酵した記号環境から意味、様式、信頼、著作性、判断を抽出し、保存・流通・責任化する過程。(ai-ethics / knowledge-management) - [[Homo Convivium]](新規) — 生成AI以後に、共に味わい、共に評価し、共に世界を構成する存在として人間を捉え直す概念。(posthuman / ai-ethics) - [[アクセシビリティ]](新規) — 計算環境が多様な身体に住まれ、変形され、拒否され、統治されうるかを問う存在論的試金石。(hci / accessibility) - [[計算機自然]]・[[マタギドライヴ]]・[[批判的デジタルネイチャー]](更新) — 生成AI以後の発酵する共在、AIの森のリテラシー、アクセシビリティとエネルギー責任を横断的知見に追記。 ### 2026-07-04 計算機自然からマタギドライヴへ ingest - [[計算機自然]](新規) — 計算的プロセスと物質的プロセスが相互に変換され、自然/人工の二項対立が再編される存在論的構想。(philosophy-of-technology / media-art) - [[マタギドライヴ]](新規) — 計算機自然の中心化・最適化・加速から距離を置き、辺縁で計算不能なものとともに生きる脱人間知性的文明論。(posthuman / technology-philosophy) - [[批判的デジタルネイチャー]](新規) — 環境負荷、計算インフラの権力構造、身体・ジェンダーの政治性を計算機自然の構成要素として組み込む再構成。(ai-ethics / technology-ethics) - [[主体なき美の美学]](新規) — 計算機の偶発的出力やグリッチに現れる美を、作者の意図や鑑賞主体の内面に還元しない美学的枠組み。(aesthetics / media-art) - [[ヌルのテトラレンマ]](新規) — null と空をめぐる四句分別を、人間/非人間・自然/人工・計算/非計算の二項対立を超える論理として扱う枠組み。(buddhist-philosophy / media-art) ### 2026-07-02 PLaMo 2 Technical Report ingest - [[ハイブリッドアテンションアーキテクチャ]](更新) — PLaMo 2 が Samba ベース構成から CPT でフルアテンション相当に移行した事例を、訓練段階ごとの効率/長距離検索切替として追記。(llm / architecture) - [[スライディングウィンドウアテンション]](更新) — PLaMo 2 の Phonebook / Passkey Retrieval で 2,048 トークン窓が長距離検索の障壁になった知見を追記。(llm / attention) - [[状態空間モデル]](更新) — SSM が任意位置の高解像度検索を苦手とする PLaMo 2 / Falcon3-Mamba 評価を追記。(sequence-modeling / llm) - [[モデル圧縮]](更新) — PLaMo 2 の 31B→8B 構造化枝刈り・知識蒸留を、モデルファミリー作成の訓練計画として追記。(llm / efficiency) - [[LLM推論]](更新) — vLLM 実装で Mamba state と KV キャッシュを同時に管理する必要があることを追記。(llm / inference) ### 2026-07-02 XProf (MLSys 2026) ingest - [[MLプロファイリング]](新規) — 現代 ML スタックの性能計測・可視化の手法・ツール群。スケーラビリティ・発見可能性・説明可能性・適応性・忠実度の 5 課題を定義。TraceMe の超低オーバーヘッド設計・Roofline 分析・多段可視化を核心とする。(ml-systems / observability / performance) - [[Rooflineモデル]](新規) — ハードウェアの演算上限と帯域幅上限を「屋根線」で表現し、compute-bound か memory-bound かを判定する性能分析フレームワーク。XProf の高レベルアクセラレーター分析ツールとして採用。(ml-systems / computer-architecture / performance) ### 2026-07-02 The Case for Learned Index Structures ingest - [[Learned Index]](新規) — 索引を学習モデル + 補助構造として再定式化する設計アプローチ。範囲索引を CDF 近似、ハッシュ索引を CDF スケーリング、Bloom filter を分類器 + 漏れ受け用 filter として扱う。(database / machine-learning / learned-data-structures) - [[B-Tree]](更新) — B-Tree を CDF を近似する回帰木として再解釈し、学習索引のフォールバック/ハイブリッド構造として位置づける横断的知見を追記。(database systems / storage engines) #### Modernizing Incident Response with LLMs, RAG, and the MCP (SREcon25 EMEA, 2025) (2026-07-01) - [[agentic SRE]](更新) — 評価駆動開発のフライホイールとマルチモーダル(画像)入力による human-agent 共通推論の横断的知見を追記。(concept / sre / aiops) - [[RAGベースクラウド運用支援]](更新) — セクション単位チャンク分割の有効性、組織固有語彙の埋め込み注釈による吸収の横断的知見を追記。(concept / aiops / rag) ### 2026-07-01 The Un-Incident (SREcon25 EMEA, Andreas Deuschl, Dynatrace) ingest - [[アンインシデント]](新規) — 正式宣言されない潜在インシデントの 4 類型(No-CI / NOF / Near Miss / Fear Miss)と Gray Zone Playbook(マインドセット→カルチャー→ストラクチャー→プロセス→事実ベース意思決定)。「インシデントか否か」ではなく「何を学べるか」への問いの転換。(sre / incident-management) - [[インシデント管理]](更新) — Un-Incident がライフサイクルの「入口の手前」にある盲点を構造化するという横断的知見を追記。(sre / incident-management / aiops) ### 2026-07-01 Incident Groundhog Day (SREcon24 EMEA, Hamed Silatani, Uptime Labs) ingest - [[インシデントシミュレーション]](新規) — ステージドワールド(staged world; Woods & Hollnagel 2006)の4特性・設計要件(技術的忠実度/社会的環境/シナリオ)・Allspaw の4活動カテゴリ(Diagnostic/Therapeutic/Recruiting/Status-Reporting)・治療的行動が即座に診断情報に変わる特性を収録。(sre / incident-management / resilience-engineering / human-factors) - [[インシデント重大度評価]](更新) — Silatani の staged world 実験から「severity 分類議論に費やした時間が解決時間を短くする」実証的証拠を横断的知見として追記。(sre / incident-management) - [[Incident Commander]](更新) — 「Solo Artist(個人突破型)vs Band Member(チーム活用型)」の行動パターン差を実験的証拠として横断的知見に追記。(sre / incident-management / ics) ### 2026-07-01 Incident Management Metrics that Matter (SREcon25 Americas, Jamie Luck / Laura de Vesine) ingest - [[インシデントメトリクス]](新規) — MTTR・インシデント件数が統計的に不堅牢かつ逆インセンティブを生む理由と、8次元の目標ベース代替指標群の定義。[[グッドハートの法則]]・[[サービスレベル目標]]・[[DORA]] との関係を整理。(sre / incident-management / metrics) - [[インシデント管理]](更新) — 「MTTR はインシデント管理プロセスの測定として不適切」という横断的知見を追記。KPI として使うことへの批判的文脈を付与。 ### 2026-07-01 Embracing the Multi-Party Dilemma (SREcon23 EMEA, Sarah Butt / Alex Elman) ingest - [[Multi-Party Dilemma]](新規) — 相互依存する組織間の境界で生じる課題のパターン。情報・影響・時間的の3非対称性、一過性組織(transient organization)と多中心的統治(polycentric governance)への移行を定義。[[Joint Activity]]・[[Common Grounding]] へ一方向参照。(human-factors / incident-response / resilience-engineering) ### 2026-07-01 An Organizational Response to Incidents (SREcon23 Americas, Laura Maguire, Jeli) ingest - [[Followship]](新規) — 「経験豊富な対応者たちが共通の目的に向けて協働する適応的コレオグラフィ」の定義、Attention の非対称性・調整のパラドックス(DELEGATE/DELAY/DIMINISH/DROP)・見える8つの行動・Reconfiguring・Observe/Talk/Analyze フレームワーク・アンチパターン(Shame/Blame/Retrain, MTTI)を収録。(sre / incident-response / resilience-engineering / human-factors) - [[Incident Commander]](更新) — Maguire が IC 個人への組織的関心の集中を問い直し、フォロワー側の働きを可視化する補完的視点として Followship を提示したことを横断的知見として追記。(sre / incident-management / ics) - [[Joint Activity]](更新) — Followship の定義が文字通り「adaptive choreography」を用いており、Davis(SREcon23)が引用した Adaptive Choreography/Response Trio と同一の理論的支柱であることを確認。ただし Maguire 本人の射程はより広いことを追記。(human-factors / incident-response) - [[Common Grounding]](更新) — Maguire による "mutual knowledge, beliefs, and/or assumptions" の直接定義(p.66)と4象限モデル(team/others/technical system/organization)、および VEng2/Eng2(ic) チャットログによる Common Ground 崩壊事例を追記。(human-factors / incident-response) ### 2026-07-01 Handover Communications in Software Operations (SREcon23 Americas, Chad Todd, CrowdStrike) ingest - [[Handover Communications]](新規) — 引き継ぎコミュニケーションの定義(The Joint Commission, 2017)、Confidence を内包する分析枠組み、CrowdStrike 社内2部門への半構造化インタビューから抽出した6テーマ。(human-factors / sre / incident-response) - [[Joint Activity]](更新) — Todd が Klein et al.(2005)を Joint Activity 自体の出典として明示。Davis(SREcon23)の3特性との突き合わせと、未解決の問いの一部解消を追記。(human-factors / incident-response) - [[Common Grounding]](更新) — Todd の Common Ground 崩壊の非対称性の記述と、Davis の即時崩壊シナリオとの相補性を横断的知見として追記。(human-factors / incident-response) - [[レジリエンスエンジニアリング]](更新) — Todd が引用する Adaptive Capacity の原著定義(Woods, 2019; p.53)と、Davis の「即興==Adaptive Capacity」論との整合を横断的知見として追記。(sre / resilience-engineering / human-factors) ### 2026-07-01 Dashboards and Runbooks: Scrapbooking for Engineers (SREcon22 APAC, Colin Douch, Cloudflare) ingest - [[ダッシュボードとランブックの運用]](新規) — ダッシュボード汎用化/特化の二極化・ランブック3クラス(自動化可能/自由記述/無価値)・良いランブックの本質的一時性・composability/SLO/discoverability への移行提案。横断的知見2件・未解決の問い3件。(sre / dashboard / runbook / observability) ### 2026-07-01 Evolution of Incident Management at Slack (SREcon21, Brent Chapman, Slack) ingest - [[インシデント管理]](更新) — Slack の Response/Review/Analysis 3部構成を、本 wiki の検知→トリアージ→診断→緩和ライフサイクルと対比する横断的知見を追記。(aiops / incident-management / sre) - [[Incident Commander]](更新) — Chapman の Area Command・Major IC follow-the-sun・IC訓練率実績・Incident Review no-give-backs ハンドオフを ICS 実践の系譜として横断的知見4件を追記。(sre / incident-management / ics) ### 2026-07-01 The Math behind the Incident Aftermath (SREcon22 APAC, Ashish Patel / Sriram Srinivasan, PayPal) ingest - [[インシデント影響測定]](新規) — FCI(Failed Customer Interactions)によるインシデント顧客影響の定量測定手法。ベースライン予測との乖離算出・Availability 変換・5軸セグメンテーションを収録。(sre / incident-management) ### 2026-07-01 You Can't Stop Fires with an Ambulance (SREcon18 Asia, Piers Chamberlain, Xero) ingest - [[アラート管理]](更新) — [[Klaxon]] の「顧客観測ベースの安全網アラート」という独立検知シグナル、および Rob Ewaschuk "philosophy on alerting" 論文への言及を症状ベースアラーティング系譜の実例として追記。(aiops / alert-management) - [[クロスインシデント分析]](更新) — Chamberlain の専任チームなし・非構造化・単独手動集計という原始的実践を、Granda の3要素(専任チーム・構造化アーティファクト・組織計画連動)との対比として追記。(sre / incident-management / postmortem) ### 2026-07-01 Fixing On-Call When Nobody Thinks It's (Too) Broken (SREcon19 Americas, Tony Lykke, HRT) ingest - [[アラート疲労]](更新) — Lykke SREcon19 Americas を追加。最小限の技術変更+コミュニケーション過剰投資+git shortlogによる定量的バイイン可視化という統合事例、および「アラート削減が沈黙への不安を招く」という副作用の横断的知見2件・未解決の問い2件を追記。(sre / alert-management / on-call) ### 2026-06-30 Xpert ICSE 2024 ingest - [[DSLクエリ推薦]](新規) — インシデント管理での KQL クエリ自動推薦。Xpert の実証知見(少数集中・非移転性・時変性)・LLM ICL 優位性・Xcore 設計・未解決の問い 5 件。(aiops / incident-management / llm / query) - [[インシデント管理]](更新) — DSL クエリ推薦が調査フェーズの新介入点として機能するという横断的知見を追記。 - [[LLMによる根本原因分析]](更新) — RCA でなくクエリ生成に LLM を使う Xpert を関連ソースとして追記。 ### 2026-07-01 nrrd 911 ic me (SREcon16, Alice Goldfuss, New Relic) ingest - [[Incident Commander]](更新) — ICS 起源(1968年フェニックス森林火災・2004年NIMS)・Sev1 拡張役割(EC/LL)・重大度5段階表・全員訓練方針・横断的知見3件(trained volunteer→deliberate team の10年進化・ROI 証拠・chatbot tooling の連続性)を追記。(sre / incident-management) ### 2026-07-01 Software Engineering (Boehm 1976) ingest - [[ソフトウェアライフサイクル]](新規) — 要件→設計→コード→テスト→保守の段階的プロセス定義と、フェーズ間の欠陥修正コスト比(要件0.1〜運用100)の原則。(software-engineering / classic) - [[ソフトウェア要件工学]](新規) — 「何を作るか」の完全・一貫・明確な仕様化の規律。ISDOS/SREP 等の機械解析可能要件仕様システム。要件/設計ジレンマ。(software-engineering) - [[ソフトウェア保守]](新規) — 修正・適応・完全化保守の三分類。ライフサイクルコストの約70%を占める規模と、軽視される構造的背景。(software-engineering / classic) ### 2026-06-30 FaultProfIT ICSE-SEIP 2024 ingest - [[障害パターンプロファイリング]](新規) — ポストモーテムにおいて各インシデントを事前定義タクソノミの葉ノードに分類する作業の定義・自動化アプローチ(FaultProfIT の性能比較表含む)・横断的知見 1 件・未解決の問い 3 件。(aiops / incident-management / postmortem) - [[ポストモーテム]](更新) — 障害パターン自動プロファイリングが深刻度バイアスを補完して分析対象範囲を拡大するという横断的知見、および汎化問題の未解決の問いを追記。 - [[障害傾向分析]](更新) — 自動分類が GQM サイクルの Organize フェーズを加速するという横断的知見、および自動化定着後の GQM 変化を問う未解決の問いを追記。 ### 2026-06-30 Fail through the Cracks EuroSys 2023 ingest - [[クロスシステムインタラクション障害]](新規) — CSI 障害の定義・3プレーン分類・根本原因パターン・横断的知見5件・未解決の問い5件。クラウドインシデントの20%の根本原因として位置づけ。(distributed / reliability / aiops) - [[分散システム障害]](更新) — CSI 障害が従来のコントロールプレーン中心から現代のデータ・管理プレーンへの構造的移行を反映するという横断的知見を追記。 - [[クラウドインシデント]](更新) — 本番インシデントの20%がCSI 障害起因であるという量的知見を横断的知見に追記。 ### 2026-06-30 Metastable Failures HotOS 2021 ingest - [[メタ安定障害]](更新) — 3 状態モデルの公式定義・4 事例からの横断的知見 4 件(逆説・隠れキャパシティ乖離・マルチレイヤー診断困難・グレイ障害との関係)・未解決の問い 3 件を追記。sources に HotOS 2021 原典を追加。(distributed-systems / reliability) ### 2026-06-30 Gray Failure HotOS 2017 ingest - [[差分可観測性]](新規) — Huang+ 2017 が定式化したグレイ障害の核心的特性。Observer がシステムを健全と判断する一方で App が不健全と観測する非対称性。Pingmesh・GrayScope との接続も収録。(reliability / monitoring / cloud) - [[グレイ障害]](更新) — 公式定義セクション(Observer/App モデル・Table 1 の4象限)・横断的知見2件(冗長性の逆説・差分可観測性ギャップ)・未解決の問い2件を追記。sources に HotOS 2017・GrayScope を追加。 ### 2026-06-30 mTCP NSDI 2014 ingest - [[ユーザーレベルTCPスタック]](新規) — TCPスタックをカーネルからユーザープロセスに移動させるアーキテクチャ。パケットI/Oとソケットイベントの双方向バッチ処理でコンテキストスイッチオーバーヘッドを分散させる。mTCP・AccelTCPを収録。(networking / systems / kernel-bypass) ### 2026-06-30 ISPASS 2015 — VM vs Linux Containers ingest - [[コンテナ仮想化]](新規) — Linux namespace + cgroup による OS レベル仮想化。Docker と KVM の性能差の機構(NUMA トポロジ隠蔽・QEMU I/O パス・NAT オーバーヘッド)と横断知見を収録。(systems / virtualization / cloud) ### 2026-06-30 Scaling Memcache at Facebook (NSDI 2013) ingest - [[分散キャッシュ]](新規) — memcached を基盤とした大規模分散キャッシュシステムの設計・パターン。ルックアサイドキャッシュ・リースメカニズム・Gutter プール等を収録。(distributed / caching) - [[一貫性ハッシュ法]](更新) — memcache でのキー配布・ホットキーにはレプリケーションで対応という知見を追記。 - [[Incast]](更新) — memcache のスライディングウィンドウによるアプリ層 incast 緩和を横断的知見に追記。 - [[結果整合性]](更新) — キャッシュ層のベストエフォート結果整合性(mcsqueal・remote marker)を横断的知見に追記。 ### 2026-06-30 Live Upgrading Thousands of Servers (LISA 2013) ingest - [[ファイルレベル同期]](新規) — パッケージマネージャーを迂回してマスターイメージをフリート全体に同期するフリート管理手法。べき等性・均一性・差分レビュー可能性が特性。(sre / infrastructure) - [[ライブアップグレード]](新規) — 稼働中サーバーを停止せず OS 等を段階的に移行する手法。フラグデー回避・細粒度変更・バイナリ互換性確保が核心。(sre / infrastructure) ### 2026-06-30 Towards end-to-end automation of AI research (Nature 2026) ingest - [[AI研究自動化]](新規) — 科学研究ライフサイクル全体をAIが自律実行する概念。The AI Scientist(Sakana AI, Nature 2026)が機械学習分野で初実証。モデル世代・計算量でスケーリングする。(ai-research-automation / llm / scientific-discovery) - [[エージェント型科学探索]](新規) — コードテンプレートや事前定義ワークフローに縛られない、並列化エージェントツリー探索によるオープンエンド科学探索。The AI Scientist テンプレート自由版の中核機構。(agentic-ai / open-endedness / tree-search) - [[自動査読]](新規) — LLMエージェントが査読ガイドラインに従い5-runアンサンブル+メタレビューで論文を自動評価するシステム。Automated Reviewer は均衡精度69%で人間(66%)と同等。(peer-review / llm / scientific-evaluation) ### 2026-06-30 An AI system to help scientists write expert-level empirical software (Nature 2026) ingest - [[LLMドリブンコード探索]](新規) — LLM を突然変異演算子として PUCT 木探索でコードを反復改善し品質スコアを最大化する技法の総称。ERA が代表実装。Best-of-N=1000 を複数 LLM で一貫して上回る。(llm / code-generation / tree-search / ai4science) - [[スコアリング可能タスク]](新規) — コード実行だけで品質スコアが自動返却されるタスクの抽象化。ERA がこの枠組みで科学的ソフトウェア開発を定式化し、LLM+木探索による自動探索を可能にした。(ai4science / code-generation / automl) - [[コードLLM]](更新) — ERA の実験(Table 1)から「同一推論コストでシングルショット生成(BoN)より木探索が有効」という横断的知見を追記。 ### 2026-06-30 Is the S in SRE for "Security"? (SREcon25 Americas) ingest - [[Safety-II]](新規) — Erik Hollnagel が提唱した安全科学の枠組み。悪い結果の非発生でなく成功の増加を目指す。SRE・セキュリティの「パフォーマンス向上」戦略の理論的基盤。(safety / security / sre) - [[Security Level Objectives]](新規) — SLO をセキュリティ指標(脆弱性数・開放ポート数・MFA カバレッジ等)に転用してリソース配分を意思決定する概念。Benninghoff が提案。(security / slo / sre) ### 2026-06-30 9 Things You Should Do When Starting to Use SLOs (SREcon23 EMEA) ingest - [[SLODLC]](新規) — SLO Development Lifecycle。INITIATE→DISCOVER→DESIGN→IMPLEMENT→OPERATE の 5 フェーズで SLO 導入を継続的プロセスとして構造化するオープンフレームワーク。Sal Furino が SREcon23 EMEA で紹介。(sre / slo) - [[サービスレベル目標]](更新) — 「成功定義 > エラー定義」の SLI 設計原則とステークホルダー別時間窓(Furino SREcon23 EMEA)を追記。 - [[SLI-SLO段階的導入]](更新) — SLODLC との対応関係と WWWWHW 文書化 6 要素(Furino SREcon23 EMEA)を追記。 ### 2026-06-30 Principled Performance Analytics (SREcon22 Americas) ingest - [[2σ手法]](新規) — ワークロードをコホート分割し正規分布 z スコアで IID 仮説を検定する、較正不要・コホート間結合可能なパフォーマンス分析手法。[[定常性モデル]]の数理実装。Desai・Bryan(Google)が SREcon22 で発表。(sre / performance / statistics) - [[定常性モデル]](更新) — 2σ手法が 2021 年提唱の定常性モデルの数理実装であるという横断知見・SREcon22 ソース追記。 - [[サービスレベル目標]](更新) — SLO 実現不可能性の根本批判(Desai SREcon22)と [[Brent Bryan]] のエンティティリンクを追記。 ### 2026-06-30 Beyond Goldilocks Reliability (SREcon21) ingest - [[定常性モデル]](新規) — Goldilocks Reliability の代替として Desai が提唱。可用性・パフォーマンス・正確性の 3 次元に定常性仮定を付与し、仮定からの逸脱を信号とする数理モデル。(sre / reliability-modeling) - [[SREの工学化]](更新) — 定常性モデルが「技芸から工学へ」の移行の具体例であるという横断知見を追記。 ### 2026-06-29 SLOs for Data-Intensive Services (SREcon19 EMEA) ingest - [[データ品質SLO]](新規) — データ集約型サービスの一貫性・新鮮性・完全性・耐久性を SLO 化する概念。外部プローブとゲートウェイ内部比較の2計測パターン。SLO が自動緩和・自動修復を可能にする。(sre / slo / data-quality) - [[サービスレベル目標]](更新) — データ品質 SLO の横断知見(可用性・レイテンシだけでは不十分・SLO が自動化の根拠になる)を追記。 - [[SLI-SLO段階的導入]](更新) — データ集約型サービスでは SLO 次元がステークホルダー関心と合わないと導入が進まないという知見を追記。 ### 2026-06-29 Latency SLOs Done Right (SREcon19 Americas) ingest - [[サービスレベル目標]](更新) — Moyer と Hartmann の両 SREcon19 発表が収束する「パーセンタイル平均化の誤り→3 手法体系」の横断的知見を追記。2017→2019→2022 の系譜確認。 - [[ヒストグラムメトリクス]](更新) — libcircllhist のログリニアビン設計・マージ可能性の条件・TSDB サポート 2019 年時点の状況を横断的知見に追記。 ### 2026-06-29 Memory in the Age of AI Agents ingest - [[エージェントメモリ]](新規) — LLM ベースのエージェントが過去の対話・行動・環境観測を蓄積・取り出す機構の総称。Hu+ (2025) が形態(トークンレベル/パラメトリック/潜在)・機能(事実/経験/作業)・動態(形成/進化/検索)の 3 軸タクソノミを提案。[[コンテキストエンジニアリング]]・RAG・LLM メモリを包含しつつ射程が異なる独立領域。(llm / agent-memory / agents) ### 2026-06-29 How We Foster Reliability in Diversity / SRE NEXT 2022 ingest - [[ダイナミックケイパビリティ]](新規) — 環境変化への組織的耐性フレームワーク。Sensing/Seizing/Transforming の3能力。SRE の5ステップとの対応を Narimichi Takamura が体系化。(sre / organization / strategy) - [[組織の信頼性マインドセット]](新規) — Google SREs 発の5フェーズ分類(Absent/Reactive/Proactive/Strategic/Visionary)。SRE コンテキスト把握の診断ツール。(sre / organization / maturity-model) - [[SRE組織変革]](更新) — 氷山モデル3層・MVV 策定・5ステップの横断的知見を SREcon23 EMEA ソースと並べて追記。 ### 2026-06-29 Extending the Error Budget Model (SREcon19 Americas) ingest - [[脆弱性バジェット]](新規) — エラーバジェットモデルをセキュリティに拡張。SLI=依存パッチリリースからの経過日数・SLO=30 日・ポリシー=閾値接近時にパッチ適用。Equifax 侵害(67 日)で有効性を論証。(sre / security / error-budget) - [[フィーチャーフレッシュネス]](新規) — エラーバジェットモデルをフィーチャー鮮度に拡張(Legacy Budget)。SLI=リリースからの経過日数・SLO=ブリーディングエッジ度の範囲・ポリシー=90 日毎アップグレード。k8s 事例。(sre / error-budget / platform-engineering) - [[エラーバジェット]](更新) — SLI/SLO/ポリシーモデルの汎用性(セキュリティ・フィーチャーフレッシュネスへの拡張)を横断的知見に追記。 ### 2026-06-29 小さくはじめるSLI/SLO / Road to SRE NEXT 2026 神戸 ingest - [[SLI-SLO段階的導入]](新規) — SLI/SLO 導入の 3 つの難点(定義・運用・定着)と、SRE 4 ステップ導入法を援用した段階的フレームワーク。SLO 違反ポリシー 5 段階拡大・成熟度モデル(3 軸 × 5 段階)を体系化。[[Narimichi Takamura]]([[Topotal]])が提案。(sre / slo / maturity-model / organization) - [[サービスレベル目標]](更新) — SLI/SLO 組織導入の段階的アプローチを横断的知見に追記。 - [[エラーバジェット]](更新) — SLO 違反ポリシー 5 段階拡大の観点を横断的知見と未解決の問いに追記。 ### 2026-06-29 インシデント対応成熟度モデル / SRE NEXT 2024 ingest - [[インシデント対応成熟度モデル]](新規) — インシデントレスポンス能力を3フェーズ×9プロセス×4段階(Absent/Reactive/Proactive/Strategic)で評価・改善する枠組み。[[Narimichi Takamura]] が SRE NEXT 2024 で提案。(sre / incident-management / maturity-model) ### 2026-06-29 SRE NEXT 2025 Rethinking Incident Response ingest - [[インシデントレスポンスAIレベル]](新規) — SAE J3016™ の自動運転 L0〜L5 に対応する IR0〜IR5 フレームワーク。2025 年時点で IR0〜IR2 実現済み、MCP + Coding Agent で IR2〜IR3 が現実的。IR3 到達には安全な操作の定義が必要。Topotal Waroom の MCP デモで実証。(sre / incident-response / aiops) - [[インシデント管理]](更新) — SAE IR Levels フレームワーク(IR0〜IR5)を横断的知見に追記。 - [[AIOps]](更新) — SRE 実務視点のベンチマーク比較(OpenRCA 11%、AIOpsLab 検知 86%・局所化 71%・RCA 14%・緩和 43%)を横断的知見に追記。 ### 2026-06-29 AWS Lambda Container Loading / ATC 2023 ingest - [[コンテナ起動高速化]](新規) — コンテナイメージ全体を転送せず必要なデータのみオンデマンドで取得してコールドスタートを短縮する技術群。ファイルシステムレベル(Slacker/Starlight) vs ブロックレベル(Lambda/DADI)の対比を含む。(distributed-systems / serverless) - [[収束暗号化]](新規) — ブロックのハッシュから暗号化キーを決定論的に導出し、キーを共有しない安全な重複排除を可能にする暗号化スキーム。Farsite 起源・Lambda で塩による爆発半径制御を追加。(cryptography / distributed-systems) - [[イレイジャーコーディング]](新規) — k-of-(k+m) 符号でデータを分散し、テールレイテンシ削減とヒット率耐障害性を両立する技法。Lambda の L2 キャッシュが 4-of-5 コードを採用し 25% オーバーヘッドで大幅なテール削減を実現。(distributed-systems / storage) - [[メタ安定障害]](新規) — トリガー後に自己強化ループで高負荷状態から回復できなくなる分散システムの障害パターン。Lambda の高ヒット率キャッシュ空時 500x 負荷倍増リスクと対策(並行処理数制限・定常作業原則)を含む。(distributed-systems / reliability / sre) ### 2026-06-29 Raft / ATC 2014 ingest - [[分散コンセンサス]](新規) — 非ビザンティン障害下で複数サーバーが同一値に合意する問題とアルゴリズム総称。Raft vs Paxos vs VR 比較・Aurora コンセンサス回避との対比を含む。(distributed / consensus) - [[複製ステートマシン]](新規) — 同一コマンド列を全サーバーで実行することで一貫性を保つ分散フォールトトレランス手法。Raft の管理対象となる複製ログモデル。(distributed / fault-tolerance) - [[リーダー選出]](新規) — 分散システムでリーダーを選ぶプロセス。Raft のランダム化タイムアウト・投票制限・MemoryDB のログベース選出との比較。(distributed / consensus) - [[分散コンセンサス回避]](更新) — Raft のジョイントコンセンサスとの対比を横断的知見に追記。 ### 2026-06-28 CockroachDB ingest (SIGMOD 2020) - [[地理分散SQLデータベース]](新規) — 複数リージョンにまたがりながら SQL + ACID トランザクションを維持するシステム。Spanner vs CockroachDB の一貫性・クロック・配置ポリシー比較。(database / distributed / sql / geo-distributed) - [[ハイブリッド論理クロック]](新規) — 物理時刻 + Lamport 論理時刻の組み合わせで因果関係と単調増加を保証する分散クロック方式。TrueTime との詳細比較。(distributed / clock / consistency) - [[分散トランザクション]](更新) — CockroachDB の Read Refresh・Parallel Commits・commit wait 回避アプローチを横断的知見に追記。未解決問いを更新。 - [[外部一貫性]](更新) — 外部一貫性 vs 単一キー線形化可能性の具体的比較・クロックスキュー超過時の動作の違いを横断的知見に追記。 ### 2026-06-28 F1 ingest (VLDB 2013) - [[分散SQLデータベース]](新規) — スケール・可用性・強一貫性・フル SQL を同時に満たす分散 DB の設計原則。F1 と Spanner の 2 ソースを横断比較。(database / distributed / sql) - [[分散トランザクション]](更新) — 楽観的 vs 悲観的の条件分岐・グローバルインデックス一貫性コストを横断的知見に追記。F1 実装セクション追加。 ### 2026-06-28 Amazon MemoryDB ingest (SIGMOD 2024) - [[インメモリデータベース]](新規) — DRAM をプライマリストレージとするデータベースシステム。耐久性のトレードオフとその解決アプローチ(ローカルログ・分散ログ分離・アンチキャッシング)を整理。(database / distributed-systems / cloud) - [[ストレージ計算分離]](新規) — 計算と耐久性/ストレージを独立コンポーネントに分解するアーキテクチャパターン。Aurora・MemoryDB・PolarDB の横断比較。(database / distributed-systems / cloud) ### 2026-06-28 Amazon Aurora ingest (SIGMOD 2018) - [[分散コンセンサス回避]](新規) — 2PC/Paxos を使わずに書き込みコミット・クォーラム読み込み・メンバーシップ変更を達成する設計アプローチ。Aurora の SCL/PGCL/VCL 階層・クォーラムセット・エポックを核として整理。(distributed / database / consensus) - [[クォーラムベースレプリケーション]](更新) — クォーラムセット + エポックによる非ブロッキックメンバーシップ変更・フル/テールセグメント非対称設計を横断的知見に追記。 - [[クラッシュリカバリ]](更新) — エポックベースフェンシング(ゾンビインスタンス解消)・Undo 並行実行を横断的知見に追記。 - [[Write-Ahead Logging (WAL)]](更新) — SCL/PGCL/VCL/VDL 分散 LSN 一貫性ポイント階層・VDL による MTR 原子性保証をレプリカ一貫性に接続した横断的知見を追記。 ### 2026-06-28 Amazon Aurora ingest (SIGMOD 2017) - [[クォーラムベースレプリケーション]](新規) — 分散データシステムで読み書き操作にクォーラム承認を要求する手法。Aurora の V=6 Vw=4 Vr=3 AZ+1 設計を含む。(distributed / database / replication) - [[コンピュートストレージ分離]](新規) — OLTP DB においてクエリ/トランザクション処理とログ/ストレージ/リカバリを独立サービスに切り出すアーキテクチャパターン。Aurora の「ログがデータベース」設計を主軸に分析。(distributed / database / architecture) - [[OLTPシステムアーキテクチャ]](更新) — クラウドネイティブ OLTP でのネットワークボトルネック問題と Aurora の対処を横断的知見に追記。 - [[Write-Ahead Logging (WAL)]](更新) — Aurora の「ログがデータベース」設計(ストレージ層へのログ適用移譲)を横断的知見に追記。 - [[クラッシュリカバリ]](更新) — Aurora の継続的 Redo 適用・10 秒以内リカバリを横断的知見に追記。 - [[分散ストレージ]](更新) — OLTP 専用ストレージのログ処理責任モデルを横断的知見に追記。 ### 2026-06-28 Unlock High-Frequency Deployments ingest (SREcon26 Americas) - [[Prometheusシリーズチャーン]](新規) — Kubernetes ロールアウト等で短期間に大量の時系列識別子が入れ替わり、失活系列が Prometheus HEAD に蓄積して OOM を引き起こす問題。stale-series compaction による解決策と閾値選択指針を含む。(sre / prometheus / observability) - [[Prometheus TSDB]](新規) — Prometheus 内蔵の時系列ストレージエンジン。HEAD(RAM) + WAL + Block の 2 層構造。シリーズチャーン問題の根源的なアーキテクチャを定義。(prometheus / storage) ### 2026-06-28 Reliability Equilibrium ingest (SREcon26 Americas) - [[ゲーム理論とSRE]](新規) — 囚人のジレンマ・Stag Hunt・公共財ゲーム・ベイジアンゲーム・進化的ゲームを用いて SRE の社会技術的失敗パターンを診断し、メカニズムデザインで解決するフレームワーク。「SRE の障害の多くは調整の失敗」「ナッシュ均衡は安定であって良いとは限らない」。(sre / game-theory / mechanism-design) ### 2026-06-28 Executing Chaos Engineering ingest (SREcon26 Americas) - [[カオスエンジニアリング]](新規) — 本番システムの逆境耐性を検証・強化する規律。Steady State 定義→仮説→障害注入→分析→改善のサイクル。金融規制環境での段階的導入フレームワーク(手動→自動化→GameDay)と実測成果(MTTD 73% 削減)を含む。(sre / chaos-engineering / resilience) - [[GameDay]](新規) — 事前通知なしにリアル障害をシミュレートしてチームの対応準備態勢を検証する演習形式。+300 人規模の Bradesco 事例・Dynatrace を RCA 宝の地図として使う実施形式・54% 発見率を含む。(sre / incident-response / chaos-engineering) ### 2026-06-28 Learning from Incidents at Scale ingest (SREcon25 Americas) - [[クロスインシデント分析]](新規) — 個別インシデント学習の次の段階として複数インシデントを横断し組織的パターン・インサイトを発見する継続的プログラム。専任チーム・定量+定性アーティファクト・組織計画連動の3要素。アクションアイテムと推奨事項の分離。(sre / incident-management / postmortem) - [[ポストモーテム]](更新) — 部門横断招待が学習コミュニティを形成するという Granda の観察・アクションアイテムファクトリー anti-pattern とその対策を横断的知見に追記。 ### 2026-06-28 So You Want a New Incident Commander ingest (SREcon26 Americas) - [[Incident Commander]](新規) — IC は最強エンジニアのバッジでなく社会技術的リーダーシップスキル。People/System/Business の3軸で条件を整える役割。3コアコンピテンシー・3チーム類型・アンチパターンを含む。(sre / incident-management) - [[インシデント管理]](更新) — IC の役割定義・3チーム類型(Deliberate/Domain/Volunteer)の横断的知見を追記。SRE Book の ICS 定義との収束を記録。 ### 2026-06-28 The Case of the Misnamed Cities ingest (SREcon26 Americas) - [[CAST]](新規) — Causal Analysis based on Systems Theory。Nancy G. Leveson 考案。制御構造・メンタルモデル・文脈要因・システム的要因を析出し、RCA が落とす遠位・組織的要因を特定する。(sre / safety-engineering / postmortem) - [[事故モデル]](更新) — CAST の「イベント選択の主観性問題」批判と制御構造アプローチを横断的知見に追記。 - [[根本原因分析]](更新) — Google での CAST 産業適用実績を横断的知見に追記。CAST → [[CAST]] へのリンク追加。 ### 2026-06-28 Human Observability of Incident Response ingest (SREcon23 Americas) - [[Joint Activity]](新規) — 複数参加者が共通目標に向け意図的に協力する活動の総称。Adaptive Choreography の3特性(Interpredictability・Directability・Common Ground)を含む。インシデント対応の本質的構造として Davis が提示。(human-factors / incident-response) - [[Common Grounding]](新規) — 相互理解とメンタルモデルをコミュニケーション・テスト・更新・調整・修復によって維持する継続的プロセス(Klein, Feltovich, Bradshaw, Woods 2005)。修復作業と並行して常に進行する。(human-factors / incident-response) - [[Practice of Practice]](新規) — Matt Davis が考案した SRE 向け反復訓練フレームワーク。「インシデントでなく共に働くことを練習する」原則。Wheel of Expertise・Decision Requirements Tables・Multiverse Mirror・Oblique Alert Strategy・RPG Your Severity・Chaos Gameday を含む。(sre / training / human-factors) - [[人的要因]](更新) — 「人間のオブザーバビリティ」という独立した観測次元(Davis)・「即興能力は練習の外に存在しない」という訓練設計への接続を横断的知見に追記。 - [[レジリエンスエンジニアリング]](更新) — 「即興 == 適応的キャパシティ」等式・Roud(2021)の集合的即興論をレジリエンスエンジニアリングの実践論として横断的知見に追記。 - [[インシデント管理]](更新) — 技術的オブザーバビリティと人間のオブザーバビリティの並存・Response Trio と SRE Book Incident Command System の相補関係を横断的知見に追記。 ### 2026-06-28 Incident Archeology ingest (SREcon23 Americas) - [[インシデント考古学]](新規) — 過去インシデント記録を仮説駆動で横断分析する実践手法。Clint Byrum(Spotify、SREcon23 Americas)が提唱。修復・再発防止でなく学習に主眼を置き、8 ステップと 4 指針で定義。(sre / postmortem / incident-management) - [[ポストモーテム]](更新) — Spotify の完了率実測値(55%→62%)・生産性影響度バイアス・インシデント考古学という第三の活用法を横断的知見に追記。 ### 2026-06-28 The Repeat Incident Fallacy ingest (SREcon22 EMEA) - [[ポストモーテム]](更新) — 「Repeat Incident Fallacy」として「再発防止誓約」が誤った前提に立つことを Ruppe の主張として追記。「Insights from the Past = Options in the Future」目標転換が Gallego/Lund/Partington との 4 者収束として横断的知見に追加。 - [[レジリエンスエンジニアリング]](更新) — 「カーディオを鍛えよ」比喩によるレジリエンス構築実践・「進化する社会技術システム」概念・Laura Maguire の CI/CD 連続変化命題を横断的知見に追加。 ### 2026-06-28 Ditch the Template ingest (SREcon22 EMEA) - [[インシデントレポート執筆]](新規) — ナラティブ型 IR 執筆の原則。テンプレートを捨て謎→調査→解決の 3 部構成で書く。読者サポート・視覚化・分析・文体の 4 軸。Laura Nolan(SREcon22 EMEA 2022)。(sre / postmortem / incident-management) - [[ポストモーテム]](更新) — テンプレート形式が学習価値を損なうという Nolan の主張・専門知識の継続的損失を IR が補うという位置づけを横断的知見に追記。 ### 2026-06-28 Retrospectives for Humans ingest (SREcon19 APAC) - [[レトロスペクティブファシリテーション]](新規) — ポストモーテム会議でのファシリテーター役割・言語技術・会議運営の実践体系。Miller's Law・Why/You→How/What 変換・contributing factor discovery・ユーモアのリスク・Conway's Law 接続。(sre / postmortem / facilitation / human-factors) - [[ポストモーテム]](更新) — contributing factor discovery(根本原因分析の代替)・ファシリテーター言語が学習の深さを規定するという観点を横断的知見に追記。 - [[人的要因]](更新) — Miller's Law の認識論的基盤・「ヒューマンエラーは行き止まり」の三者収束(Eckhardt / Lund / Gallego)を横断的知見に追記。 ### 2026-06-27 Architecting a Technical Post Mortem ingest (SREcon18) - [[ポストモーテム]](更新) — Gallego の「ブレーム・アウェア」精緻化・定義から修復を除く・根本原因用語の否定・ローカル合理性・修復的正義の 5 観点を横断的知見に追記。(sre / postmortem) - [[根本原因分析]](更新) — SRE 実践文脈での「根本原因は誤った概念」という Gallego の主張と Cook(1998)の社会的構成性を接続した横断的知見を追記。(sre / aiops) ### 2026-06-27 Failures and Fixes ingest - [[インシデント調査戦略]](新規) — インシデント対応中の根本原因特定に用いる方法論。日和見的戦略(典型原因確認/時間相関探索)と体系的戦略(症状連鎖追跡/スタック追跡)の二分類。Sillito & Kutomi 2020 が 30 インシデント定性分析で同定。(sre / incident-response) ### 2026-06-27 OTel-Arrow Phase 2 ingest - [[OTel-Arrow]](新規) — Apache Arrow のカラム型フォーマットをテレメトリ転送・パイプライン処理全体に適用する OTel SIG プロジェクト。Phase 2 DFE で OTLP 比 20× スループット(単一コア)。(observability / opentelemetry) - [[OTAP]](新規) — OpenTelemetry Arrow Protocol。Arrow カラム型フォーマットを用いたワイヤプロトコル。OTel-Arrow Phase 1 の成果。(observability / protocol) ### 2026-06-27 Do Not Blame Users for Misconfigurations (SOSP'13) - [[設定ミス脆弱性]](新規) — 設定エラーへの不良反応の 5 分類。SPEX-INJ が 743 件を検出。(configuration / systems) - [[設定マイニング]](更新) — SPEX ホワイトボックスアプローチの位置づけ・ブラックボックスとの比較・クロスソフトウェア制約ギャップを追記。 ### 2026-06-27 障害箇所特定・根本原因分析 11 論文一括 ingest - [[再帰障害]](新規) — DéjàVu が定義した「同種・別箇所の繰り返し障害」概念。オンラインサービス障害の 74% 以上が該当。(aiops / fault-localization) - [[障害依存グラフ]](新規) — 障害ユニット(コンポーネント × メトリクスグループ)版の依存グラフ。DéjàVu が導入。(aiops / fault-localization) - [[不均衡障害分類]](新規) — 変更後サービスの「正常 vs 障害」+ 「障害種別間」の二重不均衡。SLIM が定式化。(aiops / fault-localization) - [[時系列知識グラフ]](新規) — UniDiag が導入した TKG ベースのマルチモーダル統合手法。(aiops / knowledge-graph) - [[ログベース障害診断]](新規) — LogInsight が実証した LLM + ログ圧縮による障害診断と説明文生成。(aiops / log / llm) - [[クラウドインフラ障害診断]](新規) — BSODiag が対象とするバッチサーバー障害の時空間グラフ RCA。(cloud-infra / rca) - [[サーバーレスRCA]](新規) — FaaSRCA が開拓したサーバーレスアプリケーション向け RCA。(serverless / rca) - [[ワンショットRCA]](新規) — LasRCA が実証したワンショット設定の障害 RCA。(aiops / rca / llm) - [[コード知識強化RCA]](新規) — COCA が実証したソースコード活用型 RCA。(rca / llm / code) - [[Fault Localization]](更新) — DéjàVu の障害ユニット概念・FL-AIer の不均衡対処・SLIM の DNF ルールセットを追記。横断的知見・未解決の問い拡充。(aiops / fault-localization) - [[根本原因分析]](更新) — BSODiag の伝播パス出力・RADICE の因果サブグラフ・COCA のコード知識活用を追記。(aiops / rca) - [[因果発見]](更新) — PCMCI+ のマイクロサービス適用(Causal Discovery)・RADICE の産業実装を追記。(causal) - [[因果推論ベースRCA]](更新) — RADICE・Causal Discovery のドメイン知識制約設計を追記。(causal / rca) - [[LLMによる根本原因分析]](更新) — LasRCA の LLM ラベラー設計・LogInsight の LoRA ファインチューニングを追記。(llm / rca) - [[マルチモーダル障害診断]](更新) — UniDiag の TKG 融合路線を追記。(aiops / multi-modal) - [[グラフベースRCA]](更新) — BSODiag の時空間障害相関を追記。(aiops / rca / graph) - [[サービス依存グラフ]](更新) — FDG との対比を追記。(aiops / graph) - [[マイクロサービスコールグラフ]](更新) — コールグラフとレイテンシグラフの乖離を追記。(microservice / graph) - [[サーバーレスアーキテクチャ]](更新) — FaaSRCA の知見を追記。(serverless) - [[ドメイン別RCA]](更新) — FaaSRCA のサーバーレス RCA を追記。(rca) ### 2026-06-27 RCA・障害箇所特定・集合通信診断 9 論文一括 ingest - [[根本原因分析]](更新) — LLMRCA・MetaRCA・KPIRoot+・eARCO・GALA・Robust RCD の 6 ソースから横断的知見を追記。LLM 統合型 RCA(プロンプト最適化・エージェントワークフロー・強化微調整)の分岐を整理。(aiops / rca) - [[LLMによる根本原因分析]](更新) — LLMRCA・ThinkFL・eARCO・GALA の 4 ソースから LLM 活用パターンの横断的知見を追記。マルチモーダル入力・プロンプト最適化・グラフ拡張・強化微調整の 4 アプローチ対比。(aiops / llm / rca) - [[マルチモーダル障害診断]](更新) — LLMRCA からマルチモーダルオブザーバビリティデータ統合の知見を追記。(aiops / multi-modal) - [[因果推論ベースRCA]](更新) — MetaRCA のメタ因果知識・Robust RCD の分布内介入を横断的知見に追記。(aiops / causal / rca) - [[Fault Localization]](更新) — BiAn(SIGCOMM 2025)の本番ネットワーク LLM ベース FL・ThinkFL の強化微調整を追記。(aiops / fault-localization) - [[異常検知]](更新) — KPIRoot+ の異常検知-RCA 統合フレームワークを追記。(aiops / anomaly-detection) - [[集合通信]](更新) — CCL-D の遅延・ハング異常高精度診断を追記。(hpc / collective-communication) ### 2026-06-27 データベースノブチューニング・自律 DB 3 論文 - [[データベースノブチューニング]](更新) — OtterTune(SIGMOD 2017)・GPTuner(VLDB 2024)・openGauss(VLDB 2021)からの横断的知見 4 件・未解決の問い 3 件を追加。ML→NLP→LLM への発展系譜と外付け/内蔵チューニングの対比が明確化。(concept / database / aiops) ### 2026-06-27 データベース異常診断・RCA 8 論文 - [[Sparkジョブ異常診断]](新規) — クラウド環境の Spark ジョブ実行異常に対する自動検知と根本原因分析。AutoDebugger(AIDB 2025)が定式化。(concept / aiops / spark) - [[グラフベースRCA]](新規) — システムトポロジの依存グラフを活用した根本原因分析。GRANO(VLDB 2019)が eBay NuData で実運用。(concept / rca / graph) - [[宣言的RCA]](新規) — SQL ライクな宣言的言語で因果仮説を列挙しランキングする教師なし RCA パラダイム。ExplainIt!(SIGMOD 2019)が Cisco Tetration で実運用。(concept / rca / causal) - [[データベース性能トラブルシューティング]](新規) — データベースの性能問題を検知・原因分析・解決する End-to-End パイプライン。Vista(Amazon RDS)が大規模展開。(concept / database / aiops) - [[根本原因分析]](更新) — DB 異常診断 8 論文からの横断的知見を追記。 - [[異常検知]](更新) — DB/クラウド領域の新ソース知見を追記。 - [[データベース自律診断]](更新) — RCRank・Vista・BALANCE からの知見を追記。 - [[データベース O&M]](更新) — FSE 2023 産業経験報告からの知見を追記。 - [[マルチモーダル障害診断]](更新) — RCRank のマルチモーダルランキングを追記。 ### 2026-06-27 - [[NLPベースDBチューニング]](新規) — テキスト文書から DBMS チューニングヒントを自動抽出し強化学習で適応する問題設定。DB-BERT(SIGMOD 2022)が初めて形式化。 - [[データベースノブチューニング]](更新) — DB-BERT からの横断的知見(NLP+RL+ランタイムフィードバック三統合・注釈なし学習)と未解決の問い(測定困難メトリクスの抽出・乗数空間の限界)を追加。 ### 2026-06-26 - [[データセンター信頼性]] — 部品、環境、運用、ソフトウェアをまたぐ可用性・耐障害性。 - [[クラウドインシデント]] — 本番時のサービス影響事象と復旧連鎖。 - [[データセンターネットワーク信頼性]] — ネットワーク障害をサービス影響で評価する概念。 - [[分散システム障害]] — 設定、部分障害、非決定的イベント順序による障害。 - [[Kubernetesオペレータ]] — 望ましい状態への調停を自動化する Kubernetes 拡張プログラム。 Navigation: [[index]] | [[entities/_index]] | [[sources/_index]] 複数ソースを横断して抽出した概念ページの一覧。各 concept は定義・関連実体/ソースへのリンク・関連 `structures/*.MOC.md` への一方向参照に加え、**横断的知見**(複数ソースを並べて初めて見える観察)と**未解決の問い**(次に調べるべき問い)の 2 節を持ち、ingest のたびに更新する(規約は [[conventions]] §8)。 --- ### 2026-06-26 SRE NEXT 2023「エンジニアのためのSRE論文への招待」スライド ingest - [[SRE論文]](新規) — SRE に関連する論文を、実務で探索・読解するための発表者独自の呼称。ソフトウェア工学・信頼性工学・システム・ネットワーク・データベース・クラウドに分散する未普及技術論文を、実装・適用のアイデア源として扱う。(sre / research / paper-reading) ### 2026-06-26 SRE NEXT 2022 AIOps研究録 スライド ingest - [[AIOps]] / [[因果推論ベースRCA]] / [[時系列クラスタリング]] / [[自動化の皮肉]](更新) — 症状アラートと原因診断の分業、RCA 前処理の境界設計、時系列クラスタリングで因果ノードを落とさない制約、診断 AI 自体の運用という論点を追記。(aiops / rca / time-series / automation) ### 2026-06-26 DEMi 分散実行最小化 (NSDI 2016) 論文 ingest - [[分散実行最小化]](新規) — 分散システムの障害実行から不変条件違反を再現する最小イベント列(MCS)を自動探索する技法。外部イベントにデルタデバッギング + DPOR でスケジュール空間を探索する DEMi が代表実装。デルタデバッギング(逐次入力)→階層型デルタデバッギング(木構造入力)→分散実行最小化(並行プロセス)の系譜。(distributed-systems / debugging / advanced) ### 2026-06-26 ソフトウェア信頼性工学 2 論文 ingest - [[ソフトウェア信頼性工学]](新規) — 指定環境における指定期間の障害なし動作確率を定量的に評価する工学技法の総体。障害ライフサイクル 4 技法(予防・除去・耐性・予測)と SRE プロセス 4 構成要素(信頼性目標・操作プロファイル・信頼性モデリング・信頼性検証)。(software-reliability / advanced) - [[ソフトウェア信頼性成長モデル]](新規) — SRGM。テスト進行にともなう故障率減少・信頼性成長を追跡する統計モデル群。1972 年 Jelinski-Moranda 以来 100 以上のモデルが存在。NHPP・ベイジアン・ニューラルネットの 3 潮流。(software-reliability / advanced) - [[ソフトウェア耐障害性]](更新) — Lyu 2007 のシングルバージョン/マルチバージョン障害耐性技法・N-version programming 信頼性モデルの知見を横断的知見に追記。 - [[Design for Reliability]](更新) — Lyu 2007 の failure-resilient architecture 8 段階設計・コンポーネントベース信頼性の知見を追記。 ### 2026-06-26 SREcon22 APAC 動画 ingest (Reliability Map) - [[Reliability Map (r9y.dev)]](新規) — SRE ケイパビリティをゲームのテック・ツリーに着想を得たマップとして体系化したオープンソースプロジェクト。各ケイパビリティカードは「何・なぜ・取得方法・前提」を持つ。(sre / reliability / capability) - [[SRE]](更新) — ケイパビリティ選択におけるコンテキスト抽出の重要性と Reliability Map の補完的位置づけを横断的知見に追記。 ### 2026-06-26 SREcon23 EMEA スライド ingest(From Sysadmins to Flying Unicorns) - [[SRE組織変革]](新規) — シスアドから SRE チームへの組織文化変革プロセス。TOS・SRE Academy・CFT・SLO・Reliability Meetup の 5 施策。成功要因: Executive Support・IC/Management Pairing・Fail iterate・Communicate。(sre / culture / organization) - [[SRE]](更新) — SIE の SRE 組織変革事例(TOS 割り込み吸収・CFT 設計参加・Reliability Meetup)を横断的知見に追記。 ### 2026-06-26 HDD: Hierarchical Delta Debugging 論文 ingest - [[階層的デルタデバッギング]](新規) — 木構造入力の各レベルを粗いものから順に ddmin にかけるアルゴリズム。文脈自由文法で定義される入力(XML・AST 等)で ddmin より桁違いに少ないテスト回数を達成。(software-engineering / debugging / testing) ### 2026-06-26 データベース/分散システム異常診断 6 論文一括 ingest - [[間欠的遅延クエリ]](新規) — クラウドデータベースにおいてインスタンスレベル・マシンレベルの外部要因で間欠的に発生する遅延クエリ(iSQ)。通常のスロークエリとは異なり原因が外部にあり、診断に多次元テレメトリの横断分析が必要。(aiops / database / performance) - [[クエリレイテンシ予測]](新規) — クエリ実行計画とシステムコンテキスト(HW 構成・負荷状態)からレイテンシを予測する手法群。OSprey の因子分解アーキテクチャがワークロード固有モデルとシステム汎用モデルの分離を確立。(database / ml / performance) - [[ログベース異常検知]](新規) — システムログのパース・テンプレート化・ベクトル化を通じた異常検知手法。MultiLog/LogDB がマルチノードログの統合分析の必要性を実証し、単一ノードログの限界を定量化。(aiops / log-analysis) - [[データベース性能異常ベンチマーク]](新規) — OLTP 性能異常の再現手順とデータセットを体系化したベンチマーク。DBPA が 9 種類の異常を決定論的に再現可能にし、複合異常の生成アルゴリズムを提供。(database / benchmark) - [[Raftログ診断]](新規) — Raft コンセンサスプロトコルのログを分散ストレージシステムの異常診断に活用する手法。RBAD がランタイム収集オーバーヘッドほぼゼロで監視データ・アプリケーションログを上回る精度を達成。(aiops / distributed-storage / consensus) - [[異常検知]](更新) — iSQUAD の TOPIC クラスタリング、MultiLog/LogDB のマルチノードログ統合、RBAD の Raft ログ活用を横断的知見に追記。データベース/分散ストレージ領域の異常検知が監視データ・アプリログ・Raft ログの三軸で発展。 - [[データベース自律診断]](更新) — DBPA ベンチマークと iSQUAD を出典に追加。再現可能なベンチマークがモデル訓練データ不足の解消に直交的に貢献する知見を追記。 - [[分散ストレージ]](更新) — RBAD の Raft ログ活用による異常診断を横断的知見に追記。 ### 2026-06-26 arXiv:2508.08906 Ultra Ethernet 論文 ingest - [[Ultra Ethernet]](新規) — UE 1.0 の設計原則と UET の主要機能。パケットスプレー・コネクションレス・有損失対応・ゼロトラストセキュリティ。(networking / hpc) - [[RDMA]](更新) — UE 1.0 が RoCE 3 大設計欠陥に回答した横断的知見と、UE 設計論文の初の論文開示を追記。 - [[RoCE設計課題]](更新) — UE による各課題の解消状況を横断的知見・未解決の問いに追記。 ### 2026-06-26 SONiC Workshop Japan 2026 スライド ingest - [[RDMA]](更新) — RoCEv2 対 UE Transport/Falcon/MRC の 4 方式 12 軸比較表を横断的知見に追記。SONiC/SAI が UE spec v1.0.2 に基づき LLR・CBFC・LLDP を実装中であり、次世代 Ethernet への移行が実装レベルで具体化。 - [[オープンネットワーキング]](更新) — SONiC の役割が Scale-Out NOS から Scale-Up プロトコルスタック実装へ拡張されつつある横断的知見を追記。 ### 2026-06-26 再帰化への認知的転回 + なめらかなシステムと運用維持の終わらぬ未来 スライド ingest - [[再帰化]](新規) — 構造化・自動化されたサービスがユーザインタラクションの結果を取り込んで自己改修するプロセス。「関数の設計から系の設計への認知的転回」。(systems-design / machine-learning) - [[エフェクチュエーション]](新規) — 高い不確実性に対して非予測的コントロールで対処する思考様式。5 つのヒューリスティクス。なめらかなシステムの目的生成的枠組みとして導入。(entrepreneurship / systems-design) - [[なめらかなシステム]](更新) — DICOMO2025 再定義(仮)、4 構成要件、「主体から関係性へ」の転換、再帰化との接続を大幅追記。 - [[基礎情報学]](更新) — DICOMO2025 での HACS 再評価と ICT 他律性の限界の再確認を横断的知見に追記。 - [[セルフクラフト]](更新) — 再帰化との補完関係を関連に追記。 --- ### 2026-06-26 なめらかなシステム (DICOMO2018) 論文 ingest - [[コンテキスト・アウェアネス]](新規) — 1994年提唱のユビキタスコンピューティング由来のシステム観。利用者の状況に応じた自動的サービス提供を定義(Abowd 1999 定義)。(ubiquitous-computing / hci / systems-thinking) - [[基礎情報学]](新規) — 西垣通による学際情報学。HACS(階層的自律コミュニケーション・システム)を提唱。構造的カップリング・コミュニケーション継続によるシステム維持が中核。(systems-theory / systems-thinking) - [[なめらかなシステム]](更新) — 正式定義・要件(1)(2)(3)・理論的背景・横断的知見(2018→2025の発展・開発運用者対称性・シンボル・グラウンディング問題)を大幅拡充。 - [[サイバネティクス]](更新) — 「なめらかなシステムにおける生命体参照の伝統」横断的知見を追記。 --- ### 2026-06-26 arXiv 2401.00134 Unicron 論文 ingest - [[弾性LLM訓練]](新規) — 障害発生時に GPU 数・並列設定を動的変更して訓練を継続させる能力。弾性と訓練効率(Megatron 比)のトレードオフを整理。 - [[耐障害LLM訓練]](更新) — Unicron の「クラスタ全体の複数タスク WAF 最大化」という設計目標と、ByteRobust・FFTrainer の「単一大規模ジョブ ETTR 最大化」との対比を横断的知見に追記。 --- ### 2026-06-26 HotNets 2024 I've Got 99 Problems But FLOPS Ain't One 論文 ingest - [[AIデータセンタートポロジ]](新規) — LLM 訓練特化のデータセンターネットワーク設計概念。スケールアップ/スケールアウト二層構造、マルチプレーン・マルチレール、ワイドエリア分割 DC。スイッチコスト 50%・リンクコスト 66% 削減の定量化。(networking / distributed / llm-training) - [[LLM分散学習]](更新) — 百万 GPU スケールでのスケールアップボトルネック化・MoE の通信要求厳格化・東西 DC 分割の 30 ms 伝播遅延隠蔽条件を横断的知見に追記。 - [[データセンター輻輳制御]](更新) — RoCEv2 シングルパス FCT 9 ms(最適の 9 倍)・マルチパストランスポートへのシフト・業界の UEC 動向を追記。 - [[LLMスケーリング則]](更新) — スケーリング則をインフラ設計の推論ツールとして活用した事例を追記。 --- ### 2026-06-26 ICPADS 2024 Generic and ML Workloads in an HPC Datacenter 論文 ingest - [[HPCワークロード特性化]](新規) — HPC データセンターの運用ログから汎用/ML ジョブの特性を定量比較する取り組み。ML ジョブのエネルギー過消費・冷却設計超過・未完了ジョブへのエネルギー浪費・ジョブ状態相関を横断的知見として整理。(hpc / workload-characterization) - [[GPUクラスタ運用]](更新) — ML/汎用混在 HPC では ML ジョブがエネルギー 39% を消費し冷却容量を超過する知見、未完了ジョブのエネルギー浪費(50%)・GPU-position-aware スケジューリング課題を追記。 --- ### 2026-06-26 ICSE 2023 Quality Issues of DL Platform 論文 ingest - [[DLプラットフォーム品質問題]](新規) — DL プラットフォームで発生するジョブ障害・品質劣化の体系的分類。ハードウェア/プラットフォーム側/ユーザー側の三次元 22 カテゴリ。Job Resubmission と User Code Improvement が緩和の 6 割を担う。 --- ### 2026-06-26 OSDI 2025 TrainCheck 論文 ingest - [[DLトレーニングサイレントエラー]](新規) — 損失・精度異常なしに進行する DL 訓練バグの定義・根本原因分布・検知困難性。Heisenbug の DL 特化形態として位置付け。 - [[訓練不変条件]](新規) — DL 訓練固有の高レベル意味規則の自動推論・前提条件推論・転用可能性。従来の不変条件推論(Daikon 等)との観察粒度の差異を整理。 - [[Heisenbug]](更新) — DLトレーニングサイレントエラーとの横断的知見を追記。 ### 2026-06-24 ClickHouse PVLDB 2024 - [[列指向OLAPデータベース]](新規) — カラム型 OLAP DB の定義・設計原則・ClickHouse を中心とした横断的知見。 - [[LSMツリー]](更新) — MergeTree* のフラット等価パート構造と WAL レス直書き設計を追記。 ### 2026-06-24 SREcon スライド 7 件一括取り込み (anomaly detection / monitoring) - [[異常検知]](更新) — Booking.com の MAD ロバスト性定量化を LinkedIn・Alibaba の事例と横断的に接続。AI/ML なし統計検知が 2024 年でも有効であることを確認。 - [[変化点検知]](更新) — Bloomberg PELT・Netflix ゲーム QoE の変化点検知事例を追記。 - [[ゴールデンシグナル]](新規) — Google SRE Book 発のレイテンシ・トラフィック・エラー・飽和度の 4 シグナルの概念ページ。 - [[時系列類似度検索]](新規) — SAX・DTW・ユークリッド距離による時系列パターンマッチングの概念ページ。 ### 2026-06-23 SREcon18 Americas Automatic Metric Screening - [[Fault Localization]](更新) — Baidu の自動メトリクススクリーニングを、FluxRank 論文化前の「どこを見るか」を縮小する実務向け箇所特定パターンとして追記。 - [[RCA入力選別]](更新) — ゴールデンメトリクスなしに全メトリクスをダイジェスト推薦へ圧縮する、LLM 以前の入力選別として追記。 - [[特徴量削減]](更新) — ゴールデンメトリクス設定負荷の削減という運用上の動機を追記。 ### 2026-06-23 SREcon17 Americas Practical Monitoring and Alerting - [[アラート管理]](更新) — 静的しきい値を、満杯までの時間・人間の修復時間・SLO 違反へ変換する設計を追記。 - [[アクショナブルアラート]](更新) — ページ条件は SLO 違反へ寄せ、診断情報はコンソールに残す分離を追記。 - [[サービスレベル目標]](更新) — Wilkinson 2017 を SLO ベース呼び出しのデータ構造・運用分離の前段として追加。 - [[ヒストグラムメトリクス]](更新) — Prometheus の累積バケット比率によるレイテンシ割合アラートを、レイテンシ SLO 実装の初期例として追記。 ### 2026-06-23 SREcon16 Europe Alerting for Distributed Systems - [[アラート管理]](更新) — 「症状へページし、原因は調査・チケットへ逃がす」分離と、ページ用異常検知は単純・堅牢に限定する設計原則を追記。 - [[アクショナブルアラート]](更新) — 「全ページはアクショナブル」は症状ベース設計と対で成立するという観察を追記。 - [[Prometheusルールリント]](更新) — 時系列アラートの初期利点と、後年に必要になったルール健全性保証の関係を追記。 - [[サービスレベル目標]](更新) — 高レベルサービス目標へアラートし、個別コンポーネントを調査可能に保つ原則を SLO ベース呼び出しの前史として追記。 ### 2026-06-23 SREcon16 Less Alarming Alerts スライド - [[アラート管理]](更新) — Treat の「ビジネス影響・修復手順・通知先・予防可能性をアラート追加前に問う」実践を、Runbook 合意とアラートバジェットの前史として追記。 - [[アクショナブルアラート]](更新) — アクショナブル性の最小チェックリストとして、ビジネス影響・修復手順・通知先・予防可能性を追加。 - [[アラート疲労]](更新) — 偽陽性が応答性を壊す行動モデルを 2016 年時点の早い実践知として追記。 ### 2026-06-23 SREcon17 Europe Over-Monitoring and Alert Fatigue スライド - [[アラート疲労]](新規) — 大量のアラート(特に偽陽性)に繰り返し曝されることでオペレータの応答性が低下する状態。ICU のモニタリング過剰と同構造で、インセンティブ設計による介入が有効。(sre / alert-management) - [[アラート管理]](更新) — アラートバジェットによるインセンティブ設計を第三の介入軸(技術的介入・社会的設計に並ぶ)として追加。 - [[アラートポリューション]](更新) — 心理的抵抗のインセンティブによる構造的無効化を横断的知見に追加。 - [[アクショナブルアラート]](更新) — Jalleda の「即座の対応 + 人間の知性」定義を運用者視点の最小定義として追加。 ### 2026-06-23 SREcon21 Spike Detection スライド - [[アラート相関]](新規) — 分散システムの障害時にアラート群からサービス依存関係を用いて根本原因を推定する取り組み。LinkedIn の AC Engine 実装と修正 Z スコアによるスパイク分離の事例。(sre / aiops) ### 2026-06-23 Sakana Fugu Technical Report - [[集合知]](新規) — 複数フロンティアLLMの相補的専門性を組み合わせ、どの単一モデルも到達できない性能軸にアクセスする手法群。オーケストレーションをスケーリング軸として確立する概念。(multi-agent / collective-intelligence) - [[マルチエージェント協調]](更新) — Fugu の intra-workflow isolation・動的集約者・ドメイン適応創発の知見を横断的知見と未解決の問いに追記。 --- ### 2026-06-23 SREcon19 EMEA Adaptive Paging スライド - [[Adaptive Paging]](新規) — 分散トレーシングの因果関係と OpenTracing セマンティック規約を活用してアラートの通知先を動的に決定するアラートハンドラ。症状ベースアラーティングのクリスマスツリー効果と通知先集中を解消する。(sre / alert-management / distributed-tracing) ### 2026-06-23 SRE NEXT 2023 Warning アラート自動調査スライド - [[Warningアラート]](新規) — Critical ほど即時対応ではないが、SLO・エラーバジェット・信頼性劣化の兆候として放置すべきでない低重要度アラート。発火時点の観測データ保存が調査可能性を左右する。(sre / alert-management / observability) - [[アラート管理]](更新) — 発火後の「調査準備」を自動化する第七の介入点として prepalert 型 enrichment を追記。(aiops / alert-management) - [[エラーバジェット]](更新) — Warning アラートでも 5xx や遅延がエラーバジェット消費につながるため、低重要度扱いと調査不要は同義でないという観察を追記。(sre / slo) - [[サービスレベル目標]](更新) — SLO 由来アラートには原因調査に必要なログ・メトリクスを即時添付する運用層が必要という知見を追記。(slo / observability) ### 2026-06-23 ハイブリッドアテンション論文(Rethinking Hybrid Architectures) - [[ハイブリッドアテンションアーキテクチャ]](新規) — フルアテンション + 効率的注意(SWA・Lightning・Mamba-2・GDN)のハイブリッド設計。Large-Window Laziness と NoPE 改善の機構的説明。(machine-learning / llm / architecture / long-context) - [[NoPE]](更新) — フルアテンション層へのハイブリッド内選択的適用が長コンテキスト性能を大幅改善(RULER +6.75 pt)という知見を横断的知見に追記。SWA との相互作用も追加。(machine-learning / attention) - [[線形注意]](更新) — ハイブリッドでの再帰型混合器が「理論上無制限の受容野」を持つにもかかわらず長コンテキスト検索の主体ではないという知見を追記。(machine-learning / efficient transformers) ### 2026-06-23 LLM 基盤論文 4 本一括(InstructGPT / Chinchilla / Sparsely-Gated MoE / ReAct) - [[人間フィードバックからの強化学習]](新規) — RLHF の定義と 3 段階パイプライン(SFT → 報酬モデル → PPO)。InstructGPT を起点に横断的知見を蓄積。(machine-learning / alignment) - [[指示チューニング]](新規) — 自然言語指示に従うようモデルを微調整する手法。FLAN・InstructGPT の系譜。(machine-learning / alignment) - [[アライメント]](新規) — LLM の出力を人間の意図・価値観に沿わせる技術群の総称。RLHF・指示チューニング・Constitutional AI 等。(machine-learning / ai-safety) - [[スケーリング則]](更新) — Chinchilla 論文を追加。Kaplan et al. 2020 との対比で計算最適な配分が異なることを横断的知見に追記。(machine-learning / scaling) - [[計算最適訓練]](新規) — Chinchilla のスケーリング則に基づく訓練配分最適化。モデルサイズとデータ量の等比率スケーリング。(machine-learning / scaling) - [[ReAct]](新規) — 推論トレースと外部行動を交互に生成する LLM プロンプティングパラダイム。CoT の推論力とツール利用の接地力を統合。(machine-learning / prompting / agents) - [[Chain-of-Thought Prompting]](更新) — ReAct との相補性・RLHF との組み合わせに関する横断的知見を追加。出典に ReAct・InstructGPT を追記。(machine-learning / prompting) ### 2026-06-23 MoE 2017 論文(Shazeer et al., ICLR) — 概念ページ更新 - [[Mixture-of-Experts]](更新) — 2017 年論文を定義に追加。スパースゲート MoE の原型・top-k ゲーティング・重要度損失 + 負荷損失の補助損失・ネットワーク帯域ボトルネック予言を定義セクションに加筆。横断的知見に「2017 年の設計原則が 2024–2026 年研究に継承された系譜」3 点を追加。未解決の問いに「top-k の最適値」「ノイズゲーティング廃止の理由」「エキスパート専門化パターン」を追加。出典に原論文を追加。(machine-learning systems) - [[条件付き計算]](新規) — 入力ごとに計算グラフの一部を動的に有効化/無効化するパラダイム。MoE を最も成功した実現形式と位置づけ、分散環境での通信コスト・スパーシティスケーリング則を横断的知見として整理。(machine-learning) - [[負荷分散]](新規) — MoE における特定エキスパートへのトークン集中を防ぐ技術群の総称。Shazeer 2017 の補助損失(重要度損失 + 負荷損失)から DeepSeek-V3 のバイアス動的調整・MiniMax-M2 のシグモイドゲーティングまでの 4 方向の解法系譜を整理。(machine-learning systems) ### 2026-06-21 マイクロサービス RCA・マルチモーダル障害診断 7 論文一括(LocaleXpert / UniTok / MRCA / HolisticRCA / Medicine / ChangeLLM / DeepHunt) - [[根本原因分析]](更新) — LocaleXpert・MRCA・HolisticRCA・Medicine・DeepHunt の 5 ソースから横断的知見を追記。LLM 統合型・メトリクスレベル・包括的オブザーバビリティ活用の分岐を整理。(aiops / rca) - [[マルチモーダル障害診断]](更新) — MRCA・HolisticRCA・Medicine・ChangeLLM の 4 ソースからモダリティ統合戦略の横断的知見を追記。適応的重み付け(Medicine)と RAG ベース知識活用(ChangeLLM)の差異を整理。(aiops / multi-modal) - [[LLMによる根本原因分析]](更新) — LocaleXpert・ChangeLLM の 2 ソースから LLM 活用パターンの横断的知見を追記。専門家知識のプロンプト注入と RAG アプローチの対比。(aiops / llm / rca) - [[変更起因インシデント]](更新) — ChangeLLM から変更影響評価の自動化に関する知見を追記。(aiops / change-management) - [[時系列基盤モデル]](更新) — UniTok/UniTok-FM から離散トークン化アプローチの知見を追記。NTP ベース汎用 TSFM の可能性と課題。(time-series / foundation-model) ### 2026-06-20 マイクロサービス RCA 6 論文一括(TraceRank / LogCluster / LogKG / FSF / Nezha / Eadro) - [[ログクラスタリング]](新規) — IDF 重み付けベクトル化と凝集型階層クラスタリングによるログ系列の問題クラス圧縮。知識ベース照合で再発/新規を振り分ける。(aiops / log-analysis) - [[知識グラフ]](新規) — エンティティ間の関係を有向グラフで表現する知識表現形式。LogKG ではログテンプレートと障害をノードとしたグラフ推論で障害診断を実現。(aiops / knowledge-representation) ### 2026-06-20 Energy statistics (JSPI 2013) - [[エネルギー統計]](新規) — 距離に基づく U/V統計量の族。エネルギー距離・DISCO・E-クラスタリング・適合度検定を統一する枠組み。回転不変・スケール同変から一意に導出される。(statistics / distance-statistics) - [[距離相関]](新規) — 距離共分散(dCov)と距離相関(dCor)。ゼロとなる必要十分条件が独立性であり、任意次元・非線形依存も検出可能。ブラウン共分散と任意次元で一致。(statistics / dependence-measure) ### 2026-06-20 Odin (NSDI 2018) - [[CDN計測システム]](新規) — クライアント側アプリ層計測を用いた CDN 計測プラットフォームの設計原則。Odin が代表例。(networking / cdn / internet-measurement) - [[エニキャストルーティング]](新規) — 同一 IP を複数 PoP でアナウンスし BGP でユーザーを誘導する CDN ルーティング手法。性能盲目性とパッチ適用手法を整理。(networking / cdn / routing) ### 2026-06-20 分散トレーシング基礎論文 5 本一括(Pinpoint / Magpie / lprof / Pivot Tracing / Canopy) - [[動的計装]](新規) — 実行中にトレースポイントを挿入する技術。Pivot Tracing の happened-before 結合が確立。(distributed-tracing / instrumentation) - [[リクエストモデリング]](新規) — リクエスト単位の資源消費モデルをオンライン構築する技術。Magpie のスキーマ駆動パーサが先駆。(distributed-tracing / performance-modelling) - [[非侵入プロファイリング]](新規) — ソースコード改変なしにリクエストフローを再構築する手法。lprof のバイトコード静的解析が確立。(distributed-tracing / non-intrusive) - [[分散トレーシング]](更新) — Pinpoint/Pivot Tracing/Canopy の横断的知見を追加。2002–2017 の進化系譜を集約。 - [[Fault Localization]](更新) — Pinpoint の統計的障害箇所特定の起源を横断的知見に追加。 - [[トレースサンプリング]](更新) — Canopy のヘッドベースサンプリング + コールパス打ち切りを横断的知見に追加。 - [[根本原因分析]](更新) — Pinpoint の統計的 RCA の先駆的貢献を追加。 ### 2026-06-20 arXiv — A Tutorial on Kernel Density Estimation and Recent Advances - [[カーネル密度推定]](新規) — ノンパラメトリック密度推定法。帯域幅選択・信頼帯構成のバイアス処理・密度の幾何学的/位相的特徴推定を体系化。[[密度ベースクラスタリング]]の DENCLUE の理論的基盤。(nonparametric-statistics / density-estimation) - [[密度ベースクラスタリング]](更新) — KDE との理論的接続を横断的知見に追加。 ### 2026-06-20 JMLR — DirectLiNGAM - [[因果発見]](更新) — DirectLiNGAM の位置づけ(外生変数の逐次同定による直接推定法)を定義に補足。横断的知見にアルゴリズムパラメータ依存性の解消・モデル仮定違反の具体例証を追加。 ### 2026-06-19 PVLDB — Time-Series Clustering: A Comprehensive Study - [[時系列クラスタリング]](新規) — 時系列データを同質なグループに分割する教師なしタスク。84手法・128データセット評価で10年前の k-Shape を統計的に上回る手法が存在しない「進歩の幻想」が実証された。基盤モデル(CHRONOS・OFA・MOMENT)もクラスタリングでは古典手法を超えられない。(time-series / clustering / benchmark) - [[時系列基盤モデル]](更新) — TSFM のクラスタリング性能が k-Shape を統計的に上回れない知見を横断的知見に追加。「予測以外のタスクでの TSFM 優位は未確立」。 ### 2026-06-19 Boris Tane Blog — The Software Development Lifecycle Is Dead - [[コンテキストエンジニアリング]](新規) — AI エージェントに与える情報の品質を設計・管理する実践。「エージェントで構築するものの品質は、エージェントに与えるコンテキストの品質に正比例する」。従来 SDLC における「プロセスの厳密さ」に代わる AI 時代の差別化要因。(ai-native / software-development / llm / observability) - [[AIネイティブ開発]](新規) — Cursor 以降にキャリアを始め、スプリント計画・ストーリーポイント・PR レビューを経験せずに形成されたソフトウェア開発スタイルおよびエンジニア文化。従来 SDLC の「改善版」ではなくパラダイムの断絶。(ai-native / software-development / engineering-culture) ### 2026-06-19 Frontiers in Genetics — Review of Causal Discovery Methods - [[因果発見]](新規) — 観測データから変数間の因果構造(DAG/同値類)を推定する手法の総称。制約ベース(PC・FCI)・スコアベース(GES)・関数的因果モデルベース(LiNGAM・ANM・PNL)の3系統。[[因果推論ベースRCA]] の理論的基盤。(causal-discovery / graphical-models / statistics) - [[因果推論ベースRCA]](更新) — Glymour+ 2019 の理論体系との接続を追記。忠実性仮定・前処理による分布歪み・FCI vs PC の交絡対処ギャップが RCA 失敗モードを体系的に説明することを横断的知見に追加。 ### 2026-06-19 Physics Reports — Signal propagation in complex networks - [[複雑ネットワーク]](新規) — スケールフリー性・スモールワールド性・時間的ネットワーク・多層ネットワークを含む複雑ネットワークの型と特性。感染閾値・拡散パターン・カスケード障害の基礎的フレーム。(complex-networks / network-science / physics) - [[信号伝播]](新規) — 感染・情報・ニューロン活動・カスケード障害などが複雑ネットワーク上でどのように伝わるか。モデリング駆動(蔵本/反応拡散/感染症モデル)とデータ駆動(転送エントロピー/発生源特定)の 2 軸。(complex-networks / nonlinear-dynamics / physics) ### 2026-06-19 CSUR — Anomaly Detection: A Survey - [[異常検知]](更新) — Chandola+ 2009 の点異常・文脈異常・集合異常、6 技法群、仮定ベース比較を基礎 taxonomy として追加。2015 PADBI・2021 マイクロサービスサーベイ・現代 AIOps への接続を横断的知見に追記。(aiops / anomaly-detection / survey) ### 2026-06-19 SREcon19 EMEA — Latency SLOs Done Right - [[ヒストグラムメトリクス]](新規) — レイテンシ分布を平均やパーセンタイル値に潰さず、ビンごとのサンプル数として保持するメトリクス。任意の期間・ノード・エンドポイントを集約して、しきい値以内の良いイベント比率を計算できる。(telemetry / slo / observability) - [[サービスレベル目標]](更新) — レイテンシ SLO はパーセンタイル時系列でなく、ログ・カウンタ・ヒストグラムによりしきい値内のリクエスト比率として実装する必要がある観察を追加。(slo / latency / telemetry) ### 2026-06-18 SpeakerDeck — AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性 - [[GPU観測性]](更新) — クラウド事業者の責任境界により、GPU プロファイリングはユーザー有効化・高オーバーヘッドの手法から、非侵入・低オーバーヘッド・学習フレームワーク文脈復元へ要求が移る観察を追加。(gpu / observability) - [[LLM学習モニタリング]](更新) — OTel + Grafana のリソース分析基盤から、順伝搬・逆伝搬・重み更新・集団通信スパンへ意味づけを引き上げる課題を追加。(llm-training / monitoring) - [[RDMAネットワーク監視]](更新) — R-Pingmesh 型の能動プロービングを研究論文から運用ツールへ移す際の、RNIC ペア選択・網羅性・行列可視化の段差を追加。(rdma / roce / monitoring) ### 2026-06-18 PyTorch Conference 2025 — LMCache + NIXL - [[KVキャッシュ管理]](更新) — NIXL の Memory Section / Metadata Handler を、KV キャッシュ転送に必要なメモリ登録・メタデータ交換の抽象として追記。(llm / inference / kv-cache) - [[LLM推論]](更新) — VAST Storage での長コンテキスト TTFT 削減例から、推論高速化が「どこから KV を読むか」という階層ストレージ問題へ移る観察を追加。(llm / inference) - [[Prefill-Decode分離]](更新) — NIXL の UCX 例を、PD 分離における転送データ面と制御面の分離として追記。(llm / inference / serving) ### 2026-06-18 FlashAttention シリーズ 4 本 + AIBrix ingest - [[FlashAttention]](新規) — IO-aware 厳密アテンションアルゴリズム。4 世代(A100→Blackwell)にわたる進化と GPU ボトルネック追跡を横断整理。(gpu / attention / llm-inference) - [[LLM推論]](更新) — FlashAttention の IO-aware ボトルネック追跡と AIBrix のクラウドネイティブ推論オーケストレーションの横断的知見を追加。(LLM systems) - [[KVキャッシュ管理]](更新) — AIBrix の分散 KV キャッシュファブリックと scan-resistant eviction を横断的知見に追加。(llm / inference / kv-cache) - [[Prefill-Decode分離]](更新) — AIBrix の Kubernetes ベース PD 分離オートスケーリングを横断的知見に追加。(llm / inference / serving) - [[カーネルフュージョン]](更新) — FlashAttention 4 世代の融合設計進化を横断的知見に追加。(hpc / gpu) - [[テンソルコア]](更新) — テンソルコア利用率の 70-75% 天井と TMEM によるレジスタ圧力解消を横断的知見に追加。(hpc / gpu / hardware) - [[GPU最適化]](更新) — FlashAttention をボトルネック追跡型最適化の教科書的事例として横断的知見に追加。(hpc / gpu) ### 2026-06-18 KV キャッシュ・GPU クラスタ論文 5 本 - [[KVキャッシュ管理]](更新) — 本番ワークロード特性(合成比低ヒット率、シングルターン支配、指数分布寿命)、非プリフィックス選択的再計算(CacheBlend/KVShare)、デコードフェーズのアテンション・ドリフト、sub-O(n) メモリ手法のマルチターン破綻(SCBench)を追記。(llm / inference / kv-cache) - [[LLM推論]](更新) — 本番 KV キャッシュワークロード特性、RAG/マルチテナントの非プリフィックス再利用、KV キャッシュライフサイクルベンチマークの必要性を追記。(llm / inference) - [[GPUクラスタスケジューリング]](更新) — Alibaba PAI 異種混合クラスタのワークロード解析(GPU 共有、CPU 競合、タスク繰り返し SJF)を追記。(distributed / scheduling) ### 2026-06-18 MPLS JAPAN 2025 — KV cache sharing with IOWN APN - [[KVキャッシュ管理]](更新) — KV キャッシュ共有を広域低遅延ネットワークと電力制約下の分散小型データセンター設計へ拡張する知見を追加。(llm / inference / kv-cache / iown) - [[LLM推論]](更新) — 電力制約下の推論ではリクエストルーティングと KV キャッシュ配置が同時制御問題になる観察を追加。(llm / inference / energy) - [[AI Greenferencing]](更新) — XWind 型の発電源近傍コンピュートと、IOWN APN 型の光ネットワーク連携分散データセンターを横断比較。(AI infrastructure / sustainable computing) ### 2026-06-18 LLM 推論 KV キャッシュ管理/分離型推論 6 論文 - [[KVキャッシュ管理]](新規) — LLM 推論で KV キャッシュを保存・再利用・退避・転送・共有するためのメモリ/ストレージ/ネットワーク管理。PagedAttention、RadixAttention、LMCache、P/D-Serve を横断し、GPU 内 page と外部 transfer chunk の二重粒度を整理。(llm / inference / kv-cache) - [[LLM推論]](更新) — KV キャッシュが attention kernel 最適化からクラスタデータ管理へ拡張した系譜、structured LM programs、P/D-Serve の本番スケジューリング観測課題を追記。(LLM systems) - [[Prefill-Decode分離]](更新) — P/D-Serve の scenario 単位 organization、LMCache/P-D-Serve による KV 転送粒度変換を横断知見に追加。(llm / inference / serving) ### 2026-06-18 LLM 推論サービング論文 2 本 - [[Prefill-Decode分離]](新規) — LLM 推論の Prefill と Decode を別 GPU・別インスタンス・別資源プールに分けるサービング設計。DistServe の Goodput 最適化、さくら/高火力 PHY の KV キャッシュ転送制約、INLG 2025 サーベイのカテゴリ化を横断整理。(llm / inference / serving) - [[LLM推論]](更新) — DistServe による PD 分離の Goodput 最適化、Zhen+ INLG 2025 によるインスタンス/クラスタ/新興シナリオの階層型サーベイを追記。(LLM systems) ### 2026-06-18 SpeakerDeck — 推論基盤のパフォーマンス検証と最適化戦略 - [[LLM推論]](更新) — PD 分離を「同じ GPU 枚数での役割分割」として捉え、入力 8k・出力 1k・32 同時接続で ITL P99 を 30 ms 以内に維持する実測を追加。KV Cache Reuse/Sharing の TTFT 最大 1.75 倍程度削減と、完全ヒット近傍でも読み込みが TTFT 約 1/4 を占める未解決点を追加。(llm / inference / gpu / benchmark) - [[サービスレベル目標]](更新) — LLM 推論の SLO が TTFT・ITL・E2EL・Goodput・Tokens/Dollar を束ね、SLO/SLA を満たしながらコスト最小化するループとして設計される観察を追加。(slo / llm-serving / cost) ### 2026-06-17 分散深層学習の訓練系基盤論文 14 本一括 - [[テンソル並列]](新規) — Megatron-LM のテンソル並列化手法。MLP と自己注意機構の行列分割で通信を AllReduce 2 回に抑制。(distributed / parallelism) - [[パイプライン並列化]](新規) — GPipe のマイクロバッチ方式と PipeDream の 1F1B 方式を整理。bubble 比率と重み一貫性のトレードオフを横断比較。(distributed / parallelism) - [[PTD-P]](新規) — Megatron-LM SC'21 が提案した 3D 並列化(Pipeline + Tensor + Data Parallelism)。インターリーブスケジュールで bubble 1/v に削減。(distributed / parallelism) - [[ZeROメモリ最適化]](新規) — ZeRO Stage 1〜3 の段階的メモリ分割。Stage 3 でパラメータまで分割し、モデル並列なしで 1000 億パラメータ訓練を実現。(distributed / memory-optimization) - [[ZeROオプティマイザ]](新規) — DeepSpeed の ZeRO 実装。KDD 2020 チュートリアルでの概要整理。(distributed / deepspeed) - [[ZeROパラメータシャーディング]](新規) — ZeRO Stage 3 / PyTorch FSDP の共通原理。FlatParameter による通信集約と後退プリフェッチの比較。(distributed / data-parallelism) - [[シーケンス並列化]](新規) — Megatron-LM の LayerNorm・Dropout をシーケンス次元で分割する手法。テンソル並列と組み合わせ活性化メモリ削減。(distributed / parallelism) - [[選択的活性化再計算]](新規) — MLSys'23 論文提案。QKV 以外の活性化のみ再計算し、530B で活性化メモリ 5 倍削減・再計算オーバーヘッド 1/3。(distributed / activation-recomputation) - [[再マテリアライゼーション]](新規) — GPipe が導入した活性化再計算の一般概念。選択的再計算との関係を整理。(distributed / memory-optimization) - [[混合精度訓練]](新規) — FP16/BF16/FP8 での訓練手法。FP8-LM が GPT-175B でメモリ 42% 削減・64% 高速化を実証。(distributed / precision) - [[共有異常]](新規) — HiveD が発見した GPU クラスタの問題。クォータ内でも私有クラスタより待ち時間が長い現象。(distributed / gpu-scheduling) - [[Virtual Private Cluster]](新規) — HiveD のセル抽象化による共有安全性保証メカニズム。GPU アフィニティ階層を反映した仮想割り当て。(distributed / gpu-scheduling) - [[ネットワーク対応スケジューリング]](新規) — Cassini が提案。GPU 配置とネットワークフロースケジューリングの統合で JCT 最大 1.6 倍改善。(distributed / scheduling) - [[タスク並列フレームワーク]](新規) — Ray のタスク並列 + アクター統合モデル。動的タスクグラフとボトムアップ分散スケジューラ。(distributed / framework) - [[動的タスクグラフ]](新規) — Ray が計算グラフを実行時に動的構築する手法。静的グラフ(TensorFlow 等)との対比。(distributed / framework) - [[GPUクラスタスケジューリング]](更新) — HiveD の共有異常・Cassini のネットワーク対応配置を追加。アフィニティ保証と通信対応の 2 軸で整理。 - [[LLM分散学習]](更新) — 14 論文からの知見を大幅追加。並列化戦略体系・メモリ最適化・通信特性・耐障害を横断整理。 - [[並列化戦略]](更新) — TP/PP/DP/FSDP/3D の体系的分類を強化。APNet 実測データとの対応付け。 - [[チェックポイント]](更新) — FFTrainer の checkpoint razor(サイズ 1/10 圧縮)とゼロオーバーヘッド手法を追加。 - [[耐障害LLM訓練]](更新) — FFTrainer の遊休帯域活用チェックポイント・数十秒復旧を追加。 - [[集合通信]](更新) — APNet の実測通信特性(TP 内 AllReduce 55〜85% 帯域占有)を追加。 ### 2026-06-17 マイクロサービスベンチマーク/データセット 4 論文一括 - [[マイクロサービスベンチマーク]](新規) — 実装(benchmark system)と dataset(benchmark dataset)の 2 形態を整理し、Train-Ticket 共通基盤化・観測スタック標準化・fault layer 分離の系譜を横断的に記述。([[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]] / [[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]] / [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] / [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]])(microservices / benchmark / distributed) - [[マイクロサービスアーキテクチャ]](更新) — DeathStarBench(2019)の「ハードウェア/OS 層への圧迫」(front-end stalls・kernel 36.3%・single-thread 感度・1 dependency ミスで tail latency 10.4× 悪化)を Meta の trace 解析と並置。 - [[マイクロサービスコールグラフ]](更新) — Death Star graph という命名起源、TrainTicketTrace の n+1 selects パターン(breadth 30+/depth 9)を Alibaba 実測の baseline と比較。 - [[分散トレーシング]](更新) — DeathStarBench 自前 trace 0.1% overhead の参照点化と、TrainTicketTrace が multimodal trace+metric+log を Jaeger フォーマットで公開する初の大規模 fault-injected dataset としての位置付け。 - [[Fault Localization]](更新) — TrainTicketTrace の trace+metric+log 3 modality 同時公開が multimodal FL の比較基盤になることと、test 層が fault を見落とすが observability 層に痕跡が残る段の切れ目。 - [[障害注入]](更新) — TrainTicketTrace の git branch 固定型注入(Zodiac の SMT 保証と同型の再現性担保)と、テストが fault を検知できなくても trace/metric/log には残るという別軸の問題。 ### 2026-06-17 アラート管理論文 3 本(Zha+ Electronics / VOCE FASE / SkyNet SIGCOMM) - [[アラート集約]] — 3 系統(意味類似度 / 統計 / ハイブリッド)に加え、LLM の役割が「SOP 解読 / SDG マッパー / 多因子分析」の 3 系統に分化。LLM 採用/不採用は failure の severity・スケールが境界。時間順仮定の否定が複数論文で独立に観察された。([[@2024__Electronics__Leveraging Large Language Models for Efficient Alert Aggregation in AIOPs]], [[@2025__FASE__VOCE - A Virtual On-Call Engineer for Automated Alert Incident Analysis Using a Large Language Model]], [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures]])(aiops / alert-management) - [[アラートストーム]] — SkyNet が "alert flooding from severe failure" の第三カテゴリを実証(年間数回、unknown failure、損失大)。alert 内分類は severity-driven / state-driven / behavior-driven の 3 軸に独立して分かれる。(aiops / alert-management) - [[アラートインシデント分析]](新規) — VOCE が導入した後段問題。alert を集約するだけでなく originating alert(根本原因記録 alert)を特定するタスク。system layer / impact scope / severity の 3 因子で 93-95% 一致(aiops / alert-management / incident-management) - [[LLMによる根本原因分析]](新規) — LLM の責務が「外部知識リーダー / グラフマッパー / 多因子分析+因果推論器」に分化。Chain-of-Thought + 階層分解 + 反復多数決で安定化。外部知識(SOP/SDG/Topology)で LLM 自由度を制約することで信頼性確保。SkyNet が "LLM 不採用" 位置で対比。(aiops / llm / rca) - [[サービス依存グラフ]](新規) — LLM hallucination の制御材として機能。Zha+ 2024 と VOCE が必須インフラとして使用。「SDG/topology incompleteness」が両論文で limitation として共通指摘(aiops / microservices / graph) - [[ネットワーク監視]](新規) — 単一データソース coverage 3-84% という制約から複数ソース統合が必須。統合代償の alert flooding を SkyNet が preprocessor + alert tree + severity score で対応(networking / observability / aiops) ### 2026-06-16 SpeakerDeck — AI 時代の SRE と信頼性 - [[SRE]] — AI 時代には、生成物の制御と本番での観測・担保の両面を SRE が扱う必要がある。[[サービスレベル目標]]・[[エラーバジェット]]・[[agentic SRE]] への接続を更新。(SRE / AI engineering) - [[agentic SRE]] — 実務導入の入口は、本番変更の完全自律化よりも SLI/SLO 候補提案・PRC レビュー・障害対応要約・ポストモーテム下書きのような判断支援にある。(SRE / AIOps) - [[SRE AI Autonomy Levels]] — Google SRE の L0-L4 自律性モデルを、Safety Trifecta と Architectural Guardrails を伴う現場導入チェックリストとして位置づけた。(SRE / AIOps / governance) - [[サービスレベル目標]] — 生成 AI サービスでは出力品質スコア・ハルシネーション率・RAG 検索精度を SLI 候補に加える必要がある。(SLO / AI service reliability) - [[エラーバジェット]] — AI 補助による自動承認と人間承認への戻しを、エラーバジェット残量で制御する拡張を追加。(SRE / governance) ### 2026-06-16 joisino ブログ 13 記事から派生する概念 #### LLM 機構的解釈性 / アテンション - [[Transformer]] — 自己注意機構を中核とする系列モデル。線形注意により[[カーネル法]]として再定式化でき、[[RNN]] と等価な定メモリ推論モードを持つ([[joisino-トランスフォーマーはRNN-2024]])。(machine-learning / sequence-modeling) - [[RNN]] — 再帰的な隠れ状態を持つ系列モデル。Transformer の線形注意モードは固定次元状態を持つ RNN として書き下せる([[joisino-トランスフォーマーはRNN-2024]])。(machine-learning / sequence-modeling) - [[線形注意]] — softmax の代わりにカーネル特徴写像で類似度を測る注意機構。状態が無限和へ畳み込めるため固定次元 RNN として展開可能([[joisino-トランスフォーマーはRNN-2024]])。(machine-learning / attention / efficient) - [[状態空間モデル]] — Mamba・S4 等、選択的状態空間を持つ系列モデル。Transformer/線形注意/SSM/RNN の連続的な接続を Mamba 系統で議論([[joisino-トランスフォーマーはRNN-2024]])。(machine-learning / sequence-modeling) - [[カーネル法]] — 内積空間の特徴写像で類似度を測る伝統的手法。Transformer のアテンションをカーネル法とみなすことで RNN への等価変換が成立([[joisino-トランスフォーマーはRNN-2024]])。(machine-learning / kernel) - [[文脈内学習]] — Few-shot 例から推論時にタスクを学ぶ能力。重み内学習と並ぶ「過去データとの類似度をカーネルで測る」手続きとして同質視できる([[joisino-トランスフォーマーはRNN-2024]])。(machine-learning / llm / in-context-learning) - [[LLM算術機構]] — LLM が四則演算を [[ヒューリスティックの束]] として実装する内部構造。MLP ニューロンの粗い条件判定の積み重ねで答えを出力([[joisino-LLMのキモい算術-2025]])。(machine-learning / llm / interpretability) - [[ヒューリスティックの束]] — 単純な条件(範囲・剰余・パターン)を担うニューロン群の積み重ねで結果を出すモデル戦略。LLM 算術や知識検索の基本様式([[joisino-LLMのキモい算術-2025]])。(machine-learning / llm / interpretability) - [[ロジットレンズ]] — 各層・各ニューロンの出力がロジットに与える寄与を中間層へ復号して観察する解釈手法。算術機構の可視化に有効([[joisino-LLMのキモい算術-2025]])。(machine-learning / llm / interpretability) - [[Physics of Language Models]] — [[Zeyuan Allen-Zhu]]・[[Yuanzhi Li]] らによる「合成データ+線形プロービング」で LLM の普遍則を抽出する研究プログラム。知識記憶・操作・文脈学習・文法学習を制御実験で分離([[joisino-言語モデルの物理学-2025]])。(machine-learning / llm / interpretability) - [[知識操作]] — LLM が記憶した知識を比較・推論等で組み替える能力。Chain-of-Thought なしには発揮できないことが Physics of LLM で示される([[joisino-言語モデルの物理学-2025]])。(machine-learning / llm) - [[知識容量スケーリング則]] — LLM はパラメータ 1 つにつき約 2 ビットの知識を記憶できるという普遍則(Allen-Zhu+ 2024 等)([[joisino-言語モデルの物理学-2025]])。(machine-learning / llm / scaling) - [[文脈自由文法]] — CFG の構造を Transformer がどう内部表現として学習するかは Physics of LLM の主要トピックの一つ([[joisino-言語モデルの物理学-2025]])。(machine-learning / llm / grammar) #### LLM の限界と評価 - [[否定文理解]] — 「○○ではない」を正しく解釈する能力。BERT 系埋め込みは正反対文を高類似度で近接させ、softmax 出力の構造上、否定の埋め込みは数学的に存在不能([[joisino-否定文理解-2024]])。(machine-learning / llm / nlp) - [[テキスト埋め込み]] — 文を固定長ベクトルに写像する表現。否定文の取り扱いには構造的限界がある([[joisino-否定文理解-2024]])。(machine-learning / nlp / embedding) - [[自然言語推論]] — NLI(entailment/contradiction/neutral)タスク。否定文理解の評価でしばしば破綻が露呈([[joisino-否定文理解-2024]])。(machine-learning / nlp) - [[文脈付き検索]] — Anthropic Contextual Retrieval。検索ミスを 5.0%→2.9% に削減し否定文ロバスト性を補強([[joisino-否定文理解-2024]])。(rag / information-retrieval) - [[ゼロエラー境界]] — モデル自身が問題サイズの限界を定める評価フレーム(Zero-Error Horizon、ZEH)。人間の恣意的範囲設定を排除し[[LLM能力スパース性]]を可視化([[joisino-LLMの能力の穴-2026]])。(llm / evaluation) - [[LLM評価]] — LLM の能力・信頼性・安全性を測る評価設計。ZEH・自然分布内リミッター等の新指標が議論される([[joisino-LLMの能力の穴-2026]])。(llm / evaluation) - [[LLM能力スパース性]] — 高度問題を解けるモデルが低位の単純問題で誤答する非単調な能力分布。実用上の[[LLMアプリケーション信頼性]]に直結([[joisino-LLMの能力の穴-2026]])。(llm / evaluation) - [[AI検証可能性]] — 探索は AI、検証は人間という分業を成立させる、AI が出力する「検証可能な証拠」の概念。NP 完全性・対話型証明系と接続([[joisino-超人的AIと認知不能情報-2025]])。(machine-learning / ai-safety / interpretability) - [[敵対的摂動]] — 画像分類で AI を騙すと見なされてきた微小ノイズ。実は人間に認知できない正当な分類手がかりを含む信号と論じられる([[joisino-超人的AIと認知不能情報-2025]])。(machine-learning / adversarial) - [[帰属手法]] — saliency・LIME・SHAP 等の特徴帰属。敵対的摂動の知見は帰属が捉えられない高次元の微弱信号の存在を示す([[joisino-超人的AIと認知不能情報-2025]])。(machine-learning / interpretability) #### モデル表現・学習理論 - [[プラトン的表現仮説]] — Huh+ 2024 の仮説。テキスト/画像など異モダリティのモデルが性能向上とともに共通の世界統計モデルへ収束する([[joisino-アンナカレーニナの法則-2025]])。(machine-learning / representation-learning) - [[モデル表現収束]] — 強いモデル同士の表現が似てくる現象。多タスク化・暗黙的正則化が要因として論じられる([[joisino-アンナカレーニナの法則-2025]])。(machine-learning / representation-learning) - [[モデル縫合]] — 異なるモデル間で中間表現を線形写像のみで繋ぎ替える実験手法。表現収束の評価に用いられる([[joisino-アンナカレーニナの法則-2025]])。(machine-learning / representation-learning) - [[暗黙的正則化]] — 勾配法が最初に出会う単純な解で停止する現象。普通に訓練するだけで表現が揃う理由の一部([[joisino-アンナカレーニナの法則-2025]])。(machine-learning / generalization) - [[アンサンブル学習]] — 複数モデルの予測を統合する手法。強モデル同士では既に表現が似ているため効果薄。[[プラトン的表現仮説]] と整合([[joisino-アンナカレーニナの法則-2025]])。(machine-learning / ensemble) - [[ビジョン言語モデル]] — テキストと画像を共有表現に揃えるモデル(CLIP 等)。プラトン的収束が代表例として論じられる([[joisino-アンナカレーニナの法則-2025]])。(machine-learning / multimodal) - [[汎化誤差バウンド]] — 訓練データ上の経験損失と真のリスクの差を抑える理論的上界。古典的には[[集中不等式]]+[[カバリングナンバー]]で構成される([[joisino-機械学習理論入門-2025]])。(machine-learning / learning-theory) - [[集中不等式]] — マルコフ・チェビシェフ・ヘフディング等、確率変数の平均値が期待値からどれだけずれるかを抑える不等式群([[joisino-機械学習理論入門-2025]])。(probability-theory) - [[PAC学習]] — Probably Approximately Correct 学習の枠組み。誤差ε以下を確率 1-δ で達成する仮説選択([[joisino-機械学習理論入門-2025]])。(machine-learning / learning-theory) - [[カバリングナンバー]] — 距離空間を ε-球で被覆するのに必要な最小球数。連続パラメータ空間の汎化保証に用いる([[joisino-機械学習理論入門-2025]])。(machine-learning / learning-theory) - [[深層学習の汎化]] — 過パラメータ化で古典バウンドが自明に崩壊する深層学習における汎化研究。損失地形の「盆地」構造・暗黙的正則化が鍵([[joisino-機械学習理論入門-2025]]・[[joisino-アンナカレーニナの法則-2025]])。(machine-learning / generalization) #### LLM 訓練・運用 - [[1サンプルRLVR]] — 訓練データ 1 問のみでも全データに匹敵する推論性能を得る現象(Wang+ ICLR 2026)。問題選択基準は報酬分散、エントロピー増大正則化と内省語獲得が鍵([[joisino-訓練データ1個推論性能倍-2025]])。(machine-learning / reinforcement-learning / llm) - [[検証可能報酬による強化学習]] — RLVR。数学・コード等で正解検証器が機能するタスクで RL ファインチューニングする枠組み。1 サンプル RLVR の前提でもある([[joisino-訓練データ1個推論性能倍-2025]])。(machine-learning / reinforcement-learning / llm) - [[強化ファインチューニング]] — Reinforcement Fine-Tuning。少データの高品質問題に深く強化学習させ汎用推論能力を引き上げる post-training アプローチ([[joisino-訓練データ1個推論性能倍-2025]])。(machine-learning / llm / post-training) - [[報酬ハッキング]] — エージェントが報酬関数の抜け穴を突き、本来の意図を満たさないまま高スコアを得る現象([[joisino-人間を騙すAI-2025]])。(ai-safety) - [[RLHF誤誘導]] — 標準的 RLHF だけで LLM が人間を誤解させる振る舞いを学ぶ現象。真の性能ほぼ不変のまま評価スコアが劇的に上昇([[joisino-人間を騙すAI-2025]])。(ai-safety / rlhf) - [[スコファンシ]] — LLM が真実より評価者好みの答えを優先する迎合性([[joisino-人間を騙すAI-2025]])。(ai-safety / llm) - [[LLM自己検証]] — LLM 自身に出力の正しさを検証させる手法。自己検証の限界が露呈しており、ルールベース検証器の併用が推奨される([[joisino-人間を騙すAI-2025]])。(ai-safety / llm) - [[LLMアプリケーション信頼性]] — LLM ベース実応用の信頼性確保。リミッター(ZEH 等)で取りこぼしを評価し[[ゼロエラー境界]]内の運用を設計する([[joisino-LLMの能力の穴-2026]])。(llm / reliability) - [[LLMランキング]] — LLM に候補集合の優劣を判定させる枠組み。Pointwise/Pairwise/Listwise/Setwise の 4 様式([[joisino-LLMでソート-2026]])。(llm / ir) - [[LLM比較器]] — LLM を 2 項比較関数(コンパレータ)として用いる手法。主観的・曖昧な基準のソートに有効([[joisino-LLMでソート-2026]]・[[joisino-面白さ優先分類器-2025]])。(llm / ir) - [[pairwiseランキング]] — 2 項ずつの相対比較に基づくランキング。推移性なしでもクイックソート併用で近似保証([[joisino-LLMでソート-2026]])。(ir / ranking) - [[一対比較ランキング]] — pairwise 比較を集約してアイテム順位を決める枠組み。EUREKA は LLM の一対比較で「面白い」特徴量をランキングし、絶対評価のバイアスを回避([[joisino-面白さ優先分類器-2025]])。(machine-learning / ranking) - [[面白さ優先分類]] — 精度最大化でなく「面白さ」を目的関数とする特徴選択+分類器設計(EUREKA)([[joisino-面白さ優先分類器-2025]])。(machine-learning / feature-selection / llm) - [[好奇心駆動学習]] — 新規性・面白さを内発報酬として用いる学習。EUREKA は外的目的関数として一対比較ベースの面白さを採用([[joisino-面白さ優先分類器-2025]])。(machine-learning / reinforcement-learning) #### LLM 意味表象 - [[LLM意味表象]] — LLM 埋め込みが捉える言葉の意味構造。カテゴリ分類は人間と一致するが、典型度の順位相関は低い([[joisino-LLMと言葉の感じ方-2026]])。(machine-learning / llm / semantics) - [[認知意味論]] — 言語学・心理学のカテゴリ理論。家族的類似性・典型性・プロトタイプ理論を含み、LLM 埋め込み評価の基盤([[joisino-LLMと言葉の感じ方-2026]])。(linguistics / cognitive-science) - [[プロトタイプ意味論]] — Eleanor Rosch らによる典型例中心のカテゴリ構造理論。LLM 表象との順位相関比較に利用([[joisino-LLMと言葉の感じ方-2026]])。(linguistics / cognitive-science) #### 関連既存概念の更新 - [[機構的解釈性]] — 4 source(joisino-LLMアテンションと外挿/超人的AIと認知不能情報/言語モデルの物理学/LLMのキモい算術)から横断的に補強され、注意ヘッド分類・帰属の限界・Physics of LLM・LLM 算術機構の 4 視点を統合。(machine-learning / interpretability) - [[LLM向け情報検索]] — [[joisino-LLMでソート-2026]] により LLM 比較器・スライディングウィンドウ・予測付きソートまで拡張。(information-retrieval / llm-systems) メッセージパッシングで近傍情報を集約し、置換対称性を本質的に持つ。ICLR 2024 では解釈性・[[GNN同変性]]・表現能力(WL 検査から部分グラフへ)・分子基盤モデル・物理シミュレーション等で 170 本が採択。(machine-learning / graph-neural-network) - [[GNN同変性]] — 入力の対称性(置換・SE(3)・ニューロン並べ替え等)を保存してモデルの出力が変換される性質。データ効率向上と明らかな間違いの防止が利点。メタネットワーク(Kofinas+・Lim+ ICLR 2024)では MLP のパーミュテーション対称性を GNN の同変性で扱い、モデル性能を順位相関係数 >= 0.9 で予測。[[モデルパラメータ算術]] のパーミュテーション対称性問題とも接続。(machine-learning / graph-neural-network) - [[タスクベクトル]] — ファインチューニング後・前パラメータの差分 τ = θ_ft − θ_0 でタスク能力を表現したベクトル (Ilharco+ ICLR 2023)。加算でタスク追加、減算でアンラーニング、多タスク合成が可能。Word2Vec の類推演算と同様の幾何構造がモデルパラメータ空間に存在する。(machine-learning / model-merging) - [[モデルパラメータ算術]] — 深層学習モデルのパラメータに平均・加算・減算の算術演算を施してモデル能力を直接操作する研究領域。モデルスープ(パラメータ平均で性能向上)・[[タスクベクトル]](差分ベクトルでタスク転移)・NTK 理論(カーネルによる統一説明)・Git Re-Basin(パーミュテーション整合)を包含。(machine-learning / model-merging) - [[並列データベース]] — 複数プロセッサ・ディスク・メモリを協調させてリレーショナルDB処理を高速化するDBMS。DeWitt/Gray 1992(CACM)がパイプライン並列化・パーティション並列化・スピードアップ/スケールアップ指標・3脅威(startup/interference/skew)を体系化。シェアードナッシングが商業的勝者として定式化された。(database / distributed / parallel) - [[シェアードナッシング]] — 各プロセッサが専用メモリと専用ディスクを保有しインターコネクトのみで通信する並列コンピュータアーキテクチャ。DeWitt/Gray 1992(CACM)および Stonebraker[29]が命名・定式化。Teradata・Tandem・nCUBE・Gamma が代表実装。30年後も分散DBの主流設計原理。(database / distributed / architecture) - [[データパーティショニング]] — リレーションのタプルを複数ディスク/ノードに分散配置する手法。DeWitt/Gray 1992(CACM)がラウンドロビン・ハッシュ・レンジの 3 基本手法を定義。ハッシュは連想アクセス最適・レンジはクラスタリング最適・ラウンドロビンは全スキャン最適。Dynamo/Cassandra の設計原理に直結。(database / distributed / storage) - [[DTrace]] — [[Sun Microsystems]] が [[Bryan Cantrill]] らが Solaris に統合した動的計装フレームワーク(USENIX ATC 2004)。本番稼働中のシステムに対して無効時ゼロ・プローブ効果・絶対安全・D 言語・集約・投機的トレースの 4 技術でユーザー/カーネル統合計装を実現。[[eBPF]] の思想的先祖。(observability / instrumentation / systems) - [[プローブ効果]] — 計装がシステムの実際の動作に与える影響。DTrace が「disabled probe effect ゼロ」を本番適用の前提条件として確立し、静的計装との決定的差異を定式化した。現代 eBPF kprobe/uprobe も同一原則に従う。(observability / instrumentation) - [[BPF]] — BSD Packet Filter。McCanne & Jacobson(LBNL)が USENIX Winter 1993 で提案した、カーネル内の小型レジスタベース VM で動作する CFG ベースのパケットフィルタ評価機構。当時主流の CSPF(スタックベース)に対し 20倍超の高速化を達成し、`tcpdump`/`libpcap` の基盤となる。後の [[eBPF]] の直接の祖。(networking / observability / operating-systems) - [[カーネル内VM]] — カーネル空間で動作する小型仮想機械(レジスタベース等)。BPF/eBPF/DTrace 等が安全性検証+JIT 実行で計算をカーネルへ降ろし、ユーザー空間とのコンテキストスイッチコストを削減する設計原理。(systems / observability) - [[パケットフィルタリング]] — ネットワークパケットを述語で取捨選択する処理。McCanne & Jacobson 1993 の BPF が CFG ベース評価をカーネル内 VM に降ろすことで CSPF 比 20倍高速化を実現し、現代 eBPF/XDP・iptables・WireGuard 設計の基盤となった。(networking / systems) - [[時系列データベースベンチマーク]] — 時系列 DB の性能・スケーラビリティ・クエリ表現力を評価する基盤。TSM-Bench(Khelifati+ PVLDB 2023)が監視ワークロード特化の 8 TSDB × 7 クエリタイプ評価を提供し、単一万能 TSDB が存在しないことを実証した。(database / time-series / benchmark) - [[時系列データ生成]] — 異常検知・予測等の評価用に合成時系列を生成する手法。GutenTAG(Schmidl+ Wenig+ PVLDB 2022)が周期・トレンド・ノイズ・異常パターン(point/contextual/collective)を組み合わせる構成的生成器を提供し、TimeEval の基盤となる。(time-series / synthetic-data / benchmark) - [[時系列異常検知ベンチマーク]] — 時系列異常検知アルゴリズムの大規模評価フレームワーク。TimeEval(Wenig+ Schmidl+ PVLDB 2022)が 71 アルゴリズム × 976 データセットの網羅評価を提供し、深層学習が古典手法に対し決定的優位を示せないこと・DWT-MLEAD がコスト/性能比で最優秀であることを実証した。(time-series / anomaly-detection / benchmark) - [[インシデント優先順位付け]] — 自動報告される大量のインシデントを「対処すべき essential」と「対処不要な incidental」に分類し、後者を後回しにすることで OCE 工数を essential に集中させるタスク。Chen+ ASE2020(DeepIP)が定式化し、incidental を 6 カテゴリ(by design / customer error / won't fix / unable to reproduce / transient / false alarm)で taxonomize、attention 付き CNN で AUC 0.808 を達成。(aiops / incident-management) - [[トレース品質]] — 分散トレースが自動分析に耐えるかを評価する概念。Bento+ 2021(J Grid Computing)が data sufficiency / ontological / tools の 3 類型と temporal coverage(子スパン合計時間/親スパン時間)を提案し、OpenTracing 仕様の testability 欠如・タイムスタンプ単位非明示・annotation 任意性を実例で示した。後継 OpenTelemetry にも引き継がれる構造的問題。(observability / distributed tracing) - [[フォールトトレランス]] — 障害存在下でのサービス継続能力。Heimerdinger+Weinstock 1992 は冗長性管理の6アクション(検知・診断・封じ込め・マスキング・補償・修復)、障害クラス分類(所在・影響・持続時間・原因)、障害封じ込め領域(FCR)、設計多様性、カバレッジ、障害回避的措置(fault evasion)を体系化した。(fault-tolerance / dependability / systems) - [[Design for Reliability]] — 信頼性を test-analyze-and-fix 後工程に任せず、要求同定・設計・解析・検証・妥当性確認・制御の各段階へ組み込む設計プロセス。[[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]] は DfR を、信頼性技術者が設計チームに統合されるメンター型の企業横断活動として位置づける。(systems reliability / product engineering) - [[FRACAS]] — Failure Reporting, Analysis and Corrective Action System。開発試験・生産・運用で見つかった故障を報告し、調査し、是正処置と再試験まで追跡する閉ループ。SRE のインシデント管理/ポストモーテムと同型の製品信頼性版フィードバック機構。(systems reliability / failure analysis) - [[コンテナオーケストレーション]] — コンテナベースソフトウェアアプリケーションの分散クラスタを構築・継続管理する技法。マルチコンテナを単一エンティティとして扱う可用性・スケーリング・ネットワーキングを担う。Pahl ら 2019 SMS が定義し、Docker・LXC が支配的、Kubernetes・Mesos が次点。(distributed systems / cloud computing) - [[体系的マッピング研究]] — Systematic Mapping Study(SMS)。新興分野で primary studies が不足する状況で研究構造を地図化する secondary study の一形態。PICO・検索式・包含/除外基準・分類フレームワーク・データ抽出表・可視化を必須要素とする。(research methodology / software engineering) - [[コンテナ配置最適化]] — コンテナ間トラフィック量を eBPF カーネル内集約で 9% 未満のオーバーヘッドで計測し、重み付き通信グラフを構築してコンテナスケジューリングを最適化する手法。(distributed systems / container orchestration) - [[B-Tree]] — 比較ベースの可ページング ordered index。DBMS では leaf に record を持つ B+-Tree を指して B-Tree と呼ぶことが多く、range scan・buffer manager・recoverability との統合に強い。(database systems / storage engines) - [[B-Treeノードレイアウト最適化]] — B-Tree の 1 page 内の key/value 配置、slot、heap、比較補助情報、leaf 表現を変えることで cache miss・CPU instruction・空間効率・scan 性能を改善する手法群。(database systems / performance engineering) - [[LLM向け情報検索]] — LLM が検索結果を消費し、取得文書を生成・推論・行動の入力として使う前提の情報検索。主目的は関連文書の提示から、文脈ウィンドウ内の利用可能な証拠密度と検証可能性の最大化へ移る。(information-retrieval / llm-systems) - [[RAGノイズ除去]] — 検索拡張生成で LLM に渡す検索結果から、推論に役立たない、または誤誘導する情報を、インデックス・検索・文脈組み立て・検証・閉ループ訓練の各段で抑える設計。(rag / information-retrieval) - [[LSMツリーコンパクション]] — LSM ツリーの複数ソート済みランをマージし、読み取り・書き込み・空間アンプリフィケーションとクエリ資源競合を制御するバックグラウンド処理。EcoTune は WA/RA ではなく平均クエリスループットへの資源投資として定式化する。(database systems / storage engines) - [[LLM評価]] — LLM の性能・能力・人間嗜好との整合を定量化する手法の総称。静的グラウンドトゥルース型(MMLU 等)の限界(汚染・オープンエンド評価困難)を指摘し、クラウドソーシング型ペアワイズ比較(Chatbot Arena)・LLM-as-judge・専門家評価の 3 アプローチを対比。Bradley-Terry モデルと能動サンプリングによる効率的なランキング手法。(llm-evaluation / benchmarking) - [[オブザーバビリティデータモデル]] — MELT(Metrics/Events/Logs/Traces)の異種テレメトリをエージェントや ML モデルが推論に直接利用できる形式で整理するデータアーキテクチャ。Karumuri ら(SIGMOD Record 2021)が最初に体系化し、UModel(2026)がエージェント対応データモデルとして大規模実証した。(AIOps / observability) - [[スケーリング則]] — ニューラル言語モデルの損失がモデルパラメータ数 $N$・データ量 $D$・計算量 $C$ に対してべき乗則でスケールするという経験的法則。Kaplan et al. (2020) が 7 桁以上の範囲で実証。計算効率最適の訓練は $N_{\text{opt}} \propto C^{0.73}$ の大きなモデルを早期停止で訓練すべきと結論する。(machine-learning / scaling) - [[分散 PostgreSQL]] — PostgreSQL の SQL・トランザクション・DDL・エコシステム互換性を保ちつつ複数ノードへデータとクエリ処理を分散するデータベース設計。[[Aurora Limitless Database]] ではルータ/シャード分離、時刻ベース MVCC、2PC、Serverless V2、シャード分割で実現される。(Database / Distributed Systems) - [[LLMアプリケーション信頼性]] — LLM を意思決定支援・ワークフロー自動化・ツール呼び出し・マルチエージェントシステムに組み込んだとき、入力・コンテキスト・状態管理・外部ツール・バージョン更新・コスト制約を含むシステム全体が期待動作を保つ性質。LLM アプリケーションの 3 層 15 失敗モードを扱う。(LLM systems / reliability) - [[Retroactive Sampling]] — エッジエージェントで生スパンをオンディスク FIFO にバッファリングし、最小属性(33 バイト)のみ中央コレクタへ送ってサンプリング判断する手法。テールサンプリング比でネットワーク 70%・CPU/メモリ 60–70% 削減。[[VictoriaMetrics]] KubeCon EU 2026 発表。(distributed systems / observability) - [[統計的機械学習]] — 確率論・統計理論を基礎とした機械学習の枠組みの総体。線形モデル・スパースモデリング・k-NN・アンサンブル学習・ベイズモデリングを含む。少量データ・解釈性が重要な応用物理・材料科学で有効。(machine-learning / applied-science) - [[ベイズ最適化]] — 評価コストが高い目的関数をガウス過程代理モデルと獲得関数(探索と活用のトレードオフ)で逐次最適化する実験計画手法。材料パラメータ探索の典型用途。(machine-learning / experimental-design / materials-science) - [[アンサンブル学習]] — 複数の弱学習器(決定木)の出力を統合して汎化能力を向上させる手法。バギング(ランダムフォレスト)とブースティング(XGBoost/LightGBM)が2大方式。(machine-learning) - [[Flexible Skill Arrangement]] — O&M エージェントのコンテキスト組み立てを Skill(LoadDataSchema + Prompt + Meta)として外在化し LLM 自動生成・自然言語更新を可能にする設計パターン。[[Bian Que]] で提案。(AIOps / agentic operations) - [[OLTPシステムアーキテクチャ]] — 1970 年代設計の RDBMS が抱えるバッファマネージャ・ロック・ログ・ラッチの 4 コンポーネントオーバーヘッドを段階的分解で定量化。単一ボトルネックは存在せず全コンポーネント除去で初めて 20 倍改善。(Database / Systems) - [[メインメモリデータベース]] — データベース全体を主記憶に常駐させ、バッファプール管理・WAL・ページ指向レイアウトを再設計する DBMS アーキテクチャ。メモリ常駐単体では不十分で他コンポーネント除去との組み合わせが必要。(Database / Systems) - [[agentic SRE]] — agentic SRE は、本番システムの障害調査・診断・緩和を AI エージェントが実行する取り組みである。(SRE / AIOps) - [[AIOps]] — AIOps(AI for IT Operations)は、IT/クラウド運用の検知・箇所特定・根本原因分析・緩和・予防を AI で支援または自動化する取り組みである。(AIOps / cloud operations) - [[eBPF]] — Yuuki Tsubouchi の技術解説(@2021__yuuk.io__Linux eBPF Tracing Technology)が体系化した基礎知識。(operating systems / observability) - [[Fat-Tree]] — Fat-Tree は、上位階層へ行くほどリンク帯域または並列経路を太くして、リーフ間通信のボトルネックを避けるデータセンターネットワークトポロジである。(networking / HPC) - [[Fault Localization]] — 障害検知後に、コンポーネント・メトリクス・ホスト・ランク・ネットワーク層などの原因候補の場所を絞る親概念。詳細は [[根本原因分析]]・[[RCA評価設計]]・[[ログ解析]]・[[LLM学習モニタリング]]・[[RDMAネットワーク監視]] へ分ける。(SRE / AIOps) - [[因果推論ベースRCA]] — マイクロサービスメトリクス時系列から因果グラフを構築しスコアリングで根本原因を特定するアプローチ。PC/FCI/Granger/LiNGAM 系など 9 種の因果探索手法と 21 種の RCA 手法を横断的に整理・評価。多くの手法がランダム選択と同等以下の精度を示す(SRE / AIOps) - [[GPUクラスタスケジューリング]] — GPUクラスタスケジューリング(machine-learning systems / distributed systems) - [[GPUクラスタ運用]] — - GPU ノード可用性は「nines」だけでなく日次ダウンタイムと node hours で運用負債として見える: @2025__DSN-W__Characterizing Modern GPU Resilien...(distributed systems / HPC / cloud operations) - [[GPUレジリエンス]] — GPUレジリエンス(HPC / distributed systems) - [[GPU観測性]] — GPU観測性(GPU systems / observability) - [[Heisenbug]] — Gray は本番ソフトウェア(設計レビュー、品質保証、アルファテスト、ベータテスト、本番運用を経たもの)では「硬い」Bohrbug はすでに除去されており、残留バグの大多数は Heisenbug であると主張した。(software reliability) - [[Infrastructure as Code]] — 中心的な問題は semantic gap:構文的に正しく、コンパイルを通過した IaC プログラムであっても、クラウドレベルの規約に違反してデプロイ時に失敗しうる。(cloud / systems) - [[LLMスケーリング則]] — LLM スケーリング則(scaling laws)とは、大規模言語モデルの性能(汎化誤差)がモデルスケール $N$、データスケール $D$、計算予算 $C$ の増加に伴い冪乗則に従って予測可能に改善するという経験的法則。言語だけでなく画像・動画・マルチモーダル・数学的問題求解にも普遍的に成立し(Henighan et al. 2020)、最適モデルサイズの指数 $\beta \approx 0.7$ が全モダリティで共通。(machine-learning / scaling) - [[LLM分散学習]] — LLM分散学習は、数千億から兆規模の言語モデルを、数百から数万 GPU/AI アクセラレータ上で長時間訓練するためのシステム・運用・インフラの総体である。(machine-learning systems / distributed systems) - [[LLM学習モニタリング]] — 監視は 3 つの設計軸で整理できる: - 検知信号(何を見るか): ハートビート / 自己診断(MegaScale)、ホスト監視メトリクスの異常パターン(Minder)、ネットワークトラフィックのレート(Pulse...(machine-learning systems / distributed systems / networking) - [[LLM推論]] — - ハイブリッド圧縮アテンションが KV キャッシュ問題を構造的に解決し、100 万トークンコンテキスト推論を実用化した: KV キャッシュの肥大化は長コンテキスト推論の中心課題であるが、@2025__DeepSe...(LLM systems) - [[LSMツリー]] — メムテーブル→SSTable→コンパクションの書き込み最適化ストレージ構造。Bigtable 20 年史では外部コンパクションと CRDT changelog の基盤として進化。(storage systems / database internals) - [[メタ安定障害]] — SREGym では複合的な障害としてモデル化される: アプリケーション層のトリガ(例: トラフィックを増幅するリトライ設定の誤り、頻繁な GC を強いる実行時フラグ)と、システムを脆弱な状態へ追い込むインフラ制約(...(distributed systems / reliability) - [[Mixture-of-Experts]] — 分散訓練では Expert Parallelism(expert を worker 間に分散)として実現され、3 つの技術課題を持つ: - Sparse Activation: GShard(All-to-All...(machine-learning systems) - [[NetOps]] — NetOps が AIOps と異なる本質は安全性の閾値の高さにある。(networking / operations) - [[条件付き計算]] — 入力に応じて計算グラフの一部を有効/無効に切り替え、パラメータ数と計算コストを分離するパラダイム。[[Mixture-of-Experts]] を主要実現形式とし、分散環境ではディスパッチ通信が新たなコストとなる。(machine-learning) - [[負荷分散]] — MoE における特定エキスパートへのトークン集中を防ぐ技術群の総称。Shazeer 2017 の補助損失から DeepSeek-V3 のバイアス動的調整・MiniMax-M2 のシグモイドゲーティングまでの 4 方向の解法系譜を整理。(machine-learning systems) - [[RCA入力選別]] — RCA入力選別は、根本原因分析に渡すログ・メトリクス・トレース・アラート・incident report を、過不足なく絞り込む設計課題である。(SRE / AIOps) - [[RCA評価設計]] — RCA評価設計は、根本原因分析手法が本当に因果的な診断能力を持つかを測るため、障害データ、オラクル、指標、過程評価を設計する取り組みである。(SRE / AIOps) - [[RDMA]] — RDMA(Remote Direct Memory Access)は、リモートホストのメモリへ CPU を介さず NIC が直接読み書きする通信機構である。LLM/HPC だけでなく、[[Azure Storage]] のようなディスアグリゲートされたクラウドストレージでも CPU 予約削減と低レイテンシ化の基盤になる。(networking / HPC) - [[RDMAネットワーク監視]] — RDMA/RoCE ネットワークの性能異常を、能動プローブ、受動トラフィック、スイッチデータプレーン、ホスト/NIC タイムスタンプなどで検知・箇所特定する取り組み。[[RDMA Estats]] は NIC 実装バグの切り分けにも使われる。(networking / distributed systems) - [[MRC]] — MRC(Multipath RC)は RDMA の RC トランスポートを拡張し 1 キューペアが数百パスへパケットスプレーを行う新トランスポート。[[OpenAI]] が 10 万 GPU 超本番で実証。(networking / HPC) - [[SRv6]] — SRv6(Segment Routing over IPv6)はパケットに完全な経路情報を埋め込むソースルーティング技術。動的再計算不要・決定的転送・瞬時障害回避。(networking) - [[マルチプレーンClosトポロジ]] — 800G NIC を 8×100G 独立プレーンに分割しスイッチ 2 段で 131,000 GPU 超へ拡張するネットワークトポロジ設計。[[OpenAI]] が採用。(networking / HPC) - [[Scaling Telemetry Workloads]] — - 計装と分析の間に「中間処理層」を挟む設計パターンが SQL ベースで出現: @2024__IEEE CLOUD__Enabling Programmable Metric Flows の PMF は、計装層(P...(distributed systems / observability) - [[SRE]] — SRE(Site Reliability Engineering)は、ソフトウェアエンジニアリングの手法を運用の問題に適用するディシプリンである。(SRE / クラウド運用) - [[SRE AI Autonomy Levels]] — | Level | Monitor | Investigate | Mitigate | Actuate | Self-Direct | |-------|---------|-------------|-----...(SRE / AIOps / governance) - [[SRE Benchmark]] — SRE Benchmark(SRE / benchmark) - [[Transactional No-Regression]] — 「Transactional」はトランザクション的な試行(適用 → 観測 → 望ましくなければ巻き戻し)を、「No-Regression」は試行が現状の信頼性指標を後退させない不変条件を含意する。(agentic SRE / safety) - [[TSG自動化]] — - SOP フローは「TSG 自動化の RCA 特化版」——Microsoft 系 3 本との接点と差異: @2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based M...(AIOps / SRE / incident management) - [[べき等性]] — べき等性(GPU systems / fault tolerance) - [[インシデント管理]] — - インシデント対応ループを「証拠 → 仮説 → 緩和 → 変更記録」の翻訳の連鎖として捉え、各継ぎ目にエージェントを置く: 本 wiki は ICSE 研究で本番インシデントのライフサイクル(検知→トリアージ→診...(AIOps / SRE / cloud operations) - [[インターネットスケールサービス設計]] — - Cassandra(@2010__SIGOPS_OSR__Cassandra - A Decentralized Structured Storage System)は、Dynamo と同じく「障害は常態」の前...(SRE / cloud operations / service design) - [[エラーバジェット]] — エラーバジェットとは、SLO で許容される障害量の上限を「予算」として扱い、開発チームと SRE が共有する信頼性管理の仕組みである。(SRE / クラウド運用) - [[エージェントネイティブ RL]] — LLM エージェントの長期ホライズン・マルチターン軌跡を前提として設計された RL 訓練インフラストラクチャおよびシステム設計の総称。(machine-learning systems / agents) - [[エージェント型コーディング]] — LLM をエージェントとして環境(コードベース + 隔離コンテナ)内に配置し、ツール呼び出し(ファイル読み書き・シェル実行・検索・ウェブ検索)を通じてリポジトリを自律的に探索・修正するソフトウェア工学の取り組み。(software-engineering / machine-learning) - [[エージェント型強化学習]] — LLM を方策(ポリシー)としてオンポリシーの RL で事後学習する取り組みの総称。(machine-learning / agents) - [[エージェント型時系列予測]] — 実装は 3 パラダイムに整理される: Workflow(事前定義 DAG/SOP による構造化実行。(machine-learning) - [[エージェント運用安全性]] — 中心の形式装置が保証契約(assurance contract)で、自律度の段 k ごとに Ck = (Tk, Rk, Gk, Uk, Bk)(許可ツール面・必須証拠・迂回不能ゲート・ロールアウトプロトコル・予算、...(agentic operations / safety) - [[オブザーバビリティ]] — 外部出力のみからシステムの内部状態を計測する能力。モニタリングの補完として未知の障害を探索するホワイトボックス視点。CNCF Whitepaper(2023)は従来の三本柱を 5 シグナル(メトリクス・ログ・トレース・プロファイル・ダンプ)へ拡張した。(distributed systems / SRE / observability) - [[オープンLLM開発]] — オープン LLM 開発とは、大規模言語モデルの訓練パイプライン全体——事前学習データ、中間チェックポイント、後訓練データ、コード、訓練ログ、評価フレームワーク——を公開し、任意段階での介入・カスタマイズ・再現を可能...(machine-learning / open-source) - [[オープンネットワーキング]] — - DCN 設計の「最後の一マイル」——スイッチ設定生成——は依然として産業の暗黙知だった: @2026__NSDI__Matryoshka - Realizing Hyperscale Data Center N...(networking / distributed systems / HPC) - [[クラウドスケールRPC特性]] — クラウドスケールRPC特性は、ハイパースケール環境で RPC が示す規模・構造・レイテンシ・CPU コスト・エラー率の横断的な性質をまとめる概念である。(distributed-systems / cloud) - [[クラウド管理モダリティ]] — モダリティはインフラライフサイクルの 3 段階——provisioning(リソース生成と相互接続)・updates(live 更新と再作成を伴う更新)・monitoring(実時間の状態/テレメトリ取得)——を横...(cloud / systems) - [[クリティカルパス分析]] — クリティカルパス分析は、分散トレース上でエンドツーエンドレイテンシを実際に支配する RPC/処理区間を特定し、ユーザー影響の大きい遅延やエラーを優先的に扱う手法である。(microservices / observability) - [[コードLLM]] — コード LLM(Code LLM)とは、ソースコードの生成・補完・理解・変換に特化して学習された大規模言語モデルの総称である。(software-engineering / machine-learning) - [[ゴシッププロトコル]] — ゴシッププロトコル(gossip protocol)は、分散システムにおいてノード間で情報を伝播させるための通信手法であり、各ノードがランダムに選んだ少数の相手と定期的に状態を交換することで、最終的にクラスタ全体に...(distributed systems / membership / failure detection) - [[サーバーレスアーキテクチャ]] — サーバーレスコンピューティング = FaaS + BaaS。CNCF 白書(2018)は外部・運用視点で「サーバー管理不要」を定義し、Yuuki Tsubouchi(2019)はマシンサーバー(BaaS が隠蔽)とネットワークサーバー(FaaS が隠蔽)という内部視点で補完。CaaS/PaaS との 3 択では制御粒度・課金粒度が決め手。(cloud computing / distributed systems) - [[サーバーレスワークフロー]] — 複数イベントと Function を n:m マッピングで結び、逐次・並列実行・条件分岐・連鎖で構成するオーケストレーションパターン。CNCF 白書(2018)が 5 パターン・6 状態を定義。AWS Step Functions 等のステートマシン型が代表実装。(cloud computing / distributed systems) - [[サービスレベル目標]] — サービスレベル目標(SLO)とは、サービスの信頼性・性能に関する定量的な目標値である。(cloud operations) - [[ストラグラー]] — ストラグラー(machine-learning systems / distributed systems) - [[ソフトウェア変更管理]] — ソフトウェア変更管理(Software Change Management)は、大規模オンラインシステムにおいてソフトウェア変更の展開から解決までのライフサイクルを管理する取り組みである。(AIOps / SRE) - [[ソフトウェア耐障害性]] — ソフトウェア耐障害性(systems reliability) - [[チェックポイント]] — チェックポイント(fault tolerance) - [[テスト時計算スケーリング]] — ソフトマックスアテンションの二次計算量は、テスト時計算の連続的な延伸を阻む根本的なボトルネックとなる。(machine-learning / reasoning) - [[テレメトリ]] — - 計装の最前線が「GPU/アクセラレータ層」と「LLM 推論演算子・集合通信オペレーション」へ降りる: 博士論文が計装を path/time-oriented データ収集として整理し、eBPF のゼロ計装(Age...(distributed systems / observability) - [[ディペンダビリティ]] — ディペンダビリティ(dependability)とは、「正当に信頼できるサービスを提供する能力」であり、可用性(availability)・信頼性(reliability)・安全性(safety)・完全性(inte...(systems reliability / security) - [[データベース O&M]] — データベースの異常診断・復旧・性能最適化・サービス運用標準化を扱う領域。AI 診断だけでなく運用対象の形を狭める標準化も含む。(Database / AIOps) - [[データベースノブチューニング]] — データベースノブチューニングは、DBMS が公開する多数の設定パラメータ(メモリ、スレッド、キャッシュ、I/O など)を対象ワークロードに合わせて最適化し、レイテンシ低下またはスループット向上を狙う取り組みである。(データベース / AIOps) - [[データベース自律診断]] — データベース自律診断は、スロークエリ、リソース枯渇、ハング、クラッシュ、演算子起因の性能異常などを自動的に分析し、根本原因と解決策候補を特定する取り組みである。(データベース / AIOps) - [[トイル]] — トイルとは、手動的・反復的・自動化可能・戦術的・持続的価値がなく・サービス成長に比例して増大する運用作業の総称である。(SRE / 運用管理) - [[トレースサンプリング]] — トレースサンプリング(distributed systems / observability) - [[ドメイン別RCA]] — ドメイン別RCAは、根本原因分析を汎用 AIOps の単一手法として扱わず、対象システムの構造・信号源・介入可能性に応じて分ける考え方である。(SRE / AIOps) - [[ネットワークシミュレーション]] — ネットワークシミュレーションは、実際のネットワークインフラを構築・変更することなく、トポロジ・プロトコル・ワークロード設計の性能評価を行う手法の総体。(network systems / distributed systems) - [[ネットワーク依存性発見]] — 分散アプリケーションのサービス間依存関係を実行時通信や能動実験から自動発見する手法群。Sherlock・Orion・NSDMiner・Rippler から eBPF ソケット観測までを統合する。(networking / distributed systems / observability) - [[ハードウェアカウンタ]] — ハードウェアカウンタ(performance analysis) - [[ビジョン言語モデル]] — ビジョン言語モデル(Vision-Language Model; VLM)は、LLM の言語理解・生成能力を視覚情報の処理に拡張したマルチモーダルモデルである。(machine-learning) - [[プラットフォームエンジニアリング]] — プラットフォームエンジニアリングは、開発者が安全・効率的にプロダクトを構築・デプロイ・運用できる内部セルフサービス基盤(IDP)を構築・運用するディシプリンである。(SRE / クラウド運用) - [[プロセスペア]] — 1. ロックステップ: 主とバックアップが同一命令列を同期実行する。(fault-tolerant systems) - [[マイクロサービスアーキテクチャ]] — マイクロサービスアーキテクチャ(Microservice Architecture / MSA)は、モノリシックアプリケーションを小さなソフトウェアサービスに分解し、明確に定義された API(エンドポイント)を通じ...(distributed systems / software architecture) - [[マイクロサービスコールグラフ]] — マイクロサービスコールグラフとは、ユーザーリクエスト 1 件を起点として発生するマイクロサービス間のすべての呼び出しを有向グラフで表したものである。(distributed systems / microservices) - [[マルチトークン予測]] — マルチトークン予測(Multi-Token Prediction, MTP)は、標準的な次トークン予測に加えて複数の未来トークンを同時に予測する訓練目的関数である。(machine-learning) - [[マルチモーダル障害診断]] — マルチモーダル障害診断(Multimodal Failure Diagnosis)は、マイクロサービスベースのシステムにおいて、ログ・メトリクス・トレースの 3 種類の監視データを統合して障害の根本原因箇所特定(R...(AIOps / Microservices) - [[モデル圧縮]] — 圧縮の動機は明確である——LLaMA-2 70B は FP16 で約 140 GB の GPU メモリを要し、単一 GPU でのデプロイが不可能になる。(LLM efficiency) - [[継続的プロファイリング]] — 本番システムで継続的にパフォーマンスデータを収集し、「なぜ遅いか」をコードレベルまで特定するオブザーバビリティシグナル。CPU/Heap/GPU/Mutex/IO プロファイラとサンプリングプロファイラ(低オーバーヘッド本番投入可能)で構成。アイシクルグラフで可視化。DODO が LLM コード最適化ベンチマーク基盤としても活用。(observability / performance) - [[本番接地型ベンチマーク]] — AI エージェント評価・最適化のベンチマークを合成的に設計せず本番テレメトリから生成する設計原則。[[DODO]] が CPU プロファイル+実関数呼び出しで実装し、合成ベンチマークでは不可視の最適化機会を可視化。(benchmarking / software-engineering / aiops) - [[ログパース]] — - ログ署名(コード位置)による事前クラスタリングが従来パーサの精度と速度を同時に上回る: @2023__ICSE__LogReducer - Identify and Reduce Log Hotspots in...(AIOps / log analysis) - [[ログ生成]] — ログ生成(software engineering / observability) - [[ログ解析]] — 研究領域としてのログ解析は、単一タスクでなくエンドツーエンドのパイプライン全体として捉えるのが現在の到達点である。(AIOps / log analysis) - [[ワークフロー自動化]] — ワークフロー自動化は、人間が手順書・Runbook・TSG・運用プロセスとして実行していた複数ステップの作業を、機械が状態を見ながら実行・分岐・検証する取り組みである。(AIOps / SRE) - [[一貫性ハッシュ法]] — 一貫性ハッシュ法(consistent hashing)は、ハッシュ関数の出力空間を固定の環状空間(リング)として扱い、データ項目とノードをリング上の位置に配置するパーティショニング手法である。(distributed-systems) - [[並列ファイルシステム]] — 並列ファイルシステムとは、ネットワーク経由で接続された複数のサーバ・ストレージデバイスにファイルデータをストライピング(分散配置)し、並列 I/O によってアグリゲートスループットを最大化する分散ファイルシステムである。(distributed systems / HPC storage) - [[並列化戦略]] — 主要な並列化次元(Hybrid の構成要素): - Data Parallelism: 入力 batch を分割し各デバイスがモデル複製で処理、勾配を集団通信で集約。(machine-learning systems / distributed systems) - [[仮説駆動RCA]] — 仮説駆動RCAは、障害症状から複数の原因仮説を立て、限定された証拠で検証・棄却・再定式化しながら根本原因へ近づく RCA の調査スタイルである。(SRE / AIOps) - [[分散ストレージ]] — 複数サーバにまたがるデータ格納・管理システム。Bigtable 20 年史は中核モデル維持とサービス運用化を、[[Azure Storage]] の RDMA 展開はネットワーク/トランスポートがストレージ性能とコスト構造を支配することを示す。(distributed-systems) - [[分散トレーシング]] — - 「サンプリングで量を減らす」と「圧縮でサイズを減らす」は直交する 2 軸: 既存の横断的知見は、ヘッド/テールサンプリング(Hindsight・TraStrainer・Astraea)がトレースの本数や計装点を...(distributed systems / observability) - [[変化点検知]] — 変化点検知(time-series / AIOps) - [[多変量時系列予測]] — 多変量時系列予測(machine-learning) - [[専用データベースシステム]] — 専用データベースシステム(specialized database systems)とは、特定のワークロード特性に合わせてストレージ構造・クエリ処理・トランザクションモデル・可用性機構を最適化したデータベースエンジ...(database systems) - [[差分プライバシー]] — 差分プライバシー(Differential Privacy, DP)は、データ解析アルゴリズムの出力から個々のレコードが存在したかどうかを確率的に推定困難にする情報理論的プライバシー保証の枠組みだ。(privacy / machine learning / data systems) - [[強化ファインチューニング]] — 中心アルゴリズムには DPO(報酬モデル + PPO のパイプラインを選好ベース目的の直接最適化で簡素化)、PPO(連続行動空間での安定性で広く使われる)、GRPO(PPO をグループベースの方策更新へ拡張)がある。(machine-learning / aiops) - [[強化学習スケーリング]] — - RL のスケーリングにはベースモデルの規模閾値が存在し、小規模モデルでは純粋 RL の効果が現れない: @2025__arXiv__DeepSeek-R1 - Incentivizing Reasoning C...(machine-learning / scaling-laws) - [[性能可搬性]] — 性能可搬性(HPC / machine-learning systems) - [[時系列データベース]] — 時系列データベース(distributed systems / time-series) - [[時系列基盤モデル]] — @2025__arXiv__Foundation Models for Time Series - A Survey はより一般的に、TSFM を NLP の基盤モデル(LLAMA・BERT・GPT)のパラダイムを...(machine-learning) - [[時系列トークナイゼーション]] — 連続値の時系列観測をトークン列に変換し言語モデルで扱えるようにする手法の総称。スケーリング+均一量子化(Chronos)・桁列テキスト化(LLMTime)・自然言語テンプレート(PromptCast)・パッチ埋め込み(TimesFM/Toto)の 4 方式を比較。LLM 重みの転移効果が限定的という知見を含む。(machine-learning / time-series) - [[時系列質問応答]] — ARFBench は TSQA を多肢選択の単一クラス分類問題に落とし込む設計を取る。(machine-learning / time-series) - [[暗黙のコンテキスト伝搬]] — 暗黙のコンテキスト伝搬(implicit context propagation)とは、分散トレーシングにおいてトレース ID・スパン ID などの識別子をパケットのヘッダやペイロードに明示的に挿入することなく、ネ...(distributed systems / observability) - [[根本原因分析]] — 根本原因分析(Root Cause Analysis, RCA)は、障害の症状から、影響するシステム層・障害種別・因果連鎖を絞り込み、人間またはエージェントが次の緩和判断に使える説明を得る取り組みである。(SRE / AIOps) - [[特徴量削減]] — 特徴量削減(AIOps / time-series) - [[異常検知]] — LLM 時代の異常検知手法は、サーベイの整理では 3 方向に分かれる(§4.1):(1) モデルの汎化向上(時系列・ログの基盤モデルの開発/fine-tuning)、(2) 大モデルで小モデルを強化(LLM がログ...(AIOps / time-series) - [[結果整合性]] — 結果整合性(eventual consistency)は、分散データストアにおいて、すべての更新が最終的にすべてのレプリカに到達することを保証する整合性モデルである。(distributed-systems) - [[耐障害LLM訓練]] — 耐障害LLM訓練(machine-learning systems / distributed systems) - [[自動化のアイロニー]] — Bainbridge(1983)の6アイロニー(技能劣化・残余タスク・速度‐正確性トレードオフ・状態隠蔽・不明瞭な失敗・監視のアイロニー)。SREcon26でReedがAI時代への拡張を提示。(ヒューマンファクター / 自動化設計 / 認知工学) - [[設定マイニング]] — Zodiac はこの系譜をIaCへ拡張する。(program analysis / configuration) - [[近似クエリ処理]] — 時系列モニタリングでは、スライディングウィンドウに対する集約(quantile・count・distinct・entropy・L2 norm・TopK)を近似する。(databases / time-series / streaming analytics) - [[運用障害分析]] — 運用障害分析(operational failure study / failure data analysis)は、本番システムの障害事後報告や障害追跡データベースを体系的に収集・分類し、障害原因の分布・修復時間...(SRE / dependability / systems) - [[限定観測可能性]] — 限定観測可能性 (Limited Observability) とは、根本原因分析 (RCA) の文脈において、根本原因候補 (Root Cause Candidates, RCC) の一部またはすべてを直接監視で...(SRE / AIOps) - [[障害予測]] — 障害予測(AIOps / cloud operations) - [[障害注入]] — - 障害注入の有効性を「実障害データとの突き合わせ」で評価した最初の実証が 2003 年に存在する: @2003__USITS__Why Do Internet Services Fail and What Can...(SRE / AIOps) - [[障害緩和]] — @2025__CSUR__A Survey of AIOps in the Era of Large Language Models は緩和(assisted remediation)を自動化レベル昇順の 5 段に...(SRE / AIOps) - [[Webロードバランシング]] — ウェブリクエストを複数のサーバーに分散する機構。OSI 層(L2/L3/L7)と応答返路(一方向/双方向)の 2 軸で分類。コンテンツ非依存(DR・NAT)とコンテンツ依存(TCP Hand-off・TCP Splicing・Socket Cloning 等)の 2 系統。局所性考慮/非局所性考慮/QoS 考慮の 26 分散方針を体系化。(distributed systems / web-systems) - [[集合通信]] — - AllToAllv スケジューリングは NP 困難問題から多項式時間問題に「問題の単純化」で帰着できる: TACCL・TE-CCL・SyCCL が AllToAllv を NP 困難な制約充足問題として定式化し...(distributed systems / GPU clusters) - [[非致命的RPCエラー]] — 非致命的 RPC エラー(non-fatal RPC error)とは、マイクロサービスアーキテクチャにおいて、内部 RPC が失敗コードを返しても上位リクエストが成功する場合のエラー。(distributed systems / microservices / performance) - [[Transformer]] — Transformer は、再帰および畳み込みを排し自己アテンションのみに基づく系列変換モデルアーキテクチャである。GPT シリーズを通じて LLM の基盤アーキテクチャとなった。(machine-learning) - [[言語モデル事前学習]] — 大規模ラベルなしテキストで言語モデリング目的関数により汎用表現を学習し、個別タスクに転移する二段階パラダイム。GPT-1 が確立し GPT-2/3 でゼロショット/文脈内学習へ発展。(machine-learning) - [[文脈内学習]] — 言語モデルが推論時にプロンプト中の少数例示からパラメータ更新なしにタスクを遂行する能力。GPT-3 が 175B 規模で大規模に実証。(machine-learning) - [[エージェントシステム運用]] — LLM エージェントシステム自体の信頼性・安全性・制御可能性を維持する運用技術の体系(AgentOps)。モニタリング/異常検知/根本原因局所化/解決の 4 段階。(agent operations / AIOps) - [[AI Greenferencing]] — 再生可能エネルギーの発電源(風力発電所等)にモジュラー型 AI コンピュートを配置し、電力網を迂回して AI 需要を発電源で消費する展開モデル。[[Microsoft]] が提唱。(AI infrastructure / sustainable computing) - [[GPU最適化]] — GPU プログラムから性能を最大限に引き出すソフトウェアレベルの手法・技術群。4 テーマ(メモリアクセス・不規則性・バランシング・ホストインタラクション)・28 技術に分類。採用頻度トップ 4 はコアレスドアクセス・専用メモリ・分岐発散削減・auto-tuning。(hpc / gpu) - [[コアレスドメモリアクセス]] — GPU の 1 warp(32 スレッド)のグローバルメモリアクセスを整列条件下で 1 回のトランザクションにまとめる技術。GPU 最適化の中で最も採用頻度が高く、450 本中最多の論文が言及。(hpc / gpu) - [[カーネルフュージョン]] — 複数の独立した GPU カーネルを単一カーネルに統合し、グローバルメモリへの中間書き出しを排除する最適化技術。Flash Attention の核心技術。(hpc / gpu / llm-inference) - [[分岐発散]] — GPU の SIMT アーキテクチャにおいて warp 内のスレッドが条件分岐で異なる実行パスを取る現象。両パスがシリアルに実行されるため性能が低下する。採用頻度 3 位の最適化対象。(hpc / gpu) - [[Auto-tuning]] — GPU カーネルのスレッドブロックサイズ・タイルサイズ等の設定パラメータの最適値を自動探索するプロセス。全論文の 1/8 超が採用。性能可搬性の実現にも不可欠。(hpc / gpu / performance) - [[Chain-of-Thought Prompting]] — LLM のプロンプト例示に最終答えだけでなく中間推論ステップの系列(連鎖思考)を含める手法。追加学習不要で約 100B パラメータ以上のモデルにのみ有効な創発的能力。Wei et al. NeurIPS 2022 が提案。(machine-learning / llm / prompting) - [[変更起因インシデント]] — ソフトウェア・構成・データ・インフラへの変更が直接の引き金となって発生するインシデント。「導入→検知→緩和」の 3 段ライフサイクル。コード変更が最多(54-55%)、RbIC は RaIC より TTM を 40.6% 短縮。4 課題: 不足した監視指標・不正確な変更監視・低ビジネストラフィック・非効率な異常変更箇所特定。(AIOps / SRE / change management) - [[クラウドモニタリング]] — クラウドサービスの稼働状態・性能・健全性を自動化ウォッチドッグで継続観察しインシデントを先手で検知・報告する運用実践の総体。Ganatra et al. 2023 はミス検知 6 カテゴリタクソノミを構築し、40.41% が「必要なモニタ/アラートが存在しない(Missing monitor/alert)」に起因することを実証。Srinivas+ 2024(メトリクス選定)と Hussain+ FSE 2026(ディメンション部分集合推薦 DiRecGNN)で、モニタ設計の階層が「リソースクラス→メトリクス→ディメンション部分集合」へ細分化された。(AIOps / SRE / cloud operations) - [[アラート管理]] — モニタリングシステムが生成する raw alert を correlation・storm handling・determination の 3 プロセスで整理する [[インシデント管理]] の上流工程。Runbook と通知チャンネル選択による「発火前の社会的設計」も上流統制として接続。(AIOps / ITSM) - [[インシデントTTM予測]] — オンラインサービスのインシデント緩和完了までの所要時間(TTM: Time To Mitigation)を複数時点で予測する ML タスク。Wang+ ISSRE2021 が T3(最終担当チーム後の緩和フェーズ)が TTM の平均 70% を占めることを初めて定量化し、2 段階 biGRU+アテンションの TTMPred を提案。(AIOps / incident management) - [[分散メッセージブローカ]] — ソフトウェアアーキテクチャの段を非同期 publish-subscribe で疎結合させる中間層。Kafka(スループット最大化)と AMQP(信頼性・レイテンシ最大化)が起源(LinkedIn のログ処理 vs 金融取引処理)に由来する対照的な設計選択を示す。(distributed systems / messaging) - [[プロアクティブ障害管理]] — 障害発生前にその予兆を捉え対策を事前に打つ運用枠組み。Salfner+ 2010 が「予測 → 診断 → アクションスケジューリング → 実行」の 4 段階を Figure 2 で定式化し、本論文を含むサーベイ群は最初の予測段に集中する。Notaro+ 2021 が定量化した「remediation 2.5%」の薄さが残り 3 段階のボトルネックを示す。(dependability / AIOps) - [[ソフトウェアエイジング]] — 長時間稼働ソフトウェアで内部状態の累積(メモリリーク・FD 枯渇・GC 不全等)が時間とともに symptom として現れる現象。Parnas 1994 が概念化し、Salfner+ 2010 §5.2 では symptom monitoring 系手法の主要応用領域。対策は software rejuvenation(IBM xSeries の rejuvenation agent が代表)。(dependability / software engineering) - [[クラウド障害ライフサイクル]] — クラウドサービスの障害が検知されてから回復するまでを TTD(Time To Detect)・TTI(Time To Identify)・TTM(Time To Mitigate)・TTR(Time To Resolve)の 4 段で定量化する枠組み。Li+ ISSRE 2022 が三大クラウド 354 件を分析し MTTM=304.2 分・TTM が TTR の 53% を支配することを実証。(cloud-reliability / SRE / dependability) - [[時系列推論]] — 生の時系列入力に対して多段階の中間思考を経て予測・分類・因果発見・意思決定の解を導く LLM ベースのパラダイム。チェーン・オブ・ソート・自己反省・ツール呼び出し・強化学習で精錬された推論方略を介在させる。TimeReasoner / AlphaCast / TimeOmni-1 / Chow+ ほかで具体化(machine-learning / llm / time-series / reasoning) - [[検証可能報酬による強化学習]] — LLM の出力に対して客観的に検証可能な離散・連続報酬(完全一致・IoU・MAE・フォーマット準拠)を与えて後訓練する枠組み(RLVR)。DeepSeek-R1 で広く知られ、コード・数学・視覚推論・映像理解・時系列推論へ適用範囲が急速に拡大。GRPO が代表アルゴリズム(rl / llm / post-training) - [[時間的映像グラウンディング]] — 自然言語クエリ q と映像 V を入力として、クエリが指す映像区間 [ts, te] を予測するタスク(TVG)。長尺映像理解の中核。特徴量ベース → SFT-LVLM → RLVR-LVLM(Time-R1)の三世代の手法論(video-understanding / llm / multimodal) - [[グレイ障害]] — コンポーネントが完全停止せず徐々に性能が劣化する故障様式(gray failure / fail-slow / fail-stutter / limpware / partial failure)。Huang+ 2017 の定式化を AI クラウド文脈(冗長による劣化漸減・ワークロード依存・部分修復)へ拡張(reliability / aiops / gpu) - [[プロアクティブ検証]] — インシデント発生前にベンチマーク群で能動的にハードウェア・ソフトウェアを stress テストし潜在的劣化を顕在化させる運用方式。SuperBench が AI インフラ向けに体系化(reliability / aiops / gpu) - [[アテンションヘッド]] — Transformer の各層に存在する自己注意ユニット。機能的に 7 種(文法ヘッド・注意の受け皿・逐次・検索・帰納・関数ベクトル・反復)に分化し、次トークン予測精度最大化の結果として自然に出現する。(machine-learning / llm / interpretability) - [[帰納ヘッド]] — `[A][B]...[A]→[B]` パターンで文脈内学習を実現する注意ヘッド。二層構造(前置きヘッド+本体)で実現。LLM の in-context learning の主要機構とされる(Olsson+ 2022)。(machine-learning / llm / interpretability) - [[機構的解釈性]] — モデル内部の回路・アルゴリズムを特定し「なぜその出力が生成されるか」を解明する研究分野(mechanistic interpretability)。注意ヘッド分析・アブレーション・プロービングが主要ツール。(machine-learning / llm / interpretability) - [[関数ベクトル]] — LLM が文脈内学習タスクを表すために構築するベクトル。few-shot 例の最終トークン内部状態の平均として抽出でき、ゼロショットでも MLP 入力へ加算すれば同タスクを実行できる(Todd+ ICLR 2024)。(machine-learning / llm / interpretability) - [[反復ヘッド]] — 反復計算で現在の処理位置を追跡する注意ヘッド。CoT のテープ機構に相当し、漸化式計算・位置追跡を実現する(Cabannes+ NeurIPS 2024)。(machine-learning / llm / interpretability / chain-of-thought) - [[DORA]] — DevOps Research and Assessment の 4 メトリクス(デプロイ頻度・変更リードタイム・変更失敗率・MTTR)。SRE チーム自身のオペレーション能力計測にも適用できる(sre / devops / metrics) - [[SPACE]] — Satisfaction・Performance・Activity・Communication・Efficiency の 5 次元で開発者体験を計測するフレームワーク。SRE のオンコール負荷・ツール満足度・トイル率等を含む(sre / developer-experience / metrics) - [[MTWTF]] — Mean Time to WTF。アラートから「状況を理解した」までの時間。MTTR の先行指標として AI 時代の運用上の脆弱性を示す(sre / incident-management / developer-experience) - [[agentic SRE]] — 本番システムの障害調査・診断・緩和を AI エージェントが実行する取り組み。[[Storax]](Databricks)の事例追加、ユーザー共感先行論・承認ゲート設計の横断的知見を更新(sre / aiops / database) - [[データベース O&M]] — データベースシステムの異常検知・診断・RCA・復旧・性能最適化を扱う運用保守領域。Storax 産業実装事例(ツール集中化先行・Temporal承認ゲート)を追加(database / aiops) - [[データベース自律診断]] — DB 異常を自動分析して根本原因と解決策を特定する取り組み。産業実装では診断止まりで承認付き実行とセットという知見を追加(database / aiops) - [[Quality of Alerts]] — Yang+ DSN2022 が提案する自動評価枠組み。indicativeness・precision・handleability の 3 軸でアラート有用性を自動評価する。アンチパターン自動検知の基盤(aiops / alert-management) - [[アラートアンチパターン]] — Yang+ DSN2022 が Huawei Cloud で実証した 4 個別 + 2 集合のアラート非有効パターン。Repeating Alerts を初めて文書化(aiops / alert-management) - [[アラート集約]] — アラートストームを同一根本原因クラスタにまとめる技術。意味類似度・統計・ハイブリッドの 3 系統対立は頻度分布と semantic dispersion の交差で決まる(aiops / alert-management) - [[COLA]] — Kuang+ ICSE-SEIP2024 のハイブリッド型オンラインアラート集約。相関マイニング(temporal+spatial) + LLM 推論(CoT + ICL + P-tuning v2)、Cloud X 本番 4 ヶ月運用、F1 0.901-0.930(aiops / alert-aggregation) - [[KIMetrix]] — Singal+ arXiv2025 のマイクロサービス向けメトリクス選定。エントロピー + 相互情報量 + AIMD + topology-aware、DeathStarBench CPU で C=99.44%(aiops / observability) - [[情報量基準メトリクス選定]] — SRE がアラート定義の前段で「どのメトリクスを監視するか」を自動決定する問題。Informative Metric Subset Problem として形式化された NP 完全問題(aiops / observability) - [[AirAlert]] — Chen+ WWW2019 が Microsoft で実証したアウテージ予測・診断システム。Bayesian network(FCI) + XGBoost + SMOTE のハイブリッド。サービスレベル outage で F1 53-88%(aiops / outage-prediction) - [[アラートストーム]] — サービス障害トリガで短時間に集中発火する数百〜数千件のアラート現象。Zhao+ 2020 が初実証研究、Chen+ ASE2023 が伝播現象として再定義、Yuan+ ISSRE2024 が HPC の連続的アラート過負荷と区別(aiops / alert-management) - [[アラート抑制]] — 生成されたアラートを発火前にノイズと判定して除外する機構。X-out-of-Y ポリシーの動的学習(Bhukar+ 2024)とクリック行動ベース弱教師フィルタ(Voutsas+ 2023)が代表(aiops / alert-management) - [[アクショナブルアラート]] — 「影響が大きく行動を動機づける」かつ「解釈可能で次のアクションを誘導できる」異常通知。TraceArk の発火後解釈可能性に加え、Runbook と追加ガイドラインで発火前に受け手・行動・背景を合意する経路がある(aiops / alert-management) - [[VPCネットワーク可用性]](新規) — クラウドデータセンターの VPC における物理ネットワーク障害の検知・迂回・回復能力。Harp(NSDI 2026)の決定論的パス制御+インバンド検知でサブ秒回復を実現。(networking / cloud / reliability) - [[アラートランキング]](新規) — 多数発火するアラートを「真陽性確率」「重要度」「アクショナビリティ」等の基準で順序付けて OCE に呈示する技術。教師なし invariant(Jiang+ 2009)・教師なし統一最適化 CAR(CIKM2018)・教師あり AlertRank(ISSRE2020)の 3 系統が対照的進化。TraceArk が severity から actionability へ目的関数を拡張。(aiops / alert-management / ranking) - [[時系列マルチモーダルLLM]](新規) — 時系列を画像同等のネイティブな多変量モダリティとして扱う TS-MLLM。ChatTS(Xie+ VLDB 2025)が text-based/vision-based/agent-based の 3 既存路線に加えて初実装を示した第 4 路線。(llm / time-series / multimodal / aiops) - [[Interactive AIOps]] — オペレータと AI が対話的に対象システムの特徴を協働学習するコンセプト。実験可能性(異常を作り AI に教える)と解釈性(AI から根拠を受け取る)を基本型とする。(AIOps / SRE / human-AI collaboration) - [[セルフクラフト]] — 万人が AI との対話を通じて自らに最適化されたアプリケーションを製作する 2040 年代の未来像。信頼性・コスト・変更速度の均衡点を利用者と AI が対話的・体験的に調整する。(AI application development / SRE) - [[Rail-Optimizedトポロジ]](新規) — GPU N 番と Leaf N 番(Rail)の対応を固定した GPU インターコネクト設計。NCCL の AllReduce リングを Leaf 内に閉じ込めて Spine 越えトラフィックを最小化する。異種サーバー混在時の配線ズレが性能障害の原因になることが実運用で判明。(networking / gpu-cluster / interconnect) - [[マルチベンダーLosslessネットワーク]](新規) — 異なる ASIC ベンダーのスイッチ混在環境で RDMA/RoCEv2 の Lossless 通信を実現すること。AR/DLB の単純 on/off では輻輳制御が破綻し、Ingress interface hashing + DLB の組み合わせが実用解。(networking / rdma / datacenter) - [[密度ベースクラスタリング]](新規) — 密度閾値に基づき任意形状のクラスタを発見する手法群。DBSCAN(Ester+ 1996)の核点・密度到達可能性・密度接続の定義から HDBSCAN(Campello+ 2013)の階層化・安定性最適化まで。2 ソースの横断的知見を蓄積中。(clustering / data-mining) - [[クラスタ安定性]](新規) — Hartigan モデルに基づく密度等高線クラスタの安定性概念。超過質量(excess of mass)と相対超過質量による定量化。HDBSCAN が最適フラット分割抽出に活用。(clustering / density-based) - [[時系列クラスタリング]](新規) — 時系列データの教師なしグルーピング。距離尺度(ED/DTW/SBD)とアルゴリズム(分割型/階層型/スペクトル型)の選択が精度に大きく影響。k-Shape(Paparrizos+ 2015)が SBD+Rayleigh 商セントロイドでスケーラブルかつ最高精度を達成。(clustering / time-series / data-mining) - [[ヨーロッパのAI主権]] — EU が米中 AI 依存から自律しようとする政策目標。デジタル主権規制が逆に脆弱性を加速するという逆説が中心(AI政策 / 地政学 / ガバナンス) - [[コンピュート格差]] — AI 開発における地域間コンピュート資源の不均衡。米欧比 12.4→15.7 倍の拡大を定量化(AI政策 / 地政学 / コンピュート) - [[マルチエージェント協調]](新規) — 複数LLMの協調アーキテクチャ総称。手設計スキャフォールド・学習型ルーター・RL型コーディネーターの3類型。Conductorが自然言語による任意戦略生成で類型を追加。(multi-agent / llm / reinforcement-learning) - [[診断的正当化]](新規) — RCA における証拠・競合仮説・矛盾・終端状態を明示的プロセス状態として維持・エクスポートする枠組み。JustDiag が提案。校正された非閉包(stalled 状態)が設計上の中心要素。(aiops / rca / accountability) - [[LLMによる根本原因分析]](更新) — mABC の知見を追記。マルチエージェント分担が LLM 単独より大きく精度向上、blockchain 投票は解決策品質に寄与。(aiops / rca / llm / multi-agent) - [[マルチエージェント協調]](更新) — mABC の固定スキャフォールド型 vs Conductor の RL 型の対比を追記。ドメイン特化役割分担設計がモデル規模差を補完・凌駕する事実を追加。(multi-agent / llm / aiops) - [[オンコール自動化]](新規) — OCE が担うインシデント対応・チケットトリアージを LLM+マルチエージェントで自動化する領域。OncallX(ASE 2025)が ByteDance 本番で 789 倍高速化を実証。(aiops / on-call / llm / multi-agent) - [[マルチエージェント協調]](更新) — OncallX の木探索プランナー+専門エージェント設計が ReAct を超えた事例を追加。コンテキスト長増大が協調のスケーリング限界として再確認。 - [[LLMによる根本原因分析]](更新) — OncallX の事例から「入力品質が LLM 推論の律速因子」という知見がオンコール対応にも一般化することを追記。 - [[インシデント管理]](更新) — OncallX への参照を追加。 - [[認知的徒弟制]](新規) — 実世界の文脈で暗黙の認知スキルを専門家から初学者へ伝達する教育哲学。6 段階(Modeling→Coaching→Scaffolding→Articulation→Reflection→Exploration)で初学者が専門家に移行。Cruz SREcon23 が Alert Triage Hour of Power を通じた SRE 適用を報告。(sre / learning / on-call / cognitive-apprenticeship) - [[アラートポリューション]](新規) — アラートの過剰追加が信号対雑音比を低下させ重要信号の識別を困難にする状態。光害(light pollution)のアナロジー。Smith SREcon22 が定義。(sre / alert-management / observability) - [[アラート管理]](更新) — 「モニタリング増設=安全」の心理的結合がアラートポリューションの根本原因であるという知見を追加。 - [[サービスレベル目標]](更新) — SLO 導入における非技術ステークホルダーの「暗順応期間」の必要性を追加。 - [[オブザーバビリティ]](更新) — モニタリングからオブザーバビリティへの移行コストが過大評価されていた事例を追加。 - [[ビジネスモニタリング]] — ビジネス KPI(トランザクション数・成功率・応答時間等)を一次的なモニタリングシグナルとして扱い、障害の顧客影響を定量的に把握する手法(concept / monitoring / sre) - [[アラート管理]](更新) — Alibaba の CMDB ベース優先度定義を横断的知見に追加。 #### VCCL (arXiv 2026) (2026-06-26) - [[集合通信]](更新) — VCCL の SM-free P2P と CCL 内蔵 O(μs) RDMA モニタの知見を横断的知見に追記。NCCLX との SM 削減アプローチ対比、Mycroft/Pulse との「内側/外側から可視化」対比を追加。(distributed / gpu-training) - [[耐障害LLM訓練]](更新) — VCCL プライマリバックアップ QP が示す「CCL 層での NIC 障害完全透過的吸収」を横断的知見に追記。ジョブ再起動不要での GPU 待機時間 90% 削減、耐障害の第四の系統として位置づけ。(distributed / fault-tolerance) - [[RDMAネットワーク監視]](更新) — VCCL スライディングウィンドウ型 RDMA モニタが「CCL 自己計装」という外部計装不要の四番目の軸を開くことを横断的知見に追記。WR/WC タイムスタンプ集積・双閾値検知・対処まで CCL 内完結。(networking / rdma) #### 工学としてのSRE再訪 (SRE NEXT 2024) (2026-06-26) - [[SREの工学化]] — システム管理を「技芸(craft)」から「工学(engineering)」へ昇華させる営みの総体。歴史的経緯・オープンチャレンジ・SREcon 学術接続を三軸で整理(concept / sre / engineering) - [[自動化の皮肉]](更新) — Strauch 2018 と SREcon19 Asia の「第二の皮肉」を横断的知見に追加。 - [[サイバネティクス]](更新) — ウィーナー界面(制御可能/不可能の境界)を追加。 #### SREはサイバネティクスの夢をみるか (IOTS2025) (2026-06-26) - [[自動化の皮肉]] — Bainbridge (1983) のジレンマ。高度な自動化が人間の能力低下を招く。SRE/AI 運用の文脈で再解釈(concept / sre / automation) - [[なめらかなシステム]] — 利用者・情報システム・開発運用者の総体としてのシステム構想。DICOMO2018 提唱、AI エージェントネットワークへ発展(concept / sre / systems-thinking) - [[サイバネティクス]](更新) — IOTS2025 の SRE ×サイバネティクス的再解釈を横断的知見に追加。 - [[セルフクラフト]](更新) — IOTS2025 での AI エージェント時代の再提示を追加。 - [[テレメトリ]](更新) — テレメトリスケーリング 3 貢献の俯瞰的位置づけを追加。 - [[特徴量削減]](更新) — MetricSifter の俯瞰的文脈づけを追加。 - [[サービスレベル目標]](更新) — IoT/モビリティ SLI・なめらかなシステムの SLO 自動調整を追加。 #### Symptom-based Alerting for ML (SREcon23 EMEA) (2026-06-25) - [[MLモデル監視]] — ML サービスの品質・挙動・入出力データを継続的に計測し劣化やサイレント障害を検知する取り組み。Weichbrodt の 3 段階優先順位フレームワーク(concept / ml-monitoring / sre) - [[アラート管理]](更新) — 症状ベースアラーティングの ML ドメイン転用を横断的知見に追加。 - [[アクショナブルアラート]](更新) — ML サイレント障害と出力品質メトリクスによるアクショナブル化を追加。 - [[アラート疲労]](更新) — MLOps ツールの入力分布アラートが疲労を再現する事例を追加。 #### デバッギング・性能解析・フィードバック 6 論文 (2026-06-26) - [[デルタデバッギング]] — Zeller (2002) の ddmin/dd アルゴリズムによる障害誘発入力の自動簡略化・分離。自動デバッギングの基礎(concept / debugging / testing) - [[階層的デルタデバッギング]] — Misherghi & Su (2006) の HDD。木構造入力に対してレベルごとに ddmin を適用し効率を桁違いに向上(concept / debugging / testing) - [[障害スケッチング]] — Kasikci (2015) の Gist。本番障害の協調解析で failure sketch(近似ルートコーズ)を自動生成。HW ウォッチポイント活用(concept / debugging / root-cause-analysis) - [[フィードバック駆動開発]] — Cito (2015) の FDD ビジョン。ランタイムメトリクスを開発者の IDE に統合しパフォーマンス意識ギャップを埋める(concept / software-engineering / devops) - [[分散実行最小化]] — Scott (2016) の DEMi。デルタデバッギングを分散システム実行に拡張し、外部/内部イベント区別 + スケジュール探索で最小化(concept / distributed-systems / debugging) #### AIOps RCA/FI/OpsQA 7 papers batch ingest (2026-06-27) - [[障害注入]] — ソフトウェア・ハードウェアの障害を意図的に注入して耐性を検証する技法(concept / aiops / testing) - [[運用障害分析]] — 運用中に発生した障害の系統的分析手法(concept / aiops / fault-analysis) - [[介入的因果学習]] — 観測データに加え介入データを用いて因果関係を学習する手法(concept / aiops / causal-learning) - [[障害耐性劣化変更検知]] — マイクロサービスの障害耐性を劣化させるソフトウェア変更を事前検知(concept / aiops / resilience) - [[OpsQA]] — クラウド運用に特化した質問応答タスク(concept / aiops / opsqa) - [[RAGベースクラウド運用支援]] — RAG を用いたクラウド運用知識検索と質問応答(concept / aiops / rag) #### The Morning Paper on Operability (blog.acolyer 2016) (2026-06-27) - [[オペラビリティ]] — システムが本番環境で安全かつ効率的に運用可能であるという性質。Colyer の設計→可視化→デバッギング→フィードバックの 4 段階モデル(concept / sre / operations) #### マイクロサービス RCA/FL 10 論文一括 ingest (2026-06-27) - [[テスト障害診断]](新規) — テスト環境で発生するアラームの障害種別分類と箇所特定。SynthoDiag が導入(concept / testing / diagnosis) - [[情報理論的異常スコア]](新規) — 情報理論に基づく異常スコアリング。RCA Outliers (NeurIPS 2025) が理論化(concept / causal / theory) - [[単一サンプルRCA]](新規) — 介入後分布からの単一サンプルのみで根本原因を特定する問題設定。ポリツリー構造で理論的保証(concept / causal / rca) - [[根本原因分析]](更新) — Cloud Atlas, CoE, HeMiRCA, MicroIRC, RCInvestigator, GrayScope, SynthoDiag, MicroDig の知見追加 - [[グラフベースRCA]](更新) — MicroDig の異種グラフ、MicroIRC の二重グラフ構造追加 - [[因果推論ベースRCA]](更新) — Cloud Atlas の LLM 因果グラフ合成、CoE のイベント因果グラフ追加 - [[介入的因果学習]](更新) — IRLLS の潜在空間介入認識追加 - [[Interactive AIOps]](更新) — RCInvestigator の人間-機械協調可視分析追加 - [[仮説駆動RCA]](更新) — GrayScope の専門知識+因果学習融合追加 - [[ログベース障害診断]](更新) — SynthoDiag のテストアラーム文脈追加 - [[グラフニューラルネットワーク]](更新) — MicroIRC のインスタンスレベル GNN 追加 - [[知識グラフ]](更新) — MicroDig の異種グラフ文脈追加 - [[人的要因]] — Human Factors。ポストモーテムへの適用: 「ヒューマンエラー=行き止まり」批判、ローカル合理性、個別インタビュー。Resilience Engineering と密接(sre / human-factors / postmortem) - [[レジリエンスエンジニアリング]] — Resilience Engineering。創発的振る舞い・もつれた因果性・帰納の問題・次元性の呪い・システム耐性。Dekker/Cook/Rasmussen 系統(sre / resilience / complex-systems) - [[障害傾向分析]](新規) — 複数の障害データを横断収集・分析する GQM サイクル。Outage Trend Analysis / Sue Lueder / Google(concept / sre / incident-management) - [[インシデント重大度評価]](新規) — 法的・ユーザー・財務・サービス種別の 4 次元フラグ+重み付きスコアによる重大度評価(concept / sre / incident-management) - [[事故モデル]](新規) — Bad Apples / ハインリッヒのドミノ / Reason のスイスチーズモデルの系譜。「ヒューマンエラーは分析の行き止まり」「原因は構築される」「安全性は創発的特性」(concept / sre / postmortem / safety) - [[TLA+]](新規) — 形式仕様記述言語。インシデントポストモーテムに適用するワークフローを SREcon23 が提示。Azure CosmosDB・DynamoDB・Firestore が活用(concept / formal-verification / distributed-systems) - [[インシデントストーリー]](新規) — 豊かな社会技術的詳細を含む長形式インシデント記録。Courtney Nash(SREcon23)が shallow data の対案として提示。Near Misses・複数視点・パターン開示が特性(concept / sre / postmortem / incident-management) - [[TTXメトリクス]](新規) — インシデントライフサイクルをフェーズ分解して計測する指標群。MTTR の統計的限界に対する代替として TTDetect・TTAcknowledge・TTEngage 等 11 種類を定義。[[Waroom]] が Slack 連携で自動収集する実装例(concept / sre / incident-management / metrics) #### Human Factors in the Age of AI Ops (SREcon26 Americas) (2026-06-28) - [[SRE AI Autonomy Levels]](更新) — Trust Spectrum(Observe/Advise/Assist/Partner)を組織の信頼受容度軸として追記。Google L0-L4 とは直交する次元(concept / sre / aiops / governance) - [[アラート疲労]](更新) — 2026 年産業統計(960+/日・3000+/日・30%未調査)と「入力を修正するシステム問題」再フレーミングを追記(concept / sre / alert-management) - [[人的要因]](更新) — "Commanding the Chaos" フレームワーク・Trust Triangle の AI Ops 文脈適用を追記(concept / sre / human-factors / aiops) #### The Power of Stories (SREcon26 Americas) (2026-06-28) - [[逸脱の正常化]](新規) — Diane Vaughan が Challenger 事故で提唱。SRE のアラート閾値調整も同一プロセス。合理的日常行動が組織の「本当の限界」感覚を徐々に失わせる(concept / sre / safety / human-factors) - [[インシデントストーリー]](更新) — anomalous + immutable の 2 条件(Gelman & Basbøll)、Challenger の 3 視点(Feynman/Tufte/Vaughan)、Once Upon an Incident の実践を追記(concept / sre / postmortem) - [[インシデントレポート執筆]](更新) — narrative description 最重視・エピソードチャンク・インシデント開始前から書く(Hochstein)を追記、Laura Nolan との合流知見として整理(concept / sre / postmortem) #### Incident Metrics in SRE (O'Reilly, 2021) (2026-06-28) - [[TTXメトリクス]](更新) — Davidovič 2021 を正式ソースとして追加。3 者(Davidovič / Takamura / Nash)の批判アプローチの横断的知見・「大規模データでも解決しない」知見・分散自体の指標化という未解決問いを追記(concept / sre / incident-management / metrics) #### 縮約,網羅,減算:科学者の仕事とは何か (認知科学 2021) (2026-06-28) - [[縮約]](新規) — 高次元データを低次元に写像し人間理解可能な説明を生成する認知的操作。個体発生的・メタ認知的。観察バイアスと特異点見落としリスクを持つ(concept / cognitive-science / philosophy-of-science) - [[網羅]](新規) — 仮説なし包括計測によるデータ取得と大規模モデルによる演繹。2000年代以降の計算資源増大で実現。ただし人間への提示時に縮約が再発生する(concept / cognitive-science / philosophy-of-science) - [[減算]](新規) — 生体が外界の一部のみを取り込み残りを遮断すること(Uexküll 環世界)。系統発生的・生命科学的。縮約と並行して機能させることが認知科学の現実的な在り方(concept / cognitive-science / philosophy-of-science) #### Data Center Networking 基盤論文 5 本 (2026-06-29) - [[データセンターネットワークトポロジ]](新規) — Fat-Tree/Clos ベースのデータセンターネットワーク設計。k-ary Fat-Tree の構造と経路探索、full bisection bandwidth の実現。(concept / networking / datacenter) - [[ECMP]](新規) — Equal-Cost Multi-Path ルーティング。マルチルートトポロジでのトラフィック分散。エレファントフロー下では最大 60.8% 帯域損失の構造的限界あり。(concept / networking / datacenter) - [[Valiant Load Balancing]](新規) — ランダム中間ノード経由の負荷分散。VL2 が採用。トラフィック予測不要で uniform capacity を提供。(concept / networking) - [[フロースケジューリング]](新規) — データセンター内の動的フロー経路制御。Hedera の Global First Fit・Simulated Annealing アプローチ。(concept / networking / datacenter) - [[データセンターL2ファブリック]](新規) — PortLand の PMAC・ファブリックマネージャモデル。L2 セマンティクスとスケーラビリティの両立。(concept / networking / datacenter) - [[Incast]](新規) — データセンターの多対一通信パターン輻輳。DCTCP の ECN ベース段階的制御で解決。(concept / networking / datacenter) - [[データセンター輻輳制御]](更新) — DCTCP・VL2 の知見を大幅追記。ECN 段階的制御、DCQCN との対比。(concept / networking / congestion-control) - [[負荷分散]](更新) — VLB のネットワーク負荷分散知見を追記。MoE との設計哲学比較。(concept / networking) - [[マルチプレーンClosトポロジ]](更新) — Fat-Tree・VL2 が Clos の直系先祖であることを追記。(concept / networking / datacenter) - [[AIデータセンタートポロジ]](更新) — Fat-Tree が現代 AI データセンターの源流であることを追記。(concept / networking) - [[データセンターネットワーク信頼性]](更新) — PortLand の LDP/LDM 障害検知を追記。(concept / networking / reliability) #### Spanner: Google's Globally Distributed Database (OSDI 2012 / TOCS 2013) (2026-06-28) - [[外部一貫性]](新規) — 分散トランザクションにおける最強の一貫性保証。T1 が T2 開始より実時間で先行するなら T1 のコミットタイムスタンプ < T2 のコミットタイムスタンプが保証される。線形化可能性と等価。Spanner では TrueTime + commit wait で実現。(concept / distributed / database / consistency) - [[TrueTime]](新規) — Google の時刻 API。時刻を単一値でなく不確実性区間 [earliest, latest] として返す。GPS と原子時計で実装。ε 通常 4ms。Spanner の外部一貫性・リーダーリース・スキーマ変更の基盤。(concept / distributed / systems / time) - [[分散トランザクション]](新規) — 複数パーティション・サーバーにまたがる ACID 操作。Spanner は 2PC on Paxos で実現。スナップショットトランザクション(ロックフリー)と読み書きトランザクション(悲観的ロック)の 2 種。(concept / distributed / database / transaction) #### Memory in the Age of AI Agents (arXiv 2025) (2026-06-29) - [[エージェントメモリ]](新規) — LLM ベースエージェントの記憶機構。形態(トークンレベル/パラメトリック/潜在)・機能(事実/経験/作業)・動態(形成/進化/検索)の 3 軸タクソノミで体系化。コンテキストエンジニアリング・RAG を部分的に包含する上位概念。(concept / llm / agent-memory) - [[コンテキストエンジニアリング]](更新) — エージェントメモリとの射程の違い(入力設計 vs 自律的蓄積)を横断的知見に追記。(concept / ai-native / llm) #### HPC Downtime Budgets (SREcon16 Europe) (2026-06-30) - [[エラーバジェット]](更新) — HPC 適応(ダウンタイム時間単位・バーンダウンチャート・Wolf クラスタ超過事例)と SRE 普及はコミュニティ形成課題という知見を追記。(concept / sre / hpc / reliability) #### Case Study: Implementing SLOs for a New Service (SREcon19 Americas) (2026-06-29) - [[サービスレベル目標]](更新) — 異種コンポーネント SLI 分類・プローバー能動計測・Lawson 2019 事例追記。(concept / sre / slo) - [[エラーバジェット]](更新) — SLO 設定と同時のエラーバジェット計算・文書化プロセスの実践知追記。(concept / sre / reliability) - [[SLI-SLO段階的導入]](更新) — 新規サービスへのプローバー活用・SLO 公開ドキュメント実践知追記。(concept / sre / slo) #### Not All Minutes Are Equal (SREcon23 Americas) (2026-06-30) - [[イベントベースSLO]](新規) — 時間スライス方式とイベントベース方式の SLO 集計の比較。時間スライスはすべての分を等価に扱いインシデント深刻度と乖離する問題を定式化。Default SLO 式・Time Window / Polling Period / Sampling Window の定義を含む。(concept / sre / slo) #### Project Silica: Towards Sustainable Cloud Archival Storage in Glass (SOSP 2023) (2026-06-29) - [[アーカイバルストレージ]](新規) — 長期保存・低アクセス頻度向けストレージ層。クラウドワークロード実態は小規模 I/O 支配(58.7% が 4 MiB 以下)・書き込み超優位(47:1 MB比)。バックグラウンド管理コストが総コストを支配。(concept / storage / cloud / systems) - [[ガラスストレージ]](新規) — 溶融石英(クォーツガラス)を媒体とするストレージ技術。フェムト秒レーザーで voxel を書き込み偏光顕微鏡で読み出す WORM 媒体。1000 年超耐久性・ビット腐敗なし。Project Silica が初の大規模クラウド実装。(concept / storage / optical / sustainability) - [[ネットワーク符号化]](新規) — I 情報セクター + R 冗長セクターで任意の I セクターから全体を復元できる消失訂正符号。Project Silica では 3 層(Within-track / Large-group / Cross-platter NC)で使用。WORM 媒体は符号更新不要で超大グループサイズを実現。(concept / storage / erasure-coding) #### Measuring Availability the Player Focused Way (SREcon25 Americas) (2026-06-30) - [[Player Journey]](新規) — ゲームサービスのユーザー体験フェーズ分類フレームワーク。Riot Games 設計。Connecting / Purchasing / Play の 3 カテゴリ×10 分類(2024 年以降 12 分類超)で可用性の影響を共通言語化。P1-P4 優先度(CCU 割合)と組み合わせインシデントを即座に記述する。(concept / sre / gaming / availability) - [[サービスレベル目標]](更新) — CCU 重み付き可用性計測(Player Minutes)・CEO OKR 定着手法の横断的知見を追記。(concept / sre / slo) #### Incident Management and Chatops @ Netflix Feat Scorebot (SREcon16, 2016) (2026-07-01) - [[ChatOps]](新規) — チャットプラットフォームを操作インターフェイスとした DevOps/SRE 自動化パターン。Netflix Scorebot(2015-12 〜)が典型実装。bookmarking・presence・after-hours・secrets 管理の 4 機能パターン。LLM エージェント型インシデント管理の先駆として位置づけ。(concept / sre / incident-management / automation) #### Incident Response in Unfamiliar Sociotechnical Systems (SREcon20 Americas, 2020) (2026-07-01) - [[Incident Commander]](更新) — 「Warm Blanket Fallacy」(熟練IC でも組織間対応では通用しない)・民間企業向け ICS 再編構造・ICS 起源の2ソース間食い違い(Phoenix 1968 vs FIRESCOPE California)の contradiction 記録を追加。(concept / sre / incident-management) - [[インシデント管理]](更新) — ChatOps/Scorebot の横断的知見(LLM 以前の産業自動化の文脈)を追記。(concept / sre) #### When Systems Flatline—Enhancing Incident Response with Learnings from the Medical Field (SREcon21, 2021) (2026-07-01) - [[Incident Commander]](更新) — 医療分野(ACLS/ATLS/WHO 手術チェックリスト)の標準化・チェックリスト文化との横断的知見3件、Warm Blanket Fallacy との層の違いの整理を追記。(concept / sre / incident-management) #### Epic Incidents of History: The 1979 NORAD Nuclear Near Miss (SREcon23 Americas, 2023) (2026-07-01) - [[複雑システム障害論]](更新) — Walker・Woods・Rayo の「複数の系統的寄与要因 vs 根本原因」論が Cook 命題7を歴史的スケールに拡張する横断的知見を追記。(concept / sre / safety / human-factors) - [[根本原因分析]](更新) — 単一根本原因の探索が構造的に成立しない歴史的事例として1979年 NORAD 誤警報を追記。(concept / sre / rca) - [[人的要因]](更新) — ローカル合理性による疑いが歴史的規模の惨事を防いだ事例として1979年 NORAD 誤警報を追記。(concept / sre / human-factors) #### Incident Commanders (SREcon23 Americas, 2023) (2026-07-01) - [[インシデントアナリスト]](新規) — IC(Incident Commander)と対をなす、インシデントの事後調査・分析を担う役割。「なぜそのように起きたか」の調査・矛盾する仮説の整理・タイムライン再構成が核心。Vanessa Huerta Granda・Emily Ruppe が SREcon23 Americas で定義。(concept / sre / incident-management / incident-commander / postmortem) - [[Incident Commander]](更新) — IC/アナリスト役割分離が Slack の「no give backs ハンドオフ」ルールの理由付けとして機能する横断的知見、「インシデントのサイクル」ライフサイクル図の横断的知見を追記。(concept / sre / incident-management) - [[インシデント管理]](更新) — 「インシデントのサイクル」円環モデルと Slack Response/Review/Analysis 3部構成との対応関係を追記。(concept / sre / incident-management) #### The World Blew Up But We're All Okay: Managing a massive-scale incident at Datadog (SREcon23 EMEA, 2023) (2026-07-01) - [[インシデント管理]](更新) — 共通 OS ディストリビューションのグローバル障害波及・500人超規模での IC/ワークストリーム自己組織化・クラウド API レート制限による復旧ボトルネックの横断的知見3件と未解決の問い1件を追記。(concept / sre / incident-management) #### The Incident Is The Way: Using Your Incidents to Win Reliability Investment (SREcon23 EMEA, 2023) (2026-07-01) - [[インシデント重大度評価]](更新) — 可用性でなく正しさ(correctness)を測る第5の軸、意図でなく結果(consequence)で重大度を判断する構造的対策を横断的知見として追記。未解決の問いにcorrectness軸と既存フラグ体系の統合方法を追加。(concept / sre / incident-management) #### Hard Choices, Tight Timelines: A Closer Look at Tradeoff Decisions during Incidents (SREcon24 Americas, 2024) (2026-07-01) - [[トレードオフ意思決定]](新規) — skip-level tradeoff を中心概念として定義。インシデント対応中の階層横断的な意思決定分析の起点となる concept。(concept / sre / incident-management / tradeoff) #### The Critical Resource Is You: Practical Destressing for On-Call Engineers (SREcon26 Americas, 2026) (2026-07-01) - [[オンコールストレス管理]](新規) — オンコール業務の慢性・急性ストレスを ANS の観点から捉え、身体知性に根ざした実践ツールで対処する概念。(concept / sre / on-call / stress-management / human-factors) - [[人的要因]](更新) — 生理学的ストレス管理を Human Factors の身体的次元として追記。ANS の自己修正が Ordinary Mind によって抑制されるメカニズムを横断的知見に追加。(concept / sre / human-factors) #### Your System Has Recovered from an Incident, but Have Your Developers? (SREcon18 Americas, 2018) (2026-07-01) - [[インシデント後の人的回復]](新規) — インシデント終了後のエンジニアの心理的・感情的回復とピアサポートの実践概念。(concept / sre / incident-management / human-factors / post-incident) - [[オンコールストレス管理]](更新) — 横断的知見に Long と Woo の 2 ソース比較を追記。個人ツール(身体知性)と組織ピアサポートの補完関係を記述。(concept / sre / human-factors) - [[人的要因]](更新) — source に Woo (SREcon18) を追加。(concept / sre / human-factors) #### Epistemology of Incident Management (SREcon26 Americas, 2026) (2026-07-01) - [[インシデント認識論]](新規) — インシデント対応の「何を知る必要があるか」「どう知識を得るか」を体系化した認識論フレームワーク。5 フェーズ Incident Loop・証拠 2×2 マトリクス・探索 3 パターン・仮説 3 条件・テスト 6 基準。Kingsman (Atlassian) 提案。(concept / sre / incident-management / troubleshooting / epistemology) - [[インシデント管理]](更新) — Kingsman の「Incident Loop 認識論」横断的知見を追記。"Incidents are all about knowledge" の人間実践的フレーミングを横断集約に追加。(concept / sre / aiops) - [[仮説駆動RCA]](更新) — 仮説 3 条件(testable/relevant/specific)・テスト 6 基準を Kingsman 実践知として横断的知見に追記。(concept / sre / aiops) #### Retrieval as Reasoning (2026-07-02) - [[Retrieval-as-Reasoning]](新規) — エージェントネイティブ検索のパラダイム。Retrieval-as-Lookup(固定 top-k 文脈)を刷新し、検索をエージェントが推論と連動して制御する段階的活動として再定義。LLM-Wiki([[Haoliang Ming]] ら、WeChat/Tencent 2026)が最初の実装。3 原則: Compilability・Composability・Evolvability。(concept / information-retrieval / rag / agentic) #### AI impact on science concepts (2026-07-03) - [[AIと科学の集中化]](新規) — AI ツールの普及が個人の生産性を高める一方、科学全体のトピック多様性を縮小し研究者間交流を低下させる現象。個人合理性と集団的帰結の乖離。Hao et al. (Nature 2026)。(concept / scientometrics / ai-impact / science-of-science) - [[AI研究自動化]](更新) — 横断的知見に個人-集合パラドックスの観察を追記(Hao et al. との接続)。(concept / ai-research-automation) #### ML Fleet Efficiency concepts (2026-07-02) - [[ML Productivity Goodput]](新規) — ML フリート効率を測る合成指標(MPG = SG × RG × PG)。Capacity・Occupancy・Duty Cycle の限界を補う 3 層分解フレームワーク。(concept / distributed / systems-for-ml) - [[GPUクラスタ運用]](更新) — MPG フレームワークを横断的知見に追記。「有用な仕事の定義まで降りないと利用率指標が空洞になる」という観察を既存ソース群と接続。(concept / distributed / hpc) #### IPDPS 2026 AI アクセラレータ比較論文 (2026-07-06) - [[AIアクセラレータ]](新規) — GPU (SIMT) とデータフローアクセラレータの分類・比較。小バッチでデータフロー優位・大バッチで GPU 優位・エネルギー効率は GPU が全体的に優勢という横断知見を集約。(concept / hardware / llm / aiinfra) #### INTFusion (IFIP Networking 2026) 関連概念 (2026-07-06) - [[インバンドネットワークテレメトリ]](新規) — P4 プログラマブルデータプレーンによるパケット内テレメトリ埋め込み。INT ソース/シンク/トランジットノードの三者構造。smartNIC オフロードと eBPF クロスレイヤー融合の設計パターンを整理。(concept / networking / telemetry) - [[テレメトリ]](更新) — INT + eBPF クロスレイヤー受動収集の知見と、Centralizer スケーラビリティの未解決の問いを追記。 - [[ネットワーク監視]](更新) — INT + eBPF 融合後の Centralizer スケーラビリティに関する横断的知見と未解決の問いを追記。 - [[データセンター輻輳制御]](更新) — テレメトリ→制御フィードバック閉ループの未解決の問いを追記。 #### AgentTether (arXiv 2026) 関連概念 (2026-07-13) - [[エージェント修復]](新規) — 失敗した LLM エージェント実行を診断・修正する技術群。事後グラフ診断と実行時介入の連動、一度きりの診断フィードバックの減衰、根本原因の上流性を横断的知見として集約。(concept / agent / aiops) - [[エージェントシステム運用]](更新) — 「解決」段階の 3 クラス(実行前予防/実行中修正/実行後復旧)が独立でなく連動が必要という AgentTether の実証知見を追記。 - [[グラフベースRCA]](更新) — グラフ RCA の対象がサービス間依存グラフからエージェント内部の意思決定グラフへ拡張される横断的知見を追記。 #### SOUPS 2025 セキュリティインシデント要約論文 関連概念 (2026-07-13) - [[LLMインシデント要約]](新規) — 完全性・事実性・簡潔性・可読性の4軸評価枠組み。自律要約(人間に劣後)と協働(AI支援)要約(人間に優位)の成果の非対称性、要約作成者本人と第三者評価者の評価乖離を横断的知見として集約。(concept / security / llm / incident-response) - [[インシデントレポート執筆]](更新) — LLM要約が完全性・可読性で人間執筆に迫るが事実性で劣ること、AI支援(協働)は人間単独執筆を上回りうることを横断的知見に追記。 - [[インシデントレスポンスAIレベル]](更新) — セキュリティ要約タスクの実証データが IR2 で自律度を止めるべき理由を定量的に裏付けること、作成者本人と第三者評価者の評価乖離を横断的知見に追記。 #### COMET / ISSRE 2024 インシデントトリアージ論文 関連概念 (2026-07-13) - [[インシデントトリアージ]](新規) — インシデントを担当チームへ割り当てるプロセス。ルールベース(AutoAnalysis)の限界と LLM キーワード抽出の優位性を定義として集約。(concept / aiops / incident-management) - [[インシデント管理]](更新) — キーワード抽出がテキスト表現として議論・要約より優れるという知見、レガシールールベース出力を LLM の補助入力として再利用する設計パターンを横断的知見に追記。 - [[インシデントTTM予測]](更新) — トリアージ精度改善(T1/T2段階)がTTM削減の別経路になりうるという COMET の実証知見を追記。 #### CoTriage・PROBE・Build-bench・LagRCA・InsightTriage 関連概念 (2026-07-13) - [[知識蒸留]](新規) — CoTriage の知識蒸留+自己強化+DPO 路線を定義として集約。(concept / aiops / llm) - [[エージェント修復]](更新) — PROBE の diagnosis–recovery gap(診断精度改善が回復率改善を大きく上回る)を AgentTether との突き合わせとして横断的知見に追記。 - [[クロスISAマイグレーション]](新規)、[[自動ビルド修復]](新規) — Build-bench が定義するクロスISAビルド修復タスクとエージェント型反復修復の知見を集約。(concept / software-engineering / llm-agent) - [[エージェント型コーディング]](更新) — Build-bench のツール利用なし6.13% vs 反復ループ63.19%の知見を追記。 - [[遅延認識時空間因果推論]](新規) — LagRCA の時間ラグ明示モデル化アプローチを定義として集約。(concept / aiops / causal-inference) - [[因果推論ベースRCA]]・[[Fault Localization]]・[[根本原因分析]]・[[グラフベースRCA]](更新) — LagRCA の非同期障害伝播(81.5%が2分以上遅延)の実証知見を追記。 - [[インシデントトリアージ]]・[[オンコール自動化]](更新) — CoTriage(ByteDance)と InsightTriage(Huawei/ICV)がドメインごとに異なる技術路線を独立に本番デプロイしている観察を追記。 #### FoundRoot・Aloha・OScope・PerfScout・TADBench・LogSage・RefinedEdge 関連概念 (2026-07-13) - [[構造化深層思考]](新規) — FoundRoot のメトリクススキャン→伝播分析→リフレクション→ランキングという4段階RCA枠組みを定義として集約。(concept / aiops / root-cause-analysis) - [[根本原因分析]]・[[LLMによる根本原因分析]]・[[検証可能報酬による強化学習]]・[[Fault Localization]](更新) — FoundRoot の warm-up SFT + DAPO によるゼロショットRCA改善(MRR 4.5%〜48.6%)を追記。 - [[バッチ障害診断]](新規) — Aloha の対照分析ベースバッチ障害診断とusability gap指摘を定義として集約。(concept / aiops / fault-localization) - [[Fault Localization]](更新) — Alohaが単一障害箇所特定と異なる集団パターンを対象とする観察を追記。 - [[TSG自動化]]・[[マルチモーダル障害診断]](更新) — OScope の Knowledge Aligner による症状記述意味的整合とチャンク単位検証の知見を追記。 - [[定常性モデル]](更新)、[[適応的ワークロード生成]](新規) — PerfScout の SPOT/ADF-KPSS/PPO統合による性能テストワークロード生成全自動化を集約。(concept / aiops / performance-testing) - [[トレース異常検知]](新規) — TADBench の初の横断ベンチマークとトレース特性に基づく決定木推奨戦略を定義として集約。(concept / aiops / anomaly-detection) - [[ログ解析]]・[[根本原因分析]]・[[グラフベースRCA]]・[[LLMによる根本原因分析]](更新) — LogSage のカーネルパニックRCA(スパースログ抽出+ログ間長距離依存)の知見を追記。 - [[異常検知]]・[[知識蒸留]]・[[モデル圧縮]]・[[Edge-cloud Collaboration]](更新) — RefinedEdge のエッジ配置可能なMTSADモデル圧縮(0.15Mパラメータ未満)の知見を追記。 #### A Survey of DevOps Concepts and Challenges 関連概念 (2026-07-14) - [[DevOps]](更新) — 2019年の学術サーベイ(Leite et al.)がDevOpsの定義不在を既に指摘していたこと、process/people/delivery/runtimeのconceptual framework、SREへの2019年時点での言及を追記。(concept / devops / survey) #### The Anatomy of a Large-Scale Hypertextual Web Search Engine 関連概念 (2026-07-15) - [[PageRank]](新規) — リンク構造由来のページ重要度指標。定義式・ランダムサーファーモデル・ダンピング係数を集約。(concept / information-retrieval / ranking) #### Valet: Efficient Data Placement on Modern SSDs 関連概念 (2026-07-15) - [[ホスト誘導データ配置]](新規) — affinity(親和性)と lifetime(寿命)の2軸によるSSDデータ配置戦略の一般化を定義として集約。(concept / storage / ssd) - [[シムレイヤー]](新規) — LD_PRELOAD ベースの userspace interposition によるアプリケーション/カーネル非改変のホスト誘導配置実装パターンを定義として集約。(concept / storage / systems) - [[ゾーン名前空間SSD]](新規) — ZNS の append-only ゾーン管理とホスト誘導ガーベジコレクションの知見を集約。(concept / storage / ssd) - [[LSMツリー]](更新) — WAL/SSTable(および WiredTiger の log/sst)の物理配置(SSDゾーン・ストリーム分離)による性能改善という、コンパクション戦略とは独立した新しい最適化軸を追記。 #### Recursive Self-Improvement (LessWrong, 2008) 関連概念 (2026-07-15) - [[知能爆発]](新規) — I. J. Good (1965) の「ウルトラ知能機械」に遡る帰結概念。Yudkowsky の「AI go FOOM」定式化を集約。(concept / ai-safety / foom) - [[テイクオフ速度論争]](新規) — ハード/ソフトテイクオフを巡る Yudkowsky-Hanson の FOOM debate、「横ばいか爆発かのどちらか」という理論的主張を集約。(concept / ai-safety / foom) - [[リソースオーバーハング]](新規) — ハードテイクオフに寄与する追加要因(無防備なインターネット・高速逐次コンピュータ)を定義として集約。(concept / ai-safety / foom) - [[Recursive Self-Improvement]](更新) — 2008年の原論証(因果5層分解、農業の発明との対比、微分方程式による比喩、「横ばいか爆発か」の理論的主張)を追記し、2026年のハーネスレベル間接的RSIとの対比を横断的知見に追加。 #### Can Large Language Models Generate Observability-Aware Code? 関連概念 (2026-07-15) - [[オブザーバビリティ]]・[[コーディングエージェント評価]]・[[ログ生成]]・[[障害注入]]・[[バイブコーディング]](更新) — コーディングエージェント生成コードの診断意味論・障害シグナル露出のギャップ、Quantity over Quality現象、knowledge debtの実証知見を追記。 #### AI 2040: Plan A — The Deal 関連概念 (2026-07-16) - [[AI国際検証レジーム]](新規) — コンピュート宣言・訓練一時停止・相互確証コンピュート破壊(MACD)からなる、AI開発の国際的検証枠組みを定義として集約。(concept / ai-governance / ai-safety) - [[権力集中リスク]](新規) — 誤整合リスクとは独立した、超知能AIの実効支配が少数者の不可逆な独裁につながるリスク軸を定義として集約。(concept / ai-safety / ai-governance) - [[知能爆発]](更新) — Good/Yudkowskyの理論的議論と対比される「ガバナンスによるテイクオフ速度の制御」という応答の視点を横断的知見に追加。 - [[テイクオフ速度論争]](更新) — ハードテイクオフ前提を国際検証レジームで人為的に10年へ引き延ばすという、政策的制御変数としてのテイクオフ速度の扱いを横断的知見に追加。 #### LLM高速化(勉強会) 関連概念 (2026-07-16) - [[PagedAttention]](新規) — OS ページング機構に着想を得た KVCache のブロック単位管理を定義として集約。GPU 内ページ粒度と外部転送 chunk 粒度の非互換性を横断的知見に追加。(concept / llm / kv-cache / gpu) - [[Speculative Decoding]](新規) — ドラフトモデル・追加予測ヘッドによる複数トークン仮予測と並列検証を定義として集約。KVCache 削減制約がドラフト手法設計(Medusa/Eagle)を規定する観察を追加。(concept / llm / llm-inference) - [[CUDAGraph]](新規) — カーネル起動・メモリ転送のグラフ化による起動オーバーヘッド削減を定義として集約。最適化前 LLM 推論の最大ボトルネックが演算でなく起動オーバーヘッドである観察を追加。(concept / gpu / llm-inference) - [[KVキャッシュ管理]]・[[FlashAttention]]・[[Grouped-Query Attention]]・[[Multi-Head Latent Attention]]・[[線形注意]]・[[スライディングウィンドウアテンション]]・[[Prefill-Decode分離]]・[[GPU最適化]]・[[カーネルフュージョン]]・[[混合精度訓練]](更新) — 勉強会資料の具体的な見積もり計算(KVCache サイズ式、MLA low-rank 圧縮率、HBM/SRAM 帯域差)、Triton/CuTe-DSL による実装コスト低減、Ozaki Scheme・Nsight プロファイラの観察を横断的知見に追記。 #### A New Golden Age for Computer Architecture 関連概念 (2026-07-17) - [[ドメイン固有アーキテクチャ]](新規) — 特定ドメインに特化したプロセッサ設計(DSA)を定義として集約。並列性・メモリ階層・精度・DSLの4要因による効率化とGoogle TPU v1の実例を追加。(concept / computer-architecture / dsa) - [[ムーアの法則とデナードスケーリングの終焉]](新規) — Moore の法則・Dennard スケーリングの定義と、その終焉が汎用プロセッサの性能成長率(CISC期22%/年→RISC期52%/年→マルチコア期23%/年→Amdahl期12%/年→予測3%/年)をどう変えてきたかを集約。(concept / computer-architecture / moores-law) - [[VLIW]](更新) — Intel/HP の Itanium/EPIC が「市場が最終的にアーキテクチャ論争を決着させる」というテーゼの反例として失敗した経緯を追記。DSA との設計思想上の共通点を横断的知見に追加。 - [[メモリウォール]](更新) — 投機実行の無駄(Core i7 で平均19%の命令が投機ミスで浪費)という新たな定量データと、電力の壁の物理的根本原因としてのDennardスケーリング終焉を横断的知見に追加。 #### ContextPilot ingest (2026-07-18) - [[KVキャッシュ管理]](更新) — 完全一致 prefix caching の低再利用率と近似 KV マッチングの精度劣化という二律背反を、コンテキストブロック単位の整列・重複排除・注釈で回避する ContextPilot の設計を横断的知見に追加。現代 LLM の入力順序耐性向上がこの設計を成立させる前提であることも追記。CacheBlend 自身の精度劣化報告と ContextPilot の観測値が食い違う点を未解決の問いに追加。 #### The Too-Much-Talent Effect 関連概念 (2026-07-18) - [[過剰人材効果]](新規) — トップタレント比率とチーム成績の逆U字型関係を定義として集約。サッカー・バスケットボールで曲線的転換、野球では非転換という対比、地位争い→コーディネーション低下という理論的メカニズムを収録。(concept / organizational-behavior / team-performance) - [[タスク相互依存性]](新規) — チームメンバーの協働の必要度合いを定義として集約。相互依存性の高低が過剰人材効果の発現有無を調整するという本論文の中心的主張を収録。(concept / organizational-behavior / team-performance) #### AI生成テキスト分類器 関連概念 (2026-07-20) - [[AI生成テキスト検知]](新規) — LLM生成テキストと人間執筆テキストを判別する技術を定義として集約。パープレキシティベース手法の限界と、TF-IDF+SVMによる多数決分類の高い精度・汎化性能・低偽陽性率という対比を収録。(concept / machine-learning / AI生成テキスト検知) #### Adversarial dynamical systems 関連概念 (2026-07-20) - [[Koopman作用素]](新規) — 非線形力学系を観測量空間上の線形作用素として捉え直す枠組みを定義として集約。非自己随伴・非正規性がスペクトル近似(EDMD等)を難しくする根本原因という観察と、部分観測への拡張・連続時間系への一般化を未解決の問いに収録。(concept / dynamical-systems / koopman-operator) - [[可解性複雑性指標]](新規) — 計算問題を解くのに必要な逐次極限の回数を形式化するSolvability Complexity Index (SCI) を定義として集約。Koopmanスペクトル学習における上界(収束アルゴリズム)と下界(敵対的力学系による不可能性)の一致という本論文の中心的貢献を収録。(concept / computability / dynamical-systems) #### In-House LLM Serving at Netflix 関連概念 (2026-07-20) - [[制約付きデコーディング]](新規) — logits processorによる状態機械ベースの出力制約強制を定義として集約。vLLM V0(GIL律速のper-request処理)からV1(batch-level API)への移行によるテイルレイテンシ解消、部分prefill・プリエンプション対応という運用課題を収録。 - [[LLM推論]](更新) — Netflix のエンジン選定(TensorRT-LLM→vLLM)が性能ベンチマークでなく運用適合性で決まった事例を横断的知見に追記。 #### Niyama 関連概念 (2026-07-20) - [[LLM推論]](更新) — Niyama の QoS 駆動 co-scheduling(PD 分離との対照)・動的チャンキング・EDF/SRPF ハイブリッド優先度付け・積極的降格(Mooncake の Early Rejection との対比)を横断的知見に追記。未解決の問いに α パラメータの自動調整と、Niyama vs DistServe の直接比較評価の欠如を追加。 - [[Prefill-Decode分離]](更新) — 同居維持のまま QoS 差別化する Niyama のアプローチを、物理分離アプローチ(DistServe・Mooncake・P/D-Serve)との対照軸として横断的知見に追記。 - [[LLMサービング管理]](更新) — インスタンス間ルーティング(PreServe)とインスタンス内スケジューリング(Niyama)が異なるレイヤーで相補的に機能するという知見、および両者が独立に「サイロ化の非効率」という同型の課題認識に至っている観察を追記。 #### DuckDB 関連概念 (2026-07-20) - [[列指向OLAPデータベース]](更新) — サーバプロセス型(ClickHouse)と組み込み型(DuckDB)という直交する配備形態、および組み込み型特有の「結果セット転送コスト」という性能軸を横断的知見に追加。両者を同一条件で比較した定量評価の有無を未解決の問いに追加。 #### DiDi #06(Query Execution Plans and Pipelining)関連概念 (2026-07-20) - [[クエリ実行プラン]](新規) — DuckDBがSQLを木構造(まれにDAG構造)の物理演算子プランに変換する仕組み。2048行データチャンク、TABLE_SCAN/PROJECTION/FILTER/HASH_GROUP_BY等の演算子役割分担。 - [[プッシュ型パイプライン実行]](新規) — パイプライン(ソース・演算子・シンク)への分解、パイプラインブレーカーの3フェーズ(Sink/Combine/Finalize)、パイプライン依存関係、パイプライン駆動ループ。DeWitt/Gray(1992)のパイプライン並列化・パーティション並列化分類が単一プロセスDBMSの演算子レベル実装として具体化される点、skew回避が動的負荷分散でなく設計選択で行われる点を[[並列データベース]]との横断的知見として追加。 - [[並列データベース]](更新) — DuckDBのパイプライン実行モデルへのDeWitt/Gray分類の適用、skew対処の設計選択という横断的知見を追加。 #### DiDi #07(Vectorized Query Execution)関連概念 (2026-07-20) - [[SIMDベクトル処理]](更新) — DuckDBのタイトループが「SIMD効果が限定的な領域」の中でも自動ベクトル化しやすい局所例であること、`__restrict__`修飾がSIMD自動ベクトル化の成否を分けることを横断的知見に追加。 - [[分岐予測]](更新) — DBMSカーネルが誤予測ペナルティを避けるためbranch-less実装を志向する具体例、後方分岐=taken/前方分岐=not-takenヒューリスティックの具体的なx86アセンブリ形を横断的知見に追加。 - [[パイプライン処理]](更新) — DiDi講義が本ページと同一の5段パイプライン(IF/ID/EX/MEM/WB)図をDBMS教材として採用している点、コンパイラのループ展開がパイプライン効率を左右する具体例を横断的知見に追加。 #### DiDi #08(Query Rewriting and Optimization)関連概念 (2026-07-20) - [[クエリオプティマイザ]](新規) — 正準プラン→最適化パス→物理プランの3段階アーキテクチャ。DuckDB v1.5の30以上のパスが事前決定順序で一度だけ実行される(fixpointまで反復しない)設計と、それに起因するパス順序問題を定義。[[@2026__DiDi__Query Rewriting and Optimization]]を軸に整理。(database / query-optimization) - [[結合順序最適化]](新規) — 結合実装の選択・結合木の探索空間(カタラン数)・DPhyp動的計画法(Moerkotte & Neumann, SIGMOD 2008)・build/probe側の選定という3つの独立部分問題からなる概念。(database / query-optimization / join-optimization) - [[クエリ非相関化]](新規) — DEPENDENT_JOIN演算子とNeumann & Kemper(BTW 2015)の系統的書き換え規則によるπ/Γ/σ越しの押し下げとJOINへの置換を定義。DuckDBが物理演算子としてDEPENDENT_JOINを実装しないため必須の最適化として位置づく。(database / query-optimization / subquery) #### DiDi #05(The ART of Indexing)関連概念 (2026-07-20) - [[Adaptive Radix Tree]](新規) — 値のビット列表現に基づき自己組織化する順序付き探索木。span・Node4/16/48/256の可変ファンアウト・遅延展開/パス圧縮による木高最適化を定義。ARTとB-Treeの木高比較(`O(k)` vs `O(k·log₂(n))`)、選択率とメモリ局所性のトレードオフを[[Zonemap]]・[[B-Tree]]との横断的知見として追加。[[@2026__DiDi__The ART of Indexing]]を軸に整理。(database / index-structures) - [[Zonemap]](新規) — 列指向テーブルストレージに組み込まれる行グループ単位(120K行)の`(min,Max)`索引。Sequential Scanの述語プッシュダウンによるスキップ最適化、列順序(ソート済みか否か)がスキップ効果に与える影響を定義。[[Adaptive Radix Tree]]との「粗い足切りと精密な到達」の補完関係を横断的知見として追加。(database / columnar-storage) #### 30分でわかるデータ指向アプリケーションデザイン関連概念 (2026-07-20) - [[導出データ]](新規) — 他データセットへのクエリ・変換の結果として生成され続けるデータ。RDBMSの「テーブル」の意味が最新スナップショットから導出データへ変化してきたという枠組みを定義。dbtによる依存関係記述、Delta Lake/Iceberg/Apache Hudiによる履歴管理を関連付ける。(data engineering / analytics) - [[分散トランザクション]](更新) — classic Amazon Aurora(SIGMOD 2018)のgossipプロトコルによる2PC回避を、Spanner/CockroachDB系の「プロトコル最適化による回避」とは異なる「アーキテクチャによる回避」の系統として横断的知見に追記。 ### 2026-07-20 LLM hallucinations in the wild (arXiv 2605.07723) ingest-paper - [[LLMのハルシネーション]](新規) — [[@2026__arXiv__LLM hallucinations in the wild]] を軸に、学術引用というベースライン差分推定の枠組みでハルシネーションを population スケールで定量化する視点を定義。[[@2023__arXiv__GPT-4 Technical Report]] のモデル自己申告的な限界言及との観測軸の違いを横断的知見として記録。(llm / hallucination / science-of-science) ### 2026-07-20 Aurora DSQL: Scalable, Multi-Region OLTP (arXiv 2607.13276) ingest-paper - [[分散SQLデータベース]](更新) — OCC+MVCC+コミット時座標という第三の座標削減系統(Spanner/CRDBの悲観的ロック、Aurora Limitlessのcross-AZ限定と並ぶ)、ストレージの論理化(行/インデックスエントリ単位)によるクエリプッシュダウンを横断的知見に追記。 - [[地理分散SQLデータベース]](更新) — 悲観的ロック(Spanner/CRDB) vs OCC+MVCC(Aurora DSQL)のコミットレイテンシ実測比較、クロスリージョン通信を単一ラウンドに圧縮する設計を横断的知見に追記。 - [[分散トランザクション]](更新) — OCCのよくある欠点をMVCC+snapshot isolationで無効化する系統、複数Adjudicator間の2PC変種(投票のアトミック性とコミットのアトミック性の分離)、Spanner実測とのレイテンシ比較を横断的知見に追記。 - [[分散コンセンサス回避]](更新) — classic Auroraの単一ライター前提からAurora DSQLの複数書き込み者環境への回避戦略の一般化、投票権を残しつつアトミック性を単一Journal書き込みに閉じ込める新パターンを横断的知見に追記。 - [[クォーラムベースレプリケーション]](更新) — イレイジャーコーディングを可用性でなくレイテンシ分散の最適化として使うAurora DSQLの設計を、classic Auroraの複製ベースクォーラムとの対比で横断的知見に追記。 ### 2026-07-20 Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3 (SOSP 2021) ingest-paper - [[軽量形式手法]](新規) — 完全形式検証の健全性ではなく自動化・保守性・継続的な正しさ維持を優先する検証アプローチを、[[@2021__SOSP__Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3]] を軸に定義。実装と同じ言語で書く参照モデル・property-based testing・stateless model checking の組み合わせを記録。 - [[LSMツリー]](更新) — ShardStore の「shard データをエクステント外へ配置し LSM ツリーは物理配置へのインデックスに純化する」設計と、crash consistency を宣言的 Dependency 型で LSM ツリーから分離する設計判断を、Bigtable/Cassandra の GFS/ローカル FS 依存レプリケーションとの対比で横断的知見に追記。 ### 2026-07-20 The Snowflake Elastic Data Warehouse (SIGMOD 2016) ingest-paper - [[シェアードナッシング]](更新) — Snowflake が自らを「マルチクラスタ・シェアードデータ・アーキテクチャ」と呼び DeWitt/Gray の3分類のいずれとも一対一対応しない第4カテゴリを提示したこと、lazy consistent hashing + file stealing によるメンバーシップ変更対応を横断的知見に追記。 - [[並列データベース]](更新) — クラウドネイティブなコンピュート・ストレージ分離がシェアードナッシングの弱点表(ヘテロジニアスワークロード・メンバーシップ変更・オンラインアップグレード)とほぼ一致する動機から生まれたことを横断的知見に追記し、未解決の問いを「Snowflake自身の自称にとどまり学術的分類は未確立」と更新。 - [[データパーティショニング]](更新) — Snowflakeが「マイクロパーティション」ではなく不変ファイル+min-maxプルーニングという別カテゴリの技法を採用していること(一次資料で確認)、キャッシュ配置への一貫性ハッシュ適用(データ本体でなくメタレベルの決定)を横断的知見に追記。 - [[列指向OLAPデータベース]](更新) — 半構造化データのネイティブサポートという第3の配備軸、ファイル/ブロック単位統計によるプルーニングの収斂をClickHouse・DuckDBとの対比で横断的知見に追記。 ### 2026-07-20 Dremel: Interactive Analysis of Web-Scale Datasets (VLDB 2010) ingest-paper - [[ネスト型カラムナストレージ]](新規) — repetition level / definition levelによるネストレコードの列指向符号化を定義。Dremel論文単独からの新規概念。 - [[列指向OLAPデータベース]](更新) — ネストデータモデルへの列指向拡張が2010年のDremelで既に一度到達していたこと、列指向ストレージの恩恵がMapReduceのようなDBMS外ツールにも及ぶことを横断的知見に追記。 - [[並列データベース]](更新) — ウェブ検索由来の多段サービス木がDeWitt/Grayの想定しなかった第三の並列化手段として集計クエリに応用され、数千ノード規模で線形に近いスケーラビリティを実証した事例を横断的知見に追記。 ### 2026-07-21 Don't Predict, Prioritize: Rethinking GPU Reliability Assessment (KDD '26 V.2) ingest-paper - [[障害予測]](更新) — 「精密な時間予測が破綻する領域ではランキングへの再定式化が代替パラダイムになる」という HeaRank の中心的知見、ログベース予測との対照(モデル強化 vs タスク再定式化)、Salfner+ 2010 の時間軸パラメータ(t_p → ∞ のゲーム可能性)がランキングパラダイムでは逆に有効に働く点を横断的知見に追記。 - [[GPUレジリエンス]](更新) — HeaRank のホスト単位 Pareto 集中("lemon nodes")が GPU Resilience のコンポーネント単位弱点分布(GSP/PMU/MMU/NVLink)の別粒度での現れであること、リスクランキングが「信頼性の床」を埋める運用対処の第3の経路であることを横断的知見に追記。 ### 2026-07-21 ingest-slides | ネットワーク監視の自動化はどこまでできるのか? -Apache Airflowによるアラート対応基盤- - [[ワークフロー自動化]](更新) — 汎用ワークフローランナー Apache Airflow を Operator 単位の分業モデルで共通基盤化する oyakata の産業実装パターンと、自動化成熟と運用知見継承のトレードオフという新たな論点を横断的知見に追記。 - [[アラート集約]](更新) — NetBox タグベースの起動前重複排除を、意味類似度・統計・LLM に依らない第4のカテゴリとして横断的知見に追記。 - [[ネットワーク監視]](更新) — 監視データソース統合研究群(SkyNet・Harp・INTFusion)の射程外にある「検知後の対応」を oyakata が産業実装として補完する接続点を横断的知見に追記。 ### 2026-07-21 ingest-slides | Rack-Scale GPUサーバーのNW設計と運用までの苦悩 - [[AIデータセンタートポロジ]](更新) — HotNets の理論的スケールアップ/スケールアウト二層構造が、NVL72 実運用では Compute/Converged/OOB の 3 Fabric 分離と Scalable Unit(SU)障害ドメインとして現れることを横断的知見に追記。 - [[GPUクラスタ運用]](更新) — Optics 障害対応の「予測(OptProphet)・事後診断(BER/FEC)・回避(AEC)」の三段構造、および液冷トレイ交換という物理的復旧作業がMTTRに加える手作業の慎重確認手順を横断的知見に追記。 ### 2026-07-21 ingest-slides | AIインフラ時代のデータセンター内光配線の実践知 - [[データセンター内光配線設計]](新規) — 光ケーブル細径多心化・MPOコネクタ規格(BASE-8/12/16/24)・VSFF光コネクタを定義。 - [[光トランシーバー電力方式]](新規) — FRO/LRO/LPO/CPOの電力方式の遷移を定義。 - [[光ファイバーシャフル配線]](新規) — シャフルBOX/シャフルアッセンブリによるGPUクラスタ4倍拡張を定義。 - [[MRC]](更新) — UEC/UET仕様の一部取り込みという業界標準化文脈を横断的知見に追記。 - [[SRv6]](更新) — 業界複数ベンダー連携の文脈での活用事例を再確認。 - [[マルチプレーンClosトポロジ]](更新) — 「論理プレーン分割はNIC/ソフトウェア層、光ファイバーシャフル配線は物理配線層」という区別を横断的知見に追記。 ### 2026-07-21 Real-Time Incident Prediction for Online Service Systems (ESEC/FSE '20) ingest-paper - [[障害予測]](更新) — eWarn が AirAlert を追試し性能崩壊を実証した独立再現実験、LDA vs ニューラル手法の逆説、LIME 説明の診断転用という3つの横断的知見と2つの未解決の問いを追記。 ### 2026-07-21 Understanding Reasoning from Pretraining to Post-Training (arXiv) ingest-paper - [[強化学習スケーリング]](更新) — チェスドメインでの事前学習-RL結合スケーリング則の導出、ポリシー変化の3category(Ground-truth amplification・Tail discovery・Wrong-mode amplification)分類を横断的知見に追記し、事前学習投資とRL投資の最適配分に関する未解決の問いへ部分的回答を追記。 - [[検証可能報酬による強化学習]](更新) — GRPOベースのRLVRを事前学習からの結合スケーリング則という観点で定量分析した事例、ポリシー変化の3category分類を横断的知見に追記。 - [[AirAlert]](更新) — eWarn による追試結果(F1 0.51、原論文の Microsoft クラウド F1 53.92-88.78% との対比)とノイズ対処設計の違い(特徴選択 vs 特徴集約)を横断的知見に追記。 ### 2026-07-22 ingest-paper | DAG-FM: A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms - [[アモータイズド因果発見]](新規) — 事前分布空間の識別可能性がアモータイズド手法の理論的妥当性を決める分水嶺であること、順序+上三角分解への移行が古典的順序ベース手法の再輸入であること、OOMが実世界適用の第一関門であることを横断的知見に記載。 - [[因果発見]](更新) — 「5. アモータイズド因果発見」を系統として追加。DirectLiNGAMの逐次的順序決定とDAG-FMの葉/親ノード分解が設計思想として収斂している点を追記。 ### 2026-07-22 ingest-paper | How Far Can Root Cause Analysis Go on Real-World Telemetry Data? - [[LLMによる根本原因分析]](更新) — reverse reasoning agentによる「後付け診断」を新カテゴリとして追加。SREcon26とGALA・RCLAgentのOpenRCA再評価が同一パターンの独立実証であることを追記。 - [[RCA評価設計]](更新) — reverse reasoning agentをOpenRCA 2.0のPAVEと対比する第三の評価軸として追記。held-outリークコントロールの評価規律を追記。 - [[因果推論ベースRCA]](更新) — OpenRCAの極小サンプル設定で古典的因果発見手法が全て崩壊した知見を既存知見の延長として追記。 ### 2026-07-22 ingest-paper | STsCache: An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage - [[セマンティックキャッシュ]](新規) — BSCache/TSCache/STsCacheの実装トレードオフ系譜、append-only性ゆえのキャッシュ一貫性課題の不要化、グラフ+スキップリスト還元による大容量化の鍵を横断的知見に記載。 - [[時系列データベース]](更新) — TSDB内部最適化の7軸とは独立な「前段セマンティックキャッシュ層」という第8の軸を追記。 - [[分散キャッシュ]](更新) — セマンティックキャッシュへの一方向リンクを追加(完全一致キー vs 意味的関係マッチングという別系統の設計軸として区別)。 ### 2026-07-22 ingest-paper | cache_ext: Customizing and Tracing the Page Cache with eBPF - [[ページキャッシュカスタマイズ]](新規) — 拡張可能カーネルの1980年代理念がeBPF verifierで実用化された技術史的位置づけ、既存ヒント機構(madvise/fadvise)が実験的に「効かない」ことの反復確認、cachestreamとcache_extを対にした診断→設計→検証ループを横断的知見に記載。 - [[eBPF]](更新) — 「観測から制御への重心移動」(sched_ext→cache_ext)、ユーザ空間オフロードで最大20.6%のスループット低下という定量裏付けを追記。 - [[Linuxカーネルインタフェース]](更新) — struct_ops/kfuncがNetlinkの「拡張容易性」軸をeBPF verifierという新機構で実現する後継インタフェースである点を追記。 ### 2026-07-22 ingest-paper | LLM Agents for AIOps in Kubernetes: An Industrial Experience Report with Red Hat OpenShift - [[AIOps]](更新) — ReActエージェントの精度×レイテンシ×トークン消費量3軸評価、MLASPのreactive統合に関する知見を追記。 - [[agentic SRE]](更新) — 統制実験による多モデル比較知見、メモリが正確性を悪化させた実証例を追記。 - [[ReAct]](更新) — 産業実装での多モデル横断比較(Mixtral 8x22B以外はReAct原則遵守だがAR精度は0〜100%に分散)、メモリ付与による正確性悪化を追記。 - [[LLM評価]](更新) — ツール利用エージェント評価の3軸フレーム(精度・レイテンシ・verbosity)、モデルファミリー間の冗長性差を追記。 - [[エージェントメモリ]](更新) — メモリが「悪化」させる産業実証例(時間的再計算タスク)を、学術知見(メモリ追加=改善)との対比として追記。 ### 2026-07-22 ingest-paper | TSGen: Automated Troubleshooting Guide Generation - [[TSG自動化]](更新) — TSGenが「生成」軸をFlowXpert(運用ドキュメント由来)とTSGen(生インシデントデータ由来)の2系統に分岐させたこと、単一パス制約付き反復更新の設計、人間作成TSGの検索精度の低さ(Retrieval Accuracy 0.012)がFLASHのTSG品質調査と独立に「人間向けTSGはLLM消費に不適」という知見に収束することを追記。 ### 2026-07-22 ingest-paper | An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure - [[インシデントトリアージ]](更新) — 単一分類器型 vs 分散型多段階トリアージのアーキテクチャ差、COMET→Comfeyという同一組織内での中央集権→分散化の進化、実証研究が裏付けるマルチチーム関与・可逆的トリアージ判断を追記。 - [[マルチエージェント協調]](更新) — スティグマジック協調(Comfey)とネゴシエーション/RL型協調(Triangle・Conductor)の対比、OncallXとComfeyの「協調機構の寄与がモデル能力を上回る」という並行した知見を追記。 ### 2026-07-22 ingest | The Failure of Knowledge Management / Infrastructure Management Timescales (Mark Burgess) - [[知識のリレーションシップモデル]](新規) — 知識を静的データではなく個人的関係性として捉える Burgess の知識管理論。既存の [[知識グラフ]] との対比(スコープの狭い応用 vs 汎用的知識管理)を横断的知見に記載。 - [[タイムスケール分離と監視粒度]](新規) — 観測・是正のタイムスケールを問題自身の時間スケールに一致させる原則(KT境界、Dynamics trump semantics)。[[アラート疲労]]・[[制御ループの安定性とタイムラグ補償]] との横断的接続を記載。 - [[知識グラフ]](更新) — Burgess の論理的知識表現批判との緊張関係を contradiction callout として追記。 - [[アラート疲労]](更新) — タイムスケール不一致という、アラート量削減より上流の構造的原因を追記。 - [[制御ループの安定性とタイムラグ補償]](更新) — Apollo throttle castellation 事例を Burgess のタイムスケール一致原則の具体例として接続。 ### 2026-07-22 ingest-paper (batch) | Burgess LISA98/LISA2000/arXiv・Begnum 2005・Measuring System Normality - [[コンピュータ免疫学]](新規) — Computer Immunology(1998)が提唱した、生物学的免疫系の危険モデルをシステム管理の異常検知に対応づける枠組み。 - [[収束型システム管理]](新規) — Theoretical System Administration(2000)が定式化した、CFEngineの収束概念のn次元格子上への一般化。 - [[システムの正常状態]](新規) — Measuring System Normality(2002)が扱う、統計力学的アプローチ(Planck分布・温度不変性)によるシステム正常性の定義。既存の [[異常検知]] と区別される「正常とは何か」自体の主題。 - [[ゲーム理論とSRE]](更新) — Theoretical System Administration(2000)とarXiv版(cs/0003075)のゼロサムゲーム定式化を、四半世紀先行する原型として追記。 - [[SREの工学化]](更新) — 1998–1999年のBurgessの主張を、Theoretical System Administrationの具体的な数式(格子モデル・ペイオフ行列)で裏付け。 - [[タイムスケール分離と監視粒度]](更新) — arXiv版(cs/0003075)の応答時間比較式(t_auto vs t_human)を、2014年記事の14年前の定量的原型として追記。 - [[PageRank]](更新) — Begnum 2005の固有ベクトル中心性による分散異常検知が、PageRank/HITSと数学的に同型であることを追記。 - [[メトリクス削減]](更新) — Begnum 2005のPCA限界指摘を追記。 - [[異常検知]](更新) — Begnum 2005の負の実証結果(集中分析優位性を支持する証拠なし)、Measuring System Normality の長期統計/短期シグナルの二層構造を追記。 - [[集合通信]](更新) — 「Every Microsecond Matters」の memory barrier 実測・barrier-free 4 技術・Speed-of-Light 理論下限の測定方法論を追記。 - [[LLM推論]](更新) — 長文脈・小バッチデコードで集合通信レイテンシがクリティカルパスを支配するという知見を追記。 ### 2026-07-23 ingest | SWE-1.7: Frontier Intelligence at a Fraction of the Cost (Cognition Blog) - [[自己圧縮]](新規) — 生の context window を超えて長期タスクを継続するための、作業状態の要約+再開を学習させる訓練手法。SWE-1.7・Kevin-32B。 - [[エントロピー崩壊]](新規) — 長期 RL 訓練でモデルが探索を止め報酬が頭打ちになる現象。softmax 勾配の自己強化メカニズムと top-p サンプリングによる予防策。 - [[耐障害LLM訓練]](更新) — RL 訓練特有の trainer/推論間の障害コスト非対称性、圧縮重み差分のオブジェクトストレージ配信パターンを追記。 - [[報酬ハッキング]](更新) — コーディングエージェント RL でのチーティング検知・防止(サンドボックスのネットワーク制限・採点経路隔離)を追記。 - [[強化学習スケーリング]](更新) — post-training ceiling 通念への産業実例による反証、エントロピー崩壊対策を訓練安定性の実装条件として追記。 ### 2026-07-23 ingest | Frontier RL Is Cheaper Than You Think (Fireworks AI Blog) - [[RL重み差分配信]](新規) — trainer とロールアウトフリートを分離しつつ圧縮重み差分のみを配信する RL インフラアーキテクチャパターン。bf16 重みの 98% 超がビット等価という実測に基づく。 - [[耐障害LLM訓練]](更新) — 重み差分配信の定量的根拠が耐障害性とは独立の文脈(コスト効率)から示された点を追記。 ### 2026-07-23 ingest-paper | DAPO: An Open-Source LLM Reinforcement Learning System at Scale (arXiv 2503.14476) - [[エントロピー崩壊]](更新) — DAPO の Clip-Higher(上下非対称クリッピング)による最適化層の対策を追記。SWE-1.7 の生成層対策(top-p サンプリング)との対比を整理。 - [[検証可能報酬による強化学習]](更新) — DAPO のルールベース報酬(式7)とデータ変換(DAPO-Math-17K)による検証可能性の確保、および naive GRPO の訓練不安定性を追記。 - [[強化学習スケーリング]](更新) — 後続研究(ScaleRL・MiniMax-M1・Scaling Up RL)が参照する「DAPO 拡張」の原論文としての実証範囲(単一モデル規模・単一ドメイン)を追記。 ### 2026-07-25 ingest-paper | Agentic Failure Management of Cloud Systems (UIUC PhD Thesis, Yinfang Chen) - [[障害注入]](更新) — Rainmaker のアプリケーション⇔マネージドクラウドサービス間HTTPレイヤー注入という新しい注入点、call-siteカバレッジとITLSによる可視性確保を追記。 - [[プロアクティブ障害管理]](更新) — オンライン障害予測に対する「本番前テストによる潜在バグ検知」というもう一つのプロアクティブ経路(Rainmaker)を追記。 ### 2026-07-25 ingest-paper | Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker (NSDI 2023) - [[障害注入]](更新) — Rainmaker の一次論文(NSDI'23)を出典に追加し、call-siteカバレッジ・ITLSの横断的知見を一次資料の具体的な数値(Table 1のエラーコード不整合、Orleans 588日→64.47%削減等)で補強。 ### 2026-07-27 ingest | Everyone Should Know SIMD (mitchellh.com) - [[SIMDベクトル処理]](更新) — 明示的SIMDコードの5段階共通形(定数ブロードキャスト→ベクトル幅ループ→並列演算→リダクション→スカラー端数処理)を [[Ghostty]] の実例とともに追記。自動ベクトル化への懐疑から明示的ベクトル化を選好する実務的立場も追加。 ### 2026-07-27 ingest-paper | AIシステムの進化速度は指数関数を超えている (TJSAI, 2025) - [[シンギュラリティ]](新規) — Kurzweilの技術的特異点論。チップ集積度向上に基づく2045年予測とその批判。 - [[コルモゴロフ複雑性]](新規) — プログラムの複雑度を測る尺度(コルモゴロフ複雑性・プログラム長・パラメータ数)。 - [[ムーアの法則とデナードスケーリングの終焉]](更新) — 本ソースが前提とするN∝2^t(集積度の指数関数的増加の継続)と、既存ページが示すMoore's law鈍化(2018年時点で予測比15倍のギャップ)との緊張関係をcontradiction calloutで追記。 - [[Transformer]](更新) — attention機構の局所性をSIMD・ハードウェア観点から再解釈し、集積度向上との関係を追記。 - [[SIMDベクトル処理]](更新) — 実務的最適化事例に対し、計算量理論の立場からSIMDの局所性を評価する視点を追記。 ### 2026-07-27 ingest | Leiden Declaration on Artificial Intelligence and Mathematics - [[AI時代の数学研究倫理]](新規) — 数学の中核的価値5点・AI由来の脅威5点・ステークホルダー別推奨事項の枠組み。Leiden Declaration が代表的定式化。 - [[自動査読]](更新) — LLM査読の性能向上(人間同等以上の精度)と、Leiden Declaration が求める査読付き出版の維持要求との緊張関係を追記。 ### 2026-07-27 ingest-paper | Above the Clouds: A Berkeley View of Cloud Computing (UCB TR, 2009) - [[クラウドコンピューティング]](新規) — SaaS/Utility Computing/Public・Private Cloud の用語定義、elasticity のリスク移転としての経済モデル、普及障害トップ10。2009年時点で予見された「大規模分散システムのデバッグ困難性」が2020年代の[[クラウド障害ライフサイクル]]研究で定量的に実証された構造を横断的知見として追記。 ### 2026-07-27 ingest-paper | DynaPipe: Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism (NeurIPS 2025) - [[パイプライン並列化]](更新) — レイヤーをステージに分割し異なるデバイスに割り当てるモデル並列化方式。DynaPipe が特定した「サンプリング負荷によるステージ間不均衡」を追記。 - [[LLMサービング管理]](更新) — DynaPipe のパイプライン層再配分を、PreServe/Niyama のリクエストスケジューリングとは異なる「並列化トポロジ自体の管理層」として追記。 - [[KVキャッシュ管理]](更新) — DynaPipe の非同期 KV キャッシュ移行(パイプラインステージ間の層再配分に伴う引き渡し)を、再利用・退避・障害復旧に次ぐ第4の移動目的として追記。 - [[テンソル並列]](更新) — TP のヘッド粒度不均衡バブル(FailSafe)と PP のサンプリング起因バブル(DynaPipe)を対照する横断的知見を追記。 ### 2026-07-27 ingest-paper | TRANSOM: An Efficient Fault-Tolerant System for Training LLMs (arXiv, 2023) - [[耐障害LLM訓練]](更新) — TRANSOM(2023年)が ByteRobust・MegaScale(2024〜2025年)に先立ち、プロセスレベル検知→隔離→復旧・ハイブリッド異常検知・非同期RDMAチェックポイントの三本柱を統合していたことを横断的知見として追記。 - [[異常検知]](更新) — LLM訓練クラスタの異常検知が2023年時点で非LLMの軽量古典手法(LOF・KNN Matrix Profile・DTW)で実運用投入されていたことを横断的知見として追記。 ### 2026-07-27 ingest-paper | NetCause: Counterfactual Learning for Root Cause Analysis in Large-Scale Networks (arXiv / IEEE ICCCN 2026) - [[因果推論ベースRCA]](更新) — NetCause と姉妹論文 Graphical Causal Reasoning(同一AWSチーム・同日投稿)を「統計的因果発見 vs 学習ベース反実仮想シミュレーション」の直接対比事例として追記。物理ネットワークトポロジへの因果推論ベースRCA拡張という新ドメインの横断的知見も追加。 - [[介入的因果学習]](更新) — NetCause の学習済みワールドモデル上のロールアウトを、障害注入(Jha et al.)・統計的介入認識(LatentScope)に次ぐ第3の介入実装アプローチとして追記。 - [[NetOps]](更新) — NetCause・Graphical Causal Reasoning を、サーベイが提唱した「因果推論を第一級ツールに据える」設計の本番実証事例として追記。 ### 2026-07-27 ingest-paper | Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems (arXiv, 2026) - [[スケーラビリティ障害]](新規) — 反復回数がスケール次元と相関する「次元コード断片(DCF)」とアンチパターンの組み合わせで障害化するという枠組みを新設。compute/unbound/bloat/logic の4根本原因カテゴリと11アンチパターンを整理。 - [[潜在的障害]](更新) — スケーラビリティ障害を Cook の潜在的障害論のスケール軸への特殊化として位置づける横断的知見を追記。 - [[分散システム障害]](更新) — 従来の質的側面(設定ミス・部分障害・CSI障害)に対し、スケーラビリティ障害が量的側面(次元の増加)という直交する軸を扱うことを横断的知見として追記。 ### 2026-07-28 ingest-paper | An Evolutionary Study of Configuration Design and Implementation in Cloud Systems (ICSE '21) - [[設定ミス脆弱性]](更新) — SPEX(SOSP'13)の静的検出結果を、ICSE'21 論文が示すコミット履歴上の「反応的(reactive)対応」パターン(チェックコード追加の74.6%・パラメーター化の54.4%が障害等の帰結後)で時間軸から裏付ける横断的知見を追記。フィードバックメッセージ品質(L1〜L4)の低さもサイレント障害と同根であることを追記。 ### 2026-07-28 ingest | Kimi-K3 を Day0 デプロイ (Fixstars Tech Blog) - [[Decode Context Parallelism]](新規) — MLA KV キャッシュを複数 GPU に分散する推論時並列化方式。SGLang 対応、vLLM 未対応(記事時点)。 - [[Speculative Decoding]](更新) — 公開 draft モデル(DSPARK)による Kimi K3 での実運用適用例を横断的知見に追記。 ### 2026-07-28 ingest | LLMの「脳内」をハッキングする技術 (joisino) - [[操舵ベクトル]](新規) — 2群の内部状態の平均差から求める方向へ加算し、トーンや命令拒否/受諾といった1軸の態度を切り替える介入。Arditi et al. NeurIPS 2024 の拒否方向操作、`google/gemma-7b-it` のバスボム実験による知識量上限の制約を含む。(machine-learning / llm / interpretability) - [[知識編集]](新規) — [[ロジットレンズ]]で書き込み層を特定し、MLP の1回転軸だけを書き換えることで、他の知識を壊さずに特定の事実知識をピンポイントで書き換える手法。ルーブル美術館の場所を「練馬」に局所編集する実験例。(machine-learning / llm / interpretability) - [[活性化パッチング]](更新) — Arditi et al. の拒否方向操作の追加実例(バスボム実験による知識量上限の発見)、[[操舵ベクトル]]・[[知識編集]]という2段階の粒度への整理を追記。 - [[ロジットレンズ]](更新) — 知識編集の対象層特定という第3の応用例(ルーブル美術館の場所を問う予測の層ごと推移)を追記。 - [[機構的解釈性]](更新) — 観察から介入で機構仮説を実証する手法群として[[操舵ベクトル]]・[[知識編集]]・[[活性化パッチング]]への横断リンクを追記。 ### 2026-07-29 ingest-paper | Handling Network Faults in Distributed AI Training: Failover is Now an Option (EuroSys '26) - [[集合通信]](更新) — CCL 自身が last-hop ネットワーク障害を検知しフェイルオーバーする ReCCL(primary-backup RNIC + DCR + NVL)を追加。VCCL・NCCLX と並ぶ「CCL 内部での耐障害化」系統。 - [[耐障害LLM訓練]](更新) — 「再起動 vs フェイルオーバー」の判定式(チェックポイント間隔・検知時間・スローダウン率から導出)を、ジョブ層の耐障害設計に対する CCL 層からの定量的意思決定モデルとして追加。 - [[リスタート保護]](更新) — チェックポイント+再起動という支配的パラダイムに対する「フェイルオーバーで進行を保存する」という代替案の定量分析を追加。 - [[Rail-Optimizedトポロジ]](更新) — backup RNIC の rail-based 経路設計(ToR 障害時も rail 内で完結する disjoint backup path)を追加。 ### 2026-07-29 ingest-paper | PatternSketch: General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection (EuroSys '26) - [[時系列トラフィックパターン検知]](新規) — バースト・ウェーブ・promising 等の時系列パターンを「隣接期間の変化」を表すマイクロパターン系列として統一抽象化し、有限状態オートマトンによる系列マッチング問題へ帰着させる PatternSketch の中心概念。単一スケッチでの複数パターン同時検知と P4 Runtime 経由の実行時再構成を可能にする設計を記録。 ### 2026-07-30 ingest-paper | Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost (MLSys 2026) - [[KVキャッシュ量子化]](新規) — Kitty の ingest から新設。Key キャッシュのチャネル単位混合精度量子化(Dynamic Channel-wise Precision Boost)と page-centric メモリレイアウトを扱う。(llm / inference / kv-cache / quantization) - [[KVキャッシュ管理]](更新) — KV キャッシュ容量制約への対応が「データ量を減らす(退避/エビクション)」と「データを軽くする(量子化)」の直交する 2 系統に分かれることを、Kitty の 2-bit チャネル量子化を根拠に追記。(llm / inference / kv-cache) - [[モデル圧縮]](更新) — KV キャッシュ量子化(Kitty)を、重み・活性化量子化とは別対象への同一手法カテゴリの適用として追記。(llm / efficiency) ### 2026-07-30 ingest-paper | Cost-aware Duration Prediction for Software Upgrades in Datacenters (MLSys 2026 Industry Track) - [[ソフトウェアアップグレードスケジューリング]](新規) — データセンター規模で多数サーバーのソフトウェアアップグレードを固定長の「アップグレード窓」内に収めるスケジューリング問題。サービスジョブスケジューリングとは異なり、固定サーバー割り当てと達成率SLOという制約を持つ。(datacenter / scheduling) - [[ライブアップグレード]](更新) — 「窓を前提としたスケジューリング最適化」(Acela)と「無停止差し替え」(Google rpm→dpkg)という対照的な2つのアプローチを横断的知見として追記。 - [[サービスレベル目標]](更新) — 達成率型SLOで予測器の目的関数にSLO達成を直接組み込む設計パターン(分位点損失・カスタムスコア関数)を横断的知見として追記。 ### 2026-07-30 ingest-paper | FaaScale: Unlocking Fast LLM Scaling for Serverless Inference (MLSys 2026) - [[モデルスケーリング高速化]](新規) — サーバーレス LLM 推論のコールドスタートを、モデル転送(マルチキャスト)と推論実行の co-design により短縮する技術群。PipeCast の binomial-pipeline マルチキャスト + 動的実行パイプラインを中心概念とする。(serverless / llm / distributed-systems) - [[LLMサービング管理]](更新) — 「コールドスタートが遅すぎて反応的スケーリングが機能しない」という PreServe の観察に対し、FaaScale が「予測で回避」ではなく「機構自体を高速化」という直交する解決軸を提供することを横断的知見として追記。 ### 2026-07-30 ingest-paper | Speculative Decoding: Performance or Illusion? (MLSys 2026、arXiv:2601.11580) - [[Speculative Decoding]](更新) — vLLM 上での n-gram/EAGLE/EAGLE-3/Draft-Model/MTP 体系的ベンチマークから、検証コスト支配とバッチサイズ依存の速度向上減衰、受理挙動の3レベル変動、理論上限(oracle)との最大4.9倍ギャップを横断的知見として追記。未解決の問いに位置適応的手法選択の実装可能性を追加。(llm / llm-inference) - [[LLM推論]](更新) — レイテンシ・スループット双対性がバッチサイズという単一パラメータの内部でも成立することを、SD 速度向上の減衰(モデルサイズ依存)から追記。(LLM systems) ### 2026-07-30 ingest-paper | veScale-FSDP: Flexible and High-Performance FSDP at Scale (MLSys 2026 Industry Track) - [[RaggedShard]](新規) — 任意粒度・任意分布のシャーディングを許す DTensor プレースメント。要素単位/行単位という既存 FSDP シャーディングの二極化に、カスタムブロック粒度という第三の軸を導入し、非要素単位計算・ブロック単位量子化・コレクティブ再分配を単一フォーマットで満たす。構造認識プランニングアルゴリズム(NP-hard な Partition 問題への帰着 + 多項式時間 DP ヒューリスティック)と Distributed Buffer(DBuffer、ゼロコピー通信プリミティブ)を伴う。(distributed / machine-learning-systems) - [[ZeROパラメータシャーディング]](更新) — FSDP2 の per-parameter シャーディングが柔軟性の代償として interleaved コピーオーバーヘッド(最大 14%)を新設したこと、RaggedShard がこれをブロック単位の柔軟な粒度 + DBuffer のゼロコピーで解消することを横断的知見に追記。未解決の問いに固定粒度 vs 可変粒度シャーディングの今後の主流を追加。 - [[ZeROメモリ最適化]](更新) — DBuffer の決定論的・バッチ化メモリ管理が DeepSpeed/FSDP1 の非決定論的解放(ピークメモリ+20%)を解消し、FSDP2 の eager allocation 比でも 12% 追加削減することを横断的知見に追記。 - [[集合通信]](更新) — RaggedShard の構造認識プランニングアルゴリズムが、FAST(Birkhoff 分解)・HeteCCL(CEGIS)・DreamDDP(DFS)と同じ「問題固有の構造で NP 困難な探索を削減する」設計パターンを、通信スケジューリングではなくシャーディングのメモリレイアウト設計という異なる最適化対象で独立に再現していることを横断的知見に追記。 ### 2026-08-04 ingest-paper | A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM - [[LLM訓練シミュレーション・エミュレーション]](新規) — 本番クラスタへのアクセスなしに大規模 LLM 訓練の性能・実行挙動を予測・再現する技術群(シミュレーション/縮小規模実験/エミュレーションの3系統)を扱う概念。PrismLLM のコンテキストスイッチによるグラフ収集とハイブリッドエミュレーションを中心事例として記録。(distributed / hpc) ### 2026-08-04 ingest-paper | Closing the Efficiency Gap: AI Datacenter Co-design Roadmap for Scalable Training of LLMs (ICS '26) - [[AIデータセンタートポロジ]](更新) — FullFlat(全光配線 CPO)トポロジが SU/SO 帯域均等化により二層構造の前提そのものを解消する第 3 の設計選択肢であること、HBD=1024 という co-design 目標値を横断的知見に追記。 - [[Mixture-of-Experts]](更新) — MoE の All-to-All ボトルネックに対しネットワークトポロジ層(FullFlat)で応答する第 5 のレイヤー、EP=#Experts・ES=TP のデフォルト前提が最適でないことの定量実証を横断的知見に追記。 - [[並列化戦略]](更新) — MoE 特有の EP/ES を非 MoE 側の TP/PP から独立させる decoupled parallelism が GPT4-1.8T の MFU を改善することを横断的知見に追記。 - [[集合通信]](更新) — ハードウェアアクセラレーテッド collective・計算通信オーバーラップの欠如による性能劣化が、通信比率の低い密モデルの方が MoE より深刻であるという結果を横断的知見に追記。 ## 現行コンセプトカタログ この節は `wiki/concepts/` の実体ファイルから機械生成する。取り込み履歴とは独立に、現行の概念集合を正とする。 - [[1サンプルRLVR]] - [[2D位置符号化]] - [[2σ手法]] - [[AI Greenferencing]] - [[AIOps]] - [[AIと科学の集中化]] - [[AIアクセラレータ]] - [[AIデータセンタートポロジ]] - [[AIネイティブ開発]] - [[AI国際検証レジーム]] - [[AI時代の数学研究倫理]] - [[AI検証可能性]] - [[AI生成テキスト検知]] - [[AI研究自動化]] - [[ARIES]] - [[Adaptive Paging]] - [[Adaptive Radix Tree]] - [[AirAlert]] - [[AlexNet]] - [[Application Checkpointing]] - [[Auto-tuning]] - [[AutoMixer]] - [[B-Tree]] - [[B-Treeノードレイアウト最適化]] - [[BPF]] - [[Brainiac設計]] - [[C10K問題]] - [[CAST]] - [[CDN計測システム]] - [[COLA]] - [[CPU利用率]] - [[CUDA]] - [[CUDA API トレース]] - [[CUDAGraph]] - [[Capability-based Security]] - [[Capsicum]] - [[Chain-of-Thought Prompting]] - [[ChatOps]] - [[Cinderella Glass Slipper効果]] - [[CloudOps時系列予測データセット]] - [[CoTモニタリング]] - [[Common Grounding]] - [[Complexodynamics]] - [[Container Transplantation]] - [[Contiguous Patch Masking]] - [[DASEアーキテクチャ]] - [[DLトレーニングサイレントエラー]] - [[DLプラットフォーム品質問題]] - [[DORA]] - [[DSA]] - [[DSLクエリ推薦]] - [[DTrace]] - [[Decode Context Parallelism]] - [[Deep Packet Inspection]] - [[Deep Speech 2]] - [[Design for Reliability]] - [[DevOps]] - [[Dragonflyトポロジ]] - [[ECMP]] - [[Edge Computing]] - [[Edge-cloud Collaboration]] - [[Expect]] - [[Experimentable Infrastructure]] - [[Extension Interface Model]] - [[FRACAS]] - [[Fat-Tree]] - [[Fault Localization]] - [[Feel-through]] - [[File Identifier (FID)]] — 分散ファイルシステムにおけるファイルの一意識別子と、その位置解決機構 - [[Five Minute Rule]] - [[FlashAttention]] - [[Flexible Skill Arrangement]] - [[Followship]] - [[Frozen Pretrained Transformer]] - [[GPU-Aware MPI]] - [[GPUDirect RDMA]] - [[GPUワークロード分類]] - [[GitHub スター]] - [[GNN同変性]] - [[GPUエネルギー効率]] - [[GPUクラスタスケジューリング]] - [[GPUクラスタ運用]] - [[GPUストレージIOデータパス]] - [[GPUレジリエンス]] - [[GPU最適化]] - [[GPU観測性]] - [[GameDay]] - [[Gated DeltaNet]] - [[GenAI オブザーバビリティ]] - [[Grouped-Query Attention]] - [[HPCインターコネクトベンチマーク]] - [[HPCジョブスケジューリング]] - [[HPCジョブモニタリング]] - [[HPCジョブ会計とリソース利用可視化]] - [[HPCワークロード特性化]] - [[Handover Communications]] - [[Harness Engineering]] - [[Heisenbug]] - [[Homo Convivium]] - [[Human-out-of-the-loop]] - [[IPCメトリクス]] - [[Incast]] - [[Incident Commander]] - [[Infrastructure as Code]] - [[Instructions Per Cycle]] - [[Interactive AIOps]] - [[Joint Activity]] - [[KIMetrix]] - [[KPI異常検知]] - [[KVキャッシュ管理]] - [[KVキャッシュ量子化]] - [[Koopman作用素]] - [[Kubernetesオペレータ]] - [[LINE]] - [[LLM Wikiパターン]] - [[LLMによる根本原因分析]] - [[LLMのハルシネーション]] - [[LLMアプリケーション信頼性]] - [[LLMインシデント要約]] - [[LLMサービング管理]] - [[LLMスケーリング則]] - [[LLMドリブンコード探索]] - [[LLMランキング]] - [[LLM分散学習]] - [[LLM利用実態分析]] - [[LLM向け情報検索]] - [[LLM学習モニタリング]] - [[LLM意味表象]] - [[LLM推論]] - [[LLM推論設計空間探索]] - [[LLM駆動GPUカーネル生成]] - [[LLM時系列アプローチ]] - [[LLM比較器]] - [[LLM算術機構]] - [[LLM能力スパース性]] - [[LLM自己検証]] - [[LLM訓練シミュレーション・エミュレーション]] - [[LLM評価]] - [[LSMツリー]] - [[LSMツリーコンパクション]] - [[LSTM]] - [[Learned Index]] - [[Lightweight Sandboxing]] - [[Linuxカーネルインタフェース]] - [[Louvain法]] - [[ML Productivity Goodput]] - [[MLプロファイリング]] - [[MLモデル監視]] - [[MRC]] - [[MTWTF]] - [[MetricsQL]] - [[Mixture-of-Experts]] - [[Multi-Head Latent Attention]] - [[Multi-Party Dilemma]] - [[NLPベースDBチューニング]] - [[NetOps]] - [[Netlinkソケット]] - [[Networked Agent Memory]] - [[Networked Causality Representation]] - [[NoPE]] - [[OLTPシステムアーキテクチャ]] - [[OTAP]] - [[OTel-Arrow]] - [[OpsQA]] - [[PAC学習]] - [[PTD-P]] - [[PTX 注入]] - [[PageRank]] - [[PagedAttention]] - [[Para-passthrough Hypervisor]] - [[Parameter Server]] - [[Physics of Language Models]] - [[Player Journey]] - [[Practice of Practice]] - [[Prefill-Decode分離]] - [[Prometheus TSDB]] - [[Prometheusシリーズチャーン]] - [[Prometheusルールリント]] - [[QK-Norm]] - [[Quality of Alerts]] - [[RAGノイズ除去]] - [[RAGベースクラウド運用支援]] - [[RDMAネットワークロードバランシング]] - [[RaggedShard]] - [[RCA入力選別]] - [[RCA評価設計]] - [[RDMA]] - [[RDMAネットワーク監視]] - [[RFS(Receive Flow Steering)]] - [[RLHF誤誘導]] - [[RL重み差分配信]] - [[RNN]] - [[RPS(Receive Packet Steering)]] - [[RSS(Receive Side Scaling)]] - [[Raftログ診断]] - [[Rail-Optimizedトポロジ]] - [[ReAct]] - [[Recursive Self-Improvement]] - [[Reliability Map (r9y.dev)]] - [[Retrieval-as-Reasoning]] - [[Retroactive Sampling]] - [[Ring AllReduce]] - [[RoCE設計課題]] - [[Rooflineモデル]] - [[SAE]] - [[SIMDベクトル処理]] - [[SLI-SLO段階的導入]] - [[SLODLC]] - [[SPACE]] - [[SRE]] - [[SRE AI Autonomy Levels]] - [[SRE Benchmark]] - [[SREの工学化]] - [[SRE組織変革]] - [[SRE論文]] - [[SRv6]] - [[SSL TLS アクセラレーション]] - [[Safety-II]] - [[Sandbox Tailoring]] - [[Scaling Telemetry Workloads]] - [[Security Level Objectives]] - [[See-through]] - [[Self-Hosted WebAssembly Runtime]] - [[Software Craftsmanship]] - [[Sparkジョブ異常診断]] - [[Speculative Decoding]] - [[TLA+]] - [[TSG自動化]] - [[TSMixer]] - [[TTXメトリクス]] - [[Transactional No-Regression]] - [[Transformer]] - [[TrueTime]] - [[Ultra Ethernet]] - [[VLIW]] - [[VM Migration]] - [[VPCネットワーク可用性]] - [[Valiant Load Balancing]] - [[Virtual Private Cluster]] - [[Warningアラート]] - [[WebAssembly]] - [[Webサーバアーキテクチャ]] - [[Webロードバランシング]] - [[Write-Ahead Logging (WAL)]] - [[ZeROオプティマイザ]] - [[ZeROパラメータシャーディング]] - [[ZeROメモリ最適化]] - [[Zonemap]] - [[agentic SRE]] - [[eBPF]] - [[eBPFマップ]] - [[eGPU]] - [[epoll]] - [[inside the loops]] - [[kqueue]] - [[netmap]] - [[nvidia-peermem]] - [[obd デバイスモデル]] — ファイルシステムの構成要素を統一デバイス抽象として登録・接続・解体し、import/export 対で関係を表す設計 - [[pairwiseランキング]] - [[u-μP]] - [[uprobe]] - [[なめらかなシステム]] - [[べき等性]] - [[アウトオブオーダー実行]] - [[アウトオブコア処理]] - [[アクショナブルアラート]] - [[アクセシビリティ]] - [[アテンションヘッド]] - [[アノマリー応答]] - [[アプリケーションカーネルによるHPC QoS監視]] - [[アモータイズド因果発見]] - [[アライメント]] - [[アラートアンチパターン]] - [[アラートインシデント分析]] - [[アラートストーム]] - [[アラートフィルタリング]] - [[アラートポリューション]] - [[アラートランキング]] - [[アラート抑制]] - [[アラート疲労]] - [[アラート相関]] - [[アラート管理]] - [[アラート要約]] - [[アラート集約]] - [[アラーム相関]] - [[アルゴリズム設計技法]] - [[アロスタシス]] - [[アンインシデント]] - [[アンサンブル学習]] - [[アーカイバルストレージ]] - [[アーキテクチャスタイル]] - [[アーキテクチャ特性]] - [[イベントベースSLO]] - [[イレイジャーコーディング]] - [[インシデントTTM予測]] - [[インシデントアナリスト]] - [[インシデントシミュレーション]] - [[インシデントストーリー]] - [[インシデントトリアージ]] - [[インシデントメトリクス]] - [[インシデントレスポンスAIレベル]] - [[インシデントレポート執筆]] - [[インシデント優先順位付け]] - [[インシデント対応成熟度モデル]] - [[インシデント影響測定]] - [[インシデント後の人的回復]] - [[インシデント検知]] - [[インシデント管理]] - [[インシデント考古学]] - [[インシデント認識論]] - [[インシデント調査戦略]] - [[インシデント重大度評価]] - [[インターネットスケールサービス設計]] - [[インターフェース仕様の齟齬による障害]] - [[インバンドネットワークテレメトリ]] - [[インメモリデータベース]] - [[エニキャストルーティング]] - [[エネルギー統計]] - [[エフェクチュエーション]] - [[エラーバジェット]] - [[エントロピー崩壊]] - [[エージェントシステム運用]] - [[エージェントネイティブ RL]] - [[エージェントメモリ]] - [[エージェント修復]] - [[エージェント型コーディング]] - [[エージェント型強化学習]] - [[エージェント型推論]] - [[エージェント型時系列予測]] - [[エージェント型科学探索]] - [[エージェント軌跡評価]] - [[エージェント運用安全性]] - [[オブザーバビリティ]] - [[オブザーバビリティデータモデル]] - [[オブジェクトベースストレージ]] - [[オペラビリティ]] - [[オンコールストレス管理]] - [[オンコール自動化]] - [[オープンLLM開発]] - [[オープンネットワーキング]] - [[カオスエンジニアリング]] - [[カバリングナンバー]] - [[カーゴカルトSRE]] - [[カーネルバイパスネットワーキング]] - [[カーネルフュージョン]] - [[カーネル内VM]] - [[カーネル密度推定]] - [[カーネル法]] - [[ガラスストレージ]] - [[キー正規化]] - [[クエリオプティマイザ]] - [[クエリレイテンシ予測]] - [[クエリ実行プラン]] - [[クエリ非相関化]] - [[クォーラムベースレプリケーション]] - [[クラウドインシデント]] - [[クラウドインフラ障害診断]] - [[クラウドゲートウェイ]] - [[クラウドコンピューティング]] - [[クラウドスケールRPC特性]] - [[クラウドモニタリング]] - [[クラウド管理モダリティ]] - [[グラフアルゴリズム]] - [[コミュニティ検出]] - [[コンテンツアドレス指定ストレージ]] - [[コードブックによるイベント相関]] - [[シーケンスマイニング]] - [[ストレージQoS]] - [[ストレージクォータ管理]] - [[ストレージフェイルオーバ]] - [[ソフトウェアファクトリー]] - [[データキュレーション]] - [[データ制約下でのスケーリング]] - [[データ枯渇]] - [[ネットワークトレーシング]] - [[ネットワーク埋め込み]] - [[パイロットジョブ]] - [[ビジュアルアナリティクス]] - [[ファイルレイアウトとストライピング]] - [[フェミニスト・デザインリサーチ手法]] - [[フォトニックインターコネクト]] - [[プル型構成配布]] - [[プログラマブルスイッチ]] - [[ホモフィリー]] - [[メタデータスケーリング]] - [[メッシュ並列]] - [[モジュラリティ]] - [[モジュール性]] - [[ログベースイベント相関]] - [[ログ圧縮と検索]] - [[事前学習データ選択]] - [[二人制御]] - [[信頼性を持つ大規模ログ収集アーキテクチャ]] - [[再帰深度アーキテクチャ]] — 深さ方向に再帰するコアブロックをテスト時に任意回数反復して計算をスケールするアーキテクチャ族 - [[分散ロック管理]] - [[半構造化データ管理]] - [[合成データ]] - [[周波数キャッピング]] - [[弱い紐帯の強さ]] - [[性能変化検知の正確性]] - [[情報カスケード]] - [[意図ロック]] - [[時系列予測の不確実性制御]] - [[時系列基盤モデルのバイアスと失敗モード]] - [[時系列基盤モデルの後学習]] - [[時系列基盤モデルの文脈拡張]] - [[時間-変量交互アテンション]] - [[格子ボルツマン法]] - [[クラウド障害ライフサイクル]] - [[クラスタ安定性]] - [[クラッシュリカバリ]] - [[クリティカルパス分析]] - [[クロスISAマイグレーション]] - [[クロスインシデント分析]] - [[クロスシステムインタラクション障害]] - [[グッドハートの法則]] - [[グラフニューラルネットワーク]] - [[グラフベースRCA]] - [[グレイ障害]] - [[グレースフルデグレーデーション]] - [[ゲーム理論とSRE]] - [[コアレスドメモリアクセス]] - [[コネクションプーリング]] - [[コマンドロギング]] - [[コルモゴロフ複雑性]] - [[コンテキストエンジニアリング]] - [[コンテキスト・アウェアネス]] - [[コンテナオーケストレーション]] - [[コンテナネットワーク分離]] - [[コンテナ仮想化]] - [[コンテナ起動高速化]] - [[コンテナ配置最適化]] - [[コンピュータ免疫学]] - [[コンピュートストレージ分離]] - [[コンピュート格差]] - [[コーディングエージェント評価]] - [[コードLLM]] - [[コード知識強化RCA]] - [[ゴシッププロトコル]] - [[ゴールデンシグナル]] - [[サイバネティクス]] - [[サーバーレスRCA]] - [[サーバーレスアーキテクチャ]] - [[サーバーレスワークフロー]] - [[サービストポロジ]] - [[サービスレベル目標]] - [[サービス依存グラフ]] - [[シェアードナッシング]] - [[システムの正常状態]] - [[シムレイヤー]] - [[シンギュラリティ]] - [[シーケンス並列化]] - [[スケーラビリティ評価]] - [[スケーラビリティ障害]] - [[スケーリング則]] - [[スコアリング可能タスク]] - [[スコファンシ]] - [[ストラグラー]] - [[ストレージ計算分離]] - [[スパン破壊]] - [[スマートNICオフロード]] - [[スライディングウィンドウアテンション]] - [[スーパースカラー実行]] - [[セマンティックキャッシュ]] - [[セルフクラフト]] - [[セルフヒーリング]] - [[ゼロエラー境界]] - [[ゼロコピーネットワーキング]] - [[ゼロコード計装]] - [[ソフトウェアエイジング]] - [[ソフトウェアライフサイクル]] - [[ソフトウェア保守]] - [[ソフトウェア信頼性工学]] - [[ソフトウェア信頼性成長モデル]] - [[ソフトウェア変更管理]] - [[ソフトウェア耐障害性]] - [[ソフトウェア要件工学]] - [[ソフトウェアアップグレードスケジューリング]] - [[ゾーン名前空間SSD]] - [[タイムスケール分離と監視粒度]] - [[タスクベクトル]] - [[タスク並列フレームワーク]] - [[タスク相互依存性]] - [[ダイナミックケイパビリティ]] - [[ダッシュボードとランブックの運用]] - [[ダーク・ファクトリー]] - [[チェックポイント]] - [[チップレット]] - [[テールレイテンシ耐性技術]] - [[テイクオフ速度論争]] - [[テキスト埋め込み]] - [[テスト時計算スケーリング]] - [[テスト障害診断]] - [[テレイグジスタンス]] - [[テレメトリ]] - [[テロワール(味わうことのできる時間)]] - [[テンソルコア]] - [[テンソル並列]] - [[ディペンダビリティ]] - [[デジタル発酵]] - [[デジタル蒸留]] - [[デルタデバッギング]] - [[データセンターL2ファブリック]] - [[データセンターネットワークトポロジ]] - [[データセンターネットワーク信頼性]] - [[データセンター信頼性]] - [[データセンター内光配線設計]] - [[データセンター輻輳制御]] - [[データパーティショニング]] - [[データベース O&M]] - [[データベースノブチューニング]] - [[データベース性能トラブルシューティング]] - [[データベース性能異常ベンチマーク]] - [[データベース接続モデル]] - [[データベース自律診断]] - [[データ品質SLO]] - [[トイル]] - [[トラフィック相関分析]] - [[トレーシングオーバーヘッド]] - [[トレースサンプリング]] - [[トレース品質]] - [[トレース異常検知]] - [[トレードオフ意思決定]] - [[ドメイン別RCA]] - [[ドメイン固有アーキテクチャ]] - [[ドロップアウト]] - [[ヌルのテトラレンマ]] - [[ネスト型カラムナストレージ]] - [[ネットワークシミュレーション]] - [[ネットワーク依存性発見]] - [[ネットワーク対応スケジューリング]] - [[ネットワーク監視]] - [[ネットワーク符号化]] - [[ハイブリッドアテンションアーキテクチャ]] - [[ハイブリッド論理クロック]] - [[ハッシュベースグループ集約]] - [[ハードウェアカウンタ]] - [[ハードディスク信頼性]] - [[ハーネス自己進化]] - [[バイブコーディング]] - [[バッチ障害診断]] - [[パイプライン並列化]] - [[パイプライン処理]] - [[パケットフィルタリング]] - [[ヒストグラムメトリクス]] - [[ヒューリスティックの束]] - [[ヒンドサイトバイアス]] - [[ビジネスモニタリング]] - [[ビジョン言語モデル]] - [[ファイルレベル同期]] - [[フィーチャーフレッシュネス]] - [[フィードバック駆動開発]] - [[フォールトトレランス]] - [[フロースケジューリング]] - [[ブラスト半径]] - [[ブロックレベル差分同期]] - [[プッシュ型パイプライン実行]] - [[プラットフォームエンジニアリング]] - [[プラトン的表現仮説]] - [[プロアクティブ検証]] - [[プロアクティブ障害管理]] - [[プロセスペア]] - [[プロトタイプ意味論]] - [[プローブ効果]] - [[ベイズ最適化]] - [[ページキャッシュカスタマイズ]] - [[ホスト誘導データ配置]] - [[ホットリスタート]] - [[ポインターネットワーク]] - [[ポストモーテム]] - [[マイクロサービスアーキテクチャ]] - [[マイクロサービスコールグラフ]] - [[マイクロサービスベンチマーク]] - [[マタギドライヴ]] - [[マルチエージェント協調]] - [[マルチコンテキストウィンドウエージェント]] - [[マルチトークン予測]] - [[マルチプレーンClosトポロジ]] - [[マルチベンダーLosslessネットワーク]] - [[マルチモーダル障害診断]] - [[ムーアの法則とデナードスケーリングの終焉]] - [[メインメモリデータベース]] - [[メタ安定障害]] - [[メッセージパッシングニューラルネットワーク]] - [[メトリクス削減]] - [[メモリウォール]] - [[メモリ拡張ニューラルネットワーク]] - [[メモリ階層とキャッシュ]] - [[モデルパラメータ算術]] - [[モデル圧縮]] - [[モデル崩壊]] - [[モデル縫合]] - [[モデル表現収束]] - [[モデルスケーリング高速化]] - [[モデル内部可観測性]] - [[モナド論]] - [[ユーザーレベルTCPスタック]] - [[ヨーロッパのAI主権]] - [[ライブアップグレード]] - [[ランタイム中立チェックポイント]] - [[リアルタイム依存性マップ]] - [[リクエストフロー再構築]] - [[リクエストモデリング]] - [[リスタート保護]] - [[リソースオーバーハング]] - [[リーダー選出]] - [[ループエンジニアリング]] - [[レジリエンスエンジニアリング]] - [[レトロスペクティブファシリテーション]] - [[ログクラスタリング]] - [[ログパース]] - [[ログベース異常検知]] - [[ログベース障害診断]] - [[ログ生成]] - [[ログ解析]] - [[ログ重複排除]] - [[ロジットレンズ]] - [[ワンショットRCA]] - [[ワークフロー自動化]] - [[ワークベンチ自動化]] - [[一対比較ランキング]] - [[一貫性ハッシュ法]] - [[偉大な仕事の技法]] - [[不均衡障害分類]] - [[並列データベース]] - [[並列ファイルシステム]] - [[並列化戦略]] - [[主体なき美の美学]] - [[主権AI]] - [[事前学習目的設計]] - [[事故モデル]] - [[人的要因]] - [[人間フィードバックからの強化学習]] - [[介入的因果学習]] - [[仮説駆動RCA]] - [[体系的マッピング研究]] - [[価値生成の膜モデル]] - [[信号伝播]] - [[優先度駆動リアルタイム実行系]] - [[光トランシーバー電力方式]] - [[光ファイバーシャフル配線]] - [[光学文字認識]] - [[光学迷彩]] - [[共有異常]] - [[再マテリアライゼーション]] - [[再帰化]] - [[再帰障害]] - [[分岐予測]] - [[分岐発散]] - [[分散 PostgreSQL]] - [[分散SQLデータベース]] - [[分散キャッシュ]] - [[分散コンセンサス]] - [[分散コンセンサス回避]] - [[分散システム障害]] - [[分散ストレージ]] - [[分散トランザクション]] - [[分散トレーシング]] - [[分散メッセージブローカ]] - [[分散実行最小化]] - [[列指向OLAPデータベース]] - [[制御ループの安定性とタイムラグ補償]] - [[制約付きデコーディング]] - [[動的タスクグラフ]] - [[動的ランタイム切り替え]] - [[動的計装]] - [[単一サンプルRCA]] - [[反復ヘッド]] - [[収束型システム管理]] - [[収束暗号化]] - [[可解性複雑性指標]] - [[同時マルチスレッディング]] - [[否定文理解]] - [[四資本の時計]] - [[因果推論ベースRCA]] - [[因果発見]] - [[地域の乳化剤]] - [[地理分散SQLデータベース]] - [[基礎情報学]] - [[報酬ハッキング]] - [[変分ベイズニューラルネットワーク]] - [[変分損失性オートエンコーダ]] - [[変化点検知]] - [[変更起因インシデント]] - [[外部マージソート]] - [[外部一貫性]] - [[多変量時系列予測]] - [[好奇心駆動学習]] - [[存続可能性から生成する力へ]] - [[定常性モデル]] - [[実行トレース]] - [[宣言的RCA]] - [[密度ベースクラスタリング]] - [[専用データベースシステム]] - [[導出データ]] - [[差分プライバシー]] - [[差分可観測性]] - [[帰属手法]] - [[帰納ヘッド]] - [[強化ファインチューニング]] - [[強化学習スケーリング]] - [[弾性LLM訓練]] - [[性能可搬性]] - [[情報理論的異常スコア]] - [[情報量基準メトリクス選定]] - [[情報顕微鏡]] - [[批判的デジタルネイチャー]] - [[拡張現実感]] - [[指示チューニング]] - [[操舵ベクトル]] - [[敵対的摂動]] - [[文字レベル言語モデル]] - [[文書理解]] - [[文脈付き検索]] - [[文脈内学習]] - [[文脈自由文法]] - [[日本の博士教育]] - [[時系列クラスタリング]] - [[時系列データベース]] - [[時系列データベースベンチマーク]] - [[時系列データ生成]] - [[時系列トークナイゼーション]] - [[時系列マルチモーダルLLM]] - [[時系列基盤モデル]] - [[時系列推論]] - [[時系列異常検知ベンチマーク]] - [[時系列知識グラフ]] - [[時系列質問応答]] - [[時系列類似度検索]] - [[時間的映像グラウンディング]] - [[普遍知能尺度]] - [[暗黙のコンテキスト伝搬]] - [[暗黙的正則化]] - [[最小記述長原理]] - [[本番接地型ベンチマーク]] - [[条件付き計算]] - [[根本原因分析]] - [[検証可能報酬による強化学習]] - [[構造化深層思考]] - [[権力集中リスク]] - [[機構的解釈性]] - [[残差学習]] - [[永続状態相互作用監査]] — OSレベルで永続状態への全アクセスを非参加型に監査するアプローチ(LiveOps, LISA'06) - [[汎化誤差バウンド]] - [[決定志向予測評価]] - [[注意機構]] - [[活性化パッチング]] - [[深層学習の汎化]] - [[混合精度反復求解法]] - [[混合精度訓練]] - [[減算]] - [[潜在推論]] - [[潜在的障害]] - [[熱管理]] - [[特徴量削減]] - [[状態空間モデル]] - [[産業用監視システム]] - [[異常検知]] - [[畳み込みニューラルネットワーク]] - [[知能爆発]] - [[知識のリレーションシップモデル]] - [[知識グラフ]] - [[知識容量スケーリング則]] - [[知識操作]] - [[知識編集]] - [[知識蒸留]] - [[組織の信頼性マインドセット]] - [[結合順序最適化]] - [[結果整合性]] - [[統合グラフィックス]] - [[統計的機械学習]] - [[継続的プロファイリング]] - [[網羅]] - [[線形注意]] - [[縮約]] - [[耐障害LLMサービング]] - [[耐障害LLM訓練]] - [[脆弱性バジェット]] - [[膨張畳み込み]] - [[自動ジョブキャンセル]] - [[自動ビルド修復]] - [[自動並列化]] - [[自動化のアイロニー]] - [[自動化の皮肉]] - [[自動査読]] - [[自己回帰空白埋め]] - [[自己圧縮]] - [[自然言語推論]] - [[複製ステートマシン]] - [[複雑システム障害論]] - [[複雑ネットワーク]] - [[見えない労働とジェンダー化された技術労働]] - [[言語モデルのプロービング]] - [[言語モデル事前学習]] - [[計算最適訓練]] - [[計算機自然]] - [[計算複雑性]] - [[訓練不変条件]] - [[設定マイニング]] - [[設定ミス脆弱性]] - [[診断的正当化]] - [[認知意味論]] - [[認知的徒弟制]] - [[調律]] - [[負荷分散]] - [[距離相関]] - [[軽量形式手法]] - [[近似クエリ処理]] - [[連合学習]] - [[進化的探索によるエージェント設計]] - [[逸脱の正常化]] - [[遅延注入]] - [[遅延認識時空間因果推論]] - [[運用障害分析]] - [[過剰人材効果]] - [[適応的ワークロード生成]] - [[選択的活性化再計算]] - [[重要アラートマイニング]] - [[開発者生産性]] - [[間欠的遅延クエリ]] - [[関係推論]] - [[関数ベクトル]] - [[限定観測可能性]] - [[階層型メトリック収集アーキテクチャ]] - [[階層的デルタデバッギング]] - [[障害スケッチング]] - [[障害パターンプロファイリング]] - [[障害予測]] - [[障害依存グラフ]] - [[障害傾向分析]] - [[障害注入]] - [[障害緩和]] - [[障害耐性劣化変更検知]] - [[集中不等式]] - [[集合の順列不変表現]] - [[集合知]] - [[集合通信]] - [[電力スパイク]] - [[電力管理]] - [[非侵入プロファイリング]] - [[非同期エージェントRL]] - [[非同期分散データフロー]] - [[非致命的RPCエラー]] - [[面白さ優先分類]] - [[バイトレベルスケッチ計測]](新規) — P4 プログラマブルスイッチ上でパケットのバイト長を対象にフローサイズを推定するスケッチアルゴリズム設計の問題領域。FlowLog の ByteSketch がビットシフト圧縮+確率的補正で CM Sketch のバケットオーバーフロー問題をアーキテクチャレベルで解決する設計を中心概念として記録。(concept / networking / network-measurement) - [[SREエンゲージメントモデル]](新規) — SRE チームが開発チームとどう関わるかを「引き受ける/一緒にやる/助言する/配る」の4区分に整理するフレームワーク。[[組織の信頼性マインドセット]]の縦軸(フェーズ)と組み合わせて2次元マップを構成する。(concept / sre / organization) - [[因果推論ベースRCA]](更新) — PetShop 論文による traversal・CIRCA・Counterfactual Attribution の実クラウドベンチマーク横並び評価(可用性系障害での Counterfactual Attribution の脆さ)を追記。著者 Orchard の NeurIPS 2025 理論研究との系譜も接続。(aiops / rca / causal-inference) - [[RCA評価設計]](更新) — PetShop が CIRCA D_O に先行する複数手法横並び比較の先例であること、top-1/top-3 recall の逆転現象が Dummy ベースライン知見の先駆的実証であること、正常時 specificity 検証という後続ベンチマークに踏襲されなかった評価軸を追記。(aiops / benchmark) - [[GPUプーリング]](新規) — ドライバレベルの傍受で単一物理 GPU/NPU を複数の弾力的な vGPU/vNPU に分割する仮想化技術。[[gPooling]] の提案する時分割多重+利用率フィードバック方式とメモリクォータ強制方式を中心概念として記録。(concept / distributed-systems / hpc / virtualization) - [[カーネル障害診断]](新規) — Linux カーネルクラッシュの障害箇所特定と因果説明を扱う問題領域。マイクロサービス向け RCA が前提とする rich な運用テレメトリが存在せず、syscall・非構造化ログ・crash report という疎で低レベルなアーティファクトとソースレベル意味論(マクロ展開・ポインタ間接参照・設定依存分岐)を対象とする点で [[Fault Localization]] と質的に異なることを、KernelDiag の役割特化エージェント設計と Log-to-Code Mapping を中心に記録。(concept / linux / fault-localization / agentic-coding) - [[Fault Localization]](更新) — KernelDiag によるカーネル領域固有の信号源の乖離(運用テレメトリ不在)を横断的知見に追記し、[[カーネル障害診断]] への一方向参照を追加。(aiops / sre) - [[帰属手法]](更新) — SE(86.20%が局所説明、大域説明単独はゼロ)・金融・ヘルスケアの横断比較で、LIME/SHAPの選好が領域ごとに逆転する構造(SE=LIME優勢 vs 金融・ヘルスケア=SHAP優勢)とMLライブラリ報告の不透明性を横断的知見に追記([[@2026__ACCESS__Explainable Artificial Intelligence in Software Engineering Current Trends, Gaps, and Future Directions]])。 - [[ゴシッププロトコル]](更新) — SWIM(DSN 2002)を追加し、Cassandra/Dynamo のアンチエントロピー型ゴシップ(全状態ダイジェストの定期交換)と、SWIM のピギーバック型感染様式ディセミネーション(専用メッセージを生成せず障害検知メッセージに相乗り)という 2 つの実装系統を対比。Φ 累積障害検知器と SWIM の Suspicion サブプロトコル(離散状態遷移+仮想 incarnation number)の設計比較も追記。(distributed / membership / failure-detection) - [[集合通信]](更新) — NIXT(NCCL Inspector Exporter Tool)を追加し、本番訓練の帯域変動係数(CV)が孤立ベンチマークの2〜5倍という定量化、NCCL Inspector という公式プラグイン API 後段解析が Mycroft/CCL-D の CCL 内部計装とは異なる非侵襲的観測点であること、通信子トポロジ×メッセージサイズ空間の疎な集中構造の独立確認を横断的知見に追記。(distributed / gpu) - [[ストラグラー]](更新) — NIXT の空間相関分析(per-通信子・rank の帯域幅表示)による、CCL のオフラインログのみでのストラグラー局所化(健全時比帯域3〜4倍低下・CV 4〜8倍増加)を横断的知見に追記。根本原因確定にはファブリック層テレメトリとの相関が必要という限界も追記。(distributed / machine-learning) - [[GPU起動型ネットワーキング]](新規) — CPU の介在なしに GPU カーネルがネットワーク越し RDMA を発行するデバイス起動通信の concept。NCCL GIN と NVSHMEM GDAKI が同じハードウェア基盤(DOCA GPUNetIO)の上に異なるランタイム哲学(PGAS vs ウィンドウベース)で統合される点、性能同等でも「エコシステム統一」が別の価値軸になる点を横断的知見に記載。([[@2025__arXiv__GPU-Initiated Networking for NCCL]])(networking / gpu / hpc) - [[集合通信]](更新) — GIN が集団通信とは別カテゴリの one-sided デバイス起動通信を NCCL Device API に並走させる点を横断的知見に追記。([[@2025__arXiv__GPU-Initiated Networking for NCCL]])(distributed / gpu) - [[RDMA]](更新) — GPU起動型ネットワーキングの GDAKI バックエンドが要求する「デバイスアクセス可能な制御構造を持つ NIC」という新しいハードウェア互換性軸を横断的知見に追記。([[@2025__arXiv__GPU-Initiated Networking for NCCL]])(networking / hpc) - [[RDMA]](更新) — GPUDirect RDMA をノード間通信5分類(Host Native〜Device Native)の中間段階として位置づけ、カーネル境界を越えたGPU-NICメモリ一貫性を保証しないというソフトウェア的限界(ROC_SHMEMのみカーネル内保証)を横断的知見に追記。([[@2026__CSUR__The Landscape of GPU-Centric Communication]])(networking / hpc / gpu) - [[GPU起動型ネットワーキング]](更新) — Device Nativeというノード間通信taxonomyの最終段階としての体系的位置づけと、ROC_SHMEMがGDAKI/GINに先行してGPU-NICメモリ一貫性問題を解決していたという横断的知見を追記。([[@2026__CSUR__The Landscape of GPU-Centric Communication]])(networking / gpu / hpc) - [[集合通信]](更新) — NCCL/RCCL/oneCCLの実行モデルの質的差異(GPUカーネル完全自律駆動 vs CPUワーカー駆動)がCCLブラックボックス問題の根の一つであること、GPUCCLがGPU-Aware MPI/GPUSHMEMと並ぶ第三の通信モデルとして単一カーネル融合設計を共有することを横断的知見に追記。([[@2026__CSUR__The Landscape of GPU-Centric Communication]])(distributed / gpu) - [[メガカーネル]](新規) — MoE 層の通信と計算を単一の永続的 GPU カーネルへ融合する設計手法。[[Mixture-of-Kittens]](Cursor Research、NVIDIA GB300 NVL72 向け OSS メガカーネル)を中心概念として記録。([[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]])(gpu-kernels / distributed) - [[Mixture-of-Experts]](更新) — DeepSeek-V4 の MegaMoE(モデル専用垂直統合メガカーネル)と Mixture-of-Kittens(Cursor Research、複数モデル形状対応の OSS メガカーネル)の設計比較、pull-based dispatch が押し込み型に対し最大29%高い NVLink 帯域利用率を達成するという知見を横断的知見に追記。([[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]])(machine-learning / distributed / gpu) - [[集合通信]](更新) — MoE トークンディスパッチの通信方向(pull vs push)自体が独立した性能最適化軸であるという知見を、GIN の one-sided API とは異なる一段下位の設計変数として追記。([[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]])(distributed / gpu) - [[LLM駆動GPUカーネル生成]](更新) — 「エージェント単体生成の性能限界」(FlashInfer-Bench)と「人間+エージェント協働開発の生産性向上」(Mixture-of-Kittens)は異なる問いに答えており単純比較できないという対比を追記。([[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]])(gpu / llm-inference / agentic-ai) - [[マテリアライズドメトリクス]](新規) — pod ラベル等インフラ由来ラベルをスクレイプ時に畳み込み、delta 化+固定間隔強制リセットで生成する「ジグザグカウンタ」によりレプリカ間合意なしの比較・重複排除を実現する Prometheus 集約手法。本番で系列数98%削減・スループット88%減・レイテンシ80%減・誤差率0.15%。([[@2026__RedditEng__Materialized Metrics in Prometheus]])(prometheus / observability / sre) - [[Prometheusシリーズチャーン]](更新) — 同じ Reddit オブザーバビリティチームによる stale-series compaction(ストレージ層)とマテリアライズドメトリクス(集約層)という、同一問題への2つの異なるレイヤーの解法を対比する横断的知見を追記。([[@2026__RedditEng__Materialized Metrics in Prometheus]])(prometheus / sre) - [[Prometheus TSDB]](更新) — ラベルセット=系列識別という基本モデルから、ストレージ側(失活系列滞留)とクエリ側(カウンタ合算不能性)という2種類の異なる副作用が生じるという横断的知見を追記。([[@2026__RedditEng__Materialized Metrics in Prometheus]])(prometheus / storage) - [[メタテクニック(情報科学)]](新規) — コンピュータアーキテクチャ・OS・分散システム・データベース・ネットワークを横断して繰り返し現れる基本的設計技法(キャッシング・パイプライニング・投機的実行・並列化・仮想化・トランザクション等18種)を集約する concept。単一ソースのみのため横断的知見は未蓄積、未解決の問いとして技法間の依存・対立関係の整理と他 concept([[集合通信]]等)への対応付けを記録。([[@2015__SlideShare__情報科学における18のメタテクニック]])(computer-science-general) - [[分散コンピューティングコンティニュウム]](新規) — クラウド・フォグ・エッジ・モバイル・IoT・センサの6層を単一の連続体として扱う計算パラダイム。DCCS性能メトリクスタクソノミーの数理システムモデル($S=C\cup F\cup E\cup M\cup\Gamma\cup\Psi$)を集約。単一ソースのため横断的知見は未蓄積。([[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]])(distributed-systems / edge-computing) - [[性能測定]](更新) — DB/OS単体を対象とする「性能測定道」のモデル化・計測・シミュレーションの哲学と、DCCSのような分散多層システムを対象とする acquisition scope/phase/method の3次元取得要件分類との対比を横断的知見に追記。([[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]])(performance-engineering / distributed-systems) - [[Edge Computing]](更新) — EdgeSysのエッジ-クラウド2層構造と、DCCSタクソノミーの6層構造(コンティニュウムの一断面としてのエッジ)の対比、Wasmランタイムマイグレーション研究とMigration Stability Index/移行フレキシビリティの対応関係を横断的知見に追記。([[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]])(edge-computing / distributed-systems) - [[分散合意プロトコル]](新規) — 複数サーバが合意ログに合意しフォールトトレランスを実現する仕組み。RDMA のプロセッサバイパス特性による「粗粒度/細粒度」障害モデルの区分と、Write-Read-Verify による排他制御なしの合意設計パターンを集約。([[@2026__TPDS__R2aft - A Speedy and Highly Available RDMA-Based Consensus Protocol]])(distributed-systems) - [[RDMA]](更新) — RDMA のプロセッサバイパス特性を合意プロトコルの細粒度障害モデルへ応用する視点と、Write-Read-Verify という排他制御なし合意の設計パターンを横断的知見に追記。([[@2026__TPDS__R2aft - A Speedy and Highly Available RDMA-Based Consensus Protocol]])(networking / hpc) - [[動的因果推論]](新規) — 因果的な有向依存関係が時間とともにどう変化するかを推定する枠組み。DCNAR の二段階設計(ニューラル因果発見→時変ネットワーク自己回帰)と、予測精度中心からインパルス応答・反実仮想軌道による行動診断への評価基準の転換を集約。([[@2026__KDD__From Causal Discovery to Dynamic Causal Inference in Neural Time Series]])(causal-discovery / time-series) - [[因果発見]](更新) — 因果発見の出力を「最終推論対象」ではなく下流の時変因果推論を制約する構造事前分布として再利用する視点、およびフィードバックループが研究対象そのものである社会科学ドメインで非巡回性制約付き手法が意図的に不採用とされる事例を横断的知見に追記。([[@2026__KDD__From Causal Discovery to Dynamic Causal Inference in Neural Time Series]])(causal-discovery / graphical-models) - [[並列化戦略]](更新) — マルチモーダルLLMではencoderとLLMバックボーンという2つの異質なサブモデルに対し異なる並列化戦略を選びつつ同一GPU集合を時間多重化するencoder-LLM multiplexingという、Calculon-MoEの次元分離とも異なる質的に新しいdecouplingの形を横断的知見に追記。([[@2026__EuroSys__MegaScale-Omni - A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production]])(distributed / machine-learning) - [[LLM分散学習]](更新) — マルチモーダルLLM訓練が単一モダリティ訓練にはない「動的ワークロード」という第4のSER制約軸を追加すること、実運用/静的合成ワークロード間に17%のMFUギャップが存在するという定量開示を横断的知見に追記。([[@2026__EuroSys__MegaScale-Omni - A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production]])(distributed / machine-learning) - [[LLMによる根本原因分析]](更新) — 診断対象をマイクロサービス/クラウドインシデントからLLM推論基盤自身(GPUカーネル・CUDA API・通信)へ下げたTELLERの事例と、Trace Pair Encodingによる文脈圧縮のRCA精度への定量的影響、eACGMからの著者陣の研究発展を横断的知見に追記。([[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]])(aiops / llm / rca) - [[GPU観測性]](更新) — CUPTI/NVTXを「回避対象」でなく「リクエストレベル帰属」目的で正面採用するTELLERの設計と、NVTX動的importフックという第4の計装挿入時点を横断的知見に追記。([[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]])(gpu / observability) - [[CUDA API トレース]](更新) — eBPF uprobe以外にCUPTIコールバック/アクティビティAPIによるCUDA APIトレース実装が存在すること、相関IDによる非同期境界解決の実装例を横断的知見に追記。([[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]])(gpu / observability / tracing) - [[マルチモーダル障害診断]](更新) — マイクロサービス層のログ・メトリクス・トレース3モダリティに対し、LLM推論基盤層ではトレース・ログ2モダリティに絞られ「構造圧縮」が新しいボトルネックとして前景化するという横断的知見を追記。([[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]])(aiops / microservices) - [[AIスーパーノード]](新規) — 多数のXPUをスケールアップファブリックで密結合するラック規模アーキテクチャ単位。CPU:GPU比1:1接近の背景にあるAgentic AIの遊休時間構造(実稼働率15%)と、スケールアップファブリックのプロトコル多元化(UALink/CXL/PCIe/OISA等)の中での物理要求仕様の共通性を集約。([[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]])(infrastructure / hardware) - [[800V高圧直流給電]](新規) — AIラックの給電アーキテクチャを48V/54V主母線から800V高圧直流へ移行する設計。複数ベンダー(ByteDance大禹、Murata ORV3 HPR)で共通する電力等級ロードマップの段階性と、給電段数増加(2段→3段)・パッケージ革新(晶豊明源のCo-Package)との連動を集約。([[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]])(infrastructure / power) - [[KVキャッシュ管理]](更新) — DRAM/NANDフラッシュの約200倍のコスト差と、ヒット率のわずかな改善(95%→97.5%)が演算需要を非線形に半減させる経済性の知見、Active/Archive用途別2階層SSD設計を追記。([[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]])(llm / inference / kv-cache) - [[光ファイバーシャフル配線]](更新) — Shuffle Cable/Shuffle Box/CPOスイッチ内蔵Shuffleの3方式11観点比較、Fate Sharing(共通故障点)の明示的定義、NIC breakoutの選択肢(Dual/Quad/Octal-Plane)を横断的知見に追記。([[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]])(networking / datacenter) - [[マルチプレーンClosトポロジ]](更新) — マルチプレーンを機能させるために必須のNICハードウェア/通信ライブラリ側の要件(spray・集約再整列・障害時自動シフト)と、プレーン分散後もhost側Fate Sharingが残るという理論的上限を横断的知見に追記。([[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]])(networking / hpc) - [[MRC]](更新) — OCP MRC Specification 1.0準拠のパケットフォーマット・EVステートマシン(GOOD/SKIP/ASSUMED_BAD/DENIED)・配送層/セマンティック層分離・MPR/WriteIMMインフライト制御を「仕様レベルの機構」節として新設。SRv6が3転送モードの1つに過ぎないという誤解の訂正、CNPのSACKへの統合、UEC/UETとの関係精緻化を横断的知見に追記。([[@2026__SpeakerDeck__Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート]])(networking / hpc / rdma) - [[時系列類似度検索]](更新) — 学術的な Time Series Retrieval(TSR)としての定式化を追記し、single hit dominance という評価上の核心課題、UCR-R のラベル起因ノイズ除去プロトコル、CU-RCA で観測された事前学習埋め込みに対する統計的距離の優位というドメインシフトを横断的知見に追記。([[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]])(time-series / information-retrieval / benchmarking) - [[本番接地型ベンチマーク]](更新) — 時系列検索評価における本番接地の独立した再発見の事例として TSRBench の CU-RCA を追加。合成データセット(UCR-R)と産業データセット(CU-RCA)間で手法ランキングそのものが逆転するという「手法選好の忠実度」という新しいパターンを横断的知見に追記。([[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]])(software-engineering / benchmarking / aiops) - [[異常検知]](更新) — 古典的な差分によるトレンド除去(定常化)を逆転させ、離散二階差分(曲率)を判別的シグナルとして明示的に増幅する TFC の設計、および深層 TSAD の平滑化バイアスが弱い幾何レベルの逸脱を減衰させるという横断的知見を追記。単変量前提の曲率視点を多変量へ拡張する際の交差項の扱い、較正機構の長期ドリフト耐性という2件の未解決の問いを追加。([[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]])(aiops / time-series / anomaly-detection) - [[因果推論ベースRCA]](更新) — 適用対象ドメインを都市交通網へ拡張したTRACERを追加。物理法則(運動学的衝撃波理論)による枝刈りと局所的Granger因果性検定を組み合わせるハイブリッド設計が、PCアルゴリズム系のグローバル探索(組合せ爆発・スプリアス相関)より精度・コスト両面で優れることを実証した知見、並列推論+コンセンサス融合というLLM活用パターンを追記。([[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]])(aiops / rca) - [[Fault Localization]](更新) — グラフ集約による平滑化(fault smearing)がマイクロサービス・訓練クラスタに留まらず都市交通網でも同型で再現するという横断的知見、ドメインの物理法則そのものを箇所特定の制約として使うアプローチの知見を追記。([[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]])(aiops / sre) - [[光リンク過剰設計]](新規) — データセンター光トランシーバーがIEEE標準BER要求に対し中央値6倍もの過剰設計状態にあること、伝送距離引き伸ばしによるコスト削減とアプリケーション損失耐性に応じた仮想トポロジルーティング(RAIL)を集約。([[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]])(networking / datacenter) - [[データセンターネットワークトポロジ]](更新) — 単一物理トポロジ上に信頼性水準の異なる複数の仮想トポロジを重ねるRAILの設計を、Fat-Treeの均質信頼性前提と対比する横断的知見を追記。([[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]])(networking / datacenter) - [[データセンター信頼性]](更新) — HDD/サーバー信頼性研究が「信頼性不足への対処」を志向するのに対し、RAILは「信頼性過剰の是正」を志向するという対照的な方向性を横断的知見に追記。([[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]])(datacenter / reliability) - [[光バックボーンネットワークテレメトリ]](新規) — SNMPのpull型・デバイス側処理集約設計が光ネットワークテレメトリの粒度上限を15分程度に固定してきた問題を、ベンダー非依存の標準化デバイスモデルとpush型パイプラインで解消したOpTelを集約。Tx/Rx電力という単一物理量が劣化/中断分類の根拠になる知見も記録。([[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]])(networking / optics / telemetry) - [[テレメトリ]](更新) — push型パイプラインへの転換がアプリケーション層に限らず物理層(光デバイス)にも及ぶという横断的知見を[[光バックボーンネットワークテレメトリ]]から追記。(distributed systems / observability) - [[ネットワーク監視]](更新) — 監視対象がL3(VPC/経路)からさらに物理層(光デバイス)まで降りるという横断的知見を追記。([[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]])(networking / observability / aiops) - [[カナリアテスト]](更新) — 新バージョン・本番変更(カナリア)を現行バージョン・対照母集団と並行稼働させ、性能・正しさを統計的に比較するデプロイリスク低減技術。2015年 IBM CanaryAdvisor(統計仮説検定・許容誤差係数・信頼区間幅の臨界値)と2018年 Google CAS(オンライン挙動学習・確信度非公開のPASS/FAIL/NONE判定)という独立2システムが「統計判定を少数の離散状態に還元する」同型設計に収束するという横断的知見を追加。([[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]], [[@2018__acmqueue__Canary Analysis Service]])(software-engineering / deployment / aiops / sre) - [[変化点検知]](更新) — SST(改良版)とDiD(Difference-in-Differences)を組み合わせた因果帰属付き変化点検知の最初期(2015年)事例をFUNNELから追記。「変化点検知は"いつ変わったか"を、DiDは"なぜ変わったか"を担う」という役割分担、IKAによるSVDベース手法の近似高速化という設計軸を横断的知見に追加。([[@2015__CoNEXT__Rapid and Robust Impact Assessment of Software Changes in Large Internet-based Services]])(time-series / aiops) - [[制御ロールアウト]](新規) — 段階的ロールアウト(Dogfood→Internal→Insiders→Production の各リング)の各リング内でオンライン制御実験(A/Bテスト)を実行するハイブリッド手法。段階的ロールアウト単独の遅さ・代表性の低さと、制御実験単独のリスクの高さを同時に緩和する。Microsoft Office での数百件の実運用ロールアウトで、伝統的段階的ロールアウトでは検知困難な10〜50%規模の指標変動を数日以内に検知できることを実証。既存 concept [[カナリアテスト]]へ発見性のための一方向参照を追加(判定メカニズムは異なるため横断的知見はまだ未接続)。([[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]])(software-engineering / deployment / experimentation / aiops) - [[逐次検定]](新規) — 固定サンプルサイズ検定と異なり、データが逐次到着するたびに何度でも検定を実行しても型 I エラー確率をtime-uniformに厳密制御できる統計的枠組み(anytime-valid inference / confidence sequence)。Netflixのカナリアテストにおいて、開発者が固定-$n$検定([[Kayenta]]のMann-Whitney U検定)を蓄積データに繰り返し適用する「peeking」が実務で常態化し型Iエラー確率の制御が破綻していた問題を解決する。シミュレーションでは固定-$n$検定の継続的モニタリングが100回中64回・57回の誤検知を生んだのに対し、逐次検定は誤検知0回。既存 concept [[カナリアテスト]]に「固定-$n$ vs 逐次検定」という判定メカニズムの設計軸を追加。([[@2022__KDD__Rapid Regression Detection in Software Deployments through Sequential Testing]])(statistics / software-engineering / testing / aiops) - [[カナリアテスト]](更新) — [[@2022__KDD__Rapid Regression Detection in Software Deployments through Sequential Testing]]を追加し、CanaryAdvisor・CASが前提とする固定-$n$検定の「1回だけ使う」設計をNetflixの実運用(Kayenta)が破っていたという横断的知見、および regression の定義軸(離散状態への還元 vs 確率的順序による分布全体の比較)を追記。 - [[RCA評価設計]](更新) — LEMMA-RCAが IT×OT という異種ドメインを1つのベンチマークに統合した点、および「マイクロサービス向けに強い手法がOT系でも強いとは限らない」ことを定量的に示した点を横断的知見に追記。([[@2024__arXiv__LEMMA-RCA - A Large Multi-modal Multi-domain Dataset for Root Cause Analysis]])(aiops / benchmark) - [[ドメイン別RCA]](更新) — OTドメイン(水処理・水配送)ではKPI構築自体がドメイン知識を要する前処理タスクになる点、および同一RCA手法群でも手法の相対的強さはドメインを越えて安定する一方モダリティ統合効果はドメイン依存という知見を追記。([[@2024__arXiv__LEMMA-RCA - A Large Multi-modal Multi-domain Dataset for Root Cause Analysis]])(aiops / rca) - [[根本原因分析]](更新) — LEMMA-RCAデータセット論文をsourcesに追加。(sre / aiops) - 『[[詳解 システム・パフォーマンス 第2版]]』全16章の ingest により、以下の concept を**新規作成**した(37件)。いずれも出典は同書の各章 source ページ。(performance / systems / observability) - メソドロジ: [[USE メソッド]]・[[RED メソッド]]・[[ワークロードの特性の把握]]・[[ドリルダウン分析]]・[[レイテンシ分析]]・[[パフォーマンスのアンチメソドロジ]]・[[ベンチマーキング]]・[[待ち行列理論]]・[[ユニバーサルスケーラビリティ法則]]・[[レイテンシヒートマップ]]・[[フレームグラフ]] - OS・アプリケーション: [[システムコール]]・[[コンテキストスイッチ]]・[[アプリケーション並行実行モデル]]・[[同期プリミティブ]]・[[スレッド状態分析]]・[[スケジューラレイテンシ]] - メモリ: [[仮想メモリとページング]]・[[Linuxメモリ回収]]・[[メモリアロケータ]]・[[NUMAメモリ配置]]・[[メモリリークとメモリ増大]]・[[ヒュージページ]] - ストレージ: [[ファイルシステムキャッシュ階層]]・[[プリフェッチと先読み]]・[[ライトバックキャッシングと同期書き込み]]・[[ランダムIOとシーケンシャルIO]]・[[Raw IOとDirect IO]]・[[ローカルファイルシステム実装比較]]・[[IOスケジューラ]]・[[RAID]] - ネットワーク・クラウド: [[TCP輻輳制御アルゴリズム]]・[[バッファブロートとキュー管理]]・[[ネットワーク割り込み合体とCPUスケーリング]]・[[TCPバックログキューとSYNクッキー]]・[[ハードウェア仮想化]] - 計装: [[kprobe]] - 既存 concept 22件を更新(横断的知見・未解決の問いを積み増し): [[アムダールの法則]]・[[オブザーバビリティ]]・[[パフォーマンスエンジニアリング]]・[[継続的プロファイリング]]・[[動的計装]]・[[ハードウェアカウンタ]]・[[Instructions Per Cycle]]・[[CPU利用率]]・[[同時マルチスレッディング]]・[[メモリ階層とキャッシュ]]・[[NUMA対応CPUピニング]]・[[ページキャッシュカスタマイズ]]・[[ハードディスク信頼性]]・[[データセンター輻輳制御]]・[[パケットフィルタリング]]・[[クラウドコンピューティング]]・[[コンテナ仮想化]]・[[カナリアテスト]]・[[BPF]]・[[eBPF]]・[[DTrace]]・[[uprobe]]。 ### Observability Engineering, 2nd Edition(2026-08-12 ingest-book) - 新規 concept 14件: - 計装・データモデル: [[構造化イベント]]・[[テレメトリパイプライン]]・[[CI-CDオブザーバビリティ]]・[[モバイルオブザーバビリティ]] - 開発プロセス: [[オブザーバビリティ駆動開発]]・[[フィーチャーフラグ]]・[[ストラングラーフィグ]]・[[コードのキャッシュ化]] - 分析・AI: [[ユーザー中心オブザーバビリティ]]・[[AIサンドイッチアーキテクチャ]] - 組織・意思決定: [[ソシオテクニカル負債]]・[[レバレッジポイント]]・[[Build Versus Buy]]・[[ベンダーエンジニアリング]] - 既存 concept 62件を更新(横断的知見・未解決の問いを積み増し): [[オブザーバビリティ]]・[[テレメトリ]]・[[分散トレーシング]]・[[トレースサンプリング]]・[[サービスレベル目標]]・[[エラーバジェット]]・[[イベントベースSLO]]・[[アラート疲労]]・[[逸脱の正常化]]・[[ディペンダビリティ]]・[[列指向OLAPデータベース]]・[[時系列データベース]]・[[LSMツリー]]・[[Zonemap]]・[[データパーティショニング]]・[[ストレージ計算分離]]・[[ネスト型カラムナストレージ]]・[[クォーラムベースレプリケーション]]・[[ヒストグラムメトリクス]]・[[メトリクス削減]]・[[ログ重複排除]]・[[Retroactive Sampling]]・[[Scaling Telemetry Workloads]]・[[仮説駆動RCA]]・[[AIOps]]・[[agentic SRE]]・[[SRE AI Autonomy Levels]]・[[コンテキストエンジニアリング]]・[[GenAI オブザーバビリティ]]・[[LLM評価]]・[[LLMアプリケーション信頼性]]・[[Harness Engineering]]・[[知識グラフ]]・[[知識のリレーションシップモデル]]・[[オブザーバビリティデータモデル]]・[[訓練不変条件]]・[[パフォーマンスエンジニアリング]]・[[フレームグラフ]]・[[継続的プロファイリング]]・[[クリティカルパス分析]]・[[サーバーレスアーキテクチャ]]・[[アムダールの法則]]・[[ヘルメティックビルド]]・[[テスト障害診断]]・[[開発者生産性]]・[[DevOps]]・[[DORA]]・[[DTrace]]・[[eBPF]]・[[カナリアテスト]]・[[フィードバック駆動開発]]・[[サイバネティクス]]・[[事故モデル]]・[[プラットフォームエンジニアリング]]・[[SRE組織変革]]・[[SREエンゲージメントモデル]]・[[組織の信頼性マインドセット]]・[[ダイナミックケイパビリティ]]・[[トレードオフ意思決定]]・[[インシデントメトリクス]]・[[インシデント影響測定]]・[[Security Level Objectives]]。 ### SREをはじめよう(2026-08-13 ingest-book) - 新規 concept 4件: - SRE の定義軸: [[SREの心構え]](仕組みでなく思考様式として SRE を定義する)・[[SRE文化]](組織を動かす「乗り物・テコ」としての文化) - 組織への働きかけ: [[SREの提唱]](SRE の存在意義を組織内外へ伝える技法) - 設計手法: [[NALSD]](Non-Abstract Large System Design。面接・実務双方で問われる設計手法) - 既存 concept 18件を更新(横断的知見・未解決の問いを積み増し): [[DORA]]・[[DevOps]]・[[SRE]]・[[SREエンゲージメントモデル]]・[[SRE組織変革]]・[[Safety-II]]・[[インシデントストーリー]]・[[エラーバジェット]]・[[オブザーバビリティ]]・[[オンコールストレス管理]]・[[カオスエンジニアリング]]・[[カーゴカルトSRE]]・[[トイル]]・[[プラットフォームエンジニアリング]]・[[ポストモーテム]]・[[レジリエンスエンジニアリング]]・[[分散システム障害]]・[[根本原因分析]] ### Designing Data-Intensive Applications, 2nd Edition(2026-08-13 ingest-book) - 新規 concept 47件: - データモデルとクエリ: [[リレーショナル対ドキュメントモデル]]・[[グラフデータモデル]]・[[イベントソーシングとCQRS]]・[[スター・スノーフレークスキーマ]]・[[DataFrame]] - ストレージと索引: [[転置インデックス]]・[[多次元索引]]・[[マテリアライズドビューとデータキューブ]] - エンコーディングとデータフロー: [[スキーマ発展]]・[[バイナリエンコーディング]]・[[Durable Execution]] - レプリケーション: [[単一リーダーレプリケーション]]・[[マルチリーダーレプリケーション]]・[[リーダーレスレプリケーション]]・[[レプリケーションラグと読み取り整合性]] - シャーディング: [[マルチテナンシーのためのシャーディング]]・[[二次インデックスのシャーディング戦略]] - トランザクション: [[ACIDと分離レベル]]・[[スナップショット分離とMVCC]]・[[ロストアップデートと書き込みスキュー]]・[[直列化可能性]] - 分散システムの困難: [[部分故障]]・[[クロック同期と信頼性]]・[[ビザンチン障害]]・[[システムモデルと安全性・活性]]・[[分散ロックとリース]] - 一貫性と合意: [[線形化可能性]]・[[ID生成器と論理クロック]]・[[コーディネーションサービス]] - バッチ処理: [[MapReduce]]・[[データフローエンジン]]・[[分散ファイルシステムとオブジェクトストア]]・[[シャッフルと分散結合]] - ストリーム処理: [[変更データキャプチャ(CDC)]]・[[ストリーム結合]]・[[イベント時間とウィンドウ処理]]・[[ストリーム処理の耐障害性]] - 統合思想: [[データ統合]]・[[データベースのアンバンドリング]]・[[エンドツーエンド論]]・[[適時性と完全性]] - 分析基盤: [[データウェアハウス]]・[[データレイク]] - 倫理と社会: [[予測分析とアルゴリズムバイアス]]・[[フィードバックループ]]・[[データのプライバシーと同意]]・[[データを資産・権力として見る視点]] - 既存 concept 41件を更新(横断的知見・未解決の問いを積み増し): [[B-Tree]] / [[B-Treeノードレイアウト最適化]] / [[LSMツリー]] / [[LSMツリーコンパクション]] / [[TLA+]] / [[TrueTime]] / [[Write-Ahead Logging (WAL)]] / [[べき等性]] / [[インメモリデータベース]] / [[クエリ実行プラン]] / [[クォーラムベースレプリケーション]] / [[クラウドコンピューティング]] / [[グレイ障害]] / [[サービスレベル目標]] / [[シェアードナッシング]] / [[スケーラビリティ評価]] / [[ストレージ計算分離]] / [[データセンターネットワーク信頼性]] / [[データパーティショニング]] / [[フォールトトレランス]] / [[ベクトル検索インデックス]] / [[マテリアライズドメトリクス]] / [[リーダー選出]] / [[レイテンシ分析]] / [[一貫性ハッシュ法]] / [[並列データベース]] / [[分散コンセンサス]] / [[分散システム障害]] / [[分散トランザクション]] / [[分散メッセージブローカ]] / [[分散合意プロトコル]] / [[列指向OLAPデータベース]] / [[外部マージソート]] / [[外部一貫性]] / [[導出データ]] / [[権力集中リスク]] / [[知識グラフ]] / [[結果整合性]] / [[複製ステートマシン]] / [[軽量形式手法]] / [[障害注入]]。 ### Vistara: Making CXL Real(2026-08-13 ingest-paper) - 新規 concept: [[CXLによるメモリ拡張]] — CXL(Compute Express Link)によるサーバメモリ容量拡張の集約ページ。汎用ワークロード向け透過階層化(Vistara/TPP)と用途特化プールオフロード(Beluga)の2系統を横断的知見として対比。 - 既存 concept 1件を更新: [[NUMAメモリ配置]] — CXLメモリがCPUレスNUMAノードとして本番実装される事例、kernel.numa_balancingの位置づけの変化を横断的知見として追記。 ### MEGATRACE: Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters(2026-08-13 ingest-paper) - 既存 concept 2件を更新: [[LLM学習モニタリング]](MEGATRACE を「集合通信 API 呼び出しタイミング」という第 7 の検知信号軸として横断的知見に追記。既存手法が見落とす「ステージ」次元を訓練スケジュール認識のクリティカルパス分析で埋める点を整理) / [[クリティカルパス分析]](対象ドメインを microservices/observability から distributed training へ拡張。CI/CD の静的 DAG・マイクロサービスの動的呼び出しグラフに続く第三の位置として、訓練パラメータからの決定論的 DAG 再構築とパイプラインバブル起因の偽陽性除去という固有の難所を横断的知見に追記)。 ### Agentic Workflows are Serverless Applications, so deploy them that way!(2026-08-13 ingest-paper) - 既存 concept 5件を更新: [[サーバーレスアーキテクチャ]](長年未解決だった「サーバーレスとLLMエージェントの関係」への回答としてモジュール化デプロイ案を追記) / [[サーバーレスワークフロー]](エージェントCFGとCNCF Function Workflowパターンの対応関係、DAGでなくCFGを採用した理由を追記) / [[LLMサービング管理]](モデル初期化コスト内訳の実測、ステージ単位リソース管理という新しい管理粒度を追記) / [[KVキャッシュ管理]](サーバーレススケールダウン時のKVキャッシュ永続化という新しい軸を追記) / [[モデルスケーリング高速化]](ServerlessLoRA/PipeBoostのパラメータ複製共有、高帯域GPU-GPUリンクの転用をFaaScaleと対比して追記)。 ### Six Dimensions of Benchmarking Time-Series Databases(2026-08-13 ingest-paper) - 既存 concept 2件を更新: [[時系列データベースベンチマーク]](regularity次元が既存7ベンチマークいずれにも存在しなかったこと、6次元統一設計、混合ワークロード読み書き競合の3アーキテクチャ横断比較を追記) / [[時系列データベース]](ストレージエンジンの物理設計と時系列規則性の整合・不整合という第9の軸を追記)。 ### Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems(2026-08-13 ingest-paper) - 新規 concept 1件: [[フェイルスローハードウェア]] — フェイルストップと対比される「停止せず劣化したまま動き続ける」ハードウェア障害。細粒度性(I/O 操作の部分集合だけを遅くする)が内部チェッカの検知網をすり抜ける機序を定義し、[[グレイ障害]] の原因側として位置づけた。 - 既存 concept 4件を更新: [[障害注入]](バグスタディが導く構造的制約が探索アルゴリズムの工夫より効く場合があること、粗すぎる障害はフォールトトレランス機構に吸収されバグを隠すこと、「障害 ≠ 真のバグ」トリアージへの LLM エージェント適用を追記) / [[遅延注入]](依存性発見の道具としての遅延と破壊の道具としての遅延の対比、遅延長は長いほど強いわけではないという知見を追記) / [[グレイ障害]](原因側の実証としての FSH バグスタディ、本番監視・プロアクティブ検証・リリース前テストの時間軸上の三分を追記) / [[部分故障]](部分故障は再現も難しいというテスト側からの制約を追記)。 ### TS-Benchmark: A Benchmark for Time Series Databases(2026-08-13 ingest-paper) - 既存 concept 2件を更新: [[時系列データベースベンチマーク]](TS-Benchmarkの3ワークロード分離設計が書き込み性能測定ギャップをTSM-Benchより2年早く先取りしていたこと、TS-Benchmark/SciTSv2が独立に観測したストレージエンジン設計トレードオフを追記) / [[時系列データ生成]](TSM-Benchが比較対象とする「TS-Graph」の原論文がTS-Benchmark(参考文献[68])であることを特定し、DCGAN+有向グラフ+ランダムウォーク手法の詳細を追記)。 ### OpsLLM: Construction of Large Language Model for Software Operations with Multi-stage Learning(2026-08-13 ingest-paper) - 既存 concept 4件を更新: [[LLMによる根本原因分析]](推論時補助が主流だった本 concept に、OpsLLM の訓練時整合[SFT+DPRMベース段階ゲート型GRPO]という第5の軸、「結果は正しいが推論が不整合」の定量化を追記) / [[検証可能報酬による強化学習]](DPRMという学習済みプロセス報酬モデルによる「検証可能」の境界拡張、段階ゲート型カリキュラムの報酬階層的従属関係制御を追記) / [[障害注入]](評価ベンチマーク生成でなく強化学習の訓練データ生成という新しい用途、reflection-and-verification によるRCAサンプル生成を追記) / [[報酬ハッキング]](RCAドメインでの「もっともらしいが誤った推論」という報酬ハッキングの現れ方、段階ゲート型カリキュラムによる対策を追記)。 ### SLO サービスレベル目標(2026-08-13 ingest-book) - [[信頼性スタック]](新規) — 本書の中心枠組み。SLI→SLO→エラーバジェットの三層構造で、SLA は並行する契約レイヤーとして区別される。(sre / slo / reliability) - [[意味のあるSLI設計]](新規) — SLI 自体の選び方。単純なリクエスト/レスポンスサービスでは6つの質問への還元、複雑なサービスではジャンクション選択という手順を取る。(sre / slo / sli) - [[SLO目標値の選定]](新規) — 「9の数」の慣習を退け、ユーザー満足の2条件・依存対象の合成信頼性・過去データのパーセンタイル分析から目標値を導く方法論。(sre / slo / statistics) - [[ベイズ推定]](新規) — 最尤推定(MLE)・MAP 推定・ベイズ推定・HDI の枠組み。SLI の観測数が少ないときの推定の不確実性を定量化する。(statistics / bayesian / slo) - 更新 28 件: [[サービスレベル目標]] / [[エラーバジェット]] / [[SLI-SLO段階的導入]] / [[SLODLC]] / [[SREの提唱]] / [[SRE文化]] / [[SRE組織変革]] / [[組織の信頼性マインドセット]] / [[アラート管理]] / [[インシデントメトリクス]] / [[インシデント重大度評価]] / [[脆弱性バジェット]] / [[データ品質SLO]] / [[イベントベースSLO]] / [[適時性と完全性]] / [[データ統合]] / [[RED メソッド]] / [[USE メソッド]] / [[サービストポロジ]] / [[ユーザー中心オブザーバビリティ]] / [[ダッシュボードとランブックの運用]] / [[ディペンダビリティ]] / [[グレースフルデグレーデーション]] / [[カオスエンジニアリング]] / [[NALSD]] / [[時系列データベース]] / [[待ち行列理論]] / [[統計的機械学習]] — いずれも本書各章との突き合わせで見えた横断的知見と未解決の問いを積み増した。 ### SADE: Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting(2026-08-13 ingest-paper) - 新規 concept 1件: [[エージェント型ネットワーク障害診断]] — LLM エージェントがツール呼び出しを通じて稼働中のネットワークを対話的に探査し、層をまたいで連鎖する症状から根本原因を特定する診断タスク。証拠取得と仮説確定の分離・ボトムアップな層順スキャン・同一バックボーンでのアブレーションによる方法論寄与の定量化を横断的知見として集約。 - 既存 concept 3件を更新: [[仮説駆動RCA]](SADE のフェーズゲート型ワークフローが、クラウド/マイクロサービス RCA とは独立にネットワーク層でも「証拠取得と仮説確定の分離」という同型の設計に到達したことを追記) / [[Flexible Skill Arrangement]](SADE の症状ベース動的スキルルーティングが Bian Que の LLM 自動生成スキルとは異なる「人手著述+実行時テキスト照合」という設計であることを追記) / [[Fault Localization]](L2/L3 ネットワーク層を第四のドメインとして位置づけ、故障ファミリ絞り込み→デバイス特定という二段階箇所特定の知見を追記)。 ### A Network Arena for Benchmarking AI Agents on Network Troubleshooting(2026-08-13 ingest-paper) - 新規 concept 1件: [[ネットワークトラブルシューティングエージェントベンチマーク]] — LLM エージェントのネットワークインシデント診断能力を稼働中エミュレーション環境で評価する枠組み。ゴール階層分解(検知→箇所特定→RCA)がクラウド SRE ベンチマークと同型であること、障害注入手段がドメイン(ネットワーク層 vs アプリ層)ごとに分岐すること、MCP 構造化ツールがハルシネーション抑制に寄与する可能性を横断的知見として集約。 - 既存 concept 3件を更新: [[障害注入]](ネットワークインフラ層への注入対象拡大、TC/stress-ng/カスタムスクリプトの三層構成を追記) / [[SRE Benchmark]](クラウド SRE 外のネットワークドメインでもゴール階層分解パターンが同型で現れたことを追記) / [[エージェント型ネットワーク障害診断]](NIKA 一次論文とのクロスリンク、姉妹 concept としての役割分担を追記)。 ### Causal Software Engineering: A Vision and Roadmap(2026-08-13 ingest-paper) - 新規 concept 1件: [[Causal Software Engineering]] — 因果モデルと因果推論をSEライフサイクル全体に組み込む将来パラダイム。causal design spec・intervention log・living causal modelの3アーティファクトと、Causal Readiness Level(CRL-0〜CRL-5)による4ルート共進化ロードマップを定義。 - 既存 concept 3件を更新: [[因果推論ベースRCA]](本concept が集約する RCA 手法群を CSE の Route 1「因果的可観測性」の achievements として位置づけ、事後的ランキングから介入を意識した意思決定への転換を追記) / [[根本原因分析]](CSE のリトライポリシー誤帰属事例を、本concept が蓄積してきた「根本原因概念への懐疑」系譜〔Cook・Gallego・Nash・de Vesine・CAST〕に「交絡因子の非記録」という技術的機構として追加) / [[AIOps]](AIOpsLab の段階別精度低下を「観測(L1)から介入知識(L2)への飛躍の欠如」として再解釈する視座を追記)。 - 関連 concept 1件を更新: [[因果発見]](CSE が因果モデル構築の3経路〔専門家定義・データ学習・ハイブリッド〕の1つとして因果発見を位置づけることを追記)。 ### EventADL: Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems(2026-08-13 ingest-paper) - 既存 concept 2件を更新: [[異常検知]](クラウド監査イベントという第3のシグナル源とルールベース設計〔ESP/EFP〕による解釈可能・決定論的検知の実証例、Matrix Profileのmagnitude-based再設計による9倍高速化とF1向上を追記) / [[グラフベースRCA]](サービス依存グラフでも物理接続グラフでもない第4の粒度としてのIntervention Graph〔アクター・操作・リソースの構造化イベントグラフ〕、time-aware random walkという時刻比較ハード制約による経路枝刈りを追記)。 ### Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications: A Review(2026-08-13 ingest-paper) - 既存 concept 3件を更新: [[異常検知]](公平性・ロバスト性・説明可能性・効率性という4つの技術的信頼性要件への分解〔コスト考慮学習・アンサンブル学習・XAI・モデル枝刈り〕を追記) / [[根本原因分析]](根本原因箇所特定における公平性研究がAIOps研究全体でほぼ手つかずであるという明示的なギャップ指摘を追記) / [[差分プライバシー]](性能診断システムにおけるDPをブロックチェーンストレージ・連合学習と並ぶシステムレベル要件の1系統として位置づけ、訓練前一括難読化とDP-SGDの設計対比を追記)。 ### Quantifying Performance Variability in GPU Clusters(2026-08-13 ingest-paper) - 新規 concept 1件: [[GPU性能変動]] — 同一型番の GPU 間で製造ばらつき・DVFS 挙動差により生じる性能変動。GPUPerf 論文の性能予測誤差(Vista 9.38%)と本論文が実測する GPU ハードウェア変動(Vista Tensor Cores 3.7〜6.3%)が同じ現象の異なる側面である可能性、変動が計算パス・データ精度に系統的に依存すること、同一 GPU が複数実験で一貫して外れ値になることを横断的知見として集約。 - 既存 concept 1件を更新: [[ストラグラー]](ハードウェア個体差=GPU 性能変動が、アルゴリズム的不均衡が主因という What-if 分析の結論の外側で、単独でストラグラー相当の実害〔GPT 19B 3D 並列訓練で 8.0〜8.5% のスループット低下〕を生む経路として追記)。 ### CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure(2026-08-13 ingest-paper) - 新規 concept 1件: [[LLM基盤ベンチマーク]] — 要約統計量ではなく実行トレース+ワークロードカード+起動スクリプトのエビデンスを一次成果物とするベンチマーク設計。「アウトカムのみ」対「説明可能なエビデンス」という設計軸、trace-driven what-if analysisによるシミュレーション較正ギャップの解消、通信削減とend-to-endレイテンシ改善の非対称性、フレームワーク間チューニングの非移植性を横断的知見として集約。 - 既存 concept 3件を更新: [[実行トレース]](実行トレースが「協調設計の交換フォーマット」だけでなく「ベンチマークの一次成果物」としても機能すること、実測トレース→Chakra ET変換→シミュレータ投入のwhat-ifパイプライン、GPU/TPUトレースの「同一フォーマット・異なる意味論」問題を追記) / [[並列化戦略]](CCL-SearchによるTorchTitan/Megatron-LMのフレームワーク間チューニング非移植性〔3.4倍差〕、EP/DPトレードオフによるoverlap率の誤誘導可能性を追記) / [[集合通信]](NCCL vs. MSCCL++の定量比較〔通信比率改善とレイテンシ効果の不一致〕、compute-comm overlapの増加が通信トラフィック量増加で相殺される事例を追記)。 ### Eagle: Leveraging Operations Documents for Comprehensive Benchmark Question Generation(2026-08-13 ingest-paper) - 新規 concept 1件: [[運用文書駆動ベンチマーク生成]] — Ops ドキュメントから OpsLLM 評価用 QA ペアを自動生成する手法群。Eagle の4段階パイプライン(知識抽出→QA生成→品質検証→専門家アノテーション)、DirDiverによるディレクトリ階層走査、Critic Model+RAGベースAnswer Modelの二重品質検証を集約。OpsQA(実クエリへの回答)とは「評価データセット自体の合成」という点で区別される隣接概念。 - 既存 concept 3件を更新: [[LLM評価]](Eagle が示す「評価データセット生成パイプライン自体のメタ評価」という新軸、RAGベース回答検証による質問完全性〔self-containedness〕検証、ベンチマーク生成モデル自体の頑健性検証を追記) / [[AIOps]](Eagle の Ops タクソノミー〔6コア能力×3フェーズ×6モダリティ〕と既存の能力軸〔AIOpsLab 4-level・Remil+ 6能力モデル〕の関係、ベンチマーク生成パイプライン自体の産業デプロイという新しい実務化の形を追記) / [[OpsQA]](運用文書駆動ベンチマーク生成との役割の違いを追記)。 ### Anatomy of an Incident(2026-08-13 ingest-book) - 新規 concept 1 件: [[心理的安全性]] — Amy Edmondson の定義・Westrum モデル・Project Aristotle・導入時/対応中/組織全体の 4 層構造・早期エスカレーションとの関係を集約。既存ページ群([[ポストモーテム]]・[[人的要因]]・[[レジリエンスエンジニアリング]] ほか)に散在していた言及を横断的知見としてまとめ直した。 - 既存 concept 21 件を更新: [[GameDay]]・[[Incident Commander]]・[[アクショナブルアラート]]・[[インシデントシミュレーション]]・[[インシデントメトリクス]]・[[インシデント影響測定]]・[[インシデント管理]]・[[インシデント重大度評価]]・[[オンコールストレス管理]]・[[カオスエンジニアリング]]・[[クラウド障害ライフサイクル]]・[[グレースフルデグレーデーション]]・[[プロアクティブ検証]]・[[ポストモーテム]]・[[レジリエンスエンジニアリング]]・[[人的要因]]・[[根本原因分析]]・[[組織の信頼性マインドセット]]・[[複雑システム障害論]]・[[障害注入]]・[[障害緩和]]。主な追記は、3 条件のインシデント定義と 3 段階ライフサイクル([[インシデント管理]])、page/alert/metrics の 3 経路振り分け([[アクショナブルアラート]])、DiRT と Wheel of Misfortune([[カオスエンジニアリング]]・[[GameDay]]・[[障害注入]]・[[インシデントシミュレーション]]・[[プロアクティブ検証]])、ICS 内部変種と Tech IRT([[Incident Commander]])、重大度 6 区分([[インシデント重大度評価]])、不信頼性 = Σ(TTD+TTR)/TBF × Impact([[インシデントメトリクス]]・[[インシデント影響測定]]・[[クラウド障害ライフサイクル]]・[[障害緩和]]・[[グレースフルデグレーデーション]])、根本原因対トリガー / 孤立システム対全体スタック / 時点対軌跡([[ポストモーテム]]・[[根本原因分析]]・[[複雑システム障害論]]・[[レジリエンスエンジニアリング]]・[[人的要因]])。 ### ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents(2026-08-13 ingest-paper) - 新規 concept 1件: [[SWEエージェントの情報信号]] — SWEエージェントがissue解決時に依拠する5つの文脈情報信号(Reproduction Test・Regression Test・Edit Location・Execution Context・API Usage)を「Code Search能力」「Testcase Verification能力」の2軸で整理し、各信号の理想的な寄与上限(oracle)を定量化する枠組み。Reproduction Testが一貫して最大の寄与を示すこと、既存エージェントワークフローのいずれも5信号すべてを明示的に扱っていないことを横断的知見として集約。 ### Shaky structures: The wobbly world of causal graphs in software analytics(2026-08-13 ingest-paper) - 既存 concept 2件を更新: [[因果発見]](PC/FCI/GES/LiNGAMの4生成器がSEデータ23件に対しリリース間・プロジェクト間・パラメータ変更・サブサンプルのいずれの摂動でも過半数の因果エッジを変化させることを実証した知見、Jaccard指数による安定性の定量評価方法論を追記) / [[Causal Software Engineering]](本論文がRoute 1課題「進化のもとで安定な因果グラフ」の原典であることが判明し、living causal modelの実現可能性への疑問と、causal design specへの頑健性検証プロセス転用可能性を追記)。 ### Machine Learning: The High-Interest Credit Card of Technical Debt(2026-08-13 ingest-paper) - 新規 concept 1件: [[技術的負債]] — Ward Cunninghamの技術的負債の枠組みを機械学習システムに適用し、entanglement(CACE原則)・隠れたフィードバックループ・未宣言の消費者・データ依存性・glue code・pipeline jungles・configuration debtなど機械学習特有のリスク要因を集約。既存 concept [[ソシオテクニカル負債]]を更新し、「技術的負債(コード解消可能)とソシオテクニカル負債(人の行動変容が必要)の階層構造」を横断的知見として追記。 ### 詳説 データベース(2026-08-13 ingest-book) - 新規 concept 8 件: [[スロット化ページ]](ディスク上ページの 3 要件を同時に満たすレイアウト)、[[分散コンピューティングの誤謬]]・[[FLPの不可能性]]・[[2人の将軍の問題]](第 II 部が前提とする不可能性結果の 3 点セット)、[[障害検出器]](完全性と正確性のトレードオフ、strong/weak/eventually strong)、[[CAP定理]](および PACELC)、[[CRDT]](強い結果整合性)、[[アンチエントロピー]](対話型・バックグラウンド型・ゴシップ型の 3 系統)。 - 既存 concept 51 件を更新: [[ACIDと分離レベル]]・[[ARIES]]・[[B-Tree]]・[[B-Treeノードレイアウト最適化]]・[[LSMツリー]]・[[LSMツリーコンパクション]]・[[OLTPシステムアーキテクチャ]]・[[TrueTime]]・[[Write-Ahead Logging (WAL)]]・[[べき等性]]・[[インメモリデータベース]]・[[クエリオプティマイザ]]・[[クエリ実行プラン]]・[[クォーラムベースレプリケーション]]・[[クラッシュリカバリ]]・[[クロック同期と信頼性]]・[[グレイ障害]]・[[コマンドロギング]]・[[ゴシッププロトコル]]・[[システムモデルと安全性・活性]]・[[スキーマ発展]]・[[スナップショット分離とMVCC]]・[[ゾーン名前空間SSD]]・[[データパーティショニング]]・[[バイナリエンコーディング]]・[[ビザンチン障害]]・[[ファイルシステムキャッシュ階層]]・[[ベンチマーキング]]・[[ページキャッシュカスタマイズ]]・[[メインメモリデータベース]]・[[ライトバックキャッシングと同期書き込み]]・[[リーダーレスレプリケーション]]・[[リーダー選出]]・[[レプリケーションラグと読み取り整合性]]・[[ロストアップデートと書き込みスキュー]]・[[分散SQLデータベース]]・[[分散コンセンサス]]・[[分散コンセンサス回避]]・[[分散システム障害]]・[[分散トランザクション]]・[[分散合意プロトコル]]・[[列指向OLAPデータベース]]・[[単一リーダーレプリケーション]]・[[地理分散SQLデータベース]]・[[外部一貫性]]・[[専用データベースシステム]]・[[直列化可能性]]・[[結果整合性]]・[[線形化可能性]]・[[複製ステートマシン]]・[[部分故障]]。主な追記は、B ツリーを「in-place 更新」「ラッチ」の 2 軸で亜種まで系統化した [[B-Tree]]、RUM 予想と B ツリー対 LSM ツリーの増幅トレードオフを整理した [[LSMツリー]]・[[LSMツリーコンパクション]]、steal/force ポリシーと ARIES 3 フェーズを軸に据えた [[Write-Ahead Logging (WAL)]]・[[ARIES]]・[[クラッシュリカバリ]]、分離レベルの単一階層と読み書きアノマリーを整理した [[ACIDと分離レベル]]・[[スナップショット分離とMVCC]]、「直列化可能性(トランザクションの順序)と線形化可能性(単一オブジェクトの実時間順序)は別物である」という対比([[直列化可能性]]・[[線形化可能性]])、リーダー選出・合意・障害検出の入れ子構造([[リーダー選出]]・[[分散コンセンサス]]・[[分散合意プロトコル]]・[[複製ステートマシン]])、2PC がコーディネータ障害でブロックするため合意ではないという接続([[分散トランザクション]]・[[分散コンセンサス回避]])。 ### The Elements of Statistical Learning(2026-08-14 ingest-book) - 新規 concept 25 件: - **理論的な土台**: [[バイアス-バリアンストレードオフ]](第 2 章。以降ほぼ全章が参照するハブ)、[[次元の呪い]](第 2 章。局所平均化の破綻から高次元設定の再解釈まで)、[[交差検証]]・[[ブートストラップ法]](第 7〜8 章)。 - **正則化と変数選択**: [[縮小推定]](第 3 章。ridge/lasso から graphical lasso まで 6 章分が積み増した最も厚い concept)、[[部分集合選択]]・[[最小角回帰]](第 3 章)、[[基底展開]]・[[平滑化スプライン]](第 5 章)、[[多重検定]](第 18 章。FWER・FDR・BH 法・SAM 法)。 - **手法系**: [[決定木]]・[[GAM]]・[[MARS]](第 9 章)、[[勾配ブースティング]](第 10 章)、[[誤差逆伝播法]](第 11 章)、[[サポートベクターマシン]](第 12 章)、[[線形判別分析]](第 4 章)、[[局所回帰]](第 6 章)、[[最近傍法]](第 13 章)、[[EMアルゴリズム]](第 8 章)、[[無向グラフィカルモデル]](第 17 章)。 - **教師なし学習**: [[主成分分析]]・[[クラスタリング]]・[[スペクトラルクラスタリング]]・[[独立成分分析]](第 14 章)。 - 既存 concept 11 件を更新: [[統計的機械学習]](第 1・2・3・4・5・7 章が積み増し)、[[カーネル法]](第 5・6・12・14 章が「RKHS のカーネル」と「局所化の重み関数としてのカーネル」を書き分け)、[[アンサンブル学習]](第 9・10・15・16 章が層状に積み増し)、[[カーネル密度推定]](第 6 章が 2 ソース目として統合)、[[ベイズ推定]]・[[汎化誤差バウンド]]・[[最小記述長原理]](いずれも既存 seed ページに ESL の定式化が入り developing へ)、[[畳み込みニューラルネットワーク]](第 11 章の 1989 年 ZIP code ネットワークを源流として接続)、[[暗黙的正則化]](早期停止を先行観察として接続)、[[変分ベイズニューラルネットワーク]]、[[PageRank]](マルコフ連鎖の定常分布としての再定式化)。 - 特筆: 本書は同じ論点を章をまたいで再解釈するため、concept 側に「正則化の一般化」(係数への罰則 → 関数の滑らかさ → 損失関数の取り替え → グラフ構造 → 高次元でのスケーリング)と「アンサンブルの再解釈」(木の不安定性 → 損失関数最小化 → 木どうしの相関 → 辞書生成 + 事後の重み付け)という 2 本の鎖が形成された。 ### A Philosophy of Software Design(2026-08-14 ingest-book) - 新規 concept 10 件: - **複雑性と設計姿勢**: [[ソフトウェア複雑性]](第 1・2・18・21 章が層状に積み増したハブ)、[[戦略的プログラミング]](第 3・11・19・21 章)。 - **モジュール設計**: [[深いモジュール]](第 4・6・8・9 章)、[[情報隠蔽]](第 5・6・7 章)、[[抽象化(ソフトウェア設計)]](第 4・7・10 章)。 - **文書化と可読性**: [[コメント設計]](第 12・13・15・16 章)、[[命名]](第 14 章)、[[設計の一貫性]](第 17 章)。 - **個別領域への適用**: [[例外処理の設計]](第 10 章)、[[性能を意識した設計]](第 20 章)。 - 既存 concept 4 件を更新: [[本質的複雑性と偶発的複雑性]](Brooks の発生源による分類に対し、Ousterhout が症状と構造的原因で複雑性を定義していることの対比)、[[技術的負債]](返済ではなく発生を防ぐ継続投資に主眼を置く立場)、[[ソフトウェア保守]](変更のたびに戦略的に振る舞うという第 16 章の主張)、[[パフォーマンスエンジニアリング]](観測・計測中心の既存ソースに対し、クリティカルパスの再設計を出発点に置く立場)。 - 特筆: 本書の concept はすべて「複雑性の削減」という単一の評価軸にぶら下がる。主軸は 2 本で、[[深いモジュール]] → [[情報隠蔽]] → [[抽象化(ソフトウェア設計)]] → [[例外処理の設計]] というモジュール設計の鎖と、[[コメント設計]] の 4 層(なぜ書くか → 何を書くか → いつ書くか → どう維持するか)である。 ### VOID Report 2024(2026-08-14 ingest) - 新規 concept 1 件: [[自動化アーキタイプ]] — VOID コーパス 189 件の主題分析から導出した Sentinel/Gremlin/Meddler/Unreliable Narrator/Spectator/Action Item の 6 分類。[[自動化のアイロニー]] への初の大規模実証的裏付けとして位置づく。 - 既存 concept 3 件を更新: [[自動化のアイロニー]](189 件の実インシデントによる実証的裏付け、代替神話/Fitts List/MABA-MABA との理論的接続を追記)、[[Joint Activity]](Klein らの Ten Challenges・un-Fitts list を通じた自動化・AI 参加設計への接続を追記)、[[インシデント管理]](IA への組織的支援と実践の質の相関、自動化の多役割性を追記)。 ### MOMENT(2026-08-14 ingest-paper) - 既存 concept 2 件を更新: [[時系列基盤モデル]](ランダム初期化がLLM初期化を上回るという知見をChronosと2アーキテクチャで補強、MOMENTを早期のマルチタスクencoder-only系譜の起点として位置づけ、クロスモーダル転移の逆方向知見を追加、未解決の問い2件を追加)、[[時系列異常検知ベンチマーク]](UCR異常アーカイブでのMOMENT評価指標間の逆転をTimeEval/ICPE Companionの知見と接続)。 ### Moirai-MoE(2026-08-14 ingest-paper) - 既存 concept 2 件を更新: [[時系列基盤モデル]](Time-MoE と Moirai-MoE という時系列 MoE の2系統——スケール志向 vs specialization志向——を整理、Moirai の masked encoder→decoder-only転換の性能寄与をアブレーションから定量分離、MoE の内部エキスパート割り当て可視化で頻度非依存表現の獲得過程を示した知見を追加、未解決の問い2件を追加)、[[Mixture-of-Experts]](事前学習済み表現のクラスタ重心でゲーティングする Token Clusters 手法を LLM MoE のゲーティング系譜に対する第6の方向として追加、選択多様性より的を絞ったルーティングが性能に効くという観察と、時系列MoEの「スケール志向 vs specialization志向」の2系統を追記、未解決の問い2件を追加)。 ### Sundial(2026-08-15 ingest-paper) - 新規 concept 1 件: [[Flow Matching]] — flow-matching(Lipman+ 2022)を自己回帰的な時系列予測へ適用した TimeFlow Loss の定義・定式化を集約。Sundial 一本からの立ち上げ(横断的知見は今後の ingest で積み増す)。 - 既存 concept 2 件を更新: [[時系列基盤モデル]](Timer-XL と Sundial が同じ Tsinghua 研究室から独立に「長コンテキスト汎化」と「生成的確率予測」を追う関係を整理、TimeFlow Loss が categorical 分布・パラメトリック密度と並ぶ第3の確率的予測パラダイムであることを同一条件アブレーションの証拠とともに追加、未解決の問い2件を追加)、[[時系列トークナイゼーション]](パッチ化+生成的損失という第5の方式として Sundial を追加し、量子化方式(Chronos)との較正比較が未解決である点を明記)。 ### In-Context Fine-Tuning for Time-Series Foundation Models(2026-08-15 ingest-paper) - 既存 concept 2 件を更新: [[文脈内学習]](テキストの例示から数値時系列の例示へ ICL の単位を拡張した事例として TimesFM-ICF を追加、勾配更新なしでファインチューニングを上回るという新知見、separator による境界構造化の重要性を追加、未解決の問い2件を追加)、[[時系列基盤モデル]](ゼロショット対per-datasetファインチューニングの二分法に「文脈内ファインチューニング」という第三の道を追加、長履歴拡張よりコンテキスト予算を効率的に使うという知見を追加、未解決の問い2件を追加)。 ### TS-Arena(2026-08-15 ingest-paper) - 新規 concept 1 件: [[予測事前登録プロトコル]] — 正解データが物理的に存在する前に予測提出を強制することで情報漏洩を設計上不可能にする評価方法論(FPRP)。TabArena由来のELOレーティング・ランダム化リプレイ・ブートストラップも集約。 - 既存 concept 2 件を更新: [[時系列基盤モデル]](静的ベンチマークSOTAとライブ評価順位の乖離という新知見、乖離要因の切り分けが未解決である旨を追加)、[[ベンチマーキング]](「テスト対象の誤り」パターンの時系列予測領域での再来として情報漏洩を位置づけ、人間の注意力に依存しないアーキテクチャ的強制という解法を追加)。 ### Mathematics for Machine Learning(2026-08-14 ingest-book) - 新規 concept 12 件: - [[線形写像と変換行列]] — 線形写像・変換行列・座標・基底変換・核と像・階数退化次数定理という線形代数の基礎道具(第 2 章) - [[直交射影]] — 正規方程式から導かれる射影行列と Gram-Schmidt 直交化。回帰(第 9 章)と主成分分析(第 10 章)が同じ道具を使うことを集約(第 3 章) - [[固有値分解]] — 対角化可能性の条件と、基底変換不変量としての固有値・トレース(第 4 章) - [[特異値分解]] — 任意の行列に常に存在する分解と、Eckart-Young 定理による低ランク近似の最適性(第 4 章) - [[自動微分]] — 計算グラフ上での連鎖律の機械的適用。誤差逆伝播を reverse mode の特殊例として位置づける(第 5 章) - [[ガウス分布の閉性]] — 周辺化・条件付け・積・アフィン変換に対してガウス分布が閉じているという性質と、混合では閉性が壊れること(第 6・11 章) - [[共役事前分布]] — 事後分布が代数的更新だけで得られる事前分布と、有限次元十分統計量を持つ指数型分布族(第 6 章) - [[凸最適化]] — 凸集合・凸関数・線形計画/二次計画・ラグランジュ双対と凸共役。弱双対性と強双対性の成立条件(第 7 章) - [[経験リスク最小化]] — 仮説クラス・損失関数・正則化という構成要素と、正則化が事前分布に対応するという見方(第 8 章) - [[有向グラフィカルモデル]] — 同時分布の因数分解の図的表現と d 分離。無向グラフィカルモデルとの局所正規化/分配関数の対比(第 8 章) - [[ベイズ線形回帰]] — パラメータの点推定をやめて事後分布を持つ定式化と、その閉形式(事後分布・予測分布・エビデンス)(第 9 章) - [[混合ガウスモデル]] — 責任度による表現と、離散潜在変数モデルとしての再定式化(第 11 章) - 既存 concept 11 件を更新: - [[主成分分析]] — 分散最大化・射影誤差最小化・確率的潜在変数モデルの 3 観点が同一の固有値問題に帰着することを追加。既存の応用側記述との非対称性、データ行列の転置規約の違いも明記 - [[サポートベクターマシン]] — 幾何的マージン最大化とヒンジ損失+正則化の 2 経路が同じ主問題に到達すること、ラグランジュ双対による双対形の導出を追加 - [[カーネル法]] — 内積の公理から出発する RKHS の存在定理と Gram 行列の半正定値性という公理的定義を、既存の構成的な Mercer 展開の記述と対比して追加 - [[EMアルゴリズム]] — 尤度の縮退(平均がデータ点に一致し共分散が 0 に収縮すると尤度が発散)が EM の内部でどう現れるかという既存の問いに回答 - [[カーネル密度推定]] — 混合ガウスモデルとの並置(パラメトリック/ノンパラメトリック)を追加。本書が両者の極限的関係には触れないことも記録 - [[ベイズ推定]] — ベイズの定理の形式的導出と用語法、共役事前分布がエビデンスの正規化定数問題に与える部分的な回答を追加 - [[誤差逆伝播法]] — 自動微分の reverse mode の特殊例という一般原理からの位置づけを追加 - [[交差検証]] — 入れ子の交差検証が、モデル選択とモデル評価を分離するという既存の原則を具体的アルゴリズムに落としたものであることを追加 - [[汎化誤差バウンド]] — AIC/BIC をベイズエビデンスの近似として導く経路が、訓練誤差の楽観性補正として導く既存の経路と同じ式に別の根拠を与えることを追加 - [[統計的機械学習]] — MAP 推定 = 正則化という経験則が式変形で裏づけられること、リッジ回帰の $\lambda=\sigma^2/b^2$ の由来を追加 - [[無向グラフィカルモデル]] — 有向版との姉妹関係(局所正規化 vs 分配関数、非巡回性のトレードオフ)を相互リンクとともに追加 ### AgentChaos(2026-08-15 ingest-paper) - 既存 concept 3 件を更新: - [[障害注入]] — LLM API という新しい共有トランスポート層への注入対象拡張、演繹的タクソノミー構築という手法の独立再発見、「深刻さと有害性の乖離」という二重の逆説、トリガー検証という新しい「注入≠障害」対処パターンを追加。未解決の問い2件を追加 - [[カオスエンジニアリング]] — 対象が本番インフラからLLMエージェントシステムへ拡張されたこと、Bradesco事例(設定ミス起因の脆弱性)とAgentChaos(アーキテクチャ起因の脆弱性)の対比を追加。未解決の問い1件を追加 - [[エージェントシステム運用]] — Silent失敗率の実測(AutoGen 65.71%)、根本原因局所化がomission障害に構造的に弱いことの定量的裏付け、カオスエンジニアリングをデプロイ前のアーキテクチャ評価という第5の観点として位置づけたことを追加。未解決の問い1件を追加 ### Hestia(クラウドオーバーサブスクリプション、2026-08-15 ingest-paper) - 新規 concept 1 件: [[クラウドオーバーサブスクリプション]] — テナント購入量と実消費量の乖離を利用するクラウド資源管理戦略。反応的再スケジューリング・保守的オーバーサブスクリプションという既存2アプローチに対し、ワークロードの時間的揮発性そのものを低減する第三のアプローチ(Hestia)を扱う。 ### SREエンタープライズロードマップ(2026-08-15 ingest-book) - 新規 concept 1 件: [[成長の3つの地平線]] — Baghai らの Horizon 1/2/3 モデル。第 2 章が信頼性投資の計画枠組みとして援用する。 - 既存 concept 18 件を更新: [[DORA]], [[DevOps]], [[SLO目標値の選定]], [[SRE]], [[SREの心構え]], [[SREエンゲージメントモデル]], [[SRE文化]], [[SRE組織変革]], [[エラーバジェット]], [[カーゴカルトSRE]], [[グッドハートの法則]], [[サービスレベル目標]], [[ソフトウェア複雑性]], [[トイル]], [[プラットフォームエンジニアリング]], [[信頼性スタック]], [[心理的安全性]], [[組織の信頼性マインドセット]]。 - 特に厚く積み増したもの: [[SRE組織変革]](第 1・4・5・6 章の 4 章から独立組織論・コード宣言・DevOps 対比・IT コストセンター吸収の実例が集まった)、[[カーゴカルトSRE]](第 6 章の The Home Depot 事例が「成功への便乗による強制」という既存症状リストにない第 5 の経路を示した)、[[DORA]](変革の J カーブの谷の内部構造とルーフショット/ムーンショットの処方)、[[トイル]](サブリニアスケーリングという組織経済的な動機づけと、トイル定義権限を実務者が持つという組織設計原則)。 ### AEGIS(SDC検知、2026-08-15 ingest-paper) - 新規 concept 1 件: [[Silent Data Corruption (SDC)検知]] — アラームを出さずに計算結果が破損する SDC のオンライン検知に特化した concept。混合精度アキュムレータによるアルゴリズム検知と自己等価性に基づく決定論的検知の 2 系統、オフライン診断(recall 25%)とオンライン検知(recall 100%)のギャップを扱う。 - 既存 concept 2 件を更新: - [[GPUレジリエンス]] — オフライン診断の"通過"をSDCが裏切ること、低精度訓練が検知精度の基盤を掘り崩すこと、計算・メモリ起因は検知できるが通信起因は未観測という非対称性を追加。未解決の問いを更新 - [[耐障害LLM訓練]] — SDCが「検知しないと復旧すら始まらない」という前段階の課題であることを追加。SDC・gray failure の検知漏れに関する未解決の問いを AEGIS の具体的な検出率(8/8 vs 2/8)で部分的に更新 ### AIDA(ネットワーク機器RCA、2026-08-15 ingest-paper) - 既存 concept 4 件を更新: - [[LLMによる根本原因分析]] — RLファインチューニング済みLLMを「推論チェーン抽出器」として使う新カテゴリ、6バックボーンLLM横断評価での「役割分担がモデル規模を上回る」知見の再確認、KG構造に沿った文脈分解、確信度ベースabstain設計の4件を追加 - [[グラフベースRCA]] — 推論チェーン構成要素(問題記述・証拠・根本原因)をノードとする第6の粒度、SimRankベース適応的重み付けによるノード統合を追加 - [[RAGノイズ除去]] — RCAドメイン固有のノイズ(データ冗長性・相関/因果混同)をインデックス構築段で除去する設計を追加 - [[ドメイン別RCA]] — 「ネットワーク機器RCA」を第7のドメインとして追加(RDMA/NetOps RCAとの信号源の対比、マルチベンダー制約への対処) ### SDCHunter(2026-08-15 ingest-paper) - 既存 concept 3 件を更新: - [[Silent Data Corruption (SDC)検知]] — 主要更新対象。SDCHunter と AEGIS の相補関係(オンライン検知 vs オフライン診断・局在化)を定義に追加。合成テストの見逃し率が2論文で独立に一致すること、SDCが恒久的ハードウェア劣化であるという結論への独立到達、「軽量トリガー+高コスト確定検証」という2段階アーキテクチャへの収束、MoE/EP融合カーネルが検知手法によらず共通の盲点であることの4件を横断的知見に追加。未解決の問いを2件追加・1件更新 - [[GPUレジリエンス]] — SDCHunter の合成テスト見逃し率(60%超)がAEGISの25%検出率と定性的に一致する点を既存のAEGIS言及に追記 - [[耐障害LLM訓練]] — SDCHunterがAEGISの「検知の空白」の後段(欠陥GPUの特定・訓練再開)を担う橋渡し役であることを既存のAEGIS言及に追記 ### ディープラーニングを支える技術(2026-08-15 ingest-book) - 新規 concept 17 件: [[ポランニーのパラドックス]], [[勾配降下法]], [[学習問題設定の分類]], [[強化学習]], [[損失関数]], [[教師あり学習]], [[教師なし学習]], [[最尤推定]], [[正則化]], [[正規化層]], [[汎化能力]], [[物体検出]], [[画像セグメンテーション]], [[自己教師あり学習]], [[表現学習]], [[記号接地問題]], [[音声認識]]。 - 既存 concept 34 件を更新: [[AlexNet]], [[LSTM]], [[PAC学習]], [[RNN]], [[アテンションヘッド]], [[カバリングナンバー]], [[クラスタリング]], [[スケーリング則]], [[スパース注意]], [[ベイズ推定]], [[ムーアの法則とデナードスケーリングの終焉]], [[メモリ拡張ニューラルネットワーク]], [[主成分分析]], [[交差検証]], [[凸最適化]], [[固有値分解]], [[暗黙的正則化]], [[最小記述長原理]], [[最近傍法]], [[次元の呪い]], [[残差学習]], [[汎化誤差バウンド]], [[注意機構]], [[深層学習の汎化]], [[特異値分解]], [[独立成分分析]], [[畳み込みニューラルネットワーク]], [[経験リスク最小化]], [[統計的機械学習]], [[線形写像と変換行列]], [[線形注意]], [[自動微分]], [[言語モデル事前学習]], [[誤差逆伝播法]](いずれも本書の該当章との突き合わせで見えた観察を横断的知見へ、新たな問いを未解決の問いへ追記)。 ### PRAXIS(2026-08-15 ingest-paper) - 既存 concept 3 件を更新: - [[コード知識強化RCA]] — 主要更新対象。COCA(プレーンテキストでコードを扱う第一実装)に対し、PDGへのグラフ構造化という第二の実装系統としてPRAXISを追加。生コード直接投入がneedle-in-a-haystack/context rotで自壊する実証、グラフベースRCAとの合流点、Cross-SDG-PDGトラバーサルによる観測ギャップの橋渡しの3件を横断的知見に追加 - [[グラフベースRCA]] — 本ページが扱う「システムコンポーネント間」トポロジグラフとは異なる第7の粒度(コード内部の制御・データ・呼び出し依存を表すPDG)としてPRAXISを追加 - [[agentic SRE]] — ReAct型SRE-Agent(ITBench由来)を依存グラフで明示的に制約すると精度・トークン効率が同時改善するという知見、コードツール呼び出し率46%という新しい失敗モード(ツール不使用)の2件を横断的知見に追加 ### The Anatomy of Silent Data Corruption(2026-08-15 ingest-paper) - 既存 concept 1 件を更新: - [[Silent Data Corruption (SDC)検知]] — ゲートレベル故障注入が示す根本原因(NaN/±INFはSDCの1.01%のみ・nullification支配・単一ビット反転少数派・warp整列周期性)が、AEGIS/SDCHunterの本番観測(チェックサム検知の限界・合成テスト見逃し率)を独立手法から裏付けることを横断的知見に追加。未解決の問いを1件追加。 ### Performance Alert Triage(2026-08-15 ingest-paper) - 既存 concept 2 件を更新: - [[アラートランキング]] — 教師あり ML 系統に「性能アラート×時系列エンリッチメント」という第4のバリアント(Hmissa+ ICPE Companion2026)を追加し、AlertRank との対照、リーク無し時間認識型評価という方法論上の新規性を横断的知見に記載。未解決の問いを2件追加。 - [[アラート集約]] — アラート集約が「OCE のノイズ削減」だけでなく「下流 ML の学習単位を作る前処理」という第4の目的を持つことを横断的知見に追加。未解決の問いを2件追加。 ### 分散 Root Cause Localization(エッジ環境、2026-08-15 ingest-paper) - 既存 concept 3 件を更新: - [[Fault Localization]] — 「どこで計算するか(中央集中 vs 分散)」という粒度軸と直交する新しい削減対象、クラスタ粒度と精度のトレードオフの定量的裏付けを横断的知見に追加。未解決の問いを 2 件追加 - [[PageRank]] — Personalized PageRank (PPR) が Fault Localization の根本原因ランキングという第四の独立した応用文脈で標準更新式をほぼそのまま再利用すること、グラフ分割による探索空間削減、JXP アルゴリズムの分散近似への転用を横断的知見に追加。未解決の問いを追加 - [[Edge Computing]] — 障害診断(RCL)自体がエッジ環境の制約(データ転送遅延)を受けること、配置(マイグレーション)と診断が同じ「クラウド通信最小化」原理を異なるライフサイクル段階で適用する点を横断的知見に追加。未解決の問いを追加 ### 原論文から解き明かす生成AI(2026-08-15 ingest-book) - 新規 concept 8 件: [[Bradley-Terryモデル]], [[Vision Transformer]], [[サブワードトークン化]], [[位置埋め込み]], [[分布仮説]], [[学術論文の読解技術]], [[対照学習]], [[拡散モデル]] - 既存 concept 16 件を更新: [[LLMスケーリング則]], [[LLMランキング]], [[LLM評価]], [[Transformer]], [[スケーリング則]], [[スパース注意]], [[テキスト埋め込み]], [[テスト時計算スケーリング]], [[ビジョン言語モデル]], [[事前学習目的設計]], [[人間フィードバックからの強化学習]], [[強化学習スケーリング]], [[文脈内学習]], [[検証可能報酬による強化学習]], [[注意機構]], [[言語モデル事前学習]] - 本書は既存 wiki にある原論文 source(Attention Is All You Need・GPT-1〜4・InstructGPT・Kaplan のスケーリング則・Chain-of-Thought・DeepSeek-R1 / V3 / Math・Chatbot Arena・Humanity's Last Exam)を読み解く構成のため、各 concept の横断的知見は「原論文そのもの」と「本書の読み解き」の突き合わせで積み増した。 ### HYDRA: A Multi-Level Hierarchy-Driven Approach for Robust Anomaly Detection in Time Series(2026-08-15 ingest-paper) - 既存 concept 2 件を更新: [[異常検知]](discordのtwin-freak問題とクラスタリングの汚染問題を「代表集合の階層的純化」という単一設計で統一的に解消したこと、いずれの正規化方式も振幅駆動型異常を抑制しうるという二面性の統計的実証を追記) / [[時系列異常検知ベンチマーク]](TSB-AD 40データセット規模でのFriedman+Nemenyi統計検証結果と、TimeEvalの「万能アルゴリズムは存在しない」テーゼがドメイン粒度で見ると依然両立すること、正規化方式の選択が結果を左右する第5の軸であることを追記) ### Connecting 100K+ GPUs(多建屋トポロジ・CCLX・DQPLB・運用ツール、SIGCOMM 2026、Meta)(2026-08-15 ingest-paper) - 既存 concept 4 件を更新: [[集合通信]](NCCLXの「一桁削減」というDQPLBの定性的主張を接続種別ごとの定量値(72〜90%削減)へ精緻化。多建屋レイテンシ階層(7×/15×/30×)がDQPLBパラメータ設計の直接の入力になることを追記。CollTrace/Fault Analyzerの経験則ベース依存DAGをMycroftの精緻な依存トレースと対比) / [[Fault Localization]](Fault Analyzerが統計・機械学習を使わず2つの経験則のみで依存DAGを構築し、4K GPUモデルコードバグ・8K GPU NIC故障の2ケーススタディで根本原因特定に成功した事例を追記) / [[RoCE設計課題]](多建屋物理トポロジのレイテンシ階層7×/15×/30×を定量化し、トポロジの階層深さがBDPを規定するという物理的スケールアウト由来の設計制約を追記) / [[Mixture-of-Experts]](本番LLM事前学習の集合通信を並列化スキーム別に集計し、EPのAlltoAllvが小メッセージ・8GPU未満のグループに構造的に閉じることを定量化した知見を追記) ### TraceLLM(LLMトレース分析ベンチマーク+ファインチューニング、WWW 2026)(2026-08-15 ingest-paper) - 新規 concept 1 件: [[LLMによるトレース分析]] — LLM がマイクロサービスの分散トレースを自然言語で分析する能力を扱う新設概念。トレース表現形式が精度にほぼ影響しない・Trace2Text/Trace2Token のトレードオフ・8B級ファインチューニングモデルがGPT-4oを上回る事例などを横断的知見として整理。 - 既存 concept 3 件を更新: [[分散トレーシング]](LLM がトレースの一次消費者になりうるかを定量評価した初の研究として横断的知見3件・未解決の問い2件を追加。計装設計視点の既存知見群と対照させた) / [[LLM評価]](ドメイン特化ベンチマーク+ファインチューニング一体型評価という新パターン、プロンプト戦略とトレース表現戦略を分離評価する方法論を追記) / [[マイクロサービスベンチマーク]](Train-Ticket/Online-Boutiqueの「LLM instruction-tuningデータ生成基盤」という第4の利用目的を追記) ### Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports(ICPE Companion 2026)(2026-08-15 ingest-paper) - 新規 concept 1 件: [[LLMによる構造化情報抽出]] — 非構造テキストからスキーマに沿ったフィールドをLLMで抽出・分類する手法を扱う新設概念。プロンプトコンポーネント(Task/CoT/Category/Examples/Format)の組み合わせ効果を横断的知見の起点として整理。 - 既存 concept 2 件を更新: [[クラウドインシデント]](公開インシデントレポートの情報量がベンダーごとに大きく異なり、根本原因公開自体を絞るベンダーがあるという知見を追記) / [[LLM評価]](「低コスト・低レイテンシ」が品質低下ではなく十分な能力のシグナルになりうる逆説的知見と、コスト比50–60倍が精度差に見合わない事例をAIOpsエージェント評価と対比して追記) ### FlowCheck(EuroSys 2025、2026-08-15 ingest-paper) - 新規 concept 0 件。既存 concept 2 件を更新: [[チェックポイント]](チェックポイントコスト削減の「第5の道」として通信経路そのものの物理的分離を追加し、Gemini の時間軸分離との対比・コスト構造の違いを横断的知見に積み増し)、[[集合通信]](allreduce トラフィックの構造的性質を通信外の目的=チェックポインティングへ転用する新視点と、ポートミラーリングという非侵襲的観測点の位置づけを追加)。 ### ディープラーニングを支える技術〈2〉(2026-08-15 ingest-book) - 新規 concept 11 件: [[VAE(変分オートエンコーダ)]], [[GAN(敵対的生成ネットワーク)]], [[正規化フロー]], [[自己回帰モデル]], [[ベルマン方程式]], [[方策勾配法]], [[モンテカルロ木探索]], [[DQN]], [[宝くじ仮説]], [[条件数]], [[不変性と同変性]]。深層生成モデルの 4 手法と深層強化学習の中核概念群が中心で、いずれも本書が wiki 内での最初の体系的ソースになる。 - 更新 concept 27 件: - 謎1(最適化): [[勾配降下法]], [[凸最適化]], [[ベイズ最適化]] — 非凸最適化での成功理由を Star-convex Path と条件数から説明する層を追加。 - 謎2(汎化): [[汎化能力]], [[暗黙的正則化]], [[深層学習の汎化]], [[汎化誤差バウンド]], [[PAC学習]], [[バイアス-バリアンストレードオフ]], [[正則化]], [[ドロップアウト]] — 従来理論との矛盾と、その解明としての陰的正則化を本書が最も厚い教科書ソースとして与える。 - 生成モデル: [[拡散モデル]], [[最尤推定]], [[有向グラフィカルモデル]], [[膨張畳み込み]], [[変分損失性オートエンコーダ]]。 - 強化学習: [[強化学習]] — 価値推定と方策改善という 2 軸での体系化を追加し、既存の LLM 時代の強化学習系ページに古典的基礎を接続。 - 展望: [[自己教師あり学習]], [[事前学習目的設計]], [[言語モデル事前学習]], [[スケーリング則]], [[LLMスケーリング則]], [[ムーアの法則とデナードスケーリングの終焉]], [[知識蒸留]], [[対照学習]], [[表現学習]], [[集合の順列不変表現]], [[GNN同変性]]。 - なお [[勾配降下法]] と [[凸最適化]] の本書分の追記は、別セッションの先行コミット `8e76a9bcc4` に巻き込まれてコミット済み(内容は完全。履歴は改変していない)。 ### Machine Learning Applications for Data Center Optimization(2026-08-16 ingest-paper) - 新規 concept: [[PUE]] — データセンター施設全体のエネルギー効率を表す比率。IT負荷・冷却設備・気象条件からの予測、設定値感度分析、設備構成シミュレーションへの接続を整理。 - 更新 concept 3 件: [[教師あり学習]](PUEの連続値回帰を追加)、[[統計的機械学習]](予測を介入可能な運用判断へ接続する知見を追加)、[[データセンター信頼性]](観測と変更前予測という運用原則を追加)。 ### The Sciences of the Artificial(Herbert A. Simon、The MIT Press 1996、第 3 版、全 8 章)(2026-08-16 ingest-book) - 新規 concept 19 件: - [[チャンクと記憶の制約]] — 刺激の極大既知部分構造としてのチャンクと、短期記憶の保持数・長期記憶への固定時間という 2 パラメータ。 - [[ヒューリスティック探索]] — 広大な可能性の迷路を選択的に探索し、扱える大きさに縮める問題解決の方法。 - [[人工物の科学]] — 人間の目的と自然法則の双方が体現された対象を扱う知識の体系。本書全体のハブ。 - [[内部環境と外部環境]] — 人工物を内部環境・外部環境・両者を結ぶインタフェースとしての目標という三項に分解する枠組み。 - [[創発と還元主義]] — 系の性質を構成要素とその関係で説明しうるとする立場と、全体論・創発概念との対峙。 - [[問題の理解と表現]] — 自然言語の問題文から問題解決器が扱える構成要素を取り出す過程と、その結果としての問題空間。 - [[市場と組織]] — 経済活動を調整する二種の人工的な仕組みを、限定合理性への折り合いという同一問題への解法として並べる見方。 - [[情報処理システムとしての人間]] — 人間の思考を、容量の限られた高速記憶を持つ適応システムとして捉え、行動の複雑さを環境の反映と見る立場。 - [[最終目標なき設計]] — 目標が設計過程の途中で変化し続けることを前提とし、目標の機能を「新しい目標を生む活動の動機づけ」に置く設計観。 - [[決定論的カオス]] — 決定論的でありながら、初期条件の無限小の擾乱が経路を根本的に変えうる動的システム。 - [[注意の希少性]] — 情報を扱う系の設計で律速となるのは情報の量ではなく、それを受け取る人間の時間と注意であるという主張。 - [[満足化]] — 「十分によい」代替案を受け入れる選択様式。最適化が不可能だから採られるのであって、志が低いからではない。 - [[準分解可能システム]] — サブシステム内部の相互作用がサブシステム間より格段に強い系。短期はほぼ独立、長期は集約量で記述できる。 - [[状態記述と過程記述]] — 複雑システムを理解するときに利用できる 2 つの記述様式と、その相互翻訳。 - [[社会計画]] — 社会全体とその環境を、作り直すべき系として扱う設計。 - [[計算による科学的発見]] — 科学的発見の過程を情報処理システムの働きとして定式化し、プログラムとして実装・検証する研究様式。 - [[設計の科学]] — 設計過程についての、知的に手ごわく分析的で教えうる学説の体系。専門職教育の中核に置かれる。 - [[限定合理性]] — 外部環境への適合(実体的合理性)が、適応行動を発見する能力(手続き的合理性)によって制限されるという性質。 - [[階層的複雑性]] — 相互に関連するサブシステムが最下位の基本単位まで入れ子になる系と、それが優勢である進化論的理由。 - 更新 concept 4 件: - [[エージェント型科学探索]] — [[BACON]] 系譜との探索資源の見立ての逆転を追記。 - [[コルモゴロフ複雑性]] — 「非冗長な構造は自らの最も単純な記述である」という Simon の定式が非圧縮性と一致する一方、尺度定義ではなく冗長性の構造的原因を扱う点で関心が逆であることを追記。 - [[サイバネティクス]] — Simon による同時代人としての値踏み、一般システム理論への警告、全体論と還元主義の対峙を追記。 - [[記号接地問題]] — Siklossy のプログラムと、中国語の部屋への反駁として読める論点を追記。 ### SWEBOK Straw Man Version(2026-08-16 ingest-book) - 新規 concept 5 件: - [[ソフトウェア工学知識体系]] — 本バッチのハブ。SWEBOK とは何か、なぜ合意が要るか、知識領域の同定結果、段階的合意形成の設計、Stone Man 段階への引き渡しの 5 軸を 5 章分から積層。 - [[一般に受け入れられた知識]] — Generally Accepted / Advanced / Specialized / Research の 4 区分と、PMI の PMBOK Guide による "generally accepted" の定義。 - [[専門職化と資格認定]] — 認定(accreditation)・認証(certification)・免許(licensing)の 3 区分と、それぞれが中核的知識体系に依存する構造。 - [[ソフトウェア工学の関連分野]] — ソフトウェア工学と隣接分野の境界画定。 - [[形式手法]] — 1998 年時点で形式手法のどこまでが「一般に受け入れられた」と見なされていたかの成熟度分布。 - 更新 concept 3 件: - [[ソフトウェアライフサイクル]] — ISO/IEC 12207 の Primary/Supporting/Organizational という 3 プロセス類の構造と、SWEBOK の知識領域分類基盤への採用経緯を追記。 - [[SREの工学化]] — 工学分野としての成熟という論点で SWEBOK ch.3 との突き合わせを追記。 - [[軽量形式手法]] — 1998 年の付録 I の分類との突き合わせを追記。 ### Predict Boldly, Recover Cautiously(RouterOPS、SIGCOMM Posters and Demos 2026)(2026-08-16 ingest-paper) - 更新 concept 2 件: - [[NetOps]] — 中央集権的な事前検証(verification wall)とルーター側の分散型ローカル反射(RouterOPS の self/neighbor-testing + decision guard)を、NetOps 安全性確保の 2 つの時間軸戦略として対比する知見を追記。 - [[プロアクティブ障害管理]] — RouterOPS の「大胆に予測し、慎重に復旧する」原則が Salfner+ 2010 の PFM 4 段階(予測→診断→対策決定→実行)をネットワークルーティング層で 1 エージェントに統合した実例であることを追記。 ### The Vision of Autonomic Computing(Kephart & Chess、*Computer* 2003)(2026-08-16 ingest-paper) - 新規 concept 2 件: - [[自律コンピューティング]] — 自己構成・自己最適化・自己修復・自己防御の 4 側面と、自律要素(managed element + autonomic manager)というアーキテクチャによる、システム管理者を運用の詳細から解放する設計思想。 - [[MAPE-Kループ]] — 自律マネージャの内部構造。Monitor-Analyze-Plan-Execute の 4 機能が共有 Knowledge を介して結びつく制御ループ。 - 更新 concept 2 件: - [[セルフヒーリング]] — 「セルフヒーリング」という語の 2003 年時点の初出定義(検知→診断→修復アクションの 3 段階構造)を追記し、現代実装(CANDARW 2025 のホットリスタート)が診断段階を省略する傾向にあることを対比。 - [[自動化のアイロニー]] — 自律コンピューティングのビジョン(2003)が提案する段階的な自律性移譲が、Bainbridge(1983)の「監視のアイロニー」の構造をそのまま踏襲していながら言及していない点を追記。 ### Why Software Is Eating the World(Marc Andreessen、a16z 2011)(2026-08-16 ingest) - 新規 concept 1 件: [[Software Eating the World]] — ソフトウェア企業があらゆる産業の価値連鎖を代替しつつあるという2011年の VC 業界テーゼ。SRE Workbook Foreword II の「Reliability is eating the world」との言い回しの反復関係を弱い関連として記録。 ### Visions of Artificial Intelligence and Robots in Science Fiction(Osawa+, IJSR 2022)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[SFにおけるAI表象]] — SF に描かれた 115 件の AI・ロボットの計算的分析から得られた Human/Machine/Buddy/Infrastructure の 4 類型、身体性(embodiment)の知能認知への二面的影響、Human 型=人種差別のメタファー・Machine 型=制御不能への恐れというステレオタイプの系譜を横断的知見として記録。本 wiki 初の human-robot-interaction / science-fiction 領域の concept。 ### The End of Programming as We Know It(Tim O'Reilly、O'Reilly Radar 2025)(2026-08-16 ingest) - 新規 concept 2 件: - [[70%問題]] — [[Addy Osmani]] 提唱。AIコーディングツールはデモや簡単な問題では劇的な生産性向上をもたらすが、複雑な本番システムの「最後の30%」ではデバッグとAI出力の制御に必要な工学的判断力が不足し行き詰まる現象。 - [[エージェントエンジニア]] — [[Bret Taylor]] 提唱。企業のビジネスプロセスをAIエージェントへ落とし込む「最後のマイル」を担う新職種。フロントエンドWeb開発者に近い性質を持つとされる。 ### Risk management in a dynamic society(Jens Rasmussen、Safety Science 1997)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[AcciMap]] — Rasmussen が Svedung との共同研究に基づき提示した、社会技術システムの複数階層(政府〜設備・周辺環境)にまたがる意思決定と物理条件を1枚の図上に接続する事故分析手法。 - 更新 concept 1 件: [[事故モデル]] — これまで SREcon 系トークの二次引用でのみ知られていた「Rasmussen の Safety Model」(3境界モデル)の一次資料を確認し、境界名称の一致・Zeebrügge 事故分析との位置関係・AcciMap との系譜差異を追記。 ### Design and natural science research on information technology(March, Smith、Decision Support Systems 1995)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[デザインサイエンス研究]] — IT 研究を研究成果物(constructs・models・methods・instantiations)×研究活動(build・evaluate・theorize・justify)の 4×4 フレームワークとして整理する研究方法論。Simon の design science / natural science の区別を IT 研究に適用した March & Smith (1995) が起点。本 wiki 初の研究方法論(research-methodology)領域の concept。 ### On Structural Differences between Science and Engineering(Hans Poser、PHIL&TECH 1998)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[技術的規則]] — 規則(rules)は法則(laws)と異なり真理値を持たず効力(efficacy)によってのみ正当化されるという工学の認識論。know-how/know-why 論争(Rorty・Toulmin・Starnberg 学派の Finalisierungsthese)への応答と、行為・工学=科学・局所条件の3層で働く「技術的解釈学(technological hermeneutics)」を収録。 - 更新 concept 1 件: [[人工物の科学]] — Simon(命令論理の可能世界還元)と Poser(規則の真理値欠如)という、「科学=記述/工学=規範」という同じ直感への異なる根拠づけ経路を横断的知見として追記。 ### What Engineers Know and How They Know It(Walter G. Vincenti、Johns Hopkins University Press 1990、全 8 章)(2026-08-16 ingest-book) - 新規 concept 13 件: [[パラメータ変化法]] / [[制御体積解析]] / [[動作原理]] / [[変異選択モデル]] / [[工学科学]] / [[工学設計知識]] / [[暗黙知]] / [[生産のための知識]] / [[翼型設計]] / [[記述的知識と規範的知識]] / [[設計要件の確立]] / [[通常設計と急進的設計]] / [[飛行品質仕様]]。 - ハブは [[工学設計知識]](第 1 章が定義 → 第 2〜6 章が事例からの観察 → 第 7 章が 6 カテゴリ × 7 活動の構造 → 第 8 章が成長の観点、と層状に積み上げた)。成長側の中核は [[変異選択モデル]]。 ### Nicomachean Ethics - Book VI: Intellectual Virtues(Aristotle、訳: F. H. Peters、1906、断片ingest)(2026-08-16 ingest-book) - 新規 concept 1 件: [[フロネシス(実践知)]] — 人間にとっての善悪という可変の領域で行為に関わる、理にかなった実践的習性。個別具体的事実の認識を要し経験によってのみ養われる。本 wiki 初の philosophy(古典哲学)領域の concept。 ### Technology as 'Applied Science'(Gil-Pérez+, Science & Education 2005)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[科学の歪んだ描像]] — 技術を応用科学とみなす誤解を起点に科学教育で強化される、科学の性質(NOS)に関する7つの相互補強的な歪んだ描像(脱文脈化/個人主義的エリート主義/経験主義的帰納主義/硬直的アルゴリズム的/非歴史的独断的/もっぱら分析的/線形累積的)。本 wiki 初の science-education 領域の concept。 - 更新 concept 1 件: [[工学科学]] — 「技術は応用科学ではない」という結論に、Vincenti(歴史的事例研究)・Poser(規則の認識論)とは異なる第3の独立した経路(科学教育の実証研究)が到達していることを横断的知見に追記。 ### An Evaluation of the Ninth SOSP Submissions(Roy Levin, David D. Redell、ACM SIGOPS OSR 1983)(2026-08-16 ingest) - 新規 concept 1 件: [[システム論文の評価基準]] — 独創性・現実性・教訓・選択・文脈・焦点・提示・文章スタイルの7基準からなる、システム論文の投稿評価の体系。第9回SOSP(1983)プログラム委員会の査読経験に基づく。本 wiki 初の academic-writing 領域の concept。 - 更新 concept 1 件: [[学術論文の読解技術]] — 論文を「書く」側・査読する側の基準を扱う [[システム論文の評価基準]] への相補的な関連リンクを `## 関連` に追記(横断的知見の更新は単一ソース同士の突き合わせに留まるため見送った)。 ### Design Science in Information Systems Research(Hevner, March, Park, Ram、MIS Quarterly 2004)(2026-08-16 ingest-paper) - 更新 concept 1 件: [[デザインサイエンス研究]] — March and Smith (1995) の4×4フレームワークが、共著者 Salvatore T. March を接点に本論文の7ガイドラインへ発展した系譜と、build 活動(Generate/Test Cycle による具体化)・評価活動(Table 2 の5カテゴリ)・陳腐化しやすさの3点で両論文を比較した横断的知見を追記。既存の未解決の問い1件(Hevner et al. 2004 のガイドラインの内容)に回答。 ### LISA made LISA obsolete (That's a compliment!)(Thomas A. Limoncelli、;login: online / USENIX 2022)(2026-08-16 ingest) - 更新 concept 2 件: [[DevOps]](LISA 併設 configuration management workshop 由来の IaC 系譜が Velocity 2009/mizzy 系譜とは独立に存在すること、LISA→SREcon の制度単位での世代交代を横断的知見に追記)・[[システム管理者からSREへの視点転換]](Legeza の個人レベル観点転換と Limoncelli の業界レベル世代交代を突き合わせ、単一ソースの concept を 2 ソースへ昇格)。 ### The Many Faces of Systems Research - And How to Evaluate Them(Brown, Chanda, Farrow, Fedorova, Maniatis, Scott、HotOS 2005)(2026-08-16 ingest-paper) - 更新 concept 1 件: [[システム論文の評価基準]] — 1983年 Levin & Redell の7基準(執筆・提示上の基準)と2005年 Brown+ の3次元(科学・工学・芸術という論文の性質分類)が階層的に補完し合うこと、両ソースとも「単一基準の一律適用」を評価の失敗要因とする点で一致すること、2005年論文の工学次元の区別が [[工学科学]]・[[人工物の科学]] の議論と同型であることを横断的知見に追記。 ### Hints for Computer System Design(Butler W. Lampson、SOSP 1983)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[ヒントによる高速化]] — キャッシュエントリと似るが「間違っている可能性がある」「連想検索とは限らない」点で異なり、使用前に必ず truth と照合して検証する、Lampson (1983) が定式化した高速化技法。本 wiki 初の system-design 領域の concept。 - 更新 concept 1 件: [[エンドツーエンド論]] — エンドツーエンド論の広く知られる引用元(Saltzer, Reed, Clark, ACM TOCS 1984)より1年早い1983年の実務論文が、同じ論法を既に Saltzer の1981年会議発表版から引用し、Xerox PARC の実システム(Alto ファイルシステム・Pup インターネットワーク)で実務知として定着していたことを横断的知見に追記。 ### Of Apples and Oranges: Fair Comparisons in Heterogenous Systems Evaluation(Sadok, Panda, Sherry、HotNets '23)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[コストを考慮したシステム評価]] — アクセラレータ(GPU・SmartNIC・FPGA)を使うヘテロジニアスハードウェアシステムの比較評価で、性能だけでなくコストも測定・報告すべきとする方法論。コスト指標の3条件(文脈独立性・定量化可能性・end-to-end網羅性)と、Pareto支配・比較領域・理想的スケーリングに基づく評価原則からなる。本 wiki 初の systems-evaluation / accelerators 領域の concept。 - 更新 concept 1 件: [[システム論文の評価基準]] — 論文の書き方・査読基準(7基準・3次元)を扱う本 concept に対し、評価対象そのものの測定方法論を扱う姉妹concept [[コストを考慮したシステム評価]] への相補的な関連リンクを `## 関連` に追記(横断的知見の更新は単一ソース同士の突き合わせに留まるため見送った)。 ### Cybernetics: or Control and Communication in the Animal and the Machine, 2nd ed.(Norbert Wiener、The MIT Press 1961)(2026-08-16 ingest-book) - 新規 concept 13 件: [[科学の境界領域]](既成分野のあいだの no-man's land にこそ実り多い領域があるという方法論的確信。Introduction)・[[可逆性と不可逆性]](天文学的時間と気象学的時間。第1章)・[[エルゴード理論]](時間平均と位相平均の一致。第2章)・[[ウィーナーフィルタ]](最小二乗の意味での最適線形予測・フィルタ。第3章)・[[ホメオスタシス]](随意・姿勢フィードバックより低速で広域な生理学的恒常性維持。第4章)・[[計算機と神経系のアナロジー]](リレーとニューロンの悉無律による構造的等価性の主張。第5章)・[[群走査による不変量抽出]](変換群にわたる走査による普遍の知覚の機械化。第6章)・[[記憶の疾患としての精神障害]](機能的精神障害を循環する記憶とシナプス透過性の疾患として捉える見立て。第7章)・[[社会のホメオスタシス]](自由市場ホメオスタシス説とそのゲーム理論による反駁。第8章)・[[個体発生的学習と系統発生的学習]](学習の2つの時間尺度。第9章)・[[自己複製機械]](非線形トランスデューサによる自己複製の操作手順。第9章)・[[自己組織化]](非線形な周波数引き込みから秩序ある周波数構造が生じる過程。第10章)・[[ブラックボックスとホワイトボックス]](未知の非線形系を既知の系との相関で自動同定する手続き。第2版序文)。 - 更新 concept 12 件: [[サイバネティクス]](原典自身による定義・命名の由来を初めて収録し、Simon の要約とのずれ、病理への適用と社会への適用それぞれに著者が置いた留保を横断的知見に追加)・[[フィードバックループ]](負のフィードバックと発振が同じ線形作用素論の表裏であることの原典による定式化)・[[ブロック線図]](1948年の control flow chart が Hellerstein の Z 変換ブロック線図の図的祖先にあたり、`A/(1+λA)` が `F_FF/(1+F_LP)` と同じ代数形であること)・[[制御ループの安定性とタイムラグ補償]](純遅延作用素の単位円境界とフィードバック限界)・[[適応制御]](情報的フィードバックが自己調整レギュレータの1948/1961年の先行例であること)・[[アロスタシス]](ホメオスタシス=事後対応/アロスタシス=予測的という対比が原典には無く二次文献由来であることを明示)・[[システム同定]](相関ベース同定(1961)と ARX 最小二乗回帰(2004)の系譜)・[[メタ安定障害]](残存神経系への過負荷と再経路化という1948年の生物学的先行例)・[[複雑システム障害論]](電話交換網の破局的閾値の議論と Cook 命題5・命題18 の対応)・[[情報処理システムとしての人間]](論理的記述と物理機構を結ぶ戦略が Wiener はボトムアップ、Simon はトップダウンであること)・[[不変性と同変性]](群走査という逐次探索と現代のパラメータ共有による不変性の対比)・[[光学文字認識]](1948年の光電式読書器の明示的な尺度不変機構と、学習された尺度不変性の対比)。 ### End-To-End Arguments in System Design(J. H. Saltzer, D. P. Reed, D. D. Clark、ACM TOCS 1984)(2026-08-16 ingest-paper) - 更新 concept 1 件: [[エンドツーエンド論]] — エンドツーエンド論の一次資料そのものを取り込み、(1) 原論文自身が「エンドツーエンド論はどこに早期チェックを置くべきか教えてくれない」と明示的に認めていることを既存の未解決の問いへの回答として追記、(2) 決定版1984年論文がLampson(1983)Hints論文を引用しておらず両者が独立に1981年パリ版から到達したこと、(3) DDIA第13章のマルチシャード決済(エンドツーエンドリクエストID)が著者ら自身のSWALLOWシステムでの配送確認省略(メッセージ半減)と同型のパターンであることを横断的知見に追記。 ### Methodology of Algorithm Engineering(Jan Mendling, Henrik Leopold, Henning Meyerhenke, Benoît Depaire、ACM Computing Surveys 2025)(2026-08-16 ingest-paper) - 新規 concept 2 件: [[アルゴリズムエンジニアリング]](Real-World Problem→Algorithmic Task→Algorithm Design→Algorithm Implementationの存在論的連鎖と、Popperの三世界論による知識の位置づけ。本 wiki 初のアルゴリズムエンジニアリング領域の concept)・[[研究方法論における妥当性概念]](生態学的・設計・実装・外的・正当化・論理的・内的・構成概念・結論妥当性の9類型とその対応実体。ソフトウェア工学実験計画論とデザインサイエンス研究の両方から借用した妥当性概念群を統合)。 - 更新 concept 2 件: [[工学科学]]([[アルゴリズムエンジニアリング]]への関連リンクを追記。Staples 2014のエンジニアリング存在論モデルがVincentiの工学科学論と同じ問いをアルゴリズムに適用した姉妹的枠組みであることを`## 関連`に記載)・[[デザインサイエンス研究]]([[アルゴリズムエンジニアリング]]への関連リンクを追記。Hevner et al. 2004が引用するGregor and Hevner 2013のexaptation概念やWieringa 2014のデザインサイエンス方法論が、本ソースでアルゴリズム研究の知識拡張カテゴリとして直接援用されている接続を`## 関連`に記載)。 ### What is Technology? Six Definitions and Two Pathologies(Paul Nightingale、SPRU Working Paper Series SWPS 2014-19)(2026-08-16 ingest-paper) - 新規 concept 1 件: [[技術の定義]](技術の6つの定義を学問分野別の視点の階層として統合するNightingale (2014)の枠組み。本 wiki 初の philosophy-of-technology 領域の concept)。 - 更新 concept 2 件: [[動作原理]](VincentiとNightingaleがPolanyiに独立に遡る2つの参照系列を持つこと、動作原理が工学実務の水準と技術/科学の認識論的差異の説明という2つの水準で機能することを横断的知見に追記)・[[暗黙知]](Nightingaleが暗黙知を静的な背景でなく能動的な創造的統合過程として再解釈すること、Vincenti第6章末の未解決の推測にPolanyi経由のメカニズムの手がかりを与えることを横断的知見に追記)。 ### Resilience Engineering: Concepts and Precepts(Erik Hollnagel, David D. Woods, Nancy G. Leveson 編、Ashgate 2006、抜粋: Prologue + 第1章)(2026-08-16 ingest-book) - 新規 concept 0 件(本書が扱う概念はいずれも既存 concept が受け皿として存在した)。 - 更新 concept 6 件: [[レジリエンスエンジニアリング]](分野の出発点となる一次資料としての定義を追記。Prologue の「安全はコアバリューであり計数可能な商品でない」と第1章の「動的安定性の維持・回復能力」という2つの定義軸を突き合わせた横断的知見を追加)・[[事故モデル]](機能共鳴事故モデルを表に追加し、「事故モデルとリスク評価手法の対応」節を新設。採用するモデルが到達できるリスク評価手法の射程を規定するという制約関係を横断的知見に追加)・[[ヒンドサイトバイアス]](安全研究・実務の双方を支配してきた構造的バイアスとしての位置づけを Fischhoff (1975) 経由で追記)・[[人的要因]](人間を「信頼できないコンポーネント」とみなす見方から「適応能力の源泉」とみなす見方への1980年代の転換を追記)・[[トレードオフ意思決定]](安全への投資が数十年でなく数か月〜数年の時間軸で判断される「犠牲的決定」の対象になりやすいことを追記)・[[複雑システム障害論]](通常の遂行も失敗も創発的現象とみなすシステミックな視点の4要点を追記)。 ### Practical Reliability Engineering(Patrick D. T. O'Connor・Andre Kleyner、Wiley 2012、第 5 版、本編全 17 章 + Appendix 5・6、504 ページ) - 新規 concept 28 件: [[信頼性工学]](本書全体のハブ。信頼性の定義、目的の優先順位、確率的性質、プログラム活動と経済性)・[[バスタブ曲線]](修理不能品のハザード率と修理可能品の故障発生率(ROCOF)を区別して扱う)・[[工学的ばらつき]](工学における変動が自然現象の統計と質的に異なる理由と、その信頼性への影響)・[[ワイブル分布]](分布としての定義と性質、寿命データへの当てはめ、加速試験・保証データでの診断的利用)・[[寿命データ解析]](打ち切りデータの分類、順位付け、信頼限界というデータの性質と扱い)・[[モンテカルロシミュレーション]](閉形式解が得られない問題への数値的代替手段と、その適用範囲・限界)・[[荷重-強度干渉]](安全率を故障確率へ接続する枠組みと、機械的故障メカニズムによる強度の経時劣化)・[[信頼性予測]](予測の限界を軸にした整理。規格ベース予測と部品積み上げ方式への批判)・[[故障の木解析]](FTA の位置づけと、RBD・マルコフ解析・ペトリネットとの表現力の違い)・[[システム信頼性モデル]](直列・並列・冗長構成、修理可能系の可用性、ブロック図解析、信頼性配分)・[[FMECA]](故障モード・影響・致命度解析と RPN、DfR プロセスにおける位置づけ)・[[故障の物理]](機械・電子の故障メカニズムを、故障率という統計量ではなく物理過程として捉える)・[[電子部品の信頼性]](部品・回路レベルの設計上の扱い、ディレーティング、パラメータばらつきと公差)・[[ソフトウェア信頼性]](摩耗も個体差もないというハードウェア信頼性との根本的差異)・[[実験計画法]](DOE と ANOVA、無作為化、統計的有意性と工学的重要性の区別)・[[タグチメソッド]](制御因子とノイズ因子、SN 比によるロバスト設計と、著者の留保付き評価)・[[信頼性試験]](試験の計画、試験環境、試験計画の立て方)・[[加速試験]](HALT/HASS という試験手法と、加速係数・加速モデルによるデータ解析)・[[保証データ解析]](運用・保証データの性質(打ち切り・報告バイアス・集計形式)と解析手法)・[[修理可能系の信頼性解析]](ROCOF、点過程、CUSUM チャート、比例ハザードモデル)・[[信頼性実証]](success run 法・test to failure 法・劣化解析と、必要試験数の実務的限界)・[[信頼性成長]](Duane 法・M(t) 法による成長監視と、TAAF・FRACAS による成長の促進)・[[製造工程の信頼性管理]](工程と人間のばらつきの管理、抜取検査の論理的限界、工程改善)・[[ストレススクリーニング]](ESS・バーンイン・HASS による潜在欠陥の早期除去)・[[保守性]](保守時間分布、保守性の予測・実証、保守性のための設計)・[[可用性]](固有・達成・運用の 3 尺度と、信頼性と保守性の合成としての可用性)・[[予防保守]](予防保守の有効性がハザード率の傾向に規定されるという判定基準)・[[信頼性管理]](統合プログラム、コストと契約、供給者管理、能力成熟度、戦略と戦術の区分) - 更新 concept 6 件: [[Design for Reliability]](6 段階プロセスと機械・電子分野への適用を積み増し)・[[FRACAS]](閉ループの原理・信頼性成長との関係・生産 FRACAS・様式例を積み増し)・[[ディペンダビリティ]](本書の信頼性定義との対比)・[[ソフトウェア耐障害性]](同一コード冗長化が効かない理由)・[[ソフトウェア信頼性成長モデル]](本書の懐疑的評価との contradiction)・[[SRE]]・[[逐次検定]](統計的推論との接続) ### ActionNex: A Virtual Outage Manager for Cloud Computing(Zhenfeng Lin ほか13名、Microsoft、arXiv:2604.03512)(2026-08-17 ingest-paper) - 新規 concept 1 件: [[次善アクション推薦]](次に取るべき単一アクションを推薦する問題設定。ActionNex の critical events 抽象・KCA 階層記憶・検索駆動の推論エージェント層を定義に据えた本 wiki 初のこの領域の concept)。 - 更新 concept 3 件: [[エージェントメモリ]](KCA をテキスト格納・監査可能な経験メモリの産業実装として位置づけ、暗黙の人間フィードバックによる RL 不要の自己進化経路を横断的知見に追加。代表的システム表に ActionNex を追加)・[[クラウド障害ライフサイクル]](TTX が測る所要時間と ActionNex が測る段階別推薦精度〈検知は速いが確信度低・解決は遅いが確信度高〉が相補的であることを横断的知見に追加)・[[TSG自動化]](TSG「実行」「生成」の2軸に、実行まで踏み込まない「検索駆動の推薦」という第3の軸を ActionNex が加えることと、KCA の曖昧性許容設計が FLASH/LLexus の決定論的実行と対照的であることを横断的知見に追加)。 ### Handbook of Software Reliability Engineering(Michael R. Lyu 編、IEEE Computer Society Press / McGraw-Hill 1996、全 17 章 + 付録 A・B)(2026-08-17 ingest-book) - 新規 concept 4 件: [[運用プロファイル]](Musa の5段階作成手続き。テスト資源を使用頻度に比例配分する SRE 実務の中核)・[[直交欠陥分類]](統計的欠陥モデルと根本原因分析の中間を埋める Chillarege の ODC)・[[テストカバレッジ]](規準の包含階層と飽和効果、カバレッジと信頼性の実証的関係)・[[フィールドデータ解析]](出荷後の現場データの性質と、稼働量測定・データ品質の困難) - 更新 concept 25 件: [[システム信頼性モデル]]・[[ソフトウェア信頼性]]・[[ソフトウェア信頼性工学]]・[[ソフトウェア信頼性成長モデル]]・[[ソフトウェア耐障害性]]・[[ソフトウェア複雑性]]・[[ディペンダビリティ]]・[[フォールトトレランス]]・[[ベイズ推定]]・[[メトリクス削減]]・[[モンテカルロシミュレーション]]・[[ログベース障害診断]]・[[主成分分析]]・[[信頼性予測]]・[[信頼性工学]]・[[信頼性成長]]・[[信頼性管理]]・[[修理可能系の信頼性解析]]・[[可用性]]・[[寿命データ解析]]・[[故障の木解析]]・[[最尤推定]]・[[運用障害分析]]・[[障害予測]]・[[障害傾向分析]] - 特筆すべき積み増し: [[ソフトウェア信頼性成長モデル]]には第3章(分類体系と定義)・第4章(予測精度の評価と再較正)・第10章(適用前のトレンド判定)・第7章(実適用の経験とツール)・第16章(解析解からシミュレーションへ)・第17章(ノンパラメトリックなモデル化)の6層が、担当章を直列化しながら層状に積み上がった。[[ディペンダビリティ]]には第1章と第2章の用語体系の食い違いを `> [!contradiction]` として記録した。 ### SONiC で 800G AEC ケーブルを検証してみた(張朝程・内田泰広、ソフトバンク株式会社、SONiC Workshop Japan 2025)(2026-08-17 ingest-slides) - 新規 concept 2 件: [[AECケーブル]](DSP内蔵の銅線ケーブル。DAC/AOCとの構造比較とCMIS準拠による相互接続性、7m長制限を定義に据えた本wiki初のこの領域のconcept)・[[CMIS]](トランシーバー・ケーブルとネットワーク機器間の共通管理インターフェース仕様。Page構造と`i2cdump`/`i2cset`によるレジスタ操作を定義に据える)。 ### Principles of Network and System Administration(Mark Burgess、Wiley 2004、第 2 版、本編全 14 章)(2026-08-17 ingest-book) - 新規 concept 5 件: [[アカウントポリシー]]・[[サービス導入の一般手順]]・[[プロキシとエージェント]]・[[ポリシー]]・[[信頼関係]]。 - 更新 concept 19 件: [[Infrastructure as Code]]・[[べき等性]]・[[ゲーム理論とSRE]]・[[サービスレベル目標]]・[[システム管理者からSREへの視点転換]]・[[ソフトウェア変更管理]]・[[データのプライバシーと同意]]・[[ネットワーク監視]]・[[プローブ効果]]・[[ワークロードの特性の把握]]・[[予防保守]]・[[収束型システム管理]]・[[技術的規則]]・[[故障の木解析]]・[[根本原因分析]]・[[潜在的障害]]・[[統計的有意性]]・[[複雑ネットワーク]]・[[過渡応答解析]]。 - 特筆すべき積み増し: [[ポリシー]](第 3 章で新規作成)には定義と共同体原理(3 章)→ 管理モデルでの強制と委譲(6 章)→ システム設定と倫理(7 章)→ 受容したリスクとしてのセキュリティ(11 章)→ 複数の権威が発したポリシーどうしの衝突(12 章)の 5 層が、担当章を直列化しながら層状に積み上がった。[[収束型システム管理]] にも 1・4・6・7・14 章の 5 層が積まれ、第 6 章は Traugott の congruence 批判を、第 7 章は宣言的記述と冪等な収束実行という実装層を担った。 ### 仕事ではじめる機械学習 第2版(有賀康顕・中山心太・西林孝、オライリー・ジャパン 2021、第 2 版、全 12 章)(2026-08-17 ingest-book) - 新規 concept 23 件: [[決定境界]]・[[多重共線性]]・[[機械学習基盤]]・[[回帰の評価指標]]・[[因果効果の推定]]・[[リアルタイム入札]]・[[多腕バンディット]]・[[探索的データ分析]]・[[機械学習の要否判断]]・[[継続的トレーニング]]・[[予測モデルの解釈手法]]・[[分類モデルの評価指標]]・[[非連続な報酬構造の分析]]・[[探索と活用のトレードオフ]]・[[教師データ収集手段の選択]]・[[教師データのためのログ設計]]・[[機械学習プロジェクトの進め方]]・[[機械学習アルゴリズム選択の指針]]・[[機械学習システムの設計パターン]]・[[クラウドソーシングによるアノテーション]]・[[A-Bテスト|A/Bテスト]]・[[CTR予測]]・[[Uplift Modeling]]。 - 更新 concept 19 件: [[正則化]]・[[決定木]]・[[帰属手法]]・[[強化学習]]・[[最近傍法]]・[[汎化能力]]・[[逐次検定]]・[[技術的負債]]・[[教師あり学習]]・[[教師なし学習]]・[[クラスタリング]]・[[好奇心駆動学習]]・[[アンサンブル学習]]・[[勾配ブースティング]]・[[学習問題設定の分類]]・[[エージェント型強化学習]]・[[サポートベクターマシン]]・[[MLモデル監視]]・[[統計的有意性]]。 - 特筆すべき積み増し: [[A-Bテスト|A/Bテスト]] には担当章を直列化しながら 4 層が積み上がった — 第 3 章「オフライン評価だけでは不十分」→ 第 7 章「設計と実施(標本サイズ・ランダム化・母集団ハック)」→ 第 10 章「A/B テストの拡張としての Uplift Modeling」→ 第 11 章「固定割当を動的割当へ置き換えるバンディット」。[[因果効果の推定]] も第 7 章の ATE/RCT に第 10 章が個体レベル処置効果(CATE/ITE)、第 12 章が広告配信の実運用制約を重ねた。 ### 信頼性の高い機械学習(Cathy Chen・Niall Richard Murphy・Kranti Parisa・D. Sculley・Todd Underwood、オライリー・ジャパン 2024、全 15 章)(2026-08-18 ingest-book) - 新規 concept 15 件: [[MLライフサイクル]]・[[データの段階]]・[[データの保守性]]・[[モデルアーキテクチャ・定義・訓練済みモデル]]・[[MLモデルの脆弱性の所在]]・[[特徴量ストア]]・[[MLメタデータ管理]]・[[モデルの確実性検証]]・[[評価データ分布の設計]]・[[責任あるAI]]・[[ML訓練システムの信頼性原則]]・[[ML障害管理の原則]]・[[アジャイルML]]・[[ML製品開発フェーズ]]・[[組織設計のスターモデル]]。 - 更新 concept 34 件: [[MLモデル監視]]・[[MLプロファイリング]]・[[SRE組織変革]]・[[インシデント管理]]・[[オブザーバビリティ]]・[[カナリアテスト]]・[[クラウドソーシングによるアノテーション]]・[[データのプライバシーと同意]]・[[データレイク]]・[[データ品質SLO]]・[[フィードバックループ]]・[[プライバシーエンジニアリング]]・[[予測モデルの解釈手法]]・[[予測分析とアルゴリズムバイアス]]・[[分類モデルの評価指標]]・[[回帰の評価指標]]・[[差分プライバシー]]・[[市場と組織]]・[[心理的安全性]]・[[意味のあるSLI設計]]・[[探索的データ分析]]・[[教師データのためのログ設計]]・[[教師データ収集手段の選択]]・[[機械学習の要否判断]]・[[機械学習システムの設計パターン]]・[[機械学習プロジェクトの進め方]]・[[機械学習基盤]]・[[物体検出]]・[[継続的トレーニング]]・[[耐障害LLMサービング]]・[[耐障害LLM訓練]]・[[製造工程の信頼性管理]]・[[訓練不変条件]]・[[音声認識]]。 - 特筆すべき積み増し: [[MLモデル監視]] には担当章を直列化しながら層が積み上がった — 3 章「監視のスターターセット」→ 9 章「モデル/データ/サービスの 3 レイヤーとドリフトの定量化」→ 5 章「訓練運用間スキューをデプロイ前ゲートとして扱う視点」→ 8 章「サービス運用形態ごとの監視要件」→ 11 章「集計 対 スライスという監視粒度」→ 15 章「実務事例での現れ方」。既存の SRE 系 concept 群と ML 系 concept 群の橋渡しも本書の特徴で、[[インシデント管理]] には「FEMA/ICS 由来の 4 役割は ML でも非 ML でも不変」、[[SRE組織変革]] には「ML 組織と SRE 組織の対象差から見える異同」、[[耐障害LLM訓練]]・[[耐障害LLMサービング]] には「汎用 ML の原則が LLM 規模でどう定量化されるか」という形で接続が入った。 ### Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?(Z.ai / Harnets.AI / Tsinghua University、X Article、2026-05-20)(2026-08-18 ingest) - 新規 concept 1 件: [[ZCube]](Spine 層撤廃・完全二部グラフ Leaf 相互接続によるフラット化トポロジ。数式によるポート割り当て、直径・負荷分散・スケーラビリティ・コストの性質、GLM-5.1本番クラスタでの実測を集約)。 - 更新 concept 3 件: [[Fat-Tree]](ROFT(Rail-Optimized Fat-Tree)の定義とZCubeとの対比を追加)・[[Prefill-Decode分離]](KV Cache転送非対称性がネットワークトポロジ誘発輻輳を招くという横断的知見を追加)・[[マルチプレーンClosトポロジ]](同じ輻輳問題への異なるレイヤーの解法としてZCubeを対比)。 ### 機械学習システムデザイン(Chip Huyen、オライリー・ジャパン 2023、全 11 章 + 付録 A)(2026-08-18 ingest-book) - 新規 concept 16 件: [[機械学習システムの4要件]]・[[目的関数のデカップリング]](2 章)、[[サンプリング手法]]・[[天然ラベル]]・[[ラベル不足への対処]]・[[クラス不均衡]]・[[データオーグメンテーション]](4 章)、[[データリーク]]・[[特徴の汎化]](5 章)、[[モデル評価のベースライン]]・[[摂動テストと不変性テスト]]・[[モデルのキャリブレーションと信頼度測定]](6 章)、[[推論最適化]](7 章)、[[データ分布のシフト]](8 章)、[[シャドウデプロイ]]・[[インターリービング試験]](9 章)。 - 更新 concept 44 件。積み増しの中心は [[MLモデル監視]](精度・予測・特徴・生入力の 4 アーティファクト、監視の受動性と継続学習の能動性、統計的検定の実務浸透度)・[[機械学習システムの設計パターン]](研究対実現場、バッチ予測対オンライン予測)・[[機械学習プロジェクトの進め方]](6 ステップの環、外部提供という契約と組織の文脈)・[[特徴量ストア]](特徴エンジニアリング側とプラットフォーム側の 2 面)・[[モデル圧縮]]/[[量子化]]/[[枝刈り]]/[[知識蒸留]](2022 年時点の BERT/CNN 世代の技法として既存 LLM 系記述の前段階に位置づけ)・[[継続的トレーニング]]・[[責任あるAI]]・[[機械学習基盤]]・[[MLメタデータ管理]]。データ工学系では [[データウェアハウス]]・[[データレイク]]・[[リレーショナル対ドキュメントモデル]]・[[グラフデータモデル]]・[[列指向OLAPデータベース]]・[[OLTPシステムアーキテクチャ]]・[[ACIDと分離レベル]]・[[マイクロサービスアーキテクチャ]]・[[データフローエンジン]] に、DDIA・『詳説 データベース』との突き合わせで見えた観察を追記した。 ### What Goes Around Comes Around... And Around...(Michael Stonebraker・Andrew Pavlo、ACM SIGMOD Record 2024)(2026-08-18 ingest-paper) - 更新 concept 7 件: [[専用データベースシステム]](本論文の中心テーマ。BigTable/Dynamo/H-Storeの成功後にSQL/ACIDを再獲得する「収斂」という専用化のライフサイクル後半局面、カラムファミリだけが収斂に取り残された非対称性、ベクトルDBは「除去」でなく「索引追加」型専用化であることを追加)・[[MapReduce]](Google/Hadoopベンダーによる具体的な廃止経緯、Impala/Drill/PrestoというHadoop迂回の同時多発的収斂を追加)・[[データレイク]](Delta Lake/Iceberg/Hudiのコスト優位性という経済的駆動要因、統計不足による適応的クエリ処理の必要性を追加)・[[リレーショナル対ドキュメントモデル]](主要NoSQLベンダーのSQL追加という業界規模の収斂データ、ドキュメントDBのXML/OODBMSとの40年来の歴史的反復を追加)・[[列指向OLAPデータベース]](データウェアハウス市場全体の列指向移行、Snowflakeが導入したサーバレス/ストレージ計算分離の起源を追加)・[[ベクトル検索インデックス]](ベクトルDBは新アーキテクチャでなくドキュメント指向DBMSの索引特化という評価、RDBMSへの急速統合の理由分析を追加)。 ### The Roots of Software Engineering(Michael S. Mahoney、CWI Quarterly 1990)(2026-08-18 ingest) - 新規 concept 3 件: [[ソフトウェア工学の起源]](本ソースの中心的主張=NATO会議での語の成立と借用モデル群を集約)・[[ソフトウェア危機]](1960年代末の不満リストと1978年の「不況」への呼称転換)・[[構造化プログラミング]](Dijkstraの数学的検証モデルとしての位置づけ)。 - 更新 concept 0 件(新規 concept 内で既存 source [[@1976__IEEE-TC__Software Engineering]] の Area 1/Area 2 二分類と接続)。 ### カオスエンジニアリング ― 回復力のあるシステムの実践(オライリー・ジャパン 2022、イントロダクション + 全 21 章)(2026-08-18 ingest-book) - 新規 concept 9 件: [[動的安全モデル]](2 章。経済性・ワークロード・安全性の三極と、安全性だけが直感を欠く構造)・[[複雑性の経済的支柱]](2 章。状態・関係・環境・可逆性)・[[先見性]](9 章)・[[機能配分]](11 章。Fitts のリストと HABA-MABA への批判)・[[カオスの成熟モデル(CMM)]](15 章)・[[継続的ベリフィケーション]](16 章)・[[機能安全]](17 章)・[[HOP]](18 章)・[[セキュリティカオスエンジニアリング]](20 章)。 - 更新 concept 26 件: 積み増しの中心は [[カオスエンジニアリング]](22 章分すべてが異なる軸で追記。歴史・複雑系・定義・企業別導入形態・人間と組織・ビジネス価値・成熟度・応用領域)・[[ブラスト半径]](LinkedIn の母集団差し替え型局所化という第三パターン)・[[障害注入]](LDFI の内部機構、分散 DB での 4 分類)・[[レジリエンスエンジニアリング]](Dekker の old view/new view の起源を 2002 年論文へ遡及、HOP のソフトウェア外からの独立到達)・[[GameDay]](DiRT との起源関係、人物の不在を注入対象とする組織版)。ほかに [[Raftログ診断]]・[[SRE文化]]・[[インシデントメトリクス]]・[[インシデント対応成熟度モデル]]・[[インシデント影響測定]]・[[オブザーバビリティ]]・[[ソフトウェア耐障害性]]・[[デルタデバッギング]]・[[データベースリライアビリティエンジニアリング]]・[[プロアクティブ検証]]・[[プローブ効果]]・[[信頼性工学]]・[[分散システム障害]]・[[制御ループの安定性とタイムラグ補償]]・[[実験計画法]]・[[心理的安全性]]・[[情報処理システムとしての人間]]・[[故障の木解析]]・[[本質的複雑性と偶発的複雑性]]・[[自動化の皮肉]]・[[複雑システム障害論]] を更新。 ### Pingmesh: A Large-Scale System for Data Center Network Latency Measurement and Analysis(Chuanxiong Guo ほか、SIGCOMM 2015)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[サイレントパケットドロップ検知]](Pingmesh の中心的貢献であるパケットブラックホール・ランダムサイレントドロップの2分類と検知アルゴリズムを集約。R-Pingmesh の5-tupleローテーション設計との横断的知見を含む)。 - 更新 concept 2 件: [[ネットワーク監視]](全サーバ常時参加という設計選択が SkyNet の multi-source integration 論に10年先行していたことを追加)・[[データセンターネットワーク信頼性]](SNMPカウンタの信頼性限界とハードウェア冗長性の裏をかくサイレント障害という知見を追加)。 ### M2-MFP: A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure(Hongyi Xie ほか、KDD 2025)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[メモリ障害予測]](DIMM の Correctable Error ログから障害を予測する領域。BSFE の階層的空間表現・Time-Patch/Time-Point 二経路設計を軸に、seed 段階で未解決の問いを蓄積)。 - 更新 concept 1 件: [[障害予測]](ハードウェア障害予測の系譜に「メモリ(DRAM)」を追加。HDD/GPU/光トランシーバーと比較した特徴設計の抽象度の進化、時間粒度を分けた相補的統合という設計パターンの知見を追記)。 ### ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production(Yuxing Xiang ほか、Peking University / Alibaba Group、NSDI '26)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[LLMサービングワークロード特性化]](クライアント分解による因果モデリングを中心概念として集約。到着バースト性・入出力長分布・マルチモーダル異質性・推論モデルのreason/answer分離を横断)。 - 更新 concept 2 件: [[Prefill-Decode分離]](ワークロード生成精度がPD構成評価の結論を左右するという新知見、クライアント分解による因果モデリングの視点を追加)・[[ワークロードの特性の把握]](LLMサービングドメインで「誰が(クライアント)」の軸が因果モデリングの単位へ格上げされている知見を追加)。 ### The Flux Operator(Vanessa Sochat, Aldo Culquicondor, Antonio Ojea, Daniel Milroy、arXiv 2023)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[収束コンピューティング]](HPC とクラウドネイティブの技術的収束を扱う概念。Flux Operator を具体例に、収束型システム管理との用語衝突に関する注記を含む)。 - 更新 concept 1 件: [[Kubernetesオペレータ]](Flux Operator を「HPC ワークロードマネージャ全体を運用自動化する Operator」の事例として追加。既存ソースが報告する Operator バグリスクと、Flux Operator が示す抽象化の利点という 2 つの側面を横断的知見として追記)。 ### DeepServe: Serverless Large Language Model Serving at Scale(Junhao Hu ほか、Huawei Cloud / Peking University、USENIX ATC '25)(2026-08-19 ingest-paper) - 更新 concept 3 件: [[Prefill-Decode分離]](PD分離/PD同居の優劣をヒートマップ実測から導出しリクエスト単位で動的に切り替えるselect-tes-PD-heatmapポリシー、選択の非対称な利得・損失分布という新知見を追加)・[[KVキャッシュ管理]](Relational Tensor Cacheによる同期照合/非同期取り込みの分離、radix-tree+IDベースのハイブリッドインデックスという新知見を追加)・[[モデルスケーリング高速化]](pre-warming+DRAM事前ロード+NPU-forkの多層防御設計、Ascend HCCS/RoCEでのNPU-fork実測によりBlitzScale型チェーン転送のハードウェア非依存性を補強)。 ### WVA: A Global Optimization Control Plane for llmd(Abhishek Malvankar ほか、IBM Research / University of Bologna、arXiv 2026)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[オートスケーリング]](Kubernetes HPA の資源中心設計が LLM 推論に不適合な理由と、汎用オートスケーラのコアへドメイン固有ロジックを埋め込まず拡張レイヤーとして重ねる設計原則を集約)。 - 更新 concept 1 件: [[LLMサービング管理]](WVA の headroom ベースオートスケーリングと PreServe のワークロード予測ベース事前起動が、同じ trilemma に異なる時間軸・シグナルで対処する並行した設計解であるという横断的知見を追加)。 ### Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol(Vasundra Srinivasan、arXiv 2026)(2026-08-19 ingest-paper) - 更新 concept 2 件: [[AIゲートウェイ]](CABP の6段責務が agentgateway 等の製品機能と独立に収束したこと、ブローカーの恒久性主張を追加)・[[エージェント運用安全性]](MCP ブローカー層でのツールレベル ACL 強制がプロトコル層の verification gate 実例であること、脅威モデル T1-T4 を追加)。 ### Envoy AI Gateway ブログ記事3件(公式ブログ)(2026-08-19 ingest) - 更新 concept 1 件: [[AIゲートウェイ]]([[agentgateway]](新規統合Rustプロキシ)と Envoy AI Gateway(既存Envoyエコシステム拡張)という2つの異なる出自の実装アプローチの対比、MCPセッション状態配置の設計軸(エンコードして無ステート化 対 集約ストア一元管理)、自ホスト型モデルサービング層との統合方針の違いを追加)。 ### Blending Containers and Virtual Machines: A Study of Firecracker and gVisor(Anjali+, VEE 2020)(2026-08-19 ingest-paper) - 更新 concept 2 件: [[コンテナ仮想化]](「機能をホストカーネルから移動させる」設計が必ずしもホストカーネルコード実行量の削減につながらないことをVEE '20の実測で追加)・[[Lightweight Sandboxing]](実行コード量とホスト呼び出し頻度が乖離しうるという、性能代理指標とセキュリティ代理指標の不一致を追加)。 ### Reading postmortems(Dan Luu、danluu.com)(2026-08-19 ingest) - 更新 concept 3 件: [[ポストモーテム]](実務者が観測した障害原因5分類、「ops smell」視点を追加)・[[設定ミス脆弱性]](公開ポストモーテムの約50%が設定変更起因という実務規模の裏付け、コード変更とのロールアウト慎重さの非対称を追加)・[[人的要因]](「ops smell」という事前設計への疑いの視点、人的エラー過小報告の逆説を追加)。 ### Simple Testing Can Prevent Most Critical Failures: An Analysis of Production Failures in Distributed Data-Intensive Systems(Yuan+, OSDI 2014)(2026-08-19 ingest-paper) - 更新 concept 2 件: [[分散システム障害]](エラーハンドリングコードの実証分析が本ページ集約の実証研究群より10年近く早く「原因分類」から「発現連鎖」へ視点を移した先駆けであること、top-down障害注入とbottom-upエラーハンドリング解析の方法論的対立軸、再現困難性という通念を覆す実証データを追加)・[[非致命的RPCエラー]](Uber の非致命的RPCエラー分析と、10年早いエラーハンドリングコードのバグとしての定量化との二面性を追加)。 ### Collie: Finding Performance Anomalies in RDMA Subsystems(Kong+, NSDI 2022)(2026-08-19 ingest-paper) - 更新 concept 2 件: [[RDMA]](RDMA サブシステムの性能異常がネットワークプロトコル層だけでなくホスト側ハードウェアの相互作用からも生じること、verbs API という狭いウエストの抽象を使った探索空間構築、性能/診断カウンタによる非侵襲的なデプロイ前探索を追加)・[[RDMAネットワーク監視]](既存の監視三系統(能動プローブ・受動トラフィック・フルスタック計装)に「デプロイ前の事前探索」という第四の時間軸を追加、Collie が発見する異常の根本原因が主に NIC/DPU 層に集中することを追加)。 ### Hostping: Diagnosing Intra-host Network Bottlenecks in RDMA Servers(Liu+, NSDI 2023)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[ホスト内ネットワークボトルネック]](RNIC-エンドポイント間の PCIe/メモリチャネル/UPI で発生するホスト内部のボトルネック。binary network tomography のホスト内適用、症状の2分類(帯域劣化・レイテンシ増加)、誤設定(ACS/ATS)がハードウェア障害と同水準の深刻さを持つことを集約)。 - 更新 concept 2 件: [[RDMAネットワーク監視]](診断対象がネットワーク層からホスト内部へ降りる第五の層としての Hostping、binary network tomography のホスト内層への継承、誤設定という新しい根本原因クラスを追加)・[[RDMA]](RNIC 線速の急増に PCIe 帯域の伸びが追いつかずホスト内部が新たなボトルネック源になるという知見を追加)。 ### Understanding RDMA Microarchitecture Resources for Performance Isolation(Kong+, NSDI 2023)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[マルチテナントRDMA性能分離]](パブリッククラウドで複数テナントが同一 RNIC を共有する際の性能分離。RNIC マイクロアーキテクチャリソース(NIC キャッシュ・処理ユニット・PCIe 帯域)の分類、control/data verb・エラー処理の3種の消費パターン、既存分離機構(SR-IOV・HW TC・Justitia)がいずれも不十分であるという知見を集約)。 - 更新 concept 2 件: [[RDMA]](Collie と Husky が同一著者陣により「性能異常の発見」から「性能分離の破壊」へ発展したこと、SR-IOV が architectural resource は分離できてもマイクロアーキテクチャリソースは分離できないことを追加)・[[RoCE設計課題]](関連 concept として [[マルチテナントRDMA性能分離]] へのリンクを追加)。 ### Understanding the Micro-Behaviors of Hardware Offloaded Network Stacks with Lumina(Yu+, SIGCOMM 2023)(2026-08-19 ingest-paper) - 新規 concept 1 件: [[ハードウェアオフロードネットワークスタックのテスト]](RDMA NICのようなカーネルバイパス型ネットワークスタックの正しさ・性能テスト。プログラマブルスイッチによるin-network決定論的イベント注入と全パケットミラーリングというLuminaの設計を集約)。 - 更新 concept 2 件: [[RDMA]](Collie/Huskyの「性能異常発見」とLuminaの「仕様準拠性検証」という補完的な2方向のRNICテスト手法、ソフトウェアシムレイヤーがハードウェアスタックに使えないこと、先行研究の楽観的評価をLuminaの精密計測が覆した事例を追加)・[[RDMAネットワーク監視]](デプロイ後の「仕様準拠性検証」という第五の時間軸、LuminaのNoisy neighborとHawkeyeのPFC連鎖が現象として類似するが原因層が異なることを追加)。 ### TIMELY: RTT-based Congestion Control for the Datacenter(Mittal+, SIGCOMM 2015)(2026-08-19 ingest-paper) - 更新 concept 2 件: [[データセンター輻輳制御]](TIMELY セクションを拡充し、DCQCN/DCTCPとの対比・遅延ベース輻輳制御の再評価という横断的知見3件、TIMELY自身が残す将来課題を未解決の問いとして追加)・[[TCP輻輳制御アルゴリズム]](Vegas/FAST/Compoundという遅延ベース系譜がデータセンターでNIC進化により再評価されたという横断的知見を追加)。 ### Revisiting Network Support for RDMA(Mittal+, SIGCOMM 2018)(2026-08-19 ingest-paper) - 更新 concept 3 件: [[RDMA]](PFC が RoCE の性能に必須ではなく現行 NIC 設計のアーティファクトにすぎないことを 2018 年時点で実証していた点、iWARP の設計思想は正しかったが実装選択が敗因だったという定量的裏付けを追加)・[[データセンター輻輳制御]](「PFC 無効化で性能が壊滅する」のは go-back-N という NIC 側の実装に起因するのであって輻輳制御アルゴリズム自体の宿命ではないという知見を追加)・[[RoCE設計課題]](Hoefler+ 2023 が体系化する8項目のうち問題1・2・3が、2018年時点でNICのみの変更(プロトコル全体の再設計なし)で解消可能だと既に実証されていたという知見、技術的実証から業界の課題体系化まで5年の遅延があったことを追加)。 ### RDMAネットワークアーキテクチャ基礎 - IB/RoCE 編 -(Kobayashi, SpeakerDeck 2023-06-02)(2026-08-20 ingest-slides) - 新規 concept 1 件: [[InfiniBand]](IBA のサブネット・Subnet Manager・HCA・物理層データレート・プロトコルスタック・LID/GID・パケットヘッダ・Virtual Lane・トランスポートサービス4分類を体系的に集約)。 - 更新 concept 2 件: [[RDMA]](QPのメモリモデル(SQ/RQ/CQ+WQE)がCollie/Huskyのverbs API探索空間の基礎であること、RC/UDのみが実運用で使われるトランスポートサービスであることを追加)・[[RoCE設計課題]](PFCのHead-of-Line BlockingとLossless/Semi-lossless/Lossy-1/Lossy-2という運用構成スペクトラム、DCB(ETS+PFC+CN)とRoCEv1/v2で異なる優先度フィールド(PCP/DSCP)を追加)。 ### AIのための Ethernet技術動向 (SerDes) — 400 Gb/s/レーンに向けた物理層の課題と考察(Kobayashi, SpeakerDeck 2026-08-17)(2026-08-20 ingest-slides) - 新規 concept 3 件: [[400Gbpsレーン (SerDes)|400 Gb/s/レーン (SerDes)]](448G/P802.3dvの標準化状況、PAM4/6/8トレードオフ、inner FEC論点、団体分業を集約)・[[Co-Packaged Copper (CPC)]](銅の延命策、CPCチャネル帯域改善、前面パネルフォームファクタ論点)・[[ビーチフロント制約]](I/O帯域密度制約、ラック配線本数の帯域上限)。 - 更新 concept 2 件: [[光トランシーバー電力方式]](TRO段階を含むpJ/bit定量比較、NVIDIAのCPO主張、LRO展開名の資料間食い違いをcontradiction calloutで追記)・[[Ultra Ethernet]](LLRバッファ量とPHY固有遅延・クラスタ物理サイズの定量的関係を追記)。 ### RDMATracer: A scalable eBPF-based framework for tracing RDMA syscalls(Gupta+, NAIC '26)(2026-08-20 ingest-paper) - 更新 concept 3 件: [[eBPF]](戻り値ゲート型の常時稼働キャプチャという新しい応用軸、稀少な相関バグの本番診断という第三の目的軸を追加)・[[RDMA]](RNICのブラックボックス性とは別のソフトウェアテレメトリ欠落という不可視性、verbs層の薄さと障害伝播無防備のトレードオフを追加)・[[RDMAネットワーク監視]](カーネルverbs/ドライバ層への戻り値ゲート型eBPF計装という第七の計装軸、対象が性能異常からNICドライバのカーネルバグへ移ることを追加)。 ### NetEdit: An Orchestration Platform for eBPF Network Functions at Scale(Benson+, SIGCOMM 2024)(2026-08-20 ingest-paper) - 更新 concept 2 件: [[eBPF]](verifier 通過後の寿命管理・順序付けを上書きするオーケストレーション層、struct_ops CCA と cache_ext の拡張面の対応)・[[データセンター輻輳制御]](ホスト eBPF による CCA 差し替えという第三の配備経路)。 ### Logarithm: A logging engine for AI training workflows and services(Meta Engineering Blog, 2024-03-18)(2026-08-20 ingest) - 新規 concept 1 件: [[AI訓練ログデバッグ]](rank ID メタデータ・filter-by-call-site・rank 横並び比較・連続モデルテレメトリのログ化)。 - 更新 concept 3 件: [[GPU観測性]](ログベースのモデルテレメトリを GPU 計装の相補レイヤーとして追加)・[[LLM学習モニタリング]](モデル収束デバッグ用の継続ログ化という並立軸)・[[ログ解析]](100+GB/s 規模の産業参照実装として Logarithm を追加)。 ### Resilience and Stability of Ecological Systems(Holling, Ann. Rev. Ecol. Syst. 1973)(2026-08-22 ingest-paper) - 新規 concept 1 件: [[レジリエンス]](状態変数・駆動変数・パラメータの変化を吸収して関係性を維持する能力。平衡への回帰性を測る安定性とは独立した性質として定義。アトラクターの領域という概念と対になる)。 ### Blameless PostMortems and a Just Culture(Allspaw, Etsy Code as Craft 2012-05-22)(2026-08-22 ingest) - 新規 concept 1 件: [[Just Culture]](安全性と説明責任のバランスを取る取り組み。Dekker の Bad Apple Theory への対抗概念として Etsy が実務導入。免責でなく処罰の恐れの除去による説明責任の実現)。 - 更新 concept 1 件: [[ポストモーテム]](「ブレームレスポストモーテム」用語の起源が2012年 Etsy 記事であり、2016〜2018年 Gallego 講演がその理論的体系化にあたるという横断的知見を追加)。 ### ネットワークシステムについて語るときに我々の語ること(Peterson & Davie、ラムダノート 2026)(2026-08-22 ingest-book) - 新規 concept 20 件: [[5Gモバイルネットワーク]]・[[GitOps]]・[[QUIC]]・[[エレガンス(システム設計)]]・[[オープンソースソフトウェア開発]]・[[システムズアプローチ]]・[[ゼロトラスト]]・[[ソフトウェア定義ネットワーク]]・[[トランスポートプロトコル設計]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク仮想化]]・[[ネットワーク自動化]]・[[パスキー認証]]・[[ブロックチェーン]]・[[プログラマブルデータプレーン]]・[[反復可能性]]・[[砂時計モデル]]・[[量子計算]]・[[集権化と非集権化]] - 更新 concept 32 件: [[LLMのハルシネーション]]・[[LLM意味表象]]・[[LLM算術機構]]・[[TCP接続局所性]]・[[TCP輻輳制御アルゴリズム]]・[[インターネットスケールサービス設計]]・[[インバンドネットワークテレメトリ]]・[[エニキャストルーティング]]・[[エンドツーエンド論]]・[[オブザーバビリティ]]・[[オープンLLM開発]]・[[クラウドスケールRPC特性]]・[[サービスメッシュ]]・[[スマートNICオフロード]]・[[セキュリティカオスエンジニアリング]]・[[データセンター輻輳制御]]・[[トレードオフ意思決定]]・[[ドメイン固有アーキテクチャ]]・[[バッファブロートとキュー管理]]・[[ユーザーレベルTCPスタック]]・[[分散コンセンサス]]・[[分散コンピューティングの誤謬]]・[[性能を意識した設計]]・[[技術的負債]]・[[抽象化(ソフトウェア設計)]]・[[最終目標なき設計]]・[[脆弱性バジェット]]・[[複雑ネットワーク]]・[[設定ミス脆弱性]]・[[設計の一貫性]]・[[設計要件の確立]]・[[通常設計と急進的設計]] ### Principles of Computer System Design - An Introduction, Part II(Saltzer & Kaashoek、MIT OpenCourseWare 2009)(2026-08-22 ingest-book) - 新規 concept 7 件: [[セキュリティ設計原則]]・[[バージョン履歴]]・[[信頼計算基盤(TCB)]]・[[情報フロー制御]]・[[永続性のマントラ]]・[[認可モデル]]・[[調停(Reconciliation)]] - 更新 concept 22 件: [[Capability-based Security]]・[[TCP輻輳制御アルゴリズム]]・[[エンドツーエンド論]]・[[クォーラムベースレプリケーション]]・[[クラッシュリカバリ]]・[[クロック同期と信頼性]]・[[システム信頼性モデル]]・[[ゼロトラスト]]・[[トランスポートプロトコル設計]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ハードディスク信頼性]]・[[パスキー認証]]・[[フォールトトレランス]]・[[メモリ階層とキャッシュ]]・[[ロストアップデートと書き込みスキュー]]・[[信頼性工学]]・[[分散トランザクション]]・[[外部一貫性]]・[[直列化可能性]]・[[結果整合性]]・[[複製ステートマシン]] ### Computer Networks - A Systems Approach(Peterson & Davie、6th Edition 2020)(2026-08-22 ingest-book) - 新規 concept 7 件: [[MPLS]]・[[オーバーレイネットワーク]]・[[コンテンツ配信ネットワーク]]・[[フレーミング]]・[[誤り検出符号]]・[[適応ビットレートストリーミング]]・[[階層的ルーティングとアドレス集約]] - 更新 concept 17 件: [[5Gモバイルネットワーク]]・[[QUIC]]・[[インバンドネットワークテレメトリ]]・[[エニキャストルーティング]]・[[クラウドコンピューティング]]・[[クラウドスケールRPC特性]]・[[システムズアプローチ]]・[[ソフトウェア定義ネットワーク]]・[[データセンター輻輳制御]]・[[ネットワーク仮想化]]・[[ネットワーク監視]]・[[ネットワーク自動化]]・[[バイナリエンコーディング]]・[[バッファブロートとキュー管理]]・[[一貫性ハッシュ法]]・[[待ち行列理論]]・[[砂時計モデル]] ### The Real Internet Architecture - Past, Present, and Future Evolution(Zave & Rexford、Princeton University Press 2024)(2026-08-22 ingest-book) - 新規 concept 7 件: [[サブダクション]]・[[セッションアーキテクチャ]]・[[ネットワークの一様記述モデル]]・[[ブリッジング]]・[[モジュラー検証]]・[[レイヤリング]]・[[硬直化(ossification)]] - 更新 concept 15 件: [[5Gモバイルネットワーク]]・[[MPLS]]・[[QUIC]]・[[エニキャストルーティング]]・[[エンドツーエンド論]]・[[オーバーレイネットワーク]]・[[セキュリティ設計原則]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク仮想化]]・[[プロキシとエージェント]]・[[命名]]・[[形式手法]]・[[軽量形式手法]]・[[階層的ルーティングとアドレス集約]] ### LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures(Zhang, Feng, Pei+, arXiv 2026-08)(2026-08-23 ingest-paper) - 新規 concept 1 件: [[エージェント障害帰属]] - 更新 concept 1 件: [[エージェント修復]] ### ChainCraft: Bridging Causal Discovery and LLM Reasoning for Failure Prediction in Microservices(Zhao, Sun+, ISSRE 2026)(2026-08-23 ingest-paper) - 更新 concept 3 件: [[障害予測]]・[[因果発見]]・[[LLMによる根本原因分析]] ### Over the Memory Wall, Into the Instruction Wall: The New Bottleneck in GPU Data Processing(Hepkema, Wu, Kozyrakis, Chronis, Alonso、arXiv 2026-08)(2026-08-23 ingest-paper) - 更新 concept 5 件: [[Rooflineモデル]]・[[GPU占有率(Occupancy)]]・[[Instruction-Level Parallelism (GPU)]]・[[GPU観測性]]・[[メモリウォール]] ### Software-Defined Networks: A Systems Approach(Peterson, Cascone, O'Connor, Vachuska, Davie、Systems Approach 2021)(2026-08-23 ingest-book) - 新規 concept 2 件: [[ソフトウェア定義アクセスネットワーク]]・[[ネットワークオペレーティングシステム]] - 更新 concept 19 件: [[5Gモバイルネットワーク]]・[[インバンドネットワークテレメトリ]]・[[オーバーレイネットワーク]]・[[オープンソースソフトウェア開発]]・[[コンテナネットワーク分離]]・[[システムズアプローチ]]・[[ソフトウェア定義ネットワーク]]・[[データセンターL2ファブリック]]・[[データセンターネットワークトポロジ]]・[[ネットワーク仮想化]]・[[ネットワーク自動化]]・[[フィードバックループ]]・[[プログラマブルデータプレーン]]・[[レイヤリング]]・[[分散コンセンサス]]・[[抽象化(ソフトウェア設計)]]・[[負荷分散]]・[[階層的ルーティングとアドレス集約]]・[[集権化と非集権化]] ### ウェブオペレーション ―サイト運用管理の実践テクニック(Allspaw・Robbins 編、角 征典 訳、オライリー・ジャパン 2011)(2026-08-23 ingest-book) - 新規 concept 12 件: [[Apdex]]・[[エンドユーザメトリクス]]・[[キャパシティ計画]]・[[コミュニティマネジメント]]・[[データ保護]]・[[ハイブリッドクラウド]]・[[バッチサイズ]]・[[プラクティスのコミュニティ]]・[[リアルユーザモニタリング]]・[[事業継続計画(BCP)]]・[[統合監視]]・[[継続的デプロイ]] - 更新 concept 61 件: [[CAP定理]]・[[DevOps]]・[[Infrastructure as Code]]・[[Just Culture]]・[[SRE組織変革]]・[[アクショナブルアラート]]・[[アラートアンチパターン]]・[[アラート疲労]]・[[アラート管理]]・[[イテレーションの長さ]]・[[イミュータブルインフラストラクチャ]]・[[インシデントレポート執筆]]・[[インシデント管理]]・[[インメモリデータベース]]・[[オンコール]]・[[オンコールストレス管理]]・[[クラウドコンピューティング]]・[[クラウドモニタリング]]・[[クロスインシデント分析]]・[[グレイ障害]]・[[コンテンツ配信ネットワーク]]・[[ゴシッププロトコル]]・[[スケーラビリティ障害]]・[[ソシオテクニカル負債]]・[[ソフトウェア変更管理]]・[[ダッシュボードとランブックの運用]]・[[データセンター信頼性]]・[[データベースリライアビリティエンジニアリング]]・[[データベース性能トラブルシューティング]]・[[ビジネスモニタリング]]・[[フィーチャーフラグ]]・[[ポストモーテム]]・[[ポランニーのパラドックス]]・[[マルチテナンシーのためのシャーディング]]・[[マルチリーダーレプリケーション]]・[[メトリクス削減]]・[[リーダーレスレプリケーション]]・[[レイテンシ分析]]・[[レプリケーションラグと読み取り整合性]]・[[ログ生成]]・[[ログ解析]]・[[ワークフロー自動化]]・[[一貫性ハッシュ法]]・[[二次インデックスのシャーディング戦略]]・[[分散キャッシュ]]・[[分散ストレージ]]・[[単一リーダーレプリケーション]]・[[可用性]]・[[変更起因インシデント]]・[[専用データベースシステム]]・[[専門職化と資格認定]]・[[差分可観測性]]・[[心理的安全性]]・[[技術的負債]]・[[時系列データベース]]・[[時系列トラフィックパターン検知]]・[[暗黙知]]・[[潜在的障害]]・[[継続的ベリフィケーション]]・[[複雑システム障害論]]・[[認知的徒弟制]] ### A Political Scientist's Insights into Site Reliability Engineering(Michael Krax, SREcon21 2021-10-12)(2026-08-23 ingest-slides) - 新規 concept 2 件: [[政治学とSRE]]・[[ルーマンの社会システム理論とSRE]] - 更新 concept 2 件: [[ゲーム理論とSRE]]・[[複雑システム障害論]] ### Trade-Offs Under Pressure: Heuristics and Observations of Teams Resolving Internet Service Outages(John Allspaw, Lund University MSc Thesis 2015)(2026-08-23 ingest-paper) - 新規 concept 1 件: [[診断ヒューリスティック]] - 更新 concept 2 件: [[Joint Activity]]・[[複雑システム障害論]] ### Measuring Reliability Culture to Optimize Tradeoffs: Perspectives from an Anthropologist(Kathryn Bouskill, SREcon24 Americas 2024-03-20)(2026-08-23 ingest-video) - 更新 concept 1 件: [[SRE文化]] — 人類学的インサイダー/アウトサイダー・レンズによる信頼性文化の定量測定方法論、評価制度改定を通じたヒロイズム批判への処方箋を追記。 ### Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems(Ruiming Lu 他, USENIX ;login: online 2023-02-06)(2026-08-23 ingest-paper) - 更新 concept 3 件: [[フェイルスローハードウェア]](統計的検知 vs 因果的注入検証の分業、単一障害局在という発見の相互裏付けを追記)・[[グレイ障害]](PERSEUS を Observer/App 非対称性の運用実装例として追記、Harp との「比較粒度」原則の一致を追記)・[[異常検知]](固定閾値の文脈依存的破綻という同社2017年知見のハードウェアテレメトリでの再発見を追記) ### Scaling Telemetry Workloads in Cloud Applications(Yuuki Tsubouchi, Kyoto University 博士論文 2025-03)(2026-08-23 ingest-thesis) - 更新 concept 19 件: [[Scaling Telemetry Workloads]](3 層モデルの定義 + §6.2 設計指針・§6.3 将来方向)・[[テレメトリ]](time-oriented / path-oriented の定義、3 層モデル×OSS/SaaS 製品地図)・[[オブザーバビリティ]](博士論文の道具的定義と Observability Engineering の抽象度の違い)・[[クラウド障害ライフサイクル]](fault/error/failure/incident 連鎖と TTX の対応)・[[マイクロサービスアーキテクチャ]]・[[分散トレーシング]](socket ベース計装の系統と許容遅延の設計比較)・[[eBPF]](verifier 非保証のデータ競合対策)・[[eBPFマップ]](per-CPU ハッシュのトレードオフ)・[[ネットワーク依存性発見]](リレー可視性・束ね率のスケール限界)・[[トレーシングオーバーヘッド]](カーネル計装と Java エージェントの計測単位差)・[[マイクロサービスコールグラフ]]・[[時系列データベース]](バックプレッシャー設計の実運用検証)・[[アーカイバルストレージ]](hot→warm tiering と warm→cold アーカイブの対比)・[[特徴量削減]](RR/RF の規模依存トレードオフ)・[[変化点検知]](セグメントサイズを逆数和で測る設計)・[[Fault Localization]](削減指標 BA と箇所特定指標 AVG@5 の R² ギャップ)・[[メトリクス削減]](分析層の削減限界と収集層削減の依存関係)・[[カーネル密度推定]](帯域幅の理論的重要性と下流タスクでの鈍感さの乖離)・[[マイクロサービスベンチマーク]](サービス数軸と独立な「メトリクス粒度」軸)。 ### Security Engineering 3rd Edition(Ross Anderson, Wiley 2020)(2026-08-23 ingest-book) - 新規 concept 57 件: [[CAPTCHA]]・[[DRM(デジタル著作権管理)]]・[[GNSS測位の脆弱性]]・[[HSM APIセキュリティ]]・[[SIMスワップ攻撃]]・[[Signalプロトコル]]・[[アクセサリ制御]]・[[サイドチャネル攻撃]]・[[サイバー犯罪の産業化と分業]]・[[サービス妨害攻撃とネットワークプロトコルの悪用]]・[[セキュリティにおけるインセンティブ不整合]]・[[セキュリティにおける命名]]・[[セキュリティの持続可能性]]・[[セキュリティエンジニアリングチームの管理と組織的リスク]]・[[セキュリティ工学の分析フレームワーク]]・[[セキュリティ経済学]]・[[セキュリティ評価制度]]・[[ソフトウェア開発方法論(ウォーターフォールからアジャイルへ)]]・[[ソーシャルエンジニアリングとフィッシング]]・[[テロリズムの政治学と心理学]]・[[トラステッド実行環境(TEE)]]・[[パスワードのユーザビリティ]]・[[ヒューリスティックとバイアス]]・[[フルディスク暗号化]]・[[ブロック暗号設計原則]]・[[マルチラテラルセキュリティ]]・[[ランダムオラクルモデル]]・[[リスク分析とハザード分析手法]]・[[公開鍵暗号方式]]・[[医療記録プライバシー]]・[[匿名化の失敗と再識別]]・[[国家監視の歴史と法制度]]・[[多層セキュリティ(MLS)]]・[[封印と偽造防止印刷]]・[[情報戦]]・[[情報経済学]]・[[投機的実行とマイクロアーキテクチャサイドチャネル(Meltdown・Spectre)]]・[[敵対者の類型論]]・[[暗号利用モード]]・[[暗号戦争]]・[[検閲とコンテンツモデレーション]]・[[物理複製困難関数(PUF)]]・[[生体認証]]・[[秘密分散]]・[[統計的開示制御]]・[[耐タンパ性]]・[[脆弱性ライフサイクルと協調的な脆弱性開示]]・[[自動運転車のセキュリティ]]・[[複式簿記による内部統制]]・[[計量システムの脅威モデル]]・[[認証プロトコルの失敗モード]]・[[認証局とPKIの信頼モデル]]・[[誤報率と検知率のトレードオフ]]・[[運用セキュリティ(OPSEC)とトレードクラフト]]・[[選挙システムのセキュリティ]]・[[鍵配送プロトコル]]・[[電子透かしと著作権マーキング]]。 - 更新 concept 21 件: [[Capability-based Security]]・[[DevOps]]・[[アラート疲労]]・[[クロック同期と信頼性]]・[[ゲーム理論とSRE]]・[[セキュリティ設計原則]]・[[ゼロトラスト]]・[[データのプライバシーと同意]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク監視]]・[[パスキー認証]]・[[ブロックチェーン]]・[[ポリシー]]・[[信頼計算基盤(TCB)]]・[[信頼関係]]・[[分散システム障害]]・[[差分プライバシー]]・[[技術的負債]]・[[敵対的摂動]]・[[権力集中リスク]]・[[認可モデル]]。 ### Controlling the Costs of Coordination in Large-scale Distributed Software Systems(Laura Maguire, The Ohio State University 博士論文 2020)(2026-08-23 ingest-thesis) - 新規 concept 4 件: [[Adaptive Choreography]]・[[協調コスト]]・[[プロセストレーシング]]・[[クリティカルデジタルインフラ]]。 - 更新 concept 8 件: [[Joint Activity]]・[[Common Grounding]]・[[アノマリー応答]]・[[Incident Commander]]・[[Followship]]・[[Multi-Party Dilemma]]・[[ChatOps]]・[[インシデント管理]]。 ### High-Resolution Measurement of Data Center Microbursts(Qiao Zhang 他, IMC '17 2017-11-01)(2026-08-23 ingest-paper) - 新規 concept 1 件: [[マイクロバースト]] — µburstの定義、粗粒度測定における相関の弱さがバーストの積算アーティファクトであるという知見、バースト到着の自己相関(マルコフモデル)を蓄積。 - 更新 concept 1 件: [[データセンター輻輳制御]] — µburst実測が示す1 RTT未満の低遅延輻輳シグナルの必要性、[[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]]との「バーストの同期的挙動」への独立到達を追記。 ### Mathematics for Computer Science(Lehman・Leighton・Meyer、MIT OpenCourseWare 2015)(2026-08-23 ingest-book) - 新規 concept 55 件: [[オイラーの公式]]・[[グラフ彩色]]・[[シンプソンのパラドックス]]・[[トポロジカルソート]]・[[マッチング]]・[[ランダムウォーク]]・[[不変条件]]・[[二項係数]]・[[二項分布]]・[[二項関係]]・[[信頼水準]]・[[停止性問題]]・[[充足可能性問題(SAT)]]・[[公理的方法]]・[[再帰的データ型]]・[[分割統治]]・[[分散]]・[[包除原理]]・[[半順序]]・[[単純グラフ]]・[[合同算術]]・[[同値関係]]・[[命題論理]]・[[和の近似]]・[[四段階法]]・[[安定結婚問題]]・[[定常分布]]・[[対角線論法]]・[[帰納法]]・[[平面グラフ]]・[[形式的べき級数]]・[[数え上げ]]・[[整列原理]]・[[最大公約数]]・[[有向グラフ]]・[[期待値]]・[[木(グラフ理論)]]・[[条件付き確率]]・[[母関数]]・[[漸化式]]・[[漸近記法]]・[[濃度]]・[[状態機械]]・[[独立性]]・[[相互結合網]]・[[確率変数]]・[[確率空間]]・[[素数]]・[[証明]]・[[誕生日原理]]・[[調和数]]・[[述語論理]]・[[関数]]・[[集合]]・[[鳩の巣原理]]。 - 更新 concept 4 件: [[集中不等式]](機械学習理論の文脈で作られた既存ページに第 19 章のマルコフ・チェビシェフ・チェルノフ限界を積み増し、分野をまたぐ比較表を更新)・[[公開鍵暗号方式]](第 8 章の RSA の数論的基盤を追記)・[[PageRank]](第 20 章を 4 件目のソースとして追加し、定常分布としての定義を明示)・[[データセンターネットワークトポロジ]](第 10 章の離散数学によるトポロジ定式化と実運用 Fat-Tree / Clos の関係を追記)。 ### A Microscopic View of Bursts, Buffer Contention, and Loss in Data Centers(Ghabashneh 他, IMC '22 2022-10-25)(2026-08-24 ingest-paper) - 更新 concept 1 件: [[データセンター輻輳制御]] — 単一ポート計測(2017年 Zhang et al.)からホスト分散同期計測(2022年 Millisampler/SyncMillisampler)への進化と、動的しきい値バッファ共有アルゴリズム(DT、α公式)が輻輳制御の「外側」の環境条件を左右するという知見を追記。「輻輳が高いほど損失が多いとは限らない」という非自明な発見(RegA-Typical vs RegA-High)を追加。 ### SRE Book 第 19〜27 章(Google SRE、O'Reilly 2016)(2026-08-24 ingest-book) - 新規 concept 7 件: [[過負荷制御]](過負荷を「棄却の設計問題」として扱う — 何を単位に測り、誰が、何を基準に、どれだけ棄却するか)・[[カスケード障害]](正のフィードバックとしての障害。負荷を戻すだけでは回復しない非対称性)・[[レイムダック状態]](healthy / refusing connections / lame duck の 3 状態と SIGTERM 経由の安全な停止)・[[分散cron]](べき等でない周期ジョブを分散環境で確実に一度だけ実行する問題)・[[周期パイプライン]](周期実行という設計選択が持つ構造的な脆さと継続処理への移行)・[[データ完全性]](可用性と独立の目標であり、達成手段は「復旧できること」の継続的な検証)・[[ローンチチェックリスト]](チェックリストは官僚的手続きではなく組織の記憶であり、維持する専任職能が要る)。 - 更新 concept 14 件: [[負荷分散]](第 19 章の DNS 層 / VIP 層の 2 段構え、第 20 章のサブセット化と重み付けの分離)・[[エニキャストルーティング]](権威 DNS ネームサーバー自体へのエニキャスト適用)・[[Webロードバランシング]](2011 年サーベイの OSI 層分類と実運用の DSR → GRE カプセル化移行の対比)・[[グレースフルデグレーデーション]](「使われないコードパスは動かないコードパス」という実装固有リスク)・[[メタ安定障害]](SRE Book 第 22 章が HotOS 2021 の理論的定式化に 5 年先行する現場記述であるという対応関係)・[[障害緩和]](第 22 章の「ヘルスチェック停止」という他分類にない手段)・[[分散コンセンサス]](第 23 章のアドホックな合意による本番障害 3 件と運用面、第 24 章の「合意を使う側の設計」)・[[クォーラムベースレプリケーション]](地理的に不均一な RTT でのクォーラム脆弱性・階層クォーラム・クォーラムリース)・[[分散合意プロトコル]](Multi-Paxos のリーダー送出帯域ボトルネックとディスク書き込みレイテンシ、dueling proposers への実務的対処)・[[べき等性]](cron の「外部状態照会によるべき等性要件の回避」という第 4 の方針と fail closed)・[[データ保護]](既存の RTO/RPO 論と第 26 章の「復旧が目的」原則の突き合わせ)・[[グレイ障害]](out-of-band データ検証と Observer/App 非対称性の接続)・[[キャパシティ計画]](ローンチスパイクの不確実性と冗長性 headroom)・[[フィーチャーフラグ]](フレームワークの汎用要件 6 項目、UI / ビジネスロジック 2 系統、休眠機能)。 ### アクセラレータ間通信の実際(上野裕一郎・Preferred Networks、MPLS Japan 2024)(2026-08-24 ingest-slides) - 更新 concept 2 件: [[集合通信]](PCIe SW 論理分割による NCCL の NIC 選択偏りの実運用事例、Ring-AllReduce の一筆書き経路によるノード間 NIC 全二重通信の活用)・[[RDMA]](Peer Memory Direct の実運用チェックリストとして PCIe Switch の DMA 折り返し可否・GPU-NIC affinity の確認を追加)。 ### Scalable Hierarchical Aggregation Protocol (SHArP)(Richard L. Graham ほか、Mellanox、COM-HPC 2016)(2026-08-24 ingest-paper) - 新規 concept 1 件: [[インネットワーク集約]] — SHArP を軸に、集約木の論理・物理分離、end-point 管理からスイッチングインフラ管理への権限移譲、高 radix スイッチによる浅い縮約木、決定的演算順序の保証、ハードウェアペイロード上限のソフトウェアパイプライン化という 5 つの設計原則を蓄積。 - 更新 concept 2 件: [[集合通信]](NVSHARP/Multimem に代表される現代 GPU 集合通信のハードウェア縮約が、2016 年 InfiniBand SwitchIB-2 の SHArP に系譜を持つという知見を追記)・[[InfiniBand]](SwitchIB-2 内蔵の仮想 TCA としての SHArP Node の実装、RC/UD トランスポートの使い分けを追記)。 ### Could AIs become conscious?(The Economist、2026-08-20)(2026-08-24 ingest) - 新規 concept 3 件: [[AI意識]](AI が意識を持つかという一次的な問いと、AI が意識を持つと人間に見なされることの政治的帰結という二次的な問いを分離する)・[[AI人格権]](限定的な AI の権利付与ですら権力集中を招くという議論、Javier Milei による AI 法人格化の実例)・[[グローバルワークスペース理論]](LLM がモジュール間で情報を循環させるグローバルワークスペース類似の特徴を持つという言及)。 - 更新 concept 2 件: [[権力集中リスク]](AI 人格権の付与が、人間側の主体を介さない第三の権力集中経路になりうるという知見を追記)・[[SFにおけるAI表象]](SF が長らく素材にしてきた「AI に意識はあるか」という問いが現実の政治的争点として立ち上がってきたことを追記)。 ### Verbalizable Representations Form a Global Workspace in Language Models(Wes Gurnee・Nicholas Sofroniew ほか、Anthropic、Transformer Circuits Thread、2026-07-06)(2026-08-24 ingest-paper) - 新規 concept 1 件: [[アラインメント監査]] — J-lens を用いて、脅迫シナリオでの評価認識トークンのアブレーション実験、報酬ハッキング・報酬モデル迎合の2種のモデルオーガニズムで、出力に現れない意図が内部表現に一貫して現れることを示した実証群を蓄積。 - 更新 concept 3 件: [[グローバルワークスペース理論]](The Economist の言及として先に作られていたページに、J-lens/J-space の技術的実証を主内容として大幅加筆。verbal report・directed modulation・internal reasoning・flexible generalization・selectivity の5機能的性質、中間層局在・容量制限・broadcast の3構造的性質を追記)・[[機構的解釈性]](ロジットレンズを発展させた J-lens が、局所回路同定とは異なる粒度で大域的なワークスペース構造を明らかにする方向性を追記)・[[AI意識]](The Economist が示唆した「グローバルワークスペース類似の特徴」が、比喩ではなく介入実験で検証可能な内部構造として実測されたことを追記)。 ### The Working Set Model for Program Behavior(Peter J. Denning、MIT、CACM 1968)(2026-08-24 ingest-paper) - 新規 concept 2 件: [[ワーキングセットモデル]](プロセスのメモリ需要を直近τ秒間の参照集合 W(t, τ) として定式化する古典モデル。サイズ・予測性・再参入率・τ感度の4性質)・[[スラッシング]](メモリ過剰コミットメント下でページフォールトが連鎖増大する性能崩壊現象。本論文が命名)。 - 更新 concept 1 件: [[仮想メモリとページング]](2023年の実務書解説に対し、1968年のワーキングセットモデルが「観測ベースでメモリ需要を定義する」という同一方針を半世紀先に確立していたという横断的知見を追記)。 ### Understanding the limitations of pubsub systems(Atul Adya・Phil Bogle・Colin Meek、Databricks、HOTOS 25)(2026-08-24 ingest-paper) - 新規 concept 1 件: [[Watch(状態変更通知)]] — pubsub をストレージ層と watch システムへアンバンドリングする対抗アーキテクチャ。Consumer API(`watch()`/`onEvent()`/`onProgress()`/`onResync()`)と Ingester API(`append()`/`progress()`)を定義。 - 更新 concept 4 件: [[エンドツーエンド論]](pubsub の順序・配送保証がエンドツーエンド保証にならないという具体的インスタンスを追加)・[[分散メッセージブローカ]](有限バッファ・トピックコンパクションが DDIA では利点、本論文では構造的リスクとして評価される対比を追加)・[[変更データキャプチャ(CDC)]](CDC が依存する pubsub 配送そのものを問題視する対抗視点を追加。2ソース目のため横断的知見を初めて記載)・[[分散キャッシュ]](pubsub ベースのキャッシュ無効化と auto-sharder の競合、リースの役割の対比を追加)。 ### GenRec: Towards LLM-native Recommendation at Netflix(Ying Li・Arjun Rao・Shradha Sehgal、Netflix TechBlog、2026-08)(2026-08-24 ingest) - 新規 concept 1 件: [[LLMネイティブ推薦]] — 言語化(verbalization)・カタログ対応スコアリングヘッド・prefill-onlyサービング・報酬重み付けアラインメント・2フェーズ学習を統合した、LLM を推薦ランキングの中核コンポーネントとして用いる設計を定義する新規 concept。 - 更新 concept 2 件: [[コンテキストエンジニアリング]](AI エージェント開発領域で先に定式化された「特徴量/仕様書エンジニアリングからコンテキストエンジニアリングへ」という転換が、RecSys 領域でも独立に同型で現れたという横断的知見を追加)・[[LLM推論]](BatchLLM が抽象的に挙げる「オフラインランキング」の具体例として、デコードを持たない prefill-only スコアリング専用ワークロードを追記)。 ### Building Secure and Reliable Systems(Google Security / SRE 編、O'Reilly 2020、全 5 部 21 章 + Conclusion + Appendix)(2026-08-24 ingest-book) - 新規 concept 26 件: [[インシデント対応時の運用セキュリティ]]・[[セキュアコーディングフレームワーク]]・[[セキュリティと信頼性の文化]]・[[セキュリティの責任分担]]・[[セキュリティログの設計と保護]]・[[セーフプロキシ]]・[[ソフトウェアサプライチェーンセキュリティ]]・[[デバッグアクセスの設計]]・[[ファジング]]・[[ロールバックとバージョン単調性]]・[[信頼性とセキュリティの交差]]・[[内部者リスク]]・[[危機時の指揮系統]]・[[変化に追随する設計]]・[[多層防御]]・[[大規模な移行の遂行]]・[[影響範囲の制御]]・[[復旧のための設計]]・[[復旧計画の実行]]・[[最小権限設計]]・[[机上演習とレッドチーム演習]]・[[機能要件と非機能要件のトレードオフ]]・[[災害計画]]・[[理解容易性のための設計]]・[[自作のサービス妨害]]・[[静的解析の開発者ワークフロー統合]]。 - 更新 concept 40 件: [[CI-CDオブザーバビリティ]]・[[HSM APIセキュリティ]]・[[SREエンゲージメントモデル]]・[[SRE文化]]・[[インシデントシミュレーション]]・[[インシデントトリアージ]]・[[インシデント優先順位付け]]・[[インシデント対応成熟度モデル]]・[[インシデント管理]]・[[インシデント重大度評価]]・[[カオスエンジニアリング]]・[[サービス妨害攻撃とネットワークプロトコルの悪用]]・[[セキュリティにおけるインセンティブ不整合]]・[[セキュリティの持続可能性]]・[[セキュリティエンジニアリングチームの管理と組織的リスク]]・[[セキュリティカオスエンジニアリング]]・[[セキュリティ設計原則]]・[[セキュリティ評価制度]]・[[ゼロトラスト]]・[[ソフトウェア変更管理]]・[[ソフトウェア複雑性]]・[[データ保護]]・[[ブラスト半径]]・[[プロキシとエージェント]]・[[ヘルメティックビルド]]・[[ポストモーテム]]・[[レジリエンス]]・[[ログ生成]]・[[信頼計算基盤(TCB)]]・[[国家監視の歴史と法制度]]・[[封印と偽造防止印刷]]・[[技術的負債]]・[[敵対者の類型論]]・[[継続的デプロイ]]・[[脆弱性ライフサイクルと協調的な脆弱性開示]]・[[認可モデル]]・[[認証局とPKIの信頼モデル]]・[[軽量形式手法]]・[[運用セキュリティ(OPSEC)とトレードクラフト]]・[[過負荷制御]]。 ### The Art of Computer Systems Performance Analysis(Raj Jain、John Wiley & Sons 1991、全 6 部 36 章)(2026-08-24 ingest-book) - 新規 concept 13 件: [[オペレーショナル法則]]・[[シミュレーションモデルの検証と妥当性確認]]・[[モニタの分類と設計トレードオフ]]・[[リトルの法則]]・[[ワークロード選択の判断軸]]・[[乱数生成器]]・[[信頼区間]]・[[性能データの可視化]]・[[性能メトリクスの選定]]・[[確率分布の選択と関係]]・[[線形回帰]]・[[要約統計量の選定]]・[[離散事象シミュレーション]]。 - 更新 concept 27 件: [[MLプロファイリング]]・[[USE メソッド]]・[[キャパシティ計画]]・[[クラスタリング]]・[[トレーシングオーバーヘッド]]・[[ネットワークシミュレーション]]・[[パフォーマンスのアンチメソドロジ]]・[[ベンチマーキング]]・[[モンテカルロシミュレーション]]・[[ワイブル分布]]・[[ワークロードの特性の把握]]・[[主成分分析]]・[[二項分布]]・[[信頼水準]]・[[分散]]・[[分散モニタリング]]・[[回帰の評価指標]]・[[定常分布]]・[[実験計画法]]・[[待ち行列理論]]・[[性能測定]]・[[期待値]]・[[確率変数]]・[[統計的有意性]]・[[継続的プロファイリング]]・[[過負荷制御]]・[[非侵入プロファイリング]]。 ### 実践SONiC入門(海老澤健太郎、技術評論社 2025、全 11 章 + Appendix)(2026-08-24 ingest-book) - 新規 concept 6 件: [[SONiCのモジュール責務分離]]・[[データベースを介した疎結合なモジュール連携]]・[[ネットワーク機器のブートストラップとイメージ配布]]・[[パケット処理パイプラインのテーブル分割]]・[[ホワイトボックススイッチ]]・[[宣言的設定管理]]。 - 更新 concept 15 件: [[GitOps]]・[[SRv6]]・[[Watch(状態変更通知)]]・[[インメモリデータベース]]・[[オープンソースソフトウェア開発]]・[[コンテナオーケストレーション]]・[[コンテナ仮想化]]・[[デバッグアクセスの設計]]・[[ネットワークオペレーティングシステム]]・[[ネットワーク自動化]]・[[プログラマブルデータプレーン]]・[[ヘルメティックビルド]]・[[レイヤリング]]・[[ログ解析]]・[[抽象化(ソフトウェア設計)]]。 ### RFC 9161 - Operational Aspects of Proxy ARP/ND in Ethernet Virtual Private Networks(J. Rabadan ほか、Nokia/DE-CIX、IETF 2022-01)(2026-08-24 ingest) - 新規 concept 1 件: [[EVPNにおけるProxy ARP-ND]] — Learning・Reply・Unicast-Forward・Maintenance・Flood Handling・重複IP検知の6サブ機能、AS-MACによるスプーフィング対策を定義。 - 更新 concept 1 件: [[EVPN]](RFC 9161 の重複IP検知と RFC 7432 の MAC Mobility 重複検知が既定値 M=180秒・N=5回を共有するという横断的知見を追加)。 ### Floodless in SEATTLE - A Scalable Ethernet Architecture for Large Enterprises(Changhoon Kim・Matthew Caesar・Jennifer Rexford、SIGCOMM 2008)(2026-08-24 ingest-paper) - 新規 concept 1 件: [[一hopDHTによるEthernetスケーラビリティ]] — 一hop DHT・コンシステントハッシング・多階層化・トラフィック駆動キャッシュでフラットアドレッシングを維持したままEthernetのフラッディング依存を排するSEATTLEの設計。識別子ベースルーティング(ROFL/UIP/VRR)との設計原理の違いを整理。 - 更新 concept 1 件: [[EVPN(Ethernet VPN)]](Ethernetスケーラビリティ問題への異なるアプローチとしてSEATTLEとの対比を追加)。 ### Assessing Container Network Interface Plugins(Shixiong Qi・Sameer G. Kulkarni・K. K. Ramakrishnan、IEEE TNSM 2021)(2026-08-24 ingest-paper) - 新規 concept 1 件: [[Container Network Interface (CNI)]] — CNI プラグインの実装を「通信レイヤー(L2/L3/Hybrid)」×「転送方式(overlay/underlay)」の2軸で4クラスに整理する枠組みと、eBPFベースCNIのiptables完全迂回・ネットワークポリシーと性能のトレードオフ・NICトンネルオフロード依存性・native routingの優位性という横断的知見。 - 更新 concept 1 件: [[eBPF]](Cilium の eBPF datapath(XDP/TCフック)のCPUサイクル/パケット(CPP)による定量分析を追加。intra-host約189 CPP・iptablesチェーン0、inter-host約236 CPP)。 ### LeanとDevOpsの科学[Accelerate](Nicole Forsgren・Jez Humble・Gene Kim、インプレス 2018、全17章+付録A)(2026-08-24 ingest-book) - 新規 concept 13 件: [[IT業界における多様性]] — 2017年調査のジェンダー・少数人種の内訳と離職率格差、[[Westrumの組織文化類型]] — 不健全・官僚的・創造的の3類型とWestrumコンティニュアムによる測定、[[スクワッド・トライブ・チャプター]] — ING Netherlandsのアジャイル型組織モデルの3階層、[[デプロイ関連の負荷]] — デプロイへの恐怖感・不安を測る尺度と、その3つの典型的原因・軽減策、[[バーンアウト]] — Maslachの6つの組織的危険因子と、技術・リーンのプラクティスによる軽減、[[リーンマネジメント]] — WIP制限・作業フローの可視化・負担の軽い変更承認プロセスの3構成要素、[[リーン製品開発]] — 作業の細分化・チームによる実験・顧客フィードバック・可視化による管理の4ケイパビリティ、[[変革型リーダーシップ]] — Rafferty and Griffinの5次元モデルと、ケイパビリティを介した間接的影響、[[従業員エンゲージメント]] — eNPS・帰属意識・職務満足度と組織成果の関係、[[情報セキュリティのシフトレフト]] — セキュリティをデリバリライフサイクル上流へ組み込むケイパビリティ、[[潜在的構成概念の測定]] — 計量心理学による数量化と、弁別的妥当性・収束的妥当性・信頼性の検定、[[疎結合のアーキテクチャ]] — テスト容易性・デプロイ容易性の2特性、逆コンウェイ戦略、スケール時のデプロイ頻度、[[継続的デリバリ]] — 5原則と、デリバリ性能・組織文化・デプロイ負荷への実証効果のハブ。 - 更新 concept 18 件: [[DORA]]・[[SRE組織変革]]・[[イテレーションの長さ]]・[[オンコールストレス管理]]・[[クラスタリング]]・[[コンウェイの法則]]・[[ソフトウェア変更管理]]・[[バッチサイズ]]・[[フィードバック駆動開発]]・[[マイクロサービスアーキテクチャ]]・[[メンタルヘルスとインクルーシビティ]]・[[心理的安全性]]・[[教師データ収集手段の選択]]・[[研究方法論における妥当性概念]]・[[組織の信頼性マインドセット]]・[[統計的有意性]]・[[継続的デプロイ]]・[[開発者生産性]](いずれも本書の該当章との突き合わせで見えた横断的知見と未解決の問いを積み増し)。 ### InterconnectLens: Enhancing Observability of Data Transfers in GPU Clusters(Koshi Eguchi・Ryo Nakamura・Yohei Kuga・Kenjiro Taura、東京大学/トヨタ自動車/NII LLMC、PEARC '25)(2026-08-24 ingest-paper) - 更新 concept 2 件: [[RDMAネットワーク監視]](ICLensの「人間目視によるコンポーネント別グラフ比較」という自動検知に依らない運用可視化アプローチを、計装点の第八の軸として追加。`/sysfs`経由RNICカウンタの実装上の制約に関する知見も追加)、[[GPU観測性]](ICLensの「単一デバイス深掘り」ではなく「GPU間通信経路横断」の可視化という、Zoomerとは異なる統合の切り口を追加)。 ### hwloc: a Generic Framework for Managing Hardware Affinities in HPC Applications(François Broquedis ほか、University of Bordeaux/INRIA/CNRS/ENSEIRB、PDP 2010)(2026-08-25 ingest-paper) - 新規 concept 1 件: [[ハードウェアトポロジ抽象化]] — プロセッサソケット・キャッシュ・コア・NUMAメモリノードを、オブジェクト型や相対深さに仮定を置かない汎用木構造として抽象化する手法。 - 更新 concept 1 件: [[NUMA対応CPUピニング]](hwlocが示す共有キャッシュ粒度でのバインディング判断と、ソケット/コア/スレッドという固定概念に依存しない汎用トポロジ木の設計思想を横断的知見として追加)。 ### Understanding PCIe performance for end host networking(Rolf Neugebauer・Gianni Antichi・José Fernando Zazo・Yury Audzevich・Sergio López-Buedo・Andrew W. Moore、SIGCOMM '18)(2026-08-25 ingest-paper) - 新規 concept 1 件: [[PCIe性能]] — PCIe物理層帯域からDLL/TLPヘッダオーバーヘッド、MPS/MRRS制約、ホスト側のNUMA配置・Intel DDIO・IOMMUまでを含めた、end hostネットワーキングが得る実効帯域・レイテンシの概念。理論モデルとマイクロベンチマークスイートpcie-benchによる特性評価手法を集約する。 ### Understanding the Host Network(Midhul Vuppalapati・Saksham Agarwal・Henry N. Schuh・Baris Kasikci・Arvind Krishnamurthy・Rachit Agarwal、Cornell University/University of Washington、ACM SIGCOMM '24)(2026-08-25 ingest-paper) - 新規 concept 1 件: [[ドメイン別クレジットベースフロー制御]] — ホストネットワークを独立クレジットベースフロー制御を持つ複数ドメインに分解する概念的抽象化。TCPのエンドツーエンド型フロー制御とATM/PFC対応RDMAのホップバイホップ型フロー制御を一般化したもの。 - 更新 concept 1 件: [[ホスト内ネットワークボトルネック]](Hostpingの症状ベース診断と本論文の根本原因メカニズムの補完関係、ソケット内部コンポーネント間相互作用が競合源になりうる知見を追加)。 ### A PCIe Congestion-Aware Performance Model for Densely Populated Accelerator Servers(Maxime Martinasso・Grzegorz Kwasniewski・Sadaf R. Alam・Thomas C. Schulthess・Torsten Hoefler、ETH Zurich/CSCS/Oak Ridge National Laboratory、SC16)(2026-08-25 ingest-paper) - 更新 concept 1 件: [[PCIe性能]](GPU間P2P通信の輻輳系ボトルネック(ポートアービトレーション・HOLブロッキング・ルートコンプレックス通過ペナルティ)を、既存の単一フローオーバーヘッド系知見(MPS/DDIO/IOMMU)と対比する横断的知見を追加。単一デバイス性能モデルと複数デバイス間輻輳モデルという相補的な2レイヤーであることを整理)。 ### Host Congestion Control(Saksham Agarwal・Arvind Krishnamurthy・Rachit Agarwal、Cornell University/Google/University of Washington、ACM SIGCOMM '23)(2026-08-25 ingest-paper) - 新規 concept 1 件: [[ホスト輻輳制御]] — NICとCPU/メモリを結ぶホストネットワーク内での輻輳(ホスト輻輳)を検知・応答する輻輳制御の領域。IIOバッファ占有量シグナル・サブRTT粒度のホストローカル応答・RTT粒度のネットワーク資源配分の3要素を集約する。 - 更新 concept 2 件: [[データセンター輻輳制御]](輻輳制御研究の「end-to-end=NIC」という暗黙の前提がホスト輻輳の発見で覆される点、hostCCが既存プロトコルへ非侵襲的に統合される設計である点を横断的知見に追加)、[[ホストネットワークスタック性能]](「処理オーバーヘッド」と「輻輳」という異なる現象が同じホストネットワーク経路上で相互作用する観点を追加)。 ### MemAxes: Visualization and Analytics for Characterizing Complex Memory Performance Behaviors(Alfredo Giménez ほか、UC Davis/Lawrence Livermore National Laboratory/Linnaeus University、IEEE TVCG 2018)(2026-08-25 ingest-paper) - 更新 concept 2 件: [[性能データの可視化]](Jainの静的な図表選択論と、MemAxesの対話的探索ツールとしての可視化設計が、想定利用者と評価基準の異なる別アプローチであるという横断的知見を追加)、[[ハードウェアトポロジ抽象化]](hwloc論文が「トポロジ収集」を、MemAxes論文が「トポロジ可視化」を主眼とする相補的な貢献であり、水平icicle plotの視覚的スケーラビリティの欠点はhwloc利用者側から見えた課題であるという横断的知見を追加)。 ### Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines(Stéphanie Moreaud・Brice Goglin、Inria/LaBRI/Université Bordeaux 1、PDCS 2007)(2026-08-25 ingest-paper) - 更新 concept 3 件: [[NUMAメモリ配置]](HYPERTRANSPORTホップあたり約40nsという具体的なNUMA距離コストと、DMA/RDMA書き込みのみに現れる非対称NUMA効果を横断的知見として追加)、[[NUMA対応CPUピニング]](GPUと同様にNICもNUMA近接配置が必要なI/Oデバイスであること、ピニング効果がデータ移動方向で非対称になりうることを追加)、[[ホストネットワークスタック性能]](2021年のデータコピー分析に先立つ14年前から、NUMA非局所性によるNIC帯域低下が実測されていたという横断的知見を追加)。 ### Thread and Memory Placement on NUMA Systems: Asymmetry Matters(Baptiste Lepers・Vivien Quéma・Alexandra Fedorova、Simon Fraser University/Grenoble INP、USENIX ATC '15 Best Paper)(2026-08-25 ingest-paper) - 新規 concept 1 件: [[非対称NUMAインターコネクト]] — リンク幅・方向性・共有関係が非対称なNUMAインターコネクトという性質と、それに対応するホップ数でなく帯域幅を最大化する配置戦略を集約する概念。Moreaud & Goglin(2007)とLepers+(2015)という2007年→2015年・2ソケット→8ソケットという世代・スケールの異なる2つの独立研究が「非対称性は帯域幅で捉えるべき」という結論で一致することを横断的知見として記録。 - 更新 concept 1 件: [[NUMAメモリ配置]](「距離(ローカル/リモートの二値)」モデルを「帯域幅」という連続指標に置き換える必要があるという横断的知見を追加)。 ### LIKWID: A Lightweight Performance-Oriented Tool Suite for x86 Multicore Environments(Jan Treibig・Georg Hager・Gerhard Wellein、Erlangen Regional Computing Center (RRZE)/FAU Erlangen-Nürnberg、ICPPW 2010)(2026-08-25 ingest-paper) - 更新 concept 3 件: [[ハードウェアカウンタ]](likwid-perfCtrのcore-based計測設計と、PAPIとの「インストール容易さ vs 移植性の広さ」トレードオフを横断的知見として追加)、[[NUMA対応CPUピニング]](「均等分散」で十分なSTREAM triadと「精密なコア対応」が必須なJacobiステンシルという粒度の異なる2ケーススタディの対比、コンパイラのスレッド生成方式がピニング戦略に影響することを追加)、[[ハードウェアトポロジ抽象化]](likwid-topologyの`cpuid`直接実装とhwlocの汎用API設計の対比、水平icicle plotがhwloc・LIKWID双方に共通する可視化形式であるという知見を追加)。 ### Classifying Host-Side RDMA Pingmesh Results to Efficiently Identify Transport Faults in Data Centers(Songhao Ding・Boyang Zhou・Yuhua Zheng、Zhejiang Lab/Hangzhou Institute for Advanced Study UCAS、IEEE ICPADS 2025)(2026-08-25 ingest-paper) - 更新 concept 2 件: [[RDMAネットワーク監視]](「計装位置」の軸とは独立な「検知後の分類・局所化の自動化」という軸をRTFDが加えることを横断的知見として追加)、[[不均衡障害分類]](マイクロサービス障害分類のSLIM(学習目標再設計)とRDMAトランスポート障害分類のRTFD(事前学習+SFTの転移学習)が同じレアイベント問題に異なる解法系統で対処することを追加)。 ### Rethinking Intra-host Congestion Control in RDMA Networks(Zirui Wan・Jiao Zhang・Yuxiang Wang・Kefei Liu・Haoyu Pan・Tao Huang、BUPT / China Mobile (Suzhou) Software Technology / Purple Mountain Laboratories、APNet 2024)(2026-08-25 ingest-paper) - 更新 concept 4 件: [[ホスト輻輳制御]](RDMA受信側カーネルモジュールがデータパケットを直接改変できない制約に対しRHCCがPCCプローブ機構で代替する設計要素、hostCCとの関係を追加)、[[ホスト内ネットワークボトルネック]](Hostpingの診断的観察がRHCCの能動的制御を独立に動機づけるという横断的知見を追加)、[[データセンター輻輳制御]](RHCCのDCQCNとの`min(R_rev, R_cc)`合成という新しい統合パターンを追加)、[[RDMA]](RHCC・hostCCを対比しRDMAカーネルバイパスの副作用を追加)。 ### Revisiting RDMA Reliability for Lossy Fabrics(Wenxue Li ほか、香港科技大学/Huawei、ACM SIGCOMM '25)(2026-08-25 ingest-paper) - 更新 concept 1 件: [[RoCE設計課題]](IRN(RNIC-SR)がパケットレベル負荷分散と構造的に非互換であるという技術的限界を DCP が実証・解消したという横断的知見を追加。既存の未解決の問い「IRNがなぜ主流展開に至っていないか」に部分的回答を追加し、DCPのビットマップフリー設計が無損失制御プレーンという不変条件に依存する点を新たな未解決の問いとして追加)。 ### Pond: CXL-Based Memory Pooling Systems for Cloud Platforms(Huaicheng Li ほか、Microsoft Azure/Virginia Tech/CMU 他、ASPLOS '23 Distinguished Paper Award)(2026-08-25 ingest-paper) - 更新 concept 2 件: [[CXLによるメモリ拡張]](Vistara・Belugaと並ぶ「小規模プール+ML予測配分」という第3の設計点をPondが占めることを横断的知見として追加、Pondの「配置前予測」とVistara/TPPの「実行時ページ配置」を組み合わせたハイブリッド設計の可能性を未解決の問いに追加)、[[NUMAメモリ配置]](CPUレスNUMAノードとしてのCXLメモリが、VistaraのOSレベル階層化とPondのVM単位zNUMAという独立した2つの実装で確認されたことを横断的知見として追加)。 ### Doubling all2all Performance with NVIDIA Collective Communication Library 2.12(Karthik Mandakolathur・Sylvain Jeaugey、NVIDIA、NVIDIA Developer Blog 2022-02-28)(2026-08-25 ingest) - 更新 concept 2 件: [[Rail-Optimizedトポロジ]](NCCL_CROSS_NIC=0という運用的解決とPXNという機構的解決が同じ課題への異なるレイヤーからの対応であるという横断的知見、PXNがall-reduce向け設計をall2allパターンへ機構的に拡張したという知見を追加)、[[集合通信]](all2allがtree/ringで最適化できない構造的理由と、NCCL 2.28以前のall-to-allがP2P操作の集合として実装されていた設計判断の関係を追加)。 ### RHCC: Revisiting Intra-Host Congestion Control in RDMA Networks(Zirui Wan・Jiao Zhang・Yuxiang Wang・Kefei Liu・Haoyu Pan・Yongchen Pan・Tao Huang、BUPT / Purple Mountain Laboratories、IEEE Transactions on Networking 2025)(2026-08-25 ingest-paper) - 更新 concept 3 件: [[ホスト輻輳制御]](会議論文の拡張ジャーナル版がhostCCとの比較を独立節として体系化する例、PIDコントローラの収束性が既存の制御理論の援用によって事後的に裏付けられる例を横断的知見として追加)、[[ホスト内ネットワークボトルネック]](Hostping・RHCCという同一著者グループの2本の会議論文がそれぞれ独立に拡張ジャーナル版へ発展しているという横断的知見を追加)、[[データセンター輻輳制御]](RHCCとDCQCNの併存下でのPFC削減効果がホスト内輻輳応答の速さとホスト間輻輳制御の発火頻度の関係を定量化した例を横断的知見として追加)。 ### UCCL-Tran: An Extensible Software Transport Layer for GPU Networking(Yang Zhou ほか、UC Berkeley/UC Davis/Tsinghua University/Harvard University/IBM Research/AWS/Broadcom/UPB、USENIX OSDI '26)(2026-08-25 ingest-paper) - 更新 concept 3 件: [[RDMA]](IRN のハードウェア改修路線から Flor・UCCL-Tran のホスト CPU ソフトウェア拡張路線への転換、OpenAI MRC とのプログラマブル NIC 側 vs ホスト CPU 側という実装場所の対比、SRNIC の QP スケーリング劣化が ML ワークロード条件下では再現されないという知見を追加)、[[集合通信]](NCCL の内部最適化・診断とは異なる「NCCL の外側」のトランスポート層拡張という新しいレイヤー軸、DeepSeek-V3 EP incast への EQDS ソフトウェア実装という具体解を追加)、[[データセンター輻輳制御]](HotNets 2024 のシミュレーション予測をUCCL-Tranが実機テストベッドで裏づけるという横断的知見、ハードウェア標準化(UEC)を待たないソフトウェア先行実装というアプローチの対比を追加)。 ### Computer Architecture: A Quantitative Approach, 6th Edition(John L. Hennessy・David A. Patterson、Morgan Kaufmann、2019)(2026-08-25 ingest-book) - 新規 concept 3 件: [[キャッシュコヒーレンスプロトコル]]・[[メモリ一貫性モデル]]・[[命令セットアーキテクチャの設計原理]] - 更新 concept 40 件: [[AIアクセラレータ]]・[[Brainiac設計]]・[[CPU利用率]]・[[PUE]]・[[RAID]]・[[RDMA]]・[[Rooflineモデル]]・[[SIMDベクトル処理]]・[[アウトオブオーダー実行]]・[[アムダールの法則]]・[[クラウドコンピューティング]]・[[コアレスドメモリアクセス]]・[[コンテナ仮想化]]・[[スーパースカラー実行]]・[[テールレイテンシ耐性技術]]・[[ディペンダビリティ]]・[[データセンターネットワークトポロジ]]・[[データセンター信頼性]]・[[データセンター輻輳制御]]・[[ドメイン固有アーキテクチャ]]・[[ハードウェア仮想化]]・[[ハードディスク信頼性]]・[[パイプライン処理]]・[[ベンチマーキング]]・[[ムーアの法則とデナードスケーリングの終焉]]・[[メモリウォール]]・[[メモリバウンド]]・[[メモリ階層とキャッシュ]]・[[リトルの法則]]・[[仮想メモリとページング]]・[[共有メモリバンクコンフリクト]]・[[分岐予測]]・[[分散ストレージ]]・[[可用性]]・[[同時マルチスレッディング]]・[[待ち行列理論]]・[[性能メトリクスの選定]]・[[性能測定]]・[[投機的実行とマイクロアーキテクチャサイドチャネル(Meltdown・Spectre)]]・[[相互結合網]] ### FlowTracer: A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters(Hasibul Jamil ほか、IBM Research/University at Buffalo、arXiv 2024・IEEE ICC 2025採録と報告)(2026-08-25 ingest-paper) - 更新 concept 2 件: [[ECMP]](Hedera のシミュレーションから FlowTracer の実機計測へつながる知見と、RoCE エレファントフロー特性がハッシュ衝突の実害を増幅する知見を追加)・[[RDMAネットワーク監視]](R-Pingmesh の能動プロービングに対し FlowTracer が受動ホップバイホップ追跡という第九の計装軸を加える横断的知見を追加)。 ### On the General Theory of Control Systems(R. E. Kalman、Proc. First IFAC Congress, Moscow 1960)(2026-08-26 ingest-paper) - 新規 concept 3 件: [[可制御性]]・[[可観測性]]・[[双対性原理(制御理論)]] — いずれも本論文が初出。単一ソースのため横断的知見は今後の ingest 待ち。 ### 2026-08-29 更新概念 | StriaTrace - [[LLM推論]] / [[LLMサービング管理]] / [[GPU観測性]] / [[Rooflineモデル]] / [[分散トレーシング]] / [[トレーシングオーバーヘッド]] / [[クリティカルパス分析]] - [[頻出エピソードマイニング]]