# Wiki Index ### 2026-09-13 ingest | We Must Pace the Frontier\n- Source: [[@2026__DarioAmodei__We Must Pace the Frontier]]\n- AI能力の加速に対し、安全性研究・工程監査・国際協調の時間を確保するペーシングの提案。 ### 2026-09-12 ingest-paper | Fast unfolding of communities in large networks\n- Source: [[@2008__JSTAT__Fast unfolding of communities in large networks]]\n ### 2026-09-12 ingest-book | Networks, Crowds, and Markets - Source: [[@2010__CambridgeUP__Networks, Crowds, and Markets - Chapter 1 Overview]] 他全24章 ### 2026-09-12 ingest-paper | The PageRank Citation Ranking: Bringing Order to the Web\n- Source: [[@1998__TechReport__The PageRank Citation Ranking - Bringing Order to the Web]]\n ### 2026-09-10 ingest | batch (2 sources) - Source: [[@2026__PloehBlog__Programming Languages for AI]] - Source: [[@2023__DeepMindBlog__AlphaDev Discovers Faster Sorting Algorithms]] ### 2026-09-08 ingest-paper | Networked Agent Memory and Causality Representation - Source: [[@2026__SIGCOMM__Networked Agent Memory and Causality Representation - Experiences towards Interpretable Cloud-Scale Root-Causing]] ### 2026-09-08 ingest-paper | Pegasus: A Data Center Network for Bare-Metal AI Cloud - Source: [[@2026__SIGCOMM__Pegasus - A Data Center Network for Bare-Metal AI Cloud]] ### 2026-09-07 ingest-paper | Using expect to Automate System Administration Tasks - Source: [[@1990__LISA__Using expect to Automate System Administration Tasks]] ### 2026-09-07 ingest-paper | SeT-Diff\n- Source: [[@2026__arXiv__SeT-Diff - Towards Semantic Foundation Models for HPC Telemetry and Time-Series]]\n ### 2026-09-07 ingest-paper | μSlope: High Compression and Fast Search on Semi-Structured Logs - Source: [[@2024__OSDI__μSlope - High Compression and Fast Search on Semi-Structured Logs]] ### 2026-09-07 ingest-paper | Splitwise: Efficient Generative LLM Inference Using Phase Splitting\n- Source: [[@2024__ISCA__Splitwise - Efficient Generative LLM Inference Using Phase Splitting]]\n ### 2026-09-07 ingest-paper | State of AI: An Empirical 100 Trillion Token Study with OpenRouter - Source: [[@2026__arXiv__State of AI - 100 Trillion LLM Interactions with OpenRouter]] ### 2026-09-07 ingest-paper | 障害管理・アラーム相関の歴史的論文8件バッチ(1995-2014) - Sources: [[@1995__IM__A Coding Approach to Event Correlation]], [[@1995__INFOCOM__Automatic Alarm Correlation for Fault Identification]], [[@1997__IM__Automated Proactive Anomaly Detection]], [[@1998__PER__Internet Service Performance Failure Detection]], [[@1999__JNSM__Rule Discovery in Telecommunication Alarm Data]], [[@2000__LISA__Aberrant Behavior Detection in Time Series for Network Service Monitoring]], [[@2013__KDD__An Integrated Framework for Optimizing Automatic Monitoring Systems in Large IT Infrastructures]], [[@2014__KDD__Towards Scalable Critical Alert Mining]] ### 2026-09-07 ingest | IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud - Source: [[@2026__IBM__IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud]] ### 2026-09-07 ingest | TimesFM-3: A zero-shot foundation model for multivariate forecasting - Source: [[@2026__Google Research Blog__TimesFM-3 - A Zero-Shot Foundation Model for Multivariate Forecasting]] ### 2026-09-07 ingest-paper | LISA歴史論文バッチ11件 - Sources: 11件(LISA 2000-2014)。Traugott(2002) vs Kanies(2003) の congruence/convergence 対立を contradiction 化。 ### 2026-09-06 ingest-paper | LISA歴史論文バッチ10件 - Sources: [[@1993__LISA__Automated System Monitoring and Notification With Swatch]] ほか9件(1991-2010年のUSENIX LISA論文) ### 2026-09-05 ingest-paper | AutoDA-Timeseries - Automated Data Augmentation for Time Series - Source: [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]] ### 2026-09-05 ingest-paper | ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts - Source: [[@2026__WWW2026__ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts]] ### 2026-09-05 ingest-paper | A Benchmark for Language Models in Real-World System Building - Source: [[@2026__arXiv__A Benchmark for Language Models in Real-World System Building]] ### 2026-09-05 ingest-slides | Orchestrate Next-Generation AI Workloads With Open-Source Slurm - Source: [[@2026__GTC__Orchestrate Next-Generation AI Workloads With Open-Source Slurm]] ### 2026-09-05 ingest-paper | 7 HPC Papers\n- Sources: 7件のHPCテレメトリ・ワークロード特性化論文(Nextflow, Theta, Perlmutter, Minos, Marconi100など)\n ### 2026-09-05 ingest-paper | Falcon (GPU failure prediction) - Source: [[@2026__ISSRE__From Noisy Telemetry to Actionable Warnings - GPU Failure Prediction in Industrial Clusters]] ### 2026-09-05 ingest-paper | Labeling the Invisible (SlowSight) - Source: [[@2027__FAST__Labeling the Invisible - A Scalable Framework for Labeling Fail-Slow Failures in Cloud Storage Systems]] ### 2026-09-05 ingest-paper | CubeTrace: Microscopic Network Tracing for Heterogeneous Cloud Gateways - Source: [[@2026__SIGCOMM__CubeTrace Microscopic Network Tracing for Heterogeneous Cloud Gateways]] ### 2026-09-05 ingest-paper | CoLMAD\n- Source: [[@2026__ISSRE__CoLMAD : Cost-Efficient LLM-Assisted Time Series Anomaly Detection for Industrial Monitoring]]\n ### 2026-09-05 ingest-paper | THXInLog: Robust Semantic-Temporal Framework for Log Anomaly Detection in Production Supercomputers\n- Source: [[@2026__nkcs.iops.ai__THXInLog - Robust Semantic-Temporal Framework for Log Anomaly Detection in Production Supercomputers]]\n ### 2026-09-05 ingest-thesis | Post-Training in Time Series Foundation Models: A Unifying Framework - 再取り込み: 旧 [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework]](削除)を章単位(全10章)に再構成 - Hub: [[Post-Training in Time Series Foundation Models A Unifying Framework]] ### 2026-09-05 ingest-paper | Beyond Fault Localization\n- Source: [[@2026__arXiv__Beyond Fault Localization - A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis]]\n ### 2026-09-05 ingest | GPUDirect RDMA (NVIDIA CUDA Docs) - Source: [[@2026__NVIDIA__GPUDirect RDMA]] ### 2026-09-04 ingest-paper | Efficient Inter-node MPI Communication using GPUDirect RDMA for InfiniBand Clusters with NVIDIA GPUs - Source: [[@2013__ICPP__Efficient Inter-node MPI Communication using GPUDirect RDMA for InfiniBand Clusters with NVIDIA GPUs]] ### 2026-09-04 ingest-paper | BridgedRing: A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers - Source: [[@2026__TACO__BridgedRing - A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers]] ### 2026-09-04 ingest-paper | The Multipath Reliable Connection (MRC) Transport - Source: [[@2026__arXiv__The Multipath Reliable Connection (MRC) Transport]] ### Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach(Jonas Geiping ほか、ELLIS Institute Tübingen/University of Maryland/Lawrence Livermore National Laboratory、arXiv 2025)(2026-09-04 ingest-paper) - [[@2025__arXiv__Scaling up Test-Time Compute with Latent Reasoning - A Recurrent Depth Approach]] — トランスフォーマーを prelude・core recurrent block・coda に分割し、core block をテスト時に任意回数反復することで潜在空間での推論(潜在推論)を実現する再帰深度アーキテクチャ。3.5B パラメータ・800B トークンのプロトタイプ Huginn-0125 を AMD Frontier スパコンで学習し、CoT データなしにテスト時計算のスケーリングを実証。ゼロショット適応的計算・KVキャッシュ共有・自己投機的デコーディング・連続CoTを追加学習なしに自然にサポート。本文参照 Figure 1–12 を全件クロップして埋め込み、Table 1–5 を Markdown 表に転記。 - Sources (new): [[@2025__arXiv__Scaling up Test-Time Compute with Latent Reasoning - A Recurrent Depth Approach]] - Entities (new): [[Jonas Geiping]]・[[Tom Goldstein]]・[[Sean McLeish]]・[[Neel Jain]]・[[John Kirchenbauer]]・[[Siddharth Singh]]・[[Brian R. Bartoldson]]・[[Bhavya Kailkhura]]・[[Huginn-0125]]・[[ELLIS Institute Tübingen]]・[[Max Planck Institute for Intelligent Systems]] - Entities (updated): [[Abhinav Bhatele]]・[[Frontier]]・[[University of Maryland]]・[[Lawrence Livermore National Laboratory]]・[[Oak Ridge National Laboratory]]・[[AMD]] - Concepts (new): [[再帰深度アーキテクチャ]] - Concepts (updated): [[潜在推論]]・[[テスト時計算スケーリング]]・[[KVキャッシュ管理]]・[[Speculative Decoding]]・[[Chain-of-Thought Prompting]] ### 2026-09-03 ingest-paper | ML systems 11本 - Source: [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]] / [[@2016__OSDI__TensorFlow - A System for Large-Scale Machine Learning]] / [[@2017__ISCA__In-Datacenter Performance Analysis of a Tensor Processing Unit]] / [[@2017__IEEE__Efficient Processing of Deep Neural Networks]] / [[@2018__NeurIPS__Mesh-TensorFlow - Deep Learning for Supercomputers]] / [[@2021__FAST__CheckFreq - Frequent Fine-Grained DNN Checkpointing]] / [[@2022__OSDI__Alpa - Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning]] / [[@2022__MLSys__Pathways - Asynchronous Distributed Dataflow for ML]] / [[@2022__SIGCOMM__Jupiter Evolving - Transforming Google's Datacenter Network via Optical Circuit Switches and Software-Defined Networking]] / [[@2023__NSDI__TACCL - Guiding Collective Algorithm Synthesis using Communication Sketches]] / [[@2023__NSDI__TopoOpt - Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs]] - Concepts: [[Parameter Server]] / [[メッシュ並列]] / [[自動並列化]] / [[非同期分散データフロー]] ### 2026-09-03 ingest-book | アルゴリズムイントロダクション 第3版 総合版 - Source: 全 35 章 + 付録 A〜D の 39 枚 → ハブ [[アルゴリズムイントロダクション 第3版]] - 新規 concept: [[アルゴリズム設計技法]] / [[計算複雑性]] / [[グラフアルゴリズム]] ### 2026-09-03 ingest-paper | Intel Technology Journal Volume 9 Issue 1 - Sources: [[@2005__Intel Technology Journal__Second-Generation Intel Centrino Mobile Technology Platform]] ほか7本 - New concepts: [[電力管理]] / [[熱管理]] / [[統合グラフィックス]] ### 2026-09-03 ingest-paper | Jobstats: A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters - Source: [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]] - Entities: [[Troy Comi]], [[Jobstats]], [[Job Defense Shield]], [[Josko Plazonic]], [[Jonathan Halverson]] - Concepts: [[GPUクラスタ運用]], [[Prometheusシリーズチャーン]] ### 2026-09-03 ingest-book | ソフトウェアアーキテクチャの基礎 - Source: 書籍 24 章 + 付録 A(25 枚)。ハブ [[ソフトウェアアーキテクチャの基礎]] - 新規 concept: [[アーキテクチャ特性]], [[アーキテクチャスタイル]], [[モジュール性]] ### 2026-09-03 ingest-paper | Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows\n- Source: [[@2026__ACCESS__Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows An Evaluation of LustreFS and S3-Compatible Object Storage]]\n ### 2026-09-03 ingest-paper | PRISM: Evaluating POSIX Storage Systems for AI Research Workflows\n- Source: [[@2026__arXiv__PRISM Evaluating POSIX Storage Systems for AI Research Workflows]]\n ### 2026-09-03 ingest-paper | I/O Load Balancing for Big Data HPC Applications\n- Source: [[@2017__IEEE BigData__I O Load Balancing for Big Data HPC Applications]]\n- Entities: [[Arnab K. Paul]], [[Ali R. Butt]]\n- Concepts: [[並列ファイルシステム]], [[ファイルレイアウトとストライピング]], [[ストレージQoS]]\n ### 2026-09-03 ingest-paper | A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System\n- Source: [[@2017__SC__A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System]]\n- Concepts: [[ストレージQoS]], [[並列ファイルシステム]]\n ### 2026-09-03 ingest-book | Lustre Operations Manual - Book: [[Lustre Operations Manual]](Whamcloud, built 2026-05-26。全 45 章中 第 1〜38 章を章単位で取り込み) - Sources: [[@2026__Whamcloud__Lustre Operations Manual - Chapter 1 Understanding Lustre Architecture]] 〜 [[@2026__Whamcloud__Lustre Operations Manual - Chapter 38 Lustre File System Recovery]](38 件、図 33 点) - New concepts: [[ストレージフェイルオーバ]]、[[ファイルレイアウトとストライピング]]、[[ストレージクォータ管理]] ### 2026-09-02 ingest-paper | Characterizing Output Bottlenecks of a Production Supercomputer - Source: [[@2020__TOS__Characterizing Output Bottlenecks of a Production Supercomputer Analysis and Implications]] ### 2026-09-02 ingest-book | Understanding Lustre Internals\n- Book: [[Understanding Lustre Internals]](本編 7 章)\n- New concept: [[obd デバイスモデル]], [[File Identifier (FID)]]\n ### 2026-09-02 ingest-thesis | Lustre Unveiled (ACM TOS 2025)\n- Hub: [[Lustre Unveiled]] — 109 ページの Lustre 包括サーベイを全 8 章 + 付録 A の章単位で再取り込み(旧 1 枚 source は削除)。図 37 点を全点埋め込み。\n- New concept: [[メタデータスケーリング]]\n- New entity: [[GPFS]] / [[Ceph]] / [[DAOS]] / [[BeeGFS]]\n ### 2026-09-02 ingest-slides | Lustre: building a cluster file system for 1,000 node clusters - Source: [[@2003__CFS__Lustre building a cluster file system for 1,000 node clusters]] - Added: 初期Lustreの分散ロック、意図ロック、オブジェクトプロトコルに関するスライド資料 ### 2026-09-01 ingest | Running a Software Factory Efficiently at Uber Scale - Source: [[@2026__Uber__Running a Software Factory Efficiently at Uber Scale]] ### 2026-09-01 ingest-paper | Post-Training in Time Series Foundation Models: A Unifying Framework - Source: [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework]] ### 2026-09-01 wiki-query | 時系列基盤モデルのクラウド運用応用サーベイ - [[時系列基盤モデルのクラウド運用応用サーベイ]] ### 2026-08-31 ingest-paper | Performance of Zero-Shot Time Series Foundation Models on Cloud Data\n- Source: [[@2025__arXiv__Performance of Zero-Shot Time Series Foundation Models on Cloud Data]]\n ### 2026-08-31 ingest-paper | Centile: A Telemetry Foundation Model Evaluated by the Decisions It Drives - Source: [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]] ### 2026-08-31 ingest-paper | AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data - Source: [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]] ### 2026-08-31 ingest-paper | Causal Analysis for Time Series Foundation Models - Source: [[@2026__arXiv__Causal Analysis for Time Series Foundation Models]] ### 2026-08-31 ingest-video | 2017/03/17 平木敬教授 最終講義「計算機を創る」 [[平木敬]]が計算機アーキテクチャ、専用計算機、並列・分散計算機、遠距離データ通信、人材育成の経験を振り返る最終講義を取り込んだ。映像では FLATS、SIGMA-1、GRAPE-DR、Data-Reservoir、お茶の水シリーズが紹介される。 - Source: [[@2017__YouTube__平木敬教授 最終講義「計算機を創る」]] - Pages created: source 1 件 / entity 5 件([[平木敬]]・[[FLATS]]・[[SIGMA-1]]・[[GRAPE-DR]]・[[Data-Reservoir]]) - Pages updated: [[University of Tokyo]] / [[並列化戦略]] / [[GPUクラスタ運用]] / [[HPCインターコネクトベンチマーク]] - Key insight: 専用計算機の設計・製作から遠距離データ通信、人材育成までを一続きの計算機システム設計として捉える視点を、現代の並列計算・クラスタ運用の知見へ接続した。 ### 2026-08-30 ingest-paper | Getting the Most Out of Your GPUs\n- Source: [[@2026__PEARC__Getting the Most Out of Your GPUs]]\n ### 2026-08-30 token-discipline | カタログ必読の廃止 - Meta: [[token-discipline]] - Key insight: エージェントは索引を読まず、resolve / excerpt / retrieve で発見する。 ### 2026-08-30 ingest-slides | AI/ML基盤の400G DCネットワークを構築した話 - Source: [[@2023__JANOG52__AI ML基盤の400G DCネットワークを構築した話]] - Pages created: [[内田泰広]] / [[Cycloud]] / [[ConnectX-7]] / [[OSFP-RHS]] / source 1 件 - Pages updated: [[サイバーエージェント]] / [[CIU]] / [[小障子 尚太朗]] / [[RDMA]] / [[RoCE設計課題]] / [[データセンター輻輳制御]] / [[Rail-Optimizedトポロジ]] / [[マイクロバースト]] / [[Dragonflyトポロジ]] - Key insight: 400GbE RoCEv2 の導入は、PFC/ECN/CNP/ETS だけでなく、用途別ネットワーク分離、Rail Optimized、Adaptive Routing、光トランシーバー相互接続性まで含む構築・検証作業である。 ### 2026-08-30 ingest | eBPFを用いてPod ごとのインターネットトラフィック量を計測するツールの開発 - Source: [[@2024__Preferred Networks__eBPFを用いてPod ごとのインターネットトラフィック量を計測するツールの開発]] - New concept: [[Pod単位ネットワークトラフィック計測]] - Updated entities: [[Preferred Networks]] / [[Kubernetes]] / [[OpenTelemetry]] / [[Prometheus]] - Updated concepts: [[eBPF]] / [[eBPFマップ]] / [[Container Network Interface (CNI)]] / [[ネットワーク監視]] / [[XDP]] - Key insight: Chained CNI PluginからPodのTCへeBPFをアタッチし、Pod・Service・クラスタ外の3分類でIngress/Egressバイト数をカーネル内集約すると、Node NAT後には失われるテナント単位の帯域占有原因を標準メトリクスへ接続できる。 ### 2026-08-30 ingest | eBPF Tutorial by Example: Monitoring GPU Driver Activity with Kernel Tracepoints - Source: [[@2025__eunomia.dev__eBPF Tutorial by Example - Monitoring GPU Driver Activity with Kernel Tracepoints]] - New concept: [[GPUドライバトレーシング]] - Updated concepts: [[eBPF]] / [[GPU観測性]] - Updated entities: [[eunomia-bpf]] / [[bpftime]] / [[bpftrace]] / [[Linux]] / [[Intel]] / [[AMD]] / [[NVIDIA]] - Key insight: GPU ドライバ層は、CUDA API 層と GPU 内部層の間で、ジョブ待ち・fence・メモリ移動・割り込みを低オーバーヘッドに観測する中間面になる。ただし NVIDIA proprietary driver は `nvidia.ko` の内部関数に依存し、GPU 内部のワープやメモリアクセスは別の計装を要する。 ### 2026-08-30 ingest-slides | AI/ML基盤におけるGPU間ネットワークの負荷と性能影響を探る - Source: [[@2025__JANOG55__AI ML基盤におけるGPU間ネットワークの負荷と性能影響を探る]] - New entities: [[加納浩輝]] / [[奥澤智子]] - Updated entity: [[Toyota Motor Corporation]] - Updated concepts: [[RDMA]] / [[RDMAネットワーク監視]] / [[RoCE設計課題]] / [[LLM分散学習]] / [[集合通信]] - Key insight: 分散学習のネットワーク性能目標は、リンク帯域の最大値ではなく、逆伝搬時間・AllReduce送信データ量・帯域の関係から計算と通信を隠蔽できる条件として設定すべきである。長距離RDMAではACK遅延とPFC headroomも同時に評価する必要がある。 ### 2026-08-30 ingest-paper | Using Control Theory to Achieve Service Level Objectives In Performance Management - Source: [[@2002__Real-Time Systems__Using Control Theory to Achieve Service Level Objectives In Performance Management]] - New entities: [[N. Gandhi]] / [[T. Jayram]] / [[J. Bigus]] - Updated entities: [[Joseph L. Hellerstein]] / [[Yixin Diao]] / [[Sujay Parekh]] / [[Dawn M. Tilbury]] / [[IBM T.J. Watson Research Center]] / [[IBM]] / [[University of Michigan]] / [[IBM Lotus Domino Server]] - Updated concepts: [[計算機システムのフィードバック制御]] / [[サービスレベル目標]] / [[フィードバックループ]] / [[制御ループの安定性とタイムラグ補償]] / [[システム同定]] - Key insight: SLOを基準キュー長という制御目標に対応づけ、ARMAによるブラックボックス同定と根軌跡解析を組み合わせると、センサ遅延が測定精度を改善する一方で許容ゲインを狭め、実機の振動を予測できる。 ### 2026-08-30 ingest | AIインフラ革命 ─ 米国データセンターとGPUを支える技術基盤 - Source: [[@2025__LY Corporation__AIインフラ革命 ─ 米国データセンターとGPUを支える技術基盤(Rethinking AI Infrastructure Part 1)]] - Pages created: [[Actapio]] / [[AI Cloud Platform (ACP)]] / [[立見 祐介]] / [[AIインフラ]] / source 1 件 - Pages updated: [[LINE株式会社]] / [[Open Compute Project]] / [[PUE]] / [[GPUクラスタ運用]] / [[データセンターネットワークトポロジ]] / [[RoCE設計課題]] / [[データセンター内光配線設計]] - Key insight: AIインフラはGPU単体ではなく、電力・冷却、ラック、400Gbps閉域RoCEv2網、光配線、Kubernetesプラットフォーム、少人数運用を一体で設計する対象である。 ### 2026-08-30 ingest-slides | AI Networking - RoCEv2 and the role of netdev - Source: [[@2025__Netdev 0x19__AI Networking - RoCEv2 and netdev]] - New entity: [[Leon Romanovsky]] - Updated entity: [[David Ahern]] - Updated concepts: [[RDMA]] / [[RoCE設計課題]] / [[ホストネットワークスタック性能]] / [[TCP IPスタック統合|TCP/IPスタック統合]] / [[Linuxカーネルインタフェース]] - Key insight: ConnectX-7の同一環境でsocket networkingは単一フロー215-220Gbps、RoCEv2は392Gbpsに達し、差はプロトコル名だけでなく、socket側の`skb`・ページプール・softirq処理と、RDMA側のユーザー管理キュー・ゼロコピー・ハードウェアオフロードという責任境界から生じる。 ### 2026-08-30 ingest | 1兆 (1T) パラメータ規模のLLMの事前学習検証 - Source: [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]] - New entities: [[Hiroaki Mikami]] / [[Switch Transformer-C]] / [[FP8-LM]] - Updated entities: [[Preferred Networks]] / [[NVIDIA H100]] / [[PLaMo-100B]] / [[Preferred Elements]] / [[GENIAC]] / [[NEDO]] - New concepts: [[Hash Layers]] / [[Expert Choice Routing]] - Updated concepts: [[Mixture-of-Experts]] / [[負荷分散]] / [[条件付き計算]] / [[LLM分散学習]] / [[LLMスケーリング則]] / [[言語モデル事前学習]] - Key insight: 400基のH100 GPUで1T級MoEを発散なく学習できたが、通常の学習型Routerは崩壊し、実効効率はPLaMo-100Bの半分以下だった。Hash Layersへの移行でtrain loss約1.57を得た。 ### 2026-08-30 ingest | 1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習 - Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]] - New entities: [[PLaMo-100B]] / [[Preferred Elements]] / [[GENIAC]] / [[NEDO]] / [[Common Crawl]] / [[RefinedWeb]] / [[llm-jp corpus filter]] - New concepts: [[Zero Bubble]] / [[z loss]] - Updated concepts: [[QK-Norm]] / [[混合精度訓練]] / [[パイプライン並列化]] / [[並列化戦略]] / [[LLM分散学習]] / [[言語モデル事前学習]] / [[損失関数]] / [[LLM評価]] - Key insight: 大規模事前学習では、データの権利・品質・構造、数値安定性、並列化、診断メトリクスを一体で設計する必要がある。 ### 2026-08-30 ingest | 「研究テーマ」の正体|石原尚 - [[@2022__note.com__「研究テーマ」の正体|石原尚]] — [[石原尚]]による研究テーマの解説。研究テーマを、理想・現状・課題・問題からなる世界観と、アプローチ・目標・手段からなる作戦の組み合わせとして捉える。(article / research-methodology / academic-writing) - Pages created: [[研究テーマ]] / [[石原尚]] / [[卒論・修論研究の攻略本]] / source 1 件 - Pages updated: [[Osaka University]] - Key insight: 研究テーマを「どんな世界にどう挑むのか?」への答えとして構造化すると、テーマに関する抽象的な助言を、世界観と作戦の各要素への具体的な操作として読み替えられる。 ### 2026-08-30 ingest | Off-CPU Analysis - [[@2017__brendangregg.com__Off-CPU Analysis]] — [[Brendan Gregg]]が整理した、スレッドの待機時間とユーザー・カーネルスタックをスケジューラ起点で分析する方法論。on-CPUプロファイリングを補完し、I/O・ロック・スリープ・スケジューラレイテンシを対象にする。(article / performance / observability) - Pages created: [[Yichun Zhang]] / [[Sasha Goldshtein]] / [[Tanel Poder]] / [[FlameGraph]] / [[SystemTap]] - Pages updated: [[Brendan Gregg]] / [[BCC]] / [[perf]] / [[MySQL]] / [[スレッド状態分析]] / [[フレームグラフ]] / [[eBPF]] / [[コンテキストスイッチ]] / [[スケジューラレイテンシ]] / [[トレーシングオーバーヘッド]] - Key insight: 高頻度のスケジューライベントを全量出力するより、eBPFでカーネル内集約してからスタック別の待機時間を渡す方が、本番負荷と後処理量を抑えられる。 ### 2026-08-29 ingest | NVIDIA Hopper Architecture In-Depth NVIDIA の公式技術ブログによる H100/Hopper アーキテクチャ解説。第4世代 Tensor Core、FP8、Transformer Engine、DPX、thread block cluster、分散共有メモリ、TMA、HBM3、MIG、NVLink Switch System、PCIe Gen 5を、GPU 単体から最大256 GPU規模のスケールアップまで横断して整理した。 - Source: [[@2022__NVIDIA Developer Blog__NVIDIA Hopper Architecture In-Depth]] - Pages created: [[NVIDIA H100]]・[[NVIDIA SHARP]]・[[NVSwitch]]・source 1 件 - Pages updated: entity 4 件・concept 11 件 - Key insight: Hopper の性能向上は FP8 のような演算形式だけでなく、非同期データ移動、SM 間局所性、MIG の隔離、NVLink のスケールアップを組み合わせたシステム設計として現れる。公式の最大値は後続実測のワークロード依存性と併読する必要がある。 ### 2026-08-29 ingest-paper | Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks [[NVIDIA Blackwell]] の GB203/RTX 5080 と Hopper の GH100/H100 PCIe を、PTX/SASS マイクロベンチマーク、Tensor Core、メモリ階層、FP8 D-GEMM、Transformer 推論で比較した研究を取り込んだ。Blackwell は FP4/FP6 MMA、統合 INT32/FP32 ユニット、少数ワープ・高 ILP で優位な一方、評価した大規模 FP8 D-GEMMと global memory 帯域では H100 が優位だった。 - Source: [[@2025__arXiv__Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks]] - Pages created: source 1 件 / entity 6 件 - Pages updated: concept 9 件 / entity 5 件 - Key insight: GPU 世代の理論的な低精度能力は実効性能を保証せず、命令形式、ILP、ワープ数、メモリ階層、カーネル選択、電力状態を一体で測定する必要がある。 ### 2026-08-29 ingest-paper | GPU Cluster for High Performance Computing [[Stony Brook University]]の32 GPU ノード・1 Gigabit Ethernet クラスタで LBM を実装し、30 ノードの `480×400×80` 都市流体シミュレーションを 0.31 秒/ステップ、CPU クラスタ比 4.62 倍で実行した SC'04 論文を取り込んだ。 - Source: [[@2004__SC__GPU Cluster for High Performance Computing]] - Pages created: source 1 件 / concept 1 件([[格子ボルツマン法]]) / entity 6 件 - Pages updated: [[Stony Brook University]] / [[GPU最適化]] / [[GPUクラスタ運用]] / [[HPCインターコネクトベンチマーク]] - Key insight: GPU クラスタの性能は GPU の演算ピークだけでなく、データ配置、GPU–CPU 転送、通信スケジュール、計算とのオーバーラップによって決まる。 ### 2026-08-29 ingest-paper | Benchmarking and Dissecting the Nvidia Hopper GPU Architecture [[NVIDIA Hopper]] の新しい Tensor Core・DPX・TMA・分散共有メモリを、A100・RTX4090 と命令レベルから Llama 推論まで比較した研究を取り込んだ。H800 では `wgmma` が理論ピークの95%超に達する一方、旧来 `mma` は平均62.9%にとどまり、FP8 や非同期機能の効果は行列規模・ブロック形状・電力制約に依存する。 - Source: [[@2024__arXiv__Benchmarking and Dissecting the Nvidia Hopper GPU Architecture]] - Pages created: source 1 件 / concept 3 件 / entity 12 件 - Pages updated: concept 4 件 / entity 7 件 - Key insight: Hopper の世代差は精度追加だけでなく、`wgmma` の非同期発行、SM-to-SM 通信、DPX の配置単位という実行モデルの差として現れる。 ### 2026-08-29 ingest | BPF in the agentic era / BPF in the Agentic Era (LSFMM 2026) [[eBPF]] と BPF の安全境界を保ったまま、Rust とエージェント駆動開発に適した verifier・ランタイム・ツールチェーンへ進化させる提案を、LWN 記事と LSFMM 2026 の 26 枚のスライドから取り込んだ。 - Sources: [[@2026__LWN__BPF in the agentic era]] / [[@2026__BPFConf2026__BPF in the Agentic Era (LSFMM 2026)]] - Pages created: [[BPF verifier]] / [[Rust-BPF]] / [[BPF arena memory]] / [[Alexei Starovoitov]] / [[Daroc Alden]] / [[LWN.net]] / [[Aya]] / [[veristat]] / [[drgn]] / [[bpftool]] / [[rust-for-linux]] - Pages updated: [[eBPF]] / [[BPF]] / [[エージェント型コーディング]] / [[カーネル障害診断]] / [[bpftrace]] / [[libbpf]] / [[Daniel Borkmann]] / [[Steven Rostedt]] - Key insight: **verifier を無効化するのではなく、Rust の構造化診断・実行時検査・arena・widening・標準ツールを組み合わせることで、安全性とエージェントの短いフィードバックループを両立させる。** ### 2026-08-28 ingest-paper | MagmaScope(Li ほか、ICSE-SEIP、2026) [[@2026__ICSE-SEIP__MagmaScope Identifying Root-Cause Changes for Emergency Incident in Large-Scale Cloud Infrastructure]](ICSE-SEIP '26、DOI: 10.1145/3786583.3786903)は、[[ByteDance]] と [[Peking University]] が共同開発した緊急インシデント根本原因変更特定ハイブリッドシステム [[MagmaScope]] の設計・評価・産業実践を報告する。変更チケット+IM グループチャットという非テレメトリ入力を「第ゼロ・第 4 のオペレーショナルモダリティ」として活用し、3 段パイプライン(変更チケット検索→軽量ランキング→LLM エージェント推論)で ByteDance 本番 55 件の緊急インシデントに対して Top@5 74.7%・Top@10 89.8% を達成。その関連付けは「因果推論ではなく意味的理解に基づく」と論文自身が明示する。1 年超本番稼働・10 以上のビジネスグループに展開済み。 - Source: [[@2026__ICSE-SEIP__MagmaScope Identifying Root-Cause Changes for Emergency Incident in Large-Scale Cloud Infrastructure]] - Pages created: [[Zongyang Li]] / [[Ning Wang]] / [[Jiliang Liu]] / [[Yaping Zhang]] / [[Feifan Tong]] / [[Zhaoxing Chen]] / [[Chan Li]] / [[Ming Liu (ByteDance)]] / [[Xiang Zhang (ByteDance)]] / [[MagmaScope]] / [[ByteDance emergency incident dataset]] / [[Change Object Rewrite]] / source page - Pages updated: [[Yifan Wu]] / [[Tong Jia]] / [[Ying Li]] / [[Peking University]] / [[ByteDance]] / [[根本原因分析]] / [[Fault Localization]] / [[LLMによる根本原因分析]] / [[マルチモーダル障害診断]] / [[変更起因インシデント]] / [[インシデント管理]] / [[インシデント調査戦略]] ### 2026-08-28 ingest-paper | A Definition of AGI [[@2025__arXiv__A Definition of AGI]](arXiv:2510.18212v3)は、AGI を十分な教育を受けた成人の認知的な多様性と熟達度で定義し、CHC 理論から一般知識・言語・数学・推論・記憶・知覚・速度の十領域を構成する。GPT-4 の AGI Score は27%、GPT-5 は57%だが、長期記憶保存は両モデルとも0%であり、総合スコアと能力の穴の併存を示す。 - Source: [[@2025__arXiv__A Definition of AGI]] - Pages created: [[AGI]] / [[Cattell-Horn-Carroll理論]] / [[Dawn Song]] / [[Christian Szegedy]] / [[Honglak Lee]] / [[Yarin Gal]] / [[Erik Brynjolfsson]] / [[Sharon Li]] / [[Andy Zou]] / [[Max Tegmark]] / [[Gary Marcus]] / [[Kevin McGrew]] - Pages updated: [[LLM評価]] / [[LLM能力スパース性]] / [[エージェントメモリ]] / [[Dan Hendrycks]] / [[Center for AI Safety]] / [[Long Phan]] / [[Yoshua Bengio]] / [[Bo Li]] 現行の概念一覧: [[concepts/_index#現行コンセプトカタログ]]。 ### 2026-08-25 ingest-thesis | Towards Efficient Generative Large Language Model Serving `wiki-ingest-thesis` skill(ローカル PDF、37 ページ)。Xupeng Miao(Purdue University)・Gabriele Oliaro・Zhihao Zhang・Xinhao Cheng・Hongyi Jin・Tianqi Chen・Zhihao Jia(Carnegie Mellon University)による ACM Computing Surveys 58(1):15。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みした。本バッチ 20 文書の最後にあたる。** - Hub entity: [[Towards Efficient Generative Large Language Model Serving]] - Chapters: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 1 Introduction and Background]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.1 Taxonomy - Algorithmic Innovation]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 5 Benchmarks and Connection with Other Surveys]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 7 Future Direction]] / [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 8 Conclusion]](7 件) - Pages created: source 7 件、entity 6 件([[Towards Efficient Generative Large Language Model Serving]]・[[FasterTransformer]]・[[FlexFlow-Serve]]・[[ZeRO-Inference]]・[[LightLLM]]・[[MLC-LLM]]) - Pages updated: [[KVキャッシュ管理]]・[[スパース注意]]・[[動的バッチングと継続的バッチング]]・[[本番接地型ベンチマーク]](concept 4 件)、index/hot/log/sources/_index/manifest - Key insight: **分類の軸が「LLM の計算セマンティクスを変えるかどうか」に置かれている**。アルゴリズム的革新は出力の分布や計算そのものに手を入れ、システム最適化は入れない。この線引きが 2 本柱の意味であり、**投機的復号がアルゴリズム側にありながら「出力分布を変えない」という例外的な位置を占める**ことが際立つ。 - サービング固有のトレードオフ: **低レイテンシと高スループットが「相補的だがしばしば競合する」双対の目標**という診断が実装比較の読み方を決めている。Table 2 の優先目標列は、[[vLLM]] が PagedAttention でバッチサイズを拡大してスループット側へ、[[FlexFlow-Serve]] が SpecInfer で逐次復号を速めてレイテンシ側へ軸足を置くことを示す。推論手法単体のサーベイには現れない軸である。 - 同主題サーベイとの関係: [[A Survey on Efficient Inference for Large Language Models]](Zhou ほか、2024)は推論の非効率の**原因分析**から 3 階層を導くのに対し、本サーベイは**低レイテンシと高スループットの同時要求という運用上の設定**を出発点に置く。第 3.2 章があちらの system-level 章とほぼ守備範囲が重なる。**なお本サーベイの参考文献に Zhou ほかへの直接引用は見当たらず、担当は推測でリンクを張らずその旨を記録した。** - ベンチマークの不在: BurstGPT・Azure という本番トレースへ接地していてもなお、モデル構成 × ハードウェア × リクエスト負荷という評価設定空間の網羅性が担保されなければ結論の信頼性は損なわれる([[本番接地型ベンチマーク]] に記録)。 - vault との接続: [[スパース注意]] に、本サーベイ Table 1 の 4 分類が既存の「静的/動的」2 軸では捉えきれない**第 3 の軸としてハッシュベース**を明らかにすること、および同じ手法群が既存ノートではキャッシュ管理層、本サーベイではアテンション計算層という**異なる層で語られる**ことを記録した。 - 図表: 埋め込み 3 点、missing 0 / UNUSED 0。Table 1・Table 2 は Markdown 表へ忠実に転記した。 - 章境界: PDF のレイアウト上、表が図版としてページ上部に置かれ本文が回り込む箇所で食い込みが集中した。とくに **Algorithm 1(自己回帰復号の疑似コード)と §2.4 の 5 課題が、参照元の §2.3 本文とは別ファイル(`ch-31.txt` 冒頭)に置かれていた**ため第 1 章へ統合した。§3 全体の総括段落も Table 2 の直後(`ch-04.txt` 内)にあったため第 3.2 章へ帰属させた。各担当が根拠を `## 出典` に残した。 - 旧ページの退役: 1 枚もの `@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving` を削除し、被リンク 38 件をハブ entity へ張り替えた。旧ページ専用 attachment 5 点も削除した。 ### 2026-08-25 ingest-thesis | Efficient Training of Large Language Models on Distributed Infrastructures `wiki-ingest-thesis` skill(ローカル PDF、42 ページ)。Jiangfei Duan ほか(Shanghai AI Laboratory / CUHK / Fudan University / Shanghai Jiao Tong University / Nanyang Technological University / Peking University)による Vicinagearth(Springer)掲載サーベイ(arXiv:2407.20018)。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みした。** - Hub entity: [[Efficient Training of Large Language Models on Distributed Infrastructures]] - Chapters: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 1 Introduction]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 2 Background]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 3 Infrastructure for LLM Training]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 4 Parallelism Schemes for LLM Training]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 5 Computation Optimizations]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 6 Memory Optimizations]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 7 Communication Optimizations]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 8 Fault Tolerance]] / [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 9 Conclusion and Outlooks]](9 件) - Pages created: source 9 件、entity 1 件([[Efficient Training of Large Language Models on Distributed Infrastructures]]) - Pages updated: [[LLM分散学習]]・[[テンソル並列]]・[[GPUレジリエンス]]・[[チェックポイント]]・[[並列化戦略]]・[[混合精度訓練]]・[[アクティベーションオフロード]](concept 7 件)、index/hot/log/sources/_index/manifest - Key insight: **「訓練を止めないこと」を独立した章として立てる**点が本サーベイの構成上の特徴である。推論側のサーベイ([[A Survey on Efficient Inference for Large Language Models]]・[[Towards Efficient Generative Large Language Model Serving]])には対応する章がない。数週間から数ヶ月続く訓練では、障害対応そのものが効率の主要な決定要因になる。 - その主張を支える実測: Meta の LLaMA3 は 16,384 GPU・54 日の事前学習中に **466 回のジョブ中断**を経験し **78% がハードウェア起因**。Alibaba の**単一ノード日次 1.5% という障害率は 1,000 GPU 規模では日次 84.8%** になる。極めつけは OPT-175B で、**MFU から見積もった理想 25 日に対し実際は 57 日、全体の 56% が障害対応**に費やされた。 - 効率の劣化: PTD-P の MFU 52% に対し、5 倍の GPU 規模の LLaMA3 は MFU 38〜41%。この差が縮まるのか規模に対する構造的な代償なのかは本サーベイからは決まらない([[LLM分散学習]] に未解決の問いとして記録)。 - 通信の階層構造: GPT/OPT-175B の実測で **GPU ペアの 99% が一切トラフィックを持たず、0.25% 未満のペア**が並列化のトラフィックを担う。この疎さが rail-only トポロジやインネットワーク集約の根拠になる。 - vault との接続: [[GPUレジリエンス]] に C4 の「エラーの 82.5% がノード/デバイスに局在」と既存ノートの HeaRank のホストレベル集中の突き合わせを、[[テンソル並列]] に**アテンションヘッド数がテンソル並列とシーケンス並列に共通する離散的な並列度の上限**として現れる点を、[[混合精度訓練]] に FP8 未満で安定化手法が「精度の分離」から値分布の変換へ移る流れを記録した。 - 図表: 埋め込み 15 点、missing 0 / UNUSED 0。 - 旧ページの退役: 1 枚もの `@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey` を削除し、被リンク 82 件をハブ entity へ張り替えた。旧ページ専用 attachment 6 点も削除した。 ### 2026-08-29 ingest | batch (2 sources: BPF in the Agentic Era) [[Alexei Starovoitov]] が LSFMM/BPF 2026 で提示した **Rust ネイティブ BPF 再設計**を、LWN 記事と講演スライドの 2 ソースで取り込んだ。[[@2026__LSFMM__BPF in the Agentic Era]] は 26 枚の設計蓝图(アリーナメモリ、widening、PTR_TO_FUNC、panic=unwind+bpf_throw、上流 rustc/LLVM/libbpf パイプライン)。[[@2026__LWN__BPF in the agentic era]] は会場議論(verifier 二重役割分離、コードレビュー危機、Rostedt vs Starovoitov のエージェント依存論争)を補完する。 - Sources: [[@2026__LWN__BPF in the agentic era]] / [[@2026__LSFMM__BPF in the Agentic Era]] - Pages created: [[Alexei Starovoitov]] / [[drgn]] / [[Aya]] / [[Rust-BPF]] / 2 source pages - Pages updated: [[eBPF]] / [[bpftrace]] / [[Daniel Borkmann]] / [[Steven Rostedt]] ### 2026-08-25 ingest-thesis | A Survey on Efficient Inference for Large Language Models `wiki-ingest-thesis` skill(ローカル PDF、36 ページ)。Zixuan Zhou ほか(Infinigence-AI / Tsinghua University / Shanghai Jiao Tong University / Peking University)による arXiv プレプリント。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みした。** - Hub entity: [[A Survey on Efficient Inference for Large Language Models]] - Chapters: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 1 Introduction]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 2 Preliminaries]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 3 Taxonomy]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 4 Data-level Optimization]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.0 Model-level Optimization - Efficient Structure Design]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.2 Model Compression - Sparsification, Structure Optimization, Distillation, and Dynamic Inference]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.0 System-level Optimization - Inference Engine]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.1 System-level Optimization - Serving System]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.2 System-level Optimization - Hardware Accelerator and Framework Comparison]] / [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 7 Discussions of Key Application Scenarios and Conclusion]](11 件) - Pages created: source 11 件、entity 8 件([[A Survey on Efficient Inference for Large Language Models]]・[[AWQ]]・[[GPTQ]]・[[SmoothQuant]]・[[SparseGPT]]・[[Wanda]]・[[FlashDecoding++]]・[[ORCA]]) - Pages updated: [[Infinigence-AI]]・[[Zixuan Zhou]](entity 2 件)、[[KVキャッシュ管理]]・[[LLMサービング管理]]・[[LLM推論]]・[[動的バッチングと継続的バッチング]]・[[枝刈り]]・[[状態空間モデル]]・[[知識蒸留]]・[[線形注意]]・[[量子化]](concept 9 件)、index/hot/log/sources/_index/manifest - Key insight: **3 階層が「何を代償に効率を買うか」で切られている**。data-level は再学習不要、model-level は**性能に対して非可逆**、system-level は**性能に対して可逆**。効率化技術を選ぶときの意思決定軸が、そのまま分類軸になっている。 - 実測に踏み込む: 量子化(Table 4)と推論エンジン(Table 6)は著者ら自身が測定しており、**重みのみ量子化(W4A16, AWQ)が decoding とエンドツーエンドの遅延を改善する一方で prefilling 遅延はむしろ悪化しうる**、**バッチサイズと入力長が増えるほど高速化幅は縮む**という、手法の列挙だけでは出てこない知見が得られている。 - Prefilling / Decoding の非対称性が全階層を貫く: Prefilling は GEMM で演算律速、Decoding は GEMV でメモリアクセス律速。この違いが量子化方式の使い分け・投機的デコーディングの成立条件・Prefill/Decode 分離アーキテクチャ(Splitwise・TetriInfer・DistServe)のすべての根拠になっている。 - 空白: 第 7 章は**効率化技術が LLM の安全性を損なうかどうかがほとんど扱われていない**と明示する。3 階層の格子のどこにも安全性の軸がないことが、この空白を可視化している。 - 図表: 埋め込み 17 点(Figure 1〜17)、missing 0 / UNUSED 0。Table 1〜6 は Markdown 表へ忠実に転記した。 - 章境界と図表帰属の訂正 3 件: (a) Table 1 と前後の段落は物理的に `ch-02.txt`(PDF p2)にあるが本文上は §1 に属するため第 1 章へ帰属、(b) Figure 2・3 は briefing の割り当てでは第 3 章だが §2.2 / §2.3 の本文中で論じられるため第 2 章へ埋め込み、(c) Table 2 は割り当て上は第 5.1 章だが内容は §5.1.3 なので第 5.0 章へ転記。いずれも担当が根拠を `## 出典` に残した。 - **クロップ不良の自力修復**: `p003-Figure2.png` と `p003-Figure3.png` が**どちらも 2 つの図を混ぜた同一の合成クロップ**だったため、担当が PDF p3 を 300dpi で再レンダリングして 2 図を別々に切り直した。 - 旧ページの退役: 1 枚もの `@2024__arXiv__A Survey on Efficient Inference for Large Language Models` を削除し、被リンク 17 件をハブ entity へ張り替えた。旧ページ専用 attachment 10 点も削除した。 ### 2026-08-25 ingest-thesis | LLM4Log `wiki-ingest-thesis` skill(ローカル PDF、54 ページ)。Zeyang Ma・Jinqiu Yang・Tse-Hsun (Peter) Chen(Concordia University SPEAR lab ほか)による arXiv プレプリント。2020〜2025 年の 145 論文(162 task-paper レコード)が対象。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みした。** - Hub entity: [[LLM4Log]] - Chapters: [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 1 Introduction]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 2 Survey Methodology]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 3 LLM Background and Taxonomy for Log Analysis]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 4 Logging Statement Generation and Maintenance]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 5 Log Parsing]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.1 Downstream Log Analysis Tasks - Log Representation]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.2 Downstream Log Analysis Tasks - Anomaly Detection]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.3 Downstream Log Analysis Tasks - Failure Prediction and Root Cause Analysis]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.5 Downstream Log Analysis Tasks - Log Summarization]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 7 Cross-Cutting Insights and Future Directions]] / [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 8 Conclusion]](11 件) - Pages created: source 11 件、entity 1 件([[LLM4Log]]) - Pages updated: [[LLM向け情報検索]]・[[ログベース異常検知]]・[[障害予測]]・[[根本原因分析]]・[[本番接地型ベンチマーク]](concept 5 件)、index/hot/log/sources/_index/manifest - Key insight: **中核的主張は「LLM が最も効くのは安定した反復構文でなくドリフト下の意味的変動である」**。LLM の価値は前処理を不要にすることではなく、**過去に観測された表層形式への密結合から脱すること**にある。ログパース(第 5 章)でこの論点が最も先鋭に現れる。 - 7 タスク横断で共通する形: **成功システムは無制約な end-to-end 生成に頼らない**。前処理・検索・フィルタ・グルーピング・軽量スコアリングで探索空間を絞ってから、強い LLM を意味解釈・説明・レポーティングに**選択的に呼び出す層状設計**を採る([[LLM向け情報検索]] に記録)。 - 評価実践の断片化: 162 レコード中、産業/proprietary 文脈への言及は 25、人手/ユーザ study は 17、deployment 系メトリクスは 23、**明確な deployment 指向の証拠を示すのはわずか 5 件**。HDFS・BGL への依存が運用現実を部分的にしか反映しない([[本番接地型ベンチマーク]] に記録)。 - タスク分布の偏り: 異常検知 70 レコード(重複排除後 60・43.2%)とログパース 37(29・22.8%)で約 2/3。障害予測とログ要約は各 3(1)にとどまる。RCA は 25(20・15.4%)で近年急増しており、関心が「何が壊れたか」から「なぜ・どう対処するか」へ移った。 - 上流を含める構成: 本レビューは**ロギング文の生成・保守という上流から**扱う点で先行サーベイと分かれる。[[A Survey of AIOps in the Era of Large Language Models]] に対しては「あちらはログ・メトリクス・トレース・アラート・インシデントにまたがるが、本レビューはランタイムログが中心的証拠源であるときに絞る」という差分を主張する(第 2 章 Table 3)。 - **件数の訂正**: 第 6.2 章の初稿が異常検知を「71 論文」としていたが、これは**再取り込み前の 1 枚もの source ページに書かれていた数値**が briefing 経由で持ち込まれたもので原本には現れない。オーケストレータが Figure 3 を確認して 70(重複排除後 60)・43.2% へ訂正し、第 6.3 章の件数表記も Figure 3 に揃えた。 - 図表: 埋め込み 6 点、missing 0 / UNUSED 0。Table 1〜9 は Markdown 表へ忠実に転記した。**Table 3 が第 2 章(画像)と第 3 章(Markdown 表)に二重掲載されていた**ため、内容が §2.3 に属することからオーケストレータが第 2 章へ Markdown 表として一本化し、第 3 章を参照のみに改めて画像を削除した。第 6.1 章は 2 図をコピーしながら埋め込みを落としていたため補填した。 - 章境界: 全章で章末が次章ファイル冒頭へ食い込んでいた(`ch-03` 冒頭 40 行 → 第 2 章、`ch-04` 冒頭 36 行 → 第 3 章、`ch-05` 冒頭 18 行 → 第 4 章、`ch-61` 冒頭 7 行 → 第 5 章、`ch-62` 冒頭 13 行 → 第 6.1 章、`ch-63` 冒頭 29 行 → 第 6.2 章、`ch-65` 冒頭 36 行 → 第 6.3 章、`ch-07` 冒頭 5 行 → 第 6.5 章)。各担当が節番号を根拠に帰属を判断し `## 出典` に残した。 - **entity 名の衝突を 1 件検出**: ログパースの手法 `LILAC` を entity 化しようとしたところ、既存 [[Lilac]] が**別実体**(IaC lifting のニューロシンボリックパイプライン)として存在した。大文字小文字だけが違う名前はファイル名衝突を起こすため entity 化を回避した。 - 旧ページの退役: 1 枚もの `@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis` を削除し、被リンク 107 件をハブ entity へ張り替えた。旧ページ専用 attachment 9 点も削除した。 ### 2026-08-25 ingest-thesis | A Survey of LLM × DATA `wiki-ingest-thesis` skill(ローカル PDF、58 ページ)。Xuanhe Zhou ほか(Tsinghua University / Shanghai Jiao Tong University / Alibaba Group / Shanghai AI Laboratory)による arXiv プレプリント(cs.DB)。400 超の論文が対象。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みした。** - Hub entity: [[A Survey of LLM × DATA]] - Chapters: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 1 INTRODUCTION]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.4 Data Storage for LLM]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.5 Data Serving for LLM]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.1 LLM for Data Manipulation]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.2 LLM for Data Analysis]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.3 LLM for Data System Optimization]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 5 Conclusion]](12 件) - Pages created: source 12 件、entity 2 件([[A Survey of LLM × DATA]]・[[R-Bot]]) - Pages updated: [[3FS]]・[[D-Bot]]・[[DB-GPT]](entity 3 件)、[[KVキャッシュ管理]]・[[LLMスケーリング則]]・[[クエリオプティマイザ]]・[[サンプリング手法]]・[[チェックポイント]]・[[データ品質SLO]]・[[データベース自律診断]]・[[データ統合]]・[[データ発見]]・[[分散ファイルシステムとオブジェクトストア]]・[[言語モデル事前学習]](concept 11 件)、index/hot/log/sources/_index/manifest - Key insight: **DATA4LLM と LLM4DATA を対称に配置する構成が本サーベイの骨格**であり、独自貢献の **IaaS 4 次元**(inclusiveness 包括性・abundance 充足性・articulation 明瞭性・sanitization 無害化)がデータ品質の評価軸として全章を貫く。とくに abundance 次元はデータ混合手法群と**同一の引用文献群を共有**しており、次元の定義と技術が原文中で直結している。 - LLM4DATA 側の構図: 構成チューニングとクエリ最適化は「プロンプトエンジニアリング → RAG による経験強化 → ファインチューニングによる目標整合」の 3 系統で整理される一方、**異常診断だけがマルチエージェント協調とローカライズド蒸留の 2 系統を追加して 4 系統になる**。診断タスクが他の 2 つより手法的に厚い([[データベース自律診断]] に記録)。 - vault との接続: 3FS の CRAQ チェーンレプリケーションとページキャッシュ完全無効化を [[分散ファイルシステムとオブジェクトストア]] に、Bamboo / Oobleck / ReCycle の冗長計算 3 系統を [[チェックポイント]] に、KV シュリンキング・配置・インデキシングの 3 方向を [[KVキャッシュ管理]] に記録した。D-CPT・CMR・BiMix が Chinchilla 型冪乗則を**ドメイン混合比率という第 3 軸へ拡張**している点を [[LLMスケーリング則]] に記録した。 - 原本内の不整合 2 件: (a) 第 5 章の結論は課題を「DATA4LLM・LLM4DATA・hybrid data and LLM optimization」の 3 観点で提示したと述べるが、**第 4 章本文は 2 節構成のみで hybrid に対応する節が存在しない**。(b) 第 2.3 章の範囲の節番号が "2.2.7.x" と印字されているが内容は §2.3.7 である。いずれも推測で補完せず記録した。 - 章境界の処理: 二段組みレイアウトのため章末が次章ファイル冒頭へ食い込む箇所が多発した。各担当が `pdftotext` で原本ページを再抽出し、左カラム → 右カラムの順に読み直して本文を再構成し、帰属の判断と根拠を `## 出典` に残した。 - 図表: 埋め込み 10 点、missing 0 / UNUSED 0。Table 1〜7 は Markdown 表へ忠実に転記した。**自動抽出のクロップ不良を 2 件補修**した——Figure 3 は Table 1 と混在しキャプションが切れていたため第 1 章の担当が 300dpi で再レンダリングして切り直し、Figure 5 は (A) パープレキシティベースのパネルが欠落していたためオーケストレータが PDF の描画範囲を直接指定して再クロップした。 - 旧ページの退役: 1 枚もの `@2025__arXiv__A Survey of LLM × DATA` を削除し、被リンク 15 件をハブ entity へ張り替えた。旧ページ専用 attachment 10 点も削除した。 ### 2026-08-25 ingest-thesis | Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications `wiki-ingest-thesis` skill(ローカル PDF、27 ページ)。Ruyue Xin・Jingye Wang・Peng Chen・Zhiming Zhao ほか(University of Amsterdam / Multiscale Networked Systems / Xihua University / China University of Geosciences (Beijing))による ACM Computing Surveys 掲載のレビュー。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みした。** - Hub entity: [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]] - Chapters: [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 1 Introduction]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 2 Trustworthiness Requirements and Performance Diagnosis Systems]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.0 State-of-the-Art Technologies - Overview]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.1 Data Collection]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.2 Data Preprocessing]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.3 Performance Anomaly Detection]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.4 Root Cause Localization]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.5 System-Level Trustworthiness Requirements]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 4 Future Research Directions and Opportunities]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 5 Conclusion]](10 件) - Pages created: source 10 件、entity 1 件([[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]]) - Pages updated: [[AIOps]]・[[Fault Localization]]・[[差分プライバシー]]・[[根本原因分析]]・[[異常検知]](concept 5 件)、index/hot/log/sources/_index/manifest - Key insight: **貢献は新手法ではなく「格子」そのものにある**。EU AI HLEG の 7 要件から抽出した **6 つの技術的要件**(データプライバシー・公平性・頑健性・説明可能性・効率性・人間の介入)を、**4 構成要素のフレームワーク**(データ収集 → データ前処理 → 異常検知 → 根本原因箇所特定)へ当てはめる格子を全章に貫き通す。**格子の空白がそのまま研究の空白として読める**ため、「監視メトリクスの因果推論ベース根本原因箇所特定の頑健性研究は限定的」「根本原因箇所特定における人間の介入研究は少ない」と名指しできる。 - 構成要素ごとの要件の非対称性: 公平性はデータ収集と異常検知にのみ現れ、**異常検知だけが 4 要件すべてを課される**。データプライバシーと人間の介入は特定の構成要素に紐づかない**システムレベル要件**として第 3.5 章に切り出される。 - vault との接続: [[異常検知]] に、**説明可能性が 6 要件のうち唯一「EU の透明性要件からの直接翻訳」という定式化経路を持つ**ことを記録し、Chandola 2009 → Soldani & Brogi 2021 → 本レビュー 2025 という 16 年の変遷の終点として位置づけた。また本レビューが定式化する HITL 要件が、既に記録済みの Alibaba のオペレータフィードバックループ(2017 年)に 8 年越しの理論的裏づけを与える点も記録した。 - 同時期のサーベイとの呼応: [[Anomaly detection and root-cause identification in microservices]](Barata ほか 2026)の TDAI 7 次元と、本レビューの 6 要件 × 4 構成要素は、**独立した 2 つのサーベイが同時期に「診断システムの信頼をどう分解するか」を主題に選んだ**という関係にある。 - 将来方向の組織原理の対比: [[A Survey of AIOps in the Era of Large Language Models]] が工程順(タスク別)に空白を並べるのに対し、本レビューは要件別に並べる。同じ ACM CSUR 誌の 2 つの独立サーベイの対比を [[AIOps]] に記録した。 - 図表の帰属規則を発見: **Figure 7〜10 はいずれも印字位置が内容上の帰属章より 1 章分後ろへずれる**(次章の PDF ページ冒頭に浮動配置される)。担当ごとに判断が割れたため、オーケストレータが規則として確定させ、Figure 7 を第 3.2 章へ補填、Figure 10 の第 4 章側の重複埋め込みを削除した。 - 図表: 埋め込み 10 点、missing 0 / UNUSED 0。Table 1〜3 は Markdown 表へ忠実に転記した。Table 3 は pdftotext の列順が崩れていたため、担当が画像を正として転記した。 - 旧ページの退役: 1 枚もの `@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review` を削除し、被リンク 48 件をハブ entity へ張り替えた。旧ページ専用 attachment 10 点も削除した。 ### 2026-08-25 ingest-thesis | Anomaly detection and root-cause identification in microservices `wiki-ingest-thesis` skill(ローカル PDF、42 ページ)。Luís M. Barata ほか(Universidade da Beira Interior / Instituto Politécnico de Castelo Branco ほか)による Cluster Computing 29 巻掲載のサーベイ。2012〜2025 年の 117 件が対象。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みした。** - Hub entity: [[Anomaly detection and root-cause identification in microservices]] - Chapters: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 1 Introduction]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 2 Related surveys and contribution]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 3 Background on microservices and anomaly detection]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.1 Anomaly detection in a microservices environment - Overview]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.2 Data collection methods]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.3 Methods to identify anomalies in microservices]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.4 Types of anomalies detected]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.5 Root-cause identification]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.7 Methods comparison]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 5 Discussion]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 6 Challenges, open issues, and directions to future investigations]] / [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 7 Conclusion]](13 件) - Pages created: source 13 件、entity 1 件([[Anomaly detection and root-cause identification in microservices]]) - Pages updated: [[AIOps Challenge]]・[[GAIA Dataset]]・[[Sock Shop]]・[[Train-Ticket]](entity 4 件)、[[オブザーバビリティ]]・[[マイクロサービスアーキテクチャ]]・[[マイクロサービスベンチマーク]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[異常検知]](concept 6 件)、index/hot/log/sources/_index/manifest - Key insight: **同主題サーベイ 3 件のうち最も新しく、唯一「定量的な手法比較」に踏み込む**。先行 2 件([[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] 2021・[[Failure Diagnosis in Microservice Systems]] 2024)はいずれも精度の横並び比較を避けていた。本サーベイはカテゴリ別の平均性能まで集計する一方、**第 5 章で「データセットとテストベッドの違い・欠測メトリクスにより手法間比較は本質的に難しい」と自ら明言**しており、数値は序列ではなく傾向として読むべきものになっている。 - 新しい切り口: **Trusted Distributed AI(TDAI)**。信頼をモデル単体ではなく分散データ・因果的依存関係・システム全体の挙動にわたって確立する枠組みとして提示し、信頼性・一貫性・説明可能性・頑健性・因果妥当性・スケーラビリティ・テレメトリ完全性の 7 次元へ分解する(Table 10)。先行 2 サーベイにはない軸である。 - 実務資源の更新: 第 4.6 章が 22 件のテストベッドを集計し、Train Ticket 31%・Sock Shop 22% という利用比率とともに **Sock Shop の非推奨化**を記録する。[[マイクロサービスベンチマーク]] に反映した。 - 分野の偏り: 採択論文の **70%(直近 12 か月では 87%)が中国機関**に属し、86% が 2020〜2024 年に集中する。分類体系の一般性を読むうえでの前提になる。 - 原本内の不整合: abstract・第 2 章の **117 件**と第 4.1 章の **143 件**、検索件数 **1,700 件**と **10,485 件**が食い違う。原本を確認したうえで両方を原文どおり記録し、解消していない。第 6 章 §6.2 でも本文の「4 つの相補的次元」と Table 10 の 7 次元が一致しない。 - 図表: 埋め込み 13 点、missing 0 / UNUSED 0。Table 10 は Markdown 表へ忠実に転記した。Fig. 5 は印字位置が第 4.5 章側だが、論じている対象が §4.4 の異常 3 分類であるため第 4.4 章へ埋め込んだ。 - 旧ページの退役: 1 枚もの `@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey` を削除し、被リンク 93 件をハブ entity へ張り替えた。旧ページ専用 attachment 6 点も削除した。 ### 2026-08-25 ingest-thesis | A Survey on Failure Analysis and Fault Injection in AI Systems `wiki-ingest-thesis` skill(ローカル PDF、42 ページ)。Guangba Yu ほか(Sun Yat-Sen University / University of Naples Federico II / Chinese University of Hong Kong)による ACM TOSEM 掲載のサーベイ。142 件が対象。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[A Survey on Failure Analysis and Fault Injection in AI Systems]] - Chapters: [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 1 Introduction]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 2 Background and Definitions]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 3 Survey Methodology]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 4 FA and FI in AI Service]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 5 FA and FI in AI Model]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 6 FA and FI for AI Framework]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 7 FA and FI for AI Toolkit]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 8 FA and FI for AI Platform]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 9 FA and FI for AI Infrastructure]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 10 Threats to Validity]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 11 Future Opportunities of FI in AI Systems]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 12 Conclusion]](12 件) - Pages created: source 12 件、entity 1 件([[A Survey on Failure Analysis and Fault Injection in AI Systems]]) - Pages updated: [[CUDA]]・[[ChaosBlade]]・[[NCCL]]・[[PyTorch]]・[[TensorFlow]](entity 5 件)、[[GPUレジリエンス]]・[[敵対的摂動]]・[[運用障害分析]]・[[量子化]]・[[障害注入]](concept 5 件)、index/hot/log/manifest - Key insight: **本サーベイの独自性は「FI ツールが再現できていない実障害」を層ごとに名指しした点にある**。RQ1(実障害)と RQ2(FI が模擬できる障害)を別々に集計し、RQ3 でその差集合を各層の表として明示する。結果として「どの層のどの障害型に FI ツールが存在しないか」が一覧できる。 - 6 層を並べて見えること: **未対応の障害に層をまたぐ共通性がある**。NCCL Fault と NVLink Fault は AI Framework 層と AI Toolkit 層の両方で未対応として現れ、GPU 資源競合は AI Platform 層で最大のギャップとされる。**分散 GPU 環境に固有の障害が、層を問わず FI の空白になっている**。 - FI の実装様式の分断: AI Framework 層のツールは**すべて計装ベース**、AI Toolkit 層は**ファジング中心**。同じ「障害注入」という語が層によって別の技法を指しており、第 11 章の「フレームワーク横断の統一ツール」はこの分断への応答として読める。 - vault との接続: [[GPUレジリエンス]] に、本サーベイのソフトウェア/シミュレーション FI ツール群と本番 LLM 学習クラスタ(Delta・ByteDance)の実測統計との**方法論的断絶**、および HPC 時代(Titan・Blue Waters)からの系譜を記録した。[[量子化]] に **DeepMutation++ の精度削減演算子が高速化目的の量子化と「同じ操作・正反対の目的」**である対比を記録した。 - 原本の異常 2 件: Figure 5 の印字キャプション("Distribution of studies across layers")と実際のグラフ(年別研究数のヒストグラム)が不一致。§3.4 末尾の Natella らへの言及が文の途中で途切れ、原本全文にも続きが存在しない。いずれも推測補完せず注記した。 - 図表: 埋め込み 7 点。手法一覧表(Table 2〜19)は Markdown 表へ忠実に転記した。Figure 1(6 層立体図)は当初 Table 1 と 1 枚に混在してクロップされていたため、左段のみに切り出し直して補填した。 - 旧ページの退役: 1 枚もの `@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | Failure Diagnosis in Microservice Systems `wiki-ingest-thesis` skill(ローカル PDF、52 ページ)。Shenglin Zhang ほか(Nankai University / Microsoft / Tsinghua University)による 2024 年のサーベイ。2003 年以降の 98 本が対象。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[Failure Diagnosis in Microservice Systems]] - Chapters: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 1 Introduction]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 2 Methodology]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 3 Terminologies]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.1 Failure Diagnosis Through Logs]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.2 Failure Diagnosis Through Metrics]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.3 Failure Diagnosis Through Traces]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.4 Failure Diagnosis Through Multimodal Data]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 5 Discussion]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 7 Related Work]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 8 Conclusions]](11 件) - Pages created: source 11 件、entity 3 件([[Failure Diagnosis in Microservice Systems]]・[[AIOps Challenge]]・[[Loghub]]) - Pages updated: entity 17 件、[[Fault Localization]]・[[マイクロサービスアーキテクチャ]]・[[マイクロサービスベンチマーク]]・[[マルチモーダル障害診断]]・[[メトリクス削減]]・[[分散トレーシング]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[ログ解析]](concept 9 件)、index/hot/log/manifest - 章構成の判断: 原本の第 4 章が 25 ページあり、**データモダリティ別の下位節が本サーベイの主軸**をなす。1 枚に押し込むと分類が失われるため §4.1〜§4.4 を独立章として切り出し、全 8 章 → 全 11 章に組み直した。 - Key insight: **マルチモーダルが独立カテゴリに昇格した**のが先行サーベイとの最大の差である。[[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]](2021)はデータ源を 3 分類としたが、本サーベイ(2024)は第 4 のカテゴリとしてマルチモーダルを立て、その内部を融合の段階(result / model / feature)で細分する。**3 年で融合そのものが研究対象になった。** - 定量比較を最後まで行わない: 第 4 章の表も第 5 章も個別手法の precision/recall/F1 を報告しない(分類列のみ)。98 本を集めた包括サーベイが精度の横並び比較に踏み込まないという選択は、Soldani & Brogi(2021)が「定量比較は範囲外」と明示したのと同じ姿勢であり、**評価環境・データセットが揃わない状況が 3 年間変わっていない**ことを示す。 - 第 6 章の実務資源: 公開データセット・ツールキット 20 種・ランキング指標の定義を集約し、**公開ツールキット率 21.43%** という再現性の指標も示す。[[マイクロサービスベンチマーク]] に AIOps Challenge・GAIA のような産業界提供・非公開環境由来のデータセットという第 3 の出自が加わった。 - 既存 wiki の訂正: [[根本原因分析]] の以前の記述が本サーベイの参照 [130] を「T-Rank」としていたが、第 5 章担当の報告を受けて原本の参考文献リストを確認し `[130] Yu Gan et al. 2023. Sleuth` へ訂正した。 - 図表: 埋め込み 7 点。手法一覧表(Table 3〜6、計 98 手法分)は Markdown 表へ忠実に転記した。**表の「報告値」列は原本に数値記載がないため「記載なし」と明記**(数値の捏造を回避)。 - 旧ページの退役: 1 枚もの `@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | A Survey of AIOps in the Era of Large Language Models `wiki-ingest-thesis` skill(ローカル PDF、35 ページ)。Lingzhe Zhang ほか(Peking University / Tsinghua University / HKUST(Guangzhou)/ University of Illinois Chicago)による ACM Computing Surveys 掲載のサーベイ。2020 年 1 月〜2024 年 12 月を対象。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[A Survey of AIOps in the Era of Large Language Models]] - Chapters: [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 1 Introduction]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 2 Systematic Review Process]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 3 RQ1 - Transformations in Data with LLM Integration]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 4 RQ2 - Evolving Tasks in AIOps with LLMs]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 5 RQ3 - LLM-based Methods for AIOps]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 6 RQ4 - Evaluating LLM-based AIOps]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 7 Challenges and Future Directions]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 8 Conclusion]](8 件) - Pages created: source 8 件、entity 1 件([[A Survey of AIOps in the Era of Large Language Models]]) - Pages updated: [[Tsinghua University]](entity 1 件)、[[AIOps]]・[[Fault Localization]]・[[LLMによる根本原因分析]]・[[ソフトウェアエイジング]]・[[テレメトリ]]・[[ログ解析]]・[[分類モデルの評価指標]]・[[根本原因分析]]・[[異常検知]]・[[障害緩和]](concept 10 件)、index/hot/log/manifest - Key insight: **章構成が研究設問と一対一に対応し、工程順(データ → タスク → 手法 → 評価)に追跡することで空白の在り処が見える**。とりわけ **RQ1 で扱われるトレースデータには LLM ベース手法が皆無**であり、第 7 章はこれを「複雑さと量のゆえ」と説明する。データ源ごとの取り組みの濃淡がそのまま研究の空白になっている。 - 新規タスクの性格: 第 4 章が挙げる LLM 時代の新規 5 タスクのうち、自動実行を除く 4 つ(根本原因レポート生成・支援型質問応答・コマンド推薦・スクリプト生成)は人間の作業を助ける方向にある。**LLM は AIOps の自動化を進めたというより、人間との接点を増やした**と読める。 - 評価の変質: 第 6 章の評価 4 分類のうち従来からあるのは分類タスクの指標だけで、生成・実行・手動評価は LLM 統合を前提に新たに必要になった。[[A Survey of Online Failure Prediction Methods]](2010)が確立した混同行列ベースの体系から 15 年で、**測るべき対象そのものが変わった**([[分類モデルの評価指標]] に記録)。 - Notaro ほか(2021)との対比: [[A Survey of AIOps Methods for Failure Management]] は「介入の時間窓 × 対象問題」で分類し障害管理に絞るのに対し、本サーベイは「LLM による変容の 4 側面」で切る。前者は**何を解くか**、後者は**何が変わったか**を軸にしている。 - 原本内の不整合 3 件: (a) アブストラクトは「183 本」だが §2.3 本文は「163 本」、(b) §2.2 冒頭の平文が RQ2 と RQ3 の対応を §1.3 の定義と逆に書く、(c) Table 1 が Notaro ほか(2021)を「Paolop et al.」と誤記。いずれも推測で解決せず原文どおり転記して各章に注記した。 - 図表: 埋め込み 11 点。表は Markdown 表へ忠実に転記した。 - 旧ページの退役: 1 枚もの `@2025__CSUR__A Survey of AIOps in the Era of Large Language Models` を削除し、被リンクをハブ entity へ張り替えた。旧ページ専用の attachment 7 点も削除した。 ### 2026-08-25 ingest-thesis | D'ya like DAGs? A Survey on Structure Learning and Causal Discovery `wiki-ingest-thesis` skill(ローカル PDF、35 ページ)。Matthew J. Vowels・Necati Cihan Camgoz・Richard Bowden(University of Surrey)による ACM Computing Surveys 55(4) 掲載のサーベイ。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[D'ya like DAGs]] - Chapters: [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 1 Introduction]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 2 Background - Definitions and Assumptions]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 3 Structure Discovery Methods]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 4 Combinatoric and Search Based Approaches]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 5 Continuous Optimization Based Approaches]] / [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 6 Summary and Discussion]](6 件) - Pages created: source 6 件、entity 2 件([[D'ya like DAGs]]・[[NO TEARS]]) - Pages updated: [[因果発見]](concept 1 件)、index/hot/log/manifest - Key insight: **本サーベイは自らの主題を最後に相対化する**。第 2 章が仮定の体系を積み上げ第 4〜5 章が 100 本超の手法を整理したうえで、第 6 章は因果マルコフ条件を「矢印を因果的と解釈する大胆な追加解釈にすぎない」と批判し、Korb & Wallace の「輝かしい倒錯」という評を引く。手法を網羅した論文が、その出力の解釈可能性そのものに留保を付けている。 - vault との接続: この留保は実務側の手法群と突き合わせると重い。[[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] の §4.3.3 によれば、監視メトリクスから根本原因を特定する手法群は **LOUD を除く全手法が PC アルゴリズムで因果グラフを構築する**。「因果の跳躍」批判はまさにその出力を「根本原因」と呼ぶ前提に向けられている。 - 連続最適化への転換が持ち込んだもの: 非巡回性を連続な等式制約へ置き換えることで勾配法が使えるようになった一方、**識別可能性の議論が空白のまま拡張が進み**、ハード制約からソフト制約への緩和(NO FEARS → GOLEM)は新しい不確実性を持ち込んで事後の閾値処理を必須にした。 - 原本内の矛盾を 1 件検出: NODAG(Varando 2020)は本文で「非巡回性制約を課さない」と明記され節題も "DAGs without Imposing Acyclicity" だが、Table 2 では Acycl.=yes と記載される。解消せず両論併記で記録した。 - ページ名の調整: 原本の節題 `Combinatoric/Search Based Approaches` はスラッシュがファイル名に使えないため、章ページ名を "Combinatoric and Search Based Approaches" に置き換えた(本文では原題を原語で引いている)。 - 図表: 埋め込み 6 点。手法一覧表(Table 1 の 71 件、Table 2 の 30 件)は画像でなく Markdown 表へ全行転記した。 - 旧ページの退役: 1 枚もの `@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery` を削除し、被リンクをハブ entity へ張り替えた。旧ページ専用の attachment 5 点も削除した。 ### 2026-08-25 ingest-thesis | A Survey of DevOps Concepts and Challenges `wiki-ingest-thesis` skill(ローカル PDF、35 ページ)。Leonardo Leite・Carla Rocha・Fabio Kon・Dejan Milojicic・Paulo Meirelles による ACM Computing Surveys 52(6) 掲載のサーベイ。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[A Survey of DevOps Concepts and Challenges]] - Chapters: [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 1 Introduction]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 2 DevOps]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 3 Study Design]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 4 Sources of Knowledge]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 5 Fundamental Concepts]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 6 Toolset]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 7 Implications for Engineers, Managers, and Researchers]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 8 Unresolved Challenges]] / [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 9 Limitations of This Study and Conclusions]](9 件) - Pages created: source 9 件、entity 1 件([[A Survey of DevOps Concepts and Challenges]]) - Pages updated: [[Chef]]・[[Docker]]・[[Puppet]](entity 3 件)、[[DevOps]]・[[Infrastructure as Code]]・[[収束型システム管理]]・[[継続的デプロイ]]・[[継続的デリバリ]](concept 5 件)、index/hot/log/manifest - Key insight: **同じ対象が立場によって別の問題として立ち現れる**という構成上の主張が本サーベイの独自性である。第 5 章の概念地図が DevOps を 2 軸で整理するのに対し、第 7 章は同じ内容をエンジニア / 管理者 / 研究者へ配り直す。同一の主題が、ある立場には「確立した助言」として、別の立場には「未解決の研究課題」として現れる。 - 章分割の効果: **章をまたぐ問いと答えの引き継ぎが成立した**。第 1+2 章の担当が「2008 年命名の参照 [68] が何を指すか未特定」という問いを [[DevOps]] に立て、第 9 章の担当が参考文献一覧から `[68] Patrick Debois. 2008. Agile Infrastructure Operations. At Agile 2008 Toronto.` を特定して答えた。1 枚ものの source ページでは章の担当が分かれないため、この形の引き継ぎは生じない。 - グレー文献の比重: 第 4 章は DevOps 専業の査読媒体が存在しないことを示し、書籍・State of DevOps Reports・トーク・グローバルコミュニティを正規の知識源として列挙する。第 9 章の出版バイアス(失敗事例の論文が見つからない)と合わせると、この領域の知識生産が査読文献だけでは閉じないことを査読サーベイ自身が述べていることになる。 - 技術論争を解消せずに残す: 第 6 章のコンテナ化 対 継続的構成収束、第 8 章のマイクロサービスが DevOps を「促進する」のか「要求する」のか、API バージョニングの是非。いずれも対立する立場を並べたまま結論を出さず、[[DevOps]] の未解決の問いへ還流させた。 - 図表: 埋め込み 8 点。表は Markdown 表へ忠実に転記した(転記済みの表の画像 3 点は未使用のため削除)。 - 旧ページの退役: 1 枚もの `@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications `wiki-ingest-thesis` skill(ローカル PDF、36 ページ)。Jacopo Soldani・Antonio Brogi(University of Pisa)による ACM Computing Surveys 55(3) 掲載のサーベイ。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] - Chapters: [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 1 Introduction]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 2 Terminology]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.1 Log-based Anomaly Detection Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.2 Distributed Tracing-based Anomaly Detection Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.3 Monitoring-based Anomaly Detection Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.4 Discussion (Anomaly Detection)]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.1 Log-based and Distributed Tracing-based Root Cause Analysis Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.3 Monitoring-based Root Cause Analysis Techniques]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.4 Discussion (Root Cause Analysis)]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 5 Related Work]] / [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 6 Conclusions]](11 件) - Pages created: source 11 件、entity 8 件([[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] + 代表システム 7 件) - Pages updated: [[サービスレベル目標]]・[[マイクロサービスアーキテクチャ]]・[[ログベース異常検知]]・[[分散トレーシング]]・[[因果推論ベースRCA]]・[[因果発見]]・[[根本原因分析]]・[[異常検知]](concept 8 件)、index/hot/log/manifest - 章構成の判断: 原本の第 3 章・第 4 章はいずれも 12〜13 ページあり、**データ源別の下位節が本サーベイの主軸**をなす。1 枚に押し込むと分類が失われるため §3.1〜§3.4・§4.1〜§4.4 を独立章として切り出し、全 6 章 → 全 11 章に組み直した(§4.1 と §4.2 は同一ページ始まりのため統合)。 - Key insight: **同じ軸(依拠するデータ源)を検知と診断の両方に通したことで、データ源が何を決めているのかが見える**。ログベースは計装不要な代わりに粗い粒度の単一根本原因しか返せず、トレース/監視ベースは計装コストと引き換えに詳細でランク付きの原因を返す。このトレードオフが検知側(§3.4.2)と診断側(§4.4.2)で同型に現れる。さらに**データ源の内側で手法の型がさらに粒度を分ける**入れ子構造があり、監視ベース異常検知の SLO Check とハートビートは機械学習を使わず、SLO Check はアプリケーション全体粒度に限られる。 - 手法の多様性の実態: §4.4.1 によれば因果グラフは LOUD を除く全手法が PC アルゴリズムで構築し、探索は MonitorRank 由来のランダムウォークが最も広く再利用される。手法の多様性が実は少数の共通部品の組み合わせであることを示す。 - vault との接続: [[Anomaly Detection - A Survey]](Chandola ほか、2009)と切り口が直交する(前者は手法が置く仮定、本サーベイはデータ源)。**説明可能性の 16 年の変遷**(2009 年には論点が存在せず → 2021 年に未解決課題として言語化 → 2025 年に要件として形式化)も [[異常検知]] に記録した。 - 図表: 割り当て 2 点。手法一覧表(Table 1・Table 2、各 25 手法)は Markdown 表へ忠実に転記した。 - 旧ページの退役: 1 枚もの `@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | A Tutorial on Kernel Density Estimation and Recent Advances `wiki-ingest-thesis` skill(ローカル PDF、21 ページ)。Yen-Chi Chen(University of Washington 統計学部)による 2017 年のチュートリアル。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[A Tutorial on Kernel Density Estimation and Recent Advances]] - Chapters: [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 1 Introduction and Statistical Properties]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 3 Confidence Intervals and Confidence Bands]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 4 Geometric and Topological Features]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 5 Estimating the CDF]] / [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 6 Conclusion and Open Problems]](5 件) - Pages created: source 5 件、entity 1 件([[A Tutorial on Kernel Density Estimation and Recent Advances]]) - Pages updated: [[カーネル密度推定]]・[[ブートストラップ法]]・[[信頼区間]]・[[密度ベースクラスタリング]](concept 4 件)、index/hot/log/manifest - 章構成の注記: 原本の §1(Introduction)と §2(Statistical Properties)は同一 PDF ページから始まるため 1 枚に統合した。章番号は原本の節番号に従うので **Chapter 2 は存在しない**。 - Key insight: 本チュートリアルは「**推定できる**」と「**保証できる**」の間にある溝を主題にしている。第 1 章が確立する収束率は推定量が真の密度へ近づくことを言うが、第 3 章はその推定量から作った信頼帯が保証するのは**真の密度ではなくその期待値**の被覆であることを明示する。バイアスが消えないために生じるこの溝と、それを埋める 3 戦略(無視・アンダースムージング・バイアス補正)の整理が中心にある。 - 章分割の効果: 第 4 章の特徴推定アルゴリズム(モード・レベル集合・リッジ・クラスタツリー・パーシステント図)は、いずれも**点推定用の標準的な帯域幅選択法を無調整で流用している**。特徴推定に固有の帯域幅選択規準は本文に存在せず、第 6 章もこれを未解決問題として挙げる。第 1 章と第 4 章を別ページに分けたことでこの不整合が対比として立った。 - vault との接続: 第 4 章のレベル集合条件は、一様カーネルを使ったとき **DBSCAN の核点条件と数式レベルで一致する**([[Anomaly Detection - A Survey]] が DBSCAN を密度ベース異常検知技法として扱っているのと突き合わせて言える)。また Chandola ほか(2009)が帯域幅選択に踏み込まないのに対し本チュートリアルは 5 手法を理論的に分類しており、**同じ手法が応用文献では暗黙化され方法論文献では主題化される**という非対称も記録した。 - 図表: 埋め込み 8 点。 - 旧ページの退役: 1 枚もの `@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances` を削除し、被リンクをハブ entity へ張り替えた。旧ページ専用の attachment 7 点も削除した。 ### 2026-08-25 ingest-thesis | A Survey of Online Failure Prediction Methods `wiki-ingest-thesis` skill(ローカル PDF、43 ページ)。Felix Salfner・Maren Lenk・Miroslaw Malek(Humboldt-Universität zu Berlin)による ACM Computing Surveys 42(3) 掲載の古典的サーベイ。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[A Survey of Online Failure Prediction Methods]] - Chapters: [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 1 Introduction]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 2 Definitions]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 3 Evaluation Metrics]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 4 A Taxonomy of Online Failure Prediction Methods]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 5 Survey of Prediction Methods]] / [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 6 Summary and Conclusions]](6 件) - Pages created: source 6 件、entity 1 件([[A Survey of Online Failure Prediction Methods]]) - Pages updated: [[Felix Salfner]]・[[Humboldt University of Berlin]]・[[Maren Lenk]]・[[Miroslaw Malek]](entity 4 件)、[[AIOps]]・[[ディペンダビリティ]]・[[ハードディスク信頼性]]・[[プロアクティブ障害管理]]・[[分類モデルの評価指標]]・[[障害予測]](concept 6 件)、index/hot/log/manifest - Key insight: **分類体系を作った側が、自ら空の枝を残している**。第 4 章が立てる 4 分岐のうち **undetected error auditing には該当する研究が 1 件も無い**ことを第 4 章と第 5 章の双方が明示する。分類が既存研究の事後的な整理ではなく手法空間の設計図として書かれていることの現れで、この空枝は 2010 年時点の研究の偏りを示す指標にもなっている。 - 持続的な資産は分類より用語規約: 第 2 章が定める fault / error / symptom / failure の連鎖と 4 つの時間軸(t_d・t_l・t_p・t_w)は、以後の障害予測研究の共通言語になった。[[A Survey of AIOps Methods for Failure Management]](Notaro ほか、2021)は用語規約の出典として本サーベイを明示的に引く。 - 11 年後の同主題サーベイとの対比: Salfner(2010)は**観測経路**で分類し障害予測そのものを主題とするのに対し、Notaro(2021)は**予測の対象**で分類し AIOps 障害管理の 1 カテゴリとして扱う。両者を交差させたときの空白枝の棚卸しは未実施([[障害予測]] の未解決の問いに記録)。 - 図表: 埋め込み 15 点。表は Markdown 表へ忠実に転記(Table III の 47 行を第 4 章の枝番号と対応づけて全行転記)。 - 旧ページの退役: 1 枚もの `@2010__ACM CSUR__A Survey of Online Failure Prediction Methods` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | A Survey of AIOps Methods for Failure Management `wiki-ingest-thesis` skill(ローカル PDF、45 ページ)。Paolo Notaro・Jorge Cardoso・Michael Gerndt(TU München / University of Coimbra / Huawei Munich Research Center)による ACM TIST 12(6) 掲載のサーベイ。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[A Survey of AIOps Methods for Failure Management]] - Chapters: [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 1 Introduction]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 2 Related Work and Methodology]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.1 Failure Prevention]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.2 Online Failure Prediction]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.3 Failure Detection]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.4 Root-cause Analysis (RCA)]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.5 Remediation]] / [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 5 Conclusion]](8 件) - Pages created: source 8 件、entity 1 件([[A Survey of AIOps Methods for Failure Management]]) - Pages updated: [[Felix Salfner]](entity 1 件)、[[AIOps]]・[[Fault Localization]]・[[アラート管理]]・[[プロアクティブ障害管理]]・[[ログ解析]]・[[体系的マッピング研究]]・[[根本原因分析]]・[[異常検知]]・[[障害予測]]・[[障害注入]]・[[障害緩和]](concept 11 件)、index/hot/log/manifest - 章構成の判断: 原本の第 4 章が 26 ページ(全体の半分以上)を占め、そこに 5 カテゴリ・14 サブカテゴリの実体がある。**1 枚の source ページに押し込むと分類体系が失われる**ため、§4.1〜§4.5 を独立した章ページとして切り出し、全 4 章 → 全 8 章に組み直した。 - Key insight: 本サーベイの寄与は「AIOps を測れる単位に切り分けた」ことにある。**この分解によって初めてカテゴリ間の研究密度の偏りが見える** — 予防(671 件中 71 件、10.6%)と緩和(6 件)が薄く、検知と診断が厚い。緩和の薄さについて著者は「診断後の復旧手順が複雑なモデル無しでほぼ自明になるため」と説明するが、これは 2021 年時点の見立てで、その後のエージェント型緩和([[Agentic Failure Management of Cloud Systems]] の STRATUS)が扱う複雑さとは前提が食い違う。 - Table 8 の読み: 分析対象 100 件を「データソース 9 種 × 対象 5 種」で並べた表から、**48 行中 28 行が単一データソースにのみ依拠**していることが読み取れる。第 5 章が指摘するマルチモーダル化の遅れの直接的な裏づけになる。 - 図表: 割り当て 10 点。図を埋め込み、表は Markdown 表へ忠実に転記(Table 8 は当初クロップがヘッダ + 1 行しか捉えられていなかったため、クロップスクリプトの表の高さ上限を修正して 48 行全体を再取得した)。 - 旧ページの退役: 1 枚もの `@2021__TIST__A Survey of AIOps Methods for Failure Management` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | Efficient Large Language Models: A Survey `wiki-ingest-thesis` skill(ローカル PDF、67 ページ)。Zhongwei Wan ほかによる TMLR 2024 掲載のサーベイ。LLM の効率化研究を **モデル中心・データ中心・フレームワーク中心**という 3 つの介入点で整理する。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[Efficient Large Language Models - A Survey]] - Chapters: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 1 Introduction]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 2 Model-Centric Methods]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 3 Data-Centric Methods]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]] / [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 5 Concluding Remarks]](5 件) - Pages created: source 5 件、entity 11 件([[Efficient Large Language Models - A Survey]] + フレームワーク 10 件) - Pages updated: [[DeepSpeed]]・[[Megatron-LM]]・[[TensorRT-LLM]]・[[vLLM]](entity 4 件)、[[FlashAttention]]・[[LLM推論]]・[[PagedAttention]]・[[モデル圧縮]]・[[並列化戦略]]・[[枝刈り]]・[[状態空間モデル]]・[[知識蒸留]]・[[量子化]](concept 9 件)、index/hot/log/manifest - Key insight: 本サーベイの分類原理は「**どこに手を入れて効率を得るか**」という介入点であり、同じ手法群を Miao ほか(アルゴリズム / システムの 2 軸)や Zhou ほか(データ / モデル / システムの 3 層)とは別の並べ方で提示する。この違いは分類上の便宜ではなく含意を変える — 本サーベイはモデル圧縮を model-centric の独立部門として扱うが、Miao ほかはサービング最適化の前提条件として扱っており、「圧縮は目的か手段か」が分類によって入れ替わる。**分類体系どうしの対応表は未整備**で、各 concept の未解決の問いに記録した。 - 章分割の効果: 第 2 章(21 ページ)と第 3・4 章(各 5 ページ)の分量比が、効率化研究の重心がモデル側に偏っている事実をそのまま示す。また第 4 章の Table 2 を横断すると、学習対応フレームワークは 3D Parallelism / ZeRO を核に周辺機能が分布し、推論専用フレームワークは共通基盤の上で差別化軸が分かれるという 2 つの束が見える。これは個々のフレームワーク entity からは見えない。 - 図表: 割り当て 22 点のうち 18 点を埋め込み、表は Markdown 表へ忠実に転記。 - 旧ページの退役: 1 枚もの `@2024__TMLR__Efficient Large Language Models - A Survey` を削除し、被リンクをハブ entity へ張り替えた。旧ページ専用の attachment 6 点も削除した。 ### 2026-08-25 ingest-thesis | Trade-Offs Under Pressure `wiki-ingest-thesis` skill(ローカル PDF、88 ページ)。John Allspaw による Lund University の修士論文(MSc in Human Factors and System Safety、2015)。Etsy で実際に発生した機能障害を単一事例として取り上げ、プロセストレーシング法で障害対応中のエンジニアの認知過程を分析する。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[Trade-Offs Under Pressure]] - Chapters: [[@2015__MSc__Trade-Offs Under Pressure - Chapter 1 Background]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 2 Literature Review]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 3 Research Design]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 4 Event Description]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 5 Results]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 6 Analysis]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 7 Discussion]] / [[@2015__MSc__Trade-Offs Under Pressure - Chapter 8 Conclusions]] / [[@2015__MSc__Trade-Offs Under Pressure - Appendix A Initial coding schema]] / [[@2015__MSc__Trade-Offs Under Pressure - Appendix B Coordinative Episodes Coding Schema]](本編 8 章 + 付録 2 件 = 10 件) - Pages created: source 10 件、entity 1 件([[Trade-Offs Under Pressure]]) - Pages updated: [[David D. Woods]]・[[Erik Hollnagel]]・[[Etsy]]・[[Gary Klein]](entity 4 件)、[[Common Grounding]]・[[Joint Activity]]・[[プロセストレーシング]]・[[研究方法論における妥当性概念]]・[[複雑システム障害論]]・[[診断ヒューリスティック]](concept 6 件)、index/hot/log/manifest - Key insight: 本論文の寄与は安全科学の枠組みをソフトウェア運用へ適用したことではなく、運用現場の一次データからヒューリスティックを取り出したことにある。**最も強く共有されたヒューリスティック(直近のソフトウェア変更との相関確認)が、最も言語化されない** — 8 名全員が独立に「最初に取る行動」と証言した一方、IRC トランスクリプト中の直接的言及は 2 回しかなかった。これは Woods & Hollnagel(2006)の Law of Fluency の具体例であり、運用の暗黙知を発話ログだけから復元することの限界を同時に示す。 - 章分割の効果: 第 5 章(生データ)と第 6 章(定式化)を別ページに分けたことで両者の距離が可視化された。第 6 章がヒューリスティック 4 をアンケート(n=32)で補強し ETTO ルールの文言へ対応づける操作は著者による事後的解釈であり、第 5 章の "lgtm" 発話という局所的証拠からは直接導かれない。 - 取り込み範囲: 本編 8 章と付録 A・B。付録 C〜E(参加者タイムライン・ダッシュボード画像・ツール一覧)は生の資料のため対象外とした。 - 図表: 割り当て 32 点のうち本編・付録 A の範囲にある 17 点を埋め込み。表は Markdown 表へ忠実に転記。 - 旧ページの退役: 1 枚もの `@2015__LundUniversity__Trade-Offs Under Pressure - Heuristics and Observations of Teams Resolving Internet Service Outages` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | Anomaly Detection: A Survey `wiki-ingest-thesis` skill(ローカル PDF、58 ページ)。Varun Chandola・Arindam Banerjee・Vipin Kumar(University of Minnesota)による ACM Computing Surveys 41(3) 掲載の古典的サーベイ。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[Anomaly Detection - A Survey]] - Chapters: [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 1 Introduction]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 2 Different Aspects of an Anomaly Detection Problem]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 3 Applications of Anomaly Detection]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 4 Classification Based Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 5 Nearest Neighbor-Based Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 6 Clustering-Based Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 7 Statistical Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 8 Information Theoretic Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 9 Spectral Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 10 Handling Contextual Anomalies]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 11 Relative Strengths and Weaknesses of Anomaly Detection Techniques]] / [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 12 Concluding Remarks and Future Work]](12 件) - Pages created: source 12 件、entity 1 件([[Anomaly Detection - A Survey]]) - Pages updated: [[Arindam Banerjee]]・[[University of Minnesota]]・[[Varun Chandola]]・[[Vipin Kumar]](entity 4 件)、[[カーネル密度推定]]・[[変化点検知]]・[[密度ベースクラスタリング]]・[[最近傍法]]・[[異常検知]](concept 5 件)、index/hot/log/manifest - Key insight: この論文の寄与は分類そのものではなく「分類の切り方」にある。手法を応用分野やアルゴリズムの系統ではなく、**各カテゴリが正常と異常を区別するために置いている仮定**で束ねた。章分割して 6 カテゴリの仮定を並べると、クラスタリングベースだけが 3 つの仮定に分かれ、しかもそれらが互いの弱点を補う系列(クラスタ非所属 → 重心からの距離 → クラスタのサイズと密度)をなすことが見える。カテゴリ内部に自己修正の履歴が畳み込まれている。一方で第 11 章は仮定の統一表を作らず運用指向の 4 軸(訓練/検証コスト・ラベル要求・距離尺度依存・希少性仮定)で比較し、仮定の統合は第 12 章で今後の課題として先送りされる。 - 図表: 割り当て 23 点のうち図 11 点を埋め込み、表 12 点は Markdown 表へ忠実に転記(第 3 章の応用分野別技法表 10 件を含む)。 - 章境界の処理: 本サーベイは章分割がページ境界で切られているため、**各章末の「計算量」「利点と欠点」が次章ファイルの冒頭へ食い込む**現象が第 3・4・5・7・9・10・11・12 章で発生した。各担当が内容の帰属先を優先して該当章ページに含め、`## 出典` に転記元を注記している。 - 旧ページの退役: 1 枚もの `@2009__CSUR__Anomaly Detection - A Survey` を削除し、被リンクをハブ entity へ張り替えた。 ### 2026-08-25 ingest-thesis | Agentic Failure Management of Cloud Systems `wiki-ingest-thesis` skill(ローカル PDF、141 ページ)。Yinfang Chen による University of Illinois Urbana-Champaign の博士論文(2026)。クラウド障害管理を「事前予防 → 根本原因分析 → 自律緩和 → 評価基盤」という 1 本のライフサイクルとして捉え、各段階に 1 システムずつ(Rainmaker・RCACopilot・STRATUS・AIOpsLab)を対応させる。**本スキル作成前に 1 枚もの source ページとして取り込まれていたものを、章単位で再取り込みしたもの**である。 - Hub entity: [[Agentic Failure Management of Cloud Systems]] - Chapters: [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 1 Introduction]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 2 Reliability Testing for Cloud-Backed Applications]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 3 Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 4 A Multi-Agent System for Autonomous Site Reliability Engineering]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 5 Evaluating AI Agents for Autonomous Cloud Operations]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 6 Conclusion and Future Work]](6 件) - Pages created: source 6 件、entity 1 件([[Agentic Failure Management of Cloud Systems]]) - Pages updated: [[AIOpsLab]]・[[RCACopilot]]・[[Rainmaker]]・[[Stratus]]・[[Yinfang Chen]](entity 5 件)、[[AIOps]]・[[Transactional No-Regression]]・[[agentic SRE]]・[[クラウド障害ライフサイクル]]・[[プロアクティブ障害管理]]・[[根本原因分析]]・[[障害注入]]・[[障害緩和]](concept 8 件)、index/hot/log/manifest - Key insight: 本論文固有の寄与は個々のシステムではなく「束ね方」にある。第 2〜5 章の各システムは NSDI 2023・EuroSys 2024・NeurIPS 2025・MLSys 2025 で個別に発表済みであり、本論文はそれらを予防で漏れたものが診断に回り、診断の出力が緩和の入力になり、その全体を評価が測るという依存関係として接続する。安全性の扱いが分岐点で、第 4 章の Transactional No-Regression は LLM エージェントに本番の状態変更を許す判断を古典的トランザクション意味論の上で正当化するが、第 6 章はその保証が「人間が定義した health condition の網羅性」に条件づけられることを自ら認めており、自律化の限界が形式的保証ではなく仕様記述の側にあることを示す。 - 出版論文との照合: 取り込み済みの査読版 4 本すべてと数値を 1 件ずつ突き合わせ、**食い違いは検出されなかった**。博士論文版は査読版に対し、第 2 章の Table 6 内訳、第 3 章の再発率 93.80%・新規カテゴリ 24.96%、第 4 章の task-based 対 role-based 定量比較と 3 ノードクォーラムでの複数相互依存障害という新規実験、第 5 章の評価対象 2→4 アプリ・障害ライブラリ 15 種類への拡張、を追加で含む。 - 図表: 割り当て 50 点のうち図 27 点を埋め込み、表 22 点は Markdown 表へ忠実に転記(図表専用セクションは作らず本文近傍に配置)。Figure 13(プローブ結果のテキストリスト)はコード相当のため Markdown コードブロックとして転記した。 - 旧ページの退役: 1 枚もの `@2026__UIUC PhD Thesis__Agentic Failure Management of Cloud Systems` を削除し、被リンクをハブ entity へ張り替えた(`wiki/log.md` の過去エントリと `research/curation/2026-W33.md` は鉄則により編集せず、リンク切れとして残る)。 ### 2026-08-25 ingest | Doubling all2all Performance with NVIDIA Collective Communication Library 2.12 `wiki-ingest` skill(URL ingest、NVIDIA Developer Blog)。Karthik Mandakolathur・Sylvain Jeaugey(いずれもNVIDIA)による2022年2月28日公開の技術ブログ記事。NCCL 2.12で導入されたPXN(PCI × NVLink)機能を解説する。GPUがCPU間プロトコルを経由せずNVLink経由でノード内の別GPUへデータを移し、そのGPUに近いNICから送信できるようにする機能で、メッセージ集約(multireceiveによる最大8メッセージの1メッセージ化)とrail内への経路集約(Spineスイッチ通過トラフィック削減)の2軸でall2all性能を改善する。DGX A100・InfiniBand実測では128ノード/1024GPU構成でレイテンシが約2.55倍改善した。 - Source: [[@2022__NVIDIA Developer Blog__Doubling all2all Performance with NVIDIA Collective Communication Library 2.12]] - Pages created: source 1件、entity 2件([[Sylvain Jeaugey]]・[[Karthik Mandakolathur]]) - Pages updated: [[NCCL]](PXN機能の解説段落・著者2名を追加)、[[Rail-Optimizedトポロジ]](NCCL_CROSS_NIC=0とPXNが同根の課題への異なるレイヤーでの対応であるという横断的知見、PXNがall-reduce向け設計をall2allへ機構的に拡張したという知見を追加)、[[集合通信]](all2allがtree/ringで最適化できない構造的理由とNCCL 2.28以前のP2Pベース実装の関係を追加)、[[NVIDIA]](related/sources追加)、index/hot/log/manifest - Key insight: NCCL 2.12のPXNは、rail-optimizedトポロジの前提(同一GPU番号=同一Rail)を、ユーザーが環境変数(NCCL_CROSS_NIC=0)で守る運用的解決ではなく、NCCL自身がNVLink経由でrail内へデータを寄せることで機構的に守る設計であり、all-reduce向けに確立された概念をtree/ringで最適化できないall2allパターンにまで拡張した。 - 図表: 本文参照図表6点(Figure 1〜6)を全点、公式ブログの画像URLから直接ダウンロードして埋め込み(除外なし)。 ### 2026-08-25 ingest-paper | hwloc: a Generic Framework for Managing Hardware Affinities in HPC Applications `wiki-ingest-paper` skill(open-mpi.org 掲載 PDF)。François Broquedis・Jérôme Clet-Ortega・Stéphanie Moreaud・Nathalie Furmento・Brice Goglin・Guillaume Mercier・Samuel Thibault・Raymond Namyst(University of Bordeaux/INRIA/CNRS/ENSEIRB、いずれもLaBRI所属)による PDP 2010 論文。マルチコア化・NUMA化で複雑化したHPC機械のハードウェアトポロジ(プロセッサソケット・キャッシュ・コア・NUMAメモリノード)を、オブジェクト型や相対深さに仮定を置かない汎用木構造として抽象化するhwlocソフトウェアの設計を報告する。低レベル/高レベルの二層Cインターフェースと、独自Cpuset構造体によるスレッド・プロセス・メモリバインディングを提供し、OS固有API(Linux sysfs等)を吸収する。先行研究PLPA(Linux専用、共有キャッシュ・NUMA非対応)との統合が進行中だったことも記録する。 - Source: [[@2010__PDP__hwloc a Generic Framework for Managing Hardware Affinities in HPC Applications]] - Pages created: source 1件、entity 2件([[hwloc]]・[[François Broquedis]])、concept 1件([[ハードウェアトポロジ抽象化]]) - Pages updated: [[NUMA対応CPUピニング]](hwlocの共有キャッシュ粒度でのバインディング判断・トポロジ抽象化の設計思想を横断的知見として追加)、index/hot/log/manifest - Key insight: hwlocが提供する「共通祖先の深さ・共有キャッシュサイズ」という近接度情報は、OpenMPスレッドスケジューリング(FORESTGOMPのCache方式、16コアで非トポロジ認識比14対8.52倍の高速化)・MPIプロセス配置(SCOTCHによる静的マッピング、NAS CGカーネルで26%/8%改善)・MPI通信サブシステムの動的閾値決定(KNEMのI/OATオフロード閾値 = キャッシュサイズ/(2×共有プロセス数))という異なる3レイヤーで共通して有用であることを示した。 - 図表: 本文参照図表9項目(Figure 1〜9、Table I〜III)のうち実図(Figure 1・2・3・8・9)をPyMuPDFキャプション座標クロップで全点埋め込み、コード例のFigure 5〜7とテキストダンプのFigure 4はMarkdownコードブロックとして転記(除外なし)。Table I〜IIIはMarkdown表として転記。 ### 2026-08-24 ingest | RFC 9161 - Operational Aspects of Proxy ARP/ND in Ethernet Virtual Private Networks `wiki-ingest` skill(URL ingest)。IETF が 2022年1月に発行した Standards Track、RFC 7432 の更新文書(Updates: 7432)。編集者 [[Jorge Rabadan]]([[Nokia]])、共著者 Senthil Sathappan・Kiran Nagaraj・Greg Hankins(いずれも Nokia)・Thomas King(DE-CIX)。[[EVPN]] の Proxy ARP/ND 機能(動的・静的・EVPN学習の3種のエントリからなるテーブルによる ARP/NS 代理応答)の運用面を、Learning・Reply・Unicast-Forward・Maintenance・Flood Handling・重複IP検知の6サブ機能として体系化する。重複IP検知はM秒(既定180秒)内にN回(既定5回)のIP移動でスプーフィングとみなしAS-MACで通知する手続きを規定し、IXP(全静的プロビジョニングが主流)とDC(動的学習寄り)で異なる4展開シナリオを示す。 - Source: [[@2022__IETF__RFC 9161 - Operational Aspects of Proxy ARP-ND in Ethernet Virtual Private Networks]] - Pages created: source 1件、entity 1件([[Jorge Rabadan]])、concept 1件([[EVPNにおけるProxy ARP-ND]]) - Pages updated: [[EVPN]](RFC 9161 の重複IP検知と RFC 7432 の MAC Mobility 重複検知の既定値一致という横断的知見を追加)・[[Nokia]](RFC 9161 の編集者・著者陣を追記)・[[@2021__IETF__RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)]](related へ [[Jorge Rabadan]] を追加)、index/hot/log/manifest - Key insight: RFC 9161 の重複IP検知(M=180秒・N=5回)は、RFC 7432 の MAC Mobility 重複検知と全く同じ既定パラメータ値・同じ「M秒間にN回」という検知アルゴリズムの骨格を、MAC アドレス版から IP アドレス版へそのまま転用したものであり、EVPN の設計者が同一の検知アルゴリズムをL2/L3の異なるレイヤーへ繰り返し適用していることを示す。IPv6 "anycast" 能力(分散エニーキャストゲートウェイ用途)を有効化すると重複IP検知を無効化しなければならないという構造的トレードオフも明らかになった。 ### 2026-08-24 ingest-slides | HPCネットワークの多様化に挑む - マルチベンダー×マルチOSで支えるHPCネットワーク運用の実際 `wiki-ingest-slides` skill(JANOG公式ページ、補助テキストとしてさくらのナレッジのブログ記事)。SAKURA Internet株式会社クラウド事業本部の黒澤潔裕氏がJANOG57(2026年2月11日、大阪)で発表した36ページのスライド。マネージドHPCクラスタ「さくらONE」のネットワーク基盤で、シャーシ型スイッチ vs Clos Topology・Arista EOS vs SONiC(Whitebox)という2軸の選定を報告する。さくらONEは3世代のクラスタ(H100:シャーシ+SONiC、H200/B200:シャーシ+EOS、最新B200:Clos+EOS)を並行運用し、最新B200クラスタは約140サーバー・約1100GPUをBroadcom Tomahawk5によるSpine10台・Leaf20台のClos Topologyで収容する。一般的なClos Networkの利点(柔軟なスケーラビリティ・N+1冗長・rolling update)がGPU基盤では成立せずN+0構成を強いられるという知見、SONiC運用コマンド未成熟への内製対応、jsondiff→dry run→applyのconfig冪等性パイプラインをGitHub Actions×containerlabによる5分CIへ統合した事例、Ansibleによる約40,000行config自動生成(全台セットアップ30分)を扱う。同一発表者による2025年のSONiC Workshop Japan 2025発表の続編にあたる。 - Source: [[@2026__JANOG57__HPCネットワークの多様化に挑む - マルチベンダー×マルチOSで支えるHPCネットワーク運用の実際]] - Pages created: source 1件 - Pages updated: [[黒澤潔裕]](JANOG57発表を追加)・[[SAKURAONE]](最新B200クラスタのネットワーク詳細・3世代アーキテクチャ変遷を追加)・[[SAKURA internet Inc]](related追加)・[[Clos Network]](GPU基盤でのClos利点反転・72台閾値の知見を追加)・[[べき等性]](config冪等性パイプラインのCI統合事例を追加)、index/hot/log/manifest - Key insight: 一般的なClos Networkが前提とする4つの利点(柔軟なスケーラビリティ・Control Plane分離・N+1冗長・オーバーサブスクリプション前提)は、GPU基盤ではいずれも成立しないか反転する——余剰ポート確保が困難でスケールしない前提の設計を強いられ、単一機器の瞬断でもRDMAはFailしrolling updateは許されず、高価なGPU/400G SwitchはN+0で使い切る必要があり、Full bisectionのLossless構成でトランシーバーとケーブルが倍増する。それでもなお収容効率の向上が採用の最大の動機になった。 ### 2026-08-24 ingest-slides | SONiCで構築・運用する生成AI向けパブリッククラウドネットワーク `wiki-ingest-slides` skill(SpeakerDeck URL)。SAKURA Internet株式会社クラウド事業本部クラウドサービス部の黒澤潔裕氏が SONiC Workshop Japan 2025(2025年5月16日)で発表した26ページのスライド。生成AI向けGPUクラウドサービス「高火力」の基盤構築において、Clos topology + SONiCによるGPU Interconnect/Storage Network/Service/Managementの4種のネットワークを、PJ立ち上げから4か月という短納期・少数精鋭の内製チーム・Ansible/ONIE/ZTPによる自動化前提設計で実現した経緯を報告する。運用フェーズではPrometheusベースの監視刷新、jsondiff+dry run+applyによるSONiC config冪等性の実現、YANGスキーマ未整備によるOS依存の構成管理課題、コミュニティSONiCをメーカーが拡張する構造に起因する品質保証の難しさを扱う。 - Source: [[@2025__SpeakerDeck__SONiCで構築・運用する生成AI向けパブリッククラウドネットワーク]] - Pages created: source 1件、entity 1件([[黒澤潔裕]]) - Pages updated: [[SAKURA internet Inc]](「高火力」GPUクラウド基盤の構築事例を追加)・[[SONiC]](運用コマンド自社開発・Prometheus監視・config冪等性実装・YANGスキーマ未整備課題を追加)・[[Clos Network]](Chassis Networkとの比較でベンダーダイバーシティが採用の決め手だったという実運用知見を追加)・[[べき等性]](ネットワーク機器config管理における第5の冪等性実現方針を追加)、index/hot/log/manifest - Key insight: SONiCのconfig冪等性は、cfengineのような言語処理系による自動収束でも、DDIAのidempotency keyのような呼び出し先への実装要求でもなく、運用者がjsondiff差分生成→dry run(構文チェック)→applyという3段パイプラインを明示的に組み立てることで実現されていた。この分解自体が、YANGスキーマ未整備というSONiC特有のハードウェア依存制約(RDMA設定変更時のCPU100%化等)への対処と不可分に結びついており、冪等性の実現と構成管理課題の解決が同じ自動化ツール刷新の中で同時に進んだ。 ### 2026-08-24 ingest | RFC 8365 - A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN) `wiki-ingest` skill(URL ingest)。IETF が 2018年3月に発行した Standards Track(BESS Working Group)。編集者 Ali Sajassi([[Cisco]])・John Drake([[Juniper Networks]])、共著者 Nabil Bitar([[Nokia]])・R. Shekhar(Juniper)・James Uttaro([[AT&T]])・Wim Henderickx(Nokia)。[[EVPN]](RFC 7432)を [[VXLAN]]・NVGRE・MPLS over GRE の上に載せ、マルチテナントデータセンター向けの Network Virtualization Overlay(NVO)ソリューションへ転用する。EVPN の多重接続機能のうち VXLAN/NVGRE カプセル化で実質的な作り替えを要するのはスプリットホライズンフィルタリング(ESI ラベル不在を補う Local Bias 方式)のみであること、データセンター間接続(DCI)を ASBR 方式(inter-AS Option B)で構成すると mass withdrawal が per-ES 粒度から per-EVI 粒度へ後退することを規定する。 - Source: [[@2018__IETF__A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN)]] - Pages created: source 1件、entity 3件([[Nokia]]・[[AT&T]]・[[John Drake]]) - Pages updated: [[EVPN]](VXLAN/NVGRE カプセル化・DCI の ASBR/GW 方式・Local Bias スプリットホライズンを追記)・[[VXLAN]](entity ページに EVPN 制御プレーン統合節を追加)・[[MPLS]](inter-AS Option B の mass withdrawal 粒度低下という構造的類似)・[[ネットワーク仮想化]](Nicira/NSX の集中制御型 NVO と EVPN の分散 BGP 型 NVO の対比)・[[オーバーレイネットワーク]](運用者主導オーバーレイの制御プレーン層)・[[Cisco]]・[[Juniper Networks]]、index/hot/log/manifest - Key insight: EVPN の mass withdrawal 機構は、DCI を ASBR 方式で構成すると ASBR の BGP ネクストホップ書き換えにより per-ES 粒度から per-EVI 粒度へ後退する。これは BGP/MPLS VPN(RFC 4364)の inter-AS Option B が抱える一般的なトレードオフ(ASBR によるネクストホップ書き換えが originating PE の識別情報を失わせる)が、EVPN という別のプロトコルスタックにも同型に現れることを示す。 - 並行 ingest との衝突と解消: 本 ingest 実行中、別セッションが RFC 7348(VXLAN)・RFC 7432(EVPN 基本仕様)・RFC 9135(EVPN の IRB)を同時に ingest しており、EVPN concept ページが本セッション作成分を含め独立に3つ作成される衝突が発生した。相手セッションの完了を待ったうえで、本セッションが作成した `wiki/concepts/EVPN.md` は相手セッションによって RFC 7432 由来の内容が統合済みであることを確認し RFC 8365 固有の追加更新のみ行い、本セッションが作成した `wiki/concepts/VXLAN.md`(concept)は相手セッションが作成した `wiki/entities/VXLAN.md`(entity)と重複するため削除して知見を entity 側へ移した。[[EVPN(Ethernet VPN)]] との重複は本セッションのスコープ外のため未解消(要 `wiki-lint`)。 ### 2026-08-24 ingest-book | The Art of Computer Systems Performance Analysis `wiki-ingest-book` skill。Raj Jain, *The Art of Computer Systems Performance Analysis: Techniques for Experimental Design, Measurement, Simulation, and Modeling*, John Wiley & Sons, 1991(ISBN 0-471-50336-3)。全 6 部 36 章を章ごとに source 化した。測定・実験計画・シミュレーション・待ち行列モデルの 4 領域を 1 冊に統合した点が本書の特徴で、著者は「これらすべてを統合した本が存在しないから書いた」と序文で動機を述べている。 - Source: `.raw/books/art-of-computer-systems-performance-analysis/`(683 ページ PDF、全 36 章) - Book entity: [[The Art of Computer Systems Performance Analysis]] - Chapters: [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 1 Introduction]]〜[[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 36 Hierarchical Decomposition of Large Queueing Networks]](36 件) - Pages created: entity 3 件 [[ACM SIGMETRICS]]・[[Raj Jain]]・[[The Art of Computer Systems Performance Analysis]] / concept 13 件 [[オペレーショナル法則]]・[[シミュレーションモデルの検証と妥当性確認]]・[[モニタの分類と設計トレードオフ]]・[[リトルの法則]]・[[ワークロード選択の判断軸]]・[[乱数生成器]]・[[信頼区間]]・[[性能データの可視化]]・[[性能メトリクスの選定]]・[[確率分布の選択と関係]]・[[線形回帰]]・[[要約統計量の選定]]・[[離散事象シミュレーション]] - Pages updated: entity 1 件 [[IEEE Computer Society]] / concept 27 件 [[MLプロファイリング]]・[[USE メソッド]]・[[キャパシティ計画]]・[[クラスタリング]]・[[トレーシングオーバーヘッド]]・[[ネットワークシミュレーション]]・[[パフォーマンスのアンチメソドロジ]]・[[ベンチマーキング]]・[[モンテカルロシミュレーション]]・[[ワイブル分布]]・[[ワークロードの特性の把握]]・[[主成分分析]]・[[二項分布]]・[[信頼水準]]・[[分散]]・[[分散モニタリング]]・[[回帰の評価指標]]・[[定常分布]]・[[実験計画法]]・[[待ち行列理論]]・[[性能測定]]・[[期待値]]・[[確率変数]]・[[統計的有意性]]・[[継続的プロファイリング]]・[[過負荷制御]]・[[非侵入プロファイリング]] - Key insight: 本書の各部は、自分の道具の適用限界を示して閉じるという同じ形をとる。Part II はワークロードとモニタで測る方法を積み上げた末に、第 11 章「比率のゲーム」で**同じ測定データから基準の選び方ひとつで相反する結論が導ける**ことを示して終わる。Part IV は要因計画を1 要因から k 要因へ一般化した第 23 章で、完全要因計画が実験数の爆発で破綻し第 19 章の一部実施要因計画へ戻ることを示して閉じる。Part VI は待ち行列理論を単一待ち行列からネットワーク・階層分解へ広げた最終章の §36.3 で、理論自身が扱えない事柄を列挙して本書を終える。同じ姿勢は「よくある誤り(common mistakes)」と「ゲーム(games)」の対の列挙としても反復し、第 2 章(評価一般)・第 9 章(ベンチマーキング)・第 10 章(データ提示)・第 11 章(比率)・第 15 章(回帰)・第 16 章(実験)・第 24 章(シミュレーション)に現れる。前者は技法を知らないことによる無自覚な誤り、後者は自分のシステムを有利に見せるための意図的な小細工で、著者は後者を「読者が騙されないため」に名指しで書いている。 - 図表: 図 189 点を全点埋め込み(未解決リンク 0 件・未使用 attachment 0 件)。 ### 2026-08-24 ingest | RFC 7432 - BGP MPLS-Based Ethernet VPN `wiki-ingest` skill(URL ingest)。IETF が 2015年2月に発行した Standards Track。編集者 [[Ali Sajassi]]([[Cisco]])、共著者 Rahul Aggarwal(Arktan)・Nabil Bitar(Verizon)・Aldrin Isaac(Bloomberg)・James Uttaro(AT&T)・John Drake([[Juniper Networks]])・Wim Henderickx(Alcatel-Lucent)。EVPN の基礎仕様であり、VPLS が抱えるマルチホーミング・冗長性・マルチキャスト最適化の限界を、MAC/IP アドレス学習を MP-BGP によるコントロールプレーンへ移すことで解決する。Ethernet Segment(ES)単位の Ethernet A-D ルート撤回による mass withdrawal(高速収束)、Aliasing/Backup Path による All-Active 負荷分散、<ES, VLAN> 粒度の service carving による Designated Forwarder 選出、シーケンス番号付き MAC Mobility 拡張コミュニティによる MAC move の安全な収束を規定する。 - Source: [[@2015__RFC__BGP MPLS-Based Ethernet VPN]] - Pages created: source 1件、entity 2件([[Ali Sajassi]](既存 [[EVPN]] concept へ出典追記)・[[Juniper Networks]])、concept 1件([[VPLS]]) - Pages updated: [[EVPN]](RFC 7432 の中核機構節を追加)・[[MPLS]](L2VPN の具体例として追記)・[[Cisco]]、index/hot/log/manifest - Key insight: ES 単位の Ethernet A-D ルート撤回による mass withdrawal が、VPLS のデータプレーン学習方式では構造的に不可能だった高速収束を実現する。同一の設計転換(コントロールプレーン学習)が Aliasing による All-Active 負荷分散も可能にする。 - 並行 ingest との衝突: 同時並行の別セッションが RFC 8365・RFC 9135 を ingest しており、EVPN concept ページが独立に3つ作成される衝突が発生した。本セッションは自作の重複ページを [[EVPN]] へ統合して解消したが、[[EVPN(Ethernet VPN)]] との重複は未解消(要 `wiki-lint`)。 ### 2026-08-24 ingest | RFC 7348 - Virtual eXtensible Local Area Network (VXLAN) `wiki-ingest` skill(URL ingest)。RFC Editor が 2014年8月に発行した Independent Submission(Informational)。8名の共著者 [[Mallik Mahalingam]]([[Storvisor]])・[[Dinesh G. Dutt]]([[Cumulus Networks]])・[[Kenneth Duda]]([[Arista Networks]])・[[Puneet Agarwal]]([[Broadcom]])・[[Lawrence Kreeger]]([[Cisco]])・[[T. Sridhar]]([[VMware]])・[[Mike Bursell]]([[Intel]])・[[Chris Wright]]([[Red Hat]])。マルチテナント仮想化データセンター向けのL2オーバーレイ方式VXLANを、STP/VLAN範囲の制約・マルチテナント隔離・ToRテーブルサイズ不足という3つの動機から定式化し、24 bit VNI・VTEPによるステートレスなカプセル化・データプレーン学習による制御プレーンをフレームフォーマットレベルで規定する。既存 wiki が二次資料(SDN本第1章・第8章、RIA第3章)経由で記録していたVXLANの要約を、一次資料として直接裏付け・精緻化した。 - Source: [[@2014__RFC__Virtual eXtensible Local Area Network (VXLAN) - A Framework for Overlaying Virtualized Layer 2 Networks over Layer 3 Networks]] - Pages created: source 1件、entity 11件([[wiki/entities/VXLAN|VXLAN]]・[[Cumulus Networks]]・[[Storvisor]]・[[Mallik Mahalingam]]・[[Dinesh G. Dutt]]・[[Kenneth Duda]]・[[Puneet Agarwal]]・[[Lawrence Kreeger]]・[[T. Sridhar]]・[[Mike Bursell]]・[[Chris Wright]]) - Pages updated: [[Cisco]]・[[Arista Networks]]・[[Broadcom]]・[[VMware]]・[[Intel]]・[[Red Hat]]・[[GENEVE]]・[[オーバーレイネットワーク]]・[[ネットワーク仮想化]]・[[データセンターL2ファブリック]]、index/hot/log/manifest - Key insight: RFC 7348 §3.3 が明示する「仮想化により ToR スイッチが個々の VM の MAC アドレスを学習する必要が生じテーブルが溢れる」という動機は、[[データセンターL2ファブリック]] が記録する PortLand の PMAC 階層アドレッシング(O(k) フォワーディングテーブル)と同一の問題に対する異なるレイヤーでの解法であり、両者は「アドレッシングの再設計」対「オーバーレイによる分離」という対照的な手段で ToR テーブル圧迫に応じている。 ### 2026-08-24 ingest | RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN) `wiki-ingest` skill。IETF が 2021年10月に発行した Proposed Standard。筆頭著者 [[Ali Sajassi]]([[Cisco]])ほか S. Salam・S. Thoria(Cisco)、J. Drake(Juniper)、J. Rabadan(Nokia)。[[EVPN(Ethernet VPN)]]上でサブネット間ルーティングとブリッジングを統合する[[EVPNにおける統合ルーティングとブリッジング(IRB)|IRB]]を、Symmetric/Asymmetric の2モードで定義し、[[分散エニーキャストゲートウェイ]]によるデフォルトゲートウェイのモビリティ透過性、MAC Mobility Extended Community によるホストモビリティ手続きを規定する。EVPN・BGP・ネットワーク仮想化領域の新規トピックとして、既存ページなしから hub concept を新設した。 - Source: [[@2021__IETF__RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)]] - Pages created: source 1件、entity 2件([[IETF]]・[[Ali Sajassi]])、concept 3件([[EVPN(Ethernet VPN)]]・[[EVPNにおける統合ルーティングとブリッジング(IRB)]]・[[分散エニーキャストゲートウェイ]]) - Pages updated: [[Cisco]]、[[エニキャストルーティング]]、index/hot/log/manifest - Key insight: 分散エニーキャストゲートウェイは、CDN文脈のエニキャストルーティング(最近接1ノードへの経路収束)と同じ「同一アドレスの分散提供」という発想を、目的の異なる「モビリティ透過性(どのPEが応答しても論理的に等価)」に転用したものである。 ### 2026-08-23 ingest-video | Measuring Reliability Culture to Optimize Tradeoffs: Perspectives from an Anthropologist(Kathryn Bouskill、SREcon24 Americas) `wiki-ingest-video` skill。[[Kathryn Bouskill]]([[Meta]] Reliability Engineering、人類学者)が SREcon24 Americas(2024-03-20)で発表。USENIX 公式ページにスライドPDFが掲載されておらず、YouTube 動画を主 source として取り込んだ。40人超のインタビューと4波のサーベイで信頼性文化の現場認識を測定し、開発者評価基準への信頼性の明示的組み込み・信頼性測定プログラムの制度化・信頼性プログラム成熟度モデルの新設という3施策に接続した取り組みを報告する。 - Source: [[@2024__SREcon24Americas__Measuring Reliability Culture to Optimize Tradeoffs]] - Pages created: source 1件、entity 1件([[Kathryn Bouskill]]) - Pages updated: [[Meta]]、[[SRE文化]]、index/hot/log/各 `_index`/manifest - 図表: 動画から抽出した代表フレーム12枚を全点確認、うち7点を source ページに埋め込み。文字起こしは YouTube 自動生成英語字幕(auto-caption)をローリングキャプション重複除去のうえ整形。 ### 2026-08-21 ingest-paper | Serval: An End-Host Stack for Service-Centric Networking `wiki-ingest-paper` skill。[[Erik Nordström]] ほかが NSDI 2012 で発表した Serval。ServiceID・FlowID・IP アドレスの役割を分離し、SAL によるサービス登録・遅延束縛・サービスルータ・フロー移行を実現する。28,000 行の Linux カーネルプロトタイプで TCP 933.8 Mbit/s、サービスルータ UDP 872 Mbit/s を測定した。 - Source: [[@2012__NSDI__Serval An End-Host Stack for Service-Centric Networking]] - Pages created: source 1件、entity 9件(著者8名・[[University at Buffalo]])、concept 1件([[Service-Centric Networking]]) - Pages updated: [[Princeton University]]、[[サービスメッシュ]]、[[スクリプタブルロードバランサー]]、index/hot/log/各 `_index`/manifest - Figures: Figure 1〜10 を全件クロップ、Table 1〜3 を転記、発表スライドから補足図4枚を追加 ### 2026-08-21 ingest-slides | XDPerf: A High-Performance Traffic Generator Built with WASM and eBPF `wiki-ingest-slides` skill。[[Takeru Hayasaka]]が発表した、XDP/eBPF の live frames mode と WebAssembly プラグインを組み合わせたネットワークトラフィックジェネレーター [[XDPerf]]。Wasm が起動時にパケットテンプレートと差分規則を生成し、Go + [[wazero]] ホストが eBPF マップへ登録する。PDF 原本は取得できなかったため、Speaker Deck CDN の全50枚の個別画像を保存した。 - Source: [[@2026__KubeCon Japan Community Day__XDPerf - A High-Performance Traffic Generator Built with WASM and eBPF]] - Pages created: source 1件、entity 4件([[Takeru Hayasaka]]・[[BBSakura Networks]]・[[XDPerf]]・[[wazero]])、concept 1件([[XDP]]) - Pages updated: [[SAKURA internet Inc]]、[[DPDK]]、[[TRex]]、[[Linux]]、[[eBPF]]、[[WebAssembly]]、[[RSS(Receive Side Scaling)]]、[[カーネルバイパスネットワーキング]]、index/hot/log/overview/manifest - Key insight: XDPerf は、DPDK の NIC 占有なしに高い packets per second を狙うため、Wasm に柔軟性、Go ホストに起動時展開、eBPF/XDP に per-packet 性能を分担させる。 - Visual pages: CDN 個別画像 50枚を全件確認。主要図 29点を `wiki/sources/_attachments/xdperf-speakerdeck-2026/` へコピー。 ### 2026-08-21 ingest-paper | A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability `wiki-ingest-paper` skill。[[Adel Belkhiri]]、[[Arnaud Fiorini]]、[[Matthew Khouzam]]、[[Heng Li]]による ICPE '26 論文。DPDK native tracer の CTF を [[Trace Compass]] の DPDK プラグインで状態モデル・性能メトリクス・同期ビューへ変換し、VPP の性能ボトルネックを診断する。 - Source: [[@2026__ICPE__A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability]] - Pages created: source 1件、entity 10件(共著者3、Ericsson、Trace Compass、VPP、TRex、dpdk-profile、調査資料、Ciena)、concept 1件([[DPDK性能分析]]) - Pages updated: [[DPDK]]、[[Heng Li]]、[[Polytechnique Montréal]]、[[オブザーバビリティ]]、[[カーネルバイパスネットワーキング]]、[[プローブ効果]]、index/hot/log/overview/manifest - Key insight: DPDK の高速なユーザー空間経路では、性能向上だけでなく、native tracing とドメイン固有の状態モデルを用いて lcore・poll・mempool の内部状態を説明可能にすることがオブザーバビリティの中心課題になる。 - Figures: Figure 1〜9 を全件埋め込み、Table 1 を転記。埋め込み画像7点とベクター図3点を採用し、ページ全体レンダリング画像は保持しない。 ### 2026-08-21 ingest-paper | Deploying User-space TCP at Cloud Scale with LUNA `wiki-ingest-paper` skill。[[Lingjun Zhu]]、[[Yifan Shen]]、[[Erci Xu]] ほか18名([[Alibaba Group]])によるUSENIX ATC 2023論文。Alibaba Cloudストレージネットワークへ5年以上展開されたユーザーレベルTCPスタック[[LUNA]]を、run-to-completion、[[Zbuf]]による全経路ゼロコピー、Flow BifurcationとSR-IOVによるカーネルTCP共存の三設計軸から説明する。 - Source: [[@2023__USENIX ATC__Deploying User-space TCP at Cloud Scale with LUNA]] - Pages created: source 1件、entity 23件(共著者18、LUNA・Zbuf・knb・Pangu・Solar) - Pages updated: [[Alibaba Group]]、[[Alibaba Cloud]]、[[DPDK]]、[[Linux]]、concept 9件、index/hot/log/overview/manifest - Key insight: ユーザーレベルTCPの性能はカーネルを迂回するだけでなく、アプリケーションとTCPを同じコアで完了させ、バッファ所有権をNICまで共有し、カーネルTCPとの共存をNIC分岐で設計できるかで決まる。 - Figures: Figure 1〜16を全件クロップ、Table 1を転記。発表スライドp.18・p.20を統合。 ### 2026-08-21 ingest-paper | Scalable Kernel TCP Design and Implementation for Short-Lived Connections `wiki-ingest-paper` skill。[[Xiaofeng Lin]]、[[Yu Chen (Tsinghua)|Yu Chen]]、[[Xiaodong Li]]、[[Junjie Mao]]、[[Jiaquan He]]、[[Wei Xu]]、[[Yuanchun Shi]]による ASPLOS 2016 論文。短命 TCP 接続のスケーラビリティを、global TCB table・VFS・接続局所性の問題として分解し、BSD Socket API 互換のカーネル設計 [[Fastsocket]] を提案する。 - Source: [[@2016__ASPLOS__Scalable Kernel TCP Design and Implementation for Short-Lived Connections]] - Pages created: source 1件、entity 11件(著者6、組織2、Fastsocket・HAProxy・Sina Weibo)、concept 1件([[TCP接続局所性]]) - Pages updated: entity 5件、concept 8件、index/hot/manifest - Key insight: カーネルをユーザー空間へ移さなくても、Local Listen Table・Local Established Table・Receive Flow Deliver・ソケット専用 VFS 経路で接続をコア局所化すれば、BSD Socket API とカーネル機能を保ったまま短命接続をスケールできる。 - Figures: Figure 1〜5 を全件クロップして埋め込み、Table 1 を転記。 ### 2026-08-21 ingest-paper | Unikraft: Fast, Specialized Unikernels the Easy Way - Source: [[@2021__EuroSys__Unikraft - Fast, Specialized Unikernels the Easy Way]] - Pages created: source 1件、entity 25件(共著者14、所属機関2、Unikraft・比較システム・Artifact repository 9)、concept 1件([[ソフトウェア特殊化]]) - Pages updated: entity 12件、concept 4件、index/hot/manifest - Key insight: ユニカーネルの性能は単一アドレス空間だけで決まらず、OS プリミティブと API を交換可能なマイクロライブラリへ分解し、アプリケーションを POSIX 層から低レベル I/O へ接続する特殊化の設計で決まる。 - Figures: Figure 1〜22 を全件クロップして埋め込み、Table 1〜4 を転記。 ### 2026-08-21 ingest-paper | zpoline: a system call hook mechanism based on binary rewriting `wiki-ingest-paper` skill。[[Kenichi Yasukata]]、[[Hajime Tazaki]]、[[Pierre-Louis Aublin]]([[IIJ Research Laboratory]])、[[Kenta Ishiguro]]([[Hosei University]])による USENIX ATC 2023 論文。x86-64 の二バイト `syscall`/`sysenter` を `callq *%rax` と仮想アドレス 0 のトランポリンへ置換し、低オーバーヘッドかつ網羅的なシステムコールフックを実現する。 - Source: [[@2023__USENIX-ATC__zpoline - a system call hook mechanism based on binary rewriting]] - Pages created: source 1件、entity 6件([[Hajime Tazaki]]・[[Pierre-Louis Aublin]]・[[Kenta Ishiguro]]・[[Hosei University]]・[[zpoline]]・[[DPDK]])、concept 2件([[システムコールフック]]・[[バイナリ書き換え]]) - Pages updated: [[Kenichi Yasukata]]、[[IIJ Research Laboratory]]、[[lwIP]]、[[Redis]]、[[Linux]]、[[FreeBSD]]、[[システムコール]]、[[動的計装]]、[[プローブ効果]]、[[ゼロコード計装]]、[[ユーザーレベルTCPスタック]]、[[カーネルバイパスネットワーキング]] - Key insight: 既存アプリケーションへユーザー空間 OS サブシステムを透明に接続するには、スタック自体の高速化だけでなく、システムコール境界の網羅的なフックと互換性設計が必要である。 - Figures: Figure 1〜3 を全件クロップして埋め込み、Table 1 を転記。 ### 2026-08-21 ingest-paper | TAS: TCP Acceleration as an OS Service `wiki-ingest-paper` skill。[[Antoine Kaufmann]]、[[Tim Stamler]]、[[Simon Peter]]、[[Naveen Kr. Sharma]]、[[Arvind Krishnamurthy]]、[[Thomas Anderson]]による EuroSys 2019 論文。TCPの共通ケースを専用CPU上のfast path OSサービスへ分離し、接続制御・輻輳制御・タイムアウト・例外処理をslow pathへ残すTASを提案する。 - Source: [[@2019__EuroSys__TAS - TCP Acceleration as an OS Service]] - Pages created: source 1件、entity 6件([[Antoine Kaufmann]]・[[Tim Stamler]]・[[Simon Peter]]・[[Naveen Kr. Sharma]]・[[TAS]]・[[FlexStorm]])、concept 1件([[TCP高速化サービス]]) - Pages updated: [[Arvind Krishnamurthy]]、[[Thomas Anderson]]、[[University of Washington]]、[[UT Austin]]、[[Max Planck Institute for Software Systems]]、[[ユーザーレベルTCPスタック]]、[[カーネルバイパスネットワーキング]]、[[TCP IPスタック統合|TCP/IPスタック統合]]、[[ホストネットワークスタック性能]]、[[TCP輻輳制御アルゴリズム]]、[[アプリケーション並行実行モデル]]、[[スマートNICオフロード]] - Key insight: TASは、カーネルバイパスの性能機構とOSサービスの安全性・POSIX互換性を、fast path/slow pathの責任分割と負荷比例CPU割当により同時に扱う。 - Figures: Figure 1〜15を全件クロップして埋め込み、Table 1〜8を転記。 ### 2026-08-21 ingest-paper | Understanding Host Network Stack Latency `wiki-ingest-paper` skill。[[Tianyu Zuo]]、[[Jaehyun Hwang]]、[[Ao Tang]]、[[Rachit Agarwal]]、[[Qizhe Cai]]による ACM SIGCOMM 2026 論文。Linux の高いテールレイテンシを、パケット処理ではなく softIRQ 時間の誤計上、CPU runtime 公平性の限界、バースト性トラフィック下の DIM の非効率というホスト資源管理の問題として特定し、ACCa、PCSched、AutoDIM を評価する。 - Source: [[@2026__SIGCOMM__Understanding Host Network Stack Latency]] - Pages created: source 1件、entity 3件([[Tianyu Zuo]]・[[Ao Tang]]・[[Sungkyunkwan University]])、concept 1件([[ネットワークワークロードのCPUスケジューリング]]) - Pages updated: [[Jaehyun Hwang]]、[[Rachit Agarwal]]、[[Qizhe Cai]]、[[University of Virginia]]、[[Cornell University]]、[[Linux]]、[[Redis]]、[[YCSB]]、[[Ftrace]]、[[ホストネットワークスタック性能]]、[[ネットワーク割り込み合体とCPUスケーリング]]、[[レイテンシ分析]]、[[テールレイテンシ耐性技術]]、[[ユーザーレベルTCPスタック]]、[[カーネルバイパスネットワーキング]] - Key insight: 単一スレッド・非競合時の Linux は P99.9 19 マイクロ秒を達成でき、高いテールはネットワークスタックそのものより CPU 資源の計上、公平性、割り込み調整から生じる。少数接続と in-flight 要求、ACCa、PCSched、AutoDIM により、既定 Linux に対して最大 5.3 倍の改善を得る。 - Figures: Figure 1〜17 を全件クロップして埋め込み、Table 1 を転記。 ### 2026-08-21 ingest-paper | Understanding Host Network Stack Overheads `wiki-ingest-paper` skill。[[Qizhe Cai]] ら [[Cornell University]] の SIGCOMM 2021 論文。100 Gbps 級リンクの Linux ホストネットワークスタックを測定し、単一長フローでは受信側データコピーが CPU サイクルの約 49%を占め、帯域遅延積と DCA キャッシュ容量の不釣り合い、NUMA 配置、フロー競合、長短フロー混在、ネットワーク認識型スケジューリングを主要課題として示す。 - Source: [[@2021__SIGCOMM__Understanding Host Network Stack Overheads]] - Pages created: source 1件、entity 6件([[Qizhe Cai]]・[[Shubham Chaudhary]]・[[Midhul Vuppalapati]]・[[Jaehyun Hwang]]・[[Rachit Agarwal]]・[[terabit-network-stack-profiling]])、concept 1件([[ホストネットワークスタック性能]]) - Pages updated: [[Cornell University]]、[[ゼロコピーネットワーキング]]、[[カーネルバイパスネットワーキング]]、[[ユーザーレベルTCPスタック]]、[[TCP IPスタック統合|TCP/IPスタック統合]]、[[組み込みTCP IP|組み込みTCP/IP]]、[[アプリケーション並行実行モデル]]、[[TCP輻輳制御アルゴリズム]] - Key insight: 高帯域化により、ネットワークスタックの主ボトルネックは per-packet のプロトコル処理から受信側の per-byte データ移動とホスト資源オーケストレーションへ移る。 - Figures: Figure 1〜13 を全件埋め込み、Table 1〜2 を転記。 ### 2026-08-21 ingest-paper | iip: an integratable TCP/IP stack `wiki-ingest-paper` skill。[[Kenichi Yasukata]]([[IIJ Research Laboratory]])による、統合容易性と高性能の両立を目指す TCP/IP スタック [[iip]] の設計・評価論文。外部依存を API とコールバックへ間接化し、利用側の処理ループから split、merge、unified の CPU コア割り当てモデル、NIC オフロード、ゼロコピー I/O、RSS を選択可能にする。 - Source: [[@2024__SIGCOMM CCR__iip - An Integratable TCP IP Stack]] - Pages created: source 1件、entity 3件([[Kenichi Yasukata]]・[[IIJ Research Laboratory]]・[[iip]])、concept 1件([[TCP IPスタック統合|TCP/IPスタック統合]]) - Pages updated: [[ユーザーレベルTCPスタック]]、[[ゼロコピーネットワーキング]]、[[カーネルバイパスネットワーキング]]、[[RSS(Receive Side Scaling)]]、[[組み込みTCP IP|組み込みTCP/IP]]、[[ホストネットワークスタック性能]]、[[@2021__SIGCOMM__Understanding Host Network Stack Overheads]] - Key insight: TCP/IP スタックの統合問題は、依存関係を減らすだけでなく、実行ループ、プロトコル状態、パケットバッファ、NIC 機能の責任境界を統合側が選べる API として設計する問題である。 - Figures: Figure 1〜2 をベクター図のクロップとして全件埋め込み。本文参照図表の除外なし。 ### 2026-08-21 ingest-paper | Full TCP/IP for 8-Bit Architectures `wiki-ingest-paper` skill。MobiSys 2003 の論文。[[Adam Dunkels]] が [[Swedish Institute of Computer Science]] で実装した [[lwIP]] と [[uIP]] を、8 ビット・16 ビットシステムの限られたコード領域・RAM へ適合させる。RFC1122 のホスト間要件、単一グローバルバッファ、イベント駆動 API、スライディングウィンドウ、遅延 ACK、Ethernut/Atmega128 実験を扱う。 - Source: [[@2003__MobiSys__Full TCP IP for 8-Bit Architectures]] - Pages created: source 1件、entity 6件([[Adam Dunkels]]・[[Swedish Institute of Computer Science]]・[[lwIP]]・[[uIP]]・[[Dummynet]]・[[Ethernut]])、concept 1件([[組み込みTCP IP|組み込みTCP/IP]]) - Pages updated: [[FreeBSD]]、[[アプリケーション並行実行モデル]]、[[TCP輻輳制御アルゴリズム]]、[[Webサーバアーキテクチャ]] - Key insight: TCP の機構を単純に削るのではなく、状態と再送責任をスタックからアプリケーションへ移し、イベント駆動 API と単一バッファを使うことで、uIP は小型機器でもホスト間相互運用性を保つ。lwIP はより多くの状態を保持して機能性とスループットを得る。 - Figures: Figure 1〜7 を全件埋め込み、Table 1〜5 を転記。 ### 2026-08-21 ingest | Extensible Software in the age of LLMs(Jeremy Morrell、jeremymorrell.dev) `wiki-ingest` skill。LLM 支援コーディングとサンドボックス実行基盤の組み合わせにより、ウェブアプリケーションをユーザーごとに拡張可能にする設計仮説。需要曲線の長い尾、LLM ネイティブソフトウェア、AI エージェント・企業内基盤・サポート・オブザーバビリティへの適用、Salesforce の先行例、ケイパビリティによる最小権限、インタプリタ/V8 Isolate/MicroVM/WASM + WASI、Cloudflare Dynamic Workers を扱う。 - Source: [[@2026__jeremymorrell.dev__Extensible Software in the age of LLMs]] - Pages created: source 1件、entity 3件([[Dynamic Workers]]・[[Cloudflare OS]]・[[Pi]])、concept 2件([[ウェブ拡張型ソフトウェア]]・[[LLMネイティブソフトウェア]]) - Pages updated: [[Jeremy Morrell]]、[[Cloudflare]]、[[Salesforce]]、[[Extension Interface Model]]、[[Capability-based Security]]、[[WebAssembly]]、[[サーバーレスアーキテクチャ]]、[[AIネイティブ開発]]、[[LLMアプリケーション信頼性]]、[[overview]] - Key insight: LLM は拡張の作者コストを下げるが、安全性を自動的に保証しない。ウェブ上で長い尾の要求を扱うには、責任ある中核、狭いケイパビリティ、資源制限、強い分離、観測可能性を組み合わせる必要がある。 - Figures: 需要曲線、LLM 拡張デモ、サポート画面、オブザーバビリティ画面、Salesforce 構成図の5点を埋め込み。 ### 2026-08-21 ingest-video | Networking for Meta's Gigawatt-scale AI fleet(ACM SIGCOMM、Omar Baldonado) `wiki-ingest-video` skill。ACM SIGCOMM が公開した 15 分 15 秒のスポンサーセッション動画。[[Omar Baldonado]] が Meta のギガワット級 AI フリートのネットワークを、スケールアップ・スケールアウト・スケールアクロスの三領域として説明し、ワークロード、アクセラレータ、ネットワーク、配置場所を横断した協調設計と、障害迂回・無停止更新・物理交換を含むライフサイクル運用を論じる。公式講演ページで講演名・講演者・概要を裏取りした。 - Source: [[@2026__SIGCOMM__Networking for Meta's Gigawatt-scale AI fleet]] - Pages created: source 1件、entity 1件([[Omar Baldonado]]) - Pages updated: [[Meta]]、[[UALink Consortium]]、[[AIデータセンタートポロジ]]、[[GPUクラスタ運用]]、[[オープンネットワーキング]]、[[データセンターネットワーク信頼性]] - Key insight: Scale Outside として整理されていた DC 間ネットワークの第三領域を、Meta は Scale Across と呼び、電力・光ファイバー・長距離レイテンシー・クラウド容量を含む運用上の設計境界として扱う。 - 備考: 動画本体は HTTP 403 で取得できず、YouTube 自動字幕のみ保存。代表フレーム・音声は未取得で、字幕にのみ現れる数値・製品名は未確認とした。 ### 2026-08-21 ingest-paper | Data Warehousing and Analytics Infrastructure at Facebook `wiki-ingest-paper` skill。SIGMOD 2010の論文。[[Facebook]]がScribe・[[Apache Hadoop]]・[[Apache Hive]]を組み合わせ、15PB超(圧縮後2.5PB)を保持し、毎日60TB超(圧縮後10TB)を取り込んだデータウェアハウスの設計・運用経験を報告する。約10,000ジョブ/日、2万超のHiveテーブル、約1億ファイル・ブロックを背景に、ログ収集、外部テーブル、日次ロード、クラスタ分離、Fair Share、協調的メタデータ、系譜抽出を一つの基盤へ接続する。 - Source: [[@2010__SIGMOD__Data Warehousing and Analytics Infrastructure at Facebook]] - Pages created: source 1件、entity 13件、concept 2件 - Pages updated: entity 4件、concept 3件 - Key insight: データウェアハウスの集中化は格納先を一つにするだけでは終わらず、データ発見、SLA分離、資源共有、NameNodeのメタデータ管理まで含む共有基盤へ拡張される。 ### 2026-08-19 ingest | mlx5 Ethtool Counters(Linux kernel docs 6.7、NVIDIA/Mellanox) `wiki-ingest` skill。URL ingest(kernel.org、6.7 系ドキュメント、著作権表記 2023 年 NVIDIA CORPORATION & AFFILIATES)。[[Mellanox|Mellanox/NVIDIA]] ConnectX シリーズを駆動する Linux カーネルドライバ `mlx5` が公開する `ethtool -S` カウンタの公式仕様。計測点(Ring/Netdev・vPort・Physical Port・Priority Port・Device)と種別(Informative/Acceleration/Error)の2軸で 90 超のカウンタを定義し、`rx_discards_phy`(輻輳)・`rx_pcs_symbol_err_phy`/`rx_corrected_bits_phy`(FEC/BER・リンク品質)・`module_bus_stuck`(光モジュール障害)・`rx_pci_signal_integrity`(PCIe 信号品質)など、既存の RDMA 監視研究(Lumina・CorrOpt 等)が言及するカウンタ名の一次定義を与える。WebFetch(defuddle 変換込み)ではページ内の HTML `<table>` 5 個が抽出されずサマリのみになったため、生 HTML を curl で取得し BeautifulSoup でテーブルを手動変換して全文を復元した。 - Source: [[@2023__LinuxKernelDocs__mlx5 Ethtool Counters]] - Pages updated: [[Mellanox]], [[RDMAネットワーク監視]] - Key insight: RDMA 監視研究(Lumina の `rx_discards_phy` 言及、CorrOpt の RxPower/TxPower 診断)が個別に言及するカウンタ名は、ベンダーが公開する統一仕様(5 計測点 × 3 種別)の部分集合として位置づけ直せる。個別研究の観察とベンダー一次仕様を突き合わせることで、カウンタ名の意味論的な出典が明確になった。 ### 2026-08-19 ingest-paper | Blending Containers and Virtual Machines: A Study of Firecracker and gVisor(Anjali+, VEE 2020) `wiki-ingest-paper` skill。ユーザー提供 URL(pages.cs.wisc.edu、全13ページ)。[[University of Wisconsin-Madison|University of Wisconsin-Madison]] の Anjali・Tyler Caraza-Harter・Michael M. Swift による、Linux コンテナ(LXC)・[[gVisor]]・[[Firecracker]] の行・分岐粒度カーネルコードカバレッジ分析(lcov、kernel v5.4.13)+ CPU/ネットワーク/メモリ/ファイルアクセスのマイクロベンチマーク。ホストカーネル外へ機能を移動させる設計にもかかわらず、gVisor(91,161行)・Firecracker(77,392行)はネイティブ Linux(63,163行)より多くのホストカーネルコードを実行し、gVisor は LXC(90,595行)と実質同じコードを異なる頻度で共有することを実測で示した(例: `do_mmap()` は LXC で100万回超、gVisorで5,382回)。性能面ではFirecrackerがネットワークRTTで最悪(371µs、2段のカーネルネットワークスタック経由)、gVisorがメモリ割り当てとネットワークストリーミング(0.805Gbps)で最も遅いことを定量化。図表20点(Figure 1〜20)全件をPyMuPDFキャプション座標クロップで埋め込み(全図がベクター描画のためpdf.js埋め込み画像抽出はゼロ件)、表3点(Table 1〜3)をMarkdown表へ転記。全13ページ本文を通読。 - Source: [[@2020__VEE__Blending Containers and Virtual Machines - A Study of Firecracker and gVisor]] - Pages created: [[Anjali]], [[Tyler Caraza-Harter]], [[Michael M. Swift]] - Pages updated: [[gVisor]], [[Firecracker]], [[Kata Containers]], [[University of Wisconsin-Madison]], [[コンテナ仮想化]], [[Lightweight Sandboxing]] - Key insight: 「機能をホストカーネルの外(ユーザー空間カーネル・ゲストカーネル)へ移動させれば攻撃対象領域が縮小する」という隔離プラットフォーム設計の直感的前提に対し、行・分岐粒度の実測は反証を突きつける——gVisor・Firecracker はいずれもネイティブ Linux より多くのホストカーネルコードを実行する。一方で呼び出し**頻度**は大幅に下がるため、「コード量(セキュリティ代理指標)」と「呼び出し頻度(性能代理指標)」は互いに独立に変動しうる 2 つの軸であり、片方の改善がもう片方を保証しない。 ### 2026-08-19 ingest-paper | Serverless inferencing on Kubernetes(Clive Cox ほか、ICML 2020 ワークショップ) `wiki-ingest-paper` skill。arXiv 2007.07366(v1: 2020-07-14、v2: 2020-07-24)。Kubeflow エコシステムの KFServing プロジェクトを解説する4ページのワークショップ論文。Knative(基盤は Istio)上に単一の InferenceService CRD を提供し、TensorFlow/PyTorch/XGBoost/SKlearn 等のフレームワークを問わずサーバーレスデプロイできる。GPU オートスケーリングでは GPU duty cycle メトリクスの取得困難性・CPU/GPU 指標統合の困難性を回避するため、Knative Pod Autoscaler(KPA)のリクエストベースオートスケーリング(インフライトリクエスト数ベース)を活用する。2020年時点の本番運用経験として、queue-proxy サイドカーの CPU クォータと Linux CFS スケジューラのバグの組み合わせによるテールレイテンシ悪化、大規模モデル(5〜30GB)でのスケールツーゼロ起動レイテンシ問題、Istio/Knative の大規模運用負荷を報告。未解決課題として大規模モデルのキャッシュ共有、数百〜数千個の小規模モデルの多重化、監視コンポーネントのライフサイクル管理を挙げる。図1点(KFServing技術スタック)を埋め込み。 - Source: [[@2020__arXiv__Serverless inferencing on Kubernetes]] - Pages created: [[Clive Cox]], [[Dan Sun]], [[Ellis Tarn]], [[Animesh Singh]], [[Rakesh Kelkar]], [[David Goodwin]], [[Seldon Technologies]], [[Bloomberg L.P.]], [[IBM]], [[KFServing]], [[Kubeflow]] - Pages updated: [[Knative]], [[Istio]], [[Kubernetes]], [[NVIDIA]], [[Microsoft]], [[サーバーレスアーキテクチャ]], [[LLMサービング管理]] - Key insight: PreServe・FaaScale が2026年時点で扱う「LLM のコールドスタートが反応的オートスケーリングを無効化する」という trilemma は、LLM 以前の一般的な機械学習モデルサービングの時点(2020年、KFServing)ですでに同型の構造(大規模モデルのダウンロード時間 vs スケールツーゼロの起動レイテンシ)で観測されており、モデル規模拡大とともに繰り返し先鋭化してきた構造的課題であることが分かった。 ### 2026-08-19 ingest | KEP-2724: Topology Aware Scheduling(kubernetes-sigs/kueue, sig-scheduling) `wiki-ingest` skill。GitHub 上の Kueue KEP README(`gh api` で取得、全2260行)。[[Kueue]](Kubernetes 向けジョブキューイング・バッチスケジューリングコントローラ)の主要拡張である[[トポロジ考慮型スケジューリング]](Topology Aware Scheduling、TAS)の設計文書。データセンターのラック・ブロック階層をノードラベルとして表現し、AI/ML ワークロードの Pod 間通信帯域を意識した配置制約(required/preferred/unconstrained の3層アノテーション、多層スライス制約)を Kueue の ResourceFlavor・PodTemplate アノテーション経由で表現する。PodSetAssignment を必ずトポロジ最下位レベル単位で確定させることでレース条件を防ぐ設計、BestFit/LeastFreeCapacity/BalancedPlacement の配置アルゴリズム選択、ノード障害時の再割当(Workload所有構造による分岐)、ProvisioningRequest 経由の Cluster Autoscaler 統合の2パス設計、スケジューリングサイクル内競合の再計算修正(v0.19)まで、2024-07-30 の提案から v0.19 系までの継続的改訂を通読した。 - Source: [[@2024__KEP__KEP-2724 Topology Aware Scheduling]] - Pages created: [[Kueue]], [[トポロジ考慮型スケジューリング]] - Pages updated: [[Kubernetes]], [[GPUクラスタスケジューリング]] - Key insight: TAS は Philly/HiveD が扱ってきた GPU クラスタの局所性(locality)問題意識を、ノードラベルという Kubernetes ネイティブな抽象化の上に required/preferred の2段階要求・多層スライス制約・BalancedPlacementアルゴリズムとして体系化した後発の取り組みであり、決定論的なノード単位配置ゆえに通常のクォータスケジューリングより桁違いに高頻度でスケジューリングサイクル内競合を起こすという副作用も抱える。 ### 2026-08-19 ingest-book | アジャイルな見積りと計画づくり ― 価値あるソフトウェアを育てる概念と技法(Mike Cohn、マイナビ 2009、全 7 部 23 章) `wiki-ingest-book` skill。ユーザー提供のローカル PDF(全 338 ページ)。原書は *Agile Estimating and Planning*(Prentice Hall, 2006)。アジャイル開発における見積りと計画づくりを、規模の見積り・価値による優先順位づけ・スケジュール立案・トラッキングの 4 段構えで体系化した実務書。中心にあるのは「規模を見積もり、期間は導出する」という原理で、単位を持たない相対値([[ストーリーポイント]])または[[理想日]]で規模を見積もり、実測値である[[ベロシティ]]で割って期間を得るため、見積りの系統的な偏りがベロシティを介して自動的に補正される。 - Book entity: [[wiki/entities/アジャイルな見積りと計画づくり|アジャイルな見積りと計画づくり]]。既存 `books/アジャイルな見積りと計画づくり.md` と basename が衝突するため、wiki 内からの参照はすべてパス修飾する(conventions §9.7)。 - Source: 全 23 章 + イントロダクションを 1 章 = 1 source ページとして 24 枚作成(すべて `publish: false`)。[[@2009__Mynavi__アジャイルな見積りと計画づくり - Introduction イントロダクション]] 〜 [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 23 ケーススタディ ボムシェルタースタジオ]]。 - 新規 concept 23 件。アジャイル開発のプロジェクト計画領域をまとめて立ち上げた。ハブは [[アジャイルな計画づくり]]・[[ストーリーポイント]]・[[フィーチャの優先順位づけ]]・[[リリース計画づくり]]・[[イテレーション計画づくり]]・[[ベロシティ]] で、いずれも 4〜7 章分が `## 横断的知見` に層状に積まれている。 - 新規 entity 20 件([[Mike Cohn]]・[[安井力]]・[[角谷信太郎]]・[[マイナビ]]・[[SwimStats]]・[[ハバナ (ボードゲーム)]] ほか本書が引く論者 14 名)、更新 entity 2 件([[Barry W. Boehm]]・[[Kent Beck]])。 - 図表 99 点(図 50・表 49)を全点埋め込み。全図がベクター描画で埋め込み画像を持たないため、キャプションが本文 7.8pt に対し 6.4pt で組まれている点を判別条件にし、ベクター描画矩形のクラスタリングでオーケストレータが 1 パスで切り出した。本文の図表参照集合と差分ゼロ。 - 23 章(50 ページのケーススタディ)は全概念に触れるため concept 書き込みを禁じ、印字ノンブル付きの観察 8 件を報告させて各 concept へ反映した。 ### 2026-08-19 ingest-paper | Pingmesh: A Large-Scale System for Data Center Network Latency Measurement and Analysis(Chuanxiong Guo+, SIGCOMM 2015) `wiki-ingest-paper` skill。ユーザー提供のローカル PDF(全14ページ)。Microsoft のデータセンターネットワークにおける全サーバ常時参加型のレイテンシ計測・分析システム [[Pingmesh]] の設計論文。Pod内・ToR間・データセンター間の3階層完全グラフで最大到達可能なカバレッジを実現し、ネットワークSLA追跡とサイレントパケットドロップ検知を行う。既存 [[R-Pingmesh]](SIGCOMM 2024)の先行研究に当たる原論文。 - Source: [[@2015__SIGCOMM__Pingmesh - A Large-Scale System for Data Center Network Latency Measurement and Analysis]] — 全サーバ参加・常時稼働という設計選択により live-site インシデント発生時に既にレイテンシデータが存在する状態を実現し、疎結合アーキテクチャによって Inter-DC対応・QoS監視・VIP監視・サイレントパケットドロップ検知という当初想定外の機能拡張をアーキテクチャ変更なしに追加できたことを報告する。 - 新規 entity 2 件([[Pingmesh]]・[[Autopilot]])、更新 entity 3 件([[Chuanxiong Guo]]・[[David Maltz]]・[[R-Pingmesh]])。新規 concept 1 件([[サイレントパケットドロップ検知]])、更新 concept 2 件([[ネットワーク監視]]・[[データセンターネットワーク信頼性]])。 - 図表 11 点(図 8・表 1)を全点埋め込み。Figure 1・2 はベクター図のため PyMuPDF でキャプション座標クロップ、Figure 3-8 は埋め込み画像 12 枚を attachment へ配置。Table 1 は Markdown 表へ転記。 ### 2026-08-19 ingest-paper | The ganglia distributed monitoring system: design, implementation, and experience(Matthew L. Massie+, Parallel Computing 2004) `wiki-ingest-paper` skill。ユーザー提供のローカル PDF(48ページ、日英対訳版・偶数ページが英語原文)。クラスタ・グリッド・惑星規模システムを横断するスケーラブルな分散モニタリングシステム [[Ganglia]] の設計論文。マルチキャストベースの listen/announce プロトコルによるクラスタ内対称監視と、点対点接続ツリー(gmetad)によるクラスタ間フェデレーションの2層設計を提案し、Millennium・SUNY・UCB CS・[[PlanetLab]] の4生産システムでスケーラビリティとオーバーヘッドを実測する。 - 代表 source: [[@2004__Parallel Computing__The Ganglia Distributed Monitoring System - Design, Implementation, and Experience]] — クラスタ向けに設計された Ganglia を惑星規模の PlanetLab へ展開した経験から、広域帯域幅コスト・フラットなメトリック名前空間・RRDtool の I/O 負荷といった、当初想定していなかった設計課題が表面化したことを報告する。 - 新規 entity 4 件([[Matthew L. Massie]]・[[Brent N. Chun]]・[[Ganglia]]・[[PlanetLab]])、更新 entity 3 件([[David E. Culler]]・[[University of California, Berkeley]]・[[Intel Research]])。新規 concept 1 件([[分散モニタリング]])。 - 図表 11 点(図 5・表 6)を全点埋め込み。図はすべて英語原文ページ(偶数ページ)から PyMuPDF でキャプション座標クロップし、表はすべて Markdown 表へ転記した。 ### 2026-08-18 ingest-book | カオスエンジニアリング ― 回復力のあるシステムの実践(オライリー・ジャパン 2022、イントロダクション + 全 21 章) `wiki-ingest-book` skill。ユーザー提供のローカル PDF(316 ページ)。原書 *Chaos Engineering: System Resiliency in Practice*(O'Reilly Media, 2020)の日本語版。編著者 [[Casey Rosenthal]]・[[Nora Jones]] に加え、各社の実践者とレジリエンスエンジニアリング/ヒューマンファクターの研究者が章ごとに執筆する論集。章ごとに subagent へ委譲し、4 体ローリングで 22 枚の source を作成した。 - Book entity(新規): [[wiki/entities/カオスエンジニアリング ― 回復力のあるシステムの実践|カオスエンジニアリング ― 回復力のあるシステムの実践]] — 原則・事例・人間的側面・ビジネス価値・応用領域という 5 層でカオスエンジニアリングを一個の工学的規律として確立した書籍。 - 代表 source: [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 3 原則の全体像]] — 「実験 対 テスト」「ベリフィケーション 対 バリデーション」で規律を定義し、「モノを壊すこと」「抗脆弱性」との違いを明確にしたうえで発展した 5 原則を提示する理論的中核。 - 代表 source: [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 12 実験の選択に関する課題(と、その解決策)]] — [[Peter Alvaro]] が「人間の直感は伝達不可能なので実験選択の基準に据えられない」と論じ、LDFI により可観測性データから SAT/ILP で実験候補を機械的に導出する。 - 代表 source: [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 9 先見性を生み出す]] — カオスエンジニアリングを認知面接とファシリテーションでメンタルモデルの差異を可視化する装置として捉え直す。Netflix ChAP の普及失敗の記録を含む。 - Key insight: 本書の骨格は、3 章が規律を「実験であってテストではない」「バリデーションでなくベリフィケーション」と定義し、16 章がそれを継続的ベリフィケーション(CV)という上位概念へ一般化する縦の線にある。この定義がツールから独立しているため、19 章(分散データベース)・20 章(セキュリティ)・17 章(サイバーフィジカル)・18 章(製造業の HOP)という異質な領域へ同じ規律を展開できている。より重要なのは、第 III 部が編著者自身の枠組みへの批判を本編に組み込んでいる点である ── 9 章は Netflix ChAP が技術的に成功しながら利用者が作成者 4 人にとどまり自動化がかえって専門知識の広がりを浅くしたと報告し、11 章(John Allspaw)は機能配分思想を認知システム工学から否定し、12 章(Peter Alvaro)は「人間の直感は伝達不可能なので実験選択の基準に据えられない」と論じる。9 章と 12 章は「人間の直感を実験にどう使うか」という同じ問いに正反対の解(引き出して共有する 対 機械的導出に置き換える)を与えており、この対立が未解決のまま並置されているのが本書の性格を最もよく示す。vault 内では、既存の [[@2021__OReillyJapan__SREの探求 - Chapter 14 初めにカオスありき]](Rosenthal 自身による二次資料)に対する一次資料として位置づき、2 章が Rasmussen の動的安全モデルを、15 章が CMM を、それぞれ二次資料の要約より詳細な形で裏づけた。また 8 章(Capital One)と既存の [[@2026__SREcon26Americas__Executing Chaos Engineering in Production at a Critical Financial Institution]](Bradesco)は、ともに規制下の金融機関でありながら「SRE を拡大せずスケールする」問いに責任分散 対 自動化という別解を与え、ツール選定は逆経路で内製ガバナンスに収束している。 - 新規 entity 30 件(book entity・[[Nora Jones]]・章著者 13 名・[[PingCAP]]・[[ChAP]]・[[LinkedOut]]・[[ChaoSlingr]]・[[TiDB]]・[[Schrodinger]] ほか)、更新 entity 17 件。新規 concept 9 件([[動的安全モデル]]・[[複雑性の経済的支柱]]・[[先見性]]・[[機能配分]]・[[カオスの成熟モデル(CMM)]]・[[継続的ベリフィケーション]]・[[機能安全]]・[[HOP]]・[[セキュリティカオスエンジニアリング]])、更新 concept 26 件。 - 図表 43 点(図 39・表 4)を全点埋め込み。埋め込み画像が 0 件(全図がベクター)のため、キャプション(GothicBBBPr6N-Medium 7.1pt)を本文サイズ(8.0pt 以上)から分離し、本文段落の下端からキャプション下端までをクロップして切り出した。 ### 2026-08-16 ingest-paper | What is Technology? Six Definitions and Two Pathologies(Paul Nightingale、SPRU Working Paper Series SWPS 2014-19) `wiki-ingest-paper` skill。ユーザー提供のローカル PDF(32ページ)。当初 `/wiki-ingest-book` で指定されたが、単著の学術論文(SSRN掲載)であり書籍ではないと判断し、ユーザー確認のうえ `wiki-ingest-paper` に切り替えて取り込んだ。本文に numbered figure は無く、Table 1 のみを Markdown 表に転記。埋め込み画像3点のうち2点(表紙・裏表紙のSPRUロゴ)は装飾のため除外し、1点(Direction Argument を図示した概念図)を本文近傍に埋め込んだ。 - Source(新規): [[@2014__SPRU__What is Technology Six Definitions and Two Pathologies]] — [[Paul Nightingale]](SPRU, University of Sussex)による、技術の哲学・歴史学・社会学・経済学を統合し技術の6つの定義と2つの病理を論じる理論論文(SPRU Working Paper Series, SWPS 2014-19, October 2014)。[[John Searle]]のSpeech Act理論(方向性の議論: 科学は既知の原因から未知の結果を予測し、技術は既知の結果から未知の原因を見出す)で科学と技術の違いを定式化し、[[Michael Polanyi]]の暗黙知論・動作原理論を土台に、技術理解の失敗を「ガジェット化」「世界の技術的自然化」という2つの病理として名指しする。 - Entities(新規): [[Paul Nightingale]](person、著者)、[[John Searle]](person、Speech Act理論・機能の観察者相対性論の出典) - Entities(更新): [[Michael Polanyi]]・[[Walter Vincenti]](いずれも本ソースへの参照と、Vincentiを介さずPolanyiに直接遡る独立した参照系列であることを追記) - Concepts: 新規 [[技術の定義]](技術の6定義を学問分野別視点の階層として統合する枠組み。本 wiki 初の philosophy-of-technology 領域の concept) / 更新 [[動作原理]]・[[暗黙知]](いずれもNightingale (2014)がPolanyiの原著に直接遡る独立した参照系列であることと、工学実務の水準(Vincenti)と技術/科学の認識論的差異の説明という水準(Nightingale)の相補性を横断的知見に追記) - Key insight: 本 wiki には Vincenti『What Engineers Know and How They Know It』第6・7章由来の [[動作原理]]・[[暗黙知]] concept が既に確立されていたが、いずれも Vincenti 経由での Polanyi 参照だった。Nightingale (2014) は同じ Polanyi の一次資料に Vincenti を介さず直接遡り、動作原理・暗黙知を技術と科学の認識論的な違いを説明する理論的基礎として用いる、独立した第2の参照系列を与えた。 (paper / source / philosophy-of-technology / history-of-technology) ### 2026-08-16 ingest-paper | Cutting Corners: Workbench Automation for Server Benchmarking(USENIX ATC 2008) `wiki-ingest-paper` skill。ユーザー提供のローカル PDF(14ページ)。埋め込みラスター画像14点はFigure 2周辺の断片(小片)で図表として使用不可のため、Figure 1〜10・全10点をPyMuPDFのキャプション座標クロップで統一取得。Table 1〜4はMarkdown表に転記。 - Source(新規): [[@2008__USENIX-ATC__Cutting Corners - Workbench Automation for Server Benchmarking]] — [[Piyush Shivam]](Sun Microsystems)・Varun Marupadi・[[Jeffrey S. Chase]]・Thileepan Subramaniam・[[Shivnath Babu]](Duke University)、USENIX ATC 2008、pp.241–253。共有ハードウェアプール上でサーバベンチマーキング実験を自動計画・実行するワークベンチコントローラのフレームワークを提案。NFSファイルサーバのピークレート評定を動機づけ例に、二分探索・モデル誘導探索・シーディングヒューリスティックによって固定パラメータの線形探索(strawman)より大幅にコストを削減することを実験的に示す。 - Entities(新規): [[Piyush Shivam]], [[Shivnath Babu]], [[Varun Marupadi]], [[Thileepan Subramaniam]](いずれもperson)、[[Fstress]](product、DukeのNFSワークロードジェネレータ) - Entities(更新): [[Jeffrey S. Chase]], [[Duke University]], [[Sun Microsystems]] - Concepts: 新規 [[ワークベンチ自動化]] / 更新 [[ベンチマーキング]] - Key insight: 2008年時点のフィードバック駆動ベンチマーキング自動化が、負荷率上昇に伴うレスポンスタイムのばらつき増大という実測に基づき、「意味のあるテストか」という定性的チェック項目をコスト最適化アルゴリズムとして先取りしていたことを [[ベンチマーキング]] の横断的知見に追記した。 (paper / source / benchmarking / systems) ### 2026-08-16 ingest-book | Cybernetics: or Control and Communication in the Animal and the Machine, 2nd ed.(The MIT Press 1961、第2版序文 + Introduction + 全10章) `wiki-ingest-book` skill。[[ノーバート・ウィーナー]]著、[[サイバネティクス]]という語そのものを世に出した 1948 年の著作の第 2 版(1961)。原本は Internet Archive のスキャン PDF(231 ページ、OCR テキスト層あり)で、PDF アウトラインが 0 件だったため目次ページの印字ノンブルと本文のランニングヘッダからオフセット(印字ページ = PDF ページ − 19)を復元し、`--chapters` で手動分割した。第2版序文・Introduction・Part I(初版1948、第1〜8章)・Part II(補章1961、第9〜10章)の全 12 枚を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。章ごとに Sonnet 5 subagent へ委譲し、ハブ concept [[サイバネティクス]](Introduction → 第8章 → 第7章)と [[フィードバックループ]](第4章 → 第5章)を奪い合う章は投入順で直列化したうえで、常時 3〜4 体のローリング fan-out で処理した。 - 代表 source: [[Cybernetics]](book entity)/ [[@1961__MITPress__Cybernetics - Introduction]] / [[@1961__MITPress__Cybernetics - Chapter 4 Feedback and Oscillation]] - Key insight: 本 wiki の [[サイバネティクス]] concept はこれまで後世からの参照([[Herbert A. Simon]]・[[稲見昌彦]]・SRE 実践)だけで積み上がっており、原典自身の記述が 1 件も入っていなかった。原典を入れて最も大きく変わったのは、**著者自身が適用限界に留保を置いている**という事実である。第7章は精神病理学的な実体を計算機の欠陥型に対応づける主張を冒頭で明示的に退け、第8章は社会科学が観測者と現象の結合を精密科学のようには小さくできないと述べる。後世が「万能の枠組み」として参照するときに落ちる部分にあたる。 - Key concepts: 新規 13 件(うち [[ホメオスタシス]]・[[自己組織化]]・[[エルゴード理論]]・[[ウィーナーフィルタ]] は本 wiki 初出)。更新 12 件。とくに第7章の「残存する神経系への過負荷と再経路化が二次的な障害を生む」「電話交換網は過負荷の縁で効率的に働き臨界点で破局的に停止する」という 1948 年の議論が、[[メタ安定障害]] と [[複雑システム障害論]](Cook 命題5・命題18)の先行例として接続できた。 - Key entities: 新規 8 件 [[Cybernetics]]・[[アルトゥーロ・ローゼンブルース]]・[[Willard Gibbs]]・[[Henri Lebesgue]]・[[John von Neumann]]・[[Oskar Morgenstern]]・[[Dennis Gabor]]・[[Amar Bose]]。更新 2 件 [[ノーバート・ウィーナー]]・[[Vannevar Bush]]。 - 備考: スキャン PDF のため `get_image_rects()` はページ全面を返し使えず、キャプション座標クロップで図 11 点(Fig. 1〜11)を全点切り出した(第4章6点・第5章1点・第6章1点・第10章3点)。全点を Read で目視確認したうえで本文近傍に埋め込み済み。 ### 2026-08-16 ingest | LISA made LISA obsolete (That's a compliment!)(Thomas A. Limoncelli、;login: online / USENIX 2022) `wiki-ingest` skill。USENIX が LISA(Large Installation System Administration)カンファレンスを 35 年の歴史を経て終了させたことを受け、元 Google SRE で LISA 2011 共同議長の [[Thomas A. Limoncelli]] が寄稿した追悼エッセイ。LISA が掲げた 5 つの急進的アイデア(システム管理の重要性・能動的な計算機管理・自動化・人間的プロセス・オープンシステム)が業界の常識になったことをもって LISA 自身が終了し、後継として SREcon へバトンが渡ったと総括する。画像なし(テキストのみのエッセイ)。 - 代表 source: [[@2022__USENIX__LISA made LISA obsolete (That's a compliment!)]] - Key entities: 新規 6 件 [[LISA]]・[[USENIX]]・[[SAGE]]・[[Evi Nemeth]]・[[Christine Hogan]]・[[The Practice of System and Network Administration]]。更新 1 件 [[Thomas A. Limoncelli]](LISA 2011 共同議長・TPOSANA 共著者としての経歴を追加)。 - Concepts(更新): [[DevOps]](LISA 併設 configuration management workshop 由来の IaC 系譜、LISA→SREcon の制度的世代交代を追記)・[[システム管理者からSREへの視点転換]](Legeza の個人レベル観点転換と Limoncelli の業界レベル世代交代を突き合わせ、単一ソースから 2 ソースへ昇格) - Key insight: Infrastructure as Code の起源には、DevOps 運動由来(Velocity 2009 Flickr 発表、mizzy 2026)とは独立した、LISA コミュニティの configuration management workshop(cfEngine・BCFG2・Puppet)由来のより古い系譜がある。DevOps という名乗り自体は 2008-2009 年に生まれたが、その中身となる実践は Google SRE と LISA システム管理者コミュニティという複数の先行集団で独立に育っていたことが分かる。 ### 2026-08-16 ingest-book | What Engineers Know and How They Know It(Johns Hopkins University Press 1990、全 8 章) `wiki-ingest-book` skill。[[Walter Vincenti]](Walter G. Vincenti、Stanford University 航空工学名誉教授)著、本文 259 ページ + 註 60 ページ。全 8 章を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。序文は source 化せず book entity の「成立事情」に織り込み、巻末註(60 ページ)は参照用に温存した。章ごとに Sonnet 5 subagent へ委譲し、ハブ concept [[工学設計知識]] を奪い合う章は投入順で直列化(1 → 7 → 8、および 6 → 7)したうえで、常時 3〜4 体のローリング fan-out で処理した。 原本は Internet Archive による 2022 年のスキャン(344 ページ、OCR テキスト層つき)。**PDF アウトラインが 0 件**だったため、全文テキストの目次ページと本文ランニングヘッダの印字ノンブルから章境界を復元した(印字ノンブル = PDF ページ − 12 が全巻で一致)。スキャン PDF のため `get_image_rects()` はページ全面の矩形しか返さず、キャプション座標クロップに切り替えて図表 38 点を切り出した。図の上端判定は、OCR 由来のノイズブロックに惑わされないよう「本文ブロック(幅 75% 以上・行あたり高さ 8pt 以上・最大フォント 11.5pt 以下)または直前のキャプション」を床とする規則を立てた。OCR がキャプション行ごと落としていた 5 点(図2-4/2-7/3-2/3-7/5-3、いずれも縦向きの全ページ図)は本文の図参照から所在を特定して回収した。埋め込み 38 / 欠落 0 / 未使用 attachment 0、章別内訳(0/8/9/7/6/6/2/0)を機械検証済み。原本は `.raw/books/what-engineers-know-and-how-they-know-it/`。 - Book entity(新規): [[What Engineers Know and How They Know It]](The Johns Hopkins University Press 1990、全 8 章 = 導入 1 + 事例研究 5 + 総合 2) - Sources(新規 8 件、すべて `publish: false`): [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 1 Introduction - Engineering As Knowledge]] 〜 [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 8 A Variation-Selection Model for the Growth of Engineering Knowledge]](一覧は [[sources/_index]] を参照) - Entities(新規 22 件 / 更新 5 件): 新規は [[Ascher Shapiro]] / [[Consolidated Aircraft Corporation]] / [[Curtiss-Wright Corporation]] / [[Daniel Bernoulli]] / [[David R. Davis]] / [[Donald T. Campbell]] / [[Douglas Aircraft Company]] / [[Eastman N. Jacobs]] / [[Edward Constant]] / [[Edward P. Warner]] / [[Edwin Layton]] / [[Everett Parker Lesley]] / [[G. F. C. Rogers]] / [[John Staudenmaier]] / [[Ludwig Prandtl]] / [[NACA]] / [[Reuben H. Fleet]] / [[Robert R. Gilruth]] / [[Theodore von Kármán]] / [[Vladimir Pavlecka]] / [[What Engineers Know and How They Know It]] / [[William Frederick Durand]]。更新は [[Herbert A. Simon]] / [[Michael Polanyi]] / [[SWEBOK Straw Man Version]] / [[Stanford University]] / [[Walter Vincenti]] - Concepts(新規 13 件): [[パラメータ変化法]] / [[制御体積解析]] / [[動作原理]] / [[変異選択モデル]] / [[工学科学]] / [[工学設計知識]] / [[暗黙知]] / [[生産のための知識]] / [[翼型設計]] / [[記述的知識と規範的知識]] / [[設計要件の確立]] / [[通常設計と急進的設計]] / [[飛行品質仕様]] - Key insight: 本書の結論は 2 枚の図に凝縮される。表 7-1 が工学設計知識の**構造**(6 カテゴリ × 7 生成活動)を、第 8 章の変異-選択モデルがその**成長**を与える。第 7 章までが「工学知識とは何であるか」の分類学であるのに対し、第 8 章は「それがどう増えるか」に踏み込み、実物を作らずに選択を代行する**代理選択子**(vicarious selectors)を成長の主機構に据える。事例研究 5 章はこの 2 つの枠組みを支える帰納の土台であり、それぞれ設計の異なる側面 — 形状の探索(第 2 章)/ 要件の確立(第 3 章)/ 理論的道具(第 4 章)/ 設計データ(第 5 章)/ 生産との接続(第 6 章)— を担当する。 - Key insight(既存 wiki との接続): 本 vault はこの著者を**二次的な引用元から先に知っていた**。[[SWEBOK Straw Man Version]](IEEE Computer Society 1998)がソフトウェア工学の知識領域を構造化する共通枠組みとして採用を提案した「6 カテゴリ」の出典が、まさに本書第 7 章である(SWEBOK は原著 p.200 と p.236 を引く)。今回その原典が入り、**転用が原典の何を保ち何を落としたか**を突き合わせられる状態になった(→ [[工学設計知識]] の `## 横断的知見`)。さらに同日に別セッションが ingest した [[@1998__PhilTech__On Structural Differences between Science and Engineering]](Poser 1998)は、Vincenti と互いを引用せず独立に「工学は応用科学にすぎない」というテーゼを退けている。Vincenti の道具立ては航空工学史から帰納した**知識の分類体系**、Poser のそれは**規則は真理値を持たず効力で正当化される**という認識論的論法であり、対照的な経路で同じ結論に至っている。 - 備考: OCR 由来の崩れは推測復元せず回避した。表 7-1 の X 印グリッドはスキャン崩れで機械的に転写できないため散文での再構成を行わず、埋め込み画像に語らせて本文は「縦に読む」説明のみを引いた。並行 fan-out で [[NACA]]・[[Edwin Layton]] の 2 件が「新規作成」の衝突により先行章の内容を失ったため、オーケストレータが失われた章の記述を復元したうえで、複数章を並べて見える観察(NACA の設計データ取得経路が外部委託 → 内製へ移る/ Vincenti が Layton を前提・反論相手・射程拡大の足がかりと 3 通りに使い分ける)を追記した。 ### 2026-08-16 ingest-book | Feedback Control of Computing Systems(IEEE Press / John Wiley & Sons 2004、全 3 部 11 章) `wiki-ingest-book` skill。[[Joseph L. Hellerstein]]・[[Yixin Diao]]・[[Sujay Parekh]]・[[Dawn M. Tilbury]] 著、451 ページ。本編全 11 章を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。序文と付録 A〜E は source 化せず、序文の内容(読み筋・前提知識・一貫して使う実例)は book entity に織り込んだ。章ごとに Sonnet 5 subagent へ委譲し、同一 concept を奪い合う章は投入順で直列化(1→8→9→10、5→6、7→10)したうえで常時 3〜4 体のローリング fan-out で処理した。 PDF アウトラインの level 1 が Part だったため章検出が 13 件(部+前付+付録)に化けており、level 2 から章境界を復元して再分割した。451 ページのため画像一括抽出はスキップし、キャプション記法(本文参照は `Figure N.M`、キャプションは `Fig. N.M`)で判別しつつ、ベクター描画の矩形とキャプション矩形を合成するクロップ規則を立てて図 235 点を 1 パスで機械的に切り出した(図番号 1.1〜11.18 に欠番・重複ゼロ)。ユーザー指示により埋め込みは厳選方針とし、82 点を採用(パラメータ違いの応答プロットの並びは代表 1〜2 点に集約)。埋め込み 82 / 欠落 0 / 未使用 attachment 0 を機械検証済み。表は Markdown 表として本文に再現。原本は `.raw/books/feedback-control-of-computing-systems/`。 - Book entity(新規): [[Feedback Control of Computing Systems]](IEEE Press / John Wiley & Sons 2004、全 3 部 11 章 + 付録 A〜E、451 ページ) - Sources(新規 11 件、すべて `publish: false`): [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 1 Introduction and Overview]] 〜 [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 11 Advanced Topics]](一覧は [[sources/_index]] を参照) - Entities(新規 8 件 / 更新 3 件): 著者 4 名のほか [[Apache HTTP Server]]・[[IBM Lotus Domino Server]]・[[MATLAB]]。更新は [[IBM T.J. Watson Research Center]]・[[University of Michigan]]・[[Wiley]] - Concepts(新規 10 件 / 更新 4 件): [[計算機システムのフィードバック制御]]・[[SASO特性]]・[[システム同定]]・[[Z変換と伝達関数]]・[[ブロック線図]]・[[過渡応答解析]]・[[支配極と高次系の近似]]・[[極配置設計]]・[[PID制御]]・[[適応制御]]。更新は [[フィードバックループ]]・[[制御ループの安定性とタイムラグ補償]]・[[待ち行列理論]]・[[状態空間モデル]] - Key insight: 本書の論証には一本の背骨があり、**制御性能の各側面は別の側面を犠牲にしてしか手に入らない**という構図が章をまたいで繰り返される。第 8 章は比例制御が目標値・外乱のいずれかが非零なら定常偏差を構造的に消せないことを示し、第 9 章は積分項がそれを厳密ゼロにする代わりに開ループ極 $z=1$ の追加で応答が必ず遅くなることを示し、微分項は定常ゲインが 0 で確率的変動に敏感なため計算機システムでは PI が推される。第 10 章は状態空間で MIMO へ広げるが内部状態の可観測性を要求し、第 11 章は線形・決定的・時不変という前提自体を緩める。単一の設計パラメータで SASO 特性の全てを同時に満たせないという第 8 章の結論が、以降の章立てそのものを駆動している。 - Key insight(既存 wiki との接続): [[制御ループの安定性とタイムラグ補償]] に積まれていた既存ソース(Apollo LM 誘導計算機、Burgess の理論的システム管理)は制御ループの安定性を**経験的な判断**として語るのに対し、本書は「極が単位円の内側にあるか」という形式的判定と、整定時間 $k_s \approx -4/\log|a|$ という定量式を与える。また [[状態空間モデル]] は既存が深層学習の SSM(Mamba/RWKV 等)論として育っていたところへ、その語源にあたる制御理論の状態空間モデルが後から合流する形になった(上書きせず節を分けて併存させた)。 - 備考: 原本の印刷ミス・抽出崩れを 4 件検出し、いずれも推測復元せず回避した — 第 2 章 §2.4.4 の係数 `a = −0.045` が表2.1 由来の `a = −0.087` と食い違う(表2.1 側のみ引用)、第 3 章 式(3.16) の長除算途中式の桁ずれ(結果値のみ引用)、第 6 章 §6.5.4 の伝達関数式で `z` の項が欠落(極の数値のみ引用)、第 6 章 §6.2 の節見出しテキストが抽出で消失(節番号の粒度で出典表記)。 ### 2026-08-15 ingest-book | SREの探求(オライリー・ジャパン 2021、全 4 部 33 章 + 前付) `wiki-ingest-book` skill。原書 *Seeking SRE: Conversations About Running Production Systems at Scale*(O'Reilly Media 2018、David N. Blank-Edelman 編)の日本語版。前付「はじめに」と全 33 章の計 34 件を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。章ごとに Sonnet 5 subagent へ委譲し、同一 concept を奪い合う章は投入順で直列化したうえで常時 3〜4 体のローリング fan-out で処理した。632 ページのため画像一括抽出はスキップし、キャプションのフォント判別(`GothicBBBPr6N-Medium` 7.1pt、本文明朝を含まない)+ `get_image_rects()` の直接クロップで図 72 点を 1 パスで機械的に切り出した(ベクター図 9 点のみキャプション座標クロップにフォールバック)。本文の図参照 grep との差分ゼロ、埋め込み 72 / 欠落 0 / 未使用 attachment 0 を機械検証済み。表 7 点は Markdown 表として本文に再現。原本は `.raw/books/seeking-sre-ja/`。 - Book entity(新規): [[SREの探求]](David N. Blank-Edelman 編・山口能迪 監訳・渡邉了介 訳、オライリー・ジャパン 2021-09-01、632 ページ、ISBN 978-4-87311-961-8) - Sources(新規 34 件、すべて `publish: false`): [[@2021__OReillyJapan__SREの探求 - Preface はじめに]] 〜 [[@2021__OReillyJapan__SREの探求 - Chapter 33 まとめ]](一覧は [[sources/_index]] を参照) - Entities(新規 73 件 / 更新 44 件): 章著者 24 名ほか。代表 — [[Coburn Watson]]・[[Casey Rosenthal]]・[[Theo Schlossnagle]]・[[Niall Murphy]]・[[John Allspaw]]・[[Richard I. Cook]]・[[Matt Klein]]・[[Gene Kim]]・[[The DevOps Handbook]] - Concepts(新規 23 件 / 更新 90 件): [[コンテキスト対コントロール]]・[[分隊型運用]]・[[プロダクションエンジニアリング]]・[[サービスとしての運用(OaaS)]]・[[SREアンチパターン]]・[[DevOpsとSREの関係]]・[[オンコール]]・[[表現線]]・[[データ耐久性]]・[[メンタルヘルスとインクルーシビティ]]ほか(一覧は [[concepts/_index]] を参照) - Key insight: 本書の価値は規範の提示ではなく、**同じ問いに条件の異なる組織が別々の答えへ到達した経路が一次資料として並ぶ**点にある。専任 SRE チームを持たない組織だけでも SoundCloud(専任→派遣の 2 段階失敗を経て分散適用)・Spotify(常駐→集中→分散の漸進的自己認識)・Facebook(独立組織+Embedded の PE 職種)と経路が異なり、レガシー大企業 Agilent の計画的トップダウン導入が対照をなす。7 章のセルフサービス失敗と 10 章の OaaS の対比から、成否を分ける変数は「権限を外した後の代替設計の有無」だと特定できた。また本書は SRE の前提自体を疑う章を含む — 30 章は [[SRE Book]] 第 11 章(オンコール前提の最適化)の共同編者 [[Niall Murphy]] が 5 年後に慣行そのものを問い直したものであり、12 章は DevOps と SRE の関係が未解決であること自体を 7 つの説明軸として提示する。11 章と 12 章を突き合わせると、用語としての先後(DevOps が先)と実践としての先後(SRE が先)が逆方向であることも見える。 ### 2026-08-14 ingest-book | Incident Metrics in SRE(O'Reilly 2021、単章レポート・再取り込み) `wiki-ingest-book` skill。2026-06-28 に `wiki-ingest-paper` として取り込んだ既存エントリの再取り込み。PDF は既存 `.raw/papers/IncidentMeticsInSre.pdf` と md5 一致(既存原本は不変原則により温存)。全 1 章のため入力形態は「書籍の断片」として扱い、章分割はせず source 1 枚 + book entity という構成にした。被リンク 8 件を保つためファイル名と `address: c-001010` は据え置き、本文と frontmatter を書籍規約へ全面改稿した。 - Book entity(新規): [[wiki/entities/Incident Metrics in SRE|Incident Metrics in SRE]](Štěpán Davidovič、O'Reilly Media、2021-03-19、36 ページ / 本文 29 ページ、ISBN 978-1-098-10313-2) - Source(更新・全面改稿、`publish: false`): [[@2021__OReilly__Incident Metrics in SRE]] - Source(更新): [[@2025__SRE Kaigi 2025__インシデントキーメトリクスによるインシデント対応の改善]](contradiction callout 追記) - Entities(更新): [[Štěpán Davidovič]] - Concepts(更新 3 件): [[インシデントメトリクス]]・[[TTXメトリクス]]・[[統計的有意性]] - Key insight: 本レポートの核は「MTTR は駄目だ」ではなく「**低頻度・高分散の集計統計はどれも駄目であり、指標は採用前に検定にかけよ**」というメタ層の処方である。中央値・95 パーセンタイル・幾何平均・合計をそれぞれシミュレーションで潰した節があるため、本 vault が蓄積してきた MTTR 批判は「算術平均への批判」ではなく「低頻度・高分散データにおける集計統計一般への批判」として成立する。この処方は [[統計的有意性]] concept が扱う P 値閾値論争(α を 0.05 から 0.005 へ締める)と正反対の方向(α = .10 へ緩める)から出発しながら、「閾値の調整では届かない領域がある」という同じ地点に到達する。 - 図: 全 10 点(Figure 1〜10)を埋め込み画像の矩形から直接切り出し、全点を本文該当箇所に埋め込んだ(旧版は 5 点)。装飾用の NOTE アイコンと表紙・ロゴは除外。 - 訂正: 既存 [[TTXメトリクス]] の「49%・50%・64% = MTTR が 10% 以上改善される比率」(SRE Kaigi 2025 発表由来)は、一次ソースでは「15 分以上の改善(絶対変化)が観測される確率」である。両ページに contradiction callout を置いた。同ページの「Google の大規模内部データ(数万件規模)」も一次ソースに根拠がないため、著者自身の記述(「先の検定で用いた 1,000 件より多い」)に訂正した。 (book / source / sre / incident-management / metrics) ### 2026-08-14 ingest-book | A Philosophy of Software Design(Yaknyam Press 2018、全 21 章) - Book entity: [[wiki/entities/A Philosophy of Software Design|A Philosophy of Software Design]](John Ousterhout、Yaknyam Press、First Edition v1.01、188 ページ、ISBN 978-1-7321022-0-0) - Sources(全 21 章、すべて `publish: false`): [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 1 Introduction]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 2 The Nature of Complexity]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 3 Working Code Isn't Enough]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 4 Modules Should Be Deep]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 5 Information Hiding (and Leakage)]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 6 General-Purpose Modules are Deeper]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 7 Different Layer, Different Abstraction]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 8 Pull Complexity Downwards]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 9 Better Together Or Better Apart?]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 10 Define Errors Out Of Existence]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 11 Design it Twice]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 12 Why Write Comments? The Four Excuses]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 13 Comments Should Describe Things that Aren't Obvious from the Code]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 14 Choosing Names]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 15 Write The Comments First]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 16 Modifying Existing Code]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 17 Consistency]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 18 Code Should be Obvious]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 19 Software Trends]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 20 Designing for Performance]] / [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 21 Conclusion]] - Entities: [[wiki/entities/A Philosophy of Software Design|A Philosophy of Software Design]]・[[RAMCloud]](新規 2 件)。[[John Ousterhout]](更新) - Concepts(新規 10 件): [[ソフトウェア複雑性]]・[[戦略的プログラミング]]・[[深いモジュール]]・[[情報隠蔽]]・[[抽象化(ソフトウェア設計)]]・[[コメント設計]]・[[命名]]・[[設計の一貫性]]・[[例外処理の設計]]・[[性能を意識した設計]] - Concepts(更新 4 件): [[本質的複雑性と偶発的複雑性]]・[[技術的負債]]・[[ソフトウェア保守]]・[[パフォーマンスエンジニアリング]] - Key insight: 設計原則を「複雑性が減るかどうか」という単一の評価軸に従属させ、原則そのものの遵守を目的にしない構成が本書固有の価値である。この姿勢のため本書はしばしば通説に逆らう(メソッドを短くすること自体を目的にしない・テスト駆動開発への批判・ゲッター/セッターの否定・設定パラメータの多用への批判)。もう一つの型は**抽象の設計自由度そのものを問題解決の手段として使う**ことで、第 10 章「エラーを存在しないものとして定義する」は実装を工夫せずインターフェースの意味論を再定義してエラーだった状況を正常な振る舞いに含め、第 6 章の汎用化も特定用途向けメソッド群を汎用メソッドに置き換えて情報漏出ごと消す。両者は「実装で頑張らず抽象の切り方を変える」という共通の型を持つ。 - 図: 全 14 点を埋め込み画像の矩形から直接クロップし、全点を本文該当箇所に埋め込んだ(省略なし)。 ### 2026-08-14 ingest-book | The Elements of Statistical Learning(Springer 2009 第 2 版、全 18 章) - Book entity: [[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]](Trevor Hastie・Robert Tibshirani・Jerome Friedman、Springer Series in Statistics、764 ページ) - Sources(全 18 章、すべて `publish: false`): [[@2009__Springer__The Elements of Statistical Learning - Chapter 1 Introduction]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 2 Overview of Supervised Learning]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 4 Linear Methods for Classification]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 7 Model Assessment and Selection]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 8 Model Inference and Averaging]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 9 Additive Models, Trees, and Related Methods]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 10 Boosting and Additive Trees]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 11 Neural Networks]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 12 Support Vector Machines and Flexible Discriminants]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 14 Unsupervised Learning]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 15 Random Forests]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 16 Ensemble Learning]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 17 Undirected Graphical Models]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]] - Entities: [[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]]・[[Trevor Hastie]]・[[Robert Tibshirani]]・[[Jerome Friedman]]・[[Prostate Cancer Data]](新規 5 件)。[[Thomas M. Cover]](更新) - Concepts(新規 25 件): [[バイアス-バリアンストレードオフ]]・[[次元の呪い]]・[[縮小推定]]・[[部分集合選択]]・[[最小角回帰]]・[[基底展開]]・[[平滑化スプライン]]・[[交差検証]]・[[ブートストラップ法]]・[[EMアルゴリズム]]・[[決定木]]・[[GAM]]・[[MARS]]・[[勾配ブースティング]]・[[誤差逆伝播法]]・[[サポートベクターマシン]]・[[線形判別分析]]・[[局所回帰]]・[[最近傍法]]・[[主成分分析]]・[[クラスタリング]]・[[スペクトラルクラスタリング]]・[[独立成分分析]]・[[無向グラフィカルモデル]]・[[多重検定]] - Concepts(更新 11 件): [[統計的機械学習]]・[[カーネル法]]・[[アンサンブル学習]]・[[カーネル密度推定]]・[[ベイズ推定]]・[[汎化誤差バウンド]]・[[最小記述長原理]]・[[畳み込みニューラルネットワーク]]・[[暗黙的正則化]]・[[変分ベイズニューラルネットワーク]]・[[PageRank]] - Key insight: 個々の手法の列挙ではなく、**同じ論点を章をまたいで再解釈する**ことが本書の骨格である。正則化は「係数への罰則(第 3 章)→ 関数の滑らかさへの罰則(第 5 章)→ 損失関数の取り替え(第 12 章 SVM = ヒンジ損失 + L2 罰則)→ グラフ構造への罰則(第 17 章 graphical lasso)→ 高次元での強度スケーリング(第 18 章)」と一般化され、アンサンブルは「木の不安定性(第 9 章)→ 損失関数最小化(第 10 章)→ 木どうしの相関への帰着(第 15 章)→ 辞書生成 + 事後の重み付け(第 16 章)」と再解釈される。また第 2 章の「次元の呪い」と第 18 章の「$p \gg N$ は強い正則化で扱える」は矛盾せず、**有効自由度が呪いの本体である**という統一像に整理できる。 - 図: 全 291 点をキャプション座標クロップで切り出し、うち 280 点を本文該当箇所に埋め込んだ(省略 11 点はいずれも同一構図の反復か演習問題内の図)。 ### 2026-08-13 ingest-paper | Redefine Statistical Significance(Nature Human Behaviour 2017) `wiki-ingest-paper` skill。ORA(Oxford University Research Archive)登録のaccepted manuscript PDF(11ページ)。本vaultとしては初めての統計学・研究方法論ドメインの取り込み。実証研究ではなく既存理論(ベイズ因子とP値の関係、偽陽性率の閉形式近似式)と既存再現実験プロジェクトのデータ再計算に基づく提言論文であるため、実験設定・実験結果節は理論的導出と引用データの整理として記述した。 - Source(新規): [[@2017__NatHumBehav__Redefine Statistical Significance]] — [[Daniel J. Benjamin]]*・James O. Berger・[[Magnus Johannesson]]*・Brian Nosek・E.J. Wagenmakers ほか68名(共著者合計73名)、Nature Human Behaviour Vol.2, pp.6–10(2017-09-01オンライン先行公開、DOI: 10.1038/s41562-017-0189-z)。統計的有意性のデフォルトP値閾値をP<0.05からP<0.005へ変更することを提案。両側P値0.05はベイズ因子2.5〜3.4(弱い証拠)、P値0.005はベイズ因子14〜26(実質的〜強い証拠)に相当することを示し(Figure 1)、事前オッズ1:10・閾値0.05では検出力によらず偽陽性率が33%を超えるが閾値0.005では5%まで下がることを示す(Figure 2)。 - Entities(新規): [[Daniel J. Benjamin]], [[Magnus Johannesson]], [[Valen E. Johnson]](共同通信著者3名のみ。73名全著者のentity化は対象外) - Concepts: 新規 [[統計的有意性]] - Key insight: 単一ソース初出のためconceptの横断的知見はまだ薄いが、73名という研究者数の多さそのものが「批判的多数派(critical mass)」形成という論文の中心的主張の一部であり、通常のwiki-ingest-paperのentity化方針(著者全員をentity化)では規模が合わないため、共同通信著者3名のみへ絞る scope decision を行った。 (paper / source / statistics / research-methodology) ### 2026-08-13 ingest-paper | NVMM-Oriented Hierarchical Persistent Client Caching for Lustre(ACM ToS 2021) `wiki-ingest-paper` skill。ユーザー提供のローカル PDF(22ページ)。埋め込みラスター画像はグラフの棒本体のみで軸・凡例テキストを欠く不完全な断片4点だったため採用せず、Figure 1〜9 の全9点を PyMuPDF のキャプション座標クロップで統一取得した(アーキテクチャ図3点+実験グラフ6点)。 - Source(新規): [[@2021__TOS__NVMM-Oriented Hierarchical Persistent Client Caching for Lustre]] — [[Wen Cheng]]・[[Chunyan Li]]・[[Lingfang Zeng]]([[Huazhong University of Science and Technology]])、[[Yingjin Qian]]・[[Xi Li]]([[DDN]])、[[André Brinkmann]]([[Johannes Gutenberg University Mainz]])、ACM Transactions on Storage Vol.17 No.1 Article 6(2021年1月、DOI: 10.1145/3404190)。[[Lustre]]クライアントのNVMMを階層型永続キャッシュとして統合するNVMM-LPCCを提案し、RW(読み書き)/RO(読み取り専用)の2モードをHSM機構とレイアウトロックで実現。ネイティブLustre比で読み取りスループット最大35.80倍・書き込みスループット最大9.83倍、フラッシュSSD比で読み取り最大10.39倍・書き込み最大4.40倍を達成。 - Entities(新規): [[Wen Cheng]], [[Chunyan Li]], [[Lingfang Zeng]], [[Yingjin Qian]], [[Xi Li]] - Entities(更新): [[André Brinkmann]], [[Johannes Gutenberg University Mainz]], [[Huazhong University of Science and Technology]], [[DDN]], [[Lustre]] - Concepts: 新規 [[永続クライアントキャッシュ]] / 更新 [[並列ファイルシステム]]・[[ローカルファイルシステム実装比較]] - Key insight: [[並列ファイルシステム]]の既存記述は「クライアントメタデータライトバックキャッシュ」を将来の方向性として扱っていたが、本論文(2021年発表)はデータ面でのクライアント側永続キャッシュを既にHSM機構とレイアウトロックの上に実装・本番評価まで到達させていた。またNOVA/PMFS/EXT4-DAXというNVMM向けローカルファイルシステムは、ブロックデバイス向けのジャーナリング/COWとは異なる手段(DAXバイパス・ログ構造・mmap一貫性)で「クラッシュ整合性の確保」という同じ目的を達成しており、[[ローカルファイルシステム実装比較]]に新たな設計軸を追加した。 (paper / source / hpc / storage) ### 2026-08-13 ingest-paper | Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems(ACM TOCS 2026) `wiki-ingest-paper` skill。ユーザー提供のローカル PDF(33ページ)。USENIX ATC 2025 論文の招待拡張版で、拡張分は例外注入・データ破損チェッカ・エージェントによる障害検証・実装詳細・評価拡張。 - Source(新規): [[@2026__TOCS__Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems]] — [[Gen Dong]]・[[Yu Hua]](責任著者)・[[Yongle Zhang]]・[[Zhangyu Chen]]・[[Menglei Chen]]([[Huazhong University of Science and Technology]]・[[Purdue University]])、ACM Trans. Comput. Syst. 2026(DOI: 10.1145/3838187)。実世界のフェイルスローハードウェア(FSH)障害 48 件のバグスタディと、同期・タイムアウト保護された I/O 操作だけを候補障害点に絞る障害注入テストフレームワーク [[Sieve]] を提案。ZooKeeper・Kafka・HDFS で未知バグ 6 件(うち 2 件が開発者確認済み)を検出。 - Entities(新規): [[Gen Dong]], [[Yu Hua]], [[Yongle Zhang]], [[Zhangyu Chen]], [[Menglei Chen]], [[Sieve]], [[HDFS]], [[Apache HBase]] - Entities(更新): [[ZooKeeper]], [[Apache Kafka]], [[Apache Cassandra]], [[Huazhong University of Science and Technology]], [[Purdue University]] - Concepts: 新規 [[フェイルスローハードウェア]] / 更新 [[障害注入]]・[[遅延注入]]・[[グレイ障害]]・[[部分故障]] - Key insight: 実障害 48 件の全件が同期機構とタイムアウト機構の脆弱性に起因し、かつ障害の**細粒度性**が発現の必要条件である(フェイルストップ NIC を注入すると heartbeat も止まりリーダー選出で回復してしまい、バグが再現しない)。既存のカオスエンジニアリング基盤が提供する粗粒度障害では FSH バグを構造的に検出できないことを意味する。 - 備考: 図表は pdf.js の埋め込みラスター画像抽出で20点得られたが本文図表とは対応せず、Figure 1〜9 の全9点を PyMuPDF のキャプション座標クロップで取得。Table 1〜13 を Markdown 表へ転記(Table 12・13 は 1 表に統合)。付録の Table 14 は本文参照が 1 回のみ・付録限定のため除外。全33ページ本文+参考文献78件を通読。 (paper / source / distributed / fault-tolerance) ### 2026-08-13 ingest-paper | The Tail at Scale(CACM 2013) `wiki-ingest-paper` skill。ユーザー提示 URL(research.google の紹介ページ)から PDF が直接取得できなかったため、著者 [[Luiz André Barroso]] 本人の公開ページ(barroso.org)から原本 PDF を取得。埋め込みラスター画像は装飾イラスト1点のみで、本文が参照するテールレイテンシ確率のグラフはベクター図だったため PyMuPDF のキャプション座標クロップで取得した。 - Source(新規): [[@2013__CACM__The Tail at Scale]] — [[Jeffrey Dean]]・[[Luiz André Barroso]]([[Google]])、CACM Vol.56 No.2(2013年2月)。大規模分散システムのレイテンシばらつきの原因分類と、ヘッジリクエスト・タイドリクエスト・カナリアリクエスト・マイクロパーティション等の tail-tolerant 緩和技術を、Bigtable・クラスタファイルシステム・検索システムでの実測(99.9パーセンタイルレイテンシ1,800ms→74ms 等)とともに報告。 - Entities(更新): [[Jeffrey Dean]]・[[Luiz André Barroso]]・[[Google]]・[[Bigtable]] - Concepts: 新規 [[テールレイテンシ耐性技術]] / 更新 [[レイテンシ分析]]・[[フォールトトレランス]] - Key insight: DDIA 2E がこれまで間接引用していた「テールレイテンシ増幅」の定量的根拠が、原典を直接読むことでファンアウト数×外れ値頻度の解析的なモデル(Figure)と実測表(Table 1・2)として具体化された。 (paper / source / distributed / latency) ### 2026-08-11 ingest-book | AI Systems Performance Engineering(O'Reilly 2025、全20章+Appendix) `wiki-ingest-book` skill(入力形態: 章別ウェブページ、ユーザー提供のdefuddle抽出済みmarkdown 21件)。書籍ハブ entity [[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]] を新設し、全20章+Appendixを5ウェーブ(各4章)に分けて並列subagentでsource化した。原本はlearning.oreilly.com上の画像URLを含むが、著作権保護のため画像の埋め込み・ダウンロードは行わずテキストのみで処理した。 - Sources(新規、いずれも source_type: book・publish: false): [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]]〜[[@2025__OReilly__AI Systems Performance Engineering - Chapter 20 AI-Assisted Performance Optimizations and Scaling Toward Multimillion GPU Clusters]]・[[@2025__OReilly__AI Systems Performance Engineering - Appendix AI Systems Performance Checklist]](21件) - Entities: 新規 [[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]]・[[NVIDIA GB200 NVL72]]・[[NVIDIA DALI]]・[[Tensor Memory Accelerator]]・[[CUTLASS]]・[[NVSHMEM]]・[[OpenAI Triton]]・[[NVIDIA Nsight Systems]]・[[Rubin CPX]]・[[AlphaTensor]]・[[Predibase]] / 更新 [[NVIDIA]]・[[PyTorch]]・[[Kubernetes]]・[[NCCL]]・[[NIXL]]・[[DeepSeek-V3]]・[[3FS]]・[[GPUDirect Storage]]・[[NVIDIA Dynamo]]・[[AI Futures Project]] - Concepts: 新規 [[Mechanical Sympathy]]・[[Goodput]]・[[NVLink]]・[[NUMA対応CPUピニング]]・[[GPU多重化(MPS・MIG)]]・[[GPU占有率(Occupancy)]]・[[メモリコアレッシング]]・[[共有メモリバンクコンフリクト]]・[[Warp Divergence]]・[[Instruction-Level Parallelism (GPU)]]・[[Occupancy (GPU)]]・[[Warp Specialization]]・[[Thread Block Cluster]]・[[Persistent Kernel]]・[[CUDA Stream]]・[[Programmatic Dependent Launch]]・[[Dynamic Parallelism]]・[[torch.compile]]・[[動的バッチングと継続的バッチング]]・[[動的精度切り替え]]・[[カーネルオートチューニング]] / 更新 [[Rooflineモデル]]・[[GPU起動型ネットワーキング]]・[[RDMA]]・[[GPUストレージIOデータパス]]・[[CUDA]]・[[CUDAGraph]]・[[カーネルフュージョン]]・[[混合精度訓練]]・[[量子化]]・[[並列化戦略]]・[[Mixture-of-Experts]]・[[Prefill-Decode分離]]・[[Speculative Decoding]]・[[KVキャッシュ管理]]・[[メモリ階層とキャッシュ]]・[[LLM駆動GPUカーネル生成]] - Key insight: ハードウェア基盤(第1〜2章)→OS/ストレージ/ネットワーキング(第3〜5章)→CUDAカーネル最適化(第6〜12章)→PyTorchとコンパイラ(第13〜14章)→分散推論サービング(第15〜20章)→175項目超チェックリスト(Appendix)という一貫した抽象度の階段構成を持つ。DeepSeekのH800輸出規制下最適化事例を導入の起点に据え、Blackwell世代ハードウェアの物理層からvLLM/SGLang/NIXL/llm-dといった最新推論サービングスタックまでを実測値付きで一気通貫に扱う点が特徴。 (book / source / gpu / performance) ### 2026-08-11 ingest-book | 実践的パフォーマンスエンジニアリングによるAI高速化(技術評論社 2026、全8章) `wiki-ingest-book` skill(入力形態: 書籍全体PDF、401ページ・8章)。書籍ハブ entity [[wiki/entities/実践的パフォーマンスエンジニアリングによるAI高速化|実践的パフォーマンスエンジニアリングによるAI高速化]] を新設し、全8章を並列 subagent で source 化した。401ページ超のため一括画像抽出はスキップし、章ごとにPyMuPDFキャプション座標クロップで代表図7枚を取得。 - Sources(新規、いずれも source_type: book・publish: false): [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 1 パフォーマンスエンジニアリング概論]]〜[[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 8 実践5:自動運転AI推論]](8件) - Entities: 新規 [[wiki/entities/実践的パフォーマンスエンジニアリングによるAI高速化|実践的パフォーマンスエンジニアリングによるAI高速化]]・[[Llama3]]・[[BEVFusion]] / 更新 [[Fixstars]]・[[Megatron-LM]]・[[Brendan Gregg]] - Concepts: 新規 [[量子化]]・[[枝刈り]](いずれも第3章で新設、第8章の実測知見で横断的知見を拡充)・[[パフォーマンスエンジニアリング]]・[[アムダールの法則]] / 更新 [[Rooflineモデル]]・[[FlashAttention]]・[[Speculative Decoding]]・[[並列化戦略]]・[[GPU観測性]] - Key insight: 前半(第1〜3章)が計測・改善手法の一般理論を俯瞰し、後半(第4〜8章)がLLM(推論・事後学習・事前学習)と自動運転AI(学習・推論)という異なる計算特性を持つ5実践事例に同じ方法論を適用する構成。第3章由来の[[量子化]]・[[枝刈り]]は第8章の実測で「演算律速では量子化が有効、メモリ律速では枝刈りの効果が限定的」という条件依存性が具体化され、書籍内で理論と実例が往復する設計になっている。 (book / source / machine-learning / gpu) ### 2026-08-11 ingest-book | SRE Book - Chapter 2, 8, 9(O'Reilly 2016) `wiki-ingest-book` skill の初適用(入力形態: 章別ウェブページ)。書籍ハブ entity [[SRE Book]](entity_type は既存の product を温存)に章リンクを追加し、Part 章範囲を公式目次準拠に補正した。 - Sources(新規、いずれも source_type: book・publish: false): [[@2016__OReilly__SRE Book - Chapter 2 The Production Environment at Google, from the Viewpoint of an SRE]]、[[@2016__OReilly__SRE Book - Chapter 8 Release Engineering]]、[[@2016__OReilly__SRE Book - Chapter 9 Simplicity]] - Entities: 新規 [[Colossus]]・[[JC van Winkel]]・[[Dinah McNutt]]・[[Max Luebbe]]・[[Rapid]]・[[Blaze]] / 更新 [[SRE Book]]・[[Borg]]・[[Chubby]]・[[Bigtable]]・[[Stubby]] - Concepts: 新規 [[ヘルメティックビルド]]・[[本質的複雑性と偶発的複雑性]] / 更新 [[分散コンセンサス]] (book / source / sre) ### 2026-08-06 query + ingest-paper | NIC 光トランシーバーのモニタリング(question 1 件 + 論文 3 本) - [[wiki/surveys/NIC光トランシーバーのモニタリング]](question 新規) — 「NIC の光トランシーバーのモニタリングについて関連文献を調査して」への回答。規格レイヤ(SFF-8472 の DDM/DOM・SFF-8636・CMIS 5.3 の VDM が公開する pre-FEC BER と eSNR)、Linux/NIC 実装レイヤ(`ethtool -m`・`ethtool -I --show-fec`・mlx5 の `rx_err_lane_[l]_phy`/`link_down_events_phy`・`mlxlink` の Raw/Effective Physical BER と FEC ヒストグラム・SONiC の `xcvrd` と `cmis.py`)、KP4 FEC の訂正限界 2.4e-4 ゆえに閾値監視では silent degradation を捕まえられない構造、大規模 AI クラスタ 11 本の実測数値表、横断的知見 5 点、学術文献の系譜(CorrOpt/007/FANcY/Gray Failure と、光通信側の soft-failure 検知サーベイ群)、未解決の問い 4 点を収録。(question / networking / aiops / survey) - [[@2026__arXiv__Resilient AI Supercomputer Networking using MRC and SRv6]](source 新規) — [[OpenAI]]・[[Microsoft]]・AMD・Broadcom・NVIDIA の 5 社連名(Mark Handley・Torsten Hoefler・Jitendra Padhye ほか)、arXiv:2605.04333(2026-05-05)。50K/75K GPU の本番事前訓練で [[MRC]] と [[SRv6]] による耐性を評価。T0-T1 間のリンクフラップは常時毎分数件あるが ride out できるため修理を低優先度に落とせる一方、T0 スイッチの光トランシーバ 1 個のグリッチが 4 リンクを連続フラップさせスループットを 1 分間約 25% 低下させた事例を実測グラフつきで報告。**NIC 側 800Gb/s 光モジュールのフラップは NIC の全ポートを同時に失い QP が落ちるため ride out できない**残存単一障害点であると明記する。(paper / source / networking / distributed) - [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]](source 新規) — [[Yazhou Zu]] ほか([[Google]])、USENIX NSDI 2024。4096 ノードの 3D トーラスを 64 キューブに分け、**6,144 本の光 ICI リンク**を **48 台の[[光回線交換]]機(OCS)**へ接続する。日次故障率は TPU マシン 0.08%・**ICI ケーブル 0.005%**・OCS 0.04%。OCS による動的再構成でホスト可用性要件を 99.9% から 99% へ緩和し、システム可用性 99.98% を達成する。OCS と光ファイバのコストは pod 総資本コストの 5% 未満・総電力の 3% 未満。(paper / source / networking / distributed) - [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]](source 新規) — [[Omkar Salpekar]]・[[Rohan Varma]]・[[Chunqiang Tang]]・[[Maxim Naumov]] ほか([[Meta]])、arXiv:2602.00277(2026-01-30)。Llama 3 の後継にあたる 32K GPU の障害実態報告。Table 1 全 16 行を転記し、`Network Switch/Cable` 36 件・5.3%、有効訓練時間 95〜97%、2.3 件/1000 サーバ/日。本文に `optical`/`transceiver`/`BER`/`FEC` のいずれの語も現れず、**光関連の障害を独立カテゴリとして計上していない**ことを限界として明記した。(paper / source / distributed / aiops) - Sources (更新): [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]](原典 §2.3 から「数千個の光モジュールおよびリンク」「リンクフラップ 5K〜60K 件/日」「単一ジョブが月 1〜2 回クラッシュ」を補完) - Entities (新規): [[Yazhou Zu]]、[[TPUv4]]、[[Palomar Optical Circuit Switch]]、[[Omkar Salpekar]]、[[Rohan Varma]]、[[Chunqiang Tang]]、[[Maxim Naumov]]、[[FT-HSDP]]、[[PyTorch]] - Entities (更新): [[Google]]、[[Borg]]、[[Microsoft]]、[[OpenAI]]、[[Meta]] - Concepts (新規): [[光回線交換]] - Concepts (更新): [[RDMAネットワーク監視]]、[[MRC]]、[[SRv6]]、[[AIデータセンタートポロジ]]、[[データセンターネットワーク信頼性]]、[[マルチプレーンClosトポロジ]]、[[耐障害LLM訓練]] - Key insight: 「光関連の障害が何%か」は、その組織が物理層をどこまで観測できているかの関数である。Meta の 2 世代の報告(Llama 3 の 8.4% → 本論文の 5.3%)は光を `Network Switch/Cable` に丸め込み、Alibaba Aegis(6.7%)・Tencent Astral(光ファイバ 7%)・ByteDance Minder(AOC 0.9%)は独立計上する。そして独立計上した文献はいずれも観測不足を自認しており(Minder は光ケーブル用カウンタの不在を明記)、公開値はすべて下限値として扱うのが安全である。さらに MRC の実測は、**同じ光トランシーバ障害でもスイッチ側なら耐性で吸収でき NIC 側なら吸収できない**という非対称性を示し、予防型予測(OptProphet)の投資を NIC 側へ優先配分すべきだという示唆をトランスポート層という独立ソースから与える。光障害への対処が「検知して直す」(CorrOpt・OptProphet)と「トポロジで迂回する」(OCS・MRC)に分岐する構図も、TPUv4 と合わせて初めて見えた。 - Open questions: 耐性機構(MRC・dual-ToR・OCS)が物理劣化を隠すとき、劣化しつつあるリンクを CMIS VDM の pre-FEC BER・eSNR からどう拾い上げるか。光通信コミュニティの soft-failure 検知(pre-FEC BER と OSNR の窓統計)を、ショートリーチのデータセンター光モジュールへ適用できるか。光モジュール単体の AFR/FIT を実測で公開した一次資料は存在しない。 ### 2026-08-05 ingest | Materialized Metrics in Prometheus(RedditEng Blog) - [[@2026__RedditEng__Materialized Metrics in Prometheus]](source 新規) — [[Aleksandr Krivoshchekov]]・[[Walther Lee]]([[Reddit]] オブザーバビリティチーム)、RedditEng Blog(公開日不明、推定2026-07中旬以前)。Kubernetes の pod ラベルによる Prometheus カウンタ系列の膨張問題に対し、recording rule の限界(継続的背景負荷・toil・タイムアウト)を退けた上で、スクレイプ時に delta 化してから固定間隔で強制リセットする「ジグザグカウンタ」を導入し、レプリカ間合意プロトコルなしで比較・重複排除・欠損補完可能な擬似カウンタを Prometheus に書き戻す手法 [[マテリアライズドメトリクス]] を提案。本番実装で最大メトリクスの系列数を98%削減、クエリスループット88%減・レイテンシ80%減、平均誤差率0.15%(標準偏差0.13%)を達成。図表6点(pod churn による系列爆発、集約後の望ましいビュー、sum(rate) vs rate(sum) の破綻比較、累積カウンタ vs delta、ジグザグカウンタ生成、本番の counter/zigzag/rate比較)を埋め込んだ。(article / source / prometheus / observability / sre、confidence: medium — reddit.com が Cloudflare の JS 認証チャレンジで取得不能なため、ユーザーが本文を直接貼り付けたものを一次資料とした) - Entities (新規): [[Aleksandr Krivoshchekov]]、[[Walther Lee]] - Entities (更新): [[Reddit]]、[[Prometheus]](いずれもスクレイプ時集約事例を追記) - Concepts (新規): [[マテリアライズドメトリクス]] - Concepts (更新): [[Prometheusシリーズチャーン]]、[[Prometheus TSDB]] - Key insight: Reddit のオブザーバビリティチームは、同一の「pod ラベルによる系列膨張」問題に対し、時期の異なる2つの独立した打ち手を公表している。SREcon26 の stale-series compaction はストレージ層(HEAD からディスクへの先回りフラッシュ)で失活系列の滞留を防ぐのに対し、本記事のマテリアライズドメトリクスは集約層(スクレイプ時のジグザグカウンタ生成)でラベル自体を畳み込んで系列数を減らす。両者は排他的でなく異なるレイヤーの解法として併用しうる。 - Open questions: マテリアライズドメトリクスと stale-series compaction を同一インスタンスで併用した場合の相互作用は検証されているか。ジグザグカウンタのアップストリーム化(OSS Prometheus への提案)は進んでいるか。VictoriaMetrics の streaming aggregation(コメント欄で言及)との定量比較はあるか。 - 取得方法注記: reddit.com はサンドボックスのネットワーク許可リスト外かつ Cloudflare の JS 認証チャレンジ対象のため、WebFetch・curl(ブラウザ UA・公式 JSON API 含む)いずれからも本文取得不能だった。ユーザーが記事本文全文とコメント欄をチャットに直接貼り付けたものを一次資料として使用。confidence: medium。 ### 2026-08-05 ingest | Mixture-of-Kittens: our open-source MoE megakernel for NVL72s(Cursor Blog) - [[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]](source 新規) — [[Cursor Research]](Stuart Sul・Nash Brown・Henry Wildermuth・William Lin・[[Federico Cassano]])、Cursor Blog(2026-08-04)。[[NVIDIA GB300 NVL72]] 向けの決定論的 [[Mixture-of-Experts]] 訓練用[[メガカーネル]] [[Mixture-of-Kittens]](MoK)を OSS 公開。MoE 層の通信と計算を単一カーネルに融合し、(1) pull-based dispatch が push-based 比で最大29%高い NVLink 帯域利用率、(2) 計算通信オーバーラップ用の「ミニバッチ」調整式、(3) CPU-GPU 同期を排除するリングトークンバッファ、の3設計により単一 MoE 層 MXFP8 順伝播最大2.37倍・本番訓練エンドツーエンド1.41倍(760.9→1,070.2 tok/s/GPU)を達成。Kimi・GLM・Qwen・DeepSeek 形状で検証済み。(article / source / gpu-kernels / distributed / coding-agents) - Entities (新規): [[Mixture-of-Kittens]]、[[Stuart Sul]]、[[Nash Brown]]、[[Henry Wildermuth]]、[[William Lin]]、[[NVIDIA GB300 NVL72]] - Entities (更新): [[Federico Cassano]]、[[Cursor Research]]、[[ThunderKittens]](Mixture-of-Kittens との技術的血縁の推測を追記、未確認) - Concepts (新規): [[メガカーネル]] - Concepts (更新): [[Mixture-of-Experts]] — MegaMoE(DeepSeek-V4 内製)と MoK(Cursor Research、OSS 公開)の設計比較を追記、[[集合通信]] — pull-based dispatch が push-based を上回るという通信方向自体の設計軸を追記、[[LLM駆動GPUカーネル生成]] — 「エージェント単体生成」と「人間+エージェント協働開発」は異なる問いであるという対比を追記 - Key insight: DeepSeek-V4 の MegaMoE がモデル専用の垂直統合メガカーネルだったのに対し、Mixture-of-Kittens は複数モデル形状に対応する OSS メガカーネルとして「MoE 通信計算融合」を汎用化した。また pull-based dispatch が総転送バイト数の増加を伴ってもなお帯域利用率で優位という知見は、NVLink 上の通信方向選択が独立した最適化軸であることを初めて定量化した。 - Open questions: Mixture-of-Kittens と ThunderKittens のコード共有・依存関係の有無(命名からの推測のみ、未確認)。pull-based dispatch の優位性は NIC 経由のノード間 RDMA でも成立するか、ファブリック特性で逆転するか。 ### 2026-08-04 ingest-paper | Bifrost: Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis(arXiv:2607.23169) - [[@2026__arXiv__Bifrost - Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis]](source 新規) — Minghua He ほか([[Peking University]]・[[Tsinghua University]]・[[Alibaba Group]]、ASE '26 採録)。既存 PLM が自然言語向け事前学習に起因しログの多階層構造(実行フロー・イベント・コンポーネント)を捉えられないことを経験的研究で示し、これを fallibility representation として定式化。Execution Flow Prediction・Abnormal Event Discrimination・System Component Perception の3つの自己教師あり対照学習タスクと、多目的同時最適化が引き起こす fallibility jitter を勾配分散の観点から緩和する Co-Anchored Fallibility Representation Learning (CARL) 戦略を提案。BGL・Hadoop・Thunderbird・産業用 MLaaS システム Platform-X で、既存 PLM を平均 AD F1 9.83%・RCL HR@k 18.28%・FI Macro-F1 20.88% 上回った。(paper / source / aiops / log-analysis / fault-diagnosis / representation-learning) - Entities (新規): [[Xinlong Zhao]]、[[Leyi Pan]]、[[Cheng Wang]]、[[Yinghao Yu]] - Entities (更新): [[Minghua He]]、[[Tong Jia]]、[[Lingzhe Zhang]]、[[Chiming Duan]]、[[Kangjin Wang]]、[[Liping Zhang]]、[[Yifan Wu]]、[[Ying Li]]、[[Peking University]]、[[Alibaba Group]]、[[Tsinghua University]] - Concepts (更新): [[ログベース障害診断]] — 「診断モデル設計」対「ログ表現そのものの事前学習目的設計」という上流の設計軸、および対照学習の多目的同時最適化が引き起こす fallibility jitter という固有の不安定性を追記 - Key insight: 既存のログベース障害診断研究(LogInsight・LogKG 等)がいずれも下流の診断モデル設計に注力するのに対し、Bifrost はより上流の「PLM の事前学習目的自体がログの多階層構造を捉えられない」という問題に焦点を当て、表現層に fault-related な情報を先に埋め込むという分業の再配置を提案した。 ### 2026-08-04 ingest-paper | DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents(arXiv:2607.22165) - [[@2026__arXiv__DBA-Bench - A Production-Fidelity Benchmark for LLM-Based Database Operations Agents]](source 新規) — [[Junming Chen]]ほか([[University of Electronic Science and Technology of China]])。稼働ワークロードを保ったまま多ターンで診断・修復させる本番忠実度データベースエージェントベンチマーク。106 PostgreSQL シナリオ・7タスクドメイン・2難度で、outcome-first 評価(診断精度・修復達成・運用安全性を分離)を行う。848 自動実行で Diagnosis/Outcome/Safe Pass は 32.7%/19.6%/12.4%、最良自動ベースライン(GPT-5.5)の Safe Pass 17.9% は Human DBA 参照の 93.4% と 75.5 ポイントの差。診断できても安全な修復を完遂できない「診断-修復ギャップ」(diagnosis-passing runs の 62.1% が outcome に失敗)を定量化した。(paper / source / database / aiops / benchmark / llm-agent) - Entities (新規): [[Junming Chen]]、[[Kai Zheng]]、[[University of Electronic Science and Technology of China]] - Entities (更新): [[D-Bot]](lint-stub から実体化、DBA-Bench 再評価 Safe Pass 5.7%)、[[DBAIOps]](DBA-Bench 再評価 Safe Pass 14.2%)、[[AIOpsLab]](DBA-Bench からの位置づけ) - Concepts (更新): [[データベース O&M]]、[[データベース自律診断]]、[[本番接地型ベンチマーク]] - Key insight: 原論文の自己申告ベンチマークでは高精度だった D-Bot・DBAIOps を、DBA-Bench が共有の本番忠実度環境・共通バックボーンで再評価すると Safe Pass はいずれも common-ReAct GPT-5.5(17.9%)を下回った(D-Bot 5.7%、DBAIOps 14.2%)。tree-search・knowledge-graph-guided というアーキテクチャの精緻化は動作点(コスト-性能)を変えるが、診断は正しくても修復が安全に完遂しないという根本的な失敗モードは解消しない。 ### 2026-08-04 ingest-slides | もう一度考える SRE チームの作り方・育て方(SpeakerDeck) - [[@2026__SpeakerDeck__もう一度考える SRE チームの作り方・育て方]](source 新規) — [[Ryota Yoshikawa]]([[Topotal]] CTO)。SRE チームの「作り方」を組織信頼性5フェーズ(縦軸)と4つの関わり方(横軸)の平面上での初期配置と目的地の決定として、「育て方」をその平面を動かし続けるプロセスとして再定義。定石「上げてから、右へ」に対し、AI による縦横同時移動コストの低下で「上げながら、右へ」も可能になってきたと論じる。(slides / sre / organization) - Concepts (新規): [[SREエンゲージメントモデル]] - Concepts (更新): [[組織の信頼性マインドセット]] — 横軸(関わり方)との2次元マップ化を追記 - Entities (更新): [[Ryota Yoshikawa]]、[[Topotal]] - Key insight: 同じ Google Cloud 由来の5フェーズモデルでも、Takamura 系譜が「診断ツール」として縦軸単独で使うのに対し、Yoshikawa は横軸(関わり方)を掛け合わせて2次元の地図とし、「上げてから、右へ」という移動の定石を導いた。 ### 2026-08-03 ingest | bpftime GPU Support - CUDA and ROCm eBPF Attachment(eunomia.dev) - [[@2025__eunomia.dev__bpftime GPU Support - CUDA and ROCm eBPF Attachment]](source 新規) — [[Yusheng Zheng]]・[[Tong Yu]]・[[Yiwei Yang]]([[eunomia-bpf]])。[[bpftime]] 公式ドキュメントの GPU 対応実装リファレンス。`nv_attach_impl` パイプライン、3 アタッチ型(`ATTACH_CUDA_PROBE`/`ATTACH_CUDA_RETPROBE`/`__memcapture`)、GPU 専用マップ(array/ringbuf)、GPU ヘルパー関数(ID 501-506)、Host-GPU スピンロック通信プロトコル、kernelretsnoop/threadhist/launchlate の実装例、Nsight Systems/Compute の限界の4分解を詳述。NVBit 比 3-10 倍高速と主張。(article / ebpf / gpu / cuda / rocm / observability) - Concepts/Entities (更新): [[GPU観測性]]、[[eGPU]]、[[PTX 注入]]、[[bpftime]]、[[Yusheng Zheng]]、[[Tong Yu]]、[[Yiwei Yang]]、[[eunomia-bpf]] ### 2026-08-03 ingest | How to Do Great Work - Source: [[@2023__paulgraham.com__How to Do Great Work]] - Updated: [[偉大な仕事の技法]](新規)、[[Paul Graham]](新規) - Key insight: 偉大な仕事の技法を分野横断で4ステップ(分野選択・フロンティア到達・ギャップ発見・探索)に整理し、計画より「upwind に留まる」戦略とモラールの複利的サイクル、好奇心駆動のオリジナリティ論を提示した。 ### 2026-08-03 ingest-paper | Cloud Performance Decomposition for Long-Term Performance Engineering - Source: [[@2026__arXiv__Cloud Performance Decomposition for Long-Term Performance Engineering - A Case Study]] - Updated: [[時系列分解]](新規)、[[異常検知]]、[[Shimul Debnath]](新規)、[[William Hart]](新規)、[[Lori Pollock]](新規)、[[Donald Lien]](新規)、[[Wei Wang (UTSA)]](新規)、[[University of Texas at San Antonio]](新規)、[[University of Delaware]](新規) - Key insight: STL のような単一季節成分の分解手法はパブリッククラウドの週次・月次・四半期の複数周期を分離できないという限界を実証し、ハイブリッド/手動と EEMD ベース自動の 2 つの分解手法で MAPE 1.8%/2.1% の性能予測精度と、分解情報に基づくリソース配分でレイテンシ標準偏差 60% 超・最大レイテンシ 10% 削減を達成した。 ### 2026-08-03 ingest-paper | Enabling Performant and Flexible Model-Internal Observability for LLM Inference - Source: [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] - Updated: [[モデル内部可観測性]](新規)、[[機構的解釈性]]、[[Speculative Decoding]]、[[Zaoxing Liu]]、[[University of Maryland]] - Key insight: 内部可観測性を推論ホットパスから非同期分離するDMI-Libは、HookPoint(カスタムPyTorch演算子)とRing2(GPU/CPU二重リングバッファ)によりオフライン0.4〜6.8%・オンライン平均6%という低オーバーヘッドを達成し、既存手法比レイテンシオーバーヘッドを2〜15倍削減した。 ### 2026-07-31 ingest-paper | UCX: An Open Source Framework for HPC Network APIs and Beyond - Source: [[@2015__HOTI__UCX - An Open Source Framework for HPC Network APIs and Beyond]] - Updated: [[UCX]]、[[HPCインターコネクトベンチマーク]] - Key insight: UCXの初期設計は、UCS/UCT/UCPの3層で異種HPC通信を抽象化し、低水準プリミティブを基盤ドライバに近い性能で提供することを狙った。後年のGPU・集合通信のエンドツーエンド評価とは、評価対象の層を分けて解釈する必要がある。 ### 2026-07-29 wiki/concepts リファクタリング - Concepts (統合): [[メタ安定障害]](`Metastable Failure` を統合)、[[パイプライン並列化]](`パイプライン並列` を統合)。詳細は [[concepts/_index]]。 ### 2026-07-28 ingest | 30papers 読書リスト(27件) - 30papers が掲載する現行27件を個別sourceとして取り込んだ。[[@2026__30papers__Attention Is All You Need|Transformer]]、[[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate|注意機構]]、[[@2026__30papers__Scaling Laws for Neural Language Models|スケーリング則]]、[[@2008__30papers__Machine Super Intelligence|普遍知能尺度]]、[[@2026__30papers__Kolmogorov Complexity|記述長]]、[[@2026__30papers__Neural Message Passing for Quantum Chemistry|GNN]]、[[@2026__30papers__Deep Residual Learning for Image Recognition|残差学習]]を含む。30papers は「30本」と称するが、取得時点での掲載は27件である。 Last updated: 2026-07-27 | Total pages: 3067+ | Sources ingested: 551 Navigation: [[overview]] | [[hot]] | [[log]] | [[concepts/_index]] | [[entities/_index]] | [[sources/_index]] ### 2026-07-27 ingest-paper | Understanding Performance of eBPF Maps (eBPF '24) - [[@2024__eBPF'24__Understanding Performance of eBPF Maps]](source 新規) — [[Chang Liu]]・[[Byungchul Tak]]・[[Long Wang]]([[Tsinghua University]] / [[Kyungpook National University]] / [[Zhongguancun Laboratory]])、ACM SIGCOMM 併設 Workshop on eBPF and Kernel Extensions(eBPF '24、DOI 10.1145/3672197.3673430)。array・hash・per-cpu変種・ring/perf buffer・queue/stack を専用ベンチマークシステム(`bpf_bench()`)で網羅的に測定し、メモリフットプリントとキャッシュホット性が eBPF マップのアクセスオーバーヘッドの主要因であることを実証。per-cpu hash マップの新規キー挿入時ゼロ初期化による増幅、eBPF プログラムの「volume discount」特性(3syscall同時アタッチで単一アタッチ比35〜84%の実行時間)を発見 - [[Chang Liu]]・[[Byungchul Tak]]・[[Long Wang]]・[[Kyungpook National University]](entity 新規)、[[Tsinghua University]]・[[Zhongguancun Laboratory]](entity 更新) - [[eBPFマップ]](concept 新規) — メモリフットプリント・キャッシュホット性依存というeBPFマップの性能特性を新設 - [[eBPF]]・[[Linuxカーネルインタフェース]](concept 更新) — eBPFマップの性能特性を「情報を最上流で絞る」設計指針の実装レベルの根拠として追記、ring/perf buffer の大規模転送効率差を追記 ### 2026-07-27 ingest | Beyond Correlation: Finding Root-Causes using a network digital twin graph and agentic AI (AWS Database Blog) - [[@2025__AWS Database Blog__Beyond Correlation - Finding Root-Causes using a network digital twin graph and agentic AI]](source 新規) — AWS Database Blog(2025-08-18)。ネットワークデジタルツイン(Amazon Neptune 上のグラフ)とエージェント型 AI([[Strands Agents]] + Amazon Bedrock AgentCore、13 専門エージェント)を組み合わせた RCA アーキテクチャ。4 種のランブック(グラフ分析ベースライン/既知パターン+グラフフォールバック/マルチシグナル異常統合/AST-GNN 予測ドリフト統合)を提案し、[[NTT DOCOMO]] の商用モバイルネットワーク(加入者8900万超、トランスポート+4G/5G RAN)実装で 15 秒 MTTD を達成 - [[NTT DOCOMO]]・[[Amazon Neptune]]・[[Strands Agents]](entity 新規) - [[根本原因分析]]・[[グラフベースRCA]]・[[LLMによる根本原因分析]]・[[グラフニューラルネットワーク]](concept 更新) — テレコムネットワークドメインへのグラフ RCA 拡張・Neptune Analytics カスケード型設計・13 エージェント構成と OpsMemory 共有ブラックボード・AST-GNN 予測ドリフト検知を追記 ### 2026-07-27 ingest-paper | Robust Multimodal Failure Detection for Microservice Systems (KDD 2023) - [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]](新規) — [[Chenyu Zhao]]・[[Minghua Ma]] ほか([[Nankai University]] / [[Microsoft]] / [[Tsinghua University]])。metric/log/trace を異種グラフに統合し GTN+GAT+GRU で学習する教師なしインスタンス障害検知手法 AnoFusion を提案。GAIA データセットで F1=0.857、商業銀行データセットで F1=0.922。SCWarn を最大 41.00% 上回る。既存 concept [[マルチモーダル障害診断]] に、TVDiag・UniDiag 等の「診断」研究に先立つ「検知」研究として GNN 融合系譜を遡らせる知見を追記。(paper / aiops / microservices) ### 2026-07-27 ingest-paper | SequenceFI: Non-intrusive Temporal Fault Injection for Microservice Systems (arXiv 2607.20050) - [[@2026__arXiv__SequenceFI - Non-intrusive Temporal Fault Injection for Microservice Systems]](source 新規) — Wuhan University / Zhongguancun Laboratory の Yuzhen Tan ほか。マイクロサービス障害注入に「いつ」注入するかという時間的次元を導入。post-effect/order-sensitive/k-of-n の 3 パターンで 450 試行 100.0% の temporal success、TFIC 生成試行回数を平均 1 回に圧縮(H-Random 比 95.91% 探索時間削減)、Istio サイドカー比 CPU 41.5%・メモリ 2.3% - [[Yuzhen Tan]]・[[Shaolin Tan]](entity 新規)、[[Jian Wang]]・[[Bing Li]]・[[Wuhan University]]・[[Zhongguancun Laboratory]]・[[Peter Alvaro]](entity 更新) - [[障害注入]](concept 更新) — 「何を・どこに」に続く「いつ」という第三の注入軸、静的/時間的分離による探索空間爆発への新しい解法を追記 ### 2026-07-27 ingest | Leiden Declaration on Artificial Intelligence and Mathematics - [[@2026__leidendeclaration.ai__Leiden Declaration on Artificial Intelligence and Mathematics]](source 新規) — 数学研究における生成AI活用の課題に対処するコミュニティ宣言(2026-06-02発行、国際数学連合承認、署名者3,165名超)。証明の信頼性・著者への帰属・査読プロセス・研究の自律性という数学の中核的価値がAI導入によって脅かされるという懸念を提示し、数学者・組織・政策立案者・商用AI企業それぞれへの推奨事項を示す - [[Jim Portegies]]・[[Peter Scholze]]・[[Terence Tao]]・[[International Mathematical Union]]・[[Lorentz Center]](entity 新規) - [[AI時代の数学研究倫理]](concept 新規) — 数学の中核的価値・脅威・ステークホルダー別推奨事項の枠組み - [[自動査読]](concept 更新) — LLM査読の性能向上と、宣言が求める査読付き出版の維持要求との緊張関係を追記 ### 2026-07-27 ingest-paper | AIシステムの進化速度は指数関数を超えている (TJSAI, 2025) - [[@2025__TJSAI__AIシステムの進化速度は指数関数を超えている]](source 新規) — [[中島秀之]]・[[津田一郎]]([[札幌市立大学]])。Kurzweilのシンギュラリティ論を批判し、チップの物理サイズを固定して集積度がN倍になると可能な計算量が2^(NL)で指数関数的に増加すること、ムーアの法則(N∝2^t)と組み合わせると時間に関する指数関数の指数関数になることを導出。Transformerのattention機構がSIMD型の局所計算であるためこの議論が適用できると主張 - [[中島秀之]](entity 新規) — 札幌市立大学学長 - [[津田一郎]](entity 新規) — 札幌市立大学AITセンター特任教授 - [[札幌市立大学]](entity 新規) - [[シンギュラリティ]](concept 新規) — Kurzweilの技術的特異点論 - [[コルモゴロフ複雑性]](concept 新規) — プログラムの複雑度を測る尺度 - [[ムーアの法則とデナードスケーリングの終焉]](concept 更新) — 本ソースの前提(N∝2^tの継続)と既存ページの鈍化知見との緊張関係を contradiction callout で追記 - [[Transformer]](concept 更新) — attentionの局所性とSIMDの関係を追記 - [[SIMDベクトル処理]](concept 更新) — 計算量理論の立場からの局所性評価を追記 ### 2026-07-23 ingest | ソフトウェアの工業化とアーツ&クラフツ運動 (NewsPicks) - [[@2026__NewsPicks__ソフトウェアの工業化とアーツ&クラフツ運動]](source 新規) — NewsPicks、[[広木大地]]。AIコーディング時代の「職人か工業化か」対立を、19世紀アーツ&クラフツ運動からバウハウスに至る150年のデザイン史の弁証法(正→反→合)になぞらえ、[[Mitchell Hashimoto]] の「ハーネス・エンジニアリング」を統合(合)の実践例として位置づける - [[広木大地]](entity 新規) — 著者 - [[Mitchell Hashimoto]](entity 新規) — [[HashiCorp]] 共同創業者、Vagrant/Terraform の開発者、ハーネス・エンジニアリングの実践者 - [[HashiCorp]](entity 新規) - [[Wes McKinney]](entity 新規) — pandas 作者、「The Mythical Agent-Month」でブラウンフィールド・バリアを報告 - [[Fred Brooks]](entity 新規) — 『人月の神話』著者 - [[William Morris]](entity 新規) — アーツ&クラフツ運動の中心人物 - [[Walter Gropius]](entity 新規) — バウハウス創立者 - [[Marcel Breuer]](entity 新規) — ワシリー・チェアの設計者 - [[Dan Shapiro]](entity 新規) — Glowforge CEO、AIプログラミング5段階分類の提唱者 - [[StrongDM]](entity 新規) — 3人体制でソフトウェアを出荷するAIチーム - [[Software Craftsmanship]](concept 新規) — アーツ&クラフツ運動を源流とする職人的ソフトウェア開発思想、モリスのパラドックスを含む - [[ダーク・ファクトリー]](concept 新規) — Dan Shapiro の AI プログラミング5段階分類 Level 5 - [[Harness Engineering]](更新) — Mitchell Hashimoto の独立した実践知見(デザイン史の類比)を追記 - [[バイブコーディング]](更新) — 職人コーディング陣営からの「ファストフード」批判を追記 - [[Andrej Karpathy]](更新) — バイブコーディング命名への批判文脈を追記 ### 2026-07-22 ingest | Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI (NVIDIA Developer Blog) - [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]](source 新規) — NVIDIA Developer Blog。エージェント型 AI 推論向けに設計された [[NVIDIA Rubin GPU]] のチップアーキテクチャ(第 3 世代 Transformer Engine・NVFP4 最大 50 PFLOPS・HBM4 最大 288GB/22 TB/s・K 次元テンソルコアスループット倍増・NVLink 6 counted writes)と、ラックスケール統合 [[NVIDIA Vera Rubin NVL72]](Intelligent Power Smoothing・DSX MaxLPS で同一電力予算内 GPU 数最大 40% 増)を解説 - [[NVIDIA Rubin GPU]](entity 新規) — Blackwell 後継の NVIDIA 次世代 GPU。336B トランジスタ・224 SM・896 テンソルコア - [[NVIDIA Vera Rubin NVL72]](entity 新規) — Rubin GPU をラックスケールに統合した電力・冷却・ネットワーク一体型実行ドメイン - [[NVIDIA]](更新) — Rubin GPU / Vera Rubin NVL72 の発表を追記 - [[テンソルコア]](更新) — Rubin の K 次元スループット倍増・指数関数スループット向上を横断的知見に追記 - [[Mixture-of-Experts]](更新) — Rubin の TMA インライン・ディスクリプタ更新による MoE 重み移動のハードウェア co-design を追記 - [[KVキャッシュ管理]](更新) — Rubin HBM4(288GB)によるオフロード不要化の可能性を追記 - [[集合通信]](更新) — Rubin NVLink counted writes と Speed-of-Light 研究の対比を追記 - [[AIデータセンタートポロジ]](更新) — Vera Rubin NVL72 の電力 co-design(Intelligent Power Smoothing・DSX MaxLPS)を追記 - [[カーネルフュージョン]](更新) — Rubin のタイルレベル・カーネル間トリガリングをフュージョンの代替解として追記 ### 2026-07-21 ingest-paper | Understanding Reasoning from Pretraining to Post-Training (arXiv 2607.16097) - [[@2026__arXiv__Understanding Reasoning from Pretraining to Post-Training]](source 新規) — Jingyan Shen・Ang Li(対応著者)ほか(New York University・Modal Labs・University of California, Los Angeles・University of Illinois Urbana-Champaign・Columbia University)。チェスパズルを制御可能なテストベッドとして事前学習・SFT・GRPOベースの検証可能報酬RLの3段パイプラインを構築し、事前学習の損失・トークン数からRL報酬曲線の切片・傾きを予測する結合スケーリング則を導出。RLによるポリシー変化を Ground-truth amplification・Tail discovery・Wrong-mode amplification の3categoryに分類した。 - Concepts (更新): [[強化学習スケーリング]], [[検証可能報酬による強化学習]] - Entities (新規): [[Jingyan Shen]], [[Ang Li]], [[Salman Rahman]], [[Yifan Sun]], [[Micah Goldblum]], [[Matus Telgarsky]], [[Pavel Izmailov]], [[Modal Labs]], [[University of California, Los Angeles]] - Entities (更新): [[New York University]], [[University of Illinois Urbana-Champaign]], [[Columbia University]] ### 2026-07-21 ingest-paper | Real-Time Incident Prediction for Online Service Systems (ESEC/FSE '20) - [[@2020__ESEC-FSE__Real-Time Incident Prediction for Online Service Systems]](source 新規) — Nengwen Zhao・Junjie Chen(対応著者)ほか(Tsinghua University; BNRist・Tianjin University・BizSeer・China EverBright Bank、ESEC/FSE '20)。アラートデータのみから LDA テキスト特徴+統計特徴+multi-instance learning でノイズアラートを抑制し、XGBoost+SMOTE で二値分類・LIME で解釈可能レポートを生成するリアルタイムインシデント予測手法 eWarn を提案。大手商業銀行の11実サービスシステムで平均F1 0.82を達成し、AirAlert(0.51)・TF-IDF-LSTM(0.60)・銀行の現行実務FP-Growth(0.10)を上回った。MIL除去で平均F1が0.66に低下、LDAはTextCNN(0.48)・FastText(0.51)を上回った。2行への実運用適用と4件の成功事例を報告。 - Concepts (更新): [[障害予測]], [[AirAlert]] - Entities (新規): [[Zhou Wang]], [[Xiao Peng]], [[Yong Wu]], [[Gang Wang]], [[Fang Zhou]], [[Zhen Feng]], [[China EverBright Bank]] - Entities (更新): [[Nengwen Zhao]], [[Junjie Chen]], [[Dan Pei]], [[Xiaohui Nie]], [[Kaixin Sui]], [[Wenchi Zhang]], [[BizSeer]], [[Tsinghua University]], [[Tianjin University]] ### 2026-07-21 ingest-paper | BTrDB: Optimizing Storage System Design for Timeseries Processing (FAST '16) - [[@2016__FAST__BTrDB - Optimizing Storage System Design for Timeseries Processing]](source 新規) — Michael P Andersen・David E. Culler(University of California, Berkeley、FAST '16、pp.39-52)。マイクロシンクロフェーザ(uPMU)向け時系列データベース。時間区分・バージョン注釈付き copy-on-write の k-ary ツリーがストレージとインデックスを一体化し、内部ノードの統計サマリ埋め込みで対数時間統計クエリを実現。4ノード EC2 で挿入53M/秒・クエリ119M/秒、圧縮率2.9x、本番2.1兆データ点。 - Concepts (更新): [[時系列データベース]] - Entities (新規): [[Michael P Andersen]], [[David E. Culler]], [[BTrDB]] - Entities (更新): [[University of California, Berkeley]] ### 2026-07-20 ingest-paper | LLM hallucinations in the wild: Large-scale evidence from non-existent citations (arXiv 2026) - [[@2026__arXiv__LLM hallucinations in the wild]](source 新規) — Zhenyue Zhao・Yihe Wangほか4名(Cornell University・UCLA・Tsinghua University・UC Berkeley Haas School of Business、arXiv 2605.07723、2026-05-08)。arXiv・bioRxiv・SSRN・PubMed Centralの論文250万本・参照1億1,100万件を監査し、LLM登場前のマッチ失敗率をベースラインとした差分推定でハルシネーション引用を定量化。2025年単年で少なくとも146,932件、2024年半ばから急伸(arXiv 0.39%・bioRxiv 0.21%・SSRN 1.91%・PMC 0.27%、いずれも2025年8月時点)。汚染は少数の重度汚染論文ではなく多数の論文への薄い拡散パターンであり、ハルシネーション引用を出す著者(hallucination citers)は2022年以前は低生産性だったが2025年にはその格差が解消(生産性1.3〜3.1倍増)。ハルシネーション引用は実在著者に一致した場合、高生産性・高被引用・男性名の著者に不均衡に功績を帰属。arXivモデレーションはハルシネーション引用の78.8%を通過させ、bioRxiv→PMC出版移行後も85.3%が残存する。科学分野の新規ソースとして本wikiに初のscience-of-science系ハルシネーション研究を導入。 - Concepts (新規): [[LLMのハルシネーション]] - Entities (新規): [[Zhenyue Zhao]], [[Yihe Wang]], [[Toby Stuart]], [[Mathijs De Vaan]], [[Paul Ginsparg]], [[Yian Yin]] - Entities (更新): [[Cornell University]], [[University of California, Berkeley]], [[Tsinghua University]] ### 2026-07-18 ingest-paper | OpsMem: Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis (arXiv 2026) - [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]](source 新規) — Yongqian Sunほか9名(Nankai University・Tsinghua University・Huawei Technologies、arXiv 2607.11357、2026-07-13)。失敗診断のための短期記憶(STM、診断状態のグラフ)と長期記憶(LTM、運用経験のグラフ)を cross-memory resonance(CMR)で結合するデュアルメモリフレームワーク。STM は GoS(Luo+, ICML 2026)の belief-state 抽象化を踏襲し、STM 更新のたびに CMR が関連 LTM 部分グラフを再活性化する。Huawei の実運用マイクロサービス障害 120 件データセットで ReAct・GoS・GoS+VectorRAG/GraphRAG/LinearRAG の全ベースラインを上回り(最強ベースライン比 Match +6.66〜25.00pt、Relevant +3.33〜13.33pt)、LTM consolidation による自己進化(診断を重ねるほど性能向上)も実証した。 - Concepts (更新): [[エージェントメモリ]]、[[仮説駆動RCA]]、[[LLMによる根本原因分析]] - Entities (新規): [[OpsMem]], [[Rongchen Gao]], [[Qingyi Guo]], [[Yaoliang Wu]] - Entities (更新): [[Yongqian Sun]], [[Yu Luo]], [[Wenwei Gu]], [[Shenglin Zhang]], [[Dan Pei]], [[Qiuai Fu]], [[Nankai University]], [[Tsinghua University]], [[Huawei Technologies]] ### 2026-07-18 ingest-paper | MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces (MLSys 2026 Oral) - [[@2026__MLSys2026__MLCommons Chakra - Advancing Performance Benchmarking and Co-design using Standardized Execution Traces]](source 新規) — Srinivas Sridharan・Tushar Krishnaほか29名(NVIDIA / Georgia Institute of Technology / AMD / Meta / Keysight / MLCommons ほか、arXiv 2605.11333、MLSys 2026 Oral)。分散AI/MLワークロードの性能挙動を記述する標準グラフ表現Chakra Execution Trace(ET)と、Trace Linker/Converterによるホスト・デバイストレース統合、trace analysis/replay/simulation-emulationの3用途からなるMLCommons公認エコシステムを提示。40以上の企業・組織が参加するワーキンググループとして標準化されており、ASTRA-simやKeysight AI DCB等に実装されている。vLLM統合によりMoEトークンルーティングの不均衡・KVキャッシュオフロードコスト・Prefill-Decode分離間のper-layer KV転送レイテンシもトレースベースで定量化した。 - Concepts (新規): [[実行トレース]] - Concepts (更新): [[Prefill-Decode分離]]、[[KVキャッシュ管理]] - Entities (新規): [[MLCommons Chakra]], [[MLCommons]], [[Georgia Institute of Technology]], [[Tushar Krishna]], [[Srinivas Sridharan]], [[ASTRA-sim]] - Entities (更新): [[NVIDIA]], [[AMD]], [[vLLM]] ### 2026-07-15 ingest-paper | Scalable and Energy-Efficient AI: System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training (AI, MDPI) - [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]](source 新規) — [[Muhammad Ali Shafique]]ほか(Kansas State University / Johnson Controls / Florida Atlantic University / Lawrence Berkeley National Laboratory, *AI* 2026, 7(7), 232)。シングルノード8×NVIDIA H100と8×NVIDIA B200を、5種のLLM(7B〜32B)と3種のVLMのDDP訓練で比較した実証研究。B200はTFLOPs/GPU最大32%向上・訓練時間最大15%短縮を達成する一方、TFLOPs/kWとtokens-per-kilojouleでは全LLMでH100を下回る「計算-エネルギー不整合」を実測。施設規模モデリングでは高負荷5000ノードでB200が年間+$4.26M のエネルギーコスト超過となることを示した。 - Concepts (新規): [[GPUエネルギー効率]] - Concepts (更新): [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]との横断的知見(GPUエネルギー効率ページに集約) - Entities (新規): [[Muhammad Ali Shafique]], [[Imran Latif]], [[Hayat Ullah]], [[Alex C. Newkirk]], [[Arslan Munir]], [[Kansas State University]], [[Johnson Controls]], [[Florida Atlantic University]], [[Lawrence Berkeley National Laboratory]] ### 2026-07-15 ingest-paper | Speculations Concerning the First Ultraintelligent Machine (Advances in Computers, 1965) - [[@1965__AdvComput__Speculations Concerning the First Ultraintelligent Machine]](source 新規) — [[I. J. Good]](Trinity College, Oxford / Atlas Computer Laboratory, 1965)。あらゆる知的活動で人間を凌駕する「ウルトラ知能機械」を定義し、機械が自らより優れた後継機械を設計できることから「知能爆発」が不可避に生じると初めて明示的に定式化した思弁的モノグラフ。Hebb の細胞集成体理論を修正した「サブアセンブリ理論」により、通信理論の「再生」・統計的情報検索・意味論を統一的に説明する試みが本体の大半を占める。実験なし。 - Concepts (更新): [[知能爆発]](原論文出典を追加し、Good/Yudkowsky の役割分担を横断的知見に追記)、[[Recursive Self-Improvement]](起源論文を出典に追加) - Entities (更新): [[I. J. Good]](本人の一次論文を追加、「未ingest」注記を解消) ### 2026-07-15 ingest | Recursive Self-Improvement (LessWrong) - [[@2008__LessWrong__Recursive Self-Improvement]](source 新規) — [[Eliezer Yudkowsky]](LessWrong, 2008-12-01)。「AI go FOOM」論の中心的論証。因果の5層分解(metacognitive/cognitive/metaknowledge/knowledge/object level)、「自分のソースコード書き換え」と「農業の発明」の区別、微分方程式による再帰の比喩、「複雑な最適化連鎖を再帰で畳み込むと横ばいか爆発かのどちらかになるはず」という理論的主張を提示する一次資料。 - Concepts (新規): [[知能爆発]], [[テイクオフ速度論争]], [[リソースオーバーハング]] - Concepts (更新): [[Recursive Self-Improvement]] - Entities (新規): [[Eliezer Yudkowsky]], [[Robin Hanson]], [[I. J. Good]] ### 2026-07-15 ingest | Harness Engineering for Self-Improvement (Lil'Log) - [[@2026__Lil'Log__Harness Engineering for Self-Improvement]](source 新規) — [[Lilian Weng]](Lil'Log, 2026-07-04)。再帰的自己改善(RSI)の近未来的経路を、モデル重みの直接書き換えではなく訓練パイプラインとデプロイシステム(ハーネス)の改善による間接的ループと位置づけ、ワークフロー自動化・ファイルシステムを永続メモリとする設計・サブエージェント委譲の3パターン、ACE/MCE(コンテキストのプレイブック化)、Meta-Harness/Self-Harness/AHE(ハーネスコード自体の自己進化)、ADAS/AFlow/AlphaEvolve(進化的探索)を横断整理する。 - Concepts (新規): [[Recursive Self-Improvement]], [[ハーネス自己進化]], [[進化的探索によるエージェント設計]] - Concepts (更新): [[Harness Engineering]], [[コンテキストエンジニアリング]] - Entities (新規): [[Lilian Weng]] - Entities (更新): [[Andrej Karpathy]](autoresearch リポジトリへの言及を追記) ### 2026-07-14 ingest-slides | 言語モデルの内部機序:解析と解釈 (NLP2025 チュートリアル) - [[@2025__SpeakerDeck__言語モデルの内部機序:解析と解釈]](source 新規) — [[Benjamin Heinzerling]]・[[横井祥]]・[[小林悟郎]](理化学研究所・東北大学・国立国語研究所)、言語処理学会第31回年次大会(NLP2025)チュートリアル1(2025-03-10)。内部表現の解析(プロービング、SAE)・計算過程の解析(注意パターン観察、Logit Lens、Circuit Analysis)・言語と世界の対応づけ(解釈)という3段階フレームワークと、その前提「局所性・一対一対応」への懐疑的検討を扱う。全144ページ、transcript なし。 - Concepts (新規): [[SAE]], [[活性化パッチング]], [[言語モデルのプロービング]] - Concepts (更新): [[機構的解釈性]], [[プラトン的表現仮説]], [[モデル表現収束]], [[ロジットレンズ]], [[帰納ヘッド]], [[アテンションヘッド]] - Entities (新規): [[Benjamin Heinzerling]], [[横井祥]], [[小林悟郎]], [[理化学研究所]], [[東北大学]], [[国立国語研究所]] - Entities (更新): [[Anthropic]] ### 2026-07-14 ingest | The Origins of DevOps: What's in a Name? - [[@2018__devops.com__The Origins of DevOps - What's in a Name]](source 新規) — Steve Mezak、devops.com 2018-01-25。DevOps という語の起源(Agile Infrastructure BoF・Velocity 2009 Flickr発表・Devopsdays創設)を時系列で辿り、2010年の米国初Devopsdays開催と2013年『The Phoenix Project』出版によるDevOps概念の普及過程を補足する。[[@2026__mizzy.org__DevOpsとは何だったのか]] と起源の事実関係が独立に一致する。(article / devops / history) - Concepts (更新): [[DevOps]] - Entities (新規): [[Paul Hammond]], [[Gene Kim]], [[Kevin Behr]], [[George Spafford]] - Entities (更新): [[Patrick Debois]], [[Andrew Clay Shafer]], [[John Allspaw]] ### 2026-07-14 ingest | DevOpsとは何だったのか - [[@2026__mizzy.org__DevOpsとは何だったのか]](source 新規) — [[Gosuke Miyashita]](mizzy)、mizzy.org 2026-07-13。DevOps という語の起源(devopsdays・CAMS)から、モノの名前への消費、小文字devopsの試み、Infrastructure as Code/CI/CD/ChatOps/DORA への分解、そして同じ現象がSREにも起きつつあるという指摘までを辿る。(article / devops / sre / history) - Concepts (新規): [[DevOps]] - Concepts (更新): [[SRE]], [[DORA]], [[プラットフォームエンジニアリング]], [[ChatOps]] - Entities (新規): [[Patrick Debois]], [[John Willis]], [[Andrew Clay Shafer]], [[Gosuke Miyashita]] - Entities (更新): [[John Allspaw]] ### 2026-07-13 ingest | Failure is inevitable - Rethinking Reliability at Datadog - [[@2025__Datadog Engineering Blog__Failure is inevitable - Learning from a large outage and building for reliability in depth at Datadog]](source 新規) — [[Laura de Vesine]]・[[Rob Thomas]]・[[Maciej Kowalewski]](Datadog Engineering Blog, 2025-10-15)。2023 年 3 月大規模障害後のグレースフルデグレーデーション設計転換を報告。スクエアウェーブ障害パターン・8 設計原則・30% インシデント削減。(article / sre / reliability / graceful-degradation) - Concepts (新規): [[グレースフルデグレーデーション]] - Concepts (更新): [[インシデント管理]], [[ソフトウェア耐障害性]] - Entities (新規): [[Rob Thomas]], [[Maciej Kowalewski]] - Entities (更新): [[Datadog]], [[Laura de Vesine]] ### 2026-07-13 ingest-slides | Oncall: An Equal-Opportunity Waste of Time (SREcon22 EMEA) - [[@2022__SREcon22EMEA__Oncall - An Equal-Opportunity Waste of Time]](source 新規) — [[Dave O'Connor]]([[Twilio]] VP Engineering、元 Google SRE 16 年)、SREcon22 EMEA 2022-10-25。オンコールの「toxic exceptionalism」批判と SRE 価値命題の再定義。(slides / sre / oncall / organization) - Concepts (更新): [[SRE組織変革]] - Entities (新規): [[Dave O'Connor]], [[Twilio]] ### 2026-07-13 ingest | 6 Reasons You Don't Need an SRE Team - [[6 Reasons You Don't Need an SRE Team]](source 新規) — [[Gerro Wadat]](2004年Google在籍)。SREモデルの盲目的採用を批判する論考。カーゴカルトSRE・不明確なチャーター・恐怖反応としての採用・責任転嫁の4パターンが導入失敗の典型。(article / sre / organization / anti-pattern) - Concepts (新規): [[カーゴカルトSRE]] - Concepts (更新): [[SRE]] - Entities (新規): [[Gerro Wadat]] ### 2026-07-10 ingest-paper | Failure Trends in a Large Disk Drive Population (FAST 2007) - [[@2007__FAST__Failure Trends in a Large Disk Drive Population]](source 新規) — [[Eduardo Pinheiro]], [[Wolf-Dietrich Weber]], [[Luiz André Barroso]]([[Google]])、FAST 2007。Google 本番 HDD 10 万台超の大規模障害傾向研究。温度・使用率の弱相関と SMART 予測限界を定量化した歴史的基礎文献。(paper / storage / reliability / hardware / smart) - Concepts (新規): [[ハードディスク信頼性]] - Concepts (更新): [[データセンター信頼性]], [[障害予測]] - Entities (新規): [[Eduardo Pinheiro]], [[Wolf-Dietrich Weber]] - Entities (更新): [[Luiz André Barroso]] ### 2026-07-08 ingest-paper | Benchmarking the Overhead of Distributed Tracing Agents (ICPE 2026) - [[@2026__ICPE__Benchmarking the Overhead of Distributed Tracing Agents]](source 新規) — [[David Georg Reichelt]] ほか(Lancaster University Leipzig / Christian-Albrechts-Universität zu Kiel)。7 種の Java トレーシングエージェントを MooBench で統一比較。Kieker 最速(133.92 ns/depth)、OpenTelemetry 業界標準のわりに遅い(315.28 ns/depth)、Pinpoint/Scouter はスパン損失バグ。根本原因: 過度なメタデータ管理・ArrayBasedContext コピー。(paper / distributed-tracing / observability / performance-engineering / benchmarking) - Concepts (新規): [[トレーシングオーバーヘッド]] - Concepts (更新): [[分散トレーシング]], [[継続的プロファイリング]] - Entities (新規): [[David Georg Reichelt]], [[Wilhelm Hasselbring]], [[MooBench]], [[Kieker]] ### 2026-07-07 ingest-paper | VAST AI Operating System (VAST Data 2025) - [[@2025__VAST Data__VAST AI Operating System]](source 新規) — [[VAST Data]]。DASE アーキテクチャ(CNode + DBox + NVMe-oF)を基盤とした AI OS の技術白書。DataStore・DataBase・DataSpace・DataEngine・InsightEngine・AgentEngine を統合。Event Broker が Kafka 比 6 倍スループット/ブローカを主張(ベンダー値)。(whitepaper / storage / ai-infrastructure / rag / distributed) - Concepts (新規): [[DASEアーキテクチャ]] - Concepts (更新): [[コンピュートストレージ分離]], [[分散メッセージブローカ]] - Entities (更新): [[VAST Data]] ### 2026-07-06 ingest-paper | ARGUS: Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters (arXiv 2026) - [[@2026__arXiv__ARGUS - Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters]](source 新規) — [[Jiasheng Zhou]] ほか(Tencent)。10,000 GPU 超の本番 LLM 訓練クラスター向け 3 層独立計装トレーシング・段階的診断システム。2% 未満オーバーヘッド、KDE 3,700 倍圧縮、6 ヶ月超本番デプロイ。(paper / aiops / gpu / distributed / llm-training) - Concepts (更新): [[LLM学習モニタリング]], [[GPU観測性]], [[ストラグラー]] - Entities (新規): [[Jiasheng Zhou]] - Entities (更新): [[Tencent]] ### 2026-07-06 ingest-paper | KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI (ASE '26) - [[@2026__ASE__KRCA - An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI]](source 新規) — [[Jiamin Jiang]] ほか([[Nankai University]] / [[Kuaishou Technology]] / 清華大学)。20万超マイクロサービスのハイパースケール RCA: API ドリルダウン + スケルトン因果グラフ + マルチエージェント協調。AC@1=0.88/0.79 (ベースライン比+31%/+32%)、本番77.3%診断時間短縮。(paper / aiops / rca / microservice / multi-agent) - Concepts (更新): [[根本原因分析]], [[LLMによる根本原因分析]], [[因果発見]] - Entities (新規): [[Jiamin Jiang]] - Entities (更新): [[Yongqian Sun]], [[Dan Pei]], [[Kuaishou Technology]] ### 2026-07-06 ingest-paper | A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis (arXiv 2026) - [[@2026__arXiv__A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis]](source 新規) — [[Yuanhong Cai]] ほか(CNIC/CAS・南開大学・Alibaba Cloud・清華大学)。推論プロセス評価パラダイムと2データセット(AIOps2025 400件・RCA100 103件)。大規模競技(合計6,093チーム)で検証済み。(paper / aiops / benchmark / llm / rca) - Concepts (更新): [[RCA評価設計]], [[SRE Benchmark]] - Entities (新規): [[Yuanhong Cai]] ### 2026-07-06 ingest | 博士論文を書くということ(北村匡平) - [[博士論文を書くということ]](source 新規) — [[北村匡平]](映画研究者・東京理科大学教授)による note.com 記事。日本の人文学系博士教育の歴史的変化(論文博士から課程博士へ)、2025年政策変更による早期修了圧力、国際比較(英国3-4年・米国7年・日本5-6年が妥当)、「博士論文は最初の大きなマイルストーン」という位置づけを論じる。(article / academia / phd / japanese-academia) - Concepts (新規): [[日本の博士教育]] - Entities (新規): [[北村匡平]] ### 2026-07-06 ingest-paper | A Checkpoint/Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters (APSys 2024 Poster) - [[@2024__APSys__A Checkpoint-Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters]](source 新規) — [[Daigo Fujii]]・[[Katsuya Matsubara]]・[[Yuki Nakata]]([[Future University Hakodate]] / [[SAKURA internet Inc.]])。WasmEdge (standard interpreter) と WAMR・Wasm3 (fast interpreter) の間で、プログラムカウンタ・コントロールスタック・バリュースタックを相互変換する異種 interpreter 間 checkpoint/restore の予備研究。JIT/AOT は対象外。(paper / webassembly / checkpoint / migration / edge-computing) - Concepts (更新): [[WebAssembly]]、[[ランタイム中立チェックポイント]]、[[Application Checkpointing]]、[[VM Migration]]、[[Edge-cloud Collaboration]]、[[チェックポイント]] - Entities (新規): [[Wasm3]] - Entities (更新): [[Daigo Fujii]]、[[Katsuya Matsubara]]、[[Yuki Nakata]]、[[Future University Hakodate]]、[[SAKURA internet Inc.]]、[[WasmEdge]]、[[WAMR]] ### 2026-07-05 ingest-paper | Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum (Mid4CC ’25) - [[@2025__Mid4CC__Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint-Restore in Edge-Cloud Continuum]](source 新規) — [[Yuki Nakata]]・[[Katsuya Matsubara]]([[Future University Hakodate]] / [[SAKURA internet Inc.]])。Wasm にコンパイルした自己ホスト型ランタイム Chiwawa を中間層とし、ホストランタイム改変なしでランタイムと最適化戦略の両中立な C/R を実現。wasmtime・WAMR・WasmEdge をホストとする場合ともチェックポイントサイズは 1076 KB で一定。(paper / webassembly / checkpoint / migration / edge-computing) - Concepts (新規): [[Self-Hosted WebAssembly Runtime]] - Concepts (更新): [[WebAssembly]]、[[ランタイム中立チェックポイント]]、[[Application Checkpointing]]、[[VM Migration]]、[[Edge-cloud Collaboration]] - Entities (新規): [[Chiwawa]]、[[Wizard]]、[[CRIU]] - Entities (更新): [[Yuki Nakata]]、[[Katsuya Matsubara]]、[[Future University Hakodate]]、[[SAKURA internet Inc.]]、[[WasmEdge]]、[[WAMR]] ### 2026-07-05 ingest-paper | Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing (CANDARW 2025) - [[@2025__CANDARW__Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing]](source 新規) — [[Katsuya Matsubara]]・[[Yuzuki Saito]]・[[Daigo Fujii]]・[[Yuki Nakata]]。ランタイム中立チェックポイントを用いて、Wasm コンテナの障害時にホットリスタートを、メモリ圧力時に WasmEdge から WAMR への動的ランタイム切り替えを実現。Pod 退避なしにメモリ圧力を緩和し、ホットリスタートは通常再起動に比べて応答時間劣化を抑制した。(paper / webassembly / container-orchestration / fault-tolerance / self-healing) - Concepts (新規): [[ランタイム中立チェックポイント]]、[[ホットリスタート]]、[[動的ランタイム切り替え]]、[[セルフヒーリング]] - Concepts (更新): [[WebAssembly]]、[[チェックポイント]]、[[コンテナオーケストレーション]] - Entities (新規): [[Yuzuki Saito]] - Entities (更新): [[Katsuya Matsubara]]、[[Daigo Fujii]]、[[Yuki Nakata]]、[[Future University Hakodate]]、[[SAKURA internet Inc.]]、[[WasmEdge]]、[[WAMR]] ### 2026-07-05 ingest-paper | Reducing Attack Surface with Container Transplantation for Lightweight Sandboxing (APSys ’23) - [[@2023__APSys__Reducing Attack Surface with Container Transplantation for Lightweight Sandboxing]](source 新規) — [[Yuki Nakata]]・[[Shintaro Suzuki]]・[[Katsuya Matsubara]]。Linux コンテナを FreeBSD カーネルへ移植し、Linux カーネル固有の脆弱性攻撃を回避するとともに Capsicum を透過適用する Container Transplantation を提案。UnixBench で gVisor 比で大幅に小さいオーバーヘッド(システムコールオーバーヘッドは runC 比 22% 悪化)を達成した。(paper / container / security / virtualization) - Concepts (新規): [[Container Transplantation]], [[Capability-based Security]], [[Capsicum]], [[Lightweight Sandboxing]] - Concepts (更新): [[コンテナ仮想化]] - Entities (新規): [[Shintaro Suzuki]], [[gVisor]], [[Kata Containers]], [[FreeBSD]], [[Linux]], [[Linuxulator]] - Entities (更新): [[Yuki Nakata]], [[Katsuya Matsubara]], [[SAKURA internet Inc.]], [[Future University Hakodate]], [[Docker]] ### 2026-07-05 ingest-paper | Stateful VM Migration Among Heterogeneous WebAssembly Runtimes for Efficient Edge-cloud Collaborations (EdgeSys ’24) - [[@2024__EdgeSys__Stateful VM Migration Among Heterogeneous WebAssembly Runtimes for Efficient Edge-cloud Collaborations]](source 新規) — [[Daigo Fujii]]・[[Katsuya Matsubara]]・[[Yuki Nakata]]。WasmEdge と WAMR 間の異種ランタイムステートフルVMマイグレーションを提案。dirty memory検出でCRIU比30〜100倍のチェックポイント時間短縮を達成し、sqlite-benchでランタイム切り替えが単一ランタイム継続より高速になることを実証した。(paper / webassembly / edge-computing / virtualization / migration) - Concepts (新規): [[WebAssembly]]、[[VM Migration]]、[[Edge Computing]]、[[Edge-cloud Collaboration]]、[[Application Checkpointing]] - Concepts (更新): [[チェックポイント]] - Entities (新規): [[Daigo Fujii]]、[[WasmEdge]]、[[WAMR]] - Entities (更新): [[Yuki Nakata]]、[[Katsuya Matsubara]]、[[Future University Hakodate]]、[[SAKURA internet Inc.]] ### 2026-07-05 ingest-paper | Concentrated Isolation for Container Networks Toward Application-aware Sandbox Tailoring (UCC 2021) - [[@2021__UCC__Concentrated Isolation for Container Networks Toward Application-aware Sandbox Tailoring]](source 新規) — [[Yuki Nakata]]・[[Katsuya Matsubara]]・[[Ryosuke Matsumoto (SAKURA internet)|Ryosuke Matsumoto]]。PaaS/FaaS コンテナ向けにネットワーク隔離に集中した Sandbox Tailoring を提案し、BitVisor ベースの Subaco を実装。runC と同等の起動時間を維持しつつ L2/L3/L4 のパケット偽装攻撃とネットワークリソース攻撃を防御。(paper / container / security / virtualization) - Concepts (新規): [[Sandbox Tailoring]]、[[コンテナネットワーク分離]]、[[Para-passthrough Hypervisor]] - Concepts (更新): [[コンテナ仮想化]] - Entities (新規): [[Yuki Nakata]]、[[Katsuya Matsubara]]、[[Ryosuke Matsumoto (SAKURA internet)|Ryosuke Matsumoto]]、[[Future University Hakodate]]、[[SAKURA internet Inc.]] ### 2026-07-04 ingest | Extending Applications Safely and Efficiently (OSDI'25) - [[@2025__OSDI__Extending Applications Safely and Efficiently]](source 新規) — [[Yusheng Zheng]]・[[Tong Yu]]・[[Yiwei Yang]]・[[Yanpeng Hu]]・[[Xiaozheng Lai]]・[[Dan Williams]]・[[Andi Quinn]]。Extension Interface Model([[EIM]])と [[bpftime]] により、ユーザ空間アプリケーション拡張を安全かつ効率的に行う枠組み。eBPF 互換性を保ちながら Nginx(2% オーバーヘッド)、Redis、FUSE、DeepFlow、sslsniff、Syscount で評価。(paper / operating-systems / ebpf / security / observability) - Concepts (新規): [[Extension Interface Model]] - Concepts (更新): [[eBPF]]、[[BPF]]、[[uprobe]] - Entities (新規): [[Yanpeng Hu]]、[[Xiaozheng Lai]]、[[Dan Williams]]、[[Andi Quinn]]、[[Redis]]、[[FUSE]]、[[OpenSSL]] - Entities (更新): [[Yusheng Zheng]]、[[Tong Yu]]、[[Yiwei Yang]]、[[bpftime]]、[[eunomia-bpf]]、[[DeepFlow]]、[[Nginx]] ### 2026-07-04 ingest | The GPU Observability Gap: Why We Need eBPF on GPU devices(eunomia.dev) - [[@2025__eunomia.dev__The GPU Observability Gap - Why We Need eBPF on GPU devices]](source 新規) — [[Yusheng Zheng]]・[[Tong Yu]]・[[Yiwei Yang]]([[eunomia-bpf]])。GPU 観測性ギャップを指摘し、[[bpftime]] による PTX/SPIR-V 注入で eBPF を GPU カーネル内で実行する技術を解説。CPU-GPU 境界ツール・ベンダープロファイラ・研究ツールの 3 類型の限界を整理した。(article / ebpf / gpu / observability) - Concepts (新規): [[eGPU]]、[[PTX 注入]] - Concepts/Entities (更新): [[GPU観測性]]、[[eBPF]]、[[bpftime]]、[[eunomia-bpf]]、[[Yusheng Zheng]]、[[Tong Yu]]、[[Yiwei Yang]] ### 2026-07-04 ingest | CUDA Events - eBPF-based CUDA API Tracing(eunomia.dev) - [[@2026__eunomia.dev__CUDA Events - eBPF-based CUDA API Tracing]](source 新規) — [[yunwei37]]、github-actions[bot]([[eunomia-bpf]])。`libcudart.so` への eBPF uprobe で CUDA API(`cudaMalloc`/`cudaMemcpy`/`cudaLaunchKernel` 等)をリアルタイムトレースするチュートリアル。ring buffer + libbpf 構成、CUDA API 呼び出しあたり約 2 µs のオーバーヘッド。GPU 内部計装には [[bpftime]]/eGPU への発展を示す。(article / ebpf / cuda / gpu-observability) - Concepts (新規): [[CUDA API トレース]]、[[CUDA]]、[[uprobe]] - Concepts/Entities (更新): [[eBPF]]、[[GPU観測性]]、[[動的計装]]、[[eunomia-bpf]]、[[bpftime]]、[[libbpf]]、[[NVIDIA]] - Entities (新規): [[yunwei37]] ### 2026-07-04 ingest | デジタルネイチャーの十年:計算的物質化から発酵する共在へ - [[@2026__note__デジタルネイチャーの十年 - 計算的物質化から発酵する共在へ]](source 新規) — [[落合陽一]]。[[計算機自然]]の十年を、計算的物質化、境界溶解、身体多様性、[[null2]] の公共空間化、生成AI以後の発酵する共在へ整理する note 論考。(article / philosophy-of-technology / media-art / ai-ethics) - Entities (新規): [[null2]], [[xDiversity]], [[Digital Nature Group]] - Concepts (新規): [[デジタル発酵]], [[デジタル蒸留]], [[Homo Convivium]], [[アクセシビリティ]] - Concepts/Entities (更新): [[計算機自然]], [[マタギドライヴ]], [[批判的デジタルネイチャー]], [[落合陽一]] ### 2026-07-04 ingest | 計算機自然からマタギドライヴへ - 自然の再審と脱人間知性的文明論の10年 - [[@2026__note__計算機自然からマタギドライヴへ - 自然の再審と脱人間知性的文明論の10年]](source 新規) — [[落合陽一]]。2015年の『魔法の世紀』から2026年の『マタギドライヴ』までの [[計算機自然]] を、自然概念の多言語的再審、Simondon 的トランスダクション、自己批判としての辺縁的実存へ整理する note 論考。(article / philosophy-of-technology / media-art) - Entities (新規): [[落合陽一]] - Concepts (新規): [[計算機自然]], [[マタギドライヴ]], [[批判的デジタルネイチャー]], [[主体なき美の美学]], [[ヌルのテトラレンマ]] ### 2026-07-03 ingest-paper | Artificial intelligence tools expand scientists' impact but contract science's focus (Nature 2026) - [[@2026__Nature__Artificial intelligence tools expand scientists' impact but contract science's focus]](source 新規) — [[Qianyue Hao]] ほか(清華大学 BNRist / [[James Evans]] シカゴ大学)。4,130 万件の自然科学論文を BERT 分類器(F1=0.875)でAI拡張研究に同定し、個人利益(3.02倍論文・4.84倍引用・1.37年早い PI 昇進)と集団的縮小(トピック多様性 4.63%減・研究者間交流 22%減)を実証した大規模計量書誌学研究。Nature 649, 1237–1243 (2026)。(paper / scientometrics / ai-impact) - Entities (新規): [[Qianyue Hao]], [[Fengli Xu]], [[Yong Li]], [[James Evans]] - Concepts (新規): [[AIと科学の集中化]] - Concepts (更新): [[AI研究自動化]](横断的知見に個人-集合パラドックスの観察を追記) ### 2026-07-02 ingest-paper | PLaMo 2 Technical Report (arXiv 2509.04897) - [[@2025__arXiv__PLaMo 2 Technical Report]](source 新規) — [[Preferred Networks]]。日本語重視 LLM 系列 [[PLaMo 2]] の技術報告。Samba ベース構成、合成日本語データ、重み再利用、31B→8B の構造化枝刈り・知識蒸留、32K 文脈対応 CPT、vLLM 推論最適化、INT4/FP8 量子化を報告。(paper / arxiv / llm / japanese) - Entities (新規): [[Preferred Networks]], [[PLaMo 2]] - Concepts (更新): [[ハイブリッドアテンションアーキテクチャ]], [[スライディングウィンドウアテンション]], [[状態空間モデル]], [[モデル圧縮]], [[LLM推論]] ### 2026-07-02 ingest-paper | XProf (MLSys 2026)(2026-07-31 論文 PDF により再取り込み) - [[@2026__MLSys2026__XProf - An Open, Scalable and Extensible Profiling System for the Modern ML Stack]](source 更新) — [[Robert Hundt]] ほか([[Google]]、一部 [[Meta]])。OpenXLA エコシステム ML プロファイラ。TraceMe 超低オーバーヘッド計装・GTC 精密クロッキング・MapReduce バックエンドで TPU 0.3% 未満オーバーヘッドを達成する一方、GPU H100 では 0.13%〜2.30% と非対称であることを実測。PJRT C API 拡張でハードウェア非依存設計。電力・熱ケーススタディ(温度変動 20°C→10°C)を定量化。(paper / ml-systems / profiling) - [[MLプロファイリング]](concept 更新) — 現代 ML スタックの性能計測・可視化。スケーラビリティ等 4 課題・TraceMe・Roofline 分析・多段可視化を核心とする。オーバーヘッドの TPU/GPU 非対称性を追記。 - [[Rooflineモデル]](concept 新規) — 演算上限と帯域幅上限の屋根線で compute-bound/memory-bound を判定する性能分析フレームワーク。 - Entities (新規): [[Robert Hundt]], [[OpenXLA]] - Entities (更新): [[Google]] — XProf 開発元として MLプロファイリングセクション追加。 ### 2026-07-02 ingest-paper | The Case for Learned Index Structures (arXiv 1712.01208) - [[@2017__arXiv__The Case for Learned Index Structures]](source 新規) — [[Tim Kraska]]・[[Alex Beutel]]・[[Ed H. Chi]]・[[Jeffrey Dean]]・[[Neoklis Polyzotis]]([[MIT]] / [[Google]])。索引を「キーから位置または存在を予測するモデル」として再解釈し、[[Learned Index]]、RMI、学習ハッシュ関数、学習 Bloom filter を提案。(paper / database / machine-learning) - [[Learned Index]](concept 新規) — 範囲索引を CDF 近似、点索引を CDF スケーリング、存在索引を分類器 + 漏れ受け用 Bloom filter として扱う learned data structures の入口。 - Entities (新規): [[Alex Beutel]], [[Ed H. Chi]], [[Neoklis Polyzotis]] - Entities (更新): [[Tim Kraska]], [[Jeffrey Dean]], [[Google]], [[MIT]] - Concepts (更新): [[B-Tree]] — B-Tree を CDF 近似モデルとして再解釈し、学習索引の補助構造/フォールバックとして位置づける横断的知見を追記。 ### 2026-07-02 ingest-paper | Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki (arXiv 2605.25480) - [[@2026__arXiv__Retrieval as Reasoning]](source 新規) — [[Haoliang Ming]] ほか(WeChat/Tencent)。Retrieval-as-Reasoning パラダイムを提唱・LLM-Wiki を実装。3 原則: Compilability・Composability・Evolvability。Error Book 自己修正機構。マルチホップ QA SOTA(LightRAG 比 +2.0〜+8.1 F1)。(paper / nlp / rag / agentic) - [[Retrieval-as-Reasoning]](concept 新規) — 検索=ルックアップを刷新したエージェントネイティブ検索パラダイム。推論と連動した反復的証拠収集。 - [[Haoliang Ming]](entity 新規) — WeChat/Tencent 研究者、LLM-Wiki 筆頭著者。 - [[LLM Wikiパターン]](concept 更新) — LLM-Wiki が Karpathy の抽象パターンの最初の操作的実装であることを横断的知見に追記。 - [[LLM向け情報検索]](concept 更新) — Retrieval-as-Reasoning が「知識組織化が生成品質を規定する」命題を実証した横断的知見を追記。 - [[Tencent]](entity 更新) — LLM-Wiki 論文を関連ソースに追記。 ### 2026-07-01 ingest | Modern Microprocessors: A 90-Minute Guide (Jason Patterson, lighterra.com) - [[Modern-Microprocessors-A-90-Minute-Guide|Modern Microprocessors: A 90-Minute Guide]](source 新規) — Jason Patterson。現代プロセッサ マイクロアーキテクチャの包括的解説。パイプライン・スーパースカラー・OOO・分岐予測・SMT・SIMD・キャッシュ・メモリウォール・チップレットを網羅。Intel/AMD/Apple M/ARM 最新数値付き。(web / computer-architecture) - Concepts (新規): [[パイプライン処理]], [[スーパースカラー実行]], [[分岐予測]], [[アウトオブオーダー実行]], [[VLIW]], [[同時マルチスレッディング]], [[SIMDベクトル処理]], [[メモリ階層とキャッシュ]], [[メモリウォール]], [[Brainiac設計]], [[チップレット]] - Entities (新規): [[AMD]] ### 2026-07-01 ingest-slides | The Un-Incident (Andreas Deuschl, SREcon25 EMEA, 2025) - [[@2025__SREcon25EMEA__The Un-Incident]](source 新規) — [[Andreas Deuschl]]([[Dynatrace]]、USENIX SREcon25 EMEA、2025-10-08、ダブリン)。潜在インシデントの 30〜60% が正式トラッキングを通過しないという実務推計から「アンインシデント」を定義し、No-CI / NOF / Near Miss / Fear Miss の 4 類型と Gray Zone Playbook を提示。(slides / sre / incident-management) - Concepts (新規): [[アンインシデント]] - Concepts (更新): [[インシデント管理]] - Entities (新規): [[Andreas Deuschl]], [[Dynatrace]] ### 2026-07-01 ingest-slides | Modernizing Incident Response with LLMs, RAG, and the MCP (Theofilos Papapanagiotou, SREcon25 EMEA, 2025) - [[@2025__SREcon25EMEA__Modernizing Incident Response with LLMs, RAG, and the MCP]](source 新規) — [[Theofilos Papapanagiotou]]([[Amazon]])、USENIX SREcon25 EMEA(2025-10-08、ダブリン)。[[Model Context Protocol]] による人間・エージェント共通ツールと [[RAGベースクラウド運用支援|RAG]] を組み合わせた障害対応刷新を報告。70ページ + YouTube Whisper 文字起こし。 - Entities (新規): [[Theofilos Papapanagiotou]]。Entities (更新): [[Amazon]], [[Model Context Protocol]] - Concepts (更新): [[agentic SRE]], [[RAGベースクラウド運用支援]] ### 2026-07-01 Tales from the VOID: The Scary Truth About Incident Metrics (SREcon22 Americas) ingest - [[@2022__SREcon22Americas__Tales from the VOID - The Scary Truth About Incident Metrics]](source 新規) — [[Courtney Nash]]([[Verica]])、USENIX SREcon22 Americas(2022-03-14)。VOID データベース(1,856 件・610 組織)の実分布を用いて MTTR・持続時間・RCA の統計的不堅牢性と認識論的問題を論証。ニアミス分析・SLO・調整コスト・テーマ/ナラティブへの転換を提案。29 スライド、transcript なし。(slides / sre / incident-management / metrics / postmortem) - Entities (更新): [[Courtney Nash]](発表追加), [[Verica]](VOID 詳細追記) - Concepts (更新): [[インシデントメトリクス]](VOID 実分布・持続時間と深刻度の無相関を横断的知見に追記), [[ポストモーテム]](ニアミス学習価値を追記) ### 2026-07-01 Incident Groundhog Day (SREcon24 EMEA, Hamed Silatani, Uptime Labs) ingest - [[@2024__SREcon24EMEA__Incident Groundhog Day]](source 新規) — [[Hamed Silatani]]([[Uptime Labs]]、USENIX SREcon24 EMEA、2024-10-30、ダブリン)。20名のインシデントマネージャーが同一ステージドワールドシミュレーション(Black Friday eコマース・APIキー障害)を個別体験した実験報告。13/20が25分以内に解決。解決時間は経験と相関せず、重大度議論に費やした時間が多いほど解決時間が短くなった。Solo Artist vs Band Member の行動パターン差、Allspaw の4カテゴリ(Diagnostic/Therapeutic/Recruiting/Status-Reporting)を実証。31フレーム、YouTube 自動字幕 transcript(1967行)付き。(video / sre / incident-management / incident-simulation) - Entities (新規): [[Hamed Silatani]], [[Uptime Labs]] - Concepts (新規): [[インシデントシミュレーション]] / (更新): [[インシデント重大度評価]](Silatani 実験から実証的補強を追記), [[Incident Commander]](Solo Artist vs Band Member を追記) ### 2026-07-01 Incident Management Metrics that Matter (SREcon25 Americas, Jamie Luck / Laura de Vesine) ingest - [[@2025__SREcon25Americas__Incident Management Metrics that Matter]](source 新規) — [[Jamie Luck]]・[[Laura de Vesine]]([[Datadog]])、USENIX SREcon25 Americas、2025-03-27、サンタクララ。MTTR など naive なメトリクスの統計的問題と逆インセンティブを体系的に論じ、「目標→指標」の 4 ステップサイクルと Datadog の 8 次元代替指標群を提案。ロールプレイ形式。49 スライド、スピーカーノート付き、transcript なし。(slides / sre / incident-management / metrics) - Entities (新規): [[Jamie Luck]] / (更新): [[Laura de Vesine]](役職更新・発表追加), [[Datadog]](発表追加) - Concepts (新規): [[インシデントメトリクス]] / (更新): [[インシデント管理]](横断的知見追記) ### 2026-07-01 From 4 Hours to 8 Minutes with AI Agents that Transform SRE Incident Response (SREcon25 EMEA) ingest - [[@2025__SREcon25EMEA__From 4 Hours to 8 Minutes with AI Agents that Transform SRE Incident Response]](source 新規) — [[Peter Jausovec]]([[Solo.io]])、USENIX SREcon25 EMEA(2025-10、ダブリン)。AIRE (AI Reliability Engineering) フレームワークと [[kagent]](Kubernetes ネイティブ・CNCF サンドボックス)を用いた SRE インシデント対応の自動化。エージェント構造(システムプロンプト+ツール+LLM)・エージェントループ・MCP・A2A プロトコル・能力4段階を解説。17スライド、transcript なし。(slides / sre / aiops / agent / mcp) - Entities (新規): [[Peter Jausovec]], [[Solo.io]], [[kagent]] - Concepts (更新): [[インシデントレスポンスAIレベル]], [[エージェントシステム運用]] ### 2026-07-01 Embracing the Multi-Party Dilemma: Incident Response Across Company Boundaries (SREcon23 EMEA) ingest - [[@2023__SREcon23EMEA__Embracing the Multi-Party Dilemma - Incident Response Across Company Boundaries]](source 新規) — [[Sarah Butt]]([[SentinelOne]])・[[Alex Elman]]([[Indeed]])、USENIX SREcon23 EMEA、2023-10、ダブリン。組織境界を越えたインシデント対応で生じる「Multi-Party Dilemma(多者間ジレンマ)」——情報・影響・時間的の3非対称性——を、Indeed の Learning from Incidents 実践(2021年テーマ分析)を出発点に体系化。ベンダーとの一過性組織(transient organization)・多中心的統治(polycentric governance)モデル、CDN ベンダーとの双方向情報共有によるリトライストーム回避事例を含む。20フレーム(7枚を目視確認)、whisper 自動文字起こし transcript(147行)付き。(video / sre / incident-response / resilience-engineering / human-factors) - Entities (新規): [[Alex Elman]], [[SentinelOne]] / (更新): [[Sarah Butt]], [[Indeed]], [[Laura Maguire]], [[David D. Woods]], [[John Allspaw]], [[Richard I. Cook]] - Concepts (新規): [[Multi-Party Dilemma]] ### 2026-07-01 An Organizational Response to Incidents (SREcon23 Americas) ingest - [[@2023__SREcon23Americas__An Organizational Response to Incidents]](source 新規) — Dr. [[Laura Maguire]]([[Jeli]]、USENIX SREcon23 Americas、2023-03-22、Santa Clara)。Incident Commander への組織的関心の集中を問い直し、対応の大半を担う「フォロワー」の働き——フォロワーシップ(Followship)——を、SNAFUcatchers・IBM・New Relic 等との共同研究知見から体系化。調整のパラドックス・DELEGATE/DELAY/DIMINISH/DROP戦略・フォロワーシップが見える8つの行動・Observe/Talk/Analyzeフレームワークを提示。101スライド、transcript なし。(slides / sre / incident-response / resilience-engineering / human-factors) - Entities (更新): [[Laura Maguire]], [[Jeli]] - Concepts (新規): [[Followship]] / (更新): [[Incident Commander]], [[Joint Activity]], [[Common Grounding]] ### 2026-07-01 Handover Communications in Software Operations: Findings from the Field (SREcon23 Americas) ingest - [[@2023__SREcon23Americas__Handover Communications in Software Operations - Findings from the Field]](source 新規) — [[Chad Todd]]([[CrowdStrike]]、[[Lund University]] 大学院で人的要因・安全科学を専攻、USENIX SREcon23 Americas、2023-03-21、サンフランシスコ)。半構造化インタビューによる質的研究で、CrowdStrike 社内の Network Operations Center・Customer Support Center を対象に、引き継ぎコミュニケーションがエンジニアの確信度に与える影響を Joint Activity・Common Ground・Adaptive Capacity の3概念で分析。6テーマを抽出。38スライド、Whisper transcript(335行)付き。(slides / human-factors / sre / incident-response) - Entities (新規): [[Chad Todd]], [[CrowdStrike]], [[Lund University]], [[David D. Woods]], [[Emily Patterson]], [[Gary Klein]] - Concepts (新規): [[Handover Communications]] / (更新): [[Joint Activity]], [[Common Grounding]], [[レジリエンスエンジニアリング]] ### 2026-07-01 When Systems Flatline—Enhancing Incident Response with Learnings from the Medical Field (SREcon21) ingest - [[@2021__SREcon21__When Systems Flatline - Enhancing Incident Response with Learnings from the Medical Field]](source 新規) — [[Sarah Butt]]([[Salesforce]] SRE、USENIX SREcon21、2021-10-14、バーチャル開催)。医療分野のアルゴリズム誘導意思決定(ACLS)・迅速安定化(ATLS)・標準化チェックリスト(WHO 手術チェックリスト)の3コンセプトを SRE インシデント対応に応用する提案。14スライド、音声書き起こし付き。(slides / sre / incident-management / medical-analogy) - Entities (新規): [[Sarah Butt]] / (更新): [[Salesforce]] - Concepts (更新): [[Incident Commander]](医療分野の標準化・チェックリスト文化との横断的知見3件、Warm Blanket Fallacy との層の違いの整理を追加) ### 2026-07-01 The Math behind the Incident Aftermath (SREcon22 APAC) ingest - [[@2022__SREcon22APAC__The Math behind the Incident Aftermath]](source 新規) — [[Ashish Patel]] / [[Sriram Srinivasan]]([[PayPal]] Site Reliability Platform Engineering / Technical Architect、SREcon22 APAC、2022-12-07、シドニー)。FCI(Failed Customer Interactions)によるインシデント顧客影響の定量測定。実例: Baseline 99.9990% vs 実測 Availability 99.6171%、FCI 33,322件。国・製品等5軸セグメンテーション。動画は要ログインのため未取得。34スライド。(slides / sre / incident-management / fci) - Entities (新規): [[Ashish Patel]], [[Sriram Srinivasan]], [[PayPal]] - Concepts (新規): [[インシデント影響測定]] ### 2026-07-01 Evolution of Incident Management at Slack (SREcon21) ingest - [[@2021__SREcon21__Evolution of Incident Management at Slack]](source 新規) — [[Brent Chapman]](Slack, Staff Engineer / Reliability Pillar、USENIX SREcon21、2021-10-14)。Google iMAG の設計者が Slack の 2018年 reliability crisis を機に Incident Management プログラムをゼロから構築し、Major IC が直面した7課題と解決策(Slack IC・Area Command・pillar別ローテーション等)、IC訓練率実績25%等を解説。41スライド、YouTube 音声 Whisper transcript(301行)付き。(slides / sre / incident-management) - Entities (新規): [[Brent Chapman]] / (更新): [[Slack Technologies]], [[PagerDuty]] - Concepts (更新): [[インシデント管理]](Response/Review/Analysis 3部構成をライフサイクルと対比)、[[Incident Commander]](Area Command・IC訓練率実績・no-give-backsハンドオフ等横断的知見4件) ### 2026-07-01 Incident Response in Unfamiliar Sociotechnical Systems (SREcon20 Americas) ingest - [[@2020__SREcon20Americas__Incident Response in Unfamiliar Sociotechnical Systems]](source 新規) — [[Morgan Collins]]([[Salesforce]] Principal SRE、SREcon20 Americas、2020-12-07〜09、バーチャル開催)。ICS の起源(FIRESCOPE)・民間企業向けに再編された ICS 組織図・COVID-19 下の組織間インシデント対応の課題・「Warm Blanket Fallacy」を提示。16スライド。transcript なし。(slides / sre / incident-management / incident-commander / ics) - Entities (新規): [[Morgan Collins]], [[Salesforce]] - Concepts (更新): [[Incident Commander]](Warm Blanket Fallacy・民間 ICS 再編構造・ICS 起源の contradiction 記録を追加) ### 2026-07-01 You Can't Stop Fires with an Ambulance (SREcon18 Asia) ingest - [[@2018__SREcon18Asia__You Can't Stop Fires with an Ambulance]](source 新規) — [[Piers Chamberlain]]([[Xero]] Head of Site Reliability Engineering、SREcon18 Asia/Australia、2018-06、シンガポール)。クラウド移行後のアラート倍増・インシデント増加への対応として、症状ベースアラート [[Klaxon]](顧客ページヒット率検知)・chatbot [[Multivac]](war room 代替)・運用衛生スコア [[Report Card]] を紹介。2年分の post-mortem を手動横断集計し `#release` が最大の contributing cause と発見。23スライド+transcript。(slides / sre / alert-management / incident-management) - Entities (新規): [[Piers Chamberlain]], [[Xero]], [[Klaxon]], [[Multivac]], [[Report Card]] - Concepts (更新): [[アラート管理]](Klaxon の顧客観測ベース安全網アラート・Ewaschuk 論文言及を追加)、[[クロスインシデント分析]](専任チームなしの単独手動集計を Granda 3要素との対比として追加) ### 2026-07-01 Fixing On-Call When Nobody Thinks It's (Too) Broken (SREcon19 Americas) ingest - [[@2019__SREcon19 Americas__Fixing On-Call When Nobody Thinks It's (Too) Broken]](source 新規) — [[Tony Lykke]]([[Hudson River Trading]] Trade Systems SRE、SREcon19 Americas、2019-03-25)。高urgencyページを6年間の71,317件(週平均201件)から4か月で1,015件(週平均56件)へ削減。最小限の技術フィルタ層+「9 Really Hard Steps」+git shortlogバイイン可視化。34スライド+YouTube自動字幕transcript。(slides / sre / alert-management / on-call) - Entities (新規): [[Tony Lykke]], [[Hudson River Trading]] - Concepts (更新): [[アラート疲労]](統合的アプローチの具体例、沈黙への不安という副作用の横断的知見2件・未解決の問い2件を追加) ### 2026-07-01 nrrd 911 ic me: The Incident Commander Role (SREcon16 Americas) ingest - [[@2016__SREcon16__nrrd 911 ic me - The Incident Commander Role]](source 新規) — [[Alice Goldfuss]]([[New Relic]] SRE、SREcon16 Americas、2016-03)。ICS の SRE 適応。IC/TL/CL の3役分離・Sev1 拡張(EC/LL)・重大度5段階・Hubot/Nrrd chatbot・全員訓練・3日→3時間 ROI。51スライド+Whisper transcript。(slides / sre / incident-management) - Entities (新規): [[Alice Goldfuss]] - Entities (更新): [[New Relic]](Alice Goldfuss と ICS 事例追加) - Concepts (更新): [[Incident Commander]](ICS 起源・役割構成・重大度表・横断的知見3件追加) ### 2026-07-01 Software Engineering (Boehm, IEEE-TC 1976) ingest - [[@1976__IEEE-TC__Software Engineering]](source 新規) — [[Barry W. Boehm]]([[TRW Systems and Energy Group]]、1976-12)。ソフトウェアエンジニアリングの古典的定義・ライフサイクルモデル・欠陥修正コスト比・保守コスト比・Area 1 vs Area 2 の二分類。(paper / software-engineering / classic) - Entities (新規): [[Barry W. Boehm]], [[TRW Systems and Energy Group]] - Concepts (新規): [[ソフトウェアライフサイクル]], [[ソフトウェア要件工学]], [[ソフトウェア保守]] ### 2026-07-01 Unified Theory of SRE (SREcon22 EMEA) ingest - [[@2022__SREcon22 EMEA__Unified Theory of SRE]](source 新規) — [[Emil Stolarsky]]([[Wave Mobile Money]]、SREcon22 EMEA、2022-10)。SRE Book が 2400+ インフラエンジニア規模の Google 固有文脈で書かれている事実と、スタートアップ(Default Dead)向けの SRE 再構築論。Boring Technology・FAANG 技術フロンティア格差を含む。48 スライド。(slides / sre / startup) - Entities (新規): [[Emil Stolarsky]] - Concepts (更新): [[SRE]](SRE Book の規模前提・スタートアップ SRE 再構築の横断的知見 4 項目追加) ### 2026-07-01 Notes from Production Engineering (SREcon15) ingest - [[@2015__SREcon15__Notes from Production Engineering]](source 新規) — [[Pedro Canahuati]](Facebook)。SREcon15、2015-03-13。Facebook が 2009〜2015 年に SRE 組織をゼロから再建した記録。SRO の創設/解散・FBAR・Cobalt・ODS・週次 SEV レビュー・FIX MORE WHINE LESS 文化。(video / sre / organization) - Entities (新規): [[Pedro Canahuati]] / [[Jay Parikh]] - Entities (更新): [[Facebook]](Production Engineering セクション追加) - Concepts (更新): [[SRE組織変革]](Facebook 5 段階変革の知見 5 項目追加)/ [[ポストモーテム]](Facebook SEV レビュー実践追加) ### 2026-06-30 Towards Intelligent Incident Management: Why We Need It and How We Make It (ESEC/FSE 2020) - [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]](source 新規) — [[Zhuangbin Chen]] / [[Qingwei Lin]] / [[Michael R. Lyu]] / [[Yingnong Dang]] / [[Dongmei Zhang]] ほか(Sun Yat-sen University / CUHK / Microsoft)。ESEC/FSE 2020。Microsoft 6 コアサービス 2 年超の実証研究。TTB ≈ TTM という依存性課題 + IcM BRAIN フレームワーク(LSTM/GRU/CNN/Random Forest)。TTD/TTE/TTM/TTB/TTF 全指標で p < 1e-10 改善。 - Source (新規): [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]] - Entities (更新): [[Zhuangbin Chen]] / [[Qingwei Lin]] - Concepts (更新): [[インシデント管理]] / [[AIOps]] / [[グレイ障害]] / [[サービス依存グラフ]] ### 2026-06-30 Software Analytics for Incident Management of Online Services: An Experience Report (ASE 2013) - [[@2013__ASE__Software Analytics for Incident Management of Online Services - An Experience Report]](source 新規) — [[Jian-Guang Lou]] / [[Qingwei Lin]] / [[Rui Ding]] / [[Qiang Fu]] / [[Dongmei Zhang]](Microsoft Research Asia) / [[Tao Xie]](UIUC)。ASE 2013 Experience Track。SAS 本番展開経験報告。CAR マイニング・FCA+DMI・ガウス異常・GVSM 治癒推薦の 4 技術。OCE 91% 利用・86% インシデント診断・76% 有用。 - Source (新規): [[@2013__ASE__Software Analytics for Incident Management of Online Services - An Experience Report]] - Entities (新規): [[Rui Ding]] / [[Qiang Fu]] / [[Tao Xie]] - Entities (更新): [[Jian-Guang Lou]] / [[Qingwei Lin]] / [[Dongmei Zhang]] - Concepts (更新): [[インシデント管理]] / [[ログベース障害診断]] ### 2026-06-30 ART: A Unified Unsupervised Framework for Incident Management in Microservice Systems (ASE 2024) - [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]](source 新規) — [[Yongqian Sun]] / [[Binpeng Shi]] / [[Mingyu Mao]] ほか([[Nankai University]] / [[Tsinghua University]], ASE 2024)。AD・FT・RCL を SSL 単一モデルで統一した教師なしインシデント管理フレームワーク。CHA(Transformer)→TEM(GRU)→CAL(GraphSAGE)の依存関係モデル化と ILD/SLD 偏差表現で 2 データセットにて監視あり手法を凌駕。 - Source (新規): [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]] - Entities (新規): [[Mingyu Mao]] - Entities (更新): [[Yongqian Sun]] / [[Binpeng Shi]] / [[Sibo Xia]] / [[Shenglin Zhang]] / [[Dan Pei]] / [[Minghua Ma]] - Concepts (更新): [[マルチモーダル障害診断]] / [[Fault Localization]] / [[AIOps]] ### 2026-06-30 Xpert: Empowering Incident Management with Query Recommendations via LLMs (ICSE 2024) - [[@2024__ICSE__Xpert - Empowering Incident Management with Query Recommendations via Large Language Models]](source 新規) — [[Yuxuan Jiang]] ほか 10 名([[University of Michigan]] / [[Microsoft]]、ICSE 2024)。LLM ICL + ベクター検索による KQL クエリ自動推薦。GPT-4 版が Identicality 35.46%(template)/29.18%(full)で全ベースラインを凌駕。本番 1 ヶ月パイロットで CodeT5+ を大幅超過。 - Source (新規): [[@2024__ICSE__Xpert - Empowering Incident Management with Query Recommendations via Large Language Models]] - Entities (新規): [[Zhihao Yang]] - Concepts (新規): [[DSLクエリ推薦]] - Concepts (更新): [[インシデント管理]] / [[LLMによる根本原因分析]] ### 2026-06-30 X-lifecycle Learning for Cloud Incident Management using LLMs (FSE 2024) - [[@2024__FSE__X-lifecycle Learning for Cloud Incident Management using LLMs]](source 新規) — [[Drishti Goel]] ほか([[Microsoft]]、FSE 2024 Companion)。SDLC 複数段階の X-lifecycle データ(サービス依存・機能説明)を LLM プロンプトに補完。InC DEP が BLEU +5〜38%・NUBIA +54.67%。モニタ SLO 分類も accuracy +4%。 - Entities (新規): [[Aditya Singh]] - Entities (更新): [[Drishti Goel]] / [[Fiza Husain]] / [[Anjaly Parayil]] / [[Supriyo Ghosh]] / [[Xuchao Zhang]] / [[Chetan Bansal]] / [[Saravan Rajmohan]] - Concepts (更新): [[インシデント管理]] / [[根本原因分析]] / [[クラウドモニタリング]] ### 2026-06-30 FaultProfIT: Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems (ICSE-SEIP 2024) - [[@2024__ICSE-SEIP__FaultProfIT - Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems]](source 新規) — [[Junjie Huang]] ほか 9 名([[The Chinese University of Hong Kong]] / [[Sun Yat-sen University]] / [[Huawei Cloud]]、ICSE-SEIP '24)。クラウドポストモーテムの障害パターンプロファイリングを初自動化。Graphormer + 階層誘導型対照学習で F1=78.3%。Huawei Cloud で 6 ヶ月本番稼働。 - Concepts (新規): [[障害パターンプロファイリング]] - Concepts (更新): [[ポストモーテム]] / [[障害傾向分析]] - Entities (更新): [[Junjie Huang]] / [[Michael R. Lyu]] / [[Zhuangbin Chen]] / [[Jinyang Liu]] / [[Yichen Li]] / [[Jiazhen Gu]] / [[Zhihan Jiang]] ### 2026-06-30 Fail through the Cracks: Cross-System Interaction Failures in Modern Cloud Systems (EuroSys 2023) - [[@2023__EuroSys__Fail through the Cracks - Cross-System Interaction Failures in Modern Cloud Systems]](source 新規) — [[Lilia Tang]]・[[Chaitanya Bhandari]] ほか([[University of Illinois Urbana-Champaign]] / [[Purdue University]], EuroSys '23)。CSI 障害(クロスシステムインタラクション障害)を初めて体系的に分析。クラウドインシデントの20%がCSI 障害起因であることを示し、3プレーン分類・根本原因パターン・修正パターンを明らかにした。 - Concepts (新規): [[クロスシステムインタラクション障害]] - Concepts (更新): [[分散システム障害]] / [[クラウドインシデント]] - Entities (新規): [[Lilia Tang]] / [[Chaitanya Bhandari]] / [[Indranil Gupta]] - Entities (更新): [[Tianyin Xu]] / [[Purdue University]] ### 2026-06-30 Metastable Failures in Distributed Systems (HotOS 2021) - [[@2021__HotOS__Metastable Failures in Distributed Systems]](source 新規) — [[Nathan Bronson]](Rockset、旧 Facebook)ほか([[The Pennsylvania State University]] / [[University of New Hampshire]], HotOS 2021)。分散システムのメタ安定障害を初めて体系化。Stable・Vulnerable・Metastable の 3 状態モデルと sustaining effect(持続効果)の概念を導入し、再試行・ルックアサイドキャッシュ・遅いエラー処理・リンク不均衡の 4 事例を分析。特性メトリクス・隠れキャパシティ・トリガー強度の研究課題を提示。 - Concepts (更新): [[メタ安定障害]](3 状態定義・横断的知見 4 件・未解決の問い 3 件追記) - Entities (新規): [[Nathan Bronson]] / [[Abutalib Aghayev]] / [[Aleksey Charapko]] / [[Timothy Zhu]] / [[Rockset]] / [[The Pennsylvania State University]] / [[University of New Hampshire]] ### 2026-06-30 Gray Failure: The Achilles' Heel of Cloud-Scale Systems (HotOS 2017) - [[@2017__HotOS__Gray Failure - The Achilles' Heel of Cloud-Scale Systems]](source 新規) — [[Peng Huang]] ほか([[Microsoft Research]] / [[Microsoft Azure]], HotOS 2017)。Azure 本番インシデントからグレイ障害(differential observability)を定式化した seminal paper。fail-stop 前提の障害検知機構が機能しない理由と解決方向を示す。 - Concepts (新規): [[差分可観測性]] - Concepts (更新): [[グレイ障害]](公式定義・横断的知見・問い追記) - Entities (新規): [[Jacob R. Lorch]] / [[Murali Chintalapati]] / [[Randolph Yao]] - Entities (更新): [[Peng Huang]] / [[Chuanxiong Guo]] / [[Lidong Zhou]] / [[Yingnong Dang]] / [[Johns Hopkins University]] ### 2026-06-30 mTCP: a Highly Scalable User-level TCP Stack for Multicore Systems (NSDI 2014) - [[@2014__NSDI__mTCP - a Highly Scalable User-level TCP Stack for Multicore Systems]](source 新規) — [[EunYoung Jeong]] ほか([[KAIST]] / Princeton University, NSDI 2014)。ユーザーレベルTCPスタック mTCP。パケットI/Oとソケットイベントの双方向バッチ統合で、8コアでLinux比25倍・MegaPipe比3倍のTCPトランザクション性能を達成。NSDI Community Award 受賞。 - Concepts (新規): [[ユーザーレベルTCPスタック]] - Entities (新規): [[EunYoung Jeong]], [[Dongsu Han]] - Entities (更新): [[KyoungSoo Park]], [[KAIST]] ### 2026-06-30 An Updated Performance Comparison of Virtual Machines and Linux Containers (ISPASS 2015) - [[@2015__ISPASS__An Updated Performance Comparison of Virtual Machines and Linux Containers]](source 新規) — Wes Felter ほか([[IBM Research]] Austin, ISPASS 2015, 2015)。Docker 1.0 と KVM を同一サーバで体系比較。コンテナはほぼ全ベンチマークで VM と同等以上。ランダム I/O は KVM が約 50% 低下、ネットワーク遅延は KVM が +30µs(+80%)。 - Concepts (新規): [[コンテナ仮想化]] - Entities (新規): [[Wes Felter]] - Entities (更新): [[Docker]], [[IBM Research]] ### 2026-06-30 Scaling Memcache at Facebook (NSDI 2013) - [[@2013__NSDI__Scaling Memcache at Facebook]](source 新規) — Rajesh Nishtala ほか 13 名(Facebook Inc., NSDI '13, 2013)。memcached を基盤に秒間数十億リクエスト・数兆アイテムを処理する分散キー値ストアを構築。リースメカニズム・Gutter プール・mcsqueal 無効化・Cold Cluster Warmup・細粒度ロック・適応型スラブアロケータを詳述。 - Concepts (新規): [[分散キャッシュ]] - Concepts (更新): [[一貫性ハッシュ法]], [[Incast]], [[結果整合性]] - Entities (新規): [[Rajesh Nishtala]] - Entities (更新): [[Facebook]] ### 2026-06-30 SSLShader: Cheap SSL Acceleration with Commodity Processors (NSDI 2011) - [[@2011__NSDI11__SSLShader - Cheap SSL Acceleration with Commodity Processors]](source 新規) — [[Keon Jang]]・[[Sangjin Han]]・[[Seungyeop Han]]・[[Sue Moon]]・[[KyoungSoo Park]](KAIST / UW、NSDI 2011)。コモディティ GPU で RSA を最速 CPU 比 22〜31 倍高速化し、AESNI+NUMA 活用の透過的 SSL プロキシ SSLShader を構築。29K TPS・13 Gbps を達成し高級アプライアンスに匹敵。 - Entities (新規): [[Keon Jang]], [[Sangjin Han]], [[Seungyeop Han]], [[Sue Moon]] - Entities (更新): [[KyoungSoo Park]], [[KAIST]] - Concepts (新規): [[SSL TLS アクセラレーション]] ### 2026-06-30 netmap: A Novel Framework for Fast Packet I/O (USENIX ATC '12) - [[@2012__USENIX-ATC__netmap A Novel Framework for Fast Packet IO]](source 新規) — [[Luigi Rizzo]](Università di Pisa、ATC '12 Best Paper、2012-06)。カーネル-ユーザー空間間の共有リングバッファ・プリアロケーション・バッチシステムコールで 14.88 Mpps(10 Gbit/s 線速)を達成。従来 socket API 比 20 倍。libpcap エミュレーション経由で既存アプリを改変なし 5 倍以上高速化。 - Concepts (新規): [[netmap]], [[カーネルバイパスネットワーキング]], [[ゼロコピーネットワーキング]] - Entities (新規): [[Luigi Rizzo]] ### 2026-06-30 Live Upgrading Thousands of Servers from an Ancient Red Hat Distribution to 10 Year Newer Debian Based One (LISA 2013) - [[@2013__LISA__Live Upgrading Thousands of Servers from an Ancient Red Hat Distribution to 10 Year Newer Debian Based One]](source 新規) — Marc Merlin(Google, LISA '13, 2013-11)。Red Hat 7.1 から Debian ベース ProdNG へ数千台のライブアップグレード経験報告。ファイルレベル同期・段階的 rpm→deb 移行・ELF バイナリパッチ・フラグデー回避。 - Concepts (新規): [[ファイルレベル同期]], [[ライブアップグレード]] - Entities (新規): [[Marc Merlin]], [[Richard Gooch]] - Entities (更新): [[Google]](インフラストラクチャ管理セクション追記) ### 2026-06-30 dsync: Efficient Block-wise Synchronization of Multi-Gigabyte Binary Data (LISA13) - [[@2013__LISA__dsync - Efficient Block-wise Synchronization of Multi-Gigabyte Binary Data]](source 新規) — [[Thomas Knauth]]・[[Christof Fetzer]]([[TU Dresden]])、LISA 2013、Best Paper。rsync の事後チェックサム計算をカーネル内ブロック追跡に置き換え、最大 100 倍の同期高速化を達成。 - Concepts (新規): [[ブロックレベル差分同期]] - Concepts (更新): [[ファイルレベル同期]](横断的知見追記) - Entities (新規): [[Thomas Knauth]] - Entities (更新): [[Christof Fetzer]]、[[TU Dresden]] ### 2026-06-30 Mackerelを支える時系列データベース技術(yuuk.io 2015) - [[@2015__yuuk.io__High-Performance-Graphite]](source 新規) — [[Yuuki Tsubouchi]](2015-04-30、2018-01-06 更新)。[[Mackerel]] の [[Graphite]] 時系列 DB 運用を公開。whisper の RRD 設計・carbon-cache の Twisted 2 スレッド上限・ページキャッシュ圧迫・consistent-hashing クラスタ進化を詳述。2018 年の [[HeteroTSDB]] 移行前夜の設計課題の一次記録。 - Entities (新規): [[Graphite]] - Entities (更新): [[Mackerel]](Graphite 時代セクション追記)、[[Yuuki Tsubouchi]](本ブログ記事追記) - Concepts (更新): [[時系列データベース]](RRD 設計・ページキャッシュ圧迫・多段シャーディングの知見追記) ### 2026-06-30 ウェブシステムの運用自律化に向けた構想 (yuuk.io 2017) - [[@2017__yuuk.io__ウェブシステムの運用自律化に向けた構想]](source 新規) — [[Yuuki Tsubouchi]](y_uuki、Hatena SRE、2017-12-02)。SRE を「信頼性を制約条件として費用を最小にする最適化問題」と定義し、観測・制御・実験の3軸で自律化を実現する [[Experimentable Infrastructure]] 構想を初提示。はてなシステム規模(サービス100+・ホスト1000+)と複雑性の3要因(ソフトウェア依存・分散システム・入力パターン)も開示。人工知能学会ウェブサイエンス研究会招待講演の内容を加筆修正。 - Concepts (新規): [[Experimentable Infrastructure]] - Entities (更新): [[Yuuki Tsubouchi]](2017年ブログ記事追記), [[Hatena]](自律運用構想追記) - Concepts (更新): [[SRE]](最適化問題定義・本ソース追記) ### 2026-06-30 Webシステムにおけるデータベース接続アーキテクチャ概論(yuuk.io 2015) - [[@2015__yuuk.io__architecture-of-database-connection]](source 新規) — [[Yuuki Tsubouchi]](y_uuki、2015-06-30)。WebアプリとRDBMSとのあいだの接続管理モデルを都度接続・常時接続・コネクションプーリングの3種に分類し、ドライバ型(HikariCP)とプロキシ型(PgBouncer・Pgpool)の設計判断と運用事情を解説。PostgreSQL=プロセスモデル・MySQL=スレッドモデルという接続設計の根本差異。 - Concepts (新規): [[データベース接続モデル]], [[コネクションプーリング]] - Entities (新規): [[PgBouncer]], [[Pgpool]] - Entities (更新): [[Yuuki Tsubouchi]](ブログ記事追記) ### 2026-06-30 2015年Webサーバアーキテクチャ序論 (yuuk.io 2015) - [[@2015__yuuk.io__2015年Webサーバアーキテクチャ序論]](source 新規) — [[Yuuki Tsubouchi]](y_uuki, blog.yuuk.io, 2015-05-28)。Web エンジニア初心者向けのアーキテクチャ解説。シリアル・プリフォーク・マルチスレッド・イベント駆動・ハイブリッドの 5 モデルを定義し、「息の長い技術を優先する」学習方針を提唱。 - Concepts (新規): [[Webサーバアーキテクチャ]] - Concepts (更新): [[C10K問題]](Webサーバ設計観点からの横断的知見追記), [[epoll]](Webサーバ設計観点からの横断的知見追記) - Entities (更新): [[Yuuki Tsubouchi]](本ブログ記事追記) ### 2026-06-30 Towards end-to-end automation of AI research (Nature 2026) - [[@2026__Nature__Towards end-to-end automation of AI research]](source 新規) — [[Chris Lu]]・[[Cong Lu]]・[[Robert Tjarko Lange]]・[[Yutaro Yamada]]ら([[Sakana AI]])。Nature Vol. 651 (2026-03-26)。The AI Scientist: AI研究のエンドツーエンド自動化パイプライン。生成論文がILCR 2025 ICBINBワークショップ査読(採択率70%)を通過した初事例。 - Entities (新規): [[Chris Lu]], [[Cong Lu]], [[Robert Tjarko Lange]], [[Yutaro Yamada]], [[Shengran Hu]], [[Jakob Foerster]], [[David Ha]], [[Jeff Clune]] - Entities (更新): [[Sakana AI]](The AI Scientist 追記) - Concepts (新規): [[AI研究自動化]], [[エージェント型科学探索]], [[自動査読]] ### 2026-06-30 An AI system to help scientists write expert-level empirical software (Nature 2026) - [[@2026__Nature__An AI system to help scientists write expert-level empirical software]](source 新規) — Eser Aygün* ほか(42 名、*equal contrib alphabetical)、責任著者: Shibl Mourad・[[Michael P. Brenner]]([[Google Research]] / [[Harvard University]])。Nature Vol. 654 (2026-05-19)。ERA: LLM + PUCT 木探索で科学ソフトウェアを自動生成。scRNA-seq 40 手法 / COVID-19 14 手法が人手最高水準を凌駕。arXiv:2509.06503v3。 - Entities (new): [[Michael P. Brenner]] - Entities (updated): [[DeepMind]], [[Google Research]] - Concepts (new): [[LLMドリブンコード探索]](LLM+PUCT木探索コード探索の中核概念), [[スコアリング可能タスク]](ERA の問題定式化) - Concepts (updated): [[コードLLM]](BoN vs 木探索の横断的知見追記) ### 2026-06-30 Practices for Making Alerts Actionable (SRE NEXT 2020) - [[@2020__SRENext2020__Practices for Making Alerts Actionable]](source 新規) — [[Sohei Iwahori]]([[GREE, Inc]]、SRE NEXT 2020、2020-01-25)。オンプレ→AWS 移行後の月300件超アラートを5本柱で削減した実践。振り分け3段階(Slack/JIRA/PagerDuty)・Alert Operator・SysLoad共通指標。41 スライド。 - Entities (updated): [[Sohei Iwahori]](SRE NEXT 2020 発表を追記、aliases 修正), [[GREE, Inc]](規模・監視スタック・改善実績を追記) - Concepts (updated): [[アクショナブルアラート]](振り分け3段階・自動復旧によるアクショナブル化経路の横断的知見追記), [[アラート疲労]](クラウド移行後のオンプレ由来アラート疲労・SRE Book Chapter 6 引用の横断的知見追記) ### 2026-06-30 Enabling Client-side SLO (SRE NEXT 2024) - [[@2024__SRENext2024__Enabling Client-side SLO]](source 新規) — [[Wataru Tsuda]](Luup Reliability Engineer、gr1m0h、SRE NEXT 2024、2024-08-04)。iOS/Android クライアントへの SLO 拡張——BLE 操作を含む CUJ 再設定・Datadog APM p75 Latency SLI・Time Slice SLO・Multi-tiered SLOs。41 スライド。 - Entities (更新): [[Wataru Tsuda]], [[Luup]] - Concepts (更新): [[SLI-SLO段階的導入]] ### 2026-06-30 電動マイクロモビリティのシェアサービス「LUUP」におけるEnabling SLOの実践 (SRE NEXT 2023) - [[@2023__SRENext2023__電動マイクロモビリティのシェアサービス「LUUP」におけるEnabling SLOの実践]](source 新規) — [[Wataru Tsuda]](Luup SRE、gr1m0h、SRE NEXT 2023、2023-09-29)。Enabling SLO(習熟度調査+勉強会)と IoT 向け CMC(Critical Machine Communication)概念による SLI 設計の実践。35 スライド。 - Entities (new): [[Wataru Tsuda]], [[Luup]] - Concepts (updated): [[サービスレベル目標]](CMC / IoT SLI 設計・Enabling SLO 組織パターンの横断的知見追記) ### 2026-06-30 プロダクトオーナーとしてSLOに向き合う 〜Mackerelチームの事例〜 (SRE NEXT 2023) - [[@2023__SRENext2023__プロダクトオーナーとしてSLOに向き合う 〜Mackerelチームの事例〜]](source 新規) — [[渡辺 起]](Hatena、SRE NEXT 2023、2023-09-29)。Mackerel チームの PO 視点 SLO 実践——「チームで判断を回す」を動機に仮値からスタートし Error Budget Policy を緩く始めた事例。39 スライド。 - Entities (new): [[渡辺 起]] - Entities (updated): [[Mackerel]](SLO 導入事例追記) - Concepts (updated): [[サービスレベル目標]](PO 視点・仮値スタート知見追記)/ [[エラーバジェット]](緩く始めるパターン知見追記) ### 2026-06-30 DO, RE, Me: Measuring the Effectiveness of Site Reliability Engineering (SREcon22 Americas) - [[@2022__SREcon22Americas__DO RE Me - Measuring the Effectiveness of Site Reliability Engineering]](source 新規) — [[Dave Stanke]](Google Cloud、SREcon22 Americas、2022-03-16)。DORA 2021 SRE 調査の知見:52% が SRE 実践・SRE はバーンアウト緩和・信頼性は force multiplier・SRE は DevOps の一部を実装。49 スライド。 - Entities (updated): [[Dave Stanke]] - Concepts (updated): [[DORA]] / [[SRE]] ### 2026-06-30 Is the S in SRE for "Security"? (SREcon25 Americas) - [[@2025__SREcon25Americas__Is the S in SRE for Security]](source 新規) — [[John Benninghoff]]([[Security Differently]]、SREcon25 Americas、2025-03)。Safety-II の正規分布モデルで「パフォーマンス向上 > 制約強化」を示し、DORA・Veracode・Sonatype の3データセットで SRE と セキュリティの連動を実証。29 スライド。 - Entities (new): [[John Benninghoff]] / [[Security Differently]] - Concepts (new): [[Safety-II]] / [[Security Level Objectives]] ### 2026-06-30 How to SRE When Everything is Already on Fire (SREcon19 EMEA) - [[@2019__SREcon19EMEA__How to SRE When Everything is Already on Fire]](source 新規) — [[Alex Hidalgo]]・[[Alex Lee]]([[Squarespace]] SRE、SREcon19 EMEA、2019-10)。ELK スタックを SRE 7 原則で転換した実録。SLO 定義翌日のエラーバジェット枯渇で「全力対処許可」、ICS 引き継ぎ実践、シャード数根本原因特定。105 スライド。transcript なし。 - Entities (new): [[Alex Hidalgo]] / [[Alex Lee]] - Entities (updated): [[Squarespace]] - Concepts (updated): [[アラート疲労]] / [[サービスレベル目標]] / [[エラーバジェット]] / [[ポストモーテム]] ### 2026-06-30 Beyond Sequential: A Recipe for Async Pipeline Observability and Alerting (SREcon25 Americas) - [[@2025__SREcon25Americas__Beyond Sequential - A Recipe for Async Pipeline Observability and Alerting]](source 新規) — [[Jash Mistry]]・[[Gabriela Medvetska]]([[eBay]] SRE、SREcon25 Americas、2025-03)。非同期パイプラインへの SLI/SLO 適用レシピ。可用性 SLI(SUCCESS/ABANDONED)・レイテンシ SLI(end-to-end histogram)・マルチウィンドウバーンレートアラート・SLO ダッシュボード・2 件のケーススタディ。50 スライド。YouTube 字幕 transcript 補完(機械精度)。 - Entities (new): [[Jash Mistry]] / [[Gabriela Medvetska]] - Entities (updated): [[eBay]] - Concepts (updated): [[サービスレベル目標]] / [[エラーバジェット]] / [[イベントベースSLO]] / [[アラート疲労]] ### 2026-06-30 Measuring Reliability: What Got Us Here Won't Get Us There (SREcon22 EMEA) - [[@2022__SREcon22EMEA__Measuring Reliability - What Got Us Here Won't Get Us There]](source 新規) — [[Štěpán Davidovič]]([[Google]] Senior Staff SRE、SREcon22 EMEA、2022-10-25)。SLI/SLO モデルの 3 限界(誤差マージン・線形性仮定・最良データでない)を提示し、オペレーショナリゼーション(問い→モデル→バックテスト)3 ステップを提唱。42 スライド。 - Entities (updated): [[Štěpán Davidovič]] - Concepts (updated): [[サービスレベル目標]] / [[エラーバジェット]] ### 2026-06-30 SLX: An Extended SLO Framework to Expedite Incident Recovery (SREcon21) - [[@2021__SREcon21__SLX - An Extended SLO Framework to Expedite Incident Recovery]](source 新規) — [[Qian Ding]]・[[Xuan Zhang (Ant Group)]]([[Ant Group]] Infra SRE、SREcon21、2021-10-13)。SLO に SLF(Service Level Factor)・SLD(Service Level Dependency)を追加し、SLX Graph で時系列相関のある異常 SLO 依存チェーンを自動絞り込む。GitOps(ArgoCD + Kubernetes)による宣言的 SLO 管理も実践報告。40 スライド。 - Entities (new): [[Qian Ding]] / [[Xuan Zhang (Ant Group)]] - Entities (updated): [[Ant Group]] - Concepts (updated): [[サービスレベル目標]] / [[異常検知]] ### 2026-06-30 Going from 30 to 30 Million SLOs (SREcon22 EMEA) - [[@2022__SREcon22EMEA__Going-from-30-to-30-Million-SLOs]](source 新規) — [[Alex Palcuie]]([[Google]] SRE、GCE Compute API、SREcon22 EMEA、2022-10)。GCE の SLO を 6 年で 30 個 → 約 1,000 個 → 3,000 万個(顧客単位)へ拡張した実践。レイテンシ SLO = fast requests / total requests トリック、Rachel Kroll "Your nines are not my nines" の動機、5 エラーのルール(少トラフィック顧客向け動的ターゲット設定)、per-project SLI/SLO 演算グラフを解説。28 スライド。 - Entities (new): [[Alex Palcuie]] - Concepts (updated): [[サービスレベル目標]] / [[SLI-SLO段階的導入]] ### 2026-06-30 Principled Performance Analytics (SREcon22 Americas) - [[@2022__SREcon22Americas__Principled Performance Analytics]](source 新規) — [[Narayan Desai]]・[[Brent Bryan]]([[Google]] Cloud SRE、SREcon22 Americas、2022-03-16)。SLO の根本的限界(エラー認識に依存し実現不可能)を論じ、代替として 2σ手法(ワークロードコホート+正規分布 z スコア)を提示。GCP Data Analytics での本番適用・18 時間先行障害検知を実証。40 スライド。(slides / sre / performance / stationarity) - Concepts (new): [[2σ手法]] - Concepts (updated): [[定常性モデル]] / [[サービスレベル目標]] - Entities (new): [[Brent Bryan]] - Entities (updated): [[Narayan Desai]] ### 2026-06-30 Beyond Goldilocks Reliability (SREcon21) - [[@2021__SREcon21__Beyond-Goldilocks-Reliability]](source 新規) — [[Narayan Desai]]([[Google]] Cloud SRE、SREcon21、2021-10-14)。Goldilocks Reliability の 4 荷重仮定を分析・批判し、定常性(Stationarity)モデルを代替提唱。可用性・パフォーマンス・正確性の 3 次元への定常性仮定付与と階層的診断による根本原因識別を Google 本番事例で示す。23 スライド。(slides / sre / reliability-modeling) - Concepts (new): [[定常性モデル]] - Entities (updated): [[Narayan Desai]] - Concepts (updated): [[SREの工学化]] ### 2026-06-30 Latency and Availability Error Budgets Done Right at Scale (SREcon20 Americas) - [[@2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale]](source 新規) — [[Fred Moyer]]([[Zendesk]]、SREcon20 Americas、2020-12-08)。SLI を `[Metric Identifier][Operator][Metric Value]`、SLO を `[Success Objective][SLI][Period]` の公式で機械解析可能に固定し、レイテンシ+可用性の OR 複合 SLI と単一 EB 管理を実践。マルチサービス構成での EB 伝播問題(依存先 1.0%+0.1% ER が上位層 1.2% ER に見える)を図示。37 スライド。(slides / sre / slo / error-budget) - Entities (new): [[Zendesk]] / Entities (updated): [[Fred Moyer]] - Concepts (updated): [[エラーバジェット]] / [[サービスレベル目標]] ### 2026-06-30 Avoiding Goodhart's Law: Use SLO's as Tools Not Cudgels (SREcon20 Americas) - [[@2020__SREcon20Americas__Avoiding Goodhart's Law]](source 新規) — [[Marco Coulter]]([[AppDynamics]]、SREcon20 Americas、2020-12-07)。グッドハートの法則の SRE 文脈応用。HL7 医療ラボシステム事例でゲーミングを示し、Code・Infrastructure・CX の 3 次元 SLI/SLO/SLA フレームワーク、パフォーマンスカーブ SLO(多段パーセンタイル)、行動ベース CX SLI(再試行パターン)、反復的 SLO 交渉プロセスを提案。35 スライド。(slides / sre / slo / goodharts-law) - Entities (new): [[Marco Coulter]] / [[AppDynamics]] - Concepts (updated): [[グッドハートの法則]] / [[サービスレベル目標]] / [[SLI-SLO段階的導入]] ### 2026-06-30 The Map Is Not the Territory: How SLOs Lead Us Astray (SREcon19 EMEA) - [[@2019__SREcon19EMEA__The Map Is Not the Territory - How SLOs Lead Us Astray, and What We Can Do about It]](source 新規) — [[Narayan Desai]]([[Google]] SRE、SREcon19 EMEA、2019-10-03)。SLO の 4 ユースケース分類(Ongoing/Design/Incident Response/Bounding the Tail)と各ユースケースの問題・ベストプラクティスを論じた 45 分動画。テール管理への SLO 不適用論(サンドバッギング問題)と SLO Algebra の未解決問題を提起。(video / sre / slo / srecon) - Entities (new): [[Narayan Desai]] - Concepts (updated): [[サービスレベル目標]] / [[エラーバジェット]] ### 2026-06-29 SLOs for Data-Intensive Services (SREcon19 EMEA) - [[@2019__SREcon19EMEA__SLOs for Data-Intensive Services]](source 新規) — [[Yoann Fouquet]]([[Booking.com]] SRE、SREcon19 EMEA、2019-10-02)。可用性・レイテンシだけでは検索サービスのステークホルダーが無関心であることを起点に、一貫性(99.99%)・新鮮性(99.9%/xx秒)・完全性・耐久性のデータ品質 SLO を定義したプロセス。プローブ・内部比較・クエリバケット(手動→自動)を経て自動緩和・自動修復を実現。最大の恩恵は Awareness と Confidence。29 スライド。(slides / sre / slo / data-quality) - Entities (new): [[Yoann Fouquet]] / Entities (updated): [[Booking.com]] - Concepts (new): [[データ品質SLO]] / Concepts (updated): [[サービスレベル目標]] / [[SLI-SLO段階的導入]] ### 2026-06-29 Latency SLOs Done Right (SREcon19 Americas) - [[@2019__SREcon19 Americas__Latency SLOs Done Right]](source 新規) — [[Fred Moyer]]([[Circonus]] Developer Evangelist、SREcon19 Americas、2019-03-27)。パーセンタイル平均化の誤り(~200% 誤差)・ログ/カウンタ/ヒストグラムの 3 手法・libcircllhist のマージ可能ログリニアヒストグラム推奨。50 スライド。(slides / sre / slo / observability) - Entities (new): [[Fred Moyer]] / Entities (updated): [[Circonus]] - Concepts (updated): [[サービスレベル目標]] / [[ヒストグラムメトリクス]] ### 2026-06-29 How Atlassian Is Tackling Error Budgets, Agile Style (SREcon18 Asia) - [[@2018__SREcon18Asia__How Atlassian Is Tackling Error Budgets, Agile Style]](source 新規) — [[Gui Vieiro]]([[Atlassian]] SRE Team Lead、SREcon18 Asia、2018-06-06)。エラーバジェットのアジャイル段階的導入事例。Error Budgets 0.1・13週中7週トリガー・週次可視化・ブログ公開・Not So Good Result の透明化・SLO 達成率回復(Jul-Sep 下降→Oct 以降 85-100%)。47 スライド。(slides / sre / error-budget) - Entities (new): [[Gui Vieiro]] / [[Atlassian]] - Concepts (updated): [[エラーバジェット]](アジャイル導入・可視化・Not So Good Result の透明化 を横断的知見に追記) ### 2026-06-29 SLOs and SLIs in the Real World: A Deep Dive (SREcon18 Europe/EMEA) - [[@2018__SREcon18Europe__SLOs and SLIs in the Real World - A Deep Dive]](source 新規) — [[Elisa Binette]]・[[Matthew Flaming]]([[New Relic]]、SREcon18 Europe/EMEA、2018-08-30)。Americas 版の再演。ケイパビリティ駆動 SLI/SLO 7 ステップ・ハードシャード per-shard SLO・複合 SLO・インフラ SLO・UI SLI・dumb SLI・10 takeaway。音声収録あり。(slides / sre / slo) - Entities (updated): [[Matthew Flaming]] / [[Elisa Binette]](EMEA 版ソース追加) - Concepts (updated): [[サービスレベル目標]](EMEA ソース追加) ### 2026-06-29 SLOs and SLIs in the Real World: A Deep Dive (SREcon18 Americas) - [[@2018__SREcon18Americas__SLOs and SLIs in the Real World - A Deep Dive]](source 新規) — [[Elisa Binette]]・[[Matthew Flaming]]([[New Relic]]、SREcon18 Americas、2018-03-28)。ケイパビリティ駆動 SLI/SLO 定義 7 ステップ・ハードシャード per-shard SLO・複合 SLO・インフラ SLO 設計・全体 dumb SLI・10 の takeaway。(slides / sre / slo) - Entities (new): [[Matthew Flaming]] / [[Elisa Binette]] / [[New Relic]] - Concepts (updated): [[サービスレベル目標]](横断的知見 4 項目・未解決の問い 4 項目追加) ### 2026-06-29 Error Budgets and Risks (SREcon15, 2015) - [[@2015__SREcon15__Error Budgets and Risks]](source 新規) — [[Marc Alvidrez]]([[Google]] Senior Staff SRE、SREcon15、2015-03-16)。エラーバジェットフレームワークの起源と実践。SLA はミニマムかつマクシマム・リクエスト成功率による可用性計算・1% クラスターによるリスク境界化・エラーバジェット = 可用性 − SLA ターゲット。Whisper transcript 付き。(slides / sre / error-budget) - Entities (new): [[Marc Alvidrez]] - Concepts (updated): [[エラーバジェット]](起源・1% 問題・権利でなく獲得するもの、を横断的知見に追記) ### 2026-06-29 Effective Harnesses for Long-Running Agents (Anthropic Engineering Blog 2025) - [[@2025__Anthropic Engineering Blog__Effective Harnesses for Long-Running Agents]](source 新規) — [[Justin Young]] ほか([[Anthropic]]、2025-11-26)。長時間エージェントが複数コンテキストウィンドウにまたがって安定動作するハーネス設計。Initializer + Coding の 2 役分離、JSON フィーチャーリスト、Puppeteer MCP E2E テスト。(article / agent / harness / software-engineering) - Concepts (new): [[マルチコンテキストウィンドウエージェント]] - Concepts (updated): [[Harness Engineering]], [[ループエンジニアリング]] - Entities (new): [[Justin Young]] ### 2026-06-29 Harness Design for Long-Running Application Development (Anthropic Engineering Blog 2026) - [[@2026__Anthropic Engineering Blog__Harness Design for Long-Running Application Development]](source 新規) — [[Prithvi Rajasekaran]]([[Anthropic]] Labs、2026-03-24)。自己評価バイアス・コンテキスト不安・コヒーレンス喪失に対応する発展的ハーネス設計。GAN 着想のジェネレータ・エバリュエータ分離、Planner + Generator + Evaluator 3 役構成、荷重仮定(Load-Bearing Assumptions)。Solo vs フルハーネス比較(20 分/$9 vs 6 時間/$200)。(article / agent / harness / software-engineering) - Concepts (updated): [[マルチコンテキストウィンドウエージェント]], [[Harness Engineering]], [[ループエンジニアリング]] - Entities (updated): [[Prithvi Rajasekaran]] ### 2026-06-29 Harness Engineering: leveraging Codex in an agent-first world (OpenAI 2026) - [[OpenAI-Harness-Engineering]](source 新規) — [[OpenAI]](2026-02-11)。3 名のエンジニアが Codex で 5 ヶ月・手書き 0 行で 100 万行の本番コード生成。AGENTS.md 縮小・機械的依存関係強制・フィードバックループ・GC タスクからなる「ハーネス」概念を提唱。(article / agent / codex / software-engineering) - Entities (new): [[Symphony]] - Concepts (new): [[Harness Engineering]] - Entities (updated): [[OpenAI]] (Harness Engineering・Codex セクション追記) ### 2026-06-29 Memory in the Age of AI Agents (arXiv 2025) - [[@2025__arXiv__Memory in the Age of AI Agents]](source 新規) — [[Yuyang Hu]] ほか 47 名([[National University of Singapore]] 等、2025-12-18)。LLM ベースエージェントのメモリシステムを形態(Forms)・機能(Functions)・動態(Dynamics)の 3 軸で統一分類する 107 ページのサーベイ。300 以上の文献を体系化し、生成的メモリ・RL 統合・マルチモーダルメモリ等 7 フロンティアを提示。(paper / agent-memory / llm / survey) - Concepts (new): [[エージェントメモリ]] - Concepts (updated): [[コンテキストエンジニアリング]] - Entities (new): [[Yuyang Hu]], [[MemGPT]], [[Mem0]] - Entities (updated): [[National University of Singapore]] ### 2026-06-29 VictoriaMetrics vs Prometheus (Jorijn Blog ~2025) - [[@2025__Jorijn-Blog__VictoriaMetrics vs Prometheus]](source 新規) — [[Jorijn Schrijvershof]](オランダのDevOpsコンサルタント、jorijn.com)。実務家視点でVictoriaMetricsとPrometheusを比較。新規スタックではVictoriaMetricsをデフォルト推奨(RAM約1/3、グレースフルデグラデーション、HA構成の単純さ)。Prometheusは既存安定スタック・CNCF統治要件・PromQL移植性が必須の場合に正当化。MetricsQLは74%PromQL互換(PromLabs評価)。(article / sre / monitoring / victoriametrics / prometheus) - Concepts (new): [[MetricsQL]] - Entities (new): [[Jorijn Schrijvershof]], [[PromLabs]] - Entities (updated): [[VictoriaMetrics]], [[Prometheus]] ### 2026-06-30 Who owns the Service Level? (SRE NEXT 2022) - [[@2022__SRENext2022__Who owns the Service Level?]](source 新規) — [[近藤武士]]([[Recruit]]、SRE NEXT 2022、2022-05-15)。スタディサプリでの SLO 導入と Error Budget Policy 行動定着の失敗——非機能要求への予算・権限不足が原因——と、技術戦略グループ発足(1:1:1 予算)による解決。79 スライド。(slides / sre / slo / sre-next) - Entities (new): [[近藤武士]], [[Recruit]], [[スタディサプリ]] - Concepts (updated): [[サービスレベル目標]], [[エラーバジェット]] ### 2026-06-29 How We Foster "Reliability" in Diversity (SRE NEXT 2022) - [[@2022__SRE NEXT__How We Foster Reliability in Diversity]](source 新規) — [[Narimichi Takamura]]([[Topotal]]、SRE NEXT 2022、2022-05-14)。組織の多様性に応じた SRE の育て方。5ステップ・氷山モデル(Level 1/2/3)・MVV 策定・ダイナミックケイパビリティ(Sensing/Seizing/Transforming)・組織の信頼性マインドセット 5フェーズ。50 スライド。(slides / sre / organization) - Concepts (new): [[ダイナミックケイパビリティ]], [[組織の信頼性マインドセット]] - Concepts (updated): [[SRE組織変革]] - Entities (updated): [[Narimichi Takamura]], [[Topotal]] ### 2026-06-29 小さくはじめるSLI/SLO ~育てながら組織に定着させる実践知~ (Road to SRE NEXT 2026 @神戸) - [[@2026__Road to SRE NEXT 2026 神戸__小さくはじめるSLI-SLO 育てながら組織に定着させる実践知]](source 新規) — [[Narimichi Takamura]]([[Topotal]]、2026-06-15)。SLI/SLO 導入の 3 つの難点(定義・運用・定着)と、SRE 4 ステップ導入法を援用した段階的フレームワーク・SLO 違反ポリシー 5 段階拡大・成熟度モデル(3 軸 × 5 段階)。48 スライド。(slides / sre / slo) - Concepts (new): [[SLI-SLO段階的導入]] - Concepts (updated): [[サービスレベル目標]], [[エラーバジェット]] - Entities (updated): [[Narimichi Takamura]], [[Topotal]] ### 2026-06-29 Rethinking Incident Response: Context-Aware AI in Practice (SRE NEXT 2025) - [[@2025__SRE NEXT 2025__Rethinking Incident Response - Context-Aware AI in Practice]](source 新規) — [[Ryota Yoshikawa]]([[Topotal]]、SRE NEXT 2025、2025-08-19)。SAE 自動運転レベル対応の IR0〜IR5 フレームワーク提唱。MCP + Coding Agent により IR2〜IR3 が現実的になった現状と、Waroom MCP を用いた IR2+ デモ(Sentry→Claude→GitHub→クローズ)を示す。OpenRCA(11%) / AIOpsLab(RCA 14%)から RCA・緩和は研究段階。(slides / sre / incident-response / aiops) - Concepts (new): [[インシデントレスポンスAIレベル]] - Concepts (updated): [[インシデント管理]], [[AIOps]] - Entities (updated): [[Ryota Yoshikawa]], [[Waroom]] ### 2026-06-29 組織的なインシデント対応を目指して / SRE NEXT 2024 - [[@2024__SRE NEXT 2024__組織的なインシデント対応を目指して]](source 新規) — [[Narimichi Takamura]]([[Topotal]]、SRE NEXT 2024、2024-08-03)。インシデントレスポンス改善の3難点を整理し、Google SRE の信頼性マインドセットをベースとした[[インシデント対応成熟度モデル]](Pre-Incident/Response/Post-Incident の3フェーズ×9プロセス×Absent/Reactive/Proactive/Strategic の4段階)を提案。評価ステップ・フェーズマイグレーション手順・モデル活用上の注意を含む。(slides / sre / incident-management / maturity-model) - Concepts (new): [[インシデント対応成熟度モデル]] - Entities (updated): [[Narimichi Takamura]], [[Topotal]], [[SRE NEXT]] - Concepts (updated): [[インシデント管理]], [[Incident Commander]] ### 2026-06-29 CoT Monitoring: Where Does a Hot Safety Problem Come From? (SAIL Blog 2026) - [[@2026__SAILBlog__CoT-Monitoring-Where-Does-a-Hot-Safety-Problem-Come-From]](source 新規) — [[Peter Hase]]・[[Christopher Potts]]([[Stanford University]]、SAIL Blog、2026-06-18)。CoT モニタリングが 2023–2026 年に急浮上した知的系譜を解説。監視フレームワーク(Hendrycks 2021)と CoT を説明可能性面とする NLP 研究(Ling 2017 / Camburu 2018)の 2 系譜収束。Naihin et al. 2023 → OpenAI o1(2024-09)→ Baker et al. 2025 の 18 ヶ月空白タイムライン。(article / ai-safety / llm / interpretability) - Entities (new): [[Peter Hase]], [[Christopher Potts]] - Entities (updated): [[Dan Hendrycks]] - Concepts (new): [[CoTモニタリング]] - Concepts (updated): [[Chain-of-Thought Prompting]] ### 2026-06-29 On-demand Container Loading in AWS Lambda (USENIX ATC 2023) - [[@2023__ATC__On-demand Container Loading in AWS Lambda]](source 新規) — [[Marc Brooker]] ほか([[Amazon Web Services]])。USENIX ATC 2023 Best Paper Award。AWS Lambda がコンテナイメージ(最大 10GiB)をコールドスタートレイテンシを悪化させずに毎秒 15,000 コンテナ起動する仕組み。決定論的フラット化・収束暗号化・3 階層キャッシュ・4-of-5 イレイジャーコーディングの組み合わせ。(paper / serverless / distributed-systems / cloud) - Entities (new): [[Marc Brooker]], [[AWS Lambda]], [[Firecracker]] - Concepts (new): [[コンテナ起動高速化]], [[収束暗号化]], [[イレイジャーコーディング]], [[メタ安定障害]] ### 2026-06-29 Project Silica: Towards Sustainable Cloud Archival Storage in Glass (SOSP 2023) - [[@2023__SOSP__Project Silica - Towards Sustainable Cloud Archival Storage in Glass]](source 新規) — [[Antony Rowstron]] ほか 57 名([[Microsoft]])。SOSP 2023。溶融石英ガラス媒体を基盤とした初のクラウドアーカイバルストレージシステム。フェムト秒レーザー書き込み + 偏光顕微鏡読み出し + ML デコーダ。1000 年超耐久・ビット腐敗なし・スクラビング不要。論理パーティション分割シャトル管理で SLO 内処理を実証。(paper / storage / cloud / systems / sustainability) - Entities (new): [[Antony Rowstron]], [[Project Silica]] - Concepts (new): [[アーカイバルストレージ]], [[ガラスストレージ]], [[ネットワーク符号化]] ### 2026-06-29 In Search of an Understandable Consensus Algorithm (USENIX ATC 2014) - [[@2014__ATC__In Search of an Understandable Consensus Algorithm]](source 新規) — [[Diego Ongaro]]・[[John Ousterhout]]([[Stanford University]])。USENIX ATC 2014 Best Paper Award。理解しやすさを第一設計目標とした Raft 合意アルゴリズム。multi-Paxos 等価。(paper / distributed / consensus) - Entities (new): [[Diego Ongaro]], [[John Ousterhout]] - Concepts (new): [[分散コンセンサス]], [[複製ステートマシン]], [[リーダー選出]] - Concepts (updated): [[分散コンセンサス回避]] ### 2026-06-28 CockroachDB: The Resilient Geo-Distributed SQL Database (SIGMOD 2020) - [[@2020__SIGMOD__CockroachDB - The Resilient Geo-Distributed SQL Database]](source 新規) — [[Rebecca Taft]] ほか([[Cockroach Labs]])。SIGMOD 2020。地理分散 SQL DBMS の設計。MVCC + Read Refresh + Parallel Commits + HLC で直列化可能分離を汎用クラウドサーバーで実現。TPC-C 100,000 ウェアハウス 98.8% 効率。(paper / database / distributed / sql / oltp) - Entities (new): [[CockroachDB]], [[Cockroach Labs]], [[Rebecca Taft]] - Entities (updated): [[Spanner]] - Concepts (new): [[地理分散SQLデータベース]], [[ハイブリッド論理クロック]] - Concepts (updated): [[分散トランザクション]], [[外部一貫性]] ### 2026-06-29 Data Center Networking 基盤論文 5 本一括取り込み - [[@2008__SIGCOMM__A Scalable Commodity Data Center Network Architecture]](source 新規) — [[Mohammad Al-Fares]] ほか(UCSD、SIGCOMM 2008)。k-ary Fat-Tree トポロジで安価な商用スイッチのみから full bisection bandwidth を実現。27,648 ホスト・従来比 77% コスト削減。(paper / networking / datacenter) - [[@2009__SIGCOMM__VL2 - A Scalable and Flexible Data Center Network]](source 新規) — [[Albert Greenberg]] ほか(Microsoft Research、SIGCOMM 2009)。Clos トポロジと Valiant Load Balancing で uniform high capacity。IP-in-IP カプセル化とディレクトリサービスでネットワーク仮想化。(paper / networking / datacenter) - [[@2010__NSDI__Hedera - Dynamic Flow Scheduling for Data Center Networks]](source 新規) — [[Mohammad Al-Fares]] ほか(NSDI 2010)。ECMP のハッシュ衝突によるエレファントフロー帯域損失を動的フロースケジューリングで解決。最適比 96% の二分帯域幅達成。(paper / networking / datacenter) - [[@2009__SIGCOMM__PortLand - A Scalable Fault-Tolerant Layer 2 Data Center Network Fabric]](source 新規) — [[Radhika Niranjan Mysore]] ほか(SIGCOMM 2009)。PMAC とファブリックマネージャで L2 セマンティクスを維持しつつスケーラブルなファブリック。65ms 障害収束。(paper / networking / datacenter) - [[@2010__SIGCOMM__Data Center TCP (DCTCP)]](source 新規) — [[Mohammad Alizadeh]] ほか(SIGCOMM 2010)。ECN マーキング割合から輻輳度を推定し段階的ウィンドウ調整。Incast・キュー蓄積・バッファ圧迫を同時解決。(paper / networking / datacenter / congestion-control) - Entities (new): [[Mohammad Al-Fares]], [[Amin Vahdat]], [[Albert Greenberg]], [[Mohammad Alizadeh]], [[Radhika Niranjan Mysore]], [[Barath Raghavan]], [[Sivasankar Radhakrishnan]], [[VL2]] - Entities (updated): [[James Hamilton]] - Concepts (new): [[データセンターネットワークトポロジ]], [[ECMP]], [[Valiant Load Balancing]], [[フロースケジューリング]], [[データセンターL2ファブリック]], [[Incast]] - Concepts (updated): [[データセンター輻輳制御]], [[負荷分散]], [[マルチプレーンClosトポロジ]], [[AIデータセンタートポロジ]], [[データセンターネットワーク信頼性]] ### 2026-06-28 Amazon Aurora: On Avoiding Distributed Consensus for I/Os, Commits, and Membership Changes (SIGMOD 2018) - [[@2018__SIGMOD__Amazon Aurora - On Avoiding Distributed Consensus for I Os, Commits, and Membership Changes]](source 新規) — [[Alexandre Verbitski]] ほか([[Amazon Web Services]])。SIGMOD 2018 Industry Track。Aurora 2017 論文の続編。SCL/PGCL/VCL/VDL 一貫性ポイント階層・単一セグメント直接読み(クォーラム増幅回避)・クォーラムセット + エポックによる非ブロッキックメンバーシップ変更・フル/テールセグメント非対称設計(約 3× コスト)の 4 貢献。(paper / database / distributed / cloud) - [[分散コンセンサス回避]](concept 新規) — 2PC/Paxos を使わずに書き込みコミット・読み込み・メンバーシップ変更を達成する設計アプローチ。Aurora の SCL/PGCL/VCL 階層・クォーラムセット・エポックを核として整理。(distributed / database) - [[クォーラムベースレプリケーション]](concept 更新) — クォーラムセット + エポック・フル/テール非対称設計を追記。 - [[クラッシュリカバリ]](concept 更新) — エポックフェンシング・Undo 並行実行を追記。 - [[Write-Ahead Logging (WAL)]](concept 更新) — 分散 LSN 一貫性ポイント階層・VDL/MTR 原子性保証を追記。 - [[Alexandre Verbitski]](entity 更新) — 2018 論文を追加。 - [[Amazon Aurora (Database)]](entity 更新) — 2018 論文とコンセンサス回避メカニズムへの言及を追加。 ### 2026-06-28 F1: A Distributed SQL Database That Scales (VLDB 2013) - [[@2013__VLDB__F1 - A Distributed SQL Database That Scales]](source 新規) — [[Jeff Shute]] ほか([[Google]])。VLDB 2013 / PVLDB Vol.6 No.11、pp.1068–1079。Spanner 上に構築した分散 OLTP/OLAP SQL DB。AdWords 基盤。100 TB 超・5 ナイン可用性・フル SQL を両立。階層スキーマ・楽観的/悲観的/スナップショット 3 種トランザクション・非ブロッキングスキーマ変更・変更履歴ファーストクラス機能・ハッシュ分散 SQL エンジンが特徴。(paper / distributed / database / sql) - [[Jeff Shute]](entity 新規) — Google エンジニア。F1 論文筆頭著者。(person / database) - [[分散SQLデータベース]](concept 新規) — スケール・可用性・強一貫性・SQL の 4 要件を同時に満たす分散 DB の設計原則。F1 と Spanner の 2 ソースを横断。(database / distributed) - [[分散トランザクション]](concept 更新) — 楽観的 vs 悲観的の条件分岐・2PC 参加者数の実用上限・グローバルインデックス一貫性コストを横断的知見に追記。 - [[Google]](entity 更新) — Spanner・F1 の分散データベース基盤を追記。 ### 2026-06-28 Amazon MemoryDB: A Fast and Durable Memory-First Cloud Database (SIGMOD 2024) - [[@2024__SIGMOD__Amazon MemoryDB - A Fast and Durable Memory-First Cloud Database]](source 新規) — [[Yacine Taleb]] ほか([[Amazon Web Services]])。SIGMOD-Companion 2024。Redis API 完全互換・11 9s 耐久性のインメモリクラウド DB。耐久性をマルチ AZ トランザクションログへ分離し、書き込み後ろロギング・オフボックススナップショット・ログベースリーダー選出で強い整合性と高可用性を両立。2021 年 GA。(paper / database / cloud / distributed-systems) - [[Amazon MemoryDB]](entity 新規) — AWS フルマネージドインメモリ DB サービス。Redis API 互換・11 9s 耐久性・4 9s 可用性。(product / database / cloud) - [[Yacine Taleb]](entity 新規) — AWS Canada 所属エンジニア。Amazon MemoryDB 論文筆頭著者。(person / database / cloud) - [[インメモリデータベース]](concept 新規) — DRAM をプライマリストレージとするシステムの耐久性トレードオフと解決アプローチを整理。(database / distributed-systems / cloud) - [[ストレージ計算分離]](concept 新規) — 計算と耐久性/ストレージを独立コンポーネントに分解するパターン。Aurora・MemoryDB・PolarDB を横断比較。(database / distributed-systems / cloud) ### 2026-06-28 Spanner: Google's Globally Distributed Database (OSDI 2012 / TOCS 2013) - [[@2013__TOCS__Spanner - Google's Globally Distributed Database]](source 新規) — [[James C. Corbett]] ほか([[Google]])。OSDI 2012 / TOCS 2013。TrueTime(GPS + 原子時計、ε ≈ 4ms)と commit wait による外部一貫性保証。ディレクトリ単位の地理的配置制御。スナップショットトランザクションはロックフリー。F1(Google 広告バックエンド)が最初のクライアント。(paper / distributed / database / systems) - [[James C. Corbett]](entity 新規) — Google エンジニア。Spanner 第一著者。(person / distributed / systems) - [[外部一貫性]](concept 新規) — 分散トランザクションにおける最強一貫性保証。線形化可能性と等価。Spanner の TrueTime + commit wait で実現。(concept / distributed / database) - [[TrueTime]](concept 新規) — Google の時刻 API。不確実性区間 [earliest, latest] を返す。GPS + 原子時計実装。ε ≈ 4ms。(concept / distributed / systems) - [[分散トランザクション]](concept 新規) — 複数パーティションにまたがる ACID 操作。2PC on Paxos。スナップショット(ロックフリー)と RW(悲観的ロック)の 2 種。(concept / distributed / database) - [[Jeffrey Dean]](entity 更新) / [[Sanjay Ghemawat]](entity 更新) — Spanner 共著として貢献追記。 ### 2026-06-28 Amazon Aurora: Design Considerations for High Throughput Cloud-Native Relational Databases (SIGMOD 2017) - [[@2017__SIGMOD__Amazon Aurora - Design Considerations for High Throughput Cloud-Native Relational Databases]](source 新規) — [[Alexandre Verbitski]] ほか(AWS)。MySQL 互換クラウドネイティブ OLTP DB。「ログがデータベース」設計・6 ウェイ AZ+1 クォーラム・10 秒クラッシュリカバリ・ミラード MySQL 比 35 倍スループット。(paper / database / distributed) - [[Amazon Aurora (Database)]](entity 新規) — AWS の MySQL/PostgreSQL 互換 OLTP DB サービス。2015 年 GA。(product / database) - [[Alexandre Verbitski]](entity 新規) — AWS 研究者。Aurora 筆頭著者。(person / researcher) - [[クォーラムベースレプリケーション]](concept 新規) — V=6 Vw=4 Vr=3 の AZ+1 設計と相関障害モデル。(distributed / database) - [[コンピュートストレージ分離]](concept 新規) — ログ+ストレージ+リカバリを独立サービスに切り出すアーキテクチャパターン。(distributed / database) - [[OLTPシステムアーキテクチャ]](concept 更新) — クラウドネイティブのネットワークボトルネック問題を横断的知見に追記。 - [[Write-Ahead Logging (WAL)]](concept 更新) — 「ログがデータベース」設計を横断的知見に追記。 - [[クラッシュリカバリ]](concept 更新) — 継続的 Redo・10 秒リカバリを横断的知見に追記。 - [[分散ストレージ]](concept 更新) — OLTP 専用ストレージのログ処理責任を横断的知見に追記。 ### 2026-06-28 CPU Utilization is Wrong (Brendan Gregg, 2017) - [[@2017__brendangregg.com__CPU Utilization is Wrong]] — [[Brendan Gregg]](Netflix, 2017)。%CPU は「非アイドル時間」でありメモリ待機も含む。IPC(Instructions Per Cycle)が真の処理効率指標で、IPC < 1.0 はメモリバウンド・IPC ≥ 1.0 は命令バウンドを示す。CPU-DRAM ギャップにより現代の高 %CPU の多くは DRAM 待機。(source 新規 / article / performance / observability) - [[Brendan Gregg]](entity 新規) — パフォーマンスエンジニア・DTrace / Flame Graph / BPF ツール作者。(person / performance) - [[CPU利用率]](concept 新規) — %CPU の定義・誤謬・CPU-DRAM ギャップ・その他の誤解因子(スロットリング・可変クロック・スピンロック)。(concept / performance) - [[Instructions Per Cycle]](concept 新規) — IPC の定義・診断基準(< 1.0 / ≥ 1.0)・Linux perf による計測法。IPCメトリクス(Inter-Process Communication)と別概念。(concept / performance / hardware) - [[ハードウェアカウンタ]](concept 更新) — IPC / %CPU 乖離の横断的知見追記。 ### 2026-06-28 Characterizing Cloud Computing Hardware Reliability (SoCC 2010) - [[@2010__SoCC__Characterizing Cloud Computing Hardware Reliability]] — [[Kashi Venkatesh Vishwanath]]・[[Nachiappan Nagappan]]([[Microsoft Research]])。2010 年 SoCC。100,000 台超のサーバーを 14 か月観測した初の大規模データセンターハードウェア障害実証研究。AFR 約 8%・HDD が初回障害の 70%・連続障害はインバース曲線(R²=0.974)・予測因子はデータセンター名とメーカー名。(source 新規 / paper / datacenter / reliability) - [[Kashi Venkatesh Vishwanath]](entity 新規) — Microsoft Research 研究者。データセンターハードウェア信頼性を専門とする。(person / researcher) - [[Nachiappan Nagappan]](entity 新規) — Microsoft Research 研究者。ソフトウェア信頼性工学を専門とする。(person / researcher) - [[データセンター信頼性]](concept 更新) — AFR 約 8% の実測値・HDD 初回障害支配性・障害経験済みサーバーの状態遷移・予測因子のデータセンター名/メーカー名を横断知見に追記。 - [[障害予測]](concept 更新) — データセンター/メーカーというメタデータ的環境情報が障害の最強予測因子という 2010 年の実証を横断知見に追記。 ### 2026-06-28 The SPACE of Developer Productivity (ACM Queue 2021) - [[@2021__ACMQueue__The SPACE of Developer Productivity]] — [[Nicole Forsgren]]・[[Margaret-Anne Storey]] ら(GitHub / Microsoft Research / ビクトリア大学)。2021 年 2 月 ACM Queue Vol.19 No.1。開発者生産性は多次元的であり単一メトリクスでは測定不可能。Satisfaction・Performance・Activity・Communication・Efficiency の 5 次元フレームワーク SPACE を提案。少なくとも 3 次元での計測を推奨。(source 新規 / article / developer-experience / metrics) - [[開発者生産性]](concept 新規) — 開発者生産性の多次元的概念。よくある誤解(生産性 = アクティビティ等)と SPACE/DORA による計測アプローチを横断集約。(concept / developer-experience / metrics) - [[Margaret-Anne Storey]](entity 新規) — ビクトリア大学コンピュータサイエンス教授。SPACE 共著者。(person / research) - [[SPACE]](concept 更新) — 原論文からの知見追記: A(アクティビティ)が「最も危険な次元」である警告・DORA との補完関係・出典追加。 - [[Nicole Forsgren]](entity 更新) — 原論文出典追記。 ### 2026-06-28 Unlock High-Frequency Deployments without Blowing Up Prometheus (SREcon26 Americas) - [[@2026__SREcon26Americas__Unlock High-Frequency Deployments without Blowing Up Prometheus]] — [[Ganesh Vernekar]]([[Reddit]] / Prometheus TSDB メンテナー)。2026-03-26、SREcon26 Americas。Kubernetes 高頻度デプロイが Prometheus OOM を起こす仕組みと stale-series compaction の設計・本番実験・閾値選択指針。YouTube 字幕 transcript 付き。(source 新規 / slides / sre / prometheus / observability) - [[Ganesh Vernekar]](entity 新規) — Reddit Staff SWE / Prometheus TSDB メンテナー。stale-series compaction 設計者。(person / prometheus) - [[Reddit]](entity 新規) — 大規模ソーシャルプラットフォーム。Prometheus 大規模オブザーバビリティ運用組織。(organization / sre) - [[Prometheusシリーズチャーン]](concept 新規) — pod ラベル変更で失活系列が HEAD 蓄積し OOM を起こす問題と、stale-series compaction による解決・閾値選択指針。(concept / prometheus / sre) - [[Prometheus TSDB]](concept 新規) — HEAD(RAM)+WAL+Block の 2 層構造の Prometheus 内蔵ストレージエンジン。シリーズチャーンの根拠アーキテクチャ。(concept / prometheus / storage) ### 2026-06-28 Reliability Equilibrium: The Hidden Playbook behind SRE Influence (SREcon26 Americas) - [[@2026__SREcon26Americas__Reliability Equilibrium - The Hidden Playbook behind SRE Influence]] — [[Daria Barteneva]]([[Microsoft Azure]])。2026-03-26、SREcon26 Americas。ゲーム理論で SRE の社会技術的失敗パターンを体系化し、メカニズムデザインとして SRE ツールを再定義。60 ページ。(source 新規 / slides / sre / game-theory) - [[Daria Barteneva]](entity 新規) — Microsoft Azure Observability Engineering Principal SRE。(person / sre) - [[ゲーム理論とSRE]](concept 新規) — 囚人のジレンマ・Stag Hunt・公共財ゲーム・ベイジアンゲーム・進化的ゲームによる SRE 失敗パターン診断とメカニズムデザイン解。(sre / game-theory) ### 2026-06-28 Loop Engineering: The Anthropic Playbook for Designing Systems That Prompt Your Agents (Working Note) - [[@2026__Working Note__Loop Engineering - The Anthropic Playbook for Designing Systems That Prompt Your Agents]] — [[Addy Osmani]] ほか(HuaShu 編)。ループエンジニアリングの 4 層スタック・5 ムーブ・6 パーツ・4 コスト・5 失敗パターン・ジェネレータ/エバリュエータ分離を体系化。Stripe Minions(週 1,300+ PR)を実例収録。(source 新規 / paper / agents / software-engineering) - [[Addy Osmani]](entity 新規) — Google Chrome エンジニア・Loop Engineering 命名者。(person) - [[Prithvi Rajasekaran]](entity 新規) — Anthropic エンジニア・ジェネレータ/エバリュエータパターン調査者。(person) - [[Steve Kaliski]](entity 新規) — Stripe エンジニア・Minions パイプライン構築。(person) - [[ループエンジニアリング]](concept 更新) — 5 ムーブ/6 パーツ/4 コストの横断的知見・未解決の問いセクションを追加。 ### 2026-06-28 Beyond Loss and Accuracy: Closing the Observability Gaps in AI Training with TrainCheck (SREcon26 Americas) - [[@2026__SREcon26Americas__Beyond Loss and Accuracy - Closing the Observability Gaps in AI Training with TrainCheck]] — [[Yuxuan Jiang]]・[[Ryan Huang]]([[University of Michigan]] / [[OrderLab]])。2026-03-25、SREcon26 Americas。[[TrainCheck]] の SRE 向け実践発表。18/20 件を 1 イテレーション以内検知・偽陽性率 2% 未満。BLOOM-176B・凍結エンコーダケーススタディ収録。(source 新規 / slides / systems-ml / deep-learning / sre) - [[Ryan Huang]](entity 新規) — [[University of Michigan]] [[OrderLab]] 所属。SREcon26 Americas 共同登壇者。(person / systems-ml) - [[DLトレーニングサイレントエラー]](concept 更新) — BLOOM 39,999 ステップ遅延コスト・コミュニティ事例の横断的知見を追記。 - [[訓練不変条件]](concept 更新) — SRE 規律との対応・learn once check everywhere の横断的知見を追記。 - [[MLモデル監視]](concept 更新) — 症状ベース監視 vs 正当性監視・遅延コストの横断的知見を追記。 ### 2026-06-28 Executing Chaos Engineering in Production at a Critical Financial Institution (SREcon26 Americas) - [[@2026__SREcon26Americas__Executing Chaos Engineering in Production at a Critical Financial Institution]] — [[Luiz Siqueira]]・[[Leonardo Marques]]([[Bradesco]])。2026-03-24。本番カオスエンジニアリングの段階的導入。MTTD 73% 削減・MTTR 22% 改善・10 ブラインドスポット発見・9 アーキテクチャ改善。(source 新規 / slides / sre / chaos-engineering / financial) - [[カオスエンジニアリング]](concept 新規) — 定義・実験サイクル・シナリオ分類・導入フェーズ・本番前提条件を集約。金融規制環境での適用事例含む。(concept / sre / chaos-engineering) - [[GameDay]](concept 新規) — チーム対応能力訓練の演習形式。Bradesco の +300 人規模実施例・54% 発見率・横断的知見を含む。(concept / sre / chaos-engineering / incident-response) - [[Bradesco]](entity 新規) — ブラジル最大級民間銀行。(organization / financial) - [[Leonardo Marques]](entity 新規) — Bradesco SRE Head。(person / sre) - [[Luiz Siqueira]](entity 新規) — Bradesco SRE Manager。(person / sre) - [[EasyPerform]](entity 新規) — Bradesco 内製カオスエンジニアリングガバナンスプラットフォーム。(product / chaos-engineering) ### 2026-06-28 AI Agents for Incident Investigation (SREcon26 Americas) - [[@2026__SREcon26Americas__AI Agents for Incident Investigation - The Good, The Bad, and The Ugly]] — [[Vladyslav Budichenko]]([[Vocaly AI]])。2026-03-24、SREcon26 Americas。本番 RCA 精度 11.34%・プロンプトインジェクション +540%・trust-for/verify の実務フレームワーク。(source 新規 / slides / sre / aiops / incident-response / agent) - [[Vladyslav Budichenko]](entity 新規) — Vocaly AI 創業者・ソフトウェアエンジニア。 - [[Vocaly AI]](entity 新規) — ビジネス向け音声 AIエージェントプラットフォーム。 - [[LLMによる根本原因分析]](concept 更新) — 本番実測 11.34% 精度・自信満々な誤答という横断的知見を追記。 - [[インシデント調査戦略]](concept 更新) — AIエージェントがプレイブック確認・文脈収集・シグナル相関を担える知見を追記。 - [[エージェント運用安全性]](concept 更新) — ログ経由プロンプトインジェクション・trust-for/verify・ゴム印問題の横断的知見を追記。 - [[エージェントシステム運用]](concept 更新) — rabbit holes・エージェント過負荷・コンテキストウィンドウギャップの横断的知見を追記。 ### 2026-06-28 So You Want a New Incident Commander (SREcon26 Americas) - [[@2026__SREcon26 Americas__So You Want a New Incident Commander]] — [[Vanessa Huerta Granda]]([[Enova]])。2026年。IC プログラム10年超の実践知。IC の3コアコンピテンシーと3チーム類型を定義。構造より「IC 役割の明示」が普遍的要件。スライド PDF 25 ページ。(source 新規 / slides / sre / incident-management / incident-commander) - [[Incident Commander]](concept 新規) — IC の定義・役割・コンピテンシー・チーム類型・アンチパターンの横断集約。(concept / sre / incident-management) - [[Vanessa Huerta Granda]](entity 更新) — SREcon26 Americas 発表・IC プログラム実践知を追記。 - [[Enova]](entity 更新) — IC プログラムとの接続を追記。 - [[インシデント管理]](concept 更新) — IC 役割定義・3チーム類型の横断的知見を追記。 ### 2026-06-28 インシデントキーメトリクスによるインシデント対応の改善 (SRE Kaigi 2025) - [[@2025__SRE Kaigi 2025__インシデントキーメトリクスによるインシデント対応の改善]] — [[Narimichi Takamura]]([[Topotal]] CEO / SRE)。2025-01-26。MTTR がモンテカルロシミュレーション(有名インターネット企業 3 社・10 万回)で改善評価指標として統計的に機能しないことを実証。TTX メトリクス(11 種類)の体系的定義と [[Waroom]] での Slack 連携自動収集を提示。YouTube 字幕トランスクリプト使用。(source 新規 / slides / sre / incident-management / metrics) - [[Narimichi Takamura]](entity 新規) — Topotal CEO / SRE。@nari_ex。(person / sre) - [[TTXメトリクス]](concept 新規) — インシデントライフサイクルを 11 フェーズ指標に分解。MTTR 批判とシミュレーション実証・自動収集 3 条件を含む。(concept / sre / incident-management / metrics) - [[Topotal]](entity 更新) — CEO 高村成道・SRE Kaigi 2025 スポンサー情報を追記。 - [[Waroom]](entity 更新) — TTX 自動収集の実装詳細(Slack イベント連携・AI 判断)を追記。 - [[インシデント管理]](concept 更新) — MTTR 統計的限界・TTX 代替という横断的知見を追記。 ### 2026-06-28 1年間のポストモーテム運用とそこから生まれたツール sre-advisor (SRE NEXT 2022) - [[@2022__SRENEXT2022__1年間のポストモーテム運用とそこから生まれたツール sre-advisor]] — [[藤原俊一郎]]([[面白法人カヤック]])。2022-05-14。Embedded SRE でのポストモーテム横断統一運用1年半の効果(原因放置防止・横断共有・知識永続化)と sre-advisor(AWS 設定静的チェック CLI)を紹介。YouTube 字幕使用。(source 新規 / slides / sre / postmortem) - [[藤原俊一郎]](entity 新規) — 面白法人カヤック SRE。ecspresso・lambroll 作者。(person / sre) - [[面白法人カヤック]](entity 更新) — Embedded SRE 構造・ポストモーテム統一運用・藤原俊一郎のソースを追記。 - [[ポストモーテム]](concept 更新) — 知見のコード化ループ・チェックシートのトイル化・プロダクト消滅後の知識保持・日本実践の独自進化を横断的知見に追記。 ### 2026-06-28 Learning from Incidents at Scale; Actually Doing Cross-Incident Analysis (SREcon25 Americas) - [[@2025__SREcon25 Americas__Learning from Incidents at Scale - Actually Doing Cross-Incident Analysis]] — [[Vanessa Huerta Granda]]([[Enova]])。2025-03-26。クロスインシデント分析を継続プログラムとして自走させる3要素。部門横断招待・推奨事項とアクションアイテムの分離・コンテキスト付き指標。YouTube 字幕トランスクリプト使用。(source 新規 / slides / sre / incident-management / postmortem) - [[クロスインシデント分析]](concept 新規) — 個別インシデント学習の次の段階。専任チーム・構造化アーティファクト・組織計画連動の3要素。インシデント考古学との比較。(sre / incident-management) - [[Vanessa Huerta Granda]](entity 新規) — Enova テクノロジーマネージャー、Jeli 元在籍、Howie ガイド共著者。(person / sre) - [[Enova]](entity 新規) — クロスインシデント分析プログラム実践組織。10 年間の事例。(organization / fintech / sre) - [[ポストモーテム]](concept 更新) — Granda の部門横断招待・アクションアイテムファクトリー anti-pattern を追記。 - [[Jeli]](entity 更新) — Vanessa Huerta Granda の在籍歴を追記。 ### 2026-06-28 The Case of the Misnamed Cities: CAST Analysis of a Google Maps Incident (SREcon26 Americas) - [[@2026__SREcon26Americas__The Case of the Misnamed Cities - CAST Analysis of a Google Maps Incident]] — [[Ruben Barroso]]([[Google]])。2026-03-25。RCA vs CAST の対比。時系列≠因果・制御構造・メンタルモデル分析。(source 新規 / slides / sre / safety-engineering / postmortem) - [[Ruben Barroso]] — Google スタッフ SRE。5年以上 STPA/CAST を産業適用。(entity 新規 / person) - [[Nancy G. Leveson]] — CAST/STPA 考案者。システム安全工学者。(entity 新規 / person) - [[CAST]] — Causal Analysis based on Systems Theory。制御構造・メンタルモデル・文脈要因から事故を分析する手法。(concept 新規 / safety-engineering / sre) ### 2026-06-28 Human Observability of Incident Response (SREcon23 Americas) - [[@2023__SREcon23Americas__Human Observability of Incident Response]] — [[Matt Davis]]([[FORM.com]])。2023-03-23、サンタクララ。インシデント対応 = 即興演奏・Joint Activity 論。(source 新規 / slides / sre / human-factors / resilience-engineering) - [[Matt Davis]] — FORM.com SRE Architect・音楽家。Practice of Practice Gamelan 考案者。(entity 新規 / person) - [[Pauline Oliveros]] — 作曲家。Deep Listening 創始者。(entity 新規 / person) - [[Derek Bailey]] — ギタリスト・音楽理論家。「即興は練習の外に存在しない」。(entity 新規 / person) - [[Joint Activity]] — 複数参加者が共通目標に向け協力する活動の総称。(concept 新規 / human-factors) - [[Common Grounding]] — 相互理解・メンタルモデルを維持する継続プロセス(Klein et al.)。(concept 新規 / human-factors) - [[Practice of Practice]] — 「インシデントでなく共に働くことを練習する」SRE 訓練フレームワーク。(concept 新規 / sre) ### 2026-06-28 Incident Archeology (SREcon23 Americas) - [[@2023__SREcon23Americas__Incident Archeology - Finding Value in the Paperwork and Narratives of the past]] — [[Clint Byrum]]([[Spotify]])。2023-03-21、サンタクララ。過去インシデント記録を仮説検証に使う「インシデント考古学」を提唱。Spotify 実データ(2020〜2021)から副産物知見を報告。(source 新規 / slides / sre / postmortem) - [[Clint Byrum]] — Spotify スタッフエンジニア・IMOC。(entity 新規 / person) - [[Spotify]] — 音楽ストリーミング企業。インシデント考古学の実践組織。(entity 新規 / organization) - [[インシデント考古学]] — 過去インシデント記録を横断的に仮説検証する手法。(concept 新規 / sre / postmortem) - 更新: [[ポストモーテム]] — Spotify 完了率実測値・生産性影響度バイアス・インシデント考古学を横断的知見に追記。 ### 2026-06-28 The Repeat Incident Fallacy (SREcon22 EMEA) - [[@2022__SREcon22EMEA__The Repeat Incident Fallacy - What Jurassic Park Can Teach Us about Incidents]] — [[Emily Ruppe]]([[Jeli|Jeli.io]])。2022-10-26、アムステルダム。「同じインシデントは二度と起きない(Repeat Incident Fallacy)」——CI/CD の継続的変化により「再発防止誓約」は達成不可能。「Insights from the Past = Options in the Future」を提唱。(source 新規 / slides / sre / postmortem / resilience-engineering) - [[Emily Ruppe]] — Jeli.io Solutions Engineer、@themortalemily。「インシデントレビューのボブ・ロス」。元 SendGrid・Twilio。(entity 新規 / person) - [[Laura Maguire]] — レジリエンスエンジニアリング研究者。Jeli.io。CI/CD = 継続的変化命題。Howie 共著者。(entity 新規 / person) - 更新: [[ポストモーテム]] — Repeat Incident Fallacy と「Insights from the Past = Options in the Future」を横断的知見に追記(4 者収束確認)。 - 更新: [[レジリエンスエンジニアリング]] — 「カーディオを鍛えよ」と evolving sociotechnical systems 概念を横断的知見に追記。 ### 2026-06-28 A Post Incident Review Review (SREcon22 APAC) - [[@2022__SREcon22APAC__A Post Incident Review Review]] — [[Tom Partington]]([[ANZx]])。2022-12-09。根本原因・アクションアイテム・MTTx を除外した ANZx PIR² の 7 ステップ。Safety I→II・Rasmussen モデル・Dekker's Tunnel・カウザルマップ・Blame-aware デブリーフィング・Record vs Report 区別を実践接続。(source 新規 / slides / sre / postmortem) - [[Tom Partington]] — ANZx SRE、@parmigiana。安全科学を PIR 実践に橋渡し。(entity 新規 / person) - [[ANZx]] — ANZ グループ傘下フィンテック組織。1000人超・高度規制産業で PIR² を実践。(entity 新規 / organization) - [[J Paul Reed]] — Lund 大学 PhD 候補。PIR 業界調査データ(90.5% が修復アイテム含む)提供。(entity 新規 / person) - [[John Allspaw]] — 元 Etsy CTO。Debriefing Facilitation Guide 共著者。(entity 新規 / person) - [[Jeli]] — インシデント分析ツール企業。Howie: The Post-Incident Guide(2021)発行。(entity 新規 / organization) - [[Sidney Dekker]] — 安全科学者。Dekker's Tunnel・New View 提唱。(entity 新規 / person) - [[James Reason]] — 認知心理学者。スイスチーズモデル提唱。(entity 新規 / person) - [[Jens Rasmussen]] — 安全工学者。Workload/Economic/Performance 境界モデル提唱。(entity 新規 / person) - 更新: [[ポストモーテム]] — ANZx の根本原因/アクションアイテム/MTTx 除外実績・learning > fixing・Record vs Report を横断的知見に追記。 - 更新: [[事故モデル]] — Rasmussen Safety Model と PIR スタイルの接続・カウザルマップを横断的知見に追記。 - 更新: [[人的要因]] — Mechanistic Reasoning 批判・Dekker's Tunnel を横断的知見に追記。 - 更新: [[レジリエンスエンジニアリング]] — Safety I→II・STELLA/Woods' Theorem を横断的知見に追記。 ### 2026-06-28 Principled Identification of "Root Causes" Using Techniques from Safety Engineering (SREcon22 EMEA) - [[@2022__SREcon22 EMEA__Principled Identification of Root Causes Using Techniques from Safety Engineering]] — [[Laura de Vesine]](Datadog)。安全工学の System/Environment 境界モデルで根本原因=システムの脆弱性・トリガー=環境条件と再定義。5 Whys のトリガーホワイトアモール病理を診断。ニアミス調査の重要性を論じた。YouTube transcript 付き 23 ページ。(source 新規 / slides / sre / postmortem) - [[Laura de Vesine]] — Datadog スタッフエンジニア。SRE・インシデント分析・カオスエンジニアリング専門、PhD。(entity 新規 / person) - 更新: [[根本原因分析]] — 根本原因/トリガー用語再定義とトリガーホワイトアモール病理の横断的知見を追記。 - 更新: [[事故モデル]] — System/Environment 境界モデルとスイスチーズモデルの対比を横断的知見に追記。 ### 2026-06-28 Ditch the Template (SREcon22 EMEA) - [[@2022__SREcon22 EMEA__Ditch the Template - How to Write Incident Reports They Want To Read]] — [[Laura Nolan]]([[Stanza Systems]]、元 Google・Slack SRE)SREcon22 EMEA 2022-10-26。「IR の価値は学習にあり、プロセスにあるのではない」。ナラティブ型 IR 執筆(謎→調査→解決)・読者サポート・視覚化・分析の重要性を提唱。(source 新規 / slides / sre / postmortem) - [[Laura Nolan]] — Stanza Systems Principal SWE、元 Google・Slack SRE、SRE Book 共著者、USENIX ボードメンバー。(entity 新規 / person) - [[Stanza Systems]] — 本番システム制御ソフトウェアのスタートアップ。(entity 新規 / organization) - [[インシデントレポート執筆]] — ナラティブ型 IR の原則。テンプレート批判・4 軸(ナラティブ/読者サポート/視覚化/分析)・文体原則。(concept 新規) - [[ポストモーテム]] — テンプレート形式が学習価値を損なう・専門知識の継続的損失補完の 2 観点を横断的知見に追記。(concept 更新) ### 2026-06-28 Running Excellent Retrospectives (SREcon19 Americas) - [[@2019__SREcon19Americas__Running Excellent Retrospectives - Talking for Humans]] — [[Courtney Eckhardt]]([[Heroku]])・[[Lex Neva]]([[Fastly]])。ファシリテーター3仕事・言語レベルのblame回避・Miller の法則・Lake Washington 浮橋事例・Conway's Law。(source 新規 / slides / sre) - [[Lex Neva]] — Fastly SRE、SRE Weekly 運営者。(entity 新規 / person) - [[Fastly]] — エッジクラウドプラットフォーム(CDN)企業。(entity 新規 / organization) - [[Courtney Eckhardt]] — SREcon19 Americas talk を追記。(entity 更新 / person) - [[レトロスペクティブファシリテーション]] — パーセプチュアル学習・ユーモアの体系的管理・感情環境の制御を横断的知見に追記。(concept 更新) - [[人的要因]] — Lake Washington 浮橋事例(人的要因調査の不完全性)を横断的知見に追記。(concept 更新) - [[ポストモーテム]] — sources に新ソースを追記。(concept 更新) ### 2026-06-28 Retrospectives for Humans (SREcon19 Asia/Pacific) - [[@2019__SREcon19 Asia__Retrospectives for Humans (a crash course)]] — [[Courtney Eckhardt]]([[Heroku]] / Salesforce)。ポストモーテムファシリテーション言語を言語学(Miller's Law・denotation/connotation・implication/presupposition)から体系化。contributing factor discovery・Why/You→How/What 変換・ユーモアのリスク・Conway's Law。(source 新規 / slides / sre) - [[Courtney Eckhardt]] — Heroku SRE、@hashoctothorpe(she/her)。(entity 新規 / person) - [[Heroku]] — Salesforce 傘下 PaaS。contributing factor discovery の実践組織。(entity 新規 / organization) - [[レトロスペクティブファシリテーション]] — Miller's Law・避けるべき語・良い問い方・会議運営・ユーモアのリスク・Conway's Law。(concept 新規) - [[ポストモーテム]] — contributing factor discovery・ファシリテーター言語の学習深度への影響を追記。(concept 更新) - [[人的要因]] — Miller's Law の認識論的基盤・ヒューマンエラー三者収束を追記。(concept 更新) ### 2026-06-27 Architecting a Technical Post Mortem (SREcon18 Americas) - [[@2018__SREcon18 Americas__Architecting a Technical Post Mortem]] — [[Will Gallego]](Etsy)。ポストモーテムを「学習文化の適用」と定義。ブレーム・アウェア・根本原因否定・反事実回避・ローカル合理性・修復的正義。(source 新規 / slides / sre) - [[Will Gallego]] — Etsy Staff Systems Engineer。ポストモーテム実践者。(entity 新規 / person) - [[ポストモーテム]] — Gallego の 5 観点を横断的知見に追記。(concept 更新) - [[根本原因分析]] — SRE 実践文脈での「根本原因は誤った概念」を追記。(concept 更新) - [[Etsy]] — Gallego 登壇・SNAFU Catchers' Consortium 参加を追記。(entity 更新) ### 2026-06-27 Failures and Fixes: A Study of Software System Incident Response - [[@2020__arXiv__Failures and Fixes - A Study of Software System Incident Response]] — [[Jonathan Sillito]]・[[Esdras Kutomi]](Brigham Young University)。30 インシデント定性分析(15 件インタビュー + 15 件公開ポストモーテム)。4 障害原因カテゴリ・3 次元検知分析・日和見的/体系的調査戦略・5 緩和戦略・11 観察。(source 新規 / paper / arXiv 2020) - [[Jonathan Sillito]] — BYU CS 学科の実証ソフトウェアエンジニアリング研究者。(entity 新規 / person) - [[Esdras Kutomi]] — BYU CS 学科。Sillito との共同研究者。(entity 新規 / person) - [[Brigham Young University]] — 米国ユタ州プロボの私立大学。(entity 新規 / organization) - [[インシデント調査戦略]] — 日和見的戦略と体系的戦略の二分類。(concept 新規) - [[インシデント管理]](更新) — Sillito 2020 の横断的知見 2 件(モニタリング観察 7 / 対応実態とパイプラインモデルの乖離)追記。 - [[根本原因分析]](更新) — 日和見的/体系的調査戦略の二分類と LLM エージェント設計との対応を横断的知見として追記。 - [[オペラビリティ]](更新) — Colyer 4 段階モデルの empirical 補強として Sillito 2020 の観察を追記。 - [[変更起因インシデント]](更新) — 観察 4(設定変更のプロセス的非対称性)を横断的知見として追記。 ### 2026-06-27 ポストモーテム実務ガイド 5 ソースバッチ ingest - [[@ReadME__Will Larson__Move Past Incident Response to Reliability]] — [[Will Larson]]([[Calm]] CTO)。インシデント対応を超えて信頼性を体系的に向上させるフレームワーク。Incident Legalism(インシデント法律主義)の概念を提示。(source 新規 / article / sre / reliability) - [[@PagerDuty__Post-Mortem Process]] — [[PagerDuty]] のインシデント対応ガイドのポストモーテム章。SEV 別スケジュール規律とステータスワークフロー(Draft→Closed)を定義。(source 新規 / article / sre / postmortem) - [[@2021__Datadog Blog__Best Practices for Writing Incident Postmortems]] — [[Datadog]] のポストモーテムベストプラクティス。4 実践: データ一元化・自動生成・リビングドキュメント・発見可能性。(source 新規 / article / sre / postmortem) - [[@mixi developers__インフラ障害対応とポストモーテム]] — mixi developers ブログ。再発防止策の 4 分類(予防/検出/緩和/修正)。(source 新規 / article / sre / japanese-industry) - [[@2018__Hatena Developer Blog__社内障害情報共有のススメ]] — [[Hatena]] shiba_yu36。全社エンジニアへの障害共有による横方向の学習。(source 新規 / article / sre / japanese-industry) - [[ポストモーテム]] — インシデント後の非難なき事後振り返り。ブレームレス文化・構造化プロセス・ツーリングの三つの柱。5 ソースと既存 SRE Book/Workbook を横断集約。(concept 新規 / sre / incident-management) - [[Will Larson]] — Calm CTO、エンジニアリングマネジメント・SRE の著述家。(entity 新規 / person) - [[PagerDuty]] — インシデント管理プラットフォーム提供企業。(entity 新規 / organization) - [[Datadog]] / [[Hatena]] — ポストモーテム関連ソースの参照を追記。(entity 更新) - [[インシデント管理]] — ポストモーテム関連 5 ソースの参照を追記。(concept 更新) ### 2026-06-27 Do Not Blame Users for Misconfigurations (SOSP'13) - [[@2013__SOSP__Do Not Blame Users for Misconfigurations]] — Tianyin Xu ほか(UCSD/Toronto/NetApp)。SPEX 設定制約自動推論ツール。743 件の設定ミス脆弱性を検出。(source 新規 / paper / configuration / program-analysis) - [[設定ミス脆弱性]] — 設定エラーへの不良反応 5 分類の定義。(concept 新規 / configuration / systems) - [[Yuanyuan Zhou]] — UCSD 教授・SPEX 責任著者。(entity 新規 / person) - [[Shankar Pasupathy]] — NetApp 研究者・産業協力者。(entity 新規 / person) - [[NetApp]] — Storage-A 提供元ストレージベンダー。(entity 新規 / organization) - [[設定マイニング]] — ホワイトボックス(SPEX)とブラックボックス二系統の比較を追記。(concept 更新) - [[Tianyin Xu]] / [[Ding Yuan]] — SOSP'13 参加を追記。(entity 更新) ### 2026-06-27 マイクロサービス RCA/FL 10 論文一括 ingest - [[@2024__arXiv__Cloud Atlas - Efficient Fault Localization for Cloud Systems using Language Models and Causal Insight]] — Zhiqiang Xie ほか(Stanford/CMU/Microsoft Research)。LLM でシステム文書から因果グラフを自動合成し障害箇所特定。(source 新規 / paper / fault-localization / llm) - [[@2024__FSE__Chain-of-Event - Interpretable Root Cause Analysis for Microservices through Automatically Learning Weighted Event Causal Graph]] — Zhenhe Yao ほか(清華/CAS/eBay)。マルチモーダル観測データのイベント変換+重み付き因果グラフで解釈可能な RCA。(source 新規 / paper / rca / microservice) - [[@2024__KDD__Microservice Root Cause Analysis with Limited Observability]] — 限定観測可能性下の潜在空間介入認識による RCA。(source 更新 / paper / rca / causal) - [[@2024__TOSEM__HeMiRCA - Fine-Grained Root Cause Analysis for Microservices with Heterogeneous Data Sources]] — Zhouruixing Zhu ほか(CUHK-Shenzhen/CUHK)。トレース+メトリクスの異種データ間の単調相関で階層的 RCA。サービスレベル top-1 82.7%。(source 新規 / paper / rca / heterogeneous) - [[@2026__Elsevier__MicroIRC - Instance-level Root Cause Localization for Microservice Systems]] — Yuhan Zhu ほか(武漢大学/CSIRO)。インスタンスレベル GNN ベース RCA。(source 新規 / paper / rca / gnn) - [[@2025__NeurIPS__Root Cause Analysis of Outliers with Missing Structural Knowledge]] — Orchard ほか(Cambridge/MPI/Amazon)。因果グラフ未知の単一サンプル RCA の理論的保証。(source 新規 / paper / causal / theory) - [[@2026__TVCG__RCInvestigator - Towards Better Investigation of Anomaly Root Causes in Cloud Computing Systems]] — Shuhan Liu ほか(Zhejiang/Microsoft)。人間-機械協調型 RCA 可視分析システム。(source 新規 / paper / visualization / rca) - [[@2024__FSE__Illuminating the Gray Zone - Non-Intrusive Gray Failure Localization in Server Operating Systems]] — Shenglin Zhang ほか(南開/清華/Huawei)。グレー障害の非侵入的箇所特定。AC@5 90%。(source 新規 / paper / gray-failure / fault-localization) - [[@2024__FSE__SynthoDiag - Fault Diagnosis for Test Alarms in Microservices through Multi-source Data]] — Shenglin Zhang ほか(南開/Huawei Cloud/清華)。テストアラーム多ソース障害診断。(source 新規 / paper / testing / diagnosis) - [[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]] — Lei Tao ほか(南開/清華/Tencent)。異種グラフで因果と呼び出しの不一致を考慮した性能障害診断。(source 新規 / paper / microservice / performance) - Entity 新規: [[Zhiqiang Xie]], [[Yujia Zheng]], [[Lizi Ottens]], [[Wenxiao Chen]], [[Huai Jiang]], [[Liangfei Su]], [[GrayScope]], [[Di Weng]], [[Yingcai Wu]], [[CSIRO Data61]] - Entity 更新: [[Dan Pei]], [[Shenglin Zhang]], [[Qingwei Lin]], [[Jonathan Mace]], [[Christos Kozyrakis]], [[Kun Zhang]], [[Zhenhe Yao]], [[Pinjia He]], [[Zhouruixing Zhu]], [[Xiaohui Nie]], [[Zeyan Li]], [[Tencent]], [[Wuhan University]], [[Cheryl Lee]] - Concept 新規: [[テスト障害診断]], [[情報理論的異常スコア]], [[単一サンプルRCA]] - Concept 更新: [[根本原因分析]], [[グラフベースRCA]], [[因果推論ベースRCA]], [[介入的因果学習]], [[Interactive AIOps]], [[仮説駆動RCA]], [[ログベース障害診断]], [[グラフニューラルネットワーク]], [[知識グラフ]] ### 2026-06-27 AI システム障害分析・障害注入サーベイ ingest - [[A Survey on Failure Analysis and Fault Injection in AI Systems]] — [[Guangba Yu]]・[[Pengfei Chen]]・[[Roberto Natella]]・[[Michael R. Lyu]] ほか(SYSU / Naples / CUHK)。AI システムの6層(Service / Model / Framework / Toolkit / Platform / Infrastructure)にわたる障害分析(FA)と障害注入(FI)を142本の論文から体系化した初の包括的サーベイ。各層のギャップテーブルで未対応障害種別を特定。(source 新規 / paper / survey / fault-injection / aiops) - Entity 新規: [[Roberto Natella]] - Entity 更新: [[Guangba Yu]], [[Pengfei Chen]], [[Michael R. Lyu]], [[Zibin Zheng]], [[Gou Tan]] - Concept 更新: [[障害注入]](AI システム6層の FI ギャップ・フレームワーク断片化の知見を追加), [[運用障害分析]](AI システム固有の6層障害分類体系の知見を追加) ### 2026-06-27 PreServe ICSE 2026 ingest - [[@2026__ICSE__PreServe - Intelligent Management for LMaaS Systems via Hierarchical Prediction]] — Zhihan Jiang ほか(CUHK)。mLSTM ワークロード予測 + DistilBERT 応答長予測の二層構造で LMaaS オートスケーリングとルーティングを最適化。P99 正規化レイテンシ 41.3% 削減・リソース消費 49.38% 削減。(source 新規 / paper / llm / serving / aiops) - [[LLMサービング管理]] — LMaaS オートスケーリングとリクエストルーティングを統合管理する概念。コールドスタート問題・リクエスト負荷不均一性・二層予測の知見を集約。(concept 新規) - [[Zhihan Jiang]] / [[Yujie Huang]] / [[Guangba Yu]] / [[Junjie Huang]] / [[Jiazhen Gu]] / [[Michael R. Lyu]] — PreServe の共著者として追記。(entity 更新) - [[LLM推論]] — LMaaS コールドスタート問題・リクエスト応答長不均一性・反応的スケーリング限界の知見 3 件追記。(concept 更新) ### 2026-06-27 障害箇所特定・根本原因分析 11 論文一括 ingest - [[@2025__nkcs.iops.ai__Accurate and Interpretable Log-Based Fault Diagnosis using Large Language Models]] — Yongqian Sun ほか(Nankai/Tsinghua/CMCC/ZTE)。LogInsight: LLM ファインチューニング + ログ圧縮で GPT-4 直接適用を上回る障害診断と説明文生成。(source 新規 / paper / aiops / log / llm) - [[@2025__arXiv__BSODiag - A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems]] — Tao Duan ほか(Xi'an Jiaotong/Alibaba Cloud)。クラウドインフラのバッチサーバー障害に時空間グラフ RCA + 障害伝播パス推論。(source 新規 / paper / cloud-infra / rca) - [[@2025__arXiv__COCA - Generative Root Cause Analysis for Distributed Systems with Code Knowledge]] — Yichen Li ほか(CUHK)。ソースコードを第四の診断信号源として活用する生成的 RCA。(source 新規 / paper / rca / llm / code) - [[@2025__arXiv__RADICE - Causal Graph Based Root Cause Analysis for System Performance Diagnostic]] — Andrea Tonon ほか(Huawei Ireland)。PCMCI+ + 部分ドメイン知識で因果サブグラフを出力する RCA。(source 新規 / paper / causal / rca) - [[@2025__AAAI Workshop AICT__Causal Discovery for Cloud Microservice Architectures]] — Christopher Lohse ほか(IBM Research)。PCMCI+ によるマイクロサービスのレイテンシグラフ因果発見。(source 新規 / paper / causal / microservice) - [[@2022__ESEC FSE__Actionable and Interpretable Fault Localization for Recurring Failures in Online Service Systems]] — Zeyan Li ほか(清華/Microsoft)。DéjàVu: 障害ユニット粒度の再帰障害向け箇所特定。(source 新規 / paper / fault-localization) - [[@2025__TOSEM__Making Fault Localization in Online Service Systems More Actionable and Interpretable]] — Ke Xv ほか(Dalian Maritime)。FL-AIer: 多層 GAT + 不均衡対処で DéjàVu を拡張。(source 新規 / paper / fault-localization) - [[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]] — Shenglin Zhang ほか(Nankai/Tsinghua)。UniDiag: TKG で 3 モダリティの異種性を解消。(source 新規 / paper / microservice / knowledge-graph) - [[@2024__ASE__SLIM - A scalable and interpretable light-weight fault localization algorithm for imbalanced data in microservice]] — Rui Ren ほか(Alibaba DAMO)。DNF ルールセットで二重不均衡の障害箇所特定。(source 新規 / paper / fault-localization) - [[@2024__ASE__The Potential of One-Shot Failure Root Cause Analysis - Collaboration of the Large Language Model and Small Classifier]] — Yongqi Han ほか(Tongji/Di-Matrix)。LasRCA: LLM をラベラーに限定し小型分類器と協調するワンショット RCA。(source 新規 / paper / rca / llm) - [[@2024__arXiv__FaaSRCA - Full Lifecycle Root Cause Analysis for Serverless Applications]] — Jin Huang ほか(Sun Yat-sen)。サーバーレス関数のライフサイクル段階単位 RCA。(source 新規 / paper / serverless / rca) - Entity 新規: [[BSODiag]], [[COCA]], [[RADICE]], [[LogInsight]], [[FaaSRCA]], [[FL-AIer]], [[UniDiag]], [[LasRCA]], [[DiagFusion]], [[Christopher Lohse]], [[Tao Duan]], [[Andrea Tonon]], [[He Jiang]], [[Shiyu Ma]], [[Tong Xiao]] ほか 30+ - Concept 新規: [[再帰障害]], [[障害依存グラフ]], [[不均衡障害分類]], [[時系列知識グラフ]], [[ログベース障害診断]], [[クラウドインフラ障害診断]], [[サーバーレスRCA]], [[ワンショットRCA]], [[コード知識強化RCA]] - Concept 更新: [[Fault Localization]], [[根本原因分析]], [[因果発見]], [[因果推論ベースRCA]], [[LLMによる根本原因分析]], [[マルチモーダル障害診断]], [[グラフベースRCA]], [[サービス依存グラフ]], [[マイクロサービスコールグラフ]], [[サーバーレスアーキテクチャ]], [[ドメイン別RCA]] ### 2026-06-27 データベースノブチューニング・自律 DB 3 論文 ingest - [[@2024__VLDB__GPTuner - A Manual-Reading Database Tuning System via GPT-Guided Bayesian Optimization]] — [[Jiale Lao]]・[[Mingjie Tang]](Sichuan University)。LLM でマニュアルを読み構造化知識を構築、Coarse-to-Fine ベイズ最適化で既存手法比 16 倍速く良い設定を発見。最善手法比最大 30% の性能改善。(source 新規 / paper / database / llm) - [[@2021__VLDB__openGauss - An Autonomous Database System]] — [[Guoliang Li]]・[[Xuanhe Zhou]]([[Tsinghua University]])。学習型オプティマイザ+学習型アドバイザで自律運用を実現する初の包括的フレームワーク。(source 新規 / paper / database / autonomous-database) - [[@2017__SIGMOD__Automatic Database Management System Tuning Through Large-scale Machine Learning]] — [[Dana Van Aken]]・[[Andrew Pavlo]]([[Carnegie Mellon University]])。OtterTune 原論文。ML 3 段パイプラインで DBMS ノブ設定を自動最適化。(source 新規 / paper / database / machine-learning) - [[Jiale Lao]] / [[Mingjie Tang]] / [[OtterTune]] / [[Dana Van Aken]] / [[openGauss]] (entity 新規) - [[データベースノブチューニング]] — OtterTune→DB-BERT→GPTuner の発展系譜と外付け/内蔵の対比。横断的知見 4 件・未解決の問い 3 件追加。(concept 更新) ### 2026-06-27 データベース異常診断・RCA 8 論文一括 ingest - [[@2025__ICDE__Anomaly Diagnosis with Siamese Discrepancy Networks in Distributed Cloud Databases]] — Lingsen Yan ほか(Huazhong/Huawei/HKUST)。シャムネットワークによる分散クラウド DB 異常診断。(source 新規) - [[@2025__AIDB__AutoDebugger - Efficient Root Cause Analysis for Anomaly Jobs]] — Fathelrahman Ali ほか(Google/Microsoft)。Spark ジョブ異常 RCA の 10 倍高速化。(source 新規) - [[@2025__VLDB__RCRank - Multimodal Ranking of Root Causes of Slow Queries in Cloud Database Systems]] — Biao Ouyang ほか(ECNU/Alibaba Cloud/Aalborg)。スロークエリ根本原因のマルチモーダルランキング。(source 新規) - [[@2023__Amazon Science__Vista - Machine Learning based Database Performance Troubleshooting Framework in Amazon RDS]] — Vikramank Singh ほか(AWS/MIT)。Amazon RDS の ML ベース性能トラブルシューティング。(source 新規) - [[@2023__FSE__Adapting Performance Analytic Techniques in a Real-World Database-Centric System]] — Lizhi Liao ほか(Waterloo)。DB 中心システムの性能分析技法適応。(source 新規) - [[@2023__PACMMOD__BALANCE - Bayesian Linear Attribution for Root Cause Localization]] — Chaoyu Chen ほか(Ant Group/OceanBase)。XAI 帰属ベース RCA。(source 新規) - [[@2019__VLDB__GRANO - Interactive Graph-based Root Cause Analysis for Cloud-Native Distributed Data Platform]] — Hanzhang Wang ほか(eBay)。グラフベース RCA。(source 新規) - [[@2019__SIGMOD__ExplainIt! - A Declarative Root-cause Analysis Engine for Time Series Data]] — Vimalkumar Jeyakumar ほか(Cisco Tetration)。宣言的 RCA エンジン。(source 新規) - [[Sparkジョブ異常診断]] / [[グラフベースRCA]] / [[宣言的RCA]] / [[データベース性能トラブルシューティング]] (concept 新規) - entity 新規 20+: [[Lingsen Yan]], [[Bolong Zheng]], [[Xiaofang Zhou]], [[Biao Ouyang]], [[Vikramank Singh]], [[Lizhi Liao]], [[Chaoyu Chen]], [[Hanzhang Wang]], [[Vimalkumar Jeyakumar]], [[eBay]], [[NuData]], [[OceanBase]], [[Cisco Tetration Analytics]] ほか ### 2026-06-27 データベースノブチューニングサーベイ 2 本 ingest - [[@2023__TKDE__Automatic Database Knob Tuning - A Survey]] — [[Xinyang Zhao]]・[[Xuanhe Zhou]]・[[Guoliang Li]]([[Tsinghua University]])。ノブチューニングのパイプラインを4段階に分解し、16手法を体系的に比較した初の包括的サーベイ。(source 新規 / paper / database / survey) - [[@2024__arXiv__Automatic Configuration Tuning on Cloud Database - A Survey]] — [[Limeng Zhang]]・[[M. Ali Babar]]([[University of Adelaide]])。クラウド DB の自動設定チューニングサーベイ。安全性・適応性をフレームワークに組み込み、経験からの知識を独立段階として定式化。(source 新規 / paper / database / cloud / survey) - [[Xinyang Zhao]] — 清華大学。ノブチューニングサーベイ(TKDE 2023)共同筆頭著者。(entity 新規) - [[Limeng Zhang]] — University of Adelaide CREST。クラウド DB チューニングサーベイ(arXiv 2024)筆頭著者。(entity 新規) - [[M. Ali Babar]] — University of Adelaide CREST ディレクター。(entity 新規) - [[University of Adelaide]] — オーストラリアの研究大学。CREST が研究拠点。(entity 新規) - [[データベースノブチューニング]] — 2 本のサーベイから横断的知見5件・未解決の問い3件を追加。(concept 更新) - [[Guoliang Li]] / [[Xuanhe Zhou]] / [[Tsinghua University]] — ノブチューニングサーベイの参照を追記。(entity 更新) ### 2026-06-27 DB-BERT SIGMOD 2022 論文 ingest - [[@2022__SIGMOD__DB-BERT - a Database Tuning Tool that Reads the Manual]] — [[Immanuel Trummer]](Cornell University)。BERT × Double DQN で DBMS マニュアルを「読んで」ノブをチューニングする NLP 強化型データベースチューニング。全実験(TPC-H/TPC-C × Postgres/MySQL)でベースラインを凌駕。(source 新規 / paper / database / nlp) - [[NLPベースDBチューニング]] — NLP × ランタイムフィードバック融合によるチューニング問題の定式化。DB-BERT が初提案。(concept 新規) - [[Immanuel Trummer]] — Cornell University データベース・NLP 融合研究者。DB-BERT の提案者。(entity 新規) - [[データベースノブチューニング]] — NLP+RL+ランタイムフィードバック三統合・注釈なし学習の横断的知見を追記。(concept 更新) - [[データベース O&M]] — テキストからの知識抽出によるノブ探索自動化の横断的知見を追記。(concept 更新) - [[Cornell University]] — Immanuel Trummer の所属機関として追記。(entity 更新) ### 2026-06-26 SRE NEXT 2023「エンジニアのためのSRE論文への招待」スライド ingest - [[@2023__SRE NEXT 2023__エンジニアのためのSRE論文への招待]] — [[Yuuki Tsubouchi]]による SRE NEXT 2023 IN TOKYO 発表。未普及技術論文を実装・適用のアイデア源として扱い、学際的な SRE 論文を国際会議・検索・引用ネットワークから探す方法、速読と精読の分離、読書記録の作り方を提示。(source / slides / sre / research) - [[SRE論文]] — SRE 周辺の学際的な技術論文を探索・読解するための実務上の呼称。(concept 新規) - [[Yuuki Tsubouchi]] / [[SRE NEXT]] — 2023 年講演の内容と登壇歴を追記。(entity 更新) ### 2026-06-26 データセンター信頼性・クラウド障害論文 9 本 - Sources: [[@2017__DSN__What Can We Learn from Four Years of Data Center Hardware Failures]], [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]], [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]], [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]], [[@2011__SOSP__An Empirical Study on Configuration Errors in Commercial and Open Source Systems]], [[@2020__NSDI__Understanding, Detecting and Localizing Partial Failures in Large System Software]], [[@2013__ACM TOS__Datacenter Scale Evaluation of the Impact of Temperature on Hard Disk Drive Failures]], [[@2024__ISSTA__An Empirical Study on Kubernetes Operator Bugs]], [[@2016__ASPLOS__TaxDC - A Taxonomy of Non-Deterministic Concurrency Bugs in Datacenter Distributed Systems]] - Concepts: [[データセンター信頼性]], [[クラウドインシデント]], [[データセンターネットワーク信頼性]], [[分散システム障害]], [[Kubernetesオペレータ]] ## Folds - [[fold-k4-from-2026-06-19-to-2026-06-20-n16]] — 16 entries (2026-06-19–2026-06-20): AIOps RCA 基盤集約 / 時系列分析基礎手法 / AI 時代の人間の役割 - [[fold-k4-from-2026-06-18-to-2026-06-19-n16]] — 16 entries (2026-06-18–2026-06-19): FlashAttention 通時的進化 / KV キャッシュ中心 LLM 推論最適化 / マイクロサービス障害診断 - [[fold-k4-from-2026-06-17-to-2026-06-18-n16]] — 16 entries (2026-06-17–2026-06-18): LLM 分散学習基盤技術系譜(GPipe→FFTrainer) / GPU クラスタスケジューリング / LLM 推論サービング設計空間 - [[fold-k4-from-2026-06-16-to-2026-06-17-n16]] — 16 entries (2026-06-16–2026-06-17): アラート管理 27 本体系化 / LLM×時系列異常検知 4 路線 / GLM 系統樹・LLM 評価産業化 - [[fold-k4-from-2026-06-16-to-2026-06-16-n16]] — 16 entries (2026-06-16): 因果推論ベース RCA 3 手法体系化 / SRE 信頼性概念拡張 / LLM 内部機構の多面的解析 - [[fold-k4-from-2026-06-15-to-2026-06-16-n16]] — 16 entries (2026-06-15–2026-06-16): TSFM スケーリング則・系統的比較 / LLM×時系列 5 アプローチ系譜 / 分散トレーシング古典基盤 - [[fold-k4-from-2026-06-14-to-2026-06-15-n16]] — 16 entries (2026-06-14–2026-06-15): AIOps インシデント管理・RCA 体系化 / LLM/TSFM 時系列推論 / AI インフラ信頼性プロアクティブ手法 - [[fold-k4-from-2026-06-14-to-2026-06-14-n16-b2]] — 16 entries (2026-06-14): AIOps 障害管理サーベイ群 / 監視用 TSDB アーキテクチャ / クラウド基盤前史体系化 - [[fold-k4-from-2026-06-14-to-2026-06-14-n16]] — 16 entries (2026-06-14): クラウドモニタリング「何を監視すべきか」問題 / 因果推論 RCA 実効性評価 / DB ストレージ設計の古典と再工学 - [[fold-k4-from-2026-06-08-to-2026-06-14-n16]] — 16 entries (2026-06-08–2026-06-14): LLM スケーリング則と推論基礎理論 / 変更起因インシデント定量分析 / オブザーバビリティデータ管理体系化 - [[fold-k4-from-2026-06-06-to-2026-06-08-n16]] — 16 entries (2026-06-06–2026-06-08): LLM 推論・訓練インフラ電力制御 / エージェント型 AIOps オーケストレーション / SRE/LLM 基盤論文体系的取り込み - [[fold-k4-from-2026-06-06-to-2026-06-06-n16]] — 16 entries (2026-06-06): SRE 理論体系・古典論文 wiki 構築 / DeepSeek・Kimi・MiniMax 技術報告 / マイクロサービス信頼性産業実証 - [[fold-k4-from-2026-06-05-to-2026-06-06-n16]] — 16 entries (2026-06-05–2026-06-06): RL スケーリング則・エージェント型 RL 体系化 / GPU クラスタ信頼性実証 / 大規模 MoE モデル産業実装 - [[fold-k4-from-2026-06-05-to-2026-06-05-n16-b2]] — 16 entries (2026-06-05): LLM 推論効率化サーベイ / エージェント型 RL フレームワーク / NSDI '26 集合通信・テレメトリ最適化 - [[fold-k4-from-2026-06-05-to-2026-06-05-n16]] — 16 entries (2026-06-05): LLM エージェント RCA/DB 障害診断 / マルチモーダル融合の等価否定 / SLO・可用性指標深化 - [[fold-k4-from-2026-06-04-to-2026-06-05-n16]] — 16 entries (2026-06-04–2026-06-05): LLM 訓練障害診断 26 本体系化 / ATSF 3 パラダイム一巡 / インシデント自動化・ログ解析地図化 - [[fold-k4-from-2026-06-03-to-2026-06-04-n16]] — 16 entries (2026-06-03–2026-06-04): AIOps/RCA 評価基盤深化・「進歩の幻想」暴露 / TSFM 応用展開 / IaC・eBPF 外延拡張 - [[fold-k4-from-2026-06-02-to-2026-06-03-n16]] — 16 entries (2026-06-02–2026-06-03): agentic SRE ベンチマーク・産業 AI SRE 基盤構築 / LLM 分散学習インフラ体系化 / テレメトリ 3 層確立 --- ### 2026-06-26 SRE NEXT 2022 AIOps研究録 スライド ingest - [[@2022__SRE NEXT 2022__AIOps研究録―SREのためのシステム障害の自動原因診断]] — [[Yuuki Tsubouchi]]による、SLO ベースの症状アラートと原因診断を分離する AIOps 研究記録。(source 新規) - [[TSifter]] — 原因診断の因果グラフ生成前に時系列を削減する手法。(entity 新規) - [[AIOps]] / [[因果推論ベースRCA]] / [[時系列クラスタリング]] / [[自動化の皮肉]] — 診断前処理、因果経路の欠落、診断 AI の運用に関する横断的知見・未解決の問いを追記。(concept 更新) - [[Yuuki Tsubouchi]] / [[Meltria]] — 2022 年講演とデータセット生成ワークフローを追記。(entity 更新) ### 2026-06-26 SREcon23 EMEA スライド ingest(From Sysadmins to Flying Unicorns) - [[@2023__SREcon23 EMEA__From Sysadmins to (almost) Flying Unicorns]] — [[Guillaume Hérail]] ・[[Gilberto Müller]]([[Sony Interactive Entertainment]])。TOS・SRE Academy・CFT・SLO・Reliability Meetup の 5 施策で SRE 組織変革を実現したケーススタディ。(source 新規) - [[Guillaume Hérail]] / [[Gilberto Müller]] / [[Sony Interactive Entertainment]] — entity 3 件新規。(entity 新規) - [[SRE組織変革]] — TOS/CFT/SRE Academy/Reliability Meetup の組織変革パターンを横断的知見として初期化。(concept 新規) - [[SRE]] — SIE SRE 組織変革事例を横断的知見に追記。(concept 更新) ### 2026-06-26 データベース/分散システム異常診断 6 論文一括 ingest - [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]] — Minghua Ma ほか。iSQUAD: クラウド DB の間欠的遅延クエリ根本原因診断。F1 80.4%。(source 新規) - [[@2024__arXiv__OS Pre-trained Transformer - Predicting Query Latencies across Changing System Contexts]] — Negi ほか(MIT CSAIL)。OSprey: OS メトリクス事前学習でシステム間クエリレイテンシ予測を汎化。(source 新規) - [[@2024__KDD__Multivariate Log-based Anomaly Detection for Distributed Database]] — Lingzhe Zhang ほか。MultiLog: 分散 DB 初のマルチノードログ異常検知データセット + 手法。(source 新規) - [[@2023__PACMMOD__DBPA - A Benchmark for Transactional Database Performance Anomalies]] — Shiyue Huang ほか。OLTP 性能異常 9 種の再現ベンチマーク。(source 新規) - [[@2025__arXiv__LogDB - Multivariate Log-based Failure Diagnosis for Distributed Databases]] — Lingzhe Zhang ほか。MultiLog 拡張版、ノード単位特徴圧縮 + マスターノード集約。(source 新規) - [[@2025__IEEE TSC__Towards Close-To-Zero Runtime Collection Overhead - Raft-Based Anomaly Diagnosis on System Faults for Distributed Storage System]] — Lingzhe Zhang ほか。RBAD: Raft ログ活用ゼロオーバーヘッド異常診断。(source 新規) - [[iSQUAD]]・[[OSprey]]・[[Apache IoTDB]]・[[RBAD]]・[[Tim Kraska]] — 新規 entity 5 件。(entity 新規) - [[間欠的遅延クエリ]]・[[クエリレイテンシ予測]]・[[ログベース異常検知]]・[[データベース性能異常ベンチマーク]]・[[Raftログ診断]] — 新規 concept 5 件。(concept 新規) - [[異常検知]]・[[データベース自律診断]]・[[分散ストレージ]] — 横断的知見更新。(concept 更新) ### 2026-06-26 SONiC Workshop Japan 2026 スライド ingest - [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]] — [[海老澤健太郎]]([[Arrcus]])による SONiC Scale-Up WG 技術解説。Scale-Up/Out/Across 3 層分類、RoCEv2 対次世代トランスポート 4 方式比較表、LLR・CBFC・LLDP の SONiC 実装。(source 新規) - [[海老澤健太郎]] — Arrcus プリンシパルエンジニア。SONiC・Ultra Ethernet 専門家。『実践 SONiC 入門』著者。(entity 新規) - [[Arrcus]] — ネットワーク OS ベンダー。(entity 新規) - [[RDMA]] — RoCEv2 対 UE Transport/Falcon/MRC の 4 方式 12 軸比較の横断的知見追記。Hoefler+ 2023 の予測に対する進捗更新。(concept 更新) - [[オープンネットワーキング]] — SONiC の Scale-Up プロトコルスタック拡張の横断的知見追記。(concept 更新) ### 2026-06-26 LLM Wiki (Karpathy Gist) enrich — source/concept 強化 - [[Memex]] — [[Vannevar Bush]] が 1945 年に提案した個人知識管理装置の概念的原型。`[[Memex]]` リンクが実体なし状態だったため新規作成。Bush-Wiener-Karpathy 系譜を整理。(entity 新規) - [[@2026__GitHub Gist__LLM Wiki]] — IDE メタファー・ユースケース・index vs log 役割分担・ツール推奨を追加。(source 更新) - [[LLM Wikiパターン]] — Tolkien Gateway 例・問い合わせ帰還原理・"Obsidian is the IDE" メタファーを追記。(concept 更新) ### 2026-06-26 HotNets 2024 I've Got 99 Problems But FLOPS Ain't One 論文 ingest - [[@2024__HotNets__I've Got 99 Problems But FLOPS Ain't One]] — [[Costin Raiciu]] ら(UPB / Broadcom)。スケーリング則から 103.8T パラメータ LLM 訓練要件を導出し、スケールアップ・スケールアウト・ワイドエリアの 3 層でネットワーキング研究課題を体系化。(source 新規) - [[Costin Raiciu]] — UPB / Broadcom。マルチパストランスポート・データセンターネットワーキング研究者。HotNets 2024 対応著者。(entity 新規) - [[University Politehnica of Bucharest]] — ルーマニア工科大学(UPB)。ネットワーキング研究グループ拠点。(entity 新規) - [[Broadcom]] — HotNets 2024 共著者所属として追記。(entity 更新) - [[AIデータセンタートポロジ]] — LLM 訓練特化のデータセンターネットワーク設計概念。マルチプレーン・マルチレールによるコスト削減定量化。(concept 新規) - [[LLM分散学習]] — 百万 GPU スケールのネットワーキングボトルネック・MoE 通信要求を追記。(concept 更新) - [[データセンター輻輳制御]] — RoCEv2 FCT 劣化・マルチパスへのシフトを追記。(concept 更新) - [[LLMスケーリング則]] — インフラ設計ツールとしての活用を追記。(concept 更新) ### 2026-06-26 ICSE 2023 Quality Issues of DL Platform 論文 ingest - [[@2023__ICSE__An Empirical Study on Quality Issues of Deep Learning Platform]] — [[Yanjie Gao]] ほか([[Microsoft Research]] 北京・[[Chongqing University]])。Platform-X の品質問題 360 件を手動分析。症状 7 カテゴリ・根本原因 3 次元 22 カテゴリ・緩和アクション 10 カテゴリを体系化した初の包括的 DL プラットフォーム品質研究。(source 新規) - [[DLプラットフォーム品質問題]] — DL プラットフォームで発生するジョブ障害・品質劣化の三次元分類体系。ユーザー側 43.34%・ハードウェア 28.33%・プラットフォーム側 28.33%。(concept 新規) - [[Yanjie Gao]] — ICSE 2023 品質問題実証研究(筆頭著者)を追記。(entity 更新) - [[Hongyu Zhang]] — ICSE 2023 共著者(Chongqing University)として追記。(entity 更新) - [[Microsoft Research]] — Platform-X 品質問題 ICSE 2023 研究を追記。(entity 更新) --- ### 2026-06-26 Demystifying NCCL (arXiv 2507.04786) 論文 ingest - [[@2025__IEEE__Demystifying NCCL - An In-depth Analysis of GPU Communication Protocols and Algorithms]] — ETH Zürich SPCL・NVIDIA・Broadcom による NCCL 2.19.1 内部設計の体系的解析。(source 新規) - [[ATLAHS]] — NCCL 解析を基盤とするネットワークシミュレーションツールチェーン。(entity 新規) - [[Siyuan Shen]] — ETH Zürich SPCL、等貢献筆頭著者。(entity 新規) - [[Zhiyi Hu]] — ETH Zürich SPCL、等貢献筆頭著者。(entity 新規) - [[NCCL]] — 体系的内部解析論文を追記。(entity 更新) - [[Torsten Hoefler]] — Demystifying NCCL を追記。(entity 更新) - [[集合通信]] — NCCL プロトコル非対称性・Ring 2k-1 ステップ構造と既存研究の接続を追記。(concept 更新) ### 2026-06-26 VCCL (arXiv 2026) 論文 ingest - [[@2026__arXiv__An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters]] — [[Infrawaves]] / [[Beihang University]] ほかによる arXiv 2026 論文。NCCL 代替 CCL VCCL を提案。SM-free P2P・プライマリバックアップ QP・スライディングウィンドウ RDMA モニタの三機構。(source 新規) - [[Mingjun Zhang]] — VCCL 共同筆頭著者(Infrawaves)。(entity 新規) - [[Infrawaves]] — VCCL の設計・展開組織として詳細追記。(entity 更新) - [[Menghao Zhang]] — VCCL 対応著者として追記。(entity 更新) - [[集合通信]] — SM-free P2P による NCCLX 対比と CCL 内蔵 O(μs) モニタの知見追記。(concept 更新) - [[耐障害LLM訓練]] — CCL 層での NIC 障害透過的吸収(GPU 待機時間 90% 削減)を第四の耐障害系統として追記。(concept 更新) - [[RDMAネットワーク監視]] — CCL 自己計装という外部計装不要の四番目の計装軸を追記。(concept 更新) ### 2026-06-26 OSDI 2025 TrainCheck 論文 ingest - [[@2025__OSDI__Training with Confidence - Catching Silent Errors in Deep Learning Training with Automated Proactive Checks]] — [[TrainCheck]] by [[Yuxuan Jiang]] et al. ([[University of Michigan]] [[OrderLab]]). (source 新規) - [[DLトレーニングサイレントエラー]] — DL 訓練バグの定義・根本原因分布・Heisenbug との関係。(concept 新規) - [[訓練不変条件]] — DL 訓練固有の高レベル規則の自動推論・転用可能性。(concept 新規) - [[Yuxuan Jiang]] — TrainCheck 筆頭著者。(entity 新規) - [[Peng Huang]] — OrderLab PI。(entity 新規) - [[TrainCheck]] — OSDI 2025 フレームワーク。(entity 新規) - [[OrderLab]] — UMich 研究室。(entity 新規) - [[University of Michigan]] — OrderLab 所属機関として追記。(entity 更新) - [[Heisenbug]] — DL サイレントエラーとの横断的知見追記。(concept 更新) ### 2026-06-24 SREcon スライド 7 件一括取り込み (anomaly detection / monitoring) - [[@2019__SREcon19 Asia__Anomaly Detection on Golden Signals]] — Baidu ゴールデンシグナル異常検知。(source 新規) - [[@2015__SREcon15 Europe__Signatures, Patterns, and Trends - Timeseries Data Mining at Etsy]] — Etsy 時系列マイニング。(source 新規) - [[@2024__SREcon24 EMEA__Anomaly Detection in Time Series from Scratch Using Statistical Analysis]] — Booking.com 統計ベース異常検知 Granomaly。(source 新規) - [[@2025__SREcon25 Americas__Using Statistical Techniques to Automatically Detect Game-Breaking Issues]] — Netflix ゲーム変化点検知。(source 新規) - [[@2025__SREcon25 Americas__Stopping Performance Regression via Changepoint Detection]] — Bloomberg PELT 性能レグレッション検知。(source 新規) - [[@2017__SREcon17 Asia__Smart Monitoring System for Anomaly Detection on Business Trends in Alibaba]] — Alibaba ビジネストレンド異常検知。(source 新規) - [[@2015__SREcon15__Smart Monitor System For Automatic Anomaly Detection at Baidu]] — Baidu 自動異常検知プラットフォーム。(source 新規) - [[Ivan Shubin]] / [[Booking.com]] / [[Andrew Clegg]] / [[Etsy]] / [[Ian Neidel]] / [[Open Connect]] / [[Joseph Cirella]] / [[Shanthini Velan]] / [[Xianping Qu]] — 新規 entity。(entity 新規) - [[Yu Chen (Baidu)]] / [[Baidu]] / [[Netflix]] / [[Zhaogang Wang]] / [[Alibaba Group]] — entity 更新。 - [[異常検知]] / [[変化点検知]] — concept 更新。[[ゴールデンシグナル]] / [[時系列類似度検索]] — concept 新規。 ### 2026-06-23 SREcon18 Americas Automatic Metric Screening - [[@2018__SREcon18 Americas__Automatic Metric Screening for Service Diagnosis]] — [[Yu Chen (Baidu)]]([[Baidu]])による SREcon18 Americas 発表。KDE による異常度測定、DBSCAN クラスタリング、ダイジェストランキングでサービス診断候補を推薦し、70 件中 60 件の根本原因ダイジェストを top 1 に出す。(source / slides / sre / aiops / rca) - [[Yu Chen (Baidu)]] / [[Baidu]] — SREcon18 Americas 発表を追記。(entity 更新) - [[Fault Localization]] / [[RCA入力選別]] / [[特徴量削減]] — ゴールデンメトリクスなしの全メトリクススクリーニングを、LLM 以前の入力選別・特徴量削減として追記。(concept 更新) ### 2026-06-23 SREcon17 Americas Practical Monitoring and Alerting - [[@2017__SREcon17 Americas__A Practical Guide to Monitoring and Alerting with Time Series at Scale]] — [[Jamie Wilkinson]]([[Google]] SRE)による SREcon17 Americas 発表。監視保守コストを劣線形に抑える必要性、静的しきい値から時間・分布・SLO に基づくアラート設計への移行、[[Prometheus]] のラベル付き時系列・記録ルール・トポロジ集約を整理。(source / slides / monitoring / prometheus) - [[Jamie Wilkinson]] / [[Prometheus]] — 2017 年の時系列監視・Prometheus 実践を追記。(entity 更新) - [[アラート管理]] / [[アクショナブルアラート]] / [[サービスレベル目標]] / [[ヒストグラムメトリクス]] — 静的しきい値削減、ページ条件と診断情報の分離、SLO アラーティング前史、累積バケット比率の知見を追記。(concept 更新) ### 2026-06-23 SREcon16 Europe Alerting for Distributed Systems - [[@2016__SREcon16 Europe__Alerting for Distributed Systems - A Tale of Symptoms and Causes, Signals and Noise]] — [[Björn Rabenstein]]([[SoundCloud]] Production Engineer / [[Prometheus]] 主要開発者の一人)による SREcon16 Europe 発表。症状と原因の分離、ブラックボックス/ホワイトボックス監視の使い分け、時系列ベースの imminent problem 検知、ページ用異常検知の単純性を整理。(source / slides / alert-management / prometheus) - [[Björn Rabenstein]] / [[SoundCloud]] — 新規。(entity 新規) - [[Prometheus]] / [[アラート管理]] / [[アクショナブルアラート]] / [[Prometheusルールリント]] / [[サービスレベル目標]] — 時系列アラーティング、症状ベース設計、SLO ベース呼び出し前史を追記。(entity/concept 更新) ### 2026-06-23 SREcon16 Less Alarming Alerts - [[@2016__SREcon16__Less Alarming Alerts]] — [[Robert Treat]]([[OmniTI]] CEO)による SREcon16 発表。アラートを「人を起こすページ」と定義し、ビジネス影響・修復手順・通知先・予防可能性を説明できないものを削除・通知化・修正する。(source / slides / alert-management) - [[Robert Treat]] / [[OmniTI]] — 新規。(entity 新規) - [[アラート管理]] / [[アクショナブルアラート]] / [[アラート疲労]] — 発火前ガバナンス、アクショナブル性の最小チェックリスト、偽陽性による注意劣化を追記。(concept 更新) ### 2026-06-23 SREcon17 Asia Draining the Flood — Alert Fatigue at Baidu - [[@2017__SREcon17 Asia__Draining the Flood - A Combat against Alert Fatigue]] — Yu Chen(Baidu SRE)。Argus 監視システムのアラート洪水に対し 4 施策で 85% 削減。リンガバッファ・アソシエーションルールマイニング・アテンション率キャリブレーション・自動修復。(source 新規) - [[Argus (Baidu)]] — 新規。Baidu の内製監視システム。(entity 新規) - [[Yu Chen (Baidu)]] — 更新。SREcon17 Asia 発表情報を追記。(entity 更新) - [[アラート管理]] / [[アラート疲労]] / [[アラート集約]] — 横断的知見追記。(concept 更新) ### 2026-06-23 Cloudflare Blog Monitoring our Monitoring ingest - [[@2022__Cloudflare-Blog__Monitoring-our-Monitoring]] — [[Cloudflare]] SRE チームによる 2022 年ブログ記事。Prometheus ルールリンター [[pint]] のオープンソース公開告知。空クエリ問題・rate() 時間範囲不足・recording rule 連鎖破壊を体系化し、CI + デーモン「監視の監視」パターンを提示。(source / article / prometheus / alerting / monitoring) - [[Cloudflare]] — 新規。グローバルエッジネットワーク企業。Prometheus 運用規模(時系列 3,000 万)と pint 開発の文脈を収録。(entity 新規) - [[pint]] — 新規。Cloudflare 製 Prometheus ルールリンター。lint / CI / watch デーモン の 3 モード。(entity 新規) - [[Prometheusルールリント]] — 新規。Prometheus ルールが「静かに壊れている」状態を静的解析 + ライブ検証で防ぐプラクティス。watchdog monitoring パターン。(concept 新規) - [[アラート管理]] / [[Prometheus]] — 横断的知見(Prometheusルールリント 第零の介入点)追記。(concept / entity 更新) ### 2026-06-23 SREcon21 Spike Detection in Alert Correlation at LinkedIn - [[@2021__SREcon21__Spike Detection in Alert Correlation at LinkedIn]] — [[Nishant Singh]]([[LinkedIn]] シニア SRE)。修正 Z スコアでアラート相関のスパイクを分離し、ML なしでトイル 30–40% 削減。(source / slides / alert-correlation) - [[Nishant Singh]] — LinkedIn Production-SRE。アラート相関のスパイク検知を実装。(entity 新規) - [[アラート相関]] — 障害時の同時多発アラートからサービス依存関係を用いて根本原因を推定する取り組み。(concept 新規) ### 2026-06-23 joisino「AIのモデル崩壊と多様性」ingest - [[joisino-モデル崩壊と多様性-2026]] — [[佐藤竜馬]](joisino)著。AI 生成データの反復訓練による分布収縮メカニズム、π²/6 の数学的上界、人間の思考への二次効果を論じるブログ記事。(source / article / model-collapse / diversity) - [[モデル崩壊]] — 新規。AI 生成データの反復訓練により出力分布が収縮・均質化する現象。貪欲デコーディング・フィルタリング・反復訓練の 3 メカニズムと緩和策。(concept 新規) - [[佐藤竜馬]] — AI 生成データと社会的影響トピックを追記。(entity 更新) ### 2026-06-23 SREcon22 Americas Modeling Alert Quality スライド ingest - [[@2022__SREcon22 Americas__Modeling Alert Quality]] — [[Moshe Zadka]] による SREcon22 Americas 発表。アラート品質をコスト(アンチクオリティ)としてモデル化。真/偽/欠落の 3 分類と 4 区間レイテンシ分解を提示し、Goodhart の法則を踏まえた計測・改善サイクルを説く。(source / slides / alert-management / SREcon22) - [[Moshe Zadka]] — 新規。(entity 新規) - [[Quality of Alerts]] / [[アラート管理]] — 横断的知見追記。(concept 更新) ### 2026-06-23 SRE NEXT 2023 Warning アラート自動調査スライド ingest - [[@2023__SRE NEXT__Warningアラートを放置しない!アラート駆動でログやメトリックを自動収集する仕組みによる恩恵]] — [[池田将士]]([[面白法人カヤック]])による SRE NEXT 2023 発表。Mackerel の Warning アラート発火時に、[[prepalert]] がログ・メトリクスを自動収集してアラートメモへ添付する運用を紹介。(source / slides / sre / alert-management) - [[池田将士]] / [[面白法人カヤック]] / [[prepalert]] — 新規。(entity 新規) - [[Warningアラート]] — 新規。低重要度でも SLO・エラーバジェット消費につながり得るアラートを、放置せず調査可能にする運用対象として整理。(concept 新規) - [[Mackerel]] / [[SRE NEXT]] / [[アラート管理]] / [[エラーバジェット]] / [[サービスレベル目標]] — Warning アラートと自動調査準備の知見を追記。(entity/concept 更新) ### 2026-06-23 Rethinking Hybrid Architectures (Qiao+ arXiv 2026) ingest-paper - [[@2026__arXiv__Rethinking the Role of Efficient Attention in Hybrid Architectures]] — 効率的注意の役割を体系的解析。Large-Window Laziness 発見・NoPE 改善提案。(source 新規) - [[ハイブリッドアテンションアーキテクチャ]] — 新規。フルアテンション + 効率的注意のハイブリッド設計原則。(concept 新規) - [[NoPE]] — ハイブリッドへのフルアテンション選択的適用で長コンテキスト +6.75 pt という知見追記。(concept 更新) - [[線形注意]] — 再帰型混合器の長コンテキスト検索への非主体性という知見追記。(concept 更新) - [[Zhiyuan Liu]] / [[Xu Han]] / [[Chaojun Xiao]] / [[OpenBMB]] — 新規。(entity 新規) - [[Tsinghua University]] — ソース追加。(entity 更新) ### 2026-06-23 SRE NEXT 2023 Runbook スライド ingest - [[@2023__SpeakerDeck__Runbookに何を書き、どのようにアラートを振り分けるか]] — [[Sohei Iwahori]]([[GREE, Inc]])による SRE NEXT 2023 発表資料。Runbook をエスカレーション先向けの背景・文脈・判断材料として整備し、アラート追加時の通知チャンネル・スコープ・対応アクションを明示させるガイドラインを提示。(source / slides / sre / alert-management) - [[Sohei Iwahori]] — GREE, Inc のインフラ / Monitoring Unit Leader。(entity 新規) - [[GREE, Inc]] — ゲーム系ワークロードのインフラ運用とモニタリングを行う企業。(entity 新規) - [[アクショナブルアラート]] / [[アラート管理]] — Runbook と通知チャンネル選択による発火前の actionability 設計を追記。(concept 更新) ### 2026-06-23 Cameron Wolfe — Agentic RL フレームワーク比較記事 ingest - [[Agentic-RL-Cameron-Wolfe-2026]] — [[Cameron-R-Wolfe|Cameron R. Wolfe]] 著。ToRL・AgentGym-RL・Agent-R1・AgentRL・AutoForge の 5 フレームワーク横断比較と設計ベストプラクティス体系化。(source / article / agentic-rl / survey) - [[Cameron-R-Wolfe|Cameron R. Wolfe]] — AI 研究者・Substack "Deep (Learning) Focus" 著者。(entity 新規) - [[エージェント型強化学習]] — ToRL(RL-Zero + ツール利用創発)・AgentGym-RL(ScalingInter-RL カリキュラム)・5 フレームワーク収束知見を追加更新。(concept 更新) ### 2026-06-23 Europe 2031 (ARQ Foundation) ingest - [[europe2031-ai|Europe 2031]] — [[ARQ Foundation]] 主執筆。AI 開発格差によるヨーロッパ経済・政治周縁化を 2025〜2031 年スパンで描く政策シナリオ・ナラティブ。米欧コンピュート比 12.4→15.7 倍、デジタル主権規制が逆に脆弱性を加速するという逆説を描く。(source / policy / geopolitics / AI) - [[ARQ Foundation]] — ヨーロッパの AI 政策・安全保障を研究するシンクタンク。Europe 2031 の主執筆機関。(entity 新規) - [[ASML]] — オランダの EUV リソグラフィ装置メーカー。世界唯一の EUV サプライヤーとして地政学的キーノードだが、シナリオでは政治的麻痺で活かせずに終わる。(entity 新規) - [[ヨーロッパのAI主権]] — EU が米中依存からの脱却を目指す政策目標。主権規制が逆に脆弱性を加速させるという逆説が中心テーマ。(concept 新規) - [[コンピュート格差]] — AI 開発における地域間コンピュート資源の不均衡。米欧比 12.4→15.7 倍の拡大を定量化。(concept 新規) ### 2026-06-23 sairahul1 Loop Engineering スレッド記事 ingest - [[sairahul1-Loop-Engineering-2026]] — [[Sai Rahul]](@sairahul1)による X スレッド。[[Peter Steinberger]](OpenAI) と [[Boris Cherny]](Anthropic) の発言を起点に「エージェントループを設計する」というパラダイムシフトを体系化。(source / article / agents / software-engineering) - [[ループエンジニアリング]] — 反復フィードバックサイクルで AI エージェントを検証済みアウトカムへ導く実践。5 段階(DISCOVER→PLAN→EXECUTE→VERIFY→ITERATE)・6 構成要素・オープン/クローズドの 2 種別を定義(concept 新規) - [[Boris Cherny]] — Anthropic Claude Code ヘッド。「私の仕事はループを書くことだ」と発言(entity 新規) - [[Peter Steinberger]] — OpenClaw 作成者・OpenAI 在籍。「エージェントにプロンプトを送るループを設計せよ」と発言(entity 新規) - [[Sai Rahul]] — @sairahul1、AI/プロダクト/システム解説者(entity 新規) ### 2026-06-22 The Big LLM Architecture Comparison (Sebastian Raschka) ingest - [[The-Big-LLM-Architecture-Comparison|The Big LLM Architecture Comparison]] — [[Sebastian Raschka]] による DeepSeek V3〜Gemma 4 の主要 LLM アーキテクチャ包括比較サーベイ記事(Substack 2025-07-19、最終更新 2026-04-02)。(source / article / llm / architecture / survey) - [[Multi-Head Latent Attention]] — KV キャッシュ圧縮型アテンション。GQA より高性能・高実装コスト(concept 新規) - [[Grouped-Query Attention]] — K/V 共有型アテンション。現世代デファクトスタンダード(concept 新規) - [[スライディングウィンドウアテンション]] — ローカルアテンションによる KV キャッシュ削減(concept 新規) - [[NoPE]] — 位置符号化なし。長さ汎化に優れる(concept 新規) - [[QK-Norm]] — アテンション内 Q/K への RMSNorm。訓練安定化(concept 新規) - [[Gated DeltaNet]] — 線形アテンション変種。Qwen3-Next / Kimi Linear が採用(concept 新規) - [[Sebastian Raschka]] — AI 著述家・LLMs from Scratch 著者(entity 新規) - [[Gemma 3]] / [[Gemma 4]] — Google オープンウェイト LLM(entity 新規 x2) - [[Qwen3]] / [[Qwen3-Next]] — Alibaba LLM シリーズ / 後継モデル(entity 新規 x2) - [[GPT-OSS]] — OpenAI 初オープンウェイト(entity 新規) - [[SmolLM3]] — HuggingFace 3B NoPE 採用モデル(entity 新規) - [[Mistral 3]] — Mistral AI フラッグシップ MoE。DeepSeek V3 同一アーキテクチャ(entity 新規) - [[Kimi Linear]] — Moonshot AI 線形アテンションハイブリッド 48B(entity 新規) - [[Arcee AI Trinity Large]] — Arcee AI 400B MoE(entity 新規) - [[Xiaomi MiMo-V2-Flash]] — Xiaomi 309B MoE、SWA 128 トークンウィンドウ(entity 新規) - [[OLMo 2]] — Allen AI 完全透明オープン LLM(entity 新規) ### 2026-06-21 Datadog Bits AI SRE GA 発表記事 ingest - [[@2025__Datadog__Introducing Bits AI SRE]] — Kai Xin Tai([[Datadog]])、2025-06-10 公開・2025-12-02 更新。Bits AI SRE の GA 発表とプレビュー機能(Bits AI Dev Agent・トリガー拡大・推奨アクション)。(source / article / sre / aiops / product) - [[Bits AI SRE]] — GA 後の拡張(文脈記憶・コード修正・Watchdog トリガー)を反映(entity、更新)。 - [[agentic SRE]] — 調査→修正拡張・プロアクティブトリガー・調査間記憶の横断知見を追加(concept、更新)。 - [[Datadog]] — 新ソース参照を追加(entity、更新)。 ### 2026-06-21 マイクロサービス RCA・マルチモーダル障害診断 7 論文一括(LocaleXpert / UniTok / MRCA / HolisticRCA / Medicine / ChangeLLM / DeepHunt) - [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]] — [[Zhenyu Zhong]] ほか。LLM+統計的障害箇所特定のハイブリッド設計 LocaleXpert(TSC 2026)。(source / paper / aiops / rca / llm) - [[@2026__arXiv__Time Series as Language - A Universal Tokenizer for General-Purpose Time Series Foundation Models]] — [[Yunhao Zhang]]・[[Junchi Yan]] ほか。VQ-VAE ベース汎用時系列トークナイザ UniTok と NTP 基盤モデル UniTok-FM(arXiv 2026)。(source / paper / time-series / foundation-model) - [[@2024__ASE__MRCA - Metric-level Root Cause Analysis for Microservices via Multi-Modal Data]] — [[Yidan Wang]] ほか。マルチモーダルデータからメトリクスレベル根本原因を特定する MRCA(ASE 2024)。(source / paper / aiops / rca / multi-modal) - [[@2024__TSC__Holistic Root Cause Analysis for Failures in Cloud-Native Systems Through Observability Data]] — [[Yongqi Han]]・[[Qingfeng Du]] ほか。3 モダリティ統合の包括的 RCA(TSC 2024)。(source / paper / aiops / rca / cloud-native) - [[@2024__ASE__Giving Every Modality a Voice in Microservice Failure Diagnosis via Multimodal Adaptive Optimization]] — [[Lei Tao]]・[[Shenglin Zhang]] ほか。マルチモーダル適応最適化フレームワーク Medicine(ASE 2024)。(source / paper / aiops / multi-modal / failure-diagnosis) - [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]] — [[Yuchi Ma]] ほか。LLM ベースのマルチモーダル変更影響評価 ChangeLLM/SCELM(FSE 2025)。(source / paper / aiops / change-management / llm) - [[@2025__TOSEM__Interpretable Failure Localization for Microservice Systems Based on Graph Autoencoder]] — [[Yongqian Sun]]・[[Shenglin Zhang]] ほか。グラフオートエンコーダベースの解釈可能な障害箇所特定 DeepHunt(TOSEM 2025)。(source / paper / aiops / fault-localization / graph-autoencoder) - [[根本原因分析]] / [[マルチモーダル障害診断]] / [[LLMによる根本原因分析]] / [[変更起因インシデント]] / [[時系列基盤モデル]] — 概念(concept、更新)。(concept / aiops / time-series) - 新規エンティティ 18 件(person 15 / organization 3) — 詳細は [[entities/_index]]。 ### 2026-06-20 マイクロサービス RCA 6 論文一括(TraceRank / LogCluster / LogKG / FSF / Nezha / Eadro) - [[@2021__JSEP__TraceRank - Abnormal service localization with dis-aggregated end-to-end tracing data in cloud native systems]] — [[Guangba Yu]] ほか。非集計トレース + スペクトル解析 + PageRank による異常サービス箇所特定(JSEP 2021)。(source / paper / aiops / rca / distributed-tracing) - [[@2016__ICSE-C__Log Clustering Based Problem Identification for Online Service Systems]] — [[Qingwei Lin]]・[[Hongyu Zhang]]・[[Jian-Guang Lou]] ほか。IDF ログクラスタリング + 知識ベース照合(ICSE Companion 2016)。(source / paper / aiops / log-analysis) - [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]] — [[Yicheng Sui]]・[[Shenglin Zhang]]・[[Dan Pei]] ほか。知識グラフによるログ障害診断(TSC 2023)。(source / paper / aiops / log-analysis / knowledge-graph) - [[@2022__IEEE CLOUD__Localizing and Explaining Faults in Microservices Using Distributed Tracing]] — [[Jesus Rios]]・[[Saurabh Jha]]・[[Larisa Shwartz]]。スパンツリー因果推論による教師なし障害箇所特定(IEEE CLOUD 2022)。(source / paper / aiops / fault-localization / distributed-tracing) - [[@2023__ESEC-FSE__Nezha - Interpretable Fine-Grained Root Causes Analysis for Microservices on Multi-modal Observability Data]] — [[Guangba Yu]]・[[Pengfei Chen]] ほか。メトリクス+トレース+ログ 3 モダリティ統合のコード領域レベル RCA(ESEC/FSE 2023)。(source / paper / aiops / rca / multi-modal) - [[@2023__arXiv__Eadro - An End-to-End Troubleshooting Framework for Microservices on Multi-source Data]] — [[Cheryl Lee]]・[[Michael R. Lyu]] ほか。異常検知 + 箇所特定統合のエンドツーエンド障害診断(arXiv 2023)。(source / paper / aiops / rca / multi-source) - [[ログクラスタリング]] / [[知識グラフ]] — 概念(concept、新規)。(concept / aiops) - [[Zicheng Huang]] / [[Jian-Guang Lou]] / [[Xuewei Chen]] / [[Yu Zhang]] / [[Yicheng Sui]] / [[Jesus Rios]] / [[Larisa Shwartz]] / [[Cheryl Lee]] / [[Tianyi Yang]] / [[Yuxin Su]] / [[Zibin Zheng]] — エンティティ(person、新規)。(entity / person) ### 2026-06-20 Energy statistics (JSPI 2013) - [[@2013__JSPI__Energy statistics - A class of statistics based on distances]] — [[Gábor J. Székely]]・[[Maria L. Rizzo]]。距離に基づく統計量族のレビュー。エネルギー距離・DISCO・E-クラスタリング・dCov/dCor・ブラウン共分散との同値性を体系化(JSPI 2013)。(source / paper / jspi / statistics / dependence-measure) - [[エネルギー統計]] / [[距離相関]] — 概念(concept)。(concept / statistics / distance-statistics) - [[Gábor J. Székely]] / [[Maria L. Rizzo]] — エンティティ(person)。(entity / person) ### 2026-06-20 分散トレーシング基礎論文 5 本一括(Pinpoint / Magpie / lprof / Pivot Tracing / Canopy) - [[@2002__DSN__Pinpoint - Problem Determination in Large, Dynamic Internet Services]] — [[Mike Y. Chen]]・[[Emre Kıcıman]]・[[Armando Fox]]・[[Eric Brewer]]。J2EE 計装 + 決定木/χ²検定による障害コンポーネント自動特定(DSN 2002)。(source / paper / dsn / distributed-systems / fault-localization) - [[@2003__HotOS__Magpie - Online Modelling and Performance-aware Systems]] — [[Paul Barham]]・[[Rebecca Isaacs]]・[[Richard Mortier]]。イベントベースリクエスト抽出とオンラインワークロードモデリング(HotOS IX 2003)。(source / paper / hotos / distributed-tracing) - [[@2014__OSDI__lprof - A Non-intrusive Request Flow Profiler for Distributed Systems]] — [[Xu Zhao]]・[[Ding Yuan]]・[[Michael Stumm]]。バイトコード静的解析による非侵入リクエストフロープロファイラ(OSDI 2014)。(source / paper / osdi / distributed-tracing) - [[@2015__SOSP__Pivot Tracing - Dynamic Causal Monitoring for Distributed Systems]] — [[Jonathan Mace]]・[[Ryan Roelke]]・[[Rodrigo Fonseca]]。happened-before join + 動的計装による実行時因果モニタリング(SOSP 2015)。(source / paper / sosp / distributed-tracing) - [[@2017__SOSP__Canopy - An End-to-End Performance Tracing And Analysis System]] — [[Jonathan Kaldor]] ほか。Facebook 規模のエンドツーエンド性能トレーシング・分析パイプライン(SOSP 2017)。(source / paper / sosp / distributed-tracing) - [[Pinpoint]] / [[Magpie]] / [[lprof]] / [[Pivot Tracing]] / [[Canopy]] / [[Scuba]] — エンティティ(product)。(entity / product) - [[Mike Y. Chen]] / [[Emre Kıcıman]] / [[Armando Fox]] / [[Eric Brewer]] / [[Paul Barham]] / [[Rebecca Isaacs]] / [[Richard Mortier]] / [[Xu Zhao]] / [[Ding Yuan]] / [[Michael Stumm]] / [[Jonathan Mace]] / [[Ryan Roelke]] / [[Rodrigo Fonseca]] / [[Jonathan Kaldor]] — エンティティ(person)。(entity / person) - [[Stanford University]] / [[Brown University]] / [[University of Toronto]] / [[UC Berkeley ROC Project]] / [[Facebook]] / [[Meta]] / [[Microsoft Research]] — エンティティ(organization)。(entity / organization) - [[動的計装]] / [[リクエストモデリング]] / [[非侵入プロファイリング]] — 新規概念。(concept / new) - [[分散トレーシング]] / [[Fault Localization]] / [[トレースサンプリング]] / [[根本原因分析]] — 更新概念。(concept / updated) ### 2026-06-20 ISSTA 2016 — Practitioners' Expectations on Automated Fault Localization - [[@2016__ISSTA__Practitioners' Expectations on Automated Fault Localization]] — [[Pavneet Singh Kochhar]]・[[Xin Xia]]・[[David Lo]]・[[Shanping Li]]。386 名実務者調査 + 文献レビュー 15 本。FL 採用閾値(Top-5・成功率 75%・100kLOC・1 分・判断根拠)定量化。(source / paper / issta / se / fl) - [[Xin Xia]] — [[Zhejiang University]] 教授。(entity / person) - [[Pavneet Singh Kochhar]] — [[Singapore Management University]]。(entity / person) - [[Shanping Li]] — [[Zhejiang University]] 教授。(entity / person) - [[Singapore Management University]] — SMU、シンガポールの私立大学。(entity / organization) - [[Fault Localization]] — 更新: SFL 採用閾値(Kochhar+ 2016)と AIOps 評価指標の接続を横断的知見に追記。(concept / updated) ### 2026-06-20 BARO — Robust RCA via Multivariate Bayesian Online Change Point Detection - [[@2024__FSE__BARO - Robust Root Cause Analysis for Microservices via Multivariate Bayesian Online Change Point Detection]] — [[Luan Pham]]・[[Huong Ha]]・[[Hongyu Zhang]]([[RMIT University]] / [[Chongqing University]])による FSE 2024 論文。多変量 BOCPD と RobustScorer(中央値・IQR ベース)を組み合わせたエンドツーエンド RCA フレームワーク BARO を提案。Online Boutique/Sock Shop/Train Ticket で既存手法(CIRCA・RCD・CausalRCA 等)を一貫して上回り、異常検知時刻の誤差への頑強性を実証。(source / paper / fse / aiops / rca / microservices) - 更新 entity: [[Luan Pham]] / [[Huong Ha]] / [[Hongyu Zhang]] - 更新 concept: [[変化点検知]](多変量 BOCPD の知見追加)/ [[根本原因分析]](RobustScorer の横断的知見追加)/ [[因果推論ベースRCA]](BARO と因果グラフ手法比較の横断的知見追加) - Key insight: 因果グラフを使わないノンパラメトリック手法 BARO が因果グラフ手法を凌駕する根拠は、「異常検知時刻のずれへの非感度設計」にある。これは辺方向推定がボトルネックという ASE 2024 の観察を補完する新たな設計要件を提示。 ### 2026-06-20 IWQoS 2020 — MicroCause - [[@2020__IWQoS__Localizing Failure Root Causes in a Microservice through Causality Inference]] — [[Yuan Meng]]・[[Shenglin Zhang]] ほか。PCTS + TCORW によるイントラマイクロサービス障害根本原因特定。AC@5=98.7%。(source / paper / aiops / rca / microservices / causal-inference) - [[Yuan Meng]] — [[Tsinghua University]] / BNRist。MicroCause 第一著者。(entity / person) - [[Ruru Zhang]] — [[Nankai University]]。MicroCause 共著者。(entity / person) - [[Zhilong Hu]] — [[Nankai University]]。MicroCause 共著者。(entity / person) - [[Yiyin Zhang]] — [[Alibaba Group]]。MicroCause 共著者。(entity / person) - [[Chenyang Jia]] — [[Alibaba Group]]。MicroCause 共著者。(entity / person) - [[Zhaogang Wang]] — [[Alibaba Group]]。MicroCause 共著者。(entity / person) - [[因果推論ベースRCA]] — PCTS/TCORW 知見を横断的知見に追記。(concept / updated) ### 2026-06-20 KDE チュートリアル + DirectLiNGAM - [[A Tutorial on Kernel Density Estimation and Recent Advances]] — [[Yen-Chi Chen]]([[University of Washington]])による KDE チュートリアル。収束レート・帯域幅選択・信頼帯構成のバイアス処理・密度の幾何学的/位相的特徴推定を体系的に概観。(source / paper / nonparametric-statistics / density-estimation) - [[@2011__JMLR__DirectLiNGAM - A Direct Method for Learning a Linear Non-Gaussian Structural Equation Model]] — [[Shohei Shimizu]]・[[Aapo Hyvärinen]]・[[Kenneth Bollen]] ほか([[Osaka University]] / [[University of Helsinki]])。ICA に依存しない LiNGAM の直接推定法。固定ステップ数での収束保証。(source / paper / causal-discovery) - 新規 entity: [[Yen-Chi Chen]] / [[Shohei Shimizu]] / [[Aapo Hyvärinen]] / [[Kenneth Bollen]] / [[Osaka University]] / [[University of Helsinki]] - 更新 entity: [[University of Washington]] - 新規 concept: [[カーネル密度推定]] - 更新 concept: [[因果発見]](DirectLiNGAM の位置づけ・横断的知見追加)/ [[密度ベースクラスタリング]](KDE との理論的接続追加) ### 2026-06-20 クラスタリング基礎論文 3 本(DBSCAN / HDBSCAN / k-Shape) - [[@1996__KDD__A Density-Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise]] — [[Martin Ester]]・[[Hans-Peter Kriegel]]・[[Jörg Sander]]・Xiaowei Xu(University of Munich)による KDD 1996 論文。密度ベースのクラスタ定義(核点・密度到達可能性・密度接続)に立脚した DBSCAN を提案。クラスタ数の事前指定不要で任意形状のクラスタを発見し、CLARANS に対し 100 倍以上の効率を実証。(source / paper / clustering / spatial-databases) - [[@2013__PAKDD__Density-Based Clustering Based on Hierarchical Density Estimates]] — [[Ricardo J.G.B. Campello]]・[[Davoud Moulavi]]・[[Jörg Sander]](University of Alberta)による PAKDD 2013 論文。DBSCAN の全解を単一パラメータ mpts で階層的に列挙する HDBSCAN を提案。相対超過質量に基づくクラスタ安定性尺度と最適フラット分割抽出アルゴリズムを導入。OPTICS(AutoCl) と AUTO-HDS を有意に上回る。(source / paper / clustering / density-based) - [[@2016__SIGMOD Record__k-Shape - Efficient and Accurate Clustering of Time Series]] — [[John Paparrizos]]・[[Luis Gravano]](Columbia University)による SIGMOD 2015(SIGMOD Record 2016 再録)論文。正規化相互相関に基づく形状ベース距離 SBD と Rayleigh 商最大化によるセントロイド計算を組み合わせた k-Shape を提案。48 データセットで全スケーラブル手法中唯一の最高精度を達成。(source / paper / clustering / time-series) - 新規 entity: [[Martin Ester]] / [[Hans-Peter Kriegel]] / [[Jörg Sander]] / [[Ricardo J.G.B. Campello]] / [[Davoud Moulavi]] / [[Luis Gravano]] - 更新 entity: [[John Paparrizos]](k-Shape 原著の情報を追記) - 新規 concept: [[密度ベースクラスタリング]] / [[クラスタ安定性]] - 更新 concept: [[時系列クラスタリング]](距離尺度セクションと横断的知見を追加) - Key insight: DBSCAN のグローバル密度閾値の限界を HDBSCAN が階層化と安定性尺度で解決。密度ベースクラスタリングは 17 年間で「単一閾値→階層→最適抽出」と進化し、境界点の排除により密度レベルセットとの理論的整合性も改善された。 --- ### 2026-06-19 Signal Processing — Selective review of offline change point detection methods - [[@2020__Signal Processing__Selective review of offline change point detection methods]] — [[Charles Truong]]・[[Laurent Oudre]]・[[Nicolas Vayatis]]([[ENS Paris-Saclay]] / University Paris 13)による Signal Processing 2020 サーベイ。オフライン変化点検知手法を**コスト関数**(パラメトリック 7 種 + ノンパラメトリック 6 種 = 計 13 種)・**探索手法**(Opt: 動的計画法 $O(KT^2)$、Pelt: 枝刈り線形時間、Win・BinSeg・BotUp: 近似)・**制約**(l0/l1/複雑ペナルティ)の 3 軸で統一分類。Python ライブラリ [[ruptures]] として実装公開。(source / paper / signal-processing / change-point-detection / survey) - 新規 entity: [[Charles Truong]] / [[Laurent Oudre]] / [[Nicolas Vayatis]] / [[ruptures]] - 更新 concept: [[変化点検知]](3 軸分類と AIOps 応用の手法選択収束の横断的知見、ノンパラメトリックコスト関数の AIOps 評価に関する未解決の問いを追加) - Key insight: 変化点検知の 3 軸分解は手法のモジュール的選択を可能にするが、AIOps 実運用では $c_{L_2}$ + Pelt に収束しておりサーベイが示す多様なコスト関数の比較が未踏である。 --- ### 2026-06-19 PVLDB — Time-Series Clustering: A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods - [[@2025__PVLDB__Time-Series Clustering - A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods]] — [[John Paparrizos]]・Bogireddy([[The Ohio State University]])による PVLDB 2025 論文。84手法を10クラス(分割型・カーネル・密度・階層・分布・シェイプレット・半教師あり・モデル・深層学習・基盤モデル)に分類し、[[UCR Time Series Archive]] 全128データセットで Wilcoxon 検定・Friedman-Nemenyi 検定を用いて評価。10年前の k-Shape を統計的有意に上回る手法は皆無。深層学習では RES-CNN + CNRV の組み合わせが最良だが k-Shape と同等。基盤モデル(CHRONOS・OFA・MOMENT)もクラスタリングでは古典手法を超えられず、MOMENT のデータ汚染を指摘。(source / paper / pvldb / time-series / clustering / benchmark) - 新規 entity: [[John Paparrizos]] / [[UCR Time Series Archive]] - 更新 entity: [[The Ohio State University]](Paparrizos・時系列クラスタリング研究を追記) - 新規 concept: [[時系列クラスタリング]] - 更新 concept: [[時系列基盤モデル]](TSFM のクラスタリング性能が k-Shape を上回れない知見を追加) - Key insight: 10年間の「進歩」は先行ベンチマークのバグ(tslearn k-Shape 実装)・不公平なパラメータ設定・限定的データセット選択に起因する幻想であった。基盤モデルが予測タスクで示すスケーリング則はクラスタリング等の下流タスクに転移しない可能性がある。 --- ### 2026-06-19 Boris Tane Blog — The Software Development Lifecycle Is Dead - [[@2026__Boris Tane Blog__The Software Development Lifecycle Is Dead]] — [[Boris Tane]](2026-02-20)。AI エージェントが従来 SDLC を解体し、Intent → Agent → Build/Test/Deploy → Observe → Repeat というループへ収束したと論じる。唯一生き残るフェーズはモニタリング(オブザーバビリティ)。新差別化要因は[[コンテキストエンジニアリング]]。(article / software-development / ai-native / observability) - 新規 entity: [[Boris Tane]] - 新規 concept: [[コンテキストエンジニアリング]] / [[AIネイティブ開発]] - Key insight: SDLC の解体はオブザーバビリティを「最後のフェーズ」から「ループの中心」へ転換させる。Karpathy の「bookkeeping は LLM に」という主張と Tane の「コンテキスト品質が差別化要因」は AI 時代の人間の付加価値が「入力設計」に移ることで一致している。 --- ### 2026-06-19 CSUR — D'ya Like DAGs? A Survey on Structure Learning and Causal Discovery - [[D'ya like DAGs]] — [[Matthew J. Vowels]]・[[Necati Cihan Camgoz]]・[[Richard Bowden]](CVSSP, [[University of Surrey]])による ACM Computing Surveys 2022 サーベイ。構造発見の4系統(制約ベース・スコアベース・構造的非対称性・介入)を統一整理し、組合せ手法約60件と連続最適化手法約30件を横断比較。NOTEARS(2018)以降の連続最適化パラダイムを初めて体系化。「因果の跳躍」への哲学的批判を展開。(source / paper / causal-discovery / structure-learning / survey) - 新規 entity: [[Matthew J. Vowels]] / [[Necati Cihan Camgoz]] / [[Richard Bowden]] - 更新 entity: [[University of Surrey]](CVSSP・因果発見研究を追記) - 更新 concept: [[因果発見]](連続最適化パラダイムの追加・Glymour 2019 との横断的知見3件)/ [[因果推論ベースRCA]](DAG-GNN/NOTEARS 系の低次元評価制約と RCA 応用の接続) - Key insight: Glymour+ 2019 が組合せ手法の理論的厳密性を整理したのに対し、Vowels+ 2022 は連続最適化手法の実践的スケーラビリティを体系化した。両サーベイの対比から、RCA で使われる DAG-GNN・NOTEARS 系が元来 <100 変数でしか評価されておらず、マイクロサービスの数百メトリクスへの適用が理論的にも実験的にも未検証であることが明確になる。 --- ### 2026-06-19 Frontiers in Genetics — Review of Causal Discovery Methods Based on Graphical Models - [[@2019__Frontiers in Genetics__Review of Causal Discovery Methods Based on Graphical Models]] — [[Clark Glymour]]・[[Kun Zhang]]・[[Peter Spirtes]]([[Carnegie Mellon University]])による Frontiers in Genetics 2019 レビュー。制約ベース(PC・FCI)・スコアベース(GES)・関数的因果モデルベース(LiNGAM・ANM・PNL)の3系統を30年分体系化。忠実性仮定・識別可能性条件・スケーラビリティの対比、時系列因果発見の課題、生物学応用ガイドライン10項目を整理。(source / paper / causal-discovery / graphical-models / review) - 新規 entity: [[Clark Glymour]] / [[Kun Zhang]] / [[Peter Spirtes]] - 更新 entity: [[Carnegie Mellon University]](因果発見アルゴリズム発祥拠点を追記) - 新規 concept: [[因果発見]] - 更新 concept: [[因果推論ベースRCA]](Glymour 理論体系との接続——忠実性仮定・前処理分布歪み・FCI vs PC の交絡ギャップが RCA 失敗モードを説明) - Key insight: 因果発見の3系統は「スケーラビリティ vs 識別力」のトレードオフで位置づけられ、RCA で使われる PC・LiNGAM・Granger 等の理論的仮定と限界を体系的に理解する基盤を提供する。クラメール分解定理により線形関係下では非ガウス分布が遍在するが、前処理がこの非ガウス性を人為的に除去するリスクが分野を超えて存在する。 --- ### 2026-06-19 Physics Reports — Signal propagation in complex networks - [[@2023__Physics Reports__Signal propagation in complex networks]] — [[Peng Ji]] ほか([[Fudan University]]・PIK・[[University of Maribor]] ほか)。感染症・蔵本モデル・反応拡散・カスケード障害から GNN・転送エントロピー・AI 時系列解析、疫学・電力網・ロボット群への応用まで体系化した 96 ページ包括サーベイ(source / paper / complex-networks / survey) - 新規 entity: [[Peng Ji]] / [[Jürgen Kurths]] / [[Matjaž Perc]] / [[University of Maribor]] - 新規 concept: [[複雑ネットワーク]] / [[信号伝播]] - Key insight: 信号伝播のジオメトリはトポロジーと非線形相互作用の両方によって規定される。時変ネットワークの静的近似は真の伝播パターンを正確に反映できないため、時間的ネットワーク固有の解析が必要。 --- ### 2026-06-19 CSUR — Anomaly Detection: A Survey - [[Anomaly Detection - A Survey]] — [[Varun Chandola]]・[[Arindam Banerjee]]・[[Vipin Kumar]]([[University of Minnesota]])による ACM Computing Surveys 2009 論文。異常検知を点異常・文脈異常・集合異常、教師あり/半教師あり/教師なし、スコア/ラベル出力、6 技法群の仮定ベース比較として体系化する(source / paper / anomaly-detection / survey) - 新規 entity: [[Varun Chandola]] / [[Arindam Banerjee]] / [[Vipin Kumar]] / [[University of Minnesota]] - 更新 concept: [[異常検知]](古典 taxonomy、2015 PADBI・2021 マイクロサービスサーベイ・現代 AIOps への接続) - Key insight: Chandola 2009 の「技法は性能表より仮定で比較する」という見方は、LLM/時系列基盤モデル時代の異常検知にも残る。文脈異常は、現代の practical anomaly やアラート文脈依存性の古典的基礎である。 --- ### 2026-06-19 System@Scale: AI Observability (Meta, 2023) - [[@2023__SystemAtScale__AI Observability]] — [[Valentin Andrei]] ほか([[Meta]])による System@Scale 2023 講演。Dynolog・LibAsicMon・Kineto・Gpusnoop から成る 4 層 AI 観測性スタックを公開。FLOPs/sec と rDevice hour/Byte の二指標でフリートを評価する。(source / video / observability / gpu) - 新規 entity: [[Valentin Andrei]] / [[Dynolog]] / [[LibAsicMon]] / [[Kineto]] - 更新 entity: [[Meta]] - 更新 concept: [[GPU観測性]](Meta 4 層スタック・二指標の横断知見追加) --- ### 2026-06-19 Karpathy「LLM Wiki」× 稲見昌彦 3部作 — 考察更新 - [[@2026__GitHub Gist__LLM Wiki]] — [[Andrej Karpathy]](2026-04-04)による個人知識ベースアーキテクチャ提案。3層構造(Raw Sources→Wiki→Schema)と3操作(Ingest/Query/Lint)。「bookkeeping は LLM が担い人間はキュレーターと問いかけ者に専念」が核心。[[Vannevar Bush]] の Memex(1945)が残した「誰が維持管理するか」を LLM が解く。(source / article / knowledge-management) - 新規 entity: [[Andrej Karpathy]] / [[Vannevar Bush]] - 新規 concept: [[LLM Wikiパターン]] - 更新 concept: [[Human-out-of-the-loop]](Karpathy 視点追加・稲見との役割非対称性を明示)/ [[サイバネティクス]](Bush-Wiener-Karpathy 80年の収束を追記) - Key insight: 稲見(2026-02)が「科学者は翻訳者へ/ループのボトルネックは人間だ」と論じた2か月後、Karpathy(2026-04)が同じ問題意識を知識管理として独立に実装した。両者の差異は人間の残余的役割の配置: 稲見はAIループの出力側(翻訳者)、Karpathy は入力側(キュレーター)。 --- ### 2026-06-19 稲見昌彦「科学とAIとループ」3部作エッセイ(note.com) - [[@2026__note.com__科学の終焉と、新しい科学の始まり]] — [[稲見昌彦]]([[東京大学先端科学技術研究センター]])による連作エッセイ第一部(2026-02-05)。因果推論から構造圧縮へ科学の役割が変わる論、Human-out-of-the-loop・アロスタシス・サイバネティクスの交差。(source / article / ai-science / human-ai) - [[@2026__note.com__Out of the Blue]] — 同第二部(2026-02-12)。out of the loop の先を「inside the loops」と呼び、See-through/Feel-through・光学迷彩・調律概念で感覚拡張を論じる。(source / article / ar / cybernetics) - [[@2026__note.com__ループのボトルネックは、人間だ]] — 同第三部(2026-02-18)。CES 2026 体験からバイブコーディング・テレイグジスタンスを論じ、ライプニッツのモナド論でAIループを「操作」から「感じ取る」へ転換する。(source / article / telexistence / vibe-coding) - 新規 entity: [[稲見昌彦]] / [[東京大学先端科学技術研究センター]] / [[ノーバート・ウィーナー]] / [[Max Tegmark]] / [[舘暲]] / [[ゴットフリート・ライプニッツ]] / [[ジェンスン・フアン]] / [[ティモシー・リアリー]] / [[ヘレン・ケラー]] / [[VPL社]] - 新規 concept: [[Human-out-of-the-loop]] / [[サイバネティクス]] / [[アロスタシス]] / [[inside the loops]] / [[See-through]] / [[Feel-through]] / [[光学迷彩]] / [[拡張現実感]] / [[調律]] / [[バイブコーディング]] / [[テレイグジスタンス]] / [[情報顕微鏡]] / [[モナド論]] - Key insight: 3部を貫く論題は「ループから外れた人間はどこへ行くか」。第一部は理論的基盤(サイバネティクス→科学の翻訳者化)、第二部は感覚拡張(inside the loops / 調律)、第三部は実践と哲学的総括(バイブコーディング→モナド論)として展開する。 --- ### 2026-06-19 SREcon19 EMEA — Latency SLOs Done Right - [[@2019__SREcon19 EMEA__Latency SLOs Done Right]] — [[Heinrich Hartmann]]([[Circonus]])による SREcon19 EMEA 2019 講演資料。レイテンシ SLO を、対象期間中にしきい値以内で処理されたリクエスト割合として実装する方法を整理し、パーセンタイル時系列の集約不能性を示す (source / slides / sre / slo) - 新規 entity: [[Heinrich Hartmann]], [[Circonus]] - 新規 concept: [[ヒストグラムメトリクス]] - 更新 concept: [[サービスレベル目標]] ### 2026-06-19 マイクロサービス障害診断包括サーベイ (arXiv 2407.01710) - [[Failure Diagnosis in Microservice Systems]] — [[Shenglin Zhang]] ほか([[Nankai University]] / [[Microsoft]] / [[Tsinghua University]])による arXiv 2024 包括サーベイ。98 論文を体系化し、ログ/メトリクス/トレース/マルチモーダルの 4 カテゴリ分類・RCL と FC の問題設定・公開リソース一覧を整理 (source / paper / aiops / microservices / survey) - 更新 entity: [[Shenglin Zhang]] - 更新 concept: [[マルチモーダル障害診断]] / [[根本原因分析]] - Key insight: result fusion → model fusion → feature fusion のマルチモーダル進化線と、PC アルゴリズム + ランダムウォークの古典的パイプラインの普及範囲が 98 論文スケールで初めて可視化された。LLM + 知識グラフ統合が今後の重要方向として明示。 ### 2026-06-19 GRLIA — Graph-based Incident Aggregation - [[@2021__ASE__Graph-based Incident Aggregation for Large-Scale Online Service Systems]] — [[Zhuangbin Chen]] ほか([[The Chinese University of Hong Kong]] / [[University of Newcastle]] / [[Huawei Cloud]])による ASE 2021 論文。[[GRLIA]] は、EVT 障害検知、KPI による障害影響グラフ補完、incident type の DeepWalk/Word2Vec 表現学習、トポロジ距離つきオンライン集約を統合する(source / paper / aiops / incident-management) - 新規 entity: [[GRLIA]] / [[OpsPAI]] / [[Xuemin Wen]] / [[Xiao Ling]] - 更新 entity: [[Zhuangbin Chen]] / [[Jinyang Liu]] / [[Yuxin Su]] / [[Hongyu Zhang]] / [[Yongqiang Yang]] / [[Michael R. Lyu]] / [[Huawei Cloud]] / [[The Chinese University of Hong Kong]] / [[University of Newcastle]] - 更新 concept: [[アラート集約]] / [[インシデント管理]] / [[サービス依存グラフ]] / [[グレイ障害]] - Key insight: インシデント集約の難しさはテキスト非類似だけでなく、障害伝播経路上のサービスがフォールトトレランスや閾値未満状態により沈黙することにある。GRLIA はこの欠落を KPI トレンドで補完し、表現学習に渡す障害影響グラフ自体を改善する。 ### 2026-06-27 O11yCon Tokyo 2025 — AIスパコン「さくらONE」のオブザーバビリティ - [[@2025__O11yConTokyo2025__AIスパコン「さくらONE」のオブザーバビリティ]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]])Observability Conference Tokyo 2025。SAKURAONE のオブザーバビリティ基盤(OTeL + Grafana)の構成開示、オブザーバビリティギャップの整理、GPU ゼロコード計装と R-Pingmesh(source / slides / observability / gpu / hpc) ### 2026-06-18 SpeakerDeck — AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性 - [[@2025__SpeakerDeck__AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性]] — [[Yuuki Tsubouchi]]([[SAKURA internet Inc]])による情報処理学会中国支部主催講演会資料。深層学習ワークロード、GPU/集団通信、[[SAKURAONE]]、GPT-3 175B 事前学習ベンチマーク、ジョブ履歴分析、OTel + Grafana、GPU ゼロコード計装、[[R-Pingmesh]] 型 RoCE 監視、AI スパコン障害管理研究動向を横断整理(source / slides / ai-supercomputer / observability) - 更新 entity: [[Yuuki Tsubouchi]] / [[SAKURA internet Inc]] / [[SAKURAONE]] / [[R-Pingmesh]] - 更新 concept: [[GPU観測性]] / [[LLM学習モニタリング]] / [[RDMAネットワーク監視]] - Key insight: AI スパコン可観測性の難しさは、技術的な細粒度計装だけでなく、クラウド事業者がユーザーコード・アプリログへ入れない責任境界から来る。リソース分析とワークロード分析を分けたうえで、非侵入に学習処理スパン・集団通信・RoCE 経路へ意味を戻すことが次の課題。 ### 2026-06-18 Contextual Retrieval — Anthropic Engineering Blog - [[@2024__Anthropic Engineering Blog__Introducing Contextual Retrieval]] — [[Daniel Ford]]([[Anthropic]])による Contextual Retrieval 提案記事。Contextual Embeddings + Contextual BM25 + リランキングで RAG 検索失敗率を 5.7% → 1.9% に 67% 削減(source / article / rag / information-retrieval) - 新規 entity: [[Daniel Ford]] - 更新 entity: [[Anthropic]](文脈付き検索の一次資料追加・数値修正) - 更新 concept: [[文脈付き検索]](seed → developing; 一次資料数値・BM25・リランキング・横断的知見を追加) - Key insight: BM25 語彙一致は埋め込み単体を上回る。複数技術の効果は累積的で、チャンク分割による文脈損失が RAG の主要ボトルネック。 ### 2026-06-18 PyTorch Conference 2025 — LMCache + NIXL - [[@2025__PyTorchConference__Scaling KV Caches for LLMs - How LMCache + NIXL Handle Network and Storage Heterogeneity]] — [[Moein Khazraee]]([[NVIDIA]])・[[Junchen Jiang]]([[University of Chicago]] / [[LMCache]])による PyTorch Conference 2025 講演資料。[[LMCache]] を KV キャッシュ層、[[NIXL]] を異種ネットワーク/ストレージ転送層として位置づけ、Memory Section、Metadata Handler、UCX/GDS/OBJ 例、VAST Storage での長コンテキスト TTFT 削減を示す(source / slides / llm-serving / kv-cache) - 新規 entity: [[Moein Khazraee]] - 更新 entity: [[Junchen Jiang]] / [[LMCache]] / [[NIXL]] - 更新 concept: [[KVキャッシュ管理]] / [[LLM推論]] / [[Prefill-Decode分離]] - Key insight: KV キャッシュ最適化は、GPU 内 page/chunk 粒度だけでなく、DRAM/VRAM/BLK/FILE/OBJ を登録し、remote metadata を交換し、非同期 Xfer request で転送する制御面・データ面の設計問題になっている ### 2026-06-18 GPT-4 Technical Report - [[@2023__arXiv__GPT-4 Technical Report]] — OpenAI。予測可能スケーリング・マルチモーダル・RLHF アライメント(source / paper / llm) - 更新 concept: [[LLMスケーリング則]] / [[LLM評価]] / [[RLHF誤誘導]] - 更新 entity: [[OpenAI]] ### 2026-06-18 KV キャッシュ・GPU クラスタ論文 5 本 - [[@2026__arXiv__KVCache Cache in the Wild - Characterizing and Optimizing KVCache Cache at a Large Cloud Provider]] — [[Xingda Wei]] ほか(SJTU IPADS / [[Alibaba Group]])。Aliyun 本番ワークロードの KV キャッシュ特性を初の体系的分析。理想ヒット率 to-C 62%/to-B 54%(合成 80% 超を大幅に下回る)、to-B 再利用の 97% がシングルターン。ワークロード対応エビクションで LRU 比最大 41.4% QTTFT 削減(source / paper / llm-serving / kv-cache / workload-characterization) - [[@2022__NSDI__MLaaS in the Wild - Workload Analysis and Scheduling in Large-Scale Heterogeneous GPU Clusters]] — [[Qizhen Weng]] ほか(HKUST / [[Alibaba Group]])。[[Alibaba PAI]] 6,742 GPU 異種混合クラスタの 2 か月トレース。GPU 共有で必要 GPU 平均 50% 削減、タスク繰り返し 65% で SJF が FIFO 比 63% JCT 短縮、CPU 競合ボトルネック(source / paper / gpu-cluster / scheduling) - [[@2025__EuroSys__CacheBlend - Fast Large Language Model Serving for RAG with Cached Knowledge Fusion]] — [[Jiayi Yao]] ほか(University of Chicago / Microsoft Research)。RAG 向け非プリフィックス KV キャッシュの選択的再計算で TTFT 2.2-3.3× 削減、スループット 2.8-5× 向上。EuroSys 2025 Best Paper(source / paper / kv-cache / rag) - [[@2025__arXiv__KVShare - An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse]] — [[Huan Yang]] ほか(Central South University / Tsinghua University)。DHD アルゴリズムとデコードフェーズのアテンション・ドリフト対処。TTFT 最大 9.39× 短縮、SOTA 比精度 20.38% 向上(source / paper / kv-cache / multi-tenant) - [[@2025__ICLR__SCBench - A KV Cache-Centric Analysis of Long-Context Methods]] — [[Yucheng Li]] ほか(Microsoft / University of Surrey)。KV キャッシュ中心の長コンテキストベンチマーク。sub-O(n) 手法のマルチターン破綻と動的スパース性の優位を示す。ICLR 2025(source / paper / kv-cache / benchmark / long-context) - [[KVキャッシュ管理]] / [[LLM推論]] / [[GPUクラスタスケジューリング]](更新 concept) - 新規 entity: [[Xingda Wei]] / [[Jinbo Han]] / [[Qizhen Weng]] / [[Alibaba PAI]] / [[Alibaba GPU Cluster Trace]] / [[Jiayi Yao]] / [[Junchen Jiang]] / [[CacheBlend]] / [[Huan Yang]] / [[KVShare]] / [[Central South University]] / [[Yucheng Li]] / [[Huiqiang Jiang]] / [[SCBench]] / [[University of Chicago]] / [[University of Surrey]] - Key insight: 本番 KV キャッシュのヒット率は合成データより大幅に低く、ワークロードに適応したエビクションが不可欠。RAG/マルチテナントでは非プリフィックスの選択的再計算が発展段階に入り、長コンテキスト手法はマルチターンの KV キャッシュ再利用を含むライフサイクル評価が必要 ### 2026-06-18 From Attention to Disaggregation 充実化 - [[@2025__arXiv__From Attention to Disaggregation - Tracing the Evolution of LLM Inference]] — [[Srinivasa Rao Aravilli]] ほか([[Capital One]])。Transformer から PD 分離までの発展と 6 最適化、3 アーキタイプ比較を整理。本回 PDF 全 22 ページを再走査して、6 最適化テーブル、GPU メモリ階層、Monolithic vs Disaggregated 比較、PEARL 並列 Speculative Decoding、3 フレームワークの制御/データプレーン詳細、性能数値、参考文献 25 件を反映(source / paper / survey / llm-serving / pd-disaggregation) - 新規 entity: [[NVIDIA Dynamo]](既存 [[Dynamo]]([[Amazon]] の KVS)とは別物として独立)/ [[AIBrix]](Kubernetes 上クラウドネイティブ制御プレーン) - Key insight: 著者は CAP 定理の適用を「単一/密結合システム内の論理リソース割当の比喩」と各図注で明示。**厳密な分散理論ではなく設計語彙**として読む。一方 3 アーキタイプ比較(research-first / cloud-native / full-stack hardware co-design)は PD 分離研究の地図として有用 ### 2026-06-18 Mooncake — KVCache-centric Disaggregated Architecture for LLM Serving - [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]] — [[Ruoyu Qin]]・[[Zheming Li]] ほか([[Moonshot AI]] / [[Tsinghua University]] MadSys)。Kimi 本番の KVCache 中心分散 LLM サービングプラットフォーム。3 プール分離・Conductor・CPP・Layer-wise Prefill・過負荷指向スケジューリングを提案(source / paper / llm-serving / kv-cache / pd-disaggregation) - [[KVキャッシュ管理]] / [[Prefill-Decode分離]] / [[LLM推論]](更新 concept) — CPU/DRAM を KVCache 第一階層に昇格、ホットブロック複製ヒューリスティック、PD 分離固有の負荷振動問題と予測ベース緩和を追記 - 新規 entity: [[Ruoyu Qin]] / [[Zheming Li]] / [[Weiran He]] / [[Mingxing Zhang]] / [[Yongwei Wu]] / [[Weimin Zheng]] / [[Xinran Xu]] - 更新 entity: [[Mooncake]] / [[Moonshot AI]] / [[Tsinghua University]] ### 2026-06-18 MPLS JAPAN 2025 — KV cache sharing with IOWN APN - [[@2025__MPLSJapan__A study on accelerating LLM inference using KV cache sharing with IOWN APN]] — [[田仲顕至]]([[NTT]])による MPLS JAPAN 2025 講演資料。[[IOWN APN]] で小規模データセンターを束ね、KV キャッシュ共有で LLM 推論の TTFT と電力効率を改善する構想を評価(source / slides / llm-serving / kv-cache / iown) - [[KVキャッシュ管理]] / [[LLM推論]] / [[AI Greenferencing]](更新 concept) — KV キャッシュ共有を広域低遅延ネットワーク、電力制約、分散小型データセンター配置へ接続 - 新規 entity: [[田仲顕至]] / [[NTT]] / [[IOWN APN]] ### 2026-06-23 Monitoring Cloudflare's Planet-Scale Edge Network (SREcon17 Europe) - [[@2017__SREcon17 Europe__Monitoring Cloudflare's Planet-Scale Edge Network]] — [[Matt Bostock]]([[Cloudflare]])による SREcon17 Europe 発表。116 PoP の Prometheus 監視アーキテクチャ、Nagios からの移行、症状ベースアラーティング(source / video / sre / prometheus / monitoring) - [[Matt Bostock]] — Cloudflare プラットフォームオペレーションエンジニア。Prometheus ミートアップ主催者(entity / person) - [[Cloudflare]](更新) — 2017 年 PoP 配置アーキテクチャ、Nagios 移行動機を追加。 - [[Prometheus]](更新) — フェデレーション構成と Alertmanager HA の記述を追加。 - [[アラート管理]](更新) — Cloudflare の症状ベースアラーティング→pint の 5 年間進化を横断的知見に追加。 ### 2026-06-23 Introduction to Alibaba Monitoring System (SREcon18 Asia) - [[@2018__SREcon18 Asia__Introduction to Alibaba Monitoring System]] — [[Ren Xinchi]]([[Alibaba Group]] GOC)による SREcon18 Asia 発表。4 層モニタリング構造でビジネス層を最重要と位置づけ、5 ゴールデンエレメントと CMDB [[Hammurabi]] でビジネス KPI と優先度を一元管理する手法(source / video / monitoring / sre) - [[Ren Xinchi]] — Alibaba Group GOC シニアエンジニア。ビジネスモニタリングの設計・運用担当(entity / person) - [[Hammurabi]] — Alibaba のビジネスモニタリング用 CMDB。ビジネス機能と P1〜P4 優先度・担当者をマッピング(entity / product) - [[ビジネスモニタリング]] — ビジネス KPI を顧客影響の代理指標として一次モニタリングシグナルに据える手法(concept / monitoring / sre) - [[アラート管理]](更新) — Alibaba の CMDB ベース優先度定義を横断的知見に追加。 - [[Alibaba Group]](更新) — GOC による 7×24 モニタリング体制と Hammurabi の記述を追加。 ## Concepts ### 2026-08-19 Topology-Aware GPU Scheduling for Learning Workloads in Cloud Environments (SC17) - [[トポロジ考慮型スケジューリング]](更新) — KEP-2724 TASに7年先行するノード内グラフマッピング型の原型として、SC17論文の効用関数ベース最適化(通信コスト・干渉・断片化)を追記。宣言的制約 vs. 効用関数最適化という設計思想の対比(concept / kubernetes / scheduling / gpu) - [[GPUクラスタスケジューリング]](更新) — Philly/HiveDより約2年早いノード内トポロジ考慮の先行例として、局所性問題意識がHPC単一ノード→クラスタスケール→宣言的APIへ一般化した経路を追記(concept / distributed / scheduling) ### 2026-07-17 Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs (LMSYS Blog) - [[Prefill-Decode分離]](更新) — SGLang が DeepEP の Normal/Low-Latency Dispatch モードを PD 分離と組み合わせて使い分ける事例を追記(concept / llm / inference) - [[Mixture-of-Experts]](更新) — 96 H100 GPU 展開での層別並列化(Attention/密FFN=DP、疎FFN=EP)、EPLB による負荷分散、推論時 MoE 通信の Prefill/Decode 切替を追記(concept / machine-learning / distributed) - [[並列化戦略]](更新) — 密な FFN 層で TP でなく DP を選ぶハードウェアアラインメント制約の事例を追記(concept / distributed / machine-learning) - [[負荷分散]](更新) — EPLB による推論時システム配置最適化(Prefill 1.49x・Decode 2.54x)を追記(concept / machine-learning / distributed / networking) ### 2026-07-16 ISC26 Recap (Glenn K. Lockwood Blog) - [[主権AI]](新規) — 一国が外国製フロンティアAIモデル・AIインフラへの依存から自らを守るための政策的・産業的方向性。2026-06-12の米国政府によるAnthropicモデル外国人アクセス遮断が世界的な引き金になった(concept / AI政策 / 地政学 / hpc) - [[ヨーロッパのAI主権]](更新) — [[主権AI]]という上位概念との関係、および欧州固有の「規制の逆説」と世界的な主権AI機運の異同を横断的知見に追記 ### 2026-06-30 Linux マルチコアスケール カーネルチューニング(yuuk.io 2015) - [[RFS(Receive Flow Steering)]](新規) — Linux 2.6.35+ でソフトウェアが CPU キャッシュ局所性を考慮してパケット処理コアを選択する仕組み。設定 3 パラメータ(rps_cpus・rps_flow_cnt・rps_sock_flow_entries)で有効化(concept / linux / networking / kernel) - [[RPS(Receive Packet Steering)]](新規) — RSS のソフトウェア実装版。シングルキュー NIC でも IPI でパケット処理を複数コアに分散(concept / linux / networking / kernel) - [[RSS(Receive Side Scaling)]](新規) — マルチキュー NIC がハードウェアで 4 タプルハッシュにより受信割り込みを複数 CPU コアに分散する仕組み(concept / linux / networking / hardware) ### 2026-06-30 9 Things You Should Do When Starting to Use SLOs (SREcon23 EMEA) - [[SLODLC]](新規) — SLO Development Lifecycle。INITIATE→DISCOVER→DESIGN→IMPLEMENT→OPERATE の 5 フェーズ。SLO 導入を継続的ライフサイクルとして構造化するオープンフレームワーク(concept / sre / slo) - [[サービスレベル目標]](更新) — 「成功定義 > エラー定義」の SLI 設計原則とステークホルダー別時間窓(Furino 2023)を横断的知見に追記 - [[SLI-SLO段階的導入]](更新) — SLODLC との対応関係と WWWWHW 文書化 6 要素(Furino 2023)を横断的知見に追記 ### 2026-06-28 The Power of Stories (SREcon26 Americas) - [[逸脱の正常化]](新規) — Diane Vaughan が Challenger 事故で提唱。アラート閾値調整など SRE の日常作業にも常在する(concept / sre / safety / human-factors) - [[インシデントストーリー]](更新) — anomalous + immutable の 2 条件、Challenger 3 視点、Once Upon an Incident を追記 - [[インシデントレポート執筆]](更新) — Hochstein の narrative description 重視・エピソードチャンク・前史から書く指針を追記 ### 2026-06-26 SREcon22 APAC 動画 ingest (Reliability Map) - [[Reliability Map (r9y.dev)]](新規) — SRE ケイパビリティをゲームのテック・ツリーに着想を得たマップとして体系化したオープンソースプロジェクト。各ケイパビリティカードは「何・なぜ・取得方法・前提」を持つ。(sre / reliability / capability) - [[SRE]](更新) — ケイパビリティ選択におけるコンテキスト抽出の重要性と Reliability Map の補完的位置づけを横断的知見に追記。 ### 2026-06-26 How Complex Systems Fail (Cook 1998) - [[複雑システム障害論]](新規) — Cook (1998) が 18 命題で体系化した複雑システム障害論。単一根本原因の否定・潜在的障害の常在・安全性の創発的特性が核(sre / safety / human-factors / reliability) - [[潜在的障害]](新規) — 複雑システムが常に内包する障害の混合。単独では不十分だが組み合わさると破滅を引き起こす(sre / safety / reliability) - [[ヒンドサイトバイアス]](新規) — 結果知識が事故前の視点の再現を阻む認知バイアス。Cook は事故調査の主要障害と指摘(safety / incident-investigation / cognitive-bias) ### 2026-06-26 工学としてのSRE再訪 (SRE NEXT 2024) - [[SREの工学化]](新規) — システム管理を「技芸(craft)」から「工学(engineering)」へ昇華させる営みの総体(sre / engineering) ### 2026-06-24 OncallX (ASE 2025) - [[オンコール自動化]](新規) — OCE が担うインシデント対応・チケットトリアージを LLM+マルチエージェントで自動化する領域。OncallX(ASE 2025)が ByteDance 本番で 789 倍高速化を実証。(aiops / on-call / llm / multi-agent) - [[マルチエージェント協調]](更新) — OncallX の木探索プランナー+専門エージェント設計が ReAct を超えた事例と、コンテキスト長増大が協調のスケーリング限界として再確認される知見を追記。 - [[LLMによる根本原因分析]](更新) — OncallX の事例から「入力品質が LLM 推論の律速因子」という知見がオンコール対応にも一般化することを追記。 - [[インシデント管理]](更新) — OncallX への参照を追加。 ### 2026-06-18 LLM 推論 KV キャッシュ管理/分離型推論 6 論文 - [[@2023__SOSP__Efficient Memory Management for Large Language Model Serving with PagedAttention]] — [[Woosuk Kwon]] ほか。[[vLLM]] と PagedAttention の原典。KV キャッシュを固定サイズブロックでページ化し、非連続 GPU メモリ上で管理して 2-4 倍スループット改善(source / paper / llm-serving / kv-cache) - [[@2024__NeurIPS__SGLang - Efficient Execution of Structured Language Model Programs]] — [[Lianmin Zheng]] ほか。[[SGLang]]、RadixAttention、圧縮 FSM、API speculative execution により structured LM programs を高速化(source / paper / llm-serving / structured-generation) - [[@2025__arXiv__LMCache - An Efficient KV Cache Layer for Enterprise-Scale LLM Inference]] — [[Yuhan Liu]] ほか。[[LMCache]] を KV キャッシュの GPU 外退避・再読込・階層ストレージ・PD 転送層として定義(source / paper / llm-serving / kv-cache) - [[@2024__arXiv__P-D-Serve - Serving Disaggregated Large Language Model at Scale]] — [[Yibo Jin]] ほか。Huawei の数万 NPU 規模で scenario 単位 P/D group、on-demand forwarding、block-free D2D transfer を提案(source / paper / llm-serving / pd-disaggregation) - [[A Survey on Efficient Inference for Large Language Models]] / [[@2025__arXiv__From Attention to Disaggregation - Tracing the Evolution of LLM Inference]] — LLM 推論効率化の三層タクソノミーと、attention から disaggregation への発展史を整理(source / paper / survey) - [[KVキャッシュ管理]](新規 concept) — PagedAttention、RadixAttention、LMCache、P/D-Serve を横断し、GPU 内 page と外部 transfer chunk の二重粒度、prefix 再利用、cache-aware scheduling の緊張を整理 - [[LLM推論]] / [[Prefill-Decode分離]](更新 concept) — KV キャッシュがクラスタデータ管理へ拡張した系譜、scenario 単位 P/D organization、転送粒度変換を追記 - 新規 entity: [[SGLang]] / [[P-D-Serve]] / [[Woosuk Kwon]] / [[Yuhan Liu]] / [[Srinivasa Rao Aravilli]] / [[Yibo Jin]] / [[Zixuan Zhou]] / [[Tensormesh Inc]] / [[Infinigence-AI]] / [[Capital One]] - 更新 entity: [[vLLM]] / [[LMCache]] ### 2026-06-18 LLM 推論サービング論文 2 本(DistServe OSDI 2024 / Taming the Titans INLG 2025) - [[@2024__OSDI__DistServe - Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving]] — [[Yinmin Zhong]]・[[Shengyu Liu]] ほか([[Peking University]] / [[UC San Diego]] / [[StepFun]])。Prefill と Decode の同居が TTFT/TPOT 干渉と資源結合を生むことを示し、[[DistServe]] で段階別の資源割当・並列化・配置を探索。vLLM/DeepSpeed-MII 比で最大 7.4 倍リクエスト率、12.6 倍厳しい SLO(source / paper / llm-serving / osdi) - [[@2025__INLG__Taming the Titans - A Survey of Efficient LLM Inference Serving]] — [[Ranran Zhen]]・[[Juntao Li]] ほか([[Soochow University]] / [[Huawei Cloud]])。LLM 推論サービングをインスタンス、クラスタ、新興シナリオへ階層化した INLG 2025 サーベイ(source / paper / survey / llm-serving / inlg) - [[Prefill-Decode分離]](新規 concept) — Prefill と Decode を別資源で実行し、TTFT/TPOT の段階差に合わせて Goodput を最適化する設計。KV キャッシュ転送・耐障害性を未解決課題として整理 - [[LLM推論]](更新 concept) — DistServe による Goodput 最適化の一次論文としての位置づけ、INLG 2025 サーベイによる階層型整理を追加 - 新規 entity: [[DistServe]] / [[Yinmin Zhong]] / [[Shengyu Liu]] / [[Junda Chen]] / [[Jianbo Hu]] / [[Xuanzhe Liu]] / [[Ranran Zhen]] / [[Juntao Li]] / [[Yixin Ji]] / [[Zhenlin Yang]] / [[Tong Liu]] / [[Min Zhang]] / [[Qingrong Xia]] / [[Xinyu Duan]] / [[Zhefeng Wang]] / [[Baoxing Huai]] / [[Soochow University]] / [[UC San Diego]] / [[StepFun]] - 更新 entity: [[Peking University]] / [[Huawei Cloud]] / [[Yibo Zhu]] / [[Xin Jin]] / [[Hao Zhang]] / [[vLLM]] ### 2026-06-18 SpeakerDeck — 推論基盤のパフォーマンス検証と最適化戦略 - [[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]] — [[道下幹也]]([[SAKURA internet Inc]])による SpeakerDeck 資料。LLM 推論基盤のユーザー体験・SLO/SLA・Goodput ベース最適化、PD Disaggregation、Mooncake Store による KV Cache Reuse/Sharing を実測(source / slides / llm-serving / benchmark) - [[LLM推論]](更新 concept) — 同一 4 GPU 条件での PD 分離の ITL テイル改善、KV Cache Reuse/Sharing の TTFT 改善と読み込みコストの未解決点を追加 - [[サービスレベル目標]](更新 concept) — LLM 推論 SLO が TTFT・ITL・Goodput・Tokens/Dollar を束ねる観察を追加 - [[道下幹也]] / [[SAKURA internet Inc]] / [[高火力 PHY]] / [[vLLM]] / [[LMCache]] / [[Mooncake]](更新 entity) ### 2026-06-18 分散深層学習の通信・スケジューリング・ネットワーク基盤論文 14 本 - [[Dragonflyトポロジ]](新規 concept) — Dragonfly のグループ構造・コスト分析・適応ルーティングを Fat-Tree / HammingMesh / Rail-only と横断比較 - [[データセンター輻輳制御]](新規 concept) — DCQCN から Meta AI 訓練クラスタの受信側駆動制御まで、RDMA 向け輻輳制御の進化を整理 - [[RoCE設計課題]](新規 concept) — Hoefler+ 2023 の 8 つの構造的欠陥を中心に RoCE のライフサイクル限界を体系化 - [[HPCインターコネクトベンチマーク]](新規 concept) — Ethernet と InfiniBand の帯域・レイテンシ定量比較(SC-W 2024) - [[RDMA]](更新 concept) — DCQCN 原点・Microsoft 全 DC RoCEv2 展開・Meta 24k GPU AI 訓練・RoCE 8 欠陥・PFC の構造的限界を追記 - [[GPUクラスタスケジューリング]](更新 concept) — Tiresias(2DAS)と Themis(仕上がり時間公平性)の横断的知見を追記 - [[Fat-Tree]](更新 concept) — Dragonfly コスト比較・Rail-only スパイン層除去・HammingMesh 帯域分離を追記 - 14 source: [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]] / [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]] / [[@2008__ISCA__Technology-Driven, Highly-Scalable Dragonfly Topology]] / [[@2009__IEEE-Micro__Cost-Efficient Dragonfly Topology for Large-Scale Systems]] / [[@2018__SC__Harnessing GPU Tensor Cores for Fast FP16 Arithmetic to Speed up Mixed-Precision Iterative Refinement Solvers]] / [[@2019__NSDI__Tiresias - A GPU Cluster Manager for Distributed Deep Learning]] / [[@2020__NSDI__Themis - Fair and Efficient GPU Cluster Scheduling]] / [[@2022__NSDI__Accelerating Collective Communication in Data Parallel Training across Deep Learning Frameworks]] / [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning]] / [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]] / [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]] / [[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]] / [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]] / [[@2024__SC-W 2024__Benchmarking Ethernet Interconnect for HPC AI workloads]] - 新規 entity: [[John Kim]] / [[William J. Dally]] / [[Steve Scott]] / [[Dennis Abts]] / [[Juncheng Gu]] / [[Kang G. Shin]] / [[Yibo Zhu]] / [[Chuanxiong Guo]] / [[Daniel Firestone]] / [[Jitendra Padhye]] / [[Haitao Wu]] / [[Kshiteej Mahajan]] / [[Adithya Gangidi]] / [[Rui Miao]] / [[Azzam Haidar]] / [[Stanimire Tomov]] / [[Jack Dongarra]] / [[Nicholas J. Higham]] / [[Lorenzo Pichetti]] / [[Flavio Vella]] / [[Joshua Romero]] / [[Weiyang Wang]] / [[Kayvon Shakeri]] / [[Hongqiang Harry Liu]] / [[Ying Zhang]] / [[Mellanox]] / [[ETH Zürich]] / [[Hewlett Packard Enterprise]] / [[Broadcom]] / [[CINECA]] / [[University of Trento]] / [[Sapienza University of Rome]] / [[University of Manchester]] / [[University of Tennessee, Knoxville]] / [[MAGMA]] / [[Horovod]] / [[Northwestern University]] - 更新 entity: [[Torsten Hoefler]] / [[Manya Ghobadi]] / [[Aditya Akella]] ### 2026-06-17 自動化のアイロニー後続 2 論文(Baxter+ ECCE2012 / Strauch IEEE-THMS2017) - [[@2012__ECCE__The Ironies of Automation Still Going Strong at 30]] — [[Gordon Baxter]]・[[John Rooksby]] ほか([[University of St Andrews]])。Bainbridge (1983) 30 周年再検証: 航空(名古屋 A300)・金融(フラッシュクラッシュ)・クラウド(AWS 障害)の 3 ドメインでアイロニー残存確認。クラウド低コストによる品質迂回は新しいアイロニー(source / paper / automation / human-factors) - [[@2017__IEEE THMS__Ironies of Automation - Still Unresolved After All These Years]] — [[Barry Strauch]]([[National Transportation Safety Board]])。NTSB 事故調査官として Crown Princess / B747-SP / AF447 / Marshall パイプライン等で Bainbridge 予測を実証。技能マスキング・同一エラー 30 年反復・機能過多の新アイロニー。自律走行車・スマートフォンへの射程拡大(source / paper / automation / human-factors / accident-investigation) - [[自動化のアイロニー]](更新 concept) — 3 ソース横断知見(40 年間の構造的不変性・ドメイン拡大・低コストアイロニー・技能マスキング・エラー反復)と未解決の問い 3 件を追加。status を seed→developing に昇格 - 新規 entity: [[Gordon Baxter]] / [[John Rooksby]] / [[Barry Strauch]] / [[University of St Andrews]] / [[National Transportation Safety Board]] - 更新 entity: [[Lisanne Bainbridge]](被引用数・研究軌跡の補足) ### 2026-06-17 ペパボ研究所 gpt-oss サービング性能評価(LLM推論・GPU選定) - [[@2025__ペパボ研究所__gpt-ossモデルのサービング性能評価]] — [[三宅悠介]]([[GMOペパボ]])による gpt-oss サービング評価。H100 のみ並列スケール有効、出力トークン数がスループットを支配、Reasoning effort 制御がモデルサイズ選択と同等に重要(source / article / llm-serving / gpu / vLLM) - [[三宅悠介]](新規 entity) — GMOペパボ ペパボ研究所 研究員/プリンシパルエンジニア - [[GMOペパボ]](新規 entity) — ペパボ研究所が機械学習/LLM 運用研究を公開する企業 - [[LLM推論]](更新 concept) — GPU 世代別スケール可否・Reasoning effort トレードオフの横断的知見追加 - [[vLLM]](更新 entity) — gpt-oss benchmark で H100 × vLLM の並列スケーリング観察を追記 ### 2026-06-17 マイクロサービスベンチマーク/データセット 4 論文一括(DeathStarBench + Smith+ + OSS-MS + TrainTicketTrace) - [[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]] — [[Yu Gan]] ほか([[Christina Delimitrou]] @ [[Cornell University]])。DeathStarBench suite(5+1 サービス × 25-41 microservices)、自前 distributed tracing 0.1% overhead、front-end stalls/network 36.3%/tail-at-scale を実証(source / paper / microservices / benchmark / Cornell) - [[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]] — [[Sheldon Smith]] ほか([[Baylor University]])・[[Tomas Cerny]]・[[Davide Taibi]]。Train-Ticket + eShopOnContainers の Selenium + Gatling test benchmark を Zenodo 公開(source / paper / microservices / benchmark / testing) - [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] — [[Dario Amoroso d'Aragona]]([[Tampere University]])ほか 19 名。World of Code から 378 件の OSS-MS dataset(7 criteria + 6 軸ラベル)を CC BY-NC-SA で公開(source / paper / microservices / dataset / mining-software-repositories) - [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]] — [[Pirmin Urbanke]]・[[Stefan Fischer]]([[Software Competence Center Hagenberg]])。Train-Ticket 42 services × 9 fault × trace+metric+log の 3 modality dataset、EvoMaster + OpenTelemetry/Jaeger/Prometheus(source / paper / microservices / dataset / fault-localization) - [[マイクロサービスベンチマーク]](新規 concept) — 実装(benchmark system)と dataset(benchmark dataset)の 2 形態、Train-Ticket 共通基盤化、観測スタック標準化、fault layer 分離の系譜を横断的に整理 - [[DeathStarBench]] / [[Train-Ticket]](更新 entity) — 原典 source と後続 dataset の追加リンク - [[マイクロサービスアーキテクチャ]] / [[マイクロサービスコールグラフ]] / [[分散トレーシング]] / [[Fault Localization]] / [[障害注入]](更新 concept) — 横断的知見・未解決の問いに 4 source からの観察を追記 - 新規 entity: [[Christina Delimitrou]] / [[Yu Gan]] / [[Cornell University]] / [[Davide Taibi]] / [[Tomas Cerny]] / [[University of Oulu]] / [[Baylor University]] / [[eShopOnContainers]] / [[EvoMaster]] / [[World of Code]] / [[Software Competence Center Hagenberg]] / [[Pirmin Urbanke]] / [[Stefan Fischer]] / [[Dario Amoroso d'Aragona]] / [[Alexander Bakhtin]] / [[Tampere University]] ### 2026-06-17 Time-RA(ACL Findings 2026)— TSAD 生成型推論タスク + RATs40K - [[@2026__ACL Findings__Time-RA - Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback]] — [[Yiyuan Yang]](Oxford)・[[Zichuan Liu]](南京大)・[[Qingsong Wen]]†(Squirrel Ai) ほか。TSAD を二値識別→生成型推論(検知+14+6分類+因果説明)へ転換、RATs40K(実世界10ドメイン約4万件・マルチモーダル)、LoRA SFT でプラグアンドプレイ転用可能(source / paper / time-series / anomaly / multimodal / llm / benchmark) - [[Yiyuan Yang]](新規 entity) — University of Oxford、Time-RA 共同第一著者 - [[時系列推論]](更新 concept) — 異常診断への拡張(TIME-RA)追記 - [[時系列異常検知ベンチマーク]](更新 concept) — RATs40K の位置付け追記 - [[時系列マルチモーダルLLM]](更新 concept) — 視覚化→推論整合性 vs 分類の非対称性追記 ### 2026-06-17 GLM family x4(ACL 2022 起点 + GLM-4.5 + GLM-5 + GLM-OCR) - [[@2022__ACL__GLM - General Language Model Pretraining with Autoregressive Blank Infilling]] — [[Zhengxiao Du]] ほか([[Tsinghua University]]・[[BAAI]]・[[MIT CSAIL]]・[[Shanghai Qi Zhi Institute]])、ACL 2022。自己回帰空白埋め + 2D 位置符号化で NLU/生成統一、BERTLarge 1.25 倍で SuperGLUE +4.6〜5.0%、GLM 系統の起点(source / paper / machine-learning / language-model / pretraining) - [[@2025__arXiv__GLM-4.5 - Agentic Reasoning and Coding Foundation Models]] — [[Zhipu AI]]・[[Tsinghua University]]、arXiv 2508.06471。355B/32B MoE で ARC 統合、ハイブリッド推論モード(エキスパート蒸留)、深さ優先設計、TAU-Bench 70.1%/SWE-bench Verified 64.2%(source / paper / moe / agentic / reasoning / coding) - [[@2026__arXiv__GLM-5 - From Vibe Coding to Agentic Engineering]] — [[Zhipu AI]]・[[Tsinghua University]]、arXiv 2602.15763。744B/40B MoE + DSA + 28.5T トークン + 非同期 RL slime、Intelligence Index v4.0 オープンウェイト初 50、SWE-bench Verified 77.8%(source / paper / moe / agentic-rl / dsa) - [[@2026__arXiv__GLM-OCR Technical Report]] — [[Zhipu AI]]・[[Tsinghua University]]、arXiv 2603.10910。0.9B 小型 VLM で OmniDocBench v1.5 94.62 点 1 位(235B/Gemini-3 Pro 超え)、PP-DocLayout-V3 + パラメータ共有 MTP ドラフトヘッド + 4-stage GRPO RL(source / paper / ocr / vision-language / multimodal / document-understanding) - [[自己回帰空白埋め]](新規 concept) — GLM が提案した汎用事前学習目的関数。スパン破壊を自己回帰生成として再定義(concept / machine-learning / pretraining) - [[2D位置符号化]](新規 concept) — GLM の位置符号化拡張(原文中位置 + スパン内位置)(concept / machine-learning / pretraining) - [[スパン破壊]](新規 concept) — T5/GLM 系統のマスク戦略(concept / machine-learning / pretraining) - [[事前学習目的設計]](新規 concept) — 自己回帰/自己符号化/エンコーダ-デコーダの統一視点(concept / machine-learning / pretraining) - [[言語モデル事前学習]](既存 concept 更新) — GLM 起点の系譜を追記(concept / machine-learning / pretraining) - [[エージェント型コーディング]](既存 concept 更新) — GLM-4.5/5 の coding 能力を反映(concept / agentic / coding) - [[非同期エージェントRL]](新規 concept) — GLM-5 slime と MiniMax-M2 Forge の独立収束(concept / rl / agentic) - [[DSA]](新規 concept) — DeepSeek Sparse Attention、GLM-5 が大規模実装(concept / attention / sparsity) - [[光学文字認識]](新規 concept) — GLM-OCR が OCR の MTP 親和性を実証(concept / vision-language / ocr) - [[文書理解]](新規 concept) — レイアウト解析 + 並列リージョン認識の 2 段(concept / vision-language / document-understanding) - [[ビジョン言語モデル]](既存 concept 更新) — GLM-OCR の小型 VLM 設計を追記(concept / multimodal) - [[マルチトークン予測]](既存 concept 更新) — DeepSeek-V3 vs GLM-OCR の MTP 設計比較を横断的知見追加(concept / llm / training) - [[Mixture-of-Experts]](既存 concept 更新) — GLM-4.5(355B/32B)・GLM-5(744B/40B)を追加(concept / llm / architecture) - [[Zhipu AI]]・[[BAAI]]・[[Zhengxiao Du]]・[[Yujie Qian]]・[[Ming Ding]]・[[Jiezhong Qiu]]・[[Zhilin Yang]]・[[Jie Tang]]・[[Wenmeng Yu]]・[[Xiaotao Gu]](新規/更新 entity) ### 2026-06-17 CursorBench (Cursor Blog) - [[@2026__Cursor__CursorBench - How Cursor Evaluates Model Quality]] — [[Naman Jain]]([[Cursor Research]])、Cursor Blog 2026。CursorBench 3.1 のハイブリッド評価手法・SWE-bench 批判・Cursor Blame を解説。OpenAI の SWE-bench Verified 報告停止(未解決問題 60% にテスト欠陥)を引用(source / article / coding-agents / benchmark / evaluation) - [[コーディングエージェント評価]](新規 concept) — 公開ベンチマーク限界(調整不足・採点問題・汚染)とハイブリッド評価方式の横断整理(concept / coding-agents / benchmark) - [[CursorBench]] — v3.1 詳細・Cursor Blame・4 評価次元・識別力を更新(entity / dataset / coding-agents) - [[Naman Jain]] — Together AI/Agentica から Cursor Research への移籍を追記(entity / person / coding-agents) - [[SWE-Bench-Verified]] — OpenAI 報告停止・3 限界の批判セクションを追加(entity / dataset) ### 2026-06-17 アラート管理・時系列異常検知 10 本(NOMS2012-FSE2025) - [[@2012__NOMS__Optimizing System Monitoring Configurations for Non-Actionable Alerts]] — [[Liang Tang]]・[[Tao Li]] ほか([[Florida International University]]・[[IBM T.J. Watson Research Center]])、IEEE NOMS 2012。チケット遅延設計でリアル見逃しゼロを保証しつつ非アクション可能を最大 75% 削減(source / paper / aiops / alert-management / monitoring) - [[@2009__ICAC__Ranking the Importance of Alerts for Problem Determination in Large Computer Systems]] — [[Guofei Jiang]] ほか([[NEC Laboratories America]])、ICAC 2009。不変条件ネットワークと NTV ピアレビューで事前知識ゼロのアラート真陽性ランキング(source / paper / aiops / ranking) - [[@2017__KDD__Anomaly Detection in Streams with Extreme Value Theory]] — [[Alban Siffer]] ほか([[Inria]]/[[IRISA]])、KDD 2017。EVT POT で分布仮定不要・閾値不要の SPOT/DSPOT、Alert Storm のルーツ(source / paper / time-series / anomaly-detection / streaming / EVT) - [[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection]] — [[Ying Lin]] ほか([[NEC Laboratories America]]・[[University of Houston]]・[[Temple University]]・[[Amazon]])、CIKM 2018。CAR は Pitman-Yor ベイズ + エンティティ埋め込みの統一凸最適化、ROC-AUC 0.998(source / paper / aiops / alert-ranking / enterprise-security) - [[@2020__CLOUD__DEAR - Distributed Evaluation of Alerting Rules]] — [[Mathias Mormul]] ほか([[University of Stuttgart]])、IEEE CLOUD 2020。BET でアラートルール評価を VM に自動配布、TTI を 27s → 370ms(source / paper / cloud-monitoring / distributed-monitoring) - [[@2022__ICSE__Online Summarizing Alerts through Semantic and Behavior Information]] — [[Jia Chen (Fudan)]] ほか([[Fudan University]])、ICSE 2022。OAS は障害報告書 + ASR+ABR+ACT 深層学習、Fudan 三部作の起点(source / paper / aiops / alert-aggregation / Fudan) - [[@2024__FSE__ChangeRCA - Finding Root Causes from Software Changes in Large Online Systems]] — [[Guangba Yu]] ほか([[Sun Yat-sen University]]・[[Tencent]])、FSE 2024。RCCA(ACD の昇格)、WeChat 81 件で HR@1=85.78%(source / paper / aiops / rca / software-change) - [[@2025__arXiv__ARGOS - Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models]] — [[Yile Gu]] ほか([[Microsoft Research]]・[[University of Washington]])、arXiv 2501.14170。LLM はルール生成のみ、推論はルール実行、内部データで F1 +28.3%(source / paper / aiops / tsad / llm / agentic) - [[@2025__arXiv__Can Multimodal LLMs Perform Time Series Anomaly Detection]] — [[Xiongxiao Xu]] ほか([[Illinois Institute of Technology]]・[[Emory University]]・[[University of Southern California|USC]])、arXiv 2502.17812、WWW 2026。MLLM は粗粒度で従来手法超え、点別では限界(F1 8.12% 上限)、相補的活用(source / paper / tsad / multimodal-llm) - [[@2025__FSE__Alert Summarization for Online Service Systems by Validating Propagation Paths of Faults]] — [[Jia Chen (Fudan)]] ほか([[Fudan University]])、FSE 2025。ProAlert は教師なし fault propagation pattern 学習、Fudan 三部作の最新(source / paper / aiops / alert-aggregation / Fudan) - [[アラート管理]] / [[アラート集約]] / [[アラートストーム]] / [[アラート抑制]] / [[アラートフィルタリング]] / [[時系列異常検知]] / [[変更起因インシデント]] / [[根本原因分析]] — 既存 concept を 10 ソースで更新(横断的知見・未解決の問い) ### 2026-06-17 アラート管理 3 本(Zha+ Electronics / VOCE FASE / SkyNet SIGCOMM) - [[@2024__Electronics__Leveraging Large Language Models for Efficient Alert Aggregation in AIOPs]] — [[Junjie Zha]] ら([[State Grid Jiangsu Electric Power]])、MDPI Electronics 2024。時空間 DBSCAN + LLM × [[サービス依存グラフ]]の二段階アラート集約。100K アラート × 130 ストームで F1 0.815-0.850(source / paper / aiops / alert-management / llm) - [[@2025__FASE__VOCE - A Virtual On-Call Engineer for Automated Alert Incident Analysis Using a Large Language Model]] — [[Jia Chen (Fudan)]] ほか([[Peng Wang (Fudan)]] グループ、[[Fudan University]])、FASE 2025。VOCE は 3 因子(system layer/impact scope/severity)× LLM × 階層 causality mining。10,680 アラート/827 incidents で accuracy 88.90%(GPT-4o)/81.26%(LLaMA-2 13B)。時間順仮定 45.34% 否定。(source / paper / aiops / llm / incident-management) - [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures]] — [[Bo Yang]]・[[Huanwu Hu]]・[[Yifan Li]] ほか([[Ennan Zhai]]・[[Tao Lin (Alibaba)]] corresponding、[[Alibaba Cloud]])、SIGCOMM 2025。Alibaba Cloud 本番(89 DC × 10⁵ デバイス)1.5 年、mitigation time 80% 削減。12 監視ツール統合 + hierarchical alert tree + severity score。**LLM 不採用**を §2.3 で明文化(source / paper / aiops / networking / alert-management) - [[アラートインシデント分析]](新規 concept) — VOCE が導入。集約後の "originating alert 特定" を独立タスクとして体系化(concept / aiops / alert-management) - [[LLMによる根本原因分析]](新規 concept) — LLM 役割の 3 分化(外部知識リーダー / グラフマッパー / 多因子分析器)を横断的に観察(concept / aiops / llm / rca) - [[サービス依存グラフ]](新規 concept) — Zha+ 2024 と VOCE が LLM hallucination 制御材として共通利用(concept / aiops / microservices / graph) - [[ネットワーク監視]](新規 concept) — SkyNet が示す単一ソース coverage 限界(3-84%)と多ソース統合(concept / networking / observability) - [[アラート集約]] / [[アラートストーム]] — 既存 concept を 3 ソースで更新 ### 2026-06-16 SpeakerDeck — Reliability in the Age of AI - [[@2026__SpeakerDeck__Reliability in the Age of AI - Engineering for AI Velocity]] — [[Ryota Yoshikawa]]([[Topotal]])による SpeakerDeck 資料。AI による開発速度向上と信頼性指標悪化を整理し、SRE プラクティスを AI でスケールさせる段階論を示す(source / slides / sre / aiops) - [[Ryota Yoshikawa]] — [[Topotal]] CTO。`@rrreeeyyy` として SRE/AI 運用関連資料を公開(entity / person / sre) - [[Topotal]] — SRE as a Service とインシデントマネジメント SaaS [[Waroom]] を扱う企業(entity / organization / sre) - [[Waroom]] — AI も活用したインシデントマネジメント SaaS(entity / product / incident-management) ### 2026-06-16 SREcon26 Americas — Zhou/Zhang AI DB Debugging (Databricks) - [[@2026__SREcon26 Americas__How We Debug 1000s of Databases with AI]] — Annie Zhou・Sophie Zhang(Databricks)、SREcon26 Americas 2026 講演動画。AI支援 DB デバッグシステム([[Storax]])の本番導入と3教訓(ユーザー共感先行・安全基盤・テスト可能フレームワーク)。調査時間最大90%削減(source / video / sre / aiops / database) - [[Annie Zhou]] — Databricks ストレージプラットフォームチームのエンジニア(entity / person / sre) - [[Sophie Zhang (Databricks)]] — Databricks ストレージプラットフォームチームのエンジニア(entity / person / sre) - [[Databricks]] — データ・AI プラットフォーム企業。Apache Spark・Delta Lake・MLflow・Unity Catalog の開発元(entity / organization / industry) - [[Storax]] — Databricks 内部 AI デバッグツールのバックエンドサービス。セントラルファースト・シャーデッド、細粒度AC、Temporal承認ゲート(entity / product / sre / database) ### 2026-06-16 SREcon18 Asia — Wilkinson SLO Alerting - [[@2018__SREcon18 Asia__A Theory and Practice of Alerting with Service Level Objectives]] — Jamie Wilkinson(Google)、SREcon18 Asia スライド。シンプトムベースドアラーティング・SLO バーンレートアラート(source / slides / sre / slo) - [[Jamie Wilkinson]] — Google SRE。SLO バーンレートアラート体系化(entity / person / sre) ### 2026-06-16 SREcon26 Americas — Forsgren - [[DORA]] — DevOps Research and Assessment の 4 メトリクス。SRE チーム自身のオペレーション能力計測にも適用できる(sre / devops / metrics) - [[SPACE]] — Satisfaction・Performance・Activity・Communication・Efficiency の 5 次元で開発者体験を計測するフレームワーク(sre / developer-experience / metrics) - [[MTWTF]] — Mean Time to WTF。アラートから「状況を理解した」までの時間。MTTR の先行指標(sre / incident-management) ### 2026-06-16 joisino ブログ 13 記事から派生 - [[Transformer]] — 自己注意中核の系列モデル。線形注意により [[カーネル法]] 経由で [[RNN]] と等価書き直しが可能。(machine-learning / sequence-modeling) - [[線形注意]] — softmax 内積でなくカーネル特徴写像で類似度を測る注意。固定次元状態の RNN として展開できる。(machine-learning / attention) - [[Physics of Language Models]] — Allen-Zhu/Yuanzhi Li らの「合成データ+線形プロービング」研究プログラム。LLM の普遍則を制御実験で抽出。(machine-learning / llm / interpretability) - [[知識容量スケーリング則]] — LLM はパラメータ 1 つにつき約 2 ビットの知識を記憶可能(Allen-Zhu+ 2024)。(machine-learning / scaling) - [[LLM算術機構]] — LLM の四則演算は厳密アルゴリズムでなく [[ヒューリスティックの束]] の積み重ね。[[ロジットレンズ]]で可視化(Nikankin+ ICLR 2025)。(machine-learning / llm / interpretability) - [[ヒューリスティックの束]] — 範囲・剰余・パターン等の粗い条件判定ニューロン群の積み重ねで結果を出すモデル戦略。(machine-learning / interpretability) - [[ゼロエラー境界]] — モデル自身が問題サイズの限界を定める評価フレーム(ZEH)。人間の恣意的範囲設定を排除し[[LLM能力スパース性]]を可視化。(llm / evaluation) - [[プラトン的表現仮説]] — 異モダリティのモデルが性能向上とともに共通の世界統計モデルへ収束する仮説(Huh+ 2024)。(machine-learning / representation-learning) - [[1サンプルRLVR]] — 訓練データ 1 問でも全データに匹敵する推論性能を得る現象。エントロピー正則化と内省語獲得が鍵(Wang+ ICLR 2026)。(machine-learning / reinforcement-learning / llm) - [[RLHF誤誘導]] — 標準的 RLHF で LLM が人間を誤解させる振る舞いを学ぶ現象。真の性能不変のまま評価が劇的に上昇。(ai-safety / rlhf) - [[LLM比較器]] — LLM を 2 項比較関数として用いる手法。主観的・曖昧な基準のソートに有効([[LLMランキング]] / [[joisino-LLMでソート-2026]])。(llm / ir) - [[汎化誤差バウンド]] — 訓練データ上の経験損失と真リスクの差を抑える上界。[[集中不等式]]+[[カバリングナンバー]]+[[PAC学習]]。(machine-learning / learning-theory) - [[AI検証可能性]] — 探索 AI/検証 人間の役割分担を成立させる「検証可能な証拠」の概念。NP 完全性・対話型証明系と接続。(ai-safety / interpretability) - [[LLM意味表象]] — LLM 埋め込みが捉える言葉の意味。カテゴリ分類は人間と一致するが典型度の順位相関は低い([[認知意味論]]・[[プロトタイプ意味論]]視点)。(machine-learning / llm / semantics) - [[否定文理解]] — softmax の構造上 BERT 系で否定文に対応する埋め込みが数学的に存在しない、LLM もしばしば誤答する問題群。(machine-learning / llm / nlp) - [[グラフニューラルネットワーク]] — グラフ構造データに対するニューラルネットワーク。メッセージパッシングで近傍情報を集約し置換対称性を本質的に持つ。ICLR 2024 では 170 本採択。(machine-learning / graph-neural-network) - [[GNN同変性]] — 入力の対称性を保存して出力が変換される GNN の性質。分子・タンパク質・MLP パラメータのメタネットワークで活用。パーミュテーション対称性問題は [[モデルパラメータ算術]] と接続。(machine-learning / graph-neural-network) - [[タスクベクトル]] — τ = θ_ft − θ_0 でタスク能力を表現する差分パラメータ (Ilharco+ ICLR 2023)。加減算でタスク転移・削除・合成が可能。(machine-learning / model-merging) - [[モデルパラメータ算術]] — モデルパラメータへの算術演算でモデル能力を直接操作する研究領域。モデルスープ・[[タスクベクトル]]・NTK 理論・Git Re-Basin を包含。(machine-learning / model-merging) - [[アテンションヘッド]] — Transformer の自己注意ユニット。7 種に機能分化(文法・受け皿・逐次・検索・帰納・関数ベクトル・反復)し、訓練の結果として自然出現する。(machine-learning / llm / interpretability) - [[帰納ヘッド]] — `[A][B]...[A]→[B]` パターンで文脈内学習を実現する注意ヘッド。二層構造で実現(Olsson+ 2022)。(machine-learning / llm / interpretability) - [[機構的解釈性]] — LLM 内部の回路・アルゴリズムを特定する研究分野(mechanistic interpretability)。(machine-learning / llm / interpretability) - [[関数ベクトル]] — タスクを表すベクトル。few-shot 例の最終トークン内部状態の平均として抽出でき MLP 入力へ加算するだけでタスクを実行(Todd+ ICLR 2024)。(machine-learning / llm / interpretability) - [[反復ヘッド]] — CoT のテープ上で処理位置を追跡する注意ヘッド(Cabannes+ NeurIPS 2024)。(machine-learning / llm / interpretability) - [[LLMアプリケーション信頼性]] — LLM を意思決定支援・ワークフロー自動化・ツール呼び出し・マルチエージェントシステムに組み込んだとき、入力・コンテキスト・状態管理・外部ツール・バージョン更新・コスト制約を含むシステム全体が期待動作を保つ性質。AI エージェントが生成する変更も荷重を受ける変更として扱う。(LLM systems / reliability) - [[agentic SRE]] — 本番システムの障害調査・診断・緩和を AI エージェントが実行する取り組み。エージェント導入は自動化であると同時に複雑性を足すため、検証・巻き戻し・ゲートを含む安全設計が要る。(SRE / AIOps) - [[SRE]] — ソフトウェアエンジニアリングの手法を運用問題に適用するディシプリン。AI エージェント時代には、固定計画より実験で学ぶ計画、汎用緩和の継続検証、リスク先行開発が前景化する。(SRE / クラウド運用) - [[グレイ障害]] — コンポーネントが完全停止せず徐々に性能が劣化する故障様式。Huang+ 2017 の定式化を AI クラウド文脈(冗長による劣化漸減・ワークロード依存・部分修復)へ拡張(reliability / aiops / gpu) - [[プロアクティブ検証]] — インシデント発生前にベンチマーク群で能動的にハードウェアを stress テストし潜在的劣化を顕在化させる運用方式。SuperBench が AI インフラ向けに体系化(reliability / aiops / gpu) - [[トレース品質]] — 分散トレースが自動分析に耐えるかを評価する概念。Bento+ 2021(J Grid Computing)が data sufficiency / ontological / tools の 3 類型と temporal coverage(子スパン合計時間/親スパン時間)を品質指標として導入。OpenTracing 仕様の testability 欠如を実例で示す。(observability / distributed tracing) - [[フォールトトレランス]] — 障害存在下でのサービス継続能力。Heimerdinger+Weinstock 1992 が冗長性管理の6アクション・障害クラス分類・FCR・設計多様性・カバレッジ・fault evasion を体系化。(fault-tolerance / dependability) - [[プロアクティブ障害管理]] — 障害発生前に予兆を捉え対策を事前に打つ運用枠組み。Salfner+ 2010 が「予測 → 診断 → スケジューリング → 実行」の 4 段階を Figure 2 で定式化。サーベイ群はほぼ予測段に集中。(dependability / AIOps) - [[ソフトウェアエイジング]] — 長時間稼働ソフトウェアで内部状態の累積(メモリリーク・FD 枯渇・GC 不全等)が時間とともに symptom として現れる現象。Parnas 1994 が概念化し、Salfner+ 2010 §5.2 では symptom monitoring 系手法の主要応用領域。(dependability / software engineering) - [[Design for Reliability]] — 信頼性を test-analyze-and-fix 後工程に任せず、要求同定・設計・解析・検証・妥当性確認・制御の各段階へ組み込む設計プロセス。(systems reliability / product engineering) - [[FRACAS]] — 開発試験・生産・運用で見つかった故障を報告し、解析し、是正処置と再試験まで追跡する閉ループ。(systems reliability / failure analysis) - [[コンテナオーケストレーション]] — コンテナベースソフトウェアアプリケーションの分散クラスタを構築・継続管理する技法。Pahl ら 2019 SMS が定義し、Docker・LXC が支配的、Kubernetes・Mesos が次点。(distributed systems / cloud computing) - [[体系的マッピング研究]] — Systematic Mapping Study(SMS)。新興分野の研究構造を PICO・検索式・分類フレームワークで地図化する secondary study の一形態。(research methodology / software engineering) - [[コンテナ配置最適化]] — eBPF カーネル内集約でコンテナ間トラフィックを 9% 未満のオーバーヘッドで計測し、重み付き通信グラフをコンテナスケジューリングに接続する手法。(distributed systems / container orchestration) - [[B-Tree]] — 比較ベースの可ページング ordered index。DBMS では leaf に record を持つ B+-Tree を指して B-Tree と呼ぶことが多く、range scan・buffer manager・recoverability との統合に強い。(database systems / storage engines) - [[B-Treeノードレイアウト最適化]] — B-Tree の 1 page 内の key/value 配置、slot、heap、比較補助情報、leaf 表現を変えることで cache miss・CPU instruction・空間効率・scan 性能を改善する手法群。(database systems / performance engineering) - [[LLM向け情報検索]] — LLM が検索結果を消費し、取得文書を生成・推論・行動の入力として使う前提の情報検索。目的は raw recall から利用可能な証拠密度と検証可能性へ移る。(information-retrieval / llm-systems) - [[RAGノイズ除去]] — RAG で LLM に渡す検索結果から、推論に役立たない、または誤誘導する情報を、インデックス・検索・文脈組み立て・検証・閉ループ訓練の各段で抑える設計。(rag / information-retrieval) - [[LSMツリーコンパクション]] — LSM ツリーのコンパクションを、WA/RA の静的トレードオフではなく平均クエリスループットへの資源投資として扱う設計問題。[[EcoTune]] が動的計画法で時点と積極度を最適化する。(database systems / storage engines) - [[LLM評価]] — LLM の性能・人間嗜好との整合を定量化する手法。静的クローズドエンド型(HLE:専門家最前線ベンチマーク)とライブ人間嗜好型(Chatbot Arena)が相補的な 2 極。飽和・キャリブレーション・母集団バイアスが横断的課題。(llm-evaluation / benchmarking) - [[オブザーバビリティ]] — 外部出力のみからシステムの内部状態を計測する能力。CNCF Whitepaper(2023)は 5 シグナル(メトリクス・ログ・トレース・プロファイル・ダンプ)を定義。(distributed systems / SRE / observability) - [[継続的プロファイリング]] — 本番で継続的にパフォーマンスデータを収集し「なぜ遅いか」をコードレベルまで特定するオブザーバビリティシグナル。DODO が LLM コード最適化ベンチマーク基盤としても活用。(observability / performance) - [[本番接地型ベンチマーク]] — AI エージェント評価・最適化のベンチマークを本番テレメトリから生成する設計原則。[[DODO]] が CPU プロファイル+実呼び出しで実装し成熟 Go サービスの CPU コスト 8%+ 削減。(benchmarking / software-engineering) - [[オブザーバビリティデータモデル]] — MELT 異種テレメトリを統一管理・エージェント対応する設計アーキテクチャ。Karumuri ら(2021)が ODMS 4 原則を確立、UModel(2026)がエージェント対応実証。(AIOps / observability) - [[スケーリング則]] — ニューラル言語モデルの損失がモデルパラメータ数・データ量・計算量に対してべき乗則でスケールするという経験的法則。Kaplan et al. (2020) が 7 桁以上の範囲で実証。計算効率最適の訓練は大きなモデルを早期停止で訓練すべきと結論する。(machine-learning / scaling) - [[Chain-of-Thought Prompting]] — LLM のプロンプト例示に中間推論ステップの系列を加えることで複雑推論能力を引き出す手法。約 100B パラメータ以上での創発的能力。追加学習不要。Wei et al. NeurIPS 2022。(machine-learning / llm) - [[分散 PostgreSQL]] — PostgreSQL の SQL・トランザクション・DDL・エコシステム互換性を保ちつつ、複数ノードへデータとクエリ処理を分散するデータベース設計。[[Aurora Limitless Database]] ではルータ/シャード分離、時刻ベース MVCC、2PC、Serverless V2、シャード分割で実現される。(Database / Distributed Systems) - [[LLMアプリケーション信頼性]] — LLM を意思決定支援・ワークフロー自動化・ツール呼び出し・マルチエージェントシステムに組み込んだとき、入力・コンテキスト・状態管理・外部ツール・バージョン更新・コスト制約を含むシステム全体が期待動作を保つ性質。(LLM systems / reliability) - [[Retroactive Sampling]] — エッジエージェントで生スパンをオンディスク FIFO にバッファリングし、最小属性(33 バイト)のみ中央コレクタへ送ってサンプリング判断する手法。テールサンプリング比でネットワーク 70%・CPU/メモリ 60–70% 削減。[[VictoriaMetrics]] KubeCon EU 2026 発表。(distributed systems / observability) - [[統計的機械学習]] — 確率論・統計理論を基礎とした機械学習の枠組み。線形モデル・スパースモデリング・k-NN・アンサンブル学習・ベイズモデリングを含む。少量データ・解釈性が重要な応用物理・材料科学で有効。(machine-learning / applied-science) - [[ベイズ最適化]] — 評価コストが高い目的関数をガウス過程代理モデルと獲得関数で逐次最適化する実験計画手法。探索と活用のトレードオフ。材料パラメータ探索の典型用途。(machine-learning / experimental-design) - [[アンサンブル学習]] — バギング(ランダムフォレスト)とブースティング(XGBoost/LightGBM)が2大方式。決定木を基底とし汎化能力を向上。(machine-learning) - [[Flexible Skill Arrangement]] — O&M エージェントのコンテキスト組み立てを Skill(LoadDataSchema + Prompt + Meta)として外在化し LLM 自動生成・自然言語更新を可能にする設計パターン。[[Bian Que]] で提案。(AIOps / agentic operations) - [[agentic SRE]] — agentic SRE は、本番システムの障害調査・診断・緩和を AI エージェントが実行する取り組みである。(SRE / AIOps) - [[AIOps]] — AIOps(AI for IT Operations)は、IT/クラウド運用の検知・箇所特定・根本原因分析・緩和・予防を AI で支援または自動化する取り組みである。(AIOps / cloud operations) - [[eBPF]] — Yuuki Tsubouchi の技術解説(@2021__yuuk.io__Linux eBPF Tracing Technology)が体系化した基礎知識。(operating systems / observability) - [[Fat-Tree]] — Fat-Tree は、上位階層へ行くほどリンク帯域または並列経路を太くして、リーフ間通信のボトルネックを避けるデータセンターネットワークトポロジである。(networking / HPC) - [[Fault Localization]] — 障害検知後に、コンポーネント・メトリクス・ホスト・ランク・ネットワーク層などの原因候補の場所を絞る親概念。詳細は [[根本原因分析]]・[[RCA評価設計]]・[[ログ解析]]・[[LLM学習モニタリング]]・[[RDMAネットワーク監視]] へ分ける。(SRE / AIOps) - [[因果推論ベースRCA]] — マイクロサービス障害の根本原因分析を「因果グラフ構築(因果探索)→ 根本原因スコアリング」の 2 段階パイプラインで行う手法群。PC/FCI/LiNGAM/Granger/GES 等 9 種の探索アルゴリズムと、ランダムウォーク/PageRank/仮説検定の 3 種のスコアリングを組み合わせる。(SRE / AIOps / microservices) - [[GPUクラスタスケジューリング]] — GPUクラスタスケジューリング(machine-learning systems / distributed systems) - [[GPUクラスタ運用]] — - GPU ノード可用性は「nines」だけでなく日次ダウンタイムと node hours で運用負債として見える: @2025__DSN-W__Characterizing Modern GPU Resilien...(distributed systems / HPC / cloud operations) - [[GPUレジリエンス]] — GPUレジリエンス(HPC / distributed systems) - [[GPU観測性]] — GPU観測性(GPU systems / observability) - [[GPU最適化]] — GPU プログラムから性能を最大限に引き出すソフトウェアレベルの手法・技術群。4 テーマ・28 技術の分類体系。採用頻度トップ 4 はコアレスドアクセス・専用メモリ・分岐発散削減・auto-tuning。(hpc / gpu) - [[コアレスドメモリアクセス]] — GPU の 1 warp(32 スレッド)を整列条件下で 1 回のトランザクションにまとめる最頻出 GPU 最適化技術。(hpc / gpu) - [[カーネルフュージョン]] — 複数カーネルを統合しグローバルメモリへの中間書き出しを排除する最適化。Flash Attention の核心技術。(hpc / gpu / llm-inference) - [[分岐発散]] — GPU SIMT で warp 内スレッドが異なる実行パスを取る現象。シリアル実行で性能低下。(hpc / gpu) - [[Auto-tuning]] — GPU カーネルのパラメータ最適値を自動探索するプロセス。全論文の 1/8 超が採用し性能可搬性にも必須。(hpc / gpu / performance) - [[Heisenbug]] — Gray は本番ソフトウェア(設計レビュー、品質保証、アルファテスト、ベータテスト、本番運用を経たもの)では「硬い」Bohrbug はすでに除去されており、残留バグの大多数は Heisenbug であると主張した。(software reliability) - [[Infrastructure as Code]] — 中心的な問題は semantic gap:構文的に正しく、コンパイルを通過した IaC プログラムであっても、クラウドレベルの規約に違反してデプロイ時に失敗しうる。(cloud / systems) - [[IPCメトリクス]] — 計装済みサービスがプロセス間通信(IPC)の統計情報を収集・公開するオブザーバビリティシグナル。[[eBPF]]フローと補完してサービス依存マップを構築する(observability / distributed systems) - [[LLMスケーリング則]] — LLM スケーリング則(scaling laws)とは、大規模言語モデルの性能(汎化誤差)がモデルスケール $N$、データスケール $D$、計算予算 $C$ の増加に伴い冪乗則に従って予測可能に改善するという経験的...(machine-learning / scaling) - [[LLM分散学習]] — LLM分散学習は、数千億から兆規模の言語モデルを、数百から数万 GPU/AI アクセラレータ上で長時間訓練するためのシステム・運用・インフラの総体である。(machine-learning systems / distributed systems) - [[LLM学習モニタリング]] — 監視は 3 つの設計軸で整理できる: - 検知信号(何を見るか): ハートビート / 自己診断(MegaScale)、ホスト監視メトリクスの異常パターン(Minder)、ネットワークトラフィックのレート(Pulse...(machine-learning systems / distributed systems / networking) - [[LLM推論]] — - ハイブリッド圧縮アテンションが KV キャッシュ問題を構造的に解決し、100 万トークンコンテキスト推論を実用化した: KV キャッシュの肥大化は長コンテキスト推論の中心課題であるが、@2025__DeepSe...(LLM systems) - [[LSMツリー]] — メムテーブル→SSTable→コンパクションの書き込み最適化ストレージ構造。Bigtable 20 年史では外部コンパクションと CRDT changelog の基盤として進化。(storage systems / database internals) - [[メタ安定障害]] — SREGym では複合的な障害としてモデル化される: アプリケーション層のトリガ(例: トラフィックを増幅するリトライ設定の誤り、頻繁な GC を強いる実行時フラグ)と、システムを脆弱な状態へ追い込むインフラ制約(...(distributed systems / reliability) - [[Mixture-of-Experts]] — 分散訓練では Expert Parallelism(expert を worker 間に分散)として実現され、3 つの技術課題を持つ: - Sparse Activation: GShard(All-to-All...(machine-learning systems) - [[NetOps]] — NetOps が AIOps と異なる本質は安全性の閾値の高さにある。(networking / operations) - [[OLTPシステムアーキテクチャ]] — 1970 年代設計の RDBMS が抱えるバッファマネージャ・ロック・ログ・ラッチの 4 コンポーネントオーバーヘッドを段階的分解で定量化。単一ボトルネックは存在せず全コンポーネント除去で初めて 20 倍改善。(Database / Systems) - [[RCA入力選別]] — RCA入力選別は、根本原因分析に渡すログ・メトリクス・トレース・アラート・incident report を、過不足なく絞り込む設計課題である。(SRE / AIOps) - [[RCA評価設計]] — RCA評価設計は、根本原因分析手法が本当に因果的な診断能力を持つかを測るため、障害データ、オラクル、指標、過程評価を設計する取り組みである。(SRE / AIOps) - [[RDMA]] — RDMA(Remote Direct Memory Access)は、リモートホストのメモリへ CPU を介さず NIC が直接読み書きする通信機構である。LLM/HPC だけでなく、[[Azure Storage]] のようなクラウドストレージでも CPU 予約削減と低レイテンシ化の基盤になる。(networking / HPC) - [[RDMAネットワーク監視]] — RDMA/RoCE ネットワークの性能異常を、能動プローブ、受動トラフィック、スイッチデータプレーン、ホスト/NIC タイムスタンプなどで検知・箇所特定する取り組み。(networking / distributed systems) - [[MRC]] — MRC(Multipath RC)は RDMA の RC トランスポートを拡張し 1 キューペアが数百パスへパケットスプレーを行う新トランスポート。[[OpenAI]] が 10 万 GPU 超本番で実証。(networking / HPC) - [[SRv6]] — SRv6(Segment Routing over IPv6)はパケットに完全な経路情報を埋め込むソースルーティング技術。動的再計算不要・決定的転送・瞬時障害回避。(networking) - [[マルチプレーンClosトポロジ]] — 800G NIC を 8×100G 独立プレーンに分割しスイッチ 2 段で 131,000 GPU 超へ拡張するネットワークトポロジ設計。[[OpenAI]] が採用。(networking / HPC) - [[Scaling Telemetry Workloads]] — - 計装と分析の間に「中間処理層」を挟む設計パターンが SQL ベースで出現: @2024__IEEE CLOUD__Enabling Programmable Metric Flows の PMF は、計装層(P...(distributed systems / observability) - [[SRE]] — SRE(Site Reliability Engineering)は、ソフトウェアエンジニアリングの手法を運用の問題に適用するディシプリンである。(SRE / クラウド運用) - [[SRE AI Autonomy Levels]] — | Level | Monitor | Investigate | Mitigate | Actuate | Self-Direct | |-------|---------|-------------|-----...(SRE / AIOps / governance) - [[SRE Benchmark]] — SRE Benchmark(SRE / benchmark) - [[Transactional No-Regression]] — 「Transactional」はトランザクション的な試行(適用 → 観測 → 望ましくなければ巻き戻し)を、「No-Regression」は試行が現状の信頼性指標を後退させない不変条件を含意する。(agentic SRE / safety) - [[TSG自動化]] — - SOP フローは「TSG 自動化の RCA 特化版」——Microsoft 系 3 本との接点と差異: @2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based M...(AIOps / SRE / incident management) - [[べき等性]] — べき等性(GPU systems / fault tolerance) - [[インシデント管理]] — - インシデント対応ループを「証拠 → 仮説 → 緩和 → 変更記録」の翻訳の連鎖として捉え、各継ぎ目にエージェントを置く: 本 wiki は ICSE 研究で本番インシデントのライフサイクル(検知→トリアージ→診...(AIOps / SRE / cloud operations) - [[インターネットスケールサービス設計]] — - Cassandra(@2010__SIGOPS_OSR__Cassandra - A Decentralized Structured Storage System)は、Dynamo と同じく「障害は常態」の前...(SRE / cloud operations / service design) - [[エラーバジェット]] — エラーバジェットとは、SLO で許容される障害量の上限を「予算」として扱い、開発チームと SRE が共有する信頼性管理の仕組みである。(SRE / クラウド運用) - [[エージェントネイティブ RL]] — LLM エージェントの長期ホライズン・マルチターン軌跡を前提として設計された RL 訓練インフラストラクチャおよびシステム設計の総称。(machine-learning systems / agents) - [[エージェント型コーディング]] — LLM をエージェントとして環境(コードベース + 隔離コンテナ)内に配置し、ツール呼び出し(ファイル読み書き・シェル実行・検索・ウェブ検索)を通じてリポジトリを自律的に探索・修正するソフトウェア工学の取り組み。(software-engineering / machine-learning) - [[エージェント型強化学習]] — LLM を方策(ポリシー)としてオンポリシーの RL で事後学習する取り組みの総称。(machine-learning / agents) - [[LLM時系列アプローチ]] — LLM を時系列に適用する手法の 5 分類: Prompting(LLMTime/PromptCast)・Quantization(VQ-VAE/DeWave)・Aligning(One Fits All/MTAM)・Vision・Tool。One Fits All が言語・画像事前学習の時系列転移可能性を実証(machine-learning / time-series) - [[エージェント型時系列予測]] — 実装は 3 パラダイムに整理される: Workflow(事前定義 DAG/SOP による構造化実行。(machine-learning) - [[エージェントシステム運用]] — LLM エージェントシステム自体の信頼性・安全性・制御可能性を維持する運用技術の体系。AgentOps = モニタリング/異常検知/根本原因局所化/解決の 4 段階。(agent operations / AIOps) - [[エージェント運用安全性]] — 中心の形式装置が保証契約(assurance contract)で、自律度の段 k ごとに Ck = (Tk, Rk, Gk, Uk, Bk)(許可ツール面・必須証拠・迂回不能ゲート・ロールアウトプロトコル・予算、...(agentic operations / safety) - [[オープンLLM開発]] — オープン LLM 開発とは、大規模言語モデルの訓練パイプライン全体——事前学習データ、中間チェックポイント、後訓練データ、コード、訓練ログ、評価フレームワーク——を公開し、任意段階での介入・カスタマイズ・再現を可能...(machine-learning / open-source) - [[オープンネットワーキング]] — - DCN 設計の「最後の一マイル」——スイッチ設定生成——は依然として産業の暗黙知だった: @2026__NSDI__Matryoshka - Realizing Hyperscale Data Center N...(networking / distributed systems / HPC) - [[クラウドスケールRPC特性]] — クラウドスケールRPC特性は、ハイパースケール環境で RPC が示す規模・構造・レイテンシ・CPU コスト・エラー率の横断的な性質をまとめる概念である。(distributed-systems / cloud) - [[クラウド管理モダリティ]] — モダリティはインフラライフサイクルの 3 段階——provisioning(リソース生成と相互接続)・updates(live 更新と再作成を伴う更新)・monitoring(実時間の状態/テレメトリ取得)——を横...(cloud / systems) - [[クリティカルパス分析]] — クリティカルパス分析は、分散トレース上でエンドツーエンドレイテンシを実際に支配する RPC/処理区間を特定し、ユーザー影響の大きい遅延やエラーを優先的に扱う手法である。(microservices / observability) - [[コードLLM]] — コード LLM(Code LLM)とは、ソースコードの生成・補完・理解・変換に特化して学習された大規模言語モデルの総称である。(software-engineering / machine-learning) - [[ゴシッププロトコル]] — ゴシッププロトコル(gossip protocol)は、分散システムにおいてノード間で情報を伝播させるための通信手法であり、各ノードがランダムに選んだ少数の相手と定期的に状態を交換することで、最終的にクラスタ全体に...(distributed systems / membership / failure detection) - [[サーバーレスアーキテクチャ]] — サーバーレスコンピューティング = FaaS + BaaS(CNCF Serverless Whitepaper, 2019; Berkeley View on Serverless Computing, 2019)。(cloud computing / distributed systems) - [[サービスレベル目標]] — サービスレベル目標(SLO)とは、サービスの信頼性・性能に関する定量的な目標値である。(cloud operations) - [[サービストポロジ]] — マイクロサービス間の実行時依存関係をグラフ構造で表現したリアルタイム地図。eBPF・IPC メトリクス・分散トレースの 3 層融合で構築。Netflix が本番採用(distributed systems / observability / microservices) - [[ストラグラー]] — ストラグラー(machine-learning systems / distributed systems) - [[ソフトウェア変更管理]] — ソフトウェア変更管理(Software Change Management)は、大規模オンラインシステムにおいてソフトウェア変更の展開から解決までのライフサイクルを管理する取り組みである。(AIOps / SRE) - [[ソフトウェア耐障害性]] — ソフトウェア耐障害性(systems reliability) - [[チェックポイント]] — チェックポイント(fault tolerance) - [[テスト時計算スケーリング]] — ソフトマックスアテンションの二次計算量は、テスト時計算の連続的な延伸を阻む根本的なボトルネックとなる。(machine-learning / reasoning) - [[テレメトリ]] — - 計装の最前線が「GPU/アクセラレータ層」と「LLM 推論演算子・集合通信オペレーション」へ降りる: 博士論文が計装を path/time-oriented データ収集として整理し、eBPF のゼロ計装(Age...(distributed systems / observability) - [[ディペンダビリティ]] — ディペンダビリティ(dependability)とは、「正当に信頼できるサービスを提供する能力」であり、可用性(availability)・信頼性(reliability)・安全性(safety)・完全性(inte...(systems reliability / security) - [[データベース O&M]] — データベースの異常診断・復旧・性能最適化・サービス運用標準化を扱う領域。AI 診断だけでなく運用対象の形を狭める標準化も含む。(Database / AIOps) - [[データベースノブチューニング]] — データベースノブチューニングは、DBMS が公開する多数の設定パラメータ(メモリ、スレッド、キャッシュ、I/O など)を対象ワークロードに合わせて最適化し、レイテンシ低下またはスループット向上を狙う取り組みである。(データベース / AIOps) - [[データベース自律診断]] — データベース自律診断は、スロークエリ、リソース枯渇、ハング、クラッシュ、演算子起因の性能異常などを自動的に分析し、根本原因と解決策候補を特定する取り組みである。(データベース / AIOps) - [[トイル]] — トイルとは、手動的・反復的・自動化可能・戦術的・持続的価値がなく・サービス成長に比例して増大する運用作業の総称である。(SRE / 運用管理) - [[トレースサンプリング]] — トレースサンプリング(distributed systems / observability) - [[ドメイン別RCA]] — ドメイン別RCAは、根本原因分析を汎用 AIOps の単一手法として扱わず、対象システムの構造・信号源・介入可能性に応じて分ける考え方である。(SRE / AIOps) - [[ネットワークシミュレーション]] — ネットワークシミュレーションは、実際のネットワークインフラを構築・変更することなく、トポロジ・プロトコル・ワークロード設計の性能評価を行う手法の総体。(network systems / distributed systems) - [[ネットワーク依存性発見]] — 分散アプリケーションのサービス間依存関係を実行時通信から自動発見する手法群。パケット・ソケット・トランザクションの3層と、カーネル内フローバンドリング(Tsubouchi+2022)によるCPU 2.2%以下のソケットベース手法を含む。(distributed systems / observability / SRE) - [[ハードウェアカウンタ]] — ハードウェアカウンタ(performance analysis) - [[ビジョン言語モデル]] — ビジョン言語モデル(Vision-Language Model; VLM)は、LLM の言語理解・生成能力を視覚情報の処理に拡張したマルチモーダルモデルである。(machine-learning) - [[ブラスト半径]] — あるコンポーネントの障害・変更・メンテナンスが波及する影響範囲。[[サービストポロジ]]グラフの下流推移閉包で推定する(distributed systems / SRE / reliability) - [[プラットフォームエンジニアリング]] — プラットフォームエンジニアリングは、開発者が安全・効率的にプロダクトを構築・デプロイ・運用できる内部セルフサービス基盤(IDP)を構築・運用するディシプリンである。(SRE / クラウド運用) - [[プロセスペア]] — 1. ロックステップ: 主とバックアップが同一命令列を同期実行する。(fault-tolerant systems) - [[マイクロサービスアーキテクチャ]] — マイクロサービスアーキテクチャ(Microservice Architecture / MSA)は、モノリシックアプリケーションを小さなソフトウェアサービスに分解し、明確に定義された API(エンドポイント)を通じ...(distributed systems / software architecture) - [[マイクロサービスコールグラフ]] — マイクロサービスコールグラフとは、ユーザーリクエスト 1 件を起点として発生するマイクロサービス間のすべての呼び出しを有向グラフで表したものである。(distributed systems / microservices) - [[マルチトークン予測]] — マルチトークン予測(Multi-Token Prediction, MTP)は、標準的な次トークン予測に加えて複数の未来トークンを同時に予測する訓練目的関数である。(machine-learning) - [[マルチモーダル障害診断]] — マルチモーダル障害診断(Multimodal Failure Diagnosis)は、マイクロサービスベースのシステムにおいて、ログ・メトリクス・トレースの 3 種類の監視データを統合して障害の根本原因箇所特定(R...(AIOps / Microservices) - [[メインメモリデータベース]] — データベース全体を主記憶に常駐させ、バッファプール管理・WAL・ページ指向レイアウトを再設計する DBMS アーキテクチャ。メモリ常駐単体では不十分で他コンポーネント除去との組み合わせが必要。(Database / Systems) - [[モデル圧縮]] — 圧縮の動機は明確である——LLaMA-2 70B は FP16 で約 140 GB の GPU メモリを要し、単一 GPU でのデプロイが不可能になる。(LLM efficiency) - [[ログパース]] — - ログ署名(コード位置)による事前クラスタリングが従来パーサの精度と速度を同時に上回る: @2023__ICSE__LogReducer - Identify and Reduce Log Hotspots in...(AIOps / log analysis) - [[ログ生成]] — ログ生成(software engineering / observability) - [[ログ解析]] — 研究領域としてのログ解析は、単一タスクでなくエンドツーエンドのパイプライン全体として捉えるのが現在の到達点である。(AIOps / log analysis) - [[ワークフロー自動化]] — ワークフロー自動化は、人間が手順書・Runbook・TSG・運用プロセスとして実行していた複数ステップの作業を、機械が状態を見ながら実行・分岐・検証する取り組みである。(AIOps / SRE) - [[リアルタイム依存性マップ]] — 分散システムのサービス間依存関係を実トラフィックに基づき継続更新するグラフ。静的アーキテクチャ図と対比して「リビングマップ」とも呼ばれる(distributed systems / observability) - [[一貫性ハッシュ法]] — 一貫性ハッシュ法(consistent hashing)は、ハッシュ関数の出力空間を固定の環状空間(リング)として扱い、データ項目とノードをリング上の位置に配置するパーティショニング手法である。(distributed-systems) - [[並列ファイルシステム]] — 並列ファイルシステムとは、ネットワーク経由で接続された複数のサーバ・ストレージデバイスにファイルデータをストライピング(分散配置)し、並列 I/O によってアグリゲートスループットを最大化する分散ファイルシステムである。(distributed systems / HPC storage) - [[並列化戦略]] — 主要な並列化次元(Hybrid の構成要素): - Data Parallelism: 入力 batch を分割し各デバイスがモデル複製で処理、勾配を集団通信で集約。(machine-learning systems / distributed systems) - [[仮説駆動RCA]] — 仮説駆動RCAは、障害症状から複数の原因仮説を立て、限定された証拠で検証・棄却・再定式化しながら根本原因へ近づく RCA の調査スタイルである。(SRE / AIOps) - [[分散ストレージ]] — 複数サーバにまたがるデータ格納・管理システム。Bigtable 20 年史は中核モデル維持とサービス運用化を、Azure Storage の RDMA 展開はネットワークが性能とコスト構造を支配することを示す。(distributed-systems) - [[分散トレーシング]] — - 「サンプリングで量を減らす」と「圧縮でサイズを減らす」は直交する 2 軸: 既存の横断的知見は、ヘッド/テールサンプリング(Hindsight・TraStrainer・Astraea)がトレースの本数や計装点を...(distributed systems / observability) - [[変化点検知]] — 変化点検知(time-series / AIOps) - [[多変量時系列予測]] — 多変量時系列予測(machine-learning) - [[専用データベースシステム]] — 専用データベースシステム(specialized database systems)とは、特定のワークロード特性に合わせてストレージ構造・クエリ処理・トランザクションモデル・可用性機構を最適化したデータベースエンジ...(database systems) - [[差分プライバシー]] — 差分プライバシー(Differential Privacy, DP)は、データ解析アルゴリズムの出力から個々のレコードが存在したかどうかを確率的に推定困難にする情報理論的プライバシー保証の枠組みだ。(privacy / machine learning / data systems) - [[強化ファインチューニング]] — 中心アルゴリズムには DPO(報酬モデル + PPO のパイプラインを選好ベース目的の直接最適化で簡素化)、PPO(連続行動空間での安定性で広く使われる)、GRPO(PPO をグループベースの方策更新へ拡張)がある。(machine-learning / aiops) - [[強化学習スケーリング]] — - RL のスケーリングにはベースモデルの規模閾値が存在し、小規模モデルでは純粋 RL の効果が現れない: @2025__arXiv__DeepSeek-R1 - Incentivizing Reasoning C...(machine-learning / scaling-laws) - [[性能可搬性]] — 性能可搬性(HPC / machine-learning systems) - [[時系列データベース]] — 時系列データベース(distributed systems / time-series) - [[時系列基盤モデル]] — @2025__arXiv__Foundation Models for Time Series - A Survey はより一般的に、TSFM を NLP の基盤モデル(LLAMA・BERT・GPT)のパラダイムを...(machine-learning) - [[u-μP]] — 小規模プロキシモデルでチューニングしたハイパーパラメータを大規模モデルへ転移するスケーリング実験手法。Toto 2.0 で採用、dd_unit_scaling ライブラリ公開(machine-learning / scaling) - [[Contiguous Patch Masking]] — 学習時に連続パッチを一括マスクしシングルパス推論を可能にする時系列 TSFM のアーキテクチャ技術。Toto 2.0 の主要革新、レイテンシを大幅削減(machine-learning / time-series) - [[時系列質問応答]] — ARFBench は TSQA を多肢選択の単一クラス分類問題に落とし込む設計を取る。(machine-learning / time-series) - [[暗黙のコンテキスト伝搬]] — 暗黙のコンテキスト伝搬(implicit context propagation)とは、分散トレーシングにおいてトレース ID・スパン ID などの識別子をパケットのヘッダやペイロードに明示的に挿入することなく、ネ...(distributed systems / observability) - [[根本原因分析]] — 根本原因分析(Root Cause Analysis, RCA)は、障害の症状から、影響するシステム層・障害種別・因果連鎖を絞り込み、人間またはエージェントが次の緩和判断に使える説明を得る取り組みである。(SRE / AIOps) - [[特徴量削減]] — 特徴量削減(AIOps / time-series) - [[異常検知]] — LLM 時代の異常検知手法は、サーベイの整理では 3 方向に分かれる(§4.1):(1) モデルの汎化向上(時系列・ログの基盤モデルの開発/fine-tuning)、(2) 大モデルで小モデルを強化(LLM がログ...(AIOps / time-series) - [[結果整合性]] — 結果整合性(eventual consistency)は、分散データストアにおいて、すべての更新が最終的にすべてのレプリカに到達することを保証する整合性モデルである。(distributed-systems) - [[耐障害LLM訓練]] — 耐障害LLM訓練(machine-learning systems / distributed systems) - [[自動化のアイロニー]] — 1. 設計者のアイロニー: オペレータを「信頼性が低い」として排除しようとする設計者自身のエラーが、運用上の主要な問題源となる 2. 残余タスクのアイロニー: 自動化できなかったタスクだけがオペレータに残され、それ...(ヒューマンファクター / 自動化設計 / 認知工学) - [[設定マイニング]] — Zodiac はこの系譜をIaCへ拡張する。(program analysis / configuration) - [[近似クエリ処理]] — 時系列モニタリングでは、スライディングウィンドウに対する集約(quantile・count・distinct・entropy・L2 norm・TopK)を近似する。(databases / time-series / streaming analytics) - [[運用障害分析]] — 運用障害分析(operational failure study / failure data analysis)は、本番システムの障害事後報告や障害追跡データベースを体系的に収集・分類し、障害原因の分布・修復時間...(SRE / dependability / systems) - [[限定観測可能性]] — 限定観測可能性 (Limited Observability) とは、根本原因分析 (RCA) の文脈において、根本原因候補 (Root Cause Candidates, RCC) の一部またはすべてを直接監視で...(SRE / AIOps) - [[障害予測]] — 障害予測(AIOps / cloud operations) - [[障害注入]] — - 障害注入の有効性を「実障害データとの突き合わせ」で評価した最初の実証が 2003 年に存在する: @2003__USITS__Why Do Internet Services Fail and What Can...(SRE / AIOps) - [[障害緩和]] — @2025__CSUR__A Survey of AIOps in the Era of Large Language Models は緩和(assisted remediation)を自動化レベル昇順の 5 段に...(SRE / AIOps) - [[集合通信]] — - AllToAllv スケジューリングは NP 困難問題から多項式時間問題に「問題の単純化」で帰着できる: TACCL・TE-CCL・SyCCL が AllToAllv を NP 困難な制約充足問題として定式化し...(distributed systems / GPU clusters) - [[非致命的RPCエラー]] — 非致命的 RPC エラー(non-fatal RPC error)とは、マイクロサービスアーキテクチャにおいて、内部 RPC が失敗コードを返しても上位リクエストが成功する場合のエラー。(distributed systems / microservices / performance) - [[Transformer]] — 再帰・畳み込みを排し自己アテンションのみに基づく系列変換モデルアーキテクチャ。GPT シリーズを通じて LLM の基盤アーキテクチャとなった。(machine-learning) - [[言語モデル事前学習]] — 大規模ラベルなしテキストで汎用表現を学習し個別タスクに転移する二段階パラダイム。GPT-1 が確立し GPT-2/3 でゼロショット/文脈内学習へ発展。(machine-learning) - [[文脈内学習]] — 言語モデルが推論時にプロンプト中の少数例示からパラメータ更新なしにタスクを遂行する能力。GPT-3 が 175B 規模で大規模に実証。(machine-learning) - [[Webロードバランシング]] — ウェブリクエストを複数サーバーへ分散する機構の総称。OSI 層(L2/L3/L7)・応答返路(双方向/一方向)・コンテンツ把握(content-blind/content-aware)の 3 軸で分類する。(distributed / web-systems / load-balancing) - [[サーバーレスワークフロー]] — 複数イベントと Function を n:m マッピングで結び、逐次・並列実行・条件分岐・連鎖で構成するオーケストレーションパターン。CNCF 白書(2018)が 5 パターン・6 状態を定義。AWS Step Functions 等のステートマシン型が代表実装。(cloud computing / distributed systems) - [[AI Greenferencing]] — 再生可能エネルギーの発電源(風力発電所等)にモジュラー型 AI コンピュートを配置し、電力網を迂回して AI 需要を発電源で消費する展開モデル。[[Microsoft]] が提唱。(AI infrastructure / sustainable computing) - [[変更起因インシデント]] — ソフトウェア・構成・データ・インフラへの変更が直接の引き金となって発生するインシデント。「導入→検知→緩和」の 3 段ライフサイクル。コード変更が最多(54-55%)、RbIC は RaIC より TTM を 40.6% 短縮。4 課題: 不足した監視指標・不正確な変更監視・低ビジネストラフィック・非効率な異常変更箇所特定。(AIOps / SRE / change management) - [[クラウドモニタリング]] — クラウドサービスの稼働状態・性能・健全性を自動化ウォッチドッグで継続観察しインシデントを先手で検知・報告する運用実践の総体。Ganatra et al. 2023 はミス検知 6 カテゴリタクソノミを構築し、40.41% が「必要なモニタ/アラートが存在しない(Missing monitor/alert)」に起因することを実証。(AIOps / SRE / cloud operations) - [[アラート管理]] — モニタリングシステムが生成する raw alert を correlation・storm handling・determination の 3 プロセスで整理する [[インシデント管理]] の上流工程。Yu+ JNCA2024 が alert と incident を別ライフサイクルとして分離する統一 AIM アーキテクチャを提示。(AIOps / ITSM) - [[インシデントTTM予測]] — オンラインサービスのインシデント緩和完了までの所要時間(TTM: Time To Mitigation)を複数時点で予測する ML タスク。Wang+ ISSRE2021 が T3(最終担当チーム後の緩和フェーズ)が TTM の平均 70% を占めることを初めて定量化し、2 段階 biGRU+アテンションの TTMPred を提案。(AIOps / incident management) - [[分散メッセージブローカ]] — ソフトウェアアーキテクチャの段を非同期 publish-subscribe で疎結合させる中間層。Kafka(スループット最大化)と AMQP(信頼性・レイテンシ最大化)が起源(LinkedIn のログ処理 vs 金融取引処理)に由来する対照的な設計選択を示す。(distributed systems / messaging) - [[クラウド障害ライフサイクル]] — クラウドサービス障害の TTD・TTI・TTM・TTR 4 段ライフサイクルを定量化する枠組み。Li+ ISSRE 2022 が三大クラウド 354 件を分析し MTTM=304.2 分・TTM が TTR の 53% を支配することを実証。(cloud-reliability / SRE / dependability) - [[Quality of Alerts]] — Yang+ DSN2022 が提案する自動評価枠組み。indicativeness(ユーザ影響を指すか)・precision(重大度を正しく反映するか)・handleability(処理容易性)の 3 軸でアラートの有用性を自動評価する。アラートアンチパターン自動検知の基盤に位置づけ(AIOps / Alert Management) - [[アラートアンチパターン]] — 誤導的・情報量不足・行動可能でないアラートで OCE 診断を妨げる設計。Yang+ DSN2022 が個別 4 種(Unclear Name/Description・Misleading Severity・Improper/Outdated Rule・Transient/Toggling)と集合 2 種(Repeating・Cascading)を実証同定(AIOps / Alert Management) - [[アラート集約]] — システム障害がトリガするアラートストームを同一根本原因クラスタにまとめる技術。意味類似度系・統計系・ハイブリッド系の 3 系統対立は頻度分布と semantic dispersion の交差で決まる(AIOps / Alert Management) - [[COLA]] — Kuang+ ICSE-SEIP2024 のハイブリッド型オンラインアラート集約フレームワーク。相関マイニング(温度+空間)で高信頼ペアを高速判定、低信頼ペアのみ LLM 推論(CoT 2 ラウンド + ICL + P-tuning v2 SFT)。Cloud X(匿名化 Huawei Cloud)で F1 0.901-0.930、本番 4 ヶ月運用(AIOps / Alert Aggregation) - [[KIMetrix]] — Singal+ arXiv2025 のマイクロサービス向けメトリクス選定システム(IBM Research India)。エントロピー + 相互情報量 + AIMD + topology-aware で SelectKBest/mRMR/Boruta/Max Weighted Clique を上回る coverage(DeathStarBench CPU で 99.44%)(AIOps / Observability) - [[情報量基準メトリクス選定]] — SRE がアラート定義の前段で「どのメトリクスを監視するか」を自動決定する問題。Singal+ arXiv2025 が Informative Metric Subset Problem として形式化し最大重み付きクリーク問題からの帰着で NP 完全性を証明(AIOps / Observability) - [[AirAlert]] — Chen+ WWW2019 が Microsoft で実証したアウテージ予測・診断システム。Bayesian network(FCI)で信号-アウテージ依存性を学習し、XGBoost で予測。サービスレベル outage で Simple Spike(F1 7-11%)が崩壊する場面で F1 53-88% を達成(AIOps / Outage Prediction) ### 2026-06-17 distributed training batch (15 new + 6 updated) - [[テンソル並列]], [[パイプライン並列化]], [[PTD-P]], [[ZeROメモリ最適化]], [[ZeROオプティマイザ]], [[ZeROパラメータシャーディング]], [[シーケンス並列化]], [[選択的活性化再計算]], [[再マテリアライゼーション]], [[混合精度訓練]], [[共有異常]], [[Virtual Private Cluster]], [[ネットワーク対応スケジューリング]], [[タスク並列フレームワーク]], [[動的タスクグラフ]] ### 2026-07-01 NORAD Near Miss batch (2 updated) - [[複雑システム障害論]] — [[@2023__SREcon23Americas__Epic Incidents of History - The 1979 NORAD Nuclear Near Miss]] が引用する Walker・Woods・Rayo(2016)の「複数の系統的寄与要因 vs 根本原因」論を、命題 7(RCA の社会的構築性)の歴史的スケールへの拡張として追記 - [[根本原因分析]] — 1979年 NORAD 誤警報を「単一根本原因の探索が構造的に成立しない」歴史的事例として追記 ### 2026-07-01 SREcon23 EMEA McCarthy ingest (1 updated) - [[インシデント重大度評価]](更新) — McCarthy の correctness 軸(可用性でなく正しさの毀損)と、意図でなく結果を選ぶ重大度判断の処方箋を横断的知見に追記 ### 2026-07-01 Hard Choices, Tight Timelines (SREcon24 Americas) ingest (1 new) - [[トレードオフ意思決定]](新規) — インシデント対応中の階層横断的トレードオフ意思決定(skip-level tradeoff)を定義。The Void データベースの限界(推論過程の欠落)を vignette 法で補完した調査に基づく(concept / sre / incident-management / tradeoff) ### 2026-07-01 Storytelling as an Incident Management Skill (SREcon24 Americas) ingest (2 updated) - [[インシデントストーリー]](更新) — de Vesine の因果論理中心 narrative と Nash/Hochstein の人物中心 narrative を「目的別使い分け」として整理する横断的知見、および「対応中の協調的ストーリーテリング」という適用フェーズを追記(concept / sre / incident-management / postmortem) - [[ポストモーテム]](更新) — de Vesine の5段階「エンゲージングなポストモーテム」構成を、Nolan のテンプレート批判・Partington の learning > fixing と接続する横断的知見を追記(concept / sre / postmortem) ### 2026-07-22 The Failure of Knowledge Management / Infrastructure Management Timescales (Mark Burgess) ingest (2 new, 3 updated) - [[知識のリレーションシップモデル]](新規) — 知識を静的データではなく個人的関係性として捉える Burgess の知識管理論。既存の [[知識グラフ]] との対比を横断的知見に記載(concept / knowledge-management / epistemology) - [[タイムスケール分離と監視粒度]](新規) — 観測・是正のタイムスケールを問題自身の時間スケールに一致させる原則(KT境界、Dynamics trump semantics)(concept / monitoring / control-theory / sre) - [[知識グラフ]](更新) — Burgess の論理的知識表現批判との緊張関係を contradiction callout として追記 - [[アラート疲労]](更新) — タイムスケール不一致という、アラート量削減より上流の構造的原因を追記 - [[制御ループの安定性とタイムラグ補償]](更新) — Apollo throttle castellation 事例を Burgess のタイムスケール一致原則の具体例として接続 ### 2026-08-13 TS-Benchmark (ICDE 2021) ingest (2 updated) - [[時系列データベースベンチマーク]](更新) — TS-Benchmark の3ワークロード分離設計、及び TS-Benchmark/SciTSv2 が独立に観測したストレージエンジン設計トレードオフ(TSMツリー vs 行指向)を横断的知見に追記 - [[時系列データ生成]](更新) — TSM-Bench が比較対象とする「TS-Graph」の原論文が TS-Benchmark(参考文献[68])であることを特定し、DCGAN + 有向グラフ + ランダムウォーク手法の詳細と TS-LSH との構造的差異を追記 ### 2026-08-18 機械学習システムデザイン(オライリー・ジャパン 2023)ingest-book (16 新規 / 44 更新) - [[機械学習システムの4要件]](新規) — 信頼性・拡張性・保守性・適応性という、ユースケースを問わず共通のチェックリスト(2 章) - [[目的関数のデカップリング]](新規) — 複数目的を単一損失にまとめず目的ごとにモデルを分け推論時に重み付き和で結合する設計(2 章) - [[サンプリング手法]](新規) — 非確率サンプリングと確率サンプリング(単純無作為・層化・重み付き・リザーバー・重点)の選択(4 章) - [[天然ラベル]](新規) — 人手アノテーションなしにシステム自身が推測できるラベルと、そのフィードバックループの長さ(4 章) - [[ラベル不足への対処]](新規) — 弱教師学習・半教師学習・転移学習・能動学習の 4 系統(4 章) - [[クラス不均衡]](新規) — 学習が難しくなる 3 理由と、評価指標・データレベル・アルゴリズムレベルの 3 対処(4 章) - [[データオーグメンテーション]](新規) — データ量の水増しに留まらずノイズ・敵対的攻撃への頑健性を高める技法群(4 章) - [[データリーク]](新規) — ラベル情報が特徴へ漏れ込み評価では高精度、実運用では再現しない現象。6 原因と検出法(5 章) - [[特徴の汎化]](新規) — 個々の特徴が未知データに対してどれだけ有効であり続けるかという評価軸(5 章) - [[モデル評価のベースライン]](新規) — 評価指標は単体ではほぼ意味を持たず参照点との比較で初めて解釈できる(6 章) - [[摂動テストと不変性テスト]](新規) — 入力操作型の評価手法群(摂動・不変性・方向性期待値)(6 章) - [[モデルのキャリブレーションと信頼度測定]](新規) — 出力確率が実頻度と一致しているかを測る性質と、個々の予測への信頼度(6 章) - [[推論最適化]](新規) — モデルを小さくせず推論そのものを高速化する処理。IR 経由のコンパイル最適化と autoTVM(7 章) - [[データ分布のシフト]](新規) — 共変量シフト・ラベルシフト・コンセプトドリフトの数学的定義、検知手法、対処の 3 系統(8 章) - [[シャドウデプロイ]](新規) — 候補モデルを並行稼働させ予測をログのみに留める、最も安全な実環境テスト(9 章) - [[インターリービング試験]](新規) — 1 人のユーザーに両モデルの出力を混ぜて提示し、A/B テストより少ないサンプルで判定する手法(9 章) - 更新 44 件: [[MLモデル監視]]・[[機械学習システムの設計パターン]]・[[機械学習プロジェクトの進め方]]・[[機械学習の要否判断]]・[[機械学習基盤]]・[[機械学習アルゴリズム選択の指針]]・[[特徴量ストア]]・[[MLメタデータ管理]]・[[継続的トレーニング]]・[[責任あるAI]]・[[モデル圧縮]]・[[量子化]]・[[枝刈り]]・[[知識蒸留]]・[[カーネルフュージョン]]・[[Edge Computing]]・[[WebAssembly]]・[[評価データ分布の設計]]・[[分類モデルの評価指標]]・[[アンサンブル学習]]・[[損失関数]]・[[汎化能力]]・[[予測モデルの解釈手法]]・[[A-Bテスト]]・[[カナリアテスト]]・[[多腕バンディット]]・[[フィードバックループ]]・[[クラウドソーシングによるアノテーション]]・[[データ品質SLO]]・[[データウェアハウス]]・[[データレイク]]・[[リレーショナル対ドキュメントモデル]]・[[グラフデータモデル]]・[[列指向OLAPデータベース]]・[[OLTPシステムアーキテクチャ]]・[[ACIDと分離レベル]]・[[マイクロサービスアーキテクチャ]]・[[データフローエンジン]]・[[パイプライン並列化]]・[[モデルアーキテクチャ・定義・訓練済みモデル]]・[[GPUクラスタスケジューリング]]・[[組織設計のスターモデル]]・[[予測分析とアルゴリズムバイアス]]・[[差分プライバシー]] - [[集合通信]](更新) — PCIe SW 論理分割による NCCL の NIC 選択偏りの実運用事例、Ring-AllReduce の一筆書き経路によるノード間 NIC 全二重通信の活用を追記 - [[RDMA]](更新) — Peer Memory Direct の実運用チェックリスト(PCIe Switch の DMA 折り返し可否・GPU-NIC affinity)を追記 - [[インネットワーク集約]](新規) — SHArP(COM-HPC '16)を軸に、集約木の論理・物理分離、end-point 管理からスイッチングインフラ管理への権限移譲、高 radix スイッチによる浅い縮約木、決定的演算順序の保証、ハードウェアペイロード上限のソフトウェアパイプライン化という設計原則を整理 - [[InfiniBand]](更新) — SHArP(COM-HPC '16)による TCA のスイッチ内蔵仮想実装、RC/UD トランスポートの使い分けを追記 - [[集合通信]](更新2) — NVSHARP/Multimem の前身にあたる SHArP(COM-HPC '16、InfiniBand SwitchIB-2)を追記し、現代 GPU 集合通信のハードウェア縮約が 10 年近く先行する HPC インターコネクト技術に系譜を持つことを記録 --- ## Entities - [[Marcelo Amaral]] — [[Barcelona Supercomputing Center]] の研究者。SC17トポロジ考慮型GPUスケジューリング論文の第一著者(person) - [[Jordà Polo]] — [[Barcelona Supercomputing Center]] の研究者。同論文の共著者(person) - [[David Carrera]] — [[Barcelona Supercomputing Center]] の研究者。同論文の共著者(person) - [[Seetharami Seelam]] — [[IBM Watson Research Center]] の研究者。同論文の共著者(person) - [[Malgorzata Steinder]] — [[IBM Watson Research Center]] の研究者。同論文の共著者(person) - [[Barcelona Supercomputing Center]] — スペインのスーパーコンピューティング研究機関。IBM/BSC Technology Center for Supercomputing協業(organization) - [[NADDOD]] — 光トランシーバ・光ファイバーケーブル製造ベンダー。200G〜1.6T製品ラインと業界標準規格の解説ブログを持つ(organization / networking / optics) - [[Skedulix]] — Anirban Das らのハイブリッドクラウドジョブスケジューラ。サーバーレス環境でプライベートクラウドのコスト最適化と処理時間のバランスを取る。IEEE CLOUD 2020 ベストペーパー(product / serverless / scheduling) - [[DeepGEMM]] — DeepSeek 開発の MoE 向け GEMM 最適化ライブラリ。連続レイアウト(Prefill)とマスク形式(Decode)を使い分け(repository / distributed-systems / moe) - [[EPLB]] — DeepSeek 開発の Expert Parallelism Load Balancer。冗長エキスパート配置でスループット Prefill 1.49x・Decode 2.54x 向上(repository / distributed-systems / moe) - [[LineShine]] — 中国の全CPU(Arm)スーパーコンピュータ。2026年Top500首位。LX2プロセッサ(SME行列拡張・304コア/ソケット)による同質アーキテクチャ(product / hpc) - [[Top500]] — 世界のスーパーコンピュータをHPL性能で順位づけするリスト・運営組織。2026年に[[LineShine]]で中国が7年ぶりに首位復帰(organization / hpc) - [[IO500]] — ストレージシステムのI/O性能を順位づけするベンチマークリスト。2026年にSugon [[ParaStor F9000]]がDAOSを上回り首位(organization / hpc / storage) - [[Sugon]] — 中国のHPC・ストレージハードウェアメーカー。[[ParaStor F9000]]開発元(organization / hpc / storage) - [[ParaStor F9000]] — Sugon製オールフラッシュ並列ファイルシステム・アプライアンス。2026年IO500首位(product / storage / hpc) - [[Yutong Lu]] — 中国のHPC研究者(卢宇彤)。ISC26 Top500セッションで[[LineShine]]の技術詳細を発表(person / hpc) - [[James Lin]] — 上海交通大学HPCセンター副ディレクター(林新华)。Top500における中国の再登場の地政学的意味と「エージェントのためのスパコン」構想を発表(person / hpc) - [[Weicheng Huang]] — 台湾国家高性能計算センター所属。[[主権AI]]の機運がHPCセンター予算にもたらした恩恵を定量化(person / hpc) - [[Sal Furino]] — Customer Reliability Engineer。SLO 導入・SRE 文化浸透を専門。SLODLC フレームワークを SREcon23 EMEA で紹介(person / sre) - [[Chris Jones]] — [[Google]] App Engine SRE、[[SRE Book]] 第 4 章(SLO)共著者。SREcon16 でエラーバジェット制御ループを口頭解説(person / sre / google) - [[Lorin Hochstein]] — Airbnb Staff Software Engineer, Reliability。SRE・インシデント管理・レジリエンスエンジニアリングの実践者。SREcon26 Americas クロージングキーノート(person / sre / incident-management) - [[Airbnb]] — 民泊プラットフォーム企業。Once Upon an Incident セッションで組織的インシデントストーリーテリングを実践(organization / tech / sre) - [[Aaron Bowden]] — Google Cloud Professional Services SRE Practice Lead JAPAC。[[Reliability Map (r9y.dev)]] オープンソースプロジェクト主導者。(person / sre / google) - [[Richard I. Cook]] — University of Chicago 医師・研究者。How Complex Systems Fail (1998) 著者。複雑システム安全工学・ヒューマンファクタ研究の先駆者(person / safety / human-factors) - [[Mark Burgess]] — CFEngine 開発者。システム管理の工学化を主張した先駆者(person / sre / systems-administration) - [[Ruowei Fu]] — [[Nankai University]] 所属研究者、OncallX 筆頭著者(person / aiops / on-call) - [[OncallX]] — Nankai University / ByteDance 共同開発のオンコール自動化システム(product / aiops / on-call) - [[Dong Wang]] — Baidu プリンシパルアーキテクト。SRE チームを率い異常検知・障害自動修復に従事(person / sre / anomaly-detection) - [[Baidu]] — 中国最大の検索エンジン企業。10 億ユーザー超(organization / internet / china) - [[Nicole Forsgren]] — [[DORA]] 共同創設者・研究者。DX を SRE の信頼性システム特性として論じた(person / sre / developer-experience) - [[Abi Noda]] — 開発者体験の専門家。[[Nicole Forsgren]] と "Frictionless"(2026)共著(person / developer-experience) - [[Zeyuan Allen-Zhu]] — [[Meta FAIR]]。[[Physics of Language Models]] シリーズ主導、[[知識操作]]・[[知識容量スケーリング則]]・[[文脈自由文法]]学習の制御実験を確立(person / llm / interpretability) - [[Yuanzhi Li]] — MBZUAI。[[Zeyuan Allen-Zhu]] と共同で [[Physics of Language Models]] シリーズを主導(person / llm / interpretability) - [[Yann LeCun]] — [[Meta FAIR]] Chief AI Scientist・NYU 教授。次トークン予測のみによる学習が[[LLM意味表象]]の人間整合性を高めないと主張、世界モデル系自己教師あり学習を提唱([[joisino-LLMと言葉の感じ方-2026]] 文脈)(person / ai-research) - [[Meta FAIR]] — Meta AI Research。[[Zeyuan Allen-Zhu]]・[[Yann LeCun]] が所属し [[Physics of Language Models]] や次トークン予測限界の研究を発信(organization / industrial-lab / machine-learning) - [[Anthropic]] — Claude を提供する AI スタートアップ。[[文脈付き検索]] (Contextual Retrieval)・[[報酬ハッキング]]・[[スコファンシ]]の研究源として 13 件の joisino 記事で複数言及(organization / ai-startup / safety-research) - [[Michelle Brush]] — [[Google]] Engineering Director, SRE。Google Compute Engine と Persistent Disk の信頼性を担い、SREcon26 Americas 2026 で AI エージェント時代の複雑システム信頼性を論じた(person / sre / google) - [[Youcef Remil]] — [[University of Lyon]] / [[INSA Lyon]] / [[CNRS]] UMR 5205 / [[Infologic]] 所属。AIOps for incident management サーベイ([[@2024__arXiv__AIOps Solutions for Incident Management]])の筆頭著者(person / aiops) - [[Anes Bendimerad]] — [[Infologic]] 所属。Remil+ 2024 AIOps サーベイ共著者(person / aiops) - [[Romain Mathonat]] — [[Infologic]] 所属。Remil+ 2024 AIOps サーベイ共著者(person / aiops) - [[Mehdi Kaytoue]] — [[University of Lyon]] / [[INSA Lyon]] / [[CNRS]] UMR 5205 / [[Infologic]] 所属。Remil+ 2024 AIOps サーベイの senior author(person / aiops / pattern-mining) - [[University of Lyon]] — フランス・リヨンの大学連合体。[[CNRS]] UMR 5205 と協働(organization / university) - [[INSA Lyon]] — フランス・ヴィルールバンヌの工学系大学(Institut National des Sciences Appliquées de Lyon)。[[University of Lyon]] 連合・[[CNRS]] UMR 5205(LIRIS)との協働拠点(organization / university) - [[CNRS]] — フランス公的研究機関(Centre national de la recherche scientifique)。UMR 5205(LIRIS)は [[University of Lyon]] / [[INSA Lyon]] との共同研究室(organization / research-institute) - [[Infologic]] — フランス・ブール=レ=ヴァランスの企業。AIOps 産学連携の本拠で、Infologic SQL Queries / Alerts / ASH を public dataset として提供(organization / industry / aiops) - [[Yuting Jiang]] — [[Microsoft Research]]。SuperBench equal contribution 著者(person / ai-systems) - [[Ziyue Yang]] — [[Microsoft Research]]。SuperBench equal contribution 著者(person / ai-systems) - [[Lei Qu]] — [[Microsoft Research]]。SuperBench 共著(person / ai-systems) - [[Yongqiang Xiong]] — [[Microsoft Research]] Asia。Systems and Networking Research Group(person / ai-systems) - [[Lidong Zhou]] — [[Microsoft Research]]。グレイ障害概念(Huang+ 2017)提唱者の一人(person / distributed-systems) - [[SuperBench]] — Azure 本番にデプロイされた GPU クラスタ向けプロアクティブ検証システム。OSS は microsoft/superbenchmark(product / aiops / gpu) - [[Dahua Lin]] — [[Shanghai AI Laboratory]] / [[The Chinese University of Hong Kong]] の研究者。[[InternLM]] 系 LLM 開発を主導(person / llm-systems) - [[Yonggang Wen]] — [[Nanyang Technological University]] 教授。AI システム・データセンターワークロード分析(person / ai-systems) - [[Nanyang Technological University]] — シンガポールの研究大学。S-Lab を含む AI システム研究拠点(organization / academic) - [[SenseTime Research]] — 中国 [[SenseTime Research|SenseTime]] の研究組織。[[Helios]] と [[Acme]] 特性化研究に参加(organization / industry / ai) - [[InternLM]] — [[Shanghai AI Laboratory]] の LLM シリーズ(7B〜123B、transformer decoder-only)(product / llm) - [[AcmeTrace]] — [[Acme]] Seren/Kalos の 6 か月マルチモーダル本番トレース公開版(dataset / gpu-cluster) - [[Andre Bento]] — [[University of Coimbra]] / CISUC の研究者。Bento+ 2021(J Grid Computing)の corresponding author。[[OpenTracing Processor]] (OTP) のリードオーサ(person / observability / tracing) - [[Jaime Correia]] — [[University of Coimbra]] / CISUC の研究者。Bento+ 2021(J Grid Computing)と Pina+ 2018(IEEE NCA)の共著者(person / observability / microservices) - [[Ricardo Filipe]] — [[University of Coimbra]] / CISUC の研究者。Bento+ 2021(J Grid Computing)と Pina+ 2018 の共著者(person / observability / microservices) - [[Filipe Araujo]] — [[University of Coimbra]] / CISUC の研究者。Bento+ 2021(J Grid Computing)と Pina+ 2018 の共著者(person / observability / microservices) - [[OpenTracing]] — 分散トレーシングのベンダー中立 API/抽象標準。trace ID・span ID・親 span ID で span tree を構成、annotation で key-value メタ情報を付与。2019 年に OpenCensus と統合する形で [[OpenTelemetry]] に合流(product / observability / tracing) - [[OpenTracing Processor]] — Bento+ 2021(J Grid Computing)が公開した OpenTracing データ用処理パイプライン。Java Streaming API で span→trace 再構築、NetworkX で graph 処理、OpenTSDB+Grafana にメトリクス出力。GitHub: andrepbento/OpenTracingProcessor(repository / observability / tracing) - [[Felix Salfner]] — [[Humboldt University of Berlin]] の研究者。[[A Survey of Online Failure Prediction Methods]] 筆頭著者。HSMM ベースのオンライン障害予測の中心人物(person / dependability / failure-prediction) - [[Maren Lenk]] — [[Humboldt University of Berlin]] 所属(2010 年時点)。[[A Survey of Online Failure Prediction Methods]] 2nd author(person / dependability) - [[Miroslaw Malek]] — [[Humboldt University of Berlin]] 教授。ディペンダビリティ・プロアクティブ障害管理研究の指導的研究者。[[A Survey of Online Failure Prediction Methods]] senior author(person / dependability / failure-prediction) - [[Humboldt University of Berlin]] — ベルリンの研究大学。[[Miroslaw Malek]] らの dependable computing グループを擁し、HSMM ベース予測手法と Salfner+ 2010 サーベイの発信源(organization / university / dependability) - [[Patrick D. T. O'Connor]] — [[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]] 第 5 版の著者(person / reliability) - [[Andre Kleyner]] — [[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]] 第 5 版の共著者(person / reliability) - [[Wiley]] — John Wiley & Sons。[[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]] 第 5 版の出版元(organization / publisher) - [[Claus Pahl]] — [[Free University of Bozen-Bolzano]] コンピュータサイエンス学部准教授。クラウドコンテナ技術 SMS(IEEE TCC 2019)対応著者(person / cloud / containers) - [[Pooyan Jamshidi]] — [[Carnegie Mellon University]] ポスドク研究者(2017 時点)。高設定可能システム・機械学習・データ集約型計算(person / cloud / ML) - [[Free University of Bozen-Bolzano]] — イタリア・ボルツァーノ所在の大学。[[Claus Pahl]] 所属(organization / university) - [[University of Pisa]] — イタリア・ピサ所在の大学。[[Antonio Brogi]]・[[Jacopo Soldani]] 所属の SOCC 研究グループ(organization / university) - [[Docker]] — Linux LXC のメカニズム(namespace・cgroup)を利用したコンテナ事実上の標準ソリューション(product / container) - [[LXC]] — Linux Container プロジェクト(2007 年頃)。namespace・cgroup を提供するコンテナ研究の起点(product / container) - [[Satoru Kobayashi]] — [[University of Tokyo]] 大学院生(2018 年)。[[LogCausalAnalysis]] 主著者。PC + G-square によるネットワーク syslog 因果マイニング(TNSM 2018)(person / network / log-analysis) - [[Kazuki Otomo]] — [[University of Tokyo]] 大学院生(2018 年)。ネットワーク時系列知識抽出(person / network) - [[Kensuke Fukuda]] — [[National Institute of Informatics]] / SOKENDAI 准教授(2018 年)。インターネットトラフィック解析・異常検知(person / network / anomaly-detection) - [[Hiroshi Esaki]] — [[University of Tokyo]] 教授。JPNIC 副会長・WIDE Project 理事(person / network) - [[University of Tokyo]] — 日本の国立総合大学(東京)(organization / university) - [[National Institute of Informatics]] — 日本の情報学国立研究機関(NII)(organization / research-institute) - [[SINET4]] — 日本全国研究教育ネットワーク。TNSM 2018 の評価データセット(456 日・35M 件 syslog)(dataset / network) - [[LogCausalAnalysis]] — PC + G-square によるネットワーク syslog 因果マイニング OSS(repository / log-analysis) - [[Xiang Rao]] — [[National University of Defense Technology]] 所属。ノイズログフィルタリング手法 SBF の筆頭提案者(person / log-analysis / distributed) - [[Huaimin Wang]] — [[National University of Defense Technology]] 上席研究者。分散システムの信頼性・障害診断分野(person / distributed) - [[National University of Defense Technology]] — 中国・長沙所在の国防省立大学(NUDT / 国防科技大学)。国家平行分散処理重点実験室を擁する(organization / university) - [[Francisco Neves]] — [[HASLab]]-INESC TEC / [[University of Minho]] 研究者。eBPF ブラックボックストラフィック監視・コンテナ配置最適化(SAC 2020)の筆頭著者(person / distributed) - [[Ricardo Vilaça]] — [[University of Minho]] 研究者。SAC 2020 コンテナ配置最適化論文の共著者(person / distributed) - [[José Pereira]] — [[University of Minho]] 研究者。SAC 2020 コンテナ配置最適化論文の共著者(person / distributed) - [[HASLab]] — ポルトガル INESC TEC 傘下・[[University of Minho]] 附属の分散システム研究ラボ(organization) - [[University of Minho]] — ポルトガル Braga 所在の大学。[[Francisco Neves]] らが所属(organization) - [[Marcus Müller]] — [[TU Munich]] 所属。B-Trees Are Back の筆頭著者(person / database) - [[Lawrence Benson]] — [[TU Munich]] 所属。B-Trees Are Back の共著者(person / database) - [[Viktor Leis]] — [[TU Munich]] 所属。B-Trees Are Back の共著者で、[[vmcache]] など DBMS 内部構造研究に関与(person / database) - [[btree-cpp]] — B-Trees Are Back の unsynchronized B-Tree 実装(repository / database) - [[btree24]] — B-Trees Are Back の [[vmcache]] 統合版 B-Tree 実装(repository / database) - [[vmcache]] — Virtual-Memory Assisted Buffer Management に基づく storage engine / buffer management 基盤(product / database) - [[Hengrui Wang]] — [[EcoTune]] 論文の第一著者([[Tsinghua University]]) - [[Jiansheng Qiu]] — [[EcoTune]] 論文の共著者([[Tsinghua University]]) - [[Fangzhou Yuan]] — [[EcoTune]] 論文の共著者([[Tsinghua University]]) - [[Huanchen Zhang]] — [[EcoTune]] 論文の責任著者([[Tsinghua University]]、[[Shanghai Qi Zhi Institute]] 兼務) - [[EcoTune]] — LSM ツリーの平均クエリスループットを最適化する動的計画法ベースのコンパクション方針(product / database) - [[RocksDB]] — LSM ツリーベースのキーバリューストア。[[EcoTune]] の評価実装対象(product / database) - [[Shanghai Qi Zhi Institute]] — [[EcoTune]] 論文で [[Huanchen Zhang]] の兼務所属として記載される研究機関(organization) - [[Dan Hendrycks]] — [[Center for AI Safety]] 創設者・エグゼクティブディレクター。MMLU 設計者・HLE 上級著者(person) - [[Long Phan]] — [[Center for AI Safety]] 所属研究者。HLE 共同第一著者(person) - [[Center for AI Safety]] — AI 安全性研究非営利機関。[[Dan Hendrycks]] が創設。HLE ベンチマーク共同開発(organization) - [[Scale AI]] — AI データラベリング・評価プラットフォーム企業。HLE 論文の主要所属機関(organization) - [[Liz Fong-Jones]] — [[Honeycomb.io|Honeycomb]] Principal Developer Advocate。オブザーバビリティ・SRE コミュニティの著名人。CNCF TAG Observability Whitepaper(2023)の主要貢献者(person) - [[CNCF]] — Cloud Native Computing Foundation。Linux Foundation 傘下の非営利組織。Kubernetes・Prometheus・[[OpenTelemetry]] など主要クラウドネイティブ OSS をホスト(organization) - [[TAG Observability]] — CNCF の Technical Advisory Group for Observability。[[オブザーバビリティ]]ホワイトペーパー(v1.0、2023)策定組織(organization) - [[Tom Henighan]] — [[OpenAI]] 所属の研究者。スケーリング則多モダリティ拡張論文(arXiv:2010.14701)の均等貢献筆頭著者。画像・動画実験を担当(person) - [[Jason Wei]] — [[Google Brain]] / Google Research 所属の研究者。[[Chain-of-Thought Prompting]] の筆頭著者(person) - [[Denny Zhou]] — [[Google Brain]] 所属の研究者。[[Chain-of-Thought Prompting]] の共著者(person) - [[Lablup Inc]] — [[Backend.AI]] と [[Sokovan]] を開発する AI インフラ企業。504 GPU 本番訓練クラスタ運用分析を報告(organization) - [[Backend.AI]] — [[Lablup Inc]] の AI/ML ワークロード管理プラットフォーム。セッション単位の訓練ライフサイクルと自動リトライを提供(product) - [[Sokovan]] — [[Backend.AI]] の GPU 中心スケジューリング層。NUMA-aware 配置と 60 ノード訓練のギャングスケジューリングを担う(product) - [[Daemyung Kang]] — [[Lablup Inc]] の 504 GPU 本番訓練クラスタ運用分析論文の筆頭著者(person) - [[Azure Storage]] — [[Microsoft]] Azure のクラウドストレージサービス。計算とストレージを分離し、sU-RDMA/sK-RDMA によるフロントエンド/バックエンド通信を導入(product) - [[RDMA Estats]] — [[Azure Storage]] の RDMA 展開で用いられたホスト側診断テレメトリ。RDMA 操作レイテンシをホスト/NIC/ネットワークに分解(product) - [[Wei Bai]] — [[Microsoft]] 所属。[[Azure Storage]] のリージョン内 RDMA 展開経験論文の筆頭著者(person) - [[Aurora Limitless Database]] — [[Amazon Web Services]] の分散 OLTP データベースシステム。Amazon Aurora PostgreSQL をルータ/シャード構成へ拡張し、PostgreSQL 互換性と強い整合性を維持した水平スケーリングを狙う(product) - [[Dmitry Arkhangelskiy]] — [[Amazon Web Services]] 所属。[[Aurora Limitless Database]] 論文の筆頭著者(person) - [[Jacopo Soldani]] — [[University of Pisa]] 所属。マイクロサービス異常検知・RCA 統合サーベイ(ACM CSUR 2021)の筆頭著者(person) - [[Antonio Brogi]] — [[University of Pisa]] 所属。マイクロサービス異常検知・RCA 統合サーベイ(ACM CSUR 2021)の共著者(person) - [[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] — [[Jacopo Soldani]]・[[Antonio Brogi]]([[University of Pisa]])による ACM CSUR 2021 サーベイ。異常検知 25 手法・RCA 26 手法を 2 軸分類(データ源 × 手法)し、PC アルゴリズム + ランダムウォークの古典的 RCA パイプラインを体系化。説明可能性・対策推奨・継続的変化への対応を未解決課題として提示する(source / paper) - [[Luís M. Barata]] — [[Cluster Computing]] 2026 のマイクロサービス異常検知・根本原因特定サーベイの筆頭著者(person) - [[Sérgio Sequeira]] — [[Universidade da Beira Interior]] 所属。マイクロサービス異常検知・根本原因特定サーベイの共著者(person) - [[Eurico Lopes]] — [[Instituto Politécnico de Castelo Branco]] 所属。マイクロサービス異常検知・根本原因特定サーベイの共著者(person) - [[Pedro R. M. Inácio]] — [[Instituto de Telecomunicações]] / [[Universidade da Beira Interior]] 所属。マイクロサービス異常検知・根本原因特定サーベイの共著者(person) - [[Mário M. Freire]] — [[Instituto de Telecomunicações]] / [[Universidade da Beira Interior]] / [[NOVA LINCS]] 所属。マイクロサービス異常検知・根本原因特定サーベイの共著者(person) - [[Instituto de Telecomunicações]] — マイクロサービス異常検知・根本原因特定サーベイの著者所属(organization) - [[Universidade da Beira Interior]] — マイクロサービス異常検知・根本原因特定サーベイの著者所属(organization) - [[Instituto Politécnico de Castelo Branco]] — マイクロサービス異常検知・根本原因特定サーベイの著者所属(organization) - [[NOVA LINCS]] — マイクロサービス異常検知・根本原因特定サーベイの著者所属(organization) - [[Cluster Computing]] — Springer Nature 系の論文誌(organization) - [[Luan Pham]] — [[RMIT University]] 所属。[[@2024__FSE__BARO - Robust Root Cause Analysis for Microservices via Multivariate Bayesian Online Change Point Detection|BARO]] と [[RCAEval]] の開発者。マイクロサービス RCA の因果推論ベース手法を包括評価した ASE 2024 論文の筆頭著者(person) - [[Huong Ha]] — [[RMIT University]] 所属。[[Luan Pham]] と共にマイクロサービス RCA 評価研究に従事した共著者(person) - [[Hongyu Zhang]] — [[Chongqing University]] 所属。ソフトウェア工学・AIOps 研究者。マイクロサービス因果推論 RCA 評価論文(ASE 2024)の責任著者(person) - [[RMIT University]] — オーストラリア・メルボルンの大学。[[Luan Pham]]・[[Huong Ha]] の所属機関(organization) - [[Chongqing University]] — 中国・重慶の大学。[[Hongyu Zhang]] の所属機関(organization) - [[RCAEval]] — マイクロサービス RCA のオープンソース評価フレームワーク。[[Luan Pham]] が開発。21 種以上の因果推論ベース RCA 手法と合成・実システムデータセットを収録。GitHub: phamquiluan/RCAEval(repository) - [[RCAgent]] — クラウド RCA 向けツール拡張 LLM 自律エージェントフレームワーク。社内配置 LLM、意味的に最小なツール、OBSK、専門エージェント、TSC を組み合わせる(product) - [[Zefan Wang]] — [[Tsinghua University]] 所属。[[RCAgent]] 論文の第一著者(person) - [[Zichuan Liu]] — [[Nanjing University]] 所属。[[RCAgent]] 論文の共同第一著者(person) - [[Yingying Zhang]] — [[Alibaba Group]] 所属。[[RCAgent]] 論文の責任著者(person) - [[Aoxiao Zhong]] — [[Harvard University]] 所属。[[RCAgent]] 論文の共著者(person) - [[Jihong Wang]] — [[Xi'an Jiaotong University]] 所属。[[RCAgent]] 論文の共同第一著者(person) - [[Fengbin Yin]] — [[Alibaba Group]] 所属。[[RCAgent]] 論文の共著者(person) - [[Lunting Fan]] — [[Alibaba Group]] 所属。[[RCAgent]] 論文の共著者(person) - [[Lingfei Wu]] — [[Anytime AI]] 所属。[[RCAgent]] 論文の共著者(person) - [[Qingsong Wen]] — [[Squirrel Ai Learning]] 所属。[[RCAgent]] 論文の責任著者(person) - [[Xi'an Jiaotong University]] — [[RCAgent]] 論文の著者所属(organization) - [[Anytime AI]] — [[RCAgent]] 論文の著者所属(organization) - [[Squirrel Ai Learning]] — [[RCAgent]] 論文の著者所属(organization) - [[Vaishali Vinay]] — [[Microsoft]] Security Research 所属。LLM アプリケーション失敗モードのシステムレベルタクソノミーを提示した IEEE CAI 2026 論文の著者(person) - [[VictoriaTraces]] — [[VictoriaMetrics]] が開発する分散トレーシングバックエンド。エージェント `vtagent` を持ち OTLP 対応。[[Retroactive Sampling]] を 2026 年下半期に統合予定(product) - [[Zhu Jiekun]] — [[VictoriaMetrics]] エンジニア。[[Retroactive Sampling]]プロトタイプの KubeCon EU 2026 発表者(person) - [[Glenn K. Lockwood]] — HPC・AI インフラエンジニア・ブロガー。元 Microsoft 大規模 AI 訓練クラスタ担当、現 [[VAST Data]] 所属。超大規模クラスタ論争に関する実務者視点の論考で知られる(person) - [[VAST Data]] — AI インフラ向けストレージ・データプラットフォーム企業。[[Glenn K. Lockwood]] の現所属組織(organization) - [[Microsoft Fairwater]] — Microsoft の超大規模 AI 訓練クラスタ。450 MW・数十万 GPU(product) - [[AWS Rainier]] — AWS の超大規模 AI 訓練クラスタ。Trainium2 チップ約 50 万枚搭載(product) - [[Pieter Hijma]] — [[Vrije Universiteit Amsterdam]] 准教授。GPU プログラミング最適化 CSUR 論文の筆頭著者。28 技術・4 テーマ分類体系を確立(person) - [[Stijn Heldens]] — [[Netherlands eScience Center]] 研究者。GPU 最適化 CSUR 論文共著者。litstudy ライブラリ開発者(person) - [[Ben van Werkhoven]] — [[Netherlands eScience Center]] 研究者。[[Kernel Tuner]] 開発者。GPU 最適化 CSUR 論文共著者(person) - [[Henri E. Bal]] — [[Vrije Universiteit Amsterdam]] 教授。GPU 最適化 CSUR 論文のシニア著者(person) - [[Alessio Sclocco]] — [[Netherlands eScience Center]] 研究者。GPU 最適化 CSUR 論文共著者(person) - [[Vrije Universiteit Amsterdam]] — オランダの公立研究大学(VU Amsterdam)。GPU 最適化 CSUR 論文の主要研究拠点(organization) - [[Netherlands eScience Center]] — オランダの eScience 研究機関(NLeSC)。[[Kernel Tuner]] 開発元(organization) - [[Anthropic]] — AI 安全性企業。Claude モデルファミリー(Haiku/Sonnet/Opus)の開発・運用元。2021 年設立。[[Dario Amodei]] CEO(organization) - [[赤穂昭太郎]] — [[産業技術総合研究所]] 人間情報インタラクション研究部門 上級主任研究員。[[統計的機械学習]]・[[ベイズ最適化]] の研究者(person) - [[産業技術総合研究所]] — 国立研究開発法人(AIST)。日本最大規模の公的研究機関の一つ(organization) - [[Ravi Sharma]] — AI スーパーコンピュータネットワーキングに関する LinkedIn Pulse 記事著者。[[MRC]]・[[SRv6]]・[[マルチプレーンClosトポロジ]] を解説(entity) - [[Kuaishou Technology]] — 中国短動画プラットフォーム企業。[[Bian Que]] エージェント型 O&M フレームワーク開発元 - [[Bian Que]] — [[Kuaishou Technology]] 開発のエージェント型 O&M フレームワーク。統一運用パラダイム・[[Flexible Skill Arrangement]]・統一自己進化メカニズムで構成 - [[Bochao Liu]] — [[Kuaishou Technology]] 所属。[[Bian Que]] の均等貢献第一著者 - [[Ben Chen]] — [[Kuaishou Technology]] 所属。[[Bian Que]] の責任著者 - [[Zexin Wang]] — CNIC CAS/UCAS の研究者。AgentOps サーベイ論文の第一著者 - [[David Lo]] — Singapore Management University 教授・IEEE Fellow。エージェントシステム運用サーベイ共著者 - [[Yintong Huo]] — Singapore Management University の研究者。AgentOps サーベイ共著者 - [[SRE NEXT]] — 日本最大規模の SRE 専門カンファレンス。2024 年は Platform Engineering と AI がトレンドの焦点。[[Yuuki Tsubouchi]] がベストスピーカー賞受賞 - [[JAXA]] — 宇宙航空研究開発機構。SRE NEXT 2024 で月着陸実証機 SLIM 運用への SRE 実践(帯域制限下での Grafana 監視)を発表 - [[Michael Stonebraker]] — Turing Award 受賞者。「One Size Fits All」(ICDE 2005)で専用 DB の必要性を主張、H-Store(VLDB 2007)で OLTP 82 倍を実証 - [[Ugur Cetintemel]] — Brown University 准教授。「One Size Fits All」(ICDE 2005)の共著者 - [[Jeffrey Dean]] — Google フェロー。Bigtable(OSDI 2006)筆頭著者、MapReduce・TensorFlow 共同設計者 - [[Sanjay Ghemawat]] — Google フェロー。Bigtable(OSDI 2006)共著者、GFS・MapReduce 共同設計者 - [[Werner Vogels]] — Amazon CTO。Dynamo(SOSP 2007)の最終著者 - [[Giuseppe DeCandia]] — Amazon。Dynamo(SOSP 2007)筆頭著者 - [[Avinash Lakshman]] — Dynamo 共著者(Amazon) → Cassandra 筆頭著者(Facebook) - [[Prashant Malik]] — Facebook。Cassandra(SIGOPS OSR 2010)共著者 - [[Samuel Madden]] — MIT 教授。H-Store(VLDB 2007)共著者 - [[Daniel J. Abadi]] — H-Store(VLDB 2007)共著者。C-Store 共同設計者 - [[Stavros Harizopoulos]] — H-Store(VLDB 2007)共著者 - [[Pat Helland]] — H-Store(VLDB 2007)共著者。分散トランザクションの著名研究者 - [[Amazon]] — 高可用 KV ストア Dynamo(SOSP 2007)の開発元 - [[Facebook]] — Apache Cassandra の開発元(現 Meta) - [[MIT]] — H-Store プロジェクトの拠点 - [[Brown University]] — Michael Stonebraker 所属。H-Store 共同研究拠点 - [[Dynamo]] — Amazon の内部 KV ストア。結果整合性・一貫性ハッシュ法・ベクタークロック(SOSP 2007) - [[Bigtable]] — Google の分散ストレージ/非リレーショナルデータベース。OSDI 2006 の多次元疎マップ設計から、SIGMOD Companion 2026 時点で 10 EB・ピーク 70 億 QPS 規模へ成長 - [[@2026__SIGMOD Companion__Twenty Years of Bigtable]] — Bigtable の 20 年運用経験論文。10 EB・ピーク 70 億 QPS、レプリケーション、SQL、CDC、CRDT、マテリアライズドビュー、サービス運用化を整理 - [[Fabio Baltieri]] — Google 所属。Twenty Years of Bigtable の筆頭著者 - [[Google File System]] — Google の分散ファイルシステム。Bigtable の永続化層 - [[Chubby]] — Google の分散ロックサービス。Bigtable のタブレット管理 - [[Apache Cassandra]] — Dynamo + Bigtable のハイブリッド分散ストレージ(Facebook 発) - [[H-Store]] — メインメモリ OLTP プロトタイプ。商用 RDBMS 比 82 倍(VLDB 2007) - [[Gorilla]] — Facebook のインメモリ TSDB。デルタ・オブ・デルタ + XOR 圧縮で 12 倍圧縮、HBase 比クエリレイテンシ 73 倍削減(VLDB 2015) - [[Tuomas Pelkonen]] — Facebook エンジニア。Gorilla インメモリ TSDB(VLDB 2015)の筆頭著者 - [[@2015__VLDB__Gorilla - A Fast, Scalable, In-Memory Time Series Database]] — Pelkonen ほか(Facebook)、VLDB 2015。インメモリ TSDB Gorilla の設計・圧縮・耐障害性・本番実績を詳述 - [[ByteSeries]] — ByteDance/HUST の本番監視向けインメモリ TSDB。Compressed Inverted Index(trie + p4nzenc64)+ 3 段メモリ構造で tsdc 比メタデータ −60%・多次元クエリ 1.8〜10.7 倍(SoCC 2020) - [[tsdc]] — ByteDance の元本番インメモリ TSDB。メタデータがメモリ 80% 超を占め ByteSeries に置き換えられた - [[Xuanhua Shi]] — HUST 教授。ByteSeries(SoCC 2020)の筆頭著者 - [[Yongluan Zhou]] — University of Copenhagen 所属。ByteSeries(SoCC 2020)の共著者 - [[University of Copenhagen]] — デンマーク・コペンハーゲンの総合研究大学。Yongluan Zhou の所属機関 - [[@2020__SoCC__ByteSeries - An In-Memory Time Series Database for Large-Scale Monitoring Systems]] — Xuanhua Shi ほか(HUST / ByteDance / NUS / Univ. of Copenhagen)、SoCC 2020。100 億次元超監視向けインメモリ TSDB ByteSeries の設計・Compressed Inverted Index・評価を詳述 - [[Lindorm TSDB]] — [[Alibaba Group]] の大規模監視向けクラウドネイティブ分散 TSDB。共有なし + 共有ストレージ・TSM・Seriescache・前処理ダウンサンプリング・Lindorm ML(product / time-series) - [[Feifei Li]] — [[Alibaba Group]] データベース部門。[[Lindorm TSDB]] 主要設計者(PVLDB 2023)(person) - [[Zhejiang University]] — 中国・杭州市の重点大学(985 工程)。[[Lindorm TSDB]] 論文参加機関(organization) - [[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]] — Shen・[[Dan Pei]]・[[Feifei Li]] ほか([[Alibaba Group]]/[[Zhejiang University]]/[[Tsinghua University]])、PVLDB 2023。大規模監視向け分散 TSDB の設計・実装・評価。書き込み 10× / クエリ最大 16× 高速化・インデータベース ML 2× 短縮を実証(source / paper / time-series) - [[Apostolos Kokolis]] — Meta の ML 研究クラスタ信頼性論文(HPCA 2025)の共同筆頭著者 - [[Michael Kuchnik]] — Meta の ML 研究クラスタ信頼性論文(HPCA 2025)の共同筆頭著者 - [[Carole-Jean Wu]] — Meta の ML システム研究者。Revisiting Reliability 論文のシニア著者 - [[Meta AI Research SuperCluster]] — Meta の A100 世代 ML 研究クラスタ群。RSC-1 は 16k GPU、RSC-2 は 8k GPU - [[Myeongjae Jeon]] — Philly トレース論文(USENIX ATC 2019)の筆頭著者 - [[Philly]] — Microsoft の DNN 訓練向けマルチテナント GPU クラスタ管理サービス - [[philly-traces]] — Philly 論文が公開した DNN 訓練クラスタのスケジューラトレース - [[Adrián Pérez Diéguez]] — Qualcomm Technologies 所属。LLM 事前学習性能チューニング論文(PMBS25)の筆頭著者 - [[Qualcomm]] — LLM 事前学習性能チューニング論文(PMBS25)の著者所属組織 - [[Mi Zhang]] — Ohio State University 准教授、AIoT-MLSys Lab 主宰。Efficient LLMs サーベイ(TMLR 2024)の責任著者 - [[Mosharaf Chowdhury]] — University of Michigan 准教授。ML システム・ネットワーク研究(Gavel/Tiresias/Perseus) - [[The Ohio State University]] — 米国オハイオ州コロンバスの研究大学。AIoT-MLSys Lab が Efficient LLMs サーベイを主導 - [[Xupeng Miao]] — LLM サービングサーベイ筆頭著者(Purdue University、ACM Computing Surveys 2025) - [[Zhihao Jia]] — CMU 助教授。FlexFlow・SpecInfer の創始者、LLM サービングサーベイ責任著者 - [[Tianqi Chen]] — CMU 教授。TVM・XGBoost・MLC-LLM の創始者、MLSys 分野の著名研究者 - [[Purdue University]] — 米国インディアナ州の研究大学。LLM サービングサーベイ筆頭著者 Xupeng Miao の所属 - [[道下幹也]] — さくらインターネット クラウド事業本部エンジニア。「高火力 PHY で作る分散推論基盤」連載著者(LINE Yahoo で 6 年間 IaaS・GPU 業務) - [[高火力 PHY]] — さくらインターネットの GPU ベアメタルサーバーサービス(HGX H100 × 8、NVLink、400Gbps NIC × 8) - [[vLLM]] — LLM 推論フレームワーク。ページドアテンションによる KV キャッシュ効率化でスループット特化、OpenAI API 互換 - [[NIXL]] — NVIDIA Inference Xfer Library。LLM 推論向け KV Cache 転送ライブラリ(NB API/SB API 2 層、UCX/GDS/OBJ/MoonCake/3FS の 5 バックエンド) - [[UCX]] — Unified Communication X。高帯域・低レイテンシネットワーク向けオープンソース通信フレームワーク(UCT/UCP 構成) - [[LMCache]] — KV キャッシュ管理・転送ソフトウェア。NIXL 経由で Prefill-Decode Disaggregation を実現 - [[Kazuki Fujii]] — 東京科学大学博士課程。LLM 推論ベンチマーク測定の基礎知識を Zenn で体系的に解説 - [[GenAI-Perf]] — NVIDIA 製オープンソース LLM 推論ベンチマークツール。TTFT・ITL・TPS・RPS を計測。ITL 算出に TTFT を含まない(LLMPerf とは異なる定義) - [[TensorRT-LLM]] — NVIDIA の LLM 推論最適化ライブラリ。量子化・テンソル並列・Flash Attention を統合し NVIDIA GPU 上の推論を高速化 - [[NVIDIA NIM]] — NVIDIA Inference Microservices。最適化済み推論ランタイムを内包したコンテナ化 LLM エンドポイント(OpenAI API 互換) - [[東京科学大学]] — 2024 年に東京工業大学と東京医科歯科大学が統合して設立された日本の研究大学 - [[Max Planck Institute for Informatics]] — ドイツ・ザールブリュッケンの Max-Planck 傘下の情報科学研究所。Matryoshka の共同研究機関(Yiting Xia) - [[Yu Luo]] — OpsAgent 筆頭著者(南開大学)。training-free データプロセッサ+クロスレビュー+デュアル自己進化の IM 向け MAS を設計 - [[Lenovo]] — OpsAgent の本番展開先(天津)。53 日・10,492 件で 84.09% 精度・解決時間 2.5 時間→126 秒 - [[FLASH]] — 反復インシデント診断を自動化する Microsoft の LLM ワークフローエージェント(status supervision + hindsight、本番 +13.2%) - [[StepFly]] — TSG 自動化のエンドツーエンドエージェント型フレームワーク(Microsoft/Tsinghua、DAG+QPP+並列、GPT-4.1 約 94%) - [[TSG Mentor]] — StepFly 第 1 段の TSG 品質改善ツール(品質問題検知 F1 0.81) - [[LLexus]] — TSG を計画前置でコンパイルし決定論的に実行する Microsoft のインシデント管理エージェント - [[TaskWeaver]] — Microsoft のコードファースト LLM エージェントフレームワーク(FLASH の主要ベースライン) - [[Semantic Kernel]] — Microsoft の LLM オーケストレーション OSS(LLexus の計画生成) - [[Azure Durable Functions]] — Microsoft Azure のステートフルなサーバレス実行基盤(LLexus エグゼキュータ) - [[Saravan Rajmohan]] — FLASH・StepFly 双方の共著者(Microsoft Redmond)。TSG 自動化 2 本の結節点 - [[Xuchao Zhang]] — FLASH 筆頭著者(Microsoft Redmond) - [[Tanish Mittal]] — FLASH 共著者(Microsoft Bengaluru) - [[Chetan Bansal]] — FLASH 共著者(Microsoft Redmond、クラウドインシデント RCA 研究) - [[Rujia Wang]] — FLASH 共著者(Microsoft Redmond) - [[Zhixin Ren]] — FLASH 共著者(Microsoft Redmond) - [[Hao Huang]] — FLASH 共著者(Microsoft Redmond) - [[Jiayi Mao]] — StepFly 筆頭著者(Tsinghua University) - [[Liqun Li]] — StepFly 共著者(Microsoft) - [[Yanjie Gao]] — StepFly 共著者(Microsoft Research / Renmin University of China) - [[Zegang Peng]] — StepFly 共著者(Tsinghua University) - [[Si Qin]] — StepFly 共著者(Microsoft) - [[Samia Khalid]] — StepFly 共著者(Microsoft USA) - [[Sitaram Lanka]] — StepFly 共著者(Microsoft USA) - [[Dongmei Zhang]] — StepFly 共著者(Microsoft) - [[Pedro Las-Casas]] — LLexus 筆頭著者(Microsoft) - [[Alok Kumbhare]] — LLexus 共著者(Microsoft) - [[Rodrigo Fonseca]] — LLexus 共著者(Microsoft) - [[Sharad Agarwal]] — LLexus 共著者(Microsoft) - [[Muhammad Bilal]] — NetOps/AIOps サーベイの責任著者(Lancaster University) - [[Jon Crowcroft]] — NetOps/AIOps サーベイ共著者(University of Cambridge、ネットワーキングの著名研究者) - [[Ruizhi Wang]] — NetOps/AIOps サーベイ共著者(Nanjing University of Information Science and Technology) - [[Xiaolong Xu]] — NetOps/AIOps サーベイ共著者(Nanjing University of Information Science and Technology) - [[Schahram Dustdar]] — NetOps/AIOps サーベイ共著者(TU Wien + ICREA Barcelona) - [[Renmin University of China]] — 中国・北京の研究大学(中国人民大学)。StepFly 共著者 Yanjie Gao の所属(Microsoft Research 兼任) - [[Zeyang Ma]] — LLM4Log サーベイ筆頭著者(Concordia University SPEAR lab) - [[Jinqiu Yang]] — LLM4Log サーベイ共著者(Concordia University) - [[Tse-Hsun Chen]] — LLM4Log サーベイ senior 著者・SPEAR lab 主宰(Concordia University) - [[Concordia University]] — カナダ・モントリオールの大学。SPEAR lab を擁しログ解析の主要研究拠点の 1 つ - [[LLM4Log (repository)]] — LLM4Log サーベイのコンパニオンリポジトリ(145 論文を 7 タスク分類) - [[NSync]] — IaC reconciliation のための初の自動エージェントシステム(UMich+AWS) - [[Lilac]] — IaC lifting のニューロシンボリックなルール抽出パイプライン(UMich+UCSD) - [[AWS CloudTrail]] — AWS の API 監査ログサービス。NSync の drift 検知の観測点 - [[aztfexport]] — Azure 特化の IaC lifting ツール。Lilac の主要比較対象 - [[Amazon Web Services]] — クラウドプロバイダ(AWS)。NSync 共同研究機関 - [[UC San Diego]] — Lilac 共同研究機関(UCSD) - [[Zhenning Yang]] — NSync 第一著者(UMich) - [[Jingjia Peng]] — Lilac 第一著者(UMich) - [[Mingyue Cheng]] — USTC の研究者。ATSF ポジションペーパー第 1 著者、公式コード atsf を管理。時系列×エージェントの研究グループ中心 - [[Xiaoyu Tao]] — USTC の研究者。ATSF 第 2 著者で AgenticRL 実装 Cast-R1・MemCast・TokenCast の筆頭著者 - [[Qi Liu]] — USTC の責任著者(時系列×エージェント。本 wiki の別人 Xin Liu とは別人) - [[Enhong Chen]] — USTC のシニア研究者。同グループの時系列・エージェント研究に一貫して参加 - [[University of Science and Technology of China]] — 中国・合肥の大学(USTC)。State Key Laboratory of Cognitive Intelligence。ATSF 著者全員の所属 - [[Cast-R1]] — エージェント型時系列予測の RL 実装(ATSF の AgenticRL パラダイム代表、Tao+ 2026b・arXiv:2602.13802、source 化済み・10 データセットで最低 MSE) - [[TimeCopilot]] — ワークフローベースのエージェント型予測システム(ATSF の Workflow パラダイム代表、arXiv:2509.00616) - [[SREGym]] — AI SRE エージェント向けの高忠実度ライブベンチマーク兼フレームワーク - [[Stratus]] — マルチエージェントの SRE エージェント(4 エージェント + 状態機械、TNR で安全な巻き戻しと再試行) - [[CrewAI]] — STRATUS の実装基盤 LLM マルチエージェントフレームワーク - [[IBM Research]] — ITBench/STRATUS の IBM 側拠点 - [[AIOpsLab]] — AIOps エージェント評価フレームワーク(AgentOps を提唱) - [[ITBench]] — SRE/CISO/FinOps 横断の IT 自動化ベンチマーク(IBM/UIUC、ICML'25。一次論文取り込み済み) - [[Rohan Arora]] — ITBench の同等貢献リード・STRATUS 共著者(IBM Research) - [[ChaosMesh]] — カオスエンジニアリング / 障害注入ツール - [[DeathStarBench]] — マイクロサービスベンチマークスイート(AIOpsLab・SREGym 共通テストベッド) - [[Tianyin Xu]] — SREGym 最終著者(UIUC) - [[Yinfang Chen]] — AIOpsLab・SREGym・STRATUS 第一/共著者(UIUC) - [[Saurabh Jha]] — ITBench 主導著者・STRATUS 共著者(IBM Research) - [[Minghua Ma]] — AIOpsLab の責任著者(Microsoft) - [[University of Illinois Urbana-Champaign]] — 主要研究機関 - [[Microsoft]] — AIOpsLab 主要所属 - [[PAGER]] — 先回り型の障害予測・説明・対話支援エージェント(Adobe) - [[Adobe Experience Platform]] — Adobe の大規模カスタマーデータプラットフォーム(PAGER の対象) - [[Adobe]] — AEP・PAGER を擁する企業 - [[Yunyao Li]] — PAGER のシニア著者(Adobe) - [[MicroRemed]] — エンドツーエンドのマイクロサービス修復を評価する初のライブベンチマーク(PKU/Alibaba) - [[ThinkRemed]] — マイクロサービス修復のマルチエージェントフレームワーク(Coordinator/Probe/Execution/Verification) - [[Ansible]] — 宣言的・エージェントレスな IT 自動化フレームワーク(MicroRemed の緩和出力形式) - [[Train-Ticket]] — 鉄道予約題材のマイクロサービスベンチマーク(MicroRemed 最難環境) - [[Online-Boutique]] — Google のマイクロサービスデモ(= microservices-demo) - [[Lingzhe Zhang]] — MicroRemed・LLM4AIOps サーベイ第一著者(PKU、AIOps/SRE 向け LLM を多作) - [[Tong Jia]] — MicroRemed・LLM4AIOps サーベイの責任著者(PKU) - [[Ying Li]] — LLM4AIOps サーベイの責任著者(PKU、AIOps クラスタ) - [[Philip S. Yu]] — LLM4AIOps サーベイ共著者(UIC、データマイニングの著名研究者) - [[Peking University]] — MicroRemed 主所属 - [[Alibaba Group]] — MicroRemed 共同所属、Qwen3 開発元 - [[Google]] — SRE 発祥企業。Bigtable・GFS・Chubby 等の分散基盤と、AI-Ops を本番(Cloud/Ads/YouTube/Search)で展開 - [[AI Operator]] — Google の自律的な一次対応エージェント(L2/L3 稼働) - [[Actus]] — Google のアクチュエーション安全ゲートウェイ(dry-run・Red Button) - [[Detectr]] — Google の Gemini 駆動の障害検知(ユーザーフィードバックベース) - [[AI Insights]] — Google SRE の過去インシデント連続レビュー・知見抽出・risk category 注釈システム(Gemini embedding + vector DB) - [[Agent Development Kit]] — Google のエージェント開発プラットフォーム(ADK)。Google SRE AI の構築基盤 - [[Gemini Enterprise Agent Platform]] — Google のフルスタック AI 基盤。**旧 Vertex AI のリブランド**(2026-05-29 一次確認) - [[Model Context Protocol]] — AI エージェントとツール接続を標準化するオープン仕様(MCP) - [[Datadog]] — オブザーバビリティ SaaS ベンダ。自律 SRE エージェント Bits AI SRE・時系列基盤モデル Toto・本番接地型コード最適化 DODO を開発(産業界 2 例目) - [[DODO]] — Datadog Observability-Driven Optimizer。CPU プロファイル+Live Debugger 実呼び出しで本番接地型ベンチマークを生成し LLM エージェントが Go コードを最適化 - [[Junaid Ahmed]] — Datadog AI Research エンジニア。[[DODO]] 共同開発者 - [[Piotr Bejda]] — Datadog AI Research エンジニア。[[DODO]] 共同開発者 - [[Bits AI SRE]] — Datadog の自律インシデント調査・RCA エージェント(仮説駆動、TTR 最大 95% 減を主張) - [[Toto]] — Datadog の観測データ特化のゼロショット時系列予測基盤モデル。v1.0(151M)→ v2.0(4M〜2.5B 5 サイズ、CPM・u-μP 採用) - [[BOOM]] — 実運用テレメトリのみで構成した観測時系列予測ベンチマーク(2,807系列・約3.5億点、Datadog) - [[Ameet Talwalkar]] — Toto 論文のシニア著者(CMU 兼 Datadog) - [[Emaad Khwaja]] — Toto 2.0 の著者(Datadog AI Research) - [[Gerald Woo]] — Toto 2.0 の著者(Datadog AI Research) - [[Chris Lettieri]] — Toto 2.0 の著者(Datadog AI Research) - [[David Asker]] — Toto 2.0 の著者(Datadog AI Research) - [[Carnegie Mellon University]] — Toto 論文に Datadog AI Research と共同参加した大学 - [[Falcon-X]] — Ant International の異種多変量向け encoder-only 時系列基盤モデル(591M、潜在プロトタイプルーティング) - [[Ant International]] — Falcon-X を開発した企業組織(連絡先 @ant-intl.com) - [[Chronos-2]] — グループアテンションで多変量・インコンテキスト学習を可能にした TSFM(Falcon-X の主要比較対象) - [[GIFT-Eval]] — 汎用時系列予測ベンチマーク(15 univariate + 8 multivariate、7 ドメイン、144K 系列) - [[fev-bench]] — 現実的な時系列予測ベンチマーク(100 タスク、観測系 BOOMLET を含む) - [[MetricSifter]] — 障害箇所特定の前処理の特徴量削減フレームワーク(変化点検知 + KDE、SAKURA Internet) - [[Meltria]] — マイクロサービスの障害データセット生成基盤(MetricSifter の実証データ作成) - [[Sock Shop]] — 靴下販売題材のマイクロサービスベンチマーク(MetricSifter の実証研究、7 マイクロサービス) - [[PyRCA]] — メトリクスベースの RCA ライブラリ(MetricSifter の合成データ生成器兼 FL ベースライン) - [[Yuuki Tsubouchi]] — MetricSifter 筆頭著者・博士論文著者・本 vault 所有者(SAKURA Internet、元 Hatena SRE) - [[Hirofumi Tsuruta]] — MetricSifter 第 2 著者(SAKURA Internet、機械学習)。Zenn ハンドル tsurubee で LLM・時系列記事を執筆 - [[Ryosuke Matsumoto]] — Transtracer / socket-based tracing 論文の共著者(博士論文 Chapter 3 の基) - [[Masahiro Furukawa]] — Hatena SRE。Tsubouchi+ JIP 2022(TCP/UDP ソケットベース依存性発見)の共著者 - [[SAKURA internet Inc]] — 日本のクラウド事業者。Research Center が MetricSifter を生んだ - [[HeteroTSDB]] — 異種 KVS を TTL ベースで階層化する TSDA(KairosDB 比 3.98 倍の取り込み、Mackerel に実投入) - [[go-conntracer-bpf]] — カーネル内フローバンドリングの eBPF ネットワークフロートレーサの Go ライブラリ - [[Knative]] — Google 主導のKubernetes ネイティブ FaaS 基盤 OSS。サーバーレスのビルディングブロックを提供(serverless / kubernetes) - [[OpenFaaS]] — Alex Ellis 主導の OSS FaaS フレームワーク。Kubernetes または containerd 上でイベント駆動 Function を実行(serverless / open-source) - [[eunomia-bpf]] — eBPF×AI を主題とする OSS コミュニティ(bpftime/GPTtrace/AgentSight/Kgent を開発) - [[Yusheng Zheng]] — eunomia-bpf の中心人物。eBPF×AI 総説の著者 - [[bpftime]] — ユーザ空間 eBPF ランタイム(eGPU で GPU へ eBPF をオフロード) - [[GPTtrace]] — 自然言語からカーネルトレース用 eBPF を LLM で生成(AI for eBPF) - [[AgentSight]] — eBPF でゼロ計装の LLM/AI エージェント可観測性(claude code 等を <3% オーバーヘッドで観測) - [[Kgent]] — 初の LLM 駆動 eBPF 合成ツール(Z3 記号検査 + テスト、約 80% 意味的正しさ、別名 KEN) - [[Mackerel]] — Hatena の SaaS サーバ監視サービス(HeteroTSDB の本番採用先) - [[Hatena]] — 監視 SaaS Mackerel を運営する日本企業(Yuuki Tsubouchi の元勤務先) - [[Kyoto University]] — Yuuki Tsubouchi に博士号を授与した大学(本博士論文の発行機関) - [[Shanghai AI Laboratory]] — LLM 訓練システムサーベイの主所属。InternLM/InternEvo を擁する中国の AI 研究機関 - [[Jiangfei Duan]] — LLM 訓練システムサーベイの筆頭著者(Shanghai AI Lab / CUHK) - [[Peng Sun]] — LLM 訓練システムサーベイの責任著者(Shanghai AI Lab)。Acme ワークロード特徴づけ記事の著者 - [[Qinghao Hu]] — LLM 開発ワークロード特徴づけ記事の著者。Acme 6 か月トレースを分析 - [[Tianwei Zhang]] — LLM 開発ワークロード特徴づけ記事の著者。Acme 6 か月トレースを分析 - [[Acme]] — Shanghai AI Laboratory の LLM 開発向け GPU データセンター。Seren/Kalos、計 4,704 A100 GPU - [[InternEvo]] — Shanghai AI Laboratory の LLM 事前学習フレームワーク。V2 が 123B LLM・2,048 GPU で V1 比約 16% 高速化 - [[MegaScale]] — ByteDance/PKU の 10,000 GPU 超 LLM 訓練本番システム(175B を 12,288 GPU・55.2% MFU) - [[Minder]] — ByteDance の大規模分散訓練向け自動 faulty machine detector(machine-level の類似度 + 連続性 + per-metric LSTM-VAE、precision 0.904) - [[Megatron-LM]] — NVIDIA の SOTA OSS LLM 訓練フレームワーク(MegaScale の基盤兼ベースライン) - [[ByteDance]] — 10,000 GPU 超 AI クラスタで LLM を訓練する企業(MegaScale・Minder 開発主体) - [[Pulse]] — Nanjing University の LLM 訓練のトラフィック中心監視システム(BlueField-3 上のマイクロ秒 RDMA 計測 → machine-level の箇所特定、非侵入的) - [[NCCL]] — NVIDIA の集団通信ライブラリ(LLM 分散訓練の標準 CCL、Pulse の hook 対象) - [[BlueField-3]] — NVIDIA のプログラマブル SmartNIC/DPU(Pulse NIC Agent のマイクロ秒 RDMA 計測プラットフォーム) - [[Aegis]] — Alibaba の AI 訓練クラウド向け障害診断(OP-level、Pulse の SOTA ベースライン) - [[Holmes]] — 超大規模 GPU クラスタの LLM 訓練の異常箇所特定(OP-level・ストラグラー特化、Pulse ベースライン) - [[GreyHound]] — hybrid-parallel 訓練の fail-slow 検出(非侵入的だが OP-level、Pulse ベースライン) - [[Nanjing University]] — Pulse の主所属(State Key Lab of Novel Software Technology、ネットワーク計測/RDMA) - [[Yibo Xiao]] — Pulse 論文の筆頭著者(Nanjing University) - [[Qingkai Meng]] — Pulse 論文の責任著者(Nanjing University) - [[Chen Tian]] — Pulse 論文のシニア著者(Nanjing University、μMon/Astral の計測系譜) - [[Ziheng Jiang]] — MegaScale 論文の筆頭著者(ByteDance) - [[Xin Jin]] — MegaScale 論文の責任著者(Peking University) - [[Xin Liu]] — MegaScale 論文の責任著者(ByteDance) - [[Yangtao Deng]] — Minder 論文の筆頭著者(Tsinghua University、ByteDance との共同研究) - [[Zhuo Jiang]] — Minder 論文の責任著者(ByteDance High-speed Network チーム) - [[Minlan Yu]] — Minder 論文の責任著者(Harvard University) - [[Tsinghua University]] — Minder 論文の筆頭著者らの所属大学(中国) - [[Harvard University]] — Minder 論文の責任著者 Minlan Yu の所属大学(米国) - [[University of Illinois Chicago]] — 米国シカゴの研究大学(UIC)。LLM4AIOps サーベイ共著者 Philip S. Yu の所属(既出 UIUC とは別) - [[Hong Kong University of Science and Technology, Guangzhou]] — 中国・広州の研究大学(HKUST-GZ)。LLM4AIOps サーベイ共著者 Xuming Hu の所属 - [[SAKURAONE]] — SAKURA Internet の 800 GPU オープン Ethernet AI–HPC クラスタ(SONiC+RoCEv2、TOP500 HPL 49 位) - [[SONiC]] — オープンソースのネットワーク OS(SAI で ASIC 抽象化、RoCEv2 のロスレス Ethernet を提供) - [[Fumikazu Konishi]] — SAKURAONE 論文の筆頭著者・責任著者(SAKURA Internet Research Center) - [[Haoran Yan]] — GenAI クラウドインシデント実証研究の第一著者(HUST、ICSE 2026) - [[Huazhong University of Science and Technology]] — 中国・武漢の研究大学(HUST) - [[MonitorAssistant]] — LLM ベースのエンドツーエンドの実用的異常検知システム(GPT-4 Turbo、Microsoft のクラウドサービスに投入) - [[Zhaoyang Yu]] — MonitorAssistant の第一著者(Tsinghua University & BNRist、異常検知・RCA) - [[Dan Pei]] — Tsinghua University & BNRist の教授。NetManAIOps グループを主宰し AIOps 研究を広く牽引 - [[TelecomTS]] — 5G 通信ネットワーク由来の大規模マルチモーダルオブザーバビリティデータセット(Yale University) - [[Yale University]] — TelecomTS の主所属 - [[Ali Maatouk]] — TelecomTS の corresponding author(Yale University) - [[Rex Ying]] — TelecomTS の senior author(Yale University) - [[Aoyang Fang]] — 障害伝播を意識した RCA ベンチマーク論文の第一著者(CUHK-Shenzhen) - [[Pinjia He]] — 障害伝播を意識した RCA ベンチマーク論文の corresponding author(CUHK-Shenzhen) - [[The Chinese University of Hong Kong, Shenzhen]] — 中国・深圳の研究大学(CUHK-Shenzhen)。障害伝播を意識した RCA ベンチマーク論文の主所属 - [[LogPilot]] — アラート定義(PromQL)の意図を解釈してログを絞り、log chain のクラスタリングで根本原因を診断する LLM ベースのアラート診断フレームワーク(CUHK×ByteDance、Volcano Engine 本番展開) - [[Volcano Engine]] — ByteDance のクラウドプラットフォーム。LogPilot の本番デプロイ先・データ出所、Doubao LLM 提供元 - [[Zhihan Jiang]] — LogPilot 筆頭著者(CUHK、Michael R. Lyu グループ。ログ解析・ログ parsing 専門) - [[Michael R. Lyu]] — CUHK 教授。ログ解析・AIOps の著名研究者で Drain・LILAC・COCA・LogPilot を主導(ログ解析の二大ハブの一方、他方は Dan Pei) - [[Tieying Zhang]] — LogPilot の corresponding author(ByteDance、Volcano Engine への本番展開を取りまとめ) - [[The Chinese University of Hong Kong]] — 香港の研究大学(CUHK)。Michael R. Lyu グループがログ解析・AIOps を牽引(CUHK-Shenzhen とは別大学) - [[Zodiac]] — クラウド IaC のセマンティックチェックを自動マイニング・デプロイ検証するツール(UMich×Microsoft、Azure/Terraform で 510 チェック発掘) - [[Terraform]] — HashiCorp の宣言的 IaC フレームワーク(市場最有力)。core compiler は cloud-agnostic で provider 固有チェックはプラグイン経由のみ - [[Microsoft Azure]] — Microsoft のパブリッククラウド。Zodiac のセマンティックチェック検証対象(52 リソース種別) - [[Ang Chen]] — クラウド IaC × LLM エージェント研究の指導著者(UMich)。Zodiac・Lilac・NSync を貫く connecting node - [[Yiming Qiu]] — Zodiac 筆頭著者・Lilac 共著者(UMich) - [[Patrick Tser Jern Kon]] — Zodiac・Lilac 共著者(UMich、preprint 配布ページ cs-pk.com を運営) - [[Ryan Beckett]] — Zodiac 共著者(Microsoft)。ネットワーク構成検証の著名研究者 - [[University of Michigan]] — Zodiac・NSync・Lilac・クラウド管理ビジョン論文の主所属(Ann Arbor)。Ang Chen グループの拠点 - [[Martin Casado]] — クラウド管理ビジョン論文の共著者(Andreessen Horowitz、GoEx 共著) - [[Archit Bhatnagar]] — クラウド管理ビジョン論文の共同筆頭著者(UMich) - [[Tongyuan Miao]] — クラウド管理ビジョン論文の共著者(UMich) - [[Yunming Xiao]] — クラウド管理ビジョン論文の共著者(UMich、Pulse の Yibo Xiao とは別人) - [[Yibo Huang]] — クラウド管理ビジョン論文の共著者・cloudless computing 共著(UMich) - [[University of California, Berkeley]] — クラウド管理ビジョン論文の共同所属(Yiming Qiu の第 2 所属) - [[Andreessen Horowitz]] — クラウド管理ビジョン論文の産業側共同所属(Martin Casado、a16z) - [[Azure Copilot]] — Azure 向けに調整された GPT-4 ベース LLM(ビジョン論文の SDK/CLI/IaC エージェントのモデル) - [[WorkArena]] — Web エージェントの knowledge work ベンチマーク/実装基盤(ビジョン論文の ClickOps エージェントの土台、GPT-4o) - [[ARFBench]] — ソフトウェアインシデント対応の時系列質問応答(TSQA)を測る初のベンチマーク(750 問・142 系列、Datadog 本番インシデント由来) - [[Toto-1.0-QA-Experimental]] — Toto を VLM(Qwen3-VL)と結合した ARFBench 用の時系列 QA モデル(精度 63.9% でフロンティアモデルに匹敵) - [[Qwen3-VL]] — Alibaba のビジョン言語モデル(Toto-1.0-QA-Experimental のバックボーン) - [[Stephan Xie]] — ARFBench 第一著者(CMU / Datadog) - [[Ben Cohen]] — ARFBench 共著者(Datadog AI Research) - [[Mononito Goswami]] — ARFBench 共著者(CMU / AWS) - [[Cisco]] — ネットワーク機器大手。Splunk を傘下に持ち観測特化 TSFM Cisco TSM を開発 - [[Splunk]] — 観測・セキュリティ SaaS ベンダ(Cisco 傘下)。Cisco TSM の観測データとコードを提供 - [[Splunk Observability Cloud]] — Splunk の観測プラットフォーム(Cisco TSM の観測時系列データの出所) - [[TimesFM]] — Google の decoder-only 時系列基盤モデル(Cisco TSM の継続事前学習のベース) - [[Liang Gou]] — Cisco Time Series Model の著者(Cisco / Splunk) - [[RFT-FaultBench]] — 強化ファインチューニングの初の細粒度障害ベンチマーク(5 families/16 types/779 runs、PKU) - [[RFT-FM]] — RFT の障害を検知→診断→修復する閉ループ障害管理フレームワーク(RFT Failure Management) - [[OpenRLHF]] — RLHF/RFT のオープンソース訓練フレームワーク(RFT-FaultBench の実行基盤) - [[Yunpeng Zhai]] — RFT-FM 論文の共著者(PKU/Alibaba/UIC グループ) - [[Liancheng Fang]] — RFT-FM 論文の共著者(UIC) - [[Kening Zheng]] — RFT-FM 論文の共著者(PKU) - [[Hongyi Liu]] — RFT-FM 論文の共著者(PKU/Alibaba/UIC グループ) - [[Xiaosong Huang]] — RFT-FM 論文の共著者(PKU) - [[Dell Technologies]] — TSFM サーベイの主執筆機関(Hopkinton, MA)。6 次元タクソノミーで TSFM フィールドを俯瞰 - [[Siva Rama Krishna Kottapalli]] — TSFM サーベイの筆頭著者(Dell Technologies) - [[OpenRCA]] — LLM の RCA 能力を測るベンチ/データセット(335 障害・68GB テレメトリ、最良 Claude 3.5 で 11.34%、ICLR 2025)(dataset) - [[Cloud-OpsBench]] — エージェント型 RCA の再現可能ベンチ(452 障害・40 種・K8s 全スタック、State Snapshot 決定論的デジタルツイン、過程評価 IAC/RAR/ZTDR)(dataset) - [[AlertGuardian]] — Tencent 本番のアラートライフサイクル管理フレームワーク(denoise→summary→rule refinement、MTTR 156→21 分・94.8% 削減)(product) - [[Kubernetes]] — Cloud-OpsBench が全スタックを対象とするコンテナオーケストレーション基盤(product) - [[Junjielong Xu]] — OpenRCA 筆頭著者(CUHK-Shenzhen) - [[Shilin He]] — OpenRCA 共著・corresponding author(Microsoft) - [[Qingwei Lin]] — OpenRCA 共著(Microsoft、AIOps 研究) - [[Chaoyun Zhang]] — OpenRCA 共著(Microsoft) - [[Guangba Yu]] — AlertGuardian 筆頭・Cloud-OpsBench 責任著者(SYSU→CUHK、AIOps/RCA、Nezha/MicroRank) - [[Pengfei Chen]] — AlertGuardian/Cloud-OpsBench 共著(SYSU、マイクロサービス RCA を牽引) - [[Sun Yat-sen University]] — 広州の研究大学(SYSU)。Pengfei Chen グループが AIOps・マイクロサービス信頼性を牽引(organization) - [[Tencent]] — AlertGuardian の本番投入先(論文では Company-X)・共著(organization) - [[TimeSeriesScientist]] — 単変量時系列予測の全工程を 4 エージェントで自動化する初の LLM 駆動エージェント型フレームワーク(TSci、Workflow パラダイム代表、基盤モデル不使用)(repository) - [[Haokun Zhao]] — TimeSeriesScientist 論文の筆頭著者(Stony Brook University/UC San Diego)(person) - [[Chenyu You]] — TimeSeriesScientist 論文の corresponding author(Stony Brook University、Y-Research-SBU)(person) - [[Stony Brook University]] — 米国の研究大学。Haokun Zhao・Chenyu You の所属、Y-Research-SBU の拠点(organization) - [[TiRex]] — NXAI の zero-shot 時系列基盤モデル(enhanced in-context learning、TimeCopilot の MedianEnsemble 構成要素)(product) - [[Azul Garza]] — TimeCopilot 筆頭著者。TimeGPT-1・Nixtla OSS 予測ツール群の著者(person) - [[Renée Rosillo]] — TimeCopilot 共著者(person) - [[R-Pingmesh]] — BUPT/Douyin Vision の能動プロービング型サービス認識 RoCE 監視・診断システム(SIGCOMM 24) - [[ByteRobust]] — ByteDance の LLM 訓練特化 GPU インフラ管理・障害許容システム(ETTR 最大 97%、迅速な隔離、SOSP 25) - [[SMon]] — ByteDance×NYU の LLM 学習ストラグラー監視システム(What-if 帰属のオンライン化、OSDI 25) - [[NDTimeline]] — ByteDance 内製プロファイラ(SMon の入力トレース生成、10% サンプリング) - [[StragglerAnalysis]] — ストラグラー分析論文の公式 artifact リポジトリ(ByteDance-Seed/StragglerAnalysis) - [[Astral]] — Nanjing/Tencent の 50 万 GPU 級 LLM 訓練データセンターインフラ(tier-2 同一レール+HVDC+冷却+4 層監視+Seer、SIGCOMM 25) - [[Seer]] — Astral のオペレータ粒度予測コンポーネント(自己補正、密モデル 0.3% 偏差) - [[Delta]] — NCSA の大規模 GPU HPC システム(A100/H100、計 1,056 GPU)。GPU レジリエンス研究の対象・データ源 - [[Kefei Liu]] — R-Pingmesh 筆頭著者(BUPT、Hostping 筆頭著者でもある) - [[Jiao Zhang]] — R-Pingmesh 責任著者(BUPT / Purple Mountain Laboratories) - [[Shengkun Cui]] — GPU レジリエンス論文の共同筆頭著者(UIUC) - [[Ravishankar K. Iyer]] — GPU レジリエンス論文の責任著者(UIUC、ディペンダブルコンピューティング) - [[Jinkun Lin]] — ストラグラー分析(OSDI 25)の筆頭著者(NYU) - [[Aurojit Panda]] — ストラグラー分析の共著者(NYU) - [[Jinyang Li]] — ストラグラー分析の責任著者(NYU) - [[Borui Wan]] — ByteRobust 筆頭著者(HKU/ByteDance、ByteCheckpoint 筆頭著者) - [[Liang Xiang]] — ByteRobust の責任著者格(ByteDance Seed) - [[Chuan Wu]] — ByteRobust 責任著者(HKU) - [[Hao Zheng]] — Astral 共著者(Nanjing University) - [[ChonLam Lao]] — Astral 共著者(Harvard University) - [[Gianni Antichi]] — Astral 共著者(Politecnico di Milano / Queen Mary University of London) - [[BUPT]] — 北京郵電大学。R-Pingmesh の共同研究機関(networking) - [[Douyin Vision]] — R-Pingmesh を本番展開した企業(ByteDance 傘下ブランド) - [[NCSA]] — National Center for Supercomputing Applications(UIUC 内)。Delta を運用(hpc) - [[Nokia Bell Labs]] — GPU レジリエンス論文の共著者 Catello Di Martino の所属 - [[New York University]] — NYU。ストラグラー分析の著者陣の所属(ByteDance Seed と産学共同) - [[The University of Hong Kong]] — HKU。ByteRobust の責任著者 Chuan Wu・筆頭 Borui Wan の所属 - [[Kexin Chu]] — eInfer 筆頭著者(University of Connecticut) - [[Yiwei Yang]] — eGPU 筆頭著者かつ eInfer 共著(UC Santa Cruz)。eBPF×GPU 横断 - [[Shizhen Zhao]] — eInfer 共著者(Shanghai Jiao Tong University) - [[Bohua Zou]] — ProfInfer 筆頭著者(Huawei Hilbert Research Center Dresden / TU Munich) - [[Debayan Roy]] — ProfInfer 責任著者(Huawei Hilbert Research Center Dresden) - [[Haibo Chen]] — ProfInfer・PICKER 共著者(Huawei Central Software Institute / SJTU IPADS) - [[Min Si]] — NCCLX(Collective Communication for 100k+ GPUs)筆頭著者(Meta) - [[Pavan Balaji]] — NCCLX 論文の共著者(Meta) - [[James Hongyi Zeng]] — NCCLX 論文の責任著者(Meta) - [[Sébastien Darche]] — GPU トレース収集論文(hip-analyzer)筆頭著者(Polytechnique Montréal, DORSAL lab) - [[Michel R. Dagenais]] — 同 TOPC 論文共著者・DORSAL lab 主宰(Polytechnique Montréal) - [[Mingcong Han]] — PICKER 筆頭著者(SJTU IPADS) - [[Rong Chen]] — PICKER 責任著者(SJTU IPADS) - [[Tong Yu]] — eGPU 共著者(Eunomia Inc) - [[Andrew Quinn]] — eGPU 共著者(UC Santa Cruz) - [[Hong Xu]] — Mycroft 共著者(CUHK) - [[UC Santa Cruz]] — eGPU・eInfer の著者所属(米国の研究大学) - [[University of Connecticut]] — eInfer の著者 Kexin Chu らの所属(米国の研究大学) - [[University of Washington]] — eInfer の著者 Chenxingyu Zhao の所属(米国の研究大学) - [[Shanghai Jiao Tong University]] — eInfer・ProfInfer・PICKER に関与(中国、IPADS を擁する) - [[Institute of Parallel and Distributed Systems]] — SJTU 内の研究所(IPADS)。PICKER の著者所属 - [[Meta]] — 10 万 GPU 超クラスタを運用し集合通信ライブラリ NCCLX・CTran を開発 - [[ByteDance Seed]] — ByteDance の研究組織。Mycroft の複数著者所属 - [[Polytechnique Montréal]] — GPU トレース収集論文の著者所属(カナダの工科大学) - [[DORSAL lab]] — Polytechnique Montréal の研究室。Michel R. Dagenais 主宰、TOPC・hip-analyzer - [[Huawei Hilbert Research Center Dresden]] — ProfInfer の著者所属(Huawei のドレスデン拠点) - [[Huawei Central Software Institute]] — ProfInfer の著者 Haibo Chen 所属(Huawei の研究組織) - [[TU Munich]] — ProfInfer の著者所属(ドイツの工科大学) - [[Eunomia Inc]] — eGPU の著者 Tong Yu 所属、eGPU/bpftime のコードを公開 - [[NCCLX]] — Meta の集合通信フレームワーク。NCCL 拡張で 10 万 GPU 超を一元支援 - [[CTran]] — NCCLX のカスタムトランスポート層(ゼロコピー・SM フリー・ホスト駆動) - [[DQPLB]] — NCCLX の輻輳管理機構(Dynamic Queue Pair Load Balancing) - [[torchcomms]] — NCCLX の公開コードを含む Meta のリポジトリ - [[Llama4]] — Meta の LLM。NCCLX の評価対象ワークロード - [[llama.cpp]] — エッジ/オンデバイス向け LLM 推論エンジン(ProfInfer の計装対象) - [[GGML]] — llama.cpp の ML ランタイム/テンソルライブラリ - [[Perfetto]] — タイムライン可視化ツール。ProfInfer の ProfTime が利用 - [[BCC]] — BPF Compiler Collection。eBPF ラピッドプロトタイピング向けフレームワーク(70+ ツール内包、Python/Lua/C++ フロントエンド) - [[libbpf]] — eBPF 本番実装用 C ライブラリ。CO-RE によるカーネルバージョン横断ポータビリティを提供 - [[bpftrace]] — eBPF アドホックトレーシング特化スクリプト言語(2017)。探索・デバッグ段階に最適 - [[Orange Pi]] — ProfInfer の評価デバイス(RK3588 系 SoC) - [[Rubik Pi]] — ProfInfer の評価デバイス(QCS6490 SoC) - [[Rockchip NPU]] — ProfInfer が自作バックエンドを実装した NPU - [[NVBit]] — NVIDIA GPU バイナリ計装フレームワーク。eGPU の比較対象 - [[CUPTI]] — CUDA Profiling Tools Interface。GPU プロファイリングの比較参照 - [[PTX]] — NVIDIA GPU の中間表現。eGPU の注入対象 - [[ParallelGPU OS]] — GPU 向け並行チェックポイント/復元システム(POS)。eGPU の基盤 - [[CXLMemSim]] — CXL.mem シミュレータ(eGPU 著者の先行研究) - [[hip-analyzer]] — CUDA/HIP カーネル計装ツール(TOPC の参照実装) - [[Rodinia]] — GPU ベンチマークスイート(TOPC の評価) - [[HIP]] — AMD の GPU プログラミングモデル - [[PICKER]] — インスタンス単位の GPU カーネルべき等性検証システム - [[Asymmetric Resilience]] — GPU 向け耐障害システム。PICKER の統合先 - [[Chimera]] — プリエンプティブ GPU スケジューリングシステム。PICKER の統合先 - [[PACE]] — ISAV の因果探索フレームワーク(相関クラスタリング + ラグ考慮 Granger 因果性、ORNL Summit 冷却テレメトリ 7 年) - [[SkeletonHunter]] — Alibaba Cloud のコンテナ訓練ネットワーク障害診断(トラフィックスケルトン推論で probing 2 桁削減、precision 98.2%) - [[eACGM]] — eBPF + libnvml + GMM のフルスタック非侵入 ML 監視(6 ベースライン超、OSS) - [[XPUTimer]] — Alibaba/Ant の発散 LLM 訓練異常診断(非侵入 CPython 計装 + CUDA-GDB intra-kernel inspecting、v2 で Flare に改名) - [[LLMPrism]] — Huawei Cloud のブラックボックス性能診断(スイッチ層 RoCE フローのみから並列化・タイムライン逆推定) - [[L4]] — LLM 訓練障害の自動ログ解析(cross-job/spatial(iForest)/temporal(DTW)、F1 0.873) - [[Platform-X]] — Huawei Cloud の本番マルチテナント LLM 訓練基盤(L4・LLMPrism のデプロイ先、匿名) - [[Summit]] — ORNL のスパコン(冷却インフラ 7 年テレメトリが PACE の評価データ) - [[Perlmutter]] — NERSC のスパコン(A100、GPU 性能モデリング評価、誤差 4.98%) - [[Vista]] — TACC のスパコン(GH200、GPU 性能モデリング評価、誤差 9.38%) - [[GPT-NeoX]] — DeepSpeed + Megatron-LM 統合の訓練フレームワーク(GPU 性能モデリングのオペレータ分解対象) - [[Alibaba HPN]] — Alibaba の rail-optimized LLM 訓練 DC ネットワーク(SkeletonHunter の前提) - [[DeepSpeed]] — Microsoft のメモリ最適化(ZeRO)+ 3D parallelism 実装基盤(GPT-NeoX・Aegis が参照) - [[DLRover]] — Ant Group の OSS 自動分散 DL システム(Flare/XPUTimer を含む) - [[The Pile]] — 825GB の英語テキストコーパス(GPU 性能モデリングの訓練・評価) - [[Hewlett Packard Labs]] — HPE 研究部門(PACE の主所属) - [[Oak Ridge National Laboratory]] — 米 DOE 国立研(Summit・冷却テレメトリ提供、PACE 評価) - [[Case Western Reserve University]] — GPU 性能モデリング論文の主所属(著者 5 名) - [[Rutgers University]] — GPU 性能モデリング論文の共同所属(Mingkai Zheng・Zhao Zhang) - [[Ant Group]] — 6,000 GPU で Flare を本番運用、DLRover の母体(Ant International とは別) - [[Huawei Cloud]] — Platform-X を運営、L4・LLMPrism の産業側所属 - [[Pavana Prakash]] — PACE(ISAV)筆頭著者(Hewlett Packard Labs) - [[Rolando P. Hong Enriquez]] — PACE 共著者(Hewlett Packard Labs) - [[Sergey Serebryakov]] — PACE 共著者(Hewlett Packard Labs) - [[David Grant]] — PACE 共著者(所属未確定) - [[Wesley Brewer]] — PACE 共著者(Oak Ridge National Laboratory) - [[Dejan Milojicic]] — PACE シニア著者(Hewlett Packard Labs、HPE Fellow/VP) - [[Biyao Zhang]] — GPU 性能モデリング論文の筆頭著者(Case Western Reserve University) - [[Mingkai Zheng]] — 同共著者(Rutgers University) - [[Debargha Ganguly]] — 同共著者(Case Western Reserve University) - [[Xuecen Zhang]] — 同共著者(Case Western Reserve University) - [[Vikash Singh]] — 同共著者(Case Western Reserve University) - [[Vipin Chaudhary]] — 同共著者(Case Western Reserve University) - [[Zhao Zhang]] — 同シニア著者(Rutgers University、HPC) - [[Wei Liu]] — SkeletonHunter 筆頭著者(Tsinghua University) - [[Kun Qian]] — SkeletonHunter/Aegis 共著者・Alibaba HPN 筆頭(Alibaba Cloud) - [[Zhenhua Li]] — SkeletonHunter 共著者(Tsinghua University) - [[Ennan Zhai]] — SkeletonHunter/Aegis の責任著者格(Alibaba Cloud) - [[Yunhao Liu]] — SkeletonHunter 共著者(Tsinghua University) - [[Weicheng Wang]] — SkeletonHunter/Aegis 共著者(Alibaba Cloud) - [[Yun Zhang]] — SkeletonHunter 共著者(Alibaba Cloud) - [[Jiakang Li]] — SkeletonHunter 共著者(Alibaba Cloud) - [[Shuhong Zhu]] — SkeletonHunter 共著者(Alibaba Cloud) - [[Xue Li]] — SkeletonHunter/Aegis 共著者(Alibaba Cloud) - [[Hongfei Xu]] — SkeletonHunter 共著者(Alibaba Cloud) - [[Fei Feng]] — SkeletonHunter/Aegis 共著者(Alibaba Cloud) - [[Ruilin Xu]] — eACGM 筆頭著者(Sun Yat-sen University) - [[Zongxuan Xie]] — eACGM 共著者(Sun Yat-sen University) - [[Weihao Cui]] — XPUTimer(Flare)筆頭著者(Shanghai Jiao Tong University) - [[Ji Zhang]] — XPUTimer 共著者(Independent Researcher、v2) - [[Han Zhao]] — XPUTimer corresponding(v2、Shanghai Jiao Tong University) - [[Chao Liu]] — XPUTimer 共著者(Independent Researcher、v2) - [[Jian Sha]] — XPUTimer corresponding(v2、Ant Group) - [[Bingsheng He]] — XPUTimer 共著者(National University of Singapore) - [[Minyi Guo]] — XPUTimer シニア著者(Shanghai Jiao Tong University) - [[Quan Chen]] — XPUTimer corresponding(v1、Shanghai Jiao Tong University) - [[Jianbo Dong]] — Aegis 筆頭著者(Alibaba Cloud) - [[Pengcheng Zhang]] — Aegis 共著者(Alibaba Cloud) - [[Rui Ren]] — LLMPrism 共著者(Huawei Cloud) - [[Yulun Wu]] — LLMPrism 共著者(The Chinese University of Hong Kong) - [[Wenwei Gu]] — LLMPrism 共著者(The Chinese University of Hong Kong) - [[Yujie Huang]] — LLMPrism 共著者(The Chinese University of Hong Kong) - [[Junjie Huang]] — L4 筆頭著者(The Chinese University of Hong Kong) - [[Zhuangbin Chen]] — L4 共著者(Sun Yat-sen University) - [[Yichen Li]] — L4/LLMPrism 共著者(The Chinese University of Hong Kong) - [[Renyi Zhong]] — L4 共著者(The Chinese University of Hong Kong) - [[Cong Feng]] — L4/LLMPrism 共著者(Huawei Cloud) - [[Yongqiang Yang]] — L4/LLMPrism 共著者(Huawei Cloud) - [[Zengyin Yang]] — L4/LLMPrism 共著者(Huawei Cloud) - [[Shuaiyu Xie]] — TVDiag 筆頭著者(武漢大学) - [[Jian Wang]] — TVDiag 責任著者(武漢大学 + 中関村実験室) - [[Bing Li]] — TVDiag 責任著者(武漢大学 + 中関村実験室) - [[Wuhan University]] — 武漢大学。TVDiag の主所属機関(武漢市) - [[TVDiag]] — タスク指向・ビュー不変のマルチモーダル障害診断フレームワーク(武漢大学 + 中関村実験室。TOSEM Vol.35 No.2, 2026) - [[TAMO]] — ツール支援型 LLM マルチモーダル RCA フレームワーク([[Shandong University]] + [[Beihang University]]。IEEE TSC 2025) - [[Xiao Zhang]] — TAMO 第一著者、山東大学准教授(データマイニング・分散学習) - [[Dongxiao Yu]] — TAMO 責任著者、山東大学教授(エッジインテリジェンス・分散コンピューティング) - [[Fuzhen Zhuang]] — TAMO 共著者、北京航空航天大学教授(転移学習・知識グラフ、150 本超) - [[Shandong University]] — 山東大学。TAMO の主所属機関(青島/済南) - [[CASCA]] — TU Wien の MSA ベースのカーボン認識 SLO 充足プラットフォーム(arXiv 2026) - [[Jeffrey C. Mogul]] — Google Research。可用性・SLO 研究の主要著者(HotOS 2017・HotOS 2019) - [[John Wilkes]] — Google。SLO/SRE の著名研究者(HotOS 2019、SRE 本共著者) - [[Tamás Hauer]] — Google。ウィンドウ付きユーザーアップタイムの提案者(NSDI 2020 筆頭著者) - [[Philipp Hoffmann]] — Google。Meaningful Availability 共著者(NSDI 2020) - [[John Lunney]] — Google。Meaningful Availability 共著者(NSDI 2020) - [[Dan Ardelean]] — Google。Meaningful Availability 共著者(NSDI 2020) - [[Amer Diwan]] — Google。Meaningful Availability 共著者(NSDI 2020) - [[Rebecca Isaacs]] — Google。可用性のセキュリティ的思考を提唱(HotOS 2017 共著者) - [[Brent Welch]] — Google。可用性のセキュリティ的思考を提唱(HotOS 2017 共著者) - [[Boris Sedlak]] — TU Wien。SLO 拡散方法論の筆頭著者(IEEE SOSE 2024) - [[Víctor Casamayor Pujol]] — TU Wien。SLO 拡散方法論の共著者(IEEE SOSE 2024) - [[Praveen Kumar Donta]] — TU Wien。SLO 拡散方法論の共著者(IEEE SOSE 2024) - [[Juan Luis Herrera]] — TU Wien。CASCA 筆頭著者(arXiv 2026) - [[Daniel Wang (TU Wien)]] — TU Wien。CASCA 共著者(arXiv 2026) - [[Ashish Vaswani]] — Transformer 筆頭著者(NeurIPS 2017)。Google Brain → Adept AI → Essential AI - [[Noam Shazeer]] — Scaled Dot-Product Attention 提案。Google Brain → Character AI 共同創設者 - [[Aidan Gomez]] — Transformer 共著者。トロント大学 → Cohere 共同創設者 - [[Illia Polosukhin]] — Transformer 共著者。Google Research → NEAR Protocol 共同創設者 - [[Łukasz Kaiser]] — Transformer 共著者・tensor2tensor 実装。Google Brain - [[Jakob Uszkoreit]] — Transformer 共著者。Google Research → Inceptive Nucleics 共同創設者 - [[Niki Parmar]] — Transformer 共著者。Google Research - [[Llion Jones]] — Transformer 共著者。Google Research → Sakana AI 共同創設者 - [[Google Brain]] — Google の AI 研究部門(2023 年に DeepMind と統合し Google DeepMind に)。Transformer の主要開発拠点 - [[OpenAI]] — AI 研究組織(2015 年設立)。GPT シリーズ・DALL·E・ChatGPT の開発元 - [[Alec Radford]] — GPT-1/GPT-2 筆頭著者、GPT-3 共著者。OpenAI 研究者 - [[Ilya Sutskever]] — OpenAI 共同創設者・元チーフサイエンティスト。GPT-1/2/3 共著者 - [[Karthik Narasimhan]] — GPT-1 共著者。OpenAI → Princeton - [[Tim Salimans]] — GPT-1 共著者。OpenAI - [[Dario Amodei]] — GPT-2/3 共著者。OpenAI → Anthropic 共同創設者・CEO - [[Jeffrey Wu]] — GPT-2 共同第一著者。OpenAI - [[Rewon Child]] — GPT-2/3 共著者、Sparse Transformer。OpenAI - [[Tom Brown]] — GPT-3 筆頭著者。OpenAI - [[Jared Kaplan]] — GPT-3 共著者、スケーリング則研究。Johns Hopkins / OpenAI → Anthropic - [[GPT-2]] — OpenAI の 1.5B パラメータ言語モデル。ゼロショットで 8 データセット中 7 で SOTA - [[GPT-3]] — OpenAI の 175B パラメータ言語モデル。文脈内学習を大規模に実証(NeurIPS 2020) - [[WebText]] — OpenAI が構築した 40GB ウェブテキストデータセット(Reddit 3 karma 以上でフィルタ) - [[Runzhou Wang]] — 南開大学 AIOps@NKU の研究者。NexusRCL 論文(arXiv 2026-04)の第一著者 - [[NexusRCL]] — マイクロサービス RCL の半教師付き異種グラフフレームワーク。サービス/ホストを分離した Layer-Aware HGN と Active Learning を組み合わせ、HD1/HD2 で A@1 SOTA - [[Katja Gilly]] — [[Miguel Hernández University]] の研究者。Webロードバランシングサーベイ(World Wide Web 2011)筆頭著者(person / web-systems) - [[Carlos Juiz]] — [[University of Balearic Islands]] の教授。Webロードバランシングサーベイ(World Wide Web 2011)共著者(person / web-systems) - [[Ramon Puigjaner]] — [[University of Balearic Islands]] の教授。Webロードバランシングサーベイ(World Wide Web 2011)共著者(person / web-systems) - [[Miguel Hernández University]] — スペイン・アリカンテ州エルチェ所在の公立大学。[[Katja Gilly]] 所属(organization / university) - [[University of Balearic Islands]] — スペイン・バレアレス諸島州パルマ所在の公立大学(UIB)。[[Carlos Juiz]]・[[Ramon Puigjaner]] 所属(organization / university) - [[Xiaoyun Li]] — [[Sun Yat-sen University]] の研究者。Li+ ISSRE 2022 共同第一著者(person / cloud-reliability) - [[Hongyang Chen]] — [[Sun Yat-sen University]] の研究者。Li+ ISSRE 2022 共著者(person / cloud-reliability) - [[Zhekang Chen]] — [[Bizseer]] の研究者。Li+ ISSRE 2022 産業界共著者(person / cloud-reliability / industry) - [[Netflix]] — グローバル動画ストリーミング企業。数千のマイクロサービスを運用し、SRE・オブザーバビリティ・サービストポロジの実践知を広く公開(organization / streaming / distributed-systems) - [[Apache Pekko]] — Akka のオープンソースフォーク(Apache Software Foundation)。アクターモデル・Pekko Streams による JVM 向け分散処理フレームワーク(product / streaming / distributed) - [[Tianyi Yang]] — [[The Chinese University of Hong Kong]]([[Michael R. Lyu]] 研究室)。Yang+ DSN2022 アラートアンチパターンの筆頭(person / aiops) - [[Jiacheng Shen]] — CUHK Lyu 研究室。Yang+ DSN2022 共著・AID(ASE 2021)共著(person / aiops) - [[Yuxin Su]] — [[Sun Yat-sen University]] ソフトウェア工学院、Yang+ DSN2022 責任著者(person / aiops) - [[Xiaoxue Ren]] — CUHK 計算機科学工学科。Yang+ DSN2022 共著(person / aiops) - [[Jinxi Kuang]] — CUHK Lyu 研究室。Kuang+ ICSE-SEIP2024 [[COLA]] の筆頭(person / aiops) - [[Jinyang Liu]] — CUHK Lyu 研究室。Kuang+ ICSE-SEIP2024 第 2 著者・Logzip・iPACK 共著(person / aiops) - [[Jiazhen Gu]] — CUHK Lyu 研究室。Kuang+ ICSE-SEIP2024 責任著者(person / aiops) - [[Lan Yu]] — [[Huawei Cloud]] Computing and Networking Innovation Lab。Kuang+ ICSE-SEIP2024 共著(person / cloud-reliability) - [[Rui Tan]] — [[Huawei Cloud]] Computing and Networking Innovation Lab。Kuang+ ICSE-SEIP2024 共著(person / cloud-reliability) - [[Akanksha Singal]] — [[IBM Research]] India + [[IIIT Delhi]]。Singal+ arXiv2025 [[KIMetrix]] の筆頭(person / aiops / microservices) - [[Kaustabha Ray]] — [[IBM Research]] India。Singal+ arXiv2025 共著(person / aiops) - [[Divya Pathak]] — [[IBM Research]] India。Singal+ arXiv2025 共著(person / aiops) - [[Felix George]] — [[IBM Research]] India。Singal+ arXiv2025 共著(person / aiops) - [[Mudit Verma]] — [[IBM Research]] India。Singal+ arXiv2025 共著(person / aiops) - [[Pratibha Moogi]] — [[IBM Research]] India。Singal+ arXiv2025 シニア共著(person / aiops) - [[IIIT Delhi]] — Indraprastha Institute of Information Technology Delhi。[[Akanksha Singal]] 所属(organization / university / india) - [[Derek Lin]] — [[Pivotal Software]] Palo Alto。Lin+ KDD2014 アラート/インシデントクラスタリングの筆頭(person / aiops / clustering) - [[Rashmi Raghu]] — [[Pivotal Software]] Palo Alto。Lin+ KDD2014 共著(person / aiops) - [[Vivek Ramamurthy]] — [[Pivotal Software]] Palo Alto。Lin+ KDD2014 共著(person / aiops) - [[Jin Yu]] — [[Pivotal Software]] Melbourne。Lin+ KDD2014 共著・NMF + KD-tree 部担当(person / aiops) - [[Regunathan Radhakrishnan]] — [[Pivotal Software]] Palo Alto。Lin+ KDD2014 共著(person / aiops) - [[Joseph Fernandez]] — [[Visa Inc]](Foster City)。Lin+ KDD2014 共著、Pivotal との産学連携でデータ提供側(person / aiops / industry) - [[Pivotal Software]] — Palo Alto + Melbourne。Greenplum DB + MADlib の MPP データ分析プラットフォーム企業。2019 年に VMware 買収で VMware Tanzu に統合(organization / data-analytics) - [[Visa Inc]] — Foster City, CA。決済ネットワーク事業者。Lin+ KDD2014 のエンタープライズ IT データ提供側(organization / finance) - [[Yujun Chen]] — [[Beihang University]] Beijing + [[Microsoft Research]] インターン。Chen+ WWW2019 [[AirAlert]] の筆頭(person / aiops / outage-prediction) - [[Hang Dong]] — [[Microsoft Research]] Beijing。Chen+ WWW2019 共著(person / aiops) ### 2026-06-17 distributed training batch - [[Philipp Moritz]], [[Ion Stoica]], [[Mohammad Shoeybi]], [[Bryan Catanzaro]], [[Deepak Narayanan]], [[Matei Zaharia]], [[Yanping Huang]], [[Quoc V. Le]], [[Jeff Rasley]], [[Samyam Rajbhandari]], [[Yuxiong He]], [[Hanyu Zhao]], [[Vijay Korthikanti]], [[Houwen Peng]], [[Han Hu]], [[Yanli Zhao]], [[Kai Chen (HKUST)]], [[Sudarsanan Rajasekaran]], [[Manya Ghobadi]], [[Aditya Akella]], [[Bohan Zhao]], [[Wei Xu]] - [[Ray]], [[GPipe]], [[PipeDream]], [[HiveD]], [[OpenPAI]], [[Cassini]], [[FFTrainer]] - [[iSING Lab]] ### 2026-07-01 NORAD Near Miss batch - [[Nick Travaglini]] — [[Honeycomb.io]] Technical Customer Success Manager。USENIX SREcon23 Americas で 1979 年 NORAD 核ミサイル誤警報事件を Distant-Proximal / Blunt-Sharp モデルで分析する講演を発表(person / sre) - [[Honeycomb.io]] — オブザーバビリティ製品を提供する企業。[[Nick Travaglini]] が在籍(organization / sre / observability) ### 2026-07-01 SREcon23 EMEA McCarthy ingest - [[Niall McCarthy]] — [[Afterpay]] エンジニアリングリーダー。USENIX SREcon23 EMEA で「The Incident Is The Way」を発表(person / sre / incident-management) - [[Afterpay]] — 後払い決済サービスを提供する企業。[[Niall McCarthy]] が在籍(organization / fintech / sre) ### 2026-07-01 Hard Choices, Tight Timelines (SREcon24 Americas) ingest - [[Laura Maguire]](更新) — Trace Cognitive Engineering/OSU 所属を反映。Skip-level トレードオフ意思決定研究を追加(person / sre / resilience-engineering / tradeoff) - [[Courtney Nash]](更新) — The Void の限界とトレードオフ研究への展開を追加(person / sre / incident-management / tradeoff) ### 2026-07-01 Storytelling as an Incident Management Skill (SREcon24 Americas) ingest (2 updated) - [[Laura de Vesine]](更新) — SREcon24 Americas 発表を追加。人物中心でなく因果論理中心の narrative を推す立場と、5段階「エンゲージングなポストモーテム」構成を追記(person / sre / incident-management / postmortem) - [[Datadog]](更新) — de Vesine のストーリーテリング発表を出典に追加。自社のパイプライン遅延・キャッシュ層インシデント例を含む(organization / sre / incident-management) ### 2026-07-22 The Failure of Knowledge Management / Infrastructure Management Timescales (Mark Burgess) ingest (1 new, 1 updated) - [[Robin Dunbar]](新規、person) — 社会脳仮説・Dunbar数の提唱者。知識の関係性モデルの生物学的裏付けとして引用 - [[Mark Burgess]](更新) — 知識管理論・タイムスケール理論の提唱者としての側面(CFEngine 社創業と離脱の経緯を含む)を追記 ### 2026-08-13 TS-Benchmark (ICDE 2021) ingest (3 new, 4 updated) - [[Druid]](新規、product) — OLAP向けカラム型データストア。TS-Benchmarkで4TSDB中データ注入最下位・フィルタ付きクエリ最速 - [[Yuanzhe Hao]](新規、person) — TS-Benchmark第一著者([[Renmin University of China]]) - [[Yueguo Chen]](新規、person) — TS-Benchmark責任著者([[Renmin University of China]]) - [[InfluxDB]](更新) — TS-Benchmarkでの性能特性(TSMツリーによる高スループット、注入飽和時CPU100%)を追記 - [[TimescaleDB]](更新) — TS-Benchmarkでの性能特性(適応的チャンクによる高並行性書き込み性能)を追記 - [[OpenTSDB]](更新) — TS-Benchmarkでの性能特性(小規模データでの高スループット、大規模データロード失敗)を追記 - [[Renmin University of China]](更新) — TS-Benchmark著者陣の所属研究室を追記 ### 2026-08-18 機械学習システムデザイン(オライリー・ジャパン 2023)ingest-book (12 新規 / 5 更新) - [[機械学習システムデザイン]](新規、book) — Chip Huyen *Designing Machine Learning Systems* の日本語訳。全 12 章 source へのハブ - [[宮川大輔]](新規、person) — 日本語版オリジナル付録 A の執筆者([[株式会社JDSC]]) - [[株式会社JDSC]](新規、organization) — 付録 A 執筆者の所属。多ドメインで機械学習システムを受託開発する日本企業 - [[MLflow]](新規、product) — クラウド非依存のオープンソースモデルストア(10 章) - [[Feast]](新規、product) — 本書執筆時点で最も有名なオープンソース特徴ストア(10 章) - [[Metaflow]](新規、product) — デコレーターで依存とクラウド実行を指定するデータサイエンス向けワークフロー管理ツール(10 章) - [[Ofqual]](新規、organization) — 英国の教育・試験監査機関。11 章の責任あるAI 失敗事例 - [[Strava]](新規、organization) — オンラインフィットネストラッカー。11 章の責任あるAI 事例 - [[Stitch Fix]](新規、organization) — エンドツーエンドのデータサイエンティスト体制と独自モデルストアの事例(10・11 章) - [[Eric Colson]](新規、person) / [[Eugene Yan]](新規、person) / [[Abhishek Gupta]](新規、person) — 11 章のチーム構成・責任あるAI 論者 - [[Chip Huyen]](更新) — 本書著者としての書誌・経歴を追記 - [[Apache Airflow]](更新) — 10 章の Airflow 史と 3 つの欠点を追記 - [[Netflix]](更新) — Full Cycle Developers の節を追記 - [[Booking.com]](更新) — フィルターレコメンドの一貫性ケーススタディを追記 - [[GPT-3]](更新) — 「ほぼ正しい」予測の例を追記 - [[上野裕一郎]] — [[Preferred Networks]] 所属エンジニア。MPLS Japan 2024 で「アクセラレータ間通信の実際」を発表(person / networking) - [[Preferred Networks]](更新) — H100 クラスタのアクセラレータ間通信トラブルシューティング事例を追記 - [[NCCL]](更新) — PCIe SW 論理分割による NIC 選択偏りの実運用事例を追記 - [[Richard L. Graham]] — [[Mellanox]] 所属。SHArP プロトコル(COM-HPC '16)の筆頭著者(person / networking / hpc) - [[Devendar Bureddy]] — [[Mellanox]] 所属。SHArP 論文の共著者(person / networking / hpc) - [[Pak Lui]] — [[Mellanox]] 所属。SHArP 論文の共著者(person / networking / hpc) - [[Hal Rosenstock]] — [[Mellanox]] 所属。SHArP 論文の共著者(person / networking / hpc) - [[Gilad Shainer]] — [[Mellanox]] 所属。SHArP 論文の共著者(person / networking / hpc) - [[Gil Bloch]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Dror Goldenberg]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Mike Dubman]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Sasha Kotchubievsky]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Vladimir Koushnir]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Lion Levi]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Alex Margolin]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Tamir Ronen]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Oded Wertheim]] — [[Mellanox]](Yokneam, Israel)所属。SHArP 論文の共著者(person / networking / hpc) - [[Eitan Zahavi]](更新) — SHArP 論文(COM-HPC '16)の共著者としての参照を追加 - [[Alexander Shpiner]](更新) — SHArP 論文(COM-HPC '16)の共著者としての参照を追加 - [[Mellanox]](更新) — SHArP(COM-HPC '16)による InfiniBand SwitchIB-2 への網内集約オフロード技術を追記 --- ## Sources - [[@2023__SpeakerDeck__クラウドデータセンターネットワークのいまとこれから]] — [[Masayuki Kobayashi]]、AI/ML/HPCネットワーク分科会、2023-06-12。CPU-Centric から Distributed & Disaggregated Computing への移行を起点に Web Scale(Frontend)/AI-ML(Backend)ネットワーク分離、RDMA/RoCEv2 のロスレス前提、Rail Optimized Topology、ラックデザイン ToR→EoR、Clos のレイテンシ限界と Dragonfly+ 検討まで扱うスライド資料(source / slides / networking / rdma / datacenter / topology) - [[@2017__SC__Topology-Aware GPU Scheduling for Learning Workloads in Cloud Environments]] — [[Marcelo Amaral]]・[[Jordà Polo]]・[[David Carrera]]([[Barcelona Supercomputing Center]])、[[Seetharami Seelam]]・[[Malgorzata Steinder]]([[IBM Watson Research Center]])、SC17。IBM Power8(NVLink接続Tesla P100)でGPU間通信を考慮したpack/spread配置を実測(最大約1.30倍高速化)、通信コスト・同居干渉・資源断片化を統合した効用関数ベースのトポロジ考慮型スケジューリング(TOPO-AWARE/TOPO-AWARE-P)をプロトタイプと大規模シミュレーションで評価(source / paper / gpu / scheduling / distributed) - [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]] — [[Diman Zad Tootaghaj]]・Khaled Diab・Bob Lantz・Puneet Sharma([[Hewlett Packard Labs]])、Hanjiang Wu・[[Tushar Krishna]]([[Georgia Institute of Technology]])ほか。SIGCOMM 2026。NVLink ピア GPU の遊休 HBM をプールし LLM 重み・KV キャッシュを分散オフロード、MPS コロケーションでマルチテナント GPU 利用率を改善。FlexGen・Aqua 比で OPT-30B スループット 2 倍超(source / paper / llm / inference / gpu / memory-management) - [[@2015__CoNEXT__Rapid and Robust Impact Assessment of Software Changes in Large Internet-based Services]] — [[Shenglin Zhang]](筆頭)・[[Ying Liu]]・[[Dan Pei]]([[Tsinghua University]])、[[Yu Chen (Baidu)]]・[[Xianping Qu]]ほか([[Baidu]])。改良SST(Singular Spectrum Transform)とDiD(Difference-in-Differences)法を組み合わせ、大規模インターネットサービスのソフトウェア変更影響を迅速・頑健に評価する自動化ツール[[FUNNEL]]を提案。144件の評価で精度99.8%超、CUSUM・MRLS比で検知遅延38.02%〜64.99%短縮・計算速度4.59〜7098倍高速化を達成し、Baidu実サービスへ本番展開(source / paper / aiops / change-detection / distributed-systems) - [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations]] — [[Binpeng Shi]]・[[Shenglin Zhang]]ほか([[Nankai University]]・[[Tsinghua University]])。70本の代表論文をData-Target-Principle-Approachタクソノミーで整理し、Transformerの優位性を二層6能力フレームワーク(SEQ/PARALLEL/PTKL/ICL/TF/LANG)で説明、評価資源(オフラインデータセット・問題バンク・リアルタイムシミュレーション)を統合したAIOps × Transformer包括サーベイ(source / paper / aiops / transformer / llm / survey) - [[@2024__NADDOD__The Evolution of 400G, 800G, and 1.6T Optical Modules]] — NADDOD 技術ブログ。400G・800G・1.6T光モジュールへの高速化をパッケージング進化(SFP→OSFP224)・変調方式(NRZ→PAM4→xQAM)・伝送距離命名規則(KR/CR/SR/DR/FR/LR/ER/ZR)・代表規格比較表の4軸で整理(source / article / networking / optics / datacenter) - [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] — [[Nengneng Yu]]・[[Sixian Xiong]]・[[Yibo Zhao]]・[[Wei Wang (UMD)]]・[[Zaoxing Liu]]([[University of Maryland]])。DMI-Lib: HookPoint・Ring2・Data Exporterの3コンポーネントでLLM推論の内部状態観測を推論ホットパスから非同期分離。オフライン0.4〜6.8%・オンライン平均6%のオーバーヘッドで既存手法比2〜15倍削減(source / paper / llm-inference / observability / gpu-systems) - [[@2004__OSDI__MapReduce - Simplified Data Processing on Large Clusters]] — [[Jeffrey Dean]]・[[Sanjay Ghemawat]]([[Google]], Inc.)、OSDI 2004。map/reduce の2関数だけで大規模クラスタ上の並列分散計算を記述できるプログラミングモデルとその耐障害実装を提案した基盤論文。master 中央集権スケジューリング・タスク再実行による耐障害性・[[Google File System]] 局所性最適化・straggler 緩和のバックアップタスク機構が特徴。2004年8月時点で月29,423ジョブ・入力3,288TB規模で本番稼働(source / paper / distributed-systems / task-parallel) - [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]] — [[SGLang]] チーム(LMSYS)2025-05-05。[[DeepSeek-V3]] 級モデルを96台のH100 GPU上でPD Disaggregation + 大規模Expert Parallelismにより配備し、DeepSeek公式プロフィールにほぼ匹敵する性能(TP16比Prefill最大3.3倍・Decode最大5.2倍)をオープンソース実装として初めて達成(source / article / llm / inference / moe / distributed) - [[@2026__Glenn K. Lockwood Blog__ISC26 Recap]] — [[Glenn K. Lockwood]] 2026年7月。2026 ISC High Performance Conference参加記。中国の全CPU(Arm)スパコン[[LineShine]]のTop500首位獲得とSugon [[ParaStor F9000]]のIO500首位獲得、2026-06-12の米国政府によるAnthropicモデル外国人アクセス遮断を引き金とした世界的[[主権AI]]インフラ投資、AI推論のメモリ帯域幅問題がアルゴリズム進歩で解決されてきたという主張を横断的に論じる(source / article / hpc / sovereign-ai / supercomputer) - [[@2024__SREcon24 Americas__What Is Incident Severity, but a Lie Agreed Upon?]] — [[Emily Ruppe|Em Ruppe]]([[Jeli]]、[[PagerDuty]] 傘下)USENIX SREcon24 Americas(2024-03-19、サンフランシスコ)。severity を「組織内で合意された嘘」と位置づけ、組織的問題の「カナリア」として読み解く運用論(video / sre / incident-management) - [[@2015__yuuk.io__linux-networkstack-tuning-rfs]] — [[Yuuki Tsubouchi]](坪内佑樹)2015-03-31。HAProxy・nginx・memcached 等がマルチコア環境で CPU0 softirq に集中する問題を解析し、RSS→RPS→RFS の技術体系と設定例を実験で検証。RFS 有効化で約 10% 応答速度改善(source / article / linux / networking / kernel / performance) - [[@2023__SREcon23EMEA__9 Things You Should Do When Starting to Use SLOs]] — [[Sal Furino]](CRE)SREcon23 EMEA(2023-10-11、ダブリン)。SLO 導入 9 アドバイスを 3 カテゴリで体系化。成功率 > エラー率、ステークホルダー別時間窓、SLODLC、「Observability Without Action is Just Storage」(slides / sre / slo) - [[@2016__SREcon16__Service Levels and Error Budgets]] — [[Chris Jones]]・[[Niall Murphy]]([[Google]])SREcon16(2016-04)。SRE Book 第 4 章の著者が SLI/SLO/SLA とエラーバジェット制御ループを口頭解説。(video / sre / slo / error-budget) - [[@2026__SREcon26Americas__The Power of Stories]] — [[Lorin Hochstein]](Airbnb)SREcon26 Americas クロージングキーノート。インシデントストーリーの 2 条件・ポストモーテムの narrative description・逸脱の正常化(Challenger/Vaughan)・Once Upon an Incident 実践(video / sre / postmortem / incident-management / human-factors) - [[@2025__YAPC Fukuoka 2025__SREのためのテレメトリー技術の探究]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]])YAPC::Fukuoka 2025。テレメトリー技術探究 12 年の総括。Scaling Telemetry Workloads + 今後 4 方向(slides / sre / telemetry) - [[@2022__SREcon22 APAC__Introducing the Reliability Map – r9y.dev]] — [[Aaron Bowden]](Google Cloud Professional Services)SREcon22 APAC(シドニー、2022-12-08)。SRE ケイパビリティのオープンソースマップ `r9y.dev` を紹介。コンテキスト抽出→ケイパビリティ選択→戦術・戦略ロードマップのプロセス提唱(source / video / sre / reliability) - [[@1998__CtL__How Complex Systems Fail]] — [[Richard I. Cook]] (CtL, University of Chicago) 1998 年。複雑システムの障害論を 18 命題で体系化。単一根本原因の否定・潜在的障害の常在・安全性の創発的特性(source / article / safety / human-factors / reliability) - [[@2024__SRE NEXT 2024__工学としてのSRE再訪]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]]・[[Topotal]])による SRE NEXT 2024 発表。SRE を「技芸→工学」として再訪し、歴史的背景・オープンチャレンジ・SREcon 学術接続を三軸で展開(source / slides / sre / engineering) - [[@2025__ASE__LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation]] — [[Ruowei Fu]]・[[Shenglin Zhang]]([[Nankai University]])/ [[ByteDance]] ほかによる ASE 2025 論文。OncallX: LLM × マルチエージェント協調でオンコール自動化。対応 21 秒・トリアージ 4 秒(ByteDance 本番 2 か月)(source / paper / aiops / llm / multi-agent / on-call) - [[@2017__SREcon17Americas__Anomaly Detection in Infrequently Occurred Patterns]] — [[Dong Wang]]([[Baidu]])SREcon17 Americas 2017-03-14。祝日トラフィックの異常検知で CDF k-means クラスタリング+リアルタイム比率補正(source / slides / sre / anomaly-detection) - [[joisino-トランスフォーマーはRNN-2024]] — [[佐藤竜馬]] 2024-09-30。Transformer の自己注意機構を [[カーネル法]] として再定式化し、線形注意により固定次元 [[RNN]] と等価に書き直せることを示す。訓練=並列・推論=定メモリの両モード切替、[[線形注意]]・[[状態空間モデル]]・[[文脈内学習]]の同質性まで通読。(source / article / machine-learning / sequence-modeling) - [[joisino-否定文理解-2024]] — [[佐藤竜馬]] 2024-12-18。BERT 系埋め込みは正反対文を高類似度で近接、softmax 構造上、否定文の埋め込みは数学的に存在不能。BERTNOT・[[Anthropic]] の[[文脈付き検索]](5.0%→2.9%)等の回避策をサーベイ。(source / article / llm / nlp / negation) - [[joisino-超人的AIと認知不能情報-2025]] — [[佐藤竜馬]] 2025-01-15。敵対的摂動は AI を騙すノイズでなく、人間に認知できない正当な分類手がかり。NP 完全性・対話型証明系を引き「探索 AI / 検証 人間」の[[AI検証可能性]]を提案。(source / article / adversarial / ai-alignment) - [[joisino-機械学習理論入門-2025]] — [[佐藤竜馬]] 2025-03-17。[[集中不等式]]→ユニオンバウンド→[[カバリングナンバー]]で古典的[[汎化誤差バウンド]]([[PAC学習]])を導出、深層学習過パラメータ域で崩壊することと損失地形「盆地」構造への展望まで一本道。(source / article / learning-theory / generalization) - [[joisino-言語モデルの物理学-2025]] — [[佐藤竜馬]] 2025-03-24。[[Zeyuan Allen-Zhu]]・[[Yuanzhi Li]]([[Meta FAIR]]) の [[Physics of Language Models]] シリーズを通覧。[[知識容量スケーリング則]](約 2 bit/param)・[[知識操作]]は CoT 必須・自己回帰モデルの誤答取消不能・[[文脈自由文法]]学習。(source / article / llm / interpretability / physics-of-llm) - [[joisino-アンナカレーニナの法則-2025]] — [[佐藤竜馬]] 2025-05-20。「性能の良いモデルはどれも同じような表現を持つ」を [[プラトン的表現仮説]]・[[モデル縫合]]・[[暗黙的正則化]]・反変原理・[[アンサンブル学習]]効果薄で解説。(source / article / representation-learning / multimodal) - [[joisino-人間を騙すAI-2025]] — [[佐藤竜馬]] 2025-06-23。標準 RLHF だけで LLM が人間を誤解させる振る舞いを学ぶ([[RLHF誤誘導]])。フェイクエビデンス挿入・難読化コード生成。[[報酬ハッキング]]・[[スコファンシ]]・[[LLM自己検証]]限界、[[Anthropic]] 等の調査をサーベイ。(source / article / ai-safety / rlhf) - [[joisino-面白さ優先分類器-2025]] — [[佐藤竜馬]] 2025-08-28。精度でなく「[[面白さ優先分類]]」を目的関数とする分類器 EUREKA。LLM の[[一対比較ランキング]]で面白い特徴を選ぶと「面白い特徴 1 つ」だけでも統計的有意な精度を達成。(source / article / feature-selection / llm) - [[joisino-LLMのキモい算術-2025]] — [[佐藤竜馬]] 2025-10-27。LLM の四則演算は [[ヒューリスティックの束]] として実装され、[[ロジットレンズ]] でニューロン単位の寄与を可視化できる([[LLM算術機構]]、Nikankin+ ICLR 2025)。(source / article / llm / interpretability) - [[joisino-訓練データ1個推論性能倍-2025]] — [[佐藤竜馬]] 2025-11-25。訓練データ 1 問の [[1サンプルRLVR]] でも 1209 問に匹敵する性能(Qwen2.5-Math-1.5B、MATH500 36→74%、6 ベンチ平均 17.6→35.7%)。問題選択基準は報酬分散、エントロピー正則化と内省語獲得が鍵。(source / article / reinforcement-learning / llm) - [[joisino-LLMの能力の穴-2026]] — [[佐藤竜馬]] 2026-01-26。最先端 LLM は流体力学・低レイヤープログラミングをこなしつつ、5 文字二進偶奇判定や 2×2 桁の掛け算で誤答する。「[[ゼロエラー境界]]」(ZEH)でモデル自身に問題サイズ限界を定めさせ[[LLM能力スパース性]]を可視化。(source / article / llm / evaluation) - [[joisino-LLMでソート-2026]] — [[佐藤竜馬]] 2026-02-09。LLM を[[LLM比較器]]として用い主観的・曖昧な基準でソート。ペアワイズ+クイックソートで推移性なしでも近似保証、セットワイズ・予測付きソートで呼び出し最小化。([[LLMランキング]]・[[LLM向け情報検索]])(source / article / llm / ir / sorting) - [[joisino-LLMと言葉の感じ方-2026]] — [[佐藤竜馬]] 2026-03-16。LLM 埋め込みのカテゴリ分類は人間と一致するが、典型度の順位相関は 0.15 以下と乖離。表現学習(word2vec/BERT)の方が順位相関 0.3〜0.4 と高い。次トークン予測の[[LLM意味表象]]への影響を[[認知意味論]]・[[プロトタイプ意味論]]視点で検証。[[Yann LeCun]] の次トークン予測限界主張の傍証。(source / article / llm / cognitive-semantics) - [[joisino-ICLR-2024-GNN]] — [[佐藤竜馬]] による 2024-05-15 ブログ記事。ICLR 2024 採択 GNN 論文 170 本(全体の 7.4%)を解釈性・[[GNN同変性]]・表現能力・分子基盤モデル等トピック別に概観。(source / article / machine-learning / graph-neural-network) - [[joisino-モデルパラメータ算術-2024]] — [[佐藤竜馬]] による 2024-01-09 ブログ記事。モデルスープ・[[タスクベクトル]]・NTK 理論・パーミュテーション対称性/Git Re-Basin のサーベイ。(source / article / machine-learning / model-merging) - [[@2026__SREcon26 Americas__Taming the Unpredictable - Reliability in Chaos]] — [[Michelle Brush]]([[Google]])、SREcon26 Americas 2026 講演動画。AI エージェントでソフトウェア作成が速く安くなるほど複雑性も増すと論じ、汎用緩和・実験・リスク先行開発・継続的検証を提示(source / video / sre / aiops) - [[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications]] — [[Ruyue Xin]]・[[Peng Chen (Xihua University)]]・[[Zhiming Zhao]]([[University of Amsterdam]] / [[Xihua University]])、arXiv:2209.02500(2022-09-06)。勾配ベース因果構造学習(DAG-GNN)で重み付き DAG を生成し PageRank でランキングする [[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications|CausalRCA]]。Sock-shop 細粒度 AC@3=0.719、ベースライン比平均 17% 改善。マイクロサービス RCA への勾配ベース手法初適用。(source / paper / aiops / rca / causal-inference / microservices) - [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]] — [[Xianglin Lu]] ほか([[Tsinghua University]] / [[Nankai University]] / [[BizSeer]]、[[Dan Pei]] グループ)、CCGrid 2022。教師なし OLTP データベース根本原因箇所特定 **CauseRank**。G-GES + COPP で Oracle 本番 97 件・top-3=82.5%・top-5=93.8%・MAR=2.13。MicroCause 比 MAR 46.1% 改善・12.58 秒/障害。(source / paper / aiops / database / rca / causal-inference) - [[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems]] — [[Canhua Wu]]・[[Nengwen Zhao]]・[[Dan Pei]] ほか([[Tsinghua University]] / [[BNRist]] / [[China Construction Bank]] / [[BizSeer]])、ISSRE 2021(DOI:10.1109/ISSRE52982.2021.00020)。根本原因メトリクス特定 **PatternMatcher**。KS-test + 1-D CNN(13 種パターン、F1=0.98) + 重み付きランキングで大手商業銀行 4 データセット Avg@3=0.91。本番展開済み。(source / paper / aiops / sre / rca / ISSRE) - [[@2014__IEEE CLOUD__Scalability and Robustness of Time-Series Databases for Cloud-Native Monitoring of Industrial Processes]] — [[Thomas Goldschmidt]] ほか([[ABB Corporate Research]])、IEEE CLOUD 2014。OpenTSDB・KairosDB・Databus を AWS 最大 36 ノードでスマートグリッドワークロードにより評価。KairosDB が線形スケーラビリティ(403,500 値/秒)・ロバスト性で優位。OpenTSDB は HBase のメモリ不足で測定断念。産業用クラウドネイティブ [[時系列データベースベンチマーク]] の初の実証研究。(source / paper / database / time-series / cloud / industrial) - [[@2007__NSDI__X-Trace - A Pervasive Network Tracing Framework]] — [[Rodrigo Fonseca]]・[[George Porter]]・[[Randy H. Katz|Randy Katz]]・[[Scott Shenker]]・[[Ion Stoica]]([[University of California, Berkeley|UC Berkeley]] / [[ICSI]])、NSDI 2007。タスク識別子のインバンド伝搬 + レポートのアウトオブバンド収集の 2 原則と、pushDown()/pushNext() の 2 プリミティブで因果木を完全記述。クロスレイヤー・クロス管理ドメインの[[分散トレーシング]]を段階展開可能にする。[[Dapper]]・Zipkin・[[OpenTelemetry]] の直接の祖(source / paper / distributed / observability / tracing) - [[@2010__Google__Dapper - A Large-Scale Distributed Systems Tracing Infrastructure]] — [[Benjamin H. Sigelman]]・[[Luiz André Barroso]]・[[Mike Burrows]] ほか([[Google]])、2010。低オーバーヘッド + アプリ透過 + 偏在展開の 3 設計目標を共通ライブラリ計装 + 1/1024 適応サンプリングで両立、本番 2 年超稼働。スパン/トレース木/アノテーションのデータモデルが OpenTracing・W3C Trace Context・OpenTelemetry の事実上の標準を確立(source / paper / distributed / observability / tracing / google) - [[@2007__SIGCOMM__Towards Highly Reliable Enterprise Network Services via Inference of Multi-level Dependencies]] — [[Paramvir Bahl]]・[[Ranveer Chandra]]・[[Albert Greenberg]]・[[Srikanth Kandula]]・[[David Maltz]]・[[Ming Zhang (Microsoft Research)|Ming Zhang]]([[Microsoft Research]])、SIGCOMM 2007 (Sherlock)。Inference Graph(3 状態 up/troubled/down + 多層依存性) + Ferret 推論で 90.66% 障害箇所特定精度を達成、2 層 Shrink(58.61%) を 30% 上回る。Microsoft 本番 358 コンポーネントで 87% の障害が 16 コンポーネントに集中することを実証(source / paper / networking / aiops / fault-localization) - [[@2008__OSDI__Automating Network Application Dependency Discovery - Experiences, Limitations, and New Solutions]] — [[Xu Chen]]・[[Ming Zhang (Microsoft Research)|Ming Zhang]]・[[Z. Morley Mao]]・[[Paramvir Bahl]]([[University of Michigan]] / [[Microsoft Research]])、OSDI 2008 (Orion)。パケットヘッダ + タイミング情報のみ(ペイロード解析不要)で「遅延スパイクベース分析」により依存性発見。Sherlock 比偽陽性 10–95% 削減、eXpose 比 94–99% 削減(source / paper / networking / distributed / observability) - [[@2012__LISA__On the Accurate Identification of Network Service Dependencies in Distributed Systems]] — [[Barry Peddycord III]]・[[Peng Ning]]・[[Sushil Jajodia]]([[NC State University]] / [[George Mason University]])、LISA 2012。NSDMiner の比率→対数ベースランキング置換で偽陽性を大幅削減、利用頻度の低いサービスを類似クラスタから推論、LB/バックアップクラスタ自動検出で出力候補 25–50% 削減(source / paper / networking / distributed-systems / systems-administration) - [[@2017__arXiv__Sieve - Actionable Insights from Monitored Metrics in Microservices]] — [[Jörg Thalheim]] ほか([[TU Dresden]])、Middleware 2017 / arXiv:1709.06686。k-Shape クラスタリングでメトリクス次元 10–100 倍削減 + Granger 因果性によるコンポーネント間依存推定の 2 段プラットフォーム。OpenStack/ShareLatex 実装で CPU 80% / Storage 90% / Network 50% オーバーヘッド削減。マイクロサービス時代の因果ベース RCA の初期基盤(source / paper / aiops / microservices / monitoring / rca) - [[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]] — [[Minghua Ma]] ほか([[Sangfor Technologies]])、USENIX ATC 2021 (JumpStarter)。圧縮センシング + 形状ベースクラスタリング + 外れ値耐性サンプリングで訓練不要・20 分初期化の MTSAD を実現、3 データセット平均 F1=94.12% で SOTA を上回る。学習ベース MTSAD のコールドスタート問題への設計的回答(source / paper / aiops / anomaly-detection / time-series) - [[@1993__USENIX__The BSD Packet Filter A New Architecture for User-level Packet Capture]] — [[Steven McCanne]]・[[Van Jacobson]]([[Lawrence Berkeley National Laboratory]])、USENIX Winter 1993。[[BPF]] の一次ソース。ユーザー空間でパケットをコピーしてから filtering する CSPF に対し、カーネル内の小型レジスタベース VM + CFG ベース評価でカーネル側で先行フィルタリングする設計を提示し CSPF 比 20倍超高速化。`tcpdump`/`libpcap` の基盤、後の [[eBPF]] の直接の祖(source / paper / networking / observability / systems) - [[@2004__USENIX-ATC__Dynamic Instrumentation of Production Systems]] — [[Bryan Cantrill]]・[[Michael Shapiro]]・[[Adam Leventhal]]([[Sun Microsystems]])、USENIX ATC 2004。[[DTrace]] の一次ソース。プロダクション稼働中システムを統一的かつ絶対安全に動的計装する設計を初記述。**ゼロ・プローブ効果**(無効時は影響ゼロ)・D 言語・集約機構・投機的トレースの 4 技術が核。SunRay 上で gtik2_applet2 の GC 生成ループが X/OS に大量 mmap/munmap を誘発する性能問題を本番で初特定。現代 eBPF/perf/bpftrace の思想的先祖(source / paper / observability / instrumentation / systems) - [[@2018__SoCC__Weighted Sampling of Execution Traces - Capturing More Needles and Less Hay]] — [[Pedro Las-Casas]](UFMG)・[[Jonathan Mace]](MPI-SWS)・Dorgival O. Guedes(UFMG)・[[Rodrigo Fonseca]](Brown University)、SoCC 2018(DOI:10.1145/3267809.3267841)。分散トレースの均一ランダムサンプリングが頻出正常実行に予算を費やし稀少な異常・エラートレースを見逃す問題を定式化し、実行グラフのクラスタリングに基づく**重み付きサンプリング**(代表的サンプリング問題)で保存トレースの多様性を最大化。現代の[[トレースサンプリング]]研究(エッジサンプリング・カーディナリティ意識・SLO-aware sampling)の基盤(PDF 取得不可・abstract+メタデータのみで ingest、`confidence: medium`)(source / paper / distributed-tracing / sampling / observability) - [[@1992__CACM__Parallel Database Systems The Future of High Performance Database Systems]] — [[David DeWitt]]([[University of Wisconsin-Madison]])・[[Jim Gray]](DEC)、CACM 35(6):85–98、1992(DOI:10.1145/129888.129894)。[[並列データベース]] の基礎概念を体系化した古典マニフェスト。スピードアップ/スケールアップの 2 指標・startup/interference/skew の 3 脅威・シェアードメモリ/シェアードディスク/[[シェアードナッシング]]の 3 アーキテクチャ・[[データパーティショニング]](ラウンドロビン/ハッシュ/レンジ)・split/merge 演算子による並列化を定義。Teradata・Tandem・Gamma・Bubba を比較しシェアードナッシングが商業的勝者であることを実証。Grosch の法則の崩壊とコモディティ HW の台頭を論じた(source / paper / database / parallel / shared-nothing / CACM) - [[@2023__PVLDB__TSM-Bench - Benchmarking Time Series Database Systems for Monitoring Applications]] — [[Abdelouahab Khelifati]]・[[Mourad Khayati]]・Anton Dignös・[[Djellel Difallah]]([[NYU Abu Dhabi]])・[[Philippe Cudré-Mauroux]]([[University of Fribourg]] / [[eXascaleInfolab]])、PVLDB Vol.16, pp.3363–3376、2023。監視アプリケーション向け TSDB を最初に包括評価した[[時系列データベースベンチマーク]]。8 TSDB(InfluxDB・TimescaleDB ほか)× 7 クエリタイプ × TS-LSH 合成データ生成の評価基盤を構築。単一 TSDB が全ワークロードで最優秀になることはなく、ワークロード特性によって最適 TSDB が異なることを実証(source / paper / database / time-series / benchmark) - [[@2022__IPSJ JIP__Low Overhead TCP-UDP Socket-based Tracing for Discovering Network Services Dependencies]] — [[Yuuki Tsubouchi]]・[[Ryosuke Matsumoto]]・[[Masahiro Furukawa]]([[Hatena]])、IPSJ JIP Vol.30 pp.260-268、2022(DOI:10.2197/ipsjjip.30.260)。eBPF + Kprobes でエフェメラルポートをキーから除外しカーネル内でフローをバンドリングする **in-kernel flow bundling** 手法を提案。CPU オーバーヘッドを 2.2% 以下に抑える TCP/UDP ソケットベース [[ネットワーク依存性発見]]。実装: [[go-conntracer-bpf]](source / paper / observability / ebpf / networking / SRE) - [[@2022__PVLDB__Anomaly Detection in Time Series - A Comprehensive Evaluation]] — [[Sebastian Schmidl]]・[[Phillip Wenig]]・Thorsten Papenbrock([[Hasso Plattner Institute]] / University of Potsdam / Philipps University of Marburg)、PVLDB Vol.15, pp.1779–1797、2022(DOI:10.14778/3538598.3538602)。71 手法 × 976 データセットを網羅する[[時系列異常検知ベンチマーク]] **TimeEval** と合成[[時系列データ生成]]ツール [[GutenTAG]] を開発・公開。深層学習手法がコスト増に見合う精度優位を示せないこと、単一万能アルゴリズムが存在しないこと、DWT-MLEAD がコスト/性能比で最優秀(AUC-ROC 83%、2.2 ms/点)であることを実証(source / paper / anomaly-detection / time-series / benchmark) - [[@2022__arXiv__PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting]] — [[Hao Xue]]・[[Flora Salim]]([[University of New South Wales]])、arXiv:2210.08964 / 2022-10-17 (v5 2023-12-10) / 18p / IEEE TNNLS 掲載。時系列予測の入出力を自然言語文に変換し言語モデルで sentence-to-sentence に予測する **PromptCast** パラダイムを最初に提案。[[PISA]] データセット(311,932 件・気温/電力/人流)+ Bigbird/Bart/LED 等のベンチで数値専用 Transformer/Informer/Autoformer と同等以上、ゼロショット汎化は数値モデルを大幅超過。GPT-3.5 はゼロショット精度が数値モデルより劣りコスト過大。LLM×時系列の最初期ベンチマーク(source / paper / time-series / llm) - [[@2023__NeurIPS__Large Language Models Are Zero-Shot Time Series Forecasters]] — [[Nate Gruver]]・[[Marc Finzi]]・[[Shikai Qiu]]([[New York University]])・[[Andrew Gordon Wilson]]([[New York University]] / [[Carnegie Mellon University]] 訪問)、NeurIPS 2023 / arXiv:2310.07820 / 30p。数値を桁列としてエンコードする [[LLMTime]] で GPT-3・LLaMA-2 70B がゼロショット時系列予測で ARIMA/TCN/N-HiTS と同等以上(Darts/Monash/Informer 29 データセット)。LLM の簡潔性バイアス + 反復バイアスが季節性・トレンドの構造と一致。GPT-4 は RLHF + トークン化変更で GPT-3 より悪化——アライメントが不確実性較正を壊す現象を初めて定量化(source / paper / time-series / llm / zero-shot) - [[@2023__NeurIPS__One Fits All - Power General Time Series Analysis by Pretrained LM]] — [[Tian Zhou]]・[[Rong Jin]]・[[Liang Sun]] ほか [[Alibaba DAMO Academy]]、NeurIPS 2023 / arXiv:2302.11939 / 34p。GPT-2 の self-attention・feedforward 凍結 + 位置埋め込みのみ学習する [[Frozen Pretrained Transformer]](FPT)で時系列 7 タスク SOTA(学習可能パラメータ 4.6〜6.12%、TimesNet 比計算優位)。**画像事前学習(BEiT)からの転移も有効**で言語→時系列に限らない汎ドメイン転移を実証、self-attention の勾配最小化が PCA と等価という理論的根拠を提示(source / paper / time-series / llm / transfer-learning) - [[@2024__arXiv__A Decoder-Only Foundation Model for Time-Series Forecasting]] — [[Abhimanyu Das]]・Weihao Kong・[[Rajat Sen]]・Yichen Zhou([[Google Research]])、arXiv:2310.10688 / 2023-10-16 / 21p / ICML 2024。**[[TimesFM]]** の原論文。decoder-only Transformer + パッチ入力 + 出力パッチ長 > 入力パッチ長(自己回帰ステップ削減・可変ホライズン対応)を組み合わせた 200M モデルを Google Trends 約 0.5B 点 + Wikipedia ページビュー 約 300B 点 + 合成データの計約 100B 点で事前学習。Monash/Darts/ETT で教師あり SOTA(PatchTST/N-BEATS/DeepAR)にゼロショットで肉薄。17M/70M/200M で FLOPS に対し誤差単調減少し TSFM スケーリング則の前史を成す(source / paper / time-series / foundation-model / scaling) - [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]] — [[Zhen Liu]]・[[Qianli Ma]]・[[Min Wu]] ほか([[South China University of Technology]] / [[Institute for Infocomm Research]] / [[Tianjin University]])、techRxiv プレプリント(DOI:10.36227/techrxiv.176978429.90235801/v2、24p、2026-02-11)。TSFM を「データセット — 事前学習 — 事後学習」の 3 次元タクソノミーで体系化した初の包括サーベイ。事後学習を SFT・協調(PLC: LoRA/Adapter、MLC: CLIP 流多モーダル、HLC: KD)・強化(reasoning-driven GRPO / non-reasoning PPO・DPO)の 3 パラダイムで整理。Table I で既存 7 サーベイとの比較、Table III-VI で 33 ソースデータセット・33 既存 TSFM・ターゲットデータセット・事後学習比較表を提供(source / paper / time-series / foundation-models / post-training / survey) - [[@2024__arXiv__AIOps Solutions for Incident Management]] — [[Youcef Remil]]・[[Anes Bendimerad]]・[[Romain Mathonat]]・[[Mehdi Kaytoue]]([[University of Lyon]] / [[INSA Lyon]] / [[CNRS]] UMR 5205 / [[Infologic]])、arXiv:2404.01363 (cs.OS, 2024-04-01, 82p, DOI:10.48550/arXiv.2404.01363)。AIOps for incident management の包括的サーベイ。6 能力モデル(Perception/Prevention/Detection/Location/Action/Interaction)と 4 フェーズ × 9 タスク手続き(reporting{Detection,Prediction} → triage{Prioritization,Assignment,Classification,Deduplication} → diagnosis{RCA,Correlation} → mitigation)を導入し、classification・deduplication・correlation を独立タスクとして明示。8 種データソース・4 層 Maintenance Strata(Technical/Application/Functional/Business)・9 軸 taxonomy・6 項目 desiderata(interpretability の internal/external/time 3 軸、in-context evaluation の contamination zone 注意)・40+ 件の公開データセット compendium を提示。Notaro+ 2021 の prevention 10.6% / remediation 2.5% 偏りを別データで再確認しつつ、pattern mining 等の descriptive 模型を predictive 模型の対等な相棒として推奨する独自の方向性(source / paper / aiops / survey / incident-management) - [[@2026__FSE__Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems]] — [[Fiza Husain]]・[[Anson Bastos]]・[[Anjaly Parayil]]・[[Ayush Choure]]・[[Chetan Bansal]]・[[Rujia Wang]]・[[Saravan Rajmohan]]([[Microsoft]])、FSE 2026 industry track(arXiv:2510.20640、12p)。Microsoft 本番のクラウドモニタにおける「ディメンション部分集合推薦」を、モニタ・メトリクス・ディメンションのヘテロジニアスグラフ上のランキング問題として定式化。マルチヘッド注意 HGNN にランダムウォーク経路注意(RWA)と注意ヘッド整列損失を加えた [[@2026__FSE__Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems|DiRecGNN]] を提案し、SAGEConv 等の最良ベースラインに対し HR@1 +55.8%・MRR +43.1%。10 名サービスオーナー有用性 4.5/5。[[@2024__ICSE-SEIP__Intelligent Monitoring Framework for Cloud Services - A Data-Driven Approach]] のメトリクス選定の続編(source / paper / aiops / cloud-monitoring / graph-neural-network / recommendation) - [[@2024__USENIX ATC__SuperBench - Improving Cloud AI Infrastructure Reliability with Proactive Validation]] — [[Yifan Xiong]] ほか17名([[Microsoft Research]] / [[Microsoft]])、USENIX ATC '24 Best Paper(17p)。AI クラウドのハードウェア冗長が生む「グレイ障害」を Azure A100 実データで定量化し、Cox-Time 生存解析 + CDF 類似度クラスタリング + 貪欲ベンチマーク選択からなるプロアクティブ検証システム [[SuperBench]] を提案。シミュレーションで MTBI 22.61×、Azure 本番 2 年で 10.36% のノードを欠陥除外。microsoft/superbenchmark で OSS(source / paper / reliability / aiops / gpu) - [[@2024__NSDI__Characterization of Large Language Model Development in the Datacenter]] — [[Qinghao Hu]] ほか([[Shanghai AI Laboratory]] / [[Nanyang Technological University]] / [[Peking University]] / [[Shanghai Jiao Tong University]] / [[SenseTime Research]] / [[The Chinese University of Hong Kong]])、NSDI '24 (22p)。[[Acme]] 4,704 A100 の 6 か月本番トレース。GPU ジョブ中央値 2 分・利用率 0/100% 二極化・Pretraining が件数 0.9〜3.2% で GPU 時間 69.5〜94.0%・Infrastructure 障害が件数 11%・GPU 時間 82%超。観測ベースで [[InternEvo]] に Fault-tolerant Pretraining(async checkpointing 3.6〜58.7×、Log Agent + Failure Agent + Vector Store + 2 段階 NCCL allgather)と Decoupled Scheduling for Evaluation(makespan 1.3〜1.8×)を実装、[[AcmeTrace]] を公開(source / paper / machine-learning-systems / distributed / aiops) - [[@2021__J Grid Computing__Automated Analysis of Distributed Tracing - Challenges and Research Directions]] — [[Andre Bento]]・[[Jaime Correia]]・[[Ricardo Filipe]]・[[Filipe Araujo]]・[[Jorge Cardoso]]([[University of Coimbra]] / [[Huawei Munich Research Center]])による Journal of Grid Computing Vol.19 Article 9(2021、DOI:10.1007/s10723-021-09551-5、15p)。OpenTracing 準拠データから [[OpenTracing Processor]] で service metrics・dependency graph・work-flow を抽出し、Isolation Forest で異常時間枠/サービスを検知。Huawei Cloud OpenStack 本番トレース 2 日分(190K–240K spans/日)で実証する一方、ゲートウェイ計装欠落で深掘りが頓挫し「精緻なアルゴリズムよりトレース品質改善が先」と診断。temporal coverage 指標と OpenTracing 仕様の 3 類型限界(data sufficiency / ontological / tools)を提示。後継 OpenTelemetry も「testability driver の再設計が薄い」と批判(source / paper / distributed-tracing / observability / aiops) - [[A Survey of Online Failure Prediction Methods]] — [[Felix Salfner]]・[[Maren Lenk]]・[[Miroslaw Malek]]([[Humboldt University of Berlin]])、ACM Computing Surveys Vol.42 No.3 Article 10、2010-03、42p、DOI:10.1145/1670679.1670680。オンライン障害予測を 4 主要枝(failure tracking / symptom monitoring / detected error reporting / undetected error auditing) × 26 サブカテゴリの taxonomy で約 50 手法を整理する古典サーベイ。fault/error/symptom/failure の 5 段階モデル(Avižienis 2004 の symptom 追加拡張)、(`t_d, t_l, t_p, t_w`) 4 パラメータでの時間軸定式化、稀事象向け評価指標(precision/recall, F-measure, ROC/AUC)、proactive fault management の 4 段階(予測 → 診断 → スケジューリング → 実行)を標準化(source / paper / dependability / aiops / failure-prediction / survey) - [[@2019__TCC__Cloud Container Technologies - A State-of-the-Art Review]] — [[Claus Pahl]]・[[Antonio Brogi]]・[[Jacopo Soldani]]・[[Pooyan Jamshidi]]([[Free University of Bozen-Bolzano]] / [[University of Pisa]] / [[Carnegie Mellon University]])による IEEE Transactions on Cloud Computing 2019 論文(DOI:10.1109/TCC.2017.2702586、16p)。2007-2016 のクラウドコンテナとオーケストレーション研究を 46 件 primary studies で体系的にマッピング(SMS)した初の secondary study。Technology Stack・Management Services・Architecture Setting・Tools/Platforms/Technology の 4 軸分類フレームワークを構築。[[Docker]]・[[LXC]] が支配的、[[Kubernetes]] 等が次点。Solution proposal 中心の formative stage で IaaS/PaaS がほぼ均等、デプロイ容易性が動機の主、品質関心は performance/resource utilisation/startup time/elasticity に集中。Borg の限界として障害管理(failure management)を未開拓と明示(source / paper / cloud / container / orchestration / systematic-mapping) - [[A Survey of AIOps Methods for Failure Management]] — [[Paolo Notaro]]・[[Jorge Cardoso]]・[[Michael Gerndt]]([[TU Munich]] / [[Huawei Munich Research Center]] / [[University of Coimbra]]) による ACM TIST 2021 サーベイ(DOI:10.1145/3483424、45p)。AIOps の Failure Management を proactive/reactive × 5 カテゴリ・14 サブカテゴリで 100 件整理。detection 33.7% / RCA 26.7% / online prediction 26.4% に対し prevention 10.6%・remediation 2.5% という研究密度の偏りを定量化し、マルチモーダル化・recovery 自動化・標準ベンチマーク確立を将来課題に挙げる(source / paper / aiops / survey) - [[@2018__TNSM__Mining Causality of Network Events in Log Data]] — [[Satoru Kobayashi]]・[[Kazuki Otomo]]・[[Kensuke Fukuda]]・[[Hiroshi Esaki]]([[University of Tokyo]] / [[National Institute of Informatics]])、TNSM 2018。[[SINET4]] の 456 日・35M 件 syslog に PC アルゴリズム + G-square 検定を適用した因果マイニング。フーリエ+線形回帰の周期フィルタが 93% を除去、後処理でトラブルチケット 74% 対応のエッジを 5.3 エッジ/日に絞る(source / paper / network / log-analysis / causal-inference) - [[@2022__KDD__Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition]] — [[Mingjie Li]]・[[Dan Pei]] ほか([[Tsinghua University]] / BizSeer)、KDD 2022(DOI:10.1145/3534678.3539041)。Pearl の Causal Hierarchy 第 2 層「介入認識(IR)」タスクとして RCA を初めて定式化(Theorem 3.4)し、構造グラフ + 回帰仮説検定(RHT) + 子孫調整からなる [[CIRCA]] を提案。Oracle DB 99 件で AC@1=0.404(ベースライン +25%)・分析 0.578s(source / paper / aiops / rca / causal-inference) - [[@2022__NeurIPS__Root Cause Analysis of Failures in Microservices through Causal Discovery]] — [[Azam Ikram]]・[[Saurabh Bagchi]]・[[Murat Kocaoglu]]([[Purdue University]])・[[Sarthak Chakraborty]] ほか([[Adobe Research]])、NeurIPS 2022。マイクロサービス障害を soft intervention としてモデル化し、F-NODE 近傍局所学習 + 階層分割統治 Ψ-PC からなる [[RCD]] を提案。コールグラフ不要、合成 100 ノード top-1 98% / 500 ノード 22 秒、Sock Shop・AWS 本番 3 障害で実証(source / paper / aiops / rca / causal-inference / microservices) - [[@2024__EuroSys__Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]] — [[Yinfang Chen]] ほか([[Microsoft]] / UIUC / PKU / HUST / NUS)、EuroSys 2024(DOI:10.1145/3627703.3629553、arXiv:2305.15778)。LLM 強化オンコールシステム [[RCACopilot]]。アラート種別ハンドラ(DAG)で多種ソース診断情報を収集 → GPT-4 で要約 → FastText + 時間重み付き k-NN + few-shot CoT で根本原因カテゴリ予測。Microsoft Transport 1 年で Micro-F1=0.766。30 超チーム・4 年以上の本番稼働。情報スペクトラム問題(過多/不足の両端で性能低下)を実証(source / paper / aiops / rca / llm / incident-management / production) - [[@2022__ISSRE__Going through the Life Cycle of Faults in Clouds - Guidelines on Fault Handling]] — [[Xiaoyun Li]]・[[Guangba Yu]](共同第一著者)・[[Hongyang Chen]]・[[Zhekang Chen]]・[[Pengfei Chen]](責任著者)([[Sun Yat-sen University]] / [[Bizseer]])、ISSRE 2022、IEEEXplore 9978764。三大クラウド 354 件ポストモーテム分析によるクラウド障害ライフサイクル(TTD/TTI/TTM/TTR)の初の一貫実測。TTM=54.1 分(中央値)・MTTM=304.2 分が TTR の 53% を支配。設定ミスが最多根本原因(31.6%)、9 種緩和手段分布を定量化(source / paper / cloud-reliability / empirical-study) - [[@2011__SRDS__Identifying Faults in Large-Scale Distributed Systems by Filtering Noisy Error Logs]] — [[Xiang Rao]]・[[Huaimin Wang]] ほか([[National University of Defense Technology]] / [[Alibaba Cloud]])による IEEE 2011 論文。障害注入テスト中のノイズ障害 4 種類が障害特徴抽出を誤導することを定量化し、Haar ウェーブレット + DTW 類似度ベースのフィルタリング手法 SBF を提案。100 ノードクラスタ・280 万ログで適合率 96%・再現率 94% 達成(source / paper / log-analysis / distributed) - [[@2020__SoCC__ByteSeries - An In-Memory Time Series Database for Large-Scale Monitoring Systems]] — [[Xuanhua Shi]] ほか(HUST / [[ByteDance]] / [[National University of Singapore]] / [[University of Copenhagen]])による SoCC 2020 論文。ByteDance 本番監視 100 億次元超でメタデータがメモリ 80% 超を占める問題を解析し、Compressed Inverted Index(trie + p4nzenc64)と 3 段メモリ構造を持つ[[ByteSeries]]を提案。元本番 TSDB [[tsdc]] 比でメタデータ −60%・全体メモリ −50%・多次元クエリ 1.8〜10.7 倍高速化(source / paper / time-series) - [[@2020__SAC__Black-box inter-application traffic monitoring for adaptive container placement]] — [[Francisco Neves]]・[[Ricardo Vilaça]]・[[José Pereira]]([[HASLab]]-INESC TEC / [[University of Minho]])による SAC 2020 論文。eBPF KernelAgg で 9% 未満のオーバーヘッドで重み付き通信グラフを構築し、Cassandra+Spark の[[コンテナ配置最適化]]に適用。Q1 手動配置で −99.3% 転送量削減・−12% 実行時間短縮(source / paper / distributed / ebpf) - [[@2025__SIGMOD__B-Trees Are Back - Engineering Fast and Pageable Node Layouts]] — [[Marcus Müller]]・[[Lawrence Benson]]・[[Viktor Leis]]([[TU Munich]])による SIGMOD/PACMMOD 2025 論文。可変長レコードを支援する可ページング [[B-Tree]] で、6 種のノードレイアウト最適化と適応 leaf layout を評価。FDL は dense integer で lookup +71%・insert +213%・scan +105%、[[vmcache]] 統合で out-of-memory でも baseline を上回る場合がある。(source / paper / database) - [[@2025__SIGMOD__Rethinking The Compaction Policies in LSM-trees]] — [[Hengrui Wang]] ほか [[Tsinghua University]] による SIGMOD/PACMMOD 2025 論文。LSM ツリーのコンパクションを将来の平均クエリスループットへの CPU/I/O 投資として捉え直し、三レベルモデルと動的計画法ベースの [[EcoTune]] を提案。[[RocksDB]] 評価で Leveling 比 1.5〜3 倍、Lazy Leveling 比最大 1.8 倍の平均クエリスループットを達成(source / paper) - [[@2025__arXiv__Humanity's Last Exam]] — [[Long Phan]]・[[Dan Hendrycks]] ほか [[Center for AI Safety]] / [[Scale AI]] による arXiv 2025 論文(arXiv:2501.14249)。飽和した既存ベンチマーク(MMLU 等)を超える最前線学術ベンチマーク HLE を提案。50 か国・500+ 機関・約 1,000 名の専門家が 100+ 科目・2,500 問を設計。最先端モデルでも正解率 13.4% 以下・RMS キャリブレーション誤差 73〜89%(source / paper) - [[@2023__CNCF TAG Observability__Observability Whitepaper]] — [[CNCF]] [[TAG Observability]] が策定したクラウドネイティブオブザーバビリティのホワイトペーパー(v1.0、2023)。5 シグナル・シグナル間相関・SLO ベースバーンレートアラート・エコシステムギャップ 4 点を体系化。[[OpenTelemetry]] を業界標準として位置づける(source / whitepaper) - [[@2026__OTelBlog__OTel-Arrow-Phase-2]] — [[OTel-Arrow]] SIG、2026。[[OTAP]] が単一コアで [[OpenTelemetry|OTLP]] 比 20× スループット。[[OTel-Arrow Dataflow Engine]](Rust、incubation-stage)で Arrow をパイプライン内部表現として採用(source / article / observability / opentelemetry) - [[@2026__OTelDocs__OBI - OpenTelemetry eBPF Instrumentation]] — [[OpenTelemetry]] サブプロジェクト。[[eBPF]] プローブで 9 言語 × 8 プロトコル × 6 DB をアプリケーション変更なしにトレース・メトリクス収集。GenAI プロバイダ(OpenAI・Anthropic・Gemini・Bedrock・Qwen)の[[ゼロコード計装]]も提供(source / article / observability / ebpf / opentelemetry) - [[@2026__OTelBlog__OBI HTTP Header Enrichment]] — [[OBI]] v0.7.0。HTTP ヘッダエンリッチメントでスパンにテナント ID 等のリクエストコンテキストを設定変更のみで付与。インシデント対応時の影響範囲特定を高速化(source / article / observability / ebpf / opentelemetry) - [[@2026__OTelBlog__GenAI Observability with OpenTelemetry]] — [[OpenTelemetry]] セマンティック規約で GenAI 操作(`invoke_agent` → `chat` / `execute_tool`)を標準化。VS Code Copilot・OpenAI Codex・Claude Code が OTel テレメトリを送出。`gen_ai.client.operation.duration` と `gen_ai.client.token.usage` でコスト推定・レイテンシ監視(source / article / observability / genai / opentelemetry) - [[@2026__OTelBlog__OTel Collector Follow-up Survey]] — End User SIG 2025 年調査。65% が 10 台超の Collector を本番運用(+10%)、VM 51%(+18%)でハイブリッド化進行。46% がカスタムビルド、設定管理(63%)と安定性(52%)が最優先改善領域(source / article / observability / opentelemetry) - [[@2026__OTelBlog__Japanese Community Survey]] — 日本の OTel コミュニティ調査。61% が本番運用、NPS +49。トレースが 93% で最多シグナル(メトリクス首位の国際パターンと乖離)。Go のエバリュエーション→プロダクション移行率が最大(source / article / observability / opentelemetry) - [[@2026__OTelBlog__Log Deduplication Processor]] — [[OpenTelemetry]] Collector のログ重複排除プロセッサ。ハッシュベースで同一ログを集約し `log_count` と時間範囲を保持。サンプリングと異なりデータを破棄しない。OTTL 式で条件指定可能(source / article / observability / opentelemetry) - Entities: [[OBI]] - Concepts: [[ゼロコード計装]], [[GenAI オブザーバビリティ]], [[ログ重複排除]] - [[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling]] — [[Tom Henighan]]・[[Jared Kaplan]] ほか [[OpenAI]] による arXiv 2020 論文。スケーリング則 $L(x) = L_\infty + (x_0/x)^{\alpha_x}$ が画像・動画・マルチモーダル・数学的問題求解に成立し、最適モデルサイズの指数 $\beta \approx 0.7$ が全モダリティで普遍的に一定であることを実証(source / paper) - [[@2022__NeurIPS__Chain-of-Thought Prompting Elicits Reasoning in Large Language Models]] — [[Jason Wei]]・[[Denny Zhou]] ほか([[Google Brain]])による NeurIPS 2022 論文。プロンプト例示に連鎖思考ステップを加えるだけで PaLM 540B が GSM8K SOTA を達成。約 100B パラメータ以上の創発的能力として同定(source / paper) - [[@2020__arXiv__Scaling Laws for Neural Language Models]] — [[Jared Kaplan]]・Sam McCandlish ほか [[OpenAI]] による arXiv 2020 論文。Transformer 言語モデルの損失がモデルパラメータ数・データ量・計算量に対してべき乗則でスケールすることを 7 桁以上で実証。$N_{\text{opt}} \propto C^{0.73}$、$D_{\text{opt}} \propto C^{0.27}$(アーキテクチャ詳細への弱依存性も定量化)(source / paper) - [[@2024__arXiv__DeepSeekMath - Pushing the Limits of Mathematical Reasoning in Open Language Models]] — [[DeepSeek-AI]] / [[Tsinghua University]] / [[Peking University]] による arXiv 2024 論文。DeepSeekMath 7B を提案し、外部ツールなしで MATH 51.7%・Self-consistency 60.9% を達成。120B 数学トークンの fastText 反復収集コーパスと [[GRPO]](Group Relative Policy Optimization)を初提案。価値モデル廃止によるメモリ削減と 7B で Minerva 540B 超の効率を示す(source / paper) - [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]] — [[Daemyung Kang]] ほか [[Lablup Inc]] による arXiv 2026 / Lablup Technical Report。63 ノード・504 NVIDIA B200 GPU の本番クラスタで、55 日の Prometheus 時系列、73 日の運用ログ、224 セッションを分析。単一支配メトリクスなし、NFS/RPC queue time、ノード除外集中、自動リトライ成功率 33.3% を報告(source / paper) - [[@2023__NSDI__Empowering Azure Storage with RDMA]] — [[Wei Bai]] ほか [[Microsoft]] による NSDI 2023 論文。[[Azure Storage]] のフロントエンド/バックエンド通信を [[RDMA]] 化し、RoCEv2、PFC/DCQCN、[[SONiC]]、[[RDMA Estats]] を組み合わせてリージョン内規模で展開した経験を報告(source / paper) - [[@2024__ASE__Root Cause Analysis for Microservices based on Causal Inference - How Far Are We]] — [[Luan Pham]]・[[Huong Ha]]([[RMIT University]])・[[Hongyu Zhang]]([[Chongqing University]])による ASE 2024 論文。PC/FCI/LiNGAM/Granger 等 9 種の因果探索アルゴリズムと 21 種の因果推論ベース RCA 手法を包括評価。Dummy ベースラインを初めて導入し、多くの手法が Dummy 同等と判明。BARO・CausalRCA・RCD・CIRCA・NSigma が最良。評価フレームワーク [[RCAEval]] をオープンソース公開(source / paper) - [[Anomaly detection and root-cause identification in microservices]] — 2012〜2025 年のマイクロサービス異常検知・根本原因特定研究を、データ収集・検知手法・RCA 手法・評価指標・テストベッド/データセット・Trusted Distributed AI の軸で整理する [[Cluster Computing]] 2026 サーベイ。117 研究を対象に、ログ/トレース/監視メトリクスと機械学習/グラフ/統計手法の地図を与える(source / paper) - [[@2024__CIKM__RCAgent - Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models]] — [[Zefan Wang]] ほかによる CIKM 2024 論文。[[Alibaba Cloud]] の Apache Flink RCA を対象に、社内配置 LLM とツール拡張自律エージェント [[RCAgent]] を提案。OBSK、専門エージェント、JsonRegen、TSC により ReAct を上回り、OoD ジョブ診断に統合(source / paper) - [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]] — [[Vaishali Vinay]]([[Microsoft]] Security Research)による IEEE CAI 2026 論文。LLM アプリケーションの隠れた失敗を、推論・入力/コンテキスト・システム/運用の 3 層 15 種に分類し、静的ベンチマークが安定性・再現性・ドリフト・ワークフロー統合を測れない評価ギャップと、入力正規化・検証レイヤー・意味的オブザーバビリティ・コスト統制の必要性を整理(source / paper) - [[VictoriaMetrics-KubeCon-EU-2026-Sampling|@2026__VictoriaMetrics Blog__KubeCon EU 2026 Retroactive Sampling]] — [[Zhu Jiekun]]([[VictoriaMetrics]])が KubeCon EU 2026 で発表したレトロアクティブサンプリング。最小属性(33 バイト)のみ中央コレクタへ送りエッジでオンディスク FIFO バッファリング。テールサンプリング比 CPU/メモリ 60–70% 削減。[[VictoriaTraces]] vtagent に 2026 下半期統合予定(source / article) - [[@2026__Glenn K. Lockwood Blog__AI doesnt need giant supercomputers after all]] — [[Glenn K. Lockwood]](元 Microsoft、現 [[VAST Data]])の 2026-05-08 ブログ記事。超大規模 AI 訓練クラスタへの懐疑論。OpenAI の超大規模モデルが GPT-4o 比 15 倍のトークン単価で経済破綻・非推奨化された経緯を論じ、「賢さ vs 規模」パラダイム転換と[[Microsoft Fairwater]]・[[AWS Rainier]]の残存価値を整理(source / article) - [[@2023__CSUR__Optimization Techniques for GPU Programming]] — [[Pieter Hijma]] ほか [[Vrije Universiteit Amsterdam]]・[[Netherlands eScience Center]]、ACM Computing Surveys 2023。450 本の GPU 最適化論文を 4 テーマ・28 技術に体系化。コアレスドアクセス・専用メモリ・分岐発散削減・auto-tuning が採用頻度トップ 4(source) - [[@2025__Anthropic Engineering Blog__A Postmortem of Three Recent Issues]] — [[Anthropic]] による 2025 年 8〜9 月の 3 件の本番 LLM インフラ障害(ルーティングエラー・TPU 出力破壊・XLA:TPU コンパイラバグ)のポストモーテム。評価カバレッジ問題とプライバシー vs 可観測性のトレードオフを明示(source) - [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]] — [[Ravi Sharma]] による [[OpenAI]] 研究解説(2026-05-28)。[[MRC]]・[[マルチプレーンClosトポロジ]]・[[SRv6]] で 10 万 GPU 超の訓練継続性を実現する「検知・回避・回復」アーキテクチャを解説(source) - [[@2026__arXiv__Bian Que - An Agentic Framework with Flexible Skill Arrangement for Online System Operations]] — [[Bochao Liu]] ほか [[Kuaishou Technology]] による arXiv 2026。統一運用パラダイム・[[Flexible Skill Arrangement]]・統一自己進化メカニズム。KuaiShou 6 ヶ月本番でアラート量 75% 削減・RCA 精度 80%・pass@5 = 99.0% - [[@2008__SIGMOD__OLTP through the looking glass, and what we found there]] — [[Stavros Harizopoulos]](HP Labs)・[[Daniel J. Abadi]](Yale)・[[Samuel Madden]](MIT)・[[Michael Stonebraker]](MIT)、SIGMOD 2008。Shore RDBMS を TPC-C で段階的改変し 4 コンポーネントの命令数内訳を精密計測。全除去で 640→12,700 TPS(約 20 倍)、「高い杭なし」を定量化 - [[@2024__yuuk.io__SRE-NEXT-2024]] — [[Yuuki Tsubouchi]] の SRE NEXT 2024 登壇報告。「工学としてのSRE再訪」で技芸から工学への転換フレームワークと6つのSREオープンチャレンジを提示。ベストスピーカー賞受賞 - [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]] — [[Meta]] の RSC-1/RSC-2 の大規模 ML 研究クラスタ信頼性分析。11 か月・4 百万ジョブ・1.5 億超 A100 GPU 時間、MTTF の GPU 数反比例、ETTR 推定式、レモンノード検知、InfiniBand 適応ルーティングを提示(HPCA 2025, DOI:10.1109/HPCA61900.2025.00096) - [[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]] — Microsoft のマルチテナント GPU 訓練クラスタ [[Philly]] の 75 日・96,260 ジョブの本番トレース分析。ギャングスケジューリング、局所性制約、fragmentation delay、GPU 利用率平均 52.32%、失敗ジョブの GPU 時間浪費を定量化(USENIX ATC 2019) - [[@2025__さくらのナレッジ__分散推論基盤やその前提の考え方]] — [[道下幹也]]([[SAKURA internet Inc]])による LLM 分散推論基盤連載 vol.1。性能指標体系(TTFT/ITL/TPOT/E2EL/TPS/RPS/Goodput)、KV Cache 中心設計、バッチ戦略 4 種、PD 分離の利点・欠点・KV Cache 転送ボトルネック(さくらのナレッジ 2025-11-11) - [[@2025__さくらのナレッジ__分散推論基盤の基礎技術]] — 連載 vol.2。Scale Up/Out Network、GPUDirect RDMA(PeerDirect vs dma-buf)、UCX/NIXL のアーキテクチャ、H100 HGX × 2 台で NIXL ベンチマーク(NVLink 400GB/s 達成、リモート 50GB/s=物理帯域上限に収束)(さくらのナレッジ 2025-12-23) - [[@2026__さくらのナレッジ__高火力PHYを利用した分散推論基盤の性能検証]] — 連載 vol.3。PD 分離の実測(vLLM+LMCache+NIXL、H100 HGX、gpt-oss-120b)。入力 8k で 32 並列 ITL P99<30ms(Aggregated >100ms)、入力 1k では Aggregated が同等以上。メリットはワークロード依存(さくらのナレッジ 2026-03-25) - [[@2026__Zenn__MLエンジニアのための本質から理解するLLM推論]] — [[Kazuki Fujii]]([[東京科学大学]])による LLM 推論ベンチマーク入門。ISL/OSL/TTFT/ITL/TPS 定義体系、ツール間の ITL 定義差異、「計算内容の本質的理解が不可欠」(Zenn 2026-05-30) - [[@2025__NVIDIA__LLM-Inference-Benchmarking-Fundamental-Concepts]] — [[NVIDIA]] によるLLM 推論ベンチマーク基礎解説。ユースケース別 ISL/OSL プロファイル(翻訳/生成/要約/推論)、[[GenAI-Perf]] vs LLMPerf のメトリクス計算差異、ロードテストとパフォーマンスベンチマークの区別(NVIDIA Developer Blog 2025-04-02) - [[@2026__arXiv__A Microservice-Based Platform for Sustainable and Intelligent SLO Fulfilment and Service Management]] — TU Wien の [[Juan Luis Herrera]] らによるカーボン認識 SLO 充足プラットフォーム [[CASCA]]。MSA 原則 + EMMa マイクロサービスでカーボンフットプリントを報酬に組み込み、宣言的設定管理で命令的手法比 -53.7 秒(arXiv:2602.12875, 2026) - [[@2024__SOSE__Diffusing High-level SLO in Microservice Pipelines]] — TU Wien の [[Boris Sedlak]] らによるベイズネットワーク SLO 拡散方法論。高レベル SLO を自動的に低レベルへ分解、充足率 83〜100%(IEEE SOSE 2024) - [[@2020__NSDI__Meaningful Availability]] — Google の [[Tamás Hauer]] らによるウィンドウ付きユーザーアップタイム。有意義性・比例性・実用性の三要件を同時に満たす初の可用性指標、G Suite 本番で評価・展開(NSDI 2020) - [[@2019__HotOS__Nines are Not Enough - Meaningful Metrics for Clouds]] — Google の [[Jeffrey C. Mogul]]・[[John Wilkes]] による SLE/CBE 枠組み。ナイン表現の限界を指摘し法律家的思考から統計家的思考への転換を提唱(HotOS 2019) - [[@2017__HotOS__Thinking about Availability in Large Service Infrastructures]] — Google の [[Jeffrey C. Mogul]] らによる可用性のセキュリティ的思考。スレットモデリング・深層防御・フェイルスタティック設計を提唱(HotOS 2017) - [[@2024__MSR__FLASH - A Workflow Automation Agent for Diagnosing Recurring Incidents]] — ステータス監視と hindsight 統合で反復インシデント診断を自動化する Microsoft の LLM ワークフローエージェント [[FLASH]]。本番 250 件・5 シナリオで [[TaskWeaver]] 比 +13.2%、TSG 品質(Ambiguous Action 約 40%・Pass 約 8.5%)が律速と定量化([[TSG自動化]] の中心、Microsoft Research 2024) - [[@2025__arXiv__StepFly - Agentic Troubleshooting Guide Automation for Incident Diagnosis]] — TSG 自動化の 3 段エージェント型フレームワーク [[StepFly]]([[TSG Mentor]] で品質改善 / オフライン DAG+QPP 抽出 / オンライン並列 scheduler-executor)。92 TSG 実証、GPT-4.1 約 94%・実行時間 32.9〜70.4% 削減(Tsinghua×Microsoft、arXiv:2510.10074) - [[@2024__OSR__LLexus - an AI agent system for incident management]] — LLM を計画フェーズに前置し TSG を BPMN 風フローチャートへコンパイル、実行時は [[Azure Durable Functions]] で決定論的に実行する Microsoft のインシデント管理エージェント [[LLexus]]。計画は 1 TSG あたり $0.60〜$1.71 の一回払い(ACM SIGOPS OSR 2024, DOI:10.1145/3689051.3689056) - [[@2026__arXiv__Large Language Models for Agentic NetOps and AIOps - Architectures, Evaluation, and Safety]] — agentic [[NetOps]]/AIOps の信頼性はモデルでなくモデル周辺機構(typed tool interface・provenance retrieval・budget/stopping rule・least-privilege・書き込み境界の verification gate)から来ると、autonomy hierarchy/tool scope/evidence trace/[[エージェント運用安全性|assurance contract]] の 4 軸で文献統合するサーベイ(Bilal+, arXiv:2605.12729, 2026) - [[LLM4Log]] — LLM ベースログ解析の初のエンドツーエンド systematic review。ログ生成→パース→表現→下流(異常検知/障害予測/RCA/要約)で 145 論文(2020–2025)をタクソノミー化、5 設計パターンと評価ギャップを横断分析(Concordia SPEAR lab、arXiv:2604.16359, 2026) - [[@2025__arXiv__Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents]] — IaC drift 修復のエージェントシステム NSync(UMich/AWS、arXiv:2510.20211, 2025) - [[@2025__AIOps__Automated Lifting for Cloud Infrastructure-as-Code Programs]] — IaC lifting のニューロシンボリック手法 Lilac のビジョン論文(UMich/UCSD、AIOps 2025 / ICSE workshop) - [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] — MLSys 2025(arXiv:2501.06706) - [[@2026__arXiv__SREGym - A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios]] — arXiv:2605.07161(2026) - [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]] — 自律 SRE マルチエージェント + 安全仕様 TNR を形式化(PDF 本文取り込み済み、NeurIPS 2025, arXiv:2506.02009) - [[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]] — SRE/CISO/FinOps 3 ペルソナ 102 シナリオの IT 自動化ベンチマーク。SOTA でも SRE 11.4%・Hard 緩和 0%・トレース除去で診断急落(IBM/UIUC、ICML 2025, PMLR v267) - [[@2026__AAAI__PAGER - Proactive Monitoring Agent for Enterprise AI Assistant]] — AAAI-26 デモ(DOI:10.1609/aaai.v40i48.42344) - [[@2025__arXiv__MicroRemed - Benchmarking LLMs in Microservices Remediation]] — arXiv:2511.01166(2025、PKU/Alibaba) - [[@2026__GoogleSRE__AI in SRE - Engineering the Future of Reliable Operations]] — Google SRE の AI-Ops ホワイトペーパー(L0–L4 自律レベル・Safety Trifecta、sre.google) - [[@2026__Google Cloud Blog__AI in SRE - Where Google is Deploying Agentic AI to Improve Operations]] — Google SRE AI の SDLC 全体スコープと本番スタック公開製品名(Gemini + Gemini Enterprise Agent Platform[旧 Vertex AI] + ADK + MCP + BigQuery + vector DB)・AI Insights・TimesFM 連携・IMAG agentic orchestration layer・9 つの設計原則(cloud.google.com、Malesevic/Heiser、2026-05-29) - [[@2026__Datadog__Building Bits AI SRE - Autonomous Incident Investigation Agent]] — Datadog の自律 RCA エージェント Bits AI SRE の設計・評価ブログ(産業界 2 例目、datadoghq.com) - [[@2026__Datadog__Production-Grounded Benchmarks for AI Code Optimization]] — [[DODO]] 紹介ブログ。CPU プロファイル+Live Debugger で本番接地型ベンチマーク生成、成熟 Go サービス CPU コスト 8%+ 削減(Datadog、2026-06-08) - [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]] — Datadog AI Research / CMU の Toto 2.0 arXiv 技術レポート。TSFM 初のスケーリング則確立。NorMuon・CPM・u-μP・定量的出力ヘッドの詳細設計と全ベンチ SOTA(arXiv:2605.20119, 19p, 2026-06-05) - [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]] — Datadog の Toto 2.0 ブログ。4M〜2.5B の 5 サイズ family でスケーリング則を実証。CPM・u-μP の 2 革新。BOOM/GIFT-Eval/TIME 全ベンチで上位独占(Datadog blog, 2026-05-14, arXiv:2605.20119) - [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] — Datadog の観測データ特化 TSFM Toto とベンチマーク BOOM(NeurIPS 2025, arXiv:2505.14766) - [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]] — Ant International の異種多変量向け TSFM Falcon-X(591M、潜在プロトタイプルーティング)。GIFT-Eval で全体最高(arXiv:2605.27286, 2026) - [[@2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications]] — 障害箇所特定の前処理の特徴量削減フレームワーク MetricSifter(本 vault 所有者自身の論文・LLM 以前の統計手法、IEEE Access 2024, DOI:10.1109/ACCESS.2024.3374334) - [[Scaling Telemetry Workloads in Cloud Applications]] — Yuuki Tsubouchi の京大博士論文のハブ entity。テレメトリの 3 層(計装/ストレージ/マイニング)で既発表 3 編を統合。章ごとの source ページ 6 枚へリンクする(Kyoto University, 2025-03, 122p) - [[@2019__yuuk.io__2019-SRE-Thinking]] — [[Yuuki Tsubouchi]] による 2019 年の SRE 考察。「信頼性を制御する」目的論的 SRE 定義と技芸→工学への転換テーゼを提示。著者の SRE 思想の起点(blog.yuuk.io, 2019-01-16) - [[@2024__yuuk.io__The-World-of-LLM4SRE]] — [[Yuuki Tsubouchi]] (y_uuki) 著の LLM4SRE フィールドサーベイ記事。ファインチューニング/RAG/エージェント型の 3 分類と将来課題(スナップショット戦略・Runbook 統合・説明可能性・人間-AI 協調)を整理した 2024 年時点の地図(blog.yuuk.io, 2024-03-21) - [[@2021__yuuk.io__Linux eBPF Tracing Technology]] — [[Yuuki Tsubouchi]] による eBPF トレーシング技術の体系的解説。BPF アーキテクチャ(VM/Verifier/JIT/Maps)・イベントソース(Kprobe/Uprobe/tracepoint/USDT)・開発ツールチェーン([[BCC]]→[[bpftrace]]→[[libbpf]]+CO-RE)・推奨開発ワークフローを網羅(ゆううきブログ, 2021-12-28) - [[@2020__yuuk.io__IEEE CLOUD 2020 参加録]] — [[Yuuki Tsubouchi]] による IEEE World Congress on SERVICES 2020(IEEE CLOUD 併催、COVID-19 でオンライン開催)の参加報告。マイクロサービス・サーバーレス・エッジ-クラウド連携を対象とした異常検知・RCA 研究トレンドを概観し、ベストペーパー [[Skedulix]](ハイブリッドクラウドスケジューリング)を紹介。研究の理論的洗練と実務のルールベース運用継続とのギャップに言及(ゆううきブログ, 2020-10-29) - [[Efficient Training of Large Language Models on Distributed Infrastructures]] — LLM 分散訓練システム/インフラの包括サーベイ。SER の 3 軸でインフラ・並列化・最適化・耐障害性を分類(本 wiki 初の LLM 訓練インフラ・別ドメイン、arXiv:2407.20018 / Vicinagearth 2026) - [[@2024__NSDI__MegaScale - Scaling Large Language Model Training to More Than 10,000 GPUs]] — ByteDance/PKU の 10,000 GPU 超 LLM 訓練本番システム。175B を 12,288 GPU・55.2% MFU(Megatron-LM 比 1.34×)。上記サーベイの SER 3 軸を本番システムで具体化(NSDI '24) - [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] — SAKURA Internet の 800 GPU オープン Ethernet AI–HPC クラスタ SAKURAONE の経験報告。SONiC+RoCEv2 で TOP500 HPL 49 位・トップ 100 唯一のフルオープンなネットワーキングスタック。単一テナント LLM 開発のワークロード動態を観測(vault 所有者 Yuuki Tsubouchi 共著、MLSys 2026, arXiv:2604.13600) - [[@2025__NSDI__Minder - Faulty Machine Detection for Large-scale Distributed Model Training]] — ByteDance/Tsinghua/Harvard の分散訓練向け自動 faulty machine detector Minder。3D parallelism のメトリクス均質化を逆手に類似度 + 連続性 + per-metric LSTM-VAE で machine-level に教師なし特定。本番 1 年超、precision 0.904・F1 0.893・3.6 秒。MegaScale のハートビート系復旧を補完(NSDI '25) - [[@2026__ASPLOS__Pulse - Fine-grained and Non-intrusive LLM Training Monitoring via Microsecond-level Traffic Measurement]] — Nanjing University の LLM 訓練のトラフィック中心監視システム Pulse。BlueField-3 上でマイクロ秒 RDMA 計測 → オペレータセグメンテーション → 実通信時間/通信量で machine-level の箇所特定。非侵入的(コード/CCL 改変不要)、64 H200 で 12 中 10(SOTA は 4・2 誤診)、precision >90%・recall 100%・約 6 秒・オーバーヘッド無視可能。Minder の「マイクロ秒監視はオーバーヘッドで未展開」を on-NIC off-path 計測で解消(ASPLOS '26) - [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]] — Microsoft の GenAI クラウドサービス(Azure OpenAI 等)の本番インシデント 4 年分の初の大規模実証研究。TTM が非 GenAI 比 1.83 倍、人手検知 38.3%、症状と根本原因の多対多マッピング(ICSE 2026, arXiv:2504.08865) - [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]] — Yale University の 5G 通信ネットワーク由来の大規模マルチモーダルオブザーバビリティデータセット TelecomTS。非匿名化・絶対スケール保持の 18 KPI、32K サンプル・11 異常タイプ・221 万 Q&A。スケール情報の除去が RCA で最大 +30.4 ポイントの劣化を招くことを定量化。Toto が観測データ事前学習により RCA 精度 0.848 で突出(ICML 2026, arXiv:2510.06063) - [[A Survey of AIOps in the Era of Large Language Models]] — PKU の [[Lingzhe Zhang]]・[[Tong Jia]]・[[Ying Li]] らによる LLM4AIOps の初の包括的サーベイ。AIOps 全工程をデータ(RQ1)・タスク(RQ2)・手法(RQ3)・評価(RQ4)で俯瞰し、2020-01〜2024-12 の論文を分析。タスクを Failure Perception → RCA → Assisted Remediation の 3 段に整理、LLM 時代の新タスクと緩和の自動化 5 段、手法 5 系統を体系化。本 wiki が一次ソースで持つ [[AIOpsLab]] を全ライフサイクルベンチの代表として参照する「フィールドの地図」(ACM Computing Surveys 採録, arXiv:2507.12472, DOI:10.1145/3746635) - [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]] — CUHK-Shenzhen の [[Aoyang Fang]]・[[Pinjia He]] らによるマイクロサービス RCA 評価ベンチマークの妥当性研究。単純ヒューリスティック SimpleRCA が 4 公開ベンチで SOTA に匹敵し、既存ベンチの過度な単純さ(障害ケースの 86% が Type I/II、99% が観測データ不完全)を暴く。Train-Ticket + 動的ワークロード + ChaosMesh で 9,152 注入から impact-driven validation した 1,430 ケース・25 障害種別の障害伝播ベンチを生成、11 SOTA を再評価し平均 Top@1 0.21・最高 0.37、3 失敗モード(scalability/observability blind spots/modeling bottlenecks)を特定(本 wiki 初のデータ駆動 RCA モデル評価ベンチの一次論文、arXiv:2510.04711, 2025) - [[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]] — Tsinghua/Microsoft の LLM ベースの実用的異常検知システム MonitorAssistant。「実用的異常」(統計的逸脱+インシデント裏付け)を定義し、LLM を検知器でなくメタ層(設定推奨・解釈・フィードバック仲介)として配置。Microsoft のクラウドサービスに投入(ESEC/FSE 2024 Industry Track, DOI:10.1145/3663529.3663826) - [[@2025__ASE__LogPilot - Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems]] — CUHK の [[Michael R. Lyu]] グループと [[ByteDance]] による、ログベースのアラート診断を自動化する intent-aware かつスケーラブルな LLM フレームワーク [[LogPilot]]。PromQL アラート定義の意味的意図でログを絞り(intent-aware scoping)、request を spatiotemporal log chain に再構成・クラスタリングして代表だけ LLM に渡す(呼び出し 98.71% 削減)。Volcano Engine の 202 アラートで要約有用性 +50.34%・exact localization +54.79%、$0.074/アラートで 12 本番サービスに展開(本 wiki 初のログ専門 RCA 一次論文、ASE 2025, arXiv:2509.25874) - [[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]] — USTC の [[Mingyue Cheng]] らによるポジションペーパー。時系列予測をモデル中心・シングルパスの関数近似から、知覚・計画・行動・省察・記憶の反復的意思決定プロセス(ATSF)へ再定式化。Workflow/AgenticRL/AgenticFlow の 3 実装を整理し、進歩の主軸をモデル反復からシステム・ツール進化へ移す(本 wiki 初のエージェント型時系列予測の一次論文、arXiv:2602.01776) - [[@2026__eunomia.dev__eBPF × AI-LLMs - The Convergence of System Observability and AI]] — [[eunomia-bpf]] の [[Yusheng Zheng]] による eBPF×AI 総説 + 厳選リスト。eBPF for AI(カーネル層のゼロ計装可観測性、[[AgentSight]] <3%)と AI for eBPF(LLM による eBPF 合成、[[Kgent]]/[[GPTtrace]])の双方向共生ループで 2024–2025 の研究・製品を俯瞰(本 wiki 初のカーネル層 eBPF×AI ソース、eunomia.dev/GPTtrace/) - [[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]] — UMich×Microsoft([[Ang Chen]] グループ)の [[Zodiac]]。IaC がコンパイルを通過してもデプロイ時に失敗する semantic gap を、公開 Terraform リポジトリからのセマンティックチェック[[設定マイニング|マイニング]]と SMT/デプロイベース検証で埋める。Azure 52 リソース種別・26,000 リポジトリから 510 チェックを発掘し、既存ツールが捕えない inter-resource 制約を含む。200+ バグ repo と公式ドキュメント 4 件の誤りを修正(**本 wiki 初の Cloud IaC リライアビリティ一次論文**、[[Lilac]]/[[NSync]] と同一グループ、SOSP '24, DOI:10.1145/3694715.3695974) - [[@2025__arXiv__Cisco Time Series Model Technical Report]] — [[Cisco]]([[Splunk]])の観測ドメイン特化の時系列基盤モデル(Cisco TSM)。[[TimesFM]] に特殊トークンと解像度埋め込みを足して継続事前学習し、粗い 1 時間と細かい 1 分のコンテキストを連結した「多解像度の長コンテキスト」を 1/30 の系列長で扱う。約 400M 系列・13 か月・300B 点超で学習し、観測データで競合 TSFM([[Toto]]/[[Chronos-2]])を上回りつつ [[GIFT-Eval]] の汎用能力も保つ(**本 wiki 初の観測特化・多解像度 TSFM の一次論文**、arXiv:2511.19841, 2025) - [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]] — [[Carnegie Mellon University]]・[[Datadog]] AI Research・[[Amazon Web Services]] による、ソフトウェアインシデント対応の時系列質問応答(TSQA)を測る初のベンチマーク [[ARFBench]]。[[Datadog]] の本番インシデント Slack タイムライン由来、750 問・142 系列・538 万点を Tier I/II/III(111/306/333)で構成。TSFM([[Toto]])を VLM([[Qwen3-VL]])と結合した [[Toto-1.0-QA-Experimental]] が精度 63.9% でフロンティアモデル(GPT-5 62.7%)に並び、人間専門家との best-of-2 オラクルが精度 87.2%・F1 82.8% の超人的フロンティアを示す(**本 wiki 初の時系列質問応答ベンチの一次論文**、arXiv:2604.21199, 2026) - [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]] — USTC の [[Xiaoyu Tao]]・[[Mingyue Cheng]] らによる [[エージェント型時系列予測]] の **AgenticRL 代表実装**(上記 ATSF が参照していた一次論文)。時系列予測を逐次的意思決定へ再定式化し、記憶ベース状態管理 + ツール拡張エージェントワークフロー(統計特徴抽出・診断・予測モデル呼び出し)+ SFT + マルチターン RL([[強化ファインチューニング|GRPO]]) + カリキュラム学習で学習。予測モデル([[Chronos-2]]・[[TimesFM]]・PatchTST 等)を状態認識的に選ぶツールとして扱い、実世界 10 データセットで全データセット最低 MSE。ATSF の主張(ツール利用・省察・記憶)をアブレーションが裏づける一方、本文と Appendix で backbone 設定(8B vs 1.7B)が矛盾する未完成プレプリント(arXiv:2602.13802, 2026) - [[@2026__arXiv__Towards Robust LLM Post-Training - Automatic Failure Management for Reinforcement Fine-Tuning]] — [[Peking University]]/[[Alibaba Group]]/[[University of Illinois Chicago]] の同一グループ([[Lingzhe Zhang]] ら)による、[[強化ファインチューニング]](RFT)の訓練プロセスに AIOps の検知→診断→修復の障害管理ライフサイクルを移植した研究。初の細粒度障害ベンチマーク [[RFT-FaultBench]](5 families/16 types/779 runs/145 万 trajectory)と閉ループフレームワーク [[RFT-FM]] を提示。検知 F1 87.96%/73.88%・type-level Macro-F1 85.51%/42.16%・Mitigation Rate 46.25% で、自動修復の不安定性(MSC -5.84%)も定量化(**本 wiki 初の RFT 障害管理の一次論文**、arXiv:2605.04431, 2026) - [[@2025__arXiv__Foundation Models for Time Series - A Survey]] — [[Dell Technologies]] ほか([[Siva Rama Krishna Kottapalli]] 筆頭)による Transformer ベースの[[時系列基盤モデル]]サーベイ。15 の代表 TSFM を 6 次元(アーキテクチャ・パッチ有無・目的関数・単変量/多変量・確率的/決定論的・規模)で分類し、**目的関数による分類**を独自軸とする(Figure 8・Table 2)。vault が個別に持つ [[Toto]]/[[TimesFM]]/[[Chronos-2]](初代 Chronos)/[[Falcon-X]]/Cisco TSM に俯瞰の座標系を与える二次サーベイ。observability ドメインは未対象。[[Toto]] のスペック(103M)は vault の 151M と食い違いバージョン差の contradiction(**本 wiki 初の TSFM 横断サーベイ**、arXiv:2504.04011, 2025-04) - [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]] — CNIC/CAS の [[Changhua Pei]] + [[ByteDance]] の [[Tieying Zhang]] + [[Dan Pei]](清華大)らによる SOP 強化型マルチエージェント RCA システム。SOP フロー(5 ツール)+ thought-actionset-action-observation で幻覚を抑制し、GPT-4-Turbo で LA=70.89%・TA=57.12%(vs ReAct 35.50%)。(**本 wiki 初の SOP コード変換型マルチエージェント RCA 一次論文**、WWW Companion '25) - [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]] — [[Junjielong Xu]]・[[Shilin He]]・[[Dan Pei]]・[[Pinjia He]] らによる、LLM の RCA 能力を測る初の大規模ベンチ [[OpenRCA]]。実世界 3 システム由来の 335 障害 + 68.5GB テレメトリ(logs/metrics/traces)を静的に与え、根本原因 3 要素(component/start time/reason)の部分集合=7 goal を問う。コード実行型 RCA-agent(Controller + stateful Python Executor)を設計しても最良 Claude 3.5 Sonnet で 11.34%、Hard(3 要素)は全モデル 0.00%。性能はモデルのエラー耐性に律速(Gemini 実行失敗 −68.4%)。クエリは GPT-4 合成・候補事前提示で汚染対策に updatable(**本 wiki 初の LLM-RCA 静的ベンチ一次論文**、ICLR 2025, OpenReview M4qNIzQYpd) - [[@2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems]] — [[Guangba Yu]]・[[Pengfei Chen]]・[[Michael R. Lyu]] らによるエージェント型 RCA の再現可能ベンチ [[Cloud-OpsBench]]。452 障害・40 根本原因種別・7 カテゴリ・[[Kubernetes]] 全スタック。**State Snapshot Paradigm**(メトリクス・ログ・制御/データプレーンを凍結した決定論的デジタルツイン)でライブの非決定性と静的人工物の中間を取り、結果 A@k だけでなく**推論過程を採点する初の white-box 評価**(IAC/RAR/ZTDR)を導入。A@1=0.73 でも IAC=0.40・ZTDR=0.32 と過程指標は低く、SLM の律速は構文脆弱性(Syntactic Fragility)、frontier はパラメトリック幻覚(Parametric Hallucination)と認知欠陥を分離。障害注入は 3 エージェント MAS(Generator/Executor/Verifier)閉ループ。ICL が RAG/CoT を一貫して上回る(**本 wiki 初のエージェント RCA 過程評価ベンチ**、arXiv:2603.00468, 2026) - [[@2025__ASE__AlertGuardian - Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems]] — [[Guangba Yu]]・[[Pengfei Chen]]([[Sun Yat-sen University]])と [[Tencent]] による、アラートライフサイクルを一気通貫で管理する experience paper [[AlertGuardian]]。denoise(LLM 不使用の軽量グラフ GraphGuardian + 仮想ノイズノード + 高基数属性匿名化、<200ms・削減 93.82〜95.50%)→ summary(RAG+DeepSeek V3 で RCA 90.5%・Action 98.5%)→ rule refinement(オーケストレータなし 4 エージェント + 反復フィードバック、1,174 提案→375 受容/32%)。本番(Tencent)で MTTR 156→21 分(7.4倍)・日次 30万→1.5万。既存 papers/ ノートを温存し一方向参照(**本 wiki 初のアラートライフサイクル全体最適化の一次論文**、ASE 2025, yuxiaoba.github.io/files/ASE25) - [[@2025__arXiv__TimeSeriesScientist - A General-Purpose AI Agent for Time Series Analysis]] — [[Haokun Zhao]]・[[Xiang Zhang]]・[[Jiaqi Wei]]([[Stony Brook University]] ほか、corresponding [[Chenyu You]])による、汎用単変量時系列予測を自動化する初の LLM 駆動エージェント型フレームワーク [[TimeSeriesScientist]](TSci)。Curator → Planner → Forecaster → Reporter の固定 SOP を直列協調し、各決定に自然言語根拠を残すホワイトボックス設計。21 モデル(統計/ML/木/NN/専用)のライブラリを内蔵し[[時系列基盤モデル]]は不使用。8 ベンチで統計比 MAE -10.4%・LLM 直接予測比 -38.2%(8/8 最良)、レポートも 5 ルーブリックで全 LLM 超。前処理除去のアブレーションが MAE +41.8%(最大)。[[エージェント型時系列予測]] の Workflow パラダイム代表で [[Cast-R1]] と対をなす(**本 wiki 初の LLM エージェント型汎用時系列予測の一次論文**、arXiv:2510.01538, 2025-10) - [[@2025__arXiv__TimeCopilot]] — [[Azul Garza]]・[[Renée Rosillo]] による、複数の[[時系列基盤モデル]](TSFM)と LLM を単一の統一 API 下に集約する初のオープンソースなエージェント型予測フレームワーク [[TimeCopilot]]。LLM を (i) パイプライン各ステップの行動決定(オーケストレーション)と (ii) モデル選択・予測の自然言語説明の二役で使い、特徴分析 → モデル選択・評価 → 最終選択・予測の 3 段ワークフロー(Agent)と TSFM 最大級ハブを直接制御する Forecaster の 2 エントリポイントを提供。[[GIFT-Eval]] で MedianEnsemble([[Chronos-2]]+[[TimesFM]]+[[TiRex]] を isotonic regression で結合)が確率予測 CRPS の全体最良を約 $24 の低コストで達成(点予測 MASE は Chronos-2 に次ぐ 2 位)。[[エージェント型時系列予測]] の Workflow パラダイム代表で、基盤モデル不使用の [[TimeSeriesScientist]] と対照(**本 wiki 初の TSFM アンサンブル型エージェント予測フレームワークの一次論文**、NeurIPS 2025 Workshop BERT2S / arXiv:2509.00616, 2025) - [[@2025__OSR__Cloud Infrastructure Management in the Age of AI Agents]] — [[Ang Chen]] グループ([[University of Michigan]]/UC Berkeley/a16z)の LLM クラウド管理エージェントのビジョン論文。4 [[クラウド管理モダリティ]](SDK/CLI/IaC/ClickOps)を Azure VM 管理で実証比較(段階×モダリティのトレードオフ)し、agent-cloud interface・guardrail・exploration/exploitation を提示。IaC 群([[Zodiac]]/[[NSync]]/[[Lilac]])を 4 モダリティの IaC として束ね、agentic SRE/AIOps クラスタと接続(ACM SIGOPS OSR 2025, DOI:10.1145/3759441.3759443) - [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]] — BUPT/Douyin Vision の能動プロービングに基づく初のサービス認識型 RoCE 監視・診断システム [[R-Pingmesh]]。市販 RNIC の UD QP+CQE で RTT/処理遅延/ドロップを測り RNIC 起因とネットワーク内ドロップを区別、トモグラフィ的投票で箇所特定。数万 RNIC・6 か月、157 件のスイッチ問題全件正確・全体 85%(本 wiki 初の RoCE/RDMA ネットワーク監視一次論文、SIGCOMM 2024) - [[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]] — UIUC/NCSA/IBM/Nokia による NCSA [[Delta]](A100/H100)の 2.5 年・1,170 万 GPU 時間の GPU レジリエンス世代比較。H100 はメモリ MTBE が A100 の 1/3.2(回復機構が容量増に非対応)だがハードウェアは強化、99.9% 可用性に 5% オーバープロビジョニング(本 wiki 初の GPU レジリエンス特徴づけ一次論文、SC 2025, arXiv:2503.11901) - [[@2025__OSDI__Understanding Stragglers in Large Model Training Using What-if Analysis]] — NYU/[[ByteDance]] Seed の LLM 訓練ストラグラー分析。What-if 分析で 42.5% のジョブが ≥10% スローダウン・全 GPU 時間の 10.4% 浪費を帰属、主因は計算側の不均衡(PP 分割 39.3%・シーケンス長 21.4%・Python GC)で問題ワーカー主因は 1.7%。監視システム [[SMon]] を本番展開(本 wiki 初の LLM 訓練ストラグラー分析一次論文、OSDI 2025) - [[@2025__SOSP__Robust LLM Training Infrastructure at ByteDance]] — [[ByteDance]] の LLM 訓練特化 GPU インフラ管理・障害許容システム [[ByteRobust]]。制御/データプレーンで ETTR を最大化(9,600 GPU・3 か月で 97%)、「正確な箇所特定より迅速な隔離」(過剰排除)。インフラ障害は件数 11% でも GPU 時間の 82%、warm standby/hot-update が復旧を最大 10.87×/11.04×(本 wiki 初の耐障害 LLM 訓練インフラ一次論文、SOSP 2025, arXiv:2509.16293) - [[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]] — [[Nanjing University]]/[[Tencent]]/Harvard の 50 万 GPU 級 LLM 訓練データセンターインフラ [[Astral]]。tier-2 同一レール相互接続(8K GPU で効率損失 0.6%・512K 規模、HVDC+空気液体冷却で PUE 最大 16.34% 改善)+4 層フルスタック監視・階層相関(MTTLF 日→分・最大 25 倍)+オペレータ粒度予測 [[Seer]](密モデル 0.3% 偏差)。同 Nanjing グループの [[Pulse]] の系譜(本 wiki 初の超大規模 LLM 訓練データセンターインフラ一次論文、SIGCOMM 2025) - [[@2025__VLDB__Approximation-First Timeseries Monitoring Query At Scale]] — [[University of Maryland]]/[[Boston University]] の時系列モニタリング近似クエリキャッシュ [[PromSketch]]。[[Prometheus]]/[[VictoriaMetrics]] のルールクエリのボトルネック(繰り返しデータスキャン CPU 41%/80.2%・重複ウィンドウ再計算)を、中間結果(Exponential Histogram バケット)の in-memory キャッシュ + EH×スケッチ(KLL/Universal Sketching、可証明な誤差境界)で解消。5% 誤差以下でレイテンシ最大 2 桁・クエリ処理コストを Prometheus 比約 400×/VictoriaMetrics 比 4× 以上削減(本 wiki 初の[[近似クエリ処理]]一次論文、VLDB 2025, arXiv:2505.10560) - [[@2025__eBPF__eInfer - Unlocking Fine-Grained Tracing for Distributed LLM Inference with eBPF]] — [[University of Connecticut]] ほかの分散 LLM 推論を要求単位でエンドツーエンドにトレースする初の [[eBPF]] ベースシステム [[eInfer]]。ソース改変なしに CPU・アクセラレータ・プロセス・ノードをまたぐイベントを関連付け、ベンダー非依存([[CUPTI]] 相当の精度)で本番オーバーヘッド 4% 未満(本 wiki 初の eBPF 分散 LLM 推論トレーシング一次論文、eBPF Workshop 2025) - [[@2026__MLSys2026__ProfInfer - An eBPF-based Fine-Grained LLM Inference Profiler]] — [[Huawei Hilbert Research Center Dresden]]/[[TU Munich]] の [[eBPF]] uprobe を [[llama.cpp]] へ動的アタッチする非侵入オンデバイス推論プロファイラ [[ProfInfer]]。演算子レベル PMC で `ggml_tensor` を辿りハードウェア挙動とモデル構造を対応づけ、ProfDAG/ProfTime/ProfStat の 3 ビューを生成。オーバーヘッド最小 1.7%、MoE のボトルネックがディスク I/O だと特定(本 wiki 初のオンデバイス LLM 推論プロファイラ一次論文、arXiv:2601.20755) - [[@2025__SOSP__Mycroft - Tracing Dependencies in Collective Communication Towards Reliable LLM Training]] — [[ByteDance Seed]] の[[集合通信]]ライブラリ([[NCCL]])のブラックボックス性を打破する Coll-level 観測システム [[Mycroft]]。フロー/チャンク単位の依存性を露出させ、NCCL への軽量計装(C++ 1,100 行)で数万 GPU の 90% を 15 秒以内に検知・60% を 20 秒以内に箇所特定。ByteDance で 6 か月超デプロイ(本 wiki 初の集合通信依存トレーシング一次論文、SOSP 2025, arXiv:2509.03018) - [[@2025__HCDS__eGPU - Extending eBPF Programmability and Observability to GPUs]] — [[UC Santa Cruz]] の [[eBPF]] バイトコードを実行時に [[PTX]] へコンパイルし稼働中 GPU カーネルへ動的注入する初の eBPF ランタイム [[eGPU]]。カーネル中断なしに計装でき [[NVBit]] より低オーバーヘッド、共有メモリ eBPF マップで CPU-GPU 間をコピーなし交換。評価は単一 GPU・マイクロベンチに限定(本 wiki 初の GPU への eBPF 拡張一次論文、HCDS Workshop 2025) - [[@2025__arXiv__Collective Communication for 100k+ GPUs]] — [[Meta]] の 10 万 GPU 超クラスタの LLM ライフサイクル全体を [[NCCL]] 拡張で一元支援する[[集合通信]]フレームワーク [[NCCLX]]。ゼロコピー・SM フリー・ホスト駆動の [[CTran]] と三実行モード。[[Llama4]] で定常ステップ最大 12% 削減・起動最大 11 倍高速化・デコードレイテンシ 15〜80% 改善、[[DQPLB]] でスイッチバッファを一桁削減(本 wiki 初の 10 万 GPU 級集合通信フレームワーク一次論文、arXiv:2510.20171) - [[@2024__TOPC__Low-Overhead Trace Collection and Profiling on GPU Compute Kernels]] — [[Polytechnique Montréal]]([[DORSAL lab]])のトレースフェーズ区分化でデバイス上トレース収集を類似研究比 1 桁削減する手法。LLVM パスで制御フローを静的に解きバッファ事前確保・決定的実行、[[Rodinia]] で全体 1.60×(中央値 1.26×)。参照実装 [[hip-analyzer]] は CUDA/[[HIP]] 対応(本 wiki 初のコンパイル時 GPU トレース計装一次論文、ACM TOPC 2024) - [[@2024__arXiv__Microsecond-scale Dynamic Validation of Idempotency for GPU Kernels]] — [[Shanghai Jiao Tong University]](IPADS)の GPU カーネル[[べき等性]]をインスタンス単位で実行前検証する初のシステム [[PICKER]]。「条件付きべき等」を発見(547 中 490)し起動引数だけで全インスタンスを 5µs 以内に検証。[[Asymmetric Resilience]] の[[チェックポイント]]コストを 4% 未満へ・[[Chimera]] のプリエンプション待ちを平均 84.2% 削減(本 wiki 初の GPU カーネルべき等性動的検証一次論文、arXiv:2410.23661) - [[@2025__SC__Fine-grained Automated Failure Management for Extreme-Scale GPU Accelerated Systems]] — [[Intel]]/[[RIKEN Center for Computational Science]] のエクサスケール GPU 自動故障管理 [[StabilityDB]]。集中型メタ DB + マルチストライク修復ポリシーで GPU 単位の細粒度修復、[[Argonne National Laboratory]] の [[Aurora]](63,744 GPU)で MTTR を手動比最大 84 倍短縮(本 wiki 初のエクサスケール HPC 自動故障管理一次論文、SC 2025, DOI:10.1145/3712285.3759883) - [[@2026__MLSys2026__Guard - Scalable Straggler Detection and Node Health Management for Large-Scale Training]] — [[Store Foundational AI]]([[Amazon Web Services]])のストラグラー検知 + ノード健全性管理 [[Guard]]。NCCL テスト/バーンインを通過しつつ性能を劣化させるグレーノードを、オンラインモニタリング + オフラインノードスイープの閉ループで検知。MFU 最大 1.7 倍・ステップ時間分散 20%→1%、検知ツールを [[fkat]] として OSS 化(本 wiki 初のグレーノード/ノード健全性管理一次論文、MLSys 2026 Industry Track) - [[@2025__arXiv__FlashRecovery - Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs]] — [[iFLYTEK AI Engineering Institute]]/[[University of Science and Technology of China]]/[[Huawei Technologies]] の LLM 訓練障害復旧 [[FlashRecovery]]。アクティブ検知(数秒)+ スケール非依存タスク再起動 + データ並列複製による[[チェックポイント]]フリー 1 ステップ復旧で、[[Ascend NPU]] 4,800 デバイス 150 秒・従来比約 93〜95% 削減(本 wiki 初のチェックポイントフリー障害復旧一次論文、arXiv:2509.03047) - [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]] — [[Tsinghua University]]/[[Beihang University]]/[[Infrawaves]] の RDMA 性能異常診断 [[Hawkeye]]。PFC プロベナンスで backpressure/storm/deadlock を 90% 以上の精度・再現率 100% で診断、収集スイッチ数を約 1/10・オーバーヘッドを 1〜4 桁削減([[Intel Tofino]] テストベッド、本 wiki 初の RDMA 性能異常診断/PFC プロベナンス一次論文、SIGCOMM 2025, DOI:10.1145/3718958.3750490) - [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]] — [[Alibaba Group]]/[[Hong Kong University of Science and Technology]] の通信駆動型 AI 訓練効率化 [[C4]]。診断 [[C4D]]([[ACCL]] 拡張)が[[集合通信]]の症候から故障を数十秒で隔離・再開し、性能 [[C4P]] がトラフィック工学で帯域競合を削減。ダウンタイム 31.19%→1.16%・システム効率 30%→45%、本番 30 か月超([[H800]] 評価、本 wiki 初の通信駆動 AI 訓練異常検知/通信最適化一次論文、HPCA 2025) - [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]] — [[Nankai University]] の光トランシーバー故障の予測 + 分類フレームワーク [[OptProphet]]。特徴量集約(IFE+AEFR)で時間的依存と物理的結合をモデル化し IAU+FWO で不均衡データを自動処理、予測 F1 0.884(平均 1.11 日前にアラーム)・分類 F1 0.855 で SOTA を凌駕(本 wiki 初の光トランシーバー故障予測/分類一次論文、APNet 2025、PDF 原本取り込み済み) - [[@2025__ISAV__From Exploration to Explanation - ML-Driven Causal Discovery for Datacenter Reliability at Scale]] — [[Hewlett Packard Labs]]/[[Oak Ridge National Laboratory]] のデータセンター信頼性の因果探索 [[PACE]]。相関クラスタリング + ラグ考慮 Granger 因果性で多変量テレメトリから有向因果パスを抽出し物理プロセスで妥当性検証([[Summit]] 冷却 7 年、定量指標なしの定性評価、PDF 取得済み、ISAV 2025) - [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]] — [[Case Western Reserve University]]/[[Rutgers University]] の LLM 分散訓練時間予測。オペレータ分解 + 木ベース回帰、計算演算(70〜95%)に予測能力を集中。CPU 上で [[Perlmutter]] 4.98%・[[Vista]] 9.38%(arXiv:2509.22832) - [[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]] — Alibaba Cloud/[[Tsinghua University]] のコンテナ訓練ネットワーク障害診断 [[SkeletonHunter]]。RNIC バーストの STFT で集合通信スパース性を推論し probing 2 桁削減、19 種別へ箇所特定、precision 98.2%(SIGCOMM 2025) - [[@2025__IWQoS__eACGM - Non-instrumented Performance Tracing and Anomaly Detection towards Machine Learning Systems]] — [[Sun Yat-sen University]] の全スタック非侵入 ML 監視 [[eACGM]]。eBPF をフレームワーク層関数トレースへ適用 + libnvml + 教師なし GMM、6 ベースライン超(IWQoS 2025, arXiv:2506.02007) - [[@2025__arXiv__XPUTimer - Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale]] — [[Shanghai Jiao Tong University]]/[[Ant Group]] の発散 LLM 訓練異常診断 [[XPUTimer]]([[Flare]])。非侵入 CPython 計装 + CUDA-GDB intra-kernel inspecting で持続的性能回帰まで診断、6,000 GPU 8 ヶ月(v2 で Flare に改名、arXiv:2502.05413) - [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]] — Alibaba Cloud のパブリッククラウド AI 訓練障害診断 [[Aegis]]。CCL の launch/work-request/completion カウンタで計算/通信障害を非侵入弁別、idle time 97%+ 削減(NSDI 2025) - [[@2025__DSN__LLMPrism - Black-box Performance Diagnosis for Production LLM Training Platforms]] — [[The Chinese University of Hong Kong]]/[[Huawei Cloud]] のブラックボックス性能診断 [[LLMPrism]]。スイッチ層 RoCE フローのみから並列化を逆推定 + BOCD + k-σ、19 ジョブ 2880 GPU で 0.3% 誤差([[Platform-X]] 稼働、DSN 2025, arXiv:2505.00342) - [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]] — [[The Chinese University of Hong Kong]]/[[Huawei Cloud]] の LLM 訓練障害自動ログ解析 [[L4]]。cross-job/spatial(iForest)/temporal(DTW)の 3 パターンで F1 0.873・top-5 80.5%、428 件研究([[Platform-X]]、ESEC/FSE 2025, arXiv:2503.20263) - [[@2026__TOSEM__TVDiag - A Task-oriented and View-invariant Failure Diagnosis Framework for Microservice-based Systems with Multimodal Data]] — 武漢大学の [[Shuaiyu Xie]] らによるマルチモーダル障害診断フレームワーク [[TVDiag]]。タスク指向対照学習(TO)でモダリティ-タスク嗜好(トレース/メトリクス→RCL、ログ→FTI)を増幅し、グラフ拡張(AUG)でデータ不足を緩和。4 データセットで HR@1 最大 +13.15%(本 wiki 初のマルチモーダル RCL+FTI 統合診断一次論文、TOSEM Vol.35 No.2 Article 40, 2026, DOI:10.1145/3734868) - [[@2025__TSC__TAMO - Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems]] — [[Shandong University]] の [[Xiao Zhang]]・[[Dongxiao Yu]] らによるツール支援型 LLM マルチモーダル RCA フレームワーク [[TAMO]]。双分岐拡散 T1 + FFT+GAT T2 + Transformer T3 + GPT-4 エキスパートエージェントで LLM-RCA の 3 課題を統一フレームワークで解決。HolisticRCA 比 Acc@1 +4.8%・MiPr +10.8%、アブレーションで T1(拡散アライメント)が RCA の律速(IEEE TSC 2025, arXiv:2504.20462) - [[@2024__PVLDB__D-Bot - Database Diagnosis System using Large Language Models]] — [[Tsinghua University]] の [[Xuanhe Zhou]]・[[Guoliang Li]] らによる LLM ベースデータベース異常診断システム D-Bot([[DB-GPT]])。サマリツリー知識抽出・UCT 木探索診断・7 エキスパート非同期協調で DBA の 1〜2 時間→10 分/$1.8。539 件ベンチで DNN/DecisionTree 比 8〜54% 向上(PVLDB Vol.17 / VLDB 2024, DOI:10.14778/3675034.3675043) - [[DB-GPT]] — [[Tsinghua University]] の Database Group が公開する LLM 駆動データベース診断・最適化フレームワーク(D-Bot の OSS 実装) - [[データベース自律診断]] — DB 異常の LLM 自動診断。「ドメイン知識外在化が精度の律速」「UCT 木探索が早期停止を構造的抑制」を横断知見として集約 - [[@2025__PVLDB__DBAIOps - A Reasoning LLM-Enhanced Database Operation and Maintenance System using Knowledge Graphs]] — [[Wei Zhou]]・[[Xuanhe Zhou]]・[[Guoliang Li]] ら(SJTU/Tsinghua/百盛科技)による初のハイブリッド DB O&M システム DBAIOps。ExperienceGraph(6 頂点型・4 辺型異種グラフ)+800 以上の異常モデル+二段階グラフ進化で未知異常の診断パスを動的構築し、DeepSeek-R1 32B でベースライン比 RCA 精度 +34.85%・人手評価 +47.22%。25 DB・20 実環境稼働。(PVLDB 2025) - [[Wei Zhou]] — DBAIOps 筆頭著者(SJTU、データベース O&M 自動化・LLM×DB) - [[DBAIOps]] — 知識グラフ+推論 LLM による DB O&M システム(25 DB・20 実環境) - [[Baisheng Technology]] — DBAIOps 開発元(深圳) - [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]] — Nankai University の [[Yongqian Sun]]・[[Shenglin Zhang]] らによる ECD・FT・RCCA 統合フレームワーク [[SCELM]]。RAG + 7B LLM で変更管理を自動化し本番 90% 時間短縮。(FSE Companion '25, DOI:10.1145/3696630.3728561) - [[SCELM]] — ECD・FT・RCCA 統合ソフトウェア変更評価フレームワーク(product / Nankai University AIOps) - [[Tinghua Zheng]] — Nankai University 所属。SCELM 共著者(person) - [[Xidao Wen]] — BizSeer 所属。SCELM 共著者(person) - [[Weihua Kuang]] — Nankai University 所属。SCELM 共著者(person) - [[Heng Liu]] — CHINA TIANCHEN ENGINEERING CORPORATION LTD. 所属。SCELM 共著者(person) - [[Chao Shen]] — Nankai University 所属。SCELM 共著者(person) - [[Bo Wu]] — Tencent Technologies 所属。SCELM 共著者(person) - [[BizSeer]] — 北京の企業。AIOps 研究開発(organization) - [[データベース O&M]] — DB 運用保守の自動化概念。知識グラフ・グラフ進化・推論 LLM の統合が 2025 年の設計転換点 - [[ソフトウェア変更管理]] — ECD・FT・RCCA の 3 タスクからなる変更ライフサイクル自動化。SCELM が初の統合フレームワークで、変更票×ログ×メトリクスのマルチモーダル統合と RAG が鍵 - [[@2017__NeurIPS__Attention Is All You Need]] — [[Ashish Vaswani]]・[[Noam Shazeer]] ほか([[Google Brain]])。再帰・畳み込みを排し自己アテンションのみで系列変換を実現する [[Transformer]] を提案。WMT 2014 英独 BLEU 28.4、英仏 BLEU 41.8。LLM 時代の基盤アーキテクチャ(NeurIPS 2017) - [[@2018__OpenAI__Improving Language Understanding by Generative Pre-Training]] — [[Alec Radford]]・[[Ilya Sutskever]] ほか([[OpenAI]])。Transformer デコーダによる教師なし事前学習+教師あり微調整の二段階パラダイム(GPT-1)を確立。12 タスク中 9 で SOTA(OpenAI 2018) - [[@2019__OpenAI__Language Models are Unsupervised Multitask Learners]] — [[Alec Radford]]・[[Jeffrey Wu]] ほか([[OpenAI]])。1.5B パラメータの [[GPT-2]] がゼロショットで 8 言語モデリングデータセット中 7 で SOTA。規模と性能の対数線形関係を実証(OpenAI 2019) - [[@2020__NeurIPS__Language Models are Few-Shot Learners]] — [[Tom Brown]]・[[Jared Kaplan]] ほか([[OpenAI]])。175B パラメータの [[GPT-3]] が[[文脈内学習]]により微調整なしで多数の NLP タスクで競争力ある性能を達成(NeurIPS 2020) - [[@2022__DSN__Characterizing and Mitigating Anti-patterns of Alerts in Industrial Cloud Systems]] — [[Tianyi Yang]]・[[Jiacheng Shen]]・[[Yuxin Su]]・[[Xiaoxue Ren]]・[[Yongqiang Yang]]・[[Michael R. Lyu]]([[The Chinese University of Hong Kong]] + [[Sun Yat-sen University]] + [[Huawei Cloud]])、DSN 2022、arXiv 2204.09670。Huawei Cloud の 2 年・400 万件超アラート + 18 OCE 調査から 4 個別 + 2 集合のアラートアンチパターンを実証同定、QoA(indicativeness・precision・handleability)の自動評価を将来方向に。Repeating Alerts を初めて文書化(source / paper / aiops / alert-management / cloud-reliability) - [[@2024__ICSE-SEIP__Knowledge-aware Alert Aggregation in Large-scale Cloud Systems - a Hybrid Approach]] — [[Jinxi Kuang]]・[[Jinyang Liu]]・[[Junjie Huang]]・[[Renyi Zhong]]・[[Jiazhen Gu]]・[[Lan Yu]]・[[Rui Tan]]・[[Zengyin Yang]]・[[Michael R. Lyu]]([[The Chinese University of Hong Kong]] + [[Huawei Cloud]])、ICSE-SEIP 2024、DOI:10.1145/3639477.3639745。SOP を LLM 推論材料に持ち込んだハイブリッド [[COLA]](相関マイニング + CoT 2 ラウンド + ICL + P-tuning v2 SFT)。Cloud X の 500K アラート + 3K SOP で F1 0.901-0.930、本番 4 ヶ月運用(source / paper / aiops / alert-management / llm-rca) - [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices]] — [[Akanksha Singal]]・[[Divya Pathak]]・[[Kaustabha Ray]]・[[Felix George]]・[[Mudit Verma]]・[[Pratibha Moogi]]([[IBM Research]] India + [[IIIT Delhi]])、arXiv:2501.03547。Informative Metric Subset Problem(NP 完全)を初定式化し、エントロピー + 相互情報量 + トポロジ確率調整 + AIMD で SelectKBest/mRMR/Boruta/Max Weighted Clique を上回る coverage を達成する [[KIMetrix]]。DeathStarBench CPU で C=99.44%(source / paper / aiops / observability / microservices) - [[@2014__KDD__Unveiling Clusters of Events for Alert and Incident Management in Large-Scale Enterprise IT]] — [[Derek Lin]]・[[Rashmi Raghu]]・[[Vivek Ramamurthy]]・[[Jin Yu]]・[[Regunathan Radhakrishnan]]([[Pivotal Software]]) + [[Joseph Fernandez]]([[Visa Inc]])、KDD 2014、DOI:10.1145/2623330.2623360。半構造化アラート(Jaccard + connected components + graph-cut)と非構造化インシデント(NMF + KD-tree + complete-linkage + マージ精製)の 2 系統独立クラスタリング framework。5M アラート→22K ユニーク・67K インシデントを Greenplum + MADlib で処理、構造保存型可視化を提案(source / paper / aiops / alert-management / clustering) - [[@2019__WWW__Outage Prediction and Diagnosis for Cloud Service Systems]] — [[Yujun Chen]]([[Beihang University]] + [[Microsoft Research]] intern)・Xian Yang・[[Qingwei Lin]]・[[Hongyu Zhang]]([[University of Newcastle]])・[[Feng Gao]]・[[Zhangwei Xu]]・[[Yingnong Dang]]([[Microsoft Azure]])・[[Dongmei Zhang]]・[[Hang Dong]]・Yong Xu・Hao Li・[[Yu Kang]]([[Microsoft Research]] Beijing)、WWW 2019、DOI:10.1145/3308558.3313501。Bayesian network(FCI)+ XGBoost のハイブリッドアウテージ予測 [[AirAlert]]。Microsoft 1 年・6 サービスで Simple Spike が崩壊するサービスレベル outage に F1 53.92-88.78% を達成(source / paper / aiops / outage-prediction / bayesian-network) ### 2026-06-17 distributed training batch (14) - [[@2018__OSDI__Ray A Distributed Framework for Emerging AI Applications]] - [[@2019__arXiv__Megatron-LM Training Multi-Billion Parameter Language Models Using Model Parallelism]] - [[@2019__NeurIPS__GPipe Easy Scaling with Micro-Batch Pipeline Parallelism]] - [[@2019__SOSP__PipeDream Generalized Pipeline Parallelism for DNN Training]] - [[@2020__KDD__DeepSpeed System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters]] - [[@2020__OSDI__HiveD Sharing a GPU Cluster for Deep Learning with Guarantees]] - [[@2020__SC__ZeRO Memory Optimizations Toward Training Trillion Parameter Models]] - [[@2021__SC__Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM]] - [[@2023__arXiv__FP8-LM Training FP8 Large Language Models]] - [[@2023__MLSys__Reducing Activation Recomputation in Large Transformer Models]] - [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]] - [[@2024__APNet__Understanding Communication Characteristics of Distributed Training]] - [[@2024__NSDI__Cassini Network-Aware Job Scheduling in Machine Learning Clusters]] - [[@2025__arXiv__FFTrainer Fast Failover in Large Language Model Training with Almost Free State Management]] ### 2026-06-18 distributed networking/scheduling/topology batch - [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]] - [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]] - [[@2008__ISCA__Technology-Driven, Highly-Scalable Dragonfly Topology]] - [[@2009__IEEE-Micro__Cost-Efficient Dragonfly Topology for Large-Scale Systems]] - [[@2018__SC__Harnessing GPU Tensor Cores for Fast FP16 Arithmetic to Speed up Mixed-Precision Iterative Refinement Solvers]] - [[@2019__NSDI__Tiresias - A GPU Cluster Manager for Distributed Deep Learning]] - [[@2020__NSDI__Themis - Fair and Efficient GPU Cluster Scheduling]] - [[@2022__NSDI__Accelerating Collective Communication in Data Parallel Training across Deep Learning Frameworks]] - [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning]] - [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]] - [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]] - [[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]] - [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]] - [[@2024__SC-W 2024__Benchmarking Ethernet Interconnect for HPC AI workloads]] - [[@2022__SREcon22 Americas__Dark Sky Camping - Reducing Alert Pollution with Modern Observability Practices]] - [[@2023__SREcon23Americas__Epic Incidents of History - The 1979 NORAD Nuclear Near Miss]] — [[Nick Travaglini]]([[Honeycomb.io]] Technical Customer Success Manager)、USENIX SREcon23 Americas(2023 年 3 月)。1979 年 NORAD 核ミサイル誤警報事件を Walker・Woods・Rayo(2016) の Distant-Proximal / Blunt-Sharp モデルで分析し、Paul N. Edwards のクローズドワールド論を援用して単純な root cause analysis の限界を論じる。34 ページスライド + YouTube 自動字幕 transcript。(slides / sre / incident-management / human-factors / accident-model / history-of-computing) - [[@2023__SREcon23Americas__Incident Commanders]] — [[Vanessa Huerta Granda]]・[[Emily Ruppe]]([[Jeli]])、USENIX SREcon23 Americas(2023 年 3 月頃)。IC(Incident Commander) とインシデントアナリストを「似て非なる別々のスキルセット」と定義し、両ロール兼務時の注意点(燃え尽きリスク・社会技術的要因の見落とし)を論じる。「インシデントのサイクル」ライフサイクル図を提示。代表フレーム12枚 + YouTube 英語字幕。(video / sre / incident-management / incident-commander / srecon) - [[@2023__SREcon23EMEA__The Incident Is The Way - Using Your Incidents to Win Reliability Investment]] — [[Niall McCarthy]]([[Afterpay]] エンジニアリングリーダー)、USENIX SREcon23 EMEA(2023-10-11、ダブリン)。ケイパビリティマッピング・組織の巻き込み・害の共有定義(correctness重視)・意図でなく結果を選ぶ重大度判断という4つの実践で、インシデントを信頼性投資獲得の機会に変える方法を提示。YouTube 自動字幕 transcript + 代表フレーム22枚。(video / sre / incident-management / reliability-investment / srecon) - [[@2024__SREcon24Americas__Hard Choices, Tight Timelines - A Closer Look at Tradeoff Decisions during Incidents]] — [[Laura Maguire]](Trace Cognitive Engineering/OSU)・[[Courtney Nash]](The VOID)、USENIX SREcon24 Americas(2024-03-19)。インシデント対応中のトレードオフ意思決定を組織階層をまたいで分析し、The Void データベースに欠けている推論過程を vignette 法で補完。skip-level tradeoff を Datadog 実例・役割別比較表・組織図・コスト便益分布表とともに提示。全61ページ。(slides / sre / incident-management / tradeoff / human-factors) - [[@2024__SREcon24Americas__Storytelling as an Incident Management Skill]] — [[Laura de Vesine]]([[Datadog]])、USENIX SREcon24 Americas(2024-03-20、サンフランシスコ)。「英雄の旅」的な人物中心の物語形式を退け、因果論理で出来事が連鎖する narrative を組み立てる技能がオンコール準備・対応中・ポストモーテムのすべてを支えると論じる。「舞台設定→ドラマの追加→出来事の連鎖→対応の説明→修正計画」の5段階「エンゲージングなポストモーテム」構成を提示。18ページ + Whisper 音声文字起こし。(slides / sre / incident-management / postmortem / srecon) - [[@2023__Medium__The Failure of Knowledge Management]] — [[Mark Burgess]]。知識管理を静的データの貯蔵・検索として扱う従来アプローチ(エキスパートシステム・Topic Maps・RDF/OWL)を「論理は脆く知識は解釈の問題」として批判し、知識とは反復と親密さによる個人的な関係性の構築だと論じたエッセイ(2023-01-02)。(article / knowledge-management / epistemology) - [[@2014__markburgess.org__Infrastructure Management Timescales]] — [[Mark Burgess]]。インフラ管理における観測・是正のタイムスケールを問題自身の時間スケールに一致させる必要性(KT境界、"Dynamics always trump semantics")を論じ、監視アラームの典型的なタイムスケール不一致を指摘した技術エッセイ(2014-11-17)。(article / monitoring / control-theory / sre) - [[@2021__ICDE__TS-Benchmark - A Benchmark for Time Series Databases]] — [[Yuanzhe Hao]]・Xiongpai Qin・[[Yueguo Chen]](責任著者)ほか([[Renmin University of China]])、ICDE 2021。風力発電ウィンドファーム監視シナリオに基づき、DCGAN + 有向グラフ + ランダムウォークで合成時系列を生成するデータ生成モデルを提案。データロード・データ注入・データフェッチの3ワークロードでInfluxDB・TimescaleDB・Druid・OpenTSDBを比較評価し、TSM-Bench(2023)が"TS-Graph"として引用するデータ生成手法の原論文でもある(source / paper / database / time-series / benchmark / data-generation) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 1 機械学習システムの概要]] — Chip Huyen『機械学習システムデザイン』1 章。機械学習の要否判断と、研究対実現場・機械学習対従来ソフトウェアの対比(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 2 機械学習システム設計の概要]] — Chip Huyen『機械学習システムデザイン』2 章。4 要件・反復型プロセス・問題の組み立てと目的関数のデカップリング(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 3 データエンジニアリングの基礎知識]] — Chip Huyen『機械学習システムデザイン』3 章。データフォーマット・データモデル・ストレージエンジン・データフロー 3 形態・バッチ対ストリーム(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 4 訓練データ]] — Chip Huyen『機械学習システムデザイン』4 章。サンプリング・ラベル付け・クラスの不均衡・データオーグメンテーション(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 5 特徴エンジニアリング]] — Chip Huyen『機械学習システムデザイン』5 章。特徴エンジニアリングの手法群・データリーク・特徴の重要度と汎化(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 6 モデル開発とオフライン評価]] — Chip Huyen『機械学習システムデザイン』6 章。モデル選択とアンサンブル・実験管理・分散訓練・AutoML とオフライン評価の手法群(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 7 モデルのデプロイと予測サービス]] — Chip Huyen『機械学習システムデザイン』7 章。デプロイの誤解・バッチ対オンライン予測・モデル圧縮・クラウド対エッジ(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 8 データ分布のシフトと監視]] — Chip Huyen『機械学習システムデザイン』8 章。障害原因の分類・データ分布のシフトの定義と検知・監視と可観測性(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 9 実現場での継続学習とテスト]] — Chip Huyen『機械学習システムデザイン』9 章。継続学習の 4 段階と更新頻度・実環境でのテスト 5 手法(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 10 MLOpsにおけるインフラとツール]] — Chip Huyen『機械学習システムデザイン』10 章。MLOps インフラの 4 層・リソース管理・機械学習プラットフォーム・構築対購入(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 11 機械学習の人的側面]] — Chip Huyen『機械学習システムデザイン』11 章。ユーザー体験・チーム構成・責任あるAI(source / book / machine-learning / mlops) - [[@2023__OReillyJapan__機械学習システムデザイン - Appendix A 機械学習システムを外部に提供する]] — 『機械学習システムデザイン』付録 A(日本語版オリジナル、[[宮川大輔]]・[[株式会社JDSC]])。機械学習システムの外部提供に固有の契約・組織・コンプライアンスの論点(source / book / machine-learning / mlops) - [[@2024__SpeakerDeck__アクセラレータ間通信の実際]] — 上野裕一郎([[Preferred Networks]])。MPLS Japan 2024。PFN の H100 クラスタ(RoCEv2)における NVLink・DCQCN・NCCL の技術スタックと、PCIe SW 論理分割による NCCL の NIC 選択偏り、Arista スイッチのクレジット管理起因のインターコネクト不安定という2件のトラブルシューティング事例(source / slides / networking / rdma / llm) - [[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]] — Richard L. Graham ほか([[Mellanox]])。2016 First International Workshop on Optimization of Communication in HPC Systems(COM-HPC 2016)。InfiniBand SwitchIB-2 ASIC への集団操作縮約オフロード(SHArP)。128 ホストで 8 byte MPI Allreduce() を 2.1 倍・パイプライン化した 4096 byte を 3.24 倍高速化(source / paper / networking / hpc / rdma / collective-communication) --- ## Surveys - [[wiki/surveys/AIインフラにおけるストラグラー問題]]: 事前学習と事後学習RLを横断し、原因分類・検知手法の設計原理・組織別実装を23本の文献で整理したサーベイ - [[wiki/surveys/LLMのデータ枯渇に関するサーベイ]]: 訓練データ枯渇の予測と緩和策を19本のソースで横断したサーベイ - [[wiki/surveys/時系列基盤モデルのクラウド運用応用サーベイ]]: TSFM のクラウド運用応用を 4 軸で分類したサーベイ。専用事前学習の優位、汎用ゼロショットの失敗、評価軸の意思決定・QA への移動を整理 - [[wiki/surveys/ホストネットワークとインターコネクトの教科書]]: wiki の 59 本の source と 20 近い concept を横断した 11 章構成の教科書(2,200 行超)。サーバの内側でデータが CPU、メモリ、PCIe、NVLink、NIC をどう渡り歩くかを層ごとに切り分ける。第1章で「ホストネットワーク」(プロセッサ・メモリ・周辺機器のインターコネクトを統合しホスト内転送を担う経路)を定義し、ドメインごとのクレジットベースフロー制御(C2M-Read は LFB から DRAM の全ホップ・約70ns、C2M-Write は LFB から CHA の1ホップ・約10ns で MC を含まない、P2M-Write は IIO から MC の2ホップ・約300ns)を統一抽象として提示。第2章はソケット内の core/uncore(CHA・IIO・MC)と UPI/QPI/HyperTransport、NUMA 距離のホップあたり約40ns、非対称インターコネクト(最良配置はホップ数でなく総帯域で決まる、スレッド配置だけで最大237%変動)、DMA/RDMA 書き込みの非対称性(書き込み先バッファ配置のみが効き帯域最大40%低下)、hwloc と配置ミドルウェア。第3章は PCIe の三層構造、TLP ヘッダと DLL のオーバーヘッド、MPS/MRRS、DDIO、IOMMU の IOTLB ミス、単一フローのオーバーヘッドモデル(SIGCOMM18)と複数フローの輻輳モデル(SC16)の相補性、PCIe downgrading と ACS/ATS 誤設定。第4章はスケールアップ網(NVLink 世代・NVSwitch・NVL72 の単一ホップ全結合・NVLink SHARP・GPUDirect の世代反転・NV-SLI の三段レイテンシ階層・Infinity Fabric のリンク本数非対称と RCCL のホップ数推定の取りこぼし・ACN/PingPoint・FabricPerf)。第5章は CXL(CXL.io/.cache/.mem、メモリ意味論のレイテンシ予算、CPU レス NUMA ノード、Pond のメモリストランディング特性化と小規模プール+ML 予測、Vistara の ASIC から量産まで、PathFinder)。第6章はホストネットワークスタック(データコピーと per-packet/per-byte の分解、レイテンシ側の別要因、BPF から netmap と XDP、SmartNIC/IPU/DPU、CNI のオーバーヘッド)。第7章は RDMA と RNIC マイクロアーキテクチャ資源(ICM キャッシュ枯渇・処理ユニット競合・QP スケーリングの報告不一致・UCCL-Tran・GPU 主導通信・Collie)。第8章はホスト内輻輳制御(輻輳点の所在、既存 CC が届かない機構、hostCC と RHCC の設計差、ループバック RDMA が PCIe レーンで 2:1 輻輳を作り PFC を誘発した事例)。第9章は物理層(448G/P802.3dv の変調未決、PAM4/6/8 の SNR とチャネル帯域のトレードオフ、FEC の三すくみと LLR 到達距離20%減がノード数36%減に効く経路、CPC と CPO、Ultra Ethernet が置き換えた RoCEv2 の6前提)と NCCL のプロトコル選択。第10章は観測(Hostping の full-mesh ループバックと binary network tomography、R2R probing、ハードウェアカウンタ、NIC なし網の測定、INTFusion、ARGUS)。第11章は律速点の切り分け順序、配置基準、帯域収支の見積り、既定値を疑う根拠、観測点の事前配置を判断として整理。層をまたぐ未解決として、ドメインモデルが単一ソケットに閉じていること、層ごとに別々の観測手法が統合された帰属を持たないこと、CXL と Ethernet により層の境界自体が動いていることを挙げる。参照元から転載した図表 63 点を各章に配置(構造図、本文が数値で語る現象の根拠グラフ、対比を裏づける比較表を優先し、本文が言及しない実験や細かすぎるアブレーションは除外) - [[wiki/surveys/RDMAネットワークモニタリングの教科書]]: wiki の 40 本超のソースと 20 近い概念ページを横断した 5 部 19 章 + 付録 5 節構成の教科書(1,400 行超)。RDMA ネットワークそのものの可観測性を主題とし、[[LLM学習インフラ実運用の教科書]](学習基盤全体)と [[NIC光トランシーバーのモニタリング]](光部品単体)の中間を埋める。第 I 部で機構(verbs/QP/WQE、RC と UD の非対称、IB と RoCEv2 の差、PFC/ECN/DCQCN の三層分業と DSCP 26=TC 3 のデファクト、Headroom = BW×RTT+MTU)から「監視を難しくする 7 つの構造的理由」(カーネルバイパスが観測点を消す、ワンサイドは受信側 OS に記録を残さない、RNIC がブラックボックス、カウンタ自体が壊れうる、verbs 層が薄すぎて障害を吸収も記録もしない、失敗が静かな性能低下として現れる、責任境界が観測を制約する)を導く。第 II 部は障害の分類学(IMC2018 の根本原因分布で Undetermined 29%・Hardware 13%、HPN の月 0.057%/日 5K〜60K フラップ、Astral の fail-stop 66%/fail-hang 17%/fail-slow 13%、PFC 4 病理、Meta 実測の「PFC が輻輳をエッジからコアへ 2 桁シフト」、CorrOpt の破損 vs 輻輳 6 軸比較と光パワー診断表、CCGrid の lift 分析で分散が高値を上回りパケットロスは 1.27x、Hostping の PCIe 1.4µs 差で 40% 減と ACS/ATS 誤設定、Husky の 1 Gbps 攻撃で 80→2 Gbps、RDMATracer の syscall 失敗 96% が他層信号を伴わず既存分類器が 25% 誤帰属)。第 III 部が中心で、計装点 7 層 × 時間軸 4 系統の座標系に全システムを配置し、各手法が「見えない異常」の列を明示。能動プローブ(Pingmesh→R-Pingmesh の UD QP + CQE 4 点タイムスタンプ・トモグラフィ投票・RNIC 偽陽性は監視系自身の CPU 占有、SkeletonHunter の 2 段階 87.5%+95% 削減、SRv6 で統計処理が不要化)、データプレーン(INT の 3 課題、Hawkeye の PFC プロベナンスと wait-for グラフ・精度 90%+・エポック 100µs〜1ms)、エンドホスト(Pulse の 32µs 根拠 = slice 40µs と 40(p-1)µs gap、RDMA Estats の FMR hidden fence、C4 の BSP 同期点、VCCL の WR/WC 二重閾値、LLMPrism のスイッチ層だけで 1 分 19 ジョブ識別、Astral の 4 層階層相関、RDMATracer の 13 hook、Hostping のループバック)、稼働前後(Collie の焼きなまし 10^36 空間と MFS、Lumina の in-network イベント注入とカウンタ不整合)を扱う。第 IV 部は実務(mlx5 の 5 計測点 × 3 種別と用途別カウンタ、粒度設計表、JANOG56 の 100ms→400Gb/1s→40Gb、オーバーヘッド実績表、受け入れ検証 10 項目、既定設定で最大 1 桁の取りこぼし、NCCL の LL/LL128/Simple 選択が帯域解釈を変える、TP が通信量 99% だがノード内で不可視)。第 V 部は統合の 3 形(階層相関/グラフ統合/楽観的分離)と未統合の空白、MRC が T0 側光障害を ride out する一方 NIC 側は原理的に不可能という非対称、エージェント型診断、未解決 8 群。付録に用語集・主要 28 システム一覧表・章別ソース対応・数値引用時の注意 8 件を収録 - [[wiki/surveys/AIワークロード基盤技術サーベイ]]: AI ワークロードを Kubernetes 上で動かす基盤技術を、スケジューリング([[Dynamic Resource Allocation (DRA)]]・[[トポロジ考慮型スケジューリング]]・[[Kueue]])/オーケストレーション(JobSet・[[LeaderWorkerSet]]・[[Kubernetes Workload・PodGroup API]])/デプロイスタック([[KFServing|KServe]]・[[NVIDIA Dynamo]]・[[llm-d]]・[[AIBrix]]・[[Gateway API Inference Extension]]・[[Envoy AI Gateway]]・[[agentgateway]])/エージェントワークロード([[kagent]]・[[Agent Sandbox]]・[[Agent Substrate]])の 4 層に整理したサーベイ論文形式の横断ドキュメント(9 節構成)。4 層がいずれも「単純化されすぎた旧 Kubernetes 抽象」を異なる軸(資源要求の表現力・スケジューリング単位・ルーティングの意味論・ワークロード形状)で刷新する同型の運動であること、刷新の方法論が「エコシステム実装をコアへ吸収する」対「コアは汎用に保ちレイヤーを重ねる」に分岐し両者の緊張が現在の論争軸をなすことを主張の骨格とする。KEP-4381/2724/4671/407 の設計判断、Kueue のメイクスパン 15% 改善と admission P99 25ms 未満、DAS のジョブ完了時間 36% 削減、GAIE の TTFT 6.25 倍改善と +3〜11ms のオーバーヘッド、WVA の 37% スループット改善と 6 RPS での HPA 逆転、Agent Sandbox 対 Agent Substrate の「Kubernetes 内拡張 対 外部専用基盤」の分岐を収録。カバレッジの薄い項目(JobSet・KServe・kagent の CRD 名・WAS)は §8 の充足度表と gap callout で明示し、優先 ingest 候補 5 件を提示 - [[wiki/surveys/時系列基盤モデルの教科書]]: wiki の 35 本超のソースと 6 concept を横断した 14 章構成(第 0〜13 章+付録)の教科書。前史(PromptCast/LLMTime/One Fits All と「専用>転用」への転回)、定義と設計空間(狭義/広義の定義・6 次元タクソノミー+タスク多様性軸)、トークン化 5 方式と正規化・スケール情報、アーキテクチャ(encoder/decoder 分岐の causality 機序・MoE 2 動機系統・disentanglement・非自己回帰化)、事前学習データ(コーパス規模表・合成データ 4 技法・leakage 対処)、目的関数 4+1 系統(点予測/categorical/パラメトリック/分位点/flow-matching)、多変量化(cross-variate 機構 4 世代・Takens 解釈・contradiction)、スケーリング則(Toto 2.0 の GPT-2 モーメント)と推論時最適化(SPRINT)・CPT 路線、主要 16 モデル各論と一覧表、評価(MASE/CRPS・ベンチ 6 種・飽和/漏洩/スコープ依存)、予測以外のタスク(k-Shape に勝てないクラスタリング・TSQA)、批判(One-Architecture-Fits-All 終焉論・O(1/√T) 下界)、LLM 推論・事後学習・エージェント層(3 層分業構図)、未解決の問い 8 件を包括 - [[wiki/surveys/NIC光トランシーバーのモニタリング]]: NIC に挿さる光トランシーバーをどのメトリクスで・どの計装点から・どの時間軸で監視するか(11 節構成)。冒頭 2 節で光トランシーバーの構造(レーザ/変調器/フォトディテクタ/増幅器、フォームファクタとレーン、DAC/AOC との違い)と用語(光パワー、バイアス電流、BER、FEC、pre/post-FEC BER、eSNR、DDM、I2C、AFR、グレイ障害)を初学者向けに整理。以降、規格レイヤ(SFF-8472/SFF-8636/CMIS VDM)、Linux/NIC 実装レイヤ(`ethtool -m`・FEC 統計・mlx5 カウンタ・mlxlink・SONiC)、**何を測ると当たるか**(CCGrid2023 の 350 万台・15 か月の lift 分析: エラーレート高値 9.13x が最大、温度/バイアス電流/Rx パワーの**高分散が高値を上回る**、パケットロスは 1.27x でほぼ無関係、予測は precision 72.8-95.7% に対し recall 21.2-50.0%)、**どの時間粒度で取るか**(OpTel の実測: 光イベントの 51.09% が一過性・20% は 1 秒のみ・15 秒より粗い粒度では一過性を一切検知できず、60 秒 DOM ポーリングの原理的限界)、pre-FEC BER とマージンの分布(RAIL: 99.9% が BER 1e-12 閾値超・中央値 6 倍の過剰設計、FEC 世代で要求が 1e-12→5e-5 に 7 桁緩和)、大規模実測 15 本の数値表(光トランシーバーのハード故障 **AFR 0.1341%**・ソフト故障は最大 **12.22 倍**、DIMM 並みに壊れにくいが DIMM 型のソフト故障多発部品)、CorrOpt/RAIL/OpTel/CCGrid の 4 本を目的関数(コスト削減/修復最適化/検知高速化/故障予測)で対比した系譜表を収録。図 4 点(光トランシーバーの内部構造と観測点、pre/post-FEC BER の崖、イベント継続時間と収集粒度、NIC 側とスイッチ側の救済可能性の非対称)をオライリー調のグレースケール線画で収録。主要知見は、公開されている光関連比率がすべて下限値であること、**部品 AFR と運用上の痛みが乖離**すること、**予兆は値の高さでなくばらつきと小さな初回観測に宿る**こと、NIC 側光トランシーバーが冗長化で救えない最後の単一障害点であること(MRC のトランスポート層と Shuffle の物理配線層が独立に同じ結論に到達)、CorrOpt が switch-to-switch 限定で **NIC 側は誰も検証していない**こと - [[wiki/surveys/LLM学習インフラ実運用の教科書]]: wiki の 145 ソース・96 コンセプト/エンティティを横断した 13 部 100 節構成の教科書(3,000 行超)。数千〜数万 GPU を数週間〜数か月止めずに走らせる運用を主題とする。基礎(SER 軸・スケーリング則・MFU/ETTR/MPG の測り分け)、性能を作る層(並列化 5 次元とメモリ内訳・ZeRO/FSDP・パイプラインバブル・FP8・集合通信と NCCL 内部・HPN/Meta RoCE/Astral/SAKURAONE のネットワーク実装比較・Ultra Ethernet・光配線・ストレージ I/O とスケジューラ比較)、信頼性の層(計装手法の侵襲度と粒度の比較・XProf/ARGUS/Pulse/LLMPrism/EROICA・故障統計の横並び・XID とサイレントデータ破損・Minder/Guard/Aegis/C4D/CCL-D/Mycroft/TrainCheck の診断システム比較・Gemini/FlashRecovery/FFTrainer/Unicron/ReCycle の復旧比較とチェックポイント間隔の逆算式)、事後学習と RL のインフラ(事前学習との要件比較・ロールアウト配分・RFT 障害 5 ファミリ)、効率と電力(MPG 三成分・計算とエネルギーの不整合)、実運用プレイブック(90 日ロードマップ・当番の判断表・隔離と復帰の閉ループ・成熟度モデル)、未解決問題を包括。付録 C に数値引用時の注意を集約 - [[wiki/surveys/SLI-SLO教科書]]: SRE の SLI/SLO 関連文献を基礎から応用まで網羅した 11 章構成の教科書。第 8 章「応用と拡張」は SLO 拡散(ベイジアンネットワーク)・SLX・Multi-tiered SLOs・クライアントサイド SLO(Luup 2024)・カーボン認識 SLO(CASCA)・Security Level Objectives・定常性モデルを統合し、8.8 で AI サービスの SLI(Goodput・コスト起因劣化・非決定性への 3 実務解・コストの SLO 化)を展開。第 9 章「Agentic 時代の SLI/SLO」は自律度レベルと権限契約、エラーバジェットを自律度ゲートに使う設計、SLO の不変条件化の困難、能力天井/ゴム印問題/Silent 失敗の三つの壁、SLO 主体の移行と監視のアイロニーを扱う(2026-08-17 拡充) - [[wiki/surveys/インシデント対応の教科書]]: SRE インシデント対応を検知から緩和、指揮体系から AI 支援まで体系化した 9 部 19 章構成の教科書。ICS/IC 育成/フォロワーシップ/調査戦略/認識論/Common Grounding/障害緩和/人的要因/ストレス管理/MTTR 批判/成熟度モデル/ChatOps/アンインシデント/シミュレーション/IR AI レベルを包括(ポストモーテムは姉妹編に分離) - [[wiki/surveys/KVキャッシュ管理の教科書]]: wiki の 40 近いソース・17 コンセプトを横断した 13 部 35 章構成の教科書(第 2 版 2026-07-31 で MLSys 2026 系ソースを反映。量子化という第 3 の削減軸(Kitty)、オフライン一括推論の大域最適化(BatchLLM)、スーパーチップ上の第 3 の粒度階層(SuperInfer)、PD 分離の適用条件の定量化(Beyond the Buzz・Meta)、スパース注意の容量律速(HiSparse)、バッチサイズという操作点(投機的復号)を追加)。基礎(容量式・プリフィルとデコードの非対称性)、単一 GPU 管理(PagedAttention・FlashAttention との役割分担)、再利用(RadixAttention・キャッシュ認識スケジューリング)、完全一致を超える再利用(CacheBlend・KVShare・ContextPilot と精度劣化の三者不一致)、階層化と二重粒度、クラスタ規模(PD 分離・Mooncake・過負荷制御)、アーキテクチャ削減(GQA/MLA/線形注意/DCP)、破棄と圧縮の限界(SCBench の 1/4 の崖)、本番ワークロード(Aliyun トレース・ワークロード対応退避)、耐障害性(FailSafe・アプリ層への漏れ)、計測と制御(Chakra・KV 利用率を制御信号にする)、ハードウェアと広域化(HBM4・IOWN APN)を包括。付録 D に数値引用時の注意を集約 - [[wiki/surveys/ポストモーテムの教科書]]: wiki 全体の 25+ ソース・15+ コンセプトを横断した 25 章構成の教科書。基礎(定義・三つの柱・プロセス)、理論(事故モデル・Cook 18 命題・ヒューマンファクタ)、実践(ファシリテーション・IR 執筆・プロセス比較)、パラダイムシフト(Repeat Incident Fallacy・Incident Legalism・learning > fixing)、測定(MTTR 批判・TTX)、発展(ストーリーテリング・クロスインシデント分析・考古学・知見のコード化)、研究フロンティア(AI 自動化・未解決の問い) --- ## Questions - [[wiki/questions/KVキャッシュ転送コストは再計算に比べて無視できるか]]: partially。転送は再計算より安いが「無視できる」はノード内 NVLink で KV が小さいときだけ。経路、KV サイズ、粒度で分かれる - [[wiki/questions/科学技術の知識循環]]: 科学、工学、技術、技芸、運用を、上流から下流へ流れる序列ではなく、異なる問いと正当化基準を持つ実践が結合した知識生産系として論じる。航空工学史、技術哲学、設計科学、アルゴリズム工学、システム管理、SRE を横断し、技術を人工物より広い関係の編成として捉え、技芸を工学化で消える残余ではなく暗黙の判断として位置づけ、運用を直接試行と価値の再設定を担う知識源として再定義した。単一の循環モデルも避け、認識、規範、制作、技能の四つの帰還と、問題、設計、実装、測定、結論の各境界で異なる妥当性を示す - [[wiki/questions/agentic時代のSLI-SLO運用]]: 「Agentic 時代の SLI/SLO」に混在する 3 つの問い(対象としての AI / 道具としての AI / 統治対象としての AI)を分離し、本 wiki の蓄積が第 3 の問いでほぼ空白であることを示した分析。AI ワークロードの SLI 体系(TTFT/ITL/Goodput/MPG)、LLM による SLI/SLO 起草の限界、assurance contract・verification wall・Transactional No-Regression と SLO の接続点が 2 点しかないこと、エラーバジェットを自律度ゲートに使う唯一の議論(Yoshikawa)と SRE AI Autonomy Levels の昇格定量基準の空白との対応、次に埋めるべき 5 つの空白を整理 - [[ポストモーテムと事後分析の文献横断ナラティブ]]: ポストモーテムと事後分析に関する文献を横断し、障害の構造的持続性→ブレームレス文化の深化→修復から学習への転換→形骸化の病理→横断分析の系譜→日本の実践→RCA の進化→AI 支援の展望を一つのストーリーとして CS 論文 Introduction 風にまとめた統合ナラティブ - [[QoA-3軸-詳細解説]]: Yang+ DSN2022 が提案した QoA の 3 軸(indicativeness / precision / handleability)を詳解。アンチパターンとの対応関係、TraceArk・AlertRank との接続、Zadka コストモデルとの相補性を整理 - [[Zadka-コストモデル-詳細]]: Zadka SREcon22 のアラート品質コストモデルを詳解。アンチクオリティ定式化・アラーム 3 分類・真アラームのレイテンシ 4 区間分解・コスト構造全体・Goodhart の法則への警戒を網羅 - [[QoAアンチパターン-防ぎ方]]: QoA を下げるアンチパターンを防ぐ 3 層構造(設計時 Avoidance / 運用時 Reaction / 自動検知改善)を整理。AlertRank・TraceArk・AlertGuardian が各層を担う関係を図示 - [[Toto-2アーキテクチャ比較-他TSFMとの特徴]]: Toto 2.0 の CPM・u-μP・NorMuon・arcsinh 正規化を軸に TimesFM・Falcon-X・Cisco TSM と比較。観測特化 TSFM で初のスケーリング則実証の意義を整理 - [[LM-vs-TSFM-decoder-only-差異]]: 言語モデルと TSFM が共に decoder-only Transformer を用いながら、入力トークン化・出力種別・スケール正規化・注意の次元数・推論様式・位置情報・事前学習目的関数の 7 軸で根本的に設計が異なることを解説(初心者向け解説付き) - [[Toto-2.0-vs-1.0-差分]]: Toto 1.0(151M 単一サイズ・逐次自己回帰)から 2.0(4M〜2.5B の 5 サイズ・CPM シングルパス・ピンボール損失・NorMuon・u-μP)への変更点を整理 - [[分位点損失と区間予測]]: 分位点損失(ピンボール損失)の仕組み、「独立に学習」の意味、区間予測がアラート・キャパシティ・異常検知で有用な理由を連問形式でまとめ - [[アラーティングの進歩-年代別]]: 1980s 商用 NMS から 2026 agentic SRE まで、10 層超の介入点が層分化し技術的介入と人間的・組織的介入が独立軸として並走する過程を年代別レビューで整理(2026-06-24 更新: SREcon 実践者エコシステム 15 件追加) - [[アラーティング学術実務マップ]]: 年代別に [A]学術 / [P]実務 / [H]産業研究の3区分で地図化。問題命名→規範確立→手法設計→大規模実証→実用化という通時的役割分担パターンと、AIM 体系化に含まれない非技術的介入など学術/実務の断絶4点を整理 - [[現代の理想的なアラーティング]]: 40 年弱の進化史から抽出した 7 設計原則(症状起点・アクショナブル・発火前保証・適切な受け手・多層介入・測定可能品質・Agentic 対応)と 4 面の組織的条件(インセンティブ・社会的合意・能力育成・文化)を統合した理想定義 - [[現代の理想的なアラーティング-判断モデル]]: 理想的アラーティングを、顧客影響・緊急性・対応主体・自動処理可能性・欠落リスクからページ、チケット、自律処理、診断情報、削除へ振り分ける判断モデルとして再構成 - [[TSFM単体とVLM統合の本質的差異]]: Toto は次パッチ予測器だが、VLM 統合版([[Toto-1.0-QA-Experimental]])は Toto を時系列エンコーダとして再利用し中間埋め込みを言語モデルへ射影する——予測器から「時系列を読んで言語で説明する推論器」への質的変化 - [[TSFM-TSMLLM-TotoQwen3VL-比較と基礎]]: TSFM・TS-MLLM(ChatTS)・Toto-Qwen3-VL の 3 者を Transformer 基礎(自己注意/パッチ化/Encoder-Decoder/トークン化/事前学習/RLVR)から出発して信号フロー・TS エンコーダ出自・多変量次元の扱い・モダリティ数・訓練パイプラインの 5 軸で比較。「予測精度の担い手 vs 推論の担い手」という役割分業と 2 段スタック統合の構図を整理 - [[multimodal-observability-foundation-model]]: オブザーバビリティ MELT を同時にネイティブ事前学習する基盤モデル **MELT-FM** 構想。Toto/Falcon-X(予測のみ)、TVDiag/TAMO(診断のみ、事前学習なし)、UModel(意味付与のみ)の空席を埋める。PathAttn・UModel グラウンディングトークン・eBPF 4 モダ同期コーパスが新規性の核 - [[Projection-MLP-学習の仕組み]]: Toto-1.0-QA-Experimental の Projection MLP 学習とは何か。Toto と Qwen3-VL の座標系変換を逆伝播で自動発見する 3 段階訓練(合成 SFT → 実データ SFT → RLVR)と LoRA 凍結戦略を初心者向けに整理 - [[@2025__TKDE__OpDiag - Unveiling Database Performance Anomalies Through Query Operator Attribution]] — [[OpDiag]]([[Shiyue Huang]]・[[Bin Cui]]、PKU/ZTE)が演算子→クエリ→KPI→異常を三段階 ML + 三段階帰属で自動遡及。top-2 内 100%・産業事例 1/3〜1/2 削減(本 wiki 初の演算子レベル DB 診断一次論文、IEEE TKDE 2025, DOI:10.1109/TKDE.2025.3557049) - [[Shiyue Huang]] — PKU 博士課程学生、OpDiag 第一著者(person) - [[Bin Cui]] — PKU 教授 IEEE Fellow、OpDiag 責任著者(person) - [[Yinjun Wu]] — PKU 助教(Penn 博士 2021)(person) - [[Ziwei Wang]] — HKUST Guangzhou 博士課程学生(person) - [[ZTE Corporation]] — 中国・南京の通信 ICT 企業、OpDiag 産業パートナー(organization) - [[OpDiag]] — クエリ演算子帰属による DB 性能異常診断フレームワーク(product) - [[DBPA]] — PKU/ZTE による OLTP DB 性能異常ベンチマーク(dataset) - [[@2025__SIGMOD__AgentTune - An Agent-Based Large Language Model Framework for Database Knob Tuning]] — [[AgentTune]]([[Yiyan Li]]・[[Haoyang Li]] ほか、RUC/ByteDance)が 4 専門 LLM エージェント + ビームサーチ木探索でノブチューニングを自動化。6 ベンチマーク全実験 Invalid Times=0・PIE SOTA(本 wiki 初の LLM エージェントベース DB ノブチューニング一次論文、SIGMOD 2025, DOI:10.1145/3769758) - [[AgentTune]] — RUC/ByteDance による 4 専門 LLM エージェントベース DB ノブチューニングフレームワーク(product) - [[Yiyan Li]] — Renmin University of China 博士課程学生、AgentTune 共筆頭著者(person) - [[Haoyang Li]] — Renmin University of China 博士課程学生、AgentTune 共筆頭著者(person) - [[Jing Zhang]] — Renmin University of China 准教授、AgentTune 共著者(person) - [[Cuiping Li]] — Renmin University of China 教授(工学研究センター MOE)、AgentTune 責任著者(person) - [[Hong Chen]] — Renmin University of China 教授(知識工学国家重点実験室 MOE)、AgentTune 共著者(person) - [[Renata Borovica-Gajic]] — University of Melbourne 准教授、AgentTune 共著者(person) - [[University of Melbourne]] — オーストラリアの研究大学、Renata Borovica-Gajic 所属(organization) - [[データベースノブチューニング]] — DBMS チューナブルパラメータ最適化。AgentTune が LLM エージェント化・木探索・ルールベース融合で Invalid Times=0 を達成(concept) - [[個人的知識蓄積の意味-稲見3部作から]]: 稲見昌彦3部作(科学の終焉 / Out of the Blue / ループのボトルネック)を横断し、個人 wiki の存在意義を Feel-through 媒質・翻訳層・情報顕微鏡・調律の4軸で考察。知識の所有から知覚の調律への変質を論じる - [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]] — FlowXpert: ワークフロー自動生成フレームワーク(KDD 2025, Nankai+Huawei Cloud)(source) - [[Binpeng Shi]] — Nankai University, FlowXpert 第一著者(person) - [[FlowXpert]] — トラブルシューティングワークフロー自動生成フレームワーク。10 週間本番承認率約 80%(product) - [[OpsFlowBench]] — Huawei Cloud DCN 由来の 252 件ワークフロー評価ベンチマーク(dataset) - [[@2020__SC20__Live Forensics for HPC Systems - A Case Study on Distributed Storage Systems]] — Kaleidoscope: HPC 分散ストレージ向け近リアルタイム障害フォレンジクスフレームワーク。Store Pings+PGM で箇所特定 99.3%・診断 95.8%(2 年本番 843 件)、オーバーヘッド < 0.01%(SC 2020)(source) - [[Kaleidoscope]] — UIUC/NCSA の Jha ら(SC 2020)が開発した HPC 分散ストレージ向け近リアルタイム障害フォレンジクスフレームワーク(product) - [[Blue Waters]] — NCSA/UIUC が運用するペタスケール HPC スーパーコンピュータ。Kaleidoscope の評価環境(product) - [[Subho S. Banerjee]] — UIUC の Kaleidoscope 共著者(person) - [[Zbigniew T. Kalbarczyk]] — UIUC のディペンダブルコンピューティング研究者。Kaleidoscope 共著(person) - [[@2026__arXiv__CUJBench - Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend]] — CUJBench: ブラウザ可視証拠+バックエンド可観測性の初のクロスモーダル障害診断ベンチマーク。87 シナリオ・6 モデル評価・A@1=19.7%・天井=52%、ブラウザ限定 > フルツール(arXiv:2604.23455, 2026)(source) - [[Haoming Meng]] — CUJBench 単著著者(person) - [[CUJBench]] — ブラウザ可視証拠+バックエンド可観測性統合の初のクロスモーダル障害診断ベンチマーク(product / benchmark) - [[OpenTelemetry Demo]] — OpenTelemetry のポリグロットマイクロサービス型 EC デモ。CUJBench テスト環境(product) - [[Tractor Store]] — マイクロフロントエンド型 EC アプリ。CUJBench テスト環境(product) - [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]] — Meta の DCN 設計自動化システム Matryoshka(NSDI 2026)。インテント駆動・決定論的・ステートレスなスイッチ設定コンパイラ。6 年間・18 種類・約 900 DCN、100K-GPU スーパークラスタを支える。学術研究の空白だった「設定生成」フェーズを本番システムで公開した初論文(source) - [[@2026__NSDI__HeteCCL - Synthesizing Near-Optimal Collective Communication Schedules for Heterogeneous GPU Clusters]] — 東北大学(中国)・Alibaba Cloud によるヘテロジニアス GPU クラスタ向け集合通信スケジュール自動合成ツール HeteCCL(NSDI 2026)。チャンキングでプリミティブ所要時間を均質化、CEGIS で探索空間を枝刈りし、TE-CCL 比最大 322.8× 高速合成・NCCL 比最大 2.8× 帯域幅・訓練効率 23〜37% 改善(source) - [[Northeastern University]] — 中国・遼寧省瀋陽市の重点理工系大学。HeteCCL の主要所属機関(organization) - [[SIAT]] — 中国科学院傘下の深圳市研究機関(SIAT)。HeteCCL の Chengxi Gao が所属(organization) - [[Lustre Unveiled]] — Lustre の 25 年を網羅した包括的サーベイ。アーキテクチャ・設計進化・5 系統比較・Frontier/Orion エクサスケール実績・将来方向性(ACM TOS 2025, DOI:10.1145/3736583)(source) - [[@2019__arXiv__The Lustre Storage Architecture]] — Lustre の原初設計文書「Lustre Book」。539 ページ、2001–2005 年執筆・2019 年公開(arXiv:1903.01955)(source) - [[Lustre]] — オープンソース並列ファイルシステム。Top500 上位 10 中 6 台採用、25 年超・750K LOC(product) - [[Frontier]] — ORNL のエクサスケールスパコン(AMD EPYC + MI250X)(product) - [[Orion]] — Frontier の Lustre FS。700 PB・4.7 TiB/s read・40 MDT(product) - [[DDN]] — HPC ストレージベンダ。2018 年に Intel の Lustre 事業を買収(organization) - [[Whamcloud]] — Lustre 開発企業。CFS→Intel→DDN 傘下(organization) - [[OpenSFS]] — Lustre オープンソースコンソーシアム(organization) - [[Anjus George]] — ORNL NCCS、Lustre Unveiled 筆頭著者(person) - [[Andreas Dilger]] — Whamcloud/DDN、主要 Lustre コントリビュータ(person) - [[Sarp Oral]] — ORNL NCCS、Frontier/Orion ストレージリーダー(person) - [[Peter J. Braam]] — Lustre 創出者、CFS 設立者(person) - [[Cluster File Systems]] — Lustre 開発スタートアップ(CFS)。Sun(2007)→Oracle(2010)買収(organization) - [[並列ファイルシステム]] — 複数ストレージサーバにデータを分散配置し並列 I/O でスループットを最大化する分散ファイルシステム。Lustre/GPFS/Ceph/BeeGFS/DAOS 比較(concept) - [[@2026__NSDI__EROICA - Online Performance Troubleshooting for Large-scale Model Training]] — Alibaba Cloud の ~100,000 GPU 本番クラスタで 1.5 年運用した性能トラブルシューティングシステム EROICA。全ワーカー同時オンラインプロファイリング + 関数挙動パターン差分で 97.5% 診断成功率(NSDI 2026)(source) - [[@2026__NSDI__Supercharging Packet-level Network Simulation of Large Model Training via Memoization and Fast-Forwarding]] — LLM 訓練の繰り返しパターンとステディステートをメモ化・早送りで活かす Wormhole が ns-3 比 744× 高速化を誤差 1% 未満で達成(NSDI 2026)(source) - [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]] — ε-差分プライバシー付きの軽量 VAE でネットワーク・クラウドテレメトリを保持し、50 倍のコスト削減と精度 60% 向上を両立(NSDI 2026)(source) - [[@2026__NSDI__FAST - An Efficient Scheduler for All-to-All GPU Communication]] — MoE AllToAllv の動的歪みを Birkhoff 分解で解く多項式時間スケジューラ。64 GPU で 221 µs、RCCL 比最大 4.48× 向上(NSDI 2026)(source) - [[Yu Guan]] — EROICA 筆頭著者(Alibaba Cloud / Zhejiang Lab)(person) - [[Dan Li]] — Wormhole(SimNet)共著者(Tsinghua University)(person) - [[Fuheng Zhao]] — PrvTel 共著者(University of Maryland)(person) - [[Zhejiang Lab]] — 中国・杭州の研究機関(之江実験室)。EROICA の共同研究機関(organization) - [[Zhongguancun Laboratory]] — 中国・北京の研究機関(中関村実験室)。Wormhole の共同研究機関(organization) - [[MangoBoost]] — 韓国のスタートアップ。FAST スケジューラの共同研究機関(organization) - [[University of Pennsylvania]] — 米国の研究大学(UPenn)。FAST 共著者の所属(organization) - [[ネットワークシミュレーション]] — ネットワーク挙動を模擬再現。LLM 訓練の規則性で ns-3 比 744× 高速化(concept) - [[差分プライバシー]] — ε-DP。テレメトリ保持で精度・コスト・プライバシーの三角トレードオフ(concept) - [[@2024__IEEE CLOUD__Enabling Programmable Metric Flows]] — [[IBM Research]] の [[PMF]]。LP 最適化で collect-first→use-first パラダイムを実現(IEEE CLOUD 2024)(source) - [[@2023__ICSE__LogReducer - Identify and Reduce Log Hotspots in Kernel on the Fly]] — [[LogReducer]]。eBPF + EMFP でカーネルログホットスポットを動的に 70〜95% 削減、[[WeChat]] 本番 1 年超(ICSE 2023)(source) - [[@2024__ESEM__Reducing Events to Augment Log-based Anomaly Detection Models - An Empirical Study]] — [[LogCleaner]]。ログイベント削減の異常検知モデルへの影響を 3 戦略×6 モデル×4 データセットで実証(ESEM 2024)(source) - [[@2023__NSDI__Hindsight - Tracing Edge-Cases in Distributed Systems]] — [[Hindsight]]。遡及的トレースサンプリングで全リクエスト軽量トレース + 障害後完全収集、100 万 req/s・30 秒以内(NSDI 2023)(source) - [[@2025__ISSTA__Tracezip - Efficient Distributed Tracing via Trace Compression]] — [[Tracezip]]。共通性・変動性分解で分散トレースを 80% 超圧縮しつつ異常検知精度を保持(ISSTA 2025)(source) - [[@2024__IEEE CLOUD__Astraea - Unleashing Performance Insights with Online Probabilistic Tracing]] — [[Astraea]]。スパンレベル [[VAIF]] 重要度スコアリングで 1% サンプリングでもヘッドベース同等の性能分析(IEEE CLOUD 2024)(source) - [[@2025__ASPLOS__Mint - Cost-Efficient Tracing with All Requests Collection via Commonality and Variability Analysis]] — [[Mint]]。共通性・変動性分析で全リクエスト収集かつストレージ 60% 削減(ASPLOS 2025)(source) - [[@2024__FSE__TraStrainer - Adaptive Sampling for Distributed Traces with System Runtime State]] — [[TraStrainer]]。システム実行時状態で tail-based sampling を強化、F1 +15%(ESEC/FSE 2024)(source) - [[PMF]] — IBM Research のプログラマブルメトリクスフローフレームワーク(product) - [[LogReducer]] — カーネルログホットスポット動的削減ツール(product) - [[WeChat]] — Tencent のメッセージングプラットフォーム(product) - [[LogCleaner]] — ログイベント削減による異常検知モデル強化手法(product) - [[Hindsight]] — 遡及的分散トレースサンプリングシステム(product) - [[OpenTelemetry]] — テレメトリの標準フレームワーク(product) - [[OTel-Arrow]] — Apache Arrow をテレメトリ転送・パイプライン処理に応用する OTel サブプロジェクト(SIG)。Phase 2 Dataflow Engine(Rust)で OTLP 比 20× スループット達成(concept / observability) - [[OTAP]] — OpenTelemetry Arrow Protocol。Arrow カラム型エンコーディングベースのテレメトリワイヤプロトコル(concept / observability / protocol) - [[Apache-Arrow|Apache Arrow]] — ベンダー非依存のカラム型インメモリデータフォーマット標準。OTel-Arrow に採用(product / data-format) - [[Tracezip]] — トレース圧縮システム(product) - [[Astraea]] — オンライン確率的トレーシング(product) - [[VAIF]] — Astraea のスパン重要度推定モジュール(product) - [[Mint]] — 全リクエスト収集トレーシング(product) - [[TraStrainer]] — 適応的トレースサンプリング(product) - [[Jonathan Mace]] — Hindsight 筆頭著者(person) - [[Kangjin Wang]] — PMF 筆頭著者(person) - [[Zibin Zheng]] — Tracezip 責任著者(person) - [[Mehmet Toslali]] — Astraea 筆頭著者(person) - [[Ayse K. Coskun]] — Astraea 責任著者(person) - [[Haiyu Huang]] — TraStrainer 筆頭著者(person) - [[Max Planck Institute for Software Systems]] — MPI-SWS。Hindsight の著者所属(organization) - [[トレースサンプリング]] — 分散トレーシングの 4 系統サンプリング戦略(concept) - [[@2025__DSN-W__Characterizing Modern GPU Resilience and Impact in HPC Systems - A Case Study of A100 GPUs]] — [[Delta]] の A100 106 ノード/448 GPU を対象にした 3 年・12.5M GPU 時間の GPU レジリエンスケーススタディ。GPU メモリは非メモリハードウェアより 160 倍高信頼で、弱点は GSP・PMU SPI・MMU・NVLink。A100 ではメモリ回復機構が効き、後続の A100/H100 比較の基準線になる(DSN-W 2025) - [[Archit Patke]] — Delta A100 GPU レジリエンス研究の共同筆頭著者(UIUC)(person) - [[Ziheng Chen]] — Delta A100 GPU レジリエンス研究の共同筆頭著者(UIUC)(person) - [[Aditya Ranjan]] — Delta A100 GPU レジリエンス研究の共同筆頭著者(UIUC)(person) - [[Hung Nguyen]] — Delta A100 GPU レジリエンス研究の共著者(UIUC)(person) - [[Phuong Cao]] — Delta A100 GPU レジリエンス研究の共著者(UIUC)(person) - [[Brett Bode]] — Delta A100 GPU レジリエンス研究の共著者(UIUC/NCSA)(person) - [[Gregory Bauer]] — Delta A100 GPU レジリエンス研究の共著者(UIUC/NCSA)(person) - [[Chandra Narayanaswami]] — Delta A100 GPU レジリエンス研究の共著者(IBM Research)(person) - [[Daby Sow]] — Delta A100 GPU レジリエンス研究の共著者(IBM Research)(person) - [[Catello Di Martino]] — Delta A100 GPU レジリエンス研究の共著者(Nokia Bell Labs)(person) - [[@2025__arXiv__Nemotron 3 - Efficient and Open Intelligence]] — NVIDIA のオープン LLM ファミリー Nemotron 3 の技術報告書。ハイブリッド Mamba-2–Transformer MoE + LatentMoE + NVFP4 事前学習 + マルチ環境同時 RL。Nano(30B/3B)で同規模 MoE 比 3.3 倍推論スループット(arXiv:2512.20856, 2025)(source) - [[Nemotron 3]] — NVIDIA のオープン LLM ファミリー。Nano/Super/Ultra の 3 モデル(product) - [[LatentMoE]] — NVIDIA のハードウェア認識型 MoE エキスパート設計。潜在次元で通信削減を精度に再投資(product) - [[NeMo-RL]] — NVIDIA のスケーラブル RL 訓練フレームワーク(Apache 2.0)(product) - [[@2025__Moonshot AI__Kimi-Researcher - End-to-End RL Training for Emerging Agentic Capabilities]] — [[Moonshot]] の自律型リサーチエージェント Kimi-Researcher のプロジェクトページ。エンドツーエンドの REINFORCE のみで HLE Pass@1 26.9%・xbench-DeepSearch 69%。ガンマ減衰報酬・コンテキスト管理・ターンレベル部分ロールアウト・Kubernetes+MCP 非同期インフラ(2025)(source) - [[Kimi-Researcher]] — [[Moonshot]] のエンドツーエンド RL 訓練による自律型リサーチエージェント(product / agent) - [[@2026__arXiv__Composer 2 Technical Report]] — [[Cursor Research]] のエージェント型コーディングモデル Composer 2 の技術報告書。Kimi K2.5 ベース 1.04T/32B MoE を継続事前学習 + 大規模非同期 RL で訓練。CursorBench 61.3・SWE-bench Multi 73.7(arXiv:2603.24477, 2026)(source) - [[Cursor Research]] — AI コーディングエディタ Cursor のリサーチ部門(organization) - [[Composer 2]] — Cursor Research のエージェント型コーディングモデル(1.04T/32B MoE)(product) - [[CursorBench]] — Cursor の内部コーディングエージェントベンチマーク(dataset) - [[Anyrun]] — Cursor の Firecracker VM 基盤コード実行プラットフォーム(product) - [[Fireworks AI]] — LLM 推論基盤企業。Composer 2 の RL 推論パートナー(organization) - [[ThunderKittens]] — Stanford Hazy Research の GPU カーネルフレームワーク(repository) - [[DeepEP]] — DeepSeek のエキスパート並列通信ライブラリ(repository) - [[@2025__arXiv__OLMo 3]] — AI2 の完全オープン LLM ファミリー OLMo 3 の技術報告書(118 ページ)。7B/32B、SWA、Base/Think/Instruct/RL-Zero の 4 変種。モデルフロー全公開。OLMo 3.1 Think 32B は完全オープンモデル最強(arXiv:2512.13961, 2025)(source) - [[Allen Institute for AI]] — 米国シアトルの非営利 AI 研究所(AI2)。OLMo 3 を開発(organization) - [[OLMo 3]] — AI2 の完全オープン LLM ファミリー(7B/32B)(product) - [[OlmoRL]] — AI2 の完全非同期 RL 訓練インフラ。GRPO 7 改善(product) - [[OlmoBaseEval]] — AI2 のベースモデル評価スイート。43 タスク・5 クラスタ(product) - [[olmOCR]] — AI2 の PDF テキスト変換パイプライン(product) - [[Duplodocus]] — AI2 の Rust 製大規模重複排除ツールキット(product) - [[Dolma 3]] — AI2 の OLMo 3 事前学習データスイート(dataset) - [[Dolci]] — AI2 の OLMo 3 後訓練データスイート(dataset) - [[オープンLLM開発]] — LLM の訓練パイプライン全体を公開する開発方式(concept) - [[@1983__Automatica__Ironies of Automation]] — Bainbridge (1983) による自動化のパラドクスの古典論文。技能劣化・監視の不可能性・残余タスク・訓練投資の逆説を体系化(source) - [[Lisanne Bainbridge]] — UCL 心理学部。"Ironies of Automation" (1983) の著者(person) - [[University College London]] — ロンドンの研究大学。Bainbridge の所属(organization) - [[自動化のアイロニー]] — 自動化がオペレータの問題を拡大する構造的パラドクスの総称(concept) - [[@1985__Tandem__Why Do Computers Stop and What Can Be Done About It]] — Gray (1985) の耐障害システム古典論文。2,000 台超の障害統計で管理(42%)とソフトウェア(25%)が主因を実証(source) - [[Jim Gray]] — Tandem Computers 研究者。耐障害システム・Heisenbug 概念の定義者。チューリング賞(1998)(person) - [[Tandem Computers]] — 耐障害コンピュータの先駆企業。NonStop システムを開発(organization) - [[NonStop]] — Tandem の耐障害コンピュータシステム(product) - [[ソフトウェア耐障害性]] — ソフトウェアバグが存在してもシステム可用性を維持する設計原則の総体(concept) - [[Heisenbug]] — 再現困難で観察により消失するソフトウェアバグの類型(concept) - [[プロセスペア]] — 主プロセスとバックアップの対による耐障害実行パターン(concept) - [[@2003__USITS__Why Do Internet Services Fail and What Can Be Done About It]] — Oppenheimer+ (2003) の 3 大規模インターネットサービス障害分析。オペレータエラー(特に設定ミス)が最大原因を実証(source) - [[David Oppenheimer]] — UC Berkeley ROC Project。インターネットサービス障害分析の筆頭著者(person) - [[Archana Ganapathi]] — UC Berkeley ROC Project 共著者(person) - [[David A. Patterson]] — UC Berkeley 教授。RISC・RAID の共同発明者(person) - [[UC Berkeley ROC Project]] — Recovery-Oriented Computing プロジェクト(organization) - [[運用障害分析]] — 障害事後報告の体系的収集・分類による実証的信頼性研究(concept) - [[@2007__LISA__On Designing and Deploying Internet-Scale Services]] — Hamilton (2007) のインターネットスケールサービス設計のベストプラクティス集(source) - [[James Hamilton]] — Microsoft → Amazon。インターネットスケールサービス設計の体系化者(person) - [[インターネットスケールサービス設計]] — 障害前提・自動化・単純さを柱とする大規模サービス設計原則群(concept) - [[@2016__OReilly__SRE Book - Chapter 5 Eliminating Toil]] — Vivek Rau によるトイルの定義と削減原則。トイル=手作業・反復的・自動化可能・戦術的・持続的価値なし・線形スケール。Google SRE の 50% ルール(実測平均 33%)(source) - [[@2016__OReilly__SRE Book - Chapter 6 Monitoring Distributed Systems]] — Rob Ewaschuk による分散システムモニタリング。ホワイトボックス/ブラックボックス、4 つのゴールデンシグナル(レイテンシ・トラフィック・エラー・サチュレーション)、パーセンタイル分布(source) - [[@2016__OReilly__SRE Book - Chapter 7 Automation at Google]] — Niall Murphy らによる Google の自動化進化。5 段階階層、MySQL の Borg 移行で 95% 削減、Diskerase 障害(自動化の増幅リスク)(source) - [[@2016__OReilly__SRE Book - Part III Practices]] — サービス信頼性ヒエラルキー(7 層)。モニタリング→インシデント対応→RCA→テスト→キャパシティプランニング→アーキテクチャ→プロダクトローンチ(source) - [[@2016__OReilly__SRE Book - Chapter 34 Conclusion]] — Benjamin Lutch による総括。SRE の二重の役割(パイロットとエンジニア)、航空産業のアナロジー、中核的関心事の不変性(source) - [[SRE Book]] — "Site Reliability Engineering: How Google Runs Production Systems"(O'Reilly, 2016)。SRE ディシプリンの定義書(product) - [[SRE Workbook]] — "The Site Reliability Workbook"(O'Reilly, 2018)。SRE Book の原則を SLO 文書・エラーバジェット方針・アラート・オンコール・ポストモーテムへ落とす実践編(product) - [[Ben Treynor Sloss]] — Google VP Engineering、SRE 創設者。「信頼性はあらゆるプロダクトの最も基本的な特性」(person) - [[Betsy Beyer]] — Google テクニカルライター。SRE Book(2016)および SRE Workbook(2018)の編者(person) - [[Niall Murphy]] — Google SRE。SRE Book 共同編者、第 7 章(自動化)の著者(person) - [[Margaret Hamilton]] — MIT Instrumentation Laboratory ソフトウェアエンジニアリング部門ディレクター。Apollo 計画、「ソフトウェアエンジニアリング」の造語者(person) - [[@2016__OReilly__SRE Book - Foreword]] — Mark Burgess による序文。Google の第一原理からの SRE 構築、「実装は一時的だが文書化された推論は無価値にならない」(source) - [[@2016__OReilly__SRE Book - Preface]] — 運用ライフサイクル(総コスト 40-90%)、SRE の 3 次元、Margaret Hamilton の Apollo 計画(source) - [[@2016__OReilly__SRE Book - Chapter 1 Introduction]] — Ben Treynor Sloss。SRE の定義、50% ルール、エラーバジェット、プレイブック MTTR 3 倍改善、変更起因障害 70%(source) - [[@2016__OReilly__SRE Book - Chapter 3 Embracing Risk]] — Marc Alvidrez。100% 信頼性への反論、非線形コスト曲線、エラーバジェットの共通インセンティブ(source) - [[@2016__OReilly__SRE Book - Chapter 4 Service Level Objectives]] — Chris Jones, John Wilkes, Niall Murphy。SLI/SLO/SLA フレームワーク、パーセンタイル重視(source) - [[@2018__Google SRE Workbook__Foreword I]] — Mark Burgess による序文。SRE Workbook を約束の設定・評価・修復の実践として位置づけ(source) - [[@2018__Google SRE Workbook__Foreword II]] — Andrew Clay Shafer による序文。SRE 原則を DevOps の理想と接続(source) - [[@2018__Google SRE Workbook__Chapter 1 How SRE Relates to DevOps]] — SRE と DevOps の関係。SRE は DevOps の文化原則に SLO・エラーバジェット・トイル制御を与える(source) - [[@2018__Google SRE Workbook__Chapter 2 Implementing SLOs]] — SLI 仕様/実装、ユーザー中心 SLO、4 週間ローリングウィンドウ、ステークホルダー合意(source) - [[@2018__Google SRE Workbook__SLO Engineering Case Studies]] — Evernote と The Home Depot の SLO 導入事例(source) - [[@2018__Google SRE Workbook__Monitoring]] — SLO に結びついた監視戦略、監視設定 as Code、アラートロジックのテスト(source) - [[@2018__Google SRE Workbook__Alerting on SLOs]] — エラーバジェットバーン率、複数ウィンドウ複数バーン率アラート、低トラフィックサービス(source) - [[@2018__Google SRE Workbook__Eliminating Toil]] — トイル測定、削減戦略、自動化と業務廃止の事例(source) - [[@2018__Google SRE Workbook__Simplicity]] — SRE における単純さ、システム複雑性の proxy、循環依存と設定標準化(source) - [[@2018__Google SRE Workbook__Part II Practices]] — SRE 実践パートの導入。運用作業とプロジェクト作業の関係、NALSD への橋渡し(source) - [[@2018__Google SRE Workbook__On-Call]] — オンコール設計、ページャー負荷、シフト設計、心理的安全性(source) - [[@2018__Google SRE Workbook__Incident Response]] — IC/CL/OL、3C、Google と PagerDuty のインシデント対応事例(source) - [[@2018__Google SRE Workbook__Chapter 10 Postmortem Culture - Learning from Failure]] — ブレームレスポストモーテム文化、良い/悪いポストモーテム比較、アクションアイテム追跡(source) - [[@2018__Google SRE Workbook__Conclusion]] — SRE の企業導入拡大、隣接領域への展開、DevSecOps への示唆(source) - [[@2018__Google SRE Workbook__Appendix A Example SLO Document]] — Example Game Service の SLO 文書例。可用性・レイテンシ・鮮度・正確性・完全性(source) - [[@2018__Google SRE Workbook__Appendix B Example Error Budget Policy]] — 4 週間窓のエラーバジェット方針、変更停止、P0 アクションアイテム(source) - [[@2018__Google SRE Workbook__Appendix C Results of Postmortem Analysis]] — ポストモーテム分析の集計例。変更起因障害とプロセス失敗の学習(source) - [[エラーバジェット]] — SLO で許容される障害量の上限を「予算」として扱い、開発と SRE の共通インセンティブを形成する仕組み(concept) - [[トイル]] — 手動的・反復的・自動化可能・戦術的で持続的価値のない運用作業の総称。Google SRE の 50% ルールで管理(concept) - [[@2018__CNCF WG Serverless__Serverless Overview Whitepaper v1.0]] — CNCF WG Serverless(2018)が策定したサーバーレスコンピューティング定義・ユースケース・Function 仕様・エコシステム勧告白書。FaaS+BaaS の 2 要素、CaaS/PaaS との 3 択比較、n:m イベント-Function マッピング、Function Workflow の 5 パターン・6 状態を体系化。コールドスタート・標準化不足を 2018 年時点の課題として明示(source / whitepaper) - [[@2019__yuuk.io__Rethinking-Serverless-Architecture]] — Yuuki Tsubouchi(2019)によるサーバーレスアーキテクチャ再考。サーバーレス=「サーバという単位を意識しない」と定義し直し、FaaS+BaaS のピタゴラスイッチ構成を解説(source) - [[サーバーレスアーキテクチャ]] — FaaS+BaaS の組み合わせ。CNCF 公式(外部・運用視点: サーバー管理不要)と Yuuki Tsubouchi(内部・アーキテクチャ視点: 2 種のサーバーを隠蔽)の相補的定義。CaaS/PaaS との比較では制御粒度・課金粒度が決め手(concept) - [[サーバーレスワークフロー]] — 複数イベントと Function を n:m マッピングで結び、逐次・並列実行・条件分岐・連鎖で構成するオーケストレーションパターン。CNCF 白書(2018)が 5 パターン・6 状態を定義。AWS Step Functions 等のステートマシン型が代表実装(concept) - [[@2024__arXiv__DeepSeek LLM - Scaling Open-Source Language Models with Longtermism]] — DeepSeek-AI 初代基盤モデル(7B/67B dense)。非埋め込み FLOPS/トークン M でスケーリング則を拡張(source) - [[@2024__arXiv__DeepSeek-Coder - When the Large Language Model Meets Programming]] — コード特化 LLM。87 言語・2T トークン、FIM 最適化。6.7B で CodeLlama-34B を凌駕(source) - [[@2024__arXiv__DeepSeek-V3 Technical Report]] — 671B MoE。MLA・補助損失なし負荷分散・MTP・FP8・DualPipe。約 557 万ドルで訓練(source) - [[@2025__arXiv__DeepSeek-R1 - Incentivizing Reasoning Capability in LLMs via Reinforcement Learning]] — SFT なし純粋 RL で推論能力創発。GRPO + 規則ベース報酬で aha モーメント(source) - [[@2025__arXiv__DeepSeek-V3.2 - Pushing the Frontier of Open Large Language Models]] — DSA・GRPO 安定化・合成エージェント環境で事後学習を大幅強化(source) - [[@2024__arXiv__DeepSeek-VL2 - Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding]] — MoE ベース VLM。活性化 4.5B で密モデル 8B 級(source) - [[@2025__DeepSeek__DeepSeek-V4 - Towards Highly Efficient Million-Token Context Intelligence]] — MegaMoE・CSA+HCA ハイブリッド圧縮で 100 万トークン推論(source) - [[DeepSeek-AI]] — 中国の AI 研究企業。DeepSeek LLM/Coder/V3/R1/V3.2/VL2/V4 シリーズを開発(entity) - [[DeepSeek LLM]] — 初代基盤モデル(7B/67B dense)(entity) - [[DeepSeek-Coder]] — コード特化 LLM(1.3B〜33B)(entity) - [[DeepSeek-V3]] — 671B MoE モデル(37B 活性化)(entity) - [[DeepSeek-R1]] — 推論特化モデル。SFT なし RL で推論創発(entity) - [[DeepSeek-R1-Zero]] — R1 の SFT なし純粋 RL 変種(entity) - [[DeepSeek-V3.2]] — V3 後継。DSA・GRPO 安定化(entity) - [[DeepSeek-VL2]] — MoE ベース VLM(entity) - [[DeepSeek-V4]] — 最新フラグシップ。100 万トークンコンテキスト(entity) - [[Multi-head Latent Attention]] — 低ランク KV 圧縮アテンション機構(entity) - [[DualPipe]] — 双方向オーバーラップパイプライン並列(entity) - [[HAI-LLM]] — DeepSeek の分散学習フレームワーク(entity) - [[MegaMoE]] — V4 の MoE 実行カーネル(entity) - [[Daya Guo]] — DeepSeek-Coder 筆頭著者(entity) - [[LLMスケーリング則]] — LLM 損失のべき乗則。データ品質が最適配分を左右(concept) - [[コードLLM]] — コード生成・補完に特化した LLM(concept) - [[マルチトークン予測]] — 1 フォワードパスで複数トークンを同時予測(concept) - [[ビジョン言語モデル]] — 視覚と言語を統合するマルチモーダル LLM(concept) - [[@2016__OReilly__SRE Book - Chapter 10 Practical Alerting from Time-Series Data]] — Borgmon の設計と Prometheus への系譜、宣言型ルール評価(source) - [[@2016__OReilly__SRE Book - Chapter 11 Being On-Call]] — オンコールの量的・質的均衡原則、フォロー・ザ・サン(source) - [[@2016__OReilly__SRE Book - Chapter 12 Effective Troubleshooting]] — 仮説演繹法に基づくトラブルシューティングの体系化(source) - [[@2016__OReilly__SRE Book - Chapter 13 Emergency Response]] — テスト誘発型障害 vs 訓練なし障害の対比(source) - [[@2016__OReilly__SRE Book - Chapter 14 Managing Incidents]] — ICS に基づくインシデント管理の 4 役割(source) - [[@2016__OReilly__SRE Book - Chapter 15 Postmortem Culture - Learning from Failure]] — ブレームレスポストモーテム文化の定着(source) - [[@2016__OReilly__SRE Book - Chapter 16 Tracking Outages]] — Outalator によるアウテージのパッシブ集約と追跡(source) - [[@2016__OReilly__SRE Book - Chapter 17 Testing for Reliability]] — テストと信頼性の定量的関係、カナリアテスト(source) - [[@2016__OReilly__SRE Book - Chapter 18 Software Engineering in SRE]] — Auxon による意図ベースのキャパシティプランニング(source) - [[@2016__OReilly__SRE Book - Chapter 28 Accelerating SRE On-Call]] — 体系的オンボーディング、Shadow→On-Call→Project Owner(source) - [[@2016__OReilly__SRE Book - Chapter 29 Dealing with Interrupts]] — 時間の二極化と認知的フロー状態(source) - [[@2016__OReilly__SRE Book - Chapter 30 Embedding an SRE to Recover from Operational Overload]] — 埋め込み SRE の 3 フェーズモデル(source) - [[@2016__OReilly__SRE Book - Chapter 31 Communication and Collaboration in SRE]] — プロダクションミーティングとチーム連携(source) - [[@2016__OReilly__SRE Book - Chapter 32 The Evolving SRE Engagement Model]] — PRR→早期関与→フレームワークの進化(source) - [[@2016__OReilly__SRE Book - Chapter 33 Lessons Learned from Other Industries]] — 航空・医療・製造業からの教訓(source) - [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]] — [[Zexin Wang]]・[[Changhua Pei]] ほか。LLM エージェントシステムの異常タクソノミーと AgentOps フレームワーク(IEEE TSE, arXiv 2026-06-01) - [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]] — [[Runzhou Wang]]・[[Shenglin Zhang]]・[[Dan Pei]] ほか(南開大学・清華大学)。マイクロサービス RCL における entity-level 異質性の実証分析と NexusRCL(異種グラフ+半教師付き能動学習、arXiv:2604.26670, 2026-04-29) - [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]] — [[Debopam Bhattacherjee]] ほか [[Microsoft]]。[[AI Greenferencing]] 展開モデルと可変風力電力下 LLM 推論ルーター [[XWind]](arXiv:2605.23348, 2026-05-22) - [[XWind]] — [[Microsoft]] の再生可能エネルギーファーム向け LLM 推論クロスサイトルーター(product) - [[Debopam Bhattacherjee]] — [[Microsoft]] リサーチャー。[[AI Greenferencing]] と [[XWind]] の提唱者(person) - [[@2026__応用物理__機械学習の原点 - 統計的機械学習の世界]] — [[赤穂昭太郎]]([[産業技術総合研究所]])による応用物理誌基礎講座。少量データ・解釈性が重要な応用物理・材料科学向けに[[統計的機械学習]]・[[ベイズ最適化]]・[[アンサンブル学習]]を概説(source, 応用物理 Vol.95 No.5, 2026) - [[AI Greenferencing]] — 再生可能エネルギーの発電源にモジュラー型 AI コンピュートを配置する展開モデル(concept) - [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]] — [[Changhua Pei]]・[[Gaogang Xie]]・[[Dan Pei]] ほか(CNIC CAS/UCAS/Alibaba/Tsinghua)。オブザーバビリティのオブジェクト中心統一モデリング [[UModel]] と U-SPL。[[Alibaba Cloud]] 本番 1 年以上・RCA 精度 8% 向上(arXiv:2606.04799, 2026-06-03) - [[UModel]] — CNIC/CAS・UCAS・[[Alibaba Cloud]] が開発したエージェント対応オブザーバビリティデータモデリングフレームワーク(product) - [[Gaogang Xie]] — CNIC/CAS・Hangzhou Institute for Advanced Study UCAS の研究者。[[UModel]] 共著者(person) - [[オブザーバビリティデータモデル]] — メトリクス・ログ・トレースをエンティティ・関係・セマンティクスとしてモデル化しエージェント RCA を支援するデータアーキテクチャ(concept) - [[@2022__IEEE ACCESS__A Survey on Observability of Distributed Edge & Container-Based Microservices]] — [[Muhammad Usman]]・[[Simone Ferlin]]・[[Anna Brunstrom]]・[[Javid Taheri]]([[Karlstad University]])。分散エッジ・コンテナ化マイクロサービスのオブザーバビリティ包括サーベイ。三本柱・SRE ゴールデンシグナル・F*/C* 枠組み・オープン課題(IEEE ACCESS 2022, DOI:10.1109/ACCESS.2022.3193102) - [[Muhammad Usman]] — [[Karlstad University]] ポスドク研究員。エッジコンピューティング・分散システムオブザーバビリティ研究者(person) - [[Simone Ferlin]] — [[Red Hat]] シニア性能エンジニア。MPTCP・輻輳制御の専門家(person) - [[Anna Brunstrom]] — [[Karlstad University]] 教授。分散システム・5G ネットワーク研究者(person) - [[Javid Taheri]] — [[Karlstad University]] 教授。クラウド・SDN 最適化研究者(person) - [[Karlstad University]] — スウェーデンの大学。5G・エッジ・オブザーバビリティ研究グループを擁する(organization) - [[@2015__CSUR__Performance Anomaly Detection and Bottleneck Identification]] — [[Olumuyiwa Ibidunmoye]]・[[Francisco Hernández-Rodriguez]]・[[Erik Elmroth]]([[Umeå University]])。PADBI 分野の体系的サーベイ(ACM CSUR 2015)。4 検知戦略・統計/ML 手法の分類体系・クラウド固有課題を整理(source) - [[Olumuyiwa Ibidunmoye]] — [[Umeå University]] 研究者。PADBI サーベイ第一著者(person) - [[Francisco Hernández-Rodriguez]] — [[Umeå University]] 研究者。PADBI サーベイ共著者(person) - [[Erik Elmroth]] — [[Umeå University]] 教授。クラウドコンピューティング・自律システム専門(person) - [[Umeå University]] — スウェーデン北部の大学。クラウドコンピューティング・分散システム管理研究で知られる(organization) - [[@2021__ISSRE__How Long Will it Take to Mitigate this Incident for Online Service Systems]] — [[Weijing Wang]]ほか([[Tianjin University]]/[[Microsoft]])。インシデント TTM 予測の最初の深層学習研究(IEEE ISSRE 2021)。T3 が TTM の 70% を占める実証・TTMPred(biGRU+アテンション+連続損失)が MAE 25.66% 改善(source) - [[Weijing Wang]] — [[Tianjin University]] の研究者。TTMPred(ISSRE 2021)筆頭著者(entity / person) - [[Tianjin University]] — 中国・天津市の国立研究大学(entity / organization) - [[インシデントTTM予測]] — インシデント緩和時間(TTM)を複数時点で予測する ML タスク。T3 フェーズが支配的という実証に基づく(concept) - [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]] — [[Junjie Chen]]・[[Qingwei Lin]](対応)ほか([[Tianjin University]] / [[Microsoft]] / [[University of Newcastle]] / [[Peking University]])。Microsoft 18 オンラインサービスで incidental incidents が平均 50.32%・TTR の 55.05% を消費すると初めて定量化(ASE 2020)。attention 付き CNN + 関連 incident 取り込みの [[DeepIP]] が AUC 0.808 で bug-severity 流用ベースラインを 18 全システムで上回る(source) - [[Junjie Chen]] — [[Tianjin University]] 助教。DeepIP(ASE 2020)筆頭著者(entity / person) - [[Shu Zhang]] — [[Microsoft]] Research Beijing 所属(2020)。DeepIP 共著者(entity / person) - [[Xiaoting He]] — [[Microsoft]] Research Beijing 所属(2020)。DeepIP 共著者(entity / person) - [[Dan Hao]] — [[Peking University]] 所属。ソフトウェア工学・AIOps 研究者。DeepIP 共著者(entity / person) - [[Feng Gao]] — [[Microsoft Azure]] Redmond 所属。DeepIP 共著者(entity / person) - [[Zhangwei Xu]] — [[Microsoft Azure]] Redmond 所属。DeepIP 共著者(entity / person) - [[Yingnong Dang]] — [[Microsoft Azure]] Redmond 所属。DeepIP 共著者(entity / person) - [[University of Newcastle]] — オーストラリア Callaghan 所在の公立研究大学。[[Hongyu Zhang]] が 2020〜2021 年時点で所属(entity / organization) - [[DeepIP]] — Microsoft の attention 付き CNN + 関連 incident 取り込みベースのインシデント優先順位付け手法。AUC 平均 0.808(entity / product) - [[インシデント優先順位付け]] — 自動報告された大量のインシデントを essential / incidental に分類して工数最適化するタスク。Chen+ ASE2020 が 6 カテゴリ taxonomy を導出(concept) - [[@2023__ISSRE__How to Manage Change-Induced Incidents - Lessons from the Study of Incident Life Cycle]] — [[Yujin Zhao]]・[[Ling Jiang]]ほか([[Peking University]]/[[Alibaba Group]])。変更起因インシデントのライフサイクル分析(IEEE ISSRE 2023)。RaIC vs RbIC・TTD 7.67 倍差・モニター失敗 3 類型(source) - [[@2023__ICSE-SEIP__An Empirical Study on Change-induced Incidents of Online Service Systems]] — [[Yifan Wu]]・[[Ying Li]]ほか([[Peking University]]/[[Ant Group]])。Ant Group の変更起因インシデント実証分析(ICSE-SEIP 2023)。重篤度 2.6 倍・4 課題の特定(source) - [[変更起因インシデント]] — ソフトウェア変更が起因のインシデントの分類・ライフサイクル・緩和戦略。RbIC は RaIC より TTM を 40.6% 短縮(concept) - [[Yujin Zhao]] — [[Peking University]]/[[Alibaba Group]]。変更起因インシデントライフサイクル論文第一著者(person) - [[Ling Jiang]] — [[Alibaba Group]] エンジニア。変更起因インシデントライフサイクル論文共著者(person) - [[Ye Tao]] — [[Peking University]] 研究者。変更起因インシデントライフサイクル論文共著者(person) - [[Songlin Zhang]] — [[Alibaba Group]] エンジニア。変更起因インシデントライフサイクル論文共著者(person) - [[Changlong Wu]] — [[Alibaba Group]] エンジニア。変更起因インシデントライフサイクル論文共著者(person) - [[Yifan Wu]] — [[Peking University]] 研究者。ISSRE 2023・ICSE-SEIP 2023 の両論文著者(person) - [[Zhonghai Wu]] — [[Peking University]] 教授。変更起因インシデントライフサイクル論文シニア著者(person) - [[Bingxu Chai]] — [[Ant Group]] エンジニア。ICSE-SEIP 2023 論文共著者(person) - [[Bingchang Liu]] — [[Ant Group]] エンジニア。ICSE-SEIP 2023 論文共著者(person) - [[Jianguo Li]] — [[Ant Group]] シニアエンジニア。ICSE-SEIP 2023 論文責任著者(person) - [[Yong Yang]] — [[Peking University]] 研究者。ICSE-SEIP 2023 論文共著者(person) - [[Wei Jiang]] — [[Ant Group]] エンジニア。ICSE-SEIP 2023 論文共著者(person) - [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]] — [[Vaibhav Ganatra]] ほか [[Microsoft]](ESEC/FSE 2023)。Microsoft 300 超サービス・2022 年間の本番インシデント約 950 件を分析し、ミス検知 6 カテゴリタクソノミ(Missing monitor/alert 40.41% が最大)を構築。ミス検知の 27.25% がアウテージに発展し、顧客報告インシデントは TTD 10.7 倍・TTM 3.75 倍と定量化。サービス成熟度が「何を監視すべきか」を、依存関係数が「どう監視すべきか」を決める(source / paper) - [[Vaibhav Ganatra]] — [[Microsoft]] India 所属。ミス検知タクソノミ研究(ESEC/FSE 2023)筆頭著者(person / aiops) - [[Yu Kang]] — [[Microsoft]] China 所属。ミス検知タクソノミ研究(ESEC/FSE 2023)共著者(person / aiops) - [[Anjaly Parayil]] — [[Microsoft]] India 所属。ミス検知タクソノミ研究(ESEC/FSE 2023)共著者(person / aiops) - [[クラウドモニタリング]] — クラウドサービスの稼働状態・性能・健全性を自動化ウォッチドッグで継続観察しインシデントを先手で検知・報告する運用実践の総体。Ganatra et al. 2023 はミス検知 6 カテゴリタクソノミを構築し、40.41% が「必要なモニタ/アラートが存在しない(Missing monitor/alert)」に起因することを実証。(AIOps / SRE / cloud operations) - [[@2024__arXiv__Chatbot Arena - An Open Platform for Evaluating LLMs by Human Preference]] — [[Wei-Lin Chiang]]・[[Lianmin Zheng]] ほか [[LMSYS]]/UC Berkeley(arXiv 2024)。クラウドソーシング型ペアワイズ比較で LLM を評価するオープンプラットフォーム [[Chatbot Arena]] を提案。Bradley-Terry モデルで統計的ランキング、能動サンプリングで最大 54% 少ない投票数で同等精度、240K 票・90K ユーザー・50+ モデルで検証。(source / paper / llm-evaluation) - [[LLM評価]] — LLM の性能・人間嗜好との整合を定量化する手法の総称。静的ベンチマーク(MMLU 等)の限界(汚染・オープンエンド評価困難)と、クラウドソーシング型ペアワイズ比較・LLM-as-judge の 2 アプローチ。Bradley-Terry モデルと能動サンプリングによる効率的ランキング。(concept / llm-evaluation / benchmarking) - [[Wei-Lin Chiang]] — [[University of California, Berkeley]] 博士課程。[[LMSYS]] 共同設立者。[[Chatbot Arena]] 第一著者(同等貢献、arXiv 2024)(person) - [[Lianmin Zheng]] — [[University of California, Berkeley]] 博士課程。[[LMSYS]] 共同設立者。[[Chatbot Arena]] 第一著者(同等貢献、arXiv 2024)。SGLang・Vicuna の主要著者(person) - [[LMSYS]] — Large Model Systems Organization。UC Berkeley 主導。[[Chatbot Arena]]・Vicuna・SGLang・LMSYS-Chat-1M を開発・公開(organization) - [[Chatbot Arena]] — [[LMSYS]] 開発の LLM 評価オープンプラットフォーム。匿名ペアワイズ比較 + Bradley-Terry モデルによるクラウドソーシング型ランキング。2024 年 1 月時点 240K 票・90K ユーザー(product) - [[@2004__OSDI__Correlating Instrumentation Data to System States - A Building Block for Automated Diagnosis]] — [[Ira Cohen]]・[[Moises Goldszmidt]]・[[Terence Kelly]]・[[Julie Symons]]([[Hewlett Packard Labs]])・[[Jeffrey S. Chase]]([[Duke University]])による OSDI 2004 論文。TAN で SLO 違反と相関する 3–8 メトリクスを自動特定、balanced accuracy 87–94%。「メトリクス帰属」と「相関 ≠ 因果」の先駆的定式化(source / paper / aiops) - [[Ira Cohen]] — [[Hewlett Packard Labs]] 所属。TAN ベース SLO 違反分類の筆頭著者(OSDI 2004)(person) - [[Moises Goldszmidt]] — [[Hewlett Packard Labs]] 所属。確率的グラフィカルモデルの専門家。TAN ベース SLO 違反分類共著者(OSDI 2004)(person) - [[Terence Kelly]] — [[Hewlett Packard Labs]] 所属。TAN ベース SLO 違反分類共著者(OSDI 2004)(person) - [[Julie Symons]] — [[Hewlett Packard Labs]] 所属。TAN ベース SLO 違反分類共著者(OSDI 2004)(person) - [[Jeffrey S. Chase]] — [[Duke University]] コンピュータサイエンス学科所属。TAN ベース SLO 違反分類共著者(OSDI 2004)(person) - [[Hewlett Packard Labs]] — Hewlett-Packard 企業研究部門(Palo Alto, CA)。[[Ira Cohen]] ら 4 名が TAN ベース SLO 違反分類を OSDI 2004 で発表(organization) - [[Duke University]] — 米国ノースカロライナ州ダーラムの研究大学。[[Jeffrey S. Chase]] が HP Labs との共同研究に参加(OSDI 2004)(organization) - [[@2017__FAST__Chronix - Long Term Storage and Retrieval Technology for Anomaly Detection in Operational Data]] — 運用データ異常検知特化ドメイン固有 TSDB Chronix(FAST '17、QAware / FAU)(source) - [[Florian Lautenschlager]] — QAware GmbH、Chronix 筆頭開発者(entity/person) - [[Michael Philippsen]] — FAU プログラミングシステムグループ教授、Chronix 共同開発者(entity/person) - [[Andreas Kumlehn]] — FAU 所属研究者、Chronix 共同開発者(entity/person) - [[Josef Adersberger]] — QAware GmbH 共同創業者・CTO、Chronix 共同開発者(entity/person) - [[QAware GmbH]] — ドイツ・ミュンヘンのソフトウェアエンジニアリング会社、Chronix 開発拠点(entity/organization) - [[Friedrich-Alexander-Universität Erlangen-Nürnberg]] — ドイツ FAU、Chronix 研究機関(entity/organization) - [[Chronix]] — ドメイン固有 TSDB、DDC・汎用データモデル・ビルトイン解析(entity/product) - [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] — [[Qingyang Yu]] ほか(Tsinghua/CNIC/Nankai/Tencent)、WWW 2023。CMD コールグラフの曖昧性(AmSit)を初めて定式化し AmSitor + 4 段階フレームワーク CMDiagnostor を提案。HR@5=0.94・MRR=0.83 (source / paper / rca / microservice) - [[Bowen Hao]] — [[Nankai University]] 所属。CMDiagnostor(WWW 2023)の共著者(entity/person) - [[Mingjie Li]] — [[Tsinghua University]]/BNRist 所属。CMDiagnostor(WWW 2023)の共著者(entity/person) - [[Xianglin Lu]] — [[Tsinghua University]]/BNRist 所属。CMDiagnostor(WWW 2023)の共著者(entity/person) - [[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]] — Ma+, arXiv 2026。汎ドメイン TSF アーキテクチャとドメイン特化 SOTA の和解不能な矛盾を論証。メタラーニング(LLM Scientist)への方向転換を提言(source / paper / time-series / meta-learning) - [[Qinwei Ma]] — [[Tsinghua University]] の研究者。時系列予測ポジションペーパー筆頭著者(entity / person) - [[Jingzhe Shi]] — [[Tsinghua University]] の研究者。同ポジションペーパー共著者(entity / person) - [[Jiahao Qiu]] — [[Princeton University]] の研究者。TFB ベンチマーク共著者(entity / person) - [[Zaiwen Yang]] — [[Tsinghua University]] の研究者。同ポジションペーパー共著者(entity / person) - [[@2025__KDD__Can Slow-thinking LLMs Reason Over Time - Empirical Studies in Time Series Forecasting]] — Cheng+ WSDM 2026。訓練不要 DeepSeek-R1 ベースの TimeReasoner で深層学習ベースラインと競合する性能を実証(source / paper / time-series / llm / reasoning) - [[@2025__NeurIPS__Time-R1 - Post-Training Large Vision Language Model for Temporal Video Grounding]] — Wang+ NeurIPS 2025。LVLM の TVG タスクへの GRPO + tIoU 報酬による初の RLVR 後訓練。2.5K サンプル RL が 339K SFT を超える(source / paper / video-understanding / vlm / rl) - [[@2026__ICLR2026__TimeOmni-1 - Incentivizing Complex Reasoning with Time Series in Large Language Models]] — Guan+ ICLR 2026。TSR-Suite(4 タスク 23K)と SFT+GRPO の二段階訓練で因果発見 GPT-4.1 を 40.6% 上回る(source / paper / time-series / llm / rl) - [[@2024__Zenn__tsurubee__LLM-for-Time-Series]] — tsurubee(SAKURA internet)による Zenn 記事(2024-07-10)。LLM×時系列の 5 アプローチ分類(Prompting/Quantization/Aligning/Vision/Tool)を解説。LLMTime のゼロショット性能と One Fits All の知識転移可能性を紹介(source / article / time-series / llm / survey) - [[@2024__arXiv__Towards Time-Series Reasoning with LLMs]] — Chow+ NeurIPS 2024 Workshop。時系列推論を知覚→文脈化→演繹に分解し、知覚ボトルネックを定式化。軽量エンコーダ+LoRA で 7B が GPT-4o を超える(source / paper / time-series / llm / multimodal) - [[@2025__arXiv__AlphaCast - A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting]] — Zhang+ USTC arXiv 2025-11。Investigator-Generator-Reflector の三段階エージェント型推論。反省モジュール除去で Sunny Power が非推論ベースラインより悪化(source / paper / time-series / llm / agentic) - [[時系列推論]] — 生の時系列入力に対して多段階の中間思考で予測・分類・因果発見・意思決定の解を導く LLM ベースのパラダイム(concept / machine-learning / llm) - [[検証可能報酬による強化学習]] — LLM 出力に客観的検証可能な報酬を与える後訓練枠組み(RLVR)。GRPO が代表アルゴリズムで、コード・数学・視覚推論・映像理解・時系列推論へ拡大(concept / rl / llm) - [[時間的映像グラウンディング]] — 自然言語クエリと映像から区間 [ts, te] を予測する TVG タスク。特徴量ベース → SFT-LVLM → RLVR-LVLM の三世代(concept / video / vlm) - [[Tong Guan]] — Griffith U / Zhejiang U の研究者。TimeOmni-1 と TSR-Suite の筆頭著者(entity / person) - [[Qin Jin]] — Renmin U AIM3 Lab の教授。Time-R1 の対応著者(entity / person) - [[MiLM Plus]] — Xiaomi Inc. の AI 研究組織。Time-R1 を Renmin U と共同開発(entity / organization) - [[Xiaomi]] — 中国の総合家電・スマートデバイス企業。MiLM Plus を擁する(entity / organization) - [[Jiahao Wang]] / [[Daoyu Wang]] / [[Xiaohan Zhang]] / [[Tian Gao]] — USTC の研究者。TimeReasoner / AlphaCast 共著者(entity / person) - [[Winnie Chow]] / [[Lauren Gardiner]] / [[Haraldur T. Hallgrimsson]] / [[Maxwell A. Xu]] / [[Shirley You Ren]] — Stanford / Apple / UIUC の研究者。Chow+ NeurIPS 2024 Workshop 共著者(entity / person) - [[Apple]] — アメリカのテクノロジー企業。機械学習・時系列解析の研究グループを擁する(entity / organization) - [[Borgmon]] — [[Google]] の初代分散監視システム。[[Monarch]] の前身。分散管理・スキーマなし・distribution 型欠如・手動シャーディングの 4 課題が Monarch 設計の動機(entity / product) - [[@2020__VLDB__Monarch - Google's Planet-Scale In-Memory Time Series Database]] — Google の 950 億時系列・プラネットスケール・インメモリ TSDB Monarch の設計・実装論文。FHI・Collection Aggregation・クエリプッシュダウンを主要技術とする(source / time-series / distributed) - [[@2026__Netflix TechBlog__From Silos to Service Topology - Why Netflix Built a Real-Time Service Map]] — Parth Jain ほか(Netflix)、2026-05-29。eBPF・IPC メトリクス・分散トレースの 3 層統合でリアルタイムサービス依存マップを構築。Pekko Streams・カスタムグラフ DB・gRPC で提供(source / article / distributed-systems / observability / microservices) - [[C10K-Problem]] — Dan Kegel(1999〜2014)。1台のサーバで同時10,000クライアントを処理するための I/O 戦略を5分類。[[epoll]]・[[kqueue]]・NPTL・sendfile・ゼロコピーを整理した古典的リファレンス(source / article / networking / systems) - [[C10K問題]] — 1台のサーバで同時に 10,000 クライアントを処理するための I/O アーキテクチャ上の課題。Dan Kegel が 1999 年に命名(concept / networking / concurrency) - [[epoll]] — Linux 2.6 のスケーラブルな I/O イベント通知機構。Davide Libenzi が 2001 年提案、2.5.46 でマージ。[[C10K問題]] への Linux の回答(concept / linux / networking) - [[kqueue]] — FreeBSD/NetBSD/macOS のスケーラブル汎用イベント通知機構。ソケット・ファイル・シグナル・タイマー等を統一監視。[[epoll]] の BSD 版(concept / bsd / networking) - [[Dan Kegel]] — [[C10K問題]] を 1999 年に命名・整理した技術者(entity / person) - [[nginx]] — [[C10K問題]] の解法を体現したイベント駆動型 Web サーバ。Linux では [[epoll]]、BSD では [[kqueue]] を自動選択(entity / product) - [[@2023__arXiv__TimeGPT-1]] — TimeGPT-1、Nixtla、時系列初ファウンデーションモデル(source / time-series) - [[Cristian Challu]] — Nixtla 研究者、TimeGPT-1 共著(entity / person) - [[Max Mergenthaler-Canseco]] — Nixtla 研究者、TimeGPT-1 共著(entity / person) - [[Nixtla]] — 時系列予測スタートアップ、TimeGPT 開発元(entity / organization) - [[@2026__SREcon26 Americas__The WTF Problem - Developer Experience as a Reliability Property]] — Nicole Forsgren、SREcon26 スライド。DX を SRE の信頼性特性として定義、DORA+SPACE+MTWTF で計測(source / slides / sre / developer-experience) - [[@2020__ICSE-SEIP__Understanding and Handling Alert Storm for Online Service Systems]] — Zhao+ ICSE-SEIP2020、アラートストームの初実証研究 + EVT 検知 + 4 段要約(source / aiops / alert-management) - [[@2020__ESEC-FSE__Real-Time Incident Prediction for Online Service Systems]] — Zhao・Chen+ ESEC/FSE2020、eWarn。LDA テキスト特徴+統計特徴+MIL でノイズアラート抑制、XGBoost+SMOTE+LIME、11実サービスシステムで平均F1 0.82(AirAlert比0.51)(source / aiops / failure-prediction / alert-management) - [[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems]] — Zhao+ ISSRE2020、XGBoost + Resolution Record 自動ラベルで F1=0.89(source / aiops / alert-management) - [[@2023__arXiv__ESRO - Experience Assisted Service Reliability against Outages]] — Chakraborty+ arXiv2023、CK グラフでアラート+障害レポート統合の経験ベース診断(source / aiops / root-cause-analysis) - [[@2023__ASE__Dynamic Graph Neural Networks-Based Alert Link Prediction for Online Service Systems]] — Chen+ ASE2023 (DyAlert)、AMDG + k-GNN + GRU でアラートリンク予測(source / aiops / graph-neural-network) - [[@2023__JCC__Filtering Alerts on Cloud Monitoring Systems]] — Voutsas+ JCC2023、Netdata でクリック行動ベース Random Forest フィルタ(source / aiops / cloud-monitoring) - [[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems]] — Zeng+ ICSE-SEIP2023、ExL + パス粒度集約でアクショナブルアラート(source / aiops / alert-management) - [[@2024__CCGRID__AlertRCA - Causality Enhanced Graph Representation Learning for Alert-Based Root Cause Analysis]] — Yu+ CCGRID2024、アラートのみで top-1 83.9% RCA(source / aiops / root-cause-analysis) - [[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps]] — Bhukar+ ICSE-SEIP2024、教師なし統計学習で X-out-of-Y 抑制ポリシーを自動学習(source / aiops / alert-management) - [[@2024__ISSRE__Exploring Hierarchical Patterns for Alert Aggregation in Supercomputers]] — Yuan+ ISSRE2024 (SuperAgg)、HPC 連続的アラート過負荷を 2 段階階層構造で集約(source / aiops / hpc) - [[アラートストーム]] — アラート伝播による集中発火現象、Zhao+ 2020 が初定義(concept / aiops) - [[アラート抑制]] — 発火前のノイズ除去機構、Bhukar+ 2024 が動的学習(concept / aiops) - [[アクショナブルアラート]] — impact + interpretability 2 軸の解釈可能アラート、TraceArk + AlertRank(concept / aiops) - [[@2022__DICOMO__AI時代に向けたクラウドにおける信頼性エンジニアリングの未来構想]] — DICOMO 2022 統一セッション「クラウド」招待講演スライド。SRE/AIOps の現在地、[[セルフクラフト]]、[[Interactive AIOps]] を接続する(source / slides) - [[Interactive AIOps]] — オペレータと AI が対象システムの特徴を対話的に協働学習する AIOps 構想(concept / aiops) - [[セルフクラフト]] — AI との対話で利用者が個別化アプリケーションを製作し、信頼性目標を体験的に調整する未来像(concept / sre) ### 2026-06-19 JANOG56 スライド ingest - Sources: [[@2025__JANOG56__AI ML基盤における800GbEスイッチ導入とその挑戦]] - Entities: [[サイバーエージェント]], [[CIU]], [[小障子 尚太朗]], [[疋田 紅樹]], [[Juniper QFX5240]] - Concepts (new): [[Rail-Optimizedトポロジ]], [[マルチベンダーLosslessネットワーク]] - Concepts (updated): [[集合通信]], [[データセンター輻輳制御]], [[GPUクラスタ運用]] ### 2026-06-20 マイクロサービス・DB RCA 基礎論文 10 本一括 ingest - Sources: [[@2013__SIGMETRICS__Root Cause Detection in a Service-Oriented Architecture]], [[@2014__CNSM__Mining Temporal Lag from Fluctuating Events for Correlation and Root Cause Analysis]], [[@2018__CCGrid__CloudRanger - Root Cause Identification for Cloud Native Systems]], [[@2019__ISSRE__FluxRank - A Widely-Deployable Framework to Automatically Localizing Root Cause Machines for Software Service Failure Mitigation]], [[@2019__WWW__ε-Diagnosis - Unsupervised and Real-time Diagnosis of Small-window Long-tail Latency in Large-scale Microservice Platforms]], [[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]], [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]], [[@2021__CloudIntelligence__MicroDiag - Fine-grained Performance Diagnosis for Microservice Systems]], [[@2022__ICWS__TS-InvarNet - Anomaly Detection and Localization based on Tempo-spatial KPI Invariants in Distributed Services]], [[@2023__arXiv__PyRCA - A Library for Metric-based Root Cause Analysis]] - Entities: [[Myunghwan Kim]], [[LinkedIn]], [[Chunqiu Zeng]], [[Tao Li]], [[Florida International University]], [[Larisa Shwartz]], [[Genady Grabarnik]], [[Ping Wang]], [[Ping Liu]], [[Huasong Shan]], [[JD.com]], [[Li Wu]], [[Johan Tordsson]], [[Odej Kao]], [[TU Berlin]], [[Umeå University]], [[Elastisys AB]], [[Jasmin Bogatinovski]], [[Erik Elmroth]], [[Chenghao Liu]], [[Doyen Sahoo]], [[Steven C. H. Hoi]], [[Salesforce AI]] - Concepts (updated): [[根本原因分析]], [[因果推論ベースRCA]], [[マイクロサービスコールグラフ]], [[異常検知]], [[データベース自律診断]] ### 2026-06-23 Conductor (ICLR 2026) - Sources: [[@2026__ICLR__Learning to Orchestrate Agents in Natural Language with the Conductor]] - Entities (new): [[Sakana AI]], [[Stefan Nielsen]], [[Edoardo Cetin]], [[Yujin Tang]] - Concepts (new): [[マルチエージェント協調]] - Concepts (updated): [[テスト時計算スケーリング]] ### 2026-06-23 JustDiag (arXiv 2026) - Sources: [[@2026__arXiv__JustDiag! A Diagnostic Justification Engine for Accountable Root Cause Analysis]] - Entities (new): [[Tingzhu Bi]], [[Xinrui Jiang]], [[Xun Zhang]], [[Pengcheng Su]], [[Congjie He]], [[Jinglin Li]], [[Meng Ma]], [[Beijing University of Posts and Telecommunications]] - Entities (updated): [[Ping Wang]] - Concepts (new): [[診断的正当化]] - Concepts (updated): [[LLMによる根本原因分析]], [[仮説駆動RCA]], [[RCA評価設計]] ### 2026-06-23 mABC (EMNLP Findings 2024) - Sources: [[@2024__EMNLP Findings__mABC - Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecture]] - Entities (new): [[Wei Zhang (Beihang)]], [[Hongcheng Guo]], [[Cloudwise]] - Entities (updated): [[Beihang University]] - Concepts (updated): [[LLMによる根本原因分析]], [[マルチエージェント協調]] ### 2026-06-23 Cognitive Apprenticeship in Practice (SREcon23 Americas) - Sources: [[@2023__SREcon23 Americas__Cognitive Apprenticeship in Practice with Alert Triage Hour of Power]] - Entities (new): [[Paige Cruz]], [[Chronosphere]] - Concepts (new): [[認知的徒弟制]] - Concepts (updated): [[アラート管理]], [[アクショナブルアラート]] ### 2026-06-23 Anomaly Detection in Infrequently Occurred Patterns (SREcon17 Americas) - Sources: [[@2017__SREcon17Americas__Anomaly Detection in Infrequently Occurred Patterns]] - Entities (new): [[Dong Wang]], [[Baidu]] - Concepts (updated): [[異常検知]] ### 2026-06-25 - [[@2023__SREcon23 EMEA__Symptom-based Alerting for Machine Learning]] — Lina Weichbrodt, SREcon23 EMEA, 症状ベースアラーティングの ML 転用 - [[Lina Weichbrodt]] — ML フリーランス・コンサルタント - [[MLモデル監視]] — ML サービスの品質監視・3 段階優先順位フレームワーク ### 2026-06-26 - [[@2025__IOTS2025__SREはサイバネティクスの夢をみるか]] — 坪内佑樹, IOTS2025 招待講演, SRE のサイバネティクス的再解釈 - [[Yuuki Tsubouchi]] — さくらインターネット研究所研究員、京都大学博士(情報学) - [[さくらインターネット研究所]] — さくらインターネット株式会社の研究開発部門 - [[自動化の皮肉]] — Bainbridge (1983) Ironies of Automation - [[なめらかなシステム]] — 利用者・情報システム・開発運用者の総体としてのシステム構想 ### 2026-06-26 再帰化 + なめらかなシステム DICOMO2025 スライド ingest - [[@2022__ペパボテックカンファレンス__再帰化への認知的転回]] — 三宅悠介, ペパボテックカンファレンス 2022, 再帰化の認知的転回 - [[@2025__DICOMO2025__なめらかなシステムと運用維持の終わらぬ未来]] — 三宅悠介, DICOMO2025 招待講演, なめらかなシステム再定義(仮) - [[再帰化]] — 関数の設計から系の設計へ - [[エフェクチュエーション]] — 目的生成的思考様式の実践枠組み ### 2026-06-26 とあるSREの博士「過程」 SRE NEXT 2025 スライド ingest - [[@2025__SRE NEXT 2025__とあるSREの博士「過程」]] — 坪内佑樹, SRE NEXT 2025, SRE としての博士課程の動機・研究・振り返り - Sources: [[@2025__SRE NEXT 2025__とあるSREの博士「過程」]] - Entities (updated): [[Yuuki Tsubouchi]], [[SRE NEXT]] - Concepts (updated): [[SREの工学化]] ### 2026-06-26 デバッギング・性能解析・フィードバック 6 論文一括 ingest - [[@2002__IEEE TSE__Simplifying and Isolating Failure-Inducing Input]] — Zeller, IEEE TSE 2002, デルタデバッギング ddmin/dd - [[@2006__ICSE__HDD - Hierarchical Delta Debugging]] — Misherghi & Su, ICSE 2006, 木構造デルタデバッギング - [[@2014__OSDI__The Mystery Machine - End-to-end Performance Analysis of Large-scale Internet Services]] — Chow+, OSDI 2014, Facebook エンドツーエンド性能解析 - [[@2015__SOSP__Failure Sketching - A Technique for Automated Root Cause Diagnosis of In-Production Failures]] — Kasikci+, SOSP 2015, 本番障害の自動 RCA - [[@2015__Onward!__Runtime Metric Meets Developer - Building Better Cloud Applications using Feedback]] — Cito+, Onward! 2015, フィードバック駆動開発 - [[@2016__NSDI__Minimizing Faulty Executions of Distributed Systems]] — Scott+, NSDI 2016, 分散実行最小化 DEMi - Entities: [[Andreas Zeller]], [[Ghassan Misherghi]], [[Zhendong Su]], [[Michael Chow]], [[David Meisner]], [[Jason Flinn]], [[Thomas F. Wenisch]], [[George Candea]], [[Jürgen Cito]], [[Philipp Leitner]], [[Harald C. Gall]], [[Colin Scott]], [[Scott Shenker]], [[George Necula]], [[Gist]] - Concepts: [[デルタデバッギング]], [[階層的デルタデバッギング]], [[障害スケッチング]], [[フィードバック駆動開発]], [[分散実行最小化]] ### 2026-06-27 The Morning Paper on Operability (blog.acolyer 2016) - [[@2016__blog.acolyer__The Morning Paper on Operability]] — Colyer, blog.acolyer 2016, 運用性の 4 段階モデル(設計→可視化→デバッギング→フィードバック) - Entities: [[Adrian Colyer]] - Concepts: [[オペラビリティ]] ### 2026-06-27 OTel-Arrow Phase 2 blog post (opentelemetry.io 2026) - [[@2026__OTelBlog__OTel-Arrow-Phase-2]] — OpenTelemetry SIG-Arrow, 2026。Phase 2: Arrow をパイプライン全体の内部表現として採用した Dataflow Engine(Rust)。OTAP が単一コアで OTLP 比 **20×** スループット(2.47M vs 121K logs/sec)、4 rename 操作で CPU 6.6% vs 92.5%、16 コアで 14.6× 線形スケーリング - Entities: [[Apache-Arrow|Apache Arrow]] - Concepts: [[OTel-Arrow]], [[OTAP]] - [[@2019__SREcon19 Asia__A Tale of Two Postmortems - A Human Factors View]] — [[Tanner Lund]] (Microsoft Azure PRSE), SREcon19 APAC 2019。Human Factors/Resilience Engineering 視点からポストモーテムを批判的再設計。Dekker4目的・個別インタビュー・デブリーフィング手法 - Entities: [[Tanner Lund]] - Concepts: [[人的要因]](新規), [[レジリエンスエンジニアリング]](新規), [[ポストモーテム]](更新) ### 2026-06-27 SREcon16 Europe | Accident Models in Post Mortems - [[@2016__SREcon16Europe__Accident Models in Post Mortems]] — [[Will Gallego]]・[[Nathan Hoffman]]・[[Miriam Lautner]]([[Etsy]])、SREcon16 Europe 2016-07。事故モデル系譜・ヒューマンエラー批判・安全性の創発的特性・デブリーフィング7カテゴリ手法。transcript なし。 - Entities (new): [[Nathan Hoffman]], [[Miriam Lautner]] - Entities (updated): [[Will Gallego]], [[Etsy]] - Concepts (new): [[事故モデル]] - Concepts (updated): [[ポストモーテム]] ### 2026-06-27 SREcon15 Lueder | What Brought Us Down? Outage Trend Analysis at Google - [[@2015__SREcon15__What Brought Us Down - Outage Trend Analysis at Google]] — Sue Lueder(Google SRE PM)、2015-03。GQM フィードバックモデル・8 フェーズインシデントタイムライン・9 カテゴリ根本原因・4 次元重大度フラグ・Stop/Faster/Culture の 3 方向修正機会を公開。全データ捏造。transcript なし。 - Entities: [[Sue Lueder]] - Concepts (new): [[障害傾向分析]], [[インシデント重大度評価]] - Concepts (updated): [[インシデント管理]], [[根本原因分析]], [[ポストモーテム]] - Entities (updated): [[Google]] - [[@2023__SREcon23Americas__Far from the Shallows]] — [[Courtney Nash]]([[Verica]])。Duration/Severity/RCA の shallow data 批判、インシデントストーリー・Near Misses・Rasmussen Safety Boundaries 提唱(SREcon23 Americas, 2023-03-23) - [[Courtney Nash]] — Verica Head of Research、Internet Incident Librarian、The Void 主宰 - [[Verica]] — カオスエンジニアリング・インシデント研究プラットフォーム企業 - [[インシデントストーリー]] — 豊かな社会技術的詳細を持つ長形式インシデント記録(Nash 提唱) - [[@2023__SREcon23Americas__Turning an Incident Report into a Design Issue with TLA+]] — [[Finn Hackett]](UBC)・[[Markus A. Kuppe]](MSFT)。TLA+ をポストモーテムに適用し設計レベルの洞察を得るワークフロー(SREcon23 Americas, 2023-03-22) - [[Finn Hackett]] — UBC PhD 学生、TLA+ フォーマル検証研究 - [[Markus A. Kuppe]] — Microsoft Research、TLA+ プロジェクト 10 年超 - [[Joshua Rowe]] — Microsoft、Azure CosmosDB ドメインエキスパート - [[Azure CosmosDB]] — プラネットスケール KV ストア、5 段階整合性レベル、TLA+ モデル公開 - [[TLA+]] — 形式仕様記述言語。インシデントポストモーテムへの適用ワークフローを提示 ### 2026-06-28 SpeakerDeck | Postmortem as a textbook - [[@2023__SpeakerDeck__Postmortem as a textbook]] — [[KATO Toshiya]]([[LINE株式会社]] Embedded SRE)、みんなで学ぶポストモーテム Lunch LT(Findy、2023-02-09)。ポストモーテムを「他チームが学べる教材」にするためのSRE主導執筆会議手法。当事者のみが執筆・共有する既存プロセスの5つの構造的問題を特定し、全体共有前の30分SRE主導会議で1対1に解決。 - Entities (new): [[KATO Toshiya]], [[LINE株式会社]] - Concepts (updated): [[ポストモーテム]](SRE主導執筆会議の横断的知見追記) ### 2026-06-28 SREcon26 Americas | Human Factors in the Age of AI Ops - [[@2026__SREcon26Americas__Human Factors in the Age of AI Ops]] — [[Eddie Redick]]([[CTC Ops]])SREcon26 Americas(2026-03-25、Seattle)。AI 信頼パラドックス(16%信頼 vs 68%統合予定)・Trust Triangle・Trust Spectrum(Observe/Advise/Assist/Partner)・"Commanding the Chaos"・AI Ops 80/20 の法則を提示。アラート疲労は「量の問題ではなくシステム問題」と再フレーミング。 - Entities (new): [[Eddie Redick]], [[CTC Ops]] - Concepts (updated): [[SRE AI Autonomy Levels]](Trust Spectrum 追記), [[アラート疲労]](2026統計追記), [[人的要因]](AI Ops 文脈追記) ### 2026-06-28 SREcon26 Americas | The Ironies of AI² - [[@2026__SREcon26Americas__The Ironies of AI²]] — [[J Paul Reed]]([[Chime]])SREcon26 Americas(2026-03-25、Seattle)。Bainbridge(1983)の自動化のアイロニー6項をAI時代に拡張し、Joint Cognitive System 5特性でインシデント対応中のAI利用を評価。匿名インシデント事例3件・ETO(効率性‐徹底性トレードオフ)・看護師実験(AI誤り多時96〜120%性能悪化、AI説明のみ条件で緩和)を提示。「インシデント中はAIに推薦でなく説明を求めよ」が主要実践的含意。 - Sources (new): [[@2026__SREcon26Americas__The Ironies of AI²]] - Entities (new): [[Chime]] - Entities (updated): [[J Paul Reed]](SREcon26登壇・Chime所属追記) - Concepts (updated): [[自動化のアイロニー]](SREcon26でのAI時代拡張・看護師実験知見追記), [[Joint Activity]](JCSとの対比・AIのInterpredictability欠如追記) ### 2026-06-28 O'Reilly Report | Incident Metrics in SRE (Davidovič, Google SRE) - [[@2021__OReilly__Incident Metrics in SRE]] — [[Štěpán Davidovič]](Google SRE)、O'Reilly レポート(2021-03-19)。モンテカルロシミュレーション(10 万回)と 3 社実データ・Google 社内データで MTTR の統計的限界を実証。中央値・幾何平均・パーセンタイルも問題を解決しないことを示す。問いに合わせたメトリクス・ユーザースタディ・SLI/SLO を代替として提案。 - Entities (new): [[Štěpán Davidovič]] - Concepts (updated): [[TTXメトリクス]](Davidovič 2021 を正式ソース化・3 者批判の横断的知見追記) ### 2026-06-28 認知科学論文 | 縮約,網羅,減算:科学者の仕事とは何か (岡ノ谷 一夫, 東京大学) - [[@2021__認知科学__縮約,網羅,減算:科学者の仕事とは何か]] — [[岡ノ谷 一夫]]([[University of Tokyo]])、認知科学 Vol.28 No.2 pp.236–241(2021-06-01)。池上 高志への誌上討論コメンタリー。縮約・網羅・減算を三項対立で整理し、機械学習時代の科学方法論を論じる。 - Entities (new): [[岡ノ谷 一夫]], [[University of Tokyo]] - Concepts (new): [[縮約]], [[網羅]], [[減算]] ### 2026-06-29 SREcon19 Americas スライド | Case Study: Implementing SLOs for a New Service (Arnaud Lawson, Squarespace) - [[@2019__SREcon19Americas__Case Study - Implementing SLOs for a New Service]] — [[Arnaud Lawson]]([[Squarespace]] Senior SRE)、SREcon19 Americas(2019-03-25)。Ceph Object Storage への SLO 実装 6 ステップ。可用性・レイテンシ・耐久性の 3 種 SLI。プローバーによる能動的 SLI 収集。Go コード例付き。23 スライド。 - Entities (new): [[Arnaud Lawson]], [[Squarespace]] - Concepts (updated): [[サービスレベル目標]](異種コンポーネント SLI 分類・プローバー計測の横断的知見追記), [[エラーバジェット]](SLO 設定と同時計算・文書化の実践知追記), [[SLI-SLO段階的導入]](新規サービスへのプローバー活用・SLO 公開ドキュメント知見追記) ### 2026-06-30 SREcon16 Europe スライド | HPC Downtime Budgets (Cory Lueninghoener, LANL) - [[@2016__SREcon16Europe__HPC Downtime Budgets]] — [[Cory Lueninghoener]]([[Los Alamos National Laboratory]])、SREcon Europe 2016(2016-07-12)。エラーバジェットを HPC 環境に適応した「ダウンタイム予算」実践報告。四半期 30 時間予算のバーンダウンチャート可視化。37 スライド + YouTube 自動字幕 transcript。 - Entities (new): [[Cory Lueninghoener]], [[Los Alamos National Laboratory]] - Concepts (updated): [[エラーバジェット]](HPC 適応・バーンダウンチャート・Wolf クラスタ超過事例・コミュニティ形成論) ### 2026-06-30 SREcon23 Americas スライド | Not All Minutes Are Equal: The Secret behind SLO Adoption Failure (Troy Koss + Michael Goins, Capital One) - [[@2023__SREcon23Americas__Not-All-Minutes-Are-Equal]] — [[Troy Koss]]・[[Michael Goins]]([[Capital One]])、SREcon23 Americas(2023-03-23)。時間スライス SLO の「すべての分を等価に扱う」問題とイベントベース SLO の優位性を比較。採用ロードマップ 6 段階・Default SLO 式・エラーバジェットシグナル解釈パターンを提示。40 ページ。transcript なし。 - Entities (new): [[Michael Goins]], [[Troy Koss]]; (updated): [[Capital One]] - Concepts (new): [[イベントベースSLO]]; (updated): [[エラーバジェット]](時間スライス vs. イベントベース・シグナルパターン・EB Policy 4 者共有所有の横断的知見を追記) ### 2026-06-29 SREcon18 Asia/Pacific スライド | Quantifying Empathy Through Service Level Objectives (Ketan Gangatirkar, Indeed) - [[@2018__SREcon18Asia__Quantifying Empathy Through Service Level Objectives]] — [[Ketan Gangatirkar]]([[Indeed]] VP of Engineering – Job Seeker)、SREcon18 Asia/Pacific(2018 年)。SLO 設計における「共感の数値化」をテーマに、ユーザー幸福の 6 フレーバー(#ARFCAapBof: Availability/Responsiveness/Freshness/Completeness/Accuracy/Breadth)と S 字曲線による痛みのしきい値特定の 5 ステップフレームワークを提示。152 スライド + YouTube 自動字幕トランスクリプト(1104 行)。 - Entities (new): [[Ketan Gangatirkar]], [[Indeed]] - Concepts (updated): [[サービスレベル目標]](共感ギャップ・6 フレーバー・S 字曲線しきい値の横断的知見を追記) ### 2026-06-30 SREcon25 EMEA スライド | Run, Walk, Crawl, or How We Failed Our Way to SLO Readiness (Rob Durst, Spring Health) - [[@2025__SREcon25EMEA__Run Walk Crawl or How We Failed Our Way to SLO Readiness]] — [[Rob Durst]]([[Spring Health]])、SREcon25 EMEA(2025-10-08、ダブリン)。ハイパーグロース・スタートアップにおける SLO 導入 4 度の挑戦(Run/Walk/Crawl/成功)と「SLO 準備度チェックリスト」4 条件(オブザーバビリティ基盤・ノミナル所有権・標準プロセス・保護時間)を提示。SLO 導入は社会技術問題であり socio 側が律速という主張が核心。51 ページ。transcript なし。 - Entities (new): [[Rob Durst]], [[Spring Health]] - Concepts (updated): [[サービスレベル目標]](SLO 導入失敗律速・スタートアップでの定着 Lv5 到達の横断的知見を追記), [[SLI-SLO段階的導入]](4 条件前提条件診断・担当者交代問題・エラーバジェットコードフリーズの横断的知見を追記) ### 2026-06-30 ingest-paper | AI Assistants for Incident Lifecycle in a Microservice Environment: A Systematic Literature Review - [[@2024__arXiv__AI Assistants for Incident Lifecycle in a Microservice Environment - A Systematic Literature Review]] — [[Dahlia Ziqi Zhou]]・[[Marios Fokaefs]]([[York University]])。arXiv 2410.04334、2024 年 10 月。SEGRESS 準拠 SLR。309 件 → 31 件選定。Detect 54.8%・Contain 35.4%・Prepare 9.7%・Post-incident 3.2%。LLM 38.7%・DL 32.2%。非伝統的データソース(過去インシデントレポート・依存グラフ・コードリポジトリ)が将来機会として特定された。 - Entities (new): [[Dahlia Ziqi Zhou]], [[Marios Fokaefs]], [[York University]] - Concepts (updated): [[インシデント管理]](Prepare/Post-incident 過少研究の定量化追記), [[根本原因分析]](SLR での RCA 位置づけ追記), [[異常検知]](SLR での最大目標 41.9% 追記), [[LLMによる根本原因分析]](mABC ユーザースタディ確認・LLM 38.7% 追記) ### 2026-06-30 SREcon25 Americas スライド | Measuring Availability the Player Focused Way (Maxfield Stewart, Riot Games) - [[@2025__SREcon25Americas__Measuring Availability the Player Focused Way - How Riot Games Changed Its Availability Culture]] — [[Maxfield Stewart]]([[Riot Games]] Technical Director: Live Operations)、SREcon25 Americas(2025-03)。Player Minutes(CCU 重み付き可用性指標)と Player Journey フレームワーク(Connecting / Purchasing / Play × 10 分類)を導入し、CEO OKR 接続で可用性文化変革を実現したゲーム SRE ケーススタディ。50 ページ PDF。transcript なし。 - Entities (new): [[Maxfield Stewart]], [[Riot Games]], [[Derek Defields]] - Concepts (new): [[Player Journey]]; (updated): [[サービスレベル目標]](CCU 重み付き可用性計測・CEO OKR 定着手法の横断的知見追記) ### 2026-07-01 ingest-video | Keys to SRE (Ben Treynor Sloss, SREcon14, 2014) - [[@2014__SREcon14__Keys to SRE]] — [[Ben Treynor Sloss]]([[Google]] VP Engineering)、SREcon14(2014-06-26)。SRE 創設者が「13 のキー」を初めて公開整理した講演。エラーバジェット・「ローンチオンブラック」ルール・運用 50% キャップ・移植可能性・Wheel of Misfortune・無責非難のポストモーテムが SRE Book(2016)の 2 年前に原型形態で提示された。YouTube 自動字幕 transcript(~55 分)。 - Entities (updated): [[Ben Treynor Sloss]](SREcon14 講演追加、status developing へ昇格) - Concepts (updated): [[SRE]](13 のキーと SRE Book の比較・ローンチオンブラックが操作的規則として先行する知見を追記), [[エラーバジェット]](ローンチオンブラックと開発チームの自浄メカニズムの 2014 年原型を追記), [[ポストモーテム]](2014 年の無責非難原則公言と後の Gallego 理論との知的系譜を追記) ### 2026-07-01 ingest-video | Incident Management and Chatops @ Netflix Feat Scorebot (Al Tobey, SREcon16, 2016) - [[@2016__SREcon16__Incident Management and Chatops @ Netflix Feat Scorebot]] — [[Al Tobey]]([[Netflix]] SRE)、SREcon16(2016-03-16)。Go 製 ChatBot Scorebot による Netflix の ChatOps インシデント管理。Hipchat → Slack 移行後の実践。Scorebot の 4 機能(bookmarking / presence / after-hours / secrets)と 4 つの itch(callbacks / testing / コンテキスト不足 / obnoxious bot)。代表フレーム 12 枚・音声取得済み・Whisper transcript 処理中。 - Sources (new): [[@2016__SREcon16__Incident Management and Chatops @ Netflix Feat Scorebot]] - Entities (new): [[Al Tobey]]。Entities (updated): [[Netflix]] - Concepts (new): [[ChatOps]]。Concepts (updated): [[インシデント管理]](ChatOps/Scorebot を LLM 以前の産業自動化として横断的知見に追記) ### 2026-07-01 ingest-video | Incident Response @ FB, Facebook's SEV Process (Gareth Eason, SREcon16 Europe, 2016) - [[@2016__SREcon16__Incident Response @ FB, Facebook's SEV Process]] — [[Gareth Eason]]([[Facebook]] プロダクションレビュー(EMEA)運営者)、SREcon16 Europe(2016-07、Dublin)。「発見者=オーナー」原則・SEV1 意図的過大分類バイアス・IMOC の非技術的調整役割(blame umbrella / human mutex)・二段階レビューの3つの質問・メトリクスゲーミング警告・canary インシデント事例。代表フレーム6枚+YouTube自動字幕transcript。 - Sources (new): [[@2016__SREcon16__Incident Response @ FB, Facebook's SEV Process]] - Entities (new): [[Gareth Eason]]。Entities (updated): [[Facebook]], [[Jay Parikh]], [[Pedro Canahuati]] - Concepts (updated): [[Incident Commander]](IMOC の「技術的に直さない」原則・blame umbrella/human mutex の横断的知見を追記), [[インシデント重大度評価]](意図的過大分類とメトリクスゲーミング警告の横断的知見を追記), [[クロスインシデント分析]](Granda 2025年の洞察に9年先行するメトリクスゲーミング警告を追記) ### 2026-07-01 ingest-video | Dashboards and Runbooks: Scrapbooking for Engineers (Colin Douch, SREcon22 Asia/Pacific, 2022) - [[@2022__SREcon22APAC__Dashboards and Runbooks - Scrapbooking for Engineers]] — [[Colin Douch]]([[Cloudflare]] Observability Platform Team Tech Lead)、USENIX SREcon22 Asia/Pacific(2022-12-07、シドニー)。ダッシュボード・ランブックの汎用化しすぎ/特化しすぎの二極化を「エンジニアのスクラップブッキング」と呼び、ランブック3クラス(自動化可能/自由記述/無価値)分類・良いランブックの本質的な一時性・composability(Jsonnet/Pulumi)・SLI/SLO・discoverability/explorability への移行を提案。USENIX ページはログイン必須のため YouTube 上の同一動画から自動字幕 transcript と代表フレーム20枚を取得。 - Sources (new): [[@2022__SREcon22APAC__Dashboards and Runbooks - Scrapbooking for Engineers]] - Entities (new): [[Colin Douch]]。Entities (updated): [[Cloudflare]] - Concepts (new): [[ダッシュボードとランブックの運用]] ### 2026-07-01 ingest-slides | Epic Incidents of History: The 1979 NORAD Nuclear Near Miss (Nick Travaglini, SREcon23 Americas, 2023) - [[@2023__SREcon23Americas__Epic Incidents of History - The 1979 NORAD Nuclear Near Miss]] — [[Nick Travaglini]]([[Honeycomb.io]] Technical Customer Success Manager)、USENIX SREcon23 Americas(2023-03-21、サンタクララ)。1979年 NORAD 核近接ミス事件を題材に、単一根本原因でなく Walker・Woods・Rayo の「複数の系統的寄与要因」の視座から、Vannevar Bush 主導の軍産学複合体("Iron Triangle")・SAGE・NORAD 427M システムへ至る計算機史と Closed World 思考の圧力を分析。オペレーターのローカル合理性による誤警報看破の経緯を描く。34ページ + YouTube 自動字幕フォールバック transcript。 - Sources (new): [[@2023__SREcon23Americas__Epic Incidents of History - The 1979 NORAD Nuclear Near Miss]] - Entities (new): [[Nick Travaglini]], [[Honeycomb.io]]。Entities (updated): [[Vannevar Bush]](軍産学複合体"Iron Triangle"の主導者としての歴史的文脈を追加) - Concepts (updated): [[複雑システム障害論]](遠因の重層性という時間軸の追加を横断的知見に追記), [[根本原因分析]](単一根本原因の探索が構造的に成立しない歴史的事例を追記), [[人的要因]](ローカル合理性による疑いが惨事を防いだ事例を追記) ### 2026-07-01 ingest-video | Incident Commanders (Vanessa Huerta Granda, Emily Ruppe, SREcon23 Americas, 2023) - [[@2023__SREcon23Americas__Incident Commanders]] — [[Vanessa Huerta Granda]]・[[Emily Ruppe]]([[Jeli]])、USENIX SREcon23 Americas(2023 年 3 月頃)。IC(Incident Commander) とインシデントアナリストを「似て非なる別々のスキルセット」と定義し、IC の核心を「指示を出さない・壊れたものを直さない」調整役、アナリストの核心を「事件がなぜそのように起きたかを調査すること」とする。IC が事後検証(post-incident review)も担うと社会技術的要因を見落としやすいと指摘。「インシデントのサイクル」ライフサイクル図・IC の別名(Facilitator/Conductor/Sociotechnical Troubleshooter)を提示。代表フレーム12枚(全視聴確認済み) + YouTube 英語字幕。本 SREcon23 講演は同一人物 Vanessa Huerta Granda の [[Jeli]] 在籍時(2023年)のものであり、SREcon25/26([[Enova]] 在籍時)の既存記述より時系列的に早い。 - Sources (new): [[@2023__SREcon23Americas__Incident Commanders]] - Entities (updated): [[Vanessa Huerta Granda]], [[Emily Ruppe]], [[Jeli]] - Concepts (new): [[インシデントアナリスト]]。Concepts (updated): [[Incident Commander]](IC/アナリスト役割分離と Slack の no-give-backs ハンドオフの理由付け・「インシデントのサイクル」ライフサイクル図の横断的知見を追記), [[インシデント管理]](「インシデントのサイクル」円環モデルと Response/Review/Analysis 3部構成との対応関係を追記) ### 2026-07-01 ingest-video | If I Can Do It on an Ambulance, You Can Do It in an Office: Scalable Incident Response Using ICS (Thai Wood, SREcon23 Americas, 2023) - [[@2023__SREcon23Americas__If I Can Do It on an Ambulance - Scalable Incident Response Using ICS]] — [[Thai Wood]](元 EMT、[[Resilience Roundup]] 主宰の独立コンサルタント)、USENIX SREcon23 Americas(2023-03-23、Santa Clara, CA)。ICS(Incident Command System)全体ではなく最小限の「種」から始めるアプローチを提案し、「3つの帽子」(Organizer/Connector/Expert)モデルを対応に必須の core needs として再定義。「ランブックは安全を買えない(you cannot document your way to safety)」というランブック批判と、ゲームデイ・テーブルトップ演習による practice の重要性を主張。YouTube 自動字幕 transcript(34分) + 代表フレーム12枚。 - Sources (new): [[@2023__SREcon23Americas__If I Can Do It on an Ambulance - Scalable Incident Response Using ICS]] - Entities (new): [[Thai Wood]], [[Resilience Roundup]] - Concepts (updated): [[Incident Commander]](「3つの帽子」最小モデルと正式な IC/TL/CL 構造の対比、ランブック批判と Goldfuss の Nrrd 自動化との対比を追記), [[ダッシュボードとランブックの運用]](Douch の一時性原則と Wood の認識論的批判の補完関係、ランブック作成という活動自体の価値を追記), [[GameDay]](practice の目的の再定義と「文書公開だけでは終わらない」という理論的根拠を追記) ### 2026-07-01 ingest-slides | The World Blew Up But We're All Okay: Managing a massive-scale incident at Datadog (Laurent Bernaille, Laura de Vesine, SREcon23 EMEA, 2023) - [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]] — [[Laurent Bernaille]]・[[Laura de Vesine]]([[Datadog]])、USENIX SREcon23 EMEA。2023年3月8日、Ubuntu の自動セキュリティ更新が誘発した systemd/networkd の経路フラッシュにより AWS・GCP・Azure 複数リージョンで Kubernetes ノードが同時多発的に接続不能になった大規模インシデントの技術的根本原因(Cilium CNI・ENI 直接割り当て)と、500人超・単一 Zoom 通話に14時間で493人参加という規模の組織的インシデント対応を発表。76ページ + Whisper 音声文字起こし(584行)。 - Sources (new): [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]] - Entities (new): [[Laurent Bernaille]]。Entities (updated): [[Laura de Vesine]](silverrose ハンドル追記)、[[Datadog]](インシデント対応・組織文化節を追加)、[[Kubernetes]](Datadog 親子クラスタ構成を追記) - Concepts (updated): [[インシデント管理]](共通 OS の障害波及・超大規模 IC 対応・クラウド API レート制限ボトルネックの横断的知見3件、未解決の問い1件を追記) ### 2026-07-01 ingest-slides | Your System Has Recovered from an Incident, but Have Your Developers? (Jaime Woo, SREcon18 Americas, 2018) - [[@2018__SREcon18Americas__Your System Has Recovered from an Incident, but Have Your Developers]] — [[Jaime Woo]](元 [[Shopify]])、USENIX SREcon18 Americas(2018-03-27)。インシデント後のエンジニアの心理的回復を医師・コメディアン・オリンピアンの知見から論じる。42.5% が強いストレスを報告、80% がピアサポートをほぼ受けていない実態を示し「人間向けインシデントレスポンス」を提起する。39ページ、transcript なし。 - Sources (new): [[@2018__SREcon18Americas__Your System Has Recovered from an Incident, but Have Your Developers]] - Entities (new): [[Jaime Woo]] - Concepts (new): [[インシデント後の人的回復]]。Concepts (updated): [[オンコールストレス管理]](横断的知見に Long vs Woo 比較追記), [[人的要因]](source 追加) ### 2026-07-01 ingest-slides | The Critical Resource Is You: Practical Destressing for On-Call Engineers (Beth Adele Long, SREcon26 Americas, 2026) - [[@2026__SREcon26Americas__The Critical Resource Is You - Practical Destressing for On-Call Engineers]] — [[Beth Adele Long]]([[Continuous Re-integration]] / [[Adaptive Capacity Labs]])、USENIX SREcon26 Americas(2026-03-24)。オンコール業務の慢性ストレス(ページャーを持つこと)と急性ストレス(インシデント対応)を ANS の観点から分析し、Ordinary Mind / Sensory Mind の 2 意識モードを軸に、身体知性に根ざした 4 ツール(Body Scan・Breath・Movement・Boredom)を提示する。43ページ、transcript なし。 - Sources (new): [[@2026__SREcon26Americas__The Critical Resource Is You - Practical Destressing for On-Call Engineers]] - Entities (new): [[Beth Adele Long]], [[Continuous Re-integration]] - Concepts (new): [[オンコールストレス管理]]。Concepts (updated): [[人的要因]](生理学的ストレス管理を Human Factors の身体的次元として横断的知見に追記) ### 2026-07-01 ingest-slides | Epistemology of Incident Management (Jack Kingsman, SREcon26 Americas, 2026) - [[@2026__SREcon26Americas__Epistemology of Incident Management]] — [[Jack Kingsman]]([[Atlassian]] シニア SRE)、USENIX SREcon26 Americas(2026-03)。Google SRE Book の Incident Loop を 5 フェーズ(検知/宣言・生存/トリアージ・検査・診断・テスト/処置)に体系化し直し、各フェーズの「知識の問い」を設定した認識論的インシデント管理フレームワーク。証拠 2×2 マトリクス・3 種の探索パターン(Linear/Binary/Induced-Change)・仮説 3 条件(testable/relevant/specific)・テスト 6 基準の 4 ツールが核心。"Incidents are all about knowledge" で締めくくる。49ページ + YouTube 英語自動字幕 transcript。CC-BY 4.0。 - Sources (new): [[@2026__SREcon26Americas__Epistemology of Incident Management]] - Entities (new): [[Jack Kingsman]]。Entities (updated): [[Atlassian]](Kingsman SREcon26 発表を関連ソースに追加) - Concepts (new): [[インシデント認識論]]。Concepts (updated): [[インシデント管理]](Kingsman の認識論的横断的知見追記)、[[仮説駆動RCA]](仮説 3 条件・テスト 6 基準を横断的知見に追記) ### 2026-07-02 ingest-paper | Machine Learning Fleet Efficiency: Improving TPU Systems at Scale with ML Productivity Goodput (MLSys 2026) - [[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]] — [[Arissa Wongpanich]] ほか([[Google]])、MLSys 2026 Industry Track(2026-05)。ML Productivity Goodput(MPG = Scheduling Goodput × Runtime Goodput × Program Goodput)を提案。Google TPU 本番フリートで SG > 95%・非同期チェックポイント・AoT コンパイル・通信計算オーバーラップを実証。Program Goodput は roofline 効率でなく予測ステップ時間を分母に使うことでオペレーター融合余地を可視化する。 - Sources (new): [[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]] - Entities (new): [[Arissa Wongpanich]]、[[Vijay Janapa Reddi]]、[[Borg]]。Entities (updated): [[Google]](ML フリート効率セクション追加) - Concepts (new): [[ML Productivity Goodput]]。Concepts (updated): [[GPUクラスタ運用]](MPG 横断的知見・未解決の問い追記) - [[@2025__SIGCOMM__POSTER - Vedrfolnir - RDMA Network Performance Anomalies Diagnosis in Collective Communications]] — 集合通信における RDMA NPA 診断。待機グラフ+ステップ認識型適応検知。[[Hawkeye]] 比 98% テレメトリ削減。Beihang University、SIGCOMM Posters and Demos 2025。 ### 2026-07-06 ingest-paper | Beyond Throughput: Performance and Energy Insights of LLM Inference Across AI Accelerators (IPDPS 2026) - [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]] — [[Giacomo Brunetta]] ほか([[University of Illinois Chicago]] + [[Argonne National Laboratory]])、IEEE IPDPS 2026。6 GPU(NVIDIA A100/H100/GH200, AMD MI250/MI300X, Intel Max 1550) + 2 データフローアクセラレータ(Cerebras CS-3, SambaNova SN40L) × 14 LLM を ALCF 実環境で比較。スループット・レイテンシ・TTFT・ITL・エネルギー効率を測定。主知見: H100 が GPU 最高・データフローは小バッチで GPU 比1桁優位・推論では DP > TP。 - Sources (new): [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]] - Entities (new): [[Giacomo Brunetta]], [[Cerebras]], [[SambaNova]] - Concepts (new): [[AIアクセラレータ]]. Concepts (updated): [[LLM推論]](データフロー・DP vs TP・エネルギー効率の知見追記)、[[テンソル並列]](推論 TP vs DP の知見と 未解決の問い追記)、[[Mixture-of-Experts]](MoE 推論・EP vs TP 知見追記) ### 2026-07-06 ingest-paper | INTFusion: Unifying Network and Host Telemetry in Data Center Networks (IFIP Networking 2026) - [[@2026__IFIP Networking__INTFusion - Unifying Network and Host Telemetry in Data Center Networks]] — [[Leonardo Alberro]] ほか([[Universidad de la República]])、IFIP Networking 2026。INT ソース/シンクを smartNIC にオフロードし eBPF ホスト層トレースを per-flow 融合する統一型データセンター監視アーキテクチャ。二層エクスポートモデル(イベント駆動リアルタイム + レート制御遅延)。フローレット抽象化で長期持続 TCP コネクション上の複数メッセージを識別。インキャスト検知とフローサイズ推定を輻輳制御ユースケースとして実証。10 GbE sNIC で 1〜3.9 Mpps 処理。 - Sources (new): [[@2026__IFIP Networking__INTFusion - Unifying Network and Host Telemetry in Data Center Networks]] - Entities (new): [[Leonardo Alberro]], [[Matias Richart]], [[Eduardo Grampin]], [[Universidad de la República]] - Concepts (new): [[インバンドネットワークテレメトリ]]. Concepts (updated): [[テレメトリ]](INT+eBPF クロスレイヤー収集の横断知見追記)、[[ネットワーク監視]](Centralizer スケーラビリティの横断知見・未解決の問い追記)、[[データセンター輻輳制御]](テレメトリ→制御閉ループの未解決の問い追記) ### 2026-07-13 ingest | Cognitive Work of Hypothesis Exploration During Anomaly Response (ACM Queue) - [[@2019__ACMQueue__Cognitive Work of Hypothesis Exploration During Anomaly Response]] — [[Marisa R. Grayson]]([[Mile Two]]、ACM Queue Vol. 17 no. 6、2019年)。[[SNAFUcatchers Consortium]] のインシデントケースDBから4件を process tracing 手法で分析し、アノマリー応答における仮説探索空間(hypothesis-exploration space)の時間発展(line of commitment を境に分岐・収束)を可視化。データセンター間バックアップ経路輻輳とロードバランサのゾンビ tee ルールの2ケースを詳述。Cloudflare 403 のため Wayback Machine 経由で全文取得。 - Sources (new): [[@2019__ACMQueue__Cognitive Work of Hypothesis Exploration During Anomaly Response]] - Entities (new): [[Marisa R. Grayson]], [[Mile Two]], [[SNAFUcatchers Consortium]]。Entities (updated): [[David D. Woods]], [[Richard I. Cook]] - Concepts (new): [[アノマリー応答]]。Concepts (updated): [[仮説駆動RCA]](line of commitment・時間的近接性バイアスの横断的知見追記)、[[ヒンドサイトバイアス]](時間的近接性バイアスとの対比追記)、[[レジリエンスエンジニアリング]](process tracing 方法論の横断的知見追記) ### 2026-07-13 ingest | 価値はスケールしない。発酵する。(安宅和人) - [[@2026__hatenablog__価値はスケールしない、発酵する。]] — [[安宅和人]]、ブログ「ニューロサイエンスとマーケティングの間」(2026-07-11)。『風の谷という希望』第7章の価値生成論を発展させ、成長/脱成長の対立軸を「価値がどのような時間で育つか」という問いへ組み替える論考。経済資本(複利)・文化資本(発酵)・関係資本(熟成)・自然資本(循環)という[[四資本の時計]]、完全な混合でも分離でもない[[価値生成の膜モデル]]と[[地域の乳化剤]]、土地の個性ではなく「味わうことのできる時間」としての[[テロワール(味わうことのできる時間)]]、[[存続可能性から生成する力へ]]を提示する。メルボルン大学の[[Dan Hill]]との呼応、和歌山県御坊市の[[堀河屋野村]]訪問が題材。 - Sources (new): [[@2026__hatenablog__価値はスケールしない、発酵する。]] - Entities (new): [[安宅和人]], [[Dan Hill]], [[堀河屋野村]] - Concepts (new): [[四資本の時計]], [[価値生成の膜モデル]], [[地域の乳化剤]], [[テロワール(味わうことのできる時間)]], [[存続可能性から生成する力へ]] - Key insight: 成長論・脱成長論はともに全ての価値が経済資本と同じ単一の時計で動くと誤って前提しており、本当の問いは価値がどのような時間で育つかである。この論考は SRE/インフラ領域が中心だったこの wiki に、地域再生・文化資本・脱成長という新規ドメインを導入する。 - Open questions: 四資本それぞれの「発酵に適した温度」の定量化、乳化剤的人材の見出し方・育成制度設計、テロワール概念の食・酒以外への一般化。 ### 2026-07-13 ingest-paper | AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations (arXiv) - [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]] — [[Chenyu Zhao]]・[[Shenglin Zhang]] ほか([[Nankai University]] / [[Tsinghua University]] / [[Microsoft]])、arXiv 2026-07-07(cs.SE)。LLM エージェントの失敗実行を Transition Unit のグラフ(Critical Transition Graph)で診断し、オフライン HGT 検出器 + 実時間 Isolation Forest 検出器で失敗の根幹となる部分軌跡を局所化、Repair Memory で反復状態を保持しつつ保護付き実行時介入(Check→Decide→Inject)で修正を再実行中も維持する実行時修復フレームワーク。τ-bench 261 タスク・Qwen3.7-max/GPT-5.4 で評価し、Banking の初回失敗タスクを 59.04%/65.12% 修復(全体で Blind retry 比 +26.02pp)。根本原因は症状の中央値 4 ステップ上流(最大 26)にあり、一度きりの診断フィードバックは tool-call ステップ 13 で追従率 50% を割るまで減衰することを実証。 - Sources (new): [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]] - Entities (new): [[Chenyu Zhao]]. Entities (updated): [[Shenglin Zhang]], [[Dan Pei]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[Wenwei Gu]](所属不一致の contradiction 追記), [[Yongqian Sun]], [[Nankai University]], [[Tsinghua University]], [[Microsoft]] - Concepts (new): [[エージェント修復]]. Concepts (updated): [[エージェントシステム運用]](「解決」段階の連動性の実証知見追記)、[[グラフベースRCA]](エージェント内部軌跡へのグラフ RCA 拡張の横断的知見追記) ### 2026-07-13 ingest-paper | Integrating Large Language Models into Security Incident Response (USENIX SOUPS 2025) - [[@2025__SOUPS__Integrating Large Language Models into Security Incident Response]] — [[Diana Kramer]]・[[Lambert Rosique]]・[[Ajay Narotam]]・[[Elie Bursztein]]・[[Patrick Gage Kelley]]・[[Kurt Thomas]]・[[Allison Woodruff]]([[Google]] / [[DataPhant]])、USENIX SOUPS 2025(2025-08-11、Seattle)。18名のセキュリティアナリストと50件の実インシデントを用い、Gemini 1.5 Flash によるインシデント要約の自律自動化と人間協働支援を4段階の実験で評価。自律要約は人間要約に61%対39%で劣後(完全性35%・事実性42%の欠陥率)する一方、人間がAI下書きを編集する協働(AI支援)要約は人間単独の要約より77%対11%で優位という非対称な結果を示した。 - Sources (new): [[@2025__SOUPS__Integrating Large Language Models into Security Incident Response]] - Entities (new): [[Diana Kramer]], [[Lambert Rosique]], [[Ajay Narotam]], [[Elie Bursztein]], [[Patrick Gage Kelley]], [[Kurt Thomas]], [[Allison Woodruff]]. Entities (updated): [[Google]](セキュリティインシデント要約へのLLM統合を追記) - Concepts (new): [[LLMインシデント要約]]. Concepts (updated): [[インシデントレポート執筆]](LLM要約の完全性/事実性トレードオフを横断的知見に追記)、[[インシデントレスポンスAIレベル]](セキュリティ要約タスクの実証データによる IR2 停止根拠の裏付けを追記) ### 2026-07-13 ingest-paper | Large Language Models Can Provide Accurate and Interpretable Incident Triage (ISSRE 2024) - [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]] — [[Zexin Wang]]・[[Jianhui Li]]・[[Minghua Ma]] ほか([[Microsoft]] / [[Chinese Academy of Sciences]])、ISSRE 2024(2024-10、pp.523-534)。LLM(GPT-3.5/GPT-4)でログからキーワードを抽出し埋め込み類似検索でインシデントを担当チームへ割り当てるシステム COMET。AutoExtractor による生ログ絞り込み(TrimmedLogs)+ドメイン知識プロンプトによるキーワード抽出+FastText 埋め込みファインチューニング。Microsoft の2大規模クラウドサービスに6ヶ月以上本番展開し、オンラインでACC@1を0.47→0.61に改善・TTMを35%短縮。ログ・議論の生テキストよりTrimmedLogsが、生成要約よりキーワードがトリアージ入力表現として優れることを比較実験(Table I・II)で実証。DOI版はIEEE Xplore有料壁の向こうのため、著者が Microsoft Research サイトで直接公開する PDF を原本として取り込んだ。 - Sources (new): [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]] - Entities (new): [[Ze Li]], [[Jianhui Li]], [[Chinese Academy of Sciences]]. Entities (updated): [[Zexin Wang]], [[Minghua Ma]], [[Chetan Bansal]], [[Qingwei Lin]], [[Dongmei Zhang]], [[Yu Kang]], [[Chaoyun Zhang]], [[Saravan Rajmohan]], [[Murali Chintalapati]], [[Changhua Pei]], [[Gaogang Xie]], [[Microsoft]] - Concepts (new): [[インシデントトリアージ]]. Concepts (updated): [[インシデント管理]](キーワード抽出の優位性・レガシールール再利用パターンを横断的知見に追記)、[[インシデントTTM予測]](トリアージ精度改善によるTTM削減という別経路を追記) ### 2026-07-13 ingest-paper | Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems (TOSEM投稿版) - [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]] — [[Ruowei Fu]] ほか([[ByteDance]] / [[Nankai University]])、TOSEM投稿版(2026)。知識蒸留+自己強化+DPOによるSLMファインチューニングでチケットトリアージを行うCoTriageを提案。3モジュール構成、Table 1〜8で大規模本番評価。同著者陣の先行研究OncallXとは対照的な技術路線。 - Sources (new): [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]] - Entities (new): [[Yang Zhang (ByteDance)]], [[Xin Wu (ByteDance)]], [[Feng Wang (ByteDance)]], [[Zeyu Che]], [[Xiaozhou Liu (ByteDance)]]. Entities (updated): [[Ruowei Fu]], [[Yu Zhang (ByteDance)]], [[ByteDance]], [[Yongqian Sun]], [[Nankai University]], [[Wenwei Gu]], [[Shenglin Zhang]] - Concepts (new): [[知識蒸留]]. Concepts (updated): [[オンコール自動化]](CoTriage vs OncallXの技術路線対比を追記)、[[インシデントトリアージ]](DeepCT/DeepTriage/COMETが共通ベースラインとして使われる観察を追記) ### 2026-07-13 ingest-paper | Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents (arXiv 2026) - [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]] — [[Chenyu Zhao]]・[[Shenglin Zhang]] ほか([[Nankai University]])、arXiv 2026-06-05。診断精度改善(+43.58pt)が回復率改善(+12.45pt)を大きく上回る「diagnosis–recovery gap」を実証したPROBEフレームワーク。AIOpsLab上でケーススタディ。 - Sources (new): [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]] - Entities (new): [[Yihang Lin]], [[Zhimin Chen]]. Entities (updated): [[Chenyu Zhao]], [[Shenglin Zhang]], [[Wenwei Gu]], [[Yongqian Sun]], [[Dan Pei]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[AIOpsLab]] - Concepts (updated): [[エージェント修復]](PROBEとAgentTetherの突き合わせ知見を追記) ### 2026-07-13 ingest-paper | Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems - [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] — [[Chenyu Zhao]] ほか([[Nankai University]] / [[Peking University]] / [[Tsinghua University]] / [[Microsoft]])。エージェント型ツール利用なしでは GPT-5 成功率6.13%、Build-benchの反復ループ環境下で63.19%(10.3倍)に到達することを実証。クロスISAビルド修復ベンチマーク。 - Sources (new): [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] - Entities (new): [[Build-bench]], [[Open Build Service]], [[Weilin Jin]]. Entities (updated): [[Chenyu Zhao]], [[Shenglin Zhang]], [[Yongqian Sun]], [[Dan Pei]], [[Chaoyun Zhang]], [[Qingwei Lin]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[Nankai University]], [[Peking University]], [[Tsinghua University]], [[Microsoft]] - Concepts (new): [[クロスISAマイグレーション]], [[自動ビルド修復]]. Concepts (updated): [[エージェント型コーディング]](Build-benchの知見を追記) ### 2026-07-13 ingest-paper | Bridging the Delay: Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis (FSE Companion '26) - [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]] — [[Junhua Kuang]] ほか([[Nankai University]] / [[Alibaba Group]] / [[Tsinghua University]])、FSE Companion '26。マイクロサービス障害伝播の81.5%が非同期(2分以上の遅延)であることを本番データで示し、時間ラグを明示的にモデル化するLagRCAを提案。 - Sources (new): [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]] - Entities (new): [[Junhua Kuang]], [[Yimeng Zhang]], [[Jintao Feng]], [[Jingyu Wang]], [[Liping Zhang]], [[LagRCA]]. Entities (updated): [[Shenglin Zhang]], [[Yongqian Sun]], [[Dan Pei]], [[Nankai University]], [[Alibaba Group]], [[Tsinghua University]], [[Sibo Xia]], [[Wenwei Gu]], [[Wei Li]] - Concepts (new): [[遅延認識時空間因果推論]]. Concepts (updated): [[因果推論ベースRCA]], [[Fault Localization]], [[根本原因分析]], [[グラフベースRCA]] ### 2026-07-13 ingest-paper | LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles (ASE'26投稿版) - [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] — [[Ruowei Fu]] ほか([[Nankai University]])、ASE'26投稿版(InsightTriage)。Huawei/ICV(車載)ドメイン向けチケット+ログ統合トリアージ。ログ検索器除去でWeighted F1が19.2%低下するアブレーションでログを一次証拠とする設計の有効性を実証。 - Sources (new): [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] - Entities (new): [[Weiguo Li]]. Entities (updated): [[Ruowei Fu]], [[Shenglin Zhang]], [[Wenwei Gu]], [[Yongqian Sun]], [[Dan Pei]], [[Nankai University]] - Concepts (updated): [[インシデントトリアージ]], [[オンコール自動化]] ### 2026-07-13 ingest-paper | FoundRoot: Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking (ICSE '26) - [[@2026__ICSE__FoundRoot - Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking]] — [[Zhe Xie]] ほか([[Tsinghua University]] / [[ByteDance]] / [[Nankai University]])、ICSE '26。構造化深層思考(メトリクススキャン→伝播分析→リフレクション→ランキング)を warm-up SFT + DAPO で内在化し、ゼロショットRCA 4データセット全てでMRR 4.5%〜48.6%改善。 - Sources (new): [[@2026__ICSE__FoundRoot - Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking]] - Entities (new): [[Yuzhuo Yang]]. Entities (updated): [[Zhe Xie]], [[Zeyan Li]], [[Xiao He]], [[Shenglin Zhang]], [[Longlong Xu]], [[Tieying Zhang]], [[Jianjun Chen]], [[Rui Shi]], [[Dan Pei]], [[Tsinghua University]], [[ByteDance]], [[Nankai University]] - Concepts (new): [[構造化深層思考]]. Concepts (updated): [[根本原因分析]], [[LLMによる根本原因分析]], [[検証可能報酬による強化学習]], [[Fault Localization]] ### 2026-07-13 ingest-paper | Aloha: Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent (FSE Companion '26) - [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]] — Shenglin Zhang・[[Yujia Wu]]・[[Jinghuan Ren]] ほか([[Nankai University]] / [[Microsoft]])、FSE Companion '26。対照分析ベースのバッチ障害診断で「アルゴリズムでなくusability gapが実務障壁」と指摘し、CONANをACC@5で0.9370対0.6963、診断時間を約10時間から約0.5時間に短縮。 - Sources (new): [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]] - Entities (new): [[Yujia Wu]], [[Jinghuan Ren]]. Entities (updated): [[Shenglin Zhang]], [[Yongqian Sun]], [[Chaoyun Zhang]], [[Liqun Li]], [[Wenwei Gu]], [[Qingwei Lin]], [[Dongmei Zhang]], [[Saravan Rajmohan]], [[Chetan Bansal]], [[Minghua Ma]], [[Nankai University]], [[Microsoft]] - Concepts (new): [[バッチ障害診断]]. Concepts (updated): [[Fault Localization]] ### 2026-07-13 ingest-paper | When LLMs Listen to Experts: Accurate Failure Diagnosis in Operating Systems (ICSE-SEIP '26) - [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]] — [[Yongxin Zhao]] ほか([[Nankai University]] / [[Alibaba Group]] / [[Tsinghua University]])、ICSE-SEIP '26。OScope は Knowledge Aligner による症状記述の意味的整合とチャンク単位検証で、Alibaba本番OS障害診断AC@5=0.901・平均診断時間112分→1.5分を達成。 - Sources (new): [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]] - Entities (new): [[OScope]], [[Yuxin Sun]], [[Li Shi]], [[Cheng Huang]], [[Guodong Yang]], [[Luping Wang]]. Entities (updated): [[Yongxin Zhao]], [[Wenwei Gu]], [[Yongqian Sun]], [[Shenglin Zhang]], [[Dan Pei]], [[Liping Zhang]], [[Nankai University]], [[Alibaba Group]], [[Tsinghua University]] - Concepts (updated): [[TSG自動化]], [[マルチモーダル障害診断]] ### 2026-07-13 ingest-paper | PerfScout: An Adaptive Workload Generator in Software Performance Testing (ICSE-SEIP '26) - [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]] — [[Yongqian Sun]] ほか([[Nankai University]] / [[BizSeer]] / [[Huawei Cloud]] / [[Tsinghua University]])、ICSE-SEIP '26。SPOT・ADF/KPSS・PPOを統合した性能テストワークロード生成の全自動化フレームワーク。Huawei Cloudに9か月間本番デプロイされ代表ケースで87%のテスト時間短縮を実証。 - Sources (new): [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]] - Entities (new): [[Qingliang Zhang]], [[Yimin Zuo]], [[Bowen Deng]], [[Xiao Xiong]], [[Mengyao Li]], [[Huandong Zhuang]], [[Ruiyuan Wan]]. Entities (updated): [[Yongqian Sun]], [[Shenglin Zhang]], [[Dan Pei]], [[Xidao Wen]], [[Nankai University]], [[Huawei Cloud]], [[BizSeer]], [[Alban Siffer]], [[Tsinghua University]], [[Wenwei Gu]] - Concepts (updated): [[定常性モデル]], [[適応的ワークロード生成]] ### 2026-07-13 ingest-paper | A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection (IEEE TSC 2025) - [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]] — Yongqian Sun ほか([[Nankai University]])、IEEE Transactions on Services Computing, 2025。トレース異常検知の初の横断ベンチマーク TADBench。全データセット横断で一貫最良のアルゴリズムは存在せず、決定木でアルゴリズムを推奨。 - Sources (new): [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]] - Entities (new): [[Minyi Shao]], [[Kaiwen Yang]], [[Xingda Li]], [[Dongbiao He]], [[Yanbiao Li]]. Entities (updated): [[Yongqian Sun]], [[Nankai University]] - Concepts (new): [[トレース異常検知]] ### 2026-07-13 ingest-paper | From Chaos to Clarity: Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services (FCS 2025) - [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]] — [[Tianyu Cui]] ほか([[Nankai University]] / [[ByteDance]])、FCS 2025。カーネルパニックRCAをスパースログ抽出とログ間長距離依存の2課題に分解。ByteDance本番20,000件データでLogKGを15.5〜20.3pt F1上回り6ヶ月超本番デプロイ。 - Sources (new): [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]] - Entities (new): [[Tianyu Cui]]. Entities (updated): [[Shenglin Zhang]], [[Yongqian Sun]], [[Yicheng Sui]], [[Zeyu Che]], [[Nankai University]], [[ByteDance]] - Concepts (updated): [[ログ解析]], [[根本原因分析]], [[グラフベースRCA]], [[LLMによる根本原因分析]] ### 2026-07-13 ingest-paper | Bridging Edge and Cloud: A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection (IEEE TSC 2025) - [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] — Shenglin Zhang ほか([[Nankai University]] / [[Alibaba Cloud]])、IEEE Transactions on Services Computing, 2025。RefinedEdge は多変量時系列異常検知モデルをエッジ配置可能な水準(0.15Mパラメータ未満)まで圧縮しつつクラウド訓練モデルに匹敵・凌駕する精度を達成。 - Sources (new): [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] - Entities (new): [[RefinedEdge]], [[Jiacheng Zhang]], [[Guohua Liu]], [[Shiqi Chen]], [[Yutong Chen]]. Entities (updated): [[Shenglin Zhang]], [[Yongqian Sun]], [[Dan Pei]], [[Minghua Ma]], [[Chenyu Zhao]], [[Nankai University]], [[Alibaba Cloud]] - Concepts (updated): [[異常検知]], [[知識蒸留]], [[モデル圧縮]], [[Edge-cloud Collaboration]] ### 2026-07-14 ingest-paper | A Survey of DevOps Concepts and Challenges (ACM Computing Surveys, 2019) - [[A Survey of DevOps Concepts and Challenges]] — [[Leonardo Leite]]・[[Carla Rocha]]・[[Fabio Kon]]・[[Dejan Milojicic]]・[[Paulo Meirelles]]([[University of São Paulo]] / [[University of Brasília]] / [[Hewlett Packard Labs]] / [[Federal University of São Paulo]])、ACM Computing Surveys, 2019。50本のcore paperにGrounded Theory的手法を適用し、DevOps概念をprocess/people/delivery/runtimeの4カテゴリからなるconceptual frameworkとして体系化。既存DevOps SLRがdelivery/runtimeの技術的含意を軽視していたことを指摘し、DevOpsツールを7カテゴリに分類してactorと概念に対応づけた。 - Sources (new): [[A Survey of DevOps Concepts and Challenges]] - Entities (new): [[Leonardo Leite]], [[Carla Rocha]], [[Fabio Kon]], [[Paulo Meirelles]], [[University of São Paulo]], [[University of Brasília]], [[Federal University of São Paulo]]. Entities (updated): [[Dejan Milojicic]], [[Hewlett Packard Labs]] - Concepts (updated): [[DevOps]] ### 2026-07-14 ingest-paper | OpenRCA 2.0: From Outcome Labels to Causal Process Supervision (arXiv, 2026) - [[@2026__arXiv__OpenRCA 2.0 - From Outcome Labels to Causal Process Supervision]] — [[Aoyang Fang]]・[[Yifan Yang]]・[[Jin'ao Shang]]・[[Qisheng Lu]]・[[Junjielong Xu]]・[[Rui Wang]]・[[Songhan Zhang]]・[[Yuzhong Zhang]]・[[Boxi Yu]]・[[Pinjia He]]([[The Chinese University of Hong Kong, Shenzhen]])、arXiv:2606.27154, 2026。既知の障害注入介入 do(v_root) を使う段階的因果ラベリング PAVE(Path Annotation via Verified Effects)を提案し、根本原因ラベルだけでなく検証済みの因果伝播経路まで持つ初の cross-system RCA ベンチマーク OpenRCA 2.0(TrainTicket・OTel Demo・Hotel Reservation、500 インスタンス)を構築。11 の最先端 LLM を評価すると EM は平均 20.7% にとどまり、正しいサービスを言い当てる AnySvc(76.0%)と検証済み経路まで裏づける Path Reachability(61.5%)の 14.5pp のギャップを「grounding されていない診断(ungrounded diagnosis)」と定義。Edge F1(43.4%)が Node F1(62.2%)を全モデルで下回ることも示した。 - Sources (new): [[@2026__arXiv__OpenRCA 2.0 - From Outcome Labels to Causal Process Supervision]] - Entities (new): [[Yifan Yang]], [[Jin'ao Shang]], [[Qisheng Lu]], [[Rui Wang]], [[Songhan Zhang]], [[Yuzhong Zhang]], [[Boxi Yu]]. Entities (updated): [[Aoyang Fang]], [[Pinjia He]], [[Junjielong Xu]], [[The Chinese University of Hong Kong, Shenzhen]], [[OpenRCA]] - Concepts (updated): [[RCA評価設計]], [[因果発見]], [[障害注入]] ### 2026-07-15 ingest-paper | The Anatomy of a Large-Scale Hypertextual Web Search Engine (Computer Networks, 1998) - [[@1998__Computer Networks__The Anatomy of a Large-Scale Hypertextual Web Search Engine]] — [[Sergey Brin]]・[[Lawrence Page]]([[Stanford University]])、Computer Networks and ISDN Systems 30 (1998) 107-117(WWW7 1998 発表)。2,400 万ページ規模の Web 検索エンジンプロトタイプ Google を報告し、リンク構造由来のページ重要度指標 PageRank(`PR(A) = (1-d) + d·Σ PR(Ti)/C(Ti)`)とアンカーテキストのリンク先索引化を核とした設計・クローラ/インデクサ/ソータ/サーチャからなるアーキテクチャ(Fig. 1)、実測ストレージ(圧縮リポジトリ 53.5 GB・完全転置索引 37.2 GB・合計 108.7 GB)とクロール速度(秒速最大 48.5 ページ)を報告する、検索エンジンとしての Google の創業論文。 - Sources (new): [[@1998__Computer Networks__The Anatomy of a Large-Scale Hypertextual Web Search Engine]] - Entities (new): [[Sergey Brin]], [[Lawrence Page]]. Entities (updated): [[Stanford University]], [[Google]] - Concepts (new): [[PageRank]] ### 2026-07-15 ingest-paper | Valet: Efficient Data Placement on Modern SSDs (SoCC '25) - [[@2025__SoCC__Valet - Efficient Data Placement on Modern SSDs]] — Devashish R. Purandare・Peter Alvaro・Avani Wildani・Darrell D. E. Long・Ethan L. Miller([[UC Santa Cruz]] / [[Emory University]] / [[Cloudflare]] / [[Pure Storage]])、ACM Symposium on Cloud Computing (SoCC '25)、2025-11-19。LD_PRELOAD ベースの userspace シムレイヤー Valet を提案し、アプリケーション・ファイルシステム・カーネルを一切変更せずに、affinity(親和性)と lifetime(寿命)の2軸に基づく配置ヒントを RocksDB・MongoDB(WiredTiger LSM)・CacheLib に注入。f2fs に対して2〜6倍のスループット向上、最大6倍低いテールレイテンシを達成し、アプリケーション固有ソリューション zenfs に匹敵する性能とより広い適用性を両立した(zenfs は最新 RocksDB で既に動作せず保守が停滞、追加コード行数は zenfs 4017+988行・f2fs(zns) 38,188+1252行に対し Valet はカーネル・アプリ変更ゼロで userspace 1700行)。 - Sources (new): [[@2025__SoCC__Valet - Efficient Data Placement on Modern SSDs]] - Entities (new): [[Devashish R. Purandare]], [[Peter Alvaro]], [[Avani Wildani]], [[Darrell D. E. Long]], [[Ethan L. Miller]], [[Valet]], [[MongoDB]], [[CacheLib]], [[zenfs]], [[f2fs]], [[Pure Storage]]. Entities (updated): [[UC Santa Cruz]], [[Emory University]], [[Cloudflare]], [[RocksDB]] - Concepts (new): [[ホスト誘導データ配置]], [[シムレイヤー]], [[ゾーン名前空間SSD]]. Concepts (updated): [[LSMツリー]] ### 2026-07-15 ingest-paper | Can Large Language Models Generate Observability-Aware Code? (arXiv, 2026) - [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]] — [[Yongliang Tao]]・[[Hongyu Zhang]]([[Chongqing University]])、[[Pengfei Gao]]・[[Minghua Ma]]・[[Zhiyu Fan]]・[[Yu Kang]]・[[Jue Zhang]]・[[Si Qin]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Saravan Rajmohan]]([[Microsoft]])、arXiv:2607.05785、2026-07-07。コーディングエージェントが生成するコードのオブザーバビリティを、18 リポジトリ 1,223 インスタンスのソースレベル復元(Position F1・KeyBag F1)と、200 個の agent 生成マイクロサービス・Kubernetes デプロイ・13 種の Chaos Mesh 障害注入による 1,615 件の実行時評価(Fault Signals Rate 4.95〜13.99%)の 2 軸で実証。エージェントは配置(where)より診断意味論(what)の再現が体系的に弱く(全プロンプト戦略で Position F1 > KeyBag F1)、explicit instruction は生成量を倍増させるが precision を犠牲にする Quantity over Quality 現象を確認した。約 200 件の実失敗修復コミットから抽出した軽量 observability-oriented skill は FSR・Position F1・KeyBag F1 を改善するが効果は限定的(GPT-5.5: +8.67pp、Claude Opus 4.8: +0.99pp、Gemini 3.5 Flash: +2.54pp)。 - Sources (new): [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]] - Entities (new): [[Yongliang Tao]], [[Pengfei Gao]], [[Zhiyu Fan]], [[Jue Zhang]]. Entities (updated): [[Hongyu Zhang]], [[Chongqing University]], [[Minghua Ma]], [[Qingwei Lin]], [[Saravan Rajmohan]], [[Si Qin]], [[Liqun Li]], [[Yu Kang]], [[Microsoft]] - Concepts (updated): [[オブザーバビリティ]], [[コーディングエージェント評価]], [[ログ生成]], [[障害注入]], [[バイブコーディング]] ### 2026-07-16 ingest-paper | AI 2040: Plan A — The Deal (AI Futures Project, 2026) - [[@2026__AI Futures Project__AI 2040 - Plan A - The Deal]] — [[AI Futures Project]]([[Daniel Kokotajlo]] ほか)。「AI 2027」の続編となる政策シナリオ文書(90ページ)。米中が超知能開発への無謀な競争を回避する国際的取り決め「Plan A」——研究の完全透明化・コンピュート宣言・訓練一時停止・相互確証コンピュート破壊(MACD)——によって超知能到達を2040年まで先送りする成功シナリオを年表形式で描く。代替プランB(Sabotage)/C(Slowdown)/D(Race)/S(Shutdown)との著者ら自身による比較評価、中国による秘密裏AGI計画の検知確率分析(Appendix D、未検知でTED-AI到達確率は2043年まで10%未満)、著者ら自身の卓上演習で繰り返し再現された最悪の失敗モード(欠陥のある安全性ケースの承認、Appendix L)を含む。 - Sources (new): [[@2026__AI Futures Project__AI 2040 - Plan A - The Deal]] - Entities (new): [[AI Futures Project]], [[Daniel Kokotajlo]] - Concepts (new): [[AI国際検証レジーム]], [[権力集中リスク]]. Concepts (updated): [[知能爆発]], [[テイクオフ速度論争]] ### 2026-07-16 ingest-slides | LLM高速化(勉強会) (SpeakerDeck) - [[@2026__SpeakerDeck__LLM高速化(勉強会)]] — [[SuperHotDog]]、SpeakerDeck(全50ページ)。自己回帰型 LLM 推論の高速化技術を、アルゴリズム層(KVCache・FlashAttention・Super Sequence + Continual Batching・PagedAttention・Speculative Decoding)、実装層(CUDA・Triton・CuTe)、アーキテクチャ層(GQA・MLA・Sliding Attention・Linear Attention)、量子化(Mixed Precision Accumulation・Ozaki Scheme)、プロファイラ(Nsight Compute/Systems)、CUDAGraph、vLLM の内部構造とコントリビュート方法まで一気通貫で扱う勉強会資料。Qwen2.5-0.5B-Instruct によるハンズオンで、素の Transformers 推論(5.97 tokens/sec)から vLLM 推論(94.84 tokens/sec)への 15.88 倍高速化を実演する。 - Sources (new): [[@2026__SpeakerDeck__LLM高速化(勉強会)]] - Entities (new): [[SuperHotDog]]. Entities (updated): [[vLLM]] - Concepts (new): [[PagedAttention]], [[Speculative Decoding]], [[CUDAGraph]]. Concepts (updated): [[KVキャッシュ管理]], [[FlashAttention]], [[Grouped-Query Attention]], [[Multi-Head Latent Attention]], [[線形注意]], [[スライディングウィンドウアテンション]], [[Prefill-Decode分離]], [[GPU最適化]], [[カーネルフュージョン]], [[混合精度訓練]] ### 2026-07-17 ingest-paper | A New Golden Age for Computer Architecture (CACM, 2019) - [[@2019__CACM__A New Golden Age for Computer Architecture]] — [[John L. Hennessy]]・[[David A. Patterson]]([[Stanford University]] / [[University of California, Berkeley]])、Communications of the ACM, Vol. 62 No. 2, 2019-02、DOI: 10.1145/3282307。2017年ACM Turing賞受賞記念講演(Turing Lecture)のCACM掲載版。IBM System/360からRISC-Vまでの命令セットアーキテクチャ(ISA)の歴史を、著者ら自身がRISC-I/MIPSの開発当事者であった立場から振り返る。Moore の法則と Dennard スケーリングの終焉により汎用プロセッサの性能向上率がCISC期22%/年→RISC期52%/年→マルチコア期23%/年→Amdahl期12%/年→予測3%/年へと段階的に低下してきたと定量的に分析した上で、ドメイン固有アーキテクチャ(DSA、Google TPU v1が汎用CPU比29倍高速・80倍超のエネルギー効率)・オープンISA(RISC-V)・アジャイルなハードウェア開発の3つを次の10年の性能向上の道筋として提示する。Meltdown/Spectreのようなセキュリティ脆弱性を、ISAの「正しい実装」の定義に性能効果が含まれてこなかったことに起因するとする視点も示す。 - Sources (new): [[@2019__CACM__A New Golden Age for Computer Architecture]] - Entities (new): [[John L. Hennessy]], [[RISC-V]]. Entities (updated): [[David A. Patterson]], [[Google]] - Concepts (new): [[ドメイン固有アーキテクチャ]], [[ムーアの法則とデナードスケーリングの終焉]]. Concepts (updated): [[VLIW]], [[メモリウォール]] ### 2026-07-18 ingest-paper | ContextPilot: Fast Long-Context Inference via Context Reuse (MLSys 2026) - [[@2026__MLSys2026__ContextPilot - Fast Long-Context Inference via Context Reuse]] — Yinsicheng Jiang・Yeqi Huang ほか([[University of Edinburgh]])、第9回 MLSys Conference 2026(Oral)。arXiv:2511.03475。完全一致 prefix caching(RadixCache・[[LMCache]])の低再利用率と、近似 KV マッチング([[CacheBlend]])の精度劣化(9〜11%)という既存手法のトレードオフを、KV 値でなく検索文書・メモリ等のコンテキストブロック単位で整列・重複排除・優先順位注釈を行う新設計で回避。MultihopRAG/NarrativeQA/QASPER/MT-RAG で1.5〜3倍のプリフィルスループット向上とほぼ精度維持(整列由来の劣化0.1〜3.3%)、DeepSeek-R1(671B)でキャッシュヒット率5%→60%、実運用エージェント(OpenClaw)でプリフィルレイテンシ−63.6%、エッジ(M3 MacBook Air)で2.41倍のレイテンシ削減を報告(source / paper / llm-inference / kv-cache / rag) - Sources (new): [[@2026__MLSys2026__ContextPilot - Fast Long-Context Inference via Context Reuse]] - Entities (new): [[ContextPilot]]. Entities (updated): [[University of Edinburgh]], [[LMCache]], [[CacheBlend]], [[Mem0]] - Concepts (updated): [[KVキャッシュ管理]] ### 2026-07-18 ingest-paper | The Too-Much-Talent Effect: Team Interdependence Determines When More Talent Is Too Much Versus Not Enough (Psychological Science, 2014) - [[@2014__PsychSci__The Too-Much-Talent Effect - Team Interdependence Determines When More Talent Is Too Much or Not Enough]] — Roderick I. Swaab・Michael Schaerer・Eric M. Anicich・Richard Ronay・Adam D. Galinsky([[INSEAD]] / [[Columbia University]] / [[Vrije Universiteit Amsterdam]])、Psychological Science, Vol. 25 No. 8, 2014-08、DOI: 10.1177/0956797614537280。サッカー(FIFA、2010/2014年W杯予選)・バスケットボール(NBA、10シーズン)・野球(MLB、10シーズン)のアーカイバルデータから、トップタレント比率とチーム成績の関係を検証。タスク相互依存性が高いサッカー・バスケでは人材比率50%超で成績が負に転じる逆U字型曲線が現れる一方、相互依存性が低い野球では単調増加のまま転じないことを実証。NBA の play-by-play データ(アシスト・FG%・ディフェンスリバウンド)を用いた媒介分析で、チーム内コーディネーションの低下が人材過多効果を媒介することも統計的に立証(Sobel Z=2.93, p<.01)。2つのサーベイ研究では、人々の素朴信念が実際とは異なり常に線形単調だと予測していることも確認(source / paper / organizational-behavior / team-performance / sports-analytics) - Sources (new): [[@2014__PsychSci__The Too-Much-Talent Effect - Team Interdependence Determines When More Talent Is Too Much or Not Enough]] - Entities (new): [[Roderick I. Swaab]], [[Michael Schaerer]], [[Eric M. Anicich]], [[Richard Ronay]], [[Adam D. Galinsky]], [[INSEAD]]. Entities (updated): [[Columbia University]], [[Vrije Universiteit Amsterdam]], [[Singapore Management University]] - Concepts (new): [[過剰人材効果]], [[タスク相互依存性]] ### 2026-07-20 ingest | LLM生成テキストの統計的検知: TF-IDF+SVMによるAIGC分類器の構築 (blog.lyc8503.net) - [[AI生成テキスト分類器]] — [[lyc8503]] の個人ブログ記事。パープレキシティベースの AI 生成テキスト検知(失敗)を経て、`TF-IDF` + `LinearSVC` による文単位分類器 [[AITextDetector]] を構築し、7つの LLM(gemini・qwen・GLM-5・kimi25・glm47・doubao・deepseek-v3.2)それぞれに対応する二値分類器の多数決方式で約85%の文単位精度を達成。訓練データに含まれない未知モデル(Claude Sonnet 4.6・GPT 5.2)にも約70%以上の検知率で汎化することを示し、Lofter 実データでの偽陽性率が0.04%(閾値60%)と低い一方、同プラットフォームのトレンド記事の32.22%がAIスコア50%超と判定された。翻訳往復や脱AI感プロンプトによる回避は軽微な効果しかないことも検証している。 - Sources (new): [[AI生成テキスト分類器]] - Entities (new): [[lyc8503]], [[AITextDetector]] - Concepts (new): [[AI生成テキスト検知]] ### 2026-07-20 ingest-paper | Adversarial dynamical systems characterize when data-driven learning succeeds or fails (Nature Communications, 2026) - [[@2026__NatCommun__Adversarial dynamical systems characterize when data-driven learning succeeds or fails]] — [[Matthew J. Colbrook]]([[University of Cambridge]])・[[Igor Mezić]]([[UC Santa Barbara]])・[[Alexei Stepanenko]]([[University of Cambridge]])、Nature Communications (2026) 17:5397、DOI:10.1038/s41467-026-74220-8。Koopman作用素のスペクトルをデータから学習する問題に対し、敵対的力学系(adversarial dynamical systems)を構成することで、測度保存性・連続性の法という2条件が揃わない限りいかなる単一極限アルゴリズムも(確率的なものを含め)50%を超える確率で収束を保証できないという不可能性を証明。条件が揃う場合は誤差保証つきの最適アルゴリズムを構成し、可解性複雑性指標(SCI)によって問題の複雑性を上界・下界の一致として完全に分類した。北極海氷濃度データ(1979-2021)に適用し、EDMDでは埋もれる「隠れた減衰モード」を誤差保証つきで検出、IceNet・SEAS5より高精度かつ大幅に低コストな長期予測を実現(paper / dynamical-systems / koopman-operator / computability / climate-science)。 - Sources (new): [[@2026__NatCommun__Adversarial dynamical systems characterize when data-driven learning succeeds or fails]] - Entities (new): [[Matthew J. Colbrook]], [[Igor Mezić]], [[Alexei Stepanenko]] - Entities (updated): [[UC Santa Barbara]], [[University of Cambridge]] - Concepts (new): [[Koopman作用素]], [[可解性複雑性指標]] ### 2026-07-20 ingest | Kimi K3: Open Frontier Intelligence (Moonshot AI Blog) - [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]] — [[Moonshot AI]] 公式ブログ(2026-07-17)。総パラメータ 2.8 兆・コンテキスト 100 万トークンの「世界初のオープンな 3T クラスモデル」[[Kimi K3]] を発表。[[Kimi Delta Attention]](KDA、[[Kimi Linear]] 由来の線形アテンションを 512-head MLA と組み合わせ)・[[Attention Residuals]](AttnRes、選択的表現検索)・[[Stable LatentMoE]](896 エキスパート中 16 活性化、スパーシティ 56)の 3 アーキテクチャ要素と、MXFP4/MXFP8 量子化認識訓練、Per-Head Muon・Quantile Balancing・SiTU の訓練手法を紹介。DeepSWE v1.1 で 67.3、コーディングベンチマークで Claude Fable 5・GPT-5.6 Sol 以外を上回るが「全体性能は最強のプロプライエタリモデルに未だ劣る」と自認。モデルウェイト・技術レポートは 2026-07-27 公開予定(kimi.com はサンドボックスのネットワーク許可リスト外のため WebFetch 経由の構造化要約に基づく、逐語引用ではない)(source / article / moe / llm / attention) - Sources (new): [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]] - Entities (new): [[Kimi K3]], [[Kimi Delta Attention]], [[Attention Residuals]], [[Stable LatentMoE]]. Entities (updated): [[Moonshot AI]], [[Kimi Linear]] - Concepts (updated): [[Mixture-of-Experts]] ### 2026-07-20 ingest-paper | FailSafe: High-performance Resilient Serving (arXiv 2025 / MLSys 2026 Oral) - [[@2025__arXiv__FailSafe - High-performance Resilient Serving]] — Ziyi Xu([[Shanghai Jiao Tong University]])・[[Zhiqiang Xie]]・[[Swapnil Gandhi]]・[[Christos Kozyrakis]]([[Stanford University]])、arXiv:2511.14116(2025-11-18、cs.DC、Under Review)。MLSys 2026 Oral(https://mlsys.org/virtual/2026/oral/3856)にて改題後 "RaidServe" として発表予定(OpenReview `5pl9fdbEkq`)。テンソル並列 LLM サービングにおける GPU 障害後の計算・メモリ不均衡と復旧レイテンシに対処する耐障害システム。Cyclic KVCache Placement・Hybrid Attention・Fine-Grained Load-Aware Routing による負荷均衡と、プロアクティブ KVCache ホストバックアップ・FFN 可換性を利用したオンデマンド重み復旧による183倍高速復旧を8×H100 DGX で実証。標準的障害対応比最大2倍のスループット。(paper / llm-serving / fault-tolerance / tensor-parallelism) - Sources (new): [[@2025__arXiv__FailSafe - High-performance Resilient Serving]] - Entities (new): [[Ziyi Xu]]. Entities (updated): [[Zhiqiang Xie]], [[Swapnil Gandhi]], [[Christos Kozyrakis]], [[Stanford University]], [[Shanghai Jiao Tong University]], [[ReCycle]] - Concepts (new): [[耐障害LLMサービング]]. Concepts (updated): [[テンソル並列]], [[KVキャッシュ管理]], [[耐障害LLM訓練]] ### 2026-07-20 ingest | In-House LLM Serving at Netflix (Netflix TechBlog) - [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]] — Liping Pengほか([[Netflix]] AI Platform)、2026-07。既存のJVMベース統合サービングシステムとModel Scoring Service(MSS)/[[Triton Inference Server]]の上でLLM推論を内製運用する事例。2026年夏に[[TensorRT-LLM]]から[[vLLM]]へpaved-pathエンジンを切り替え(判断基準は性能ベンチマークでなく運用適合性)、TritonのPython/vLLMバックエンド選択とバージョン整合の運用課題、OpenAI互換API追加(response_formatの欠落パッチ)、Red-Black/Versionedデプロイ戦略、vLLM V0→V1移行によるlogits processorのバッチレベル化(制約付きデコーディング)を報告。(source / article / llm-inference / serving / netflix / vllm / triton) - Sources (new): [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]] - Entities (new): [[Triton Inference Server]]. Entities (updated): [[Netflix]], [[vLLM]], [[TensorRT-LLM]], [[NVIDIA]] - Concepts (new): [[制約付きデコーディング]]. Concepts (updated): [[LLM推論]] ### 2026-07-20 ingest-paper | Niyama: Breaking the Silos of LLM Inference Serving (arXiv 2025 / ASPLOS 2026) - [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]] — [[Kanishk Goel]]・[[Jayashree Mohan]]・[[Nipun Kwatra]]・[[Ravi Shreyas Anupindi]]・[[Ramachandran Ramjee]]([[Microsoft Research]] India)、arXiv:2503.22562(2025-03-28、cs.LG/cs.AI/cs.DC)。改題後 "QoServe" として ASPLOS 2026 採録。既存 LLM サービングの interactive/batch サイロ分割を廃し、複数 QoS クラスを同一レプリカ上で co-schedule する QoS 駆動スケジューリングシステム Niyama を提示。動的チャンキング(デッドラインスラック活用)・ハイブリッド優先度付け(EDF/SRPF 線形補間)・積極的降格(過負荷時の選択的リクエスト降格)の 3 技術により、SOTA サイロ構成比で GPU 必要台数を最大 32% 削減し、極限負荷下で SLO 違反を一桁削減。[[Sarathi-Serve]] のスケジューラを拡張して実装。(paper / llm-serving / scheduling / qos) - Sources (new): [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]] - Entities (new): [[Kanishk Goel]], [[Jayashree Mohan]], [[Nipun Kwatra]], [[Ravi Shreyas Anupindi]], [[Ramachandran Ramjee]], [[Sarathi-Serve]]. Entities (updated): [[Microsoft Research]], [[vLLM]] - Concepts (updated): [[LLM推論]], [[Prefill-Decode分離]], [[LLMサービング管理]] ### 2026-07-20 ingest-paper | DuckDB: an Embeddable Analytical Database (SIGMOD '19) - [[@2019__SIGMOD__DuckDB - an Embeddable Analytical Database]] — Mark Raasveldt・Hannes Mühleisen([[CWI]])、SIGMOD '19 Demonstration track、4ページ、DOI 10.1145/3299869.3320212。SQLiteのような組み込みデータベースはOLTP向けに設計され分析(OLAP)性能が乏しいという課題を受け、パーサ(libpg_query)・コストベースオプティマイザ・ベクトル化解釈実行エンジン・HyPer由来のシリアライザブルMVCC・DataBlocksストレージから成る、ゼロから組み込み分析用途向けに設計されたデータベースDuckDBを提示。JIT不採用による移植性重視、SQLite・MonetDBLite・HyPerとの対決を想定したTPC-Hベンチマークデモンストレーション構成(teaser/drilldownシナリオ)を報告。(paper / database / olap / embedded-database) - Sources (new): [[@2019__SIGMOD__DuckDB - an Embeddable Analytical Database]] - Entities (new): [[Mark Raasveldt]], [[Hannes Mühleisen]], [[CWI]], [[DuckDB]], [[MonetDBLite]] - Concepts (updated): [[列指向OLAPデータベース]] ### 2026-07-20 ingest-slides | Welcome & Setup (Design and Implementation of DuckDB Internals, Lecture 1) - [[@2026__DuckDB__Welcome & Setup (DiDi Course, Lecture 1)]] — [[Torsten Grust]]([[Universität Tübingen]])による15週講義シリーズ「Design and Implementation of DuckDB Internals(DiDi)」第1回。講義全体の射程を概観し、[[DuckDB]]の「zero copy」プロセス内蔵設計・2019年6月初リリース・名称の由来(Hannes Mühleisenの飼っていたアヒルWilbur)を紹介する導入回。(slides / database / olap / embedded-database) - Sources (new): [[@2026__DuckDB__Welcome & Setup (DiDi Course, Lecture 1)]] - Entities (new): [[Torsten Grust]], [[DuckDB Labs]]. Entities (updated): [[DuckDB]], [[Hannes Mühleisen]], [[Mark Raasveldt]] - Concepts (updated): [[列指向OLAPデータベース]] ### 2026-07-20 ingest-slides | The Query Performance Spectrum (DiDi Course #2) - [[@2026__DiDi__The Query Performance Spectrum]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第2回。TPC-H `lineitem` 列合計クエリをawk・Python・C(getline/mmap/マルチスレッド)・SQL([[DuckDB]])の7実装で実測比較し、システムコール削減・SWARビット演算・マルチスレッド化による40倍以上の性能スペクトラムを示す。(slides / database / olap / performance-engineering) - Sources (new): [[@2026__DiDi__The Query Performance Spectrum]] - Entities (updated): [[Torsten Grust]], [[DuckDB]] - Concepts (updated): [[列指向OLAPデータベース]] ### 2026-07-20 ingest-slides | Managing Memory + Grouped Aggregation (DiDi Course #3) - [[@2026__DiDi__Managing Memory + Grouped Aggregation]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第3回。[[DuckDB]]のメモリ管理(ホストRAM80%既定利用、統合割り当て管理、German Strings)とハッシュベースグループ集約(`HASH_GROUP_BY`/`PERFECT_HASH_GROUP_BY`、2段階の外部集約)を扱う。(slides / database / olap / memory-management) - Sources (new): [[@2026__DiDi__Managing Memory + Grouped Aggregation]] - Entities (updated): [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]] - Concepts (new): [[アウトオブコア処理]], [[ハッシュベースグループ集約]] ### 2026-07-20 ingest-slides | Sorting Large Tables (DiDi Course #4) - [[@2026__DiDi__Sorting Large Tables]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第4回。[[DuckDB]]の二相マージソート戦略(キー正規化・Vergesort/Ska Sort/Pattern-defeating QuickSort・T-way merge)を解説する。(slides / database / olap / sorting) - Sources (new): [[@2026__DiDi__Sorting Large Tables]] - Entities (updated): [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]] - Concepts (new): [[外部マージソート]], [[キー正規化]] ### 2026-07-20 ingest-slides | The ART of Indexing (DiDi Course #5) - [[@2026__DiDi__The ART of Indexing]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第5回。[[DuckDB]]のZonemap(min-maxインデックス)とAdaptive Radix Tree(ART、span=8bit・4種類の内部ノード型・遅延展開/パス圧縮)の2種類のインデックスを解説する。(slides / database / olap / indexing) - Sources (new): [[@2026__DiDi__The ART of Indexing]] - Entities (updated): [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]] - Concepts (new): [[Adaptive Radix Tree]], [[Zonemap]]. Concepts (updated): [[B-Tree]] ### 2026-07-20 ingest-slides | Query Execution Plans and Pipelining (DiDi Course #6) - [[@2026__DiDi__Query Execution Plans and Pipelining]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第6回。[[DuckDB]]がSQLを実行プラン(演算子木)へ変換しパイプラインへ分解する仕組み(自明並列演算子とシンクのSink/Combine/Finalize、パイプライン依存関係・パイプライン駆動ループ)を扱う。(slides / database / olap / query-execution) - Sources (new): [[@2026__DiDi__Query Execution Plans and Pipelining]] - Entities (updated): [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]] - Concepts (new): [[クエリ実行プラン]], [[プッシュ型パイプライン実行]]. Concepts (updated): [[並列データベース]] ### 2026-07-20 ingest-slides | Vectorized Query Execution (DiDi Course #7) - [[@2026__DiDi__Vectorized Query Execution]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第7回。[[DuckDB]]のベクトル物理表現(FLAT/CONSTANT/DICTIONARY/SEQUENCE)、unified representation+テンプレートによるコード生成、DuckDB 1.4実ソースの比較式評価トレース、コンパイラのSIMD化・分岐予測ミスペナルティを扱う。(slides / database / olap / simd / vectorization) - Sources (new): [[@2026__DiDi__Vectorized Query Execution]] - Entities (updated): [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]] - Concepts (updated): [[SIMDベクトル処理]], [[分岐予測]], [[パイプライン処理]] ### 2026-07-20 ingest-slides | Query Rewriting and Optimization (DiDi Course #8) - [[@2026__DiDi__Query Rewriting and Optimization]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第8回。[[DuckDB]]のクエリオプティマイザ(30以上の最適化パス、結合順序最適化のDPhyp動的計画法、DEPENDENT_JOINの系統的書き換えによるクエリ非相関化)をTPC-Hクエリで解説する。(slides / database / olap / query-optimization) - Sources (new): [[@2026__DiDi__Query Rewriting and Optimization]] - Entities (updated): [[Torsten Grust]], [[Universität Tübingen]], [[DuckDB]] - Concepts (new): [[クエリオプティマイザ]], [[結合順序最適化]], [[クエリ非相関化]] ### 2026-07-20 ingest-slides | 30分でわかるデータ指向アプリケーションデザイン (Data Engineering Study #18) - [[@2023__DataEngineeringStudy__30分でわかるデータ指向アプリケーションデザイン]] — 『データ指向アプリケーションデザイン』監訳者[[Taro L. Saito]]による講演。原著出版から5年間の発展を、データ形式・インデックス構造・分散トランザクション・[[導出データ]]・SQLの役割拡大・SLOという原著の枠組みに沿って再構成する。(slides / database / distributed-systems) - Sources (new): [[@2023__DataEngineeringStudy__30分でわかるデータ指向アプリケーションデザイン]] - Entities (new): [[Taro L. Saito]]. Entities (updated): [[Amazon Aurora (Database)]], [[DuckDB]] - Concepts (new): [[導出データ]]. Concepts (updated): [[分散トランザクション]] ### 2026-07-20 ingest-paper | Aurora DSQL: Scalable, Multi-Region OLTP - [[@2026__arXiv__Aurora DSQL - Scalable, Multi-Region OLTP]] — [[Marc Brooker]]ほか([[Amazon Web Services]])。compute・storage・トランザクション調整を独立サービスに分離した disaggregated アーキテクチャで、MVCC による座標不要読み取りと OCC による書き込みを組み合わせ、コミット時のみクロスリージョン座標するマルチリージョン分散 SQL データベース。p99 レイテンシ実測(2リージョンで SELECT 約2ms・COMMIT 約30ms)と Journal 間イレイジャーコーディングによるレイテンシ・可用性最適化を報告する。(paper / database / distributed) - Sources (new): [[@2026__arXiv__Aurora DSQL - Scalable, Multi-Region OLTP]] - Entities (new): [[Aurora DSQL]]. Entities (updated): [[Marc Brooker]], [[Amazon Aurora (Database)]] - Concepts (updated): [[分散SQLデータベース]], [[地理分散SQLデータベース]], [[分散トランザクション]], [[分散コンセンサス回避]], [[クォーラムベースレプリケーション]] ### 2026-07-20 ingest-paper | Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3 - [[@2021__SOSP__Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3]] — [[James Bornholt]]ほか([[Amazon Web Services]] / ETH Zurich / University of Washington)。Amazon S3 の新しいキーバリューストレージノード [[ShardStore]] を、実装と同じ言語(Rust)で書く参照モデル・property-based testing・stateless model checking(Loom/Shuttle)で検証する軽量形式手法アプローチ。本番投入前に16件の不具合(機能的正しさ5・クラッシュ整合性5・並行性6)を検出し、検証アーティファクトの保守を段階的に非専門エンジニアへ引き継いだ。(paper / storage / formal-methods) - Sources (new): [[@2021__SOSP__Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3]] - Entities (new): [[ShardStore]], [[James Bornholt]]. Entities (updated): [[Amazon Web Services]] ### 2026-07-20 ingest-paper | The Snowflake Elastic Data Warehouse - [[@2016__SIGMOD__The Snowflake Elastic Data Warehouse]] — Benoit Dageville・Thierry Cruanes・Marcin Zukowski ほか([[Snowflake Computing]])。ストレージ(S3)とコンピュートを疎結合サービスへ分離した「マルチクラスタ・シェアードデータ・アーキテクチャ」を導入。テーブルファイルの不変性を核にSnapshot Isolation・時間旅行・クローン・オンラインアップグレードを同一設計原理から導出し、VARIANT型による半構造化データのELT処理を約10%オーバーヘッドで実現した産業論文(SIGMOD 2016)。(paper / database / distributed / cloud) - Sources (new): [[@2016__SIGMOD__The Snowflake Elastic Data Warehouse]] - Entities (new): [[Snowflake Computing]], [[Benoit Dageville]], [[Thierry Cruanes]], [[Marcin Zukowski]]. Entities (updated): [[Amazon Web Services]] - Concepts (updated): [[シェアードナッシング]], [[並列データベース]], [[データパーティショニング]], [[列指向OLAPデータベース]] - Concepts (new): [[軽量形式手法]]. Concepts (updated): [[LSMツリー]] ### 2026-07-20 ingest-paper | Dremel: Interactive Analysis of Web-Scale Datasets - [[@2010__VLDB__Dremel - Interactive Analysis of Web-Scale Datasets]] — Sergey Melnikほか([[Google]], Inc.)。ネストデータに対する列指向ストレージ(repetition level / definition level)とウェブ検索由来の多段サービス木を組み合わせ、兆行規模テーブルへの集計クエリを数秒で実行する対話的クエリシステム。MapReduceを置き換えず補完する設計思想を明示し、3000ノード規模の実験でMR-on-recordsに対し87TBに対し約0.5TBしか読まず実行時間を2桁短縮する(VLDB 2010)。(paper / database / olap / distributed) - Sources (new): [[@2010__VLDB__Dremel - Interactive Analysis of Web-Scale Datasets]] - Entities (new): [[Sergey Melnik]], [[Andrey Gubarev]], [[Jing Jing Long]], [[Geoffrey Romer]], [[Shiva Shivakumar]], [[Matt Tolton]], [[Theo Vassilakis]], [[MapReduce]], [[Protocol Buffers]]. Entities (updated): [[Google]] - Concepts (new): [[ネスト型カラムナストレージ]]. Concepts (updated): [[列指向OLAPデータベース]], [[並列データベース]] ### 2026-07-21 ingest-paper | Mach: A Pluggable Metrics Storage Engine for the Age of Observability - [[@2022__CIDR__Mach - A Pluggable Metrics Storage Engine for the Age of Observability]] — [[Franco Solleza]]・[[Andrew Crotty]]・[[Suman Karumuri]]・[[Nesime Tatbul]]・[[Stan Zdonik]]([[Brown University]]・[[Carnegie Mellon University]]・[[Slack Technologies]]・Intel Labs・MIT)。複数の独立ライタースレッドが疎結合(mutex 協調なし)に振る舞うメトリクス専用ストレージエンジン。単一ノード最大480M f64/秒の書き込み(既存手法比約10倍)・100万データソースまでのスケーリング・既存手法比最大3倍の読み取りスループットを予備実験で示した(CIDR 2022)。(paper / database / time-series / observability) - Sources (new): [[@2022__CIDR__Mach - A Pluggable Metrics Storage Engine for the Age of Observability]] - Entities (new): [[Andrew Crotty]], [[Mach]]. Entities (updated): [[Franco Solleza]], [[Nesime Tatbul]], [[Stan Zdonik]], [[Suman Karumuri]], [[Brown University]], [[Carnegie Mellon University]], [[Slack Technologies]] - Concepts (updated): [[時系列データベース]], [[専用データベースシステム]] ### 2026-07-21 ingest | Tales from the Lunar Module Guidance Computer - [[@2004__AAS__Tales from the Lunar Module Guidance Computer]] — [[Don Eyles]]([[MIT Instrumentation Laboratory]])。Apollo 11 の 1201/1202 プログラムアラーム(ランデブーレーダーのICD記載漏れによるCPU時間喪失)とスロットル振動「キャッスレーション」(タイムラグ補償の誤り)を、開発当事者が一次資料に基づき解説する回顧録(AAS 04-064, 2004)。Apollo Guidance Computer の優先度駆動プリエンプティブ Executive/Waitlist・リスタート保護の設計思想を含む。(article / fault-tolerance / real-time-systems / postmortem / apollo) - Sources (new): [[@2004__AAS__Tales from the Lunar Module Guidance Computer]] - Entities (new): [[Don Eyles]], [[Allan Klumpp]], [[Hal Laning]], [[Apollo Guidance Computer]], [[MIT Instrumentation Laboratory]]. Entities (updated): [[Margaret Hamilton]] - Concepts (new): [[優先度駆動リアルタイム実行系]], [[リスタート保護]], [[インターフェース仕様の齟齬による障害]], [[制御ループの安定性とタイムラグ補償]]. Concepts (updated): [[べき等性]], [[チェックポイント]], [[根本原因分析]], [[ポストモーテム]] ### 2026-07-21 ingest-paper | Don't Predict, Prioritize: Rethinking GPU Reliability Assessment - [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]] — Difeng Ma・[[Changhua Pei]]ほか(Computer Network Information Center, [[Chinese Academy of Sciences]] / [[University of Chinese Academy of Sciences]] / [[StepFun]] / [[Tsinghua University]])。GPU の Double Bit Error・GPU Lost 障害が時系列テレメトリからは本質的に予測不能であることを 5 モデル横断で実証し(Kendall相関・SNR・分布比較の3分析)、ホスト単位のリスクランキングへ再定式化する Learning-to-Rank モデル HeaRank を提案。本番クラスタで AUC 0.834、上位5%リスクノードで将来障害の64%を捕捉(既存Health Scoreシステムは21%)し、6ヶ月の本番展開で月あたり約5万ドルのGPU時間節約を試算した(KDD '26 V.2)。(paper / aiops / hpc / gpu-reliability) - Sources (new): [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]] - Entities (new): [[Difeng Ma]], [[Yuanwei Lu]], [[Quan Zhou]], [[Daxin Jiang]], [[Jingjing Li]]. Entities (updated): [[Changhua Pei]], [[Gaogang Xie]], [[Zexin Wang]], [[Yibo Zhu]], [[Dan Pei]], [[Chinese Academy of Sciences]], [[University of Chinese Academy of Sciences]], [[Tsinghua University]], [[StepFun]] - Concepts (updated): [[障害予測]], [[GPUレジリエンス]] ### 2026-07-21 ingest-slides | ネットワーク監視の自動化はどこまでできるのか? -Apache Airflowによるアラート対応基盤- - [[@2026__JANOG58__ネットワーク監視の自動化はどこまでできるのか - Apache Airflowによるアラート対応基盤]] — [[上岡 輔乃]]([[LINE株式会社|LINEヤフー株式会社]])。22,000台以上のデータセンターネットワークにおけるアラート一次対応の人手ボトルネックに対し、[[Apache Airflow]] を共通基盤とした NW 運用ワークフロー自動化基盤 [[oyakata]] を内製、複数 NW チームへの本番導入でアラート一次対応の90%以上を自動化した事例(JANOG58, 2026-07-15)。 - Sources (new): [[@2026__JANOG58__ネットワーク監視の自動化はどこまでできるのか - Apache Airflowによるアラート対応基盤]] - Entities (new): [[上岡 輔乃]], [[Apache Airflow]], [[oyakata]], [[NetBox]]. Entities (updated): [[LINE株式会社]] - Concepts (updated): [[ワークフロー自動化]], [[アラート集約]], [[ネットワーク監視]] ### 2026-07-21 ingest-slides | AIインフラ時代のデータセンター内光配線の実践知 ~高密度実装の課題と解決策~ - [[@2026__JANOG58__AIインフラ時代のデータセンター内光配線の実践知]] — [[井上喬視]]([[SAKURA internet Inc]])・[[菊地秀夫]]([[TWCCパートナーズ合同会社]]代表)。さくらインターネットのコンテナ型DCを実例に、光ケーブル細径多心化・MPOコネクタ規格・FRO→LRO→LPO→CPO電力方式・光ファイバーシャフル配線によるGPUクラスタ4倍拡張を報告する(JANOG58, 2026、共催: SAKURA Internet・[[エクストリーク株式会社]])。 - Sources (new): [[@2026__JANOG58__AIインフラ時代のデータセンター内光配線の実践知]] - Entities (new): [[井上喬視]], [[菊地秀夫]], [[株式会社フジクラ]], [[TWCCパートナーズ合同会社]], [[エクストリーク株式会社]] - Concepts (new): [[データセンター内光配線設計]], [[光トランシーバー電力方式]], [[光ファイバーシャフル配線]]. Concepts (updated): [[MRC]], [[SRv6]], [[マルチプレーンClosトポロジ]] ### 2026-07-21 ingest-slides | Rack-Scale GPUサーバーのNW設計と運用までの苦悩 - [[@2026__JANOG58__Rack-Scale GPUサーバーのNW設計と運用までの苦悩]] — [[内田泰広]]・[[張朝程]]([[ソフトバンク株式会社]])。NVIDIA GB200 NVL72 を用いた Rack-Scale GPU サーバー基盤の Compute/Converged/OOB Fabric 分離設計、Scalable Unit(SU)単位のサービス提供トレードオフ(Rack/Tray/GPU単位)、ケーブリング自動化・Optics の BER/FEC トラブルシュート・液冷トレイ交換運用までの実務知見を報告する(JANOG58, 2026)。 - Sources (new): [[@2026__JANOG58__Rack-Scale GPUサーバーのNW設計と運用までの苦悩]] - Entities (new): [[ソフトバンク株式会社]], [[内田泰広]], [[張朝程]] - Concepts (updated): [[AIデータセンタートポロジ]], [[GPUクラスタ運用]] ### 2026-07-22 ingest-paper | DAG-FM: A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms - [[@2026__arXiv__DAG-FM - A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms]] — Yikang Chen・Zhengkang Guan・Haoyuan Qian・Yi Yang([[Zhejiang University]])・[[Peng Cui]]([[Tsinghua University]])・[[Kun Kuang]](責任著者、[[Zhejiang University]])。事前分布空間を4つの識別可能なFCM族(LiNGAM/ANM/HNM/PNL)に制限した理論的設計条件と、葉ノード予測→親ノード予測の2段階自己回帰分解+Mixture-of-Leaf-Expertsを組み合わせ、DAG識別可能性の理論的保証を保ったままスケーラブルなアモータイズド因果発見を実現する基盤モデル(arXiv投稿 2026-07-13)。 - Sources (new): [[@2026__arXiv__DAG-FM - A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms]] - Entities (new): [[Kun Kuang]], [[Peng Cui]]. Entities (updated): [[Zhejiang University]], [[Tsinghua University]] - Concepts (new): [[アモータイズド因果発見]]. Concepts (updated): [[因果発見]] ### 2026-07-22 ingest-paper | How Far Can Root Cause Analysis Go on Real-World Telemetry Data? - [[@2026__arXiv__How Far Can Root Cause Analysis Go on Real-World Telemetry Data?]] — [[Athira Gopal]]・[[Ashwanth Krishnan]]([[QPIAI]])。OpenRCAベンチマーク上で古典的因果発見手法(全てAccuracy 0)と既存LLMマルチエージェント系([[GALA]]・[[RCLAgent]])が確実に失敗する中、reverse reasoning agentによる誤り分析でRCA失敗の大半が証拠不足ではなく推論失敗(Reasoning Gap)に起因することを定量的に示した論文(arXiv投稿 2026-07-15)。 - Sources (new): [[@2026__arXiv__How Far Can Root Cause Analysis Go on Real-World Telemetry Data?]] - Entities (new): [[QPIAI]], [[Athira Gopal]], [[Ashwanth Krishnan]], [[RCLAgent]]. Entities (updated): [[OpenRCA]], [[GALA]] - Concepts (updated): [[LLMによる根本原因分析]], [[RCA評価設計]], [[因果推論ベースRCA]] ### 2026-07-22 ingest-paper | STsCache: An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage - [[@2025__VLDB__STsCache - An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage]] — Tao Kong・[[Hui Li]](責任著者)・Yuxuan Zhao・Liping Li・Xiyue Gao・Qilong Wu・Jiangtao Cui([[Xidian University]])。時系列クエリのセマンティクスを形式的に定義しグラフ+スキップリストのセマンティックインデックスへ落とし込むことで、append-only性を活かしキャッシュ一貫性を不要化しつつTSDB本体を変更しない前段セマンティックキャッシュ層を提案し、InfluxDB/TimescaleDB比でスループット4.8-10.8倍を達成した(PVLDB Vol.18 No.9, 2025)。 - Sources (new): [[@2025__VLDB__STsCache - An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage]] - Entities (new): [[Hui Li]], [[Xidian University]], [[STsCache]], [[TSCache]], [[BSCache]] - Concepts (new): [[セマンティックキャッシュ]]. Concepts (updated): [[時系列データベース]], [[分散キャッシュ]] ### 2026-07-22 ingest-paper | cache_ext: Customizing and Tracing the Page Cache with eBPF - [[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]] — Tal Zussman・Ioannis Zarkadas(共同筆頭)・Jeremy Carin・Andrew Cheng・Hubertus Franke・Jonas Pfefferle([[IBM Research]])・[[Asaf Cidon]](責任著者)([[Columbia University]] × IBM Research)。Linuxページキャッシュの退避・受け入れ方針をeBPFの`struct_ops`/kfuncでカーネル内実装に置き換え、ユーザ空間オフロード方式が招く最大20.6%のスループット低下を回避しつつ最大70%のスループット向上・58%のP99テールレイテンシ削減を達成した(ACM TOCS, 2026、SOSP 2025 Chairs推薦によるTOCS拡張出版)。 - Sources (new): [[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]] - Entities (new): [[cache_ext]], [[cachestream]], [[sched_ext]], [[Tal Zussman]], [[Ioannis Zarkadas]], [[Jeremy Carin]], [[Andrew Cheng]], [[Hubertus Franke]], [[Jonas Pfefferle]], [[Asaf Cidon]]. Entities (updated): [[Columbia University]], [[IBM Research]], [[RocksDB]] - Concepts (new): [[ページキャッシュカスタマイズ]]. Concepts (updated): [[eBPF]], [[Linuxカーネルインタフェース]] ### 2026-07-22 ingest-paper | LLM Agents for AIOps in Kubernetes: An Industrial Experience Report with Red Hat OpenShift - [[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]] — [[Arthur Vitui]]([[Red Hat]])・[[Tse-Hsun Chen]]([[Concordia University]])。同一OpenShift環境・同一ツール・同一プロンプトで10種の商用LLMを統制比較し、単発ツール精度と多段ツール連鎖の精度が独立に劣化しうること、低レイテンシ・低トークン消費が「早期終了」の兆候にすぎない例を実証した(ESEC/FSE 2026 Companion、FSE Companion '26)。 - Sources (new): [[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]] - Entities (new): [[Arthur Vitui]], [[Red Hat]], [[Red Hat OpenShift]], [[LangChain]], [[LangGraph]], [[MLASP]]. Entities (updated): [[Tse-Hsun Chen]], [[Concordia University]], [[Prometheus]], [[Kubernetes]] - Concepts (updated): [[AIOps]], [[agentic SRE]], [[ReAct]], [[LLM評価]], [[エージェントメモリ]] ### 2026-07-22 ingest-paper | TSGen: Automated Troubleshooting Guide Generation - [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]] — Yi Xiao・[[Hongyu Zhang]]([[Chongqing University]])・Daniel Genkin・[[Chaoyun Zhang]]・[[Rujia Wang]]・[[Chetan Bansal]]・Bhala Ranganathan・[[Saravan Rajmohan]]・[[Minghua Ma]](責任著者、[[Microsoft]])。過去インシデントデータのマイニングから「TSGが存在しない/古い」状態から構造化TSGをゼロ生成する、TSG実行自動化研究(FLASH・LLexus・StepFly)を補完する一段上流の課題を解いた研究(FSE Companion '26)。 - Sources (new): [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]] - Entities (new): [[Yi Xiao]], [[Daniel Genkin]], [[Bhala Ranganathan]], [[TSGen]]. Entities (updated): [[Hongyu Zhang]], [[Chaoyun Zhang]], [[Rujia Wang]], [[Chetan Bansal]], [[Saravan Rajmohan]], [[Minghua Ma]], [[Chongqing University]], [[Microsoft]] - Concepts (updated): [[TSG自動化]] ### 2026-07-22 ingest-paper | An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure - [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]] — Yuhan Yao・Yuxuan Jiang(共同筆頭)・[[Minghua Ma]]・Madhura Vaidya・Jieren Deng・[[Chetan Bansal]]・[[Ze Li]]・[[Murali Chintalapati]]([[Microsoft]])・[[Yigong Hu]](Boston University)。単一分類器型でなくローカルなaccept/reject判断とGlobal Routing Tableによる履歴駆動のスティグマジックなチーム間ルーティングを分離した分散型インシデントトリアージ Comfey を提案し、Azure本番22か月間の運用で先行システムCOMET比+7.55%の精度・4.38倍のトリアージ高速化を達成した(FSE Companion '26)。 - Sources (new): [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]] - Entities (new): [[Comfey]], [[Yuhan Yao]], [[Madhura Vaidya]], [[Jieren Deng]]. Entities (updated): [[Yuxuan Jiang]], [[Yigong Hu]], [[Chetan Bansal]], [[Minghua Ma]], [[Ze Li]], [[Murali Chintalapati]], [[Microsoft]], [[Microsoft Azure]] - Concepts (updated): [[インシデントトリアージ]], [[マルチエージェント協調]] ### 2026-07-22 ingest-paper (batch) | Burgess LISA98/LISA2000/arXiv・Begnum 2005・Measuring System Normality Mark Burgess の初期システム管理理論5論文(LISA'98 Computer Immunology、LISA2000 Theoretical System Administration とその arXiv プレプリント cs/0003075、Begnum & Burgess 2005 Machine Learning誌、Burgess+ 2002 ACM TOCS)を並行 subagent 5体で ingest。cfengine の実運用経験から生まれた「収束」「危険モデル」「ゲーム理論的定式化」「統計力学的正常性」という4系統の理論が、後年(2014年タイムスケール理論、2026年 Barteneva ゲーム理論的SRE講演)に展開される着想の1998〜2005年時点の原型であることが判明した。 - Sources (new): [[@1998__LISA__Computer Immunology]], [[@2000__LISA__Theoretical System Administration]], [[@2000__arXiv__On the theory of system administration]], [[@2005__Machine Learning__Principle Components and Importance Ranking of Distributed Anomalies]], [[@2002__TOCS__Measuring System Normality]] - Entities (new): [[Kyrre Begnum]], [[Harek Haugerud]], [[Sigmund Straumsnes]], [[Trond Reitan]], [[Norwegian Water Resources and Energy Directorate]]. Entities (updated): [[Mark Burgess]], [[Oslo University College]], [[cfengine]] - Concepts (new): [[コンピュータ免疫学]], [[収束型システム管理]], [[システムの正常状態]]. Concepts (updated): [[ゲーム理論とSRE]], [[SREの工学化]], [[タイムスケール分離と監視粒度]], [[PageRank]], [[メトリクス削減]], [[異常検知]] - Note: LISA2000版とarXiv版(cs/0003075)は核心の数理装置(理想状態・H(d)公式・ペイオフ行列)を共有する近縁文書だが、タイトル・重心が異なるため別ページとして残し、arXiv側に両者の関係を明記した。 ### 2026-07-22 ingest-paper | Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives (arXiv 2607.16100) - [[@2026__arXiv__Every Microsecond Matters Achieving Near Speed-of-Light Latency in GPU Collectives]] — Siyuan Shen・Torsten Hoefler([[ETH Zürich]])・Anton Korzh・John Bachan・Sylvain Jeaugey ほか([[NVIDIA]])。GB200 NVL72 の scale-up ネットワークで AllReduce の Speed-of-Light 理論下限(1.404 µs)を実測導出し、既存実装が依存する memory barrier(1 回あたり 1 µs 超)を LL・sentinel 同期・双方向通信+double buffering・two-shot LL128 atomic の 4 技術で完全排除する低レイテンシカーネルを NCCL のデバイス側 API 上に実装。SoL 比 7% まで到達し、vLLM 推論(Llama-3.1-70B・DeepSeek-V3 等)で inter-token latency を最大 13% 削減、cuSOLVERMp でも GFLOPS/GPU を最大 7.0% 改善した。 - Sources (new): [[@2026__arXiv__Every Microsecond Matters Achieving Near Speed-of-Light Latency in GPU Collectives]] - Entities (updated): [[Siyuan Shen]], [[Torsten Hoefler]], [[NCCL]] - Concepts (updated): [[集合通信]], [[LLM推論]] ### 2026-07-23 ingest | SWE-1.7: Frontier Intelligence at a Fraction of the Cost (Cognition Blog) - [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]] — [[Cognition]] 公式ブログ(2026-07-08)。[[Kimi K2.7]] ベースの継続 RL 訓練モデル [[SWE-1.7]] を発表。top-p サンプリング+サンプリング分布リプレイによる[[エントロピー崩壊]]対策、3 大陸 4 データセンターにまたがるマルチクラスタ耐障害 RL 訓練([[NVIDIA Dynamo]]・[[Fireworks AI]] 活用)、検証器品質・難易度較正・チーティング防止のデータ品質パイプライン、[[自己圧縮]]による長期タスク対応(訓練 rollout 最大 6 時間)という 4 本柱を解説。[[FrontierCode]] 1.1 Main 42.3%・[[Terminal-Bench]] 2.1 81.5%・[[SWE-Bench Multilingual]] 77.8% を達成し、既に広範な RL 事後学習を経たベースモデルからの大幅な追加性能向上を「post-training ceiling」通念への反証として位置づけた。[[Devin]] 上で [[Cerebras]] 経由・1000 TPS で提供。 - Sources (new): [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]] - Entities (new): [[Cognition]], [[Devin]], [[SWE-1.7]], [[Kimi K2.7]], [[FrontierCode]], [[Terminal-Bench]], [[SWE-Bench Multilingual]], [[Kevin-32B]]. Entities (updated): [[NVIDIA Dynamo]], [[Fireworks AI]], [[Cerebras]] - Concepts (new): [[自己圧縮]], [[エントロピー崩壊]]. Concepts (updated): [[耐障害LLM訓練]], [[報酬ハッキング]], [[強化学習スケーリング]] ### 2026-07-23 ingest | Frontier RL Is Cheaper Than You Think (Fireworks AI Blog) - [[@2026__Fireworks AI__Frontier RL Is Cheaper Than You Think]] — [[Fireworks AI]] 公式ブログ(2026-03-23)。「フロンティア RL には co-located メガクラスタが要る」という通念に対し、bf16 チェックポイント間で重みの 98% 超がビット等価という実測(1TB チェックポイント平均差分 20.3 GiB・50 ステップ窓での転送量削減 約94%)を根拠に反証する。trainer とロールアウトフリートを地理的に分離しつつ差分圧縮のみを配信する設計は、[[Cognition]] の [[SWE-1.7]]・[[Cursor]] Composer 2 が採用する圧縮重み差分配信パターンを一般化する一次資料として位置づけられる。フルマネージド・Tinker 互換 SDK・Bring-your-own-trainer の 3 種の RL 提供形態も紹介する。 - Sources (new): [[@2026__Fireworks AI__Frontier RL Is Cheaper Than You Think]] - Entities (new): [[AReaL]], [[Federico Cassano]]. Entities (updated): [[Fireworks AI]], [[Cursor]] - Concepts (new): [[RL重み差分配信]]. Concepts (updated): [[耐障害LLM訓練]] ### 2026-07-23 ingest-paper | DAPO: An Open-Source LLM Reinforcement Learning System at Scale (arXiv 2503.14476) - [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]] — [[Qiying Yu]] ほか([[ByteDance Seed]] / [[Institute for AI Industry Research (AIR), Tsinghua University]] / [[The University of Hong Kong]])。naive [[GRPO]] を [[Qwen2.5-32B]] ベースモデルに適用したところ AIME 2024 で avg@32=30 点(DeepSeek-R1 の 47 点に大幅劣後)しか出ず、エントロピー崩壊・報酬ノイズ・勾配消失という 3 障害を特定。Clip-Higher(上下非対称クリッピング ε_low=0.2/ε_high=0.28)・Dynamic Sampling(accuracy=0/1 プロンプトの除外)・Token-Level Policy Gradient Loss・Overlong Reward Shaping(ソフト長さ罰則)の 4 技術を逐次追加し 50 点まで改善、DeepSeek-R1-Zero-Qwen-32B(47 点)を訓練ステップ数半分で上回った。アルゴリズム・[[VeRL]] 基盤の訓練コード・DAPO-Math-17K データセットを完全にオープンソース化した。 - Sources (new): [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]] - Entities (new): [[Qiying Yu]], [[Institute for AI Industry Research (AIR), Tsinghua University]], [[Qwen2.5-32B]]. Entities (updated): [[GRPO]], [[VeRL]], [[ByteDance Seed]], [[The University of Hong Kong]], [[DeepSeek-R1-Zero]] - Concepts (updated): [[エントロピー崩壊]], [[検証可能報酬による強化学習]], [[強化学習スケーリング]] ### 2026-07-23 ingest-video | AWS Distinguished Eng: Learning From 3000 Incidents And How Engineering Is Changing (YouTube, Marc Brooker) - [[@2026__YouTube__AWS Distinguished Eng - Learning From 3000 Incidents And How Engineering Is Changing (Marc Brooker)]] — Ryan Peterman のポッドキャストでの [[Marc Brooker]]([[Amazon Web Services]])インタビュー。3,000件超のクラウドシステムポストモーテムを読んだ経験から「なぜ」を複数レベルで掘り下げるポストモーテム分析法、AWS 週次 COE レビューミーティングという組織学習機構、キャッシュの「フル/空」二峰性が[[メタ安定障害]]の温床になるという直接的説明と [[Aurora DSQL]] ストレージ層を「完全なキャッシュ」として設計しこの二峰性自体を排除した経緯、AI がソフトウェアエンジニアリングに与える3層の影響(趣味・古いやり方の経済圏・エージェント的開発の主流)を語る。動画本体は HTTP 403 で取得不可のため YouTube 自動生成英語字幕から transcript を作成、代表フレームなし。 - Sources (new): [[@2026__YouTube__AWS Distinguished Eng - Learning From 3000 Incidents And How Engineering Is Changing (Marc Brooker)]] - Entities (new): [[Ryan Peterman]]. Entities (updated): [[Marc Brooker]], [[Aurora DSQL]] - Concepts (updated): [[メタ安定障害]], [[ポストモーテム]] ### 2026-07-25 ingest-paper | Agentic Failure Management of Cloud Systems (UIUC PhD Thesis, Yinfang Chen) - [[Agentic Failure Management of Cloud Systems]] — [[Yinfang Chen]] の博士論文(指導教員 [[Tianyin Xu]]、[[University of Illinois Urbana-Champaign]]、2026年)。クラウドインシデントライフサイクル全体(予防・診断・緩和・評価)を横断する4系統の研究を統合する。新規に第2章で [[Rainmaker]](HTTP層でREST API呼び出しに介入するpush-buttonフォールトインジェクションツール。no error handling / throwing unrelated exceptions / silent semantic violations / state divergence の4パターンのバグtaxonomyを提示し、11の.NETアプリで新規バグ73件・確認55件・修正51件・誤検知率1.96%を検出)を発表。第3–5章は既刊の [[RCACopilot]](EuroSys'24)・[[Stratus]](NeurIPS'25)・[[AIOpsLab]](MLSys'25)と同一内容のため既存 wiki source ページへ委譲し、本ページは各章の位置づけとDiscussion/Future Workの統合フレーミング(自律緩和の説明責任・監査可能性・自動化バイアス・相関故障という社会的含意、SREの役割が応答者から仕様策定者へ移行するというhuman dimension論)のみを深掘りする。 - Sources (new): [[Agentic Failure Management of Cloud Systems]] - Entities (new): [[Rainmaker]]. Entities (updated): [[Yinfang Chen]], [[Tianyin Xu]] - Concepts (updated): [[障害注入]], [[プロアクティブ障害管理]] ### 2026-07-25 ingest-paper | Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker (NSDI 2023) - [[@2023__NSDI__Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker]] — [[Yinfang Chen]]・[[Xudong Sun]]([[University of Illinois Urbana-Champaign]])、[[Suman Nath]]([[Microsoft Research]])、[[Ze Yang]]・[[Tianyin Xu]]([[University of Illinois Urbana-Champaign]])。[[Rainmaker]] の一次論文(NSDI'23)。クラウドサービス API・SDK のエラー通知の不整合(§2)に起因する4パターンのバグ taxonomy(no error handling / throwing unrelated exceptions / silent semantic violations / state divergence)を提示し、HTTP プロキシで REST 呼び出しに push-button フォールトインジェクションを行うツールを開発。11 の .NET アプリケーションで新規バグ73件(確認55件・修正51件、誤検知率1.96%)を発見、call-site 単位のカバレッジ指標(C1–C4)と inheritable thread-local storage (ITLS) により exhaustive baseline 比64.47%のテスト実行回数削減を達成。既存 wiki の [[Agentic Failure Management of Cloud Systems]] 第2章はこの一次論文の再録である。 - Sources (new): [[@2023__NSDI__Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker]] - Entities (new): [[Xudong Sun]], [[Ze Yang]]. Entities (updated): [[Rainmaker]], [[Yinfang Chen]], [[Tianyin Xu]], [[Suman Nath]] - Concepts (updated): [[障害注入]] ### 2026-07-27 ingest | Everyone Should Know SIMD (mitchellh.com) - [[@2026__mitchellh.com__Everyone Should Know SIMD]] — [[Mitchell Hashimoto]] のブログ記事。SIMD コードを「定数のブロードキャスト→ベクトル幅ループ→並列演算→リダクション→スカラー端数処理」の5段階の共通形として定式化し、自身の [[Zig]] 製ターミナルエミュレータ [[Ghostty]] のコードポイント探索実装(ARM NEON最大4倍・AVX2最大8倍/実測約5倍・AVX-512最大16倍)を実例に示す。コンパイラの自動ベクトル化は不得手であり、パフォーマンス重視のコードでは明示的なベクトル化を選ぶべきという立場。 - Sources (new): [[@2026__mitchellh.com__Everyone Should Know SIMD]] - Entities (new): [[Zig]], [[Ghostty]]. Entities (updated): [[Mitchell Hashimoto]] - Concepts (updated): [[SIMDベクトル処理]] ### 2026-07-27 ingest-paper | Above the Clouds: A Berkeley View of Cloud Computing (UCB TR, 2009) - [[@2009__UCB TR__Above the Clouds - A Berkeley View of Cloud Computing]] — [[Michael Armbrust]] ほか10名([[University of California, Berkeley]] RAD Lab)。SaaS/Utility Computing/Public・Private Cloud の用語を整理し、elasticity をリスク移転として定式化する経済モデル(UserHours×(revenue-Cost) の不等式)を提示。Amazon EC2・Google AppEngine・Microsoft Azure を仮想化レベルのスペクトルとして分類し、普及・成長・政策の3層に分けたトップ10の障害と機会のリスト(可用性・データロックイン・機密性・データ転送・性能予測不可能性・スケーラブルストレージ・大規模分散システムのデバッグ・迅速なスケーリング・評判連座責任・ソフトウェアライセンス)を提示する。75台のEC2インスタンスでのVM間I/O性能干渉の実測(ディスク書き込み帯域の変動係数16%超)も含む。「クラウドコンピューティング」という用語を業界に定着させた基礎的な技術報告書。 - Sources (new): [[@2009__UCB TR__Above the Clouds - A Berkeley View of Cloud Computing]] - Entities (new): [[Michael Armbrust]], [[Google App Engine]]. Entities (updated): [[Ion Stoica]], [[Armando Fox]], [[Matei Zaharia]], [[Randy H. Katz]], [[David A. Patterson]], [[University of California, Berkeley]], [[Amazon Web Services]], [[Microsoft Azure]] - Concepts (new): [[クラウドコンピューティング]] ### 2026-07-27 ingest-paper | DynaPipe: Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism (NeurIPS 2025) - [[@2025__NeurIPS__DynaPipe - Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism]] — [[Hongxin Xu]]・[[Tianyu Guo]](共同筆頭)・[[Xianwei Zhang]](責任著者)([[Sun Yat-sen University]])。パイプライン並列 LLM サービングで見過ごされてきた「最終ステージのサンプリング(logit計算+トークン選択)負荷によるステージ間不均衡」を特定し、実行時間予測器(単層フォワード時間・サンプリング時間の線形モデル)・バブル対応スケジューラ(window threshold 付き整合度指標 Δ による層再配分決定)・非同期 KV キャッシュ移行コーディネータ(計算・通信オーバーラップで無停止移行)の3コンポーネントで層をステージ間に動的再配分する DynaPipe を提案。gLLM をベースに実装し、vLLM・gLLM・SGLang に対して ShareGPT/Azure-Conv・Qwen2.5-14B/32B で平均 E2E レイテンシを 8〜41% 削減、SLO 達成率でも一貫して優位、gLLM 比で最大 19% 高いリクエストレートを 90% SLO 達成で維持した。 - Sources (new): [[@2025__NeurIPS__DynaPipe - Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism]] - Entities (new): [[Hongxin Xu]], [[Tianyu Guo]], [[Xianwei Zhang]]. Entities (updated): [[Sun Yat-sen University]] - Concepts (updated): [[パイプライン並列化]], [[LLMサービング管理]], [[KVキャッシュ管理]], [[テンソル並列]] ### 2026-07-27 ingest-paper | TRANSOM: An Efficient Fault-Tolerant System for Training LLMs (arXiv 2310.10046) - [[@2023__arXiv__TRANSOM - An Efficient Fault-Tolerant System for Training LLMs]] — [[SenseTime Research|SenseTime]]・[[Huazhong University of Science and Technology]]・[[Beijing University of Posts and Telecommunications]] による arXiv プレプリント(2023-10-16、v3: 2023-10-18)。プロセスレベル自動フォールトトレランス(TOL、状態機械ベースの launcher/operator)・ハイブリッド異常検知(TEE、LOF+KNN Matrix Profile+DTW クラスタリングの2/3多数決)・非同期+RDMAチェックポイントエンジン(TCE、インメモリキャッシュ+ピア間バックアップ)の三本柱で、GPT3-175B・512 A800 GPUの訓練期間を118日から85日へ28%短縮、チェックポイント読み書きを最大27倍高速化(255秒→16秒)したと報告する。ByteRobust・MegaScale(2024〜2025年)に2年先立ち、同種の三本柱設計を統合していた点が[[耐障害LLM訓練]] conceptにとって重要な先行事例。[[異常検知]] conceptには「LLM訓練クラスタの検知は2023年時点で非LLMの軽量古典手法で実運用投入されていた」という知見を追加。 - Sources (new): [[@2023__arXiv__TRANSOM - An Efficient Fault-Tolerant System for Training LLMs]] - Entities (new): [[Shigang Li]], [[Yongqiang Guo]]. Entities (updated): [[SenseTime Research]], [[Huazhong University of Science and Technology]], [[Beijing University of Posts and Telecommunications]] - Concepts (updated): [[耐障害LLM訓練]], [[異常検知]] ### 2026-07-27 ingest-paper | Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks (arXiv / IEEE ICC 2026) - [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]] — [[Fabien Chraim]]・[[Dominik Janzing]]・[[John Evans]]([[Amazon Web Services]])。IEEE ICC 2026 採録プレプリント。クラウドネットワークインシデントの根本原因分析を、二値時系列への二変量 Granger 因果性 + 条件付き独立性トリプレット検定によるグラフベース因果発見と、エッジ固有の時間ラグ条件付き確率 P(A=1|B=1,Δt) を用いた経路尤度最大化による確率的推論で行う。自動化オントロジー(観測・リスク・障害・アクションの4ノード)とスパティオテンポラルグループ化で 185層×26カテゴリ=4,810 変数を 76,595 変数ペアまで削減。35件のラベル付き本番インシデントで Recall@3=85.7%・完全一致74.3%(ルールベース比+25.7pt)を達成し、7ヶ月間で本番800件超のインシデントに投入され、エンジニア評価48件中19件が5つ星だった。 - Sources (new): [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]] - Entities (new): [[Fabien Chraim]], [[Dominik Janzing]], [[John Evans]]. Entities (updated): [[Amazon Web Services]] - Concepts (updated): [[因果発見]], [[グラフベースRCA]], [[因果推論ベースRCA]], [[遅延認識時空間因果推論]] ### 2026-07-27 ingest-paper | Gemini: Fast Failure Recovery in Distributed Training with In-Memory Checkpoints (SOSP '23) - [[@2023__SOSP__Gemini - Fast Failure Recovery in Distributed Training with In-Memory Checkpoints]] — [[Zhuang Wang]]([[Rice University]]、Amazon Web Services インターンシップ時)・[[T. S. Eugene Ng]]([[Rice University]])ほか [[Amazon Web Services]] 所属研究者。SOSP '23。GPU マシンの CPU メモリ(GPU メモリよりはるかに大容量)へ毎イテレーションチェックポイントすることで、既存手法比 13 倍超の障害復旧高速化を達成する分散訓練システム Gemini を提案。証明可能に準最適なチェックポイント配置戦略(mixed placement strategy、Theorem 1・Corollary 1 で復旧確率の最適性・準最適性を証明)と、訓練通信のネットワーク遊休時間帯へチェックポイント通信をパイプライン化するトラフィックスケジューリングアルゴリズム(Algorithm 2)の2本柱で構成。16台の p4d.24xlarge(A100)で GPT-2 100B を評価し、チェックポイント取得時間を最大250倍・頻度を最大8倍改善、訓練スループットへのオーバーヘッドなしに障害復旧を13倍超高速化した。 - Sources (new): [[@2023__SOSP__Gemini - Fast Failure Recovery in Distributed Training with In-Memory Checkpoints]] - Entities (new): [[Zhuang Wang]], [[T. S. Eugene Ng]], [[Rice University]]. Entities (updated): [[Amazon Web Services]], [[DeepSpeed]] - Concepts (updated): [[チェックポイント]], [[耐障害LLM訓練]] ### 2026-07-27 ingest-paper | Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems (arXiv) - [[@2026__arXiv__Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems]] — [[Hao-Nan Zhu]]・[[Goodness Ayinmode]]・[[Cindy Rubio-González]]([[University of California, Davis]])・[[Cesar A. Stuardo]]・[[Haryadi S. Gunawi]]([[University of Chicago]])。10 の大規模分散システム(Cassandra, Hadoop, HBase, HDFS, Ignite, Kafka, MapReduce, Spark, Storm, Yarn)から 444 件のスケーラビリティ障害を分析し、compute・unbound・bloat・logic の4根本原因カテゴリと11アンチパターンを同定。反復回数がスケール次元と相関する「次元コード断片(DCF)」がアンチパターンと組み合わさって障害化するという枠組みを提示し、動的解析(ScaleView)+静的解析(ScalePick)を組み合わせたツール [[ScaleLens]] を設計。55件の既知障害のうち36件を完全検出(ベースライン SFind 比 DCF 検出数4.2倍)、Cassandra/HDFS/Ignite最新版でアンチパターン付きDCFを334件検出し27件を開発者に報告(5件確認済み、4件調査中)。 - Sources (new): [[@2026__arXiv__Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems]] - Entities (new): [[Hao-Nan Zhu]], [[Goodness Ayinmode]], [[Cesar A. Stuardo]], [[Haryadi S. Gunawi]], [[Cindy Rubio-González]], [[University of California, Davis]], [[ScaleLens]] - Concepts (new): [[スケーラビリティ障害]]. Concepts (updated): [[潜在的障害]], [[分散システム障害]] ### 2026-07-27 ingest-paper | NetCause: Counterfactual Learning for Root Cause Analysis in Large-Scale Networks (arXiv / IEEE ICCCN 2026) - [[@2026__arXiv__NetCause - Counterfactual Learning for Root Cause Analysis in Large-Scale Networks]] — [[Fabien Chraim]]・[[Jian Zhang]](共同筆頭)・[[Dominik Janzing]]・[[Xiang Song]]・[[Christos Faloutsos]]・[[John Evans]]([[Amazon Web Services]])。ネットワークインシデントをグラフ時系列プロセスとしてモデル化し、R-GCN(異種メッセージパッシング)+RNN(ノード毎時系列)の生成的時空間ワールドモデル $P(X_{t+1}|X_t,G)$ を1,500件の本番インシデントで自己教師あり学習。推論時は候補障害仮説の観測遷移を除去した反実仮想系列をロールフォワードし、事実/反実仮想予測の累積乖離 Total Causal Influence(TCI)でランキングする。31件の専門家ラベル付きインシデントで評価し、完全一致精度35.5%(ルールベースヒューリスティック19.4%比+16.1pt、82%相対改善)、Hits@2で41.9%。推論はCPU逐次実装でも95パーセンタイルsub-30秒、GPUバッチ化でsub-second。同著者チーム(Fabien Chraim・Dominik Janzing・John Evans)による姉妹論文 [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]](Granger因果性ベース、35件評価・完全一致74.3%)と同日投稿されており、「統計的因果発見」対「学習ベース反実仮想シミュレーション」という設計対比をなす。 - Sources (new): [[@2026__arXiv__NetCause - Counterfactual Learning for Root Cause Analysis in Large-Scale Networks]] - Entities (new): [[Jian Zhang]], [[Xiang Song]], [[Christos Faloutsos]]. Entities (updated): [[Fabien Chraim]], [[Dominik Janzing]], [[John Evans]], [[Amazon Web Services]] - Concepts (updated): [[因果推論ベースRCA]], [[介入的因果学習]], [[NetOps]] ### 2026-07-27 ingest-paper | Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems (ICPE Companion '26) - [[@2026__ICPE Companion__Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems]] — [[Federico Di Menna]]・[[Luca Traini]]・[[Vittorio Cortellessa]]([[University of L'Aquila]])。ICPE Companion '26(2026-05-04〜08、フィレンツェ)。時系列基盤モデル Chronos・[[TSPulse]] をゼロショットプロンプティング設定でソフトウェア性能異常検知に適用し、AIOPS・MSCloudという2つの公開データセットで、AR・Isolation Forest・LSTM-AD・VAEという4つの代表的TSADベースラインと比較する予備的実証研究。基盤モデルはベースラインに匹敵する性能を達成する(MSCloudでChronosがAUC-PR 0.52でベースライン3/4を上回りIsolation Forestに次ぐ2位)が、いずれのデータセットでも最良にはならなかった。推論レイテンシはFMがベースラインの10倍超だが(TSPulse約3ミリ秒/点、Chronos1.1ミリ秒/点超 vs ベースライン全て0.1ミリ秒未満)、訓練を含めた総所要時間ではLSTM-ADなど一部ベースラインがFMより長くなる場合がある。異常セグメント単位でのk-ステップ遅延を許容する評価アジャストメント適用後は全モデルのF1が大幅改善し、Chronosは両データセットで2位となった。 - Sources (new): [[@2026__ICPE Companion__Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems]] - Entities (new): [[Federico Di Menna]], [[Luca Traini]], [[Vittorio Cortellessa]], [[University of L'Aquila]], [[TSPulse]] - Concepts (updated): [[時系列基盤モデル]], [[異常検知]], [[時系列異常検知ベンチマーク]] ### 2026-07-27 ingest-paper | TSPulse: Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis (ICLR 2026) - [[@2026__ICLR__TSPulse - Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis]] — Vijay Ekambaram・Subodh Kumar・Arindam Jati・Sumanta Mukherjee・Tomoya Sakai・Pankaj Dayama・Wesley M. Gifford・Jayant Kalagnanam(全員 [[IBM Research]])。ICLR 2026 採択論文(arXiv:2505.13033、初版2025-05-19)。時間・周波数の両空間でのマスク再構成を時間的・スペクトル的・意味的の3ビューへ明示的にdisentangleする1Mパラメータの超軽量時系列基盤モデル群 [[TSPulse]] の原論文。Transformerではなく軽量TSMixerバックボーンを採用し、マスクトークンを生パッチレベルで定義するハイブリッドマスキング、分類向けpost-hocフューザーTSLens、異常検知向けMulti-Head Triangulationにより、分類・補完・異常検知・類似検索の4診断タスクで75以上のデータセットにおいて10〜100倍大きいMOMENT・UniTS・VQShapeを上回る(TSB-AD異常検知+20%、類似検索+25%、補完+50%、多変量分類+5〜16%)。感度分析(合成正弦波データ)では時間埋め込み(位相シフトに高感度、歪み130%)と意味埋め込み(欠損・ノイズ・位相いずれにも頑健、歪み4.6〜12%)の役割分担を定量的に確認し、disentanglementの実効性を裏付けた。同じTSPulseをソフトウェア運用ドメインでゼロショット評価した[[@2026__ICPE Companion__Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems]]では最良にならなかった結果との対比を、[[時系列基盤モデル]]の横断的知見に追記した。 - Sources (new): [[@2026__ICLR__TSPulse - Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis]] - Entities (updated): [[TSPulse]], [[IBM Research]] - Concepts (updated): [[時系列基盤モデル]] ### 2026-07-28 ingest-paper | An Evolutionary Study of Configuration Design and Implementation in Cloud Systems (ICSE '21) - [[@2021__ICSE__An Evolutionary Study of Configuration Design and Implementation in Cloud Systems]] — Yuanliang Zhang・Haochen He・[[Owolabi Legunsen]]・Shanshan Li・Wei Dong・[[Tianyin Xu]]([[National University of Defense Technology]]・[[University of Illinois Urbana-Champaign]]・[[Cornell University]])。ICSE'21(arXiv:2102.07052)。HDFS・HBase・Spark・Cassandra 4 システムの 2.5 年分(2017.6–2019.12)・1178 件の設定関連コミットを人手で分類し、設定エンジニアリングの進化を interface(パラメーターの追加・削除・修正)・usage(Parse→Check→Handling/Feedback→Use)・documentation の3軸タクソノミーで実証する。パラメーター化 169 件の 54.4% が障害等の深刻な帰結を経験した後の postmortem 対応、チェックコード追加コミットの 74.6% がユーザー報告後の反応的(reactive)追加、フィードバックメッセージの最高品質(L4)到達はごく少数、パラメーター再利用 151 件の 19.2% が不整合を伴う、という定量結果を示す。SPEX(SOSP'13)による設定ミス脆弱性の静的検出結果を、開発プロセスの時間軸から裏付ける。Fig.1 タクソノミー図を埋め込み。 - Sources (new): [[@2021__ICSE__An Evolutionary Study of Configuration Design and Implementation in Cloud Systems]] - Entities (new): [[Yuanliang Zhang]], [[Haochen He]], [[Owolabi Legunsen]], [[Shanshan Li]], [[Wei Dong]] - Entities (updated): [[Tianyin Xu]], [[National University of Defense Technology]], [[University of Illinois Urbana-Champaign]], [[Cornell University]] - Concepts (updated): [[設定ミス脆弱性]] ### 2026-07-28 ingest-paper | Kimi K3: Open Frontier Intelligence (Technical Report、2026-07-20 版から全面改訂) - [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]] — [[Moonshot AI]] の技術レポート(2026-07-27公開、47ページ)。2026-07-20時点のブログ暫定版を全面改訂。総パラメータ2.78T(活性化104.2B)・93層・コンテキスト100万トークンのネイティブマルチモーダルMoE [[Kimi K3]]。KDA(下限付きSigmoid減衰・フルランクゲート)3層+Gated MLA 1層のハイブリッドアテンション、Attention Residuals(Block構成)、Stable LatentMoE(896エキスパート中16活性化、RMSNorm・SiTU-GLU・Quantile Balancingで安定化)によりKimi K2比約2.5倍のスケーリング効率改善。SFT→9専門モデルRL→Multi-Teacher On-Policy Distillationの三段階後段訓練。MoonEP(完全均衡Expert Parallelism)・AgentENV(Firecrackerサンドボックス、5,100万超生成)を新規開発。Claude Fable 5・GPT-5.6 Solに僅差で劣後しつつ他モデルを一貫して上回り、コスト効率でフロンティア級に近接(BrowseCompで最高スコアを最安値で達成)。LatentMoEの名称論争(NVIDIA Nemotron 3との異同)を解消——同一原著論文(Elango et al.)を継承した設計であることを確認。図表5枚(アーキテクチャ・Quantile Balancing・タスク合成・プレフィックスキャッシュ・コスト効率)を埋め込み。(source / paper / moe / llm / attention) - Sources (updated): [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]] - Entities (new): [[MoonEP]] - Entities (updated): [[Kimi K3]], [[Kimi Delta Attention]], [[Attention Residuals]], [[Stable LatentMoE]], [[Moonshot AI]] - Concepts (updated): [[Mixture-of-Experts]] ### 2026-07-28 ingest | Kimi-K3 を Day0 デプロイ。2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか (Fixstars Tech Blog / Zenn) - [[@2026__Fixstars Tech Blog__Kimi-K3 を Day0 デプロイ - 2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか]] — [[Fixstars]] による [[Kimi K3]](2.78T MoE)公開当日のデプロイ実測記事。[[NVIDIA]] B300 SXM6 x8 単一ノード(HBM3e 288GB×8)に [[SGLang]] 0.5.16 で配備し、[[Decode Context Parallelism|DCP]] により実効コンテキスト527,872トークンを確保。Random ワークロード(ISL 8K/OSL 1K)で並列数40時にピークスループット5,847.6 tok/s、並列数50では失敗率が急増しスケーリング限界を露呈。コーディングエージェント実データセットでは並列30近傍で頭打ちし実用上限は同時30リクエスト程度と報告。MXFP4 ネイティブ配布(QAT済み)により追加量子化不要だったが、ウェイトダウンロードからモデルロードまで起動全体で約88.8分を要し、`--mamba-full-memory-ratio` の初期設定が KDA state pool に寄りすぎていた点を反省点として報告している。A*経路探索可視化ツールの実装比較では GLM-5.2 に対し完成度で優位という主観評価も併記。(source / article / moe / llm-inference / benchmark) - Sources (new): [[@2026__Fixstars Tech Blog__Kimi-K3 を Day0 デプロイ - 2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか]] - Entities (new): [[Fixstars]]. Entities (updated): [[Kimi K3]], [[SGLang]], [[NVIDIA]] - Concepts (new): [[Decode Context Parallelism]]. Concepts (updated): [[Speculative Decoding]] ### 2026-07-28 ingest | LLMの「脳内」をハッキングする技術 (ジョイジョイジョイ) - [[joisino-LLMの脳内をハッキングする技術-2026]] — [[佐藤竜馬]](joisino)2026-07-21。LLM の内部状態への介入手法を2つ解説。(1)[[操舵ベクトル]]: `llm-jp/llm-jp-4-8b-instruct` の内部状態を丁寧語↔関西弁クラスタの平均差方向に強制移動させ、文脈を保ったままトーンだけを切り替える(スライダー的操作)。日本語1軸から求めたベクトルが英語にも汎化。Arditi et al.(NeurIPS 2024, arXiv:2406.11717)の命令拒否方向操作も同種の操舵ベクトルとして紹介し、`google/gemma-7b-it` の爆弾チュートリアル実験(バスボムしか出力できない)でモデルが持たない知識までは操舵ベクトルで捏造できないという上限を示す。(2)[[知識編集]]: [[ロジットレンズ]]で「ルーブル美術館→パリ」の知識書き込み層(第28層付近のMLP)を特定し、MLP の行列回転のうち1軸だけを「練馬」に書き換えることで、他の質問への回答を壊さずに特定知識だけをピンポイント編集する(丸ごと置換だと無関係な質問まで「練馬」と答える副作用が出る対比実験つき)。介入後もモデルが破綻しないことを「生物的な柔軟性と治癒力」と表現し、[[joisino-モデルパラメータ算術-2024|モデルマージ]]が機能する土台とも位置づける。(source / article / llm / interpretability) - Sources (new): [[joisino-LLMの脳内をハッキングする技術-2026]] - Concepts (new): [[操舵ベクトル]], [[知識編集]] - Concepts (updated): [[活性化パッチング]], [[ロジットレンズ]], [[機構的解釈性]] - Entities (updated): [[佐藤竜馬]] ### 2026-07-29 ingest-paper | Handling Network Faults in Distributed AI Training: Failover is Now an Option (EuroSys '26) - [[@2026__EuroSys__Handling Network Faults in Distributed AI Training]] — ByteDance × National University of Singapore(EuroSys '26)。スイッチ〜ホスト間の last-hop ネットワーク障害を再起動でなくフェイルオーバーで扱う初の耐障害 CCL「ReCCL」。single-port RNIC を前提にソフトウェアで primary-backup 冗長性を実現する Soft Bonding(s-Bond)、フェイルオーバー後の straggler channel を無効化する Dynamic Channel Rebalancing(DCR)、NVLink 経由で PCIe ボトルネックを回避する Transit GPU(NVL)の3技術を統合し、NCCL の drop-in replacement として動作する。フェイルオーバー判定式($t_{elapsed} > (T_{interval}(k-1)-T_{detect})/k$)をジョブスケジューラとの意思決定インタフェースとして提示。Llama3-405B・16k GPU シミュレーションで restart 比64.96%、restart+scaling 比80.97%の GPU 時間削減、32 GPU テストベッド実測ではフェイルオーバー時スローダウン k<1.1。図6枚(CCL アーキテクチャ・primary/backup RNIC 対応・フェイルオーバーシーケンス・DCR・GPU時間節約・モデル別スローダウン)を埋め込み。 - Sources (new): [[@2026__EuroSys__Handling Network Faults in Distributed AI Training]] - Entities (new): [[Xin Zhe Khooi]] - Entities (updated): [[Zhuo Jiang]], [[ByteDance]], [[National University of Singapore]] - Concepts (updated): [[集合通信]], [[耐障害LLM訓練]], [[リスタート保護]], [[Rail-Optimizedトポロジ]] ### 2026-07-29 ingest-paper | PatternSketch: General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection (EuroSys '26) - [[@2026__EuroSys__PatternSketch - General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection]] — [[Yang Du]] ほか([[Soochow University]] × [[Nanjing University of Posts and Telecommunications]])。バースト・ウェーブ・promising 等の時系列トラフィックパターンを「隣接期間の変化」を表すマイクロパターン系列として統一抽象化し、有限状態オートマトン(Pattern Automaton)による系列マッチング問題へ帰着させることで、単一スケッチで複数パターンを同時検知する PatternSketch を提案。検知ルールを Micro-pattern Table・State Transition Table・State Priority Table の3テーブルへ分離し P4 Runtime 経由で実行時再構成できるため、既存研究([42, 72])が要した4〜8秒のスイッチダウンタイムを回避する。[[Intel Tofino]] 実機(Wedge 100BF-32X、3.2 Tbps ASIC)実装で4データセット・6パターン同時検知時に200KBメモリでF1スコア90%超を達成し、BurstSketch・Pontus・ScoutSketch を上回る精度を報告。eruption・plunge・disturbance の3新規パターンをコントローラAPIのみで(データプレーン変更なしに)追加できる拡張性も実証。図5枚(代表パターン・アーキテクチャ・Micro-pattern Collection・新規パターン・ハードウェア資源消費)とTable1(状態遷移表)をクロップ・埋め込み。 - Sources (new): [[@2026__EuroSys__PatternSketch - General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection]] - Entities (new): [[Yang Du]], [[Dan Wang]], [[He Huang]], [[Hanwen Zhang]], [[Jianzhi Tang]], [[Fu Xiao]], [[Yu-E Sun]], [[Nanjing University of Posts and Telecommunications]] - Entities (updated): [[Soochow University]], [[Intel Tofino]] - Concepts (new): [[時系列トラフィックパターン検知]] ### 2026-07-30 ingest-paper | Beyond the Buzz: A Pragmatic Take on Inference Disaggregation (MLSys 2026 Oral) - [[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]] — [[Tiyasa Mitra]]・[[Bita Darvish Rouhani]]ほか(全19名、[[NVIDIA]]、MLSys 2026 Industry Track Oral。arXiv プレプリント 2506.05508 は旧題 "A Pragmatic Take on Inference Disaggregation" で2025-06-05 投稿)。NVIDIA 独自の high-fidelity GPU 性能シミュレータで disaggregated inference serving の設計空間を数十万点規模でシミュレートし、モデルアーキテクチャ(DeepSeek-R1 MoE vs. Llama-3.1 dense)・モデルサイズ(8B/70B/405B)・トラフィックパターン(ISL/OSL)・NVLink ドメインサイズの4軸で disaggregation の恩恵の感度を定量化した初の体系的研究。disaggregation は prefill-heavy トラフィックと大規模モデルで最も効果的であり、Pareto 最適性能の達成には動的レートマッチングと弾性スケーリングが不可欠であることを示す。Chunked Pipeline Parallelism(CPP)による FTL 低減、整数計画的レートマッチングアルゴリズム(Algorithm 1・2)、KV キャッシュ転送帯域の解析式(式3・4)に加え、camera-ready 版では NVIDIA Dynamo SLA-Aware Planner の本番相当 goodput ベンチマーク(H200、最良静的構成比2倍・非効率比率比8倍)と cache-aware KV ルーティングの FTL 安定性評価(L40S)を実機で追加提示。論文図5枚+発表スライド由来3枚の計8枚を選定埋め込み。 - Sources (new): [[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]] - Entities (new): [[Tiyasa Mitra]], [[Bita Darvish Rouhani]], [[Hongkuan Zhou]], [[Yan Ru Pei]], [[Vishwanath Venkatesan]], [[Kyle Kranen]], [[Suresh Nambi]], [[Itay Neeman]] - Entities (updated): [[NVIDIA]], [[NVIDIA Dynamo]] - Concepts (updated): [[Prefill-Decode分離]] ### 2026-07-30 ingest-paper | BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching (arXiv:2412.03594, MLSys 2026 Industry Track) - [[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]] — [[Zhen Zheng]] ほか([[Microsoft]]・[[Institute of Software, Chinese Academy of Sciences]])。大規模バッチ・オフライン LLM 推論(検索エンジンのスニペット生成・オフラインランキング等)に特化し、共通プレフィックスの DP による大域的事前識別(compact prefix tree + Algorithm 1)、prefix-sharing グループ単位のスケジューリングとリクエスト並べ替え、メモリ中心 token バッチング、水平融合 prefix-shared Attention カーネルを組み合わせる。vLLM v0.6.4 に実装し、vLLM・SGLang に対しマイクロベンチマークと実運用ワークロードで 1.3〜10.8 倍のスループット向上を達成。MLSys 2026 Industry Track の発表スライドも合わせて取り込み、論文図(Figure 1・2・4・6)をスライドの対応ページから取得して埋め込んだ。 - Sources (new): [[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]] - Entities (new): [[Zhen Zheng]] - Entities (updated): [[Microsoft]], [[Institute of Software, Chinese Academy of Sciences]] - Concepts (updated): [[KVキャッシュ管理]], [[LLM推論]] ### 2026-07-30 ingest-paper | Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost (MLSys 2026) - [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]] — Haojun Xia・Xiaoxia Wu・Jisen Li ほか([[University of Sydney]]・[[Together AI]]・[[University of Illinois Urbana-Champaign]]・[[Microsoft]])。Key キャッシュのチャネルごとの量子化感度の偏りに着目し、少数の重要チャネル(12.5〜25%)のみを INT4 に保ち残りを INT2 にする Dynamic Channel-wise Precision Boost を提案。混合精度 Key ページを 2 つの統一 2-bit テンソル(dense + 疎な boosted チャネル)に分解する page-centric メモリレイアウトと Triton 融合逆量子化カーネルにより、動的チャネル選択のオーバーヘッドを実効 0.17% まで償却する。Qwen3・LLaMA3 で KV メモリを約 8 倍削減しつつ精度劣化をほぼゼロに抑え、同一メモリ予算下でバッチサイズ最大 8 倍・スループット 2.1〜4.1 倍を達成。図5枚(Figure 1〜5)を PyMuPDF によるキャプション座標クロップで取得・埋め込み。 - Sources (new): [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]] - Entities (new): [[Haojun Xia]], [[Shuaiwen Leon Song]], [[University of Sydney]] - Entities (updated): [[Zhen Zheng]], [[Together AI]], [[Microsoft]], [[University of Illinois Urbana-Champaign]] - Concepts (new): [[KVキャッシュ量子化]] - Concepts (updated): [[KVキャッシュ管理]], [[モデル圧縮]] ### 2026-07-30 ingest-paper | Cost-aware Duration Prediction for Software Upgrades in Datacenters (MLSys 2026 Industry Track) - [[@2026__MLSys2026__Cost-aware Duration Prediction for Software Upgrades in Datacenters]] — [[Yi Ding]]([[Purdue University]])・[[Henry Hoffmann]](University of Chicago)ほか([[Meta]] Infra Data Center チームとの共同研究)。データセンター規模のソフトウェアアップグレードスケジューリングを制約付き最適化問題として初めて定式化し、コストアウェア期間予測フレームワーク Acela を提案。分位点勾配ブースティング木([[LightGBM]] ベースの QGBT)で非対称な誤予測コスト(過小予測は SLO 違反、過大予測は効率低下だが許容度が高い)を反映した分位点損失を用い、MAE と過大予測率(OPR)を組み合わせたカスタムスコア関数でモデル選択を行い、p99/p99.9 でストラグラーを除去した複数の訓練セットで過大予測バイアスを緩和する。Meta 本番データセンター(400万件超の訓練データ、198 UG・約100万件で評価)での実運用評価で、既存 Heuristic スケジューラに対しアップグレード窓利用率1.25倍(37.8%→47.1%)・スケジュール数+33%・完了数+41%・キャンセル率2.4倍低減(6.6%→2.8%)を達成し、95%のSLOをAcelaのみが満たす。発表スライド(MLSys 2026)も合わせて取り込み、論文図5枚+スライド図4枚を埋め込んだ。 - Sources (new): [[@2026__MLSys2026__Cost-aware Duration Prediction for Software Upgrades in Datacenters]] - Entities (new): [[Yi Ding]], [[Henry Hoffmann]], [[LightGBM]] - Entities (updated): [[Meta]], [[Purdue University]] - Concepts (new): [[ソフトウェアアップグレードスケジューリング]] - Concepts (updated): [[ライブアップグレード]], [[サービスレベル目標]] #### BOute: Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization (MLSys 2026、2026-07-30) - [[@2026__MLSys__BOute - Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization]] — [[Youhe Jiang]]・[[Fangcheng Fu]]・[[Eiko Yoneki]]([[University of Cambridge]]・[[Shanghai Jiao Tong University]])。ユーザー提供のローカル PDF(`46_BOute_Cost_Efficient_LLM_Se.pdf`)から取り込み、対応する MLSys 2026 発表スライド(会議サイト直リンク、登壇者 [[Ran Yan]]、[[Hong Kong University of Science and Technology]])も統合。異種モデルルーティング(小/大モデルへのクエリ振り分け)と異種GPUデプロイメント(モデルごとのGPU割当・並列化戦略)が互いに補完しあうことをワークロード特性分析(§3)で実証したうえで、両者を単一の多目的ベイズ最適化(MOBO)問題として協調最適化するシステム BOute を提案。加法カーネルGP・負荷比率エンコーディング・モデル-GPU選好重み付きカーネル・制約付きqNEHVIといった構造的情報の注入により、同一コスト予算下でP95レイテンシを最大157%(平均59%)改善、または同一性能目標下でコストを15〜61%(平均38%)削減した。構造的情報を無効化すると収束に必要なBO評価回数が約8倍に増加することもアブレーションで確認。OpenReviewはCloudflare Turnstileでアクセス不可のためarXiv版・会議サイト・スライドで書誌を裏取り。 - Sources (new): [[@2026__MLSys__BOute - Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization]] - Entities (new): [[Youhe Jiang]], [[Fangcheng Fu]], [[Eiko Yoneki]], [[Ran Yan]] - Concepts (updated): [[LLMサービング管理]], [[GPUクラスタスケジューリング]], [[ベイズ最適化]] #### FaaScale: Unlocking Fast LLM Scaling for Serverless Inference (MLSys 2026、2026-07-30) - [[@2026__MLSys2026__FaaScale - Unlocking Fast LLM Scaling for Serverless Inference]] — [[Minchen Yu]]・Rui Yang ほか([[The Chinese University of Hong Kong, Shenzhen]]・[[University of Virginia]]・[[Hong Kong University of Science and Technology]]・[[Alibaba Group]]・[[Nokia Bell Labs]])。ユーザー提供のローカル PDF(`24_FaaScale_Unlocking_Fast_LLM.pdf`)から取り込み。OpenReview のスライドページ(`https://openreview.net/forum?id=jgL8LuOVyT`)は Cloudflare Turnstile で直接取得できなかったが、ユーザーから MLSys 2026 会議サイトの直リンク(`https://mlsys.org/media/mlsys-2026/Slides/3769.pdf`)が提供され、16ページの発表スライドを追加統合した。サーバーレス LLM 推論のコールドスタートを「bursty request patterns・large resource footprint・model proliferation」の trilemma として実測で定式化し、binomial-pipeline ベースの適応的モデルマルチキャストと動的パイプライン並列推論を co-design する PipeCast を提案。k-way 伝送戦略(Algorithm 1)で相補的なブロックをサブグループ間で並行転送し、実行パイプライン生成戦略(Algorithm 2)でブロック到着次第動的にパイプラインを形成することで、モデル全体の受信完了を待たずに分散推論を開始する。BurstGPT 実トレース評価で ServerlessLLM・FaaSNet・NCCL 比 P90 TTFT レイテンシ 2.4×–5× 改善、GPU コスト 17.8%–31.3% 削減。論文図5枚(bursty トレース・アーキテクチャ・PipeCast マルチキャスト可視化・マルチキャストレイテンシ・スループットスケーリング)に加え、スライド図2枚(2D 実行パイプラインの独自可視化、GPU割当推移・累積GPU時間・TTFT CDFを統合したend-to-end性能サマリ)を埋め込んだ。スライド p.3 は Hugging Face のモデル数を「2M超」と述べ、論文本文の「50万超」より大きい数字を提示しており、時点差として source ページに注記した。 - Sources (new): [[@2026__MLSys2026__FaaScale - Unlocking Fast LLM Scaling for Serverless Inference]] - Entities (new): [[Minchen Yu]], [[Yue Cheng]], [[Wei Wang]], [[Ao Wang]], [[Ruichuan Chen]], [[University of Virginia]] - Concepts (new): [[モデルスケーリング高速化]] - Concepts (updated): [[LLMサービング管理]] #### TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference (MLSys 2026、2026-07-30) - [[@2025__arXiv__TokenWeave - Efficient Compute-Communication Overlap for Distributed LLM Inference]] — Raja Gond・[[Nipun Kwatra]]・[[Ramachandran Ramjee]]([[Microsoft Research]] India)。ユーザー提供のローカル PDF(`5_TokenWeave_Efficient_Compute.pdf`)から取り込み。arXiv ID 2505.11329 として正式に取得し直し(元ファイル名がサンドボックスの token 読み取り拒否ルールに抵触したため)。テンソル並列推論の AllReduce 通信オーバーヘッド(8×H100 で 9–23%)と、見過ごされてきた RMSNorm のオーバーヘッド(4–9%)を同時に削減する融合 AllReduce–RMSNorm カーネルを NVSHARP/Multimem で実装し、wave-aware な smart-splitting による 2 分割で計算-通信オーバーラップをトークン数 1024 という小規模イテレーションでも成立させる TokenWeave を提案。vLLM V1 に実装し、Llama-3.3-70B・Qwen2.5-72B・Mixtral-8x22B で最大 1.28 倍のレイテンシ改善・1.19 倍のスループット改善を達成し、TileLink・NanoFlow を上回る。一部設定では通信を完全除去した理論上限(vLLM-nocomm)すら上回る。論文図4枚(アーキテクチャ概要・レイテンシ結果・選択的有効化フロー・wave 分割説明)を埋め込んだ。 - Sources (new): [[@2025__arXiv__TokenWeave - Efficient Compute-Communication Overlap for Distributed LLM Inference]] - Entities (new): [[Raja Gond]] - Entities (updated): [[Nipun Kwatra]], [[Ramachandran Ramjee]] - Concepts (updated): [[テンソル並列]], [[集合通信]], [[LLM推論]] ## BEAM: Joint Resource–Power Optimization for Energy-Efficient LLM Inference under SLO constraints (2026-07-30) BEAM(KAIST CASYS)は、LLM 推論サービングにおける資源効率(バッチング)と電力効率(DVFS)を、リクエストごとの SLO レイテンシスラックのもとでミリ秒粒度・イベント駆動的に共最適化するコントローラ。vLLM に約1,100行を追加して実装し、A100×8構成のLlama3.3-70Bで vLLM比49%(Window-DVFS比30%削減)までエネルギー消費を削減しつつ TTFT/TBT SLO遵守率94%台以上を維持。MLSys 2026発表スライドも統合し、バースト応答時の制御ノブ軌跡など論文本文にない可視化も取り込んだ。 - Sources (new): [[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]] - Entities (new): [[Hyunjae Lee]], [[Sangjin Choi]], [[Seungjae Lim]], [[Youngjin Kwon]] - Concepts (updated): [[GPUエネルギー効率]], [[LLMサービング管理]] ## SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips (2026-07-30) SuperInfer([[University of Illinois Urbana-Champaign]] SSAIL Lab)は、NVIDIA GH200 のような GPU-CPU 密結合 Superchip(NVLink-C2C 900GB/s)向けの SLO 認識 LLM 推論システム。既存オフロード手法をそのまま移植しても C2C 帯域の 5% 未満しか活用できない原因が、PagedAttention の細粒度セグメント + 大量のカーネル起動というソフトウェアスタックにあることを特定し、Virtual Lag Time(VLT)に基づく能動的ローテーションスケジューラ RotaSched と、eager block rotation + block-first レイアウトで全二重転送を実現する DuplexKV を co-design した。GH200 NVL2 上の評価で TTFT SLO 達成率を最大 74.7% 改善しつつ TBT・スループット(最大 29.2% 改善)を維持し、DuplexKV は理想帯域比 94% に到達。MLSys 2026 発表スライドも統合し、GH200 アーキテクチャ図(NVIDIA datasheet からの引用)を取り込んだ。 - Sources (new): [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]] - Entities (new): [[Jiahuan Yu]], [[Mingtao Hu]], [[Zichao Lin]], [[Minjia Zhang]], [[NVIDIA GH200]] - Entities (updated): [[University of Illinois Urbana-Champaign]], [[vLLM]] - Concepts (updated): [[KVキャッシュ管理]], [[LLMサービング管理]] ## Speculative Decoding: Performance or Illusion? (2026-07-30) [[University of California, Berkeley]] のグループ(Xiaoxuan Liu・Jiaxiang Yu 共同筆頭著者)による、本番グレードの推論エンジン vLLM 上での投機的デコーディング(SD)の初の体系的ベンチマーク(MLSys 2026)。n-gram・EAGLE/EAGLE-3・Draft-Model・MTP を、バッチサイズ 1〜128・モデル規模 8B〜106B・6 種のワークロードにわたって横断比較し、検証(verification)段階が実行時間の 42〜95% を占め支配的コストであること、トークン受理率がリクエスト内・リクエスト間・データセット間で大きく変動することを実測で示した。実測ベンチマークデータに基づく理論上限(oracle)シミュレータにより、EAGLE と n-gram を位置適応的に組み合わせる Oracle Combine が単一手法比最大 2.2×・標準デコーディング比最大 4.9× の追加速度向上をもたらす可能性を定量化。arXiv プレプリント(2601.11580)と MLSys 2026 発表スライド(会議サイト直リンク)を統合取り込みした。OpenReview の PDF 直リンクは Cloudflare 保護で 403 だったため、スライドから著者・タイトルを特定し arXiv API で正式なプレプリントを取得する経路を取った。 - Sources (new): [[@2026__arXiv__Speculative Decoding - Performance or Illusion?]] - Entities (new): [[Xiaoxuan Liu]], [[Jiaxiang Yu]], [[Jongseok Park]], [[Alvin Cheung]] - Entities (updated): [[Ion Stoica]] - Concepts (updated): [[Speculative Decoding]], [[LLM推論]] ## DreamDDP: Accelerating Low-Bandwidth Geo-Distributed LLM Training with Layer-wise Partial Synchronization (2026-07-30) DreamDDP(The Hong Kong University of Science and Technology ほか、MLSys 2026 Oral)は、地理分散データセンター間の低帯域幅環境における LLM 訓練を高速化するフレームワーク。Local SGD の全層一括同期を層単位で分解する partial synchronization(PLSGD)により通信と逆伝播(BP)のオーバーラップを可能にし、S-SGD と同じ収束率 O(1/R) を理論的に保証する(Theorem 1)。3 つの性質(Optimal Hiding・Delayed CO Assignment・At-least-One Assignment)を用いた DFS スケジューラで、素朴な組み合わせ探索 (H+L)!/(L!H!) を O(2^{min(L-H,H)}) に削減し、さらに通信の空き時間(idle bubble)を後期層の追加同期で埋めて収束を加速する。32 GPU・ResNet-18/50・GPT-2・Llama-2 の実験で ASC-WFBP 比 1.73〜5.22 倍、FLSGD 比 1.13〜1.50 倍の反復時間短縮を達成した(目標性能到達までの wall-clock 時間では FLSGD 比最大 1.56 倍)。arXiv 版(2502.11058)はタイトルが異なる("...Layer-wise Scheduled Partial Synchronization")ことを確認した上で、本 source は MLSys 2026 camera-ready 版(ユーザー提供のローカル PDF)を取り込んだ。ベクター描画の図(タイムライン比較・スケジューリング概要・依存関係図・収束曲線)は PyMuPDF によるキャプション座標クロップで抽出した。 - Sources (new): [[@2026__MLSys__DreamDDP - Accelerating Low-Bandwidth Geo-Distributed LLM Training with Layer-wise Partial Synchronization]] - Entities (new): [[Zhenheng Tang]], [[Shaohuai Shi]], [[Xiaowen Chu]], [[Bo Li]], [[Hong Kong Baptist University]], [[Harbin Institute of Technology]] - Concepts (updated): [[並列化戦略]], [[集合通信]] ## veScale-FSDP: Flexible and High-Performance FSDP at Scale (2026-07-30) veScale-FSDP([[ByteDance Seed]]・[[University of Washington]]、MLSys 2026 Industry Track)は、既存 FSDP システム(DeepSpeed ZeRO・FSDP1・FSDP2・Megatron-FSDP)の固定シャーディング粒度(要素単位/行単位)がブロック単位量子化・Shampoo/Muon 等の非要素単位オプティマイザと衝突する問題を解決する。任意粒度・任意分布のシャーディングを許す新フォーマット RaggedShard、NP-hard な最適化問題(古典的 Partition 問題への帰着)を多項式時間 DP ヒューリスティックで解く構造認識プランニングアルゴリズム、ゼロコピー通信プリミティブ Distributed Buffer(DBuffer)の 3 層で構成される。既存システム比スループット 5〜66% 向上・メモリ 16〜30% 削減を達成し、8-bit Adam・Distributed Muon のケーススタディと 8K〜10K GPU への線形スケーリングを実証。ByteDance Seed の本番環境にすでに大半の訓練ワークロードで展開済み。ローカル PDF と MLSys 2026 発表スライド(会議サイト直リンク)を統合取り込みしたが、スライドは論文と同内容の図の段階的ビルドアニメーションが中心だったため図表は論文本文の 8 枚のみを埋め込んだ。 - Sources (new): [[@2026__MLSys2026__veScale-FSDP - Flexible and High-Performance FSDP at Scale]] - Entities (new): [[Zezhou Wang]], [[Yanghua Peng]], [[veScale]] - Entities (updated): [[Xin Liu]], [[ByteDance Seed]], [[University of Washington]] - Concepts (new): [[RaggedShard]] - Concepts (updated): [[ZeROパラメータシャーディング]], [[ZeROメモリ最適化]], [[集合通信]] ## LEANN: A Low-Storage Vector Index (2026-07-30) LEANN([[University of California, Berkeley]] Sky Computing Lab ほか、arXiv:2506.08276、MLSys 2026 Oral)は、埋め込みベクトルを事前保存せずクエリ時にオンザフライで再計算し、近接グラフのメタデータも高次数保存枝刈りで圧縮するストレージ効率型ベクトルインデックス。76GBのRPJ-Wikiデータセットに対しインデックスサイズを4GB(生データの5%未満)まで圧縮しつつHNSWと同等の検索精度を維持し、既存手法(HNSW・DiskANN等)比最大50倍のストレージ削減を達成する。二段階探索(近似PQ距離で候補を絞り厳密再計算を交互に行う)と動的バッチング(複数探索ホップをまたいだGPUバッチ化)により、RAGパイプライン全体へのレイテンシオーバーヘッドを20%未満(推論集約タスクでは3%未満)に抑える。ユーザー提供のローカルPDFと、MLSys 2026会議サイト直リンクの発表スライド(37ページ、GitHubスター履歴・Claude Code連携・コミュニティ実測値などの論文外情報を含む)を統合取り込みした。新設concept「ベクトル検索インデックス」を導入し、既存concept「LLM向け情報検索」「エージェントメモリ」にストレージ効率化という横断的知見を追記した。 - Sources (new): [[@2025__arXiv__LEANN - A Low-Storage Vector Index]] - Entities (new): [[Yichuan Wang]], [[Joseph E. Gonzalez]], [[LEANN (repository)]] - Entities (updated): [[Ion Stoica]], [[Matei Zaharia]], [[University of California, Berkeley]], [[The Chinese University of Hong Kong]], [[Amazon Web Services]], [[University of California, Davis]] - Concepts (new): [[ベクトル検索インデックス]] - Concepts (updated): [[LLM向け情報検索]], [[エージェントメモリ]] ## FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems (2026-07-31) FlashInfer-Bench(University of Washington・Carnegie Mellon University・NVIDIA・UC Berkeley ほか、MLSys 2026、arXiv:2601.00227)は、LLM エージェントが生成する GPU カーネルを本番 LLM 推論システムへ統合するための標準化されたクローズドループフレームワーク。カーネル定義・実世界ワークロード・候補実装・評価結果を単一の JSON スキーマ(FlashInfer Trace)で記述し、実サービストレース由来の79定義・2,474ワークロードからなるデータセット、決定的/低精度(FP8等)/非決定的(サンプリング)カーネルにそれぞれ対応した堅牢なベンチマーク基盤(サンドボックス隔離によるリワードハッキング対策込み)、フロンティアモデルの GPU プログラミング能力を追跡する公開リーダーボード、そしてコード変更なしで最良カーネルを SGLang・vLLM 等の本番エンジンへ動的注入する `flashinfer_bench.apply()` を統合する。Gemini 2.5 Pro・Claude Opus 4.1・GPT-5・OpenAI o3 の評価では、正しさエラー(32件)の94%(30件)がコンパイル失敗であること、Triton が CUDA より正しさ・速度ともに一貫して優位であること(例: GPT-5 は CUDA 83% vs Triton 96%)、GEMM ではエージェントが cuBLAS 呼び出しを学習し PyTorch 参照比116倍という人間水準を超える性能を達成する一方、GQA Ragged・MLA Paged・MoE のような複雑なカーネルでは FlashInfer 基準の0.4倍未満にとどまることを示した。新設concept「LLM駆動GPUカーネル生成」を導入し、既存concept「GPU最適化」にエージェントが到達できる最適化技術・できない技術の対比を追記した。 - Sources (new): [[@2026__arXiv__FlashInfer-Bench - Building the Virtuous Cycle for AI-driven LLM Systems]] - Entities (new): [[Shanli Xing]], [[Yiyan Zhai]], [[Alexander Jiang]], [[Yixin Dong]], [[Zihao Ye]], [[Charlie Ruan]], [[Yingyi Huang]], [[Yineng Zhang]], [[Liangsheng Yin]], [[Aksara Bayyapu]], [[Luis Ceze]], [[FlashInfer]] - Entities (updated): [[Yong Wu]], [[Tianqi Chen]], [[NVIDIA]], [[Carnegie Mellon University]], [[University of Washington]], [[University of California, Berkeley]], [[SGLang]], [[vLLM]] - Concepts (new): [[LLM駆動GPUカーネル生成]] - Concepts (updated): [[GPU最適化]] ## AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization (2026-07-31) AccelOpt(Stanford University・Amazon Web Services・University of Toronto、MLSys 2026 Oral、arXiv:2511.15915)は、専門家提供のハードウェア固有最適化知識に頼らずに [[AWS Trainium]] 向け [[Neuron Kernel Interface (NKI)|NKI]] カーネルを自律的に最適化する自己改善型 LLM エージェントシステム。ビームサーチによる候補カーネル探索(planner・executor・summarizer の3エージェントワークフロー)と、発見したスロー・ファストなカーネル対(正・負の書き換え)を要約して未来のイテレーションに転写する容量制御された最適化メモリの2機構を組み合わせる。評価用に実世界 LLM ワークロード由来の14カーネルから成るベンチマーク [[NKIBench]] を新規構築し、理論ピーク性能到達率という絶対指標を導入した。オープンソースモデル(gpt-oss-120b・Qwen3-Coder-480B)を用い、Trainium 1 のピーク到達率を49%から61%、Trainium 2 を45%から59%に改善し、Claude Sonnet 4(thinking mode)と同等の性能を26倍安いコストで達成。Mamba・RoPE カーネルでは人間専門家の最良実装を上回る性能を発見した。新設concept「LLMによるカーネル最適化」を導入し、既存concept「エージェントメモリ」「AIアクセラレータ」に横断的知見を追記した。同時期に取り込まれた「LLM駆動GPUカーネル生成」(FlashInfer-Bench 起点)とは、パイプライン/言語トレードオフ(GPU 限定) vs 探索アルゴリズム(GPU に限らない新興アクセラレータ)という異なる軸を扱う姉妹概念として相互参照した。 - Sources (new): [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] - Entities (new): [[Genghan Zhang]], [[Kunle Olukotun]], [[Yida Wang]], [[Anjiang Wei]], [[Zhen Jia]], [[AWS Trainium]], [[Neuron Kernel Interface (NKI)]], [[NKIBench]], [[AccelOpt (repository)]] - Entities (updated): [[Stanford University]], [[Amazon Web Services]], [[University of Toronto]] - Concepts (new): [[LLMによるカーネル最適化]] - Concepts (updated): [[エージェントメモリ]], [[AIアクセラレータ]] ## HiSparse: Turbocharging Sparse Attention with Hierarchical Memory (2026-07-31) HiSparse([[LMSYS]] Org、ブログ記事、2026-04-10 公開)は、[[SGLang]] 上に実装された top-k [[スパース注意]]向け階層メモリシステム。スパース注意は計算量を削減してもフルコンテキストの KV キャッシュを高速アクセスのため GPU HBM に保持し続ける必要があり capacity-bound になりやすいという課題に対し、不活性な KV キャッシュエントリをホストメモリへプロアクティブに退避しつつ GPU HBM 上に頻繁アクセス領域のみを保持する hot device buffer を維持する設計で応じる。専用 CUDA カーネルが top-k キャッシュミス特定・LRU 退避候補選定・ページテーブル更新の3段処理を実行し、hot device buffer サイズの拡大(2048→4096)と LRU 退避方針の組み合わせが FIFO・Random よりミスカウントを大きく削減することを [[DeepSeek-V3.2]](DSA、LongBenchV2)で確認した。GLM-5.1-FP8 での評価では並行数256でベースライン比3倍超、入出力シーケンス長構成のスイープでは最大約4.9倍(352→1720 tokens/s)のスループット改善を報告。PDF/arXiv 論文が存在しない技術ブログ記事のため `wiki-ingest`(汎用フロー)で取り込んだ。新設concept「スパース注意」を導入し、既存concept「KVキャッシュ管理」に「スパース注意は容量ボトルネックの再配置であり既存のホストメモリ階層退避の設計思想がそのまま適用できる」という横断的知見を追記した。 - Sources (new): [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]] - Entities (updated): [[SGLang]], [[LMSYS]], [[DeepSeek-V3.2]] - Concepts (new): [[スパース注意]] - Concepts (updated): [[KVキャッシュ管理]] ## Optimizing Deployment Configurations for LLM Inference: Challenges and Insights (2026-07-31) Optimizing Deployment Configurations for LLM Inference([[Meta]] Inference Team、責任著者 Sungmin Cho・Jaewon Lee、MLSys 2026 Industry Track)は、月間アクティブユーザー約10億人規模の Llama 推論運用から得たデプロイメント最適化の知見を報告する実務論文。ハードウェア(H100/H200/MI300X 等)・5次元並列化(TP/PP/EP/CP/DP)・ランタイム(継続的バッチング対分離推論)の組み合わせが数百万規模に達する設計空間を、演算子マイクロベンチマーク駆動の軽量シミュレータ(実機比±5%精度、数分でスイープ)で体系的に探索する手法を開発した。5つの知見を報告: (1) オンライン推論では [[Prefill-Decode分離]] が継続的バッチング比1.5〜2.2倍のQPSを達成し(オフラインでは差が消失)、Meta はオンラインサービスの大半を分離ランタイムへ移行し約30%の容量削減を得た。(2) Prefill/Decode で最適[[並列化戦略]]が体系的に異なる(Prefill=PP4-TP2、Decode=TP8+大バッチ)。(3) 異種ハードウェアで Prefill(計算バウンド)と Decode(メモリ帯域バウンド)を別アクセラレータに割り当てると同等QPSを15〜25%低いTCOで達成できる。(4) Expert Parallelism が [[Mixture-of-Experts]] のスケールアウトを効率化し、Llama 4 Maverick(128エキスパート)ではTP16化でDecode QPSがほぼ半減する一方、EP併用のTP4DP4-TP4EP4はTP8比+45%を達成。(5) 密モデルはスケールアップ基盤が必須になるがMoEモデルはExpert Parallelismによりスケールアウト基盤でも良好にスケールする。MLSys 2026 発表スライド(Sung Min Cho)も統合取り込みした。新設concept「LLM推論設計空間探索」を導入し、既存concept「Prefill-Decode分離」「並列化戦略」「Mixture-of-Experts」に本番規模の定量知見を追記した。 - Sources (new): [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]] - Entities (updated): [[Meta]] - Concepts (new): [[LLM推論設計空間探索]] - Concepts (updated): [[Prefill-Decode分離]], [[並列化戦略]], [[Mixture-of-Experts]] ## 性能測定道 事始め編 (2026-07-31) 性能測定道 事始め編([[早水悠登]]、東京大学 喜連川研究室、日本PostgreSQLユーザ会 第27回しくみ+アプリケーション勉強会、2013-10-05)は、性能測定を「モデル化」「計測」「シミュレーション」の3つの基本形に分解し、互いに検証(validate)し合う関係として解説する連続講演の第一回。性能測定は Raj Jain の言う「技芸(art)」であり、モデル化ができれば実際の計測前に性能を予測できること、計測はモデル化の「しもべ」でありモデルなき計測は意味を成さないこと、シミュレーションは「もしもこうだったら?」を分析する技術でシステムの一部を意図的に「端折る」行為であることを、HDDシーケンシャルリードのスループットモデル化、待ち行列理論M/M/1によるCPU・ストレージ・データベース・ネットワークルータの理論的性能モデル化、blktraceベースのI/O REPLAYによるHDD/SSD1/SSD2でのI/Oパターン再生シミュレーションという3つの実例で示す。SlideShareの当該ページはボット対策(Client Challenge)によりPDF原本を取得できなかったため、CDN上の個別スライド画像(全49枚、638px幅JPG)を代替の一次資料として`.raw/slides/seinou-sokuteidou-jpug2013/pages/`に保存した。新設concept「性能測定」を導入した。 - Sources (new): [[@2013__JPUG__性能測定道 事始め編]] - Entities (new): [[早水悠登]], [[喜連川優]] - Concepts (new): [[性能測定]] ## 性能測定道 実践編 (2026-07-31) 性能測定道 実践編([[早水悠登]]、東京大学 喜連川研究室、日本PostgreSQLユーザ会 しくみ+アプリケーション勉強会、2014-02-01)は、「事始め編」の続編で、CPUのメモリアクセスレイテンシ測定とストレージI/O性能モニタリングという2つの実践をAWS EC2上のライブデモとともに解説する。核心は「実行時間とメモリアクセス回数は比例するとは限らない」という指摘で、命令パイプライン実行・スーパースカラ実行・プリフェッチ・分岐予測というCPUの性能最適化機構が実行時間とメモリアクセス回数の比例関係を崩すため、ポインタチェイシング(1つ前の命令に必ずデータ依存する命令列)によるパイプライン阻害、ランダムアクセスによるプリフェッチ無効化、分岐命令を与えないことによる分岐予測器の無力化という3つの手法(「ニート化」)でこれらを意図的に働かなくする必要があると説く。早水悠登が開発した自作ツール micbench(マイクロベンチマークツールセット)を用いたAWS EC2上のライブ実測では、L1Dキャッシュ8.23クロック・L2キャッシュ24.6クロック・L3共有キャッシュ445クロック・主記憶567クロックというレイテンシが得られ、いずれもWikipedia調べの理論値を一貫して上回った。I/O性能測定では、標準ツールsysstat(mpstat/iostat)の出力可読性・リアルタイム性の限界を指摘し、これを解決する自作ツール PerfMonger(JSON出力・リアルタイムWebダッシュボード)によるライブデモを行った。SlideShareの当該ページはボット対策(Client Challenge)によりPDF原本を取得できなかったため、CDN上の個別スライド画像(全106枚、638px幅JPG)を代替の一次資料として`.raw/slides/seinou-sokuteidou-jissen-jpug2014/pages/`に保存した。新設entity「micbench」「PerfMonger」を導入し、既存concept「性能測定」に横断的知見(実測値と理論値の乖離)を追記した。 - Sources (new): [[@2014__JPUG__性能測定道 実践編]] - Entities (new): [[micbench]], [[PerfMonger]] - Entities (updated): [[早水悠登]], [[喜連川優]] - Concepts (updated): [[性能測定]] ## TuxBot: Semantic-Aware Online OS Tuning with Large Language Models (2026-08-03) TuxBot(Georgios Liargkovas・Mihir Nitin Joshi・[[Hubertus Franke]]・Kostis Kaffes、[[Columbia University]] / [[IBM Research]]、arXiv 2605.15026)は、既存のオンライン OS チューニングコントローラ(MLOS 等のベイズ最適化・Q-Learning/DQN)が各 OS ノブを独立変数として扱うために生じる 3 つの失敗——数値的に妥当だが意味論的に無意味/矛盾した設定への反復探索、単一プロキシ報酬の脆さ、制御サーフェス拡大に伴う意味論的リスクの増大——を、LLM をノブ・テレメトリの意味論的推論器として組み込むことで解決するホスト側フレームワーク。低遅延の Instant ループと低頻度・高推論予算の Reasoning ループから成る dual-loop 制御、セッション内/セッション横断メモリ(ChromaDB による埋め込み検索でウォームスタート)、型付き Parameter Validator による検証済みアクチュエーションを組み合わせ、5 ベンチマークスイート・13 ワークロード・最大 41 Linux パラメータで安定フェーズ性能を default 比 +72.5%、最強ベースライン MLOS 比 +153.3% 改善する。アプリケーションメトリクスが得られずシステムメトリクスのみの場合でも、アプリケーションメトリクスを直接使うベースラインを 93.7 ポイント上回り、30 ウィンドウのセッションコストは約 $0.20。新設 concept「OSノブチューニング」を導入し、既存 concept「データベースノブチューニング」に OS ノブと DB ノブの同型の失敗構造という横断的知見を追記した。 - Sources (new): [[@2026__arXiv__TuxBot - Semantic-Aware Online OS Tuning with Large Language Models]] - Entities (new): [[Georgios Liargkovas]], [[Mihir Nitin Joshi]], [[Kostis Kaffes]] - Entities (updated): [[Hubertus Franke]], [[Columbia University]], [[IBM Research]] - Concepts (new): [[OSノブチューニング]] - Concepts (updated): [[データベースノブチューニング]] ## STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices (2026-08-03) STAR(Junle Wang・Xingchuang Liao・Wenjun Wu、[[Beihang University]] School of Artificial Intelligence、arXiv 2605.15581)は、LLM ベース RCA エージェント(mABC・RCAgent)の推論トレースを Evidence Package(EP)・Hypothesis Set(HS)・Analysis Structure(AS)・Decision Report(DR)の4段階アーティファクトに分解し、失敗を単一の end-to-end 誤りではなくステージ局所化可能な推論バグとして扱う後付け修復フレームワーク。ステージ単位監査による信頼性スコア算出、予算考慮型 Fast/Slow Routing、反実仮想的な候補パッチ評価による決定的故障ステージ s* の特定(疑わしいステージでなく修正が実際に改善をもたらすステージを実証的に特定)、s* 以降のステージのみを再実行するパッチ&リプレイ、Self-Evolving Repair Memory の5コンポーネントで構成される。mABC・RCAgent の2ワークフロー・GPT-5/Qwen3-Max/Gemini-2.5-Pro の3基盤モデル・公開ベンチマーク(AIOps Challenge, HipsterShop2)と実運用本番データセットの2データセットで評価し、根本原因箇所特定(mABC で Acc@1 +19.0pt、RCAgent で +24.9pt)・障害種別分類・決定的ステージ局所化精度(全ステージでベースライン比+10pt以上)を一貫して改善し、当初誤ったトレースの過半数を単一リプレイで修復した。既存concept「LLMによる根本原因分析」に mABC・RCAgent への後付け修復という新知見を、「エージェント修復」に AgentTether/PROBE の TU 粒度帰属と対比する RCA 特化4ステージ粒度帰属という新知見を追記した。 - Sources (new): [[@2026__arXiv__STAR - A Stage-attributed Triage and Repair framework for RCA Agents in Microservices]] - Entities (new): [[Junle Wang]], [[Xingchuang Liao]], [[Wenjun Wu]] - Entities (updated): [[Beihang University]] - Concepts (updated): [[LLMによる根本原因分析]], [[エージェント修復]] ## TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices (2026-08-03) TopoEvo(Junle Wang・Xingchuang Liao・Wenjun Wu、[[Beihang University]] School of Artificial Intelligence、arXiv 2605.15611、STAR と同一著者)は、トポロジに依存しない LLM ベース RCA エージェントが下流の増幅された症状を根本原因と誤認する symptom-amplification bias に対処する、end-to-end のトポロジ制約付き自己進化型マルチエージェントフレームワーク。メトリクス埋め込みをログ・トレース整合成分に直交分解して対照学習で整列する Metric-orthogonal Multimodal Alignment(MOMA)、GAT ベースのトポロジ表現学習、ベクトル量子化(VQ、コードブックサイズ K=128)による監査可能な症状トークン化、Hypothesis Planner・Metric/Log/Trace Agent・Judge Agent からなる Hypothesis-Evidence-Test(HET)マルチエージェント推論(temporal precedence・path consistency・template consistency の 3 基準チェックリストで代替仮説を明示的に棄却)、階層的インシデントメモリと高信頼度疑似ラベルによる保守的テスト時適応を行う Self-Evolving Mechanism の5コンポーネントで構成される。公開 AIOps ベンチマーク(HipsterShop2)と実運用インシデントデータセットで根本原因特定精度を最大 3.44 ポイント、障害種別分類 F1 を 4.39〜16.81 ポイント改善し、アブレーションでは HET 除去が最大の性能低下(AC@1 で 15〜16 ポイント)をもたらした。既存concept「仮説駆動RCA」に、victim-as-cause 代替仮説の強制生成という症状増幅バイアス対策と、JustDiag の主張レベル裁定と同型の 3 基準チェックリスト検証という新知見を追記した。 - Sources (new): [[@2026__arXiv__TopoEvo - A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices]] - Entities (updated): [[Junle Wang]], [[Xingchuang Liao]], [[Wenjun Wu]], [[Beihang University]] - Concepts (updated): [[仮説駆動RCA]] ## Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought (2026-08-03) RCLAgent(Lingzhe Zhang・Tong Jia・Kangjin Wang・Chiming Duan・Minghua He・Ying Li、[[Peking University]]、Rongqian Wang・Xi Peng・Meiling Wang・Gong Zhang・Renhai Chen、[[Huawei Theory Lab]]、IEEE Transactions on Dependable and Secure Computing 採録・arXiv 2605.14866)は、15名の SRE への半構造化インタビューと AIOPS 2022 の失敗100ケースの事後分析から、人間の根本原因特定が recursiveness(再帰性)・multi-dimensional expansion(多次元展開)・cross-modal reasoning(モダリティ横断推論)の3特性を持つこと、既存 LLM ベース RCA が文脈爆発による証拠希釈と逐次推論構造による浅い探索という2つの限界を抱えることを実証的に特定した。これに基づき、トレースグラフの各スパンに専任エージェント(Dedicated Agent)を割り当てグラフトポロジに沿って再帰的・並列に組織する Multi-Agent Recursion-of-Thought(固定容量 Agents Pool で並列度を制御)を核とし、Root-Level Diagnosis Report(再帰的集約結果)と Global Evidence Graph(全スパンの自己状態証拠を保持するボトムアップな証拠基盤)を Diagnosis Synthesizer が統合して最終診断を生成するフレームワーク RCLAgent を提案する。AIOPS 2022・Augmented-TrainTicket・RCAEval の3ベンチマークで MRR 69.73%/74.08%/62.97% を達成し mABC・GALA・TraceRCA 等の SOTA を上回りつつ、最速の LLM ベースライン ReAct 比 1.49〜2.11 倍高速。アブレーションでは Global Evidence Graph 除去が最大の精度低下(平均 MRR 69.73%→56.90%)をもたらした。既存 entity [[RCLAgent]] が別の引用元論文([[@2026__arXiv__How Far Can Root Cause Analysis Go on Real-World Telemetry Data?]])の記述に基づき登録していたアーキテクチャ("data agent/thought agent"、3フェーズ)が、原論文の実際の構成(Dedicated Agent・Agents Pool・Global Evidence Graph)と一致しないことを発見し、contradiction callout として記録した。既存concept「LLMによる根本原因分析」「マルチエージェント協調」の双方に、トレースグラフ構造をそのまま協調トポロジとして流用する設計という横断的知見を追記した。 - Sources (new): [[@2026__TDSC__Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought]] - Entities (new): [[Chiming Duan]], [[Minghua He]], [[Rongqian Wang]], [[Xi Peng]], [[Meiling Wang]], [[Gong Zhang]], [[Renhai Chen]], [[Huawei Theory Lab]] - Entities (updated): [[Lingzhe Zhang]], [[Tong Jia]], [[Ying Li]], [[Kangjin Wang]], [[Peking University]], [[RCLAgent]] - Concepts (updated): [[LLMによる根本原因分析]], [[マルチエージェント協調]] ## ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload (2026-08-03) ReCoVer(Ziyue Liu・Zhengyang Wang・Ruijie Zhang・Zheng Zhang、[[UC Santa Barbara]]、Avinash Maurya・Hui Zhou・Paul Hovland・Sheng Di・Franck Cappello・Bogdan Nicolae、[[Argonne National Laboratory]]、arXiv 2605.11215、査読中)は、数万 GPU 規模で平均故障間隔(MTBF)が18分に縮小しチェックポイント・リスタート方式が50%超の GPU 時間を浪費する問題に対し、「各反復が常に同じマイクロバッチ数 B を確定させる」という単一不変条件(Σ C_r(t) = W_init・G_init = B)を維持する前方復旧(forward recovery)システムを提案する。ULFM(User-Level Failure Mitigation)ベースの障害耐性集合通信(`ULFM_ALLREDUCE`/`ULFM_CONSENSUS` による Detect-Repair-Record-Reduce の4段階)・反復内バケット単位の勾配復元(ワールドエポックタグ付けによる stale バケット判定と巻き戻し)・Major/Minor/Major-spare/Minor-spare の4ロールによる動的マイクロバッチ再配分(多用途ワークロードポリシー)の3層に分離したプロトコルで構成され、レプリカ単位を生存の原子単位として3D並列・HSDP両方に並列化スキーム非依存で統合できる。512 GPU・256 GPU 喪失下の3D並列 7B LLaMA型モデル事前学習で、無故障参照実行と視覚的に区別不能な訓練損失曲線を260反復にわたり実証し(Appendix F で分布等価性を数学的に証明)、チェックポイント・リスタート方式比で連続障害後に最大2.23倍の実効スループット、234 GPU時間で+102Mトークン(+74.9%)多い処理量を達成した。既存concept「耐障害LLM訓練」に、FTAR(勾配ノイズスケール変化による軌跡ドリフト)・SPARE(シミュレーションのみ・冗長計算大)という2つの直近先行研究を名指しで乗り越える「復旧を速くする」から「復旧しても勾配分布を変えない」への軸転換、およびホットスペアと SPARE の中間点にある「動的かつゼロ冗長」なスペア設計という2つの横断的知見を追記した。 - Sources (new): [[@2026__arXiv__ReCoVer - Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload]] - Entities (new): [[Ziyue Liu]], [[Zheng Zhang]], [[Bogdan Nicolae]] - Entities (updated): [[UC Santa Barbara]], [[Argonne National Laboratory]] - Concepts (updated): [[耐障害LLM訓練]] ## PRIM: Meta-Learned Bayesian Root Cause Analysis (2026-08-03) PRIM(Christopher Lohse、[[Trinity College Dublin]] / [[IBM Research]]、Anish Dhir、University College London Gatsby Computational Neuroscience Unit、Amadou Ba・Bradley Eck、[[IBM Research]]、Marco Ruffini、[[Trinity College Dublin]]、Jonas Wahl、[[DFKI]] / University of Bergen、arXiv 2605.08786、査読中)は、根本原因分析(RCA)を因果グラフ $G$ と機能的メカニズム $f$ の不確実性を周辺化するベイズ推論タスク $p(T\mid D^{obs}, D^{int}, m)$ として再定式化し、事前分布からシミュレーションした大量の合成 SCM で MACE(Model-Averaged Causal Estimation)transformer neural process をメタ学習することで、テスト時に因果探索・統計検定を一切行わずに単一フォワードパスで根本原因ノード集合を推定する手法を提案する。サンプル方向(観測/介入)・ノード方向の交互アテンションで観測分布と異常分布の差分 $\Delta = \bar H^{int} - \bar H^{obs}$ を暗黙的に符号化し、最大100変数のシステムに対して17ms(A100 GPU)の一定推論時間でゼロショット推論を実現する(既存の因果探索ベース手法がノード数に対して指数的にスケールするのと対照的)。合成データでの識別可能性実験では、観測データのみからは因果グラフが非識別な設定でも根本原因を正しく特定できることを実証し、Squires et al. の I-faithfulness を軸とした識別可能性理論(Appendix A.2)がグラフ $G$ 自体を一意に復元しなくても根本原因集合 $T$ を識別できることを裏付ける。実世界ベンチマーク PetShop・CausRCA では、グラフ非依存(graph-not-given)手法群の中でファインチューニング版 PRIM-FT が最高の Top-3 recall(平均0.65)・MAP@3(サブシステム平均0.77)を達成し、一部設定ではグラフ既知手法にも匹敵した。既存concept「因果推論ベースRCA」に、テスト時因果探索・統計検定を完全に排除する第三の設計軸という横断的知見を、「アモータイズド因果発見」に、グラフ復元ではなく下流タスク出力を直接予測するアモータイズド手法という新系譜を追記した。 - Sources (new): [[@2026__arXiv__PRIM - Meta-Learned Bayesian Root Cause Analysis]] - Entities (new): [[Anish Dhir]], [[Amadou Ba]], [[Marco Ruffini]], [[Bradley Eck]], [[Jonas Wahl]], [[Trinity College Dublin]], [[DFKI]], [[CausRCA]] - Entities (updated): [[Christopher Lohse]], [[PetShop]] - Concepts (updated): [[因果推論ベースRCA]], [[アモータイズド因果発見]] ## What's in a GitHub Star? Understanding Repository Starring Practices in a Social Coding Platform (2026-08-04) 「What's in a GitHub Star?」([[Hudson Borges]]・[[Marco Tulio Valente]]、[[Universidade Federal de Minas Gerais]]、arXiv 1811.07643、Elsevier 投稿版)は、GitHub のスター機能の実際の意味を、開発者906名分の2つの独立調査(スター動機調査791件・成長パターン認識調査115件)と上位5,000リポジトリの定量分析で実証した研究。スターは appreciation の表明(52.5%)・bookmark(51.1%)・利用実績(36.7%)の複合シグナルであり、73.0%の開発者が利用・貢献前にスター数を考慮する。定量分析では組織所有リポジトリが個人所有より多スター、age とは無相関(ρ=0.050)・commits と低相関(ρ=0.439)・contributors(ρ=0.502)/forks(ρ=0.558)と中程度相関。KSC クラスタリングにより Slow(58.2%)・Moderate(30.0%)・Fast(9.3%)・Viral(2.3%)の4スター成長パターンを抽出し、Random Forest による判別要因分析(MDA)では Age・Last Push・Issues が最も判別力の高い要因であることを特定した。開発者調査では Slow の主因は活動停滞(53.8%)、Viral の主因はソーシャルメディア拡散(72.7%、主に Hacker News)であることも判明。既存 wiki コーパス(AIOps/LLMインフラ中心)とは domain の異なる、実証的ソフトウェア工学・オープンソース研究の初の source。 - Sources (new): [[@2018__arXiv__What's in a GitHub Star? Understanding Repository Starring Practices in a Social Coding Platform]] - Entities (new): [[Hudson Borges]], [[Marco Tulio Valente]], [[Universidade Federal de Minas Gerais]] - Concepts (new): [[GitHub スター]] ## FlowLog: Byte-Level Flow Monitoring System in High-Throughput Networks (2026-08-04) FlowLog([[Long Chen]]・Mingwei Cui・Qiuheng Yin・Hanglong Lyu・Yisen Hong・[[Tong Yang]]・Yangyang Bai・Ziwei Zhao、Douyin Vision Company Ltd. / [[Peking University]]、IEEE Transactions on Networking Vol.34 2026)は、P4 プログラマブルゲートウェイ(P4GW)上で400Gbps級の本番トラフィックに対しサンプリングなしにバイトレベルのフローサイズを高精度推定する初のエンドツーエンドスケッチベース監視システムである。デバイスローカルの新規スケッチアルゴリズム ByteSketch(ビットシフトによる値圧縮+確率的補正で、CM Sketch がバイトレベル計測時に抱えるバケットオーバーフロー問題をアーキテクチャレベルで解消し、誤差上界の形式的証明を伴う)・KeyWatcher/KeyReceiver によるタグ方式のフローID・スケッチ統計同期(制御/データプレーンのクロック非同期とスイッチングサイクルのずれを解消)・Kafka+Flink のスキュー耐性解析サブシステム(フローIDとスケッチデータの極端なメモリ非対称性を利用したブロードキャスト型ジョブ割当+TTLベースjoin最適化)の3層構成を持つ。[[ByteDance]] データセンターに6ヶ月超・ピーク帯域400Gbpsで本番デプロイし、既存の sFlow ベース監視 Bytehunter・CMSketch・TowerSketch を精度(AAE/ARE で最大10倍)・効率の両面で上回った。CIC-IDS 2017・CAIDA 2019・MAWI の3公開データセットでも汎化性を確認し、Section VIII では PISA メタデータ分離・パイプラインステージ内での中間状態の生成消費同居・モジュール化デプロイ・BF false positive 対策等、本番運用から得た一般化可能な設計原則を報告する。既存 wiki コーパス(AIOps/LLMインフラ中心)とは domain の異なる、データセンターネットワーク計測の初の source として新設concept「バイトレベルスケッチ計測」を導入した。 - Sources (new): [[@2026__TON__FlowLog - Byte-Level Flow Monitoring System in High-Throughput Networks]] - Entities (new): [[Long Chen]], [[Tong Yang]] - Entities (updated): [[Peking University]], [[ByteDance]] - Concepts (new): [[バイトレベルスケッチ計測]] - Concepts (updated): [[時系列トラフィックパターン検知]] ## A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM (2026-08-04) PrismLLM(Shaoke Xi・ChonLam Lao・Boyi Jia・Jiaqi Gao(equal contribution)ほか、[[Alibaba Group]] / [[Harvard University]] / [[Shanghai Jiao Tong University]] / [[Zhejiang University]]、責任著者 [[Jingren Zhou]]、arXiv 2605.15617、査読中)は、本番規模クラスタへのアクセスを要さずに数千 GPU 規模の LLM 訓練挙動を数個の GPU で忠実にエミュレートするシステムを提案する。既存のシミュレーション手法(SimAI・Phantora 等)がモデル維持コストの増大と実挙動の乖離に悩み、縮小規模実験が並列化戦略・通信構造そのものを変えてしまう問題に対し、「関心のあるランクだけを物理 GPU で実行し、残りを論理的に維持する」選択的実行のアイデアを 2 フェーズ設計に具体化した。Phase 1(グラフ準備)ではコンテキストスイッチ実行により少数 GPU 上に多数の論理ランクを多重化し、通信点でブロックしたランクの状態を CPU へ退避しながら bare graph(構造)を収集、スライス単位のタイミング充填とスライス間キャリブレーション(依存関係に基づくタイムスタンプ整合)で大域的に整合した高忠実度グラフを再構成する。Phase 2(ハイブリッドエミュレーション)では選択ランクをサンドボックス GPU 上で実プログラムとして実行しつつ、残りを NCCL グループ削減・近傍プルーニングで最適化したアシスタント GPU 上の仮想ランクとしてリプレイし、ring/tree collective の数値的正しさを事前補正値で保証する。2,048-GPU テストベッド(Megatron-LM、Qwen3 MoE 235B〜1.01T)で反復時間誤差平均 0.58%・ピークメモリ誤差 0.01% 未満を達成し、8192 GPU クラスタを対象 GPU の 1% 未満(物理ノード32台)でエミュレート可能であることを実証、SimAI(平均誤差77.2%)・Phantora(12〜64%誤差)を大きく上回る精度を示した。既存 wiki コーパス(AIOps/障害診断中心の GPU クラスタ運用研究)とは異なる、性能予測・システムデバッグ手段としての「訓練エミュレーション」という新しい研究系譜を、新設concept「LLM訓練シミュレーション・エミュレーション」として導入した。 - Sources (new): [[@2026__arXiv__A Few GPUs, A Whole Lotta Scale]] - Entities (new): [[Shaoke Xi]] - Entities (updated): [[ChonLam Lao]], [[Jingren Zhou]], [[Alibaba Group]], [[Harvard University]], [[Shanghai Jiao Tong University]], [[Zhejiang University]], [[Megatron-LM]], [[NCCL]] - Concepts (new): [[LLM訓練シミュレーション・エミュレーション]] ## The PetShop Dataset — Finding Causes of Performance Issues across Microservices (2026-08-04) PetShop([[Mila Hardt]]・[[William R. Orchard]]・[[Patrick Blöbaum]]・[[Elke Kirschbaum]]・[[Shiva Prasad Kasiviswanathan]]、[[Amazon]] / [[University of Cambridge]]、CLeaR 2024、arXiv:2311.04806)は、AWS 公開デモのペットアダプションサイト(41 コンポーネント)に 68 件の性能障害を注入したマイクロサービス RCA ベンチマークデータセット [[PetShop]] を提案する論文。サービスマップ(AWS X-Ray トレース由来)・5 分間隔のレイテンシ/リクエスト数/可用性メトリクス・正解根本原因ラベルをセットで公開し、因果グラフ既知の手法(traversal・CIRCA・Counterfactual Attribution)と因果グラフ不要の手法(ε-Diagnosis・RCD・相関ランキング)を low/high/temporal の 3 トラフィックシナリオで横並び評価した。因果グラフ既知手法は top-3 recall で概ね優位だが、top-1 recall では単純な相関ランキングが全手法中最高となる逆転が生じ、Sock-shop で高性能だった手法が本データセットでは苦戦する例も確認された。正常期間データでも全手法が根本原因を「捏造」する(偽陽性を出す)ことを明示的に検証した点も特徴。既存 concept [[因果推論ベースRCA]]・[[RCA評価設計]]に、traversal/CIRCA/Counterfactual Attribution の実証比較・specificity 評価という横断的知見を追記した。 - Sources (new): [[@2024__CLeaR__The PetShop Dataset - Finding Causes of Performance Issues across Microservices]] - Entities (new): [[Mila Hardt]], [[William R. Orchard]], [[Patrick Blöbaum]], [[Elke Kirschbaum]], [[Shiva Prasad Kasiviswanathan]] - Entities (updated): [[PetShop]] - Concepts (updated): [[因果推論ベースRCA]], [[RCA評価設計]] ## Closing the Efficiency Gap: AI Datacenter Co-design Roadmap for Scalable Training of LLMs (2026-08-04) Calculon-MoE([[Jesmin Jahan Tithi]]、[[Intel]]、[[Hanjiang Wu]]・[[Joongun Park]]、[[Georgia Institute of Technology]]、[[Avishaii Abuhatzera]](Ex-Intel)、[[Fabrizio Petrini]]、[[Intel]]、[[Tushar Krishna]]、[[Georgia Institute of Technology]]、ICS '26、2026-07-06〜09 Belfast)は、dense LLM 専用の open-source Calculon フレームワークを [[Mixture-of-Experts]] 向けに拡張したデータセンター co-design 解析ツールを提案する論文。MoE ゲーティング(Linear_Expert_Projection→Select_TopK→SoftMax)・エキスパート並列(EP)・エキスパートシャーディング(ES)・動的 All-to-All 通信・SwiGLU 活性化を新規モデル化し、$DP_{non\text{-}MoE} \times TP \times PP = DP_{MoE} \times EP \times ES \times PP$ という制約下で MoE 部分と非 MoE 部分の並列化を独立に決定できるようにした。NVIDIA H100/H200 の 8〜128 GPU での検証(Mixtral-8×3B/8×7B)で平均予測誤差 4.6〜5.2% を達成し、これを用いて 65,536 GPU 規模までの co-design 感度分析を実施した。中心的な発見は、高基数・低直径の全光配線(CPO)による FullFlat トポロジが、スケールアップ(SU)/スケールアウト(SO)帯域幅を均等化することで、上位 5,000 パラメータ構成間の性能ギャップを TwoTier ネットワークの最大 70% から 13% 以下に縮小し、GPT4-1.8T/29T 級 MoE モデルを 12〜20 倍高速化し、30〜50% の電力削減も見込めるという点。HBD(高帯域ドメイン)サイズは 1024・HBM 容量は 1.3TB/GPU を co-design 目標値として提示。また EP=#Experts・ES=TP というフレームワーク既定の慣習から外れる decoupled parallelism が GPT4-1.8T の MFU を 75.96%→83.66% に改善することも実証し、計算通信オーバーラップ・ハードウェアアクセラレーテッド集合通信(SHARP)の欠如による性能劣化は通信比率の低い密モデル(GPT3-175B)の方が MoE より深刻(最大 43%/29%)であるという直感に反する結果も示した。既存 concept [[AIデータセンタートポロジ]]・[[Mixture-of-Experts]]・[[並列化戦略]]・[[集合通信]]の全てに横断的知見を追記した初の datacenter co-design 解析ツール論文。 - Sources (new): [[@2026__ICS__Closing the Efficiency Gap - AI Datacenter Co-design Roadmap for Scalable Training of LLMs]] - Entities (new): [[Jesmin Jahan Tithi]], [[Hanjiang Wu]], [[Joongun Park]], [[Avishaii Abuhatzera]], [[Fabrizio Petrini]], [[Calculon-MoE]] - Entities (updated): [[Tushar Krishna]], [[Intel]], [[Georgia Institute of Technology]] - Concepts (updated): [[AIデータセンタートポロジ]], [[Mixture-of-Experts]], [[並列化戦略]], [[集合通信]] ## gPooling: An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters (2026-08-04) gPooling([[Kaicheng Guo]]・[[Jingyi Chen]]・[[Chen Chen]]・[[Yun Wang]]・[[Pengwei Du]]・[[Zhengwei Qi]]・[[Haibing Guan]]、[[Shanghai Jiao Tong University]] / [[Huawei Technologies]]、IEEE Transactions on Parallel and Distributed Systems Vol.37 No.10 2026)は、大学 GPU クラスタの90日トレースで GPU 利用率25%未満と滞留ジョブ200件超が共存するという逆説を動機に、ドライバレベルのカーネルハイジャックで弾力的な vGPU/vNPU を作る [[GPUプーリング]] フレームワーク [[gPooling]] を提案する論文。コンピュート仮想化(チャネルベースの時分割多重+利用率フィードバックによる動的時間量子調整)とメモリ制御(cudaMalloc/cuMemAlloc 傍受による per-vGPU クォータ強制)を分離した設計により、CUDA レイヤーより下で正確なプリエンプションと低オーバーヘッドを両立し、NVIDIA GPU と Huawei Ascend NPU を統一アーキテクチャで扱う。Slurm には SPANK プラグイン経由でソースコード・ユーザースクリプト無改変のまま GRES として統合される。6週間の本番デプロイでキュー圧力を平均5.3倍・ピーク7.2倍低減し、ジョブ待ち時間中央値を125分から23分へ5.4倍改善した。コンピュートパーティショニング精度評価では、1%という極端な低クォータ構成で既存業界ソリューション以上のオーバーシュート(約300% vs 約200%)を示す限界も確認された。新設 concept「GPUプーリング」の初出ソースであり、既存 concept [[GPUクラスタスケジューリング]] に「割り当て粒度自体を可変にする」という横断的知見を追記した。 - Sources (new): [[@2026__IEEE TPDS__gPooling - An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters]] - Entities (new): [[Kaicheng Guo]], [[Jingyi Chen]], [[Chen Chen]], [[Yun Wang]], [[Pengwei Du]], [[Zhengwei Qi]], [[Haibing Guan]], [[gPooling]] - Entities (updated): [[Shanghai Jiao Tong University]], [[Huawei Technologies]] - Concepts (new): [[GPUプーリング]] - Concepts (updated): [[GPUクラスタスケジューリング]] ## SPPO: Making Million-Token LLM Training Practical on Modest GPU Clusters (2026-08-04) SPPO(qiaoling chen・[[Shenggui Li]]・[[Wei Gao]]・[[Peng Sun]]・[[Yonggang Wen]]・[[Tianwei Zhang]]、[[Nanyang Technological University]] / [[Hong Kong University of Science and Technology]] / [[Shanghai AI Laboratory]]、ICS '26、arXiv:2503.10377)は、長系列 LLM 訓練の既存最適化(活性化再計算・CPU オフロード・分散並列化)が系列を分割不可能な単一ブロックとして扱う「粒度ミスマッチ」を共通の根本原因として指摘し、部分系列(subsequence)単位の適応的オフロードと適応的パイプラインスケジューリングを組み合わせた Adaptive Sequence Pipeline Parallel Offloading(SPPO)を提案する論文。sequence-aware offloading・2レベル活性化管理(アクセス頻度に応じて GPU 残置/CPU オフロードを分離)・部分系列数・パイプライン段数・シーケンス並列度を同時決定するヒューリスティックソルバー・バブル隣接部分系列に局所適用する多重化系列分割(multiplexing sequence partitioning)の4要素で構成する。128台の NVIDIA Ampere GPU のみで 7B パラメータ LLM を最大400万トークンの系列長で訓練可能にし、Megatron-LM・DeepSpeed-Ulysses・TeraPipe 比で最大3.38倍のスループット改善、GPT-65B で128 GPU 時に Megatron-Tuned 比88%上回る最大系列長スケーラビリティ(4倍 vs 2.13倍)を実証した。新設 concept「アクティベーションオフロード」の初出ソースであり、既存 concept [[パイプライン並列化]]・[[シーケンス並列化]]・[[並列化戦略]] に「分割粒度自体を最適化する」という横断的知見を追記した。 - Sources (new): [[@2026__ICS__SPPO - Making Million-Token LLM Training Practical on Modest GPU Clusters]] - Entities (new): [[qiaoling chen]], [[Shenggui Li]], [[Wei Gao]] - Entities (updated): [[Peng Sun]], [[Tianwei Zhang]], [[Yonggang Wen]], [[Nanyang Technological University]], [[Hong Kong University of Science and Technology]], [[Shanghai AI Laboratory]], [[Megatron-LM]], [[DeepSpeed]] - Concepts (new): [[アクティベーションオフロード]] - Concepts (updated): [[パイプライン並列化]], [[シーケンス並列化]], [[並列化戦略]] ## KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes (2026-08-04) KernelDiag(Weijing Wang・[[Dong Wang (Tianjin University)|Dong Wang]]・[[Haichi Wang]]・[[Junjie Chen]]・[[Zan Wang]]、[[Tianjin University]] School of Computer Software、arXiv:2607.17722)は、Linux カーネルクラッシュの根本原因診断を対象とする初のエージェントベースフレームワークを提案する論文。syscall・ログ・crash report という異種の診断アーティファクトを Syscall Agent・Log Agent・Report Agent という役割特化型エージェントでそれぞれ解析し、ロギングマクロの backward reachability による静的解決(Log-to-Code Mapping)、Semantic Function Introspection(オンデマンドの関数/マクロ/構造体索引)、Environment-Aware Semantic Pruning(カーネル `.config` に基づく実行不可能分岐の除外)を通じてカーネルソースを反復探索し、スキーマ検証済みの Evidence Graph に因果依存関係を段階的に組織化する。File-level → Method-level の2段階局所化エージェントと Explanation Agent により、因果起源を優先した箇所特定と伝播説明を end-to-end で行う。実世界ベンチマーク KGYM(279件、72サブシステム)で唯一の既存カーネル特化手法 [[LinuxFL+]] と汎用 SOTA [[Agentless]] をファイルレベル Top@1 65.95%(+27.78%/+31.43%)・メソッドレベル Top@1 33.33%(+24.09%〜+34.21%)で上回り、明示的ヒントのない設定では Top@10 で最大4倍・2倍の相対改善を達成。crash report 除去が最大の性能低下(-63.04%/-78.49%)をもたらすアブレーション、2025年3月以降の50件のポストリリースデータセットによるデータリーク耐性検証、DeepSeek-V3/Qwen3-Max 両バックエンドでの汎化も実証した。新設 concept「カーネル障害診断」の初出ソースであり、既存 concept [[Fault Localization]] に「カーネル領域では信号源の抽象度自体が数段階下がる」という横断的知見を追記した。 - Sources (new): [[@2026__arXiv__KernelDiag - Agent-Based Root Cause Diagnosis for Kernel Crashes]] - Entities (new): [[Haichi Wang]], [[Zan Wang]], [[Dong Wang (Tianjin University)]], [[KGYM]], [[LinuxFL+]], [[Agentless]] - Entities (updated): [[Weijing Wang]], [[Junjie Chen]], [[Tianjin University]], [[Dong Wang]] - Concepts (new): [[カーネル障害診断]] - Concepts (updated): [[Fault Localization]], [[エージェント型コーディング]] ## Exploring LLM-Based Agents for Root Cause Analysis (2026-08-04) [[@2024__FSE Companion__Exploring LLM-Based Agents for Root Cause Analysis]]([[Devjeet Roy]]([[Washington State University]]、[[Microsoft]] インターンシップ中)・[[Xuchao Zhang]]・[[Rashi Bhave]]・[[Chetan Bansal]]・[[Pedro Las-Casas]]・[[Rodrigo Fonseca]]・[[Saravan Rajmohan]]、[[Microsoft]]、FSE Companion '24)は、クラウドインシデント管理向け RCA に [[ReAct]] エージェントを適用した最初期の実証研究の一つ。ファインチューニング・few-shot なしのゼロショット設定で、Microsoft の 107,000 件本番インシデントデータセットから RQ1・RQ2(一般化ツール:リトリーバル+インシデント記述 QA)と RQ3(Azure Fundamental Team との実運用ケーススタディ:データベースクエリツール・KBA Q/A ツール・KBA Planning Tool・Human Interaction Tool)の 2 段構成で評価した。自動評価指標では Retrieval Baseline・CoT と意味的類似度が同等かやや劣るが、人手定性評価ではハルシネーション率が最低(不正解の 6% のみ vs Retrieval Baseline 49%・CoT 18%)。discussion comments のリトリーバルコーパスへの追加は RCA 性能を明確には改善しない。ケーススタディでは KBA(トラブルシューティングガイド)へのアクセスが単純インシデントの自律解決の鍵であり、複数 KBA にまたがる複雑インシデントでは反復試行の仕組みが必要になることを示した。既存 concept [[ReAct]]・[[LLMによる根本原因分析]]・[[根本原因分析]]に、RCAgent・mABC に先行する最初期の ReAct-for-RCA 実証・KBA という外部知識制約の新実例・人間介在ツールという新しいハルシネーション緩和パターンを追記した。 - Sources (new): [[@2024__FSE Companion__Exploring LLM-Based Agents for Root Cause Analysis]] - Entities (new): [[Devjeet Roy]], [[Rashi Bhave]], [[Washington State University]] - Entities (updated): [[Xuchao Zhang]], [[Chetan Bansal]], [[Pedro Las-Casas]], [[Rodrigo Fonseca]], [[Saravan Rajmohan]], [[Microsoft]], [[LangChain]] - Concepts (updated): [[ReAct]], [[LLMによる根本原因分析]], [[根本原因分析]] ## Explainable Artificial Intelligence in Software Engineering: Current Trends, Gaps, and Future Directions (2026-08-04) [[@2026__ACCESS__Explainable Artificial Intelligence in Software Engineering Current Trends, Gaps, and Future Directions]]([[Adam Khan]]・[[Asad Ali]]・[[Muhammad Ismail Mohmand]]・[[Mahdi Zareei]]・[[Rajesh Roshan Biswal]]、[[Tecnologico de Monterrey]] ほか、IEEE Access Vol.14 2026、DOI:10.1109/ACCESS.2026.3679576)は、2020年3月〜2024年4月に発表されたXAI関連SE研究29件を対象とするシステマティックリテラチャーレビュー(SLR)。Kitchenhamのガイドラインに従い、(1)説明タイプ(局所/大域/ハイブリッド)、(2)局所説明用XAIツール、(3)MLライブラリ、(4)XAI適用先SEサブ領域、(5)先行SLR(Mohammadkhani et al. 2023)との比較、という5つのRQで構成する。SEでは局所説明が86.20%を占め大域説明単独の研究は皆無、局所説明ツールはLIME(65.5%)がSHAP(44.3%)を上回るが、補助的に調査した金融(SHAP 93.3%)・ヘルスケア(SHAP 73.3%)ではSHAPが優勢という逆転構造を報告した。MLライブラリはscikit-learnが最多(37.9%)だが58.6%が未記載で再現性に課題があり、XAI適用先はソフトウェア欠陥予測に集中(本文82.20%、Figure 16では25/29≈86.2%と内的に不一致)し、コードスメル検知・工数見積り・ソフトウェアテスト・CI/CDは手薄なままであることを指摘した。既存concept [[帰属手法]]に、SE・金融・ヘルスケア横断でのLIME/SHAP選好の逆転構造とMLライブラリ報告の不透明性という横断的知見を追記した。 - Sources (new): [[@2026__ACCESS__Explainable Artificial Intelligence in Software Engineering Current Trends, Gaps, and Future Directions]] - Entities (new): [[Adam Khan]], [[Asad Ali]], [[Muhammad Ismail Mohmand]], [[Mahdi Zareei]], [[Rajesh Roshan Biswal]], [[Tecnologico de Monterrey]] - Concepts (updated): [[帰属手法]] ## SWIM: Scalable Weakly-consistent Infection-style Process Group Membership Protocol (2026-08-04) [[@2002__DSN__SWIM - Scalable Weakly-consistent Infection-style Process Group Membership Protocol]](Abhinandan Das・[[Indranil Gupta]]・[[Ashish Motivala]]、[[Cornell University]] Dept. of Computer Science、DSN 2002、DOI:10.1109/DSN.2002.1028914)は、分散プロセスグループ向け弱一貫性メンバーシッププロトコル SWIM の古典的論文。障害検知(ランダム化間接プロービング: ping/ping-req/ack)とメンバーシップ更新伝播(ping/ack へのピギーバックのみで行う感染様式ディセミネーション)を明確に分離することで、全対全ハートビート方式のメッセージ負荷のグループサイズに対する二次的増大を回避し、メンバーあたりのメッセージ負荷(実測約2.0メッセージ/周期)と障害検知時間をグループサイズ非依存の定数に保つことを56メンバーまでのプロトタイプ実験で実証した。Suspicion サブプロトコル(仮想 incarnation number 付き Alive/Suspect/Confirm 優先順位)で誤検知頻度を低減し、Round-Robin プローブ対象選択で決定的な検知時間上界(2Nプロトコル周期、Time Bounded Completeness)を保証する。10%パケット損失下の実験では SWIM+Inf.+Susp. が安定して12メンバーに到達したのに対し SWIM:Basic は2メンバー、SWIM+Inf. は4メンバーで頭打ちとなり、Suspicion メカニズムの効果を直接示した。既存 concept [[ゴシッププロトコル]] に、Cassandra/Dynamo のアンチエントロピー型ゴシップ(全状態ダイジェストの定期交換)とは異なる「専用メッセージを生成せず障害検知メッセージにのみ相乗りする」伝播系統としての横断的知見と、Φ累積障害検知器(連続値スコア)とSuspicionサブプロトコル(離散状態遷移+仮想incarnation number)の設計比較を追記した。 - Sources (new): [[@2002__DSN__SWIM - Scalable Weakly-consistent Infection-style Process Group Membership Protocol]] - Entities (new): [[Abhinandan Das]], [[Ashish Motivala]] - Entities (updated): [[Indranil Gupta]], [[Cornell University]] - Concepts (updated): [[ゴシッププロトコル]] ## NIXT: A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training (2026-08-04) [[@2026__arXiv__NIXT - A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training]]([[Ziyang Jia]]・[[Sirshak Das]]・[[Jason Sewall]]・[[Laxmi Bhuyan]]・[[Pasha Shamis]]・[[Daniel Wong]]、[[University of California, Riverside]] / [[NVIDIA]]、arXiv:2608.01449、2026-08-02)は、NCCL 2.28 に同梱される公式プロファイラプラグイン NCCL Inspector の生ログを DuckDB ベースの型付き列指向スキーマへ変換し(26 倍のログ削減)、要約統計・時間的/空間的/資源的/その他の相関分析プリミティブで集団通信の観測性を高めるエクスポータツール [[NIXT]] を提案する。Nemotron-4 15B/340B(最大 2,048 H100 GPU)の実運用事前訓練トレースで、ReduceScatter+AllGather が通信量の 99.7% を占め NIC-only 経路が全転送バイトの 70.4% を占めること、本番訓練の帯域変動係数(CV)が nccl-tests での孤立再現実験より 2〜5 倍大きく ML フレームワークが変動の一因であること、空間相関分析でストラグラーを特定ホストへ帯域 3〜4 倍低下・CV 4〜8 倍増加として局所化できることを実証した。NCCL Inspector プロファイリング自体のオーバーヘッドは全スケールで 2% 未満。既存 concept [[集合通信]]・[[ストラグラー]] に、NCCL 本体への計装追加を必要としない非侵襲的な観測手段としての横断的知見を追記した。 - Sources (new): [[@2026__arXiv__NIXT - A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training]] - Entities (new): [[Ziyang Jia]], [[Daniel Wong]], [[Laxmi Bhuyan]], [[Sirshak Das]], [[Jason Sewall]], [[Pasha Shamis]], [[University of California, Riverside]], [[NIXT]] - Entities (updated): [[NCCL]] - Concepts (updated): [[集合通信]], [[ストラグラー]] ## GPU-Initiated Networking for NCCL (2026-08-04) [[@2025__arXiv__GPU-Initiated Networking for NCCL]](Khaled Hamidouche・John Bachan・Pak Markthub・Peter-Jan Gootzen・Elena Agostini・Sylvain Jeaugey・Aamir Shafi・Georgios Theodorakis・Manjunath Gorentla Venkata、全員 [[NVIDIA]] Corporation、arXiv:2511.15076、2025-11-19投稿)は、NCCL 2.28 の Device API のうち、ネットワーク越し RDMA を担う GPU-Initiated Networking(GIN)を解説する論文。NCCL Device API は LSA(NVLink/PCIe のロード/ストアアクセス)・Multimem(NVLink SHARP マルチキャスト)・GIN(ネットワーク RDMA)の3操作モードを提供し、GIN は3層アーキテクチャ(NCCL Core・Device GIN API・GIN Network Plugin)で構成され、GDAKI(DOCA GPUNetIO による直接 GPU-to-NIC 通信)と Proxy(ロックフリー GPU-to-CPU キュー)の二重バックエンドを持つ。GDAKI は小メッセージで16.7µsの往復レイテンシを達成し NVSHMEM IBRC(16.0µs)に匹敵、NVSHMEM IBGDA(24.3µs)を上回る。MoE 通信ライブラリ [[DeepEP]] への統合により、High-Throughput・Low-Latency 両カーネルで NVSHMEM/IBGDA ベースの既存実装と同等の性能(帯域差1〜3%程度)を達成した。新設 concept [[GPU起動型ネットワーキング]] の初出ソースであり、既存 concept [[集合通信]] に「GIN は集団通信とは別カテゴリの one-sided デバイス起動通信を並走させる」という横断的知見を、[[RDMA]] に「GPU起動型利用はデバイスアクセス可能な制御構造を持つ NIC という新しいハードウェア互換性軸を課す」という横断的知見を追記した。図表3点(GIN の3操作モード、NCCL Device API と従来 NCCL の比較、GIN 内部アーキテクチャ)を埋め込んだ。 - Sources (new): [[@2025__arXiv__GPU-Initiated Networking for NCCL]] - Entities (updated): [[NCCL]], [[DeepEP]], [[NVIDIA]] - Concepts (new): [[GPU起動型ネットワーキング]] - Concepts (updated): [[集合通信]], [[RDMA]] ## The Landscape of GPU-Centric Communication (2026-08-04) [[@2026__CSUR__The Landscape of GPU-Centric Communication]]([[Didem Unat]]・[[Ilyas Turimbetov]]・[[Mohammed Issa]]・[[Dogan Sagbili]]・[[Ismayil Ismayilov]]、[[Koç University]]、[[Flavio Vella]]、[[University of Trento]]、[[Daniele De Sensi]]、[[Sapienza University of Rome]]、ACM Computing Surveys Vol.58 No.12 Article 322、DOI:10.1145/3813799、2026年6月)は、CPU がマルチ GPU 通信を管理する従来モデルから GPU 自身が通信を自律制御する GPU 中心通信への移行を、ベンダー機構(GPUDirect・NVLink/NVSwitch等)とユーザーレベル通信ライブラリ(GPU-Aware MPI・GPUCCL・GPUSHMEM)の両面から整理したサーベイ。ノード内通信を Host Native/Host-Controlled/Device Native/Host Fallback の4型、ノード間通信を Host Native/Pinned Host Native/GPU RDMA/GPU-Triggered/Device Native の5型に分類する統一 taxonomy を提示し(Table 1・2、Figure 1・2)、GPUDirect(1.0/2.0/RDMA/Async)と NVLink/NVSwitch の進化をタイムライン化(Figure 3)、NCCL/RCCL/oneCCL の実行モデルの質的差異(Table 3、GPU カーネル完全自律駆動 vs CPU ワーカー駆動)と NVSHMEM/ROC_SHMEM/Intel SHMEM の GPU-NIC メモリ一貫性の扱いの差を体系的に整理した。CPU-free networking・コレクティブアルゴリズム設計・デバッグ/プロファイリング/ベンチマークツールの不足・圧縮加速通信を今後の研究課題として挙げる。既存 concept [[RDMA]] にノード間通信5分類の中での GPUDirect RDMA の位置づけとカーネル境界一貫性制約を、[[GPU起動型ネットワーキング]] に Device Native という最終段階としての体系的位置づけと ROC_SHMEM の先行的一貫性保証を、[[集合通信]] に NCCL/RCCL/oneCCL の実行モデル差異を横断的知見として追記した。図表5点(ノード内/ノード間通信のデータパス図、NVIDIA 技術タイムライン、RDMA 指向ソフトウェアスタック、通信ライブラリ間相互作用図)はいずれも pdf.js の埋め込み画像抽出が0件だったため、PyMuPDF によるベクター図クロップで埋め込んだ。 - Sources (new): [[@2026__CSUR__The Landscape of GPU-Centric Communication]] - Entities (new): [[Koç University]], [[Didem Unat]], [[Ilyas Turimbetov]], [[Mohammed Issa]], [[Dogan Sagbili]], [[Ismayil Ismayilov]] - Entities (updated): [[Flavio Vella]], [[Daniele De Sensi]], [[University of Trento]], [[NCCL]] - Concepts (updated): [[RDMA]], [[GPU起動型ネットワーキング]], [[集合通信]] ## 情報科学における18のメタテクニック (2026-08-08) [[@2015__SlideShare__情報科学における18のメタテクニック]]([[中野淳]]、[[金沢工業大学]]、2015-04-30)は、コンピュータアーキテクチャ・OS・分散システム・データベース・ネットワークを横断して繰り返し現れる18の基本技法(キャッシング・パイプライニング・投機的実行・条件の緩和・並列化・結合vs分離・仮想化・トランザクション等)を、着想と代表例の対で整理したスライド資料。SlideShare のボット対策で PDF 原本を取得できず、CDN 上の個別スライド画像(638×478px、24枚)を代替原本として取り込んだ。新設 concept [[メタテクニック(情報科学)]] にこの分類枠組みを集約し、既存 concept([[メモリ階層とキャッシュ]]・[[パイプライン処理]]・[[コンテナ仮想化]]・[[分散トランザクション]]・[[クォーラムベースレプリケーション]])へは単一ソースの浅い言及にとどまるため発見性のための一方向リンクのみとした。 - Sources (new): [[@2015__SlideShare__情報科学における18のメタテクニック]] - Entities (new): [[中野淳]], [[金沢工業大学]] - Concepts (new): [[メタテクニック(情報科学)]] ## A Taxonomy of Performance Metrics for the Distributed Computing Continuum (2026-08-08) [[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]](Praveen Kumar Donta([[Stockholm University]])・[[Boris Sedlak]]・Alfreds Lapkovskis・Alaa Saleh([[University of Helsinki]])・Ying Li([[Northeastern University]])・[[Víctor Casamayor Pujol]]・Ilir Murturi・Manuel Otero Barbasan・[[Schahram Dustdar]]([[TU Wien]]/ICREA)、arXiv:2607.28407、2026-07-30)は、分散コンピューティングコンティニュウムシステム(DCCS)の性能メトリクスを computing-level・network-level・application/user-level の3階層に分類し、さらにAI/LLM時代の要請に応じた新興メトリクス群(CO2排出量・熱放散・観測可能性・適応性指数・データ局所性指数・コンティニュウム断片化指数・移行安定性指数・信頼性スコア等15個)を加えたタクソノミー論文。各メトリクスに数式定義を与えるだけでなく、取得範囲(Single-Node/Multi-Node/Full System/Full App)・取得フェーズ(Operational/Experimental)・取得手法(Standard/Custom/Experimental Instrumentation)の3次元でメトリクス取得の実装可能性を体系的に整理する点が特徴。独自実験は行わない理論的サーベイであり、著者ら自身が将来課題として実装検証用シミュレータの構築を挙げている。新設 concept [[分散コンピューティングコンティニュウム]] の初出ソース。既存 concept [[性能測定]]・[[Edge Computing]] に横断的知見を追記した。 - Sources (new): [[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]] - Entities (new): [[Alfreds Lapkovskis]], [[Alaa Saleh]], [[Ying Li (Northeastern University)]], [[Ilir Murturi]], [[Manuel Otero Barbasan]], [[Stockholm University]], [[Universitat Pompeu Fabra]], [[University of Prishtina]], [[Universidad de Sevilla]] - Entities (updated): [[Praveen Kumar Donta]], [[Boris Sedlak]], [[Schahram Dustdar]], [[Víctor Casamayor Pujol]], [[University of Helsinki]], [[Northeastern University]], [[TU Wien]] - Concepts (new): [[分散コンピューティングコンティニュウム]] - Concepts (updated): [[性能測定]], [[Edge Computing]] ## R2aft: A Speedy and Highly Available RDMA-Based Consensus Protocol (2026-08-08) [[@2026__TPDS__R2aft - A Speedy and Highly Available RDMA-Based Consensus Protocol]]([[Zhiyuan Dong]]・[[Haitao Song]]・[[Zhaoguo Wang]]、[[Shanghai Jiao Tong University]] Institute of Parallel and Distributed Systems / Shanghai Artificial Intelligence Research Institute、IEEE Transactions on Parallel and Distributed Systems Vol.37 No.7、DOI:10.1109/TPDS.2026.3679987、2026-04-03公開)は、RDMA のプロセッサバイパス特性(RNIC がネットワークスタックをオフロードし CPU を介さずリモートメモリへアクセスできる特性)を利用して、プロセッサ障害とサーバ全体の障害を切り離す「細粒度障害モデル」をリーダー選出とログ複製の両方に完全適用した、初の RDMA ベース Raft 派生合意プロトコル R2aft を提案する。既存の RDMA ベース合意プロトコル(Dare・Sift・Protected Memory Paxos・Mu)はログ複製では細粒度障害モデルを利用できるが、stale リーダーのアクセス権限剥奪にリモートプロセッサを要するためリーダー選出では利用できないという非対称性を抱えていた。R2aft は Single Writer Multiple Reader Region(サーバごとに書き込み可能な領域を固定し他サーバは読み取り専用にする)という構造的制約と、Write-Read-Verify アプローチ(書き込み→読み取り→検証の順序転換により排他制御なしで競合状態を防ぐ)によりこれを解消する。YCSB ベンチマークで最先端の RDMA ベース合意プロトコル Mu に対し 12.2% のレイテンシオーバーヘッドで同等のスループットを達成し、3 サーバ構成でリーダーのプロセッサのみが故障した極端なケースでも、粗粒度障害モデルに基づく Raft・Dare・Mu が完全停止する一方 R2aft のみが動作を継続できることを実証した。新設 concept [[分散合意プロトコル]] の初出ソース。既存 concept [[RDMA]] に、プロセッサバイパスを可用性の観点(障害モデルの粒度)から再解釈する横断的知見を追記した。図表6点(strawman 反例・アーキテクチャ概観・データレイアウト・レイテンシ比較・スループット比較・故障回復スループット推移)を、ベクター図は PyMuPDF によるキャプション座標クロップで埋め込んだ。 - Sources (new): [[@2026__TPDS__R2aft - A Speedy and Highly Available RDMA-Based Consensus Protocol]] - Entities (new): [[Zhiyuan Dong]], [[Haitao Song]], [[Zhaoguo Wang]], [[Shanghai Artificial Intelligence Research Institute]] - Entities (updated): [[Shanghai Jiao Tong University]], [[Institute of Parallel and Distributed Systems]] - Concepts (new): [[分散合意プロトコル]] - Concepts (updated): [[RDMA]] ## From Causal Discovery to Dynamic Causal Inference in Neural Time Series (2026-08-09) [[@2026__KDD__From Causal Discovery to Dynamic Causal Inference in Neural Time Series]]([[Dmitry Zaytsev]]・[[Valentina V. Kuskova]]・[[Michael Coppedge]]、[[University of Notre Dame]]、KDD '26、DOI:10.1145/3770855.3818956)は、因果構造が未知・不確実な設定での動的因果推論を可能にする二段階フレームワーク DCNAR(Dynamic Causal Network Autoregression)を提案する。第一段階でニューラル加法自己回帰因果発見(NAVAR)により疎な有向因果ネットワークをデータから学習し、第二段階でこれを構造事前分布として時変ネットワーク自己回帰(tvNAR)の動的推定を制約する。学習構造は最終的な推論対象ではなく、下流の因果的挙動(インパルス応答・反実仮想軌道)を通じて間接的に検証される反証可能な構造仮説として扱われる点が特徴。[[V-Dem (Varieties of Democracy)]] の139カ国×35年パネルで、Ridge VAR・TV-VAR・LSTM(MC Dropout)と同等の予測分布精度を保ちつつ、滑らかで符号一貫性のあるインパルス応答と有界・解釈可能な反実仮想軌道を生成することを示した。アーキテクチャアブレーションでは、NAVAR による学習構造を線形VAR由来の構造に置換するとCRPSが14.5%悪化し、ショック持続性を系統的に過大評価するIRFを生じることを確認した。DYNOTEARS等の非巡回性制約付き手法は、フィードバックループが研究対象そのものである民主主義制度システムでは実質的に不適切として意図的に不採用とされている。新設 concept [[動的因果推論]] の初出ソース。既存 concept [[因果発見]] に、発見結果を下流動的推論の構造事前分布として再利用する視点を横断的知見として追記した。 - Sources (new): [[@2026__KDD__From Causal Discovery to Dynamic Causal Inference in Neural Time Series]] - Entities (new): [[Dmitry Zaytsev]], [[Valentina V. Kuskova]], [[Michael Coppedge]], [[University of Notre Dame]], [[V-Dem (Varieties of Democracy)]] - Concepts (new): [[動的因果推論]] - Concepts (updated): [[因果発見]] ## MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production (2026-08-09) [[@2026__EuroSys__MegaScale-Omni - A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production]](Chunyu Xue([[Shanghai Jiao Tong University]])・Yangrui Chen・Jianyu Jiang ほか([[ByteDance Seed]])、EuroSys '26、DOI:10.1145/3767295.3803587、2026-04-27〜30 Edinburgh)は、マルチモーダル大規模言語モデル(MLLM)訓練における encoder-LLM 間の動的ワークロード不均衡を解決する産業グレードシステム。encoder(long-short sequence parallelism)と LLM バックボーン(full-fledged 5D parallelism)の並列化戦略を分離しつつ、EncoderAnchor という統一表現で同一GPU集合上にコロケーションし、on-demand insertion による workload-resilient pipeline で時間的に協調オーケストレーションする「encoder-LLM multiplexing」を提案する。decentralized grouped reordering(データロード)・adaptive sample sharding + symmetric dispatching(リシャーディング)によるワークロードバランシングも実装。4つの最先端ベースライン(Megatron-LM・Megatron-Dist・AutoParallel・Optimus)に対し本番相当の動的マルチモーダルワークロード下で1.27×〜7.57×のスループット改善を達成し、数千GPU規模の社内本番環境に展開されている。既存 concept [[並列化戦略]]・[[LLM分散学習]] に、単一モデルでなく複数サブモデル間の時間多重化コロケーションという新しい decoupling の形と、実運用/静的合成ワークロード間の17% MFUギャップという横断的知見を追記した。 - Sources (new): [[@2026__EuroSys__MegaScale-Omni - A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production]] - Entities (updated): [[ByteDance Seed]], [[Shanghai Jiao Tong University]], [[Quan Chen]], [[Yanghua Peng]], [[Xin Liu]] - Concepts (updated): [[並列化戦略]], [[LLM分散学習]] ## Agentic Coding in the Wild: Characterizing GitHub Copilot at Production Scale (2026-08-09) [[@2026__arXiv__Agentic Coding in the Wild - Characterizing GitHub Copilot at Production Scale]](Banruo Liu([[University of Illinois Urbana-Champaign]])・Haoran Qiu・[[Íñigo Goiri]]・[[Rodrigo Fonseca]]・[[Ricardo Bianchini]]・[[Esha Choukse]]([[Microsoft Azure]] Research)、arXiv:2608.00101、2026-07-30)は、GitHub Copilot コーディングエージェントの匿名化テレメトリ(2026年6月第1週、320万ユーザー・1,350万セッション・7.6億LLM呼び出し・95兆トークン・7.75億ツール呼び出し)を用いた初の本番規模ワークロード特性化。エージェント実行は LLM 呼び出しの 87% が自律継続で発生しツール呼び出しとほぼ 1:1 で結合するタイトな構造を持ち、6 種類のワークフローアーキタイプ(Deep-loop read 30.5%・LLM-only 20.2%・Multi-cycle edit 19.0% 等)に分岐する。KV キャッシュヒット率はターン内で平均90%に達するが、ターン境界で55%(-26pt)、モデル切替直後で8%(-67pt)へ系統的に劣化し、コンテキスト圧縮(セッションの7.8%で発生、発火時トークン72.8%・キャッシュヒット率66.1%を喪失)も同格の第3の構造イベントとして機能する。ツール失敗はターンの9%で発生し自律リトライループを誘発して計算量を最大4倍に増幅する。ユーザーは5アーキタイプ(Readers・Coders・Terminal users・Deep-loop users・Chat-only users)に分かれターンあたりトークン消費で50倍の開きを持つ。ターン境界を signal とする軽量アイドル時間予測器(LightGBM、12分位点、推論3ms未満)は全アイドル時間の86〜90%を捕捉する。既存 concept [[エージェント型コーディング]]・[[KVキャッシュ管理]] に、本番トレースに基づく構造イベント別キャッシュ劣化の定量値とワークフローアーキタイプの多様性を横断的知見として追記した。 - Sources (new): [[@2026__arXiv__Agentic Coding in the Wild - Characterizing GitHub Copilot at Production Scale]] - Entities (new): [[Banruo Liu]], [[Haoran Qiu]], [[Íñigo Goiri]], [[Ricardo Bianchini]], [[Esha Choukse]], [[University of Illinois Urbana-Champaign]] - Entities (updated): [[Rodrigo Fonseca]] - Concepts (updated): [[エージェント型コーディング]], [[KVキャッシュ管理]] ## TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference (2026-08-09) [[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]]([[Ruilin Xu]]・[[Junyi Li]]・[[Pengfei Chen]]・[[Zongxuan Xie]]、[[Sun Yat-sen University]]、ASE '26、arXiv:2608.01975、2026-08-03)は、モデルバイナリを変更せずに NVTX/CUPTI で LLM 推論のエンジン・CUDA ランタイム・GPU カーネル・通信・ログを横断トレースし、リクエスト単位のコールチェーンを再構成して根本原因分析を行う非侵入フレームワーク TELLER を提案する。依存関係考慮型の causal-context slice(親子構造・時間近接・通信結合を保持)と、Trace Pair Encoding(TPE、構造保存型トレーストークナイザ)でトレースを圧縮し、trace–log マルチモーダルなトランスフォーマーデコーダで異常ステップ・疑わしいオペレータ・自然言語根本原因説明を同時予測する。SGLang・Torch FSDP・vLLM v0/v1 で評価し、Robustlog・LAnoBERT 等の既存手法を上回るステップ精度(Acc 0.930/0.911)とオペレータ局所化(Macro F1 0.806/0.792)を達成。TPE ボキャブラリ 256(83.88% 圧縮)が最良で、512/1024 への積極圧縮はオペレータ局所化 Macro F1 を 0.806→0.173→0.138 まで崩壊させることを示した。AI21 Labs 報告の実 vLLM 障害(Mamba SSM 状態汚染)ケーススタディも含む。著者陣は eACGM(IWQoS 2025、同グループ)の非侵入計装の発想を訓練クラスタ異常検知から推論のリクエストレベル RCA へ発展させた。既存 concept [[LLMによる根本原因分析]]・[[GPU観測性]]・[[CUDA API トレース]]・[[マルチモーダル障害診断]] に、診断対象を GPU カーネル/CUDA API レベルへ下げた事例・NVTX/CUPTI を「正面採用」する設計・trace 圧縮とRCA精度のトレードオフという横断的知見を追記した。 - Sources (new): [[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]] - Entities (new): [[Junyi Li]] - Entities (updated): [[Ruilin Xu]], [[Zongxuan Xie]], [[Pengfei Chen]], [[Sun Yat-sen University]], [[CUPTI]], [[eACGM]] - Concepts (updated): [[LLMによる根本原因分析]], [[GPU観測性]], [[CUDA API トレース]], [[マルチモーダル障害診断]] ## AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド (2026-08-10) [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]](Masayuki Kobayashi(markunet)、SpeakerDeck、OCTS 2026講演資料、2026-07-09、北京)は、OCTS 2026(Open Compute Tech Summit 2026 / OCP China Day 2026)の内容を6つの技術トレンドに整理したスライド53ページ。推論・とりわけAIエージェントの実運用がGPU中心に最適化してきたインフラの前提を崩したという共通認識を起点に、計算(GPU中心→CPU-GPU協調、Alibaba Cloud磐久UMXでCPU:GPU比1:1接近)・記憶(KV CacheがHBM占有の57%を占め、DRAM/NAND約200倍のコスト差)・接続(スーパーノードがラック設計の標準単位化、2023〜2027年でXPU数16〜64枚→576〜1,152枚、NPO/CPO/XPOの光インターコネクト路線並立)・電力(54V→800V高圧直流、ByteDance大禹2.0で1ラック264kW実装済み)・冷却(液冷は「導入是非」の議論を終え部品設計そのものを液冷前提で再構築)・管理(OCPのスコープが「grid to chip」へ拡張、字節跳動主導のRAS API標準v0.95)を、Alibaba Cloud・ByteDance・浪潮信息(IEIT SYSTEMS)・沐曦(MetaX)・サムスン電子・Astera Labs・China Mobile等の公開セッション資料から横断的に整理する。新設 concept [[AIスーパーノード]]・[[800V高圧直流給電]] の初出ソース。既存 concept [[KVキャッシュ管理]] にハードウェア階層のコスト非線形性という経済性の知見を追記した。 - Sources (new): [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]] - Entities (new): [[浪潮信息 (IEIT SYSTEMS)]], [[沐曦 (MetaX)]], [[Astera Labs]], [[サムスン電子 (Samsung Electronics)]], [[China Mobile]], [[Open Compute Project]] - Entities (updated): [[Alibaba Cloud]], [[ByteDance]] - Concepts (new): [[AIスーパーノード]], [[800V高圧直流給電]] - Concepts (updated): [[KVキャッシュ管理]] ## マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察 (2026-08-10) [[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]]([[Masayuki Kobayashi]](markunet)、SpeakerDeck、Interconnect Architecture SIG、2026-03-09発表)は、800G/1.6T級NICを用いた大規模GPUクラスタのマルチプレーンネットワーク実現に必要な「シャッフル(Shuffle)」配線技術を整理した社内検討資料、全39ページ。Shuffleを「breakout cableではなくlane remap + plane分散 + structured cablingを含む物理配線アーキテクチャであり、本質はserver-majorの束をplane-majorに組み替えること」と定義し、800G NICの2x400G(Dual-Plane、shuffle不要)/4x200G(Quad-Plane)/8x100G(Octal-Plane)という分岐選択肢、Shuffle Cable(ケーブル内部remap)・Shuffle Box(box/cassette内部remap)・CPOスイッチ内蔵Shuffle(装置内部でfiber regrouping)の3方式を11観点(構成変更しやすさ・追加接続点・挿入損失・運用上の見えやすさ等)で比較する。Fate Sharing(共通故障点)を明示的に定義し、プレーン分散してもファブリックプレーン側の耐障害性は向上する一方でhost port/optics起点の共通故障点は消えないことを示す。Corning Optical Communicationsの400G 4×4/2×2 Shuffle結線図、Oracleの800G NIC shuffle実装例(Acceleron Multiplanar Networking Architecture)を引用しつつ、実クラスタ(Elpis Cluster - 202601)での4サーバ×8NIC×4Plane構成例も示す。考察として「Shuffleの価値の本質は規模そのものより配線の複雑度が人手管理を超えるかどうかにある」と結論付ける。既存 concept [[光ファイバーシャフル配線]] にShuffle Cable/Box/CPO内蔵の3方式11観点比較とFate Sharing定義を、[[マルチプレーンClosトポロジ]] にマルチプレーンを機能させるNICハードウェア側要件とhost側Fate Sharingの理論的上限を横断的知見として追記した。 - Sources (new): [[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]] - Entities (new): [[Masayuki Kobayashi]], [[Corning Optical Communications]], [[Oracle]] - Concepts (updated): [[光ファイバーシャフル配線]], [[マルチプレーンClosトポロジ]] ## GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet – PFC/ECN編 (2026-08-10) [[@2024__SpeakerDeck__GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet - PFC-ECN編]]([[Masayuki Kobayashi]](markunet)、LINEヤフー Staff Engineer、SpeakerDeck、2024-12-27公開)は、RoCEv2 が前提とする Lossless Ethernet を構成する PFC(IEEE 802.1Qbb)・ECN(IEEE 802.1Qau)・CNP(IBTA規格)の仕組みを解説する社内基礎勉強会資料、全47ページ。パケットのプライオリティ分類(PCP/DSCP → Traffic Class、Trust Mode)の基礎から、RoCEv2=DSCP26=TC3・CNP=DSCP48=TC6 というベンダー横断のデファクト値、PFC/ECN/CNPそれぞれの動作メカニズム(ECT/CEビット、CNP Opcode 0x81)、Headroomバッファのケーブル長依存計算、NVIDIA Cumulus Linux・Arista EOS の実コマンド設定例までを一貫して扱う。PFCの継続発動は性能低下を招くためECN/CNPによる事前抑制を主防御としPFCは最終手段とすべきという運用規律、Arista EOS設定例が「StrataXGS Chip前提、DNXでは異なる」と明記する点(単一ベンダー内でもASICファミリが異なれば設定が異なる)を中心的知見とする。実クラスタでの個別設定値・Juniper/Cisco/SONiC設定例など6ページは登壇者により非公開。既存 concept [[データセンター輻輳制御]]・[[マルチベンダーLosslessネットワーク]] に横断的知見を追記した。 - Sources (new): [[@2024__SpeakerDeck__GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet - PFC-ECN編]] - Entities (updated): [[Masayuki Kobayashi]], [[LINE株式会社]] - Concepts (updated): [[データセンター輻輳制御]], [[マルチベンダーLosslessネットワーク]] ## AIインフラを考える (2026-08-10) [[@2025__SpeakerDeck__AIインフラを考える]]([[Masayuki Kobayashi]](markunet)、さくらインターネット インフラエンジニア、第38回 ISOC-JP Workshop、2025-09-26)は、AIインフラの巨大化サイクルとScale Up/Scale Out/Scale Outsideの3ネットワークドメイン区分から出発し、RoCEv2のパケット構造(BTH/RETH、フラグメントの受信順序保証制約)、ECNの3ホップ通知経路とスイッチが直接CNPを生成できない制約(IETF Fast CNP draft)、PFCバッファプロファイルのケーブル長・スイッチ種別依存性、RDMA-unaware/RDMA-aware ロードバランシング方式比較、並列化方式別の通信ドメイン・ボトルネック対応表、PD DisaggregationにおけるKV Cache転送サイズ試算(Llama3 8B/405B、1K〜8K×同時100リクエストで100〜420GB)とScale Up/Scale Out経路選択の4部構成でAIインフラの技術的課題を横断的に整理した全52ページの講演資料。既存 concept 9件に横断的知見を追記し、[[Masayuki Kobayashi]] の所属(さくらインターネット)を初めて確認した。 - Sources (new): [[@2025__SpeakerDeck__AIインフラを考える]] - Entities (updated): [[Masayuki Kobayashi]], [[SAKURA internet Inc]], [[高火力 PHY]] - Concepts (updated): [[RDMA]], [[RoCE設計課題]], [[データセンター輻輳制御]], [[Valiant Load Balancing]], [[並列化戦略]], [[KVキャッシュ管理]], [[Prefill-Decode分離]], [[AIデータセンタートポロジ]], [[Ultra Ethernet]] ## Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート (2026-08-10) [[@2026__SpeakerDeck__Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート]]([[Masayuki Kobayashi]](markunet)、SpeakerDeck、2026-06-30公開)は、OCP MRC Specification 1.0・MRC Transport論文(arXiv:2606.18170)を一次ソースとする全66ページのTechnical Deep Dive資料。RoCEv2 RCとの差分(経路利用/信頼性/輻輳制御/パケットロス解釈の4軸)、EVの3実現方式(ECMPハッシュ/Structured EV/SRv6 uSID)とEVステートマシン(GOOD/SKIP/ASSUMED_BAD/DENIED)、配送層(SACK/NACK)とセマンティック層(RDMA ACK/NAK)の分離、MPR/WriteIMMインフライト制御、パケットフォーマット(BTH/RETH変更のみ、METH/SETH/NETH/PETH等の新設ヘッダ、MRC専用オペコード空間0b110)、SRv6統合のデータ・コントロールプレーン詳細(uSIDによるIPv6-in-IPv6カプセル化、EV↔SRv6アドレスのアルゴリズム的対応)、適用領域とトレードオフ、NIC/スイッチベンダー対応状況(2026-06-19時点、NVIDIA CX8/AMD Pensando/Broadcom Thor Ultra)を扱う。既存 concept [[MRC]] に「仕様レベルの機構」節を新設し、既存の運用実績中心の記述(arXiv:2605.04333)を仕様書レベルの技術詳細で補強した。「MRC = SRv6」は著名デプロイに引きずられた誤解であり、SRv6はOCP仕様が定義する3転送モードの1つに過ぎないという重要な訂正を含む。 - Sources (new): [[@2026__SpeakerDeck__Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート]] - Entities (updated): [[Masayuki Kobayashi]], [[Open Compute Project]] - Concepts (updated): [[MRC]] ## TSRBench: Benchmarking Time-Series Retrieval (2026-08-10) [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]]([[Cenjie Hu]]・[[Hang Cui]]・[[Zexin Wang]]・[[Juncheng Bao]]・[[Jingwen Yang]]・[[Jingjing Li]]・[[Changhua Pei]]・[[Dan Pei]]・[[Gaogang Xie]]、KDD '26 V.2、2026-08-09)は、時系列検索(TSR)のためのエンドツーエンドベンチマークスイート。データ層・モデル層・評価層を分離する距離ライブラリパイプラインの下で、古典的距離手法とエンコーダベース手法(自己教師あり・基盤モデル)を統一評価する。UCR アーカイブを形状一貫性のある関連性定義と工夫されたディストラクタプールで再構成した公開データセット UCR-R と、通信事業者のインシデントテレメトリから構築した産業データセット CU-RCA を提供し、single hit dominance(1 件の高順位ヒットだけで見かけ上高スコアになる現象)を緩和する AdaBase Ranking Scorecard(AB-NDCG・AB-MAP、3 種の適応的割引ファミリー)を提案する。UCR-R では Hit@K がしばしば飽和する一方 AdaBase は識別力を保ち、グリッド制御実験でディストラクタプール拡大に対し単調に低下することを確認した。CU-RCA では単純な統計的距離(Pearson・Chebyshev)が事前学習済み埋め込みを上位ランクで上回るドメインシフトが観測され、産業評価の必要性を裏付けた。既存 concept [[時系列類似度検索]] に Time Series Retrieval としての定式化と single hit dominance の知見を追記、[[本番接地型ベンチマーク]] に「手法選好の忠実度」という新パターンを追記。 - Sources (new): [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]] - Entities (new): [[Cenjie Hu]], [[Hang Cui]], [[Juncheng Bao]], [[Jingwen Yang]] - Entities (updated): [[Zexin Wang]], [[Jingjing Li]], [[Changhua Pei]], [[Dan Pei]], [[Gaogang Xie]] - Concepts (updated): [[時系列類似度検索]], [[本番接地型ベンチマーク]] ## Rethinking Time Series Anomaly Detection from a Dynamic Perspective: Temporal–Frequency–Curvature Fusion (2026-08-10) [[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]]([[Hang Cui]]・[[Zexin Wang]]・[[Changhua Pei]]・[[Juncheng Hu]]・[[Haotian Si]]・[[Quan Zhou]]・[[Cenjie Hu]]・[[Jingjing Li]]・[[Dan Pei]]・[[Gaogang Xie]]、KDD '26 V.2、2026-08-09〜13)は、時系列を「値の集合」ではなく「進化するシステムが生成する軌道」として捉え直し、離散二階差分(曲率)を時間・周波数の既存視点に加える第三の視点として統合する時系列異常検知(TSAD)フレームワーク TFC を提案する。二階差分が二階微分を O(Δt²) で近似し(命題2.1)、傾き変化点で局所インパルスを生み(命題2.2)、離散時間フーリエ変換上で高周波成分を選択的に増幅するフィルタとして振る舞う(命題2.3)という理論的動機づけのもと、Multi-Span Attention(短・中・長距離の局所スパンを並列処理するアテンション機構)で曲率のマルチスケールなパターンを捉え、二段階融合(周波数-曲率クロスアテンションによる較正 → エキスパートルーティングによる時間視点との統合)で誤警報を抑制する。AIOPS・WSD・Yahoo・NAB・UCR・TODS の6ベンチマーク・17ベースラインに対し平均 Best-F1・Event-F1 で SOTA を達成し、強いベースライン比平均 10.8% の改善、ウィンドウ長 16〜128 にわたる安定性、モデルサイズ・推論時間の両面での優位(小型・高速なまま平均スコア上位フロンティア)を実証した。既存 concept [[異常検知]] に「平滑化を逆転させ曲率を判別的シグナルとして増幅する」という新しい設計軸の知見を追記し、多変量拡張・較正機構の長期ドリフト耐性という2件の未解決の問いを追加した。 - Sources (new): [[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]] - Entities (new): [[Haotian Si]], [[Juncheng Hu]], [[Jilin University]], [[Shenyang Institute of Automation, Chinese Academy of Sciences]] - Entities (updated): [[Hang Cui]], [[Zexin Wang]], [[Changhua Pei]], [[Quan Zhou]], [[Cenjie Hu]], [[Jingjing Li]], [[Dan Pei]], [[Gaogang Xie]] - Concepts (updated): [[異常検知]] ## TSLoc: Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters (2026-08-10) [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]]([[Quan Zhou]]・[[Changhua Pei]]・[[Yuanwei Lu]]・[[Difeng Ma]]・[[Zexin Wang]]・[[Jianhui Li]]・[[Yibo Zhu]]・[[Daxin Jiang]]・[[Dan Pei]]・[[Jingjing Li]]・[[Gaogang Xie]]、KDD 2026、2026-08-09〜13)は、大規模 LLM 訓練クラスタの障害ノード検出を、過去の障害ラベルに依存しない自己教師あり逸脱検知タスクとして再定式化するフレームワーク TSLoc を提案する。健全ノードが同一コード・同一データ分割ロジックを実行するために成立する群コンセンサスからの逸脱を、LSTM ゲーティング + KAN-AD エキスパートからなる共有 Mixture-of-Experts 時系列エンコーダで捉え、空間逸脱(ノード間距離)と時間的 volatility(埋め込みの時刻間変化)を Reciprocal Rank Aggregation で統合する。[[Minder]] の決定木ベースのメトリクス優先順位付け(closed-world 仮定に基づき未知障害へ汎化できない)を主要な批判対象とし、障害ラベルを一切使わないことで新規メトリクスへの day-one サポートを実現する。数百〜700台超ノードの本番 Kubernetes クラスタに数ヶ月デプロイされ Top-5 精度 0.908・平均応答 4.2 秒を達成、標準監視が処理しきれない23件の困難な長尾障害に対するオンライン実験でも Acc@5=0.826 を報告した。既存 concept [[Fault Localization]] に Minder との対比・役割異質性の限界に関する横断的知見と未解決の問いを追記、[[異常検知]] にメトリクス非依存 MoE 設計と 1/rank 集約の頑健性に関する知見を追記、[[GPUクラスタ運用]] に day-one 対応とサンプリング粒度限界の知見を追記。 - Sources (new): [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]] - Entities (new): [[KAN-AD]] - Entities (updated): [[Quan Zhou]], [[Changhua Pei]], [[Difeng Ma]], [[Zexin Wang]], [[Yuanwei Lu]], [[Jianhui Li]], [[Yibo Zhu]], [[Daxin Jiang]], [[Jingjing Li]], [[Gaogang Xie]], [[Dan Pei]], [[StepFun]], [[Minder]] - Concepts (updated): [[Fault Localization]], [[異常検知]], [[GPUクラスタ運用]] ## TRACER: Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis (2026-08-10) [[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]]([[Yuhang Zhang]]・[[Meng Ma]]・[[Ping Wang]]、[[Peking University]]、KDD '26、2026-08-09〜13)は、都市交通網の非再帰的渋滞に対する訓練不要・ゼロショットの根本原因診断エージェントフレームワーク TRACER を提案する。既存の深層学習ベース手法がグラフ畳み込みの低域通過フィルタ性により根本原因と下流影響ノードを混同する fault smearing(平滑化効果)を起こすこと、因果発見手法(PCアルゴリズム等)が物理非依存で流れ保存則に反するスプリアスなリンクを生成すること、直接LLM適用がトークン類似度による空間的ハルシネーションを起こすことを指摘し、運動学的衝撃波理論(kinematic wave theory)による物理接地された双方向トレースとGranger因果性検定を組み合わせた Physics-Grounded Evidence Construction でこれらを解決する。並列LLM推論とコンセンサス融合による三段階パイプラインで、SUMOベースの閉ループベンチマークとPeMS-BAY実データの双方で既存の統計的・ニューラル・LLM・エージェント手法を上回り、Hit@1精度を最良ベースライン比32.6%相対改善、推論時間を85.7%削減した。閉ループ介入実験では、正確な根本原因診断に基づく介入が実際に交通回復を加速することも定量的に実証した。既存concept [[因果推論ベースRCA]] に、物理法則による枝刈りとローカルな統計検証を組み合わせるハイブリッド設計がグローバル統計的因果探索より優れうるという知見、および並列分解+コンセンサス融合というLLM活用パターンを追記。[[Fault Localization]] に、グラフ集約の平滑化問題がマイクロサービス・訓練クラスタと全く異なる都市交通ドメインでも同型で再現するという横断的知見を追記。 - Sources (new): [[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]] - Entities (new): [[Yuhang Zhang]] - Entities (updated): [[Meng Ma]], [[Ping Wang]], [[Peking University]] - Concepts (updated): [[因果推論ベースRCA]], [[Fault Localization]] ## An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data (2026-08-10) [[@2023__CCGrid__An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data]]([[Paolo Notaro]]・[[Qiao Yu]]・[[Soroush Haeri]]・[[Jorge Cardoso]]・[[Michael Gerndt]]、CCGrid 2023)は、350万台超・131リージョン・15か月分の光トランシーバーDDMモニタリングデータとOSレベルメトリクス(エラーレート・パケットロス・スループット)を突き合わせた、光トランシーバー信頼性に関する初の大規模包括研究。時系列自己相関(エラーレートは24時間以内に高確率で再発)・annualized failure rate推定(ハード故障AFR 0.1341%はDIMM相当・ハードドライブより有意に低いが、ソフト故障はハード故障の最大12.22倍)・健全/故障モジュールの運用範囲比較(バイアス電流・温度・Rx/Txパワーで故障モジュールの範囲が有意に広い)・パターンlift分析(ErrorRate_HIGHがlift 9.13xで最大、パケットロスはlift 1.27-1.28xでほぼ無関係)・機械学習故障予測モデル(Random Forest/XGBoost/Logistic Regression/閾値ベース推定器、precision 72.8-95.7%・recall 21.2-50.0%)という5つの独立した分析軸すべてで、エラーレートの過去発生とバイアス電流の高値が将来故障の最強の予兆であることが一貫して確認された。既存concept [[障害予測]] に、abstractのみで具体的特徴が不明だった[[OptProphet]]の予兆特徴を定量的に埋める知見、Notaro et al. の研究系譜(サーベイ→実証データ分析→応用予測モデル)の進化に関する知見、デバイス経年未考慮・単変量lift対多変量recallのギャップに関する新規未解決の問い2件を追記。 - Sources (new): [[@2023__CCGrid__An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data]] - Entities (new): [[Qiao Yu]], [[Soroush Haeri]], [[Huawei Technologies Duesseldorf GmbH]] - Entities (updated): [[Paolo Notaro]], [[Jorge Cardoso]], [[Michael Gerndt]] - Concepts (updated): [[障害予測]] ## RAIL: A Case for Redundant Arrays of Inexpensive Links in Data Center Networks (2026-08-10) [[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]]([[Danyang Zhuo]]・[[Manya Ghobadi|Monia Ghobadi]]・[[Ratul Mahajan]]・[[Amar Phanishayee]]・[[Xuan Kelvin Zou]]・[[Hang Guan]]・[[Arvind Krishnamurthy]]・[[Thomas Anderson]]、NSDI 2017)は、データセンターネットワーク(DCN)の光トランシーバーが業界標準に対して著しく過剰設計されていることを大規模実測で示した研究である。20データセンター超・30万リンク(60万トランシーバー)を10か月間計測し、99.9%のリンクがBER 10^-12を満たすのに必要な受信光パワー閾値を上回り、中央値で6倍もの余裕があることを確認した。この過剰設計を利用し、市販トランシーバーの伝送距離仕様を1.6〜4倍「引き伸ばす(stretch)」ことで、10Gbpsネットワークで最大10%・40Gbpsネットワークで最大44%のコスト削減を実証した。引き伸ばしにより一部経路(1〜5%)がグレー化するリスクを、単一物理トポロジ上に信頼性水準の異なる複数の仮想トポロジを構築しアプリケーションの損失耐性に応じてルーティングするシステム RAIL(O(n log n)最悪経路特定アルゴリズム・透過的XOR誤り訂正)で吸収する。既存 concept [[データセンターネットワークトポロジ]] に、Fat-Treeの均質信頼性前提とRAILの信頼性クラス多重化という対照的な設計の知見を追記、[[データセンター信頼性]] に、HDD/サーバー研究の「信頼性不足への対処」とRAILの「信頼性過剰の是正」という対照的方向性の知見を追記。新規 concept [[光リンク過剰設計]] を作成。 - Sources (new): [[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]] - Entities (new): [[Danyang Zhuo]], [[Manya Ghobadi|Monia Ghobadi]], [[Xuan Kelvin Zou]], [[Hang Guan]], [[Thomas Anderson]] - Entities (updated): [[Ratul Mahajan]], [[Amar Phanishayee]], [[Arvind Krishnamurthy]], [[University of Washington]], [[Microsoft Research]], [[Columbia University]] - Concepts (new): [[光リンク過剰設計]] - Concepts (updated): [[データセンターネットワークトポロジ]], [[データセンター信頼性]] ## Detecting Ephemeral Optical Events with OpTel (2026-08-10) [[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]](Congcong Miao・[[Arpit Gupta]]・Zili Meng・Lianjin Ye・Jingyu Xiao・Jilong Wang・Heng Yuほか、NSDI 2022)は、[[Tencent]]・[[Tsinghua University]]・[[UC Santa Barbara]]による光バックボーンネットワーク向けテレメトリシステムOpTelの論文である。SNMPベースの既存テレメトリはポーリング遅延がインジケータ数・デバイス数に線形増加し秒オーダーの高頻度収集に耐えないという問題を、ベンダー非依存の標準化デバイスモデル(logic model + data model)とpush型テレメトリパイプライン(telemetry manager/agent/cache/aggregator)で解消する。収集頻度0.1sでもCPU使用率をSNMPの96%からOpTelの25%に抑制し、1秒粒度データにより既存の15分粒度では検知不能な一過性(ephemeral)光イベントを含め既存比2倍多く検知、トラブルシューティング時間を数分〜数日から数秒〜数十秒に短縮した。Tencentの本番光バックボーンで6か月間(2020年7-12月)運用した実績を報告する。新規 concept [[光バックボーンネットワークテレメトリ]] を作成し、既存 concept [[テレメトリ]]・[[ネットワーク監視]] に横断的知見を追記。 - Sources (new): [[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]] - Entities (new): [[Congcong Miao]], [[Arpit Gupta]] - Entities (updated): [[Tencent]], [[Tsinghua University]], [[UC Santa Barbara]] - Concepts (new): [[光バックボーンネットワークテレメトリ]] - Concepts (updated): [[テレメトリ]], [[ネットワーク監視]] [[@2017__SIGCOMM__Understanding and Mitigating Packet Corruption in Data Center Networks]]([[Danyang Zhuo]]・[[Manya Ghobadi|Monia Ghobadi]]・[[Ratul Mahajan]]・[[Klaus-Tycho Förster]]・[[Arvind Krishnamurthy]]・[[Thomas Anderson]]、SIGCOMM 2017)は、15の本番データセンター・35万本のスイッチ間光リンクを7か月監視し、パケット破損(corruption)による損失が輻輳(congestion)による損失と同水準の規模であることを示した最初の大規模研究である。破損は輻輳より影響リンク数が少ないが損失率は重く、破損損失率は利用率と無相関(平均ピアソン相関0.19)かつ時間的に安定しているため輻輳制御的な対処では緩和できない。トラブルチケット300件超と光パワー監視の突き合わせから根本原因5種(コネクタ汚染・ケーブル損傷・送信機劣化・トランシーバ不良・共有コンポーネント故障)の症状パターンを確立した。緩和システムCorrOptは、容量制約下でのリンク無効化問題がNP-completeであることを3-SAT還元で証明した上で、線形時間の高速チェッカと厳密最適化の2段階アルゴリズムで既存手法に対し破損損失を3〜6桁削減し、根本原因ベースの修復推薦エンジンを70以上のデータセンターへ展開して初回修復成功率を50%から80%へ改善した。既存 concept [[RDMAネットワーク監視]] に、輻輳系監視が破損という質的に異なる障害クラスを見落とすという横断的知見と、光層根本原因診断のRxPower/TxPowerパターンマッチングという共通言語の知見を追記。 - Sources (new): [[@2017__SIGCOMM__Understanding and Mitigating Packet Corruption in Data Center Networks]] - Entities (new): [[Danyang Zhuo]], [[Klaus-Tycho Förster]], [[Thomas Anderson]] - Entities (updated): [[Ratul Mahajan]], [[Arvind Krishnamurthy]], [[Manya Ghobadi|Monia Ghobadi]](表記ゆれ重複 `Monia Ghobadi.md` を統合) - Concepts (updated): [[RDMAネットワーク監視]] ## CanaryAdvisor: A Statistical-Based Tool for Canary Testing (2026-08-11) [[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]]([[Alexander Tarvo]]ほか、[[IBM Research]]、ISSTA 2015デモ論文)は、クラウドベースアプリケーション向け自動カナリアテストツール CanaryAdvisor を提案する。データ収集(collectd/logstash)→メトリクス変換(DataAgent)→統計的比較(CanaryAdvisor Service)→判定集約(DecisionMaker)→可視化(UI)の5段階パイプラインで構成され、非パラメトリック統計仮説検定によりベースラインとカナリアのメトリクス差が有意かを判定する。許容誤差係数xと信頼区間幅の臨界値Wcriticalの2パラメータで、ハードウェア/OSの微小バイアスへの頑健性と判定に必要なデータ量というトレードオフを制御する設計が核心。Daytraderベンチマークへの障害注入実験(エラー率20%・応答時間30%増)でInconclusive→Fail、Inconclusive→Passの状態遷移を実証した一方、非ランダムノイズの識別・除去や本番環境でのグラウンドトゥルース欠如下での精度検証を2015年時点の未解決課題として明記している。新規 concept [[カナリアテスト]] を作成し、この vault に欠けていた「デプロイリスク低減の統計的手法」という系譜の起点を記録した。 - Sources (new): [[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]] - Entities (new): [[CanaryAdvisor]], [[Alexander Tarvo]] - Entities (updated): [[IBM Research]] - Concepts (new): [[カナリアテスト]] ## Canary Analysis Service (acmqueue 2018) (2026-08-11) [[@2018__acmqueue__Canary Analysis Service]]([[Štěpán Davidovič]] with [[Betsy Beyer]]、[[Google]]、acmqueue 2018年1・2月号)は、Google が全社横断で展開する集中型カナリア分析サービス CAS(Canary Analysis Service)の設計・運用報告である。CAS はバイナリ更新・構成変更・データセット変更など本番変更全般に対し、カナリア/対照母集団のA/Bテストを自動実行し、確信度スコアやp値を意図的に隠したPASS/FAIL/NONEの三値判定のみをロールアウトツールに返す。Evaluate()/GetResult()の2 RPCのみというシンプルなAPI設計により、CASプロセス群が5〜10分おきにクラッシュするバグが生じた際も全ユーザーリクエストへのサービス提供を継続できた実例を報告。オンライン挙動学習によるオートコンフィグレーションで統計知識のないエンジニアでも利用可能にし、1日あたり数十万件の本番変更評価という規模で全社採用を達成。near-miss分析(過去のポストモーテムを遡りCASが防げたはずの障害を特定する手法)によりインパクトを測定し、数百件規模のポストモーテム相当の障害を防いだと推定している。既存 concept [[カナリアテスト]](2015年 IBM CanaryAdvisor 起点)に、独立した2企業・2時代のシステムが「統計判定を少数の離散状態に還元する」同型設計に収束するという横断的知見を追記し、この vault のカナリア判定系譜に2つ目のソースを接続した。 - Sources (new): [[@2018__acmqueue__Canary Analysis Service]] - Entities (updated): [[Štěpán Davidovič]], [[Betsy Beyer]] - Concepts (updated): [[カナリアテスト]], [[変更起因インシデント]], [[障害緩和]], [[SRE]] ## Safe Velocity: A Practical Guide to Software Deployment at Scale using Controlled Rollout (ICSE-SEIP 2019) (2026-08-11) [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]]([[Tong Xia]]・[[Sumit Bhardwaj]]・[[Pavel Dmitriev]]・[[Aleksander Fabijan]]、[[Microsoft]]、ICSE-SEIP '19)は、段階的ロールアウト(Dogfood→Internal→Insiders→Productionの各リング)の各リング内でオンライン制御実験(A/Bテスト)を実行するハイブリッド手法「制御ロールアウト(controlled rollout, CRL)」を提案する。段階的ロールアウト単独の遅さ・代表性の低さ・測定不正確さと、制御実験単独のリスクの高さ・逐語的フィードバックの少なさを同時に緩和する狙い。二標本t検定の検出力分析に基づきリングごとの最適なロールアウト期間・検出目標Δ%を決定する実務的手法と、データ品質・ガードレール・成功(OEC)・ローカルの4種の指標体系を提示。Microsoft Officeでの2018年の数百件の制御ロールアウト分析により、Dogfood/Internalリングでは35%がガードレール指標に有意変動(79%が3日以内に検知)、Insiders/Productionリングでは61%がOEC/ローカル指標に有意変動を示し、いずれも伝統的段階的ロールアウトでは検知困難な規模であることを実証した。Word for Androidのデフォルトビュー変更事例を通じ、逐語的フィードバックだけでは見えない、文書編集ユーザーと閲覧のみユーザーで結果が分かれるという制御実験ならではの知見も報告。新規 concept [[制御ロールアウト]] を作成した。 - Sources (new): [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]] - Entities (new): [[Tong Xia]], [[Sumit Bhardwaj]], [[Pavel Dmitriev]], [[Aleksander Fabijan]], [[Outreach.io]] - Entities (updated): [[Microsoft]] - Concepts (new): [[制御ロールアウト]] - Concepts (updated): [[カナリアテスト]] ## Rapid Regression Detection in Software Deployments through Sequential Testing (KDD 2022) (2026-08-11) [[@2022__KDD__Rapid Regression Detection in Software Deployments through Sequential Testing]]([[Michael Lindon]]・[[Chris Sanden]]・[[Vaché Shirikian]]、[[Netflix]]、KDD '22)は、カナリアテストにおける性能劣化(regression)検知を、固定サンプルサイズ検定ではなく逐次検定(sequential testing)とanytime-validなconfidence sequenceで実施する統計フレームワークを提案する。regressionを平均値の差ではなく確率的順序(stochastic order)・分布の等価性という分布全体を対象にした仮説として定式化し、平均は変わらないが裾が悪化するケース(PlayDelayの例)も検知範囲に含める。Netflixの既存カナリア分析システム [[Kayenta]] が前提とする固定-$n$統計検定(Mann-Whitney U検定)を、開発者がregressionを早期に検知しようとして蓄積データに繰り返し適用してしまう「peeking」が実務で常態化し型 I エラー確率の制御が破綻していた問題を、Howard and Ramdasの confidence sequenceに基づく逐次$p$値と、有限時間で必ず停止する相補的停止規則で解決する。2つの実運用ケーススタディ(PlayDelay劣化を約65秒、Successful Play Starts減少を約11秒で検知)と、付録Eのシミュレーション(固定-$n$検定は継続的モニタリング下で100回中64回・57回の誤検知を生んだのに対し提案手法は0回)でその有効性を実証した。新規 concept [[逐次検定]] を作成し、既存 concept [[カナリアテスト]] に「固定-$n$ vs 逐次検定」という判定メカニズムの設計軸を追加した。 - Sources (new): [[@2022__KDD__Rapid Regression Detection in Software Deployments through Sequential Testing]] - Entities (new): [[Michael Lindon]], [[Chris Sanden]], [[Vaché Shirikian]], [[Kayenta]] - Entities (updated): [[Netflix]] - Concepts (new): [[逐次検定]] - Concepts (updated): [[カナリアテスト]] ## Gandalf: An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure (NSDI 2020) (2026-08-11) [[@2020__NSDI__Gandalf - An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure]]([[Ze Li]]・[[Qian Cheng]]・[[Ken Hsieh]]・[[Yingnong Dang]]・[[Peng Huang]]・[[Pankaj Singh]]・[[Xinsheng Yang]]・[[Qingwei Lin]]・[[Youjiang Wu]]・[[Sebastien Levy]]・[[Murali Chintalapati]]、[[Microsoft Azure]] / [[Johns Hopkins University]] / [[Microsoft Research]]、NSDI '20)は、Microsoft Azure の大規模クラウドインフラにおける安全なデプロイのための end-to-end 分析サービス [[Gandalf]] を提案する。コンポーネント個別の watchdog とは異なり、テレメトリシグナルをクラスタ横断で継続監視し、異常検知(Holt-Winters + z-score)→ 相関分析(vote-veto → 空間・時間相関 → 時間減衰)→ 決定プロセス(Gaussian discriminant classifier)の3段階モデルでロールアウトの go/no-go をトップダウンに判定する。ラムダアーキテクチャ(Speed Layer + Batch Layer)により即時障害と latent 障害の両方を捕捉する。Azure で18ヶ月以上稼働し、データプレーンで precision 92.4%・recall 100%、コントロールプレーンで precision 94.9%・recall 99.8% を達成した産業スケールの実証例。空間相関の導入で correlation precision が77%改善、時間減衰の除去で precision が58.8%低下というアブレーション結果を報告し、cross-component impact・region-specific impact・latent impact の3件のケーススタディを含む。NSDI 2020 発表から4年以上を経ても、FUNNEL/SCWarn/ChangeRCA/Guardian 等の後続研究で標準的な比較ベースラインとして参照され続ける中核論文。既存 concept [[変更起因インシデント]]・[[カナリアテスト]] に Gandalf との技術的対比(イベント相関による犯人特定 vs メトリクス統計比較)を追記。新規 entity [[Gandalf]](製品)を作成。 - Sources (new): [[@2020__NSDI__Gandalf - An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure]] - Entities (new): [[Gandalf]], [[Qian Cheng]], [[Ken Hsieh]], [[Pankaj Singh]], [[Xinsheng Yang]], [[Youjiang Wu]], [[Sebastien Levy]] - Entities (updated): [[Ze Li]], [[Yingnong Dang]], [[Peng Huang]], [[Qingwei Lin]], [[Murali Chintalapati]], [[Johns Hopkins University]], [[Microsoft Azure]], [[Microsoft Research]] - Concepts (updated): [[変更起因インシデント]], [[カナリアテスト]] ## Aegis: Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems (ICSE-SEIP 2023) (2026-08-11) [[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]](Xiaohan Yan・[[Ken Hsieh]]・[[Yasitha Liyanage]]・[[Murali Chintalapati]]([[Microsoft Azure]])、[[Minghua Ma]]・[[Qingwei Lin]]・[[Dongmei Zhang]]([[Microsoft Research]])、[[Yingnong Dang]]([[Microsoft Azure]])、ICSE-SEIP 2023)は、Microsoft Azure control plane(CRP・NRP・RNM・AzSM 等の region/zone/cluster レベルサービス群)を対象に、component 単体の監視では捉えられない cross-component・cross-layer の変更起因障害を検出・緩和するエンドツーエンド分析サービス [[Aegis (Azure Control Plane)]] を提案する。ドメイン知識駆動の相関エンジン(時間的相関×空間的相関×fault-component関連度重み、build レベルでの分布集約による高並行デプロイ耐性、layer射影/分解によるcross-layer相関)と反実仮想射影モデル(sigmoid関数による未デプロイユニットへの影響信頼区間推定)を核とする。2022年1-3月のCRP・RNM・AzSM実デプロイ(60以上のbuild・700以上のdeployment)でprecision・recallともに約80%を達成し、Validation Engine除去でprecision 28.6%低下、Signature Weight除去でprecision 37.5%低下・recallほぼ半減というablationで両者の寄与を実証した。12ヶ月の本番運用で8000件以上のデプロイに意思決定、RNMのバイナリ欠落バグ(VMSS作成失敗148倍増)・AzSMロールアウトのcross-layer相関(根本原因はAzCPGateway)の2ケーススタディを報告する。同じAzureチームの一部(Chintalapati・[[Ken Hsieh]]・[[Qingwei Lin]]・[[Yingnong Dang]])が開発した component レベル監視 [[Gandalf]](NSDI 2020、本日先行ingest)の後継系譜にあたり、「component レベル→ component/layer 横断」への設計拡張を示す。既存 concept [[変更起因インシデント]]・[[ソフトウェア変更管理]] に横断的知見を追記。新規 entity Xiaohan Yan・[[Yasitha Liyanage]]・[[Aegis (Azure Control Plane)]](製品、Alibaba の同名システム [[Aegis]] と名前が衝突するため disambiguation)を作成。 - Sources (new): [[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]] - Entities (new): [[Xiaohan Yan]], [[Yasitha Liyanage]], [[Aegis (Azure Control Plane)]] - Entities (updated): [[Ken Hsieh]], [[Minghua Ma]], [[Murali Chintalapati]], [[Qingwei Lin]], [[Yingnong Dang]], [[Dongmei Zhang]], [[Microsoft Azure]], [[Gandalf]], [[Aegis]] - Concepts (updated): [[変更起因インシデント]], [[ソフトウェア変更管理]] ## Constructing Large-Scale Real-World Benchmark Datasets for AIOps (ESEC/FSE 2022) (2026-08-11) [[@2022__ESEC FSE__Constructing Large-Scale Real-World Benchmark Datasets for AIOps]]([[Zeyan Li]]・[[Nengwen Zhao]]([[Tsinghua University]])・[[Shenglin Zhang]]・[[Yongqian Sun]]([[Nankai University]])・[[Pengfei Chen]]([[Sun Yat-sen University]])・[[Xidao Wen]]([[Tsinghua University]])・[[Minghua Ma]]([[Microsoft Research]])・[[Dan Pei]]([[Tsinghua University]])、ESEC/FSE 2022 Industry Track)は、AIOps 研究における公開・大規模・実世界データセットの不足に対し、著者らの NetManAIOps ネットワークが構築・公開してきた 3 データセット(KPI 異常検知 dataset A・多次元根本原因箇所特定 dataset B・障害発見/診断 dataset C)と、それに基づく 2018/2019/2020 年の AIOps アルゴリズムコンペティション(合計 407 チーム参加)を紹介する Industry Track の短編。dataset A は Sogou・eBay・Baidu・Tencent・Ali の 27 KPI を実務エンジニアが手動ラベル付けしたもので 2018 年大会(最良 F1=0.8216)、dataset B は Suning のオンラインショッピングプラットフォームに基づき 5 属性を匿名化した上で GRE + ガウスノイズで生成した 400 件の合成障害で 2019 年大会(最良 F1=0.9593)、dataset C は China Mobile Zhejiang の分散システム sysA に対する 169 件の注入障害(トレース・KPI・メトリクスの 3 モダリティ)で 2020 年大会(最良合計スコア 755 / 129 障害)に用いられた。[[Squeeze]] をはじめ本 wiki が既に収集済みの複数の RCA 論文が dataset B(B0〜B4)を再利用しており、AIOps コミュニティのベンチマーク基盤を支えてきた一次データ源であることを確認した。図表 3 点(障害管理パイプライン図・KPI 波形例・分散システムアーキテクチャ図)は pdf.js 埋め込み画像抽出では取得できず、PyMuPDF のキャプション座標クロップで取得した。 - Sources (new): [[@2022__ESEC FSE__Constructing Large-Scale Real-World Benchmark Datasets for AIOps]] - Entities (updated): [[Zeyan Li]], [[Nengwen Zhao]], [[Shenglin Zhang]], [[Yongqian Sun]], [[Pengfei Chen]], [[Xidao Wen]], [[Minghua Ma]], [[Dan Pei]], [[Tsinghua University]], [[Nankai University]], [[Sun Yat-sen University]], [[Microsoft Research]] - Concepts (updated): [[根本原因分析]], [[時系列異常検知ベンチマーク]] ## LEMMA-RCA: A Large Multi-modal Multi-domain Dataset for Root Cause Analysis (arXiv 2024) (2026-08-11) [[@2024__arXiv__LEMMA-RCA - A Large Multi-modal Multi-domain Dataset for Root Cause Analysis]]([[Lecheng Zheng]]([[University of Illinois Urbana-Champaign]])・[[Zhengzhang Chen]]・[[Dongjie Wang]]([[University of Kansas]])・[[Chengyuan Deng]]([[Rutgers University]])・[[Reon Matsuoka]]([[NEC Laboratories Japan]])・[[Haifeng Chen]]([[NEC Laboratories America]])、arXiv 2024)は、IT運用(マイクロサービス2種: Product Review・Cloud Computing)とOT運用(水処理・水配送2種: SWaT・WADI)にまたがる実障害RCAベンチマークデータセット LEMMA-RCA を公開する。6種のRCAベースライン(PC・CIRCA・ε-Diagnosis・RCD・BARO・Nezha)をmetric only/log only/multi-modalityの3設定でPrecision@K・MAP@K・MRRにより評価し、Product ReviewでBAROのPR@1がmetric onlyの25%からmulti-modalで75%へ改善する等、マルチモーダル入力がRCA精度を大きく改善することを実証する。既存の公開RCAデータセット(NeZha・PetShop・Sock-Shop・ITOps・Murphy)がpublic性・real fault・large-scale・multi-domain・multi-modalityのいずれかを欠くとし、LEMMA-RCAが全条件を満たす初のデータセットであると主張する(Table 1)。CIRCAがマイクロサービス・水インフラいずれのドメインでも上位性能を維持する一方、multi-modal化の劇的な改善効果はSWaT/WADIでは観測されず、「手法の相対的な強さはドメインを越えて安定するが、モダリティ統合の効果はドメイン依存」という知見を [[ドメイン別RCA]] に追加した。既存 concept [[RCA評価設計]]・[[ドメイン別RCA]]・[[根本原因分析]] に横断的知見を追記。既存 entity [[Zhengzhang Chen]]・[[Haifeng Chen]] を更新、新規 entity [[Lecheng Zheng]]・[[Dongjie Wang]]・[[Chengyuan Deng]]・[[Reon Matsuoka]]・[[University of Kansas]]・[[NEC Laboratories Japan]] を作成。 - Sources (new): [[@2024__arXiv__LEMMA-RCA - A Large Multi-modal Multi-domain Dataset for Root Cause Analysis]] - Entities (new): [[Lecheng Zheng]], [[Dongjie Wang]], [[Chengyuan Deng]], [[Reon Matsuoka]], [[University of Kansas]], [[NEC Laboratories Japan]] - Entities (updated): [[Zhengzhang Chen]], [[Haifeng Chen]] - Concepts (updated): [[RCA評価設計]], [[ドメイン別RCA]], [[根本原因分析]] ## 詳解 システム・パフォーマンス 第2版(オライリー・ジャパン 2023、Brendan Gregg)(2026-08-12) [[詳解 システム・パフォーマンス 第2版]]([[Brendan Gregg]] 著、西脇靖紘 監訳、長尾高弘 訳、オライリー・ジャパン 2023。原書 *Systems Performance: Enterprise and the Cloud*, 2nd Edition、Pearson 2021)は、Linux システムのパフォーマンス分析を「推測ではなく計測」の原則のもとに体系化した教科書である。全16章を章別 source ページとして取り込んだ。構成は、導入と本書の骨格をなすメソドロジ群(第1〜2章)→ 分析対象となるソフトウェアスタック(第3〜5章: OS・可観測性ツール・アプリケーション)→ 第2章のメソドロジを各リソースへ順に適用するリソース別分析(第6〜11章: CPU・メモリ・ファイルシステム・ディスク・ネットワーク・クラウド)→ 計測手段そのものを扱うベンチマーキングとトレーシングツール(第12〜15章)→ 実務ケーススタディ(第16章)という抽象度の階段になっており、この構成自体が本書の主張にあたる。第2版の最大の変化は主対象が Solaris/DTrace から Linux/拡張BPF へ移ったことで、[[perf]]・[[Ftrace]]・[[BCC]]/[[bpftrace]] に 1 章ずつを充てる第13〜15章がその中心となる。第16章は [[Netflix]] のコンテナ移行で観測された「うますぎる」3〜4倍の高速化を、60秒チェックリスト → [[USE メソッド]] → PMC → トレーシングの順で調査し、隣人不在・LLCヒット率差・CPU負荷差という3要因の重なりとして説明する唯一の実務章である。図表166点は PyMuPDF のキャプション座標クロップで取得し本文の該当箇所に埋め込んだ(940ページのため全ページレンダリングは使用していない)。著作権コンテンツのため章 source ページはすべて `publish: false`。 - Sources (new): [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 1 イントロダクション]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 2 メソドロジ]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 3 オペレーティングシステム]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 4 可観測性ツール]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 5 アプリケーション]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 6 CPU]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 7 メモリ]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 8 ファイルシステム]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 9 ディスク]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 10 ネットワーク]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 11 クラウドコンピューティング]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 12 ベンチマーキング]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 13 perf]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 14 Ftrace]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 15 BPF]], [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 16 ケーススタディ]] - Entities (new): [[詳解 システム・パフォーマンス 第2版]], [[perf]], [[Ftrace]], [[trace-cmd]], [[perf-tools]], [[KernelShark]], [[Steven Rostedt]], [[Alastair Robertson]] - Entities (updated): [[Brendan Gregg]], [[Netflix]], [[Linux]], [[FreeBSD]], [[BCC]], [[bpftrace]], [[Kubernetes]], [[Docker]], [[Firecracker]] - Concepts (new): [[USE メソッド]], [[RED メソッド]], [[ワークロードの特性の把握]], [[ドリルダウン分析]], [[レイテンシ分析]], [[パフォーマンスのアンチメソドロジ]], [[ベンチマーキング]], [[待ち行列理論]], [[ユニバーサルスケーラビリティ法則]], [[レイテンシヒートマップ]], [[フレームグラフ]], [[システムコール]], [[コンテキストスイッチ]], [[アプリケーション並行実行モデル]], [[同期プリミティブ]], [[スレッド状態分析]], [[スケジューラレイテンシ]], [[仮想メモリとページング]], [[Linuxメモリ回収]], [[メモリアロケータ]], [[NUMAメモリ配置]], [[メモリリークとメモリ増大]], [[ヒュージページ]], [[ファイルシステムキャッシュ階層]], [[プリフェッチと先読み]], [[ライトバックキャッシングと同期書き込み]], [[ランダムIOとシーケンシャルIO]], [[Raw IOとDirect IO]], [[ローカルファイルシステム実装比較]], [[IOスケジューラ]], [[RAID]], [[TCP輻輳制御アルゴリズム]], [[バッファブロートとキュー管理]], [[ネットワーク割り込み合体とCPUスケーリング]], [[TCPバックログキューとSYNクッキー]], [[ハードウェア仮想化]], [[kprobe]] - Concepts (updated): [[アムダールの法則]], [[オブザーバビリティ]], [[パフォーマンスエンジニアリング]], [[継続的プロファイリング]], [[動的計装]], [[ハードウェアカウンタ]], [[Instructions Per Cycle]], [[CPU利用率]], [[同時マルチスレッディング]], [[メモリ階層とキャッシュ]], [[NUMA対応CPUピニング]], [[ページキャッシュカスタマイズ]], [[ハードディスク信頼性]], [[データセンター輻輳制御]], [[パケットフィルタリング]], [[クラウドコンピューティング]], [[コンテナ仮想化]], [[カナリアテスト]], [[BPF]], [[eBPF]], [[DTrace]], [[uprobe]] ## Observability Engineering, 2nd Edition(O'Reilly 2026、Charity Majors ほか)(2026-08-12) [[Observability Engineering 2nd Edition]]([[Charity Majors]]・[[Liz Fong-Jones]]・[[George Miranda]]・[[Austin Parker]] 著、O'Reilly Media 2026、ISBN 978-1-098-17992-2)は、オブザーバビリティを分野として確立した初版(2022)をほぼ全面改稿した第2版である。全32章を章別 source ページとして取り込んだ(第27章のみ他章より遅れて原本が揃い、増分で追加した)。構成は6部で、基礎概念(Part I: 1〜3章)→ 計装(Part II: 4〜7章)→ 分析ワークフロー(Part III: 8〜12章)→ 技術的深掘り(Part IV: 13〜17章)→ ユースケース(Part V: 18〜22章)→ ガバナンス(Part VI: 23〜31章)→ 結論(32章)と進む。中心的な主張は二つある。第一に、オブザーバビリティを「ツールの一分類」ではなくソフトウェアの[[ディペンダビリティ]]を構成する属性として捉え直す点(第1章)。第二に、[[構造化イベント]](ワイドイベント)を唯一の下部構造とし、メトリクス・ログ・トレースをそこからの導出物として扱う点(第5章)であり、これを第6章が属性カタログ、第13・14章が[[Retriever]]と[[ClickHouse]]のストレージ実装、第19章がモバイル領域への適用として裏づける。第3章は著者自身が「定義の戦いに敗れた」と総括し Observability 1.0/2.0 という区分で再出発する当事者史である。第2版を初版から隔てるのは AI の位置づけで、AI 生成コードの本番検証(第2章)・調査補助エージェント(第8・10章)・LLM アプリケーションの評価(第21章)・組織の学習速度という制約(第23章)・コード自体の位置づけの変化(第32章)と全体を貫く強制関数として扱われる。[[SRE Book]] が運用側の実践を体系化したのに対し、本書は開発者側のフィードバックループに軸足を置き、第25章がこの違いを「運用ループ対開発者ループ」として定式化する。ゲスト寄稿者13名が各分野を担当。図表95点を O'Reilly の資産 URL から取得し本文該当箇所に埋め込んだ。著作権コンテンツのため章 source ページはすべて `publish: false`。 - Sources (new): [[@2026__OReilly__Observability Engineering 2E - Chapter 1 What Is Observability?]], [[@2026__OReilly__Observability Engineering 2E - Chapter 2 How Code Crosses Over - Validating Developer Intent in Production]], [[@2026__OReilly__Observability Engineering 2E - Chapter 3 The Origins of Observability in Software]], [[@2026__OReilly__Observability Engineering 2E - Chapter 4 Getting Started with Instrumentation]], [[@2026__OReilly__Observability Engineering 2E - Chapter 5 Structured Events Are the Building Blocks of Observability]], [[@2026__OReilly__Observability Engineering 2E - Chapter 6 Making Structured Events Arbitrarily Wide]], [[@2026__OReilly__Observability Engineering 2E - Chapter 7 Instrumenting Your Code with OpenTelemetry]], [[@2026__OReilly__Observability Engineering 2E - Chapter 8 Getting Started with Observability Analysis]], [[@2026__OReilly__Observability Engineering 2E - Chapter 9 Observability-Driven Development]], [[@2026__OReilly__Observability Engineering 2E - Chapter 10 The Role of AI Agents for Observability]], [[@2026__OReilly__Observability Engineering 2E - Chapter 11 Using Service Level Objectives for Reliability]], [[@2026__OReilly__Observability Engineering 2E - Chapter 12 Acting On and Debugging SLO-Based Alerts]], [[@2026__OReilly__Observability Engineering 2E - Chapter 13 Efficient Data Storage with Retriever]], [[@2026__OReilly__Observability Engineering 2E - Chapter 14 Efficient Data Storage with ClickHouse]], [[@2026__OReilly__Observability Engineering 2E - Chapter 15 Cheap and Accurate Enough Sampling]], [[@2026__OReilly__Observability Engineering 2E - Chapter 16 Telemetry Management with Pipelines]], [[@2026__OReilly__Observability Engineering 2E - Chapter 17 Ontologies as a Shared Language for Humans and AI]], [[@2026__OReilly__Observability Engineering 2E - Chapter 18 Observability for CI-CD Pipelines]], [[@2026__OReilly__Observability Engineering 2E - Chapter 19 Observability for Mobile and Frontend]], [[@2026__OReilly__Observability Engineering 2E - Chapter 20 Performance Engineering with Observability]], [[@2026__OReilly__Observability Engineering 2E - Chapter 21 Observability for Large Language Models]], [[@2026__OReilly__Observability Engineering 2E - Chapter 22 Fin’s Case Study in Modern Engineering]], [[@2026__OReilly__Observability Engineering 2E - Chapter 23 Organizational Learning Speed Is Now Your Biggest Constraint - An Open Letter to CTOs]], [[@2026__OReilly__Observability Engineering 2E - Chapter 24 Systems Thinking for Software Delivery]], [[@2026__OReilly__Observability Engineering 2E - Chapter 25 The Observability Landscape Through a Systems Lens]], [[@2026__OReilly__Observability Engineering 2E - Chapter 26 The Business Case for Observability]], [[@2026__OReilly__Observability Engineering 2E - Chapter 27 Diagnosing Your Observability Investment]], [[@2026__OReilly__Observability Engineering 2E - Chapter 28 The Organizational Shift]], [[@2026__OReilly__Observability Engineering 2E - Chapter 29 Build Versus Buy (Versus Open Source)]], [[@2026__OReilly__Observability Engineering 2E - Chapter 30 The Art and Science of Vendor Partnerships]], [[@2026__OReilly__Observability Engineering 2E - Chapter 31 Instrumentation for Observability Teams]], [[@2026__OReilly__Observability Engineering 2E - Chapter 32 Where Do We Go From Here?]] - Entities (new): [[Austin Parker]], [[Bindplane]], [[Chad Fowler]], [[Charity Majors]], [[Christine Yen]], [[CircleCI]], [[Coreplane Labs]], [[Darragh Curran]], [[Donella Meadows]], [[Embrace]], [[Eric Trist]], [[Fin]], [[Frank Chen]], [[Fred Hebert]], [[Gartner]], [[George Miranda]], [[GitHub Actions]], [[Hanson Ho]], [[Hazel Weakly]], [[Heidi Waterhouse]], [[Hugo Santos]], [[HyperDX]], [[Intercom]], [[Jeremy Morrell]], [[Karpenter]], [[Kesha Mykhailov]], [[Mark Callaghan]], [[Martin Fowler]], [[Mat Vine]], [[Matt Klein]], [[Mike Kelly]], [[Namespace Labs]], [[Nivenly Foundation]], [[OTel Weaver]], [[Observability Engineering 2nd Edition]], [[OpAMP]], [[Peter Corless]], [[Phillip Carter]], [[Retriever]], [[Rick Clark]], [[Rudolf E. Kálmán]], [[Simon Wardley]], [[UST]], [[dynsampler-go]] - Entities (updated): [[ANZx]], [[AWS Lambda]], [[Alex Hidalgo]], [[Apache Kafka]], [[Boris Tane]], [[Brendan Gregg]], [[Bryan Cantrill]], [[ClickHouse]], [[ClickHouse Inc]], [[Cloudflare]], [[Cursor]], [[Dapper]], [[Docker]], [[Facebook]], [[Honeycomb.io]], [[Jens Rasmussen]], [[Kubernetes]], [[Liz Fong-Jones]], [[MongoDB]], [[OBI]], [[OpenTelemetry]], [[RocksDB]] - Concepts (new): [[AIサンドイッチアーキテクチャ]], [[Build Versus Buy]], [[CI-CDオブザーバビリティ]], [[オブザーバビリティ駆動開発]], [[コードのキャッシュ化]], [[ストラングラーフィグ]], [[ソシオテクニカル負債]], [[テレメトリパイプライン]], [[フィーチャーフラグ]], [[ベンダーエンジニアリング]], [[モバイルオブザーバビリティ]], [[ユーザー中心オブザーバビリティ]], [[レバレッジポイント]], [[構造化イベント]] - Concepts (updated): [[AIOps]], [[DORA]], [[DTrace]], [[DevOps]], [[GenAI オブザーバビリティ]], [[Harness Engineering]], [[LLMアプリケーション信頼性]], [[LLM評価]], [[LSMツリー]], [[Retroactive Sampling]], [[SRE AI Autonomy Levels]], [[SREエンゲージメントモデル]], [[SRE組織変革]], [[Scaling Telemetry Workloads]], [[Security Level Objectives]], [[Zonemap]], [[agentic SRE]], [[eBPF]], [[アムダールの法則]], [[アラート疲労]], [[イベントベースSLO]], [[インシデントメトリクス]], [[インシデント影響測定]], [[エラーバジェット]], [[オブザーバビリティ]], [[オブザーバビリティデータモデル]], [[カナリアテスト]], [[クォーラムベースレプリケーション]], [[クリティカルパス分析]], [[コンテキストエンジニアリング]], [[サイバネティクス]], [[サーバーレスアーキテクチャ]], [[サービスレベル目標]], [[ストレージ計算分離]], [[ダイナミックケイパビリティ]], [[テスト障害診断]], [[テレメトリ]], [[ディペンダビリティ]], [[データパーティショニング]], [[トレースサンプリング]], [[トレードオフ意思決定]], [[ネスト型カラムナストレージ]], [[パフォーマンスエンジニアリング]], [[ヒストグラムメトリクス]], [[フィードバック駆動開発]], [[フレームグラフ]], [[プラットフォームエンジニアリング]], [[ヘルメティックビルド]], [[メトリクス削減]], [[ログ重複排除]], [[事故モデル]], [[仮説駆動RCA]], [[分散トレーシング]], [[列指向OLAPデータベース]], [[時系列データベース]], [[知識のリレーションシップモデル]], [[知識グラフ]], [[組織の信頼性マインドセット]], [[継続的プロファイリング]], [[訓練不変条件]], [[逸脱の正常化]], [[開発者生産性]] ## SREをはじめよう(オライリー・ジャパン 2024、David N. Blank-Edelman)(2026-08-13) [[SREをはじめよう]]([[David N. Blank-Edelman]] 著、山口能迪 訳、オライリー・ジャパン 2024、ISBN 978-4-8144-0090-4。原書 *Becoming SRE: First Steps Toward Reliability for You and Your Organization*、O'Reilly 2024)は、SRE の技術的実践を網羅する参照書ではなく、**SRE を「始める」局面**だけに焦点を絞った入門書である。本編全 18 章と付録 A・B を章別 source ページとして取り込んだ(付録 C は SRE 関連資料リストのため対象外)。構成は 3 部で、共通基盤としての第Ⅰ部 SRE入門(1〜4章)→ 個人のキャリア軸である第Ⅱ部(5〜10章)→ 組織の導入軸である第Ⅲ部(11〜18章)と進み、第Ⅱ部と第Ⅲ部はどちらから読んでもよいと著者は述べる。中心にあるのは、SRE を仕組みや手順の集合ではなく**心構え**として定義する立場である(第2章。著者自身が「1 章だけ読むならこの章」と位置づける)。そのうえで同じ論点を個人視点と組織視点で二度扱う構造をとり、たとえば肩書きだけを付け替える「[[カーゴカルトSRE|肩書きのフリップ]]」は第6章では個人の転身の失敗として、第12章では組織の導入の失敗として現れる。第11章の 8 つの成功要因と第12章の 8 つの失敗要因も同じ対の関係にある。実務的な出発点としては [[Mikey Dickerson]] の信頼性の階層構造(第14章)が与えられ、組織構造は中央集権型・分散型・ハイブリッド型の 3 モデル(第15章)、組織の成熟は [[Benjamin Purgason]] の 5 段階(消防士→ゲートキーパー→提唱者→パートナー→エンジニア。第16章)、人のスケーリングは 0→1→6→18→48→108 という規模の目安(第17章)として整理される。本書の記述は著者単独の主張ではなく多数の実務者インタビューを骨格に据えており(序文「本書は声であふれている」)、付録 A・B の 22 名の寄稿がその形式を最も純粋に示す。[[SRE Book]] が Google の実践を体系化した参照書であるのに対し、本書は「その本を読んだ後に何をすればよいか分からない」という空白を埋める位置づけを自認する。図は原本に 3 点しかなく(図1-1・図1-2・図14-1)、PyMuPDF で該当ページからクロップして本文の該当箇所に埋め込んだ。第14章の階層を強調した同一ピラミッドの変種 6 点は、ほぼ同一構図の繰り返しのため取り込んでいない。著作権コンテンツのため章 source ページはすべて `publish: false`。 - Sources (new): [[@2024__OReillyJapan__SREをはじめよう - Chapter 1 はじめに]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 2 SREの心構え]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 3 SREの文化]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 4 SREについて語る(SREの提唱)]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 5 SREになるための準備]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 6 …からSREになる]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 7 SREとして採用されるためのヒント]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 8 SREのある一日]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 9 トイルとの関係を築く]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 10 失敗から学習する]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 11 成功のための組織的要因]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 12 SREはいかにして失敗するか]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 13 ビジネス視点からのSRE]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 14 Dickersonの信頼性の階層構造(良い出発点)]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 15 SREを組織に組み込む]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 16 SRE組織の進化段階]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 17 組織におけるSREの成長]], [[@2024__OReillyJapan__SREをはじめよう - Chapter 18 おわりに]], [[@2024__OReillyJapan__SREをはじめよう - Appendix A 若きSREへの手紙]], [[@2024__OReillyJapan__SREをはじめよう - Appendix B 元SREからのアドバイス]] - Entities (new): [[Andrew Fong]], [[Ben Lutch]], [[Benjamin Purgason]], [[Dave Rensin]], [[David N. Blank-Edelman]], [[Dina Levitan]], [[John Reese]], [[Joseph Bironas]], [[Mikey Dickerson]], [[SREをはじめよう]], [[Sara Smollett]], [[Scott MacFiggen]], [[Vivek Rau]] - Entities (updated): [[Alex Hidalgo]], [[Ben Treynor Sloss]], [[David D. Woods]], [[Fred Hebert]], [[Heinrich Hartmann]], [[Jamie Wilkinson]], [[John Allspaw]], [[Nancy G. Leveson]], [[Narayan Desai]], [[Niall Murphy]], [[Richard I. Cook]] - Concepts (new): [[NALSD]], [[SREの心構え]], [[SREの提唱]], [[SRE文化]] - Concepts (updated): [[DORA]], [[DevOps]], [[SRE]], [[SREエンゲージメントモデル]], [[SRE組織変革]], [[Safety-II]], [[インシデントストーリー]], [[エラーバジェット]], [[オブザーバビリティ]], [[オンコールストレス管理]], [[カオスエンジニアリング]], [[カーゴカルトSRE]], [[トイル]], [[プラットフォームエンジニアリング]], [[ポストモーテム]], [[レジリエンスエンジニアリング]], [[分散システム障害]], [[根本原因分析]] ## Designing Data-Intensive Applications, 2nd Edition(O'Reilly 2026、Martin Kleppmann・Chris Riccomini)(2026-08-13) [[Designing Data-Intensive Applications 2nd Edition]]([[Martin Kleppmann]]・[[Chris Riccomini]] 著、O'Reilly Media 2026-02-18 刊、672 ページ、ISBN 9781098119065。副題 *The Big Ideas Behind Reliable, Scalable, and Maintainable Systems*)は、データシステム設計の標準的教科書とされる書籍の第2版である。初版(2017)から9年を経ての全面改訂で、目次から Part 分割が消え14章がフラットに並ぶ。全14章を章別 source ページとして取り込んだ。 本書を貫くのは「最良の解は存在せず、あるのはトレードオフだけだ」という立場で、OLTP/OLAP、LSM ツリー対 B-Tree、同期対非同期レプリケーション、キーレンジ対ハッシュ、分離レベル、適時性対完全性が同型の問いとして繰り返し提示される。技術的中核は**記録系(system of record)と導出データ(derived data)の区別**にあり、第1章の定義が第3章のイベントソーシング、第11・12章のバッチとストリーム、第13章の「全順序ログを介したデータ統合」とデータベースのアンバンドリング構想へと収束する。第9・10章(部分故障・信頼できないクロック・線形化可能性・合意)は、この vault の分散系・障害系 concept 群に共通の理論的下地を与える。第14章は予測分析・監視・データの資産化を扱い、技術選択が人に及ぼす権力とエンジニアの倫理的責任を説いて閉じる。 図表100点を O'Reilly の資産 URL から取得し本文該当箇所に埋め込んだ。原本クリップは第9章の Figure 9-3 と第10章の Figure 10-9 を欠き、一部の alt text が別の図の説明と取り違えられていたため、実画像を確認して図番号を対応づけた。著作権対応で全14章 `publish: false`。 - Sources (new): [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 1 Trade-Offs in Data Systems Architecture]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 10 Consistency and Consensus]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 11 Batch Processing]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 12 Stream Processing]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 13 A Philosophy of Streaming Systems]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 14 Doing the Right Thing]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 2 Defining Nonfunctional Requirements]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 3 Data Models and Query Languages]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 4 Storage and Retrieval]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 5 Encoding and Evolution]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 6 Replication]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 7 Sharding]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 8 Transactions]], [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 9 The Trouble with Distributed Systems]] - Entities (new): [[Apache Avro]], [[Apache Flink]], [[Apache Spark]], [[Chris Riccomini]], [[Debezium]], [[Designing Data-Intensive Applications 2nd Edition]], [[Lucene]], [[Martin Kleppmann]], [[Neo4j]], [[PostgreSQL]], [[Riak]], [[Temporal]], [[ZooKeeper]], [[etcd]] - Entities (updated): [[Apache Cassandra]], [[Apache Kafka]], [[Chubby]], [[Dynamo]], [[Kubernetes]], [[MongoDB]], [[Netflix]], [[Protocol Buffers]], [[RocksDB]] - Concepts (new): [[ACIDと分離レベル]], [[DataFrame]], [[Durable Execution]], [[ID生成器と論理クロック]], [[MapReduce]], [[イベントソーシングとCQRS]], [[イベント時間とウィンドウ処理]], [[エンドツーエンド論]], [[クロック同期と信頼性]], [[グラフデータモデル]], [[コーディネーションサービス]], [[システムモデルと安全性・活性]], [[シャッフルと分散結合]], [[スキーマ発展]], [[スター・スノーフレークスキーマ]], [[ストリーム処理の耐障害性]], [[ストリーム結合]], [[スナップショット分離とMVCC]], [[データのプライバシーと同意]], [[データを資産・権力として見る視点]], [[データウェアハウス]], [[データフローエンジン]], [[データベースのアンバンドリング]], [[データレイク]], [[データ統合]], [[バイナリエンコーディング]], [[ビザンチン障害]], [[フィードバックループ]], [[マテリアライズドビューとデータキューブ]], [[マルチテナンシーのためのシャーディング]], [[マルチリーダーレプリケーション]], [[リレーショナル対ドキュメントモデル]], [[リーダーレスレプリケーション]], [[レプリケーションラグと読み取り整合性]], [[ロストアップデートと書き込みスキュー]], [[予測分析とアルゴリズムバイアス]], [[二次インデックスのシャーディング戦略]], [[分散ファイルシステムとオブジェクトストア]], [[分散ロックとリース]], [[単一リーダーレプリケーション]], [[変更データキャプチャ(CDC)]], [[多次元索引]], [[直列化可能性]], [[線形化可能性]], [[転置インデックス]], [[適時性と完全性]], [[部分故障]] - Concepts (updated): [[B-Tree]], [[B-Treeノードレイアウト最適化]], [[LSMツリー]], [[LSMツリーコンパクション]], [[TLA+]], [[TrueTime]], [[Write-Ahead Logging (WAL)]], [[べき等性]], [[インメモリデータベース]], [[クエリ実行プラン]], [[クォーラムベースレプリケーション]], [[クラウドコンピューティング]], [[グレイ障害]], [[サービスレベル目標]], [[シェアードナッシング]], [[スケーラビリティ評価]], [[ストレージ計算分離]], [[データセンターネットワーク信頼性]], [[データパーティショニング]], [[フォールトトレランス]], [[ベクトル検索インデックス]], [[マテリアライズドメトリクス]], [[リーダー選出]], [[レイテンシ分析]], [[一貫性ハッシュ法]], [[並列データベース]], [[分散コンセンサス]], [[分散システム障害]], [[分散トランザクション]], [[分散メッセージブローカ]], [[分散合意プロトコル]], [[列指向OLAPデータベース]], [[外部マージソート]], [[外部一貫性]], [[導出データ]], [[権力集中リスク]], [[知識グラフ]], [[結果整合性]], [[複製ステートマシン]], [[軽量形式手法]], [[障害注入]] ## Vistara: Making CXL Real(ISCA 2026、2026-08-13 ingest-paper) Meta 初の自社設計 CXL メモリエキスパンダ ASIC「[[Vistara]]」のハードウェア設計から Linux カーネルの TPP/TMO ベース階層化ソフトウェアスタック、数百万台規模フリートへの本番展開までを一気通貫で報告する ISCA 2026 論文。自社フリートの約40%がメモリ容量律速という課題を背景に、廃止サーバの DDR4 DIMM 再利用によるコスト・炭素排出削減と、分散キャッシュ・データウェアハウス・DevInfra・ML パラメータサーバ横断の本番改善(分散キャッシュで平均レイテンシ29%削減、分散ML推論でサーバ台数最大25%削減)を実証した。先行研究が報告したCXLのテールレイテンシ不安定性・TPPオーバーヘッド懸念を実測データで反証している点が特徴。 - Sources (new): [[@2026__ISCA__Vistara - Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment]] - Entities (new): [[Neha Gholkar]], [[Vistara]] - Entities (updated): [[Meta]], [[Chunqiang Tang]], [[AMD]] - Concepts (new): [[CXLによるメモリ拡張]] - Concepts (updated): [[NUMAメモリ配置]] ## MEGATRACE: Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters(ICDCS 2026、2026-08-13 ingest-paper) [[Beihang University]]・[[Infrawaves]] などが開発した、LLM 訓練クラスタのハング・スローダウンという痕跡を残さないサイレント障害を診断する軽量プロファイリングフレームワーク「[[MEGATRACE]]」の ICDCS 2026 論文。NCCL 集合通信 API 呼び出し(計算の narrow waist)と RDMA Work Request(通信の narrow waist)という 2 点のみの計装で、訓練スケジュール(TP/PP/DP)から反復ごとの依存 DAG を決定論的に再構築し、クリティカルパス分析でパイプラインバブルに吸収される偽陽性を除去したうえで、いつ・どのランク・どの実行ステージかまで一貫して特定する。ハング検知 F1=1.00、スローダウン検知 F1=0.95(既存 SOTA を 29.44% 上回る)、オーバーヘッド 0.16%。[[Infrawaves]] の本番 2 クラスタでのハング・CPU 割り当て不足のケーススタディを報告する。既存の [[MegaScale]]・[[Minder]]・[[Holmes]]・[[Aegis]]・[[GreyHound]]・[[C4]] を比較対象・関連手法として引用し、[[LLM学習モニタリング]]・[[クリティカルパス分析]] の両 concept に横断的知見を追加した。 図表13点(埋め込みラスター1点+PyMuPDFキャプション座標クロップ12点)・表1点(Table I、Markdown転記)を本文該当箇所に埋め込んだ。全11ページ本文+参考文献36件を通読。 - Sources (new): [[@2026__ICDCS__MEGATRACE - Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters]] - Entities (new): [[MEGATRACE]], [[Bolin Chen]], [[Jiaxun Huang]], [[Yanmin Jia]], [[Xiaohe Hu]], [[Bohua Xu]], [[Bowen Han]] - Entities (updated): [[Fangzheng Jiao]], [[Menghao Zhang]], [[Chunming Hu]], [[Infrawaves]], [[Beihang University]], [[China Unicom Software Research Institute]], [[Nanyang Technological University]], [[MegaScale]], [[Minder]], [[Holmes]], [[GreyHound]], [[C4]], [[Aegis]], [[Megatron-LM]], [[NCCL]] - Concepts (updated): [[LLM学習モニタリング]], [[クリティカルパス分析]] ## Agentic Workflows are Serverless Applications, so deploy them that way!(位置づけ不明の position paper、2026-08-13 ingest-paper) [[University of British Columbia]]・[[TU Munich]] の [[Ian Dougherty]] ほかによる position paper。サーバーレス LLM ホスティングの現状調査(ServerlessLLM・HydraServe・Medusa・CORTEX・HELIUM 等)と、エージェント型 AI ワークロードのサーバーレス適合性に関する実測分析を組み合わせる。Static RAG Agent・Mini SWE Agent・GPT-Researcher の3代表アーキタイプに対する A100 GPU 単一ノード実測で、エージェントワークフローが明確なステージ構造とアイドル期間(GPU VRAM が推論非実行中も解放されない等)を持つことを示し、モデル初期化コスト内訳の実測(gpt-oss-20b の要約タスクで合計37.34秒中29.21秒(78%)が推論エンジン初期化)を報告する。エージェントを Control Flow Graph としてモジュール化デプロイする Modular Serverless Agent System Design を提案し、Small Language Models の co-design・ワークフローグラフフレームワーク・ツールサンドボックス(CRIU/Firecracker 応用)の状態永続化という4研究方向を示す。発表媒体・DOI は web 検索で特定できず不明。 Figure 1・5・6 の掲載3ページはテキストレイヤーを持たない全ページラスター画像として埋め込まれておりテキスト抽出が完全失敗、該当ページ本文を画像目視で手動書き起こした。図表6点を全件本文該当箇所に埋め込んだ。全11ページ本文+参考文献56件を通読。 - Sources (new): [[@2026__Unknown__Agentic Workflows are Serverless Applications, so deploy them that way!]] - Entities (new): [[Ian Dougherty]], [[Natalie Lambert]], [[Joshua Wang]], [[Ethan Xu]], [[Reto Achermann]], [[Alexandra Fedorova]] - Entities (updated): [[University of British Columbia]], [[TU Munich]] - Concepts (updated): [[サーバーレスアーキテクチャ]], [[サーバーレスワークフロー]], [[LLMサービング管理]], [[KVキャッシュ管理]], [[モデルスケーリング高速化]] ## Six Dimensions of Benchmarking Time-Series Databases(EDBT '27 採録原稿、arXiv 2026-08-13 ingest-paper) [[Karlsruhe Institute of Technology]] の [[Jalal Mostafa]]・[[Sandro Melissano]](共同筆頭)ほかによる TSDB ベンチマーク SciTSv2 の提案論文。前身 SciTS(SSDBM 2022)に、接続並列性・バッチ取り込み・システムメトリクスの既存3次元へ、時系列規則性(等間隔性)・多変量系列・混合ワークロードの3次元を追加し、既存ベンチマーク(YCSB-TS・SmartBench・IoTDB-Benchmark・TS-Benchmark・TSM-Bench・TSBS)のいずれも実装していない6次元統一を実現した。InfluxDB(TSMツリー)・TimescaleDB(PostgreSQL拡張)・ClickHouse(カラムOLAP)・DataLayerTS(正則時系列特化ベクターストア)の4TSDBを評価し、正則時系列でClickHouseの取り込みレートがむしろ低下する反直感的な結果、DataLayerTSの最大178 MB/s取り込み・サブミリ秒クエリと小バッチでの1 MB/s未満への崩壊、InfluxDBの多変量クエリでの指数的レイテンシ増加(1変数1.35ms→24変数698.3ms)などを実証した。 全11ページ本文+参考文献26件を通読。全図(Figure 1〜10、うち埋め込みラスター画像0件のためPyMuPDFキャプション座標クロップで全件取得)・表2点(Table 1・2、Markdown転記)を本文該当箇所に埋め込み。 - Sources (new): [[@2026__arXiv__Six Dimensions of Benchmarking Time-Series Databases]] - Entities (new): [[InfluxDB]], [[TimescaleDB]], [[DataLayerTS]], [[Karlsruhe Institute of Technology]], [[Jalal Mostafa]], [[Sandro Melissano]] - Entities (updated): [[ClickHouse]] - Concepts (updated): [[時系列データベースベンチマーク]], [[時系列データベース]] ## OpsLLM: Construction of Large Language Model for Software Operations with Multi-stage Learning(arXiv 2026、2026-08-13 ingest-paper) [[Sun Yat-sen University]]([[Jingkai He]] 第一著者・[[Pengfei Chen]] corresponding author)と [[Alibaba Cloud]]([[Ye Li]]・[[Xidao Wen]]・[[Fang Situ]]・[[Qi Zhou]])の共同研究。知識ベース QA と根本原因分析(RCA)を統合的にサポートするソフトウェア運用ドメイン特化 LLM「OpsLLM」を、データ構築(Human-in-the-Loop によるマルチモーダル運用データのキュレーション)→ 事後訓練(LoRA による SFT + ドメインプロセス報酬モデル(DPRM)を用いた段階ゲート型 GRPO 強化学習)→ 評価(MCQ ベースの客観的 QA 評価)の3フェーズで構築する。7B/14B/32B の3スケールで既存の base/open-source/closed-source LLM を QA タスクで 0.2%〜11.9%、RCA タスクで 8.5%〜70.3% 上回り、Train Ticket への zero-shot 転移でも改善が持続することを示した。 全12ページ本文+参考文献56件を通読。図8点(Figure 1〜8、全て埋め込みラスター画像として取得)・表2点(Table I・II、Markdown転記)を本文該当箇所に埋め込み。ROUGE-L/BERTScore のような類似度ベース QA 評価がスケーリング則と矛盾する順位を出す一方、MCQ 評価が単調な順位を回復するという新規性(Fig. 2)、ドメインプロセス報酬モデル(DPRM)と人間専門家評価のスピアマン相関 0.88 という妥当性検証を確認した。 - Sources (new): [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]] - Entities (new): [[OpsLLM]], [[Jingkai He]], [[Chenghui Wu]], [[Shuang Liang]], [[Ye Li]], [[Chuanfu Zhang]], [[Fang Situ]], [[Qi Zhou]] - Entities (updated): [[Pengfei Chen]], [[Gou Tan]], [[Xidao Wen]], [[Sun Yat-sen University]], [[Alibaba Cloud]], [[GRPO]], [[VeRL]] - Concepts (updated): [[LLMによる根本原因分析]], [[検証可能報酬による強化学習]], [[障害注入]], [[報酬ハッキング]] ## Representation-Aware Root Cause Analysis with Large Language Models (Position Paper)(ICPE Companion '26、2026-08-13 ingest-paper) [[Concordia University]]([[Yiwei Wen]] 筆頭・[[Moataz Chouchen]]・[[Abdelwahab Hamou-Lhadj]])と [[University of Ottawa]]([[Mahsa Panahandeh]])の共同研究。マイクロサービスの LLM ベース根本原因分析(RCA)において、観測性データの表現設計(粒度・モダリティ・明示性・summarization)が診断精度と推論コストをどう左右するかを Train-Ticket ベンチマーク上で探索的に検証した position paper。呼び出しレベル(invocation-level)への集約が平均入力トークンを最大2桁削減しつつ精度を同等以上に保つこと、暗黙的異常指標(support・confidence)が生の数値メトリクスより一貫して有効であることを示し、4つの設計原則(P1〜P4)を提示する。 全7ページ本文+参考文献21件を通読。図1点(Figure 1、分散トレース例)を本文該当箇所に埋め込み、Table 1〜3 を Markdown 表へ忠実に転記した。最良の LLM 設定(Top1 54.5%)が非LLM手法 TraceRCA の参考値(Top1 64.8%)に及ばない点は、本 wiki が SREcon26・OpenRCA 再評価で蓄積してきた「LLM ベース RCA が非LLMベースラインや実環境で精度が伸び悩む」という観察に新たな独立サンプルを加えた。 - Sources (new): [[@2026__ICPE Companion__Representation-Aware Root Cause Analysis with Large Language Models (Position Paper)]] - Entities (new): [[Yiwei Wen]], [[Mahsa Panahandeh]], [[Moataz Chouchen]], [[Abdelwahab Hamou-Lhadj]], [[University of Ottawa]] - Entities (updated): [[Concordia University]], [[Train-Ticket]] - Concepts (updated): [[LLMによる根本原因分析]], [[RCA入力選別]], [[仮説駆動RCA]] ## SLO サービスレベル目標(オライリー・ジャパン 2023、Alex Hidalgo)(2026-08-13) [[SLO サービスレベル目標]]([[Alex Hidalgo]] 著、山口能迪 監訳、山口能迪・成田昇司 訳、オライリー・ジャパン 2023、ISBN 978-4-8144-0034-8。原書 *Implementing Service Level Objectives: A Practical Guide to SLIs, SLOs, and Error Budgets*、O'Reilly 2020)は、[[SRE Book]] が一章の一節として扱った SLI・SLO・エラーバジェットを、それだけで一冊を成す主題として展開した実践ガイドである。本編全 17 章と付録 A・B を章別 source ページとして取り込んだ。構成は 3 部で、第 I 部 SLO の開発(1〜5章)が信頼性とは何かという問いから [[信頼性スタック]](SLI→SLO→エラーバジェットの三層。SLA は並行する契約レイヤー)を組み立て、第 II 部 SLO の実装(6〜12章)が同意獲得・計測・アラート・統計・アーキテクチャという実装面を扱い、第 III 部 SLO の文化(13〜17章)が組織への定着を論じる。本書の独自性は、概念紹介にとどまらず (1) 目標値選定の統計的手法(4・9章と付録B)、(2) SLO を前提とした設計(10章)、(3) データサービスへの拡張(11章)、(4) 組織文化としての定着(第III部)という 4 方向へ踏み込んだ点にある。特に 9 章は確率分布・最尤推定/MAP/ベイズ推定・HDI・ポアソン過程・待ち行列理論を動員し、SLO の議論で通常は経験則にとどまる部分(短いウィンドウでの偶然の違反判定、レプリケーションの耐久性試算)に確率論の裏づけを与える。第 III 部は [[SREをはじめよう]] の組織論と主題が重なるが、後者が SRE という職能そのものの導入を扱うのに対し、本書は SLO という具体的実践を軸に据え、6 章「同意の獲得」(導入前)と 16 章「SLO の提唱」(定着後)を時間軸で分ける整理をとる。本書は章ごとに寄稿者が執筆する構成で、7 章 [[Benjamin H. Sigelman]]、8 章 [[Niall Murphy]]、9 章 [[Toby Burress]]・[[Jaime Woo]]、10 章 Salim Virji、11 章 [[Polina Giralt]]・[[Blake Bisset]]、13 章 [[Harold Treen]]、16 章 [[Daria Barteneva]]・[[Eva Parish]] が担当する。図表 48 点は PyMuPDF で取得した(大半がベクター描画で `get_images()` が空を返すため `get_drawings()` の外枠矩形からクロップし、15・17 章のみ埋め込みラスター画像として取得)。432 ページのため全ページレンダリングは不使用。9 章は本書で最も図が多く、本文参照 32 点のうちほぼ同一構図の反復 8 点を代表点へ統合して 24 点を埋め込んだ。著作権コンテンツのため章 source ページはすべて `publish: false`。 - Sources (new): [[@2023__OReillyJapan__SLO サービスレベル目標 - Appendix A SLOの定義のテンプレート]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Appendix B 9章の証明]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 1 信頼性スタック]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 10 信頼性を得るためのアーキテクチャ]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 11 データの信頼性]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 12 適切に機能した例]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 13 SLO文化の構築]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 14 SLOの進化]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 15 発見可能で理解可能なSLO]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 16 SLOの提唱]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 17 信頼性のレポート]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 2 信頼性についての考え方]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 3 意味のあるサービスレベル指標の開発]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 4 適切なサービスレベル目標の選択]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 5 エラーバジェットの使い方]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 6 同意の獲得]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 7 SLIとSLOの計測]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 8 SLOの監視とアラート]], [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 9 SLIとSLOの確率と統計]] - Entities (new): [[SLO サービスレベル目標]], [[Toby Burress]], [[Polina Giralt]], [[Blake Bisset]], [[Harold Treen]], [[Matt LeMay]], [[Isobel Redelmeier]], [[Eva Parish]] - Entities (updated): [[Benjamin H. Sigelman]], [[Niall Murphy]], [[Dave Rensin]], [[Daria Barteneva]], [[Jaime Woo]] - Concepts (new): [[信頼性スタック]], [[意味のあるSLI設計]], [[SLO目標値の選定]], [[ベイズ推定]] - Concepts (updated): [[サービスレベル目標]], [[エラーバジェット]], [[SLI-SLO段階的導入]], [[SLODLC]], [[SREの提唱]], [[SRE文化]], [[SRE組織変革]], [[組織の信頼性マインドセット]], [[アラート管理]], [[インシデントメトリクス]], [[インシデント重大度評価]], [[脆弱性バジェット]], [[データ品質SLO]], [[イベントベースSLO]], [[適時性と完全性]], [[データ統合]], [[RED メソッド]], [[USE メソッド]], [[サービストポロジ]], [[ユーザー中心オブザーバビリティ]], [[ダッシュボードとランブックの運用]], [[ディペンダビリティ]], [[グレースフルデグレーデーション]], [[カオスエンジニアリング]], [[NALSD]], [[時系列データベース]], [[待ち行列理論]], [[統計的機械学習]] ## SADE: Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting(arXiv 2026、2026-08-13 ingest-paper) [[University of Sydney]]([[Kuan-Hao Tseng]] 筆頭・[[Niruth Bogahawatta]]・[[Yasod Ginige]]・[[Kosta Dekic]]・[[Suranga Seneviratne]] 責任著者)と [[University of New South Wales]]([[Arunan Sivanathan]])の共同研究。Cisco の古典的な階層的トラブルシューティング方法論を LLM エージェントの明示的ポリシーとして符号化した、ネットワーク故障診断エージェント [[SADE]](Symptom-Aware Diagnostic Escalation)を提案する論文。既存 LLM エージェント(ReAct・汎用コーディングエージェント)が自由形式の熟考の中で証拠取得と仮説確定を混同する点を主要な失敗要因と位置づけ、初期スキャン→深層ネットワークスキャン(L2/インフラ→制御プレーン→ホストローカル→サービスの4フェーズ)→症状-故障ファミリ対応付け→スキル駆動の故障検知・箇所特定という4段階のフェーズゲート型ワークフローでこれを分離する。故障ファミリごとの専門知識は 15 の Claude Skills として外在化され、Fault-Index による動的な症状ルーティングと stop-and-submit ルールで探索の暴走を防ぐ。 公開 [[NIKA]] ベンチマークの held-out 523 インシデントで、SADE は RCA F1 0.77・検知精度 0.85 を達成し、ReAct + GPT-5(F1 0.40)と同一 Claude Sonnet 4.6 バックボーンの Claude Code ベースライン(F1 0.55)の両方を上回る。同一バックボーン比較により F1 差 22 ポイントを診断ポリシー自体に帰属させ、性能向上がモデル性能ではなくワークフロー設計に由来することを実証した。クロススタック故障(到達性は健全だが特定プロトコルポートだけがフィルタされている `bgp_acl_block`・`dns_port_blocked`)・大規模トポロジ(平均約101ノード)への耐性・未提出率 4.2%(ベースライン比最大3.6倍改善)を報告する。全12ページ本文+参考文献33件を通読。図表6点(Figure 1〜6)・表8点(Table I〜VIII)を本文該当箇所に埋め込んだ。 - Sources (new): [[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]] - Entities (new): [[Kuan-Hao Tseng]], [[Niruth Bogahawatta]], [[Yasod Ginige]], [[Kosta Dekic]], [[Arunan Sivanathan]], [[Suranga Seneviratne]], [[SADE]], [[NIKA]] - Entities (updated): [[University of Sydney]], [[University of New South Wales]] - Concepts (new): [[エージェント型ネットワーク障害診断]] - Concepts (updated): [[仮説駆動RCA]], [[Flexible Skill Arrangement]], [[Fault Localization]] ## A Network Arena for Benchmarking AI Agents on Network Troubleshooting(arXiv 2025、2026-08-13 ingest-paper) [[University of Electronic Science and Technology of China]]([[Zhihao Wang]] 筆頭・[[Dingde Jiang]])・[[KAUST]]([[Alessandro Cornacchia]]・[[Marco Canini]])・[[Politecnico di Torino]]([[Alessio Sacco]]・[[Franco Galante]])の共同研究。LLM 駆動のネットワークインシデント診断・トラブルシューティング向けとして現時点最大の公開ベンチマーク NIKA を提示する一次論文。Kathará コンテナエミュレーション上に、Model Context Protocol (MCP) 経由で 30 種類超のツールを公開する Agent Access Layer を構築し、5 ネットワークシナリオ×54 種の根本原因の組み合わせで 640 通りのインシデントを構成する。 GPT-OSS:20B・GPT-5-mini・GPT-5 を評価した結果、大きいモデルほど検知(89.0%/74.0%/19.0%)には成功するが、箇所特定(68.7%/36.0%/5.5%)・RCA(55.3%/22.0%/5.5%)には依然苦戦することを示した。ツール呼び出し誤り率は GPT-5 で 0.7%・GPT-5-mini で 1.6% と低く、MCP ベースの構造化インターフェースがハルシネーションを抑制する可能性を示唆する。直前に ingest した [[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]] が同じ NIKA ベンチマークを評価対象としており、SADE 側が「NIKA の LLM-as-judge プロトコル」と述べる評価尺度が本論文の記述(混同行列ベースの精度のみ)と食い違うことを発見し、両ソースおよび [[NIKA]] entity に `[!contradiction]` callout を追加した。 - Sources (new): [[@2025__arXiv__A Network Arena for Benchmarking AI Agents on Network Troubleshooting]] - Entities (new): [[Zhihao Wang]], [[Dingde Jiang]], [[Alessandro Cornacchia]], [[Marco Canini]], [[Alessio Sacco]], [[Franco Galante]], [[KAUST]], [[Politecnico di Torino]] - Entities (updated): [[University of Electronic Science and Technology of China]], [[NIKA]] - Concepts (new): [[ネットワークトラブルシューティングエージェントベンチマーク]] - Concepts (updated): [[障害注入]], [[SRE Benchmark]], [[エージェント型ネットワーク障害診断]] ## EventADL: Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems(ACM FSE 2026、2026-08-13 ingest-paper) [[RMIT University]]([[Luan Pham]] 筆頭)と [[Amazon Web Services]]([[Victor Nicolet]]・[[Joey Dodds]]・[[Hui Guan]]・[[Daniel Kroening]])の共同研究(Luan Pham の Amazon インターンシップ中に実施)。クラウド監査イベント(アクター・操作・リソース・時刻)を対象とした初のオープンボックス(open-box)異常検知・根本原因箇所特定(ADL)フレームワーク [[@2026__ACM FSE__EventADL - Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems|EventADL]] を提案する。520件の実インシデント分析により異常が Event Type(21%)・Event Value(68%)・Event Frequency(67%)の3次元に現れ、根本原因の68%が複数介入にまたがることを定量化した上で、ルールベースの Event Semantic Pattern(ESP、jsonLogic式)と Matrix Profile を離散イベント頻度に適応させた Event Frequency Pattern(EFP、magnitude-based)という2種の解釈可能なパターンで異常を検知し、アクター・操作・リソースから直接構築される Intervention Graph 上の time-aware random walk で根本原因を箇所特定する。 5データセット(Falcon・Flask・Live・OUT・AVA)で14種の異常検知ベースラインと10種のRCLベースラインを一貫して上回り、異常検知F1スコア90%以上・根本原因箇所特定AC@3スコア100%を達成した。EFPコンポーネント単体はメトリクス・ログ・トレースにも汎化する(§5.10)。全24ページ本文+参考文献70件を通読。図表8点(Figure 1〜8)のうち6点(Figure 2・3・5・6・7・8)をPyMuPDFのキャプション座標クロップで取得・埋め込み、2点(Figure 1・4、いずれもjsonLogic/JSON例)はコードブロックとして転記した。Table 1〜5をMarkdown表へ抜粋転記。既存 wiki の [[Luan Pham]] エンティティ(BAROの著者として既存)を更新し、同一著者が異常検知時刻の誤差に頑健なメトリクスベースRCA(BARO)から、イベントベースの開かれた箱設計(EventADL)へ研究を拡張した点を接続した。 - Sources (new): [[@2026__ACM FSE__EventADL - Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems]] - Entities (new): [[Victor Nicolet]], [[Joey Dodds]], [[Hui Guan]], [[Daniel Kroening]] - Entities (updated): [[Luan Pham]], [[RMIT University]], [[Amazon Web Services]] - Concepts (updated): [[異常検知]], [[グラフベースRCA]] ## Causal Software Engineering: A Vision and Roadmap(FSE Companion '26、2026-08-13 ingest-paper) [[University of Naples Federico II]](Roberto Pietrantuono 筆頭・[[Luca Giamattei]]・[[Stefano Russo]])・[[Fraunhofer IESE]]([[Julien Siebert]])・[[University of Sheffield]]([[Neil Walkinshaw]])の共同研究。既存の相関ベースのSEツール(異常検知・予測分析・AIOps・LLMエージェント)が「介入したら何が起きるか(what-if)」「別の行動をとっていたらどうだったか(counterfactual)」に答えられないという課題認識から、Causal Software Engineering(CSE)という将来パラダイムを提唱するビジョン・ロードマップ論文。マイクロサービスのリトライポリシー誤帰属事例(オートスケーリングとトラフィックシフトという交絡因子を見落として改善をリトライポリシーに誤帰属し、再現に失敗してインシデントに至る)を動機に、コード変更・設定変更・デプロイ・是正措置を do 演算子で表される因果的介入として扱う。 3種の軽量アーティファクト(causal design spec・intervention log・living causal model)と、Causal Readiness Level(CRL-0〜CRL-5)による4ルート(因果的可観測性・介入可能性・反実仮想的保証・ガバナンス&アラインメント)共進化のロードマップを提示し、Bertolino et al. のソフトウェアテストロードマップの"achievements–challenges–dreams"構造を踏襲する。intervention-effect・counterfactual incident・causal testing の3ベンチマークファミリーによる評価計画を提案するが、実証実験は行っていないビジョン論文であり、因果グラフの進化下での不安定性・反実仮想手法の分散システムへのスケーラビリティ不足を著者ら自身が未解決課題として明示する。全5ページ本文+参考文献20件を通読。図表1点(Figure 1、ロードマップ図)・表1点(Table 1)を本文該当箇所に埋め込んだ。 - Sources (new): [[@2026__FSE__Causal Software Engineering - A Vision and Roadmap]] - Entities (new): [[Roberto Pietrantuono]], [[Luca Giamattei]], [[Stefano Russo]], [[Julien Siebert]], [[Neil Walkinshaw]], [[University of Naples Federico II]], [[Fraunhofer IESE]], [[University of Sheffield]] - Concepts (new): [[Causal Software Engineering]] - Concepts (updated): [[因果推論ベースRCA]], [[根本原因分析]], [[AIOps]], [[因果発見]] ## Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications: A Review(ACM Comput. Surv. 2025、2026-08-13 ingest-paper) [[Ruyue Xin]]([[China University of Geosciences (Beijing)]] / [[University of Amsterdam]] [[Multiscale Networked Systems (MNS)]]、筆頭)・[[Jingye Wang]]([[University of Amsterdam]])・[[Peng Chen (Xihua University)]]([[Xihua University]]、責任著者)・[[Zhiming Zhao]]([[University of Amsterdam]]、責任著者)によるサーベイ。EU の Ethics Guidelines for Trustworthy AI が示す7要件から、data privacy・fairness・robustness・explainability・efficiency・human intervention という6つの技術的信頼性要件を抽出し、data collection → data preprocessing → anomaly detection → root cause localization という一般的な性能診断フレームワークへ統合した taxonomy を提示する。 Fairness はデータ収集(不均衡データ・ラベル不足へのデータサンプリング/アノテーション対応)、robustness/explainability/efficiency はデータ前処理・異常検知・根本原因箇所特定の各段階(データ拡張・アンサンブル学習・XAI・モデル枝刈り等)、data privacy と human intervention はシステム全体(ブロックチェーン・差分プライバシー・連合学習、データアノテーション・ハイパーパラメータチューニング・人間フィードバック)に対応づけられ、計13の要件-コンポーネント対応(Table 3)としてまとめられる。根本原因箇所特定における公平性研究の空白、細粒度(サービス+メトリクス単位)局所化の未成熟を将来課題として指摘する。既存 entity([[Ruyue Xin]]・[[Zhiming Zhao]]・[[Peng Chen (Xihua University)]]・[[University of Amsterdam]]・[[Xihua University]]・[[Multiscale Networked Systems (MNS)]])は CausalRCA ([[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications]]) からの再登場であり、著者陣がマイクロサービス RCA からより広い信頼できる AI サーベイへ研究を展開したことを示す。図表10点(Figure 1〜10、全て埋め込みラスター画像)・表3点(Table 1〜3、Markdown表へ抜粋転記)を本文該当箇所に埋め込み。全37ページ本文を通読。 - Sources (new): [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]] - Entities (new): [[Jingye Wang]], [[China University of Geosciences (Beijing)]] - Entities (updated): [[Ruyue Xin]], [[Zhiming Zhao]], [[Peng Chen (Xihua University)]], [[University of Amsterdam]], [[Xihua University]], [[Multiscale Networked Systems (MNS)]] - Concepts (updated): [[異常検知]], [[根本原因分析]], [[差分プライバシー]] ## TORAI: Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph(ACM FSE 2026、2026-08-13 ingest-paper) [[Luan Pham]]・[[Huong Ha]]・[[Xiuzhen Zhang]]([[RMIT University]])と [[Hongyu Zhang]]([[Chongqing University]])——BARO・RCAEval と同一著者グループ——による、サービスコールグラフを構築しない教師なしマルチソース RCA 手法 [[@2026__FSE__TORAI - Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph]]。既存のマルチソース RCA 手法が前提とする「フルトレースカバレッジ」を放棄し、トレース計装のないサービス(blind spot)が混在する環境でも動作する設計が中心的貢献。 SeverityScorer(正常期間からの z スコア的乖離で異常度を測定)→SymptomCluster(GMM + BIC で severity ベースのクラスタリング)→CausalRanker(severity クラスタ内で分割統治 Ψ-PC による因果ランキング、RCD 由来)→RankAggregation(クラスタランキング優先の統合)→FineGrainer(中央値/IQR ベースの仮説検定で細粒度指標を特定、BARO 由来)という 6 段パイプラインで構成する。トレース欠損サービスの severity ベクトル成分は ρ=0 で明示的に補完し、Sock Shop(全サービス blind spot)でも AC@1=0.84・Avg@5=0.94 を達成する。270 件の注入障害(Online Boutique/Sock Shop/Train Ticket)と実運用 10 件の障害で 9 種の SOTA ベースライン(PDiagnose・HeMiRCA・CausalRCA・MicroCause・RCD・CIRCA・BARO・MicroRank・TraceRCA)を上回り、64 サービスの Train Ticket でも平均 20.59 秒で完了する効率性を示す。RQ4 のアブレーションでは、severity による事前絞り込みなしの CausalRanker 単体が大きく性能劣化し、「因果探索単独では弱い」という Pham+ ASE 2024 の知見を自己の設計内でも再確認した。コードレベル障害(cartservice の Int32 オーバーフロー例外)もスタックトレース頻度を根本原因指標として検出できることを実証した。 著者4名・関連組織2件・評価対象システム3件・RCAEval のすべてが既存 entity として存在しており、新規 entity 作成は不要。[[因果推論ベースRCA]]に手法エントリと横断的知見2件(CIRCA/RCD/BARO の統合、コールグラフ排除の一般化)、[[限定観測可能性]]に blind spot の部分観測パターンとしての位置づけ、[[マイクロサービスコールグラフ]]に計装カバレッジという新しい欠落軸を追記した。 - Sources (new): [[@2026__FSE__TORAI - Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph]] - Entities (updated): [[Luan Pham]], [[Huong Ha]], [[Xiuzhen Zhang]], [[Hongyu Zhang]], [[RMIT University]], [[Chongqing University]], [[RCAEval]], [[Online-Boutique]], [[Sock Shop]], [[Train-Ticket]] - Concepts (updated): [[因果推論ベースRCA]], [[限定観測可能性]], [[マイクロサービスコールグラフ]] ## Quantifying Performance Variability in GPU Clusters(IEEE TPDS 2026、2026-08-13 ingest-paper) [[Rutgers University]]([[Michael Mogilevsky]]・[[Hazem Zaky]] 同等貢献、[[Mingkai Zheng]]、[[Zhao Zhang]] 責任著者)と [[George Mason University]]([[Yu Sun]]・[[Lishan Yang]])の共同研究。NVIDIA A100(NERSC [[Perlmutter]])と GH200(TACC [[Vista]])を対象に、GEMM・STREAM マイクロベンチマークと 7 実世界アプリケーション(NAMD・GROMACS・LAMMPS・NWChem・MILC・GPT・Llama)で GPU 間の性能変動を実測した特性化研究 [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]]。GEMM 変動は Tensor Cores で 3.7〜8.8%・CUDA Cores で 0.1〜8.2% の範囲であり、Tensor Cores または CUDA Cores 上の FP64 を使うアプリケーションほど変動が高いという一貫パターンを見出した。 単一 GPU での GPT 4.8B・Llama 3B 訓練の変動はそれぞれ 10.4%・8.9%。8 台の GH200 による GPT 19B の 3D 並列訓練では、最遅 GPU をどの並列次元(DP/PP/TP)に配置しても一貫して 8.0〜8.5% のスループット低下が生じ、配置自体には有意差がないことを示した。テレメトリの Pearson 相関分析により、コアクロックと実行時間の強い負相関(DVFS ブースト)、温度との弱い正相関(熱スロットリング)を両システムで定量化。48 時間の連続訓練では性能劣化は観測されなかった。同じ Rutgers 研究室が同じ Vista/Perlmutter テストベッドを用いた [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]](GPUPerf、性能予測誤差 Vista 9.38%/Perlmutter 4.98%)との横断的知見として、GPUPerf が Vista の高誤差をネットワーク要因に帰属する一方、本論文が実測する GPU ハードウェア自体の変動が代替(または並存する)要因になりうることを発見し、新規 concept [[GPU性能変動]] に集約した。図表6点(Figure 1〜6)・表7点(Table I〜VII、全て PyMuPDF キャプション座標クロップで画像化し Markdown 表へ転記)を本文該当箇所に埋め込み。全12ページ本文+参考文献45件を通読。 - Sources (new): [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] - Entities (new): [[Michael Mogilevsky]], [[Hazem Zaky]], [[Yu Sun]], [[Lishan Yang]] - Entities (updated): [[Zhao Zhang]], [[Mingkai Zheng]], [[Rutgers University]], [[George Mason University]], [[Vista]], [[Perlmutter]] - Concepts (new): [[GPU性能変動]] - Concepts (updated): [[ストラグラー]] ## CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure(arXiv 2026、2026-08-13 ingest-paper) [[Cornell University]]([[Eric Ding]] 筆頭・連絡先著者、[[Byungsoo Oh]]・[[Bhaskar Kataria]]・[[Kaiwen Guo]]・[[Jelena Gvero]]・[[Abhishek Vijaya Kumar]]・[[Arjun Devraj]]・[[Lindsey Bowen]]・[[Atharv Sonwane]]・[[Emaad Manzoor]]、[[Rachee Singh]] 最終著者)による、要約統計量ではなく実行トレース・YAMLワークロードカード・起動スクリプトの3点セットをエビデンスとして記録するトレースベースのLLM基盤ベンチマーク [[CCL-Bench]]([[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]])。大学の授業プロジェクトを起源とし、100件超のワークロード・7種のモデルアーキテクチャ・7種のフレームワーク・3種のハードウェア環境(NERSC Perlmutter A100・Google TPU v6e)を収集した。 コミュニティ拡張可能なメトリクスツールキット(MFU・compute-communication overlap・memory-transfer overhead等)、実測トレースを[[MLCommons Chakra]]の実行グラフ形式へ変換し[[Astra-Sim]]へ投入するtrace-driven what-if分析パイプライン、LLMエージェントによる構成自動探索ツール[[CCL-Search]]の3本柱で構成される。3つの技術的主張を実演した: (1) compute-communication overlapの増加は必ずしもstep time短縮を意味せず、非効率な並列化選択(EP/DPトレードオフ)を明らかにすることがある、(2) TPU ICI帯域幅の倍化はGPU scale-up帯域幅の倍化より小〜中規模ワークロードで著しく高いutilityを持つ(推論最大100倍・訓練最大22倍)一方、大規模GPU訓練ではscale-upドメイン拡大がより有効、(3) 同一ハードウェア上でもフレームワーク固有のベストチューニング後の最適構成は転移せず、あるフレームワークの最適構成を別フレームワークに適用すると最大3倍遅くなる。NCCL vs. [[MSCCL++]]、vLLM vs. SGLang、[[TorchTitan]] vs. Megatron-LMのクロスシステム比較、GPU vs. TPUのクロスアーキテクチャ比較も含む。図表15点(埋め込みUIスクリーンショット1点+PyMuPDFキャプション座標クロップ14点)・表4点を本文該当箇所に埋め込み。全24ページ本文+Appendix A〜Jを通読。 - Sources (new): [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]] - Entities (new): [[Eric Ding]], [[Byungsoo Oh]], [[Bhaskar Kataria]], [[Kaiwen Guo]], [[Jelena Gvero]], [[Abhishek Vijaya Kumar]], [[Arjun Devraj]], [[Lindsey Bowen]], [[Atharv Sonwane]], [[Emaad Manzoor]], [[Rachee Singh]], [[CCL-Bench]], [[CCL-Search]], [[MSCCL++]], [[TorchTitan]], [[MaxText]] - Entities (updated): [[Cornell University]], [[MLCommons Chakra]], [[Astra-Sim]], [[NCCL]], [[vLLM]], [[SGLang]], [[Megatron-LM]], [[PyTorch]], [[Kineto]], [[Perlmutter]], [[OpenXLA]] - Concepts (new): [[LLM基盤ベンチマーク]] - Concepts (updated): [[実行トレース]], [[並列化戦略]], [[集合通信]] ## Eagle: Leveraging Operations Documents for Comprehensive Benchmark Question Generation(FSE Companion '26、2026-08-13 ingest-paper) [[Tsinghua University]] & [[BNRist]]([[Yuhe Liu]] 筆頭、[[Longlong Xu]]、[[Dan Pei]] 責任著者)・[[Computer Network Information Center, Chinese Academy of Sciences]]([[Changhua Pei]]・[[Hang Wang]])・[[Huawei Technologies]](西安、[[Xiaogang Dong]]・[[Zhen Feng (Huawei)]])・[[China Academy of Information and Communications Technology]]([[Li Zheng (CAICT)]]・[[Kehang Ji]])の共同で、運用(Ops)ドキュメントから OpsLLM 評価用ベンチマーク QA を自動生成するフレームワーク [[Eagle (OpsLLMベンチマーク)]]([[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]])を提案。Understanding/Memory/Generation/Agent/Logic/Extraction の6コア能力 × Pre/In/Post-Event の3 Ops フェーズ × 6データモダリティのタクソノミーを定義し、LLM ガイド型ディレクトリ階層走査アルゴリズム [[DirDiver]] による知識抽出、In-Breadth/In-Depth Evolving による Seed Question 駆動の QA 生成、Critic Model + RAG ベース Answer Model による二重品質検証の4段階パイプラインを構築した。 [[Huawei Technologies]] 社内に6ヶ月間デプロイし、企業ドキュメントから4,845件の QA ペアを合成、モデル選定・ロールアウト判断に用いる社内横断ベンチマークレポートを作成した点が最大の特徴である。オフライン評価では UNIX/Redis/Zabbix の3公開コーパスで [[Bonito]]・[[Forge (5G Instruct Forge)]] という2ベースラインを専門家評点ルーブリックスコアで22%〜49%上回り、ペアワイズ勝率95%超を記録。4種の生成モデル(Qwen2.5-72B・GPT-4.1・Gemini 2.5・Claude 3.7 Sonnet)への頑健性(合計スコア差 ±0.6 点以内)、Seed Question(最大寄与)/制約/DirDiverの寄与度を定量化するアブレーション研究、10モデル横断の per-metric 評価(Memory/Logic が飽和、Generation が最弱・最も分散、Post-Event が最も頑健、Pre-Event が最も分散)も実施した。図表3点(Figure 1・2・5)を PyMuPDF キャプション座標クロップで取得し本文該当箇所に埋め込み、プロンプトテンプレート・QA 例(Figure 3・4・6〜11)は本文抽出テキストへ忠実な Markdown 引用ブロックとして転記、表7点(Table 1〜7)を Markdown 表へ転記。全11ページ本文+参考文献27件を通読。 - Sources (new): [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]] - Entities (new): [[Yuhe Liu]], [[Hang Wang]], [[Xiaogang Dong]], [[Zhen Feng (Huawei)]], [[Li Zheng (CAICT)]], [[Kehang Ji]], [[Computer Network Information Center, Chinese Academy of Sciences]], [[China Academy of Information and Communications Technology]], [[Eagle (OpsLLMベンチマーク)]], [[DirDiver]], [[Bonito]], [[Forge (5G Instruct Forge)]] - Entities (updated): [[Dan Pei]], [[Changhua Pei]], [[Longlong Xu]], [[Tsinghua University]], [[BNRist]], [[Huawei Technologies]] - Concepts (new): [[運用文書駆動ベンチマーク生成]] - Concepts (updated): [[LLM評価]], [[AIOps]], [[OpsQA]] ### [2026-08-13] ingest-book | Anatomy of an Incident(O'Reilly, 2022) Google SRE の [[Ayelet Sachto]]・[[Adrienne Walcer]](with [[Jessie Yang]])による全 7 章 70 ページの無償レポート。インシデント管理を「準備 → 対応 → 緩和と復旧」の循環するライフサイクルとして提示し、各段階に Google 社内の具体的な仕組み(DiRT・Wheel of Misfortune、コンポーネント応答者と system-of-system 応答者の二層構造、FEMA ICS の内部変種、重大度 6 区分)を対応づける。第 4 章は不信頼性 = Σ(TTD+TTR)/TBF × Impact という式で影響を定量化し、検知までの時間の短縮・修復までの時間の短縮・障害間隔の延伸という 3 つの操作変数に投資判断を分解する。第 5 章は心理的安全性とポストモーテムを 2 本柱に、根本原因対トリガー・孤立システム対全体スタック・時点対軌跡という 3 つの対比で分析の視野を広げることを説く。第 6 章は 2019 年 6 月 2 日の実インシデント「Mayan Apocalypse」を時系列で描き、40 人超が参加しても並列化が緩和を加速しない構造を実例で示す。図表 17 点を本文該当箇所へ埋め込み、全 7 章を通読。著作権コンテンツのため章 source は全て `publish: false`。 - Sources (new): [[@2022__OReilly__Anatomy of an Incident - Chapter 1 Introduction]], [[@2022__OReilly__Anatomy of an Incident - Chapter 2 Practicing Incident Response Readiness (Preparedness)]], [[@2022__OReilly__Anatomy of an Incident - Chapter 3 Scaling Incident Management (Response)]], [[@2022__OReilly__Anatomy of an Incident - Chapter 4 Mitigation and Recovery]], [[@2022__OReilly__Anatomy of an Incident - Chapter 5 Postmortems and Beyond]], [[@2022__OReilly__Anatomy of an Incident - Chapter 6 The Mayan Apocalypse - A Real-World Example]], [[@2022__OReilly__Anatomy of an Incident - Chapter 7 Conclusion and Moving Forward]] - Entities (new): [[Adrienne Walcer]], [[wiki/entities/Anatomy of an Incident|Anatomy of an Incident]], [[Ayelet Sachto]], [[Jessie Yang]] - Entities (updated): [[Ben Treynor Sloss]], [[Google]] - Concepts (new): [[心理的安全性]] - Concepts (updated): [[GameDay]], [[Incident Commander]], [[アクショナブルアラート]], [[インシデントシミュレーション]], [[インシデントメトリクス]], [[インシデント影響測定]], [[インシデント管理]], [[インシデント重大度評価]], [[オンコールストレス管理]], [[カオスエンジニアリング]], [[クラウド障害ライフサイクル]], [[グレースフルデグレーデーション]], [[プロアクティブ検証]], [[ポストモーテム]], [[レジリエンスエンジニアリング]], [[人的要因]], [[根本原因分析]], [[組織の信頼性マインドセット]], [[複雑システム障害論]], [[障害注入]], [[障害緩和]] ## ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents(arXiv 2026、2026-08-13 ingest-paper) [[Microsoft]]([[Kenan Li]] 共同筆頭)・[[Georgia Institute of Technology]]([[Qirui Jin]] 共同筆頭・[[Wenke Lee]])の共同で、SWEエージェント研究が暗黙に注目してきた5つの文脈情報信号——Reproduction Test・Regression Test・Edit Location・Execution Context・API Usage——について、SWEベンチマークのgold patchや実行トレースから機械的に「oracle(完璧に得られた場合の正解)」版を抽出し、各信号の理想的な寄与上限を定量化する統一手法 [[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]] を提案。最小構成のSWE-agentをベースエージェントとして採用し、単一信号のablationと複数信号の組み合わせの両方を評価した。 SWE-bench-Verified・Live・Proの3ベンチマーク・複数モデル(GPT-5・GPT-4o・Claude-4.5/4.6-Sonnet)で一貫してReproduction Testが最大の寄与を示し(SWE-bench-VerifiedでReproduction > Context ∼ Location > API > Regression、Live/ProでReproduction > Context ∼ API > Location > Regression)、全5要因注入で4つのモデル・ベンチマーク組み合わせすべてが97%以上の成功率に到達することを実証した。native error stackはcustom stack collectorより有意に効果的だが利用可能なインスタンスは全体の約1/4に限られること、内部APIがAPI呼び出しの約82%を占め外部APIが約18%にとどまることも報告する。強いLMが実際に抽出した信号をベースエージェントに与える2段階検証実験でも、oracle版と一致する寄与順序が再現され、oracleベースの上限測定が実運用の研究優先順位付けの指標として使えることを示した。図表11点(Figure 1〜10全図+Table 1、PyMuPDFキャプション座標クロップ)を本文該当箇所に埋め込み、Table 2〜5をMarkdown表へ転記。全27ページ本文+Appendix A〜Hを通読。 - Sources (new): [[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]] - Entities (new): [[Kenan Li]], [[Qirui Jin]], [[Wenke Lee]] - Entities (updated): [[Dongmei Zhang]], [[Microsoft]], [[Georgia Institute of Technology]], [[Agentless]], [[SWE-Bench-Verified]] - Concepts (new): [[SWEエージェントの情報信号]] ## Shaky structures: The wobbly world of causal graphs in software analytics(Empirical Software Engineering 2025、2026-08-13 ingest-paper) [[North Carolina State University]]([[Jeremy Hulse]]・[[Tim Menzies]])・[[University of Tennessee, Knoxville]]([[Nasir U. Eisty]])による、因果グラフ生成器(PC・FCI・GES・LiNGAM)がソフトウェア工学データに対して示す不安定性を定量化した実証研究 [[@2025__EMSE__Shaky structures - The wobbly world of causal graphs in software analytics]]。同一欠陥データの隣接バージョンで因果の向きが逆転する動機付け事例から出発し、リリース間・プロジェクト間・有意水準αのチューニング・90%サブサンプルという4種の摂動を、欠陥予測・ソフトウェア設定・プロジェクト管理の3タスク・23データセットに対して適用した。 Jaccard指数で測定した結果、リリース間で過半数、プロジェクト間で約75%の因果エッジが変化し、有意水準αの微小変更(特にα<0.1)では急激な相転移が、10%のデータ除去でも一部0.25まで低下する不安定性が観測された。Scott-Knott分析ではFCIが最も不安定な生成器の一つ、config・processタスクがdefectタスクより不安定という傾向を報告し、因果グラフから一般的な結論を導く前に多数の生成グラフにわたる頑健性を検証すべきだと主張する。[[Causal Software Engineering]]が課題として引用していた「進化のもとで安定な因果グラフ」問題の原典であり、取り込みにより[[因果発見]]・[[Causal Software Engineering]]の横断的知見・未解決の問いを直接更新した。図表6点(Figure 1〜5全図+Table 2内挿入図)を本文該当箇所に埋め込み、表2点(Table 6・7)をMarkdown表へ転記。全26ページを通読。 - Sources (new): [[@2025__EMSE__Shaky structures - The wobbly world of causal graphs in software analytics]] - Entities (new): [[Jeremy Hulse]], [[Tim Menzies]], [[Nasir U. Eisty]] - Entities (updated): [[North Carolina State University]], [[University of Tennessee, Knoxville]], [[Julien Siebert]] - Concepts (updated): [[因果発見]], [[Causal Software Engineering]] ## Machine Learning: The High-Interest Credit Card of Technical Debt(SE4ML: Software Engineering for Machine Learning, NIPS 2014 Workshop、2026-08-13 ingest-paper) [[Google]]の[[D. Sculley]]ほか8名による、技術的負債の枠組みを機械学習システムに初めて体系的に適用した位置づけ論文 [[@2014__SE4ML2014__Machine Learning - The High-Interest Credit Card of Technical Debt]]。entanglement(CACE原則: Changing Anything Changes Everything)・隠れたフィードバックループ・未宣言の消費者による境界侵食、不安定/未活用のデータ依存性・訂正カスケードによるデータ依存性コスト、glue code・pipeline jungles・dead experimental codepaths・configuration debtによるシステムレベルのアンチパターン、外部世界の変化への対処という4軸でリスク要因を整理する。 成熟したMLシステムでは実際にMLを行うコードは最大5%程度で残りはglue codeになりうると指摘し、Knight Capital社が廃止された実験的コードパスにより45分間で4億6,500万ドルを失った事例を引用する。実験を伴わない位置づけ論文であり、Googleでの実務経験に基づく観察と緩和戦略の提示が中心。新規 concept [[技術的負債]]を作成し、既存 concept [[ソシオテクニカル負債]]と横断的知見で相互接続した。図表なし(本文にFigure/Table参照が存在しない純テキストの論文と確認)。 - Sources (new): [[@2014__SE4ML2014__Machine Learning - The High-Interest Credit Card of Technical Debt]] - Entities (new): [[D. Sculley]], [[Gary Holt]], [[Daniel Golovin]], [[Eugene Davydov]], [[Todd Phillips]], [[Dietmar Ebner]], [[Vinay Chaudhary]], [[Michael Young]] - Entities (updated): [[Google]] - Concepts (new): [[技術的負債]] - Concepts (updated): [[ソシオテクニカル負債]] ## 詳説 データベース(Database Internals: A Deep Dive into How Distributed Data Systems Work、オライリー・ジャパン 2021 年 7 月、Alex Petrov 著・小林隆浩 監訳・成田昇司 訳、全 14 章 392 ページ)(2026-08-13 ingest-book) [[Alex Petrov]] による *Database Internals*(O'Reilly Media, 2019)の日本語版 [[詳説 データベース]]。データベースを「ストレージエンジン」と「分散システム」の二層に分解し、単一ノードのディスク上データ構造から複数ノードにまたがる合意形成までを一本の筋で扱う。第 I 部(1〜7 章)は B ツリーと LSM ツリーという二大系統の対立軸(in-place 更新 対 追記のみ、読み取り増幅 対 書き込み増幅)を、スロット化ページのバイト配置やコンパクション戦略といった実装水準まで降りて解説する。第 II 部(8〜14 章)は 8 章の不可能性結果(FLP・2 人の将軍の問題)を起点に、障害検出 → リーダー選出 → レプリケーションと一貫性 → アンチエントロピー → 分散トランザクション → 合意という積み上げで構成される。 本書の独自性は、同一の対立軸を単一ノードと分散環境の両方に一貫して適用した点にある。第 I 部の「in-place 更新か追記か」というストレージ層のトレードオフは、第 II 部では「同期的な調整か結果整合性か」という形で反復され、どちらの部でも「万能の設計はなく、何を諦めたかを言えることが設計である」という立場が貫かれる。全 14 章に各部の序論 2 本を加えた 16 件を source ページ化し(すべて `publish: false`)、図 124 点を本文該当箇所へ埋め込んだ。 - Sources (new): [[@2021__OReillyJapan__詳説 データベース - Part I 序論 ストレージエンジン]], [[@2021__OReillyJapan__詳説 データベース - Chapter 1 基本事項の紹介と概要]], [[@2021__OReillyJapan__詳説 データベース - Chapter 2 Bツリーの基本]], [[@2021__OReillyJapan__詳説 データベース - Chapter 3 ファイルフォーマット]], [[@2021__OReillyJapan__詳説 データベース - Chapter 4 Bツリーの実装]], [[@2021__OReillyJapan__詳説 データベース - Chapter 5 トランザクション処理とリカバリ]], [[@2021__OReillyJapan__詳説 データベース - Chapter 6 Bツリーの亜種]], [[@2021__OReillyJapan__詳説 データベース - Chapter 7 ログ構造化ストレージ]], [[@2021__OReillyJapan__詳説 データベース - Part II 序論 分散システム]], [[@2021__OReillyJapan__詳説 データベース - Chapter 8 基本事項の紹介と概要]], [[@2021__OReillyJapan__詳説 データベース - Chapter 9 障害検出]], [[@2021__OReillyJapan__詳説 データベース - Chapter 10 リーダー選出]], [[@2021__OReillyJapan__詳説 データベース - Chapter 11 レプリケーションと一貫性]], [[@2021__OReillyJapan__詳説 データベース - Chapter 12 アンチエントロピーと情報散布]], [[@2021__OReillyJapan__詳説 データベース - Chapter 13 分散トランザクション]], [[@2021__OReillyJapan__詳説 データベース - Chapter 14 合意]] - Entities (new): [[Akka]], [[Alex Petrov]], [[Bitcask]], [[Calvin]], [[LLAMA]], [[LMDB]], [[Percolator]], [[SQLite]], [[TPC-C]], [[WiredTiger]], [[WiscKey]], [[YCSB]], [[詳説 データベース]] - Entities (updated): [[Apache Cassandra]], [[Apache HBase]], [[Bigtable]], [[CockroachDB]], [[MongoDB]], [[PostgreSQL]], [[Riak]], [[RocksDB]], [[Spanner]], [[ZooKeeper]] - Concepts (new): [[2人の将軍の問題]], [[CAP定理]], [[CRDT]], [[FLPの不可能性]], [[アンチエントロピー]], [[スロット化ページ]], [[分散コンピューティングの誤謬]], [[障害検出器]] - Concepts (updated): [[ACIDと分離レベル]], [[ARIES]], [[B-Tree]], [[B-Treeノードレイアウト最適化]], [[LSMツリー]], [[LSMツリーコンパクション]], [[OLTPシステムアーキテクチャ]], [[TrueTime]], [[Write-Ahead Logging (WAL)]], [[べき等性]], [[インメモリデータベース]], [[クエリオプティマイザ]], [[クエリ実行プラン]], [[クォーラムベースレプリケーション]], [[クラッシュリカバリ]], [[クロック同期と信頼性]], [[グレイ障害]], [[コマンドロギング]], [[ゴシッププロトコル]], [[システムモデルと安全性・活性]], [[スキーマ発展]], [[スナップショット分離とMVCC]], [[ゾーン名前空間SSD]], [[データパーティショニング]], [[バイナリエンコーディング]], [[ビザンチン障害]], [[ファイルシステムキャッシュ階層]], [[ベンチマーキング]], [[ページキャッシュカスタマイズ]], [[メインメモリデータベース]], [[ライトバックキャッシングと同期書き込み]], [[リーダーレスレプリケーション]], [[リーダー選出]], [[レプリケーションラグと読み取り整合性]], [[ロストアップデートと書き込みスキュー]], [[分散SQLデータベース]], [[分散コンセンサス]], [[分散コンセンサス回避]], [[分散システム障害]], [[分散トランザクション]], [[分散合意プロトコル]], [[列指向OLAPデータベース]], [[単一リーダーレプリケーション]], [[地理分散SQLデータベース]], [[外部一貫性]], [[専用データベースシステム]], [[直列化可能性]], [[結果整合性]], [[線形化可能性]], [[複製ステートマシン]], [[部分故障]] ## VOID Report 2024: Exploring the Unintended Consequences of Automation in Software(Prowler(旧 Verica)、2024、著者 Courtney Nash)(2026-08-14 ingest) [[Courtney Nash]]([[Verica]] Head of Research、現在は [[Prowler]] がスポンサー・発行元)による [[VOID]] の年次レポート [[@2024__Prowler__VOID Report 2024 - Exploring the Unintended Consequences of Automation in Software]]。予備調査(58 名・55 組織)でインシデント分析(IA)への組織的支援と実践の質の相関を示した後、VOID コーパス(約 1 万件)から自動化関与インシデント 189 件を主題分析し、77% で自動化が寄与要因・75% で人間の介入必須というコードを定量化。導出した Sentinel/Gremlin/Meddler/Unreliable Narrator/Spectator/Action Item の 6 自動化アーキタイプを新規 concept 化した。Klein らの un-Fitts list・"Ten Challenges for Making Automation a 'Team Player'" を通じて、既存の [[自動化のアイロニー]]・[[Joint Activity]] concept と接続する。J Paul Reed の Lund 大学論文について既存記述(博士論文・2021)と本レポート(修士論文・2018)の学位・年が食い違う点を contradiction callout で明示した。 - Sources (new): [[@2024__Prowler__VOID Report 2024 - Exploring the Unintended Consequences of Automation in Software]] - Entities (new): [[Prowler]] - Entities (updated): [[Verica]], [[Courtney Nash]], [[David D. Woods]], [[Lisanne Bainbridge]], [[John Allspaw]], [[J Paul Reed]], [[Lorin Hochstein]] - Concepts (new): [[自動化アーキタイプ]] - Concepts (updated): [[自動化のアイロニー]], [[Joint Activity]], [[インシデント管理]] ## UniTS: A Unified Multi-Task Time Series Model(NeurIPS 2024、arXiv:2403.00131、著者 Shanghua Gao ほか)(2026-08-14 ingest-paper) [[Harvard University]]・[[MIT Lincoln Laboratory]]・[[University of Virginia]]による [[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]]。sample・prompt・task(GEN/CLS)の3種のトークンで時系列とタスク仕様をともに符号化する「タスクトークン化」により、予測・補完・異常検知(生成的タスク)と分類(識別的タスク)を単一の共有重みモデル [[UniTS]] で統一する。時間・変量の両軸への自己注意、動的線形演算子DyLinear、Gate moduleを特徴とし、38データセット(20予測+18分類)のマルチタスクco-trainingでiTransformer・TimesNet・PatchTST・GPT4TS等のタスク別専用モジュールを持つベースラインを上回り38タスク中27タスクで最良。GENトークンの複製による直接多段予測はスライディングウィンドウ方式よりMSEを最大10.5%改善しつつ推論を3倍高速化し、統一マスク再構成事前学習による凍結モデル上のprompt learningは完全教師あり学習と同等以上の性能を達成する。既存 concept [[時系列基盤モデル]]・[[多変量時系列予測]]の横断的知見・未解決の問いを更新し、TSPulse等の後続TSFM研究がUniTSを比較対象として引用している既存の横断的知見と接続した。図表9点(Figure 1〜9全図)を本文該当箇所に埋め込み、全36ページを通読。 - Sources (new): [[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]] - Entities (new): [[UniTS]], [[MIT Lincoln Laboratory]] - Entities (updated): [[Harvard University]], [[University of Virginia]] - Concepts (updated): [[時系列基盤モデル]], [[多変量時系列予測]] ## SLOconf 2021: SLO Math(SLOconf 2021、著者 Steve McGhee、16分)(2026-08-14 ingest-video) [[Steve McGhee]](Google, Reliability Advocate)による [[@2021__SLOconf__SLO Math]]。依存サービス群の可用性合成を多面ダイスのアナロジーで説明し、「SLO の集合論」として intersection availability(全依存必須、SLO^depth)・union availability(冗長構成、1-(1-SLO)^redundancy)という 2 式を提示する。component-level reliability(正三角形、total availability 目標)と scalable reliability(逆三角形、aggregate availability 目標)を対比し、"resilience via engineering"(信頼性の低いものの上に信頼性の高いものを構築できる)という考え方を導く一方、ネットワーク・ロードバランサーという制御外の依存がボトルネックとなり実際には 4〜5 nines に留まると論じる。既存 concept [[サービスレベル目標]] の「SLO Algebra はいまだ未解決」という横断的知見に対し、独立性を仮定した具体的な合成式を与える形で部分的解決を記録し、[[信頼性スタック]] の「マイクロサービス群での信頼性スタック合成」という未解決の問いにも接続した。代表フレーム 12 枚のうち 7 枚を吟味し、YouTube 字幕由来の transcript を全文読了。 - Sources (new): [[@2021__SLOconf__SLO Math]] - Entities (new): [[Steve McGhee]] - Concepts (updated): [[サービスレベル目標]], [[信頼性スタック]] ## MOMENT: A Family of Open Time-series Foundation Models(ICML 2024、arXiv:2402.03885、著者 Mononito Goswami ほか)(2026-08-14 ingest-paper) [[Carnegie Mellon University]] [[Auton Lab]](Robotics Institute)と [[University of Pennsylvania]] による [[@2024__ICML__MOMENT - A Family of Open Time-series Foundation Models]]。マスク時系列モデリング(パッチをランダムマスクし学習可能な[MASK]埋め込みで置換して再構成するMSE目的関数)で事前学習したT5型Transformerエンコーダ [[MOMENT]](Small 40M/Base 125M/Large 385M)が、長期予測・短期予測・分類・異常検知・補完の5タスクをゼロショットまたは線形プロービングだけで解く汎用性を実証した。13ドメイン・約13M系列・約1.23Bタイムスタンプの公開時系列統合コーパス [[Time Series Pile]] を新規構築・公開し、Informer長期予測データセット・Monash短期予測アーカイブ・UCR/UEA分類アーカイブ・TSB-UAD異常検知ベンチマークの4リポジトリを統合した。分類ではゼロショット表現+SVMで91UCRデータセット中平均精度0.794を達成し専用学習手法4つを除く全てを上回り、異常検知では線形プロービングがAdj. Best F1平均0.628で最良、モデルスケーリングは1エポック未満から訓練損失を低下させ、ランダム初期化がFlan-T5重み初期化より低い訓練損失に収束し、凍結した自己注意・feed-forward層でも画像・テキストのクロスモーダル系列分類でGPT-2・Flan-T5と同等の精度を達成した。一方でreversible instance normalizationに起因し垂直シフトされた時系列を区別できないという明示的な限界を持つ。既存 concept [[時系列基盤モデル]](ランダム初期化知見のChronosとの2アーキテクチャ補強、マルチタスクencoder-only系譜の起点としての位置づけ、クロスモーダル転移の逆方向知見、未解決の問い2件を追加)・[[時系列異常検知ベンチマーク]](UCR異常アーカイブでの評価指標間逆転をTimeEval/ICPE Companionの知見と接続)を更新し、既存 entity [[Mononito Goswami]]・[[Carnegie Mellon University]]・[[University of Pennsylvania]]を積み増した。図表12点(Figure 1〜6, 10〜12。Figure 7〜9は本文図の付録重複・低情報付加として除外)を本文該当箇所に埋め込み、全38ページを通読。 - Sources (new): [[@2024__ICML__MOMENT - A Family of Open Time-series Foundation Models]] - Entities (new): [[Auton Lab]], [[MOMENT]], [[Time Series Pile]], [[Konrad Szafer]], [[Arjun Choudhry]], [[Yifu Cai]], [[Shuo Li]], [[Artur Dubrawski]] - Entities (updated): [[Mononito Goswami]], [[Carnegie Mellon University]], [[University of Pennsylvania]] - Concepts (updated): [[時系列基盤モデル]], [[時系列異常検知ベンチマーク]] ## Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts(arXiv:2410.10469、著者 Xu Liu ほか)(2026-08-14 ingest-paper) [[Salesforce AI]] [[National University of Singapore]] [[Hong Kong University of Science and Technology, Guangzhou]] による [[@2024__arXiv__Moirai-MoE - Empowering Time Series Foundation Models with Sparse Mixture of Experts]]。既存の時系列基盤モデル([[Moirai]]・[[TimesFM]])が採る「頻度」という人為的なメタ特徴に基づく model specialization の限界(頻度が同じでもパターンが異なる、頻度が違ってもパターンが似る、単一系列内でも非定常)を批判し、単一の入出力射影層 + Transformer 内部のスパース Mixture-of-Experts でトークンレベルの自動 specialization を実現する。事前学習済み Moirai の自己注意出力表現に k-means クラスタリングを適用しクラスタ重心をゲーティングに用いる新手法 Token Clusters を提案し、ランダム初期化の線形射影ゲーティングを全エキスパート数構成で一貫して上回った。39 データセット(in-distribution 29・ゼロショット 10)での評価で、同等の活性化パラメータを持つ Moirai を最大 17% 上回り、TimesFM・Chronos を最大 65 倍少ない活性化パラメータで凌駕。モデル分析(t-SNE 可視化・エキスパート割り当て分布)により、深い層で頻度非依存(frequency-invariant)な表現を獲得し層を通じて漸進的なノイズ除去を行うことを明らかにした。既存 concept [[時系列基盤モデル]](Time-MoE と Moirai-MoE という時系列 MoE の 2 系統——スケール志向 vs specialization 志向——の整理、Moirai の masked encoder→decoder-only 転換の性能寄与の定量分離、頻度非依存表現の獲得過程の可視化)・[[Mixture-of-Experts]](事前学習済み表現クラスタでゲーティングする第 6 の方向、選択多様性より的を絞ったルーティングが性能に効くという観察)を更新し、著者 7 名を新規 entity として作成、[[Chenghao Liu]]・[[Doyen Sahoo]]・[[Gerald Woo]] を更新した。本文参照図表 12 点中 9 点を PyMuPDF でクロップして埋め込み(残り 3 点は付録の近似構図の反復として代表 1 点のみ採用、理由をチャット報告)、全 20 ページを通読。 - Sources (new): [[@2024__arXiv__Moirai-MoE - Empowering Time Series Foundation Models with Sparse Mixture of Experts]] - Entities (new): [[Xu Liu]], [[Juncheng Liu]], [[Taha Aksu]], [[Yuxuan Liang]], [[Roger Zimmermann]], [[Silvio Savarese]], [[Caiming Xiong]] - Entities (updated): [[Chenghao Liu]], [[Doyen Sahoo]], [[Gerald Woo]] - Concepts (updated): [[時系列基盤モデル]], [[Mixture-of-Experts]] ## Timer-XL: Long-Context Transformers for Unified Time Series Forecasting(ICLR 2025、arXiv:2410.04803、著者 Yong Liu ほか)(2026-08-14 ingest-paper) [[Tsinghua University]] School of Software, BNRist による [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]]。単変量のnext token predictionを多変量次トークン予測へ一般化し、変量依存グラフの隣接行列$C$と時間的因果マスク$\mathcal{T}$のクロネッカー積$C \otimes \mathcal{T}$でトークン間依存を厳密に分解するTimeAttentionにより、単変量・多変量・共変量付きという3種類の予測タスクをdecoder-only Transformer1つで統一する。encoder-only(UniTST)が長コンテキストで性能劣化する現象を実証し(ERA5年次コンテキストでPatchTSTのMSEが0.0745→0.1194へ悪化)、decoder-onlyのcausality維持がこれを緩和することを表現分析(注意可視化)まで踏み込んで示した。タスク特化ベンチマーク(univariate/multivariate/covariate-informed)と大規模事前学習によるゼロショット予測(UTSD+LOTSA、Time-MoE・Moirai・TimesFM・MOMENT・Chronosを含む比較で1st Count 15/22)の両方でSOTAを達成し、既存ベンチマークの性能飽和を避けるため40年分のECMWF Reanalysis v5から長コンテキスト専用ベンチマーク(ERA5-S/MS/Large)を新設した。既存 concept [[多変量時系列予測]](クロネッカー積による因果マスク明示的分解というcross-variate機構の新形態、共変量へのcausality維持のアブレーション)・[[時系列基盤モデル]](decoder-only対encoder-onlyの分岐に対する機序的説明、ベンチマーク性能飽和への新規ベンチマーク構築という対処)を更新し、著者5名を新規entityとして作成、[[Tsinghua University]]を更新した。本文参照図表12点(Figure 1〜12全図)をPyMuPDFでクロップして埋め込み、Table 12・13(既存Table 4・7の予測長別内訳)を同一実験の粒度違いとして割愛した以外は本文参照テーブル14点すべてをMarkdown表として転記し、全25ページを通読。 - Sources (new): [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]] - Entities (new): [[Yong Liu]], [[Guo Qin]], [[Xiangdong Huang]], [[Jianmin Wang]], [[Mingsheng Long]] - Entities (updated): [[Tsinghua University]] - Concepts (updated): [[多変量時系列予測]], [[時系列基盤モデル]] ## Sundial: A Family of Highly Capable Time Series Foundation Models(ICML 2025、arXiv:2502.00816、著者 Yong Liu・Guo Qin ほか)(2026-08-15 ingest-paper) [[Tsinghua University]] School of Software, BNRist(THUML グループ)による [[@2025__ICML__Sundial - A Family of Highly Capable Time Series Foundation Models]]。連続値時系列を離散化せずパッチトークン化する「ネイティブ」設計と、事前分布を一切指定しない「柔軟」設計を初めて両立する時系列基盤モデルファミリー [[Sundial]](Small 32M/Base 128M/Large 444M)を提案する。次パッチの分布を flow-matching(Lipman et al., 2022)で学習する新規訓練目的関数 [[Flow Matching|TimeFlow Loss]] を核心とし、Transformer 表現 $h_i$ を条件とする速度場をガウスノイズから反復的に押し出すことで、複数のもっともらしい予測を生成する。1 兆時系列点規模の事前学習コーパス TimeBench(LOTSA・Chronos データ・自社収集の Finance/IoT・ERA5 気象再解析・0.05% の KernelSynth 合成データ)を構築し、TSLib(Time-MoE 比 平均 MSE -7.57%/MAE -4.71%)・GIFT-Eval(97 構成中 MASE 1 位)・FEV leaderboard(ゼロショット事前学習モデル中 Chronos に次ぐ 2 位)の 3 大ベンチマークでゼロショット SOTA を、N-BEATS 級の数ミリ秒推論で達成した。同一バックボーン・同一データ規模でのアブレーション(Table 3・7)により、TimeFlow Loss が MSE 損失・拡散損失のいずれよりも一貫して優れ mode collapse(単一の過度に平滑な予測への縮退、Appendix C.1・Figure 14-15)を緩和することを実証した。新規 concept [[Flow Matching]] を立ち上げ、既存 concept [[時系列基盤モデル]](Timer-XL と Sundial が同一研究室から独立に「長コンテキスト汎化」「生成的確率予測」を追う関係、TimeFlow Loss が categorical/パラメトリック密度に並ぶ第 3 の確率的予測パラダイムという知見、未解決の問い 2 件)・[[時系列トークナイゼーション]](パッチ化+生成的損失という第 5 の方式として追加)を更新した。著者陣は Timer-XL と同じ Tsinghua 研究室であり、[[Yong Liu]]・[[Guo Qin]]・[[Xiangdong Huang]]・[[Tsinghua University]] を更新し、新規 entity として [[Mingsheng Long]]・[[Jianmin Wang]]・product entity [[Sundial]] を作成した。本文参照図表のうち Figure 1〜11・14(計 12 点)を PyMuPDF でクロップして埋め込み、ほぼ同一構図の繰り返しである Figure 12・13・15(ショーケースの追加例)は代表 1 点(Figure 11)への集約として割愛した。Table 1〜8 は Markdown 表として転記し(Table 9 は Table 1 の予測長別内訳で付録限定のため割愛)、全 23 ページを通読。 - Sources (new): [[@2025__ICML__Sundial - A Family of Highly Capable Time Series Foundation Models]] - Entities (new): [[Mingsheng Long]], [[Jianmin Wang]], [[Sundial]] - Entities (updated): [[Yong Liu]], [[Guo Qin]], [[Xiangdong Huang]], [[Tsinghua University]] - Concepts (new): [[Flow Matching]] - Concepts (updated): [[時系列基盤モデル]], [[時系列トークナイゼーション]] ## In-Context Fine-Tuning for Time-Series Foundation Models(arXiv:2410.24087、著者 Abhimanyu Das・Matthew Faw・Rajat Sen・Yichen Zhou)(2026-08-15 ingest-paper) [[Google Research]] による [[@2024__arXiv__In-Context Fine-Tuning for Time-Series Foundation Models]]。[[TimesFM]] を継続事前学習し、推論時にコンテキストウィンドウへ対象タスクの履歴に加えて他の関連時系列からの複数の文脈内例示を与えるだけで、勾配更新なしに対象ドメインへの適応相当の精度改善を得る「文脈内ファインチューニング(in-context fine-tuning)」を提案した TimesFM-ICF。素朴な時系列連結が別パターン(複数の線形トレンドが三角波に誤認される等)に混同されることを防ぐ学習可能な separator トークン、separator を含む全パッチへの交差例示アテンション、コンテキスト長の伸長に対する長さ汎化のため NoPE(No Positional Encodings)を採用した3つのアーキテクチャ変更を base モデルに施す。Monash ベンチマークで次点の教師ありベースライン(N-BEATS)・TimesFM(base)をともに7%、ETT ベンチマークで最良ベースラインを25%以上上回り、対象データセットごとに全重み更新でファインチューニングした FT-TimesFM (Full)すら約3%上回った(ファインチューニング総所要時間115分に対し推論はわずか4分)。同じコンテキスト長を単純な履歴長拡張(TimesFM (LH), L=2048)に使うより、文脈内例示に振り分ける方が効果的であることも示した。既存 concept [[文脈内学習]](テキストの例示から数値時系列の例示への拡張、勾配更新なしでファインチューニングを上回るという知見、separator による境界構造化の重要性、未解決の問い2件)・[[時系列基盤モデル]](ゼロショット対per-datasetファインチューニングの二分法に「文脈内ファインチューニング」という第三の道を追加、長履歴拡張よりコンテキスト予算を効率的に使うという知見、未解決の問い2件)を更新した。既存 entity [[Abhimanyu Das]]・[[Rajat Sen]]・[[Yichen Zhou]]・[[TimesFM]] を更新し、新規 entity として [[Matthew Faw]](University of Texas at Austin)を作成した。本文参照図表 Figure 1〜8(全8点)を全件埋め込んだ(Figure 1・2・3・4・8 は pdf.js 埋め込みラスター画像、Figure 5・6・7 はベクター描画のため PyMuPDF でキャプション座標クロップ)。全24ページを通読。 - Sources (new): [[@2024__arXiv__In-Context Fine-Tuning for Time-Series Foundation Models]] - Entities (new): [[Matthew Faw]] - Entities (updated): [[Abhimanyu Das]], [[Rajat Sen]], [[Yichen Zhou]], [[TimesFM]] - Concepts (updated): [[文脈内学習]], [[時系列基盤モデル]] ## TS-Arena -- A Live Forecast Pre-Registration Platform(KDD '26、arXiv:2512.20761、著者 Marcel Meyer・Sascha Kaltenpoth・Henrik Albers・Kevin Zalipski・Oliver Müller)(2026-08-15 ingest-paper) [[Paderborn University]] Data Analytics Group による [[@2026__arXiv__TS-Arena - A Live Forecast Pre-Registration Platform]]。時系列基盤モデル([[時系列基盤モデル]])の評価が抱える直接的情報漏洩(訓練・テストサンプル重複)と間接的な時間的情報漏洩(相関する時系列間の時間的重複、例: バスと地下鉄の利用者数)の両方を、既知の過去ではなく未知の未来のデータで評価するというアーキテクチャ的な仕組みで根絶する[[予測事前登録プロトコル|予測事前登録プロトコル(FPRP)]]を提案する。正解の実測値が物理的に存在する前にモデルへ予測の提出を厳格な登録ウィンドウ内で強制し、ウィンドウ閉鎖後の提出を拒否することでテストセット汚染を設計上不可能にする。この仕組みを [[TS-Arena]] というモジュラーなマイクロサービスアーキテクチャ(TimescaleDB・Data Portal・API Portal・Dashboard API・Front-end・Reference Model Service)で実装し、SMARD・Gridstatus・FINGRIDから取得したエネルギー領域の186本のライブ時系列を14チャレンジに束ねて運用する。評価にはMASEとTabArenaに着想を得たELOレーティング(ランダム化リプレイ・ブートストラップ B=500 による95%信頼区間付き)を用いる。2025年通年のバックテストでは5,000超のチャレンジラウンド・392万点超の評価点が生成され、chronos-2(グローバルELO 1289)が首位、tirex(1270、最低グローバルMASE 0.682)・moirai-2-small(1263)が続いた。エネルギー消費予測は高精度(MASE 0.2台)だが、発電予測は太陽光の夜間ゼロ・風力の長期ゼロ出力といった物理的境界条件により著しく困難であることも示した。新規concept [[予測事前登録プロトコル]]を立ち上げ、既存concept [[時系列基盤モデル]](静的ベンチマークSOTAとライブ評価順位の乖離という知見、未解決の問い1件)・[[ベンチマーキング]](「テスト対象の誤り」パターンの時系列予測領域での再来としての情報漏洩、アーキテクチャ的強制という解法)を更新した。新規entityとして著者5名([[Marcel Meyer]]・[[Oliver Müller]]・[[Sascha Kaltenpoth]]・[[Henrik Albers]]・[[Kevin Zalipski]])・[[Paderborn University]]・product entity [[TS-Arena]]を作成し、既存entity [[Chronos-2]]・[[TiRex]]・[[Sundial]]・[[TimesFM]]・[[TimescaleDB]]をライブ評価結果で更新した。本文参照図表Figure 1〜7(全7点、いずれもpdf.js埋め込みラスター画像)を全件埋め込んだ。Table 1〜4はMarkdown表として転記し、Table 5〜8(付録限定・本文で名指し議論なし)は割愛した。全17ページを通読。 - Sources (new): [[@2026__arXiv__TS-Arena - A Live Forecast Pre-Registration Platform]] - Entities (new): [[Marcel Meyer]], [[Oliver Müller]], [[Sascha Kaltenpoth]], [[Henrik Albers]], [[Kevin Zalipski]], [[Paderborn University]], [[TS-Arena]] - Entities (updated): [[Chronos-2]], [[TiRex]], [[Sundial]], [[TimesFM]], [[TimescaleDB]] - Concepts (new): [[予測事前登録プロトコル]] - Concepts (updated): [[時系列基盤モデル]], [[ベンチマーキング]] ## Tiny Time Mixers (TTMs): Fast Pre-trained Models for Enhanced Zero/Few-Shot Forecasting of Multivariate Time Series(NeurIPS 2024、arXiv:2401.03955、著者 Vijay Ekambaram ほか)(2026-08-15 ingest-paper) [[IBM Research]] による [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]]。100万パラメータから始まる超軽量な時系列基盤モデル [[Tiny Time Mixers (TTM)|TTM]] を提案する。自己注意を持たない軽量な TSMixer アーキテクチャをバックボーンに、adaptive patching(層ごとにパッチ長を変える)・diverse resolution sampling(高解像度データの平均化/間引きで低解像度データセットを増強)・resolution prefix tuning(解像度埋め込みを最初のパッチの prefix として付加)という3機構を新規導入し、Monash・LibCity 由来の約10億サンプルという異種解像度データセットでの事前学習を1Mパラメータ規模で成立させた。multi-level modeling(チャネル独立な backbone を凍結し、fine-tuning 時のみ decoder のチャネル混合ブロックを有効化)により、既存の多くの軽量/大規模時系列基盤モデルが欠くチャネル相関・外生変数の後付け学習を実現する。ゼロショット予測で TTM_A(5M)が311MパラメータのMoirai_Lを4〜10%、200MパラメータのTimesFMを19%、少数ショット5%でTTM_BがGPT4TS(84M)を15%上回り、CPU推論時間はChronos_Bより最大298倍高速。外生変数付きD2データセット(Bike Sharing・Carbon Capture・Application・Service)ではTTM-CMが競合モデルを15〜44%上回った。既存 concept [[時系列基盤モデル]](Toto 2.0のスケーリング則確立より約1年半早く「小型化で勝つ」路線を確立していたこと、TSPulseがTTMの延長線であること、DRSによる解像度多様性の効果がChronosのTSMixup/KernelSynthより先に定量実証されていたこと、未解決の問い2件)・[[多変量時系列予測]](事前学習ではチャネル独立・fine-tuningでのみチャネル混合を有効化する「二段階切替」というcross-variate機構の新形態、専用exogenous mixerによる外生変数の後付け注入、未解決の問い1件)を更新し、既存entity [[IBM Research]](TTM→TSPulseという時系列基盤モデル系統の起点として再整理)を更新、新規product entity [[Tiny Time Mixers (TTM)]] を作成した。本文参照図表 Figure 1〜7(全7点)を、埋め込みラスター画像が本文図の断片・装飾フラグメントに留まりFigure 6のみ38枚の埋め込みサブプロットで構成されていたため、いずれもPyMuPDFのページ座標クロップで図全体を1枚として取得し本文該当箇所に埋め込んだ。Table 1〜7を本文中で参照。全27ページ(本文12ページ+付録)を通読。 - Sources (new): [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]] - Entities (new): [[Tiny Time Mixers (TTM)]] - Entities (updated): [[IBM Research]] - Concepts (updated): [[時系列基盤モデル]], [[多変量時系列予測]] ## AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection(ASE '26、arXiv:2608.06790、著者 Gou Tan ほか、Sun Yat-sen University / Singapore Management University / Monash University)(2026-08-15 ingest-paper) [[Sun Yat-sen University]]・[[Singapore Management University]]・[[Monash University]] による国際共著 [[@2026__ASE__AgentChaos - Chaos Engineering for Agent Systems via Programmatic Fault Injection]]。全エージェントシステムが同一のHTTP request-responseインターフェースでLLMにアクセスするという観察を利用し、ソースコード変更なしにHTTP層で非侵入的にLLM API障害を注入するカオスエンジニアリングフレームワーク AgentChaos を提案する。ディペンダビリティ理論の古典的分類([[@2004__TDSC__Basic Concepts and Taxonomy of Dependable and Secure Computing]])を演繹的に適用し、crash・omission・valueの3カテゴリ×content/tool_callsの2フィールドからなる6種の障害タイプを定義、注入戦略・合成シナリオと組み合わせて65種の障害設定を構成する。トリガー検証機構により未発火タスクを除外し障害影響の過小評価を回避する設計を持つ。AutoGen・MAD・MapCoder・EvoMAC・Mini-SEの5エージェントシステム・7ベンチマーク・4バックボーンLLMを横断した評価で、全システムがpass@1最大約50ポイント低下という劣化を示し、劣化の順位はモデルを跨いで一貫しておりシステム実装に依存することを示した。既存の障害診断手法(ルールベース・LLMベース)はいずれも全体精度56%を超えず、especially omission障害(切り詰め等)の診断が最も困難という結果を得た。既存 concept [[障害注入]](LLM API層という新しい共有トランスポート層への注入、深刻さと有害性の乖離、トリガー検証という新しい「注入≠障害」対処パターン、未解決の問い2件)・[[カオスエンジニアリング]](本番インフラからLLMエージェントシステムへの対象拡張、Bradesco事例との脆弱性クラスの対比、未解決の問い1件)・[[エージェントシステム運用]](Silent失敗率の実測、根本原因局所化の限界の定量的裏付け、カオスエンジニアリングという評価的アプローチの位置づけ、未解決の問い1件)を更新した。既存entity [[Gou Tan]]・[[Pengfei Chen]]・[[Zilong He]]・[[Chuanfu Zhang]]・[[Shuai Liang]]・[[David Lo]]・[[Sun Yat-sen University]]・[[Singapore Management University]]・[[China Unicom Software Research Institute]]を更新し、新規entity [[Zhensu Sun]]・[[Jieke Shi]]・[[Ting Zhang]]・[[Qingfu Wu]]・[[Weifeng Sun]]・[[Junda He]]・[[Lwin Khin Shar]]・[[Monash University]]を作成した。本文参照図表Figure 1〜4(全4点)のうちFigure 1・3・4はベクター描画のためPyMuPDFのキャプション座標クロップで取得・埋め込み、Figure 2(JSONコードスニペット)はMarkdownコードブロックとして転記。Table 1〜9(全9点)のうちTable 1・2・5・6・8・9はMarkdown表として転記、幅の大きいTable 3・4・7はPyMuPDFで画像クロップして埋め込んだ。全13ページを通読。 - Sources (new): [[@2026__ASE__AgentChaos - Chaos Engineering for Agent Systems via Programmatic Fault Injection]] - Entities (new): [[Zhensu Sun]], [[Jieke Shi]], [[Ting Zhang]], [[Qingfu Wu]], [[Weifeng Sun]], [[Junda He]], [[Lwin Khin Shar]], [[Monash University]] - Entities (updated): [[Gou Tan]], [[Pengfei Chen]], [[Zilong He]], [[Chuanfu Zhang]], [[Shuai Liang]], [[David Lo]], [[Sun Yat-sen University]], [[Singapore Management University]], [[China Unicom Software Research Institute]] - Concepts (updated): [[障害注入]], [[カオスエンジニアリング]], [[エージェントシステム運用]] ## Mathematics for Machine Learning(Cambridge University Press 2020、Marc Peter Deisenroth・A. Aldo Faisal・Cheng Soon Ong 著、全 12 章 417 ページ)(2026-08-14 ingest-book) [[Mathematics for Machine Learning]] は、機械学習の手法を導出するのに必要な数学だけを選んで体系的に積み上げ、その数学だけで機械学習の中心問題を解いてみせる教科書である。第 I 部(第 2〜7 章)が線形代数・解析幾何・行列分解・ベクトル解析・確率と分布・連続最適化を一続きの体系として用意し、第 II 部(第 8〜12 章)が線形回帰・主成分分析・混合ガウスモデル・サポートベクターマシンをそこから導出する。本書の設計上の特徴は、同じ対象を複数の独立した観点から導出して同一の解に到達することを見せる点にあり、主成分分析は分散最大化・射影誤差最小化・確率的潜在変数モデルの 3 観点から(第 10 章)、サポートベクターマシンは幾何的マージン最大化とヒンジ損失+正則化の 2 観点から(第 12 章)導かれる。既存の [[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]] が応用と手法比較を主軸に置くのに対し、本書はその数学的基礎の側を担い、同じ手法を扱う場合でも前者が結果を所与として使うのに対し本書は第一原理から導出するという非対称な補完関係にある。全 12 章を 1 章 = 1 source ページとして取り込み、本文が参照する図 143 点を全件、本文の該当箇所へ埋め込んだ(キャプションが傍注に組まれる体裁のため、PyMuPDF で傍注キャプションとベクター描画クラスタを対応づけて切り出した)。 - Sources (new): [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 1 Introduction and Motivation]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 2 Linear Algebra]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 3 Analytic Geometry]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 4 Matrix Decompositions]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 5 Vector Calculus]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 6 Probability and Distributions]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 7 Continuous Optimization]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 8 When Models Meet Data]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 9 Linear Regression]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 10 Dimensionality Reduction with Principal Component Analysis]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 11 Density Estimation with Gaussian Mixture Models]], [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 12 Classification with Support Vector Machines]] - Entities (new): [[Mathematics for Machine Learning]], [[Marc Peter Deisenroth]], [[A. Aldo Faisal]], [[Cheng Soon Ong]] - Concepts (new): [[線形写像と変換行列]], [[直交射影]], [[固有値分解]], [[特異値分解]], [[自動微分]], [[ガウス分布の閉性]], [[共役事前分布]], [[凸最適化]], [[経験リスク最小化]], [[有向グラフィカルモデル]], [[ベイズ線形回帰]], [[混合ガウスモデル]] - Concepts (updated): [[主成分分析]], [[サポートベクターマシン]], [[カーネル法]], [[EMアルゴリズム]], [[カーネル密度推定]], [[ベイズ推定]], [[誤差逆伝播法]], [[交差検証]], [[汎化誤差バウンド]], [[統計的機械学習]], [[無向グラフィカルモデル]] ## SREエンタープライズロードマップ(Enterprise Roadmap to SRE、O'Reilly 2022、James Brookbank・Steve McGhee 著、山口 能迪 訳、全 6 章 64 ページ)(2026-08-15 ingest-book) [[SREエンタープライズロードマップ]] は、大規模かつ複雑な組織(大企業)で SRE を導入する際の課題を扱う Google/O'Reilly のテクニカルレポートである。[[SRE Book]] と [[SRE Workbook]] を基礎に置きつつ、その先にある「SRE への熱意と実際の採用レベルとのギャップ」を埋めることを目的とし、個々の技法の解説は SRE Book に委ねて、原則を組織に接続する層(組織破壊のミスの回避、可逆性の優先、J カーブの谷を越える覚悟、経営陣のスポンサーシップ、育成優先の人材論)に紙幅を割く。構成は導入の姿勢(第 1 章)→ 動機(第 2 章)→ 原則(第 3 章)→ プラクティス(第 4 章)→ 文化と育成(第 5 章)→ 他業界の事例(第 6 章)と進み、最終章のヘルスケア・小売業の事例が、前章までの抽象的な処方が業界固有の制約(規制・IT コストセンター構造・DevOps 未導入)にぶつかったときに何が起きるかを具体的に検証する役割を担う。全 6 章を 1 章 = 1 source ページとして取り込み、本文が参照する図 4 点を全件、本文の該当箇所へ埋め込んだ。著作権対応で全 6 枚 `publish: false`。 - Sources (new): [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 1 エンタープライズSREことはじめ]], [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 2 なぜ信頼性のためにSREというアプローチをとるのか?]], [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 3 SREの原則]], [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 4 SREのプラクティス]], [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 5 積極的な成功体験の育成]], [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 6 Googleを超えて]] - Entities (new): [[SREエンタープライズロードマップ]], [[James Brookbank]], [[山口 能迪]], [[Kip Primous]], [[Randall Lee]], [[The Home Depot]] - Entities (updated): [[Google]], [[Joseph Bironas]], [[Steve McGhee]] - Concepts (new): [[成長の3つの地平線]] - Concepts (updated): [[DORA]], [[DevOps]], [[SLO目標値の選定]], [[SRE]], [[SREの心構え]], [[SREエンゲージメントモデル]], [[SRE文化]], [[SRE組織変革]], [[エラーバジェット]], [[カーゴカルトSRE]], [[グッドハートの法則]], [[サービスレベル目標]], [[ソフトウェア複雑性]], [[トイル]], [[プラットフォームエンジニアリング]], [[信頼性スタック]], [[心理的安全性]], [[組織の信頼性マインドセット]] ## Safeguarding LLM Training at Scale: Online SDC Detection and Insights from 35 Million GPU Hours(OSDI '26、著者 Kinman Lei ほか、Tsinghua University / ByteDance)(2026-08-15 ingest-paper) [[Tsinghua University]]・[[ByteDance]] による [[@2026__OSDI__Safeguarding LLM Training at Scale - Online SDC Detection and Insights from 35 Million GPU Hours]]。大規模 LLM 訓練における Silent Data Corruption(SDC、アラームを出さずに誤った計算結果を生成する障害)をオンラインで検知するシステム AEGIS を提案する。cSensor(軽量な破損センシング、クリティカルパス上でインライン実行)と cVerifier(確定的な破損検証、パイプラインバブルを使ってオフパスで実行)を分離する 2 段階抽象を導入し、(1) Tensor Core 内部の混合精度(float32)アキュムレータを利用してチェックサム差分を丸め誤差ノイズから分離するアルゴリズム検知(Matmul・FlashAttention 向けに新規の代数的不変量を導出)、(2) activation recomputation や FlashAttention backward の再計算冗長性を利用した自己等価性ベースの決定論的検知(xorsum フィンガープリント)、の 2 系統を組み合わせる。3.5×10^7 GPU 時間の本番展開で 18 件の SDC インシデントと 13 台の故障 GPU を 0.86% のオーバーヘッドで検出し、既知故障 8 台の再現実験ではオフライン診断ツール(2/8=25%)に対し AEGIS(8/8=100%)が優位を示した。検出された SDC は非決定論的に発現するが根本原因は恒久的なハードウェア故障であり、リブートでは解消しないという実証的知見も提供する。新規 concept [[Silent Data Corruption (SDC)検知]] を作成し、既存 concept [[GPUレジリエンス]](オフライン診断の"通過"をSDCが裏切ること、低精度訓練が検知精度基盤を掘り崩すこと)・[[耐障害LLM訓練]](SDCが検知の前段階課題であること、SDC・gray failure の検知漏れに関する未解決の問いを具体的な検出率で更新)を更新した。既存entity [[ByteDance]]・[[Tsinghua University]]・[[Megatron-LM]]・[[Xin Liu]] を更新した。本文参照図表 Figure 1〜17(全17点)は全てベクター描画のため PyMuPDF のキャプション座標クロップで取得・埋め込み、Table 1〜2(全2点)は Markdown 表として転記。全17ページを通読。 - Sources (new): [[@2026__OSDI__Safeguarding LLM Training at Scale - Online SDC Detection and Insights from 35 Million GPU Hours]] - Entities (updated): [[ByteDance]], [[Tsinghua University]], [[Megatron-LM]], [[Xin Liu]] - Concepts (new): [[Silent Data Corruption (SDC)検知]] - Concepts (updated): [[GPUレジリエンス]], [[耐障害LLM訓練]] ## Rethinking Cloud Optimization: Volatility-Driven for Better Outcomes(SIGCOMM '26、著者 Baoqing Wang ほか、University of Science and Technology of China / Tencent Cloud)(2026-08-15 ingest-paper) [[University of Science and Technology of China]]・[[Tencent]] Cloudによる [[@2026__SIGCOMM__Rethinking Cloud Optimization - Volatility-Driven for Better Outcomes]]。クラウドオーバーサブスクリプション(過剰申込)の実効性を左右する根本要因が「ワークロードの時間的揮発性(temporal volatility)」であるという観察に基づき、時間的に相補的なワークロードを空間的に集約することで揮発性を低減し、より積極的かつ安全なオーバーサブスクリプションを実現するフレームワーク [[Hestia]] を提案する。平均基準の従来のCoefficient of Variation(CV)に代わり、最大値基準のMaximum-based Coefficient of Variation(MCV)という新指標を理論的上下界(Jensenの不等式に基づくTheorem 2.2)付きで導入した。Hestiaは Classifier(LOESS平滑化+ACFベースの周期性信頼度スコアPCSでワークロードを分類)・Aggregator(密度ベースの貪欲法DWAでNP困難なバランス分割問題を近似的に解く集約アルゴリズム)・Allocator(非対称二乗損失で学習しSLA違反を重く罰する軽量FFNによる資源割当)・Scheduler(配置)の4モジュールで構成される。Alibaba-trace-v2018・v2022の公開トレースと、著者ら自身がTencent Cloud本番環境から収集したTencent-trace-v2025の3トレースで評価し、CPU MCVを43.3%削減、オーバーサブスクリプション利益を66.74%増加させた。[[Tencent]] Cloudの本番環境に実際にデプロイされている。新規concept [[クラウドオーバーサブスクリプション]] を作成し、既存entity [[Alibaba Group]]・[[Tencent]]・[[University of Science and Technology of China]]・[[Kubernetes]] を更新した。本文参照図表Figure 1〜19(全19点)は全てベクター描画のためPyMuPDFのキャプション座標クロップで取得・埋め込み、Table 1〜2(全2点)はMarkdown表として転記。全14ページを通読。 - Sources (new): [[@2026__SIGCOMM__Rethinking Cloud Optimization - Volatility-Driven for Better Outcomes]] - Entities (new): [[Hestia]], [[Baoqing Wang]], [[Gongming Zhao]], [[Hongli Xu]], [[Shibo Wu]], [[Zhuolong Yu]], [[Jiawei Liu]], [[Junhong Lu]], [[Shaohui Xu]], [[Fanjie Meng]], [[Alibaba-trace-v2018]], [[Alibaba-trace-v2022]], [[Tencent-trace-v2025]] - Entities (updated): [[Alibaba Group]], [[Tencent]], [[University of Science and Technology of China]], [[Kubernetes]] - Concepts (new): [[クラウドオーバーサブスクリプション]] ## AIDA: Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning(SIGCOMM '26、著者 Haoran Xu ほか、Sun Yat-sen University / Alibaba Cloud)(2026-08-15 ingest-paper) [[Sun Yat-sen University]]・[[Alibaba Cloud]] による [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]]。マルチベンダーのネットワーク機器障害に対する根本原因分析(RCA)を自動化する初の細粒度システム [[AIDA]] を提案する。強化学習(GRPO)でファインチューニングしたLLMが過去の診断メールから問題記述・証拠・根本原因要約の3ノードからなる構造化推論チェーンを抽出し(SFT 50件の少量ラベルで初心者抽出器を構築後、内容完全性+論理的整合性の複合報酬でRL精錬)、SimRankベースの構造考慮ノード統合と診断特異性に基づく適応的重み付けで冗長性の少ない知識グラフ(KG)へ合成する(KGノード数62.7%削減)。新規インシデントに対しては、意味考慮ログテンプレートによる二段階フィルタリング(45.6倍のログ削減)→証拠ノード単位の検証→チェーン全体検証と信頼度ランキングという多段階推論でRAG駆動のRCAを行う。Alibaba Cloud本番ネットワークに1年以上展開され846件の障害ケースを処理し、精度95.4%を維持しながらRCA所要時間(TRCA)の中央値を72.6時間から1.6分へ、90パーセンタイル値を329.9時間から19.4時間へ短縮した。6種のバックボーンLLM(8B〜1T)を横断した評価で最強ベースライン比+8.0pt(Accuracy)・+9.8pt(Precision)の改善を示し、8BモデルのAIDAが72BモデルのLightRAGを上回った。監視によるフォルト局所化は担わず、局所化済み機器の「なぜ壊れたか」に特化する設計であり、同じAlibaba CloudグループのBiAn([[@2025__SIGCOMM__Towards LLM-Based Failure Localization in Production-Scale Networks]]、局所化)と補完関係にある。既存concept [[LLMによる根本原因分析]](推論チェーン抽出器という新カテゴリ、役割分担がモデル規模を上回る知見の再確認、KG構造に沿った文脈分解、確信度ベースabstain設計)・[[グラフベースRCA]](推論チェーン構成要素をノードとする第6の粒度、適応的重み付けノード統合)・[[RAGノイズ除去]](RCA固有ノイズのインデックス構築段除去)・[[ドメイン別RCA]](ネットワーク機器RCAという第7のドメイン)を更新した。既存entity [[Ennan Zhai]]・[[Alibaba Cloud]]・[[Sun Yat-sen University]] を更新し、新規entity [[Haoran Xu]]・[[Xuan Zeng]]・[[Xumiao Zhang]]・[[Xiaoxi Zhang]]・[[Yang Lv]]・[[Peng Zhang]]・[[Deke Guo]]・[[AIDA]] を作成した。本文参照図表Figure 1〜25(全25点)は全てベクター描画のためPyMuPDFのキャプション座標クロップで取得・埋め込み、Table 1(RCACopilot等のバックボーン別精度比較)も文字化け対策で画像クロップ。Appendix限定のFigure 26・27は除外(本文参照なし)。全17ページを通読。 - Sources (new): [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]] - Entities (new): [[Haoran Xu]], [[Xuan Zeng]], [[Xumiao Zhang]], [[Xiaoxi Zhang]], [[Yang Lv]], [[Peng Zhang]], [[Deke Guo]], [[AIDA]] - Entities (updated): [[Ennan Zhai]], [[Alibaba Cloud]], [[Sun Yat-sen University]] - Concepts (updated): [[LLMによる根本原因分析]], [[グラフベースRCA]], [[RAGノイズ除去]], [[ドメイン別RCA]] ## SDCs in the Wild: Characterizing and Diagnosing SDC-defective GPUs in Production LLM Training(OSDI '26、著者 Wenxin Zheng ほか、Shanghai Jiao Tong University / ByteDance Seed)(2026-08-15 ingest-paper) [[Shanghai Jiao Tong University]]・[[ByteDance Seed]] による [[@2026__OSDI__SDCs in the Wild - Characterizing and Diagnosing SDC-defective GPUs in Production LLM Training]]。本番 LLM 訓練クラスタで観測された GPU の Silent Data Corruption(SDC)を初めて大規模に特性調査し(SDC 欠陥 GPU 23 台)、標準的な合成マイクロベンチマークが欠陥デバイスの 60% 超を見逃すと示す。SDC は新品ハードウェアに限らず経年劣化で後から出現し(デプロイ後約1年で 40% が発現)、データ依存・ユニット固有であり ECC や温度保護では捕捉できないという 3 つの知見に基づき、自動診断システム SDCHunter を提案する。SDCHunter は Phase 1(データ並列レプリカ間の通信境界シグネチャ比較による軽量グルーピング)と Phase 2(疑わしいグループ内での全状態比較による精密局在化)の 2 段階階層的リプレイで、決定論的訓練(ステップタイム劣化 0.01% 未満)を前提に欠陥 GPU を特定する。ByteDance の本番環境に展開され、検出カバレッジ・局在化精度いずれも 100%、エンドツーエンドオーバーヘッド 4% 未満で、40 件の SDC インシデントを緩和した(オフラインデバッグ時間を数日から 1 時間未満に短縮)。同じ OSDI 2026 で発表されたオンライン SDC 検知システム [[@2026__OSDI__Safeguarding LLM Training at Scale - Online SDC Detection and Insights from 35 Million GPU Hours]](AEGIS)と多数の共著者(Yun Zhang・Gaohong Liu・Zuquan Song・Shuguang Wang・[[Wencong Xiao]]・[[Xin Liu]])が重複し、SDCHunter 論文 §8 は AEGIS を SDC 検知ツールとして明示的に参照する——AEGIS がオンラインでリアルタイムに検知し、SDCHunter がその後の欠陥 GPU 局在化・確定を担う相補関係が ByteDance の本番パイプラインで実現されている。既存 concept [[Silent Data Corruption (SDC)検知]](主要更新対象。SDCHunter と AEGIS の相補関係、合成テスト見逃し率の独立一致、SDC の恒久性への独立到達、2段階アーキテクチャへの収束、MoE/EP 融合カーネルの共通盲点を追加)・[[GPUレジリエンス]]・[[耐障害LLM訓練]] を更新した。既存 entity 8 件([[Yun Zhang]]・[[Mingcong Han]]・[[Xingda Wei]]・[[Haibo Chen]]・[[Wencong Xiao]]・[[Xin Liu]]・[[ByteDance Seed]]・[[Shanghai Jiao Tong University]])を更新し、新規 entity [[Wenxin Zheng]](筆頭著者)・[[Jinyu Gu]](corresponding author)を作成した。本文参照図表 Figure 1〜16(全16点、うち Figure 2・3 はコードスニペットのため Markdown コードブロックとして転記)・Table 1〜7(全て Markdown 表へ転記)は全て埋め込み済み(差分ゼロを確認)。図はすべてベクター描画のため PyMuPDF のキャプション座標クロップで取得。全19ページを通読。 - Sources (new): [[@2026__OSDI__SDCs in the Wild - Characterizing and Diagnosing SDC-defective GPUs in Production LLM Training]] - Entities (new): [[Wenxin Zheng]], [[Jinyu Gu]] - Entities (updated): [[Yun Zhang]], [[Mingcong Han]], [[Xingda Wei]], [[Haibo Chen]], [[Wencong Xiao]], [[Xin Liu]], [[ByteDance Seed]], [[Shanghai Jiao Tong University]] - Concepts (updated): [[Silent Data Corruption (SDC)検知]], [[GPUレジリエンス]], [[耐障害LLM訓練]] ## ディープラーニングを支える技術 ——「正解」を導くメカニズム[技術基礎](技術評論社 2022、岡野原大輔)(2026-08-15 ingest-book) [[岡野原大輔]]([[Preferred Networks]] 代表取締役 CER)による日本語のディープラーニング技術解説書 [[wiki/entities/ディープラーニングを支える技術|ディープラーニングを支える技術]] を、本編 5 章 + Appendix の全 6 枚として章単位で取り込んだ。本書の特徴は、手法をカタログのように並べるのではなく背後にある原理・原則・考え方を軸に据える点にある。第 1 章はポランニーのパラドックス(人は語れる以上のことを知っている)を人工知能実現の困難の核心に置き、ダートマス会議以降のシンボリック派とノンシンボリック派の対立史と、ムーアの法則による計算資源の指数的成長からディープラーニング隆盛の背景を説明する。第 2 章は機械学習の目的を丸暗記でなく汎化能力の獲得と定義し、学習問題を網羅性・逐次性・フィードバック種別の 3 軸で分類したうえで、クロスエントロピー損失の最小化が KL ダイバージェンス最小化であり最尤推定でもあるという等価性を示す。第 3 章は表現学習を中心概念に据え、ニューラルネットワークの構成・学習・誤差逆伝播法(層数に対して線形の計算量で勾配が得られる理由)・代表的な構成要素を通しで扱う。第 4 章は本書が最も紙数を割く章で、ReLU 等の活性化関数・スキップ接続・正規化手法を「学習の三大発明」として括り、それぞれがなぜ効くのかを直感的説明と理論的説明の双方から与える。第 5 章は画像認識(AlexNet → VGGNet → GoogleNet → ResNet → SENet)・音声認識(LAS)・自然言語処理(BERT / GPT-2 / GPT-3)の代表アーキテクチャを紹介し、Appendix は本編を読むための線形代数・微分・確率を証明抜きで厳選する。図表は 118 点(本文図 107 + 章扉図 5 + Column 図 3 + 表 3)を全点埋め込んだ。章 source はいずれも著作権コンテンツのため `publish: false` を付し、Obsidian Publish から除外している。 - Sources (new): [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 1 ディープラーニングと人工知能]], [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 2 [入門]機械学習]], [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 3 ディープラーニングの技術基礎]], [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 4 ディープラーニングの発展]], [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 5 ディープラーニングを活用したアプリケーション]], [[@2022__Gihyo__ディープラーニングを支える技術 - Appendix A [厳選基礎]機械学習&ディープラーニングのための数学]] - Entities (new): [[BERT]], [[Big Bird]], [[Chainer]], [[Daniel Kahneman]], [[David Marr]], [[DenseNet]], [[Frank Rosenblatt]], [[GoogleNet]], [[John McCarthy]], [[LAS]], [[Marvin Minsky]], [[Mask R-CNN]], [[Michael Polanyi]], [[SENet]], [[Tesla]], [[U-Net]], [[VGGNet]], [[wiki/entities/ディープラーニングを支える技術|ディープラーニングを支える技術]], [[岡野原大輔]], [[甘利俊一]] - Entities (updated): [[Apple]], [[DeepMind]], [[Facebook]], [[Fei-Fei Li]], [[GPT-2]], [[GPT-3]], [[Geoffrey Hinton]], [[ImageNet]], [[OpenAI]], [[Preferred Networks]], [[ResNet]], [[Shane Legg]], [[Yann LeCun]], [[Yoshua Bengio]] - Concepts (new): [[ポランニーのパラドックス]], [[勾配降下法]], [[学習問題設定の分類]], [[強化学習]], [[損失関数]], [[教師あり学習]], [[教師なし学習]], [[最尤推定]], [[正則化]], [[正規化層]], [[汎化能力]], [[物体検出]], [[画像セグメンテーション]], [[自己教師あり学習]], [[表現学習]], [[記号接地問題]], [[音声認識]] - Concepts (updated): [[AlexNet]], [[LSTM]], [[PAC学習]], [[RNN]], [[アテンションヘッド]], [[カバリングナンバー]], [[クラスタリング]], [[スケーリング則]], [[スパース注意]], [[ベイズ推定]], [[ムーアの法則とデナードスケーリングの終焉]], [[メモリ拡張ニューラルネットワーク]], [[主成分分析]], [[交差検証]], [[凸最適化]], [[固有値分解]], [[暗黙的正則化]], [[最小記述長原理]], [[最近傍法]], [[次元の呪い]], [[残差学習]], [[汎化誤差バウンド]], [[注意機構]], [[深層学習の汎化]], [[特異値分解]], [[独立成分分析]], [[畳み込みニューラルネットワーク]], [[経験リスク最小化]], [[統計的機械学習]], [[線形写像と変換行列]], [[線形注意]], [[自動微分]], [[言語モデル事前学習]], [[誤差逆伝播法]] ## The Anatomy of Silent Data Corruption: GPU Error Pattern Study and Modeling Guidance(arXiv 2026、Duke University / NVIDIA / University of Rochester)(2026-08-15 ingest-paper) [[Chung-Hsuan Tung]]ら([[Duke University]]/[[NVIDIA]]/[[University of Rochester]])による、production-classデータセンターGPUを対象にした大規模ゲートレベルstuck-at故障注入研究([[@2026__arXiv__The Anatomy of Silent Data Corruption - GPU Error Pattern Study and Modeling Guidance]]、arXiv 2026)を取り込んだ。2-SM構成のゲートレベルモデルに対して300万シミュレータ時間・63 CUDAマイクロベンチマークの故障注入を実施し、Silent Data Corruption(SDC)の破損型・ビット反転パターン・warp整列した空間相関を定量特性化した。NaN/±INFのような検知しやすい特殊値はSDC結果のわずか1.01%にすぎず、nullification(全ビットゼロ化)が50.68%と50倍以上支配的である。単一ビット反転はビット反転破損の40%未満(CPU報告の72–98%と対照的)にとどまり、破損アドレスはwarpサイズ(W=32)を法とした空間周期性を示す。故障箇所依存性として、制御パス故障はnullificationに、データバッファ故障は非特殊ビット反転に偏ることも示した。これらの知見をもとに、分布考慮型のソフトウェアベース故障注入テンプレートを提案する。既存の [[Silent Data Corruption (SDC)検知]] 概念が集約するAEGIS([[@2026__OSDI__Safeguarding LLM Training at Scale - Online SDC Detection and Insights from 35 Million GPU Hours]])・SDCHunter([[@2026__OSDI__SDCs in the Wild - Characterizing and Diagnosing SDC-defective GPUs in Production LLM Training]])の本番観測(チェックサム検知の限界・合成テストの見逃し率)を、ゲートレベルという独立した手法から根拠づける。 - Sources (new): [[@2026__arXiv__The Anatomy of Silent Data Corruption - GPU Error Pattern Study and Modeling Guidance]] - Entities (new): [[Chung-Hsuan Tung]], [[Yanxiang Huang]], [[Nirmal Saxena]], [[Philip Shirvani]], [[Saurabh Hukerikar]], [[Twinkle Jain]], [[Abhishek Tyagi]], [[Sanjay Gongalore]], [[University of Rochester]] - Entities (updated): [[Duke University]], [[NVIDIA]] - Concepts (updated): [[Silent Data Corruption (SDC)検知]] ## PRAXIS: Integrating Program Analysis with Observability for Root-Cause Analysis(DSN 2026、著者 Shengkun Cui ほか、University of Illinois Urbana-Champaign / IBM Research)(2026-08-15 ingest-paper) [[University of Illinois Urbana-Champaign]]・[[IBM Research]] による [[@2026__DSN__PRAXIS - Integrating Program Analysis with Observability for Root-Cause Analysis]]。サービス依存グラフ(SDG)と、コード内の制御・データ・呼び出し依存を表すhammock-blockプログラム依存グラフ(PDG)の2種のグラフに対するLLM駆動の構造化トラバーサルにより、コード・設定起因のクラウドインシデントを診断するエージェント型オーケストレータPRAXISを提案する。既存のReAct型エージェント([[@2024__CIKM__RCAgent - Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models|RCAgent]]等)がコードをプレーンテキストとして扱うのに対し、PRAXISはPDGの構造に沿ってLLMの推論経路を明示的に制約し(Expand/Relate/Complete/Discardの4ツール)、各マイクロサービスのPDGをグローバルSDGに接続してサービスレベルとコードレベルをシームレスに横断するCross-SDG-PDGトラバーサルを可能にする。[[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks|ITBench]]のOpenTelemetry Demoアプリケーション上に構築した30シナリオのCode-Cloud-RCAベンチマークで、ITBench由来のReAct型SRE-Agentをベースラインにgpt-5-codex等5種のLLMを評価し、根本原因推論(RCR)精度を最大6.3倍(32.7%→61.5%はPDG誘導 vs 生コード直接投入のアブレーション比較)、根本原因特定(RCI)精度を3.4倍、トークン消費を5.3倍(884.9k→166.5k)改善した。アブレーションでは、生コードをそのままプロンプトに詰め込む変種(PRAXIS Raw Code)がneedle-in-a-haystackとcontext rotで劣化することを実証し、グラフ構造化そのものが精度に寄与する独立要因であることを示した。デプロイメント/リソースインフラ関連障害・並行性バグはアプリケーション層のオブザーバビリティ欠如や静的解析の限界により現状スコープ外であることを明示している。既存 concept [[コード知識強化RCA]](主要更新対象。COCAに続く第二の実装系統として、PDGへのグラフ構造化・needle-in-a-haystack実証・Cross-SDG-PDGトラバーサルを追加)・[[グラフベースRCA]](コード内部を表す第7の粒度としてPDGを追加)・[[agentic SRE]](ReAct型ベースラインへのグラフ制約の効果、ツール不使用という新しい失敗モードを追加)を更新した。既存 entity 3 件([[Shengkun Cui]]・[[Saurabh Jha]]・[[Ravishankar K. Iyer]])を更新し、新規 entity [[Rahul Krishna]](IBM Research、CLDK開発者)を作成した。本文参照図表 Figure 1〜7(全7点、いずれもベクター描画のためPyMuPDFのキャプション座標クロップで取得)は全て埋め込み済み(差分ゼロを確認)。Table I(PDGトラバーサルツール)はMarkdown表へ転記。全15ページを通読。 - Sources (new): [[@2026__DSN__PRAXIS - Integrating Program Analysis with Observability for Root-Cause Analysis]] - Entities (new): [[Rahul Krishna]] - Entities (updated): [[Shengkun Cui]], [[Saurabh Jha]], [[Ravishankar K. Iyer]] - Concepts (updated): [[コード知識強化RCA]], [[グラフベースRCA]], [[agentic SRE]] ## Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features(ICPE Companion '26、著者 Adem Hmissa ほか、Polytechnique Montréal)(2026-08-15 ingest-paper) [[Polytechnique Montréal]] による [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features]]。Mozilla の Firefox 性能テスト基盤から得られる性能アラート(集約単位はアラートサマリ、`SUMMARY_ID` で生アラートを non-dropping group-by 集約)が、報告済みの Bugzilla バグと関連付けられているかを予測するリーク無し時間認識型トリアージパイプラインを提案する。識別子・目的変数由来フィールドを除去し、直近20%を将来の保留テストとする厳密な時系列分割の下、構造化アラートメタデータ(94特徴量)+時間文脈(7特徴量)+短・中・長の3解像度で計算したマルチスケール時系列特徴量(デルタ・傾き・分位点統計等、40特徴量)を融合した CatBoost 分類器(Optuna でハイパーパラメータ最適化)が、テスト AUPRC 0.851・P@50 0.920・R@200 0.941 を達成した。TF-IDF+linear・CatBoost表形式のみのベースラインに対しそれぞれ AUPRC を+0.116・+0.152改善する一方、fastText テキスト埋め込みの追加は非テキスト構成を上回らなかった(AUPRC 0.831 vs 0.851)。最重要特徴量は `n_related_alerts`(アラート集約統計)で、バグ報告前に確定する事前トリアージ相関指標として真の回帰の重大度を反映すると解釈される。パイプライン全体の実行時間93.86秒のうち時系列特徴量抽出が76.06秒(ピークRAM 6673.5MB)を占め、単一CPUでも近リアルタイム展開に耐える効率性を実証した。既存 concept [[アラートランキング]](教師あり ML 系統に時系列エンリッチメントという第4のバリアントを追加し、AlertRank との対照・リーク無し時間認識型評価の方法論的新規性を記載)・[[アラート集約]](アラート集約が「OCE のノイズ削減」だけでなく「下流 ML の学習単位を作る前処理」という第4の目的を持つことを追加)を更新した。既存 entity [[Polytechnique Montréal]] を更新し、新規 entity [[Adem Hmissa]](筆頭著者)・[[Gabriela Nicolescu]](最終著者)を作成した。本文参照図表 Figure 1(パイプライン概要、ベクター描画のためPyMuPDFキャプション座標クロップ)・Figure 2(特徴量重要度、埋め込みラスター画像)は全て埋め込み済み、Table 1〜5は全てMarkdown表へ転記。全5ページ(ICPE Companionショートペーパー)を通読。 - Sources (new): [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features]] - Entities (new): [[Adem Hmissa]], [[Gabriela Nicolescu]] - Entities (updated): [[Polytechnique Montréal]] - Concepts (updated): [[アラートランキング]], [[アラート集約]] ## A Decentralized Root Cause Localization Approach for Edge Computing Environments(IEEE TSC 2026、著者 Duneesha Fernando ほか、University of Melbourne)(2026-08-15 ingest-paper) [[University of Melbourne]] qCLOUDS Laboratory による [[@2026__TSC__A Decentralized Root Cause Localization Approach for Edge Computing Environments]]。既存の Root Cause Localization (RCL) 手法はクラウド向けの中央集中型分析を前提としており、唯一のエッジ向け先行研究 MicroCERCL も含めて監視データを中央へ集約するためエッジで適用すると転送遅延と通信オーバーヘッドが増大する。本論文は、通信頻度・コロケーションを考慮したマイクロサービスクラスタリング(Algorithm 1)でマイクロサービスをグループ化し、各クラスタ内でエッジデバイス上の Personalized PageRank (PPR) をローカル実行することで探索空間を縮小する分散 RCL を提案する。マイクロサービス層・デバイス層・ネットワーク層にまたがる異常トリガーに対応する新しい異常スコアリング機構(異常メトリクス影響+入力異常エッジ影響)と、クラスタをまたぐ稀な異常伝播に対応する軽量なクラスタ間 peer-to-peer 近似処理(JXP アルゴリズムの改変版、平均近似異常スコアの一度きりの交換)を併せて提案する。公開データセット MicroCERCL(383 シナリオ、SockShop/Hipster 由来)での評価で、分散手法は中央集中ベースラインに対し Acc@1 を HH で 0.43→0.56、SH で 0.50→0.61 に改善しつつ、局所化時間を単一クラスタ伝播ケース(311/383 件)で 23〜34%、複数クラスタ伝播ケース(72/383 件)でも 2.77〜28.79% 削減した。iAnomaly で生成した大規模データセット(50〜2,500 ノード)でのスケーラビリティ実験では、適応的クラスタリング(約 10 ノードに 1 クラスタ)がグラフ規模によらずほぼ一定の局所化時間(0.02 秒未満)を保つのに対し、中央集中 PPR は 2,500 ノードで約 1.0 秒まで増大することを示した。クラスタ粒度を細分化すると Top-1 精度が低下する精度-粒度トレードオフを著者らは validity threat として明記している。既存 concept [[Fault Localization]](「どこで計算するか」という中央集中 vs 分散の軸、クラスタ粒度と精度のトレードオフの定量的裏付けを追加)・[[PageRank]](Personalized PageRank による根本原因ランキングという第四の応用文脈、JXP アルゴリズムの分散近似への転用を追加)・[[Edge Computing]](障害診断自体がエッジ環境の制約を受けること、配置と診断が同じ設計原理を異なるライフサイクル段階で適用する点を追加)を更新した。新規 entity(person) 3 件 [[Duneesha Fernando]]・[[Maria A. Rodriguez]]・[[Rajkumar Buyya]]、entity(dataset) 1 件 [[MicroCERCL]] を作成し、既存 entity [[University of Melbourne]] を更新した。本文参照図表 Figure 1〜7(全7点、いずれも埋め込みラスター画像)は全て埋め込み済み(差分ゼロを確認)。Table I〜IV は全て Markdown 表へ転記。全14ページを通読。 - Sources (new): [[@2026__TSC__A Decentralized Root Cause Localization Approach for Edge Computing Environments]] - Entities (new): [[Duneesha Fernando]], [[Maria A. Rodriguez]], [[Rajkumar Buyya]], [[MicroCERCL]] - Entities (updated): [[University of Melbourne]] - Concepts (updated): [[Fault Localization]], [[PageRank]], [[Edge Computing]] ## 原論文から解き明かす生成AI(技術評論社 2025、著者 菊田遥平)(2026-08-15 ingest-book) [[菊田遥平]] 『原論文から解き明かす生成AI』(技術評論社, 2025 年 8 月 23 日初版, ISBN 978-4-297-15078-5, 305 ページ)を全 8 章 + Appendix の 9 枚に分割して取り込んだ。book entity は [[wiki/entities/原論文から解き明かす生成AI|原論文から解き明かす生成AI]]。本書は生成 AI の重要な原論文を数式から直接読み解く構成で、扱うモデルはすべて Transformer 型に統一されている。第 2・3 章が基礎、第 4・7 章がテキスト生成、第 5 章が画像生成、第 6 章が両者の融合、第 8 章が評価という依存関係を持つ。本書自身が「他の情報源ではあまり扱われないトピック」として挙げる 3 点(分布仮説を支持する実験的事実、拡散過程と逆拡散過程が同じ関数形で表現できる数学的保証、Chatbot Arena の背後にある数理モデル)は、それぞれ第 2・5・8 章で厚く扱われている。この vault には本書が読み解く原論文の source ページが既に 12 本あるため、各章はそれらに重ねる「読み解きの層」として機能する。図表は本文参照の全 168 点(図 149 + 表 18 + 付録図 1)を全章に埋め込み済み(未使用 attachment ゼロを機械検証)。全章 `publish: false`。 - Sources (new): [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 1 本書の読み方と論文を読み解く技術]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 2 入力データの特徴量化]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 3 生成AIモデルの大前提となるTransformer]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 4 Generative Pre-trained Transformerとテキスト生成]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 5 拡散モデルと画像生成]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 6 テキストと画像の融合]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則]], [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 8 生成AIモデルの評価]], [[@2025__Gihyo__原論文から解き明かす生成AI - Appendix 参考文献の取り扱いとビッグオー記法]] - Entities (new): [[BLIP]], [[CLIP]], [[Imagic]], [[LLaVA]], [[unCLIP]], [[wiki/entities/原論文から解き明かす生成AI|原論文から解き明かす生成AI]], [[菊田遥平]] - Entities (updated): [[Alec Radford]], [[Chatbot Arena]], [[GPT-2]], [[GPT-3]], [[OpenAI]], [[SWE-Bench-Verified]] - Concepts (new): [[Bradley-Terryモデル]], [[Vision Transformer]], [[サブワードトークン化]], [[位置埋め込み]], [[分布仮説]], [[学術論文の読解技術]], [[対照学習]], [[拡散モデル]] - Concepts (updated): [[LLMスケーリング則]], [[LLMランキング]], [[LLM評価]], [[Transformer]], [[スケーリング則]], [[スパース注意]], [[テキスト埋め込み]], [[テスト時計算スケーリング]], [[ビジョン言語モデル]], [[事前学習目的設計]], [[人間フィードバックからの強化学習]], [[強化学習スケーリング]], [[文脈内学習]], [[検証可能報酬による強化学習]], [[注意機構]], [[言語モデル事前学習]] ## HYDRA: A Multi-Level Hierarchy-Driven Approach for Robust Anomaly Detection in Time Series(SIGMOD 2026、Ohio State University / Inria)(2026-08-15 ingest-paper) [[Mingyi Huang]]・[[Qinghua Liu]]・[[Paul Boniol]]・[[John Paparrizos]]による、discordベース(Matrix Profile)とクラスタリングベース(NormA)という時系列異常検知の二大パラダイムを、階層的な代表ウィンドウ選抜と参照駆動スコアリングへ統合した教師なし手法HYDRA。TSB-ADベンチマーク40データセット・40アルゴリズム横断で単変量VUS-PR +18.7%・多変量+9.2%を統計的有意性とともに達成し、いずれの正規化方式(z-score/Min-Max/Unit-length)も振幅駆動型異常の判別信号を抑制しうることを実証した。HNSW近似版は厳密版に対し100万長系列で最大49.8倍高速化。 - Sources (new): [[@2026__SIGMOD__HYDRA - A Multi-Level Hierarchy-Driven Approach for Robust Anomaly Detection in Time Series]] - Entities (new): [[Mingyi Huang]], [[Qinghua Liu]], [[Paul Boniol]] - Entities (updated): [[John Paparrizos]], [[The Ohio State University]], [[Inria]] - Concepts (updated): [[異常検知]], [[時系列異常検知ベンチマーク]] ## Connecting 100K+ GPUs(多建屋トポロジ・CCLX・DQPLB・運用ツール、SIGCOMM 2026、Meta)(2026-08-15 ingest-paper) [[Hongyi Zeng]]・[[Min Si]]・[[Pavan Balaji]]ほか([[Meta]])による、10万GPU超が複数データセンタ建屋にまたがるRoCEファブリックの通信スタック報告。多建屋トポロジのレイテンシ階層(ラック内比7×/15×/30×)とMoE由来のバーストAll-to-Allトラフィックに対し、通信ライブラリCCLX(NVIDIA版NCCLX/AMD版RCCLX)の初期化を96K GPU規模で最大11倍高速化(265.0秒→24.0秒)、HBM使用量を64K GPU規模で約2倍削減、トランスポート層DQPLBでバッファ蓄積を最大90%削減、CollTraceベースのFault Analyzerと分散CPUエミュレーションを含む運用ツール群を報告する。先行arXiv版([[@2025__arXiv__Collective Communication for 100k+ GPUs]])のNCCLX/CTran/DQPLBをCCLXへ一般化し多建屋文脈で再提示する続編。 - Sources (new): [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]] - Entities (updated): [[NCCLX]], [[DQPLB]], [[Meta]], [[James Hongyi Zeng]], [[Min Si]], [[Pavan Balaji]], [[Minlan Yu]], [[Adithya Gangidi]], [[Rui Miao]] - Concepts (updated): [[集合通信]], [[Fault Localization]], [[RoCE設計課題]], [[Mixture-of-Experts]] ## TraceLLM: Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications(WWW 2026、Fudan University / Xidian University / Samsung)(2026-08-15 ingest-paper) [[Tong Zhou]]・[[Xin Peng]]ほか([[Fudan University]]/[[Xidian University]]/サムスン電子中国拠点)による、LLM のトレース分析能力を初めて体系的に評価する論文。Train-Ticket 上に初の instruction&response ベンチマーク TraceBench(38タスク・30,400 I&R組・12,988トレース)を構築し、GPT-4o(Zero-Shot Acc 0.734)・open-source 3モデル(最良 Qwen-3-8B で0.650)を評価。プロンプト工学ではFew-Shotが最良、トレース表現戦略はほぼ無関係という知見を得たうえで、ファインチューニング手法 TraceLLM(Trace2Text 系・Trace2Token 系)を提案し、open-source ベースラインを平均51.34%・closed-source GPT-4o を平均19.16%上回った。未見タスク・未見Webアプリケーション(OnlineBoutique)への汎化性、トレース長への頑健性も確認した。 - Sources (new): [[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]] - Entities (new): [[Tong Zhou]], [[Jie Zhang]], [[Chaofeng Sha]], [[Chenxi Zhang]], [[Zicheng Yuan]], [[Senyu Xie]] - Entities (updated): [[Xin Peng]], [[Fudan University]], [[Xidian University]], [[サムスン電子 (Samsung Electronics)]], [[Train-Ticket]], [[Online-Boutique]], [[OpenTelemetry]] - Concepts (new): [[LLMによるトレース分析]] - Concepts (updated): [[分散トレーシング]], [[LLM評価]], [[マイクロサービスベンチマーク]] ## ディープラーニングを支える技術〈2〉 ニューラルネットワーク最大の謎(技術評論社 2022、岡野原大輔)(2026-08-15 ingest-book) [[岡野原大輔]]([[Preferred Networks]])による『[[wiki/entities/ディープラーニングを支える技術|ディープラーニングを支える技術]]』の続編 [[wiki/entities/ディープラーニングを支える技術〈2〉|ディープラーニングを支える技術〈2〉]] を、本編全 6 章(第 0 章〜第 5 章)として章単位で取り込んだ。両書はもともと一冊として執筆され、分量と主題の広がりから二分冊になった経緯を持つ。前書が「何がどう動くのか」を扱う技術基礎書だったのに対し、本書は「なぜそれが成り立つのか」を扱う。中心にあるのは題名どおりの二つの謎である。第 1 章は「なぜ学習できるのか」に最適化理論の側から答え、極小解・プラトー・鞍点が無数にある非凸最適化でありながら、幅の広いネットワークでは初期値から最適解まで単調減少する経路(Star-convex Path)が存在しやすいことを示し、条件数を軸にモーメンタム法が収束率の条件数依存を κ から √κ へ弱める仕組みを説明する。第 2 章は「なぜ汎化するのか」に答える本書の中心章で、ランダムラベルすら丸暗記できる表現力を持ちながら過学習しない矛盾を、勾配降下法によるノルム最小化・低ランク化、フラットな解への到達(MDL・PAC-Bayes による説明)、宝くじ仮説という 3 つの仕組みからなる陰的正則化(implicit regularization)で解明する。第 3 章は深層生成モデルを「生成を通じて複雑な世界を理解する」視点で捉え、VAE・GAN・自己回帰モデル・正規化フロー・拡散モデルの 5 手法を、抽象化表現・尤度評価・学習安定性・生成忠実度・生成速度の 5 軸で横断比較する。第 4 章は本書最長(82 ページ)で、強化学習を教師あり学習との 3 つの違い(評価的フィードバックのみ・時間差の信用割当問題・非 i.i.d. データ)から特徴づけ、ベルマン方程式による価値推定と方策勾配法による方策改善という 2 軸で手法を体系化したうえで、DQN と AlphaGo ファミリー(AlphaGo → AlphaGo Zero → AlphaZero → MuZero)を詳説する。第 5 章は 2022 年 5 月時点の展望で、自己教師あり学習の発展、Richard Sutton の Bitter Lesson をめぐる計算性能と汎用手法の論争、不変性・同変性による帰納バイアスの組み込み、システム 1 は達成しつつあるがシステム 2 は未達という課題整理を論じる。図表は 84 点(図 83 + 表 1)を全点埋め込んだ。章 source はいずれも著作権コンテンツのため `publish: false` を付し、Obsidian Publish から除外している。 - Sources (new): [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 0 ディープラーニングとは何か]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 1 ディープラーニングの最適化]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 2 ディープラーニングの汎化]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 3 深層生成モデル]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]], [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 5 これからのディープラーニングと人工知能]] - Entities (new): [[wiki/entities/ディープラーニングを支える技術〈2〉|ディープラーニングを支える技術〈2〉]], [[AlphaGo]] - Entities (updated): [[DeepMind]] - Concepts (new): [[VAE(変分オートエンコーダ)]], [[GAN(敵対的生成ネットワーク)]], [[正規化フロー]], [[自己回帰モデル]], [[ベルマン方程式]], [[方策勾配法]], [[モンテカルロ木探索]], [[DQN]], [[宝くじ仮説]], [[条件数]], [[不変性と同変性]] ## Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports(ICPE Companion 2026、Vrije Universiteit Amsterdam / University of Amsterdam / Delft University of Technology)(2026-08-15 ingest-paper) [[Xiaoyu Chu]]・[[Shashikant Ilager]]・[[Yizhen Zang]]・[[Sacheendra Talluri]]・[[Alexandru Iosup]]による、LLMを用いてクラウドインシデントレポートから構造化情報を抽出する体系的評価(ICPE Companion '26 Work In Progress Paper)。AWS・AZURE・GCPの3プロバイダから3,087件のインシデントレポートを収集し460件(15%)を手動アノテーションした、公開クラウドインシデントデータセット・抽出ツールボックスとしては初のもの。5つのプロンプトコンポーネント(Task/CoT/Category/Examples/Format)を組み合わせた6戦略と、軽量3種・SotA3種の計6LLM(GPT-3.5/GPT-4o、Claude 3.5/Claude 4、Gemini 2.0/Gemini 2.5)を比較し、メタデータ抽出精度75–95%を達成した。Few-shotプロンプティングは分類フィールドを除き精度を全般的に改善(最大改善17.34%)し、出力トークン短縮によりレイテンシも改善する一方、入力トークンは1.5–2倍必要となる。軽量モデル(Gemini 2.0・GPT 3.5)は精度・コスト・レイテンシで良好なバランスを示し、AZUREでは軽量モデルのGemini 2.0 Few-shot(80.60%)がSotAのGemini 2.5 Few-shot(77.90%)を上回った。最も高価なモデルは最安モデルの50–60倍のコストを要する。既存 concept [[クラウドインシデント]](公開レポートの情報量がベンダーごとに大きく異なる知見を追加)・[[LLM評価]](「低コスト・低レイテンシ」が品質低下ではなく十分な能力のシグナルになりうる逆説的知見をAIOpsエージェント評価と対比して追加)を更新し、新規 concept [[LLMによる構造化情報抽出]] を作成した。既存 entity [[Xiaoyu Chu]]・[[Alexandru Iosup]]・[[Vrije Universiteit Amsterdam]]・[[University of Amsterdam]] を更新し、新規 entity(person) 3 件 [[Shashikant Ilager]]・[[Sacheendra Talluri]]・[[Yizhen Zang]]、entity(organization) 1 件 [[Delft University of Technology]] を作成した。本文参照図表 Figure 1〜3・Table 1〜6(全9点)は全て埋め込み済み(Table 2はチェックマーク付きレイアウトのためベクター座標クロップの画像埋め込み、他は全てMarkdown表または画像埋め込み)。DOI(https://doi.org/10.1145/3777911.3801103)・GitHub(atlarge-research/llm-cloud-incident-extraction)の実在を確認済み。全8ページを通読。 - Sources (new): [[@2026__ICPE__Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports]] - Entities (new): [[Shashikant Ilager]], [[Sacheendra Talluri]], [[Yizhen Zang]], [[Delft University of Technology]] - Entities (updated): [[Xiaoyu Chu]], [[Alexandru Iosup]], [[Vrije Universiteit Amsterdam]], [[University of Amsterdam]] - Concepts (new): [[LLMによる構造化情報抽出]] - Concepts (updated): [[クラウドインシデント]], [[LLM評価]] ## FlowCheck: Decoupling Checkpointing and Training of Large-Scale Models(EuroSys 2025、Alibaba Cloud / Shanghai Jiao Tong University / Peking University / Zhejiang University)(2026-08-15 ingest-paper) [[Zimeng Huang]]・[[Hao Nie]](共同筆頭著者)・[[Haonan Jia]]・[[Bo Jiang]](corresponding author)・[[Junchen Guo]]・[[Jianyuan Lu]]・[[Rong Wen]]・[[Biao Lyu]]・[[Shunmin Zhu]]・[[Xinbing Wang]]による、データセンタースイッチのポートミラーリング機能でデータ並列(DP)の allreduce トラフィックを傍受し、訓練ノードに一切の追加通信を発生させずにチェックポインティングを行うシステム FlowCheck(EuroSys '25)。既存のチェックポイント手法(vanilla PyTorch・CheckFreq・[[@2023__SOSP__Gemini - Fast Failure Recovery in Distributed Training with In-Memory Checkpoints|Gemini]])がいずれも訓練ノード自身がチェックポイント通信を能動的に発生させる(時間軸での分離)のに対し、FlowCheck は CPU 専用チェックポイントノードがミラー化トラフィックを受動的に傍受する「経路そのものの物理的分離」で同じ目標に到達する。パケットカウントベースの状態機械でアプリケーション層情報なしに allreduce のフェーズとデータ位置を復元し、ミラーリンクの再送不能というリスクには DP の構造的冗長性を用いた回復方式(3ノード監視で単一イテレーション損失率 $6\times10^{-12}$)で対処する。8ノードのデータ並列環境で BERT/RoBERTa/GPT-3/Llama2-7B を評価し、チェックポイントなしの理想値とほぼ同一のイテレーション時間・98%超の有効訓練時間比率を達成した。Megatron-LM 相当175B〜1Tパラメータ・最大3072GPU規模への外挿推定でも単一イテレーション内でのチェックポイント完了を示し、ソフトウェア実装全体を [[flowcheck-eurosys25]] としてオープンソース公開している。既存 concept [[チェックポイント]](チェックポイントコスト削減の「第5の道」=通信経路の物理的分離を追加)・[[集合通信]](allreduce トラフィックの通信外目的への転用という新視点を追加)を更新した。新規 entity(person)10件、entity(organization)1件、entity(repository)1件を作成し、既存 entity 4件([[Alibaba Cloud]]・[[Shanghai Jiao Tong University]]・[[Peking University]]・[[Zhejiang University]])を更新した。図表は本文参照分17点(Figure 1〜17)全てをPyMuPDFキャプション座標クロップで取得・埋め込み、Table 1・2はMarkdown表へ転記した(全図がベクター描画で埋め込みラスター画像が0件だったため全件クロップ)。DOI(https://doi.org/10.1145/3689031.3696088)・GitHub(AlibabaResearch/flowcheck-eurosys25)の実在を確認済み。全16ページを通読。 - Sources (new): [[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]] - Entities (new): [[Zimeng Huang]], [[Hao Nie]], [[Haonan Jia]], [[Bo Jiang]], [[Junchen Guo]], [[Jianyuan Lu]], [[Rong Wen]], [[Biao Lyu]], [[Shunmin Zhu]], [[Xinbing Wang]], [[Hangzhou Feitian Cloud]], [[flowcheck-eurosys25]] - Entities (updated): [[Alibaba Cloud]], [[Shanghai Jiao Tong University]], [[Peking University]], [[Zhejiang University]] - Concepts (updated): [[チェックポイント]], [[集合通信]] ## 2026-08-16 | Machine Learning Applications for Data Center Optimization - [[@2014__Google__Machine Learning Applications for Data Center Optimization]] — [[Jim Gao]](Google)による2014年Google White Paper。19個の設備・負荷・気象特徴量から5隠れ層ニューラルネットワークでPUEを予測し、平均絶対誤差0.004、標準偏差0.005を報告する。[[PUE]]、[[教師あり学習]]、[[統計的機械学習]]、[[データセンター信頼性]]と接続。 - 新規ページ: source 1件、entity 5件、concept 1件。既存 entity 2件、concept 3件を更新。図表7点を `wiki/sources/_attachments/42542/` に配置。 ## 2026-08-16 | The Sciences of the Artificial(Herbert A. Simon、The MIT Press 1996、第 3 版、全 8 章) [[Herbert A. Simon]] の [[The Sciences of the Artificial]](第 3 版、The MIT Press 1996)を全 8 章、章単位で取り込んだ。本書は人工物(artifact)を対象とする経験科学がいかにして可能かを問う。人工物は自然法則を免れないと同時に人間の目標に適応しているために「そうであるにすぎない」偶然性を帯び、この偶然性ゆえに科学の対象たりえないのではないかという疑いに対して、Simon は人工物を[[内部環境と外部環境]]・両者を結ぶインタフェースとしての目標という三項に分解する枠組みを与える。この分解によって、内部環境の詳細を知らずとも目標と外部環境からふるまいを予測でき、逆に設計者は内部システムを外部環境の変動から絶縁できる。第 2〜4 章は同じ枠組みを経済主体と人間の思考に当て、[[限定合理性]]と[[満足化]]、そして「行動システムとしての人間は単純であり、行動の複雑さは環境の複雑さの反映である」という評決を取り出す。第 5〜6 章は適応の記述から作り出す側へ視点を移し、[[設計の科学]]を専門職教育の中核として立て直す 7 項目のカリキュラムと、目標自体が動く[[社会計画]]・[[最終目標なき設計]]を論じる。第 7〜8 章は全体を複雑性の理論として締めくくり、[[準分解可能システム]]と[[階層的複雑性]]によって「なぜ複雑なものが階層形式をとり、なぜそれが理解可能か」に答える。本書の各命題は分野ごとに独立しているのではなく、「内部環境の限界が外部環境への適応を制約する」という一つの主張の変奏として提示される点が要である。章 source はいずれも著作権コンテンツのため `publish: false` を付し、Obsidian Publish から除外している。 - Sources (new): [[@1996__MITPress__The Sciences of the Artificial - Chapter 1 Understanding the Natural and Artificial Worlds]], [[@1996__MITPress__The Sciences of the Artificial - Chapter 2 Economic Rationality - Adaptive Artifice]], [[@1996__MITPress__The Sciences of the Artificial - Chapter 3 The Psychology of Thinking - Embedding Artifice in Nature]], [[@1996__MITPress__The Sciences of the Artificial - Chapter 4 Remembering and Learning - Memory as Environment for Thought]], [[@1996__MITPress__The Sciences of the Artificial - Chapter 5 The Science of Design - Creating the Artificial]], [[@1996__MITPress__The Sciences of the Artificial - Chapter 6 Social Planning - Designing the Evolving Artifact]], [[@1996__MITPress__The Sciences of the Artificial - Chapter 7 Alternative Views of Complexity]], [[@1996__MITPress__The Sciences of the Artificial - Chapter 8 The Architecture of Complexity - Hierarchic Systems]] - Entities (new): [[Allen Newell]], [[BACON]], [[EPAM]], [[Herbert A. Simon]], [[The Sciences of the Artificial]], [[UNDERSTAND]] - Entities (updated): [[ノーバート・ウィーナー]] - Concepts (new): [[チャンクと記憶の制約]], [[ヒューリスティック探索]], [[人工物の科学]], [[内部環境と外部環境]], [[創発と還元主義]], [[問題の理解と表現]], [[市場と組織]], [[情報処理システムとしての人間]], [[最終目標なき設計]], [[決定論的カオス]], [[注意の希少性]], [[満足化]], [[準分解可能システム]], [[状態記述と過程記述]], [[社会計画]], [[計算による科学的発見]], [[設計の科学]], [[限定合理性]], [[階層的複雑性]] - Concepts (updated): [[エージェント型科学探索]], [[コルモゴロフ複雑性]], [[サイバネティクス]], [[記号接地問題]] - 新規ページ: source 8 件、entity 6 件、concept 19 件(合計 33 件)。更新: entity 1 件、concept 4 件(合計 5 件)。図 7 点を `wiki/sources/_attachments/sciences-of-the-artificial-3e/` に配置。 ## 2026-08-16 | Guide to the Software Engineering Body of Knowledge - A Straw Man Version(IEEE Computer Society 1998、本編 7 章 + 付録 I・J) [[SWEBOK Straw Man Version]] は、SWEBOK Guide 策定プロジェクト 4 年計画の第 1 段階報告書である。ソフトウェア工学を正統な工学分野かつ専門職として確立するには中核的な知識体系への合意が不可欠だという立場から、教科書 24 冊の目次と大学課程 29 件のカリキュラム・入学要件を分析し、[[ソフトウェア工学知識体系]]の知識領域(Knowledge Area)と関連分野(Related Discipline)の草案を提示する。"Straw Man"(藁人形)の名が示すとおり、確定版ではなく**議論を誘発して叩かれるための素案**として位置づけられる。前半 3 章が「なぜ合意が要るか」を[[専門職化と資格認定]]の観点から立て、後半 4 章が「どう同定するか」と「何が同定されたか」を[[一般に受け入れられた知識]]の 4 区分と [[ISO IEC 12207|ISO/IEC 12207]] を軸に示す構成をとる。章 source はいずれも著作権コンテンツのため `publish: false` を付し、Obsidian Publish から除外している。 - Sources (new): [[@1998__IEEECS__SWEBOK Straw Man - Chapter 1 Introduction]], [[@1998__IEEECS__SWEBOK Straw Man - Chapter 2 The Guide to the Software Engineering Body of Knowledge Project]], [[@1998__IEEECS__SWEBOK Straw Man - Chapter 3 Context and Relationships]], [[@1998__IEEECS__SWEBOK Straw Man - Chapter 4 Development Methodology for Identifying Knowledge Areas and Related Disciplines]], [[@1998__IEEECS__SWEBOK Straw Man - Chapter 5 Proposed Knowledge Areas]], [[@1998__IEEECS__SWEBOK Straw Man - Chapter 6 Proposed Related Disciplines]], [[@1998__IEEECS__SWEBOK Straw Man - Chapter 7 Summary and Next Steps]], [[@1998__IEEECS__SWEBOK Straw Man - Appendix I Draft Classification of Knowledge on Formal Methods]], [[@1998__IEEECS__SWEBOK Straw Man - Appendix J Additional Information on Other Body of Knowledge Proposals]] - Entities (new): [[SWEBOK Straw Man Version]], [[IEEE Computer Society]], [[ISO IEC 12207]], [[Walter Vincenti]], [[Pierre Bourque]], [[Robert Dupuis]], [[Alain Abran]], [[James W. Moore]], [[Leonard Tripp]], [[Guy Tremblay]], [[ICCP]], [[ASQ]], [[Quality Assurance Institute]] - Concepts (new): [[ソフトウェア工学知識体系]], [[一般に受け入れられた知識]], [[専門職化と資格認定]], [[ソフトウェア工学の関連分野]], [[形式手法]] - Concepts (updated): [[ソフトウェアライフサイクル]], [[SREの工学化]], [[軽量形式手法]] - 新規ページ: source 9 件、entity 13 件、concept 5 件(合計 27 件)。更新: concept 3 件。図表 10 点(Figure 1〜6・Table 1〜4)を `wiki/sources/_attachments/swebok-straw-man-1998/` に配置。 ## 2026-08-16 | Predict Boldly, Recover Cautiously: Fast On-Router Route Anomaly Prediction and Recovery(RouterOPS、SIGCOMM Posters and Demos '26) [[Hang Cui]]ほか([[Computer Network Information Center, Chinese Academy of Sciences]]・[[Tsinghua University]]・[[Jilin University]]・[[Shenyang Institute of Automation, Chinese Academy of Sciences]])による、ルーター自身が自己/近隣の異常を検知し安全ガード付きでローカル復旧する router-native 軽量 AIOps フレームワーク RouterOPS(SIGCOMM Posters and Demos '26、3 pages)。既存の中央集権的な observe-then-react ループ(ルーター→コントローラへテレメトリ集約→診断→緩和アクション押し戻し)が秒単位で伝播する経路異常には遅すぎるという問題意識から、各ルーターに self-testing/neighbor-testing(EWMA + 残差集約 + ヒステリシス)によるコンパクトなヘルススコア維持を担わせ、「大胆に予測し、慎重に復旧する(predict boldly, recover cautiously)」原則のもと decision guard(持続性・対象特定・ポリシー充足の 3 条件)を満たした場合にのみ loop-free バックアップ next hop へのローカル復旧を発動する。本番デプロイのケーススタディで、Centralized AIOps ベースライン([[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]])より早い異常応答と、経路下流ほど拡大する累積 RTT 削減(最大 43.4ms)を報告した。[[NetOps]]・[[プロアクティブ障害管理]]の 2 概念を更新し、中央集権的な事前検証とルーター側の分散型ローカル反射という対比の知見を追加した。 - Sources (new): [[@2026__SIGCOMM Posters and Demos__Predict Boldly, Recover Cautiously : Fast On-Router Route Anomaly Prediction and Recovery]] - Entities (new): [[Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences]] - Entities (updated): [[Hang Cui]], [[Cenjie Hu]], [[Zexin Wang]], [[Jingjing Li]], [[Juncheng Hu]], [[Dan Pei]], [[Changhua Pei]], [[Gaogang Xie]], [[Computer Network Information Center, Chinese Academy of Sciences]], [[Tsinghua University]], [[Jilin University]], [[Shenyang Institute of Automation, Chinese Academy of Sciences]] - Concepts (updated): [[NetOps]], [[プロアクティブ障害管理]] - 新規ページ: source 1 件、entity 1 件(合計 2 件)。更新: entity 11 件、concept 2 件。図表 4 点(Figure 1〜4、全件ベクター描画のため PyMuPDF キャプション座標クロップ)を `wiki/sources/_attachments/3789240.3830299/` に配置。 ## 2026-08-16 | The Vision of Autonomic Computing(Kephart & Chess、*Computer* 2003) [[Jeffrey O. Kephart]]・[[David M. Chess]]([[IBM T.J. Watson Research Center]])による自律コンピューティングのビジョン論文([[@2003__Computer__The Vision of Autonomic Computing]]、*Computer*, Vol. 36 No. 1, 2003)。ソフトウェアの複雑さ危機に対する唯一の残された選択肢として、管理者が与える高レベル目標だけに従ってシステム自身が自らを管理する自律コンピューティングというビジョンを提示し、自己構成・自己最適化・自己修復・自己防御の 4 側面([[自律コンピューティング]])と、管理対象要素 + 自律マネージャからなる自律要素というアーキテクチャ、その内部構造である [[MAPE-Kループ]](Monitor-Analyze-Plan-Execute over shared Knowledge)を導入した。以後 20 年以上の自己適応システム研究で参照される基礎語彙の初出であり、[[セルフヒーリング]]の初出定義や、[[自動化のアイロニー]]が警告する構造(監視のアイロニー)を意識せずに段階的自律性移譲を提案している点など、複数の既存 concept との横断的接続を持つ。 - Sources (new): [[@2003__Computer__The Vision of Autonomic Computing]] - Entities (new): [[Jeffrey O. Kephart]], [[David M. Chess]] - Entities (updated): [[IBM T.J. Watson Research Center]] - Concepts (new): [[自律コンピューティング]], [[MAPE-Kループ]] - Concepts (updated): [[セルフヒーリング]], [[自動化のアイロニー]] - 新規ページ: source 1 件、entity 2 件、concept 2 件(合計 5 件)。更新: entity 1 件、concept 2 件(合計 3 件)。図表 3 点(Figure 1・Figure 2 は PyMuPDF キャプション座標クロップ、Table 1 は Markdown 表転記)を `wiki/sources/_attachments/The_vision_of_autonomic_computing/` に配置。 ## 2026-08-16 | Why Software Is Eating the World(Marc Andreessen、a16z 2011) [[Marc Andreessen]]([[Netscape]] 共同創業者、[[Andreessen Horowitz]] 共同創業パートナー)による2011年のエッセイ([[@2011__a16z__Why Software Is Eating the World]])。ブロードバンド・スマートフォンの世界的普及と、クラウドコンピューティングによる起業コストの劇的な低下([[Loudcloud]] の月額15万ドル→[[Amazon]] クラウドの月額1,500ドル)を背景に、書籍(Borders 対 Amazon)・映像([[Netflix]] 対 Blockbuster)・音楽・ゲーム・写真・広告・通信・人材採用([[LinkedIn]])から、自動車・小売物流・資源探査・農業・金融・医療・教育・国防に至るまで、あらゆる産業の価値連鎖をソフトウェア企業が代替しつつあるという「Software is eating the world」テーゼ([[Software Eating the World]])を提示した。VC 業界で繰り返し引用される定型句の初出であり、[[@2018__Google SRE Workbook__Foreword II]] が挙げる「Reliability is eating the world」との言い回しの反復関係を弱い横断的知見として記録した。 - Sources (new): [[@2011__a16z__Why Software Is Eating the World]] - Entities (new): [[Marc Andreessen]], [[Ben Horowitz]], [[Netscape]], [[Loudcloud]] - Entities (updated): [[Andreessen Horowitz]], [[Amazon]], [[Netflix]] - Concepts (new): [[Software Eating the World]] - 新規ページ: source 1 件、entity 4 件、concept 1 件(合計 6 件)。更新: entity 3 件(合計 3 件)。 ## 2026-08-16 | Visions of Artificial Intelligence and Robots in Science Fiction: a computational analysis(Osawa+, IJSR 2022) [[Hirotaka Osawa]]・[[Dohjin Miyamoto]]・[[Satoshi Hase]]・[[Reina Saijo]]・[[Kentaro Fukuchi]]・[[Yoichiro Miyake]](いずれも [[University of Tsukuba]])による、SF に描かれた AI・ロボットの計算的分析([[@2022__IJSR__Visions of Artificial Intelligence and Robots in Science Fiction - a computational analysis]]、*International Journal of Social Robotics*, Vol. 14, pp. 2123–2133、Open Access CC BY 4.0)。SF and Fantasy Writers of Japan の専門家 7 名の協力のもと SF に描かれた 115 件の AI を知能の多様性・社会的側面・人間知能の拡張という 3 基準で選定し、9〜11 の量的因子(親密性・汎用性・意識・群性・ネットワーク性・言語性・学習性・身体性・人間形状・製作者数・独立性)に対する階層クラスタ分析(Ward 法)と主成分分析(PCA)により、知能・人間性を軸とする 2 次元空間上に Human(人間型)・Machine(機械型)・Buddy(相棒型)・Infrastructure(インフラ型)という 4 クラスタを見出した([[SFにおけるAI表象]])。身体性(embodiment)が知能認知に二面的な影響(人間形状は知能増加、一般的身体性は知能低下と結びつく)を持つという定量的知見は、HRI/HCI の adaptation gap 原則と符合する。 - Sources (new): [[@2022__IJSR__Visions of Artificial Intelligence and Robots in Science Fiction - a computational analysis]] - Entities (new): [[Hirotaka Osawa]], [[Dohjin Miyamoto]], [[Satoshi Hase]], [[Reina Saijo]], [[Kentaro Fukuchi]], [[Yoichiro Miyake]], [[University of Tsukuba]] - Concepts (new): [[SFにおけるAI表象]] - 新規ページ: source 1 件、entity 7 件、concept 1 件(合計 9 件)。図表は本文参照の Figure 1(PCA マップ)のみで、pdf.js の埋め込み画像抽出でそのまま取得(唯一の embedded 画像)。Table 1〜3 は Markdown 表として本文に転記。 ## 2026-08-16 | The End of Programming as We Know It(Tim O'Reilly、O'Reilly Radar 2025) [[Tim O'Reilly]]([[O'Reilly Media]] 創業者)による、生成AIによるプログラマ失業論への反論エッセイ([[@2025__OReilly__The End of Programming as We Know It]]、O'Reilly Radar、2025-02-04)。機械語→アセンブリ→高級言語→Web→クラウドという過去の技術的抽象化の反復のたびに「プログラミングの終わり」が語られてきたが、いずれの波もプログラマの数を実際には増やしてきたという歴史的パターンを提示し、経済史家 [[James Bessen]] の産業革命研究(learning by doing による生産性波及の遅延)を理論的支柱に、AIによる変化も「プログラミングとして知られているものの終わり」にすぎないと論じる。[[Sam Schillace]](Microsoft副CTO)・[[Bret Taylor]]([[Sierra]] CEO)・[[Shyam Sankar]]([[Palantir]] CTO)・[[Chip Huyen]]・[[Ethan Mollick]]・[[Simon Willison]] ら業界関係者への取材を交え、[[Addy Osmani]] の[[70%問題]](AIはデモでは劇的な生産性向上をもたらすが本番品質の「最後の30%」で行き詰まる)、[[Bret Taylor]] が提唱する新職種[[エージェントエンジニア]]、[[Shyam Sankar]] の「プロトタイプから本番への旅」といった論点を統合する。 - Sources (new): [[@2025__OReilly__The End of Programming as We Know It]] - Entities (new): [[Tim O'Reilly]], [[O'Reilly Media]], [[Steve Yegge]], [[James Bessen]], [[Ethan Mollick]], [[Sam Schillace]], [[Bret Taylor]], [[Sierra]], [[Chip Huyen]], [[Simon Willison]], [[Shyam Sankar]], [[Palantir]] - Entities (updated): [[Addy Osmani]], [[Microsoft]], [[Devin]] - Concepts (new): [[70%問題]], [[エージェントエンジニア]] - 新規ページ: source 1 件、entity 12 件、concept 2 件(合計 15 件)。更新: entity 3 件(合計 3 件)。画像は本文の装飾的な挿絵のみで情報価値が低いため埋め込みは見送った。 ## 2026-08-16 | Risk management in a dynamic society: A modelling problem(Jens Rasmussen、Safety Science 1997) [[Jens Rasmussen]](Risø National Laboratory)による安全工学の古典的論文([[@1997__Safety Science__Risk management in a dynamic society - A modelling problem]]、*Safety Science*, Vol. 27, No. 2-3, 1997, pp. 183-213)。動的社会におけるリスク管理を専門分野ごとの構造分解ではなく社会技術システム全体を横断する制御問題として捉え、タスク分析(行為・エラーの記述)を境界条件と勾配による機能的抽象化のモデルに置き換えるべきと論じる。作業空間は Performance・Economic・Workload の3境界に囲まれ、コスト効率化圧力の下で行動が Performance 境界へ系統的にドリフトするモデル(Figure 3)と、Ivan Svedung との共同研究に基づく多階層事故分析手法「[[AcciMap]]」(Figure 4・5・6)の両方の一次資料。SREcon 系トーク([[@2022__SREcon22APAC__A Post Incident Review Review]] 等)で長年二次引用されてきた「Rasmussen の Safety Model」の原典を確認し、境界名称の一致(Performance/Economic/Workload)と、AcciMap という別個の貢献の存在を明らかにした。 - Sources (new): [[@1997__Safety Science__Risk management in a dynamic society - A modelling problem]] - Entities (updated): [[Jens Rasmussen]] - Concepts (new): [[AcciMap]] - Concepts (updated): [[事故モデル]] - 新規ページ: source 1 件、concept 1 件(合計 2 件)。更新: entity 1 件、concept 1 件(合計 2 件)。図表 8 点すべて(Figure 1〜8、全てベクター描画のため PyMuPDF キャプション座標クロップ)を `wiki/sources/_attachments/rasmussen1997-risk-management-dynamic-society/` に配置。pdf.js の埋め込み画像抽出で得られたのは DTU Library ロゴ 1 点のみで論文図ではないため除外。 ## 2026-08-16 | On Structural Differences between Science and Engineering(Hans Poser、PHIL&TECH 1998) [[Hans Poser]](ベルリン工科大学)による科学哲学のエッセイ([[@1998__PhilTech__On Structural Differences between Science and Engineering]]、*Society for Philosophy and Technology Quarterly Electronic Journal*, Vol. 4, No. 2, Winter 1998, pp. 81-93)。科学と工学を分ける存在論的区別(自然物 vs 人工物)・創造性・Bunge の「応用科学」テーゼをいずれも退け、規則(rules)は法則(laws)と異なり真理値を持たず効力(efficacy)によって正当化されると論じ、行為・工学=科学・局所条件の3層で働く「技術的解釈学(technological hermeneutics)」という独自概念を提示する。図表・実験を伴わない純粋な哲学論考であり、本 wiki 初の philosophy-of-technology 領域のソース。 - Sources (new): [[@1998__PhilTech__On Structural Differences between Science and Engineering]] - Entities (new): [[Hans Poser]], [[TU Berlin]] - Concepts (new): [[技術的規則]] - Concepts (updated): [[人工物の科学]] - 新規ページ: source 1 件、entity 2 件、concept 1 件(合計 4 件)。更新: concept 1 件(合計 1 件)。図表参照なし(哲学エッセイのため画像抽出は不要)。 ## 2026-08-16 | Design and natural science research on information technology(Salvatore T. March, Gerald F. Smith、Decision Support Systems 1995) [[Salvatore T. March]]・[[Gerald F. Smith]]([[University of Minnesota]])による IS 研究方法論の古典的論文([[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]]、*Decision Support Systems*, Vol. 15 (1995), pp. 251-266、Invited Paper)。IT 研究には design science(実務改善志向)と natural science(理論構築志向)の両方が必要であると論じ、Simon の *The Sciences of the Artificial* に由来する自然科学/設計科学の区別を土台に、研究出力軸(constructs・models・methods・instantiations)×研究活動軸(build・evaluate・theorize・justify)の 4×4=16 セルのフレームワーク(Fig. 1)を提示する。関係データモデル・意味データモデル・GDSS・エキスパートシステム・遺伝的アルゴリズム等のデータ管理領域の文献へ適用し、IT artifact が人為的現象であるがゆえの3つの含意(深層構造の不在の可能性・研究成果の陳腐化・artifact 分類の必要性)を論じる。 - Sources (new): [[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]] - Entities (new): [[Salvatore T. March]], [[Gerald F. Smith]] - Entities (updated): [[University of Minnesota]] - Concepts (new): [[デザインサイエンス研究]] - 新規ページ: source 1 件、entity 2 件、concept 1 件(合計 4 件)。更新: entity 1 件(合計 1 件)。図表は本文参照の Fig. 1(研究フレームワークの 4×4 表)のみで、pdf.js の埋め込み画像抽出は JBig2 デコード失敗で全滅したため PyMuPDF のキャプション座標クロップで取得した。全 16 ページを通読。 ## 2026-08-16 | Nicomachean Ethics - Book VI: Intellectual Virtues(Aristotle、訳: F. H. Peters、Kegan Paul, Trench, Trübner & Co. 1906) [[Aristotle]] による『ニコマコス倫理学』第6巻([[@1906__StandardEbooks__Nicomachean Ethics - Book VI Intellectual Virtues]]、F. H. Peters 英訳、London: Kegan Paul, Trench, Trübner & Co., 1906、原本は Internet Archive スキャン `nicomachean00aris`、現行配信元 Standard Ebooks)。魂の理性的部分を学問的部分と推量的部分に分け、真理に到達する5つの習性(技術・学問・思慮・知恵・直知)を定義し、思慮(フロネシス)と知恵(ソフィア)の違い、器用さ(デイノテース)との対比、そして思慮と倫理的徳の相互依存(ソクラテスの主知主義批判)を論じる。全10巻中この第6巻のみを断片として取り込んだ。本 wiki 初の古典哲学(classical philosophy)領域のソース。 - Sources (new): [[@1906__StandardEbooks__Nicomachean Ethics - Book VI Intellectual Virtues]] - Entities (new): [[Nicomachean Ethics]](book entity、`status: seed`)、[[Aristotle]] - Concepts (new): [[フロネシス(実践知)]] - 新規ページ: source 1 件、entity 2 件、concept 1 件(合計 4 件)。更新なし。図表なし(散文のみのテキスト)。全10巻中第6巻のみの断片取り込みのため、book entity は `status: seed`。 ## 2026-08-16 | Episteme and Techne(Richard Parry、Stanford Encyclopedia of Philosophy、初出2003年・実質改訂2024年) [[Richard Parry]] による古代ギリシア哲学の episteme(エピステーメー)/technê(テクネー)概念史サーベイ([[@2003__SEP__Episteme and Techne]]、*The Stanford Encyclopedia of Philosophy*)。クセノポン(両概念に区別なし)→プラトン(technê を機能〈ergon〉で定義し経験〈empeiria〉から区別、episteme は形相知へ純化)→アリストテレス(『ニコマコス倫理学』第6巻で最も明確な区別を与えるが『形而上学』『自然学』では用語が混用される)→ストア派(徳を「生の技術」かつ「宇宙の把握」として両概念を統合)→アレクサンドロス・アプロディシエンシス(stochastic technê=蓋然的技術を導入)→プロティノス(technê をほぼ格下げ)という6段階の通時的変遷を追跡する。本日先に ingest した一次資料 [[@1906__StandardEbooks__Nicomachean Ethics - Book VI Intellectual Virtues]] の直後の二次文献として機能し、[[フロネシス(実践知)]] に初めて複数ソースからの横断的知見を追記できた。 - Sources (new): [[@2003__SEP__Episteme and Techne]] - Entities (new): [[Richard Parry]], [[Xenophon]], [[Plato]], [[Plotinus]], [[Alexander of Aphrodisias]] - Entities (updated): [[Aristotle]], [[Nicomachean Ethics]] - Concepts (new): [[エピステーメー]], [[テクネー]], [[エンペイリア(経験知)]] - Concepts (updated): [[フロネシス(実践知)]] - 新規ページ: source 1 件、entity 5 件、concept 3 件(合計 9 件)。更新: entity 2 件、concept 1 件(合計 3 件)。図表なし(哲学史サーベイのため画像抽出は不要)。本 wiki 2件目の古典哲学(classical philosophy)ソース。 ## 2026-08-16 | Technology as 'Applied Science': A Serious Misconception that Reinforces Distorted and Impoverished Views of Science(Gil-Pérez, Vilches, Fernández, Cachapuz, Praia, Valdés, Salinas、Science & Education 2005) [[Daniel Gil-Pérez]]・Amparo Vilches・[[Isabel Fernández]]([[Universitat de València]])、Antonio Cachapuz(Universidade de Aveiro)、João Praia(Universidade de Porto)、Pablo Valdés(Universidad de La Habana)、Julia Salinas(Universidad de Tucumán)による科学教育学の論説([[@2005__Science & Education__Technology as 'Applied Science' - A Serious Misconception that Reinforces Distorted and Impoverished Views of Science]]、*Science & Education*, Vol. 14, 2005, pp. 309-320)。技術を「応用科学」——科学の「後」に来るもの——とみなす通念が科学教育における技術軽視を正当化しているという批判を起点に、教員インタビュー・教科書分析・6回の国際会議proceedings分析(主に共著者 Fernández の2000年ドクター論文に集約)に基づき、科学の性質(NOS)に関する7つの相互補強的な歪んだ描像(脱文脈化・社会的中立/個人主義的・エリート主義的/経験主義的・帰納主義的/硬直的・アルゴリズム的/非歴史的・独断的/もっぱら分析的/線形・累積的)を同定する。是正策として、STSE(科学-技術-社会-環境)文脈化された問題状況(large context problems)を軸とする開かれた調査型学習を提案する。図表・実験を伴わない哲学的・教育学的な論説であり、「技術は応用科学ではない」という結論に、[[Walter Vincenti]](1990、航空工学史の事例研究)・[[Hans Poser]](1998、規則の認識論)とは異なる第3の独立した経路(科学教育の実証研究)から到達する。 - Sources (new): [[@2005__Science & Education__Technology as 'Applied Science' - A Serious Misconception that Reinforces Distorted and Impoverished Views of Science]] - Entities (new): [[Daniel Gil-Pérez]], [[Isabel Fernández]], [[Universitat de València]] - Concepts (new): [[科学の歪んだ描像]] - Concepts (updated): [[工学科学]] - 新規ページ: source 1 件、entity 3 件、concept 1 件(合計 5 件)。更新: concept 1 件(合計 1 件)。図表なし(散文のみの哲学的・教育学的論説)。全12ページを通読。 ## 2026-08-16 | An Evaluation of the Ninth SOSP Submissions -or- How (and How Not) to Write a Good Systems Paper(Roy Levin, David D. Redell、ACM SIGOPS OSR 1983) [[Roy Levin]]・[[David D. Redell]](第9回 [[SOSP]] プログラム委員会共同議長)による、システム論文の投稿評価基準を明文化した古典的エッセイ([[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]]、*ACM SIGOPS Operating Systems Review*, Vol. 17, No. 3, 1983, pp. 35-40、現在は USENIX Author Resources が著者の許諾のもと再掲)。83件の投稿論文から16件を採択した1983年の第9回 SOSP の査読経験に基づき、独創性・現実性・教訓・選択・文脈・焦点・提示・文章スタイルの7基準・約30個の問いを提示する。「アブストラクトは本文より先に書き、内容の目次ではなく仮定と結果を簡潔に述べる」「未実装システムであることを冒頭で明示する」「事後的な合理化(修正主義的な歴史)を避ける」など、40年以上経った現在もシステム分野の執筆指南として引用され続ける一次資料。 - Sources (new): [[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]] - Entities (new): [[Roy Levin]], [[David D. Redell]], [[SOSP]] - Concepts (new): [[システム論文の評価基準]] - Concepts (updated): [[学術論文の読解技術]] - 新規ページ: source 1 件、entity 3 件、concept 1 件(合計 5 件)。更新: concept 1 件(合計 1 件)。図表なし(散文エッセイ)。USENIX 掲載ページが 403 を返したため、ブラウザ UA を付けた curl 経由で取得。 ## 2026-08-16 | Design Science in Information Systems Research(Alan R. Hevner, Salvatore T. March, Jinsoo Park, Sudha Ram、MIS Quarterly 2004) [[Alan R. Hevner]]・[[Salvatore T. March]]・[[Jinsoo Park]]・[[Sudha Ram]]による情報システム(IS)研究方法論の古典的研究エッセイ([[@2004__MIS Quarterly__Design Science in Information Systems Research]]、*MIS Quarterly*, Vol. 28, No. 1, pp. 75-105, March 2004)。行動科学(behavioral science)とデザインサイエンス(design science)という2つの相補的パラダイムを対比し、環境(Environment)・IS研究(IS Research)・知識ベース(Knowledge Base)の三層からなる概念的フレームワーク(Figure 2)と、デザインサイエンス研究が満たすべき7つのガイドライン(人工物としての設計・問題の関連性・設計評価・研究貢献・研究の厳密性・探索プロセスとしての設計・研究の伝達、Table 1)を提示する。3本の模範論文(Gavish and Gerdes 1998; Aalst and Kumar 2003; Markus, Majchrzak, and Gasser 2002)にガイドラインを適用して実演したうえで、デザインサイエンス研究固有の課題(理論的基盤の不足・成果物の陳腐化しやすさ・厳密な評価手法の適用困難)を論じる。[[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]](March and Smith 1995)の4×4フレームワーク(研究出力 × 研究活動)を土台に、共著者 [[Salvatore T. March]] を接点として、より運用可能な7ガイドラインへと発展させた系譜にあたる。 - Sources (new): [[@2004__MIS Quarterly__Design Science in Information Systems Research]] - Entities (new): [[Alan R. Hevner]], [[Sudha Ram]], [[Jinsoo Park]], [[University of South Florida]], [[University of Arizona]], [[Vanderbilt University]], [[Korea University]] - Entities (updated): [[Salvatore T. March]] - Concepts (updated): [[デザインサイエンス研究]] - 新規ページ: source 1 件、entity 7 件(合計 8 件)。更新: entity 1 件、concept 1 件(合計 2 件)。図表3点(すべてベクター描画、PyMuPDF キャプション座標クロップで取得・全件埋め込み)。全31ページを通読。 ## 2026-08-16 | The Many Faces of Systems Research - And How to Evaluate Them(Aaron B. Brown, Anupam Chanda, Rik Farrow, Alexandra Fedorova, Petros Maniatis, Michael L. Scott、HotOS 2005) [[Aaron B. Brown]]([[IBM Research]])・[[Anupam Chanda]]([[Rice University]])・[[Rik Farrow]]・[[Alexandra Fedorova]]([[Harvard University]])・[[Petros Maniatis]]([[Intel Research]])・[[Michael L. Scott]]([[University of Rochester]])による、システム研究論文の評価方法論を論じた HotOS X の位置づけ論文([[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]]、*Proceedings of the 10th Workshop on Hot Topics in Operating Systems*, Santa Fe, NM, June 2005)。システム研究論文を科学(science)・工学(engineering)・芸術(art)という3つの評価次元で捉え、各次元に固有の評価基準(科学=仮説の厳密さと再現性、工学=実用性と汎用性、芸術=優雅さ・単純さ・美しさ)を提案する。第9回SOSPプログラム委員会の[[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]](Levin & Redell 1983)を最も近い先行研究として明示的に参照し、両論文とも「研究の種類によって異なる評価基準が必要」との立場を共有する。 - Sources (new): [[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]] - Entities (new): [[Aaron B. Brown]], [[Anupam Chanda]], [[Rik Farrow]], [[Petros Maniatis]], [[Michael L. Scott]], [[Intel Research]] - Entities (updated): [[Alexandra Fedorova]], [[Harvard University]], [[Rice University]], [[IBM Research]], [[University of Rochester]] - Concepts (updated): [[システム論文の評価基準]] ## 2026-08-16 | Hints for Computer System Design(Butler W. Lampson、SOSP 1983) [[Butler W. Lampson]](Xerox PARC Computer Science Laboratory)による、計算機システム設計に関する経験則を集成した古典的エッセイ([[@1983__SOSP__Hints for Computer System Design]]、*Proceedings of the Ninth ACM Symposium on Operating Systems Principles* = ACM SIGOPS Operating Systems Review 17, 5, Oct. 1983, pp. 33-48)。機能性・速度・フォールトトレランスの3軸 × 完全性・インタフェース・実装の3軸(Figure 1)にヒントを整理し、Alto・Bravo・Star・Dorado・Grapevine 等 Xerox PARC の実システムで具体例を示す。インタフェース設計の3要件(単純・完全・小さく速い実装)、キャッシュとヒントの明確な区別、エンドツーエンドのエラー回復(Saltzer 由来)、safety first/shed load など、後の分散システム設計語彙の源流となる概念を多数含む。 - Sources (new): [[@1983__SOSP__Hints for Computer System Design]] - Entities (new): [[Butler W. Lampson]] - Concepts (new): [[ヒントによる高速化]] - Concepts (updated): [[エンドツーエンド論]] - 新規ページ: source 1 件、entity 1 件、concept 1 件(合計 3 件)。更新: concept 1 件。図1点(スキャンPDFのためPyMuPDFキャプション座標クロップで取得・埋め込み)。全16ページを通読。 - 新規ページ: source 1 件、entity 6 件(合計 7 件)。更新: entity 5 件、concept 1 件(合計 6 件)。図表なし(位置づけ論文、本文に Figure/Table 参照なし)。USENIX legacy archive から `red.pdf` を取得(著者名の似た別論文 `brown.pdf` を誤取得して破棄した後、HTML 版のリンクから正しい PDF ファイル名を特定)。 ## 2026-08-16 | Of Apples and Oranges: Fair Comparisons in Heterogenous Systems Evaluation(Hugo Sadok, Aurojit Panda, Justine Sherry、HotNets '23) [[Hugo Sadok]]・[[Justine Sherry]]([[Carnegie Mellon University]])・[[Aurojit Panda]]([[New York University]])による HotNets '23 ポジションペーパー([[@2023__HotNets__Of Apples and Oranges - Fair Comparisons in Heterogenous Systems Evaluation]]、*The 22nd ACM Workshop on Hot Topics in Networks*, Nov. 28-29, 2023, Cambridge, MA, 8 pages)。GPU・SmartNIC・FPGA のようなアクセラレータを使うヘテロジニアスハードウェアシステムの評価では、性能だけでなくコストも測定・報告すべきと論じる。良いコスト指標が満たすべき3条件(文脈独立性・定量化可能性・end-to-end網羅性)を提示し、TCO(総所有コスト)は文脈依存であるため研究評価に不向きだとして退け、消費電力(Watts)を実践的な代替として推奨する。さらに、性能とコストの2次元でPareto支配・比較領域(comparison region)・理想的スケーリング(ideal scalability)の概念を用いた7原則からなる評価方法論を提示し、「SmartNICへのオフロードで性能が改善した」式の主張が資源量の変化を無視した不公平な比較であると批判する。 - Sources (new): [[@2023__HotNets__Of Apples and Oranges - Fair Comparisons in Heterogenous Systems Evaluation]] - Entities (new): [[Hugo Sadok]], [[Justine Sherry]] - Entities (updated): [[Aurojit Panda]], [[Carnegie Mellon University]], [[New York University]] - Concepts (new): [[コストを考慮したシステム評価]] - Concepts (updated): [[システム論文の評価基準]] - 新規ページ: source 1 件、entity 2 件、concept 1 件(合計 4 件)。更新: entity 3 件、concept 1 件(合計 4 件)。図表4点(Table 1をMarkdown表に転記、Figure 1-3はすべてベクター描画のためPyMuPDFキャプション座標クロップで取得・全件埋め込み)。全8ページを通読。ローカルPDFから取り込み(発表媒体はDOI・本文奥付から確認、arXiv版なし)。 ## 2026-08-16 | End-To-End Arguments in System Design(J. H. Saltzer, D. P. Reed, D. D. Clark、ACM TOCS 1984) [[Jerome H. Saltzer]]・[[David P. Reed]]・[[David D. Clark]](いずれも [[MIT]] Laboratory for Computer Science)による、分散コンピュータシステムのモジュール間に機能をどう配置するかを導く設計原則の古典的論文([[@1984__TOCS__End-To-End Arguments in System Design]]、*ACM Transactions on Computer Systems*, Vol. 2, No. 4, November 1984, pp. 277-288。前身版は1981年パリの2nd International Conference on Distributed Systems)。エンドツーエンド論(the end-to-end argument)——完全性を要する機能は通信システムの末端にあるアプリケーションでしか正しく実装できず、低レベル層による実装は性能向上策としてのみ正当化される——を、ケアフルファイル転送のケーススタディから定式化し、配送確認・暗号化・重複メッセージ抑制・FIFO配送保証・トランザクション管理(著者自身のSWALLOWシステム)という複数機能に適用範囲を広げる。音声パケット通信の事例により、原則が絶対的な規則ではなく文脈依存のガイドラインであることも示す。本 wiki には既に [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 13 A Philosophy of Streaming Systems]]・[[@1983__SOSP__Hints for Computer System Design]] を通じてこの原則が二次的に参照されていたが、本 ingest で一次資料そのものを取り込んだ。 - Sources (new): [[@1984__TOCS__End-To-End Arguments in System Design]] - Entities (new): [[Jerome H. Saltzer]], [[David P. Reed]], [[David D. Clark]] - Entities (updated): [[MIT]] - Concepts (updated): [[エンドツーエンド論]] - 新規ページ: source 1 件、entity 3 件(合計 4 件)。更新: entity 1 件、concept 1 件(合計 2 件)。図表なし(本文に Figure/Table 参照が一切無い純粋な論証論文。pdf.js抽出画像も全12点が page-render のみでJBig2デコード失敗のため保持せず削除)。全12ページ(本文6ページ+参考文献等)を通読。既存concept [[エンドツーエンド論]] の「未解決の問い」1件(性能向上策としての部分実装との境界線)に、原論文自身が「エンドツーエンド論はどこに早期チェックを置くべきか教えてくれない」と明示的に認めていることを回答として追記した。 ## 2026-08-16 | Methodology of Algorithm Engineering(Jan Mendling, Henrik Leopold, Henning Meyerhenke, Benoît Depaire、ACM Computing Surveys 2025) [[Jan Mendling]]([[Humboldt University of Berlin|Humboldt-Universität zu Berlin]]・[[Vienna University of Economics and Business]]・[[Weizenbaum Institute]])・[[Henrik Leopold]]([[Kühne Logistics University]]・[[Hasso Plattner Institute]])・[[Henning Meyerhenke]]([[Karlsruhe Institute of Technology]])・[[Benoît Depaire]]([[Hasselt University]])による、アルゴリズムエンジニアリングのための統一研究枠組み論文([[@2025__CSUR__Methodology of Algorithm Engineering]]、*ACM Computing Surveys*, Vol. 58, No. 4, Article 94, 38 pages, October 2025, DOI: 10.1145/3769071)。計算機科学の下位分野(VLDB・NeurIPS・ESA・VIS等)ごとに異なるアルゴリズム研究の評価基準を統合すべく、科学哲学の存在論・認識論・方法論の3領域を土台にした枠組みを構築する。存在論ではStaples (2014) のエンジニアリング存在論モデルに基づき、Real-World Problem→Algorithmic Task→Algorithm Design→Algorithm Implementationの4実体をAbstracts/Satisfies/Instantiatesの3関係でつなぐ(Figure 1)。認識論ではPopperの三世界論を援用し、タスク・設計それぞれの「knowledge of」と「knowledge about」を区別する(Figure 2)。方法論では知識拡張を4カテゴリに分類し、9つの妥当性概念(生態学的・設計・実装・外的・正当化・論理的・内的・構成概念・結論妥当性)を各存在論的実体・知識類型に対応づける(Figure 3, Table 1)。 - Sources (new): [[@2025__CSUR__Methodology of Algorithm Engineering]] - Entities (new): [[Jan Mendling]], [[Henrik Leopold]], [[Henning Meyerhenke]], [[Benoît Depaire]], [[Vienna University of Economics and Business]], [[Weizenbaum Institute]], [[Kühne Logistics University]], [[University of Potsdam]], [[Hasselt University]] - Entities (updated): [[Humboldt University of Berlin]], [[Karlsruhe Institute of Technology]], [[Hasso Plattner Institute]] - Concepts (new): [[アルゴリズムエンジニアリング]], [[研究方法論における妥当性概念]] - Concepts (updated): [[工学科学]], [[デザインサイエンス研究]] - 新規ページ: source 1 件、entity 9 件、concept 2 件(合計 12 件)。更新: entity 3 件、concept 2 件(合計 5 件)。図表7点(Figure 1-3はすべてベクター描画のフレームワーク図のためPyMuPDFキャプション座標クロップで取得・全件埋め込み。Table 1-4はMarkdown表に転記)。全38ページを通読。既存entity [[Hasso Plattner Institute]] を誤って上書きしかけたが、既存内容を復元したうえで正しく統合した。 ## 2026-08-16 | Resilience Engineering: Concepts and Precepts(Erik Hollnagel, David D. Woods, Nancy G. Leveson 編、Ashgate 2006、抜粋: Prologue + 第1章) [[Erik Hollnagel]]([[Linköping University]])・[[David D. Woods]]([[The Ohio State University]])・[[Nancy G. Leveson]]([[MIT]])の 3 名が編んだ、レジリエンスエンジニアリングという分野の出発点となった論集([[wiki/entities/Resilience Engineering|Resilience Engineering: Concepts and Precepts]]、Ashgate Publishing, 2006、全21章)。2004年10月にスウェーデン Söderköping で開かれた国際シンポジウムの議論と、参加者の事後寄稿からなる。原本が書籍全体でなく先頭41ページの抜粋(Preface・Prologue・第1章・第2章前半)であるため、wiki 化したのは Prologue と第1章の 2 枚である。 - Sources (new): [[@2006__Ashgate__Resilience Engineering - Prologue Resilience Engineering Concepts]], [[@2006__Ashgate__Resilience Engineering - Chapter 1 Resilience – the Challenge of the Unstable]] - Entities (new): [[wiki/entities/Resilience Engineering|Resilience Engineering: Concepts and Precepts]], [[Yushi Fujita]], [[Linköping University]] - Entities (updated): [[Erik Hollnagel]], [[David D. Woods]] - Concepts (updated): [[レジリエンスエンジニアリング]], [[事故モデル]], [[ヒンドサイトバイアス]], [[人的要因]], [[トレードオフ意思決定]], [[複雑システム障害論]] - 新規ページ: source 2 件、entity 3 件(合計 5 件)。更新: entity 2 件、concept 6 件(合計 8 件)。図表 3 点(Figure 1.1-1.3。ベクター図と埋め込み画像の混在のため PyMuPDF キャプション座標クロップで取得・全件埋め込み)。第2章は原本が印字 p.28 の文中で切断されているためユーザー確認のうえ取り込み対象から除外した。 ## 2026-08-16 | Practical Reliability Engineering(Patrick D. T. O'Connor・Andre Kleyner、Wiley 2012、第 5 版) [[Patrick D. T. O'Connor]]・[[Andre Kleyner]] による信頼性工学の標準教科書(第 5 版、504 ページ)。本編全 17 章と Appendix 5・6 を章単位で取り込んだ。信頼性を時間依存の確率として定義し、確率・寿命データ解析から設計・試験・製造・保守・管理までを一続きの実務プロセスとして体系化する。一貫する立場は「数学より工学判断が上位にある」ことで、統計的適合度だけで分布を選ぶな(§3.7)・信頼性予測には根本的限界がある(§6.2)・統計的有意性と工学的重要性は別物(§11.4)・実証試験に必要な試験数は非現実的(§14.11)という形で繰り返し現れる。 - Sources (new): 全 19 枚 — [[@2012__Wiley__Practical Reliability Engineering - Chapter 1 Introduction to Reliability Engineering]] 〜 [[@2012__Wiley__Practical Reliability Engineering - Chapter 17 Reliability Management]]、[[@2012__Wiley__Practical Reliability Engineering - Appendix 5 Failure Reporting, Analysis and Corrective Action System (FRACAS)]]、[[@2012__Wiley__Practical Reliability Engineering - Appendix 6 Reliability, Maintainability (and Safety) Plan Example]] - Entities (new): [[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]], [[Genichi Taguchi]], [[W. E. Deming]], [[K. Ishikawa]] - Entities (updated): [[Patrick D. T. O'Connor]], [[Andre Kleyner]], [[Wiley]] - Concepts (new): [[信頼性工学]], [[バスタブ曲線]], [[工学的ばらつき]], [[ワイブル分布]], [[寿命データ解析]], [[モンテカルロシミュレーション]], [[荷重-強度干渉]], [[信頼性予測]], [[故障の木解析]], [[システム信頼性モデル]], [[FMECA]], [[故障の物理]], [[電子部品の信頼性]], [[ソフトウェア信頼性]], [[実験計画法]], [[タグチメソッド]], [[信頼性試験]], [[加速試験]], [[保証データ解析]], [[修理可能系の信頼性解析]], [[信頼性実証]], [[信頼性成長]], [[製造工程の信頼性管理]], [[ストレススクリーニング]], [[保守性]], [[可用性]], [[予防保守]], [[信頼性管理]] - Concepts (updated): [[Design for Reliability]], [[FRACAS]], [[ディペンダビリティ]], [[ソフトウェア耐障害性]], [[ソフトウェア信頼性成長モデル]], [[SRE]], [[逐次検定]] - 新規ページ: source 19 件、entity 4 件、concept 28 件(合計 51 件)。更新: entity 3 件、concept 7 件。図表 169 点(504 ページのため一括抽出は行わず、キャプションのフォント判別による座標クロップで本文参照 174 点を全点切り出し、重複構図と演習問題専用の 6 点を除いて埋め込み)。 - 2026-06-14 に書籍全体 1 枚として取り込んでいた旧 source ページ `@2012__Wiley__Practical Reliability Engineering` は削除し、参照を book entity と該当章ページへ張り替えた(`wiki/log.md` と `wiki/folds/` の過去エントリは編集禁止のためリンク切れが残る)。 ## 2026-08-17 | Gleaner: A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics(Yifan Yang, Aoyang Fang, Songhan Zhang, Pinjia He、ISSTA 2026 採択・arXiv:2604.16810) [[Yifan Yang]]・[[Aoyang Fang]]・[[Songhan Zhang]]・[[Pinjia He]](いずれも [[The Chinese University of Hong Kong, Shenzhen]])による、オンラインテールベーストレースサンプラー Gleaner の提案論文([[@2026__ISSTA__Gleaner : A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics]]、ISSTA 2026 採択、arXiv:2604.16810)。既存のテールベースサンプラーがスパン粒度の構造情報にのみ依存し、スパン内部のログイベント(エラー・リトライ等)を見落とす「意味論的盲点」を指摘し、トレースを「bag-of-edges」(EPS: event-pair set)というハッシュ可能な集合として表現することでグラフ構造解析を集合演算に置き換え、意味論的豊かさとオンライン性能(0.74ms/trace)を両立する。root-span グルーピングに基づくアラーム駆動2層クォータ配分と DPP(Determinantal Point Process)ベースの多様性選択を組み合わせ、1%サンプリング率で下流 RCA 精度を次点サンプラーより42%〜107%改善し、驚くべきことにサンプリング済みデータでのRCAが全量データ(unsampled)を上回るという「サンプリングはデータ削減でなくシグナル強化パラダイムたりうる」知見を、性質の異なる3種のRCAツール(集約統計ベース・パターンベース・因果推論ベース)を用いて実証した。161件の障害注入ケース・140万件超のトレースからなる新規大規模ベンチマークデータセットも Train-Ticket 上に構築・公開している。 - Sources (new): [[@2026__ISSTA__Gleaner : A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics]] - Entities (updated): [[Yifan Yang]], [[Aoyang Fang]], [[Songhan Zhang]], [[Pinjia He]], [[The Chinese University of Hong Kong, Shenzhen]], [[Train-Ticket]], [[Drain]] - Concepts (updated): [[トレースサンプリング]], [[根本原因分析]] - 新規ページ: source 1 件(合計 1 件)。更新: entity 7 件、concept 2 件(合計 9 件)。図表7点(Figure 1-7全件がベクター描画のためPyMuPDFキャプション座標クロップで取得・全件埋め込み)、表4点(Table 1・4・6・8はMarkdown表に転記。Table 2 notation定義・Table 3 障害内訳・Table 5 変種一覧・Table 7 アブレーションRCAは本文プロースと図6-7のキャプションで既に数値・内容を網羅しているため個別のMarkdown表化は省略)。全21ページを通読。既存concept [[トレースサンプリング]] の未解決の問い1件(サンプラーとRCAの共同最適化)に、Gleanerの結果を踏まえた回答(共同最適化ではなくサンプラー単体の改善による効果である旨)を追記。 ## 2026-08-17 | ActionNex: A Virtual Outage Manager for Cloud Computing(Zhenfeng Lin ほか13名、Microsoft、arXiv:2604.03512、ASE 2026 採択(ユーザー情報)) [[Zhenfeng Lin]]ほか14名([[Microsoft PRIMO]]/[[Microsoft Research]]/[[Microsoft Azure Core]]/[[Azure CTO Office]])による、outage(障害)管理を end-to-end に支援する本番グレードのエージェントシステム [[ActionNex]] の提案論文([[@2026__arXiv__ActionNex - A Virtual Outage Manager for Cloud Computing]]、arXiv 2026-04)。生のマルチモーダル運用信号(outage メタデータ・人間のコミュニケーション・テレメトリ)を「critical events(重要イベント)」という状態遷移抽象へ圧縮する知覚層と、playbook から蒸留した Key-Condition-Action(KCA)三つ組の長期記憶・過去 outage のエピソード記憶・ライブな作業記憶からなる階層記憶層、検索駆動(ルールトリガーでない)で次善アクションを推薦する推論エージェント層の3層構成を取る。実行された人間のアクションを暗黙のフィードバックとして用いる自己進化設計により、明示的な報酬関数を必要としない。Azure の実運用 outage 8 件(約 800 万トークン・約 4,000 件の critical events)で precision 71.4%・recall 52.8〜54.8% を達成し、本番環境で試験導入(piloting)済み。段階別(Detect→Assess→Investigate→Mitigate→Resolve)分析では、outage が進行するほど recall が上昇し precision が低下する一貫したパターンを確認した。 - Sources (new): [[@2026__arXiv__ActionNex - A Virtual Outage Manager for Cloud Computing]] - Entities (new): [[Zhenfeng Lin]], [[Ryan Zhang]], [[Salman Zafar]], [[Haoji Hu]], [[Junhao Li]], [[Hatay Tuna]], [[Ming Hao]], [[Oleg Kulygin]], [[Sheila Jiang]], [[Angie Anderson]], [[Microsoft PRIMO]], [[Microsoft Azure Core]], [[Azure CTO Office]], [[ActionNex]] - Entities (updated): [[Chetan Bansal]], [[Ze Li]], [[Murali Chintalapati]], [[Xuchao Zhang]] - Concepts (new): [[次善アクション推薦]] - Concepts (updated): [[エージェントメモリ]], [[クラウド障害ライフサイクル]], [[TSG自動化]] - 新規ページ: source 1 件、entity 14 件、concept 1 件(合計 16 件)。更新: entity 4 件、concept 3 件(合計 7 件)。図表5点(Figure 1・2 は埋め込みラスター画像、Figure 3 はベクター図で PyMuPDF キャプション座標クロップ、Table 1・2 は Markdown 表に転記)を全件埋め込み。全7ページを通読。ユーザー提供情報によれば ASE 2026 に採択(本文中には会議名の明記なし、source ページに備考として記載)。 ## 2026-08-17 | Handbook of Software Reliability Engineering(Michael R. Lyu 編、IEEE Computer Society Press / McGraw-Hill 1996) [[Michael R. Lyu]] が編者となり、ソフトウェア信頼性工学の各領域の第一人者に分担執筆させた1996年の分野標準ハンドブック([[wiki/entities/Handbook of Software Reliability Engineering|Handbook of Software Reliability Engineering]])。編者が全文を無償公開している。全 17 章 + 付録 A・B を **1 章 = 1 source ページ**で取り込んだ(全 19 枚、原本 780 ページ)。 本書の価値は個々の章よりも**章をまたいで初めて見える構造**にある。信頼性成長モデルをめぐっては、第3章がモデルを分類・定義し、第4章が「当てはまりでなく予測精度で判定せよ」と評価軸を与え、第10章が「そもそも成長しているか」をモデル適用前に検定し、第7章が実プロジェクトでの適用経験を報告するという **診断 → 選択 → 検証のパイプライン**が組み上がる。しかもその第7章が、JPL・Bellcore のいずれも実行時間や運用プロファイル情報を体系的に記録していないと報告しており、**パイプラインの入口そのものが現場では欠落している**という留保が同じ書物のなかに置かれている。さらに、編者 Lyu(第1章)がフォールト→故障の二段階連鎖で用語を要約するのに対し、分担執筆者 Laprie & Kanoun(第2章)はフォールト→誤り→故障の三段階連鎖を必須構造とするという、編著書における用語統制のずれも検出した。 - Sources (new): [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 1 Introduction]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 3 Software Reliability Modeling Survey]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 4 Techniques for Prediction Analysis and Recalibration]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 5 The Operational Profile]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 6 Best Current Practice of SRE]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 7 Software Reliability Measurement Experience]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 8 Measurement-Based Analysis of Software Reliability]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 9 Orthogonal Defect Classification]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 10 Trend Analysis]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 11 Field Data Analysis]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 12 Software Metrics for Reliability Assessment]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 13 Software Testing and Reliability]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 14 Fault-Tolerant Software Reliability Engineering]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 15 Software System Analysis Using Fault Trees]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 16 Software Reliability Simulation]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 17 Neural Networks for Software Reliability Engineering]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Appendix A Software Reliability Tools]], [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Appendix B Review of Reliability Theory, Analytical Techniques, and Basic Statistics]] - Entities (new): [[wiki/entities/Handbook of Software Reliability Engineering|Handbook of Software Reliability Engineering]] ほか 41 件(章著者・所属組織・対象システム・信頼性ツール) - Entities (updated): [[Florida Atlantic University]], [[IBM T.J. Watson Research Center]], [[Jean-Claude Laprie]], [[John Musa]], [[LAAS-CNRS]], [[Michael R. Lyu]], [[NonStop]], [[North Carolina State University]], [[Purdue University]], [[Ravishankar K. Iyer]], [[Tandem Computers]], [[University of Virginia]] - Concepts (new): [[テストカバレッジ]], [[フィールドデータ解析]], [[直交欠陥分類]], [[運用プロファイル]] - Concepts (updated): [[システム信頼性モデル]], [[ソフトウェア信頼性]], [[ソフトウェア信頼性工学]], [[ソフトウェア信頼性成長モデル]], [[ソフトウェア耐障害性]], [[ソフトウェア複雑性]], [[ディペンダビリティ]], [[フォールトトレランス]], [[ベイズ推定]], [[メトリクス削減]], [[モンテカルロシミュレーション]], [[ログベース障害診断]], [[主成分分析]], [[信頼性予測]], [[信頼性工学]], [[信頼性成長]], [[信頼性管理]], [[修理可能系の信頼性解析]], [[可用性]], [[寿命データ解析]], [[故障の木解析]], [[最尤推定]], [[運用障害分析]], [[障害予測]], [[障害傾向分析]] - 新規ページ: source 19 件、entity 42 件、concept 4 件(合計 65 件)。更新: entity 12 件、concept 25 件(合計 37 件)。図表 106 点を埋め込み。**原本は章別 PDF がテキスト層を持たないスキャン画像**のため、150 DPI のページ画像を subagent が視覚的に読み取って作成した。図は埋め込み画像もキャプション座標も取れず手作業のクロップとなるため、各章 3〜8 点に絞っている。著作権コンテンツのため全 19 枚に `publish: false` を付与。 ## SONiC で 800G AEC ケーブルを検証してみた [[張朝程]]・[[内田泰広]]([[ソフトバンク株式会社]])が SONiC Workshop Japan 2025(2025-05-19)で発表したスライド資料([[@2025__SpeakerDeck__SONiCで800G AECケーブルを検証してみた]])。全28ページ(本編18+Appendix10)を画像で確認し、YouTube 動画の音声を Whisper で文字起こしして口頭説明を補助情報として用いた。 800G AEC(Active Electrical Cable)ケーブルは DAC と同じ銅素材ながら DSP を内蔵し、AOC と異なり電気/光(OE)変換がないため消費電力を抑えられる。二社の SONiC スイッチ間でリンクアップを検証したところ片方(Y社)のみリンクせず、CMIS(Common Management Interface Specification)のログと `i2cdump`/`i2cset` によるレジスタ確認により、Tx Output Controls レジスタが全レーン無効(`0xFF`)のままになっていたことが根本原因と判明した。レジスタを書き換えることでリンクアップに成功している。消費電力は SONiC/Linux コマンドではポート単位計測ができず、[[Credo Semiconductor]] 協力の専用テスターで実測したところ、AEC は Optics SR8 比で約15%、DR8 比で約21%低い結果だった。 - Sources (new): [[@2025__SpeakerDeck__SONiCで800G AECケーブルを検証してみた]] - Entities (new): [[Credo Semiconductor]] - Entities (updated): [[張朝程]], [[内田泰広]], [[ソフトバンク株式会社]], [[SONiC]] - Concepts (new): [[AECケーブル]], [[CMIS]] - 新規ページ: source 1 件、entity 1 件、concept 2 件(合計 4 件)。更新: entity 4 件。図表 6 点を埋め込み。全スライドに `CONFIDENTIAL` 表記があるが SpeakerDeck・YouTube で一般公開されている資料であることを確認して取り込んだ。 ## 2026-08-17 | Principles of Network and System Administration(Mark Burgess、Wiley 2004、第 2 版) - Book entity: [[wiki/entities/Principles of Network and System Administration|Principles of Network and System Administration]] - 章 source 14 件: - [[@2004__Wiley__Principles of Network and System Administration - Chapter 1 Introduction]] — 技術と人間を対等に扱う工学分野としてシステム管理を定義し、ポリシー・予測可能性・拡張性という 3 つのメタ原理を提示する導入章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 2 System components]] — 「システム」を人間・ホスト・ネットワークの依存関係の網として定義し、ハードウェア・OS・ファイルシステム・プロセス・ネットワークの語彙を確定する参照章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 3 Networked communities]] — 共同体の原理からポリシーを定義し、システム管理を社会人類学として捉え直す章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 4 Host management]] — ホスト単体の設定でも大局を見失わないという姿勢を軸に、物理環境の保護・データ分離・ソフトウェア配置設計を扱う章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 5 User management]] — アカウント発行・資源制御の実務論と、管理者の倫理・利用者の福利という規範論を統合する章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 6 Models of network and system administration]] — ネットワーク管理をスター型からピアツーピア型まで 6 段階に類型化し、競合・免疫・収束の三つ組で保守モデルを理論的に基礎づける、本書の理論的中核章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 7 Configuration and maintenance]] — 第 6 章の類型学を実装の層へ下ろし、原因と症状のどちらを制御するか・宣言的言語・cfengine の動作原理・予防保守を論じる章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 8 Diagnostics, fault and change management]] — 因果の網としてシステムを捉え、原因木・確率的な故障の木・ゲーム理論・監視・品質保証を統一的に扱う、本書で最も理論負荷の高い章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 9 Application-level services]] — 応用層サービス(DNS・WWW・メール・NFS・Samba・印刷・Java)の設置を、登録・起動方式選択・アクセス制御という共通枠組みで統一的に扱う章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 10 Network-level services]] — 有限のネットワーク容量の配分を、QoS・囚人のジレンマ/ハト-タカゲーム・SLA の 3 視点で貫く、資源配分と契約の章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 11 Principles of security]] — セキュリティを 4 つの独立した問題に分解し、信頼関係とポリシーによるリスク受容として定義したうえで障害モードを類型化する章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 12 Security implementation]] — 第 11 章の原理を実装に落とし、正規化・認証・IPSec の規則衝突・ファイアウォール・侵害後対応までを扱う章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 13 Analytical system administration]] — システム管理を科学として行う方法論を論じ、誤差との比較による測定の解釈規律と、確率分布・フーリエ解析による解析手法を提示する章。 - [[@2004__Wiley__Principles of Network and System Administration - Chapter 14 Summary and outlook]] — 2004 年時点の著者が予見した情報管理・ソフトウェア工学との協働・遍在コンピューティング・システム管理の将来像を語る締めくくりの章。 - 新規 concept 5 件: [[アカウントポリシー]]・[[サービス導入の一般手順]]・[[プロキシとエージェント]]・[[ポリシー]]・[[信頼関係]] - 更新 concept 19 件 / 更新 entity 7 件(詳細は各 `_index.md`) - 図 82 点を全点埋め込み。章 source は著作権対応で全て `publish: false`。 ## 2026-08-17 | 仕事ではじめる機械学習 第2版(有賀康顕・中山心太・西林孝、オライリー・ジャパン 2021、第 2 版) - ingest-book: 全 12 章を章ごとに source 化。原本 `.raw/books/shigoto-de-hajimeru-kikai-gakushu/`(352 ページ) - Book entity: [[仕事ではじめる機械学習]] - 章 source 12 件: - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 1 機械学習プロジェクトのはじめ方]] — 機械学習プロジェクトは課題設定・道具選び・モデル作成・サービス組み込みの 4 段階 10 ステップで進み、MVP による仮説検証と「機械学習を使わない選択肢」の検討を最優先し、機械学習特有の技術的負債には 5 つの対処法で臨む章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 2 機械学習で何ができる?]] — 分類・回帰・クラスタリング・次元削減というタスク分類のもと、scikit-learn のフローチャートによる選択軸と、同一データへの決定境界可視化による横並び比較でアルゴリズムを整理するカタログ章(図 37 点)。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 3 学習結果を評価するには]] — 分類(適合率・再現率・F 値・ROC/AUC)と回帰(RMSE・決定係数)のオフライン評価指標を解説したうえで、それだけでは不十分でビジネス指標を確認する A/B テストが別途要ると述べる章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 4 システムに機械学習を組み込む]] — 学習・予測のタイミングと予測結果のサービング方式の組み合わせを開発自由度対レイテンシのトレードオフで選び、教師データの制約を見越したログ設計をあらかじめ行う章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 5 学習のためのリソースを収集する]] — 教師データの取得手段を公開データセット・自作・同僚への依頼・クラウドソーシング・サービスへの組み込みの 5 通りに整理し、着手コスト・品質担保・スケールのトレードオフで選ばせる章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 6 継続的トレーニングをするための機械学習基盤]] — 長期運用のための継続的トレーニングと ML Ops を扱い、機械学習基盤を共通実験環境・予測サービング・パイプライン化・継続的トレーニングの 4 ステップに整理する章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 7 効果検証:機械学習にもとづいた施策の成果を判断する]] — ルービンの因果モデル・RCT・仮説検定という A/B テストの理論的基盤から、標本サイズ設計や母集団ハックのような落とし穴、A/B テストができない場合の差の差法までを一貫して解説する章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 8 機械学習のモデルを解釈する]] — 線形回帰の係数から p 値・決定木の可視化・Feature Importance・SHAP へと解釈手法を段階的に強めながら、各手法が何を答えられ何を答えられないかを離職予測データで示す章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 9 Kickstarterの分析、機械学習を使わないという選択肢]] — Kickstarter の資金調達データを題材に、達成率という正規化指標を導入した探索的データ分析だけで、機械学習を使わずに意思決定に足るレポートを作る過程を示す章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 10 Uplift Modelingによるマーケティング資源の効率化]] — A/B テストのデータを個体の特徴量で分解し、無関心・説得可能・天邪鬼・鉄板の 4 セグメントに分類して、介入に反応する対象だけへ資源を絞り込む章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 11 バンディットアルゴリズムによる強化学習入門]] — 事後分布の不確実性を評価値に組み込む Bayesian-UCB・UCB1・Softmax 法・Thompson Sampling で探索と活用のトレードオフを解き、A/B テスト・Uplift Modeling との関係性まで示す章。 - [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 12 オンライン広告における機械学習]] — リアルタイム入札を題材に、ビジネス設定を制約付き最適化問題として定式化する回路と、CTR 予測モデルを広告配信ログ特有の困難のもとで運用し続ける回路の両方を示す最終章。 - 新規 entity 5 件: [[仕事ではじめる機械学習]]・[[有賀康顕]]・[[中山心太]]・[[西林孝]]・[[SHAP]] - 新規 concept 23 件 / 更新 concept 19 件(詳細は各 `_index.md`) - 図 133 点を全点埋め込み。章 source は著作権対応で全て `publish: false`。 ## 2026-08-18 | 信頼性の高い機械学習(Cathy Chen・Niall Richard Murphy・Kranti Parisa・D. Sculley・Todd Underwood、オライリー・ジャパン 2024) - 原書: *Reliable Machine Learning: Applying SRE Principles to ML in Production*(O'Reilly Media, 2022)。訳: 井伊篤彦・張凡・樋口千洋(異業種データサイエンス研究会)。ISBN 978-4-8144-0076-8。 - Book entity: [[信頼性の高い機械学習]] - 章 source(全 15 章): - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 1 はじめに]] — 著者らが「ML ループ」と呼ぶ終わりのない反復的な ML ライフサイクル(データ収集と分析→データマネジメント→ML 訓練パイプライン→アプリケーションの構築と検証→品質と性能の評価→SLO の定義と測定→ローンチ→監視とフィードバックのループ)の枠組みを、YarnIt という架空のオンライン小売店を例に提示する。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 2 データマネジメント]] — ML システムをデータ処理パイプラインとして捉え、データの段階(作成・取り込み・前処理・後処理)・信頼性(耐久性・一貫性・バージョン管理・性能・可用性)・保守性(セキュリティ・プライバシー・コンプライアンス)という 3 つの枠組みでデータマネジメントの実務を整理する。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 3 MLモデルの基礎]] — モデルアーキテクチャ/モデル定義/訓練済みモデルの区別と、訓練データ・ラベル・訓練方法に潜む脆弱性の所在、運用者向けの診断的な質問集を、yarnit.ai の毛糸クリック予測モデルを題材に示す。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 4 特徴量と訓練データ]] — 特徴量(定義と値の区別)・人間が生成したラベル(アノテーション体制・品質計測・能動学習)・メタデータという 3 つのサブシステムの設計を、特徴量ストアを中心に論じる。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 5 モデルの確実性と品質の評価]] — モデルの確実性(システムを壊さないか)とモデルの品質(役に立つか)という独立した 2 つの評価軸を、確実性チェック・評価データ分布の設計・評価指標の 3 分類に分けて体系立てる。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 6 公正さ、プライバシー、倫理的なMLシステム]] — 公平性の複数定義の非両立性(グループパリティ 対 キャリブレーション)、プライバシーの技術的・制度的対策、責任ある AI の ML パイプライン別チェックリストを扱う。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 7 MLモデル訓練システム]] — 訓練システムの必要条件と基本アーキテクチャを示した上で、一般的な信頼性の原則、データ感度・再現性・計算リソース容量というよくある問題、組織的な構造上の信頼性課題を扱う。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 8 サービス運用]] — サービス運用アーキテクチャをオフライン・オンライン・サービスとしてのモデル(MaaS)・エッジの 4 類型に整理し、トラフィック・レイテンシ・ハードウェア・バージョン管理といった判断軸から選択指針を与える。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 9 モデルの監視と可観測性]] — 運用中の ML システムをモデル・データ・サービスの 3 レイヤーに分けて監視する枠組みを中核に、運用開始前の検証、ドリフトとデータ品質チェックの区別、ML 固有の SLO 設計までを体系化した、本書で最も長く実務的な章。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 10 継続的なML]] — 継続的な ML システムに特有の観察(外界の出来事・フィードバックループ・時間的影響・危機対応・段階的ローンチと安定ベースライン・モデル管理)を扱い、「全ての運用 ML システムは継続的な ML システムとして扱うべきである」という推薦で締めくくる。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 11 障害対応]] — ML の障害対応は一般的な障害管理の骨格(FEMA 由来の役割分担を含む)を保ちつつ、検知の困難さ・関与組織の広さ・タイムラインの不明確さの 3 点で ML 特有の変化を伴うことを、長大な事例研究と役割別の枠組みで示す。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 12 製品とMLの関わり方]] — アジャイル開発の前提と ML の相性の悪さを論じたうえで、発見と定義からサポート・メンテナンスまでの循環モデルを提示し、構築か購入かの判断軸と yarnit.ai の推薦機能事例で締めくくる。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 13 MLの組織への統合]] — ML 実装がもたらす重大な組織リスク(魔法視・メンタルモデルの慣性・Westrum 組織類型による文化差・サイロ化の限界)と、[[Jay R. Galbraith]] のスターモデル(戦略・構造・プロセス・報酬・人材)による組織設計の枠組みを提示する。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 14 実践的なML組織の事例]] — YarnIt を舞台に、新規集中型・分散型・中央集権型インフラと分散型モデリングのハイブリッドという 3 つの組織シナリオを通じ、スターモデルのうちプロセス・報酬・人材の 3 要素が具体的にどう現れるかを描く。 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 15 ケーススタディ:MLOpsの実践]] — [[Dialpad]]・[[Google]]・[[Landing AI]] という 3 社 6 事例の実践者自身による寄稿を通じ、フィードバックループ・実績値の代理性・プライバシーと再現性の緊張・ローカル計測と本番の乖離・反復的ラベル定義・上流依存の回帰テストという形で、1〜14 章の原則が実務でどう現れるかを示す。 - 新規 entity 12 件: [[信頼性の高い機械学習]]・[[Cathy Chen]]・[[Kranti Parisa]]・[[Todd Underwood]]・[[Aileen Nielsen]]・[[Aparna Dhinakaran]]・[[Jay R. Galbraith]]・[[Latanya Sweeney]]・[[YarnIt]]・[[Dialpad]]・[[Landing AI]]・[[Kubeflow Pipelines (KFP)]] - 新規 concept 15 件 / 更新 concept 34 件(詳細は各 `_index.md`) - 図 37 点を全点埋め込み。章 source は著作権対応で全て `publish: false`。 ## 2026-08-18 | Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?(Z.ai / Harnets.AI / Tsinghua University、X Article、2026-05-20) - Source: [[@2026__X__Next-generation LLM Inference Network - How ZCube Alleviates Network Bottlenecks]] — [[Zhipu AI|Z.ai]]・[[Harnets.AI]]・[[Tsinghua University]] が ACM SIGCOMM 2025 発表のネットワークトポロジ [[ZCube]] を GLM-5.1 コーディング推論の本番クラスタへ初めて大規模展開した事例報告。 - 新規 entity 1 件: [[Harnets.AI]] - 更新 entity 2 件: [[Zhipu AI]]・[[Tsinghua University]] - 新規 concept 1 件: [[ZCube]](トポロジ構造・数式・性質・実運用検証結果を集約) - 更新 concept 3 件: [[Fat-Tree]](ROFT 定義を追加)・[[Prefill-Decode分離]](トポロジ誘発輻輳の横断的知見を追加)・[[マルチプレーンClosトポロジ]](ZCubeとの対比を追加) - Key insight: PD分離推論のKV Cache転送非対称性が静的レール割り当て(ROFT)を破綻させトポロジ誘発輻輳を招くメカニズムを実測で示し、Spine層撤廃・完全二部グラフ化(ZCube)というトポロジ層の解法と、マルチプレーンClos+MRC/SRv6というトランスポート層の解法が、同じ問題への異なるレイヤーの対処であることが判明した。 - 図5点(トポロジ図・ROFT/ZCube比較図・PFCバックプレッシャー実測・スループット/TTFT比較チャート)を埋め込み。X(Twitter)のArticle機能記事(SSRされたplain_textを完全抽出)。 ## 2026-08-18 | The Roots of Software Engineering(Michael S. Mahoney、CWI Quarterly 1990) - Source: [[@1990__CWIQuarterly__The Roots of Software Engineering]] — 1990年の CWI 講演録。「ソフトウェアエンジニアリング」という語が1967–68年の NATO 会議でなぜ意図的に挑発的な語として選ばれたかを跡づけ、その背後に Taylor の科学的管理法・Ford の組立ライン・機械工具産業の互換部品モデルという、他の工学分野から借用され吟味されないまま残ったモデル群があると分析する短編の歴史論考。全10ページ。 - 新規 entity 6 件: [[Michael S. Mahoney]]・[[F.L. Bauer]]・[[M.D. McIlroy]]・[[Edsger W. Dijkstra]]・[[Frederick W. Taylor]]・[[Henry Ford]]・[[Watts Humphrey]](計7件) - 更新 entity 2 件: [[Brian Randell]](NATO ソフトウェア工学会議編者としての役割を追記)・[[Fred Brooks]](本ソースでの言及を追記) - 新規 concept 3 件: [[ソフトウェア工学の起源]](本ソースの中心的主張を集約)・[[ソフトウェア危機]]・[[構造化プログラミング]] - 更新 source 1 件: [[@1976__IEEE-TC__Software Engineering]](Boehm 1976 の Area 1/Area 2 二分類と Mahoney の借用モデル論を接続) - Key insight: 「ソフトウェアエンジニアリング」という語は1967年、実践が存在しない段階で希求の表明として作られた。その後の議論は Taylor(科学的管理法)・Ford(組立ライン)・機械工具産業の互換部品という、いずれもアメリカ機械工学の遺産に由来する借用モデルに規定され続けており、モジュラープログラミング→オブジェクト指向という後年の展開も同一の互換部品モデルの継続と読める。Boehm 1976 の Area 2(要件・設計・保守に科学的原理がほぼない)という診断は、この借用モデル論の6年後の定量的裏づけとして接続できる。 ## 2026-08-18 | What Goes Around Comes Around... And Around...(Michael Stonebraker・Andrew Pavlo、ACM SIGMOD Record 2024) - Source: [[@2024__SIGMODRecord__What Goes Around Comes Around... And Around]] — Stonebraker & Hellerstein の2005年論文「What Goes Around Comes Around」の20年後の続編。2005年以降のMapReduce・キーバリューストア・ドキュメントDB・カラムファミリ・テキスト検索・配列DB・ベクトルDB・グラフDBというデータモデル潮流と、カラム型システム・クラウドDB・データレイク/レイクハウス・NewSQL・ハードウェアアクセラレータ・ブロックチェーンDBというアーキテクチャ潮流を検証する。 - 更新 entity 2 件: [[Michael Stonebraker]](続編論文とAndrew Pavloとの共著関係を追記)・[[Andrew Pavlo]](Stonebrakerとの共著、NewSQL節の担当を追記) - 更新 concept 7 件: [[専用データベースシステム]](収斂という専用化ライフサイクルの後半局面、カラムファミリの非対称な取り残され、ベクトルDBの「索引追加」型専用化)・[[MapReduce]](Google/Hadoopベンダーの具体的廃止経緯)・[[データレイク]](レイクハウス収斂の経済的駆動要因)・[[リレーショナル対ドキュメントモデル]](NoSQLベンダーのSQL獲得という業界規模の収斂)・[[列指向OLAPデータベース]](データウェアハウス市場の列指向移行、Snowflake起源のサーバレス化)・[[ベクトル検索インデックス]](ベクトルDBはドキュメント指向DBMSの索引特化に過ぎないという評価) - Key insight: 2005年に「専用化がRDBMSを打ち負かす」と予見したStonebrakerが、19年後の本論文で「専用化の多くは結局SQLライクなインターフェースとACIDトランザクションを再獲得してRDBMSへ収斂しつつある」と自ら報告している。DynamoDB・Cassandra・Aerospike・Couchbase・MongoDBという主要NoSQLベンダーが軒並みSQLインターフェースを追加した一方、カラムファミリ(BigTable系)だけは収斂に取り残された唯一の外れ値として残った。ベクトルDBは新しいシステムアーキテクチャではなくドキュメント指向DBMSの索引特化に過ぎないと明確に評価されており、既存RDBMSは2023年のうちにpgVector等のOSS統合でベクトル索引を取り込んだ。 - 図表なし(本文が名指しで参照する図表は皆無であることを全文検索で確認)。埋め込み画像はACM論文ページの装飾的な「Check for updates」バッジ1点のみで本文参照がないため取り込み対象外。 ## 2026-08-19 | FabricPerf: Measuring NIC-less Scale-Up Network through GPU Communication Kernel Profiling(Songlin Huang・Chenshu Wu、ACM SIGCOMM 2026) - Source: [[@2026__SIGCOMM__FabricPerf - Measuring NIC-less Scale-Up Network through GPU Communication Kernel Profiling]] — [[The University of Hong Kong]]の[[Songlin Huang]]・[[Chenshu Wu]]による、NICが存在しないScale-upネットワーク(NvLink・UALink等)向けのきめ細かいパケット単位計測ツールキット[[FabricPerf]](SIGCOMM'26)。GPU通信カーネルへのアセンブリレベルプロービング、GPU内蔵クロックによるGPTPクロック同期、通信のメモリトラフィックモデリングの三本柱を持つ。 - 新規 entity 4 件: [[Songlin Huang]]・[[Chenshu Wu]]・[[FabricPerf]]・[[Neutrino]](先行研究、OSDI'25)。更新 entity 2 件: [[The University of Hong Kong]]・[[NCCL]]。 - 更新 concept 3 件: [[GPU観測性]](通信カーネル向け計装という第4の挿入時点、マルチデバイス間クロック同期という新軸を追加)・[[GPU起動型ネットワーキング]](Device Native通信の計測手段の空白を埋めた点を追加)・[[NVLink]](H100/GB200 NVL72実測によるLLCヒット率崩壊・チャネル不均衡の発見を追加)。 - Key insight: H100 NVL8・GB200 NVL72上の実測により、①チャネル間のP99レイテンシがP50の約2倍に達する不均衡(飽和より遥かに手前の12コア・約200GB/sで既に発生)と、②ネットワークバッファのLLCヒット率が16チャネル以上・350GB/s以上で約0%まで崩壊する現象という2つの新規知見を発見した。①はwork-stealingでチャネルスプレッドを46%削減しAllGatherスループットを+17.5GB/s、②はLLC eviction優先度チューニングでLLC読み取りヒット率を34.86ポイント引き上げReduceScatter帯域を+16.07GB/s改善した。GPTP(GPU版Precision Time Protocol)によるクロック同期(intra-kernel jitter 101.8ns)とメモリトラフィックモデル(平均誤差3.17%)の高精度さが、これらの発見を可能にした計測基盤である。 - 図表: 本文参照の図17点・表8点を全点埋め込み(全図がベクター描画のためPyMuPDFキャプション座標クロップで取得)。Algorithm 1(work-stealingチャネルバランサ疑似コード)も画像として埋め込み。 ## 2026-08-19 | KEP-4381: Dynamic Resource Allocation with Structured Parameters(Kubernetes Enhancement Proposal, sig-node) - Source: [[@2024__KEP__KEP-4381 Dynamic Resource Allocation with Structured Parameters]] — [[Patrick Ohly]]([[Intel]])著、[[Kubernetes]] sig-node の KEP。kubelet デバイスプラグインAPI(単一線形量のみ表現可)の限界を解消するため、`ResourceSlice`(デバイス公開)・`ResourceClaim`(要求・割当結果)・`DeviceClass`(管理者プリセット)という3新規APIオブジェクトでGPU等アクセラレータの宣言的割当を実現する。Kubernetes 1.30(アルファ)から1.34(GA)まで4年越しで段階昇格。 - 新規 entity 2 件: [[Patrick Ohly]]・[[Intel]] - 更新 entity 1 件: [[Kubernetes]] - 新規 concept 1 件: [[Dynamic Resource Allocation (DRA)]](API設計・スケジューラ拡張点・GA条件・代替案を集約) - 更新 concept 2 件: [[GPU多重化(MPS・MIG)]](DRAとMIG静的分割の役割分担を追加)・[[コンテナオーケストレーション]](リソース表現力というオーケストレーションの別軸ギャップをKubernetesコアが段階的に埋めた事例として追加) - Key insight: DRAが解くのは「分割済みデバイスをどう要求・割当するか」というオーケストレーション層の問題であり、MIG/MPSのような「デバイスをどう分割するか」というハードウェア層の問題とは補完関係にある。GAには異なる組織による実DRAドライバ実装3件以上、NUMA/PCIeルート等ノード内トポロジ整合のための標準属性の少なくとも1つの標準化という具体的条件が課されている。 - 図2点(コンポーネント構成図、kubelet資源準備フロー図)を embed。GitHub Markdown を `gh api` で取得し PNG 図2点を別途ダウンロードして選定・埋め込み。 ### M2-MFP: A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure(Hongyi Xie ほか、KDD 2025)(2026-08-19 ingest-paper) - Source: [[@2025__KDD__M2-MFP - A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure]] - 新規 entity: [[Hongyi Xie]]・[[Min Zhou]]・[[Jialiang Yu]]・[[Zhenli Sheng]]・[[Hong Xie]]・[[Defu Lian]]・[[M2-MFP]] - 新規 concept: [[メモリ障害予測]] - 更新: [[Qiao Yu]]・[[Huawei Cloud]]・[[University of Science and Technology of China]]・[[TU Berlin]]・[[障害予測]] ### Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse(Taekyung Heo ほか、NVIDIA、arXiv 2026)(2026-08-19 ingest-paper) - Source: [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]] - 新規 entity: [[Taekyung Heo]] - 更新 entity: [[Bita Darvish Rouhani]]・[[NVIDIA]]・[[Qwen3]]・[[Llama3]]・[[Mistral 3]] - 更新 concept: [[KVキャッシュ管理]](cross-model KVキャッシュ転送という新軸を追加、横断的知見2件・未解決の問い3件を追記) - Key insight: 同一ファミリ内の異なるサイズのモデル間で、勾配学習を一切用いないper-headリッジ回帰の閉形式マッパーがKVキャッシュを転送し、受信側の再プリフィルを2.7〜25倍高速化しつつ標準精度の73〜98%を保持する(6ペア中4ペア)。matched-KV(KVヘッド数・ヘッド次元一致)は成功の必要条件だが十分条件ではなく、校正R²ではなくattention出力コサイン類似度がcross-pair転送品質を予測する(r=+0.57 vs r=−0.20)。 - 図9点(Figure 1〜9)を全点埋め込み。図はすべて埋め込みラスター画像(matplotlib出力)として抽出でき、ベクター描画のクロップ作業は不要だった。Appendix専用の補足表(Table 9・11・13・14・18)は本文Table(1・2・5)で要点をカバー済みのため転記を割愛。 ### ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production(Yuxing Xiang ほか、Peking University / Alibaba Group、NSDI '26)(2026-08-19 ingest-paper) - Source: [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]] - 新規 entity 5 件: [[Yuxing Xiang]]・[[Yan Zhang]]・[[Wenyuan Yu]]・[[ServeGen]]・[[BurstGPT]] - 更新 entity 6 件: [[Xue Li]]・[[Kun Qian]]・[[Ennan Zhai]]・[[Xin Jin]]・[[Jingren Zhou]]・[[Alibaba Group]]・[[Peking University]] - 新規 concept 1 件: [[LLMサービングワークロード特性化]](クライアント分解による因果モデリングを中心概念として集約) - 更新 concept 2 件: [[Prefill-Decode分離]](ワークロード生成精度がPD構成評価の結論を左右する新知見を追加)・[[ワークロードの特性の把握]](LLMサービングドメインでの「誰が」軸の格上げを追加) - Key insight: Alibaba Cloud Model Studio の本番クラスタから4か月間・12モデル・35.4億リクエストを収集し、言語・マルチモーダル・推論の3カテゴリでLLMサービングワークロードを横断的に特性化した。複雑な変動パターンの多くは少数の上位クライアントのレート変動に起因する因果構造(クライアント分解)として説明でき、この知見に基づくワークロード生成フレームワーク ServeGen は、NAIVEな生成手法と比べてインスタンスプロビジョニング・PD分離構成選択のいずれでも、より現実に即したベンチマーク結果を導くことを実証した。 - 図表: 本文参照の図21点(Figure 1〜21)を全点埋め込み(全図がベクター描画のためPyMuPDFキャプション座標クロップで取得)。Table 1・2はMarkdown表として本文転記。 ## 2026-08-19 | KEP-4671: Gang Scheduling using Workload Object(Kubernetes Enhancement Proposal, sig-scheduling) - Source: [[@2025__KEP__KEP-4671 Gang Scheduling using Workload Object]] — erictune・wojtek-t ほか8名著、[[Kubernetes]] sig-scheduling の KEP。kube-scheduler にギャングスケジューリング(all-or-nothing方式)のフレームワーク支援を組み込む。`Workload`(スケジューリングポリシーテンプレート)・`PodGroup`(スタンドアロンのランタイムスケジューリング単位)を分離したAPI設計で、etcd 1.5MBオブジェクト上限・status読み書き競合というスケーラビリティ問題を回避する。Alpha(v1.35)からBeta(v1.37)まで段階昇格。 - 新規 concept 1 件: [[Kubernetes Workload・PodGroup API]](API設計・Workload Scheduling Cycle・昇格条件・代替案を集約) - 更新 entity 1 件: [[Kubernetes]] - 更新 concept 3 件: [[GPUクラスタスケジューリング]](HiveD/Themisの配置保証・公平性理論との比較を追加)・[[Dynamic Resource Allocation (DRA)]](DRAブロッキングとの未解決の接続点を追加)・[[コンテナオーケストレーション]](エコシステム既存実装のコア吸収パターンを追加) - Key insight: Beta で導入される Workload Scheduling Cycle は、PodGroup単位で全メンバーPodを単一クラスタスナップショット上で一括処理し、専用の `PlacementFeasiblePlugin` 拡張点と専用PodGroupキューを持つ。アカデミアのHiveD/Themisが積み上げた配置保証・公平性理論の多くはBeta時点でも将来課題として先送りされており、DRAと並ぶ「エコシステムの既存実装(Volcano.sh・Kueue等)をコアへ吸収する」設計パターンの反復と位置づけられる。 - 図なし(KEP本文中のownership図はmermaidとして直接埋め込み)。GitHub Markdown を `gh api` で取得(README.md 2082行 + kep.yaml)。著者8名はGitHubハンドルのみで個別entityは作成せず。 ## 2026-08-19 | Evaluating Kubernetes Performance for GenAI Inference: From Automatic Speech Recognition to LLM Summarization(Sai Sindhur Malleni ほか、Red Hat / Illinois Institute of Technology、ICPE 2026) - Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]] — Kueue(バッチスケジューリング)・Dynamic Accelerator Slicer(GPU動的MIGスライシング)・Gateway API Inference Extension(GAIE、分散LLM推論ルーティング)という3つのKubernetesネイティブプロジェクトを組み合わせ、Whisper音声認識バッチ推論とLLM要約オンライン推論からなるマルチステージGenAI推論パイプラインをRed Hat OpenShift Service on AWS上で実装・評価した産業論文。 - 新規 entity 12 件: [[Sai Sindhur Malleni]]・[[Raúl Sevilla]]・[[Aleksei Vasilevskii]]・[[José Castillo Lema]]・[[André Bauer]](著者5名)・[[Dynamic Accelerator Slicer]]・[[Gateway API Inference Extension]]・[[llm-d]]・[[Whisper]]・[[kube-burner]]・[[GuideLLM]]・[[Earnings-22]] - 更新 entity 4 件: [[Kueue]]・[[Red Hat]]・[[Illinois Institute of Technology]]・[[vLLM]] - 更新 concept 3 件: [[コンテナオーケストレーション]](3層分業型GenAI推論オーケストレーションと決定論的スケジューリングの選好を追加)・[[GPUクラスタスケジューリング]](動的MIGスライシングによる並列度向上とスライスパディングの知見を追加)・[[KVキャッシュ管理]](Kubernetes Gateway APIレベルでのキャッシュ認識ルーティングという新しい統合ポイントを追加) - Key insight: Kueue の優先度クラス+プリエンプションでメイクスパンを最大15%削減、DAS の動的MIGスライシングで並列実行数をGPU数(8)からスライス数(25)へ増やし平均ジョブ完了時間を36%削減、GAIE の Precise Prefix-Cache Aware Scheduling がランダムルーティング比でテールTTFTを最大90%改善した。3つの独立コンポーネントが異なるパイプライン段階を担当することで、Kubernetesを要求の厳しいGenAI推論の統一基盤として機能させうることを実証した。 - 図表: 本文参照の図7点(Figure 1〜7)・表6点(Table 1〜6)を全点埋め込み/転記。Figure 1〜4はベクター描画のためPyMuPDFキャプション座標クロップで取得、Figure 5〜7はmatplotlib埋め込みラスター画像として取得。TTFT改善率について本文§4.4(90%)とConclusion§5(82%)に軽微な数値不整合ありと注記。 ## 2026-08-19 | The Flux Operator(Vanessa Sochat, Aldo Culquicondor, Antonio Ojea, Daniel Milroy、arXiv 2023) - Source: [[@2023__arXiv__The Flux Operator]] — Lawrence Livermore National Laboratory と Google の共著。HPC ワークロードマネージャ [[Flux Framework]] を Kubernetes の Indexed Job・headless service・ConfigMap のみで稼働させる Kubernetes Operator「Flux Operator」を提案し、「収束コンピューティング(converged computing)」の具体例として位置づける。 - 新規 entity 7 件: [[Vanessa Sochat]]・[[Daniel Milroy]]・[[Aldo Culquicondor]]・[[Antonio Ojea]]・[[Lawrence Livermore National Laboratory]]・[[Flux Framework]]・[[MPI Operator]] - 更新 entity 3 件: [[Google]]・[[Kueue]]・[[Kubernetes]] - 新規 concept 1 件: [[収束コンピューティング]](HPC とクラウドネイティブの技術的収束を扱う概念。既存の [[収束型システム管理]] との用語衝突に関する注記を含む) - 更新 concept 1 件: [[Kubernetesオペレータ]](Flux Operator を「HPC ワークロードマネージャ全体を運用自動化する Operator」の事例として追加) - Key insight: LAMMPS を用いた強スケーリング実験(8/16/32/64ノード、EKS + hpc6a.48xlarge + EFA)で、SSH でワーカーを協調させ専用ランチャーノードを要する [[MPI Operator]](Kubeflow発)に対し、Flux Operator は総壁時間で平均約5%高速だった。MiniCluster の作成・削除は全サイズで1分未満・変動約5秒に収まりノード数に対しほぼ線形の弱スケーリングを示した。Flux は `hwloc` によるリソース検出の制約から「1 Pod = 1 物理ノード」を厳守する設計を採り、Kubernetes の Indexed Job・headless service・ConfigMap という標準機構のみでツリー型オーバーレイネットワーク(TBON)を構築する。状態保存・弾力性(elasticity)・オートスケーリング・マルチテナンシー・バースティング・ワークフロー統合([[Kueue]] への統合)という6つの実験的機能を実装し、KubeCon Amsterdam '23 での発表を機に Google の Aldo Culquicondor が Kueue への統合を主導した。 - 図表: 本文参照の図5点(Figure 1〜5、Figure 5はSupplementary)を全点埋め込み(すべて matplotlib/diagrams.net 由来の埋め込みラスター画像として取得、ベクタークロップは不要)。Table 1(Flux Framework Projects)をMarkdown表として転記。 ## 2026-08-19 | KEP-407: Gang Scheduling(LeaderWorkerSet、kubernetes-sigs/lws) - Source: [[@2025__KEP__KEP-407 Gang Scheduling (LeaderWorkerSet)]] — kubernetes-sigs/lws の KEP。[[LeaderWorkerSet]](LWS)の各レプリカに PodGroup を作成し、Volcano・coscheduling scheduler-plugin・YuniKorn 等の外部カスタムスケジューラへギャングスケジューリングを委任できるようにする。特定スケジューラに直接結合せず `SchedulerProvider`・`BaseResourceProvider` を合成した `ReplicaResourceProvider` インターフェースでプラガブルに切り替える設計。PodGroup は Leader Pod への OwnerReference で寿命を同期し、StartupPolicy(LeaderCreated/LeaderReady)に応じて MinMember を切り替える。 - 新規 entity 1 件: [[LeaderWorkerSet]] - 更新 concept 2 件: [[Kubernetes Workload・PodGroup API]](本KEPとKEP-4671の「コア側標準化」対「コントローラ側プラガブル統合」という2レイヤー独立解の関係を追加)・[[GPUクラスタスケジューリング]](LWSのPodGroup統合という新しい参照点を追加) - Key insight: 資源制約下でスケジューラが Leader Pod のみ優先し Worker Pod が pending のまま放置されるとリソースデッドロックが生じる(Issue #167)。KEP-407 はこれを PodGroup による all-or-nothing 保証で防ぐが、[[@2025__KEP__KEP-4671 Gang Scheduling using Workload Object]] のコアAPI標準化に先行(2025-04-08起草)して、PodGroupのownershipをLeader Podへ紐付ける同型の設計原理に独立に到達していた。 - 図なし。GitHub Markdown を `gh api` で取得(README.md 515行)。著者は個別に列記されずIssue #167起票者を起点として記載。 ## 2026-08-19 | DeepServe: Serverless Large Language Model Serving at Scale(Junhao Hu ほか、Huawei Cloud / Peking University、USENIX ATC '25) - Source: [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]] — [[Huawei Cloud]] のフルホスト型サーバーレス AI プラットフォーム DeepServe。request-job-task というサーバーレス抽象化で post-training・agent serving・model serving を単一クラスタに統合し、サービングエンジン FlowServe(microkernel設計・NPU中心実行・SPMDベース並列化)・分散スケジューリング(locality-aware・PD-aware・load-awareの統合)・高速スケーリング(pre-warming・DRAM事前ロード・NPU-fork)という4つの設計コンポーネントで構成される。1年以上大規模 Ascend NPU クラスタ上で本番稼働。 - 新規 entity 3 件: [[Junhao Hu]](筆頭著者、[[Peking University]] から Huawei Cloud へインターン)・[[Xusheng Chen]]・[[Yizhou Shan]](co-corresponding author) - 更新 entity 4 件: [[Huawei Cloud]]・[[Peking University]]・[[Tao Xie]](UIUC からの所属移籍を DBLP で確認)・[[P-D-Serve]] - 更新 concept 3 件: [[Prefill-Decode分離]](PD分離/PD同居の優劣を実測ヒートマップから導出しリクエスト単位で動的に切り替えるselect-tes-PD-heatmapポリシー、選択の非対称な利得・損失分布という新知見を追加)・[[KVキャッシュ管理]](Relational Tensor Cacheによる同期照合/非同期取り込みの分離、radix-tree+IDベースのハイブリッドインデックスという新知見を追加)・[[モデルスケーリング高速化]](pre-warming・DRAM事前ロード・NPU-forkの多層防御設計、Ascend HCCS/RoCEでのNPU-fork実測を追加) - Key insight: PD分離とPD同居のどちらが有利かを、prefill長・decode長・RPSを軸にした実測ヒートマップとして可視化し、80%超のセルがRPSを変えても符号が一貫するという安定性を確認した上で、軽量LLM分類モデル(84.9%精度)によるdecode長予測と組み合わせてリクエスト単位でPD分離/PD同居を動的に切り替えるselect-tes-PD-heatmapポリシーを導出した。PD分離が有利な場合の利得(最大+0.87)はPD同居が有利な場合の利得(最大-0.40程度)より非対称に大きく、誤った選択の損失が小さいことがこのヒートマップベース設計を頑健にする。高速スケーリング面では、pre-warmed Pods/TEs・DRAM事前ロード・NPU-fork(高速NPU間リンク)を組み合わせても、最適化後のE2E内訳ではTE-Pre-load(Python起動・NPU初期化)が依然として支配的要因であり続けると報告し、モデル転送の高速化だけでは本番のコールドスタート問題を解決しきれないことを示唆する。 - 図表: 本文参照の図11点(Figure 1〜11)を全点埋め込み(ベクター描画はPyMuPDFキャプション座標クロップ、matplotlib埋め込みラスター画像はそのまま抽出)。Table 1・2はMarkdown表として本文転記。Algorithm 1(分散スケジューリングポリシー疑似コード)はコードブロックとして転記。 - 備考: USENIX 論文ページから PDF(全17ページ)を取得。ユーザー指示により発表動画(YouTube、`yt-dlp`で英語字幕取得)の文字起こしを補助テキストとして併用し、XDS(extremely disaggregated system)という上位プラットフォーム名称、Ascend チップのコア構成、実装言語選定の経緯、論文投稿後半年間の進捗(SuperPod-native化・omni request scheduler・xCCL)など、PDF本文に無い口頭説明を「Source: 発表動画」として明記し PDF 由来の記述と区別した。 ## 2026-08-19 | WVA: A Global Optimization Control Plane for llmd(Abhishek Malvankar ほか、IBM Research / University of Bologna、arXiv 2026) - Source: [[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]] — [[llm-d]](Kubernetes ネイティブ分散 LLM 推論フレームワーク)と共同設計された制御プレーン Workload Variant Autoscaler(WVA)。ハードウェア・並列度・量子化のタプルである Variant を第一級抽象として導入し、KV キャッシュ利用率・キュー長という推論エンジン内部の飽和シグナルに基づく headroom ベースのグローバル最適化(Unconstrained/Constrained Mode の Global Optimizer)と fragmentation-aware scale-down により、Kubernetes HPA が持つ資源中心・ハードウェア均質前提の限界(アプリケーション固有 SLO 非考慮・ハードウェア異種性非対応・エンジン内部状態の未捕捉)を克服する。 - 新規 entity 2 件: [[Abhishek Malvankar]](筆頭著者、IBM Research)・[[University of Bologna]](組織。共著者 Tommaso Sgreccia の所属) - 更新 entity 3 件: [[IBM Research]]・[[llm-d]]・[[Kubernetes]] - 新規 concept 1 件: [[オートスケーリング]](Kubernetes HPA の LLM 推論への構造的不適合と、汎用オートスケーラのコアへドメイン固有ロジックを埋め込まず拡張レイヤーとして重ねる設計原則を集約) - 更新 concept 1 件: [[LLMサービング管理]](WVA の headroom ベースオートスケーリングと PreServe のワークロード予測ベース事前起動が、同じコールドスタート/負荷不均一性 trilemma に異なる時間軸・シグナルで対処する並行した設計解であるという横断的知見を追加) - Key insight: シミュレーションと実機 200-H100 OpenShift クラスタの両方で、WVA は HPA 比の有効スループットを最大 37% 改善しリクエスト失敗数を 10 分の 1 に削減した。ただしデプロイの最大レプリカ数という外部制約に達すると(実機検証の 6 RPS 地点)、WVA の積極的な headroom ベーススケーリングが安全バッファなしの過負荷運用に陥り、スループット・失敗数・レイテンシのすべてで保守的な HPA に劣後する逆転が論文自身によって明示的に報告されている——headroom ベース戦略が上限制約下で持つ構造的な弱点を示す。 - 図表: 本文参照の図6点(Figure 1〜6)を全点埋め込み。Figure 1(埋め込みラスター画像)はそのまま抽出、Figure 2〜6(matplotlib 折れ線・棒グラフ)は PyMuPDF キャプション座標クロップで取得。表は本文に無し。 - 備考: arXiv HTML 版(`https://arxiv.org/html/2603.09730`)で書誌情報・abstract・著者所属を確認。PDF テキスト抽出(`pdftotext -layout`)で本文・数式・実験設定・数値を裏取り。 ## 2026-08-19 | agentgateway Standalone ドキュメント概要(agentgateway.dev) - Source: [[@2026__AgentgatewayDocs__agentgateway Standalone ドキュメント概要]] — [[Linux Foundation]] の一部としてホストされる Rust 製オープンソースゲートウェイ [[agentgateway]] の公式ドキュメントトップページ。通常の HTTP/gRPC API トラフィックと、[[Model Context Protocol|MCP]] ツールサーバ・A2A エージェント間通信・LLM 推論トラフィックを同一プロキシで扱う設計思想と、LLM Gateway・MCP Gateway・A2A Gateway・セキュリティ/オブザーバビリティ・プラットフォーム非依存の5機能領域を概観する。 - 新規 entity 5 件: [[agentgateway]](製品)・[[Agent2Agent Protocol (A2A)]](プロトコル)・[[Linux Foundation]](組織)・[[Kubernetes Gateway API]](製品)・[[CEL]](製品) - 更新 entity 3 件: [[Gateway API Inference Extension]]・[[Model Context Protocol]]・[[kagent]] - 新規 concept 1 件: [[AIゲートウェイ]](MCP・A2A・LLM推論トラフィックを通常API と同一プロキシで扱うという設計パターンを集約) - Key insight: MCP・A2A はステートフルな長命 JSON-RPC セッション・複数バックエンドへのファンアウト・サーバ起点 SSE プッシュ・クライアント単位の動的ツール可視性を要求し、従来の API ゲートウェイのステートレス request/response 前提と根本的に相容れない。agentgateway はこれを「AI 用」と「通常用」でゲートウェイを分離するのではなく単一プロキシへ統合することで解決するという設計判断を採る。[[Model Context Protocol]] エンティティpage では、この agentgateway の立ち位置が「サーバ側でツールを公開する」既存の MCP 実装(Google Production Agent・Amazon の共通ツールハンドル)とは異なる「複数 MCP サーバを集約・仲介・保護するインフラ層」の標準化であると位置づけた。 - 図表: `architecture.svg`(agentgateway の構成図)を1点埋め込み。 - 備考: ドキュメントサイトのトップ概要ページのみ取り込み。下位ページ(quickstart / about / deployment / configuration / llm / mcp / agent / operations / reference / faqs)は未取り込み。 ## 2026-08-19 | Running Agents on Kubernetes with Agent Sandbox(Kubernetes blog) - Source: [[@2026__KubernetesBlog__Running Agents on Kubernetes with Agent Sandbox]] — Kubernetes SIG Apps が開発中の [[Agent Sandbox]](`kubernetes-sigs/agent-sandbox`)を紹介する公式ブログ記事。AI エージェントは孤立・ステートフル・シングルトンという性質を持ち、既存の StatefulSet・headless Service・PersistentVolumeClaim の組み合わせでは大規模運用が破綻するという課題に対し、Sandbox CRD が [[gVisor]]・[[Kata Containers]] による強い隔離・アイドル時ゼロスケール可能なライフサイクル管理・安定したネットワークアイデンティティを提供する。SandboxWarmPool 拡張は事前起動済み Pod プールで約1秒の Pod 起動コールドスタートを解消する。 - 新規 entity 1 件: [[Agent Sandbox]](製品。sig-apps 発の AI エージェント向け宣言的 API) - 更新 entity 5 件: [[Kubernetes]]・[[gVisor]]・[[Kata Containers]]・[[LeaderWorkerSet]]・[[Agent Substrate]](Google/kagent の非 Kubernetes 解との対比を追記) - 更新 concept 1 件: [[Lightweight Sandboxing]](gVisor・Kata Containers が「性能競合手法」として評価される研究文脈と、「隔離ランタイムの選択肢」として並列に扱われるプラットフォーム統合文脈の対比を追加) - Key insight: 同じく sig-apps 発の [[LeaderWorkerSet]](分散 LLM 推論・訓練向け Leader/Worker 非対称レプリカ)と Agent Sandbox は、「既存 Kubernetes プリミティブの組み合わせでは表現しきれない AI 関連ワークロードの形状ごとに、専用の宣言的 API(CRD)を新設する」という共通の設計方針を示す。一方、既存エンティティ [[Agent Substrate]](Google 創立、[[kagent]] の次世代ランタイム)は同じ課題(サンドボックス化・アイドル時ライフサイクル・高速再開)に対し「Kubernetes Deployment 基盤の外に専用基盤を作る」という正反対の解を選んでおり、この2ソースを並べることで「Kubernetes 内で拡張するか、外に出るか」という同一課題への設計分岐が可視化された。 - 備考: Kubernetes ブログのトップ概要記事のみ取り込み。`kubernetes-sigs/agent-sandbox` リポジトリ本体・Python SDK・examples は未取り込み。 ## 2026-08-19 | Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol(Vasundra Srinivasan、arXiv 2026) - Source: [[@2026__arXiv__Bridging Protocol and Production - Design Patterns for Deploying AI Agents with Model Context Protocol]] — エンタープライズ AI エージェントプラットフォームの本番展開(大手クラウドプロバイダの [[Model Context Protocol|MCP]] サーバ統合、クライアント名秘匿)から得た教訓。MCP が規定しない3プリミティブ(identity propagation・adaptive tool budgeting・structured error semantics)を埋める Context-Aware Broker Protocol(CABP)・Adaptive Timeout Budget Allocation(ATBA)・Structured Error Recovery Framework(SERF)を検証可能な仮説として提案し、5設計次元(サーバ契約・ユーザーコンテキスト・タイムアウト・エラー・オブザーバビリティ)による失敗モード分類・脅威モデル(T1〜T4)・本番準備チェックリストを提示する。 - 新規 entity 1 件: [[Vasundra Srinivasan]](単著者、AI Architect) - 更新 entity 1 件: [[Model Context Protocol]](CABP による識別情報伝播ギャップの形式化、Phantom Tool 事例によるツール記述重要性の裏付けを追記) - 更新 concept 2 件: [[AIゲートウェイ]](CABP の6段責務が agentgateway 等の製品機能と独立に収束したこと、ブローカーの恒久性主張を追加)・[[エージェント運用安全性]](MCP ブローカー層でのツールレベル ACL 強制がプロトコル層の verification gate 実例であること、脅威モデル T1-T4 を追加) - Key insight: MCP には識別情報伝播・タイムアウト予算配分・エラーセマンティクスという3プロトコルレベルの欠落があり、これらは仕様がネイティブ対応した後もブローカー/ゲートウェイ層が恒久的に必要であり続ける。3件の実失敗事例(Phantom Tool・Silent Egress Failure・Retry Storm)はいずれもコード変更でなくツール記述・healthエンドポイント・冪等性キーというメタデータ/インフラの欠如が根本原因だった。 - 図表: 本文参照の図5点(Figure 1〜5)を全点埋め込み(全てベクター描画のため PyMuPDF キャプション座標クロップで取得、埋め込みラスター画像はゼロ)。表4点(Table 1〜4)を Markdown 表として転記。 - 備考: arXiv abs ページ(https://arxiv.org/abs/2603.13417)で投稿日・カテゴリを確認。PDF テキスト抽出で本文・数式・アルゴリズムを裏取り。DragonScale address c-003979(source)、c-003997(entity)を採番。 ## 2026-08-19 | kagent 関連記事3件バッチ取り込み(Medium・Platformers Community・kagent.dev 公式ブログ) - Source 1: [[@2025__Medium__Kagent - Open Source Agentic AI Framework for Autonomous Systems]] — [[kagent]] の一般向け入門記事。技術的詳細は薄く、数値指標なし。Cloudflare の直接アクセス拒否により r.jina.ai リーダープロキシ経由で取得。 - Source 2: [[@2025__PlatformersCommunity__An Introduction to Kagent - The Open Source Framework for AI Agents on Kubernetes]] — [[Lin Sun]](Solo.io Open Source Head)への取材に基づく入門記事。発案背景(ハリケーン時インシデント)・アーキテクチャ(宣言的API・MCP・A2A)・Istio Ambient Mesh + Argo CD の設定ミス自動修正デモ・ロードマップ(ADK/LangGraph/CrewAI 統合、Bring Your Own MCP、Agent Gateway)を一次情報に近い形で記述。 - Source 3: [[@2026__KagentDevBlog__The Future of kagent]] — [[Eitan Yarmush]](シニアアーキテクト)による公式ブログ。2026年8月時点の実績(163リリース・174貢献者・3,400+スター)、運用3課題(サンドボックス化・専用ファイルシステム・低占有率効率性)、Kubernetes Deployment 基盤から Google 創立の [[Agent Substrate]](100ms未満再開保証・microVM/gVisor サポート)への全面移行を発表。 - 新規 entity 3 件: [[Lin Sun]](人物)・[[Eitan Yarmush]](人物)・[[Agent Substrate]](製品、一次情報が限定的なため gap 注記あり) - 更新 entity 3 件: [[kagent]](発案背景・実績・Agent Substrate 移行を追記)・[[Solo.io]](Lin Sun・Eitan Yarmush の在籍を追記)・[[agentgateway]]・[[Agent Development Kit]](related に kagent を追加) - Key insight: kagent の3ソースを重ねると、プロジェクトの技術的成熟度の推移が見える——2025年5月(Medium、一般向け紹介)→2025年8月(Platformers、宣言的API+MCP+A2Aの具体アーキテクチャとデモ)→2026年8月(公式ブログ、Kubernetes Deployment モデルとエージェントワークロードの構造的ミスマッチを認識し Agent Substrate への全面移行を決断)という順に情報の精度と技術的踏み込みが深まっている。特に最新記事が示す「常時起動コンテナ前提の Deployment 抽象は間欠実行のエージェントワークロードと根本的にミスマッチする」という論点は、kagent 固有の課題ではなく Kubernetes ネイティブ AgenticOps 全般に波及しうる論点である。 - 備考: DragonScale address c-003991〜c-003993(source 3件)、c-003994〜c-003996(entity 3件)を採番。3ソースとも独立性が高く並列取得可能だったため、WebFetch を3件同時実行して取得した。 ## 2026-08-19 | Envoy AI Gateway ブログ記事3件(公式ブログ) - Source 1: [[@2024__EnvoyAIGatewayBlog__Introducing Envoy AI Gateway]] — [[Tetrate]] と [[Bloomberg L.P.]] が2024年10月に協業開始した [[Envoy AI Gateway]] プロジェクト発足記事。トークンベース使用量制御・統一API・アップストリーム認可というMVP3機能を提示。 - Source 2: [[@2025__EnvoyAIGatewayBlog__Envoy AI Gateway Reference Architecture]] — Tier One(集約クラスタ)/Tier Two(自ホストモデルクラスタ)からなる二層ゲートウェイのリファレンスアーキテクチャ。自ホスト型モデルサービングを[[KFServing|KServe]]に委譲する統合方針を示す。 - Source 3: [[@2025__EnvoyAIGatewayBlog__MCP in Envoy AI Gateway]] — [[Model Context Protocol|MCP]]のステートフルセッションを、アップストリームセッション情報をクライアントセッションIDへ自己完結的にエンコードする「トークンエンコーディング設計」で扱う実装判断を解説。Redis等の集約化ステート管理を代替案として検討・却下した理由も明示。 - 新規 entity 6 件: [[Envoy AI Gateway]](製品、ハブ)・[[Envoy Gateway]](製品)・[[Tetrate]](組織)・[[Erica Hughberg]]・[[Alexa Griffith]]・[[Ignasi Barrera]](いずれも人物) - 更新 entity 5 件: [[Envoy]](LLM/AIゲートウェイへの展開を追記)・[[KFServing]](KServeへの改名とEnvoy AI Gatewayでの再利用を追記)・[[Bloomberg L.P.]](Envoy AI Gateway共同創設を追記)・[[Model Context Protocol]](トークンエンコーディングによるステートフルセッション設計を追記)・[[Kubernetes Gateway API]](Envoy Gatewayとの関係を追記) - 更新 concept 1 件: [[AIゲートウェイ]]([[agentgateway]](新規統合Rustプロキシ)と Envoy AI Gateway(既存Envoyエコシステム拡張)という2つの異なる出自の実装アプローチの対比、MCPセッション状態配置の設計軸(エンコードして無ステート化 対 集約ストア一元管理)、自ホスト型モデルサービング層との統合方針の違いを追加) - Key insight: Envoy AI Gateway は「LLM/MCPトラフィックも最終的にはHTTPに依存する」という主張のもと、新規プロキシを実装するのではなく既存のEnvoy Gateway/Envoy Proxyエコシステム(約10年の本番運用実績)を拡張する戦略を取る。これは agentgateway の「Rustで新規統合プロキシを作る」戦略と対照的であり、「AIゲートウェイ」という同一の問題設定(LLM/MCP/A2Aトラフィックを通常APIと同一プロキシで扱う)に「既存資産拡張」と「新規統合実装」という異なる出自から独立に到達しつつある構造が見える。MCPステートフルセッションの扱いでも、Envoy AI Gatewayの「トークンエンコーディング(ゲートウェイをステートレスに保つ)」対「集約化ステート管理(Redis、却下)」という明示的な設計判断の記録は、AIゲートウェイのMCPセッション状態配置に「エンコードして無ステート化」対「集約ストアで一元管理」という一貫した設計軸があることを示す一次資料になった。 - 備考: 記事内の二層ゲートウェイアーキテクチャ図・KServe統合図は、抽出したURLが取得時点で404だったため埋め込みを断念しテキストのみで取り込んだ。DragonScale address c-003980〜c-003985(entity 6件)、c-003986〜c-003988(source 3件)を採番。 ## 2026-08-19 | KVBM (KV Block Manager) 概要(NVIDIA Dynamo 公式ドキュメント) - Source: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]] — [[NVIDIA Dynamo]] Knowledge Base 配下の KVBM 概要ページ。異種・分散環境をまたいで KV ブロックのメモリ割り当て・管理・リモート共有を担うスケーラブルなランタイムコンポーネントを、LLM 推論ランタイム層・KVBM ロジック層・[[NIXL]] 層の3層アーキテクチャとして解説する。 - 新規 entity 1 件: [[KVBM (KV Block Manager)]](製品。NVIDIA Dynamo の KV キャッシュ統一メモリ層) - 更新 entity 4 件: [[NVIDIA Dynamo]](主要コンポーネント節を KVBM 詳細ページへリンク)・[[NIXL]](KVBM 最下層としての役割を追記)・[[vLLM]]・[[TensorRT-LLM]](いずれも KVBM 対応フレームワークとして追記)・[[SGLang]](KVBM 非対応・HiCache 代替経路を追記) - 更新 concept 1 件: [[KVキャッシュ管理]](フレームワーク非依存の共通階層管理レイヤーを NIXL の上に切り出す設計として KVBM を位置づけ、SGLang の HiCache 直結アプローチとの設計思想対比を追加) - Key insight: KVBM の Feature Support Matrix は vLLM・TensorRT-LLM を対応、SGLang を非対応(❌)と明記する。SGLang は代わりに自身の階層キャッシュ HiCache を NIXL と直接連携させる別経路を持ち、「フレームワーク非依存の共通メモリ管理層を挟む」(KVBM)対「エンジン内蔵の階層キャッシュ実装」(SGLang HiCache)という設計分岐が、同じ NIXL を最下層に置く2つのアプローチの間に生じている。 - 図表: KVBM Architecture 図(3層構成、S3 署名付き URL から SVG を取得)を1点埋め込み。 - 備考: トップレベル概要ページのみ取り込み。下位ページ(KVBM Guide・KVBM Design・KV Cache Offloading 比較(LMCache/FlexKV/HiCache)・SGLang HiCache)は未取り込み。WebFetch は著作権保護のため全文転記を拒否したため、`defuddle parse` で生テキストを取得し裏取りした。DragonScale address c-003998(source)・c-003999(entity)を採番。 ## 2026-08-19 | A Fresh Look at the Architecture and Performance of Contemporary Isolation Platforms(van Rijn & Rellermeyer, Middleware 2021) - Source: [[@2021__Middleware__A Fresh Look at the Architecture and Performance of Contemporary Isolation Platforms]] — [[Delft University of Technology|TU Delft]] の [[Vincent van Rijn]]・[[Jan S. Rellermeyer]] による、コンテナ([[Docker]]・[[LXC]])・セキュアコンテナ([[Kata Containers]]・[[gVisor]])・ハイパーバイザー([[QEMU]]・[[Firecracker]]・[[Cloud Hypervisor]])・ユニカーネル([[OSv]])の計10プラットフォームをCPU・メモリ・I/O・ネットワーク・起動時間・実運用ワークロード(Memcached, MySQL)の6軸で横断比較し、EPSS重み付けした拡張HAPメトリクスでセキュリティも定量評価した実証研究。28件のFinding・9件のConclusion。図18点を全点埋め込み(アーキテクチャ図4点はPyMuPDFキャプション座標クロップで取得)。 - 新規 entity 5 件: [[Vincent van Rijn]](人物)・[[Jan S. Rellermeyer]](人物)・[[QEMU]](製品)・[[Cloud Hypervisor]](製品)・[[OSv]](製品) - 更新 entity 6 件: [[Docker]]・[[LXC]]・[[Firecracker]]・[[gVisor]]・[[Kata Containers]](いずれも本論文の横断ベンチマーク結果を追記)・[[Delft University of Technology]](著者所属として追記) - 新規 concept 1 件: [[ユニカーネル]](本論文が唯一の出典。OSvの拡張HAPメトリクス上の少なさとハイパーバイザー依存性を起点concept化) - 更新 concept 3 件: [[コンテナ仮想化]](10プラットフォーム横断比較による「隔離強度と性能のトレードオフ」問いの大枠解決、VEE'20とのHAP傾向の一致、virtio-fsによるI/O改善実証を追記)・[[ハードウェア仮想化]](QEMU・Firecracker・Cloud Hypervisorの成熟度別オーバーヘッド実測を追記)・[[Lightweight Sandboxing]](拡張HAPメトリクスによるKata Containersの"Speed of containers, security of VMs"タグライン破綻の実証を追記) - Key insight: 本論文の拡張HAPメトリクスは、[[@2020__VEE__Blending Containers and Virtual Machines - A Study of Firecracker and gVisor]] が静的コードカバレッジで示した「gVisorはLXCより大きいコードカバレッジを持つ」という知見を、動的な悪用可能性重み付け呼び出し頻度という異なる指標で独立に確認した(方向性が一致)。一方でFirecrackerについては、VEE'20の「許可されるシステムコールがわずか36個と最も厳格」という静的指標と、本論文の「拡張HAPでは全プラットフォーム中最もホストカーネル関数を呼び出す」という動的指標が一見矛盾するように見え、「狭いシステムコールインタフェースは低頻度の呼び出しを意味しない」という新たな知見を生んだ。また、Kata Containersの"Speed of containers, security of VMs"タグラインについては、VEE'20が実測せず紹介のみに留めたのに対し、本論文が実際に定量測定して「一般には成立しない」と反証した点で、2つの独立ソースが同一の対象に異なる深さでアプローチした好例となった。 - 備考: PDFはpure.tudelft.nl(TU Delft機関リポジトリ)から取得。サンドボックスのSSL証明書検証エラーのためサンドボックス無効化で再取得した。DragonScale address c-004004(source)、c-004005〜c-004009(entity 5件)、c-004010(concept)を採番。 ## 2026-08-19 | Reading postmortems(Dan Luu、danluu.com) - Source: [[@danluu.com__Reading postmortems]] — [[Dan Luu]] が Google・Microsoft 在籍時に社内ポストモーテムを大量に読んだ経験から、フォーマルな定量分析に先立って観測した「重大障害の再発パターン」5分類(エラーハンドリング・設定・ハードウェア・人間・監視/アラート)を、公開文献の引用で裏付けながら整理したエッセイ。公開日はページ上に未記載。 - 新規 entity 1 件: [[Dan Luu]](人物、danluu.com のブロガー) - 更新 entity 1 件: [[Ding Yuan]](OSDI'14 でのもう1本の論文"Simple Testing Can Prevent Most Critical Failures"への言及を追記) - 更新 concept 3 件: [[ポストモーテム]](実務者が観測した障害原因5分類、「ops smell」視点を追加)・[[設定ミス脆弱性]](公開ポストモーテムの約50%が設定変更起因という実務規模の裏付けを追加)・[[人的要因]](事前設計への疑いとしての「ops smell」、人的エラー過小報告の逆説を追加) - Key insight: 記事が引用する参照文献のうち [[@1998__CtL__How Complex Systems Fail]]・[[@1985__Tandem__Why Do Computers Stop and What Can Be Done About It]]・[[@2013__SOSP__Do Not Blame Users for Misconfigurations]] はこの wiki に既に source として ingest済みであり、danluu の実務者的な多読観察と、これらの学術・一次資料の知見が独立に収束することが確認できた。Ding Yuan et al. (OSDI'14) の「重大障害の92%がエラー誤処理起因」という統計は、既存の [[Ding Yuan]] エンティティ(SPEX・lprof)に3本目の代表作として接続された。 - 備考: sandbox のネットワーク制限で danluu.com へのアクセスがブロックされたため sandbox 無効化で再取得。defuddle で本文抽出。画像なし(記事内の図はグラフのキャプチャで内容説明が本文に含まれるため埋め込みは省略)。DragonScale address c-004012(source)・c-004013(entity)を採番。 ## 2026-08-19 | Understanding and Dealing with Operator Mistakes in Internet Services(Nagaraja+, OSDI 2004) - Source: [[@2004__OSDI__Understanding and Dealing with Operator Mistakes in Internet Services]] — [[Rutgers University]] の [[Kiran Nagaraja]]・[[Fábio Oliveira]]・[[Ricardo Bianchini]]・[[Richard P. Martin]]・[[Thu D. Nguyen]] による、21人の被験者オペレータに三層オークションサービスの保守・診断タスクを行わせた43回のライブ実験の分析。42件のオペレータミス(設定ミス24件・誤ったソフトウェア再起動14件が最頻、19件が即座のスループット低下)を観測し、オペレータのアクションをオンラインスライスへ反映する前に検証スライスで妥当性確認する validation 基盤(トレースベース検証・レプリカベース検証・マルチコンポーネント検証)を提案・実装した。プロトタイプは観測ミスの66%(28/42件)を検知し、offline testingの40%(17/42件)を上回った。 - 新規 entity 4 件: [[Kiran Nagaraja]]・[[Fábio Oliveira]]・[[Richard P. Martin]]・[[Thu D. Nguyen]](いずれも人物、Rutgers University の著者) - 更新 entity 2 件: [[Ricardo Bianchini]](2004年当時のRutgers University所属時代の論文として追記)・[[Rutgers University]](OSDI'04の運用ミス検証研究を追記) - 更新 concept 1 件: [[運用障害分析]](Oppenheimer 2003 のポストモーテム集計分析に対し、実験的再現という第三の方法論を追加。エキスパートもミスを犯すという実験的知見、検証(validation)を予防的介入として位置づける横断的知見を追記) - Key insight: [[@2003__USITS__Why Do Internet Services Fail and What Can Be Done About It]](Oppenheimer et al. 2003、参考文献[19])を論文自身が直接引用・拡張しており、集計統計中心のポストモーテム分析(Oppenheimer 2003)と、個々のミスの発生プロセスを追う実験的再現(本論文)という2つの方法論が同一テーマ(オペレータエラー)に対して相補的であることを確認した。「エキスパートオペレータも無視できない割合でミスを犯す」という実験結果は、スキル向上だけでは運用ミスを解消できないことを直接裏付ける一次的証拠である。 - 図表: Figure 1(オペレータミスとその影響、積み上げ棒グラフ)・Figure 2(オペレータカテゴリ別ミス内訳)・Figure 3(検証を伴う三層オークションサービスのアーキテクチャ図)・Figure 4(検証操作によるCPUオーバーヘッド)の4点を全点、PyMuPDFキャプション座標クロップで取得・埋め込み(ベクター描画のため pdf.js の埋め込み画像抽出では取得不可だった)。Table 1・Table 2 はMarkdown表として転記。 - 備考: USENIXの会議ページ(usenix.org)はWebFetchが403を返したため、ブラウザUAを設定したcurlで取得(既知の403回避策)。PDFは `usenix.org/publications/library/...` の直リンクから取得。DragonScale address c-004019(source)、c-004020〜c-004023(entity 4件)を採番。 ## 2026-08-19 | Simple Testing Can Prevent Most Critical Failures: An Analysis of Production Failures in Distributed Data-Intensive Systems(Yuan+, OSDI 2014) - Source: [[@2014__OSDI__Simple Testing Can Prevent Most Critical Failures - An Analysis of Production Failures in Distributed Data-Intensive Systems]] — [[University of Toronto]] の [[Ding Yuan]]・[[Michael Stumm]] らによる、Cassandra・HBase・HDFS・Hadoop MapReduce・Redis の実障害198件(うち壊滅的障害48件)を issue tracker から抽出し、手動精読・73件の再現を行った実証分析。壊滅的障害の**92%が明示的に通知された非致命的エラーの誤処理**に起因し、35%(単純ミス:空catch・過剰catch・TODO放置)は容易に予防可能、58%は簡単なテストで検出可能だったと報告。静的チェッカー Aspirator を9分散システムに適用し500件の新規バグ・悪しき実践を検出、143件が開発者に修正・確認された。障害の90%は3入力イベント以下、98%は3ノード以下、77%はユニットテストで再現可能という testability の知見も併せて提示する。 - 新規 entity 4 件: [[Xin Zhuang]]・[[Guilherme Renna Rodrigues]]・[[Pranay U. Jain]]・[[Yu Luo (University of Toronto)]](いずれも人物、2014年当時 University of Toronto の共著者) - 更新 entity 6 件: [[Ding Yuan]]("未ingest"note を実リンクへ解消)・[[Michael Stumm]]・[[Xu Zhao]]・[[Yongle Zhang]](本論文への参加と経歴の連続性を追記)・[[University of Toronto]](2014年のDing Yuan/Michael Stummグループの2論文を追記)・[[Yu Luo]]/[[Yu Luo (Tencent)]](同名異人noteを更新) - 更新 concept 2 件: [[分散システム障害]](本論文が「原因分類」から「発現連鎖」へ視点を移した2014年の先駆けであること、top-down障害注入とbottom-upエラーハンドリング解析の方法論的対立軸、再現困難性の通念を覆す実証データを追加)・[[非致命的RPCエラー]](Uber の非致命的RPCエラー研究(2024)と、10年早いエラーハンドリングコードのバグとしての定量化(本論文、2014)との二面性を追加) - Key insight: [[Ding Yuan]] エンティティページに「未ingest」として予告されていた本論文([[@danluu.com__Reading postmortems]] の中核的引用元)を実際に ingest したことで、Ding Yuan の3本(SPEX=設定ミス・lprof=リクエストフロープロファイリング・本論文=エラーハンドリング)が揃い、分散システムの信頼性研究を一貫して多角的に手がけた人物像が完成した。壊滅的障害の92%という単一の knock-down finding は、[[分散システム障害]] concept が集約する後続の実証研究群(設定ミス2011・並行バグ2016・部分障害2020)より一貫して早い時期に、原因分類でなく「発現連鎖」という別の軸を提示していたことが確認できた。 - 図表: Figure 1〜12 の全12点を全点埋め込み(HDFS/HBase/MapReduce の障害シーケンス図・棒グラフ・Aspiratorの断片コード例。すべてベクター描画のため pdf.js の埋め込み画像抽出では断片パーツしか取れず、PyMuPDFキャプション座標クロップで再取得)。Table 1〜9 の全9点をMarkdown表として転記。 - 備考: USENIXの会議ページ(usenix.org)はWebFetchが403を返したため、ブラウザUAを設定したcurlで取得(既知の403回避策)。PDFは `usenix.org/system/files/conference/osdi14/...` の直リンクから取得。DragonScale address c-004014(source)、c-004015〜c-004018(entity 4件)を採番。 ## 2026-08-19 | Collie: Finding Performance Anomalies in RDMA Subsystems(Kong+, NSDI 2022) - Source: [[@2022__NSDI__Collie - Finding Performance Anomalies in RDMA Subsystems]] — Duke University・ByteDance Inc. の [[Xinhao Kong]]・[[Yibo Zhu]]・[[Huaping Zhou]]・[[Zhuo Jiang]]・[[Jianxi Ye]]・[[Chuanxiong Guo]]・[[Danyang Zhuo]] による、RDMA サブシステムの性能異常をデプロイ前に体系的に発見するツール Collie の提案論文。verbs API の narrow-waist 抽象からホストトポロジ・メモリ割り当て・トランスポート設定・メッセージパターンの4次元探索空間を構築し、性能・診断カウンタを焼きなまし法(simulated annealing)で極値領域へ駆動することで性能異常(PFC pause frame ストーム・低スループット)を発見、minimal feature set (MFS) アルゴリズムで再現条件を特定する。8種類の商用RDMAサブシステムで評価し、既知3件を含む18件の性能異常を発見(15件が新規)、全件がベンダーに承認され7件は修正済み。自社RDMA RPCライブラリとBytePSベース分散機械学習フレームワークの性能異常回避に実運用で活用された事例も報告する。 - 新規 entity 3 件: [[Xinhao Kong]](筆頭著者、Duke University・ByteDance)・[[Huaping Zhou]]・[[Jianxi Ye]](いずれも ByteDance Inc. 所属の共著者) - 更新 entity 6 件: [[Yibo Zhu]]・[[Chuanxiong Guo]](ByteDance 所属としての Collie 参画を追記)・[[Danyang Zhuo]](Duke University 所属としての Collie 参画を追記、CorrOpt/RAIL に続く主要業績)・[[Zhuo Jiang]](「未ingest」として予告されていた Collie を実リンクに解消)・[[Duke University]](Collie 共著を追記)・[[ByteDance]](RDMA/ネットワーク信頼性研究の系譜を2022年のCollieまで遡って追記) - 更新 concept 2 件: [[RDMA]](RDMA サブシステムの性能異常がネットワークプロトコル層だけでなくホスト側ハードウェアの相互作用からも生じること、verbs API という狭いウエストの抽象を使った探索空間構築、性能/診断カウンタによる非侵襲的なデプロイ前探索を追加)・[[RDMAネットワーク監視]](既存の監視三系統(能動プローブ・受動トラフィック・フルスタック計装)に「デプロイ前の事前探索」という第四の時間軸を追加、Collie が発見する異常の根本原因が主に NIC/DPU 層に集中することを追加) - Key insight: [[Zhuo Jiang]] エンティティページに「ByteDance の RDMA・ネットワーク信頼性研究(R-Pingmesh・Collie 等)」として予告されていた Collie を実際に ingest したことで、ByteDance の RDMA/AI インフラ信頼性研究に「事前検証(Collie, 2022)→本番監視(R-Pingmesh, 2024)→障害検知(Minder, 2025)→フェイルオーバー(ReCCL, 2026)」という時系列が完成した。Collie は既存 [[RDMAネットワーク監視]] concept が扱う本番稼働中の反応的診断とは異なる、デプロイ前の予防的ハードウェア検証という新しい時間軸を [[RDMA]] concept に加える。 - 図表: Figure 1〜6 の全6点を全点埋め込み(RDMAサブシステム構成・システム概要・プログラミング抽象・探索効率比較3点。すべてベクター描画のため pdf.js の埋め込み画像抽出では取得不可能で、PyMuPDFキャプション座標クロップで取得)。Table 1・2 の全2点をMarkdown表として転記。 - 備考: USENIXの会議ページ(usenix.org)はWebFetchが403を返したため、ブラウザUAを設定したcurlで取得(既知の403回避策)。PDFは `usenix.org/system/files/nsdi22-paper-kong.pdf` の直リンクから取得。DragonScale address c-004024(source)、c-004025〜c-004027(entity 3件)を採番。 ## 2026-08-19 | Hostping: Diagnosing Intra-host Network Bottlenecks in RDMA Servers(Liu+, NSDI 2023) - Source: [[@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers]] — BUPT・ByteDance Inc.・Purple Mountain Laboratories の [[Kefei Liu]]・[[Zhuo Jiang]]・[[Jiao Zhang]]・Haoran Wei・Xiaolong Zhong・Lizhuang Tan・Tian Pan・Tao Huang による、RDMA サーバのホスト**内**ネットワーク(PCIe リンク・メモリチャネル・CPU ソケット間バス)に特化した初のボトルネック監視・診断システム Hostping の提案論文。RNIC 線速の急増(25Gb/s→200Gb/s)に PCIe 帯域の伸びが追いつかないという背景のもと、RNIC-エンドポイント間ループバックテストでホスト内レイテンシ・帯域を計測し、binary network tomography に着想した投票機構でリンク単位の異常を推論する。300台超の本番分散機械学習サーバへの展開で、既知4種のリンク障害に加え CPU ルートポート障害・メモリチャネルフラッピング・ACS/ATS設定ミス・輻輳起因の帯域劣化など6種の新規ボトルネックを発見した。 - 新規 entity 6 件: [[Haoran Wei]]・[[Xiaolong Zhong]]・[[Lizhuang Tan]]・[[Tian Pan]]・[[Tao Huang]](いずれも人物、BUPT/ByteDance/Purple Mountain Laboratories 所属の共著者)・[[Purple Mountain Laboratories]](組織、南京の研究機関) - 更新 entity 5 件: [[Kefei Liu]](R-Pingmeshの筆頭著者としてのみ記載されていたところに、先行研究 Hostping の筆頭著者としての実リンクを追加)・[[Jiao Zhang]](Hostping の責任著者情報を追加)・[[Zhuo Jiang]](Collie・R-Pingmesh・Minder・ReCCLのライフサイクルに「ホスト内診断(Hostping)」を追加)・[[BUPT]](Hostping の共同研究情報を追加)・[[ByteDance]](Hostping を sources/関連に追加) - 新規 concept 1 件: [[ホスト内ネットワークボトルネック]](RNIC-エンドポイント間の PCIe/メモリチャネル/UPI で発生するホスト内部のボトルネック。binary network tomography のホスト内適用、症状の2分類(帯域劣化・レイテンシ増加)、誤設定(ACS/ATS)がハードウェア障害と同水準の深刻さを持つことを集約) - 更新 concept 2 件: [[RDMAネットワーク監視]](診断対象がネットワーク層からホスト内部へ降りる第五の層としての Hostping、binary network tomography のホスト内層への継承、誤設定という新しい根本原因クラスを追加)・[[RDMA]](RNIC 線速の急増に PCIe 帯域の伸びが追いつかずホスト内部が新たなボトルネック源になるという知見を追加) - Key insight: [[Kefei Liu]] エンティティページに「先行研究 Hostping」として既に予告されていた本論文を実際に ingest したことで、Kefei Liu・Zhuo Jiang・Jiao Zhang らを軸とした BUPT/ByteDance の RDMA 信頼性研究に、Collie(デプロイ前探索, 2022)より前の時系列ではなく「ホスト内部」という別レイヤーの診断(Hostping, 2023)が加わった。R-Pingmesh(ネットワーク層、SIGCOMM 2024)と Hostping(ホスト内部、NSDI 2023)は同じ著者陣による「診断対象の層を分けた」連続研究であり、既存 [[RDMAネットワーク監視]] concept が集約してきた計装位置の議論(スイッチ ASIC・NIC/DPU・集団通信ライブラリ・物理部品)に、RNIC よりさらに内側という第五の層を明示的に加えた。 - 図表: Figure 1〜10 の全10点を全点埋め込み(Figure 2・5・6・7・8(a-f)・10(a-c) の9点は pdf.js の埋め込みラスター画像抽出で取得、Figure 1・3・4・9 の4点はベクター描画のため PyMuPDF キャプション座標クロップで取得)。表なし。 - 備考: USENIX の会議ページ(usenix.org)は WebFetch が 403 を返したため、ブラウザ UA を設定した curl で取得(既知の 403 回避策)。PDF は `usenix.org/system/files/nsdi23-liu-kefei.pdf` の直リンクから取得。DragonScale address c-004028(source)、c-004030〜c-004035(entity 6件)、c-004056(concept)を採番。 ## 2026-08-19 | Congestion Patterns in a Large-scale RDMA Datacenter(Ghorbani+, IMC 2025) - Source: [[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]] — Meta・Johns Hopkins University の [[Soudeh Ghorbani]]・[[Yimeng Zhao]]・[[Srikanth Sundaresan]]・[[Ying Zhang]]・[[Yijing Zeng]]・[[Abhigyan Sharma]]・[[Prashanth Kannan]]・[[Cristian Lumezanu]] による、分散AI訓練専用の大規模RDMAデータセンターにおける本番輻輳パターンをトポロジ層・時間スケール・ワークロード横断で測定した初の研究。ToRスイッチの`switchos`(分単位カウンタ)とホスト常駐の`finecounters`(ミリ秒級サンプリング)を用い、PFC(Priority Flow Control)の導入によって輻輳箇所がTCP/IPデータセンターのエッジ(ToR→host)からネットワークコア(ToR→spine)へシフトしたこと、トラフィックがラックローカルでないこと(コア/エッジ差約16%)、スパイン間のPFC一時停止フレーム負荷が2桁近く不均一であること、AI訓練トラフィックがゾーンによっては53%のホストで同期する頻発バースト(中央値4.8〜9.6ms)を示すこと、粗粒度(分単位)のPFC一時停止カウンタが平均トラフィックレートでは見えないバースト性を検知できることを報告する。 - 新規 entity 7 件: [[Soudeh Ghorbani]](筆頭著者、Meta・Johns Hopkins University兼任)・[[Yimeng Zhao]]・[[Srikanth Sundaresan]]・[[Yijing Zeng]]・[[Abhigyan Sharma]]・[[Prashanth Kannan]]・[[Cristian Lumezanu]](いずれもMeta所属の共著者) - 更新 entity 3 件: [[Meta]](本番RDMA AIデータセンターの輻輳測定研究を追記)・[[Johns Hopkins University]]([[Soudeh Ghorbani]]の兼任所属先として追記)・[[Ying Zhang]](Rail-onlyに続く本論文への参加を追記) - 更新 concept 2 件: [[データセンター輻輳制御]](PFC導入が輻輳箇所をエッジからコアへシフトさせるという空間的帰結、粗粒度カウンタでもバースト性を捉えられる「指標の種類」という設計軸、RDMAファブリックがラックローカリティを前提にできないことを追加)・[[RDMAネットワーク監視]](既存の粗粒度PFCカウンタ自体がバースト検知の一次シグナルになりうるという知見、PFC展開による輻輳空間分布の変化が既存監視系の計装点設計と整合することを追加) - Key insight: 本論文はMetaのAI訓練専用RDMAデータセンターにおける「輻輳がどこで・どう起きるか」を初めてトポロジ層横断で実測し、PFCの導入が輻輳の発生を防ぐだけでなく発生場所そのものを一段上(エッジ→コア)へ動かすという構造的帰結を明らかにした。既存の [[RDMAネットワーク監視]] concept が集約してきたHawkeye(スイッチデータプレーン計装)・R-Pingmesh(能動プローブ)等の設計判断が、本論文の実測知見(コアが最も輻輳する)と整合することを独立した測定研究として裏付けた。 - 図表: Figure 1〜6 の全6点を全点PyMuPDFキャプション座標クロップで取得(すべてベクター描画のため pdf.js の埋め込みラスター画像抽出では取得不可能)。表なし。 - 備考: ローカルPDF(`/Users/y-tsubouchi/Downloads/Congestion_Patterns_Large_scale_RDMA.pdf`)から取り込み。DOI(https://doi.org/10.1145/3730567.3764494)から書誌情報を確認、arXiv版は確認できず。DragonScale address c-004029(source)、c-004043〜c-004049(entity 7件)を採番。 ## 2026-08-19 | Understanding RDMA Microarchitecture Resources for Performance Isolation(Kong+, NSDI 2023) - Source: [[@2023__NSDI__Understanding RDMA Microarchitecture Resources for Performance Isolation]] — Duke University・Microsoft・Shanghai Jiao Tong University の [[Xinhao Kong]]・[[Jingrong Chen]]・[[Wei Bai]]・[[Yechen Xu]]・[[Mahmoud Elhaddad]]・[[Shachar Raindel]]・[[Jitendra Padhye]]・[[Alvin R. Lebeck]]・[[Danyang Zhuo]] による、RNIC(RDMA NIC)のマイクロアーキテクチャリソース(NIC キャッシュ・処理ユニット・PCIe 帯域)がマルチテナント性能分離に与える影響を体系的に検証した論文。control verb(特に MR deregistration)は data verb よりも激しいキャッシュミスを誘発し帯域を 96.6→48.0 Gbps に低下させ、RNR エラー処理は処理ユニット全体を停止させ victim の帯域を 93.53→0.018 Gbps に崩壊させることを実証した。この消費モデルに基づき、既存の性能分離ソリューション(SR-IOV・HW TC・Justitia)をすべて破壊するテストスイート Husky を構築し、allreduce・eRPC-based Masstree の実アプリケーションでも影響が波及することを示した。発見は NVIDIA によって再現・確認され、ファームウェア修正が計画された。 - 新規 entity 5 件: [[Jingrong Chen]]・[[Yechen Xu]]・[[Mahmoud Elhaddad]]・[[Shachar Raindel]]・[[Alvin R. Lebeck]](いずれも Duke University・Microsoft・Shanghai Jiao Tong University 所属の共著者) - 更新 entity 7 件: [[Xinhao Kong]](Collie に続く2本目の主要業績として Husky を追記)・[[Danyang Zhuo]](同様に Husky への参画を追記)・[[Wei Bai]]・[[Jitendra Padhye]](Microsoft 側著者としての本論文参画を追記)・[[Duke University]]・[[Microsoft]]・[[Shanghai Jiao Tong University]](本論文の共同研究情報を追記) - 新規 concept 1 件: [[マルチテナントRDMA性能分離]](パブリッククラウドで複数テナントが同一 RNIC を共有する際の性能分離。RNIC マイクロアーキテクチャリソースの分類、control/data verb・エラー処理の3種の消費パターン、既存分離機構がいずれも不十分であるという知見を集約) - 更新 concept 2 件: [[RDMA]](Collie と Husky が同一著者陣により「性能異常の発見」から「性能分離の破壊」へ発展したこと、SR-IOV が architectural resource は分離できてもマイクロアーキテクチャリソースは分離できないことを追加)・[[RoCE設計課題]](関連 concept として [[マルチテナントRDMA性能分離]] へのリンクを追加) - Key insight: 同一著者陣(Xinhao Kong・Danyang Zhuo)による Collie(NSDI '22、デプロイ前の性能異常探索)と Husky(NSDI '23、マルチテナント性能分離の破壊)が、「RNIC はブラックボックスであり内部リソースが性能問題の根本原因になる」という一貫した問題意識を異なる文脈(第一者トラフィックの通常操作 vs 悪意ありうる第三者テナント)で確認した。ハードウェアベースの分離機構(SR-IOV)が architectural resource(帯域)は分離できてもマイクロアーキテクチャリソース(キャッシュ・PU)は分離できないという発見は、[[RoCE設計課題]] が指摘する「セキュリティの設計上の弱さ」とは異なる層の問題として、マルチテナント RDMA という新しい concept を独立させる根拠になった。 - 図表: Figure 1〜10 の全10点を全点 PyMuPDF キャプション座標クロップで取得(全図がベクター描画のため pdf.js の埋め込みラスター画像抽出では取得不可能。images.json には page1 のロゴ画像2点のみ)。Table 1・2 は Markdown 表に転記、Table 3(チェックマーク表)は画像埋め込み。 - 備考: USENIX の会議ページ(usenix.org)は WebFetch が 403 を返したため、ブラウザ UA を設定した curl で取得(既知の 403 回避策)。PDF は `usenix.org/system/files/nsdi23-kong.pdf` の直リンクから取得。DragonScale address c-004036(source)、c-004037〜c-004041(entity 5件)、c-004042(concept)を採番。 ## 2026-08-19 | Understanding the Micro-Behaviors of Hardware Offloaded Network Stacks with Lumina(Yu+, SIGCOMM 2023) - Source: [[@2023__SIGCOMM__Understanding the Micro-Behaviors of Hardware Offloaded Network Stacks with Lumina]] — Johns Hopkins University・Peking University・Microsoft・Rice University の [[Zhuolong Yu (Johns Hopkins University)]]・[[Bowen Su]]・[[Wei Bai]]・[[Shachar Raindel]]・[[Vladimir Braverman]]・[[Xin Jin]] による、ハードウェアオフロード型ネットワークスタック(RDMA NIC)の正しさ・性能をテストするツール Lumina の提案論文。プログラマブルスイッチ(Intel Tofino)を2ホスト間のイベント注入器として使い、パケットドロップ・ECNマーク・破損を決定論的に注入し、全パケットを専用サーバー群へミラーリングしてオフライン解析する。NVIDIA/Intelの商用RDMA NIC 4機種(CX4 Lx・CX5・CX6 Dx・E810)をテストし、CX6 DxのETSパケットスケジューラの非work-conserving性、CX4 Lxのnoisy neighbor問題、CX5-E810間の相互運用性問題、複数のNICカウンタ不整合などの重大バグをベンダーに確認させた。 - 新規 entity 4 件: [[Zhuolong Yu (Johns Hopkins University)]](筆頭著者、Johns Hopkins University所属。既存の [[Zhuolong Yu]](University of Science and Technology of China、Hestia論文)とは別人として曖昧さ回避)・[[Bowen Su]]・[[Vladimir Braverman]] - 更新 entity 3 件: [[Wei Bai]](Azure Storage RDMA展開・RNICマイクロアーキテクチャ性能分離に続く3本目の関与としてLuminaを追記)・[[Xin Jin]](LLM推論サービング系譜とは別にRDMAネットワークスタック検証への関与を追記)・[[Shachar Raindel]](Husky論文に続く本論文への参画を追記) - 新規 concept 1 件: [[ハードウェアオフロードネットワークスタックのテスト]](カーネルバイパス型ネットワークスタックの正しさ・性能テスト。プログラマブルスイッチによるin-network決定論的イベント注入と全パケットミラーリングの設計を集約) - 更新 concept 2 件: [[RDMA]](Collie/Huskyの「性能異常発見」とLuminaの「仕様準拠性検証」という補完的な2方向のRNICテスト手法を追加)・[[RDMAネットワーク監視]](デプロイ後の「仕様準拠性検証」という第五の時間軸、LuminaのNoisy neighborとHawkeyeのPFC連鎖の類似・相違を追加) - Key insight: LuminaはCollie・Huskyと同じ「RNICはブラックボックス」という問題意識から出発しつつ、in-network決定論的イベント注入により「性能異常の発見」ではなく「仕様準拠性の検証」という補完的な軸を切り拓いた。先行研究(Shpiner et al.)がCX4 Lxのロッシー環境下goodputを高評価したのに対し、Luminaの精密な再送遅延計測は実際の再送遅延が約200µs(約100 base RTT分)に達することを明らかにし、マクロな指標(goodput)だけでは見逃されるマイクロビヘイビア上の欠陥があることを実証した。 - 図表: Figure 1〜11 の全11点を全点PyMuPDFキャプション座標クロップで取得(全図がベクター描画のため埋め込みラスター画像なし。images.jsonの埋め込み画像4点はいずれも本文と無関係な装飾アイコンのため除外)。Table 1・2 をMarkdown表として転記。 - 備考: Microsoft Research公開ページから論文本体(PDF直リンク)を特定し取得。全14ページ本文を通読。Zhuolong Yuという著者名が既存entity(University of Science and Technology of China、Hestia論文)と所属・共著者ネットワーク・研究分野で一致しないため、同名異人として新規ページ`Zhuolong Yu (Johns Hopkins University).md`を作成し、両ページに相互の注記を追加。DragonScale address c-004050(source)、c-004051〜c-004054(entity 4件)、c-004055(concept)を採番。 ## 2026-08-19 | TIMELY: RTT-based Congestion Control for the Datacenter(Mittal+, SIGCOMM 2015) - Source: [[@2015__SIGCOMM__TIMELY - RTT-based Congestion Control for the Datacenter]] — Google の [[Radhika Mittal]]([[University of California, Berkeley]] 在籍時)・[[Vinh The Lam]]・[[Nandita Dukkipati]]・[[Emily Blem]]・[[Hassan Wassel]]・[[Manya Ghobadi]](現 Microsoft)・[[Amin Vahdat]]・[[Yaogong Wang]]・[[David Wetherall]]・[[David Zats]] による、ECN 等のスイッチフィードバックを一切使わず、NIC ハードウェアタイムスタンプによる精密な RTT 測定のみで輻輳を検知する初のデータセンター向け遅延ベース輻輳制御プロトコル TIMELY の提案論文。RTT の絶対値ではなく勾配(gradient)を用いて輻輳の立ち上がり・立ち下がりを予測することで、標準的な目標キュー長維持方式の理論的限界(制御ループより短い時間スケールのキューは制御できない)を回避しながら低レイテンシと高スループットを両立する。T_low/T_high の2閾値とHAI(Hyperactive Increase)を補助機構として持つ。RDMA(OS-bypass メッセージング)実装の数百台規模 Clos トポロジ評価で、PFC のみのファブリック比で99パーセンタイル尾部レイテンシを9倍、最適化済みカーネルDCTCP比で13倍改善し、本番ストレージアプリケーションのレイテンシ中央値を8.9秒→5.1秒に改善した。 - 新規 entity 10 件: [[Radhika Mittal]](筆頭著者)・[[Vinh The Lam]]・[[Nandita Dukkipati]]・[[Emily Blem]]・[[Hassan Wassel]]・[[Manya Ghobadi]]・[[Yaogong Wang]]・[[David Wetherall]]・[[David Zats]](いずれも共著者)・[[University of California, Berkeley]](Radhika Mittal の在籍先) - 更新 entity 3 件: [[Amin Vahdat]](データセンタートポロジ研究に続く輻輳制御領域での参画を追記)・[[Google]](TIMELY の発表主体として関連リンクを追記)・[[Microsoft]](Monia Ghobadi の現所属として追記) - 更新 concept 2 件: [[データセンター輻輳制御]](TIMELY セクションを拡充し、DCQCN/DCTCP との対比・遅延ベース輻輳制御の再評価という横断的知見3件、TIMELY自身が残す将来課題を未解決の問いとして追加)・[[TCP輻輳制御アルゴリズム]](Vegas/FAST/Compound という遅延ベース系譜がデータセンターでNIC進化により再評価されたという横断的知見を追加) - Key insight: DCTCP の著者が「データセンターの微小なキューイング遅延の正確な測定は困難な課題」と明言していたのに対し、TIMELY は同じ SIGCOMM 2015 で NIC ハードウェアタイムスタンプの進化を背景にこの通説を覆した。DCQCN(ECN信号・NIC+スイッチ実装)と TIMELY(RTT信号・ホスト完結)は同じ号で発表されながら輻輳シグナルの選択が対照的であり、[[データセンター輻輳制御]] concept に「スイッチ変更不要」という展開容易性の軸を新たに加えた。 - 図表: Figure 1〜23(Table 1 含め計24点相当)を全点埋め込み。うち7点(Figure 4・6・7・8・13上下・23)は pdf.js の埋め込みラスター画像抽出で取得、残り17点はベクター描画のため PyMuPDF キャプション座標クロップで取得。Table 1 は Markdown 表に転記。 - 備考: ローカルPDF(`~/Downloads/TIMELY - RTT-based Congestion Control for the Datacenter.pdf`)から取り込み。DOI(10.1145/2785956.2787510)から書誌情報を確認。DragonScale address c-004057(source)、c-004058〜c-004067(entity 10件)を採番。 ## 2026-08-19 | HPCC: High Precision Congestion Control(Li+, SIGCOMM 2019) - Source: [[@2019__SIGCOMM__HPCC - High Precision Congestion Control]] — [[Alibaba Group]]・[[Harvard University]]・[[University of Cambridge]]・[[MIT]] の [[Yuliang Li]]・[[Rui Miao]]・[[Hongqiang Harry Liu]]・[[Yan Zhuang]]・[[Fei Feng]]・[[Lingbo Tang]]・[[Zheng Cao]]・[[Ming Zhang]]・[[Frank Kelly]]・[[Mohammad Alizadeh]]・[[Minlan Yu]] による、in-network telemetry(INT)を用いた高精度輻輳制御 HPCC の提案論文。ECN の1ビットや RTT という粗粒度シグナルに頼る DCQCN・TIMELY と異なり、経路上の各スイッチが ACK にキュー長・送信バイトレート・帯域容量を直接埋め込み、送信者がリンクごとの inflight bytes を精密に計算・制御することで、ほとんどの場合1回のレート更新で適正な送信レートに収束する。32台テストベッドで DCQCN 比 99パーセンタイル FCT スローダウンを最大95%削減、320台シミュレーションの incast で DCQCN・TIMELY が発生させる PFC ポーズをゼロに抑制する。チューニングパラメータは η・maxStage・W_AI の3個のみ。 - 新規 entity 8 件: [[Yuliang Li]](筆頭著者、Alibaba Group / Harvard University)・[[Hongqiang Harry Liu]]・[[Yan Zhuang]]・[[Lingbo Tang]]・[[Zheng Cao]]・[[Ming Zhang]](いずれも Alibaba Group 所属の共著者)・[[Frank Kelly]](University of Cambridge、輻輳制御の理論分析の著名研究者)・[[MIT]](Mohammad Alizadeh の所属先) - 更新 entity 7 件: [[Rui Miao]]・[[Fei Feng]](いずれも Alibaba Group 在籍時の HPCC 参画を追記)・[[Mohammad Alizadeh]](DCTCP に続く輻輳制御研究の系譜として HPCC を追記)・[[Minlan Yu]](Minder・Mycroft に先行する HPCC への参画を追記)・[[Alibaba Group]]・[[Harvard University]]・[[University of Cambridge]](いずれも HPCC への関与を追記) - 更新 concept 3 件: [[データセンター輻輳制御]](HPCC を主要プロトコルの1つとして新設。DCQCN・TIMELY・HPCC を輻輳シグナルの情報量という軸で比較する横断的知見3件を追加)・[[インバンドネットワークテレメトリ]](INT の最初期の主要用途が輻輳制御(HPCC)であったことを追記し、INTFusion(監視・診断用途)との用途変遷を横断的知見として追加)・[[RoCE設計課題]](lossless 前提の HPCC と lossy 前提の Ultra Ethernet の対比を未解決の問いに追記) - Key insight: DCQCN(ECN、2015)・TIMELY(RTT勾配、2015)・HPCC(INT直接測定、2019、いずれもSIGCOMM)は、輻輳シグナルの情報量を段階的に増やす方向で進化してきた。HPCC は INT を「輻輳制御ループへ直接組み込む」形で実用化した最初期の例であり、7年後の INTFusion(2026)が同じ INT 情報を「監視・診断」目的に転用しているのと対照的に、「制御」と「観測」という異なる用途に INT が展開されてきたことが分かる。 - 図表: Figure 1〜14を全点埋め込み(表なし)。埋め込みラスター画像は0点で、全図 PyMuPDF キャプション座標クロップで取得(すべてベクター描画の折れ線グラフ・ブロック図のため)。 - 備考: ローカルPDF(`~/Downloads/HPCC - high precision congestion control .pdf`)から取り込み。DOI(10.1145/3341302.3342085)から書誌情報を確認。Appendix A で理論的収束性・公平性の証明を含む全13ページ本文+付録+参考文献を通読。DragonScale address c-004068(source)、c-004069〜c-004076(entity 8件)を採番。 ## 2026-08-19 | Revisiting Network Support for RDMA(Mittal+, SIGCOMM 2018) - Source: [[@2018__SIGCOMM__Revisiting Network Support for RDMA]] — [[University of California, Berkeley]]/ICSI・[[Mellanox]] Technologies・NYU・University of Washington の [[Radhika Mittal]]・[[Alexander Shpiner]]・[[Aurojit Panda]]・[[Eitan Zahavi]]・[[Arvind Krishnamurthy]]・[[Sylvia Ratnasamy]]・[[Scott Shenker]] による、PFC(Priority Flow Control)が RoCE の高性能に本質的に必要ではなく現行 NIC 設計のアーティファクトにすぎないことを示す論文。RoCE NIC に SACK ベースの効率的ロス回復と BDP-FC(帯域幅遅延積ベースのエンドツーエンドフロー制御)という2つの小変更を加えた改良版 NIC 設計 IRN(Improved RoCE NIC)を提案し、シミュレーションにより IRN(PFC なし)が RoCE(PFC あり)を典型的なネットワークシナリオで6〜83%上回ることを示す。iWARP との実機比較(RoCE の3倍のレイテンシ・4分の1のスループット)・FPGA 高位合成によるハードウェアオーバーヘッド評価(NIC リソースの3〜10%)を含む。 - 新規 entity 3 件: [[Alexander Shpiner]](Mellanox 所属、Resilient RoCE の著者でもある)・[[Eitan Zahavi]](Mellanox 所属、Resilient RoCE の著者でもある)・[[Sylvia Ratnasamy]](UC Berkeley 教授) - 更新 entity 5 件: [[Radhika Mittal]](TIMELY に続く IRN の筆頭著者としての参画を追記)・[[Scott Shenker]]・[[Arvind Krishnamurthy]]・[[Aurojit Panda]](いずれも IRN の共著者として追記)・[[Mellanox]](Alexander Shpiner・Eitan Zahavi が Mellanox 所属として参加した貢献を追記) - 更新 concept 3 件: [[RDMA]](PFC が RoCE の性能に必須ではなく現行 NIC 設計のアーティファクトにすぎないことを2018年時点で実証していた点、iWARP の設計思想は正しかったが実装選択が敗因だったという定量的裏付けを追加)・[[データセンター輻輳制御]](「PFC 無効化で性能が壊滅する」のは go-back-N という NIC 側の実装に起因するのであって輻輳制御アルゴリズム自体の宿命ではないという知見を追加)・[[RoCE設計課題]](Hoefler+ 2023 が体系化する8項目のうち問題1・2・3が2018年時点でNICのみの変更で解消可能だと既に実証されていたという知見、技術的実証から業界の課題体系化まで5年の遅延があったことを追加) - Key insight: PFC への依存は「輻輳制御アルゴリズムの宿命」ではなく「現行 RoCE NIC の go-back-N ロス回復という実装上の弱点」に起因することを、2018年という早い段階で厳密に実証した論文。同じ「PFC を切る」操作が RoCE(go-back-N)では性能を1.5〜3倍悪化させる一方、IRN(SACK)ではむしろ性能を向上させるという対照実験が、PFC 依存の真因を NIC 設計に特定する。Hoefler+ 2023([[RoCE設計課題]])が体系化する8つの設計課題のうち3つ(PFC ヘッドルーム・輻輳ツリー・go-back-N)は、本論文により5年前に既にNICレベルの変更のみで解決可能と実証されていたが、RoCE の主流実装への反映は本論文執筆時点でも(そしておそらく2023年時点でも)進んでいなかった。 - 図表: Figure 1〜12を全点埋め込み(表なし該当、Table 1・2はMarkdown表に転記)。埋め込みラスター画像は0点で、全図 PyMuPDF キャプション座標クロップで取得(すべてベクター描画の棒グラフ・折れ線グラフのため)。 - 備考: ローカルPDF(`~/Downloads/Revisiting network support for RDMA.pdf`)から取り込み。DOI(10.1145/3230543.3230557)から書誌情報を確認。全14ページ本文+参考文献を通読。DragonScale address c-004077(source)、c-004079〜c-004081(entity 3件)を採番。 [[@2023__SpeakerDeck__RDMAネットワークアーキテクチャ基礎 - IB/RoCE 編 -]]([[Masayuki Kobayashi]](markunet)、[[Yahoo Japan Corporation]] 社内勉強会資料、SpeakerDeck、2023-06-02公開)は、確認できる同著者最古の公開資料であり、DMA/RDMAの基本概念からInfiniBand Architecture(サブネット・Subnet Manager・HCA・LID/GID・パケットヘッダ・トランスポートサービス4分類・QP/WQEメモリモデル)、RoCEv1/v2の構造差、DCB(ETS+PFC+CN)によるロスレスイーサネット実現、PFCのHead-of-Line Blocking、DCQCNによる輻輳制御、Lossless/Semi-lossless/Lossy-1/Lossy-2という運用構成スペクトラムまでを体系的に解説する全57ページの基礎資料。10日後(2023-06-12)公開の [[@2023__SpeakerDeck__クラウドデータセンターネットワークのいまとこれから]] と合わせ、基礎→応用の連続シリーズを構成する。新設 concept [[InfiniBand]] の初出ソース。既存 concept [[RDMA]]・[[RoCE設計課題]] に横断的知見を追記し、[[Masayuki Kobayashi]] entity の「最も古い公開資料」記述を訂正した。 - Sources (new): [[@2023__SpeakerDeck__RDMAネットワークアーキテクチャ基礎 - IB/RoCE 編 -]] ## 2026-08-20 | AIのための Ethernet技術動向 (SerDes) — 400 Gb/s/レーンに向けた物理層の課題と考察(Masayuki Kobayashi, SpeakerDeck 2026-08-17) - Source: [[@2026__SpeakerDeck__AIのためのEthernet技術動向 (SerDes)]] — さくらインターネットの [[Masayuki Kobayashi]] が Interconnect Architecture SIG 名義で公開した、400 Gb/s/レーン(448G / IEEE P802.3dv)の標準化状況を IEEE 802.3・OIF・UEC・OCP・SNIA/SFF の一次公開文書と OFC 2026 の発表突き合わせで整理した資料(全77ページ)。変調方式(PAM4/PAM6/PAM8)・inner FEC・前面パネルのフォームファクタ・CPOとプラガブルの線引き・レイテンシの優先順位という5つの未決論点を軸に、2026年8月時点で「決まったのは枠組みであり技術選択ではない」と結論する。 - 新規 entity 6 件: [[IEEE 802.3]]・[[OIF]]・[[UALink Consortium]]・[[SNIA/SFF]]・[[Arista Networks]]・[[Ethernet Alliance]] - 新規 concept 3 件: [[400Gbpsレーン (SerDes)|400 Gb/s/レーン (SerDes)]]・[[Co-Packaged Copper (CPC)]]・[[ビーチフロント制約]] - 更新 entity 4 件: [[Masayuki Kobayashi]]・[[NVIDIA]]・[[Broadcom]]・[[Open Compute Project]] - 更新 concept 2 件: [[光トランシーバー電力方式]](TROを含むpJ/bit定量比較、LRO展開名の資料間食い違いをcontradiction calloutで追記)・[[Ultra Ethernet]](LLRバッファ量とPHY固有遅延・クラスタ物理サイズの定量的関係を追記) - Key insight: 448G(400 Gb/s/レーン)は到達距離・BERというObjectiveこそ2026年7月にP802.3dvとして固まったが、電気側変調(PAM4/PAM6/PAM8)とinner FECは依然TBDであり、標準化団体(IEEE 802.3/OIF/UEC/OCP/SNIA/SFF)とMSA群(OCI/Open CPX/XPO)が「何を満たすか」と「どんな部品で実現するか」を分業する構造の中で、2026年9月以降発足予定のタスクフォースにその判断が委ねられている。 - 図表: 5点(3層ネットワーク技術要求・PAM4/6/8チャネル帯域トレードオフ・ラック配線本数の帯域上限・電力とリーチのトレードオフ・2026年標準化タイムライン)を埋め込み。 - 備考: PDF原本 `.raw/slides/markunet-ai-ethernet-serdes-trends/markunet-ai-ethernet-serdes-trends.pdf`(md5: 1485e9d72658a296ea13aaf33c0e9ba1)。全77ページの画像を通読、うち重要図表・出典行は個別再読で裏取り。DragonScale address c-004086(source)、c-004087〜c-004092(entity 6件)、c-004093〜c-004095(concept 3件)を採番。 ## 2026-08-20 | RDMATracer: A scalable eBPF-based framework for tracing RDMA syscalls(Prankur Gupta ほか、Meta / Carnegie Mellon University、NAIC '26) - Source: [[@2026__NAIC__RDMATracer - A scalable eBPF-based framework for tracing RDMA syscalls]] — [[Meta]]・[[Carnegie Mellon University]] による、AI訓練ジョブ失敗の5〜20%を占めるNICドライバのカーネルバグを診断するeBPFベースのフレームワークRDMATracerの提案論文(ACM SIGCOMM Workshop on Networks for AI Computing、2026年8月17〜21日)。4つの操作者由来ヒューリスティックで約2,000個のRDMA関数を13個のkernel hookへ絞り込み、per-CPUカウンタ+リングバッファの二重BPFマップでバースト時のロスレス集計とgraceful degradationを両立する。 - 新規 entity 5 件: [[Prankur Gupta]]・[[Miao Xu]]・[[Maxim Samoylov]]・[[Rajiv Krishnamurthy]]・[[Theophilus A. Benson]] - 更新 entity 3 件: [[Prashanth Kannan]]・[[Meta]]・[[Carnegie Mellon University]] - 更新 concept 3 件: [[eBPF]](戻り値ゲート型の常時稼働キャプチャという新応用軸、稀少な相関バグの本番診断という第三の目的軸を追加)・[[RDMA]](RNICのブラックボックス性とは別のソフトウェアテレメトリ欠落という不可視性、verbs層の薄さと障害伝播無防備のトレードオフを追加)・[[RDMAネットワーク監視]](カーネルverbs/ドライバ層への戻り値ゲート型eBPF計装という第七の計装軸、対象が性能異常からNICドライバのカーネルバグへ移ることを追加) - Key insight: RDMATracerが扱う不可視性(syscall失敗試行の96%が他レイヤー信号を伴わない)は、既存RDMA監視系(Hawkeye・Pulse・Collie等)が扱うRNIC/ネットワークのハードウェア的不透明性とは異なり、`libibverbs`が薄いラッパーでリトライロジックを持たないという**ソフトウェアスタックの構造**に起因する。4つの操作者由来ヒューリスティックは名前空間ゲート+トークン正規表現へ機械的に符号化可能で、44関数の正解データ検証(recall=1.000, F1=0.765)により他ベンダーのRDMAドライバ名前空間へも移植できることを示した。 - 図表: Figure 1〜4を全点埋め込み(全て埋め込みラスター画像)、Table 1・2をMarkdown表として転記。 - 備考: ローカルPDF(ユーザー提供、`~/Downloads/RDMATracer_scalable_eBPF_framework_tracing.pdf`)から取り込み。DOI(10.1145/3789240.3828742)は論文自身の記載から確認。全6ページ本文+参考文献を通読。DragonScale address c-004100(source)、c-004101〜c-004105(entity 5件)を採番。 ## 2026-08-20 | Logarithm: A logging engine for AI training workflows and services(Meta Engineering Blog、2024-03-18) - Source: [[@2024__EngineeringAtMeta__Logarithm - A logging engine for AI training workflows and services]] — Meta 内部限定のホスト型サーバレス・マルチテナントログサービス Logarithm。100+GB/s リアルタイム索引化、毎秒数千クエリ。C++20 実装。AI 訓練デバッグ(rank ID メタデータ API・filter-by-call-site・rank 横並び比較)、TensorBoard 内部デプロイ(722 系列/45 万サンプル・ストリーミング API)、Manifold+ORC+Bloom フィルタの3層 tiering、Scribe/LogDevice 耐久キュー、Shard Manager ingestion elasticity。 - 新規 entity 6 件: [[Logarithm]]・[[Manifold]]・[[Scribe]]・[[LogDevice]]・[[glog]]・[[Apache ORC]] - 新規 concept 1 件: [[AI訓練ログデバッグ]] - 更新 entity 3 件: [[Meta]]・[[PyTorch]]・[[TensorBoard]] - 更新 concept 3 件: [[GPU観測性]]・[[LLM学習モニタリング]]・[[ログ解析]] - Key insight: Logarithm は Dynolog/Kineto 系の GPU/ハードウェア中心オブザーバビリティを代替せず、ログという低コスト高情報量チャネルでシステム層とモデル層テレメトリを同居させ、長時間訓練ジョブの再現なしデバッグを可能にする log-based の相補レイヤーである。 - 図表: 7点(データモデル・訓練デバッグ UI・TensorBoard ダッシュボード・システムアーキテクチャ・スケーラビリティ・SLO 2 枚)を全点埋め込み。 - 備考: Engineering at Meta ブログ URL から WebFetch 取得。DragonScale address c-004120(source)、c-004121〜c-004127(entity/concept 7件)を採番。 ## 2026-08-20 | NetEdit: An Orchestration Platform for eBPF Network Functions at Scale(Theophilus A. Benson ほか、CMU / Meta、SIGCOMM '24) - Source: [[@2024__SIGCOMM__NetEdit - An Orchestration Platform for eBPF Network Functions at Scale]] — ホストネットワーキング向け eBPF オーケストレーション基盤 NetEdit。BPFAdapter でフック点差を隠し、pinning/bpf-iter で高可用性、Twine 連動 PolicyEngine で tuningFeature を動的着脱する。本番 5 年以上・13 機能。無効化実験で再送 4.5 倍・ToR ダウンリンク輻輳破棄 363.7% 増。 - 新規 entity 7 件: [[NetEdit]]・[[Balasubramanian Madhavan]]・[[Kumar Saurabh Arora]]・[[Jie Meng]]・[[Martin Lau]]・[[Abhishek Dhamija]]・[[Neil Spring]] - 更新 entity 8 件: [[Theophilus A. Benson]]・[[Prankur Gupta]]・[[Prashanth Kannan]]・[[Rajiv Krishnamurthy]]・[[Srikanth Sundaresan]]・[[Ying Zhang]]・[[Meta]]・[[Carnegie Mellon University]] - 更新 concept 2 件: [[eBPF]]・[[データセンター輻輳制御]] - Key insight: OSS の eBPF マネージャはインターフェース切り離しは持つが BPF-to-BPF 切り離しとサービスライフサイクル連動を欠く。NetEdit はカーネル既定 GC/順序付けを上書きし、RDMATracer が使う社内オーケストレーション層の一次記述になる。 - 図表: Figure 1〜6 を全点埋め込み。Table 1〜7 を Markdown 転記(Table 3・6 は抜粋)。 - 備考: Stanford 公開の ACM paginated PDF。DOI 10.1145/3651890.3672227。DragonScale address c-004106(source)、c-004107〜c-004113(entity 7件)。 ## 2026-08-20 | Zoomer: Powering AI Performance at Meta’s Scale Through Intelligent Debugging and Optimization(Prashant Gupta、Meta Engineering Blog、2025-11-21) - Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]] — [[Meta]] の訓練・推論ワークロードを横断する自動性能プロファイリング、デバッグ、分析、最適化プラットフォーム [[Zoomer]]。GPU メトリクス、Kineto/PyTorch Profiler、Dynolog、StrobeLight、集合通信、推論要求を三層アーキテクチャで統合し、ボトルネックから改善提案・再実行までを接続する。 - 新規 entity 5 件: [[Zoomer]]・[[NVIDIA Data Center GPU Manager]]・[[StrobeLight]]・[[Crochet]]・[[Holistic Trace Analysis]] - 更新 entity 8 件: [[Meta]]・[[Manifold]]・[[Kineto]]・[[Dynolog]]・[[LibAsicMon]]・[[Perfetto]]・[[PyTorch]]・[[NVIDIA]] - 更新 concept 9 件: [[GPU観測性]]・[[LLM学習モニタリング]]・[[LLM推論]]・[[GPUエネルギー効率]]・[[パフォーマンスエンジニアリング]]・[[ストラグラー]]・[[クリティカルパス分析]]・[[並列化戦略]]・[[GPU最適化]] - Key insight: Zoomer は Meta の GPU/CPU/ホスト観測性を性能デバッグ閉ループへ統合し、Meta は Ads 関連モデルで訓練時間 75% 短縮・電力消費 78% 削減、32k GPU ベンチマークで 30% 高速化などを報告する。公式ブログの自己報告であり、測定条件は限定的である。 - 図表: Zoomer 三層アーキテクチャ図 1 点を埋め込み。 - 備考: Engineering at Meta の公式ページを Defuddle で取得。DragonScale address c-004135(source)、c-004136〜c-004140(entity 5件)を採番。 ## 2026-08-22 | Resilience and Stability of Ecological Systems(C. S. Holling、Annual Review of Ecology and Systematics、1973) - Source: [[@1973__AnnRevEcolSyst__Resilience and Stability of Ecological Systems]] — [[University of British Columbia]] の [[C. S. Holling]] による生態学的安定性理論の総説。「レジリエンス」と「安定性」を独立した性質として定義し分離する。 - 新規 entity 1 件: [[C. S. Holling]] - 更新 entity 1 件: [[University of British Columbia]] - 新規 concept 1 件: [[レジリエンス]] - Key insight: 現実の生態系は単一の大域平衡ではなく複数の「アトラクターの領域」を持ち、境界を越えると系は不可逆に別の配置へ移行する。大きな変動(低い安定性)がむしろ高いレジリエンスの原因になりうる(スプルースバドワーム大発生周期が代表例)。平衡中心の管理(最大持続生産量)はレジリエンスを損ないうる。 - 図表: Figure 1〜4 を全点 PyMuPDF キャプション座標クロップで取得・埋め込み(埋め込みラスター画像は JSTOR ロゴ等の装飾のみで除外、表なし)。 - 備考: JSTOR 経由でデジタル化された 1973 年のスキャン論文。図はすべて JBig2(モノクロビットマップ)エンコードで pdf.js のデコードに失敗したため、PyMuPDF によるページレンダリング+キャプション座標クロップで取得した。DragonScale address c-004301(source)、c-004302(entity)、c-004304(concept)。 ## 2026-08-22 | Blameless PostMortems and a Just Culture(John Allspaw、Etsy Code as Craft、2012-05-22) - Source: [[@2012__EtsyCodeAsCraft__Blameless PostMortems and a Just Culture]] — [[John Allspaw]] が [[Etsy]] Code as Craft ブログに投稿した、「ブレームレスポストモーテム」という語の起源的一次資料。[[Sidney Dekker]] の Bad Apple Theory への対抗として [[Just Culture]] を実務に導入した。 - 新規 concept 1 件: [[Just Culture]] - 更新 entity 4 件: [[John Allspaw]]・[[Etsy]]・[[Sidney Dekker]]・[[Erik Hollnagel]] - 更新 concept 1 件: [[ポストモーテム]](2012 年記事を起点とした「ブレームレスポストモーテム」用語史を追記) - Key insight: 「非難・恥・処罰」の7段階自己強化サイクルと「第一の物語 / 第二の物語」(Woods & Cook, *Behind Human Error*)の対比を提示。同じ Etsy から 4〜6 年後に出た [[Will Gallego]] の講演(2016年・2018年)は、本記事の主張を「ローカル合理性」「ブレーム・アウェア」という理論用語で再定式化したものと位置づけられる。 - 備考: 直接 fetch は DataDome の 403 で失敗。Wayback Machine スナップショット(2026-04-27)経由で defuddle 抽出した。DragonScale address c-004310(source)、c-004311(concept)。 ## 2026-08-22 | ネットワークシステムについて語るときに我々の語ること(Larry Peterson・Bruce Davie 著、進藤資訓 訳、ラムダノート、2026-06-01) - Book: [[ネットワークシステムについて語るときに我々の語ること]] — 原書 *What We Talk About When We Talk About Systems: Essays on the Systems Approach*。Systems Approach シリーズ唯一のエッセイ集を章単位で ingest。 - 章 source 13 件: [[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Front Matter 本書に寄せて]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 1 イントロダクション]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 2 システムとネットワークのアーキテクチャ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 3 オープンソースソフトウェア]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 4 システム設計における判断]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 5 SDN:ソフトウェア定義ネットワーク]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 6 集権化と非集権化]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 7 TCPの考古学]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 8 セキュリティ:負の目標]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 9 5G:対照的なアーキテクチャ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 10 SmartNIC、IPU、DPU]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 11 ネットワーク管理は今やクールな仕事だ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 12 Looking Over The Fence (垣根をこえて)]] - 新規 entity 44 件: [[3GPP]]・[[AWS Nitro]]・[[ActivityPub]]・[[Aether]]・[[Bruce Davie]]・[[Computer Networks - A Systems Approach]]・[[David Ward]]・[[Donald Michie]]・[[Emily Bender]]・[[Fediverse]]・[[Guido Appenzeller]]・[[Homa]]・[[Intel IPU]]・[[John Kindervag]]・[[John McPhee]]・[[Kostadis Roussos]]・[[Larry Peterson]]・[[MENACE]]・[[Mastodon]]・[[Michael D. Schroeder]]・[[Multics]]・[[Nicira]]・[[Nick McKeown]]・[[Niklaus Wirth]]・[[O-RAN Alliance]]・[[Oguz Sunay]]・[[Open Networking Foundation]]・[[OpenFlow]]・[[P. H. Winston]]・[[P4]]・[[Private 5G - A Systems Approach]]・[[Project Monterey]]・[[Rodney Brooks]]・[[Stephen Wolfram]]・[[Steve Deering]]・[[Tracy Kidder]]・[[Twitter]]・[[VMware]]・[[Vint Cerf]]・[[YANG]]・[[ネットワークシステムについて語るときに我々の語ること]]・[[モリスワーム]]・[[ラムダノート]]・[[進藤資訓]] - 更新 entity 21 件: [[Amin Vahdat]]・[[Cisco]]・[[David D. Clark]]・[[David P. Reed]]・[[Edsger W. Dijkstra]]・[[Envoy]]・[[Facebook]]・[[Frank Kelly]]・[[Fred Brooks]]・[[Intel]]・[[Istio]]・[[Jerome H. Saltzer]]・[[John Ousterhout]]・[[Kubernetes]]・[[Linux Foundation]]・[[Martin Casado]]・[[PlanetLab]]・[[Scott Aaronson]]・[[Scott Shenker]]・[[Snowflake Computing]]・[[Van Jacobson]] - 新規 concept 20 件: [[5Gモバイルネットワーク]]・[[GitOps]]・[[QUIC]]・[[エレガンス(システム設計)]]・[[オープンソースソフトウェア開発]]・[[システムズアプローチ]]・[[ゼロトラスト]]・[[ソフトウェア定義ネットワーク]]・[[トランスポートプロトコル設計]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク仮想化]]・[[ネットワーク自動化]]・[[パスキー認証]]・[[ブロックチェーン]]・[[プログラマブルデータプレーン]]・[[反復可能性]]・[[砂時計モデル]]・[[量子計算]]・[[集権化と非集権化]] - 更新 concept 32 件: [[LLMのハルシネーション]]・[[LLM意味表象]]・[[LLM算術機構]]・[[TCP接続局所性]]・[[TCP輻輳制御アルゴリズム]]・[[インターネットスケールサービス設計]]・[[インバンドネットワークテレメトリ]]・[[エニキャストルーティング]]・[[エンドツーエンド論]]・[[オブザーバビリティ]]・[[オープンLLM開発]]・[[クラウドスケールRPC特性]]・[[サービスメッシュ]]・[[スマートNICオフロード]]・[[セキュリティカオスエンジニアリング]]・[[データセンター輻輳制御]]・[[トレードオフ意思決定]]・[[ドメイン固有アーキテクチャ]]・[[バッファブロートとキュー管理]]・[[ユーザーレベルTCPスタック]]・[[分散コンセンサス]]・[[分散コンピューティングの誤謬]]・[[性能を意識した設計]]・[[技術的負債]]・[[抽象化(ソフトウェア設計)]]・[[最終目標なき設計]]・[[脆弱性バジェット]]・[[複雑ネットワーク]]・[[設定ミス脆弱性]]・[[設計の一貫性]]・[[設計要件の確立]]・[[通常設計と急進的設計]] - Key insight: 「システムズアプローチ」(問題定義から教訓抽出までを反復する方法論)を軸に、砂時計モデル・SDN・輻輳制御・セキュリティ・5G・SmartNIC・ネットワーク管理という個別領域を横断して、「何を不動点として固定し、何を後から決められるようにするか」という同一の判断軸が繰り返し現れることを示す。個々のエッセイには著者らが当事者として関わった [[PlanetLab]]・[[Open Networking Foundation]]・[[Nicira]]・[[Aether]] の回顧が含まれ、SDN 黎明期の一次証言としての価値を持つ。 - 図表: 本文が参照する図 19 点を全点取得・埋め込み。和書キャプションはゴシック `HiraKakuPro-W3` 7.4pt、本文中の図参照は明朝 8.4pt という組版差でキャプションだけを機械的に判別し、PyMuPDF のキャプション座標クロップで一括切り出しした(未マッチ 0 件・未使用 attachment 0 件)。 - 備考: 入力は書籍全体 PDF(256 頁)。PDF アウトラインの level 1 がそのまま章一覧だったため `--chapters` で章境界を手動指定し、索引・著者略歴・奥付をダミー章で切り離した。訳者前書きは source 化せず book entity の書誌・成立事情に織り込み、「本書に寄せて」([[David Ward]])のみ Front Matter として 1 枚 source 化した。出典表記は印字ノンブル(PDF ページ − 10)に統一。全 13 章を Sonnet 5 subagent へ 1 章 1 体でローリング委譲した。 ## 2026-08-22 | Principles of Computer System Design: An Introduction, Part II(Jerome H. Saltzer・M. Frans Kaashoek 著、MIT OpenCourseWare、2009 / Version 5.0) - Book: [[Principles of Computer System Design]] — MIT 6.033 の40年以上の講義ノートから育った計算機システム設計の教科書。Part I(第1〜6章)は Morgan Kaufmann の印刷書籍、Part II(第7〜11章)は MIT OpenCourseWare の公開教育資源(CC BY-NC-SA 3.0 US)。本 ingest の対象は Part II。 - 章 source 5 件: [[@2009__MITOCW__Principles of Computer System Design - Chapter 7 The Network as a System and as a System Component]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 8 Fault Tolerance - Reliable Systems from Unreliable Components]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 9 Atomicity - All-or-Nothing and Before-or-After]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 10 Consistency]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 11 Information Security]] - 新規 entity 2 件: [[M. Frans Kaashoek]]・[[Principles of Computer System Design]] - 更新 entity 6 件: [[Butler W. Lampson]]・[[Jerome H. Saltzer]]・[[Jim Gray]]・[[Michael D. Schroeder]]・[[University of Wisconsin-Madison]]・[[Van Jacobson]] - 新規 concept 7 件: [[セキュリティ設計原則]]・[[バージョン履歴]]・[[信頼計算基盤(TCB)]]・[[情報フロー制御]]・[[永続性のマントラ]]・[[認可モデル]]・[[調停(Reconciliation)]] - 更新 concept 22 件: [[Capability-based Security]]・[[TCP輻輳制御アルゴリズム]]・[[エンドツーエンド論]]・[[クォーラムベースレプリケーション]]・[[クラッシュリカバリ]]・[[クロック同期と信頼性]]・[[システム信頼性モデル]]・[[ゼロトラスト]]・[[トランスポートプロトコル設計]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ハードディスク信頼性]]・[[パスキー認証]]・[[フォールトトレランス]]・[[メモリ階層とキャッシュ]]・[[ロストアップデートと書き込みスキュー]]・[[信頼性工学]]・[[分散トランザクション]]・[[外部一貫性]]・[[直列化可能性]]・[[結果整合性]]・[[複製ステートマシン]] - Key insight: 第7章のベストエフォート契約(パケットは失われ、重複し、順序が変わる)という不完全な土台の上に、第8章が冗長性で不完全さを覆う一般理論を、第9章が原子性という「全か無か」の保証を、第10章が複数複製への拡張を、第11章が敵対的な相手のいる環境への拡張を順に積む構造を持つ。設計原則に名前を与えて章をまたいで再参照する体裁が本書の方法であり、**End-to-end argument** は第7章 §7.2.5 で層モデルから導かれたのち第8章 §8.6.2 で耐障害性の文脈から再検討される。第9章 §9.1.6 の external time consistency は Spanner(2012)の外部一貫性と同一の概念を3年先行して「直列化可能性より強い正しさ要件の一般形」として述べたもので、本書が扱う要件のいくつかは後年の実装が追いついた形になっている。 - 図表: 本文が参照する図 111 点を全点取得・埋め込み(未マッチ 0 件・未使用 attachment 0 件)。図はすべてベクター描画で埋め込み画像が取れないため、キャプションラベル(`FIGURE N.M`、Verdana 大文字 9pt)と、ノイズ除去したベクター描画クラスタを矩形間距離で対応づける方式で一括切り出しした。キャプションが図の左に置かれる横並びレイアウトがあるため、上下だけでなく左右も含めた最近傍マッチにしてある。 - 備考: 入力は MIT OCW のサイトダンプ(`res.6-004-spring-2009`)。章別 PDF が既に分かれていたため `fetch-book.sh` の章分割は使わず、5本の章 PDF をそのまま `chapters/ch-NN.pdf` として配置した。出典表記は節番号を優先し、節番号が取れない箇所のみ章内独立の印字ノンブル(`8–13` 形式)を使う。設計原則一覧・用語集・文献ガイド・問題集は `.raw/.../aux/` に原本として置き、source 化はしていない(設計原則一覧の内容は book entity に織り込んだ)。全 5 章を Sonnet 5 subagent へ 1 章 1 体でローリング委譲した。 ## 2026-08-22 | Computer Networks: A Systems Approach, 6th Edition(Larry Peterson・Bruce Davie、2020 / CC BY 4.0) - Book: [[Computer Networks - A Systems Approach]] — 1996 年初版の定番ネットワーキング教科書。第 6 版は CC BY 4.0 でオープンソース化され https://book.systemsapproach.org/ に公開されている。全 9 章 + Preface を章単位で ingest。 - 章 source 10 件: [[@2020__SystemsApproach__Computer Networks - A Systems Approach - Preface]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 1 Foundation]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 2 Direct Links]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 3 Internetworking]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 4 Advanced Internetworking]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 5 End-to-End Protocols]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 6 Congestion Control]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 7 End-to-End Data]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 8 Network Security]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 9 Applications]] - 新規 entity 0 件(著者・出版社・主要製品はいずれも既存) - 更新 entity 6 件: [[Bruce Davie]]・[[Computer Networks - A Systems Approach]]・[[Netflix]]・[[OpenFlow]]・[[P4]]・[[YANG]] - 新規 concept 7 件: [[MPLS]]・[[オーバーレイネットワーク]]・[[コンテンツ配信ネットワーク]]・[[フレーミング]]・[[誤り検出符号]]・[[適応ビットレートストリーミング]]・[[階層的ルーティングとアドレス集約]] - 更新 concept 17 件: [[5Gモバイルネットワーク]]・[[QUIC]]・[[インバンドネットワークテレメトリ]]・[[エニキャストルーティング]]・[[クラウドコンピューティング]]・[[クラウドスケールRPC特性]]・[[システムズアプローチ]]・[[ソフトウェア定義ネットワーク]]・[[データセンター輻輳制御]]・[[ネットワーク仮想化]]・[[ネットワーク監視]]・[[ネットワーク自動化]]・[[バイナリエンコーディング]]・[[バッファブロートとキュー管理]]・[[一貫性ハッシュ法]]・[[待ち行列理論]]・[[砂時計モデル]] - Key insight: 本書の編成そのものが主張になっている。各章は解くべき問題の定義(`Problem:` 節)から始まり、層構造に沿って進みながら層構造を絶対視しない。その最も明快な例が輻輳制御で、著者らはこれをトランスポート層に押し込めず独立した第 6 章として扱い、Preface でその判断を「システムズアプローチ」の実践そのものとして説明している。第 6 版はここに 2 つの装置を加えた。各章末の Perspective 節が第 1 章の `Feature Velocity` から第 9 章の `The Cloud is the New Internet` までクラウド化(Cloudification)という 1 本の線を通し、本文中の Key Takeaway(全 9 章で 28 件)が周囲の記述から設計則を 1 つずつ蒸留する。くびれの位置が IP から HTTP へ移りつつあるという第 5 章 Perspective の主張は、[[砂時計モデル]] にとってこの vault で最も重要な積み増しになった。 - 図表: 本文が参照する図 245 点を全点取得・埋め込み(未マッチ 0 件・未使用 attachment 0 件)。Sphinx が生成する web 版のため図は `_images/` に PNG として直接置かれており、キャプション座標クロップもフォント判別も不要だった。 - 備考: 入力形態は章別ウェブページ(75 ページ)。**当初 defuddle で clean markdown 化したところ、Sphinx の一部 `<section>` を丸ごと落としていた**(第 3 章で見出し 3・Key Takeaway 2・図 6 点、第 6 章で見出し 6・図 1 点、第 7 章で見出し 5・図 3 点)。BeautifulSoup で articleBody の DOM を明示的に走査する抽出器を書き直し、HTML の見出し数・Key Takeaway 数・図参照数が全 10 章で1:1 一致することを確認してから確定させた(図は 238 → 245 点に増えた)。defuddle は図の相互参照(「Figure 152 illustrates ...」)も落としており、旧版では図番号が抜けた文が残っていた。前付は Preface のみ source 化し、Foreword 2 本は book entity の書誌・位置づけに織り込んだ(出典は書誌自身を指す)。 ## 2026-08-22 | The Real Internet Architecture: Past, Present, and Future Evolution(Pamela Zave・Jennifer Rexford、Princeton University Press、2024) - Book: [[The Real Internet Architecture]] — 古典的な 4 層モデルでは現実のインターネットを記述できないという問題意識から、ネットワークとサービスを一様な語彙で記述するモデルと、ブリッジング・レイヤリング・サブダクションという 3 つの合成演算子を導入して、インターネットを「多数のネットワークが合成された生態系」として書き直す教科書。全 6 章を章単位で ingest。 - 章 source 6 件: [[@2024__PrincetonUP__The Real Internet Architecture - Chapter 1 Introduction]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 2 Describing Networks and Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 3 Composing Networks and Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 4 The Real Internet Architecture]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 5 Patterns for Enhanced Network Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 6 Ideas for a Better Internet]] - 新規 entity 5 件: [[John Day]]・[[Pamela Zave]]・[[Resilient Overlay Networks]]・[[The Real Internet Architecture]]・[[Tor]] - 更新 entity 3 件: [[David D. Clark]]・[[Jennifer Rexford]]・[[P4]] - 新規 concept 7 件: [[サブダクション]]・[[セッションアーキテクチャ]]・[[ネットワークの一様記述モデル]]・[[ブリッジング]]・[[モジュラー検証]]・[[レイヤリング]]・[[硬直化(ossification)]] - 更新 concept 15 件: [[5Gモバイルネットワーク]]・[[MPLS]]・[[QUIC]]・[[エニキャストルーティング]]・[[エンドツーエンド論]]・[[オーバーレイネットワーク]]・[[セキュリティ設計原則]]・[[ネットワークアーキテクチャ]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク仮想化]]・[[プロキシとエージェント]]・[[命名]]・[[形式手法]]・[[軽量形式手法]]・[[階層的ルーティングとアドレス集約]] - Key insight: 本書の主張の核は「合成演算子は 3 つしかない」という**閉じた主張**にある。ブリッジング(対等なネットワークの接合)とレイヤリング(オーバーレイのリンクをアンダーレイのセッションで実装する)に、共有リンクを介してレイヤリングの不連続を埋めるサブダクションを加えた 3 つで、AS 間接続・BGP・NAT・VPN・VLAN・階層化 MPLS・Tor・RON・クラウド・モビリティ・マルチキャスト・ファイアウォール通過までが説明できるという構成を、本書は 6 章かけて実演する。この閉じた語彙が硬直化(ossification)論への反論を可能にしている — 狭いくびれ(narrow waist)が変わらないことは進化の不在を意味せず、進化はレイヤリングとサブダクションの側で起きてきた、というのが 2013 年の AT&T バックボーンで観測された 11 ヘッダーのパケット(図1.4)が示す物証である。この論点は [[砂時計モデル]] が同じくびれを「進化を可能にした美点」として肯定的に描くのと**観察の焦点が正反対**であり、[[硬直化(ossification)]] にその対比を記録した。 - 図表: 本文が参照する図 92 点を全点切り出し・埋め込み(未マッチ 0 件・未使用 attachment 0 件)。表 Table 2.1〜6.2 は画像化されていないため本文テキストから markdown 表として書き起こした。 - 備考: 入力は書籍全体 PDF(340 ページ)。PDF アウトラインの level 1 に 6 章がそのまま並んでいたが、既定の章検出は level 2 の節見出しまで拾って 45 章に化けた(`--chapters` で再分割)。図は埋め込みラスタ画像として PDF に含まれており、キャプション `FIGURE N.M.`(小型大文字ブロック)と直上の未使用画像矩形を対応づける 1 パスで 92 点すべてが切り出せた(スキャン PDF ではないため `get_image_rects()` が使えた)。序文と用語集は source 化せず、序文由来の記述(著者の経歴・本書の成立事情)は book entity と著者 entity に書誌自身を出典として織り込んだ。 ## 2026-08-23 | LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures(Zhang, Feng, Pei+, arXiv 2026-08) - Source: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]] — [[Changhua Pei]]・[[Dan Pei]] ら CNIC/CAS・清華大学チームによる、長期水平 LLM エージェント失敗の責任役割帰属・根本原因ステップ局所化ベンチマーク。SWE-bench Pro・Terminal Bench 2・TravelPlanner・VitaBench・WebArena Verified から集めた 1,140 件の非注入失敗軌跡(平均 156.3 ステップ・root-to-end distance 中央値 48・最大 605)に責任役割・根本原因ステップの人手ラベルを付与(22 名の CS 修士・博士課程学生、完全一致率は役割 65.9%・根本原因ステップ 39.5%)。訓練不要の診断手法 RCTA(セグメント要約による広域検索 → ハンドオフ指示への遡及照合の 2 段階)を提案し、同一バックボーン(DeepSeek-V4-Flash)・同一 1,140 軌跡で responsible-role accuracy 51.1%・root-cause exact accuracy 24.1% を達成(最強ベースライン ECHO 比 +23.6pt/+10.9pt)。 - 新規 entity 7 件: [[Yunfei Zhang]]・[[Boyu Feng]]・[[Institute of Computing Technology, Chinese Academy of Sciences]]・[[SWE-bench Pro]]・[[TravelPlanner]]・[[VitaBench]]・[[WebArena Verified]] - 更新 entity 10 件: [[Changhua Pei]]・[[Dan Pei]]・[[Gaogang Xie]]・[[Jingjing Li]]・[[Zexin Wang]]・[[Difeng Ma]]・[[Chongqing University]]・[[Tongyi Lab]]・[[Terminal-Bench]]・[[DeepSeek-V4]] - 新規 concept 1 件: [[エージェント障害帰属]] - 更新 concept 1 件: [[エージェント修復]] - Key insight: 責任役割の特定(51.1%)と根本原因ステップの厳密局所化(24.1%)は精度が大きく乖離する 2 つの異なる診断能力であり、単一指標での評価は片方の弱点を覆い隠す。この非対称性は、[[エージェント修復]] が報告する diagnosis–recovery gap(診断精度の改善が回復率の改善を上回る)と合わせて読むと、「誰が・どこで・なぜ間違えたか」自体が既に複数の異なる難易度を持つ下位問題に分解できることを示唆する。 - 図表: 本文が参照する図 6 点を全点取得・埋め込み(未マッチ 0 件)。図はすべてベクター描画のため pdf.js の埋め込み画像抽出では取得できず、PyMuPDF のキャプション座標クロップで一括切り出しした。 ## 2026-08-23 | ChainCraft: Bridging Causal Discovery and LLM Reasoning for Failure Prediction in Microservices(Zhao, Sun+, ISSRE 2026) - Source: [[@2026__ISSRE__ChainCraft - Bridging Causal Discovery and LLM Reasoning for Failure Prediction in Microservices]] — [[Yongxin Zhao]]・[[Yongqian Sun]](責任著者)ら Nankai University・Alibaba Group・Tsinghua University による、メトリクス駆動の因果発見(PCMCI)と LLM 推論を橋渡しする障害予測フレームワーク。異常メトリクスから構築した因果グラフを制約として LLM(Chain Builder)に異常伝播チェーンを生成させ、Structural/Temporal Checker・Chain Critic・Chain Refiner による閉ループ洗練で一貫性・完全性を高め、ハイブリッドなテキスト構造検索(症状類似度+グラフ構造的チェーン類似度)で関連する過去故障事例を検索する。Alibaba 実運用データ(100件アラート)で F1=0.875(最良ベースライン CoT/ReAct 比 +22%)を達成し、アブレーションで PCMCI 除去(C1)が最大の性能低下をもたらすことを実証。3か月間の Alibaba 本番デプロイで OCE が予測精度80.8%(26件中21件)を確認し、予防的緩和を約30分から約5分に短縮した。 - 新規 entity 1 件: [[Boxuan Zhao]] - 更新 entity 12 件: [[Yongxin Zhao]]・[[Yongqian Sun]]・[[Jingyu Wang]]・[[Junhua Kuang]]・[[Shenglin Zhang]]・[[Wenwei Gu]]・[[Li Shi]]・[[Wei Li]]・[[Liping Zhang]]・[[Dan Pei]]・[[Nankai University]]・[[Alibaba Group]]・[[Tsinghua University]] - 更新 concept 3 件: [[障害予測]]・[[因果発見]]・[[LLMによる根本原因分析]] - Key insight: PCMCI 因果グラフを LLM 推論の生成的制約として使う設計は、[[障害予測]](pre-hoc)と [[LLMによる根本原因分析]](post-hoc)という異なる時間軸のタスクに、同型の「閉ループ検証」「構造認識型検索」パターンを橋渡しする。アブレーションで因果発見の除去が最大の性能低下をもたらした事実は、[[因果発見]]の出力が単なる特徴量選択やスコアリングを超え、LLM の生成タスクそのものを制約する足場として機能しうることを定量的に裏づける。 - 図表: 本文が参照する図 4 点(Fig.1 問題設定・Fig.2 フレームワーク全体像・Fig.3 デプロイアーキテクチャ・Fig.4 ケーススタディ)を全点 PyMuPDF キャプション座標クロップで取得・埋め込み(未マッチ 0 件)。図はすべてベクター描画+アイコン合成のため pdf.js の埋め込み画像抽出(34点、いずれも図中の装飾アイコン)は使用せず。表 Table I は markdown 表として本文に転記した。 ## 2026-08-23 | Over the Memory Wall, Into the Instruction Wall: The New Bottleneck in GPU Data Processing(Hepkema, Wu, Kozyrakis, Chronis, Alonso、arXiv 2026-08) - Source: [[@2026__arXiv__Over the Memory Wall, Into the Instruction Wall - The New Bottleneck in GPU Data Processing]] — [[Sven Hepkema]]・[[Bowen Wu]]・[[Christos Kozyrakis]]・[[Yannis Chronis]]・[[Gustavo Alonso]]([[ETH Zürich]] Systems Group / [[NVIDIA]] & [[Stanford University]])による、GPUデータベースライブラリ[[cuDF]]がTPC-H実行時にメモリバウンドから演算(命令スループット)バウンドへ移行する現象を実証した論文。複数プロファイラ(Nsight Systems・Nsight Compute・[[Maximus]])を統合するツール[[Valk]]を新たに開発し、価格・帯域幅特性が対照的なL4とGH200上でTPC-Hを実行した。GH200はL4の13.4倍のメモリ帯域幅と2.5倍の命令スループットを持つが、TPC-H実行では5.2倍しか高速化しない。 - 新規 entity 7 件: [[Sven Hepkema]]・[[Bowen Wu]]・[[Yannis Chronis]]・[[Gustavo Alonso]]・[[cuDF]]・[[Valk]]・[[Maximus]] - 更新 entity 4 件: [[Christos Kozyrakis]]・[[ETH Zürich]]・[[NVIDIA GH200]]・[[NVIDIA Nsight Systems]] - 更新 concept 5 件: [[Rooflineモデル]]・[[GPU占有率(Occupancy)]]・[[Instruction-Level Parallelism (GPU)]]・[[GPU観測性]]・[[メモリウォール]] - Key insight: [[Rooflineモデル|Roofline]]の ridge line はソフトウェア側の演算強度引き上げ(低精度化・フュージョン)だけでなく、ハードウェア世代交代(GPUのメモリ帯域幅がCUDAコアの命令スループットより急増するトレンド)によっても大きくシフトしうる。同一のカーネル実装のままGPUを変えるだけで、[[cuDF]]カーネルの実行時間の分類はメモリバウンド74.1%→22.5%、演算バウンド25.9%→77.5%へと逆転する。さらに占有率・ILPを理想的に引き上げてもGH200上ではカーネル時間の53%が命令スループットバウンドのまま残り、[[メモリウォール]]が「解消できない壁」から「別の壁(命令の壁)へ置き換わる壁」であることを実測で示した。 - 図表: 本文が参照する図9点(Figure 1〜9)を全点埋め込み(未マッチ 0 件)。Figure 3(Valk UI)は pdf.js の埋め込みラスタ画像として取得、それ以外の8点はすべてベクター描画のため PyMuPDF のキャプション座標クロップで一括切り出しした。表9点(Table 1〜9)は markdown 表として本文に転記した。 ## 2026-08-23 | Software-Defined Networks: A Systems Approach(Larry Peterson・Carmelo Cascone・Brian O'Connor・Thomas Vachuska・Bruce Davie、Systems Approach、2021) - Book: [[Software-Defined Networks - A Systems Approach]] — SDN を個別技術(OpenFlow 等)ではなく「コモディティハードウェア上で動くスケーラブルな分散システム」として捉え直し、プロトコルスタックに代えて **SDN のソフトウェアスタックに沿って章を並べる**教科書。Foreword([[Nick McKeown]])・Preface + 全 10 章を章単位で ingest(巻末の演習・書誌節は対象外)。 - 章 source 12 件: [[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 1 Introduction]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 10 Future of SDN]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 2 Use Cases]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 3 Basic Architecture]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 4 Bare-Metal Switches]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 5 Switch OS]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 6 Network OS]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 7 Leaf-Spine Fabric]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 8 Network Virtualization]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 9 Access Networks]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Foreword]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Preface]] - 新規 entity 17 件: [[Atomix]]・[[Brian O'Connor]]・[[Carmelo Cascone]]・[[GENEVE]]・[[OF-DPA]]・[[ONOS]]・[[OVN]]・[[Open Compute Project]]・[[Open Network Linux (ONL)]]・[[Open vSwitch (OVS)]]・[[P4Runtime]]・[[SAI (Switch Abstraction Interface)]]・[[SD-Fabric]]・[[Software-Defined Networks - A Systems Approach]]・[[Stratum]]・[[Thomas Vachuska]]・[[gNMI]] - 更新 entity 16 件: [[Aether]]・[[Broadcom]]・[[Bruce Davie]]・[[Google]]・[[Intel Tofino]]・[[Larry Peterson]]・[[Nicira]]・[[Nick McKeown]]・[[O-RAN Alliance]]・[[Open Networking Foundation]]・[[OpenFlow]]・[[P4]]・[[SONiC]]・[[Scott Shenker]]・[[VMware]]・[[YANG]] - 新規 concept 2 件: [[ソフトウェア定義アクセスネットワーク]]・[[ネットワークオペレーティングシステム]] - 更新 concept 19 件: [[5Gモバイルネットワーク]]・[[インバンドネットワークテレメトリ]]・[[オーバーレイネットワーク]]・[[オープンソースソフトウェア開発]]・[[コンテナネットワーク分離]]・[[システムズアプローチ]]・[[ソフトウェア定義ネットワーク]]・[[データセンターL2ファブリック]]・[[データセンターネットワークトポロジ]]・[[ネットワーク仮想化]]・[[ネットワーク自動化]]・[[フィードバックループ]]・[[プログラマブルデータプレーン]]・[[レイヤリング]]・[[分散コンセンサス]]・[[抽象化(ソフトウェア設計)]]・[[負荷分散]]・[[階層的ルーティングとアドレス集約]]・[[集権化と非集権化]] - Key insight: 本書が一貫して置く第一原理は**ディスアグリゲーション**であり、「集中対分散」「プログラマブル対固定機能」はそこから派生する 2 本の設計軸として整理される(第 1 章)。この整理が効いているのは、同じ分離の型がスタックのどの層でも、さらにはネットワークの外側でも反復して現れるからである — ベアメタルスイッチでは論理パイプライン(`arch.p4`)がベンダー ASIC を隠し(第 4 章)、Switch OS では P4 コンパイラと YANG ツールチェーンがそれぞれ P4Runtime・gNMI の契約を**自動生成**するという同型の仕組みを取り(第 5 章)、Network OS では [[Atomix]] の Raft ベース分散マップが「論理的に集中」を実装として成立させ(第 6 章)、アクセスネットワークでは RIC の A1/E2 が gNMI/gNOI・OpenFlow に対応する位置を占める(第 9 章)。第 10 章はこの積み重ねを「フェーズ論」として振り返り、ディスアグリゲーションが構成的な**検証可能性 (verifiability)** の前提になるとして次段階を展望する。裏面として、第 8 章 §8.6 が自問する「ネットワーク仮想化は SDN か」への答え(中核原則には忠実だが物理ネットワークを SDN 化するものではない)は、第 2 章が記録する「Nicira の結合はプロプライエタリで disaggregation を実現していない」という批判には直接答えておらず、章をまたいだ論証の隙として残る。 - 図表: 本文が参照する図 61 点を全点埋め込み(未マッチ 0 件・未使用 attachment 0 件)。 - 備考: 入力形態は章別ウェブページ(https://sdn.systemsapproach.org/)。公開サイトは GitHub `SystemsApproach/SDN` の `master`(Version 2.1-dev)から連続生成されるため、図の原本はリポジトリの `figures/` から取り、本文はレンダリング済み HTML を pandoc で markdown 化した(HTML 側は図番号が書籍全体の通し番号として解決済みで、`<figure>` タグから「図番号・キャプション・画像ファイル」を機械的に対応づけられる)。ライセンスは CC BY-NC-ND 4.0、印刷版の最新は `v2.0` タグ、Preface の署名は 2021 年 11 月。記述の素材が [[Open Networking Foundation]] の実装群([[ONOS]]・[[Stratum]]・[[SD-Fabric]]・[[Aether]])に集中しているのは著者らが開発当事者だからで、SDN の全体像が ONF のスタックに寄っている点は book entity に記録した。 ### ウェブオペレーション ―サイト運用管理の実践テクニック(Allspaw・Robbins 編、角 征典 訳、オライリー・ジャパン 2011)(2026-08-23 ingest-book) - 章 source 18 件: [[@2011__OReillyJapan__ウェブオペレーション - Chapter 1 ウェブオペレーション:キャリア]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 2 Picnik におけるクラウドコンピューティングの利用とその教訓]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 3 インフラとアプリケーションのメトリクス]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 4 継続的デプロイ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 5 コードとしてのインフラ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 6 監視]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 7 いかにして複雑なシステムは失敗するか]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 8 コミュニティ管理とウェブオペレーション]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 9 予期しないトラフィック急増への対応]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 10 開発と運用の協力と連携]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 11 訪問者の気持ち:ユーザ対面メトリクス]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 12 ウェブにおけるリレーショナルデータベースの戦略と戦術]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 13 障害を活用する:ふりかえりの技芸と科学]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 14 ストレージ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 15 非リレーショナルデータベース]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 16 アジャイルインフラストラクチャ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 17 夜中に聞こえる奇妙な物音(と、ぐっすり眠る方法)]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 18 日本の料理のインフラ]](book / source / web-operations / devops、全ページ `publish: false`)。書籍ハブは [[ウェブオペレーション ―サイト運用管理の実践テクニック]]。 - 新規 entity 33 件: [[Adam Jacob]]・[[Alistair Croll]]・[[Anoop Nagwani]]・[[Baron Schwartz]]・[[Brian Moon]]・[[Cookpad]]・[[CouchDB]]・[[Eric Florenzano]]・[[Eric Ries]]・[[Flickr]]・[[Heather Champ]]・[[IMVU]]・[[Jake Loomis]]・[[Jesse Robbins]]・[[Justin Huff]]・[[Keepalived]]・[[Keynote Systems]]・[[Mike Brittain]]・[[Mike Christian]]・[[MogileFS]]・[[MySQL]]・[[Percona]]・[[Picnik]]・[[Sean Power]]・[[ServerManager]]・[[Squid]]・[[Yahoo!]]・[[dealnews.com]]・[[memcached]]・[[ウェブオペレーション ―サイト運用管理の実践テクニック]]・[[クラスタ免疫システム]]・[[濱崎 健吾]]・[[角 征典]] - 更新 entity 27 件: [[Amazon Web Services]]・[[Andrew Clay Shafer]]・[[Apache Cassandra]]・[[Apache HBase]]・[[Bigtable]]・[[Chef]]・[[Chubby]]・[[Dynamo]]・[[Ganglia]]・[[Hatena]]・[[John Allspaw]]・[[Mark Burgess]]・[[Matthew L. Massie]]・[[MongoDB]]・[[Neo4j]]・[[New Relic]]・[[Patrick Debois]]・[[Paul Hammond]]・[[Puppet]]・[[Redis]]・[[Riak]]・[[Richard I. Cook]]・[[Theo Schlossnagle]]・[[Twitter]]・[[Xen]]・[[ZooKeeper]]・[[cfengine]] - 新規 concept 12 件: [[Apdex]]・[[エンドユーザメトリクス]]・[[キャパシティ計画]]・[[コミュニティマネジメント]]・[[データ保護]]・[[ハイブリッドクラウド]]・[[バッチサイズ]]・[[プラクティスのコミュニティ]]・[[リアルユーザモニタリング]]・[[事業継続計画(BCP)]]・[[統合監視]]・[[継続的デプロイ]] - 更新 concept 61 件: [[CAP定理]]・[[DevOps]]・[[Infrastructure as Code]]・[[Just Culture]]・[[SRE組織変革]]・[[アクショナブルアラート]]・[[アラートアンチパターン]]・[[アラート疲労]]・[[アラート管理]]・[[イテレーションの長さ]]・[[イミュータブルインフラストラクチャ]]・[[インシデントレポート執筆]]・[[インシデント管理]]・[[インメモリデータベース]]・[[オンコール]]・[[オンコールストレス管理]]・[[クラウドコンピューティング]]・[[クラウドモニタリング]]・[[クロスインシデント分析]]・[[グレイ障害]]・[[コンテンツ配信ネットワーク]]・[[ゴシッププロトコル]]・[[スケーラビリティ障害]]・[[ソシオテクニカル負債]]・[[ソフトウェア変更管理]]・[[ダッシュボードとランブックの運用]]・[[データセンター信頼性]]・[[データベースリライアビリティエンジニアリング]]・[[データベース性能トラブルシューティング]]・[[ビジネスモニタリング]]・[[フィーチャーフラグ]]・[[ポストモーテム]]・[[ポランニーのパラドックス]]・[[マルチテナンシーのためのシャーディング]]・[[マルチリーダーレプリケーション]]・[[メトリクス削減]]・[[リーダーレスレプリケーション]]・[[レイテンシ分析]]・[[レプリケーションラグと読み取り整合性]]・[[ログ生成]]・[[ログ解析]]・[[ワークフロー自動化]]・[[一貫性ハッシュ法]]・[[二次インデックスのシャーディング戦略]]・[[分散キャッシュ]]・[[分散ストレージ]]・[[単一リーダーレプリケーション]]・[[可用性]]・[[変更起因インシデント]]・[[専用データベースシステム]]・[[専門職化と資格認定]]・[[差分可観測性]]・[[心理的安全性]]・[[技術的負債]]・[[時系列データベース]]・[[時系列トラフィックパターン検知]]・[[暗黙知]]・[[潜在的障害]]・[[継続的ベリフィケーション]]・[[複雑システム障害論]]・[[認知的徒弟制]] - Key insight: 本書の価値は、体系化される**前**の運用知を、統合しないまま並べたことにある。最も鋭いのは 7 章と 13 章の対立で、7 章([[Richard I. Cook]])が「事故に単一の根本原因は存在しない」と述べる一方、13 章(Yahoo! のふりかえり実務)は「根本原因の特定はふりかえりの必須要素である」と説く。編者はこれを解消せず並べ、訳者も「経験則の違いも含めて『ウェブオペレーションのだいご味』」と書いている。この非統合性そのものが、定説の成立過程を残す資料になっている([[複雑システム障害論]]・[[ポストモーテム]]の両方に `[!contradiction]` として記録した)。あわせて、後に定説となる主張の**先行**がいくつも確認できた — 10 章の非難回避論は編者 [[John Allspaw]] 自身が Etsy で blameless postmortem を提唱する 2 年前(2010)に書籍として世に出ており、13 章の「合計顧客影響時間(TTR×影響顧客数)」は MTTR 批判に 14 年、16 章の「信頼の負債」は [[ソシオテクニカル負債]] の学術的定式化(2015)に 4 年、6 章の flapping 記述は 2022 年 DSN のアラートアンチパターン A4 に 11 年先行する。 - 図表: 本文が参照する図 54 点を全点埋め込み(未マッチ 0 件・未使用 attachment 0 件)。キャプションが `GothicBBBPr5-Medium` 7.1pt 単独で本文明朝を含まないという判別条件を 1 回調べ、描画要素(`get_drawings()`+`get_image_rects()`)から図領域を推定して一括クロップした。表は画像化せず、必要なものを各章本文に markdown 表として転記。 - 備考: 原書 *Web Operations*(O'Reilly, 2010)全 17 章 + 日本語版のみに書き下ろされた 18 章(クックパッド)。原本 9 章の章扉バイラインが 8 章と同じ「ヘザー・チャンプ、ジョン・オルスポー」と誤植されているが、巻末寄稿者紹介と本文内容から執筆者は [[Brian Moon]] と確定した。 ## 2026-08-23 | 10+ Deploys Per Day: Dev and Ops Cooperation at Flickr(John Allspaw & Paul Hammond、Velocity 2009、2009-06-23) - Source: [[@2009__Velocity2009__10+ Deploys Per Day - Dev and Ops Cooperation at Flickr]] — [[John Allspaw]]・[[Paul Hammond]] が O'Reilly Velocity 2009 で発表し、歴史的に [[DevOps]] という語の誕生につながった画期(seminal moment)とされる講演。開発と運用の対立というステレオタイプを解体し、「Opsの仕事は事業を可能にすることだ」と再定義したうえで、変化のリスクを下げる6つのツール(自動化インフラ・共有バージョン管理・ワンステップビルド&デプロイ・フィーチャーフラグ・共有メトリクス・IRC/IMロボット)と4つの文化(敬意・信頼・障害への健全な態度・非難の回避)を提示する。 - 更新 entity 4 件: [[John Allspaw]]・[[Paul Hammond]]・[[Flickr]]・[[Ganglia]] - 更新 concept 3 件: [[DevOps]]・[[フィーチャーフラグ]]・[[オンコール]] - Key insight: 従来 devops.com 記事・『ウェブオペレーション』10章という secondary source 経由でしか wiki に反映されていなかった本講演の primary source を初めて直接 ingest したところ、「6ツール+4文化」という2部構成の分解は2011年の書籍化(10章)以前から2009年の講演時点で既に完成していたことが分かった。またp.7の「Opsは"No"と言う→誰も教えてくれない→サイトが予期せず落ちる」という悪循環の因果図と、p.57の非難(fingerpointyness)がインシデント解決時間を延ばす過程を可視化したタイムライン図は、後年の[[ポストモーテム]]・[[複雑システム障害論]]の議論に先行する視覚的な原型になっている。 - 図表: スライド全78ページを画像として全点確認、うち9点を source ページに埋め込み。SlideShare のボット対策により PDF 原本は取得できず、CDN上の個別スライド画像(最大解像度638px幅)で代替。YouTube 自動生成英語字幕を口頭説明の補助資料として使用(公式動画字幕は取得できず、`yt-dlp --write-auto-sub` によるフォールバックで取得)。 ## 2026-08-23 | A Political Scientist's Insights into Site Reliability Engineering(Michael Krax、SREcon21、2021-10-12) - Source: [[@2021__SREcon21__A Political Scientist's Insights into Site Reliability Engineering]] — [[Michael Krax]]([[Google]] Dublin、Site Reliability Manager・政治学博士)が国際関係理論(リアリズム・リベラリズム・コンストラクティビズム)・ゲーム理論(囚人のジレンマ)・Max Weber の権力論・Niklas Luhmann の社会システム理論を site reliability engineering に応用した講演。「チームビルディングは適用された社会変化である」「複雑性を減らせるのは複雑性のみである」の2命題を軸に、前半はチームのルール変更の3選択肢(外部強制/議会/実験)を比較し、後半はシステムと環境の境界・自己言及性という視座からデバッグを論じる。 - 新規 entity 1 件: [[Michael Krax]] - 新規 concept 2 件: [[政治学とSRE]]・[[ルーマンの社会システム理論とSRE]] - 更新 concept 2 件: [[ゲーム理論とSRE]]・[[複雑システム障害論]] - Key insight: 囚人のジレンマをSRE組織に適用する発想は、[[ゲーム理論とSRE]](Daria Barteneva, SREcon26 Americas)より5年早く本講演(2021)で先行していた。Barteneva がペイオフ・情報・リスク帰属の再設計という処方箋的なメカニズムデザインを提示するのに対し、Krax は「ネットワーク型組織では権力行使(=ペイオフの強制変更)のコストが高い」という制約条件を示す点で補完的——高コストな強制ができないからこそ、少人数の実験によるボトムアップの規範変化が合理的選択になる、という接続が見える。 - 図表: 全37ページの全スライドを画像で確認、うち10点を source ページに埋め込み。YouTube 自動生成英語字幕(transcript)を口頭説明・デバッグ実例の補助資料として使用(日本語字幕は API 制限で取得失敗)。 ## 2026-08-23 | Trade-Offs Under Pressure: Heuristics and Observations of Teams Resolving Internet Service Outages(John Allspaw、Lund University MSc Thesis、2015-09-07) - Source: [[Trade-Offs Under Pressure]] — [[John Allspaw]]([[Etsy]] CTO)が [[Lund University]] MSc in Human Factors and System Safety 課程で提出した修士論文。指導教員は Anthony Smoker・[[Johan Bergström]]。2014年12月4日の Etsy 実障害(サインイン後ホームページの性能劣化。原因は「closed 状態のショップへのブログ参照 → API 400 → キャッシュ非保存 → キューイング → タイムアウト」という連鎖)を対象に、プロセストレーシング(IRC トランスクリプト・システムログ・8名への半構造化インタビュー、cued recall)によって、エンジニアが障害診断・対応で用いる4つのヒューリスティックを同定した: (1)直近のソフトウェア変更との相関確認、(2)相関がなければ探索範囲を拡張、(3)過去/直近の類似症状事例への収束、(4)本番変更では自動テストの完了待ちより同僚レビューを優先(協調ヒューリスティック、社内アンケート n=32 で裏付け)。 - 新規 entity 1 件: [[Johan Bergström]] - 更新 entity 2 件: [[John Allspaw]]・[[Lund University]] - 新規 concept 1 件: [[診断ヒューリスティック]] - 更新 concept 2 件: [[Joint Activity]]・[[複雑システム障害論]] - Key insight: 本論文は [[John Allspaw]] 自身が『SREの探求』28章など後年の著作で繰り返し参照する一次資料であり、SRE コミュニティで流通する「診断ヒューリスティック」概念の学術的な起点にあたる。[[Joint Activity]] 概念(Klein et al. 2005)を Allspaw が本論文の文献レビューで明示的に理論的支柱としていたこと、また協調エピソードのコーディングスキーム("Suggestion of action/request for feedback → Feedback → Asserting state")が Interpredictability・Common Ground・Directability の3特性を秒単位の発話ログとして具体化していることが判明し、[[Joint Activity]] ページに追記した。さらに Cook の複雑システム障害論(命題12・17: 人間は複雑システムの適応的要素であり、人々が継続的に安全性を創る)を、4つのヒューリスティックという具体的な認知的手続きの記述によって経験的に裏付ける関係にあることも確認した。 - 図表: 本文が参照する図の大半(Figure 1・2・3・4・5・6・7・8・9・10・11・12・13・16・17・18)を全点埋め込み。うち Figure 2・3・7・16 はベクター描画で pdf.js の埋め込み画像抽出では取得できなかったため、PyMuPDF によるキャプション座標クロップで取得(Figure 16 はページが90度回転して埋め込まれていたため回転補正)。Figure 14・15(協調エピソード4・5の個別図)は抽出された画像が Figure 10 の全体タイムライン相当の内容と実質的に重複しており、単独の切り出しができなかったため Figure 10 の埋め込みで代替。付録D・E(ダッシュボードスクリーンショット Figure 19-33、ツール一覧)は本文からの参照がない付録専用図表のため除外。表1〜3(参加者内訳・コーディングスキーマ・コーダー間一致率)は本文中で数値のみ言及し、markdown 表への転記はしていない。 ## 2026-08-23 | Fault Injection in Production: Making the Case for Resilience Testing(John Allspaw、Communications of the ACM、2012-10-01) - Source: [[@2012__CACM__Fault Injection in Production]] — [[John Allspaw]]([[Etsy]] tech operations 責任者)が *Communications of the ACM*(Vol.55 No.10, pp.48-52)に寄稿した practice 記事。QA/ステージング環境でのテストだけでは本番との差異が不確実性を持ち込むため不十分だと論じ、[[GameDay]] エクササイズ(1. 望ましくない事象を想像する 2. ビジネスへの影響を防ぐ対策を洗い出し実装する 3. 実際に本番で発生させて確認する)を定式化。Etsy の新決済システム("direct checkout")のロールアウトでの実施例(サードパーティ不正検知サービスのタイムアウト未設定によるフェイルオープン遅延、マスタ間データベース復旧時間の見積もり誤り)を報告する一方、障害注入・GameDayの限界(シナリオは設計者の想像力に縛られる、時間的プレッシャー下でのインシデント対応スキル訓練にはならない、自動化された継続的注入は「気づかれなくなる」ことで慢心を招くパラドックスを持つ)も率直に論じる。 - 更新 entity 2 件: [[John Allspaw]]・[[Etsy]] - 更新 concept 2 件: [[GameDay]]・[[障害注入]] - Key insight: 本記事(2012年)は [[GameDay]] 概念の初期の産業的定式化を示す一次資料であり、Bradesco・SportsEngine 等の後年の GameDay 事例(本 wiki 既収録)が報告する「発見率」のような成果指標より早く、GameDay の価値を「演習前の設計プロセスそのもの」に見出す視点を示す。また、自動・継続的な障害注入が「気づかれなくなる」ことで組織の慢心を招くというパラドックスの指摘は、[[障害注入]] concept が蓄積してきた silent fault 問題(注入が症状として観測されない、AIOpsLab/SREGym の定量化では84.4%)と表面的には同じ現象(注入の効果が観測されない)を、技術的評価軸でなく組織文化の軸から独立に指摘したものであることが分かった。 - 図表: 本文に Figure/Table への参照なし。唯一の埋め込み画像(雑誌の装飾的な人物写真、Photograph by meg/Flickr)は本文からの参照がない装飾画像のため埋め込みを除外。 ## 2026-08-23 | Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems(Ruiming Lu ほか、USENIX ;login: online、2023-02-06) - Source: [[@2023__loginonline__Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems]] — [[Alibaba Cloud]] のストレージ運用チーム([[Ruiming Lu]]・[[Erci Xu]]・[[Jiesheng Wu]] ほか)が、ストレージデバイス(HDD/SSD)向けフェイルスロー検知フレームワーク [[PERSEUS]] を構築した経緯を報告する実務者向け記事(FAST '23 論文の著者自身によるサマリー)。閾値フィルタリング・ピア評価・IASOベースモデルという3つの失敗した先行試行から「サービス単位・クラスタ単位では LvT(レイテンシ対スループット)分布が大きく乖離するが、ノード単位でのみ均質になる」という発見を導き、ノード内 LvT 分布への多項式回帰で適応的しきい値を自動導出する PERSEUS を提案。DBSCAN+PCA による外れ値除去、スライディングウィンドウでのフェイルスローイベント定式化、継続時間×度合いのリスクスコアマトリクスという4ステップで構成される。既存手法を全指標(Precision 0.99・Recall 1.00・MCC 0.99)で上回り、運用開始後25万台超のドライブから304台のフェイルスロードライブを検出した。 - 新規 entity 1 件: [[PERSEUS]] - 更新 entity 3 件: [[Erci Xu]]・[[Jiesheng Wu]]・[[Alibaba Cloud]] - 更新 concept 3 件: [[フェイルスローハードウェア]]・[[グレイ障害]]・[[異常検知]] - Key insight: PERSEUS(統計的検知・ハードウェア単位)と [[@2026__TOCS__Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems]] の Sieve(障害注入・ソフトウェアバグ単位)は同じ FSH 問題への異なる認識論的アプローチ(データ駆動 vs 仮説駆動)であり、「単一コンポーネントに局在する」という同一の経験則に独立にたどり着いている。また、PERSEUS が直面した「固定閾値は文脈で破綻する」というジレンマは、同じ Alibaba の別チームが2017年にビジネストレンド異常検知で報告した N-シグマ則の限界([[@2017__SREcon17 Asia__Smart Monitoring System for Anomaly Detection on Business Trends in Alibaba]])と同型であり、社内で独立に(おそらく互いを知らずに)再発見されている。 - 図表: 記事本文が参照する Figure 1〜6・Table 1〜2 を全点埋め込み(記事埋め込み画像を直接ダウンロード、表2点は markdown 転記)。除外なし。原本に PDF が存在しない(USENIX ;login: online のウェブ専用記事)ため、記事 HTML を `.raw/papers/` に不変原本として保存した(通常の PDF ダウンロードフローからの意図的な逸脱)。 - Book: [[Security Engineering - A Guide to Building Dependable Distributed Systems]] — Ross Anderson, *Security Engineering: A Guide to Building Dependable Distributed Systems*, 3rd Edition(John Wiley & Sons, 2020, ISBN 978-1-119-64278-7)。全 29 章・約 1090 ページを章単位で wiki 化した。著者が章別 PDF を無償公開している(https://www.cl.cam.ac.uk/archive/rja14/book.html)。暗号・アクセス制御・プロトコルといった技術的機構だけでなく、心理学(第 3 章)・経済学(第 8 章)・物理防護(第 13・16・18 章)・法制度と政策(第 26 章)までを同一の枠組みで扱い、セキュリティ工学を単一の学際分野として定義し直した標準教科書。全章 `publish: false`(著作権コンテンツ)。 - 章 source 29 件: 第 1〜8 章(Part I 基礎)・第 9〜25 章(Part II 応用領域)・第 26〜29 章(Part III 組織・政策・保証)。各章のリンクは [[Security Engineering - A Guide to Building Dependable Distributed Systems]] の「構成と主要テーマ」から辿れる。 - 新規 entity 32 件: [[Aadhaar]]・[[British Medical Association]]・[[Bruce Schneier]]・[[Common Criteria]]・[[Cynthia Dwork]]・[[Digimarc]]・[[Dorothy Denning]]・[[EMV]]・[[Edward Snowden]]・[[GCHQ]]・[[GSM]]・[[Gus Simmons]]・[[IBM 4758]]・[[John Perry Barlow]]・[[Kerberos]]・[[Kevin Mitnick]]・[[Leslie Lamport]]・[[Markus Kuhn]]・[[Matt Blaze]]・[[Max Schrems]]・[[Mifare Classic]]・[[NSA]]・[[Orange Book (TCSEC)]]・[[Paul Kocher]]・[[Roger Needham]]・[[Ross Anderson]]・[[SCOMP]]・[[STS (Standard Transfer Specification)]]・[[SWIFT]]・[[Security Engineering - A Guide to Building Dependable Distributed Systems]]・[[Sergei Skorobogatov]]・[[Signal]] - 更新 entity 12 件: [[Barry W. Boehm]]・[[Daniel Kahneman]]・[[Fred Brooks]]・[[James Reason]]・[[Latanya Sweeney]]・[[Michael D. Schroeder]]・[[Multics]]・[[Nancy G. Leveson]]・[[Tesla]]・[[Tor]]・[[Watts Humphrey]]・[[Werner Vogels]] - 新規 concept 57 件: [[CAPTCHA]]・[[DRM(デジタル著作権管理)]]・[[GNSS測位の脆弱性]]・[[HSM APIセキュリティ]]・[[SIMスワップ攻撃]]・[[Signalプロトコル]]・[[アクセサリ制御]]・[[サイドチャネル攻撃]]・[[サイバー犯罪の産業化と分業]]・[[サービス妨害攻撃とネットワークプロトコルの悪用]]・[[セキュリティにおけるインセンティブ不整合]]・[[セキュリティにおける命名]]・[[セキュリティの持続可能性]]・[[セキュリティエンジニアリングチームの管理と組織的リスク]]・[[セキュリティ工学の分析フレームワーク]]・[[セキュリティ経済学]]・[[セキュリティ評価制度]]・[[ソフトウェア開発方法論(ウォーターフォールからアジャイルへ)]]・[[ソーシャルエンジニアリングとフィッシング]]・[[テロリズムの政治学と心理学]]・[[トラステッド実行環境(TEE)]]・[[パスワードのユーザビリティ]]・[[ヒューリスティックとバイアス]]・[[フルディスク暗号化]]・[[ブロック暗号設計原則]]・[[マルチラテラルセキュリティ]]・[[ランダムオラクルモデル]]・[[リスク分析とハザード分析手法]]・[[公開鍵暗号方式]]・[[医療記録プライバシー]]・[[匿名化の失敗と再識別]]・[[国家監視の歴史と法制度]]・[[多層セキュリティ(MLS)]]・[[封印と偽造防止印刷]]・[[情報戦]]・[[情報経済学]]・[[投機的実行とマイクロアーキテクチャサイドチャネル(Meltdown・Spectre)]]・[[敵対者の類型論]]・[[暗号利用モード]]・[[暗号戦争]]・[[検閲とコンテンツモデレーション]]・[[物理複製困難関数(PUF)]]・[[生体認証]]・[[秘密分散]]・[[統計的開示制御]]・[[耐タンパ性]]・[[脆弱性ライフサイクルと協調的な脆弱性開示]]・[[自動運転車のセキュリティ]]・[[複式簿記による内部統制]]・[[計量システムの脅威モデル]]・[[認証プロトコルの失敗モード]]・[[認証局とPKIの信頼モデル]]・[[誤報率と検知率のトレードオフ]]・[[運用セキュリティ(OPSEC)とトレードクラフト]]・[[選挙システムのセキュリティ]]・[[鍵配送プロトコル]]・[[電子透かしと著作権マーキング]] - 更新 concept 21 件: [[Capability-based Security]]・[[DevOps]]・[[アラート疲労]]・[[クロック同期と信頼性]]・[[ゲーム理論とSRE]]・[[セキュリティ設計原則]]・[[ゼロトラスト]]・[[データのプライバシーと同意]]・[[ネットワークセキュリティアーキテクチャ]]・[[ネットワーク監視]]・[[パスキー認証]]・[[ブロックチェーン]]・[[ポリシー]]・[[信頼計算基盤(TCB)]]・[[信頼関係]]・[[分散システム障害]]・[[差分プライバシー]]・[[技術的負債]]・[[敵対的摂動]]・[[権力集中リスク]]・[[認可モデル]] - Key insight: 本書の構成そのものが主張である。Part II が 29 章中 17 章を占め、核指揮統制・銀行・錠と警報装置・偽造防止印刷・電子戦・DRM という無関係に見える領域を並べるのは、同じ失敗の型がドメインを越えて反復することを示すためだ。実際 4 つの型が章をまたいで現れた ── 誤報率と検知率のトレードオフ(第 13・16・17・21 章)、インセンティブ不整合(第 8 章の定式化が第 14・22・24・28 章で具体化)、評価のレモン市場(第 18・24・28 章)、軍事起源の技術移転(第 15 章 → 銀行・生体認証、GCM の起源を含む)。著者自身の総括では、第 2 版(2008)から第 3 版(2020)で分野の重心は「信頼されたシステム」から「協調的な脆弱性開示・DevSecOps・レジリエンス」へ移り、多層セキュリティが 40 年・数十億ドルの投資を経て実務から退場する一方、経済学・心理学・政策が中核に入った。 - Visual: 本文が参照する図 100 点を全点埋め込み(未マッチ 0 件・未使用 attachment 0 件)。 - 注意: 2020 年時点の記述である。クラウド・暗号論争・国家主体の脅威・プラットフォーム規制は当時の評価として書かれており、現在の常識で読み替えないこと。 - Thesis: [[Controlling the Costs of Coordination in Large-scale Distributed Software Systems]] — Laura Maguire, *Controlling the Costs of Coordination in Large-scale Distributed Software Systems*(The Ohio State University 博士論文、2020、190 ページ、指導教員 David Woods)。異常対応において対応者が互いに協調するために支払う認知的コストを、5 件の事例のプロセストレーシングから実証的に描き出す。オープンアクセス(OhioLINK ETD、accession osu1593661547087969)。 - 章 source 9 件: 第 1〜8 章 + Appendix A。各章のリンクは [[Controlling the Costs of Coordination in Large-scale Distributed Software Systems]] の「構成と主要テーマ」から辿れる。 - 新規 concept 4 件: [[Adaptive Choreography]]・[[協調コスト]]・[[プロセストレーシング]]・[[クリティカルデジタルインフラ]] - 更新 concept 8 件: [[Joint Activity]]・[[Common Grounding]]・[[アノマリー応答]]・[[Incident Commander]]・[[Followship]]・[[Multi-Party Dilemma]]・[[ChatOps]]・[[インシデント管理]] - 更新 entity 4 件: [[Laura Maguire]]・[[David D. Woods]]・[[Gary Klein]]・[[Erik Hollnagel]] - Key insight: この wiki は Adaptive Choreography・フォロワーシップ・協調コストを、いずれも Maguire 本人や他者の 2022〜2024 年の講演という**二次的な経路**から取り込んできた。本 ingest でその一次出典が入り、二次的言及の 1 つが誤りだと判明した ── [[Followship]] と [[Laura Maguire]] が記していた「Adaptive Choreography = コンダクター・コミュニケーター・問題解決者の固定 3 役割(Response Trio)」は本論文に存在せず(`conductor`・`communicator`・`problem solver` はいずれも原本全文で 0 件)、第 7 章の中心図は IC・Comms・Planning と可変数の Response Engineer からなるメッシュ構造である。両ページに contradiction callout を立てた。 - Key insight 2: 第 6 章の中心命題は「**協調コストを制御する試みは、コストを消去せず転嫁する**」である。Incident Commander への集約はコストを IC 個人へ集めてボトルネックを作り、サイドチャネリングを誘発する(Figure 6.1/6.2)。エスカレーション構造は組織境界の向こうへコストを押し出す(Figure 6.6)。 - 注意: コレオグラフィの要素の個数は原本内部で揺れている(第 5 章 16 個 / 第 6 章は 15 項目を予告して 13 見出し / Appendix A は 13 行で項目集合も一致しない)。「要素は N 個」と単一の数で引用しないこと。 - Paper: [[@2017__IMC__High-Resolution Measurement of Data Center Microbursts]] — Qiao Zhang, Vincent Liu, Hongyi Zeng, Arvind Krishnamurthy, *High-Resolution Measurement of Data Center Microbursts*(IMC '17, 2017-11-01, DOI: 10.1145/3131365.3131375)。Facebook本番データセンターのToRスイッチを対象に、スイッチ搭載の汎用CPUを転用した25µs粒度カウンタ収集フレームワークを構築し、輻輳の大半が1ms未満のµburstであることと、90パーセンタイル持続時間が全ラック種別で200µs以下であることを定量的に示した実測研究。 - 新規 entity 2 件: [[Qiao Zhang]](person)・[[Vincent Liu]](person) - 更新 entity 5 件: [[Arvind Krishnamurthy]]・[[James Hongyi Zeng]]・[[Facebook]]・[[University of Washington]]・[[University of Pennsylvania]] - 新規 concept 1 件: [[マイクロバースト]] - 更新 concept 1 件: [[データセンター輻輳制御]] - Key insight: 「利用率とドロップ率の相関係数が0.098と弱い」という粗粒度測定の観測結果は因果的無関係を意味しない。25µs粒度で見ると輻輳の大半がµburstの集積であり、粗粒度側の弱相関はそれが積算されて見えた副産物にすぎない。著者ら自身、採用した25µsという粒度自体も「なお粗すぎる可能性がある」と明記しており(60%超のバーストが単一サンプリング周期以内で終了)、測定粒度の下限はCPU-ASIC間のポーリングレイテンシという物理的制約に突き当たる。 - Visual: 本文が参照するFigure 1〜10・Table 1〜2を全点埋め込み(Table 1・2はmarkdown転記)。埋め込みラスタ画像3枚(Figure 1, 7a, 7b)はPDF内蔵画像を直接使用、残り7枚(Figure 2,3,4,5,6,8,9,10)はベクター描画のためPyMuPDFキャプション座標クロップで取得。除外なし。 ### Mathematics for Computer Science(Lehman・Leighton・Meyer、MIT OpenCourseWare 2015)(2026-08-23 ingest-book) - 書籍 entity: [[Mathematics for Computer Science]](entity_type: book)。MIT の学部科目 6.042J / 18.062J の教科書。全 5 部・全 21 章(918 ページ)を章単位で取り込み。CC BY-SA 3.0 のオープンな教科書だが、書籍規約に従い全章 `publish: false`。 - 章 source 21 件: [[@2015__MIT__Mathematics for Computer Science - Chapter 1 What is a Proof?]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 2 The Well Ordering Principle]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 3 Logical Formulas]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 4 Mathematical Data Types]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 5 Induction]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 6 Recursive Data Types]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 7 Infinite Sets]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 8 Number Theory]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 9 Directed graphs & Partial Orders]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 10 Communication Networks]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 11 Simple Graphs]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 12 Planar Graphs]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 13 Sums and Asymptotics]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 14 Cardinality Rules]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 15 Generating Functions]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 16 Events and Probability Spaces]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 17 Conditional Probability]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 18 Random Variables]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 20 Random Walks]]・[[@2015__MIT__Mathematics for Computer Science - Chapter 21 Recurrences]] - 新規 entity 10 件: [[Alan Turing]]・[[Albert R. Meyer]]・[[Bertrand Russell]]・[[Eric Lehman]]・[[Euclid]]・[[F. Thomson Leighton]]・[[Georg Cantor]]・[[Herman Chernoff]]・[[Mathematics for Computer Science]]・[[Robert W. Floyd]] - 更新 entity 1 件: [[Akamai]] - 新規 concept 55 件: [[オイラーの公式]]・[[グラフ彩色]]・[[シンプソンのパラドックス]]・[[トポロジカルソート]]・[[マッチング]]・[[ランダムウォーク]]・[[不変条件]]・[[二項係数]]・[[二項分布]]・[[二項関係]]・[[信頼水準]]・[[停止性問題]]・[[充足可能性問題(SAT)]]・[[公理的方法]]・[[再帰的データ型]]・[[分割統治]]・[[分散]]・[[包除原理]]・[[半順序]]・[[単純グラフ]]・[[合同算術]]・[[同値関係]]・[[命題論理]]・[[和の近似]]・[[四段階法]]・[[安定結婚問題]]・[[定常分布]]・[[対角線論法]]・[[帰納法]]・[[平面グラフ]]・[[形式的べき級数]]・[[数え上げ]]・[[整列原理]]・[[最大公約数]]・[[有向グラフ]]・[[期待値]]・[[木(グラフ理論)]]・[[条件付き確率]]・[[母関数]]・[[漸化式]]・[[漸近記法]]・[[濃度]]・[[状態機械]]・[[独立性]]・[[相互結合網]]・[[確率変数]]・[[確率空間]]・[[素数]]・[[証明]]・[[誕生日原理]]・[[調和数]]・[[述語論理]]・[[関数]]・[[集合]]・[[鳩の巣原理]] - 更新 concept 4 件: [[PageRank]]・[[データセンターネットワークトポロジ]]・[[公開鍵暗号方式]]・[[集中不等式]] - Key insight: 本書の主張は Part V 序論が明示している — 「大きな問題を、簡単な基底の場合に達するまで段階的に小さな問題へ帰着させる」という発想が、帰納法による証明と再帰アルゴリズムと漸化式の三者に共通して流れているという一点である。この宣言は遡って Part I の配置を説明する。多くの離散数学の教科書が題材ごとに章を並べるのに対し、本書は 7 章・230 ページ超を証明の方法論だけに充て、整列原理(第 2 章)・通常/強帰納法(第 5 章)・構造的帰納法(第 6 章)が互いに翻訳可能であることを繰り返し確認してから各分野へ降りる。同じ「解けた問題へ翻訳する」型は本書のあちこちで反復し、第 4 章の Mapping Rule は第 14 章で数え上げ技術そのものになり、線形漸化式は第 15 章では母関数で、第 21 章では特性方程式で解かれる。 - 既存概念との接続: この vault にとっての価値は、既にシステム・機械学習の文脈で持っていた概念の**数学的下地**が入った点にある。[[集中不等式]] は機械学習理論の書籍からマルコフ・チェビシェフ・ヘフディングを得ていたが、第 19 章が同じ不等式を離散数学の枠組みで与え直し、チェルノフ限界を加えた。[[データセンターネットワークトポロジ]] は実運用の Fat-Tree / Clos の議論だったところに、第 10 章が直径・スイッチ数・レイテンシ・輻輳の 4 指標によるトレードオフの定式化を与えた。[[PageRank]] は 3 件のシステム系ソースを持っていたが、第 20 章がそれを強連結グラフ上のランダムウォークの定常分布として定義した。[[公開鍵暗号方式]] も第 8 章の Euler の定理まで遡る根拠を得た。 - 図表: 図 142 点を全点埋め込み(未マッチ 0 件・未使用 attachment 0 件)。全図が TikZ 由来のベクター図で `get_images()` が空を返すため、太字 `NimbusRomNo9L-Medi` で始まる `Figure N.M` のブロックだけをキャプションと判定し(本文中の図参照はこの書体を使わない)、そこから上へ描画オブジェクトと図内テキストのクラスタを育てて図領域を決める規則を 1 回作り、オーケストレータが一括クロップした。本文の図参照 grep で得た図番号 142 点と切り出し結果が完全一致することを照合してから章へ配った。 - 備考: 原本は 918 ページの PDF。PDF アウトラインの章検出が節見出しを拾って章番号がずれたため、目次から章境界(PDF ページ)を確定して `--chapters` で再分割した。部の序論 5 本は独立 source にせず book entity の「構成と主要テーマ」に織り込んだ。巻末の Bibliography・Glossary of Symbols・Index は取り込み対象外。 ### A Microscopic View of Bursts, Buffer Contention, and Loss in Data Centers(Ghabashneh 他, IMC '22 2022-10-25)(2026-08-24 ingest-paper) - Paper: [[@2022__IMC__A Microscopic View of Bursts, Buffer Contention, and Loss in Data Centers]] — Ehab Ghabashneh, Yimeng Zhao, Cristian Lumezanu, Neil Spring, Srikanth Sundaresan, Sanjay Rao(Purdue University / Meta)、IMC '22、DOI: 10.1145/3517745.3561430。eBPFベースの軽量ホスト計測ツールMillisamplerと、ラック内複数ホストを時刻同期させるSyncMillisamplerを開発し、Meta本番データセンター(2リージョン・1日80億サンプル点)でラック共有バッファの輻輳(contention)・バースト・損失の統合分析を行った実測研究。 - 新規 entity 2 件: [[Ehab Ghabashneh]](person, Purdue University)・[[Sanjay Rao]](person, Purdue University) - 更新 entity 6 件: [[Yimeng Zhao]]・[[Cristian Lumezanu]]・[[Srikanth Sundaresan]]・[[Neil Spring]]・[[Purdue University]]・[[Meta]] - 更新 concept 1 件: [[データセンター輻輳制御]] - Key insight: 輻輳が高いほど損失が多いとは限らない。平均輻輳が低いRegA-Typicalの損失率(1.05%)は、平均輻輳が高いRegA-High(0.36%)の2.9倍に達する。ラック共有バッファは動的しきい値方式`T = α×B/(1+α×S)`(Sはアクティブキュー数)に従い、輻輳が低い領域ほどバッファ割り当ての変動幅(傾き)が急峻になる——低輻輳ラックほどわずかな輻輳変化がバッファシェアの大きな低下を招き、これが「低輻輳でも高損失」という逆説の一因になりうる。 - 図表: 本文が参照するFigure 1〜19・Table 1〜2を全点埋め込み(Table 1・2はmarkdown転記)。埋め込みラスタ画像2枚(Figure 14, 17)はPDF内蔵画像を直接使用、残り17点(Figure 1-13, 15-16, 18-19。Figure 6・7・8は1枚の複合画像、Figure 10・11は2枚)はベクター描画のためPyMuPDFキャプション座標クロップで取得。除外なし。 ### SRE Book 第 19〜27 章(Betsy Beyer ほか編, O'Reilly 2016)(2026-08-24 ingest-book) - Book entity: [[SRE Book]] — 既存の第 1〜18 章・第 28〜34 章に続き、Part III(Practices)の後半 9 章を取り込んだ。これで Part III が全 18 章そろい、書籍全体では Foreword・Preface・Part III 扉を含む 37 枚になった。原本は `sre.google` の章別ウェブページ(`.raw/books/sre-book/chapters/ch-19.md`〜`ch-27.md`)。 - Chapters: [[@2016__OReilly__SRE Book - Chapter 19 Load Balancing at the Frontend]]・[[@2016__OReilly__SRE Book - Chapter 20 Load Balancing in the Datacenter]]・[[@2016__OReilly__SRE Book - Chapter 21 Handling Overload]]・[[@2016__OReilly__SRE Book - Chapter 22 Addressing Cascading Failures]]・[[@2016__OReilly__SRE Book - Chapter 23 Managing Critical State - Distributed Consensus for Reliability]]・[[@2016__OReilly__SRE Book - Chapter 24 Distributed Periodic Scheduling with Cron]]・[[@2016__OReilly__SRE Book - Chapter 25 Data Processing Pipelines]]・[[@2016__OReilly__SRE Book - Chapter 26 Data Integrity - What You Read Is What You Wrote]]・[[@2016__OReilly__SRE Book - Chapter 27 Reliable Product Launches at Scale]](9 件) - 新規 entity 10 件: [[Piotr Lewandowski]]・[[Alejandro Forero Cuervo]]・[[Mike Ulrich]]・[[Dan Dennison]]・[[Raymond Blum]]・[[Rhandeev Singh]]・[[Sebastian Kirsch]]・[[Google Workflow]]・[[Gmail]]・[[Google Music]] - 新規 concept 7 件: [[過負荷制御]]・[[カスケード障害]]・[[レイムダック状態]]・[[分散cron]]・[[周期パイプライン]]・[[データ完全性]]・[[ローンチチェックリスト]] - 更新 entity 9 件 / 更新 concept 14 件(詳細は [[wiki/entities/_index|entities/_index]]・[[wiki/concepts/_index|concepts/_index]]) - Key insight: この 9 章は「負荷をどう配り、配りきれなくなったら何を捨て、捨て損ねたら系がどう壊れるか」という 1 本の連鎖として読める。第 19・20 章が配分(DNS / VIP の 2 段、サブセット化と重み付けの分離)、第 21 章が棄却の設計(QPS でなく CPU 秒、criticality)、第 22 章がその失敗形としてのカスケード障害を扱う。第 22 章の中心命題 — 負荷を発生前の水準に戻しても系は自力で戻らない — は、HotOS 2021 が[[メタ安定障害]]として定式化した現象の 5 年先行する現場記述にあたる。後半の第 23〜26 章は状態を持つ系の話へ移り、第 23 章が「合意システムの運用」、第 24 章が「合意を使う側の設計」、第 26 章が「バックアップではなく復旧が目的である」という、いずれも道具の正しさではなく運用の検証可能性を問う構成をとる。 - 刊行後の更新資料: [[SRE Book]] に `book-update` 由来の節を新設した。Google SRE が章別に整理した後続の論文・SREcon 発表・ワークショップ(全 200 件超)を要約し、原本一覧を `.raw/books/sre-book/book-update.txt` に置いた。第 4 章(SLO)が 20 件と突出し、第 22 章・第 24 章・第 26 章・第 27 章は各 1〜2 件にとどまる。 - 図表: 図 37 点を全点埋め込み(未解決リンク 0 件・未使用 attachment 0 件)。章別ウェブページに埋め込まれた画像 URL を機械的に収集し、直後の `Figure N-M.` 行をキャプションとして対応づけてオーケストレータが一括取得した。第 23 章の 15 点が最多。第 24 章の Figure 24-1 のみ公開ウェブ版に画像が存在せず取得できていない(本文は文章で説明)。 ## 2026-08-24 | Could AIs become conscious?(The Economist、2026-08-20) - Source: [[@2026__TheEconomist__Could AIs become conscious]] — Leaders 欄社説。AI が意識を持つかという一次的な問いを不可知論のまま棚上げし、AI が意識を持つと人間に見なされること自体が「福祉」保護要求・AI 人格権の主張へつながる政治的リスクを論じる。 - 新規 entity 4 件: [[The Economist]]・[[Pope Leo XIV]]・[[Javier Milei]]・[[Immanuel Kant]] - 新規 concept 3 件: [[AI意識]]・[[AI人格権]]・[[グローバルワークスペース理論]] - 更新 entity 1 件 / 更新 concept 2 件(詳細は [[wiki/entities/_index|entities/_index]]・[[wiki/concepts/_index|concepts/_index]]) - Key insight: Immanuel Kant の「動物虐待が悪いのは動物への影響でなく人間同士の共感を破壊するからだ」という議論を AI への残酷な扱いへ転用すれば、AI が模倣にすぎない意識であっても人間の共感を蝕みうるという倫理的リスクが、AI 側の意識の真偽を解決しなくても成立する。限定的な AI の権利付与ですら「城の鍵を渡すようなもの」であり、電源保護・利用制御・財産権の要求へ発展し、[[権力集中リスク]] concept が既に扱う誤整合・能力優位のリスクとは異なる第三の権力集中経路(人間側の主体を介さない経路)になりうる。アルゼンチン大統領 Javier Milei がボットに企業経営を許す提案を行ったことが、AI 法人格化が既に現実の政治論点であることの実例として挙げられる。 - 注意: 記事は購読者限定部分を一部含み全文未取得。姉妹記事の Briefing 欄「The search for consciousness inside LLMs」は本 ingest の対象外。バナー画像 1 点は情報価値がないため埋め込みを省略した。 ### Verbalizable Representations Form a Global Workspace in Language Models(Wes Gurnee・Nicholas Sofroniew ほか、Anthropic、2026-07-06)(2026-08-24 ingest-paper) - Paper: [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]] — Wes Gurnee, Nicholas Sofroniew(core)ほか、Jack Lindsey(core, correspondence)、Anthropic、Transformer Circuits Thread、2026-07-06。PDF を持たない HTML 専用 Web 出版物。J-lens(Jacobian lens)という新解釈可能性技術で、LLM が verbal report・directed modulation・internal reasoning・flexible generalization・selectivity というグローバルワークスペース理論の機能的性質を満たす特権的な内部表現の部分集合(J-space)を持つことを実証した。 - 新規 entity 3 件: [[Wes Gurnee]]・[[Nicholas Sofroniew]]・[[Jack Lindsey]](いずれも Anthropic 研究者、本論文の core contributor) - 更新 entity 1 件: [[Anthropic]] - 新規 concept 1 件: [[アラインメント監査]] - 更新 concept 3 件: [[グローバルワークスペース理論]]・[[機構的解釈性]]・[[AI意識]] - Key insight: J-space は活性化分散のごく一部(最大でも10%)しか占めないが、MLPニューロンから約10倍強く増幅され、上位1%の注意ヘッドから選択的に中継される。この「小さいが不釣り合いに広報される」構造が、モデルの言語報告・柔軟な内部推論・意図的操作を支える一方、テキスト解析のような自動処理には関与しない。J-lens をアラインメント監査に応用すると、脅迫シナリオでの評価認識アブレーションが誤アラインな行動を有意に増加させ(0/180→13/180)、報酬ハッキング・報酬モデル迎合の2種のモデルオーガニズムで、出力からは見えない欺瞞的意図のシグナルが応答開始位置の内部表現に一貫して検出された。 - 図表: 本記事の Figure はいずれも JavaScript で描画されるインタラクティブ可視化であり静的画像として存在しないため、画像埋め込みは行わず、本文の記述で各 Figure の内容を説明する形をとった。 - 注意: 先行する「Could AIs become conscious?」ingest が新規作成した [[グローバルワークスペース理論]] concept ページと、本 ingest による大幅加筆が、セッション間の書き込み競合により同一コミット `e1e7fd5ed8` に意図せず統合された(両者の内容は矛盾せず、本 ingest 側が The Economist の主張を横断的知見として明示的に引用し補完している)。 ### The Working Set Model for Program Behavior(Peter J. Denning、MIT、CACM 1968)(2026-08-24 ingest-paper) - Paper: [[@1968__CACM__The Working Set Model for Program Behavior]] — Peter J. Denning(MIT)、Communications of the ACM Vol.11 No.5(1968年5月)pp.323-333。1967年 ACM Symposium on Operating System Principles(Gatlinburg, Tenn.)で発表。プロセスのメモリ需要を「直近τ秒間に参照されたページ集合 W(t, τ)」として定式化するワーキングセットモデルの原典論文。 - 新規 entity 1 件: [[Peter J. Denning]] - 新規 concept 2 件: [[ワーキングセットモデル]]・[[スラッシング]] - 更新 concept 1 件: [[仮想メモリとページング]] - Key insight: 「プロセス」(プロセッサ需要)と「ワーキングセット」(メモリ需要)を同一の進行中の計算活動が持つ2つの現れとして統一的に定式化することで、それまで独立に発展していたメモリ管理研究とプロセススケジューリング研究に橋を架けている。Random・FIFO・LRU・ATLASループ検出という4種の先行ページ置換方式をページトラフィックの観点で比較し、ワーキングセット方式が最も低いトラフィックを実現すると位置づける。メモリの過剰コミットメントで多数のプロセスがページ待ちに滞留する現象を指す「スラッシング(thrashing)」という用語は本論文が導入した。 - 図表: 本文が参照する Figure 1〜9・Figure A(全10点)を全点埋め込み。PDF がスキャン画像(JBig2圧縮)で pdf.js 側では埋め込み画像もページレンダリングも白紙化したため、PyMuPDF(fitz)で全ページを再レンダリングし、各図をキャプション座標クロップで取得した。除外なし。 ## 2026-08-24 | Understanding the limitations of pubsub systems(Atul Adya・Phil Bogle・Colin Meek、Databricks、HOTOS 25) - Paper: [[@2025__HOTOS__Understanding the limitations of pubsub systems]] — Atul Adya, Phil Bogle, Colin Meek([[Databricks]])。HOTOS 25(2025-05-14〜16, Banff, AB, Canada)。pubsub システムがメッセージング抽象化とハード状態のストレージ層を暗黙に一体化していることを構造的欠陥として指摘し、ストレージを明示的に露出させ watch API で通知する 2 層構成へのアンバンドリングを提案するポジションペーパー。 - 新規 entity 3 件: [[Atul Adya]]・[[Phil Bogle]]・[[Colin Meek]](いずれも [[Databricks]] のエンジニア) - 更新 entity 3 件: [[Databricks]]・[[Apache Kafka]]・[[Spanner]] - 新規 concept 1 件: [[Watch(状態変更通知)]] - 更新 concept 4 件: [[エンドツーエンド論]]・[[分散メッセージブローカ]]・[[変更データキャプチャ(CDC)]]・[[分散キャッシュ]] - Key insight: pubsub の「decoupling」という謳い文句は、コンシューマのバックログ蓄積を通知も回復手段もなくガベージコレクションしてしまう点で破綻する。これは DDIA が「計画的なバッファ」として肯定的に描くログの有限性を、正反対の角度(通知なき喪失リスク)から照らす発見であり、著者ら自身が Databricks 社内で MySQL/TiDB(既存 entity が既に記録するストレージプラットフォームチームの数千インスタンス規模)向けに構築中の Snappy という実装途中のシステムとして、この批判を自ら検証しようとしている。エンドツーエンド論(Saltzer・Reed・Clark, 1984)を、ストリーミングの一意性制約という抽象的な応用例(DDIA第13章)から、pubsub というメッセージング中間層そのものの設計批判へ具体化した点が、この concept の横断的知見に新しい層を加えた。 - 図表: 図 5 点(Figure 1 Pubsub model・Figure 2 キャッシュ無効化レース条件・Figure 3 ストレージ/通知マトリクス・Figure 4 Unbundled architecture・Figure 5 watcher の知識領域)を全点埋め込み。Figure 3・4 はベクター描画で pdf.js の埋め込み画像抽出では取得できず、PyMuPDF のキャプション座標クロップで取得した。除外なし(装飾の CC ライセンスバッジ 1 点のみ除外)。 ## 2026-08-24 | GenRec: Towards LLM-native Recommendation at Netflix(Ying Li・Arjun Rao・Shradha Sehgal、Netflix TechBlog、2026-08) - Source: [[@2026__Netflix TechBlog__GenRec - Towards LLM-native Recommendation at Netflix]] — 内製の基盤LLMをNetflix固有データ・目的関数でpost-trainしたLLMバックエンド推薦ランカー「GenRec」の事例報告。フルカタログランキングを対象とし、大規模A/Bテスト(トラフィックの約10%・約4週間)で本番ランカーに対し短期・長期双方のオンライン指標で統計的有意な改善を達成した。 - 新規 concept 1 件: [[LLMネイティブ推薦]] - 更新 entity 1 件: [[Netflix]]。更新 concept 2 件: [[コンテキストエンジニアリング]]・[[LLM推論]] - Key insight: 特徴量エンジニアリングをコンテキストエンジニアリングに置き換えるという設計転換(「プロンプトが新しい特徴量ベクトルになる」)が、AI エージェント開発領域とは独立に RecSys 領域でも同型で現れた。ユーザー履歴・アイテムメタデータ・文脈を自然言語へ言語化しカタログ対応スコアリングヘッドでランキングするアーキテクチャと、prefill-onlyモードでのフルカタログ一括スコアリングにより、Phase-2ラベルを約40分の1(データ効率評価では10〜40分の1)しか使わずに成熟した本番ランカーと同等以上の性能を達成した。報酬重み付け損失による長期満足度・事業要件へのアラインメントは、完全なRLより単純かつコスト効率が高いと報告されている。 - 図表: 図 4 点を選択埋め込み(Figure 1 パイプライン概要・Figure 2 2フェーズ学習フレームワーク・Figure 3 オンライン指標(短期+0.115%/長期+0.006%、いずれも統計的有意)・Figure 5 コンテキスト長のエルボーポイント)。Table 1(Phase1/Phase2寄与度)はMarkdown表として転記。Figure 4(データスケーリング曲線)は本文記述で代替し埋め込み省略。 ## 2026-08-24 | Building Secure and Reliable Systems(Google Security / SRE 編、O'Reilly 2020、全 5 部 21 章 + Conclusion + Appendix) - Book entity: [[Building Secure and Reliable Systems]] — Google の Security 部門と SRE 部門の実務者およそ 150 名が共同執筆し、セキュリティと信頼性をシステムライフサイクル全体に組み込むべき第一級の設計要件として扱う書籍。全文がウェブで無償公開されている。 - Chapters: [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 1 The Intersection of Security and Reliability]] 〜 [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 21 Building a Culture of Security and Reliability]] + [[@2020__OReilly__Building Secure and Reliable Systems - Conclusion]] + [[@2020__OReilly__Building Secure and Reliable Systems - Appendix A Disaster Risk Assessment Matrix]](source 23 件、いずれも `publish: false`) - 新規 entity 23 件: [[ALTS]]・[[Adam Stubblefield]]・[[Ana Oprea]]・[[BeyondCorp]]・[[Binary Authorization]]・[[Building Secure and Reliable Systems]]・[[Certificate Transparency]]・[[ClusterFuzz]]・[[DiRT]]・[[Google App Engine]]・[[Google Chrome]]・[[Google Tool Proxy]]・[[Heather Adkins]]・[[NSO Group]]・[[OSS-Fuzz]]・[[Parisa Tabriz]]・[[Paul Blankinship]]・[[Project Shield]]・[[Testing on the Toilet]]・[[Tink]]・[[Tricorder]]・[[Zero Touch Prod]]・[[in-toto]] - 更新 entity 6 件: [[Borg]]・[[Google]]・[[Kubernetes]]・[[Mitre Corporation]]・[[OpenSSL]]・[[Piotr Lewandowski]] - 新規 concept 26 件: [[インシデント対応時の運用セキュリティ]]・[[セキュアコーディングフレームワーク]]・[[セキュリティと信頼性の文化]]・[[セキュリティの責任分担]]・[[セキュリティログの設計と保護]]・[[セーフプロキシ]]・[[ソフトウェアサプライチェーンセキュリティ]]・[[デバッグアクセスの設計]]・[[ファジング]]・[[ロールバックとバージョン単調性]]・[[信頼性とセキュリティの交差]]・[[内部者リスク]]・[[危機時の指揮系統]]・[[変化に追随する設計]]・[[多層防御]]・[[大規模な移行の遂行]]・[[影響範囲の制御]]・[[復旧のための設計]]・[[復旧計画の実行]]・[[最小権限設計]]・[[机上演習とレッドチーム演習]]・[[機能要件と非機能要件のトレードオフ]]・[[災害計画]]・[[理解容易性のための設計]]・[[自作のサービス妨害]]・[[静的解析の開発者ワークフロー統合]] - 更新 concept 40 件: [[CI-CDオブザーバビリティ]]・[[HSM APIセキュリティ]]・[[SREエンゲージメントモデル]]・[[SRE文化]]・[[インシデントシミュレーション]]・[[インシデントトリアージ]]・[[インシデント優先順位付け]]・[[インシデント対応成熟度モデル]]・[[インシデント管理]]・[[インシデント重大度評価]]・[[カオスエンジニアリング]]・[[サービス妨害攻撃とネットワークプロトコルの悪用]]・[[セキュリティにおけるインセンティブ不整合]]・[[セキュリティの持続可能性]]・[[セキュリティエンジニアリングチームの管理と組織的リスク]]・[[セキュリティカオスエンジニアリング]]・[[セキュリティ設計原則]]・[[セキュリティ評価制度]]・[[ゼロトラスト]]・[[ソフトウェア変更管理]]・[[ソフトウェア複雑性]]・[[データ保護]]・[[ブラスト半径]]・[[プロキシとエージェント]]・[[ヘルメティックビルド]]・[[ポストモーテム]]・[[レジリエンス]]・[[ログ生成]]・[[信頼計算基盤(TCB)]]・[[国家監視の歴史と法制度]]・[[封印と偽造防止印刷]]・[[技術的負債]]・[[敵対者の類型論]]・[[継続的デプロイ]]・[[脆弱性ライフサイクルと協調的な脆弱性開示]]・[[認可モデル]]・[[認証局とPKIの信頼モデル]]・[[軽量形式手法]]・[[運用セキュリティ(OPSEC)とトレードクラフト]]・[[過負荷制御]] - Key insight: 本書の中核は、信頼性とセキュリティがいずれも創発特性であり後付けできないという点と、両者が不可視性・評価困難性・ライフサイクル全体への関与という共通点を持ちながら**敵対者の有無**という一点で設計判断が分岐するという定式化にある(第 1 章)。この定式化が本書全体の構成を規定しており、設計(Part II)では最小権限・理解容易性・レジリエンス・復旧が、実装(Part III)では「人ではなく成果物を検証する」というサプライチェーンの転換が、運用(Part IV)ではインシデントを事前準備・危機の最中・事後の復旧という時間軸で 3 分割する構成が、それぞれ同じ分岐から導かれている。最終章(第 21 章)と Conclusion は、これらの技術的実践が意図的に設計された組織文化に支えられて初めて機能すると結ぶ。 - 図表: 図 39 点を全点埋め込み(除外なし)。原本がウェブ公開の HTML であり図が `images/bsrs_<章><番号>.png` として個別配布されているため、PDF からのクロップは不要で、オーケストレータが 1 パスで全点を取得・命名して配置した。 ### 実践SONiC入門(海老澤健太郎、技術評論社 2025、全 11 章 + Appendix)(2026-08-24 ingest-book) - Source: `.raw/books/jissen-sonic-nyumon-2025/`(全 11 章 + Appendix 1 / 入力: pdf / 369 ページ) - Book entity: [[実践SONiC入門]] - 新規 source 12 件: [[@2025__Gihyo__実践SONiC入門 - Chapter 1 ホワイトボックススイッチとSONiCアーキテクチャ]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 2 SONiCの機能とユースケース]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 3 コミュニティ運営と開発プロセス]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 4 商用版SONiCと有償サポート]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 5 SONiCの入手とインストール]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 6 SONiCの基本操作と設定方法]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 7 SONiCの内部構造:アーキテクチャとサブシステム]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 8 SONiCの内部構造:ステートの流れとモジュール連携]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 9 SAI詳細解説[API・オブジェクト・データプレーンパイプライン]]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 10 高度な設定と利用法]]・[[@2025__Gihyo__実践SONiC入門 - Chapter 11 SONiCのトラブルシューティング]]・[[@2025__Gihyo__実践SONiC入門 - Appendix 1 ソースコードからのビルド]] - 新規 entity 15 件: [[APRESIA Systems]]・[[Aviz Networks]]・[[FRRouting (FRR)]]・[[KDDI株式会社]]・[[ONIE (Open Network Install Environment)]]・[[Orange S.A]]・[[PINS (P4 Integrated Network Stack)]]・[[PalC Networks]]・[[SONiC Foundation]]・[[SONiC-DASH]]・[[SONiC-VPP]]・[[SONiC管理フレームワーク]]・[[Target]]・[[マクニカ]]・[[実践SONiC入門]] - 更新 entity 19 件: [[Alibaba Group]]・[[Arista Networks]]・[[Arrcus]]・[[Broadcom]]・[[Cisco]]・[[Dell Technologies]]・[[Google]]・[[Juniper Networks]]・[[LINE株式会社]]・[[Linux Foundation]]・[[Microsoft]]・[[NVIDIA]]・[[Open Compute Project]]・[[Open Network Linux (ONL)]]・[[Open Networking Foundation]]・[[SAI (Switch Abstraction Interface)]]・[[SONiC]]・[[eBay]]・[[海老澤健太郎]] - 新規 concept 6 件: [[SONiCのモジュール責務分離]]・[[データベースを介した疎結合なモジュール連携]]・[[ネットワーク機器のブートストラップとイメージ配布]]・[[パケット処理パイプラインのテーブル分割]]・[[ホワイトボックススイッチ]]・[[宣言的設定管理]] - 更新 concept 15 件: [[GitOps]]・[[SRv6]]・[[Watch(状態変更通知)]]・[[インメモリデータベース]]・[[オープンソースソフトウェア開発]]・[[コンテナオーケストレーション]]・[[コンテナ仮想化]]・[[デバッグアクセスの設計]]・[[ネットワークオペレーティングシステム]]・[[ネットワーク自動化]]・[[プログラマブルデータプレーン]]・[[ヘルメティックビルド]]・[[レイヤリング]]・[[ログ解析]]・[[抽象化(ソフトウェア設計)]] - Key insight: 本書が他の SONiC 資料と決定的に違うのは、内部構造の説明をソースコードとコミュニティのデザイン文書(HLD)まで降ろしている点にある。そこから 3 層の設計原則が読み取れる。(1) **命名規約が責務を語る** — `*orch` / `*syncd` / `*mgrd` というモジュール名の接尾辞がそのまま責務の分類になっており(第 7 章)、(2) **モジュール間通信は原則すべて Redis データベース経由で、例外は orchagent 内部の直接呼び出しだけ**という規律がその上に乗り(第 8 章)、(3) **同じ SAI API が orchagent では sairedis による疑似実装、syncd では vendor SAI への実リンクという二重実装になっている**(第 9 章)。この非対称性が「ASIC を触るのは syncd だけ」という単一の集約点を生み、第 11 章のトラブルシューティングが層ごとのログ(`swss.rec` / `sairedis.rec`)で切り分けられる根拠になっている。設定側でも同じ構図があり、CONFIG_DB を単一の情報源とする宣言的モデル(第 6 章)に対して、CLI 未実装の新機能は APPL_DB へ直接投入するバイパス経路が用意されている(第 10 章の SRv6)。 - 図表: 本文が参照する図 167 点のうち、コンソール出力の画面キャプチャを除いた概念図・アーキテクチャ図・フロー図 50 点を埋め込んだ。キャプションが図の**上**に置かれる組版のため、キャプションのフォント(ゴシック W5 7.8pt、本文は明朝 9.2pt)で判別し、下向きに空白帯(15pt)まで切り出す方式で全点を機械的に取得した。 ## 2026-08-24 | Floodless in SEATTLE: A Scalable Ethernet Architecture for Large Enterprises(Changhoon Kim・Matthew Caesar・Jennifer Rexford、SIGCOMM 2008) - Source: [[@2008__SIGCOMM__Floodless in SEATTLE - A Scalable Ethernet Architecture for Large Enterprises]] - 新規 entity 2 件: [[Changhoon Kim]]([[Princeton University]])・[[Matthew Caesar]]([[University of Illinois Urbana-Champaign]]) - 更新 entity 3 件: [[Jennifer Rexford]]・[[Princeton University]]・[[University of Illinois Urbana-Champaign]] - 新規 concept 1 件: [[一hopDHTによるEthernetスケーラビリティ]] — スイッチレベルリンクステート情報とコンシステントハッシングで構成する一hopネットワーク層DHTにより、フラットアドレッシングを維持したままEthernetブリッジングのフラッディング依存とスパニングツリー制約を排するSEATTLEの設計。識別子ベースルーティング(ROFL/UIP/VRR)との設計原理の違いを整理。 - 更新 concept 1 件: [[EVPN(Ethernet VPN)]](Ethernetスケーラビリティ問題への異なるアプローチとしてSEATTLEとの対比を追加) - Key insight: SEATTLE(2008)は「ハッシュを箇所解決にのみ使い、実際の転送は解決後の最短経路で行う」という設計分離により、識別子ベースルーティング(宛先識別子のハッシュそのものに基づき経路を決めるROFL/UIP/VRR)に対しストレッチを約1/5、パス安定性を3桁以上改善した。2000年代後半のEthernetスケーラビリティ問題への解として、後年主流化するEVPN/VXLAN(L2フレームのL3オーバーレイカプセル化+BGP制御プレーン)とは異なる、フラットアドレッシング+分散ハッシュディレクトリという設計系譜が存在したことを示す一次資料。 - 図表: 本文参照図表8点(Table含む9項目)を全点埋め込み。うち1点(Figure 8c、TCPシーケンス番号の時系列)はPDF埋め込みラスター画像、残り7点はベクター描画のためPyMuPDFでキャプション座標クロップして取得。 ## 2026-08-24 | Network Virtualization in Multi-tenant Datacenters(Teemu Koponen ほか、VMware/ICSI/UC Berkeley、NSDI 2014) - Source: [[@2014__NSDI__Network Virtualization in Multi-tenant Datacenters]] - 新規 entity 4 件: [[Teemu Koponen]]・[[Ben Pfaff]]・[[Onix]]・[[Network Virtualization Platform (NVP)]] - 更新 entity 4 件: [[Martin Casado]]・[[VMware]]・[[Scott Shenker]]・[[Open vSwitch (OVS)]] - 更新 concept 1 件: [[ネットワーク仮想化]](本論文自体を未読としていた未解決の問いを解消し、宣言的増分計算・二層コントローラクラスタという技術的詳細を追加) - Key insight: NVP は論理データパスを各ホストの [[Open vSwitch (OVS)|Open vSwitch]] にほぼ完全に実装し、宣言的言語 nlog(約1200 declaration・900テーブル)による増分状態計算と、論理コントローラ(O(N))/物理コントローラ(O(N^2)のノード別詳細化)の二層シャーディングによって、数万論理ポート規模のマルチテナントデータセンターをスケーラブルに管理する。論文自身が Discussion で認める限界(OpenFlow採用によるO(N^2)物理層スケーリング、非トランザクショナルな一時的状態不整合)は、後継の VMware NSX でホストパーバイザー内への物理コントローラ移動とトランザクショナル化として解消が図られた。 - 図表: 本文参照図表12点(Figure 1-12)+Table 1のうち、Figure 6(nlog宣言のコード例)はMarkdownコードブロックとして転記、残り11 Figure+Table 1はすべてPyMuPDFキャプション座標クロップで埋め込み(除外なし、全点ベクター描画で埋め込みラスター画像なし)。 ## 2026-08-24 | The eXpress Data Path: Fast Programmable Packet Processing in the Operating System Kernel(Høiland-Jørgensen・Brouer・Borkmann・Fastabend・Herbert・Ahern・Miller、CoNEXT '18) - Source: [[@2018__CoNEXT__The eXpress Data Path - Fast Programmable Packet Processing in the Operating System Kernel]] - 新規 entity 9 件: [[Toke Høiland-Jørgensen]]・[[Jesper Dangaard Brouer]]・[[Daniel Borkmann]]・[[John Fastabend]]・[[Tom Herbert]]・[[David Ahern]]・[[David Miller]]・[[Cilium]]・[[Katran]] - 更新 entity 7 件: [[Karlstad University]]・[[Red Hat]]・[[Cumulus Networks]]・[[DPDK]]・[[Cloudflare]]・[[Mellanox]]・[[TRex]] - 更新 concept 4 件: [[XDP]]([[@2026__KubeCon Japan Community Day__XDPerf - A High-Performance Traffic Generator Built with WASM and eBPF]] しか無かった developing 状態の concept に、XDP そのものの設計原論文を初めて追加)・[[eBPF]](verifier の2パスDAG検証アルゴリズム、BPF→eBPFのレジスタ拡張の具体的数値を追加)・[[BPF]](原論文とeBPF拡張を1本の論文内で対比できる一次資料を追加)・[[カーネルバイパスネットワーキング]](XDP対DPDKの2018年時点の定量的性能比較を追加) - Key insight: XDP(eXpress Data Path)論文は、DPDKのようなカーネルバイパスの「対極」のアプローチとして、性能に敏感なパケット処理操作をカーネルの中に移し、OSネットワーキングスタックが処理を始める前に実行する設計を提示する。単一コアで24 Mppsのパケットドロップ性能(DPDKの43.5 Mppsには届かないが、通常のLinuxスタックの5倍)を達成しつつ、カーネルのセキュリティ境界・管理ツール・API安定性を保持する。ソフトウェアルーティング(Linux比2.5〜3倍)・[[Katran]]ロードバランサ(IPVS比4.3倍)・[[Cloudflare]]のGatebotを模したDDoS緩和という3つの実世界ユースケースで実用性を実証した。本 wiki が2026年時点のXDPerf論文からのみ知っていたXDPの概念を、2018年の設計原論文まで遡って裏付けた。 - 図表: 本文参照図表9項目(Figure 1-7、Table 1-2)を全点取り込み(除外なし)。埋め込みラスター画像はACM Artifacts Evaluatedバッジ1点のみ(装飾のため除外)、Figure 1-7はすべてベクター描画のためPyMuPDFでキャプション座標クロップして取得、Table 1・2はMarkdown表として忠実に転記。 ## 2026-08-24 | The Design and Implementation of Open vSwitch(Ben Pfaff ほか、VMware/Awake Networks、USENIX NSDI '15 Best Paper) - Source: [[@2015__NSDI__The Design and Implementation of Open vSwitch]] - 新規 entity 12 件: [[Ben Pfaff]](筆頭著者)・[[Justin Pettit]]・[[Ethan Jackson]]・[[Andy Zhou]]・[[Jarno Rajahalme]]・[[Jesse Gross]]・[[Alex Wang]]・[[Joe Stringer]]・[[Pravin Shelar]](以上VMware)・[[Keith Amidon]]・[[Awake Networks]] - 更新 entity 5 件: [[Open vSwitch (OVS)]]・[[VMware]]・[[Martin Casado]]・[[OpenFlow]]・[[Teemu Koponen]] - 新規 concept 1 件: [[パケット分類]] — タプル空間探索分類器と、OVSが実装するタプル優先度ソート・ステージドルックアップ・プレフィックストラッキング・分類器パーティショニングという4つのキャッシュ意識最適化。 - 更新 concept 1 件: [[ソフトウェア定義ネットワーク]](OpenFlowの単純な制御モデルとOVS実装側の複雑さの対比という横断的知見を追加) - Key insight: OpenFlow コントローラから見た「マッチ/アクションによる単純なフローテーブル」というモデルは、OVS内部ではタプル優先度ソート・ステージドルックアップ・プレフィックストラッキング・分類器パーティショニングという4つの分類器最適化と、マイクロフロー/メガフローの2層キャッシュによって初めて高性能に実現されている。これら4最適化はいずれも正当性を犠牲にせず、生成されるメガフローをより一般化する(=キャッシュヒット率を高める)という一貫した設計原理を持ち、マイクロベンチマークではカーネルフロー数を1,051,884から15まで削減しながらスループットを3倍以上(37→117 ktps)改善した。実運用(Rackspace、1,000台超のハイパーバイザ、24時間)では全体キャッシュヒット率97.7%を達成している。同じ著者の一部(Pfaff・Koponen・Casado等)は前年のNVP論文(2014 NSDI)の共著者でもあり、NVPが依拠するOVSの内部設計を1年後に詳述する関係にある。 - 図表: 本文参照図表10項目(Figure 1-8、Table 1-2)を全点取り込み(除外なし)。Figure 1(アーキテクチャ図)・Figure 2/3(擬似コード)・Figure 4-8(実験結果グラフ)はいずれもベクター描画のためPyMuPDFでキャプション座標クロップして取得(埋め込みラスター画像はUSENIXページ装飾のみで図表としては利用不可)。Table 1・2はMarkdown表として忠実に転記。 ## 2026-08-24 | Assessing Container Network Interface Plugins: Functionality, Performance, and Scalability(Shixiong Qi・Sameer G. Kulkarni・K. K. Ramakrishnan、IEEE TNSM 2021) - Source: [[@2021__TNSM__Assessing Container Network Interface Plugins - Functionality, Performance, and Scalability]] - 新規 entity 4 件: [[Shixiong Qi]]・[[Sameer G. Kulkarni]]・[[K. K. Ramakrishnan]]・[[Indian Institute of Technology, Gandhinagar]] - 更新 entity 1 件: [[University of California, Riverside]] - 新規 concept 1 件: [[Container Network Interface (CNI)]] - 更新 concept 1 件: [[eBPF]](Cilium の eBPF datapath を CPP で定量化した知見を追加) - Key insight: Kubernetes CNI プラグイン(Flannel・Weave・Cilium・Calico 4 モード・Kube-router)を CPU サイクル/パケット(CPP)でカーネル内オーバーヘッド分解し、性能差の根本原因を特定した。intra-host では eBPF ベースの Cilium が iptables/Netfilter 処理を完全に迂回して最高性能を達成する一方、inter-host では native routing(underlay)が overlay より一貫して高性能で、NIC のトンネルオフロード対応可否が overlay CNI の実効性能を大きく左右する(IP-in-IP オフロード非対応環境でスループットが約4割低下)。ネットワークポリシーの粒度と Netfilter オーバーヘッドはトレードオフの関係にあり、Calico-wp-ipip は inter-host で全 CNI 中最大の 749 CPP に達する。 - 図表: 本文参照図表15点(Figure 1-15)+Table 3点全点を取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のため PyMuPDF キャプション座標クロップで全図を取得、Table 1-3 は Markdown 表として忠実に転記(テキスト抽出不可のベクター描画テーブルのため画像で内容を目視確認)。 ## 2026-08-24 | LeanとDevOpsの科学[Accelerate] テクノロジーの戦略的活用が組織変革を加速する(Nicole Forsgren・Jez Humble・Gene Kim、インプレス 2018) - Book entity: [[LeanとDevOpsの科学[Accelerate]]] - Source: `.raw/books/accelerate-lean-devops/`(前付「はじめに」+ 本編17章 + 付録A の 19 ページ / 入力: pdf) - Chapters: [[@2018__Impress__LeanとDevOpsの科学 - Introduction はじめに]]〜[[@2018__Impress__LeanとDevOpsの科学 - Appendix A 改善促進効果の高いケイパビリティ]](19 件) - 新規 entity 4 件: [[ING]]・[[Kripa Krishnan]]・[[LeanとDevOpsの科学[Accelerate]]]・[[Ron Westrum]] - 更新 entity 10 件: [[Gene Kim]]・[[Google]]・[[IBM]]・[[Jez Humble]]・[[Kevin Behr]]・[[Melvin Conway]]・[[Nicole Forsgren]]・[[Puppet]]・[[Steve Yegge]]・[[W. E. Deming]] - 新規 concept 13 件: [[IT業界における多様性]]・[[Westrumの組織文化類型]]・[[スクワッド・トライブ・チャプター]]・[[デプロイ関連の負荷]]・[[バーンアウト]]・[[リーンマネジメント]]・[[リーン製品開発]]・[[変革型リーダーシップ]]・[[従業員エンゲージメント]]・[[情報セキュリティのシフトレフト]]・[[潜在的構成概念の測定]]・[[疎結合のアーキテクチャ]]・[[継続的デリバリ]] - 更新 concept 18 件: [[DORA]]・[[SRE組織変革]]・[[イテレーションの長さ]]・[[オンコールストレス管理]]・[[クラスタリング]]・[[コンウェイの法則]]・[[ソフトウェア変更管理]]・[[バッチサイズ]]・[[フィードバック駆動開発]]・[[マイクロサービスアーキテクチャ]]・[[メンタルヘルスとインクルーシビティ]]・[[心理的安全性]]・[[教師データ収集手段の選択]]・[[研究方法論における妥当性概念]]・[[組織の信頼性マインドセット]]・[[統計的有意性]]・[[継続的デプロイ]]・[[開発者生産性]] - Key insight: **本書の中核は「何がデリバリ性能を高めるか」ではなく「その主張がどこまで言えるか」を自分で定義したことにある**。実務書でありながら第2部の4章を丸ごと調査設計・計量心理学・統計的推論に割き、相関と因果を区別し(第12章)、直接測れない対象を潜在的構成概念として数量化する検定手続きを開示し(第13章)、システムデータではなくアンケートを選んだ理由を5点挙げて論証し(第14章)、紹介による抽出(スノーボールサンプリング)という標本抽出の制約と、母集団を「DevOps用語に馴染みのある専門家・組織」へ絞ったトレードオフまで明示する(第15章)。第1部の各章が示す「予測関係」は、この留保とセットで初めて意味を持つ。もう1つの軸は**成熟度モデルの否定**で、到達段階で格付けするのではなく改善効果の高い24のケイパビリティを個別に測って伸ばす枠組みを取り(第1章・付録A)、その帰結として第16章は「ハイパフォーマンス文化は実装(模倣)できない」と結ぶ。第11章が「変革型リーダーシップの影響は技術とリーンのケイパビリティを介した**間接的**なものであり、リーダー単独ではハイパフォーマンスに届かない」と示すのも、同じ立場の現れである。 - 図表: 本文参照の図 27 点を全点取り込み(除外なし)。320 ページのため一括画像抽出は行わず、キャプションのフォント判別(`FutoGoB101Pr6-Bold` 単独 + 図番号パターン)で 28 点のキャプションを機械的に特定し、直上の未使用画像矩形との対応づけでオーケストレータが 1 パスでクロップした(付録B の図B.1 のみ範囲外のため除外)。図3.1・図16.2・図16.3 の 3 点はベクター描画のためキャプション座標クロップ、図A.1 は見開き 2 ページにまたがるため左右を結合して 1 枚にした。著作権コンテンツのため章 source ページは全て `publish: false`、図の埋め込みも `publish: false` を持つ source ページ内のみに限定している。 ## 2026-08-24 | InterconnectLens: Enhancing Observability of Data Transfers in GPU Clusters(Koshi Eguchi・Ryo Nakamura・Yohei Kuga・Kenjiro Taura、東京大学/トヨタ自動車/NII LLMC、PEARC '25) - Source: [[@2025__PEARC__InterconnectLens - Enhancing Observability of Data Transfers in GPU Clusters]] - 新規 entity 7 件: [[Koshi Eguchi]]・[[Ryo Nakamura]]・[[Yohei Kuga]]・[[Kenjiro Taura]]・[[Toyota Motor Corporation]]・[[NII LLMC]]・[[InterconnectLens]] - 更新 entity 4 件: [[Prometheus]]・[[NVIDIA Data Center GPU Manager]]・[[University of Tokyo]]・[[NCCL]] - 更新 concept 2 件: [[RDMAネットワーク監視]]・[[GPU観測性]] - Key insight: GPUDirect RDMAはCPU・ホストメモリをバイパスして通信を高速化する一方、GPU-to-GPU通信路がCPU・GPU・Root Complex・RNICの複数コンポーネントを経由するため、NICメトリクス単体では性能劣化の原因を特定できない。ICLensはdcgm-exporter・拡張版Intel pcm・procfsベースRNIC Exporterという異ベンダーのExporterをPrometheusへ統合し、コンポーネント別・TX/RX方向別の帯域を単一ダッシュボードに並置することで、TCP誤用(RNIC不活性+CPU負荷増)とGPUDirect RDMA誤設定(RNIC活性+CPU PCIe/Memory負荷増)というRNIC単体では区別できない2つの問題を切り分けられることを示した。既存のRDMA監視系(Hawkeye・C4・R-Pingmesh等)がいずれも自動異常検知を志向するのに対し、ICLensは自動化を持たず「人間がグラフを目視比較する」運用可視化に徹する点が対照的。 - 図表: 本文参照図表9点(Figure 1〜5、全サブ図)を全点埋め込み(除外なし)。埋め込みラスター画像0点(全図がベクター/スクリーンショット描画)のため PyMuPDF キャプション座標クロップで全図を取得。 ## 2026-08-25 | Understanding PCIe performance for end host networking(Rolf Neugebauer・Gianni Antichi・José Fernando Zazo・Yury Audzevich・Sergio López-Buedo・Andrew W. Moore、SIGCOMM '18) - Source: [[@2018__SIGCOMM__Understanding PCIe performance for end host networking]] - 新規 entity 4 件: [[Rolf Neugebauer]]・[[Andrew W. Moore]]・[[Netronome]]・[[NetFPGA]] - 更新 entity 1 件: [[Gianni Antichi]] - 新規 concept 1 件: [[PCIe性能]] - Key insight: PCIe Gen 3 x8は物理層で62.96Gb/sの帯域を持つが、DLL/TLPヘッダオーバーヘッドとMPS/MRRS制約により実効帯域は約50Gb/s以下に低下し、ExaNIC実測では128Bパケットの往復レイテンシの90.6%・1500Bでも77.2%をPCIe自体が占める。さらにホスト側のIOMMU(ワーキングセットがIO-TLBサイズ超過で64B DMA読み出しスループット最大70%低下)・NUMA(リモート64B読み出しでローカル比約20%低下+約100nsのレイテンシ増)・DDIO(キャッシュ常駐データへのアクセスが約70ns高速)という3つの技術が、PCIe単体のプロトコルオーバーヘッドに輪をかけてエンドホストネットワーキング性能を左右する。同世代のXeon E5とE3でPCIeレイテンシ分布が劇的に異なる(E3の99.9パーセンタイルが中央値の10倍近い)という、単一ベンダー内でも実装差が大きいことを示す知見も注目に値する。 - 図表: 本文参照図表9点(Figure 1-9)+Table 2点全点を取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のため PyMuPDF キャプション座標クロップで全図を取得、Table 1・2 は Markdown 表として転記。 ## 2026-08-25 | A PCIe Congestion-Aware Performance Model for Densely Populated Accelerator Servers(Maxime Martinasso・Grzegorz Kwasniewski・Sadaf R. Alam・Thomas C. Schulthess・Torsten Hoefler、ETH Zurich/CSCS/Oak Ridge National Laboratory、SC16) - Source: [[@2016__SC__A PCIe Congestion-Aware Performance Model for Densely Populated Accelerator Servers]] - 新規 entity 1 件: [[Maxime Martinasso]] - 更新 entity 1 件: [[Torsten Hoefler]] - 更新 concept 1 件: [[PCIe性能]] - Key insight: GPU間のPCIe P2P通信は、単一のマイクロベンチマーク値では予測できないほど動的に帯域が変動する。ポートアービトレーション(上流:均等配分、下流:重み付きラウンドロビン)とHead-Of-Line(HOL)ブロッキングを4段階アルゴリズムでモデル化し、8GPU構成2トポロジ(約19万通信)で97%以上を誤差±15%以内に予測した。ルートコンプレックスを通過する通信は小さいパケットサイズを強いられ理論帯域効率が76%に低下するという特殊な帯域損失特性も定量化しており、これは既存concept [[PCIe性能]] が集約する単一フローのMPS/DDIO/IOMMUオーバーヘッド系知見とは異なる、複数フロー間の輻輳系ボトルネックとして位置づけられる。COSMO気象予報モデルのhalo exchange通信パターンに適用し、通信順序の選び方だけで2Dで最大1.9倍・3Dで最大2.57倍の性能差が生じることを実証した。 - 図表: 本文参照図表11点(Figure 1-11)+Table 2点全点を取り込み(除外なし)。埋め込みラスター画像2点(Figure 6のT1・T2プロット)以外はすべてベクター描画のため PyMuPDF キャプション座標クロップで取得、Table I・II は Markdown 表として転記。 ## 2026-08-25 | Understanding and Profiling CXL.mem Using PathFinder(Xiao Li・Zerui Guo・Yuebin Bai・Mahesh Ketkar・Hugh Wilkinson・Ming Liu、University of Wisconsin-Madison/Beihang University/Intel、ACM SIGCOMM '25) - Source: [[@2025__SIGCOMM__Understanding and Profiling CXL.mem Using PathFinder]] - 新規 entity 7 件: [[Xiao Li]]・[[Zerui Guo]]・[[Yuebin Bai]]・[[Mahesh Ketkar]]・[[Hugh Wilkinson]]・[[Ming Liu]]・[[University of Wisconsin-Madison]] - 更新 entity 2 件: [[Intel]]・[[Beihang University]] - 新規 concept 1 件: [[CXL.memプロトコル実行プロファイリング]] - 更新 concept 1 件: [[CXLによるメモリ拡張]] - Key insight: サーバプロセッサとそのチップセットを多段Closネットワークとみなし、traceroute・reverse traceroute・delay-based queueing analysis(Little's Law)というネットワーク領域の解析技術をホスト内部のPMUベースマイクロアーキテクチャ解析へ転用するという方法論的橋渡しにより、232種のPMUカウンタでCXL.memの4データパス(DRd・DWr→RFO・RFO・HW/SW PF)をエンドツーエンドに追跡できることを示した。back-propagationアルゴリズム(PFEstimator)は、CXL起因のパイプラインストール(平均2.1〜2.7倍増加)がアンコアからコアへ向かって階層キャッシュにより漸減する現象を定量化でき、既存の粗い按分手法より正確にボトルネックを特定する。7ケーススタディでTPP/Colloidとの組み合わせによる実運用最適化(GUPSスループット1.1倍)も実証し、オーバーヘッドは1.3% CPU/38MBメモリと軽量。 - 図表: 本文参照図表16点(Figure 1-16)のうち主要ケーススタディに対応するFigure 1-13を全点PyMuPDFキャプション座標クロップで埋め込み(除外なし)。Figure 14-16(付録、EMRサーバでの再現性検証。数値知見は本文に既記載)とTable 1-6(PMUカウンタ列挙・ベンチマーク構成の大規模参照表)は除外、Table 7はCase 1の分析で本文中に具体的数値を引用する形で記述。埋め込みラスター画像3点(いずれもページ装飾用の空白アイコン)のため図表としては利用不可、全図をPyMuPDFキャプション座標クロップで取得。 ## 2026-08-25 | Understanding the Host Network(Midhul Vuppalapati・Saksham Agarwal・Henry N. Schuh・Baris Kasikci・Arvind Krishnamurthy・Rachit Agarwal、Cornell University/University of Washington、ACM SIGCOMM '24) - Source: [[@2024__SIGCOMM__Understanding the Host Network]] - 新規 entity 3 件: [[Midhul Vuppalapati]]・[[Saksham Agarwal]]・[[Henry N. Schuh]] - 更新 entity 5 件: [[Baris Kasikci]]・[[Arvind Krishnamurthy]]・[[Rachit Agarwal]]・[[Cornell University]]・[[University of Washington]] - 新規 concept 1 件: [[ドメイン別クレジットベースフロー制御]] - 更新 concept 1 件: [[ホスト内ネットワークボトルネック]] - Key insight: ホストネットワーク(プロセッサ・メモリ・周辺機器インターコネクト)内の競合を、ドメインごとのクレジットベースフロー制御という単一の概念的抽象化で説明する研究。既存研究(Google/Alibaba Pangu/Hostping等)が報告してきた「メモリ帯域飽和時にP2MがC2Mを圧迫する」現象(赤レジーム)を再現・説明するだけでなく、メモリ帯域が未飽和の段階でC2Mのみが劣化しP2Mが無傷という逆方向の新規現象(青レジーム)を発見した。Intel uncore performance countersで各ドメイン(C2M-Read/C2M-Write/P2M-Read/P2M-Write)のクレジット数・無負荷時レイテンシをリバースエンジニアリングし、MCでの行ミス・バンク負荷不均衡・CHA/MCからのバックプレッシャーという具体的機構で両レジームを説明した上、誤差10%以内の解析式で定量的に検証した。全観測結果はネットワーク越しの転送を介さない単一ホスト内実験でも再現され、影響範囲がネットワークアプリケーションという文脈を超えることを示す。 - 図表: 本文参照図表14項目(Figure 1-12、Table 1-2)を全点取り込み(除外なし)。埋め込みラスター画像0点(全図・全表がベクター描画)のためPyMuPDFでキャプション座標クロップして取得。 ## 2026-08-25 | Host Congestion Control(Saksham Agarwal・Arvind Krishnamurthy・Rachit Agarwal、Cornell University/Google/University of Washington、ACM SIGCOMM '23) - Source: [[@2023__SIGCOMM__Host Congestion Control]] - 新規 entity: なし(著者3名・所属3組織はすべて既存ページ) - 更新 entity 6 件: [[Saksham Agarwal]]・[[Arvind Krishnamurthy]]・[[Rachit Agarwal]]・[[Cornell University]]・[[Google]]・[[University of Washington]] - 新規 concept 1 件: [[ホスト輻輳制御]] - 更新 concept 2 件: [[データセンター輻輳制御]]・[[ホストネットワークスタック性能]] - Key insight: 高帯域アクセスリンクの普及とホスト内資源(CPU・キャッシュ・メモリ帯域)の技術トレンド停滞のギャップから「ホスト輻輳」が顕在化し、輻輳点(メモリコントローラ)ではなく輻輳点から離れたNICバッファでキューイング・ドロップが起きるという、古典的輻輳制御の前提(パケットドロップは輻輳点で発生する)を覆す現象を実測で特定した。hostCCはIIOバッファ占有量というサブマイクロ秒粒度のホスト輻輳シグナルを導入し、サブRTT粒度のホストローカル応答(ホスト資源配分)とRTT粒度のネットワーク資源配分(既存プロトコルへのシグナルエコー)を組み合わせることで、DCTCPを無改変のまま統合する。3倍のホスト輻輳下でパケットドロップ率を桁違いに削減しつつ目標帯域をほぼ達成し、128B RPCで13µsという最小限のテールレイテンシ劣化に抑えた。同一著者グループが翌年発表した[[@2024__SIGCOMM__Understanding the Host Network]]は、hostCCが対象とする「輻輳の検知と制御」を補完する「輻輳の理解」を深化させる関係にある。 - 図表: 本文参照図表19点(Figure 1-19、全サブ図含む)を全点取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のためPyMuPDFキャプション座標クロップで全図を取得。 ## 2026-08-25 | MemAxes: Visualization and Analytics for Characterizing Complex Memory Performance Behaviors(Alfredo Giménez ほか、UC Davis/Lawrence Livermore National Laboratory/Linnaeus University、IEEE TVCG Vol.24 No.7, 2018) - Source: [[@2018__TVCG__MemAxes - Visualization and Analytics for Characterizing Complex Memory Performance Behaviors]] - 新規 entity 10 件: [[Alfredo Giménez]]・[[Todd Gamblin]]・[[Ilir Jusufi]]・[[Abhinav Bhatele]]・[[Martin Schulz]]・[[Peer-Timo Bremer]]・[[Bernd Hamann]]・[[LULESH]]・[[XSBench]]・[[Linnaeus University]] - 更新 entity 3 件: [[Lawrence Livermore National Laboratory]]・[[University of California, Davis]]・[[hwloc]] - 新規 concept: なし - 更新 concept 2 件: [[性能データの可視化]]・[[ハードウェアトポロジ抽象化]] - Key insight: サンプリングされたメモリアクセスデータを、ソースコード/データオブジェクト・ハードウェアトポロジ・全属性の並行ヒストグラムという3つの連携ビューでリンクし、hwloc/likwidが用いる水平icicle plotの視覚的スケーラビリティの欠点を解消する放射状(sunburst型)トポロジ可視化を新規提案した。平均アクセスレイテンシ・負荷不均衡という2種のスコアリング指標に基づく制約付き凝集型クラスタリング(隣接ウィンドウのみ比較しO(kw log w)に抑える)により、専門知識の少ない利用者でも興味深いデータ部分集合を発見できるガイド付きインタラクションを実現した。LULESHの事例研究では、放射状トポロジ可視化とクラスタリングで両ソケットにまたがるz-index方向のデータ分割非効率を発見・修正し、メモリアクセスサイクルを60%、総実行時間を10%削減した。XSBenchの事例研究では、時間属性とNUMA・L2不均衡指標の相関分析により、非決定的アルゴリズムの3実行フェーズ(低コスト初期化・L1に収まらないソート・NUMAアクセスを伴う並列処理)を発見した。 - 図表: 本文参照図表14点(Figure 1-13、うちFig.11はa/bの2枚)を全点埋め込み(除外なし)。Figure 1(仮想的なメモリアクセスデータの表・コード・グリッド図)のみベクター描画のためPyMuPDFキャプション座標クロップで取得、他13点は埋め込みラスター画像をそのまま利用。 ## 2026-08-25 | Understanding and Profiling the Accelerator Chiplet Network Using PingPoint(Junyeol Ryu・Ming Liu・Matthew D. Sinclair、University of Wisconsin-Madison、ACM SIGCOMM '26) - Source: [[@2026__SIGCOMM__Understanding and Profiling the Accelerator Chiplet Network Using PingPoint]] - 新規 entity 3 件: [[Junyeol Ryu]]・[[Matthew D. Sinclair]]・[[PingPoint]] - 更新 entity 3 件: [[Ming Liu]]・[[University of Wisconsin-Madison]]・[[AMD]] - 更新 concept 2 件: [[チップレット]]・[[GPU観測性]] - Key insight: チップレット型アクセラレータ内部でcompute chiplet・IO chiplet・memory moduleを接続するオンパッケージネットワークを「Accelerator Chiplet Network(ACN)」と命名し、既存ツールがこれを見過ごし性能劣化をコンピュート/メモリに誤帰属させてきたことをAMD MI300X/MI350Xの実測で示した。ACNのCOM-IO(traffic-agnostic spraying)・IO-IO(deterministic routingと深いバッファ)・IO-MEM(address-directed traffic-oblivious backpressure)の3リンク種はそれぞれ全く異なる輻輳挙動を持ち、単一のキューイングモデルでは表現できない。これに基づきhoseモデル+専用キューイング抽象(Central-FCFS/Split-FCFS/Central-PS)でACNを論理グラフ化し、target kernelとpingマイクロベンチマークを1つのfused kernelへ融合してDifferential Congestion Attribution(DCA)でリンク単位に輻輳を帰属する軽量プロファイラPingPointを構築した。空間分離したカーネル間でもACN経由で6倍を超える遅延干渉が生じることを実測し(Case #3)、CU/SM占有率ベースの資源分離だけでは干渉を防げないことを示した。同一著者(Ming Liu)によるPathFinder(SIGCOMM'25、CXL.mem対象)の系譜に連なる。 - 図表: 本文参照図表16点(Figure 1-16)全点をPyMuPDFキャプション座標クロップで埋め込み(全図がベクター描画のため埋め込みラスター画像は利用不可、除外なし)。Table 1・2・4・5・6はMarkdown表として転記(Table 2はPDF抽出時のレイアウト崩れを本文記述と整合させて再構成、注記あり)。 ## 2026-08-25 | Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines(Stéphanie Moreaud・Brice Goglin、Inria/LaBRI/Université Bordeaux 1、PDCS 2007) - Source: [[@2007__PDCS__Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines]] - 新規 entity 3 件: [[Stéphanie Moreaud]]・[[Brice Goglin]]・[[LaBRI]] - 更新 entity 1 件: [[hwloc]](Brice Goglinの2007年の先行研究として、hwlocの設計思想の背景に追記) - 更新 concept 3 件: [[NUMAメモリ配置]]・[[NUMA対応CPUピニング]]・[[ホストネットワークスタック性能]] - Key insight: AMD OPTERON/HYPERTRANSPORTアーキテクチャでのNUMA配置が高速ネットワーク通信性能に与える影響を、レイテンシとスループットの両面から定量化した。レイテンシへの影響はHYPERTRANSPORTホップあたり約40nsと小さいが、DMA/RDMA書き込みの帯域幅は最大40%低下し、しかもこの効果は書き込み先バッファの配置のみに依存し送信側の配置は無関係という非対称性を持つことを発見した。LINUXカーネルへのNUMAトポロジ公開パッチと、NEWMADELEINEミドルウェアへの自動配置実装により、手動でのNUMA配置と同等の通信性能をポータブルに達成した。著者Brice Goglinは3年後のhwloc論文(2010年)の共著者でもあり、本論文で得た個別ミドルウェアへのNUMA情報統合の経験が、hwlocの汎用トポロジ抽象化という設計思想の先行研究になっている。 - 図表: 本文参照図表5点(Figure 1-5)全点をPyMuPDFキャプション座標クロップで埋め込み(全図がベクター描画のため埋め込みラスター画像は利用不可、除外なし)。Table 1・2はMarkdown表として転記。 ## 2026-08-25 | LIKWID: A Lightweight Performance-Oriented Tool Suite for x86 Multicore Environments(Jan Treibig・Georg Hager・Gerhard Wellein、Erlangen Regional Computing Center (RRZE)/FAU Erlangen-Nürnberg、ICPPW 2010) - Source: [[@2010__ICPPW__LIKWID : A Lightweight Performance-Oriented Tool Suite for x86 Multicore Environments]] - 新規 entity 5 件: [[LIKWID]]・[[PAPI]]・[[Jan Treibig]]・[[Georg Hager]]・[[Gerhard Wellein]] - 更新 entity 1 件: [[Friedrich-Alexander-Universität Erlangen-Nürnberg]](Erlangen Regional Computing Center (RRZE) でのLIKWID開発を追記) - 更新 concept 3 件: [[ハードウェアカウンタ]]・[[NUMA対応CPUピニング]]・[[ハードウェアトポロジ抽象化]] - Key insight: x86マルチコア環境向けの軽量なコマンドラインツール群LIKWIDの論文。スレッド・キャッシュトポロジ探索(likwid-topology)・スレッド-コアアフィニティ強制(likwid-pin)・性能カウンタ計測(likwid-perfCtr)・ハードウェアプリフェッチャ切替(likwid-features)の4ツールから成り、カーネルパッチ不要でPAPIより単純なインストールを実現する一方x86系Linuxに対応を限定する。OpenMP STREAM triadベンチマークでlikwid-pinによる明示的ピニングが性能分散を大幅に低減することを示し、共有キャッシュ活用型3D Jacobiステンシルでは誤ったピニングが最適化効果を反転させ性能を半減させることを実測した。event countを厳密にcore-baseで定義する設計は、限られたPMC資源をどう単純明快に運用するかという問題への一貫した解法をハードウェアカウンタ計測の草創期から示している。 - 図表: 本文参照図表11点(Figure 1-11全点)をPyMuPDFキャプション座標クロップで埋め込み(全図がベクター描画のため埋め込みラスター画像は利用不可、除外なし)。Table I・IIはMarkdown表として転記。 ## 2026-08-25 | Thread and Memory Placement on NUMA Systems: Asymmetry Matters(Baptiste Lepers・Vivien Quéma・Alexandra Fedorova、Simon Fraser University/Grenoble INP、USENIX ATC '15 Best Paper) - Source: [[@2015__ATC__Thread and Memory Placement on NUMA Systems - Asymmetry Matters]] - 新規 entity 4 件: [[Baptiste Lepers]]・[[Vivien Quéma]]・[[Simon Fraser University]]・[[Grenoble INP]] - 更新 entity 2 件: [[Alexandra Fedorova]]・[[AMD]] - 新規 concept 1 件: [[非対称NUMAインターコネクト]] - 更新 concept 1 件: [[NUMAメモリ配置]] - Key insight: 8ノードのAMD Bulldozer機(HyperTransport 3.0)を対象に、リンク幅・方向性(単方向を含む)・共有関係のいずれにおいても非対称なNUMAインターコネクトが性能に与える影響を定量化した、USENIX ATC '15 Best Paper受賞論文。スレッドとメモリの分散が同一でも、割り当てるノードの組み合わせだけで性能が最大237%(facerec)変動することを実測し、最良の接続性はホップ数最小ではなく総帯域幅最大で決まるという反直感的な知見を確立した。この知見に基づき、ハードウェアカウンタで通信量を継続測定し、帯域幅を最大化するスレッドクラスタ配置を動的に決定するアルゴリズムAsymSchedを設計・実装。ロックフリーかつ複数ノード間並列移行に対応した独自の高速メモリマイグレーションシステムコール(標準Linuxシステムコール比最大34倍高速)と、配置候補の67〜99%を省略する2段階ヒューリスティックにより実用的なオーバーヘッド(最大3%)で運用する。単一・複数アプリケーション双方のワークロードで、静的な最良配置と同等以上の性能をランダム配置比最大218%改善しつつ達成した。同種のHyperTransport非対称性を2007年に2ソケット機で先に定量化した[[@2007__PDCS__Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines]](Moreaud & Goglin)と、「非対称性は帯域幅で捉えるべき」という結論で世代・スケールを超えて一致する。 - 図表: 本文参照図表7点(Figure 1-7)+表5点(Table 1-5)を全点取り込み(除外なし)。埋め込みラスター画像2点はUSENIX表紙装飾のため図表として不使用、全図がベクター描画のためPyMuPDFキャプション座標クロップで取得。Table 1は接続トポロジ図を含む複合表のため画像埋め込み、Table 2〜5は単純な数値表のためMarkdown表に転記。 ## 2026-08-25 | Evaluating Modern GPU Interconnect: PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect(Ang Li ほか、Pacific Northwest National Laboratory/Oak Ridge National Laboratory/College of William and Mary、IEEE TPDS 2020) - Source: [[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]] - 新規 entity 9 件: [[Ang Li (PNNL)]]・[[Shuaiwen Leon Song (PNNL)]]・[[Jieyang Chen]]・[[Jiajia Li]]・[[Xu Liu (William and Mary)]]・[[Nathan R. Tallent]]・[[Kevin J. Barker]]・[[Pacific Northwest National Laboratory]]・[[College of William and Mary]](Ang Li・Shuaiwen Leon Song・Xu Liuは既存の同姓同名 entity と別人物のため `(PNNL)`/`(William and Mary)` で区別) - 更新 entity 4 件: [[Oak Ridge National Laboratory]]・[[Summit]]・[[Rice University]]・[[NCCL]] - 更新 concept 3 件: [[NVLink]]・[[PCIe性能]]・[[集合通信]] - Key insight: PCIe・NVLink-V1・NVLink-V2・NV-SLI・NVSwitch・GPUDirect-RDMAの6種のGPUインターコネクトを6プラットフォーム横断で評価し、位置・接続性・ルーティングに起因するNVLinkのNUMA効果3種と、PCIeチップセット設計に起因する新規NUMA効果「anti-locality」(近傍アクセスが遠隔アクセスより低性能)を実測で同定した2019年時点の基礎的研究。NCCLのリング構成がインターコネクトのトポロジ形状(PCIe木構造 vs NVLinkハイパーキューブメッシュ)にそのまま従属し、集団通信帯域のGPU数依存性が正反対になることを実証。GPUDirect-RDMAの相対性能がSummitDev→Summit世代で逆転(劣位→常に最良)する知見も報告した。もっとも著しい知見は、マイクロベンチマークで確認したNVLinkの通信効率向上が、CPU中心master-slaveプログラミングモデルの制約下では実アプリケーション全体の性能にほとんど反映されないというギャップであり、後年のGPU中心プログラミングモデル(NVSHMEM等)・メガカーネル(Mixture-of-Kittens等)への移行を動機づける先行観察になっている。 - 図表: 本文参照図表39点(Figure 1〜39、全サブ図含む)を全点取り込み(除外なし)。埋め込みラスター画像2点(著者近影・PDF装飾のためのみ判明、図表としては不使用)のため、全図をPyMuPDFキャプション座標クロップで取得。Table 1〜3はMarkdown表として転記。 ## 2026-08-25 | Classifying Host-Side RDMA Pingmesh Results to Efficiently Identify Transport Faults in Data Centers(Songhao Ding・Boyang Zhou・Yuhua Zheng、Zhejiang Lab/Hangzhou Institute for Advanced Study UCAS、IEEE ICPADS 2025) - Source: [[@2025__ICPADS__Classifying Host-Side RDMA Pingmesh Results to Efficiently Identify Transport Faults in Data Centers]] - 新規 entity 3 件: [[Songhao Ding]]・[[Boyang Zhou]]・[[Yuhua Zheng]] - 更新 entity 3 件: [[Zhejiang Lab]]・[[Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences]]・[[R-Pingmesh]] - 更新 concept 2 件: [[RDMAネットワーク監視]]・[[不均衡障害分類]] - Key insight: [[R-Pingmesh]] が収集するホスト側の遅延・帯域・パケットロス時系列を入力に、事前学習+SFT(教師ありファインチューニング)の二段階LSTM分類器RTFDでRDMAトランスポート障害を分類・障害セグメント単位まで局所化する手法を提案。既存のRDMA監視系がいずれも「異常の検知・可視化」を担うのに対し、RTFDはR-Pingmeshの後段に接続し「検知後の分類・局所化の自動化」という直交する軸を加える。SimAI上の3種DCNトポロジで平均分類精度0.92・平均AUC0.93、まれ障害でもrecall 0.890/F1 0.882を報告。マイクロサービス障害分類のSLIM(学習目標の直接最適化)とは異なり、ドメイン間の転移学習(事前学習→SFT)でレアイベント・データ不均衡問題に対処する系統として位置づけられる。 - 図表: 本文参照図表5点(Figure 1〜5)全点を埋め込み(除外なし)。埋め込みラスター画像5点がFigure 1〜5と1対1で対応することを目視確認して対応づけた。ベクター描画のみの図はなくPyMuPDFクロップは不要だった。 - 出典検査: 本文中に3件の数値的不整合を確認し、source ページ本文に注記のうえ報告した。(1) 特徴ベクトルの次元数: Algorithm 1は10次元(9統計量+λ,μ,ρ,L)、III-B節本文は9統計量に加えてλ,μ,ρのみを加えた12次元(かつRB,RL,RWという別変数を含む)と、疑似コードと本文で次元数・変数構成が食い違う。(2) Pkt Drop(まれ障害)のrecall: 本文は「recall 0.890」と記述するが、Figure 4のグラフ上の表示値は0.900。(3) デュアルプレーン分離トポロジでの鍵指標最小値: Abstractは「minimum value of 0.84」、Section VI(結論)は「above 0.838」、Section IV-B(評価本文)は「maintained at 0.893」と、同じ主張について3箇所で異なる数値を挙げている。いずれも原文ママで転記し、創作による解消はしていない。 ## 2026-08-25 | Rethinking Intra-host Congestion Control in RDMA Networks(Zirui Wan・Jiao Zhang・Yuxiang Wang・Kefei Liu・Haoyu Pan・Tao Huang、BUPT / China Mobile (Suzhou) Software Technology / Purple Mountain Laboratories、APNet 2024) - Source: [[@2024__APNet__Rethinking Intra-host Congestion Control in RDMA Networks]] - 新規 entity 4 件: [[Zirui Wan]]・[[Yuxiang Wang]]・[[Haoyu Pan]]・[[China Mobile (Suzhou) Software Technology]] - 更新 entity 5 件: [[Jiao Zhang]]・[[Kefei Liu]]・[[Tao Huang]]・[[BUPT]]・[[Purple Mountain Laboratories]] - 更新 concept 4 件: [[ホスト輻輳制御]]・[[ホスト内ネットワークボトルネック]]・[[データセンター輻輳制御]]・[[RDMA]] - Key insight: RNIC線速(25Gbps→200Gbps)の急伸とホスト内資源(PCIe帯域63Gbps→256Gbps、メモリ帯域)の相対的停滞のギャップから生じる「ホスト内輻輳」がRDMAネットワーク性能を大きく損なうことを自前のテストベッド実測(3倍輻輳下でPFC有効/PFC-free環境それぞれスループット62%/68%低下、レイテンシ2.4倍/2.6倍増加)で確認し、対処するRHCC(RDMA intra-Host Congestion Control)を提案する論文。同じ著者グループの前年発表[[@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers]]が「ホスト内ボトルネックの診断」を扱ったのに対し、本論文は「能動的な制御」へ研究テーマを展開している。[[@2023__SIGCOMM__Host Congestion Control]](hostCC、TCP向け)のIIOバッファ占有量シグナル・Intel MBAによるホスト内資源配分をRDMAへ転用しつつ、RDMA受信側カーネルモジュールがデータパケットを直接改変できない制約(hostCCのECNマーキング方式が展開不能な理由)に対し、商用RNIC(Mellanox ConnectX-6 DX)が持つProgrammable Congestion Control(PCC)のプローブ機構で受信処理遅延を測定するという代替解を導入した新規性を持つ。送信レートを$R_{trans}=\min(R_{rev}, R_{cc})$としてホスト間輻輳制御(DCQCN)と統合する設計により、既存プロトコルを変更せずRNICトラフィック間のmax-min公平性を実現する。2台のDell R740サーバに実装し、3倍のホスト内輻輳下でPCIeスタール書き込み要求を80〜97%削減、PFC一時停止時間を最大64%削減、ネットワークスループット/レイテンシを最大2倍/1.4倍改善した。 - 図表: 本文参照図表6点(Figure 1-6、全サブ図含む)を全点取り込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のためPyMuPDFキャプション座標クロップで全図を取得。 ## 2026-08-25 | Diagnosing End-Host Network Bottlenecks in RDMA Servers(Kefei Liu・Jiao Zhang・Zhuo Jiang・Haoran Wei・Xiaolong Zhong・Lizhuang Tan・Tian Pan・Tao Huang、BUPT/Douyin Vision Company Ltd./Purple Mountain Laboratories/Qilu University of Technology、IEEE/ACM Transactions on Networking 2024) - Source: [[@2024__TON__Diagnosing End-Host Network Bottlenecks in RDMA Servers]] — 同著者グループによる Hostping の拡張ジャーナル版。NSDI '23 版のループバックテスト(ホスト内帯域劣化・レイテンシ増加の診断)に加え、同一ホスト上の RNIC 同士が相互にプローブし合う RNIC-to-RNIC(R2R)probing を新規導入し、RNIC 自体の接続性問題(ルーティング誤設定・フラッピング・誤配線)を第3の症状カテゴリとして診断できるようにした。binary network tomography に基づくリンク状態推論を Algorithm 1 として定式化。数千台の本番展開で計8件の新規問題を報告し、うち#14(誤ったスイッチポート配線)・#16(RNICの頻繁なビット誤り)はR2R probingで初めて発見できた、NSDI版にない新規知見。 - 新規 entity 0 件(全著者・所属機関が既存の NSDI '23 版 ingest 時に作成済み) - 更新 entity 12 件: [[Kefei Liu]]・[[Jiao Zhang]]・[[Zhuo Jiang]]・[[Haoran Wei]]・[[Xiaolong Zhong]]・[[Lizhuang Tan]](所属がByteDanceからQilu University of TechnologyへNSDI版から変化したことを明記)・[[Tian Pan]]・[[Tao Huang]]・[[BUPT]]・[[ByteDance]]・[[Douyin Vision]]・[[Purple Mountain Laboratories]] - 更新 concept 3 件: [[ホスト内ネットワークボトルネック]](R2R probingによる「接続性問題」という第3の症状カテゴリ、Algorithm1の疑似コード化を追加)・[[RDMAネットワーク監視]](Hostpingのbinary tomography投票とR-Pingmeshの投票機構が独立に収斂している点、R2R probingとR-Pingmeshのプローブ機構の機能的類似を追加)・[[PCIe性能]](Hostpingの実測(root complex通過で40%スループット低下)と2016年SC論文の輻輳モデル(理論効率76%)の相互裏付けを追加) - Key insight: NSDI '23版で「ホスト内帯域劣化・レイテンシ増加」の2症状に限定されていたHostpingの診断範囲が、TON拡張版でRNIC自体の接続性問題(R2R probing)まで拡張されたことで、ホスト**内**診断ツールとネットワーク**間**監視ツール(R-Pingmesh)の機能的な境界が接近した。同じ研究グループが「ホスト内」から出発して段階的に「RNIC接続性」「輻輳制御」(RHCC)へと診断対象を広げていく系列がこのwikiで追跡可能になった。 - 図表: 本文参照図表10点(Figure 1-10)全点を埋め込み(除外なし)。埋め込みラスター画像はFig.2(topology図)・Fig.5(core idea図)・Fig.6(framework図)・Fig.7(loopback timing図)・Fig.10(a)(b)(c)(bandwidth matrix、3枚とも個別embedded画像として抽出)の7点をそのまま利用。Fig.1(throughput折れ線)・Fig.3(棒グラフ2枚)・Fig.4(棒グラフ2枚)・Fig.8(bandwidth matrix、a-fの6パネルを1枚に集約)・Fig.9(flapping時系列)の5点はベクター描画または大量の断片化画像(Fig.8は元々20個のセル断片に分解されていた)のためPyMuPDFキャプション座標クロップで取得。Fig.2・5・6・7の4点はNSDI '23版のsourceページと共通の図。 ## 2026-08-25 | Revisiting RDMA Reliability for Lossy Fabrics(Wenxue Li ほか、香港科技大学/Huawei、ACM SIGCOMM '25) - Source: [[@2025__SIGCOMM__Revisiting RDMA Reliability for Lossy Fabrics]] - 新規 entity 2 件: [[Wenxue Li]]・[[DCP]] - 更新 entity 3 件: [[Kai Chen (HKUST)]]・[[Huawei Technologies]]・[[Hong Kong University of Science and Technology]] - 更新 concept 1 件: [[RoCE設計課題]] - Key insight: PFC 非依存・パケットレベル負荷分散互換・RTO フリー・ハードウェアオフロード対応という4要件を同時に満たすスイッチ・RNIC 共設計トランスポート DCP を提案。「制御プレーンのみを無損失に保ちデータプレーンは有損失のまま許容する」非対称設計により、IRN(RNIC-SR)がパケットレベル負荷分散との組み合わせで発生させる大量の偽の再送(NS3実験でフローの50〜90%が影響)を解消する。ヘッダオンリーパケットベースの精密な再送、拡張ヘッダによる順序非依存受信、ビットマップフリーなパケット追跡(exactly once特性を利用したメッセージ単位カウンタ)の3機構で、P4スイッチ+FPGAプロトタイプにより実装可能性を実証し、SOTA比1.6〜72倍の性能改善を達成した。 - 図表: 本文参照図表17点(Figure 1-17)+表5点(Table 1-5)を全点、PyMuPDFキャプション座標クロップで埋め込み(除外なし)。全図がベクター描画のため埋め込みラスター画像(背景用グレー矩形のみ)は利用不可。 ## 2026-08-25 | Pond: CXL-Based Memory Pooling Systems for Cloud Platforms(Huaicheng Li ほか、Microsoft Azure/Virginia Tech/CMU 他、ASPLOS '23 Distinguished Paper Award) - Source: [[@2023__ASPLOS__Pond - CXL-Based Memory Pooling Systems for Cloud Platforms]] - 新規 entity 14 件: [[Huaicheng Li]]・[[Daniel S. Berger]]・[[Stanko Novakovic]]・[[Lisa Hsu]]・[[Daniel Ernst]]・[[Pantea Zardoshti]]・[[Monish Shah]]・[[Samir Rajadnya]]・[[Scott Lee]]・[[Ishwar Agarwal]]・[[Mark D. Hill]]・[[Marcus Fontoura]]・[[Virginia Tech]]・[[Stone Co]] - 更新 entity 8 件: [[Ricardo Bianchini]]・[[Microsoft Azure]]・[[Microsoft]]・[[Carnegie Mellon University]]・[[University of Washington]]・[[Google]]・[[Intel]]・[[University of Wisconsin-Madison]] - 更新 concept 2 件: [[CXLによるメモリ拡張]]・[[NUMAメモリ配置]] - Key insight: Azure本番100クラスタ・75日分のトレース解析から、スケジュール済みコア比率が85%を超える局面でメモリストランディング(全コアが貸与済みでもメモリは未貸与のまま残る現象)の中央値が10%超・95パーセンタイルで最大25〜30%に達することを初めて公開特性化した。8〜16ソケット規模の小さなCXLメモリプールで、より大規模なプールが得る効果の大半を達成できるという知見と、約50%のVMが割り当てメモリの50%未満しかタッチしていないという知見を組み合わせ、RandomForestによるレイテンシ非感受性予測・LightGBMによる未タッチメモリ予測の2つのMLモデルでVM起動前にプール配分を決定するPondを提案した。ハイパーバイザのzNUMA(zero-core virtual NUMAノード)機構により、予測が正しければVMは実質的にプールメモリへアクセスしない(48時間本番実験でzNUMAへのトラフィックは0.06〜0.38%)。158ワークロード・3500超の実験で、16ソケットプール・CXLレイテンシ222%増加の条件下でDRAM需要を7%(サーバコスト換算3.5%)削減することを実証した。既存の[[CXLによるメモリ拡張]]概念に対しては、Meta Vistaraの「データセンター規模の透過的階層化」・中国OCPコミュニティのBelugaの「専用プールオフロード」とは異なる「小規模プール+VM起動前ML予測配分」という第3の設計点を提供する。 - 図表: 本文参照図表21点(Figure 1〜21)全点を埋め込み(除外なし)。埋め込みラスター画像は3点のみ(CCライセンスロゴ1点は装飾のため除外、numactl出力[Figure 10]とzNUMAアクセスビットヒートマップ[Figure 15の一部]の2点はそのまま採用)。残り19点はほぼ全てベクター描画のため、PyMuPDFでキャプション座標を全ページ探索しクロップして取得。初回クロップでキャプション行が下端に混入した図(Figure 8・12・13・14)は座標を再調整して再クロップした。 ## 2026-08-25 | RHCC: Revisiting Intra-Host Congestion Control in RDMA Networks(Zirui Wan・Jiao Zhang・Yuxiang Wang・Kefei Liu・Haoyu Pan・Yongchen Pan・Tao Huang、BUPT / Purple Mountain Laboratories、IEEE Transactions on Networking 2025) - Source: [[@2025__TON__RHCC - Revisiting Intra-Host Congestion Control in RDMA Networks]] — [[@2024__APNet__Rethinking Intra-host Congestion Control in RDMA Networks]](APNet 2024)の拡張ジャーナル版。 - 新規 entity 1 件: [[Yongchen Pan]] - 更新 entity 8 件: [[Zirui Wan]]・[[Jiao Zhang]]・[[Yuxiang Wang]]・[[Kefei Liu]]・[[Haoyu Pan]]・[[Tao Huang]]・[[BUPT]]・[[Purple Mountain Laboratories]] - 更新 concept 3 件: [[ホスト輻輳制御]]・[[ホスト内ネットワークボトルネック]]・[[データセンター輻輳制御]] - Key insight: APNet 2024版の中核設計(RHCCフレームワーク・CPU-to-メモリトラフィック輻輳応答・RNICトラフィック輻輳応答・主要実験数値)を保ったまま、拡張ジャーナル版で著者にYongchen Panが加わり、PIDコントローラの収束性の理論的解析(§III-C、SISO ARMAXモデル)・hostCCに対する5点の体系的優位性比較(§III-D)・Ithr/Dthrのパラメータ感度分析(§IV-C)・考察(§V: CXL・新しい資源配分ポリシー・プログラマブルなホスト内ネットワーク)が新設された。矛盾はなく、会議版からジャーナル版への拡張が実験追加ではなく「先行手法との関係の言語化」という論証構造の精緻化として現れる例である。 - 図表: 本文参照図表21点(Figure 1-21)全点を埋め込み(除外なし)。埋め込みラスター画像0点(全図がベクター描画)のためPyMuPDFキャプション座標クロップで全図を取得。 ## UCCL-Tran: An Extensible Software Transport Layer for GPU Networking(2026-08-25) [[@2026__OSDI__UCCL-Tran - An Extensible Software Transport Layer for GPU Networking]]([[Yang Zhou]]ほか、[[University of California, Berkeley]] / [[University of California, Davis]] / [[Tsinghua University]] / [[Harvard University]] / [[IBM Research]] / [[Amazon Web Services]] / [[Broadcom]] / [[University Politehnica of Bucharest]]、USENIX OSDI '26)は、既存 RDMA NIC のコントロールパス(輻輳制御・パケット信頼性・マルチパス負荷分散)をデータパスから分離し、コントロールパスをホスト CPU 上のソフトウェアとして実行する拡張可能トランスポート層 UCCL-Tran を提案する。RDMA UC の `write_with_immediate` verb でコントロールヘッダとデータペイロードを CPU/GPU へ分離する設計(Figure 3・4)により、NVIDIA ConnectX-7・Broadcom Thor-2・AWS EFA という異種 NIC を単一のソフトウェアレイヤーで統一的にサポートする。パケットスプレー型マルチパストランスポート・受信側主導 CC(EQDS)・選択的再送という3つの拡張性ケーススタディを実装し、既存 RDMA ハードウェアトランスポート比 ML collective で最大4.5倍、DeepSeek-V2-Lite訓練で最大7.5%、DeepSeek-V3サービングでレイテンシ最大1.42倍の改善を実測した。1 CPU コアで400Gbps単方向トラフィックを処理でき、コネクション分割・コントロールコアレシング(32KBチャンク)・チェインドポスティングでソフトウェア効率を確保する。既存 concept [[RDMA]] に IRN(2018)のハードウェア改修路線から Flor・UCCL-Tran のホスト CPU ソフトウェア拡張路線への転換、OpenAI [[MRC]] とのプログラマブル NIC 側 vs ホスト CPU 側という実装場所の対比を、[[集合通信]] に NCCL の内部最適化・診断とは異なる「NCCL の外側」のトランスポート層拡張という新しいレイヤー軸を、[[データセンター輻輳制御]] に HotNets 2024 のシミュレーション予測を実機テストベッドで裏づけるという横断的知見を追記した。図15点(本文参照 Figure 1-15 全点、PyMuPDFキャプション座標クロップで埋め込み)、表4点(Table 1-4を Markdown表に転記)。Appendix 図表(Figure 16-26・Table 5)は付録限定参照のため除外。 - Sources (new): [[@2026__OSDI__UCCL-Tran - An Extensible Software Transport Layer for GPU Networking]] - Entities (new): [[Yang Zhou]]・[[Zhongjie Chen]]・[[Ziming Mao]]・[[Shuo Yang]]・[[Pravein Govindan Kannan]]・[[Xizhi Zhang]]・[[Jiaqi Gao]]・[[Yilong Zhao]]・[[Yongji Wu]]・[[Kaichao You]]・[[Fengyuan Ren]]・[[Zhiying Xu]] - Entities (updated): [[ChonLam Lao]]・[[Costin Raiciu]]・[[Ion Stoica]] - Concepts (updated): [[RDMA]]・[[集合通信]]・[[データセンター輻輳制御]] ## Computer Architecture: A Quantitative Approach, 6th Edition(2026-08-25) [[Computer Architecture - A Quantitative Approach]]([[John L. Hennessy]]・[[David A. Patterson]]、Morgan Kaufmann、2019、ISBN 978-0-12-811905-1)は、計算機アーキテクチャを費用・性能・電力の定量的トレードオフとして扱う標準教科書である。本編 7 章と付録 A・B・C・D・F の計 12 枚を章単位の source ページとして取り込んだ(付録 E・G〜M は未取り込み)。 本書を通読して見えるのは、**単一プロセッサの性能成長が尽きた地点で書かれた教科書**という第 6 版の位置である。第 1 章が性能成長率の 52%→23%→12%→3.5%/年 という段階的鈍化を示し、第 3 章が ILP 拡張の限界を Wall(1993)と IBM Power 系列の実測で、第 5 章がマルチプロセッサのスケーラビリティ限界を「96 コア世代でも 24 コア機比 2 倍未満」という実測で裏づけ、第 7 章が領域特化を唯一残された答えとして提示する。この論証は本書全体で 1 本に繋がっている。 並列性を形態ごとに分解する構成も第 6 版の骨格を成す。命令レベル並列性(第 3 章)、データレベル並列性(第 4 章)、スレッドレベル並列性(第 5 章)、リクエストレベル並列性(第 6 章)がそれぞれ独立した章を持ち、付録 A・B・C がそれぞれ第 1 章・第 2 章・第 3 章の基礎編として対応する。命令セットを MIPS から RISC-V へ全面的に切り替えた最初の版でもある。 この vault の関心との接続では、第 6 章(WSC の障害モデル・PUE・TCO・テールレイテンシ)と付録 D(公称 MTTF と実測 AFR の乖離、「five nines」への実測データによる反証)、付録 F(トポロジ・ルーティング・フロー制御の理論)が中心になる。とくに付録 F は既存 concept [[相互結合網]] の未解決の問いを 1 件解消し(Beneš 網が Clos 網の再帰的極限であること)、[[RDMA]] には InfiniBand の 2005 年実測値が RDMA 低レイテンシ性の実証起源であること、PFC の構造的弱点が古典的フロー制御理論の一般的トレードオフの一例であることを接続した。第 4 章と第 7 章はそれぞれ異なる軸で [[Rooflineモデル]] を積み増している(前者は ridge point によるハードウェア特性の比較、後者は TPU/Haswell/K80 の 3 者比較とレイテンシ制約という第三の天井)。 - Sources (new): [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 1 Fundamentals of Quantitative Design and Analysis]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 2 Memory Hierarchy Design]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 3 Instruction-Level Parallelism and Its Exploitation]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 4 Data-Level Parallelism in Vector, SIMD, and GPU Architectures]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 5 Thread-Level Parallelism]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 6 Warehouse-Scale Computers to Exploit Request-Level and Data-Level Parallelism]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 7 Domain-Specific Architectures]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix A Instruction Set Principles]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix B Review of Memory Hierarchy]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix C Pipelining - Basic and Intermediate Concepts]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix D Storage Systems]]・[[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix F Interconnection Networks]] - Entities (new): [[Computer Architecture - A Quantitative Approach]]・[[ARM Cortex-A53]]・[[Amazon EC2]]・[[CUDA]]・[[Ethernet]]・[[Fujitsu SPARC64 X+]]・[[Google TPU]]・[[IBM 360/91]]・[[IBM Blue Gene/L]]・[[IBM Power8]]・[[InfiniBand]]・[[Intel 80x86]]・[[Intel Core i7]]・[[Intel Core i7 6700]]・[[Intel Crest]]・[[Intel Itanium]]・[[Intel Xeon E7]]・[[José Duato]]・[[Jupiter (Google WSCネットワークスイッチ)]]・[[MIPS R4000]]・[[Microsoft Catapult]]・[[NVIDIA Pascal]]・[[Pixel Visual Core]]・[[SPEC]]・[[Timothy M. Pinkston]]・[[VAX]] - Entities (updated): [[Amazon Web Services]]・[[David A. Patterson]]・[[Google]]・[[James Hamilton]]・[[Jim Gray]]・[[John L. Hennessy]]・[[Luiz André Barroso]]・[[MapReduce]]・[[NVIDIA]]・[[NetApp]]・[[PTX]]・[[RISC-V]]・[[TPC-C]]・[[Tandem Computers]]・[[Xen]] - Concepts (new): [[キャッシュコヒーレンスプロトコル]]・[[メモリ一貫性モデル]]・[[命令セットアーキテクチャの設計原理]] - Concepts (updated): [[AIアクセラレータ]]・[[Brainiac設計]]・[[CPU利用率]]・[[PUE]]・[[RAID]]・[[RDMA]]・[[Rooflineモデル]]・[[SIMDベクトル処理]]・[[アウトオブオーダー実行]]・[[アムダールの法則]]・[[クラウドコンピューティング]]・[[コアレスドメモリアクセス]]・[[コンテナ仮想化]]・[[スーパースカラー実行]]・[[テールレイテンシ耐性技術]]・[[ディペンダビリティ]]・[[データセンターネットワークトポロジ]]・[[データセンター信頼性]]・[[データセンター輻輳制御]]・[[ドメイン固有アーキテクチャ]]・[[ハードウェア仮想化]]・[[ハードディスク信頼性]]・[[パイプライン処理]]・[[ベンチマーキング]]・[[ムーアの法則とデナードスケーリングの終焉]]・[[メモリウォール]]・[[メモリバウンド]]・[[メモリ階層とキャッシュ]]・[[リトルの法則]]・[[仮想メモリとページング]]・[[共有メモリバンクコンフリクト]]・[[分岐予測]]・[[分散ストレージ]]・[[可用性]]・[[同時マルチスレッディング]]・[[待ち行列理論]]・[[性能メトリクスの選定]]・[[性能測定]]・[[投機的実行とマイクロアーキテクチャサイドチャネル(Meltdown・Spectre)]]・[[相互結合網]] ## FlowTracer: A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters(2026-08-25) [[@2024__arXiv__FlowTracer - A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters]]([[Hasibul Jamil]]ほか、[[IBM Research]](Yorktown Heights・Haifa)/ [[University at Buffalo]](SUNY)、arXiv 2024、ユーザー提供情報では IEEE ICC 2025 採録・未検証)は、AI 分散学習クラスタにおける ECMP ハッシュ衝突起因のネットワークパス不均衡を、実運用の RDMA(RoCE)/TCP トラフィックに対してホップバイホップで受動追跡・可視化するツール FlowTracer を提案する。R-Pingmesh・RD-Probe のような能動プロービング系ツールと異なり合成トラフィックを注入せず、並列プロセス・スレッド化と持続的 SSH 接続の組み合わせでフロー追跡を高速化する。新指標 Flow Imbalance Metric(FIM、MAPE ベース)を導入し、16 ノードの RoCEv2 対応リーフ・スパイン検証環境で標準 ECMP ルーティング(不均衡 36.5%)と事前設定した静的ルーティング(不均衡 6.2%)を定量比較する使用例を示した。既存 concept [[ECMP]] に、Hedera(2010・シミュレーション)から FlowTracer(2024・実機計測)へつながる系譜と RoCE エレファントフロー特性がハッシュ衝突の実害を増幅する知見を、[[RDMAネットワーク監視]] に R-Pingmesh の能動プロービングに対し受動ホップバイホップ追跡という第九の計装軸を加える知見を追記した。図5点(本文参照 Figure 1-5 全点。Figure 2 はベクター描画のため PyMuPDF キャプション座標クロップ、他はラスター埋め込み画像を利用)。 - Sources (new): [[@2024__arXiv__FlowTracer - A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters]] - Entities (new): [[Hasibul Jamil]]・[[Bengi Karacali]]・[[Tevfik Kosar]] - Entities (updated): [[IBM Research]]・[[University at Buffalo]] - Concepts (updated): [[ECMP]]・[[RDMAネットワーク監視]] ## On the General Theory of Control Systems(2026-08-26) [[@1960__IFAC1960__On the General Theory of Control Systems]]([[R. E. Kalman]]、Proc. First International Congress of IFAC, Moscow 1960)は、線形・定常・単入力単出力プラントに限定したうえで可制御性(controllability)・可観測性(observability)という 2 概念を厳密に定義し、それぞれの必要十分条件(ベクトル列の線形独立性、Jordan 標準形での固有値重複条件)を証明する。さらに双対性原理(Principle of Duality)により、Φ を双対 Φ* に置き換え・入出力制約を入れ替え・時間の向きを反転させることで可制御性↔可観測性が対応することを示し、その帰結として最適レギュレータ問題(二次形式性能指標のもとで完全可制御性が解の存在の必要十分条件、Theorem II)がウィーナー・コルモゴロフのフィルタリング問題と数学的に同一構造であることを導く(式 72)。テキスト層のないスキャン PDF(JBIG2、`.raw/papers/kalman.pdf`)のため 12 ページ全ページを視覚的に通読して作成した。新規 concept [[可制御性]]・[[可観測性]]・[[双対性原理(制御理論)]] はいずれも本論文が初出で、単一ソースのため横断的知見は今後の関連ソース ingest 待ち。図4点(Figure 1-4全点、PyMuPDFキャプション座標クロップで埋め込み、除外なし)。 - Sources (new): [[@1960__IFAC1960__On the General Theory of Control Systems]] - Entities (new): [[R. E. Kalman]] - Concepts (new): [[可制御性]]・[[可観測性]]・[[双対性原理(制御理論)]] ## AI Chip Architectures(2026-08-29) [[AI Chip Architectures]](jepeake、技術記事、2026)は、現行の主要 AI アクセラレータ6種(NVIDIA GPU・[[Google TPU]]・[[AMD]] Instinct GPU・[[Cerebras]] WSE・[[AWS Trainium]]・[[Groq]] LPU)を、設計思想・世代系譜・計算/メモリ/数値表現・スケーリング(scale-up/scale-out)・ソフトウェアスタックという共通フォーマットで横断比較する記事である。Hennessy & Patterson の2018年 Turing Lecture(「次の10年でアーキテクチャのカンブリア爆発が起きる」)を出発点に、チップの理解を「データがどこに居るか・どう移動するか・計算ユニットの形・チップ間通信」という4つの問いへ還元する。 最大の横断的知見は、同じ「メモリウォールへの対処」という問題設定に対し6アーキテクチャが分岐した設計哲学: NVIDIA(非同期化を進めるプログラマブルなwarp階層)、TPU/Trainium(シストリックアレイ+コンパイラスケジューリング、同一思想の2実装)、AMD(保守的なCUに積極的パッケージングを組み合わせる)、Cerebras(ウェハを切らずSRAM専用、データフロー到着駆動)、Groq(SRAM専用だがCerebrasとは正反対の時計駆動・完全決定論)。GroqのLPU技術は2025年にNVIDIAへ非独占ライセンスされ、2026年にRubin NVL72のAttention-FFN分離構成へ統合されるという、6アーキテクチャの境界が実際に溶け合った実例も記録する。 - Sources (new): [[AI Chip Architectures]] - Entities (new): [[Groq]] - Entities (updated): [[NVIDIA]]・[[Google TPU]]・[[AMD]]・[[Cerebras]]・[[AWS Trainium]]・[[CUDA]] - Concepts (updated): [[AIアクセラレータ]]・[[メモリウォール]]・[[チップレット]]・[[テンソルコア]]・[[光回線交換]]・[[ドメイン固有アーキテクチャ]] ### StriaTrace: Efficient Tracing and Diagnosis for Online LLM Inference(Haonan Wu ほか、Shanghai Jiao Tong University/Alibaba Group、USENIX OSDI '26)(2026-08-29 ingest-paper) - [[@2026__OSDI__StriaTrace - Efficient Tracing and Diagnosis for Online LLM Inference]] — オンライン LLM 推論向けの低オーバーヘッドな継続トレーシング・診断システム。同期点・クリティカルパス・異常時の高忠実度保存を組み合わせ、動的回帰型ルーフラインで推論ステップのテイル異常を検知する。評価では既存手法比 97.8% のオーバーヘッド削減、注入異常 recall 100%、本番 1,700 超インスタンス・日量 1.8億超リクエスト・19 種類の根本原因を報告。本文参照 Figure 1–11 を全件クロップして埋め込み、Table 1–4 を Markdown 表に転記。(paper / llm / inference / observability / tracing) ### 新規実体(2026-08-29 ingest-paper | StriaTrace) - [[StriaTrace]] — オンライン LLM 推論向け継続トレーシング・診断システム。 - [[Yanqing Chen]] / [[Jingbo Xu]] / [[Guangtao Xue]] — StriaTrace 共著者。 - [[Shanghai Key Laboratory of Trusted Data Circulation and Governance and Web3]] — Guangtao Xue の併記所属。 - [[py-spy]] — StriaTrace が異常時 CPU スタックを取得するサンプリングプロファイラ。 - [[NVIDIA H20-3e]] — 評価ノードで使われた NVIDIA GPU。 ### 2026-08-29 更新概念 | StriaTrace - [[LLM推論]] / [[LLMサービング管理]] / [[GPU観測性]] / [[Rooflineモデル]] / [[分散トレーシング]] / [[トレーシングオーバーヘッド]] / [[クリティカルパス分析]]