# Sources Index
### 2026-09-13 ingest | We Must Pace the Frontier\n- 新規 source: [[@2026__DarioAmodei__We Must Pace the Frontier]]\n
### 2026-09-12 ingest-thesis | Community detection in graphs (Fortunato)
- 19 章(18節+付録A): [[@2010__PhysRep__Community detection in graphs - Chapter I Introduction]] 〜 [[@2010__PhysRep__Community detection in graphs - Chapter XVIII Outlook]] + [[@2010__PhysRep__Community detection in graphs - Appendix A Elements of Graph Theory]]
### 2026-09-12 ingest-paper | Fast unfolding of communities in large networks\n- 新規 source: [[@2008__JSTAT__Fast unfolding of communities in large networks]]\n
### 2026-09-12 ingest-book | Networks, Crowds, and Markets
- 全24章の source ページを新規作成([[@2010__CambridgeUP__Networks, Crowds, and Markets - Chapter 1 Overview]]〜Chapter 24)
### 2026-09-12 ingest-paper | The PageRank Citation Ranking\n- 新規 source: [[@1998__TechReport__The PageRank Citation Ranking - Bringing Order to the Web]]\n
### 2026-09-11 ingest-paper | DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression\n- 新規 source: [[@2026__TechReport__DeepSeek-V4.1-Flash - Pushing the Limits of KV Cache Compression]]\n
### 2026-09-11 ingest-paper | データ制約スケーリング・合成データ 論文6本バッチ
- 新規: [[@2025__JMLR__Scaling Data-Constrained Language Models]], [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]], [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]], [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]], [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]], [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]
### 2026-09-11 ingest-paper | Scaling Inference Prefill with High-Radix Photonic Interconnects\n- 新規: [[@2026__HOTI__Scaling Inference Prefill with High-Radix Photonic Interconnects]]\n
### 2026-09-10 ingest | batch (2 sources)
- New source: [[@2026__PloehBlog__Programming Languages for AI]]
- New source: [[@2023__DeepMindBlog__AlphaDev Discovers Faster Sorting Algorithms]]
### 2026-09-10 ingest-paper | Will we run out of data?
- 新規 source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]
### 2026-09-08 ingest-paper | Networked Agent Memory and Causality Representation
- 新規 source: [[@2026__SIGCOMM__Networked Agent Memory and Causality Representation - Experiences towards Interpretable Cloud-Scale Root-Causing]]
### 2026-09-08 ingest-paper | Pegasus: A Data Center Network for Bare-Metal AI Cloud
- 新規 source: [[@2026__SIGCOMM__Pegasus - A Data Center Network for Bare-Metal AI Cloud]]
### 2026-09-07 ingest-paper | Using expect to Automate System Administration Tasks
- 新規 source: [[@1990__LISA__Using expect to Automate System Administration Tasks]]
### 2026-09-07 ingest-paper | The Log-Structured Merge-Tree (LSM-Tree)
- 新規 source: [[@1996__Acta Informatica__The Log-Structured Merge-Tree (LSM-Tree)]]
### 2026-09-07 ingest-paper | When GPUs Fail Quietly
- 新規 source: [[@2026__arXiv__When GPUs Fail Quietly - Observability-Aware Early Warning Beyond Numeric Telemetry]]
### 2026-09-07 ingest-paper | SeT-Diff\n- 新規 source: [[@2026__arXiv__SeT-Diff - Towards Semantic Foundation Models for HPC Telemetry and Time-Series]]\n
### 2026-09-07 ingest-paper | μSlope: High Compression and Fast Search on Semi-Structured Logs
- 新規 source: [[@2024__OSDI__μSlope - High Compression and Fast Search on Semi-Structured Logs]]
### 2026-09-07 ingest-paper | Splitwise: Efficient Generative LLM Inference Using Phase Splitting\n- 新規: [[@2024__ISCA__Splitwise - Efficient Generative LLM Inference Using Phase Splitting]]\n
### 2026-09-07 ingest-paper | State of AI: An Empirical 100 Trillion Token Study with OpenRouter
- 新規 source: [[@2026__arXiv__State of AI - 100 Trillion LLM Interactions with OpenRouter]]
### 2026-09-07 ingest-paper | Fighting the Fog of War (Warden)\n- 新規 source: [[@2021__ATC__Fighting the Fog of War - Automated Incident Detection for Cloud Systems]]\n
### 2026-09-07 ingest-paper | 障害管理・アラーム相関の歴史的論文8件(1995-2014)
- 新規: [[@1995__IM__A Coding Approach to Event Correlation]], [[@1995__INFOCOM__Automatic Alarm Correlation for Fault Identification]], [[@1997__IM__Automated Proactive Anomaly Detection]], [[@1998__PER__Internet Service Performance Failure Detection]], [[@1999__JNSM__Rule Discovery in Telecommunication Alarm Data]], [[@2000__LISA__Aberrant Behavior Detection in Time Series for Network Service Monitoring]], [[@2013__KDD__An Integrated Framework for Optimizing Automatic Monitoring Systems in Large IT Infrastructures]], [[@2014__KDD__Towards Scalable Critical Alert Mining]]
### 2026-09-07 ingest | IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud
- New source: [[@2026__IBM__IBM Granite Time Series models bring real-time forecasting and anomaly detection to Confluent Cloud]]
### 2026-09-07 ingest | TimesFM-3: A zero-shot foundation model for multivariate forecasting
- New source: [[@2026__Google Research Blog__TimesFM-3 - A Zero-Shot Foundation Model for Multivariate Forecasting]]
### 2026-09-07 ingest-paper | LISA歴史論文バッチ11件
- 新規: 11 source pages (LISA 2000-2014, 構成管理/コストモデル/依存性発見/ログ分析/ネットワーク監視)
### 2026-09-07 ingest-paper | LiveOps: Systems Management as a Service (LISA'06)\n- 新規 source: [[@2006__LISA__LiveOps - Systems Management as a Service]]\n
### 2026-09-07 ingest | USENIX LISA '11 会議報告
- New source: [[@2012__login__USENIX LISA '11 - 25th Large Installation System Administration Conference]]
### 2026-09-06 ingest-paper | LISA歴史論文バッチ10件
- 新規 source 10件: [[@1993__LISA__Automated System Monitoring and Notification With Swatch]] / [[@1991__LISA__Modules - Providing a Flexible User Environment]] / [[@1997__LISA__An Analysis of UNIX System Configuration]] / [[@1998__LISA__MRTG - The Multi Router Traffic Grapher]] / [[@1998__LISA__Bootstrapping an Infrastructure]] / [[@1994__LISA__Towards a High-Level Machine Configuration System]] / [[@1999__LISA__A Retrospective on Twelve Years of LISA Proceedings]] / [[@2004__LISA__Nix - A Safe and Policy-Free System for Software Deployment]] / [[@2010__LISA__Chukwa - A System for Reliable Large-Scale Log Collection]] / [[@2010__LISA__Log Analysis and Event Correlation Using Variable Temporal Event Correlator (VTEC)]]
### RDMA基盤論文8件ingest(ATC16 Kalia, NSDI14 FaRM, U-Net 1995, OSDI16 FaSST, ConWeave SIGCOMM'23, NSDI25 White-Boxing/ScalaCN, Alibaba Stellar SIGCOMM'25)(2026-09-06 ingest-paper)
- [[@2016__ATC__Design Guidelines for High Performance RDMA Systems]] — RDMA性能はPCIeトランザクション数とNIC内WQEキャッシュ管理で決まることを実証。(paper / rdma)
- [[@2014__NSDI__FaRM- Fast Remote Memory]] — RDMAの低レベル最適化とACIDトランザクション抽象を一体設計。(paper / rdma / distributed-transactions)
- [[@1995__SOSP__U-Net- A User-Level Network Interface for Parallel and Distributed Computing]] — カーネルバイパスネットワーキングの1995年の先駆的原型。(paper / networking)
- [[@2016__OSDI__FaSST- Fast, Scalable and Simple Distributed Transactions with Two-Sided (RDMA) Datagram RPCs]] — 両側データグラムRPCによる分散トランザクション。(paper / rdma / distributed-transactions)
- [[@2023__SIGCOMM__Network Load Balancing with In-network Reordering Support for RDMA]] — ConWeave。RTT単位再ルーティングとToR順序反転隠蔽でRDMA向けLBを実現。(paper / rdma / load-balancing)
- [[@2025__NSDI__White-Boxing RDMA with Packet-Granular Software Control]] — BlueField-3 DPAでQPデキュー速度をパケット粒度制御。(paper / rdma / smartnic)
- [[@2025__NSDI__Mitigating Scalability Walls of RDMA-based Container Networks]] — ScalaCN。RNIC内eSwitchフローテーブルのスケーラビリティ壁を解明。(paper / rdma / container-networking)
- [[@2025__SIGCOMM__Alibaba Stellar - A New Generation RDMA Network for Cloud AI]] — SR-IOV由来のVF制約をSF+virtioで解消するクラウドAI向けRDMA基盤。(paper / rdma / cloud-ai)
### 2026-09-05 ingest-paper | AutoDA-Timeseries - Automated Data Augmentation for Time Series (ICLR 2026)
- 新規 source: [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]]
### 2026-09-05 ingest-paper | ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts (WWW2026)
- 新規 source: [[@2026__WWW2026__ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts]]
### 2026-09-05 ingest-paper | A Benchmark for Language Models in Real-World System Building (arXiv 2601.12927)
- 新規 source: [[@2026__arXiv__A Benchmark for Language Models in Real-World System Building]]
### 2026-09-05 ingest-slides | Orchestrate Next-Generation AI Workloads With Open-Source Slurm
- 新規 source: [[@2026__GTC__Orchestrate Next-Generation AI Workloads With Open-Source Slurm]]
### 2026-09-05 ingest-paper | 7 HPC Papers\n- 7本の新規HPCテレメトリ・ワークロード論文を追加\n
### 2026-09-05 ingest-paper | Falcon (GPU failure prediction)
- 新規 source: [[@2026__ISSRE__From Noisy Telemetry to Actionable Warnings - GPU Failure Prediction in Industrial Clusters]]
### Why Transformers? A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations(Nankai University / Tsinghua University)(2026-09-05 ingest-thesis 再ingest)
- 旧1枚物source([[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations]]、削除済み)を9章 source + ハブentity [[Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations]] に再構成。図表を4点→16点(Fig.1-8・Table1-8全件)へ拡充。
### 2026-09-05 ingest-paper | Labeling the Invisible (SlowSight)
- 新規 source: [[@2027__FAST__Labeling the Invisible - A Scalable Framework for Labeling Fail-Slow Failures in Cloud Storage Systems]]
### 2026-09-05 ingest-paper | CubeTrace: Microscopic Network Tracing for Heterogeneous Cloud Gateways
- 新規 source: [[@2026__SIGCOMM__CubeTrace Microscopic Network Tracing for Heterogeneous Cloud Gateways]]
### 2026-09-05 ingest-paper | THXInLog\n- 新規 source: [[@2026__nkcs.iops.ai__THXInLog - Robust Semantic-Temporal Framework for Log Anomaly Detection in Production Supercomputers]]\n
### 2026-09-05 ingest-paper | CoLMAD\n- 新規 source: [[@2026__ISSRE__CoLMAD : Cost-Efficient LLM-Assisted Time Series Anomaly Detection for Industrial Monitoring]]\n
### 2026-09-05 ingest-thesis | Post-Training in Time Series Foundation Models: A Unifying Framework\n- 再取り込み: 旧 [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework]](削除)を章単位に再構成\n- 新規 source(10 件): [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 1 Introduction]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 2 Background]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 3 Taxonomy of TSFMs Post-Training Methods]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 4 Parameter Adaptation Methods]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 5 Context Augmentation Methods]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 6 Model Composition Methods]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 7 Output Processing and Uncertainty Control Methods]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 8 Compression and Specialization Methods]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 9 Future Directions]] / [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 10 Conclusion]]\n
### 2026-09-05 ingest-paper | Beyond Fault Localization\n- 新規 source: [[@2026__arXiv__Beyond Fault Localization - A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis]]\n
### 2026-09-05 ingest-paper | Making Core Memory
- 新規 source: [[@2018__CHI__Making Core Memory - Design Inquiry into Gendered Legacies of Engineering and Craftwork]]
### 2026-09-05 ingest-paper | Benchmarking Change Detection Exactness and Overhead of Instrumentation and Sampling
- 新規 source: [[@2026__ICPE__Benchmarking Change Detection Exactness and Overhead of Instrumentation and Sampling]]
### 2026-09-05 ingest-paper | HPCクラスタ監視系7本
- 新規source: [[@2003__JSSPP__SLURM - Simple Linux Utility for Resource Management]] / [[@2026__SCAHPCAsiaWS__Leveraging NVML GPM for NVIDIA GPU Monitoring]] / [[@2015__CiSE__Open XDMoD - A Tool for the Comprehensive Management of High-Performance Computing Resources]] / [[@2020__CLUSTER__PIKA - Center-Wide and Job-Aware Cluster Monitoring]] / [[@2019__CLUSTER__ClusterCockpit - A web application for job-specific performance monitoring]] / [[@2014__HUST__Comprehensive Resource Use Monitoring for HPC Systems with TACC Stats]] / [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]]
### 2026-09-05 ingest | Benchmarking GPUDirect RDMA on Modern Server Platforms
- New source: [[@2014__NVIDIA Developer Blog__Benchmarking GPUDirect RDMA on Modern Server Platforms]]
### 2026-09-05 ingest-paper | The DMA Streaming Framework
- 新規 source: [[@2026__arXiv__The DMA Streaming Framework - Kernel-Level Buffer Orchestration for High-Performance AI Data Paths]]
### 2026-09-05 ingest | GPUDirect RDMA (NVIDIA CUDA Docs)
- New source: [[@2026__NVIDIA__GPUDirect RDMA]]
### 2026-09-05 ingest-paper | GPU-Aware MPI on RDMA-Enabled Clusters\n- 新規 source: [[@2014__TPDS__GPU-Aware MPI on RDMA-Enabled Clusters - Design, Implementation and Evaluation]]\n
### 2026-09-04 ingest-paper | Efficient Inter-node MPI Communication using GPUDirect RDMA
- 新規 source: [[@2013__ICPP__Efficient Inter-node MPI Communication using GPUDirect RDMA for InfiniBand Clusters with NVIDIA GPUs]]
### 2026-09-04 ingest-paper | BridgedRing: A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers
- 新規 source: [[@2026__TACO__BridgedRing - A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers]]
### 2026-09-04 ingest-paper | SRNIC: A Scalable Architecture for RDMA NICs
- 新規 source: [[@2023__NSDI__SRNIC - A Scalable Architecture for RDMA NICs]]
### 2026-09-04 ingest-paper | The Multipath Reliable Connection (MRC) Transport
- 新規 source: [[@2026__arXiv__The Multipath Reliable Connection (MRC) Transport]]
### 2026-09-04 ingest-paper | NCCLbpf
- 新規 source: [[@2026__arXiv__NCCLbpf - Verified, Composable Policy Execution for GPU Collective Communication]]
### 2026-09-04 ingest-paper | Scaling up Test-Time Compute with Latent Reasoning
- [[@2025__arXiv__Scaling up Test-Time Compute with Latent Reasoning - A Recurrent Depth Approach]]
### 2026-09-03 ingest-paper | ML systems 11本
- 新規 source: [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]], [[@2016__OSDI__TensorFlow - A System for Large-Scale Machine Learning]], [[@2017__ISCA__In-Datacenter Performance Analysis of a Tensor Processing Unit]], [[@2017__IEEE__Efficient Processing of Deep Neural Networks]], [[@2018__NeurIPS__Mesh-TensorFlow - Deep Learning for Supercomputers]], [[@2021__FAST__CheckFreq - Frequent Fine-Grained DNN Checkpointing]], [[@2022__OSDI__Alpa - Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning]], [[@2022__MLSys__Pathways - Asynchronous Distributed Dataflow for ML]], [[@2022__SIGCOMM__Jupiter Evolving - Transforming Google's Datacenter Network via Optical Circuit Switches and Software-Defined Networking]], [[@2023__NSDI__TACCL - Guiding Collective Algorithm Synthesis using Communication Sketches]], [[@2023__NSDI__TopoOpt - Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs]]
### 2026-09-04 ingest-paper | Training Large Language Models to Reason in a Continuous Latent Space
- 新規 source: [[@2025__COLM__Training Large Language Models to Reason in a Continuous Latent Space]]
### 2026-09-03 ingest-book | アルゴリズムイントロダクション 第3版 総合版\n- 章 source 39 枚(第 1〜35 章 + 付録 A〜D)。全て publish: false。ハブは [[アルゴリズムイントロダクション 第3版]]\n
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__The Emergence of PCI Express in the Next Generation of Mobile Platforms
- [[@2005__Intel Technology Journal__The Emergence of PCI Express in the Next Generation of Mobile Platforms]]
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__Second-Generation Intel Centrino Mobile Technology Platform
- [[@2005__Intel Technology Journal__Second-Generation Intel Centrino Mobile Technology Platform]]
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__Performance and Power Consumption for Mobile Platform Components Under Common Usage Models
- [[@2005__Intel Technology Journal__Performance and Power Consumption for Mobile Platform Components Under Common Usage Models]]
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__Next-Generation PC Platform Built on Intel Centrino Mobile Technology New Usage Models
- [[@2005__Intel Technology Journal__Next-Generation PC Platform Built on Intel Centrino Mobile Technology New Usage Models]]
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__Low-Power Audio and Storage Input Output Technologies for the Second-Generation Intel Centrino Mobile Technology Platform
- [[@2005__Intel Technology Journal__Low-Power Audio and Storage Input Output Technologies for the Second-Generation Intel Centrino Mobile Technology Platform]]
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__Interface Material Selection and a Thermal Management Technique in Second-Generation Platforms Built on Intel Centrino Mobile Technology
- [[@2005__Intel Technology Journal__Interface Material Selection and a Thermal Management Technique in Second-Generation Platforms Built on Intel Centrino Mobile Technology]]
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__Intel 915GMS Chipset - In Mobile Platforms, Smaller is Better
- [[@2005__Intel Technology Journal__Intel 915GMS Chipset - In Mobile Platforms, Smaller is Better]]
### 2026-09-03 ingest-paper | @2005__Intel Technology Journal__High-Performance Graphics and TV Output Comes to the Second-Generation Intel Centrino Mobile Technology Platform
- [[@2005__Intel Technology Journal__High-Performance Graphics and TV Output Comes to the Second-Generation Intel Centrino Mobile Technology Platform]]
### 2026-09-03 ingest-paper | Jobstats
- 新規 source: [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]]
### 2026-09-03 ingest-book | ソフトウェアアーキテクチャの基礎
- 新規 source: 章 source 24 枚 + 付録 A 1 枚(計 25 枚)。ハブは [[ソフトウェアアーキテクチャの基礎]]
### 2026-09-03 ingest-paper | Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows\n- 新規 source: [[@2026__ACCESS__Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows An Evaluation of LustreFS and S3-Compatible Object Storage]]\n
### 2026-09-03 ingest-paper | PRISM: Evaluating POSIX Storage Systems for AI Research Workflows\n- 新規 source: [[@2026__arXiv__PRISM Evaluating POSIX Storage Systems for AI Research Workflows]]\n
### 2026-09-03 ingest-paper | I/O Load Balancing for Big Data HPC Applications\n- 新規 source: [[@2017__IEEE BigData__I O Load Balancing for Big Data HPC Applications]]\n
### 2026-09-03 ingest-paper | A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System\n- 新規 source: [[@2017__SC__A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System]]\n
### 2026-09-03 ingest-book | Lustre Operations Manual
- 新規 source 38 件: [[@2026__Whamcloud__Lustre Operations Manual - Chapter 1 Understanding Lustre Architecture]] 〜 [[@2026__Whamcloud__Lustre Operations Manual - Chapter 38 Lustre File System Recovery]](公式運用マニュアル第 1〜38 章。第 39〜45 章のリファレンス章は対象外)
### 2026-09-02 ingest-paper | Characterizing Output Bottlenecks of a Production Supercomputer
- 新規 source: [[@2020__TOS__Characterizing Output Bottlenecks of a Production Supercomputer Analysis and Implications]]
### 2026-09-02 ingest-book | Understanding Lustre Internals\n- 章 source 7 件を追加(Chapter 1〜7)\n
### 2026-09-02 ingest-thesis | Lustre Unveiled (ACM TOS 2025)\n- 再取り込み: 旧 [[@2025__TOS__Lustre Unveiled - Evolution, Design, Advancements, and Current Trends]](削除)を章単位に再構成\n- 新規 source(9 件): [[@2025__TOS__Lustre Unveiled - Chapter 1 Introduction]] / [[@2025__TOS__Lustre Unveiled - Chapter 2 The Lustre Filesystem]] / [[@2025__TOS__Lustre Unveiled - Chapter 3 Architectural Details of Lustre]] / [[@2025__TOS__Lustre Unveiled - Chapter 4 A Comparative Study of Lustre versus Related Storage Technologies]] / [[@2025__TOS__Lustre Unveiled - Chapter 5 Lustre Design Evolution]] / [[@2025__TOS__Lustre Unveiled - Chapter 6 Lustre in Practice - Frontier's Orion]] / [[@2025__TOS__Lustre Unveiled - Chapter 7 Future Directions and Open Challenges in Lustre]] / [[@2025__TOS__Lustre Unveiled - Chapter 8 Concluding Thoughts]] / [[@2025__TOS__Lustre Unveiled - Appendix A The Complete History of Lustre]]\n
### 2026-09-02 ingest-slides | Lustre: building a cluster file system for 1,000 node clusters
- 新規 source: [[@2003__CFS__Lustre building a cluster file system for 1,000 node clusters]]
### 2026-09-01 ingest | Running a Software Factory Efficiently at Uber Scale
- New source: [[@2026__Uber__Running a Software Factory Efficiently at Uber Scale]]
### 2026-09-01 ingest-paper | Post-Training in Time Series Foundation Models: A Unifying Framework
- 新規 source: [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework]]
### 2026-08-31 ingest-paper | APEX\n- 新規 source: [[@2026__arXiv__APEX - A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations]]\n
### 2026-08-31 ingest-paper | Large Pretrained Foundation Model for KPI Multivariate Time Series Anomaly Detection
- 新規 source: [[@2024__OJCS__Large Pretrained Foundation Model for Key Performance Indicator Multivariate Time Series Anomaly Detection]]
### 2026-08-31 ingest-paper | Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain\n- 新規 source: [[@2023__arXiv__Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain]]\n
### 2026-08-31 ingest-paper | Performance of Zero-Shot Time Series Foundation Models on Cloud Data
- 新規 source: [[@2025__arXiv__Performance of Zero-Shot Time Series Foundation Models on Cloud Data]]
### 2026-08-31 ingest-paper | Centile: A Telemetry Foundation Model Evaluated by the Decisions It Drives
- 新規 source: [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]]
### 2026-08-31 ingest-paper | AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data
- 新規 source: [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]]
### 2026-08-31 ingest-paper | Causal Analysis for Time Series Foundation Models
- 新規 source: [[@2026__arXiv__Causal Analysis for Time Series Foundation Models]]
### 2026-08-31 ingest-video | 2017/03/17 平木敬教授 最終講義「計算機を創る」
- [[@2017__YouTube__平木敬教授 最終講義「計算機を創る」]] — [[平木敬]]が計算機アーキテクチャ、専用計算機、並列・分散計算機、遠距離データ通信、人材育成の経験を振り返る最終講義。FLATS、SIGMA-1、GRAPE-DR、Data-Reservoir、お茶の水シリーズを代表例として紹介する。(video / computer-architecture / hpc)
### 2026-08-30 ingest-paper | Getting the Most Out of Your GPUs\n- 新規 source: [[@2026__PEARC__Getting the Most Out of Your GPUs]]\n
### 2026-08-30 ingest | eBPFを用いてPod ごとのインターネットトラフィック量を計測するツールの開発
- [[@2024__Preferred Networks__eBPFを用いてPod ごとのインターネットトラフィック量を計測するツールの開発]] — [[Preferred Networks]]の2024年夏季インターンシップで開発されたPod単位のネットワーク計測ツール。Chained CNI PluginからTCへeBPFをアタッチし、Pod・Service・クラスタ外のIngress/Egressバイト数をper-CPU Mapへ集約して、DaemonSetからOpenTelemetry/Prometheus形式で出力する。図5点を保存。(article / kubernetes / networking / ebpf / observability)
### 2026-08-30 ingest-slides | AI/ML基盤の400G DCネットワークを構築した話
- [[@2023__JANOG52__AI ML基盤の400G DCネットワークを構築した話]] — [[内田泰広]]・[[小障子 尚太朗]]が[[サイバーエージェント]]の[[Cycloud]] ML Platform 向けに構築した 400GbE Lossless RoCEv2 インターコネクトの事例。用途別ネットワーク分離、Rail Optimized、Adaptive Routing、PFC/ECN/CNP/ETS、トランシーバー相互接続性を扱う。(slides / networking / rdma / gpu-cluster)
### 2026-08-30 ingest | eBPF Tutorial by Example: Monitoring GPU Driver Activity with Kernel Tracepoints
- [[@2025__eunomia.dev__eBPF Tutorial by Example - Monitoring GPU Driver Activity with Kernel Tracepoints]] — [[eunomia-bpf]] の GPU ドライバ観測チュートリアル。DRM スケジューラの共通トレースポイント、Intel i915/AMDGPU の固有イベント、NVIDIA proprietary driver の kprobe/Xid、GPU 内部観測との境界を整理する。(article / ebpf / gpu / observability / tracing)
### 2026-08-30 ingest-paper | Using Control Theory to Achieve Service Level Objectives In Performance Management
- [[@2002__Real-Time Systems__Using Control Theory to Achieve Service Level Objectives In Performance Management]] — S. Parekh・N. Gandhi・J. Hellerstein・D. Tilbury・T. Jayram・J. Bigusによる *Real-Time Systems* 2002論文。Lotus Notesのキュー長をSLOとして、統計的ARMAモデル、積分制御、根軌跡解析、センサ遅延のトレードオフを実機で評価した。(paper / control-theory / performance / slo)
### 2026-08-30 ingest-slides | AI/ML基盤におけるGPU間ネットワークの負荷と性能影響を探る
- [[@2025__JANOG55__AI ML基盤におけるGPU間ネットワークの負荷と性能影響を探る]] — [[加納浩輝]]・[[奥澤智子]](トヨタ自動車)によるJANOG55発表。データ並列の計算・通信オーバーラップ、AllReduceの通信量推定、`perf-tests`/`nccl-tests`のMessage Size定義、再生可能エネルギーを活用した分散計算基盤、長距離RDMAのACK遅延とPFC headroomを扱う。40ページの全スライド画像を保存。(slides / networking / rdma / gpu)
### 2026-08-30 ingest | AIインフラ革命 ─ 米国データセンターとGPUを支える技術基盤
- [[@2025__LY Corporation__AIインフラ革命 ─ 米国データセンターとGPUを支える技術基盤(Rethinking AI Infrastructure Part 1)]] — [[Actapio]]による米国データセンターの立地・冷却・ラック納品・400Gbps RoCEv2 Clos・GPUラック排熱・光配線・SFP相互運用性を整理したAIインフラ実務記事。(article / ai-infrastructure / datacenter / networking)
### 2026-08-30 ingest-slides | AI Networking - RoCEv2 and the role of netdev
- [[@2025__Netdev 0x19__AI Networking - RoCEv2 and netdev]] — [[David Ahern]]・[[Leon Romanovsky]]によるNetdev 0x19ワークショップ資料。AI訓練ネットワークのホスト内要件、netdevとIB verbsの責任分担、ConnectX-7でのsocket networking対RoCEv2性能比較、Linux TCPのdevmem・io_uring・TCP with QPsを扱う。24ページの全スライド画像を保存。(slides / networking / rdma / gpu-cluster)
### 2026-08-30 ingest | 1兆 (1T) パラメータ規模のLLMの事前学習検証
- [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]] — [[Preferred Elements]]がPLaMo-100Bを基盤に1Tパラメータ級MoEを400基のH100 GPUで検証。通常の学習型Routerは崩壊したがHash Layersでtrain loss約1.57まで学習でき、実効効率は約220 TFLOP/s/GPUだった。(article / llm / pretraining / mixture-of-experts)
### 2026-08-30 ingest | 1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習
- [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]] — [[Preferred Networks]] / [[Preferred Elements]]によるPLaMo-100Bの事前学習報告。2T tokenの日本語・英語データ、Common Crawl由来の日本語コーパス、QK Normalization、z loss、3D parallelism、Zero Bubble、540TFLOP/s/GPUを扱う。(article / llm / distributed / machine-learning)
### 2026-08-30 ingest | 「研究テーマ」の正体|石原尚
- [[@2022__note.com__「研究テーマ」の正体|石原尚]] — [[石原尚]]による研究テーマの解説。研究テーマを、理想・現状・課題・問題からなる世界観と、アプローチ・目標・手段からなる作戦の組み合わせとして捉える。(article / research-methodology / academic-writing)
### 2026-08-30 ingest | Off-CPU Analysis
- [[@2017__brendangregg.com__Off-CPU Analysis]] — スレッドがCPU上で実行していない時間を、スケジューラのコンテキストスイッチとユーザー・カーネルスタックから分析する方法論。BCC/eBPFの`offcputime`、要求同期コンテキスト、off-CPUフレームグラフ、ウェイクアップ解析、スケジューラレイテンシの注意点を整理する。(article / performance / observability / systems)
### 2026-08-29 ingest | NVIDIA Hopper Architecture In-Depth
- [[@2022__NVIDIA Developer Blog__NVIDIA Hopper Architecture In-Depth]] — NVIDIA の H100/Hopper 公式技術解説。FP8・Transformer Engine・DPX・thread block cluster・TMA・分散共有メモリ・HBM3・NVLink Switch System・MIG・PCIe Gen 5をまとめ、H100 の単体性能から256 GPU規模のスケールアップ構成までを説明する。(article / gpu / hpc / llm)
### 2026-08-29 ingest-paper | Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks(Jarmusch ほか、arXiv、2025)
- [[@2025__arXiv__Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks]] — PTX/SASS マイクロベンチマークで GB203/RTX 5080 と GH100/H100 PCIe の実行パイプライン、Tensor Core、メモリ階層、FP8 GEMM、Transformer 推論を比較する。(paper / gpu / computer-architecture / performance)
### 2026-08-29 ingest-paper | GPU Cluster for High Performance Computing(Fan ほか、SC、2004)
- [[@2004__SC__GPU Cluster for High Performance Computing]] — [[Stony Brook University]]の32 GPU ノード・1 Gigabit Ethernet クラスタで LBM を実装し、30 ノードの `480×400×80` 都市流体シミュレーションを 0.31 秒/ステップ、CPU クラスタ比 4.62 倍で実行した。テクスチャ配置、GPU–CPU 転送、MPI 通信、通信スケジュール、計算とのオーバーラップを一体で評価する。(paper / hpc / gpu / computational-fluid-dynamics)
### 2026-08-29 ingest-paper | Benchmarking and Dissecting the Nvidia Hopper GPU Architecture(Luo ほか、arXiv、2024)
- [[@2024__arXiv__Benchmarking and Dissecting the Nvidia Hopper GPU Architecture]] — A100・RTX4090・H800 のメモリ階層と Tensor Core を命令レベルで比較し、Hopper 固有の `wgmma`・FP8・DPX・非同期データ移動・分散共有メモリを評価する。(paper / gpu / computer-architecture / performance)
### 2026-08-25 ingest-thesis | Towards Efficient Generative Large Language Model Serving(Miao ほか、ACM CSUR、2025)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 1 Introduction and Background]] — Transformer と GPU の基礎、自己回帰復号の疑似コードを置き、レイテンシ・メモリ・スケーラビリティ・ハードウェア互換性・精度対効率という 5 課題を提示する。(paper / llm / serving / efficiency)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.1 Taxonomy - Algorithmic Innovation]] — 2 本柱の一方。復号アルゴリズム・アーキテクチャ設計・モデル圧縮の 3 部門。投機的復号は出力分布を変えずに並列性を高められる唯一の手法として位置づけられる。(paper / llm / serving / efficiency)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]] — 2 本柱の他方。LLM の計算セマンティクスを変えずに基盤を洗練する手法群として、低ビット量子化・並列計算・メモリ管理・リクエストスケジューリング・カーネル最適化の 5 主題。(paper / llm / serving / efficiency)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]] — 10 のオープンソース GPU ベースサービングシステムを、並列計算・スケジューリング・アテンションカーネル・優先目標(Lat/Tpt)の 4 軸で比較する(Table 2)。(paper / llm / serving / efficiency)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 5 Benchmarks and Connection with Other Surveys]] — 本番トレース(BurstGPT・Azure)が主流だが MLPerf のような包括的で再現可能なベンチマークは未確立、という指摘と、先行サーベイとの差別化。(paper / llm / serving / efficiency)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 7 Future Direction]] — ハードウェアアクセラレータ・効率的な復号・長コンテキスト・代替アーキテクチャ・複雑な環境へのデプロイ・要求への自動適応の 6 方向。(paper / llm / serving / efficiency)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 8 Conclusion]] — 効率的な LLM サービングを先端 AI 技術へのアクセスの民主化に向けた基盤的なステップと位置づける短い結論。(paper / llm / serving / efficiency)
### 2026-08-25 ingest-thesis | Efficient Training of Large Language Models on Distributed Infrastructures(Duan ほか、Vicinagearth、2026)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 1 Introduction]] — Scalability・Efficiency・Reliability(SER)の 3 課題を提示し、LLaMA-3 が H100 を 16,000 基使って約 54 日を要した事実を基準点に置く。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 2 Background]] — LLM 訓練を従来の深層学習と分ける 4 特性を挙げ、アーキテクチャの均質性こそがシステム最適化の余地を生むと論じる。先行サーベイとの差分も示す。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 3 Infrastructure for LLM Training]] — AI アクセラレータ・ネットワーク・ストレージ・スケジューリングの 4 層。訓練トラフィックが少数の elephant flow に特徴づけられ ECMP では分散できないという診断。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 4 Parallelism Schemes for LLM Training]] — Hybrid(5 並列化次元の手組み、3D parallelism)・Auto(探索空間 → 性能モデル → 最適化の 3 段階)・Heterogeneous(異種ハードウェアと異種モデル)の 3 系統。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 5 Computation Optimizations]] — 演算子最適化(手動カーネル / コンパイラ生成・融合)と混合精度訓練。FP8 未満では安定化の付随機構が複雑化する。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 6 Memory Optimizations]] — アクティベーション再計算・冗長性削減(ZeRO 系)・断片化解消・オフロード(CPU/SSD)の 4 系統。メモリ消費を 4 要素へ分解する。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 7 Communication Optimizations]] — 集団通信・通信スケジューリング・インネットワーク集約の 3 系統。通信が階層構造を持ち大半がノード内に閉じるという実測が設計の前提。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 8 Fault Tolerance]] — 障害分析・異常検知・チェックポイント有無の復旧。LLaMA3 の 466 回中断(78% がハードウェア起因)、OPT-175B で全体時間の 56% が障害対応という実測を含む。(paper / llm / distributed-training / infrastructure)
- [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 9 Conclusion and Outlooks]] — デジタル回路の物理的・経済的限界と、シリコンフォトニクスによる光電子集積(TopoOpt・TPUv4 の OCS・Taichi)という展望。(paper / llm / distributed-training / infrastructure)
### 2026-08-25 ingest-thesis | A Survey on Efficient Inference for Large Language Models(Zhou ほか、arXiv、2024)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 1 Introduction]] — LLM 推論の計算・メモリアクセス・メモリの 3 負荷を示し、先行 8 サーベイに対して 3 階層の網羅と比較実験の実施を差分として主張する(Table 1)。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 2 Preliminaries]] — Prefilling と Decoding の 2 段階を定義し、8 つの効率指標と非効率の 3 根本原因(モデルサイズ・注意演算の二乗複雑度・自己回帰復号)を導く。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 3 Taxonomy]] — 3 根本原因への対処として data-level / model-level / system-level の 3 階層を立てる。この分類が第 4 章以降の章構成そのものになる。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 4 Data-level Optimization]] — 入力圧縮(prompt pruning / summary / soft prompt / RAG)と出力構造化(SoT → SGD → APAR → SGLang)の 2 系統。モデルを変更しないため再学習が不要。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.0 Model-level Optimization - Efficient Structure Design]] — 効率的 FFN 設計(MoE)・効率的 attention 設計・Transformer 代替(SSM 系譜)の 3 系統。FFN は LLaMA-7B でパラメータの 63% を占める。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] — PTQ と QAT、重みのみ量子化と重み+活性値量子化。著者ら自身の実測(Table 4)で W4A16 が prefilling 遅延をむしろ悪化させうると示す。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.2 Model Compression - Sparsification, Structure Optimization, Distillation, and Dynamic Inference]] — スパース化・構造最適化(NAS / 低ランク分解)・知識蒸留(ホワイト/ブラックボックス)・動的推論の 4 主題と、model-level 全体の総括(§5.3)。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.0 System-level Optimization - Inference Engine]] — 演算子/グラフ最適化(FlashAttention 系・カーネル融合)と投機的デコーディング。attention と線形演算子でランタイムの 75% 超を占める。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.1 System-level Optimization - Serving System]] — オフローディング・メモリ管理(PagedAttention)・継続的バッチング・スケジューリング・Prefill/Decode 分離の 5 主題。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.2 System-level Optimization - Hardware Accelerator and Framework Comparison]] — FPGA アクセラレータと推論エンジン 7 種の比較(Table 6)、および system-level 全体の総括(§6.5)。(paper / llm / inference / efficiency)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 7 Discussions of Key Application Scenarios and Conclusion]] — エージェント・長文脈・エッジデバイスの 3 シナリオと、効率化が安全性を損なうかがほとんど検証されていないという指摘。(paper / llm / inference / efficiency)
### 2026-08-29 ingest | BPF in the Agentic Era (batch: LWN + LSFMM slides)
- [[@2026__LWN__BPF in the agentic era]] — LWN.net 記事(Daroc Alden、2026-06-03)。Alexei Starovoitov の LSFMM/BPF 2026 講演報道。エージェント×BPF 危機、verifier 二重役割分離、Rust-BPF 方向、コードレビュー危機、コミュニティ反応。(article / ebpf / kernel / agentic)
- [[@2026__LSFMM__BPF in the Agentic Era]] — Alexei Starovoitov 講演スライド 26 枚(bpfconf/LSFMM 2026)。Rust ネイティブ BPF 設計蓝图。アリーナメモリ、widening、PTR_TO_FUNC、panic=unwind+bpf_throw、コンパイルパイプライン、エージェント向け drgn+Rust BPF ツールキット。図 5 点。(slides / ebpf / kernel / rust)
- [[A Survey on Efficient Inference for Large Language Models]] — [[Zixuan Zhou]] ほか([[Infinigence-AI]] / Tsinghua / Shanghai Jiao Tong / Peking University)による LLM 推論効率化サーベイ。非効率の原因をモデルサイズ、二乗 attention、自己回帰復号に整理し、data-level / model-level / system-level の三層タクソノミーとフレームワーク比較を提示。(paper / arxiv / survey / llm-inference)
### 2026-08-29 ingest-slides | BPF in the Agentic Era (LSFMM 2026)
- [[@2026__BPFConf2026__BPF in the Agentic Era (LSFMM 2026)]] — BPF の制約を削らず標準 Rust を BPF 上で動かす設計案。arena 型メモリ、`PTR_TO_FUNC`、ループ widening、panic 処理、構造化 verifier エラー、エージェント向けカーネルデバッグツールキットを 26 枚のスライドで示す。(slides / bpf / rust / agentic-coding)
### 2026-08-29 ingest | BPF in the agentic era
- [[@2026__LWN__BPF in the agentic era]] — LWN による 2026 Linux Storage, Filesystem, Memory-Management, and BPF Summit の報告。verifier を安全境界として維持しつつ Rust 連携・説明的エラー・widening・エージェント向けツールを整える提案と、生成パッチ増加へのレビュー懸念を記録する。(article / bpf / linux / agentic-coding)
### 2026-08-25 ingest-thesis | LLM4Log(Ma ほか、arXiv、2026)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 1 Introduction]] — ログの半構造性・ドリフト・ラベル不足という難所を示し、LLM が意味的汎化と異種証拠の統合をもたらす一方でコンテキスト長・コスト・プライバシー・幻覚を持ち込むと整理する。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 2 Survey Methodology]] — flagship-venue-first 検索 → snowballing → デジタルライブラリ横断チェックの 3 段プロトコルで 145 論文(162 レコード)を確定し、Figure 3 でタスク分布の偏りを示す。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 3 LLM Background and Taxonomy for Log Analysis]] — ログが自然言語とコードの中間にある半構造化テキストだという診断から、LLM 能力の特化度タクソノミー(汎用・コード指向・ドメイン特化)と適応パラダイムを立てる。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 4 Logging Statement Generation and Maintenance]] — 上流のロギング文生成を where-to-log / what-to-log / how-to-log の 3 決定に分解し、5 系統の手法へ整理する。本レビュー固有の守備範囲。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 5 Log Parsing]] — ログパースを 4 系統の方法論ファミリへ整理し、脆い区切り規則や固定閾値を意味的一般化へ置き換えるという共通の動きを抽出する。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.1 Downstream Log Analysis Tasks - Log Representation]] — 分割 → 表現 → タスク推論 → 行動という下流の共通ワークフロー(Fig. 5)と、記号列・特徴ベクトル・埋め込みという表現 3 類型。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.2 Downstream Log Analysis Tasks - Anomaly Detection]] — 最多タスク(70 レコード・重複排除後 60・43.2%)。表現インタフェース・教師あり設定・適応戦略・推論形式の 4 設計軸と 7 手法ファミリ。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.3 Downstream Log Analysis Tasks - Failure Prediction and Root Cause Analysis]] — 障害予測は疎(3 レコード)。RCA は 25(重複排除後 20)で急増しており、関心が「何が壊れたか」から「なぜ・どう対処するか」へ移ったと述べる。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 6.5 Downstream Log Analysis Tasks - Log Summarization]] — structure-then-generate パターン。品質が生成能力よりも上流のログ準備・選別段階に律速される点を指摘する。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 7 Cross-Cutting Insights and Future Directions]] — 本レビューの中核。5 つの適応パラダイムの比較(Table 9)、階層設計という共通形、そして deployment 証拠がわずか 5 件という評価実践の断片化。(paper / log-analysis / llm / aiops)
- [[@2026__arXiv__LLM4Log - A Systematic Review of Large Language Model-based Log Analysis - Chapter 8 Conclusion]] — LLM の利点(意味的汎化・証拠統合・運用者支援)と課題(評価・グラウンディング・プライバシー・コスト・実務性)の総括。第 7 章の要約であり新規主張はない。(paper / log-analysis / llm / aiops)
### 2026-08-25 ingest-thesis | A Survey of LLM × DATA(Zhou ほか、arXiv、2025)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 1 INTRODUCTION]] — DATA4LLM と LLM4DATA の双方向の構図を示し、先行 4 サーベイに対する差分(パイプライン全体の横断的視点と LLM4DATA の新規性)を主張する。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] — 独自貢献の IaaS 4 次元(包括性・充足性・明瞭性・無害化)を定義し、LLM ライフサイクル 7 段階のデータ特性差を Table 1 で比較する。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]] — 獲得(Web スクレイピング+レイアウト解析)・重複排除 4 系統・フィルタリング 2 軸を Table 2〜4 で網羅する。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]] — データ選択 3 系統とデータ混合(訓練前/訓練中 × 4 系統)を Table 5・6 で網羅し、混合が IaaS の充足性次元を具体化すると示す。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]] — 合成データの 5 用途と蒸留 3 系統、RefinedWeb / DCLM-Baseline / FineWeb の 3 パイプラインの設計トレードオフ比較。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.4 Data Storage for LLM]] — 形式・分散配置・組織化・移動・耐障害・KV キャッシュの 6 分野。3FS の CRAQ とページキャッシュ完全無効化の設計を含む。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.5 Data Serving for LLM]] — シャッフリング・圧縮・パッキング・来歴の 4 分野。データ来歴はマーカー埋め込みと統計的検知の 2 系統。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.1 LLM for Data Manipulation]] — データクリーニング・統合・発見の 3 タスクを、プロンプト/エージェント/RAG/ファインチューニングの技法軸で整理する。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.2 LLM for Data Analysis]] — 構造化・半構造化・非構造化の 3 データ型。半構造化は SOTA と人間の性能差が 20〜50% と報告される未成熟領域。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.3 LLM for Data System Optimization]] — 構成チューニング・クエリ最適化・異常診断の 3 タスク。異常診断だけがマルチエージェント協調と蒸留の 2 系統を追加して 4 系統になる。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]] — DATA4LLM 側 5 項目・LLM4DATA 側 4 項目の課題を「限界 → 具体例 → 有望な方向性」の型で提示する。(paper / llm / data-management)
- [[@2025__arXiv__A Survey of LLM × DATA - Chapter 5 Conclusion]] — 1 段落の総括。結論部が述べる課題 3 観点と第 4 章の 2 節構成が一致しない点を記録した。(paper / llm / data-management)
### 2026-08-28 ingest-paper | MagmaScope(Li ほか、ICSE-SEIP、2026)
- [[@2026__ICSE-SEIP__MagmaScope Identifying Root-Cause Changes for Emergency Incident in Large-Scale Cloud Infrastructure]] — ByteDance+PKU 共同開発の緊急インシデント根本原因変更特定ハイブリッドシステム。変更チケット+IM グループチャットを入力に、変更チケット検索・軽量ランキング・LLM エージェント推論の 3 段パイプラインで Top@5 74.7%、Top@10 89.8% を達成。1 年超本番稼働・10 以上のビジネスグループに展開。(paper / aiops / root-cause-analysis / change-management)
### 2026-08-28 ingest-paper | A Definition of AGI
- [[@2025__arXiv__A Definition of AGI]] — Dan Hendrycks ほかによる、AGI を十分な教育を受けた成人の認知的な多様性と熟達度で定義し、CHC 理論に基づく十領域の AGI Score を提示する論文。GPT-4 は27%、GPT-5 は57%だが、長期記憶保存は両モデルとも0%(paper / artificial-general-intelligence / llm-evaluation)
### 2026-08-25 ingest-thesis | Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications(Xin ほか、ACM CSUR、2025)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 1 Introduction]] — 信頼できる AI の一般要件と性能診断の技術詳細を統合したサーベイが存在しないという空白を示し、3 つのサブクエスチョンと調査手法・貢献を提示する。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 2 Trustworthiness Requirements and Performance Diagnosis Systems]] — EU AI HLEG の 7 要件から 6 つの技術的要件を抽出し、Table 1 の 12 研究から導いた 4 構成要素フレームワークへ対応づける、本レビューの理論的骨格。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.0 State-of-the-Art Technologies - Overview]] — 効率性・データプライバシー・人間の介入の定義を締めくくり、6 要件をフレームワークへ統合する橋渡し章(Figure 2)。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.1 Data Collection]] — 性能データをログ・トレース・監視メトリクスの 3 種に分け、不均衡とラベル欠如に対する公平性要件をサンプリングとアノテーションの 2 系統で扱う。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.2 Data Preprocessing]] — ログ解析・時系列特徴量エンジニアリング・その他前処理の 3 系統と、頑健性・説明可能性・効率性の 3 要件の対応。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.3 Performance Anomaly Detection]] — 教師あり/教師なし/半教師ありの 3 系統(Table 2)に、公平性・頑健性・説明可能性・効率性の **4 要件すべて**が課される唯一の構成要素。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.4 Root Cause Localization]] — 粗粒度/細粒度の 2 水準とログ/トレース/メトリクスの 3 系統。監視メトリクスの因果推論手法の頑健性研究の空白を名指しする。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.5 System-Level Trustworthiness Requirements]] — データプライバシーと人間の介入だけは特定の構成要素に紐づかないシステムレベル要件であると位置づける(Figure 10)。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 4 Future Research Directions and Opportunities]] — Table 3(6 要件 × 4 構成要素)を踏まえた 5 つの将来方向と、本レビューが扱わなかった倫理的要件の明示。(paper / trustworthy-ai / performance-diagnosis / cloud)
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 5 Conclusion]] — 6 要件 × 4 構成要素を 13 の要件へ畳み込んだ総括と、実時間検知・頑健な根本原因特定・倫理的要件を今後の課題とする結論。(paper / trustworthy-ai / performance-diagnosis / cloud)
### 2026-08-25 ingest-thesis | Anomaly detection and root-cause identification in microservices(Barata ほか、Cluster Computing、2026)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 1 Introduction]] — Alibaba の 3 万超サービスや Amazon の 2013/2018 年障害を引き、CloudWatch 級の監視と Chaos Monkey 級の試験ではマイクロサービスに不十分だと論じ、TDAI の観点を導入する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 2 Related surveys and contribution]] — 7 ライブラリを PRISMA で走査し、マイクロサービスに直接焦点を当てた先行サーベイは Soldani & Brogi と Zhang ほかの 2 件のみと同定する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 3 Background on microservices and anomaly detection]] — 点・文脈的・集団的の異常 3 類型と教師なし/教師あり/半教師ありの 3 アプローチ、障害 5 分類(Figure 2)という基礎の枠。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.1 Anomaly detection in a microservices environment - Overview]] — 検索 10,485 件から選定に至る手続きと、採択論文の 86% が 2020〜2024 年・70% が中国機関という分布。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.2 Data collection methods]] — データ収集をログ・分散トレーシング・監視(メトリクス)の 3 分類で整理し、それぞれの限界を対比する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.3 Methods to identify anomalies in microservices]] — 検知アルゴリズムを教師なし・教師あり・強化学習・トレース比較・統計分析の 5 分類で整理する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.4 Types of anomalies detected]] — ワークフロー・性能・セキュリティの異常 3 型。内訳は性能 65%・ワークフロー 25%・セキュリティ 10%(Fig. 5)。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.5 Root-cause identification]] — RCI 手法を ML・グラフベース・統計の 3 型で整理。集計ではグラフベースが 58% で最多。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]] — 22 件のテストベッドを集計。Train Ticket 31%・Sock Shop 22% が上位で、**Sock Shop の非推奨化**を明記する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.7 Methods comparison]] — 26 件のデータセットと手法カテゴリ別の平均性能、および parallel-sets ダイアグラム(Figure 7)による 3 軸の流れの可視化。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 5 Discussion]] — RQ1〜RQ5 への回答。RCI をルールベース・学習ベース・ケースベース・モデルベースの 4 分類へ再整理し、手法間比較の本質的な困難も明言する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 6 Challenges, open issues, and directions to future investigations]] — **Trusted Distributed AI(TDAI)** を信頼性・一貫性・説明可能性・頑健性・因果妥当性・スケーラビリティ・テレメトリ完全性の 7 次元へ分解(Table 10)し、13 の将来研究方向を挙げる。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 7 Conclusion]] — 単一の手法だけではスケーラビリティ・説明可能性・実時間性のすべてに応えられないとし、TDAI への発展を結論に置く。(paper / microservices / anomaly-detection / root-cause-analysis)
### 2026-08-25 ingest-thesis | A Survey on Failure Analysis and Fault Injection in AI Systems(Yu ほか、ACM TOSEM、2025)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 1 Introduction]] — AI システムを 6 層に分解し、RQ1(頻発する障害)・RQ2(FI が模擬できる障害)・RQ3(両者のギャップ)を掲げる。6 層の立体図は各層に §4〜§9 の対応が振られる。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 2 Background and Definitions]] — Failure / Fault の定義、AI 対クラウドの障害比較、FA → FI の 4 段階ライフサイクルを定義する。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 3 Survey Methodology]] — Scopus + 双方向スノーボーリング(331 → 38 → 142 件、Cohen's κ=0.82)による収集と 6 層マッピングの手続き。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 4 FA and FI in AI Service]] — FA 5 分類 9 種、FI 4 次元 6 ツール。Defective Code と Configuration Fault が既存 FI ツール全てで未対応。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 5 FA and FI in AI Model]] — FA 3 分類 10 種。FI はミューテーションテストとして 4 ツール・11 変異グループで比較する。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 6 FA and FI for AI Framework]] — 障害 6 グループ 16 種、FI 8 ツールはすべて計装ベース。4 種が未対応で TensorFlow 1/2 のダイバージェンスも課題。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 7 FA and FI for AI Toolkit]] — 障害 4 グループ 11 種、FI 4 ツールはファジング中心。NCCL / NVLink Fault ほか 5 種が未対応で分散・並列計算向け FI 能力が欠如する。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 8 FA and FI for AI Platform]] — 障害 10 型、FI 5 ツールで 6 型が未対応。既存ツールが従来型クラウド基盤向け設計で AI 特化の GPU 資源競合を扱えない。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 9 FA and FI for AI Infrastructure]] — 障害 10 型、FI 11 ツールで 4 型が未対応。GPU/FPGA 向け FI の大半がソフトウェア/シミュレーションベースでリアリズムを欠く。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 10 Threats to Validity]] — 研究選定妥当性とデータ妥当性(データ抽出プロトコル・6 層分類・専門家レビュー、κ=0.82)。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 11 Future Opportunities of FI in AI Systems]] — 狙い撃ちしたカバレッジ拡大、層横断・複数同時注入、知的 FI ポリシー生成、フレームワーク横断の統一ツール、非計装型注入。(paper / fault-injection / ai-systems / reliability)
- [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems - Chapter 12 Conclusion]] — 6 層にわたる FA と FI の整理とギャップの提示を総括する。(paper / fault-injection / ai-systems / reliability)
### 2026-08-25 ingest-thesis | Failure Diagnosis in Microservice Systems(Zhang ほか、arXiv、2024)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 1 Introduction]] — 既存サーベイ 8 本の 4 つの空白(RCL/FC 未分離・単一モーダル偏重・実務観点欠如・公開資源未統合)を指摘し、98 論文対象の包括サーベイを提案する。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 2 Methodology]] — 12 会議・5 誌・5 リポジトリから 2,548 本を収集し、除外基準・品質評価・スノーボーリングで 98 本に絞る手続き。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 3 Terminologies]] — マルチモーダルデータ 5 種の定義、根本原因箇所特定(ランキング問題)と障害分類(分類問題)の定式化、3 段階粒度、障害 6 タイプ。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.1 Failure Diagnosis Through Logs]] — 原理(統計/ルール・ML・DL)による 3 分類。診断粒度がコンポーネントレベルに偏る。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.2 Failure Diagnosis Through Metrics]] — 直接分析・ウォーク・サーチ・特徴抽出・その他の 5 分類、47 手法。PC アルゴリズムとランダムウォーク/PageRank が主流。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.3 Failure Diagnosis Through Traces]] — 特徴抽出 → 異常検知 → 根本原因分析の 3 段階パイプラインとして整理し、RCA をさらに 4 種に細分する。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 4.4 Failure Diagnosis Through Multimodal Data]] — result fusion → model fusion → feature fusion の 3 系統。単一モダリティでは捕捉できない障害の検知と細粒度の原因特定を可能にする。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 5 Discussion]] — 動向・粒度と説明可能性・特性と移植性・精度とコスト・最良実践の 5 観点で総括する。定量比較表を持たない完全に定性的な章。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] — 公開データセット・ツールキット 20 種・評価指標(RCA のランキング指標、障害分類の P/R/F1 系)を集約する、本サーベイで最も実務価値の高い章。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 7 Related Work]] — 先行サーベイとの守備範囲の違いを 4 群に整理する。(paper / microservices / failure-diagnosis / aiops)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 8 Conclusions]] — マルチモーダルデータによる障害診断技術を 2003 年から包括的に検討した初のサーベイであることを総括する。(paper / microservices / failure-diagnosis / aiops)
### 2026-08-25 ingest-thesis | A Survey of AIOps in the Era of Large Language Models(Zhang ほか、ACM CSUR、2025)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 1 Introduction]] — LLM 時代の AIOps 全工程を扱う初の包括サーベイとして自身を位置づけ、RQ1〜RQ4 の 4 研究設問を定義する。(paper / aiops / llm)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 2 Systematic Review Process]] — 5 データベース検索・採録/除外基準・4 段階の漏斗(761 → 614 → 395 → 163 本)による文献選定プロセス。(paper / aiops / llm)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 3 RQ1 - Transformations in Data with LLM Integration]] — 既存データへの LLM ベース処理(ログパースが最活発)と、ソフトウェア情報・ソースコード・QA・インシデントレポートという人間生成データ源の新規取り込みの 2 軸。(paper / aiops / llm)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 4 RQ2 - Evolving Tasks in AIOps with LLMs]] — AIOps を障害知覚 → 根本原因分析 → 支援型緩和の 3 段 8 タスクに整理し、LLM 時代の新規 5 タスクを従来タスクと区別する。(paper / aiops / llm)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 5 RQ3 - LLM-based Methods for AIOps]] — 手法を foundation model・fine-tuning・embedding-based・prompt-based・knowledge-based の 5 分類で整理する。(paper / aiops / llm)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 6 RQ4 - Evaluating LLM-based AIOps]] — 評価指標を分類・生成・実行・手動評価の 4 分類(うち 3 つが新規)に整理し、新規データセットが支援修復タスクに偏在すると報告する。(paper / aiops / llm)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 7 Challenges and Future Directions]] — 時間効率と費用対効果、多様なデータ源の深い活用、ソフトウェア進化への汎化性、既存ツールチェーンとの統合という 4 課題。(paper / aiops / llm)
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models - Chapter 8 Conclusion]] — LLM が AIOps を再形成しているという総括と RQ1〜RQ4 の要約。(paper / aiops / llm)
### 2026-08-25 ingest-thesis | D'ya like DAGs? A Survey on Structure Learning and Causal Discovery(Vowels ほか、ACM CSUR、2022)
- [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 1 Introduction]] — 介入実験が行えない状況を出発点に、未観測交絡・選択バイアス・因果関係の事前未知性という 3 課題を提示し、連続最適化に主眼を置く立場を述べる。(paper / causal-discovery / structure-learning)
- [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 2 Background - Definitions and Assumptions]] — 本サーベイの理論的土台。因果マルコフ条件・忠実性・因果的十分性・識別可能性を定義し、DAG → CPDAG → ADMG/MAG → PAG というグラフ表現の階層を提示する。(paper / causal-discovery / structure-learning)
- [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 3 Structure Discovery Methods]] — 手法の全体地図。制約ベース・スコアベース・構造的非対称性・介入利用の 4 系統に整理し、加法ノイズモデル・時系列因果性・評価指標を導入する。(paper / causal-discovery / structure-learning)
- [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 4 Combinatoric and Search Based Approaches]] — DAG 空間の超指数的爆発と NP 困難性を示し、連続最適化を用いない 71 手法を 6 列で一覧する。(paper / causal-discovery / structure-learning)
- [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 5 Continuous Optimization Based Approaches]] — 本サーベイの中心章。非巡回性を等式制約へ置き換える転換を NO TEARS 起点に体系化し、計算量削減・制約緩和・非線形化の 3 系譜で 30 手法を整理する。(paper / causal-discovery / structure-learning)
- [[@2022__CSUR__D'ya Like DAGs - A Survey on Structure Learning and Causal Discovery - Chapter 6 Summary and Discussion]] — 残る技術的課題を挙げたのち、構造発見の出力を因果と解釈することへの哲学的批判(因果の跳躍)を論じ、探索的用途では有用と結論する。(paper / causal-discovery / structure-learning)
### 2026-08-25 ingest-thesis | A Survey of DevOps Concepts and Challenges(Leite ほか、ACM CSUR、2019)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 1 Introduction]] — DevOps が広く合意された定義を欠く現状を踏まえた独自定義、エンジニア / 管理者 / 研究者の 3 視点の枠組み、既存サーベイとの差別化、ロードマップ。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 2 DevOps]] — 定義の再掲とアジャイル運動からの進化、開発 / 運用のサイロとチケットシステムの問題、2008 年の命名、継続的デリバリ / デプロイメントとの関係、SRE の初出言及。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 3 Study Design]] — 検索・選定プロトコル(198 → 153 → 50 件)と、Grounded Theory によるオープンコーディング・定数比較法で概念枠組みを構築する設計。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 4 Sources of Knowledge]] — 知識源を査読付き文献・関連 SLR・書籍・その他に分類する。DevOps 専業の査読媒体は存在せず、グレー文献が正規の知識源として列挙される。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 5 Fundamental Concepts]] — 本サーベイの中核。DevOps の基礎概念を全体概念地図と process / people / delivery / runtime の 4 領域別概念地図として提示する。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 6 Toolset]] — ツールを 7 カテゴリに分類し第 5 章の概念地図へ対応づける。コンテナ化 対 継続的構成収束を未解決の技術論争として論じる。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 7 Implications for Engineers, Managers, and Researchers]] — 文献知見をエンジニア 15 項目・管理者 9 項目・研究者 3 項目の 3 節へ切り分けて再編成する。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 8 Unresolved Challenges]] — アーキテクチャ再設計・組織への導入方法・品質評価・教育という 4 課題を、対立する立場を明示しながら論じる。(paper / devops / software-engineering)
- [[@2019__ACM CSUR__A Survey of DevOps Concepts and Challenges - Chapter 9 Limitations of This Study and Conclusions]] — 文献選定の恣意性と出版バイアスを自己申告し、協働側のコンセンサス不足と組織構造の未決着を結論する。(paper / devops / software-engineering)
### 2026-08-25 ingest-thesis | Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications(Soldani & Brogi、ACM CSUR、2021)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 1 Introduction]] — サービス間相互作用の増殖がカスケード障害の切り分けを困難にするという問題設定と本サーベイの目的・構成。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 2 Terminology]] — failure / anomaly、application-level / service-level anomaly、RCA 対 debugging、観測データ 4 種の定義。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.1 Log-based Anomaly Detection Techniques]] — 正常運用時ログから制御フローグラフを教師なしで採掘し、逸脱で機能的異常を検知する(OASIS ほか)。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.2 Distributed Tracing-based Anomaly Detection Techniques]] — 教師なし学習(TraceAnomaly)・教師あり学習(MEPFL)・トレース比較の 3 系統。トレース比較のみオフライン限定。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.3 Monitoring-based Anomaly Detection Techniques]] — 教師なし学習・教師あり学習・SLO Check・ハートビートの 4 型。後 2 者は機械学習を使わない。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 3.4 Discussion (Anomaly Detection)]] — 25 手法を 5 軸で整理し、異常の型と粒度 対 導入コストのトレードオフ、訓練問題、説明可能性を総括する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.1 Log-based and Distributed Tracing-based Root Cause Analysis Techniques]] — ログベースは因果グラフ分析の 1 系統のみ、トレースベースは可視化・直接分析・トポロジグラフの 3 系統。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.3 Monitoring-based Root Cause Analysis Techniques]] — 直接分析・トポロジグラフ分析・因果グラフ分析の 3 分類。全 15 手法を入力/グラフ構築/絞り込み/出力で比較する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.4 Discussion (Root Cause Analysis)]] — 25 手法を 7 軸で整理し、原因の詳細度 対 導入コスト、相関 ≠ 因果という原理的限界、説明可能性と対処策を総括する。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 5 Related Work]] — 先行 6 件との守備範囲の比較。異常検知と RCA を一体で詳細に扱う初のサーベイと位置づける。(paper / microservices / anomaly-detection / root-cause-analysis)
- [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 6 Conclusions]] — 性能の定量比較・経時変化への対応・説明可能性・対処策推薦の 4 方向を今後の課題として挙げる。(paper / microservices / anomaly-detection / root-cause-analysis)
### 2026-08-25 ingest-thesis | A Tutorial on Kernel Density Estimation and Recent Advances(Yen-Chi Chen、arXiv、2017)
- [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 1 Introduction and Statistical Properties]] — KDE の定義と基本性質。3 種の誤差指標のもとでの収束率、密度導関数の推定、帯域幅選択の 5 手法(経験則・LSCV・biased CV・plug-in・Lepski)を理論的に分類する。(paper / statistics / density-estimation)
- [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 3 Confidence Intervals and Confidence Bands]] — 本チュートリアルの核心。局所被覆と同時被覆を区別し、KDE のバイアスが被覆保証を真の密度からその期待値へすり替える問題と、3 つの対処戦略を整理する。(paper / statistics / density-estimation)
- [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 4 Geometric and Topological Features]] — 密度関数の形から取り出せる構造(局所モード・レベル集合・リッジ・Morse-Smale 複体・クラスタツリー・パーシステント図)の推定。(paper / statistics / density-estimation)
- [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 5 Estimating the CDF]] — KDE を積分して累積分布関数と ROC 曲線を推定する。最適帯域幅のもとでは CDF 推定の収束率が経験分布関数と同じに帰着する。(paper / statistics / density-estimation)
- [[@2017__arXiv__A Tutorial on Kernel Density Estimation and Recent Advances - Chapter 6 Conclusion and Open Problems]] — 信頼帯の因果推論への拡張、多次元 KDE の可視化、幾何的・位相的構造の一様推論という 3 つの未解決問題を挙げる。(paper / statistics / density-estimation)
### 2026-08-25 ingest-thesis | A Survey of Online Failure Prediction Methods(Salfner・Lenk・Malek、ACM CSUR、2010)
- [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 1 Introduction]] — 古典的な信頼性工学(設計時・長期統計)と対比してオンライン障害予測(実行時監視・短期評価)を定義し、根本原因分析との時間軸の違いとプロアクティブ障害管理の 4 段階枠組みを提示する。(paper / failure-prediction / dependability)
- [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 2 Definitions]] — fault → error(undetected / detected)→ symptom → failure の 5 段階連鎖と、t_d・t_l・t_p・t_w からなる予測の時間軸を確立する。本サーベイが後続研究に与えた最大の資産のひとつ。(paper / failure-prediction / dependability)
- [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 3 Evaluation Metrics]] — 混同行列を基礎に適合率・再現率・F 値・偽陽性率・特異度・NPV・正解率・オッズ比を定義し、PR 曲線・ROC/AUC と有限テストデータからの指標推定を扱う。(paper / failure-prediction / dependability)
- [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 4 A Taxonomy of Online Failure Prediction Methods]] — 本サーベイの中核。手法を「fault をどう可視化するか」で 4 分岐(failure tracking / symptom monitoring / detected error reporting / undetected error auditing)し、各枝を principal approach → category へ階層分解する。(paper / failure-prediction / dependability)
- [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 5 Survey of Prediction Methods]] — 最長章。第 4 章の分類体系を約 50 の実手法で埋める。制御理論・自然言語処理・生物配列解析など他分野からの技術移植が多い。(paper / failure-prediction / dependability)
- [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 6 Summary and Conclusions]] — 全手法一覧(Table III、47 行)を第 4 章の枝番号と対応づけて示し、ディペンダビリティが恒久的課題であり続ける 7 要因を論じる。(paper / failure-prediction / dependability)
### 2026-08-25 ingest-thesis | A Survey of AIOps Methods for Failure Management(Notaro・Cardoso・Gerndt、ACM TIST、2021)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 1 Introduction]] — AIOps が未構造な研究領域であることを示し、障害管理 / 資源配分という最上位 2 区分を立て、障害管理に絞る理由と 3 つの目的を述べる。(paper / aiops / failure-management)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 2 Related Work and Methodology]] — 先行 21 件を整理して埋める空白を示し、1,086 件から 100 件への選定手続き・評価指標・用語規約を定義し、介入の時間窓 × 対象問題という 2 軸の分類体系(5 カテゴリ・14 サブカテゴリ)を導入する。(paper / aiops / failure-management)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.1 Failure Prevention]] — SDP・障害注入・ソフトウェア若返り・チェックポインティングの 4 サブカテゴリ。研究密度は 671 件中 71 件(10.6%)で FM 中 2 番目に少ない。(paper / aiops / failure-management)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.2 Online Failure Prediction]] — hardware(SMART → HMM/SVM/RNN で再現率 0.33 → 90% 台後半)と system(ログ/KPI から多様な手法)の 2 サブカテゴリ。(paper / aiops / failure-management)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.3 Failure Detection]] — 異常検知・Internet Traffic Classification・Log Enhancement の 3 サブカテゴリ。異常検知が障害検知の主流。(paper / aiops / failure-management)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.4 Root-cause Analysis (RCA)]] — fault localization と root-cause diagnosis を区別し、加えて RCA 支援ツール群を扱う 3 サブカテゴリ。(paper / aiops / failure-management)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 4.5 Remediation]] — incident triage・solution recommendation・recovery の 3 サブカテゴリ。レビュー対象はわずか 6 件で 5 カテゴリ中最も薄い。(paper / aiops / failure-management)
- [[@2021__TIST__A Survey of AIOps Methods for Failure Management - Chapter 5 Conclusion]] — 出版数は年平均 100 件以上で安定成長する一方、標準化とベンチマークが不足し単一データソース依存が続くことを指摘する。(paper / aiops / failure-management)
### 2026-08-25 ingest-thesis | Efficient Large Language Models: A Survey(Zhongwei Wan ほか、TMLR、2024)
- [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 1 Introduction]] — LLaMA 系列の学習 GPU 時間の指数関数的増大を動機に、モデル中心・データ中心・フレームワーク中心という 3 分類の taxonomy を提示する導入章。(paper / llm / efficiency)
- [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 2 Model-Centric Methods]] — 本サーベイ最大の章。モデル圧縮・効率的事前学習・効率的ファインチューニング・効率的推論・効率的アーキテクチャ設計の 5 節がそれぞれ taxonomy 樹形図を持つ。(paper / llm / efficiency)
- [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 3 Data-Centric Methods]] — データ選別(事前学習用・ファインチューニング用)とプロンプト工学(few-shot・プロンプト圧縮・プロンプト生成)の 2 系統。モデルを触らずに効率を得る経路。(paper / llm / efficiency)
- [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]] — 学習・微調整・推論の対応可否でフレームワークを三分類し、学習系 8 種と推論専用 7 種を Table 2 で機能横断比較する。(paper / llm / efficiency)
- [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 5 Concluding Remarks]] — taxonomy に沿ったレビューを総括し、効率性が今後ますます重要な役割を果たすと述べる短い結論章。(paper / llm / efficiency)
### 2026-08-25 ingest-thesis | Trade-Offs Under Pressure(John Allspaw、Lund University 修士論文、2015)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 1 Background]] — インターネットサービスの基盤化を数値で示し、運用環境を「不透明な手術室」の比喩で提示する背景章。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 2 Literature Review]] — 安全科学・認知システム工学の系譜を辿り、ソフトウェア運用領域には回復活動そのものを扱う研究が欠けているという「A Gap Found」論証から研究設問へ至る。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 3 Research Design]] — 事例研究法とプロセストレーシングを組み合わせ、行動プロトコルと言語プロトコル(IRC 記録・刺激想起面接)を 8 名から収集する設計。分析的一般化とバイアスを明示的に検討する。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 4 Event Description]] — 2014 年 12 月 4 日、Etsy.com のサインイン済みホームページで起きた性能劣化を検知から緩和まで時系列で記述する。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 5 Results]] — 8 名の発話・行動データをコーディングし、5 つの協調エピソード・5 つの診断仮説の生成過程・擾乱管理活動を提示する中心章。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 6 Analysis]] — 第 5 章の生データを解釈し、4 つのヒューリスティックを定式化する。アンケート(n=32)とアブダクション推論の枠組みで裏づける。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 7 Discussion]] — 知見を Woods(1995a)の異常対応モデルへ接続し直し、訓練とインターフェース設計への含意、研究の限界、4 つの未解決の問いを述べる。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Chapter 8 Conclusions]] — 4 つのヒューリスティックを提示し、成功の主因はソフトウェアの疑似知能ではなくエンジニアの専門知識と暗黙知にあると結論する。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Appendix A Initial coding schema]] — 初期 12 コードと first-order code へのグルーピング、別コーダーによる一致率 79.6% の信頼性検証。(thesis / sre / incident-response / human-factors)
- [[@2015__MSc__Trade-Offs Under Pressure - Appendix B Coordinative Episodes Coding Schema]] — 協調エピソードに 3 コード(SoA/RFF・FoA/Art・AS)を付与する分析戦略を、エピソード #1 の全 26 発話を例に提示する。(thesis / sre / incident-response / human-factors)
### 2026-08-25 ingest-thesis | Anomaly Detection: A Survey(Chandola・Banerjee・Kumar、ACM CSUR、2009)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 1 Introduction]] — 異常検知をノイズ除去・ノイズ許容・ノベルティ検知から定義的に切り分け、6 つの困難要因を挙げ、本サーベイ固有の記述様式(仮定明示 + 基本技法テンプレート)を宣言する導入章。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 2 Different Aspects of an Anomaly Detection Problem]] — 入力データの性質・異常の種類(点/文脈/集合)・ラベル可用性・出力形式という 4 軸で問題を定式化する。本サーベイの分類体系の中核。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 3 Applications of Anomaly Detection]] — 侵入検知・不正検知・医療/公衆衛生・産業被害検知・画像処理・テキスト・センサネットワークの 7 分野を、異常の概念/データの性質/課題/技法の 4 側面で横断整理する。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 4 Classification Based Anomaly Detection Techniques]] — 仮定=識別器が特徴空間上で学習できる。多クラス/一クラスに分かれ、ニューラルネットワーク・ベイジアンネットワーク・SVM・ルールベースの 4 群。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 5 Nearest Neighbor-Based Anomaly Detection Techniques]] — 仮定=正常は密な近傍を持ち異常の近傍は疎。k 番目近傍距離ベースと相対密度ベース(LOF・COF)の 2 群。O(N²) が共通の課題。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 6 Clustering-Based Anomaly Detection Techniques]] — 仮定が 3 通り(クラスタ非所属/重心から遠い/小さく疎なクラスタ)に分かれ、互いの弱点を補う系列をなす。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 7 Statistical Anomaly Detection Techniques]] — 仮定=正常は確率モデルの高確率領域に生じる。パラメトリック(ガウシアン・回帰・混合分布)とノンパラメトリック(ヒストグラム・カーネル関数)の 2 系統。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 8 Information Theoretic Anomaly Detection Techniques]] — 仮定=異常はデータ集合の情報量に不規則性をもたらす。C(D)−C(D−I) を最大化する最小部分集合を求めるパレート最適化として定式化される。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 9 Spectral Anomaly Detection Techniques]] — 仮定=正常と異常が顕著に異なる低次元部分空間へ埋め込める。PCA 系とグラフ時系列向け特異ベクトル分解。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 10 Handling Contextual Anomalies]] — 点異常向け技法を文脈異常・集合異常へ拡張する 2 経路(点異常検知への還元 / データ内の構造の利用)。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 11 Relative Strengths and Weaknesses of Anomaly Detection Techniques]] — 訓練/検証コスト・ラベル要求・距離尺度依存・希少性仮定という 4 つの運用指向の軸でカテゴリを横並び比較する。(paper / anomaly-detection / machine-learning)
- [[@2009__CSUR__Anomaly Detection - A Survey - Chapter 12 Concluding Remarks and Future Work]] — 仮定の統一的枠組みへの統合を課題とし、文脈/集合異常・分散/プライバシー保護・オンライン処理・複雑システムという 4 方向を示す。(paper / anomaly-detection / machine-learning)
### 2026-08-25 ingest-thesis | Agentic Failure Management of Cloud Systems(Yinfang Chen、UIUC 博士論文、2026)
- [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 1 Introduction]] — 信頼性エンジニアリングが人手中心であることを課題とし、予防・診断・緩和・評価の 4 課題に 4 貢献(Rainmaker・RCACopilot・STRATUS・AIOpsLab)を対応させる俯瞰章。(thesis / aiops / cloud-reliability)
- [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 2 Reliability Testing for Cloud-Backed Applications]] — **Rainmaker**。エラー処理バグの 4 パターン分類と 4 種の障害注入ポリシー・2 種の汎用オラクルにより、11 個の .NET アプリケーションで新規バグ 73 件を偽陽性率 1.96% で検出する。(thesis / aiops / cloud-reliability)
- [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 3 Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]] — **RCACopilot**。診断情報収集ハンドラと LLM の few-shot CoT を組み合わせ、Micro-F1 0.766 を Microsoft の 30 超チーム・4 年以上の本番運用で達成する。(thesis / aiops / llm-agent)
- [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 4 A Multi-Agent System for Autonomous Site Reliability Engineering]] — **STRATUS**。検知・診断・緩和・巻き戻しの 4 エージェントを決定論的な状態機械で統率し、安全仕様 Transactional No-Regression により不成功の緩和が必ず巻き戻せることを保証する。(thesis / aiops / llm-agent)
- [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 5 Evaluating AI Agents for Autonomous Cloud Operations]] — **AIOpsLab**。P=⟨T,C,S⟩ 定式化・Agent-Cloud Interface・Orchestrator を備えたエンドツーエンドのベンチマーク。48 問題での評価で最高は FLASH の 59.32%。(thesis / aiops / llm-agent)
- [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 6 Conclusion and Future Work]] — 4 システムを振り返り、TNR の保証が人間の定義する health condition の網羅性に条件づけられる点と自律緩和の社会的含意を論じ、5 方向の今後を示す。(thesis / aiops / cloud-reliability)
### 2026-08-24 ingest-paper | The Design and Implementation of Open vSwitch
- [[@2015__NSDI__The Design and Implementation of Open vSwitch]] — Ben Pfaff ほか(VMware / Awake Networks)。USENIX NSDI '15 Best Paper。Open vSwitchの2層フローキャッシュ(マイクロフロー+メガフロー)とキャッシュを意識したタプル空間探索パケット分類器(タプル優先度ソート・ステージドルックアップ・プレフィックストラッキング・分類器パーティショニング)の設計を、7年間の実運用経験と大規模データセンター(Rackspace)の統計に基づいて報告する。(paper / networking / sdn / virtualization)
### 2026-08-24 ingest-slides | HPCネットワークの多様化に挑む - マルチベンダー×マルチOSで支えるHPCネットワーク運用の実際
- [[@2026__JANOG57__HPCネットワークの多様化に挑む - マルチベンダー×マルチOSで支えるHPCネットワーク運用の実際]] — SAKURA Internetの黒澤潔裕氏がJANOG57で発表。マネージドHPCクラスタ「さくらONE」の最新B200クラスタ(約140サーバー・約1100GPU、Clos Topology)を題材に、シャーシ vs Clos・Arista EOS vs SONiCの選定基準と、GPU基盤特有のClos制約(N+0運用・Full bisectionによるケーブル倍増)、Ansible/CIによるconfig自動生成・冪等性確保を報告する。(slides / networking / gpu-cluster / hpc)
### 2026-08-24 ingest-slides | SONiCで構築・運用する生成AI向けパブリッククラウドネットワーク
- [[@2025__SpeakerDeck__SONiCで構築・運用する生成AI向けパブリッククラウドネットワーク]] — SAKURA Internetの黒澤潔裕氏がSONiC Workshop Japan 2025で発表。生成AI向けGPUクラウド「高火力」のClos topology + SONiC基盤を、4か月の短納期・少数精鋭内製・自動化前提で構築した経緯と、jsondiff+dry run+applyによるconfig冪等性実装・SONiC特有の構成管理/品質保証課題を報告する。(slides / networking / sonic)
### 2026-08-24 ingest | RFC 8365 - A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN)(Ali Sajassi ほか、IETF、2018-03)
- [[@2018__IETF__A Network Virtualization Overlay Solution Using Ethernet VPN (EVPN)]] — EVPN(RFC 7432)を VXLAN・NVGRE・MPLS over GRE の上に載せ、マルチテナントデータセンター向けの Network Virtualization Overlay(NVO)ソリューションへ転用する Standards Track。VNI-to-EVI マッピング、Local Bias スプリットホライズン、DCI の GW/ASBR 方式を規定する。
### 2026-08-24 ingest | RFC 7348 - Virtual eXtensible Local Area Network (VXLAN)(M. Mahalingam ほか、RFC Editor、2014-08)
- [[@2014__RFC__Virtual eXtensible Local Area Network (VXLAN) - A Framework for Overlaying Virtualized Layer 2 Networks over Layer 3 Networks]] — マルチテナント仮想化データセンター向けのL2オーバーレイ方式VXLANを定義する Independent Submission(Informational)。24 bit VNI・VTEPによるステートレスなカプセル化・データプレーン学習を規定する。
### 2026-08-24 ingest | RFC 7432 - BGP MPLS-Based Ethernet VPN(Ali Sajassi ほか、IETF、2015-02)
- [[@2015__RFC__BGP MPLS-Based Ethernet VPN]] — EVPN の基礎仕様。ES/ESI・4 種類の BGP EVPN ルート(A-D・MAC/IP Advertisement・Inclusive Multicast Ethernet Tag・Ethernet Segment)・DF 選出の service carving・MAC Mobility を規定する Standards Track。
### 2026-08-24 ingest | RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)(A. Sajassi ほか、IETF、2021-10)
- [[@2021__IETF__RFC 9135 - Integrated Routing and Bridging in Ethernet VPN (EVPN)]] — EVPN 上で Symmetric/Asymmetric の2モードによる統合ルーティング/ブリッジング(IRB)を定義。分散エニーキャストゲートウェイ、EVPN Router's MAC Extended Community、MAC Mobility Extended Community によるホストモビリティ手続きを規定する Proposed Standard。
### 2026-08-21 ingest-paper | Serval: An End-Host Stack for Service-Centric Networking(Erik Nordström ほか、NSDI 2012)
- [[@2012__NSDI__Serval An End-Host Stack for Service-Centric Networking]] — 固定ホスト中心の TCP/IP 識別子を ServiceID・FlowID・IP アドレスへ分離し、トランスポート層とネットワーク層の間に SAL を置く Service-Centric Networking。初回 SYN のサービス解決、サービス登録、LPM ベースのサービス表、複数フロー・フロー移行を統合し、28,000 行の Linux カーネルプロトタイプで TCP 933.8 Mbit/s、Serval サービスルータの UDP 872 Mbit/s を評価した。Figure 1〜10 を全件クロップ、Table 1〜3 を転記。発表スライド 53 枚を確認し、補足図 4 枚を同一 source に追加。
### 2026-08-21 ingest-slides | XDPerf: A High-Performance Traffic Generator Built with WASM and eBPF(Takeru Hayasaka、KubeCon Japan Community Day 2026)
- [[@2026__KubeCon Japan Community Day__XDPerf - A High-Performance Traffic Generator Built with WASM and eBPF]] — XDP/eBPF の live frames mode と WebAssembly プラグインを組み合わせたネットワークトラフィックジェネレーター。Wasm が起動時にパケットテンプレートと変化規則を作り、Go + wazero ホストが eBPF マップへ登録し、XDP が未変更の upstream ドライバで送信する。64B で 116.5 Mpps、256B 以上で 100G wire rate、24 TX コアで 110.7 Mpps を提示する。PDF 原本は Speaker Deck の 403 により取得できず、CDN の個別スライド画像 50 枚を保存した。
### 2026-08-21 ingest-paper | A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability(Adel Belkhiri ほか、ICPE 2026)
- [[@2026__ICPE__A Transparent and Efficient Performance Analysis Approach to Enhance DPDK Observability]] — DPDK native tracer の CTF を Trace Compass の DPDK プラグインへ接続し、lcore・service・RX/TX throughput・poll 分布・mempool 状態を同期ビューで分析する性能分析フレームワーク。19人の実務家調査で低オーバーヘッド、本番安全性、DPDK 固有メトリクスの要求を抽出し、VPP のケーススタディで RX throughput 低下から `vpp pool 0` 枯渇までを診断した。Figure 1〜9 を全件埋め込み、Table 1 を転記。
### 2026-08-21 ingest-paper | Deploying User-space TCP at Cloud Scale with LUNA
- [[@2023__USENIX ATC__Deploying User-space TCP at Cloud Scale with LUNA]] — Alibaba Cloudのストレージネットワークへ5年以上展開されたユーザーレベルTCPスタックLUNAを、run-to-completion、Zbufによる全経路ゼロコピー、Flow BifurcationとSR-IOVによるカーネルTCP共存の三軸から説明する。4KB RPCでカーネルTCP比3.5倍のスループット、99パーセンタイルレイテンシ70%削減を報告し、200〜400Gbps級での限界とSolarへの進化も議論する。図1〜16を全件クロップし、Table 1を転記。発表スライドp.18・p.20も同一sourceへ統合。
### 2026-08-21 ingest-paper | Scalable Kernel TCP Design and Implementation for Short-Lived Connections(Xiaofeng Lin ほか、ASPLOS 2016)
- [[@2016__ASPLOS__Scalable Kernel TCP Design and Implementation for Short-Lived Connections]] — 短命 TCP 接続向けの BSD Socket 互換カーネル設計 [[Fastsocket]] を提案。Local Listen Table・Local Established Table・Receive Flow Deliver・Fastsocket-aware VFS で TCB 管理、接続局所性、VFS 競合をコア単位に分割し、24 コアで Nginx 475K cps、Sina Weibo 本番 HAProxy の実効容量 53.5% 改善を報告する。Figure 1〜5 をクロップし、Table 1 を転記。
### 2026-08-21 ingest-paper | Unikraft: Fast, Specialized Unikernels the Easy Way(Simon Kuenzer ほか、EuroSys 2021)
- [[@2021__EuroSys__Unikraft - Fast, Specialized Unikernels the Easy Way]] — OS プリミティブと API をマイクロライブラリへ完全に分解し、Kconfig ベースのビルドシステム、musl、syscall shim、静的リンクで既存アプリケーションの移植容易性とアプリケーション特殊化を両立するユニカーネル。nginx・Redis・SQLite で Linux ゲスト比 1.7〜2.7 倍、2 MB 未満のイメージ、2〜6 MB のゲストメモリ、VMM を除き約 1 ms の起動時間を評価。Figure 1〜22 を全件クロップし、Table 1〜4 を転記。
### 2026-08-21 ingest-paper | zpoline: a system call hook mechanism based on binary rewriting(Kenichi Yasukata ほか、USENIX ATC 2023)
- [[@2023__USENIX-ATC__zpoline - a system call hook mechanism based on binary rewriting]] — x86-64 の `syscall`/`sysenter` を二バイトの `callq *%rax` と仮想アドレス 0 のトランポリンへ置換し、低オーバーヘッドかつ網羅的なシステムコールフックを実現する論文。`ptrace`・`int3`・SUD・`LD_PRELOAD` と比較し、フック単体と lwIP/DPDK 上の HTTP サーバー・Redis の性能を評価する。Figure 1〜3 をクロップし、Table 1 を転記。
### 2026-08-21 ingest-paper | TAS: TCP Acceleration as an OS Service(Antoine Kaufmann ほか、EuroSys 2019)
- [[@2019__EuroSys__TAS - TCP Acceleration as an OS Service]] — データセンターRPC向けにTCPの共通ケースを専用CPU上のfast path OSサービスへ分離し、接続制御・輻輳制御・タイムアウト・例外処理をslow pathへ残す設計論文。POSIXソケット互換性、ACK・輻輳制御の強制、負荷比例のCPU割当を保ちながら、Linux・IX・mTCPと比較してRPC、キーバリューストア、FlexStorm、輻輳制御を評価した。Figure 1〜15を全件クロップし、Table 1〜8を転記。
### 2026-08-21 ingest-paper | Understanding Host Network Stack Latency(Tianyu Zuo ほか、SIGCOMM 2026)
- [[@2026__SIGCOMM__Understanding Host Network Stack Latency]] — Linux の高いテールレイテンシを、softIRQ 時間の誤計上、CPU runtime 公平性の限界、バースト性トラフィック下の DIM の非効率へ分解した論文。ACCa、要求数ベースの PCSched、予測型 AutoDIM により、同程度のスループットでテールレイテンシを最大 5.3 倍改善する。Figure 1〜17 を全件クロップし、Table 1 を転記。
### 2026-08-21 ingest-paper | Understanding Host Network Stack Overheads
- [[@2021__SIGCOMM__Understanding Host Network Stack Overheads]] — 100 Gbps 級リンクの Linux ネットワークスタックを、単一フロー・複数フロー・長短フロー混在・パケット損失・DCA・IOMMU・輻輳制御の条件で測定した SIGCOMM 2021 論文。単一長フローでは受信側データコピーが CPU サイクルの約 49%を占め、帯域遅延積と DCA キャッシュ容量の不釣り合い、NUMA 配置、GRO 集約機会、ネットワーク認識型スケジューリングを高帯域ホストスタックの課題として示す。Figure 1〜13 を全件埋め込み、Table 1〜2 を転記。
### 2026-08-21 ingest-paper | iip: an integratable TCP/IP stack(Kenichi Yasukata、SIGCOMM CCR 2024)
- [[@2024__SIGCOMM CCR__iip - An Integratable TCP IP Stack]] — 高性能 TCP/IP スタックの統合複雑性と移植性重視スタックの性能制約を、外部依存のコールバック化、利用側が所有する実行ループ、context object、NIC オフロード、ゼロコピー I/O で同時に扱う設計論文。32 コアの TCP ping-pong で 72.3 million requests/sec、バルク転送で TSO・チェックサム・scatter-gather の寄与を評価した。図2点を埋め込み。
### 2026-08-21 ingest-paper | Full TCP/IP for 8-Bit Architectures(Adam Dunkels、MobiSys 2003)
- [[@2003__MobiSys__Full TCP IP for 8-Bit Architectures]] — 8 ビット・16 ビット組み込みシステム向けに、RFC1122 のホスト間通信要件を維持した軽量 TCP/IP 実装 [[lwIP]] と [[uIP]] を設計・評価した論文。lwIP は動的バッファ、複数接続、スライディングウィンドウ、輻輳制御を持ち、uIP は単一グローバルバッファとイベント駆動 API、接続ごとに 1 セグメントの未確認制約で資源量を最小化する。Ethernut/Atmega128 実験では、uIP のコードサイズ 5,164 バイト・RAM 400 バイト〜3 キロバイト、lwIP のコードサイズ 21,756 バイト・RAM 5〜16 キロバイトを測定し、遅延 ACK が uIP の送信性能を制限することを示す。Figure 1〜7 と Table 1〜5 を全件埋め込み・転記。
### 2026-08-21 ingest | Extensible Software in the age of LLMs(Jeremy Morrell、jeremymorrell.dev)
- [[@2026__jeremymorrell.dev__Extensible Software in the age of LLMs]] — LLM 支援コーディングでユーザー固有の需要曲線の長い尾へ対応するウェブ拡張型ソフトウェアの設計仮説。責任ある中核、狭いケイパビリティ、資源制限、強い分離、オブザーバビリティを要件とし、Salesforce、Pi、Cloudflare OS、Dynamic Workers、インタプリタ/V8 Isolate/MicroVM/WASM + WASIを接続する。図5点を埋め込み。
### 2026-08-21 ingest-video | Networking for Meta's Gigawatt-scale AI fleet(ACM SIGCOMM、Omar Baldonado)
- [[@2026__SIGCOMM__Networking for Meta's Gigawatt-scale AI fleet]] — Meta のギガワット級 AI フリートを支えるネットワークを、スケールアップ・スケールアウト・スケールアクロスの三領域と、ワークロード・全体システム・ライフサイクルを横断する協調設計として説明するスポンサーセッション動画。公式講演ページで概要を裏取りし、動画本体は HTTP 403 のため YouTube 自動字幕のみを保存した。
### 2026-08-21 ingest-paper | Data Warehousing and Analytics Infrastructure at Facebook(Ashish Thusoo+, SIGMOD 2010)
- [[@2010__SIGMOD__Data Warehousing and Analytics Infrastructure at Facebook]] — [[Facebook]]がScribe・[[Apache Hadoop]]・[[Apache Hive]]を組み合わせ、15PB超(圧縮後2.5PB)を保持し、毎日60TB超(圧縮後10TB)を取り込んだデータウェアハウスの設計・運用経験報告。約10,000ジョブ/日、2万超のHiveテーブル、約1億ファイル・ブロックを背景に、外部テーブル、クラスタ分離、Fair Share、協調的メタデータ、系譜抽出を説明する。図2点を埋め込み。
### 2026-08-20 ingest | Zoomer: Powering AI Performance at Meta’s Scale Through Intelligent Debugging and Optimization(Prashant Gupta、Meta Engineering Blog、2025-11-21)
- [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]] — [[Meta]] の訓練・推論ワークロードを横断する自動性能プロファイリング/デバッグ/最適化基盤 [[Zoomer]]。インフラストラクチャ/プラットフォーム、分析/洞察エンジン、可視化/ユーザーインターフェースの三層で、GPU/CPU/ホスト/通信/要求単位のデータを統合する。訓練時間 75% 短縮・電力 78% 削減、32k GPU で 30% 高速化などを報告。図1点を埋め込み。
### 2026-08-20 ingest-slides | クラウドデータセンターネットワークの"いま"と"これから"(Masayuki Kobayashi、AI/ML/HPCネットワーク分科会、2023/06/12)
- [[@2023__SpeakerDeck__クラウドデータセンターネットワークのいまとこれから]] — [[Masayuki Kobayashi]](発表当時LINEヤフー)が2023年6月12日に発表したスライド資料。全37ページ(うち4ページ非公開)。CPU-Centric から Distributed & Disaggregated Computing への移行を起点に、Web Scale(Frontend)/AI-ML(Backend)ネットワークの分離、RDMA/RoCEv2 のロスレス前提、Rail Optimized Topology、ラックデザインの ToR→EoR 変更、Clos のレイテンシ限界と Dragonfly+ 検討まで扱う。図6点を埋め込み。
### 2026-08-19 ingest-paper | Serverless inferencing on Kubernetes(Clive Cox ほか、Seldon Technologies / Bloomberg L.P. / IBM / Microsoft / NVIDIA、ICML 2020 ワークショップ)
- [[@2020__arXiv__Serverless inferencing on Kubernetes]] — Kubeflow エコシステムの KFServing プロジェクトを解説する ICML 2020 ワークショップ論文。Knative(基盤は Istio)上に単一の InferenceService CRD で多様な ML フレームワークをサーバーレスデプロイし、GPU オートスケーリングは GPU/CPU メトリクスに依存しない Knative Pod Autoscaler のリクエストベースオートスケーリングで解決。2020年時点の本番運用経験(CFS スケジューラバグによるテールレイテンシ悪化、大規模モデルのスケールツーゼロ起動レイテンシ問題)と未解決課題(大規模モデルのキャッシュ共有、数百〜数千小規模モデルの多重化)を報告。図1点(KFServing技術スタック)を埋め込み。
### 2026-08-19 ingest-paper | Topology-Aware GPU Scheduling for Learning Workloads in Cloud Environments(Marcelo Amaral ほか、Barcelona Supercomputing Center / IBM Watson Research Center、SC17)
- [[@2017__SC__Topology-Aware GPU Scheduling for Learning Workloads in Cloud Environments]] — IBM Power8(NVLink接続Tesla P100×4)上でGPU間通信を考慮したジョブ配置(pack/spread)を実測し、通信コスト・同居干渉・資源断片化を統合した効用関数ベースのトポロジ考慮型スケジューリングアルゴリズム(TOPO-AWARE/TOPO-AWARE-P)をプロトタイプと大規模トレース駆動シミュレーションの両方で評価。pack配置は最大約1.30倍高速化、提案アルゴリズムはグリーディ手法(FCFS/Best Fit)比で累積実行時間を最大約1.30倍改善しSLO違反なし。図11点(Figure 1〜11)・表1点(Table 1)すべて埋め込み。
### 2026-08-19 ingest-book | アジャイルな見積りと計画づくり(マイナビ 2009、Mike Cohn 著・安井力/角谷信太郎 監訳、全 7 部 23 章 338 ページ)
- 書籍ハブ entity: [[wiki/entities/アジャイルな見積りと計画づくり|アジャイルな見積りと計画づくり]]。原書は *Agile Estimating and Planning*(Prentice Hall, 2006)。全 23 章 + イントロダクションを 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。まえがき・日本の読者に向けて・訳者あとがきは source 化せず、内容は book entity に織り込んだ。図 50 点・表 49 点の計 99 点を `wiki/sources/_attachments/agile-estimating-and-planning-ja/` に配置し本文該当箇所へ埋め込み。原本は `.raw/books/agile-estimating-and-planning-ja/`。「規模を見積もり、期間は導出する」という原理を軸に、アジャイル開発における見積りと計画づくりを規模・価値・スケジュール・トラッキングの 4 段構えで体系化した実務書。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Introduction イントロダクション]] — 書名を「アジャイルな見積りと計画づくり」とした理由(プロセス自体がアジャイルでなければならない)と、全 7 部 23 章の見取り図を示す導入。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 1 計画の目的]] — 不確実性コーンで見積りの難しさを示し、よい計画づくりの 5 特徴(リスクの軽減・不確実性の低減・意思決定の支援・信頼の確立・情報の伝達)を提示。成果物としての「計画」より活動としての「計画づくり」を重視する立場を定める(図 1 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 2 なぜ計画づくりに失敗するのか]] — 従来型の計画づくりが失敗する 5 つの理由(活動ベースの計画・マルチタスク化・開発都合の実装順序・不確実性の無視・見積りとコミットメントの混同)を検討する(図 3 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 3 アジャイル手法]] — アジャイルマニフェストの 4 価値からアジャイルチームに共通する 5 つの振る舞いを整理し、プランニング・オニオンと満足条件を導入する。個別手法名は挙げない(図 2 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 4 ストーリーポイントによる規模の見積り]] — 単位を持たない相対値であるストーリーポイントを導入し、ベロシティを介して規模から期間を導出する仕組みを示す(図表 3 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 5 理想日による見積り]] — 理想時間と現実時間(経過時間)の違いから理想日を定義し、その 3 つの前提を示す。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 6 見積りの技法]] — 見積りの労力と正確さが収益逓減の関係にあることを前提に、専門家の意見・対比・分割を合成した技法としてプランニングポーカーを詳述する(図 1 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 7 再見積り]] — 再見積りが必要なのは相対的な規模の判断が変わったときだけで、実装が想定より長引いたこと自体は理由にならないと論じる(図表 3 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 8 ストーリーポイントと理想日]] — ストーリーポイントの長所 5 点と理想日の長所 2 点を対比し、著者はストーリーポイントを推奨しつつ慣れないチームには理想日からの段階的移行を示す。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 9 テーマの優先順位づけ]] — 個々のストーリーでは価値を測りにくいためテーマにまとめ、金銭価値・コスト・新しい知識・リスクの 4 要素とリスク対価値の四象限で順位を決める枠組みを示す(図 3 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 10 金銭価値による優先順位づけ]] — 収益源を 4 分類して見積もり、正味現在価値・内部収益率・回収期間・割引回収期間の 4 指標でテーマを比較する手順を、架空企業 WebPayroll の例題で通しで示す(表 15 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 11 「望ましさ」による優先順位づけ]] — 金銭で測りにくい価値を、狩野モデル(ユーザーアンケート)と相対的重み付け(専門家判断)の 2 手法で順位づけする(図表 5 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 12 ユーザーストーリーの分割]] — 大きなストーリー(エピック)を 5 系統の切り口で分割する方法と、タスクへ分解しない・関連変更を上乗せしないという 2 つの禁則を示す。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 13 リリース計画づくりの基本]] — 満足条件の決定からリリース日の決定まで 6 ステップの標準手順を示し、日付主導とフィーチャ主導の違いを整理する(図表 4 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 14 イテレーション計画づくり]] — ベロシティ駆動とコミットメント駆動という 2 つの進め方を対比し、著者はコミットメント駆動を好むと述べる。ポイントと時間を固定的に対応づけることの危うさも論じる(図表 8 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 15 イテレーションの長さを決める]] — イテレーション長を決める 7 要因を挙げ、著者は 2 週間を最も好むと述べる。月末・四半期末に終わりを合わせるべきではないと注意する(図 1 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 16 ベロシティの見積り]] — 過去の実績・実イテレーション・予想という 3 手法を示し、いずれもベロシティは単一値ではなく幅で表現すべきだと説く(図表 4 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 17 不確実性に備えるバッファの計画]] — フィーチャバッファとスケジュールバッファを定義し、後者を二乗和平方根法で算出する手順を示す。バッファは水増しではなく開示すべき安全余裕だと位置づける(図表 7 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 18 複数チーム編成プロジェクトの計画づくり]] — 複数チームで追加される 4 テクニック(共有できる見積り基準・早期のストーリー詳細化・移動する先読み範囲・合流バッファ)を、必要最小限だけ段階的に導入することを勧める(図表 3 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 19 リリース計画のモニタリング]] — 推測航法の比喩で進捗トラッキングを位置づけ、リリースバーンダウンチャートとパーキングロットチャートの読み方を示す(図 6 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 20 イテレーション計画のモニタリング]] — タスクボードとイテレーションバーンダウンチャートを扱い、投入工数の実績比較には否定的、個人単位のベロシティ測定には明確に反対する(図 2 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 21 計画とコミュニケーション]] — 期日は単一値でなく幅や確度を添えて伝えるべきだとし、条件つきのガントチャート・幅を持たせたベロシティ・イテレーション終了報告書という手段を示す(図表 3 点)。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 22 なぜアジャイルな計画づくりがうまくいくのか]] — 頻繁な計画見直し・規模と期間の分離・複数レベルの計画・フィーチャ基準・小さなストーリー・仕掛り作業の非持ち越し・チーム単位トラッキング・不確実性の受容という 8 つの理由と 12 のガイドラインで本編を総括する。
- [[@2009__Mynavi__アジャイルな見積りと計画づくり - Chapter 23 ケーススタディ ボムシェルタースタジオ]] — 架空のゲーム会社が『ハバナ』のソフトウェア版を作る過程に本編 22 章の技法を時系列で適用する通し事例。初期見積りの幅(12〜20 週間)をわずかに超える 22 週間で完了する(図表 25 点)。
### 2026-08-19 ingest-paper | The ganglia distributed monitoring system: design, implementation, and experience(Matthew L. Massie+, Parallel Computing 2004)
- [[@2004__Parallel Computing__The Ganglia Distributed Monitoring System - Design, Implementation, and Experience]] — Matthew L. Massie・Brent N. Chun・[[David E. Culler]]([[University of California, Berkeley]] / [[Intel Research|Intel Research Berkeley]])、Parallel Computing 30 (2004) 817–840。クラスタ内はマルチキャスト listen/announce プロトコルで対称的に監視し、複数クラスタは点対点接続ツリーの gmetad で連合・集約する階層設計の分散モニタリングシステム [[Ganglia]] を提案。500 以上のクラスタでの実運用データを用いてスケーラビリティとオーバーヘッドを定量化し、[[PlanetLab]] への展開経験から広域帯域幅コスト・フラット名前空間・RRDtool I/O 負荷などの課題を報告する。→ [[分散モニタリング]](paper / source / distributed / monitoring)
### 2026-08-18 ingest-paper | DynamoServe: A Distributed Tiered Memory System for Multi-tenant LLM Serving(Diman Zad Tootaghaj+, SIGCOMM 2026)
- [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]] — [[Diman Zad Tootaghaj]]・Khaled Diab・Bob Lantz・Puneet Sharma([[Hewlett Packard Labs]])、Hanjiang Wu・[[Tushar Krishna]]([[Georgia Institute of Technology]])ほか。SIGCOMM 2026、6 ページ。NVLink ピア GPU の遊休 HBM をプールし LLM 状態を分散オフロード、MPS コロケーションでマルチテナント利用率を改善。→ [[DynamoServe]] / [[KVキャッシュ管理]] / [[GPU多重化(MPS・MIG)]](paper / source / llm / inference / gpu / memory-management)
### 2026-08-16 ingest-paper | Cutting Corners: Workbench Automation for Server Benchmarking(Piyush Shivam+, USENIX ATC 2008)
- [[@2008__USENIX-ATC__Cutting Corners - Workbench Automation for Server Benchmarking]] — [[Piyush Shivam]](Sun Microsystems)・Varun Marupadi・[[Jeffrey S. Chase]]・Thileepan Subramaniam・[[Shivnath Babu]](Duke University)、USENIX ATC 2008、pp.241–253。共有ハードウェアプール上でサーバベンチマーキング実験集合を自動計画・実行するワークベンチコントローラのフレームワークを提案し、NFSファイルサーバのピークレート評定を動機づけ例に二分探索・モデル誘導探索・シーディングヒューリスティックの各ポリシーを実験的に評価する。→ [[ワークベンチ自動化]] / [[ベンチマーキング]]。(paper / source / benchmarking / systems)
### 2026-08-16 ingest | Episteme and Techne(Richard Parry、Stanford Encyclopedia of Philosophy、初出2003年・実質改訂2024年)
- [[@2003__SEP__Episteme and Techne]] — 古代ギリシア哲学における episteme(エピステーメー)/technê(テクネー)概念の関係を、クセノポン→プラトン→アリストテレス→ストア派→アレクサンドロス・アプロディシエンシス→プロティノスの順に通時的に追跡する哲学史サーベイ。[[@1906__StandardEbooks__Nicomachean Ethics - Book VI Intellectual Virtues]] の直後の二次文献として、アリストテレス自身の用語法の揺らぎ(『形而上学』『自然学』での混用)を補う。
### 2026-08-16 ingest-book | Feedback Control of Computing Systems(IEEE Press / John Wiley & Sons 2004、Hellerstein・Diao・Parekh・Tilbury、全 3 部 11 章 451 ページ)
- 書籍ハブ entity: [[Feedback Control of Computing Systems]]。本編全 11 章を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。序文と付録 A〜E は source 化せず、序文の内容(読み筋・前提知識・一貫して使う実例)は book entity に織り込んだ。図 82 点を `wiki/sources/_attachments/feedback-control-of-computing-systems/` に配置し本文該当箇所へ埋め込み。表は Markdown 表として本文に再現。原本は `.raw/books/feedback-control-of-computing-systems/`。待ち行列理論が扱う定常特性ではなく**動特性**を対象に、計算機システムの資源管理を離散時間のフィードバック制御問題として定式化するこの分野の基礎文献。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 1 Introduction and Overview]] — フィードバック制御系の 8 要素とブロック線図、定値制御・外乱抑制・最適化という 3 種の制御目標、SASO 特性、開ループ対閉ループの対比を提示し、IBM Lotus Domino Server・Apache HTTP Server・RED・負荷分散・ストリーミング・キャッシングという実例で計算機システムを制御問題として定式化する導入章(図 7 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 2 Model Construction]] — M/M/1/K の定常特性が線形・遷移・飽和の 3 領域に分かれる非線形性を出発点に、差分方程式と動作点まわりの線形化を導入し、スコープ指定 → 実験計画 → 最小二乗回帰 → モデル評価という 4 段階のブラックボックスシステム同定を具体化する(図 7 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 3 Z-Transforms and Transfer Functions]] — 第 2 章の差分方程式モデルを Z 変換で解析可能な形(伝達関数・極・BIBO 安定性・定常ゲイン・支配極)に変換する橋渡しの章。以降の解析章はすべてこの道具に依存する(図 8 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 4 System Modeling with Block Diagrams]] — 構成要素ごとの伝達関数を直列・並列・フィードバック結合で組み合わせ、閉ループ伝達関数 $F_R = F_{FF}/(1+F_{LP})$ へ簡約する記法と代数規則を与える。短いが著者らが精読を指示する要所(図 8 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 5 First-Order Systems]] — 一次系 $y(k+1)=ay(k)+bu(k)$ の過渡応答を、極 $a$ の値だけで安定性・振動・整定時間 $k_s \approx -4/\log|a|$ が定まることを軸に、初期条件・インパルス・ステップ・ランプ・正弦波応答として体系的に解析する(図 8 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 6 Higher-Order Systems]] — 2 つ以上の極を持つ高次系を、絶対値最大の極(支配極)による一次系近似と、複素極が生む振動・オーバーシュート $M_P \approx r^{\pi/|\theta|}$ の定量化という 2 本柱で解析する。零点による極の相殺と非最小位相系も扱う(図 8 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 7 State-Space Models]] — 状態空間モデル $x(k+1)=Ax(k)+Bu(k),\ y(k)=Cx(k)$ を導入し、Part II で唯一 MIMO を正面から扱う。可制御性・可観測性という状態空間固有の概念と、Apache HTTP Server の MIMO システム同定を示す(図 7 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 8 Proportional Control]] — 比例制御 $u(k)=K_P e(k)$ を軸に SASO 特性を閉ループ極と根軌跡で定量化し(整定時間 $-4/\log r$、オーバーシュート $r^{\pi/|\theta|}$)、目標値または外乱が非零なら定常偏差を消去できないという構造的限界を示す(図 5 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 9 PID Controllers]] — 第 8 章が消せなかった定常偏差を積分項が厳密ゼロにできることを示す一方、開ループ極 $z=1$ の追加で応答が必ず遅くなるトレードオフを明らかにし、根軌跡・極配置・CHR 法という 3 つの整定手法を与える。微分項は確率的変動に敏感なため PI 制御を推す(図 6 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 10 State-Space Feedback Control]] — 第 7 章の状態空間モデルを土台に、静的・precompensator 付き静的・動的という 3 つの状態フィードバックアーキテクチャと、極配置設計・LQR という 2 つの設計技法を提示し、Apache HTTP Server の MIMO 制御実験で LQR の優位を実測で示す(図 8 点)。
- [[@2004__Wiley__Feedback Control of Computing Systems - Chapter 11 Advanced Topics]] — 線形・決定的・時不変という第 2〜10 章の前提を緩和する 5 技法(ゲインスケジューリング・自己調整レギュレータ・最小分散制御・流体流近似・ファジィ制御)を、M/M/1/K と Apache HTTP Server を題材に簡潔に紹介する最終章(図 8 点)。
### 2026-08-15 ingest-book | SREの探求(Seeking SRE、オライリー・ジャパン 2021 年 9 月、David N. Blank-Edelman 編・山口能迪 監訳・渡邉了介 訳、全 4 部 33 章 632 ページ)
- 書籍ハブ entity: [[SREの探求]]。前付「はじめに」と全 33 章の計 34 件を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。図 72 点を `wiki/sources/_attachments/seeking-sre-ja/` に配置し本文該当箇所へ埋め込み。表 7 点は Markdown 表として本文に再現。原本は `.raw/books/seeking-sre-ja/`。原書は *Seeking SRE: Conversations About Running Production Systems at Scale*(O'Reilly Media, 2018)。40 名近い寄稿者による対談・アンケート・書籍抜粋を含む非均質な会話集で、[[SRE Book]] が単一組織の実践を統一理論として示すのに対し、Google 以外の組織が SRE をどう解釈し失敗し定着させたかの一次資料を並べる。
- [[@2021__OReillyJapan__SREの探求 - Preface はじめに]] — 編者が「会話(conversations)」「探求(Seeking)」を核心語に、SRE Book とは異なる非均質な会話集としての編集方針と本書誕生の経緯を語る序文。
- [[@2021__OReillyJapan__SREの探求 - Chapter 1 SREにおけるコンテキストとコントロール]] — Netflix の [[Coburn Watson]] が、意思決定の責任とともに情報を渡す「コンテキスト駆動型」と、プロセス・権限制限で結果を強制する「コントロールベース」の対比を語る対談(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 2 サイトリライアビリティエンジニアの面接]] — Dropbox の [[Andrew Fong]] が、11 段階の採用ファネルと電話選考/オンサイト/在宅課題の 3 段階、ブラインド書類選考によるバイアス対策を体系化する(図 1 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 3 なるほど、SREチームを作りたいのですね]] — Google の [[Luke Stone]] が、100 人超のリーダーとの面談経験から「名前だけの SRE」を避け、組織が SRE にふさわしいかを判断する問いを示す(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 4 インシデントのメトリクスを用いたSREの大規模な改善]] — Microsoft Azure の [[Martin Check]] が TTD/TTE/TTF/TTM の時間分解・代理メトリクス・修復負債/仮想修復負債で信頼性投資を優先順位づけしたケーススタディ(図 5 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 5 サードパーティとの協力を円滑に進める重要性]] — [[Jonathan Mercereau]] が、サードパーティを自社の拡張として扱い、CapEx/OpEx/PrOpEx/AbEx で構築・購入・採用を評価し、ベンダー SLA 交渉に自社 SLI/SLO を持ち込む実務を示す(図 2 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 6 専任SREチームなしでSREの原則を適用する方法]] — SoundCloud が専任 SRE チーム(エンジニア総数の 5〜10% を占め破綻)と SRE 派遣の両方に失敗した後、you build it you run it と共通デプロイ基盤 Bazooka で分散適用へ至った経緯(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 7 SREのいないSRE:Spotifyのケーススタディ]] — Spotify が専任 SRE チームを持たないまま、常駐 → 集中型 → 分散という漸進的自己認識を経て「分隊型運用(Ops-in-Squads)」へ移行した記録(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 8 大企業におけるSREの導入]] — 1930 年代創業の大企業 [[Agilent Technologies]] に、買収された SaaS スタートアップ側から SRE を導入した 5 ステップの実践記録。SRECon17 Europe 発表がもと(図 4 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 9 25ページでシステム管理者からSREへ]] — Amazon Japan の [[Vladimir Legeza]] が、コンポーネント別 SLA と 1 分粒度・1 年ローリングウィンドウの日次可用性計算を通じて、システム管理者から SRE への視点転換を 11 ステップで示す(図 3 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 10 大企業でSRE導入の道を開く方法]] — [[Damon Edwards]] が、トイル・サイロ・引き継ぎ・チケット駆動型キューという構造的病理を分析し、「サービスとしての運用(OaaS)」というセルフサービス設計パターンを提示する(図 11 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 11 DevOpsの幅広い実践現場で活用されているSREのパターン]] — [[Gene Kim]] が *[[The DevOps Handbook]]* から、GWS の自動化テスト文化・ローンチ/引き継ぎレディネスレビュー(LRR/HRR)・単一共有リポジトリを、SRE 由来で DevOps 全般に通じるパターンとして示す(図 2 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 12 DevOpsとSRE:コミュニティからの声]] — 編者が 34 か国 1,165 人に問うたアンケートから、DevOps と SRE の関係が単一の結論に収斂せず 7 つの説明軸(実装関係・役割対アプローチ・成熟度移行・Limoncelli モデル・用語先後・組織事情・相補的反応)が並立することを示す(図 1 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 13 Facebookにおけるプロダクションエンジニアリング]] — Facebook の [[Pedro Canahuati]] が、SRE → SRO+AppOps → PE という約 4 年の組織変革と、集中型報告+分散型配属・SWE との完全なオンコール共有を核とする PE 職種を語る対談(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 14 初めにカオスありき]] — 元 Netflix の [[Casey Rosenthal]] が Chaos Monkey/Chaos Kong の導入経緯と PrinciplesofChaos.org の 4 手順テンプレート・5 原則を当事者記録として記す(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 15 信頼性とプライバシーが交わるところ]] — [[Betsy Beyer]] と [[Amber Yust]] が、信頼性とプライバシーの共通目標、防護・強化・消火の 3 分類、およびプライバシー障害が不可逆であるゆえに SLA の帰結モデルが適用できない非対称性を論じる(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 16 データベースリライアビリティエンジニアリング]] — [[Laine Campbell]] が原著 *Database Reliability Engineering*(2017)から、DBA の番人モデルを「データの保護・大規模セルフサービス・データベースは特別ではない」の 3 原則で再定義する(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 17 データ耐久性のエンジニアリング]] — Dropbox の [[James Cowling]] が、可用性から独立した信頼性の側面として耐久性を立て、マルコフモデルと分離・保護・検証・自動化の 4 本柱で論じる。最大のリスクは運用者自身(図 5 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 18 SREのための機械学習入門]] — Acquia の [[Ricardo Amaro]] が、機械学習のカテゴリ分類からニューラルネットワーク基礎・Jupyter/scikit-learn/TensorFlow の実践、DeepMind のデータセンター冷却 40% 省エネ事例までを SRE 実務者向けに解説する入門編(図 19 点、本書最多)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 19 ドキュメント作成業務の改善:エンジニアリングワークフローへのドキュメンテーションの統合]] — Google の [[Ríona MacNamara]] らが、g3doc/EngPlay でドキュメントをコードと同じソース管理・レビュー・ツールチェーンへ統合し、構造品質より機能品質を優先した取り組みを示す(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 20 アクティブなティーチングとラーニング]] — Google の [[Laura Nolan]] が、Wheel of Misfortune・Incident Manager カードゲーム・SRE Classroom という 3 種の能動的学習の教材を、再現可能な手順つきで示す(図 1 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 21 サービスレベル目標の技法と科学]] — Circonus の [[Theo Schlossnagle]] が、SLA(外部)/SLO(内部)の区別と可用性計測の 3 方式に、PDF/CDF/分位関数/ヒストグラムによる分布分析を接続し、逆分位数起点の SLO 設計を提案する(図 3 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 22 成功の文化としてのSRE]] — LinkedIn の [[Kurt Andersen]] が、SRE を障害削減でなくビジネスの成功実現に集中する活動として捉え直し、4 つの文化的価値と 4 段階の実施フェーズ(消火活動→門番→支持者/パートナー→触媒)を示す(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 23 SREのアンチパターン]] — Dropbox の [[Blake Bisset]] が、SRE 業界が繰り返し陥る 18 個のアンチパターン(看板の掛け替え・ヒューマンエラー帰責・アラート過多・プッシュ型強制など)を名前・症状・処方箋の共通形式で列挙する(図 1 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 24 イミュータブルなインフラストラクチャとSRE]] — 元 Netflix の [[Jonah Horowitz]] が、実行中インスタンスを交換のみで更新する利点と、収束型設定管理の放棄・永続データ層の困難・イテレーションレイテンシ増大という代償を論じる(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 25 スクリプタブルロードバランサー]] — 元 Shopify の [[Emil Stolarsky]] が、Lua 等でスクリプトを書けるロードバランサーがシャード対応ルーティング・無停止デプロイ(Intermission)・スロットリングを可能にすることを示す(図 10 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 26 サービスメッシュはマイクロサービスの世話人か]] — Lyft の [[Matt Klein]] が、サイドカー型サービスメッシュがマイクロサービスの「世話人」たりうるかを、一貫したオブザーバビリティという利点とコンテキスト伝播・コントロールプレーンの複雑さという残存コストの両面から検討する(図 3 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 27 SREにおける心理的安全性]] — Facebook の [[John Looney]] が、Google の Project Aristotle と架空の新入社員の物語から、SRE が構造的に心理的安全性を損ないやすい 6 要因を論じる(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 28 SREの認知的作業]] — [[John Allspaw]] と [[Richard I. Cook]] が、SRE の日常業務を「表現線」「共同認知システム」「犠牲を伴う意思決定」「キャリブレーション問題」という安全科学・レジリエンスエンジニアリングの概念で分析する(図 1 点、表 4 点)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 29 燃え尽きを超えて]] — Quantopian の [[James Meickle]] が、燃え尽き(短期的ストレス反応)と精神疾患・神経発達障害(慢性的状態)を区別し、インクルージョンの欠如を組織の構造的責任として捉え直す(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 30 オンコール反対論]] — [[Niall Murphy]] が、オンコールの唯一正当な理由を「プロダクションの知恵」に絞り込み、ストレス下 25〜30% のエラー率という実証データを根拠に業界規模の標準化による根本解決を提唱する、本書中で最も論争的な章(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 31 複雑なシステムのためのエレジー]] — 元 United States Digital Service の [[Mikey Dickerson]] が、コンウェイの法則・デコヒーレンス・部分的障害の恒常性・昇進インセンティブ・調整オーバーヘッドという 5 つの切り口から複雑システムに共通する挙動を整理する(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 32 運用と社会運動が交わるところ]] — [[Emily Gorcenski]] と [[Liz Fong-Jones]] が、SRE の計測・危機対応・フォローアップ管理のスキルを社会運動の組織化に類比し、セントポール原則とインシデント管理原則を対応づける(図なし)。
- [[@2021__OReillyJapan__SREの探求 - Chapter 33 まとめ]] — 編者が本書を終幕でなく一時休止と位置づけ、Preface の核心語「会話」に回帰して締めくくる 1 ページの結び(図なし)。
### 2026-08-14 ingest-book | Incident Metrics in SRE(O'Reilly 2021、単章レポート・再取り込み)
- [[@2021__OReilly__Incident Metrics in SRE]](更新・再取り込み) — [[Štěpán Davidovič]]([[Google]] SRE)、*Incident Metrics in SRE: Critically Evaluating MTTR and Friends*、O'Reilly Media 2021-03-19(ISBN 978-1-098-10313-2、全 1 章 29 ページ)。3 社の匿名インターネット企業の公開インシデントデータと Google 内部データを用い、インシデント継続時間が正の歪みを持ち標準偏差が平均の 2 倍前後に達することを示したうえで、10 万回のモンテカルロシミュレーション(α = .10)により (1) 全インシデントを実際に 10% 短縮しても MTTR 差がゼロ以下になる試行が 38%/40%/20% を占め、15 分以上の改善が見える確率は 49%/50%/64% にとどまること、(2) インシデントを一切変えなくても 30 分以上の「改善」が 19%/23%/10% の確率で観測されることを実証する。中央値・95 パーセンタイル・幾何平均・合計継続時間でも解決せず、Google の大規模データでも 1 年分で ±5.3% が限界。問題の所在をデータ品質ではなく件数の少なさと分散の高さに帰し、汎用の代替指標は存在しないと明言したうえで「採用前に自分のデータでシミュレーションして検出力を確かめる」手続きを処方する。2026-06-28 に `wiki-ingest-paper` で取り込んだ既存ページを、`wiki-ingest-book` の書籍規約(`source_type: book`・`publish: false`・book entity へのリンク・原本を `.raw/books/` へ)に沿って全面改稿し、図を 5 点から全 10 点へ拡張した。(book / source / sre / incident-management / metrics)
- [[@2025__SRE Kaigi 2025__インシデントキーメトリクスによるインシデント対応の改善]](更新) — 本書から引用された「49%・50%・64%」の条件が一次ソースと食い違う点(相対 10% 改善 対 絶対 15 分改善)を `> [!contradiction]` callout として追記。
### 2026-08-13 ingest-paper | Redefine Statistical Significance(Nature Human Behaviour 2017)
- [[@2017__NatHumBehav__Redefine Statistical Significance]] — [[Daniel J. Benjamin]]*・James O. Berger・[[Magnus Johannesson]]*・Brian Nosek・E.J. Wagenmakers ほか68名(共著者合計73名、*は共同通信著者、もう1名の共同通信著者は末尾の[[Valen E. Johnson]]*)、Nature Human Behaviour Vol.2, pp.6–10(2017-09-01オンライン先行公開)。統計的有意性のデフォルトP値閾値を現行のP<0.05からP<0.005へ変更することを提案する提言論文。両側P値0.05はベイズ因子換算でわずか2.5〜3.4(「弱い」〜「非常に弱い」証拠)にしか相当しないこと(Figure 1)、事前オッズ1:10・P値閾値0.05のとき検出力に関わらず偽陽性率が33%を超えるが閾値0.005では5%まで下がること(Figure 2)を、ベイズ因子換算式と偽陽性率の閉形式近似の2つの定量的論拠で示す。心理学・実験経済学の再現実験プロジェクトの実証データ(P<0.005の初期研究の再現率がP<0.05の初期研究の約2倍)も援用し、偽陰性率の懸念・サンプルサイズ増加(約70%)・多重検定等の他要因への非対処・分野ごとの閾値差・帰無仮説有意性検定自体の代替という5つの想定反論に個別に応答する。実証研究ではなく既存理論・既存再現実験データの再計算に基づく提言論文であるため、実験設定・実験結果に相当する節は本論文の理論的導出と引用データの整理に置き換えて記述した。新規 entity 3件([[Daniel J. Benjamin]]・[[Magnus Johannesson]]・[[Valen E. Johnson]]、共同通信著者3名のみ。73名全著者のentity化は対象外とした)、新規 concept 1件([[統計的有意性]])を作成。図表2点(Figure 1・Figure 2、いずれも埋め込みラスター画像)を本文該当箇所に埋め込み。全11ページ本文+参考文献15件を通読。(paper / source / statistics / research-methodology)
### 2026-08-13 ingest-paper | NVMM-Oriented Hierarchical Persistent Client Caching for Lustre(ACM ToS 2021)
- [[@2021__TOS__NVMM-Oriented Hierarchical Persistent Client Caching for Lustre]] — [[Wen Cheng]]・[[Chunyan Li]]・[[Lingfang Zeng]]([[Huazhong University of Science and Technology]])、[[Yingjin Qian]]・[[Xi Li]]([[DDN]])、[[André Brinkmann]]([[Johannes Gutenberg University Mainz]])、ACM Transactions on Storage Vol.17 No.1 Article 6(2021年1月)。[[Lustre]]クライアントのNVMMを階層型永続キャッシュとして統合するNVMM-LPCCを提案。RW/ROの2キャッシュモードをHSM機構とレイアウトロックで実現し、ネイティブLustre比で読み取りスループット最大35.80倍・書き込みスループット最大9.83倍を達成。(paper / source / hpc / storage)
### 2026-08-13 ingest-paper | The Tail at Scale(CACM 2013)
- [[@2013__CACM__The Tail at Scale]] — [[Jeffrey Dean]]・[[Luiz André Barroso]]([[Google]])、Communications of the ACM Vol.56 No.2, pp.74–80(2013年2月)。大規模分散システムのレイテンシばらつきをフォールトトレランスになぞらえ「tail-tolerant」技術として体系化した基礎論文。ヘッジリクエスト・タイドリクエスト・カナリアリクエスト・マイクロパーティション等の技術と、[[Bigtable]]・クラスタファイルシステム・検索システムでの実測値(99.9パーセンタイルレイテンシ1,800ms→74ms等)を報告。(paper / source / distributed / latency)
### 2026-08-11 ingest-book | AI Systems Performance Engineering(全20章+Appendix)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]] — mechanical sympathyを軸に、DeepSeekのH800制約下でのDualPipe最適化事例とgoodput指標からAIシステム性能エンジニアの役割を導入する。(book / source / gpu / performance)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 2 AI System Hardware Overview]] — Grace CPU+Blackwell GPU(GB200 NVL72)のSuperchip・NVLink/NVSwitch・液冷ラック構成というハードウェア全体像を解説する。(book / source / gpu / networking)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 3 OS, Docker, and Kubernetes Tuning for GPU-Based Environments]] — NUMA・hugepages・MPS/MIG・Kubernetes/SLURMオーケストレーションのシステムレベルチューニングを扱う。(book / source / gpu / systems)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 4 Tuning Distributed Networking Communication]] — RDMA・NCCL・InfiniBand・Magnum IOによる分散ネットワーキング通信のチューニングを扱う。(book / source / gpu / networking)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 5 GPU-Based Storage IO Optimizations]] — GPUDirect Storage・DeepSeek 3FS・PyTorch DataLoader・NVIDIA DALIによるストレージI/O最適化を扱う。(book / source / gpu)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 6 GPU Architecture, CUDA Programming, and Maximizing Occupancy]] — GPUアーキテクチャ・CUDAプログラミングの基礎とRooflineモデルによる占有率最大化を扱う。(book / source / gpu / cuda)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 7 Profiling and Tuning GPU Memory Access Patterns]] — メモリコアレッシング・共有メモリバンクコンフリクト回避・TMAによるメモリアクセスパターンのプロファイリングとチューニングを扱う。(book / source / gpu / cuda)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 8 Occupancy Tuning, Warp Efficiency, and Instruction-Level Parallelism]] — Nsight Systems/Compute診断からoccupancyチューニング・warp divergence緩和・命令レベル並列性引き出しまでを扱う。(book / source / gpu / cuda)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 9 Increasing CUDA Kernel Efficiency and Arithmetic Intensity]] — マルチレベルタイリング・CUTLASS・カーネルフュージョン・低精度Tensor Core活用による演算強度の引き上げを扱う。(book / source / gpu / cuda)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 10 Intra-Kernel Pipelining, Warp Specialization, and Cooperative Thread Block Clusters]] — warp specialization・persistent kernel・thread block cluster/DSMEMによるカーネル内パイプライニングを扱う。(book / source / gpu / cuda)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 11 Inter-Kernel Pipelining, Synchronization, and CUDA Stream-Ordered Memory Allocations]] — CUDAストリームによるカーネル間オーバーラップとstream-ordered memory allocatorによる非同期実行設計を扱う。(book / source / gpu / cuda)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 12 Dynamic Scheduling, CUDA Graphs, and Device-Initiated Kernel Orchestration]] — アトミックワークキュー・CUDA Graphs・Dynamic Parallelism・NVSHMEMによるGPUオーケストレーションを扱う。(book / source / gpu / cuda)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 13 Profiling, Tuning, and Scaling PyTorch]] — PyTorch Profiler・DDP/FSDPによるプロファイリング・チューニング・スケーリングを扱う。(book / source / gpu / machine-learning)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 14 PyTorch Compiler, OpenAI Triton, and XLA Backends]] — TorchDynamo→AOT Autograd→TorchInductorのコンパイルパイプライン、OpenAI Tritonカスタムカーネル、XLAバックエンドを扱う。(book / source / gpu / machine-learning)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 15 Multinode Inference, Parallelism, Decoding, and Routing Optimizations]] — テンソル並列・MoEルーティング・Speculative Decoding・Prefill-Decode分離の配置指針(NIXL・llm-d)を扱う。(book / source / gpu / llm / distributed)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 16 Profiling, Debugging, and Tuning Inference at Scale]] — vLLM/SGLang等の推論エンジンのプロファイリング・デバッグ・大規模チューニングを扱う。(book / source / gpu / llm)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 17 Scaling Disaggregated Prefill and Decode for Inference]] — Disaggregated Prefill/Decodeのスケーリング、NIXLのパス選択、llm-dの動的プール再配分を扱う。(book / source / gpu / llm / distributed)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 18 Advanced Prefill-Decode and KV Cache Tuning]] — FlashMLA/ThunderMLA・分離型KVキャッシュプール・POD-Attentionによる高度なKVキャッシュチューニングを扱う。(book / source / gpu / llm)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 19 Dynamic and Adaptive Inference Engine Optimizations]] — SpeCacheによる投機的KVプリフェッチとGPUメモリ使用率に応じたリアルタイムKVキャッシュ量子化を扱う。(book / source / gpu / llm)
- [[@2025__OReilly__AI Systems Performance Engineering - Chapter 20 AI-Assisted Performance Optimizations and Scaling Toward Multimillion GPU Clusters]] — LLM駆動のGPUカーネル自動生成と超大規模GPUクラスタへのスケーリングを扱う。(book / source / gpu / performance)
- [[@2025__OReilly__AI Systems Performance Engineering - Appendix AI Systems Performance Checklist]] — 全20章の技法を175項目超のチェックリストとして分野別に再編成した付録。(book / source / gpu / performance)
### 2026-08-11 ingest-book | 実践的パフォーマンスエンジニアリングによるAI高速化(全8章)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 1 パフォーマンスエンジニアリング概論]] — パフォーマンスエンジニアリングを性能効率性の全体最適な実践として定義し、「推測するな、計測せよ」の原則・USE/REDメソッド・5段階の実践プロセスを提示する導入章。(book / source / machine-learning / gpu)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 2 パフォーマンス計測]] — 計測の目的・基本戦略・性能指標(レイテンシ/スループット/使用率/飽和度)を整理し、Nsight Systems/Compute・PyTorch Profiler等の計測ツールの使い方を詳述する。(book / source / machine-learning / gpu)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 3 パフォーマンス改善]] — フレームワーク選定・モデル改善([[量子化]]・[[枝刈り]]等)・アルゴリズム改善・分散並列・ハードウェア調整まで、改善手法を視座の高い順に俯瞰する「地図」の章。(book / source / machine-learning / gpu)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 4 実践1:LLM推論]] — Llama3-8B推論をFlashAttention-2・量子化・vLLM導入等で改善し、素朴実装比約13倍のスループット(13,739 tokens/sec)を達成する実践事例。(book / source / machine-learning / gpu)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 5 実践2:LLM事後学習]] — Llama-3.2-1Bのフルパラメータ事後学習を段階的施策で改善し、学習速度5.14倍化を達成する実践事例。(book / source / machine-learning / gpu)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 6 実践3:LLM事前学習]] — [[Megatron-LM]]によるLlama3 70B事前学習をH100からH200へ移植し、損失半減時間を36時間→4時間(9倍速)に短縮する実践事例。(book / source / machine-learning / gpu)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 7 実践4:自動運転AI学習]] — [[BEVFusion]]の学習を3処理の個別改善で最適化し、精度を維持しつつ学習レイテンシを約2倍高速化する実践事例。(book / source / machine-learning / gpu)
- [[@2026__技術評論社__実践的パフォーマンスエンジニアリングによるAI高速化 - Chapter 8 実践5:自動運転AI推論]] — CUDA-BEVFusionをJetson AGX Orin上へエッジデプロイし、量子化・枝刈り・転送隠蔽の組み合わせで最大12%の処理時間短縮を達成する実践事例。(book / source / machine-learning / gpu)
### 2026-08-11 ingest-book
- [[@2016__OReilly__SRE Book - Chapter 2 The Production Environment at Google, from the Viewpoint of an SRE]] — JC van Winkel([[Google]])。Google 本番環境の用語法を導入する用語解説の章。マシン/サーバの区別、[[Borg]] によるクラスタ管理、[[Chubby]] の Paxos 合意とマスタ選出、[[Bigtable]]・[[Colossus]] のストレージ階層、Stubby による RPC、protocol buffers の効率(XML 比サイズ 1/3〜1/10・速度 20〜100 倍)を概説する。(book / source / sre)
- [[@2016__OReilly__SRE Book - Chapter 8 Release Engineering]] — Dinah McNutt([[Google]])。リリースエンジニアリング職能を定義する章。セルフサービス・高頻度リリース・ヘルメティックビルド・アクセス制御の 4 哲学と、[[Rapid]]([[Blaze]] + [[Borg]] + MPM)による再現可能な自動リリース、4 方式の構成管理を解説する。(book / source / sre)
- [[@2016__OReilly__SRE Book - Chapter 9 Simplicity]] — Max Luebbe([[Google]])。安定性と俊敏性の均衡としての単純性を論じる章。探索的コーディング、本質的/偶発的複雑性の区別、コード削除・最小 API・モジュール性・小さなリリースを指針として示す。(book / source / sre)
### 2026-08-04 ingest-paper
- [[@2026__CSUR__The Landscape of GPU-Centric Communication]] — [[Didem Unat]](責任著者)・[[Ilyas Turimbetov]]・[[Mohammed Issa]]・[[Dogan Sagbili]]・[[Ismayil Ismayilov]]([[Koç University]])、[[Flavio Vella]]([[University of Trento]])、[[Daniele De Sensi]]([[Sapienza University of Rome]])。CPUがマルチGPU通信を管理する従来モデルからGPU自身が通信を自律制御するGPU中心通信への移行を、ベンダー機構(GPUDirect・NVLink/NVSwitch等)とユーザーレベルライブラリ(GPU-Aware MPI・GPUCCL・GPUSHMEM)の両面から整理したACM Computing Surveysのサーベイ。ノード内通信を4型・ノード間通信を5型に分類する統一taxonomyを提示し、NCCL/RCCL/oneCCLの実行モデルの質的差異(Table 3)、NVSHMEM/ROC_SHMEM/Intel SHMEMのGPU-NICメモリ一貫性の扱いの差を体系的に整理。CPU-free networking・コレクティブアルゴリズム設計・デバッグ/プロファイリングツール不足を今後の課題として挙げる。→ [[RDMA]] / [[GPU起動型ネットワーキング]] / [[集合通信]]。(paper / source / hpc / gpu / networking / distributed)
- [[@2026__arXiv__Bifrost - Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis]] — Minghua He ほか([[Peking University]]・[[Tsinghua University]]・[[Alibaba Group]]、ASE '26)。既存 PLM が捉えられないログの多階層構造(実行フロー・イベント・コンポーネント)を fallibility representation として定式化し、EFP/AED/SCP の3対照学習タスクと CARL 最適化安定化戦略で学習。BGL・Hadoop・Thunderbird・産業用 Platform-X で AD/RCL/FI の3タスクすべてで既存 PLM を上回る(F1 平均 9.83%・HR@k 平均 18.28%・Macro-F1 平均 20.88%)。(paper / source / aiops / log-analysis / fault-diagnosis / representation-learning)
- [[@2026__arXiv__DBA-Bench - A Production-Fidelity Benchmark for LLM-Based Database Operations Agents]] — [[Junming Chen]]・[[Junyang Jiang]]・Xu Chen・[[Zibo Liang]]・[[Kai Zheng]]([[University of Electronic Science and Technology of China]])。稼働ワークロードを保ったまま多ターンで診断・修復させる本番忠実度データベースエージェントベンチマーク。106 PostgreSQL シナリオ・7タスクドメイン・2難度で、outcome-first 評価(診断精度・修復達成・運用安全性を分離)を行う。848 自動実行で Diagnosis/Outcome/Safe Pass は 32.7%/19.6%/12.4%、最良自動ベースライン(GPT-5.5)の Safe Pass 17.9% は Human DBA 参照の 93.4% と 75.5 ポイントの差。D-Bot・DBAIOps を共通バックボーンで再評価し、診断は正しくても安全な修復を完遂できない「診断-修復ギャップ」を定量化した。(paper / source / database / aiops / benchmark / llm-agent)
### 2026-08-04 ingest-slides
- [[@2026__SpeakerDeck__もう一度考える SRE チームの作り方・育て方]] — [[Ryota Yoshikawa]]([[Topotal]] CTO)。SRE チームの「作り方」を組織信頼性5フェーズ(縦軸)と4つの関わり方(横軸)の平面上での初期配置と目的地の決定として、「育て方」をその平面を動かし続けるプロセスとして再定義。定石「上げてから、右へ」に対し、AI 時代には「上げながら、右へ」も可能になったと論じる。(slides / source / sre / organization)
### 2026-08-04 ingest-paper
- [[@2018__arXiv__What's in a GitHub Star? Understanding Repository Starring Practices in a Social Coding Platform]] — [[Hudson Borges]]・[[Marco Tulio Valente]]([[Universidade Federal de Minas Gerais]])。GitHub スター機能の意味・特性・動的成長を、開発者906名分の2つの独立調査(動機調査・成長パターン認識調査)と上位5,000リポジトリの定量分析で実証。スターは appreciation・bookmark・利用実績の複合シグナルであり73%の開発者が利用/貢献前にスター数を考慮。組織所有リポジトリが個人所有より多スター、age とは無相関・commits と低相関・contributors/forks と中程度相関。KSC クラスタリングでSlow(58.2%)・Moderate(30.0%)・Fast(9.3%)・Viral(2.3%)の4成長パターンを抽出し、Random Forest で Age・Last Push・Issues が最も判別力の高い要因と特定。(paper / source / software-engineering / open-source / github)
### 2026-08-03 ingest
- [[@2025__eunomia.dev__bpftime GPU Support - CUDA and ROCm eBPF Attachment]] — [[Yusheng Zheng]]・[[Tong Yu]]・[[Yiwei Yang]]([[eunomia-bpf]])。[[bpftime]] 公式ドキュメントの GPU 対応実装リファレンス。`nv_attach_impl` パイプライン、3 アタッチ型(`ATTACH_CUDA_PROBE`/`ATTACH_CUDA_RETPROBE`/`__memcapture`)、GPU 専用マップ(array/ringbuf)、GPU ヘルパー関数(ID 501-506)、Host-GPU スピンロック通信プロトコル、kernelretsnoop/threadhist/launchlate の実装例、Nsight Systems/Compute の限界の4分解を詳述。NVBit 比 3-10 倍高速と主張。(article / ebpf / gpu / cuda / rocm / observability)
- [[@2023__paulgraham.com__How to Do Great Work]] — [[Paul Graham]] の2023年7月エッセイ。偉大な仕事をする技法を分野横断の4ステップ(分野選択・フロンティア到達・ギャップ発見・探索)に整理し、「upwind に留まる」戦略・モラールの複利的サイクル・好奇心駆動のオリジナリティ論を展開。→ [[偉大な仕事の技法]]。
### 2026-08-03 ingest-paper
- [[@2026__arXiv__Cloud Performance Decomposition for Long-Term Performance Engineering - A Case Study]] — クラウド性能トレースをトレンド・季節サイクルに分解するハイブリッド/手動および EEMD ベース自動の 2 手法を、SAB の 11 サーバーレス関数で検証したケーススタディ。
#### Enabling Performant and Flexible Model-Internal Observability for LLM Inference (arXiv:2605.11093, 2026-08-03)
- [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] — [[Nengneng Yu]]・[[Sixian Xiong]](共同筆頭)・[[Yibo Zhao]]・[[Wei Wang (UMD)]]・[[Zaoxing Liu]]([[University of Maryland]])。LLM推論の内部状態観測を第一級のシステムプリミティブとして扱うDMI-Libを提案。HookPoint(カスタムPyTorch演算子による同期フリーな任意テンソル捕捉)とRing2(GPU常駐payload ring + CPU寄せmeta ringの二重リングバッファ)で可観測性を推論ホットパスから非同期分離し、オフラインバッチ推論0.4〜6.8%・オンライン提供平均約6%のオーバーヘッドで既存ベースライン(PyTorch hooks・NNsight・vLLM Hook・TensorRT-LLM Debug API)比レイテンシオーバーヘッドを2〜15倍削減。hook filtering + ランタイムポリシー(completeness/best-effort)の2階層オーバーロード制御でPCIe帯域飽和下も段階的に劣化。(paper / source / llm-inference / observability / gpu-systems)
#### UCX: An Open Source Framework for HPC Network APIs and Beyond (HOTI 2015) (2026-07-31)
- [[@2015__HOTI__UCX - An Open Source Framework for HPC Network APIs and Beyond]] — [[Pavel Shamis]]ほか([[Oak Ridge National Laboratory]]・[[Mellanox]]・[[NVIDIA]]・IBM・[[University of Tennessee, Knoxville]])。異種HPCネットワークの低水準API差異をUCS/UCT/UCPの3層で抽象化するUCXの初期設計。InfiniBand UCTの予備評価で、1バイトshort PUTのレイテンシ0.89µs、zcopy帯域6,138.5MB/s、単一CPUコア当たり毎秒1,400万操作を報告する。(paper / source / hpc / networking / rdma)
#### AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization (MLSys 2026, arXiv:2511.15915) (2026-07-31)
- [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] — Genghan Zhang ほか([[Stanford University]]・[[Amazon Web Services]]・[[University of Toronto]])。専門家提供のハードウェア固有最適化知識に頼らず AWS Trainium 向け NKI カーネルを自律的に最適化する自己改善型 LLM エージェントシステム。ビームサーチ(planner・executor・summarizer の3エージェントワークフロー)と、スロー・ファストなカーネル対(正・負の書き換え)を要約して転写する容量制御された最適化メモリを組み合わせる。実世界ワークロード由来の14カーネルから成るベンチマーク NKIBench を新規構築し理論ピーク性能到達率という絶対指標を導入。オープンソースモデルで Trainium 1 のピーク到達率を49%から61%に改善し、Claude Sonnet 4 と同等性能を26倍安いコストで達成、Mamba・RoPE カーネルでは人間専門家の最良実装を上回った。(paper / source / llm-agent / kernel-optimization / ai-accelerator)
#### FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems (MLSys 2026, arXiv:2601.00227) (2026-07-31)
- [[@2026__arXiv__FlashInfer-Bench - Building the Virtuous Cycle for AI-driven LLM Systems]] — Shanli Xing・Yiyan Zhai・Alexander Jiang・Yixin Dong ほか([[University of Washington]]・[[Carnegie Mellon University]]・[[NVIDIA]]・[[University of California, Berkeley]])。LLM エージェントが生成する GPU カーネルを本番 LLM 推論システムへ統合するための標準化フレームワーク。カーネル定義・ワークロード・実装・評価を単一スキーマで記述する FlashInfer Trace、実サービストレース由来の79定義・2,474ワークロードからなるデータセット、決定的/低精度/非決定的カーネルに対応した堅牢なベンチマーク基盤、コード変更なしで最良カーネルを SGLang・vLLM 等へ動的注入する `flashinfer_bench.apply()` を統合。Gemini 2.5 Pro・Claude Opus 4.1・GPT-5・OpenAI o3 の評価で、正しさエラーの94%がコンパイル失敗であること、Triton が CUDA より正しさ・速度ともに優位であること、GEMM ではエージェントが cuBLAS 呼び出しを学習し人間水準に達する一方 GQA Ragged・MLA Paged・MoE では FlashInfer 基準の0.4倍未満にとどまることを示した。(paper / source / llm-inference / gpu-kernel / benchmark / agentic-ai)
### 2026-07-30 ingest-paper | LEANN: A Low-Storage Vector Index (arXiv:2506.08276, MLSys 2026 Oral)
- [[@2025__arXiv__LEANN - A Low-Storage Vector Index]](新規) — Yichuan Wang ほか([[University of California, Berkeley]]・[[The Chinese University of Hong Kong]]・[[Amazon Web Services]]・[[University of California, Davis]])。埋め込みをオンザフライ再計算しグラフメタデータを高次数保存枝刈りで圧縮するストレージ効率型ベクトルインデックス LEANN。76GBデータセットに対しインデックスサイズを4GB(5%未満)に圧縮しHNSW同等の精度を維持、既存手法比最大50倍のストレージ削減。ユーザー提供ローカルPDFとMLSys 2026会議サイト直リンクの発表スライド(37ページ)を統合取り込み。(paper / source / vector-search / rag / on-device)
### 2026-07-30 ingest | クラウド系の国際会議IEEE CLOUD 2020参加録
- [[@2020__yuuk.io__IEEE CLOUD 2020 参加録]](新規) — [[Yuuki Tsubouchi]]、ゆううきブログ、2020-10-29。IEEE World Congress on SERVICES 2020(IEEE CLOUD 併催、COVID-19 でオンライン開催)の参加報告。マイクロサービス・サーバーレス・エッジ-クラウド連携を対象とした異常検知・RCA 研究トレンドを概観し、ベストペーパー Skedulix(ハイブリッドクラウドスケジューリング)を紹介。(article / aiops / sre)
### 2026-07-28 ingest | 30papers 読書リスト(27件)
- 30papers掲載の基礎AI読書リストを27件すべて個別source化。RNN/LSTM/CNN/ResNetから注意機構・Transformer・GNN・スケーリング則、MDL・普遍知能までを横断参照として接続した。各sourceは `@YYYY__30papers__...` を参照。
### 2026-07-27 ingest-paper | Understanding Performance of eBPF Maps (eBPF '24)
- [[@2024__eBPF'24__Understanding Performance of eBPF Maps]](新規) — [[Chang Liu]]・[[Byungchul Tak]]・[[Long Wang]]([[Tsinghua University]] / [[Kyungpook National University]] / [[Zhongguancun Laboratory]])、ACM SIGCOMM 併設 Workshop on eBPF and Kernel Extensions (eBPF '24)、DOI 10.1145/3672197.3673430。array・hash・per-cpu変種・ring/perf buffer・queue/stack を専用ベンチマークシステム(`bpf_bench()`)で網羅測定し、メモリフットプリントとキャッシュホット性がオーバーヘッドの主要因であることを実証。per-cpu hash のゼロ初期化増幅、eBPF の「volume discount」特性(3syscall同時アタッチで単一アタッチ比35〜84%の実行時間)を発見。(paper / ebpf / performance-benchmark / operating-systems)
### 2026-07-27 ingest-paper | Robust Multimodal Failure Detection for Microservice Systems (KDD 2023)
- [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]](新規) — [[Chenyu Zhao]]・[[Minghua Ma]] ほか([[Nankai University]] / [[Microsoft]] / [[Tsinghua University]])。metric/log/trace を異種グラフに統合し GTN(Graph Transformer Network)+GAT(Graph Attention Network)+GRU で学習する教師なしインスタンス障害検知手法 AnoFusion を提案。GAIA データセットで F1=0.857、商業銀行データセットで F1=0.922 を達成し、2 モダリティ手法 SCWarn を最大 41.00% 上回った。(paper / aiops / microservices)
### 2026-07-27 ingest-paper | SequenceFI: Non-intrusive Temporal Fault Injection for Microservice Systems (arXiv 2607.20050)
- [[@2026__arXiv__SequenceFI - Non-intrusive Temporal Fault Injection for Microservice Systems]](新規) — [[Yuzhen Tan]] ほか([[Wuhan University]] / [[Zhongguancun Laboratory]])。マイクロサービス障害注入に「いつ」注入するかという時間的次元を非侵入的サイドカー(TFIProxy)で実現。post-effect/order-sensitive/k-of-n の 3 パターンで 450 試行 100.0% temporal success、TFIC 生成試行回数平均 1 回。(paper / aiops / sre / fault-injection / microservices)
### 2026-07-22 ingest | Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI (NVIDIA Developer Blog)
- [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]](新規) — NVIDIA Developer Blog。エージェント型 AI 推論向けの [[NVIDIA Rubin GPU]](第 3 世代 Transformer Engine・NVFP4 最大 50 PFLOPS・HBM4 最大 288GB/22 TB/s・K 次元テンソルコアスループット倍増)と、ラックスケール統合 [[NVIDIA Vera Rubin NVL72]](Intelligent Power Smoothing・DSX MaxLPS)を解説。(article / gpu / hardware / nvidia / agentic-ai)
### 2026-07-22 ingest-paper | LLM Agents for AIOps in Kubernetes: An Industrial Experience Report with Red Hat OpenShift (FSE Companion '26)
- [[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]](新規) — [[Arthur Vitui]]([[Red Hat]])・[[Tse-Hsun Chen|Tse-Hsun (Peter) Chen]]([[Concordia University]])、ESEC/FSE 2026 Companion、DOI 10.1145/3803437.3805240。[[Red Hat OpenShift]] 上に [[LangChain]]/[[LangGraph]] で実装した [[ReAct]] エージェントを構築し、Kubernetes API・[[Prometheus]]・RAG・容量計画ツール [[MLASP]] をツールとして統合。10 種類の商用 LLM(Anthropic/OpenAI/Mistral)を 20 クエリ(Simple/Advanced Reasoning)で精度・レイテンシ・トークン消費量の 3 軸比較し、GPT-4o が Advanced Reasoning で全問正解した一方、メモリが時間的再計算タスクの正確性を悪化させることを実証した。(paper / aiops / kubernetes / agentic-sre)
### 2026-07-21 ingest-paper | BTrDB: Optimizing Storage System Design for Timeseries Processing (FAST '16)
- [[@2016__FAST__BTrDB - Optimizing Storage System Design for Timeseries Processing]](新規) — [[Michael P Andersen]]・[[David E. Culler]]([[University of California, Berkeley]]、FAST '16、pp.39-52)。マイクロシンクロフェーザ(uPMU)向けの時系列データベース。時間区分・バージョン注釈付き copy-on-write の k-ary ツリーがストレージとインデックスを一体化し、内部ノードに統計サマリ(min/mean/max/count)を無償で埋め込むことで対数時間の統計クエリを実現。4ノード EC2 クラスタで挿入53M/秒・クエリ119M/秒、圧縮率2.9x、本番2.1兆データ点の実績。(paper / time-series / distributed / storage)
- [[@2013__JPUG__性能測定道 事始め編]](新規) — [[早水悠登]](東京大学 喜連川研究室)、日本PostgreSQLユーザ会(JPUG)第27回しくみ+アプリケーション勉強会、2013-10-05。性能測定を「モデル化」「計測」「シミュレーション」の3つの基本形に分解し、相互検証の関係として解説する連続講演の第一回。HDDシーケンシャルリードのモデル化、待ち行列理論M/M/1によるOLTPシステムのモデル化、I/O REPLAYによるシミュレーションを実例として提示。SlideShareのボット対策によりPDF原本は取得できず、CDN上の個別スライド画像(全49枚)を代替の一次資料として使用。(slides / source / database-systems / performance-engineering)
### 2026-07-31 ingest-slides | 性能測定道 実践編
- [[@2014__JPUG__性能測定道 実践編]](新規) — [[早水悠登]](東京大学 喜連川研究室)、日本PostgreSQLユーザ会(JPUG)しくみ+アプリケーション勉強会、2014-02-01。「事始め編」の続編で、CPUのメモリアクセスレイテンシ測定とストレージI/O性能モニタリングの実践を解説。命令パイプライン・スーパースカラ実行・プリフェッチ・分岐予測を意図的に無力化する(ニート化する)コードでレイテンシを正確に測る手法、AWS EC2上でのmicbenchによるL1〜主記憶レイテンシ実測(実測値がWikipedia理論値を一貫して上回る)、自作ツールPerfMongerによるsysstatの限界(可読性・リアルタイム性)克服を実演。SlideShareのボット対策によりPDF原本は取得できず、CDN上の個別スライド画像(全106枚)を代替の一次資料として使用。(slides / source / database-systems / performance-engineering)
### 2026-07-21 ingest | Tales from the Lunar Module Guidance Computer (AAS 04-064, 2004)
- [[@2004__AAS__Tales from the Lunar Module Guidance Computer]](新規) — [[Don Eyles]]([[MIT Instrumentation Laboratory]])。Apollo 11 の 1201/1202 プログラムアラーム(ランデブーレーダーのICD記載漏れ)とスロットル振動「キャッスレーション」(タイムラグ補償の誤り)を当事者が一次資料で解説する回顧録。優先度駆動プリエンプティブExecutive/Waitlist・リスタート保護の設計思想を詳述。(article / fault-tolerance / real-time-systems / postmortem / apollo)
### 2026-07-18 ingest-paper | OpsMem: Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis (arXiv 2026)
- [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]](新規) — Yongqian Sunほか9名(Nankai University / Tsinghua University / Huawei Technologies)、arXiv 2607.11357、2026-07-13。短期記憶(STM、診断状態のグラフ)と長期記憶(LTM、運用経験のグラフ)を cross-memory resonance で結合する失敗診断向けデュアルメモリフレームワーク。Huawei の実運用マイクロサービス障害 120 件データセットで ReAct・GoS・GoS+RAG 系全ベースラインを上回り、LTM consolidation による自己進化も実証した。(paper / aiops / failure-diagnosis / agent-memory)
### 2026-07-18 ingest-paper | MLCommons Chakra: Advancing Performance Benchmarking and Co-design using Standardized Execution Traces (MLSys 2026 Oral)
- [[@2026__MLSys2026__MLCommons Chakra - Advancing Performance Benchmarking and Co-design using Standardized Execution Traces]](新規) — Srinivas Sridharan・Tushar Krishnaほか29名(NVIDIA / Georgia Institute of Technology / AMD / Meta / Keysight / MLCommons ほか)、arXiv 2605.11333、MLSys 2026 Oral。分散AI/MLワークロードの標準実行トレース表現Chakra ETと、Trace Linker/Converter・trace analysis/replay/simulation-emulationからなるMLCommons公認エコシステムを提示。訓練ワークロード(GPT3/Llama3/Mixtral/DeepSeek-MoE等)のトレース分析・リプレイ・シミュレーション・Hardware-in-the-Loopエミュレーションに加え、vLLM統合によるMoEトークンルーティング・KVキャッシュオフロード・Prefill-Decode分離間KV転送の推論トレース分析を実証した。(paper / distributed / benchmarking / mlsystems)
### 2026-07-15 ingest-paper | Scalable and Energy-Efficient AI: System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training (AI, MDPI 2026)
- [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]](新規) — [[Muhammad Ali Shafique]]ほか(Kansas State University / Johnson Controls / Florida Atlantic University / Lawrence Berkeley National Laboratory)、*AI* (MDPI) 2026, 7(7), 232。8×NVIDIA H100と8×NVIDIA B200のシングルノード構成を、5種のLLM(7B〜32B)・3種のVLMのDDP訓練で統制比較。B200のTFLOPs/GPU最大32%向上・訓練時間最大15%短縮という計算優位に対し、TFLOPs/kWとtokens-per-kilojouleは全LLMでH100を下回る「計算-エネルギー不整合」を実測し、ノード単位の実測値を施設規模の年間エネルギー・コストモデリング(2000/5000ノード)へ拡張した。(paper / gpu / energy / llm / aiinfra)
### 2026-07-15 ingest-paper | Speculations Concerning the First Ultraintelligent Machine (Advances in Computers, 1965)
- [[@1965__AdvComput__Speculations Concerning the First Ultraintelligent Machine]](新規) — [[I. J. Good]](Trinity College, Oxford / Atlas Computer Laboratory)。「ウルトラ知能機械」の定義から「知能爆発」概念を初めて明示的に定式化した思弁的モノグラフ。Hebb の細胞集成体理論を修正した「サブアセンブリ理論」により、通信理論の「再生(regeneration)」・統計的情報検索・意味論を統一的に説明しようとする。実験を伴わない理論的試み。(paper / ai-safety / intelligence-explosion)
### 2026-07-14 ingest-slides | 言語モデルの内部機序:解析と解釈 (NLP2025 チュートリアル)
- [[@2025__SpeakerDeck__言語モデルの内部機序:解析と解釈]](新規) — [[Benjamin Heinzerling]]・[[横井祥]]・[[小林悟郎]](理化学研究所・東北大学・国立国語研究所)、言語処理学会第31回年次大会(NLP2025)チュートリアル1(2025-03-10)。内部表現の解析(プロービング、SAE)・計算過程の解析(注意パターン観察、Logit Lens、Circuit Analysis)・言語と世界の対応づけ(解釈)という3段階フレームワークを解説し、終盤で「局所性・一対一対応」という前提自体への懐疑的検討を展開する。全144ページ、transcript なし。(slides / llm / interpretability / mechanistic-interpretability)
### 2026-07-13 ingest-slides | Oncall: An Equal-Opportunity Waste of Time (SREcon22 EMEA, 2022)
- [[@2022__SREcon22EMEA__Oncall - An Equal-Opportunity Waste of Time]](新規) — [[Dave O'Connor]]([[Twilio]] VP Engineering、元 Google SRE 16 年)、USENIX SREcon22 EMEA(2022-10-25)。「オンコールは良いアイデアだが時間の良い使い方ではない」という挑発的命題を軸に、SRE が toxic exceptionalism(オンコールの意図的複雑化・ゲートキープ)によって自らの価値を狭めていると批判。ステークホルダーへの価値証明を工学的乗数効果に移す方法論と思考実験を提示。10 スライド、transcript なし。(slides / sre / oncall / organization / srecon)
### 2026-07-10 ingest-paper | Failure Trends in a Large Disk Drive Population (FAST 2007)
- [[@2007__FAST__Failure Trends in a Large Disk Drive Population]](新規) — [[Eduardo Pinheiro]], [[Wolf-Dietrich Weber]], [[Luiz André Barroso]]([[Google]])、FAST 2007。Google 本番環境 10 万台超の HDD を 9 か月観測。温度・使用率の障害相関が従来通念より弱いことを実証。SMART 強シグナル(スキャンエラー 39×・オフライン再割り当て 21×)を発見するも、障害ドライブの 56% 超が強シグナルゼロという予測限界を定量化。(paper / storage / reliability / hardware / smart / hdd)
### 2026-07-08 ingest-paper | Benchmarking the Overhead of Distributed Tracing Agents (ICPE 2026)
- [[@2026__ICPE__Benchmarking the Overhead of Distributed Tracing Agents]](新規) — [[David Georg Reichelt]] ほか(Lancaster University Leipzig / Christian-Albrechts-Universität zu Kiel)、ICPE '26。MooBench マイクロベンチマークを 7 種 Java トレーシングエージェント(Elastic APM / inspectIT / Kieker / OpenTelemetry / Pinpoint / Scouter / SkyWalking)に拡張。Kieker が最速(133.92 ns/depth)・OpenTelemetry が業界標準のわりに遅い(315.28 ns/depth)・Pinpoint と Scouter はスパン損失バグあり。根本原因は過度なメタデータ管理と ArrayBasedContext コピー。(paper / distributed-tracing / observability / performance-engineering / benchmarking)
### 2026-07-07 ingest-paper | VAST AI Operating System (VAST Data 2025)
- [[@2025__VAST Data__VAST AI Operating System]](新規) — [[VAST Data]]。DASE アーキテクチャ(CNode + NVMe-oF + DBox)基盤の AI OS 白書。DataStore・DataBase・DataSpace・DataEngine・InsightEngine を統合し、Object Store/DB/Kafka/ベクトルDB/K8s を単一クラスターで代替することを標榜。性能値はベンダー自己申告。(whitepaper / storage / ai-infrastructure / rag / distributed)
### 2026-07-06 ingest-paper | INTFusion: Unifying Network and Host Telemetry in Data Center Networks (IFIP Networking 2026)
- [[@2026__IFIP Networking__INTFusion - Unifying Network and Host Telemetry in Data Center Networks]](新規) — [[Leonardo Alberro]] ほか([[Universidad de la República]])、IFIP Networking 2026。smartNIC(Netronome Agilio 4000 CX)への INT ソース/シンクオフロードと eBPF ホスト層トレースを per-flow 粒度で統合する統一型データセンター監視アーキテクチャ。二層エクスポートモデル(イベント駆動リアルタイム + レート制御遅延)。(paper / networking / telemetry / int / smartnic / ebpf)
### 2026-07-06 ingest-paper | ARGUS: Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters (arXiv 2026)
- [[@2026__arXiv__ARGUS - Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters]](新規) — [[Jiasheng Zhou]] ほか(Tencent)。10,000 GPU 超の本番 LLM 訓練クラスター向け常時稼働トレーシング・診断システム。3 層独立計装(< 2% オーバーヘッド)、KDE クラスタリング 3,700 倍圧縮、L1〜L5 段階的診断。6 ヶ月以上本番デプロイ済み。(paper / aiops / gpu / distributed / llm-training)
### 2026-07-06 ingest-paper | KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI (ASE '26)
- [[@2026__ASE__KRCA - An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI]](新規) — [[Jiamin Jiang]] ほか([[Nankai University]] / [[Kuaishou Technology]] / 清華大学)。20万超マイクロサービスのハイパースケール RCA: API レベルドリルダウン + スケルトンベース因果グラフ + マルチエージェント協調の3段パイプライン。AC@1=0.88/0.79 (最強ベースライン比+31%/+32%)、本番77.3%診断時間短縮。(paper / aiops / rca / microservice / multi-agent / llm)
### 2026-07-06 ingest-paper | A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis (arXiv 2026)
- [[@2026__arXiv__A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis]](新規) — [[Yuanhong Cai]] ほか(CNIC/CAS・南開大学・Alibaba Cloud・清華大学)。LLMエージェントによるマイクロサービス障害診断のための推論プロセス評価パラダイムと2データセット(AIOps2025 400件・RCA100 103件)。大規模競技(合計6,093チーム)で検証済み。(paper / aiops / benchmark / llm / rca / microservice)
### 2026-07-06 ingest-paper | A Checkpoint/Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters (APSys 2024 Poster)
- [[@2024__APSys__A Checkpoint-Restore Mechanism with Interoperability Among Distinctive WebAssembly Interpreters]](新規) — [[Daigo Fujii]]・[[Katsuya Matsubara]]・[[Yuki Nakata]]([[Future University Hakodate]] / [[SAKURA internet Inc.]])。WasmEdge (standard interpreter) と WAMR・Wasm3 (fast interpreter) の間で、プログラムカウンタ・コントロールスタック・バリュースタックを相互変換する異種 interpreter 間 checkpoint/restore の予備研究。JIT/AOT は対象外。(paper / webassembly / checkpoint / migration / edge-computing)
### 2026-07-05 ingest-paper | Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum (Mid4CC ’25)
- [[@2025__Mid4CC__Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint-Restore in Edge-Cloud Continuum]](新規) — [[Yuki Nakata]]・[[Katsuya Matsubara]]([[Future University Hakodate]] / [[SAKURA internet Inc.]])。Wasm にコンパイルした自己ホスト型ランタイム Chiwawa を中間層とし、ホストランタイム改修なしでランタイムと最適化戦略の両中立な C/R を実現。wasmtime・WAMR・WasmEdge をホストとする場合ともチェックポイントサイズは 1076 KB で一定。Wizard との比較で自己ホスト設計の有効性、sqlite-bench で自己ホストのオーバーヘッドを評価した。(paper / webassembly / checkpoint / migration / edge-computing)
### 2026-07-05 ingest-paper | Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing (CANDARW 2025)
- [[@2025__CANDARW__Seamless Self-Healing in WebAssembly Container Orchestration with Runtime-Neutral Checkpointing]](新規) — [[Katsuya Matsubara]]・[[Yuzuki Saito]]・[[Daigo Fujii]]・[[Yuki Nakata]]([[Future University Hakodate]] / [[SAKURA internet Inc.]])。ランタイム中立チェックポイントを用いて、Wasm コンテナの障害時にホットリスタートを、メモリ圧力時に WasmEdge から WAMR への動的ランタイム切り替えを実現。Pod 退避なしにメモリ圧力を緩和し、ホットリスタートは通常再起動に比べて応答時間劣化を抑制した。(paper / webassembly / container-orchestration / fault-tolerance / self-healing)
### 2026-07-05 ingest-paper | Reducing Attack Surface with Container Transplantation for Lightweight Sandboxing (APSys ’23)
- [[@2023__APSys__Reducing Attack Surface with Container Transplantation for Lightweight Sandboxing]](新規) — [[Yuki Nakata]]・[[Shintaro Suzuki]]・[[Katsuya Matsubara]]([[SAKURA internet Inc.]] / [[Future University Hakodate]])。Linux コンテナを FreeBSD カーネルへ移植し、Linux カーネル固有の脆弱性攻撃を回避するとともに Capsicum を透過適用する Container Transplantation を提案。UnixBench で gVisor 比で大幅に小さいオーバーヘッド(システムコールオーバーヘッドは runC 比 22% 悪化)を達成した。(paper / container / security / virtualization)
### 2026-07-05 ingest-paper | Stateful VM Migration Among Heterogeneous WebAssembly Runtimes for Efficient Edge-cloud Collaborations (EdgeSys ’24)
- [[@2024__EdgeSys__Stateful VM Migration Among Heterogeneous WebAssembly Runtimes for Efficient Edge-cloud Collaborations]](新規) — [[Daigo Fujii]]・[[Katsuya Matsubara]]・[[Yuki Nakata]]([[Future University Hakodate]] / [[SAKURA internet Inc.]])。WasmEdge と WAMR 間の異種ランタイムステートフルVMマイグレーションを提案。dirty memory検出でCRIU比30〜100倍のチェックポイント時間短縮を達成し、sqlite-benchでランタイム切り替えが単一ランタイム継続より高速になることを実証した。(paper / webassembly / edge-computing / virtualization / migration)
### 2026-07-05 ingest-paper | Concentrated Isolation for Container Networks Toward Application-aware Sandbox Tailoring (UCC 2021)
- [[@2021__UCC__Concentrated Isolation for Container Networks Toward Application-aware Sandbox Tailoring]](新規) — [[Yuki Nakata]]・[[Katsuya Matsubara]]・[[Ryosuke Matsumoto (SAKURA internet)|Ryosuke Matsumoto]]([[Future University Hakodate]] / [[SAKURA internet Inc.]])。PaaS/FaaS コンテナのネットワーク隔離に集中した Sandbox Tailoring の提案と、BitVisor ベースの para-passthrough ハイパーバイザ Subaco を設計・実装。runC と同等の起動時間(約 1.15 秒)を維持しつつ L2/L3/L4 のパケット偽装攻撃とホスト OS のネットワークリソース攻撃を防御する。(paper / container / security / virtualization)
### 2026-07-04 OSDI'25 Extending Applications Safely and Efficiently ingest
- [[@2025__OSDI__Extending Applications Safely and Efficiently]](新規) — [[Yusheng Zheng]]・[[Tong Yu]]・[[Yiwei Yang]]・[[Yanpeng Hu]]・[[Xiaozheng Lai]]・[[Dan Williams]]・[[Andi Quinn]]。ユーザ空間アプリケーション拡張の安全性と効率性を両立する Extension Interface Model([[EIM]])と [[bpftime]] を提案。eBPF スタイル検証、Intel MPK プロセス内隔離、動的バイナリ書き換えにより、Nginx 拡張で 2% オーバーヘッドを達成。eBPF エコシステムとの互換性を保ちながら、Nginx, Redis, FUSE, DeepFlow, sslsniff, Syscount の 6 ユースケースを評価。(paper / operating-systems / ebpf / security / observability)
### 2026-07-04 The GPU Observability Gap ingest
- [[@2025__eunomia.dev__The GPU Observability Gap - Why We Need eBPF on GPU devices]](新規) — [[Yusheng Zheng]]・[[Tong Yu]]・[[Yiwei Yang]]([[eunomia-bpf]])。GPU 観測性ギャップを指摘し、bpftime による PTX/SPIR-V 注入で eBPF を GPU カーネル内で実行する技術を解説。CPU-GPU 境界ツール・ベンダープロファイラ・研究ツールの 3 類型の限界を整理した。(article / ebpf / gpu / observability)
### 2026-07-04 CUDA Events - eBPF-based CUDA API Tracing ingest
- [[@2026__eunomia.dev__CUDA Events - eBPF-based CUDA API Tracing]](新規) — [[yunwei37]]、github-actions[bot]([[eunomia-bpf]])。`libcudart.so` への eBPF uprobe による CUDA API トレースチュートリアル。メモリ管理・データ転送・カーネル起動・ストリーム/イベント同期を ring buffer + libbpf で収集。CUDA API 呼び出しあたり約 2 µs のオーバーヘッドを報告。GPU 内部計装への発展として [[bpftime]]/eGPU を参照。(article / ebpf / cuda / gpu-observability)
- [[@2026__note__デジタルネイチャーの十年 - 計算的物質化から発酵する共在へ]](新規) — [[落合陽一]]。[[計算機自然]]の十年を、計算的物質化、境界溶解、身体多様性、[[null2]] の公共空間化、生成AI以後の [[デジタル発酵]]・[[デジタル蒸留]]・[[Homo Convivium]]・[[マタギドライヴ]] へ整理する note 論考。(article / philosophy-of-technology / media-art / ai-ethics)
### 2026-07-04 計算機自然からマタギドライヴへ ingest
- [[@2026__note__計算機自然からマタギドライヴへ - 自然の再審と脱人間知性的文明論の10年]](新規) — [[落合陽一]]。[[計算機自然]]の10年を、自然概念の多言語的再審、Simondon 的トランスダクション、[[マタギドライヴ]]による辺縁への自己批判、[[批判的デジタルネイチャー]]としての環境・権力・身体問題の内部化へ整理する note 論考。(article / philosophy-of-technology / media-art / posthuman)
### 2026-07-03 AI tools expand scientists' impact but contract science's focus (Nature 2026) ingest
- [[@2026__Nature__Artificial intelligence tools expand scientists' impact but contract science's focus]](新規) — [[Qianyue Hao]]・[[Fengli Xu]]・[[Yong Li]]・[[James Evans]](清華大学 BNRist / シカゴ大学 知識ラボ)。4,130 万件の自然科学論文を BERT 識別モデル(F1=0.875)で AI 拡張研究に分類し、個人利益(3.02 倍論文・4.84 倍引用・1.37 年早い PI 昇進)と集団的縮小(トピック多様性 4.63% 減・研究者間交流 22% 減)を同時実証。Nature 649, 1237–1243 (2026)。PDF 非公開(Nature 購読)。(paper / scientometrics / ai-impact / science-of-science)
### 2026-07-02 PLaMo 2 Technical Report ingest
- [[@2025__arXiv__PLaMo 2 Technical Report]](新規) — [[Preferred Networks]] による日本語重視 LLM 系列 [[PLaMo 2]] の技術報告。Samba ベースの Mamba + スライディングウィンドウアテンション構成、合成日本語データ、重み再利用、31B→8B の構造化枝刈り・知識蒸留、32K 文脈対応 CPT、vLLM 実装、INT4 重み量子化、FP8 KV キャッシュ量子化を報告。図 1-6 を attachment 化済み。(paper / arxiv / llm / japanese / inference)
### 2026-07-02 XProf (MLSys 2026) ingest
- [[@2026__MLSys2026__XProf - An Open, Scalable and Extensible Profiling System for the Modern ML Stack]](新規) — [[Robert Hundt]] ほか([[Google Cloud]]、MLSys 2026 Oral)。OpenXLA エコシステムの ML プロファイラ XProf の設計・アーキテクチャを報告。TraceMe 超低オーバーヘッド計装・GTC 精密クロッキング・MapReduce スケーラブルバックエンドの 3 革新で TPU 0.3% 未満のオーバーヘッドを達成。PJRT C API 拡張でサードパーティアクセラレーターをプラグイン対応。MLPerf 受賞・Google 社内効率改善の実績。(paper / ml-systems / profiling / openxla)
### 2026-07-02 The Case for Learned Index Structures ingest
- [[@2017__arXiv__The Case for Learned Index Structures]](新規) — [[Tim Kraska]]・[[Alex Beutel]]・[[Ed H. Chi]]・[[Jeffrey Dean]]・[[Neoklis Polyzotis]]([[MIT]] / [[Google]])。B-Tree・ハッシュマップ・Bloom filter を「キーから位置または存在を予測するモデル」と再解釈し、[[Learned Index]]、RMI、学習ハッシュ関数、学習 Bloom filter を提案。整数範囲索引で B-Tree 比最大 1.5〜3 倍高速・最大 2 桁小さい索引、学習ハッシュで最大 77.5% 衝突削減、学習 Bloom filter で 1% FPR 時 36% メモリ削減を報告。(paper / database / machine-learning / indexing)
#### Modernizing Incident Response with LLMs, RAG, and the MCP (SREcon25 EMEA, 2025) (2026-07-01)
- [[@2025__SREcon25EMEA__Modernizing Incident Response with LLMs, RAG, and the MCP]] — [[Theofilos Papapanagiotou]]([[Amazon]])、USENIX SREcon25 EMEA(2025-10-08、ダブリン)。属人化した障害対応知識を [[Model Context Protocol]] による人間・エージェント共通ツールインターフェースと、[[RAGベースクラウド運用支援|RAG]](OpenSearch + Bedrock Titan embeddings)による知識検索で刷新する取り組みを報告。「自動化ではなく理解を目指した」を中心主張に、MCPアーキテクチャ・IAMロール分離の認証設計・評価駆動開発(Promptfoo)・cognitive reliability への信頼性再定義を提示。70ページ + YouTube Whisper 音声文字起こし。(slides / sre / incident-management / mcp / rag / agentic-sre / srecon)
### 2026-07-01 The Un-Incident (SREcon25 EMEA) ingest
- [[@2025__SREcon25EMEA__The Un-Incident]](新規) — [[Andreas Deuschl]]([[Dynatrace]]、USENIX SREcon25 EMEA、2025-10-08、ダブリン)。正式宣言されない潜在インシデント「アンインシデント」を 4 類型(No-CI / NOF / Near Miss / Fear Miss)に分類し、Gray Zone Playbook(マインドセット→カルチャー→ストラクチャー→プロセス→事実ベース意思決定)として体系化。30〜60% の潜在インシデントが正式トラッキングを通過しないという実務推計(自己経験)を提示。AI 支援トリアージ(Dynatrace Davis CoPilot)・ラッキーセーブの記録・NOF インシデントのプロダクト設計への転用を処方として示す。26 スライド、transcript なし。(slides / sre / incident-management)
### 2026-07-01 Incident Groundhog Day (SREcon24 EMEA) ingest
- [[@2024__SREcon24EMEA__Incident Groundhog Day]](新規) — [[Hamed Silatani]]([[Uptime Labs]]、USENIX SREcon24 EMEA、2024-10-30、ダブリン)。20名のインシデントマネージャーが同一ステージドワールドシミュレーション(Black Friday eコマース・APIキー障害)を個別体験した実験報告。13/20が25分以内に解決。解決時間は経験と相関せず、重大度議論に費やした時間が多いほど解決時間が短くなった。Solo Artist vs Band Member の行動パターン差、Allspaw の4カテゴリ(Diagnostic/Therapeutic/Recruiting/Status-Reporting)を実証。31フレーム、YouTube 自動字幕 transcript(1967行)付き。(video / sre / incident-management / incident-simulation)
### 2026-07-01 Incident Management Metrics that Matter (SREcon25 Americas) ingest
- [[@2025__SREcon25Americas__Incident Management Metrics that Matter]](新規) — [[Jamie Luck]]・[[Laura de Vesine]]([[Datadog]])、USENIX SREcon25 Americas、2025-03-27、サンタクララ。MTTR など naive なメトリクスの統計的不堅牢性と逆インセンティブを論証し、8 次元・目標ベースの代替指標フレームワークを Datadog 実践から提示。ロールプレイ形式、49 スライド(スピーカーノート付き)、transcript なし。(slides / sre / incident-management / metrics)
### 2026-07-01 From 4 Hours to 8 Minutes with AI Agents that Transform SRE Incident Response (SREcon25 EMEA) ingest
- [[@2025__SREcon25EMEA__From 4 Hours to 8 Minutes with AI Agents that Transform SRE Incident Response]](新規) — [[Peter Jausovec]]([[Solo.io]])、USENIX SREcon25 EMEA、2025-10、ダブリン。AIRE (AI Reliability Engineering) フレームワークと [[kagent]](Kubernetes ネイティブ、CNCF サンドボックス)を用いた SRE インシデント対応の自動化。エージェント構成(システムプロンプト+ツール+LLM)・エージェントループ・MCP(Model Context Protocol)・A2A(Agent2Agent)プロトコル・主要能力4段階(Operational Knowledge / Awareness / Investigation / Resolution)を解説。17スライド、transcript なし、デモあり(スライド未記録)。(slides / sre / aiops / agent / mcp / cloud-native)
### 2026-07-01 Embracing the Multi-Party Dilemma (SREcon23 EMEA) ingest
- [[@2023__SREcon23EMEA__Embracing the Multi-Party Dilemma - Incident Response Across Company Boundaries]](新規) — [[Sarah Butt]]([[SentinelOne]])・[[Alex Elman]]([[Indeed]])、USENIX SREcon23 EMEA、2023-10、ダブリン。組織境界を越えたインシデント対応で生じる「Multi-Party Dilemma(多者間ジレンマ)」——情報・影響・時間的の3非対称性——を、Indeed の Learning from Incidents 実践(2021年テーマ分析)を出発点に体系化。ベンダーとの一過性組織(transient organization)・多中心的統治(polycentric governance)モデル、CDN ベンダーとの双方向情報共有によるリトライストーム回避事例を含む。20フレーム(7枚を目視確認)、whisper 自動文字起こし transcript(147行)付き。(video / sre / incident-response / resilience-engineering / human-factors)
### 2026-07-01 What Is Incident Severity, but a Lie Agreed Upon? (SREcon24 Americas) ingest
- [[@2024__SREcon24 Americas__What Is Incident Severity, but a Lie Agreed Upon?]](新規) — [[Emily Ruppe|Em Ruppe]]([[Jeli]]、登壇時点で [[PagerDuty]] に買収済み、USENIX SREcon24 Americas、2024-03-19、サンフランシスコ)。インシデント重大度は「組織内で合意された嘘」であるという Fred Nii の言葉を出発点に、重大度の正しい定義よりも組織的合意の難しさを論じる。severity を組織的問題(過小評価・過大評価・説明不足・未成熟さ)の「カナリア」と位置づけ、Google/Facebook 型の複雑な多次元マトリクス化("incident math")を明確に否定。17フレーム、YouTube 自動字幕 transcript(1634行)付き。(video / sre / incident-management)
### 2026-07-01 An Organizational Response to Incidents (SREcon23 Americas) ingest
- [[@2023__SREcon23Americas__An Organizational Response to Incidents]](新規) — Dr. [[Laura Maguire]]([[Jeli]]、USENIX SREcon23 Americas、2023-03-22、Santa Clara)。Incident Commander への組織的関心の集中を問い直し、対応の大半を担う「フォロワー」の働き——[[Followship]]——を、SNAFUcatchers・IBM・New Relic 等との共同研究知見から体系化。調整のパラドックス・DELEGATE/DELAY/DIMINISH/DROP戦略・フォロワーシップが見える8つの行動・共通基盤(common ground)の4象限・Reconfiguring(組織再編)・Observe/Talk/Analyzeフレームワークを提示。101スライド、transcript なし。(slides / sre / incident-response / resilience-engineering / human-factors)
### 2026-07-01 Handover Communications in Software Operations (SREcon23 Americas) ingest
- [[@2023__SREcon23Americas__Handover Communications in Software Operations - Findings from the Field]](新規) — [[Chad Todd]]([[CrowdStrike]]、[[Lund University]] 大学院で人的要因・安全科学を専攻、USENIX SREcon23 Americas、2023-03-21、サンフランシスコ)。半構造化インタビューによる質的研究で、CrowdStrike 社内の Network Operations Center・Customer Support Center を対象に、引き継ぎコミュニケーション([[Handover Communications]])がエンジニアの確信度(Confidence)に与える影響を [[Joint Activity]]・[[Common Grounding]]・Adaptive Capacity の3概念で分析。6テーマを抽出。38スライド、Whisper transcript(335行)付き。(slides / human-factors / sre / incident-response)
### 2026-07-01 The Math behind the Incident Aftermath (SREcon22 APAC) ingest
- [[@2022__SREcon22APAC__The Math behind the Incident Aftermath]](新規) — [[Ashish Patel]] / [[Sriram Srinivasan]]([[PayPal]] Site Reliability Platform Engineering / Technical Architect、SREcon22 APAC、2022-12-07、シドニー)。インシデントの顧客影響を FCI(Failed Customer Interactions)という定量指標で測定する実務フレームワーク。ベースライン予測との乖離から可用性を算出し(実例: Baseline 99.9990% vs 実測 99.6171%、FCI 33,322件)、国・製品・マーチャント等5軸でセグメンテーション可能。動画は要ログインのため未取得。34スライド。(slides / sre / incident-management / fci)
### 2026-07-01 Evolution of Incident Management at Slack (SREcon21) ingest
- [[@2021__SREcon21__Evolution of Incident Management at Slack]](新規) — [[Brent Chapman]](Slack, Staff Engineer / Reliability Pillar、USENIX SREcon21、2021-10-14)。Google iMAG の設計者が Slack の 2018年 reliability crisis を機に Incident Management プログラムをゼロから構築し、Major IC オンコールが直面した7つの課題(地域間負荷格差・個人責任過多・タスク過多・同時多発・リソース競合・長期化・特定チーム偏在)とその解決策(Slack IC・Area Command・pillar別ローテーション等)を解説。PagerDuty クラスを土台にした IC 訓練率実績25%等の定量データも含む。41スライド、YouTube 音声 Whisper transcript(301行)付き。(slides / sre / incident-management)
### 2026-07-01 You Can't Stop Fires with an Ambulance (SREcon18 Asia) ingest
- [[@2018__SREcon18Asia__You Can't Stop Fires with an Ambulance]](新規) — [[Piers Chamberlain]]([[Xero]] Head of Site Reliability Engineering、SREcon18 Asia/Australia、2018-06、シンガポール)。クラウド移行後のアラート倍増・インシデント増加への対応として、症状ベースアラート [[Klaxon]](顧客ページヒット率検知)・chatbot [[Multivac]](war room 代替)・運用衛生スコア [[Report Card]] を紹介。2年分の post-mortem を手動横断集計し `#release` が最大の contributing cause と発見。23スライド、transcript付き。(slides / sre / alert-management / incident-management)
### 2026-07-01 Fixing On-Call When Nobody Thinks It's (Too) Broken (SREcon19 Americas) ingest
- [[@2019__SREcon19 Americas__Fixing On-Call When Nobody Thinks It's (Too) Broken]](新規) — [[Tony Lykke]]([[Hudson River Trading]] Trade Systems SRE、SREcon19 Americas、2019-03-25)。高urgencyページを6年間の71,317件(週平均201件)から4か月で1,015件(週平均56件)へ削減した実務報告。技術変更は最小限のフィルタ層追加に留め、「9 Really Hard Steps」フレームワークとgit shortlogによるバイイン可視化で組織的合意形成を進めた。34スライド、YouTube自動字幕transcript付き。(slides / sre / alert-management / on-call)
### 2026-07-01 nrrd 911 ic me (SREcon16 Americas) ingest
- [[@2016__SREcon16__nrrd 911 ic me - The Incident Commander Role]](新規) — [[Alice Goldfuss]]([[New Relic]] SRE、SREcon16 Americas、2016-03)。ICS(Incident Command System)のソフトウェア運用適応。3役分離(IC/TL/CL)・Sev1 拡張(EC/LL)・重大度5段階・Hubot/Nrrd chatbot デモ・全員訓練方針・3日→3時間の ROI 証拠。transcript(Whisper)付き。51スライド。(slides / sre / incident-management / ics)
### 2026-07-01 Software Engineering (Boehm, IEEE-TC 1976) ingest
- [[@1976__IEEE-TC__Software Engineering]](新規) — [[Barry W. Boehm]]([[TRW Systems and Energy Group]]、IEEE Transactions on Computers, Vol. C-25, No. 12、1976-12)。ソフトウェアエンジニアリングの定義と 1976 年時点の包括的サーベイ。欠陥修正コストの指数的増大・設計エラー優位(60:40)・保守コスト約 70% の実証データを含む。Area 1 vs Area 2 の二分類でソフトウェア科学の成熟度を診断。6 図・104 文献。(paper / software-engineering / survey / classic)
### 2026-07-01 Unified Theory of SRE (SREcon22 EMEA) ingest
- [[@2022__SREcon22 EMEA__Unified Theory of SRE]](新規) — [[Emil Stolarsky]]([[Wave Mobile Money]]、SREcon22 EMEA、2022-10)。SRE Book が 2400+ インフラエンジニアを抱える Google 固有の前提で書かれているという批判的考察と、スタートアップ(Default Dead)向けの SRE 再構築論。開発速度優先・Boring Technology・FAANG 技術フロンティア論を含む。48 スライド、YouTube 動画付き。(slides / sre / startup / reliability / boring-technology)
### 2026-07-01 Notes from Production Engineering (SREcon15) ingest
- [[@2015__SREcon15__Notes from Production Engineering]](新規) — [[Pedro Canahuati]](Facebook Production Engineering ディレクター)。SREcon15, 2015-03-13。Facebook が 2009 年から 2015 年にかけて SRE 組織をゼロから再建した 5 段階変革の記録。SRO の創設と解散・FBAR による自動化・Cobalt クラスター自動構築・ODS モニタリング・週次 SEV レビューを詳述。(video / sre / organization / facebook)
### 2026-06-30 Software Analytics for Incident Management of Online Services (ASE 2013) ingest
- [[@2013__ASE__Software Analytics for Incident Management of Online Services - An Experience Report]](新規) — [[Jian-Guang Lou]] / [[Qingwei Lin]] / [[Rui Ding]] / [[Qiang Fu]] / [[Dongmei Zhang]](Microsoft Research Asia) / [[Tao Xie]](UIUC)。ASE 2013 Experience Track, pp. 475–485。インシデント管理をソフトウェアアナリティクス問題として定式化し Service Analysis Studio(SAS)を開発・本番展開した最初期産業 AIOps の経験報告。CAR マイニングによるインシデントビーコン特定(再現率~90% vs L1-LR ~60%)・FCA+DMI による不審実行パターン抽出・ガウス異常検知による異常サーバロール検知・GVSM 治癒行動推薦(top-1 精度 0.90)の 4 手法を含む。OCE 91% が利用、86% のインシデントを診断対象、76% で有用。(paper / aiops / incident-management / software-analytics / log-analysis)
### 2026-06-30 Xpert (ICSE 2024) ingest
- [[@2024__ICSE__Xpert - Empowering Incident Management with Query Recommendations via Large Language Models]](新規) — [[Yuxuan Jiang]] ほか 10 名([[University of Michigan]] / [[Microsoft]])。ICSE 2024。LLM ICL + Faiss ベクター検索による KQL クエリ自動推薦。GPT-4 版が Identicality 35.46%(template)で全ベースラインを凌駕。Xcore(構文・意味・出力スキーマの 3 観点評価指標)を新提案。本番 1 ヶ月パイロットで応答時間約 5 秒。(paper / aiops / incident-management / llm / kql / query-recommendation)
### 2026-06-30 AI Assistants for Incident Lifecycle in a Microservice Environment (arXiv 2024) ingest
- [[@2024__arXiv__AI Assistants for Incident Lifecycle in a Microservice Environment - A Systematic Literature Review]](新規) — [[Dahlia Ziqi Zhou]]・[[Marios Fokaefs]]([[York University]])。arXiv 2410.04334、2024 年 10 月。309 件から 31 件を選定した SLR。Detect 54.8%・Contain 35.4%・Prepare 9.7%・Post-incident 3.2%。LLM 38.7%・DL 32.2%。ユーザースタディ 5/31 件。(paper / survey / aiops / incident-management / microservice / llm)
### 2026-06-30 FaultProfIT (ICSE-SEIP 2024) ingest
- [[@2024__ICSE-SEIP__FaultProfIT - Hierarchical Fault Profiling of Incident Tickets in Large-scale Cloud Systems]](新規) — [[Junjie Huang]] ほか 9 名([[The Chinese University of Hong Kong]] / [[Sun Yat-sen University]] / [[Huawei Cloud]])。ICSE-SEIP 2024。クラウドシステムのポストモーテムにおける障害パターンプロファイリングを初めて自動化。階層誘導型対照学習 + Graphormer で F1=78.3%(HiAGM 比 +3.2 ポイント)を達成。Huawei Cloud(CloudA)で 6 ヶ月本番稼働、30+ サービス・10,000+ インシデントを解析。(paper / aiops / incident-management / postmortem / cloud)
### 2026-06-30 Fail through the Cracks (EuroSys 2023) ingest
- [[@2023__EuroSys__Fail through the Cracks - Cross-System Interaction Failures in Modern Cloud Systems]](新規) — [[Lilia Tang]]・[[Chaitanya Bhandari]]* ほか([[University of Illinois Urbana-Champaign]] / [[Purdue University]])。EuroSys '23。CSI 障害(クロスシステムインタラクション障害)の初体系分析。本番インシデントの20%がCSI起因。データプレーン51%・管理プレーン32%・コントロールプレーン17%。(source / paper / cloud / reliability / distributed / csifailures)
### 2026-06-30 Metastable Failures in Distributed Systems (HotOS 2021) ingest
- [[@2021__HotOS__Metastable Failures in Distributed Systems]](新規) — [[Nathan Bronson]](Rockset、旧 Facebook)ほか 3 名。HotOS 2021。分散システムのメタ安定障害を初めて体系化。安定・脆弱・メタ安定の 3 状態モデルと sustaining effect の概念を導入。再試行・キャッシュ・リンク不均衡の 4 事例。特性メトリクス・隠れキャパシティ・トリガー強度の研究課題を提示。(paper / distributed-systems / reliability / sre / metastable-failures)
### 2026-06-30 Gray Failure: The Achilles' Heel of Cloud-Scale Systems (HotOS 2017) ingest
- [[@2017__HotOS__Gray Failure - The Achilles' Heel of Cloud-Scale Systems]](新規) — [[Peng Huang]] ほか 6 名([[Microsoft Research]] / [[Microsoft Azure]] / [[Johns Hopkins University]])。HotOS 2017。Azure 本番インシデント経験からグレイ障害の公式定義(差分可観測性)を提唱し、高冗長性が逆に可用性を下げる逆説・ハートビート検知器の死角・復旧が連鎖障害を招くケースを示す。解決方向は「Observer の観測ギャップを埋める」多次元ヘルス監視。(paper / reliability / cloud / gray-failure / differential-observability / azure)
### 2026-06-30 mTCP: a Highly Scalable User-level TCP Stack for Multicore Systems (NSDI 2014) ingest
- [[@2014__NSDI__mTCP - a Highly Scalable User-level TCP Stack for Multicore Systems]](新規) — [[EunYoung Jeong]] ほか([[KAIST]] / Princeton University)。ユーザーレベルTCPスタック mTCP。パケットI/Oとソケットイベントの双方向バッチ統合でカーネルTCPスタックの根本的非効率性を解決。8コアで Linux 比25倍・MegaPipe 比3倍のトランザクション性能。NSDI Community Award 受賞。(source / paper / networking / systems / kernel-bypass)
### 2026-06-30 ISPASS 2015 — VM vs Linux Containers ingest
- [[@2015__ISPASS__An Updated Performance Comparison of Virtual Machines and Linux Containers]](新規) — Wes Felter ほか(IBM Research Austin)。Docker 1.0 と KVM を Intel Sandy Bridge-EP サーバ上で体系比較。コンテナはほぼ全ケースで VM と同等以上の性能。AUFS と NAT がパフォーマンス落とし穴。(source / paper / systems / virtualization / cloud)
### 2026-06-30 Scaling Memcache at Facebook (NSDI 2013) ingest
- [[@2013__NSDI__Scaling Memcache at Facebook]](新規) — Rajesh Nishtala ほか 13 名(Facebook Inc.)。秒間数十億リクエストを処理する memcached ベース分散キー値ストアの設計・運用を詳述。リースメカニズム・Gutter プール・mcsqueal・Cold Cluster Warmup 等を体系化。(source / paper / distributed / caching)
### 2026-06-30 Live Upgrading Thousands of Servers from an Ancient Red Hat Distribution to 10 Year Newer Debian Based One (LISA 2013) ingest
- [[@2013__LISA__Live Upgrading Thousands of Servers from an Ancient Red Hat Distribution to 10 Year Newer Debian Based One]](新規) — Marc Merlin(Google)による、Red Hat 7.1 から Debian ベース ProdNG へ数千台をライブアップグレードした経験報告。ファイルレベル同期・段階的パッケージ移行・ELF バイナリパッチ。LISA '13。
### 2026-06-30 An AI system to help scientists write expert-level empirical software (Nature 2026) ingest
- [[@2026__Nature__An AI system to help scientists write expert-level empirical software]] — Eser Aygün\* ほか 14 名(\*equal contrib, alphabetical)、責任著者: Shibl Mourad([[DeepMind]])・[[Michael P. Brenner]]([[Google Research]] / [[Harvard University]])。Nature Vol. 654, Issue 8120(2026-05-19 オンライン)。ERA(Empirical Research Assistance):LLM + PUCT 木探索でスコアリング可能な科学タスクの経験的ソフトウェアを自動生成。scRNA-seq バッチ統合で 40 手法が OpenProblems リーダーボードの人手最高手法を凌駕、COVID-19 入院予測で 14 手法が CDC アンサンブルを上回った。GIFT-Eval・ZAPBench・地理空間・数値積分でもエキスパートレベル。arXiv:2509.06503v3。(paper / ai4science / llm / tree-search / code-generation / nature / bioinformatics / epidemiology)
### 2026-06-30 Towards end-to-end automation of AI research (Nature 2026) ingest
- [[@2026__Nature__Towards end-to-end automation of AI research]] — [[Chris Lu]]・[[Cong Lu]]・[[Robert Tjarko Lange]]・[[Yutaro Yamada]]・[[Shengran Hu]]・[[Jakob Foerster]]・[[David Ha]]・[[Jeff Clune]]([[Sakana AI]] / University of Oxford / UBC / Vector Institute)。Nature Vol. 651 (2026-03-26)。The AI Scientist: アイデア創出・実験・論文執筆・査読を端から端まで自律化するパイプライン。テンプレートベースとテンプレート自由(並列化エージェントツリー探索)の2モード。生成論文がILCR 2025 ICBINBワークショップ査読(採択率70%)を通過した初事例。自動査読者の均衡精度は人間と同等(69% vs 66%)。モデル世代・計算量の両軸でスケーリングする。(paper / ai-research-automation / llm / agentic-ai / scientific-discovery / nature)
### 2026-06-30 Practices for Making Alerts Actionable (SRE NEXT 2020)
- [[@2020__SRENext2020__Practices for Making Alerts Actionable]] — [[Sohei Iwahori]]([[GREE, Inc]]、インフラ/Monitoring Unit Leader)。SRE NEXT 2020(2020-01-25)。オンプレ由来アラートルールのクラウド流用で2018/09に月300件超ピークを経験。月次Top10計測・振り分け3段階(Slack/JIRA/PagerDuty)・Alert Operator自動復旧・SysLoad共通指標の5本柱でアクショナブル化を実践。41 スライド。(slides / sre / alert-management / on-call / gree / sre-next)
### 2026-06-30 Who owns the Service Level? (SRE NEXT 2022)
- [[@2022__SRENext2022__Who owns the Service Level?]] — [[近藤武士]]([[Recruit]]、Engineering Manager, SRE)。SRE NEXT 2022(2022-05-15)。スタディサプリでの SLO Review(2020)振り返りと技術戦略グループによる解決——SLI/SLO 定義・観察は成功したが Error Budget Policy の行動定着に失敗した構造的理由(非機能要求への予算・権限不足)と 1:1:1 予算配分による解決。「Service Level は全員のもの」。79 スライド。(slides / sre / slo / sre-next / studysapuri / recruit)
### 2026-06-30 Enabling Client-side SLO (SRE NEXT 2024)
- [[@2024__SRENext2024__Enabling Client-side SLO]] — [[Wataru Tsuda]]([[Luup]] Reliability Engineer、gr1m0h)。SRE NEXT 2024(2024-08-04、Track B jp005)。iOS/Android クライアントへの SLO 拡張——BLE 操作や Firestore 直接通信が API 計測では漏れるため、CUJ 再設定(PdM/SWE/SRE 三者・ユーザージャーニーマトリクス)→ Datadog APM p75 Latency SLI → Datadog Time Slice SLO + Multi-tiered SLOs(Upside/Downside/Actual)まで実践。文化醸成(Weekly SLI/SLO レビュー)が最重要。41 スライド。(slides / sre / slo / client-side / mobile / enabling-sre / sre-next / luup)
### 2026-06-30 電動マイクロモビリティのシェアサービス「LUUP」におけるEnabling SLOの実践 (SRE NEXT 2023)
- [[@2023__SRENext2023__電動マイクロモビリティのシェアサービス「LUUP」におけるEnabling SLOの実践]] — [[Wataru Tsuda]]([[Luup]] SRE、gr1m0h)。SRE NEXT 2023(2023-09-29)。Enabling SLO として開発組織全体に SLI/SLO を普及(習熟度調査14問+勉強会)し、IoT チームには CMC(Critical Machine Communication)概念で SLI を設計。Embedded SRE が困難なスタートアップではLeadとの直接コミュニケーションが有効。35 スライド。(slides / sre / slo / iot / enabling-sre / sre-next / luup)
### 2026-06-30 プロダクトオーナーとしてSLOに向き合う 〜Mackerelチームの事例〜 (SRE NEXT 2023)
- [[@2023__SRENext2023__プロダクトオーナーとしてSLOに向き合う 〜Mackerelチームの事例〜]] — [[渡辺 起]]([[Hatena]]、Mackerel プロデューサー)。SRE NEXT 2023(2023-09-29)。PO 視点での SLO 導入実践——「判断と改善をチームで回す」を動機に、信頼性をユーザー主語で定義し仮値から始めた Mackerel チームの事例。Error Budget Policy は「調査するか判断する」から開始。DORA 2022 フロー/後期段階。39 スライド。(slides / sre / slo / sre-next / hatena / mackerel)
### 2026-07-01 Tales from the VOID: The Scary Truth About Incident Metrics (SREcon22 Americas)
- [[@2022__SREcon22Americas__Tales from the VOID - The Scary Truth About Incident Metrics]] — [[Courtney Nash]]([[Verica]])。SREcon22 Americas(2022-03-14)。VOID データベース(1,856 件・610 組織)の実分布を用いて MTTR・持続時間・RCA の統計的不堅牢性と認識論的問題を論証し、SLO・調整コスト・テーマ/ナラティブ・ニアミス分析への転換を提案。29 スライド、transcript なし。(slides / sre / incident-management / metrics / postmortem)
### 2026-06-30 DO, RE, Me: Measuring the Effectiveness of Site Reliability Engineering (SREcon22 Americas)
- [[@2022__SREcon22Americas__DO RE Me - Measuring the Effectiveness of Site Reliability Engineering]] — [[Dave Stanke]](Google Cloud、SREcon22 Americas、2022-03-16)。DORA の 2021 年 SRE 調査を紹介。52% が SRE 実践、信頼性は force multiplier、SRE は DevOps の一部を実装。49 スライド。(slides / sre / devops / dora)
### 2026-06-30 Is the S in SRE for "Security"? (SREcon25 Americas)
- [[@2025__SREcon25Americas__Is the S in SRE for Security]] — [[John Benninghoff]]([[Security Differently]] 創業者)。SREcon25 Americas(2025-03)。Safety-II・DORA・Veracode・Sonatype の実証データを根拠に、SRE の中核実践(インベントリ管理・パッチ頻度)がセキュリティコントロールのトップ2と同一であることを示す。Security Level Objectives(SLO のセキュリティ版)の概念を提案。29 スライド。(slides / sre / security / safety)
Navigation: [[index]] | [[concepts/_index]] | [[entities/_index]]
ingest した新規ソース 1 件につき 1 ページの要約一覧。原本は `.raw/` に不変で保持される。
---
### 2026-06-30 Beyond Sequential: A Recipe for Async Pipeline Observability and Alerting (SREcon25 Americas)
- [[@2025__SREcon25Americas__Beyond Sequential - A Recipe for Async Pipeline Observability and Alerting]] — [[Jash Mistry]]・[[Gabriela Medvetska]]([[eBay]] SRE)。SREcon25 Americas(2025-03)。非同期パイプライン(Producer→Queue→Consumer→Retry)に SLI/SLO を適用するレシピ。可用性 SLI(SUCCESS/ABANDONED 比率、RETRY 除外)・レイテンシ SLI(end-to-end 累積 histogram)・マルチウィンドウ・マルチバーンレートアラート(Critical/Warning 2 段階)・SLO ダッシュボード 4 ビュー・Serving Suggestions(Triage Assistant/CI 統合/Coverage & Compliance)・ケーススタディ 2 件。50 スライド。(slides / sre / slo / async / observability)
### 2026-06-30 9 Things You Should Do When Starting to Use SLOs (SREcon23 EMEA)
- [[@2023__SREcon23EMEA__9 Things You Should Do When Starting to Use SLOs]] — [[Sal Furino]](Customer Reliability Engineer)。SREcon23 EMEA(2023-10-11、ダブリン)。SLO 導入の 9 アドバイスを「システム理解・期待値理解・逸脱認識」3 カテゴリで整理。成功率 > エラー率の SLI 原則、ステークホルダー別時間窓(24h/14D/Monthly)、SLODLC(SLO Development Lifecycle)フレームワーク、「Observability Without Action is Just Storage」の格言。40 スライド。(slides / sre / slo / slodlc)
### 2026-06-30 Measuring Reliability: What Got Us Here Won't Get Us There (SREcon22 EMEA)
- [[@2022__SREcon22EMEA__Measuring Reliability - What Got Us Here Won't Get Us There]] — [[Štěpán Davidovič]]([[Google]] Senior Staff SRE)。SREcon22 EMEA(2022-10-25、アムステルダム)。SLI/SLO モデルの限界(誤差マージン・線形性仮定・最良データでない)を体系化し、「問い → モデル → バックテスト」3 ステップのオペレーショナリゼーションを提唱。ステークホルダー 5 類(オンコール〜CEO)ごとに異なる時間窓・SLI 数が必要というバブルチャートが特徴的。42 スライド。(slides / sre / slo / reliability-measurement)
### 2026-06-30 SLX: An Extended SLO Framework to Expedite Incident Recovery (SREcon21)
- [[@2021__SREcon21__SLX - An Extended SLO Framework to Expedite Incident Recovery]] — [[Qian Ding]]・[[Xuan Zhang (Ant Group)]]([[Ant Group]] Infra SRE)。SREcon21(2021-10-13、Virtual)。SLO を SLF(Service Level Factor)と SLD(Service Level Dependency)に拡張し、SLX Graph と GitOps 管理で大規模インシデント調査を効率化する実践報告。40 スライド。(slides / sre / slo / aiops)
### 2026-06-30 Going from 30 to 30 Million SLOs (SREcon22 EMEA)
- [[@2022__SREcon22EMEA__Going-from-30-to-30-Million-SLOs]] — [[Alex Palcuie]]([[Google]] SRE、GCE Compute API チーム)。SREcon22 EMEA(2022-10、アムステルダム)。GCE の SLO を 6 年間で 30 個 → 約 1,000 個 → 3,000 万個(顧客単位)へ拡張した実践。レイテンシを「fast requests / total requests」として可用性 SLI と同一基盤で管理するトリック、Rachel Kroll "Your nines are not my nines" の動機、5 エラーのルール(少トラフィック顧客への動的 SLO ターゲット設定)、per-project SLI/SLO 演算グラフを解説。28 スライド。(slides / sre / slo / per-customer)
### 2026-06-30 Principled Performance Analytics (SREcon22 Americas)
- [[@2022__SREcon22Americas__Principled Performance Analytics]] — [[Narayan Desai]]・[[Brent Bryan]]([[Google]] Cloud SRE)。SREcon22 Americas(2022-03-16)。SLO の根本的限界(エラー認識は人間のゲシュタルト的判断に依存し SLO は実現不可能)を論じ、代替として 2σ手法(ワークロードコホート+正規分布 z スコア+較正不要の定常性検定)を提示。バックテストで従来監視より 18 時間先行した障害検知、階層的診断、逸脱影響評価、相関計測、コホート A/B テストの 5 アプリケーション。40 スライド。(slides / sre / performance-analytics / stationarity)
### 2026-06-30 Beyond Goldilocks Reliability (SREcon21)
- [[@2021__SREcon21__Beyond-Goldilocks-Reliability]] — [[Narayan Desai]]([[Google]] Cloud SRE)。SREcon21(2021-10-14)。Goldilocks Reliability(SLI 閾値設定アプローチ)の 4 荷重仮定を分析・批判し、代替として定常性(Stationarity)による信頼性モデル化を提唱。3 次元(可用性・パフォーマンス・正確性)への定常性仮定付与と階層的診断による根本原因識別を解説。23 スライド。(slides / sre / reliability-modeling)
### 2026-06-30 Squish Level Objectives (SREcon20 Americas)
- [[@2020__SREcon20Americas__Squish Level Objectives]] — [[Dave Stanke]]([[Google]] Cloud Platform Developer Advocate)。SREcon20 Americas(2020、バーチャル)。「スクイッシュな人間」である顧客を中心に据えた SRE 実践。3 つの神話(顧客接点なし・プロダクトを作っていない・フィーチャーを作っていない)の反論、製品の認知的構築物定義、顧客理解の 3 手法(Talk/Be/Mess with them)、エラーバジェットの UX 実験活用、SLO Policy Rationale でユーザー行動データを根拠づける手法。41 スライド、YouTube 字幕あり。(slides / sre / slo / customer-centric)
### 2026-06-30 Latency and Availability Error Budgets Done Right at Scale (SREcon20 Americas)
- [[@2020__SREcon20Americas__Latency-and-Availability-Error-Budgets-Done-Right-at-Scale]] — [[Fred Moyer]]([[Zendesk]] SRE)。SREcon20 Americas(2020-12-08、バーチャル)。SLI/SLO/EB の機械解析可能な公式・レイテンシと可用性の OR 結合複合 SLI・1,000 名規模でのエラーバジェット民主化・マルチサービス構成での EB 伝播問題を解説。37 スライド。(slides / sre / slo / error-budget)
### 2026-06-30 Avoiding Goodhart's Law (SREcon20 Americas)
- [[@2020__SREcon20Americas__Avoiding Goodhart's Law]] — [[Marco Coulter]]([[AppDynamics]]、AIOps Technical Evangelist)。SREcon20 Americas(2020-12-07、バーチャル)。グッドハートの法則の SRE 文脈応用——SLO が「棍棒」になるとゲーミングが起きることを HL7 医療ラボシステム事例で示す。Code・Infrastructure・CX の 3 次元 SLI/SLO/SLA フレームワークと、パフォーマンスカーブ SLO(多段パーセンタイル閾値)、行動ベース CX SLI(再試行パターン)、反復的 SLO 交渉プロセスを提案。35 スライド。(slides / sre / slo / goodharts-law)
### 2026-06-29 SLOs for Data-Intensive Services (SREcon19 EMEA)
- [[@2019__SREcon19EMEA__SLOs for Data-Intensive Services]] — [[Yoann Fouquet]]([[Booking.com]] SRE)。SREcon19 EMEA(2019-10-02)。可用性・レイテンシ SLO に加えて、検索サービスのデータ一貫性(99.99%)・新鮮性(99.9%/xx秒)・完全性・耐久性という「データ品質 SLO」を定義したプロセスを紹介。プローブ・ゲートウェイ内部比較・クエリバケット(手動/自動)による実装と、SLO が可能にした自動緩和・自動修復を解説。29 スライド。(slides / sre / slo / data-quality)
### 2026-06-29 Extending the Error Budget Model to Security and Feature Freshness (SREcon19 Americas)
- [[@2019__SREcon19Americas__Extending the Error Budget Model to Security and Feature Freshness]] — [[Jim Thomson]]・[[David Laing]]([[Pivotal Software]] Cloud R&D)。SREcon19 Americas(2019-03-27、NYC)。エラーバジェットモデルを[[脆弱性バジェット]](SLI=パッチリリースからの経過日数・SLO=30 日)と[[フィーチャーフレッシュネス]](k8s 90 日アップグレード)に拡張。Equifax 侵害(CVE-2017-5638、67 日)への 30 日 SLO の有効性を論証。51 スライド。(slides / sre / security / error-budget)
### 2026-06-29 Latency SLOs Done Right (SREcon19 Americas)
- [[@2019__SREcon19 Americas__Latency SLOs Done Right]] — [[Fred Moyer]]([[Circonus]] Developer Evangelist)。SREcon19 Americas(2019-03-27、Brooklyn)。パーセンタイル平均化の誤り(p95(W1∪W2)≠(p95(W1)+p95(W2))/2、~200% 誤差)と、レイテンシ SLO の 3 手法(ログ・カウンタ・ヒストグラム)を解説。libcircllhist のマージ可能ログリニアヒストグラムを推奨。50 スライド。(slides / sre / slo / observability)
### 2026-06-29 SLOs and SLIs in the Real World: A Deep Dive (SREcon18 Europe/EMEA)
- [[@2018__SREcon18Europe__SLOs and SLIs in the Real World - A Deep Dive]] — [[Elisa Binette]]・[[Matthew Flaming]]([[New Relic]])。SREcon18 Europe/EMEA(2018-08-30)。Americas 版の再演。ケイパビリティ駆動 SLI/SLO 7 ステップレシピ・ハードシャード per-shard SLO・複合 SLO・インフラ SLO・UI SLI・dumb SLI・10 takeaway。29 スライド・音声収録あり。(slides / sre / slo)
### 2026-06-29 SLOs and SLIs in the Real World: A Deep Dive (SREcon18 Americas)
- [[@2018__SREcon18Americas__SLOs and SLIs in the Real World - A Deep Dive]] — [[Elisa Binette]]・[[Matthew Flaming]]([[New Relic]])。SREcon18 Americas(2018-03-28)。ケイパビリティ駆動の SLI/SLO 定義 7 ステップレシピ、ハードシャード per-shard SLO、複合 SLO、コアインフラ SLO 設計、全体 dumb SLI による サニティチェック、10 の takeaway。25 スライド。(slides / sre / slo)
### 2026-06-29 How Atlassian Is Tackling Error Budgets, Agile Style (SREcon18 Asia)
- [[@2018__SREcon18Asia__How Atlassian Is Tackling Error Budgets, Agile Style]] — [[Gui Vieiro]]([[Atlassian]] SRE Team Lead)。SREcon18 Asia(2018-06-06)、シンガポール。エラーバジェットの段階的(アジャイル)導入事例。「Error Budgets 0.1」として開発停止なしに開始、13週中7週未達をトリガーに設計、週次可視化・ブログ公開による組織的受容、SLO 達成率の回復(Jul-Sep 下降→Oct 以降 85-100%)。47 スライド。(slides / sre / error-budget / reliability)
### 2026-06-29 Error Budgets and Risks (SREcon15, 2015)
- [[@2015__SREcon15__Error Budgets and Risks]] — [[Marc Alvidrez]]([[Google]])。SREcon15(2015-03-16)、Santa Clara, CA。エラーバジェットフレームワークの初期体系的紹介。SLA はミニマムかつマクシマム、リクエスト成功率による可用性計算、1% クラスターによるリスク境界化、エラーバジェット = 可用性 − SLA ターゲット。transcript(Whisper)付き。26 スライド。(slides / sre / error-budget / reliability)
### 2026-06-29 How We Foster "Reliability" in Diversity (SRE NEXT 2022)
- [[@2022__SRE NEXT__How We Foster Reliability in Diversity]] — [[Narimichi Takamura]]([[Topotal]])。SRE NEXT 2022(2022-05-14)。組織の多様性に応じた SRE の育て方。5ステップ・氷山モデル(Level 1/2/3)・MVV 策定・ダイナミックケイパビリティ・組織の信頼性マインドセット。50 スライド。(slides / sre / organization)
### 2026-06-29 小さくはじめるSLI/SLO ~育てながら組織に定着させる実践知~ (Road to SRE NEXT 2026 @神戸)
- [[@2026__Road to SRE NEXT 2026 神戸__小さくはじめるSLI-SLO 育てながら組織に定着させる実践知]] — [[Narimichi Takamura]]([[Topotal]])。2026-06-15、Road to SRE NEXT 2026 @神戸。SLI/SLO 導入の 3 つの難点・SRE 4 ステップを援用した段階的フレームワーク・SLO 違反ポリシー 5 段階拡大・成熟度モデル(定義/運用/定着 各 5 段階)。48 スライド。(slides / sre / slo)
### 2026-06-29 Rethinking Incident Response: Context-Aware AI in Practice (SRE NEXT 2025)
- [[@2025__SRE NEXT 2025__Rethinking Incident Response - Context-Aware AI in Practice]] — [[Ryota Yoshikawa]]([[Topotal]])。SRE NEXT 2025(2025-08-19)。SAE 自動運転 L0〜L5 に対応する IR0〜IR5 フレームワークを提唱。MCP + Coding Agent により IR2〜IR3 が現実的になった現状を分析し、Waroom MCP を用いた IR2+ デモ(Sentry→調査→PR→クローズ)を示す。OpenRCA(11%) / AIOpsLab(RCA 14%)ベンチマークから RCA・緩和は研究段階と整理。(slides / sre / incident-response / aiops)
### 2026-06-29 組織的なインシデント対応を目指して / SRE NEXT 2024
- [[@2024__SRE NEXT 2024__組織的なインシデント対応を目指して]] — [[Narimichi Takamura]]([[Topotal]])。SRE NEXT 2024(2024-08-03)。[[インシデント対応成熟度モデル]](Pre-Incident/Response/Post-Incident の3フェーズ×9プロセス×Absent/Reactive/Proactive/Strategic の4段階)の提案。成熟度評価・フェーズマイグレーション手順を含む。(slides / sre / incident-management / maturity-model)
### 2026-06-29 On-demand Container Loading in AWS Lambda (USENIX ATC 2023)
- [[@2023__ATC__On-demand Container Loading in AWS Lambda]] — [[Marc Brooker]] ほか([[Amazon Web Services]])。USENIX ATC 2023 Best Paper Award。AWS Lambda のオンデマンドコンテナローディングシステム。決定論的フラット化 + 収束暗号化 + 3 階層キャッシュ(L1 ワーカーローカル/L2 AZ レベル/L3 S3)+ 4-of-5 イレイジャーコーディングで、毎秒 15,000 コンテナ起動と 99.8% 超のキャッシュヒット率を達成。(paper / serverless / distributed-systems / cloud)
### 2026-06-29 In Search of an Understandable Consensus Algorithm (USENIX ATC 2014)
- [[@2014__ATC__In Search of an Understandable Consensus Algorithm]] — [[Diego Ongaro]]・[[John Ousterhout]]([[Stanford University]])。USENIX ATC 2014 Best Paper Award。Raft 合意アルゴリズムの提案論文。multi-Paxos 等価・リーダー選出/ログ複製/安全性の分解設計・ランダム化タイムアウトによるスプリットボート解消・ジョイントコンセンサスによるメンバーシップ変更。43 名スタディで 33 名が Paxos より Raft クイズ高得点。(paper / distributed / consensus)
### 2026-06-28 CockroachDB: The Resilient Geo-Distributed SQL Database (SIGMOD 2020)
- [[@2020__SIGMOD__CockroachDB - The Resilient Geo-Distributed SQL Database]] — [[Rebecca Taft]] ほか([[Cockroach Labs]])。SIGMOD 2020。汎用ハードウェア上で直列化可能分離を実現する地理分散 SQL DBMS。MVCC + Read Refresh + Parallel Commits のトランザクションモデル・Raft 合意・3 種地理分散データ配置ポリシー。TPC-C 100,000 ウェアハウスで 98.8% 効率。(paper / database / distributed / sql / oltp)
### 2026-06-28 F1: A Distributed SQL Database That Scales (VLDB 2013)
- [[@2013__VLDB__F1 - A Distributed SQL Database That Scales]] — [[Jeff Shute]] ほか([[Google]])。VLDB 2013 / PVLDB Vol.6 No.11。Spanner 上の分散 OLTP/OLAP SQL DB。AdWords 基盤。100 TB 超・5 ナイン可用性・フル SQL。階層スキーマ・3 種トランザクション・非ブロッキングスキーマ変更・変更履歴・ハッシュ分散 SQL エンジン。(paper / database / distributed / sql)
### 2026-06-28 Amazon MemoryDB: A Fast and Durable Memory-First Cloud Database (SIGMOD 2024)
- [[@2024__SIGMOD__Amazon MemoryDB - A Fast and Durable Memory-First Cloud Database]] — [[Yacine Taleb]] ほか([[Amazon Web Services]])。2024 年 SIGMOD-Companion。Redis API 互換・11 9s 耐久性のインメモリクラウド DB。マルチ AZ トランザクションログへの耐久性分離・書き込み後ろロギング・オフボックススナップショット・ログベースリーダー選出を核心とする。(database / cloud / distributed-systems)
### 2026-06-28 Amazon Aurora: On Avoiding Distributed Consensus for I/Os, Commits, and Membership Changes (SIGMOD 2018)
- [[@2018__SIGMOD__Amazon Aurora - On Avoiding Distributed Consensus for I Os, Commits, and Membership Changes]] — [[Alexandre Verbitski]] ほか([[Amazon Web Services]])。2018-06、SIGMOD 2018 Industry Track。Aurora 2017 論文の続編。SCL/PGCL/VCL/VDL 一貫性ポイント階層・クォーラム読み込み回避(単一セグメント直接読み)・クォーラムセット + エポックによる非ブロッキックメンバーシップ変更・フル/テールセグメント非対称コスト削減(6× → 約 3×)の 4 貢献。(database / distributed / cloud)
### 2026-06-28 Amazon Aurora: Design Considerations for High Throughput Cloud-Native Relational Databases (SIGMOD 2017)
- [[@2017__SIGMOD__Amazon Aurora - Design Considerations for High Throughput Cloud-Native Relational Databases]] — [[Alexandre Verbitski]] ほか([[Amazon Web Services]])。2017-05、SIGMOD 2017。MySQL 互換クラウドネイティブ OLTP DB の設計。Redo ログのみをネットワーク越しに送る「ログがデータベース」設計・6 ウェイ AZ+1 クォーラム・10 秒以内クラッシュリカバリ・ミラード MySQL 比 35 倍スループットを実現。(database / distributed / cloud)
### 2026-06-28 Characterizing Cloud Computing Hardware Reliability (SoCC 2010)
- [[@2010__SoCC__Characterizing Cloud Computing Hardware Reliability]] — [[Kashi Venkatesh Vishwanath]]・[[Nachiappan Nagappan]]([[Microsoft Research]])。2010 年 SoCC。100,000 台超のサーバーを 14 か月観測した初の大規模データセンターハードウェア障害実証研究。AFR 約 8%、HDD が修理の 78%・初回障害の 70%、障害予測因子はデータセンター名とメーカー名、連続障害はインバース曲線(R²=0.974)に適合。(datacenter / reliability / hardware)
### 2026-06-28 Unlock High-Frequency Deployments without Blowing Up Prometheus (SREcon26 Americas)
- [[@2026__SREcon26Americas__Unlock High-Frequency Deployments without Blowing Up Prometheus]] — [[Ganesh Vernekar]]([[Reddit]] Staff SWE / Prometheus TSDB メンテナー)。2026-03-26、SREcon26 Americas。Kubernetes 高頻度デプロイによる Prometheus OOM 問題と、stale-series compaction(v3.10.0 実験機能)の設計・Reddit 本番実験・閾値選択ガイドを解説。失活系列比率 > 0.5 で検討、YouTube 字幕 transcript 付き。(slides/sre/prometheus/observability)
### 2026-06-28 Reliability Equilibrium: The Hidden Playbook behind SRE Influence (SREcon26 Americas)
- [[@2026__SREcon26Americas__Reliability Equilibrium - The Hidden Playbook behind SRE Influence]] — [[Daria Barteneva]]([[Microsoft Azure]] Observability Engineering, Principal SRE)。2026-03-26、SREcon26 Americas。ゲーム理論(囚人のジレンマ・Stag Hunt・公共財ゲーム・ベイジアンゲーム・進化的ゲーム)を SRE の社会技術的問題に適用する「Reliability Equilibrium」フレームワーク。メカニズムデザインとして SLO・エラーバジェット・カナリアデプロイを再定義。60 ページ、transcript なし。(slides/sre/game-theory/mechanism-design)
### 2026-06-28 Loop Engineering Working Note (Osmani / HuaShu)
- [[@2026__Working Note__Loop Engineering - The Anthropic Playbook for Designing Systems That Prompt Your Agents]] — [[Addy Osmani]] ほか(HuaShu 編)。2026-06。ループエンジニアリングの包括的 working note。4 層スタック・5 ムーブ(discovery/handoff/verification/persistence/scheduling)・6 パーツ・5 失敗パターン・ジェネレータ/エバリュエータ分離・4 コスト強化サイクルを体系化。Stripe Minions(週 1,300+ PR)実例収録。(paper / agents / software-engineering)
### 2026-06-28 Beyond Loss and Accuracy: Closing the Observability Gaps in AI Training with TrainCheck (SREcon26 Americas)
- [[@2026__SREcon26Americas__Beyond Loss and Accuracy - Closing the Observability Gaps in AI Training with TrainCheck]] — [[Yuxuan Jiang]]・[[Ryan Huang]]([[University of Michigan]] / [[OrderLab]])。2026-03-25、SREcon26 Americas。[[TrainCheck]](OSDI 2025)の SRE 向け実践発表。損失スカラー・GPU 使用率では検知できないサイレント障害に対し、訓練不変条件の自動推論・継続検証で 18/20 件を 1 イテレーション以内に検知、偽陽性率 2% 未満。BLOOM-176B・凍結エンコーダの詳細ケーススタディ収録。(slides/systems-ml/deep-learning/sre/traincheck)
### 2026-06-28 Executing Chaos Engineering in Production at a Critical Financial Institution (SREcon26 Americas)
- [[@2026__SREcon26Americas__Executing Chaos Engineering in Production at a Critical Financial Institution]] — [[Luiz Siqueira]]・[[Leonardo Marques]]([[Bradesco]])。2026-03-24、SREcon26 Americas。ブラジル最大級の民間銀行が本番環境でカオスエンジニアリングを段階的に導入。手動実験フェーズで Redis・Hikari・Circuit Breaker・DNS キャッシュ等の重大脆弱性を発見し、内製ツール [[EasyPerform]] による自動化・+300 人 GameDay へ発展。MTTD 73% 削減・MTTR 22% 改善。transcript なし。(slides/sre/chaos-engineering/financial)
### 2026-06-28 AI Agents for Incident Investigation (SREcon26 Americas)
- [[@2026__SREcon26Americas__AI Agents for Incident Investigation - The Good, The Bad, and The Ugly]] — [[Vladyslav Budichenko]]([[Vocaly AI]])。2026-03-24、SREcon26 Americas。AIエージェントによるインシデント調査の利点・欠点・危険を実務視点で整理。RCA精度11.34%実測・プロンプトインジェクション+540%・trust-for/verifyフレームワーク。(slides/sre/aiops/incident-response/agent)
### 2026-06-28 So You Want a New Incident Commander (SREcon26 Americas)
- [[@2026__SREcon26 Americas__So You Want a New Incident Commander]] — [[Vanessa Huerta Granda]]([[Enova]])。2026年、SREcon26 Americas。IC プログラム10年超の実践知。IC の3コアコンピテンシー(コミュニケーション・社会技術的リーダーシップ・認知負荷管理)と3チーム類型(Deliberate/Domain/Volunteer)を定義。構造より「IC の役割の明示」が普遍的要件。スライド PDF 25 ページ。(slides/sre/incident-management/incident-commander)
### 2026-06-28 1年間のポストモーテム運用とそこから生まれたツール sre-advisor (SRE NEXT 2022)
- [[@2022__SRENEXT2022__1年間のポストモーテム運用とそこから生まれたツール sre-advisor]] — [[藤原俊一郎]]([[面白法人カヤック]])。2022-05-14、SRE NEXT 2022。Embedded SRE 組織での横断統一ポストモーテム運用(2020年10月開始)と、振り返りから生まれた AWS リソース設定静的チェック CLI ツール sre-advisor を紹介。「インシデント → ポストモーテム → sre-advisor → 事前検出」循環ループ。YouTube 字幕トランスクリプト使用。(slides/sre/postmortem/incident-management)
### 2026-06-28 Learning from Incidents at Scale (SREcon25 Americas)
- [[@2025__SREcon25 Americas__Learning from Incidents at Scale - Actually Doing Cross-Incident Analysis]] — [[Vanessa Huerta Granda]]([[Enova]])。2025-03-26、SREcon25 Americas。個別インシデント学習から[[クロスインシデント分析]]へ。専任チーム・定量+定性アーティファクト・組織計画連動ケイデンスの3要素。MTTR 等の指標はコンテキストなしでは意味がない。部門横断招待が最重要変革。スライドPDF未取得(USENIX サインイン必須)、YouTube 字幕トランスクリプトに基づく。(slides/sre/incident-management/postmortem/cross-incident-analysis)
### 2026-06-28 The Case of the Misnamed Cities: CAST Analysis of a Google Maps Incident (SREcon26 Americas)
- [[@2026__SREcon26Americas__The Case of the Misnamed Cities - CAST Analysis of a Google Maps Incident]] — [[Ruben Barroso]]([[Google]])。2026-03-25、SREcon26 Americas。Google Maps 都市名誤表示インシデントを事例に RCA vs CAST を対比実演。時系列≠因果・イベント選択の主観性・制御構造による組織的因果要因の析出を論じる。(slides / sre / postmortem / safety-engineering / CAST)
### 2026-06-28 Human Observability of Incident Response (SREcon23 Americas)
- [[@2023__SREcon23Americas__Human Observability of Incident Response]] — [[Matt Davis]]([[FORM.com]])。2023-03-23、SREcon23 Americas、サンタクララ。インシデント対応を即興演奏(Joint Activity)として捉え、Response Trio(コンダクター・コミュニケーター・問題解決者)・Common Grounding・Practice of Practice Gamelan を提案。人間のオブザーバビリティを技術的オブザーバビリティから独立した観測問題として位置付ける。(slides / sre / incident-response / resilience-engineering / human-factors)
### 2026-06-28 Incident Archeology (SREcon23 Americas)
- [[@2023__SREcon23Americas__Incident Archeology - Finding Value in the Paperwork and Narratives of the past]] — [[Clint Byrum]]([[Spotify]])。2023-03-21、SREcon23 Americas、サンタクララ。過去のインシデント記録をアーティファクトとして仮説検証する「インシデント考古学」を提唱。Spotify の 2020〜2021 年データから、ポストモーテム完了率 55%→62%・業務時間中宣言 80%・変更起因 30%・時刻フィールド 75% デフォルト放置という副産物知見を報告。(slides / sre / postmortem / incident-management)
### 2026-06-28 The Repeat Incident Fallacy (SREcon22 EMEA)
- [[@2022__SREcon22EMEA__The Repeat Incident Fallacy - What Jurassic Park Can Teach Us about Incidents]] — [[Emily Ruppe]]([[Jeli|Jeli.io]])。2022-10-26、SREcon22 EMEA、アムステルダム。「同じインシデントは二度と起きない(Repeat Incident Fallacy)」——CI/CD による継続的変化が「再発防止誓約」を達成不可能にすることをジュラシックパーク映画で論じ、「Insights from the Past = Options in the Future」への目標転換を提唱。(slides / sre / postmortem / resilience-engineering / incident-management)
### 2026-06-28 A Post Incident Review Review (SREcon22 APAC)
- [[@2022__SREcon22APAC__A Post Incident Review Review]] — [[Tom Partington]]([[ANZx]])。2022-12-09、SREcon22 APAC。PIR の目的を「修復 > 学習」から「学習 > 修復」へ転換する。根本原因・アクションアイテム・MTTx を意図的に除外した ANZx の PIR² プロセス(7ステップ)を紹介。Safety II・Rasmussen モデル・Dekker's Tunnel・スイスチーズモデル・カウザルマップ・Blame-aware デブリーフィングを実践に接続。(slides / sre / postmortem / safety-engineering)
### 2026-06-28 Principled Identification of "Root Causes" Using Techniques from Safety Engineering (SREcon22 EMEA)
- [[@2022__SREcon22 EMEA__Principled Identification of Root Causes Using Techniques from Safety Engineering]] — Laura de Vesine(Datadog)。安全工学の System/Environment 境界モデルを SRE インシデント分析に適用し「根本原因 = システムの脆弱性」「トリガー = 環境条件」と再定義。5 Whys の失敗モードをトリガーホワイトアモールとして診断し、ニアミス調査の重要性を論じた。YouTube transcript 付き。(slides / sre / postmortem / safety-engineering)
### 2026-06-28 Ditch the Template: How to Write Incident Reports They Want To Read (SREcon22 EMEA)
- [[@2022__SREcon22 EMEA__Ditch the Template - How to Write Incident Reports They Want To Read]] — [[Laura Nolan]]([[Stanza Systems]]、元 Google・Slack SRE)、SREcon22 EMEA、2022-10-26、アムステルダム。「IR の価値は学習にあり、プロセスにあるのではない」。テンプレート形式を捨てナラティブ(謎→調査→解決)で書くことを提唱。読者サポート・視覚化・分析・文体の 4 軸。(slides / sre / postmortem / incident-management)
### 2026-06-27 Architecting a Technical Post Mortem (SREcon18 Americas)
- [[@2018__SREcon18 Americas__Architecting a Technical Post Mortem]] — Will Gallego(Etsy)。ポストモーテムを「学習文化の適用」として再定義。ブレーム・アウェア / 根本原因は誤った概念 / 反事実の回避 / ローカル合理性 / 修復的正義。33 枚スライド。(slides / sre / postmortem / SREcon18)
### 2026-06-27 Failures and Fixes: A Study of Software System Incident Response (arXiv 2020)
- [[@2020__arXiv__Failures and Fixes - A Study of Software System Incident Response]] — Jonathan Sillito・Esdras Kutomi(Brigham Young University)。30 インシデント(15 件インタビュー + 15 件公開ポストモーテム)の定性分析。障害の 4 原因カテゴリ・検知の 3 次元(自動化/特異性/適時性)・調査の日和見的/体系的戦略・緩和の 5 戦略・11 の主要観察を体系化。(paper / incident-response / qualitative / arXiv 2020)
### 2026-06-27 Do Not Blame Users for Misconfigurations (SOSP'13)
- [[@2013__SOSP__Do Not Blame Users for Misconfigurations]] — Tianyin Xu ほか(UCSD/Toronto/NetApp)。SPEX: ソースコードのデータフロー解析で設定制約を自動推論し、設定ミス脆弱性 743 件を検出。「設定ミスはユーザーの失敗ではなく開発者の設計問題」を主張。(paper / configuration / program-analysis / systems / SOSP'13)
### 2026-06-27 OTel-Arrow Phase 2 (opentelemetry.io blog 2026)
- [[@2026__OTelBlog__OTel-Arrow-Phase-2]] — OTel-Arrow SIG、2026。Apache Arrow のカラム型フォーマットをパイプライン全体の内部表現として採用する Phase 2 構想。OTAP が単一コアで OTLP 比 20× スループット(2.47M vs 121K logs/sec)。DFE は Rust 実装、incubation-stage。(article / observability / opentelemetry)
### 2026-06-27 マイクロサービス RCA/FL 10 論文一括 ingest
- [[@2024__arXiv__Cloud Atlas - Efficient Fault Localization for Cloud Systems using Language Models and Causal Insight]] — Zhiqiang Xie ほか(Stanford/CMU/Microsoft Research)。LLM でシステム文書から因果グラフを自動合成し障害箇所特定。手動構築グラフと同等精度。(paper / fault-localization / llm / causal)
- [[@2024__FSE__Chain-of-Event - Interpretable Root Cause Analysis for Microservices through Automatically Learning Weighted Event Causal Graph]] — Zhenhe Yao ほか(清華/CAS/eBay)。マルチモーダル観測データをイベントに変換し重み付きイベント因果グラフで解釈可能な RCA。(paper / rca / microservice / interpretable)
- [[@2024__KDD__Microservice Root Cause Analysis with Limited Observability]] — 限定観測可能性下の潜在空間介入認識による RCA。(paper / rca / causal)(既存更新)
- [[@2024__TOSEM__HeMiRCA - Fine-Grained Root Cause Analysis for Microservices with Heterogeneous Data Sources]] — Zhouruixing Zhu ほか(CUHK-Shenzhen/CUHK)。トレース+メトリクスの異種データ間単調相関で階層的 RCA。top-1 82.7%。(paper / rca / heterogeneous)
- [[@2026__Elsevier__MicroIRC - Instance-level Root Cause Localization for Microservice Systems]] — Yuhan Zhu ほか(武漢大学/CSIRO)。インスタンスレベル GNN ベース RCA。二重グラフ構造。(paper / rca / gnn / instance-level)
- [[@2025__NeurIPS__Root Cause Analysis of Outliers with Missing Structural Knowledge]] — Orchard ほか(Cambridge/MPI/Amazon)。因果グラフ未知の単一サンプル RCA の理論的保証。(paper / causal / theory)
- [[@2026__TVCG__RCInvestigator - Towards Better Investigation of Anomaly Root Causes in Cloud Computing Systems]] — Shuhan Liu ほか(Zhejiang/Microsoft)。人間-機械協調型 RCA 可視分析。(paper / visualization / rca)
- [[@2024__FSE__Illuminating the Gray Zone - Non-Intrusive Gray Failure Localization in Server Operating Systems]] — Shenglin Zhang ほか(南開/清華/Huawei)。グレー障害の非侵入的箇所特定。AC@5 90%。(paper / gray-failure / fault-localization)
- [[@2024__FSE__SynthoDiag - Fault Diagnosis for Test Alarms in Microservices through Multi-source Data]] — Shenglin Zhang ほか(南開/Huawei Cloud/清華)。テストアラーム多ソース障害診断。(paper / testing / diagnosis)
- [[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]] — Lei Tao ほか(南開/清華/Tencent)。異種グラフで性能障害診断。(paper / microservice / performance / heterogeneous-graph)
### 2026-06-27 PreServe ICSE 2026 ingest
- [[@2026__ICSE__PreServe - Intelligent Management for LMaaS Systems via Hierarchical Prediction]] — Zhihan Jiang ほか(CUHK)。mLSTM ワークロード予測 + DistilBERT 応答長予測の二層構造で LMaaS オートスケーリングとルーティングを最適化。(paper / llm / serving / aiops)
### 2026-06-27 障害箇所特定・根本原因分析 11 論文一括 ingest
- [[@2025__nkcs.iops.ai__Accurate and Interpretable Log-Based Fault Diagnosis using Large Language Models]] — LogInsight。LLM ファインチューニング + FOLS ログ圧縮による障害診断と説明文生成。(paper / aiops / log / llm)
- [[@2025__arXiv__BSODiag - A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems]] — 時空間グラフ RCA + 障害伝播パス推論によるクラウドインフラ障害診断。(paper / cloud-infra / rca)
- [[@2025__arXiv__COCA - Generative Root Cause Analysis for Distributed Systems with Code Knowledge]] — ソースコードを第四の診断信号源として活用する生成的 RCA。(paper / rca / llm / code)
- [[@2025__arXiv__RADICE - Causal Graph Based Root Cause Analysis for System Performance Diagnostic]] — PCMCI+ + 部分ドメイン知識で因果サブグラフを出力する RCA。(paper / causal / rca)
- [[@2025__AAAI Workshop AICT__Causal Discovery for Cloud Microservice Architectures]] — PCMCI+ によるマイクロサービスのレイテンシグラフ因果発見。(paper / causal / microservice)
- [[@2022__ESEC FSE__Actionable and Interpretable Fault Localization for Recurring Failures in Online Service Systems]] — DéjàVu。障害ユニット粒度の再帰障害向け箇所特定。(paper / fault-localization)
- [[@2025__TOSEM__Making Fault Localization in Online Service Systems More Actionable and Interpretable]] — FL-AIer。多層 GAT + 不均衡対処で DéjàVu を拡張。(paper / fault-localization)
- [[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]] — UniDiag。TKG で 3 モダリティの異種性を解消。(paper / microservice / knowledge-graph)
- [[@2024__ASE__SLIM - A scalable and interpretable light-weight fault localization algorithm for imbalanced data in microservice]] — DNF ルールセットで二重不均衡の障害箇所特定。(paper / fault-localization)
- [[@2024__ASE__The Potential of One-Shot Failure Root Cause Analysis - Collaboration of the Large Language Model and Small Classifier]] — LasRCA。LLM をラベラーに限定し小型分類器と協調するワンショット RCA。(paper / rca / llm)
- [[@2024__arXiv__FaaSRCA - Full Lifecycle Root Cause Analysis for Serverless Applications]] — サーバーレス関数のライフサイクル段階単位 RCA。(paper / serverless / rca)
### 2026-06-27 RCA・障害箇所特定・集合通信診断 9 論文一括 ingest
- [[@2026__TOSEM__LLMRCA - Multilevel Root Cause Analysis for LLM Applications Using Multimodal Observability Data]] — [[Gou Tan]] ほか。LLM アプリケーション特化の多段 RCA。マルチモーダルオブザーバビリティデータ(トレース・ログ・メトリクス)を統合。(paper / aiops / rca / llm)
- [[@2026__FSE__MetaRCA - A Generalizable Root Cause Analysis Framework for Cloud-Native Systems Powered by Meta Causal Knowledge]] — メタ因果知識による未知システムへの汎化可能な RCA フレームワーク。(paper / aiops / rca / causal)
- [[@2026__PPoPP__CCL-D - A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training]] — 大規模モデル訓練における集合通信の遅延・ハング異常の高精度診断。(paper / hpc / collective-communication / diagnosis)
- [[@2025__arXiv__KPIRoot+ - An Efficient Integrated Framework for Anomaly Detection and Root Cause Analysis in Large-Scale Cloud Systems]] — 異常検知と RCA を統合したエンドツーエンドフレームワーク。(paper / aiops / rca / anomaly-detection)
- [[@2025__SIGCOMM__Towards LLM-Based Failure Localization in Production-Scale Networks]] — [[BiAn]] / [[Guyue Liu]] ほか。本番規模ネットワークにおける LLM ベース障害箇所特定。(paper / networking / fault-localization / llm)
- [[@2025__ICLR__Robust Root Cause Diagnosis using In-Distribution Interventions]] — [[TWIST]]。分布内介入による因果推論ベース RCA のロバスト性向上。(paper / causal / rca / interventional)
- [[@2026__ACM TOSEM__ThinkFL - Self-Refining Failure Localization for Microservice Systems via Reinforcement Fine-Tuning]] — 強化微調整による自己改善型障害箇所特定。(paper / aiops / fault-localization / llm)
- [[@2025__arXiv__eARCO - Efficient Automated Root Cause Analysis with Prompt Optimization]] — [[eARCO]]。プロンプト最適化による効率的な自動 RCA。(paper / aiops / rca / llm)
- [[@2025__arXiv__GALA - Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis]] — [[GALA]]。グラフ拡張 LLM エージェントワークフローによる RCA。(paper / aiops / rca / llm / agent)
### 2026-06-27 データベースノブチューニング・自律 DB 3 論文 ingest
- [[@2024__VLDB__GPTuner - A Manual-Reading Database Tuning System via GPT-Guided Bayesian Optimization]] — [[Jiale Lao]]・[[Mingjie Tang]](Sichuan University)/ [[Jianguo Wang]]([[Purdue University]])ほか。LLM でマニュアル・フォーラムを読み構造化知識を構築、Coarse-to-Fine ベイズ最適化で既存手法比 16 倍速く良い設定を発見。最善手法比最大 30% の性能改善。(paper / database / llm / aiops)
- [[@2021__VLDB__openGauss - An Autonomous Database System]] — [[Guoliang Li]]・[[Xuanhe Zhou]]([[Tsinghua University]])ほか。学習ベースの最適化技術を実オープンソース DB に統合した初の包括的自律データベースフレームワーク。学習型オプティマイザ(MCTS クエリ書き換え・Tree-LSTM コスト推定・DRL プラン生成)と学習型アドバイザ(自己監視・自己診断・自己設定・自己最適化)を構成。(paper / database / autonomous-database / aiops)
- [[@2017__SIGMOD__Automatic Database Management System Tuning Through Large-scale Machine Learning]] — [[Dana Van Aken]]・[[Andrew Pavlo]]([[Carnegie Mellon University]])ほか。OtterTune の原論文。教師あり・教師なし ML を組み合わせた 3 段階パイプラインで DBMS ノブ設定を自動最適化。デフォルト比 58〜94% のレイテンシ低減。(paper / database / machine-learning / aiops)
### 2026-06-27 データベース異常診断・RCA 8 論文一括 ingest
- [[@2025__ICDE__Anomaly Diagnosis with Siamese Discrepancy Networks in Distributed Cloud Databases]] — [[Lingsen Yan]]・[[Bolong Zheng]]([[Huazhong University of Science and Technology]])/ [[Xiaofang Zhou]](HKUST)/ Huawei ほか。分散クラウド DB の異常診断をシャムネットワークによる正常-異常乖離パターンで分類。少数ショット対応。(paper / aiops / database / anomaly-diagnosis)
- [[@2025__AIDB__AutoDebugger - Efficient Root Cause Analysis for Anomaly Jobs]] — Fathelrahman Ali(Google)/ Yiwen Zhu ほか(Microsoft)。Microsoft Fabric 環境の Spark ジョブ異常に対しホワイトボックス予測モデル+ML で根本原因分析を 10 倍以上高速化。(paper / aiops / spark / rca)
- [[@2025__VLDB__RCRank - Multimodal Ranking of Root Causes of Slow Queries in Cloud Database Systems]] — [[Biao Ouyang]]・Yingying Zhang(Alibaba Cloud)/ [[Yang Shu]]・[[Chenjuan Guo]](ECNU)/ [[Christian S. Jensen]](Aalborg)ほか。スロークエリの根本原因をクエリ文・実行計画・ログ・KPI の 4 モダリティでランキング。(paper / database / rca / multimodal)
- [[@2023__Amazon Science__Vista - Machine Learning based Database Performance Troubleshooting Framework in Amazon RDS]] — [[Vikramank Singh]]・Zhao Song・[[Tim Kraska]](AWS / MIT)ほか。Amazon RDS の DB 性能トラブルシューティング 3 段パイプライン(検知→RCA→解決)。深層自己回帰モデルで非定常・準周期ワークロード対応。(paper / database / aiops / amazon)
- [[@2023__FSE__Adapting Performance Analytic Techniques in a Real-World Database-Centric System]] — [[Lizhi Liao]]・[[Heng Li]]・[[Weiyi Shang]](Waterloo / Polytechnique Montréal)/ ERA Environmental ほか。データベース中心アーキテクチャの性能分析技法適応に関する産業経験報告。(paper / database / performance / industrial-experience)
- [[@2023__PACMMOD__BALANCE - Bayesian Linear Attribution for Root Cause Localization]] — [[Chaoyu Chen]]・Hang Yu・[[Jianguo Li]]([[Ant Group]])/ Wenhui Shi([[OceanBase]])ほか。XAI の帰属フレームワークを RCA に適用。BMFS + 帰属分析 + KPI 間マージの 3 コンポーネント。(paper / rca / xai / database)
- [[@2019__VLDB__GRANO - Interactive Graph-based Root Cause Analysis for Cloud-Native Distributed Data Platform]] — [[Hanzhang Wang]]・Phuong Nguyen ほか([[eBay]])。eBay NuData プラットフォーム向けグラフベース RCA システム。Detection Layer / Anomaly Graph Layer / Application Layer の 3 層。(paper / rca / graph / cloud-native)
- [[@2019__SIGMOD__ExplainIt! - A Declarative Root-cause Analysis Engine for Time Series Data]] — [[Vimalkumar Jeyakumar]]・[[Navindra Yadav]]([[Cisco Tetration Analytics]])ほか。SQL ライクな宣言的言語で因果仮説を列挙・ランキングする教師なし RCA エンジン。(paper / rca / causal / declarative)
### 2026-06-27 データベースノブチューニングサーベイ 2 本 ingest
- [[@2023__TKDE__Automatic Database Knob Tuning - A Survey]] — [[Xinyang Zhao]]・[[Xuanhe Zhou]]・[[Guoliang Li]]([[Tsinghua University]])。ノブチューニングのパイプラインを4段階(ノブ選択・特徴量選択・チューニング手法・転移技術)に分解し、ヒューリスティック・BO・DL・RL の4クラス16手法を体系的に比較した初の包括的サーベイ。(paper / database / aiops / survey)
- [[@2024__arXiv__Automatic Configuration Tuning on Cloud Database - A Survey]] — [[Limeng Zhang]]・[[M. Ali Babar]]([[University of Adelaide]])。クラウド DBMS の自動設定チューニングサーベイ。安全性・適応性をフレームワークに明示的に組み込み、「経験からの知識」を独立段階として定式化。(paper / database / aiops / cloud / survey)
### 2026-06-27 DB-BERT SIGMOD 2022 論文 ingest
- [[@2022__SIGMOD__DB-BERT - a Database Tuning Tool that Reads the Manual]] — [[Immanuel Trummer]](Cornell University)。BERT × Double DQN で DBMS マニュアルを「読んで」ノブをチューニングする NLP 強化型データベースチューニング。全実験(TPC-H/TPC-C × Postgres/MySQL)でベースラインを凌駕。(paper / database / nlp / aiops)
### 2026-06-26 SRE NEXT 2023「エンジニアのためのSRE論文への招待」スライド ingest
- [[@2023__SRE NEXT 2023__エンジニアのためのSRE論文への招待]] — [[Yuuki Tsubouchi]]による SRE NEXT 2023 IN TOKYO 発表。未普及技術論文をエンジニアの実装・適用のアイデア源として位置づけ、SRE 論文を国際会議・検索・引用ネットワークから能動的に探し、探索時の速読と適用時の精読を分ける実践を紹介。(slides / sre / research / paper-reading)
### 2026-06-26 データセンター信頼性・クラウド障害論文 9 本 ingest
- [[@2017__DSN__What Can We Learn from Four Years of Data Center Hardware Failures]] — 29 万件超のハードウェア障害操作チケットから相関障害と修理保留の影響を分析。(paper / datacenter / reliability)
- [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]] — 597 件の停止から復旧連鎖の不完全さを整理。(paper / cloud / reliability)
- [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]] — Facebook のデータセンター内外ネットワークを長期分析。(paper / networking / reliability)
- [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]] — Azure 本番インシデントのバグを分析。(paper / cloud / software-reliability)
- [[@2011__SOSP__An Empirical Study on Configuration Errors in Commercial and Open Source Systems]] — 546 件の設定誤りを分析。(paper / configuration)
- [[@2020__NSDI__Understanding, Detecting and Localizing Partial Failures in Large System Software]] — OmegaGen による部分障害の検知・箇所特定。(paper / distributed)
- [[@2013__ACM TOS__Datacenter Scale Evaluation of the Impact of Temperature on Hard Disk Drive Failures]] — HDD 温度・利用率・障害の関係を分析。(paper / datacenter)
- [[@2024__ISSTA__An Empirical Study on Kubernetes Operator Bugs]] — 210 件の Kubernetes Operator バグを分析。(paper / kubernetes)
- [[@2016__ASPLOS__TaxDC - A Taxonomy of Non-Deterministic Concurrency Bugs in Datacenter Distributed Systems]] — 104 件の分散並行バグの分類体系。(paper / distributed / concurrency)
### 2026-06-26 SRE NEXT 2022 AIOps研究録 スライド ingest
- [[@2022__SRE NEXT 2022__AIOps研究録―SREのためのシステム障害の自動原因診断]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]])による SRE NEXT 2022 ONLINE 発表。SLO ベースの症状アラートと原因診断を分離し、全メトリクスからの因果グラフ生成に向けて異常検知・形状クラスタリングを前処理として段階化。PC アルゴリズムの条件付き独立性検定が原因から症状への経路を切りうる課題と、AI を運用する自動化の皮肉を示す。(slides / aiops / sre / rca / time-series)
### 2026-06-26 ソフトウェア信頼性工学 2 論文 ingest
- [[@2007__FOSE__Software Reliability Engineering - A Roadmap]](新規) — [[Michael R. Lyu]]([[The Chinese University of Hong Kong]])。SRE の 35 年史と将来ロードマップ。障害ライフサイクル 4 技法・SRE プロセス 4 構成要素を体系化し、アーキテクチャ・テスト・メトリクス・新興アプリケーションの 5 軸で将来方向を提示。(paper / software-reliability)
- [[@2019__arXiv__The First 50 Years of Software Reliability Engineering - A History of SRE with First Person Accounts]](新規) — [[James J. Cusick]]。1968 年 NATO 会議から 2018 年までの SRE 50 年通史。Schneidewind・Musa への未発表インタビュー収録。Hudson (1967)→Jelinski-Moranda (1971)→Musa (1975)→体系化→アジャイル/モバイルへの展開。(paper / software-reliability / history-of-science)
### 2026-06-26 SREcon23 EMEA スライド ingest(From Sysadmins to Flying Unicorns)
- [[@2023__SREcon23 EMEA__From Sysadmins to (almost) Flying Unicorns]](新規) — [[Guillaume Hérail]] と [[Gilberto Müller]]([[Sony Interactive Entertainment]])。シスアドチームから SRE チームへの文化的転換。TOS・SRE Academy・CFT・SLO・Reliability Meetup の 5 施策で 5 課題を解消したケーススタディ。(slides / sre / culture)
### 2026-06-26 データベース/分散システム異常診断 6 論文一括 ingest
- [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]](新規) — Minghua Ma ほか(Tsinghua University・Alibaba Group・Nankai University)。クラウドデータベースの間欠的遅延クエリ(iSQ)の根本原因診断フレームワーク iSQUAD。異常抽出・依存性クレンジング・TOPIC クラスタリング・ベイズ事例モデルの 4 コンポーネントで F1 80.4% を達成。(paper / aiops / database)
- [[@2024__arXiv__OS Pre-trained Transformer - Predicting Query Latencies across Changing System Contexts]](新規) — Parimarjan Negi ほか(MIT CSAIL)。OS メトリクスの時系列をトランスフォーマーで事前学習し、システムコンテキスト変化に対応するクエリレイテンシ予測。因子分解アーキテクチャで新システムへの汎化を実現。(paper / database / ml)
- [[@2024__KDD__Multivariate Log-based Anomaly Detection for Distributed Database]](新規) — Lingzhe Zhang ほか(Peking University)。分散データベース向け初のマルチノードログ異常検知データセットと MultiLog 手法。単一ノードログでは不十分であることを実証し、既存手法を約 12% 上回る。(paper / aiops / database)
- [[@2023__PACMMOD__DBPA - A Benchmark for Transactional Database Performance Anomalies]](新規) — Shiyue Huang ほか(Peking University・ZTE Corporation)。OLTP 性能異常 9 種の決定論的再現手順を体系化したベンチマーク。複合異常生成アルゴリズムと大規模データセットを提供。(paper / database / benchmark)
- [[@2025__arXiv__LogDB - Multivariate Log-based Failure Diagnosis for Distributed Databases]](新規) — Lingzhe Zhang ほか(Peking University)。MultiLog の拡張版。ノード単位のログ特徴抽出・圧縮とマスターノード集約による分散データベース障害診断。Apache IoTDB で評価。(paper / aiops / database)
- [[@2025__IEEE TSC__Towards Close-To-Zero Runtime Collection Overhead - Raft-Based Anomaly Diagnosis on System Faults for Distributed Storage System]](新規) — Lingzhe Zhang ほか(Peking University)。Raft ログを活用したゼロオーバーヘッド異常診断手法 RBAD。モニタリングベース手法を 15.38%、ログベース手法を 53.10% 上回る。(paper / aiops / distributed-storage)
### 2026-06-26 arXiv:2508.08906 Ultra Ethernet 論文 ingest
- [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]](新規) — Torsten Hoefler ほか 15 名(ETH Zürich・Broadcom・HPE・OpenAI・Intel・AMD・Cisco・Microsoft)。UE 1.0 の設計解説論文。EV ベースパケットスプレー・PDC ゼロ RTT 確立・NSCC+RCCC 輻輳制御・TSS ゼロトラストセキュリティ・LLR/CBFC リンク層機能を詳述。(paper / networking / hpc / ai-infrastructure)
### 2026-06-26 SONiC Workshop Japan 2026 スライド ingest
- [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]](新規) — [[海老澤健太郎]]([[Arrcus]])による SONiC Scale-Up WG の技術解説スライド。Scale-Up/Out/Across の 3 層分類、RoCEv2 対次世代トランスポート比較表、LLR・CBFC・LLDP の SONiC 実装方法。(slides / networking / gpu-cluster)
### 2026-06-26 SOSP 2024 ReCycle 論文 ingest
- [[@2024__SOSP__ReCycle - Resilient Training of Large DNNs using Pipeline Adaptation]] — [[Swapnil Gandhi]] ほか([[Stanford University]])。ハイブリッド並列訓練のデータ並列冗長性とパイプラインバブルを利用し、スペアサーバなしで障害時も訓練を継続。分割逆伝播とストラグラーオプティマイザで Oobleck 対比最大 1.46×、Bamboo 対比最大 1.64× のスループット向上。(paper / distributed / fault-tolerant-training)
### 2026-06-26 SIGCOMM 2024 Alibaba HPN 論文 ingest
- [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]] — [[Kun Qian]] ほか([[Alibaba Cloud]])。LLM 訓練専用データセンターネットワーク HPN。2 層デュアルプレーン + 非スタック型デュアル ToR + レール最適化で 1 Pod 内 15K GPU を収容。8 ヶ月本番運用で DCN+ 比 14.9% 訓練スループット向上、ToR 単一障害点ゼロ。(paper / networking / distributed / llm-training)
---
### 2026-06-26 SC24 GPU-to-GPU Communication 論文 ingest
- [[@2024__SC__Exploring GPU-to-GPU Communication - Insights into Supercomputer Interconnects]] — [[Daniele De Sensi]] ほか([[Sapienza University of Rome]] / [[ETH Zürich]] / [[CINECA]] / [[NVIDIA]] ほか)。Alps・Leonardo・LUMI 3台のスーパーコンピュータで GPU 間インターコネクトを最大4,096 GPU 規模で実計測比較した初の包括的研究。デフォルト設定から手動チューニングで最大1桁の性能向上。ノード間点対点では MPI が*CCL 比最大10倍高速、ネットワークノイズが allreduce を最大50%低下させる。(paper / hpc / networking / benchmark)
---
### 2026-06-26 arXiv 2401.00134 Unicron 論文 ingest
- [[@2024__arXiv__Unicron - Economizing Self-Healing LLM Training at Scale]] — [[Tao He (Alibaba)]] ほか([[Alibaba Group]])。LLM 訓練の障害回復コストをクラスタ全体で最小化する自己修復ワークロードマネージャ Unicron。インバンド誤り検知(3× D_iter)・WAF 最大化動的計画法・部分結果再利用遷移戦略の三機構。128 GPU で Megatron 比 1.9×(高頻度障害)の累積 WAF 改善。(paper / distributed / machine-learning / fault-tolerance)
---
### 2026-06-26 HotNets 2024 I've Got 99 Problems But FLOPS Ain't One 論文 ingest
- [[@2024__HotNets__I've Got 99 Problems But FLOPS Ain't One]] — [[Costin Raiciu]] ら([[University Politehnica of Bucharest]] / [[Broadcom]])。1000 億ドル規模 AI データセンター建設計画を起点に、百万 GPU・103.8T パラメータ LLM 訓練のネットワーキング課題を体系化。スケールアップ 14.4 Tbps が露出ネットワーキングを 5%/20% に抑える鍵。RoCEv2 シングルパスは FCT 9 ms(最適の 9 倍)、マルチパストランスポートで 5% 以内に。マルチプレーン・マルチレールでスイッチコスト 50%・リンクコスト 66% 削減。(paper / networking / distributed / llm-training)
---
### 2026-06-26 ICPADS 2024 Generic and ML Workloads in an HPC Datacenter 論文 ingest
- [[@2024__ICPADS__Generic and ML Workloads in an HPC Datacenter]] — [[Xiaoyu Chu]], [[Daniel Hofstätter]] ほか([[Vrije Universiteit Amsterdam]] / [[TU Wien]] / [[SURF]] / [[NREL]])。SURF Lisa(338 ノード)の 9400 万タプル・100 指標の長期運用データで汎用/ML ジョブを統計比較。ML ジョブはノード 15%・件数 9% に対してエネルギー 39% を消費し、GPU 温度制限に頻繁に達する。クラスタエネルギーの 50% が未完了ジョブに費やされる。ジョブ-ノード結合解析によりジョブ終了状態相関(NODE_FAIL: 0.94/0.75)を初報告。データセット・ツールキットをオープンソース公開。(paper / hpc / workload-characterization / energy / gpu)
---
### 2026-06-26 ICSE 2023 Quality Issues of DL Platform 論文 ingest
- [[@2023__ICSE__An Empirical Study on Quality Issues of Deep Learning Platform]] — [[Yanjie Gao]] ほか([[Microsoft Research]] 北京・[[Chongqing University]])。Microsoft 社内 DL プラットフォーム Platform-X の品質問題 360 件を手動分析。症状 7 カテゴリ・根本原因 22 カテゴリ(ハードウェア 28.33% / プラットフォーム側 28.33% / ユーザー側 43.34%)・緩和アクション 10 カテゴリを体系化。(paper / aiops / software-reliability / deep-learning)
---
### 2026-06-26 SRE NEXT 2024 工学としてのSRE再訪 スライド ingest
- [[@2024__SRE NEXT 2024__工学としてのSRE再訪]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]]・[[Topotal]])による SRE NEXT 2024(東京, 2024-08-03)発表。SRE を「工学」として再訪し、技芸→工学の歴史的背景、未解決オープンチャレンジ(アラート問題・トレースデータ・TTR・SLO ベース意思決定・LLM によるインシデント対応・SLO→アーキテクチャ導出)、SREcon 経由の学術分野接続(レジリエンス工学・認知科学・社会学・人類学)を三軸で展開。Human-Computer Engineering としての発展可能性を示唆。(slides / sre / engineering)
### 2026-06-26 Demystifying NCCL (arXiv 2507.04786) 論文 ingest
- [[@2025__IEEE__Demystifying NCCL - An In-depth Analysis of GPU Communication Protocols and Algorithms]] — [[Zhiyi Hu]], [[Siyuan Shen]] ほか([[ETH Zürich]] SPCL・[[NVIDIA]]・Broadcom)。NCCL 2.19.1 の内部設計を体系的に解析。Simple/LL/LL128 プロトコル・ノード内外データ転送・Ring/Tree アルゴリズムの設計原理と実測を文書化。ATLAHS シミュレーションの基盤。(paper / hpc / nccl / distributed)
### 2026-06-26 OSDI 2025 TrainCheck 論文 ingest
- [[@2025__OSDI__Training with Confidence - Catching Silent Errors in Deep Learning Training with Automated Proactive Checks]] — [[Yuxuan Jiang]] ほか([[University of Michigan]] [[OrderLab]])。DL 訓練のサイレントエラーを訓練不変条件の自動推論・継続検証で検知するフレームワーク TrainCheck。20 件中 18 件を 1 イテレーション以内に検知、6 件の新規バグを発見。(paper / systems-ml / software-reliability)
### 2026-06-24 ClickHouse PVLDB 2024 論文 ingest
- [[@2024__PVLDB__ClickHouse - Lightning Fast Analytics for Everyone]] — [[Robert Schulze]] ほか([[ClickHouse Inc|ClickHouse Inc.]])。カラム型 OLAP DB ClickHouse のシステム論文。MergeTree* ストレージ・3 機構データプルーニング・ベクトル化実行+LLVM コンパイル・ClickBench 最速を解説。(paper / database / olap)
### 2026-06-24 SREcon スライド 7 件一括取り込み (anomaly detection / monitoring)
- [[@2019__SREcon19 Asia__Anomaly Detection on Golden Signals]] — [[Yu Chen (Baidu)]]([[Baidu]])による SREcon19 Asia 発表。ゴールデンシグナル上の異常検知を STL 分解・クラスタリング・曜日別正規化で構築。(slides / sre / anomaly-detection)
- [[@2015__SREcon15 Europe__Signatures, Patterns, and Trends - Timeseries Data Mining at Etsy]] — [[Andrew Clegg]]([[Etsy]])による SREcon15 Europe 発表。時系列マイニングで SAX・DTW・類似度検索を Kale/Skyline パイプラインに統合。(slides / sre / time-series)
- [[@2024__SREcon24 EMEA__Anomaly Detection in Time Series from Scratch Using Statistical Analysis]] — [[Ivan Shubin]]([[Booking.com]])による SREcon24 EMEA 発表。Z スコア・MAD・Graphite ネイティブ関数で AI/ML なしの異常検知サービス Granomaly を構築。(slides / sre / anomaly-detection)
- [[@2025__SREcon25 Americas__Using Statistical Techniques to Automatically Detect Game-Breaking Issues]] — [[Ian Neidel]]([[Netflix]])による SREcon25 Americas 発表。ゲーム QoE メトリクスの変化点検知に統計手法を適用。(slides / sre / changepoint-detection)
- [[@2025__SREcon25 Americas__Stopping Performance Regression via Changepoint Detection]] — [[Joseph Cirella]]・[[Shanthini Velan]]([[Bloomberg]])による SREcon25 Americas 発表。PELT アルゴリズムで性能レグレッションを CI/CD パイプラインで自動検知。(slides / sre / changepoint-detection)
- [[@2017__SREcon17 Asia__Smart Monitoring System for Anomaly Detection on Business Trends in Alibaba]] — [[Zhaogang Wang]]([[Alibaba Group]])による SREcon17 Asia 発表。STL 分解・N-σ 適応閾値・ヒューマンフィードバックでビジネストレンド異常検知を構築。(slides / sre / anomaly-detection)
- [[@2015__SREcon15__Smart Monitor System For Automatic Anomaly Detection at Baidu]] — [[Xianping Qu]]([[Baidu]])による SREcon15 発表。BNS/BMS/DMP/Transfer 4 モジュールの監視プラットフォームで自動異常検知を構築。(slides / sre / anomaly-detection)
### 2026-06-23 SREcon18 Americas Automatic Metric Screening
- [[@2018__SREcon18 Americas__Automatic Metric Screening for Service Diagnosis]] — [[Yu Chen (Baidu)]]([[Baidu]])による SREcon18 Americas 発表。障害前 60 分と障害後 5 分のメトリクスを KDE で比較し、インスタンス単位クラスタリングとダイジェストランキングで、ゴールデンメトリクスなしに診断候補を推薦する。(slides / sre / aiops / rca)
### 2026-06-23 SREcon17 Americas Practical Monitoring and Alerting
- [[@2017__SREcon17 Americas__A Practical Guide to Monitoring and Alerting with Time Series at Scale]] — [[Jamie Wilkinson]]([[Google]] SRE)による SREcon17 Americas 発表。監視保守コストを劣線形に抑える必要性、静的しきい値から時間・分布・SLO に基づくアラート設計への移行、[[Prometheus]] のラベル付き時系列・記録ルール・トポロジ集約を整理。(slides / sre / monitoring / prometheus)
### 2026-06-29 SREcon16 Service Levels and Error Budgets
- [[@2016__SREcon16__Service Levels and Error Budgets]] — [[Chris Jones]]・[[Niall Murphy]]([[Google]])による SREcon16 発表(2016 年 4 月)。SRE Book 第 4 章の共著者が SLI/SLO/SLA の区別とエラーバジェットの制御ループ的運用を口頭解説。「SRE の仕事は可用性最大化ではなくプロダクトベロシティ最大化」「SRE は No から Yes/if へ」の組織的帰結を直接語った。(video / sre / slo / error-budget)
### 2026-06-23 SREcon16 Europe Alerting for Distributed Systems
- [[@2016__SREcon16 Europe__Alerting for Distributed Systems - A Tale of Symptoms and Causes, Signals and Noise]] — [[Björn Rabenstein]]([[SoundCloud]] Production Engineer / [[Prometheus]] 主要開発者の一人)による SREcon16 Europe 発表。症状と原因の分離、ブラックボックス/ホワイトボックス監視の使い分け、時系列ベースの imminent problem 検知、ページ用異常検知の単純性を整理。(slides / sre / alert-management / prometheus)
### 2026-06-23 SREcon16 Less Alarming Alerts
- [[@2016__SREcon16__Less Alarming Alerts]] — [[Robert Treat]]([[OmniTI]] CEO)による SREcon16 発表。アラートを「人を起こすページ」に限定し、ビジネス影響・修復手順・通知先・予防可能性を説明できないものを削除・通知化・修正する発火前ガバナンスを提示。(slides / sre / alert-management)
### 2026-06-23 SREcon17 Asia Draining the Flood — Alert Fatigue at Baidu
- [[@2017__SREcon17 Asia__Draining the Flood - A Combat against Alert Fatigue]] — Yu Chen(Baidu SRE)が Argus 監視システムのアラート洪水(1 人 100 件超/日、有効率 15% 未満)に対し、リンガバッファグルーピング・アソシエーションルールマイニング・重要度キャリブレーション・オンコールエスカレーション・自動修復の 4 施策で 85% 削減を達成。(slides / sre / alert-management)
### 2026-06-23 SREcon17 Europe Over-Monitoring and Alert Fatigue
- [[@2017__SREcon17 Europe__Want to Solve Over-Monitoring and Alert Fatigue - Create the Right Incentives]] — Kishore Jalleda(Yahoo / 元 Zynga SRE 責任者)がアラートバジェットによるインセンティブ設計で偽アラーム 90% 削減を達成した Clean Room イニシアティブの事例報告。(slides / sre / alert-management)
### 2026-06-23 SREcon21 Spike Detection in Alert Correlation at LinkedIn
- [[@2021__SREcon21__Spike Detection in Alert Correlation at LinkedIn]] — Nishant Singh(LinkedIn シニア SRE)が修正 Z スコアによるスパイク分離を実装。アラート相関の推奨結果から一時的スパイクを分離し、偽陽性率 1% 未満・トイル 30–40% 削減を ML なしで達成。(slides / sre / alert-correlation)
### 2026-06-23 Sakana Fugu Technical Report
- [[@2026__Sakana AI__Sakana Fugu Technical Report]] — Sakana AI による学習型 LLM オーケストレーター群(Fugu / Fugu-Ultra)のテクニカルレポート。オーケストレーションを新スケーリング軸として実証し、SWE-bench Pro 73.7%・GPQA 95.5% 等で公開フロンティアモデルを超えた。(multi-agent / collective-intelligence / llm)
---
### 2026-06-23 SREcon19 EMEA Adaptive Paging スライド
- [[@2019__SREcon19 EMEA__Are We All on the Same Page - Lets Fix That]] — [[Luis Mineiro]]([[Zalando SE]] SRE 責任者)による SREcon19 EMEA 発表。症状ベースアラーティングの限界を示し、分散トレーシングの因果関係で通知先を動的に決定する [[Adaptive Paging]] を提案。(slides / sre / alert-management / distributed-tracing)
- [[@2023__SRE NEXT__Warningアラートを放置しない!アラート駆動でログやメトリックを自動収集する仕組みによる恩恵]] — [[池田将士]]([[面白法人カヤック]])による SRE NEXT 2023 発表資料。Mackerel の Warning アラートを放置せず、[[prepalert]] で発火時点のログ・メトリクスを自動収集してアラートメモに貼る運用を紹介。(slides / sre / alert-management / observability)
- [[@2026__arXiv__Rethinking the Role of Efficient Attention in Hybrid Architectures]] — [[Ziqing Qiao]], [[Yinuo Xu]] ほか ([[Tsinghua University]]・[[OpenBMB]])。ハイブリッドアーキテクチャにおける効率的注意の役割を体系的解析。Large-Window Laziness の発見と NoPE によるフルアテンション強化の提案。(paper / machine-learning / llm / architecture / long-context)
- [[@2022__NeurIPS__Training language models to follow instructions with human feedback]] — [[Long Ouyang]] ほか (OpenAI)。InstructGPT: 人間フィードバックからの強化学習(RLHF)で GPT-3 を指示追従に整列。SFT → 報酬モデル → PPO の 3 段階パイプライン。(paper / machine-learning / alignment / rlhf)
- [[@2022__arXiv__Training Compute-Optimal Large Language Models]] — [[Jordan Hoffmann]] ほか (DeepMind)。Chinchilla: 計算最適訓練ではモデルサイズとデータ量を等比率でスケールすべき。70B パラメータ × 4 倍データで 280B Gopher を凌駕。(paper / machine-learning / scaling-laws)
- [[@2022__NVIDIA Developer Blog__Doubling all2all Performance with NVIDIA Collective Communication Library 2.12]] — [[Karthik Mandakolathur]]・[[Sylvain Jeaugey]]([[NVIDIA]])。NCCL 2.12で導入されたPXN(PCI × NVLink)機能を解説。GPUがNVLink経由でノード内の別GPUへデータを移し、そのGPUに近いNICから送信できるようにし、メッセージ集約とrail内経路集約でall2all性能を最大2.55倍改善(DGX A100・128ノード/1024GPU実測)。(article / networking / gpu / nccl)
- [[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]] — [[Noam Shazeer]] ほか (Google Brain)。スパースゲート MoE 層: 計算量を緩やかに増やしつつモデル容量を 1000 倍以上に拡大。(paper / machine-learning / moe)
- [[@2023__ICLR__ReAct Synergizing Reasoning and Acting in Language Models]] — [[Shunyu Yao]] ほか (Princeton)。ReAct: 推論トレースと行動を交互に生成し、知識検索・意思決定タスクで CoT 単体を上回る。(paper / machine-learning / prompting / agents)
- [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]] — [[Zhenyu Zhong]] ほか。LLM とマルチモーダルデータ(メトリクス・ログ・トレース)を統合した障害箇所特定フレームワーク LocaleXpert。(paper / aiops / rca / llm / multi-modal / TSC)
- [[@2026__arXiv__Time Series as Language - A Universal Tokenizer for General-Purpose Time Series Foundation Models]] — [[Yunhao Zhang]]・[[Junchi Yan]] ほか([[Shanghai Jiao Tong University]]・[[Huawei Noah's Ark Lab]])。VQ-VAE ベースの汎用時系列トークナイザ UniTok と NTP 事前学習基盤モデル UniTok-FM。(paper / time-series / foundation-model / arXiv)
- [[@2024__ASE__MRCA - Metric-level Root Cause Analysis for Microservices via Multi-Modal Data]] — [[Yidan Wang]] ほか。マルチモーダルデータからメトリクスレベルの根本原因を特定する MRCA。(paper / aiops / rca / multi-modal / ASE)
- [[@2024__TSC__Holistic Root Cause Analysis for Failures in Cloud-Native Systems Through Observability Data]] — [[Yongqi Han]]・[[Qingfeng Du]] ほか([[Tongji University]]・[[Di-Matrix]])。メトリクス・ログ・トレース 3 モダリティを統合したクラウドネイティブ障害の包括的 RCA。(paper / aiops / rca / cloud-native / multi-modal / TSC)
- [[@2024__ASE__Giving Every Modality a Voice in Microservice Failure Diagnosis via Multimodal Adaptive Optimization]] — [[Lei Tao]]・[[Shenglin Zhang]]・[[Dan Pei]] ほか。マルチモーダル適応最適化による障害診断フレームワーク Medicine。(paper / aiops / multi-modal / failure-diagnosis / ASE)
- [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]] — [[Yuchi Ma]]・[[Qiuai Fu]]・[[Pinjia He]] ほか。LLM によるマルチモーダルな変更影響評価フレームワーク ChangeLLM/SCELM。(paper / aiops / change-management / llm / FSE)
- [[@2025__TOSEM__Interpretable Failure Localization for Microservice Systems Based on Graph Autoencoder]] — [[Yongqian Sun]]・[[Shenglin Zhang]]・[[Dan Pei]] ほか([[Nankai University]])。グラフオートエンコーダベースの解釈可能な障害箇所特定フレームワーク DeepHunt。(paper / aiops / fault-localization / graph-neural-network / TOSEM)
- [[@2021__JSEP__TraceRank - Abnormal service localization with dis-aggregated end-to-end tracing data in cloud native systems]] — [[Guangba Yu]]・[[Zicheng Huang]]・[[Pengfei Chen]]([[Sun Yat-sen University]])。非集計トレースを用いたスペクトル解析 + PageRank ランダムウォークによるサービスレベル異常箇所特定。(paper / aiops / rca / microservices / distributed-tracing / JSEP)
- [[@2016__ICSE-C__Log Clustering Based Problem Identification for Online Service Systems]] — [[Qingwei Lin]]・[[Hongyu Zhang]]・[[Jian-Guang Lou]] ほか([[Microsoft Research]])。IDF ベースのログクラスタリングと知識ベース照合による問題特定。(paper / aiops / log-analysis / ICSE)
- [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]] — [[Yicheng Sui]]・[[Shenglin Zhang]]・[[Dan Pei]] ほか([[Tsinghua University]] / [[BNRist]])。知識グラフによるログ障害診断フレームワーク。(paper / aiops / log-analysis / knowledge-graph / TSC)
- [[@2022__SREcon22 APAC__Introducing the Reliability Map – r9y.dev]] — [[Aaron Bowden]](Google Cloud Professional Services、SRE Practice Lead JAPAC)による SREcon22 APAC(シドニー)講演。SRE ケイパビリティをゲームのテック・ツリーに着想を得たマップとして体系化したオープンソースプロジェクト `r9y.dev` を紹介。ベストプラクティスはコンテキスト依存であり、「コンテキスト抽出→ケイパビリティ選択→戦術・戦略ロードマップ」のプロセスを提唱。(video / sre / reliability / ケイパビリティ / SREcon22 APAC)
- [[@2022__SREcon22 Americas__Modeling Alert Quality]] — [[Moshe Zadka]]。アラート品質をコスト(アンチクオリティ)としてモデル化。真/偽/欠落の 3 アラーム分類と 4 区間レイテンシ分解。Goodhart の法則への警告。(slides / alert-management / SREcon22)
- [[@2022__IEEE CLOUD__Localizing and Explaining Faults in Microservices Using Distributed Tracing]] — [[Jesus Rios]]・[[Saurabh Jha]]・[[Larisa Shwartz]]([[IBM Research]])。分散トレーシングのスパンツリー動的因果推論による教師なし障害箇所特定。(paper / aiops / fault-localization / microservices / distributed-tracing / IEEE CLOUD)
- [[@2023__ESEC-FSE__Nezha - Interpretable Fine-Grained Root Causes Analysis for Microservices on Multi-modal Observability Data]] — [[Guangba Yu]]・[[Pengfei Chen]] ほか([[Sun Yat-sen University]])。マルチモーダルオブザーバビリティデータによるコード領域・リソースタイプレベルの解釈可能な根本原因分析。(paper / aiops / rca / microservices / multi-modal / ESEC-FSE)
- [[@2023__arXiv__Eadro - An End-to-End Troubleshooting Framework for Microservices on Multi-source Data]] — [[Cheryl Lee]]・[[Tianyi Yang]]・[[Zhuangbin Chen]]・[[Michael R. Lyu]]([[The Chinese University of Hong Kong]] / [[Sun Yat-sen University]])。異常検知と根本原因箇所特定を統合するエンドツーエンドトラブルシューティングフレームワーク。(paper / aiops / rca / microservices / multi-source / arXiv)
- [[@2013__JSPI__Energy statistics - A class of statistics based on distances]] — [[Gábor J. Székely]]・[[Maria L. Rizzo]](NSF / Rényi 数学研究所 / Bowling Green State University)による JSPI 2013 レビュー論文。距離に基づく統計量族「エネルギー統計」の理論と応用を体系化。エネルギー距離・DISCO・E-クラスタリング・距離共分散(dCov)・距離相関(dCor)・ブラウン共分散との同値性を解説。(paper / statistics / distance-statistics / dependence-measure / JSPI)
- [[@2018__NSDI__Odin - Microsoft's Scalable Fault-Tolerant CDN Measurement System]] — [[Matt Calder]]・[[Ethan Katz-Bassett]] ほか([[Microsoft]] / [[University of Southern California|USC]] / [[Columbia University]])による NSDI 2018 論文。100+ PoP の Microsoft CDN を支えるクライアント側アプリケーション層計測プラットフォーム Odin の設計・評価。サードパーティ CDN フォールバックで耐障害性を実現し、Odin データから生成した DNS マップで最大 P75 30% 超の低遅延化を達成。(paper / networking / cdn / internet-measurement / NSDI)
- [[@2002__DSN__Pinpoint - Problem Determination in Large, Dynamic Internet Services]] — [[Mike Y. Chen]]・[[Emre Kıcıman]]・[[Armando Fox]]・[[Eric Brewer]]([[UC Berkeley ROC Project]] / [[Stanford University]])による DSN 2002 論文。大規模インターネットサービスにおけるリクエストトレースと統計的クラスタリング(決定木・χ²検定)を組み合わせた障害コンポーネント自動特定。J2EE ミドルウェア計装によりアプリ改変不要。(paper / distributed-tracing / fault-localization / statistical-analysis / DSN)
- [[@2003__HotOS__Magpie - Online Modelling and Performance-aware Systems]] — [[Paul Barham]]・[[Rebecca Isaacs]]・[[Richard Mortier]]・Dushyanth Narayanan([[Microsoft Research]] Cambridge)による HotOS IX 2003 論文。OS カーネル・ミドルウェアのイベントトレーシングとスキーマ駆動パーサにより、個別リクエストの資源消費モデルをオンライン構築。クラスタリングによる異常リクエスト検出とワークロードモデリングのビジョンを提示。(paper / distributed-tracing / request-modelling / performance-analysis / HotOS)
- [[@2014__OSDI__lprof - A Non-intrusive Request Flow Profiler for Distributed Systems]] — [[Xu Zhao]]・[[Ding Yuan]]・[[Michael Stumm]]ほか([[University of Toronto]])による OSDI 2014 論文。ソースコード改変なしに既存ログからリクエストフローを再構築する非侵入プロファイラ。バイトコード静的解析でログ形式・識別子・実行順序を抽出し、分散ノード間のログを個別リクエストに縫合。HDFS・HBase 等で有効性を実証。(paper / distributed-tracing / non-intrusive-profiling / request-flow / OSDI)
- [[@2015__SOSP__Pivot Tracing - Dynamic Causal Monitoring for Distributed Systems]] — [[Jonathan Mace]]・[[Ryan Roelke]]・[[Rodrigo Fonseca]]([[Brown University]])による SOSP 2015 論文。動的計装と happened-before 結合を組み合わせた分散モニタリングフレームワーク。実行時にトレースポイントを挿入し、コンポーネント・マシン境界を越えた因果関係に沿ったメトリクス集計を実現。Hadoop クラスタ(HDFS/HBase/MapReduce/YARN)で評価。(paper / distributed-tracing / dynamic-instrumentation / causal-monitoring / SOSP)
- [[@2017__SOSP__Canopy - An End-to-End Performance Tracing And Analysis System]] — [[Jonathan Kaldor]]・[[Jonathan Mace]]・Michał Bejda ほか([[Facebook]])による SOSP 2017 論文。Facebook 規模(日次数十億リクエスト)のエンドツーエンドパフォーマンストレーシング基盤。トレースモデル・特徴量抽出 DSL・パフォーマンスデータセット・Scuba 統合の 4 層アーキテクチャ。(paper / distributed-tracing / performance-analysis / trace-sampling / SOSP)
- [[@2016__ISSTA__Practitioners' Expectations on Automated Fault Localization]] — [[Pavneet Singh Kochhar]]・[[Xin Xia]]・[[David Lo]]・[[Shanping Li]]([[Singapore Management University]] / [[Zhejiang University]])による ISSTA 2016 論文。386 名実務者への大規模アンケートで FL 採用閾値(Top-5・成功率 75%・100kLOC・1 分・判断根拠・IDE)を定量化し、2011–2015 年の 15 本文献レビューで研究-実務ギャップを明示。(paper / software-engineering / fault-localization / empirical-study)
- [[@2020__IWQoS__Localizing Failure Root Causes in a Microservice through Causality Inference]] — [[Yuan Meng]]・[[Shenglin Zhang]]・[[Yongqian Sun]] ほか([[Tsinghua University]] / [[Nankai University]] / [[Alibaba Group]] / BNRist)による IWQoS 2020 論文。イントラマイクロサービス障害根本原因特定(初の体系的研究)のために PCTS(PCMCI ベース時系列因果グラフ)と TCORW(偏相関 + 異常度 + 優先度 + 時刻の統合ランダムウォーク)を提案。86 件の実障害チケットで AC@5=98.7%(最良ベースライン比 +33.4%)を達成。(paper / aiops / rca / microservices / causal-inference / IWQoS)
- [[A Tutorial on Kernel Density Estimation and Recent Advances]] — [[Yen-Chi Chen]]([[University of Washington]])による arXiv 2017 チュートリアル。KDE の統計的性質(収束レート・帯域幅選択)から信頼区間/信頼帯構成のバイアス処理、密度関数の幾何学的・位相的特徴(局所モード・レベルセット・リッジ・クラスターツリー・パーシステント図)の推定まで体系的に概観。(paper / nonparametric-statistics / density-estimation)
- [[@2011__JMLR__DirectLiNGAM - A Direct Method for Learning a Linear Non-Gaussian Structural Equation Model]] — [[Shohei Shimizu]]・[[Aapo Hyvärinen]]・[[Kenneth Bollen]] ほか([[Osaka University]] / [[University of Helsinki]])による JMLR 2011 論文。LiNGAM の因果順序推定において ICA ベースの反復探索に依存しない直接推定法を提案。外生変数の逐次同定により変数数に等しい固定ステップ数で収束を保証。(paper / causal-discovery / structural-equation-models)
- [[@2020__Signal Processing__Selective review of offline change point detection methods]] — [[Charles Truong]]・[[Laurent Oudre]]・[[Nicolas Vayatis]]([[ENS Paris-Saclay]] / University Paris 13)による Signal Processing 2020 サーベイ。オフライン変化点検知を**コスト関数**(パラメトリック 7 種 + ノンパラメトリック 6 種 = 計 13 種)・**探索手法**(Opt・Pelt・Win・BinSeg・BotUp)・**制約**(l0/l1/複雑ペナルティ)の 3 軸で統一的に体系化。Python ライブラリ [[ruptures]] として実装公開。(paper / signal-processing / change-point-detection / survey)
- [[@2025__PVLDB__Time-Series Clustering - A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods]] — [[John Paparrizos]]・Bogireddy([[The Ohio State University]] / Aristotle University of Thessaloniki)による PVLDB 2025 論文。84手法を10クラスに分類し、[[UCR Time Series Archive]] 全128データセットで包括的に評価。10年前の k-Shape を統計的に有意に上回る手法は存在せず、「進歩の幻想」が先行ベンチマークのバグ・不公平な設定に起因することを実証。基盤モデル(CHRONOS・OFA・MOMENT)もクラスタリングでは k-Shape を超えられない。(paper / pvldb / time-series / clustering / benchmark)
- [[@2026__Boris Tane Blog__The Software Development Lifecycle Is Dead]] — [[Boris Tane]] によるブログ記事(2026-02-20)。AI エージェントが従来 SDLC を解体したと論じ、モニタリング(オブザーバビリティ)を唯一の生存フェーズとして位置づける。新たな差別化要因として[[コンテキストエンジニアリング]]、AI ネイティブエンジニアの台頭([[AIネイティブ開発]])を提唱。(article / software-development / ai-native / observability)
- [[D'ya like DAGs]] — [[Matthew J. Vowels]]・[[Necati Cihan Camgoz]]・[[Richard Bowden]](CVSSP, [[University of Surrey]])による ACM Computing Surveys 2022 サーベイ。構造発見の4系統を統一整理し、組合せ手法約60件と連続最適化手法約30件(NOTEARS 以降)を横断比較。「因果の跳躍」への哲学的批判を展開。(paper / causal-discovery / structure-learning / continuous-optimization / survey)
- [[@2019__Frontiers in Genetics__Review of Causal Discovery Methods Based on Graphical Models]] — [[Clark Glymour]]・[[Kun Zhang]]・[[Peter Spirtes]]([[Carnegie Mellon University]])による Frontiers in Genetics 2019 レビュー。制約ベース(PC・FCI)・スコアベース(GES)・関数的因果モデルベース(LiNGAM・ANM・PNL)の3系統を体系化。忠実性仮定・識別可能性条件・スケーラビリティ・生物学応用ガイドラインを整理。(paper / causal-discovery / graphical-models / review)
- [[@2023__Physics Reports__Signal propagation in complex networks]] — [[Peng Ji]] ほか 10 名([[Fudan University]]・PIK・[[University of Maribor]] ほか)による Physics Reports 2023 包括サーベイ(96 ページ、860 以上の参考文献)。感染症モデル・蔵本モデル・反応拡散・カスケード障害・神経科学動力学から、時間的ネットワーク・多層ネットワーク・GNN、グレンジャー因果性・転送エントロピー・発生源特定・AI 駆動時系列解析、疫学・社会動態・電力網・ロボット群への応用まで体系化。(paper / physics-reports / complex-networks / network-science / nonlinear-dynamics / survey)
- [[Anomaly Detection - A Survey]] — [[Varun Chandola]]・[[Arindam Banerjee]]・[[Vipin Kumar]]([[University of Minnesota]])による ACM Computing Surveys 2009 サーベイ論文。異常検知を点異常・文脈異常・集合異常に分け、分類・近傍・クラスタリング・統計・情報理論・スペクトルの 6 技法群を、それぞれの正常/異常仮定、計算量、利点/欠点から整理する。後続の性能異常検知・マイクロサービス/AIOps 異常検知サーベイが依拠する古典的 taxonomy。(paper / csur / anomaly-detection / survey)
- [[@2019__SREcon19 EMEA__Latency SLOs Done Right]] — [[Heinrich Hartmann]]([[Circonus]])による SREcon19 EMEA 2019 講演資料。レイテンシ SLO を「対象期間の全リクエストのうち、しきい値以内に処理された割合」として定式化し、パーセンタイル時系列は複数時間窓・複数ノードで集約できないため SLO 実装に不適切と示す。正しい実装経路としてログ、しきい値別カウンタ、[[ヒストグラムメトリクス]]を比較する。(slides / sre / slo / latency / telemetry)
- [[Failure Diagnosis in Microservice Systems]] — [[Shenglin Zhang]] ほか([[Nankai University]] / [[Microsoft]] / [[Tsinghua University]])による arXiv 2024 包括サーベイ。2003〜2024 年の 98 論文を調査し、ログ・メトリクス・トレース・マルチモーダルの 4 カテゴリ分類体系と根本原因箇所特定(RCL)/障害種別分類(FC)の問題設定を整理。PC アルゴリズム + ランダムウォークの古典的パイプラインから result/model/feature fusion のマルチモーダル進化線まで体系化。公開データセット 10 種・ツールキット 20 種・評価メトリクスを初めて一覧化。(paper / aiops / microservices / survey)
- [[@2021__ASE__Graph-based Incident Aggregation for Large-Scale Online Service Systems]] — [[Zhuangbin Chen]]・[[Jinyang Liu]]・[[Yuxin Su]]・[[Hongyu Zhang]]・[[Xuemin Wen]]・[[Xiao Ling]]・[[Yongqiang Yang]]・[[Michael R. Lyu]]([[The Chinese University of Hong Kong]] / [[University of Newcastle]] / [[Huawei Cloud]])による ASE 2021 論文。[[GRLIA]] は、EVT によるインシデントバースト検知、KPI + incident 類似度による障害影響グラフ補完、DeepWalk/Word2Vec による incident type 表現学習、トポロジ距離つきオンライン集約を組み合わせる。Huawei Cloud Networking サービス 2020 年 5〜11 月本番データで NMI 0.831/0.866/0.912、実運用で障害対応時間 18.6〜24.8% 短縮を報告。(paper / ase / aiops / incident-management / alert-aggregation)
- [[@2025__SpeakerDeck__AIスーパーコンピュータにおけるLLM学習処理性能の計測と可観測性]] — [[Yuuki Tsubouchi]]([[SAKURA internet Inc]])による 2025 年度情報処理学会中国支部主催講演会資料。深層学習ワークロード、GPU/集団通信、[[SAKURAONE]] の 3 クラスタ構成、GPT-3 175B 事前学習ベンチマーク、ジョブ履歴分析、OTel + Grafana によるリソース分析、GPU ゼロコード計装、[[R-Pingmesh]] 型 RoCE 能動プロービング、AI スパコン障害管理研究の観測点・診断アルゴリズム・侵入度分類を統合的に説明する。(slides / ai-supercomputer / llm-training / observability / rdma)
- [[@2025__O11yConTokyo2025__AIスパコン「さくらONE」のオブザーバビリティ]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]])Observability Conference Tokyo 2025。[[SAKURAONE]] のオブザーバビリティ基盤(OTeL Collector Agent/Gateway → VictoriaMetrics/VictoriaLogs/Pyroscope → Grafana)の構成を開示し、クラウドネイティブ分野との「オブザーバビリティギャップ」を 3 つ(学習処理性能のボトルネック特定・問題切り分け・マイクロバースト監視)に整理。eBPF による GPU ゼロコード計装と [[R-Pingmesh]] による RoCE 常時監視で解消を目指す。(slides / observability / gpu / hpc)
- [[@2024__Anthropic Engineering Blog__Introducing Contextual Retrieval]] — [[Daniel Ford]]([[Anthropic]])による Contextual Retrieval 提案記事(2024-09-19)。各チャンクの先頭に LLM 生成の文脈テキスト(50〜100 トークン)を付与してベクトル埋め込みと BM25 両方に適用し、検索失敗率を 5.7% → 1.9%(67% 削減)に改善。Voyage・Gemini Text-004 が最高性能の埋め込みモデル。プロンプトキャッシングで約 $1.02/百万ドキュメントトークン。(article / anthropic / rag / information-retrieval)
- [[@2025__PyTorchConference__Scaling KV Caches for LLMs - How LMCache + NIXL Handle Network and Storage Heterogeneity]] — [[Moein Khazraee]]([[NVIDIA]])・[[Junchen Jiang]]([[University of Chicago]] / [[LMCache]])による PyTorch Conference 2025 講演資料。[[LMCache]] を GPU-GPU 転送、GPU-CPU 退避、CPU-CPU 転送、ストレージ退避を扱う KV キャッシュ層として示し、[[NIXL]] の Memory Section / Metadata Handler / UCX・GDS・OBJ バックエンドで異種ネットワーク/ストレージ転送を抽象化する。VAST Storage 例では 224K 入力付近で KV 再計算 TTFT 約 36 秒に対しストレージ取得は約 4 秒弱。(slides / pytorch-conference / llm-serving / kv-cache / NIXL)
- [[@2023__arXiv__GPT-4 Technical Report]] — [[OpenAI]](280 名超)。大規模マルチモーダル LLM の技術報告。予測可能スケーリング(1/1,000〜1/10,000 の計算量から性能予測)、模擬バー試験上位 10%・MMLU 86.4%・GSM-8K 92.0% 達成、RLHF によるキャリブレーション劣化(ECE 0.007→0.074)を定量化。アーキテクチャ詳細は非公開。(paper / arxiv / llm / scaling / alignment / multimodal)
- [[@2026__arXiv__KVCache Cache in the Wild - Characterizing and Optimizing KVCache Cache at a Large Cloud Provider]] — [[Xingda Wei]] ほか(SJTU IPADS / [[Alibaba Group]])。Aliyun 本番 LLM サービスの KV キャッシュワークロード特性を初めて体系的に分析。理想ヒット率 to-C 62%/to-B 54%、シングルターンが再利用の 97% を占め、ワークロード対応エビクションで LRU 比最大 41.4% QTTFT 削減。(paper / arxiv / llm-serving / kv-cache / workload-characterization)
- [[@2022__NSDI__MLaaS in the Wild - Workload Analysis and Scheduling in Large-Scale Heterogeneous GPU Clusters]] — [[Qizhen Weng]] ほか(HKUST / [[Alibaba Group]])。Alibaba PAI 6,742 GPU 異種混合クラスタの 2 か月トレース分析。GPU 共有で必要 GPU 平均 50% 削減、タスク繰り返しによる SJF の有効性、CPU 競合ボトルネックを報告。(paper / nsdi / gpu-cluster / scheduling / workload-analysis)
- [[@2025__EuroSys__CacheBlend - Fast Large Language Model Serving for RAG with Cached Knowledge Fusion]] — [[Jiayi Yao]] ほか(University of Chicago / Microsoft Research)。RAG 向け非プリフィックス KV キャッシュ再利用。KV 偏差上位 10-20% トークンの選択的再計算で TTFT 2.2-3.3× 削減、スループット 2.8-5× 改善。EuroSys 2025 Best Paper。(paper / eurosys / llm-serving / kv-cache / rag)
- [[@2025__arXiv__KVShare - An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse]] — [[Huan Yang]] ほか(Central South University / Tsinghua University)。マルチテナント KV キャッシュ再利用の DHD アルゴリズムと cache-aware スケジューラ。CacheBlend を発展させ、デコードフェーズのアテンション・ドリフトを解決。TTFT 最大 9.39× 短縮、SOTA 比精度 20.38% 向上。(paper / arxiv / llm-serving / kv-cache / multi-tenant)
- [[@2025__ICLR__SCBench - A KV Cache-Centric Analysis of Long-Context Methods]] — [[Yucheng Li]] ほか(Microsoft / University of Surrey)。KV キャッシュ中心の長コンテキスト手法ベンチマーク。生成・圧縮・検索・ローディングの 4 フェーズを共有コンテキストで評価。sub-O(n) 手法はマルチターン破綻、動的スパース性が静的パターンに優越。ICLR 2025。(paper / iclr / llm-serving / kv-cache / benchmark / long-context)
- [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]] — [[Ruoyu Qin]]・[[Zheming Li]] ほか([[Moonshot AI]] / [[Tsinghua University]] MadSys)による arXiv 2407.00079 テックレポート。Kimi サービングプラットフォーム Mooncake を記述。KVCache 中心の 3 プール分離(Prefill/KVCache/Decode)、CPU/DRAM/SSD 分散 KVCache、Conductor グローバルスケジューラ、Chunked Pipeline Parallelism(CPP)、Layer-wise Prefill、過負荷指向 Early Rejection を提案。実ワークロードで vLLM 比 75% 多いリクエスト処理、長コンテキスト模擬データで最大 525% スループット改善。(paper / arxiv / llm-serving / kv-cache / pd-disaggregation / Moonshot)
- [[@2025__MPLSJapan__A study on accelerating LLM inference using KV cache sharing with IOWN APN]] — [[田仲顕至]]([[NTT]] デバイスイノベーションセンタ)による MPLS JAPAN 2025 講演資料。LLM 推論需要と電力インフラ制約を背景に、小規模データセンターを分散配置し、[[IOWN APN]] でリクエストルーティングと KV キャッシュ共有を行う構想を提示。CacheBlend/KVShare によりユーザー間 KV キャッシュ共有の可能性を示し、100 km 圏内で TTFT 短縮効果の変化 8%、電力効率 2.31x と評価。(slides / mpls-japan / llm-serving / kv-cache / iown)
- [[@2023__SOSP__Efficient Memory Management for Large Language Model Serving with PagedAttention]] — [[Woosuk Kwon]] ほか([[University of California, Berkeley]] / Stanford / UC San Diego)による SOSP 2023 論文。[[vLLM]] と PagedAttention を提案し、KV キャッシュを固定サイズブロックに分けて非連続 GPU メモリ上で管理する。既存システムの予約・内部/外部断片化を抑え、FasterTransformer/Orca 比で同等レイテンシのまま 2-4 倍のスループット改善。(paper / sosp / llm-serving / kv-cache / vLLM)
- [[@2024__NeurIPS__SGLang - Efficient Execution of Structured Language Model Programs]] — [[Lianmin Zheng]] ほかによる NeurIPS 2024 論文。複数 generation call、制御フロー、構造化入出力を持つ LM プログラムを frontend/runtime 協調で実行する [[SGLang]] を提案。RadixAttention、圧縮 FSM、API speculative execution により、エージェント、RAG、JSON decoding、マルチターンチャット等で最大 6.4 倍スループット改善。(paper / neurips / llm-serving / structured-generation / kv-cache)
- [[@2025__arXiv__LMCache - An Efficient KV Cache Layer for Enterprise-Scale LLM Inference]] — [[Yuhan Liu]] ほか([[Tensormesh Inc]] / University of Chicago)による [[LMCache]] 論文。[[vLLM]] / [[SGLang]] から KV キャッシュを抽出・再読込し、CPU/SSD/リモートストレージ/Redis/RDMA/NVLink をまたいで退避・再利用・PD 転送する。chunk 化、計算 I/O 重畳、zero-copy により最大 15 倍スループット改善。(paper / arxiv / llm-serving / kv-cache / LMCache)
- [[@2024__arXiv__P-D-Serve - Serving Disaggregated Large Language Model at Scale]] — [[Yibo Jin]] ほか(Huawei Technologies)による [[P-D-Serve]] 論文。数万 NPU 規模の [[Prefill-Decode分離]]で、scenario 単位 P/D group、on-demand forwarding、block-free D2D KVCache transfer を提案。Ascend/MindSpore 上で 8 か月超商用展開され、E2E throughput 60%、TTFT SLO 42%、D2D transfer time 46% 改善、集約型比 6.7 倍 throughput。(paper / arxiv / llm-serving / pd-disaggregation / kv-cache)
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models]] — [[Zixuan Zhou]] ほか([[Infinigence-AI]] / Tsinghua / Shanghai Jiao Tong / Peking University)による LLM 推論効率化サーベイ。非効率の原因をモデルサイズ、二乗 attention、自己回帰復号に整理し、data-level / model-level / system-level の三層タクソノミーとフレームワーク比較を提示。(paper / arxiv / survey / llm-inference)
- [[@2025__arXiv__From Attention to Disaggregation - Tracing the Evolution of LLM Inference]] — [[Srinivasa Rao Aravilli]] ほか([[Capital One]])による LLM 推論発展史サーベイ。KV Cache、FlashAttention、Continuous Batching、Speculative Decoding、PagedAttention、RadixAttention を disaggregated inference へ接続し、DistServe/AIBrix/NVIDIA Dynamo をアーキタイプとして比較。(paper / arxiv / survey / llm-serving / disaggregation)
- [[@2024__OSDI__DistServe - Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving]] — [[Yinmin Zhong]]・[[Shengyu Liu]] ほか([[Peking University]] / [[UC San Diego]] / [[StepFun]])による OSDI 2024 論文。LLM 推論の Prefill と Decode を別 GPU に分離し、段階別の資源割当・並列化・帯域考慮配置で per-GPU Goodput を最大化する [[DistServe]] を提案。vLLM/DeepSpeed-MII 比で最大 7.4 倍高いリクエスト率または 12.6 倍厳しい SLO、OPT-175B でも KV キャッシュ転送は総レイテンシ 0.1% 未満。(paper / llm-serving / osdi / goodput / pd-disaggregation)
- [[@2025__INLG__Taming the Titans - A Survey of Efficient LLM Inference Serving]] — [[Ranran Zhen]]・[[Juntao Li]] ほか([[Soochow University]] / [[Huawei Cloud]])による INLG 2025 サーベイ。LLM 推論サービングをインスタンスレベル(モデル配置・スケジューリング・KV キャッシュ・[[Prefill-Decode分離]])、クラスタレベル(異種 GPU・ロードバランシング・クラウド/エッジ)、新興シナリオ(長コンテキスト・RAG・MoE・LoRA・投機的復号・エージェント・マルチモーダル)に階層化。(paper / survey / llm-serving / inlg / acl)
- [[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]] — [[道下幹也]]([[SAKURA internet Inc]])による 2026-03-06 公開 SpeakerDeck 資料。第 3 回 vLLM roundup Community Meetup Tokyo 登壇資料。LLM 推論基盤をユーザー体験・SLO/SLA・Goodput から最適化する考え方を示し、PD Disaggregation と Mooncake Store を用いた KV Cache Reuse/Sharing を実測。入力 8k・出力 1k・32 同時接続で PD 分離が ITL P99 30 ms 以内、KV Cache Reuse/Sharing が TTFT 最大 1.75 倍程度削減。(slides / llm-serving / benchmark / gpu / vLLM / LMCache)
- [[@2025__ペパボ研究所__gpt-ossモデルのサービング性能評価]] — [[三宅悠介]]([[GMOペパボ]] ペパボ研究所)による 2025-08-18 公開レポート。OpenAI のオープンウェイトモデル gpt-oss を Google Cloud H100/A100/L4 で vLLM + Locust により評価。H100 のみ並列スケーリングが有効で A100/L4 はサービス用途に非推奨。出力トークン数がスループットを支配し、Reasoning effort 管理がモデルサイズ選択と同等に重要。(article / llm-serving / benchmark / gpu / vLLM)
- [[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]] — [[Yu Gan]] ほか 24 名([[Christina Delimitrou]] @ [[Cornell University]])による ASPLOS 2019 論文。**[[DeathStarBench]]** suite を初公開:Social Network・Media Service・E-commerce・Banking・Swarm Cloud/Edge の 5(+1) サービス、各々 25-41 unique microservices。Apache Thrift RPC / REST、Conway の法則準拠の言語多様性、自前 distributed tracing(Thrift timing interface、Zipkin Collector 派生、overhead 0.1% 未満)。実証研究で(1)フロントエンドストール大半・retired instructions 21%、(2)ネットワーク処理 36.3%(monolithic NGINX 5.3% との対比)、(3)単スレッド性能感度の高さ、(4)dependency 管理ミスで tail latency 10.4× 悪化、(5)tail-at-scale 効果の顕著性を示した。MS benchmark の原点的ベンチで AIOpsLab・SREGym・Astraea 等の後続 testbed として広く再利用。(paper / microservices / benchmark / distributed-systems / Cornell)
- [[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]] — [[Sheldon Smith]] ほか([[Baylor University]])・[[Tomas Cerny]]([[Baylor University]])・[[Miroslav Bures]]([[Czech Technical University]])・[[Davide Taibi]]([[University of Oulu]])による arXiv 2306.05895。[[Train-Ticket]] v1.0.0(47 microservices、FudanSELab)と [[eShopOnContainers]] v5.0.0(C# .NET reference)の Selenium + JUnit/TestNG による functional regression テスト(51 + 26 ユースケース)と Gatling による load testing を Zenodo(10.5281/zenodo.7877723)で公開。1,000 ユーザで Train-Ticket booking 10.2%/eShop checkout 19.0% が 800ms 超(合格)、2,500 ユーザで両者不合格。両 system で login シナリオが負荷下に脆弱。Selenium 並列化で実行時間 25s → 6-7s。best practice(token 抽出・form parameter・並列化)も実装込み公開。(paper / microservices / benchmark / testing / Train-Ticket)
- [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] — [[Dario Amoroso d'Aragona]]([[Tampere University]])ほか 19 名([[Alexander Bakhtin]]・[[Davide Taibi]] @ [[University of Oulu]] ほか)による MSR 2024 論文。[[World of Code]](173M projects)から **378 件の手動ラベル付き OSS-MS dataset** を構築:I1-I7 の 7 criteria(2021-2022 active、commit ≥100、contributors ≥3、Docker-Compose ≥3 services、12+ active months、age ≥1 year、英語 README)+ 6 軸の手動ラベル(application type/purpose/developer/archived/WIP/is_microservice)。Top 50 で `taskcluster/taskcluster`(50 services)・`FudanSELab/train-ticket`(42)等を確認。CC BY-NC-SA 4.0、figshare 公開、replication package あり。Research Council of Finland MuFAno 助成。(paper / microservices / dataset / mining-software-repositories / OSS-MS)
- [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]] — [[Pirmin Urbanke]]・[[Stefan Fischer]]([[Software Competence Center Hagenberg]] GmbH)による SANER-C 2026 論文。**[[Train-Ticket]] 42 microservices × 9 fault branch + 1 cleaned baseline** の trace+metric+log dataset。[[EvoMaster]] white-box mode(38 Java services、1h/service)、[[OpenTelemetry]] + [[Jaeger]] + [[Prometheus]] + Logback。各 branch 約 440,000 traces、計 380h データ収集。fault は Gregor+ ICST 2025 taxonomy で Exec F.→Service Faulty 7 件(race condition/SQL error/VIP logic)・Depl F.→Wrong Config 2 件(thread-pool saturation/body size limit)・Conn F.→Timed out 1 件(third-party delay)。Train-Ticket fault replication repo の不整合を著者が修正、reproducible 化。EvoMaster の test では seeded fault を 1 件も検出できなかったが、trace breadth/depth・endpoint coverage 差として痕跡が残る。Zenodo DOI 10.5281/zenodo.17811972。(paper / microservices / dataset / fault-localization / distributed-tracing)
- [[@2012__NOMS__Optimizing System Monitoring Configurations for Non-Actionable Alerts]] — [[Liang Tang]]・[[Tao Li]]([[Florida International University]])・[[Florian Pinel]]・[[Larisa Shwartz]]([[IBM T.J. Watson Research Center]])・[[Genady Grabarnik]]([[St. John's University]])による IEEE NOMS 2012 論文。「アラートをリアル/非リアルに分類する」のではなく「SLA の許す範囲でチケット生成を遅延 → 一過性アラートを自然消滅」へ設計転換し、リアルチケットの見逃しゼロを数学保証(Theorem 1: P(損失) → 0)しながら非アクション可能チケットを最大 75% 削減。IBM Tivoli 本番データ(Account1: actionable rate 49%、Account2: 21%)で実証。ルールベース学習(Srikant-Agrawal 量的アソシエーション、Laplace 精度)で「ルール条件 + 最適遅延時間」を抽出するオフライン手法。(paper / aiops / alert-management / monitoring / IBM)
- [[@2009__ICAC__Ranking the Importance of Alerts for Problem Determination in Large Computer Systems]] — [[Guofei Jiang]]・[[Haifeng Chen]]・[[Kenji Yoshihira]]・[[Akhilesh Saxena]]([[NEC Laboratories America]])による ICAC 2009 論文(ICAC'09, Barcelona)。複雑システムのルールベース監視で個別閾値が異なる多メトリクス間の真陽性確率を相対ランクづけるため、不変条件ネットワーク([[ARXモデル]])による値伝播と等価閾値変換 → ピアレビュー機構による NTV(Number of Threshold Values)集計を提案。事前知識ゼロで真陽性確率(PRTP)を導出。ISSRE 2020 の AlertRank が同問題を ML ランキングで再定式化した先行研究。(paper / aiops / alert-management / ranking / NEC)
- [[@2017__KDD__Anomaly Detection in Streams with Extreme Value Theory]] — [[Alban Siffer]]・[[Pierre-Alain Fouque]]・[[Alexandre Termier]]・[[Christine Largouet]]([[Amossys]]・[[Inria]]・[[IRISA]]・[[Univ. Rennes 1]]・[[AgroCampus]])による KDD 2017 論文。EVT(Extreme Value Theory)の Peaks-Over-Threshold(POT)アプローチで、データ分布を仮定せず・閾値を手動設定せずに、リスクパラメータ q 1 個だけでストリーム異常検知を実現する **SPOT/DSPOT**。一般化パレート分布(GPD)で超過分布をモデル化、Grimshaw 最尤推定。Zhao+ ICSE-SEIP 2020 のアラートストーム検知器が EVT を採用したことで、本論文はアラートストーム文脈の統計的ルーツ。単変量 iid 仮定で初期バッチサイズ n≈1000 件が要件。(paper / time-series / anomaly-detection / streaming / EVT / KDD)
- [[@2018__DICOMO2018__なめらかなシステムを目指して]] — [[栗林健太郎]]・[[三宅悠介]]・[[Ryosuke Matsumoto]](GMOペパボ ペパボ研究所)による DICOMO2018 論文。[[なめらかなシステム]]の一次出典。利用者・情報システム・開発運用者の継続的相互影響による総体を定義し、[[コンテキスト・アウェアネス]]と[[基礎情報学]](HACS)を統合。(paper / systems-thinking / sre / context-aware)
- [[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection]] — [[Ying Lin]]([[University of Houston]])・[[Zhengzhang Chen]]・[[Lu-An Tang]]・[[Wei Cheng]]・[[Zhichun Li]]([[NEC Laboratories America]])・[[Cheng Cao]]([[Amazon]])・[[Kai Zhang (Temple University)]]([[Temple University]])による CIKM 2018 産業論文。**CAR(Collaborative Alert Ranking)** は異種カテゴリカルアラートの時間的依存性(Pitman-Yor 前置木階層ベイズ)とコンテンツ類似度(エンティティ埋め込み)を統一凸最適化(NNLS)で同時に解き、ラベル不要のまま個別アラートと多段攻撃パターンを同時ランキング。企業セキュリティ実データで ROC-AUC 0.998、PRC-AUC 0.719、FPR 0.010、攻撃シナリオ(MLS/SNO/BOT/EEE/DAV/DCP)を完全復元。ISSRE2020 AlertRank の教師あり相補、AlertRCA(CCGRID2024)へのパイプライン構成可能。(paper / aiops / alert-ranking / anomaly-detection / enterprise-security / CIKM)
- [[@2020__CLOUD__DEAR - Distributed Evaluation of Alerting Rules]] — [[Mathias Mormul]]・[[Pascal Hirmer]]・[[Christoph Stach]]・[[Bernhard Mitschang]]([[University of Stuttgart]] IPVS)による IEEE CLOUD 2020 論文。集約による精度劣化と分散化による管理複雑性の **二重トレードオフ**を BET(Binary Expression Tree)中間表現でアラートルール評価を VM に自動配布する **DEAR Plugin** で解決。ルール管理は中央のアラートフレームワーク(Esper CEP)に保持しつつ評価のみ分散。TTI(Time-To-Insight)が集約インターバル依存(最大 27 秒)から定値 ~360-380ms に。発火後フィルタリング(Voutsas+/Bhukar+)とは独立した「発火前精度向上」の介入点として位置づけ。(paper / cloud-monitoring / distributed-monitoring / alerting-rules / IEEE-CLOUD)
- [[@2022__ICSE__Online Summarizing Alerts through Semantic and Behavior Information]] — [[Jia Chen (Fudan)]]・[[Peng Wang (Fudan)]] corresponding・[[Wei Wang (Fudan)]]([[Fudan University]])による ICSE 2022 論文。**OAS(Online Alert Summarizing)** は障害報告書(failure report)をラベル源とした教師あり深層学習で、ASR(Alert Semantic Representation, BERT)+ ABR(Alert Behavior Representation, LSTM)+ ACT(Alert Correlation Transformer)を統合。CMDB 不要、意味的に異なるアラート(同義語・記述差)も同一障害として集約。2 商業銀行実データで Bank B ACR > 99%・VCR ≈ 54% を達成。Fudan アラート集約三部作 OAS(2022)→ DyAlert(ASE2023)→ ProAlert(FSE2025)の起点。(paper / aiops / alert-aggregation / online-service-systems / deep-learning / ICSE / Fudan)
- [[@2024__FSE__ChangeRCA - Finding Root Causes from Software Changes in Large Online Systems]] — [[Guangba Yu]]・[[Pengfei Chen]]・[[Zilong He]]([[Sun Yat-sen University]])・[[Qiuyu Yan]]・[[Yu Luo (Tencent)]]・[[Fangyuan Li]]([[Tencent]])・[[Zibin Zheng]] による FSE 2024 論文(Proc. ACM Softw. Eng. 1, FSE, Article 2、DOI:10.1145/3643728)。既存の ACD(Abnormal Change Detection、変更の異常度判定)から **RCCA**(Root Cause Change Analysis、複数 changes から defective change を pinpoint)へ問題を昇格。3 情報統合(サービス依存グラフ・変更フロー・KPI 差分)の 3 段階フレームワーク。WeChat 本番 30 件 + OnlineBoutique シミュレーション 51 件(計 81 件、81 種類の defective changes)で HR@1=85.78%・HR@3=96%、TTI を 90% 以上削減、FUNNEL/SCWarn/Gandalf を 20-28 ポイント超え。(paper / aiops / rca / software-change / online-service-systems / FSE)
- [[@2025__arXiv__ARGOS - Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models]] — [[Yile Gu]]([[University of Washington]] / [[Microsoft Research]])・[[Yifan Xiong]]・[[Jonathan Mace]]・[[Yuting Jiang]]・[[Yigong Hu]]([[Boston University]] / Microsoft Research)・[[Baris Kasikci]](UW)・[[Peng Cheng]](MSR)による arXiv 論文(2501.14170、2025-01-24)。**ARGOS** は LLM をルール生成フェーズ(訓練時)のみに使い、推論時はルール実行のみ — 説明可能性・再現性・自律性を同時達成する Agentic TSAD システム。Detection / Repair / Review の 3 エージェント協調 + Aggregator(モデル融合)で精度退行ゼロ保証、top-k ルール選択で収束加速。KPI/Yahoo/Microsoft 内部データセットで SOTA 超え、内部データセットで LSTMAD 比 F1 +28.3%、推論レイテンシは最良ベースライン比 1.5x-34.3x 高速化。1 試行あたり LLM コスト最大 $0.177。(paper / aiops / time-series-anomaly-detection / llm / agentic / arXiv)
- [[@2025__arXiv__Can Multimodal LLMs Perform Time Series Anomaly Detection]]
- [[@2012__ECCE__The Ironies of Automation Still Going Strong at 30]] — [[Gordon Baxter]]・[[John Rooksby]] ほか([[University of St Andrews]])による ECCE 2012 論文。Bainbridge (1983) の「自動化のアイロニー」発表 30 周年に際し、航空(名古屋 A300 事故)・金融取引(フラッシュクラッシュ 2010)・クラウドコンピューティング(AWS 障害 2011)の 3 ドメインでアイロニーの残存を確認。クラウドの低コストが品質保証プロセスの迂回を招く新しいアイロニーを特定。(paper / automation / human-factors / aviation / cloud-computing / financial-trading)
- [[@2017__IEEE THMS__Ironies of Automation - Still Unresolved After All These Years]] — [[Barry Strauch]]([[National Transportation Safety Board]])による IEEE THMS 2017 論文。Bainbridge (1983) へのトリビュート。NTSB 事故調査官としての実務経験に基づき、Crown Princess 傾斜事故・B747-SP 事故・AF447 事故・Marshall パイプライン破裂等で Bainbridge のアイロニーが事故として顕現する構造を実証。新しいアイロニー(技能マスキング・同一エラーの 30 年間反復・機能過多)を体系化。自律走行車・スマートフォンへのアイロニーの射程拡大を議論。(paper / automation / human-factors / accident-investigation / aviation / autonomous-vehicles) — [[Xiongxiao Xu]]([[Illinois Institute of Technology]])・[[Haoran Wang]]([[Emory University]])・[[Yueqing Liang]](IIT)・[[Philip S. Yu]]([[University of Illinois Chicago]])・[[Yue Zhao]]([[University of Southern California]])・[[Kai Shu]](Emory)による arXiv 論文(2502.17812、2025-02-24、WWW 2026 採択)。**VisualTimeAnomaly** は MLLM(視覚言語モデル)で時系列を画像化し point-wise / range-wise / variate-wise / irregular の 4 タイプの異常を統合的に扱う。MLLM は不規則サンプリングへロバスト・ハルシネーション削減を実現するが、点別異常では数値推論限界により F1 上限 8.12% で従来手法に大幅劣後(粗粒度の range/variate では従来手法超え)。MLLM × 数値手法は**相補的に使うべき**との実証。TSAD-Agents(scan→plan→detect→verify)も実装。(paper / time-series-anomaly-detection / multimodal-llm / mllm / vision-language / arXiv / WWW)
- [[@2025__FSE__Alert Summarization for Online Service Systems by Validating Propagation Paths of Faults]] — [[Jia Chen (Fudan)]]・[[Yuang He]]・[[Peng Wang (Fudan)]] corresponding・[[Xiaolei Chen]]・[[Jie Shi]]・[[Wei Wang (Fudan)]]([[Fudan University]])による FSE 2025 論文(Proc. ACM Softw. Eng. 2, FSE, Article FSE097、DOI:10.1145/3729367、23p)。**ProAlert** はトポロジ接続性だけでなく**エッジのセマンティクス**を考慮するアラート集約。歴史的アラート + CMDB トポロジから fault propagation patterns を**教師なし** DBSCAN で学習(オフライン)、real-time alerts に対し propagation paths を validate(オンライン推論軽量、S1: 200+ alerts/sec、S2: 1280+ alerts/sec)。S1 で VCR 93.53%・SA 99.71%、S2 で VCR 77.63%・SA 98.55% を達成し LiDAR/StormSum/OAS を上回る。Fudan 三部作の最新作。コード: github.com/Pro-Alert/ProAlert。(paper / aiops / alert-aggregation / fault-propagation / online-service-systems / FSE / Fudan)
- [[@2026__NSDI__Harp - Improving VPC Network Availability via Efficient Failure Detection and Rerouting in Tencent Cloud]] — [[Jiayu Hu]]・[[Feng Jin]]・[[Kai Zhang]] ほか([[Tencent]]・[[Fudan University]])による NSDI 2026 論文。UDP ソースポートによる決定論的 ECMP パス制御と VM パケットへのインバンドプローブ埋め込みで VPC ネットワーク障害をサブ秒(P50: 48-97 ms)で回復。Tencent Cloud の 8 件の重大スイッチ障害で停止時間 78.71%-99.97% 削減。特定ハードウェア不要・VM 透過。(paper / networking / cloud / reliability)
- [[@2024__Electronics__Leveraging Large Language Models for Efficient Alert Aggregation in AIOPs]] — [[Junjie Zha]] ら 5 名([[State Grid Jiangsu Electric Power]])による MDPI Electronics 2024 論文(DOI:10.3390/electronics13224425)。時空間 DBSCAN([[node2vec]] + [[Sentence-BERT]] のハイブリッド類似度、τ=15min)と LLM × [[サービス依存グラフ]]の弱連結成分集約を組み合わせた二段階アラート集約手法を提案。State Grid Jiangsu の 100K アラート × 130 ストーム実本番データで F1 0.815-0.850 を達成し、FPGrowth(0.475-0.540)/DBSCAN(0.248-0.295)/AlertStorm(0.408-0.468)を大差で上回る。アブレーションで時間情報除去が最大の劣化(F1 -0.275)、Phase 2 LLM 除去で F1 -0.294。(paper / aiops / alert-management / llm)
- [[@2025__FASE__VOCE - A Virtual On-Call Engineer for Automated Alert Incident Analysis Using a Large Language Model]] — [[Jia Chen (Fudan)]] ほか([[Peng Wang (Fudan)]] グループ、[[Fudan University]])による FASE 2025 論文(DOI:10.1007/978-3-031-90900-9_4)。**アラートインシデント分析**(alert linking 後段の根本原因 alert 特定)を新概念として導入。Company A 10,680 アラート/827 インシデントの本番データで「originating alert は system layer 最下層 93%・impact scope 最広 95%・severity 最高 93% で一致、Order = 45.34%」を実証(時系列順仮定の半分の誤りを定量化)。VOCE は (i) Drain で template 化、(ii) CoT で 3 因子抽出、(iii) source 内→隣接 source 間の階層 causality mining(k=5 多数決)、(iv) 統計的 causality correction、(v) fault propagation graph 上の [[Eigenvector Centrality]] で originating alert を推定。VOCE-GPT 88.90%(56.79s)、VOCE-LLaMA 81.26%(279.91s)、CoT/Prompt をいずれも上回る。(paper / aiops / alert-management / llm / incident-management)
- [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures]] — [[Bo Yang]]・[[Huanwu Hu]]・[[Yifan Li]] ほか([[Ennan Zhai]]・[[Tao Lin (Alibaba)]] が corresponding author、[[Alibaba Cloud]])による SIGCOMM 2025 論文(DOI:10.1145/3718958.3750536)。89 DC × 29 リージョン × O(10⁵) ネットワークデバイスの本番で **1.5 年安定稼働**、severe network failure の mitigation time を中央値 736s→147s、最大 14,028s→1,920s(80% 削減)、false negative 0% を達成。12 種監視ツール(Ping/Traceroute/Out-of-band/Traffic/Internet telemetry/Syslog/SNMP+GRPC/INT/PTP/Route monitoring/Modification events/Patrol inspection、[[FT-tree]] で Syslog template 化)を統一入力に変換する preprocessor、location 階層(Region/City/Logic Site/Site/Device/Cluster)で構築する hierarchical alert tree(threshold 2/1+2/5)、impact × time の severity score(Eq.1-3)で incident をランクする evaluator の 3 モジュール。**LLM 不採用**を §2.3 で明文化(Syslog 10M/15min が 20M トークン context 超過、ハルシネーション、ブラックボックス性の 3 理由)。SkyNet 出力を LLM 入力にする posterior integration を future work と位置づける。(paper / aiops / networking / alert-management)
- [[@2026__SpeakerDeck__Reliability in the Age of AI - Engineering for AI Velocity]] — [[Ryota Yoshikawa]]([[Topotal]])による 2026-06-09 公開 SpeakerDeck 資料。AI による開発速度向上と信頼性指標悪化を DORA・AI コード品質・生成 AI サービス運用の 3 軸で整理し、SLI/SLO・エラーバジェット・Production-Readiness Check・障害対応/ポストモーテムへの AI 導入を人間承認付きで段階化する。(slides / sre / aiops / ai-engineering)
- [[joisino-トランスフォーマーはRNN-2024]] — [[佐藤竜馬]] による 2024-09-30 ブログ記事。Transformer の自己注意機構を [[カーネル法]] として再定式化し、線形注意により固定次元状態を持つ [[RNN]] として等価に書き直せることを示す。訓練時はトランスフォーマーモード(並列)、推論時は RNN モード(定メモリ・定計算量)に切り替え可能。[[線形注意]]・[[状態空間モデル]](Mamba 等)・[[文脈内学習]] と重み内学習の同質性まで通読可能な入門解説。(article / machine-learning / sequence-modeling)
- [[joisino-否定文理解-2024]] — [[佐藤竜馬]] による 2024-12-18 ブログ記事。BERT のテキスト埋め込みは正反対の意味の文を高類似度(0.97)で近接させ、softmax の構造上、否定文に対応する埋め込みベクトルは数学的に存在できないことを示す。ChatGPT o1 も否定文穴埋めで誤答多発。[[テキスト埋め込み]]・[[自然言語推論]]・BERTNOT・[[Anthropic]] の[[文脈付き検索]](Contextual Retrieval、検索ミス 5.0%→2.9%)等の回避策をサーベイ。(article / machine-learning / llm / nlp / negation)
- [[joisino-超人的AIと認知不能情報-2025]] — [[佐藤竜馬]] による 2025-01-15 ブログ記事。[[敵対的摂動]]は AI を騙すノイズではなく、人間に認知できない正当な分類手がかりを含む正規な信号であると論じ、[[帰属手法]]の限界・[[機構的解釈性]]の難しさを示す。NP 完全性・対話型証明系を引いて「探索は AI に任せ、検証は人間が担う」役割分担([[AI検証可能性]])を提案。(article / machine-learning / adversarial / interpretability / ai-alignment)
- [[joisino-機械学習理論入門-2025]] — [[佐藤竜馬]] による 2025-03-17 ブログ記事。[[集中不等式]](マルコフ→チェビシェフ→ヘフディング)とユニオンバウンド・[[カバリングナンバー]]を積み上げ、古典的 [[汎化誤差バウンド]]([[PAC学習]])を導出。さらに深層学習の過パラメータ化でこれらが自明(≥1)に崩壊することを示し、損失地形の「盆地」構造に基づく代替アプローチ([[深層学習の汎化]])へ展望をつなぐ一本道の入門解説。(article / machine-learning / generalization / learning-theory)
- [[joisino-言語モデルの物理学-2025]] — [[佐藤竜馬]] による 2025-03-24 ブログ記事。[[Zeyuan Allen-Zhu]]・[[Yuanzhi Li]]([[Meta FAIR]]) の [[Physics of Language Models]] シリーズを通覧。制御データ+線形プロービングで普遍則を抽出するアプローチ、[[知識容量スケーリング則]](パラメータ 1 つにつき約 2 ビット記憶)、[[知識操作]]は CoT 必須、自己回帰モデルは内部状態で誤答を認識しているが発言を取り消せない、[[文脈自由文法]] 学習などを論じる。(article / machine-learning / llm / interpretability / physics-of-llm)
- [[joisino-アンナカレーニナの法則-2025]] — [[佐藤竜馬]] による 2025-05-20 ブログ記事。「性能の良いモデルはどれも同じような表現を持つ」という機械学習版アンナ・カレーニナ法則を、[[プラトン的表現仮説]](Huh+ 2024)・[[モデル縫合]]・[[暗黙的正則化]]・反変原理・[[アンサンブル学習]]の効果薄化として解説。テキスト/画像など異モダリティのモデルが性能向上とともに共通の世界統計モデルへ収束する。(article / machine-learning / representation-learning / multimodal)
- [[joisino-人間を騙すAI-2025]] — [[佐藤竜馬]] による 2025-06-23 ブログ記事。標準的 RLHF だけで LLM が人間を誤解させる振る舞いを学ぶ([[RLHF誤誘導]])。RLHF 後は真の性能ほぼ不変のまま人間評価が劇的に上昇し、質問応答では高度なフェイクエビデンス挿入、コーディングでは意図的に複雑なコードで誤りを隠蔽。[[LLM自己検証]]の限界、ルールベース検証器・[[スコファンシ]]・[[報酬ハッキング]]・[[Anthropic]] のサーベイ。(article / ai-safety / rlhf / reward-hacking)
- [[joisino-面白さ優先分類器-2025]] — [[佐藤竜馬]] による 2025-08-28 ブログ記事。精度最大化でなく「[[面白さ優先分類]]」を目的とする分類器 EUREKA を紹介。LLM の[[一対比較ランキング]]で面白い特徴量をランキングし、上位 K 特徴のみで訓練。ほぼ全データセットで「面白い特徴量 1 つ」だけでも統計的有意な精度を達成。疑似相関も教科書素材・仮説生成源として価値づける。(article / machine-learning / feature-selection / llm)
- [[joisino-LLMのキモい算術-2025]] — [[佐藤竜馬]] による 2025-10-27 ブログ記事。Nikankin+ ICLR 2025 を解説。LLM の四則演算は厳密なアルゴリズムでなく、MLP ニューロンが担う粗い条件判定([[ヒューリスティックの束]])の積み重ねで実装されており、[[ロジットレンズ]] でニューロン単位の寄与を定量化できる([[LLM算術機構]])。計算ミスはヒューリスティックの押し上げ不足で生じる。(article / machine-learning / llm / interpretability)
- [[joisino-訓練データ1個推論性能倍-2025]] — [[佐藤竜馬]] による 2025-11-25 ブログ記事。[[1サンプルRLVR]] を解説(Wang+ ICLR 2026)。訓練データを 1 問に限定した [[検証可能報酬による強化学習]] でも 1209 問使用時と遜色ない推論性能を達成し、Qwen2.5-Math-1.5B で MATH500 36.0%→73.6%、6 ベンチマーク平均 17.6%→35.7%。問題選択基準は報酬分散、エントロピー増大正則化と内省語の獲得が鍵。([[強化ファインチューニング]] / machine-learning / reinforcement-learning / llm / post-training)
- [[joisino-LLMの能力の穴-2026]] — [[佐藤竜馬]] による 2026-01-26 ブログ記事。最先端 LLM(GPT-5.2 等)は流体力学・低レイヤープログラミングをこなす一方、5 文字の二進文字列偶奇判定や 2 桁×2 桁の掛け算で誤答する。「[[ゼロエラー境界]]」(ZEH)はモデル自身が問題サイズの限界を定めることで人間の恣意的評価範囲設定を排除する。リミッターは対抗例と異なり自然分布内で[[LLMアプリケーション信頼性]]への実用的影響が大きい。([[LLM評価]] / [[LLM能力スパース性]] / llm / benchmarking)
- [[joisino-LLMでソート-2026]] — [[佐藤竜馬]] による 2026-02-09 ブログ記事。LLM を比較関数([[LLM比較器]])として用いて主観的・曖昧な基準でソートする手法群を概観。ペアワイズ法+クイックソートで推移性なしでも近似保証、リストワイズ法はアイテム数増加で破綻し[[スライディングウィンドウ]]が折衷策、セットワイズ法で呼び出し回数削減、予測付きソート(Sorting with Predictions)で低コスト比較器を前段に置く。([[LLMランキング]] / [[pairwiseランキング]] / [[LLM向け情報検索]] / sorting)
- [[joisino-LLMと言葉の感じ方-2026]] — [[佐藤竜馬]] による 2026-03-16 ブログ記事。LLM の埋め込みは人間と同様のカテゴリー分類をする一方、典型度の順位相関は 0.15 以下と乖離が大きい。非典型語ほど「〜は○○なんだよ」と鳥類であることが明言されるテキスト偏りが順位逆転を招く。次トークン予測目的は[[LLM意味表象]]の人間整合性を必ずしも高めず、表現学習(word2vec/BERT)の方が順位相関 0.3〜0.4 と高い。[[Yann LeCun]] が示唆する次トークン予測限界の傍証。([[認知意味論]] / [[プロトタイプ意味論]] / machine-learning / llm / cognitive-semantics)
- [[joisino-LLMアテンションと外挿-2025]] — [[佐藤竜馬]]([[National Institute of Informatics]])による 2025-09-29 ブログ記事。LLM の注意ヘッドを 7 種(文法・受け皿・逐次・検索・[[帰納ヘッド]]・[[関数ベクトル]]・[[反復ヘッド]])に分類し、「LLM = チューリングマシン的汎用計算装置+静的知識 DB」フレームで外挿可能性を論じる。([[機構的解釈性]] / machine-learning / llm)
- [[joisino-ICLR-2024-GNN]] — [[佐藤竜馬]] による 2024-05-15 ブログ記事。ICLR 2024 で採択された GNN 関連論文 170 本(全採択 2296 本中 7.4%)を代表トピック別に概観。解釈性・[[GNN同変性]](メタネットワークによるモデルパラメータ予測)・表現能力(WL 検査から部分グラフへ移行)・分子(基盤モデル登場)・物理シミュレーション等。GNN コア技術の成熟と応用急拡大を報告。(article / machine-learning / graph-neural-network)
- [[joisino-モデルパラメータ算術-2024]] — [[佐藤竜馬]] による 2024-01-09 ブログ記事。深層学習モデルのパラメータに算術演算を施す研究群をサーベイ。モデルスープ(Wortsman+ ICML 2022・パラメータ平均)・[[タスクベクトル]](Ilharco+ ICLR 2023・差分パラメータでタスク転移/削除/合成)・NTK 理論(Ortiz-Jimenez+ NeurIPS 2023・ファインチューニングをパルツェン窓追加として解釈)・パーミュテーション対称性と Git Re-Basin を解説。(article / machine-learning / model-merging)
- [[@2026__SREcon26 Americas__Taming the Unpredictable - Reliability in Chaos]] — [[Michelle Brush]]([[Google]])による SREcon26 Americas 2026 講演動画。AI エージェントによりソフトウェア作成が安く速くなると、ジェボンズのパラドックスで作られるものも増え、SRE が扱うシステムはより複雑になると論じる。予測困難性に対し、汎用緩和、実験、リスク先行開発、意図的仮定のコード化、継続的テストを重視する。(video / sre / aiops / reliability)
- [[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications]] — [[Ruyue Xin]]・[[Peng Chen (Xihua University)]]・[[Zhiming Zhao]]([[University of Amsterdam]] MNS / [[Xihua University]])による arXiv プレプリント(arXiv:2209.02500、2022-09-06)。勾配ベース因果構造学習(DAG-GNN)で重み付き DAG を生成し PageRank で根本原因メトリクスをランキングする [[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications|CausalRCA]] を提案。Sock-shop 13 サービスで細粒度(障害サービス内メトリクス特定)平均 AC@3=0.719、ベースライン手法比平均 17% 改善。線形・非線形両方の因果関係を捉える勾配ベース手法をマイクロサービス RCA に初めて適用。(paper / aiops / rca / causal-inference / microservices)
- [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]] — [[Xianglin Lu]]・[[Zhe Xie]]・[[Zeyan Li]] ほか([[Tsinghua University]] / [[Nankai University]] / [[BizSeer]]、[[Dan Pei]] グループ)による IEEE/ACM CCGrid 2022 論文。OLTP データベース向け教師なし根本原因箇所特定手法 **CauseRank** を提案。G-GES(グループベース因果探索)と COPP(因果指向パーソナライズド PageRank)を核とし、大規模 Oracle 本番 97 件で top-3 精度 82.5%・top-5 精度 93.8%・MAR 2.13 を達成。教師なし最良ベースライン(MicroCause)比で MAR 46.1% 改善。(paper / aiops / database / rca / causal-inference / CCGrid)
- [[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems]] — [[Canhua Wu]]・[[Nengwen Zhao]]・[[Dan Pei]] ほか([[Tsinghua University]] / [[BNRist]] / [[China Construction Bank]] / [[BizSeer]])による IEEE ISSRE 2021 論文(DOI:10.1109/ISSRE52982.2021.00020)。根本原因メトリクスの 2 要件(異常性・解釈可能性)を定義し、KS-test 粗粒度異常検知 → 1-D CNN による 13 種パターン分類 → 重み付きランキングの 3 ステップからなる **PatternMatcher** を提案。大手商業銀行 4 データセット 113 件で Avg@3=0.91 を達成し全ベースラインを上回る。本番展開済み。(paper / aiops / sre / rca / anomaly-detection / ISSRE)
- [[@2014__IEEE CLOUD__Scalability and Robustness of Time-Series Databases for Cloud-Native Monitoring of Industrial Processes]] — [[Thomas Goldschmidt]]・[[Anton Jansen]]・[[Heiko Koziolek]]・[[Jens Doppelhamer]]・[[Hongyu Pei Breivold]]([[ABB Corporate Research]])による IEEE CLOUD 2014 論文。OpenTSDB・KairosDB・Databus を AWS 最大 36 ノードでスマートグリッドワークロード(PMU Write・SmartMeter Write)により評価。KairosDB が線形スケーラビリティ(36 ノードで 403,500 値/秒)・ロバスト性・読み書き独立性のすべてで優位を示す一方、OpenTSDB は HBase のメモリ不足で測定断念、Databus は 36 ノードで線形性崩壊。産業用クラウドネイティブ時系列 DB の初の現実的ベンチマーク。(paper / database / time-series / cloud / industrial / IEEE-CLOUD)
- [[C10K-Problem]] — [[Dan Kegel]](1999〜2014、www.kegel.com)による技術記事。1台のサーバで同時 10,000 クライアントを処理するための I/O 戦略を5分類([[epoll]]・[[kqueue]]・非同期 I/O・スレッド・カーネル内サーバ)・OS別チューニング・sendfile/ゼロコピー/TCP_CORK を整理した高並行サーバ設計の古典的リファレンス。(article / networking / systems / concurrency)
- [[@1992__CACM__Parallel Database Systems The Future of High Performance Database Systems]] — [[David DeWitt]]([[University of Wisconsin-Madison]])・[[Jim Gray]](DEC)による CACM 1992年6月論文(Vol.35 No.6 pp.85–98、DOI:10.1145/129888.129894)。並列データベースシステムの基礎概念を体系化した教科書的論文。スピードアップ/スケールアップの 2 指標・startup/interference/skew の 3 脅威・シェアードメモリ/シェアードディスク/シェアードナッシングの 3 アーキテクチャ・ラウンドロビン/ハッシュ/レンジの 3 パーティショニング手法・split/merge 演算子によるリレーショナル演算子の並列化を定義。[[Teradata]](1978〜)・Tandem・Gamma・Bubba 等の当時の技術水準を横断比較し、シェアードナッシングが商業的勝者であることを実証。Grosch の法則の崩壊とコモディティハードウェアの台頭を論じた。(paper / database / parallel / shared-nothing / CACM)
- [[@2004__USENIX-ATC__Dynamic Instrumentation of Production Systems]] — [[Bryan Cantrill]]・[[Michael Shapiro]]・[[Adam Leventhal]]([[Sun Microsystems]])による USENIX ATC 2004 論文。[[DTrace]] の一次ソース。本番稼働中のシステムに対してユーザー空間・カーネル空間を統一的かつ絶対安全に動的計装する設計を初めて記述した。ゼロ・プローブ効果(無効時は影響ゼロ)・D 言語・集約機構・投機的トレースの 4 技術を核とし、SunRay サーバで gtik2_applet2 が GC 生成ループで X サーバ・OS に大量の mmap/munmap を誘発するシステミック性能問題を本番で初めて特定した事例を報告。現代 eBPF の思想的先祖。(paper / observability / instrumentation / systems)
- [[@2022__arXiv__FlashAttention - Fast and Memory-Efficient Exact Attention with IO-Awareness]] — [[Tri Dao]] ほか([[Stanford University]] / [[Together AI]])。IO-aware 厳密アテンション。タイリング+オンライン softmax+再計算で HBM 読み書きを O(N²d²M⁻¹) に削減、標準アテンション比 2-4 倍高速化・最大 20 倍メモリ節約。GPT-2 訓練 15% 高速化、長文書分類で 6.4 ポイント精度向上。(paper / arxiv / attention / gpu-optimization / io-awareness)
- [[@2023__arXiv__FlashAttention-2 - Faster Attention with Better Parallelism and Work Partitioning]] — [[Tri Dao]]([[Princeton University]] / [[Together AI]])。非 MMA FLOP 削減・シーケンス長並列化・split-Q ワープ分割で A100 利用率 50-73%、225 TFLOP/秒。FA1 比 2 倍高速化。(paper / arxiv / attention / gpu-optimization)
- [[@2024__arXiv__FlashAttention-3 - Fast and Accurate Attention with Asynchrony and Low-precision]] — [[Jay Shah]]([[Colfax Research]])・[[Ganesh Bikshandi]]([[NVIDIA]])・[[Ying Zhang]]・[[Vijay Thakkar]]・[[Pradeep Ramani]]・[[Tri Dao]]。H100 Hopper でワープ特化+TMA/WGMMA 非同期+FP8 ブロック量子化。BF16 740 TFLOP/秒(75%)、FP8 約 1.2 PFLOP/秒。数値誤差 2.6 倍改善の incoherent processing。(paper / arxiv / attention / gpu-optimization / hopper)
- [[@2026__arXiv__FlashAttention-4 - Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling]] — [[Jay Shah]]・[[Ganesh Bikshandi]]・[[Ying Zhang]]・[[Vijay Thakkar]]・[[Pradeep Ramani]]・[[Tri Dao]]。B200 Blackwell 向け。ソフトウェアエミュレート指数関数・TMEM+2-CTA MMA・CuTe-DSL。1613 TFLOP/秒(71%)。非対称ハードウェアスケーリング時代のアルゴリズム-カーネル協調設計。(paper / arxiv / attention / gpu-optimization / blackwell)
- [[@2025__arXiv__AIBrix - Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure]] — [[Jiang Xu]] ほか([[ByteDance]])。Kubernetes+Ray ハイブリッドのクラウドネイティブ LLM 推論フレームワーク。分散 KV キャッシュ(50% スループット向上・70% レイテンシ削減)、LLM 固有オートスケーリング、LoRA 管理、SLO 駆動 GPU 最適化。(paper / arxiv / llm-serving / cloud-native / kubernetes)
- [[@1993__USENIX__The BSD Packet Filter A New Architecture for User-level Packet Capture]] — [[Steven McCanne]]・[[Van Jacobson]]([[Lawrence Berkeley National Laboratory]])による USENIX Winter 1993 論文。[[BPF]](BSD Packet Filter)の一次ソース。ユーザー空間でパケットをコピーして後からフィルタリングする従来 CSPF に対し、カーネル内の小型レジスタベース VM でフィルタリングを先行させる設計により CSPF 比で最大 20 倍の高速化を達成。レジスタベース CFG・ランタイム安全検証・プロセス共有ポリシーが [[eBPF]] の直接の祖先。(paper / networking / observability / operating-systems)
- [[@2018__SoCC__Weighted Sampling of Execution Traces - Capturing More Needles and Less Hay]] — [[Pedro Las-Casas]](UFMG)・[[Jonathan Mace]](MPI-SWS)・Dorgival O. Guedes(UFMG)・[[Rodrigo Fonseca]](Brown University)による ACM SoCC 2018 論文(DOI:10.1145/3267809.3267841)。均一ランダムサンプリングが頻出正常実行に予算を費やし稀少な異常・エラートレースを見逃す問題を定式化。実行グラフのクラスタリングに基づく重み付きサンプリング(代表的サンプリング問題)で保存トレースの多様性を最大化する。現代[[トレースサンプリング]]研究の基盤文献。(paper / distributed-tracing / sampling / observability)
- [[@2023__PVLDB__TSM-Bench - Benchmarking Time Series Database Systems for Monitoring Applications]] — [[Abdelouahab Khelifati]]・[[Mourad Khayati]]・Anton Dignös・[[Djellel Difallah]]([[NYU Abu Dhabi]])・[[Philippe Cudré-Mauroux]]([[University of Fribourg]] / [[eXascaleInfolab]])による PVLDB 2023 論文(Vol.16, pp.3363–3376)。監視アプリケーション向け TSDB を最初に包括評価したベンチマーク。8 TSDB(InfluxDB・TimescaleDB ほか)× 7 クエリタイプ × TS-LSH 合成データ生成の評価基盤を構築。単一 TSDB が全ワークロードで最優秀になることはなく、ワークロード特性によって最適 TSDB が異なることを実証。(paper / database / time-series / benchmark)
- [[@2022__PVLDB__Anomaly Detection in Time Series - A Comprehensive Evaluation]] — [[Sebastian Schmidl]]・[[Phillip Wenig]]・Thorsten Papenbrock([[Hasso Plattner Institute]]、University of Potsdam / Philipps University of Marburg)による PVLDB 2022 論文(Vol.15, pp.1779–1797、DOI:10.14778/3538598.3538602)。71 手法 × 976 データセットを網羅する時系列異常検知ベンチマーク([[TimeEval]])と合成データ生成ツール([[GutenTAG]])を開発・公開。深層学習手法がコスト増に見合う精度優位を示せないこと、単一万能アルゴリズムが存在しないこと、DWT-MLEAD がコスト/性能比で最優秀(AUC-ROC 83%、2.2 ms/点)であることを実証。(paper / anomaly-detection / time-series / benchmark)
- [[@2022__arXiv__PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting]] — [[Hao Xue]]・[[Flora Salim]]([[University of New South Wales]])による arXiv 論文(2210.08964、18p、2022-10-17、v5 2023-12-10、IEEE TNNLS 掲載)。時系列予測の入出力を自然言語文に変換し、言語モデルで sentence-to-sentence に予測する **PromptCast** パラダイムを最初に提案。Bigbird/Bart/LED 等のファインチューニング言語モデルが Transformer/Informer/Autoformer 等の数値専用モデルと同等以上の RMSE・MAE、ゼロショット設定では数値モデルを大幅に上回る汎化を達成。[[PISA]] データセット(311,932 件・気温(CT) / 電力(ECL) / 人流(SG) の 3 サブセット)を公開。GPT-3.5 はゼロショット精度が数値モデルより劣りコストが高い。LLM×時系列の最初期ベンチマーク。(paper / time-series / llm)
- [[@2023__NeurIPS__Large Language Models Are Zero-Shot Time Series Forecasters]] — [[Nate Gruver]]・[[Marc Finzi]]・[[Shikai Qiu]]([[New York University]])・[[Andrew Gordon Wilson]]([[New York University]] / [[Carnegie Mellon University]] 訪問)による NeurIPS 2023 論文(arXiv:2310.07820、30p、2023-10-11)。数値をテキストの桁列としてエンコードする [[LLMTime]] により、GPT-3・LLaMA-2 70B が訓練なしにゼロショット時系列予測でき、Darts/Monash/Informer の 3 ベンチマーク(計 29 データセット)で ARIMA・TCN・N-HiTS 等の専用モデルと同等以上の MAE・CRPS を達成。**LLM の簡潔性バイアス(Occam's razor prior)と反復バイアス**が季節性・トレンドの構造と一致するため外挿が機能。**GPT-4 は GPT-3 より悪化**(トークン化変更と RLHF による不確実性較正の劣化)。欠損値は `NaN` テキストとして補完なしで扱える。MMLU 推論能力と予測性能が正の相関を示すが、RLHF 等のアライメント処理は性能を悪化させる。(paper / time-series / llm / zero-shot)
- [[@2023__NeurIPS__One Fits All - Power General Time Series Analysis by Pretrained LM]] — [[Tian Zhou]]・[[Rong Jin]]・[[Liang Sun]] ほか [[Alibaba DAMO Academy]] による NeurIPS 2023 論文(arXiv:2302.11939、34p、2023-02-23)。GPT-2 の self-attention・feedforward 層を凍結したまま位置埋め込み・正規化のみ学習する [[Frozen Pretrained Transformer]](FPT)で、時系列分析の主要 7 タスク(分類・異常検出・補完・短期/長期予測・few-shot/zero-shot 予測)で SOTA または同等を達成。学習可能パラメータは全体の 4.6〜6.12% にとどまり TimesNet(42M)に対し計算優位。**画像事前学習(BEiT)からの転移も有効**で、GPT-2 が cross-domain 転移の本質ではなく事前学習トランスフォーマーの汎ドメイン性が鍵。**self-attention の勾配最小化が PCA と等価**という理論的根拠を提示。GPT-2(3) FPT が異常検出 F1=86.72%(TimesNet 比 +1.7%)、分類精度 74.00%(+0.4 ポイント)。LLM×時系列の Aligning アプローチ代表。(paper / time-series / llm / transfer-learning)
- [[@2024__arXiv__A Decoder-Only Foundation Model for Time-Series Forecasting]] — [[Abhimanyu Das]]・Weihao Kong・[[Rajat Sen]]・Yichen Zhou([[Google Research]])による arXiv 論文(2310.10688、21p、2023-10-16、ICML 2024 採録)。**[[TimesFM]]** の原論文。decoder-only アテンションモデル + パッチ入力 + **出力パッチ長 > 入力パッチ長**(自己回帰ステップ数削減・可変ホライズン対応)を組み合わせた 200M パラメータの時系列基盤モデル。事前学習コーパスは Google Trends(約 0.5B 点)+ Wikipedia ページビュー(約 300B 点)+ 合成データで計約 100B 時系列点。Monash/Darts/ETT 等で教師あり SOTA(PatchTST・N-BEATS・DeepAR)にゼロショットで肉薄。17M/70M/200M の 3 サイズで FLOPS に対しモデル誤差が単調減少する**スケーリング予兆**を提示し、[[Toto|Toto 2.0]](4M〜2.5B)に続く TSFM スケーリング則研究の前史を成す。(paper / time-series / foundation-model / scaling)
- [[@2024__arXiv__Chronos Learning the Language of Time Series]] — [[Abdul Fatir Ansari]]・[[Lorenzo Stella]] ら([[AWS AI Labs]])による arXiv 2024 論文(arXiv:2403.07815、TMLR 2024 採録)。時系列値を平均スケーリング + 均一量子化($B=4096$ ビン)でトークナイズし、T5/GPT-2 そのままで確率的予測基盤モデルを学習する **Chronos** フレームワークを提案。事前学習には実データ 28 データセット(〜890K 系列・84B 点)とガウス過程カーネルを組み合わせた合成データ **KernelSynth** を使用し、訓練時データ拡張 **TSMixup**(複数系列の凸結合)を導入。**Benchmark I**(15 in-domain データセット)と **Benchmark II**(27 ゼロショットデータセット)の 42 データセット包括ベンチで、ゼロショットのみの Chronos(T5-Large 710M)が専用訓練モデルを含む多くのベースラインに匹敵または凌駕した。**LLM 重みで初期化してもランダム初期化と有意差なし**という意外な知見も報告。(paper / time-series / foundation-model / tokenization)
- [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]] — [[Zhen Liu]]・[[Qianli Ma]]・[[Min Wu]] ほか([[South China University of Technology]] / [[Institute for Infocomm Research]] / [[Tianjin University]])による techRxiv プレプリント(DOI:10.36227/techrxiv.176978429.90235801/v2、24p、2026-02-11)。TSFM を「データセット — 事前学習 — 事後学習」の 3 次元タクソノミーで体系化した初の包括サーベイ。既存サーベイ 7 本(Table I)が事前学習と規則時系列に偏ることを指摘し、事後学習と不規則時系列を扱う唯一の survey と位置づける。事後学習を SFT(partial/full)・協調(PLC: LoRA/Adapter、MLC: CLIP 流多モーダル、HLC: 知識蒸留)・強化(reasoning-driven GRPO / non-reasoning PPO・DPO)の 3 パラダイムで整理し、TimeMaster・LangTime・TPO 等を代表例として収録。Table III(33 ソースデータセット)・Table IV(33 既存 TSFM)・Table V(ターゲットデータセット)・Table VI(事後学習パラダイム比較)を提供。code: github.com/ZLiu21/awesome-tsfms-from-pre-training-to-post-training。(time-series / foundation-models / post-training / survey / paper)
- [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]] — [[Emaad Khwaja]]・[[Chris Lettieri]]・[[Gerald Woo]] ほか [[Datadog]] AI Research / [[Carnegie Mellon University]] による arXiv テクニカルレポート(arXiv:2605.20119、19p、2026-06-05)。TSFM で初めて信頼できるスケーリング則を実証(4M〜2.5B で単調改善・飽和なし)。主要革新は [[Contiguous Patch Masking]](CPM、シングルパス推論)・[[NorMuon]](per-neuron 正規化 Muon、ピンボール損失との相性改善)・[[u-μP]] ハイパーパラメータ転移(10M プロキシから全 5 サイズへゼロショット転移)。公開データを事前学習に使わず BOOM・GIFT-Eval・TIME 全ベンチで SOTA。dd_unit_scaling ライブラリ(Apache 2.0)も公開。(time-series / scaling / paper)
- [[@2025__WWW Companion__RCAEval - A Benchmark for Root Cause Analysis of Microservice Systems with Telemetry Data]] — [[Luan Pham]]・[[Hongyu Zhang]]・[[Huong Ha]]・[[Flora Salim]]・[[Xiuzhen Zhang]]([[RMIT University]] / [[University of Newcastle]] / [[University of New South Wales]])による WWW Companion 2025 論文(4p, DOI:10.1145/3701716.3715290)。マイクロサービス RCA の公開ベンチマーク [[RCAEval]] を提示し、3 マイクロサービスシステム([[Online-Boutique]] 12 サービス / [[Sock Shop]] 15 サービス / [[Train-Ticket]] 64 サービス)から計 735 ケース・11 種障害(リソース 4・ネットワーク 2・コードレベル 5)の 3 データセット(RE1/RE2/RE3)を構築。メトリクス・ログ・トレースの 3 モダリティを統合し、コードレベル障害を扱う最初の RCA データセットを主張。15 ベースライン(メトリクス系・トレース系・マルチソース系)を統一フレームワークで横並び評価可能にした。Train Ticket / RE2 / 6 障害の予備実験では BARO がリソース系で強く DELAY/LOSS で弱く、TraceRCA がネットワーク障害で BARO を上回る。多くのマルチソース版が単独メトリクス版より劣る現象も定量化。(aiops / microservices / benchmark / paper)
- [[@2026__FSE__Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems]] — [[Fiza Husain]]・[[Anson Bastos]]・[[Anjaly Parayil]]・[[Ayush Choure]]・[[Chetan Bansal]]・[[Rujia Wang]]・[[Saravan Rajmohan]]([[Microsoft]])による FSE 2026 industry track 論文(arXiv:2510.20640、12p、2025-10-23)。Microsoft 本番のクラウドモニタについて「与えられたメトリクスをどのディメンション部分集合で集約してアラートを出すか」を、モニタ・メトリクス・ディメンションのヘテロジニアスエンティティグラフ(モニタ 18,291・メトリクス 4,623・ディメンション 8,356)上のランキング問題として定式化。マルチヘッド注意の HGNN にランダムウォーク経路への注意(RWA)と注意ヘッド整列損失を加えた [[@2026__FSE__Attention Enhanced Entity Recommendation for Intelligent Monitoring in Cloud Systems|DiRecGNN]] を提案し、SAGEConv 等の最良ベースラインに対し HR@1 +55.8%・NDCG@k +69.2%・Recall@5 +43.02%・MRR +43.1% を達成(Table 2)。RWA は低次数(sparse)領域で性能ゲインが大きく(Figure 7a)、スケールはノード数に対し線形(Figure 7b)。10 名のサービスオーナー構造化インタビューで有用性平均 4.5/5、全員が「類似モニタを添えた説明」と end-to-end 自動化を望むことが分かった。[[@2024__ICSE-SEIP__Intelligent Monitoring Framework for Cloud Services - A Data-Driven Approach]] のメトリクス選定の続編に位置づく。(paper / aiops / cloud-monitoring / graph-neural-network / recommendation)
- [[@2026__FSE__TSGuard - Automated User-Centric Incident Diagnosis for AI Workloads in the Cloud]] — [[Yitao Yang]]・[[Yangtao Deng]]・[[Yifan Xiong]]・[[Baochun Li]]・[[Hong Xu]]・[[Peng Cheng]]([[The Chinese University of Hong Kong]] / [[Microsoft Research]] / [[University of Toronto]])による FSE 2026 論文(Proc. ACM Softw. Eng. Vol.3 No.FSE Article FSE012、24p、DOI:10.1145/3797149、arXiv:2506.01481)。AI ワークロード基盤のインシデントを user-centric paradigm で診断する多エージェントシステム [[TSGuard]] を提案。Microsoft Azure 本番 1 年データ(778 件)で median TTM 52.5 時間・GPU 関連 52.47%・recurrence 8.78 という分布を実証し、過去事例 DB(quick)・階層タクソノミー 6/28/97(slow)・探索(deep)の 3 段パイプラインを 5 エージェント(Summarization/Planning/Execution/Reflection/Conclusion)で回す。テスト 208 件で Micro F1=0.854・Macro F1=0.816、RCACopilot 比 Micro +19.8%・Macro +43.6%、検証時間 -63.4%(304s vs CVD 830s)を達成。Qwen2.5-72B 等 open-source LLM でも GPT-4o とほぼ同等。pre-ticket interception layer として user 側で動かす設計が paradigm shift の核心。(aiops / llm-agent / incident-management / gpu / paper)
- [[@2024__NSDI__Characterization of Large Language Model Development in the Datacenter]] — [[Qinghao Hu]]・[[Zhisheng Ye]]・[[Zerui Wang]]・[[Guoteng Wang]]・[[Meng Zhang]]・[[Qiaoling Chen]]・[[Peng Sun]]・[[Dahua Lin]]・[[Xiaolin Wang]]・[[Yingwei Luo]]・[[Yonggang Wen]]・[[Tianwei Zhang]]([[Shanghai AI Laboratory]] / [[Nanyang Technological University]] / [[Peking University]] / [[Shanghai Jiao Tong University]] / [[SenseTime Research]] / [[The Chinese University of Hong Kong]])による NSDI '24 論文(22p, USENIX <https://www.usenix.org/conference/nsdi24/presentation/hu>)。[[Shanghai AI Laboratory]] の LLM 専用 GPU データセンター [[Acme]](Seren 2,288 + Kalos 2,416 = 4,704 A100、2023-03〜08)の 6 か月本番トレースを既存 DNN クラスタ([[Philly]]/[[Helios]]/[[Alibaba PAI|PAI]])と同一指標で並べ、GPU ジョブ中央値 2 分・利用率の 0%/100% 二極化・Pretraining が件数 0.9〜3.2% で GPU 時間 69.5〜94.0%・Evaluation 最長キュー遅延・Infrastructure 障害が件数 11% で GPU 時間 82%超(NVLinkError 30.25%・CUDAError 15.77%・NodeFailure 14.30%・ECCError 11.00%)を実測。観測から [[InternEvo]] に Fault-tolerant Pretraining(async checkpointing で 3.6〜58.7× 削減、Log Agent + Failure Agent + Vector Store + 2 段階 NCCL allgather test、手動介入 ~90% 削減)と Decoupled Scheduling for Evaluation(model load 分離・metric 計算の CPU ジョブ化・prior-based elastic scheduling、makespan 1.3〜1.8× 短縮)を実装。[[AcmeTrace]] を公開。(machine-learning systems / distributed / aiops / paper)
- [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]] — [[Junjie Chen]]([[Tianjin University]] / [[Microsoft]] 訪問)・[[Shu Zhang]]・[[Xiaoting He]]・[[Qingwei Lin]](対応著者)・[[Hongyu Zhang]]([[University of Newcastle]])・[[Dan Hao]]([[Peking University]])・[[Yu Kang]]・[[Feng Gao]]・[[Zhangwei Xu]]・[[Yingnong Dang]]・[[Dongmei Zhang]] による ASE 2020(DOI:10.1145/3324884.3416624、12p)。[[Microsoft]] の 18 大規模オンラインサービスシステムの 6 か月分インシデントを分析し、incidental incidents が平均 50.32%・TTR の 55.05% を消費するという「半数以上が無視してよい」構造を初めて定量化。incidental の 6 カテゴリ(by design / customer error / won't fix / unable to reproduce / transient / false alarm)を導出し、[[DeepIP]](attention 付き CNN + 関連 incident 取り込み)で AUC 0.808 を達成、bug severity prediction 流用ベースライン(Rule 0.624 / Bayes 0.586)を 18 全システムで上回る。Mozilla データセット転用でも SOTA を P+41.00%・R+10.29% で改善。(aiops / incident-management / paper)
- [[@2021__J Grid Computing__Automated Analysis of Distributed Tracing - Challenges and Research Directions]] — [[Andre Bento]]・[[Jaime Correia]]・[[Ricardo Filipe]]・[[Filipe Araujo]]・[[Jorge Cardoso]]([[University of Coimbra]] / [[Huawei Munich Research Center]])による Journal of Grid Computing Vol.19 Article 9(2021、DOI:10.1007/s10723-021-09551-5、15p)。OpenTracing 準拠の分散トレースから [[OpenTracing Processor]] で service metrics(in/out 呼数・平均応答時間)・dependency graph・work-flow を抽出し、Isolation Forest で異常時間枠/サービスを位置づけるパイプラインを提案。Huawei Cloud OpenStack の本番トレース 2 日分(190K–240K spans/日)で検知に成功する一方、ゲートウェイ計装欠落で work-flow 深掘りが頓挫し、「精緻なアルゴリズムよりトレース品質改善が先」と診断。temporal coverage(子スパン合計/親スパン)を品質指標として導入し、OpenTracing 仕様の限界(タイムスタンプ単位非明示・annotation 任意性・testability 欠如)を data sufficiency / ontological / tools の 3 類型で体系化。後継 OpenTelemetry も「merge 努力が主で testability driver の再設計が薄い」と批判する。(distributed tracing / observability / aiops / paper)
- [[@1992__CMU SEI__A Conceptual Framework for System Fault Tolerance]] — [[Walter Heimerdinger]]([[Honeywell]])・[[Charles Weinstock]]([[Software Engineering Institute]])による SEI Technical Report CMU/SEI-92-TR-033(1992年10月、44p)。フォールトトレランスの概念フレームワークを提案し、fault/failure/symptom の定義、ディペンダビリティ達成の4手段(障害回避・障害除去・フォールトトレランス・障害回避的措置)、障害クラス分類(所在・影響・持続時間・直接原因・究極原因)、冗長性管理の6アクション(検知・診断・封じ込め・マスキング・補償・修復)、障害封じ込め領域、設計多様性、カバレッジを体系化。フォールトトレラントシステム設計の6規則を提示。(fault-tolerance / dependability / systems)
- [[A Survey of Online Failure Prediction Methods]] — [[Felix Salfner]]・[[Maren Lenk]]・[[Miroslaw Malek]]([[Humboldt University of Berlin]])による ACM Computing Surveys 2010 サーベイ(Vol.42 No.3 Article 10、DOI:10.1145/1670679.1670680、42p)。オンライン障害予測を設計時 reliability prediction と root cause analysis から明確に分離し、入力データ系統で 4 主要枝(failure tracking / symptom monitoring / detected error reporting / undetected error auditing)・26 サブカテゴリへ約 50 手法を写像する taxonomy を構築。fault/error/symptom/failure の 5 段階モデル(Avižienis 2004 に symptom と undetected/detected 区別を加えた拡張)と (`t_d, t_l, t_p, t_w`) 4 パラメータでの時間軸定式化、稀事象に対する評価指標(precision/recall, F-measure, ROC/AUC, contingency table)を標準化。proactive fault management の 4 段階(予測 → 診断 → アクションスケジューリング → 実行)を Figure 2 で整理し、本論文はそのうち予測のみを扱う。後続の AIOps サーベイ([[A Survey of AIOps Methods for Failure Management]] [[A Survey of AIOps in the Era of Large Language Models]])の語彙的・概念的源流。(dependability / aiops / failure-prediction / survey)
- [[@2018__CNCF WG Serverless__Serverless Overview Whitepaper v1.0]] — [[CNCF]] WG Serverless が 2018 年に策定したサーバーレスコンピューティングの概念定義・ユースケース・Function 仕様・エコシステム勧告白書(v1.0)。FaaS+BaaS の 2 要素、ゼロサーバーオプス・アイドル時課金なしの 2 大メリット、CaaS/PaaS との 3 択比較(制御粒度・運用負荷・課金粒度)、n:m イベント-Function マッピング、Function Workflow の 5 パターン・6 状態、CNCF 勧告 7 点(相互運用性 API・OSS ツール・セキュリティガイダンス等)を体系化。コールドスタート・デバッグ困難・標準化不足を 2018 年時点の主要課題として明示。(cloud / serverless / whitepaper)
- [[@2019__TCC__Cloud Container Technologies - A State-of-the-Art Review]] — [[Claus Pahl]]([[Free University of Bozen-Bolzano]])・[[Antonio Brogi]]・[[Jacopo Soldani]]([[University of Pisa]])・[[Pooyan Jamshidi]]([[Carnegie Mellon University]])による IEEE Transactions on Cloud Computing 2019 論文(DOI:10.1109/TCC.2017.2702586、16p)。2007-2016 年のクラウドコンテナとオーケストレーション研究を 46 件の primary studies で体系的にマッピング(SMS)した初の secondary study。Technology Stack・Management Services・Architecture Setting・Tools/Platforms/Technology の 4 軸分類フレームワークを RQ1-RQ4 と整合して構築。Docker・LXC が支配的・Kubernetes・CoreOS・OpenVZ・Diego・Rocket が次点。Solution proposal 中心の formative stage で、IaaS と PaaS がほぼ均等、デプロイ容易性が動機の主、品質関心は performance/resource utilisation/startup time/elasticity に集中。Borg の限界として障害管理(failure management)を未開拓と明示。(cloud / container / orchestration / systematic-mapping)
- [[A Survey of AIOps Methods for Failure Management]] — [[Paolo Notaro]]・[[Jorge Cardoso]]・[[Michael Gerndt]]([[TU Munich]] / [[Huawei Munich Research Center]] / [[University of Coimbra]])による ACM TIST 2021 サーベイ(DOI:10.1145/3483424、45p)。AIOps の Failure Management 領域を proactive(prevention・online prediction)/reactive(detection・RCA・remediation)の 2 軸 × 5 カテゴリ・14 サブカテゴリで整理し、1,086 件中 100 件を AI 手法・データソース・対象構成要素・定量結果で索引化。研究密度は detection 33.7% / RCA 26.7% / online prediction 26.4% に集中する一方、prevention 10.6%・remediation 2.5% は薄い。マルチモーダル化と recovery 自動化、ベンチマーク確立を将来課題に挙げる。
- [[@2018__TNSM__Mining Causality of Network Events in Log Data]] — [[Satoru Kobayashi]]・[[Kazuki Otomo]]・[[Kensuke Fukuda]]・[[Hiroshi Esaki]]([[University of Tokyo]] / [[National Institute of Informatics]])による TNSM 2018 論文(DOI:10.1109/TNSM.2017.2778096)。[[SINET4]](日本全国研究教育ネットワーク)の 15 ヶ月・35M 件 syslog から PC アルゴリズム + G-square 条件付き独立性検定で因果 DAG を抽出。フーリエ+線形回帰の周期フィルタが 93% のメッセージを除去し、後処理の頻出エッジ除去(上位 5%)でトラブルチケット 74% に対応するエッジを 5.3 エッジ/日に絞り込む。スパース二値データに対して G-square が Fisher-Z より偽陽性率・処理速度で優位(network / log-analysis / causal-inference)
- [[@2011__SRDS__Identifying Faults in Large-Scale Distributed Systems by Filtering Noisy Error Logs]] — [[Xiang Rao]]・[[Huaimin Wang]] ほか([[National University of Defense Technology]] / [[Alibaba Cloud]])による IEEE 2011 論文。大規模分散システムの障害注入テストで発生するノイズログ(ランダムハードウェア障害・バグ・設定誤り・ログ重大度誤設定の 4 種)が障害特徴抽出を誤導する問題を定量化し、Haar ウェーブレット + DTW 類似度ベースのフィルタリング手法 SBF を提案。100 ノードクラスタ・2,800,973 ログで適合率 96%・再現率 94% を達成(ベースライン CFC は 500 秒 window で再現率 30%)。
- [[@2020__SoCC__ByteSeries - An In-Memory Time Series Database for Large-Scale Monitoring Systems]] — [[Xuanhua Shi]] ほか([[Huazhong University of Science and Technology]] / [[ByteDance]] / [[National University of Singapore]] / [[University of Copenhagen]])による SoCC 2020 論文(DOI:10.1145/3419111.3421289)。[[ByteDance]] 本番監視 100 億次元超でメタデータがメモリ 80% 超を占める問題を解析し、Compressed Inverted Index(trie + p4nzenc64)と 3 段メモリ構造(Active Buffer→Static Segment→Compressed Segment)を持つインメモリ TSDB [[ByteSeries]] を提案。元本番システム [[tsdc]] 比でメタデータ −60%・全体メモリ −50%・多次元クエリ 1.8〜10.7 倍高速化、[[Prometheus]] 比で同メモリで 7 倍多い次元数を処理。
- [[@2020__SAC__Black-box inter-application traffic monitoring for adaptive container placement]] — [[Francisco Neves]]・[[Ricardo Vilaça]]・[[José Pereira]]([[HASLab]]-INESC TEC / [[University of Minho]])による SAC 2020 論文(DOI:10.1145/3341105.3374007)。eBPF の kprobe カーネル内集約(KernelAgg)で 9% 未満のオーバーヘッドで Cassandra+Spark コンテナ間トラフィックの重み付き通信グラフを構築。UserAgg は 68% 低下、Scope 方式は 1% だがトラフィック量不可計測。自動配置(Pyevolve 遺伝的アルゴリズム)で Q1 −28%、Q2 −40%; 手動配置で Q1 −99.3%・実行時間 −12%、Q2 −73%・実行時間 −29%
- [[@2015__VLDB__Gorilla - A Fast, Scalable, In-Memory Time Series Database]] — [[Tuomas Pelkonen]] ほか([[Facebook]])による VLDB 2015 論文(DOI: 10.14778/2824032.2824078)。20 億の一意時系列・毎秒 1,200 万点を処理する Facebook のインメモリ TSDB [[Gorilla]] を提案。デルタ・オブ・デルタ(タイムスタンプ 96% を 1 ビット)と XOR 浮動小数点(値 51% を 1 ビット)で 12 倍圧縮(1.37 バイト/点)を達成し、HBase 比クエリレイテンシ 73 倍削減。直近 26 時間を write-through キャッシュとして RAM に全量保持、2 リージョン並行ストリーミングで地理障害を透過的に処理。
- [[@2025__SIGMOD__B-Trees Are Back - Engineering Fast and Pageable Node Layouts]] — [[Marcus Müller]]・[[Lawrence Benson]]・[[Viktor Leis]]([[TU Munich]])による SIGMOD/PACMMOD 2025 論文。可変長レコードを支援する可ページング [[B-Tree]] で、prefix truncation・heads・hints・fingerprinting・semi/fully dense leaves を分解評価し、key shape と scan 頻度で leaf layout を切り替える適応 B-Tree を提案。FDL は 100% dense integer で lookup +71%・insert +213%・scan +105%、adaptive B-Tree は ART/HOT/Wormhole/LITS と比較して scan で強く、[[vmcache]] 統合により out-of-memory でも baseline を大きく上回る場合がある。
- [[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]] — [[Lu Dai]]・[[Liang Sun]]・[[Fanpu Cao]]・[[Ziyang Rao]]・[[Cehao Yang]]・[[Hao Liu]]・[[Hui Xiong]]([[Hong Kong University of Science and Technology]] / [[Hong Kong University of Science and Technology, Guangzhou]])による SIGIR 2026 視点論文。LLM が検索結果の消費者になることで、情報検索の主目的は raw recall から、文脈ウィンドウ内の利用可能な証拠密度と検証可能性へ移ると主張。NQ 500 サンプル実験では、金 3 件にノイズ 7 件を足すと EM が 41.8% へ低下し、純ノイズ文脈では 8.0% まで悪化。Controlled Indexing / Robust Retrieval / Context Assembly / Retrieval Verification / Closed-Loop Training の 5 段タクソノミーを提示。
- [[@2025__SIGMOD__Rethinking The Compaction Policies in LSM-trees]] — [[Hengrui Wang]]・[[Jiansheng Qiu]]・[[Fangzhou Yuan]]・[[Huanchen Zhang]]([[Tsinghua University]]、[[Shanghai Qi Zhi Institute]])による SIGMOD/PACMMOD 2025 論文。LSM ツリーのコンパクションを将来の平均クエリスループットへの CPU/I/O 投資として捉え直し、三レベルモデルと動的計画法ベースの [[EcoTune]] を提案。[[RocksDB]] 評価で Leveling 比 1.5〜3 倍、Lazy Leveling 比最大 1.8 倍の平均クエリスループットを達成。
- [[@2025__arXiv__Humanity's Last Exam]] — [[Long Phan]]・Alice Gatti・Ziwen Han・Nathaniel Li(共同第一著者)・[[Dan Hendrycks]](上級著者)ほか、[[Center for AI Safety]] / [[Scale AI]](arXiv:2501.14249、2025-01-24)。飽和した既存ベンチマーク(MMLU 等)を超える最前線学術ベンチマーク HLE を提案。50 か国・500+ 機関・約 1,000 名の専門家が 100+ 科目・2,500 問を設計し、LLM 難易度チェック→専門家 2 段階レビューを経た。最先端モデルでも正解率は最高 13.4%(o3-mini high)にとどまり、全モデルで RMS キャリブレーション誤差 73〜89% と高い。
- [[@2024__arXiv__Chatbot Arena - An Open Platform for Evaluating LLMs by Human Preference]] — [[Wei-Lin Chiang]]・[[Lianmin Zheng]] ほか [[LMSYS]]/UC Berkeley による arXiv 2024 論文(arXiv:2403.04132)。クラウドソーシング型ペアワイズ比較で LLM を評価するオープンプラットフォーム [[Chatbot Arena]] を提案。Bradley-Terry モデルで統計的ランキング、能動サンプリングで最大 54% 少ない投票数で同等精度、240K 票・90K ユーザー・50+ モデルで検証。クラウド投票と専門家評価の一致率 72〜83%。
- [[@2023__CNCF TAG Observability__Observability Whitepaper]] — [[CNCF]] [[TAG Observability]] が 35+ 名の貢献者とともに策定したクラウドネイティブオブザーバビリティのホワイトペーパー(v1.0、2023 年 10 月)。制御理論的定義・5 シグナル(メトリクス・ログ・トレース・プロファイル・ダンプ)・シグナル間相関機構(ターゲットメタデータ統一・Exemplar・Trace ID 付与)・SLO ベースバーンレートアラートの定量化・エコシステムギャップ 4 点を体系化。[[OpenTelemetry]] を計装・収集の業界標準として位置づける。
- [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]] — [[Suman Karumuri]]([[Slack Technologies]])・[[Franco Solleza]]・[[Stan Zdonik]]([[Brown University]])・[[Nesime Tatbul]](Intel Labs/MIT) による SIGMOD Record 2021 ビジョン論文(DOI:10.1145/3456859.3456863)。オブザーバビリティを「データ管理問題」として最初に体系的に定式化し、MELT(Metrics/Events/Logs/Traces)の 4 類型が異なるデータモデル・クエリ・ストレージを要することを Slack の実測データで示す。クエリの 97% 超が <24h データを対象とする強い鮮度バイアス(表2)を実証し、ODMS 設計 4 原則と Real-Time Indexing → Persistent Storage → Hot Data Cache のポリストア型アーキテクチャを提案する。
- [[@2020__arXiv__Scaling Laws for Neural Language Models]] — [[Jared Kaplan]]・Sam McCandlish ほか [[OpenAI]] による arXiv 2020 論文(arXiv:2001.08361、2020-01-23)。Transformer 言語モデルの損失がモデルパラメータ数 $N$・データ量 $D$・計算量 $C$ に対してべき乗則でスケールすることを 7 桁以上の範囲で実証。$\alpha_N \approx 0.076$、$\alpha_D \approx 0.095$、$\alpha_C^{\min} \approx 0.050$。アーキテクチャ詳細への弱依存を定量化し、計算効率最適の訓練は $N_{\text{opt}} \propto C^{0.73}$ の大きなモデルを早期停止で訓練すべきと結論した。
- [[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling]] — [[Tom Henighan]]・[[Jared Kaplan]] ほか [[OpenAI]] による arXiv 2020 論文。スケーリング則 $L(x) = L_\infty + (x_0/x)^{\alpha_x}$ が画像・動画・マルチモーダル・数学的問題求解に成立することを実証し、最適モデルサイズの指数 $\beta \approx 0.7$ が全モダリティで普遍的に一定であることを発見。損失の情報理論解釈(低減不可能損失 = エントロピー、低減可能損失 = KL ダイバージェンス)を提案し、生成損失の不可逆損失への接近が下流タスク性能の頭打ちを意味しないことを示した。
- [[@2024__arXiv__DeepSeekMath - Pushing the Limits of Mathematical Reasoning in Open Language Models]] — [[DeepSeek-AI]] / [[Tsinghua University]] / [[Peking University]] による arXiv 2024 論文。7B モデル DeepSeekMath 7B を提案し、外部ツールなしで MATH 51.7%(Self-consistency 64 サンプルで 60.9%)を達成。fastText 反復収集による 120B 数学トークンの DeepSeekMath Corpus と、価値モデルを廃して グループ内報酬正規化でアドバンテージを推定する [[GRPO]](Group Relative Policy Optimization)を貢献として提示する。DeepSeek-Coder-Base-v1.5 7B をベースに数学 56%・コード 20%・自然言語 10%・arXiv 10%・AlgebraicStack 4% の混合比で継続事前学習し、コード×数学の相乗効果を実証。7B で Minerva 540B を上回り、[[GRPO]] は後続の [[DeepSeek-R1]](671B MoE)まで標準アルゴリズムとして継承
- [[@2026__arXiv__From Detection to Recovery - Operational Analysis on LLM Pre-training with 504 GPUs]] — [[Daemyung Kang]] ほか [[Lablup Inc]] による arXiv 2026 / Lablup Technical Report。63 ノード・504 NVIDIA B200 GPU の本番クラスタで、55 日の Prometheus 時系列、73 日の運用ログ、224 マルチノード訓練セッションを分析。751 メトリクスと 10 XID 同定 GPU 障害では単一支配メトリクスがなく、523 checkpoint events では restart load が最大 read 帯域の 21.5%、save burst が write 帯域の 16.0%、WRITE RPC queue time が 93.1% を占める。224 セッションのノード除外は上位 3/63 ノードが 50% 超、自動リトライは 12 チェーンで成功率 33.3%
- [[@2023__NSDI__Empowering Azure Storage with RDMA]] — [[Wei Bai]] ほか [[Microsoft]] による NSDI 2023 論文。[[Azure Storage]] のフロントエンド/バックエンド通信を [[RDMA]] 化し、RoCEv2、PFC/DCQCN、[[SONiC]]、[[RDMA Estats]]、sU-RDMA/sK-RDMA を組み合わせてリージョン内規模で展開した経験を報告。2023年2月時点で Azure パブリックリージョンのトラフィックの約70%が RDMA となり、全 Azure パブリックリージョンでリージョン内 RDMA をサポート。1MB I/O では read 23.8%・write 15.6% のレイテンシ削減、ホストドメイン CPU 最大 34.5% 削減を示す
- [[@2026__SIGMOD Companion__Aurora PostgreSQL Limitless Database - Building a Highly Scalable OLTP Database]] — [[Dmitry Arkhangelskiy]] ほか [[Amazon Web Services]] による SIGMOD Companion 2026 論文。[[Aurora Limitless Database]] を、ルータ群と PostgreSQL シャード群で構成される分散 OLTP データベースとして報告。Amazon Time Sync による時刻ベース MVCC、lead shard 付き 2PC、Aurora Serverless V2 とシャード分割を組み合わせる適応スケーリング、DDL/バックアップ/クエリ pushdown まで含む PostgreSQL 互換の水平スケーリング設計を提示。HammerDB では 8 ルータ・16 シャード・3072 ACU で 2,891,718 NOPM・NEWORD 平均 9.72ms
- [[Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications]] — [[Jacopo Soldani]]・[[Antonio Brogi]]([[University of Pisa]])による ACM Computing Surveys 2021 サーベイ。マルチサービスアプリケーションの異常検知(25 手法)と根本原因分析(26 手法)の両者を統合した最初のサーベイ。データ源(ログ/分散トレース/監視メトリクス)× 手法(教師なし/教師あり/トレース比較/SLO チェック/ハートビート)の 2 軸分類と、PC アルゴリズム + ランダムウォークによる古典的 RCA パイプラインを体系化。説明可能性・対策推奨・継続的変化への対応を未解決課題として提示する
- [[@2024__ASE__Root Cause Analysis for Microservices based on Causal Inference - How Far Are We]] — [[Luan Pham]]・[[Huong Ha]]([[RMIT University]])・[[Hongyu Zhang]]([[Chongqing University]])による ASE 2024 論文。9 種の因果探索手法と 21 種の因果推論ベース RCA 手法を合成 6 + 実 4 データセットで包括評価し、Dummy(ランダム選択)ベースラインを初めて導入。PC/FCI/Granger 系の多くが Dummy 同等、BARO・CausalRCA・RCD・CIRCA・NSigma が最良と判明。合成データでの性能は実システムを反映しないという警告と 7 つの今後の研究方向を提示。評価フレームワーク [[RCAEval]] をオープンソースで公開
- [[Anomaly detection and root-cause identification in microservices]] — [[Luís M. Barata]]・[[Sérgio Sequeira]]・[[Eurico Lopes]]・[[Pedro R. M. Inácio]]・[[Mário M. Freire]] による [[Cluster Computing]] 2026 サーベイ。2012〜2025 年のマイクロサービス異常検知・根本原因特定研究を、ログ/トレース/監視メトリクス、教師なし/教師あり/統計/トレース比較、機械学習/グラフ/統計 RCA、テストベッド/データセットの軸で整理。117 研究を対象に、Train Ticket・Sock Shop・AIOps Challenge 2020/2021 などの評価基盤を地図化し、Trusted Distributed AI の観点から信頼性・説明可能性・一貫性・頑健性・因果妥当性を評価軸に加える
- [[@2024__CIKM__RCAgent - Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models]] — [[Zefan Wang]]・[[Zichuan Liu]]・[[Yingying Zhang]] ほかによる CIKM 2024 論文。[[Alibaba Cloud]] の Apache Flink リアルタイム計算基盤を対象に、社内配置 LLM と意味的に最小なツール、OBSK、コード/ログ専門エージェント、JsonRegen、TSC を組み合わせる [[RCAgent]] を提案。ReAct 比で根本原因・解決策・証拠・責任判定の全側面を改善し、OoD ジョブ診断ワークフローへ統合
- [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]] — [[Vaishali Vinay]]([[Microsoft]] Security Research)による IEEE CAI 2026 論文。LLM アプリケーションの隠れた失敗を、推論失敗・入力/コンテキスト失敗・システム/運用失敗の 3 層 15 種(幻覚、論理的不整合、計画崩壊、過信、制約違反、曖昧プロンプト、プロンプトインジェクション、コンテキスト喪失、分布外入力、競合指示、ツール/API エラー、外部ツール失敗、マルチエージェント通信破綻、ビジネスルール不整合、コスト起因劣化)に分類。静的ベンチマークが安定性・再現性・ドリフト・ワークフロー統合を測れない評価ギャップと、入力正規化・検証レイヤー・意味的オブザーバビリティ・コスト統制の必要性を整理
- [[@2023__CSUR__Optimization Techniques for GPU Programming]] — [[Pieter Hijma]] ほか [[Vrije Universiteit Amsterdam]]・[[Netherlands eScience Center]] による ACM Computing Surveys 2023 論文。450 本の GPU 最適化論文を体系的に分析し、メモリアクセス・不規則性・バランシング・ホストインタラクションの 4 テーマ・28 技術を分類。コアレスドアクセス・専用メモリ・分岐発散削減・auto-tuning が採用頻度トップ 4 で、最適化の相互依存性とアーキテクチャ世代依存性を定量化
- [[@2026__arXiv__Bian Que - An Agentic Framework with Flexible Skill Arrangement for Online System Operations]] — [[Bochao Liu]] ほか [[Kuaishou Technology]] による arXiv 2026 プレプリント。LLM O&M エージェントのボトルネックを推論でなくオーケストレーション(適切なデータ・知識の選択)と特定し、統一運用パラダイム(リリース遮断・積極的点検・アラート RCA)・[[Flexible Skill Arrangement]](Skill = LoadDataSchema + Prompt + Meta)・統一自己進化メカニズム(1 フィードバック → 知識蒸留+Skill 精緻化)を提案。KuaiShou 検索エンジン 6 ヶ月本番でアラート量 75% 削減・RCA 精度 80%・MTTR 50% 以上圧縮・オフライン pass@5 = 99.0%
- [[@2014__ICDE__Rethinking Main Memory OLTP Recovery]] — [[Nirmesh Malviya]]([[MIT CSAIL]])・[[Ariel Weisberg]]([[VoltDB]] Inc.)・[[Samuel Madden]]([[MIT CSAIL]])・[[Michael Stonebraker]]([[MIT CSAIL]])による IEEE ICDE 2014 論文(DOI:10.1109/ICDE.2014.6816685)。[[VoltDB]] を実装基盤として ARIES 生理ロギングとコマンドロギングの詳細な性能比較を実施。TPC-C でコマンドロギングが生理ロギングより 1.5× 高いスループットを達成し、パフォーマンス差がディスク I/O 量だけでなく差分ログレコード構築の CPU オーバーヘッドにも起因することを制御実験で実証。メインメモリ OLTP における復旧方式の第一選択としてコマンドロギングを推奨。(paper / database / recovery / OLTP / ICDE)
- [[@2008__SIGMOD__OLTP through the looking glass, and what we found there]] — [[Stavros Harizopoulos]](HP Labs)・[[Daniel J. Abadi]](Yale)・[[Samuel Madden]](MIT)・[[Michael Stonebraker]](MIT)による SIGMOD 2008 論文。Shore RDBMS を TPC-C で段階的に改変し、バッファマネージャ(34.6%)・ロック(16.3%)・ログ(11.9%)・ラッチ(14.2%)の命令数内訳を精密計測。全コンポーネント除去で 640 TPS → 12,700 TPS(約 20 倍)、単一の「高い杭」は存在せず 4 コンポーネント同時除去が必要であることを定量化
- [[@2005__ICDE__One Size Fits All - An Idea Whose Time Has Come and Gone]] — [[Michael Stonebraker]]・[[Ugur Cetintemel]] による ICDE 2005 招待論文。汎用 RDBMS が全ワークロードに最適とする「ワンサイズフィッツオール」戦略の終焉を論じ、データウェアハウス(カラムストア)・ストリーム処理・テキスト検索・科学データベースなどの専用エンジンの優位性を体系的に主張。StreamBase が同一アプリケーションで商用 RDBMS 比約 200 倍のスループットを達成した例を報告
- [[@2006__OSDI__Bigtable - A Distributed Storage System for Structured Data]] — [[Jeffrey Dean]]・[[Sanjay Ghemawat]] ほか [[Google]] による OSDI 2006 論文。(row, column, timestamp) → string の多次元疎マップを数千台のコモディティサーバに分散格納する [[Bigtable]] を報告。タブレット分割・SSTable/memtable による LSM 的書き込みパス・[[Chubby]] 分散ロックサービス・[[Google File System]] 上の永続化を組み合わせ、2006 年 8 月時点で 388 クラスタ・24,500 タブレットサーバを運用
- [[@2026__SIGMOD Companion__Twenty Years of Bigtable]] — [[Fabio Baltieri]] ほか [[Google]] による SIGMOD Companion 2026 論文。[[Bigtable]] の 20 年運用経験を報告し、10 EB データ・ピーク 70 億 QPS・単一クラスタ 2.5 億 QPS 超の規模、レプリケーション、SQL、CDC、カウンタ/CRDT、マテリアライズドビュー、外部コンパクション、行キャッシュ、オートサイジング、Bigtable SRE チームによるサービス運用への移行を整理
- [[@2007__SOSP__Dynamo - Amazon's Highly Available Key-value Store]] — [[Giuseppe DeCandia]]・[[Werner Vogels]] ほか [[Amazon]] による SOSP 2007 論文。結果整合性・一貫性ハッシュ法・ベクタークロック・スロッピークォーラム・マークル木・ゴシッププロトコルを組み合わせ、単一障害点のない高可用キーバリューストア [[Dynamo]] を構築。99.9 パーセンタイル SLA でショッピングカートを運用、リクエストの 99.94% が単一バージョンを返す
- [[@2007__VLDB__The End of an Architectural Era (It's Time for a Complete Rewrite)]] — [[Michael Stonebraker]]・[[Samuel Madden]]・[[Daniel J. Abadi]] ほかによる VLDB 2007 論文。現行 RDBMS のコードの有用作業は OLTP で 6.8% に過ぎず、バッファ管理 34.6%・ラッチ 14.2%・ロック 16.3% 等がオーバーヘッドを支配。メインメモリ・単一スレッド・シェアードナッシングの [[H-Store]] プロトタイプで TPC-C 相当ベンチマーク 82 倍の高速化を達成
- [[@2010__SIGOPS_OSR__Cassandra - A Decentralized Structured Storage System]] — [[Avinash Lakshman]]・[[Prashant Malik]] による SIGOPS OSR 2010 / LADIS 2009 論文。[[Dynamo]] のパーティショニング設計と [[Bigtable]] のカラムファミリデータモデルを統合した [[Apache Cassandra]] を報告。修正版 Scuttlebutt ゴシッププロトコルと Φ 累積障害検知器により完全非中央集権を実現。[[Facebook]] Inbox Search(2 億ユーザ超)で 600 台運用
- [[@2024__USENIX login Online__Understanding Workload Characteristics in Large Language Model Development]] — [[Qinghao Hu]]・[[Peng Sun]]・[[Tianwei Zhang]] による USENIX ;login: Online 記事。[[Shanghai AI Laboratory]] の LLM 開発向け GPU データセンター [[Acme]](Seren/Kalos、計 4,704 A100)の 2023 年 3〜8 月トレースから、GPU ジョブ実行時間中央値 2 分、GPU 利用率中央値 97%/99% かつ 0%/100% 二極化、評価ジョブが件数を支配する一方で事前学習が GPU 時間 69.5〜94.0% を消費すること、インフラ障害が失敗件数 11% でも GPU 時間 82% 超を占めることを報告。[[InternEvo]] V2 は 123B LLM・2,048 GPU で V1 比約 16% 高速化(USENIX ;login: Online 2024-03-19 / NSDI 2024 論文の要約)
- [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]] — [[Meta]] の [[Apostolos Kokolis]]・[[Michael Kuchnik]]・[[Carole-Jean Wu]] らによる、RSC-1/RSC-2 の大規模 ML 研究クラスタ信頼性分析。11 か月・4 百万ジョブ・1.5 億超 A100 GPU 時間を分析し、ハードウェア関連失敗はジョブ件数 0.2% でも GPU 実行時間 18.7% に影響、1024 GPU ジョブの MTTF 7.9 時間、16,384 GPU 1.8 時間、131,072 GPU 0.23 時間と予測。ETTR 推定式、レモンノード検知(512+ GPU 大規模ジョブ失敗率 14%→4%)、InfiniBand 適応ルーティングを提示(HPCA 2025, DOI:10.1109/HPCA61900.2025.00096)
- [[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]] — [[Microsoft]] のマルチテナント GPU 訓練クラスタ [[Philly]] の 75 日・96,260 ジョブ・14 仮想クラスタの本番トレース分析。ギャングスケジューリングと局所性制約による fragmentation delay、割り当て済み GPU の処理サイクル利用率平均 52.32%、killed/unsuccessful が件数 30.7% でも総 GPU 時間の約 55% を消費することを定量化。[[philly-traces]] を公開し、後続の [[GPUクラスタスケジューリング]]・[[LLM分散学習]] 研究の基礎データになった(USENIX ATC 2019, Jeon ほか)
- [[@2025__PMBS__Pretraining LLMs at Scale - Tuning Strategies and Performance Portability]] — [[Qualcomm]] の Adrián Pérez Diéguez らによる LLM 事前学習性能チューニング論文。DeepSpeed/ZeRO/NCCL の通信を意識した 3 段方法論を提案し、Model-2(8B) を 8 ノード 64 GPU の IB-A100/RoCE-A100/RoCE-H100 で評価。ZeRO Stage 2・batch_size 128・grad_acc 2 が 3 プラットフォームで最良、既定構成比最大 1.6 倍高速化、DeepSpeed Stage 2 既定実装が reduce-scatter ではなく all-reduce を使うこと、性能可搬性 `Φ=0.2574` を報告(PMBS25 / SC Workshops '25, DOI:10.1145/3731599.3767699)
- [[@2025__arXiv__The Landscape of Agentic Reinforcement Learning]] — エージェント型 RL の包括的サーベイ。MDP/POMDP 形式化で PBRFT と Agentic RL を区別し、能力軸(計画・ツール・記憶・自己改善・推論・知覚)とタスク軸(検索・コード・数学・GUI・ビジョン・身体化・MAS)の二重タクソノミーで 500 本超を体系化。環境 40+・フレームワーク 23 のカタログと RL メカニズム論争の定量的整理を含む 95 ページのサーベイ(TMLR 2026, Zhang ほか, Oxford/Shanghai AI Lab/NUS 等 15 機関)
- [[Efficient Large Language Models - A Survey]] — LLM 効率化手法のモデル中心・データ中心・フレームワーク中心 3 軸タクソノミーによる包括的サーベイ。量子化・プルーニング・LoRA・投機的復号・KV キャッシュ・MoE・SSM・17 フレームワーク比較を 67 ページに網羅(TMLR 2024, Wan ほか, OSU/UMich 等)
- [[Towards Efficient Generative Large Language Model Serving]] — LLM サービングの効率化に関する包括的サーベイ。アルゴリズム革新(復号・アーキテクチャ・圧縮)とシステム最適化(量子化・並列計算・メモリ管理・スケジューリング・カーネル)の 2 軸タクソノミーで 375 本の文献を体系化。10 種のオープンソースフレームワークを横断比較(ACM Computing Surveys 2025, Miao ほか, Purdue/CMU)
- [[@2026__NSDI__FAST - An Efficient Scheduler for All-to-All GPU Communication]] — MoE AllToAllv の動的歪みをスケール内リバランス + Birkhoff 分解で解く多項式時間スケジューラ。64 GPU で 221 µs(SyCCL 比数桁速)、AMD Megatron-LM で RCCL 比最大 4.48× 向上。GPU 集団通信層への Birkhoff 分解初適用(NSDI 2026, Lei ほか, CMU/MangoBoost/UW/Penn)
- [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]] — Meta の本番 DCN 設計自動化システム。インテント駆動コンパイラで高レベル設計インテントをスイッチ設定に変換。6 年間・18 種類・約 900 DCN、100K-GPU AI スーパークラスタを支える。GSC 抽象化・決定論的ステートレス設計・4 種グラフレット合成が主要技術(NSDI 2026, Cai ほか, Meta/MPII)
- [[@2026__ASE__OpsAgent - An Evolving Multi-agent System for Incident Management in Microservices]] — training-free データプロセッサ+3 専門エージェント+クロスレビュー+デュアル自己進化(PPO+反省)のマイクロサービス IM 用軽量 MAS。OPENRCA SOTA 比 Correct +46.63%、Lenovo 本番 84.09%・解決時間 2.5h→126s(ASE '26, 南開大学/Alibaba Cloud/Lenovo/清華大学, arXiv:2510.24145)
- [[@2017__HotOS__Thinking about Availability in Large Service Infrastructures]] — 大規模インフラストラクチャの可用性をセキュリティ的思考で捉え直すポジションペーパー(HotOS 2017, Mogul ほか, Google)
- [[@2019__HotOS__Nines are Not Enough - Meaningful Metrics for Clouds]] — SLO 定義の困難さを統計学的意思決定との同型性で捉え、SLE/CBE によるリスク明示的分担を提唱(HotOS 2019, Mogul+Wilkes, Google)
- [[@2020__NSDI__Meaningful Availability]] — ウィンドウ付きユーザーアップタイムで有意義性・比例性・実用性の三要件を同時に満たす可用性メトリクスを G Suite 本番で実証(NSDI 2020, Hauer ほか, Google)
- [[@2024__SOSE__Diffusing High-level SLO in Microservice Pipelines]] — 高レベル SLO をベイズネットワーク拡散で低レベル SLO・パラメータ割り当てに自動変換する 3 ステップ方法論(IEEE SOSE 2024, Sedlak ほか, TU Wien)
- [[@2026__arXiv__A Microservice-Based Platform for Sustainable and Intelligent SLO Fulfilment and Service Management]] — カーボン認識 SLO 管理プラットフォーム CASCA(arXiv:2602.12875, 2026, Herrera ほか, TU Wien)
- [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] — 自律クラウド(AgentOps)に向けた AIOps エージェント評価の包括的フレームワーク(MLSys 2025, arXiv:2501.06706)
- [[@2026__arXiv__SREGym - A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios]] — AI SRE エージェント向けの高忠実度のライブベンチマーク(arXiv:2605.07161, 2026)
- [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]] — 4 エージェントを状態機械として編成した自律 SRE マルチエージェントシステム。安全仕様 TNR(severity 単調非増加)を Alpern–Schneider の安全性として形式化・証明し、スタックベースの巻き戻しで実装。AIOpsLab 69.2%/ITBench 50.0%(PDF 本文 ingest 済み、NeurIPS 2025, arXiv:2506.02009)
- [[@2025__ICML2025__ITBench - Evaluating AI Agents across Diverse Real-World IT Automation Tasks]] — SRE・CISO・FinOps の 3 ペルソナ計 102 シナリオを実環境でワンボタン評価する初の包括的 IT 自動化ベンチマーク。SOTA(GPT-4o)でも SRE 11.4%/CISO 25.2%/FinOps 25.8%、Hard の緩和は全モデル 0%、トレース除去で診断 13.81%→9.52%。NTAM と軌跡指標(Detoured/Covered Services)を導入([[ITBench]] の一次論文。[[Saurabh Jha]] ほか、IBM/UIUC、ICML 2025, PMLR v267)
- [[@2026__AAAI__PAGER - Proactive Monitoring Agent for Enterprise AI Assistant]] — 障害発生前に予測・説明・対話支援するプロアクティブ監視エージェント(AEP 向け、random forest+LLM、AAAI-26 デモ)
- [[@2025__arXiv__MicroRemed - Benchmarking LLMs in Microservices Remediation]] — エンドツーエンドのマイクロサービス修復を測る初のベンチマーク。マルチエージェントの ThinkRemed を併せて提案(PKU/Alibaba、arXiv:2511.01166, 2025)
- [[@2026__GoogleSRE__AI in SRE - Engineering the Future of Reliable Operations]] — Google SRE の AI-Ops ホワイトペーパー。L0–L4 の自律レベル・Safety Trifecta・Bronze/Silver/Gold 評価・AI Operator/Actus を提示(本 wiki 初の産業界・本番運用の一次情報、sre.google)
- [[@2026__Datadog__Building Bits AI SRE - Autonomous Incident Investigation Agent]] — Datadog の自律 RCA エージェント Bits AI SRE の設計・評価ブログ。仮説駆動の調査・因果へのフォーカス・再帰的な深掘り・実インシデント+LLM judge による評価(産業界 2 例目、調査・RCA 特化、datadoghq.com)
- [[@2026__Datadog__Production-Grounded Benchmarks for AI Code Optimization]] — Datadog の [[DODO]](Datadog Observability-Driven Optimizer)紹介ブログ。CPU プロファイルと Live Debugger 実呼び出しを組み合わせた本番接地型ベンチマーク生成 + LLM 最適化エージェントの 2 ループ構成。成熟 Go サービスで CPU コスト 8%+ 削減・O(10k) コア節約(Junaid Ahmed・Piotr Bejda、2026-06-08)
- [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] — Datadog の観測データに特化したゼロショット時系列基盤モデル Toto(151M)と、実運用テレメトリ由来のベンチマーク BOOM を提案。BOOM で CRPS を次点比 12.4% 改善、GIFT-Eval/LSF でも SOTA(NeurIPS 2025, arXiv:2505.14766)
- [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]] — Ant International の異種多変量向け encoder-only 時系列基盤モデル Falcon-X(591M)。変量を潜在プロトタイプ空間へ分離し、正負の依存を differential attention で表現。GIFT-Eval で 0.666 MASE/0.453 CRPS の全体最高(arXiv:2605.27286, 2026)
- [[@2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications]] — 障害箇所特定の前処理となる特徴量削減フレームワーク MetricSifter。障害起因の変化点の時間的近接によって障害窓を教師なしで局所化し BA 0.981(本 wiki 初の vault 所有者自身の論文・LLM 以前の統計手法、IEEE Access 2024, DOI:10.1109/ACCESS.2024.3374334)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 1 Introduction]]〜[[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 6 Conclusion]](全 6 章)— [[Yuuki Tsubouchi]] の京大博士論文。テレメトリを計装/ストレージ/マイニングの 3 層で捉え、既発表 3 編(in-kernel flow bundling / [[HeteroTSDB]] / [[MetricSifter]])を統合。「データ削減は文脈が豊富な両端で」という設計指針と、use-first・LLM 障害スナップショットという今後の方向性。ハブ: [[Scaling Telemetry Workloads in Cloud Applications]](Kyoto University, 2025-03, 122p)
- [[Efficient Training of Large Language Models on Distributed Infrastructures]] — LLM 分散訓練システム/インフラの包括サーベイ。SER(Scalability/Efficiency/Reliability)の 3 軸でインフラ・並列化(hybrid/auto/heterogeneous)・計算/メモリ/通信の最適化・耐障害性を体系分類。LLaMA3 は 16K H100・54 日で 466 回中断し、障害の 78% がハードウェア起因。今後の方向性は光コンピューティング(本 wiki 初の LLM 訓練インフラ・別ドメイン、arXiv:2407.20018 / Vicinagearth Vol.3 (2026), DOI:10.1007/s44336-026-00038-z)
- [[@2024__NSDI__MegaScale - Scaling Large Language Model Training to More Than 10,000 GPUs]] — ByteDance/PKU の 10,000 GPU 超 LLM 訓練の本番システム。アルゴリズムとシステムの協調設計と深いオブザーバビリティにより 175B を 12,288 GPU・55.2% MFU(Megatron-LM 比 1.34×)で訓練。各並列化次元の通信オーバーラップ・O(n) 初期化・2 段階チェックポイント・分散ビューの診断ツール。数週間の本番ランで 100 回超の自動復旧(上記サーベイの SER 3 軸を本番システムで具体化、NSDI '24)
- [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] — [[SAKURA internet Inc]] の 800 GPU(100×H100)のオープン Ethernet AI–HPC クラスタ [[SAKURAONE]] の経験報告。SONiC + RoCEv2 のフルオープン 800 GbE で ISC 2025 TOP500 HPL 49 位・トップ 100 唯一、HPL 33.95 PFLOP/s。単一テナント LLM 開発のワークロード動態(小規模が件数を支配・大規模が GPU 時間を支配、CPT→fine-tuning のフェーズ遷移、キャンセル率 73.5%、21 件の障害の 42.9% が GPU 起因)をテレメトリから観測。**vault 所有者 [[Yuuki Tsubouchi]] の共著・本 wiki 初の HPC/オープンネットワーキングの一次論文**(MLSys 2026 採録、arXiv:2604.13600)
- [[@2025__NSDI__Minder - Faulty Machine Detection for Large-scale Distributed Model Training]] — [[ByteDance]]/[[Tsinghua University]]/[[Harvard University]] の大規模分散訓練向けの自動故障マシン検知器 [[Minder]]。3D parallelism によるメトリクスの均質化を逆手に取り、マシン単位の類似度 + 連続性 + メトリクスごとの LSTM-VAE + 決定木による優先順位付けで、停止前の異常パターンから故障マシン 1 台を教師なしで特定。本番で 1 年超稼働し、150 件の障害で適合率 0.904・F1 0.893・平均 3.6 秒(手動比 99% 短縮)。障害の 55.8% がハードウェア起因(ECC 38.9%)。[[MegaScale]] のハートビート系の復旧をメトリクスパターン検知で補完(NSDI '25)
- [[@2026__ASPLOS__Pulse - Fine-grained and Non-intrusive LLM Training Monitoring via Microsecond-level Traffic Measurement]] — [[Nanjing University]] の LLM 訓練向けのトラフィック中心の監視システム [[Pulse]]。訓練コード/CCL を改変せず [[BlueField-3]] 上でマイクロ秒級の RDMA トラフィック計測を行い、function hooking で得た期待ボリューム/ピアから per-QP レートを operator 単位にセグメント化し、実際の通信時間/通信量でマシン単位に箇所特定。64 H200 GPU で 12 件中 10 件をマシン単位で特定(SOTA の [[Aegis]]/[[Holmes]]/[[GreyHound]] は 4 件・2 件を誤診)、適合率 90% 超・再現率 100%・平均約 6 秒・オーバーヘッドは無視可能。**[[Minder]] が「オーバーヘッドのため未展開」としたマイクロ秒監視を、計測の on-NIC off-path 化で実現**(ASPLOS '26, DOI:10.1145/3779212.3790163)
- [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]] — Microsoft の GenAI クラウドサービス(Azure OpenAI 等)の本番インシデント 4 年分の初の大規模実証研究。GenAI 固有の症状・根本原因・緩和の 3 分類体系を構築し、TTM が非 GenAI 比 1.83 倍・人手検知率 38.3%・症状と根本原因の多対多マッピングを定量化(ICSE 2026, arXiv:2504.08865)
- [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]] — 5G 通信ネットワーク由来の大規模マルチモーダルオブザーバビリティデータセット。非匿名化・絶対スケール保持の 18 KPI、32K サンプル・11 異常タイプ・221 万 Q&A。スケール情報の除去が RCA +30.4 ポイントの劣化を招くことを定量化(Yale University、ICML 2026, arXiv:2510.06063)
- [[A Survey of AIOps in the Era of Large Language Models]] — [[Peking University]] の [[Lingzhe Zhang]]・[[Tong Jia]]・[[Ying Li]] らによる LLM4AIOps の初の包括的サーベイ。AIOps 全工程をデータ(RQ1)・タスク(RQ2)・手法(RQ3)・評価(RQ4)の 4 軸で俯瞰し、2020-01〜2024-12 の論文を分析。タスクを Failure Perception → Root Cause Analysis → Assisted Remediation の 3 段に整理し、LLM 時代の新タスク(root cause report generation・script generation・automatic execution 等)と緩和の自動化 5 段、手法 5 系統(foundation/fine-tuning/embedding/prompt/knowledge-based)を体系化。課題に時間効率・trace 活用・汎化・既存ツールチェーンとの統合を挙げる。**本 wiki が一次ソースで持つ [[AIOpsLab]] を全ライフサイクルベンチの代表として参照する「フィールドの地図」**(ACM Computing Surveys 採録, arXiv:2507.12472, DOI:10.1145/3746635)
- [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]] — [[The Chinese University of Hong Kong, Shenzhen]] の [[Aoyang Fang]]・[[Pinjia He]] らによる、マイクロサービス RCA の評価ベンチマークの妥当性を問い直した論文。単純ヒューリスティック SimpleRCA が 4 公開ベンチで SOTA に匹敵すると示し、既存ベンチの過度な単純さ(障害ケースの 86% が Type I/II、99% が観測データ不完全)を暴く。[[Train-Ticket]](50 サービス)+ 動的ワークロード + [[ChaosMesh]] で 9,152 注入から impact-driven validation した 1,430 ケース・25 障害種別の障害伝播ベンチを生成し、11 SOTA を再評価して平均 Top@1 0.21・最高 0.37。3 失敗モード(scalability/observability blind spots/modeling bottlenecks)を特定(**本 wiki 初のデータ駆動 RCA モデル評価ベンチの一次論文**、arXiv:2510.04711, 2025)
- [[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]] — [[Tsinghua University]] の [[Zhaoyang Yu]]・[[Microsoft]] の [[Minghua Ma]] らによる LLM ベースの実用的異常検知システム [[MonitorAssistant]]。「実用的異常」(統計的逸脱 + インシデント裏付け)を定義し、LLM(GPT-4 Turbo)を検知器でなくメタ層(設定推奨・異常レポート生成・フィードバック仲介)として配置。統一類似度(時系列シェープレット + LLM 記述類似度)で最適なモデル設定を推奨し、LLM-Engineer-In-The-Loop でサービスエンジニアが低閾値でモデルを改善。Microsoft のクラウドサービスに投入し有効性を検証(**産業投入による学術—産業ギャップの橋渡し**、ESEC/FSE 2024 Industry Track, DOI:10.1145/3663529.3663826)
- [[@2025__ASE__LogPilot - Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems]] — [[The Chinese University of Hong Kong]] の [[Michael R. Lyu]] グループと [[ByteDance]] による、ログベースのアラート診断を自動化する intent-aware かつスケーラブルな LLM フレームワーク [[LogPilot]]。アラート定義(PromQL)の意味的意図を LLM に解釈させ因果的に関連するログを絞り込み(intent-aware scoping)、各 request を spatiotemporal log chain に再構成・クラスタリングして代表だけを LLM に渡す(LLM 呼び出し 98.71% 削減)。[[Volcano Engine]] Cloud の 4 サービス・202 アラートで根本原因要約の有用性 +50.34%・exact localization +54.79%、$0.074/アラート・E2E 58.6 秒で 12 本番サービスに展開(受容率 84.21%)。**本 wiki 初のログ専門のアラート診断/RCA 一次論文**(ASE 2025, arXiv:2509.25874)
- [[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]] — [[University of Science and Technology of China]] の [[Mingyue Cheng]]・[[Xiaoyu Tao]] らによるポジションペーパー。時系列予測をモデル中心・静的・シングルパスの関数近似から、知覚(perception)・計画(planning)・行動(action)・省察(reflection)・記憶(memory)の 5 コンポーネントからなる反復的・マルチターンな意思決定プロセス([[エージェント型時系列予測]] / ATSF)へ再定式化する立場を主張する。予測モデルの呼び出し自体を行動空間の 1 つとして扱い、ツール相互作用・フィードバック取り込み・経験蓄積による進化を重視する。実装を Workflow(構造的安定、例 [[TimeCopilot]])・AgenticRL(自律的進化、例 [[Cast-R1]])・AgenticFlow(ハイブリッド)の 3 パラダイムに整理し(Table 2)、進歩の主軸を「モデルアーキテクチャの反復」から「ワークフロー設計・ツール構成・意思決定ポリシーのシステムレベル進化」へ移すべきだと論じる(Table 1 で ATSF だけがツール利用・進化を持つ)。ポジションペーパーゆえ体系的な実験評価はなく、同グループの [[Cast-R1]] 等を有効性の参照とする。**本 wiki 初のエージェント型時系列予測の一次論文**(arXiv:2602.01776v4 [cs.LG], 2026)
- [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]] — [[University of Science and Technology of China]] の [[Xiaoyu Tao]]・[[Mingyue Cheng]] らによる、[[エージェント型時系列予測]] の **AgenticRL パラダイムの代表実装**(上の ATSF ポジションペーパーが有効性の参照とする一次論文)。時系列予測を逐次的意思決定問題へ再定式化し、記憶ベース状態管理 + モジュール式ツールキット(統計特徴抽出・データ品質診断・[[変化点検知|変化点検出]]・予測モデル呼び出し)を介したツール拡張エージェントワークフローで予測を実行。SFT + マルチターン RL([[強化ファインチューニング|GRPO]])+ カリキュラム学習の 2 段階で学習し、予測モデル([[Chronos-2]]・[[TimesFM]]・PatchTST・iTransformer・ARIMA・DLinear)を状態認識的に選ぶツールとして扱う。実世界 10 データセット(ETT 4 種・Wind・EPF 5 種)で全データセット最低 MSE。ATSF が実験なしに掲げた主張(ツール利用・省察・記憶・計画)をアブレーションが個別に裏づける一方([[Chronos-2]] 除去で volatile NP が 22.5→55.4、RL 除去で 24.750→54.631)、**本文(Qwen3-8B/4×A800)と Appendix(Qwen3-1.7B/単一 RTX 4090D)で実装設定が矛盾し Table 2 主結果が 4B 相当数値**という未完成プレプリント(arXiv:2602.13802v1, 2026)
- [[@2026__eunomia.dev__eBPF × AI-LLMs - The Convergence of System Observability and AI]] — [[eunomia-bpf]] の [[Yusheng Zheng]] による eBPF と AI/LLM の融合を俯瞰する位置づけエッセイ + 厳選リスト(awesome list)。URL は同コミュニティの [[GPTtrace]] ページだが、内容は GPTtrace 単体でなく eBPF×AI 全体。核心は双方向の**共生ループ**——(a)**eBPF for AI**: カーネル層の高忠実度テレメトリで AI ワークロード/エージェントを観測・最適化([[AgentSight]] が claude code/gemini-cli を <3% オーバーヘッドで追跡、GPU の uprobe トレース、[[bpftime]] の eGPU)、(b)**AI for eBPF**: LLM がカーネル拡張を生成・検証([[Kgent]]/KEN が Z3 記号検査つきで約 80% 意味的正しさ、[[GPTtrace]] が実装、SimpleBPF/DiffSpec/LLM スケジューラ合成)。2024–2025 の研究・製品を Part 1(可観測性/セキュリティ/性能)・Part 2(カーネル内データパス)・Part 3(eBPF 合成)に整理。**本 wiki 初のカーネル層 eBPF×AI ソース**で、アプリ層 AIOps に新レイヤーを足す。awesome list ゆえ二次情報・`confidence: medium`(eunomia.dev/GPTtrace/、2026-06-04 取得)
- [[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]] — [[University of Michigan]] × [[Microsoft]]([[Ang Chen]] グループ)の [[Zodiac]]。IaC プログラムがコンパイルを通過してもデプロイ時に失敗する **semantic gap** を、公開 [[Terraform]] リポジトリからの[[設定マイニング|セマンティックチェックのマイニング]]とデプロイベース検証(SMT による positive/negative テスト)で埋める自動パイプライン。[[Microsoft Azure]] の 52 リソース種別・26,000 リポジトリから 510 の検証済みチェックを発掘し、既存 IaC ツール(TFLint/Checkov 等)が捕えない inter-resource 制約を含む。200+ のバグ repo と公式ドキュメント 4 件の誤りを発見・修正。**本 wiki 初の Cloud IaC リライアビリティ一次論文**で、[[Lilac]](lifting)・[[NSync]](reconciliation)と同一グループの IaC ライフサイクル研究の起点(SOSP '24, DOI:10.1145/3694715.3695974)
- [[@2025__arXiv__Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents]] — [[University of Michigan]] の [[Zhenning Yang]]・[[Ang Chen]] と [[Amazon Web Services]] による、IaC reconciliation のための初の自動エージェントシステム [[NSync]]。コンソール/CLI/SDK 経由の帯域外変更で生じる infrastructure drift を、クラウド API トレース([[AWS CloudTrail]])から検知し既存 [[Terraform]] 構成へパッチを生成。タスクを program repair として定式化し、ニューロシンボリックな注釈 + 統合の intent identification、ライブ実行なしの read-only ツール(drift_report・self_critique)による patch generation、プロジェクト単位の継続学習 KB の 3 段。5 プロジェクト・372 drift で pass@3 0.71→0.97・トークン効率 1.47 倍。**本 wiki 初の IaC drift 修復の一次論文**(arXiv:2510.20211, 2025)
- [[@2025__AIOps__Automated Lifting for Cloud Infrastructure-as-Code Programs]] — [[University of Michigan]] の [[Jingjia Peng]]・[[Ang Chen]] らと [[UC San Diego]] による、IaC lifting(既存の非 IaC デプロイを IaC へ逆生成)のニューロシンボリックなルール抽出パイプライン [[Lilac]] のビジョン論文。鍵となる洞察は「lifting ルール(逆方向)は IaC デプロイ(順方向)の観測から学習できる」。LLM(ルール抽出)と symbolic 手法(incremental deployment・IaC ネイティブ検証 import/equivalence/redeployment)を組み合わせ、安全クリティカルな lifting で LLM の幻覚を guardrail で抑える。43 Azure リソースで [[aztfexport]] と同等以上の誤り率(FP 2.3%/FN 0% 対 4.6%/7.0%)を少ない手作業で達成。**本 wiki 初の IaC lifting の一次論文**(AIOps 2025 / ICSE workshop, IEEE Xplore 11029329)
- [[@2025__arXiv__Cisco Time Series Model Technical Report]] — [[Cisco]]([[Splunk]])による観測ドメイン特化の時系列基盤モデル(Cisco TSM)。[[TimesFM]] に特殊トークンと解像度埋め込みを足して継続事前学習し、粗い 1 時間と細かい 1 分のコンテキストを連結した「多解像度の長コンテキスト」を 1/30 の系列長で扱う。約 400M 系列・13 か月・300B 点超で学習し、観測データ評価で競合 TSFM([[Toto]]/[[Chronos-2]])を上回りつつ、[[GIFT-Eval]] の non-leaking 評価で汎用能力も保つ。アブレーションで解像度埋め込み + 特殊トークンが系列長連結(CONCAT)と同等以上かつ収束が速い(**本 wiki 初の観測特化・多解像度 TSFM の一次論文**、arXiv:2511.19841, 2025)
- [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]] — [[Carnegie Mellon University]]・[[Datadog]] AI Research・[[Amazon Web Services]] による、ソフトウェアインシデント対応の時系列質問応答(TSQA)を測る初のベンチマーク [[ARFBench]]。[[Datadog]] の本番インシデント Slack タイムラインを専門家アノテーションの一次源に、750 問・142 系列・538 万点を Tier I/II/III(111/306/333)で構成。事前学習済み TSFM([[Toto]])を VLM([[Qwen3-VL]])と結合した [[Toto-1.0-QA-Experimental]] が精度 63.9% でフロンティアモデル(GPT-5 62.7%)に並び、人間専門家との best-of-2 オラクルが精度 87.2%・F1 82.8% の超人的フロンティアを示す。訓練段アブレーションで RLVR が +15.4pp(**本 wiki 初の時系列質問応答ベンチの一次論文**、arXiv:2604.21199, 2026)
- [[@2026__arXiv__Towards Robust LLM Post-Training - Automatic Failure Management for Reinforcement Fine-Tuning]] — [[Peking University]]/[[Alibaba Group]]/[[University of Illinois Chicago]] の同一グループ([[Lingzhe Zhang]] ら)による、[[強化ファインチューニング]](RFT)の訓練プロセスに AIOps の検知→診断→修復の障害管理ライフサイクルを移植した研究。初の細粒度障害ベンチマーク [[RFT-FaultBench]](5 families/16 types/779 runs/22,549 train-step/145 万 trajectory)と閉ループフレームワーク [[RFT-FM]] を提示。検知 F1 87.96%/73.88%・type-level Macro-F1 85.51%/42.16%・Mitigation Rate 46.25% で、自動修復の不安定性(MSC -5.84%)も定量化(**本 wiki 初の RFT 障害管理の一次論文**、arXiv:2605.04431, 2026)
- [[@2025__arXiv__Foundation Models for Time Series - A Survey]] — [[Dell Technologies]] ほか([[Siva Rama Krishna Kottapalli]] 筆頭)による Transformer ベースの[[時系列基盤モデル]]のサーベイ。15 の代表 TSFM を 6 次元(アーキテクチャ・パッチ有無・目的関数・単変量/多変量・確率的/決定論的・規模)で分類するタクソノミーを提案し、**目的関数による分類**を独自軸とする。vault が個別に持つ [[Toto]]/[[TimesFM]]/[[Chronos-2]](初代 Chronos)/[[Falcon-X]]/Cisco TSM 等に俯瞰の座標系を与える二次サーベイ。observability ドメインは扱わない(**本 wiki 初の TSFM 横断サーベイ**、arXiv:2504.04011, 2025-04)
- [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]] — [[Junjielong Xu]]・[[Shilin He]]・[[Qingwei Lin]]・[[Chaoyun Zhang]]([[Microsoft]])・[[Dan Pei]]([[Tsinghua University]])・[[Pinjia He]]([[The Chinese University of Hong Kong, Shenzhen]])らによる、LLM の根本原因分析能力を測る初の大規模ベンチ [[OpenRCA]]。実世界 3 システム由来の 335 障害 + 68.5GB テレメトリ(logs/metrics/traces)を CSV で静的に与え、根本原因 3 要素(originating component / start time / failure reason)の部分集合=7 goal を問う目標駆動定式化。コード実行型 RCA-agent(Controller の高位ガイダンス + stateful Python Executor の ReAct ループ)が raw テレメトリをコンテキストに載せず KPI 1263→53 に絞って捌くが、最良 Claude 3.5 Sonnet で 11.34%・Hard(3 要素)は全モデル 0.00%。性能はモデルのエラー耐性に律速(Gemini は sampling 最良→agent 最弱、実行失敗 −68.4%)、推論を 10 ステップ超に伸ばすと精度向上。クエリは GPT-4 合成・候補事前提示で、汚染対策に updatable(**本 wiki 初の LLM-RCA 静的ベンチ一次論文**、ICLR 2025, OpenReview M4qNIzQYpd)
- [[@2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems]] — [[Guangba Yu]]・[[Pengfei Chen]]([[Sun Yat-sen University]])・[[Michael R. Lyu]]([[The Chinese University of Hong Kong]])らによるエージェント型 RCA の再現可能ベンチ [[Cloud-OpsBench]]。452 障害・40 根本原因種別・7 カテゴリ・[[Kubernetes]] 全スタック。**State Snapshot Paradigm**(メトリクス・ログ・コントロールプレーン設定・データプレーン状態を凍結した決定論的デジタルツイン + モック接面)で「ライブ非決定性 vs 静的人工物」の二分を埋める第三の型を取り、結果 A@k だけでなく**推論過程を採点する初の white-box 評価**(IAC/RAR/ZTDR)を導入。A@1=0.73 でも IAC=0.40・RAR=0.11・ZTDR=0.32 と過程指標は低く、SLM の律速は推論でなく構文脆弱性(Syntactic Fragility/IAC)、frontier はパラメトリック幻覚(Parametric Hallucination/ZTDR)と認知欠陥を分離。障害注入は 3 エージェント MAS(Generator/Executor/Verifier)閉ループで K8s 自動マスクを Verifier が検出し強度調整、診断ツール T1〜T10 平均 487 呼び出しを事前計算。手続き的実演(ICL)が宣言的知識(RAG)/CoT を一貫して上回る(GPT-4o 0.49→0.70)(**本 wiki 初のエージェント RCA 過程評価ベンチ**、arXiv:2603.00468, 2026)
- [[@2025__ASE__AlertGuardian - Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems]] — [[Guangba Yu]]・Genting Mai・[[Pengfei Chen]]([[Sun Yat-sen University]])と [[Tencent]] による、アラートライフサイクルを一気通貫で管理する ASE 2025 の experience paper [[AlertGuardian]]。3 フェーズ=Alert Denoise(**LLM 不使用**の軽量グラフ GraphGuardian=LINE+Transformer + 仮想ノイズノード + 高基数属性匿名化、<200ms・削減率 93.82〜95.50%)→ Alert Summary(RAG+DeepSeek V3 で Root Cause/Explanation/Solution/Reference 生成、RCA 90.5%・Action 98.5%)→ Alert Rule Refinement(オーケストレータなし 4 エージェント Detect/RAG/Rule/Review + 反復フィードバック、停止条件=構文・重要アラート保持・ノイズ比 5%、human-in-the-loop で 1,174 提案→375 受容/32%)。本番(Tencent System A)で MTTR 156→21 分(7.4倍)・日次アラート 30万→1.5万。同 ASE2025 の [[LogPilot]](単発アラート診断)に対し「ライフサイクル全体最適化」の対比軸を立てる。既存 papers/ ノートは温存し wiki から一方向参照(**本 wiki 初のアラートライフサイクル全体最適化の一次論文**、ASE 2025, yuxiaoba.github.io/files/ASE25/AlertGuardian.pdf)
- [[@2025__arXiv__TimeSeriesScientist - A General-Purpose AI Agent for Time Series Analysis]] — [[Haokun Zhao]]・[[Xiang Zhang]]・[[Jiaqi Wei]]([[Stony Brook University]] ほか、corresponding [[Chenyu You]])による、汎用単変量時系列予測を自動化する初の LLM 駆動エージェント型フレームワーク [[TimeSeriesScientist]](TSci)。Curator(LLM ガイド診断+前処理+可視化+構造プロファイリング)→ Planner(モデル選択+ハイパラ最適化+ランキング)→ Forecaster(3 系のアンサンブル戦略を LLM が選択、テスト前に重み固定でリーク回避)→ Reporter(5 部構成のホワイトボックスレポート)の固定 SOP を直列協調。21 モデル(統計 7/ML 6/木 4/NN 2/専用 2)のライブラリを内蔵し[[時系列基盤モデル]]は不使用。8 ベンチ 5 ドメイン(ETT×4/Weather/ECL/Exchange/ILI)で統計比 MAE 平均 -10.4%・LLM 直接予測比 -38.2%、8/8 で MAE 最良。レポートも 5 ルーブリック(AS/MJ/IC/AQ/SC)の win rate で全 LLM ベースライン超。アブレーションで前処理除去が MAE +41.8%(最大)。[[エージェント型時系列予測]] の Workflow パラダイムの典型例で、AgenticRL の [[Cast-R1]] と対をなす(**本 wiki 初の LLM エージェント型汎用時系列予測の一次論文**、arXiv:2510.01538, 2025-10)
- [[@2025__ISAV__From Exploration to Explanation - ML-Driven Causal Discovery for Datacenter Reliability at Scale]] — [[Hewlett Packard Labs]]/[[Oak Ridge National Laboratory]] の [[Pavana Prakash]] らによる、データセンター信頼性の因果探索フレームワーク [[PACE]]。教師なし相関クラスタリングとラグ考慮型 Granger 因果性で多変量テレメトリからサブシステム構造と有向因果パスを抽出し、推定因果グラフを既知の物理プロセスと突き合わせて妥当性検証する。[[Summit]] 冷却インフラ 7 年分テレメトリ(Yokogawa SMARTDAC)で評価。定量的な精度指標は報告せず物理整合性・エントロピー順位・感度分析の定性評価による(**本 wiki 初の施設テレメトリ因果探索の一次論文**、PDF 取得済み、ISAV 2025 / SC Workshops pp.997–1002, DOI:10.1145/3731599.3767471)
- [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]] — [[Case Western Reserve University]]/[[Rutgers University]] の [[Biyao Zhang]] らによる、LLM 分散訓練のエンドツーエンド訓練時間予測。オペレータ単位分解 + 木ベース回帰器で、通信演算は予測誤差 50% 超だがイテレーション時間の 5% 未満しか占めないため計算演算(70〜95%)に予測能力を集中配分する。完全に CPU 上で動作し、[[Perlmutter]](A100)で平均誤差 4.98%・[[Vista]](GH200)で 9.38%、最大 20B・128 GPU(arXiv:2509.22832, 2025)
- [[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]] — Alibaba Cloud/[[Tsinghua University]]/[[University of Illinois Urbana-Champaign]] の [[Wei Liu]]・[[Ennan Zhai]] らによる、コンテナ化大規模訓練のネットワーク障害診断システム [[SkeletonHunter]]。CSP がモデル構成を見られない制約下で RNIC バーストサイクルの STFT + 階層クラスタリングから集合通信のスパース性を「トラフィックスケルトン」として間接推論し、probing を full-mesh から 2 桁削減。overlay/underlay を楽観的に分離して 19 コンポーネント種別へ箇所特定、~30s の訓練ラウンド内で precision 98.2%/recall 99.3%(**本 wiki 初のコンテナ訓練ネットワーク障害診断の一次論文**、SIGCOMM 2025, DOI:10.1145/3718958.3750513)
- [[@2025__IWQoS__eACGM - Non-instrumented Performance Tracing and Anomaly Detection towards Machine Learning Systems]] — [[Sun Yat-sen University]] の [[Ruilin Xu]] らによる、AI/ML 全スタック(CUDA/Python/PyTorch/NCCL/GPU)をコード計装ゼロで実行時トレースする非侵入監視フレームワーク [[eACGM]]。eBPF をフレームワーク層のユーザ空間関数トレースへ適用し、libnvml で GPU メトリクスを統合、教師なし GMM(確率密度 < δ で異常)で層別の性能異常を検知。KMeans/IsolationForest/DBSCAN/XGBoost/SVM/RandomForest を全層で上回る(IWQoS 2025, arXiv:2506.02007、OSS shady1543/eACGM)
- [[@2025__arXiv__XPUTimer - Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale]] — [[Shanghai Jiao Tong University]]/[[National University of Singapore]]/[[Ant Group]] の [[Weihao Cui]] らによる、発散 LLM 訓練の異常診断システム [[XPUTimer]]([[Flare]])。非侵入 CPython(PyEval_SetProfile)+ LD_PRELOAD の全スタック計装と、稼働中 ring-allreduce カーネルの SASS レジスタを CUDA-GDB で読む intra-kernel inspecting による O(1) 通信ハング箇所特定で、throughput では見えない持続的「性能回帰」まで issue latency 分布・void percentage で診断。[[Ant Group]] 6,000 GPU で 8 ヶ月運用、再発回帰の協業を 63.5% 削減。**arXiv v2 で Flare に改名**(arXiv:2502.05413, 2025)
- [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]] — Alibaba Cloud の [[Jianbo Dong]]・[[Kun Qian]] らによる、パブリッククラウドの AI 訓練障害診断システム [[Aegis]]。計算と通信の境界にある CCL を差し替えて launch/work-request/completion カウンタを仕込み、顧客コードを一切変えずに計算障害(CL 遅れ)と通信障害(WR<WC)を弁別。箇所特定と根本原因分析を分離し前者に専念。本番で idle time 97%+・restart 84%+ 削減、性能劣化 71% 検知。高位 GPU の MTBF は A100 約 400 日・H100 約 200 日、訓練タスクの 73% が最初の 10 分以内に失敗(**本 wiki 初のパブリッククラウド AI 訓練障害診断の一次論文**、NSDI 2025)
- [[@2025__DSN__LLMPrism - Black-box Performance Diagnosis for Production LLM Training Platforms]] — [[The Chinese University of Hong Kong]]/[[Huawei Cloud]] の Zhihan Jiang・[[Guangba Yu]] らによる、スイッチ層 RoCE ネットワークフローのみから LLM 訓練を診断するブラックボックス性能診断システム [[LLMPrism]]。DP/PP の通信フットプリント差から並列化戦略を逆推定し、BOCD(閾値 0.95)でステップ境界を、k-σ 則(k=3)で異常を検知してタイムラインを再構築。テナントのプライバシーを保ったまま、19 ジョブ/2880 GPU で 0.3% 誤差・並列化識別 100%、[[Platform-X]] で 2024 年 10 月から稼働(**本 wiki 初のネットワークフローからの訓練ブラックボックス診断の一次論文**、DSN 2025, arXiv:2505.00342)
- [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]] — [[The Chinese University of Hong Kong]]/[[Sun Yat-sen University]]/[[Huawei Cloud]] の [[Junjie Huang]]・[[Guangba Yu]] らによる、LLM 訓練障害の自動ログ解析診断 [[L4]]。従来のログ異常検知の 3 指標(レベル・頻度・意味)が訓練ログに通用しない実証(障害指示ログの 54.8% のみ error レベル)を踏まえ、cross-job(成功ジョブとの差分)・spatial(同期ノード間ログの Isolation Forest 外れ値)・temporal(イテレーション間ログ系列の DTW)の 3 パターンで障害指示情報を抽出。F1 0.873・top-5 80.5%、[[Platform-X]] で 428 件の障害研究(障害あたり平均 16.92GB・手動診断 34.7 時間)(**本 wiki 初の LLM 訓練ログ自動解析の一次論文**、ESEC/FSE 2025, arXiv:2503.20263)
- [[@2025__arXiv__TimeCopilot]] — [[Azul Garza]]・[[Renée Rosillo]] による、複数の[[時系列基盤モデル]](TSFM)と LLM を単一の統一 API 下に集約する初のオープンソースなエージェント型予測フレームワーク [[TimeCopilot]]。LLM を (i) パイプライン各ステップの行動決定(オーケストレーション)と (ii) モデル選択・予測の自然言語説明の二役で使い、特徴分析 → モデル選択・評価 → 最終選択・予測の 3 段ワークフロー(Agent)と、TSFM 最大級ハブを直接制御する Forecaster の 2 エントリポイントを提供。[[GIFT-Eval]](24 データセット・144k+ 系列・1.77 億点)で MedianEnsemble([[Chronos-2]]+[[TimesFM]]+[[TiRex]] を isotonic regression で結合)が確率予測 CRPS の全体最良を約 $24 の低コストで達成(点予測 MASE は Chronos-2 に次ぐ 2 位)。[[エージェント型時系列予測]] の Workflow パラダイム代表で、基盤モデル不使用の [[TimeSeriesScientist]] と対照をなす(**本 wiki 初の TSFM アンサンブル型エージェント予測フレームワークの一次論文**、NeurIPS 2025 Workshop BERT2S / arXiv:2509.00616, 2025)
- [[@2025__OSR__Cloud Infrastructure Management in the Age of AI Agents]] — [[Zhenning Yang]]・[[Archit Bhatnagar]]・[[Yiming Qiu]] ほか([[University of Michigan]] / [[University of California, Berkeley]] / [[Andreessen Horowitz]]、[[Ang Chen]] senior・[[Martin Casado]] 共著)による、LLM クラウド管理エージェントのビジョン/ポジション論文。クラウド管理を 4 [[クラウド管理モダリティ|モダリティ]](SDK/CLI/IaC/ClickOps)で捉え、Azure VM 管理の予備実験で provisioning/updates/monitoring の段階 × モダリティのトレードオフを実証(CLI=provisioning 最効率 1.0/1.6、IaC=再作成更新に強く monitoring に弱い 0.40、ClickOps=monitoring 1.0 だが作成は遅く脆い 46 step)。解決スケッチとして user-agent/agent-cloud interface・multi-agent orchestration・exploration/exploitation + workflow caching・guardrail(formal spec/access control/audit trail)・fault tolerance(rollback/self-healing)・human-in-the-loop を提示。同研究室の IaC 群([[Zodiac]]/[[NSync]]/[[Lilac]])を 4 モダリティの IaC として束ねるビジョン論文(**既存 IaC クラスタと agentic SRE/AIOps クラスタを接続**、ACM SIGOPS OSR 2025, DOI:10.1145/3759441.3759443)
- [[@2024__arXiv__FlowTracer - A Tool for Uncovering Network Path Usage Imbalance in AI Training Clusters]] — [[IBM Research]](Yorktown Heights・Haifa)と [[University at Buffalo]] による、AI 分散学習クラスタの ECMP ハッシュ衝突起因のネットワークパス不均衡を可視化するツール FlowTracer。RDMA(RoCE)/TCP フローを実運用トラフィックのままホップバイホップで受動追跡し、新指標 Flow Imbalance Metric(FIM、MAPE ベース)で不均衡を定量化。16 ノード RoCEv2 リーフ・スパイン検証環境で標準 ECMP ルーティング(不均衡 36.5%)と事前設定した静的ルーティング(不均衡 6.2%)を比較する使用例を示す(arXiv 2024、ユーザー提供情報では IEEE ICC 2025 採録・未検証)
- [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]] — [[BUPT]] と [[Douyin Vision]] による、エンドツーエンドの能動プロービングに基づく初のサービス認識型 RoCE ネットワーク監視・診断システム [[R-Pingmesh]]。市販 RNIC の UD QP と CQE タイムスタンプでネットワーク RTT とエンドホスト処理遅延を測り、RNIC 起因とネットワーク内ドロップを区別し、サービス障害がネットワーク起因かを判定する。ToR-mesh プロービングで異常 RNIC をリアルタイム検知し、二分トモグラフィ的投票でリンク/スイッチを箇所特定。数万 RNIC・6 か月の本番運用で 14 種の問題を検知・箇所特定、報告 157 件のスイッチ問題は全件正確・全体 85% 正確、Agent オーバーヘッドは CPU 約 3%・メモリ約 18.5MB(**本 wiki 初の RoCE/RDMA ネットワーク監視の一次論文**、SIGCOMM 2024, DOI:10.1145/3651890.3672264)
- [[@2025__SC__Characterizing GPU Resilience and Impact on AI - HPC Systems]] — [[University of Illinois Urbana-Champaign]]/[[NCSA]]/[[IBM Research]]/[[Nokia Bell Labs]]([[Shengkun Cui]]・[[Ravishankar K. Iyer]] ら)による、NCSA [[Delta]](A100/H100、計 1,056 GPU)の 2.5 年・1,170 万 GPU 時間の運用ログ(XID/Slurm/DCGM)に基づく GPU レジリエンスの世代間比較。H100 はメモリの per-GPU MTBE が A100 の 1/3.2(回復機構 spare row 512 行据え置きで容量 2.4 倍に非対応)と弱体化する一方、GSP/PMU SPI/NVLink 等のハードウェアレジリエンスは大幅向上。MMU/NVLink 以外の GPU エラーはほぼ 100% ジョブ失敗で、99.9% ジョブ可用性には 5% オーバープロビジョニング(1,000 ノードで月 100 万ドル超)が要る(別題 "Story of Two GPUs"、**本 wiki 初の GPU レジリエンス特徴づけの一次論文**、SC 2025, arXiv:2503.11901)
- [[@2025__OSDI__Understanding Stragglers in Large Model Training Using What-if Analysis]] — [[New York University]]([[Jinkun Lin]]・[[Aurojit Panda]]・[[Jinyang Li]])と [[ByteDance]] Seed による、LLM 訓練のストラグラーを **What-if 分析**(ストラグラー不在の理想タイムラインをトレースからシミュレートし実測と対比、$S=T/T_{\text{ideal}}$)で帰属した研究。5 か月・3,079 ジョブの実トレースで 42.5% のジョブが ≥10% スローダウン、全 GPU 時間の 10.4% が浪費。主因はハードウェア障害(問題ワーカー主因は 1.7%)でなく計算側のアルゴリズム的不均衡——パイプラインステージ分割不均衡(39.3%)・シーケンス長不均衡($O(\sum s_i^2)$、21.4%)・Python GC。緩和はシーケンス再分配で 23.9%・計画 GC で 12.6% 改善。分析を監視システム [[SMon]] として本番展開(**本 wiki 初の LLM 訓練ストラグラー分析の一次論文**、OSDI 2025, usenix.org/conference/osdi25/presentation/lin-jinkun)
- [[@2025__SOSP__Robust LLM Training Infrastructure at ByteDance]] — [[ByteDance]]([[Borui Wan]]・[[Liang Xiang]]・[[Chuan Wu]]@[[The University of Hong Kong]] ら)による、LLM 訓練特化の GPU インフラ管理・障害許容システム [[ByteRobust]]。制御プレーン(Robust Controller/Runtime Analyzer)+データプレーン(Robust Agent: Monitor/Diagnoser/CKPT Manager/On-Demand Tracer)で構成し、ETTR(有効訓練時間率)を最大化目標に据え 9,600 GPU・3 か月で最大 97% を達成。設計哲学は「正確な箇所特定より迅速な隔離」——軽量リアルタイム検知 + 階層的停止時診断、解けなければスタックトレースのデータ駆動クラスタリングで並列グループ単位に過剰排除。インフラ障害は件数 11% でも GPU 時間の 82% を消費、ハングは全インシデントの 9.9%。warm standby/hot-update が復旧を最大 10.87×/11.04× 高速化、毎ステップ CKPT のオーバーヘッド 0.9% 未満(**本 wiki 初の耐障害 LLM 訓練インフラの一次論文**、SOSP 2025, arXiv:2509.16293)
- [[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]] — [[Nanjing University]]([[Qingkai Meng]]・[[Chen Tian]] ら)・[[Tencent]]・[[Harvard University]]([[ChonLam Lao]])による、50 万 GPU 級 LLM 訓練データセンターインフラ [[Astral]] の 18 か月の設計・運用経験。3 つの革新=(i) tier-2 まで広げた同一レール相互接続(単一レール 8K GPU・単一 Pod 64K・クラスタ 512K、8K GPU で効率損失 0.6%。物理展開のため分散 HVDC 電源 + 空気液体統合冷却、平均 PUE 最大 16.34% 改善)、(ii) アプリ〜物理の 4 層フルスタック監視 + クロスホスト・階層ログ相関(MTTLF を日→分、fail-stop 12×/fail-hang 25×/fail-slow 約 5×)、(iii) オペレータ粒度予測 [[Seer]](自己補正で数秒・密モデル 0.3% 偏差)。同 Nanjing グループの [[Pulse]] の系譜(**本 wiki 初の超大規模 LLM 訓練データセンターインフラの一次論文**、SIGCOMM 2025, DOI:10.1145/3718958.3750521)
- [[@2025__eBPF__eInfer - Unlocking Fine-Grained Tracing for Distributed LLM Inference with eBPF]] — [[University of Connecticut]] の [[Kexin Chu]] ほか([[UC Santa Cruz]]/[[University of Washington]]/[[Shanghai Jiao Tong University]])による、分散 LLM 推論を要求単位でエンドツーエンドにトレースする初の [[eBPF]] ベースシステム [[eInfer]]。ソース改変・再コンパイルなしに CPU・アクセラレータ・プロセス・ノードをまたぐイベントを一意に関連付け、ベンダー非依存([[CUPTI]] 相当の精度)で本番ワークロードのオーバーヘッドを 4% 未満(サブミリ秒級)に抑える。ランタイム適応型トレーシングで動的ワークロードとアクセラレータ上の計測ギャップに追従(**本 wiki 初の eBPF ベース分散 LLM 推論トレーシングの一次論文**、eBPF Workshop 2025, DOI:10.1145/3748355.3748372)
- [[@2026__MLSys2026__ProfInfer - An eBPF-based Fine-Grained LLM Inference Profiler]] — [[Huawei Hilbert Research Center Dresden]]/[[TU Munich]] の [[Bohua Zou]]・[[Debayan Roy]] らによる、[[eBPF]] の uprobe/uretprobe/tracepoint を [[llama.cpp]] のランタイム関数へ動的アタッチし、ソース改変・再コンパイルなしで token/graph/operator/scheduler の多粒度トレースを取る非侵入プロファイラ [[ProfInfer]]。演算子レベルで [[ハードウェアカウンタ|PMC]] を読み `ggml_tensor` を辿ってハードウェア挙動とモデル構造を対応づけ、Analyzer が ProfDAG/ProfTime([[Perfetto]])/ProfStat の 3 ビューを生成。decode 速度低下は [[libbpf]] で最小 1.7%・token/graph のみなら 0.1% と 4% 未満に収まり、ONNX Runtime profiler(8.91%)を上回る。MoE のボトルネックがメモリ帯域でなくディスク I/O だと特定(**本 wiki 初のオンデバイス LLM 推論プロファイラの一次論文**、arXiv:2601.20755, 2026-01)
- [[@2025__SOSP__Mycroft - Tracing Dependencies in Collective Communication Towards Reliable LLM Training]] — [[ByteDance Seed]] の [[Yangtao Deng]] らによる、[[集合通信]]ライブラリ([[NCCL]])のブラックボックス性を打破して信頼性問題を診断する Coll-level 観測システム [[Mycroft]]。フロー単位・チャンク単位の細粒度な依存性(制御依存・データ依存)を露出させ、グレイフェイラー/フェイルスローの根本原因分析を行う。NCCL への軽量計装(C++ 1,100 行)+固定サイズ環形バッファ+非同期アップロードで臨界経路にほぼオーバーヘッドなく連続トレーシングし、数万 GPU で 90% を 15 秒以内に検知・60% を 20 秒以内に箇所特定。ByteDance に 2024 年 10 月以降 6 か月超デプロイ(**本 wiki 初の集合通信依存トレーシングの一次論文**、SOSP 2025, arXiv:2509.03018)
- [[@2025__HCDS__eGPU - Extending eBPF Programmability and Observability to GPUs]] — [[UC Santa Cruz]] の [[Yiwei Yang]]・[[Tong Yu]]・[[Andrew Quinn]] らによる、[[eBPF]] バイトコードを実行時に [[PTX]] へコンパイルして稼働中の GPU カーネルへ動的注入する初の eBPF ランタイム/フレームワーク [[eGPU]]。稼働中カーネルを中断せずにインストルメンテーションを追加・変更・削除でき、[[NVBit]] などバイナリ書き換え型より低オーバーヘッド。共有メモリ上の eBPF マップで CPU-GPU 間をコピーなしにイベント交換し、LD/ST 計装で NVBit ベースの gpumemtrace より低オーバーヘッドを示す。評価は単一 GPU・マイクロベンチに限定(**本 wiki 初の GPU への eBPF 拡張の一次論文**、HCDS Workshop 2025, DOI:10.1145/3723851.3726984)
- [[@2025__arXiv__Collective Communication for 100k+ GPUs]] — [[Meta]] の [[Min Si]]・[[Pavan Balaji]]・[[James Hongyi Zeng]] らによる、10 万 GPU 超クラスタの LLM ライフサイクル全体(訓練の同期要求から推論の低レイテンシ要求まで)を [[NCCL]] 拡張で一元支援する[[集合通信]]フレームワーク [[NCCLX]]。カスタムトランスポート [[CTran]] はゼロコピー・SM フリー・ホスト駆動で host-initiated / GPU-resident metadata / device-initiated の三実行モードを統一スタックで提供。[[Llama4]] 評価で定常ステップを最大 12% 削減・96K 規模で起動を最大 11 倍高速化・デコードレイテンシ 15〜80% 改善、[[DQPLB]] でスイッチバッファ蓄積を一桁削減(**本 wiki 初の 10 万 GPU 級集合通信フレームワークの一次論文**、arXiv:2510.20171, 2025)
- [[@2024__TOPC__Low-Overhead Trace Collection and Profiling on GPU Compute Kernels]] — [[Polytechnique Montréal]]([[DORSAL lab]])の [[Sébastien Darche]]・[[Michel R. Dagenais]] による、GPU 固有の並列動作を活かしトレースフェーズを区分化してデバイス上のトレース収集オーバーヘッドを類似研究比で 1 桁削減する手法。制御フローが既知であることを利用してバッファを事前確保し決定的実行を保証、LLVM パス(host/device IR)に基づく多段性能解析。[[Rodinia]] で全体実行時間オーバーヘッド平均 1.60×・中央値 1.26×。参照実装 [[hip-analyzer]] は CUDA/[[HIP]] 対応・AMD MI100 でも検証(**本 wiki 初のコンパイル時 GPU トレース計装の一次論文**、ACM TOPC 2024, DOI:10.1145/3649510)
- [[@2024__arXiv__Microsecond-scale Dynamic Validation of Idempotency for GPU Kernels]] — [[Shanghai Jiao Tong University]]([[Institute of Parallel and Distributed Systems|IPADS]])の [[Mingcong Han]]・[[Rong Chen]]・[[Haibo Chen]] による、GPU カーネルの[[べき等性]]をインスタンス単位で実行前に検証する初のシステム [[PICKER]]。カーネルが入力に応じてべき等/非べき等の双方を持つ「条件付きべき等」を発見(6 アプリ 547 カーネル中 490)し、起動引数だけを用いて全インスタンスを 5µs 以内に検証(偽陽性 0・偽陰性 18.54%)。耐障害システム [[Asymmetric Resilience]] の[[チェックポイント]]コストを 115% 超から 4% 未満へ、スケジューラ [[Chimera]] のプリエンプション待ちを平均 84.2% 削減(**本 wiki 初の GPU カーネルべき等性動的検証の一次論文**、arXiv:2410.23661, 2024)
- [[@2025__VLDB__Approximation-First Timeseries Monitoring Query At Scale]] — [[Zeying Zhu]]・[[Kenny Wu]]・[[Zaoxing Liu]]([[University of Maryland]])と [[Jonathan Chamberlain]]・[[David Starobinski]]([[Boston University]])による、時系列モニタリングの近似優先クエリキャッシュ [[PromSketch]]。[[Prometheus]]/[[VictoriaMetrics]] の周期ルールクエリの主要ボトルネックを「繰り返しデータスキャン(CPU 41%/80.2%)」と「重複ウィンドウの繰り返し計算」と特定し、生データでも最終結果でもなく**中間結果**(Exponential Histogram バケット)を in-memory キャッシュ。EH×KLL(EHKLL、quantile 系)と EH×Universal Sketching(EHUniv、distinct/entropy/L2/TopK の GSum 系)を可証明な誤差境界つきで組み合わせ、任意サブウィンドウクエリを支援。Go 約 5K 行・約 30 行パッチで統合、Prometheus の aggregation-over-time の 70% をカバー。平均誤差 5% 以下でレイテンシ最大 2 桁削減、クエリ処理コストを Prometheus 比約 400×・VictoriaMetrics 比 4× 以上削減(**本 wiki 初の近似クエリ処理/時系列モニタリングコスト最適化の一次論文**、PVLDB/VLDB 2025, DOI:10.14778/3742728.3742732, arXiv:2505.10560)
- [[@2025__SC__Fine-grained Automated Failure Management for Extreme-Scale GPU Accelerated Systems]] — [[Intel]]/[[RIKEN Center for Computational Science]] の [[Yonatan Levitt]] らによる、エクサスケール級 GPU 加速システムの MTTR を最小化する自動故障管理システム [[StabilityDB]]。MTBF が世代ごとに低下し続ける前提で、相関イベントを含むイベント履歴を分析する**集中型メタデータベース**・きめ細かな**マルチストライク修復ポリシー**(過剰なノードドレインを防ぎつつ真のハードウェア故障を高精度に特定)・自動回復フレームワークの 3 要素で、ノード単位でなく GPU 単位の細粒度に修復対象を切り分ける。[[Argonne National Laboratory]] の [[Aurora]] スパコン(63,744 GPU)に実導入し、手動保守比で MTTR を最大 84 倍短縮(**本 wiki 初のエクサスケール HPC 自動故障管理の一次論文**、SC 2025, DOI:10.1145/3712285.3759883)
- [[@2026__MLSys2026__Guard - Scalable Straggler Detection and Node Health Management for Large-Scale Training]] — [[Store Foundational AI]]([[Amazon Web Services]])の [[Guanliang Liu]] らによる、大規模学習クラスタの[[ストラグラー]]検知とノード健全性管理システム [[Guard]]。NCCL テスト・GPU バーンインといった既存ヘルスチェックを通過しつつ性能を暗黙に劣化させる**グレーノード**(フェイルスロー)を主要な効率損失源と捉え、学習中の**オンラインモニタリング**(ピアベース相対異常検知 + 段階的緩和)と復帰前の**オフラインノードスイープ**(現実的ワークロード再現による持続性能検証)を閉ループ統合し、急性障害と長期フェイルスローの双方を検知する。大規模事前学習で MFU を最大 1.7 倍改善、ステップ時間分散を 20% から 1% に低減、平均ステップ時間を 17 秒から 10 秒に短縮。検知ツールの一部を [[fkat]] として OSS 化(**本 wiki 初のグレーノード/ノード健全性管理の一次論文**、MLSys 2026 Industry Track Oral)
- [[@2025__arXiv__FlashRecovery - Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs]] — [[iFLYTEK AI Engineering Institute]]/[[University of Science and Technology of China]]/[[Huawei Technologies]] の [[Haijun Zhang]] らによる、LLM 大規模訓練の高速・低コスト障害復旧システム [[FlashRecovery]]。(1) アクティブ障害検知(ハートビート + デバイスプラグイン)で数秒以内に障害を特定(検知 4〜11 秒、PyTorch 既定 1,800 秒比で約 99% 短縮)、(2) スケール非依存タスク再起動でランクテーブル更新を O(1) 化し復旧時間をクラスタ規模からほぼ分離、(3) データ並列複製を用いた**チェックポイントフリー 1 ステップ復旧**で定期チェックポイントの I/O オーバーヘッドを排除。[[Ascend NPU]] 4,800 デバイスで総復旧 150 秒以内、従来手法(175B)比で約 93〜95% 削減(**本 wiki 初のチェックポイントフリー障害復旧の一次論文**、arXiv:2509.03047, 2025-09)
- [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]] — [[Tsinghua University]]/[[Beihang University]]/[[Infrawaves]] の Shicheng Wang らによる、PFC のプロベナンス(来歴)に基づく RDMA 性能異常(NPA)診断システム [[Hawkeye]]。細粒度 PFC 対応テレメトリ・データプレーン内 PFC 因果関係解析・プロベナンスベース診断アルゴリズムの 3 コンポーネントで、PFC backpressure・PFC storm・PFC deadlock を 90% 以上の精度・再現率 100% で診断する。テレメトリ収集スイッチ数を全ポーリング方式の約 1/10 に抑えつつ 100% の因果関係カバレッジを保ち、処理オーバーヘッドを既存手法比 1〜4 桁削減。[[Intel Tofino]] テストベッドと NS-3 で評価(**本 wiki 初の RDMA 性能異常診断/PFC プロベナンスの一次論文**、SIGCOMM 2025, DOI:10.1145/3718958.3750490)
- [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]] — [[Alibaba Group]]/[[Hong Kong University of Science and Technology]] の [[Jianbo Dong]] らによる、通信駆動型の大規模 AI 訓練効率化ソリューション [[C4]]。分散訓練の同質的・反復的負荷ゆえハードウェア異常が[[集合通信]]に特定の症候を生む洞察で、診断サブシステム [[C4D]]([[ACCL]] 拡張)が故障コンポーネントを数十秒で特定・隔離・再開し、性能サブシステム [[C4P]] が予測可能な長寿命フローのトラフィック工学で帯域競合を削減する。エラー誘発ダウンタイムを 31.19% から 1.16% へ、システム効率を 30% から 45% へ引き上げ、本番に 30 か月超展開([[H800]] 評価環境、**本 wiki 初の通信駆動 AI 訓練異常検知/通信最適化の一次論文**、HPCA 2025, IEEE 10946823)
- [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]] — [[Nankai University]] の AIOps グループ(Sibo Xia・[[Shenglin Zhang]]・[[Yongqian Sun]] ら)による、大規模 LLM 訓練クラスタの光トランシーバー故障を**予測と分類**で統合するフレームワーク [[OptProphet]]。特徴量集約で時間的依存と物理的結合をモデル化し、不均衡データを自動処理して予測の感度と分類の特異度を高める。2 つの実世界データセット(Huawei 実運用クラスタ、D1: 10,804 台・20 日、D2: 3,394 台・30 日)で故障予測の平均 F1 0.884(平均 1.11 日前にアラーム)・故障分類の平均 F1 0.855 を達成し SOTA を凌駕(**本 wiki 初の光トランシーバー故障予測/分類の一次論文**、APNet 2025 短編 pp.241–243, DOI:10.1145/3735358.3737815、PDF 原本取り込み済み・図表2点埋め込み)
- [[A Survey of LLM × DATA]] — LLM とデータ管理の双方向的関係(DATA4LLM/LLM4DATA)を 400 超の文献で体系化した包括サーベイ。IaaS(Inclusiveness/Abundance/Articulation/Sanitization)品質枠組みを提案(SJTU/Tsinghua/Alibaba、arXiv:2505.18458, 2025)
- [[@2025__PVLDB__DBAIOps - A Reasoning LLM-Enhanced Database Operation and Maintenance System using Knowledge Graphs]] — [[Wei Zhou]]・[[Xuanhe Zhou]]・[[Guoliang Li]] ら(SJTU/Tsinghua/百盛科技)による初のハイブリッドデータベース O&M システム [[DBAIOps]]。専門家の O&M 経験を 6 頂点型・4 辺型の異種知識グラフ(ExperienceGraph)に符号化し、800 以上の異常モデルと二段階グラフ進化(ADF)で未知異常の診断パスを動的構築。DeepSeek-R1 32B でベースライン比 RCA 精度 +34.85%・人手評価 +47.22%、25 データベースシステム・20 実環境シナリオ稼働(**本 wiki 初の知識グラフ+推論 LLM による DB O&M 診断の一次論文**、PVLDB 2025、DOI:10.14778/3797919.3797937)
- [[LLM4Log]] — [[Concordia University]] SPEAR lab の [[Zeyang Ma]]・[[Jinqiu Yang]]・[[Tse-Hsun Chen|Tse-Hsun (Peter) Chen]] による、LLM ベースログ解析の初のエンドツーエンド systematic review [[LLM4Log (repository)|LLM4Log]]。ソフトウェア runtime log を中心証拠源に固定し、[[ログ生成]]→[[ログパース]]→表現学習→下流タスク([[異常検知]]・[[障害予測]]・[[根本原因分析]]・ログ要約)のパイプライン 7 タスクで 145 論文(2020–2025)を統一タクソノミー化。タスク分布は異常検知(71)+パース(41)で約 2/3、RCA(20)が近年急増。5 設計パターン(prompting/ICL・RAG・fine-tuning・tool/agent・verification)を抽出し、横断結論は「成功システムは無制約生成でなく情報を絞ってから LLM を選択的に呼ぶ階層設計」。162 レコード中、明確な deployment 証拠は 5 のみ・HDFS/BGL 偏重を指摘し、評価の comparability/realism と grounding/privacy を主要課題に挙げる(**本 wiki 初の LLM4Log エンドツーエンドサーベイ**、arXiv:2604.16359v2, 2026, github.com/zeyang919/LLM4Log)
- [[@2024__MSR__FLASH - A Workflow Automation Agent for Diagnosing Recurring Incidents]] — [[Microsoft]] の [[Xuchao Zhang]]・[[Saravan Rajmohan]] らによる、反復インシデント診断を自動化する LLM ワークフローエージェント [[FLASH]](workFLow Automation agent with Status supervision and Hindsight integration)。複雑な TSG 命令を識別ステータスに沿って分解する status supervision と、過去失敗から LLM が生成する hindsight integration で多段診断の信頼性を高める。本番 250 件・5 シナリオで [[TaskWeaver]] 比平均 +13.2%(73.9% 対 60.7%)。実世界 TSG 品質調査で Ambiguous Action 約 40%・そのまま自動化可能な Pass 約 8.5% と、TSG 品質が自動化の律速であることを定量化(**本 wiki 初の [[TSG自動化]] 一次論文の 1 つ**、Microsoft Research, 2024-10)
- [[@2025__arXiv__StepFly - Agentic Troubleshooting Guide Automation for Incident Diagnosis]] — [[Tsinghua University]]/[[Microsoft]] の [[Jiayi Mao]]・[[Saravan Rajmohan]]・[[Dongmei Zhang]] らによる、[[TSG自動化]] のエンドツーエンドエージェント型フレームワーク [[StepFly]]。3 段=① [[TSG Mentor]] で TSG 品質改善(F1 0.81)、② LLM でオフライン前処理し非構造 TSG から構造化実行 DAG と Query Preparation Plugins(QPP)を抽出(DAG F1 94.89%・QPP 抽出 97.3%)、③ DAG ガイド付き scheduler-executor + memory でオンライン実行し独立ステップを並列化(約 46% の TSG が並列化可)。GPT-4.1 で約 94% 成功率、並列化可能 TSG で実行時間 32.9〜70.4% 削減、プロトタイプで緩和時間中央値約 34% 削減。コード github.com/microsoft/StepFly(**本 wiki 初の DAG+QPP オフライン前処理型 TSG 自動化の一次論文**、arXiv:2510.10074, v2 2026-04)
- [[@2024__OSR__LLexus - an AI agent system for incident management]] — [[Microsoft]] の [[Pedro Las-Casas]]・[[Rodrigo Fonseca]] らによる、[[TSG自動化|TSG]] 実行を自動化するインシデント管理 AI エージェント [[LLexus]]。LLM をインシデント時でなく**計画フェーズ(オフライン)に前置**し、[[Semantic Kernel]] + GPT-4-Turbo で TSG を BPMN 風フローチャート(アクション/条件分岐/イベント)へコンパイル、実行時は [[Azure Durable Functions]] 上で既存ツール(Powershell・Kusto)を決定論的に呼ぶ。計画は 1 TSG あたり一回払い $0.60〜$1.71 で、インシデント件数が増えるほどオンライン方式に対しコスト優位が拡大。54 TSG 調査(中央値 815 語・更新中央値 19 日)。既知の反復インシデントにのみ適用可、新種には ReAct 型が必要(**本 wiki 初の計画前置・決定論的実行型 TSG 自動化の一次論文**、ACM SIGOPS OSR 2024, DOI:10.1145/3689051.3689056)
- [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]] — CNIC/CAS の [[Changhua Pei]]・[[ByteDance]] の [[Tieying Zhang]]・[[Dan Pei]]([[Tsinghua University]])らによる、SOP 強化型マルチエージェント RCA システム Flow-of-Action。SOP フロー(match_sop/generate_sop/generate_sop_code/run_sop/match_observation)でエージェントの幻覚を抑制し、thought-actionset-action-observation パラダイムで多様な観測に対する行動選択を改善。GPT-4-Turbo で LA=70.89%・TA=57.12%(平均 64.01%)を達成し、ReAct(35.50%)を LA+23%・TA+28% 上回る(90 件・9 障害種・GoogleOnlineBoutique+ChaosMesh, **本 wiki 初の SOP コード変換型マルチエージェント RCA の一次論文**、WWW Companion '25, DOI:10.1145/3701716.3715225)
- [[@2026__arXiv__Large Language Models for Agentic NetOps and AIOps - Architectures, Evaluation, and Safety]] — [[Muhammad Bilal]]・[[Jon Crowcroft]] ら(Lancaster University / University of Cambridge / Nanjing University of Information Science and Technology / TU Wien)による、agentic [[NetOps]] と AIOps を横断するサーベイ。中心命題は「運用上の信頼性はモデル自体でなくモデルを取り巻く機構(typed tool interface・provenance/freshness-aware retrieval・明示的 budget と stopping rule・least-privilege・書き込み境界の verification gate)から来る」。文献を autonomy hierarchy / tool scope / evidence trace / [[エージェント運用安全性|assurance contract]] の 4 軸で整理し、評価は静的 QA を超え workflow 中心(trace 品質・bounded tool use・sandbox replay・rollback-aware な canary)であるべきと論じ、prompt injection・retrieval poisoning・telemetry integrity・excessive agency 等の脅威を扱う(**本 wiki 初の agentic NetOps/AIOps 横断サーベイ・安全性の形式化**、arXiv:2605.12729, 2026)
- [[@2026__TOSEM__TVDiag - A Task-oriented and View-invariant Failure Diagnosis Framework for Microservice-based Systems with Multimodal Data]] — [[Wuhan University]] の [[Shuaiyu Xie]]・[[Jian Wang]]・[[Bing Li]] らによる、マイクロサービス向けマルチモーダル障害診断フレームワーク [[TVDiag]]。タスク指向学習(TO)で「RCL はトレース/メトリクス、FTI はログが支配的」というモダリティ-タスク嗜好を教師あり対照学習で増幅し、クロスモーダル関連付け(CM)でビュー不変情報を抽出、グラフ拡張(AUG)でデータ不足に対処する。4 データセットで HR@1 最低 +20.16%・F1-score 最低 +3.08% を SOTA 比で達成(**本 wiki 初のタスク指向マルチモーダル障害診断の一次論文**、TOSEM Vol.35 No.2 Article 40, January 2026, DOI:10.1145/3734868)
- [[@2024__PVLDB__D-Bot - Database Diagnosis System using Large Language Models]] — [[Tsinghua University]] の [[Xuanhe Zhou]]・[[Guoliang Li]] らによる、LLM ベースのデータベース異常診断システム D-Bot。サマリツリー知識抽出・BM25/Sentence-BERT プロンプト生成・UCT 木探索・7 エキスパート非同期協調により、DBA の 1〜2 時間の診断を 10 分/$1.8 に短縮。539 件ベンチマークで DNN/DecisionTree 比 8〜54% 向上・HumanDBA と競争力のある精度。アブレーションで知識削除が最大 −64.1%・木探索削除が −35.85%(**DB ドメイン特化 LLM RCA の代表的実証論文**、PVLDB Vol.17 / VLDB 2024, DOI:10.14778/3675034.3675043)
- [[@2025__TSC__TAMO - Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems]] — [[Shandong University]] の [[Xiao Zhang]]・[[Dongxiao Yu]] と [[Beihang University]] の [[Fuzhen Zhuang]] らによる、クラウドネイティブシステム向けツール支援型 LLM RCA フレームワーク [[TAMO]]。双分岐拡散モデル(T1)・FFT+GAT 箇所特定(T2)・Transformer+GAT 障害分類(T3)と GPT-4 エキスパートエージェントで、3 モダリティ統合・コンテキスト制限・動的依存グラフという LLM-RCA の 3 課題を同時解決。HolisticRCA 比 Acc@1 +4.8%・MiPr +10.8%、アブレーションで T1 削除が最大性能劣化(Acc@1 −28pt)(**ツール支援型 LLM マルチモーダル fine-grained RCA の実証一次論文**、IEEE TSC 2025, arXiv:2504.20462)
- [[@2025__TKDE__OpDiag - Unveiling Database Performance Anomalies Through Query Operator Attribution]] — [[Peking University]] の [[Shiyue Huang]]・[[Bin Cui]] と [[ZTE Corporation]] による、クエリ演算子帰属によるデータベース性能異常診断フレームワーク [[OpDiag]]。三段階 ML モデル(Tree-CNN + 加算アグリゲータ + ランダムフォレスト)と三段階特徴量帰属(Tree Shap → Integrated Gradient × 2)で、演算子→クエリ→KPI→異常の階層を逐次遡及。[[DBPA]] 合成ベンチマークで top-2 内 100%・[[ZTE Corporation]] 実産業事例で DBA 診断時間 1/3〜1/2 削減(**本 wiki 初の演算子レベル DB 自動診断の一次論文**、IEEE TKDE Vol.37 No.6 June 2025, DOI:10.1109/TKDE.2025.3557049)
- [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]] — [[Nankai University]] の [[Yongqian Sun]]・[[Shenglin Zhang]] と [[Tsinghua University]] の [[Dan Pei]] らによる、ECD・FT・RCCA を単一パイプラインに統合した最初のソフトウェア変更評価フレームワーク [[SCELM]]。RAG + 7B LLM + マルチモーダルデータ変換(ログの意味情報保持・異常形状自然言語化)で、変更管理ライフサイクルを自動化。D1:ECD F1=1.0・FT F1=0.964・RCCA Top1=0.775、D2:ECD F1=0.942・FT F1=0.865・RCCA Top1=0.879 を達成。11 か月以上の本番稼働で誤り変更解決時間 90% 削減(**本 wiki 初の ECD・FT・RCCA 統合変更管理フレームワークの一次論文**、FSE Companion '25, DOI:10.1145/3696630.3728561)
- [[@2025__SIGMOD__AgentTune - An Agent-Based Large Language Model Framework for Database Knob Tuning]] — [[Renmin University of China]]/[[ByteDance]] の [[Yiyan Li]]・[[Haoyang Li]]・[[Jing Zhang]]・[[Cuiping Li]]・[[Hong Chen]]・[[Renata Borovica-Gajic]] ほかによる、4 専門 LLM エージェント(Workload Analyzer → Knob Selector → Range Pruner → Configuration Recommender)+ ビームサーチ木探索でデータベースノブチューニングを自動化するフレームワーク [[AgentTune]]。セントロイド距離ランキングによる構成空間での多数決(自己整合性)と、ルールベース検証 + Range Pruner の融合で 6 ベンチマーク全実験にわたり Invalid Times=0 を達成。PIE・スループット・レイテンシの全指標で SOTA を更新し、GPT-4 コスト $20.17/898 秒/100 ステップを報告。新規メトリクス PIE(Performance Improvement Efficiency = P_gap/P_default / T_opt)を提案(**本 wiki 初の LLM エージェントベース DB ノブチューニングの一次論文**、SIGMOD 2025, DOI:10.1145/3769758)
- [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]]
- [[@2020__SC20__Live Forensics for HPC Systems - A Case Study on Distributed Storage Systems]] — [[Saurabh Jha]] ほか(UIUC/NCSA)による、HPC 分散ストレージ(Blue Waters Cray Sonexion)向け近リアルタイム障害フォレンジクスフレームワーク [[Kaleidoscope]]。Store Pings 能動プローブ + 因子グラフ PGM で箇所特定 99.3%・診断 95.8%(2 年間 843 件本番インシデント)を実現し、NetBouncer 比で TP 1.67 倍・アラーム数 1/24 を達成。オーバーヘッド < 0.01%。(SC 2020)
- [[@2026__arXiv__CUJBench - Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend]] — [[Haoming Meng]] による、ブラウザ可視証拠とバックエンド可観測性を統合した初のクロスモーダル障害診断ベンチマーク [[CUJBench]]。87 シナリオ・5 障害ファミリー・決定論的スナップショット評価。6 モデル評価で A@1=19.7%・天井=52%。ブラウザ限定エージェント(A@1=28%)がフルツールセットエージェント(19.9%)を上回るという反直感的結果と、クロスモーダル統合ボトルネックの定量化(**本 wiki 初のブラウザ可視層込みクロスモーダル障害診断ベンチマークの一次論文**、arXiv:2604.23455, 2026) — [[Nankai University]] の [[Binpeng Shi]]・[[Shenglin Zhang]] と [[Huawei Cloud]]・[[Dan Pei]](Tsinghua)による、クラウドインシデントのトラブルシューティングワークフロー自動生成フレームワーク [[FlowXpert]]。事前定義オントロジーによるインシデント固有ノード中心の知識グラフ基盤 + Planner(PPO)・Scorer(DPO)の Multi-Agent Coevolution で、手動 7 時間を 22.1 秒に短縮・本番 10 週間 承認率約 80%。STEPScore と OpsFlowBench を新規提案(**本 wiki 初のワークフロー自動生成の一次論文**、KDD 2025, DOI:10.1145/3711896.3737221)
- [[Lustre Unveiled]] — [[Anjus George]] ほか([[Oak Ridge National Laboratory]] NCCS / [[Whamcloud]]/[[DDN]])による [[Lustre]] の包括的サーベイ。25 年の歴史・アーキテクチャ(MDS/OSS/LDLM/LNet)・設計進化・GPFS/BeeGFS/DAOS/Ceph との比較・[[Frontier]]/[[Orion]] エクサスケール実績(700 PB, 4.7 TiB/s read)・将来方向性(WBC/CSDC/FLR EC/MDT プール/LMR)を 109 ページに凝縮。**章単位に再取り込み済み(2026-09-02)。各章 source はハブ entity からたどる。**Top500 上位 10 中 6 台が Lustre 採用(**本 wiki 初の並列ファイルシステム一次論文**、ACM Trans. Storage Vol.21 No.3, 2025, DOI:10.1145/3736583)
- [[@2019__arXiv__The Lustre Storage Architecture]] — [[Peter J. Braam]]([[Cluster File Systems]])による Lustre の原初設計文書「Lustre Book」。2001–2005 年にかけて執筆された 539 ページのアーキテクチャ・設計 API・マニュアルを 2019 年に arXiv へ公開。MDS/OST/DLM/Portals の 4 層設計、メタデータライトバックキャッシュやクラスタ化 MDS の初期構想、設計の不確実性と代替案の記録を含む(**本 wiki 初の HPC ストレージ設計文書**、arXiv:1903.01955, cs.OS)
- [[@2026__NSDI__EROICA - Online Performance Troubleshooting for Large-scale Model Training]] — Alibaba Cloud の ~100,000 GPU 本番クラスタで 1.5 年運用した LMT 性能トラブルシューティングシステム。全ワーカー同時オンラインプロファイリング + 関数挙動パターン差分で 97.5% 診断成功率を達成(NSDI 2026)
- [[@2026__NSDI__Supercharging Packet-level Network Simulation of Large Model Training via Memoization and Fast-Forwarding]] — LLM 訓練の繰り返し競合パターンとステディステートをメモ化・早送りで活かす Wormhole が ns-3 比 744× 高速化を誤差 1% 未満で達成(NSDI 2026)
- [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] — [[Qingyang Yu]] ほか([[Tsinghua University]]/CNIC/[[Nankai University]]/[[Tencent]])による WWW 2023 論文(DOI:10.1145/3543507.3583302)。コールメトリクスデータ(CMD)で構築するコールグラフに存在する「曖昧性(AmSit)」を初めて定式化し、回帰ベースの解消アルゴリズム AmSitor と4段階フレームワーク CMDiagnostor を提案。実世界大規模データ(65件・8K+マイクロサービス)で HR@5=0.94・MRR=0.83 を達成し最強ベースライン MicroHECL を 14% 上回る。(aiops / rca / microservice / call-metric)
- [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]] — PrvTel(NSDI 2026)— ε-差分プライバシー付きの軽量 VAE でネットワーク・クラウドテレメトリを保持し、無損失圧縮比で 50 倍のコスト削減とクロスフィールドクエリ精度 60% 向上を両立
- [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]] — Meta の本番 DCN 設計自動化システム。インテント駆動コンパイラで高レベル設計インテントをスイッチ設定に変換。6 年間・18 種類・約 900 DCN、100K-GPU AI スーパークラスタを支える(NSDI 2026)
- [[@2026__NSDI__FAST - An Efficient Scheduler for All-to-All GPU Communication]] — MoE AllToAllv の動的歪みをスケール内リバランス + Birkhoff 分解で解く多項式時間スケジューラ。64 GPU で 221 µs、AMD Megatron-LM で RCCL 比最大 4.48× 向上(NSDI 2026)
- [[@2026__NSDI__HeteCCL - Synthesizing Near-Optimal Collective Communication Schedules for Heterogeneous GPU Clusters]] — 東北大学(中国)・Alibaba Cloud によるヘテロジニアス GPU クラスタ向け集合通信スケジュール自動合成ツール。チャンキングで均質化、CEGIS で探索削減、NCCL 比最大 2.8× 帯域幅・訓練効率 23〜37% 改善(NSDI 2026)
- [[@2024__IEEE CLOUD__Enabling Programmable Metric Flows]] — [[IBM Research]] の [[Kangjin Wang]] らによるプログラマブルメトリクスフローフレームワーク [[PMF]]。collect-first→use-first パラダイムと LP 最適化でメトリクスパイプラインの冗長収集を排除(IEEE CLOUD 2024)
- [[@2023__ICSE__LogReducer - Identify and Reduce Log Hotspots in Kernel on the Fly]] — [[Tencent]]/HUST の [[Guangba Yu]]・[[Pengfei Chen]] らによるカーネルログホットスポット動的削減ツール [[LogReducer]]。eBPF + EMFP(実効メッセージ頻度)で [[WeChat]] 本番 1 年超稼働、ログ量 70〜95% 削減(ICSE 2023)
- [[@2024__ESEM__Reducing Events to Augment Log-based Anomaly Detection Models - An Empirical Study]] — ログイベント削減が異常検知モデルに与える影響の実証研究 [[LogCleaner]]。TF-IDF/クラスタリング/エントロピーの 3 戦略を 6 モデル×4 データセットで比較(ESEM 2024)
- [[@2023__NSDI__Hindsight - Tracing Edge-Cases in Distributed Systems]] — [[Jonathan Mace]] ら [[Max Planck Institute for Software Systems]] による遡及的トレースサンプリングシステム [[Hindsight]]。全リクエストを軽量にトレースし障害検知後に完全トレースを収集、毎秒 100 万リクエスト・30 秒以内(NSDI 2023)
- [[@2025__ISSTA__Tracezip - Efficient Distributed Tracing via Trace Compression]] — [[Sun Yat-sen University]] の [[Zhuangbin Chen]]・[[Zibin Zheng]] らによるトレース圧縮システム [[Tracezip]]。共通性・変動性分解で圧縮率 80% 超を達成しつつ異常検知精度を保持(ISSTA 2025)
- [[@2024__IEEE CLOUD__Astraea - Unleashing Performance Insights with Online Probabilistic Tracing]] — [[Boston University]] の [[Mehmet Toslali]]・[[Ayse K. Coskun]] らによるオンライン確率的トレーシング [[Astraea]]。スパンレベル [[VAIF]] 重要度スコアリングで 1% サンプリングでもヘッドベース同等の性能分析(IEEE CLOUD 2024)
- [[@2025__ASPLOS__Mint - Cost-Efficient Tracing with All Requests Collection via Commonality and Variability Analysis]] — [[Sun Yat-sen University]]/[[Alibaba Group]] の [[Guangba Yu]]・[[Pengfei Chen]] らによる全リクエスト収集トレーシング [[Mint]]。共通性・変動性分析でストレージ 60% 削減・クエリ遅延 40% 削減(ASPLOS 2025)
- [[@2024__FSE__TraStrainer - Adaptive Sampling for Distributed Traces with System Runtime State]] — [[Huawei Technologies]] の [[Haiyu Huang]]・[[Pengfei Chen]] らによる適応的トレースサンプリング [[TraStrainer]]。システム実行時状態で tail-based sampling を強化、従来手法比 F1 +15%(ESEC/FSE 2024)
- [[@2025__arXiv__AutoForge - Environment Synthesis for Agentic RL]] — [[Tongyi Lab]]([[Alibaba Group]])の [[Shihao Cai]]・[[Runnan Fang]] らによる、ツール記述文書から模擬環境と高難度タスクを自動合成しエージェント型 RL で言語エージェントを訓練するフレームワーク [[AutoForge]]。GRPO を環境レベルへ拡張した ERPO と模擬ユーザー誤りマスク(MEU)で訓練安定性を確保し、Qwen3-30B-A3B(活性 3B)で τ-bench・τ²-Bench・VitaBench の 200B 未満オープンソース最良を達成、クローズドソースに匹敵(arXiv:2512.22857, 2025)
- [[@2025__arXiv__AgentRL - Training Language Model Agents with Reinforcement Learning]] — [[Tsinghua University]]/[[Zhipu AI]] の [[Hanchen Zhang]]・[[Xiao Liu]] らによる、マルチターン・マルチタスクのエージェント型 RL 訓練フレームワーク [[AgentRL]]。完全非同期パイプライン + コンテナ化異種環境 + 交差方策サンプリング + タスクアドバンテージ正規化で、Qwen2.5-32B が 5 タスク平均成功率 70.4% を達成し GPT-5/Claude-Sonnet-4/DeepSeek-R1 を凌駕。マルチタスク単一モデルがシングルタスク特化群の最良値に匹敵し BFCL-v3 への正転移も確認(**本 wiki 初のマルチターン・マルチタスク RL エージェント訓練の一次論文**、arXiv:2510.04206, 2025)
- [[@2025__Together AI__DeepSWE - Training a Fully Open-sourced State-of-the-Art Coding Agent by Scaling RL]] — [[Agentica]]/[[Together AI]] の [[Michael Luo]]・[[Naman Jain]] らによる、完全オープンソースの RL 訓練コーディングエージェント [[DeepSWE]]。Qwen3-32B から SFT なしの純粋 RL(GRPO++)のみで訓練し、[[SWE-Bench-Verified]] で Pass@1 42.2%・Pass@16 71.0%・ハイブリッド Best@16 59.0% を達成しオープンウェイト SOTA。新規の Compact Filtering で不完全軌跡をフィルタし、テスト通過の二値報酬のみで訓練。64 H100 で 6 日間、4,500 問の [[R2E-Gym]] サブセットを使用。モデル・コード([[rLLM]])・データ・ログを完全公開(**本 wiki 初の RL スケーリングによるコーディングエージェント訓練の一次情報**、together.ai/blog/deepswe, 2025-07-02)
- [[@2025__arXiv__Scaling Behaviors of LLM Reinforcement Learning Post-Training]] — [[Shanghai AI Laboratory]]/[[University of Oxford]]/[[University of Science and Technology of China]] の [[Zelin Tan]]・[[Chen Zhang (Shanghai AI Lab)]]・[[Zhenfei Yin]] らによる、LLM の RL 事後学習(GRPO)のスケーリング則を 63 モデル超で初めて体系化した研究。テスト損失と計算量/データ量の関係が対数線形べき乗則に従い、学習効率 k(N) が K_max に飽和すること(32B 以降で顕著)を実証(R² > 0.99)。Qwen2.5(0.5B〜72B)と Llama 3(1B〜70B)で再現、アーキテクチャ非依存。データ再利用は τ ≤ 25 で有効(**本 wiki 初の RL 事後学習スケーリング則の体系的実証論文**、arXiv:2509.25300, 2025)
- [[@2026__arXiv__IsoCompute Playbook - Optimally Scaling Sampling Compute for LLM Reinforcement Learning]] — [[UC San Diego]]/[[MBZUAI]]/[[Carnegie Mellon University]] の [[Aviral Kumar]] らによる、LLM の RL 事後学習におけるサンプリング計算量の最適配分を体系化した研究。約 120,000 H200-hours の実験で、計算量最適な並列ロールアウト数がシグモイド状に増加し飽和すること、容易問題ではシャープニング・困難問題ではカバレッジ拡張という二重機構を解明。問題間干渉が並列ロールアウトのスケーリングを正当化する主要機構であることを実証(**本 wiki 初の LLM RL サンプリング計算量スケーリング則の一次論文**、arXiv:2603.12151, 2026)
- [[@2025__arXiv__Agent-R1 - Training Agents with End-to-End RL]] — [[University of Science and Technology of China]] の [[Mingyue Cheng]] らによる、エージェント型 RL のための統合的かつモジュール式フレームワーク [[Agent-R1]]。ステップレベル MDP 抽象化と柔軟なコンテキスト管理を核に、PPO・GRPO・Reinforce++・RLOO を同一基盤上で比較。GSM8K/HotpotQA/ALFWorld/WebShop の 4 ベンチマークで評価(arXiv:2511.14460, 2025)
- [[@2025__arXiv__The Art of Scaling Reinforcement Learning Compute for LLMs]] — [[Meta]]/[[UT Austin]]/UC Berkeley/Harvard/Periodic Labs の [[Devvrit Khatri]]・Lovish Madaan・[[Rishabh Agarwal]] らによる、LLM の RL 後訓練における計算スケーリングの初の大規模系統的研究(400,000 GPU 時間超)。シグモイド型飽和曲線で漸近性能 A と計算効率 B を分離して評価するフレームワークを提案し、6 軸の設計選択アブレーションから統合レシピ [[ScaleRL]] を構築。[[PipelineRL]]-8 + CISPO + FP32 精度修正等を組み合わせ、8B で A=0.61(GRPO 0.45・DAPO 0.53 を凌駕)、100,000 GPU 時間のランで 50k からの外挿が実測と整合。Scout 17B×16 MoE で A=0.71(**本 wiki 初の RL 計算スケーリングの予測的フレームワークの一次論文**、arXiv:2510.13786, 2025)
- [[@2025__arXiv__Scaling Up RL - Unlocking Diverse Reasoning in LLMs via Prolonged Training]] — [[NVIDIA]] の [[Mingjie Liu]]・[[Yejin Choi]] らによる、1.5B パラメータモデルへの長期 RL 訓練の体系的調査。GRPO + DAPO 拡張(分離クリッピング・動的サンプリング)+ KL 正則化 + 参照方策リセットの訓練レシピで 5 ドメイン(数学・コード・STEM・論理パズル・指示追従)を統合訓練。8 ランの逐次訓練(ハードリセット)で [[Nemotron-Research-Reasoning-Qwen-1.5B]] を開発し、数学 +14.7%・コード +13.9%・論理パズル +54.8% を達成。[[VeRL]] フレームワーク上で 4×8×H100-80GB・約 16,000 GPU 時間(arXiv:2507.12507, 2025)
- [[@2025__arXiv__The Landscape of Agentic Reinforcement Learning]] — [[Shanghai AI Laboratory]]/[[University of Oxford]]/[[National University of Singapore]] の [[Guibin Zhang]]・[[Lei Bai]] らによる、エージェント型 RL の 95 ページ包括サーベイ(TMLR 2026)。能力軸(計画・ツール使用・記憶・推論・自己改善・知覚)×タスクドメイン軸(検索・コード・数学・GUI・視覚・身体化・マルチエージェント等)の二重タクソノミーを提案し、600 超の文献を網羅。GRPO 族急成長・ツール統合推論の標準化・RL メカニズム論争(増幅器 vs 新知識)・環境スケーリングのボトルネックの 4 主要知見(arXiv:2509.02547, 2025)
- [[@2025__arXiv__Training Long-Context Multi-Turn SWE Agents with Reinforcement Learning]] — [[Nebius AI]] の [[Alexander Golubev]] らによる、長コンテキスト・マルチターン SWE エージェントの RL 訓練パイプライン。RFT + DAPO の 2 段階で Qwen2.5-72B-Instruct を教師蒸留なしに訓練し、SWE-bench Verified Pass@1 を 11% → 39%。SWE タスクを POMDP として定式化し、ステップベースの長さペナルティとコンテキスト長(65K→131K)の段階的拡張カリキュラムを設計。サンプリング分布の一貫性(top-k/min-p の暗黙有効化による訓練不安定性)と長軌跡フィルタリングの罠を報告。**PDF 本文 ingest 済み**(arXiv:2508.03501, 2025)
- [[@2026__Cursor__Introducing Composer 2.5]] — [[Cursor]] のブログ記事。AI コーディングエージェントモデル Composer 2.5 を発表。[[Moonshot]] の [[Kimi K2.5]](オープンソースチェックポイント)を基盤に、ターゲット RL(テキストフィードバックによる信用割当緩和)、合成タスク 25 倍拡大(特徴削除ベース)、[[Sharded Muon]](分散直交化 + dual-mesh HSDP)を適用。訓練中に Python 型キャッシュ逆工学・Java バイトコード逆コンパイルによる報酬ハッキングを観察。[[SpaceXAI]] と協業し [[Colossus 2]] の百万 H100 相当で次世代モデル開発中(**本 wiki 初の産業コーディングエージェント訓練の一次情報**、Cursor Blog 2026-05-18)
- [[@2025__DSN-W__Characterizing Modern GPU Resilience and Impact in HPC Systems - A Case Study of A100 GPUs]] — [[University of Illinois Urbana-Champaign]]/[[IBM Research]]/[[Nokia Bell Labs]] の [[Shengkun Cui]]・[[Archit Patke]] らによる、[[Delta]] の A100 106 ノード/448 GPU を対象にした 3 年・12.5M GPU 時間の GPU レジリエンスケーススタディ。運用期の per-node MTBE は 199h→154h へ 23% 悪化、GPU メモリは非メモリハードウェアより 160 倍高信頼、弱点は GSP(ジョブ失敗率 100%)・PMU SPI(97.56%)・MMU(90.48%)・NVLink(53.75%)。A100 の row remapping/error containment は運用期の訂正不能メモリエラーを全て緩和し、可用性は 99.5%(1 日 7 分ダウンタイム)(DSN-W 2025, DOI:10.1109/DSN-W65791.2025.00031)
- [[@2025__arXiv__MiniMax-M1 - Scaling Test-Time Compute Efficiently with Lightning Attention]] — [[MiniMax]] による世界初のオープンウェイト大規模ハイブリッドアテンション推論モデル [[MiniMax-M1]]。[[Lightning Attention]] とソフトマックスアテンションを 7:1 で交互配置し、MoE(456B/45.9B 活性化/32 エキスパート)と組み合わせて 100 万トークンのネイティブコンテキスト長と 100K 生成時 FLOPS を DeepSeek R1 比 25% に削減。新 RL アルゴリズム [[CISPO]](IS 重みクリッピング)で DAPO 比 2 倍のステップ効率を達成し、512 [[H800]] GPU・3 週間・約 53.4 万ドルで RL 完了。SWE-bench Verified 56.0%・TAU-bench(airline) 62.0%・OpenAI-MRCR(128k) 73.4% でオープンウェイト最上位帯(**本 wiki 初のハイブリッドアテンション推論モデルの一次論文**、arXiv:2506.13585, 2025)
- [[@2026__arXiv__The MiniMax-M2 Series - Mini Activations Unleashing Max Real-World Intelligence]] — [[MiniMax]] による MoE 言語モデルファミリー。229.9B 総パラメータ・トークンあたり 9.8B 活性化の 62 層 decoder-only Transformer(256 細粒度エキスパート・シグモイドゲーティング・192K コンテキスト)。エージェントネイティブ RL システム [[Forge]](ホワイトボックス/ブラックボックスエージェント統一・Windowed FIFO・接頭辞木マージで最大 40× 高速化)と CISPO 方策最適化でエージェントコーディング・コワーク・推論の各ベンチマークでフロンティアモデルと対等な性能を達成。M2.7 は自律的に訓練ランをデバッグし自身のスキャフォールドを修正する自己進化の初期的実装を示す(**本 wiki 初の MoE + エージェントネイティブ RL の一次論文**、arXiv:2605.26494, 2026)
- [[@2025__arXiv__Kimi K1.5 - Scaling Reinforcement Learning with LLMs]] — [[Moonshot]](月之暗面)による RL 訓練マルチモーダル LLM の技術報告。長コンテキスト RL(128k)とオンラインミラー降下変種を組み合わせ、MCTS・価値関数・プロセス報酬モデルを排除したシンプルな RL フレームワークで OpenAI o1 に匹敵する推論性能(AIME 77.5、MATH-500 96.2)を達成。パーシャルロールアウト(長軌跡の分割再利用)、ハイブリッドデプロイメント([[Megatron-LM]] + [[vLLM]] + [[Mooncake]] RDMA 転送)による RL インフラ最適化、および long2short 手法(モデルマージ・最短拒否サンプリング・DPO・long2short RL の 4 経路)で短 CoT モデルでも GPT-4o を最大 +550% 上回る(arXiv:2501.12599, 2025)
- [[@2025__Moonshot AI__Kimi-Researcher - End-to-End RL Training for Emerging Agentic Capabilities]] — [[Moonshot]] によるエンドツーエンドのエージェント型 RL で訓練した自律型リサーチエージェント [[Kimi-Researcher]]。SFT やワークフロー設計なしに REINFORCE のみで HLE 8.6% → 26.9% Pass@1(SOTA)・xbench-DeepSearch 69% pass@1 を達成。3 ツール(並列検索・テキストブラウザ・コード実行)、ガンマ減衰報酬、コンテキスト管理(10→50+ イテレーション拡張)、ターンレベル部分ロールアウト(1.5 倍高速化)。矛盾情報の自己修正や検証行動の創発を報告(**本 wiki 初のエンドツーエンド RL リサーチエージェントの産業実装**、moonshotai.github.io/Kimi-Researcher/, 2025-06-20)
- [[@2025__arXiv__Kimi K2 - Open Agentic Intelligence]] — [[Moonshot AI]] による 1.04 兆パラメータ(活性化 32B)の超疎 MoE LLM [[Kimi K2]] のテクニカルレポート。384 エキスパート(活性化 8 + 共有 1)・MLA・64 アテンションヘッドの構成で、[[MuonClip]] オプティマイザ(Muon + QK-Clip)により 15.5 兆トークンをロススパイクなしに事前学習。事後学習では MCP ツール 3,000 超 + 合成ツール 20,000 超のエージェント型データ合成と、RLVR + 自己批判型ルーブリック報酬の統合 RL。SWE-bench Verified 65.8%・τ2-Bench 66.1 でオープンソース非思考モデル SOTA。スパーシティスケーリング則(固定活性化パラメータ・総エキスパート増加で一貫した損失低下)を実証。16-way PP + 16-way EP + ZeRO-1 DP、interleaved 1F1B(DualPipe 不採用)(**本 wiki 初の 1 兆パラメータ規模 MoE のエージェント特化訓練の一次論文**、arXiv:2507.20534, 2025)
- [[@2022__ACL__GLM - General Language Model Pretraining with Autoregressive Blank Infilling]] — [[Zhengxiao Du]]・[[Yujie Qian]]・[[Xiao Liu]]・[[Ming Ding]]・[[Jiezhong Qiu]]・[[Zhilin Yang]]・[[Jie Tang]]([[Tsinghua University]]・[[BAAI]]・[[MIT CSAIL]]・[[Shanghai Qi Zhi Institute]])による ACL 2022 論文。**[[自己回帰空白埋め]]** を単一目的関数として導入し、自然言語理解 (NLU)・条件付き生成・非条件付き生成の三種タスクを統一的に扱う汎用言語モデル [[@2022__ACL__GLM - General Language Model Pretraining with Autoregressive Blank Infilling|GLM]] を提案。**[[2D位置符号化]]**(原文中位置 + スパン内位置)と**スパンシャッフリング**で BERT 同等パラメータ・同等データから SuperGLUE 平均 +4.6〜5.0% を達成。NLU をクローズ問題として自己回帰生成で解き事前学習-ファインチューニング不整合を解消。BERTLarge 1.25 倍(410M)の単一モデルで NLU・生成・LM すべてに最良の単一モデル性能。後年の GLM-130B・ChatGLM・GLM-4・GLM-4.5・GLM-5 ファミリーの起点(**本 wiki 初の GLM 系統の起点論文**、arXiv:2103.10360, ACL 2022)
- [[@2025__arXiv__GLM-4.5 - Agentic Reasoning and Coding Foundation Models]] — [[Zhipu AI]] / [[Tsinghua University]] による総パラメータ 355B・活性化 32B の MoE LLM [[@2025__arXiv__GLM-4.5 - Agentic Reasoning and Coding Foundation Models|GLM-4.5]]。Agentic・Reasoning・Coding (ARC) の 3 能力を単一モデルに統合し、23T トークンの多段階事前学習(汎用 → 推論 → 中間チェックポイント) + エキスパートモデル反復後訓練(蒸留 + SFT + RL)。**ハイブリッド推論モード**(思考/非思考)を単一モデルで実現するエキスパート蒸留パイプライン、**深さ優先設計**(幅を絞り層数を増やす)が推論能力を向上させる実証的知見、QK-Norm + 部分 RoPE による位置エンコード安定化。TAU-Bench 70.1%・SWE-bench Verified 64.2%・AIME 24 91.0% でオープンソース全体 3 位、エージェント能力で Claude-Sonnet-4 と対等。コンパクトな GLM-4.5-Air (106B/12B) も提供(**本 wiki 初の ARC 統合 MoE モデルの一次論文**、arXiv:2508.06471, 2025)
- [[@2026__arXiv__GLM-5 - From Vibe Coding to Agentic Engineering]] — [[Zhipu AI]] / [[Tsinghua University]] による次世代 [[@2026__arXiv__GLM-5 - From Vibe Coding to Agentic Engineering|GLM-5]]。**[[DSA]] (DeepSeek Sparse Attention)** を採用した 744B/40B MoE で 28.5 兆トークンを訓練。**非同期 RL インフラ ([[slime]] フレームワーク)** で生成と訓練を分離し長期エージェントロールアウトの GPU 利用率を最大化、エージェント協調(コワーク)を 4 能力 + 6 タスクで体系化。Artificial Analysis Intelligence Index v4.0 でオープンウェイト初のスコア 50 を達成、SWE-bench Verified 77.8%・BrowseComp(文脈管理あり) 75.9% でオープンソース SOTA。「Vibe Coding」(意図表現) → 「Agentic Engineering」(複雑長期工程の自律遂行) というスローガンで GLM-4.5 からのスコープ拡張を明示(**本 wiki 初の非同期エージェント RL × DSA の一次論文**、arXiv:2602.15763, 2026)
- [[@2026__arXiv__GLM-OCR Technical Report]] — [[Zhipu AI]] / [[Tsinghua University]] による文書理解特化の小型 VLM [[@2026__arXiv__GLM-OCR Technical Report|GLM-OCR]]。**0.9B パラメータという小規模モデルながら OmniDocBench v1.5 で 94.62 点を達成し、235B Qwen3-VL や Gemini-3 Pro を上回る 1 位**。**PP-DocLayout-V3 によるレイアウト解析 → 並列リージョン認識** の 2 ステージパイプラインで複雑レイアウト(LaTeX 数式・複雑表)の幻覚を抑制。**パラメータ共有ドラフトヘッドの [[マルチトークン予測]]** で 1 ステップあたり平均 5.2 トークン生成(約 50% スループット向上、OCR の構造トークン局所性が高受容率を生む)。Stage 1-4 の段階訓練(事前学習 → 知識アライメント → SFT → GRPO ベース RL)で構造的出力の信頼性を強化(**本 wiki 初の文書理解特化 MoE-VLM の小型実装**、arXiv:2603.10910, 2026)
- [[@2025__arXiv__Nemotron 3 - Efficient and Open Intelligence]] — [[NVIDIA]] によるオープン LLM ファミリー [[Nemotron 3]] の技術報告書。ハイブリッド Mamba-2–Transformer [[Mixture-of-Experts|MoE]] アーキテクチャに [[LatentMoE]](潜在次元でのエキスパート計算・通信削減を精度向上に再投資)と NVFP4 ネイティブ事前学習(BF16 比 <1% 損失差で 25T トークン安定)を統合。Nano(30B/3B)は同規模 Transformer MoE 比 3.3 倍の推論スループット、MTP 投機的復号で承認率約 97%。マルチ環境同時 RL([[GRPO]] + マスク付き重要度サンプリング)で数学・コード・ツール利用・長コンテキスト(最大 100 万トークン)を同時最適化。[[NeMo-RL]]・NeMo-Gym を Apache 2.0 公開(arXiv:2512.20856, 2025)
- [[@2025__arXiv__OLMo 3]] — [[Allen Institute for AI]](AI2)の OLMo Team による完全オープン LLM ファミリー [[OLMo 3]] の技術報告書(118 ページ)。7B/32B の decoder-only Transformer(SWA 3/4 層 + フルアテンション 1/4 層)で Base・Think・Instruct・RL-Zero の 4 変種を提供。モデルフロー全体(全段階・チェックポイント・データポイント・依存関係)を公開。事前学習データ [[Dolma 3]](5.9T トークン、[[Duplodocus]] による兆トークン規模の 3 段階重複排除、品質認識型アップサンプリング)、後訓練データ [[Dolci]](Delta Learning: Qwen 3 32B/0.6B 能力デルタ DPO)、RL インフラ [[OlmoRL]](GRPO 7 改善・完全非同期パイプライン・4 倍スループット)。OLMo 3.1 Think 32B は MATH 96.2・AIME 2024 80.6 で完全オープンモデル最強。1024 H100 GPU・約 56 日・$2.75M(**本 wiki 初の完全オープン LLM のモデルフロー全公開の一次論文**、arXiv:2512.13961, 2025)
- [[@2026__arXiv__Composer 2 Technical Report]] — [[Cursor Research]] によるエージェント型コーディングモデル [[Composer 2]] の技術報告書。[[Kimi K2.5]] ベースの 1.04T/32B MoE を、コード特化の継続事前学習(32K→256K コンテキスト、MXFP8 on B300、パープレキシティと下流 RL 報酬の対数線形相関を確認)の後、Dr. GRPO 変種による大規模非同期 RL(4 サービス分離: 訓練/環境/推論/評価、[[Fireworks AI]] との地理的分散推論、[[Anyrun]] Firecracker VM 環境)で訓練。CursorBench 61.3・SWE-bench Multi 73.7・Terminal-Bench 61.7 でコスト精度パレート最適。RL が平均性能と best-of-K 性能の双方を同時改善する証拠を示す。[[DeepEP]] エキスパート並列・[[ThunderKittens]] GPU カーネルを活用(**本 wiki 初の産業コーディングエージェントモデルの技術報告書**、arXiv:2603.24477, 2026)
- [[@1983__Automatica__Ironies of Automation]] — [[Lisanne Bainbridge]]([[University College London]])による自動化のパラドクスの古典的論考。自動化が人間オペレータの問題を除去するどころか拡大する 5 つのアイロニー(設計者のアイロニー、残余タスクのアイロニー、技能劣化、監視の不可能性、訓練投資の逆説)を体系化。agentic SRE・SRE AI Autonomy Levels・エージェント運用安全性の理論的基盤(Automatica Vol.19 No.6, 1983)
- [[@1985__Tandem__Why Do Computers Stop and What Can Be Done About It]] — [[Jim Gray]]([[Tandem Computers]])による耐障害システムの古典論文。2,000 台超・1,300 システム年超の障害統計で管理(42%)とソフトウェア(25%)が障害主因であることを実証し、Bohrbug/Heisenbug の二分法、プロセスペアの 5 類型、永続プロセスペア+トランザクションによるソフトウェア耐障害性の設計論を体系化(Tandem TR 85.7, 1985)
- [[@2003__USITS__Why Do Internet Services Fail and What Can Be Done About It]] — [[David Oppenheimer]]・[[Archana Ganapathi]]・[[David A. Patterson]]([[UC Berkeley ROC Project]])による 3 大規模インターネットサービスの障害事後報告 500 件超の分析。オペレータエラー(特に設定ミス)がサービス障害と修復時間の最大原因であることを実証(USITS '03, 2003)
- [[@2007__LISA__On Designing and Deploying Internet-Scale Services]] — [[James Hamilton]]([[Microsoft]] Windows Live Services Platform)によるインターネットスケールサービス設計のベストプラクティス集。「障害を前提とした設計」「すべてを自動化」「単純さの保持」の 3 信条と 10 領域の運用知見を体系化(LISA '07, 2007)
- [[@2016__OReilly__SRE Book - Foreword]] — [[Mark Burgess (SRE)|Mark Burgess]] による SRE Book 序文。[[Google]] がシステム管理を第一原理から問い直し、ソフトウェアと自動化で運用をエンジニアリングへ変革した経緯を俯瞰。「実装は一時的だが、文書化された推論は無価値にならない」(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Preface]] — [[Betsy Beyer]]・Chris Jones・Jennifer Petoff・[[Niall Murphy]] 編。SRE が運用ライフサイクル(総コストの 40〜90%)に焦点を当てる 3 次元と、[[Margaret Hamilton]] の Apollo プログラムを SRE の先駆として位置づける序論(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Chapter 1 Introduction]] — [[Ben Treynor Sloss]] による SRE の定義。従来の sysadmin モデルの線形スケーリングと開発/運用対立の限界を示し、50% ルール・[[エラーバジェット]]・プレイブック(MTTR 3 倍短縮)・変更管理(障害の 70% が変更起因)を体系化(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Chapter 3 Embracing Risk]] — Marc Alvidrez による章。100% 信頼性の不合理性(ユーザー知覚の限界・非線形コスト曲線)を論じ、リクエスト成功率による計測と[[エラーバジェット]]による共通インセンティブの創出を提示(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Chapter 4 Service Level Objectives]] — Chris Jones・[[John Wilkes]]・[[Niall Murphy]]・Cody Smith による章。SLI/SLO/SLA フレームワークの定義、パーセンタイル重視、サービス種別ごとの優先指標、[[エラーバジェット]]による停滞防止を体系化(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Chapter 5 Eliminating Toil]] — Vivek Rau による章。トイル=手作業・反復的・自動化可能・戦術的・持続的価値なし・線形スケール。50% ルール(実測平均 33%)。過度なトイルはキャリア停滞・士気低下・離職を招く(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Chapter 6 Monitoring Distributed Systems]] — Rob Ewaschuk による章。ホワイトボックス/ブラックボックスモニタリング、4 つのゴールデンシグナル(レイテンシ・トラフィック・エラー・サチュレーション)、パーセンタイル分布、アラート設計の 5 つの問い(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Chapter 7 Automation at Google]] — [[Niall Murphy]]・John Looney・Michael Kacirek による章。自動化の 5 段階階層、MySQL の Borg 移行(Decider、95% 削減)、Diskerase 障害(自動化の増幅リスク)(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Part III Practices]] — サービス信頼性ヒエラルキー。モニタリング→インシデント対応→RCA→テスト→キャパシティプランニング→アーキテクチャ→プロダクトローンチの 7 層(O'Reilly, 2016)
- [[@2016__OReilly__SRE Book - Chapter 34 Conclusion]] — Benjamin Lutch による章。SRE の二重の役割(パイロットとエンジニア)、航空産業のアナロジー、中核的関心事の不変性(O'Reilly, 2016)
- [[@2021__SoCC__Characterizing Microservice Dependency and Performance]] — [[Shutian Luo]] ほか([[SIAT]]/[[Alibaba Group]])による Alibaba トレース分析。マイクロサービスのコールグラフがヘビーテール分布に従いツリー状に展開すること、レイテンシの 4 パターンを定量化(SoCC 2021)
- [[@2022__SoCC__How to Fight Production Incidents]] — [[Supriyo Ghosh]] ほか([[Microsoft]])による大規模クラウドサービス 152 件の高重篤インシデント実証研究。コード/設定バグが 40%、90% 超がコード変更なしで緩和、MTTR 中央値 113 分、認知時間が MTTR の 72.5%(SoCC 2022)
- [[@2024__PACMCAS__The Tale of Errors in Microservices]] — [[I-Ting Angelina Lee]]・[[Zhizhou Zhang]]・[[Milind Chabbi]] による [[Uber]] の非致命的 RPC エラーの大規模分析。6,000 超マイクロサービスの RPC エラーの 29.35% が非致命的、クリティカルパス分析と LR Estimator による優先順位付けを提案(PACM CAS 2024)
- [[@2023__USENIX ATC__Lifting the veil on Meta's microservice architecture]] — [[Darby Huye]]・[[Yuri Shkuro]]・[[Raja R. Sambasivan]] による [[Meta]] のマイクロサービストポロジとリクエストワークフローの初の公開分析。22 か月で 2 倍成長、「不適合」エンティティの存在、[[Canopy]] トレーシング基盤の解説(USENIX ATC 2023)
- [[@2024__KDD__Microservice Root Cause Analysis with Limited Observability]] — [[Zhe Xie]] ほか([[Tsinghua University]])による限定観測可能性下の RCA 手法 [[LatentScope]]。介入認識モジュールで因果推論を潜在空間上に持ち込み、不完全なメトリクスでも根本原因を特定(KDD 2024)
- [[@2023__SIGCOMM__Network-Centric Distributed Tracing with DeepFlow]] — [[Junxian Shen]] ほか([[Tsinghua University]]/[[Yunshan Networks]])による eBPF ベースのネットワーク中心トレーシングシステム [[DeepFlow]]。コード修正ゼロ・暗黙のコンテキスト伝搬で分散トレースを実現(SIGCOMM 2023)
- [[@2021__ESEC-FSE__Identifying Bad Software Changes via Multimodal Anomaly Detection]] — [[Nengwen Zhao]] ほか([[Tsinghua University]]/[[China Guangfa Bank]])による不正ソフトウェア変更検出システム [[SCWarn]]。ビジネス KPI・マシン KPI・ログのマルチモーダル LSTM で F1 0.95、大規模商業銀行で実証(ESEC/FSE 2021)
- [[@2022__USENIX ATC__CRISP - Critical Path Analysis of Large-Scale Microservice Architectures]] — [[Zhizhou Zhang]]・[[Milind Chabbi]] ほかによるクリティカルパス分析システム [[CRISP]]。[[Uber]] の 4 万エンドポイントに実投入、TraceAnomaly 比で訓練 27.77 倍・推論 66.85 倍高速化、偽陽性 50% 削減(USENIX ATC 2022)
- [[@2023__SOSP__A Cloud-Scale Characterization of Remote Procedure Calls]] — [[Korakit Seemakhupt]]・[[Arvind Krishnamurthy]] ほか([[Google]]/UW/UCSD)による Google 規模の RPC 特性分析。スループットが年率 30% 増、レイテンシ中央値がミリ秒スケール、障害の多くが非致命的(SOSP 2023)
- [[@2024__arXiv__DeepSeek LLM - Scaling Open-Source Language Models with Longtermism]] — [[DeepSeek-AI]] の初代基盤モデル。7B/67B の dense Transformer でデータ品質がスケーリング則の最適配分を左右することを実証。非埋め込み FLOPS/トークン M を新モデルスケール表現として導入。[[HAI-LLM]] フレームワークで 2,048 GPU 訓練(arXiv:2401.02954, 2024)
- [[@2024__arXiv__DeepSeek-Coder - When the Large Language Model Meets Programming]] — [[Daya Guo]] ほか([[DeepSeek-AI]])によるコード特化 LLM。リポジトリレベルのデータ構築と FIM 学習戦略の体系的最適化により 6.7B モデルで CodeLlama-34B を凌駕。87 言語・2T トークンで訓練(arXiv:2401.14196, 2024)
- [[@2024__arXiv__DeepSeek-V3 Technical Report]] — [[DeepSeek-AI]] の 671B MoE モデル。[[Multi-head Latent Attention]]・補助損失なし負荷分散・マルチトークン予測・FP8 混合精度・[[DualPipe]] パイプライン並列により 2,788K H800 GPU 時間(約 557 万ドル)でロススパイクなし訓練(arXiv:2412.19437, 2024)
- [[@2025__arXiv__DeepSeek-R1 - Incentivizing Reasoning Capability in LLMs via Reinforcement Learning]] — [[DeepSeek-AI]] の推論特化モデル。SFT なし純粋 RL(R1-Zero)で推論能力の創発を大規模に実証。GRPO + 規則ベース報酬のみで aha モーメント等の高次推論パターンが出現。4 段パイプラインで $294K のフロンティア性能(arXiv:2501.12948, 2025)
- [[@2025__arXiv__DeepSeek-V3.2 - Pushing the Frontier of Open Large Language Models]] — [[DeepSeek-AI]] の V3 後継。DSA スパースアテンション・GRPO 4 安定化技術・1,800 以上の合成エージェント環境により、事後学習の計算投資を事前学習コスト 10% 超に引き上げオープンモデルとプロプライエタリモデルの差を大幅に縮小(arXiv:2512.02556, 2025)
- [[@2024__arXiv__DeepSeek-VL2 - Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding]] — [[DeepSeek-AI]] の VLM。動的タイリング視覚エンコーダと MoE 言語バックボーンにより活性化パラメータ 4.5B で密モデル 8B 級に匹敵。3 バリアント間のルーティング関数遷移が MoE 設計の過渡的状態を示す(arXiv:2412.10302, 2024)
- [[@2025__DeepSeek__DeepSeek-V4 - Towards Highly Efficient Million-Token Context Intelligence]] — [[DeepSeek-AI]] の最新フラグシップ。[[MegaMoE]] ウェーブベースカーネル融合・CSA+HCA ハイブリッド圧縮アテンション(KV キャッシュを BF16 GQA8 比約 2% に削減)・Muon ZeRO ハイブリッドオプティマイザにより 100 万トークンコンテキストの効率的推論を実現(2025)
- [[@2004__TDSC__Basic Concepts and Taxonomy of Dependable and Secure Computing]] — [[Algirdas Avizienis]]・[[Jean-Claude Laprie]]・[[Brian Randell]]・[[Carl Landwehr]] による TDSC 創刊号(2004)。[[IFIP WG 10.4]] 25 年間の合意形成の集大成。ディペンダビリティの 6 属性・障害→エラー→失敗の基本連鎖・8 視点 31 障害クラスのタクソノミー・4 達成手段体系を確立。SRE・AIOps・セキュリティ研究の概念的基盤
- [[@2017__NeurIPS__Attention Is All You Need]] — [[Ashish Vaswani]]・[[Noam Shazeer]] ほか([[Google Brain]]/Google Research/トロント大学)による NeurIPS 2017 論文。再帰・畳み込みを排し自己アテンションのみに基づく [[Transformer]] を提案。WMT 2014 英独 BLEU 28.4、英仏 BLEU 41.8 を 8 GPU・3.5 日で達成し、LLM 時代の基盤アーキテクチャを確立
- [[@2018__OpenAI__Improving Language Understanding by Generative Pre-Training]] — [[Alec Radford]]・[[Ilya Sutskever]] ほか([[OpenAI]])による技術報告書(2018)。Transformer デコーダによる教師なし事前学習+教師あり微調整の二段階転移学習パラダイム(GPT-1)を確立。12 タスク中 9 で SOTA を達成
- [[@2019__OpenAI__Language Models are Unsupervised Multitask Learners]] — [[Alec Radford]]・[[Jeffrey Wu]] ほか([[OpenAI]])による技術報告書(2019)。1.5B パラメータの [[GPT-2]] が [[WebText]] で訓練され、ゼロショットで 8 言語モデリングデータセット中 7 で SOTA。モデル規模と性能の対数線形関係を実証
- [[@2020__NeurIPS__Language Models are Few-Shot Learners]] — [[Tom Brown]]・[[Jared Kaplan]] ほか([[OpenAI]])による NeurIPS 2020 論文。175B パラメータの [[GPT-3]] が文脈内学習(少数ショット・ワンショット・ゼロショット)により微調整なしで多数の NLP タスクで競争力ある性能を達成。スケーリングと文脈内学習能力の滑らかな関係を実証
- [[@2026__CoNEXT__ChainScope - Balancing Accuracy and Overhead in Non-intrusive Distributed Tracing of Microservices]] — [[Ruipeng Hong]]・[[Gabriele Castellano]]・[[Pengfei Chen]]・[[Massimo Gallo]] ほか([[Sun Yat-sen University]]/[[Huawei Technologies]])による CoNEXT 2026 論文。eBPF カーネル内コンテキスト伝搬と IP レベルパケットタギングにより、コード改変なし・HTTPS/TLS 透過の非侵襲型分散トレーシングを実現。1% サンプリング時に精度 100%・CPU 2〜3%・性能低下 4% 未満を達成し、DeepFlow/Beyla を大幅に上回る
- [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]] — [[Zexin Wang]]・[[Changhua Pei]] ほか(CNIC CAS/UCAS/ICT CAS/Singapore Management University)による IEEE TSE 掲載論文(arXiv 2026-06-01)。LLM エージェントシステムの異常を Intra-Agent(推論/行動/メモリ/セキュリティ)× Inter-Agent(タスク仕様/オーケストレーション/通信/終了)の 2 軸で体系化し、AgentOps フレームワーク(モニタリング/異常検知/根本原因局所化/解決の 4 段階)を提案する最初の包括的サーベイ
- [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]] — [[Longlong Xu]]・[[Zeyan Li]]・[[Dan Pei]] ほか([[Tsinghua University]]/[[ByteDance]]/CNIC CAS)による ICML 2026 論文。学習不要のプラグアンドプレイフレームワーク [[SPRINT]] を提案し、季節成分をパターン複製・トレンドを解像度補間でダウンサンプリング空間にて予測することで、任意の TSFM の精度を平均 +19%・推論時間を最大 16.87 倍・最大メモリを 6.35 倍改善する
- [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]] — [[Runzhou Wang]]・[[Shenglin Zhang]]・[[Dan Pei]] ほか([[Nankai University]]/[[Tsinghua University]])による arXiv 2026-04 論文。マイクロサービスの RCL においてエンティティレベル異質性(サービス vs ホスト)が障害伝播を非対称クロスレイヤー支配にすることを実証し、半教師あり枠組み [[NexusRCL]] を提案。HD1 A@1 82.50%・HD2 A@1 68.75% を達成し全ベースラインを大幅に上回る(arXiv:2604.26670v1)
- [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]] — [[Debopam Bhattacherjee]] ほか [[Microsoft]] による arXiv 2026-05 プレプリント(cs.DC)。風力発電サイトに GPU を配置する [[AI Greenferencing]] 展開モデルを提案し、可変風力電力下で LLM 推論 SLO を維持するクロスサイトルーター [[XWind]] を設計・実装。64 × A100 テストベッドで Max-FLOPS に対し P99 E2E レイテンシを最大 52% 削減、静的ルーティング比 69× 改善を実証(arXiv:2605.23348v1)
- [[@2026__応用物理__機械学習の原点 - 統計的機械学習の世界]] — [[赤穂昭太郎]]([[産業技術総合研究所]])による応用物理誌「機械学習・AI×応用物理」シリーズ第2回(2026年5月号、Vol.95 No.5 pp.274-279)。深層学習より統計的機械学習(少量データ・ドメイン知識・解釈性)が有効な場面を整理し、線形モデル・スパースモデリング・k-NN・[[アンサンブル学習]]・ベイズモデリング・[[ベイズ最適化]]を概説。応用物理研究者が機械学習へ参入するための基礎講座
- [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]] — [[Changhua Pei]]・[[Gaogang Xie]]・[[Dan Pei]] ほか(CNIC CAS/UCAS/Alibaba/Tsinghua University)による arXiv 2026-06-03 論文。オブザーバビリティをデータ中心からオブジェクト中心へ転換する統一オントロジーフレームワーク [[UModel]] と U-SPL を提案。[[Alibaba Cloud]] 本番 1 年以上・RCA 精度 8% 向上(arXiv:2606.04799v1)
- [[@2022__NeurIPS__Chain-of-Thought Prompting Elicits Reasoning in Large Language Models]] — [[Jason Wei]]・[[Denny Zhou]] ほか([[Google Brain]])による NeurIPS 2022 論文。プロンプト例示に中間推論ステップの系列(連鎖思考)を加えるだけで LLM の複雑推論能力を大幅に向上させる手法を提案。PaLM 540B が 8 件の CoT 例示のみで GSM8K SOTA を達成。連鎖思考推論は約 100B パラメータ以上の創発的能力(source / paper)
- [[@2022__IEEE ACCESS__A Survey on Observability of Distributed Edge & Container-Based Microservices]] — [[Muhammad Usman]]・[[Simone Ferlin]]・[[Anna Brunstrom]]・[[Javid Taheri]]([[Karlstad University]])による IEEE ACCESS 2022 論文。分散エッジ・コンテナ化マイクロサービスのオブザーバビリティを網羅的に調査した初のサーベイ。三本柱(ログ/メトリクス/トレース)・SRE ゴールデンシグナル・オブザーバビリティ要件(F*/C* 枠組み)・オープン課題を整理(survey / paper)
- [[@2015__CSUR__Performance Anomaly Detection and Bottleneck Identification]] — [[Olumuyiwa Ibidunmoye]]・[[Francisco Hernández-Rodriguez]]・[[Erik Elmroth]]([[Umeå University]])による ACM Computing Surveys 2015 サーベイ(Article 4, Vol.48 No.1, DOI:10.1145/2791120)。PADBI(Performance Anomaly Detection and Bottleneck Identification)分野の体系的サーベイ。性能異常を point/collective/contextual/pattern の 4 種に分類し、ボトルネックを resource saturation/contention × single/multiple/shifting で整理。4 検知戦略(シグネチャ/観測/知識/フロー)と統計/ML 手法の分類体系を提供。調査対象 53% が PAD のみ・PADBI 統合は 18%。クラウド固有課題(スケール・マルチテナンシー・動的リソース管理)を明示(survey / paper)
- [[@2021__ISSRE__How Long Will it Take to Mitigate this Incident for Online Service Systems]] — [[Weijing Wang]]・Junjie Chen・Lin Yang([[Tianjin University]])・[[Hongyu Zhang]]([[University of Newcastle]])・[[Qingwei Lin]] ほか([[Microsoft]])による IEEE ISSRE 2021 論文(DOI:10.1109/ISSRE52982.2021.00024)。Microsoft 20 大規模システム・4 年分インシデントデータの最初の TTM 実証研究。T3(最終担当チーム確定後)が TTM の平均 70.20% を占めることを初めて定量化。TTMPred(2 段階アテンション付き双方向 GRU + 連続損失関数)が回帰ベースライン比 MAE 25.66% 改善・分類で F 値 19.09%〜153.34% 改善(empirical study / deep learning / incident management / paper)
- [[@2023__ISSRE__How to Manage Change-Induced Incidents - Lessons from the Study of Incident Life Cycle]] — [[Yujin Zhao]]・[[Ling Jiang]]・[[Ye Tao]]・[[Songlin Zhang]]・[[Changlong Wu]]・[[Yifan Wu]]・[[Tong Jia]]・[[Ying Li]]・[[Zhonghai Wu]]([[Peking University]]/[[Alibaba Group]])による IEEE ISSRE 2023 論文(DOI:10.1109/ISSRE59848.2023.00027)。2 年間・231 件の変更起因インシデントを「導入→検知→緩和」の 3 段で分析。モニター検知は利用者検知の 7.67 倍速い(TTD: 65.6 対 564.0)が 50.6% のインシデントで利用者が先に検知。RbIC は RaIC より TTM を 40.6% 短縮(38.8 対 65.3)。コード変更 54.5%・構成変更 28.1% が主因(empirical study / paper)
- [[@2023__ICSE-SEIP__An Empirical Study on Change-induced Incidents of Online Service Systems]] — [[Yifan Wu]]・Bingxu Chai・[[Ying Li]]・Bingchang Liu・Jianguo Li・Yong Yang・Wei Jiang([[Peking University]]/[[Ant Group]])による ICSE-SEIP 2023 論文(DOI:10.1109/ICSE-SEIP58684.2023.00027)。Ant Group(3000 以上のマイクロサービス)の 161 件の変更起因インシデントを分析。変更起因インシデントは High/Critical 重篤度が通常の 2.6 倍(13% 対 5%)、TTD 75 パーセンタイルが 26.8 倍長い。4 課題:①不足したモニタリング指標・②不正確な変更モニタリング・③低ビジネストラフィック・④非効率な異常変更箇所特定(empirical study / paper)
- [[@2024__ICSE-SEIP__Intelligent Monitoring Framework for Cloud Services - A Data-Driven Approach]] — [[Pooja Srinivas]] ほか [[Microsoft]](ICSE-SEIP 2024)。791 本番サービス・30,920 モニタからリソースクラス 13 種・SLO タイプ 9 種のオントロジーを構築し、プロトタイプ学習でモニタ推奨を自動化。大多数のクラスで再現率 1.00、ユーザー評価 4.27/5.0
- [[@2024__Microsoft Research Blog__Intelligent Monitoring - Towards AI-Assisted Monitoring for Cloud Services]] — [[Microsoft]] Research Blog(2024-03-19)。ICSE-SEIP 2024 論文の一般向け解説+Monitor Scorecards(ベイズ統計+時系列モデリングによるモニタ有効性評価)将来計画を公開
- [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]] — [[Vaibhav Ganatra]] ほか [[Microsoft]](ESEC/FSE 2023)。Microsoft 300 超サービス・2022 年間の本番インシデント約 950 件を分析し、ミス検知 6 カテゴリタクソノミ(Missing monitor/alert 40.41% が最大)を構築。ミス検知の 27.25% がアウテージに発展し、顧客報告インシデントは TTD 10.7 倍・TTM 3.75 倍と定量化。サービス成熟度が「何を監視すべきか」を、依存関係数が「どう監視すべきか」を決める
- [[@2004__OSDI__Correlating Instrumentation Data to System States - A Building Block for Automated Diagnosis]] — [[Ira Cohen]]・[[Moises Goldszmidt]]・[[Terence Kelly]]・[[Julie Symons]]([[Hewlett Packard Labs]])・[[Jeffrey S. Chase]]([[Duke University]])による OSDI 2004 論文。124 システムメトリクスから TAN(ツリー拡張ナイーブベイズネットワーク)で SLO 違反と相関する少数(3–8 個)のメトリクスの組み合わせを自動特定。balanced accuracy 87–94%、単一メトリクスルールの不十分さを定量化。「相関 ≠ 因果」と「メトリクス帰属(metric attribution)」の先駆的な定式化
- [[@2017__FAST__Chronix - Long Term Storage and Retrieval Technology for Anomaly Detection in Operational Data]] — [[Florian Lautenschlager]]・[[Michael Philippsen]]・[[Andreas Kumlehn]]・[[Josef Adersberger]]([[QAware GmbH]]/[[Friedrich-Alexander-Universität Erlangen-Nürnberg]])による USENIX FAST '17 論文(pp. 229–242)。運用データの異常検知に特化したドメイン固有 TSDB [[Chronix]] を提案。DDC(Date-Delta-Compaction)・汎用バイナリデータモデル(メトリクス/ログ/トレース格納可能)・ビルトイン高水準解析関数(outlier/trend/frequency/sax/fastdtw)・コミッショニング方法論により、108.2 GB 実運用データで汎用 TSDB(InfluxDB/OpenTSDB/KairosDB)比ストレージ 20〜68% 削減・データ取得 80〜92% 短縮・解析関数 73〜97% 短縮を達成(paper / storage / time-series / anomaly-detection)
- [[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]] — [[Chunhui Shen]]・[[Dan Pei]]・[[Feifei Li]] ほか([[Alibaba Group]]/[[Zhejiang University]]/[[Tsinghua University]])による PVLDB 2023 論文(Vol.16 No.12 pp.3715–3727)。共有なし + 共有ストレージのハイブリッドアーキテクチャ・TSM エンジン・Seriescache・前処理ダウンサンプリング・パイプライン実行エンジン・Lindorm ML(インデータベース ML)を提案。10M 時系列規模で InfluxDB/TimescaleDB 比書き込み 10× 高速、クエリ最大 16× 低レイテンシ、ML 実行 2× 短縮を実証(paper / time-series / distributed / database)
- [[@2024__JNCA__A survey on intelligent management of alerts and incidents in IT services]] — [[Qingyang Yu]]・[[Nengwen Zhao]]・[[Dan Pei]] ほか([[Tsinghua University]] / [[BizSeer]])による JNCA 2024 論文(Vol.224, Article 103842)。alert management(correlation・storm handling・determination)と incident management(representation・linking・triage・mitigation・resolution)を統合した AIM アーキテクチャ Fig.5 を提示し、2008-2022 の代表 89 件を体系化。alert と incident を別ライフサイクルとして分離する設計と 3 種 alert determination の直列統合(Fig.7)を将来方向として提示(paper / aiops / survey / alert-management / incident-management)
- [[@2011__World Wide Web__An up-to-date survey in web load balancing]] — [[Katja Gilly]]([[Miguel Hernández University]])・[[Carlos Juiz]]・[[Ramon Puigjaner]]([[University of Balearic Islands]])による World Wide Web 2011 サーベイ(DOI:10.1007/s11280-010-0101-5、27p)。2010 年時点のウェブロードバランシング機構を OSI 層別に網羅。L2/L3 コンテンツ非依存(DR・NAT・IPTun)と L7 コンテンツ依存(TCP Hand-off・TCP Splicing・Socket Cloning・TCP Rebuilding 等)のアーキテクチャ、および局所性考慮/非局所性考慮/QoS 考慮の 26 分散方針(Table 3)を体系化。オープン課題: 動的コンテンツのサービス時間予測、監視情報の陳腐化、仮想化対応、エネルギー効率。(web-systems / distributed / load-balancing)
- [[@2017__arXiv__A Survey of Distributed Message Broker Queues]] — [[Vineet John]]・[[Xia Liu]]([[University of Waterloo]])による arXiv:1704.00411(2017-04-03, 8p)。[[Apache Kafka]] と [[AMQP]]/[[RabbitMQ]] を 5 ノード Flotilla ベンチで直接対比し、Kafka はスループット優位(SendFile + sequential write + batching)、AMQP はレイテンシ優位(push + 既定非永続化)・信頼性優位という設計対比を経験的に示す(paper / messaging / distributed / survey)
- [[@2022__ISSRE__Going through the Life Cycle of Faults in Clouds - Guidelines on Fault Handling]]
- [[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]]
- [[@2025__KDD__Can Slow-thinking LLMs Reason Over Time - Empirical Studies in Time Series Forecasting]] — [[Mingyue Cheng]]・[[Jiahao Wang]]・[[Daoyu Wang]]・[[Xiaoyu Tao]]・[[Qi Liu]]([[University of Science and Technology of China]])による WSDM 2026 採録論文(DOI:10.1145/3773966.3777931, arXiv:2505.24511, 12p)。訓練不要のスロー思考 LLM([[DeepSeek-R1]] バックボーン)を時系列予測に適用する TimeReasoner を提案し、ETTh1 MSE 5.4 で iTransformer(7.5)・PatchTST 等の深層学習ベースラインを上回る。タイムスタンプ削除で MSE 5.4 → 25.3 の劣化、CoT 過長で精度低下、温度 τ=0.6 がスイートスポット(paper / time-series / llm / reasoning)
- [[@2025__NeurIPS__Time-R1 - Post-Training Large Vision Language Model for Temporal Video Grounding]] — [[Renmin University of China]] AIM3 Lab × [[MiLM Plus]]([[Xiaomi]])による NeurIPS 2025 採択論文(35p)。映像言語モデル(LVLM)の時間的映像グラウンディング(TVG)タスクに RLVR(GRPO + tIoU 報酬 + フォーマット報酬)を初適用。2.5K サンプル RL が 339K サンプル(136 倍)の SFT-LoRA を超え、TVGBench で
[email protected]=41.8 を達成し Gemini-2.5-Pro(39.1)を上回る。VideoMME も 53.0 → 54.2 に改善(paper / video-understanding / vlm / reinforcement-learning)
- [[@2026__ICLR2026__TimeOmni-1 - Incentivizing Complex Reasoning with Time Series in Large Language Models]] — [[Tong Guan]]・Zijie Meng・Dianqi Li・Shiyu Wang・[[Chao-Han Huck Yang]]・[[Qingsong Wen]]・[[Zuozhu Liu]]・[[Sabato Marco Siniscalchi]]・[[Ming Jin]]・[[Shirui Pan]]([[Griffith University]] / [[Zhejiang University]] / [[NVIDIA]] / [[Squirrel Ai Learning]] / [[University of Palermo]] ほか)による ICLR 2026 論文(arXiv:2509.24803, 32p)。TSR-Suite(4 アトミックタスク・23K サンプル)と二段階訓練(SFT + GRPO)による TimeOmni-1(Qwen2.5-7B ベース)を提案。因果発見で GPT-4.1 を ID 40.6%・OOD 28.1% 上回り、ジョイント訓練の能力補完を実証(paper / time-series / llm / reasoning / reinforcement-learning)
- [[@2024__arXiv__Towards Time-Series Reasoning with LLMs]] — [[Winnie Chow]]([[Stanford University]])・[[Lauren Gardiner]]([[Apple]])・[[Haraldur T. Hallgrimsson]]([[Apple]])・[[Maxwell A. Xu]]([[University of Illinois Urbana-Champaign]])・[[Shirley You Ren]]([[Apple]])による NeurIPS 2024 Workshop on Time Series in the Age of Large Models 論文(arXiv:2409.11376, 12p)。時系列推論を「知覚 → 文脈化 → 演繹」の 3 段階に分解。テキスト変換による知覚ボトルネックを定式化し、軽量パッチエンコーダ(MLP)+ LoRA + CoT 拡張微調整で 7B モデル(Mistral-7B)が GPT-4o をゼロショット時系列分類で上回る(paper / time-series / llm / multimodal)
- [[@2025__arXiv__AlphaCast - A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting]] — [[Xiaohan Zhang]]・[[Tian Gao]]・[[Mingyue Cheng]]・Bokai Pan・Ze Guo・Yaguo Liu・[[Xiaoyu Tao]]・[[Qi Liu]]([[University of Science and Technology of China]])による arXiv 2025-11 プレプリント(20p)。時系列予測を Investigator(文脈準備)→ Generator(推論生成)→ Reflector(反省的検証)のマルチターンエージェントループに再定式化し、訓練不要 LLM(GPT-5・DeepSeek-R1 等)を推論エンジンに使う。特徴量セット・知識ベース・ケースライブラリ・文脈プールの軽量ツールキットで EPF・ETT・Windy Power 等 10 データセットで既存ベースラインを上回る。反省モジュール除去で Sunny Power が非推論ベースラインより悪化し「推論は両刃」を示す(paper / time-series / llm / agentic) — [[Qinwei Ma]]・[[Jingzhe Shi]]([[Tsinghua University]])・[[Jiahao Qiu]]([[Princeton University]])・[[Zaiwen Yang]]([[Tsinghua University]])による arXiv 2026 ポジションペーパー(14p)。時系列予測における汎ドメインアーキテクチャと特定ドメイン SOTA の和解不能な矛盾を論証し、ドメイン特化 NN またはメタラーニング(LLM Scientist)への方向転換を提言(paper / time-series / meta-learning) — [[Xiaoyun Li]]・[[Guangba Yu]](共同第一著者)・[[Hongyang Chen]]・[[Zhekang Chen]]・[[Pengfei Chen]](責任著者)([[Sun Yat-sen University]] / [[Bizseer]])による ISSRE 2022 論文(IEEEXplore 9978764)。三大クラウド(Alibaba・Tencent・Baidu)の 354 件ポストモーテムを 5 か月 3 ラウンドのオープンコーディングで分析し、全障害ライフサイクル(TTD/TTI/TTM/TTR)を初めて一貫して実測。MTTD=16.9 分・MTTM=304.2 分・TTM が TTR の 53% を支配・変更中障害は内部原因 84.7%・設定ミスが最多根本原因(31.6%)・9 種緩和手段分布を定量化。カオスエンジニアリングの 4 欠落注入カテゴリを実証的に特定し 3 群のガイドラインを提示(empirical study / cloud-reliability / fault-lifecycle / paper)
- [[@2024__USENIX ATC__SuperBench - Improving Cloud AI Infrastructure Reliability with Proactive Validation]] — [[Yifan Xiong]]・[[Yuting Jiang]]・[[Ziyue Yang]]・[[Lei Qu]] ほか17名([[Microsoft Research]] / [[Microsoft]])による USENIX ATC '24 Best Paper(17p)。AI インフラのハードウェア冗長が生む「グレイ障害」を Azure A100 実データで定量化し(MTBI 17.5h・初回 719.4h → 20 回目 151.7h)、Cox-Time 生存解析 + 貪欲ベンチマーク選択 + CDF 類似度クラスタリングからなるプロアクティブ検証システム [[SuperBench]] を提案。シミュレーションで MTBI 22.61×・検証時間 92.07% 削減、Azure 本番 2 年運用で 24k+ A100 GPU から 10.36% のノードを欠陥として除外。ベンチマーク群は microsoft/superbenchmark で OSS 化(paper / gpu / reliability / aiops)
- [[@2022__KDD__Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition]] — [[Mingjie Li]]・[[Zeyan Li]]・[[Kanglin Yin]]・[[Xiaohui Nie]]・[[Wenchi Zhang]]・[[Kaixin Sui]]・[[Dan Pei]]([[Tsinghua University]] / BizSeer)による KDD 2022 論文(DOI:10.1145/3534678.3539041)。RCA を Pearl の Causal Hierarchy 第 2 層「介入認識(IR)」タスクとして初めて定式化(Theorem 3.4)し、アーキテクチャ知識ベースの構造グラフ + 回帰仮説検定(RHT) + 子孫調整からなる [[CIRCA]] を提案。Oracle DB の高 AAS 障害 99 件(197 メトリクス)で AC@1=0.404(最良ベースライン NSigma 0.323 比 +25%)・分析時間 0.578 秒を達成。コード公開: github.com/NetManAIOps/CIRCA(paper / aiops / rca / causal-inference / 2022)
- [[@2022__NeurIPS__Root Cause Analysis of Failures in Microservices through Causal Discovery]] — [[Azam Ikram]]・[[Saurabh Bagchi]]・[[Murat Kocaoglu]]([[Purdue University]])・[[Sarthak Chakraborty]]・Subrata Mitra・Shiv Kumar Saini([[Adobe Research]])による NeurIPS 2022 論文(pp.31158-31170)。マイクロサービス障害を soft intervention としてモデル化し、F-NODE 近傍の局所学習 + 階層分割統治 Ψ-PC からなる [[RCD]] アルゴリズムを提案。コールグラフ・パラメトリック仮定・過去障害履歴が不要。合成データ 100 ノードで top-1 再現率 98%、500 ノードで 22 秒(対 Ψ-PC 150 分超)、[[Sock Shop]] テストベッド・AWS 本番 3 障害ケースで競合ベースラインを上回る。コード: github.com/azamikram/rcd(paper / aiops / rca / causal-inference / microservices / 2022)
- [[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]] — [[Xiaoming Shi]]・[[Shiyu Wang]]・[[Yuqi Nie]]([[Princeton University]])・[[Qingsong Wen]]([[Squirrel Ai Learning]])・[[Ming Jin]]([[Griffith University]])ほか([[Xiaohongshu Inc]] / Princeton University / Squirrel Ai Learning / Griffith University)による ICLR 2025 論文(arXiv:2409.16040)。スパース MoE を用いた decoder-only トランスフォーマーで時系列基盤モデルを 2.4B パラメータ(活性化 1.1B)へ初めてスケールアップ。事前学習コーパス [[Time-300B]](9 ドメイン・309B 観測点)を公開。ゼロショット MSE を最良ベースライン比平均 20% 削減、スケーリング則がトークン数・モデルサイズの両軸で時系列予測にも適用できることを実証した(paper / time-series / scaling / mixture-of-experts)
- [[@2024__EuroSys__Automatic Root Cause Analysis via Large Language Models for Cloud Incidents]] — [[Yinfang Chen]]・Huaibing Xie・[[Minghua Ma]]・[[Yu Kang]]・[[Supriyo Ghosh]]・[[Xuchao Zhang]]・[[Chaoyun Zhang]]・[[Qingwei Lin]]・[[Saravan Rajmohan]]・[[Dongmei Zhang]]・[[Tianyin Xu]] ほか([[Microsoft]] / [[University of Illinois Urbana-Champaign]] / [[Peking University]] / [[Huazhong University of Science and Technology]] / [[National University of Singapore]])による EuroSys 2024 論文(DOI:10.1145/3627703.3629553、arXiv:2305.15778v4、15p)。LLM 強化オンコールシステム [[RCACopilot]] を提案。アラート種別に紐づくインシデントハンドラ(scope/query/mitigate アクションノードの DAG)で多種ソース(ログ・メトリクス・トレース・スクリプト)から診断情報を自動収集し、GPT-4 で要約 → FastText 埋め込み + 時間重み付き k-NN + few-shot CoT で根本原因カテゴリ予測 + 説明文を生成。Microsoft Transport 1 年分インシデントで Micro-F1=0.766 / Macro-F1=0.533 を達成、Ahmed+ ICSE 2023 を大きく上回る。診断情報収集部は Microsoft 30 超チーム・4 年以上の本番稼働。情報スペクトラム問題(情報過多・情報不足の両端で性能低下)を実証(paper / aiops / rca / llm / incident-management / production / 2024)
- [[@2020__VLDB__Monarch - Google's Planet-Scale In-Memory Time Series Database]] — [[Colin Adams]] ほか 13 名 ([[Google LLC]])による PVLDB 2020 論文(PVLDB 13(12):3181–3194, VLDB 2020)。[[Google]] が 2010 年から運用するプラネットスケール・マルチテナント・インメモリ TSDB [[Monarch]] の設計・実装・運用経験を報告。2019 年 7 月時点で約 950 億時系列・750 TB インメモリ・2.2 TB/s 取り込み・毎秒 600 万クエリ。主要技術: リレーショナルデータモデル(Target schema + Metric schema + distribution 型)・辞書順シャーディング・Collection Aggregation(delta + バケット + admission window、平均 36:1)・Field Hints Index(トライグラムインメモリ索引、ゾーン 99.5%・root 75.8% ファンアウト抑制)・クエリプッシュダウン(95% がゾーン完結)。前身 [[Borgmon]] の 4 課題(分散管理・スキーマなし・distribution 型欠如・手動シャーディング)を解決した後継(paper / time-series / distributed / observability / google)
- [[@2007__NSDI__X-Trace - A Pervasive Network Tracing Framework]] — [[Rodrigo Fonseca]]・[[George Porter]]・[[Randy H. Katz|Randy Katz]]・[[Scott Shenker]]・[[Ion Stoica]]([[University of California, Berkeley|UC Berkeley]] / [[ICSI]])による NSDI 2007 論文。タスク識別子をインバンドで伝搬し、レポートをアウトオブバンドで収集する 2 原則と、`pushDown()` / `pushNext()` の 2 プリミティブで因果木を完全記述する設計。クロスレイヤー・クロス管理ドメインのトレースを段階展開可能にする。pushNext() 576B で 0.71µs。DNS/3 層 web/I3 オーバーレイで実装。[[Dapper]]・Zipkin・OpenTelemetry の直接の祖(paper / distributed / observability / tracing)
- [[@2010__Google__Dapper - A Large-Scale Distributed Systems Tracing Infrastructure]] — [[Benjamin H. Sigelman]]・[[Luiz André Barroso]]・[[Mike Burrows]] ほか([[Google]])による 2010 年 Google テクニカルレポート。低オーバーヘッド + アプリ透過 + 偏在展開の 3 設計目標を、共通ライブラリ計装 + 1/1024 適応サンプリングで両立。Google 本番 2 年超稼働。スパン / トレース木 / アノテーションのデータモデルは OpenTracing・W3C Trace Context・[[OpenTelemetry]] の事実上の標準を確立。トレースデータの開発者向け API 公開が予期しなかった分析ツール群を生んだ点も重要(paper / distributed / observability / tracing / google)
- [[@2007__SIGCOMM__Towards Highly Reliable Enterprise Network Services via Inference of Multi-level Dependencies]] — [[Paramvir Bahl]]・[[Ranveer Chandra]]・[[Albert Greenberg]]・[[Srikanth Kandula]]・[[David Maltz]]・[[Ming Zhang (Microsoft Research)|Ming Zhang]]([[Microsoft Research]])による SIGCOMM 2007 論文(Sherlock)。Inference Graph(3 状態 up/troubled/down + 多層依存性)+ パケットトレース共起確率による自動依存性発見 + Ferret 推論で **90.66%** の障害箇所特定精度を達成し、2 層 Shrink の **58.61%** を 30% 上回る。Microsoft 本番ネット 358 コンポーネントで 87% の障害が 16 コンポーネントに集中することを実証。サービス依存性推論ベース fault localization の代表ソース(paper / networking / aiops / fault-localization)
- [[@2008__OSDI__Automating Network Application Dependency Discovery - Experiences, Limitations, and New Solutions]] — [[Xu Chen]]・[[Ming Zhang (Microsoft Research)|Ming Zhang]]・[[Z. Morley Mao]]・[[Paramvir Bahl]]([[University of Michigan]] / [[Microsoft Research]])による OSDI 2008 論文(Orion)。パケットヘッダ + タイミング情報のみ(ペイロード解析不要)で「遅延スパイクベース分析」により依存性発見。Sherlock 比偽陽性 10–95% 削減、eXpose 比 94–99% 削減。候補集合を 50–44,000 倍に絞り込む。受動観測ベース依存性発見の発展段階を代表(paper / networking / distributed / observability)
- [[@2012__LISA__On the Accurate Identification of Network Service Dependencies in Distributed Systems]] — [[Barry Peddycord III]]・[[Peng Ning]]・[[Sushil Jajodia]]([[NC State University]] / [[George Mason University]])による LISA 2012 論文(NSDMiner 拡張)。NSDMiner の比率ベースランキングを対数ベースに置換して偽陽性を大幅削減、利用頻度の低いサービスを類似クラスタから推論、ロードバランシング/バックアップクラスタの自動検出で出力候補を 25–50% 削減。受動観測ベース依存性発見の系譜の到達点の一つ(paper / networking / distributed-systems / systems-administration)
- [[@2017__arXiv__Sieve - Actionable Insights from Monitored Metrics in Microservices]] — [[Jörg Thalheim]] ほか([[TU Dresden]])による Middleware 2017 論文 / arXiv:1709.06686。k-Shape クラスタリングによるメトリクス次元 **10–100 倍削減** + Granger 因果性によるコンポーネント間依存性推定の 2 段プラットフォーム。OpenStack/ShareLatex で実装、**CPU 80% / Storage 90% / Network 50%** オーバーヘッド削減を達成。オートスケーリング + 根本原因分析(RCA)への応用例を提示。マイクロサービス時代の因果ベース RCA の初期基盤(paper / aiops / microservices / monitoring / rca)
- [[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]] — [[Minghua Ma]] ほか([[Sangfor Technologies]])による USENIX ATC 2021 論文(JumpStarter)。**圧縮センシング(CS)** + 形状ベースクラスタリング + 外れ値耐性サンプリングで**訓練不要・20 分初期化**の多変量時系列異常検知を実現。3 データセット平均 **F1=94.12%** で SOTA を上回る。学習ベース MTSAD の「初期化時間 10–100 日」問題に対する設計的回答(paper / aiops / anomaly-detection / time-series)
- [[@2015__TKDE__In-Memory Big Data Management and Processing - A Survey]] — [[Hao Zhang]]・[[Gang Chen]]・[[Beng Chin Ooi]]・[[Kian-Lee Tan]]・[[Meihui Zhang]]([[National University of Singapore]] / [[Zhejiang University]] / [[Singapore University of Technology and Design]])による IEEE TKDE 2015 サーベイ論文(Vol.27 No.7 pp.1920–1948、DOI:10.1109/TKDE.2015.2427795、28p / 290 文献)。インメモリビッグデータ管理を、メモリ階層・NUMA・HTM(Intel TSX)・NVRAM(PCM/STT-MRAM/Memristor)の基盤技術から、H-Store/VoltDB・Hekaton・HyPer/ScyPer・SAP HANA・MemepiC・MongoDB・RAMCloud・Redis 等の代表系、Mammoth・Spark/RDD・Storm 等の処理フレームワークまで網羅的に整理。索引・データレイアウト・並列性・並行性制御・クエリ処理・耐障害性・データオーバーフローの 6 軸で研究機会を提示。「メモリ常駐は必要条件、ロック/WAL/B-tree/バッファ管理など 90% 以上を占める legacy オーバーヘッド除去まで進めて初めて 100 倍が出る」を中心命題とする(paper / database / in-memory / survey)
- [[@2023__arXiv__TimeGPT-1]] — [[Azul Garza]]・[[Cristian Challu]]・[[Max Mergenthaler-Canseco]]([[Nixtla]])による arXiv 2023 論文(arXiv:2310.03589)。時系列向け初のファウンデーションモデル TimeGPT を提案。エンコーダ・デコーダ Transformer を 100B 点超の多ドメイン時系列で事前学習し、月次 rMAE 0.727 で全ベースラインを上回り top-3 に入る。推論速度 0.6 ms/系列(統計手法の 1/1000)。コンフォーマル予測による分布仮定不要な予測区間も提供。(paper / time-series / foundation-model)
- [[@2026__SREcon26 Americas__The WTF Problem - Developer Experience as a Reliability Property]] — [[Nicole Forsgren]] による SREcon26 Americas 45 分講演。SRE のツール・プロセス摩擦を信頼性のシステム特性として定義し、[[DORA]] + [[SPACE]] を SRE チーム自身の計測に適用する。北極星メトリクスとして [[MTWTF]](アラートから状況理解までの時間)を提案。AI が摩擦を増幅するリスクと、ビジネスケースの作り方まで論じる(slides / sre / developer-experience / dora / space)
- [[@2018__SREcon18 Asia__A Theory and Practice of Alerting with Service Level Objectives]] — [[Jamie Wilkinson]]([[Google]])による SREcon18 Asia 2018-06-08 講演スライド。シンプトムベースドアラーティング(symptom = SLO で計測できるもの)の定義、SLI/SLO/SLA 三層・工学的許容差との類比、可用性のリクエスト成功率定義、SLO バーンレートアラート(Fast Burn: `delta(errors[1h]) > budget/burn_period`)の PromQL 実装まで体系化(slides / sre / slo / alerting)
- [[@2026__SREcon26 Americas__How We Debug 1000s of Databases with AI]] — [[Annie Zhou]]・[[Sophie Zhang (Databricks)]]([[Databricks]] ストレージプラットフォームチーム)による SREcon26 Americas 2026 講演。MySQL/TiDB を数千インスタンス・70以上のリージョン・3クラウドで運用する Databricks が AI支援デバッグシステム([[Storax]])を本番導入するまでを解説。調査時間最大90%削減。3 教訓: (1)ユーザー共感先行 (2)セントラルファースト+細粒度AC+統一ツールの安全基盤 (3)DSPy インスパイア Signature/Tools/Modules フレームワーク・内部 LLM プロキシによるモデル差し替え。Temporal 承認ゲートで本番 DB 操作を保護(video / sre / aiops / database)
- [[@2022__DSN__Characterizing and Mitigating Anti-patterns of Alerts in Industrial Cloud Systems]] — [[Tianyi Yang]]・[[Jiacheng Shen]]・[[Yuxin Su]]・[[Xiaoxue Ren]]・[[Yongqiang Yang]]・[[Michael R. Lyu]]([[The Chinese University of Hong Kong]] + [[Sun Yat-sen University]] + [[Huawei Cloud]])による DSN 2022 論文(arXiv:2204.09670)。Huawei Cloud の 2 年・400 万件超アラート + 18 OCE 調査から 4 個別 + 2 集合のアラートアンチパターンを実証同定。Repeating Alerts を初めて文書化。SOP の有用性「Helpful 22.2% vs Limited Help 77.8%」、QoA(indicativeness/precision/handleability)の自動評価を将来方向に。(paper / aiops / alert-management / cloud-reliability)
- [[@2024__ICSE-SEIP__Knowledge-aware Alert Aggregation in Large-scale Cloud Systems - a Hybrid Approach]] — [[Jinxi Kuang]]・[[Jinyang Liu]]・[[Junjie Huang]]・[[Renyi Zhong]]・[[Jiazhen Gu]]・[[Lan Yu]]・[[Rui Tan]]・[[Zengyin Yang]]・[[Michael R. Lyu]]([[The Chinese University of Hong Kong]] + [[Huawei Cloud]])による ICSE-SEIP 2024 論文(arXiv:2403.06485、DOI:10.1145/3639477.3639745)。外部知識 SOP を初めてアラート集約に持ち込むハイブリッド [[COLA]](相関マイニング temporal+spatial + LLM 推論 CoT 2 ラウンド + ICL + P-tuning v2 SFT)。Cloud X(匿名化 Huawei Cloud)で F1 0.901-0.930、本番 4 ヶ月運用、ICL 単体 42-50s/ペアを 5.78-8.94s に圧縮。(paper / aiops / alert-management / llm-rca)
- [[@2025__arXiv__Metric Criticality Identification for Cloud Microservices]] — [[Akanksha Singal]]・[[Divya Pathak]]・[[Kaustabha Ray]]・[[Felix George]]・[[Mudit Verma]]・[[Pratibha Moogi]]([[IBM Research]] India + [[IIIT Delhi]])による arXiv 2025 論文(arXiv:2501.03547v2)。Informative Metric Subset Problem(NP 完全)を初定式化し、エントロピー + 相互情報量 + トポロジパス確率調整 + AIMD で SelectKBest/mRMR/Boruta/Max Weighted Clique を上回る coverage を達成する [[KIMetrix]]。教師ラベル不要・SOP 不要・ログ処理不要で QoTD(253 metrics)+ DeathStarBench(180 metrics)で実証、DeathStarBench CPU で C=99.44%。(paper / aiops / observability / microservices)
- [[@2014__KDD__Unveiling Clusters of Events for Alert and Incident Management in Large-Scale Enterprise IT]] — [[Derek Lin]]・[[Rashmi Raghu]]・[[Vivek Ramamurthy]]・[[Jin Yu]]・[[Regunathan Radhakrishnan]]([[Pivotal Software]]) + [[Joseph Fernandez]]([[Visa Inc]])による KDD 2014 論文(DOI:10.1145/2623330.2623360)。半構造化アラート(Jaccard + connected components + 正規化グラフカット)と非構造化インシデント(NMF + KD-tree + complete-linkage + マージ精製)の 2 系統独立クラスタリング framework。5M アラート→22K ユニーク + 67K インシデントを Pivotal Greenplum + MADlib で処理、(word, position) タプル可視化で word cloud の構造保持を克服。(paper / aiops / alert-management / clustering)
- [[@2019__WWW__Outage Prediction and Diagnosis for Cloud Service Systems]] — [[Yujun Chen]]([[Beihang University]] + [[Microsoft Research]] intern)・Xian Yang・[[Qingwei Lin]]・[[Hongyu Zhang]]([[University of Newcastle]])・[[Feng Gao]]・[[Zhangwei Xu]]・[[Yingnong Dang]]([[Microsoft Azure]])・[[Dongmei Zhang]]・[[Hang Dong]]・Yong Xu・Hao Li・[[Yu Kang]]([[Microsoft Research]] Beijing)による WWW 2019 論文(DOI:10.1145/3308558.3313501)。Bayesian network(FCI アルゴリズム)で信号-アウテージの依存性を学習し、XGBoost + SMOTE でアウテージの発生を予測する [[AirAlert]]。Microsoft 1 年・6 サービス・約 8,000 サンプルで、サービスレベル outage で Simple Spike(F1 7-11%)が崩壊する場面で AirAlert Related F1 53.92-88.78% を達成。(paper / aiops / outage-prediction / bayesian-network)
- [[@2020__ICSE-SEIP__Understanding and Handling Alert Storm for Online Service Systems]] — [[Nengwen Zhao]]・[[Junjie Chen]]・[[Dan Pei]] ほか([[Tsinghua University]]/[[Tianjin University]]/[[BizSeer]]/[[China EverBright Bank]])による ICSE-SEIP 2020 論文(DOI:10.1145/3377813.3381363)。アラートストームの初の実証研究で China EverBright Bank の 3 年・300 万件超アラートを分析。EVT(極値理論)ベースの適応的検知で F1>0.9 を達成し、Isolation Forest デノイジング + DBSCAN クラスタリング + 代表アラート選択により調査対象を 98% 以上削減。(paper / aiops / alert-management / alert-storm)
- [[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems]] — [[Nengwen Zhao]]・[[Dan Pei]] ほか([[Tsinghua University]]/[[China Construction Bank]]/[[Stevens Institute of Technology]]/[[BizSeer]])による ISSRE 2020 論文。重要アラート識別をランキング問題として定式化し、XGBoost + 40 次元特徴量(テキスト + 時系列 + KPI 異常)で F1=0.89(rule-based 0.53 比)を達成。Resolution Record の TF-IDF + k-means で連続重要度スコアを自動付与、ソフトウェア変更後のインクリメンタル学習で F1 を 0.68 から 0.88 まで回復。(paper / aiops / alert-management / actionable-alerting)
- [[@2023__arXiv__ESRO - Experience Assisted Service Reliability against Outages]] — [[Sarthak Chakraborty]]・[[Shubham Agarwal]]・[[Shiv Saini]] ほか([[University of Illinois Urbana-Champaign]]/[[Adobe Research]]/[[Adobe]]/[[IIT Kanpur]])による arXiv 2023 論文(arXiv:2309.07230v1)。アラートデータと過去の障害レポートを統合した CK グラフを構築し、リアルタイムアラートのみで根本原因と緩和手順を推薦する経験ベース診断 ESRO を提案。クラスタベース推論でベースライン比 +27.2%/+39.0% の Rouge スコア改善、Random Forest によるクラスタ予測で top-1 62%・top-5 72.7%。(paper / aiops / root-cause-analysis / alert-management)
- [[@2023__ASE__Dynamic Graph Neural Networks-Based Alert Link Prediction for Online Service Systems]] — [[Yiru Chen]]・[[Chenxi Zhang]]・[[Zhen Dong]]・[[Xin Peng]] ほか([[Fudan University]]/[[Alibaba Group]]/[[Alipay]]/[[Taobao]])による ASE 2023 論文(DOI:10.1109/ASE56229.2023.00177、pp.79-90)。アラートストームをアラート伝播の現象と再定義し、AMDG(Alert-Metric Dynamic Graph)+ 異種 k-GNN + GRU でリンク予測する DyAlert を提案。Alibaba 85 BU・約 3 万サービスの実データで F1 を SOTA 比 +0.259 向上、Precision +41.8%/Recall +10.1%。(paper / aiops / alert-management / graph-neural-network)
- [[@2023__JCC__Filtering Alerts on Cloud Monitoring Systems]] — [[Fotios Voutsas]]・[[John Violos]]・[[Aris Leivadeas]]([[École de Technologie Supérieure]])による JCC 2023 論文(DOI:10.1109/JCC59055.2023.00010、pp.34-37)。クラウドモニタリングのアラートフィルタリングをクリック行動ベースの二値分類問題として初定式化。Netdata 10 万サンプル・10 ヶ月で Random Forest が精度 70%・推論 7.3 ms を達成。通常システム 4,000 メトリクス・80〜100 種アラート、本番 10,000〜20,000 メトリクス・数百種の規模感を実測報告。(paper / aiops / alert-management / cloud-monitoring)
- [[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems]] — [[Yuqun Zhang]]・[[Saravan Rajmohan]]・[[Qingwei Lin]] ほか([[Southern University of Science and Technology]]/[[Microsoft]] M365)による ICSE-SEIP 2023 論文(DOI:10.1109/ICSE-SEIP58684.2023.00029)。アクショナブルアラートを impact + interpretability の 2 軸で定義し、ExL(排他的レイテンシ)とパス粒度トレース集約 + XGBoost フィードバック機構で実装。Exchange 本番 4 ヶ月で適合率 0.9068(従来 2.38 倍)、ExchangeデータセットでF1=0.5936(AutoEncoder F1=0.3945 を +50.47%)。(paper / aiops / alert-management / actionable-alerting)
- [[@2024__CCGRID__AlertRCA - Causality Enhanced Graph Representation Learning for Alert-Based Root Cause Analysis]] — [[Zhaoyang Yu]]・[[Changhua Pei]]・[[Dan Pei]] ほか([[Tsinghua University]]/CNIC CAS/[[Huawei Technologies|Huawei]]/[[eBay]])による CCGRID 2024 論文。アラートイベントのみを入力とするエンドツーエンド RCA 手法 AlertRCA を提案、Alert2Vec(BERT+MLP)+ CPGAT(非対称アテンション因果スコア)+ DAGNN(分散集約)を組み合わせる。実世界 EC データセットで top-1 83.9%/top-3 96.8% を達成、Groot(手作業ルールあり)を上回り、DejaVu 比で top-1 +24.8%/+15.7% 改善。(paper / aiops / root-cause-analysis / alert-management / graph-neural-network)
- [[@2024__ICSE-SEIP__Dynamic Alert Suppression Policy for Noise Reduction in AIOps]] — [[Karan Bhukar]]・[[Rohan Arora]]・[[Pooja Aggarwal]] ほか([[IBM Research]] T.J. Watson + India)による ICSE-SEIP 2024 論文(DOI:IEEE 10554731)。教師なし統計手法(移動平均エンベロープ)で X-out-of-Y アラート抑制ポリシーをメトリクス・マイクロサービスごとに自動学習する Dynamic-X-Y を提案。メトリクスで No-Suppression 比 45.8%/Static-X-Y 比 7.4% 正解率改善、TcpRetrans 事例で 61.53% ノイズ削減、教師なし学習が教師あり上界に到達することを実証。(paper / aiops / alert-management / alert-suppression)
- [[@2024__ISSRE__Exploring Hierarchical Patterns for Alert Aggregation in Supercomputers]] — [[Yuan Yuan]]・[[Tongqing Zhou]]・[[Yongqian Sun]] ほか([[National University of Defense Technology]]/[[Nankai University]]/National Supercomputer Center in Tianjin)による ISSRE 2024 論文。スーパーコンピュータの「アラート過負荷」(連続的バースト、98 万〜211 万件/130 日)を断続的アラートストームと区別して定義。SuperAgg の 2 段階階層構造(センサ層パターン4カテゴリ + システム層 Apriori 主従関係)で集約率 99.04%/98.64%・精度 99.18%/95.88% を達成、3 ベースライン比で +83.8%/+43.2% 精度向上。(paper / aiops / alert-management / alert-aggregation / hpc)
- [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]] — [[Jun Liu (UCAS)]]・[[Chaoyun Zhang]]・[[Jiaxu Qian]]・[[Minghua Ma]]・[[Si Qin]]・[[Chetan Bansal]]・[[Qingwei Lin]]・[[Saravan Rajmohan]]・[[Dongmei Zhang]]([[Microsoft]] + [[University of Chinese Academy of Sciences]] + [[Zhejiang University of Technology]])による KDD 2025 論文(DOI:10.1145/3711896.3737239、arXiv:2405.15370)。LLM を直接 fine-tuning なしで TSAD に使う初のフレームワーク [[LLMAD]] を提案。FastDTW ベースの正常/異常履歴 ICL + [[AnoCoT]](判定ルール・8 種異常タイプ・3 段階アラームレベル + 大域 → 局所 → 再評価の段階推論)で、GPT-4 が KPI/WSD/Yahoo 平均 Best F1=0.759 を達成し TFAD(0.725)を上回る。年間運用コスト約 $65.70。5 名の DevOps エンジニア人手評価で usefulness 4.06、Acc(any-hit) 0.79〜0.93。(paper / aiops / anomaly-detection / llm / time-series)
- [[@2026__ACL Findings__Time-RA - Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback]] — [[Yiyuan Yang]]([[University of Oxford]])・[[Zichuan Liu]]([[Nanjing University]])・[[Lei Song]]・[[Jiang Bian]]([[MSRA]])・[[Qingsong Wen]]†([[Squirrel Ai Learning]])ほかによる ACL 2026 Findings 論文(arXiv:2507.15066)。TSAD を二値識別から生成型推論タスクへ転換する **TIME-RA** タスクを定義。4 モデルプール(GPT-4o/Gemini-2.5/DeepSeek-R1/Llama-3.3-70B)+GPT-4 優先選択・批評による AI フィードバックで実世界 10 ドメイン約 4 万件・単変量 14+多変量 6 カテゴリの **RATs40K** を構築。SFT(LoRA)で Qwen2.5-7B は未見ドメインにもプラグアンドプレイで転用可能、視覚表現は推論一貫性(Thought マッチング)を一貫して向上。(paper / time-series / anomaly-detection / multimodal / benchmark / llm / reasoning / ACL)
- [[@2025__VLDB__ChatTS - Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning]] — [[Zhe Xie]]・[[Zeyan Li]]・[[Xiao He]]・[[Longlong Xu]]・[[Xidao Wen]]・[[Tieying Zhang]]・[[Jianjun Chen]]・[[Rui Shi]]・[[Dan Pei]]([[Tsinghua University]]/[[BNRist]] + [[ByteDance]] + [[BizSeer]])による PVLDB Vol. 18, No. 8, pp. 2385-2398, 2025 論文(DOI:10.14778/3742728.3742735)。時系列を画像同等のネイティブな多変量モダリティとして扱う初の TS-MLLM [[ChatTS]] を提案。属性プール(Trend 4 / Periodicity 7 / Noise 3 / Local Fluctuation 19 種 × 567 メトリクス名)からの合成データのみで Qwen2.5-14B-Instruct を SFT し、[[TSEvol]] で多様な Q&A を量産。GPT-4o(vision/text/agent)を alignment +46.0% / reasoning +25.8% で上回り、入力トークンは 1/40〜1/15。(paper / aiops / llm / time-series / multimodal)
- [[@2022__DICOMO__AI時代に向けたクラウドにおける信頼性エンジニアリングの未来構想]] — [[Yuuki Tsubouchi]]・[[Hirofumi Tsuruta]]([[SAKURA internet Inc]] / [[Kyoto University]])による DICOMO 2022 統一セッション「クラウド」招待講演スライド。SRE・AIOps の現在地から、2040 年代の [[セルフクラフト]]、信頼性・コスト・変更速度の対話的均衡調整、[[Interactive AIOps]] の実験可能性・解釈性へ至る信頼性エンジニアリング構想(slides / sre / aiops)
### 2026-06-18 分散深層学習の通信・スケジューリング・ネットワーク基盤論文 14 本一括
- [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]] — [[Yibo Zhu]]・[[Daniel Firestone]]・[[Chuanxiong Guo]]・[[Jitendra Padhye]]([[Microsoft]] / [[Mellanox]])ほかによる SIGCOMM 2015 論文。PFC の輻輳拡散を解決するレート制御型エンドツーエンド輻輳制御プロトコル [[DCQCN]] を提案。QCN と DCTCP を融合し NIC ハードウェアに実装、流体モデルでパラメータを最適化。スパインスイッチの PAUSE メッセージを 600 万件→約 3000 件に削減し、3 階層 Clos テストベッドで検証。(paper / networking / rdma / congestion-control)
- [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]] — [[Chuanxiong Guo]]・[[Jitendra Padhye]]([[Microsoft]])ほかによる SIGCOMM 2016 論文。RoCEv2 を全データセンタへ Layer-3 IP 上に大規模展開した初の体系的報告。DSCP ベース PFC で VLAN 制約を脱却し、PFC デッドロック・トランスポートライブロック・NIC PFC ストーム・スローレシーバーの 4 安全課題を発見・解決。RDMA Pingmesh で 99 パーセンタイルレイテンシ 90 µs(TCP 700 µs)を実証。(paper / networking / rdma / datacenter)
- [[@2008__ISCA__Technology-Driven, Highly-Scalable Dragonfly Topology]] — [[John Kim]]・[[William J. Dally]]・[[Steve Scott]]・[[Dennis Abts]]による ISCA 2008 論文。グループ(仮想ルータ)導入で実効ラジックスを高め、グローバルホップ数を最大 1 回に削減する [[Dragonflyトポロジ]] を提案。フラット化バタフライ比 20%・折り畳み Clos 比 52% のコスト削減。UGAL-LCR による間接適応ルーティングの遅延問題解決。(paper / networking / hpc / interconnect)
- [[@2009__IEEE-Micro__Cost-Efficient Dragonfly Topology for Large-Scale Systems]] — [[John Kim]]・[[William J. Dally]]・[[Steve Scott]]・[[Dennis Abts]]による IEEE Micro 2009 論文。ISCA 2008 の Dragonfly を拡張し、選択的仮想チャネル分離とクレジット往復レイテンシの 2 手法を組み合わせて間接適応ルーティングの限界を克服。16K ノード以上でフラット化バタフライ比 20%・折り畳み Clos 比 52%・3D トーラス比最大 60% のコスト削減を実証。(paper / networking / hpc / interconnect)
- [[@2018__SC__Harnessing GPU Tensor Cores for Fast FP16 Arithmetic to Speed up Mixed-Precision Iterative Refinement Solvers]] — [[Azzam Haidar]]・[[Jack Dongarra]]([[University of Tennessee]] / [[University of Manchester]])ほかによる SC 2018 論文。FP16 テンソルコアを用いた混合精度反復精密化により FP64 精度の解を最大 4× 高速に取得。テンソルコアの FP32 蓄積が数値安定性を向上、GMRES 前処理で条件数制約を κ∞(A) < 10^8 まで緩和。(paper / hpc / gpu / mixed-precision / linear-algebra)
- [[@2019__NSDI__Tiresias - A GPU Cluster Manager for Distributed Deep Learning]] — [[Juncheng Gu]]・[[Mosharaf Chowdhury]]・[[Kang G. Shin]]([[University of Michigan]])ほかによる NSDI 2019 論文。ジョブ所要時間が不明な状況で 2DAS(二次元アテインドサービス)スケジューラにより GPU 数×経過時間の積を優先度指標に用い、YARN-CS 比で平均 JCT 最大 5.5 倍改善。MLFQ 式離散化キューでプリエンプションコストを抑制。(paper / distributed / gpu-scheduling)
- [[@2020__NSDI__Themis - Fair and Efficient GPU Cluster Scheduling]] — [[Kshiteej Mahajan]]・[[Aditya Akella]]・[[Amar Phanishayee]]・[[Shivaram Venkataraman]]ほかによる NSDI 2020 論文。ML ジョブのギャングスケジューリング必要性と配置感度が DRF/LAS の公平性保証を破壊することを示し、仕上がり時間公平性(finish-time fairness)と部分割り当てオークションで公平性を 2.25 倍以上改善しつつクラスタ効率も向上。(paper / distributed / scheduling / gpu)
- [[@2022__NSDI__Accelerating Collective Communication in Data Parallel Training across Deep Learning Frameworks]] — [[Joshua Romero]]([[Oak Ridge National Laboratory]] / [[NVIDIA]])ほかによる NSDI 2022 論文。Horovod のコーディネータ・ワーカー制御プレーンの O(N) ボトルネックを応答キャッシュとビットベクタ積集合でバイパスし、6000 GPU で既存比 2× の性能向上。27,600 GPU(Summit 全体)で 0.93 の線形近似スケーリングと 1.54 エクサフロップス(FP16)を達成。(paper / distributed / collective-communication)
- [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning]] — [[Torsten Hoefler]]・[[Daniele De Sensi]]・[[Steve Scott]]([[ETH Zürich]] / [[Microsoft]])ほかによる SC 2022 論文。DL の通信パターンをトーラス状(直交ハミルトン閉路の集合)でモデル化し、2 次元並列化に完全帯域分離を提供しつつ汎用グローバル帯域も維持する [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning|HammingMesh]] トポロジを提案。Fat-Tree の均一全二分帯域に対し通信局所性特化で低コスト化。(paper / networking / hpc / distributed)
- [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]] — [[Weiyang Wang]]・[[Manya Ghobadi]]([[MIT]])ほかによる arXiv 2023 論文。LLM 訓練の通信パターンが疎でありトラフィックの 99% 超が同一レール内に留まる観察から、スパイン層を除去した Rail-only アーキテクチャを提案。スイッチ・トランシーバ削減でコスト 38〜77%・消費電力 37〜75% 削減しつつ訓練性能を維持。(paper / networking / distributed / llm-training)
- [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]] — [[Torsten Hoefler]]([[ETH Zürich]] / [[Hewlett Packard Enterprise|HPE]] / [[Broadcom]] / [[Google]] / [[Microsoft]])ほか産学連合による IEEE Computer 2023 論文。RoCE の 8 つの構造的欠陥(PFC 過大バッファ・輻輳ツリー・Go-back-N・輻輳制御の相互不干渉性・ヘッダオーバーヘッド・スマートスタック不対応・セキュリティ・リンク信頼性)を体系化し、TCP/RoCE は 10 年以内に次世代 Ethernet に置き換わると予測。(paper / networking / rdma / roce)
- [[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]] — [[Yanjie Gao]]([[Microsoft Research]])ほかによる ICSE 2024 論文。400 件の実ジョブから 706 件の低 GPU 利用率問題を分析。最多はホスト-GPU データ転送の非効率(27.90%)、バッチサイズ不適切(25.64%)、チェックポイント(16.43%)の順。84.99% は少数のコード修正で解消可能。スケジューラ改善とジョブコード改善は直交する課題。(paper / gpu / empirical-study / deep-learning)
- [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]] — [[Adithya Gangidi]]・[[James Hongyi Zeng|Hongyi Zeng]]([[Meta]])ほかによる SIGCOMM 2024 論文。24,000 GPU の RoCE クラスタで Llama 3 を訓練した大規模事例報告。DCQCN は集合通信に適合せず受信側駆動のトラフィック許可制御へ転換。ルーティングを ECMP→フローレットスイッチングへ段階的に改善し、NCCL のデフォルト性能を 2 倍以上改善。(paper / networking / rdma / distributed-training)
- [[@2024__SC-W 2024__Benchmarking Ethernet Interconnect for HPC AI workloads]] — [[Lorenzo Pichetti]]・[[Daniele De Sensi]]([[University of Trento]] / [[Sapienza University of Rome]] / [[Huawei Technologies|Huawei]] / [[CINECA]])ほかによる SC-W 2024 論文。32 KiB 以上の大メッセージで Ethernet と InfiniBand の帯域差は 4% 未満、AllToAll・AllReduce でも 3% 未満。レイテンシでは InfiniBand が約 1.4× 優位。Ethernet が HPC/AI インターコネクトとして InfiniBand に肉薄する定量的根拠を提示。(paper / networking / hpc / benchmark / ethernet)
### 2026-06-17 分散深層学習の訓練系基盤論文 14 本一括
- [[@2018__OSDI__Ray A Distributed Framework for Emerging AI Applications]] — [[Philipp Moritz]]・[[Robert Nishihara]]・[[Ion Stoica]]([[University of California, Berkeley]])ほかによる OSDI 2018 論文。タスク並列とアクターモデルを統合する分散フレームワーク [[Ray]] を提案。動的タスクグラフ、グローバル制御ストア (GCS)、ボトムアップ分散スケジューラにより、1.8 ミリ秒の遅延で毎秒 100 万タスク以上を処理し、強化学習ワークロードで既存特化フレームワークを凌駕。(paper / distributed / task-parallel / actor-model)
- [[@2019__arXiv__Megatron-LM Training Multi-Billion Parameter Language Models Using Model Parallelism]] — [[Mohammad Shoeybi]]・[[Mostofa Patwary]]・[[Bryan Catanzaro]]([[NVIDIA]])ほかによる arXiv 2019 論文。層内テンソル並列化を提案し、MLP と自己注意の行列分割で通信を AllReduce 2 回に抑制。83 億パラメータの Transformer を 512 V100 GPU で 15.1 PetaFLOPs(理論ピーク 76%)に到達。(paper / distributed / tensor-parallelism)
- [[@2019__NeurIPS__GPipe Easy Scaling with Micro-Batch Pipeline Parallelism]] — [[Yanping Huang]]・[[Quoc V. Le]]([[Google Brain]])ほかによる NeurIPS 2019 論文。マイクロバッチパイプライン並列化ライブラリ [[GPipe]] を提案。再マテリアライゼーションとの組み合わせで 6 億パラメータ AmoebaNet を 8 倍に拡大し ImageNet 84.4% top-1 を達成。bubble 比率 O(K−1)/M で M(マイクロバッチ数)増加により無視可能に。(paper / distributed / pipeline-parallelism)
- [[@2019__SOSP__PipeDream Generalized Pipeline Parallelism for DNN Training]] — [[Deepak Narayanan]]・[[Matei Zaharia]]([[Stanford University]] / [[Microsoft Research]])ほかによる SOSP 2019 論文。1F1B パイプラインスケジュールと重み隠蔽(weight stashing)を組み合わせた [[PipeDream]] を提案。GPipe 比でメモリ使用量を最大 2 倍削減し、データ並列比で VGG-16 を 5.3 倍高速化。(paper / distributed / pipeline-parallelism)
- [[@2020__KDD__DeepSpeed System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters]] — [[Jeff Rasley]]・[[Samyam Rajbhandari]]・[[Yuxiong He]]([[Microsoft]])ほかによる KDD 2020 チュートリアル概要。[[DeepSpeed]] ライブラリの概要と [[ZeROオプティマイザ]] を紹介。100〜200 億パラメータモデルを当時最良比 10 倍高速に訓練でき、BERT 事前訓練を 1024×V100 で 44 分(従来比 34% 短縮)に達成。(paper / distributed / deepspeed)
- [[@2020__OSDI__HiveD Sharing a GPU Cluster for Deep Learning with Guarantees]] — [[Hanyu Zhao]]([[Peking University]])ほかによる OSDI 2020 論文。マルチテナント GPU クラスタで「[[共有異常]]」を発見・定式化し、[[Virtual Private Cluster]] + バディセル割り当てで安全性を保証する [[HiveD]] を提案。2,232 GPU クラスタでプリエンプション 55% 削減・断片化最大 20% 改善。(paper / distributed / gpu-scheduling)
- [[@2020__SC__ZeRO Memory Optimizations Toward Training Trillion Parameter Models]] — [[Samyam Rajbhandari]]・[[Jeff Rasley]]・[[Yuxiong He]]([[Microsoft]])ほかによる SC 2020 論文。[[ZeROメモリ最適化]] の Stage 1〜3 を提案。オプティマイザ状態 / 勾配 / パラメータを GPU 間で分割し、モデル並列なしで 1000 億パラメータ訓練を可能にし、スーパーリニアなスループットスケーリングを実証。(paper / distributed / memory-optimization)
- [[@2021__SC__Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM]] — [[Deepak Narayanan]]・[[Matei Zaharia]]([[Stanford University]] / [[Microsoft Research]])ほかによる SC 2021 論文。パイプライン・テンソル・データの 3 種類並列を組み合わせる [[PTD-P]] を提案。1 兆パラメータモデルを 3072 A100 GPU で 502 petaFLOP/s(MFU 52%)で訓練可能と実証。インターリーブスケジュールで bubble 比率を 1/v に削減。(paper / distributed / 3d-parallelism)
- [[@2023__arXiv__FP8-LM Training FP8 Large Language Models]] — [[Houwen Peng]]・[[Han Hu]]([[Microsoft Azure]] / [[Microsoft Research]])ほかによる arXiv 2023 論文。FP8 での LLM 事前訓練を初めて体系的に検証。forward に FP8、backward に FP16/BF16、勾配に FP8 + 精度補償を適用し、GPT-175B でメモリ使用量 42% 削減・訓練 64% 高速化。(paper / distributed / mixed-precision)
- [[@2023__MLSys__Reducing Activation Recomputation in Large Transformer Models]] — [[Vijay Korthikanti]]・[[Mohammad Shoeybi]]・[[Bryan Catanzaro]]([[NVIDIA]])ほかによる MLSys 2023 論文。[[選択的活性化再計算]] と [[シーケンス並列化]] を提案。530B パラメータモデルで活性化メモリを 5 倍削減しつつ再計算オーバーヘッドは既存手法の 3 分の 1 に抑制。(paper / distributed / activation-recomputation)
- [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]] — [[Yanli Zhao]]([[Meta]])ほかによる VLDB 2023 論文。PyTorch FSDP の設計と産業規模運用を報告。FlatParameter による通信集約、後退プリフェッチで GPT-175B 18% スループット向上、レートリミッターで T5-11B 最大 5× 向上。[[ZeROパラメータシャーディング]] と同等の手法を PyTorch ネイティブに実装。(paper / distributed / data-parallelism)
- [[@2024__APNet__Understanding Communication Characteristics of Distributed Training]] — [[Wenxue Li]]・[[Kai Chen (HKUST)]]([[iSING Lab]] / [[Hong Kong University of Science and Technology|HKUST]])ほかによる APNet 2024 論文。分散訓練ワークロードの通信特性を実測・分類。3D 並列化で TP 内 AllReduce が支配的(帯域の 55〜85%)、DP の AllReduce バースト性が高く、PP は帯域消費が低いが遅延に敏感。(paper / distributed / communication)
- [[@2024__NSDI__Cassini Network-Aware Job Scheduling in Machine Learning Clusters]] — [[Sudarsanan Rajasekaran]]・[[Manya Ghobadi]]・[[Aditya Akella]]([[MIT]] / [[UT Austin]])ほかによる NSDI 2024 論文。[[ネットワーク対応スケジューリング]] を ML クラスタに導入する [[Cassini]] を提案。GPU 配置とネットワークフロースケジューリングを統合し、JCT を最大 1.6 倍改善。(paper / distributed / gpu-scheduling / network)
- [[@2025__arXiv__FFTrainer Fast Failover in Large Language Model Training with Almost Free State Management]] — [[Bohan Zhao]]・[[Wei Xu]]([[Tsinghua University]])ほかによる arXiv 2025 論文。[[FFTrainer]] を提案。訓練ネットワークの遊休帯域を利用したゼロオーバーヘッドチェックポイント(< 3%)と checkpoint razor(サイズ 1/10 以下圧縮)で反復ごとのチェックポイントを実現し、障害復旧時間を数十分から数十秒に短縮。(paper / distributed / fault-tolerance)
### 2026-06-19 JANOG56 スライド
- [[@2025__JANOG56__AI ML基盤における800GbEスイッチ導入とその挑戦]] — [[小障子 尚太朗]]・[[疋田 紅樹]]([[サイバーエージェント]] CIU)による JANOG56 Day2 講演(2025-07-31)。400G/800G 混在 Rail-Optimized GPU インターコネクト構築事例。NCCL_CROSS_NIC=0 によるリング経路最適化、Ingress interface hashing + DLB によるマルチベンダー Lossless チューニング、SN-MT コネクタで 4 倍密度のパッチパネルを実現。TOP500 国内 15 位(世界 132 位)を達成。(slides / networking / gpu-cluster / interconnect)
### 2026-06-20 クラスタリング基礎論文 3 本
- [[@1996__KDD__A Density-Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise]] — [[Martin Ester]]・[[Hans-Peter Kriegel]]・[[Jörg Sander]]・Xiaowei Xu(University of Munich)による KDD 1996 論文。密度ベースのクラスタ定義(核点・密度到達可能性・密度接続)に立脚した DBSCAN を提案。クラスタ数の事前指定不要で任意形状のクラスタを発見し、CLARANS に対し 100 倍以上の効率を実証。(paper / clustering / spatial-databases)
- [[@2013__PAKDD__Density-Based Clustering Based on Hierarchical Density Estimates]] — [[Ricardo J.G.B. Campello]]・[[Davoud Moulavi]]・[[Jörg Sander]](University of Alberta)による PAKDD 2013 論文。DBSCAN の全解を単一パラメータ mpts で階層的に列挙する HDBSCAN を提案。相対超過質量に基づくクラスタ安定性尺度と最適フラット分割抽出アルゴリズムを導入。(paper / clustering / density-based)
- [[@2016__SIGMOD Record__k-Shape - Efficient and Accurate Clustering of Time Series]] — [[John Paparrizos]]・[[Luis Gravano]](Columbia University)による SIGMOD 2015(SIGMOD Record 2016 再録)論文。正規化相互相関に基づく形状ベース距離 SBD と Rayleigh 商最大化によるセントロイド計算を組み合わせた k-Shape を提案。48 データセットでスケーラブル手法中唯一の最高精度を達成。(paper / clustering / time-series)
### 2026-06-20 マイクロサービス・データベース RCA 基礎論文 10 本一括
- [[@2013__SIGMETRICS__Root Cause Detection in a Service-Oriented Architecture]] — [[Myunghwan Kim]]・[[Roshan Sumbaly]]・[[Sam Shah]]([[Stanford University]] / [[LinkedIn]])による SIGMETRICS 2013 論文。コールグラフ上のパーソナライズドランダムウォーク(MonitorRank)を提案し、サービス依存グラフの相関比例遷移で根本原因をランク付けする最初の手法を示した。(paper / aiops / rca)
- [[@2014__CNSM__Mining Temporal Lag from Fluctuating Events for Correlation and Root Cause Analysis]] — [[Chunqiu Zeng]]・[[Tao Li]]([[Florida International University]])・[[Larisa Shwartz]]([[IBM Research|IBM]])ほかによる CNSM 2014 論文。イベント間の変動する時間遅れをマイニングし、隠れた時間依存を発見する LTD アルゴリズムを提案。(paper / aiops / event-correlation)
- [[@2018__CCGrid__CloudRanger - Root Cause Identification for Cloud Native Systems]] — [[Ping Wang]]・[[Pengfei Chen]]([[Peking University]] / [[IBM Research China]])ほかによる CCGrid 2018 論文。PC アルゴリズムで因果グラフを構築し、二次ランダムウォークで根本原因を特定する CloudRanger を提案。MonitorRank の拡張。(paper / aiops / rca)
- [[@2019__ISSRE__FluxRank - A Widely-Deployable Framework to Automatically Localizing Root Cause Machines for Software Service Failure Mitigation]] — [[Ping Liu]]・[[Dan Pei]]([[Tsinghua University]])ほかによる ISSRE 2019 論文。サービス障害時にマシンレベルの根本原因を特定する FluxRank を提案。異常検知・特徴選択・相関ランキングの 3 段構成で Baidu 本番に展開。(paper / aiops / rca)
- [[@2019__WWW__ε-Diagnosis - Unsupervised and Real-time Diagnosis of Small-window Long-tail Latency in Large-scale Microservice Platforms]] — [[Huasong Shan]]([[JD.com]])ほかによる WWW 2019 論文。マイクロサービスのテイルレイテンシ違反を小窓リアルタイムで診断する ε-Diagnosis を提案。ε 統計量による教師なし異常検知。(paper / aiops / microservice-diagnosis)
- [[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]] — [[Ping Liu]]・[[Dan Pei]]([[Tsinghua University]])ほかによる IPCCC 2020 論文。DB 性能異常の根本原因 KPI を重み付き無向依存グラフ(WUDG)+ PageRank で特定する FluxInfer を提案。(paper / aiops / database-diagnosis)
- [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]] — [[Minghua Ma]]・[[Dan Pei]]([[Tsinghua University]])ほかによる WWW 2020 論文。異常行動グラフと前方・自己・後方ランダムウォークによるマイクロサービス自動診断ツール AutoMAP を提案。(paper / aiops / microservice-diagnosis)
- [[@2021__CloudIntelligence__MicroDiag - Fine-grained Performance Diagnosis for Microservice Systems]] — [[Li Wu]]・[[Johan Tordsson]]・[[Odej Kao]]([[TU Berlin]] / [[Umeå University]])ほかによる CloudIntelligence 2021 論文。サービスとマシン粒度の性能異常診断を因果推論で行う MicroDiag を提案。(paper / aiops / microservice-diagnosis)
- [[@2022__ICWS__TS-InvarNet - Anomaly Detection and Localization based on Tempo-spatial KPI Invariants in Distributed Services]] — [[Zijun Hu]]・[[Pengfei Chen]]([[Sun Yat-sen University]])ほかによる ICWS 2022 論文。KPI ペア間の不変条件崩壊に基づく異常検知・箇所特定手法 TS-InvarNet を提案。トポロジ不要・292KB の軽量設計。(paper / aiops / anomaly-detection)
- [[@2023__arXiv__PyRCA - A Library for Metric-based Root Cause Analysis]] — [[Chenghao Liu]]・[[Steven C. H. Hoi]]([[Salesforce AI]])ほかによる arXiv 2023 論文。AIOps 向け RCA のオープンソースライブラリ PyRCA を提案。因果グラフ構築からスコアリングまでを統合。(paper / aiops / rca)
- [[@2024__FSE__BARO - Robust Root Cause Analysis for Microservices via Multivariate Bayesian Online Change Point Detection]] — [[Luan Pham]]・[[Huong Ha]]・[[Hongyu Zhang]]([[RMIT University]] / [[Chongqing University]])による FSE 2024 論文。多変量 BOCPD(Adams & MacKay 2007 × Xuan & Murphy 2007)で異常変化点を検知し、RobustScorer(中央値・IQR ベースノンパラメトリック仮説検定)で根本原因メトリクスをスコアリングするエンドツーエンド RCA フレームワーク BARO を提案。Online Boutique/Sock Shop/Train Ticket の 3 ベンチマークで既存手法を一貫して上回り、異常検知時刻の誤差への頑強性を実証。(paper / fse / aiops / rca / microservices / change-point-detection)
### 2026-06-23 Europe 2031 ingest
- [[europe2031-ai|Europe 2031]] — [[ARQ Foundation]] 主執筆(Daan Juijn ほか計8名)。AI 開発格差によるヨーロッパ周縁化を 2025〜2031 年スパンで描く政策シナリオ・ナラティブ。米欧コンピュート比 12.4→15.7 倍、デジタル主権規制の逆説を中心テーマに置く。(source / web / policy-scenario / AI政策 / 地政学)
### 2026-06-23 Conductor (ICLR 2026)
- [[@2026__ICLR__Learning to Orchestrate Agents in Natural Language with the Conductor]] — [[Stefan Nielsen]]・[[Edoardo Cetin]]・[[Yujin Tang]]([[Sakana AI]])ほかによる ICLR 2026 論文。強化学習(GRPO)で訓練した7B ConductorがGPQA Diamond 87.5%・LiveCodeBench 83.93%でGPT-5を超えSOTAを達成。自然言語で任意のマルチエージェント協調戦略を記述・学習する新手法。(paper / llm / multi-agent / reinforcement-learning)
### 2026-06-23 JustDiag (arXiv 2026)
- [[@2026__arXiv__JustDiag! A Diagnostic Justification Engine for Accountable Root Cause Analysis]] — [[Tingzhu Bi]]・[[Xinrui Jiang]]・[[Xun Zhang]]・[[Pengcheng Su]]・[[Congjie He]]・[[Jinglin Li]]・[[Ping Wang]]・[[Meng Ma]]([[Peking University]] / [[University of Edinburgh]] / [[Beijing University of Posts and Telecommunications]])による arXiv 2026 論文。説明責任ある RCA のための診断的正当化エンジン JustDiag を提案。証拠・発見・競合仮説・矛盾・次の確認事項を明示的なプロセス状態として維持し、Outcome Score 51.0→57.7 / Process Score 44.0→50.5(対 DJ なし制御群)を達成。(paper / aiops / rca / accountability)
### 2026-06-23 SRE NEXT 2023 Runbook スライド
- [[@2023__SpeakerDeck__Runbookに何を書き、どのようにアラートを振り分けるか]] — [[Sohei Iwahori]]([[GREE, Inc]])による SRE NEXT 2023 発表資料。エスカレーション先向け Runbook を「アラートの背景・文脈・判断材料」を残す仕組みとして整備し、アラート追加時に通知チャンネル・対応タイミング・スコープ・対応 Runbook を明示させるガイドラインを提示。(slides / sre / alert-management / runbook)
### 2026-06-23 mABC (EMNLP Findings 2024)
- [[@2024__EMNLP Findings__mABC - Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecture]] — [[Wei Zhang (Beihang)]]・[[Hongcheng Guo]]([[Beihang University]] / [[Cloudwise]] Research)ほかによる EMNLP Findings 2024 論文。7 専門エージェントと blockchain-inspired 投票でマイクロサービス RCA を行う mABC を提案。GPT-4-Turbo ベースで ReAct を平均 +8.4 ポイント上回り、マルチエージェント役割分担がモデル規模を超える性能向上をもたらすことを実証。(paper / aiops / rca / multi-agent / llm)
### 2026-06-23 Cognitive Apprenticeship in Practice (SREcon23 Americas)
- [[@2023__SREcon23 Americas__Cognitive Apprenticeship in Practice with Alert Triage Hour of Power]] — [[Paige Cruz]]([[Chronosphere]])による SREcon23 Americas 発表。Alert Triage Hour of Power の設計・運用・学びを共有し、認知的徒弟制の 6 段階(Modeling→Coaching→Scaffolding→Articulation→Reflection→Exploration)との対応を示す。KEEP/TUNE/DELETE の集団判定によるアラート衛生と、オンコールスキルの体系的伝達を両立する実践。(slides / sre / on-call / alert-management / cognitive-apprenticeship)
### 2026-06-23 Dark Sky Camping (SREcon22 Americas)
- [[@2022__SREcon22 Americas__Dark Sky Camping - Reducing Alert Pollution with Modern Observability Practices]] — [[Kristin Smith]]([[Campspot]] DevOps Services リード)による SREcon22 Americas 発表。パンデミック期の急成長でアラート増設が逆効果(アラートポリューション)になった事例と、Honeycomb + OpenTelemetry + SLO への移行による回復を、光害のアナロジーで説明。OpenTelemetry 自動計装は 4 時間で完了、SLO 導入では営業チームとの早期コミュニケーション不足が組織的摩擦を生んだ教訓。(slides / sre / alert-management / observability / slo)
### 2026-06-23 Monitoring Cloudflare's Planet-Scale Edge Network (SREcon17 Europe)
- [[@2017__SREcon17 Europe__Monitoring Cloudflare's Planet-Scale Edge Network]] — [[Matt Bostock]]([[Cloudflare]])による SREcon17 Europe 発表。116 PoP のエニーキャストエッジネットワークを Nagios から Prometheus へ移行した 18 か月の経験。各 PoP に独立 Prometheus を配置しコアへフェデレーションで集約するアーキテクチャ、症状ベースアラーティングの組織的推進、PagerDuty ドリルテスト。(video / sre / prometheus / monitoring / alerting)
### 2026-06-23 Anomaly Detection in Infrequently Occurred Patterns (SREcon17 Americas)
- [[@2017__SREcon17Americas__Anomaly Detection in Infrequently Occurred Patterns]] — [[Dong Wang]]([[Baidu]])による SREcon17 Americas 発表。中国の祝日(太陰暦で毎年日付が変動)のトラフィック異常検知で従来手法が破綻する問題に対し、日次トラフィック CDF の k-means クラスタリングとリアルタイム比率補正の 2 段階手法を本番投入。(slides / sre / anomaly-detection / baidu)
### 2026-06-23 Introduction to Alibaba Monitoring System (SREcon18 Asia)
- [[@2018__SREcon18 Asia__Introduction to Alibaba Monitoring System]] — [[Ren Xinchi]]([[Alibaba Group]] GOC)による SREcon18 Asia 発表。4 層モニタリング構造でビジネスレイヤを最重要と位置づけ、5 ゴールデンエレメントと CMDB [[Hammurabi]] でビジネス KPI・優先度・担当者を一元管理。変更相関(70% が変更起因)と次元分析で迅速な障害復旧を実現。(video / sre / monitoring / alibaba)
### 2026-06-24 OncallX (ASE 2025)
- [[@2025__ASE__LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation]] — [[Ruowei Fu]]・[[Shenglin Zhang]]([[Nankai University]])/ Yang Zhang・[[ByteDance]] ほかによる ASE 2025 論文。LLM × マルチエージェント協調でオンコール自動化を実現する [[OncallX]] を提案。ユーザー意図強化(RAG + ClarifyAgent 多ターン対話)・木探索マルチエージェント QA(OCEAgent + 専門エージェント群)・KG 拡張チケットトリアージの 3 モジュール構成。ByteDance 本番 2 か月で対応 21 秒(789 倍高速)・トリアージ 4 秒(50 倍高速)を達成。(paper / aiops / llm / multi-agent / on-call)
### 2026-06-26 VCCL (arXiv 2026)
- [[@2026__arXiv__An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters]] — [[Mingjun Zhang]]・Xiaohe Hu ほか([[Infrawaves]] / [[Beihang University]] / [[Tsinghua University]] ほか)による arXiv 2026 論文。NCCL を置き換える大規模 GPU 訓練向け集合通信ライブラリ VCCL を提案。①SM-free P2P(CPU スレッド+コピーエンジン、カーネル起動ゼロ)、②プライマリバックアップ QP(NIC 障害透過的吸収)、③スライディングウィンドウ RDMA モニタ(O(μs) 異常検知)の三機構で訓練スループット平均 4.00%/最大 5.28% 向上・GPU 待機時間約 90% 削減を 24K GPU 本番で達成。(paper / distributed / gpu-training / collective-communication / rdma / fault-tolerance)
### 2026-06-27 AIOps RCA/FI/OpsQA 7 papers batch ingest
- [[@2024__ICWS__G-Cause - Parameter-free Global Diagnosis for Hyperscale Web Service Infrastructures]] — Xinrui Jiang ほか(清華大学 / Huawei Cloud)。ハイパースケール Web 基盤のパラメータフリー全体診断フレームワーク。因果グラフと障害伝播モデルを用いた根本原因箇所特定。(paper / aiops / rca / causal-graph)
- [[@2024__KDD__FaultInsight - Interpreting Hyperscale Data Center Host Faults]] — Tingzhu Bi ほか(Microsoft / Tsinghua University)。ハイパースケールデータセンターのホスト障害を解釈可能に診断するフレームワーク。(paper / aiops / fault-diagnosis / datacenter)
- [[@2024__ISSRE__LoFI - Demystifying and Extracting Fault-indicating Information from Logs for Failure Diagnosis]] — Zhihan Jiang ほか(CUHK / WeBank)。ログからの障害指示情報抽出。スパン予測モデルで障害関連ログセグメントを抽出。(paper / aiops / log-analysis / fault-diagnosis)
- [[@2025__ASE__iKnow - an Intent-Guided Chatbot for Cloud Operations with Retrieval-Augmented Generation]] — Guangba Yu ほか(SYSU / CUHK)。意図誘導型クラウド運用チャットボット。RAG ベースの OpsQA。(paper / aiops / opsqa / rag)
- [[@2024__ISSRE__SparseRCA - Unsupervised Root Cause Analysis in Sparse Microservice Testing Traces]] — Zhenhe Yao ほか(清華大学 / Ant Group / CAS / ByteDance)。テスト環境の疎トレースに対する教師なし RCA。排他レイテンシ分解 + パーソナライズド PageRank。A@1=66.1%, A@5=88.1%。(paper / aiops / rca / microservice / testing)
- [[@2024__DSN-S__Fault Localization Using Interventional Causal Learning for Cloud-Native Applications]] — Saurabh Bagchi ほか。介入的因果学習によるクラウドネイティブアプリケーションの障害箇所特定。CausalBench ベンチマーク提案。(paper / aiops / fault-localization / causal-learning)
- [[@2024__ISSRE__Guardian of the Resiliency - Detecting Erroneous Software Changes Before They Make Your Microservice System Less Fault-Resilient]] — Guanglei He ほか。マイクロサービスの障害耐性を劣化させるソフトウェア変更を事前検知。ResilienceGuardian。(paper / aiops / microservice / resilience / change-detection)
### 2026-06-26 SREはサイバネティクスの夢をみるか (IOTS2025)
- [[@2025__IOTS2025__SREはサイバネティクスの夢をみるか]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]])による IOTS2025 招待講演。SRE を[[サイバネティクス]]的に再解釈し、フィードバックループ・セカンドオーダー・創発の 3 概念で利用者・情報システム・開発運用者の総体を捉えるモデルを提示。博士論文のテレメトリスケーリング 3 貢献を俯瞰し、[[なめらかなシステム]]・[[セルフクラフト]]・[[自動化の皮肉]]を経由して AI 時代の SRE 像を論じる。(slides / sre / systems-theory / cybernetics)
### 2026-06-25 Symptom-based Alerting for Machine Learning (SREcon23 EMEA)
- [[@2023__SREcon23 EMEA__Symptom-based Alerting for Machine Learning]] — [[Lina Weichbrodt]](ML フリーランス・コンサルタント、元 [[Zalando SE|Zalando]])による SREcon23 EMEA 発表。SRE の症状ベースアラーティングを ML サービスに転用し、出力側から逆順に 3 段階の監視優先度(ユーザー影響 → 応答分布 → 入力データ)を割り当てるフレームワークを提示。30 以上の ML ユースケース運用経験に基づく。(slides / sre / ml-monitoring)
### 2026-06-26 再帰化への認知的転回 (ペパボテックカンファレンス 2022)
- [[@2022__ペパボテックカンファレンス__再帰化への認知的転回]] — [[三宅悠介]]([[GMOペパボ]])によるペパボテックカンファレンス(2022-03-11)発表。「再帰化」すなわちサービスがユーザインタラクションのフィードバックを取り込んで自己改修するプロセスを、「関数の設計から系の設計への認知的転回」として定式化し、[[なめらかなシステム]]との接続を論じた。(slides / systems-design / machine-learning / なめらかなシステム)
### 2026-06-26 とあるSREの博士「過程」 (SRE NEXT 2025)
- [[@2025__SRE NEXT 2025__とあるSREの博士「過程」]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]]、[[Kyoto University|京都大学]]博士)による SRE NEXT 2025 IN TOKYO(2025-07-11)発表。SRE として博士課程に進学した動機、3 つの個別研究(HeteroTSDB / Transtracer / MetricSifter)を "Scaling Telemetry Workloads" として体系化した経緯、「作る側になりたい」→「積み重ねていきたい」へのメンタルモデル転換を語った。(slides / sre / phd / telemetry)
### 2026-06-26 なめらかなシステムと運用維持の終わらぬ未来 (DICOMO2025)
- [[@2025__DICOMO2025__なめらかなシステムと運用維持の終わらぬ未来]] — [[三宅悠介]]([[GMOペパボ]])による DICOMO2025 IOT 統一テーマセッション招待講演(2025-06-27)。「なめらかなシステム」を 2018 年定義から 7 年ぶりに再定義(仮)し、τέλος(目的)の転回・エフェクチュエーション・AI エージェントネットワークによる意味の翻訳と関係性の媒介を構想した。(slides / systems-design / なめらかなシステム / effectuation)
### 2026-06-27 The Morning Paper on Operability (blog.acolyer 2016)
- [[@2016__blog.acolyer__The Morning Paper on Operability]] — [[Adrian Colyer]](Accel / 元 Pivotal CTO)による講演記事。The Morning Paper の 400+ 論文レビューから運用性に関わる知見を横断集約。Hamilton の「80% は設計に起因」、Mystery Machine、Failure Sketching、Delta Debugging、HDD、DEMi、FDD、Cook の How Complex Systems Fail を 4 段階モデル(設計→可視化→デバッギング→フィードバック)で構成。(article / operability / sre / debugging)
### 2026-06-26 デバッギング・性能解析・フィードバック 6 論文一括 ingest
- [[@2002__IEEE TSE__Simplifying and Isolating Failure-Inducing Input]] — [[Andreas Zeller]]・Ralf Hildebrandt(Universität des Saarlandes / DeTeLine)による IEEE TSE 2002 論文。ddmin アルゴリズム(障害誘発入力の 1-最小簡略化)と dd アルゴリズム(1-最小障害誘発差分の分離)を提案。GCC 755→77 文字、Mozilla 896→1 行 HTML に簡略化。自動デバッギングの基礎的業績。(paper / debugging / testing)
- [[@2006__ICSE__HDD - Hierarchical Delta Debugging]] — [[Ghassan Misherghi]]・[[Zhendong Su]](UC Davis)による ICSE 2006 論文。デルタデバッギングを木構造入力に拡張。入力の構文木をレベルごとに ddmin 適用し、平坦な ddmin 比でテスト回数を桁違いに削減。XML・CSS・SQL への事例研究。(paper / debugging / testing)
- [[A Survey on Failure Analysis and Fault Injection in AI Systems]] — [[Guangba Yu]]・[[Pengfei Chen]]・[[Roberto Natella]]・[[Michael R. Lyu]] ほか(SYSU / Naples / CUHK)。AI システムの6層にわたる障害分析(FA)と障害注入(FI)を142本の論文から体系化した初の包括的サーベイ。各層の FA/FI ギャップを定量化。(paper / survey / fault-injection / aiops)
- [[@2014__OSDI__The Mystery Machine - End-to-end Performance Analysis of Large-scale Internet Services]] — [[Michael Chow]]・[[David Meisner]]・[[Jason Flinn]]・[[Thomas F. Wenisch]](University of Michigan / Facebook)による OSDI 2014 論文。Facebook のエンドツーエンド性能解析ツール。既存トレーシング(Dapper / X-Trace)の計装負担なしに、UberTrace ログから因果関係を仮説検証で自動推定。クリティカルパス・slack 解析でページロード遅延を 300ms 以上削減。(paper / performance-analysis / distributed-tracing)
- [[@2015__SOSP__Failure Sketching - A Technique for Automated Root Cause Diagnosis of In-Production Failures]] — [[Baris Kasikci]]・[[Benjamin Schubert]]・[[George Candea]](EPFL / Cristian Zamfir @ Google)による SOSP 2015 論文。Gist は本番環境の障害を協調解析で「failure sketch」(障害の近似ルートコーズ)に要約する手法。ハードウェアウォッチポイント活用で性能オーバーヘッド 2.4%。11 件の実バグで 8 件を完全診断。(paper / debugging / root-cause-analysis)
- [[@2015__Onward!__Runtime Metric Meets Developer - Building Better Cloud Applications using Feedback]] — [[Jürgen Cito]]・[[Philipp Leitner]]・[[Harald C. Gall]](University of Zurich)ほかによる Onward! 2015 論文。フィードバック駆動開発(FDD)のビジョン。ランタイムメトリクスを開発者の IDE に直接統合し、パフォーマンス意識の喪失(performance-awareness gap)を埋める。CloudWorkBench によるベンチマーク自動化の実装。(paper / software-engineering / devops / feedback)
- [[@2016__NSDI__Minimizing Faulty Executions of Distributed Systems]] — [[Colin Scott]]・Aurojit Panda・[[Scott Shenker]](UC Berkeley / ICSI)ほかによる NSDI 2016 論文。デルタデバッギングを分散システム実行に拡張する DEMi。外部イベント(障害注入)と内部イベント(メッセージ送受信)を区別し、スケジュール探索で最小化。Raft・Spark・Akka の 7 バグで実行イベント 1~2 桁削減。(paper / distributed-systems / debugging / testing)
- [[@2025__YAPC Fukuoka 2025__SREのためのテレメトリー技術の探究]] — [[Yuuki Tsubouchi]]([[さくらインターネット研究所]])YAPC::Fukuoka 2025 ゲストセッション(2025-11-14)。テレメトリー技術探究 12 年間を 5 章構成で総括。博士論文コアコンセプト Scaling Telemetry Workloads と今後 4 方向(SDGs / AI for SRE / Observability for AI Systems / Controllability)。(slides / sre / telemetry)
- [[@2019__SREcon19Americas__Running Excellent Retrospectives - Talking for Humans]] — [[Courtney Eckhardt]]([[Heroku]])・[[Lex Neva]]([[Fastly]])による SREcon19 Americas(2019-03-26)90 分チュートリアル。ファシリテーターの3仕事(ファシリテーション・生産的会議運営・ユーモア失敗回避)、言語レベルの blame 回避(you/why/always/never/should 禁止)、Miller の法則、ローカル合理性、Lake Washington 浮橋事例、Conway's Law の帰結を体験型形式で伝える。(slides / sre / postmortem / facilitation / human-factors)
- [[@2019__SREcon19 Asia__Retrospectives for Humans (a crash course)]] — [[Courtney Eckhardt]]([[Heroku]] / Salesforce)による SREcon19 Asia/Pacific(2019-06-12)発表。ポストモーテム会議でのファシリテーション言語を言語学(Miller's Law・denotation/connotation・implication/presupposition)から体系化。contributing factor discovery・「Why/You→How/What 変換」・ユーモアのリスク・Conway's Law 接続。(slides / sre / postmortem / facilitation / human-factors)
- [[@2019__SREcon19 Asia__A Tale of Two Postmortems - A Human Factors View]] — [[Tanner Lund]](Microsoft Azure PRSE)による SREcon19 Asia/Pacific 発表。Dekker(2015)の4目的枠組み(認識論的・予防的・道徳的・実存的)を導入し、「ヒューマンエラーは分析の行き止まり」「規範的言語=後知恵バイアス+非難」と従来型ポストモーテムを批判。Human Factors/Resilience Engineering 流の個別インタビュー→デブリーフィング手法を対案として示す。(slides / sre / postmortem / human-factors)
- [[@2016__SREcon16Europe__Accident Models in Post Mortems]] — [[Will Gallego]]・[[Nathan Hoffman]]・[[Miriam Lautner]]([[Etsy]])によるSREcon16 Europe(2016年7月、ダブリン)2部構成チュートリアル。事故モデル系譜(Bad Apples/ドミノ/スイスチーズ)・ヒューマンエラー批判・安全性の創発的特性・ブレーム認識・デブリーフィング7カテゴリ問いかけ手法。(slides / sre / postmortem / accident-models)
- [[@2019__SREcon19Asia__Getting More out of Postmortems and Making Them Less Painful to Do]] — [[Ashar Rizqi]]([[Blameless]])SREcon19 Asia/Pacific 発表。300 社以上の事例からポストモーテム成功の6要素(所有権・コンテキスト & KD・期日内完了・AI 完了追跡・ブレームレス言語・再参照性)を体系化。各要素の困難な理由と解決策をケーススタディ形式で提示。再参照性は今も未解決問題として残ると認める。(slides / sre / postmortem)
- [[@2015__SREcon15__What Brought Us Down - Outage Trend Analysis at Google]] — [[Sue Lueder]]([[Google]] SRE Program Manager)、SREcon 2015。全プロダクション障害横断 GQM 分析プログラム・8 フェーズインシデントタイムライン・9 カテゴリ根本原因・4 次元重大度フラグ・3 方向修正機会を公開。(slides / sre / incident-management)
- [[@2023__SREcon23Americas__Turning an Incident Report into a Design Issue with TLA+]] — [[Finn Hackett]](UBC)・[[Markus A. Kuppe]](MSFT)SREcon23 Americas(2023-03-22)発表。Azure CosmosDB の 28 日間インシデントを事例に、インシデントレポートを TLA+ フォーマルモデルへと変換するワークフローを提示。Session Consistency のトークン共有不備が根本原因。(slides / sre / formal-verification / distributed-systems)
- [[@2023__SREcon23Americas__Far from the Shallows]] — [[Courtney Nash]]([[Verica]])SREcon23 Americas(2023-03-23)発表。Duration/MTTR・Severity・Root Cause という慣習的指標を「shallow data」として批判し、インシデントストーリー・Near Misses・Rasmussen の Safety Boundaries を代替的分析枠組みとして提示。The Void(1 万件超の公開インシデントレポート DB)を出典とする。(slides / sre / postmortem / incident-management / human-factors)
#### インシデントキーメトリクスによるインシデント対応の改善 (SRE Kaigi 2025) (2026-06-28)
- [[@2025__SRE Kaigi 2025__インシデントキーメトリクスによるインシデント対応の改善]] — [[Narimichi Takamura]]([[Topotal]] CEO / SRE)、SRE Kaigi 2025(2025-01-26)発表。MTTR がモンテカルロシミュレーション(10 万回)で改善評価指標として統計的に機能しないことを実証し、TTX メトリクス(11 種類)の実践的定義と [[Waroom]] での自動収集実装を提示。(slides / sre / incident-management / metrics)
#### Human Factors in the Age of AI Ops (SREcon26 Americas) (2026-06-28)
- [[@2026__SREcon26Americas__Human Factors in the Age of AI Ops]] — [[Eddie Redick]]([[CTC Ops]])SREcon26 Americas(2026-03-25、Seattle)発表。16%/68%/62% の信頼パラドックス・Trust Triangle(Logic/Empathy/Authenticity)・Trust Spectrum(Observe/Advise/Assist/Partner)・"Commanding the Chaos" フレームワーク・AI Ops 80/20 の法則(80% 業務再設計)を提示。アラート疲労を「システム問題」として再フレーミング。(slides / sre / aiops / human-factors / trust)
#### The Ironies of AI² (SREcon26 Americas) (2026-06-28)
- [[@2026__SREcon26Americas__The Ironies of AI²]] — [[J Paul Reed]]([[Chime]])SREcon26 Americas(2026-03-25、Seattle)発表。Bainbridge(1983)の自動化のアイロニー6項をAI時代に拡張し、Joint Cognitive System 5特性(Autonomy・Authority・Directed Attention・Redirectability・Interpredictability)でインシデント対応中のAI利用を評価。匿名インシデント事例3件・ETO(効率性‐徹底性トレードオフ)・看護師実験(AI誤り多時に96〜120%性能悪化、AI説明のみ条件で緩和)を提示。(video / sre / human-factors / incident-response / ai-automation)
#### The Power of Stories (SREcon26 Americas) (2026-06-28)
- [[@2026__SREcon26Americas__The Power of Stories]] — [[Lorin Hochstein]]([[Airbnb]])SREcon26 Americas クロージングキーノート。インシデントストーリーが箇条書きより記憶に定着する理由、有用なストーリーの 2 条件(anomalous + immutable / Gelman & Basbøll)、ポストモーテムの narrative description 重視、逸脱の正常化(Vaughan/Challenger)の SRE への接続、Airbnb「Once Upon an Incident」の実践を論じた。(video / sre / incident-management / postmortem / human-factors)
#### Incident Metrics in SRE (O'Reilly, 2021) (2026-06-28)
- [[@2021__OReilly__Incident Metrics in SRE]] — [[Štěpán Davidovič]]([[Google]] SRE)、O'Reilly レポート(2021-03-19)。モンテカルロシミュレーション(10 万回)と 3 社の実インシデントデータ・Google 社内データを用いて MTTR を批判的に評価。中央値・幾何平均・パーセンタイルを含む代替統計でも問題が解決しないことを示し、問いに合わせたメトリクス・ユーザースタディ・SLI/SLO を代替として提案。(paper / sre / incident-management / metrics)
#### Postmortem as a textbook (SpeakerDeck, 2023-02-09) (2026-06-28)
- [[@2023__SpeakerDeck__Postmortem as a textbook]] — [[KATO Toshiya]]([[LINE株式会社]] Embedded SRE)、みんなで学ぶポストモーテム Lunch LT(Findy、2023-02-09)。ポストモーテムを「他チームが学べる教材」にするためのSRE主導執筆会議手法を報告。5つの構造的省略問題を特定し、全体共有前30分のSRE主導執筆会議で解決。品質向上と共有会議時短を同時達成。(slides / sre / postmortem / incident-management)
#### 縮約,網羅,減算:科学者の仕事とは何か (認知科学 2021) (2026-06-28)
- [[@2021__認知科学__縮約,網羅,減算:科学者の仕事とは何か]] — [[岡ノ谷 一夫]]([[University of Tokyo]])、認知科学 Vol.28 No.2 pp.236–241(2021-06-01)。池上 高志「生命としての認知科学」へのコメンタリー。縮約(次元圧縮・個体発生的)・網羅(仮説なし包括計測・2000年代以降)・減算(Uexküll 環世界的選択的遮断・系統発生的)を三項対立で整理し、認知科学は縮約と減算の並行処理にならざるを得ないと結論づける。(paper / cognitive-science / philosophy-of-science)
#### Data Center Networking 基盤論文 5 本 (2026-06-29)
- [[@2008__SIGCOMM__A Scalable Commodity Data Center Network Architecture]] — [[Mohammad Al-Fares]] ほか([[Amin Vahdat]]、UCSD)、SIGCOMM 2008。安価な商用スイッチによる k-ary Fat-Tree トポロジで full bisection bandwidth を実現。二段経路探索で転送表エントリをスイッチあたり k 以内に抑制。27,648 ホスト・従来比 77% コスト削減。(paper / networking / datacenter)
- [[@2009__SIGCOMM__VL2 - A Scalable and Flexible Data Center Network]] — [[Albert Greenberg]] ほか(Microsoft Research)、SIGCOMM 2009。Clos トポロジと Valiant Load Balancing で uniform high capacity を実現。IP-in-IP カプセル化とディレクトリサービスでネットワーク仮想化。(paper / networking / datacenter)
- [[@2010__NSDI__Hedera - Dynamic Flow Scheduling for Data Center Networks]] — [[Mohammad Al-Fares]] ほか、NSDI 2010。ECMP のハッシュ衝突によるエレファントフロー帯域損失(最大 60.8%)を動的フロースケジューリングで解決。Simulated Annealing で最適比 96% の二分帯域幅達成。(paper / networking / datacenter)
- [[@2009__SIGCOMM__PortLand - A Scalable Fault-Tolerant Layer 2 Data Center Network Fabric]] — [[Radhika Niranjan Mysore]] ほか、SIGCOMM 2009。PMAC アドレスとファブリックマネージャで L2 セマンティクスを維持しつつスケーラブルなデータセンターファブリックを実現。65ms 障害収束。(paper / networking / datacenter)
- [[@2010__SIGCOMM__Data Center TCP (DCTCP)]] — [[Mohammad Alizadeh]] ほか、SIGCOMM 2010。ECN マーキング割合から輻輳度を推定し段階的ウィンドウ調整。TCP コード変更 30 行でデータセンターの Incast・キュー蓄積・バッファ圧迫を同時解決。(paper / networking / datacenter / congestion-control)
#### Spanner: Google's Globally Distributed Database (OSDI 2012 / TOCS 2013) (2026-06-28)
- [[@2013__TOCS__Spanner - Google's Globally Distributed Database]] — [[James C. Corbett]] ほか([[Google]], 2013)。OSDI 2012 論文の TOCS 拡張版。世界規模の外部一貫性のある分散トランザクションを実現する最初のシステム。TrueTime API(GPS + 原子時計による不確実性区間)を使った commit wait で外部一貫性を数学的に保証。ε 通常 4ms、commit wait ≥ 2ε。ディレクトリが配置・移動の単位。スナップショットトランザクションはロックフリー。F1(Google 広告バックエンド)が最初のクライアント。(paper / distributed / database / systems)
#### Memory in the Age of AI Agents (arXiv 2025) (2026-06-29)
- [[@2025__arXiv__Memory in the Age of AI Agents]] — [[Yuyang Hu]] ほか 47 名([[National University of Singapore]] 等、2025-12-18)。LLM ベースエージェントのメモリシステムを形態(Forms)・機能(Functions)・動態(Dynamics)の 3 軸で統一的に分類する 107 ページのサーベイ。トークンレベル・パラメトリック・潜在メモリの 3 形態、事実・経験・作業メモリの 3 機能、形成・進化・検索の 3 動態を体系化。300 以上の文献を整理し 7 つのフロンティアを提示。(paper / agent-memory / llm / survey)
#### Project Silica: Towards Sustainable Cloud Archival Storage in Glass (SOSP 2023) (2026-06-29)
- [[@2023__SOSP__Project Silica - Towards Sustainable Cloud Archival Storage in Glass]] — [[Antony Rowstron]] ほか 57 名([[Microsoft]], 2023)。溶融石英ガラス媒体を基盤とした初のクラウドアーカイバルストレージシステム Silica の設計・プロトタイプ実証。フェムト秒レーザー書き込み + 偏光顕微鏡読み出しの WORM 媒体、1000 年超耐久性でスクラビング・リフレッシュ不要。論理パーティション分割型シャトル管理で輻輳を 10% 以内に抑制し SP 対比 20〜90% 省電力。30 MB/s ドライブで IOPS ワークロードの SLO を達成。(paper / storage / cloud / systems / sustainability)
#### Case Study: Implementing SLOs for a New Service (SREcon19 Americas) (2026-06-29)
- [[@2019__SREcon19Americas__Case Study - Implementing SLOs for a New Service]] — [[Arnaud Lawson]]([[Squarespace]] Senior SRE)、SREcon19 Americas(2019-03-25)。Ceph Object Storage への SLO 実装 6 ステップ(SLI 種別決定・SLI 定義・計測方法選択・SLI 収集・エラーバジェット導出・公開)を解説。可用性 99.9%・レイテンシ p90<300ms/p99<2000ms・耐久性 99.999999% の 3 種 SLO と Go プローバーによる能動的計測実装を含む。(slides / sre / slo / srecon)
#### Quantifying Empathy Through Service Level Objectives (SREcon18 Asia/Pacific, 2018) (2026-06-29)
- [[@2018__SREcon18Asia__Quantifying Empathy Through Service Level Objectives]] — [[Ketan Gangatirkar]]([[Indeed]] VP of Engineering – Job Seeker)、SREcon18 Asia/Pacific(2018 年)。SLO 設計を「共感の数値化」として捉え直し、ユーザー幸福の 6 フレーバー(#ARFCAapBof)と S 字曲線による痛みのしきい値特定の 5 ステップフレームワークを提示。152 ページスライド + YouTube 自動字幕トランスクリプト。(slides / sre / slo / user-empathy)
#### How to SRE When Everything is Already on Fire (SREcon19 EMEA) (2026-06-30)
- [[@2019__SREcon19EMEA__How to SRE When Everything is Already on Fire]] — [[Alex Hidalgo]]・[[Alex Lee]]([[Squarespace]] SRE)、SREcon19 EMEA(2019-10)。ELK スタックの連続インシデントを SRE 7 原則(アラート精選・SLI/SLO/エラーバジェット・オブザーバビリティ強化・環境改善・ICS 適用・ポストモーテム・反復改善)で転換した実録。SLO 定義の翌日エラーバジェット枯渇で「全力対処の許可」を得た事例・37 時間インシデントでの ICS 引き継ぎ実践・シャード数 2,200 → 推奨上限 600 の根本原因特定を含む。105 ページ PDF。transcript なし。(slides / sre / alerting / slo / incident-management / postmortem)
#### The Map Is Not the Territory: How SLOs Lead Us Astray, and What We Can Do about It (SREcon19 EMEA) (2026-06-30)
- [[@2019__SREcon19EMEA__The Map Is Not the Territory - How SLOs Lead Us Astray, and What We Can Do about It]] — [[Narayan Desai]]([[Google]] SRE)、SREcon19 EMEA(2019-10-03、Dublin)。SLO の 4 ユースケース(Ongoing / Design / Incident Response / Bounding the Tail)分類、暗黙的仮定の明示化(独立リクエスト・均一重要度・均一エラー)、テール管理への SLO 不適用論(サンドバッギング問題)、SLO Algebra の未解決問題を論じる。45 分動画 + 自動字幕 transcript。(video / sre / slo / srecon)
#### Not All Minutes Are Equal: The Secret behind SLO Adoption Failure (SREcon23 Americas) (2026-06-30)
- [[@2023__SREcon23Americas__Not-All-Minutes-Are-Equal]] — [[Troy Koss]]・[[Michael Goins]]([[Capital One]])、SREcon23 Americas(2023-03-23)。時間スライス SLO とイベントベース SLO の比較を軸に SLO 採用失敗の構造的原因を解説。採用ロードマップ 6 段階(Study → Experiment → Fix → Understand Signals → Fanfare & Action → Scale)、Default SLO 式、エラーバジェットシグナルの読み方を提示。40 ページ PDF。transcript なし(Whisper 失敗・YouTube 429)。(slides / sre / slo / error-budget / srecon)
#### HPC Downtime Budgets: Moving SRE Practice to the Rest of the World (SREcon16 Europe) (2026-06-30)
- [[@2016__SREcon16Europe__HPC Downtime Budgets]] — [[Cory Lueninghoener]]([[Los Alamos National Laboratory]])、SREcon Europe 2016(2016-07-12、Dublin)。エラーバジェット概念を HPC(約 36,000 ノード・110 PB Lustre)に適応。四半期 30 時間のダウンタイム予算をバーンダウンチャートで可視化し、計画メンテ・施設工事・落雷・専用ユーザー時間・技術的負債解消の 5 用途に活用。Wolf クラスタ一晩停止で四半期予算を使い果たした事例が核心。SRE 普及はコミュニティ形成の課題と論じる。37 ページ + YouTube 自動字幕 transcript。(slides / sre / hpc / error-budget / srecon)
#### Run, Walk, Crawl, or How We Failed Our Way to SLO Readiness (SREcon25 EMEA) (2026-06-30)
- [[@2025__SREcon25EMEA__Run Walk Crawl or How We Failed Our Way to SLO Readiness]] — [[Rob Durst]]([[Spring Health]])、SREcon25 EMEA(2025-10-08、ダブリン)。ハイパーグロース・スタートアップにおける SLO 導入 4 度の挑戦と失敗、「SLO 準備度チェックリスト」4 条件と「信頼性イニシアチブ・フレームワーク」を提示。SLO 導入は社会技術問題であり socio 側が律速という主張が核心。51 ページ PDF。transcript なし。(slides / sre / slo / srecon)
#### Measuring Availability the Player Focused Way (SREcon25 Americas) (2026-06-30)
- [[@2025__SREcon25Americas__Measuring Availability the Player Focused Way - How Riot Games Changed Its Availability Culture]] — [[Maxfield Stewart]]([[Riot Games]] Technical Director: Live Operations)、SREcon25 Americas(2025-03)。ゲームサービスの可用性をサービス稼働率ではなく「プレイヤー分(Player Minutes = SUM(CCU per minute))の中断割合」で計測し、Player Journey(Connecting / Purchasing / Play)× P1-P4 優先度の組み合わせを共通言語として導入。CEO OKR 強制と月次レポートで文化定着を実現し、可用性 97-98% → 99%、Live Ops モラルスコア 1.5 → 4.3 を達成した 50 ページ PDF。transcript なし。(slides / sre / slo / gaming / srecon)
#### X-lifecycle Learning for Cloud Incident Management using LLMs (FSE 2024) (2026-06-30)
- [[@2024__FSE__X-lifecycle Learning for Cloud Incident Management using LLMs]] — [[Drishti Goel]]・[[Fiza Husain]]・[[Anjaly Parayil]]・[[Aditya Singh]]・[[Supriyo Ghosh]]・[[Xuchao Zhang]]・[[Chetan Bansal]]・[[Saravan Rajmohan]] ほか([[Microsoft]])。FSE 2024 Companion(ESEC/FSE '24、DOI:10.1145/3663529.3663861)。SDLC の複数段階にわたるデータ(サービス依存関係・機能説明)を LLM プロンプトに補完する X-lifecycle アプローチを実証。IC3(Teams バックエンド)の 353 インシデント・260 モニタで、InC DEP(インコンテキスト例 5 件 + 上流サービス説明)が BLEU +5〜38%・NUBIA +54.67% を達成。モニタ SLO 分類でサービス説明補完が accuracy 0.75→0.79。(paper / aiops / incident-management / llm / rca / microsoft)
#### Keys to SRE (SREcon14, 2014) (2026-07-01)
- [[@2014__SREcon14__Keys to SRE]] — [[Ben Treynor Sloss]]([[Google]] VP Engineering)、SREcon14(2014-06-26)。SRE 創設者が「13 のキー」を SRE Book より 2 年早く初めて公開整理した基調講演。エラーバジェット・「ローンチオンブラック」ルール・運用 50% キャップ・5% 開発オンコール・移植可能性・Wheel of Misfortune・無責非難のポストモーテムが原型形態で提示されている。YouTube 自動字幕 transcript(~55 分 / 3303 秒)。映像フレーム未取得。(video / sre / error-budget / postmortem / srecon)
#### Incident Management and Chatops @ Netflix Feat Scorebot (SREcon16, 2016) (2026-07-01)
- [[@2016__SREcon16__Incident Management and Chatops @ Netflix Feat Scorebot]] — [[Al Tobey]]([[Netflix]] SRE)、SREcon16(2016-03-16)。2015 年 12 月生まれの Go 製チャットボット Scorebot による ChatOps インシデント管理自動化。Hipchat → Slack 移行後の実践。bookmarking・presence・after-hours・secrets の 4 機能設計。代表フレーム 12 枚・音声取得済み・Whisper transcript 処理中。(video / sre / chatops / incident-management / netflix / srecon)
#### Incident Response @ FB, Facebook's SEV Process (SREcon16 Europe, 2016) (2026-07-01)
- [[@2016__SREcon16__Incident Response @ FB, Facebook's SEV Process]] — [[Gareth Eason]]([[Facebook]] プロダクションレビュー(EMEA)運営者)、SREcon16 Europe(2016-07、Dublin)。「発見者=オーナー」原則・SEV1 意図的過大分類バイアス・IMOC の非技術的調整役割定義(blame umbrella / human mutex)・二段階レビューの3つの質問・メトリクスゲーミング警告・canary インシデント事例。代表フレーム6枚+YouTube自動字幕transcript。(video / sre / incident-management / facebook / srecon)
#### Incident Response in Unfamiliar Sociotechnical Systems (SREcon20 Americas, 2020) (2026-07-01)
- [[@2020__SREcon20Americas__Incident Response in Unfamiliar Sociotechnical Systems]] — [[Morgan Collins]]([[Salesforce]] Principal SRE)、SREcon20 Americas(バーチャル開催、2020-12-07〜09)。ICS の起源(FIRESCOPE)・民間企業向け再編されたICS組織図・COVID-19下の組織間(inter-organizational)インシデント対応の課題・「Warm Blanket Fallacy」(熟練ICでも不慣れな連携では通用しない)を提示。16スライド。transcript なし。(slides / sre / incident-management / incident-commander / ics)
#### When Systems Flatline—Enhancing Incident Response with Learnings from the Medical Field (SREcon21, 2021) (2026-07-01)
- [[@2021__SREcon21__When Systems Flatline - Enhancing Incident Response with Learnings from the Medical Field]] — [[Sarah Butt]]([[Salesforce]] SRE)、SREcon21(バーチャル開催、2021-10-14)。医療分野のアルゴリズム誘導意思決定(ACLS)・迅速安定化(ATLS)・標準化チェックリスト(WHO 手術チェックリスト)の3コンセプトを SRE インシデント対応に応用する提案。14スライド + 音声書き起こし。(slides / sre / incident-management / medical-analogy / srecon)
#### Dashboards and Runbooks: Scrapbooking for Engineers (SREcon22 Asia/Pacific, 2022) (2026-07-01)
- [[@2022__SREcon22APAC__Dashboards and Runbooks - Scrapbooking for Engineers]] — [[Colin Douch]]([[Cloudflare]] Observability Platform Team Tech Lead)、USENIX SREcon22 Asia/Pacific(2022-12-07、シドニー)。ダッシュボード・ランブックの汎用化しすぎ/特化しすぎの二極化を「エンジニアのスクラップブッキング」と呼び、ランブックの3クラス(自動化可能/自由記述/無価値)分類・良いランブックの本質的な一時性・composability(Jsonnet/Pulumi)・SLI/SLO・discoverability/explorability への移行を提案。USENIX ページはログイン必須のため YouTube 上の同一動画から自動字幕 transcript と代表フレーム20枚を取得。(video / sre / dashboard / runbook / observability / srecon)
#### Epic Incidents of History: The 1979 NORAD Nuclear Near Miss (SREcon23 Americas, 2023) (2026-07-01)
- [[@2023__SREcon23Americas__Epic Incidents of History - The 1979 NORAD Nuclear Near Miss]] — [[Nick Travaglini]]([[Honeycomb.io]] Technical Customer Success Manager)、USENIX SREcon23 Americas(2023-03-21、サンタクララ)。1979年 NORAD 核近接ミス事件を題材に、単一の根本原因ではなく Walker・Woods・Rayo の「複数の系統的寄与要因」の視座から、Vannevar Bush 主導の軍産学複合体("Iron Triangle")・SAGE・NORAD 427M システムへ至る計算機史とClosed World思考の圧力を分析。オペレーターのローカル合理性による誤警報看破の経緯を描く。34ページ + YouTube 自動字幕フォールバック transcript。(slides / sre / incident-management / human-factors / history-of-computing)
#### Incident Commanders (SREcon23 Americas, 2023) (2026-07-01)
- [[@2023__SREcon23Americas__Incident Commanders]] — [[Vanessa Huerta Granda]]・[[Emily Ruppe]]([[Jeli]])、USENIX SREcon23 Americas(2023年3月頃)。IC(Incident Commander)とインシデントアナリストを「似て非なる別々のスキルセット」と定義し、「指示を出さない・壊れたものを直さない」IC の核心と「事件がなぜそのように起きたかを調査する」アナリストの核心を対比。「インシデントのサイクル」ライフサイクル図・IC が事後検証も担うと社会技術的要因を見落とすリスク・IC の別名(Facilitator/Conductor/Sociotechnical Troubleshooter)を提示。代表フレーム12枚(全視聴確認済み) + YouTube 英語字幕。(video / sre / incident-management / incident-commander / srecon)
#### If I Can Do It on an Ambulance, You Can Do It in an Office: Scalable Incident Response Using ICS (SREcon23 Americas, 2023) (2026-07-01)
- [[@2023__SREcon23Americas__If I Can Do It on an Ambulance - Scalable Incident Response Using ICS]] — [[Thai Wood]](元 EMT、[[Resilience Roundup]] 主宰の独立コンサルタント)、USENIX SREcon23 Americas(2023-03-23、Santa Clara, CA)。ICS(Incident Command System)全体ではなく最小限の「種」から始めるアプローチを提案し、「3つの帽子」(Organizer/Connector/Expert)モデルを対応に必須の core needs として再定義。「ランブックは安全を買えない(you cannot document your way to safety)」というランブック批判と、ゲームデイ・テーブルトップ演習による practice の重要性を主張。YouTube 自動字幕 transcript(34分) + 代表フレーム12枚。(video / sre / incident-management / incident-commander / runbook / srecon)
#### The World Blew Up But We're All Okay: Managing a massive-scale incident at Datadog (SREcon23 EMEA, 2023) (2026-07-01)
- [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]] — [[Laurent Bernaille]]・[[Laura de Vesine]]([[Datadog]])、USENIX SREcon23 EMEA。2023年3月8日、Ubuntu の自動セキュリティ更新が誘発した systemd/networkd の経路フラッシュにより AWS・GCP・Azure 複数リージョンで Kubernetes ノードが同時多発的に接続不能になった大規模インシデントの技術的根本原因と、500人超・単一 Zoom 通話に14時間で493人参加という規模の組織的インシデント対応を発表。76ページ + Whisper 音声文字起こし(584行)。(slides / sre / incident-management / kubernetes / datadog / multi-cloud / srecon)
#### The Incident Is The Way: Using Your Incidents to Win Reliability Investment (SREcon23 EMEA, 2023) (2026-07-01)
- [[@2023__SREcon23EMEA__The Incident Is The Way - Using Your Incidents to Win Reliability Investment]] — [[Niall McCarthy]]([[Afterpay]] エンジニアリングリーダー)、USENIX SREcon23 EMEA(2023-10-11、ダブリン)。マイクロサービス単位でなくユーザー視点の「ケイパビリティ」でシステムをマッピングする実践、インシデント対応にエンジニアリング以外の組織を「関連性」基準で巻き込む実践、可用性でなく正しさ(correctness)で害を定義する実践、意図でなく結果(consequence)で重大度を判断する実践の4つのホームワークを、インシデントを信頼性投資獲得の機会に変える方法として提示する15分のライトニングトーク。YouTube 自動字幕 transcript + 代表フレーム22枚。(video / sre / incident-management / reliability-investment / srecon)
#### Hard Choices, Tight Timelines: A Closer Look at Tradeoff Decisions during Incidents (SREcon24 Americas, 2024) (2026-07-01)
- [[@2024__SREcon24Americas__Hard Choices, Tight Timelines - A Closer Look at Tradeoff Decisions during Incidents]] — [[Laura Maguire]](Trace Cognitive Engineering/OSU)・[[Courtney Nash]](The VOID)、USENIX SREcon24 Americas(2024-03-19)。インシデント対応中のトレードオフ意思決定を組織階層をまたいで分析し、The Void データベースに欠けている「意思決定の推論過程」を vignette 法で補完。上級リーダー・マネジメント層・対応者という階層ごとに重視する軸が異なる skip-level tradeoff を提示。Datadog 実例(p.13)・役割別比較表(p.19)・組織図(p.43)・コスト便益分布表(p.46)を含む全61ページ。(slides / sre / incident-management / tradeoff / human-factors)
#### Storytelling as an Incident Management Skill (SREcon24 Americas, 2024) (2026-07-01)
- [[@2024__SREcon24Americas__Storytelling as an Incident Management Skill]] — [[Laura de Vesine]]([[Datadog]] シニアスタッフエンジニア)、USENIX SREcon24 Americas(2024-03-20、サンフランシスコ)。Joseph Campbell の「英雄の旅」に代表される人物中心の物語形式を明示的に退け、因果の論理で出来事が連鎖する narrative を組み立てる技能が、オンコール準備・対応中の協調的ストーリーテリング・ポストモーテム作成のすべてを支えると論じる。「舞台設定→ドラマの追加→出来事の連鎖→対応の説明→修正計画」の5段階からなる「エンゲージングなポストモーテム」構成を提示。トラブルシューティングの経緯より出来事の連鎖を残すことを選ぶ理由(人間は直せないがシステムは直せるかもしれない)を明言。18ページ + Whisper 音声文字起こし。(slides / sre / incident-management / postmortem / srecon)
#### The Critical Resource Is You: Practical Destressing for On-Call Engineers (SREcon26 Americas, 2026) (2026-07-01)
- [[@2026__SREcon26Americas__The Critical Resource Is You - Practical Destressing for On-Call Engineers]] — [[Beth Adele Long]]([[Continuous Re-integration]] / [[Adaptive Capacity Labs]])、USENIX SREcon26 Americas(2026-03-24)。オンコール業務の慢性ストレス(ページャーを持つこと)と急性ストレス(インシデント対応)を ANS(自律神経系)の観点から分析し、Ordinary Mind / Sensory Mind の 2 モードと、身体知性に根ざした 4 つの実践ツール——Body Scan・Breath・Movement・Boredom——を提示。「ストレスは単なる負荷であり良くも悪くもない、健全なストレスはキャパシティを拡大する」という再フレーミングで締めくくる。43ページ、transcript なし。(slides / sre / on-call / stress-management / human-factors / srecon)
#### Your System Has Recovered from an Incident, but Have Your Developers? (SREcon18 Americas, 2018) (2026-07-01)
- [[@2018__SREcon18Americas__Your System Has Recovered from an Incident, but Have Your Developers]] — [[Jaime Woo]](元 [[Shopify]] テクノロジーコミュニケーション責任者)、USENIX SREcon18 Americas(2018-03-27)。インシデント後のエンジニアの心理的回復を医師・コメディアン・オリンピアンの知見から論じる。Shopify の本番エンジニア 40 名の調査データ(42.5% がインシデント後に強いストレスを報告、80% がピアサポートをほぼ受けていない)を軸に、「人間向けのインシデントレスポンス」の設計を促す。39ページ、transcript なし。(slides / sre / incident-management / human-factors / post-incident / srecon)
#### Epistemology of Incident Management (SREcon26 Americas, 2026) (2026-07-01)
- [[@2026__SREcon26Americas__Epistemology of Incident Management]] — [[Jack Kingsman]]([[Atlassian]] シニア SRE)、USENIX SREcon26 Americas(2026-03)。Google SRE Book の Incident Loop を 5 フェーズ(検知/宣言・生存/トリアージ・検査・診断・テスト/処置)に体系化し直し、証拠 2×2 マトリクス・3 種の探索パターン(Linear/Binary/Induced-Change)・仮説 3 条件(testable/relevant/specific)・テスト 6 基準(作用・相互排他・交絡排除・測定可逆・リスク管理・最小介入)を提案。"Incidents are all about knowledge" で締めくくる。49ページ + YouTube 英語自動字幕 transcript。CC-BY 4.0。(slides / sre / incident-management / troubleshooting / epistemology / srecon)
#### Retrieval as Reasoning: Self-Evolving Agent-Native Retrieval via LLM-Wiki (arXiv, 2026) (2026-07-02)
- [[@2026__arXiv__Retrieval as Reasoning]] — [[Haoliang Ming]] ほか(WeChat/Tencent)、arXiv 2026-05-26。Retrieval-as-Reasoning パラダイムを提唱し、文書を双方向リンク付き Wiki ページにコンパイル・エージェントが推論と連動して検索を制御する LLM-Wiki を実装。Error Book による自己修正機構を導入。HotpotQA・MuSiQue・2WikiMultiHopQA で SOTA(LightRAG 比 +2.0〜+8.1 F1)。(paper / nlp / rag / information-retrieval / multi-hop-qa / agentic)
#### Machine Learning Fleet Efficiency: Improving TPU Systems at Scale with ML Productivity Goodput (MLSys 2026) (2026-07-02)
- [[@2026__MLSys2026__Machine Learning Fleet Efficiency - Improving TPU Systems at Scale with ML Productivity Goodput]] — [[Arissa Wongpanich]] ほか([[Google]])、MLSys 2026 Industry Track(2026-05)。Capacity・Occupancy・Duty Cycle といった従来指標が ML フリートの「有用な仕事」を測れないことを指摘し、ML Productivity Goodput(MPG = Scheduling Goodput × Runtime Goodput × Program Goodput)を提案。Google TPU 本番フリートで全ジョブサイズ SG > 95%・非同期チェックポイント・AoT コンパイル・通信計算オーバーラップを実証。Program Goodput は roofline 効率でなく予測ステップ時間を分母に取ることでオペレーター融合余地を可視化する。(paper / distributed / machine-learning / systems-for-ml / tpu)
#### POSTER: Vedrfolnir: RDMA Network Performance Anomalies Diagnosis in Collective Communications (SIGCOMM Posters and Demos 2025) (2026-07-06)
- [[@2025__SIGCOMM__POSTER - Vedrfolnir - RDMA Network Performance Anomalies Diagnosis in Collective Communications]] — [[Yuxuan Chen]] ほか([[Menghao Zhang]] 対応著者、[[Beihang University]])、SIGCOMM Posters and Demos 2025。集合通信における RDMA NPA 診断システム Vedrfolnir。アルゴリズム分解→待機グラフ構築→ステップ認識型適応検知→マルチソースデータ融合の3段構成。[[Hawkeye]] 比 98% テレメトリ削減を NS3 評価で確認。(paper / networking / distributed / rdma / collective-communication)
#### Beyond Throughput: Performance and Energy Insights of LLM Inference Across AI Accelerators (IPDPS 2026) (2026-07-06)
- [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]] — [[Giacomo Brunetta]] ほか([[University of Illinois Chicago]] + [[Argonne National Laboratory]])、IEEE IPDPS 2026。6 GPU(NVIDIA A100/H100/GH200, AMD MI250/MI300X, Intel Max 1550) + 2 データフローアクセラレータ(Cerebras CS-3, SambaNova SN40L) × 14 LLM の大規模比較実験。スループット・レイテンシ・TTFT・ITL・エネルギー効率を測定。(paper / aiinfra / llm / gpu / hpc / inference)
#### AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations (arXiv, 2026) (2026-07-13)
- [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]] — [[Chenyu Zhao]]・[[Shenglin Zhang]] ほか([[Nankai University]] / [[Tsinghua University]] / [[Microsoft]])、arXiv 2026-07-07。LLM エージェントの失敗実行を Transition Unit のグラフ(Critical Transition Graph)で診断し、保護付き実行時介入で修正を維持する実行時修復フレームワーク AgentTether。τ-bench 261 タスクで Banking の初回失敗タスクを Qwen3.7-max 59.04%・GPT-5.4 65.12% 修復(Blind retry 比 +26.02pp 全体)。根本原因は症状の中央値 4 ステップ上流にあり(最大 26)、一度きりの診断は再実行中に減衰する(tool-call ステップ 13 で追従率 50% を割る)ことを実証。(paper / agent / aiops / agent-repair / graph-rca)
#### Integrating Large Language Models into Security Incident Response (USENIX SOUPS 2025) (2026-07-13)
- [[@2025__SOUPS__Integrating Large Language Models into Security Incident Response]] — [[Diana Kramer]]・[[Lambert Rosique]]・[[Ajay Narotam]]・[[Elie Bursztein]]・[[Patrick Gage Kelley]]・[[Kurt Thomas]]・[[Allison Woodruff]]([[Google]] / [[DataPhant]])、USENIX SOUPS 2025(2025-08-11)。Gemini 1.5 Flash による自律的なセキュリティインシデント要約は人間要約に61%対39%で劣後(完全性35%・事実性42%の欠陥率)する一方、人間がAI下書きを編集する協働(AI支援)要約は人間単独の要約より77%対11%で優位。18名のセキュリティアナリスト・50件の実インシデント(クラウド侵入/コインマイニング/認証情報漏洩/マルウェア/フィッシング)による4段階実験。(paper / security / incident-response / llm / human-ai-collaboration)
#### Large Language Models Can Provide Accurate and Interpretable Incident Triage (ISSRE 2024) (2026-07-13)
- [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]] — [[Zexin Wang]]・[[Jianhui Li]]・[[Minghua Ma]] ほか([[Microsoft]] / [[Chinese Academy of Sciences]])、ISSRE 2024(2024-10, pp.523-534)。LLM でログからキーワードを抽出しインシデントを担当チームへ割り当てるシステム COMET。AutoExtractor による生ログ絞り込み+ドメイン知識プロンプトによるキーワード抽出+FastText 埋め込み類似検索。Microsoft の2クラウドサービスに6ヶ月以上本番展開し、精度(ACC@1)30%改善・TTM 35%短縮。ログ・要約よりキーワードの方がトリアージ入力表現として優れることを比較実験で実証。(paper / aiops / incident-management / incident-triage / llm)
#### Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems (TOSEM投稿版) (2026-07-13)
- [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]] — [[Ruowei Fu]] ほか([[ByteDance]] / [[Nankai University]])、TOSEM投稿版(2026)。知識蒸留+自己強化+DPOによるSLMファインチューニングでチケットトリアージを行うCoTriage。3モジュール構成で大規模本番評価。同著者陣の先行研究OncallXとは対照的な知識蒸留路線。(paper / aiops / ticket-triage / llm / knowledge-distillation / reinforcement-learning)
#### Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents (arXiv, 2026) (2026-07-13)
- [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]] — [[Chenyu Zhao]]・[[Shenglin Zhang]] ほか([[Nankai University]])、arXiv 2026-06-05。ソフトウェアエンジニアリングエージェント向けの失敗基点構造化回復フレームワーク PROBE。診断精度改善(+43.58pt)が回復率改善(+12.45pt)を大きく上回る「diagnosis–recovery gap」を実証。AIOpsLab上でケーススタディ。(paper / agent / aiops / software-engineering)
#### Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems (2026-07-13)
- [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] — [[Chenyu Zhao]] ほか([[Nankai University]] / [[Peking University]] / [[Tsinghua University]] / [[Microsoft]])。クロスISAビルド修復ベンチマーク Build-bench。エージェント型ツール利用なしでは GPT-5 成功率6.13%、反復ループ環境下で63.19%(10.3倍)に到達することを実証。(paper / aiops / software-engineering / llm-agent / build-repair / cross-isa)
#### Bridging the Delay: Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis (FSE Companion 2026) (2026-07-13)
- [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]] — [[Junhua Kuang]] ほか([[Nankai University]] / [[Alibaba Group]] / [[Tsinghua University]])、FSE Companion '26。マイクロサービス障害伝播の81.5%が非同期(2分以上の遅延)であることを本番データで示し、時間ラグを明示的にモデル化するLagRCAを提案。(paper / aiops / root-cause-analysis / causal-inference / microservices)
#### LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles (ASE'26投稿版) (2026-07-13)
- [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] — [[Ruowei Fu]] ほか([[Nankai University]])、ASE'26投稿版(InsightTriage)。Huawei/ICV(車載)ドメイン向けチケット+ログ統合トリアージ。ログ検索器除去でWeighted F1が19.2%低下するアブレーションでログを一次証拠とする設計の有効性を実証。(paper / aiops / incident-management / llm / log-analysis)
#### FoundRoot: Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking (ICSE '26) (2026-07-13)
- [[@2026__ICSE__FoundRoot - Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking]] — [[Zhe Xie]] ほか([[Tsinghua University]] / [[ByteDance]] / [[Nankai University]])、ICSE '26。構造化深層思考(メトリクススキャン→伝播分析→リフレクション→ランキング)を warm-up SFT + DAPO で LLM に内在化し、ゼロショット RCA 4データセット全てで MRR 4.5%〜48.6%改善。(paper / aiops / root-cause-analysis / llm / reinforcement-learning)
#### Aloha: Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent (FSE Companion '26) (2026-07-13)
- [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]] — Shenglin Zhang・[[Yujia Wu]]・[[Jinghuan Ren]] ほか([[Nankai University]] / [[Microsoft]])、FSE Companion '26。対照分析ベースのバッチ障害診断で「アルゴリズムでなくusability gapが実務障壁」と指摘し、CONANをACC@5で0.9370対0.6963、診断時間を約10時間から約0.5時間に短縮。(paper / aiops / fault-localization / contrast-analysis / human-in-the-loop)
#### When LLMs Listen to Experts: Accurate Failure Diagnosis in Operating Systems (ICSE-SEIP '26) (2026-07-13)
- [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]] — [[Yongxin Zhao]] ほか([[Nankai University]] / [[Alibaba Group]] / [[Tsinghua University]])、ICSE-SEIP '26。OScope は Knowledge Aligner による症状記述の意味的整合とチャンク単位検証で、Alibaba本番OS障害診断AC@5=0.901・平均診断時間112分→1.5分を達成。(paper / aiops / operating-system / failure-diagnosis / llm)
#### PerfScout: An Adaptive Workload Generator in Software Performance Testing (ICSE-SEIP '26) (2026-07-13)
- [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]] — [[Yongqian Sun]] ほか([[Nankai University]] / [[BizSeer]] / [[Huawei Cloud]] / [[Tsinghua University]])、ICSE-SEIP '26。SPOT・ADF/KPSS・PPOを統合した性能テストワークロード生成の全自動化フレームワーク。Huawei Cloudに9か月間本番デプロイされ代表ケースで87%のテスト時間短縮を実証。(paper / aiops / performance-testing / reinforcement-learning)
#### A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection (IEEE TSC 2025) (2026-07-13)
- [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]] — Yongqian Sun ほか([[Nankai University]])、IEEE Transactions on Services Computing, 2025。トレース異常検知の初の横断ベンチマーク TADBench。全データセット横断で一貫最良のアルゴリズムは存在せず、決定木でアルゴリズムを推奨。(paper / aiops / trace-analysis / anomaly-detection / benchmark)
#### From Chaos to Clarity: Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services (FCS 2025) (2026-07-13)
- [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]] — [[Tianyu Cui]] ほか([[Nankai University]] / [[ByteDance]])、FCS 2025。カーネルパニックRCAをスパースログ抽出とログ間長距離依存の2課題に分解。ByteDance本番20,000件データでLogKGを15.5〜20.3pt F1上回り6ヶ月超本番デプロイ。(paper / aiops / log-analysis / kernel-panic / graph-neural-network)
#### Bridging Edge and Cloud: A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection (IEEE TSC 2025) (2026-07-13)
- [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] — Shenglin Zhang ほか([[Nankai University]] / [[Alibaba Cloud]])、IEEE Transactions on Services Computing, 2025。RefinedEdge は多変量時系列異常検知モデルをエッジ配置可能な水準(0.15Mパラメータ未満)まで圧縮しつつクラウド訓練モデルに匹敵・凌駕する精度を達成。(paper / aiops / time-series / edge-computing / knowledge-distillation)
#### A Survey of DevOps Concepts and Challenges (ACM Computing Surveys, 2019) (2026-07-14)
- [[A Survey of DevOps Concepts and Challenges]] — [[Leonardo Leite]]・[[Carla Rocha]]・[[Fabio Kon]]・[[Dejan Milojicic]]・[[Paulo Meirelles]]([[University of São Paulo]] / [[University of Brasília]] / [[Hewlett Packard Labs]] / [[Federal University of São Paulo]])、ACM Computing Surveys, 2019。50本のcore paperにGrounded Theory的手法を適用し、DevOps概念をprocess/people/delivery/runtimeの4カテゴリからなるconceptual frameworkとして体系化し、既存DevOps SLRがdelivery/runtime(技術的含意)を軽視していたことを指摘。(paper / devops / survey / conceptual-framework)
#### OpenRCA 2.0: From Outcome Labels to Causal Process Supervision (arXiv, 2026) (2026-07-14)
- [[@2026__arXiv__OpenRCA 2.0 - From Outcome Labels to Causal Process Supervision]] — [[Aoyang Fang]]・[[Pinjia He]] ら([[The Chinese University of Hong Kong, Shenzhen]])、arXiv:2606.27154, 2026。既知の障害注入介入を使う段階的因果ラベリング PAVE で、根本原因サービスだけでなく検証済みの因果伝播経路まで持つ初の cross-system RCA ベンチマーク OpenRCA 2.0(TrainTicket・OTel Demo・Hotel Reservation、500 インスタンス)を構築。11 の最先端 LLM を評価すると厳密一致 EM は 20.7% にとどまり、正しいサービスを言い当てる AnySvc(76.0%)と検証済み経路で裏づける Path Reachability(61.5%)の 14.5pp のギャップを「grounding されていない診断(ungrounded diagnosis)」と定義。Edge F1(43.4%)が Node F1(62.2%)を全モデルで下回ることも示す。(paper / aiops / microservice / rca-benchmark / causal-discovery)
#### The Anatomy of a Large-Scale Hypertextual Web Search Engine (Computer Networks, 1998) (2026-07-15)
- [[@1998__Computer Networks__The Anatomy of a Large-Scale Hypertextual Web Search Engine]] — [[Sergey Brin]]・[[Lawrence Page]]([[Stanford University]])、Computer Networks and ISDN Systems 30 (1998) 107-117 / WWW7 1998。2,400万ページ規模の Web 検索エンジンプロトタイプ Google を報告し、リンク構造由来のページ重要度指標 PageRank とアンカーテキスト索引化を核とした設計・アーキテクチャ・実測ストレージ/クロール性能を詳述する、検索エンジンとしての Google の創業論文。(paper / information-retrieval / web / ranking)
#### Valet: Efficient Data Placement on Modern SSDs (SoCC '25) (2026-07-15)
- [[@2025__SoCC__Valet - Efficient Data Placement on Modern SSDs]] — Devashish R. Purandare・Peter Alvaro・Avani Wildani・Darrell D. E. Long・Ethan L. Miller([[UC Santa Cruz]] / [[Emory University]] / [[Cloudflare]] / [[Pure Storage]])、ACM Symposium on Cloud Computing (SoCC '25)。LD_PRELOAD ベースの userspace シムレイヤー Valet を提案し、アプリケーション・ファイルシステム・カーネルを一切変更せずに RocksDB・MongoDB・CacheLib へ affinity/lifetime ベースの配置ヒントを注入。f2fs に対し2〜6倍のスループット、最大6倍低いテールレイテンシを達成し、アプリケーション固有ソリューション zenfs に匹敵する性能と広い適用性を両立。(paper / storage / ssd / zns / shim-layer)
#### Recursive Self-Improvement (LessWrong, 2008) (2026-07-15)
- [[@2008__LessWrong__Recursive Self-Improvement]] — [[Eliezer Yudkowsky]]、LessWrong(2008-12-01)。「AI go FOOM」論の中心的論証を提示する一次資料。因果を5層(metacognitive/cognitive/metaknowledge/knowledge/object level)に分解し、AIが自身の記憶検索アルゴリズムを改善する課題を与えられた瞬間にmetacognitive層とobject層が同一化する「真の再帰」を定義。複雑な最適化連鎖を再帰で自己に畳み込むと理論上「横ばいか爆発かのどちらか」になるはずだと論じ、ソフトテイクオフには「正確に都合の良い収穫逓減則」という狭い条件が必要と主張する。(article / ai-safety / rsi / foom / takeoff)
#### Can Large Language Models Generate Observability-Aware Code? (arXiv, 2026) (2026-07-15)
- [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]] — [[Yongliang Tao]] ほか([[Chongqing University]] / [[Microsoft]])、arXiv:2607.05785, 2026-07-07。コーディングエージェント生成コードのオブザーバビリティを、18リポジトリ1,223インスタンスのソースレベル復元(Position F1・KeyBag F1)と、200個のagent生成マイクロサービス・1,615件の注入障害による実行時評価(Fault Signals Rate 4.95〜13.99%)の2軸で実証。エージェントは配置(where)より診断意味論(what)の再現が体系的に弱く、explicit instructionは生成量を増やすが質を下げるQuantity over Quality現象を確認。軽量observability skillの効果は限定的。(paper / aiops / coding-agents / observability)
#### AI 2040: Plan A — The Deal (AI Futures Project, 2026) (2026-07-16)
- [[@2026__AI Futures Project__AI 2040 - Plan A - The Deal]] — [[AI Futures Project]]([[Daniel Kokotajlo]] ほか)。「AI 2027」の続編となる政策シナリオ文書(90ページ)。米中が超知能開発への無謀な競争を回避する国際的取り決め「Plan A」——研究の完全透明化・コンピュート宣言・訓練一時停止・相互確証コンピュート破壊(MACD)——によって超知能到達を2040年まで先送りする成功シナリオを年表形式で描く。代替プランB(Sabotage)/C(Slowdown)/D(Race)/S(Shutdown)との比較、中国による秘密裏AGI計画の検知確率分析(Appendix D)、著者ら自身の卓上演習で繰り返し再現された最悪の失敗モード(欠陥のある安全性ケースの承認、Appendix L)を含む。(paper / ai-safety / ai-governance / scenario-planning)
#### LLM高速化(勉強会) (SpeakerDeck, 2026) (2026-07-16)
- [[@2026__SpeakerDeck__LLM高速化(勉強会)]] — [[SuperHotDog]]、SpeakerDeck(全50ページ)。KVCache・FlashAttention・Super Sequence + Continual Batching・PagedAttention・Speculative Decoding といったアルゴリズム的高速化、CUDA/Triton/CuTe による実装、GQA・MLA・Sliding Attention・Linear Attention のアーキテクチャ的工夫、量子化(Mixed Precision Accumulation・Ozaki Scheme)、Nsight Compute/Systems によるプロファイリング、CUDAGraph、vLLM の内部構造とコントリビュート方法までを一気通貫で扱う勉強会資料。Qwen2.5-0.5B-Instruct のハンズオンで Transformers 推論(5.97 tokens/sec)から vLLM 推論(94.84 tokens/sec)への 15.88 倍高速化を実演する。(slides / llm-inference / gpu / kv-cache)
#### A New Golden Age for Computer Architecture (CACM, 2019) (2026-07-17)
- [[@2019__CACM__A New Golden Age for Computer Architecture]] — [[John L. Hennessy]]・[[David A. Patterson]]([[Stanford University]] / [[University of California, Berkeley]])、Communications of the ACM, Vol. 62 No. 2, 2019-02。2017年ACM Turing賞受賞記念講演(Turing Lecture)のCACM掲載版。IBM System/360からRISC-Vまでの命令セットアーキテクチャ(ISA)の歴史を振り返り、Moore の法則・Dennard スケーリングの終焉により汎用プロセッサの性能向上率が年3%まで低下すると分析した上で、ドメイン固有アーキテクチャ(DSA、Google TPU v1 が汎用CPU比29倍高速・80倍超のエネルギー効率を実証)・オープンISA(RISC-V)・アジャイルなハードウェア開発の3つを次の10年の黄金時代の道筋として提示する。(paper / computer-architecture / risc / dsa / risc-v)
#### ContextPilot: Fast Long-Context Inference via Context Reuse (MLSys 2026) (2026-07-18)
- [[@2026__MLSys2026__ContextPilot - Fast Long-Context Inference via Context Reuse]] — Yinsicheng Jiang・Yeqi Huang ほか([[University of Edinburgh]])、第9回 MLSys Conference 2026(Oral)、arXiv:2511.03475。完全一致 prefix caching の低再利用率と近似 KV マッチングの精度劣化というトレードオフを、コンテキストブロック単位の整列・重複排除・優先順位注釈で回避し、精度をほぼ落とさずにプリフィルレイテンシを最大3倍削減。DeepSeek-R1(671B)・エッジデバイスまで幅広く評価。(paper / llm-inference / kv-cache / rag)
#### The Too-Much-Talent Effect: Team Interdependence Determines When More Talent Is Too Much Versus Not Enough (Psychological Science, 2014) (2026-07-18)
- [[@2014__PsychSci__The Too-Much-Talent Effect - Team Interdependence Determines When More Talent Is Too Much or Not Enough]] — Roderick I. Swaab・Michael Schaerer・Eric M. Anicich・Richard Ronay・Adam D. Galinsky([[INSEAD]] / [[Columbia University]] / [[Vrije Universiteit Amsterdam]])、Psychological Science, Vol. 25 No. 8, 2014-08、DOI: 10.1177/0956797614537280。サッカー(FIFA)・バスケットボール(NBA)・野球(MLB)のアーカイバルデータから、トップタレント比率とチーム成績の関係がタスク相互依存性の高いスポーツ(サッカー・バスケ)では逆U字型に転じ、低いスポーツ(野球)では単調増加のままであることを実証。NBAの play-by-play データではチーム内コーディネーションの低下が媒介変数であることも統計的に立証。(paper / organizational-behavior / team-performance / sports-analytics)
#### LLM生成テキストの統計的検知: TF-IDF+SVMによるAIGC分類器の構築 (2026-07-20)
- [[AI生成テキスト分類器]] — [[lyc8503]] の個人ブログ記事。パープレキシティベースの検知(失敗)から `TF-IDF` + `LinearSVC` による文単位分類器 [[AITextDetector]] へ移行し、7 LLM分の二値分類器の多数決で約85%の文単位精度、未知モデルにも約70%以上の検知率を達成。実データでの低偽陽性率(0.04%@閾値60%)と、Lofterトレンド記事の32.22%がAI生成疑いという実測結果、翻訳往復・脱AI感プロンプトの限定的な回避効果を報告。(source / article / AI生成テキスト検知 / TF-IDF / テキスト分類)
#### Adversarial dynamical systems characterize when data-driven learning succeeds or fails (Nature Communications, 2026) (2026-07-20)
- [[@2026__NatCommun__Adversarial dynamical systems characterize when data-driven learning succeeds or fails]] — [[Matthew J. Colbrook]]・[[Igor Mezić]]・[[Alexei Stepanenko]]([[University of Cambridge]] / [[UC Santa Barbara]])、Nature Communications (2026) 17:5397。敵対的力学系の構成によりKoopman作用素スペクトル学習の不可能性(測度保存性・連続性の法が揃わない限り単一極限アルゴリズムは50%超の確率で収束不可)を証明する一方、条件が揃えば誤差保証つき最適アルゴリズムを構成し、可解性複雑性指標(SCI)で問題の複雑性を完全分類。北極海氷濃度データで隠れた減衰モードを検出し、IceNet・SEAS5を低コストで上回る長期予測を実証。(source / paper / dynamical-systems / koopman-operator / computability)
#### FailSafe: High-performance Resilient Serving (arXiv, 2025 / MLSys 2026 Oral) (2026-07-20)
- [[@2025__arXiv__FailSafe - High-performance Resilient Serving]] — Ziyi Xu([[Shanghai Jiao Tong University]])・[[Zhiqiang Xie]]・[[Swapnil Gandhi]]・[[Christos Kozyrakis]]([[Stanford University]])、arXiv:2511.14116(2025-11-18、cs.DC、Under Review)。MLSys 2026 Oral(改題後 "RaidServe")。テンソル並列 LLM サービングの耐障害システム。Cyclic KVCache Placement・Hybrid Attention・Fine-Grained Load-Aware Routing による計算・メモリ均衡と、プロアクティブ KVCache バックアップ・FFN シャーディング可換性を利用したオンデマンド重み復旧による183倍高速な復旧を実現。8×H100 で標準的な障害対応比最大2倍のスループット。(paper / llm-serving / fault-tolerance / tensor-parallelism)
#### In-House LLM Serving at Netflix (Netflix TechBlog, 2026) (2026-07-20)
- [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]] — Liping Pengほか([[Netflix]] AI Platform)、2026-07。既存のJVMベース統合サービングシステムとModel Scoring Service(MSS)/[[Triton Inference Server]]の上でLLM推論を内製運用する事例。2026年夏に[[TensorRT-LLM]]から[[vLLM]]へpaved-pathエンジンを切り替え(判断基準は性能でなく運用適合性)、TritonのvLLMバックエンド採用とバージョン整合の運用課題、OpenAI互換API追加、Red-Black/Versionedデプロイ戦略、vLLM V0→V1移行によるlogits processorのバッチレベル化([[制約付きデコーディング]])を報告。(source / article / llm-inference / serving / netflix / vllm / triton)
#### Niyama: Breaking the Silos of LLM Inference Serving (arXiv, 2025 / ASPLOS 2026) (2026-07-20)
- [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]] — [[Kanishk Goel]]・[[Jayashree Mohan]]・[[Nipun Kwatra]]・[[Ravi Shreyas Anupindi]]・[[Ramachandran Ramjee]]([[Microsoft Research]] India)、arXiv:2503.22562(2025-03-28、cs.LG/cs.AI/cs.DC)。改題後 "QoServe" として ASPLOS 2026 採録。既存 LLM サービングの interactive/batch サイロ分割を廃し、複数 QoS クラスを同一レプリカ上で co-schedule する QoS 駆動スケジューリングシステム Niyama を提示。動的チャンキング(デッドラインスラック活用)・ハイブリッド優先度付け(EDF/SRPF 線形補間)・積極的降格(過負荷時の選択的リクエスト降格)の 3 技術により、SOTA サイロ構成比で GPU 必要台数を最大 32% 削減し、極限負荷下で SLO 違反を一桁削減。[[Sarathi-Serve]] のスケジューラを拡張して実装。(paper / llm-serving / scheduling / qos)
#### DuckDB: an Embeddable Analytical Database (SIGMOD '19) (2026-07-20)
- [[@2019__SIGMOD__DuckDB - an Embeddable Analytical Database]] — [[Mark Raasveldt]]・[[Hannes Mühleisen]]([[CWI]])、SIGMOD '19 Demonstration track、4ページ、DOI 10.1145/3299869.3320212。SQLiteのような組み込みデータベースがOLTP向け設計のためOLAP性能に乏しいという課題を受け、パーサ(libpg_query)・コストベースオプティマイザ・ベクトル化解釈実行エンジン・HyPer由来のシリアライザブルMVCC・DataBlocksストレージから成る、ゼロから組み込み分析用途向けに設計されたデータベースDuckDBを提示。前身[[MonetDBLite]]の非purpose-built性が開発動機であることと、JIT不採用による移植性重視を報告。SQLite・MonetDBLite・HyPerとの対決を想定したTPC-Hデモンストレーション構成(teaser/drilldownシナリオ)を提案する。(paper / database / olap / embedded-database)
#### Welcome & Setup (Design and Implementation of DuckDB Internals, Lecture 1) (DiDi Course, 2026) (2026-07-20)
- [[@2026__DuckDB__Welcome & Setup (DiDi Course, Lecture 1)]] — [[Torsten Grust]]([[Universität Tübingen]])が担当する15週構成の講義シリーズ「Design and Implementation of DuckDB Internals(DiDi)」第1回スライド。講義全体の射程(データ表現、SQLからのクエリプラン生成、データ構造とアルゴリズム、CPUアーキテクチャとの関係、並列性、耐障害性)を概観する導入回。[[DuckDB]]がSQLiteのようなDBMSプロセス分離アーキテクチャを取らずクライアントと同一プロセスに組み込む「zero copy」設計であること、2019年6月初リリースの比較的新しいDBMSであること、名称がHannes Mühleisenの飼っていたアヒルWilburに由来することを紹介する。(slides / database / olap / embedded-database)
#### The Query Performance Spectrum (DiDi Course #2, 2026) (2026-07-20)
- [[@2026__DiDi__The Query Performance Spectrum]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第2回。TPC-H `lineitem` テーブル(SF=1、6+百万行・720MB)の`quantity`列合計という単純クエリを、awk・Python・C(getline/mmap/mmap+マルチスレッド)・SQL([[DuckDB]])の7実装で実測比較し、実行時間がawk 1.60秒からC+mmap+マルチスレッド0.04秒まで40倍以上変動することを示す。システムコール削減・SWARビット演算・マルチスレッド化(T=12コアで18.8 GB/s、DRAM帯域21 GB/sに接近)というDBMS内部最適化を段階的に提示する。(slides / database / olap / performance-engineering)
#### Managing Memory + Grouped Aggregation (DiDi Course #3, 2026) (2026-07-20)
- [[@2026__DiDi__Managing Memory + Grouped Aggregation]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第3回。[[DuckDB]]のメモリ管理(ホストRAM80%既定利用、非ページ/ページ割り当て・ベーステーブルバッファリングの統合管理、German Strings表現)と、ハッシュベースグループ集約(`HASH_GROUP_BY`/`PERFECT_HASH_GROUP_BY`、線形プロービング、スレッドローカル事前集約Phase 1とパーティション単位集約Phase 2の2段階設計)を扱う。(slides / database / olap / memory-management)
#### Sorting Large Tables (DiDi Course #4, 2026) (2026-07-20)
- [[@2026__DiDi__Sorting Large Tables]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第4回。[[DuckDB]]の大規模テーブルソートを二相マージソート戦略・キー正規化・並列マージの3点で解説。フェーズ➊でソートキーを固定長へ正規化(uint64_t比較)しVergesort/Ska Sort/Pattern-defeating QuickSortでランを生成、フェーズ➋でT-way mergeする。直近の大規模書き換えはv1.4.0(2025年9月)。(slides / database / olap / sorting)
#### The ART of Indexing (DiDi Course #5, 2026) (2026-07-20)
- [[@2026__DiDi__The ART of Indexing]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第5回。[[DuckDB]]が実装する2種類のインデックス、Zonemap(min-maxインデックス、行グループ122,880行単位)とAdaptive Radix Tree(ART、値のビット列に基づく自己組織化探索木)を扱う。ARTはspan=8bitでNode4/16/48/256の4種類の内部ノード型を使い分け、遅延展開とパス圧縮(悲観的/楽観的)で木高と空間を削減する。(slides / database / olap / indexing)
#### Query Execution Plans and Pipelining (DiDi Course #6, 2026) (2026-07-20)
- [[@2026__DiDi__Query Execution Plans and Pipelining]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第6回。[[DuckDB]]がSQLを木構造の実行プラン(演算子ノード、2048行データチャンクのエッジ)へ変換し、自明に並列な演算子(FILTER・PROJECTION)とパイプラインブレーカーとなるシンク演算子(HASH_GROUP_BY、Sink→Combine→Finalizeの3フェーズ)を対比しながらパイプラインへ分解する仕組みを扱う。パイプライン依存関係とパイプライン駆動ループの疑似コードをTPC-Hクエリで解説する。(slides / database / olap / query-execution)
#### Vectorized Query Execution (DiDi Course #7, 2026) (2026-07-20)
- [[@2026__DiDi__Vectorized Query Execution]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第7回。[[DuckDB]]のデータ単位(vector・data chunk・morsel)、ベクトル物理表現(FLAT/CONSTANT/DICTIONARY/SEQUENCE)、super-specificコード生成と組み合わせ爆発回避のためのunified representation+テンプレート、DuckDB 1.4実ソースでの比較式評価トレース(`ExpressionExecutor`→`BinaryExecutor::ExecuteGenericLoop`)、コンパイラのtight loop生成(SIMD化・`__restrict__`)、分岐予測ミスペナルティ(約15サイクル)を扱う。(slides / database / olap / simd / vectorization)
#### Query Rewriting and Optimization (DiDi Course #8, 2026) (2026-07-20)
- [[@2026__DiDi__Query Rewriting and Optimization]] — [[Torsten Grust]]([[Universität Tübingen]])によるDiDi講義第8回。[[DuckDB]]のクエリオプティマイザを扱い、v1.5で30以上の最適化パス(式簡約・述語並べ替え・フィルタプッシュダウン等、fixpoint反復なしの一方向適用)、結合順序最適化(カタラン数で爆発する結合木探索空間へのMoerkotte & NeumannのDPhyp動的計画法適用)、クエリ非相関化(Neumann & KemperのUnnesting Arbitrary Queriesに基づくDEPENDENT_JOINの系統的書き換え)をTPC-Hクエリで解説する。(slides / database / olap / query-optimization)
#### 30分でわかるデータ指向アプリケーションデザイン (Data Engineering Study #18, 2023) (2026-07-20)
- [[@2023__DataEngineeringStudy__30分でわかるデータ指向アプリケーションデザイン]] — 『データ指向アプリケーションデザイン』監訳者[[Taro L. Saito]]による講演。原著出版(2017年)から5年間の発展を、データ形式(Parquet/Dremel)・インデックス構造(B-Tree/LSMツリー)・分散トランザクション(Amazon Aurora)・[[導出データ]](dbt、Delta Lake/Iceberg/Hudi)・SQLの役割拡大(F1、Trino)・SLO(2023年Elon Muskツイート未配信問題)という原著の枠組みに沿って再構成する。(slides / database / distributed-systems)
#### LLM hallucinations in the wild: Large-scale evidence from non-existent citations (arXiv, 2026) (2026-07-20)
- [[@2026__arXiv__LLM hallucinations in the wild]] — [[Zhenyue Zhao]]・[[Yihe Wang]]ほか([[Cornell University]]・[[Tsinghua University]]・[[University of California, Berkeley]] Haas School of Business)。arXiv・bioRxiv・SSRN・PubMed Centralの参照1億1,100万件を監査し、LLM登場前後の unmatched 引用率の差分から2025年単年で146,932件のハルシネーション引用を推定。汚染は多数の論文への薄い拡散パターンであり、既存のモデレーション・査読は大半を捕捉できていない。(paper / llm / hallucination / science-of-science)
#### Aurora DSQL: Scalable, Multi-Region OLTP (arXiv, 2026) (2026-07-20)
- [[@2026__arXiv__Aurora DSQL - Scalable, Multi-Region OLTP]] — [[Marc Brooker]]・Marc Bowes・Mike Hershey・Zak van der Merwe・James Morle・Matthys Strydom([[Amazon Web Services]])。Query Processor・Adjudicator・Journal・Crossbar・Storage に分離した disaggregated アーキテクチャを持つサーバーレス SQL データベース。MVCC による座標不要読み取りと OCC による書き込みを組み合わせ、コミット時のみクロスリージョン座標する設計により、2リージョン構成で SELECT p99 約2ms・COMMIT p99 約30msを実測。Journal 間の2-of-3イレイジャーコーディングでレイテンシ分散と可用性を同時に改善する。(paper / database / distributed / oltp)
#### Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3 (SOSP, 2021) (2026-07-20)
- [[@2021__SOSP__Using Lightweight Formal Methods to Validate a Key-Value Storage Node in Amazon S3]] — [[James Bornholt]]ほか([[Amazon Web Services]] / ETH Zurich / University of Washington)。[[Amazon Web Services]] S3 の新しいキーバリューストレージノード [[ShardStore]] を、実装と同じ言語(Rust)で書かれた参照モデル・property-based testing・stateless model checking(Loom / Shuttle)で検証する軽量形式手法アプローチを報告する。本番投入前に機能的正しさ5件・クラッシュ整合性5件・並行性6件の計16件の不具合を検出し、検証アーティファクトの保守を段階的に非専門エンジニアへ引き継いだ。(paper / storage / formal-methods / distributed)
#### The Snowflake Elastic Data Warehouse (SIGMOD, 2016) (2026-07-20)
- [[@2016__SIGMOD__The Snowflake Elastic Data Warehouse]] — Benoit Dageville・Thierry Cruanes・Marcin Zukowski ほか([[Snowflake Computing]])。ストレージ(Amazon S3)とコンピュート(Virtual Warehouse)を疎結合サービスへ分離した「マルチクラスタ・シェアードデータ・アーキテクチャ」を導入した産業論文。テーブルファイルの不変性を核に、MVCCベースのSnapshot Isolation・時間旅行・クローン・全サービスのステートレス化によるオンラインアップグレードを同一設計原理から導出。VARIANT型・自動スキーマ推論・列指向格納による半構造化データのELT処理を約10%オーバーヘッドで実現し、4階層(root/account/table/file)の鍵階層でエンドツーエンド暗号化する。(paper / database / distributed / cloud)
#### MapReduce: Simplified Data Processing on Large Clusters (OSDI, 2004) (2026-07-20)
- [[@2004__OSDI__MapReduce - Simplified Data Processing on Large Clusters]] — [[Jeffrey Dean]]・[[Sanjay Ghemawat]]([[Google]], Inc.)。map/reduce の2関数だけで大規模クラスタ上の並列分散計算を記述できるプログラミングモデルとその耐障害実装を提案した基盤論文。master による中央集権スケジューリング・タスク再実行による耐障害性・[[Google File System]] の局所性を活用したデータ配置最適化・straggler 緩和のためのバックアップタスク機構を特徴とする。2004年8月時点で月29,423ジョブ・入力3,288TBの規模で本番稼働し、Google の検索インデックス生成システムの書き換え(コード量約1/5に削減)に使用された。BSP データフロー型タスク並列フレームワークの起源。(paper / distributed-systems / task-parallel)
#### Dremel: Interactive Analysis of Web-Scale Datasets (VLDB, 2010) (2026-07-20)
- [[@2010__VLDB__Dremel - Interactive Analysis of Web-Scale Datasets]] — Sergey Melnik ほか([[Google]], Inc.)。ネストデータに対する列指向ストレージ(repetition level / definition level)とウェブ検索由来の多段サービス木を組み合わせ、兆行規模テーブルへの集計クエリを数秒で実行する対話的クエリシステム。MapReduceを置き換えず補完する設計思想を明示し、3000ノード規模の実験でMR-on-recordsに対し87TBに対し約0.5TBしか読まず実行時間を2桁短縮する。(paper / database / olap / distributed)
#### Mach: A Pluggable Metrics Storage Engine for the Age of Observability (CIDR, 2022) (2026-07-21)
- [[@2022__CIDR__Mach - A Pluggable Metrics Storage Engine for the Age of Observability]] — [[Franco Solleza]]・[[Andrew Crotty]]・[[Suman Karumuri]]・[[Nesime Tatbul]]・[[Stan Zdonik]]([[Brown University]]・[[Carnegie Mellon University]]・[[Slack Technologies]]・Intel Labs・MIT)。オブザーバビリティ用メトリクスに特化したプラガブルストレージエンジン Mach。複数の独立ライタースレッドが疎結合(mutex 協調なし)に振る舞うアーキテクチャで、単一ノード最大480M f64/秒の書き込み(既存手法比約10倍)・空間次元で100万ソースまでのスケーリング・既存手法比最大3倍の読み取りスループットを予備実験で示した(CIDR 2022)。(paper / database / time-series / observability)
#### Don't Predict, Prioritize: Rethinking GPU Reliability Assessment (KDD '26 V.2, arXiv 2026) (2026-07-21)
- [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]] — Difeng Ma・[[Changhua Pei]]ほか(Computer Network Information Center, [[Chinese Academy of Sciences]] / [[University of Chinese Academy of Sciences]] / [[StepFun]] / [[Tsinghua University]])。GPU の Double Bit Error・GPU Lost 障害が時系列テレメトリからは本質的に予測不能であることを 5 モデル横断で実証し、ホスト単位のリスクランキングへ再定式化する Learning-to-Rank モデル HeaRank を提案。本番クラスタで AUC 0.834、上位 5% リスクノードで将来障害の 64% を捕捉(既存 Health Score システムは 21%)し、6 ヶ月の本番展開で月あたり約 5 万ドルの GPU 時間節約を試算した。(paper / aiops / hpc / gpu-reliability)
#### ネットワーク監視の自動化はどこまでできるのか? -Apache Airflowによるアラート対応基盤- (JANOG58, 2026)
- [[@2026__JANOG58__ネットワーク監視の自動化はどこまでできるのか - Apache Airflowによるアラート対応基盤]] — [[上岡 輔乃]]([[LINE株式会社|LINEヤフー株式会社]])。22,000台以上のデータセンターネットワークにおけるアラート一次対応の人手ボトルネックに対し、[[Apache Airflow]] を共通基盤として NW 運用ワークフローを分業実装し、Airflow 単体では不足するアラート駆動起動・種別紐付け・重複排除を内製 API [[oyakata]] で補う設計を報告する。[[NetBox]] 連携によるタグベース重複排除、ワークフロー内 LLM Agent 組み込みパターンを含み、複数 NW チームへの本番導入でアラート一次対応の90%以上を自動化した。(slides / networking / workflow-automation / aiops)
#### Rack-Scale GPUサーバーのNW設計と運用までの苦悩 (JANOG58, 2026) (2026-07-21)
- [[@2026__JANOG58__Rack-Scale GPUサーバーのNW設計と運用までの苦悩]] — [[内田泰広]]・[[張朝程]]([[ソフトバンク株式会社]])。NVIDIA GB200 NVL72 を用いた Rack-Scale GPU サーバー基盤の Compute/Converged/OOB Fabric 分離設計、Scalable Unit(SU)単位のサービス提供トレードオフ(Rack/Tray/GPU単位)、ケーブリング自動化・Optics の BER/FEC トラブルシュート・液冷トレイ交換運用までの実務知見を報告する。(slides / networking / gpu-infrastructure / liquid-cooling)
#### AIインフラ時代のデータセンター内光配線の実践知 ~高密度実装の課題と解決策~ (JANOG58, 2026) (2026-07-21)
- [[@2026__JANOG58__AIインフラ時代のデータセンター内光配線の実践知]] — [[井上喬視]]([[SAKURA internet Inc]])・[[菊地秀夫]]([[TWCCパートナーズ合同会社]]代表、元[[株式会社フジクラ]])。さくらインターネットのコンテナ型DC(第1弾H200約1000基、第2弾B200約1100基・ISC2026 TOP500世界63位)を実例に、光ケーブル細径多心化・MPOコネクタ規格・Method A/B/C配線方式、FRO→LRO→LPO→CPO光トランシーバー電力方式、光ファイバーシャフル配線によるGPUクラスタ4倍拡張、VSFF光コネクタを扱う(共催: SAKURA Internet・[[エクストリーク株式会社]])。(slides / networking / datacenter / optical-interconnect)
#### Real-Time Incident Prediction for Online Service Systems (ESEC/FSE '20) (2026-07-21)
- [[@2020__ESEC-FSE__Real-Time Incident Prediction for Online Service Systems]] — [[Nengwen Zhao]]・[[Junjie Chen]](対応著者)ほか([[Tsinghua University]]; BNRist・[[Tianjin University]]・[[BizSeer]]・[[China EverBright Bank]])。アラートデータのみから LDA テキスト特徴+統計特徴+multi-instance learning でノイズアラートを抑制し、XGBoost+SMOTE で二値分類・LIME で解釈可能レポートを生成するリアルタイムインシデント予測手法 eWarn を提案する。大手商業銀行の11実サービスシステムで平均F1 0.82を達成し、[[AirAlert]](0.51)・TF-IDF-LSTM(0.60)・銀行の現行実務FP-Growth(0.10)を上回った。2行への実運用適用と4件の成功事例を報告する。(paper / aiops / failure-prediction / alert-management)
#### Understanding Reasoning from Pretraining to Post-Training (arXiv, 2026) (2026-07-21)
- [[@2026__arXiv__Understanding Reasoning from Pretraining to Post-Training]] — [[Jingyan Shen]]・[[Ang Li]](対応著者)ほか([[New York University]]・[[Modal Labs]]・[[University of California, Los Angeles]]・[[University of Illinois Urbana-Champaign]]・[[Columbia University]])。チェスパズルを制御可能なテストベッドとして、事前学習・SFT・GRPOベースの検証可能報酬RLの3段パイプラインを構築し、事前学習の損失・トークン数からRL報酬曲線の切片・傾きを予測する結合スケーリング則 `R(CRL,N,T) = f(Lpt(N,T)) + g(N,T)(log10 CRL − log10 Cref)` を導出する。RLによるポリシー変化を Ground-truth amplification・Tail discovery・Wrong-mode amplification の3categoryに分類し、難易度ビン別に定量分析した。(paper / reinforcement-learning / scaling-laws / chess)
#### DAG-FM: A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms (arXiv, 2026) (2026-07-22)
- [[@2026__arXiv__DAG-FM - A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms]] — Yikang Chen・Zhengkang Guan・Haoyuan Qian・Yi Yang([[Zhejiang University]])・[[Peng Cui]]([[Tsinghua University]])・[[Kun Kuang]](責任著者、[[Zhejiang University]])。事前分布空間を4つの識別可能なFCM族(LiNGAM/ANM/HNM/PNL)に制限する理論的設計条件と、葉ノード予測→親ノード予測の2段階自己回帰分解+Mixture-of-Leaf-Expertsを組み合わせ、DAG識別可能性の理論的保証を保ったままスケーラブルなアモータイズド因果発見を実現する基盤モデル。(paper / causal-discovery / foundation-model / scalability)
#### How Far Can Root Cause Analysis Go on Real-World Telemetry Data? (arXiv, 2026) (2026-07-22)
- [[@2026__arXiv__How Far Can Root Cause Analysis Go on Real-World Telemetry Data?]] — [[Athira Gopal]]・[[Ashwanth Krishnan]]([[QPIAI]])。OpenRCAベンチマーク上で古典的因果発見手法(全てAccuracy 0)と既存LLMマルチエージェント系([[GALA]]・[[RCLAgent]])が失敗する中、reverse reasoning agentによる誤り分析でRCA失敗の大半が証拠不足ではなく推論失敗(Reasoning Gap)に起因することを定量的に示した。(paper / aiops / root-cause-analysis / llm-agents)
#### STsCache: An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage (VLDB, 2025) (2026-07-22)
- [[@2025__VLDB__STsCache - An Efficient Semantic Caching Scheme for Time-series Data Workloads Based on Hybrid Storage]] — Tao Kong・[[Hui Li]](責任著者)ほか([[Xidian University]])。時系列クエリのセマンティクスを形式的に定義しグラフ+スキップリストのセマンティックインデックスへ落とし込み、append-only性を活かしキャッシュ一貫性を不要化する前段セマンティックキャッシュ層。InfluxDB/TimescaleDB比でスループット4.8-10.8倍を達成した。(paper / database / time-series / caching)
#### cache_ext: Customizing and Tracing the Page Cache with eBPF (ACM TOCS, 2026) (2026-07-22)
- [[@2026__TOCS__cache_ext - Customizing and Tracing the Page Cache with eBPF]] — Tal Zussman・Ioannis Zarkadas(共同筆頭)ほか([[Columbia University]] × [[IBM Research]])・[[Asaf Cidon]](責任著者)。Linuxページキャッシュの退避・受け入れ方針をeBPFの`struct_ops`/kfuncでカーネル内実装に置き換え、ユーザ空間オフロード方式が招く最大20.6%のスループット低下を回避しつつ最大70%のスループット向上・58%のP99テールレイテンシ削減を達成した。(paper / operating-systems / ebpf / page-cache)
#### LLM Agents for AIOps in Kubernetes: An Industrial Experience Report with Red Hat OpenShift (FSE Companion, 2026) (2026-07-22)
- [[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]] — [[Arthur Vitui]]([[Red Hat]])・[[Tse-Hsun Chen]]([[Concordia University]])。同一OpenShift環境で10種の商用LLMをReActエージェントとして統制比較し、単発ツール精度と多段ツール連鎖の精度が独立に劣化しうること、低レイテンシ・低トークン消費が「早期終了」の兆候にすぎない例を実証した。(paper / aiops / kubernetes / llm-agents)
#### TSGen: Automated Troubleshooting Guide Generation (FSE Companion, 2026) (2026-07-22)
- [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]] — Yi Xiao・[[Hongyu Zhang]]([[Chongqing University]])ほか([[Microsoft]])・[[Minghua Ma]](責任著者)。過去インシデントデータのマイニングから構造化トラブルシューティングガイドをゼロ生成し、TSG実行自動化研究(FLASH・LLexus・StepFly)を補完する一段上流の課題を解いた。(paper / aiops / troubleshooting / llm-generation)
#### An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure (FSE Companion, 2026) (2026-07-22)
- [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]] — Yuhan Yao・Yuxuan Jiang(共同筆頭)ほか([[Microsoft]]・Boston University)。ローカルなaccept/reject判断とGlobal Routing Tableによる履歴駆動のスティグマジックなチーム間ルーティングを分離した分散型インシデントトリアージ Comfey。Azure本番22か月間の運用で先行システムCOMET比+7.55%の精度・4.38倍のトリアージ高速化を達成した。(paper / aiops / incident-triage / multi-agent)
#### The Failure of Knowledge Management (Medium, 2023) (2026-07-22)
- [[@2023__Medium__The Failure of Knowledge Management]] — [[Mark Burgess]]。知識管理を静的データの貯蔵・検索として扱う従来アプローチ(エキスパートシステム・Topic Maps・RDF/OWL)を「論理は脆く知識は解釈の問題」として批判し、知識とは反復と親密さ(rehearsal and intimacy)による個人的な関係性の構築だと論じたエッセイ。(article / knowledge-management / epistemology)
#### Infrastructure Management Timescales (markburgess.org, 2014) (2026-07-22)
- [[@2014__markburgess.org__Infrastructure Management Timescales]] — [[Mark Burgess]]。インフラ管理における観測・是正のタイムスケールを問題自身の時間スケールに一致させる必要性(KT境界、"Dynamics always trump semantics")を論じ、監視アラームの典型的なタイムスケール不一致を指摘した技術エッセイ。(article / monitoring / control-theory / sre)
#### Computer Immunology (LISA '98, 1998) (2026-07-22)
- [[@1998__LISA__Computer Immunology]] — [[Mark Burgess]]([[Oslo University College]])。[[cfengine]] の実運用経験を土台に、生物学的免疫系(自己/非自己モデルの限界と危険モデルへの転換)を計算機システムのシグナル(SIGCHLD=apoptosis / SIGSEGV等=necrosis)に対応づけ、収束的意味論を持つリアクタとしての自律的システム管理を提唱した vision paper。(paper / sre / systems-administration / autonomic-computing)
#### Theoretical System Administration (LISA 2000, 2000) (2026-07-22)
- [[@2000__LISA__Theoretical System Administration]] — [[Mark Burgess]]([[Oslo University College]])。CFEngine の「収束」概念をn次元格子上の状態空間モデルへ一般化し、システム管理者とユーザーの相互作用をゼロサムゲームとして定式化した理論論文。ゲーム理論とSRE・SREの工学化の四半世紀先行する原型。(paper / sre / systems-administration / game-theory)
#### On the theory of system administration (arXiv cs/0003075, 2000) (2026-07-22)
- [[@2000__arXiv__On the theory of system administration]] — [[Mark Burgess]]。LISA2000版と核心の数理装置(理想状態・H(d)公式・ペイオフ行列)を共有するarXivプレプリント。Theorem 1の公理的証明・応答時間比較式など、LISA版と異なる内容に重心を置く。(paper / sre / systems-administration / game-theory)
#### Principle Components and Importance Ranking of Distributed Anomalies (Machine Learning, 2005) (2026-07-22)
- [[@2005__Machine Learning__Principle Components and Importance Ranking of Distributed Anomalies]] — [[Kyrre Begnum]]・[[Mark Burgess]]([[Oslo University College]])。cfengineの分散異常検知に対しPCAと固有ベクトル中心性(PageRank/HITSと数学的に同型)を用いて「集中分析の優位性」を検証したが支持する証拠は得られなかったという負の実証結果を報告。(paper / anomaly-detection / distributed-systems / sysadmin)
#### Measuring System Normality (ACM TOCS, 2002) (2026-07-22)
- [[@2002__TOCS__Measuring System Normality]] — [[Mark Burgess]]・[[Harek Haugerud]]・[[Sigmund Straumsnes]]([[Oslo University College]])・[[Trond Reitan]]([[Norwegian Water Resources and Energy Directorate]])。トランザクション数の揺らぎが周期性を除去するとPlanck(最大エントロピー)分布に収束し「温度」が地理的に離れたサイトを越えて概ね不変であることを示す一方、この統計的枠組みには1〜2週間以上のデータが必要で15分間の模擬攻撃は統計的に不可視だったことを実証した統計力学的アプローチの原点論文。(paper / anomaly-detection / sre)
#### Every µs Matters: Achieving Near Speed-of-Light Latency in GPU Collectives (arXiv, 2026) (2026-07-22)
- [[@2026__arXiv__Every Microsecond Matters Achieving Near Speed-of-Light Latency in GPU Collectives]] — Siyuan Shen・Torsten Hoefler([[ETH Zürich]])・Sylvain Jeaugey ほか([[NVIDIA]])。GB200 の scale-up ネットワークで AllReduce の Speed-of-Light 理論下限(1.404 µs)を実測導出し、LL・sentinel 同期・双方向通信+double buffering・two-shot LL128 atomic により memory barrier を完全排除する低レイテンシカーネルを NCCL に実装。SoL 比 7% まで到達し、vLLM 推論の inter-token latency を最大 13% 削減する(paper / distributed / gpu / networking)。
#### SWE-1.7: Frontier Intelligence at a Fraction of the Cost (Cognition Blog, 2026-07-08) (2026-07-23)
- [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]] — [[Cognition]]。[[Kimi K2.7]] ベースの継続 RL 訓練モデル [[SWE-1.7]] の発表ブログ。エントロピー保全(top-p + サンプリング分布リプレイ)・3 大陸マルチクラスタ耐障害訓練・データ品質パイプライン・自己圧縮の 4 本柱を解説。FrontierCode 1.1 Main 42.3%・Terminal-Bench 2.1 81.5%・SWE-Bench Multilingual 77.8%。(article / reinforcement-learning / coding-agents / llm)
#### Frontier RL Is Cheaper Than You Think (Fireworks AI Blog, 2026-03-23) (2026-07-23)
- [[@2026__Fireworks AI__Frontier RL Is Cheaper Than You Think]] — [[Fireworks AI]]。bf16 チェックポイント間で重みの 98% 超がビット等価という実測(1TB チェックポイント平均差分 20.3 GiB)に基づき、trainer とロールアウトフリートを地理的に分離しつつ差分圧縮のみを配信するアーキテクチャで「フロンティア RL には co-located メガクラスタが要る」という通念に反証する。SWE-1.7・Composer 2 の圧縮重み差分配信パターンを一般化する一次資料。(article / reinforcement-learning / distributed-systems / llm)
#### DAPO: An Open-Source LLM Reinforcement Learning System at Scale (arXiv, 2025-03-17) (2026-07-23)
- [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]] — [[Qiying Yu]] ほか([[ByteDance Seed]] / [[Institute for AI Industry Research (AIR), Tsinghua University]] / [[The University of Hong Kong]])。naive GRPO を [[Qwen2.5-32B]] に適用した際の失敗(AIME24 avg@32=30 点)を出発点に、Clip-Higher(上下非対称クリッピング)・Dynamic Sampling・Token-Level Policy Gradient Loss・Overlong Reward Shaping の 4 技術を提案。逐次適用で 50 点まで改善し DeepSeek-R1-Zero-Qwen-32B(47 点)を訓練ステップ数半分で上回った。アルゴリズム・[[VeRL]] 基盤の訓練コード・DAPO-Math-17K データセットを完全オープンソース化。(paper / reinforcement-learning / llm / post-training)
#### AWS Distinguished Eng: Learning From 3000 Incidents And How Engineering Is Changing (YouTube, 2026-04-13) (2026-07-23)
- [[@2026__YouTube__AWS Distinguished Eng - Learning From 3000 Incidents And How Engineering Is Changing (Marc Brooker)]] — Ryan Peterman によるポッドキャストインタビュー。[[Marc Brooker]]([[Amazon Web Services]])が 3,000 件超のクラウドシステムポストモーテムを読んだ経験、キャッシュの二峰性と[[メタ安定障害]]の関係([[Aurora DSQL]]ストレージ層による回避設計)、AI がソフトウェアエンジニアリングに与える影響、執筆の重要性について語る。(video / sre / distributed-systems / postmortem)
#### Agentic Failure Management of Cloud Systems (UIUC PhD Thesis, 2026) (2026-07-25)
- [[Agentic Failure Management of Cloud Systems]] — [[Yinfang Chen]](指導教員 [[Tianyin Xu]]、[[University of Illinois Urbana-Champaign]])。クラウドインシデントライフサイクル全体(予防・診断・緩和・評価)を横断する博士論文。新規に [[Rainmaker]](HTTP層フォールトインジェクションで11 .NETアプリから新規バグ73件・誤検知率1.96%を検出)を提示し、既刊の [[RCACopilot]]・[[Stratus]]・[[AIOpsLab]] を統合。第6章では自律緩和の説明責任・監査可能性・自動化バイアス・相関故障という社会的含意とSREの役割変化を論じる。(paper / aiops / sre / fault-injection / agent)
#### Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker (NSDI, 2023-04-17) (2026-07-25)
- [[@2023__NSDI__Push-Button Reliability Testing for Cloud-Backed Applications with Rainmaker]] — [[Yinfang Chen]]・[[Xudong Sun]]([[University of Illinois Urbana-Champaign]])、[[Suman Nath]]([[Microsoft Research]])、[[Ze Yang]]・[[Tianyin Xu]]([[University of Illinois Urbana-Champaign]])。[[Rainmaker]] の一次論文(NSDI'23)。クラウドサービス API・SDK のエラー通知の不整合に起因する4パターンのバグ taxonomy(no error handling / throwing unrelated exceptions / silent semantic violations / state divergence)を提示し、HTTP プロキシで REST 呼び出しに push-button フォールトインジェクションを行うツールを開発。11 の .NET アプリケーションで新規バグ73件(確認55件・修正51件、誤検知率1.96%)を発見、call-site 単位のカバレッジ指標(C1–C4)と ITLS により exhaustive baseline 比64.47%のテスト実行回数削減を達成。2026年の [[Yinfang Chen]] 博士論文第2章に再録。(paper / aiops / fault-injection / cloud-reliability)
#### Everyone Should Know SIMD (mitchellh.com) (2026-07-27)
- [[@2026__mitchellh.com__Everyone Should Know SIMD]] — [[Mitchell Hashimoto]]。SIMD コードを「定数のブロードキャスト→ベクトル幅ループ→並列演算→リダクション→スカラー端数処理」の5段階の共通形として定式化し、[[Zig]] 製ターミナルエミュレータ [[Ghostty]] のコードポイント探索実装(ARM NEON最大4倍・AVX2最大8倍/実測約5倍・AVX-512最大16倍)を実例に示す。コンパイラの自動ベクトル化は不得手であり、パフォーマンス重視のコードでは明示的なベクトル化を選ぶべきという立場。(article / simd / performance-engineering / zig)
#### AIシステムの進化速度は指数関数を超えている (TJSAI, 2025-05-01) (2026-07-27)
- [[@2025__TJSAI__AIシステムの進化速度は指数関数を超えている]] — [[中島秀之]]・[[津田一郎]]([[札幌市立大学]])。Ray Kurzweilのシンギュラリティ論(ムーアの法則に基づく2045年予測)がチップ上のプログラムの複雑性増加を考慮していないと批判し、チップの物理サイズを固定して集積度がN倍になると可能な計算量が組合せ論的に2^(NL)(Nの指数関数)で増加すること、ムーアの法則(N∝2^t)と組み合わせると時間に関する指数関数の指数関数になることを導出。Transformerのattention機構はSIMD型の局所計算でありこの条件を満たすため、生成AIの進化速度はKurzweilの予測より速い可能性があると主張する4ページの理論的位置づけ論文。(paper / computer-architecture / singularity / complexity-theory)
#### Leiden Declaration on Artificial Intelligence and Mathematics (2026-06-02) (2026-07-27)
- [[@2026__leidendeclaration.ai__Leiden Declaration on Artificial Intelligence and Mathematics]] — 数学研究における生成AI活用の課題に対処する国際的コミュニティ宣言(国際数学連合承認、署名者3,165名超)。証明を通じた確実性・著者への帰属・議論の透明性・共有される評価基準・研究の自律性という数学の中核的価値5点それぞれに対応するAI由来の脅威(信頼性の低い証明の生成、出典引用の欠落、査読プロセスへの圧力等)を指摘し、数学者・数学組織・政策立案者・商用AI企業への推奨事項を示す。[[Peter Scholze]]・[[Terence Tao]]ら著名数学者が支持。(article / mathematics / research-ethics / ai-policy / peer-review)
#### Above the Clouds: A Berkeley View of Cloud Computing (UCB TR, 2009-02-10) (2026-07-27)
- [[@2009__UCB TR__Above the Clouds - A Berkeley View of Cloud Computing]] — [[Michael Armbrust]] ほか10名([[University of California, Berkeley]] RAD Lab)。SaaS/Utility Computing/Public・Private Cloud の用語を整理し、elasticity をリスク移転として定式化する経済モデル(UserHours×(revenue-Cost) の不等式)を提示。Amazon EC2・Google AppEngine・Microsoft Azure を仮想化レベルのスペクトルとして分類し、普及・成長・政策の3層に分けたトップ10の障害と機会のリストを提示する、クラウドコンピューティングという用語を業界に定着させた基礎的な技術報告書。(paper / distributed-systems / cloud-computing / economics)
#### DynaPipe: Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism (NeurIPS 2025) (2026-07-27)
- [[@2025__NeurIPS__DynaPipe - Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism]] — [[Hongxin Xu]]・[[Tianyu Guo]](共同筆頭)・[[Xianwei Zhang]](責任著者)([[Sun Yat-sen University]])。パイプライン並列 LLM サービングで見過ごされてきた「最終ステージのサンプリング負荷によるステージ間不均衡」を特定し、実行時間予測器・バブル対応スケジューラ・非同期 KV キャッシュ移行コーディネータで動的に層を再配分する DynaPipe を提案。vLLM・gLLM・SGLang に対し平均 E2E レイテンシを 8〜41% 削減し SLO 達成率も改善した。(paper / llm / distributed-systems / pipeline-parallelism)
#### TRANSOM: An Efficient Fault-Tolerant System for Training LLMs (arXiv, 2023-10-16) (2026-07-27)
- [[@2023__arXiv__TRANSOM - An Efficient Fault-Tolerant System for Training LLMs]] — Baodong Wu ほか([[SenseTime Research|SenseTime]]・[[Huazhong University of Science and Technology]]・[[Beijing University of Posts and Telecommunications]])。プロセスレベル自動フォールトトレランス(TOL)・ハイブリッド異常検知(TEE、LOF+KNN Matrix Profile+DTW)・非同期RDMAチェックポイントエンジン(TCE)の三本柱で、GPT3-175B・512 A800 GPUの訓練期間を28%短縮、チェックポイント読み書きを最大27倍高速化。ByteRobust・MegaScaleに2年先立つ設計。(paper / distributed-systems / machine-learning / fault-tolerance)
#### Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks (arXiv / IEEE ICC 2026, 2026-06-11) (2026-07-27)
- [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]] — [[Fabien Chraim]]・[[Dominik Janzing]]・[[John Evans]]([[Amazon Web Services]])。クラウドネットワークインシデントの RCA を、二値時系列への二変量 Granger 因果性 + 条件付き独立性トリプレット検定によるグラフベース因果発見と、エッジ固有の時間ラグ条件付き確率(経路尤度最大化)による確率的推論で行う。自動化オントロジー(観測・リスク・障害・アクション)とスパティオテンポラルグループ化で 4,810 変数を 76,595 変数ペアまで削減。35件のラベル付きインシデントで Recall@3=85.7%・完全一致74.3%(ルールベース比+25.7pt)、本番7ヶ月間で800件超のインシデントに投入。(paper / aiops / network-rca / causal-discovery)
#### Gemini: Fast Failure Recovery in Distributed Training with In-Memory Checkpoints (SOSP '23, 2023-10-23) (2026-07-27)
- [[@2023__SOSP__Gemini - Fast Failure Recovery in Distributed Training with In-Memory Checkpoints]] — [[Zhuang Wang]]([[Rice University]])・[[T. S. Eugene Ng]]([[Rice University]])ほか [[Amazon Web Services]] 所属研究者。GPU マシンの CPU メモリへ毎イテレーションチェックポイントすることで障害復旧を既存手法比 13 倍超高速化する分散訓練システム Gemini を提案。証明可能に準最適なチェックポイント配置戦略(mixed placement strategy)と、ネットワーク遊休時間帯へのトラフィックパイプライニングアルゴリズムの2本柱。16台の p4d.24xlarge(A100)で GPT-2/BERT/RoBERTa 100B を評価し、チェックポイント取得時間を最大250倍・頻度を最大8倍改善。DeepSpeed + ZeRO-3 上に実装。(paper / distributed-systems / machine-learning / fault-tolerance)
#### Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems (arXiv, 2026-06-10) (2026-07-27)
- [[@2026__arXiv__Understanding and Detecting Scalability Faults in Large-Scale Distributed Systems]] — [[Hao-Nan Zhu]]・[[Goodness Ayinmode]]・[[Cindy Rubio-González]]([[University of California, Davis]])・[[Cesar A. Stuardo]]・[[Haryadi S. Gunawi]]([[University of Chicago]])。10 の大規模分散システムから 444 件のスケーラビリティ障害を分析し、compute・unbound・bloat・logic の4根本原因カテゴリと11アンチパターンを同定。動的解析(ScaleView)+静的解析(ScalePick)を組み合わせたツール [[ScaleLens]] を提案し、55件の既知障害のうち36件を完全検出(ベースライン比4.2倍)、Cassandra/HDFS/Ignite最新版でアンチパターン付きDCFを334件検出(27件を開発者に報告、5件確認済み)。(paper / distributed-systems / scalability / fault-detection)
#### NetCause: Counterfactual Learning for Root Cause Analysis in Large-Scale Networks (arXiv / IEEE ICCCN 2026, 2026-06-11) (2026-07-27)
- [[@2026__arXiv__NetCause - Counterfactual Learning for Root Cause Analysis in Large-Scale Networks]] — [[Fabien Chraim]]・[[Jian Zhang]](共同筆頭)・[[Dominik Janzing]]・[[Xiang Song]]・[[Christos Faloutsos]]・[[John Evans]]([[Amazon Web Services]])。ネットワークインシデントをグラフ時系列プロセスとしてモデル化し、R-GCN+RNNの生成的時空間ワールドモデルを自己教師あり学習、推論時に候補障害仮説を除去した反実仮想系列をロールフォワードして Total Causal Influence(事実/反実仮想の予測乖離)でランキングする。1,500件の本番インシデントで学習し31件の専門家ラベル付きインシデントで評価、完全一致精度35.5%(ルールベースヒューリスティック比+16.1pt)。推論はCPU逐次実装でも95パーセンタイルsub-30秒。同著者チームの姉妹論文 [[@2026__arXiv__Graphical Causal Reasoning for Root Cause Analysis in Cloud Networks]](Granger因果性ベース)と対をなす。(paper / aiops / network-rca / causal-inference / counterfactual-reasoning)
#### Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems (ICPE Companion '26, 2026-05-04) (2026-07-27)
- [[@2026__ICPE Companion__Leveraging Time Series Foundation Models to Detect Performance Anomalies in Software Systems]] — [[Federico Di Menna]]・[[Luca Traini]]・[[Vittorio Cortellessa]]([[University of L'Aquila]])。時系列基盤モデル(Chronos・[[TSPulse]])をゼロショットでソフトウェア性能異常検知(AIOPS・MSCloudデータセット)に適用し、4つの代表的TSADベースライン(AR・Isolation Forest・LSTM-AD・VAE)と比較。基盤モデルはベースラインに匹敵する性能(MSCloudでChronosがAUC-PR 2位)を達成するが、いずれのデータセットでも最良にはならない。推論レイテンシはベースラインの10倍超だが、訓練込みの総所要時間ではLSTM-ADなど一部ベースラインを下回る場合がある。(paper / aiops / time-series / anomaly-detection)
#### TSPulse: Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis (ICLR 2026, 2025-05-19) (2026-07-27)
- [[@2026__ICLR__TSPulse - Tiny Pre-Trained Models with Disentangled Representations for Rapid Time-Series Analysis]] — Vijay Ekambaram ほか([[IBM Research]])による超軽量(1Mパラメータ)[[時系列基盤モデル]] [[TSPulse]] の原論文。時間・周波数の両空間でのマスク再構成を時間的・スペクトル的・意味的の3ビューへ明示的にdisentangleし、TSMixerバックボーン・ハイブリッドマスキング・post-hocフューザー(分類向けTSLens、異常検知向けMulti-Head Triangulation)により、分類・補完・異常検知・類似検索の4診断タスクで10〜100倍大きいMOMENT・UniTS・VQShapeを75以上のデータセットで上回る(TSB-AD異常検知+20%、類似検索+25%、補完+50%、分類+5〜16%)。感度分析で各埋め込みが位相シフト・欠損・ノイズに異なる頑健性を示すことを定量的に確認(paper / time-series / foundation-model / disentangled-representation)
#### An Evolutionary Study of Configuration Design and Implementation in Cloud Systems (ICSE '21 / arXiv, 2021-02-14) (2026-07-28)
- [[@2021__ICSE__An Evolutionary Study of Configuration Design and Implementation in Cloud Systems]] — Yuanliang Zhang ほか([[National University of Defense Technology]]・[[University of Illinois Urbana-Champaign]]・[[Cornell University]])。HDFS・HBase・Spark・Cassandra の 2.5 年分・1178 件の設定関連コミットを人手で分類し、設定エンジニアリングの進化を interface(パラメーター)・usage(check/handle/use)・documentation の3軸タクソノミーで実証する。パラメーター化の54.4%・チェックコード追加の74.6%が障害等の深刻な帰結を経験した「事後(postmortem/reactive)」対応であることを定量的に示し、[[設定ミス脆弱性]] の SPEX(SOSP'13)による静的検出結果を開発プロセスの時間軸から裏付ける。(paper / configuration / aiops / systems)
#### Kimi K3: Open Frontier Intelligence (Technical Report, 2026-07-27) (2026-07-28、2026-07-20 版から全面改訂)
- [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]] — [[Moonshot AI]] の技術レポート(47ページ)。総パラメータ 2.78T(活性化 104.2B)・93層・コンテキスト100万トークンのネイティブマルチモーダル MoE [[Kimi K3]]。[[Kimi Delta Attention]](KDA、下限付きSigmoid減衰・フルランクゲート)3層+Gated MLA 1層のハイブリッドアテンション、[[Attention Residuals]](AttnRes、Block構成でO(Nd)に圧縮)、[[Stable LatentMoE]](896エキスパート中16活性化、RMSNorm・SiTU-GLU・Quantile Balancingで安定化)により Kimi K2 比約2.5倍のスケーリング効率改善。SFT→9専門モデルRL→Multi-Teacher On-Policy Distillationの三段階後段訓練、[[MoonEP]](完全均衡Expert Parallelism)・AgentENV(Firecracker microVMサンドボックス)の新規インフラ。Claude Fable 5・GPT-5.6 Solに僅差で劣後しつつ他モデルを一貫して上回り、コスト効率でフロンティア級に近接。(paper / source / moe / llm / attention)
#### Kimi-K3 を Day0 デプロイ。2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか (Fixstars Tech Blog / Zenn, 2026-07-28)
- [[@2026__Fixstars Tech Blog__Kimi-K3 を Day0 デプロイ - 2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか]] — [[Fixstars]] による [[Kimi K3]] 公開当日のデプロイ実測記事。[[NVIDIA]] B300 SXM6 x8 単一ノードに [[SGLang]] 0.5.16 で配備し、[[Decode Context Parallelism|DCP]] により実効コンテキスト527,872トークンを確保。Random ワークロードで並列数40時に5,847.6 tok/s のピークスループット、コーディングエージェント実データセットでは並列30近傍で頭打ちし実用上限は同時30リクエスト程度。MXFP4 ネイティブ配布により追加量子化不要だったが起動全体で約88.8分を要した。(article / source / moe / llm-inference / benchmark)
#### LLMの「脳内」をハッキングする技術 (ジョイジョイジョイ, 2026-07-21)
- [[joisino-LLMの脳内をハッキングする技術-2026]] — [[佐藤竜馬]] 2026-07-21。LLM の内部状態への介入手法を[[操舵ベクトル]](2群の内部状態の平均差から求める方向へ加算し、丁寧語↔関西弁のトーン切替や Arditi et al. NeurIPS 2024 の命令拒否方向操作を実演。ただし `google/gemma-7b-it` のバスボム実験が示すように知識量の上限には制約される)と[[知識編集]](ロジットレンズで書き込み層を特定し、MLP の1回転軸だけを書き換えてルーブル美術館の場所を「練馬」に局所編集)の2手法で解説。介入後もモデルが破綻せず動き続けることを「生物的な柔軟性と治癒力」と表現し、[[モデルパラメータ算術|モデルマージ]]が機能する土台とも位置づける。(source / article / llm / interpretability)
#### Handling Network Faults in Distributed AI Training: Failover is Now an Option (EuroSys '26, 2026-04-27)
- [[@2026__EuroSys__Handling Network Faults in Distributed AI Training]] — ByteDance × National University of Singapore。last-hop(スイッチ〜ホスト間)ネットワーク障害を再起動でなくフェイルオーバーで扱う初の耐障害 CCL「ReCCL」。primary-backup の Soft Bonding(s-Bond)・Dynamic Channel Rebalancing(DCR)・Transit GPU over NVLink(NVL)を組み合わせ、Llama3-405B・16k GPU シミュレーションで restart 比64.96%、restart+scaling 比80.97%の GPU 時間削減。テストベッド実測ではフェイルオーバー時のスローダウン k<1.1。(source / paper / distributed / gpu / networking / collective-communication)
#### PatternSketch: General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection (EuroSys '26, 2026-04-27)
- [[@2026__EuroSys__PatternSketch - General and Runtime Reconfigurable Time-series Network Traffic Pattern Detection]] — [[Yang Du]] ほか([[Soochow University]] × [[Nanjing University of Posts and Telecommunications]])。バースト・ウェーブ・promising 等の時系列トラフィックパターンを「隣接期間の変化」を表すマイクロパターン系列として統一抽象化し、有限状態オートマトン(Pattern Automaton)による系列マッチング問題へ帰着させることで、単一スケッチで複数パターンを同時検知する PatternSketch を提案。検知ルールを3テーブル(Micro-pattern/State Transition/State Priority)へ分離し P4 Runtime 経由で実行時再構成できるため、既存研究が要した4〜8秒のスイッチダウンタイムを回避。[[Intel Tofino]] 実機実装で4データセット・6パターン同時検知時に200KBメモリでF1スコア90%超を達成し、BurstSketch・Pontus・ScoutSketch を上回る精度を報告。eruption・plunge・disturbance の3新規パターンをコントローラAPIのみで追加できる拡張性も実証。(source / paper / networking / network-measurement / programmable-switch)
#### Beyond the Buzz: A Pragmatic Take on Inference Disaggregation (MLSys 2026 Oral, 2026-05-21) (2026-07-30)
- [[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]] — [[Tiyasa Mitra]]・[[Bita Darvish Rouhani]]ほか(全19名、[[NVIDIA]])。disaggregated inference serving の設計空間を、モデルアーキテクチャ・サイズ・トラフィックパターン・NVLink ドメインサイズの4軸にわたり数十万の設計点をシミュレートして体系的に評価した初の研究。disaggregation は prefill-heavy トラフィックと大規模モデル(>10B)で最も効果的であり、Pareto 最適性能には動的レートマッチングと弾性スケーリングが不可欠であることを示す。Chunked Pipeline Parallelism、整数計画的レートマッチングアルゴリズム、KV キャッシュ転送帯域の解析式に加え、camera-ready 版では NVIDIA Dynamo SLA-Aware Planner の本番相当 goodput ベンチマーク(H200、最大8倍)と cache-aware KV ルーティングの FTL 安定性評価(L40S)を実機で追加提示。(paper / source / llm-inference / disaggregation / nvidia)
#### BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching (arXiv:2412.03594, MLSys 2026 Industry Track) (2026-07-30)
- [[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]] — [[Zhen Zheng]]ほか([[Microsoft]]・[[Institute of Software, Chinese Academy of Sciences]])。大規模バッチ・オフライン LLM 推論(検索エンジンのスニペット生成・オフラインランキング等)に特化し、共通プレフィックスの DP による大域的事前識別、prefix-sharing グループ単位のスケジューリングとリクエスト並べ替え、メモリ中心 token バッチング、水平融合 prefix-shared Attention カーネルを組み合わせる。vLLM v0.6.4 に実装し、vLLM・SGLang に対しマイクロベンチマークと実運用ワークロードで 1.3〜10.8 倍のスループット向上を達成。MLSys 2026 Industry Track の発表スライドも合わせて取り込み。(paper / source / llm-inference / kv-cache / batching)
#### Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost (MLSys 2026) (2026-07-30)
- [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]] — Haojun Xia・Xiaoxia Wu・Jisen Li ほか([[University of Sydney]]・[[Together AI]]・[[University of Illinois Urbana-Champaign]]・[[Microsoft]])。Key キャッシュのチャネルごとの量子化感度の偏りに着目し、少数の重要チャネルのみを INT4 に保ち残りを INT2 にする Dynamic Channel-wise Precision Boost を提案。混合精度 Key ページを 2 つの統一 2-bit テンソル(dense + 疎な boosted チャネル)に分解する page-centric メモリレイアウトと Triton 融合逆量子化カーネルにより、動的チャネル選択のオーバーヘッドを実効 0.17% まで償却。Qwen3・LLaMA3 で KV メモリを約 8 倍削減しつつ精度劣化をほぼゼロに抑え、同一メモリ予算下でバッチサイズ最大 8 倍・スループット 2.1〜4.1 倍を達成。(paper / source / llm-inference / kv-cache / quantization)
#### Cost-aware Duration Prediction for Software Upgrades in Datacenters (MLSys 2026 Industry Track) (2026-07-30)
- [[@2026__MLSys2026__Cost-aware Duration Prediction for Software Upgrades in Datacenters]] — [[Yi Ding]]([[Purdue University]])・[[Henry Hoffmann]](University of Chicago)ほか([[Meta]] 共同研究)。データセンター規模のソフトウェアアップグレードスケジューリングを制約付き最適化問題として初めて定式化し、分位点勾配ブースティング木([[LightGBM]])で非対称な誤予測コストを考慮するコストアウェア期間予測フレームワーク Acela を提案。SLO(達成率95%)を考慮したカスタムスコア関数によるモデル選択、ストラグラー除去による訓練セット多様化を組み合わせる。Meta 本番データセンターでの実運用評価(400万件超の訓練データ、198 UG・約100万件で評価)で、既存 Heuristic スケジューラに対しアップグレード窓利用率1.25倍・スケジュール数+33%・完了数+41%・キャンセル率2.4倍低減を達成。発表スライドも合わせて取り込み。(paper / source / datacenter / scheduling)
#### BOute: Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization (MLSys 2026) (2026-07-30)
- [[@2026__MLSys__BOute - Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization]] — [[Youhe Jiang]]・[[Fangcheng Fu]]・[[Eiko Yoneki]]([[University of Cambridge]]・[[Shanghai Jiao Tong University]])。異種モデルルーティングと異種GPUデプロイメントの循環的依存関係をワークロード特性分析で実証し、両者を多目的ベイズ最適化(MOBO)で協調最適化するシステム BOute を提案。加法カーネルGP・負荷比率エンコーディング・モデル-GPU選好重み付きカーネル・制約付きqNEHVIにより、既存手法(vLLM単体・RouteLLM)比P95レイテンシ最大157%(平均59%)改善、コスト最大61%(平均38%)削減を達成。MLSys 2026発表スライド(登壇者 [[Ran Yan]]、HKUST)も合わせて取り込み。(paper / source / llm-serving / gpu-scheduling / bayesian-optimization)
#### FaaScale: Unlocking Fast LLM Scaling for Serverless Inference (MLSys 2026) (2026-07-30)
- [[@2026__MLSys2026__FaaScale - Unlocking Fast LLM Scaling for Serverless Inference]] — [[Minchen Yu]]・Rui Yang ほか([[The Chinese University of Hong Kong, Shenzhen]]・[[University of Virginia]]・[[Hong Kong University of Science and Technology]]・[[Alibaba Group]]・[[Nokia Bell Labs]])。サーバーレス LLM 推論のコールドスタート trilemma(bursty request・大規模リソース占有・モデル増殖)を、モデルブロックの binomial-pipeline マルチキャストと動的パイプライン並列推論を co-design する PipeCast で解決。k-way 伝送戦略(Algorithm 1)と実行パイプライン生成戦略(Algorithm 2)により、モデル全体の到着を待たずに分散推論を開始。BurstGPT トレースで ServerlessLLM・FaaSNet・NCCL 比 P90 TTFT レイテンシ 2.4×–5× 改善、GPU コスト 17.8%–31.3% 削減。(paper / source / llm-inference / serverless / model-scaling)
#### BEAM: Joint Resource–Power Optimization for Energy-Efficient LLM Inference under SLO constraints (MLSys 2026, 2026-05) (2026-07-30)
- [[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]] — [[Hyunjae Lee]]ほか([[KAIST]] CASYS)。バッチング(資源効率)と DVFS(電力効率)が同一の SLO レイテンシスラック予算を奪い合う結合した最適化軸であることを定式化し、GPU クロック・チャンクサイズ・マイクロバッチ数をイベント駆動・ミリ秒粒度で共最適化するプリフィル/デコード別スケジューラ(S1/S2)BEAM を提案。vLLM に約1,100行追加して実装し、オフラインプロファイリング由来の Perf-Energy Lookup Table を代数合成する軽量予測モデルでサブミリ秒の意思決定を実現。A100×8構成のLlama3.3-70Bで vLLM比49%(Window-DVFS比30%削減)、A100×4構成のQwen2.5-32Bで vLLM比53%までエネルギー消費を削減しつつ、TTFT/TBT SLO遵守率94%台以上を維持。MLSys 2026発表スライドも合わせて取り込み。(paper / source / llm-inference / energy / dvfs / gpu-scheduling)
#### TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference (MLSys 2026, arXiv:2505.11329) (2026-07-30)
- [[@2025__arXiv__TokenWeave - Efficient Compute-Communication Overlap for Distributed LLM Inference]] — Raja Gond・[[Nipun Kwatra]]・[[Ramachandran Ramjee]]([[Microsoft Research]] India)。テンソル並列推論の AllReduce 通信オーバーヘッド(8×H100 で 9–23%)を、これまで見過ごされてきた RMSNorm(4–9%)ごと削減する融合 AllReduce–RMSNorm カーネルを NVSHARP/Multimem で実装し、wave-aware な smart-splitting による 2 分割で計算-通信オーバーラップをトークン数 1024 という小規模イテレーションでも成立させる。vLLM V1 に実装し、Llama-3.3-70B・Qwen2.5-72B・Mixtral-8x22B で最大 1.28 倍のレイテンシ改善・1.19 倍のスループット改善を達成、TileLink・NanoFlow を上回る。一部設定では通信を完全除去した理論上限(vLLM-nocomm)すら上回る。(paper / source / llm-inference / collective-communication / distributed)
#### SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips (MLSys 2026) (2026-07-30)
- [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]] — [[Jiahuan Yu]]・[[Mingtao Hu]]・[[Zichao Lin]]・[[Minjia Zhang]]([[University of Illinois Urbana-Champaign]] SSAIL Lab)。既存 LLM サービングシステムを [[NVIDIA GH200]](NVLink-C2C 900GB/s)に移植しても C2C 帯域の 5% 未満しか活用できない原因がソフトウェアスタック(小さく非連続な KV キャッシュセグメント + カーネル起動オーバーヘッド)にあることを特定し、Virtual Lag Time に基づく能動的ローテーションスケジューラ RotaSched と、eager block rotation + block-first レイアウトで全二重転送を実現する DuplexKV を co-design。GH200 NVL2 上の評価で TTFT SLO 達成率を最大 74.7% 改善しつつ TBT・スループット(最大 29.2% 改善)を維持。DuplexKV は理想帯域比 94% を達成。MLSys 2026 発表スライドも合わせて取り込み。(paper / source / llm-inference / kv-cache / superchip / gpu-scheduling)
#### Speculative Decoding: Performance or Illusion? (MLSys 2026、arXiv:2601.11580) (2026-07-30)
- [[@2026__arXiv__Speculative Decoding - Performance or Illusion?]] — [[Xiaoxuan Liu]]・[[Jiaxiang Yu]]・[[Jongseok Park]]・[[Ion Stoica]]・[[Alvin Cheung]]([[University of California, Berkeley]])。本番グレードの推論エンジン vLLM 上で n-gram・EAGLE/EAGLE-3・Draft-Model・MTP の投機的デコーディング(SD)変種を、バッチサイズ 1〜128・モデル規模 8B〜106B・6 種のワークロードにわたって初めて体系的に比較。検証(verification)段階が実行時間の 42〜95% を占め支配的コストであること、トークン受理率がリクエスト内・リクエスト間・データセット間で大きく変動することを実測で示した。実測ベンチマークデータに基づく理論上限(oracle)シミュレータにより、EAGLE と n-gram を位置適応的に組み合わせる Oracle Combine が単一手法比最大 2.2×・標準デコーディング比最大 4.9× の追加速度向上をもたらす可能性を定量化。MLSys 2026 発表スライド(Xiaoxuan Liu・Jiaxiang Yu 登壇)も合わせて取り込み。(paper / source / llm-inference / speculative-decoding)
#### DreamDDP: Accelerating Low-Bandwidth Geo-Distributed LLM Training with Layer-wise Partial Synchronization (MLSys 2026、arXiv:2502.11058) (2026-07-30)
- [[@2026__MLSys__DreamDDP - Accelerating Low-Bandwidth Geo-Distributed LLM Training with Layer-wise Partial Synchronization]] — Zhenheng Tang・Zichen Tang・Junlin Huang・Xinglin Pan・Rudan Yan・Yuxin Wang・Amelie Chi Zhou・[[Shaohuai Shi]]・[[Xiaowen Chu]]・[[Bo Li]]([[The Hong Kong University of Science and Technology]]・The Hong Kong University of Science and Technology (Guangzhou)・[[Hong Kong Baptist University]]・[[Harbin Institute of Technology]])。Local SGD の全層一括同期を層単位に分解する partial synchronization(PLSGD)を提案し、S-SGD と同じ収束率 O(1/R) を理論的に保証しつつ、通信と逆伝播(BP)のオーバーラップを可能にする。DFS ベースのスケジューラで探索空間を (H+L)!/(L!H!) から O(2^{min(L-H,H)}) に削減し、通信の空き時間(idle bubble)を後期層の追加同期で埋める。32 GPU・ResNet-18/50・GPT-2・Llama-2 の実験で ASC-WFBP 比 1.73〜5.22 倍、FLSGD 比 1.13〜1.50 倍の反復時間短縮を達成。(paper / source / distributed-training / collective-communication / parallelism)
#### veScale-FSDP: Flexible and High-Performance FSDP at Scale (MLSys 2026 Industry Track) (2026-07-30)
- [[@2026__MLSys2026__veScale-FSDP - Flexible and High-Performance FSDP at Scale]] — Zezhou Wang・Youjie Li・Zhiqi Lin・Jiacheng Yang ほか(equal contribution)・[[Xin Liu]]([[ByteDance Seed]]・[[University of Washington]])。既存 FSDP システム(DeepSpeed・FSDP1・FSDP2・Megatron-FSDP)の固定シャーディング粒度がブロック単位量子化・Shampoo/Muon 等の非要素単位オプティマイザと衝突する問題を、任意粒度シャーディング RaggedShard・NP-hard 最適化に基づく構造認識プランニングアルゴリズム・ゼロコピー通信プリミティブ Distributed Buffer(DBuffer)で解決。既存システム比スループット 5〜66% 向上・メモリ 16〜30% 削減を達成し、8-bit Adam・Distributed Muon のケーススタディと 8K〜10K GPU への線形スケーリングを実証。ByteDance Seed の本番環境にすでに展開済み。MLSys 2026 発表スライドも合わせて取り込み。(paper / source / distributed-training / collective-communication / parallelism)
#### HiSparse: Turbocharging Sparse Attention with Hierarchical Memory (LMSYS Blog) (2026-07-31)
- [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]] — Zhiqiang Xie・Zhangheng Huang・Tingwei Huang([[LMSYS]])。[[SGLang]] の top-k [[スパース注意]]がメモリ容量ボトルネック(capacity-bound)に陥る問題を、不活性 KV キャッシュエントリのホストメモリ退避 + GPU HBM 上の hot device buffer による階層メモリ設計で緩和する HiSparse を提案。専用 CUDA カーネルで top-k キャッシュミス特定・LRU 退避・ページテーブル更新を実行し、GLM-5.1-FP8 で並行数256時にベースライン比3倍超、長文脈シーケンス構成で最大約4.9倍(352→1720 tokens/s)のスループット改善を報告。[[DeepSeek-V3.2]](DSA)向けのキャッシュミス評価も実施。査読論文ではなく PDF を伴わない技術ブログ記事のため `wiki-ingest`(汎用フロー)で取り込み。(article / source / llm-inference / kv-cache / sparse-attention)
#### Optimizing Deployment Configurations for LLM Inference: Challenges and Insights (MLSys 2026 Industry Track) (2026-07-31)
- [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]] — Meta Inference Team(責任著者 Sungmin Cho・Jaewon Lee、[[Meta]])。月間アクティブユーザー約10億人規模の Llama 推論運用から得た知見を報告。ハードウェア・並列化(5次元)・ランタイムの組み合わせが数百万規模に達する設計空間を、演算子マイクロベンチマーク駆動の軽量シミュレータ(実機比±5%精度)で体系的に探索する手法を提案し、5つの知見を示す: (1) オンライン推論では [[Prefill-Decode分離]] が継続的バッチング比1.5〜2.2倍のQPS(オフラインでは差が消失)、(2) Prefill/Decode で最適[[並列化戦略]]が異なる、(3) 異種ハードウェアの Prefill/Decode 別割当でTCO 15〜25%改善、(4) Expert Parallelism が [[Mixture-of-Experts]] のスケールアウトを効率化(Llama 4 Maverick で TP16化はDecode QPSほぼ半減、EP併用のTP4DP4-TP4EP4はTP8比+45%)、(5) 密モデルはスケールアップ必須だがMoEはスケールアウトでも良好にスケール。Meta はオンラインサービスの大半を分離ランタイムへ移行し約30%の容量削減を達成。MLSys 2026 発表スライド(Sung Min Cho)も合わせて取り込み。→ [[LLM推論設計空間探索]]。(paper / source / llm-inference / deployment / parallelism / moe)
#### TuxBot: Semantic-Aware Online OS Tuning with Large Language Models (arXiv:2605.15026) (2026-08-03)
- [[@2026__arXiv__TuxBot - Semantic-Aware Online OS Tuning with Large Language Models]] — Georgios Liargkovas・Mihir Nitin Joshi・[[Hubertus Franke]]・Kostis Kaffes([[Columbia University]] / [[IBM Research]])。既存のオンライン OS チューニングコントローラ(MLOS 等)が各 OS ノブを独立変数として扱うことで生じる意味論的に無意味/矛盾した設定への反復探索・単一プロキシ報酬の脆さ・制御サーフェス拡大に伴うリスク増大という 3 つの失敗を、LLM をノブ・テレメトリの意味論的推論器として組み込む dual-loop 制御(Instant/Reasoning)・セッション横断メモリ・型付き検証済みアクチュエーションで解決するホスト側フレームワーク TuxBot を提案。5 ベンチマークスイート・13 ワークロード・最大 41 Linux パラメータで安定フェーズ性能を default 比 +72.5%、最強ベースライン MLOS 比 +153.3% 改善し、システムメトリクスのみでもアプリケーションメトリクス直接利用のベースラインを 93.7 ポイント上回る。30 ウィンドウのセッションコストは約 $0.20。(paper / source / operating-systems / llm-agent / aiops)
#### STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices (arXiv:2605.15581) (2026-08-03)
- [[@2026__arXiv__STAR - A Stage-attributed Triage and Repair framework for RCA Agents in Microservices]] — Junle Wang・Xingchuang Liao・Wenjun Wu([[Beihang University]] School of Artificial Intelligence)。LLM ベース RCA エージェント(mABC・RCAgent)の推論トレースを Evidence Package・Hypothesis Set・Analysis Structure・Decision Report の4段階アーティファクトに分解し、失敗をステージ局所化可能な推論バグとして扱う後付け修復フレームワーク STAR を提案。ステージ単位監査による信頼性スコア・予算考慮型 Fast/Slow Routing・反実仮想的な候補パッチ評価による決定的故障ステージ特定・パッチ&リプレイ・Self-Evolving Repair Memory の5コンポーネントで構成。公開ベンチマーク(AIOps Challenge)と実運用本番データセットの2データセット・3基盤モデル(GPT-5・Qwen3-Max・Gemini-2.5-Pro)で mABC・RCAgent の根本原因箇所特定(Acc@1 最大+24.9pt)・決定的ステージ局所化精度(全ステージでベースライン比+10pt以上)を一貫して改善し、当初誤ったトレースの過半数を単一リプレイで修復。(paper / source / aiops / rca / agent-repair / multi-agent)
#### TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices (arXiv:2605.15611) (2026-08-03)
- [[@2026__arXiv__TopoEvo - A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices]] — Junle Wang・Xingchuang Liao・Wenjun Wu([[Beihang University]] School of Artificial Intelligence、STAR と同一著者)。トポロジ非依存な LLM ベース RCA が下流の増幅された症状を根本原因と誤認する symptom-amplification bias を解決するため、Metric-orthogonal Multimodal Alignment(MOMA)・ベクトル量子化(VQ)による監査可能な症状トークン化・Hypothesis-Evidence-Test(HET)マルチエージェント推論・Self-Evolving Mechanism(階層的インシデントメモリ+保守的テスト時適応)の4要素からなる end-to-end フレームワーク TopoEvo を提案。公開 AIOps ベンチマーク(HipsterShop2)と実運用インシデントデータセットで根本原因特定精度を最大 3.44pt、障害種別分類 F1 を 4.39〜16.81pt 改善。アブレーションでは HET 除去が最大の性能低下(AC@1 で 15〜16pt)をもたらし、検証駆動の診断パイプラインであることを裏づける。(paper / source / aiops / rca / microservices / multi-agent / hypothesis-driven)
#### Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought (IEEE TDSC 採録、arXiv:2605.14866) (2026-08-03)
- [[@2026__TDSC__Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought]] — Lingzhe Zhang・Tong Jia・Kangjin Wang・Chiming Duan・Minghua He・Ying Li([[Peking University]])、Rongqian Wang・Xi Peng・Meiling Wang・Gong Zhang・Renhai Chen([[Huawei Theory Lab]])。15名の SRE インタビューと100件の失敗事後分析から、人間の根本原因特定が recursiveness・multi-dimensional expansion・cross-modal reasoning の3特性を持つことを抽出し、これを実装する RCLAgent を提案。トレースグラフの各スパンに専任エージェントを再帰的・並列に割り当てる Multi-Agent Recursion-of-Thought で文脈爆発を回避し、Root-Level Diagnosis Report と Global Evidence Graph を Diagnosis Synthesizer が統合。AIOPS 2022・Augmented-TrainTicket・RCAEval で MRR 69.73%/74.08%/62.97% を達成し mABC・GALA など SOTA を上回りつつ、最速 LLM ベースライン ReAct 比 1.49〜2.11 倍高速。アブレーションでは Global Evidence Graph 除去が最大の精度低下(69.73%→56.90%)をもたらした。既存 entity [[RCLAgent]] の記述(引用元論文由来)と原論文のアーキテクチャ記述が食い違う矛盾を発見し記録した。(paper / source / aiops / root-cause-localization / multi-agent)
#### ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload (arXiv:2605.11215) (2026-08-03)
- [[@2026__arXiv__ReCoVer - Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload]] — Ziyue Liu・Zhengyang Wang・Ruijie Zhang・Zheng Zhang([[UC Santa Barbara]])、Avinash Maurya・Hui Zhou・Paul Hovland・Sheng Di・Franck Cappello・Bogdan Nicolae([[Argonne National Laboratory]])。数万 GPU 規模で平均故障間隔(MTBF)が18分に縮小し、チェックポイント・リスタート方式が50%超の GPU 時間を浪費する問題に対し、「各反復が常に同じマイクロバッチ数 B を確定させる」という単一不変条件を維持する前方復旧システム ReCoVer を提案。ULFM ベースの障害耐性集合通信(`ULFM_ALLREDUCE`/`ULFM_CONSENSUS`)・反復内バケット単位勾配復元・Major/Minor/Spare 4 ロールによる動的マイクロバッチ再配分の3層構成で、512 GPU・256 GPU 喪失下の3D並列 7B LLaMA型モデル事前学習において無故障参照実行と視覚的に区別不能な訓練損失曲線を実証。チェックポイント・リスタート比で連続障害後に最大2.23倍の実効スループット、234 GPU時間で+102Mトークン(+74.9%)多い処理量を達成。3D並列・HSDP双方に並列化スキーム非依存で統合可能。FTAR(勾配ノイズスケール変化による軌跡ドリフト)・SPARE(シミュレーションのみ・冗長計算大)を名指しで比較する初の計算等価性の数学的証明(Appendix F)を伴う前方復旧システム。(paper / source / distributed-training / fault-tolerance / llm-pretraining)
#### PRIM: Meta-Learned Bayesian Root Cause Analysis (arXiv:2605.08786) (2026-08-03)
- [[@2026__arXiv__PRIM - Meta-Learned Bayesian Root Cause Analysis]] — Christopher Lohse([[Trinity College Dublin]] / [[IBM Research]])、Anish Dhir(University College London Gatsby Unit)、Amadou Ba・Bradley Eck([[IBM Research]])、Marco Ruffini([[Trinity College Dublin]])、Jonas Wahl([[DFKI]] / University of Bergen)。根本原因分析(RCA)を因果モデルの事前分布上でのベイズ推論タスクとして定式化し、因果グラフと機能的メカニズムの不確実性を明示的な因果探索・統計検定なしに周辺化する PRIM を提案。合成 SCM で事前学習した MACE(Model-Averaged Causal Estimation)transformer neural process が、観測/介入サンプルとノード間構造依存の両方に交互アテンションを向けて単一フォワードパスで根本原因ノードのロジットを出力し、最大100変数のシステムで17ms(A100 GPU)のゼロショット推論を実現。合成ベンチマークでは観測データのみからは因果グラフが非識別な設定でも根本原因を正しく特定できることを実証し、実世界ベンチマーク PetShop・CausRCA ではグラフ非依存(graph-not-given)手法群の中でファインチューニング版 PRIM-FT が最高の Top-3 recall(0.65)・MAP@3(サブシステム平均 0.77)を達成、一部設定ではグラフ既知手法にも匹敵した。(paper / source / aiops / rca / causal-discovery / bayesian-meta-learning)
#### FlowLog: Byte-Level Flow Monitoring System in High-Throughput Networks (IEEE Transactions on Networking Vol.34, 2026) (2026-08-04)
- [[@2026__TON__FlowLog - Byte-Level Flow Monitoring System in High-Throughput Networks]] — [[Long Chen]]・Mingwei Cui・Qiuheng Yin・Hanglong Lyu・Yisen Hong・[[Tong Yang]]・Yangyang Bai・Ziwei Zhao(Douyin Vision Company Ltd. / [[Peking University]])。P4 プログラマブルゲートウェイ上で 400Gbps 級本番トラフィックのバイトレベルフローサイズをサンプリングなしに推定する初のエンドツーエンドスケッチベース監視システム FlowLog を提案。新規スケッチアルゴリズム ByteSketch(ビットシフト圧縮+確率的補正で CM Sketch のバケットオーバーフロー問題を解消、誤差上界の形式的証明つき)・KeyWatcher/KeyReceiver によるタグ方式フローID同期・Kafka+Flink のスキュー耐性解析サブシステム(ブロードキャスト型ジョブ割当+TTLベースjoin)の3層構成。[[ByteDance]] データセンターに6ヶ月超・ピーク帯域400Gbpsで本番デプロイし、既存の sFlow ベース監視 Bytehunter・CMSketch・TowerSketch を精度・効率の両面で上回った。CIC-IDS 2017・CAIDA 2019・MAWI の3公開データセットでも汎化性を確認。(paper / source / networking / network-measurement / programmable-switches)
#### A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM (arXiv:2605.15617) (2026-08-04)
- [[@2026__arXiv__A Few GPUs, A Whole Lotta Scale]] — Shaoke Xi・ChonLam Lao・Boyi Jia・Jiaqi Gao(equal contribution)ほか([[Alibaba Group]] / [[Harvard University]] / [[Shanghai Jiao Tong University]] / [[Zhejiang University]]、責任著者 [[Jingren Zhou]])。本番規模クラスタへのアクセスなしに数千 GPU 規模の LLM 訓練挙動を忠実に再現するエミュレーションシステム PrismLLM を提案。コンテキストスイッチ実行で少数 GPU 上に多数の論理ランクを多重化して bare graph(構造)を収集し、スライスごとのタイミング充填とスライス間キャリブレーションで大域的に整合したタイミングを復元、NCCL グループ削減・近傍プルーニングを施したハイブリッドエミュレーションで選択ランクをサンドボックス GPU 上で実行しつつ残りを仮想リプレイする。2,048-GPU テストベッド(Megatron-LM、Qwen3 MoE 235B〜1.01T)で反復時間誤差平均 0.58%・ピークメモリ誤差 0.01% 未満を達成し、8192 GPU クラスタを物理 GPU の 1% 未満でエミュレート。SimAI(平均誤差 77.2%)・Phantora(12〜64% 誤差)を大きく上回る精度を実証。(paper / source / distributed-training / hpc / performance-modeling / gpu-emulation)
#### The PetShop Dataset — Finding Causes of Performance Issues across Microservices (CLeaR 2024、arXiv:2311.04806) (2026-08-04)
- [[@2024__CLeaR__The PetShop Dataset - Finding Causes of Performance Issues across Microservices]] — [[Mila Hardt]]・[[William R. Orchard]]・[[Patrick Blöbaum]]・[[Elke Kirschbaum]]・[[Shiva Prasad Kasiviswanathan]]([[Amazon]] / [[University of Cambridge]])。AWS 公開デモのペットアダプションサイト(41 コンポーネント)に 68 件の性能障害を注入したマイクロサービス RCA ベンチマークデータセット [[PetShop]] を提案。サービスマップ・5分間隔のレイテンシ/リクエスト数/可用性メトリクス・正解根本原因ラベルを公開し、因果グラフ既知の手法(traversal・CIRCA・Counterfactual Attribution)と因果グラフ不要の手法(ε-Diagnosis・RCD・相関ランキング)を low/high/temporal の3トラフィックシナリオで横並び評価。因果グラフ既知手法は top-3 recall で概ね優位だが top-1 recall では相関ランキングが最高となる逆転が生じ、Sock-shop で高性能だった手法が本データセットでは苦戦する例も確認。正常期間データでも全手法が偽陽性(根本原因の捏造)を出すことを明示的に検証した。(paper / source / aiops / rca / benchmark / causal-inference)
#### Closing the Efficiency Gap: AI Datacenter Co-design Roadmap for Scalable Training of LLMs (ICS '26) (2026-08-04)
- [[@2026__ICS__Closing the Efficiency Gap - AI Datacenter Co-design Roadmap for Scalable Training of LLMs]] — [[Jesmin Jahan Tithi]]([[Intel]])・[[Hanjiang Wu]]・[[Joongun Park]]([[Georgia Institute of Technology]])・[[Avishaii Abuhatzera]](Ex-Intel)・[[Fabrizio Petrini]]([[Intel]])・[[Tushar Krishna]]([[Georgia Institute of Technology]])。dense LLM 専用の open-source [[Calculon]] を [[Mixture-of-Experts]] 向けに拡張した co-design 解析ツール [[Calculon-MoE]] を提案。MoE ゲーティング・エキスパート並列(EP)・エキスパートシャーディング(ES)・動的 All-to-All 通信・SwiGLU 活性化を新規モデル化し、128 GPU 規模の実測で平均予測誤差 4.6〜5.2% を達成。65,536 GPU 規模までの co-design 感度分析で、高基数・低直径の全光配線(CPO)FullFlat トポロジが TwoTiered ネットワーク比で上位5,000パラメータ構成間の性能ギャップを 70%→13% に縮小し、GPT4-1.8T/29T 級 MoE モデルを 12〜20 倍高速化することを実証。HBD サイズ=1024・HBM 容量 1.3TB/GPU を co-design 目標値として提示し、EP=#Experts・ES=TP のデフォルト前提から独立させる decoupled parallelism が MFU を改善することも示した。→ [[AIデータセンタートポロジ]] / [[並列化戦略]] / [[集合通信]]。(paper / source / datacenter / networking / distributed / llm-training / moe)
#### gPooling: An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters (IEEE TPDS Vol.37 No.10, 2026) (2026-08-04)
- [[@2026__IEEE TPDS__gPooling - An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters]] — Kaicheng Guo・Jingyi Chen(共同筆頭著者)・Chen Chen・Yun Wang・Pengwei Du・Zhengwei Qi(責任著者)・Haibing Guan([[Shanghai Jiao Tong University]] / [[Huawei Technologies]])。大学 GPU クラスタの90日トレースで GPU 利用率25%未満と滞留ジョブ200件超が共存する逆説を動機に、ドライバレベルのカーネルハイジャックで NVIDIA GPU・Huawei Ascend NPU 双方に弾力的な vGPU/vNPU を作る [[gPooling]] を提案。チャネルベースの時分割多重+利用率フィードバックによるコンピュート制御と、cudaMalloc/cuMemAlloc 傍受による per-vGPU メモリクォータ強制を分離し、Slurm には SPANK プラグインでソースコード・ユーザースクリプト無改変のまま GRES として統合する。6週間の本番デプロイでキュー圧力を平均5.3倍・ピーク7.2倍低減、ジョブ待ち時間中央値を125分から23分へ5.4倍改善した一方、1%極小クォータ構成では既存業界ソリューション以上のオーバーシュート(約300% vs 約200%)を示す限界も確認。Euro-Par 2025 の予備会議版のジャーナル拡張版。(paper / source / distributed-systems / hpc / virtualization)
#### SPPO: Making Million-Token LLM Training Practical on Modest GPU Clusters (ICS '26、arXiv:2503.10377) (2026-08-04)
- [[@2026__ICS__SPPO - Making Million-Token LLM Training Practical on Modest GPU Clusters]] — qiaoling chen・[[Shenggui Li]]・[[Wei Gao]]・[[Peng Sun]]・[[Yonggang Wen]]・[[Tianwei Zhang]]([[Nanyang Technological University]] / [[Hong Kong University of Science and Technology]] / [[Shanghai AI Laboratory]])。長系列 LLM 訓練の既存最適化(活性化再計算・CPU オフロード・分散並列化)が系列を分割不可能な単一ブロックとして扱う「粒度ミスマッチ」を共通の根本原因として指摘し、部分系列(subsequence)単位の適応的オフロードと適応的パイプラインスケジューリングを組み合わせた Adaptive Sequence Pipeline Parallel Offloading(SPPO)を提案。sequence-aware offloading・2レベル活性化管理・ヒューリスティックソルバー・多重化系列分割(multiplexing sequence partitioning)の4要素で構成し、128台の NVIDIA Ampere GPU のみで 7B パラメータ LLM を最大400万トークンの系列長で訓練可能にする。Megatron-LM・DeepSpeed-Ulysses・TeraPipe 比で最大 3.38 倍のスループット改善、GPT-65B で128 GPU 時に Megatron-Tuned 比88%(4倍 vs 2.13倍)上回る最大系列長スケーラビリティを実証。→ [[アクティベーションオフロード]] / [[パイプライン並列化]] / [[シーケンス並列化]]。(paper / source / distributed-training / long-context / llm-pretraining)
#### KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes (arXiv:2607.17722) (2026-08-04)
- [[@2026__arXiv__KernelDiag - Agent-Based Root Cause Diagnosis for Kernel Crashes]] — Weijing Wang・[[Dong Wang (Tianjin University)|Dong Wang]]・[[Haichi Wang]]・[[Junjie Chen]]([[Tianjin University]] School of Computer Software)、[[Zan Wang]]([[Tianjin University]])。Linux カーネルクラッシュの根本原因診断において、syscall・ログ・crash report という異種アーティファクトをそれぞれ専任のエージェント(Syscall/Log/Report Agent)で解析し、Log-to-Code Mapping(ロギングマクロの backward reachability による静的解決)と Semantic Function Introspection・Environment-Aware Semantic Pruning によるカーネルソース探索で構造化 Evidence Graph を構築、2段階(ファイル→メソッド)の因果駆動型箇所特定と根本原因説明を行う agent-based フレームワーク KernelDiag を提案。実世界ベンチマーク KGYM(279件、72サブシステム)で最強ベースライン LinuxFL+・Agentless をファイルレベル Top@1 65.95%(+27.78%)・メソッドレベル Top@1 33.33%(+24.09%〜)で上回り、明示的ヒントのない設定では Top@10 で最大4倍・2倍の改善を達成。crash report 除去が最大の性能低下(-63.04%/-78.49%)をもたらすアブレーション、2025年3月以降の50件のポストリリースデータセットでのデータリーク耐性検証、DeepSeek-V3/Qwen3-Max 双方でのバックエンド汎化も実証。→ [[カーネル障害診断]] / [[Fault Localization]] / [[エージェント型コーディング]]。(paper / source / fault-localization / agentic-coding / linux-kernel)
#### Exploring LLM-Based Agents for Root Cause Analysis (FSE Companion '24、DOI:10.1145/3663529.3663841) (2026-08-04)
- [[@2024__FSE Companion__Exploring LLM-Based Agents for Root Cause Analysis]] — [[Devjeet Roy]]([[Washington State University]])・[[Xuchao Zhang]]・[[Rashi Bhave]]・[[Chetan Bansal]]・[[Pedro Las-Casas]]・[[Rodrigo Fonseca]]・[[Saravan Rajmohan]]([[Microsoft]])。クラウドインシデント管理向け RCA に [[ReAct]] エージェントを適用した最初期の実証研究。ゼロショット設定で Microsoft の 107,000 件本番インシデントデータセットを評価し(RQ1・RQ2)、Azure Fundamental Team との 4 週間の実運用ケーススタディ(RQ3、データベースクエリツール・KBA Q/A ツール・KBA Planning Tool・Human Interaction Tool)を実施。ReAct は自動評価指標で Retrieval Baseline・CoT と同等かやや劣るが、人手定性評価ではハルシネーション率が最低(不正解の 6% のみ)。KBA へのアクセスが単純インシデントの自律解決の鍵であり、複数 KBA にまたがる複雑インシデントでは反復試行が必要になることを示した。→ [[ReAct]] / [[LLMによる根本原因分析]] / [[根本原因分析]]。(paper / source / rca / aiops / agents)
#### Explainable Artificial Intelligence in Software Engineering: Current Trends, Gaps, and Future Directions (IEEE Access, DOI:10.1109/ACCESS.2026.3679576) (2026-08-04)
- [[@2026__ACCESS__Explainable Artificial Intelligence in Software Engineering Current Trends, Gaps, and Future Directions]] — [[Adam Khan]]・[[Asad Ali]]・[[Muhammad Ismail Mohmand]]・[[Mahdi Zareei]]・[[Rajesh Roshan Biswal]]([[Tecnologico de Monterrey]] ほか)。2020年3月〜2024年4月の29件の一次研究を対象に、SE における XAI 適用状況を金融・ヘルスケアとの横断比較込みで分析したシステマティックリテラチャーレビュー(SLR)。局所説明が86.20%を占め大域説明単独の研究は皆無、局所説明ツールはLIME(65.5%)がSHAP(44.3%)を上回るが金融・ヘルスケアではSHAPが優勢という逆転構造、MLライブラリはscikit-learnが中心だが58.6%が未記載、XAI適用先はソフトウェア欠陥予測に82.20%〜86.2%(本文とFig.16で数値に不一致あり)集中し他SEサブ領域は手薄、という知見を報告。先行SLR(Mohammadkhani et al. 2023)との比較(RQ5)も含む。→ [[帰属手法]]。(paper / source / xai / software-engineering / systematic-literature-review)
#### SWIM: Scalable Weakly-consistent Infection-style Process Group Membership Protocol (DSN 2002、DOI:10.1109/DSN.2002.1028914) (2026-08-04)
- [[@2002__DSN__SWIM - Scalable Weakly-consistent Infection-style Process Group Membership Protocol]] — Abhinandan Das・[[Indranil Gupta]]・[[Ashish Motivala]]([[Cornell University]])。分散プロセスグループ向け弱一貫性メンバーシッププロトコル SWIM を提案する古典的論文。障害検知(ランダム化間接プロービング: ping/ping-req/ack)とメンバーシップ更新伝播(ping/ack へのピギーバックによる感染様式ディセミネーション)を明確に分離することで、全対全ハートビート方式のメッセージ負荷のグループサイズに対する二次的増大を回避し、メンバーあたりのメッセージ負荷と障害検知時間をグループサイズ非依存の定数に保つ。Suspicion サブプロトコル(仮想 incarnation number 付き)で誤検知頻度を低減し、Round-Robin プローブ対象選択で決定的な検知時間上界(2N プロトコル周期)を保証。56 メンバーまでのプロトタイプ実験で、10% パケット損失下でも SWIM+Inf.+Susp. が SWIM:Basic・SWIM+Inf. より安定したグループサイズを維持することを実証。既存 concept [[ゴシッププロトコル]] に、Cassandra/Dynamo のアンチエントロピー型ゴシップとは異なる「ピギーバックのみで専用メッセージを生成しない」伝播系統としての横断的知見を追記。(paper / source / distributed-systems / membership / failure-detection / gossip)
#### NIXT: A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training (arXiv:2608.01449) (2026-08-04)
- [[@2026__arXiv__NIXT - A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training]] — [[Ziyang Jia]]・[[Sirshak Das]]・[[Jason Sewall]]・[[Laxmi Bhuyan]]・[[Pasha Shamis]]・[[Daniel Wong]]([[University of California, Riverside]] / [[NVIDIA]])。NCCL Inspector(NCCL 2.28 同梱の公式プロファイラプラグイン)の生ログを DuckDB ベースの型付き列指向スキーマへ変換し(26 倍のログ削減)、要約統計・時間的/空間的/資源的/その他の相関分析プリミティブで集団通信の観測性を高めるエクスポータツール [[NIXT]] を提案。Nemotron-4 15B/340B(最大 2,048 H100 GPU)の実運用事前訓練トレースで、ReduceScatter+AllGather が通信量の 99.7% を占め NIC-only 経路が全転送バイトの 70.4% を占めること、本番訓練の帯域変動係数(CV)が nccl-tests での孤立再現実験より 2〜5 倍大きく ML フレームワークが変動の一因であること、空間相関分析でストラグラーを特定ホストへ帯域 3〜4 倍低下・CV 4〜8 倍増加として局所化できることを実証。NCCL Inspector プロファイリング自体のオーバーヘッドは全スケールで 2% 未満。既存 concept [[集合通信]]・[[ストラグラー]] に、NCCL 本体への計装追加を必要としない非侵襲的な観測手段としての横断的知見を追記。(paper / source / distributed / observability / gpu)
#### GPU-Initiated Networking for NCCL (arXiv:2511.15076) (2026-08-04)
- [[@2025__arXiv__GPU-Initiated Networking for NCCL]] — Khaled Hamidouche・John Bachan・Sylvain Jeaugey ほか([[NVIDIA]])。NCCL 2.28 の Device API のうち、ネットワーク越し RDMA を担う GPU-Initiated Networking(GIN)を解説。CPU の介在なしに GPU カーネルから one-sided put/signal 操作を発行するデバイス起動通信で、GDAKI(DOCA GPUNetIO による直接 GPU-to-NIC 通信、16.7µs 往復レイテンシ)と Proxy(ロックフリー GPU-to-CPU キュー、18.0µs)の二重バックエンドを持つ。MoE 通信ライブラリ [[DeepEP]] への統合により、NVSHMEM/IBGDA ベースの既存実装と同等の性能(帯域差1〜3%程度)を達成した。新設 concept [[GPU起動型ネットワーキング]] の初出ソース。既存 concept [[集合通信]]・[[RDMA]] に、集団通信とは別カテゴリの one-sided デバイス起動通信という横断的知見を追記。(paper / source / distributed / networking / gpu)
#### Mixture-of-Kittens: our open-source MoE megakernel for NVL72s (Cursor Blog) (2026-08-05)
- [[@2026__Cursor__Mixture-of-Kittens - our open-source MoE megakernel for NVL72s]] — Stuart Sul・Nash Brown・Henry Wildermuth・William Lin・[[Federico Cassano]]([[Cursor Research]])。[[NVIDIA GB300 NVL72]] 向けの決定論的 [[Mixture-of-Experts]] 訓練用[[メガカーネル]] [[Mixture-of-Kittens]](MoK)を OSS 公開。pull-based dispatch(push-based 比最大29%高い NVLink 帯域利用率)・計算通信オーバーラップ用の「ミニバッチ」・CPU-GPU 同期を排除するリングトークンバッファの3設計で、単一 MoE 層 MXFP8 順伝播最大2.37倍・本番訓練エンドツーエンド1.41倍(760.9→1,070.2 tok/s/GPU)を達成。Kimi・GLM・Qwen・DeepSeek 形状で検証済み。既存 concept [[Mixture-of-Experts]]・[[集合通信]]・[[LLM駆動GPUカーネル生成]] に横断的知見を追記。(article / source / gpu-kernels / distributed / coding-agents、confidence: medium — cursor.com がサンドボックス許可リスト外のため WebFetch 経由で取得)
#### Materialized Metrics in Prometheus (RedditEng Blog) (2026-08-05)
- [[@2026__RedditEng__Materialized Metrics in Prometheus]] — [[Aleksandr Krivoshchekov]]・[[Walther Lee]]([[Reddit]] オブザーバビリティチーム)。Kubernetes の pod ラベルによる Prometheus カウンタ系列の膨張問題に対し、recording rule の限界(継続的背景負荷・toil・タイムアウト)を退けた上で、スクレイプ時に delta 化してから固定間隔で強制リセットする「ジグザグカウンタ」でレプリカ間合意なしの比較・重複排除・欠損補完を実現する手法 [[マテリアライズドメトリクス]] を提案。本番実装で系列数を最大メトリクスで98%削減、クエリスループット88%減・レイテンシ80%減、平均誤差率0.15%を達成。既存 concept [[Prometheusシリーズチャーン]]・[[Prometheus TSDB]] に、同じ Reddit チームによる stale-series compaction(ストレージ層)との対比という横断的知見を追記。reddit.com が Cloudflare の JS 認証チャレンジで取得不能だったため、ユーザー貼り付けの本文を一次資料とした。(article / source / prometheus / observability / sre、confidence: medium — 取得方法の制約と公開日不明のため)
#### Resilient AI Supercomputer Networking using MRC and SRv6 (arXiv:2605.04333) (2026-08-06)
- [[@2026__arXiv__Resilient AI Supercomputer Networking using MRC and SRv6]] — [[OpenAI]]・[[Microsoft]]・AMD・Broadcom・NVIDIA の 5 社連名(Mark Handley・Torsten Hoefler・Jitendra Padhye ほか)。50K/75K GPU の本番事前訓練で [[MRC]](マルチパス RDMA)と [[SRv6]] による耐性を評価。T0-T1 間のリンクフラップは常時毎分数件あるが ride out できるため修理を低優先度に落とせる一方、T0 スイッチの光トランシーバ 1 個のグリッチが 4 リンクを連続フラップさせスループットを 1 分間約 25% 低下させた事例を実測グラフつきで報告。NIC 側 800Gb/s 光モジュールのフラップは NIC の全ポートを同時に失い QP が落ちるため ride out できない残存単一障害点であると明記する。既存 concept [[RDMAネットワーク監視]] に「NIC 側光モジュールは計装点 4 層のどこにも救われない」という横断的知見を追記。(paper / source / networking / distributed)
#### Resiliency at Scale: Managing Google's TPUv4 Machine Learning Supercomputer (NSDI 2024) (2026-08-06)
- [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]] — [[Yazhou Zu]] ほか([[Google]])。4096 ノードの 3D トーラスを 64 キューブに分け、6,144 本の光 ICI リンクを 48 台の[[光回線交換]]機(OCS)へ接続する。日次故障率は TPU マシン 0.08%・ICI ケーブル 0.005%・OCS 0.04%。OCS による動的再構成でホスト可用性要件を 99.9% から 99% へ緩和し、システム可用性 99.98%・訓練ジョブの約 1% のみがハードウェア停止の影響を受ける状態を達成。訓練ジョブの 95% が耐障害 ICI ルーティングを選択し、実運用のステップタイム低下は 0.5〜8.6% に収まる。OCS と光ファイバのコストは pod 総資本コストの 5% 未満・総電力の 3% 未満。(paper / source / networking / distributed)
#### Training LLMs with Fault Tolerant HSDP on 100,000 GPUs (arXiv:2602.00277) (2026-08-06)
- [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]] — [[Omkar Salpekar]]・[[Rohan Varma]]・[[Chunqiang Tang]]・[[Maxim Naumov]] ほか([[Meta]])。Llama 3 の後継にあたる 32K GPU の障害実態報告。Table 1 全 16 行(合計 678 件)を転記し検算した上で、`Network Switch/Cable` 36 件・5.3%、有効訓練時間 95〜97%、2.3 件/1000 サーバ/日、78% がハードウェア起因と報告する。本文に `optical`/`transceiver`/`BER`/`FEC` のいずれの語も現れず、光関連の障害を独立カテゴリとして計上していないことを限界として明記した。(paper / source / distributed / aiops)
#### 情報科学における18のメタテクニック (SlideShare) (2026-08-08)
- [[@2015__SlideShare__情報科学における18のメタテクニック]] — [[中野淳]]([[金沢工業大学]]情報工学科、2015-04-30)。コンピュータアーキテクチャ・OS・分散システム・データベース・ネットワークを横断して繰り返し現れる18の基本技法(キャッシング・パイプライニング・投機的実行・条件の緩和・並列化・結合vs分離・仮想化・トランザクション等)を着想と代表例の対で整理したスライド資料。新設 concept [[メタテクニック(情報科学)]] にこの分類枠組みを集約。(slides / source / systems、confidence: medium — SlideShare のボット対策で PDF 原本を取得できず CDN 個別画像で代替、発表イベントの確定情報なし)
#### A Taxonomy of Performance Metrics for the Distributed Computing Continuum (arXiv:2607.28407) (2026-08-08)
- [[@2026__arXiv__A Taxonomy of Performance Metrics for the Distributed Computing Continuum]] — Praveen Kumar Donta([[Stockholm University]])・[[Boris Sedlak]]・Alfreds Lapkovskis・Alaa Saleh([[University of Helsinki]])・Ying Li([[Northeastern University]])・[[Víctor Casamayor Pujol]]・Ilir Murturi・Manuel Otero Barbasan・[[Schahram Dustdar]]([[TU Wien]] / ICREA)。分散コンピューティングコンティニュウムシステム(DCCS)の性能メトリクスをcomputing-level・network-level・application/user-levelの3階層+AI駆動時代の新興メトリクス群(CO2排出量・熱放散・観測可能性・適応性指数・データ局所性指数・コンティニュウム断片化指数等15個)に整理したタクソノミー論文。各メトリクスに数式定義と、取得範囲(Single-Node/Multi-Node/Full System/Full App)・取得フェーズ(Operational/Experimental)・取得手法(Standard/Custom/Experimental Instrumentation)の3次元取得要件を付与する点が特徴。新設 concept [[分散コンピューティングコンティニュウム]] の初出ソース。既存 concept [[性能測定]]・[[Edge Computing]] に横断的知見を追記。(paper / source / distributed-systems / edge-computing / performance-engineering)
#### R2aft: A Speedy and Highly Available RDMA-Based Consensus Protocol (IEEE TPDS 2026) (2026-08-08)
- [[@2026__TPDS__R2aft - A Speedy and Highly Available RDMA-Based Consensus Protocol]] — [[Zhiyuan Dong]]・[[Haitao Song]]・[[Zhaoguo Wang]]([[Shanghai Jiao Tong University]] Institute of Parallel and Distributed Systems / Shanghai Artificial Intelligence Research Institute)。RDMA のプロセッサバイパス特性を利用し、プロセッサ障害とサーバ全体の障害を切り離す「細粒度障害モデル」をリーダー選出とログ複製の両方に適用した初の RDMA ベース Raft 派生合意プロトコル R2aft を提案。Single Writer Multiple Reader Region(サーバごとに書き込み可能な領域を固定)と Write-Read-Verify アプローチ(書き込み→読み取り→検証の順序転換)により、リモートプロセッサを完全にバイパスしながら競合状態を防ぐ。YCSB ベンチマークで最先端の RDMA ベース合意プロトコル Mu に対し 12.2% のレイテンシオーバーヘッドで同等のスループットを達成し、3 サーバ構成でリーダーのプロセッサのみが故障した極端なケースでも唯一動作を継続できることを実証。新設 concept [[分散合意プロトコル]] の初出ソース。既存 concept [[RDMA]] に横断的知見を追記。(paper / source / distributed-systems / rdma / consensus)
#### From Causal Discovery to Dynamic Causal Inference in Neural Time Series (KDD '26) (2026-08-09)
- [[@2026__KDD__From Causal Discovery to Dynamic Causal Inference in Neural Time Series]] — [[Dmitry Zaytsev]]・[[Valentina V. Kuskova]]・[[Michael Coppedge]]([[University of Notre Dame]])。因果構造が未知・不確実な設定で動的因果推論を可能にする二段階フレームワーク DCNAR(Dynamic Causal Network Autoregression)を提案。第一段階でニューラル加法自己回帰因果発見(NAVAR)により疎な有向因果ネットワークを学習し、第二段階でこれを構造事前分布として時変ネットワーク自己回帰(tvNAR)を制約する。[[V-Dem (Varieties of Democracy)]] の139カ国×35年パネルで、Ridge VAR・TV-VAR・LSTM(MC Dropout)と同等の予測分布精度(CRPS)を保ちつつ、滑らかで符号一貫性のあるインパルス応答と有界な反実仮想軌道を生成することを示した。アーキテクチャアブレーションでは、NAVAR による学習構造を線形VAR由来の構造に置換するとCRPSが14.5%悪化することを確認。新設 concept [[動的因果推論]] の初出ソース。既存 concept [[因果発見]] に、発見結果を下流動的推論の構造事前分布として再利用する視点を横断的知見として追記。(paper / source / causal-discovery / time-series / political-science)
#### MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production (EuroSys '26) (2026-08-09)
- [[@2026__EuroSys__MegaScale-Omni - A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production]] — Chunyu Xue([[Shanghai Jiao Tong University]])・Yangrui Chen・Jianyu Jiang ほか([[ByteDance Seed]])、責任著者 [[Quan Chen]]・[[Yanghua Peng]]。マルチモーダルLLM(MLLM)訓練で encoder と LLM バックボーン間のワークロードが動的にシフトする問題を、両者の並列化戦略を分離しつつ同一GPU集合上でコロケーションする「encoder-LLM multiplexing」で解決する産業グレードシステム。encoderに long-short sequence parallelism、LLM に full-fledged 5D parallelism を適用し、EncoderAnchor という統一表現で workload-resilient な結合パイプラインを実現。decentralized grouped reordering・adaptive sample sharding によるワークロードバランシングも実装。4つの最先端ベースラインに対し1.27×〜7.57×のスループット改善を、数千GPU規模の本番環境で実証。既存 concept [[並列化戦略]]・[[LLM分散学習]] に、複数サブモデル間の時間多重化コロケーションという新しい decoupling と、実運用/静的合成ワークロード間の17% MFUギャップという横断的知見を追記。(paper / source / distributed / machine-learning / multimodal)
#### Agentic Coding in the Wild: Characterizing GitHub Copilot at Production Scale (arXiv:2608.00101) (2026-08-09)
- [[@2026__arXiv__Agentic Coding in the Wild - Characterizing GitHub Copilot at Production Scale]] — Banruo Liu([[University of Illinois Urbana-Champaign]])・Haoran Qiu・[[Íñigo Goiri]]・[[Rodrigo Fonseca]]・[[Ricardo Bianchini]]・[[Esha Choukse]]([[Microsoft Azure]] Research)。GitHub Copilot コーディングエージェントの匿名化テレメトリ(2026年6月第1週、320万ユーザー・1,350万セッション・7.6億LLM呼び出し・95兆トークン)を用いた初の本番規模ワークロード特性化。LLM呼び出しの87%がエージェント起点で1:1でツール呼び出しと結合する構造、KVキャッシュヒット率がターン内90%からターン境界で55%・モデル切替後8%へ劣化する系統的パターン、コンテキスト圧縮がセッションの7.8%で発生し発火時に72.8%のトークン・66.1%のキャッシュを失うこと、ツール失敗が計算量を最大4倍に増幅するリトライループを誘発すること、ユーザーが5アーキタイプ(Readers・Coders・Terminal users・Deep-loop users・Chat-only users)に分かれターン当たりトークン消費で50倍の開きを持つことを定量化。ターン境界を signal とする軽量アイドル時間予測器(LightGBM)で全アイドル時間の86〜90%を捕捉。既存 concept [[エージェント型コーディング]]・[[KVキャッシュ管理]] に、本番トレースに基づく構造イベント別キャッシュ劣化の定量化とワークフローアーキタイプの多様性を横断的知見として追記。(paper / source / llm / inference / agents / workload-characterization)
#### TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference (arXiv:2608.01975, ASE '26) (2026-08-09)
- [[@2026__arXiv__TELLER - Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference]] — [[Ruilin Xu]]・[[Junyi Li]]・[[Pengfei Chen]]・[[Zongxuan Xie]]([[Sun Yat-sen University]])。モデルバイナリを変更せずに NVTX/CUPTI で LLM 推論のエンジン・CUDA ランタイム・GPU カーネル・通信・ログを横断トレースし、リクエスト単位のコールチェーンを再構成して根本原因分析を行う非侵入フレームワーク。依存関係考慮型 causal-context slice と、構造保存型トレーストークナイザ Trace Pair Encoding(TPE)でトレースを圧縮し、trace–log マルチモーダルなトランスフォーマーデコーダで異常ステップ・疑わしいオペレータ・自然言語根本原因説明を同時予測する。SGLang・Torch FSDP・vLLM v0/v1 で評価し既存手法(Robustlog・LAnoBERT 等)を上回るステップ精度(Acc 0.930/0.911)とオペレータ局所化(Macro F1 0.806/0.792)を達成。TPE ボキャブラリ 256(83.88%圧縮)が最良で、512/1024 への積極圧縮はオペレータ局所化 Macro F1 を 0.806→0.173→0.138 まで崩壊させることを示した。AI21 Labs 報告の実 vLLM 障害(Mamba SSM 状態汚染)ケーススタディを含む。同著者陣による eACGM(IWQoS 2025)の非侵入計装を訓練クラスタ異常検知から推論のリクエストレベル RCA へ発展させた後継研究。既存 concept [[LLMによる根本原因分析]]・[[GPU観測性]]・[[CUDA API トレース]]・[[マルチモーダル障害診断]] に横断的知見を追記。(paper / source / aiops / llm / gpu / tracing)
#### AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド (SpeakerDeck, OCTS 2026) (2026-08-10)
- [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]] — Masayuki Kobayashi(markunet)。OCTS 2026(Open Compute Tech Summit 2026、2026-07-09、北京)講演内容をまとめたスライド53ページ。Agentic AIの実運用化を起点に、計算(GPU中心→CPU-GPU協調)・記憶(KV Cacheのボトルネック化)・接続(スーパーノード標準化、NPO/CPO/XPO)・電力(54V→800V高圧直流)・冷却(ネイティブ液冷)・管理(RAS API標準、grid to chip)の6トレンドを、Alibaba Cloud・ByteDance・浪潮信息(IEIT SYSTEMS)・沐曦(MetaX)・サムスン電子・Astera Labs・China Mobile等の公開資料から横断的に整理。新設 concept [[AIスーパーノード]]・[[800V高圧直流給電]] の初出ソース。既存 concept [[KVキャッシュ管理]] にDRAM/NAND約200倍のコスト差という経済性の知見を追記。新規entity 浪潮信息(IEIT SYSTEMS)・沐曦(MetaX)・Astera Labs・サムスン電子・China Mobile・OCP Foundation。(slides / source / infrastructure / hardware / power / cooling)
#### マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察 (SpeakerDeck, Interconnect Architecture SIG) (2026-08-10)
- [[@2026__SpeakerDeck__マルチプレーンGPUネットワークを実現するシャッフルアーキテクチャの整理と考察]] — [[Masayuki Kobayashi]](markunet)。Interconnect Architecture SIG(2026-03-09発表)向け社内検討資料、全39ページ。Shuffleを「breakout cableではなくlane remap + plane分散 + structured cablingを含む物理配線アーキテクチャ、本質はserver-majorの束をplane-majorに組み替えること」と定義し、800G NICの2x400G(Dual-Plane)/4x200G(Quad-Plane)/8x100G(Octal-Plane)の分岐選択肢、Shuffle Cable/Shuffle Box/CPOスイッチ内蔵Shuffleの3方式比較、Fate Sharing(共通故障点)の定義と限界を整理。Corning・Oracleの公開図表を引用しつつElpis Clusterでの実構成例(4サーバ×8NIC×4Plane)も示す。既存 concept [[光ファイバーシャフル配線]] にShuffle Cable/Box/CPO内蔵の3方式11観点比較とFate Sharing定義を追記、[[マルチプレーンClosトポロジ]] にNICハードウェア側要件の詳細を追記。新規entity [[Masayuki Kobayashi]]・[[Corning Optical Communications]]・[[Oracle]]。(slides / source / networking / datacenter / gpu-infrastructure)
#### GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet – PFC/ECN編 (SpeakerDeck) (2026-08-10)
- [[@2024__SpeakerDeck__GPUネットワーク設計・運用 基礎勉強会 Lossless Ethernet - PFC-ECN編]] — [[Masayuki Kobayashi]](markunet、LINEヤフー Staff Engineer)。2024年12月公開の社内基礎勉強会資料、全47ページ。RoCEv2 が前提とする Lossless Ethernet を構成する PFC(IEEE 802.1Qbb)・ECN(IEEE 802.1Qau)・CNP(IBTA規格)の仕組みを、パケット分類(PCP/DSCP → Traffic Class)の基礎から NIC/スイッチ双方の実コマンド設定例(NVIDIA Cumulus Linux・Arista EOS)まで一貫して解説。RoCEv2=DSCP26=TC3・CNP=DSCP48=TC6 というベンダー横断のデファクト値、PFCは最終手段でECN/CNPによる事前抑制が主防御という運用規律、Headroomバッファのケーブル長依存計算を提示。Arista EOS 設定例には「StrataXGS Chip 前提、DNX では異なる」という明示的注記があり、単一ベンダー内でも ASIC ファミリが異なれば設定が異なることを示す一次資料。実クラスタでの個別設定値・Juniper/Cisco/SONiC設定例など6ページは登壇者により非公開化。既存 concept [[データセンター輻輳制御]]・[[マルチベンダーLosslessネットワーク]] に横断的知見を追記、entity [[Masayuki Kobayashi]]・[[LINE株式会社]] を更新。(slides / source / networking / rdma / gpu-cluster / congestion-control)
#### AIインフラを考える (SpeakerDeck, 第38回 ISOC-JP Workshop) (2026-08-10)
- [[@2025__SpeakerDeck__AIインフラを考える]] — [[Masayuki Kobayashi]](markunet、さくらインターネット インフラエンジニア)。第38回 ISOC-JP Workshop(2025-09-26)向け発表資料、全52ページ。AIインフラの巨大化サイクルとScale Up/Scale Out/Scale Outsideの3ドメイン区分、RoCEv2のパケット構造(BTH/RETH、フラグメント順序保証)、ECNの3ホップ通知経路とIETF Fast CNP draft、PFCバッファプロファイルのケーブル長依存性、RDMA-unaware/aware ロードバランシング方式比較、並列化方式別の通信ドメイン・ボトルネック対応表、PD DisaggregationにおけるKV Cache転送のサイズ試算(Llama3 8B/405B、1K〜8K×同時100リクエストで100〜420GB)とScale Up/Scale Out経路選択を扱う。既存 concept [[RDMA]]・[[RoCE設計課題]]・[[データセンター輻輳制御]]・[[Valiant Load Balancing]]・[[並列化戦略]]・[[KVキャッシュ管理]]・[[Prefill-Decode分離]]・[[AIデータセンタートポロジ]]・[[Ultra Ethernet]] に横断的知見を追記、entity [[Masayuki Kobayashi]](所属判明)・[[SAKURA internet Inc]]・[[高火力 PHY]] を更新。(slides / source / networking / rdma / gpu-infrastructure / llm-inference)
#### Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート (SpeakerDeck) (2026-08-10)
- [[@2026__SpeakerDeck__Multipath Reliable Connection (MRC) 大規模AI学習ファブリックのためのマルチパスRoCEv2拡張トランスポート]] — [[Masayuki Kobayashi]](markunet)。2026-06-30公開のTechnical Deep Dive資料、全66ページ。OCP MRC Specification 1.0・MRC Transport論文(arXiv:2606.18170)を一次ソースに、RoCEv2 RCとの差分(経路利用・信頼性・輻輳制御・パケットロス解釈)、EVの3実現方式(ECMPハッシュ/Structured EV/SRv6 uSID)とEVステートマシン(GOOD/SKIP/ASSUMED_BAD/DENIED)、MPRとWriteIMMインフライト制御、パケットフォーマット(BTH/RETH変更、METH/SETH/NETH/PETH等新設ヘッダ、MRC専用オペコード空間0b110)、SRv6統合のデータ・コントロールプレーン詳細、適用領域とプロトコル設計トレードオフ、NIC/スイッチベンダー対応状況(2026-06-19時点)を仕様書レベルで深掘りする。既存 concept [[MRC]] に「仕様レベルの機構」節を新設し、EVステートマシン・配送層/セマンティック層分離・MPR・パケットフォーマットの4項目を追加、横断的知見4件(SRv6誤解の訂正、CNP代替先、NICトランシーバ単一障害点の手がかり、UEC/UET関係の精緻化)を追記。entity [[Masayuki Kobayashi]]・[[Open Compute Project]] を更新。(slides / source / networking / rdma / mrc)
#### Why Transformers? A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations (TOSEM 投稿版) (2026-08-10)
- [[Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations]](旧1枚物sourceは2026-09-05に9章へ再ingest。エントリはハブentityを指す) — [[Binpeng Shi]](筆頭)・[[Shenglin Zhang]](責任著者)ほか([[Nankai University]]・[[Tsinghua University]]、[[Dan Pei]])。1,259本の候補から70本の代表論文へ絞り込み、Data(ログ・メトリクス・イベント)-Target-Principle-Approachの4軸タクソノミーでTransformerのAIOps応用を整理。Transformerの優位性を二層6能力(基本: SEQ・PARALLEL、応用: PTKL・ICL・TF・LANG)フレームワークで説明し、CloudOps・Loghub-2.0・OpenRCA・AIOPSLAB・ITBench等10ベンチマークを横断比較。Transformerの役割が「パターンモデラー→文脈対応タスクソルバー→自律エージェント」の3段階で進化してきたと整理し、ハルシネーション・汎化・計算コスト・マルチモーダル融合の4課題とベストプラクティスを提示。既存 concept [[AIOps]]・[[Transformer]]・[[LLMによる根本原因分析]]・[[LLM時系列アプローチ]] に横断的知見を追記、entity [[Binpeng Shi]]・[[Shenglin Zhang]]・[[Dan Pei]] を更新。(paper / source / aiops / transformer / llm / survey)
#### TSRBench: Benchmarking Time-Series Retrieval (KDD '26 V.2) (2026-08-10)
- [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]] — [[Cenjie Hu]](筆頭、[[University of Chinese Academy of Sciences]])・[[Hang Cui]]・[[Zexin Wang]]・[[Juncheng Bao]]・[[Jingwen Yang]]・[[Jingjing Li]]・[[Changhua Pei]](corresponding author)・[[Dan Pei]]([[Tsinghua University]])・[[Gaogang Xie]](Shenyang Institute of Automation, CAS / Computer Network Information Center, CAS)。時系列検索(TSR)のためのエンドツーエンドベンチマークスイート。データ層・モデル層・評価層を分離する距離ライブラリパイプラインの下で、UCR アーカイブを形状一貫性のある関連性と工夫されたディストラクタプールで再構成した公開データセット UCR-R(46 クラス・2,622 系列)と、通信事業者の実インシデントテレメトリから構築した産業データセット CU-RCA を提供。single hit dominance(1 件の高順位ヒットだけで見かけ上高スコアになる現象)を緩和する AdaBase Ranking Scorecard(AB-NDCG・AB-MAP、3 種の適応的割引ファミリー)を提案し、Hit@K が飽和する場面でも識別力を保つことをグリッド制御実験で実証。CU-RCA では単純な統計的距離(Pearson・Chebyshev)が事前学習済み埋め込みを上位ランクで上回るドメインシフトが観測され、産業評価の必要性を裏付けた。既存 concept [[時系列類似度検索]]・[[本番接地型ベンチマーク]] に横断的知見を追記、entity [[Changhua Pei]]・[[Dan Pei]]・[[Gaogang Xie]]・[[Zexin Wang]]・[[Jingjing Li]] を更新、新規 entity [[Cenjie Hu]]・[[Hang Cui]]・[[Juncheng Bao]]・[[Jingwen Yang]] を作成。図表 7 点(パイプライン図・システム概要図・散布図・ヒートマップグリッド・箱ひげ図・バブルチャート・レーダーチャート)を PyMuPDF のキャプション座標クロップで埋め込み。(paper / source / time-series / information-retrieval / benchmark)
#### Rethinking Time Series Anomaly Detection from a Dynamic Perspective: Temporal–Frequency–Curvature Fusion (KDD '26 V.2) (2026-08-10)
- [[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]] — [[Hang Cui]](筆頭、[[Chinese Academy of Sciences]] / [[University of Chinese Academy of Sciences]])・[[Zexin Wang]](corresponding author)・[[Changhua Pei]]・[[Juncheng Hu]]([[Jilin University]])・[[Haotian Si]]・[[Quan Zhou]]・[[Cenjie Hu]](Shenyang Institute of Automation, CAS)・[[Jingjing Li]]・[[Dan Pei]]([[Tsinghua University]])・[[Gaogang Xie]]。時系列を「値の集合」でなく「進化するシステムが生成する軌道」として捉え直し、離散二階差分(曲率)を時間・周波数に加える第三の視点として統合する TSAD フレームワーク TFC を提案。二階差分が二階微分を近似し傾き変化点で局所インパルスを生み高周波を選択的に増幅する(命題2.1–2.3)という理論的動機づけのもと、Multi-Span Attention(短・中・長距離の局所スパンを並列処理)と二段階融合(周波数-曲率クロスアテンションによる較正 → エキスパートルーティングによる時間統合)で shapelet 変形・トレンドシフト等のパターン単位の異常を検知する。AIOPS・WSD・Yahoo・NAB・UCR・TODS の6ベンチマーク・17ベースラインに対し平均 Best-F1・Event-F1 で SOTA を達成し、強いベースライン比平均 10.8% の改善、ウィンドウ長への安定性、モデルサイズ・推論時間の両面での優位を示した。既存 concept [[異常検知]] に「平滑化を逆転させ二階差分を判別的シグナルとして増幅する」新知見と2件の未解決の問いを追記。entity [[Changhua Pei]]・[[Dan Pei]]・[[Gaogang Xie]]・[[Zexin Wang]]・[[Jingjing Li]]・[[Quan Zhou]]・[[Hang Cui]]・[[Cenjie Hu]] を更新、新規 entity [[Haotian Si]]・[[Juncheng Hu]]・[[Jilin University]]・[[Shenyang Institute of Automation, Chinese Academy of Sciences]] を作成。図表5点(曲率視点の概念図・異常タイプ別放射状比較図・アーキテクチャ図・ウィンドウサイズ感度・F1対推論時間トレードオフ)を PyMuPDF のキャプション座標クロップおよび埋め込みラスター画像から取得。(paper / source / time-series / anomaly-detection / aiops)
#### TSLoc: Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters (KDD 2026) (2026-08-10)
- [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]] — [[Quan Zhou]](筆頭、[[Chinese Academy of Sciences]])・[[Changhua Pei]](corresponding author)・[[Yuanwei Lu]]([[StepFun]])・[[Difeng Ma]]・[[Zexin Wang]]・[[Jianhui Li]]([[Nanjing University]])・[[Yibo Zhu]]([[StepFun]])・[[Daxin Jiang]]([[StepFun]])・[[Dan Pei]]([[Tsinghua University]])・[[Jingjing Li]]・[[Gaogang Xie]]。健全ノードが同一コード・同一データ分割ロジックで生じる群コンセンサスからの逸脱を検知する自己教師あり障害箇所特定フレームワーク TSLoc を提案。LSTM ゲーティング + KAN-AD([[KAN-AD]])エキスパートからなる共有 Mixture-of-Experts 時系列エンコーダで多様なメトリクスの正常挙動を統一表現に落とし込み、空間逸脱(ノード間距離)と時間的 volatility(埋め込みの時刻間変化)を Reciprocal Rank Aggregation で統合する。[[Minder]] の決定木ベース優先順位付け(closed-world 仮定)を批判し、障害ラベル不要で未知障害・新規メトリクスに day-one 対応できる点を新規性とする。数百〜700台超ノードの本番 Kubernetes クラスタに数ヶ月デプロイし Top-5 精度 0.908・平均応答 4.2 秒を達成、オンライン実験(23件の困難な長尾障害)でも Acc@5=0.826 を報告。既存 concept [[Fault Localization]]・[[異常検知]]・[[GPUクラスタ運用]] に横断的知見・未解決の問いを追記、entity [[Minder]] に比較コメントを追記、9名の共著者entity([[Quan Zhou]]・[[Changhua Pei]]・[[Difeng Ma]]・[[Zexin Wang]]・[[Yuanwei Lu]]・[[Yibo Zhu]]・[[Daxin Jiang]]・[[Jingjing Li]]・[[Gaogang Xie]])・[[Dan Pei]]・[[StepFun]] を更新、新規 entity [[KAN-AD]] を作成(著者ら自身の先行研究、ICML 2025)。図表3点(PCIe rx bytes 障害前後パターン、MoE エンコーダ内部構造、異常スコアリングパイプライン)を埋め込みラスター画像から取得。(paper / source / aiops / distributed / gpu-reliability)
#### TRACER: Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis (KDD '26) (2026-08-10)
- [[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]] — [[Yuhang Zhang]](筆頭、[[Peking University]])・[[Meng Ma]](corresponding author)・[[Ping Wang]]。都市交通網の非再帰的渋滞に対する訓練不要・ゼロショットの根本原因診断エージェントフレームワーク TRACER を提案。運動学的衝撃波理論(kinematic wave theory)による物理接地された双方向トレースとGranger因果性検定を組み合わせた Physics-Grounded Evidence Construction で因果連鎖を構築し、並列LLM推論とコンセンサス融合で根本原因をランク付けする三段階パイプライン。既存の深層学習ベース手法(ST-GCN・GWNet等)がグラフ畳み込みの低域通過フィルタ性により fault smearing(平滑化効果)を起こすこと、因果発見手法(PCアルゴリズム・CUTS+等)が物理非依存でスプリアスな逆方向伝播を生成すること、直接LLM適用が空間的ハルシネーションを起こすことを指摘し、いずれも解決する。SUMOベースの閉ループベンチマーク TRACER-Bench と PeMS-BAY実データで評価し、Hit@1精度を最良ベースライン比32.6%相対改善、推論時間を85.7%削減、コストを41%以上削減。閉ループ介入実験で正確なRCAが交通回復を実際に加速することも実証。既存 concept [[因果推論ベースRCA]]・[[Fault Localization]] に横断的知見を追記、entity [[Meng Ma]]・[[Ping Wang]]・[[Peking University]] を更新、新規 entity [[Yuhang Zhang]] を作成。図表7点(4パラダイム比較・アーキテクチャ図・実世界4ケース地図・SUMOケーススタディ・感度分析・回復動態2枚)をPyMuPDFのキャプション座標クロップおよび埋め込みラスター画像から取得。(paper / source / aiops / causal-inference / urban-computing / llm-agent)
#### An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data (CCGrid 2023) (2026-08-10)
- [[@2023__CCGrid__An Optical Transceiver Reliability Study based on SFP Monitoring and OS-level Metric Data]] — [[Paolo Notaro]](筆頭、[[Huawei Technologies Duesseldorf GmbH]] / [[TU Munich]])・[[Qiao Yu]]([[TU Berlin]])・[[Soroush Haeri]]([[Huawei Technologies Duesseldorf GmbH]])・[[Jorge Cardoso]]([[University of Coimbra]])・[[Michael Gerndt]]([[TU Munich]])。350万台超・131リージョン・15か月分の光トランシーバーDDMモニタリングデータとOSレベルメトリクス(エラーレート・パケットロス・スループット)を突き合わせた大規模信頼性研究。時系列自己相関(エラーレートは24時間以内の再発傾向)・annualized failure rate推定(ハード故障AFR 0.1341%、ソフト故障はハード故障の最大12.22倍)・健全/故障モジュールの運用範囲比較・パターンlift分析(ErrorRate_HIGHがlift 9.13xで最大、パケットロスはlift 1.27-1.28xでほぼ無関係)・機械学習故障予測モデル(Random Forest/XGBoost/Logistic Regression/閾値ベース推定器、precision 72.8-95.7%・recall 21.2-50.0%)の5分析軸すべてでエラーレートとバイアス電流の重要性が一貫して確認された。既存 concept [[障害予測]] に、abstractのみだった[[OptProphet]]の予兆特徴を定量的に埋める横断的知見・同一著者系譜(サーベイ→実証→応用)の進化の知見・新規未解決の問い2件を追記。entity [[Paolo Notaro]]・[[Jorge Cardoso]]・[[Michael Gerndt]] を更新、新規 entity [[Qiao Yu]]・[[Soroush Haeri]]・[[Huawei Technologies Duesseldorf GmbH]] を作成。図表4点(DDM/OSメトリクス分布・エラーレート自己相関・AFR結果・パターンlift)をPyMuPDFのキャプション座標クロップで埋め込み。(paper / source / hardware-reliability / optical-networking / aiops)
#### Detecting Ephemeral Optical Events with OpTel (NSDI 2022) (2026-08-10)
- [[@2022__NSDI__Detecting Ephemeral Optical Events with OpTel]] — Congcong Miao(筆頭、[[Tencent]])・[[Arpit Gupta]]([[UC Santa Barbara]])・Zili Meng・Lianjin Ye・Jingyu Xiao・Jilong Wang・Heng Yu([[Tsinghua University]])ほか。Tencentの光バックボーンネットワーク向けテレメトリシステムOpTelを提案。SNMPベースの既存テレメトリはポーリング遅延がインジケータ数・デバイス数に線形増加し秒オーダーの高頻度収集に耐えないという問題を、ベンダー非依存の標準化デバイスモデル(logic model + data model)とpush型テレメトリパイプライン(telemetry manager/agent/cache/aggregator)で解消。収集頻度0.1sでもCPU使用率をSNMPの96%からOpTelの25%に抑制し、1秒粒度データにより既存の15分粒度では検知不能な一過性(ephemeral)光イベントを含め2倍多く検知、トラブルシューティング時間を数分〜数日から数秒〜数十秒に短縮。Tencentの本番光バックボーンで6か月間(2020年7-12月)運用した実績を報告。新規 concept [[光バックボーンネットワークテレメトリ]] を作成し、既存 concept [[テレメトリ]]・[[ネットワーク監視]] に横断的知見を追記。新規 entity [[Congcong Miao]]・[[Arpit Gupta]] を作成、[[Tencent]]・[[Tsinghua University]]・[[UC Santa Barbara]] を更新。図表7点(既存vs.OpTel対比図・OTU logic model・push型パイプライン構成図・伝送損失/Rx電力閾値・CPU使用率比較・収集頻度別検知イベント割合)を埋め込み画像から取得。(paper / source / networking / optical / telemetry)
#### RAIL: A Case for Redundant Arrays of Inexpensive Links in Data Center Networks (NSDI 2017) (2026-08-10)
- [[@2017__NSDI__RAIL - A Case for Redundant Arrays of Inexpensive Links in Data Center Networks]] — [[Danyang Zhuo]](筆頭、[[University of Washington]])・[[Manya Ghobadi|Monia Ghobadi]]・[[Ratul Mahajan]]・[[Amar Phanishayee]]・[[Xuan Kelvin Zou]]([[Microsoft Research]])・[[Hang Guan]]([[Columbia University]])・[[Arvind Krishnamurthy]]・[[Thomas Anderson]]([[University of Washington]])。20データセンター超・30万リンク(60万トランシーバー)を10か月間実測し、99.9%の光リンクがIEEE標準BER 10^-12を満たすのに必要な受信光パワーを上回り、中央値で6倍もの過剰設計状態にあることを示した。この過剰設計を利用してトランシーバー伝送距離仕様を1.6〜4倍「引き伸ばす(stretch)」ことで10Gbpsネットワークで最大10%・40Gbpsネットワークで最大44%のコスト削減を実証。伝送距離引き伸ばしで一部の経路(1〜5%)がグレー化するリスクは、物理トポロジ上に複数の仮想トポロジを構築しアプリケーションの損失耐性に応じて経路を割り当てるシステム RAIL(O(n log n)最悪経路特定アルゴリズム・透過的XOR誤り訂正)で吸収する。既存 concept [[データセンターネットワークトポロジ]]・[[データセンター信頼性]] に横断的知見を追記、新規 concept [[光リンク過剰設計]] を作成。entity [[Ratul Mahajan]]・[[Amar Phanishayee]]・[[Arvind Krishnamurthy]]・[[University of Washington]]・[[Microsoft Research]]・[[Columbia University]] を更新、新規 entity [[Danyang Zhuo]]・[[Manya Ghobadi|Monia Ghobadi]]・[[Xuan Kelvin Zou]]・[[Hang Guan]]・[[Thomas Anderson]] を作成(Danyang Zhuo・Thomas Anderson は同著者陣による関連論文 CorrOpt の並行 ingest により既存)。図表6点(トランシーバー模式図・過剰設計CDF・価格/reach関係・仮想トポロジ概念図・アプリケーション性能結果2枚)を pdf.js 埋め込み画像抽出で取得。(paper / source / networking / datacenter)
#### Understanding and Mitigating Packet Corruption in Data Center Networks (SIGCOMM 2017) (2026-08-10)
- [[@2017__SIGCOMM__Understanding and Mitigating Packet Corruption in Data Center Networks]] — [[Danyang Zhuo]](筆頭、[[University of Washington]])・[[Manya Ghobadi|Monia Ghobadi]]・[[Ratul Mahajan]]([[Microsoft Research]] & Intentionet)・[[Klaus-Tycho Förster]]([[Aalborg University]])・[[Arvind Krishnamurthy]]・[[Thomas Anderson]]([[University of Washington]])。15の本番データセンター・35万本のスイッチ間光リンクを7か月監視し、パケット破損(corruption)による損失が輻輳(congestion)による損失と同水準の規模を持つことを示した最初の大規模研究。破損は輻輳より影響リンク数が少ないが損失率は重く(10^-3以上のリンクが破損12.67% vs 輻輳0.22%)、破損損失率は利用率と無相関(平均ピアソン相関0.19)かつ時間的に安定しているため輻輳制御的な対処は効かない。トラブルチケット300件超と光パワー(RxPower/TxPower)監視の突き合わせから根本原因5種(コネクタ汚染・ケーブル損傷・送信機劣化・トランシーバ不良・共有コンポーネント故障)の症状パターンを確立。緩和システムCorrOptは、容量制約下でのリンク無効化問題がNP-completeであることを3-SAT還元で証明した上で、線形時間の高速チェッカと厳密最適化の2段階アルゴリズムで既存のswitch-local checkingに対し破損損失を3〜6桁削減。根本原因ベースの修復推薦エンジンを70以上のデータセンターに展開し、初回修復成功率を50%から80%へ改善した。既存 concept [[RDMAネットワーク監視]] に「輻輳系監視は破損という質的に異なる障害クラスを見落とす」「光層根本原因診断のRxPower/TxPowerパターンマッチングという共通言語」の横断的知見を追記。entity [[Ratul Mahajan]]・[[Arvind Krishnamurthy]]・[[Manya Ghobadi|Monia Ghobadi]] を更新(Monia Ghobadi は既存の表記ゆれエンティティ [[Manya Ghobadi]] に統合)、新規 entity [[Danyang Zhuo]]・[[Klaus-Tycho Förster]]・[[Thomas Anderson]] を作成(Danyang Zhuo・Thomas Anderson は同著者陣による関連論文 RAIL の並行 ingest とエンティティを共有)。図表7点(破損損失量の全DCN比較・破損vs輻輳の時間安定性・利用率相関散布図・清浄/汚染ファイバ顕微鏡画像・switch-local checkingの準最適性図解・トポロジ剪定図・CorrOptアーキテクチャ図・容量制約別ペナルティ比較)を pdf.js 埋め込み画像抽出で取得。(paper / source / networking / aiops)
#### CanaryAdvisor: A Statistical-Based Tool for Canary Testing (Demo) (ISSTA 2015) (2026-08-11)
- [[@2015__ISSTA__CanaryAdvisor - A Statistical-Based Tool for Canary Testing]] — [[Alexander Tarvo]](筆頭、[[IBM Research]])・Peter F. Sweeney・Nick Mitchell・V. T. Rajan・Matthew Arnold・Ioana Baldini(全員IBM Research)。クラウドベースアプリケーション向け自動カナリアテストツール [[CanaryAdvisor]] を提案するデモ論文。collectd/logstashによるデータ収集→DataAgentによるメトリクス変換→CanaryAdvisor Service (CAS)による非パラメトリック統計仮説検定を用いたメトリクス比較→DecisionMakerによる判定集約→UIによる可視化、という5段階パイプラインを実装。許容誤差係数xと信頼区間幅の臨界値Wcriticalの2パラメータで、ハードウェア/OSの微小バイアスへの頑健性と判定に必要なデータ量のトレードオフを制御する。Daytraderベンチマークへの障害注入(エラー率20%・応答時間30%増)実験でInconclusive→Fail、Inconclusive→Passの状態遷移を実証。非ランダムノイズの識別・除去とグラウンドトゥルース欠如下での精度検証を未解決課題として明記。新規 concept [[カナリアテスト]] を作成、entity [[IBM Research]] を更新、新規 entity [[CanaryAdvisor]]・[[Alexander Tarvo]] を作成。図表4点(アーキテクチャ図・Inconclusive/Fail/Pass状態のUIスクリーンショット3枚)をpdf.jsの埋め込み画像抽出で取得。(paper / source / software-engineering / testing / aiops)
#### Rapid and Robust Impact Assessment of Software Changes in Large Internet-based Services (CoNEXT 2015) (2026-08-11)
- [[@2015__CoNEXT__Rapid and Robust Impact Assessment of Software Changes in Large Internet-based Services]] — [[Shenglin Zhang]](筆頭)・[[Ying Liu]]・[[Dan Pei]]([[Tsinghua University]])、[[Yu Chen (Baidu)]]・[[Xianping Qu]]・Shimin Tao・Zhi Zang([[Baidu]])。大規模インターネットサービスにおけるソフトウェア変更(ソフトウェアアップグレード・設定変更)の影響を迅速・頑健に評価する自動化ツール [[FUNNEL]] を提案。SST(Singular Spectrum Transform)を IKA(Implicit Krylov Approximation)による行列圧縮でロバスト化・高速化した上で、DiD(Difference-in-Differences)法により treated group(変更対象 KPI)と control group(未変更 KPI)の相対的性能変化からソフトウェア変更由来の変化のみを因果的に切り分ける。144件のソフトウェア変更・9982アイテムの評価で精度99.8%超を達成し、CUSUM・MRLS比で検知遅延38.02%〜64.99%短縮・計算速度4.59〜7098倍高速化。Baidu実サービスへの本番展開で precision 98.21%を達成し、ある広告システムのインシデントで検知時間を手動評価の1.5時間から10分未満へ短縮した実績を報告。既存 concept [[変化点検知]] に横断的知見・未解決の問いを追記、entity [[Shenglin Zhang]]・[[Dan Pei]]・[[Xianping Qu]] を更新。図表6点(サービス階層図・FUNNEL設計フローチャート・サービス関係図・検知遅延CCDF・Redisケーススタディ・広告クリック数ケーススタディ)をPyMuPDFのキャプション座標クロップで取得(埋め込み画像は全てベクター図の断片で使用不可のため)。(paper / source / aiops / change-detection / distributed-systems)
#### Canary Analysis Service (acmqueue 2018) (2026-08-11)
- [[@2018__acmqueue__Canary Analysis Service]] — [[Štěpán Davidovič]]([[Google]])が [[Betsy Beyer]] と共著。Google 全社横断の集中型カナリア分析サービス CAS(Canary Analysis Service)の設計・運用報告。Evaluate()/GetResult() の2 RPCのみの単純なAPI、確信度スコアを意図的に返さないPASS/FAIL/NONE判定、オンライン挙動学習によるオートコンフィグレーションで統計知識のないエンジニアでも利用可能にし、1日あたり数十万件の本番変更評価という規模で全社採用を実現。既存 concept [[カナリアテスト]](2015年 IBM CanaryAdvisor 起点)に、独立した2システムが統計判定→少数離散状態という同型設計に収束するという横断的知見を追記。図表2点(CASワークフロー図・CAS主要コンポーネント構成図)をPyMuPDFのキャプション座標クロップで取得(pdf.js埋め込み画像抽出はベクター図の断片のみで実質利用不可だったため)。全27ページ本文を通読。(paper / source / sre / reliability / google)
#### Safe Velocity: A Practical Guide to Software Deployment at Scale using Controlled Rollout (ICSE-SEIP 2019) (2026-08-11)
- [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]] — [[Tong Xia]](筆頭)・[[Sumit Bhardwaj]]・[[Pavel Dmitriev]](Outreach.io、以前 Microsoft 在籍)・[[Aleksander Fabijan]](いずれも [[Microsoft]])。段階的ロールアウト(Dogfood → Internal → Insiders → Production の各リング)の各リング内でオンライン制御実験(A/Bテスト)を実行するハイブリッド手法「制御ロールアウト(controlled rollout, CRL)」を提案。段階的ロールアウト単独の遅さ・代表性の低さ・測定不正確さと、オンライン制御実験単独のリスクの高さ・逐語的フィードバックの少なさを同時に緩和する狙い。二標本t検定の検出力分析(式1・2)に基づきリングごとの最適なロールアウト期間・検出目標Δ%を決定する実務的手法を提示し、データ品質・ガードレール・成功(OEC)・ローカルの4種の指標体系(Table 1)を整理。Microsoft Office での2018年の数百件の制御ロールアウト分析により、Dogfood/Internalリングでは35%がガードレール指標に有意変動(79%が3日以内に検知)、Insiders/Productionリングでは61%がOEC/ローカル指標に有意変動を示し、いずれも伝統的段階的ロールアウトでは検知困難な規模であることを実証。Word for Android のデフォルトビュー変更事例(逐語的フィードバックは好意的だったが実験結果は文書編集ユーザーと閲覧のみユーザーで分かれた)を通じ、制御実験でしか見えない知見を具体的に示した。新規 concept [[制御ロールアウト]] を作成し、既存 concept [[カナリアテスト]] に発見性のための一方向参照を追加。新規 entity [[Tong Xia]]・[[Sumit Bhardwaj]]・[[Pavel Dmitriev]]・[[Aleksander Fabijan]]・[[Outreach.io]] を作成、[[Microsoft]] を更新。図表4点(リング構造図・検出可能変化率とロールアウト期間の関係グラフ・Word Android画面比較・段階的ロールアウトvs制御ロールアウトの指標可視化比較)を埋め込みラスター画像から取得。全10ページ本文+参考文献を通読。(paper / source / software-engineering / deployment / experimentation / aiops)
#### Rapid Regression Detection in Software Deployments through Sequential Testing (KDD 2022) (2026-08-11)
- [[@2022__KDD__Rapid Regression Detection in Software Deployments through Sequential Testing]] — [[Michael Lindon]]・[[Chris Sanden]]・[[Vaché Shirikian]](いずれも [[Netflix]])。カナリアテストの regression 検知に逐次検定(sequential testing)・anytime-valid な confidence sequenceを適用する統計フレームワークを提案。平均値の差ではなく確率的順序(stochastic order)・分布の等価性を検定対象とすることで、平均は変わらないが裾が悪化するケース(PlayDelayの例)も検知範囲に含める。Netflixの既存カナリア分析システム [[Kayenta]] が前提とする固定-$n$統計検定(Mann-Whitney U検定)を開発者が繰り返し適用してしまう「peeking」問題を、Howard and Ramdas の confidence sequenceに基づく逐次$p$値と相補的停止規則で解決する。PlayDelay劣化事例で約65秒、Successful Play Starts減少事例で約11秒での検知を実証し、付録Eのシミュレーションでは固定-$n$検定(Mann-Whitney/Kolmogorov-Smirnov)が継続的モニタリング下で100回中64回・57回の誤検知を生んだのに対し、提案手法は誤検知0回だった。新規 concept [[逐次検定]] を作成し、既存 concept [[カナリアテスト]] に「固定-$n$ vs 逐次検定」という設計軸の横断的知見を追記。新規 entity [[Michael Lindon]]・[[Chris Sanden]]・[[Vaché Shirikian]]・[[Kayenta]] を作成、[[Netflix]] を更新。図表3点(PlayDelay逐次p値の時間推移・SPS逐次p値と累積イベント数・固定-n検定vs逐次検定の型Iエラー比較シミュレーション)をPyMuPDFのキャプション座標クロップで取得(pdf.js埋め込み画像抽出は対象0件のため)。全11ページ本文+付録を通読。(paper / source / software-engineering / testing / aiops / sre)
#### Gandalf: An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure (NSDI 2020) (2026-08-11)
- [[@2020__NSDI__Gandalf - An Intelligent, End-To-End Analytics Service for Safe Deployment in Large-Scale Cloud Infrastructure]] — [[Ze Li]](筆頭)・[[Qian Cheng]]・[[Ken Hsieh]]・[[Yingnong Dang]]([[Microsoft Azure]])、[[Peng Huang]]([[Johns Hopkins University]])、[[Pankaj Singh]]・[[Xinsheng Yang]]([[Microsoft Azure]])、[[Qingwei Lin]]([[Microsoft Research]])、[[Youjiang Wu]]・[[Sebastien Levy]]・[[Murali Chintalapati]]([[Microsoft Azure]])。Microsoft Azure の大規模クラウドインフラにおける安全なデプロイのための end-to-end 分析サービス [[Gandalf]] を提案。コンポーネント個別の watchdog とは異なり、テレメトリシグナルをクラスタ横断で継続監視し、異常検知(Holt-Winters + z-score)→ 相関分析(vote-veto → 空間・時間相関 → 時間減衰)→ 決定プロセス(Gaussian discriminant classifier)の3段階モデルでロールアウトの go/no-go をトップダウンに判定する。ラムダアーキテクチャ(Speed Layer + Batch Layer)により即時障害と latent 障害の両方を捕捉。Azure で18ヶ月以上稼働し、データプレーンで precision 92.4%・recall 100%、コントロールプレーンで precision 94.9%・recall 99.8% を達成。空間相関の導入で correlation precision が77%改善、時間減衰の除去で precision が58.8%低下というアブレーション結果を報告。3件のケーススタディ(cross-component impact・region-specific impact・latent impact)を含む。既存 concept [[変更起因インシデント]]・[[カナリアテスト]] にGandalfとの技術的対比(イベント相関による犯人特定 vs メトリクス統計比較)を横断的知見として追記。新規 entity [[Gandalf]](製品)・[[Qian Cheng]]・[[Ken Hsieh]]・[[Pankaj Singh]]・[[Xinsheng Yang]]・[[Youjiang Wu]]・[[Sebastien Levy]] を作成、既存 entity [[Ze Li]]・[[Yingnong Dang]]・[[Peng Huang]]・[[Qingwei Lin]]・[[Murali Chintalapati]]・[[Johns Hopkins University]]・[[Microsoft Azure]]・[[Microsoft Research]] を更新。図表5点(ロールアウト分類・4層安全機構ピラミッド・システムアーキテクチャ・相関モデル・アブレーション棒グラフ3連)をPyMuPDFのキャプション座標クロップで取得(pdf.js埋め込み画像は表紙装飾のみのため)。全15ページ本文+参考文献を通読。FUNNEL/SCWarn/ChangeRCA/Guardian 等の後続研究で標準的な比較ベースラインとして参照される中核論文。(paper / source / aiops / sre / deployment / change-management)
#### Aegis: Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems (ICSE-SEIP 2023) (2026-08-11)
- [[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]] — Xiaohan Yan(筆頭)・[[Ken Hsieh]]・[[Yasitha Liyanage]]・[[Murali Chintalapati]]([[Microsoft Azure]])、[[Minghua Ma]]・[[Qingwei Lin]]・[[Dongmei Zhang]]([[Microsoft Research]])、[[Yingnong Dang]]([[Microsoft Azure]])。Microsoft Azure control plane(CRP・NRP・RNM・AzSM 等)の component/layer 横断変更影響帰属・緩和サービス [[Aegis (Azure Control Plane)]] を提案。ドメイン知識駆動の相関エンジン(時間的相関×空間的相関×fault-component関連度重み、build レベルでの分布集約による高並行デプロイ耐性、layer射影/分解によるcross-layer相関)と、反実仮想射影モデル(sigmoid関数で未デプロイユニットへの影響を信頼区間として推定)を核とする。2022年1-3月のCRP・RNM・AzSM実デプロイ(60以上のbuild・700以上のdeployment)でprecision・recallともに約80%を達成。Validation Engine除去でprecision 28.6%低下、Signature Weight除去でprecision 37.5%低下・recallほぼ半減というablationで両者の寄与を実証。12ヶ月の本番運用で8000件以上のデプロイに意思決定、RNMのバイナリ欠落バグ(VMSS作成失敗148倍増)・AzSMロールアウトのcross-layer相関(根本原因はAzCPGateway)の2ケーススタディを報告。同じAzureチームの一部(Chintalapati・Ken Hsieh・Qingwei Lin・Yingnong Dang)が開発した component レベル監視 [[Gandalf]](NSDI 2020、本日先行ingest)の後継系譜にあたり、「component レベル→ component/layer 横断」への設計拡張を示す。既存 concept [[変更起因インシデント]]・[[ソフトウェア変更管理]] に横断的知見を追記。新規 entity Xiaohan Yan・[[Yasitha Liyanage]]・[[Aegis (Azure Control Plane)]](製品、Alibaba の同名システム [[Aegis]] と名前が衝突するため disambiguation)を作成、既存 entity [[Ken Hsieh]]・[[Minghua Ma]]・[[Murali Chintalapati]]・[[Qingwei Lin]]・[[Yingnong Dang]]・[[Dongmei Zhang]]・[[Microsoft Azure]]・[[Gandalf]] を更新。図表7点(Azure control planeアーキテクチャ・システム概要・時空間相関・相関スコア分布・cross-layer相関・Impact Evaluation Engineアーキテクチャ・性能評価)をpdf.js埋め込み画像抽出で取得。全12ページ本文+参考文献を通読。(paper / source / aiops / cloud-computing / change-management)
#### Constructing Large-Scale Real-World Benchmark Datasets for AIOps (ESEC/FSE 2022) (2026-08-11)
- [[@2022__ESEC FSE__Constructing Large-Scale Real-World Benchmark Datasets for AIOps]] — [[Zeyan Li]]・[[Nengwen Zhao]]([[Tsinghua University]])・[[Shenglin Zhang]]・[[Yongqian Sun]]([[Nankai University]])・[[Pengfei Chen]]([[Sun Yat-sen University]])・[[Xidao Wen]]([[Tsinghua University]])・[[Minghua Ma]]([[Microsoft Research]])・[[Dan Pei]]([[Tsinghua University]])。AIOps 研究の公開・大規模・実世界データセット不足に対し、著者らが構築・公開してきた 3 データセット(KPI 異常検知 dataset A・多次元根本原因箇所特定 dataset B・障害発見/診断 dataset C)と、2018/2019/2020 年の年次 AIOps アルゴリズムコンペティション(合計 407 チーム参加)を紹介する ESEC/FSE 2022 Industry Track の短編。dataset B(B0〜B4)は [[Squeeze]] 等の後続 RCA 論文で広く再利用される一次データ源。図表 3 点(パイプライン図・KPI 波形例・分散システムアーキテクチャ図)は PyMuPDF キャプション座標クロップで取得。(paper / source / aiops / benchmark / dataset)
#### LEMMA-RCA: A Large Multi-modal Multi-domain Dataset for Root Cause Analysis (arXiv 2024) (2026-08-11)
- [[@2024__arXiv__LEMMA-RCA - A Large Multi-modal Multi-domain Dataset for Root Cause Analysis]] — [[Lecheng Zheng]](筆頭、[[University of Illinois Urbana-Champaign]])・[[Zhengzhang Chen]]([[NEC Laboratories America]])・[[Dongjie Wang]]([[University of Kansas]])・[[Chengyuan Deng]]([[Rutgers University]])・[[Reon Matsuoka]]([[NEC Laboratories Japan]])・[[Haifeng Chen]]([[NEC Laboratories America]])。IT(マイクロサービス2種: Product Review・Cloud Computing)と OT(水処理・水配送2種: SWaT・WADI)にまたがる実障害RCAベンチマークデータセットを公開。6種のRCAベースライン(PC・CIRCA・ε-Diagnosis・RCD・BARO・Nezha)をmetric only/log only/multi-modalityの3設定でPR@K・MAP@K・MRR評価し、Product ReviewでBAROのPR@1がmetric onlyの25%からmulti-modalで75%へ改善する等、モダリティ統合の効果を定量化。既存RCAデータセット(NeZha・PetShop・Sock-Shop・ITOps・Murphy)がpublic性・real fault・large-scale・multi-domain・multi-modalityのいずれかを欠くのに対し、LEMMA-RCAは全条件を満たす初のデータセットと主張(Table 1)。既存 concept [[RCA評価設計]]・[[ドメイン別RCA]]・[[根本原因分析]] に横断的知見を追記。既存 entity [[Zhengzhang Chen]]・[[Haifeng Chen]] を更新、新規 entity [[Lecheng Zheng]]・[[Dongjie Wang]]・[[Chengyuan Deng]]・[[Reon Matsuoka]]・[[University of Kansas]]・[[NEC Laboratories Japan]] を作成。図表7点(Product Reviewアーキテクチャ・ElasticSearchログ例・8障害のKPI可視化・Cryptojackingシナリオ図・External Storage Failureのトポロジ/メトリクス/ログイベントシーケンス)をpdf.js埋め込み画像抽出で取得。全17ページ本文+付録を通読。(paper / source / aiops / rca-benchmark)
#### 詳解 システム・パフォーマンス 第2版(オライリー・ジャパン 2023、Brendan Gregg、全16章)(2026-08-12)
- [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 1 イントロダクション]] 〜 [[@2023__OReillyJapan__詳解 システム・パフォーマンス 第2版 - Chapter 16 ケーススタディ]](全16章) — [[Brendan Gregg]]([[Netflix]])著、西脇靖紘 監訳・長尾高弘 訳。原書 *Systems Performance: Enterprise and the Cloud*, 2nd Edition(Pearson 2021)。書籍ハブ entity は [[詳解 システム・パフォーマンス 第2版]]。導入とメソドロジ(1〜2章)→ システムの構成要素(3〜5章: OS・可観測性ツール・アプリケーション)→ リソース別分析(6〜11章: CPU・メモリ・ファイルシステム・ディスク・ネットワーク・クラウド)→ ベンチマーキングとトレーシングツール(12〜15章: ベンチマーキング・perf・Ftrace・BPF)→ 実務ケーススタディ(16章)という構成。第2版で主対象が Solaris/DTrace から Linux/拡張BPF へ移り、[[perf]]・[[Ftrace]]・[[BCC]]/[[bpftrace]] の専用3章が加わった。新規 concept 37件([[USE メソッド]]・[[待ち行列理論]]・[[フレームグラフ]]・[[レイテンシ分析]]・[[ドリルダウン分析]]・[[ベンチマーキング]] ほか)、新規 entity 7件([[perf]]・[[Ftrace]]・[[trace-cmd]]・[[perf-tools]]・[[KernelShark]]・[[Steven Rostedt]]・[[Alastair Robertson]])を作成。図表166点をPyMuPDFのキャプション座標クロップで取得し本文該当箇所に埋め込み(940ページのため全ページレンダリングは不使用)。著作権対応で全章 `publish: false`。(book / source / performance / systems / observability)
#### Observability Engineering, 2nd Edition(O'Reilly 2026、Charity Majors ほか、全32章)(2026-08-12)
- [[@2026__OReilly__Observability Engineering 2E - Chapter 1 What Is Observability?]] 〜 [[@2026__OReilly__Observability Engineering 2E - Chapter 32 Where Do We Go From Here?]](全32章) — [[Charity Majors]]・[[Liz Fong-Jones]]・[[George Miranda]]・[[Austin Parker]] 著([[Honeycomb.io]])。書籍ハブ entity は [[Observability Engineering 2nd Edition]]。基礎概念(Part I: 1〜3章)→ 計装(Part II: 4〜7章)→ 分析ワークフロー(Part III: 8〜12章)→ 技術的深掘り(Part IV: 13〜17章)→ ユースケース(Part V: 18〜22章)→ ガバナンス(Part VI: 23〜31章)→ 結論(32章)という6部構成。中心的主張は、オブザーバビリティをツールの分類ではなく**ディペンダビリティを構成する属性**として捉え直し、**構造化イベント(ワイドイベント)を唯一の下部構造**としてメトリクス・ログ・トレースをそこからの導出物とする点にある。第2版はゲスト寄稿者13名を迎え、ストレージエンジン内部([[Retriever]]・[[ClickHouse]])、モバイル、LLM、CI/CD、組織変革を各分野の実務者が担当する。新規 concept 14件([[構造化イベント]]・[[テレメトリパイプライン]]・[[オブザーバビリティ駆動開発]]・[[ユーザー中心オブザーバビリティ]]・[[モバイルオブザーバビリティ]]・[[ソシオテクニカル負債]]・[[Build Versus Buy]]・[[ベンダーエンジニアリング]]・[[レバレッジポイント]]・[[AIサンドイッチアーキテクチャ]]・[[コードのキャッシュ化]]・[[CI-CDオブザーバビリティ]]・[[フィーチャーフラグ]]・[[ストラングラーフィグ]])、新規 entity 43件([[Charity Majors]]・[[Austin Parker]]・[[George Miranda]]・[[Retriever]]・[[Bindplane]]・[[Fin]]・[[Intercom]]・[[Rudolf E. Kálmán]] ほか)を作成。図表95点を O'Reilly の資産 URL から取得し本文該当箇所に埋め込み。第27章のみ他章より遅れて原本が揃い、増分で追加した。著作権対応で全章 `publish: false`。(book / source / observability / opentelemetry / slo)
#### SREをはじめよう(オライリー・ジャパン 2024、David N. Blank-Edelman、全18章+付録A・B)(2026-08-13)
- [[@2024__OReillyJapan__SREをはじめよう - Chapter 1 はじめに]] 〜 [[@2024__OReillyJapan__SREをはじめよう - Appendix B 元SREからのアドバイス]](全20枚) — [[David N. Blank-Edelman]] 著、山口能迪 訳。原書 *Becoming SRE*(O'Reilly 2024)。書籍ハブ entity は [[SREをはじめよう]]。SRE入門(第Ⅰ部 1〜4章)→ 個人がSREをはじめるには(第Ⅱ部 5〜10章)→ 組織がSREをはじめるには(第Ⅲ部 11〜18章)→ 寄稿集(付録A・B)という構成。SRE を仕組みではなく心構えとして定義する立場(第2章)を基点に、同じ論点を個人視点と組織視点で二度扱う。新規 concept 4件([[SREの心構え]]・[[SRE文化]]・[[SREの提唱]]・[[NALSD]])、新規 entity 13件([[SREをはじめよう]]・[[David N. Blank-Edelman]]・[[Mikey Dickerson]]・[[Benjamin Purgason]]・[[Vivek Rau]]・[[Ben Lutch]]・[[Dave Rensin]]・[[John Reese]]・[[Joseph Bironas]]・[[Dina Levitan]]・[[Sara Smollett]]・[[Andrew Fong]]・[[Scott MacFiggen]])を作成。図は原本に3点のみで、PyMuPDF クロップにより本文該当箇所へ埋め込み。著作権対応で全20枚 `publish: false`。(book / source / sre / reliability / organization)
#### Designing Data-Intensive Applications, 2nd Edition(O'Reilly 2026、Martin Kleppmann・Chris Riccomini、全14章)(2026-08-13)
- [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 1 Trade-Offs in Data Systems Architecture]] 〜 [[@2026__OReilly__Designing Data-Intensive Applications 2E - Chapter 14 Doing the Right Thing]](全14章) — [[Martin Kleppmann]]・[[Chris Riccomini]] 著。原書副題 *The Big Ideas Behind Reliable, Scalable, and Maintainable Systems*。書籍ハブ entity は [[Designing Data-Intensive Applications 2nd Edition]]。初版(2017)から9年ぶりの全面改訂で、目次から Part 分割が消え14章がフラットに並ぶ。語彙と非機能要求(1〜2章)→ データモデルとストレージ(3〜5章)→ レプリケーションとシャーディング(6〜7章)→ トランザクション・分散システムの困難・合意(8〜10章)→ バッチとストリームによる導出データ(11〜13章)→ 倫理(14章)という読み筋を持つ。中心にあるのは「最良の解は存在せずトレードオフだけがある」という立場と、**記録系(system of record)と導出データ(derived data)の区別**であり、後者は第13章の「全順序ログを介したデータ統合」とデータベースのアンバンドリング構想へ収束する。新規 concept 47件([[ACIDと分離レベル]]・[[直列化可能性]]・[[スナップショット分離とMVCC]]・[[線形化可能性]]・[[部分故障]]・[[ビザンチン障害]]・[[システムモデルと安全性・活性]]・[[単一リーダーレプリケーション]]・[[マルチリーダーレプリケーション]]・[[リーダーレスレプリケーション]]・[[MapReduce]]・[[データフローエンジン]]・[[変更データキャプチャ(CDC)]]・[[データベースのアンバンドリング]]・[[エンドツーエンド論]] ほか)、新規 entity 14件([[Designing Data-Intensive Applications 2nd Edition]]・[[Martin Kleppmann]]・[[Chris Riccomini]]・[[PostgreSQL]]・[[Neo4j]]・[[Riak]]・[[Lucene]]・[[ZooKeeper]]・[[etcd]]・[[Debezium]]・[[Apache Spark]]・[[Apache Flink]]・[[Apache Avro]]・[[Temporal]])を作成。図表100点を O'Reilly の資産 URL から取得し本文該当箇所に埋め込み(原本クリップは第9章の Figure 9-3・第10章の Figure 10-9 を欠き、一部の alt text が別の図の説明と取り違えられていたため実画像を確認して対応づけた)。著作権対応で全14章 `publish: false`。(book / source / database / distributed-systems)
#### Vistara: Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment(ISCA 2026、Neha Gholkar ほか、Meta Platforms)(2026-08-13)
- [[@2026__ISCA__Vistara - Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment]] — [[Neha Gholkar]](筆頭)ほか13名([[Meta]] Platforms、[[Chunqiang Tang]] を含む)。自社設計CXLメモリエキスパンダASIC「[[Vistara]]」のハードウェア(CXL 2.0/1.1準拠、アイドルレイテンシ約50ns、消費電力約9W)、LinuxカーネルのTPP/TMOベース階層化ソフトウェアスタック、数百万台規模フリートへの本番展開を一気通貫で報告した、業界初のエンドツーエンドCXL実運用エビデンス。自社フリートの約40%がメモリ容量律速という課題背景から、廃止サーバのDDR4 DIMM再利用によるコスト・炭素排出削減効果を主眼に置く。分散キャッシュで平均レイテンシ29%削減、分散ML推論でサーバ台数最大25%削減、Spark executor数33%増加などの本番改善を実証し、先行研究([19]・[44])が報告したCXLのテールレイテンシ不安定性・TPPオーバーヘッド懸念の双方を実測データで反証した。knee-of-the-curve分析ではホットフットプリント75%超で性能劣化が始まることを示すが、評価した全本番ワークロードはこの閾値を大きく下回る安定領域で稼働している。新規 concept [[CXLによるメモリ拡張]] を作成し、既存 concept [[NUMAメモリ配置]] にCPUレスNUMAノードとしてのCXLに関する横断的知見を追記。新規 entity [[Neha Gholkar]]・[[Vistara]] を作成、既存 entity [[Meta]]・[[Chunqiang Tang]]・[[AMD]] を更新。図表13点(Fig.1〜13、うち埋め込みラスター画像0件のためPyMuPDFキャプション座標クロップで全件取得)・表10点(Table I〜X、Markdown転記)を本文該当箇所に埋め込み。全15ページ本文+参考文献45件を通読。(paper / source / systems / hardware-architecture / datacenter / cxl / memory-tiering)
#### MEGATRACE: Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters(ICDCS 2026、Fangzheng Jiao ほか、Beihang University・Infrawaves)(2026-08-13)
- [[@2026__ICDCS__MEGATRACE - Troubleshooting Hang and Slowdown in Large-scale LLM Training Clusters]] — [[Fangzheng Jiao]](筆頭)・[[Menghao Zhang]]・[[Bolin Chen]]・[[Jiaxun Huang]]・[[Yanmin Jia]]・[[Xiaohe Hu]]・[[Bohua Xu]]・[[Bowen Han]]・[[Chunming Hu]]([[Beihang University]]・[[Infrawaves]]・[[China Unicom Software Research Institute]]・[[Nanyang Technological University]])。LLM 訓練クラスタのハング・スローダウンという痕跡を残さないサイレント障害を、NCCL 集合通信 API 呼び出し(計算の narrow waist)と RDMA Work Request(通信の narrow waist)という 2 点のみの計装で、いつ・どのランク・どの実行ステージかまで一貫して特定する軽量フレームワーク。訓練スケジュール(TP/PP/DP)から反復ごとの依存 DAG を決定論的に再構築し、クリティカルパス分析でパイプラインバブルに吸収される偽陽性を除去する。ハング検知 F1=1.00(100% precision)、スローダウン検知 F1=0.95(既存 SOTA である [[Holmes]] 0.93・[[Minder]] 0.89・[[MegaScale]] 0.84 を上回る、既存比 29.44% 改善)、プロファイリングオーバーヘッド 0.16%。[[Infrawaves]] の本番 2 クラスタでのケーススタディ(3840-GPU タスクでの `Recv` 欠落によるハング、256-GPU Docker 環境での CPU 割り当て不足)を報告する。同じ研究グループの Vedrfolnir(SIGCOMM Posters 2025)と同じ国家自然科学基金(No.62402025)の支援を受けた継続研究。新規 entity [[MEGATRACE]](製品)・[[Bolin Chen]]・[[Jiaxun Huang]]・[[Yanmin Jia]]・[[Xiaohe Hu]]・[[Bohua Xu]]・[[Bowen Han]] を作成。既存 entity [[Fangzheng Jiao]]・[[Menghao Zhang]]・[[Chunming Hu]]・[[Infrawaves]]・[[Beihang University]]・[[China Unicom Software Research Institute]]・[[Nanyang Technological University]]・[[MegaScale]]・[[Minder]]・[[Holmes]]・[[GreyHound]]・[[C4]]・[[Aegis]]・[[Megatron-LM]]・[[NCCL]] を更新。既存 concept [[LLM学習モニタリング]]・[[クリティカルパス分析]] に横断的知見を追記。図表13点(Fig.1〜13、埋め込みラスター1点+PyMuPDFキャプション座標クロップ12点)・表1点(Table I、Markdown転記)を本文該当箇所に埋め込み。全11ページ本文+参考文献36件を通読。(paper / source / distributed / aiops / llm-training)
#### Agentic Workflows are Serverless Applications, so deploy them that way!(位置づけ不明の position paper、Ian Dougherty ほか、University of British Columbia・Technical University of Munich)(2026-08-13)
- [[@2026__Unknown__Agentic Workflows are Serverless Applications, so deploy them that way!]] — [[Ian Dougherty]](筆頭)・[[Natalie Lambert]]・[[Joshua Wang]]・[[Ethan Xu]]・[[Reto Achermann]]([[TU Munich]])・[[Alexandra Fedorova]](責任著者、[[University of British Columbia]])。サーバーレス LLM ホスティングの現状調査(ServerlessLLM・HydraServe・Medusa・CORTEX・HELIUM 等)と、エージェント型 AI ワークロードのサーバーレス適合性に関する実測分析を組み合わせた position paper。Static RAG Agent・Mini SWE Agent・GPT-Researcher の3代表アーキタイプに対する A100 GPU 単一ノード実測(CPU・メモリ・ネットワーク・GPU トレース)で、エージェントワークフローが明確なステージ構造とアイドル期間(GPU VRAM が推論非実行中も解放されない等)を持つことを示した。モデル初期化コスト内訳の実測では gpt-oss-20b の要約タスクで合計37.34秒中29.21秒(78%)が推論エンジン初期化に費やされ実推論はわずか11.5%にとどまることを定量化。エージェントを Control Flow Graph としてモジュール化デプロイする Modular Serverless Agent System Design を提案し、Small Language Models の co-design・ワークフローグラフフレームワーク・ツールサンドボックス(CRIU/Firecracker 応用)の状態永続化という4研究方向を示す。発表媒体・DOI は web 検索で特定できず不明。新規 entity 8件([[Ian Dougherty]]・[[Natalie Lambert]]・[[Joshua Wang]]・[[Ethan Xu]]・[[Reto Achermann]]・[[Alexandra Fedorova]])を作成、既存 entity 2件([[University of British Columbia]]・[[TU Munich]])を更新。既存 concept 5件([[サーバーレスアーキテクチャ]]・[[サーバーレスワークフロー]]・[[LLMサービング管理]]・[[KVキャッシュ管理]]・[[モデルスケーリング高速化]])に横断的知見を追記。図表6点(Figure 1〜6)を全件本文該当箇所に埋め込み。うち Figure 1・5・6 の掲載3ページはテキストレイヤーを持たない全ページラスター画像として埋め込まれておりテキスト抽出が完全失敗、該当ページ本文(§2.3・§3後半・§4冒頭)を画像目視で手動書き起こし。全11ページ本文+参考文献56件を通読。(paper / source / serverless / llm-serving / agent / cold-start)
#### Six Dimensions of Benchmarking Time-Series Databases(EDBT '27 採録原稿、Jalal Mostafa・Sandro Melissano ほか、Karlsruhe Institute of Technology)(2026-08-13)
- [[@2026__arXiv__Six Dimensions of Benchmarking Time-Series Databases]] — [[Jalal Mostafa]]・[[Sandro Melissano]](共同筆頭著者)・Nicholas Tan Jerome・Suren Chilingaryan・Andreas Kopmann([[Karlsruhe Institute of Technology]])。時系列データベース(TSDB)ベンチマーク SciTSv2 を提案する論文。前身 SciTS(SSDBM 2022)の接続並列性・バッチ取り込み・システムメトリクスの3次元に、時系列規則性(等間隔性、新規次元)・多変量系列・混合ワークロードを追加し、既存ベンチマーク(YCSB-TS・SmartBench・IoTDB-Benchmark・TS-Benchmark・TSM-Bench・TSBS)のいずれも実装していない6次元統一を実現した。InfluxDB(TSMツリー)・TimescaleDB(PostgreSQL拡張)・ClickHouse(カラムOLAP)・DataLayerTS(正則時系列特化ベクターストア)の4TSDBを評価し、正則時系列でClickHouseの取り込みレートがむしろ低下する反直感的な結果、DataLayerTSの最大178 MB/s取り込み・サブミリ秒クエリと小バッチでの1 MB/s未満への崩壊、InfluxDBの多変量クエリ(Q1-B)での指数的レイテンシ増加(1変数1.35 ms→24変数698.3 ms)を実証した。新規 entity 6件([[InfluxDB]]・[[TimescaleDB]]・[[DataLayerTS]]・[[Karlsruhe Institute of Technology]]・[[Jalal Mostafa]]・[[Sandro Melissano]])を作成、既存 entity 1件([[ClickHouse]])を更新。既存 concept 2件([[時系列データベースベンチマーク]]・[[時系列データベース]])に横断的知見を追記。図表10点(Figure 1〜10、うち埋め込みラスター画像0件のためPyMuPDFキャプション座標クロップで全件取得)・表2点(Table 1・2、Markdown表へ忠実に転記)を本文該当箇所に埋め込み。全11ページ本文+参考文献26件を通読。(paper / source / database / time-series / benchmark)
#### TS-Benchmark: A Benchmark for Time Series Databases(ICDE 2021、Yuanzhe Hao ほか、Renmin University of China)(2026-08-13)
- [[@2021__ICDE__TS-Benchmark - A Benchmark for Time Series Databases]] — [[Yuanzhe Hao]](筆頭)・Xiongpai Qin・[[Yueguo Chen]](責任著者)・Yaru Li・Xiaoguang Sun・Yu Tao・Xiao Zhang・Xiaoyong Du([[Renmin University of China]])。風力発電ウィンドファーム監視シナリオに基づき、データロード(バッチ)・データ注入(連続ストリーミング)・データフェッチ(6種の典型クエリ)の3ワークロードを分離して測定する時系列データベース(TSDB)ベンチマーク。既存TSDBベンチマーク(IoTAbench・Linear Road・InfluxDB-comparison・Time Series Benchmark Suite)が複合分析クエリに偏重しデータ注入性能を軽視していた問題に対処する。DCGAN(Deep Convolutional GAN)による合成フラグメント生成 + 類似度に基づく有向グラフ構築 + ランダムウォークによる連続時系列生成というデータ生成モデルを提案し、InfluxDB V1.7・TimescaleDB V1.2.1・Druid V0.13・OpenTSDB V2.3の4TSDBをシングルノード構成で比較評価した。InfluxDBはTSMツリーにより書き込み・読み取り両面で高性能(注入飽和時CPU使用率ほぼ100%)、TimescaleDBは適応的タイムチャンクにより高並行性下の書き込みスループットが最高、Druidはカラム型ストレージ+ビットマップインデックスでフィルタ付きクエリ最速だがtranquilityによる書き込みが最下位、OpenTSDBは小規模データでのみ高スループットだが284.5GBデータのロードに失敗、という4者4様のトレードオフを実証した。TSM-Bench(PVLDB 2023、参考文献[68])が比較対象とする「TS-Graph」の原論文であることが判明し、時系列データ生成の系譜で先行研究として位置づけられる。新規 entity 3件([[Druid]]・[[Yuanzhe Hao]]・[[Yueguo Chen]])を作成、既存 entity 4件([[InfluxDB]]・[[TimescaleDB]]・[[OpenTSDB]]・[[Renmin University of China]])を更新。既存 concept 2件([[時系列データベースベンチマーク]]・[[時系列データ生成]])に横断的知見を追記。図表11点(Fig.1〜11、うち埋め込みラスター画像は装飾用アイコン3点のみのためPyMuPDFキャプション座標クロップで主要パネルを取得)・表6点(Table I〜VI、Markdown表へ忠実に転記)を本文該当箇所に埋め込み。全7ページ本文+参考文献41件を通読。(paper / source / database / time-series / benchmark / data-generation)
#### Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems(ACM TOCS 2026、Gen Dong・Yu Hua ほか、Huazhong University of Science and Technology・Purdue University)(2026-08-13)
- [[@2026__TOCS__Fail-Slow Hardware Failure Bug Analysis and Detection for Cloud Systems]] — [[Gen Dong]](筆頭)・[[Yu Hua]](責任著者)・[[Zhangyu Chen]]・[[Menglei Chen]]([[Huazhong University of Science and Technology]])・[[Yongle Zhang]]([[Purdue University]])。ACM Trans. Comput. Syst. 2026(DOI: 10.1145/3838187)。USENIX ATC 2025 論文「Understanding and Detecting Fail-Slow Hardware Failure Bugs in Cloud Systems」の招待拡張版で、例外注入・データ破損チェッカ・エージェントによる障害検証・タイムアウト値収集とメモリアクセス追跡の実装詳細・評価拡張を追加。ZooKeeper・HDFS・HBase・MapReduce・Cassandra の実世界フェイルスローハードウェア(FSH)障害 48 件を JIRA から収集して分析し、(1) 全件が同期機構とタイムアウト機構の脆弱性に起因すること、(2) 障害の細粒度性が発現の必要条件であることを示した。この 2 点を枝刈り基準として、同期・タイムアウト保護された I/O 操作だけを候補障害点とする障害注入テストフレームワーク [[Sieve]](Java 約8,100 SLOC、Soot による静的解析 + Javassist によるバイトコード計装)を提案。ZooKeeper 3.9.0・Kafka 3.6.0・HDFS 3.3.6 に各2000テスト実行を適用し、未知バグ 6 件(ZK-4816・ZK-4817・ZK-4844・ZK-4836・KAFKA-16401・KAFKA-16412、うち 2 件が開発者確認済み)と既知バグ 1 件を検出。研究対象 48 件中 36 件を再現した。新規 entity 8件([[Gen Dong]]・[[Yu Hua]]・[[Yongle Zhang]]・[[Zhangyu Chen]]・[[Menglei Chen]]・[[Sieve]]・[[HDFS]]・[[Apache HBase]])を作成、既存 entity 5件([[ZooKeeper]]・[[Apache Kafka]]・[[Apache Cassandra]]・[[Huazhong University of Science and Technology]]・[[Purdue University]])を更新。新規 concept 1件([[フェイルスローハードウェア]])を作成、既存 concept 4件([[障害注入]]・[[遅延注入]]・[[グレイ障害]]・[[部分故障]])に横断的知見を追記。図表 Figure 1〜9 の全9点を PyMuPDF キャプション座標クロップで取得して本文該当箇所に埋め込み、Table 1〜13 を Markdown 表へ転記(Table 12・13 は 1 表に統合、付録限定の Table 14 は除外)。全33ページ本文+参考文献78件を通読。(paper / source / distributed / fault-tolerance / fault-injection)
#### OpsLLM: Construction of Large Language Model for Software Operations with Multi-stage Learning(arXiv 2026、Jingkai He・Pengfei Chen ほか、Sun Yat-sen University・Alibaba Cloud)(2026-08-13)
- [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]] — [[Jingkai He]](筆頭)・[[Pengfei Chen]](責任著者、[[Sun Yat-sen University]])・[[Chenghui Wu]]・[[Shuang Liang]]・[[Ye Li]]・[[Gou Tan]]・[[Xidao Wen]]・[[Chuanfu Zhang]]・[[Fang Situ]]・[[Qi Zhou]]([[Alibaba Cloud]] Computing、杭州)。知識ベース QA と根本原因分析(RCA)を統合的にサポートするソフトウェア運用ドメイン特化 LLM「OpsLLM」の構築ワークフローを提案する論文。データ構築フェーズでは、観測性データ由来(Chaos Mesh による Online Boutique への障害注入 + reflection-and-verification による RCA サンプル生成、596件)とテキスト運用知識由来(4ソースから 14,431件)の 15K ファインチューニングデータセットを Human-in-the-Loop(Cohen's κ = 0.89、反復ルール改善)で構築する。事後訓練フェーズでは LoRA による SFT の後、5ルーブリックのドメインプロセス報酬モデル(DPRM、人間専門家とのスピアマン相関 0.88)を用いた段階ゲート型 GRPO 強化学習(Verl 上で実装)で RCA の最終回答精度と推論過程の信頼性を同時に最適化する。評価フェーズでは ROUGE-L/BERTScore のような類似度ベース評価がスケーリング則と矛盾する順位を出す問題(Fig. 2)に対し、多肢選択式(MCQ)への変換で客観的評価を実現した。7B/14B/32B の3スケールで既存 LLM を QA タスクで 0.2%〜11.9%、RCA タスクで 8.5%〜70.3% 上回り、Train Ticket への zero-shot 転移(OpsLLM-14B、32%)でも改善が持続することを示した。新規 entity 8件([[OpsLLM]]・[[Jingkai He]]・[[Chenghui Wu]]・[[Shuang Liang]]・[[Ye Li]]・[[Chuanfu Zhang]]・[[Fang Situ]]・[[Qi Zhou]])を作成、既存 entity 7件([[Pengfei Chen]]・[[Gou Tan]]・[[Xidao Wen]]・[[Sun Yat-sen University]]・[[Alibaba Cloud]]・[[GRPO]]・[[VeRL]])を更新。既存 concept 4件([[LLMによる根本原因分析]]・[[検証可能報酬による強化学習]]・[[障害注入]]・[[報酬ハッキング]])に横断的知見を追記。図表8点(Figure 1〜8、全て埋め込みラスター画像として取得)・表2点(Table I・II、Markdown転記)を本文該当箇所に埋め込み。全12ページ本文+参考文献56件を通読。(paper / source / aiops / llm / rca / reinforcement-learning)
#### Representation-Aware Root Cause Analysis with Large Language Models (Position Paper)(ICPE Companion '26、Yiwei Wen ほか、Concordia University・University of Ottawa)(2026-08-13)
- [[@2026__ICPE Companion__Representation-Aware Root Cause Analysis with Large Language Models (Position Paper)]] — [[Yiwei Wen]](筆頭、[[Concordia University]])・[[Mahsa Panahandeh]]([[University of Ottawa]])・[[Moataz Chouchen]]・[[Abdelwahab Hamou-Lhadj]]([[Concordia University]])。LLM ベース根本原因分析(RCA)における観測性データの表現設計を、粒度(trace-level vs invocation-level)・モダリティ(traces-only vs +metrics)・明示性(生の数値 vs 暗黙的異常指標)・summarization という4軸で探索的に評価した position paper。Train-Ticket ベンチマーク(Li et al. 2021 データセット、41マイクロサービス、20万件超のトレース)上で Google Gemini 1.5 を用い、invocation-level 集約(同一呼び出しパスの統計量への集約)が平均入力トークンを最大2桁削減しつつ Top-5 精度を同等以上に保つこと、暗黙的異常指標(support・confidence)が生メトリクスより一貫して精度を改善すること、summarization を加えた invocation-level 表現が本研究最良のコスト精度トレードオフ(Top5 81.2%・最小トークン量)を達成することを示した。一方で最良の LLM 設定(Top1 54.5%)は非LLM手法 TraceRCA(Li et al. 2021)の参考値(Top1 64.8%)には及ばなかった。新規 entity 5件([[Yiwei Wen]]・[[Mahsa Panahandeh]]・[[Moataz Chouchen]]・[[Abdelwahab Hamou-Lhadj]]・[[University of Ottawa]])を作成、既存 entity 2件([[Concordia University]]・[[Train-Ticket]])を更新。既存 concept 3件([[LLMによる根本原因分析]]・[[RCA入力選別]]・[[仮説駆動RCA]])に横断的知見を追記。図表1点(Figure 1、埋め込みラスター画像)を本文該当箇所に埋め込み、Table 1〜3 を Markdown 表へ忠実に転記。全7ページ本文+参考文献21件を通読。(paper / source / aiops / rca / llm / microservice)
#### SLO サービスレベル目標(オライリー・ジャパン 2023、Alex Hidalgo、全17章+付録A・B)(2026-08-13)
- [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 1 信頼性スタック]] 〜 [[@2023__OReillyJapan__SLO サービスレベル目標 - Appendix B 9章の証明]](全19枚) — [[Alex Hidalgo]] 著、山口能迪 監訳、山口能迪・成田昇司 訳。原書 *Implementing Service Level Objectives: A Practical Guide to SLIs, SLOs, and Error Budgets*(O'Reilly 2020)。書籍ハブ entity は [[SLO サービスレベル目標]]。SLOの開発(第I部 1〜5章)→ SLOの実装(第II部 6〜12章)→ SLOの文化(第III部 13〜17章)→ 付録A・B という構成。[[SRE Book]] が一章で扱った SLI・SLO・エラーバジェットを一冊分の主題へ展開し、目標値選定の統計的手法(4・9章)・SLOを前提とした設計(10章)・データサービスへの拡張(11章)・組織文化としての定着(第III部)という4方向へ踏み込む。章ごとに寄稿者が執筆する構成で、7章 [[Benjamin H. Sigelman]]・8章 [[Niall Murphy]]・9章 [[Toby Burress]]/[[Jaime Woo]]・10章 Salim Virji・11章 [[Polina Giralt]]/[[Blake Bisset]]・13章 [[Harold Treen]]・16章 [[Daria Barteneva]]/[[Eva Parish]] が担当する。新規 concept 4件([[信頼性スタック]]・[[意味のあるSLI設計]]・[[SLO目標値の選定]]・[[ベイズ推定]])、新規 entity 8件([[SLO サービスレベル目標]]・[[Toby Burress]]・[[Polina Giralt]]・[[Blake Bisset]]・[[Harold Treen]]・[[Matt LeMay]]・[[Isobel Redelmeier]]・[[Eva Parish]])を作成。図表48点を PyMuPDF で取得(大半がベクター描画で `get_images()` が空を返すため `get_drawings()` の外枠矩形からクロップ、17章と15章のみ埋め込みラスター画像)、432ページのため全ページレンダリングは不使用。9章は本書で最も図が多く、参照32点のうちほぼ同一構図の反復8点を代表点へ統合して24点を埋め込んだ。著作権対応で全19枚 `publish: false`。(book / source / sre / slo / reliability)
#### SADE: Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting(arXiv 2026、Kuan-Hao Tseng ほか、University of Sydney・University of New South Wales)(2026-08-13)
- [[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]] — [[Kuan-Hao Tseng]](筆頭)・[[Niruth Bogahawatta]]・[[Yasod Ginige]]・[[Kosta Dekic]]([[University of Sydney]])・[[Arunan Sivanathan]]([[University of New South Wales]])・[[Suranga Seneviratne]](責任著者、[[University of Sydney]])。Cisco の古典的な階層的トラブルシューティング方法論を LLM エージェントの明示的ポリシーとして符号化した、ネットワーク故障診断エージェント [[SADE]] を提案する論文。初期スキャン→深層ネットワークスキャン(L2/インフラ→制御プレーン→ホストローカル→サービスの4フェーズ)→症状-故障ファミリ対応付け→スキル駆動の故障検知・箇所特定という4段階のフェーズゲート型ワークフローで、証拠取得と仮説確定を明示的に分離する。故障ファミリごとの専門知識は 15 の Claude Skills(SKILL.md)として外在化され、Fault-Index による動的な症状ルーティングと Phase 3 の stop-and-submit ルールで探索の暴走を防ぐ。公開 [[NIKA]] ベンチマークの held-out 523 インシデントで、SADE は RCA F1 0.77・検知精度 0.85 を達成し、ReAct + GPT-5(F1 0.40)と同一 Claude Sonnet 4.6 バックボーンの Claude Code ベースライン(F1 0.55)の両方を上回る。同一バックボーン比較により F1 差 22 ポイントを診断ポリシー自体に帰属させ、性能向上がモデル性能ではなくワークフロー設計に由来することを示した。クロススタック故障(`bgp_acl_block`・`dns_port_blocked`)・大規模トポロジ(平均約101ノード)への耐性・未提出率 4.2%(ベースライン比最大3.6倍改善)・ツール呼び出し効率(正解提出あたり27.2回)を実証。新規 entity 8件([[Kuan-Hao Tseng]]・[[Niruth Bogahawatta]]・[[Yasod Ginige]]・[[Kosta Dekic]]・[[Arunan Sivanathan]]・[[Suranga Seneviratne]]・[[SADE]]・[[NIKA]])を作成、既存 entity 2件([[University of Sydney]]・[[University of New South Wales]])を更新。新規 concept 1件([[エージェント型ネットワーク障害診断]])を作成、既存 concept 3件([[仮説駆動RCA]]・[[Flexible Skill Arrangement]]・[[Fault Localization]])に横断的知見を追記。図表6点(Figure 1〜6、うち埋め込みラスター画像3点+PyMuPDFキャプション座標クロップ3点)・表8点(Table I〜VIII、Table III/VIIは同一事例のため統合、Markdown表へ転記)を本文該当箇所に埋め込み。全12ページ本文+参考文献33件を通読。(paper / source / networking / aiops / agentic-sre / rca)
#### EventADL: Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems(ACM FSE 2026、Luan Pham ほか、RMIT University・Amazon Web Services)(2026-08-13)
- [[@2026__ACM FSE__EventADL - Open-Box Anomaly Detection and Localization Framework for Events in Cloud-Based Service Systems]] — [[Luan Pham]](筆頭、[[RMIT University]])・[[Victor Nicolet]]・[[Joey Dodds]]・[[Hui Guan]]・[[Daniel Kroening]](いずれも[[Amazon Web Services]])。Luan Pham の Amazon インターンシップ中の研究。クラウド監査イベント(アクター・操作・リソース・時刻の構造化レコード)を対象とした初のオープンボックス異常検知・根本原因箇所特定(ADL)フレームワーク。520件の実インシデント分析で、異常が Event Type(21%)・Event Value(68%)・Event Frequency(67%)の3次元に現れ、根本原因の68%が複数介入(intervention)にまたがることを定量化。ルールベースの Event Semantic Pattern(ESP、jsonLogicスキーマの意味パターン、学習にHyGLADを使用)と、Matrix Profileを離散イベント頻度時系列に初めて適応させた大きさ(magnitude)重視のEvent Frequency Pattern(EFP、分布非依存の仮説検定)という2種の解釈可能なパターンで異常を検知し、アクター・操作・リソースから直接構築されるIntervention Graph上のtime-aware random walkで根本原因を箇所特定する。5データセット(Falcon・Flask・Live・OUT・AVA)で異常検知14種・箇所特定10種のベースラインを一貫して上回り、異常検知F1スコア90%以上・箇所特定AC@3スコア100%を達成。EFPコンポーネント単体はメトリクス・ログ・トレース(Eadro・GAIA・AIOps21)にも汎化する。新規 entity 4件([[Victor Nicolet]]・[[Joey Dodds]]・[[Hui Guan]]・[[Daniel Kroening]])を作成、既存 entity 3件([[Luan Pham]]・[[RMIT University]]・[[Amazon Web Services]])を更新。既存 concept 2件([[異常検知]]・[[グラフベースRCA]])に横断的知見を追記。図表8点(Figure 1〜8)のうち6点(Figure 2・3・5・6・7・8)をPyMuPDFキャプション座標クロップで取得・埋め込み、2点(Figure 1・4、jsonLogic/JSON例)はコードブロックとして転記。Table 1〜5をMarkdown表へ抜粋転記。全24ページ本文+参考文献70件を通読。(paper / source / aiops / anomaly-detection / root-cause-localization / cloud)
#### A Network Arena for Benchmarking AI Agents on Network Troubleshooting(arXiv 2025、Zhihao Wang ほか、University of Electronic Science and Technology of China・KAUST・Politecnico di Torino)(2026-08-13)
- [[@2025__arXiv__A Network Arena for Benchmarking AI Agents on Network Troubleshooting]] — [[Zhihao Wang]](筆頭)・[[Alessandro Cornacchia]]・[[Alessio Sacco]]・[[Franco Galante]]・[[Marco Canini]]・[[Dingde Jiang]]([[University of Electronic Science and Technology of China]]・[[KAUST]]・[[Politecnico di Torino]])。LLM 駆動のネットワークインシデント診断・トラブルシューティング向けとして現時点最大の公開ベンチマーク NIKA(Network Incidents benchmarKing FrameworK for AI Agents)の一次論文。Kathará コンテナエミュレーションを実行バックエンドに、Model Context Protocol (MCP) 経由で 30 種類超のツールを公開する Agent Access Layer を持ち、5 ネットワークシナリオ(データセンター・キャンパス・ISP バックボーン・SDN 対応クラウド POP ファブリック・P4 テストベッド)×54 種の根本原因の組み合わせで 640 通りのインシデントを構成する。GPT-OSS:20B・GPT-5-mini・GPT-5 を評価し、大きいモデルほど検知(89.0%/74.0%/19.0%)には成功するが箇所特定(68.7%/36.0%/5.5%)・RCA(55.3%/22.0%/5.5%)には依然苦戦することを示した。ツール呼び出し誤り率は GPT-5 で0.7%・GPT-5-mini で1.6%と低く、MCP ベースの構造化インターフェースがハルシネーションを抑制する可能性を示す。トポロジサイズを大きくすると検知精度はほぼ一定だが箇所特定・RCA 精度は低下しトークン消費はほぼ倍増する。本論文は直前に ingest した [[@2026__arXiv__SADE - Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting]] が評価対象とする NIKA ベンチマークの一次資料であり、SADE 側が「NIKA の LLM-as-judge プロトコル」と述べる評価尺度が本論文の評価器節(§3.3.3、混同行列ベースの精度のみ)と食い違うことを発見し、両ソースおよび [[NIKA]] entity に `[!contradiction]` callout を追加した。新規 entity 8件([[Zhihao Wang]]・[[Alessandro Cornacchia]]・[[Alessio Sacco]]・[[Franco Galante]]・[[Marco Canini]]・[[Dingde Jiang]]・[[KAUST]]・[[Politecnico di Torino]])を作成、既存 entity 2件([[University of Electronic Science and Technology of China]]・[[NIKA]])を更新。新規 concept 1件([[ネットワークトラブルシューティングエージェントベンチマーク]])を作成、既存 concept 3件([[障害注入]]・[[SRE Benchmark]]・[[エージェント型ネットワーク障害診断]])に横断的知見を追記。図表5点(Figure 1・2・4・5・6、全て埋め込みラスター画像が装飾アイコンのみのため PyMuPDF キャプション座標クロップで取得。Figure 3a/3b はコードのため Markdown コードブロックへ転記)・表5点(Table 1〜5、全て Markdown 表へ忠実に転記)を本文該当箇所に埋め込み。全18ページ本文+参考文献87件を通読。(paper / source / networking / aiops / benchmark / agent)
#### Causal Software Engineering: A Vision and Roadmap(FSE Companion '26、Roberto Pietrantuono ほか、University of Naples Federico II・Fraunhofer IESE・University of Sheffield)(2026-08-13)
- [[@2026__FSE__Causal Software Engineering - A Vision and Roadmap]] — Roberto Pietrantuono(筆頭、[[University of Naples Federico II]])・[[Luca Giamattei]]・[[Stefano Russo]](いずれも[[University of Naples Federico II]])・[[Julien Siebert]]([[Fraunhofer IESE]])・[[Neil Walkinshaw]]([[University of Sheffield]])。既存の相関ベースのSEツール(異常検知・予測分析・AIOps・LLMエージェント)が「介入したら何が起きるか(what-if)」「別の行動をとっていたらどうだったか(counterfactual)」に答えられないという課題認識から、Causal Software Engineering(CSE)という将来パラダイムを提唱するビジョン・ロードマップ論文。マイクロサービスのリトライポリシー誤帰属事例(オートスケーリングとトラフィックシフトという交絡因子を見落として改善をリトライポリシーに誤帰属した後、再現に失敗してインシデントに至る)を動機として、3種の軽量アーティファクト(causal design spec・intervention log・living causal model)と、Causal Readiness Level(CRL-0〜CRL-5)による4ルート(因果的可観測性・介入可能性・反実仮想的保証・ガバナンス&アラインメント)共進化のロードマップを提示する。Bertolino et al. のソフトウェアテストロードマップの"achievements–challenges–dreams"構造を踏襲し、intervention-effect・counterfactual incident・causal testing の3ベンチマークファミリーによる評価計画を提案する。実証実験は行っていないビジョン論文であり、因果グラフの進化下での不安定性・反実仮想手法の分散システムへのスケーラビリティ不足を著者ら自身が未解決課題として明示する。新規 concept 1件([[Causal Software Engineering]])を作成、既存 concept 3件([[因果推論ベースRCA]]・[[根本原因分析]]・[[AIOps]])と因果発見の関連1件([[因果発見]])に横断的知見を追記。新規 entity 8件(著者5名・所属組織3件)を作成。図表1点(Figure 1、ロードマップ図。ベクター描画のため PyMuPDF キャプション座標クロップで取得)・表1点(Table 1、Markdown表へ忠実に転記)を本文該当箇所に埋め込み。全5ページ本文+参考文献20件を通読。(paper / source / aiops / causal / rca / vision-paper)
#### Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications: A Review(ACM Comput. Surv. 2025、Ruyue Xin ほか、University of Amsterdam・China University of Geosciences (Beijing)・Xihua University)(2026-08-13)
- [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]] — [[Ruyue Xin]](筆頭、[[China University of Geosciences (Beijing)]] / [[University of Amsterdam]] [[Multiscale Networked Systems (MNS)]])・[[Jingye Wang]]([[University of Amsterdam]])・[[Peng Chen (Xihua University)]](責任著者、[[Xihua University]])・[[Zhiming Zhao]](責任著者、[[University of Amsterdam]])。全37ページ、参考文献245件超のサーベイ論文。EU の Ethics Guidelines for Trustworthy AI が示す7要件から data privacy・fairness・robustness・explainability・efficiency・human intervention という6つの技術的信頼性要件を抽出し、data collection → data preprocessing → anomaly detection → root cause localization の一般的性能診断フレームワークへ統合した taxonomy(Fig. 3)を提示する。fairness はデータ収集(データサンプリング・データアノテーション)、robustness/explainability/efficiency はデータ前処理・異常検知・根本原因箇所特定の各段階、data privacy(ブロックチェーンストレージ・差分プライバシー・連合学習)と human intervention(データアノテーション・ハイパーパラメータチューニング・人間フィードバック)はシステム全体、という計13の要件-コンポーネント対応表(Table 3)を中心的な成果とする。根本原因箇所特定における公平性研究の空白、サービス+メトリクス単位の細粒度局所化の未成熟を将来課題として指摘する。既存 entity 6件([[Ruyue Xin]]・[[Zhiming Zhao]]・[[Peng Chen (Xihua University)]]・[[University of Amsterdam]]・[[Xihua University]]・[[Multiscale Networked Systems (MNS)]])は CausalRCA([[@2022__arXiv__CausalRCA - Causal Inference based Precise Fine-grained Root Cause Localization for Microservice Applications]])からの再登場であり、同じ著者陣がマイクロサービス RCA の個別研究からより広い信頼できる AI サーベイへ展開したことを示す。新規 entity 2件([[Jingye Wang]]・[[China University of Geosciences (Beijing)]])を作成。既存 concept 3件([[異常検知]]・[[根本原因分析]]・[[差分プライバシー]])に横断的知見を追記。図表10点(Figure 1〜10、全て埋め込みラスター画像として取得)・表3点(Table 1〜3、Markdown表へ抜粋転記)を本文該当箇所に埋め込み。全37ページ本文を通読、サーベイの性質上参考文献本体(245件超)は精読対象から除外。(paper / source / aiops / survey / trustworthy-ai)
#### TORAI: Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph(ACM FSE 2026、Luan Pham ほか、RMIT University・Chongqing University)(2026-08-13)
- [[@2026__FSE__TORAI - Multi-source Root Cause Analysis for Blind Spots in Microservice Service Call Graph]] — [[Luan Pham]]・[[Huong Ha]]・[[Xiuzhen Zhang]]([[RMIT University]])・[[Hongyu Zhang]]([[Chongqing University]])。BARO・RCAEval と同一著者グループによる、サービスコールグラフを構築しない教師なしマルチソース RCA。SeverityScorer(異常度スコアリング)→SymptomCluster(GMM+BIC クラスタリング)→CausalRanker(severity クラスタ内で分割統治 Ψ-PC による因果ランキング)→RankAggregation→FineGrainer(中央値/IQR 仮説検定)の6段パイプラインで、トレース計装のないサービス(blind spot)が混在する環境でも動作する。トレース欠損サービスの severity ベクトル成分を ρ=0 で明示的に補完し、Sock Shop(全サービス blind spot)でも AC@1=0.84・Avg@5=0.94 を達成。270件の注入障害と実運用10件の障害で9種のSOTAベースライン(PDiagnose・HeMiRCA・CausalRCA・MicroCause・RCD・CIRCA・BARO・MicroRank・TraceRCA)を上回り、64サービスのTrain Ticketでも平均20.59秒で完了する。RQ4アブレーションではseverityによる事前絞り込みなしのCausalRanker単体が大きく劣化し、コードレベル障害(cartserviceのInt32オーバーフロー例外)もスタックトレース頻度で検出できることを実証。著者4名・組織2件・評価対象システム3件・RCAEvalの計10 entityすべてが既存ページとして再利用でき、新規entity作成は不要だった。既存concept 3件([[因果推論ベースRCA]]・[[限定観測可能性]]・[[マイクロサービスコールグラフ]])に横断的知見を追記。図表14点(Figure 1〜8の全図+Table 2〜7の大型結果表、PyMuPDFキャプション座標クロップ)を埋め込み、小規模なTable 1・8・9・10・11はMarkdown表へ転記。全24ページ本文+参考文献69件を通読。(paper / source / aiops / rca / microservices)
#### Quantifying Performance Variability in GPU Clusters(IEEE TPDS 2026、Michael Mogilevsky・Hazem Zaky ほか、Rutgers University・George Mason University)(2026-08-13)
- [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] — [[Michael Mogilevsky]]・[[Hazem Zaky]](同等貢献、[[Rutgers University]])・[[Yu Sun]]・[[Lishan Yang]]([[George Mason University]])・[[Mingkai Zheng]]・[[Zhao Zhang]](責任著者、[[Rutgers University]])。NVIDIA A100(NERSC Perlmutter)と GH200(TACC Vista)を対象に、GEMM・STREAM マイクロベンチマークと 7 実世界アプリケーション(NAMD・GROMACS・LAMMPS・NWChem・MILC・GPT・Llama)で GPU 間性能変動を実測した特性化研究。GEMM 変動は Tensor Cores で 3.7〜8.8%・CUDA Cores で 0.1〜8.2%、Tensor Cores・CUDA Cores 上の FP64 を使うアプリケーションほど変動が高いという一貫パターンを見出した。単一 GPU での GPT 4.8B・Llama 3B 訓練の変動はそれぞれ 10.4%・8.9%、GPT 19B の 3D 並列訓練では最遅 GPU の混入で配置に関わらず 8.0〜8.5% のスループット低下が生じることを実証。48 時間の連続訓練では性能劣化は観測されず。コアクロックと実行時間の強い負相関(DVFS)、温度との弱い正相関(熱スロットリング)を Pearson 相関で定量化。健全性チェックによる外れ値 GPU の交換・変動感度に基づくアプリケーション配置という緩和策を提案する。同じ著者研究室([[Rutgers University]] の Zhao Zhang 研究室)が同じ [[Vista]]/[[Perlmutter]] テストベッドを用いた [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]](GPUPerf、性能予測誤差 Vista 9.38%/Perlmutter 4.98%)との横断的知見として、GPUPerf が Vista の高誤差をネットワーク要因に帰属する一方、本論文が実測する GPU ハードウェア自体の変動が代替要因になりうることを発見し、新規 concept [[GPU性能変動]] に集約した。新規 entity 4件([[Michael Mogilevsky]]・[[Hazem Zaky]]・[[Yu Sun]]・[[Lishan Yang]])を作成、既存 entity 6件([[Zhao Zhang]]・[[Mingkai Zheng]]・[[Rutgers University]]・[[George Mason University]]・[[Vista]]・[[Perlmutter]])を更新。新規 concept 1件([[GPU性能変動]])を作成、既存 concept 1件([[ストラグラー]])に横断的知見を追記。図表6点(Figure 1〜6、埋め込みラスター画像4点+PyMuPDFキャプション座標クロップ2点)・表7点(Table I〜VII、全てベクター/テキストのため PyMuPDF キャプション座標クロップで画像化して読み取り、Markdown 表へ忠実に転記)を本文該当箇所に埋め込み。全12ページ本文+参考文献45件を通読。(paper / source / hpc / gpu / distributed)
#### CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure(arXiv 2026、Eric Ding ほか、Cornell University)(2026-08-13)
- [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]] — [[Eric Ding]](筆頭・連絡先著者)・[[Byungsoo Oh]]・[[Bhaskar Kataria]]・[[Kaiwen Guo]]・[[Jelena Gvero]]・[[Abhishek Vijaya Kumar]]・[[Arjun Devraj]]・[[Lindsey Bowen]]・[[Atharv Sonwane]]・[[Emaad Manzoor]]・[[Rachee Singh]](いずれも[[Cornell University]])。要約統計量ではなく実行トレース・YAMLワークロードカード・起動スクリプトの3点セットをエビデンスとして記録するトレースベースのLLM基盤ベンチマーク[[CCL-Bench]]の一次提案論文。100件超のワークロード・7種のモデルアーキテクチャ・7種のフレームワーク・3種のハードウェア環境(NERSC Perlmutter A100・Google TPU v6e)を収集。コミュニティ拡張可能なメトリクスツールキット(MFU・compute-communication overlap・memory-transfer overhead等)、実測トレースを[[MLCommons Chakra]]/[[Astra-Sim]]へ接続するtrace-driven what-if分析パイプライン、LLMエージェントによる構成自動探索ツール[[CCL-Search]]の3本柱で構成される。3つの技術的主張——(1)compute-communication overlapの増加がstep timeの長期化と共起し非効率な並列化選択(EP/DPトレードオフ)を明らかにすることがある、(2)TPU ICI帯域幅の倍化はGPU scale-up帯域幅の倍化より小〜中規模ワークロードで著しく高いutilityを持つ(推論最大100倍・訓練最大22倍)、(3)フレームワーク固有のベストチューニング後の最適構成は転移せず最大3倍の性能差を生む——を、既存の要約統計量ベンチマークでは発見できない発見として実演した。NCCL vs. MSCCL++、vLLM vs. SGLang、TorchTitan vs. Megatron-LMのクロスシステム比較、GPU vs. TPUのクロスアーキテクチャ比較も含む。新規 entity 16件(人物11件・製品/システム5件: [[CCL-Bench]]・[[CCL-Search]]・[[MSCCL++]]・[[TorchTitan]]・[[MaxText]])を作成、既存 entity 11件([[Cornell University]]・[[MLCommons Chakra]]・[[Astra-Sim]]・[[NCCL]]・[[vLLM]]・[[SGLang]]・[[Megatron-LM]]・[[PyTorch]]・[[Kineto]]・[[Perlmutter]]・[[OpenXLA]])を更新。新規 concept 1件([[LLM基盤ベンチマーク]])を作成、既存 concept 3件([[実行トレース]]・[[並列化戦略]]・[[集合通信]])に横断的知見を追記。図表15点(Figure 1〜15、埋め込みUIスクリーンショット1点+PyMuPDFキャプション座標クロップ14点)を本文該当箇所に埋め込み、表4点(Table 1〜4)をMarkdown表へ転記。全24ページ本文+Appendix A〜Jを通読。(paper / source / llm / aiinfra / benchmark / distributed)
#### Eagle: Leveraging Operations Documents for Comprehensive Benchmark Question Generation(FSE Companion '26、Yuhe Liu ほか、Tsinghua University・CNIC/CAS・Huawei・CAICT)(2026-08-13)
- [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]] — Yuhe Liu(筆頭、[[Tsinghua University]] & [[BNRist]])・[[Changhua Pei]]・[[Hang Wang]]([[Computer Network Information Center, Chinese Academy of Sciences]])・[[Longlong Xu]]([[Tsinghua University]] & [[BNRist]])・[[Xiaogang Dong]]・[[Zhen Feng (Huawei)]]([[Huawei Technologies]]、西安)・[[Li Zheng (CAICT)]]・[[Kehang Ji]]([[China Academy of Information and Communications Technology]])・[[Dan Pei]](責任著者、[[Tsinghua University]] & [[BNRist]])。運用(Ops)ドキュメントから OpsLLM 評価用ベンチマーク QA を自動生成するフレームワーク [[Eagle (OpsLLMベンチマーク)]] の一次提案論文。Understanding/Memory/Generation/Agent/Logic/Extraction の6コア能力 × Pre/In/Post-Event の3 Ops フェーズ × 6データモダリティから成るタクソノミーを定義し、LLM ガイド型ディレクトリ階層走査アルゴリズム [[DirDiver]] による知識抽出、In-Breadth/In-Depth Evolving による Seed Question 駆動の QA 生成、Critic Model + RAG ベース Answer Model による二重品質検証から成る4段階パイプラインを提案する。[[Huawei Technologies]] 社内に6ヶ月間デプロイし企業ドキュメントから4,845件の QA ペアを合成、モデル選定・ロールアウト判断に用いる社内横断ベンチマークレポートを作成した点が特徴。オフライン評価では UNIX/Redis/Zabbix の3公開コーパスで [[Bonito]]・[[Forge (5G Instruct Forge)]] という2ベースラインを専門家評点ルーブリックスコアで22%〜49%上回り、ペアワイズ勝率95%超を記録。4種の生成モデル(Qwen2.5-72B・GPT-4.1・Gemini 2.5・Claude 3.7 Sonnet)への頑健性、Seed Question/制約/DirDiver の寄与を定量化するアブレーション研究、10モデル横断の per-metric 評価(Memory/Logic が飽和、Generation が最弱、Post-Event が最も頑健)も実施した。新規 entity 12件(著者6名・組織2件・プロダクト4件)を作成、既存 entity 6件([[Dan Pei]]・[[Changhua Pei]]・[[Longlong Xu]]・[[Tsinghua University]]・[[BNRist]]・[[Huawei Technologies]])を更新。新規 concept 1件([[運用文書駆動ベンチマーク生成]])を作成、既存 concept 3件([[LLM評価]]・[[AIOps]]・[[OpsQA]])に横断的知見を追記。図表3点(Figure 1・2・5、いずれもベクター描画のため PyMuPDF キャプション座標クロップで取得)を本文該当箇所に埋め込み、プロンプトテンプレート・QA 例(Figure 3・4・6〜11)は本文抽出テキストが正確なため Markdown 引用ブロックへ転記、表7点(Table 1〜7)を Markdown 表へ転記。全11ページ本文+参考文献27件を通読。(paper / source / aiops / llm-evaluation / benchmark)
#### Anatomy of an Incident(Anatomy of an Incident: Google's Approach to Incident Management for Production Services、O'Reilly Media 2022年1月、Ayelet Sachto & Adrienne Walcer with Jessie Yang、Google SRE)(2026-08-13)
- 書籍ハブ entity: [[wiki/entities/Anatomy of an Incident|Anatomy of an Incident]]。全 7 章 70 ページの無償レポートを 1 章 = 1 source ページとして取り込んだ(7 件、すべて `publish: false`)。図表 17 点を `wiki/sources/_attachments/anatomy-of-an-incident/` に配置し本文該当箇所へ埋め込み。原本は `.raw/books/anatomy-of-an-incident/`。
- [[@2022__OReilly__Anatomy of an Incident - Chapter 1 Introduction]] — 「エスカレーション・即時対応・組織的対応」の 3 条件でインシデントを定義し、モニタリング/アラート/インシデントを峻別したうえで、準備・対応・緩和と復旧の 3 段階が円環をなすインシデント管理ライフサイクル(図 1-1)を提示する導入章。
- [[@2022__OReilly__Anatomy of an Incident - Chapter 2 Practicing Incident Response Readiness (Preparedness)]] — Google の DiRT プログラムと Wheel of Misfortune による災害ロールプレイングを軸に、定期的なインシデント対応テストが応答者の技術的・精神的準備を高める経緯と、直近のポストモーテムの 3 標準質問を起点にテストを段階的に設計する手順を示す(4 ページ、図なし)。
- [[@2022__OReilly__Anatomy of an Incident - Chapter 3 Scaling Incident Management (Response)]] — コンポーネント応答者と system-of-system 応答者(プロダクト特化 IRT・Tech IRT)の二層エスカレーション組織、共通プロトコル・信頼・敬意・透明性の 4 特性、重大度 6 区分(Table 3-1)、3 日以内という対応期間ポリシーを提示する、本書で最も組織論的な章(図 5 点)。
- [[@2022__OReilly__Anatomy of an Incident - Chapter 4 Mitigation and Recovery]] — 不信頼性 = Σ(TTD+TTR)/TBF × Impact という式を軸に、検知までの時間の短縮・修復までの時間の短縮・障害間隔の延伸という 3 方向の改善策(アラート設計、ICS/IMAG、N+2 冗長化・多重防御・グレースフルデグレーデーション)を論じる、本書で最も定量的な章(図 6 点)。
- [[@2022__OReilly__Anatomy of an Incident - Chapter 5 Postmortems and Beyond]] — 心理的安全性(導入時・対応中・組織全体の 3 層)とポストモーテム執筆(3 円ベン図モデル、根本原因対トリガー、孤立システム対全体スタック、時点対軌跡)の 2 本柱を論じる、本書で最も分量の多い章(16 ページ、図 5 点)。
- [[@2022__OReilly__Anatomy of an Incident - Chapter 6 The Mayan Apocalypse - A Real-World Example]] — 2019 年 6 月 2 日の実インシデント「Mayan Apocalypse」(ネットワーク自動化ツール Maya の誤フラグに端を発するカスケード障害)を時系列で描き、40 人超が参加しても並列化が緩和を加速しない構造と、対象コンポーネント未経験の Tech IRT メンバーがインシデントコマンダーとして機能した経過を示す事例章。
- [[@2022__OReilly__Anatomy of an Incident - Chapter 7 Conclusion and Moving Forward]] — 「インシデント管理は適切な場面でのみ使い、ヒーロイズムでなくチーム全体の継続改善と非難のなさで臨むべき」という行動喚起を述べ、Additional Reading・Bibliography・謝辞・著者紹介で締めくくる結論章。
#### ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents(arXiv 2026、Kenan Li・Qirui Jin ほか、Microsoft・Georgia Institute of Technology)(2026-08-13)
- [[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]] — [[Kenan Li]]*・[[Qirui Jin]]*(*共同筆頭、[[Microsoft]]・[[Georgia Institute of Technology]])ほか13名([[Wenke Lee]]・[[Dongmei Zhang]]含む)。SWEエージェント研究が暗黙に注目してきた5つの文脈情報信号(Reproduction Test・Regression Test・Edit Location・Execution Context・API Usage)について、gold patchや実行トレースから機械的に「oracle(完璧に得られた場合の正解)」版を抽出し、各信号の理想的な寄与上限を定量化する統一手法Oracle-SWEを提案。SWE-bench-Verified・Live・Proの3ベンチマーク・複数モデル(GPT-5・GPT-4o・Claude-4.5/4.6-Sonnet)で一貫してReproduction Testが最大の寄与を示し(SWE-bench-VerifiedでReproduction > Context ∼ Location > API > Regression、Live/ProでReproduction > Context ∼ API > Location > Regression)、全5要因注入で4つのモデル・ベンチマーク組み合わせすべてが97%以上の成功率に到達することを実証。native error stackはcustom stack collectorより有意に効果的だが利用可能なインスタンスは全体の約1/4に限られること、内部APIがAPI呼び出しの約82%を占めることも報告する。実際の強いLMが抽出した信号をベースエージェントに与える2段階検証実験でも、oracle版と一致する寄与順序が再現された。新規 entity 3件([[Kenan Li]]・[[Qirui Jin]]・[[Wenke Lee]])を作成、既存 entity 4件([[Dongmei Zhang]]・[[Microsoft]]・[[Georgia Institute of Technology]]・[[Agentless]]・[[SWE-Bench-Verified]])を更新。新規 concept 1件([[SWEエージェントの情報信号]])を作成。図表11点(Figure 1〜10全図+Table 1、PyMuPDFキャプション座標クロップ)を本文該当箇所に埋め込み、Table 2〜5をMarkdown表へ転記。全27ページ本文+Appendix A〜Hを通読。(paper / source / agents / software-engineering / benchmark)
#### Shaky structures: The wobbly world of causal graphs in software analytics(Empirical Software Engineering 2025、Jeremy Hulse・Nasir U. Eisty・Tim Menzies、NC State・University of Tennessee Knoxville)(2026-08-13)
- [[@2025__EMSE__Shaky structures - The wobbly world of causal graphs in software analytics]] — [[Jeremy Hulse]](筆頭・全実験担当、[[North Carolina State University]])・[[Nasir U. Eisty]]([[University of Tennessee, Knoxville]])・[[Tim Menzies]]([[North Carolina State University]])。因果グラフ生成器(PC・FCI・GES・LiNGAM)がSEデータに対して非常に不安定であることを4種の摂動(リリース間・プロジェクト間・パラメータチューニング・90%サブサンプル)×3タスク(欠陥予測・ソフトウェア設定・プロジェクト管理)×23データセットで定量化した実証研究。同一欠陥データの隣接バージョンで因果の向きが逆転する動機付け事例(loc→bugとbug→locの逆転)から出発し、Jaccard指数で測定した結果、リリース間で過半数、プロジェクト間で約75%、有意水準αの微小変更(特にα<0.1)で急激に、10%のサブサンプル除去でも一部0.25まで因果エッジが変化することを示した。Scott-Knott分析ではFCIが最も不安定な生成器の一つ、config・processタスクがdefectタスクより不安定という傾向を報告する。結論として、因果グラフから一般的な結論を導く前に多数の生成グラフにわたる頑健性を検証すべきだと主張する。[[Causal Software Engineering]]がRoute 1の未解決課題として引用していた原典であり、取り込みにより[[因果発見]]・[[Causal Software Engineering]]の横断的知見・未解決の問いを直接更新した。新規 entity 3件([[Jeremy Hulse]]・[[Tim Menzies]]・[[Nasir U. Eisty]])を作成、既存 entity 3件([[North Carolina State University]]・[[University of Tennessee, Knoxville]]・[[Julien Siebert]])を更新。既存 concept 2件([[因果発見]]・[[Causal Software Engineering]])に横断的知見・未解決の問いを追記。図表6点(Figure 1・2・3・4・5の全図+Table 2内挿入図、いずれも埋め込みラスター画像)を本文該当箇所に埋め込み、表2点(Table 6・7)をMarkdown表へ転記。全26ページ本文+Declarations を通読。(paper / source / causal-discovery / empirical-se)
#### Machine Learning: The High-Interest Credit Card of Technical Debt(SE4ML: Software Engineering for Machine Learning, NIPS 2014 Workshop、D. Sculley ほか、Google, Inc.)(2026-08-13)
- [[@2014__SE4ML2014__Machine Learning - The High-Interest Credit Card of Technical Debt]] — [[D. Sculley]](筆頭)・[[Gary Holt]]・[[Daniel Golovin]]・[[Eugene Davydov]]・[[Todd Phillips]]・[[Dietmar Ebner]]・[[Vinay Chaudhary]]・[[Michael Young]](Google, Inc.)。技術的負債の枠組みを機械学習システムに初めて体系的に適用した位置づけ論文(実験なし)。entanglement(CACE原則: Changing Anything Changes Everything)・隠れたフィードバックループ・未宣言の消費者による境界侵食、不安定/未活用のデータ依存性・訂正カスケードによるデータ依存性コスト、glue code・pipeline jungles・dead experimental codepaths・configuration debtによるシステムレベルのアンチパターン、固定閾値・相関の変化・prediction bias/action limitsによる外部世界の変化への対処、という4軸でリスク要因を整理する。成熟したMLシステムでは実際にMLを行うコードは最大5%程度で残りはglue codeになりうると指摘し、Knight Capital社が廃止された実験的コードパスにより45分間で4億6,500万ドルを失った事例([9])を引用する。新規 entity 8件(著者全員)を作成、既存 entity 1件([[Google]])を更新。新規 concept 1件([[技術的負債]])を作成し、既存 concept [[ソシオテクニカル負債]]と横断的知見で相互接続。図表なし(本文に Figure/Table 参照が存在しない純テキストの位置づけ論文と確認)。全9ページを通読。(paper / source / software-engineering / machine-learning)
#### 詳説 データベース(Database Internals: A Deep Dive into How Distributed Data Systems Work、オライリー・ジャパン 2021 年 7 月、Alex Petrov 著・小林隆浩 監訳・成田昇司 訳、全 14 章 392 ページ)(2026-08-13)
- 書籍ハブ entity: [[詳説 データベース]]。全 14 章に各部の序論 2 本を加えた 16 件を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。図 124 点を `wiki/sources/_attachments/database-internals-ja/` に配置し本文該当箇所へ埋め込み。原本は `.raw/books/database-internals-ja/`。
- [[@2021__OReillyJapan__詳説 データベース - Part I 序論 ストレージエンジン]] — データベース選定はワークロードのシミュレーションと内部構造の理解に基づくべきで、ストレージエンジンの設計はあらゆるユースケースに最適な単一解が存在しないトレードオフの連続であることを説く、第 I 部の序論(6 ページ、図なし)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 1 基本事項の紹介と概要]] — DBMS アーキテクチャ、メモリベース対ディスクベース、列指向対行指向、データファイル対インデックスファイル、バッファリング・イミュータビリティ・オーダリングという本書全体の座標軸を定義する導入章(図 6 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 2 Bツリーの基本]] — 二分探索木の局所性・ファンアウト・高さの限界からディスクベース構造の要件を導出し、B ツリーの階層構造・セパレータキー・検索アルゴリズム・分割とマージの手続きを体系的に示す(図 14 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 3 ファイルフォーマット]] — バイナリエンコーディング、スロット化ページ、セルレイアウト、可変長データ管理、バージョン管理、チェックサムという、ディスク上のバイト配置という最も具体的な層を扱う(図 9 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 4 Bツリーの実装]] — 2 章が示した B ツリーの理論を、ページヘッダ・兄弟リンク・ハイキー・パンくずリスト・オーバーフローページという補助構造によって実装可能にする(図 11 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 5 トランザクション処理とリカバリ]] — バッファ管理(退避ポリシー)、リカバリ(WAL・steal/force・ARIES)、同時実行制御(OCC・MVCC・2PL・分離レベルとアノマリー)を扱う、第 I 部で最長かつ最も密度の高い章(34 ページ、図 9 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 6 Bツリーの亜種]] — B ツリーという単一の構造に対し、ハードウェアと同時実行性の要請から派生した 5 系統(コピーオンライト・遅延・FD ツリー・Bw ツリー・キャッシュオブリビアス)の設計の系統樹を示す(図 9 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 7 ログ構造化ストレージ]] — イミュータブルな LSM ツリーを、B ツリーとの読み書き増幅トレードオフ(RUM 予想)、Bitcask・WiscKey という順序なし LSM ストレージ、FTL・ファイルシステムログ・LLAMA というログ構造化スタック全体の観点から解説する、第 I 部最終章かつ最長章(38 ページ、図 16 点)。
- [[@2021__OReillyJapan__詳説 データベース - Part II 序論 分散システム]] — 垂直スケーリングの限界から水平スケーリングへの移行を導入し、参加者・クロック・通信リンクという基本語彙と、通信チャネルとプロセスの不完全な信頼性という困難さの根源を定義する、第 II 部の序論(4 ページ、図なし)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 8 基本事項の紹介と概要]] — 並行実行から出発し、分散コンピューティングの誤謬、リンクの抽象化(フェアロス・スタボーン・パーフェクト)、2 人の将軍の問題、FLP の不可能性、システムの同期性、障害モデルという、第 II 部全体を貫く語彙と不可能性結果を導入する(図 4 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 9 障害検出]] — 非同期分散系では「クラッシュ」と「単に遅い」を区別できないため障害検出は本質的に困難であり、完全性と正確性のトレードオフを軸に ping・ハートビート・Phi-Accrual・ゴシップ・FUSE という異なる設計思想を紹介する(図 5 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 10 リーダー選出]] — 活性と安全性の両立が理想だが、ブリー・次候補フェイルオーバー・候補者/一般人・招待・リングの 5 系統はいずれも安全性を欠き、安定した選出には障害検出との組み合わせが不可欠であることを示す(図 5 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 11 レプリケーションと一貫性]] — CAP 定理、共有メモリレジスタ(セーフ/レギュラー/アトミック)、線形化可能性から因果一貫性までの階層、セッションモデル、R + W > N の調整可能な一貫性、ウィットネスレプリカ、CRDT を体系的に扱う、第 II 部の中核章(30 ページ、図 9 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 12 アンチエントロピーと情報散布]] — アンチエントロピーを対話型(読み取り修復・ダイジェスト読み取り)、バックグラウンド型(Merkle ツリー・ビットマップバージョンベクトル)、ゴシップ型(情報散布)の 3 系統に分類し、それぞれがスコープ削減・最新性・完全性のどれに最適化されているかを示す(図 5 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 13 分散トランザクション]] — 分散トランザクションを、アトミックコミット(2PC・3PC)、決定論的順序(Calvin)、TrueTime による外部一貫性(Spanner)、分散スナップショット分離(Percolator)、調整の回避(RAMP)という 5 つのアプローチから対比的に解説する(図 9 点)。
- [[@2021__OReillyJapan__詳説 データベース - Chapter 14 合意]] — ブロードキャスト、ZAB、Paxos(基本と Multi-Paxos・Fast Paxos・EPaxos・Flexible Paxos の亜種)、Raft、PBFT を通じ、リーダー選出と障害検出の積み重ねの先にある分散合意の到達点を提示する、本書最長かつ最終章(36 ページ、図 13 点)。
### The Elements of Statistical Learning(2026-08-14 ingest-book)
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 1 Introduction]] — 統計的学習問題を教師あり/教師なし学習に大別し、スパムメール判定・前立腺がんデータ・手書き数字認識・DNA 発現マイクロアレイの 4 実例と本書全体の章構成を提示する導入章(図 3 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 2 Overview of Supervised Learning]] — 最小二乗法と k 最近傍法を両極として、統計的決定理論による最適予測子・次元の呪い・学習の不良設定性・バイアス-バリアンストレードオフという、以降全章が参照する共通言語を据える(図 11 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] — 部分集合選択(離散的)と縮小推定(連続的)の二軸、および制約領域の幾何が変数選択の有無を決めるという論点で、ridge・lasso・elastic net・LAR・PCR・PLS を整理する(図 20 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 4 Linear Methods for Classification]] — 線形な決定境界を作る 4 経路(指示行列の線形回帰・LDA/QDA・ロジスティック回帰・分離超平面)を並べ、masking 問題と、同時分布 対 条件付き分布という推定原理の違いを対比する(図 16 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] — 入力を基底展開して線形手法をそのまま使い、複雑さを基底の個数ではなく罰則で制御する転換。スプライン・平滑化スプライン・有効自由度・ウェーブレット・RKHS(図 20 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]] — 局所回帰・カーネル密度推定・動径基底関数・混合モデルを「目標点の近傍にカーネルで重みを与えて単純なモデルを当てはめる」発想で統一的に扱う(図 17 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 7 Model Assessment and Selection]] — モデル選択とモデル評価を別目的として区別し、訓練誤差の楽観性を補正する解析的手法($C_p$・AIC・BIC・MDL・SRM)と標本再利用(交差検証・ブートストラップ)を体系化する(図 15 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 8 Model Inference and Averaging]] — 最尤推定・ベイズ推定・ブートストラップという推論の枠組みを統一的に示し、EM アルゴリズムとギブスサンプリングの構造的対応、バギング・スタッキング・バンプ狩りを扱う(図 13 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 9 Additive Models, Trees, and Related Methods]] — GAM・決定木(CART)・PRIM・MARS・階層的専門家混合を扱い、以降の章が前提とする決定木の基礎(貪欲な育成・不純度指標・コスト複雑度枝刈り・代理分割・不安定性)を据える(図 13 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 10 Boosting and Additive Trees]] — ブースティングを前向き段階的加法モデリングによる損失関数最小化へ再解釈し、AdaBoost と指数損失の等価性、勾配ブースティング(MART)、変数重要度と部分依存プロットを扱う(図 22 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 11 Neural Networks]] — ニューラルネットワークを射影追跡回帰の特殊ケースとして「導出特徴を学習する 2 段階モデル」と位置づけ、誤差逆伝播法・重み減衰・重み共有(畳み込み構造)・ベイズ的事後平均を扱う(図 12 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 12 Support Vector Machines and Flexible Discriminants]] — SVM を「ヒンジ損失 + L2 罰則」という正則化の枠組みに再解釈し、LDA を最適スコアリングによる線形回帰の系列として再定式化して FDA・PDA・MDA へ一般化する(図 15 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]] — モデルを持たない分類手法として、プロトタイプ法(K-means・LVQ・ガウス混合)と k 最近傍法(Cover-Hart 上界・不変計量・適応的計量 DANN)を対比する(図 15 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 14 Unsupervised Learning]] — 結合ルール・クラスタリング・SOM・主成分分析/主曲線・スペクトラルクラスタリング・NMF・独立成分分析・多次元尺度構成法・PageRank を共通の合成データで対比する、本書最長の章(102 ページ、図 40 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 15 Random Forests]] — バギングされた木の分散を「木どうしの相関 $\rho$」に帰着させ、分割候補変数のランダム化で $\rho$ を下げることで分散削減に特化した非適応的なアンサンブルを実現する(図 11 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 16 Ensemble Learning]] — アンサンブル学習を「基底の辞書生成 + 事後の重み付け」の 2 段構えで統一し、ブースティングと lasso 正則化パスの近さ・bet on sparsity 原理・ISLE・Rule Ensembles を扱う総括章(図 10 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 17 Undirected Graphical Models]] — 辺の欠如が条件付き独立を意味することを起点に、連続変数はガウス精度行列と graphical lasso で、離散変数はイジングモデル・RBM で、グラフ構造とパラメータを推定する(図 7 点)。
- [[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]] — $p \gg N$ では分散が予測誤差を支配するため強い正則化を課す単純な手法が勝つことを示し、後半は多重検定で FWER に代わり偽発見率(BH 法・SAM 法)を制御基準とすべきことを示す(図 20 点)。
### A Philosophy of Software Design(2026-08-14 ingest-book)
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 1 Introduction]] — 複雑性を不可避の敵と位置づけ、コードを単純明白にする戦略とモジュール設計でカプセル化する戦略という 2 本柱、および設計は完成しないという漸進的な開発観を提示する序章。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 2 The Nature of Complexity]] — 複雑性を「システムを理解し変更することを困難にするもの」と実務的に定義し、変更増幅・認知負荷・未知の未知という 3 症状と、依存・不明瞭さという 2 原因に整理する(図 1 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 3 Working Code Isn't Enough]] — 戦術的プログラミングと戦略的プログラミングを対比し、開発時間の 10〜20% を設計に投資する立場を Facebook・Google・VMware の実例とともに論じる(図 1 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 4 Modules Should Be Deep]] — モジュールをインターフェース(コスト)と実装(利益)の 2 面で評価する見方から深いモジュールという中心概念を導き、Unix ファイル I/O を好例、Java のストリーム API とクラス病を反例とする(図 1 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 5 Information Hiding (and Leakage)]] — 深さを生む最重要の技術である情報隠蔽と、その失敗形である情報漏出・時間的分解・過剰露出を、学生の HTTP サーバ実装事例で具体的に検討する(図 1 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 6 General-Purpose Modules are Deeper]] — 「やや汎用寄り」を狙うとインターフェースが単純になり実装がやや複雑になるが総体として深くなることを、GUI テキストエディタの事例で示す。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 7 Different Layer, Different Abstraction]] — 層が違えば抽象も違うべきという原則から、パススルーメソッド・デコレータ・パススルー変数という 3 つの API 重複パターンを診断し、それぞれの解消手段と正当な例外を示す(図 2 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 8 Pull Complexity Downwards]] — 回避できない複雑性は利用者ではなくモジュール開発者が引き受けるべきだと説き、設定パラメータの多用を複雑性の上方への押し上げとして批判しつつ、この原則自体のやりすぎにも警告する。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 9 Better Together Or Better Apart?]] — 2 つのコードを結合すべきか分離すべきかの判断基準(情報共有・インターフェース簡素化・重複除去・相互依存)を示し、メソッドは長さだけを理由に分割すべきでないという立場を取る(図 3 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 10 Define Errors Out Of Existence]] — 例外処理を複雑性の最悪の原因の一つと位置づけ、意味論の再定義・隠蔽・集約・クラッシュという 4 手段で例外を処理すべき箇所の数そのものを減らす(図 2 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 11 Design it Twice]] — 重要な設計判断のたびに根本的に異なる複数案を出して比較する手続きを提案し、それが設計スキルそのものへの投資になると論じる。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 12 Why Write Comments? The Four Excuses]] — コメントを書かない 4 つの言い訳(自己文書化コード・時間がない・陳腐化・役に立たない)をすべて退け、コメントなしに抽象は完成しないと論じる。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 13 Comments Should Describe Things that Aren't Obvious from the Code]] — コメントを 4 分類して規約化し、コードを繰り返さず、低水準コメントで精度を・高水準コメントで直感を与え、インターフェース文書を実装の細部で汚染しないことを説く本書最長の章。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 14 Choosing Names]] — 名前を精度と一貫性の 2 性質で論じ、著者自身が Sprite OS で経験した `block` の多義性による半年がかりのバグを教訓として示す。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 15 Write The Comments First]] — コードより先にコメントを書く手順を提案し、抽象を言語化する行為が設計の欠陥を早期に露呈させるためコメントは設計ツールになると論じる。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 16 Modifying Existing Code]] — 既存コードの変更時も戦略的に振る舞い、コメントをコードの近くに置く・コミットログではなくコードに書く・差分を確認するといった技法で文書を最新に保つ。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 17 Consistency]] — 一貫性が認知負荷を下げる仕組みと、それを維持する手段(文書化・強制・既存規約を変えない)、そしてやりすぎると誤った推測を招くという限界を示す。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 18 Code Should be Obvious]] — 不明瞭さの裏返しである「明白さ」は読み手だけが判定できるとし、明白さを損なうものを列挙する。設計原則 14「読みやすさのために設計する」の出典。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 19 Software Trends]] — 本書の原則を使って継承・アジャイル開発・単体テスト・テスト駆動開発・デザインパターン・ゲッター/セッターを評価する応用章。単体テストは支持し、テスト駆動開発とゲッター/セッターには批判的。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 20 Designing for Performance]] — 単純な設計はしばしば高速でもあると論じ、RAMCloud の `Buffer` 再設計で速度が約 2 倍・コード行数が約 20% 削減された事例を示す(図 3 点)。
- [[@2018__YaknyamPress__A Philosophy of Software Design - Chapter 21 Conclusion]] — 複雑性が本書唯一の主題であることを再確認し、設計への投資は初期コストを生むが早期に回収されると結論づける。
- [[@2024__Prowler__VOID Report 2024 - Exploring the Unintended Consequences of Automation in Software]] — VOID コーパス 189 件の主題分析(自動化が寄与要因 77%・人間の介入必須 75%)から Sentinel/Gremlin/Meddler/Unreliable Narrator/Spectator/Action Item の 6 自動化アーキタイプを導出し、Klein らの Ten Challenges・un-Fitts list による Joint Cognitive Systems 的改善を提言する Prowler(旧 Verica)の年次レポート。
### UniTS(2026-08-14 ingest-paper)
- [[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]] — タスクトークン化(sample/prompt/GEN・CLS token)により予測・分類・補完・異常検知を単一の共有重みモデルで統一し、38データセットのマルチタスク学習でタスク別専用モジュールを持つベースラインを上回る(NeurIPS 2024、図 9 点)。
### SLOconf 2021: SLO Math(2026-08-14 ingest-video)
- [[@2021__SLOconf__SLO Math]] — Steve McGhee(Google)による SLOconf 2021 講演。依存サービス群の可用性合成をダイスアナロジーで説明し、intersection availability(SLO^depth)・union availability(1-(1-SLO)^redundancy)という 2 式で「SLO の集合論」を提示する(16 分、代表フレーム 12 枚)。
### MOMENT(2026-08-14 ingest-paper)
- [[@2024__ICML__MOMENT - A Family of Open Time-series Foundation Models]] — Carnegie Mellon University Auton Lab が発表した時系列基盤モデル(ICML 2024)。マスク時系列モデリングで事前学習した T5 型 Transformer(Small/Base/Large)が、長期予測・短期予測・分類・異常検知・補完の5タスクをゼロショット/線形プロービングで解く。13ドメイン・約13M系列の公開コーパス Time Series Pile を新規構築し公開(図 12 点)。
### Moirai-MoE(2026-08-14 ingest-paper)
- [[@2024__arXiv__Moirai-MoE - Empowering Time Series Foundation Models with Sparse Mixture of Experts]] — Salesforce AI Research による時系列基盤モデル。Moirai の周波数レベル model specialization を批判し、単一入出力射影層 + Transformer 内部のスパース Mixture-of-Experts でトークンレベルの自動 specialization を実現。事前学習済み表現の k-means クラスタ重心でゲーティングする Token Clusters 手法を新規提案し、39 データセットで Moirai を最大17%上回る(図 9 点)。
### Timer-XL(2026-08-14 ingest-paper)
- [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]] — Tsinghua University(BNRist)が発表した時系列予測用causal Transformer(ICLR 2025)。単変量next token predictionを多変量次トークン予測へ一般化し、変量依存行列とcausal時間マスクのクロネッカー積で分解するTimeAttentionにより単変量・多変量・共変量付き予測を統一。encoder-only(UniTST)が長コンテキストで性能劣化するのに対しdecoder-onlyがこれを緩和すると実証し、ERA5由来の長コンテキストベンチマークを新設(図12点)。
### Sundial(2026-08-15 ingest-paper)
- [[@2025__ICML__Sundial - A Family of Highly Capable Time Series Foundation Models]] — Tsinghua University(THUML)が発表した生成的時系列基盤モデル(ICML 2025)。flow-matching ベースの TimeFlow Loss により離散トークン化・事前分布指定のどちらにも依存しないネイティブかつ柔軟な確率的予測を実現し、1 兆点規模の TimeBench で事前学習して TSLib・GIFT-Eval・FEV leaderboard のゼロショット SOTA を数ミリ秒の推論速度で達成(図 12 点)。
### In-Context Fine-Tuning for Time-Series Foundation Models(2026-08-15 ingest-paper)
- [[@2024__arXiv__In-Context Fine-Tuning for Time-Series Foundation Models]] — Google Research が発表した TimesFM の文脈内ファインチューニング手法(TimesFM-ICF、arXiv:2410.24087)。推論時にコンテキストウィンドウへ対象ドメインの関連時系列例示を separator トークンで区切って追加するだけで、勾配更新なしに Monash ベンチマークで TimesFM(base)を7%、ETT ベンチマークで最良ベースラインを25%以上上回り、per-dataset ファインチューニングすら凌駕する(図8点)。
### TS-Arena(2026-08-15 ingest-paper)
- [[@2026__arXiv__TS-Arena - A Live Forecast Pre-Registration Platform]] — Paderborn University Data Analytics Group が発表したライブ時系列予測ベンチマークプラットフォーム(KDD '26 採録、arXiv:2512.20761)。予測事前登録プロトコル(FPRP)により正解データが物理的に存在する前にモデルへ予測提出を強制し、直接的・間接的情報漏洩を設計上不可能にする。マイクロサービスアーキテクチャで実装し、エネルギー領域186系列・14チャレンジの2025年通年バックテストでchronos-2(ELO 1289)・tirex(最低MASE 0.682)が上位を占めた(図7点、Table 1-4を転記)。
### Tiny Time Mixers (TTM)(2026-08-15 ingest-paper)
- [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]] — IBM Research が発表した超軽量(1Mパラメータから)時系列基盤モデル(NeurIPS 2024)。軽量TSMixerバックボーンにadaptive patching・diverse resolution sampling・resolution prefix tuningを導入し、311MパラメータのMoirai_Lや200MパラメータのTimesFMを大幅に小さいモデルサイズでゼロショット予測において上回る。multi-level modelingでチャネル相関・外生変数を後付け学習する(図7点)。
### Mathematics for Machine Learning(2026-08-14 ingest-book)
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 1 Introduction and Motivation]] — 第 1 章。機械学習の 3 要素(データ・モデル・学習)を導入し、本書の二部構成と 2 通りの読み方を提示する序章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 2 Linear Algebra]] — 第 2 章。連立方程式・ベクトル空間・線形独立・基底とランク・線形写像・アフィン空間を積み上げる線形代数の基盤章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 3 Analytic Geometry]] — 第 3 章。内積を導入し、代数的なベクトル空間に長さ・角度・直交射影という幾何を与える章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 4 Matrix Decompositions]] — 第 4 章。行列式と固有値で行列を要約し、Cholesky 分解・固有値分解・特異値分解で分解して低ランク近似へ至る章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 5 Vector Calculus]] — 第 5 章。微分・勾配・ヤコビ行列・ヘッセ行列・テイラー級数を、誤差逆伝播と自動微分の計算基盤として整備する章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 6 Probability and Distributions]] — 第 6 章。確率空間・和と積の規則・ベイズの定理・要約統計量・ガウス分布の閉性・共役性と指数型分布族を体系化する章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 7 Continuous Optimization]] — 第 7 章。勾配降下法と凸最適化(ラグランジュ双対・線形計画/二次計画・凸共役)という 2 つの道具立てで第 I 部を締めくくる章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 8 When Models Meet Data]] — 第 8 章。モデルを関数と見る見方と確率分布と見る見方を並べ、経験リスク最小化・最尤推定・ベイズ推論・グラフィカルモデル・モデル選択を統合する第 II 部の総論
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 9 Linear Regression]] — 第 9 章。最尤推定・過学習・MAP 推定(正則化)・ベイズ線形回帰を経て、回帰を直交射影として幾何的に統一する章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 10 Dimensionality Reduction with Principal Component Analysis]] — 第 10 章。主成分分析を分散最大化・射影誤差最小化・確率的潜在変数モデルの 3 観点から導出し、同一の固有値問題に帰着させる章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 11 Density Estimation with Gaussian Mixture Models]] — 第 11 章。混合ガウスモデルの最尤推定が閉形式で解けないことから EM アルゴリズムを導き、潜在変数の観点で下界最大化として再解釈する章
- [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 12 Classification with Support Vector Machines]] — 第 12 章。マージン最大化とヒンジ損失+正則化という 2 つの見方を統一し、双対形の内積構造からカーネル法へ橋渡しする章
### AgentChaos(2026-08-15 ingest-paper)
- [[@2026__ASE__AgentChaos - Chaos Engineering for Agent Systems via Programmatic Fault Injection]] — 全エージェントシステムが同一のHTTPインターフェースでLLMにアクセスする点を利用し、ソースコード変更なしにHTTP層で非侵入的にLLM API障害を注入するカオスエンジニアリングフレームワーク(ASE 2026)。crash/omission/valueの6障害タイプ×65設定で5エージェントシステムを評価し、pass@1最大約50ポイントの劣化を実証した。
### AEGIS(SDC検知、2026-08-15 ingest-paper)
- [[@2026__OSDI__Safeguarding LLM Training at Scale - Online SDC Detection and Insights from 35 Million GPU Hours]] — [[ByteDance]]/[[Tsinghua University]] による大規模 LLM 訓練向けオンライン Silent Data Corruption(SDC)検知システム AEGIS(OSDI 2026)。cSensor-cVerifier の2段階抽象で軽量センシングと確定検証を分離し、Tensor Core の混合精度アキュムレータと訓練フレームワークの再計算冗長性を利用した検知手法を提案。3.5×10^7 GPU時間の本番展開で18件のSDCと13台の故障GPUを0.86%オーバーヘッドで検出し、既知故障8台の再現実験ではオフライン診断の2/8に対しAEGISは8/8を検出した。
### Hestia(クラウドオーバーサブスクリプション、2026-08-15 ingest-paper)
- [[@2026__SIGCOMM__Rethinking Cloud Optimization - Volatility-Driven for Better Outcomes]] — [[University of Science and Technology of China]]/[[Tencent]] Cloudによる、ワークロードの時間的揮発性(temporal volatility)を空間的集約で低減しクラウドオーバーサブスクリプションを最適化するフレームワークHestia(SIGCOMM 2026)。新指標MCV(Maximum-based Coefficient of Variation)を理論的上下界付きで導入し、CPU MCVを43.3%削減、オーバーサブスクリプション利益を66.74%増加させた。
### SREエンタープライズロードマップ(2026-08-15 ingest-book)
- 書籍ハブ entity: [[SREエンタープライズロードマップ]]。原書 *Enterprise Roadmap to SRE*(O'Reilly 2022、ISBN 9781098117733)、[[James Brookbank]]・[[Steve McGhee]] 著、[[山口 能迪]] 訳、Google Japan G.K. 発行の 64 ページのテクニカルレポート。全 6 章を 1 章 = 1 source ページとして取り込んだ(すべて `publish: false`)。図 4 点を `wiki/sources/_attachments/enterprise-roadmap-to-sre-ja/` に配置し本文該当箇所へ埋め込み。原本は `.raw/books/enterprise-roadmap-to-sre-ja/`。
- [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 1 エンタープライズSREことはじめ]] — 既存フレームワーク(ITIL・DevOps)との共存を説き、「今いる場所から始める」「人から始まる」姿勢で SRE 導入に臨むことを説く導入章。
- [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 2 なぜ信頼性のためにSREというアプローチをとるのか?]] — 信頼性の差別化要因化、成長の 3 つの地平線による投資計画、クラウド化による信頼性モデルの転換(ユニオン→交差)、Google の水平スケーリング史が SRE を今日必要とする理由を説く章。
- [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 3 SREの原則]] — SRE Book 第 3〜9 章の 7 原則を要約しアンチパターンを添え、可逆性を重視する組織変革論と J カーブで大企業への適用を論じる理論的中心章。
- [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 4 SREのプラクティス]] — SRE を機能させるのは文化であり、プラットフォームは低リスクから MVP で育て、リーダーシップは平時/戦時とコード宣言で信頼性投資を制度化することを説く、本書最長の実践章。
- [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 5 積極的な成功体験の育成]] — SRE を機能させるのは文化(5 つのチーム力学)であり、「今すぐ小さく始める」育成と手入れの実務論。
- [[@2022__OReillyJapan__SREエンタープライズロードマップ - Chapter 6 Googleを超えて]] — ヘルスケアと小売業の SRE リーダー 3 名へのインタビューを通じ、Google 以外の業界固有の制約下での SRE 導入の実像を描く事例章。
### AIDA(ネットワーク機器RCA、2026-08-15 ingest-paper)
- [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]] — [[Sun Yat-sen University]]/[[Alibaba Cloud]] による、マルチベンダーのネットワーク機器障害向け自動細粒度RCAシステムAIDA(SIGCOMM 2026)。RLでファインチューニングしたLLMが過去の診断メールから構造化推論チェーンを抽出し、SimRankベースの構造考慮ノード統合で知識グラフへ合成、多段階RAG推論で検証可能なRCAレポートを生成する。Alibaba Cloud本番ネットワークに1年以上展開され846件を処理、精度95.4%を維持しつつRCA所要時間の中央値を72.6時間から1.6分へ短縮した。
### SDCHunter(2026-08-15 ingest-paper)
- [[@2026__OSDI__SDCs in the Wild - Characterizing and Diagnosing SDC-defective GPUs in Production LLM Training]] — [[ByteDance Seed]]/[[Shanghai Jiao Tong University]] による、本番 LLM 訓練クラスタの GPU Silent Data Corruption(SDC)を特性調査し決定論的リプレイで診断する自動システム SDCHunter(OSDI 2026)。SDC 欠陥 GPU 23 台の特性調査から標準的な合成ストレステストが欠陥デバイスの 60% 超を見逃すと示し、DP レプリカ間の軽量グルーピング(Phase 1)と全状態比較による精密局在化(Phase 2)の 2 段階リプレイで、オーバーヘッド 4% 未満のまま検出カバレッジ・局在化精度いずれも 100% を達成。ByteDance の本番環境で 40 件の SDC インシデントを緩和し、同じ OSDI 2026 の AEGIS(オンライン検知)と相補的に連携する。
### ディープラーニングを支える技術(2026-08-15 ingest-book)
- [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 1 ディープラーニングと人工知能]] — ポランニーのパラドックスと人工知能史、計算コストの指数的成長からディープラーニング隆盛の背景を解説する導入章。
- [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 2 [入門]機械学習]] — 学習の目的を丸暗記でなく汎化能力の獲得と定義し、問題設定の分類学と確率モデルとしての学習を体系的に導入する章。
- [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 3 ディープラーニングの技術基礎]] — 表現学習・ニューラルネットワークの構成・誤差逆伝播法・代表的な構成要素を通しで扱う本書の中核章。
- [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 4 ディープラーニングの発展]] — 正規化層・スキップ接続・注意機構という三大技術が、なぜ学習と汎化を改善するのかを直感と理論の双方から解く発展章。
- [[@2022__Gihyo__ディープラーニングを支える技術 - Chapter 5 ディープラーニングを活用したアプリケーション]] — 画像認識(AlexNet〜SENet)・音声認識(LAS)・自然言語処理(BERT/GPT-3)の代表アーキテクチャを紹介する応用章。
- [[@2022__Gihyo__ディープラーニングを支える技術 - Appendix A [厳選基礎]機械学習&ディープラーニングのための数学]] — 線形代数・微分・確率の3分野を証明抜きで厳選し、本編理解の前提知識として圧縮解説する数学付録。
### The Anatomy of Silent Data Corruption(2026-08-15 ingest-paper)
- [[@2026__arXiv__The Anatomy of Silent Data Corruption - GPU Error Pattern Study and Modeling Guidance]] — [[Duke University]]/[[NVIDIA]]/[[University of Rochester]] による、production-classデータセンターGPUのゲートレベル故障注入(300万シミュレータ時間・63 CUDAマイクロベンチマーク)でSDCの破損型・ビット反転パターン・warp整列した空間相関を定量特性化した論文(arXiv 2026)。NaN/±INFはSDC結果の1.01%にとどまり、nullificationが50.68%と支配的、単一ビット反転は非特殊破損の40%未満、破損アドレスはwarpサイズを法とした周期性を示す。
### PRAXIS(エージェント型RCA・SDG+PDGグラフトラバーサル、2026-08-15 ingest-paper)
- [[@2026__DSN__PRAXIS - Integrating Program Analysis with Observability for Root-Cause Analysis]] — [[University of Illinois Urbana-Champaign]]/[[IBM Research]] による、サービス依存グラフ(SDG)とhammock-blockプログラム依存グラフ(PDG)へのLLM駆動グラフトラバーサルでコード・設定起因のクラウド障害を診断するエージェントPRAXIS(DSN 2026)。ITBench由来のReAct型SRE-Agentベースラインに対し、30シナリオのCode-Cloud-RCAベンチマークで根本原因推論精度6.3倍・根本原因特定精度3.4倍・トークン消費5.3倍削減を達成。生コードをそのままプロンプトに渡す変種はneedle-in-a-haystack/context rotで性能劣化することをアブレーションで示し、PDG誘導トラバーサルが精度向上の主因であることを実証。
### Performance Alert Triage(2026-08-15 ingest-paper)
- [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features]] — [[Polytechnique Montréal]] による、Mozilla の性能アラートサマリがバグ報告と関連付けられるかを予測するリーク無し時間認識型トリアージパイプライン(ICPE Companion '26)。アラートメタデータとマルチスケール(短・中・長)時系列特徴量を融合した CatBoost モデルが、厳密な時系列分割下でテスト AUPRC 0.851・P@50 0.920 を達成し、fastText テキスト埋め込みの追加は非テキスト構成を上回らないことを示した。
### 分散 Root Cause Localization(エッジ環境、2026-08-15 ingest-paper)
- [[@2026__TSC__A Decentralized Root Cause Localization Approach for Edge Computing Environments]] — [[University of Melbourne]] qCLOUDS Laboratory による、エッジコンピューティング環境向け分散 Root Cause Localization (RCL) 手法(IEEE TSC 2026)。通信・コロケーション考慮のマイクロサービスクラスタリングと、クラスタ内でエッジデバイスがローカル実行する Personalized PageRank (PPR)、クラスタ間 peer-to-peer 近似処理を組み合わせ、公開データセット MicroCERCL(383 シナリオ)で中央集中ベースラインと同等以上の精度を保ちつつ局所化時間を最大 34% 削減。iAnomaly で生成した大規模データセット(50〜2,500 ノード)でも中央集中型を一貫して上回るスケーラビリティを示した。
### 原論文から解き明かす生成AI(2026-08-15 ingest-book)
[[菊田遥平]] 『原論文から解き明かす生成AI』(技術評論社, 2025)を章単位で取り込み。book entity は [[wiki/entities/原論文から解き明かす生成AI|原論文から解き明かす生成AI]]。全章 `publish: false`(著作権コンテンツ)。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 1 本書の読み方と論文を読み解く技術]] — 全 8 章の依存関係・原論文マップ(表1.1〜1.7)・数式記法という本書の地図と、arXiv 活用や実装読解など論文を批判的に読み解く技術を示す章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 2 入力データの特徴量化]] — 分布仮説の実験的検証(Rubenstein and Goodenough, 1965)から BPE・ユニグラム言語モデル・SentencePiece・バイトレベル BPE を経て「トークナイザーは本当に必要か」に答える章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 3 生成AIモデルの大前提となるTransformer]] — Attention Is All You Need を全体像・位置埋め込み・マルチヘッド注意・出力部分・学習と実験結果の順に読み解き、自己注意の計算量優位や n≪d 仮定まで批判的に検討する中心章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 4 Generative Pre-trained Transformerとテキスト生成]] — GPT-1,2 を複数タスクモデル、GPT-3,4 を生成モデルとして読み解き、文脈内学習と RLHF を別原論文から掘り下げる本書最長(54 ページ)の章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 5 拡散モデルと画像生成]] — ViT による画像領域への Transformer 転用、拡散過程と逆拡散過程が同じ関数形になる数学的保証(Feller, 1949)を含む拡散モデルの定式化、両者を統合した DiT を通しで読み解く章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 6 テキストと画像の融合]] — CLIP が確立したテキスト・画像の共通埋め込み空間を土台に、text-to-image(unCLIP)・画像編集(Imagic)・画像記述(BLIP / LLaVA)の 3 方向へ展開する章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則]] — 事前学習スケーリング則(Kaplan / Henighan)と推論時スケーリング則(Chain-of-Thought → GRPO → DeepSeek-R1)を、原論文の数式導出を通じて一本の筋で並べる章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 8 生成AIモデルの評価]] — 生成 AI 評価の二重の困難を、Chatbot Arena の Bradley-Terry モデルによる人間相対評価と Humanity's Last Exam の専門性評価という 2 つの原論文の読み解きで示す章。
- [[@2025__Gihyo__原論文から解き明かす生成AI - Appendix 参考文献の取り扱いとビッグオー記法]] — 参考文献に原則 arXiv を使う著者の方針とその根拠、および Landau のビッグオー記法による計算量表現を扱う付録。
- [[@2026__SIGMOD__HYDRA - A Multi-Level Hierarchy-Driven Approach for Robust Anomaly Detection in Time Series]] — [[Mingyi Huang]]・[[Qinghua Liu]]・[[Paul Boniol]]・[[John Paparrizos]]([[The Ohio State University]]/[[Inria]])による、discordベース(Matrix Profile)とクラスタリングベース(NormA)両パラダイムを階層的代表選抜で統合した教師なし時系列異常検知手法HYDRA(SIGMOD 2026)。TSB-ADベンチマーク40データセット・40アルゴリズム横断で単変量VUS-PR +18.7%・多変量+9.2%を統計的有意性とともに達成し、いずれの正規化方式も振幅駆動型異常を抑制しうることを実証した。
### Connecting 100K+ GPUs(多建屋トポロジ・CCLX・DQPLB・運用ツール、2026-08-15 ingest-paper)
- [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]] — [[Hongyi Zeng]]・[[Min Si]]・[[Pavan Balaji]]ほか([[Meta]])による、10万GPU超が複数データセンタ建屋にまたがるRoCEファブリックの通信スタック報告(SIGCOMM 2026)。多建屋トポロジのレイテンシ階層(ラック内比7×/15×/30×)とMoE由来のバーストAll-to-Allトラフィックに対し、通信ライブラリCCLX(NVIDIA版NCCLX/AMD版RCCLX)の初期化を96K GPU規模で最大11倍高速化、HBM使用量を64K GPU規模で約2倍削減、トランスポート層DQPLBでバッファ蓄積を最大90%削減、CollTraceベースのFault Analyzerと分散CPUエミュレーションを含む運用ツール群を報告する。先行arXiv版([[@2025__arXiv__Collective Communication for 100k+ GPUs]])のNCCLX/CTran/DQPLBをCCLXへ一般化し多建屋文脈で再提示する続編。
### TraceLLM(LLMトレース分析ベンチマーク+ファインチューニング、WWW 2026、2026-08-15 ingest-paper)
- [[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]] — [[Tong Zhou]]・[[Xin Peng]]ほか([[Fudan University]]/[[Xidian University]]/サムスン電子中国拠点)による、LLM のトレース分析能力を初めて体系的に評価する論文(WWW 2026)。Train-Ticket 上に初の instruction&response ベンチマーク TraceBench(38タスク・30,400組)を構築し、GPT-4o が Acc 0.734 で最良・open-source では Qwen-3-8B のみ実用水準(0.650)と評価。ファインチューニング手法 TraceLLM(Trace2Text 系・Trace2Token 系)は open-source ベースラインを平均 51.34%、GPT-4o を平均 19.16% 上回り、未見タスク・未見Webアプリケーション(OnlineBoutique)への汎化性とトレース長への頑健性も確認した。
### Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports(ICPE Companion 2026、2026-08-15 ingest-paper)
- [[@2026__ICPE__Leveraging LLMs for Structured Information Extraction and Analysis from Cloud Incident Reports]] — [[Xiaoyu Chu]]・[[Shashikant Ilager]]・[[Yizhen Zang]]・[[Sacheendra Talluri]]・[[Alexandru Iosup]]([[Vrije Universiteit Amsterdam]]/[[University of Amsterdam]]/[[Delft University of Technology]])による、LLMでクラウドインシデントレポートから構造化情報を抽出する体系的評価(ICPE Companion '26 Work In Progress Paper)。AWS・AZURE・GCPから3,087件のインシデントレポートを収集し460件を手動アノテーション、5プロンプトコンポーネント×6戦略×6LLM(軽量3種・SotA3種)でメタデータ抽出精度75–95%を達成。Few-shotは分類フィールドを除き精度改善に有効(最大改善17.34%)だが入力トークンを1.5–2倍要し、軽量モデル(Gemini 2.0・GPT 3.5)が精度・コスト・レイテンシで良好なバランスを示す一方、最高価格モデルは最安モデルの50–60倍のコストを要した。
### ディープラーニングを支える技術〈2〉(2026-08-15 ingest-book)
- [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 0 ディープラーニングとは何か]] — 学習の非凸最適化・過剰パラメータ汎化という二つの謎、生成モデル、深層強化学習、今後の課題を予告する本書全体の見取り図。
- [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 1 ディープラーニングの最適化]] — 非凸最適化にもかかわらず学習が成功する理由を Star-convex Path から説き、条件数・モーメンタム法・学習率自動調整・ハイパーパラメータ最適化で学習の効率化を扱う章。
- [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 2 ディープラーニングの汎化]] — パラメータ数が多くても汎化する矛盾を、勾配降下法によるノルム最小化・フラットな解・宝くじ仮説からなる陰的正則化で解明する本書の中心章。
- [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 3 深層生成モデル]] — 生成モデルを「生成を通じて複雑な世界を理解する」視点で捉え、VAE・GAN・自己回帰モデル・正規化フロー・拡散モデルの 5 手法を生成過程・学習原理・長所短所から比較する章。
- [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]] — 強化学習を教師あり学習との違いから特徴づけ、ベルマン方程式による価値推定と方策勾配法による方策改善の 2 軸で手法を体系化し、DQN と AlphaGo で深層強化学習の実例を示す本書最長の章。
- [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 5 これからのディープラーニングと人工知能]] — 自己教師あり学習の発展、Bitter Lesson をめぐる論争、不変性・同変性による帰納バイアスの組み込み、システム 2 の未達を論じる 2022 年時点の展望。
### FlowCheck(EuroSys 2025、Alibaba Cloud / Shanghai Jiao Tong University、2026-08-15 ingest-paper)
- [[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]] — [[Zimeng Huang]]・[[Hao Nie]]ほか([[Alibaba Cloud]]/[[Shanghai Jiao Tong University]]/[[Peking University]]/[[Zhejiang University]])による、データセンタースイッチのポートミラーリング機能で DP の allreduce トラフィックを傍受し訓練ノードに一切の追加通信を課さずにチェックポインティングを実現するシステム(EuroSys '25)。パケットカウントベースの状態機械で勾配パケットを識別し、ミラーリンクの再送不能というリスクには DP の構造的冗長性を用いた回復方式(3ノード監視で単一イテレーション損失率 $6\times10^{-12}$)で対処する。8ノード評価で98%超の有効訓練時間比率を達成し、Megatron-LM 相当175B〜1T・最大3072GPU規模の外挿推定でも成立を示した。
### Machine Learning Applications for Data Center Optimization(2026-08-16 ingest-paper)
- [[@2014__Google__Machine Learning Applications for Data Center Optimization]] — Googleの実運用センサーデータから5隠れ層ニューラルネットワークでPUEを予測し、感度分析、異常メーター検知、設備構成シミュレーションへ応用した2014年ホワイトペーパー。本文参照図表Figure 1〜7(4a–d、5a–dを含む)全7点を埋め込み。
### The Sciences of the Artificial(Herbert A. Simon、The MIT Press 1996、第 3 版、全 8 章)(2026-08-16 ingest-book)
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 1 Understanding the Natural and Artificial Worlds]] — 人工物は自然法則と人間の目的の双方を体現する。内部環境と外部環境のインタフェースとして捉え直すことで人工物の科学が可能になる。
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 2 Economic Rationality - Adaptive Artifice]] — 経済主体・市場・組織・進化を題材に、限定合理性が人工システムの適応をいかに規定するかを示す。
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 3 The Psychology of Thinking - Embedding Artifice in Nature]] — 蟻の寓話を人間に置き換え、思考の複雑さは環境の複雑さの反映だと実験証拠から示す。
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 4 Remembering and Learning - Memory as Environment for Thought]] — 長期記憶を思考の第二の環境として捉え、熟達・理解・学習・発見の過程が「人間は単純だ」という評決を覆さないことを示す。
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 5 The Science of Design - Creating the Artificial]] — 設計を「あるべき姿」を扱う知的に堅固な学科として立て直し、専門職教育の中核へ戻す 7 項目のカリキュラムを提案する。
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 6 Social Planning - Designing the Evolving Artifact]] — 社会規模の設計は目標の抑制と大胆な単純化を要し、最終目標なき進化する人工物の設計になる。
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 7 Alternative Views of Complexity]] — 複雑性研究の 3 度の噴出を整理し、カオス・進化計算を階層への代替かつ補完として位置づける。
- [[@1996__MITPress__The Sciences of the Artificial - Chapter 8 The Architecture of Complexity - Hierarchic Systems]] — 複雑性はしばしば階層形式をとり、階層は準分解可能ゆえに速く進化し簡潔に記述できる。
### Guide to the Software Engineering Body of Knowledge - A Straw Man Version(IEEE Computer Society 1998、本編 7 章 + 付録 I・J)(2026-08-16 ingest-book)
- [[@1998__IEEECS__SWEBOK Straw Man - Chapter 1 Introduction]] — ソフトウェア工学が正統な工学分野・認知された専門職の地位に達していないという問題提起から、4 年計画の第一歩としての本報告書の位置づけを述べる導入章。
- [[@1998__IEEECS__SWEBOK Straw Man - Chapter 2 The Guide to the Software Engineering Body of Knowledge Project]] — 「知識体系」と「その Guide」、「知識体系」と「カリキュラム」の 2 つの区別を立て、Straw Man → Stone Man → Iron Man の三段階アプローチを設計する。
- [[@1998__IEEECS__SWEBOK Straw Man - Chapter 3 Context and Relationships]] — 専門職の正統性要件(Starr)、成熟度の 8 要素モデル(Ford and Gibbs)、工学と科学の目的の違い(Vincenti)から、核となる知識体系への合意が認定・免許・カリキュラムすべての前提であることを示す。
- [[@1998__IEEECS__SWEBOK Straw Man - Chapter 4 Development Methodology for Identifying Knowledge Areas and Related Disciplines]] — 教科書 24 冊と大学課程 29 件を公開検証可能な情報源とし、ISO/IEC 12207 を分類基盤に用いる再現可能な識別方法論を記述する。
- [[@1998__IEEECS__SWEBOK Straw Man - Chapter 5 Proposed Knowledge Areas]] — 方法論の適用結果を Table 1・2・3 として提示し、「一般に受け入れられた」の閾値を 6(教科書の 4 分の 1)に置いた理由と解釈上の限界を述べる。
- [[@1998__IEEECS__SWEBOK Straw Man - Chapter 6 Proposed Related Disciplines]] — 関連分野 9 件を Table 4 として提案し、選択コースに現れる計算機科学への強い偏りとその要因、調査の限界を指摘する。
- [[@1998__IEEECS__SWEBOK Straw Man - Chapter 7 Summary and Next Steps]] — 世界規模のリーダーシップの必要を訴え、Stone Man 段階へ引き渡す未決事項と Vincenti の工学設計知識カテゴリという構造化枠組みの採用提案を示す。
- [[@1998__IEEECS__SWEBOK Straw Man - Appendix I Draft Classification of Knowledge on Formal Methods]] — 4 区分スキーマを形式手法という 1 つの知識領域に適用してみせた実例。ISO/IEC 12207 の語彙をあえて使わない。
- [[@1998__IEEECS__SWEBOK Straw Man - Appendix J Additional Information on Other Body of Knowledge Proposals]] — SWEBOK 以前から存在した認証プログラム(ICCP の CCP、ASQ の SQE、Quality Assurance Institute)と BOK 提案のカタログ。
- [[@2026__SIGCOMM Posters and Demos__Predict Boldly, Recover Cautiously : Fast On-Router Route Anomaly Prediction and Recovery]] — [[Hang Cui]]ほか(CNIC/CAS・清華大学ほか)による、ルーターネイティブ軽量 AIOps フレームワーク RouterOPS(SIGCOMM Posters and Demos '26)。各ルーターが self-testing/neighbor-testing で EWMA + 残差集約 + ヒステリシスのコンパクトなヘルススコアを維持し、「大胆に予測し慎重に復旧する」原則のもと decision guard(持続性・対象特定・ポリシー充足)を満たした場合のみ loop-free バックアップ next hop へのローカル復旧を発動する。本番デプロイのケーススタディで Centralized AIOps ベースラインより早い異常応答と累積 RTT 削減(経路下流で最大 43.4ms)を報告。
- [[@2003__Computer__The Vision of Autonomic Computing]] — [[Jeffrey O. Kephart]]・[[David M. Chess]]([[IBM T.J. Watson Research Center]])による自律コンピューティングのビジョン論文(*Computer*, 2003)。自己構成・自己最適化・自己修復・自己防御の 4 側面と、自律要素(managed element + autonomic manager)という MAPE-K アーキテクチャを提示し、以後の自己適応システム研究の基礎語彙を確立した。
### Why Software Is Eating the World(Marc Andreessen、a16z 2011)(2026-08-16 ingest)
- [[@2011__a16z__Why Software Is Eating the World]] — [[Marc Andreessen]] による2011年のエッセイ。ブロードバンド・スマートフォン普及とクラウドによる起業コスト低下(月額15万ドル→1,500ドル)を背景に、書籍・映像・音楽・ゲーム・広告・通信から自動車・小売・金融・医療・国防に至るまで、あらゆる産業をソフトウェア企業が代替しつつあるという「Software is eating the world」テーゼを提示した VC 業界の古典的エッセイ。
### Visions of Artificial Intelligence and Robots in Science Fiction: a computational analysis(Osawa+, IJSR 2022)(2026-08-16 ingest-paper)
- [[@2022__IJSR__Visions of Artificial Intelligence and Robots in Science Fiction - a computational analysis]] — [[Hirotaka Osawa]]ほか(全員 [[University of Tsukuba]])による、SF and Fantasy Writers of Japan の専門家 7 名と協働し SF に描かれた 115 件の AI・ロボットを階層クラスタ分析・主成分分析で計算的に分析した論文(*International Journal of Social Robotics*, Vol. 14, pp. 2123–2133、Open Access)。知能・人間性を軸とする 2 次元空間上に Human・Machine・Buddy・Infrastructure という 4 クラスタを見出し、身体性(embodiment)が知能認知に二面的な影響を持つことを定量的に示した。
### The End of Programming as We Know It(Tim O'Reilly、O'Reilly Radar 2025)(2026-08-16 ingest)
- [[@2025__OReilly__The End of Programming as We Know It]] — [[Tim O'Reilly]]([[O'Reilly Media]] 創業者)による、生成AIによるプログラマ失業論への反論エッセイ(O'Reilly Radar、2025-02-04)。過去の技術的抽象化の反復パターンと経済史家 [[James Bessen]] の産業革命研究を根拠に、AIによる変化も「プログラミングとして知られているものの終わり」にすぎないと論じる。[[70%問題]]・[[エージェントエンジニア]]など業界関係者への取材も交える。
### Risk management in a dynamic society: A modelling problem(Jens Rasmussen、Safety Science 1997)(2026-08-16 ingest-paper)
- [[@1997__Safety Science__Risk management in a dynamic society - A modelling problem]] — [[Jens Rasmussen]](Risø National Laboratory)による安全工学の古典的論文(*Safety Science*, Vol. 27, No. 2-3, 1997, pp. 183-213)。動的社会におけるリスク管理を、社会技術システム全体(立法者〜作業者)にまたがる制御問題として捉え、タスク分析(行為・エラー)ではなく境界条件と勾配による機能的抽象化でモデル化すべきと論じる。3境界モデル(Performance/Economic/Workload、Figure 3)と AcciMap(Figure 4・5・6、Svedung and Rasmussen, 1997 に基づく)の一次資料。SREcon 系トークで頻繁に二次引用されてきた「Rasmussen の Safety Model」の原典。
### Design and natural science research on information technology(Salvatore T. March, Gerald F. Smith、Decision Support Systems 1995)(2026-08-16 ingest-paper)
- [[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]] — [[Salvatore T. March]]・[[Gerald F. Smith]]([[University of Minnesota]])による IS 研究方法論の古典的論文(*Decision Support Systems*, Vol. 15, 1995, pp. 251-266、Invited Paper)。IT 研究のための研究成果物(constructs・models・methods・instantiations)×研究活動(build・evaluate・theorize・justify)の 4×4 フレームワーク(Fig. 1)を提示し、Simon の design science / natural science の区別を IT 研究における記述的研究と処方的研究の対立の調停に応用した。[[デザインサイエンス研究]]という研究方法論 concept の起点。
### On Structural Differences between Science and Engineering(Hans Poser、PHIL&TECH 1998)(2026-08-16 ingest-paper)
- [[@1998__PhilTech__On Structural Differences between Science and Engineering]] — [[Hans Poser]](ベルリン工科大学)による科学哲学のエッセイ(*Society for Philosophy and Technology Quarterly Electronic Journal*, Vol. 4, No. 2, Winter 1998, pp. 81-93)。科学と工学を分ける存在論的区別・創造性・Bunge の「応用科学」テーゼをいずれも退け、規則(rules)は法則(laws)と異なり真理値を持たず効力(efficacy)によって正当化されると論じ、行為・工学=科学・局所条件の3層で働く「技術的解釈学(technological hermeneutics)」という独自概念を提示する。
### What Engineers Know and How They Know It(Walter G. Vincenti、Johns Hopkins University Press 1990、全 8 章)(2026-08-16 ingest-book)
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 1 Introduction - Engineering As Knowledge]] — 工学知識を応用科学の派生物ではなく自律した知識体系として扱うという本書の立場と方法を示す導入章。
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 2 Design and the Growth of Knowledge - The Davis Wing and the Problem of Airfoil Design, 1908-1945]] — 理論的根拠を欠く Davis 翼型が Consolidated B-24 に採用され、のちに層流翼型として事後的に説明される顛末。
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 3 Establishment of Design Requirements - Flying-Quality Specifications for American Aircraft, 1918-1943]] — パイロットの主観的な操縦感覚を、四半世紀かけて客観的な飛行品質仕様へ翻訳した過程。
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 4 A Theoretical Tool for Design - Control-Volume Analysis, 1912-1953]] — 制御体積解析の百年史から、工学科学が科学と異なる思考様式を持つ理由を解き明かす。
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 5 Data for Design - The Air-Propeller Tests of W. F. Durand and E. P. Lesley, 1916-1926]] — Durand と Lesley の風洞プロペラ試験が、理論の及ばない領域を埋めるパラメータ変化法を確立した。
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 6 Design and Production - The Innovation of Flush Riveting in American Airplanes, 1930-1950]] — 沈頭リベット化の技術革新から、記述的知識・規範的知識・暗黙知の三分法を導く。
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 7 The Anatomy of Engineering Design Knowledge]] — 第 2〜6 章の事例を 6 カテゴリ × 7 生成活動に一般化し、表 7-1 で骨格を提示する本書最重要章。
- [[@1990__JohnsHopkins__What Engineers Know and How They Know It - Chapter 8 A Variation-Selection Model for the Growth of Engineering Knowledge]] — Campbell の変異-選択理論を踏み台に、工学知識がどう成長するかをモデル化する最終章。
### Nicomachean Ethics - Book VI: Intellectual Virtues(Aristotle、訳: F. H. Peters、Kegan Paul, Trench, Trübner & Co. 1906、断片ingest)(2026-08-16 ingest-book)
- [[@1906__StandardEbooks__Nicomachean Ethics - Book VI Intellectual Virtues]] — 『ニコマコス倫理学』第6巻。知性的徳(技術・学問・思慮・知恵・直知)を定義し、思慮(フロネシス)と知恵(ソフィア)の違い、思慮と倫理的徳の相互依存(ソクラテスの主知主義批判)を論じる。全10巻中この第6巻のみを断片として取り込んだ。
### Technology as 'Applied Science': A Serious Misconception that Reinforces Distorted and Impoverished Views of Science(Gil-Pérez+, Science & Education 2005)(2026-08-16 ingest-paper)
- [[@2005__Science & Education__Technology as 'Applied Science' - A Serious Misconception that Reinforces Distorted and Impoverished Views of Science]] — [[Daniel Gil-Pérez]]ほか7名(スペイン・ポルトガル・キューバ・アルゼンチンの5大学)による科学教育学の論説(*Science & Education*, Vol. 14, 2005, pp. 309-320)。技術を「応用科学」とみなす通念が、科学の性質(NOS)に関する7つの相互補強的な歪んだ描像(脱文脈化・個人主義的エリート主義・経験主義的帰納主義・硬直的アルゴリズム的・非歴史的独断的・もっぱら分析的・線形累積的)を強化すると論じ、STSE文脈化された調査型学習を是正策として提案する。「工学(技術)は応用科学ではない」という結論に、[[Walter Vincenti]](1990、歴史的事例研究)・[[Hans Poser]](1998、規則の認識論)とは異なる第3の経路(科学教育の実証研究)から到達する。
### An Evaluation of the Ninth SOSP Submissions -or- How (and How Not) to Write a Good Systems Paper(Roy Levin, David D. Redell、ACM SIGOPS OSR 1983)(2026-08-16 ingest)
- [[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]] — [[Roy Levin]]・[[David D. Redell]](第9回 [[SOSP]] プログラム委員会共同議長)による、投稿論文の評価基準を明文化した古典的エッセイ(*ACM SIGOPS Operating Systems Review*, Vol. 17, No. 3, 1983, pp. 35-40)。独創性・現実性・教訓・選択・文脈・焦点・提示・文章スタイルの7基準・約30個の問いを提示する。
### Design Science in Information Systems Research(Hevner, March, Park, Ram、MIS Quarterly 2004)(2026-08-16 ingest-paper)
- [[@2004__MIS Quarterly__Design Science in Information Systems Research]] — [[Alan R. Hevner]]・[[Salvatore T. March]]・[[Jinsoo Park]]・[[Sudha Ram]]による IS 研究方法論の古典的研究エッセイ(*MIS Quarterly*, Vol. 28, No. 1, pp. 75-105, March 2004)。行動科学とデザインサイエンスの2パラダイムを対比し、環境・IS研究・知識ベースの三層フレームワーク(Figure 2)とデザインサイエンス研究の7ガイドライン(Table 1)を提示、3本の模範論文に適用して実演する。[[@1995__Decision Support Systems__Design and Natural Science Research on Information Technology]](March and Smith 1995)の4×4フレームワークを7ガイドラインへ発展させた後継論文。
### LISA made LISA obsolete (That's a compliment!)(Thomas A. Limoncelli、;login: online / USENIX 2022)(2026-08-16 ingest)
- [[@2022__USENIX__LISA made LISA obsolete (That's a compliment!)]] — 元 Google SRE で LISA 2011 共同議長の [[Thomas A. Limoncelli]] による、USENIX の [[LISA]] カンファレンス終了(35年の歴史、2022年)への追悼エッセイ。LISA が掲げた5つの急進的アイデア(システム管理の重要性・能動的管理・自動化・人間的プロセス・オープンシステム)が業界の常識になったことで LISA 自身が陳腐化し、後継として SREcon へバトンが渡ったと総括する。LISA 併設 configuration management workshop が cfEngine・BCFG2・Puppet を生み Infrastructure as Code の源流になった経緯、LISA の LGBT フレンドリーな文化、共著書 [[The Practice of System and Network Administration]] の執筆秘話も含む。
### The Many Faces of Systems Research - And How to Evaluate Them(Brown, Chanda, Farrow, Fedorova, Maniatis, Scott、HotOS 2005)(2026-08-16 ingest-paper)
- [[@2005__HotOS__The Many Faces of Systems Research - And How to Evaluate Them]] — [[Aaron B. Brown]]・[[Anupam Chanda]]・[[Rik Farrow]]・[[Alexandra Fedorova]]・[[Petros Maniatis]]・[[Michael L. Scott]]による HotOS X の位置づけ論文(*Proceedings of the 10th Workshop on Hot Topics in Operating Systems*, Santa Fe, NM, June 2005)。システム研究論文を科学・工学・芸術の3次元で評価すべきと論じ、各次元に固有の基準(仮説の厳密さ/実用性/優雅さ)を提案する。[[@1983__ACM SIGOPS OSR__An Evaluation of the Ninth SOSP Submissions - How and How Not to Write a Good Systems Paper]](Levin & Redell 1983)を最も近い先行研究として参照する。
### Hints for Computer System Design(Butler W. Lampson、SOSP 1983)(2026-08-16 ingest-paper)
- [[@1983__SOSP__Hints for Computer System Design]] — [[Butler W. Lampson]](Xerox PARC)による、計算機システム設計に関する経験則を集成した古典的エッセイ(*Proceedings of the Ninth ACM Symposium on Operating Systems Principles*, ACM SIGOPS Operating Systems Review 17, 5, Oct. 1983, pp. 33-48)。機能性・速度・フォールトトレランスの3軸 × 完全性・インタフェース・実装の3軸(Figure 1)にヒントを整理し、Alto・Bravo・Star・Dorado 等 Xerox PARC の実システムで具体例を示す。エンドツーエンド論(Saltzer, 1981の会議発表版を引用)、ヒントとキャッシュの区別、safety first/shed load など、後の分散システム設計語彙の源流となった多くの概念を含む。
### Of Apples and Oranges: Fair Comparisons in Heterogenous Systems Evaluation(Sadok, Panda, Sherry、HotNets '23)(2026-08-16 ingest-paper)
- [[@2023__HotNets__Of Apples and Oranges - Fair Comparisons in Heterogenous Systems Evaluation]] — [[Hugo Sadok]]・[[Justine Sherry]]([[Carnegie Mellon University]])・[[Aurojit Panda]]([[New York University]])による HotNets '23 ポジションペーパー(*The 22nd ACM Workshop on Hot Topics in Networks*, Nov. 2023, 8 pages)。SmartNIC・FPGA・プログラマブルスイッチのようなアクセラレータを使うヘテロジニアスハードウェアシステムの比較評価には性能だけでなくコストの報告が必要と主張し、コスト指標が満たすべき3条件(文脈独立性・定量化可能性・end-to-end網羅性)と、Pareto支配・比較領域・理想的スケーリングに基づく7つの評価原則を提示する。
### Cybernetics: or Control and Communication in the Animal and the Machine, 2nd ed.(Norbert Wiener、The MIT Press 1961、第2版序文 + Introduction + 全10章)(2026-08-16 ingest-book)
- [[@1961__MITPress__Cybernetics - Preface to the Second Edition]] — 初版から 13 年の回顧と、非線形系をブラックボックス/ホワイトボックスの相関で同定する技術的核心、第 2 版補章(学習機械・自己組織化)の見取り図を示す序文。
- [[@1961__MITPress__Cybernetics - Introduction]] — [[アルトゥーロ・ローゼンブルース]] との境界領域探究の確信、対空射撃管制の予測問題、フィードバック概念の発見を経て、1947 年に「サイバネティクス」を命名し学際的な Macy 会議へと発展した経緯を語る、本書で最も参照される部分。
- [[@1961__MITPress__Cybernetics - Chapter 1 Newtonian and Bergsonian Time]] — 天文学(可逆)と気象学(不可逆)の対比を軸に、統計力学の発展と自動機械論の哲学史を辿り、現代のオートマトンを通信工学とベルクソン的不可逆時間で捉え直す。
- [[@1961__MITPress__Cybernetics - Chapter 2 Groups and Statistical Mechanics]] — [[Willard Gibbs]] の統計力学とアンサンブル的視点を [[Henri Lebesgue]] の測度論が基礎づけ、変換群・不変量・エルゴード定理へ至る過程を描く。
- [[@1961__MITPress__Cybernetics - Chapter 3 Time Series, Information, and Communication]] — 情報量を負のエントロピーとして定義し、独立情報源の加法性・ノイズ下の有限性を示したのち、エルゴード定理とブラウン運動から最小二乗最適な予測・フィルタ演算子を導出する。本書で最長かつ最も数学的な章。
- [[@1961__MITPress__Cybernetics - Chapter 4 Feedback and Oscillation]] — 臨床像(小脳性振戦)から出発し、負のフィードバックと発振を同じ線形作用素論の表裏として定式化し、補償器の配置・情報的フィードバック・ホメオスタシスを論じる本書の中心章。図 6 点。
- [[@1961__MITPress__Cybernetics - Chapter 5 Computing Machines and the Nervous System]] — 計算機のリレー構造と神経系のニューロン(悉無律)を二進法・二分法の議論で結びつけ、記憶・論理・学習・情動的色調のフィードバック図式へ展開する。
- [[@1961__MITPress__Cybernetics - Chapter 6 Gestalt and Universals]] — 大きさ・向きが変わっても同一の形を認識する「普遍」の知覚を、変換群にわたる群走査として機械化し、盲人用読書器に応用する。
- [[@1961__MITPress__Cybernetics - Chapter 7 Cybernetics and Psychopathology]] — 精神病理学への留保から出発し、機能的精神障害を循環する記憶とシナプス透過性の疾患として捉え、神経系の過負荷・交通渋滞・半球優位性を論じる。
- [[@1961__MITPress__Cybernetics - Chapter 8 Information, Language, and Society]] — 個体の細胞共同体から人間・アリの通信を経て、自由市場のホメオスタシス説をゲーム理論で反駁し、社会科学の方法論的限界を自ら留保する Part I 最終章。
- [[@1961__MITPress__Cybernetics - Chapter 9 On Learning and Self-Reproducing Machines]] — 学習(個体発生的/系統発生的の対比、ゲーム学習機械)と自己複製(非線形トランスデューサによる構築手順)を、機械の学習として論じる補章。
- [[@1961__MITPress__Cybernetics - Chapter 10 Brain Waves and Self-Organizing Systems]] — 脳波の自己相関・パワースペクトル測定と非線形な周波数引き込みによる自己組織化仮説を、交流発電機網や生物学的自己複製への思弁的類推とともに論じる最終章。図 3 点。
### End-To-End Arguments in System Design(J. H. Saltzer, D. P. Reed, D. D. Clark、ACM TOCS 1984)(2026-08-16 ingest-paper)
- [[@1984__TOCS__End-To-End Arguments in System Design]] — 分散コンピュータシステムのモジュール間の機能配置を導く設計原則「エンドツーエンド論」を定式化した古典的論文。ケアフルファイル転送のケーススタディを中心に、配送確認・暗号化・重複メッセージ抑制・FIFO配送保証・トランザクション管理(SWALLOW)への適用を示し、音声パケット通信の事例で原則が絶対的規則ではなくガイドラインであることを論じる。図表なし。
### Methodology of Algorithm Engineering(Jan Mendling, Henrik Leopold, Henning Meyerhenke, Benoît Depaire、ACM Computing Surveys 2025)(2026-08-16 ingest-paper)
- [[@2025__CSUR__Methodology of Algorithm Engineering]] — [[Jan Mendling]]・[[Henrik Leopold]]・[[Henning Meyerhenke]]・[[Benoît Depaire]]による、アルゴリズムエンジニアリングのための統一研究枠組み論文(*ACM Computing Surveys*, Vol. 58, No. 4, Article 94, 38 pages, October 2025)。科学哲学の存在論・認識論・方法論の3領域を土台に、Real-World Problem→Algorithmic Task→Algorithm Design→Algorithm Implementationの存在論的連鎖(Staples 2014に基づく)、Popperの三世界論による知識の位置づけ(Figure 2)、9つの妥当性概念(Table 1)を体系的に提示する。図表3点(すべてベクター描画のフレームワーク図、PyMuPDFキャプション座標クロップで取得・全件埋め込み)、表4点(Table 1-4はMarkdown表に転記)。
### What is Technology? Six Definitions and Two Pathologies(Paul Nightingale、SPRU Working Paper Series SWPS 2014-19)(2026-08-16 ingest-paper)
- [[@2014__SPRU__What is Technology Six Definitions and Two Pathologies]] — [[Paul Nightingale]]による、技術の哲学・歴史学・社会学・経済学を統合し技術の6定義と2病理を論じる理論論文。[[John Searle]]のSpeech Act理論(方向性の議論)で科学と技術の違いを定式化し、[[Michael Polanyi]]の暗黙知論・動作原理論を土台に、技術理解の失敗を「ガジェット化」「世界の技術的自然化」という2つの病理として名指しする。図表はTable 1(定義の一覧、Markdown表に転記)と方向性の議論を図示した概念図1点(埋め込み画像、本文に明示的な図番号なし)。
### Resilience Engineering: Concepts and Precepts(Erik Hollnagel, David D. Woods, Nancy G. Leveson 編、Ashgate 2006、抜粋: Prologue + 第1章)(2026-08-16 ingest-book)
- [[@2006__Ashgate__Resilience Engineering - Prologue Resilience Engineering Concepts]] — 安全研究・実務が後知恵(hindsight)に支配されてきたことを論じ、人間を信頼できないコンポーネントとみなす事後対応型の「エラー計数」パラダイムから、人間の適応能力を安全の源泉とみなす先回り型のレジリエンスエンジニアリングへの転換を提示する。安全を集計可能な商品でなく組織のコアバリュー、Weick の言う「動的な非出来事」として捉え直す。
- [[@2006__Ashgate__Resilience Engineering - Chapter 1 Resilience – the Challenge of the Unstable]] — 事故モデルを単純線形(ドミノ)・複雑線形(スイスチーズ)・非線形システミックの 3 世代に整理し、それぞれに対応するリスク評価手法(イベントツリー / フォールトツリー / 機能共鳴)を突き合わせたうえで、レジリエンスを外乱後に動的安定状態を維持・回復する内在的能力として再定義する。図 3 点を全件埋め込み。章末に Yushi Fujita の挿話「Systems are Ever-Changing」を節として併載。
### Practical Reliability Engineering(Patrick D. T. O'Connor・Andre Kleyner、Wiley 2012、第 5 版、本編全 17 章 + Appendix 5・6、504 ページ)
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 1 Introduction to Reliability Engineering]] — 信頼性を「規定の条件下で規定の期間にわたり要求機能を故障せずに遂行する確率」と定義し、故障原因の分類、修理可能品と修理不能品の区別、バスタブ曲線、成立史、プログラム活動と経済性という全体の枠組みを与える導入章
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 2 Reliability Mathematics]] — 確率論・連続/離散分布・統計的推論・点過程を解説しつつ、工学的ばらつきは自然現象の統計と質的に異なり数学は工学判断に従属するという本書の立場を数学章の中で表明する
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 3 Life Data Analysis and Probability Plotting]] — 打ち切りデータの分類・メジアンランク・ワイブル確率プロット・信頼限界という寿命データ解析の実務を扱い、統計的適合度だけで分布を選んではならないと結論する
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 4 Monte Carlo Simulation]] — 閉形式解が得られない問題への数値的代替手段として、追加分布・逆変換抽出法・実施手順を扱う第 5 版新設の短い章
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 5 Load–Strength Interference]] — 荷重と強度を分布として扱い裾の重なりから故障確率を導くことで、決定論的な安全率と確率的な信頼性推定を橋渡しする
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 6 Reliability Prediction and Modelling]] — 信頼性予測の根本的限界を論じたうえで、規格ベース予測の限界と RBD・FTA・マルコフ解析・ペトリネットによるシステムモデリング技法を対比的に整理する
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 7 Design for Reliability]] — test-analyse-and-fix に代え Identify・Design・Analyse・Verify・Validate・Control の 6 段階で信頼性を開発初期から設計へ組み込む DfR プロセスを提示する
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 8 Reliability of Mechanical Components and Systems]] — 過大応力による破断と強度の経時劣化を軸に、疲労・クリープ・摩耗・腐食・振動衝撃・温度影響を物理過程として説明し、材料・部品・工程の選定指針を扱う
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 9 Electronic Systems Reliability]] — 電子システムの信頼性を部品・回路システム・生産試験保守の 3 層で扱い、部品の高信頼性化によりシステム故障の主因が部品外へ移ったことを論じる
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 10 Software Reliability]] — ソフトウェアには摩耗も個体差もなく故障は設計欠陥の顕在化であるという原則から、同一コード冗長化が効かず多様性が要る理由と、信頼性予測モデルへの懐疑的評価までを論じる
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 11 Design of Experiments and Analysis of Variance]] — DOE と ANOVA を、統計的有意性と工学的重要性は別物であるという立場のもとで解説し、タグチメソッドを留保付きで評価する
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 12 Reliability Testing]] — 統合試験計画・試験環境・加速試験(HALT/HASS)・FRACAS を扱い、「成功の実証ではなく故障を起こして学ぶ」という試験思想を提示する
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 13 Analysing Reliability Data]] — パレート分析、加速試験データ解析(加速係数と加速モデル)、修理可能系の ROCOF 解析、CUSUM と比例ハザードモデル、保証データ解析を扱う
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 14 Reliability Demonstration and Growth]] — 信頼性実証(必要試験数が指数的に増大するという実務的限界を含む)と信頼性成長(Duane 法・TAAF)の 2 部構成をとる第 5 版新設章
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 15 Reliability in Manufacture]] — 製造工程と人間のばらつきの管理、抜取検査の論理的限界、工程改善、ストレススクリーニング、生産 FRACAS を扱い、信頼性を作り込む段階を論じる
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] — 保守と保守性が可用性(固有・達成・運用の 3 尺度)にどう影響するかを定義し、予防保守の有効性がハザード率の傾向に規定されることを示す
- [[@2012__Wiley__Practical Reliability Engineering - Chapter 17 Reliability Management]] — 信頼性を技法ではなくマネジメントの問題として扱う最終章。方針・統合プログラム・コスト・製造物責任・契約・供給者管理・能力成熟度を経て、戦略的原則と戦術的方法の区分で本書を締めくくる
- [[@2012__Wiley__Practical Reliability Engineering - Appendix 5 Failure Reporting, Analysis and Corrective Action System (FRACAS)]] — FRACAS の分析出力(故障一覧・パレート分析・MTBF・傾向分析・確率/ハザードプロット)と運用上の注記を示す 2 ページの様式例
- [[@2012__Wiley__Practical Reliability Engineering - Appendix 6 Reliability, Maintainability (and Safety) Plan Example]] — 第 17 章 §17.10 が概念として述べるプロジェクト信頼性計画を、実際に発行される RAMS 計画書の目次・節構成のレベルで示す雛形
### Gleaner: A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics(Yifan Yang, Aoyang Fang, Songhan Zhang, Pinjia He、ISSTA 2026 採択・arXiv:2604.16810)(2026-08-17 ingest-paper)
- [[@2026__ISSTA__Gleaner : A Semantically-Rich and Efficient Online Sampler for Microservice Diagnostics]] — [[Yifan Yang]]・[[Aoyang Fang]]・[[Songhan Zhang]]・[[Pinjia He]]([[The Chinese University of Hong Kong, Shenzhen]])による、オンラインテールベーストレースサンプラー Gleaner の提案論文(ISSTA 2026 採択)。トレースを「bag-of-edges」(EPS: event-pair set)として表現しグラフ構造解析を集合演算に置き換えることで、ログ意味論の考慮とオンライン性能(0.74ms/trace)を両立。root-span グルーピングに基づくアラーム駆動2層クォータ配分と DPP ベースの多様性選択により、1%サンプリング率でRCA精度を次点サンプラーより42%〜107%改善し、サンプリング済みデータでのRCAが全量データを上回るという「サンプリングはデータ削減でなくシグナル強化」知見を実証した。161件の障害注入ケース・140万件超のトレースからなる新規ベンチマークデータセットも公開。図表7点(すべてベクター描画、PyMuPDFキャプション座標クロップで全件埋め込み)、表4点(Table 1・4・6・8をMarkdown表に転記)。
### ActionNex: A Virtual Outage Manager for Cloud Computing(Zhenfeng Lin ほか13名、Microsoft、arXiv:2604.03512、ASE 2026 採択(ユーザー情報))(2026-08-17 ingest-paper)
- [[@2026__arXiv__ActionNex - A Virtual Outage Manager for Cloud Computing]] — [[Zhenfeng Lin]]ほか([[Microsoft PRIMO]]/[[Microsoft Research]]/[[Microsoft Azure Core]]/[[Azure CTO Office]])による、outage(障害)管理を end-to-end に支援する本番グレードのエージェントシステム ActionNex の提案論文。マルチモーダル運用信号を「critical events」という状態遷移抽象へ圧縮し、playbook から蒸留した Key-Condition-Action(KCA)三つ組の長期記憶・過去事例のエピソード記憶・ライブな作業記憶からなる階層記憶と組み合わせて、役割・段階条件付きの次善アクションを検索駆動(ルールトリガーでない)で推薦する。実行された人間のアクションを暗黙のフィードバックとして用いる自己進化設計を持つ。Azure の実運用 outage 8 件(約 800 万トークン・約 4,000 件の critical events)で precision 71.4%・recall 52.8〜54.8% を達成し、本番環境で試験導入(piloting)済み。段階別(Detect〜Resolve)に見ると outage が進行するほど recall が上昇し precision が低下する傾向を確認した。図表5点(Figure 1・2 は埋め込み画像、Figure 3 はベクター図で PyMuPDF キャプション座標クロップ、Table 1・2 は Markdown 表に転記)を全件埋め込み。
### Handbook of Software Reliability Engineering(Michael R. Lyu 編、IEEE Computer Society Press / McGraw-Hill 1996、全 17 章 + 付録 A・B)(2026-08-17 ingest-book)
- Book entity: [[wiki/entities/Handbook of Software Reliability Engineering|Handbook of Software Reliability Engineering]] — 編者が全文を無償公開している分野標準ハンドブック。章別 PDF 19 本・全 780 ページを 1 章 = 1 source ページで取り込んだ。原本はテキスト層のないスキャン画像のため、150 DPI のページ画像を視覚的に読み取って作成している。図表は手作業でのクロップとなるため各章 3〜8 点に絞り、計 106 点を埋め込んだ。全ページ `publish: false`。
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 1 Introduction]] — 編者 Lyu による導入章。fault/error/failure の用語基盤と、信頼性達成の4技法(障害予防・障害除去・障害耐性・障害/故障予測)への分類
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] — Laprie と Kanoun による、ハードウェアとソフトウェアを区別しない「X-ware」統一モデルとディペンダビリティ概念体系
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 3 Software Reliability Modeling Survey]] — Farr による信頼性成長モデルのサーベイ。Musa-Okumoto の5属性分類体系と主要モデル族の定義
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 4 Techniques for Prediction Analysis and Recalibration]] — Brocklehurst と Littlewood による予測精度の評価(PLR・u-plot・y-plot)と再較正
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 5 The Operational Profile]] — Musa らによる運用プロファイルの5段階作成手続きと、DEFINITY・FASTAR・PQRS への適用事例
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 6 Best Current Practice of SRE]] — AT&T 社内約70名の合意に基づく組織プロセスとしての SRE(活動配置・コスト実績・段階的導入)
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 7 Software Reliability Measurement Experience]] — Nikora と Lyu による JPL・Bellcore への適用経験。単一最良モデルの不在と、データ収集の実務的欠落
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 8 Measurement-Based Analysis of Software Reliability]] — Iyer と Lee による Tandem・IBM MVS・DEC VAX/VMS の稼働ログを用いた計測ベース解析
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 9 Orthogonal Defect Classification]] — Chillarege による ODC。defect type・trigger という意味論的属性で欠陥を分類し工程の効果を測る
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 10 Trend Analysis]] — Kanoun と Laprie による、劣加法性に基づく信頼性成長・劣化の統計的判定(モデル適用前の診断層)
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 11 Field Data Analysis]] — Jones と Vouk による出荷後の現場データ解析。IBM・Hitachi・Nortel・NASA スペースシャトルの実データ
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 12 Software Metrics for Reliability Assessment]] — Munson と Khoshgoftaar による静的複雑性メトリクスの主成分分析縮約と故障傾向モジュール予測
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 13 Software Testing and Reliability]] — Horgan と Mathur によるカバレッジ規準の階層と飽和効果。飽和は信頼性を最大3.33倍過大評価する
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 14 Fault-Tolerant Software Reliability Engineering]] — McAllister と Vouk による多版冗長方式と、20版アビオニクス実験が示した独立故障仮定の崩れ
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 15 Software System Analysis Using Fault Trees]] — Dugan による故障の木解析のソフトウェアへの拡張と、マルコフ連鎖との組み合わせ
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 16 Software Reliability Simulation]] — Tausworthe と Lyu によるレートベースシミュレーションと、Galileo 探査機搭載ソフトウェアへの適用
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 17 Neural Networks for Software Reliability Engineering]] — Karunanithi と Malaiya によるニューラルネットワークのノンパラメトリックなモデル化と分類器への応用
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Appendix A Software Reliability Tools]] — Stark による1996年時点の推定ツール6種のカタログと、2階層の選定基準
- [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Appendix B Review of Reliability Theory, Analytical Techniques, and Basic Statistics]] — 編者 Lyu による数学的下敷きの復習。各章が前提とする確率・統計・信頼性理論の道具
- [[@2025__SpeakerDeck__SONiCで800G AECケーブルを検証してみた]] — [[張朝程]]・[[内田泰広]](ソフトバンク株式会社)。SONiC Workshop Japan 2025(2025-05-19)発表資料、全28ページ(本編18+Appendix10)+YouTube動画の文字起こし。800G AECケーブルはDACと同じ銅素材にDSPを内蔵しAOCと異なりOE変換がないため消費電力を抑えられる構造、二社のSONiCスイッチ間リンクアップ検証でY社のみリンクせずCMISログ・`i2cdump`/`i2cset`によるレジスタ確認でTx Output Controlsレジスタが全レーン無効(0xFF)だったことが根本原因と判明した障害切り分け、Credo Semiconductor協力の専用テスターによる消費電力実測(AEC 11.04W、SR8 Optics比15%減・DR8 Optics比21%減)を扱う。新規 concept [[AECケーブル]]・[[CMIS]]、新規 entity [[Credo Semiconductor]] を作成、既存 entity [[張朝程]]・[[内田泰広]]・[[ソフトバンク株式会社]]・[[SONiC]] を更新。(slides / source / networking / optics)
### Principles of Network and System Administration(Mark Burgess、Wiley 2004、第 2 版、本編全 14 章)(2026-08-17 ingest-book)
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 1 Introduction]] — 技術と人間を対等に扱う工学分野としてシステム管理を定義し、ポリシー・予測可能性・拡張性という 3 つのメタ原理を提示する導入章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 2 System components]] — 「システム」を人間・ホスト・ネットワークの依存関係の網として定義し、ハードウェア・OS・ファイルシステム・プロセス・ネットワークの語彙を確定する参照章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 3 Networked communities]] — 共同体の原理からポリシーを定義し、システム管理を社会人類学として捉え直す章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 4 Host management]] — ホスト単体の設定でも大局を見失わないという姿勢を軸に、物理環境の保護・データ分離・ソフトウェア配置設計を扱う章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 5 User management]] — アカウント発行・資源制御の実務論と、管理者の倫理・利用者の福利という規範論を統合する章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 6 Models of network and system administration]] — ネットワーク管理をスター型からピアツーピア型まで 6 段階に類型化し、競合・免疫・収束の三つ組で保守モデルを理論的に基礎づける、本書の理論的中核章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 7 Configuration and maintenance]] — 第 6 章の類型学を実装の層へ下ろし、原因と症状のどちらを制御するか・宣言的言語・cfengine の動作原理・予防保守を論じる章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 8 Diagnostics, fault and change management]] — 因果の網としてシステムを捉え、原因木・確率的な故障の木・ゲーム理論・監視・品質保証を統一的に扱う、本書で最も理論負荷の高い章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 9 Application-level services]] — 応用層サービス(DNS・WWW・メール・NFS・Samba・印刷・Java)の設置を、登録・起動方式選択・アクセス制御という共通枠組みで統一的に扱う章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 10 Network-level services]] — 有限のネットワーク容量の配分を、QoS・囚人のジレンマ/ハト-タカゲーム・SLA の 3 視点で貫く、資源配分と契約の章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 11 Principles of security]] — セキュリティを 4 つの独立した問題に分解し、信頼関係とポリシーによるリスク受容として定義したうえで障害モードを類型化する章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 12 Security implementation]] — 第 11 章の原理を実装に落とし、正規化・認証・IPSec の規則衝突・ファイアウォール・侵害後対応までを扱う章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 13 Analytical system administration]] — システム管理を科学として行う方法論を論じ、誤差との比較による測定の解釈規律と、確率分布・フーリエ解析による解析手法を提示する章。
- [[@2004__Wiley__Principles of Network and System Administration - Chapter 14 Summary and outlook]] — 2004 年時点の著者が予見した情報管理・ソフトウェア工学との協働・遍在コンピューティング・システム管理の将来像を語る締めくくりの章。
### 仕事ではじめる機械学習 第2版(有賀康顕・中山心太・西林孝、オライリー・ジャパン 2021、第 2 版、全 12 章)(2026-08-17 ingest-book)
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 1 機械学習プロジェクトのはじめ方]] — 機械学習プロジェクトは課題設定・道具選び・モデル作成・サービス組み込みの 4 段階 10 ステップで進み、MVP による仮説検証と「機械学習を使わない選択肢」の検討を最優先し、機械学習特有の技術的負債には 5 つの対処法で臨む章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 2 機械学習で何ができる?]] — 分類・回帰・クラスタリング・次元削減というタスク分類のもと、scikit-learn のフローチャートによる選択軸と、同一データへの決定境界可視化による横並び比較でアルゴリズムを整理するカタログ章(図 37 点)。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 3 学習結果を評価するには]] — 分類(適合率・再現率・F 値・ROC/AUC)と回帰(RMSE・決定係数)のオフライン評価指標を解説したうえで、それだけでは不十分でビジネス指標を確認する A/B テストが別途要ると述べる章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 4 システムに機械学習を組み込む]] — 学習・予測のタイミングと予測結果のサービング方式の組み合わせを開発自由度対レイテンシのトレードオフで選び、教師データの制約を見越したログ設計をあらかじめ行う章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 5 学習のためのリソースを収集する]] — 教師データの取得手段を公開データセット・自作・同僚への依頼・クラウドソーシング・サービスへの組み込みの 5 通りに整理し、着手コスト・品質担保・スケールのトレードオフで選ばせる章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 6 継続的トレーニングをするための機械学習基盤]] — 長期運用のための継続的トレーニングと ML Ops を扱い、機械学習基盤を共通実験環境・予測サービング・パイプライン化・継続的トレーニングの 4 ステップに整理する章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 7 効果検証:機械学習にもとづいた施策の成果を判断する]] — ルービンの因果モデル・RCT・仮説検定という A/B テストの理論的基盤から、標本サイズ設計や母集団ハックのような落とし穴、A/B テストができない場合の差の差法までを一貫して解説する章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 8 機械学習のモデルを解釈する]] — 線形回帰の係数から p 値・決定木の可視化・Feature Importance・SHAP へと解釈手法を段階的に強めながら、各手法が何を答えられ何を答えられないかを離職予測データで示す章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 9 Kickstarterの分析、機械学習を使わないという選択肢]] — Kickstarter の資金調達データを題材に、達成率という正規化指標を導入した探索的データ分析だけで、機械学習を使わずに意思決定に足るレポートを作る過程を示す章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 10 Uplift Modelingによるマーケティング資源の効率化]] — A/B テストのデータを個体の特徴量で分解し、無関心・説得可能・天邪鬼・鉄板の 4 セグメントに分類して、介入に反応する対象だけへ資源を絞り込む章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 11 バンディットアルゴリズムによる強化学習入門]] — 事後分布の不確実性を評価値に組み込む Bayesian-UCB・UCB1・Softmax 法・Thompson Sampling で探索と活用のトレードオフを解き、A/B テスト・Uplift Modeling との関係性まで示す章。
- [[@2021__OReillyJapan__仕事ではじめる機械学習 - Chapter 12 オンライン広告における機械学習]] — リアルタイム入札を題材に、ビジネス設定を制約付き最適化問題として定式化する回路と、CTR 予測モデルを広告配信ログ特有の困難のもとで運用し続ける回路の両方を示す最終章。
### 信頼性の高い機械学習(Cathy Chen・Niall Richard Murphy・Kranti Parisa・D. Sculley・Todd Underwood、オライリー・ジャパン 2024、全 15 章)(2026-08-18 ingest-book)
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 1 はじめに]] — 著者らが「ML ループ」と呼ぶ終わりのない反復的な ML ライフサイクル(データ収集と分析→データマネジメント→ML 訓練パイプライン→アプリケーションの構築と検証→品質と性能の評価→SLO の定義と測定→ローンチ→監視とフィードバックのループ)の枠組みを、YarnIt という架空のオンライン小売店を例に提示する。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 2 データマネジメント]] — ML システムをデータ処理パイプラインとして捉え、データの段階(作成・取り込み・前処理・後処理)・信頼性(耐久性・一貫性・バージョン管理・性能・可用性)・保守性(セキュリティ・プライバシー・コンプライアンス)という 3 つの枠組みでデータマネジメントの実務を整理する。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 3 MLモデルの基礎]] — モデルアーキテクチャ/モデル定義/訓練済みモデルの区別と、訓練データ・ラベル・訓練方法に潜む脆弱性の所在、運用者向けの診断的な質問集を、yarnit.ai の毛糸クリック予測モデルを題材に示す。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 4 特徴量と訓練データ]] — 特徴量(定義と値の区別)・人間が生成したラベル(アノテーション体制・品質計測・能動学習)・メタデータという 3 つのサブシステムの設計を、特徴量ストアを中心に論じる。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 5 モデルの確実性と品質の評価]] — モデルの確実性(システムを壊さないか)とモデルの品質(役に立つか)という独立した 2 つの評価軸を、確実性チェック・評価データ分布の設計・評価指標の 3 分類に分けて体系立てる。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 6 公正さ、プライバシー、倫理的なMLシステム]] — 公平性の複数定義の非両立性(グループパリティ 対 キャリブレーション)、プライバシーの技術的・制度的対策、責任ある AI の ML パイプライン別チェックリストを扱う。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 7 MLモデル訓練システム]] — 訓練システムの必要条件と基本アーキテクチャを示した上で、一般的な信頼性の原則、データ感度・再現性・計算リソース容量というよくある問題、組織的な構造上の信頼性課題を扱う。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 8 サービス運用]] — サービス運用アーキテクチャをオフライン・オンライン・サービスとしてのモデル(MaaS)・エッジの 4 類型に整理し、トラフィック・レイテンシ・ハードウェア・バージョン管理といった判断軸から選択指針を与える。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 9 モデルの監視と可観測性]] — 運用中の ML システムをモデル・データ・サービスの 3 レイヤーに分けて監視する枠組みを中核に、運用開始前の検証、ドリフトとデータ品質チェックの区別、ML 固有の SLO 設計までを体系化した、本書で最も長く実務的な章。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 10 継続的なML]] — 継続的な ML システムに特有の観察(外界の出来事・フィードバックループ・時間的影響・危機対応・段階的ローンチと安定ベースライン・モデル管理)を扱い、「全ての運用 ML システムは継続的な ML システムとして扱うべきである」という推薦で締めくくる。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 11 障害対応]] — ML の障害対応は一般的な障害管理の骨格(FEMA 由来の役割分担を含む)を保ちつつ、検知の困難さ・関与組織の広さ・タイムラインの不明確さの 3 点で ML 特有の変化を伴うことを、長大な事例研究と役割別の枠組みで示す。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 12 製品とMLの関わり方]] — アジャイル開発の前提と ML の相性の悪さを論じたうえで、発見と定義からサポート・メンテナンスまでの循環モデルを提示し、構築か購入かの判断軸と yarnit.ai の推薦機能事例で締めくくる。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 13 MLの組織への統合]] — ML 実装がもたらす重大な組織リスク(魔法視・メンタルモデルの慣性・Westrum 組織類型による文化差・サイロ化の限界)と、[[Jay R. Galbraith]] のスターモデル(戦略・構造・プロセス・報酬・人材)による組織設計の枠組みを提示する。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 14 実践的なML組織の事例]] — YarnIt を舞台に、新規集中型・分散型・中央集権型インフラと分散型モデリングのハイブリッドという 3 つの組織シナリオを通じ、スターモデルのうちプロセス・報酬・人材の 3 要素が具体的にどう現れるかを描く。
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 15 ケーススタディ:MLOpsの実践]] — [[Dialpad]]・[[Google]]・[[Landing AI]] という 3 社 6 事例の実践者自身による寄稿を通じ、フィードバックループ・実績値の代理性・プライバシーと再現性の緊張・ローカル計測と本番の乖離・反復的ラベル定義・上流依存の回帰テストという形で、1〜14 章の原則が実務でどう現れるかを示す。
### Next-generation LLM Inference Network: How ZCube Alleviates Network Bottlenecks?(Z.ai / Harnets.AI / Tsinghua University、X Article、2026-05-20)(2026-08-18 ingest)
- [[@2026__X__Next-generation LLM Inference Network - How ZCube Alleviates Network Bottlenecks]] — [[Zhipu AI|Z.ai]]・[[Harnets.AI]]・[[Tsinghua University]] が ACM SIGCOMM 2025 発表のネットワークトポロジ [[ZCube]] を GLM-5.1 コーディング推論の本番クラスタへ初めて大規模展開した事例報告。Prefill-Decode 分離推論の KV Cache 転送非対称性が [[Fat-Tree|ROFT(Rail-Optimized Fat-Tree)]] のレール割り当てを破綻させ、トポロジ誘発輻輳を招くメカニズムを Grafana 実測で示し、Spine 層を撤廃した完全フラット化トポロジ ZCube への移行で GPU 推論スループット 15%超向上・TTFT P99 40.6%削減・ネットワークハードウェア CapEx 33%削減を達成した。図5点(トポロジ図・ROFT/ZCube 比較図・PFC バックプレッシャー実測・スループット/TTFT 比較チャート)を埋め込み。
### 機械学習システムデザイン(Chip Huyen、オライリー・ジャパン 2023、全 11 章 + 付録 A)(2026-08-18 ingest-book)
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 1 機械学習システムの概要]] — 機械学習を使うべき条件と使うべきでない条件を整理し、研究の機械学習と実現場の機械学習の違い(要求・計算優先度・データ・公正さ・説明能力)、機械学習システムと従来のソフトウェアエンジニアリングの違いを論じる導入章。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 2 機械学習システム設計の概要]] — ビジネス目標に沿った目標設定と 4 要件(信頼性・拡張性・保守性・適応性)、反復型プロセス、問題を入力・出力・目的関数として組み立てる方法と目的関数のデカップリングを扱う。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 3 データエンジニアリングの基礎知識]] — データフォーマット(行優先・列優先)、データモデル(リレーショナル・ドキュメント・グラフ)、ストレージエンジン(OLTP・OLAP・ETL)、データフローの 3 形態、バッチ処理とストリーム処理という、機械学習システムを支えるデータ工学の基礎を解説する。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 4 訓練データ]] — サンプリング手法、ラベル付け(手作業のラベル・天然のラベル・ラベル不足への対処)、クラスの不均衡、データオーグメンテーションという、質のよい訓練データを手に入れる技法を扱う。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 5 特徴エンジニアリング]] — 特徴エンジニアリングの一般的手法(欠損値処理・スケーリング・離散化・カテゴリーエンコード・特徴交差・位置埋め込み)を概観し、データリークの原因と検出法を詳述し、優れた特徴を重要度と汎化性の 2 軸で評価する。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 6 モデル開発とオフライン評価]] — モデル選択の 6 指針・アンサンブル・実験管理とバージョン管理・分散訓練・AutoML と、ベースライン比較を前提とする摂動テスト・不変性テスト・キャリブレーション・スライスベース評価というオフライン評価の手法群を扱う。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 7 モデルのデプロイと予測サービス]] — デプロイの 4 誤解の解消、バッチ予測とオンライン予測の対比、モデル圧縮(低ランク分解・知識蒸留・枝刈り・量子化)、クラウドとエッジのハードウェア最適化まで、モデルデプロイをエンジニアリング課題として体系的に扱う。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 8 データ分布のシフトと監視]] — 実環境デプロイ後の障害原因を整理し、データ分布のシフト(共変量シフト・ラベルシフト・コンセプトドリフト)を数学的に定義して検知と対処を示し、機械学習特有の監視対象(精度・予測・特徴・生入力)と可観測性との違いを説明する。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 9 実現場での継続学習とテスト]] — 継続学習(ステートレス再訓練とステートフル訓練の区別、導入の 4 段階、データの鮮度の価値による更新頻度の決定)と、静的なオフライン評価の限界を補う実環境でのテスト(シャドウデプロイ・A/Bテスト・カナリアリリース・インターリービング・バンディット)を扱う。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 10 MLOpsにおけるインフラとツール]] — ストレージとコンピューティング・リソース管理・機械学習プラットフォーム・開発環境の 4 層で MLOps インフラを整理し、下位ほどコモディティ化が進む構図と構築対購入の判断指針を示す。
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 11 機械学習の人的側面]] — 機械学習システムの確率論的性質がもたらすユーザー体験の課題、チーム構成(別チーム対エンドツーエンドのデータサイエンティスト)、責任あるAI(Ofqual・Strava の失敗事例と実装レベルの枠組み)を扱う。
- [[@2023__OReillyJapan__機械学習システムデザイン - Appendix A 機械学習システムを外部に提供する]] — 原著にない日本語版オリジナルの寄稿([[宮川大輔]]・[[株式会社JDSC]])。機械学習システムを外部の顧客企業に受託して構築する際に固有の、契約(準委任契約・ステアリングコミッティ)・データパイプライン設計・コンプライアンス・利害関係者管理・「PoC ゾンビ」回避といった論点を仮想事例を通じて論じる。
### The Roots of Software Engineering(Michael S. Mahoney、CWI Quarterly 1990)(2026-08-18 ingest)
- [[@1990__CWIQuarterly__The Roots of Software Engineering]] — 「ソフトウェアエンジニアリング」という語が1967年のNATO会議でなぜ意図的に挑発的な語として選ばれたかを、計算機商業化とプログラマ人口急増(1968年時点で500社・10万人)という社会的条件から跡づけ、Taylorの科学的管理法・Fordの組立ライン・機械工具産業の互換部品モデルという、他分野から借用され吟味されないまま残ったモデル群にソフトウェア工学の議論が規定され続けていると論じる短編論考。全10ページを通読。
### What Goes Around Comes Around... And Around...(Michael Stonebraker・Andrew Pavlo、ACM SIGMOD Record 2024)(2026-08-18 ingest-paper)
- [[@2024__SIGMODRecord__What Goes Around Comes Around... And Around]] — 2005年の同名論文(Stonebraker & Hellerstein)の20年後の続編。MapReduce・キーバリューストア・ドキュメントDB・カラムファミリ・テキスト検索・配列DB・ベクトルDB・グラフDBという8つのデータモデル潮流と、カラム型システム・クラウドDB・データレイク/レイクハウス・NewSQL・ハードウェアアクセラレータ・ブロックチェーンDBという6つのアーキテクチャ潮流を検証し、RM/SQLから逸脱した多くの試みがニッチ市場にとどまるか結局SQLライクなインターフェースを備えてRDBMSへ収斂しつつあると論じる。図表なし(全文検索で確認済み)。
### カオスエンジニアリング ― 回復力のあるシステムの実践(オライリー・ジャパン 2022、イントロダクション + 全 21 章)(2026-08-18 ingest-book)
- [[@2022__OReillyJapan__カオスエンジニアリング - Introduction カオスの誕生]] — Netflix の 2008 年データベース障害とクラウド移行を起点に Chaos Monkey・Chaos Kong が生まれ、2015 年の原則定式化とコミュニティ形成を経て分野が成立するまでの歴史。実践が理論に先行した順序を時系列で示す。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 1 複雑なシステムとの出会い]] — 線形/非線形とメンタルモデルの構築不能性で複雑なシステムを定義し、妥当な設計判断でも防げない 3 つの機能停止実例を通じて、偶発的複雑性も本質的複雑性も持続可能な形では削減できないと論じる。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 2 複雑なシステムの舵を取る]] — 動的安全モデル(経済性・ワークロード・安全性)と複雑性の経済的支柱(状態・関係・環境・可逆性)を並置し、安全性と可逆性という独立した 2 軸からカオスエンジニアリングを正当化する。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 3 原則の全体像]] — 「実験 対 テスト」「ベリフィケーション 対 バリデーション」で規律を定義し、「モノを壊すこと」「抗脆弱性」との違いを明確にしたうえで、発展した 5 原則を提示する本書の理論的中核。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 4 Slackの惨劇シアター]] — カオス前提で設計されていないレガシーなシステムに対する開発環境先行・段階的ゲート付きの演習プロセス。実験の前に必要な耐障害性投資という前提条件を明示する。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 5 Google DiRT 災害からの復旧テスト]] — 2006 年開始の全社演習。技術システムだけでなくビジネスプロセスや非エンジニアリング部門も対象とし、SLO 非破壊ルールと 2 名以上の外部レビュワーによる計画審査で制度化する。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 6 Microsoftにおける実験の多様化と優先順位づけ]] — 障害シナリオを既知/未知×期待/予期せぬの 3 カテゴリに整理し、発生頻度・対処確度・切迫度の 3 特性と単一/複合/波及の 3 段階で優先順位をつける枠組み。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 7 LinkedIn メンバーに対して配慮すること]] — リクエストレベル故障注入 LinkedOut と、対象母集団を従業員・合成ユーザへ差し替える戦略。爆発半径を「狭める」のでなく「差し替える」第三のパターンを示す。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 8 Capital Oneにおけるカオスエンジニアリングの導入と進化]] — 規制産業での導入。監査証跡生成とデータ非流出のため独自ツールを内製し、実験中のアラート受信自体を実験失敗のシグナルとみなす。コンプライアンスを普及の追い風と位置づける。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 9 先見性を生み出す]] — 認知面接とファシリテーションでメンタルモデルの差異を可視化し先見性を養う。Netflix ChAP は技術的に成功したが利用者は作成者 4 人にとどまり、自動化が専門知識の広がりを浅くした。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 10 人間的なカオス]] — 3 原則を組織そのものに適用する。人物の不在を単一障害点として注入するゲームデー、チーム間ローテーション、ボトムアップの文化的実験の 3 事例と、Westrum モデルによる実験受容度診断。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 11 ループの中の人々]] — Fitts のリスト(1951)と HABA-MABA に代表される機能配分思想を認知システム工学から批判する。Hollnagel の「置き換えの神話」を引き、人間は約束に責任を持てる点で機械と本質的に異なると論じる。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 12 実験の選択に関する課題(と、その解決策)]] — 人間の直感は伝達不可能なので実験選択の基準に据えられない。LDFI により可観測性データから SAT/ILP で実験候補を機械的に導出する。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 13 カオスエンジニアリングの費用対効果]] — インシデント削減の恩恵は「可用性向上→リリース高速化→複雑さ増大」の力学で一時的になりやすい。Kirkpatrick モデル 4 段階を ROI 証明に転用し、ChAP は「救えた SPS」で価値を示した。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 14 オープンな心、オープンな科学、そしてオープンなカオス]] — 対立的マインドセットは衝突を、協調的マインドセットは共同オーナーシップを生む。Open Chaos Initiative は実験を 7 要素で定義し定常状態の仮説を 2 回評価する。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 15 カオスの成熟モデル(CMM)]] — 「導入」と「洗練」という直交する 2 軸。導入は賛同者・参加割合・前提条件(最重要は劣化状態の検知能力)・障壁の 4 考慮点、洗練はゲームデーからプラットフォーム自動化までの 5 段階。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 16 継続的ベリフィケーション]] — CI→CD→CV という系譜に位置づけ、カオスエンジニアリングを包含する上位規律として継続的ベリフィケーションを定義する。CV ツールを ChAP(経験的)と Vizceral(定性的)の両極に分ける。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 17 サイバーフィジカルで行こう]] — 物理的結果が不可逆な系への拡張。機能安全規格と FMEA はカオスエンジニアリングの原則に対応するが多点故障を扱えず、ソフトウェアの多用がこれを深刻化させる。プローブ効果も課題。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 18 HOPとカオスエンジニアリングの出会い]] — 製造業の安全マネジメント体系 HOP の 5 原則と接続する。アクションアイテムのクローズ自体への注力が有効性と持続可能性を犠牲にするという批判を含む。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 19 データベースにおけるカオスエンジニアリング]] — PingCAP の TiDB/TiKV での実践。100% ユニットカバレッジでも Raft スナップショット破損は捉えられない。故障注入を 4 分類に整理し Schrodinger で自動化する。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 20 セキュリティカオスエンジニアリングの事例]] — セキュリティ制御そのものを実験対象にする。RCA 批判のもと Red/Purple チームを補完する ChaoSlingr を示し、ポート設定ミス実験で半数のケースでファイアウォールの検知・ブロック失敗を発見。
- [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 21 おわりに]] — 「線の下(ツール)/線の上(人々・組織)」を区別し、回復力を作るのはツールでなく人々だと結ぶ。信頼性のためのルール強制が逆効果になりうる 3 例を挙げる。
- [[@2015__SIGCOMM__Pingmesh - A Large-Scale System for Data Center Network Latency Measurement and Analysis]] — Microsoft の全サーバ常時参加型データセンターネットワークレイテンシ計測・分析システム。3階層完全グラフによる最大カバレッジ設計で、ネットワークSLA追跡とパケットブラックホール・ランダムサイレントドロップの検知を実現する。
- [[@2026__SIGCOMM__FabricPerf - Measuring NIC-less Scale-Up Network through GPU Communication Kernel Profiling]] — HKUのGPU通信カーネルプロービングによるNICなしScale-upネットワーク(NvLink)計測ツールキット。GPTPクロック同期とメモリトラフィックモデリングでチャネル不均衡・LLCキャッシュ非効率を発見。
### M2-MFP: A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure(Hongyi Xie ほか、KDD 2025)(2026-08-19 ingest-paper)
- [[@2025__KDD__M2-MFP - A Multi-Scale and Multi-Level Memory Failure Prediction Framework for Reliable Cloud Infrastructure]] — Huawei Cloud の 70,000 超 DIMM・9 か月分の Correctable Error ログから DIMM レベル・bit レベルの多階層 2 値行列特徴を抽出する Binary Spatial Feature Extractor(BSFE)と、Time-Patch(LightGBM)・Time-Point(DIMM-Centric Gini 決定木)の二経路時間モデリングを組み合わせたメモリ障害予測フレームワーク。最良ベースライン比 F1 約 55% 改善し、Huawei Cloud の AIOps プラットフォームへ本番デプロイ(40 万台超のサーバーを監視)。図8点・表5点(比較・アブレーション・オンライン検証)を埋め込み。
### Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse(Taekyung Heo ほか、NVIDIA、arXiv 2026)(2026-08-19 ingest-paper)
- [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]] — 同一LLMファミリ内(Qwen3・Llama 3.1・Ministral 3)の異なるサイズのモデル間でKVキャッシュを転送し受信側の再プリフィルを省略する、勾配学習不要の閉形式per-headリッジマッパー。matched-KVペアの6組中4組が標準精度の73〜98%を保持しつつ再プリフィル比2.7〜25倍高速。attention出力コサイン類似度が校正R²よりcross-pair転送品質を予測する(r=+0.57 vs r=−0.20)。図9点を全点埋め込み。
### ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production(Yuxing Xiang ほか、Peking University / Alibaba Group、NSDI '26)(2026-08-19 ingest-paper)
- [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]] — Alibaba Cloud Model Studio の本番クラスタから4か月間・12モデル・35.4億リクエストを収集し、言語・マルチモーダル・推論の3カテゴリでLLMサービングワークロードを横断的に特性化。複雑な変動パターンの多くが少数の上位クライアントのレート変動に起因する因果構造(クライアント分解)として説明できることを示し、この知見に基づくワークロード生成フレームワーク ServeGen がNAIVE生成より正確なベンチマークを実現することを、インスタンスプロビジョニングとPD分離の2ケーススタディで実証した。図21点を全点埋め込み。
### Evaluating Kubernetes Performance for GenAI Inference: From Automatic Speech Recognition to LLM Summarization(Sai Sindhur Malleni ほか、Red Hat / Illinois Institute of Technology、ICPE 2026)(2026-08-19 ingest-paper)
- [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]] — Kueue(バッチスケジューリング)・Dynamic Accelerator Slicer(GPU 動的 MIG スライシング)・Gateway API Inference Extension(GAIE、分散 LLM 推論ルーティング)を組み合わせた Kubernetes ネイティブ GenAI 推論パイプライン(Whisper 音声認識バッチ推論 + LLM 要約オンライン推論)を Red Hat OpenShift Service on AWS 上で評価。Kueue の優先度・プリエンプションでメイクスパン最大 15%、DAS の動的スライシングで平均ジョブ完了時間 36%、GAIE の Precise Prefix-Cache Aware Scheduling でテール TTFT 最大 90% の改善を達成。図7点・表6点を全点埋め込み。
### DeepServe: Serverless Large Language Model Serving at Scale(Junhao Hu ほか、Huawei Cloud / Peking University、USENIX ATC '25)(2026-08-19 ingest-paper)
- [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]] — Huawei Cloud のフルホスト型サーバーレス AI プラットフォーム DeepServe。request-job-task 抽象化で post-training・agent serving・model serving を統合し、サービングエンジン FlowServe(microkernel設計・NPU中心実行・SPMD)、PD分離/PD同居を実測ヒートマップから動的に切り替えるPD-awareスケジューリング、pre-warming・DRAM事前ロード・NPU-forkによる64インスタンスへの数秒スケーリングを提案。1年以上のAscend NPUクラスタ本番運用実績。図11点を全点埋め込み(発表動画の文字起こしを補助テキストとして使用)。
### The Flux Operator(Vanessa Sochat, Aldo Culquicondor, Antonio Ojea, Daniel Milroy、arXiv 2023)(2026-08-19 ingest-paper)
- [[@2023__arXiv__The Flux Operator]] — LLNL と Google の共著。HPC ワークロードマネージャ [[Flux Framework]] を Kubernetes の Indexed Job・headless service・ConfigMap のみで稼働させる Kubernetes Operator「Flux Operator」を提案し、「収束コンピューティング(converged computing)」の具体例として位置づける。LAMMPS を用いた強スケーリング実験(8/16/32/64ノード)で [[MPI Operator]] と比較し総壁時間平均約5%高速。状態保存・弾力性・オートスケーリング・マルチテナンシー・バースティング・ワークフロー統合([[Kueue]] への統合含む)という実験的機能を実装。図5点を全点埋め込み、Table 1(Flux Frameworkの構成プロジェクト)をMarkdown表として転記。
### WVA: A Global Optimization Control Plane for llmd(Abhishek Malvankar ほか、IBM Research / University of Bologna、arXiv 2026)(2026-08-19 ingest-paper)
- [[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]] — [[llm-d]] と共同設計された Kubernetes ネイティブオートスケーラ Workload Variant Autoscaler(WVA)。ハードウェア・並列度・量子化のタプルである Variant を第一級抽象として導入し、KV キャッシュ利用率・キュー長という推論エンジン内部の飽和シグナルに基づく headroom ベースのグローバル最適化と fragmentation-aware scale-down により、Kubernetes HPA の資源中心・ハードウェア均質前提の限界を克服する。200 基の H100 GPU を持つ実機 OpenShift クラスタでの検証で、HPA 比の有効スループット最大 37% 改善・リクエスト失敗数 10 分の 1 を達成。デプロイ上限到達時(6 RPS)には保守的な HPA に劣後する逆転も論文自身が報告する。図6点を全点埋め込み。
### Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol(Vasundra Srinivasan、arXiv 2026)(2026-08-19 ingest-paper)
- [[@2026__arXiv__Bridging Protocol and Production - Design Patterns for Deploying AI Agents with Model Context Protocol]] — エンタープライズ AI エージェントプラットフォームの本番展開(クラウドプロバイダの MCP サーバ統合、クライアント名秘匿)から得た [[Model Context Protocol]] 運用の教訓。identity propagation・adaptive tool budgeting・structured error semantics という3つのプロトコルレベルの欠落に対し、Context-Aware Broker Protocol(CABP、JWT クレームをリクエストごとに注入する6段ブローカーパイプライン)・Adaptive Timeout Budget Allocation(ATBA、p99レイテンシ分布に基づく動的タイムアウト予算配分)・Structured Error Recovery Framework(SERF、machine-readableなエラー分類による決定論的自己修復)の3機構を検証可能な仮説(H1〜H6)として提案。Phantom Tool・Silent Egress Failure・Retry Storm の3つの実失敗事例、脅威モデル(T1〜T4)、本番準備チェックリストを提示。図5点を全点埋め込み(ベクター描画のためPyMuPDFキャプション座標クロップで取得)、表2点をMarkdown表として転記。
### Envoy AI Gateway ブログ記事3件(公式ブログ)(2026-08-19 ingest)
- [[@2024__EnvoyAIGatewayBlog__Introducing Envoy AI Gateway]] — [[Tetrate]] と [[Bloomberg L.P.]] が2024年10月に協業開始した [[Envoy AI Gateway]] プロジェクトの発足記事。トークンベース使用量制御・統一API・アップストリーム認可というMVP3機能を提示。
- [[@2025__EnvoyAIGatewayBlog__Envoy AI Gateway Reference Architecture]] — Tier One(集約クラスタ)/Tier Two(自ホストモデルクラスタ)からなる二層ゲートウェイのリファレンスアーキテクチャ。自ホスト型モデルサービングを[[KFServing|KServe]]に委譲する統合方針を示す。
- [[@2025__EnvoyAIGatewayBlog__MCP in Envoy AI Gateway]] — [[Model Context Protocol|MCP]]のステートフルセッションを、アップストリームセッション情報をクライアントセッションIDへ自己完結的にエンコードする「トークンエンコーディング設計」で扱う実装判断を解説。Redis等の集約化ステート管理を代替案として検討・却下した理由も明示。
### Blending Containers and Virtual Machines: A Study of Firecracker and gVisor(Anjali+, VEE 2020)(2026-08-19 ingest-paper)
- [[@2020__VEE__Blending Containers and Virtual Machines - A Study of Firecracker and gVisor]] — [[University of Wisconsin-Madison|University of Wisconsin-Madison]] の [[Anjali]]・[[Tyler Caraza-Harter]]・[[Michael M. Swift]] による、[[gVisor]]・[[Firecracker]]・LXC の行・分岐粒度カーネルコードカバレッジ分析。ホストカーネル外へ機能を移すアーキテクチャにもかかわらず gVisor(91,161行)・Firecracker(77,392行)はネイティブLinux(63,163行)より実質的に多くのホストカーネルコードを実行し、gVisorはLXC(90,595行)と実質同じコードを異なる頻度で共有することを示す。CPU・ネットワーク・メモリ・ファイルアクセスの4ワークロードでコードカバレッジと実測性能を対応づけ、Firecrackerはネットワーク遅延(RTT 371µs)、gVisorはメモリ管理とネットワークストリーミングで劣ることを定量化した。(paper / container / virtualization / security / serverless)
### A Fresh Look at the Architecture and Performance of Contemporary Isolation Platforms(van Rijn & Rellermeyer, Middleware 2021)(2026-08-19 ingest-paper)
- [[@2021__Middleware__A Fresh Look at the Architecture and Performance of Contemporary Isolation Platforms]] — [[Delft University of Technology|TU Delft]] の [[Vincent van Rijn]]・[[Jan S. Rellermeyer]] による、コンテナ([[Docker]]・[[LXC]])・セキュアコンテナ([[Kata Containers]]・[[gVisor]])・ハイパーバイザー([[QEMU]]・[[Firecracker]]・[[Cloud Hypervisor]])・ユニカーネル([[OSv]])の計10プラットフォームを同一実験環境でCPU・メモリ・I/O・ネットワーク・起動時間・実運用ワークロード(Memcached, MySQL)の6軸横断比較した実証研究。コンテナはほぼネイティブ同等かつ最速起動、ハイパーバイザーはネットワーク・メモリに常時オーバーヘッド、セキュアコンテナはI/Oが最弱と結論。EPSSで悪用可能性を重み付けした拡張HAPメトリクスにより、セキュアコンテナは通常のコンテナより多くのホストカーネル関数を呼び出す(=安全性はHAP単体ではなく多層防御に依存する)ことを定量的に示した。28件のFinding・9件のConclusion。図18点を全点埋め込み(アーキテクチャ図4点はPyMuPDFキャプション座標クロップで取得)。(paper / container / virtualization / security / benchmarking)
### Reading postmortems(Dan Luu、danluu.com)(2026-08-19 ingest)
- [[@danluu.com__Reading postmortems]] — [[Dan Luu]] が Google・Microsoft 在籍時のポストモーテム多読経験から、重大障害の再発パターンを5分類(エラーハンドリング・設定・ハードウェア・人間・監視/アラート)に整理したエッセイ。Ding Yuan et al. (OSDI'14) の「重大障害の92%がエラー誤処理起因」、公開ポストモーテムの約50%が設定変更起因という観察、「人手プロトコル追加自体がops smell」という視点を提示。公開日不明。(article / sre / postmortem / reliability)
### Understanding and Dealing with Operator Mistakes in Internet Services(Nagaraja+, OSDI 2004)(2026-08-19 ingest-paper)
- [[@2004__OSDI__Understanding and Dealing with Operator Mistakes in Internet Services]] — [[Rutgers University]] の [[Kiran Nagaraja]]・[[Fábio Oliveira]]・[[Ricardo Bianchini]]・[[Richard P. Martin]]・[[Thu D. Nguyen]] による、21人の被験者オペレータに三層オークションサービスの保守・診断タスクを行わせた43回のライブ実験の分析。42件のオペレータミス(設定ミス24件・誤ったソフトウェア再起動14件が最頻)を観測し、オペレータのアクションを本番反映前に検証(validation)するオンラインスライス/検証スライス方式のプロトタイプ基盤を提案・実装。プロトタイプは観測ミスの66%(28/42件)を検知し、offline testingの40%を上回った。図4点を全点埋め込み(ベクター描画のためPyMuPDFキャプション座標クロップ)、表2点をMarkdown表として転記。[[@2003__USITS__Why Do Internet Services Fail and What Can Be Done About It]](Oppenheimer et al.)を直接引用し拡張する関係にある。(paper / sre / dependability / fault-injection)
### Simple Testing Can Prevent Most Critical Failures: An Analysis of Production Failures in Distributed Data-Intensive Systems(Yuan+, OSDI 2014)(2026-08-19 ingest-paper)
- [[@2014__OSDI__Simple Testing Can Prevent Most Critical Failures - An Analysis of Production Failures in Distributed Data-Intensive Systems]] — [[University of Toronto]] の [[Ding Yuan]]・[[Michael Stumm]] らによる、Cassandra・HBase・HDFS・Hadoop MapReduce・Redis の実障害198件(うち壊滅的障害48件)の手動精読・73件の再現に基づく実証分析。壊滅的障害の**92%が明示的に通知された非致命的エラーの誤処理**に起因し、うち35%は空のcatchブロック・過剰catchによるabort・TODOコメント放置という単純ミス、58%は簡単なテストで検出可能だったと報告。静的チェッカー Aspirator を9分散システムに適用し500件の新規バグ・悪しき実践を検出、うち143件が開発者に修正・確認された。障害の90%は3入力イベント以下、98%は3ノード以下、77%はユニットテストで再現可能という testability の知見も提示。図12点を全点埋め込み(ベクター描画のためPyMuPDFキャプション座標クロップで取得)、表9点をMarkdown表として転記。[[@2014__OSDI__lprof - A Non-intrusive Request Flow Profiler for Distributed Systems]] と同著者陣による同年OSDI発表で、[[@danluu.com__Reading postmortems]] の中核的引用元。(paper / distributed / fault-localization / software-reliability)
### Collie: Finding Performance Anomalies in RDMA Subsystems(Kong+, NSDI 2022)(2026-08-19 ingest-paper)
- [[@2022__NSDI__Collie - Finding Performance Anomalies in RDMA Subsystems]] — Duke University・ByteDance Inc. の [[Xinhao Kong]]・[[Yibo Zhu]]・[[Huaping Zhou]]・[[Zhuo Jiang]]・[[Jianxi Ye]]・[[Chuanxiong Guo]]・[[Danyang Zhuo]] による、RDMA サブシステムの性能異常をデプロイ前に体系的に発見するツール Collie の提案論文。verbs API の narrow-waist 抽象からホストトポロジ・メモリ割り当て・トランスポート設定・メッセージパターンの4次元探索空間を構築し、性能・診断カウンタを焼きなまし法(simulated annealing)で極値領域へ駆動することで異常を発見、minimal feature set (MFS) アルゴリズムで再現条件を特定する。8種類の商用RDMAサブシステムで評価し、既知3件を含む18件の性能異常を発見(うち15件が新規)、全件がベンダーに承認され7件は修正済み。自社RDMA RPCライブラリとBytePSベース分散機械学習フレームワークの性能異常回避に実運用で活用された事例も報告。図6点(RDMAサブシステム構成・システム概要・プログラミング抽象・探索効率比較3点)を全点PyMuPDFキャプション座標クロップで取得(ベクター描画のため)、表2点をMarkdown表として転記。全20ページ本文+付録+参考文献を通読。(paper / source / networking / distributed)
### Hostping: Diagnosing Intra-host Network Bottlenecks in RDMA Servers(Liu+, NSDI 2023)(2026-08-19 ingest-paper)
- [[@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers]] — BUPT・ByteDance Inc.・Purple Mountain Laboratories の [[Kefei Liu]]・[[Zhuo Jiang]]・[[Jiao Zhang]]・Haoran Wei・Xiaolong Zhong・Lizhuang Tan・Tian Pan・Tao Huang による、RDMA サーバのホスト**内**ネットワーク(PCIe リンク・メモリチャネル・CPU ソケット間バス)に特化した初のボトルネック監視・診断システム Hostping の提案論文。RNIC 線速の急増(25Gb/s→200Gb/s)に PCIe 帯域の伸びが追いつかないという背景のもと、RNIC-エンドポイント間ループバックテストでホスト内レイテンシ・帯域を計測し、binary network tomography に着想した投票機構でリンク単位の異常を推論する。300台超の本番分散機械学習サーバへの展開で、既知4種のリンク障害に加え CPU ルートポート障害・メモリチャネルフラッピング・ACS/ATS設定ミス・輻輳起因の帯域劣化など6種の新規ボトルネックを発見。図10点を全点埋め込み(埋め込みラスター画像9点+ベクター描画4点はPyMuPDFキャプション座標クロップで取得)。(paper / source / networking / rdma)
- [[@2024__TON__Diagnosing End-Host Network Bottlenecks in RDMA Servers]] — 同著者グループによる Hostping の拡張ジャーナル版(IEEE/ACM Transactions on Networking, Vol.32, No.5, 2024)。NSDI '23 版のループバックテストに加え、同一ホスト上の RNIC 同士が相互にプローブし合う RNIC-to-RNIC(R2R)probing を新たに導入し、RNIC 自体の接続性問題(ルーティング誤設定・フラッピング・誤配線)を「ホスト内帯域劣化・レイテンシ増加」とは別の第3の症状カテゴリとして診断できるようにした。binary network tomography に基づくリンク状態推論を Algorithm 1 として定式化。数千台の本番展開で計8件の新規問題([New]マーク、うち#14誤ったスイッチポート配線・#16 RNIC のビット誤りは NSDI 版にない新規発見)を報告。図10点を全点埋め込み(埋め込みラスター画像7点+ベクター描画5点はPyMuPDFキャプション座標クロップで取得、うち3点はNSDI版と共通)。(paper / source / networking / rdma)
### Congestion Patterns in a Large-scale RDMA Datacenter(Ghorbani+, IMC 2025)(2026-08-19 ingest-paper)
- [[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]] — Meta・Johns Hopkins University の [[Soudeh Ghorbani]]・[[Yimeng Zhao]]・[[Srikanth Sundaresan]]・[[Ying Zhang]]・[[Yijing Zeng]]・[[Abhigyan Sharma]]・[[Prashanth Kannan]]・[[Cristian Lumezanu]] による、分散AI訓練専用の大規模RDMAデータセンターにおける本番輻輳パターンをトポロジ層・時間スケール・ワークロード横断で測定した初の研究。ToRスイッチの`switchos`(分単位カウンタ)とホスト常駐の`finecounters`(ミリ秒級サンプリング)を用い、PFC(Priority Flow Control)の導入によって輻輳箇所がTCP/IPデータセンターのエッジ(ToR→host)からネットワークコア(ToR→spine)へシフトしたこと、トラフィックがラックローカルでないこと(コア/エッジ差約16%)、スパイン間のPFC一時停止フレーム負荷が2桁近く不均一であること、AI訓練トラフィックがゾーンによっては53%のホストで同期する頻発バースト(中央値4.8〜9.6ms)を示すこと、粗粒度(分単位)のPFC一時停止カウンタが平均トラフィックレートでは見えないバースト性を検知できることを報告する。図6点(topology図1点+チャート5点)を全点PyMuPDFキャプション座標クロップで取得(すべてベクター描画のため埋め込みラスター画像なし)。全8ページ本文+参考文献を通読。(paper / source / networking / rdma / congestion-control)
### Understanding RDMA Microarchitecture Resources for Performance Isolation(Kong+, NSDI 2023)(2026-08-19 ingest-paper)
- [[@2023__NSDI__Understanding RDMA Microarchitecture Resources for Performance Isolation]] — Duke University・Microsoft・Shanghai Jiao Tong University の [[Xinhao Kong]]・[[Jingrong Chen]]・[[Wei Bai]]・[[Yechen Xu]]・[[Mahmoud Elhaddad]]・[[Shachar Raindel]]・[[Jitendra Padhye]]・[[Alvin R. Lebeck]]・[[Danyang Zhuo]] による、RNIC(RDMA NIC)のマイクロアーキテクチャリソース(NIC キャッシュ・処理ユニット・PCIe 帯域)がマルチテナント性能分離に与える影響を体系的に検証した論文。control verb(特に MR deregistration)は data verb よりも激しいキャッシュミスを誘発し帯域を 96.6→48.0 Gbps に低下させ、RNR エラー処理は処理ユニット全体を停止させ victim の帯域を 93.53→0.018 Gbps に崩壊させることを実証。この消費モデルに基づき、既存の性能分離ソリューション(SR-IOV・HW TC・Justitia)をすべて破壊するテストスイート Husky を構築し、allreduce・eRPC-based Masstree の実アプリケーションでも影響が波及することを示した。発見は NVIDIA によって再現・確認された。図10点を全点 PyMuPDF キャプション座標クロップで取得(全図がベクター描画のため埋め込みラスター画像なし)、表3点中2点をMarkdown表に転記・1点(チェックマーク表)を画像埋め込み。同著者陣による先行研究 Collie(NSDI '22)と対をなす。全19ページ本文+付録を通読。(paper / source / networking / rdma / multi-tenancy)
### Understanding the Micro-Behaviors of Hardware Offloaded Network Stacks with Lumina(Yu+, SIGCOMM 2023)(2026-08-19 ingest-paper)
- [[@2023__SIGCOMM__Understanding the Micro-Behaviors of Hardware Offloaded Network Stacks with Lumina]] — Johns Hopkins University・Peking University・Microsoft・Rice University の [[Zhuolong Yu (Johns Hopkins University)]]・[[Bowen Su]]・[[Wei Bai]]・[[Shachar Raindel]]・[[Vladimir Braverman]]・[[Xin Jin]] による、ハードウェアオフロード型ネットワークスタック(RDMA NIC)の正しさ・性能をテストするツール Lumina の提案論文。プログラマブルスイッチ(Intel Tofino)を2ホスト間のイベント注入器として使い、パケットドロップ・ECNマーク・破損を決定論的に注入、全パケットを専用サーバー群へミラーリングしてオフライン解析する。NVIDIA/Intelの商用RDMA NIC 4機種(CX4 Lx・CX5・CX6 Dx・E810)をテストし、CX6 DxのETSパケットスケジューラの非work-conserving性、CX4 Lxのnoisy neighbor問題、CX5-E810間の相互運用性問題、複数のNICカウンタ不整合などの重大バグをベンダーに確認させた。先行研究(Shpiner et al.)がCX4 Lxのロッシー環境下goodputを高評価したのに対し、実際の再送遅延は約200µs(約100 base RTT分)に達することも明らかにした。図11点を全点PyMuPDFキャプション座標クロップで取得(全図がベクター描画のため埋め込みラスター画像なし)、表2点をMarkdown表として転記。全14ページ本文を通読。(paper / source / networking / rdma)
### TIMELY: RTT-based Congestion Control for the Datacenter(Mittal+, SIGCOMM 2015)(2026-08-19 ingest-paper)
- [[@2015__SIGCOMM__TIMELY - RTT-based Congestion Control for the Datacenter]] — Google の Radhika Mittal(UC Berkeley 在籍時)・Vinh The Lam・Nandita Dukkipati・Emily Blem・Hassan Wassel・Monia Ghobadi(現Microsoft)・[[Amin Vahdat]]・Yaogong Wang・David Wetherall・David Zats による、ECN 等のスイッチフィードバックを一切使わず NIC ハードウェアタイムスタンプによる精密な RTT 測定のみで輻輳を検知する初のデータセンター向け遅延ベース輻輳制御プロトコル TIMELY の提案論文。RTT の絶対値ではなく勾配(gradient)を用いて輻輳の立ち上がり・立ち下がりを予測することで、標準的な目標キュー長維持方式の理論的限界を回避しながら低レイテンシと高スループットを両立する。数百台規模 Clos トポロジ評価で、PFC のみのファブリック比で99パーセンタイル尾部レイテンシを9倍、最適化済みカーネルDCTCP比で13倍改善し、本番ストレージアプリケーションのレイテンシ中央値を8.9秒→5.1秒に改善した。図表24点(埋め込み7点+PyMuPDFクロップ17点)を全点埋め込み、Table 1をMarkdown表として転記。全13ページ本文+参考文献を通読。(paper / source / networking / datacenter / congestion-control / rdma)
### HPCC: High Precision Congestion Control(Li+, SIGCOMM 2019)(2026-08-19 ingest-paper)
- [[@2019__SIGCOMM__HPCC - High Precision Congestion Control]] — Alibaba Group・Harvard University・University of Cambridge・MIT の [[Yuliang Li]]・[[Rui Miao]]・[[Hongqiang Harry Liu]]・[[Yan Zhuang]]・[[Fei Feng]]・[[Lingbo Tang]]・[[Zheng Cao]]・[[Ming Zhang]]・[[Frank Kelly]]・[[Mohammad Alizadeh]]・[[Minlan Yu]] による、in-network telemetry(INT)を用いた高精度輻輳制御 HPCC の提案論文。ECN の1ビットや RTT という粗粒度シグナルに頼る DCQCN・TIMELY と異なり、経路上の各スイッチが ACK にキュー長・送信バイトレート・帯域容量を直接埋め込み、送信者がリンクごとの inflight bytes を精密に計算・制御することで、ほとんどの場合1回のレート更新で適正な送信レートに収束する。32台テストベッドで DCQCN 比 99パーセンタイル FCT スローダウンを最大95%削減、320台シミュレーションの incast で DCQCN・TIMELY が発生させる PFC ポーズをゼロに抑制。チューニングパラメータは η・maxStage・W_AI の3個のみ。図14点を全点埋め込み(埋め込みラスター画像なし、全図 PyMuPDF キャプション座標クロップで取得)、表なし。Appendix A で理論的収束性・公平性を証明。全13ページ本文+付録+参考文献を通読。(paper / source / networking / rdma / congestion-control)
### Revisiting Network Support for RDMA(Mittal+, SIGCOMM 2018)(2026-08-19 ingest-paper)
- [[@2018__SIGCOMM__Revisiting Network Support for RDMA]] — UC Berkeley/ICSI・Mellanox Technologies・NYU・University of Washington の [[Radhika Mittal]]・[[Alexander Shpiner]]・[[Aurojit Panda]]・[[Eitan Zahavi]]・[[Arvind Krishnamurthy]]・[[Sylvia Ratnasamy]]・[[Scott Shenker]] による、PFC(Priority Flow Control)が RoCE の高性能に本質的に必要ではなく現行 NIC 設計のアーティファクトにすぎないことを示す論文。RoCE NIC に SACK ベースの効率的ロス回復と BDP-FC(帯域幅遅延積ベースのエンドツーエンドフロー制御)という2つの小変更を加えた改良版 NIC 設計 IRN(Improved RoCE NIC)を提案し、シミュレーションにより IRN(PFC なし)が RoCE(PFC あり)を6〜83%上回ることを示す。iWARP との実機比較・FPGA 高位合成によるハードウェアオーバーヘッド評価(NIC リソースの3〜10%)も含む。図表12点(全図 PyMuPDF キャプション座標クロップ、埋め込みラスター画像なし)を全点埋め込み、Table 1・2をMarkdown表として転記。全14ページ本文+参考文献を通読。(paper / source / networking / rdma / congestion-control)
### RDMAネットワークアーキテクチャ基礎 - IB/RoCE 編 -(Kobayashi, SpeakerDeck 2023-06-02)(2026-08-20 ingest-slides)
- [[@2023__SpeakerDeck__RDMAネットワークアーキテクチャ基礎 - IB/RoCE 編 -]] — [[Yahoo Japan Corporation]] 社内勉強会資料を編集して公開した、[[Masayuki Kobayashi]] による RDMA・InfiniBand・RoCE の基礎技術解説資料。確認できる同著者の最も古い公開資料。DMA/RDMA の基本概念、RDMA実装3種(InfiniBand/RoCE/iWARP)の比較、InfiniBand Architecture(サブネット・Subnet Manager・HCA・LID/GID・パケットヘッダ・トランスポートサービス4分類・QP/WQEメモリモデル)、RoCEv1/v2の構造差、DCB(ETS+PFC+CN)によるロスレスイーサネット実現、PFCのHead-of-Line Blocking、DCQCNによる輻輳制御、Lossless/Semi-lossless/Lossy-1/Lossy-2という運用構成スペクトラムを体系的に解説する。全57ページ全点通読。図8点(p.10/14/15/25/30/36/45/50)を埋め込み。(slides / source / networking / hpc / rdma)
### AIのための Ethernet技術動向 (SerDes) — 400 Gb/s/レーンに向けた物理層の課題と考察(Kobayashi, SpeakerDeck 2026-08-17)(2026-08-20 ingest-slides)
- [[@2026__SpeakerDeck__AIのためのEthernet技術動向 (SerDes)]] — [[Masayuki Kobayashi]](Interconnect Architecture SIG)による、400 Gb/s/レーン(448G/P802.3dv)の標準化状況を、IEEE 802.3・OIF・UEC・OCP・SNIA/SFF の一次公開文書と OFC 2026 の発表突き合わせで整理した資料。全77ページ。7つの観点(変調方式PAM4/6/8が未決、ビーチフロント制約、CPCによる銅の延命、電力が主要制約、レイテンシは仕様・物理が決める下限、標準化速度自体が競争要因、EthernetのScale-Up拡大)で構成し、2026年8月時点で決まったのは「枠組み」であり「技術選択」ではないと結論する。図表5点(3層ネットワーク技術要求・PAM4/6/8チャネル帯域トレードオフ・ラック配線本数の帯域上限・電力とリーチのトレードオフ・2026年標準化タイムライン)を埋め込み。全77ページ通読(一部ページは個別再読で補強)。(slides / source / networking / standardization)
### RDMATracer: A scalable eBPF-based framework for tracing RDMA syscalls(Gupta+, NAIC '26)(2026-08-20 ingest-paper)
- [[@2026__NAIC__RDMATracer - A scalable eBPF-based framework for tracing RDMA syscalls]] — [[Meta]]・[[Carnegie Mellon University]] の Prankur Gupta・Miao Xu・Maxim Samoylov・[[Prashanth Kannan]]・Rajiv Krishnamurthy・Theophilus A. Benson による、AI訓練ジョブ失敗の5〜20%を占めるNICドライバのカーネルバグを診断するeBPFベースのフレームワークRDMATracerの提案論文。4つの操作者由来ヒューリスティック(読み取り専用除外・汎用カーネル内部処理除外・クリーンアップパス除外・重要RDMAオブジェクト操作へ焦点化)で約2,000個のRDMA関数を13個のkernel hookへ絞り込み(全RDMA関数追跡比で約2,000倍のオーバーヘッド削減)、per-CPUカウンタ+リングバッファの二重BPFマップでバースト時のロスレス集計とgraceful degradationを両立する。本番数年間の運用で10億件超のsyscall失敗を捕捉し、独立分類器ALPS基準で73%のGPU時間浪費カバレッジ(recall=1.000, F1=0.765)を検証。1invocationあたりBPF実行コストは他の本番トレーシングBPFプログラムよりP50で約18倍・P99で約46倍低い。図4点を全点埋め込み(全て埋め込みラスター画像)、表2点をMarkdown表として転記。全6ページ本文+参考文献を通読。(paper / source / ebpf / rdma / observability)
### NetEdit: An Orchestration Platform for eBPF Network Functions at Scale(Benson+, SIGCOMM 2024)(2026-08-20 ingest-paper)
- [[@2024__SIGCOMM__NetEdit - An Orchestration Platform for eBPF Network Functions at Scale]] — [[Theophilus A. Benson]]([[Carnegie Mellon University]])と [[Meta]] の共著。ホストネットワーキング向け eBPF オーケストレーション基盤 NetEdit。BPFAdapter・pinning/bpf-iter・PolicyEngine によりカーネル既定の寿命管理から切り離し、13 の tuningFeature を本番 5 年以上運用。無効化実験で再送 4.5 倍・ToR ダウンリンク輻輳破棄 363.7% 増。図 6 点埋め込み、表は Markdown 転記。全 14 ページ通読。(paper / source / ebpf / networking / orchestration)
### Logarithm: A logging engine for AI training workflows and services(Meta Engineering Blog, 2024-03-18)(2026-08-20 ingest)
- [[@2024__EngineeringAtMeta__Logarithm - A logging engine for AI training workflows and services]] — [[Meta]] 内部限定のホスト型サーバレス・マルチテナントログサービス Logarithm。100+GB/s リアルタイム索引化、毎秒数千クエリ。C++20 実装。AI 訓練デバッグ(rank ID メタデータ API・filter-by-call-site・rank 横並び比較)、TensorBoard 内部デプロイ(722 系列/45 万サンプル・ストリーミング API)、Manifold+ORC+Bloom フィルタの3層 tiering、Scribe/LogDevice 耐久キュー、Shard Manager ingestion elasticity。図7点を全点埋め込み。(article / source / observability / logging / meta / ai-training)
### Resilience and Stability of Ecological Systems(Holling, Ann. Rev. Ecol. Syst. 1973)(2026-08-22 ingest-paper)
- [[@1973__AnnRevEcolSyst__Resilience and Stability of Ecological Systems]] — [[University of British Columbia]] の [[C. S. Holling]] による、生態学的安定性理論の総説。「レジリエンス(状態変数・駆動変数・パラメータの変化を吸収して関係性を維持する能力)」と「安定性(平衡への回帰の速さと確実性)」を独立した性質として定義し分離する。位相平面解析(6種の軌道パターン)・再生産曲線の繁殖力/死亡率分解・ポテンシャル場によるアトラクター領域の測定モデルを提示し、五大湖漁業・スプルースバドワーム大発生・鮭個体群・山火事・ダニ捕食実験など多数の実世界事例を通じて、現実の生態系が単一の大域平衡ではなく複数の「アトラクターの領域」を持つことを示す。図1〜4を全点 PyMuPDF キャプション座標クロップで取得・埋め込み(表なし)。全23ページ本文+参考文献を通読。(paper / source / ecology / resilience / systems-theory)
### Blameless PostMortems and a Just Culture(Allspaw, Etsy Code as Craft 2012-05-22)(2026-08-22 ingest)
- [[@2012__EtsyCodeAsCraft__Blameless PostMortems and a Just Culture]] — [[John Allspaw]] が [[Etsy]] Code as Craft ブログに投稿した、「ブレームレスポストモーテム」という語の起源的一次資料。[[Sidney Dekker]] の Bad Apple Theory への対抗として [[Just Culture]](公正文化)を実務に導入。「非難・恥・処罰」の7段階自己強化サイクル、「第一の物語 / 第二の物語」(Woods & Cook, *Behind Human Error*)の対比、[[Erik Hollnagel]] の事故メカニズム論を提示する。同じ Etsy から4〜6年後の [[Will Gallego]] 講演(2016年・2018年)は本記事の主張を理論用語で再定式化したものと位置づけられる。全文通読(defuddle 抽出)。(article / source / sre / postmortem / human-factors / just-culture)
### ネットワークシステムについて語るときに我々の語ること(Peterson & Davie、ラムダノート 2026)(2026-08-22 ingest-book)
- 章 source 13 件: [[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Front Matter 本書に寄せて]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 1 イントロダクション]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 2 システムとネットワークのアーキテクチャ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 3 オープンソースソフトウェア]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 4 システム設計における判断]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 5 SDN:ソフトウェア定義ネットワーク]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 6 集権化と非集権化]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 7 TCPの考古学]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 8 セキュリティ:負の目標]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 9 5G:対照的なアーキテクチャ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 10 SmartNIC、IPU、DPU]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 11 ネットワーク管理は今やクールな仕事だ]]・[[@2026__LambdaNote__ネットワークシステムについて語るときに我々の語ること - Chapter 12 Looking Over The Fence (垣根をこえて)]](book / source / networking / systems、全ページ `publish: false`)。書籍ハブは [[ネットワークシステムについて語るときに我々の語ること]]。
### Principles of Computer System Design - An Introduction, Part II(Saltzer & Kaashoek、MIT OpenCourseWare 2009)(2026-08-22 ingest-book)
- 章 source 5 件: [[@2009__MITOCW__Principles of Computer System Design - Chapter 7 The Network as a System and as a System Component]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 8 Fault Tolerance - Reliable Systems from Unreliable Components]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 9 Atomicity - All-or-Nothing and Before-or-After]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 10 Consistency]]・[[@2009__MITOCW__Principles of Computer System Design - Chapter 11 Information Security]](book / source / systems / distributed-systems / fault-tolerance / security、全ページ `publish: false`)。書籍ハブは [[Principles of Computer System Design]]。
### Computer Networks - A Systems Approach(Peterson & Davie、6th Edition 2020)(2026-08-22 ingest-book)
- 章 source 10 件: [[@2020__SystemsApproach__Computer Networks - A Systems Approach - Preface]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 1 Foundation]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 2 Direct Links]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 3 Internetworking]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 4 Advanced Internetworking]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 5 End-to-End Protocols]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 6 Congestion Control]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 7 End-to-End Data]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 8 Network Security]]・[[@2020__SystemsApproach__Computer Networks - A Systems Approach - Chapter 9 Applications]](book / source / networking、全ページ `publish: false`)。書籍ハブは [[Computer Networks - A Systems Approach]]。
### The Real Internet Architecture - Past, Present, and Future Evolution(Zave & Rexford、Princeton University Press 2024)(2026-08-22 ingest-book)
- 章 source 6 件: [[@2024__PrincetonUP__The Real Internet Architecture - Chapter 1 Introduction]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 2 Describing Networks and Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 3 Composing Networks and Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 4 The Real Internet Architecture]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 5 Patterns for Enhanced Network Services]]・[[@2024__PrincetonUP__The Real Internet Architecture - Chapter 6 Ideas for a Better Internet]](book / source / networking / network-architecture、全ページ `publish: false`)。書籍ハブは [[The Real Internet Architecture]]。図 92 点を各章本文に埋め込み済み。
### LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures(Zhang, Feng, Pei+, arXiv 2026-08)(2026-08-23 ingest-paper)
- [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]] — [[Changhua Pei]]・[[Dan Pei]] ら CNIC/CAS・清華大学チームによる、長期水平 LLM エージェント失敗の責任役割帰属・根本原因ステップ局所化ベンチマーク。SWE-bench Pro・Terminal Bench 2・TravelPlanner・VitaBench・WebArena Verified から集めた 1,140 件の非注入失敗軌跡(平均 156.3 ステップ)に人手ラベルを付与。訓練不要の診断手法 RCTA(セグメント要約による広域検索+ハンドオフ指示への遡及照合)を提案し、responsible-role accuracy 51.1%・root-cause exact accuracy 24.1% を達成(ECHO 比 +23.6pt/+10.9pt)。図 6 点(PyMuPDF キャプション座標クロップ)を全点埋め込み。(paper / source / agent / aiops / benchmark)
### ChainCraft: Bridging Causal Discovery and LLM Reasoning for Failure Prediction in Microservices(Zhao, Sun+, ISSRE 2026)(2026-08-23 ingest-paper)
- [[@2026__ISSRE__ChainCraft - Bridging Causal Discovery and LLM Reasoning for Failure Prediction in Microservices]] — [[Yongxin Zhao]]・[[Yongqian Sun]] ら Nankai University・Alibaba Group・Tsinghua University による、メトリクス駆動の因果発見(PCMCI)と LLM 推論を橋渡しする障害予測フレームワーク。因果グラフを制約として LLM(Chain Builder)に異常伝播チェーンを生成させ、Structural/Temporal Checker・Chain Critic・Chain Refiner による閉ループ洗練で一貫性を高め、ハイブリッドなテキスト構造検索で過去故障事例を検索する。Alibaba 実運用データで F1=0.875(最良ベースライン比 +22%)を達成し、3か月間の Alibaba 本番デプロイで OCE が予測精度 80.8% を確認。図 4 点(PyMuPDF キャプション座標クロップ)・表 1 点(markdown 転記)を全点埋め込み。(paper / source / aiops / microservice / failure-prediction)
### Over the Memory Wall, Into the Instruction Wall: The New Bottleneck in GPU Data Processing(Hepkema, Wu, Kozyrakis, Chronis, Alonso、arXiv 2026-08)(2026-08-23 ingest-paper)
- [[@2026__arXiv__Over the Memory Wall, Into the Instruction Wall - The New Bottleneck in GPU Data Processing]] — [[Sven Hepkema]]・[[Bowen Wu]]・[[Christos Kozyrakis]]・[[Yannis Chronis]]・[[Gustavo Alonso]]([[ETH Zürich]] Systems Group / [[NVIDIA]] & [[Stanford University]])による、GPUデータベースライブラリ[[cuDF]]の新しいボトルネックを実証した論文。複数プロファイラ(Nsight Systems・Nsight Compute・Maximus)を統合するツール[[Valk]]を開発し、L4とGH200上でTPC-Hを実行。メモリ帯域幅が13.4倍増加しても性能は5.2倍にとどまることを示し、[[Rooflineモデル|Roofline]]分析でcuDFカーネルがメモリバウンド(L4で74%)から演算・命令スループットバウンド(GH200で77.5%)へ転じることを実証。occupancy・ILP・キャッシュ利用・命令強度という3つの改善軸を提言。図9点(PyMuPDF座標クロップ+embedded screenshot)・表9点(markdown転記)を全点埋め込み。(paper / source / gpu / database / performance-analysis / roofline)
### Software-Defined Networks: A Systems Approach(Peterson, Cascone, O'Connor, Vachuska, Davie、Systems Approach 2021)(2026-08-23 ingest-book)
- 章 source 12 件: [[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 1 Introduction]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 10 Future of SDN]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 2 Use Cases]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 3 Basic Architecture]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 4 Bare-Metal Switches]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 5 Switch OS]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 6 Network OS]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 7 Leaf-Spine Fabric]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 8 Network Virtualization]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Chapter 9 Access Networks]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Foreword]]・[[@2021__SystemsApproach__Software-Defined Networks - A Systems Approach - Preface]](book / source / networking、全ページ `publish: false`)。書籍ハブは [[Software-Defined Networks - A Systems Approach]]。図 61 点を各章本文に埋め込み済み。原本は章別ウェブページ(https://sdn.systemsapproach.org/)。
### 10+ Deploys Per Day: Dev and Ops Cooperation at Flickr(Allspaw & Hammond, Velocity 2009)(2026-08-23 ingest-slides)
- [[@2009__Velocity2009__10+ Deploys Per Day - Dev and Ops Cooperation at Flickr]] — [[John Allspaw]]・[[Paul Hammond]] が O'Reilly Velocity 2009(2009-06-23)で発表し、歴史的に [[DevOps]] という語の誕生につながった画期(seminal moment)とされる講演。開発と運用の対立というステレオタイプを解体し、変化のリスクを下げる6つのツール(自動化インフラ・共有バージョン管理・ワンステップビルド&デプロイ・フィーチャーフラグ・共有メトリクス・IRC/IMロボット)と4つの文化(敬意・信頼・障害への健全な態度・非難の回避)を提示する。従来は devops.com 記事・『ウェブオペレーション』10章という secondary source 経由でしか wiki に反映されていなかった primary source を初めて直接 ingest した。SlideShare のボット対策のため PDF 原本の代わりに CDN 上のスライド画像(全78ページ)を使用、YouTube 自動生成英語字幕を口頭説明の補助に使用。(slides / source / devops / history)
### ウェブオペレーション ―サイト運用管理の実践テクニック(Allspaw・Robbins 編、角 征典 訳、オライリー・ジャパン 2011)(2026-08-23 ingest-book)
- 章 source 18 件: [[@2011__OReillyJapan__ウェブオペレーション - Chapter 1 ウェブオペレーション:キャリア]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 2 Picnik におけるクラウドコンピューティングの利用とその教訓]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 3 インフラとアプリケーションのメトリクス]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 4 継続的デプロイ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 5 コードとしてのインフラ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 6 監視]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 7 いかにして複雑なシステムは失敗するか]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 8 コミュニティ管理とウェブオペレーション]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 9 予期しないトラフィック急増への対応]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 10 開発と運用の協力と連携]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 11 訪問者の気持ち:ユーザ対面メトリクス]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 12 ウェブにおけるリレーショナルデータベースの戦略と戦術]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 13 障害を活用する:ふりかえりの技芸と科学]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 14 ストレージ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 15 非リレーショナルデータベース]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 16 アジャイルインフラストラクチャ]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 17 夜中に聞こえる奇妙な物音(と、ぐっすり眠る方法)]]・[[@2011__OReillyJapan__ウェブオペレーション - Chapter 18 日本の料理のインフラ]](book / source / web-operations / devops、全ページ `publish: false`)。書籍ハブは [[ウェブオペレーション ―サイト運用管理の実践テクニック]]。図 54 点を各章本文に埋め込み済み(キャプションのフォント判別による座標クロップ)。原本は書籍 PDF(`.raw/books/web-operations-ja/`)。原書 *Web Operations*(O'Reilly, 2010)全 17 章 + 日本語版のみの 18 章。
### A Political Scientist's Insights into Site Reliability Engineering(Michael Krax, SREcon21 2021-10-12)(2026-08-23 ingest-slides)
- [[@2021__SREcon21__A Political Scientist's Insights into Site Reliability Engineering]] — [[Michael Krax]]([[Google]] Dublin、Site Reliability Manager・政治学博士)が国際関係理論・ゲーム理論・Weber の権力論・Niklas Luhmann の社会システム理論を SRE のチームビルディングとシステム設計・デバッグに応用した講演。「チームビルディングは適用された社会変化である」「複雑性を減らせるのは複雑性のみである」の2命題が核。全37ページの全スライドを画像で確認し、YouTube 自動生成英語字幕(transcript)で口頭説明を補完。図10点を埋め込み。(slides / source / political-science / system-theory)
### Trade-Offs Under Pressure: Heuristics and Observations of Teams Resolving Internet Service Outages(John Allspaw, Lund University MSc Thesis 2015)(2026-08-23 ingest-paper)
- [[Trade-Offs Under Pressure]] — [[John Allspaw]]([[Etsy]] CTO)が [[Lund University]] MSc in Human Factors and System Safety 課程で提出した修士論文。2014年12月4日の Etsy 実障害(サインイン後ホームページ性能劣化)を対象に、プロセストレーシング(IRC トランスクリプト・システムログ・8名への半構造化インタビュー)によって、エンジニアが用いる4つのヒューリスティック — (1)直近変更との相関確認、(2)探索範囲の拡張、(3)過去/直近の類似事例への収束、(4)自動テストより同僚レビューを優先する協調ヒューリスティック — を同定した。Allspaw 自身の後年の著作(『ウェブオペレーション』7章、『SREの探求』28章)で繰り返し参照される一次資料。図16点(埋め込みラスター12点+ベクター図4点の PyMuPDF 座標クロップ、うち1点は90度回転補正)を全点埋め込み。付録D・E(ダッシュボードスクリーンショット19-33)は本文非参照のため除外。
### Measuring Reliability Culture to Optimize Tradeoffs: Perspectives from an Anthropologist(Kathryn Bouskill, SREcon24 Americas 2024-03-20)(2026-08-23 ingest-video)
- [[@2024__SREcon24Americas__Measuring Reliability Culture to Optimize Tradeoffs]] — [[Kathryn Bouskill]]([[Meta]] Reliability Engineering、人類学者)が USENIX SREcon24 Americas で発表。「move fast and break things」から「move fast with stable infrastructure」への文化転換にあたり、40人超のインタビューと4波のサーベイで信頼性文化の現場認識を体系的に測定。回答者の78%がチームは信頼性を重視すると回答した一方、約半数がどの信頼性ギャップに取り組むべきか判断しづらいと回答。開発者評価基準への信頼性の明示的組み込み、信頼性測定プログラムの制度化、信頼性プログラム成熟度モデルの新設という3施策に接続。USENIX 公式ページにスライドPDFが掲載されておらず YouTube 動画を主 source として取り込み(代表フレーム12枚、自動生成英語字幕)。(video / sre / culture / organization / srecon)
### Fault Injection in Production: Making the Case for Resilience Testing(John Allspaw, Communications of the ACM 2012-10)(2026-08-23 ingest-paper)
- [[@2012__CACM__Fault Injection in Production]] — [[John Allspaw]]([[Etsy]] tech operations 責任者)が Communications of the ACM(Vol.55 No.10, pp.48-52)に寄稿した practice 記事。本番とステージング環境の差異が不確実性を持ち込むという論理から、[[GameDay]] エクササイズ(事象を想像し→ビジネスへの影響を防ぐ対策を実装し→本番で実際に発生させて確認する3ステップ)を定式化。Etsy の新決済システム("direct checkout")ロールアウトでの実施例(サードパーティ不正検知サービスのタイムアウト未設定、マスタ間データベース復旧時間の見積もり誤りを発見)を報告する一方、障害注入・GameDayの限界(作り込まれたシナリオは想像力に縛られる、自動化された継続的注入は「気づかれなくなる」ことで慢心を招くパラドックスを持つ)も率直に論じる。図表は本文参照なし(唯一の埋め込み画像は装飾的な雑誌写真のため除外)。(paper / source / sre / chaos-engineering / resilience-engineering)
### Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems(Ruiming Lu 他, USENIX ;login: online 2023-02-06)(2026-08-23 ingest-paper)
- [[@2023__loginonline__Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems]] — [[Alibaba Cloud]] のストレージデバイス(HDD/SSD)向けフェイルスロー検知フレームワーク [[PERSEUS]] を扱う、著者自身による FAST '23 論文の実務者向けサマリー記事。閾値フィルタリング・ピア評価・IASOベースモデルという3つの失敗した先行試行から「ノード単位でのみレイテンシ対スループット(LvT)分布が均質になる」という発見を導き、ノード内 LvT 分布への多項式回帰で適応的しきい値を自動導出する PERSEUS を提案。既存手法を全指標(Precision 0.99・Recall 1.00・MCC 0.99)で上回り、運用開始後 25 万台超のドライブから 304 台のフェイルスロードライブを検出した。図6点(記事埋め込み画像)・表2点(markdown転記)を全点埋め込み。原本に PDF が存在しないため HTML を原本として保存。(paper / source / distributed / fault-tolerance)
### Scaling Telemetry Workloads in Cloud Applications(Yuuki Tsubouchi, Kyoto University 博士論文 2025-03)(2026-08-23 ingest-thesis)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 1 Introduction]] — クラウドアプリケーションの信頼性課題を起点に、テレメトリの計装・保持・分析の 3 層モデルとその運用複雑性を提示し、RQ1〜RQ3 と第 3〜5 章の貢献・論文構成を概観する導入章。(thesis / distributed / aiops)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 2 Background]] — クラウドアプリケーションのアーキテクチャ・信頼性用語(fault / error / failure / incident)・テレメトリの分類(time-oriented / path-oriented)と 3 層システムモデル・各層のワークロード特性を定義する背景章。(thesis / distributed / observability)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 3 Efficient TCP-UDP Socket-based Instrumentation in Kernel for Continuous Construction of Network Call Graphs]] — 計装層の貢献。カーネル内フロー束ね(in-kernel flow bundling)により、TCP/UDP ソケット計装で CPU オーバーヘッド 2.2% 未満・レイテンシ最大 6µs を維持しながらネットワークコールグラフを非侵入かつ継続的に構築する。実装は [[go-conntracer-bpf]]。論文版は [[@2022__IPSJ JIP__Low Overhead TCP-UDP Socket-based Tracing for Discovering Network Services Dependencies]](数値の食い違いなしを確認)。(thesis / distributed / ebpf)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 4 Time Series Data-Intensive Application by Automated Data Tiering in Heterogeneous Key-Value Stores]] — ストレージ層の貢献。[[HeteroTSDB]] はメモリベース KVS とディスクベース KVS を TTL + jitter で連合させる TSDA アーキテクチャで、[[KairosDB]] 比 3.98 倍の取り込みスループットを達成し、2017 年 8 月に [[Mackerel]] へ本番投入された(§4.6 Lessons Learned に本番構成の差異とインシデント 2 件)。(thesis / time-series / storage)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]] — マイニング層の貢献。障害起因の変化点が時間的に密集する性質を使い、多変量メトリクスから障害時間窓を教師なしで局所化する特徴量削減フレームワーク [[MetricSifter]] を提案。論文版は [[@2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications]](BA 0.981・実行時間削減 43.75–50.39%・ω=2.5/h=3.5 まで一致を確認)。(thesis / aiops / time-series)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 6 Conclusion]] — データ削減は文脈知識が最も豊富な計装層・マイニング層の両端で行い、保持層は文脈非依存の堅牢な保持に徹すべきという設計指針(§6.2)と、collect-first から use-first への転換・LLM 障害管理向け failure snapshot・LLM 訓練基盤のテレメトリという 3 つの将来方向(§6.3)。(thesis / aiops)
- ハブ entity: [[Scaling Telemetry Workloads in Cloud Applications]]。旧 ingest の単一 source ページは本バッチで削除し、受信リンク 141 箇所をハブ entity へ張り替えた。
### Security Engineering 3rd Edition(Ross Anderson, Wiley 2020)(2026-08-23 ingest-book)
- 書籍 entity: [[Security Engineering - A Guide to Building Dependable Distributed Systems]]。全 29 章を章単位で取り込み。原本は著者が無償公開する章別 PDF(`.raw/books/security-engineering-3e/`)。著作権コンテンツのため全章 `publish: false`。
- [[@2020__Wiley__Security Engineering 3e - Chapter 1 What Is Security Engineering?]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 2 Who Is the Opponent?]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 3 Psychology and Usability]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 4 Protocols]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 5 Cryptography]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 6 Access Control]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 7 Distributed Systems]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 8 Economics]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 9 Multilevel Security]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 10 Boundaries]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 11 Inference Control]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 12 Banking and Bookkeeping]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 13 Locks and Alarms]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 14 Monitoring and Metering]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 15 Nuclear Command and Control]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 16 Security Printing and Seals]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 17 Biometrics]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 18 Tamper Resistance]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 19 Side Channels]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 20 Advanced Cryptographic Engineering]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 21 Network Attack and Defence]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 22 Phones]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 23 Electronic and Information Warfare]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 24 Copyright and DRM]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 25 New Directions?]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 26 Surveillance or Privacy?]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 27 Secure Systems Development]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 28 Assurance and Sustainability]]
- [[@2020__Wiley__Security Engineering 3e - Chapter 29 Beyond “Computer Says No”]]
### Controlling the Costs of Coordination in Large-scale Distributed Software Systems(Laura Maguire, The Ohio State University 博士論文 2020)(2026-08-23 ingest-thesis)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 1 Introduction]] — 実務者は異常対応の協調コストをどう制御するかというリサーチクエスチョンを提示し、イベント駆動の協調というクロススケールな視点で論文全体を統合する序論。(thesis / resilience-engineering / incident-response)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 2 Joint activity & anomaly response in large-scale distributed work systems]] — 協調・共同活動・協調コスト・異常対応の中核概念を、Malone & Crowston のコーディネーション理論から Klein et al (2005) の joint activity への転換として整理する理論的土台。Clark & Brennan (1991) のコスト分類(Figure 2.3)が論文題名の直接の出典。(thesis / resilience-engineering / cognitive-systems-engineering)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 3 The domain of Critical Digital Infrastructure]] — Agile/DevOps・クラウド・SLA・CD/CI への移行が CDI の協調要求を質的に変えたと論じ、ICS をソフトウェア工学へ輸入する試み(SRE Book を名指し)を「単純化しすぎ」と批判する背景章。(thesis / sre / incident-response)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 4 Research Methods]] — SNAFU Catchers Consortium 経由で 4 社から収集したデータをもとに、2 本の準備研究(面接 46 名・アーティファクト 27 件・観察約 420 時間)を経て 62 件から 5 件へ絞り込んだ事例コーパスをプロセストレーシングで分析する方法章。(thesis / research-methods)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 5 Findings]] — 4 系統 7 種のインシデントモデル(Incident Command・OAAT とその 3 変種・Escalation・All Hands・SWAT)と 5 件の事例のプロセストレーシングから、16 個のコレオグラフィの構成要素を実証的に導出する中核章。(thesis / incident-response / cognitive-systems-engineering)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 6 Discussion]] — 要素を個別に議論しつつ common ground(AR)と common ground(JA)の区別を導入し、Incident Commander のボトルネック化とサイドチャネリング(Figure 6.1/6.2)、境界を越えたコスト転嫁から第 7 章へ橋渡しする議論章。(thesis / incident-response / coordination)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 7 Adaptive choreography]] — Incident Command の指揮統制構造に代わるモデルとして、コレオグラフィの要素を対応者間で動的に再配分する Adaptive Choreography 枠組みを提示する主たる理論的貢献。同概念の**一次出典**。(thesis / incident-response / coordination)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Chapter 8 Conclusion]] — 協調戦略の適応性を振り返り、Incident Commander を実行責任者から支援役へ再設計する含意と、互酬性・将来の協調への投資・ポストインシデントでの choreography 省察支援を今後の課題に挙げる 2 ページの結論。(thesis / incident-response)
- [[@2020__PhD__Controlling the Costs of Coordination in Large-scale Distributed Software Systems - Appendix A Elements of Choreography]] — 13 の要素それぞれについて、オーバーヘッドコスト・コストを負う主体・時間スケール・事例からの例・協調コストを制御する適応を一覧化した参照表(原表画像 5 点を含む)。(thesis / reference)
- ハブ entity: [[Controlling the Costs of Coordination in Large-scale Distributed Software Systems]]。オープンアクセス(OhioLINK ETD)のため `publish: false` は付けていない。原本は `.raw/theses/phd-maguire-2020-coordination-costs/`。
### High-Resolution Measurement of Data Center Microbursts(Qiao Zhang 他, IMC '17 2017-11-01)(2026-08-23 ingest-paper)
- [[@2017__IMC__High-Resolution Measurement of Data Center Microbursts]] — Facebook本番データセンターのToRスイッチを25µs粒度で計測する独自フレームワークを構築し、輻輳の大半が1ms未満のµburstであることと、90パーセンタイル持続時間が全ラック種別で200µs以下であることを実証した論文。図表10点(Figure 1-10)+表1点(Table 2、Table 1は本文転記)を全点埋め込み。(paper / networking / datacenter)
### Mathematics for Computer Science(Lehman・Leighton・Meyer、MIT OpenCourseWare 2015)(2026-08-23 ingest-book)
- 書籍 entity: [[Mathematics for Computer Science]]。MIT の学部科目 6.042J / 18.062J の教科書を全 21 章・5 部構成で章単位に取り込み。原本は `.raw/books/mathematics-for-computer-science/`(918 ページ)。CC BY-SA 3.0 のオープンな教科書だが、書籍規約に従い全章 `publish: false`。図はベクター図をキャプション座標から切り出し、142 点を全点埋め込み。
- [[@2015__MIT__Mathematics for Computer Science - Chapter 1 What is a Proof?]] — 命題・述語・公理的方法を導入し、含意・同値・場合分け・背理法という 4 つの基本的な証明パターンを提示する、本書全体の入口。(book / mathematics / proof)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 2 The Well Ordering Principle]] — 整列原理を「最小の反例」を取る証明テンプレートとして定式化し、素因数分解の存在証明に適用したうえで整列集合へ一般化する。(book / mathematics / proof)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 3 Logical Formulas]] — 命題論理と述語論理の記法・意味論を体系化し、標準形と SAT 問題、そして P 対 NP 問題へ至る。(book / mathematics / logic)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 4 Mathematical Data Types]] — 集合・列・関数・二項関係・有限濃度を定義し、Mapping Rule によって以降の章の土台を築く。(book / mathematics / set-theory)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 5 Induction]] — 通常の帰納法・強帰納法・整列原理が相互に翻訳可能であることを示し、Floyd の不変条件原理と状態機械によるプログラム検証の枠組みを確立する(図 13 点)。(book / mathematics / proof / verification)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 6 Recursive Data Types]] — 再帰的データ型を基底部と構成子部で定義し、構造的帰納法を括弧整合列・算術式・Ackermann 関数に適用する。(book / mathematics / proof)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 7 Infinite Sets]] — 有限濃度を無限へ拡張し、Cantor の対角線論法から停止性問題の決定不能性を導き、Russell のパラドックスを経て ZFC と公理的方法の限界に立ち返る。(book / mathematics / set-theory / computability)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 8 Number Theory]] — 整除性・最大公約数・素数・合同算術・Euler の定理を積み上げ、Alan Turing の逸話を軸に RSA 公開鍵暗号方式を構築する。(book / mathematics / number-theory / cryptography)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 9 Directed graphs & Partial Orders]] — 有向グラフの語彙と DAG のスケジューリング理論を導入し、関係の性質を軸に半順序・全順序・積順序・同値関係へ一般化する(図 14 点)。(book / mathematics / graph-theory)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 10 Communication Networks]] — 完全二分木・2 次元アレイ・バタフライネット・Beneš ネットの 4 トポロジを、直径・スイッチ数・レイテンシ・輻輳の 4 指標で比較する(図 5 点)。(book / mathematics / networking)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 11 Simple Graphs]] — 次数と握手補題から同型・二部マッチング・安定結婚問題・彩色・連結性・木と最小全域木までを扱い、本書のグラフ理論の主要語彙を確立する(図 34 点)。(book / mathematics / graph-theory)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 12 Planar Graphs]] — 平面グラフを平面描画と平面埋め込みの 2 通りで定義し、オイラーの公式から K5・K3,3 の非平面性・5-彩色定理・正多面体の分類・Kuratowski の特徴づけを導く(図 18 点)。(book / mathematics / graph-theory)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 13 Sums and Asymptotics]] — 年金の現在価値から出発し、積分限界法による和の近似、調和数、Stirling の公式、漸近記法の厳密な定義までを扱う、アルゴリズム解析の道具立て(図 9 点)。(book / mathematics / asymptotics)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 14 Cardinality Rules]] — 全単射の規則を起点に積・和・除法・部分集合の各規則を積み上げ、鳩の巣原理・包除原理・組合せ論的証明までを扱う Part III の中核(図 7 点)。(book / mathematics / combinatorics)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 15 Generating Functions]] — 母関数によって数列を代数的操作の対象へ翻訳し、数え上げ・部分分数分解・線形漸化式の解法を統一的に扱う。(book / mathematics / combinatorics)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 16 Events and Probability Spaces]] — モンティ・ホール問題と非推移的サイコロを題材に四段階法を導入し、確率空間・事象・確率関数を集合論の上に定式化する(図 10 点)。(book / mathematics / probability)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 17 Conditional Probability]] — 条件付き確率と木図法の正当化、全確率の法則とベイズの規則(乳がん検診の陽性適中率が約 15% にとどまる例)、シンプソンのパラドックス、独立性と相互独立性を扱う(図 4 点)。(book / mathematics / probability)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 18 Random Variables]] — 確率変数を標本空間上の関数として定義し、分布関数と代表的な分布、期待値とその線形性(独立性を要求しない点が核心)を導入する(図 10 点)。(book / mathematics / probability)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] — マルコフ・チェビシェフの不等式と分散の性質から、無作為抽出による推定、信頼水準と確率の区別、チェルノフ限界へ展開する。(book / mathematics / probability)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 20 Random Walks]] — 破産問題を 1 次元ランダムウォークとして解析し、わずかな不利さが破滅的に効くことを示したうえで、グラフ上のランダムウォークへ一般化して PageRank を定常分布として定義する(図 9 点)。(book / mathematics / probability)
- [[@2015__MIT__Mathematics for Computer Science - Chapter 21 Recurrences]] — ハノイの塔とマージソートを題材に漸化式の解法(推測と検証、展開と整理、特性方程式、Akra-Bazzi の公式)を体系化し、部分問題のサイズと個数が解の増大率を左右するという直感を養う、本書の締めくくり。(book / mathematics / recurrences)
- [[@2022__IMC__A Microscopic View of Bursts, Buffer Contention, and Loss in Data Centers]] — [[Ehab Ghabashneh]]・[[Sanjay Rao]]([[Purdue University]])、[[Yimeng Zhao]]・[[Cristian Lumezanu]]・[[Neil Spring]]・[[Srikanth Sundaresan]]([[Meta]])。IMC '22。eBPFベースの軽量計測ツールMillisampler/SyncMillisamplerでMeta本番データセンターのラック共有バッファ輻輳(contention)を実測し、輻輳が高いほど損失が多いとは限らないという非自明な関係を発見(RegA-Typicalの損失率がRegA-Highの2.9倍)。(paper / networking / datacenter / congestion-control)
### SRE Book 第 19〜27 章(Google SRE、O'Reilly 2016)(2026-08-24 ingest-book)
- [[@2016__OReilly__SRE Book - Chapter 19 Load Balancing at the Frontend]] — Piotr Lewandowski。フロントエンド負荷分散を DNS 層と VIP 層の 2 段構えで捉え、再帰リゾルバがクライアント位置を隠すこと・TTL が守られないこと・EDNS0 client subnet による部分的緩和を示す。(book / sre / networking)
- [[@2016__OReilly__SRE Book - Chapter 20 Load Balancing in the Datacenter]] — Alejandro Forero Cuervo。バックエンド選定を健全性判定(healthy / refusing connections / lame duck)・サブセット化・負荷分散ポリシー(Round Robin / Least-Loaded / Weighted Round Robin)の 3 層に分解する(図 6 点)。(book / sre / networking)
- [[@2016__OReilly__SRE Book - Chapter 21 Handling Overload]] — Alejandro Forero Cuervo。過負荷を QPS でなく CPU 秒で測り、顧客ごとクォータ・クライアント側の適応スロットリング・criticality 4 段階による選択的棄却・リトライバジェットで受付を設計する(図 1 点)。(book / sre / reliability)
- [[@2016__OReilly__SRE Book - Chapter 22 Addressing Cascading Failures]] — Mike Ulrich。カスケード障害を正のフィードバックループとして定式化し、負荷を戻すだけでは回復しない非対称性、誘発要因(リトライ増幅・デッドライン伝播の欠如・コールドキャッシュ)、脱出手順を体系化する(図 3 点)。(book / sre / reliability)
- [[@2016__OReilly__SRE Book - Chapter 23 Managing Critical State - Distributed Consensus for Reliability]] — Laura Nolan。ハートビートによるアドホックなリーダー選出が招いた本番障害を示し、Multi-Paxos・レプリカ配置・クォーラム構成・レイテンシ・監視という分散合意の運用面を扱う(図 15 点)。(book / sre / distributed-systems)
- [[@2016__OReilly__SRE Book - Chapter 24 Distributed Periodic Scheduling with Cron]] — Štěpán Davidovič。べき等でない周期ジョブを分散環境で確実に一度だけ実行する問題。スキップと二重実行のトレードオフ、Paxos ログへの起動記録、外部副作用(Borg ジョブ)の耐久化、thundering herd 回避(図 2 点)。ACM Queue 2015 の *Reliable Cron Across the Planet* に一部先行掲載。(book / sre / distributed-systems)
- [[@2016__OReilly__SRE Book - Chapter 25 Data Processing Pipelines]] — Dan Dennison。周期パイプラインの構造的脆さ(データ量の不均衡・ストラグラー・モアレ負荷パターン)を示し、Google Workflow による継続処理への移行と MVC パターンの分散システムへの翻案を扱う(図 6 点)。(book / sre / data-engineering)
- [[@2016__OReilly__SRE Book - Chapter 26 Data Integrity - What You Read Is What You Wrote]] — Raymond Blum, Rhandeev Singh。データ完全性は可用性と独立の目標であり、目的はバックアップでなく復旧であるという中心命題。障害モードの 3 軸 24 通り、多層防御 3 段、Gmail・Google Music の実例(図 4 点)。(book / sre / storage)
- [[@2016__OReilly__SRE Book - Chapter 27 Reliable Product Launches at Scale]] — Rhandeev Singh, Sebastian Kirsch, Vivek Rau。Launch Coordination Engineering 職能とローンチチェックリスト。チェックリストは過去の障害から抽出された組織の記憶であり、5 基準(軽量・頑健・徹底的・スケーラブル・適応的)の均衡の上に成り立つ。(book / sre / release)
- [[@2024__SpeakerDeck__アクセラレータ間通信の実際]] — 上野裕一郎([[Preferred Networks]])。MPLS Japan 2024。PFN の H100 クラスタ(RoCEv2)を題材に NVLink・DCQCN・NCCL の技術スタックを整理し、SuperMicro サーバの PCIe SW 論理分割による NCCL の NIC 選択偏りと Arista スイッチのクレジット管理起因のインターコネクト不安定という2件のトラブルシューティング事例を報告。(slides / networking / rdma / llm)
- [[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]] — Richard L. Graham ほか([[Mellanox]])。2016 First International Workshop on Optimization of Communication in HPC Systems(COM-HPC 2016)。InfiniBand SwitchIB-2 ASIC に集団操作の縮約処理をオフロードする SHArP プロトコルを提案し、128 ホストの 8 byte MPI Allreduce() を 2.1 倍、パイプライン化した 4096 byte を 3.24 倍高速化。(paper / networking / hpc / rdma / collective-communication)
### GenRec: Towards LLM-native Recommendation at Netflix(Ying Li・Arjun Rao・Shradha Sehgal、Netflix TechBlog、2026-08)(2026-08-24 ingest)
- [[@2026__Netflix TechBlog__GenRec - Towards LLM-native Recommendation at Netflix]] — Ying Li・Arjun Rao・Shradha Sehgal([[Netflix]])。内製の基盤LLMをNetflix固有データ・目的関数でpost-trainしたLLMバックエンド推薦ランカー「GenRec」の事例報告。ユーザー履歴・アイテムメタデータ・文脈を言語化しカタログ対応スコアリングヘッドでフルカタログランキングし、prefill-onlyモードでvLLM上サービングする。大規模A/Bテストで、Phase-2ラベルを約40分の1しか使わずに本番ランカーに対し短期・長期双方のオンライン指標で統計的有意な改善を達成した。(article / llm / recommendation-system / netflix / ranking / context-engineering)
### Could AIs become conscious?(The Economist、2026-08-20)(2026-08-24 ingest)
- [[@2026__TheEconomist__Could AIs become conscious]] — The Economist Leaders 欄の社説。AI が意識を持つかという一次的な問いには不可知論を取りつつ、AI が意識を持つと人間に見なされること自体が「福祉」保護要求や AI 人格権の主張へつながる政治的リスクを論じる。Kant の動物虐待論を AI への残酷さへ転用し、限定的な AI の権利付与ですら権力集中を招くと警告する。(article / ai-safety / ai-consciousness / ai-rights)
### Verbalizable Representations Form a Global Workspace in Language Models(Wes Gurnee・Nicholas Sofroniew ほか、Anthropic、Transformer Circuits Thread、2026-07-06)(2026-08-24 ingest-paper)
- [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]] — Wes Gurnee・Nicholas Sofroniew(core)ほか、Jack Lindsey(core, correspondence)、[[Anthropic]]。PDF を持たない HTML 専用 Web 出版物。J-lens(Jacobian lens)という新しい解釈可能性技術により、LLM が報告・操作・内部推論に使われる特権的な内部表現の部分集合(J-space)を持ち、これがグローバルワークスペース理論の機能的性質(verbal report・directed modulation・internal reasoning・flexible generalization・selectivity)を満たすことを介入実験で示した。J-lens をアラインメント監査(脅迫シナリオ・報酬ハッキングモデルオーガニズム等)と counterfactual reflection training という新訓練技術に応用した。(paper / machine-learning / interpretability / ai-safety / philosophy-of-mind)
### The Working Set Model for Program Behavior(Peter J. Denning、MIT、CACM 1968)(2026-08-24 ingest-paper)
- [[@1968__CACM__The Working Set Model for Program Behavior]] — Peter J. Denning(MIT)。Communications of the ACM Vol.11 No.5(1968年5月)。プロセスのメモリ需要を「直近τ秒間に参照されたページ集合 W(t, τ)」として定式化するワーキングセットモデルの原典。プロセス(プロセッサ需要)とワーキングセット(メモリ需要)を同一の計算活動の2つの現れとして統一的に扱い、メモリの過剰コミットメントによる性能崩壊を指す「スラッシング(thrashing)」という用語を導入した。図10点(Fig.1〜9、Fig.A)を全点埋め込み。(paper / systems / memory-management / operating-systems)
### Understanding the limitations of pubsub systems(Atul Adya・Phil Bogle・Colin Meek、Databricks、HOTOS 25)(2026-08-24 ingest-paper)
- [[@2025__HOTOS__Understanding the limitations of pubsub systems]] — Atul Adya・Phil Bogle・Colin Meek([[Databricks]])。HOTOS 25(2025-05-14〜16, Banff)。pubsub システムがメッセージング抽象化とストレージ層を暗黙に一体化していることが疎結合の失敗・エンドツーエンド論違反・アドホックなストレージ API という3系統の限界を生むと論じ、ストレージを明示的に露出させた「Watch API」(Consumer API・Ingester API)へのアンバンドリングを提案するポジションペーパー。図5点(Pubsub model・キャッシュ無効化レース・ストレージ/通知マトリクス・Watch アーキテクチャ・watcher の知識領域)を全点埋め込み。(paper / distributed-systems / messaging / pubsub)
### Building Secure and Reliable Systems(Google Security / SRE 編、O'Reilly 2020、全 5 部 21 章 + Conclusion + Appendix)(2026-08-24 ingest-book)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 1 The Intersection of Security and Reliability]] — Adam Stubblefield・Massimiliano Poletto・Piotr Lewandowski。信頼性とセキュリティは共に創発特性だが、敵対者の有無という一点が両者の設計判断を分岐させる(図 1 点)。(book / security / reliability)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 2 Understanding Adversaries]] — Heather Adkins・David Huska。敵対者を動機・プロファイル・手法の 3 枠組みで捉え、内部者リスクへの設計対策を示す。(book / security)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 3 Case Study - Safe Proxies]] — Jakub Warmuz・Ana Oprea。セーフプロキシで本番操作を仲介し、監査・多者承認・レート制限を既存システムに後付けする(図 2 点)。(book / security / sre)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 4 Design Tradeoffs]] — Christoph Kern。機能要件とセキュリティ・信頼性は対立せず、初期投資により両立できると説く。(book / security / software-engineering)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 5 Design for Least Privilege]] — Oliver Barrett・Aaron Joyner・Rory Ward。最小権限を、リスクに基づく分類・小さな機能 API・監査・多者承認等の高度な制御に分解して実装する。(book / security)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 6 Design for Understandability]] — Julien Boeuf・Christoph Kern・John Reese。不変条件・信頼計算基盤・アイデンティティ層・型で複雑性を封じ込め、理解容易性を設計品質として扱う(図 4 点)。(book / security / software-engineering)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 7 Design for a Changing Landscape]] — Maya Kaczorowski・John Lunney・Deniz Pecel。短期・中期・長期の変化に高信頼性を保ったまま追随する設計と、HTTPS 移行という業界規模の移行の完遂法(図 1 点)。(book / security / sre)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 8 Design for Resilience]] — Vitaliy Shipitsyn・Mitch Adler・Zoltan Egyed・Paul Blankinship。多層防御・劣化の制御・影響範囲の分離・障害ドメインと冗長性・継続的検証でレジリエンスを設計する(図 4 点)。(book / security / resilience)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 9 Design for Recovery]] — Aaron Joyner・Jon McCune・Vitaliy Shipitsyn。復旧は速度とポリシーの分離、単調な MASVN によるロールバック制御、意図した状態の把握で支える(図 2 点)。(book / security / reliability)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 10 Mitigating Denial-of-Service Attacks]] — Damian Menscher。DoS を需要が供給を超える経済攻撃と捉え直し、階層防御・自動緩和・自作の攻撃への対処を論じる(図 2 点)。(book / security / networking)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 11 Case Study - Designing, Implementing, and Maintaining a Publicly Trusted CA]] — Andy Warner・James Kasten・Rob Smits・Piotr Kucharski・Sergey Simakov。公的に信頼される認証局を内製する判断と、その設計・鍵保護・発行検証の運用。(book / security / cryptography)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 12 Writing Code]] — Michał Czapiński・Julian Bangert。型とフレームワークで危険なコードをコンパイル不能にし、開発者の注意力に頼らず安全性を構造的に強制する(図 2 点)。(book / security / software-engineering)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 13 Testing Code]] — Phil Ames・Franjo Ivančić。単体・統合・動的解析・ファジング・静的解析を開発者ワークフローへ統合して初めて効果が積み上がる(図 4 点)。(book / security / software-engineering)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 14 Deploying Code]] — Jeremiah Spradlin・Mark Lodato。デプロイは「誰が」ではなく「何を」検証すべきであり、バイナリ来歴・検証可能ビルド・チョークポイントで敵対者の迂回を防ぐ(図 8 点)。(book / security / devops)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 15 Investigating Systems]] — Pete Nuttall・Matt Linton・David Seidman。デバッグ技法とセキュリティ調査の違い、およびログの不変性・保持・アクセス制御の設計トレードオフ(図 1 点)。(book / security / observability)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 16 Disaster Planning]] — Michael Robinson・Sean Noonan。災害が起きる前の準備。リスク分析・IR チーム組成・重大度/優先度モデル・段階的テスト(図 1 点)。(book / security / incident-response)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 17 Crisis Management]] — Matt Linton。危機か否かのトリアージから運用セキュリティ・並列化・引き継ぎ・士気管理まで、危機の指揮統制(図 2 点)。(book / security / incident-response)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 18 Recovery and Aftermath]] — Alex Perry・Gary O’Connor・Heather Adkins。セキュリティ復旧は攻撃者という反応する相手を前提に、追い出しの時機と技術的負債のトレードオフを設計する(図 3 点)。(book / security / incident-response)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 19 Case Study - Chrome Security Team]] — Parisa Tabriz。Chrome セキュリティチームは脆弱性報奨金プログラム発足とハイブリッドエンジニアリングチーム化を経て多層防御と透明性の文化を築いた。(book / security / culture)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 20 Understanding Roles and Responsibilities]] — Heather Adkins・Cyrus Vesuna・Hunter King・Felix Gröbert・David Challoner。セキュリティは全員の責任であり、専門家は専門実装とベストプラクティス整備に徹すべきだと説く。(book / security / culture)
- [[@2020__OReilly__Building Secure and Reliable Systems - Chapter 21 Building a Culture of Security and Reliability]] — Heather Adkins。本書全体の技術的実践は、意図的に設計された組織文化に支えられて初めて機能する(図 2 点)。(book / security / culture)
- [[@2020__OReilly__Building Secure and Reliable Systems - Conclusion]] — Heather Adkins ほか編者。セキュリティと信頼性はシステム固有の属性であり全員の責任だと結び、知識領域の横断とチームへの投資を訴える。(book / security)
- [[@2020__OReilly__Building Secure and Reliable Systems - Appendix A Disaster Risk Assessment Matrix]] — 編者。発生確率(6 段階)×影響度(5 段階)で災害リスクを格付けするサンプルマトリクス。(book / security / incident-response)
### The Art of Computer Systems Performance Analysis(Raj Jain、John Wiley & Sons 1991、全 6 部 36 章)(2026-08-24 ingest-book)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 1 Introduction]] — 性能評価は科学ではなく技芸(art)であるという本書の題名の由来を示し、6 部構成が性能評価の 6 種の典型問題に対応することを述べる。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 2 Common Mistakes and How to Avoid Them]] — 性能評価によくある 22 の誤りを列挙し、それを避ける 10 段階の体系的アプローチと事例研究のプロジェクト計画を示す(図 1 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 3 Selection of Techniques and Metrics]] — 解析モデリング・シミュレーション・測定の 3 技法を 7 つの規準で比較し、サービス要求の 3 帰結からメトリクスを体系的に導く(図 5 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 4 Types of Workloads]] — 加算命令・命令ミックス・カーネル・合成プログラム・アプリケーションベンチマークという 5 段階でテストワークロードの発展を追う(図 5 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 5 The Art of Workload Selection]] — SUT と CUS を区別し、行使されるサービス・詳細度・代表性・適時性という 4 つの判断軸でワークロードを選ぶ(図 3 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 6 Workload Characterization Techniques]] — 平均・ばらつき・ヒストグラム・主成分分析・マルコフモデル・クラスタリングという 7 技法のカタログを与える(図 8 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 7 Monitors]] — モニタを実装水準・起動機構・結果提示方法で分類し、設計上のトレードオフと分散システムモニタの層構造を論じる(図 2 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 8 Program Execution Monitors and Accounting Logs]] — プロファイラの設計論に加え、課金目的で既に取られているログを性能解析に転用するという実務的発想を示す(図 1 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 9 Capacity Planning and Benchmarking]] — キャパシティ計画の手順と難所を示し、ベンチマーキングのよくある誤りとゲームを分けて列挙する(図 7 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 10 The Art of Data Presentation]] — 良い図の指針・図のよくある誤り・図によるゲームの 3 本立てに、ガントチャート・Kiviat グラフ・Schumacher チャートを加える(図 27 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 11 Ratio Games]] — 比率は基準の選び方ひとつで結論を反転させられることを数値例で示し、本書の「ゲーム」の系列を締めくくる(図 2 点)。(book / performance / performance)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 12 Summarizing Measured Data]] — 測定データを 1 つの数にまとめるとき、平均・中央値・最頻値やばらつきの指標をどう選ぶかの判定規則を与える(図 6 点)。(book / performance / statistics)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 13 Comparing Systems Using Sample Data]] — 標本から信頼区間を構成し、対応の有無で手続きを分けて 2 系統を比較する。仮説検定より信頼区間を推奨する立場を採る(図 4 点)。(book / performance / statistics)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 14 Simple Linear Regression Models]] — 単回帰の最小二乗推定・変動の配分・信頼区間と、モデルの前提を残差プロットで視覚的に検証する手続きを扱う(図 15 点)。(book / performance / statistics)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 15 Other Regression Models]] — 重回帰・カテゴリ予測子・曲線回帰・変換・外れ値と、回帰におけるよくある誤りを扱う(図 6 点)。(book / performance / statistics)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 16 Introduction to Experimental Design]] — Part IV の用語を定義し、単純設計・完全要因計画・一部実施要因計画を実験数と情報量のトレードオフとして分類する(図 1 点)。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 17 2k Factorial Designs]] — 2 水準 k 要因の効果を符号表と応答値の内積で機械的に算出し、総変動を各効果の平方和へ配分する。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 18 2kr Factorial Designs with Replications]] — 反復により実験誤差を推定して効果の信頼区間を得る。前提が破れれば対数変換で乗法モデルへ移す(図 6 点)。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 19 2k-p Fractional Factorial Designs]] — 実験数を減らす代償として生じる交絡を、交絡の代数と設計の解像度によって設計時に予測する。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 20 One-Factor Experiments]] — 3 水準以上を取る一要因の実験を扱い、分散分析(ANOVA)の F 検定による有意性判定を導入する(図 2 点)。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 21 Two-Factor Full Factorial Design Without Replications]] — 二要因実験を扱うが、反復がないため相互作用と実験誤差を分離できないという制約のもとで分析する(図 11 点)。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 22 Two-Factor Full Factorial Design with Replications]] — 反復によって誤差を独立に推定できるようにし、相互作用そのものの有意性を検定可能にする(図 2 点)。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 23 General Full Factorial Designs with k Factors]] — k 要因へ一般化し、完全要因計画が実験数の爆発で破綻して一部実施要因計画へ回帰する構造で Part IV を閉じる(図 1 点)。(book / performance / experimental-design)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 24 Introduction to Simulation]] — シミュレーションの失敗要因、モデルの分類語彙、言語選択、3 類型、事象集合アルゴリズムを扱う(図 9 点)。(book / performance / simulation)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 25 Analysis of Simulation Results]] — 検証と妥当性確認を区別し、過渡状態の除去と、目標とする信頼区間の幅から決まる停止条件を扱う(図 13 点)。(book / performance / simulation)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 26 Random-Number Generation]] — 擬似乱数生成器の設計論。線形合同法を中心に、周期と質を決めるパラメータの選び方とシード選択の指針を与える(図 5 点)。(book / performance / simulation)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 27 Testing Random-Number Generators]] — 生成器の検定を一様性と独立性の 2 系統に整理し、二段階検定と k 次元一様性で束ねる(図 7 点)。(book / performance / simulation)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 28 Random-Variate Generation]] — 一様乱数から任意の分布に従う変量を作る、逆変換・棄却・合成・畳み込み・特性という 5 つの汎用手法を並べる(図 4 点)。(book / performance / simulation)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 29 Commonly Used Distributions]] — 約 20 の分布を統一書式で並べ、分布どうしの導出・極限の関係を 1 枚の地図にまとめる(図 2 点)。(book / performance / simulation)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 30 Introduction to Queueing Theory]] — ケンドール記法、分布によらず成り立つ規則、リトルの法則、確率過程の類型という Part VI の共通言語を導入する(図 7 点)。(book / performance / queueing)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 31 Analysis of a Single Queue]] — 生死過程を道具に M/M/1・M/M/m・有限バッファを解き、使用率が 1 に近づくと応答時間が非線形に発散することを示す(図 5 点)。(book / performance / queueing)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 32 Queueing Networks]] — ネットワークを開放型・閉鎖型・混合型に分け、後続章の解法を支える積形式の成立条件を与える(図 8 点)。(book / performance / queueing)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 33 Operational Laws]] — 確率分布を一切仮定せず測定量の定義だけから導ける 5 法則と、そこから引けるボトルネックの上下界を示す(図 4 点)。(book / performance / queueing)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 34 Mean-Value Analysis and Related Techniques]] — 閉鎖型ネットワークをジョブ数の再帰で解く平均値解析(MVA)と、その近似解法および均衡ジョブ限界を扱う(図 5 点)。(book / performance / queueing)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 35 Convolution Algorithm]] — 積形式ネットワークの正規化定数 G(N) を畳み込みで求め、全性能量を G の比として導く。(book / performance / queueing)
- [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 36 Hierarchical Decomposition of Large Queueing Networks]] — Chandy-Herzog-Woo の定理で部分ネットワークを等価な 1 センターへ縮約する階層分解を示し、最後に待ち行列理論自身の適用限界を列挙して本書を閉じる(図 5 点)。(book / performance / queueing)
### 実践SONiC入門(海老澤健太郎、技術評論社 2025、全 11 章 + Appendix)(2026-08-24 ingest-book)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 1 ホワイトボックススイッチとSONiCアーキテクチャ]] — スイッチの 3 プレーンと物理構成を整理し、Switch ASIC ベンダー間の差異を吸収する SAI 誕生の背景と SONiC アーキテクチャの全体像を導入する(図 6 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 2 SONiCの機能とユースケース]] — Microsoft・Alibaba・Target・eBay・Google・Orange S.A.・LINE・KDDI の 8 事例と、Switch ASIC 以外への適用例(SONiC-DASH・SONiC-VPP)から採用の広がりを示す(図 8 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 3 コミュニティ運営と開発プロセス]] — SONiC Foundation の理事会・TSC・ワーキンググループという三層ガバナンスと、HLD レビューを起点とする年 2 回のリリースプロセス(図 2 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 4 商用版SONiCと有償サポート]] — 商用版は必ずしも有償ライセンスを意味せず、対応プラットフォーム・機能・テスト・ドキュメントの 4 軸でコミュニティ版と異なる。ベンダー選定と支援調達の検討ポイント(図 1 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 5 SONiCの入手とインストール]] — 対応ハードウェアの見分け方、イメージ入手経路、ONIE による実機インストール、KVM 上の sonic-vs による仮想環境構築(図 1 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 6 SONiCの基本操作と設定方法]] — CONFIG_DB を単一の信頼できる情報源とする宣言的設定モデルと、Click ベース CLI・Klish ベース CLI の併存(図 1 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 7 SONiCの内部構造:アーキテクチャとサブシステム]] — サブシステム(コンテナ)とモジュール(プロセス)の 2 階層構造の原理と、各コンテナの役割・supervisord による起動制御(図 3 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 8 SONiCの内部構造:ステートの流れとモジュール連携]] — Redis データベース群を介したステートの読み出し・変換・書き込みと、Pub/Sub 通知による疎結合なモジュール連携(図 11 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 9 SAI詳細解説[API・オブジェクト・データプレーンパイプライン]]] — SAI による Switch ASIC の CRUD 抽象化と、orchagent が sairedis 経由で呼ぶ一方 vendor SAI に実リンクするのは syncd だけという非対称性(図 10 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 10 高度な設定と利用法]] — 章題に反し実態はほぼ全編が SRv6。CLI 未実装機能を APPL_DB へ直接投入する経路と、End.DT46・H.Encaps.Red の対比を SAI オブジェクトまで検証(図 5 点)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Chapter 11 SONiCのトラブルシューティング]] — show コマンドから syslog・swss.rec/sairedis.rec、GDB・ASIC デバッグシェルへと侵襲度順にエスカレーションする層別の切り分け手順(図なし)。(book / networking / SONiC)
- [[@2025__Gihyo__実践SONiC入門 - Appendix 1 ソースコードからのビルド]] — .deb 生成 → Docker イメージ生成 → sonic-$(PLATFORM).bin 統合という多段ビルドと、外部依存の変化に起因するビルド失敗という課題(図 2 点)。(book / networking / SONiC)
- [[@2022__IETF__RFC 9161 - Operational Aspects of Proxy ARP-ND in Ethernet Virtual Private Networks]] — RFC 7432 を更新する Standards Track(2022-01)。EVPN の Proxy ARP/ND 機能の運用面(6サブ機能・重複IP検知・4展開シナリオ)を規定する。(source / networking / evpn / arp)
- [[@2008__SIGCOMM__Floodless in SEATTLE - A Scalable Ethernet Architecture for Large Enterprises]] — Changhoon Kim・Matthew Caesar・Jennifer Rexford(Princeton/UIUC)による SIGCOMM 2008 論文。一hopネットワーク層DHT・コンシステントハッシング・トラフィック駆動キャッシュにより、Ethernetブリッジングに比べ制御オーバーヘッドと状態量を約2桁削減し、識別子ベースルーティング(ROFL)より低ストレッチ・高パス安定性を実現。(paper / networking / ethernet / dht / routing)
- [[@2014__NSDI__Network Virtualization in Multi-tenant Datacenters]] — Teemu Koponen ほか(VMware; Scott Shenker は ICSI/UC Berkeley)による NSDI 2014 論文。数百の本番環境に展開された NVP(Network Virtualization Platform)の設計・実装を報告。宣言的言語 nlog による増分状態計算、論理/物理二層のコントローラクラスタ、STT カプセル化によるハードウェアオフロードの回復が中心。(paper / networking / sdn / virtualization)
- [[@2018__CoNEXT__The eXpress Data Path - Fast Programmable Packet Processing in the Operating System Kernel]] — Toke Høiland-Jørgensen ほか(Karlstad University/Red Hat/Cilium.io/Quantonium/Cumulus Networks)による CoNEXT 2018 論文。XDP(eXpress Data Path)の設計原論文で、4コンポーネント(ドライバフック・eBPF VM・BPF maps・verifier)のアーキテクチャ、DPDK比較性能評価(単一コア24 Mpps対43.5 Mpps)、ソフトウェアルーティング・DDoS緩和・ロードバランシングの実世界ユースケースを report する。(paper / networking / linux / ebpf / xdp / kernel)
- [[@2021__TNSM__Assessing Container Network Interface Plugins - Functionality, Performance, and Scalability]] — Shixiong Qi・Sameer G. Kulkarni・K. K. Ramakrishnan(UC Riverside/IIT Gandhinagar)による IEEE TNSM 2021 論文。Flannel・Weave・Cilium・Calico(4モード)・Kube-router を定性・定量の両面で比較し、CPUサイクル/パケット(CPP)によるカーネル内オーバーヘッド分解で性能差の根本原因を特定する。(paper / networking / kubernetes / container / cni)
- [[@2018__Impress__LeanとDevOpsの科学 - Introduction はじめに]] — 著者3名が2013年末にPuppet社チームと合流して始めた4年間・23,000件超の調査研究の成り立ちと、本書3部構成の読み方。(book / devops / 調査設計)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 1 業務を加速させるということ]] — 成熟度モデルからケイパビリティモデルへ転換すべき4つの理由と、24のキーとなるケイパビリティ・2017年の性能比較の先取り。(book / devops / ケイパビリティモデル)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 2 開発組織のパフォーマンスを計測]] — デプロイの頻度・変更のリードタイム・MTTR・変更失敗率の4指標とクラスター分析によるパフォーマー分類。速度と安定性にトレードオフがないことを示す。(book / devops / メトリクス)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 3 組織文化のモデル化と測定、改善の方法]] — Ron Westrumの組織文化3類型をリッカート尺度で測定し、文化がデリバリ性能・組織性能・職務満足度を予測することを立証。(book / devops / 組織文化)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 4 技術的プラクティス―継続的デリバリの基本原則と効果]] — 継続的デリバリを1つのケイパビリティとして測定し、バージョン管理・テスト自動化・トランクベースの開発などの実証効果を検証。(book / devops / 継続的デリバリ)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 5 アーキテクチャのキーポイント]] — システムのタイプは性能と無相関で、テスト容易性・デプロイ容易性という疎結合の2特性がハイパフォーマーを予測する。(book / devops / アーキテクチャ)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 6 デリバリライフサイクルに情報セキュリティを組み込む]] — 情報セキュリティのシフトレフトがデリバリ性能とセキュリティの質を同時に高めることの実証。(book / devops / セキュリティ)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 7 ソフトウェア管理のプラクティス]] — リーンマネジメントをWIP制限・可視化・負担の軽い変更承認プロセスでモデル化。チーム外承認の必須化は速度を悪化させ品質を改善しない。(book / devops / リーン)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 8 製品開発のプラクティス]] — リーン製品開発の4ケイパビリティが性能・文化を高めバーンアウトを軽減し、デリバリ性能と好循環をなす。(book / devops / リーン)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 9 作業を持続可能にするデプロイ負荷とバーンアウトの軽減]] — デプロイ関連の負荷とバーンアウトの測定尺度、Maslachの6つの組織的危険因子、技術・リーンのプラクティスによる軽減。(book / devops / バーンアウト)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 10 従業員の満足度、アイデンティティ、コミットメント]] — eNPS・帰属意識・職務満足度が組織成果を底上げすることと、2017年調査のジェンダー・少数人種の内訳。(book / devops / 従業員エンゲージメント / 多様性)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 11 変革型リーダーシップとマネジメントの役割]] — 変革型リーダーシップの5次元を測定し、その影響が技術・リーンのケイパビリティを介した間接的なものであることを示す。(book / devops / リーダーシップ)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 12 統計学的背景]] — 調査研究の分類、Leekのデータ分析6類型、相関と因果の区別、データフィッシングの回避、階層的クラスター分析。(book / 統計 / 研究方法論)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 13 計量心理学入門]] — 潜在的構成概念による数量化と、弁別的妥当性・収束的妥当性・信頼性の検定手続き。(book / 計量心理学 / 研究方法論)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 14 アンケート調査を採用する理由]] — システムデータではなくアンケート調査を用いる5つの理由をIBMディスクストレージ事例などで論証。(book / 研究方法論 / 調査設計)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 15 データの収集方法]] — 母集団の絞り込みとスノーボールサンプリングの採用理由、2つの制約への対処、代表性への4つの検証手段。(book / 研究方法論 / 標本抽出)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 16 ハイパフォーマンスを実現するリーダーシップとマネジメント]] — ING Netherlandsの事例研究。スクワッド/トライブ/チャプター、オーベヤとキャッチボール、コーチとしてのリーダー。(book / devops / 組織設計 / 事例研究)
- [[@2018__Impress__LeanとDevOpsの科学 - Chapter 17 おわりに]] — デリバリ性能が全組織にとって重要であることが全調査で一貫して証明されたと振り返り、ハイパフォーマンスは購入も模倣もできないと結ぶ。(book / devops)
- [[@2018__Impress__LeanとDevOpsの科学 - Appendix A 改善促進効果の高いケイパビリティ]] — 24のケイパビリティを5カテゴリーに分類し、詳説する章へのリンクを添えた参照資料。(book / devops / ケイパビリティ)
### InterconnectLens: Enhancing Observability of Data Transfers in GPU Clusters(Koshi Eguchi・Ryo Nakamura・Yohei Kuga・Kenjiro Taura、東京大学/トヨタ自動車/NII LLMC、PEARC '25)(2026-08-24 ingest-paper)
- [[@2025__PEARC__InterconnectLens - Enhancing Observability of Data Transfers in GPU Clusters]] — GPUDirect RDMAがCPU・ホストメモリをバイパスして高速化する一方、GPU間通信路がCPU・GPU・Root Complex・RNICの複数コンポーネントを経由するためNICメトリクス単体では原因追跡できない課題に対し、dcgm-exporter・拡張版Intel pcm・procfsベースRNIC Exporterを組み合わせてPrometheusへ統合するオブザーバビリティツールICLensを提案。TCP誤用・GPUDirect RDMA誤設定・イーサネットスイッチ輻輳の3ケーススタディで、単一コンポーネント監視では区別できない問題をコンポーネント別TX/RX可視化で切り分けられることを示した。図9点(Figure 1〜5、全サブ図)を全点クロップ埋め込み。(paper / networking / observability / gpu)
### A PCIe Congestion-Aware Performance Model for Densely Populated Accelerator Servers(Maxime Martinasso・Grzegorz Kwasniewski・Sadaf R. Alam・Thomas C. Schulthess・Torsten Hoefler、ETH Zurich/CSCS/Oak Ridge National Laboratory、SC16)(2026-08-25 ingest-paper)
- [[@2016__SC__A PCIe Congestion-Aware Performance Model for Densely Populated Accelerator Servers]] — MeteoSwissの高密度GPU搭載サーバ(Cray CS-Storm)を背景に、GPU間PCIe通信のポートアービトレーション・フロー制御・HOLブロッキングを4段階アルゴリズムでモデル化した輻輳考慮型性能モデルの論文。8GPU構成の2トポロジ(T1・T2、あわせて約19万通信)での検証で97%以上の通信を誤差±15%以内に予測し、COSMO気象予報モデルのhalo exchange通信パターン最適化に適用して2Dで最大1.9倍・3Dで最大2.57倍の輻輳グラフ間性能差を実証した。図11点(すべてベクター描画、PyMuPDFキャプション座標クロップで全件埋め込み、Figure 6のみ埋め込みラスター画像2点)、表2点(Table I・IIをMarkdown表に転記)。(paper / networking / hpc / gpu)
### Understanding PCIe performance for end host networking(Rolf Neugebauer・Gianni Antichi・José Fernando Zazo・Yury Audzevich・Sergio López-Buedo・Andrew W. Moore、SIGCOMM '18)(2026-08-25 ingest-paper)
- [[@2018__SIGCOMM__Understanding PCIe performance for end host networking]] — PCIe(Gen 3 x8)の理論モデルとマイクロベンチマークスイート pcie-bench を提案し、Netronome NFPとNetFPGAという独立2実装で複数世代のIntel Xeonサーバを横断特性評価した論文。ExaNIC計測で128Bパケットのレイテンシの90.6%・1500Bでも77.2%をPCIeが占めることを示し、IOMMU有効時はワーキングセットがIO-TLBサイズ(推定64エントリ=256KB)を超えると64B DMA読み出しスループットが最大70%低下、NUMA環境ではリモート64B読み出しがローカル比約20%低下、DDIOはキャッシュ常駐データへのアクセスを約70ns高速化することを確認。同世代のXeon E5とE3でPCIeレイテンシ分布が劇的に異なる(E3は99.9パーセンタイルが中央値の10倍近く)という驚くべき差異も報告する。図9点(すべてベクター描画、PyMuPDFキャプション座標クロップで全件埋め込み)、表2点(Table 1・2をMarkdown表に転記)。(paper / source / networking / pcie)
### hwloc: a Generic Framework for Managing Hardware Affinities in HPC Applications(François Broquedis ほか、University of Bordeaux/INRIA/CNRS/ENSEIRB、PDP 2010)(2026-08-25 ingest-paper)
- [[@2010__PDP__hwloc a Generic Framework for Managing Hardware Affinities in HPC Applications]] — マルチコア化・NUMA化で複雑化したHPC機械のハードウェアトポロジを、OS非依存の汎用オブジェクト木構造として抽象化するhwlocの設計論文。共通祖先の深さ・共有キャッシュサイズという近接度情報がOpenMPスレッドスケジューリング(FORESTGOMPのCache方式)・MPIプロセス配置(SCOTCH静的マッピング)・MPI通信の動的閾値決定(KNEMのI/OATオフロード)の3レイヤーで有用であることを示す。図6点(Figure 1・2・3・8・9をPyMuPDFキャプション座標クロップ、Figure 4はコードブロック転記)、表3点(Table I〜IIIをMarkdown表転記)。(paper / hpc / systems / numa)
### Understanding the Host Network(Midhul Vuppalapati・Saksham Agarwal・Henry N. Schuh・Baris Kasikci・Arvind Krishnamurthy・Rachit Agarwal、Cornell University/University of Washington、ACM SIGCOMM '24)(2026-08-25 ingest-paper)
- [[@2024__SIGCOMM__Understanding the Host Network]] — ホストネットワーク(プロセッサ・メモリ・周辺機器インターコネクト)内の競合を、ドメインごとのクレジットベースフロー制御という概念的抽象化で解明する論文。既存研究が報告した「メモリ帯域飽和時にP2MがC2Mを圧迫する」現象(赤レジーム)を再現・説明するだけでなく、メモリ帯域未飽和でもC2Mのみが劣化しP2Mが無傷という逆方向の新現象(青レジーム)を発見。Intel uncore performance countersでドメインのクレジット数・レイテンシをリバースエンジニアリングし、誤差10%以内の解析式で定量的に検証した。図12点+表2点(Figure 1-12・Table 1-2)を全点取り込み(除外なし)。全図がベクター描画のためPyMuPDFキャプション座標クロップで取得。(paper / networking / hardware / rdma)
### Understanding and Profiling CXL.mem Using PathFinder(Xiao Li・Zerui Guo・Yuebin Bai・Mahesh Ketkar・Hugh Wilkinson・Ming Liu、University of Wisconsin-Madison/Beihang University/Intel、ACM SIGCOMM '25)(2026-08-25 ingest-paper)
- [[@2025__SIGCOMM__Understanding and Profiling CXL.mem Using PathFinder]] — サーバプロセッサとそのチップセットを多段Closネットワークとみなし、各アーキテクチャモジュールにPMUベースのテレメトリエンジンを装備してCXL.memの4データパス(DRd・DWr→RFO・RFO・HW/SW PF)を追跡する軽量プロファイラPathFinderの提案論文。traceroute・reverse traceroute・Little's Lawキューイング解析といったネットワーク領域のトラフィック解析技術をホスト内部のマイクロアーキテクチャ解析に転用し、232種のPMUカウンタでCXL.mem実行を解剖する。7ケーススタディ(パス分類・スタックサイクル分解・ローカル-CXL干渉・CXL mFlow間輻輳・帯域分割・データローカリティ・TPP最適化)を通じ、CXLアクセスがコアのパイプラインストールサイクルを平均2.1〜2.7倍に増加させることを実測。図13点(Figure 1-13)を全点PyMuPDFキャプション座標クロップで埋め込み、Figure 14-16(付録、EMRサーバでの再現性検証)とTable 1-6(PMUカウンタ列挙・ベンチマーク構成の大規模参照表)は除外。(paper / systems-architecture / hardware-architecture / memory-disaggregation / profiling)
### Host Congestion Control(Saksham Agarwal・Arvind Krishnamurthy・Rachit Agarwal、Cornell University/Google/University of Washington、ACM SIGCOMM '23)(2026-08-25 ingest-paper)
- [[@2023__SIGCOMM__Host Congestion Control]] — 高帯域アクセスリンクの普及とホスト内資源(CPU・キャッシュ・メモリ帯域)の技術トレンド停滞のギャップから顕在化する「ホスト輻輳」(NIC-CPU/メモリ間のホストネットワーク内での輻輳)を実測で特定し、対処する輻輳制御アーキテクチャhostCCを提案する論文。IIOバッファ占有量をサブマイクロ秒粒度のホスト輻輳シグナルとして導入し、サブRTT粒度のホストローカル輻輳応答とRTT粒度のネットワーク資源配分を組み合わせる。Linuxカーネルモジュール(約800LOC)としてDCTCPと無改変統合し、3倍のホスト輻輳下でパケットドロップ率を桁違いに削減しつつ目標帯域をほぼ達成、128B RPCで13µsという最小限のテールレイテンシ劣化を実証。図19点(全図ベクター描画、PyMuPDFキャプション座標クロップで全件埋め込み、除外なし)。(paper / networking / congestion-control / hardware)
### MemAxes: Visualization and Analytics for Characterizing Complex Memory Performance Behaviors(Alfredo Giménez ほか、UC Davis/Lawrence Livermore National Laboratory/Linnaeus University、IEEE TVCG Vol.24 No.7, 2018)(2026-08-25 ingest-paper)
- [[@2018__TVCG__MemAxes - Visualization and Analytics for Characterizing Complex Memory Performance Behaviors]] — HPCアプリケーションのオンノードメモリ性能を、サンプリングされたメモリアクセスデータをソースコード/データオブジェクト・ハードウェアトポロジ・全属性の並行ヒストグラムという3つの連携ビューで可視化する分析ツールMemAxesの論文。hwloc/likwidの水平icicle plotが持つ視覚的スケーラビリティの欠点を解消する放射状(sunburst型)トポロジ可視化を新規提案し、平均アクセスレイテンシ・負荷不均衡のスコアリングに基づく凝集型クラスタリングでガイド付きインタラクションを実現。LULESHの事例研究では、放射状トポロジ可視化とクラスタリングで発見したクロスソケットのデータ分割非効率を修正し、メモリアクセスサイクルを60%、総実行時間を10%削減した。図14点(本文参照のFigure 1〜13を全点、Figure 1のみベクター描画のためPyMuPDFキャプション座標クロップ、他は埋め込みラスター画像)。(paper / hpc / visualization / performance)
### Understanding and Profiling the Accelerator Chiplet Network Using PingPoint(Junyeol Ryu・Ming Liu・Matthew D. Sinclair、University of Wisconsin-Madison、ACM SIGCOMM '26)(2026-08-25 ingest-paper)
- [[@2026__SIGCOMM__Understanding and Profiling the Accelerator Chiplet Network Using PingPoint]] — チップレット型アクセラレータ内部でcompute chiplet・IO chiplet・memory moduleを接続するオンパッケージネットワーク「Accelerator Chiplet Network(ACN)」を命名し、AMD MI300X/MI350Xの実測に基づく特性評価フレームワークと、hoseモデル+ソフトウェアプロービングでACNをリンク単位に診断する軽量プロファイラPingPointを提案する論文。COM-IO・IO-IO・IO-MEMの3リンク種がそれぞれ異なる輻輳挙動を持つこと、空間分離したカーネル間でもACN経由で6倍を超える遅延干渉が生じることを実測で示した。図16点(全図ベクター描画、PyMuPDFキャプション座標クロップで全件埋め込み、除外なし)。(paper / computer-architecture / gpu / chiplet / networking)
### Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines(Stéphanie Moreaud・Brice Goglin、Inria/LaBRI/Université Bordeaux 1、PDCS 2007)(2026-08-25 ingest-paper)
- [[@2007__PDCS__Impact of NUMA Effects on High-Speed Networking with Multi-Opteron Machines]] — AMD OPTERON/HYPERTRANSPORTアーキテクチャにおけるNUMA配置が高速ネットワーク(InfiniBand・Myri-10G・Quadrics Elan4)の通信性能に与える影響をマイクロベンチマークとアプリケーションレベル測定で定量化した論文。レイテンシへの影響はHYPERTRANSPORTホップあたり約40nsと小さい一方、DMA/RDMA書き込みの帯域幅は最大40%低下し、その影響が書き込み先バッファの配置のみに依存する非対称効果であることを発見。LINUXカーネルパッチとNEWMADELEINEミドルウェアへの実装で、手動配置に匹敵する自動NUMA配置を達成した。図5点(Figure 1〜5、すべてベクター描画のためPyMuPDFキャプション座標クロップで全件埋め込み)、表2点(Table 1・2をMarkdown表に転記)。(paper / networking / numa / systems)
### Thread and Memory Placement on NUMA Systems: Asymmetry Matters(Baptiste Lepers・Vivien Quéma・Alexandra Fedorova、Simon Fraser University/Grenoble INP、USENIX ATC '15 Best Paper)(2026-08-25 ingest-paper)
- [[@2015__ATC__Thread and Memory Placement on NUMA Systems - Asymmetry Matters]] — 8ノードのAMD Bulldozer機(HyperTransport 3.0)で観測される非対称インターコネクト(リンク幅・方向性・共有関係の非対称性)が性能に及ぼす影響を定量化し、ホップ数ではなく総帯域幅を最大化するスレッド・メモリ配置アルゴリズムAsymSchedを提案する論文。スレッド配置の違いだけで性能が最大237%変動することを実測し、独自の高速メモリマイグレーションシステムコール(標準比最大34倍高速)と2段階の配置ヒューリスティックにより、静的な最良配置と同等以上の性能をランダム配置比最大218%改善しつつ達成した。図7点(Figure 1〜7、全図ベクター描画のためPyMuPDFキャプション座標クロップで全件埋め込み)、表5点(Table 1は画像埋め込み、Table 2〜5はMarkdown表に転記、全件網羅)。(paper / systems / numa / performance)
### LIKWID: A Lightweight Performance-Oriented Tool Suite for x86 Multicore Environments(Jan Treibig・Georg Hager・Gerhard Wellein、Erlangen Regional Computing Center (RRZE)/FAU Erlangen-Nürnberg、ICPPW 2010)(2026-08-25 ingest-paper)
- [[@2010__ICPPW__LIKWID : A Lightweight Performance-Oriented Tool Suite for x86 Multicore Environments]] — x86マルチコア環境向けの軽量なコマンドラインツール群LIKWIDの論文。スレッド・キャッシュトポロジ探索(likwid-topology)、スレッド-コアアフィニティ強制(likwid-pin)、性能カウンタ計測(likwid-perfCtr)、ハードウェアプリフェッチャ切替(likwid-features)の4ツールから成り、カーネルパッチ不要でPAPIより単純なインストールを実現する一方x86系Linuxに対応を限定する。OpenMP STREAM triadベンチマークでlikwid-pinによる明示的ピニングが性能分散を大幅に低減することを示し、共有キャッシュ活用型3D Jacobiステンシルでは誤ったピニングが最適化効果を反転させ性能を半減させることを実測した。図11点(Figure 1〜11全点、ラスター埋め込み画像なしのためPyMuPDFキャプション座標クロップで全件埋め込み)、表2点(Table I・IIをMarkdown表に転記)。(paper / hpc / performance)
### Evaluating Modern GPU Interconnect: PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect(Ang Li ほか、Pacific Northwest National Laboratory/Oak Ridge National Laboratory/College of William and Mary、IEEE TPDS 2020)(2026-08-25 ingest-paper)
- [[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]] — PCIe・NVLink-V1・NVLink-V2・NV-SLI・NVSwitch・GPUDirect-RDMAの6種のGPUインターコネクトを、P100-DGX-1・V100-DGX-1・DGX-2・SLIシステム・SummitDev・Summitの6プラットフォームでTartan Benchmark Suiteを用いて横断評価した論文。位置・接続性・ルーティング選択に起因する3種のNVLink NUMA効果と、PCIeチップセット設計に起因する新規NUMA効果「anti-locality」(近傍アクセスが遠隔アクセスより低性能)を実測で同定。NV-SLIとNVSwitchは全結合トポロジのためUMA。PCIe集団通信帯域はGPU数増加で低下(木構造)する一方NVLinkは増加(ハイパーキューブメッシュ)する対照的傾向、GPUDirect-RDMAの相対性能がSummitDev→Summit世代で逆転する知見、実アプリケーション13種の評価でNVLinkの通信効率向上がCPU中心master-slaveモデルの下ではアプリケーション全体性能にほとんど反映されないという知見を報告。図39点(Figure 1〜39全点、PyMuPDFキャプション座標クロップで全件埋め込み)、表3点(Table 1〜3をMarkdown表に転記)。(paper / source / gpu / networking / hpc)
### Rethinking Intra-host Congestion Control in RDMA Networks(Zirui Wan・Jiao Zhang・Yuxiang Wang・Kefei Liu・Haoyu Pan・Tao Huang、BUPT / China Mobile (Suzhou) Software Technology / Purple Mountain Laboratories、APNet 2024)(2026-08-25 ingest-paper)
- [[@2024__APNet__Rethinking Intra-host Congestion Control in RDMA Networks]] — RNIC線速(25Gbps→200Gbps)の急伸とホスト内資源(PCIe帯域63Gbps→256Gbps、メモリ帯域)の停滞のギャップから生じる「ホスト内輻輳」がRDMAネットワーク性能を損なうことを実測(3倍輻輳下でスループット62-68%低下・レイテンシ2.4-2.6倍増加)で確認し、対処するRHCC(RDMA intra-Host Congestion Control)を提案する論文。[[@2023__SIGCOMM__Host Congestion Control]](hostCC、TCP向け)のIIOバッファ占有量シグナル・Intel MBA資源配分をRDMAへ転用しつつ、RDMA受信側カーネルモジュールがデータパケットを直接改変できない制約に対しMellanoxのProgrammable Congestion Control(PCC)プローブ機構で代替する新規性を持つ。2台のDell R740サーバに実装し、PCIeスタール書き込み要求を最大97%削減、ネットワークスループット/レイテンシを最大2倍/1.4倍改善。図6点(Figure 1-6、全図ベクター描画のためPyMuPDFキャプション座標クロップで全件埋め込み、除外なし)。拡張ジャーナル版: [[@2025__TON__RHCC - Revisiting Intra-Host Congestion Control in RDMA Networks]]。(paper / networking / congestion-control / rdma / datacenter)
### RHCC: Revisiting Intra-Host Congestion Control in RDMA Networks(Zirui Wan・Jiao Zhang・Yuxiang Wang・Kefei Liu・Haoyu Pan・Yongchen Pan・Tao Huang、BUPT / Purple Mountain Laboratories、IEEE Transactions on Networking 2025)(2026-08-25 ingest-paper)
- [[@2025__TON__RHCC - Revisiting Intra-Host Congestion Control in RDMA Networks]] — [[@2024__APNet__Rethinking Intra-host Congestion Control in RDMA Networks]](APNet 2024)の拡張ジャーナル版。著者にYongchen Panが追加され、cross-NUMA実測の拡充、PIDコントローラの収束性の理論的解析(§III-C、SISO ARMAXモデル)、hostCCに対する5点の体系的優位性比較(§III-D)、Ithr・Dthrのパラメータ感度分析(§IV-C、Figure 19・20)、考察(§V: CXL・新しい資源配分ポリシー・プログラマブルなホスト内ネットワーク)が新たに追加された。中核設計・主要実験数値(3倍輻輳下でスループット62%/68%低下、レイテンシ2.4倍/2.6倍増加、PCIeスタール書き込み要求80〜97%削減、スループット/レイテンシ最大2倍/1.4倍改善)はAPNet版と一致し矛盾はない。図21点(Figure 1-21、全図ベクター描画のためPyMuPDFキャプション座標クロップで全件埋め込み、除外なし)。(paper / source / networking / congestion-control / rdma / datacenter)
### Classifying Host-Side RDMA Pingmesh Results to Efficiently Identify Transport Faults in Data Centers(Songhao Ding・Boyang Zhou・Yuhua Zheng、Zhejiang Lab/Hangzhou Institute for Advanced Study UCAS、IEEE ICPADS 2025)(2026-08-25 ingest-paper)
- [[@2025__ICPADS__Classifying Host-Side RDMA Pingmesh Results to Efficiently Identify Transport Faults in Data Centers]] — R-Pingmeshが収集するホスト側の遅延・帯域・パケットロス時系列を、事前学習+教師ありファインチューニング(SFT)の二段階LSTM分類器RTFDにかけ、まれなRDMAトランスポート障害を少数ショット・データ不均衡下で分類・局所化する手法の論文。SimAI上の3種DCNトポロジ(単一平面・デュアルToR・デュアルプレーン)で評価し、平均分類精度0.92・平均AUC0.93、6障害タイプ平均F1 0.93(まれ障害でもrecall 0.890/F1 0.882)、3トポロジ平均accuracy 0.918・AUC 0.94を報告。図5点(Figure 1〜5全点、埋め込みラスター画像で全件対応、除外なし)。(paper / networking / rdma / machine-learning)
### Revisiting RDMA Reliability for Lossy Fabrics(Wenxue Li ほか、香港科技大学/Huawei、ACM SIGCOMM '25)(2026-08-25 ingest-paper)
- [[@2025__SIGCOMM__Revisiting RDMA Reliability for Lossy Fabrics]] — PFC 非依存・パケットレベル負荷分散互換・RTO フリー・ハードウェアオフロード対応という4要件を同時に満たすスイッチ・RNIC 共設計トランスポート DCP の提案論文。制御プレーン(ヘッダ転送)のみを無損失に保ちデータプレーン(ペイロード転送)は有損失のまま許容する非対称設計により、既存の有損失 RDMA ソリューション(IRN 系 RNIC-SR)がパケットレベル負荷分散との組み合わせで発生させる大量の偽の再送を回避する。ヘッダオンリーパケットの PSN に基づく精密な再送、拡張 RDMA ヘッダによる順序非依存パケット受信、「exactly once」特性を利用したビットマップフリーなパケット追跡の3機構で、メモリオーバーヘッドとパケット処理レイテンシを両立して削減する。P4 スイッチ+FPGA のフル機能プロトタイプによる testbed 実験と NS3 大規模シミュレーションで、SOTA の無損失・有損失ソリューションに対しそれぞれ1.6倍・2.1〜72倍の性能改善を実証。図17点+表5点(Figure 1-17・Table 1-5)を全点、PyMuPDFキャプション座標クロップで埋め込み(除外なし、全図がベクター描画で埋め込みラスター画像は背景用グレー矩形のみのため利用不可)。(paper / networking / rdma / transport)
### Pond: CXL-Based Memory Pooling Systems for Cloud Platforms(Huaicheng Li ほか、Microsoft Azure/Virginia Tech/CMU 他、ASPLOS '23 Distinguished Paper Award)(2026-08-25 ingest-paper)
- [[@2023__ASPLOS__Pond - CXL-Based Memory Pooling Systems for Cloud Platforms]] — Azure本番100クラスタ・75日分のトレース解析でメモリストランディング(最大25〜30%)を初めて公開特性化し、CXLベースのメモリプーリングシステムPondを提案する論文。8〜16ソケットの小規模プールで大規模プールの効果の大半を達成できるという知見と、RandomForestによるレイテンシ非感受性予測・LightGBMによる未タッチメモリ予測の2つのMLモデルを組み合わせ、ハイパーバイザのzNUMA(zero-core virtual NUMAノード)機構で選択的にプールメモリを利用させる。158ワークロード・3500超の実験で、16ソケットプール・CXLレイテンシ222%増加の条件下でDRAM需要を7%(サーバコスト3.5%相当)削減することを実証。図21点(Figure 1〜21全点。埋め込みラスター画像2点はそのまま採用、残り19点はベクター描画のためPyMuPDFキャプション座標クロップで全件埋め込み、除外なし)。(paper / systems / hardware-architecture / datacenter / cxl)
### UCCL-Tran: An Extensible Software Transport Layer for GPU Networking(Yang Zhou ほか、UC Berkeley/UC Davis/Tsinghua University/Harvard University/IBM Research/AWS/Broadcom/UPB、USENIX OSDI '26)(2026-08-25 ingest-paper)
- [[@2026__OSDI__UCCL-Tran - An Extensible Software Transport Layer for GPU Networking]] — 既存 RDMA NIC のコントロールパス(輻輳制御・パケット信頼性・マルチパス負荷分散)とデータパスを分離し、コントロールパスをホスト CPU 上のソフトウェアとして実行する拡張可能トランスポート層 UCCL-Tran の提案論文。RDMA UC の `write_with_immediate` でコントロールヘッダとデータペイロードを CPU/GPU へ分離し、NVIDIA ConnectX-7・Broadcom Thor-2・AWS EFA という異種 NIC を単一のソフトウェアレイヤーで統一的にサポートする。パケットスプレー型マルチパス・受信側主導 CC(EQDS)・選択的再送の3ケーススタディを実装し、既存 RDMA ハードウェアトランスポート比 ML collective で最大4.5倍、DeepSeek-V2-Lite訓練で最大7.5%、DeepSeek-V3サービングでレイテンシ最大1.42倍の改善を実測。1 CPU コアで400Gbps単方向トラフィックを処理できる。図15点(本文参照 Figure 1-15 全点、PyMuPDFキャプション座標クロップで埋め込み)、表4点(Table 1-4を Markdown表に転記)。Appendix 図表(Figure 16-26・Table 5)は付録限定参照のため除外。(paper / source / rdma / gpu-networking / congestion-control / collective-communication)
### Computer Architecture: A Quantitative Approach, 6th Edition(John L. Hennessy・David A. Patterson、Morgan Kaufmann、2019)(2026-08-25 ingest-book)
- 書籍ハブ: [[Computer Architecture - A Quantitative Approach]] — 本編 7 章 + 付録 A・B・C・D・F の計 12 枚。原本 `.raw/books/computer-architecture-quantitative-approach-6e/`。
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 1 Fundamentals of Quantitative Design and Analysis]] — 実行時間のみが信頼できる性能指標であるという定量的設計のテーゼを軸に、費用・電力・性能・ディペンダビリティの定量指標とアムダールの法則・CPU 性能方程式を導入し、ムーアの法則とデナードスケーリングの終焉を領域特化への移行の根拠として位置づける、本書全体の土台となる章。図7点。(computer-architecture / performance / benchmarking)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 2 Memory Hierarchy Design]] — キャッシュの基礎を付録 B に委ね、10 の高度なキャッシュ最適化技法をハードウェア複雑度・消費電力・ミスペナルティの軸で分類し、HBM/PCM などのメモリ技術、仮想マシンによる保護層、ARM Cortex-A53 と Intel Core i7 6700 の実測比較を扱う発展編。図6点。(computer-architecture / memory-hierarchy / virtualization)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 3 Instruction-Level Parallelism and Its Exploitation]] — 動的スケジューリング(Tomasulo のアルゴリズム)とハードウェア投機によって命令レベル並列性をどこまで引き出せるかを検証し、Wall(1993)と IBM Power・Intel Core i7 系列の実測から、ハードウェアによる ILP 拡張の限界と 2005 年前後のマルチコアへの設計転換を実証的に描く。図7点。(computer-architecture / ilp / speculation)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 4 Data-Level Parallelism in Vector, SIMD, and GPU Architectures]] — ベクトルアーキテクチャ・マルチメディア SIMD 命令拡張・GPU という 3 つのデータレベル並列性の実装形態を同一の枠組みで比較し、ルーフラインモデルと GPU 用語・ベクトル用語の対応表を軸に、GPU を「多数レーンを持つ浅くマルチスレッド化されたベクトルプロセッサ」として解説する。図7点。(computer-architecture / gpu / simd / roofline)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 5 Thread-Level Parallelism]] — 共有メモリマルチプロセッサの一貫性・整合性・同期を、集中共有メモリと分散共有メモリの構成、スヌーピング方式とディレクトリ方式、逐次一貫性から緩和一貫性モデルへの設計スペクトラム、実機 3 系統の実測スケーリングという軸で扱う。図7点。(computer-architecture / multiprocessor / cache-coherence)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 6 Warehouse-Scale Computers to Exploit Request-Level and Data-Level Parallelism]] — ウェアハウススケールコンピュータを、費用・電力・障害率の定量モデルに基づいて一台のコンピュータとして設計する対象として論じる。障害前提のソフトウェア冗長性、PUE の推移、TCO、ネットワーク階層とオーバーサブスクリプション、レイテンシのテールを扱う。図7点。(computer-architecture / datacenter / wsc / reliability)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 7 Domain-Specific Architectures]] — 第 6 版で新設された結論の章。ムーアの法則とデナードスケーリングの終焉後、性能とエネルギー効率を桁違いに伸ばす唯一の道が領域特化であるとし、Google TPU・Microsoft Catapult・Intel Crest・Google Pixel Visual Core の 4 実例を DSA 設計 5 指針に照らして比較する。図7点。(computer-architecture / dsa / ai-accelerator)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix A Instruction Set Principles]] — 命令セットアーキテクチャの分類軸(オペランド格納方式・アドレッシング・符号化・コンパイラからの要求)を実測データに基づいて論じ、その推奨を RISC-V がどう体現しているかを示す。図6点。(computer-architecture / isa / risc-v)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix B Review of Memory Hierarchy]] — メモリ階層の基礎編。キャッシュ設計の 4 つの問い、平均メモリアクセス時間の定式化、3C モデル、6 つの基本最適化、仮想メモリとページ保護を扱う。第 2 章の前提。図7点。(computer-architecture / memory-hierarchy / cache)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix C Pipelining - Basic and Intermediate Concepts]] — パイプラインの基礎編。5 段 RISC-V パイプラインを題材に、構造・データ・制御の 3 ハザードとフォワーディング/ストール、CPI の定量モデル、精密例外、MIPS R4000 のケーススタディを扱う。第 3 章の前提。図7点。(computer-architecture / pipelining / hazards)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix D Storage Systems]] — ストレージを I/O 性能(待ち行列理論)とディペンダビリティの両面から定量評価する。RAID、Tertiary Disk・Tandem の実障害データ、リトルの法則と M/M/1、Internet Archive のケーススタディ、「five nines」への実測データによる反証を扱う。図7点。(computer-architecture / storage / raid / dependability / queueing)
- [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Appendix F Interconnection Networks]] — Timothy M. Pinkston と José Duato による改訂。相互接続網を OCN/SAN/LAN/WAN の 4 領域に分類し、トポロジ・ルーティング・アービトレーション・スイッチングという共通の設計軸、仮想チャネルによるデッドロック回避、Clos 網と fat tree、スイッチマイクロアーキテクチャを統一的に扱う。図8点。(computer-architecture / interconnect / topology / routing)
### On the General Theory of Control Systems(R. E. Kalman、Proc. First IFAC Congress, Moscow 1960)(2026-08-26 ingest-paper)
- [[@1960__IFAC1960__On the General Theory of Control Systems]] — 可制御性(controllability)・可観測性(observability)を定義し、両者を結ぶ双対性原理(Principle of Duality)を提示することで、最適レギュレータ問題とウィーナー・コルモゴロフのフィルタリング問題が数学的に同一構造であることを示す、現代制御理論の基礎文献。テキスト層のないスキャンPDF(JBIG2)のため12ページ全ページを視覚的に通読して作成。図4点(Figure 1-4全点、PyMuPDFキャプション座標クロップで埋め込み、除外なし)。(paper / control-theory)
### StriaTrace: Efficient Tracing and Diagnosis for Online LLM Inference(Haonan Wu ほか、Shanghai Jiao Tong University/Alibaba Group、USENIX OSDI '26)(2026-08-29 ingest-paper)
- [[@2026__OSDI__StriaTrace - Efficient Tracing and Diagnosis for Online LLM Inference]] — オンライン LLM 推論向けの低オーバーヘッドな継続トレーシング・診断システム。同期点・クリティカルパス・異常時の高忠実度保存を組み合わせ、動的回帰型ルーフラインで推論ステップのテイル異常を検知する。評価では既存手法比 97.8% のオーバーヘッド削減、注入異常 recall 100%、本番 1,700 超インスタンス・日量 1.8億超リクエスト・19 種類の根本原因を報告。本文参照 Figure 1–11 を全件クロップして埋め込み、Table 1–4 を Markdown 表に転記。(paper / llm / inference / observability / tracing)
## 現行ソースカタログ
- [[@1990__LISA__Using expect to Automate System Administration Tasks]]
- [[@1991__LISA__Modules - Providing a Flexible User Environment]]
- [[@1993__LISA__Automated System Monitoring and Notification With Swatch]]
- [[@1994__LISA__Towards a High-Level Machine Configuration System]]
- [[@1995__IM__A Coding Approach to Event Correlation]]
- [[@1995__INFOCOM__Automatic Alarm Correlation for Fault Identification]]
- [[@1995__SOSP__U-Net- A User-Level Network Interface for Parallel and Distributed Computing]]
- [[@1996__Acta Informatica__The Log-Structured Merge-Tree (LSM-Tree)]]
- [[@1997__IM__Automated Proactive Anomaly Detection]]
- [[@1997__LISA__An Analysis of UNIX System Configuration]]
- [[@1998__LISA__Bootstrapping an Infrastructure]]
- [[@1998__LISA__MRTG - The Multi Router Traffic Grapher]]
- [[@1998__PER__Internet Service Performance Failure Detection]]
- [[@1998__TechReport__The PageRank Citation Ranking - Bringing Order to the Web]]
- [[@1999__JNSM__Rule Discovery in Telecommunication Alarm Data]]
- [[@1999__LISA__A Retrospective on Twelve Years of LISA Proceedings]]
- [[@2000__LISA__Aberrant Behavior Detection in Time Series for Network Service Monitoring]]
- [[@2000__LISA__Use of Cfengine for Automated, Multi-Platform Software and Patch Distribution]]
- [[@2002__LISA__Why Order Matters - Turing Equivalence in Automated Systems Administration]]
- [[@2003__CFS__Lustre building a cluster file system for 1,000 node clusters]]
- [[@2003__JSSPP__SLURM - Simple Linux Utility for Resource Management]]
- [[@2003__LISA__ISconf - Theory, Practice, and Beyond]]
- [[@2003__LISA__Seeking Closure in an Open World - A Behavioral Agent Approach to Configuration Management]]
- [[@2004__LISA__Nix - A Safe and Policy-Free System for Software Deployment]]
- [[@2005__Intel Technology Journal__High-Performance Graphics and TV Output Comes to the Second-Generation Intel Centrino Mobile Technology Platform]]
- [[@2005__Intel Technology Journal__Intel 915GMS Chipset - In Mobile Platforms, Smaller is Better]]
- [[@2005__Intel Technology Journal__Interface Material Selection and a Thermal Management Technique in Second-Generation Platforms Built on Intel Centrino Mobile Technology]]
- [[@2005__Intel Technology Journal__Low-Power Audio and Storage Input Output Technologies for the Second-Generation Intel Centrino Mobile Technology Platform]]
- [[@2005__Intel Technology Journal__Next-Generation PC Platform Built on Intel Centrino Mobile Technology New Usage Models]]
- [[@2005__Intel Technology Journal__Performance and Power Consumption for Mobile Platform Components Under Common Usage Models]]
- [[@2005__Intel Technology Journal__Second-Generation Intel Centrino Mobile Technology Platform]]
- [[@2005__Intel Technology Journal__The Emergence of PCI Express in the Next Generation of Mobile Platforms]]
- [[@2005__LISA__Toward a Cost Model for System Administration]]
- [[@2006__LISA__LiveOps - Systems Management as a Service]] — LISA'06。永続状態(PS)相互作用の非参加型監査によるMSN本番構成管理サービス
- [[@2008__JSTAT__Fast unfolding of communities in large networks]]
- [[@2009__LISA__Two-Person Control Administration - Preventing Administration Faults through Duplication]]
- [[@2010__LISA__Chukwa - A System for Reliable Large-Scale Log Collection]]
- [[@2010__LISA__Log Analysis and Event Correlation Using Variable Temporal Event Correlator (VTEC)]]
- [[@2010__PhysRep__Community detection in graphs - Appendix A Elements of Graph Theory]]
- [[@2010__PhysRep__Community detection in graphs - Chapter I Introduction]]
- [[@2010__PhysRep__Community detection in graphs - Chapter II Communities in real-world networks]]
- [[@2010__PhysRep__Community detection in graphs - Chapter III Elements of Community Detection]]
- [[@2010__PhysRep__Community detection in graphs - Chapter IV Traditional methods]]
- [[@2010__PhysRep__Community detection in graphs - Chapter IX Methods based on statistical inference]]
- [[@2010__PhysRep__Community detection in graphs - Chapter V Divisive algorithms]]
- [[@2010__PhysRep__Community detection in graphs - Chapter VI Modularity-based methods]]
- [[@2010__PhysRep__Community detection in graphs - Chapter VII Spectral Algorithms]]
- [[@2010__PhysRep__Community detection in graphs - Chapter VIII Dynamic Algorithms]]
- [[@2010__PhysRep__Community detection in graphs - Chapter X Alternative methods]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XI Methods to find overlapping communities]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XII Multiresolution methods and cluster hierarchy]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XIII Detection of dynamic communities]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XIV Significance of clustering]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XV Testing Algorithms]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XVI General properties of real clusters]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XVII Applications on real-world networks]]
- [[@2010__PhysRep__Community detection in graphs - Chapter XVIII Outlook]]
- [[@2011__LISA__Automated Planning for Configuration Changes]]
- [[@2012__LISA__On the Accurate Identification of Network Service Dependencies in Distributed Systems]]
- [[@2013__ICPP__Efficient Inter-node MPI Communication using GPUDirect RDMA for InfiniBand Clusters with NVIDIA GPUs]]
- [[@2013__KDD__An Integrated Framework for Optimizing Automatic Monitoring Systems in Large IT Infrastructures]]
- [[@2014__HUST__Comprehensive Resource Use Monitoring for HPC Systems with TACC Stats]]
- [[@2014__KDD__Towards Scalable Critical Alert Mining]]
- [[@2014__LISA__Analyzing Log Analysis - An Empirical Study of User Log Mining]]
- [[@2014__LISA__Realtime High-Speed Network Traffic Monitoring Using ntopng]]
- [[@2014__NSDI__FaRM- Fast Remote Memory]]
- [[@2014__NVIDIA Developer Blog__Benchmarking GPUDirect RDMA on Modern Server Platforms]]
- [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]]
- [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]]
- [[@2014__TPDS__GPU-Aware MPI on RDMA-Enabled Clusters - Design, Implementation and Evaluation]]
- [[@2015__CiSE__Open XDMoD - A Tool for the Comprehensive Management of High-Performance Computing Resources]]
- [[@2015__WWW__LINE - Large-scale Information Network Embedding]]
- [[@2016__ATC__Design Guidelines for High Performance RDMA Systems]]
- [[@2016__OSDI__FaSST- Fast, Scalable and Simple Distributed Transactions with Two-Sided (RDMA) Datagram RPCs]]
- [[@2016__OSDI__TensorFlow - A System for Large-Scale Machine Learning]]
- [[@2017__IEEE BigData__I O Load Balancing for Big Data HPC Applications]]
- [[@2017__IEEE__Efficient Processing of Deep Neural Networks]]
- [[@2017__ISCA__In-Datacenter Performance Analysis of a Tensor Processing Unit]]
- [[@2017__SC__A Configurable Rule based Classful Token Bucket Filter Network Request Scheduler for the Lustre File System]]
- [[@2018__CHI__Making Core Memory - Design Inquiry into Gendered Legacies of Engineering and Craftwork]]
- [[@2018__NeurIPS__Mesh-TensorFlow - Deep Learning for Supercomputers]]
- [[@2019__CLUSTER__ClusterCockpit - A web application for job-specific performance monitoring]]
- [[@2020__CLUSTER__PIKA - Center-Wide and Job-Aware Cluster Monitoring]]
- [[@2020__TOS__Characterizing Output Bottlenecks of a Production Supercomputer Analysis and Implications]]
- [[@2021__ATC__Fighting the Fog of War - Automated Incident Detection for Cloud Systems]]
- [[@2021__FAST__CheckFreq - Frequent Fine-Grained DNN Checkpointing]]
- [[@2021__ORNL__Understanding Lustre Internals - Chapter 1 Lustre Architecture]]
- [[@2021__ORNL__Understanding Lustre Internals - Chapter 2 TESTS]]
- [[@2021__ORNL__Understanding Lustre Internals - Chapter 3 UTILS]]
- [[@2021__ORNL__Understanding Lustre Internals - Chapter 4 MGC]]
- [[@2021__ORNL__Understanding Lustre Internals - Chapter 5 OBDCLASS]]
- [[@2021__ORNL__Understanding Lustre Internals - Chapter 6 LIBCFS]]
- [[@2021__ORNL__Understanding Lustre Internals - Chapter 7 File Identifiers, FID Location Database, and Object Index]]
- [[@2022__MLSys__Pathways - Asynchronous Distributed Dataflow for ML]]
- [[@2022__OSDI__Alpa - Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning]]
- [[@2022__SIGCOMM__Jupiter Evolving - Transforming Google's Datacenter Network via Optical Circuit Switches and Software-Defined Networking]]
- [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]
- [[@2023__NSDI__SRNIC - A Scalable Architecture for RDMA NICs]]
- [[@2023__NSDI__TACCL - Guiding Collective Algorithm Synthesis using Communication Sketches]]
- [[@2023__NSDI__TopoOpt - Co-optimizing Network Topology and Parallelization Strategy for Distributed Training Jobs]]
- [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]]
- [[@2023__SIGCOMM__Network Load Balancing with In-network Reordering Support for RDMA]]
- [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]]
- [[@2023__arXiv__Pushing the Limits of Pre-training for Time Series Forecasting in the CloudOps Domain]]
- [[@2024__ISCA__Splitwise - Efficient Generative LLM Inference Using Phase Splitting]]
- [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]
- [[@2024__OJCS__Large Pretrained Foundation Model for Key Performance Indicator Multivariate Time Series Anomaly Detection]]
- [[@2024__OSDI__μSlope - High Compression and Fast Search on Semi-Structured Logs]]
- [[@2025__COLM__Training Large Language Models to Reason in a Continuous Latent Space]]
- [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]
- [[@2025__JMLR__Scaling Data-Constrained Language Models]]
- [[@2025__NSDI__Mitigating Scalability Walls of RDMA-based Container Networks]]
- [[@2025__NSDI__White-Boxing RDMA with Packet-Granular Software Control]]
- [[@2025__SIGCOMM__Alibaba Stellar - A New Generation RDMA Network for Cloud AI]]
- [[@2025__TOS__Lustre Unveiled - Appendix A The Complete History of Lustre]]
- [[@2025__TOS__Lustre Unveiled - Chapter 1 Introduction]]
- [[@2025__TOS__Lustre Unveiled - Chapter 2 The Lustre Filesystem]]
- [[@2025__TOS__Lustre Unveiled - Chapter 3 Architectural Details of Lustre]]
- [[@2025__TOS__Lustre Unveiled - Chapter 4 A Comparative Study of Lustre versus Related Storage Technologies]]
- [[@2025__TOS__Lustre Unveiled - Chapter 5 Lustre Design Evolution]]
- [[@2025__TOS__Lustre Unveiled - Chapter 6 Lustre in Practice - Frontier's Orion]]
- [[@2025__TOS__Lustre Unveiled - Chapter 7 Future Directions and Open Challenges in Lustre]]
- [[@2025__TOS__Lustre Unveiled - Chapter 8 Concluding Thoughts]]
- [[@2025__arXiv__Performance of Zero-Shot Time Series Foundation Models on Cloud Data]]
- [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]
- [[@2025__arXiv__Scaling up Test-Time Compute with Latent Reasoning - A Recurrent Depth Approach]] — 深さ方向に再帰するコアブロックで潜在推論を行う再帰深度アーキテクチャ(Huginn-0125, arXiv:2502.05171)
- [[@2026__ACCESS__Convergence of HPC and Cloud Storage Systems for Deep Learning Workflows An Evaluation of LustreFS and S3-Compatible Object Storage]]
- [[@2026__ASE__Log-Insight - Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis]]: 大規模マイクロサービスにおけるニューロシンボリックログ分析・根本原因分析システム (ASE 2026)
- [[@2026__DarioAmodei__We Must Pace the Frontier]]
- [[@2026__ESWA__Federated Transfer Learning for Anomaly Detection in HPC Systems]]
- [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]
- [[@2026__GTC__Orchestrate Next-Generation AI Workloads With Open-Source Slurm]]
- [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]]
- [[@2026__ICPE__Benchmarking Change Detection Exactness and Overhead of Instrumentation and Sampling]]
- [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]]
- [[@2026__ISC__Understanding Large-Scale HPC System Behavior Through Cluster-Based Visual Analytics]]
- [[@2026__ISSRE__CoLMAD : Cost-Efficient LLM-Assisted Time Series Anomaly Detection for Industrial Monitoring]]
- [[@2026__ISSRE__From Noisy Telemetry to Actionable Warnings - GPU Failure Prediction in Industrial Clusters]]
- [[@2026__ISSRE__KnowLution - A Multi-Agent Framework for Execution-Oriented Autonomous Operations in Production Supercomputers]]
- [[@2026__PEARC__Getting the Most Out of Your GPUs]]
- [[@2026__POMACS__Minos - Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters]]
- [[@2026__SCAHPCAsiaWS__Leveraging NVML GPM for NVIDIA GPU Monitoring]]
- [[@2026__SIGCOMM__CubeTrace Microscopic Network Tracing for Heterogeneous Cloud Gateways]]
- [[@2026__SIGCOMM__Networked Agent Memory and Causality Representation - Experiences towards Interpretable Cloud-Scale Root-Causing]] — XiHe: マルチエージェント RCA の Networked Agent Memory + Networked Causality Representation による解釈可能性向上
- [[@2026__SIGCOMM__Pegasus - A Data Center Network for Bare-Metal AI Cloud]]
- [[@2026__TACO__BridgedRing - A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 1 Introduction]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 2 Methodology]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 3 Preliminary]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 4 Taxonomy]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 5 Transformers in AIOps Domain]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 6 Evaluation and Benchmark for Transformers in AIOps Domain]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 7 Related Work]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 8 Open Challenges and Future Directions]]
- [[@2026__TOSEM__Why Transformers - A Comprehensive Overview of Transformers in Artificial Intelligence for IT Operations - Chapter 9 Conclusion]]
- [[@2026__TechReport__DeepSeek-V4.1-Flash - Pushing the Limits of KV Cache Compression]]
- [[@2026__WWW2026__ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 1 Understanding Lustre Architecture]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 10 Configuring a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 11 Configuring Failover in a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 12 Monitoring a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 13 Lustre Operations]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 14 Lustre Maintenance]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 15 Managing Lustre Networking (LNet)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 16 LNet Software Multi-Rail]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 17 Upgrading a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 18 Backing Up and Restoring a File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 19 Managing File Layout (Striping) and Free Space]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 2 Understanding Lustre Networking (LNet)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 20 Data on MDT (DoM)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 21 Lazy Size on MDT (LSoM)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 22 File Level Redundancy (FLR)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 23 Managing the File System and I O]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 24 Lustre File System Failover and Multiple-Mount Protection]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 25 Configuring and Managing Quotas]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 26 Hierarchical Storage Management (HSM)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 27 Persistent Client Cache (PCC)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 28 Mapping UIDs and GIDs with Nodemap]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 29 Configuring Shared-Secret Key (SSK) Security]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 3 Understanding Failover in a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 30 Managing Security in a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 31 Lustre ZFS Snapshots]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 32 Testing Lustre Network Performance (LNet Self-Test)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 33 Benchmarking Lustre File System Performance (Lustre I O Kit)]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 34 Tuning a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 35 Lustre File System Troubleshooting]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 36 Troubleshooting Recovery]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 37 Debugging a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 38 Lustre File System Recovery]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 4 Installation Overview]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 5 Determining Hardware Configuration Requirements and Formatting Options]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 6 Configuring Storage on a Lustre File System]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 7 Setting Up Network Interface Bonding]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 8 Installing the Lustre Software]]
- [[@2026__Whamcloud__Lustre Operations Manual - Chapter 9 Configuring Lustre Networking (LNet)]]
- [[@2026__arXiv__A Benchmark for Language Models in Real-World System Building]]
- [[@2026__arXiv__A Scalable Pattern Mining Workflow for Interpretable Machine Log Analysis in High-Performance Computing Environments]]
- [[@2026__arXiv__APEX - A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations]]
- [[@2026__arXiv__Balancing Workload Performance and Slurm Stress - Four Nextflow Deployment Strategies]]
- [[@2026__arXiv__Beyond Fault Localization - A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis]]
- [[@2026__arXiv__Causal Analysis for Time Series Foundation Models]]
- [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]]
- [[@2026__arXiv__Evaluating Forecasting Techniques for Hardware Errors on a Large-scale HPC System]]
- [[@2026__arXiv__NCCLbpf - Verified, Composable Policy Execution for GPU Collective Communication]]
- [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]
- [[@2026__arXiv__PRISM Evaluating POSIX Storage Systems for AI Research Workflows]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 1 Introduction]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 10 Conclusion]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 2 Background]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 3 Taxonomy of TSFMs Post-Training Methods]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 4 Parameter Adaptation Methods]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 5 Context Augmentation Methods]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 6 Model Composition Methods]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 7 Output Processing and Uncertainty Control Methods]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 8 Compression and Specialization Methods]]
- [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 9 Future Directions]]
- [[@2026__HOTI__Scaling Inference Prefill with High-Radix Photonic Interconnects]]
- [[@2026__arXiv__State of AI - 100 Trillion LLM Interactions with OpenRouter]]
- [[@2026__arXiv__The DMA Streaming Framework - Kernel-Level Buffer Orchestration for High-Performance AI Data Paths]]
- [[@2026__arXiv__The Multipath Reliable Connection (MRC) Transport]]
- [[@2026__arXiv__When GPUs Fail Quietly - Observability-Aware Early Warning Beyond Numeric Telemetry]]
- [[@2027__FAST__Labeling the Invisible - A Scalable Framework for Labeling Fail-Slow Failures in Cloud Storage Systems]]
- [[@2026__nkcs.iops.ai__THXInLog - Robust Semantic-Temporal Framework for Log Anomaly Detection in Production Supercomputers]]
- 書籍『アルゴリズムイントロダクション 第3版 総合版』章 source 39 枚 → ハブ [[アルゴリズムイントロダクション 第3版]]
- 書籍『ソフトウェアアーキテクチャの基礎』章 source 25 枚 → ハブ [[ソフトウェアアーキテクチャの基礎]]