# マイクロサービスベンチマーク
## 定義
マイクロサービスアーキテクチャを採用した複数のサービスから構成される実装と、その実装に対する負荷・テスト・障害シナリオの組をパッケージ化し、後続研究が同一条件で比較可能にする評価資産。**実装(benchmark system)** と **データセット(benchmark dataset)** の 2 形態がある。前者は [[DeathStarBench]]・[[Train-Ticket]]・[[eShopOnContainers]]・[[Sock Shop]]・[[Online-Boutique]] のように deploy 可能な microservices system 一式、後者は trace・metric・log を fault-injected/clean ペアで提供する **TrainTicketTrace** や **LO2-microservice-data** のような事前収集データ。(Source: [[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]] / [[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]] / [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]])
## 横断的知見
- **規模差で評価の質が変わる**: 既存の単層 cloud benchmark([[Cloudsuite]]・[[TailBench]]・µSuite)は 1-3 層に限定され、cascading QoS 違反や network 輻輳のような **at-scale 効果** を捕捉できない([[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]])。一方 10 services 規模の Sock Shop・Online-Boutique では本番の依存ウェブを模擬できず、Train-Ticket(42-50 services)が microservice RCA の de facto baseline になりつつある(Source: [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]] と [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]] の Train-Ticket 重視は一貫)。
- **Train-Ticket が複数論文の中央ベンチマーク**: 本 vault が ingest した 4 本の microservice benchmark 論文のうち、3 本([[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]] / [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] / [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]])が Train-Ticket を中心に置き、残る 1 本(DeathStarBench)が比較対象として競合する。これは microservice テスト・dataset・fault localization の各研究で **Train-Ticket が共通基盤化** したことを示す。
- **fault injection と benchmark の分離が顕在**: 古典的 benchmark(DeathStarBench)は性能特性の測定が主目的で fault injection は含まない。一方 microservice の SRE/AIOps 評価では fault が必須のため、後続研究([[AIOpsLab]]・[[SREGym]]・[[MicroRemed]]・[[RCAEval]]・TrainTicketTrace)が DeathStarBench・Train-Ticket に **fault layer を追加** する形で発展した。**TrainTicketTrace は fault layer を dataset として固定化**(Source: [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]])することで、deployment コストなしに評価可能にした点で進展。
- **EvoMaster + OpenTelemetry が現代的な標準セット**: 自前 distributed tracing([[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]] の Thrift timing interface)→ Selenium + Gatling([[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]])→ [[EvoMaster]] + [[OpenTelemetry]] + [[Jaeger]] + [[Prometheus]]([[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]])と、観測スタックが標準化された。
- **OSS-MS dataset と benchmark system は補完関係**: [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] は 378 件の **生の OSS-MS** を整理し、benchmark system 選定の母集団を可視化した。例えば Train-Ticket は 42 microservices で全 OSS-MS の Top 3 以内に位置し、taskcluster(50 services)・dojot/docker-compose(36)など Train-Ticket より大きい OSS-MS も存在することが分かる(Source: [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] Appendix Table 1)。Benchmark 選定の議論を「sample 数の主張」から「dataset 内位置の主張」に格上げできる。
- **fault が自動検出されないことが共通の壁**: [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]] は EvoMaster の生成 test がいずれの seeded fault も検知できなかったと報告。Smith+ の Selenium テストも同様に fault 検出ではなく functional regression のみが目的。すなわち **「テスト一式 ≠ fault detection ベンチマーク」**。前者は coverage を、後者は trace/metric/log での anomaly localization を測る。両者は別問題で、benchmark の設計目的を明示することが評価妥当性を左右する(Source: [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]] Section V.C)。
- **マイクロサービスベンチマークの第4の用途: LLM トレース分析の instruction-tuning データ生成基盤**: 本ページがこれまで扱ってきた Train-Ticket・Online-Boutique の用途は fault localization・RCA・remediation ベンチマーク(MicroRemed・RCAEval 等)に集中していたが、[[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]](WWW 2026)は Train-Ticket(47サービス・90インスタンス)から収集した 13,279 トレースを、LLM の instruction&response ペア生成基盤(TraceBench、38タスク・30,400組)として利用した。これは「ベンチマークシステムが生成するトレースを、下流の異常検知・RCA アルゴリズムの入力にする」という従来の用途に加え、「トレース自体を LLM ファインチューニングの教師データにする」という新しい利用目的を追加する。Online-Boutique は TraceLLM の**未見 Web アプリケーションへの汎化性評価**(TraceBench-OB)に使われ、単一ベンチマークシステムで学習した LLM が別のベンチマークシステムに汎化するかを測る「クロスシステム転移」の評価軸としても機能した。(Source: [[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]])
- **サービス数を固定して「メトリクス粒度」だけをスケールさせる第 3 の評価軸が MetricSifter の empirical study で確立している**: 本ページがこれまで整理してきた規模軸は「サービス数」(Sock Shop 7〜Train-Ticket 41〜50 超の OSS-MS)に集中していたが、[[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]](博士論文第 5 章、MetricSifter の完全版)は、同一のベンチマークシステム(Sock Shop・Train Ticket)からサービス数を変えずに、収集するメトリクス種別だけを 3 段階(-small: 手動選定の標準 Pod のみ、-medium: 全 Pod 共通の標準メトリクス、-large: ミドルウェア固有メトリクスを追加)にスケールした 6 データセットを構築した(Tab. 5.5)。結果、Train Ticket は最小構成(TT-small: 平均 383 メトリクス)から最大構成(TT-large: 平均 9,458 メトリクス)まで同一サービス数のまま 1 桁以上メトリクス数が変わり、障害箇所特定の top-5 recall と実行時間の双方に大きな差を生んだ(§5.6.3, §5.7.2)。これは「サービス数を増やす」(本ページの既存知見)と「メトリクス粒度を増やす」(本知見)が独立な難易度パラメータであり、Fault Localization/RCA ベンチマークの難易度を語るには両軸を区別する必要があることを示す。(Source: [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]] Tab. 5.5, §5.6.1)
- **本ページが整理してきた「ベンチマークシステム(deploy 可能な実装)対 ベンチマークデータセット(事前収集データ)」の2形態に対し、マイクロサービス障害診断サーベイは第3の出自として「本番環境由来/専用シミュレーションプラットフォーム由来のマルチモーダル障害データセット」を挙げる**: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] §6.1 が整理する AIOps Challenge データセット群(清華大学が大規模無線サービスプロバイダ・商業銀行・EC システムの本番環境から収集)や GAIA(Cloud Wisdom の MicroSS マイクロサービスシミュレーションシステムが出所)は、本ページが挙げる Train-Ticket・Sock Shop・DeathStarBench のような deploy 可能なベンチマークシステム上で収集されたものではない。すなわち同じ「マイクロサービス障害データセット」でも、(1) 本ページの Train-Ticket 由来データセット(研究者がベンチマークシステムに自ら障害注入して収集)と、(2) AIOps Challenge・GAIA のような産業界提供データセット(既存の本番/専用シミュレーション環境から収集済みのものを配布)という、収集主体・再現可能性の異なる2系統が並立する。後者はベンチマークシステムそのものが非公開のため、研究者は同じ環境で追加実験を行えない制約を持つ。(Source: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] §6.1)
- **公開ツールキットの不足という別の再現性問題を、本ページの「fault injection と benchmark の分離」という既存知見に付け加える**: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] §6.1 は、公開ツールキットを伴う障害診断研究がこれまで全体の 21.43% にとどまっていたと報告する。本ページの既存知見は「fault injection layer の有無」(TrainTicketTrace 等が DeathStarBench・Train-Ticket に fault layer を追加)を benchmark 発展の軸としてきたが、同章はこれとは別に「手法自体のツールキット公開率」という再現性の軸を追加する。ベンチマークシステム・データセットが公開されていても、それを用いた手法の実装(ツールキット)が非公開であれば、後続研究による同一条件での比較・再現は依然として妨げられる。(Source: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] §6.1)
- **2本のサーベイが独立にTrain-Ticket優位とAIOps Challenge/GAIAの産業界出自を確認し、かつ互いに補完しあうテストベッド一覧を持つ**: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]](2012〜2025年117件対象)のTable 8は、本ページが既に指摘してきたTrain-Ticket優位を**利用比率31%(22テストベッド中最多、次点Sock Shop 22%)という定量値で裏付ける**。同時に、[[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]]が「産業界提供データセットの代表」として挙げたAIOps Challenge・GAIAを、本サーベイのTable 9も独立に「最多被引用データセット(AIOps Challenge 2020/2021、9件)」「2023年発表の最新データセット(GAIA - Generic AIOps Atlas)」として挙げており、2つのサーベイが同一の産業界出自データセットに独立到達したことを示す。一方でTable 8の22テストベッドのうち、本ページが従来扱ってきた5系(DeathStarBench・Train-Ticket・eShopOnContainers・Sock Shop・Online-Boutique)以外(BookInfo・TPC-W・ACME Air・Hipster-shop・OpenStack・Grid5000・Stan's Robot Shop・Alibaba EagleEye・IBM Bluemix等17系)は本ページ・[[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]]のいずれにも未出のロングテールであり、本ページのentity化範囲(節を割いて論じられる代表システムのみ)は117件規模の実際の利用分布のごく一部しか捉えていない。(Source: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]], [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] §6.1)
- **Sock Shopのdeprecated化という、既存entityページ(Sock Shop)にも波及する新情報**: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]] は、利用比率で2位(22%)のSock Shopが「肯定的な評価と科学コミュニティでの広範な利用にもかかわらず、著者らにより最近deprecatedと明記された」と報告する。本ページが挙げる5系benchmark systemのうち初めて「保守終了」が明示された事例であり、Sock ShopのforkであるHipster-shop(利用比率6%)への移行が実際に進んでいるかは本サーベイの範囲では確認できない。(Source: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]])
## 未解決の問い
- **メトリクス粒度軸(-small/-medium/-large のようなミドルウェア固有メトリクスの段階的追加)とサービス数軸(Sock Shop〜Train-Ticket〜50超 OSS-MS)は、fault localization/RCA ベンチマークの難易度にどちらがより強く効くか**: 両軸を独立に振った比較実験は本 vault が扱う範囲ではまだ存在しない。(Source: [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]] Tab. 5.5)
- 50 services 超の OSS-MS(taskcluster、xpresso 等)を fault-injection ベンチマークに昇格させた研究はまだ存在しないか? 拡張優先順位はどうか?
- Train-Ticket fault dataset と LO2 dataset の **trace formats** に互換性はあるか? 共通の anomaly detection 評価 framework を作るには何が必要か?
- DeathStarBench の Social Network/Media と Train-Ticket の dependency graph は **どの程度トポロジが似ているか**? 一方の fault dataset が他方に転移可能か?
- 生成テスト(EvoMaster)が fault を捕まえないという事実は、テスト ≠ fault localization の境界を示す。**trace/metric/log を入力とする fault detection** に特化した benchmark protocol(評価指標・前処理・ラベル付与のガイドライン)はどう設計すべきか?
- [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]] の OSS-MS から自動で fault-injection benchmark を生成する pipeline は構築できるか? chaos engineering tool(chaos-mesh 等)との接続点は?
- マイクロサービスベンチマークの **時間的妥当性**(deprecate される)を保証する更新 protocol はあるか? Smith+ の Train-Ticket 1.0.0 vs. TrainTicketTrace の fork 版での差分は何を示唆するか?
- TraceLLM の TraceBench は Train-Ticket 単一システムのトレースで構築されているが、[[DeathStarBench]]・[[Sock Shop]] など他のベンチマークシステムのトレースを混ぜて学習した場合、Online-Boutique への汎化性(現状 Trace2Text で -31.35%)は改善するか。複数ベンチマークシステム横断の instruction-tuning データセットは構築されているか。([[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]])
- AIOps Challenge・GAIA のような産業界提供・非公開ベンチマーク環境由来のデータセットと、Train-Ticket のような公開ベンチマークシステム由来のデータセットとで、下流の fault localization/RCA 手法の性能傾向(難易度・転移可能性)に系統的な違いはあるか。両系統を横断して比較した研究は本 vault が扱う範囲ではまだ確認できていない。(Source: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]] §6.1)
- Sock Shop が deprecated と明記された後、後続研究は実際に Hipster-shop や他プラットフォームへ移行しているか。移行の有無・時期を横断的に追跡した研究は本 vault の範囲ではまだ確認できていない。(Source: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]])
- 本ページが挙げる5系benchmark systemに含まれないTable 8の17系ロングテール(BookInfo・TPC-W・Hipster-shop・Stan's Robot Shop 等)のうち、今後複数論文で再利用され「代表システム」に格上げされうるものはあるか。単発採用にとどまる理由(技術的制約かコミュニティ慣性か)は本サーベイの範囲では明らかにされていない。(Source: [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]])
## 関連
- 関連 source(原典系): [[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]](DeathStarBench)・[[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]](Smith+)・[[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]](OSS-MS 378)・[[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]]
- 関連 source(SRE/AIOps benchmark): [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] / [[@2025__arXiv__MicroRemed - Benchmarking LLMs in Microservices Remediation]] / [[@2025__WWW Companion__RCAEval - A Benchmark for Root Cause Analysis of Microservice Systems with Telemetry Data]] / [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]] / [[@2026__arXiv__SREGym - A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios]]
- 関連 source(LLM トレース分析 benchmark): [[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]]
- 関連 source(メトリクス粒度スケーリング): [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]]
- 関連 source(産業界提供の障害診断データセット): [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]](AIOps Challenge・GAIA のような本番/専用シミュレーション由来データセット、公開ツールキット率21.43%という再現性の別軸)
- 関連 source(テストベッド・データセット一覧、117件横断): [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]](Table 8 テストベッド22件、Train-Ticket利用比率31%、Sock Shop deprecated化)/ [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.7 Methods comparison]](Table 9 データセット26件、AIOps Challenge最多被引用)
- 関連 entity(代表的 MS system): [[DeathStarBench]] / [[Train-Ticket]] / [[eShopOnContainers]] / [[Sock Shop]] / [[Online-Boutique]]
- 関連 entity(産業界提供データセット): [[AIOps Challenge]] / [[GAIA Dataset]]
- 関連 entity(評価基盤): [[EvoMaster]] / [[OpenTelemetry]] / [[Jaeger]] / [[Prometheus]] / [[World of Code]]
- 関連 concept: [[マイクロサービスアーキテクチャ]] / [[マイクロサービスコールグラフ]] / [[本番接地型ベンチマーク]] / [[Fault Localization]] / [[障害注入]] / [[分散トレーシング]] / [[LLMによるトレース分析]] / [[LLM評価]]
- 関連 MOC: [[AIOps - Failure Detection - MOC]] / [[SRE - MOC]] / [[LLM4SRE - MOC]]
## 出典
- [[@2019__ASPLOS__An Open-Source Benchmark Suite for Cloud and IoT Microservices]]
- [[@2023__arXiv__Benchmarks for End-to-End Microservices Testing]]
- [[@2024__MSR__A Dataset of Microservices-based Open-Source Projects]]
- [[@2026__SANER-C__TrainTicketTrace - A Multi-Fault Distributed Dataset for Microservice Fault Detection and Localization]]
- [[@2026__WWW__TraceLLM - Evaluating and Exploring Large Language Models on Trace Analysis in Microservice-based Web Applications]](§2.1 Train-Ticket でのトレース収集(47サービス・90インスタンス)、§5.3.2 Online-Boutique への汎化評価)
- [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]](Tab. 5.5 empirical dataset summary、§5.6.1 Sock Shop/Train Ticket のメトリクス粒度別データセット構築)
- [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 6 Datasets and Metrics]](§6.1 Table 7 公開データセット一覧、公開ツールキット率21.43%)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.6 Testbeds and datasets used]](§4.6 Table 8 テストベッド22件、Fig.6 利用比率)
- [[@2026__Cluster Computing__Anomaly detection and root-cause identification in microservices - a survey - Chapter 4.7 Methods comparison]](§4.7 Table 9 データセット26件)