# 差分プライバシー
## 定義
差分プライバシー(Differential Privacy, DP)は、データ解析アルゴリズムの出力から個々のレコードが存在したかどうかを確率的に推定困難にする情報理論的プライバシー保証の枠組みだ。ランダム化アルゴリズム M が (ε, δ)-DP を満たすとは、隣接するデータベース X と X' に対して全ての出力事象 E について
`P(M(X) ∈ E) ≤ e^ε · P(M(X') ∈ E) + δ`
が成立することをいう。ε(プライバシー予算)が小さいほど強いプライバシー保護を意味し、δ は失敗確率だ。GDPR・CCPA 等のプライバシー規制に対応する形式的保証として機械学習・データ解析の分野で広く採用されている。(Source: [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]])
**後処理不変性**: DP アルゴリズムの出力に任意の後処理を行ってもプライバシー損失は増加しない。これにより、DP 機構の出力を基に学習したモデルも同等の DP 保証を継承できる。
**合成可能性**: ε₁-DP と ε₂-DP を合成するとε₁+ε₂-DP になる。これは複数の DP ステップを組み合わせる際にプライバシー予算の消費を追跡する基礎となる。
## k-匿名性(関連する匿名化手法)
k-匿名性は、あるデータセットにおいて関心のあるカテゴリの任意の組み合わせについて、該当する個人が少なくともk人存在するようデータをバケット化する匿名化手法である。誕生日を月・年単位で報告する、郵便番号の先頭桁のみを報告するといった方法で達成する。推奨されるkのサイズは領域によって異なり(医療分野で最低5、50を超えることが好ましい場合もある)、データの機密性・データセットの有用性・他の既知のリンク可能なデータセットの有無に応じて選択する必要がある。差分プライバシーが数学的な確率保証(隣接データベース間の出力分布の近さ)を提供するのに対し、k-匿名性はデータセット内の集団のサイズという構造的性質としてプライバシーを概念化する点で異なるアプローチである。(Source: [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 6 公正さ、プライバシー、倫理的なMLシステム]] §6.2)
## 差分プライバシーの起源とϵ-識別不能性
2006年、Cynthia Dwork・Frank McSherry・Kobbi Nissim・Adam Smithが、統計データベースにノイズを加えて開示を防ぐ仕組みを体系的に分析できる理論として差分プライバシーを発表した。理論の出発点は2003年のKobbi NissimとIrit Dinurの研究で、クエリがプライベートなビット情報の線形関数の近似値を返す場合、誤差が十分小さければ少数のクエリでデータベース全体を再構成できる(reconstruction attack)ことを示していた——追跡子(tracker)による標的型攻撃ではなく、大量のランダムなクエリと線形代数だけで全データを引き出せるということである。この知見から導かれた鍵となる洞察は、開示の意図しない発生を避けるため個々人の貢献がクエリ結果に与える差を、データの感度に応じて較正したノイズの標準偏差で抑えるというものだ。プライバシーメカニズムが**ϵ-識別不能(ϵ-indistinguishable)**であるとは、1行だけ異なる任意のデータベースX, X′について、任意の答えの確率比が(1+ϵ)以内に収まることをいう。ラプラス分布ノイズでこれを達成でき、複数のメカニズムが合成可能(compose)であるためϵの消費量を追跡できる。この定式化は、暗号理論における一時パッド(one-time pad)や無条件安全な認証コードに相当する、統計データベースセキュリティのゴールドスタンダードと見なされるようになった。(Source: [[@2020__Wiley__Security Engineering 3e - Chapter 11 Inference Control]] §11.3)
## 2020年米国国勢調査での実運用
米国国勢調査局は2020年国勢調査で差分プライバシーを全面採用した。2010年国勢調査のセキュリティを現代の分析ツールで再検証したところ、Nissim-Dinurの再構成攻撃の考え方に基づき、44ビットの機密データを持つ集計済みファイル(CEF)から約38%の変数を完全に正しく復元でき、これは人口の約20%をカバーすることが判明した(4台のサーバで1か月を要した)。2010年国勢調査はスワッピング(識別性の高い世帯を別の地区の世帯と入れ替える)によって部分的な保護しか提供できておらず、この実証実験が「古典的な統計的開示制御では不十分」という結論を裏付けた。2020年国勢調査では、地理識別子なしの全国ヒストグラムをまず生成し、州・郡・地区・ブロックグループ・ブロックへと再帰的にトップダウンで地理ヒストグラムを構築し、州別集計が全国集計と一致するよう(議会選挙区割りに必要)にする新しいアルゴリズムが採用された。プライバシー予算ϵの値は政策判断であり、ϵと本人確認詐欺(identity theft)の限界的な社会的コストとの経済分析シミュレーションにより、ϵ=4〜6という値が導かれた。(Source: [[@2020__Wiley__Security Engineering 3e - Chapter 11 Inference Control]] §11.3)
## 横断的知見
- **プライバシー予算ϵの値は、独立に発展した複数の応用領域で驚くほど近い範囲(概ね1桁台前半)に収斂している**: 本概念が既に集約するPrvTel(テレメトリ保持向け)は「ε≤4を推奨」、Appleのmacos実装は「ε≈8」という値を採用する。これに対し[[@2020__Wiley__Security Engineering 3e - Chapter 11 Inference Control]]が報告する2020年米国国勢調査は、経済分析シミュレーション(統計の限界的社会便益と個人情報盗用の限界的社会的コストのトレードオフ)を通じて独立にε=4〜6という値を導いた。テレメトリ・企業製品・国家統計という応用ドメインも、ε選定の方法論(推奨値の提示/実装上の経験則/経済分析シミュレーション)も互いに異なるにもかかわらず、いずれも「ε=1000は生データ公開に等しい」という同じ理論的直感の下で、1桁台前半という近い範囲へ収斂している。これは本概念の「未解決の問い」が指摘してきた「ε設定値のドメイン依存性」という疑問に対し、少なくとも実務上の落とし所には一定の収斂があることを示す新しい手がかりである。(Source: [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]], [[@2020__Wiley__Security Engineering 3e - Chapter 11 Inference Control]] §11.3)
- **差分プライバシー登場以前の「アドホックな統計的開示制御」がなぜ2010年国勢調査で実際に破られたかを、Security Engineering第11章はNissim-Dinurの再構成攻撃という具体的な攻撃モデルで裏付ける**: 本概念はこれまでPrvTelの後処理不変性定理・合成可能性という差分プライバシーの数学的性質を主に扱ってきたが、なぜ差分プライバシー**以前**の手法(スワッピング等)が不十分だったのかという実証的根拠は薄かった。第11章が報告する2010年国勢調査データへの再構成攻撃実験(4台のサーバ・1か月で38%の変数を完全復元、人口の約20%をカバー)は、[[統計的開示制御]]が集約する古典的なランダム化手法(スワッピング等)が「一部の世帯しか保護しない」という実証的な失敗例であり、差分プライバシーが理論的な優位性だけでなく実証的にも必要とされた理由を補強する。(Source: [[@2020__Wiley__Security Engineering 3e - Chapter 11 Inference Control]] §11.3)
- **テレメトリ保持における DP 強制の方法論が「勾配時注入(DP-SGD)」から「事前データ摂動」へ移行する**: 従来の DP-SGD は確率的勾配降下の各更新ステップでノイズを追加するため、プライバシー損失が積み重なり訓練が不安定化する。PrvTel は訓練前に一回限り PrivBayes でノイズを注入し、後処理不変性定理で ε-DP を証明する。これはデータの低次統計量のみを摂動し高次元テーブル全体を摂動しないことで、同一予算で少ないノイズを実現する。(Source: [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]])
- **IP マスクだけでは再識別を防げない——フィールド組み合わせが依然として個人を識別する**: GDPR は IP 等の明示的識別子だけでなく行動推定を可能にするフィールド(トラフィックパターン・CPU/メモリ使用率)も対象とする。PrvTel のメンバーシップ推論攻撃(MIA)実験で、IP のみマスクした場合は MIA の AUC が 1.0(完全再識別可能)になることを示した。ε = 2 の DP 下では AUC が 0.491(ランダム推定と同等)に抑制される。(Source: [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]])
- **性能診断システムのサーベイは、DP をブロックチェーンベースストレージ・連合学習(FL)と並ぶ「システムレベルのデータプライバシー要件」の3系統の一つと位置づけ、モデル訓練段階での適用に絞って整理する**: [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]](Xin+, ACM Comput. Surv. 2025)は、性能診断データは典型的には個人情報に乏しいため DP は入力データそのものよりモデルへ直接適用されることが多いと述べ、ε-DP の定義(Dwork+)・訓練前の難読化関数(Zhang+)・DP-SGD(Abadi+)・DP を組み込んだ SVM 学習(Rubinstein+)・DP を統合した FL(Wei+)を代表例として列挙する。本 concept が扱う PrvTel の「訓練前にPrivBayesで一回限りノイズを注入する」方式は、このサーベイが「DP-SGD(訓練中に逐次ノイズ注入)」対「訓練前の一括難読化」として対比する2系統のうち後者に位置づけられ、性能診断分野でも同じ設計選択(いつノイズを入れるか)が繰り返し現れていることを示す。ただし本サーベイ自身が、性能診断データの匿名性の低さゆえに DP 適用の実証研究がまだ限定的であることを認めている(Section 4「Secure data governance for data and models」)。(Source: [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]])
- **「差分プライベート実験システムを構築して再利用する」という実務者の一文は、PrvTel が精緻化した ε-DP の技術的実装コストを、SRE 由来の組織原則(課題解決を一度だけにする)で正当化する**: PrvTel は DP の強制方法論を後処理不変性・PrivBayes による一括ノイズ注入まで数式レベルで詰めるが、その適用コストや運用体制については論じない。『SREの探求』15章は逆に、技術的詳細に踏み込まず「差分プライベート実験システムを構築して再利用する」ことを、SREの「課題の解決は一度だけ」原則(車輪の再発明を避け、意思決定・理由・結果を周知する)の一例として位置づけ、footnote で Rappor を類似着想のシステム例として挙げる。技術的に精緻な DP 実装(PrvTel)と、それを組織にどう定着させるか(ch.15 の SRE 的フレーム)は補完関係にあり、後者は前者のような一次資料が本 wiki にはまだ乏しい「DP システムをいつ作り、どう再利用させるか」という運用面の判断を補う。(Source: [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]], [[@2021__OReillyJapan__SREの探求 - Chapter 15 信頼性とプライバシーが交わるところ]] §15.3.2.1)
- **『信頼性の高い機械学習』6章が指摘する「GDPRの削除権とML モデルの矛盾」は、PrvTelが定式化する ε-DP の保証範囲の外側にある未解決問題である**: PrvTelの後処理不変性定理は「DP機構の出力に対する後処理はプライバシー損失を増加させない」ことを数式で証明し、これによりDPデータで訓練したモデルも同等のDP保証を継承できると主張する。しかし6章は、EUのGDPRが個人にデータ削除の権利を与える一方、モデルが既にそのデータから学習してしまった後では「削除の権利」が実質的に意味をなさない可能性を指摘し、モデルが自分のデータを「忘れた」ことを証明させられるかという問いを未解決のまま残す(訓練データが削除されるたびにモデルを完全に再訓練するのは非現実的)。PrvTelのDP保証は「学習済みモデルの出力から個々のレコードの存在を推定できない」ことを保証するが、これは「モデルがそのレコードの影響を受けていない」ことまでは保証しない——DPが数学的に達成する保証の粒度と、GDPRが法的に要求する削除の粒度には、6章が示唆するギャップが残る。(Source: [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 6 公正さ、プライバシー、倫理的なMLシステム]] §6.2, [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]] Theorem 2)
- **DPのプライバシー保証と精度低下のトレードオフは、全サンプルに均等ではなく少数派サブグループへ偏って現れる**: 本概念がこれまで蓄積してきた PrvTel・SREの探求・信頼性の高い機械学習の各ソースは、DPのプライバシー予算 ε と精度・実装コストのトレードオフを扱うが、そのコストが「誰に」偏るかには踏み込んでいない。『機械学習システムデザイン』11章は、Bagdasaryan と Shmatikov(2019)の "Differential Privacy Has Disparate Impact on Model Accuracy" を引用し、差分プライバシーが提供する保護レベルを高めるほどモデル精度が低下するが、この精度低下は少数派となるクラス・サブグループで顕著に大きいと報告する。これは、本概念がこれまで「プライバシー予算 ε の値をどう選ぶか」という集計レベルの問いとして扱ってきたトレードオフに、「その集計上のコストが集団間でどう不均一に配分されるか」という責任あるAIの観点(→[[責任あるAI]])を追加する。(Source: [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 11 機械学習の人的側面]] §11.3.2.3)
- **性能診断サーベイの全体像(Chapter 3.0)は「なぜDPが入力データそのものより主にモデル訓練へ適用されるのか」をAIライフサイクルの2段階分割として裏づける**: 本概念は既にこのサーベイの他章の引用から「性能診断データの匿名性の低さゆえ、DPは入力データよりモデルへ直接適用されることが多い」という観察を持っていたが、その理由づけは薄かった。サーベイのオーバービュー章([[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.0 State-of-the-Art Technologies - Overview]])は、データプライバシー保護技術をAIライフサイクル全体に配置したうえで、(1) データ収集・前処理段階では「機微情報の秘匿性・安全性を確保する」手法、(2) モデル訓練段階では「個々のデータ点を出力から隠す」手法、という2段階に明確に切り分けている。この切り分けは、PrvTelが訓練前の一括ノイズ注入(PrivBayes)という「収集後・訓練前」の中間的な適用点を選んだ設計判断と対比すると興味深い——サーベイの2段階モデルでは「収集・前処理」と「訓練」が別の保護手法を要する別々の段階として扱われるのに対し、PrvTelは収集データを訓練直前に一括処理することで、この2段階の境界そのものを曖昧にしている。(Source: [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.0 State-of-the-Art Technologies - Overview]], [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]] §4.3)
## 未解決の問い
- プライバシー予算 ε の適切な設定値はドメインや運用コンテキストによって異なる。テレメトリ保持で「ε ≤ 4 を推奨」とする PrvTel の示知と、一般的な DP アプリケーション(Apple macOS の実装では ε ≈ 8 が知られる)との間のギャップをどう解釈するか。
- PrivBayes の 256 フィールド制限は多くの実ワールドデータセットには十分だが、将来の高次元テレメトリ(IoT センサ群の大規模統合等)にはスケールしない。高次元ベイジアンネットワーク構築のコストを下げながら DP を維持する手法はあるか。
- 合成データからの派生統計で DP を証明するアプローチと、統計集計を直接DP 機構で算出するアプローチ(例:スケッチへのノイズ注入)を比較すると、クエリ汎用性と精度の間でどういうトレードオフがあるか。
- 性能診断システムのサーベイが指摘する「性能データの匿名性の低さゆえ DP 適用実証が限定的」という状況は、PrvTel のようなテレメトリ特化 DP 手法の登場でどこまで変わったか。ブロックチェーンストレージ・FL と DP を組み合わせた性能診断パイプライン(3系統同時適用)の実装例は存在するか。(Source: [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]])
- Bagdasaryan と Shmatikov(2019)が報告する「DPの精度コストは少数派サブグループに偏る」という知見は、PrvTel のテレメトリ向け DP 実装(PrivBayes による事前一括ノイズ注入)でも同様に観測されるか。PrvTel の MIA 実験(§5.6)はサブグループ別の精度劣化を評価しておらず、テレメトリという別ドメインでの検証は未実施。
- 2020年米国国勢調査のϵ=4〜6という値は経済分析シミュレーション(統計の便益 対 個人情報盗用コスト)で導かれたが、この方法論はテレメトリ・企業製品のϵ選定(PrvTelの推奨・Appleの実装例)にも応用できるか。応用領域ごとに独立にϵが1桁台前半へ収斂している現状は偶然の一致か、何らかの共通の下限があるのかは未検証。
- 性能診断サーベイのオーバービュー章が示す「収集・前処理段階」対「訓練段階」というAIライフサイクルの2段階プライバシー保護モデルは、実際のシステム実装(PrvTel等)でどこまで厳密に守られているか。PrvTelのように収集データを訓練直前に一括処理する設計は、サーベイの段階分けを暗黙に統合しているように見えるが、この統合が一般的な設計パターンなのか、PrvTel固有の選択なのかは、本サーベイの他章(データプライバシーを主題として扱う章)を確認しないと判断できない。
## 関連
- ソース: [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]] / [[Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications]] / [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.0 State-of-the-Art Technologies - Overview]] / [[@2021__OReillyJapan__SREの探求 - Chapter 15 信頼性とプライバシーが交わるところ]] / [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 6 公正さ、プライバシー、倫理的なMLシステム]] / [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 11 機械学習の人的側面]] / [[@2020__Wiley__Security Engineering 3e - Chapter 11 Inference Control]]
- 概念: [[テレメトリ]] / [[近似クエリ処理]] / [[プライバシーエンジニアリング]] / [[データのプライバシーと同意]] / [[責任あるAI]] / [[統計的開示制御]](DP以前のアドホックな技法群) / [[匿名化の失敗と再識別]]
- 実体: [[Cynthia Dwork]]
- 関連 MOC: [[LLM4SRE - MOC]]
## 出典
- [[@2026__NSDI__PrvTel - Lightweight Models for Private and Accurate Telemetry Data Retention]](§3.1 DP 定義、§4.3 DP 強制方法論、§5.6 MIA 実験、Theorem 2 後処理不変性による ε-DP 証明)
- [[@2021__OReillyJapan__SREの探求 - Chapter 15 信頼性とプライバシーが交わるところ]](§15.3.2.1: 差分プライベート実験システムの構築・再利用を「課題の解決は一度だけ」原則の例として言及)
- [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 6 公正さ、プライバシー、倫理的なMLシステム]](§6.2: DPの平易な定義、k-匿名性、GDPR削除権との緊張関係)
- [[@2023__OReillyJapan__機械学習システムデザイン - Chapter 11 機械学習の人的側面]](§11.3.2.3: プライバシーと精度のトレードオフ、少数派サブグループへの不均一な精度コスト)
- Ross Anderson, *Security Engineering: A Guide to Building Dependable Distributed Systems*, 3rd Edition, John Wiley & Sons, 2020, Chapter 11, §11.3(Dwork et al. 2006の理論的起源、2020年国勢調査での実運用)。
- [[@2025__ACMCSUR__Trustworthy AI-based Performance Diagnosis Systems for Cloud Applications - A Review - Chapter 3.0 State-of-the-Art Technologies - Overview]](原本 PDF p9: データプライバシー保護技術をAIライフサイクル全体〈収集・前処理段階/訓練段階〉に配置する記述。差分プライバシーという用語自体は明示されず、一般的な「データプライバシー」要件の記述であることに注意)。