# Parameter Server Navigation: [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]] ## 定義 パラメータサーバ(parameter server)は、分散機械学習において、データと計算を担う多数のワーカーノードと、大域共有パラメータ(疎または密なベクトル・行列)を保持・同期するサーバノード群を分離するアーキテクチャの枠組みである。ワーカーはローカルの訓練データから局所統計量(勾配など)を計算してサーバへ push し、サーバは集約後の値を計算してワーカーへ pull させることで、単一マシンに載らない規模のモデルとデータを扱う([[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]])。第一世代は memcached ベースの (key,value) ストアを流用したものであり、第二世代は YahooLDA・Distbelief のような用途特化実装、第三世代は本 source が示すような、線形代数データ型・柔軟な一貫性モデル・弾力的スケーラビリティ・継続的障害耐性を備えた一般プラットフォームである。 ## 未解決の問い - パラメータサーバの一貫性モデル(Sequential・Eventual・Bounded Delay)の選択は、後続システム(例: TensorFlow の分散パラメータサーバ実装)でどのように再構成・簡略化されているか。 - パラメータサーバ型のアーキテクチャは、モデル並列(model parallelism)やパイプライン並列など他の分散学習手法とどのように組み合わされ、あるいは置き換えられてきたか。 - 一貫性ハッシュによるキー分割とチェーンレプリケーションによる障害耐性は、現代の大規模言語モデル学習(パラメータ数が既存の想定を大きく超える規模)でも同じ設計でスケールするか。 ## 未編纂の観察 ## 関連 - 元となった source: [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]] - 関連エンティティ: [[Mu Li]] / [[Alexander J. Smola]] / [[David G. Andersen]] / [[Google]] / [[Carnegie Mellon University]] / [[Baidu]] ## 出典 - [[@2014__OSDI__Scaling Distributed Machine Learning with the Parameter Server]]