# Wes Gurnee ## 概要 [[Anthropic]] の解釈可能性研究者。「Verbalizable Representations Form a Global Workspace in Language Models」(2026-07-06, Transformer Circuits Thread)の core contributor(共同筆頭著者)。(Source: [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]]) ## 貢献 - [[Jack Lindsey]] と共に、Jacobian Lens 手法および「言語化可能な表現とアクセス意識の接続」というアイデアを着想。 - [[Mateusz Piotrowski]] と共に Jacobian Lens の最初の実装を開発し、その後の手法改良・ロジットレンズ/tuned lens との比較を主導。 - J-lens が内部推論に使われる概念を表出できることを示す初期実験を実施。 - internal reasoning(主要実験)・flexible generalization・structural layer-wise effects(主要実験)・capacity(occupancy・分散説明の測定)・broadcast 実験・脅迫シナリオのアラインメント監査・プロンプトインジェクション事例・全体の方法論的比較とアブレーションを担当。 - [[Adam Pearce]] と共にインタラクティブ可視化基盤を構築。 ## 出典 - [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]] — Author Contributions 節に基づく