# Nicholas Sofroniew ## 概要 [[Anthropic]] の解釈可能性研究者。「Verbalizable Representations Form a Global Workspace in Language Models」(2026-07-06, Transformer Circuits Thread)の core contributor(共同筆頭著者)。(Source: [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]]) ## 貢献 - [[Jack Lindsey]] と共に、J-space をグローバルワークスペース理論の諸性質へ接続する実験を提案。 - verbal report・flexible generalization の主要実験、flexible-vs-automatic タスク実験、layer-wise 自己相関分析・曖昧入力実験、list retention/multitasking によるワークスペース容量測定を担当。 - post-training 効果のうち、ユーザープロンプトトークン上での Assistant 反応(bereavement・Tylenol 過剰摂取シナリオ等)、「考えるな」指示に対する苛立ちの表出を担当。 - 関連研究として、同一の内部方向がユーザー・第三者キャラクター・Assistant のいずれに帰属される感情も符号化するという先行知見(Sofroniew ら)が本論文の Related Work で言及されている。 ## 出典 - [[@2026__TransformerCircuits__Verbalizable Representations Form a Global Workspace in Language Models]] — Author Contributions 節に基づく