## 定義
モデル内部可観測性(model-internal observability)とは、LLM推論システムにおいて、プロンプト・出力トークンのロギングを超えて、残差ストリーム・注意パターン・MLP活性化・KVキャッシュスライス等の**モデル内部状態そのもの**を実行時に取得・分析可能にする性質を指す。既存のシステム・ハードウェアレベルの可観測性(Prometheus 互換メトリクス、GPU/メモリ利用率、分散トレーシング等)がカーネル・ストリーム・メモリ・通信レベルの実行挙動を扱うのに対し、モデル内部可観測性はモデルの計算グラフ内部を対象とする点で異なるレイヤーの関心事である。[[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] は、これを推論の「補助機能」ではなく「独自のリソース・性能制約を持つ第一級のシステムプリミティブ」として扱うべきだと主張する。(Source: [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] Section 1, Section 2.3)
## 横断的知見
- 現時点で本 concept に紐づくソースは1件([[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]])のみであり、複数ソース間の突き合わせによる横断的知見はまだ蓄積されていない。今後、機構的解釈性系ツール(NNsight/NDIF、TransformerLens等)や推論最適化系ソース(Speculative Decoding、KVキャッシュ管理等)が追加 ingest された際に、可観測性の「取得コスト」と「取得範囲」のトレードオフがどのツール系統でも共通して現れるかを比較する。
## 未解決の問い
- モデル内部可観測性システム(DMI-Lib)は HuggingFace/vLLM への統合を前提とするが、SGLang や TensorRT-LLM のような他の主要推論エンジンへの統合コストはどの程度か(論文はvLLM Hook・TensorRT-LLM Debug APIを比較対象として言及するのみで、自身の統合実績はHuggingFace/vLLMに限定)。
- FlashAttention/FlashInfer使用時にattn_scores・patternへのアクセスが不能([[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] Table 1)という制約は、他の融合カーネル最適化(FlashDecoding等)でも同様に生じるか。融合カーネルとモデル内部可観測性は本質的にトレードオフの関係にあるのか。
- 「可観測性を推論ホットパスから分離する」設計思想は、[[Speculative Decoding]] のように内部状態(隠れ状態)をむしろ推論の高速化に**積極的に利用**する系統(EAGLE-3等)とどう関係するか。分離と活用は両立可能な独立した設計軸か、それとも相反するか。
- リアルタイム安全監視(悪意ある対話の検知・早期停止)のような、可観測性そのものが推論結果に介入するユースケースでは、「ホットパスからの分離」という前提はどこまで維持できるか。
## 関連
- 隣接concept: [[LLM推論]] / [[機構的解釈性]](内部状態解析の主要な下流ユースケース) / [[Speculative Decoding]](内部状態を活用する推論高速化との対比)
- ソース: [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]]
## 出典
- [[@2026__arXiv__Enabling Performant and Flexible Model-Internal Observability for LLM Inference]] — DMI-Lib(HookPoint・Ring2・Data Exporter)の設計と評価。モデル内部可観測性を第一級のシステムプリミティブとして定式化した初出ソース。