# BLIP
## 概要
BLIP(Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation)は、text+image-to-text(画像とテキストを入力し説明テキストを出力する)を実現するモデル構造の一例として本書が紹介するモデルである。モダリティの組み合わせ方として、モデル内部の注意層で異なるモダリティの特徴量を組み合わせる**中間融合(intermediate fusion)**を採用する。(Source: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 6 テキストと画像の融合]] §6.4)
## モデル構造
多段階の学習で構成され、3つの損失の和 $L_{\text{BLIP}} = L_{\text{ITC}} + L_{\text{ITM}} + L_{\text{LM}}$ で学習する。
- **Image-Text Contrastive(ITC)損失**: Image Encoder(Vision Transformer)と Text Encoder(BERT)の [CLS] トークン特徴量を用いる、[[CLIP]] のような[[対照学習]]の損失。
- **Image-Text Matching(ITM)損失**: BERT の自己注意層の後に交差注意層(クエリー=テキスト特徴量、キー・バリュー=画像特徴量)を加えたモデルで、正しい画像・テキストの組か否かを2値分類するクロスエントロピー損失。
- **Language Modeling(LM)損失**: マスク付き自己注意に差し替えた Transformer デコーダー型モデルによる次トークン予測損失。
テキストのモデルは同じ構成要素であれば同じパラメータを共有する。この交差注意でモダリティを組み合わせる構造は、unCLIP デコーダーとも近い。(Source: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 6 テキストと画像の融合]] §6.4)
## 応用
事前学習後はタスクに合わせてデータを準備しファインチューニングすることで text+image-to-text を実現する。例えば画像に対する質問応答タスクであれば、画像・質問テキスト・回答テキストを準備して学習する。
## 関連
- ソース: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 6 テキストと画像の融合]]
- モデル: [[CLIP]](ITC 損失の由来) / [[LLaVA]](早期融合との対比)
- 概念: [[対照学習]] / [[ビジョン言語モデル]]
## 出典
- 菊田遥平, 『原論文から解き明かす生成AI』, 技術評論社, 2025, 第6章 §6.4(原論文: BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation, https://arxiv.org/abs/2201.12086v2).