Przejdź do treści
CLIPSZTUCZNA INTELIGENCJA
人工知能モデル、その運用と限界

CLIP

Contrastive Language-Image Pre-training

数億組の画像とキャプションのペアで学習されたモデル。画像とテキストを同一の数値空間に配置するため、特定の画像にどの程度特定の説明文が適合するかを評価できる。

なぜ重要か

CLIPのおかげで、画像生成モデルは「温かみのある光」「浅い被写界深度」「上からのアングル」などの視覚的表現を理解できる。同じメカニズムが、キーワードではなく自然な文章で画像検索を行う仕組みの基盤となっている。

なければ何が困るか

このようなモデルがなければ、シーンの説明は固定されたリストのラベルに限定され、生成モデルは単純な名詞にしか反応できなかったであろう。

いつ使うか

画像生成モデル、視覚検索エンジン、メディアライブラリでの自動画像説明など、あらゆる場面で使用される。

私たちの使い方

CLIPは外見をよく理解するが、文法構造は弱い。たとえば「女性がレポートを持っている」と「レポートが女性を持っている」はほぼ同じように認識する——対象間の関係性を把握するためには、言語エンコーダーが必要となる。

知っておきたい数字

データで見るCLIP

82,2

W drugim kwartale 2026 roku sprzedaż słuchawek typu ear-clip wzrosła o 82,2% rdr, najszybciej w całym segmencie otwartym

IDC09/2026世界

関連用語