Przejdź do treści
CLIPSZTUCZNA INTELIGENCJA
Künstliche IntelligenzModelle, ihr Betrieb und ihre Grenzen

CLIP

Contrastive Language-Image Pre-training

Ein Modell, das auf Hunderten von Millionen Bild-Text-Paaren trainiert wurde. Es platziert Bilder und Texte in einem gemeinsamen numerischen Raum, sodass es bewerten kann, wie gut ein bestimmter Text zu einem bestimmten Bild passt.

Warum das wichtig ist

Dank CLIP verstehen Bildgeneratoren visuelle Beschreibungen wie „warmes Licht“, „kleine Schärfentiefe“ oder „Aufnahme von oben“. Derselbe Mechanismus ermöglicht die Bildsuche mittels natürlicher Sprache anstelle von Schlüsselwörtern.

Was ohne das fehlt

Ohne solche Modelle müsste eine Szenebeschreibung auf eine starre Liste von Etiketten reduziert werden, und Generatoren reagierten nur auf einfache Substantive.

Wann es verwendet wird

In jedem Bildgenerator, in visuellen Suchmaschinen und bei der automatischen Bildbeschreibung in Medienbibliotheken.

Wie wir es einsetzen

CLIP versteht gut das Aussehen, aber schlecht die Syntax. Die Sätze „Frau hält Bericht“ und „Bericht hält Frau“ werden fast gleich wahrgenommen – für die Beachtung der Beziehungen zwischen Objekten sind sprachliche Encoder zuständig.

Zahlen, die man kennen sollte

CLIP in Zahlen

82,2

W drugim kwartale 2026 roku sprzedaż słuchawek typu ear-clip wzrosła o 82,2% rdr, najszybciej w całym segmencie otwartym

IDC09/2026weltweit

Verwandte Begriffe