Zum Inhalt springen

Embeddings im Detail

Wissen

Im Einsteiger-Kurs hast du gelernt, dass Embeddings Wörter in Zahlen verwandeln. Jetzt schauen wir uns an, wie das mathematisch funktioniert und warum es so mächtig ist.

Ein Embedding ist ein Vektor -- eine geordnete Liste von Zahlen. Moderne Embedding-Modelle wie text-embedding-3-large von OpenAI erzeugen Vektoren mit 3.072 Dimensionen. Das bedeutet: Jedes Wort, jeder Satz oder jedes Dokument wird durch 3.072 Zahlen beschrieben. Diese Zahlen kodieren semantische Eigenschaften -- Bedeutungsdimensionen, die das Modell beim Training gelernt hat.

iDimensionen sind keine Kategorien

Eine einzelne Dimension in einem Embedding entspricht keinem menschlich lesbaren Konzept wie "Tier" oder "Farbe". Es sind abstrakte, mathematisch gelernte Merkmale. Erst das Zusammenspiel aller Dimensionen ergibt die Bedeutung.

Verstehen

Vektorräume und semantische Nähe

Stell dir einen dreidimensionalen Raum vor -- wie ein Zimmer mit Länge, Breite und Höhe. Jedes Wort hat darin eine Position. Wörter mit ähnlicher Bedeutung liegen nah beieinander. Jetzt erweitere dieses Zimmer auf 3.072 Dimensionen. Das Prinzip bleibt gleich: Semantisch ähnliche Konzepte haben ähnliche Vektoren.

Tiere
Farben
Programmieren
Essen

Klicke auf einen Punkt, um Ähnlichkeiten zu sehen — oder aktiviere die Vektorrechnung

Positionen und Ähnlichkeitswerte sind vereinfacht. Echte Embedding-Räume haben hunderte Dimensionen — hier siehst du eine 3D-Projektion.

Cosine Similarity -- Das Mass für Ähnlichkeit

Wie misst man, ob zwei Vektoren "ähnlich" sind? Die gängigste Methode ist Cosine Similarity. Sie misst den Winkel zwischen zwei Vektoren:

  • 1.0 = identische Richtung (maximale Ähnlichkeit)
  • 0.0 = rechtwinklig (keine Beziehung)
  • -1.0 = entgegengesetzte Richtung (Gegenteil)

Die Formel:

cosine_similarity(A, B) = (A . B) / (|A| * |B|)

Der Vorteil gegenüber euklidischer Distanz: Cosine Similarity ist unabhängig von der Länge der Vektoren. Ein langer Satz und ein kurzes Wort können trotzdem hohe Ähnlichkeit haben, wenn sie in die gleiche "Richtung" zeigen.

Zwei Embedding-Vektoren haben eine Cosine Similarity von 0.92. Was bedeutet das?

Anwenden

Wo Embeddings in der Praxis eingesetzt werden

  • Semantische Suche: Statt nach exakten Schlüsselbegriffen zu suchen, vergleichst du Embedding-Vektoren. Die Suchanfrage "Wie kündige ich mein Abo?" findet auch Dokumente über "Abonnement beenden" oder "Mitgliedschaft stornieren".
  • Clustering: Tausende Kundenfeedbacks automatisch nach Themen gruppieren -- ohne vordefinierte Kategorien.
  • Anomaly Detection: Texte finden, die sich semantisch von allen anderen unterscheiden.
  • RAG (Retrieval-Augmented Generation): Relevante Dokumente für ein LLM finden -- die Grundlage für die nächste Section.

Dimensionen in der Praxis

ModellDimensionenTypischer Einsatz
text-embedding-3-small1.536Kosteneffizient, allgemeine Suche
text-embedding-3-large3.072Höchste Qualität, komplexe Semantik
Cohere embed-v41.536Mehrsprachig, kompakt
Voyage 31.024Allgemein, mehrsprachig (voyage-code-3 ist für Code)

Reflektieren

Ein Unternehmen will seine interne Wissensdatenbank durchsuchbar machen. Mitarbeiter sollen Fragen in natürlicher Sprache stellen können. Welche Technologie ist die beste Grundlage?