Embeddings im Detail
Wissen
Im Einsteiger-Kurs hast du gelernt, dass Embeddings Wörter in Zahlen verwandeln. Jetzt schauen wir uns an, wie das mathematisch funktioniert und warum es so mächtig ist.
Ein Embedding ist ein Vektor -- eine geordnete Liste von Zahlen. Moderne Embedding-Modelle wie text-embedding-3-large von OpenAI erzeugen Vektoren mit 3.072 Dimensionen. Das bedeutet: Jedes Wort, jeder Satz oder jedes Dokument wird durch 3.072 Zahlen beschrieben. Diese Zahlen kodieren semantische Eigenschaften -- Bedeutungsdimensionen, die das Modell beim Training gelernt hat.
iDimensionen sind keine Kategorien
Eine einzelne Dimension in einem Embedding entspricht keinem menschlich lesbaren Konzept wie "Tier" oder "Farbe". Es sind abstrakte, mathematisch gelernte Merkmale. Erst das Zusammenspiel aller Dimensionen ergibt die Bedeutung.
Verstehen
Vektorräume und semantische Nähe
Stell dir einen dreidimensionalen Raum vor -- wie ein Zimmer mit Länge, Breite und Höhe. Jedes Wort hat darin eine Position. Wörter mit ähnlicher Bedeutung liegen nah beieinander. Jetzt erweitere dieses Zimmer auf 3.072 Dimensionen. Das Prinzip bleibt gleich: Semantisch ähnliche Konzepte haben ähnliche Vektoren.
Klicke auf einen Punkt, um Ähnlichkeiten zu sehen — oder aktiviere die Vektorrechnung
Positionen und Ähnlichkeitswerte sind vereinfacht. Echte Embedding-Räume haben hunderte Dimensionen — hier siehst du eine 3D-Projektion.
Cosine Similarity -- Das Mass für Ähnlichkeit
Wie misst man, ob zwei Vektoren "ähnlich" sind? Die gängigste Methode ist Cosine Similarity. Sie misst den Winkel zwischen zwei Vektoren:
- 1.0 = identische Richtung (maximale Ähnlichkeit)
- 0.0 = rechtwinklig (keine Beziehung)
- -1.0 = entgegengesetzte Richtung (Gegenteil)
Die Formel:
cosine_similarity(A, B) = (A . B) / (|A| * |B|)
Der Vorteil gegenüber euklidischer Distanz: Cosine Similarity ist unabhängig von der Länge der Vektoren. Ein langer Satz und ein kurzes Wort können trotzdem hohe Ähnlichkeit haben, wenn sie in die gleiche "Richtung" zeigen.
Zwei Embedding-Vektoren haben eine Cosine Similarity von 0.92. Was bedeutet das?
Anwenden
Wo Embeddings in der Praxis eingesetzt werden
- Semantische Suche: Statt nach exakten Schlüsselbegriffen zu suchen, vergleichst du Embedding-Vektoren. Die Suchanfrage "Wie kündige ich mein Abo?" findet auch Dokumente über "Abonnement beenden" oder "Mitgliedschaft stornieren".
- Clustering: Tausende Kundenfeedbacks automatisch nach Themen gruppieren -- ohne vordefinierte Kategorien.
- Anomaly Detection: Texte finden, die sich semantisch von allen anderen unterscheiden.
- RAG (Retrieval-Augmented Generation): Relevante Dokumente für ein LLM finden -- die Grundlage für die nächste Section.
Dimensionen in der Praxis
| Modell | Dimensionen | Typischer Einsatz |
|---|---|---|
| text-embedding-3-small | 1.536 | Kosteneffizient, allgemeine Suche |
| text-embedding-3-large | 3.072 | Höchste Qualität, komplexe Semantik |
| Cohere embed-v4 | 1.536 | Mehrsprachig, kompakt |
| Voyage 3 | 1.024 | Allgemein, mehrsprachig (voyage-code-3 ist für Code) |
Reflektieren
Ein Unternehmen will seine interne Wissensdatenbank durchsuchbar machen. Mitarbeiter sollen Fragen in natürlicher Sprache stellen können. Welche Technologie ist die beste Grundlage?