Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Die ai.embed Funktion konvertiert Text in Vektoreinbettungen, die Bedeutung darstellen. Verwenden Sie Embeddings, um Inhalte nach ihrer Bedeutung statt nach exakter Formulierung zu suchen, zu gruppieren und zu vergleichen.
Hinweis
- Dieser Artikel behandelt
ai.embedmit PySpark. Zu pandas siehe ai.embed mit pandas verwenden. - Alle KI-Funktionen und Voraussetzungen finden Sie in der Übersicht über KI-Funktionen.
- Ändern der Standardkonfiguration für KI-Funktionen mit PySpark.
Überblick
Die ai.embed Funktion ist für Spark DataFrames verfügbar. Sie müssen den Namen einer vorhandenen Eingabespalte als Parameter angeben.
Die Funktion gibt einen neuen DataFrame zurück, der Einbettungen für jede Zeile von Eingabetext in einer Ausgabespalte enthält.
Syntax
df.ai.embed(input_col="col1", output_col="embed")
Die Parameter
| Name | Description |
|---|---|
input_col Erforderlich |
Eine Zeichenfolge , die den Namen einer vorhandenen Spalte mit Eingabetextwerten enthält, die zum Berechnen von Einbettungen verwendet werden sollen. |
output_col Wahlfrei |
Eine Zeichenfolge , die den Namen einer neuen Spalte enthält, um berechnete Einbettungen für jede Eingabetextzeile zu speichern. Wenn Sie diesen Parameter nicht festlegen, wird für die Ausgabespalte ein Standardname generiert. |
error_col Wahlfrei |
Eine Zeichenfolge , die den Namen einer neuen Spalte enthält, in der alle OpenAI-Fehler gespeichert werden, die aus der Verarbeitung der einzelnen Eingabetextzeilen resultieren. Wenn Sie diesen Parameter nicht festlegen, wird für die Fehlerspalte ein Standardname generiert. Wenn eine Eingabezeile keine Fehler aufweist, weist diese Spalte einen null Wert auf. |
Rückkehr
Die Funktion gibt einen Spark DataFrame mit einer neuen Spalte zurück, die generierte Einbettungen für jede Eingabezeile enthält. Embeddings sind pyspark.ml.linalg.DenseVector Werte. Die Vektorgröße hängt von den Dimensionen des Einbettungsmodells ab, die in KI-Funktionen konfigurierbar sind.
Example
# This code uses AI. Always review output for mistakes.
# Read terms: https://azure.microsoft.com/support/legal/preview-supplemental-terms/.
df = spark.createDataFrame([
("This duvet, lovingly hand-crafted from all-natural fabric, is perfect for a good night's sleep.",),
("Tired of friends judging your baking? With these handy-dandy measuring cups, you'll create culinary delights.",),
("Enjoy this *BRAND NEW CAR!* A compact SUV perfect for the professional commuter!",)
], ["descriptions"])
embed = df.ai.embed(input_col="descriptions", output_col="embed")
display(embed)
Ausgabe:
Verwandte Inhalte
- Verwenden Sie ai.embed mit Pandas.
- Erfahren Sie mehr über KI-Funktionen.
- Ändern der Standardkonfiguration für KI-Funktionen mit PySpark.
- Informationen zur Abrechnung für KI-Funktionen.