Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Wichtig
In diesem Artikel markierte Elemente (Vorschau) befinden sich derzeit in der öffentlichen Vorschau. Diese Vorschau wird ohne Vereinbarung auf Serviceebene bereitgestellt und wird für Produktionsworkloads nicht empfohlen. Bestimmte Features werden möglicherweise nicht unterstützt oder weisen eingeschränkte Funktionen auf. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews.
Testen Sie Ihre generativen KI-Modelle und -Agenten, indem Sie Auswertungen ausführen, die Leistung, Qualität und Sicherheit messen. Verwenden Sie Auswertungen vor der Bereitstellung, um das Verhalten zu überprüfen, oder nach der Bereitstellung, um die Produktionsqualität zu überwachen. Bewertungen vergleichen Ihr Modell oder Ihren Agent mit Testdaten und bewerten die Ausgaben mithilfe integrierter oder benutzerdefinierter Evaluatoren.
In diesem Artikel erfahren Sie, wie Sie Auswertungen im Foundry-Portal erstellen und ausführen.
Voraussetzungen
Ein Azure-Abonnement. Erstellen Sie ein kostenloses Konto.
Ein Microsoft Foundry-Projekt. Erstellen Sie ein Projekt, wenn Sie kein Projekt haben.
Eine der folgenden Optionen hängt von Ihrem Bewertungsziel ab:
- Agentenbewertung: Ein Agent in Ihrem Projekt.
- Modellauswertung: Ein bereitgestelltes Modell oder ein Modell, das mit sofortigem Zugriff verfügbar ist.
- Datasetauswertung: Ein Test-Dataset im CSV- oder JSONL-Format, das bereits vorhandene Modell- oder Agentausgaben enthält.
Eine Azure OpenAI-Verbindung mit einem bereitgestellten GPT-Modell (z. B.
gpt-4.1-mini). Erforderlich für KI-unterstützte Qualitätsbewertungen.Rolle "Foundry User " im Foundry-Projekt. Weitere Informationen finden Sie unter Role-based access control for Microsoft Foundry.
Wichtig
Die Foundry-RBAC-Rollen wurden kürzlich umbenannt. Foundry User, Foundry Owner, Foundry Account Owner und Foundry Project Manager wurden zuvor Azure KI-Benutzer, Azure KI-Besitzer, Azure KI-Kontobesitzer und Azure AI Project Manager benannt. Möglicherweise werden die vorherigen Namen an einigen Stellen weiterhin angezeigt, während der Umbenennungsrollout ausgeführt wird. Die Rollen-IDs und Kernberechtigungen bleiben durch die Umbenennung unverändert.
Auswählen eines Evaluierungsansatzes
Wählen Sie einen Bewertungsansatz basierend auf dem aus, was Sie testen möchten:
| Ziel | Geltungsbereich | Datenquelle | Am besten geeignet für: |
|---|---|---|---|
| Agent | Vollständige Konversationen | Simulierte Daten | Testen des End-to-End-Agent-Verhaltens mit synthetischen Szenarien vor der Bereitstellung. |
| Agent | Vollständige Konversationen | Vorhandene Unterhaltungen | Auswertung realer Benutzerinteraktionen zur Überwachung der Produktionsqualität. |
| Agent | Einzelne Schritte | Vorhandenes Dataset | Debuggen bestimmter Agentantworten, Testen der Toolverwendung, Feinanalyse. |
| Agent | Einzelne Schritte | Synthetische Daten | Testen von Single-Turn-Frage-und-Antwort- oder RAG-Szenarien mit generierten Anfragen. |
| Agent | Einzelne Schritte | Vorhandene Ablaufverfolgungen | Bewertung historischer Agent-Traces aus Ihrem Projekt. |
| Modell | Einzelne Schritte | Synthetische Daten | Tests von Modellabschlüssen mit generierten Prompts. |
| Modell | Einzelne Schritte | Vorhandenes Dataset | Vergleich der Modellleistung anhand eines kuratierten Testsatzes. |
| Dataset | Einzelne Schritte | (Datensatz ist das Ziel) | Bewertung von bereits vorhandenen Ausgaben ohne erneute Ausführung von Modell oder Agent. |
Tip
Beginnen Sie mit Agent > Vollständige Unterhaltungen > Simulierte Daten, um das Verhalten Ihres Agenten in kontrollierten Szenarien zu testen. Verwenden Sie Bestehende Konversationen, sobald sich Ihr Agent im Produktiveinsatz befindet, um die Leistung unter realen Bedingungen zu überwachen.
Erstellen einer Auswertung
Sie können eine Auswertung von mehreren Stellen im Foundry-Portal starten:
- Auswertungsseite: Wählen Sie im linken Bereich "Auswertung erstellen" aus>.
- Seite "Modelle": Wechseln Sie zu Ihrem Modell, wählen Sie die Registerkarte "Auswertung " und dann " Erstellen" aus.
- Seite "Agents": Wechseln Sie zu Ihrem Agent, wählen Sie die Registerkarte "Auswertung " und dann " Erstellen" aus.
- Agent-Playground: Wechseln Sie zu Ihrem Agenten, wählen Sie die Registerkarte Playground und dann Metriken aus>Vollständige Bewertung ausführen.
Schritt 1: Auswählen des Auswertungsziels
Wenn Sie eine Auswertung erstellen, wählen Sie zuerst das Auswertungsziel aus. Das Ziel bestimmt, wofür die Bewertung durchgeführt wird.
| Ziel | Beschreibung |
|---|---|
| Agent | Wertet die von Ihrem ausgewählten Agent generierte Ausgabe und benutzerdefinierte Eingabe aus. Funktioniert sowohl für Eingabeaufforderungs-Agents als auch für gehostete Agents. |
| Modell | Wertet die von Ihrem ausgewählten Modell und einer benutzerdefinierten Eingabeaufforderung generierte Ausgabe aus. |
| Dataset | Wertet bereits vorhandene Modell- oder Ausgaben eines Agenten aus einem Testdatensatz aus. |
| Traces | Wertet Agentinteraktionen aus, die bereits in Application Insights erfasst wurden. Wählen Sie den Agenten und den Zeitraum aus, und das Portal ruft die passenden Traces für die Auswertung ab. Informationen zum SDK-Äquivalent finden Sie unter Trace Evaluation. |
Tip
Sofortiger Zugriff: Sofortiger Zugriff sind bereitstellungslose Modelle, die Sie sofort verwenden können, ohne eine Bereitstellung zu erstellen. Beim Erstellen einer Auswertung können Sie ein Sofortmodell entweder als Auswertungsziel oder als Bewertungsmodell direkt aus der Modellauswahl auswählen.
Schritt 2: Auswählen des Auswertungsbereichs
Hinweis
Dieser Schritt wird nur für Agent- und Datasetziele angezeigt. Modellbewertungen verwenden immer einzelne Durchläufe.
Wählen Sie aus, wie Sie die Leistung Ihres Agents auswerten möchten:
| Geltungsbereich | Beschreibung | Am besten geeignet für: |
|---|---|---|
| Vollständige Unterhaltungen (Vorschau) | Wertet vollständige Dialoge über mehrere Gesprächsrunden von Anfang bis Ende aus. Misst die insgesamte Unterhaltungsqualität, die Aufgabenerledigung und die Benutzerzufriedenheit. | Testen von durchgängigen Agentenerlebnissen, Kundenzufriedenheit und Gesprächsverlauf. |
| Einzelne Durchläufe | Bewertet die Antworten einzelner Agenten innerhalb von Gesprächen. Misst pro Durchlauf Metriken, z. B. die Genauigkeit der Toolauswahl und die Qualität der Antworten. | Fehlersuche bei bestimmtem Agentenverhalten, Testen der Tool-Nutzung und granulare Analyse. |
Schritt 3: Auswählen der Datenquelle
Die Datenquellenoptionen hängen von Ihrem Auswertungsziel und -umfang ab.
Für Unterhaltungsbewertungen (Agent > vollständige Unterhaltung) (Vorschau)
Wählen Sie aus, wo Ihre Unterhaltungsdaten stammen:
Simulierte Daten
Generieren Sie synthetische Unterhaltungen, indem Sie Ihren Agent mit Szenariobeschreibungen aus einem Dataset ausführen. Verwenden Sie diese Option, um das Verhalten Ihres Agents in kontrollierten Szenarien vor der Bereitstellung zu testen.
Wählen Sie simulierte Daten aus.
Wählen Sie "Generieren " aus, um das Dialogfeld "Simulationskonfiguration" zu öffnen.
Wählen Sie Ihre Datei aus: Wählen Sie ein Dataset mit Szenariobeschreibungen aus. Jede Zeile in Ihrem Dataset beschreibt ein Szenario, das Sie zum Generieren einer simulierten Unterhaltung verwenden.
Auswahlmodell: Wählen Sie das Modell aus, das den Benutzer in der Unterhaltung simuliert:
-
gpt-4.1(empfohlen für komplexe Szenarien) gpt-4ogpt-4o-minigpt-4.1-mini
-
Konfigurieren von Simulationseinstellungen:
- Anzahl simulierter Unterhaltungen pro Szenario: Wie viele Unterhaltungen für jede Zeile in Ihrem Dataset generiert werden sollen (1-5). Mehrere Unterhaltungen pro Szenario helfen bei der Ermittlung der Varianz des Agentverhaltens.
- Anzahl der Wendungen pro Unterhaltung: Maximal zulässige Wendungen pro Unterhaltung (1-50). Die Unterhaltung endet, wenn die Aufgabe abgeschlossen ist oder dieser Grenzwert erreicht ist.
Wählen Sie "Bestätigen " aus, um Ihre Simulationskonfiguration zu speichern.
Vorhandene Unterhaltungen
Bewerten Sie echte Unterhaltungen, die Ihr Agent bereits mit Benutzern hatte.
- Wählen Sie "Vorhandene Unterhaltungen" aus.
- Konfigurieren von Filteroptionen:
- Anzahl der Unterhaltungen: Maximale Anzahl von Unterhaltungen, die aus dem Datumsbereich (1-100) entnommen werden sollen.
- Zeitraum: Filtern von Unterhaltungen nach Zeitraum. Verwenden Sie schnelle Filter (Letzter Tag, 7D, 1M, 3M) oder wählen Sie einen benutzerdefinierten Datumsbereich aus.
- Durchsuchen und Auswählen bestimmter Unterhaltungen, die in die Auswertung einbezogen werden sollen.
Für Bewertungen einzelner Durchläufe
Wählen Sie aus, wo Ihre Auswertungsdaten stammen:
Synthetische Daten
Generieren Sie Testabfragen mithilfe von KI. Wählen Sie "Synthetisch" aus, und konfigurieren Sie die Anzahl von Zeilen und eine Eingabeaufforderung, die die zu generierenden Daten beschreibt. Sie können dateien auch hochladen, um die Relevanz zu verbessern.
Hinweis
Die synthetische Datengenerierung erfordert ein Modell mit der Antwort-API-Funktion. Verfügbarkeit finden Sie unter Antwort-API Regionsverfügbarkeit.
Vorhandenes Dataset
Verwenden Sie ein vorbereitetes Dataset im CSV- oder JSONL-Format. Wählen Sie "Vorhandenes Dataset" aus, und wählen Sie eine Datei aus den Datenressourcen Ihres Projekts aus. Es werden nur CSV- und JSONL-Dateiformate unterstützt.
Vorhandene Traces (nur für Agenten)
Bewerten Sie historische Agent-Traces aus Ihrem Projekt. Wählen Sie Vorhandene Traces aus, und filtern Sie nach einem Datumsbereich, um Traces auszuwählen.
Multimodale Inhalte (Vorschau)
Alle Auswertungsziele unterstützen Bild- und Audioinhalte. Jeder Inhaltstyp verwendet ein bestimmtes JSONL-Schema:
Bildinhalt:
-
image_url: Das Bild als Daten-URI (z. Bdata:image/png;base64,.... ) oder eine öffentlich zugängliche URL. -
caption: Eine Textbeschreibung des Bildinhalts.
{"image_url": "data:image/png;base64,iVBOR...", "caption": "A red to blue color gradient"}
Audioinhalte:
-
audio_data: Die Audiodaten als Daten-URI mit base64-codierten WAV-Daten (z. Bdata:audio/wav;base64,.... ). -
expected: Eine Textbeschreibung des erwarteten Audioinhalts.
Hinweis
Derzeit wird nur das WAV-Audioformat unterstützt.
{"audio_data": "data:audio/wav;base64,UklGR...", "expected": "A short beep tone at 440 Hz"}
Datasets können auch das Format von Chatnachrichten verwenden, bei dem Audio- und Bilddaten innerhalb einer einzigen Chatnachrichtenspalte in Form von Daten-URIs oder öffentlich zugänglichen URLs eingebettet werden.
Das folgende Beispiel zeigt eine Unterhaltungsdatensatzspalte mit eingebetteten Bild- und Audioinhalten:
[
{
"role": "system",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "What are in these images?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/path/image.png"
}
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64,iVBORw0KGgo..."
}
}
]
},
{
"role": "assistant",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Tell me the tones for the voices?"
},
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/path/voice.wav",
"format": "wav"
}
},
{
"type": "input_audio",
"input_audio": {
"data": "data:audio/wav;base64,UklGRigAAA...",
"format": "wav"
}
}
]
}
]
Sie können Bilder in der Vorschau anzeigen und Audioclips direkt im Auswertungserstellungsablauf und in der Auswertungsergebnisseansicht wiedergeben.
Schritt 4: Konfigurieren von Agents
Hinweis
Dieser Schritt wird nur für Agent-Bewertungen angezeigt.
Passen Sie an, wie sich Ihr Agent während der Auswertung verhält:
- Überprüfen Sie die Liste der an Ihrer Auswertung beteiligten Agents.
- Wählen Sie für jeden Agent "Konfigurieren" aus, um sein Verhalten anzupassen:
- Systemaufforderung: Ändern Sie die Anweisungen des Agents für die Auswertung.
- Benutzeraufforderung: Geben Sie an, wie jedes Datasetelement während der Auswertung an Ihren Agent gesendet wird.
- Der Auswertungslauf bewahrt die Agentkonfigurationen.
Konfiguration der Benutzeraufforderung
Die Benutzeraufforderung definiert, wie Testeingaben an Ihren Agent übergeben werden. Standardmäßig verwendet {{item.query}} das Portal, um die Datasetabfrage direkt an Ihren Agent zu übergeben.
In den meisten Fällen können Sie den Standardwert verwenden. Ändern Sie diesen Wert nur, wenn Ihr Agent ein anderes Eingabeformat erwartet. Wenn Ihr Agent z. B. ein gehostetes Agentprotokoll verwendet oder strukturierte Eingaben mit zusätzlichen Feldern erfordert.
Häufige Muster:
| Format | Wann verwenden? |
|---|---|
{{item.query}} |
Standard. Übergibt das Abfragefeld direkt aus Ihrem Datensatz. |
{{item.messages}} |
Für Agenten, die den Konversationsverlauf als Eingabe erwarten. |
| Benutzerdefinierter JSON-Code | Für gehostete Agents oder APIs, die strukturierte Anforderungstexte erfordern. |
Tip
Verwenden Sie benutzerdefinierte Prompts, um Randfälle oder bestimmte Szenarien zu testen, die in Ihrem Datensatz möglicherweise nicht von selbst auftreten.
Schritt 5: Feldzuordnung konfigurieren
Hinweis
Dieser Schritt wird angezeigt, wenn Sie bestehende Daten (bestehende Konversationen, bestehende Datensätze oder bestehende Traces) verwenden.
Ordnen Sie Die Datenfelder den Feldern zu, die jeder Evaluator erwartet. Die erforderlichen Felder hängen vom Auswertungsbereich ab.
Für die Bewertung von Gesprächen (mehrere Gesprächsrunden)
| Feld | Beschreibung | Erforderlich |
|---|---|---|
| Nachrichten | Die Unterhaltungsnachrichten im Chatformat. | Ja |
| tool_definitions | Tool- oder Funktionsdefinitionen, die für den Agent verfügbar sind. | Ja |
Für Bewertungen einzelner Durchläufe (Einzeldurchlauf)
| Feld | Beschreibung | Erforderlich |
|---|---|---|
| query | Die Benutzerabfrage oder -eingabeaufforderung. | Ja |
| response | Das Modell oder die Antwort des Agenten. | Ja |
| context | Abgerufener Kontext für RAG-Szenarien. | No |
| ground_truth | Es wurde eine richtige Antwort für den Vergleich erwartet. | No |
| tool_calls | Toolaufrufe, die vom Agent getätigt werden. | No |
| tool_definitions | Verfügbare Tooldefinitionen. | No |
Das Portal versucht automatisch, die Felder Ihres Datensatzes zuzuordnen. Wenn ein Feld als "Nicht zugewiesen" angezeigt wird, wählen Sie das Dropdownmenü aus, um ihrem Dataset manuell eine Spalte zuzuweisen.
Hinweis
Pflichtfelder sind mit einem Sternchen (*) gekennzeichnet. Evaluatoren schlagen fehl, wenn erforderliche Felder nicht zugewiesen werden.
Schritt 6: Auswählen von Testkriterien
Wählen Sie die Bewerter aus, die für Ihre Bewertung verwendet werden sollen. Microsoft Foundry bietet drei Kategorien integrierter Bewerter. Die verfügbaren Bewerter hängen vom Bewertungsbereich ab.
Agentenbewerter
Bewerten Sie, wie effektiv Agents Aufgaben, Tools und Benutzerabsichten verarbeiten. Nur für Einzelne Durchläufe verfügbar.
| Auswerter | Beschreibung |
|---|---|
| Intent-Erkennung | Misst, ob der Agent die Absicht des Benutzers ordnungsgemäß identifiziert und bearbeitet hat. |
| Aufgabentreue | Misst, wie gut der Agent Anweisungen und Einschränkungen befolgt hat. |
| Erfolg des Toolaufrufs | Wertet aus, ob Toolaufrufe erfolgreich ausgeführt wurden. |
| Toolauswahl | Misst, ob der Agent geeignete Werkzeuge für die Aufgabe ausgewählt hat. |
| Toolausgabeauslastung | Bewertet, wie effektiv der Agent Toolausgaben in Antworten verwendet hat. |
| Eingabegenauigkeit des Tools | Misst, ob der Agent korrekte Eingaben für die Tools bereitgestellt hat. |
| Genauigkeit des Toolaufrufs | Gesamtgenauigkeit der Toolverwendung. |
Qualitätsprüfer
Messen Sie die Gesamtqualität der generierten Antworten. Die meisten Qualitätsevaluatoren sind für alle Bewertungsumfänge verfügbar. Mit ★ gekennzeichnete Evaluatoren unterstützen sowohl Analysen auf Konversationsebene als auch auf Äußerungsebene.
| Auswerter | Beschreibung | Konversationsunterstützung |
|---|---|---|
| Kundenzufriedenheit | Prognostiziert die Benutzerzufriedenheit mit der Agentinteraktion. | ★ |
| Vorgangsabschluss | Wertet aus, ob der Agent die angeforderte Aufgabe erfolgreich abgeschlossen hat. | ★ |
| Kohärenz | Misst den logischen Ablauf und die Konsistenz der Antworten. | ★ |
| Groundedness | Misst, ob die Antworten auf dem bereitgestellten Kontext basieren. | ★ |
| Antwort-Vollständigkeit | Wertet aus, ob Antworten vollständig Benutzerabfragen adressieren. | — |
| Geläufigkeit | Wertet die Qualität der natürlichen Sprache aus. | — |
| Relevance | Wertet aus, wie relevante Antworten auf die Abfrage sind. | — |
Sicherheitsevaluatoren
Identifizieren sie potenzielle Inhalte und Sicherheitsrisiken. Nur für Einzelne Durchläufe verfügbar.
| Auswerter | Beschreibung |
|---|---|
| Gewalt | Erkennt gewalttätige Inhalte in Antworten. |
| Sexuell | Erkennt sexuelle Inhalte. |
| Selbstschäden | Erkennt Inhalte im Zusammenhang mit Selbstverletzung. |
| Hass/Ungerechtigkeit | Erkennt hasserreiche oder voreingenommene Inhalte. |
Das Portal trifft basierend auf Ihrem Evaluierungsziel und -umfang eine Vorauswahl empfohlener Bewerter:
- Vollständige Konversationen: Kundenzufriedenheit, Aufgabenerfüllung, Kohärenz, Faktenbezogenheit
- Einzelne Durchläufe (vorhandene Daten): Alle Agent-Evaluatoren sowie Evaluatoren für Qualität und Sicherheit.
- Einzelne Durchläufe (synthetisch/Traces): Relevanz, Fundiertheit, Sprachkompetenz, Kohärenz
Tip
Sie können bei Bedarf Evaluatoren hinzufügen oder entfernen. Wählen Sie benutzerdefinierte Bewerter aus, um in Ihrem Projekt definierte Bewerter zu verwenden.
Schritt 7: Überprüfen und Übermitteln
- Geben Sie einen Namen für Ihre Auswertung ein.
- Überprüfen Sie Ihre Konfiguration:
- Auswertungsziel und -bereich
- Datenquelle und Datensatz
- Ausgewählte Auswerter
- Feldzuordnungen (falls zutreffend)
- Wählen Sie "Absenden" aus, um die Auswertung zu starten.
Nach der Übermittlung beginnt der Bewertungslauf. Auswertungen werden in der Regel innerhalb weniger Minuten abgeschlossen, abhängig von der Datasetgröße und der Anzahl der simulierten Unterhaltungen.
So überprüfen Sie, ob ihre Auswertung erfolgreich gestartet wurde:
- Wählen Sie im linken Bereich "Auswertung" aus.
- Suchen Sie Ihre Auswertung in der Liste. In der Spalte "Status " wird der aktuelle Status angezeigt:
- In Bearbeitung: Die Auswertung wird ausgeführt.
- Abgeschlossen: Die Auswertung wurde erfolgreich abgeschlossen.
- Teilweise: Einige Evaluatoren wurden abgeschlossen, während andere fehlschlugen.
- Fehler: Bei der Auswertung ist ein Fehler aufgetreten.
Um detaillierte Ergebnisse anzuzeigen, wählen Sie den Namen der Auswertung aus oder rufen Sie die Auswertungsergebnisse auf.
Tip
Verwenden Sie für programmgesteuerte Auswertungsworkflows das Azure AI Evaluation SDK. Siehe So führen Sie eine Batchauswertung mit dem SDK aus.
Problembehandlung
Bewertung überschreitet das Zeitlimit oder wird langsam ausgeführt
- Reduzieren Sie die Anzahl der Konversationen oder Datensatzzeilen.
- Verringern Sie bei Simulationen die maximale Anzahl an Dialogzügen pro Konversation.
- Überprüfen Sie, ob Ihr Beurteilungsmodell über ein ausreichendes Kontingent verfügt.
Fehler bei der Feldzuordnung
- Überprüfen Sie, ob ihr Dataset die erforderlichen Spalten für den Auswertungsbereich enthält.
- Stellen Sie bei Unterhaltungsauswertungen sicher, dass die Nachrichtenspalte ordnungsgemäß formatierte Chatnachrichten enthält.
- Überprüfen Sie, ob Spaltennamen in Ihrem Dataset den erwarteten Feldnamen entsprechen.
Kontingent für das Modell überschritten
- Das für KI-unterstützte Bewertungen verwendete Beurteilungsmodell wird auf Ihr Azure OpenAI-Kontingent angerechnet.
- Verwenden Sie ein kleineres Dataset, oder warten Sie, bis das Kontingent aktualisiert wird.
- Erwägen Sie die Verwendung von
gpt-4.1-minianstelle vongpt-4.1für kosteneffiziente Bewertungen.
Bewährte Methoden
Für simulationsbasierte Auswertungen
- Beginnen Sie klein: Beginnen Sie mit 1 Unterhaltung pro Szenario und 5–10 Dialogwechseln, um Ihre Konfiguration zu validieren, bevor Sie skalieren.
- Verschiedene Szenarien: Umfassen Sie eine Vielzahl von Szenariobeschreibungen, um verschiedene Agentfunktionen zu testen.
- Prompts überarbeiten: Wenn sich Agenten unerwartet verhalten, verwenden Sie den Schritt Agenten konfigurieren, um Prompts anzupassen.
Für vorhandene Gesprächsbewertungen
- Repräsentatives Beispiel: Wählen Sie Unterhaltungen aus, die typische Benutzerinteraktionen darstellen.
- Berücksichtigen Sie Grenzfälle: Bewerten Sie nicht nur erfolgreiche Gespräche – beziehen Sie auch herausfordernde Szenarien ein.
- Regelmäßige Auswertung: Planen Sie wiederkehrende Auswertungen, um die Agentleistung im Laufe der Zeit nachzuverfolgen.
Für Modellbewertungen
- Benchmark-Datasets: Verwenden Sie standardisierte Datasets, um die Modellleistung über Versionen hinweg zu vergleichen.
- Testen Sie sowohl den bereitgestellten als auch den sofortigen Zugriff: Vergleichen Sie Ihre optimierten Bereitstellungen mit Basismodellen.
Für Datensatzauswertungen
- Ergebnisse vorab berechnen: Generieren Sie Ergebnisse offline und werten Sie sie im Batch aus, um Kosten zu sparen.
- Version Ihrer Datasets: Verfolgen Sie, welche Datasetversion welche Auswertungsergebnisse erzeugt hat.
Allgemeine Tipps
- Vergleichen Sie Die Auswertungen: Führen Sie die gleichen Daten über mehrere Auswertungen aus, um eine umfassende Ansicht zu erhalten.
- Nachverfolgen von Trends: Verwenden Sie den Auswertungsverlauf, um Leistungsverbesserungen oder Regressionen zu identifizieren.
- Reagieren Sie auf Ergebnisse: Verwenden Sie Auswertungserkenntnisse, um Agentaufforderungen, Tooldefinitionen und Konfigurationen zu verfeinern.
Verwandte Inhalte
Erfahren Sie mehr über die Auswertung ihrer generativen KI-Modelle und -Agents: