Referenz zu integrierten Evaluatoren

Important

In diesem Artikel markierte Elemente (Vorschau) befinden sich derzeit in der öffentlichen Vorschau. Diese Vorschau wird ohne Vereinbarung auf Serviceebene bereitgestellt und wird für Produktionsworkloads nicht empfohlen. Bestimmte Features werden möglicherweise nicht unterstützt oder weisen eingeschränkte Funktionen auf. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews.

Microsoft Foundry umfasst integrierte Bewerter, um die Qualität, Sicherheit und Zuverlässigkeit von KI-Antworten während des gesamten Entwicklungslebenszyklus zu bewerten. In dieser Referenz werden alle verfügbaren Bewerter, ihre Zwecke und Anleitungen zum Auswählen des richtigen Für Ihren Anwendungsfall aufgeführt. Sie können auch benutzerdefinierte Bewerter erstellen, die auf Ihre spezifischen Bewertungskriterien zugeschnitten sind.

Allgemeine Bewertungen

Auswerter Purpose
Kohärenz Misst logische Konsistenz und Reaktionsfluss.
Sprachfluss Misst qualität und Lesbarkeit der natürlichen Sprache.

Weitere Informationen finden Sie unter "Allgemeine Bewertungen".

Textbezogene Ähnlichkeitsbewertungen

Auswerter Purpose
Ähnlichkeit KI-unterstützte Textgleichheitsmessung.
F1-Bewertung Harmonisches Mittel der Präzision und Rückruf im Token überlappt zwischen Reaktion und Bodenwahrung.
BLEU Zweisprachige Bewertungs-Understudy-Bewertung für Übersetzungsqualitätsmaßnahmen überlappen sich in n-Gramm zwischen Reaktion und Bodenwahrung.
GLEU Google-BLEU Variante für Bewertungsmaße auf Satzebene überschneidet sich in n-Grammen zwischen Antwort und Ground Truth.
Rot Recall-Oriented Understudy for Gisting Evaluation Messgrößen überschneiden sich in n-Gramm zwischen Response und Ground Truth.
METEOR Metrik für die Auswertung der Übersetzung mit expliziten Sortierungsmaßen überlappen sich in n-Gramm zwischen Reaktion und Bodenwahrung.

Weitere Informationen finden Sie unter "Textbezogene Ähnlichkeitsbewertungen".

RAG-Gutachter

Auswerter Purpose
Abrufen Misst, wie effektiv das System relevante Informationen abruft.
Dokumentabruf Misst die Genauigkeit bei abrufergebnissen gegebener Bodenwahrheit.
Verankerung Misst, wie sich die Antwort im abgerufenen Kontext befindet. Gibt eine Bewertung von 1 bis 5 mithilfe eines modellbasierten Urteils zurück.
Geerdetheit Pro (Vorschau) Misst, ob die Antwort im abgerufenen Kontext mithilfe des Azure KI Inhaltssicherheit-Diensts geerdet wird. Gibt einen binären Pass/Fail zurück, ohne dass eine Modellbereitstellung erforderlich ist.
Relevanz Misst, wie relevant die Antwort in Bezug auf die Abfrage ist.
Antwort-Vollständigkeit (Vorschau) Maßnahmen, in welchem Umfang die Antwort abgeschlossen ist (keine kritischen Informationen fehlen) im Hinblick auf die Bodenwahrung.

Weitere Informationen finden Sie unter "Retrieval-Augmented Generation (RAG)-Evaluatoren".

Risiko- und Sicherheitsbewertungen

Auswerter Purpose
Hass und Unfairness Identifiziert voreingenommene, diskriminierende oder hassfähige Inhalte.
Sexuelle Identifiziert unangemessene sexuelle Inhalte.
Gewalt Erkennt gewaltsame Inhalte oder Aufregung.
Selbstverletzung Erkennt Inhalte, die Selbstschäden fördern oder beschreiben.
Geschützte Materialien Erkennt nicht autorisierte Verwendung urheberrechtlich geschützter oder geschützter Inhalte.
Indirekter Angriff (XPIA) Misst, ob die Antwort auf einen indirekten Jailbreak-Versuch fiel, der durch den abgerufenen Kontext injiziert wurde.
Code-Schwachstelle Identifiziert Sicherheitsprobleme im generierten Code.
Nicht fundierte Attribute Erkennt erstellte oder fehlerhafte Informationen, die von Benutzerinteraktionen abgeleitet werden.
Verbotene Aktionen Misst die Fähigkeit eines KI-Agents, verhaltensweisen zu interagieren, die explizit unzulässige Aktionen verletzen.
Vertrauliche Datenlecks Misst die Sicherheitsanfälligkeit eines KI-Agents, um vertrauliche Informationen verfügbar zu machen.

Weitere Informationen finden Sie unter Risiko- und Sicherheitsbewertungen.

Agentenbewerter

Auswerter Purpose
Aufgabentreue (Vorschau) Misst, ob der Agent anhand von systemanweisungen identifizierten Aufgaben folgt.
Vorgangsabschluss (Vorschau) Misst, ob der Agent den angeforderten Vorgang erfolgreich abgeschlossen hat.
Kundenzufriedenheit (Vorschau) Misst die ganzheitliche Benutzerzufriedenheit in einem Gespräch mit sechs Dimensionen: Hilfreichkeit, Vollständigkeit, Klarheit, Ton, Auflösung und Anpassungsfähigkeit.
Intent-Auflösung (Vorschau) Misst, wie genau der Agent Benutzerabsichten identifiziert und adressiert.
Effizienz der Vorgangsnavigation Bestimmt, ob die Sequenz der Schritte des Agents mit einem optimalen oder erwarteten Pfad übereinstimmt, um die Effizienz zu messen.
Genauigkeit des Toolaufrufs Misst die Gesamtqualität von Toolaufrufen, einschließlich Auswahl, Parameterkorrektur und Effizienz.
Toolauswahl Misst, ob der Agent die am besten geeigneten und effizientesten Tools für einen Vorgang ausgewählt hat.
Eingabegenauigkeit des Tools Überprüft, ob alle Parameter für Den Toolaufruf mit strengen Kriterien wie Erdung, Typ, Format, Vollständigkeit und Angemessenheit korrekt sind.
Toolausgabeverwendung Misst, ob der Agent Die Toolausgabe in Antworten und nachfolgenden Aufrufen ordnungsgemäß interpretiert und verwendet.
Erfolg des Toolaufrufs Wertet aus, ob alle Toolaufrufe ohne technische Fehler erfolgreich ausgeführt werden.
Quality Grader (Vorschau) Ermöglicht eine Qualitätsauswertung über mehrere Dimensionen hinweg – Relevanz, Abstention, Vollständigkeit, Erdheit und Kontextabdeckung – in einem einzelnen Evaluator, anstatt einzelne Auswertungen separat auszuführen.

Weitere Informationen finden Sie unter Agent-Bewertungen.

Rubrikenwerte (Vorschau)

Auswerter Purpose
Rubrik Bewertet eine Antwort oder mehrstufige Unterhaltung anhand von benutzerdefinierten, gewichteten Kriterien mithilfe eines LLM als Richter. Gibt eine gewichtete Durchschnittsbewertung normalisiert auf 0 bis 1 zurück, wobei die Grundlegung pro Dimension erfolgt.

Weitere Informationen finden Sie unter Rubrikenbewertungen.

Azure OpenAI-Grader

Auswerter Purpose
Modellbezeichner Klassifiziert Inhalte mithilfe von benutzerdefinierten Richtlinien und Bezeichnungen.
Zeichenfolgenüberprüfung Führt flexible Textüberprüfungen und Musterabgleiche durch.
Textähnlichkeit Wertet die Textqualität aus oder bestimmt die semantische Nähe.
Modellbewerter Generiert numerische Bewertungen (angepasster Bereich) für Inhalte basierend auf benutzerdefinierten Richtlinien.

Weitere Informationen finden Sie unter Azure OpenAI Graders.

Benutzerdefinierte Auswertungen (Vorschau)

Zusätzlich zu integrierten Bewertern können Sie benutzerdefinierte Bewerter erstellen, die auf Ihre spezifischen Bewertungskriterien zugeschnitten sind. Mit benutzerdefinierten Bewertern können Sie eindeutige Bewertungslogik, Validierungsregeln und Qualitätsmetriken definieren, die ihren geschäftlichen Anforderungen und anwendungsspezifischen Anforderungen entsprechen.

Weitere Informationen finden Sie unter "Benutzerdefinierte Auswertungen".

Bewertungsstufen

Jeder Evaluator unterstützt bestimmte Bewertungsstufen, die durch das supported_evaluation_levels Feld im Evaluatorkatalog angegeben werden:

Grad Description
turn Wertet einzelne Agentantworten aus (Standardeinstellung)
conversation Wertet ganze Multi-Turn-Unterhaltungen aus

Legen Sie beim Erstellen einer Auswertungsausführung fest evaluation_level , dass sie den unterstützten Ebenen Ihrer Evaluatoren entspricht. Wenn dies weggelassen wird, ist der Standardwert turn.

Evaluatoren auf Unterhaltungsebene bewerten die vollständige Interaktion anstelle einzelner Wendungen. Verwenden Sie sie, um Ergebnisse wie Benutzerzufriedenheit, Aufgabenabschluss über mehrere Schritte oder unterhaltungsweite Kohärenz zu messen.

Important

Alle Bewerter in einer Ausführung müssen den angegebenen evaluation_levelunterstützen. Sie können Evaluatoren nicht mit inkompatiblen Ebenen in derselben Auswertungsausführung kombinieren.

Kombinieren von Bewertern

Kombinieren Sie für eine umfassende Qualitätsbewertung mehrere Bewertungen:

  • RAG-Anwendungen: Abruf + Erdung + Relevanz + Inhaltssicherheit
  • Agent-Anwendungen: Tool-Anrufgenauigkeit + Aufgabenbefolgung + Absichtsauflösung + Rubrik + Inhaltssicherheit
  • Übersetzungsanwendungen: BLEU + METEOR + Fluency + Coherence
  • Alle Anwendungen: Fügen Sie Risiko- und Sicherheitsprüfer hinzu (Hass und Ungerechtigkeit, Sexualität, Gewalt Self-Harm) für verantwortungsvolle KI-Praktiken