
Test-Sets
Ein Test-Set ist eine Sammlung von Testfällen mit gemeinsamer Konfiguration. Jedes Test-Set definiert die Konversationsform, welche Checks angewendet werden und wie sich Tools während der Evaluierung verhalten sollen.Ein Test-Set erstellen
- Klicke im Tab Evals auf Neues Test-Set.

- Gib einen Namen für das Test-Set ein und wähle eine Konversationsform. Derzeit ist nur Einzelner Turn verfügbar.

- Wähle optional einen oder mehrere Checks zur Bewertung deiner Testfälle: KI-Prüfer, Tool-Check oder Keyword-Prüfung.

- Wenn du KI-Prüfer ausgewählt hast, wähle das Modell, das als Prüfer dienen soll.

- Klicke auf Test-Set erstellen.
Check-Typen
Checks definieren, wie jeder Testfall bewertet wird. Du wählst sie beim Erstellen eines Test-Sets aus, und sie gelten für jeden Fall in diesem Set.KI-Prüfer
Der KI-Prüfer vergleicht die tatsächliche Antwort deines Agenten mit einer erwarteten Antwort, die du für jeden Testfall definierst. Er verwendet ein Sprachmodell, um zu bewerten, ob die Antwort die Absicht und den Inhalt der erwarteten Antwort erfüllt, auch wenn die Formulierung abweicht. Du wählst beim Erstellen des Test-Sets, welches Modell als Prüfer dient.Tool-Check
Der Tool-Check überprüft, ob dein Agent die erwarteten Tools für einen bestimmten Prompt aufgerufen hat. Definiere die Tools, die du erwartest, und der Check bestätigt, ob der Agent sie während der Evaluierung verwendet hat. Dies ist nützlich für Agenten mit Integrations-Aktionen, bei denen der Aufruf des richtigen Tools genauso wichtig ist wie die Antwort selbst.Keyword-Prüfung
Die Keyword-Prüfung überprüft, ob die Antwort des Agenten Pflichttext enthält oder verbotenen Text vermeidet. Der Abgleich ist ein Teilstring-Vergleich ohne Beachtung der Groß- und Kleinschreibung, kein Wortabgleich. Im Gegensatz zum KI-Prüfer verwendet sie kein Modell und liefert ein deterministisches Ergebnis: bestanden oder nicht bestanden. Jeder Testfall hat zwei Felder für diesen Check: Muss enthalten und Darf nicht enthalten. Verwende sie für Compliance-Anforderungen, Markenrichtlinien oder alle Fälle, in denen bestimmte Begriffe in der Antwort vorkommen oder vermieden werden müssen.Testfälle
Nach dem Erstellen eines Test-Sets fügst du die einzelnen Testfälle hinzu, die evaluiert werden.Testfälle manuell hinzufügen
Klicke auf der Test-Set-Seite auf Fall hinzufügen, um einen einzelnen Testfall zu erstellen. Gib bei einem Agenten mit dem Input-Typ Prompt einen Prompt und die erwarteten Outputs ein, anhand derer deine ausgewählten Checks bewerten. Fülle bei einem Agenten mit dem Input-Typ Formular die konfigurierten Formularfelder des Agenten aus und übermittle die Werte für den Testfall.
Import per CSV
Klicke bei Agenten mit dem Input-Typ Prompt auf CSV importieren, um mehrere Fälle auf einmal zu laden. Die CSV benötigt die Spalteprompt. Sie kann außerdem die Spalten must_contain, must_not_contain, reference_answer und expected_tools enthalten.
CSV importieren und CSV exportieren für Testfälle sind nur für Agenten mit dem Input-Typ Prompt verfügbar. Diese Einschränkung gilt nicht für CSV herunterladen bei abgeschlossenen Durchlaufergebnissen.
Evals ausführen
Klicke oben rechts auf der Test-Set-Seite auf Ausführen, um die Evaluierung zu starten. Wähle einen oder mehrere Fälle aus und klicke auf Ausgewählte ausführen, um nur diese Teilmenge auszuführen. Nutze den Pfeil neben Ausführen, um den Standard des Test-Sets mit Im Testmodus ausführen oder Live ausführen zu überschreiben. Ergebnisse erscheinen live, sobald jeder Fall abgeschlossen ist, und zeigen Status, Prompt, Output, Grader-Ergebnisse und Dauer pro Fall.
Jeder Testfall verbraucht Nutzung auf die gleiche Weise wie eine reguläre Agenten-Konversation. Wenn KI-Prüfer aktiv ist, kommt bei einem Fall mit erwarteter Antwort zusätzlich ein eigener Prüfer-Modellaufruf hinzu. Pro Test-Set kann nur ein Durchlauf gleichzeitig aktiv sein, und jeder Workspace kann bis zu drei aktive Durchläufe haben.
Ergebnisse überprüfen
Sobald ein Fall abgeschlossen ist, klicke darauf, um die Detailansicht zu öffnen. Du kannst Folgendes überprüfen:
- Die vollständige Konversation zwischen Prompt und Agent
- Die Antwort des Agenten
- Token-Nutzung und Dauer
- Das Ergebnis jeder Bewertung, zum Beispiel bestanden, nicht bestanden oder unsicher
Tool-Ausführungsmodi
Der Tool-Ausführungsmodus bestimmt, ob die Tools deines Agenten während einer Evaluierung tatsächlich ausgeführt werden. Du konfigurierst dies im Bereich Erweitert beim Erstellen eines Test-Sets.
Wenn einer Aktion noch eine Verbindung fehlt, schlägt im Live-Modus ein Fall fehl, bevor der Agent startet.