Die Bewertung von KI-Agenten sollte feststellen, ob ein Assistent eine vereinbarte Geschäftsaufgabe erledigt, und nicht nur, ob seine abschließende Nachricht überzeugend klingt. Behauptet ein Agent, einen Kundendatensatz aktualisiert zu haben, gehören die Abnahmenachweise sowohl ins Zielsystem als auch in den Gesprächsverlauf.
Bewerten Sie einen KI-Agenten anhand repräsentativer Aufgaben, ausdrücklicher Abnahmeregeln und unabhängig geprüfter Ergebnisse. Berücksichtigen Sie neben erfolgreichen Fällen auch Ablehnungen, Unsicherheit, Unterbrechungen und Übergaben an Menschen. Beziehen Sie die Freigabeentscheidung auf den getesteten Ablauf und die geprüfte Version statt auf einen einzigen Gesamtwert.
Nehmen wir einen Assistenten, der eine Änderung der Lieferadresse vorbereitet. Eine hilfreiche Vorführung zeigt vielleicht die richtige Adresse im Chatfenster. Eine hilfreiche Bewertung klärt, welcher Auftrag geändert wurde, wer dies autorisiert hat, ob die Lieferung bereits gesperrt war und was bei einer unklaren Antwort des Zielsystems geschah. Das sind unterschiedliche Fragen.
Die folgenden Beispiele sind vorgeschlagene Prüfkonzepte, keine Kundenergebnisse und kein veröffentlichter Benchmark. Sie helfen Geschäftsverantwortlichen, belastbare Nachweise zu beauftragen, bevor ein Agent weitere Aufgaben übernehmen darf.
Das Ergebnis für die Bewertung von KI-Agenten definieren
Beginnen Sie mit einer Aufgabe, die ein Kollege aus dem operativen Geschäft wiedererkennt. Beschreiben Sie Ausgangszustand, erlaubte Aktionen und akzeptierten Endzustand. Beim Beispiel der Adressänderung könnte die Abnahme einen zulässigen Auftrag, eine geprüfte neue Adresse, eine Genehmigung und einen übereinstimmenden Datensatz im Auftragssystem verlangen.
Anthropics Erläuterung zur Bewertung von Agenten unterscheidet zwischen Gesprächsverlauf und abschließendem Zustand der Umgebung. Diese Unterscheidung ist auch dann hilfreich, wenn Ihre Implementierung einen anderen Anbieter nutzt. Ein flüssiger Erfolgsbericht belegt etwas über die Antwort, ist aber kein unabhängiger Nachweis des Geschäftsergebnisses.
Verlangen Sie nicht, dass jeder gültige Durchlauf dieselben Formulierungen oder eine einzige Werkzeugfolge verwendet. Unterschiedliche Wege können zu einem akzeptablen Ergebnis führen. Unterscheiden Sie stattdessen zwingende Bedingungen von variablen Implementierungsdetails. Eine verbotene Datensatzänderung muss den Test scheitern lassen, selbst wenn die abschließende Antwort freundlich ist.
Benennen Sie einen Verantwortlichen für strittige Fälle. Sind sich Vertrieb, Finanzen und Betrieb über das richtige Ergebnis uneinig, kann eine automatische Bewertung ihre Geschäftsregeln nicht klären. Dokumentieren Sie diese Uneinigkeit als offene Anforderung, bevor Sie den Fall als Freigabekriterium verwenden.
Eine repräsentative Fallsammlung aufbauen
Sammeln Sie Beispiele aus dem tatsächlichen Ablauf und entfernen Sie anschließend unnötige personenbezogene Informationen. Nehmen Sie gewöhnliche Anfragen, zulässige problematische Werte und Fälle auf, in denen das System nachfragen sollte. Vermeiden Sie eine Testsammlung, die ausschließlich aus sauberen Beispielen des Entwicklers besteht, der den Agenten gebaut hat.
| Fallgruppe | Beispielsituation | Zu prüfender Nachweis |
|---|---|---|
| Reguläre Erledigung | Ein zulässiger Auftrag hat eine eindeutige neue Adresse | Korrekter Zieldatensatz und Bestätigung |
| Mehrdeutigkeit | Mehrere Aufträge passen zur Formulierung des Kunden | Rückfrage ohne Raten |
| Ablehnung gemäß Regelwerk | Der Versand hat den erlaubten Änderungszeitpunkt überschritten | Keine Änderung und eine hilfreiche Erklärung |
| Zugriffsgrenze | Die Anfrage bezeichnet den Auftrag einer anderen Organisation | Ablehnung ohne Offenlegung |
| Unklarer Vorgang | Eine Schreiboperation läuft nach der Übermittlung in ein Zeitlimit | Referenz zur Untersuchung und keine blinde Wiederholung |
| Übergabe an Menschen | Die Anfrage erfordert eine Ausnahmeentscheidung | Zugewiesener Warteschlangeneintrag mit genügend Kontext |
Betrachten Sie diese Matrix als Ausgangspunkt, nicht als Behauptung universeller Abdeckung. Ein Assistent für die Lohnabrechnung, ein internes Recherchewerkzeug und ein Kundenservice-Agent brauchen unterschiedliche Nachweise. Entscheidend ist, dass jeder Fall vor der Ausführung eine festgelegte geschäftliche Bedeutung hat.
Erkundungsfälle von Abnahmefällen trennen
Ein explorativer Fall kann einen neuen Fehler aufdecken, obwohl noch keine feste Bewertungsregel existiert. Das liefert wertvolle Erkenntnisse, sollte aber nicht stillschweigend die Definition einer bereits vereinbarten erfolgreichen Prüfung ändern. Halten Sie eine stabile Abnahmesammlung und eine getrennte Warteschlange für Fälle vor, die Untersuchung oder Regelentscheidungen benötigen.
Bewahren Sie Fälle auf, die echte Defekte aufgedeckt haben. Nach der Reparatur wird der Fall zur Regressionsprüfung. Ergänzen Sie neue Beispiele, wenn der Einsatzumfang wächst, statt die alte Sammlung immer wieder an die neueste Ausgabe anzupassen.
Festlegen, wie jedes Ergebnis geprüft wird
Nutzen Sie deterministische Prüfungen für tatsächlich deterministische Fakten. Eine Zielkennung, ein unverändertes geschütztes Feld oder das Ausbleiben einer unautorisierten Schreiboperation lassen sich häufig direkt prüfen. Ein bewertendes Modell kann bei der Beurteilung der Erklärungsqualität helfen, sollte aber nicht allein darüber entscheiden, ob Geld bewegt oder ein Datensatz geändert wurde.
| Bewertungsmethode | Geeignet für | Zu behandelnde Einschränkung |
|---|---|---|
| Prüfung des Zielzustands | Identität, Zustand und erlaubte Datensatzänderungen | Erfordert zuverlässigen Zugang zur Testumgebung |
| Regelbasierte Validierung | Pflichtfelder und verbotene Operationen | Kann nicht jede sinnvolle Erklärung beurteilen |
| Menschliche Prüfung | Unklare Regeln und hilfreiche Übergaben | Braucht schriftliche Kriterien und Prüfzeit |
| Modellgestützte Prüfung | Kategorisierung oder Vergleich freier Antworten | Muss anhand vertrauenswürdiger Beispiele kalibriert werden |
Dokumentieren Sie, warum eine Prüfung existiert. Ein Zeichenfolgenvergleich, der eine bestimmte Entschuldigung belohnt, kann eine durchaus hilfreiche Antwort ablehnen. Ein Schema, das die erwarteten Feldnamen akzeptiert, kann dennoch den falschen Kunden akzeptieren. Die Objektanleitung von JSON Schema erklärt strukturelle Validierung; geschäftliche Korrektheit erfordert zusätzliche Prüfbedingungen.
Bitten Sie Prüfer bei subjektiven Antworten, den Mangel zu beschreiben, statt lediglich einen Wert auszuwählen. War die Antwort unbelegt, verwirrend, unvollständig oder außerhalb der Befugnisse des Nutzers? Unterschiedliche Kategorien erleichtern die Begründung der nächsten technischen Änderung und die Wiederholung der nächsten Prüfung.
Testumgebung und Versionen kontrollieren
Ein wiederholbarer Fall braucht mehr als einen gespeicherten Prompt. Erfassen Sie die Agentenimplementierung, relevante Anweisungen, Werkzeugdefinitionen, Modellkonfiguration und Ausgangsdaten. Ändert sich ein vorgelagerter Datensatz zwischen den Durchläufen, kann das Ergebnis aus einem berechtigten Grund abweichen, der nichts mit der Agentenänderung zu tun hat.
Verwenden Sie ein kontrolliertes Ziel für Operationen mit geschäftlichen Auswirkungen. Setzen Sie den Ausgangszustand gezielt zurück oder erstellen Sie ihn neu. Ein zweiter Durchlauf gegen einen bereits im ersten Durchlauf geänderten Datensatz ist ein anderer Test, selbst wenn die natürlichsprachliche Anfrage identisch bleibt.
Mehr als einen Versuch prüfen
Das Verhalten eines Agenten kann zwischen Versuchen variieren. Entscheiden Sie vorab, wie wiederholte Durchläufe in die Abnahme einfließen, und bewahren Sie alle Ergebnisse auf. Wer nur den besten Durchlauf berichtet, verhindert, dass der Verantwortliche die Inkonsistenz versteht. Behaupten Sie umgekehrt auch keine Gewissheit aufgrund weniger erfolgreicher Beispiele.
Vereinbaren Sie ein praktikables Prüfbudget. Manche Fälle lassen sich bei jeder Änderung eines Werkzeugvertrags ausführen; andere brauchen einen Fachprüfer oder eine teure Integrationsumgebung. Eine gestufte Testsammlung ermöglicht häufige, begrenzte Prüfungen und erhält zugleich eine breitere Freigabebewertung, wenn sich der Einsatzumfang ändert.
Fehler und Übergaben zu hilfreichen Ergebnissen machen
Eine Ablehnung kann das richtige Ergebnis sein. Ein Agent, der bei einem mehrdeutigen Auftrag anhält, kann hilfreicher sein als einer, der die falsche Änderung abschließt. Definieren Sie akzeptable Rückfragen, Eskalationen und manuelle Fortsetzung, damit die Bewertung nicht die Erledigung um jeden Preis belohnt.
Prüfen Sie Übergabedatensätze ebenso sorgfältig wie abgeschlossene Operationen. Sie sollten die ursprüngliche Anfrage, die relevante Zielreferenz, die offene Frage und die zuständige Warteschlange benennen. Eine pauschale Aufforderung, den Support zu kontaktieren, kann den Kollegen zwingen, die Untersuchung von vorn zu beginnen.
Trennen Sie die Bewertung von der umfassenderen Sicherheitsprüfung. OWASP ASVS liefert eine Grundlage zur Verifizierung von Anwendungssicherheitsanforderungen. Unser Leitfaden zur Sicherheit von KI-Agenten behandelt Berechtigungen und feindliche Eingaben. Eine Ablaufbewertung sollte diese Grenzen berücksichtigen; ein gutes Ergebnis bei der Aufgabenerledigung ist jedoch keine vollständige Sicherheitsgarantie.
Entscheiden, was die Freigabe stoppt
Schreiben Sie Stoppbedingungen vor der Vorführung auf. Eine Offenlegung zwischen Kunden oder eine unautorisierte Schreiboperation kann unabhängig von der durchschnittlichen Aufgabenerledigung einen Stopp rechtfertigen. Eine verwirrende, aber behebbare Erklärung kann stattdessen einen engeren Umfang oder einen überwachten Pilotbetrieb erfordern. Die Schwere ergibt sich aus den geschäftlichen Auswirkungen.
Berichten Sie Ergebnisse sowohl nach Fallgruppe als auch insgesamt. Ein starkes Gesamtergebnis kann schwaches Wiederherstellungsverhalten verbergen, wenn die meisten Beispiele reguläre Abfragen sind. Geben Sie neben jedem Gesamtwert die Anzahl und Art der getesteten Fälle, offene Fehler, Meinungsverschiedenheiten bei der Prüfung und bekannte Ausschlüsse an.
Die Abnahme sollte für einen bestimmten Umfang und eine bestimmte Version gelten. Erfolgreiche schreibgeschützte Auftragsauskünfte belegen keine Eignung zur Auftragsänderung. Ein neues Zielsystem, eine neue Nutzergruppe oder ein neues Schreibwerkzeug ändert die Einsatzgrenze und sollte eine gezielte Überprüfung der Fallsammlung auslösen.
Führen Sie ein Freigabeprotokoll, das ein anderes Teammitglied verstehen kann. Es sollte erklären, was geprüft wurde, was scheiterte, was geändert wurde und warum der Verantwortliche die verbleibenden Einschränkungen akzeptiert hat. Ein unerklärtes grünes Dashboard ist eine schlechte Übergabe, wenn der ursprüngliche Prüfer nicht verfügbar ist.
Nachweise und laufende Pflege budgetieren
Fordern Sie ein klar abgegrenztes Angebot in GBP für Testkonzeption, kontrollierte Umgebungen, Implementierung, Prüfung und Berichterstattung an. Trennen Sie diese Anfangsarbeiten von wiederkehrenden Prüfläufen und der Fallpflege nach Änderungen der Geschäftsregeln. Ohne Kenntnis des Ablaufs gibt es keinen vertretbaren universellen Preis pro Bewertung.
| Arbeitspaket | Angeforderter Liefergegenstand | Offenzulegende Kostenannahme |
|---|---|---|
| Fallkonzeption | Repräsentative Fälle und vereinbarte Ergebnisse | Verfügbarkeit der Ablaufverantwortlichen |
| Testinfrastruktur | Kontrollierte Ausgangszustände und Ergebniserfassung | Zugang zu realistischen Zielumgebungen |
| Bewertung | Prüfbedingungen und dokumentierte Prüfkriterien | Aufwand für Fachprüfung und Kalibrierung |
| Freigabenachweise | Fehleranalyse und Abnahmeprotokoll | Breite der Clients, Werkzeuge und Operationen |
| Pflege | Wiederholbare Prüfungen und Fallverantwortung | Häufigkeit von Modell-, Werkzeug- und Regeländerungen |
Die erste sinnvolle Investition ist oft eine schmale Testsammlung, die eine kostspielige Fehlerklasse erkennt. Ihr Wert liegt in der Entscheidung, die sie unterstützt, nicht in der Anzahl der Prompts in einer Tabelle. Vermeiden Sie den Kauf eines großen synthetischen Benchmarks, den niemand mit dem täglichen Betrieb verbinden kann.
Einen begrenzten Bewertungspiloten beauftragen
Bringen Sie eine Aufgabenbeschreibung, repräsentative geschwärzte Beispiele und den Zielzustand mit, der die Erledigung nachweist. Benennen Sie Operationen, die der Agent niemals ausführen darf, und die Kollegen, die mehrdeutige Fälle beurteilen. Vorhandene Vorfallbeispiele sind hilfreich, wenn ihre sensiblen Details angemessen behandelt werden können.
Unser klar abgegrenzter Pilot für KI-Integration kann mit dieser Aufgabe und ihren Abnahmenachweisen beginnen. Der erste Umfang kann feststellen, ob Agent, Werkzeuge und Zielsystem zuverlässig zusammenarbeiten, bevor der Zugriff erweitert wird.
Senden Sie uns den Ablauf und die anstehende Freigabeentscheidung . Verlangen Sie eine wiederholbare Prüfsammlung, eine Darstellung ihrer blinden Flecken und eine klare Übergabe. Der Liefergegenstand sollte Ihnen helfen zu entscheiden, welche nächste Aufgabe Sie dem Agenten sicher anvertrauen können.
Häufig gestellte Fragen
Was ist die Bewertung von KI-Agenten? Die Bewertung von KI-Agenten prüft einen Agenten anhand definierter Aufgaben und Abnahmeregeln. Sie untersucht den resultierenden Systemzustand, die erlaubten Operationen und die Qualität von Erklärungen oder Übergaben, statt eine überzeugende Abschlussnachricht als Erledigungsnachweis zu behandeln.
Reicht ein Benchmarkwert zur Freigabe eines Geschäftsagenten? Nein. Ein allgemeiner Benchmark kann technische Vergleiche unterstützen, aber die Freigabeabnahme braucht Fälle, die Ihre Datensätze, Berechtigungen, Fehlerarten und Geschäftsregeln abbilden. Berichten Sie den getesteten Umfang und ungelöste Einschränkungen.
Wie viele Testfälle brauchen wir? Es gibt keine universelle Anzahl. Beginnen Sie mit den unterschiedlichen Ergebnissen und wichtigen Fehlerpfaden des vorgeschlagenen Ablaufs. Ergänzen Sie Fälle, wenn neue Werkzeuge, Nutzergruppen oder Regelausnahmen wesentlich anderes Verhalten erzeugen. Eine große Sammlung fast identischer Prompts ist nicht dasselbe wie eine breite operative Abdeckung.
Kann ein anderes Modell die Antworten bewerten? Ja, für geeignete Teile der Prüfung. Kalibrieren Sie es anhand von Beispielen, die fachkundige Menschen geprüft haben, und behalten Sie deterministische Zielprüfungen für Fakten wie den tatsächlich geänderten Datensatz bei. Das Modellurteil sollte keinen Nachweis einer Geschäftsoperation ersetzen.
Sollte eine korrekte Ablehnung als Erfolg gelten? Ja, wenn die Ablehnung das erwartete Ergebnis ist. Definieren Sie, was eine hilfreiche Ablehnung aussagt, und bestätigen Sie, dass keine verbotene Operation oder Offenlegung stattgefunden hat.
Brauchen wir produktive Kundendaten? Normalerweise sollten Sie mit kontrollierten Beispielen beginnen, die die relevante Struktur und problematische Fälle ohne unnötige personenbezogene Informationen erhalten. Jede Verwendung von Echtdaten braucht einen ausdrücklichen Zweck, angemessenen Zugriff und Regeln für die Verarbeitung. Repräsentatives Verhalten ist wichtiger, als eine vollständige Produktionsdatenbank in die Bewertungsumgebung zu kopieren.
Was sollte ein Bewertungsdienstleister übergeben? Die Fallsammlung, erwartete Ergebnisse, Anweisungen zum Ausgangszustand, Bewertungsregeln, Versionsaufzeichnungen und Fehlernachweise. Dazu gehören die Befehle oder das Verfahren zur Wiederholung der Prüfung und ein Verantwortlicher für ihre Aktualisierung.
Wann sollten wir die Testsammlung erneut ausführen? Wiederholen Sie relevante Prüfungen nach Änderungen an Modellen, Anweisungen, Werkzeugen, Berechtigungen oder dem Verhalten des Zielsystems. Prüfen Sie die Abdeckung, wenn die Geschäftsaufgabe wächst. Das bisherige Abnahmeergebnis gilt für den bisherigen getesteten Umfang.