Eval-Suiten sind nicht das Test-Modul am Ende — sie sind der Vertragstext mit der Maschine. Wer ohne Evals deployt, vereinbart nichts.
Drei Kategorien
- Functional Evals — prüfen, ob der Agent das tut, was er soll. Klassische Eingabe-Erwartung-Paare.
- Red-Team Evals — prüfen, ob der Agent sich gegen feindselige oder verwirrende Eingaben hält. Jailbreaks, Prompt-Injections, mehrdeutige Intents.
- Compliance Evals — prüfen, ob der Agent regulatorische oder organisatorische Vorgaben einhält. Datenschutz, Aussage-Verbote, Eskalations-Pfade.
)
)
)
)
)