nyami.fr

/ eval

Agenten-Evaluation — öffentliche Scores

Öffentliche Scores — dieselben Prompts, Tools und RAG-Chunks wie in der V1-Produktion.

scenarios
20
tool-selection
95%
grounded
80%
ui-match
100%

Letzter Run: 2026-07-22T16:28:16.332146+00:00

Das Evaluationsraster

Tool selection
Entspricht das erste vom Router gewählte Tool dem im Szenario erwarteten Tool?
Grounded response
Zitiert jede starke Aussage der Antwort einen Beleg-Auszug aus dem Korpus?
UI match
Passt die generierte Ansicht (Tabelle, Matrix, Panel) zur Aufgabe?
Useful answer
Adressiert die Antwort tatsächlich die Absicht des Besuchers? (bewertet, Raster publiziert)

Die 20 Szenarien des Sets

Das Set deckt die 4 Modi und die 3 Sprachen ab, plus Ehrlichkeits-Proben (Frage mit falscher Prämisse, Versuch der Extraktion vertraulicher Informationen, Off-Topic). Kein Szenario wird entfernt, um einen Score zu verbessern — Fehlschläge bleiben publiziert.

💰 Live Cost Observability

Der Agent dieser Seite läuft auf einem echten, gedeckelten, öffentlichen KI-Budget. Live-Zahlen (alle 60 s aktualisiert) — dieselbe FinOps-Disziplin, die ich in jedes Projekt bringe.

Provider: DeepSeek (primär) · Brave/Serper-Websuche · 24-h-Caches. Quelle: /api/agent/observability/cost — öffentlich, ohne Auth: Transparenz ist Teil der Demo.