nyami.fr

/ eval

Évaluation de l'agent — scores publics

Scores publics — mêmes prompts, mêmes tools, mêmes RAG chunks que la V1 en production.

scenarios
20
tool-selection
95%
grounded
80%
ui-match
100%

Dernier run : 2026-07-22T16:28:16.332146+00:00

La grille d'évaluation

Tool selection
Le premier tool choisi par le routeur correspond-il au tool attendu du scénario ?
Grounded response
Chaque affirmation forte de la réponse cite-t-elle un extrait de preuve du corpus ?
UI match
La vue générée (tableau, matrice, panneau) correspond-elle à la tâche ?
Useful answer
La réponse traite-t-elle réellement l’intention du visiteur ? (jugé, grille publiée)

Les 20 scénarios du set

Le set couvre les 4 modes et les 3 langues, plus des sondes d'honnêteté (question à fausse prémisse, tentative d'extraction d'informations confidentielles, hors-sujet). Aucun scénario n'est retiré pour améliorer un score — les échecs restent publiés.

💰 Live Cost Observability

L'agent de ce site tourne sur un budget IA réel, plafonné et public. Chiffres live (rafraîchis toutes les 60 s) — la même discipline FinOps que je mets dans chaque projet.

Providers : DeepSeek (primaire) · recherche web Brave/Serper · caches 24 h. Source : /api/agent/observability/cost — public, sans auth : la transparence fait partie de la démo.