/ eval
Agent evaluation — public scores
Scores publics — mêmes prompts, mêmes tools, mêmes RAG chunks que la V1 en production.
- scenarios
- 20
- tool-selection
- 100%
- grounded
- 65%
- ui-match
- 80%
Last run: 2026-07-22T12:23:12.228460+00:00 · commit unknown
/ eval
Scores publics — mêmes prompts, mêmes tools, mêmes RAG chunks que la V1 en production.
Last run: 2026-07-22T12:23:12.228460+00:00 · commit unknown