使用指南
產生報告
把前面留下的測試資料、回答與評估結果整理成一份可閱讀、可回頭確認的報告。
基本用法
lladar report --evaluation artifacts/evaluation.json --output artifacts/report.md
--evaluation 指向上一階段產生的評估結果;--output 是報告要存放的位置。
報告會告訴你什麼?
- 這次測了什麼,以及整體通過情況。
- 哪些題目通過、哪些沒有通過,和各自的判斷理由。
- 統計結果是根據哪些逐題結果算出來的。
- 測試的範圍和限制,例如沒有測到哪些入口或情境。
把報告用在改善工作
報告不是只用來給一個分數。把未通過的題目分成幾類:是知識文件不清楚、Agent 沒有遵守規則、還是題目沒有涵蓋真正的使用情境?找出原因後,修改文件、Agent 或測試資料,再跑一次同樣流程,就能比較改善前後的差異。
需要團隊自己的報告格式?
可以用 SKILL.md 指定報告要包含的章節、語氣或審核欄位。即使改了呈現方式,逐題結果和統計仍會保留,讓讀者知道每個結論從哪裡來。
範例
客服 Agent 範例會輸出 artifacts/support-demo/report.md。你可以用它查看哪些客服規則最容易答錯。