使用指南
評估 Agent 的回答
先看每一題的回答是否符合預期,再把所有題目的結果整理成清楚的統計。
這一步在做什麼?
這個步驟會把每題的「預期答案」和「Agent 實際回答」放在一起檢查。你可以指定要檢查的重點,例如回答是否正確、有沒有遺漏重要限制,或有沒有說出文件不支持的內容。
lladar eval --dataset artifacts/dataset.json --run artifacts/run.json --output artifacts/evaluation.json
為什麼要分成「逐題判斷」和「最後統計」?
逐題判斷需要看文字內容;最後統計只需要把通過和未通過的題數加總。因此,LLaDAR 可以用評估流程處理每一題,然後由 Python 負責算總數和比例。這樣即使再次產生報告,統計方式也不會跟著改變。
想檢查自己在意的規則?
加入自己的 SKILL.md,可以定義評估時要特別看什麼。例如客服 Agent 的測試可以要求:退款時限必須正確、不能承諾政策中沒有的例外、資訊不足時要請使用者補充資料。
如何閱讀結果?
先看 evaluation.json 的每一題,確認判斷理由是否合理;再看總計,了解常在哪些類型的問題失敗。不要只看通過率:少數很重要的規則答錯,也可能需要優先修正。
範例
在客服 Agent 範例中,評估會檢查 Agent 是否依照客服政策回答退貨、出貨與退款問題。