使用指南

評估 Agent 的回答

先看每一題的回答是否符合預期,再把所有題目的結果整理成清楚的統計。

這一步在做什麼?

這個步驟會把每題的「預期答案」和「Agent 實際回答」放在一起檢查。你可以指定要檢查的重點,例如回答是否正確、有沒有遺漏重要限制,或有沒有說出文件不支持的內容。

lladar eval --dataset artifacts/dataset.json --run artifacts/run.json --output artifacts/evaluation.json

為什麼要分成「逐題判斷」和「最後統計」?

逐題判斷需要看文字內容;最後統計只需要把通過和未通過的題數加總。因此,LLaDAR 可以用評估流程處理每一題,然後由 Python 負責算總數和比例。這樣即使再次產生報告,統計方式也不會跟著改變。

想檢查自己在意的規則?

加入自己的 SKILL.md,可以定義評估時要特別看什麼。例如客服 Agent 的測試可以要求:退款時限必須正確、不能承諾政策中沒有的例外、資訊不足時要請使用者補充資料。

如何閱讀結果?

先看 evaluation.json 的每一題,確認判斷理由是否合理;再看總計,了解常在哪些類型的問題失敗。不要只看通過率:少數很重要的規則答錯,也可能需要優先修正。

範例

在客服 Agent 範例中,評估會檢查 Agent 是否依照客服政策回答退貨、出貨與退款問題。