開始使用

用範例客服 Agent 跑完一次完整測試

這個範例會測試一個已存在的客服 Agent:從客服政策出題、讓 Agent 回答、檢查回答,到輸出報告。

開始前

1. 安裝 LLaDAR

先取得專案並以可編輯模式安裝。下面的指令要在你想放置專案的目錄執行。

git clone https://github.com/stoday/LLaDAR.git
cd LLaDAR
python -m pip install -e .

2. 用客服政策建立題目

knowledge.md 是範例客服 Agent 應遵守的規則。這個指令會根據它建立測試資料,並寫入 artifacts/support-demo/dataset.json。

lladar create test-dataset --knowledge examples/support-demo-agent/knowledge.md --output artifacts/support-demo/dataset.json

想知道測試資料包含什麼,請看建立測試資料指南。

3. 讓範例 Agent 回答題目

LLaDAR 會讀取範例專案,找出如何把問題送給 Agent,先試跑確認,再執行所有題目。--no-interactive 表示使用已找到的做法直接執行,不在中途要求你選擇。

lladar run-agent --project examples/support-demo-agent --dataset artifacts/support-demo/dataset.json --output artifacts/support-demo/run.json --no-interactive

結果會寫入 run.json;LLaDAR 也會留下它如何執行 Agent 的紀錄。詳情請看執行 Agent 指南。

4. 檢查回答並產生報告

先逐題比較預期答案和 Agent 的回答,再把結果寫成報告。

lladar eval --dataset artifacts/support-demo/dataset.json --run artifacts/support-demo/run.json --output artifacts/support-demo/evaluation.json
lladar report --evaluation artifacts/support-demo/evaluation.json --output artifacts/support-demo/report.md

跑完後會看到什麼?

檔案用途
dataset.json題目、預期答案,以及這次出題的記錄。
run.json每一題送給 Agent 的內容和 Agent 的實際回答。
interfaces.json、audit.jsonLLaDAR 找到的執行方式,以及試跑是否成功。
evaluation.json每一題的檢查結果和總計。
report.md方便人閱讀和分享的結果報告。

試跑成功只代表 LLaDAR 真的能透過 Agent 對外提供的入口送出問題;要知道回答好不好,請看後面的逐題評估和報告。