開始使用
用範例客服 Agent 跑完一次完整測試
這個範例會測試一個已存在的客服 Agent:從客服政策出題、讓 Agent 回答、檢查回答,到輸出報告。
開始前
- Python 3.10 以上。
- 已設定可用的 LLaDAR provider。它會用在產生題目和評估回答。
- 這個範例 Agent 只使用 Python 標準函式庫,不必另外安裝 Agent 的相依套件。
1. 安裝 LLaDAR
先取得專案並以可編輯模式安裝。下面的指令要在你想放置專案的目錄執行。
git clone https://github.com/stoday/LLaDAR.git
cd LLaDAR
python -m pip install -e .
2. 用客服政策建立題目
knowledge.md 是範例客服 Agent 應遵守的規則。這個指令會根據它建立測試資料,並寫入 artifacts/support-demo/dataset.json。
lladar create test-dataset --knowledge examples/support-demo-agent/knowledge.md --output artifacts/support-demo/dataset.json
想知道測試資料包含什麼,請看建立測試資料指南。
3. 讓範例 Agent 回答題目
LLaDAR 會讀取範例專案,找出如何把問題送給 Agent,先試跑確認,再執行所有題目。--no-interactive 表示使用已找到的做法直接執行,不在中途要求你選擇。
lladar run-agent --project examples/support-demo-agent --dataset artifacts/support-demo/dataset.json --output artifacts/support-demo/run.json --no-interactive
結果會寫入 run.json;LLaDAR 也會留下它如何執行 Agent 的紀錄。詳情請看執行 Agent 指南。
4. 檢查回答並產生報告
先逐題比較預期答案和 Agent 的回答,再把結果寫成報告。
lladar eval --dataset artifacts/support-demo/dataset.json --run artifacts/support-demo/run.json --output artifacts/support-demo/evaluation.json
lladar report --evaluation artifacts/support-demo/evaluation.json --output artifacts/support-demo/report.md
跑完後會看到什麼?
| 檔案 | 用途 |
|---|---|
dataset.json | 題目、預期答案,以及這次出題的記錄。 |
run.json | 每一題送給 Agent 的內容和 Agent 的實際回答。 |
interfaces.json、audit.json | LLaDAR 找到的執行方式,以及試跑是否成功。 |
evaluation.json | 每一題的檢查結果和總計。 |
report.md | 方便人閱讀和分享的結果報告。 |
試跑成功只代表 LLaDAR 真的能透過 Agent 對外提供的入口送出問題;要知道回答好不好,請看後面的逐題評估和報告。