Evaluation: Model Eval, RAG Eval & LLM-as-a-Judge
วัดคุณภาพ GenAI อย่างเป็นระบบก่อนและหลังขึ้น production
| ประเภท evaluation ใน Bedrock | วัดอย่างไร | เหมาะกับ |
|---|---|---|
Automatic (programmatic) | metric มาตรฐาน: accuracy, robustness, toxicity บน built-in หรือ custom dataset | เทียบโมเดลเร็วๆ ราคาถูก |
LLM-as-a-judge | ใช้ FM อีกตัวให้คะแนน correctness, completeness, helpfulness, faithfulness, harmfulness ฯลฯ | วัดคุณภาพเชิงความหมายในปริมาณมาก ใกล้เคียงคน |
Human evaluation | ทีมของเราหรือ AWS-managed workforce ให้คะแนน | งานละเอียดอ่อน / ตัดสินด้วย domain expert |
RAG evaluation (Knowledge Base) | retrieve-only: context relevance, coverage · retrieve+generate: correctness, faithfulness, citation precision | วัดทั้งการค้นหาและการตอบของ RAG |
| Metric | ใช้วัด |
|---|---|
ROUGE | summarization (overlap กับคำตอบอ้างอิง) |
BLEU | translation |
BERTScore | ความคล้ายเชิงความหมาย |
Faithfulness / Groundedness | คำตอบอิงจาก context จริงไหม (ตรวจ hallucination) |
Context relevance / recall | สิ่งที่ retrieve มาเกี่ยวข้อง/ครบไหม |
Task completion rate | agent ทำงานสำเร็จกี่ % |
ต้องการวัดว่าคำตอบของแชตบอต RAG 'แต่งข้อมูลที่ไม่มีในเอกสาร' บ่อยแค่ไหน โดยอัตโนมัติ metric ใดตรงที่สุด?
การดึงความรู้ออกมาใช้ทันทีหลังอ่าน (retrieval practice) ช่วยให้จำได้นานขึ้นมาก