AWS Exam Hub
AIP-C01
GenAI Developer Pro
ภาพรวมบทเรียนฝึกทำทบทวนFlashcardsMock Examคลังข้อสอบสถิติ
ภาพรวมบทเรียนฝึกทำทบทวน
บทเรียนทั้งหมด
Evaluation & Troubleshootingบทที่ 14/16 · ~12 นาที

Evaluation: Model Eval, RAG Eval & LLM-as-a-Judge

วัดคุณภาพ GenAI อย่างเป็นระบบก่อนและหลังขึ้น production

ประเภท evaluation ใน Bedrockวัดอย่างไรเหมาะกับ

Automatic (programmatic)

metric มาตรฐาน: accuracy, robustness, toxicity บน built-in หรือ custom dataset

เทียบโมเดลเร็วๆ ราคาถูก

LLM-as-a-judge

ใช้ FM อีกตัวให้คะแนน correctness, completeness, helpfulness, faithfulness, harmfulness ฯลฯ

วัดคุณภาพเชิงความหมายในปริมาณมาก ใกล้เคียงคน

Human evaluation

ทีมของเราหรือ AWS-managed workforce ให้คะแนน

งานละเอียดอ่อน / ตัดสินด้วย domain expert

RAG evaluation (Knowledge Base)

retrieve-only: context relevance, coverage · retrieve+generate: correctness, faithfulness, citation precision

วัดทั้งการค้นหาและการตอบของ RAG

Metric ที่ควรรู้จัก
Metricใช้วัด

ROUGE

summarization (overlap กับคำตอบอ้างอิง)

BLEU

translation

BERTScore

ความคล้ายเชิงความหมาย

Faithfulness / Groundedness

คำตอบอิงจาก context จริงไหม (ตรวจ hallucination)

Context relevance / recall

สิ่งที่ retrieve มาเกี่ยวข้อง/ครบไหม

Task completion rate

agent ทำงานสำเร็จกี่ %

Continuous evaluation ใน CI/CD
ออกสอบบ่อย
  • เปรียบเทียบ 2 prompt / 2 โมเดล กับข้อมูลจริง → Bedrock model evaluation (หรือ A/B ด้วย Prompt Management variants)
  • วัดคุณภาพ RAG แบบอัตโนมัติ ไม่ต้องใช้คน → RAG evaluation + LLM-as-a-judge
  • กัน regression ก่อน deploy → golden dataset + automated quality gate
เช็กความเข้าใจ

ต้องการวัดว่าคำตอบของแชตบอต RAG 'แต่งข้อมูลที่ไม่มีในเอกสาร' บ่อยแค่ไหน โดยอัตโนมัติ metric ใดตรงที่สุด?

อ่านจบแล้ว? ลองทำข้อสอบเรื่องนี้เลย

การดึงความรู้ออกมาใช้ทันทีหลังอ่าน (retrieval practice) ช่วยให้จำได้นานขึ้นมาก

ฝึกข้อสอบเรื่องนี้
บทก่อนหน้า
Monitoring & Observability
บทถัดไป
Troubleshooting GenAI Apps