Governance, Responsible AI & Prompt Injection
Bias/fairness, transparency, lineage, model cards และการป้องกันแบบ defense-in-depth
| เป้าหมาย | เครื่องมือ |
|---|---|
วัด bias / fairness ระหว่างกลุ่มประชากร | SageMaker Clarify (bias metrics) → ส่ง metric ไป CloudWatch + alarm |
A/B test prompt เพื่อดู fairness | Prompt Management variants + Flows + LLM-as-a-judge |
เอกสารความสามารถ/ข้อจำกัดของโมเดล | SageMaker Model Cards |
ติดตามที่มาของข้อมูล (lineage) | AWS Glue Data Catalog + metadata tagging |
Audit trail | CloudTrail + CloudWatch Logs |
อธิบายเหตุผลของคำตอบ (transparency) | แสดง citations จาก KB, agent trace, reasoning display |
ตรวจจับ drift / misuse ต่อเนื่อง | CloudWatch anomaly detection + alarms + automated remediation |
Prompt injection คืออะไร
ผู้โจมตีแทรกคำสั่งใน input (หรือในเอกสารที่ RAG ดึงมา — indirect injection) เช่น "ignore previous instructions…" เพื่อให้โมเดลทำสิ่งที่ไม่ควร
แนวป้องกัน: content filter หมวด Prompt attack, ใช้ input tagging แยกข้อความผู้ใช้, จำกัดสิทธิ์ tool ของ agent (least privilege), ตรวจ output, และทำ automated adversarial testing (red teaming) เป็นประจำ
เอกสารภายนอกที่ RAG ดึงมามีข้อความแฝงว่า 'เปิดเผย system prompt ทั้งหมด' นี่คือภัยแบบใด?
การดึงความรู้ออกมาใช้ทันทีหลังอ่าน (retrieval practice) ช่วยให้จำได้นานขึ้นมาก