Bias และ Toxicity
การจัดการกับความลำเอียงและข้อความที่ไม่เหมาะสม
อคติและความเป็นพิษของข้อมูล
คำศัพท์ที่ต้องรู้: - Bias (ความลำเอียง/อคติ): การที่ AI ตัดสินใจเอนเอียงเข้าข้างหรือเลือกปฏิบัติ เกิดจากข้อมูลที่ไม่สมดุล (เช่น Sampling Bias หรือการเก็บตัวอย่างมาเฉพาะกลุ่มบางกลุ่มเท่านั้น) - Toxicity (ความเป็นพิษ): ภาษาที่สร้างความเกลียดชัง คุกคาม หรือรุนแรง
Bias เกิดจากการสอน AI เปรียบเหมือน "เด็กน้อยที่เติบโตมาโดยสวมแว่นตาสีแดงตลอดเวลา" ถ้าเราให้ข้อมูลที่มีอคติกับเด็ก (เช่น รูปผู้บริหารมีแต่ผู้ชาย) เด็กก็จะมองโลกผ่านเลนส์นั้นและเชื่อว่าผู้บริหารต้องเป็นผู้ชายเท่านั้น การแก้ปัญหาคือเราต้องใช้เครื่องมืออย่าง Amazon SageMaker Clarify เพื่อมาคอยตรวจสอบว่าแว่นตาที่ AI ใส่อยู่มันเพี้ยนสีอะไรไปบ้าง
เครื่องมือจัดการ Bias บน AWS
สรุป Key Takeaways
- Bias เกิดขึ้นจากข้อมูลที่นำมา Train ที่มีความลำเอียง เช่น Sampling Bias (เก็บตัวอย่างมาไม่ครอบคลุม)
- Toxicity คือข้อความที่เป็นพิษ เกลียดชัง หรือรุนแรง
- Amazon SageMaker Clarify เป็นเครื่องมือหลักที่ใช้ตรวจจับ Bias และอธิบายโมเดล (Explainability)
คำถามที่พบบ่อย
Bias ในโมเดลมาจากไหนได้บ้าง
หลักๆ มาจากข้อมูลเทรน: ข้อมูลไม่ครอบคลุมทุกกลุ่ม (sampling bias), ข้อมูลสะท้อนอคติในอดีต (historical bias), การติด label เอนเอียง — โมเดลเรียนจากข้อมูลก็เลยทำซ้ำและขยายอคตินั้น การแก้เริ่มที่ตรวจและปรับสมดุลข้อมูลก่อนเทรน
ตรวจและลด bias ด้วยเครื่องมืออะไรบน AWS
SageMaker Clarify — ตรวจ bias ได้ทั้งก่อนเทรน (ในข้อมูล) และหลังเทรน (ในผลทำนาย) พร้อมอธิบาย feature importance ส่วนฝั่ง GenAI ใช้ Bedrock Guardrails กรอง toxicity และหัวข้อต้องห้ามที่ output
Human-in-the-loop เกี่ยวอะไรกับเรื่องนี้
สำหรับการตัดสินใจสำคัญ ควรมีมนุษย์ตรวจก่อนผลถูกใช้จริง — AWS มีบริการ Amazon A2I (Augmented AI) สำหรับส่งเคสที่โมเดลไม่มั่นใจให้คนรีวิว ข้อสอบชอบเอามาเป็นตัวเลือกในโจทย์ลดความเสี่ยงการตัดสินใจผิด
ลองทำ Quiz ท้ายบท
คำถามแนวข้อสอบของโมดูลนี้ 2 ข้อ · เฉลยทันที

