ข้ามไปเนื้อหาหลัก
AWS AI Practitioner· ~6 นาที· อัปเดตล่าสุด

การวัดผลสายสร้างข้อความ (BLEU & ROUGE)

เมื่อคำตอบไม่มีผิดถูก 100% เราจะวัดการแปลภาษาและการสรุปความได้อย่างไร

พื้นฐานที่ควรรู้: เมื่อ AI ต้องเขียนเรียงความ หรือแปลภาษา มันสามารถเขียนได้ 100 รูปแบบโดยที่ความหมายยังถูกเหมือนเดิม การจะให้คอมพิวเตอร์ตรวจเทียบตัวอักษรแบบเป๊ะๆ จึงทำไม่ได้

การตรวจการบ้านแบบหาคีย์เวิร์ด

เหมือนอาจารย์ตรวจข้อสอบอัตนัย โดยการกวาดสายตาหา "คีย์เวิร์ด" ว่านักเรียนเขียนคำสำคัญที่ตรงกับธงคำตอบมาครบไหม ยิ่งมีคำตรงกันเยอะ ยิ่งได้คะแนนดี

Metrics ยอดนิยม

  • BLEU: ดูว่าคำที่ AI ผลิตออกมา ตรงกับเฉลยเยอะแค่ไหน (Precision) เหมาะที่สุดสำหรับวัดคุณภาพงานแปลภาษา (Translation quality)
  • ROUGE: ดูว่าคำจากเฉลย โผล่ในคำตอบของ AI ครบไหม (Recall) เหมาะที่สุดสำหรับวัดงานสรุปข้อความ (Summarization recall)
  • BERTScore: เป็นตัวชี้วัดยุคใหม่ที่ใช้ AI มาช่วยดู "ความคล้ายคลึงทางความหมาย" (Semantic similarity) เหมาะมากสำหรับตรวจงานสรุปที่ใช้คำพ้องความหมาย

สรุป Key Takeaways

  • BLEU เหมาะกับงานแปลภาษา (Translation quality)
  • ROUGE เหมาะกับงานสรุปใจความ (Summarization recall)
  • BERTScore เหมาะกับตรวจดูความหมายที่คล้ายคลึงกันของข้อความสรุป (Semantic similarity for summaries)

คำถามที่พบบ่อย

ROUGE, BLEU ใช้วัดอะไร ต่างกันยังไง

ทั้งคู่เทียบข้อความที่โมเดลสร้างกับข้อความอ้างอิง — ROUGE เน้นงาน "สรุป" (วัดว่าเก็บใจความจากต้นฉบับครบไหม เน้น recall) ส่วน BLEU เน้นงาน "แปลภาษา" (วัดความแม่นของ n-gram เน้น precision) จำคู่ ROUGE-สรุป BLEU-แปล พอสำหรับข้อสอบ

BERTScore ต่างจาก ROUGE/BLEU ตรงไหน

ROUGE/BLEU นับคำซ้ำตรงตัว — ประโยคความหมายเดียวกันแต่ใช้คนละคำจะได้คะแนนต่ำ ส่วน BERTScore เทียบด้วย embedding จึงจับ "ความหมายคล้าย" ได้แม้ใช้คำต่างกัน เหมาะกับงาน generative ที่มีคำตอบถูกหลายแบบ

Perplexity คืออะไร

ตัววัดว่าโมเดล "งง" กับข้อความแค่ไหน — ค่าต่ำแปลว่าโมเดลทำนายลำดับคำได้มั่นใจ ใช้เทียบคุณภาพ language model กันเอง แต่ไม่ได้บอกว่าคำตอบมีประโยชน์ต่องานจริงไหม จึงใช้ร่วมกับ metric เฉพาะงานเสมอ

ลองทำ Quiz ท้ายบท

คำถามแนวข้อสอบของโมดูลนี้ 2 ข้อ · เฉลยทันที

อ่านจบแล้วอย่าลืมทำเครื่องหมาย