AIF-C01 notes
Optimizing foundation models

Model Evaluation

Tiga metrik yang membandingkan teks hasil model dengan teks referensi buatan manusia:

MetrikMengukurFokusPaling cocok untuk
ROUGEOverlap kata, n-gram, atau sequence dengan referensiRecall: seberapa banyak informasi penting yang tertangkapSummarization (juga terjemahan)
BLEUPrecision n-gram terhadap terjemahan referensi, dengan brevity penalty untuk output yang terlalu pendekPrecisionMachine translation
BERTScoreCosine similarity dari contextual embeddings BERTKemiripan makna: mengenali parafrase dan sinonimTugas apa pun yang lebih mementingkan makna daripada kata yang persis sama

Varian ROUGE

  • ROUGE-N: overlap n-gram (ROUGE-1 untuk kata tunggal, ROUGE-2 untuk pasangan kata). Mengukur kelancaran dan cakupan ide utama.
  • ROUGE-L: longest common subsequence. Mengukur koherensi dan urutan.

Keterbatasan

  • ROUGE dan BLEU bergantung pada kecocokan kata yang persis, jadi parafrase yang valid ikut dihukum.
  • BLEU kesulitan menilai kelancaran dan tata bahasa.
  • BERTScore sering dipakai bersama keduanya agar penilaiannya lebih lengkap.

Hasil AnyCompany

Deskripsi produk dan saran yang lebih baik menggerakkan business metrics:

  • Conversion rate naik 15%, dengan rata-rata ROUGE 0,85.
  • Average order value naik 20%, dengan BLEU 0,78.
  • Customer retention naik 25%, dengan rata-rata BERTScore 0,90.

On this page