Optimizing foundation models
Model Evaluation
Tiga metrik yang membandingkan teks hasil model dengan teks referensi buatan manusia:
| Metrik | Mengukur | Fokus | Paling cocok untuk |
|---|---|---|---|
| ROUGE | Overlap kata, n-gram, atau sequence dengan referensi | Recall: seberapa banyak informasi penting yang tertangkap | Summarization (juga terjemahan) |
| BLEU | Precision n-gram terhadap terjemahan referensi, dengan brevity penalty untuk output yang terlalu pendek | Precision | Machine translation |
| BERTScore | Cosine similarity dari contextual embeddings BERT | Kemiripan makna: mengenali parafrase dan sinonim | Tugas apa pun yang lebih mementingkan makna daripada kata yang persis sama |
Varian ROUGE
- ROUGE-N: overlap n-gram (ROUGE-1 untuk kata tunggal, ROUGE-2 untuk pasangan kata). Mengukur kelancaran dan cakupan ide utama.
- ROUGE-L: longest common subsequence. Mengukur koherensi dan urutan.
Keterbatasan
- ROUGE dan BLEU bergantung pada kecocokan kata yang persis, jadi parafrase yang valid ikut dihukum.
- BLEU kesulitan menilai kelancaran dan tata bahasa.
- BERTScore sering dipakai bersama keduanya agar penilaiannya lebih lengkap.
Hasil AnyCompany
Deskripsi produk dan saran yang lebih baik menggerakkan business metrics:
- Conversion rate naik 15%, dengan rata-rata ROUGE 0,85.
- Average order value naik 20%, dengan BLEU 0,78.
- Customer retention naik 25%, dengan rata-rata BERTScore 0,90.