Developing generative AI solutions
Evaluating an FM
Evaluasi mengecek apakah model memenuhi tujuan bisnis.
Tiga metode evaluasi
| Metode | Kelebihan | Kekurangan |
|---|---|---|
| Human evaluation | Standar emas. Menilai koherensi, relevansi, faktualitas, dan kualitas | Lambat dan mahal untuk skala besar |
| Benchmark datasets | Perbandingan standar antarmodel dan dari waktu ke waktu | Belum tentu sesuai use case spesifikmu |
| Automated metrics | Cepat dan scalable untuk iterasi | Melewatkan nuansa dan belum tentu sejalan dengan penilaian manusia |
Benchmark yang perlu diketahui:
- GLUE: pemahaman bahasa (klasifikasi, Q&A, inference)
- SuperGLUE: versi GLUE yang lebih sulit
- SQuAD: question answering
- WMT: machine translation
Metrik yang perlu diketahui
| Metrik | Mengukur | Paling cocok untuk |
|---|---|---|
| ROUGE | Overlap antara teks hasil model dan referensi, fokus pada recall | Summarization |
| BLEU | Precision n-gram terhadap referensi | Machine translation |
| BERTScore | Kemiripan makna memakai embeddings BERT dan cosine similarity | Generation apa pun yang lebih mementingkan makna daripada kata yang persis sama |
| Perplexity | Seberapa baik model memprediksi token berikutnya (makin rendah makin bagus) | Kualitas language model |
| F1 score | Keseimbangan precision dan recall | Classification dan entity recognition |
Automated metrics memberi gambaran awal. Gabungkan dengan human evaluation untuk gambaran yang lengkap.