AIF-C01 notes
Developing generative AI solutions

Evaluating an FM

Evaluasi mengecek apakah model memenuhi tujuan bisnis.

Tiga metode evaluasi

MetodeKelebihanKekurangan
Human evaluationStandar emas. Menilai koherensi, relevansi, faktualitas, dan kualitasLambat dan mahal untuk skala besar
Benchmark datasetsPerbandingan standar antarmodel dan dari waktu ke waktuBelum tentu sesuai use case spesifikmu
Automated metricsCepat dan scalable untuk iterasiMelewatkan nuansa dan belum tentu sejalan dengan penilaian manusia

Benchmark yang perlu diketahui:

  • GLUE: pemahaman bahasa (klasifikasi, Q&A, inference)
  • SuperGLUE: versi GLUE yang lebih sulit
  • SQuAD: question answering
  • WMT: machine translation

Metrik yang perlu diketahui

MetrikMengukurPaling cocok untuk
ROUGEOverlap antara teks hasil model dan referensi, fokus pada recallSummarization
BLEUPrecision n-gram terhadap referensiMachine translation
BERTScoreKemiripan makna memakai embeddings BERT dan cosine similarityGeneration apa pun yang lebih mementingkan makna daripada kata yang persis sama
PerplexitySeberapa baik model memprediksi token berikutnya (makin rendah makin bagus)Kualitas language model
F1 scoreKeseimbangan precision dan recallClassification dan entity recognition

Automated metrics memberi gambaran awal. Gabungkan dengan human evaluation untuk gambaran yang lengkap.

On this page