AIF-C01 notes
Developing ML solutions

Machine Learning Models Performance Evaluation

Dataset untuk evaluasi

  • Training set untuk melatih model.
  • Validation set untuk mengecek generalisasi selama model masih diperbaiki.
  • Test set adalah pengecekan terakhir sebelum production.

Model fit

Bandingkan error di training data dan evaluation data:

  • Underfitting: buruk di training data (bias tinggi).
  • Overfitting: bagus di training data, buruk di evaluation data. Model menghafal alih-alih menggeneralisasi (variance tinggi).
  • Balanced: bias rendah dan variance rendah.

Dengan analogi papan dart, bias adalah seberapa jauh lemparan dari tengah, dan variance adalah seberapa menyebar lemparannya.

Metrik classification

Dibangun dari confusion matrix: true positive (TP), false positive (FP), false negative (FN), dan true negative (TN).

MetrikRumusPakai saat
Accuracy(TP + TN) / semua prediksiKelasnya seimbang. Menyesatkan kalau true negative-nya banyak
PrecisionTP / (TP + FP)False positive mahal, misalnya spam filter yang menyembunyikan email asli
Recall (sensitivity)TP / (TP + FN)False negative mahal, misalnya melewatkan penyakit serius
F1 scoreHarmonic mean dari precision dan recallButuh keseimbangan precision dan recall
AUC-ROCLuas area di bawah kurva true positive rate vs false positive rate di berbagai thresholdMembandingkan model dan memilih threshold

Metrik regression

  • Mean squared error (MSE): rata-rata kuadrat error prediksi. Makin rendah makin bagus.
  • R squared: porsi variance yang dijelaskan model, dari 0 sampai 1. Makin dekat ke 1 makin bagus.

Business metrics

  • Kaitkan metrik model dengan KPI yang ditetapkan saat business goal identification, misalnya penjualan naik, biaya turun, atau churn berkurang.
  • Pastikan metriknya mencerminkan toleransi bisnis terhadap error, dan pertimbangkan cost function untuk dampak ekonomi tiap jenis error.
  • Bandingkan varian model di production dengan A/B testing atau canary deployment.

On this page