Developing ML solutions
Machine Learning Models Performance Evaluation
Dataset untuk evaluasi
- Training set untuk melatih model.
- Validation set untuk mengecek generalisasi selama model masih diperbaiki.
- Test set adalah pengecekan terakhir sebelum production.
Model fit
Bandingkan error di training data dan evaluation data:
- Underfitting: buruk di training data (bias tinggi).
- Overfitting: bagus di training data, buruk di evaluation data. Model menghafal alih-alih menggeneralisasi (variance tinggi).
- Balanced: bias rendah dan variance rendah.
Dengan analogi papan dart, bias adalah seberapa jauh lemparan dari tengah, dan variance adalah seberapa menyebar lemparannya.
Metrik classification
Dibangun dari confusion matrix: true positive (TP), false positive (FP), false negative (FN), dan true negative (TN).
| Metrik | Rumus | Pakai saat |
|---|---|---|
| Accuracy | (TP + TN) / semua prediksi | Kelasnya seimbang. Menyesatkan kalau true negative-nya banyak |
| Precision | TP / (TP + FP) | False positive mahal, misalnya spam filter yang menyembunyikan email asli |
| Recall (sensitivity) | TP / (TP + FN) | False negative mahal, misalnya melewatkan penyakit serius |
| F1 score | Harmonic mean dari precision dan recall | Butuh keseimbangan precision dan recall |
| AUC-ROC | Luas area di bawah kurva true positive rate vs false positive rate di berbagai threshold | Membandingkan model dan memilih threshold |
Metrik regression
- Mean squared error (MSE): rata-rata kuadrat error prediksi. Makin rendah makin bagus.
- R squared: porsi variance yang dijelaskan model, dari 0 sampai 1. Makin dekat ke 1 makin bagus.
Business metrics
- Kaitkan metrik model dengan KPI yang ditetapkan saat business goal identification, misalnya penjualan naik, biaya turun, atau churn berkurang.
- Pastikan metriknya mencerminkan toleransi bisnis terhadap error, dan pertimbangkan cost function untuk dampak ekonomi tiap jenis error.
- Bandingkan varian model di production dengan A/B testing atau canary deployment.