Responsible Preparation for Datasets
Model yang bertanggung jawab butuh balanced dataset yang mewakili setiap kelompok yang relevan. Keseimbangan ini paling penting di bidang berisiko tinggi seperti rekrutmen, pinjaman, dan peradilan pidana. Tools-nya: SageMaker Clarify untuk menemukan ketidakseimbangan, SageMaker Data Wrangler untuk memperbaikinya.
Dua langkah menuju data yang seimbang
1. Pengumpulan data yang inklusif dan beragam
Kumpulkan dari sumber, sudut pandang, dan demografi yang beragam. Model yang dilatih kebanyakan dengan data orang paruh baya akan kurang akurat untuk orang yang lebih muda atau lebih tua. Keragaman penting untuk topik apa pun, bukan hanya data tentang manusia.
2. Data curation (labeling, pengorganisasian, dan preprocessing)
- Preprocessing: cleaning, normalisasi, dan feature selection untuk menghilangkan bias dan error.
- Augmentation: membuat contoh baru untuk kelompok yang kurang terwakili saat data aslinya tidak cukup.
- Regular auditing: terus periksa bahwa data tetap seimbang dan adil.
Seimbangkan sesuai use case
Keseimbangan bergantung pada tujuannya. Sistem tentang kanker pada anak harus dibangun dengan data anak-anak, bukan orang dewasa.