Optimizing foundation models
Evaluate Results
Dua cara paling umum untuk mengevaluasi model generative AI, dan kenapa biasanya keduanya dipakai:
| Human evaluation | Benchmark datasets | |
|---|---|---|
| Sifat | Kualitatif | Kuantitatif dan objektif |
| Mengukur | User experience, kesesuaian konteks, kreativitas dan fleksibilitas | Akurasi, kecepatan dan efisiensi, skalabilitas |
| Paling cocok untuk | Tuning berulang agar sesuai ekspektasi pengguna | Pengujian awal dan membandingkan model atau versi model |
Membuat benchmark dataset
- Subject matter expert (SME) menulis pertanyaan yang relevan dan menantang tentang topik atau dokumen.
- SME memberikan jawaban yang benar beserta konteks sumbernya.
- Model menjawab pertanyaan tersebut, lalu jawabannya dinilai terhadap jawaban SME.
Penilaiannya bisa diotomasi dengan LLM as a judge: LLM lain membandingkan jawaban model dengan jawaban benchmark.
Pendekatan gabungan
Benchmark menunjukkan kemampuan teknis, sedangkan manusia menunjukkan kegunaan di dunia nyata. AnyCompany menguji dengan benchmark sebelum production dan mengumpulkan rating manusia sesudahnya, agar model terus membaik.