AIF-C01 notes
Optimizing foundation models

Evaluate Results

Dua cara paling umum untuk mengevaluasi model generative AI, dan kenapa biasanya keduanya dipakai:

Human evaluationBenchmark datasets
SifatKualitatifKuantitatif dan objektif
MengukurUser experience, kesesuaian konteks, kreativitas dan fleksibilitasAkurasi, kecepatan dan efisiensi, skalabilitas
Paling cocok untukTuning berulang agar sesuai ekspektasi penggunaPengujian awal dan membandingkan model atau versi model

Membuat benchmark dataset

  1. Subject matter expert (SME) menulis pertanyaan yang relevan dan menantang tentang topik atau dokumen.
  2. SME memberikan jawaban yang benar beserta konteks sumbernya.
  3. Model menjawab pertanyaan tersebut, lalu jawabannya dinilai terhadap jawaban SME.

Penilaiannya bisa diotomasi dengan LLM as a judge: LLM lain membandingkan jawaban model dengan jawaban benchmark.

Pendekatan gabungan

Benchmark menunjukkan kemampuan teknis, sedangkan manusia menunjukkan kegunaan di dunia nyata. AnyCompany menguji dengan benchmark sebelum production dan mengumpulkan rating manusia sesudahnya, agar model terus membaik.

On this page