AIF-C01 notes
Optimizing foundation models

Retrieval-Augmented Generation

FM sendiri tidak tahu isi dokumen, manual, laporan, atau transaksi milik perusahaan. RAG mencari data perusahaan berdasarkan prompt dan menambahkan potongan yang paling relevan ke prompt sebagai konteks, sehingga jawabannya akurat dan up to date.

Cara kerjanya

  1. Embed: model ML mengubah dokumen, gambar, atau audio menjadi vector embeddings, yaitu angka di ruang n-dimensi. Hal yang berkaitan punya vektor yang berdekatan: "sea" dekat dengan "ocean" dan jauh dari "stapler".
  2. Store: vektor beserta metadata-nya disimpan di vector database yang dirancang untuk similarity search cepat di miliaran vektor.
  3. Retrieve: prompt juga di-embed, lalu database mengembalikan hasil terdekat dengan k-nearest neighbors (k-NN) atau cosine similarity.
  4. Generate: FM menjawab memakai prompt ditambah konteks yang diambil.

Opsi vector database di AWS

  • Amazon OpenSearch Service (provisioned)
  • Amazon OpenSearch Serverless
  • pgvector di Amazon RDS for PostgreSQL
  • pgvector di Amazon Aurora PostgreSQL-Compatible Edition
  • Amazon Kendra

Pada kasus AnyCompany, chatbot kini mengueri database berisi data perusahaan dan memberi jawaban yang kontekstual.

On this page