ÕPPETUND 09 / 16 · 25 MIN · KESKTASE

AI-rakenduste ehitamine

Embeddings ja vektorotsing

Muuda tekstid võrreldavateks arvvektoriteks ja leia tähenduselt sarnane sisu koos vajalike filtritega.

AiKoodi tehisintellekti ja koodi abstraktne illustratsioon
AI-rakendus vajab kasutajaliidest, serverikihti ja läbimõeldud piire.
Õpieesmärk

Oskad selgitada vektori loomist, sarnasuse arvutamist ja seda, miks otsinguskoor ei ole vastuse tõesuse tõenäosus.

Embedding kirjeldab kasutuslikku sarnasust

Embedding-mudel teisendab teksti arvude jadaks. Lähedased vektorid viitavad mudeli järgi sarnasele sisule, kuid ei tõesta väite õigsust ega dokumentide samaväärsust.

„Kuidas arvet muuta?“ → [0.12, -0.44, 0.08, ...]
„Arve parandamise juhend“ → [0.10, -0.41, 0.11, ...]

// Tegelik vektor on tavaliselt palju pikem.
// Sarnasusskoor ei ole tõesuse protsent.

Sisestus ja päring on kaks eraldi voogu

Dokumendi muutumisel puhastatakse tekst, luuakse lõigud ja vektorid ning salvestatakse metaandmed. Küsimuse ajal luuakse päringuvektor, rakendatakse õiguste filtrid ja leitakse lähimad kandidaadid.

  1. Normaliseeri dokument ja eemalda tarbetu kordus.
  2. Jaga sisu peatüki või mõtte järgi.
  3. Loo sama embedding-mudeliga vektor.
  4. Salvesta vektor ja metaandmed.
  5. Päringul filtreeri ning reasta kandidaadid.
  6. Anna edasi ainult sobiv arv lõike.

Filtrid annavad tähendusele piirid

Semantiliselt sarnane lõik võib olla vales keeles, aegunud või teise kliendi oma. Rakenda ligipääs, kehtivus, keel ja dokumenditüüp andmebaasipäringus enne tulemuse mudelile saatmist.

const results = await vectorStore.search(queryVector, {
  limit: 8,
  filter: {
    tenantId: session.tenantId,
    language: "et",
    status: "active"
  }
});

Mõõda leidmist eraldi vastusest

Koosta küsimuste kogum, kus tead õiget dokumenti. Mõõda, kas see jõuab esimeste kandidaatide hulka. Alles seejärel hinda koostatud vastuse täpsust ja viiteid.

PANE TÄHELE

Praktilised märkused

  • Lõigu optimaalne suurus sõltub dokumendi struktuurist ja küsimustest; testi mitut varianti.
  • Embedding-mudeli vahetamisel tuleb dokumentide vektorid tavaliselt sama mudeliga uuesti luua.
VÄLDI

Levinud vead

  • Ühe globaalse indeksi kasutamine ilma kliendi või õiguste filtrita.
  • Kõrge sarnasusskoori esitamine kasutajale kui kindel tõenäosus.
TEE NII

Hea tava

  • Salvesta vektori kõrval algtekst, päritolu ja filtri väljad.
  • Kasuta kindlat testküsimuste komplekti iga lõigustamise või mudeli muudatuse järel.
PROOVI ISE

Praktiline harjutus

Koosta kuus lühikest tekstilõiku ja viis päringut. Määra käsitsi iga päringu õige vaste ning kirjelda filtrid, mis välistavad vale keele, kliendi või aegunud sisu.

ARUTA JA KÜSI

Mis jäi lahtiseks?

Jaga harjutuse tulemust või küsi teema kohta avalikus AI-vestluses. Ära postita saladusi ega isikuandmeid.