Evaluacija jezičkih modela (LLM)
Izrađujemo sistem evaluacije koji pokazuje da li je funkcija s jezičkim modelom dovoljno dobra za puštanje u rad i da li je sljedeća promjena čini boljom ili gorom. Vaš tim može mijenjati modele, prepravljati prompte i dodavati funkcije, a iza svake odluke stoje dokazi.
Šta je to i kada odgovara.
LLM evaluacije su automatski testovi za ponašanje AI sistema. Skupove podataka pravimo od stvarnog korištenja i primjera koje su označili stručnjaci, dopunjavamo ih sintetičkim slučajevima za rijetke situacije i ocjenjujemo rezultate determinističkim provjerama, kriterijima koje ocjenjuje model i, gdje treba, pregledom čovjeka. Testovi rade u CI-ju kao regresijska provjera i nastavljaju raditi u upotrebi kroz uzorkovanje i praćenje.
Evaluacije se isplate čim funkcija s jezičkim modelom utiče na klijente, novac ili usklađenost s propisima, ili kada više ljudi mijenja prompte i modele. Za jednokratnu internu skriptu to je previše. Evaluacije dodajemo i postojećim sistemima koje su izradili drugi timovi, a to je često najbrži način da saznate zašto kvalitet varira.
Šta izrađujemo.
Skupovi podataka za evaluaciju
Odabrani testni slučajevi iz logova i od stručnjaka za vašu oblast, označeni očekivanim ishodom i grupisani po scenariju.
Sintetički testovi
Generisana pitanja, dokumenti i izuzeci za rijetke situacije. Ljudi ih pregledaju prije nego što uđu u skup testova.
Ocjenjivanje uz pomoć modela
Kriteriji za vjernost izvoru, ton i potpunost koje ocjenjuje jezički model, usklađeni s ocjenama ljudi da bi rezultati imali smisla.
Regresijske provjere u CI-ju
Evaluacije se pokreću na svakom pull requestu i blokiraju novu verziju kada tačnost, sigurnost ili trošak pređu granice koje dogovorimo.
Praćenje u radu
Praćenje poziva, ocjenjivanje uzorka stvarnih upita, upozorenja kada kvalitet počne padati i dashboardi za kvalitet, brzinu i trošak po funkciji.
Kako teče rad.
- 01
Šta je dobar rezultat
Sa stručnjacima iz vaše oblasti kvalitet pretvaramo u konkretne kriterije koji se mogu ocijeniti, za svaki zadatak sistema.
- 02
Izrada skupa podataka
Sastavljamo stvarne i sintetičke slučajeve, označavamo ih i utvrđujemo početni rezultat postojećeg sistema.
- 03
Uvezivanje u isporuku
Testovi se pokreću u CI-ju i pri svakoj promjeni modela ili prompta, a vaš tim može čitati rezultate bez otvaranja Jupyter notebooka.
- 04
Skup testova uvijek aktuelan
Greške iz upotrebe i povratne informacije korisnika dodajemo kao nove slučajeve, pa skup testova prati kako se proizvod stvarno koristi.
Povezani projekti.
Tehnologije.
Sve tehnologijeZa dalje čitanje.
LLM evaluacije prije svakog izdanja
Praktičan pristup LLM evaluacijama: skup testova iz stvarnih slučajeva, provjere u kodu uz ocjenjivanje modelom i blokiranje novih verzija koje su lošije.
4 min čitanja
Kako evaluirati RAG: metrike pretrage, vjernost izvoru i zlatni skup
Kako pravilno mjeriti RAG sistem: pretragu odvojite od odgovora, vjernost izvoru provjerite tvrdnju po tvrdnju i sastavite zlatni skup kojem možete vjerovati.
4 min čitanja
Česta pitanja.
Možemo, i to je čest početak. Povežemo praćenje, napravimo skup podataka iz vaših logova i početni rezultat, pa dobijete jasnu sliku gdje sistem griješi prije nego što odlučite šta ispraviti.
Jesu, kada su kalibrisane. Ocjene modela poredimo s ocjenama ljudi na uzorku, pooštravamo kriterije gdje se razilaze i zadržavamo determinističke provjere za sve što se može tačno provjeriti, kao što su polja, formati i navedeni izvori.
Zavisi od broja različitih scenarija koje sistem obrađuje. Manji skup dobro označenih slučajeva po scenariju korisniji je od hiljada nasumičnih primjera, a skup raste kako upotreba otkriva nove vrste grešaka.
Pomažu. Kada isti skup testova pokrenete na više modela, vidite razlike u kvalitetu, brzini i trošku za vaš zadatak. Tako prelazak na drugog dobavljača, model hostovan u EU ili otvoreni model postaje odluka zasnovana na mjerenju.