Evaluacija jezičkih modela (LLM)

Izrađujemo sistem evaluacije koji pokazuje da li je funkcija s jezičkim modelom dovoljno dobra za puštanje u rad i da li je sljedeća promjena čini boljom ili gorom. Vaš tim može mijenjati modele, prepravljati prompte i dodavati funkcije, a iza svake odluke stoje dokazi.

Šta je to i kada odgovara.

LLM evaluacije su automatski testovi za ponašanje AI sistema. Skupove podataka pravimo od stvarnog korištenja i primjera koje su označili stručnjaci, dopunjavamo ih sintetičkim slučajevima za rijetke situacije i ocjenjujemo rezultate determinističkim provjerama, kriterijima koje ocjenjuje model i, gdje treba, pregledom čovjeka. Testovi rade u CI-ju kao regresijska provjera i nastavljaju raditi u upotrebi kroz uzorkovanje i praćenje.

Evaluacije se isplate čim funkcija s jezičkim modelom utiče na klijente, novac ili usklađenost s propisima, ili kada više ljudi mijenja prompte i modele. Za jednokratnu internu skriptu to je previše. Evaluacije dodajemo i postojećim sistemima koje su izradili drugi timovi, a to je često najbrži način da saznate zašto kvalitet varira.

Šta izrađujemo.

Kako teče rad.

  1. 01

    Šta je dobar rezultat

    Sa stručnjacima iz vaše oblasti kvalitet pretvaramo u konkretne kriterije koji se mogu ocijeniti, za svaki zadatak sistema.

  2. 02

    Izrada skupa podataka

    Sastavljamo stvarne i sintetičke slučajeve, označavamo ih i utvrđujemo početni rezultat postojećeg sistema.

  3. 03

    Uvezivanje u isporuku

    Testovi se pokreću u CI-ju i pri svakoj promjeni modela ili prompta, a vaš tim može čitati rezultate bez otvaranja Jupyter notebooka.

  4. 04

    Skup testova uvijek aktuelan

    Greške iz upotrebe i povratne informacije korisnika dodajemo kao nove slučajeve, pa skup testova prati kako se proizvod stvarno koristi.

Povezani projekti.

Tehnologije.

Sve tehnologije

Za dalje čitanje.

Česta pitanja.

Započnite saradnju s Vantionom.