Kratak odgovor
Ako želite da jezički model odgovara iz dokumenata, podataka ili pravila vaše kompanije, gotovo uvijek vam treba RAG (retrieval-augmented generation, odgovaranje iz pronađenih dokumenata). Ako želite da se model drugačije ponaša, na primjer da poštuje strog format izlaza, piše u stilu vaše kuće ili jeftino obavlja uzak zadatak klasifikacije, može pomoći fine-tuning (dodatno treniranje modela). Mnogi timovi prvo posegnu za fine-tuningom jer zvuči kao da model uči o poslovanju, a onda otkriju da loše barata činjenicama.
Ovaj članak je za poslovne i produktne rukovodioce koji odlučuju kako prilagoditi jezički model (LLM), i za inženjere koji taj kompromis trebaju objasniti. Opisujemo šta radi svaki pristup, dajemo tabelu za odluku i objašnjavamo kada ih kombinovati i koliko košta rad svakog od njih.
Šta rade RAG i fine-tuning
RAG ne mijenja model. Kada stigne pitanje, sistem pretraži vaše dokumente, najvažnije odlomke stavi u prompt i traži od modela da odgovori iz njih. Izmijenite dokument i sljedeći odgovor to već odražava. Svaki odgovor može navesti izvor, a prava pristupa mogu se primijeniti za svakog korisnika u trenutku pretrage.
Fine-tuning mijenja težine modela tako što ga dodatno trenira na primjerima ulaza i željenih izlaza. Model usvaja obrasce: format, ton, terminologiju i način rješavanja određene vrste zadatka. Činjenice ne uči pouzdano, i to ne na način koji možete ažurirati, citirati ili ograničiti. Sve što ipak usvoji ostaje zamrznuto u trenutku treniranja.
Koristan način razmišljanja:
- RAG mijenja šta model zna u trenutku odgovora.
- Fine-tuning mijenja kako model obično odgovara.
- Promptovanje, s jasnim uputama i primjerima, malo pomjera oboje i najmanje košta. Probajte ga prvo.
Tabela za odluku
| Vaš zahtjev | RAG | Fine-tuning |
|---|---|---|
| Odgovori iz internih dokumenata, pravila ili podataka o proizvodima | Odlično odgovara | Loše odgovara |
| Sadržaj se mijenja sedmično ili dnevno | Odlično odgovara: ponovo indeksirate izmjene | Loše odgovara: treba ponovno treniranje |
| Odgovori moraju navesti izvore | Odlično odgovara | Nema ugrađene podrške |
| Različiti korisnici smiju vidjeti različit sadržaj | Odlično odgovara: filtriranje pri pretrazi | Nema ugrađene podrške |
| Strog format izlaza ili stil kuće | Obično se postiže promptovanjem | Dobro odgovara kada promptovanje nije dovoljno |
| Uzak zadatak s velikim obimom, na primjer klasifikacija | Malo doprinosi | Dobro odgovara: manji dotrenirani model može biti jeftiniji i brži |
| Stručni rječnik s kojim osnovni model loše barata | Pomaže jer definicije stavlja u kontekst | Može pomoći, uz dovoljno kvalitetnih primjera |
U većini poslovnih primjena, kao što su interni asistenti za znanje, korisnička podrška, provjera pravila i odgovaranje na pitanja iz dokumenata, prevladavaju redovi na vrhu tabele. Zato je RAG naša polazna tačka, a fine-tuning razmatramo kasnije, iz konkretnih i mjerljivih razloga.
Kada kombinovati RAG i fine-tuning
Ova dva pristupa rade zajedno. Kombinacija ima smisla kada pretraga već radi, a ostane mjerljiv problem u ponašanju modela. Na primjer:
- Asistent za podršku pronalazi prave članke, ali odgovori moraju pratiti strogu strukturu koju promptovanje ne drži dosljedno.
- Proces s velikim obimom klasifikuje dokumente prije pretrage, a mali dotrenirani model taj korak obavlja za djelić troška velikog općeg modela.
- Embedding model ili reranker dotrenira se na parovima vaših upita i dokumenata, pa pretraga bolje razumije vašu terminologiju.
Posljednju opciju ljudi često previde. Fine-tuning komponenti za pretragu može poboljšati RAG sistem više od fine-tuninga modela koji piše odgovor, jer kvalitet pretrage određuje gornju granicu kvaliteta odgovora. Naš vodič o embeddingima i semantičkoj pretrazi pokriva tu stranu.
Trošak i održavanje
Trošak izrade je samo dio slike. Kroz nekoliko godina važno je koliko truda traži da svaki pristup ostane tačan.
| Vrsta troška | RAG | Fine-tuning |
|---|---|---|
| Početni rad | Unos dokumenata, chunking, pretraga, navođenje izvora i prava pristupa | Prikupljanje i čišćenje stotina do hiljada označenih primjera, plus treniranje |
| Ažuriranje sadržaja | Ponovno indeksiranje izmjena, uglavnom automatski | Ponovna izrada skupa podataka i treniranje |
| Nadogradnja modela | Zamijenite model i ponovo pokrenite evaluacije | Ponovno treniranje na novom osnovnom modelu, ili ostanak na starom |
| Trošak rada | Infrastruktura za pretragu i duži prompti | Hosting ili cijena po tokenu za dotrenirani model |
| Otklanjanje grešaka | Pregledate pronađene odlomke i vidite zašto je nastao odgovor | Teže, jer je ponašanje raspoređeno po težinama modela |
Red o nadogradnji modela zaslužuje pažnju. Opći modeli brzo napreduju, a RAG sistem obično može preći na bolji model izmjenom konfiguracije i ponovnim pokretanjem skupa testova. Dotrenirani model vas veže za svoj osnovni model dok ne uložite u ponovno treniranje.
Oba pristupa trebaju vlasnika i nakon puštanja u rad. Kod RAG-a to znači pratiti poslove unosa dokumenata, pregledati neuspjela pitanja i održavati skup testova ažurnim. Kod fine-tuninga to znači birati nove primjere za treniranje kako se zadatak mijenja i odlučiti kada se ponovno treniranje isplati.
Praktičan vodič za odluku
- 01Zapišite problem kao ishode: koja pitanja ili zadaci, za koga i kako ćete procijeniti dobar odgovor.
- 02Probajte dobro promptovanje sa sposobnim općim modelom i malim skupom testova, pa izmjerite.
- 03Ako odgovori trebaju vaše znanje, izradite RAG i odvojeno mjerite pretragu i odgovore, kako je opisano u članku kako evaluirati RAG.
- 04Ako neko ponašanje i nakon toga ne radi, a možete prikupiti dobre primjere, uradite fine-tuning za to ponašanje i uporedite rezultate na istom skupu testova.
- 05Odluku preispitajte kada se osnovni modeli promijene. Ono što je prošle godine trebalo fine-tuning, danas možda ne treba.
Ovim redom idemo kada s klijentima definišemo AI posao, i većina projekata završi s RAG-om i dobrim evaluacijama. Naš vodič za RAG chatbot u stvarnoj upotrebi ide dublje u izradu, a možete i zakazati razgovor da prođemo kroz vaš slučaj.