LLM-evaluaties voor je AI-toepassingen
We bouwen de evaluaties die laten zien of een LLM-functie goed genoeg is om live te gaan, en of de volgende wijziging haar beter of slechter maakt. Je team kan van model wisselen, prompts herschrijven en functies toevoegen, met bewijs achter elk besluit.
Wat het is en wanneer het past.
LLM-evaluaties zijn automatische tests voor het gedrag van AI. We bouwen testsets uit echt gebruik en uit voorbeelden die vakexperts hebben gelabeld, en vullen ze aan met synthetische cases voor zeldzame situaties. De output beoordelen we met vaste controles, rubrieken die een model toepast en, waar nodig, controle door mensen. De testset draait in CI als regressietest en blijft na livegang draaien via steekproeven en monitoring.
Evaluaties zijn de moeite waard zodra een LLM-functie gevolgen heeft voor klanten, geld of compliance, of als meerdere mensen prompts en modellen aanpassen. Voor een eenmalig intern script zijn ze te veel. We voegen ook evaluaties toe aan bestaande systemen van andere teams. Dat is vaak de snelste manier om te ontdekken waarom de kwaliteit wisselt.
Wat we bouwen.
Testsets
Zorgvuldig gekozen testcases uit logs en van vakexperts, gelabeld met de verwachte uitkomst en gegroepeerd per scenario.
Synthetische testsets
Gegenereerde vragen, documenten en randgevallen voor zeldzame situaties. Mensen controleren ze voordat ze in de testset komen.
Beoordeling door een model
Rubrieken waarmee een LLM beoordeelt of antwoorden trouw aan de bron, in de juiste toon en volledig zijn. We ijken ze tegen beoordelingen van mensen, zodat de scores iets betekenen.
Regressietests in CI
Evaluaties bij elke pull request, die een release tegenhouden als nauwkeurigheid, veiligheid of kosten over de afgesproken grenzen gaan.
Monitoring na livegang
Tracing, scores op een steekproef van live verkeer, meldingen bij afwijkingen en dashboards voor kwaliteit, snelheid en kosten per functie.
Hoe het werkt.
- 01
Bepalen wat goed is
Samen met je vakexperts vertalen we kwaliteit naar concrete criteria waarop je kunt scoren, voor elke taak die het systeem uitvoert.
- 02
De testset bouwen
We stellen echte en synthetische cases samen, labelen ze en doen een nulmeting van het huidige systeem.
- 03
Inbouwen in de ontwikkeling
De testset draait in CI en bij elke wijziging van model of prompt. Je team kan de resultaten lezen zonder een notebook te openen.
- 04
Actueel houden
Fouten uit de praktijk en feedback van gebruikers komen erbij als nieuwe cases. Zo volgt de testset hoe het product echt gebruikt wordt.
Gerelateerde cases.
Gebouwd met.
Alle technologieVerder lezen.
LLM evals: zo test je AI voor elke release
Een praktische aanpak voor LLM-evaluaties: bouw een testset uit echte zaken, combineer controles in code met beoordeling door een model en houd releases tegen die slechter scoren.
5 min leestijd
RAG evalueren: retrieval-metrics, faithfulness en golden sets
Zo meet je een RAG-systeem goed: houd retrieval en antwoorden apart, controleer faithfulness per bewering en bouw een golden set die je kunt vertrouwen.
5 min leestijd
Veelgestelde vragen.
Ja, en daar beginnen we vaak mee. We koppelen tracing, bouwen een testset uit je logs en doen een nulmeting. Zo zie je waar het systeem faalt voordat je besluit wat je aanpakt.
Ja, als ze geijkt zijn. We vergelijken de scores van het model met beoordelingen van mensen op een steekproef, scherpen rubrieken aan waar ze verschillen en houden vaste controles voor alles wat exact te controleren is, zoals velden, formaten en bronverwijzingen.
Dat hangt af van het aantal verschillende scenario's dat het systeem afhandelt. Een gerichte set goed gelabelde cases per scenario is nuttiger dan duizenden willekeurige voorbeelden. De set groeit mee als er in de praktijk nieuwe soorten fouten opduiken.
Ja. Draai je dezelfde testset op meerdere modellen, dan zie je de afweging tussen kwaliteit, snelheid en kosten voor jouw taak. Overstappen naar een andere aanbieder, een model in de EU of een open model wordt dan een onderbouwd besluit.