Test för system där svaret varierar, med eval, robusthet och säkerhet
När svaret kan formuleras på flera riktiga sätt behöver testningen se annorlunda ut. Utvärderingar, evals, mäter kvaliteten mot en testmängd med kända fall, där träffsäkerhet, relevans och fullständighet bedöms med både automatiska mått och mänsklig granskning. Robusthetstesterna prövar hur systemet hanterar ovanliga formuleringar, motstridiga instruktioner, andra språk och inmatningar som ligger utanför det tänkta området. Säkerhetsdelen omfattar prompt injection, försök att få systemet att lämna ut känslig information, och kontroll av att skyddsräcken håller. Till området hör också uppföljning av kostnad och svarstider, samt regressionstester som visar effekten när en modell eller promt byts ut.
Det här är ett område där vi arbetar dagligen, eftersom vi både bygger och förvaltar AI-lösningar i produktion. Våra testare och AI-specialister sätter upp evalsramverk med testmängder som växer i takt med att verkligheten visar nya fall, körda automatiskt i pipelinen så att en försämring syns direkt. Vi kombinerar automatiska mått med granskning av verksamhetens egna experter, vilket gör bedömningen relevant för den uppgift lösningen ska lösa. Att våra säkerhetsspecialister deltar gör att modellens egna sårbarheter prövas på samma allvar som annan kritisk funktion. Ni får mätbar kvalitet över tid, och trygghet i att AI-lösningen håller när den möter riktiga användare.