Scorul mediu al prompt-urilor LLM: de ce te păcălește și ce să faci în schimb
Să compari prompt-uri după media scorurilor e ca și cum ai alege un medic după media pacienților tratați – cifrele mint frumos.

Să zicem că ai două prompt-uri. Primul are media 6.8, al doilea – 7.4. Pare că al doilea e mai bun, nu? Ei bine, nu neapărat. Dacă te uiți mai atent, primul poate face față perfect cazurilor critice, iar al doilea le ratează complet, dar obține 10 la cereri simple. Media netezește totul, iar tu rămâi cu o falsă senzație de victorie.
Problema e că media aritmetică e ca salariul mediu în IT: unii iau 5000, alții 500 000, iar media e 50 000 – degeaba. Pentru prompt-urile LLM, variația scorurilor e mai importantă decât media. Un prompt poate da constant 7 din 10, altul – când 10, când 2. Pe care l-ați alege pentru producție? Exact, pe cel stabil, chiar dacă media lui e puțin mai mică.
Ce e de făcut? În loc de medie, folosiți percentile și analiza valorilor aberante. Uitați-vă la percentilele 10 și 90 – ele arată cum se comportă prompt-ul în cele mai proaste și mai bune cazuri. O altă abordare tare e evaluarea după cel mai prost scenariu: dacă prompt-ul a greșit măcar o dată, dați-i un steag roșu. În producție, LLM-ul va lucra nu cu utilizatori medii, ci cu toți.
Nu uitați de segmentarea pe tipuri de cereri. Împărțiți setul de test în categorii (complexe, simple, ambigue) și calculați metricile separat. Așa veți ști exact unde câștigă prompt-ul A și unde B – și veți lua o decizie informată, nu pe bază de ghicit.
Comentariul echipei METABYTE: La METABYTE am crezut și noi în medie, până când un prompt a trimis utilizatorului o rețetă de borș în loc de cod. Acum suntem prieteni cu percentilele și vă sfătuim și pe voi. Dacă aveți nevoie de ajutor cu LLM-urile – intrați la noi, avem ceai și prăjituri, fără temperaturi medii.
URMATORUL PAS
Ti-a placut abordarea?
Aplicam aceleasi principii in proiectele clientilor: AI, automatizari, produse care nu se sting dupa lansare.