Ciclul de viață al modelelor AI: tracker ELO arată cum „prostesc” modelele flagship
Ați observat că un model AI nou după lansare funcționează mai prost? Trackerul ELO confirmă: nu e paranoia, ci un fapt bazat pe date.

Pentru dezvoltatori e senzație cunoscută: un model AI proaspăt lansat e bestie, iar după câteva săptămâni parcă l-au înlocuit. Un entuziast a decis să verifice științific și a construit un dashboard cu istoricul ratingurilor ELO ale modelelor flagship.
În loc să deseneze o „grămadă de spaghete” cu sute de versiuni, trackerul inteligent urmărește o singură curbă continuă pentru fiecare laborator AI major. Dinamica arată atât salturile bruște la lansarea unei generații noi, cât și degradarea lentă – exact acel „nerfing” pe care îl bănuiam. Da, prieteni, nu vă înșală simțurile: modelele chiar „prostesc” în timp.
Bonus: dashboardul e adaptat pentru mobil și are temă întunecată. Dar autorul recunoaște o zonă oarbă: Arena AI testează în mare parte API-uri, iar interfețele de chat pentru consumatori adaugă prompturi sistem grele, wrapper-e de siguranță sau, sub sarcină, înlocuiesc modelele cu versiuni cuantizate. Benchmarkurile API nu reflectă acest „nerfing” pe care îl simt utilizatorii obișnuiți.
Autorul caută seturi de date istorice ELO care să colecteze date de pe interfețele web, nu din API. Dacă aveți idei – bine ați venit în depozitul open source.
Comentariul studioului METABYTE: Și noi am observat că modelele „uită” abilitățile în timp – exact ca dezvoltatorii după concediu. Dacă aveți nevoie de un AI stabil, nu de unul care se poartă ca un student în sesiune, scrieți-ne, vă ajutăm să configurați monitorizarea.
URMATORUL PAS
Ti-a placut abordarea?
Aplicam aceleasi principii in proiectele clientilor: AI, automatizari, produse care nu se sting dupa lansare.