IA pentru șarpe a doborât un record mondial eliminând o componentă cheie. Da, ați auzit bine
Un dezvoltator a scos PER din Rainbow DQN — și șarpele a început să joace mai bine. Uneori, mai puțin înseamnă mai mult.

Vă amintiți acel șarpe care înghițea pixeli pe Nokia 3310? Ei bine, urmașul său, antrenat cu o rețea neurală, tocmai a stabilit un nou record mondial. Dar partea amuzantă este că pentru asta a trebuit să scoată una dintre componentele cheie ale algoritmului.
Vorbim despre Rainbow DQN — un amestec de cele mai bune practici din deep reinforcement learning. De obicei, include Prioritized Experience Replay (PER), care ajută agentul să învețe din situații rare dar importante. Cu toate acestea, experimentul a arătat că pentru șarpe, PER a fost mai mult o piedică decât un ajutor. Fără el, agentul a acumulat mai multe puncte decât orice model cunoscut până acum.
De ce? Poate PER a supraîncărcat rețeaua cu evenimente rare care nu sunt atât de critice în contextul șarpelui. Sau poate redarea prioritară a experienței a împiedicat agentul să învețe pattern-uri simple. Oricum, este un exemplu excelent că în inginerie „clasic” nu înseamnă întotdeauna „optim”.
Pentru dezvoltatori: uneori cel mai bun mod de a îmbunătăți performanța este să dezactivați o funcție care pare de neînlocuit. Mai ales când lucrați cu resurse limitate (ca în jocuri sau dispozitive edge).
Comentariul studioului METABYTE: Și nouă ne place să experimentăm cu arhitecturi — dar de obicei nu pe șarpe, ci pe proiecte reale. Dacă agentul vostru AI începe să se comporte ciudat, poate e timpul să revedeți „setul standard”. Sau măcar să verificați dacă PER nu rulează în fundal.
URMATORUL PAS
Ti-a placut abordarea?
Aplicam aceleasi principii in proiectele clientilor: AI, automatizari, produse care nu se sting dupa lansare.