ProgramBench: Pot modelele lingvistice să reconstruiască programe de la zero?
Noul benchmark ProgramBench testează capacitatea LLM-urilor de a restaura codul sursă al unui program pe baza comportamentului său.

Imaginați-vă: îi dați unei rețele neuronale un binar sau o descriere a funcționării unui program, iar ea vă returnează codul sursă. Sună a știință-ficțiune? Cercetătorii de la mai multe universități au prezentat benchmark-ul ProgramBench, care tocmai această abilitate o evaluează la modelele lingvistice.
Ce este ProgramBench? Este un set de sarcini în care modelul trebuie să "reconstruiască" un program având doar:
- descrierea funcționalității (în limbaj natural);
- exemple de intrări și ieșiri;
- sau chiar cod binar.
Benchmark-ul include 150 de sarcini de complexitate variată — de la scripturi simple la aplicații mici. Evaluarea se face după trei metrici: acuratețea reconstrucției, corectitudinea sintactică și timpul de execuție.
Rezultate: încă nu e perfect Cele mai bune modele (GPT-4, Claude 3) se descurcă cu sarcinile simple în 60-70% din cazuri, dar la exemplele complexe scad la 20%. Interesant, modelele generează adesea cod sintactic corect, dar semantic incorect — adică programul se compilează, dar nu face ce trebuie.
De ce e important pentru dezvoltatori? Dacă astfel de modele sunt perfecționate, ele ar putea ajuta la restaurarea codului pierdut, la reverse-engineering-ul sistemelor vechi sau chiar la generarea automată a documentației pe baza comportamentului programului. Deocamdată e mai mult un teren de cercetare, dar potențialul e uriaș.
Comentariul studioului METABYTE: ProgramBench ne reamintește că nici cele mai inteligente rețele neuronale nu pot înlocui deocamdată omul în înțelegerea logicii de business. Dar ca instrument pentru refactorizare sau analiză a codului moștenit — de ce nu?
URMATORUL PAS
Ti-a placut abordarea?
Aplicam aceleasi principii in proiectele clientilor: AI, automatizari, produse care nu se sting dupa lansare.