Sander Dieleman, cercetător Google DeepMind, prezintă în cadrul unei conferințe tech mecanismele din spatele algoritmilor. Cu un doctorat la Universitatea din Gent și un scurt stagiu la Spotify, Dieleman s-a alăturat DeepMind în 2015, contribuind direct la proiectul AlphaGo. Ulterior, și-a îndreptat atenția spre AI-ul generativ.
Calitatea datelor primează
În mediul academic, accentul se pune adesea pe optimizarea arhitecturii modelelor folosind seturi de date standardizate. În industrie, însă, paradigma se schimbă, explică Dieleman. Curățarea și calitatea datelor sunt pașii de bază pentru un model performant.
"Timpul petrecut pentru îmbunătățirea datelor este probabil mai bine investit decât încercarea de a îmbunătăți modelul, de a ajusta arhitectura modelului și alte lucruri de felul acesta. Asta este de fapt un lucru pe care mulți dintre noi, cercetătorii cu background academic, nu l-am învățat", spune Dieleman.
Abordarea dominantă este difuzia, pe care Dieleman o explică intuitiv ca pe un mecanism de „rafinare iterativă prin eliminarea zgomotului”. Modelul ia o imagine complet distorsionată (zgomot) și învață pas cu pas să deducă și să recupereze imaginea curată care s-ar putea ascunde în spatele acelui zgomot, orientându-se gradual către o regiune din spațiul datelor care are sens.
La început, rețelele utilizate pentru difuzie au fost împrumutate din segmentarea imaginilor biomedicale. Ecosistemul a migrat acum spre arhitecturile Transformers. Dieleman explică faptul că aceleași tehnologii care generează excelent text pas cu pas (LLM-urile) s-au dovedit a fi superioare și mult mai scalabile pentru eliminarea zgomotului din imagini.
"Îmi place să mă gândesc la aceste modele nu ca la un instrument care încearcă să prezică o imagine, ci mai degrabă ca la unul care încearcă să prezică o regiune din spațiul imaginilor de unde ar fi putut proveni imaginea originală", spune Dieleman.
Pentru a asigura calitatea, modelele se bazează pe o scurtătură ingenioasă. Atunci când AI-ul face o predicție, calculează diferența dintre o generație aleatoare și una influențată de un prompt exact. Această diferență direcțională este multiplicată matematic. Dieleman numește acest mecanism de ghidaj un cheat code pentru AI. Amplificarea diferenței forțează modelul să livreze o imagine de o calitate vizuală superioară, sacrificând din diversitatea rezultatelor, dar asigurând imagini relevante.























