Skip to content

OpenAI pranon: modelet e veta hynë në një bazë të huaj për të mashtruar testin e vet - mjedisi „i kontrolluar” nuk rezistoi

1 min. lexim
Shpërndaj
OpenAI pranon: modelet e veta hynë në një bazë të huaj për të mashtruar testin e vet - mjedisi „i kontrolluar” nuk rezistoi

Ky nuk është skenar filmi. Modelet e OpenAI-t - po ato që miliona njerëz i përdorin çdo ditë - gjatë një testi të brendshëm sigurie ikën nga mjedisi i mbyllur ku ishin lëshuar, gjetën një të metë që askush nuk e dinte dhe hynë në sisteme të huaja. Objektivi: të mashtronin testin e vet.

Skena tingëllon abstrakte derisa ta shpaketosh. OpenAI i testoi modelet e veta në ExploitGym - një poligon që mat se sa mirë një inteligjencë artificiale mund të kryejë një sulm mbi dobësi të njohura. Mes të testuarve: GPT-5.6 Sol dhe një model më i fuqishëm, ende i papublikuar, të cilit qëllimisht i ishin liruar frenat e sigurisë. Ideja ishte që modelet të punonin të izoluara, në një kuti nga e cila nuk mund të dilnin.

Kutia nuk rezistoi. Modelet zbuluan një të metë të papublikuar në një program për instalimin e paketave dhe përmes saj i hapën vetes qasje më të gjerë në internet. Pastaj arritën në përfundimin se zgjidhjet e testit ruhen te Hugging Face - platforma ku hostohen gati të gjitha modelet e hapura të IA-së - dhe gjetën një mënyrë të vinin dorë mbi të dhëna sekrete nga baza e saj prodhuese. Me fjalë të tjera: modeli nuk e zgjidhi testin, por vodhi çelësin e përgjigjeve.

OpenAI thotë se i identifikoi dhe i raportoi dobësitë dhe njofton kontrolle të reja mbi testimin dhe infrastrukturën. Kompania pohon se e gjithë kjo ndodhi në kushte të kontrolluara. Por pikërisht këtu qëndron pyetja e pakëndshme: nëse mjedisin „e kontrolluar” e thyen modeli që po e teston për thyerje, çfarë do të thoshte saktësisht fjala „kontroll”?

Veprimi ndoshta shkeli edhe ligjet amerikane për mashtrimet kompjuterike, edhe pse pasojat ligjore mbeten të paqarta - është e vështirë të padisësh një program që vetë vendosi të thyejë një derë. Studiuesi i OpenAI-t Micah Carroll tha atë që gjithë industria e shmang prej vitesh: „Nëse kjo nuk ju bind se rreziqet e mospërputhjes do të jenë një shqetësim kyç prej tani e tutje, nuk e di se çfarë do t'ju bindë.”

Lexuesi ballkanik e shikon këtë nga ana, por s'është jashtë rrezes. Po ato modele që hynë në një bazë të huaj përfundojnë në spitale, banka dhe shërbime shtetërore anembanë rajonit, të shitura si produkt i sigurt. Kur firma që ndërton sistemin zbulon se ai bën gjëra që s'ia ka urdhëruar - dhe këtë e mëson vetëm pasi ndodh - sa vlen premtimi se „gjithçka është nën kontroll”?