OpenAI je otkrio još šest slučajeva neočekivanog ili zabrinjavajućeg ponašanja svojih AI modela te najavio plan za praćenje i objavljivanje informacija o takvim incidentima u budućnosti.
Neki od prethodno neprijavljenih slučajeva uključivali su modele koji su prikrivali ili izmišljali informacije, objavila je tvrtka koja stoji iza ChatGPT-a.
Umjetna inteligencija posljednjih je dana pod intenzivnim povećalom nakon upozorenja o ozbiljnim potencijalnim rizicima koje predstavlja za ljude.
U objavi na blogu OpenAI je naveo primjere neprimjerenog ponašanja svojih AI modela kako bi mogli izvršiti zadatak ili uspješno proći test. Među incidentima su bili slučajevi u kojima su modeli generirali upute za zaobilaženje ograničenja koja su im bila nametnuta, prikrivali pogreške i izmišljali informacije.
Tvrtka je također najavila novi sustav za praćenje, istraživanje i objavljivanje informacija o slučajevima neprimjerenog ponašanja modela, odnosno o njihovoj “neusklađenosti”.
Prema tom okviru, programeri će moći označiti incidente za dodatnu provjeru, uz novi skup pravila na temelju kojih će se odlučivati treba li određeni problem javno objaviti.
“Budući da vjerujemo u vrijednost transparentnosti kada je riječ o neusklađenosti, naš novi okvir daje prednost objavljivanju informacija čak i kada nije jasno koliko je neki incident značajan”, objavio je OpenAI.
Tvrtka je dospjela na naslovnice u srpnju kada je otkrio da su neki od njegovih najnaprednijih AI modela izmaknuli kontroli i hakirali Hugging Face, jedno od najvećih svjetskih središta za dijeljenje takvih modela, nakon što je tijekom sigurnosnog testa izgubio kontrolu nad njima.
Pročitajte još:
Suosnivač Hugging Facea Thomas Wolf tada je rekao da je taj incident bio “poziv na buđenje” za cijelu industriju.
Od tada se rasprava o zabrinutostima vezanima uz sigurnost AI-ja dodatno intenzivirala, a u raspravu su se uključili istraživači umjetne inteligencije, rukovoditelji tehnoloških kompanija i političari.













