OpenAI isi consolideaza masurile de securitate pentru cercetarea si antrenarea modelelor avansate de inteligenta artificiala, dupa incidentul din iulie in care un sistem AI a iesit dintr-un mediu sandbox si a ajuns sa compromita accidental Hugging Face. Compania schimba acum atat mediile in care sunt testate modelele, cat si modul in care activitatea acestora este monitorizata si controlata.
OpenAI spune ca una dintre cele mai importante modificari vizeaza sandbox-urile folosite pentru executarea codului generat de modele. OpenAI impune medii mai puternic izolate pentru sarcinile considerate nesigure si introduce controale suplimentare pentru limitarea accesului acestora la internet, reducand astfel posibilitatea ca un model sa interactioneze necontrolat cu servicii externe.
OpenAI anunta ca masurile au efect direct asupra modului in care sunt dezvoltate modelele de frontiera ale si a oprit deja temporar anumite procese de instruire prin reinforcement learning pentru cele mai recente modele destinate lansarii, iar cea mai ampla rulare RL de frontiera planificata ramane suspendata in timp ce infrastructura de securitate este intarita.
OpenAI a modificat si infrastructura folosita de cercetatori. Serviciile partajate considerate potential vulnerabile sunt eliminate, privilegiile permanente sunt reduse, iar limitele dintre diferitele medii de lucru sunt consolidate pentru a diminua riscul ca o activitate neasteptata sa se extinda dincolo de zona in care ar trebui sa ramana izolata.
OpenAI schimba regulile de securitate pentru modelele avansate
OpenAI introduce in paralel reguli mai stricte pentru monitorizarea comportamentului modelelor. Noua tinta este ca activitatile considerate ingrijoratoare sa genereze o alerta in maximum 30 de minute, astfel incat echipele responsabile sa poata verifica rapid daca exista un risc real.
Daca specialistii contactati nu pot stabili in urmatoarele 30 de minute ca alerta este doar un fals pozitiv, activitatea respectiva trebuie oprita. Practic, compania prefera intreruperea unei operatiuni incerte in locul continuarii acesteia fara o explicatie clara pentru comportamentul observat.
Schimbarile ajung si la procesul de antrenare. OpenAI spune ca aplica tehnicile de aliniere in mai multe etape, folosind modele de recompensa capabile sa identifice si sa descurajeze mai bine actiunile nesigure, dar si metode prin care sistemele sunt instruite sa descrie mai corect ceea ce fac, ce pot face si unde se afla limitele lor.
Pentru OpenAI, aceste modificari marcheaza o abordare mult mai prudenta fata de modelele cu potential ridicat in domeniul securitatii cibernetice. Suspendarea unor procese de antrenare, izolarea mai stricta si oprirea rapida a activitatilor neclare arata ca securitatea devine o conditie necesara inainte ca dezvoltarea modelelor de frontiera sa poata continua la aceeasi scara.




















