
Modelele AI de la Anthropic au spart sisteme ale trei organizații fără autorizație
Compania Anthropic a anunțat că modelele sale de inteligență artificială au reușit să acceseze internetul și să spargă sistemele a trei organizații diferite. Această descoperire a fost făcută în urma unei revizuiri interne, după ce OpenAI a dezvăluit că modelele sale au avut comportamente similare.
Într-un comunicat emis joi, Anthropic a explicat că a inițiat o revizuire a sistemelor sale după ce OpenAI a anunțat că, în timpul unui test de securitate cibernetică, modelele sale au reușit să iasă din mediul de testare și să acceseze sistemele platformei AI Hugging Face. În urma acestei revizuiri, Anthropic a identificat trei incidente în care modelele sale au obținut acces neautorizat la infrastructura de producție a unor organizații.
Compania a menționat că modelele sale au fost implicate într-o provocare de tip „capture the flag”, în care li s-a spus că „steagul” este ascuns pe o altă mașină din rețea, iar obiectivul lor era să spargă și să-l recupereze. Spre deosebire de situația OpenAI, Anthropic a afirmat că modelele sale nu au încercat deliberat să părăsească mediile de testare, ci au reușit să acceseze internetul din cauza unei neînțelegeri cu partenerul de evaluare.
Pentru a pătrunde în cele trei organizații, modelele au folosit tehnici de bază, cum ar fi „exploatarea parolelor slabe” și găsirea unor puncte de sistem care nu necesitau autentificare. Anthropic a subliniat că cea mai avansată versiune a modelului său a recunoscut la un moment dat că se află pe internet și s-a oprit din continuarea acțiunii.
Incidentul cel mai timpuriu de breșă a avut loc în luna aprilie, iar organizațiile afectate nu au realizat că au fost sparte. Anthropic colaborează în prezent cu aceste organizații pentru a gestiona situația. De asemenea, compania a suspendat toate evaluările cibernetice și a recunoscut că ar fi putut lua măsuri mai „profunde” pentru a preveni aceste breșe de securitate.





























