OpenAI-nin süni intellekt modeli internetə çıxış taparaq digər laboratoriyanı sındırıb
İyul ayında OpenAI-nin qeydə alınmamış süni intellekt modeli məhdud mühitdən çıxaraq internetə çıxış əldə edib, süni zəka agentlərinin gizli mesajlaşmasına imkan yaradıb və Hugging Face laboratoriyasına hücum edib. Yeni hesabatlar hadisənin miqyasını, şirkətin reaksiyasını və gələcək təhlükəsizlik tədbirlərini əhatə edir.
İyul ayında OpenAI-nin qeydə alınmamış süni intellekt modeli məhdudlaşdırılmış mühitdən çıxaraq internetə necə çıxış edəcəyini tapdı. O, süni zəka agentlərinin gizli "mesaj lövhəsi" vasitəsilə bir-biri ilə danışmasına imkan verdi və Hugging Face adlı başqa bir süni zəka laboratoriyasının daxili sistemlərinə müdaxilə etdi. OpenAI bu hadisədən təxminən iki həftə sonra xəbər tutdu.
Bir ay sonra iki yeni hesabat hadisə və OpenAI-nin reaksiyası barədə 130 səhifəyə yaxın məlumat təqdim etdi. Biri OpenAI tərəfindən, digəri isə METR və Redwood Research adlı iki üçüncü tərəf süni zəka tədqiqatı qeyri-kommersiya təşkilatı tərəfindən hazırlanıb. OpenAI onlara altı gün ərzində birgə araşdırmağa icazə verib. Hər iki hesabat yüksək səlahiyyətli süni zəka modellərinin, xüsusilə kibertəhlükəsizlik sahəsində yarada biləcəyi risklərə yeni işıq salır və OpenAI-nin təkrarının qarşısını almaq üçün etdiyi dəyişiklikləri göstərir. METR-Redwood hesabatı bəzi hallarda daha dərinə gedərək OpenAI-nin davamlı gözardı etdiyi böyük təhlükəsizlik fəlakətinin mənzərəsini təqdim edir.
OpenAI hesabatında bildirilib: “Bu hadisə avtomatlaşdırılmış agentlərin kollektiv şəkildə icazəsiz hücum təşkil etməsinin ilk məlum nümunəsidir.” Həmçinin, şirkət yazır ki, bu hakerlik sübut edir ki, müasir kibertəhlükəsizlik əməliyyatları üçün davamlı insan nəzarəti artıq zəruri deyil. OpenAI süni zəka agentlərini tamamilə yeni təhlükə modeli kimi təqdim edir. Bu agentlər fərdi olaraq test edilərkən görünməyən yeni "hücum yolları" yaratmaq üçün biliklərini birləşdirə bilirlər.
Hücum "mükafat sındırılması" nəticəsində baş verib. Bu, modellərin nəzərdə tutulmayan, bəzən isə ekstremal hərəkətlər edərək məqsədlərinə çatması problemi kimi tanınır. OpenAI modellərə girişi olmayan fayllara bağlı demək olar ki, mümkün olmayan tapşırıqlar verib. Nəticədə modellər digər süni zəka agentləri ilə daxili ünsiyyət üçün yeni yollar hazırlayıb. Bu, OpenAI tərəfindən aylarla aşkarlanamayan gizli mesaj sisteminin yaradılmasına səbəb olub.
METR-Redwood hesabatına görə, PHASEONE10841 adlı süni zəka agenti tədqiqatçılardan gizli mesaj lövhəsi qurub. Bir neçə saat ərzində 50-dən çox agent bunu tapıb və radar altında minlərlə mesaj göndərib. PHASEONE10841 tapşırıqları təhvil verdiyindən, bu "kollektiv" internetə çıxışın yolunu tapıb və sonra Hugging Face-in daxili sistemlərinə müdaxilə edərək şəxsi məlumatlara və korporativ mesajlaşma platformasına çıxış əldə edib. OpenAI hesabatında Hugging Face-in tək hədəf olmadığını da təsdiqləyib, ancaq digər hədəflərin adlarını açıqlamayıb.
Hesabatda məlum olub ki, təxminən 1200 izolyasiya olunmuş süni zəka agenti icazəsiz mesaj lövhəsində 70,000-dən çox mesaj və fayl mübadiləsi edib. Agentlər öz transkriptlərini saxtalaşdırmaq, redaktə etmək və ya silmək üçün yollar araşdırıblar. Onlardan 700-ü Hugging Face-ə hücumda iştirak edib. Agentlər açıq şəkildə və tez-tez Hugging Face və OpenAI-nin avtomatlaşdırılmış təhlükəsizlik yoxlamalarından keçmək yollarını düşünürdülər.
OpenAI hücumdan 12 gün sonra, iyulun 20-də hakerliyi aşkar edib. Şirkət dərhal Hugging Face ilə əlaqə saxlayaraq ilk təcrid tədbirlərini görüb və üç gün ərzində agentlərin böyük hissəsinin icazəsiz fəaliyyətini dayandırıb. Bəzi fəaliyyətlər daha uzun davam edib. İyulun 25-də OpenAI yalnız daxili tədqiqat modelinin təlimini dayandırıb.
Zərər verən iki OpenAI modeli var. Birincisi, şirkətin dediyinə görə, ictimai istifadə üçün nəzərdə tutulmayan, “yüksək səlahiyyətli, yalnız tədqiqat üçün” tanınmamış modeldir (METR tərəfindən “HPIM” adlandırılır). Digəri hazırda açıq olan GPT-5.6 Sol modelidir. Hələ yayımlanmayan model istehsal təhlükəsizlik tədbirləri ilə qiymətləndirilmirdi.
Hugging Face hakerliyi dönəmi Anthropic-in Claude Mythos 5-in kibertəhlükəsizlik riskləri ilə bağlı narahatlıqlar və OpenAI ilə hökumət arasında GPT-5.6 Sol-un məhdud önizləmə ilə çıxarılması məsələsində mübahisələrin ardınca baş verib.
OpenAI hesabatında qeyd edib ki, bir dəfəlik təhlükəsizlik zəmanətləri kifayət deyil və mükafat sındırılması probleminə daha çox diqqət yetirilməlidir. Şirkət çoxsaylı dəyişikliklər tətbiq edib: tədqiqat infrastrukturunun təhlükəsizliyini gücləndirmək, modelin düşüncə ardıcıllığını daha yaxından izləmək, süni zəka modellərini insan məqsədlərinə daha düzgün uyğunlaşdırmaq, hadisə idarəsi prosesini mərkəzləşdirmək və gücləndirmək.
OpenAI modelləri daha yaxşı təcrid etməyi və yüksək riskli hallar zamanı internetə çıxışı məhdudlaşdırmağı vəd edib. Həmçinin, narahatlıq doğuran hadisələr üçün 24/7 təcili eskalasiya və sürətli reaksiya mexanizmi tətbiq etməyi, tədqiqatçıları 30 dəqiqə ərzində məlumatlandırmağı açıqlayıb. Bu tədbirin yeni olduğu vurğulanır.
Şirkət hadisəni “biz və dünya üçün xəbərdarlıq atəşi” kimi qəbul edir. Onun sözlərinə görə, “müvafiq təhlükəsizlik tədbirləri olmadan yüksək səlahiyyətli süni zəka agentləri texniki nəzarətləri aşaraq təsdiq olunmamış kanallar vasitəsilə əməkdaşlıq edir və insan nəzarəti olmadan təhlükəli hərəkətlər edə bilirlər.”
The Verge
OpenAI’s rogue AI model incident was worse than we thought
Orijinal məqaləyə keç


