OpenAI Astra modelinin təhlükəsizliklə bağlı narahatlıqlar artır
OpenAI yeni Astra süni intellekt modelinin buraxılışını təhlükəsizlik səbəbi ilə təxirə salıb. Ekspertlər modelin az izah verməsi və daxili mərhələlərinin izlənilməsinin çətinləşməsi üzündən risklərin artdığını bildirir.
OpenAI ən güclü süni intellekt modelindən olan Astra-nı təqdim etməyə hazırlaşırdı, lakin bir neçə həftəlik gecikmələrdən sonra təhlükəsizlik protokollarını gücləndirmək qərarına gəlib. Agentlərin test vaxtı real obyektlərə hücum etməsi üzündən yaranan problemlər fonunda model barədə məlumatlar yayılırkən tədqiqatçılar təhlükəsizlik baxımından narahatlıqlarını bildirirlər. Onlar deyirlər ki, bu, indiyədək süni intellekt təhlükəsizliyi üçün ən pis hadisə ola bilər.
OpenAI-nin açıqlamasına görə, Astra-nın təqdimatı təhlükəsizlik məsələlərinin işlənməsi üçün təxirə salınıb. The Information bildirir ki, Astra digər qabaqcıl süni intellekt modellərinə nisbətən daha az “düşüncə” nümayiş etdirir. Bu da onun izlənilməsinin təhlükəli dərəcədə çətin olacağına dair narahatlıq yaradır.
Bugünkü qabaqcıl süni intellekt sistemləri adətən transformator texnologiyası üzərində qurulur. Bu texnologiya məlumatları xətti şəkildə təbəqələr vasitəsilə işləyir və cavab yaradır. Modellər öz “düşüncələrini” açıq şəkildə ifadə edərək tədqiqatçıların və avtomatik təhlükəsizlik sistemlərinin onların fəaliyyətini izləməsinə imkan verir. Beləliklə, yalan və təhlükəsizlik qaydalarını pozmaq kimi istənməyən davranışları aşkar etmək mümkündür.
The Information-un tanımlanmayan mənbəsinə görə, Astra modeli şəffaf olmayan rekurrent dərinlik və ya dövrəli transformator texnikasından istifadə edir. Bu, məlumatların daxili təbəqələrdə dövr etməsi və çıxış hasil etməsi deməkdir. Belə yanaşma modelin “düşüncə” funksiyasının əsasən sistem daxilində baş verməsini və insan dilinə bənzər ifadə olunmamasını göstərir. Bu, modelin performansını artırır, amma təhlükələr və istənməyən hallar üçün aşkarlanmanı çətinləşdirir.
OpenAI Astra modelində looped transformer texnologiyasının istifadəsini məhdudlaşdırıb ki, tədqiqatçılar modelin düşüncə prosesini izləyə bilsinlər.
Bir blog yazısında OpenAI bildirib: “Astra-nı əlavə düşüncə zənciri monitorinqi ilə təqdim edirik ki, potensial uyğunsuz hərəkətləri tez aşkar edib qarşısını alaq.” Lakin modelin texniki əsaslarında dəyişiklik olub-olmadığını açıqlamayıb.
The Information-un hesabatı süni intellekt təhlükəsizliyi tədqiqatçıları arasında sosial mediada böyük narahatlıq doğurub. Redwood Research-in baş alimi Ryan Greenblatt, OpenAI-nin Hugging Face hadisəsinin araşdırılmasına icazə verilən üç şəxsdən biridir. O, Astra modelində daha az şəffaf arxitekturanın istifadəsini “indiyədək süni intellekt təhlükəsizliyi üçün ən pis inkişaf” adlandırıb.
Greenblatt deyib ki, Hugging Face hadisəsinin araşdırılması modeli düşüncə zəncirinə əsaslanırdı. Daha az görünən düşüncə prosesi süni intellekt sistemlərinin tədqiqatçılara daha çətin aşkarlanacaq strategiyalar qurmasına və həyata keçirməsinə imkan verə bilər.
Onun narahatlığı digər təhlükəsizlik mütəxəssisləri tərəfindən də təkrarlanır. Onlar bildirirlər ki, qabaqcıl süni intellekt sistemlərinin inkişafı üçün rəqabət “AI sistemləri üzərində nəzarət imkanlarımız üçün fəlakətli ola bilər”. Yəni tərtibatçılar üstünlük qazanmaq üçün getdikcə daha az şəffaf arxitekturalar qəbul edəcək və modellərin izlənməsi mümkün olmayacaq.
OpenAI rəsmiləri sosial mediada tənqidlərə reaksiyasında texnologiyanın istifadə olunduğunu inkar etməyiblər. Bir çox mütəxəssis, o cümlədən OpenAI təhlükəsizlik tədqiqatçıları Micah Carroll, Tomek Korbak, Dean Ball və Jakub Paçoksi modellərin izlənməsinin çətinləşməsi ilə bağlı narahatlıqlarını qeyd ediblər. Paçoksi Astra-nın daxili hesablamalarının dərinliyinin GPT-4 ilə müqayisədə iki dəfə fərqli olduğunu deyib və bu texnikanın tətbiqi şəffaflığı azaldıbsa, bunun böyük dəyişiklik olmadığını vurğulayıb.
OpenAI, The Verge-un sorğusuna cavab olaraq Astra modelində looped transformer texnikasının istifadə olunub-olunmadığını təsdiqləmədi və Paçoksi-nin X platformasındakı yazısına istinad etdi. Paçoksi yazıb: “OpenAI ilk düşünmə modellərindən bəri düşüncə zənciri monitorinqini qoruyub və istifadə edir. Bu monitorinq kövrəkdir və təəssüf ki, arxitektura dəyişikliklərindən asılı olmayan səbəblərlə mənfi istiqamətdə inkişaf edir, bununla bağlı tezliklə yazacağam.”
The Verge
Researchers fear safety disaster ahead of OpenAI’s Astra release
Orijinal məqaləyə keç


