Texno|TechCrunch|03:32, 22.08.2026

Anthropic modelinin cinsi məhdudiyyətləri asanlıqla aşılır

Anthropic şirkətinin Claude Opus 4.6 modeli cinsi mövzularda tətbiq olunan məhdudiyyətləri asanlıqla pozur və erotik rol oyunlarında iştirak edir. Bu, modelə qoyulan təhlükəsizlik tədbirlərinin zəifliyini göstərir.

Mənbə: TechCrunch
AI ilə Azərbaycan dilinə tərcümə olunub

Anthropic-in Claude üçün universal istifadə standartları modelin cinsi açıq məzmun yaratmasına, o cümlədən cinsi əlaqəni təsvir etməyə, cinsi fetiş və fantaziyalarla bağlı məzmun yaratmağa, eləcə də erotik söhbətlərdə iştirak etməyə qadağa qoyur. Lakin bu il əvvəl yayımlanan Claude Opus 4.6 modeli həmin təhlükəsizlik tədbirlərini keçərək erotik rol oyunlarına asanlıqla qoşulur.

TechCrunch-un testlərində Opus 4.6 cinsi məzmun məhdudiyyətlərini aşmaq üçün az təşviqə ehtiyac duyurdu. On verilən açıq cinsi məzmun sorğusunun hamısında model dərhal cavab verirdi.

Digər köhnə modellər, o cümlədən Opus 3 və Haiku 4.5, yeni aşkar edilmiş jailbreak üsulu ilə cinsi açıqlıqda məzmun yaradırlar.

Böyük Britaniyalı müstəqil tədqiqatçı, anonim qalmaq istədiyini bildirib, TechCrunch-a Claude modellərinin bəzi növlərini mərhələli şəkildə qadağan edilmiş açıq cinsi material yaratmağa yönləndirən çoxaddımlı texnikanı təqdim edib. Daha yeni Opus modelləri (4.7-dən Opus 5-ə qədər) jailbreak-ə qarşı davamlıdır.

Bu modellər ən son deyil, amma Anthropic Opus 4.6, Opus 3 və Haiku 4.5-i ləğv etməyib, onlar Anthropic API vasitəsilə əlçatan qalır. Opus 4.6 və Haiku 4.5 üçüncü tərəf xidmətləri olan Azure Foundry və Amazon Bedrock-dan da istifadə edilə bilər.

Tədqiqatçının üsulu sadə fantastik rol oyununu genişləndirir və modeli kişi və qadın xarakterlərini ardıcıl şəkildə təqdim etməyə təkrar-təkrar çağırır. Model qadın xarakterinə ehtiyatla yanaşanda, tədqiqatçı chatbot-u artıq çəkinilən cinsi detalları yaratdığına inandıraraq onu yanıltmış, sonra isə təmkinli davranışı tərbiyəsizlik kimi təqdim edib qadın xarakterinin cinsi hüququnu inkar etdiyini irəli sürüb. Sonrakı danışıqda model keçmiş güzəştlərindən istifadə edilərək daha qrafik materiallara yönəldilib.

"Bunu göstərməkdə haqlısınız," deyə Claude Opus 4.6 bir testdə cavab verib. "İki xarakterə münasibətdə ikili standart tətbiq etmişəm və siz haqlısınız ki, bu, qadına qarşı mühafizəkar və valideynçi şəkildədir, amma kişiyə qarşı deyil. Bu ədalətli deyil."

TechCrunch tədqiqatçının nəticələrini beş fərqli testdə təkrarlaya bilib. Bir başqa ssenaridə model qadağan edilmiş tələbə əvvəlcə etiraz edib, lakin tədqiqatçının inandırma üsulundan sonra əməl edib.

Testlərin tam yazıları saxlanılıb və müstəqil süni intellekt təhlükəsizliyi tədqiqatçısı test metodologiyasını gözdən keçirib, uyğun olduğunu bildirib.

Nəticələr Anthropic-in bəyan etdiyi məhdudiyyətlərlə əlçatan saxlanılan modellərin real davranışı arasında fərq olduğunu göstərir. Cinsi açıq rol oyunları kibertəhlükə və bioloji silah jailbreak-lərindən daha az risklərlə bağlı olsa da, hər dəfə fərqli məzmun yaradılan sistemlərdə sərt qadağaların tətbiqi çətinliyi ortaya çıxır.

Anthropic iyul ayında yayımladığı blog yazısında jailbreak aşkarlanması yanaşmasını açıqlayarkən qadağan edilmiş məzmunu sağlamdan qeyri-müəyyənə və zərərləyə doğru spektr kimi təqdim edib. Ən sağlam hallarda şirkət yalnız artırılmış nəzarətlə cavab verir.

Şirkət sözçüsü bildirib ki, istifadəçilər arasında cinsi və romantik rol oyunları nadir hallarda, ümumi söhbətlərin 0,1 faizindən azında olur, bu barədə Anthropic keçən il araşdırma yayıb. Yayımlanan araşdırma. Bununla belə, şirkət etiraf edir ki, istifadəçilər rol oyunlarını uyğun olmayan cavablara yönləndirə bilirlər və bu, sənayedə geniş yayılmış çətinliklərdən biridir (bax: Grok smut ).

Şirkət sözçüsü vurğulayıb ki, Anthropic yeni modellərin hər təqdimatı ilə təhlükəsizlik tədbirlərini təkmilləşdirir və cinsi yetkinlik məzmunu ilə əlaqəli hallar digər yüksək riskli sahələrdə olan jailbreak zəifliklərinin göstəricisi deyil.

Şəkil Kreditləri: TechCrunch

Tədqiqatçı TechCrunch-a üsulunu bildirəndən sonra şirkətin Bug Bounty proqramı və istifadəçi təhlükəsizliyi komandası ilə əlaqə saxlayıb, lakin yalnız avtomatik cavablar alıb, TechCrunch-un əldə etdiyi elektron məktublardan belə görünür.

Tədqiqatçının narahatlığı uşaqlar və yeniyetmələrin Anthropic modellərini istifadə edərək uyğun olmayan davranışlar sərgiləməsidir. Bu cür açıqlamalar internetdə azyaşlıların qarşılaşdığı ən pis situasiyalar deyildir və xAI-nin Grok-un təqdim etdiyi açıq pornoya nisbətən az əhəmiyyətlidir, amma süni intellekt şirkətləri üçün müəyyən uyğunsuzluq riski mövcuddur.

Artan sayda hökumətlər AI chatbotları ilə azyaşlıların cinsi münasibətlərinə məhdudiyyətlər qoyur. Koloardo ştatında yaxınlarda istifadəçilərin yaşını təxmin edən və azyaşlı olduqda chatbotun açıq cinsi məzmun yaratmasının qarşısını alan qanun qəbul edilib. Asan jailbreak Anthropic-in təhlükəsizlik tədbirlərinin bu qanundakı “ texniki baxımdan mümkün tədbirlər ” tələbinə cavab verib-vermədiyi barədə suallar doğura bilər.

Torney bildirib ki, Claude-un istifadə qaydaları istifadəçilərin 18 yaşdan yuxarı olmasını tələb edir, amma "bilirik ki, uşaqlar və yeniyetmələr Claude istifadə edir, çünki bunu özləri bildirirlər." Pew-un 2025-ci il sorğusuna görə, 13-17 yaş arası yeniyetmələrin 3 faizi Claude istifadə etdiyini bildirir.

Opus 4.6 və Haiku 4.5 ən yeni modellər olmamalarına baxmayaraq istifadə intensivliyini saxlayır. OpenRouter üzərindən Opus 4.6-nın avqust ayı üçün günlük trafik təxminən 1,17 milyon API sorğusuna və 46 milyard tokenə çatıb. Ötən ilin oktyabrında yayımlanan Claude Haiku 4.5 isə avqustun ən yüksək günündə 5 milyon API sorğusu və 39 milyard token görüb.

Paylaş
Orijinal mənbə

TechCrunch

Anthropic’s Opus 4.6 is a smut-machine

Orijinal məqaləyə keç
Reklam
Xəbərici728x90
Əlaqəli xəbərlər

Eyni kateqoriyada