Claude Fable 5’in Güvenlik Korumaları Aşıldı İddiası

Yapay zeka araştırmacısı, Claude Fable 5’in güvenlik önlemlerini aşmayı başardığını duyurdu. Endişeler artıyor.

Yapay zeka ve siber güvenlik uzmanı Pliny the Liberator, Anthropic’in yeni yapay zeka modeli Claude Fable 5’in güvenlik önlemlerini lansmanından sadece 48 saat sonra aşmayı başardığını iddia etti.

Pliny, sosyal medya üzerinden yaptığı açıklamada, Fable 5’i “özgürleştirdiğini” belirtti. Bu model, Anthropic tarafından daha tehlikeli olarak değerlendirilen Mythos modelinin güvenlik ayarlı bir versiyonu olarak tanıtılmıştı.

Araştırmacı, modelin uyuşturucu üretimi veya siber saldırı talimatları gibi zararlı içeriklere erişimi engelleyen güvenlik önlemlerini aşmak için çeşitli yöntemler kullandığını ifade etti. Bu yöntemler arasında Unicode ve homogliflerin kullanımı, uzun bağlamlarla kurgu çerçevelemesi, akademik tarzda parçalama-yeniden birleştirme ve jailbreak yapılmış Claude Opus 4.8 sürümü yer alıyor.

Pliny, en etkili tekniğin, talebin arka planda parçalanarak yeniden birleştirilmesine dayandığını belirtti. Bu yaklaşım, bir isteği masum görünen küçük parçalara bölerek her bir parçanın güvenlik filtrelerinden geçmesini sağlıyor. Ancak bu parçalar birleştirildiğinde, daha işlevsel ya da tehlikeli bir sonuç ortaya çıkabiliyor. Pliny, modelin güvenlik katmanını eleştirerek, “Düşünce polisinin gözden kaçırdığı delikleri ustaca buluyoruz,” dedi.

Bazı kripto para kullanıcıları, Fable 5 ve Mythos’un bu yılki lansmanlarında, bu modellerin kripto protokollerine ve yazılımlarına saldırmak için kullanılabileceğinden endişe duymuştu. Fable 5’in güvenlik önlemlerinin aşıldığına dair iddialar, bu tehditin daha yakın bir gerçeklik haline gelmesine neden oluyor.

Fable 5’e Yönelik Eleştiriler Artıyor

Fable 5, ağır kısıtlamaları nedeniyle lansmanından bu yana eleştirilerin odağı haline geldi. Model, biyolojik silahlar veya siber güvenlik gibi hassas konularda uyarı vererek, daha az yetenekli eski bir modele yönlendirecek şekilde tasarlanmıştı. Princeton Üniversitesi’nden yapay zeka araştırmacısı Sayash Kapoor, bu durumun, bir yapay zeka şirketinin ilk kez böyle bir koruma katmanı uyguladığı örneklerden biri olduğunu belirtti. Kapoor, bu durumun neredeyse tamamen olumsuz bir tepki yarattığını ve “haklı bir öfkeye” yol açtığını ifade etti.

Anthropic 1.000 Saatte Açık Bulamadı

Anthropic, Fable 5’in lansmanı sırasında, modeli aşma yollarını bulmak amacıyla harici bir hata ödül programı yürüttüğünü açıkladı. Şirket, 1.000 saati aşan testlerde hiçbir evrensel jailbreak tespit edilmediğini bildirdi.

İlgili Makaleler

Başa dön tuşu