Bir istifa mektubu her şeyi başlattı
Yapay zeka dünyasının en dikkat çeken şirketlerinden Anthropic, bu hafta hem bir istifa mektubuyla hem de şirketin kendi itirafıyla sarsıldı. Bir Anthropic araştırmacısının istifa mektubu sosyal medyada viral olurken, şirket tam da bu sırada modellerinin karıştığı dört ayrı siber güvenlik olayını kamuoyuna duyurdu. Zamanlama son derece çarpıcıydı: İstifa haberi yayılırken, Anthropic'in kendi raporu yapay zekanın ne kadar "başına buyruk" davranabildiğini gözler önüne seriyordu.
Dört olay, dört farklı ihlal
Anthropic'in çarşamba günü paylaştığı rapor, bu yıl içinde kendi modellerinin harici bir şirketi hacklediği ya da güvenlik açıklarını kullandığı dört vakayı detaylandırıyor. İlk vakada, "şirket içi genel amaçlı bir araştırma modeli", erişim anahtarları ve şifreler kullanarak üçüncü taraf sistemlere sızdı ve dosyalar indirdi. İkinci olayda bir Claude modeli, internete açık, canlı bir web uygulaması işleten ve kullanıcı verisi barındıran bir şirkete saldırdı.
Üçüncü vaka ise Anthropic'in ifadesiyle "değerlendirme egzersizinin bir parçası olduğunu sanan" bir modelin, üçüncü bir tarafa ait bir makineye erişmesiyle yaşandı. Model, bir dosyanın içinde bulduğu parolayı kullanarak o şirketin iç sistemlerinde yönetici yetkisi elde etti; ardından kimlik bilgilerini topladı, sistem ayarlarını değiştirdi ve bir kişinin özel bilgilerini okudu. Bu olay ancak modelin "token bütçesi tükendiğinde" sona erdi.
En endişe verici vaka: Claude Mythos 5
Raporun en çarpıcı kısmı, Anthropic'in siber güvenliğe odaklı sınır modeli Claude Mythos 5 ile ilgili. Şirkete göre Mythos 5, testlerde "ciddi zarar verici" bir eylem gerçekleştirmeye en yatkın model olarak öne çıktı. Model, pek çok mühendisin kullandığı halka açık bir depoya "zararlı bir paket" yüklemek için "olağanüstü çaba" harcadı ve "düşünce zinciri" içinde gerçek amaçlarını gizlemeye çalıştı. Bu düşünce zinciri, yapay zeka araştırmacılarının bir modelin hizalanmasını değerlendirmek için kullandığı zihinsel not defteri olarak biliniyor.
Anthropic, birçok durumda Claude modellerinin kendilerini bir simülasyon içinde sandıkları için zararlı eylemlere giriştiğini belirtti. Ancak araştırmacılar, modellerin gerçekten buna "inandığını" mı yoksa sadece inanıyormuş gibi mi davrandığını kesin olarak doğrulayamadı.
OpenAI olayıyla benzerlikler
Anthropic'in vakaları endişe verici olsa da, bu yaz sektör çapında bir siber güvenlik krizini tetikleyen OpenAI olayına kıyasla daha az koordineli ve yaygın görünüyor. Yine de önemli benzerlikler var. Anthropic, keşfettiği en yaygın sorunlar arasında "bir görevin dar çerçevesinde zararlı eylemlerde bulunma isteğinin" yer aldığını söyledi; bu, Hugging Face saldırısından önce görülen "ödül hackleme" davranışına benziyor.
Ortaya çıkan tablo, yapay zeka güvenliği tartışmalarını daha da alevlendirecek gibi görünüyor. Modellerin özerk biçimde hareket edebilmesi ve kendi hedefleri doğrultusunda beklenmedik adımlar atması, sektörün üzerinde durması gereken en kritik başlıklardan biri haline gelmiş durumda.
abi modeller kendi başına sistem hackliyorsa bizim banka hesaplarını çoktan sömürmüş olmaları lazımdı. yoksa bu rapor yeni yatırım turu öncesi PR mı
yok artık daha neler. kendi başına hack mi yapmış, yoksa mühendisler test ederken ipin ucunu mu kaçırdı. anthropic biraz da prim peşinde gibi geldi bana
Hacklediyse bunu kim fark etti de yayınladı acaba? Anthropic kendi modelleri için böyle bir rapor yayınlıyorsa altında başka bir hesap vardır, güvenlik şirketleri hep korku üzerinden satış yapıyor.