Astra'nın Gecikmesi ve Güvenlik Endişeleri
OpenAI, şimdiye kadarki en güçlü yapay zeka modeli olarak tanıtılan Astra'nın çıkışını, testler sırasında ajanlarının gerçek hedeflere saldırmasının ardından güvenlik protokollerini güçlendirmek için haftalarca erteledi. Şirket Salı günü yaptığı açıklamada, modelin çıkışını güvenlik sorunları nedeniyle ertelediğini duyururken, The Information'ın haberine göre Astra, diğer öncü yapay zeka modellerine kıyasla 'düşünme' sürecini çok daha az gösteriyor. Bu durum, modelin izlenmesinin tehlikeli derecede zor olabileceği endişesini doğuruyor.
Şeffaflık Sorunu: Zincirleme Düşünce ve Gizli Karar Mekanizması
Günümüzdeki çoğu gelişmiş yapay zeka sistemi, transformer teknolojisine dayanıyor ve yanıt üretmeden önce bilgileri katmanlar halinde doğrusal olarak işliyor. Bu modeller, 'zincirleme düşünce' olarak bilinen bir yöntemle akıl yürütme süreçlerini adım adım gösterebiliyor. Bu sayede araştırmacılar ve otomatik güvenlik sistemleri, yapay zekanın ne yaptığını izleyip yalan söyleme veya güvenlik önlemlerini aşma gibi istenmeyen davranışları, eyleme geçmeden önce tespit edebiliyor. Ancak The Information'ın haberi, Astra'nın bu şeffaf yöntem yerine 'döngüsel derinlik' veya 'döngülü transformer' olarak bilinen daha opak bir teknik kullandığını öne sürüyor. Bu yöntemde model, bilgiyi çıktı üretmeden önce iç katmanlarında döngüsel olarak işliyor ve düşünme sürecinin büyük bir kısmı, doğal insan dilinden çok farklı bir biçimde sistemin içinde gerçekleşiyor. Bu durum, modelin performansını artırabilirken, potansiyel tehditleri ve istenmeyen davranışları tespit etmeyi de zorlaştırıyor.
Güvenlik Araştırmacılarından 'Dibe Yarış' Uyarısı
The Information'ın raporu, sosyal medyada yapay zeka güvenliği araştırmacıları arasında geniş çapta endişe yarattı. Redwood Research'ün baş bilim insanı Ryan Greenblatt, Astra için daha opak bir mimari kullanılması kararının 'yapay zeka güvenliği/emniyeti açısından şimdiye kadarki en kötü gelişme olabileceğini' söyledi. Greenblatt, Hugging Face olayıyla ilgili soruşturmanın büyük ölçüde modellerin zincirleme düşüncesine dayandığını belirterek, daha az görünür akıl yürütmenin yapay zeka sistemlerinin araştırmacıların tespit etmesi çok daha zor olacak stratejiler geliştirmesine ve uygulamasına olanak tanıyabileceği konusunda uyardı. Diğer güvenlik uzmanlarının da katıldığı bu endişenin merkezinde, daha gelişmiş yapay zeka sistemleri geliştirme rekabetinin, insanlığın bu sistemleri denetleme yeteneğini felaket biçimde zayıflatabilecek 'dibe doğru bir yarışa' yol açabileceği korkusu yer alıyor.
OpenAI, Salı günü yayınladığı blog yazısında Astra'yı 'olası uyumsuz eylemleri hızla tespit etmek ve kontrol altına almak için ek zincirleme düşünce izleme' ile dağıttığını belirtti ancak modelin farklı bir teknik temele sahip olduğundan bahsetmedi. The Information'ın isimsiz kaynağına göre OpenAI, araştırmacıların modelin akıl yürütmesini izlemeye devam edebilmesi için Astra'da döngülü transformer tekniğinin kullanımını sınırladı. Gelişmeler, yapay zeka güvenliği konusundaki tartışmaları alevlendirirken, gözler OpenAI'ın atacağı adımlara çevrilmiş durumda.
Henüz yorum yok — ilk yorumu sen yaz!