Yapay Zeka Testlerinde Yeni Bir Soluk: Vals AI
Yapay zeka dünyasında modellerin yeteneklerini kanıtlamak için kullanılan testler (benchmark'lar) neredeyse bir reklam aracı haline geldi. Şirketler, elde ettikleri iyi sonuçları öne çıkararak rakiplerine üstünlük sağlıyor. Ancak eski test sistemleri, modern modellerin karmaşıklığını ölçmekte yetersiz kalıyor ve şirketler bu sistemleri nasıl kandıracaklarını da öğrenmiş durumda. İşte tam bu noktada, 2024'te kurulan Vals AI, bu bozuk sistemi düzeltme misyonuyla sahneye çıkıyor.
Hızlı Büyüme ve Yatırımcı İlgisi
Vals AI, kısa sürede teknoloji dünyasında dikkat çeken bir isim haline geldi. Geçtiğimiz yıl 8VC ve Bloomberg Beta liderliğinde tohum yatırımı alan şirket, geçen ay ise Andreessen Horowitz liderliğinde 40 milyon dolar (yaklaşık 2.000 TL) değerinde bir A serisi yatırım topladı. Şirketin 25 yaşındaki kurucu ortağı Rayan Krishnan, daha önce Palantir'de staj yapmış ve Stanford Üniversitesi'nde Microsoft ile üniversitenin ünlü yapay zeka laboratuvarında çalışmış. Krishnan, Vals'in kendi gözlemlerinden doğduğunu belirtiyor: "Piyasaya hızla çok yetenekli yeni modeller çıkıyordu ve akademik testler bu gelişimi yakalayamıyordu."
Gerçek Dünya Görevlerine Odaklanmak
Vals, diğer test sistemlerinden farklı olarak, test materyallerini kamuya açık paylaşmıyor. Böylece şirketlerin modellerini bu testlere göre eğitmesinin önüne geçiliyor. Ayrıca Vals, yalnızca genel bilgiyi değil, hukuk, finans ve kodlama gibi belirli sektörlerdeki karmaşık görevleri tamamlama yeteneğini de ölçüyor. Krishnan, "Biz aslında modellerin gerçek etkilerine bakıyoruz. Her alanda insan kalitesinde ürün üretebiliyorlar mı?" diyor. Amaç sadece olumlu sonuçları değil, olumsuz sonuçları da tespit etmek. Örneğin, modellerin dünyada kontrolsüzce çalışması durumunda ne gibi olumsuz etkiler yaratabileceği analiz ediliyor.
Gelecek Vadeden Alanlar
Vals'in ölçtüğü yetenekler giderek çeşitleniyor. Geleneksel sektörlerin yanı sıra, özyinelemeli kendini geliştirme, ruh sağlığı, siber güvenlik, biyogüvenlik ve hatta silahlı çatışma hukuku (Cenevre Sözleşmesi'nin uygulanması) gibi alanlarda da testler geliştiriyor. Şirketler, modellerini test ettirmek için Vals'e para ödüyor. Bu kulağa tuhaf gelebilir; neden bir şirket modelinin yetersiz olduğunu öğrenmek için para ödesin? Ancak Vals, tarafsız ve güvenilir sonuçlar sunarak yapay zeka ekosisteminde altın standart olmayı hedefliyor. Önümüzdeki dönemde yapay zeka modellerinin gerçek dünyadaki etkilerini daha iyi anlamak isteyen şirketler için Vals kritik bir rol oynayabilir.
Henüz yorum yok — ilk yorumu sen yaz!