Meta’nın Ses Tanımada Çığır Açan Modeli
Meta, yapay zeka alanındaki iddiasını sürdürüyor. Şirketin Superintelligence Lab (MSI) birimi, bugüne kadar geliştirdiği en güçlü ses tanıma modellerinden biri olan Muse Voice Transcribe’ı tanıttı. Bu model, aynı anda 20’den fazla konuşmacıyı ayırt edebiliyor ve birden fazla dili eşzamanlı olarak işleyebiliyor. Meta’nın açıklamasına göre, model gerçek zamanlı çalışıyor ve konuşmacıları otomatik olarak tanımlayıp diller arasında geçiş yapabiliyor.
Meta CEO’su Mark Zuckerberg, üç yıl aradan sonra X platformuna döndü ve modelin yeteneklerini gösteren bir video paylaştı. Videoda, transkripsiyon sistemi farklı konuşmacıları kusursuz bir şekilde ayırıyor ve diller arasında anında geçiş yapıyor. Özellikle code-switching olarak bilinen, bir cümle içinde birden fazla dilin kullanıldığı durumları bile başarıyla çözümlüyor.
Uyarlanabilir Gecikme ve Eğitim Stratejisi
Modelin en dikkat çekici özelliklerinden biri, dinleme süresini kendi kendine ayarlaması. Meta yetkililerine göre Muse Voice Transcribe, uyarlanabilir gecikme adı verilen bir yöntem kullanıyor: Zor kelimelerde biraz daha uzun süre dinliyor, kolay kelimelerde ise daha hızlı karar veriyor. Bu sayede her bir kelimeyi tahmin ederek doğruluğu artırıyor.
Model, 70’ten fazla dil üzerinde eğitildi ve lansman anında 25 dilin validasyonu tamamlandı. Ayrıca, 20’den fazla konuşmacının yer aldığı bir saatlik oturumların üstesinden gelebiliyor. Gerçek dünyadaki karmaşık ses kayıtlarında bile yüksek performans gösterdiği belirtiliyor.
Rakipler ve Entegrasyon
Bu lansman, Google’ın geçtiğimiz hafta duyurduğu Gemini 3.5 Transcribe modelinden sadece birkaç gün sonra geldi. Google, kendi ses modelini Android ve Chrome’a entegre etmeyi planlarken, Meta’nın Muse Voice Transcribe’ı ana hizmetlerine entegre etme planı henüz net değil.
Ancak Meta, modeli şimdilik yeni çıkardığı Meta AI Mac uygulaması üzerinden kullanıma sundu. Bu uygulama, diğer uygulamalarda ses özelliklerini güçlendirdiği için Muse Voice Transcribe, farklı servislerdeki dikte özelliklerini de destekleyecek. Geliştiriciler için model, Muse Code ve Meta Model API üzerinden erişilebilir durumda. Fiyatlandırma ise 1.000 ses dakikası için 3 dolar olarak belirlendi. Ayrıca, araştırma blogunda modelin demo versiyonu da yayınlandı.
Muse Voice Transcribe, Meta Superintelligence Lab’in son dönemdeki hızlı üretiminin bir parçası. Son haftalarda şirket ayrıca ilk özel kodlama ajanını, açık ağırlıklı bir modeli ve daha önce bahsedilen Meta AI Mac uygulamasını tanıttı. Meta, yapay zeka alanındaki bu yeniliklerle ses tanıma teknolojisinde de iddialı bir konuma gelmeyi hedefliyor.
Henüz yorum yok — ilk yorumu sen yaz!