Vals, yapay zekâ testlerinde yeni bir standart arıyor
Andreessen Horowitz liderliğinde 40 milyon dolar yatırım alan Vals, yapay zekâ modellerini gerçek iş görevleri ve riskler üzerinden ölçmeyi hedefliyor.
Yapay zekâ şirketleri, modellerinin yeteneklerini kanıtlamak ve rakipleriyle karşılaştırmak için benchmark testlerine başvuruyor. Ancak sektörde kullanılan birçok ölçüm sistemi, bugünün gelişmiş modellerini değerlendirmek için yeterli olmayabiliyor. 2024’te kurulan Vals, bu sorunu çözerek yapay zekâ kıyaslamalarında güvenilir bir referans noktası oluşturmayı amaçlıyor.
Şirket, modelleri yalnızca genel bilgi düzeyleri veya standart sınavlardaki başarıları üzerinden değerlendirmek yerine, gerçek dünyadaki iş süreçlerini ne kadar iyi tamamlayabildiklerine odaklanıyor. Vals’ın yaklaşımı; hukuk, finans ve yazılım geliştirme gibi alanlarda insanların yürüttüğü karmaşık görevlerin yapay zekâ tarafından hangi kalitede gerçekleştirilebildiğini ölçmeye dayanıyor.
Geleneksel benchmark sistemleri neden yetersiz kalıyor?
Yapay zekâ alanında benchmark testleri, şirketlerin modelleri hakkında somut sonuçlar paylaşmasını sağlıyor. Yüksek puanlar, bir modelin rakiplerinden daha yetenekli olduğu iddiasını destekleyebiliyor. Fakat test soruları ve değerlendirme yöntemleri kamuya açık olduğunda, model geliştiricileri sistemlerini doğrudan bu ölçümlere göre eğitebiliyor.
Bu durum, testte yüksek puan almanın gerçek dünyada başarılı sonuç üretmekle aynı anlama gelmesini zorlaştırıyor. Vals, bu açığı kapatmak için kullandığı test materyallerinin ayrıntılarını kamuya açıklamıyor. Böylece modellerin daha önce karşılaştıkları soruları hatırlamak yerine, yeni ve karmaşık görevleri gerçekten çözme becerisinin ölçülmesini hedefliyor.
Şirketin kurucu ortağı Rayan Krishnan’a göre akademik benchmark’lar, piyasaya hızla çıkan yeni ve güçlü modellerin gerisinde kaldı. Krishnan, yapay zekâ toplumun farklı alanlarına yayılırken değerlendirme sistemlerinin de şirketlerin vaat ettiği işleri gerçekten yapıp yapamadığını doğrulaması gerektiğini savunuyor.
Ölçüm yalnızca başarıya değil, risklere de bakıyor
Vals’ın yaklaşımı, bir modelin doğru sonuç üretip üretmediğiyle sınırlı değil. Şirket, yapay zekâ sistemlerinin olumsuz sonuçlara veya istenmeyen etkilere yol açma ihtimalini de incelemeyi planlıyor. Bu bakış açısı, modellerin kontrolsüz biçimde yaygınlaştırılması durumunda ortaya çıkabilecek riskleri anlamayı amaçlıyor.
Vals’ın üzerinde çalıştığı değerlendirme alanları arasında daha geleneksel sektörlerin yanında yinelemeli öz gelişim, ruh sağlığı, siber güvenlik ve biyogüvenlik de bulunuyor. Şirket ayrıca yapay zekâ modellerinin silahlı çatışma hukuku gibi hassas alanlarda kuralları nasıl uyguladığını anlamaya yönelik çalışmalar yürütüyor. Kaynakta bu çalışmaların kapsamına ilişkin daha fazla ayrıntı paylaşılmıyor.
Bu yöntem, yapay zekâ modellerini tek bir genel puanla sıralamak yerine kullanım alanlarına göre değerlendirme fikrini güçlendiriyor. Bir modelin hukukta başarılı olması, aynı performansı finans, kodlama veya güvenlik görevlerinde de göstereceği anlamına gelmeyebilir. Vals, bu nedenle alanlara özgü benchmark’lar hazırlıyor.
Vals’ın yatırım ve büyüme süreci
2024 yılında kurulan girişim, geçen yıl 8VC ve Bloomberg Beta liderliğinde bir tohum yatırım turu gerçekleştirdi. Hızlı büyüme döneminin ardından şirket, geçen ay Andreessen Horowitz liderliğinde 40 milyon dolarlık Seri A yatırımı aldı.
Şirketin kurucu ortağı 25 yaşındaki Rayan Krishnan, daha önce Palantir’de staj yaptı. Stanford’da lisans eğitimi alırken Microsoft’ta ve üniversitenin yapay zekâ laboratuvarında çalıştı. Krishnan’ın gözlemleri, yapay zekâ modellerinin gelişim hızına ayak uyduramayan değerlendirme sistemleri fikrinin ortaya çıkmasında etkili oldu.
Vals’ın önündeki temel görev, farklı sektörlerdeki karmaşık işleri adil, tekrarlanabilir ve güvenilir biçimde ölçebildiğini göstermek olacak. Şirket bunu başarabilirse benchmark sonuçları yalnızca pazarlama amacıyla kullanılan puanlar olmaktan çıkıp, yapay zekâ sistemlerinin gerçek kullanım değerini ve risklerini anlamaya yarayan araçlara dönüşebilir.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- Bugün
- Yapay zekâ düzenlemesi tartışması neden yeniden alevlendi
- LG TV tartışması büyüyor: Kullanıcılar nasıl korunabilir?
- Vals, yapay zekâ testlerinde yeni bir standart arıyor Bu haber
- Neuralink Çipli Hastanın İlk Cümlesi “Seni Seviyorum” Oldu
- GTA 6 için Türkçe dil desteği ihtimali güçlendi
- iPhone 18 Pro Max’in Şarj Hızı Galaxy S26 Ultra’ya Yaklaştı
- iPhone 18 Pro Max’te Face ID için ekran koruyucu uyarısı
- Apple ürünlerinde hafta sonu indirimi: 100 dolara varan fırsat
- Baykar’ın Piaggio Aerospace’i Türkiye’ye 2 Uçak Satacak
- iPhone 18 Pro Max’in ABD sürümünde Qualcomm modem çıktı
- iPhone 18 Pro Max için iOS 27’ye yeni pil özelliği
- GPT-6 Astra’nın Minecraft macerası Creeper’la sona erdi
- EasyCep, Erişim Sorunları ve Mağaza Kapanışlarını Açıkladı
- GTA 6’nın 34 Şarkılık Resmî Albümü Plak Olarak Duyuruldu