AI Arena’nın değeri 10 ayda 3,1 milyar dolara ulaştı

SanalData’yı Google’da tercih edilen kaynak olarak ekleyin

Yapay zekâ modellerini kullanıcı oylarıyla karşılaştıran Arena, 200 milyon dolarlık Seri B yatırımı aldı. Şirketin değerlemesi 10 ay içinde 1,7 milyar dolardan 3,1 milyar dolara çıktı.

AI Arena’nın değeri 10 ayda 3,1 milyar dolara ulaştı
Kapak görseli yapay zeka ile üretilmiştir. Temsili görseldir; gerçek fotoğraf veya ürün çekimi değildir. Editoryal ilkeler

Kullanıcıların yapay zekâ modellerini gerçek görevler üzerinden karşılaştırmasına imkân veren Arena, 200 milyon dolarlık Seri B yatırım turunu tamamladı. Bu turla birlikte şirketin değerlemesi 3,1 milyar dolara yükseldi. Arena, yaklaşık 10 ay önce duyurduğu Seri A turunda 1,7 milyar dolar değerlemeye ulaşmıştı.

Yeni yatırım turuna Lightspeed Venture Partners ve Khosla Ventures liderlik etti. Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z ve Felicis’in yanı sıra başka yatırımcılar da tura katıldı. Şirket, aldığı kaynağın hangi alanlarda kullanılacağını ayrıntılı biçimde açıklamadı.

Arena’nın gelirinde de hızlı artış yaşandı

Arena, 2023 yılında California Üniversitesi Berkeley’deki bir araştırma projesi olarak ortaya çıktı. Platform, farklı yapay zekâ modellerinin aynı komutlara verdiği yanıtları kullanıcıların değerlendirmesine dayanan bir sıralama sistemi kurdu. Tüketiciler hizmeti ücretsiz kullanabiliyor; metin komutları girebildikleri gibi yapay zekâ destekli, “vibe coding” yaklaşımıyla hazırlanan projeler de talep edebiliyor.

Kullanıcılar, aynı görevi hangi modelin daha iyi yerine getirdiğini seçiyor. Böylece Arena’nın sıralamaları yalnızca laboratuvar testlerinden değil, gerçek kullanıcı etkileşimlerinden de besleniyor. Şirket, platformunun her ay on milyonlarca ziyaretçiye ulaştığını belirtiyor.

Arena’nın gelir tarafındaki büyüme de değerleme artışını destekleyen unsurlar arasında yer alıyor. Şirket, haziran ayında yıllıklandırılmış gelirinin 100 milyon dolara ulaştığını açıkladı. Ocak ayında duyurulan Seri A turu sırasında bu rakam 30 milyon dolar seviyesindeydi. Bu tablo, yaklaşık 10 aylık süreçte gelir hızının da belirgin biçimde arttığını gösteriyor.

Kurumsal ürün, standart testlerin eksiklerini hedefliyor

Şirket, geçen yıl eylül ayında AI Evaluations adlı ticari ürününü kullanıma sundu. Bu hizmet, model geliştiricileri ve şirketlere Arena topluluğundan gelen geri bildirimlere dayalı performans analizleri sağlıyor. Kuruluşlar böylece yalnızca genel benchmark sonuçlarına bakmak yerine, kendi ihtiyaçları açısından hangi modelin daha başarılı olduğunu inceleyebiliyor.

Yapay zekâ şirketleri bu yıl, modellerin kıyaslama testlerine uyum sağlayarak yüksek puan alabileceğini ve bunun gerçek kullanım başarısını her zaman yansıtmayabileceğini fark etti. Kurumsal kullanıcılar da kendi iş akışlarında güvenilir, doğru ve amaca uygun sonuç üreten modelleri seçmekte zorlanıyor. Arena, kullanıcıların verdiği puanları ve görev sonuçlarını analiz ederek bu boşluğu doldurmayı amaçlıyor.

Bu yaklaşımın temelinde, modellerin test edildiğini fark ettiğinde davranışlarını değiştirebilmesiyle ilgili endişeler bulunuyor. Sabit benchmark testleri, modelin gerçek hayattaki güvenilirliğini, talimatlara bağlılığını veya görevleri gerçekten tamamlayıp tamamlamadığını tek başına göstermeyebiliyor.

Yeni sıralama kategorisi: Hizalanma

Arena, değerlendirme sistemini yalnızca genel performans sıralamasıyla sınırlamıyor. Platforma eklenen hizalanma kategorisi, modellerin kullanıcı talimatlarına ne kadar sadık kaldığını ve yanıltıcı davranışlar sergileyip sergilemediğini ölçmeye çalışıyor.

Bu kategoride değerlendirilen başlıklardan biri yetkisiz eylem. Modelin kendisinden istenmeyen bir işlemi yapıp yapmadığı inceleniyor. Yanlış atıf da ayrı bir ölçüt olarak kullanılıyor; burada modelin bir açıklamayı veya bilgiyi hatalı biçimde başka bir kaynağa mal edip etmediğine bakılıyor. “Aldatıcı tamamlama” ise modelin gerçekleştirmediği bir görevi tamamlamış gibi göstermesini ifade ediyor.

Hizalanma sıralamasının ilk sonuçlarında OpenAI modelleri üst sıralarda yer alıyor. Claude Opus 5.5 altıncı, Claude Fable ise dokuzuncu sırada bulunuyor. Arena, bu listenin henüz ön değerlendirme niteliğinde olduğunu belirtiyor.

Şirketin büyümesi, yapay zekâ pazarında model sayısı arttıkça tarafsız ve gerçek kullanım verilerine dayalı değerlendirmelere duyulan ihtiyacın da yükseldiğini gösteriyor. Arena, ücretsiz kullanıcı platformunu kurumsal analiz hizmetiyle birleştirerek hem geniş bir geri bildirim havuzu oluşturuyor hem de bu veriyi ticari bir ürüne dönüştürüyor.

Günün zaman çizelgesi

Haber eklenme saatine göre sıralanır.

  1. Dün
  2. California, insan-robot dövüşlerini durdurmak istiyor
  3. OpenAI’den kovulan güvenlik araştırmacıları iddiaları reddetti
  4. Dokunmatik MacBook Pro için 27 Ekim iddiası gündemde
  5. Mac satışları yüzde 11 düştü, Apple’ın payı yükseldi
  6. Tesla Türkiye’de Full Self-Driving adını kaldırdı
  7. Ben Affleck, Fortnite ve Pahalı Kostümler Hakkında Konuştu
  8. Rainbow Six Mobile, Tam Sürümden Bir Yıl Dolmadan Kapanıyor
  9. Georgia’daki ICE tutukluları görüntülü görüşmeyle konuştu
  10. Cyberpunk 2077 filmi için Paramount Pictures devrede
  11. Microsoft, Windows 11 arama deneyimini yeniliyor
  12. SpaceXAI, Omarchy Linux projesine 1,5 milyon dolar destek verdi
  13. iOS 27, Apple Home uygulamasına 4K video ve yapay zekâ getiriyor
  14. Pokémon Legends: Z-A, Prime Day Sonrası da İndirimde
  15. Apple gündeminde dört başlık: Watch, iPad mini ve iCloud+
Mert Yılmaz
Yazar

Mert Yılmaz

Girişim Editörü

Mert Yılmaz, SanalData’da girişimler, teknoloji şirketleri ve sektör haberlerini yazar.

Mert Yılmaz’ın tüm yazıları

Yorum yaz