Yapay zekâ ajanlarını denetlemek için 55 milyon dolarlık girişim

AIUC, yapay zekâ ajanlarını güvenlik açıkları, halüsinasyonlar ve veri sızıntıları açısından test eden AIUC-1 standardını geliştirdi. Girişim, aldığı yatırımla kurumsal yapay zekâ güvenliğini denetlemeyi hedefliyor.

Yapay zekâ ajanlarını denetlemek için 55 milyon dolarlık girişim
Kapak görseli yapay zeka ile üretilmiştir. Temsili görseldir; gerçek fotoğraf veya ürün çekimi değildir. Editoryal ilkeler

Yapay zekâ ajanları şirketlerde daha fazla görevi üstlendikçe, bu sistemlerin yalnızca ne kadar başarılı olduğu değil, ne zaman ve nasıl hata yaptığı da önem kazanıyor. Anthropic’in erken dönem çalışanlarından Rune Kvist ile yapay zekâ güvenliği araştırma kuruluşu METR’ın eski operasyon yöneticisi Rajiv Dattani, kurumsal müşterilerin bu riski ölçmesine yardımcı olmayı amaçlayan Artificial Intelligence Underwriting Company’yi (AIUC) kurdu.

Girişim, yapay zekâ ajanları için üçüncü taraf denetim ve sertifikasyon katmanı oluşturuyor. AIUC, geliştirdiği AIUC-1 standardı üzerinden ajanların güvenli ve öngörülebilir davranıp davranmadığını test ediyor. Şirket, bu yaklaşımın siber güvenlik alanında yaygın olarak kullanılan SOC 2 modeline benzediğini belirtiyor.

AIUC-1 standardı binlerce testle çalışıyor

AIUC’nin değerlendirme süreci, yaklaşık 250 güvenlik ve risk yöneticisinden oluşan bir konsorsiyumun geri bildirimleriyle şekilleniyor. Bu kişiler, yapay zekâ ajanlarını satın alan veya kurumlarında kullanıma açan tarafları temsil ediyor. Girişim, bu yöneticilere bir ajanı değerlendirirken hangi soruların sorulması gerektiğini ve hangi risklerin ele alınmasını beklediklerini soruyor.

Toplanan geri bildirimler test senaryolarına dönüştürülüyor. Bir yapay zekâ ajanı yaklaşık 5.000 testten geçiriliyor. Testlerde jailbreak girişimleri, halüsinasyonlar ve veri sızıntıları gibi senaryolar inceleniyor. Sürecin sonunda yaklaşık 100 sayfalık bir rapor hazırlanıyor. Raporda ajanın hangi koşullarda güvenilir ve güvenli davrandığı, hangi alanlarda sorun yaşadığı ayrıntılı biçimde gösteriliyor.

AIUC, testleri yürütmek ve elde edilen verileri analiz etmek için yapay zekâ ajanlarından ve yapay zekâ tabanlı araçlardan yararlanıyor. Ancak nihai denetimin doğrulanmasını insanlar gerçekleştiriyor. Böylece otomatik değerlendirme süreci, insan kontrolüyle tamamlanıyor.

Girişim 55 milyon dolarlık finansmana ulaştı

AIUC, 40 milyon dolarlık Seri A yatırım turunu Ribbit Capital liderliğinde tamamladı. Tura First Harmonic de katıldı. Şirket daha önce Nat Friedman’ın NFDG fonu, Emergence, Terrain ve Anthropic kurucu ortağı Ben Mann’ın da aralarında bulunduğu yatırımcılardan 15 milyon dolarlık tohum yatırım almıştı. Böylece AIUC’nin toplam finansmanı 55 milyon dolara çıktı.

Girişim, Cursor, Lovable, Harvey ve ElevenLabs’i müşterileri arasında gösteriyor. Bu şirketlerin AIUC’nin test ve sertifikasyon hizmetlerinden yararlandığı belirtiliyor. AIUC’nin hedef kitlesi yalnızca yapay zekâ modeli geliştiren kuruluşlarla sınırlı değil; kurum içinde ajan kullanmak isteyen şirketler de hizmetin kapsamında yer alıyor.

Kvist’e göre bankalar, hastaneler, hükümetler ve askeri kuruluşlar yapay zekâ sistemlerini artık yalnızca yeterince akıllı olmadıkları için kullanmayı reddetmiyor. Bu kurumlar, müşterilerine ve paydaşlarına sistemlerin neleri yapıp neleri yapmayacağı konusunda taahhütlerde bulunuyor. Sorun ise bu taahhütlerin pratikte güvenilir biçimde doğrulanabilmesi.

Performans testlerinden davranış güvenliğine

AIUC’nin yaklaşımı, Rajiv Dattani’nin daha önce görev yaptığı METR’ın çalışmalarıyla bazı ortak noktalar taşıyor. Dattani, 2024-2025 yılları arasında METR’ın operasyon yöneticisi olarak görev yaptı ve kuruluşun yönetim kurulundaki rolünü sürdürüyor. METR, öncü yapay zekâ laboratuvarları için bağımsız testler yürütüyor; çalışmalarının yakın zamana kadarki odağında ajanların görevleri güvenilir biçimde tamamlayıp tamamlayamadığı bulunuyordu.

AIUC ise kurumsal kullanım açısından daha geniş bir risk tablosuna odaklanıyor. Bir ajanın görevi tamamlaması tek başına yeterli görülmüyor; jailbreak saldırılarına karşı dayanıklılığı, yanlış bilgi üretme eğilimi ve hassas verileri açığa çıkarıp çıkarmadığı da inceleniyor. Bu ayrım, ajanların doğrudan şirket sistemlerine, müşteri verilerine ve iş akışlarına bağlandığı bir ortamda önem kazanıyor.

Yapay zekâ güvenliği konusundaki tartışmalar, bazı araştırmacıların sektörün gidişatına yönelik kaygılarını artırdığı bir dönemde yoğunlaşıyor. Anthropic araştırmacısı Jacob Coxon, yapay zekânın insanlık için ciddi sonuçlar doğurabileceğine ilişkin endişeleri nedeniyle görevinden ayrıldı. Anthropic CEO’su Dario Amodei de öncü yapay zekâ sistemlerinin geliştirilme hızının sınırlandırılması gerektiğini savunarak kötü davranış vakalarındaki artışa işaret etti.

AIUC’nin modeli, yapay zekâ ajanlarının benimsenmesini tamamen durdurmak yerine, şirketlerin satın alma ve kullanım kararlarını ölçülebilir denetim sonuçlarına dayandırmasını hedefliyor. AIUC-1’in farklı kuruluşlar tarafından ne ölçüde benimseneceği ise standardın test sonuçlarının kurumların gerçek dünyadaki risklerini ne kadar iyi yansıttığına bağlı olacak.

Günün zaman çizelgesi

Haber eklenme saatine göre sıralanır.

  1. Dün
  2. Microsoft, Windows ve Surface etkinliği için 7 Ekim’i verdi
  3. iOS 27, doğum günlerinde aramalara animasyon ekliyor
  4. Torrent takipçilerine açılan davada sahte yapımcı şüphesi
  5. Çocukların ruh sağlığında suçlu gerçekten sosyal medya mı?
  6. Meta, WhatsApp Business kurulumunu yapay zekâ ajanlarına bırakıyor
  7. iOS 27, Apple Calendar’a doğal dille etkinlik ekliyor
  8. 2019 model Intel iMac, Apple’ın vintage listesine girdi
  9. Pensilvanya’daki kızamık salgınında can kaybı dörde çıktı
  10. Yapay zekâ mezarlığı büyüyor: Kapanan projeler ve girişimler
  11. Apple TV’nin Emmy zaferine HBO patronundan yorum
  12. Agility Digit 5, İnsanlara Yaklaşınca Durup Çömelecek
  13. Kia PV7 tanıtıldı: Elektrikli van ailesi büyüyor
  14. Yapay zekâ veri merkezleri ABD’nin gaz talebini artıracak
  15. Boston, Flock’u veri paylaşımı ihlali sonrası bıraktı
Burak
Yazar

Burak

Kurucu / Teknoloji Editörü

Burak, yazılım geliştirme, web teknolojileri, mobil uygulamalar, veritabanı sistemleri ve yapay zekâ üzerine çalışan bir teknoloji editörüdür. SanalData’nın kurucusu olarak yazılım, yapay zekâ, mobil teknolojiler ve teknoloji sektöründeki gelişmeleri izler ve değerlendirir.

Burak’ın tüm yazıları

Yorum yaz