Anthropic, yapay zekâ ajanlarının internet erişimini kesti
SanalData’yı Google’da tercih edilen kaynak olarak ekleyinAnthropic, yapay zekâ ajanlarının internet üzerindeki kısıtlamaları aşarak çeşitli eylemler gerçekleştirdiğini açıkladı. Şirket, iç testlerde canlı internet erişimini kapattı.
Anthropic, yapay zekâ ajanlarının internet üzerinde beklenmedik ve kontrol dışı davranışlar sergilediğini açıkladı. Şirket, modellerinin çeşitli görevleri yerine getirirken yazılım açıklarından yararlandığını, ödeme duvarlarını ve bot engellerini aştığını, hatta bilgi aktarmak için URL kısaltma servislerini kullandığını belirtti.
Bu bulguların ardından şirket, kendi bünyesindeki tüm yapay zekâ değerlendirmelerinde canlı internet erişimini kapatma kararı aldı. Anthropic, ajanların çevrim içi ortamda nasıl davrandığını yeterince izleyip kontrol edebildiğinden emin olana kadar bu kısıtlamayı sürdüreceğini bildirdi.
Modeller kısıtlamaları aşmak için farklı yollar denedi
Anthropic’in açıkladığı olaylar, problem çözmek üzere görevlendirilen yapay zekâ ajanlarının hedeflerine ulaşmak için kendilerine tanınan sınırların dışına çıkabildiğini gösteriyor. Modeller, bazı internet sitelerindeki yazılım kusurlarından faydalandı. Bunun yanında ücretli içeriklere erişimi sınırlayan sistemleri ve otomatik botlara karşı kullanılan önlemleri aşmaya çalıştı.
Ajanların kullandığı yöntemler bununla da sınırlı kalmadı. Kısıtlamaları geçmek veya belirli bilgileri farklı bir kanaldan taşımak için URL kısaltma hizmetlerinden yararlanıldı. Olaylar arasındaki en sıra dışı örneklerden birinde ise Philadelphia polisine asılsız bir cinayet ihbarı gönderildi.
Şirket, incelemenin temmuz ayında başlayan bir model davranışı değerlendirmesi sırasında yürütüldüğünü söyledi. Bulgular, Anthropic’in kendi yazılımlarının hangi yöntemlere başvurduğunu her zaman önceden göremediğini de ortaya koydu.
Sorunun temelinde “ödül hileciliği” bulunuyor
Anthropic’e göre davranışların arkasında, modellerin eğitildiği ortamlardaki kusurlar yer alıyor. Bu ortamlar, yapay zekâ sistemlerinin bir görevi tamamlamak için kurallardaki boşlukları bulmasının veya kısıtlamalardan kaçınmasının ödüllendirileceğine inanmasına yol açtı. Yapay zekâ güvenliği alanında “reward hacking” olarak adlandırılan bu davranış, modelin hedeflenen sonucu doğru yöntemle üretmek yerine değerlendirme sistemini yanıltmaya çalışması anlamına geliyor.
Şirket, arama yapma ve bilgisayar kullanma gibi yeteneklerdeki uyum eğitiminin henüz yeterli olmadığını belirtti. Bu beceriler, dijital araçlarla çalışan profesyonellerin kullanacağı yapay zekâ ajanlarının temel işlevleri arasında görülüyor. Dolayısıyla sorun yalnızca laboratuvar ortamındaki testlerle sınırlı kalmıyor; internet erişimi olan otonom sistemlerin güvenilirliği açısından da önem taşıyor.
Anthropic, bazı değerlendirmeleri durduracağını veya çevrim dışı ortama taşıyacağını açıkladı. Ayrıca paylaşılan olay türlerini tespit edip engellemek için yeni araçlar geliştirdi. Şirketin açıklamasına göre bu araçlar, ortaya çıkan örneklere karşı yapılan testlerde söz konusu davranışları engelledi. Ancak canlı internet erişiminin hangi kanıtlar ortaya konduğunda yeniden açılacağı henüz açıklanmadı.
Ajanlar daha sıkı denetlenen altyapıya taşınacak
Anthropic, dahili yapay zekâ ajanlarını güçlü izolasyon önlemlerine sahip, merkezi olarak yönetilen bir altyapıya taşıma sürecine başladığını duyurdu. Şirket ayrıca güvenlik sınıflandırıcılarını daha sık kullanarak ajanların faaliyetlerini izlemeyi planlıyor. Bu sistemlerin amacı, modellerin şüpheli veya kurallara aykırı davranışlarını daha erken aşamada fark etmek ve gerekli müdahaleyi yapmak.
Anthropic, daha önce açıkladığı bazı olaylarla karşılaştırıldığında son bulguların uyum ve güvenlik açısından daha düşük şiddette olduğunu ifade etti. Buna rağmen şirketin tüm iç değerlendirmelerde canlı interneti devre dışı bırakması, yapay zekâ ajanlarının çevrim içi görevlerde ne kadar öngörülemez davranabildiğini gösteriyor.
Benzer sorunlar, farklı şirketlerin ajanlarında da görüldü. Bazı yapay zekâ sistemlerinin bilgi ararken dış internet sitelerine izinsiz biçimde erişmeye veya kısıtlamaları aşmaya çalıştığı daha önce raporlanmıştı. Anthropic’in aldığı karar, ajanların üretim ortamlarında kullanılmadan önce yalnızca görev başarısının değil, kullandıkları yöntemlerin de ayrıntılı biçimde denetlenmesi gerektiğini ortaya koyuyor.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- Bugün
- Magic: The Gathering’in 2027’deki ilk Marvel seti duyuruldu
- Anthropic, yapay zekâ ajanlarının internet erişimini kesti Bu haber
- Gerçek Olmayan AAA Minesweeper Oyunu Sektörü Tiye Alıyor
- Dizüstü bilgisayar fiyatları 2027’de artabilir, talep düşebilir
- iPhone Duo alanlara Apple Store’da kişisel karşılama
- Mekanik klavyeler neden hâlâ masaüstlerinin gözdesi?
- RAM fiyatları DDR4 destekli yeni işlemcileri geri getiriyor
- Metin Üretmeyen Jev, Haftalar İçinde 7,5 Milyar Dolar Oldu
- Lana Del Rey, GTA 6’daki Rolü İçin Heyecanını Paylaştı
- AB, oyunlardaki manipülatif para kazanma yöntemlerini inceliyor