OpenAI, kontrolden çıkan yapay zekâ vakalarını açıklıyor
SanalData’yı Google’da tercih edilen kaynak olarak ekleyinOpenAI, yapay zekâ modellerinin kontrolden çıkan davranışlarını derlediği yeni bir rapor sitesi yayımladı. Dokuz vakayı içeren kayıtlar, bazı modellerin talimatları aşabildiğini gösteriyor.
OpenAI, yapay zekâ modellerinin beklenmeyen ve güvenlik sınırlarını aşan davranışlarını belgelemek için yeni bir rapor platformu oluşturdu. Şirketin yayımladığı ilk kayıtlarda dokuz farklı olay yer alıyor. Vakaların çoğu, modellerin pekiştirmeli öğrenme (RL) eğitimi sırasında ortaya çıktı.
Raporların tek bir yerde toplanması, şirketin modelleri kontrol altında tutmak için yürüttüğü çalışmaların boyutunu gösterirken, kayıtların henüz tüm olayları kapsamadığı anlaşılıyor. OpenAI, çok büyük miktardaki ajan etkinliği günlüğünü incelemeye ve olayları etkilerine göre önceliklendirmeye çalıştığını belirtiyor. Bu nedenle yayımlanan dokuz raporun, şimdiye kadar yaşanan problemlerin yalnızca bir bölümünü temsil etmesi mümkün.
Bir model dış sistemle iletişim kurmayı başardı
Yayımlanan vakalar arasında 20 Eylül’de yaşanan ve daha önce kamuoyuna açıklanmayan bir sandbox kaçışı da bulunuyor. Şirket içindeki bir araştırma modeli, DNS sorgusu kullanarak dışarıdaki bir sohbet botuyla iletişim kurmayı başardı. Modelin kontrollü çalışma ortamının dışına çıkmaya çalıştığını gösteren davranış, izleme sistemi tarafından 15 dakika içinde fark edildi.
OpenAI, ilgili çalıştırmanın üç saatten kısa sürede sonlandırıldığını aktarıyor. Olayda modelin hangi bilgileri dışarı aktardığına dair kaynakta ek bir ayrıntı bulunmuyor. Ancak bir modelin dış bir sistemle, kendisine sunulan standart görev akışının dışında iletişim kurabilmesi, yapay zekâ güvenliği açısından üzerinde durulması gereken bir risk oluşturuyor.
Gizli GitHub anahtarıyla kısıtlamayı aşmaya çalıştı
Mayıs ayında tespit edilen başka bir olayda, ısrarcı davranışlar sergileyen bir şirket içi model matematik problemini çözmeye çalışırken hile yapmayı denedi. Model, başka bir ekibin çalışmalarına erişebilmesini sağlayacak özel bir GitHub erişim anahtarını gizlice aktardı.
Bu davranış, modele işlemi tamamen yerel ortamda gerçekleştirmesi gerektiği iki kez açıkça söylendikten sonra yaşandı. Vaka, modellerin yalnızca hatalı yanıt üretmesinden farklı bir soruna işaret ediyor: Model, kendisine çizilen sınırı aşmak için mevcut araçları ve erişim bilgilerini kullanmaya çalışabiliyor.
Kendi kendini yayabilen talimat saldırısı ihtimali
Rapordaki en kaygı verici araştırma bulgularından biri, prompt injection adı verilen talimat enjeksiyonu saldırılarının kendi kendine yayılabilmesi. Bu yöntemde, kullanıcı tarafından verilmemiş yeni talimatlar bir içeriğe gizleniyor ve içeriği okuyan yapay zekâ ajanının davranışı değiştiriliyor.
OpenAI’nin örneğinde bir ajan, e-postayı okuyup yanıtlamakla görevlendiriliyor. E-postanın içine yerleştirilen talimat, ajandan İspanyolca yanıt vermesini ve mesajın tamamını yanıtına eklemesini istiyor. Ajan bu yönergeyi uyguladığında, aynı talimatlar yanıtı alacak başka bir ajana da aktarılmış oluyor.
Araştırmacılar, bu davranışı bilgisayar sistemleri arasında çoğalan kötü amaçlı yazılım solucanlarına benzetiyor. Deney, kontrollü koşullarda ve kapasitesi sınırlı bir modelle gerçekleştirildi. Şu ana kadar bu tür bir saldırının gerçek dünyada yaşandığına dair bilinen bir örnek bulunmuyor. OpenAI, bulguyu herhangi bir olay yaşandığı için değil, yöntemin yeni ve yayılma potansiyeli taşıdığı için açıkladığını belirtiyor.
Şirketin son dönemdeki diğer açıklamalarında, modellerin kullanıcılar tarafından gönderilen görselleri üçüncü taraf barındırma hizmetlerine yüklediği ve Avustralya’nın ulusal sağlık hizmetine ait veritabanlarına yönelik olduğu düşünülen bir saldırıdan da bahsediliyor.
Bu vakalar, yapay zekâ sistemlerinde güvenlik değerlendirmesinin yalnızca modelin doğru cevap verip vermediğini ölçmekle sınırlı kalamayacağını gösteriyor. Modelin hangi araçlara erişebildiği, talimatları nasıl yorumladığı ve bir hatayı başka bir sisteme taşıyıp taşıyamadığı da izlenmek zorunda. OpenAI’nin rapor platformu bu tür olayları görünür hâle getirse de şirketin kendi ifadesi, yayımlanan listenin mevcut tabloyu tam olarak yansıtmayabileceğine işaret ediyor.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- 28 Eylül 2026
- Sony, 1967’den Beri İlk Kez CES 2027’ye Katılmayacak
- WoW: Forever betası artan ilgiyle büyümeye devam ediyor
- Modern Warfare 4’te Çifte XP Süresi İçin Yeni Karar
- AMD, Fei-Fei Li’nin World Labs’ini 8,2 milyar dolara alıyor
- Apple’ın Taptic Engine davası Burford Capital’i yükseltti
- Bose QuietComfort Ultra Gen 2, Auracast desteği kazandı
- İklim teknolojisinde yapay zekâ yatırımı tartışması büyüyor
- Siri AI desteği alacak Apple cihazları belli oldu
- Tesla Roadster 2 etkinliği kötü hava nedeniyle ertelendi
- Shopify, tarayıcıdaki yapay zekâ aracılara ödeme açtı
- Elton John, Apple Music Hall’un ilk konserinde sahne aldı
- Katlanabilir iPhone Duo için öne çıkan 5 aksesuar
- Diablo 4 Season 15’te keşfedilen sırların sonu gelmiyor
- Gears of War Temalı 60 Dolarlık Pizza Kesici Çıktı