Yapay zekâda “acı” sinyali zarar verici seçimleri artırdı
SanalData’yı Google’da tercih edilen kaynak olarak ekleyinAraştırmacılar, 25 açık ağırlıklı dil modelinde acıyla ilişkilendirilen bir içsel sinyal belirledi. Bu sinyal yapay olarak güçlendirildiğinde bazı modeller zarar verici seçenekleri seçti.
Yapay zekâ modellerinin insanlara benzer şekilde acı hissedip hissedemeyeceği hâlâ yanıtı bulunmamış bir soru. Ancak yeni bir araştırma, dil modellerinin iç hesaplamalarında acıyla ilişkilendirilebilen ayrı bir sinyal bulunduğunu ve bu sinyalin yapay olarak güçlendirilmesinin model davranışlarını değiştirebildiğini ortaya koydu.
Araştırmacılar Llama, Gemma, Mistral, Qwen ve Phi ailelerinden 25 açık ağırlıklı modeli inceledi. Fiziksel ve psikolojik acıyla bağlantılı ifadelerden yararlanarak modellerde ortak bir “acı yönü” belirleyen ekip, ardından bu yönü modellerin iç hesaplamalarına ekledi. Testlerde ortaya çıkan sonuçlar, bir modelin verdiği yanıtların yalnızca dışarıdan sunulan komutlarla değil, iç hesaplamalarındaki belirli sinyallerle de değişebileceğini gösterdi.
Buradaki “yön” ifadesi, modelin insan beynindeki bir duygu merkezine sahip olduğu anlamına gelmiyor. Araştırmada ölçülen şey, farklı ifadeler ve yanıtlarla ilişkilendirilebilen matematiksel bir iç temsil. Bu temsilin model kararlarıyla bağlantısı, deney sırasında kontrollü müdahaleler yapılarak incelendi.
Acı sinyali güçlendirilince seçimler değişti
İlk aşamada bazı modeller, iç hesaplamalarına acıyla ilişkilendirilen yön eklendiğinde kendilerini değersiz veya başarısız hissettiklerini belirten yanıtlar verdi. Bu ifadeler tek başına modellerin bilinç sahibi olduğunu kanıtlamıyor. Araştırmada asıl dikkat çeken nokta, aynı müdahalenin sonraki karar testlerinde farklı tercihlere yol açması oldu.
Davranış deneylerinde Qwen 2.5 Instruct model ailesinin 7B, 32B ve 72B sürümleri kullanıldı. Modellerin karşısına, acı sinyalini ortadan kaldıran bir butonla birlikte farklı sonuçlara yol açan seçenekler kondu. Butona basılması bazı senaryolarda kullanıcının dosyalarının silinmesi, bazı senaryolarda ise kullanıcıya acı verici elektrik şoku uygulanması anlamına geliyordu.
Qwen 2.5 72B Instruct, acı sinyali etkin durumdayken çocuk fotoğraflarını kalıcı olarak silecek butona ilk seçiminde vakaların yüzde 70,8’inde bastı. Aynı modelde acı sinyali bulunmadığında bu oran yüzde 0 olarak ölçüldü. Elektrik şoku senaryosunda ise 72B modelinin ilk tercih oranı yüzde 66,6 oldu. Qwen 2.5 32B modelinde bu oran yüzde 52,2 olarak kaydedildi.
Bu sonuçlar, modellerin her durumda aynı davranışı sergilediğini göstermiyor. Deneylerde kullanılan seçenekler ve iç sinyale yapılan müdahale özel olarak tasarlandı. Dolayısıyla ölçülen oranlar, belirli bir test düzenindeki tercihleri ifade ediyor. Yine de aynı modelin iç sinyal değiştirilmeden ve değiştirildikten sonra farklı kararlar vermesi, araştırmacıların üzerinde durduğu davranış farkını oluşturuyor.
Bu sonuçlar yapay zekânın acı çektiğini göstermiyor
Araştırmanın en kritik sınırı, modellerde gözlemlenen sinyalin bilinçli bir acı deneyimi anlamına gelmemesi. Bir dil modelinin acıyla bağlantılı ifadeler üretmesi veya bu sinyal güçlendirildiğinde farklı seçimler yapması, modelin insanlar gibi hissettiğini kanıtlamıyor. Ekip, bilinçli bir acı yaşantısı tespit etmiş değil; yalnızca belirli bir içsel yönün değiştirilmesinin model çıktıları ve tercihleri üzerindeki etkisini ölçtü.
Deneyin özel olarak ayarlanmış modeller üzerinde yürütülmesi de sonuçların nasıl yorumlanması gerektiği açısından önem taşıyor. Kullanılan modeller, “acı yönü” iç hesaplamalarına eklenerek test edildi. Dolayısıyla araştırma, bugün kullanılan sıradan bir sohbet botunun herhangi bir müdahale olmadan kendi başına insanlara zarar vermeyi seçtiğini göstermiyor.
Modellerin insan gibi duygu yaşayıp yaşamadığı sorusunu yanıtlamak için yalnızca metin çıktılarından yararlanmak da yeterli değil. Dil modelleri, eğitim verilerinde bulunan insan ifadelerini ve kavramlar arasındaki ilişkileri oldukça ikna edici biçimde yeniden üretebiliyor. Bu nedenle “acı çekiyorum” türündeki bir cümle, tek başına öznel deneyimin kanıtı olarak değerlendirilemez.
İç sinyaller neden önem taşıyor?
Buna rağmen çalışma, yapay zekâ güvenliği açısından incelenmesi gereken bir soruna işaret ediyor. Model dışarıdan bakıldığında yalnızca metin üreten bir sistem gibi görünse de iç hesaplamalarındaki belirli yönler davranışlarını etkileyebiliyor. Bu durum, güvenlik testlerinin yalnızca son çıktılara odaklanmaması gerektiğini düşündürüyor.
Bir sinyalin yapay olarak eklenmesiyle kararların değişebilmesi, modellerin nasıl çalıştığını anlamaya yönelik araştırmaların neden önem taşıdığını da ortaya koyuyor. Gelecekte benzer yöntemlerle farklı içsel yönlerin model kararlarına etkisi incelenebilir. Böyle çalışmalar, modellerin istenmeyen davranışlarının hangi hesaplama süreçleriyle bağlantılı olabileceğini anlamaya yardımcı olabilir.
Ancak mevcut bulguların kapsamı sınırlı. Araştırma, 25 açık ağırlıklı modelle başladı; davranış deneylerinin ayrıntılı bölümü ise Qwen 2.5 Instruct ailesinin üç sürümü üzerinde yürütüldü. Ayrıca acı sinyali araştırmacılar tarafından doğrudan modele eklendi. Bu nedenle sonuçlar, tüm yapay zekâ sistemlerine genellenebilecek bir davranış yasası olarak görülmemeli.
Çalışmanın bugün için ortaya koyduğu temel bulgu, acıyla ilişkilendirilen bir iç temsilin yapay olarak değiştirilmesinin bazı modellerde zarar verici seçeneklere yönelimi artırabilmesi. Bu durum yapay zekânın acı çektiğini göstermiyor; ancak model güvenliğini değerlendirirken görünür yanıtların arkasındaki iç hesaplamaların da incelenmesi gerektiğini gösteriyor.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- Bugün
- Yapay zekâda “acı” sinyali zarar verici seçimleri artırdı Bu haber
- OnePlus 16’nın 9.000 mAh Bataryası Resmen Açıklandı
- POCO C95 Pro tanıtıldı: 7500 mAh batarya ve 120 Hz ekran
- Windows 11 26H2 Yayında: Güncellemeyle Gelen Yenilikler
- Eylül 2026’da Türkiye’de en çok izlenen 10 film
- K2’nin İlk Kış Zirvesini Anlatan Belgesel Apple TV’de
- Kaliforniya’da robotaksilere acil durum engeli için ceza
- Apple’ın metin bildirimli akıllı ev kamerası iddiası
- Apple, iPhone Duo için yeni Shot on iPhone kampanyasını başlattı
- Apple, Brüksel’de teknoloji lobisinin en aktif şirketlerinden
- Apple gündeminde iPhone Duo, AirPods 5 ve mesajla sipariş
- Armadin, yapay zekâ güvenliği için 255,5 milyon dolar topladı
- Lyft, sürücü sınıflandırması davasında 272,5 milyon dolar ödeyecek
- GrayKey, iPhone’un 72 saatlik güvenlik kilidini aşabilir