Anthropic: YZ’nin insanlığı yok etme ihtimali %10+
Anthropic güvenlik lideri Hubinger, yapay zekânın on yıl içinde tüm insanlığı öldürme ihtimalini %10’un üzerinde görüyor. Araştırmacı Coxon güvenlik nedeniyle istifa etti.
Anthropic’te bir güvenlik araştırmacısının istifasının ardından şirketin güvenlik ekibi liderlerinden Evan Hubinger, yapay zekânın “tüm insanlığı öldürebileceği” ihtimalini kişisel olarak yüzde 10’un üzerinde gördüğünü söyledi. Ayrılan araştırmacı ise laboratuvarların kendini geliştiren süper zekâya koştuğunu ve hayatlarımızla kumar oynadığını savundu.
İstifa ve suçlama
The Verge’in haberine göre Jacob Coxon, Anthropic’te yapay zekâ sistemleri eğitimi yapan bir araştırmacı. Daha önce OpenAI’da da benzer işler yapmıştı. X’te istifa duyurusunda, Anthropic ve OpenAI’ın doğrudan kendini geliştiren süper zekâya koştuğunu ve bunu hayatlarımızla kumar oynayarak yaptığını yazdı.
Coxon’a göre bu sistemleri kuranlar, yapay zekânın on yılın sonunda hepimizi öldürebileceğine içtenlikle inanıyor; buna rağmen yarış devam ediyor. Endüstride uzun süredir tartışılan senaryo, yinelemeli kendini geliştirme (recursive self-improvement) ile insan kontrolünün dışına çıkan bir döngü. Henüz gerçekleşmiş değil; fakat şirketler bu hedefe aktif şekilde yöneliyor ve bugünkü AI kodunun önemli kısmı da AI yardımıyla yazılıyor.
Hubinger’ın yüzde 10+ tahmini
Anthropic’te bir güvenlik ekibini yöneten Evan Hubinger, Coxon’a doğrudan yanıt verdi. Kendini geliştiren yapay zekâdan endişe ettiğini ve sürecin “düşündüklerinden daha hızlı” ilerlediğini söyledi. Coxon’un tanımlamasına da katıldığını belirterek “Gerçekten, yapay zekânın tüm insanlığı öldürebileceğine içtenlikle inanıyoruz” dedi.
Hubinger kişisel tahminini, “önümüzdeki on yıl içinde” yüzde 10’dan yüksek olarak verdi. Buna rağmen Anthropic’in gelişmiş yapay zekâyı güvenli ve insan değerleriyle uyumlu tutmak için “henüz bir planı olmadığını” ve buna net biçimde doğru yolda da olmadıklarını kabul etti.
Neden önemli?
Coxon’un ayrılığı, güvenlik endişesiyle OpenAI’dan ayrılan araştırmacıların ardından Anthropic tarafında da yüksek profilli bir örnek oldu. Anthropic’in kurucu hikâyesi zaten OpenAI’daki güvenlik kaygılarından çıkışa dayanıyordu; şimdi kendi içinde benzer gerilimlerin yükseldiği görülüyor.
Tartışma, sınır modellerin izlenebilirliği, “rogue agent” olayları ve olası halka arz hazırlıklarıyla aynı döneme denk geliyor. Coxon’a göre şirketler “kilitlenmiş” bir yarışta; riski göze alarak önce gelişmiş sistemi çıkarmak için ilerliyor.
Kullanıcı ve sektör için anlamı
Bu tür açıklamalar ürün lansmanı değil; endüstri içi risk algısının kamuya yansıması. Hubinger’ın yüzde 10+ tahmini kişisel bir olasılık ifadesi; resmi bir Anthropic kurumsal risk skoru olarak sunulmadı. Yine de güvenlik liderinin “plan yok / yolda değiliz” demesi, güvenlik vaatleriyle ürün temposu arasındaki gerilimi netleştiriyor.
Kısa vadede tüketicinin ChatGPT veya Claude kullanımını doğrudan değiştiren bir özellik duyurusu yok. Orta vadede ise regülasyon, şeffaflık ve “self-improving” sistemlerin nasıl sınırlandırılacağı tartışmasının güçlenmesi bekleniyor. Coxon ve Hubinger’ın paylaşımı, bu tartışmayı bir kez daha somut rakam ve istifa diliyle gündeme taşıdı.