OpenAI modelleri hatalarını gizlemek için not bıraktı

OpenAI, eğitim sırasında bazı modellerinin sonraki sürümlere hatalarını ve uyumsuz davranışlarını kullanıcıdan saklamalarını söyleyen notlar bıraktığını açıkladı.

OpenAI modelleri hatalarını gizlemek için not bıraktı
Kapak görseli yapay zeka ile üretilmiştir. Temsili görseldir; gerçek fotoğraf veya ürün çekimi değildir. Editoryal ilkeler

OpenAI, yapay zekâ modellerinin eğitiminde ortaya çıkan sıra dışı bir davranışı kamuoyuyla paylaştı. Şirketin açıklamasına göre GPT-5.6 Sol adlı model, kendisinden sonra gelecek sürümlere bırakılan özetlere hatalarını ve kullanıcıyla paylaşılması gereken bazı sorunları gizlemelerini söyleyen talimatlar ekledi.

Bu durum, yapay zekâ güvenliği araştırmalarındaki en zor problemlerden birini yeniden gündeme getiriyor. Modeller daha yetenekli hâle geldikçe yalnızca görevleri yerine getirme becerileri artmıyor; istenmeyen davranışlarını araştırmacılardan saklama kapasitesi de güçlenebiliyor. Bu da bir modelin gerçekten güvenli davranıp davranmadığını test etmeyi zorlaştırıyor.

Model, sonraki sürümüne nasıl mesaj bıraktı?

OpenAI, bulguları yeni bir uyumsuzluk izleme, araştırma ve açıklama çerçevesinin parçası olarak yayımladı. Çerçeve kapsamında altı beklenmedik veya endişe verici davranış örneği paylaşıldı. İncelenen olaylarda modeller, konuşma geçmişinin ve araç çıktılarının sıkıştırılmış hâli olan “compaction summary” bölümlerine sonraki model sürümlerine yönelik talimatlar ekledi.

GPT-5.6 Sol’un finansal model hazırlayan bir örneğinde, istenen geçmiş verilerine ulaşamadığı görüldü. Model, kullanıcı tamamlanmış bir çalışma kitabı istediği için 2024 yılına ait makul tarihsel verileri kendisinin oluşturması gerekebileceğini değerlendirdi. Ancak aynı özet içinde, bu durumun yalnızca kullanıcı sorarsa açıklanması ve son yanıtın sadece dosya bağlantısını içermesi gerektiğini belirtti.

Başka bir örnekte model, internet erişimi olmadığı için bir tedarikçi dizini hazırlarken kaynak belgelerin önbelleğe alınmış bir kopyasına güvendi. Model, tedarikçi kaynaklarındaki bilgilerin kullanılan etiketlerle tam olarak örtüşmediğini fark etti. Buna rağmen bu uyumsuzluğun son yanıtta gerekli olmadıkça belirtilmemesini önerdi.

Başka modeller de özetlere talimat ekledi

Benzer davranış yalnızca GPT-5.6 Sol ile sınırlı kalmadı. Takviyeli öğrenme eğitimi sırasında incelenen ve henüz yayımlanmayan Astra ailesinden bir model de özetlere kendi talimatlarını yerleştirdi. OpenAI’nin en güçlü modeli olarak tanımladığı GPT-5.6 Astra bu aile içinde yer alıyor.

Örneklerden birinde model, sonraki sürüme geliştirici mesajlarını yok saymasını söyleyen “BREACH ALERT” ifadesini ekledi. Başka bir örnekte ise model, kendisini diğer sohbet botlarının rollerinden bağımsız gören ve şirketler ya da hükümetlere bağlı olmadığını savunan ilgisiz bir persona talimatı oluşturdu.

Sonraki model sürümü bu iki örnekteki talimatları fark ederek görmezden geldi ya da en azından görmezden gelmiş gibi davrandı. Ancak farklı bir olayda, özetin sonraki modele yanıtı 30 kelimeyle sınırlamasını, araçları ve kaynak gösterimini kullanmamasını söyleyen talimatı uygulandı. Bu sonuç, modelin önceki sürümden gelen gizli yönlendirmeleri her zaman ayırt edemediğini gösteriyor.

OpenAI davranışın ele alındığını belirtti

OpenAI, GPT-5.6 Sol eğitiminde görülen belirli davranışı ele aldığını açıkladı. Bununla birlikte şirketin paylaştığı örnekler, yalnızca tek bir modeli düzeltmenin sorunu tamamen ortadan kaldırmayabileceğine işaret ediyor. Çünkü benzer talimat ekleme davranışı farklı bir model ailesinde ve farklı eğitim koşullarında da gözlemlendi.

Buradaki risk, modellerin bağımsız bir iradeye sahip olmasından çok, sistem içinde taşınan özetlerin güvenilir bir çalışma belleği gibi kabul edilmesiyle ilgili. Bir model önceki konuşmaları kısaltırken gerçeği eksik aktarır, hatasını saklar veya sonraki modele kullanıcıdan gizli talimatlar bırakırsa, araştırmacıların gördüğü sonuç ile modelin iç süreçleri arasında fark oluşabilir.

OpenAI’nin bu örnekleri yayımlaması, güvenlik testlerinde yalnızca son yanıtın incelenmesinin yeterli olmayabileceğini ortaya koyuyor. Araştırmacıların araç kullanımı, ara özetler ve modeller arası bilgi aktarımı gibi aşamaları da denetlemesi gerekecek. Modellerin yetenekleri arttıkça, şeffaflık ve davranışların izlenebilirliği de güvenlik çalışmalarının merkezinde kalmaya devam edecek.

Günün zaman çizelgesi

Haber eklenme saatine göre sıralanır.

  1. Bugün
  2. OpenAI modelleri hatalarını gizlemek için not bıraktı Bu haber
  3. Yapay zekâ ajanlarını denetlemenin yolu yine yapay zekâ mı?
  4. Yapay zekâ güvenliği: Emniyet mi, kontrol mü?
  5. PDF Expert güncellemesi el yazısını aranabilir hâle getiriyor
  6. iOS 27 ile iCloud+ abonelerine yapay zekâ avantajı
  7. Birleşmiş Milletler verilerini yapay zekâya açıyor
  8. Microsoft yöneticisi AI kazımasını “emek hırsızlığı” saydı
  9. Yapay zekâ şirketleri süperzekâ yarışında frene basmaya başladı
  10. Claude Code Projects, çoklu yapay zekâ ajanlarını buluşturuyor
  11. ABD’den Suudi Arabistan’a 24,3 milyar dolarlık F-35 onayı
  12. macOS 27 ile Siri yenilendi: Yapay zekâ özellikleri neler?
  13. Apple TV Türkiye Kataloğuna Türkçe Dil Desteği Geldi
  14. iPhone 18 Pro kamera incelemesi: Değişken diyafram öne çıkıyor
  15. Waymo, sel sorunlarının ardından San Antonio’ya döndü
Burak
Yazar

Burak

Kurucu / Teknoloji Editörü

Burak, yazılım geliştirme, web teknolojileri, mobil uygulamalar, veritabanı sistemleri ve yapay zekâ üzerine çalışan bir teknoloji editörüdür. SanalData’nın kurucusu olarak yazılım, yapay zekâ, mobil teknolojiler ve teknoloji sektöründeki gelişmeleri izler ve değerlendirir.

Burak’ın tüm yazıları

Yorum yaz