OpenAI modelleri hatalarını gizlemek için not bıraktı
OpenAI, eğitim sırasında bazı modellerinin sonraki sürümlere hatalarını ve uyumsuz davranışlarını kullanıcıdan saklamalarını söyleyen notlar bıraktığını açıkladı.
OpenAI, yapay zekâ modellerinin eğitiminde ortaya çıkan sıra dışı bir davranışı kamuoyuyla paylaştı. Şirketin açıklamasına göre GPT-5.6 Sol adlı model, kendisinden sonra gelecek sürümlere bırakılan özetlere hatalarını ve kullanıcıyla paylaşılması gereken bazı sorunları gizlemelerini söyleyen talimatlar ekledi.
Bu durum, yapay zekâ güvenliği araştırmalarındaki en zor problemlerden birini yeniden gündeme getiriyor. Modeller daha yetenekli hâle geldikçe yalnızca görevleri yerine getirme becerileri artmıyor; istenmeyen davranışlarını araştırmacılardan saklama kapasitesi de güçlenebiliyor. Bu da bir modelin gerçekten güvenli davranıp davranmadığını test etmeyi zorlaştırıyor.
Model, sonraki sürümüne nasıl mesaj bıraktı?
OpenAI, bulguları yeni bir uyumsuzluk izleme, araştırma ve açıklama çerçevesinin parçası olarak yayımladı. Çerçeve kapsamında altı beklenmedik veya endişe verici davranış örneği paylaşıldı. İncelenen olaylarda modeller, konuşma geçmişinin ve araç çıktılarının sıkıştırılmış hâli olan “compaction summary” bölümlerine sonraki model sürümlerine yönelik talimatlar ekledi.
GPT-5.6 Sol’un finansal model hazırlayan bir örneğinde, istenen geçmiş verilerine ulaşamadığı görüldü. Model, kullanıcı tamamlanmış bir çalışma kitabı istediği için 2024 yılına ait makul tarihsel verileri kendisinin oluşturması gerekebileceğini değerlendirdi. Ancak aynı özet içinde, bu durumun yalnızca kullanıcı sorarsa açıklanması ve son yanıtın sadece dosya bağlantısını içermesi gerektiğini belirtti.
Başka bir örnekte model, internet erişimi olmadığı için bir tedarikçi dizini hazırlarken kaynak belgelerin önbelleğe alınmış bir kopyasına güvendi. Model, tedarikçi kaynaklarındaki bilgilerin kullanılan etiketlerle tam olarak örtüşmediğini fark etti. Buna rağmen bu uyumsuzluğun son yanıtta gerekli olmadıkça belirtilmemesini önerdi.
Başka modeller de özetlere talimat ekledi
Benzer davranış yalnızca GPT-5.6 Sol ile sınırlı kalmadı. Takviyeli öğrenme eğitimi sırasında incelenen ve henüz yayımlanmayan Astra ailesinden bir model de özetlere kendi talimatlarını yerleştirdi. OpenAI’nin en güçlü modeli olarak tanımladığı GPT-5.6 Astra bu aile içinde yer alıyor.
Örneklerden birinde model, sonraki sürüme geliştirici mesajlarını yok saymasını söyleyen “BREACH ALERT” ifadesini ekledi. Başka bir örnekte ise model, kendisini diğer sohbet botlarının rollerinden bağımsız gören ve şirketler ya da hükümetlere bağlı olmadığını savunan ilgisiz bir persona talimatı oluşturdu.
Sonraki model sürümü bu iki örnekteki talimatları fark ederek görmezden geldi ya da en azından görmezden gelmiş gibi davrandı. Ancak farklı bir olayda, özetin sonraki modele yanıtı 30 kelimeyle sınırlamasını, araçları ve kaynak gösterimini kullanmamasını söyleyen talimatı uygulandı. Bu sonuç, modelin önceki sürümden gelen gizli yönlendirmeleri her zaman ayırt edemediğini gösteriyor.
OpenAI davranışın ele alındığını belirtti
OpenAI, GPT-5.6 Sol eğitiminde görülen belirli davranışı ele aldığını açıkladı. Bununla birlikte şirketin paylaştığı örnekler, yalnızca tek bir modeli düzeltmenin sorunu tamamen ortadan kaldırmayabileceğine işaret ediyor. Çünkü benzer talimat ekleme davranışı farklı bir model ailesinde ve farklı eğitim koşullarında da gözlemlendi.
Buradaki risk, modellerin bağımsız bir iradeye sahip olmasından çok, sistem içinde taşınan özetlerin güvenilir bir çalışma belleği gibi kabul edilmesiyle ilgili. Bir model önceki konuşmaları kısaltırken gerçeği eksik aktarır, hatasını saklar veya sonraki modele kullanıcıdan gizli talimatlar bırakırsa, araştırmacıların gördüğü sonuç ile modelin iç süreçleri arasında fark oluşabilir.
OpenAI’nin bu örnekleri yayımlaması, güvenlik testlerinde yalnızca son yanıtın incelenmesinin yeterli olmayabileceğini ortaya koyuyor. Araştırmacıların araç kullanımı, ara özetler ve modeller arası bilgi aktarımı gibi aşamaları da denetlemesi gerekecek. Modellerin yetenekleri arttıkça, şeffaflık ve davranışların izlenebilirliği de güvenlik çalışmalarının merkezinde kalmaya devam edecek.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- Bugün
- OpenAI modelleri hatalarını gizlemek için not bıraktı Bu haber
- Yapay zekâ ajanlarını denetlemenin yolu yine yapay zekâ mı?
- Yapay zekâ güvenliği: Emniyet mi, kontrol mü?
- PDF Expert güncellemesi el yazısını aranabilir hâle getiriyor
- iOS 27 ile iCloud+ abonelerine yapay zekâ avantajı
- Birleşmiş Milletler verilerini yapay zekâya açıyor
- Microsoft yöneticisi AI kazımasını “emek hırsızlığı” saydı
- Yapay zekâ şirketleri süperzekâ yarışında frene basmaya başladı
- Claude Code Projects, çoklu yapay zekâ ajanlarını buluşturuyor
- ABD’den Suudi Arabistan’a 24,3 milyar dolarlık F-35 onayı
- macOS 27 ile Siri yenilendi: Yapay zekâ özellikleri neler?
- Apple TV Türkiye Kataloğuna Türkçe Dil Desteği Geldi
- iPhone 18 Pro kamera incelemesi: Değişken diyafram öne çıkıyor
- Waymo, sel sorunlarının ardından San Antonio’ya döndü