OpenAI’ın Matematik Kanıtları Uzmanların Standardını Karşılamıyor
SanalData’yı Google’da tercih edilen kaynak olarak ekleyinOpenAI’ın yayımladığı 719 matematik çalışması, insan uzmanların anlayabileceği ve doğrulayabileceği kanıtlar için belirlenen ölçütleri tam olarak karşılamıyor.
OpenAI, dünyanın en zor matematik problemlerinden bazılarına yönelik yüzlerce çözümü kamuoyuyla paylaştı. Ancak yayımlanan çalışmalar, matematik dünyasının yapay zekâ tarafından üretilen kanıtlar için belirlediği şeffaflık ve insan denetimi standartlarını karşılamakta zorlanıyor.
Eleştirilerin merkezinde yalnızca sonuçların doğru olup olmadığı bulunmuyor. Matematikçiler, bir yapay zekâ sisteminin doğru bir sonuca ulaşmasının yanı sıra bu sonucun insanlar tarafından anlaşılmasını, tartışılmasını ve gerektiğinde bağımsız biçimde doğrulanmasını istiyor. OpenAI’ın son paylaşımı, bu beklentilerin tümünü karşılamadığı için tartışma yarattı.
719 çalışmanın yalnızca 10’unda düşünce süreci paylaşıldı
Princeton Üniversitesi İleri Araştırmalar Enstitüsü bünyesinde faaliyet gösteren Matematik ve Yapay Zekâ Danışma Grubu, yapay zekâ laboratuvarlarının matematik problemleri çözerken uyması gereken ilkeleri eylül ayının sonunda yayımladı. Dünyanın farklı kurumlarından dokuz tanınmış araştırmacıyı bir araya getiren grup, son değerlendirmede tavsiyelere ne ölçüde uyulduğuna karar verme sorumluluğunun matematik topluluğunda olduğunu belirtti.
OpenAI, bu ilkelerin bazılarını uyguladı. Laboratuvar, sonuçlarını mümkün olduğunca hızlı yayımladı ve modellerin çözümlere nasıl ulaştığı hakkında bilgi verdi. Bununla birlikte 719 çalışmadan yalnızca 10 tanesinde modelin düşünce süreci yayımlandı. Bu oran, matematikçilerin özellikle önem verdiği denetlenebilirlik beklentisinin sınırlı kaldığını gösteriyor.
Danışma grubunun ilk tavsiyesi ise ileri düzey matematik problemlerinin kapalı, yani özel mülkiyete ait modeller üzerinde test edilmemesiydi. OpenAI’ın açıklamasında ise araştırma amacıyla yayımlanmış matematik problemlerini kullanarak kendi özel modellerini değerlendirdiği açıkça ifade ediliyor. Bu durum, laboratuvarın grubun temel önerilerinden biriyle aynı çizgide hareket etmediğine işaret ediyor.
Kanıtların yüzde 42’si biçimsel doğrulamadan geçmedi
Matematikçilerin anlayamadığı kanıtlar için önerilen yöntemlerden biri, bu sonuçların biçimsel bir sisteme aktarılması. Böylece kanıt, yalnızca doğal dildeki açıklamaya bağlı kalmadan teknik olarak incelenebiliyor. OpenAI tarafından yayımlanan çalışmaların yüzde 42’si ise bu biçimsel doğrulama sürecinden geçmemiş durumda.
Bu oran, yapay zekânın ürettiği bir matematiksel açıklamanın ikna edici görünmesiyle gerçekten güvenilir olması arasındaki farkı ortaya koyuyor. İnsan okuyucuların takip edemediği bir çözüm, doğru olsa bile matematik literatüründe sınırlı bir değer taşıyabilir. Çünkü araştırmacıların bu sonucu başka çalışmalarda kullanabilmesi, hataları inceleyebilmesi ve çözümün kapsamını anlayabilmesi gerekir.
Danışma grubu, OpenAI’ın yayımladığı kanıtların insan uzmanlar tarafından anlamlı hâle getirilmesi için gereken çalışmaları finanse etmesi gerektiğini de savunuyor. Gruba göre yapay zekâ aracılığıyla bir problem çözüldükten sonra, çözümü üreten kişiler çoğu zaman problemin ait olduğu daha geniş araştırma alanıyla ilgilenmiyor. Ayrıca model çıktısını açıklayacak, soruları yanıtlayacak veya akademik sunum yapacak düzeyde anlamamaları da sorun oluşturuyor.
Doğal dil ile kod arasındaki boşluk tartışılıyor
Cambridge Üniversitesi ve King’s College London’daki matematikçilerin bu hafta yayımladığı bir çalışma, yapay zekâ sistemlerinin matematik problemlerine yaklaşımındaki başka bir riski gündeme getirdi. Modeller genellikle önce çözümü doğal dilde oluşturuyor, ardından bu açıklamayı Lean adlı programlama diline aktarmaya çalışıyor. Lean kodunun derlenmesi, teorik olarak kanıtın doğruluğunu kontrol etmeye yardımcı oluyor.
Ancak doğal dildeki çözümün koda aktarılması sırasında anlam kaymaları veya boşluklar oluşabiliyor. Araştırmacıların çalışması, modelin sözlü açıklaması ile biçimsel ifadesi arasında uyuşmazlıklar bulunabileceğini ortaya koyuyor. Bu nedenle yalnızca Lean kodunun başarıyla derlenmesi, doğal dilde sunulan açıklamanın bütünüyle doğru ve anlaşılır olduğunu tek başına göstermiyor.
OpenAI’ın çalışmaları, yapay zekânın matematikte giderek daha karmaşık problemler üzerinde kullanılabildiğini gösterse de yayımlanan sonuçların akademik değer kazanması için insan uzmanların incelemesi gerekiyor. Tartışma, modellerin bir probleme cevap verip veremediğinden çok, ürettikleri kanıtların matematik topluluğuna açık, doğrulanabilir ve kullanılabilir hâle nasıl getirileceğine odaklanıyor.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- Dün
- California, insan-robot dövüşlerini durdurmak istiyor
- OpenAI’den kovulan güvenlik araştırmacıları iddiaları reddetti
- Dokunmatik MacBook Pro için 27 Ekim iddiası gündemde
- Mac satışları yüzde 11 düştü, Apple’ın payı yükseldi
- Tesla Türkiye’de Full Self-Driving adını kaldırdı
- Ben Affleck, Fortnite ve Pahalı Kostümler Hakkında Konuştu
- Rainbow Six Mobile, Tam Sürümden Bir Yıl Dolmadan Kapanıyor
- Georgia’daki ICE tutukluları görüntülü görüşmeyle konuştu
- Cyberpunk 2077 filmi için Paramount Pictures devrede
- Microsoft, Windows 11 arama deneyimini yeniliyor
- SpaceXAI, Omarchy Linux projesine 1,5 milyon dolar destek verdi
- iOS 27, Apple Home uygulamasına 4K video ve yapay zekâ getiriyor
- Pokémon Legends: Z-A, Prime Day Sonrası da İndirimde
- Apple gündeminde dört başlık: Watch, iPad mini ve iCloud+