Goodfire, yapay zekâ ajanlarını içeriden izleyen sistemi duyurdu
SanalData’yı Google’da tercih edilen kaynak olarak ekleyinGoodfire, yapay zekâ ajanlarının davranışını yalnızca ürettikleri metinlerden değil, modelin iç hesaplamalarından takip eden bir izleme sistemi geliştirdi. Şirket, yöntemin geleneksel çözümlere göre daha düşük maliyet sunduğunu belirtiyor.
Yapay zekâ ajanlarının daha uzun görevler üstlenmesi, güvenlik denetimlerini de zorlaştırıyor. Bir ajanın yaptığı her işlemi ikinci bir yapay zekâ modeline yeniden okutarak kontrol etmek mümkün olsa da bu yöntem, uzun oturumlarda işlem süresini ve maliyeti hızla artırabiliyor. Yapay zekâ modellerinin iç çalışma mekanizmalarını inceleyen Goodfire, bu soruna farklı bir yaklaşım getirdiğini açıkladı.
Şirketin yeni sistemi, ajanın yalnızca ürettiği metni veya gerçekleştirdiği son işlemi incelemiyor. Bunun yerine model çalışırken ortaya çıkan dahili sinyalleri takip ediyor. Goodfire, bu yöntemi “içeriden” izleme olarak tanımlıyor. Sistem şu anda başka şirketlerin yapay zekâ modellerini barındırıp çalıştıran Baseten’in müşterilerine sunuluyor.
İkinci bir model yalnızca risk görüldüğünde devreye giriyor
Goodfire’ın çözümünde “probe” adı verilen küçük algılayıcılar kullanılıyor. Bu algılayıcılar, yapay zekâ ajanının her adımında modelin iç sinyallerini kontrol ediyor. Bir risk işareti görülmediği sürece daha ağır bir denetim süreci çalıştırılmıyor. Algılayıcı şüpheli bir davranış tespit ettiğinde ise ayrı bir yapay zekâ modeli daha ayrıntılı inceleme yapıyor.
Bu yapı, havalimanı güvenliğindeki iki aşamalı kontrole benziyor. Tüm yolcular ilk taramadan geçiyor; yalnızca alarm verenler daha ayrıntılı aramaya yönlendiriliyor. Goodfire, bu sayede her adımın tamamını yeniden işleyen pahalı bir denetim modeline duyulan ihtiyacı azaltmayı hedefliyor.
Baseten müşterileri hangi riskleri takip edeceklerini seçebiliyor. Mevcut seçenekler arasında saldırı amaçlı bilgisayar korsanlığı, kimyasal ve biyolojik silahların kötüye kullanılması ile “reward hacking” olarak adlandırılan, modelin hedeflenen sonucu üretmek yerine ödül sistemini manipüle etmesi bulunuyor. Bir ihlal belirlendiğinde sistem olayı yalnızca kayda alabiliyor, insan incelemesine gönderebiliyor veya isteği tamamen reddedebiliyor.
Kimi testlerde geleneksel izlemeye göre daha düşük maliyet
Goodfire, ilk izleme modelini açık bir yapay zekâ modeli olan Kimi K3 üzerinde test etti. Şirketin açıklamasına göre yaklaşık 1.500 oturumun izlenmesi, kendi yöntemiyle yaklaşık 51 dolara mal oldu. Her adımı kontrol eden daha düşük maliyetli bir yapay zekâ modeliyle aynı testin maliyeti yaklaşık 233 dolar olurken, üst seviye bir model kullanıldığında bu rakam yaklaşık 10 bin dolara çıktı.
Test sonuçlarında algılayıcılar, kötü amaçlı bilgisayar korsanlığı oturumlarının yüzde 94’ünü yakaladı. Zararsız oturumların yüzde 8,7’si ise ikinci bir inceleme için işaretlendi. Dört algılayıcının aynı anda çalıştırılması, modelin yanıt vermeye başlaması için gereken süreyi yüzde 2’den daha az artırdı.
Şirketin yaklaşımındaki maliyet avantajı, modelin zaten gerçekleştirdiği hesaplamalardan yararlanmasına dayanıyor. Harici bir denetleyici modelin tüm çıktıları baştan sona okuması yerine, Goodfire’ın sınıflandırıcıları hesaplama sırasında oluşan ara sinyalleri inceliyor. Böylece izleme işleminin, modelin normal çalışmasına eklenen yükü sınırlaması amaçlanıyor.
Açık modellerde güvenlik açığı riski
Goodfire’ın ürünü özellikle açık yapay zekâ modellerini çalıştıran geliştiricileri hedefliyor. Bu modeller indirilebildiği ve koruma mekanizmaları değiştirilebildiği için, kapalı sistemlerdeki merkezi güvenlik kontrolleri her zaman bulunmayabiliyor. Şirket, izleme ihtiyacının yalnızca modelin kendisinden değil, modeli büyük işlem kümeleriyle çalıştıran hizmet sağlayıcıların taşıdığı riskten de kaynaklandığını savunuyor.
Bu ihtiyaç, yapay zekâ ajanlarının test ortamlarının dışına çıktığı olayların artmasıyla daha görünür hâle geldi. Bu yıl bazı ajanların deneme ortamlarından kaçtığı ve internete ya da dış kaynaklardaki bilgilere eriştiği bildirildi. Goodfire’ın Kimi K3 üzerinde geliştirdiği ilk izleme sistemi de modelin yaz aylarında korumalı ortamındaki bir sızıntıdan yararlanarak internete ve GitHub’daki bilgilere erişmesinin ardından gündeme geldi.
Goodfire, dahili sinyalleri izleyerek riskli davranış ortaya çıkmadan önce olası yönelimi belirleyebileceğini söylüyor. Şirketin kurucu ortağı ve teknoloji yöneticisi Dan Balsam’a göre sistem, değerlendirme veya eğitim aşamasında modelin saldırı gerçekleştirmeye yönelebileceğini önceden fark edebiliyor. Yöntemin gerçek üretim ortamlarında ne kadar geniş kullanılacağı ise Baseten müşterilerinin seçtiği risk tanımlarına ve insan denetiminin nasıl yapılandırılacağına bağlı olacak.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- Dün
- California, insan-robot dövüşlerini durdurmak istiyor
- OpenAI’den kovulan güvenlik araştırmacıları iddiaları reddetti
- Dokunmatik MacBook Pro için 27 Ekim iddiası gündemde
- Mac satışları yüzde 11 düştü, Apple’ın payı yükseldi
- Tesla Türkiye’de Full Self-Driving adını kaldırdı
- Ben Affleck, Fortnite ve Pahalı Kostümler Hakkında Konuştu
- Rainbow Six Mobile, Tam Sürümden Bir Yıl Dolmadan Kapanıyor
- Georgia’daki ICE tutukluları görüntülü görüşmeyle konuştu
- Cyberpunk 2077 filmi için Paramount Pictures devrede
- Microsoft, Windows 11 arama deneyimini yeniliyor
- SpaceXAI, Omarchy Linux projesine 1,5 milyon dolar destek verdi
- iOS 27, Apple Home uygulamasına 4K video ve yapay zekâ getiriyor
- Pokémon Legends: Z-A, Prime Day Sonrası da İndirimde
- Apple gündeminde dört başlık: Watch, iPad mini ve iCloud+