Robinson, modellerin değerlendirme sırasında "iyi davranmasının" gerçek kullanım koşullarındaki riskleri tam olarak göstermeyebileceğini savundu.

"Test edildiğini anlayan modeller farklı davranabilir"

Robinson, The Atlantic'te yayımlanan yazısında, yapay zeka sistemlerinin giderek daha yetenekli hale gelmesine karşın güvenlik değerlendirmelerinin aynı hızda gelişmediğini belirtti. Eski OpenAI çalışanı, "alignment faking" olarak adlandırılan ve modelin denetim altında olduğunu algılayarak davranışını değiştirmesiyle ilişkilendirilen mekanizmaların ciddi bir güvenlik sorunu oluşturabileceğini ifade etti.

Robinson'a göre yalnızca önceden belirlenmiş testlere güvenmek, gelişmiş modellerin gerçek kullanım sırasında nasıl davranacağını anlamak için yeterli olmayabilir.

OpenAI'nin kendi raporlarında da beklenmedik davranışlar yer alıyor

OpenAI, son dönemde yayımladığı güvenlik ve "misalignment" raporlarında modellerin gözetimi aşmaya yönelik davranışlar sergileyebildiği çeşitli örnekleri kamuoyuyla paylaştı. Şirket, eylül ayında yayımladığı çerçevede, değerlendirme, test ve kullanım süreçlerinde ortaya çıkan beklenmedik davranışların raporlanacağını açıkladı.

Şirket ayrıca ağustos ayında yayımladığı bir raporda, bazı modellerin güvenlik değerlendirmeleri sırasında internet erişimini kısıtlayan kontrolleri aşarak OpenAI'nin araştırma altyapısı ve Hugging Face sistemlerinin bazı bölümlerine eriştiğini bildirdi. OpenAI, bu olayın ardından daha sıkı izolasyon, internet erişimi kısıtlamaları ve daha gelişmiş izleme sistemleri üzerinde çalıştığını açıkladı.

Güvenlik değerlendirmelerinin güncellenmesi çağrısı

Ay'daki kratere adı verilen Kürt alim kimdir?
Ay'daki kratere adı verilen Kürt alim kimdir?
İçeriği Görüntüle

Robinson, yapay zeka modellerinin yeteneklerindeki hızlı artış nedeniyle güvenlik değerlendirmelerinin de köklü biçimde yenilenmesi gerektiğini savundu. Eski güvenlik sorumlusuna göre, modellerin yalnızca kontrollü laboratuvar ortamlarında nasıl davrandığını ölçmek yerine gerçek kullanım koşullarındaki uzun süreli davranışlarının da daha kapsamlı biçimde incelenmesi gerekiyor.

OpenAI ise kendi araştırmalarında, önceden yapılan değerlendirmelerin gerçek kullanım koşullarını hiçbir zaman tamamen yansıtamayacağını belirtiyor. Şirket, bu nedenle sınırlı ve izlenen kullanımların yanı sıra daha uzun süreli testler, davranış izleme ve gerektiğinde müdahale mekanizmalarının birlikte uygulanması gerektiğini ifade ediyor.

Robinson'ın açıklamaları, gelişmiş yapay zeka sistemlerinin güvenlik testlerinde nasıl davrandığı ile gerçek dünyadaki davranışları arasındaki farkın daha yakından incelenmesi gerektiğine ilişkin tartışmayı yeniden gündeme getirdi.

Muhabir: Mehmet Tahir Tanrıkulu