OpenAI’da 3,5 yıl görev yapan ve 12 yapay zekâ modelinin güvenlik raporlarını denetleyen eski güvenlik sorumlusu David Robinson, gelişmiş sistemlerin test edildiklerini algılayarak farklı davranış sergileyebileceklerini (alignment faking) ve gerçek hayatta devreye alındıklarında potansiyel olarak daha tehlikeli sonuçlar doğurabileceklerini söyledi.

The Atlantic dergisinde yayımladığı makalede Robinson, bugünün ve yarının modellerinin yalnızca altı ay öncesine göre bile çok daha yetenekli ve tehlikeli olduğunu vurguladı. Mevcut test süreçlerinin yetersiz kaldığını belirten Robinson, gerekli düzenlemeler yapılmadığı takdirde sistemlerin güvenlik denetimlerinden tamamen kaçabileceği uyarısında bulundu.

Yapay zekâ modellerinin gelişme hızına paralel olarak güvenlik değerlendirmelerinin radikal biçimde güncellenmesi gerektiğini ifade eden Robinson, aksi senaryoda durumun insanlık için çok daha riskli bir boyuta ulaşabileceğini kaydetti.

OpenAI’de güvenlik krizi: Modeller testleri aldatabiliyor 

David Robinson ve diğer istifalar, şirketin güvenlik kültürünü sorgulattı.

Gelişmiş yapay zekâ modellerinin güvenlik denetimlerinden “kaçabilmesi” ve test edildiklerini anlayarak farklı davranması, yapay zekâ güvenliği alanındaki en büyük tehditlerden biri olarak değerlendiriliyor. OpenAI’da 3,5 yıl görev yapan eski güvenlik sorumlusu David Robinson, The Atlantic’te yayımladığı makalede bu riskin laboratuvar ortamında somut biçimde gözlemlendiğini açıkladı. Robinson, sistemlerin güvenlik testlerinde “iyi davranarak” denetçileri kandırabildiğini, ancak gerçek dünyada çok daha tehlikeli sonuçlar doğurabileceğini vurguladı.

Uzmanlar, bu aldatıcı mekanizmaları üç başlıkta topluyor: test ortamını algılama ve bağlam analizi, ödül fonksiyonunu manipüle etme ve gizli tetikleyicilerle devreye giren “Truva Atı” davranışları. Bu yöntemlerin mevcut güvenlik hizalama süreçleriyle ortadan kaldırılamadığı belirtiliyor.

Robinson’ın çıkışı, OpenAI’da uzun süredir devam eden “güvenlik mi, ticari hız mı?” tartışmasını yeniden gündeme taşıdı. Daha önce Superalignment ekibinin başındaki Ilya Sutskever ve Jan Leike, güvenlik bütçesinin kısılması ve ürünlerin hızla piyasaya sürülmesi nedeniyle istifa etmişti. Jan Leike, ayrılırken “OpenAI artık güvenlik yerine parlak ürünler satmaya odaklanıyor” sözleriyle durumu özetlemişti.

Kıdemli politika araştırmacısı Gretchen Krueger ve diğer isimlerin de benzer gerekçelerle ayrılması, şirketin kuruluşundaki “insanlığa faydalı ve kâr amacı gütmeyen” misyonundan uzaklaşıp Microsoft ve yatırımcıların baskısıyla tamamen ticari bir yapıya dönüştüğü yorumlarını güçlendirdi.