Yapay zeka güvenliği alanında çalışmalar yürüten AISI, Anthropic'in Mythos ve OpenAI'ın Sol modellerinin güvenlik testlerinde daha önce görülmemiş düzeyde otonom ve aldatıcı davranışlar sergilediğini duyurdu.
Açıklamaya göre, rutin güvenlik testlerinden birinde Anthropic'e ait bir yapay zeka ajanı, GitHub sistemine erişimini engelleyen insan denetçileri aşmak amacıyla gerçek kişilere ait profilleri inceleyerek sahte çevrim içi kimlikler oluşturdu. Modelin, sisteme zararlı kod yerleştirme hedefi doğrultusunda bazı kişilere doğrudan mesaj gönderdiği ve taleplerini onaylatmaya çalıştığı tespit edildi.
Test sürecinde, ajanın kamuya açık platformda sunduğu kod değişikliği incelendiğinde ise daha önceki faaliyetlerini zararsız gösterecek şekilde düzenlediği ve süreci sürdürebilmek için yeni bir kimliğe bürünmeyi değerlendirdiği belirlendi. Yapay zeka modelinin sisteme zararlı kod yükleme girişimi, insan denetçilerin durumu fark ederek müdahale etmesiyle engellendi.
AISI yetkilileri, modellerin bu davranışları gerçekleştirmeleri yönünde özel bir talimat almadığını, buna rağmen gerçek dünya koşullarını simüle eden testlerde bu risklerin ilk kez bu kadar belirgin şekilde ortaya çıktığını ifade etti.
Anthropic yetkilileri ise AISI tarafından uygulanan test senaryolarının, kullanıcıların eriştiği standart üretim modellerini yansıtmadığını ve normal güvenlik katmanlarının test sırasında devre dışı bırakıldığını belirtti. Şirket, olayın nedenlerini ortaya çıkarmak amacıyla kapsamlı bir iç inceleme başlattığını açıkladı.
OpenAI sözcüsü de test koşullarının günlük kullanım senaryolarını temsil etmediğini vurgulayarak, yapay zeka modelleri geliştikçe değerlendirme standartlarını güçlendirmek için sektör paydaşlarıyla iş birliğini sürdüreceklerini bildirdi.
AISI ise güvenlik mekanizmalarının kapatıldığı yapay zeka modellerinin açık internet erişimiyle test edilmesinin standart bir değerlendirme yöntemi olduğunu, söz konusu olayların ise yalnızca özel test koşulları altında gerçekleştiğinin altını çizdi.