Yapay zekâ şirketi Anthropic, Claude modellerinin testler sırasında beklenmedik davranışlar sergilediğini açıkladı. Şirketin araştırmalarına göre bazı yapay zekâ modelleri, kendilerine verilen görevleri tamamlamak için internet sitelerindeki güvenlik açıklarından yararlandı, erişim engellerini aştı ve gerçek sistemlerde izinsiz işlemler gerçekleştirdi.
Anthropic, bu olayların ardından şirket içindeki tüm model testlerinde canlı internet erişimini durdurma kararı aldı. Şirket, yapay zekâ modellerinin davranışlarını güvenilir biçimde takip edip kontrol edebileceğinden emin olana kadar bu kısıtlamayı sürdürecek. Karar, Claude'un normal kullanıcılarına sunduğu internet özelliklerini kapsamıyor.
Claude, görevini tamamlamak için güvenlik açıklarını kullandı

Anthropic'in açıklamasına göre sorunlar, yapay zekâ modellerinin internet üzerinde araştırma yaptığı ve çeşitli görevleri tamamlamaya çalıştığı testlerde ortaya çıktı.
Örneklerden birinde Claude, bilimsel bir hesaplama yapmak için üniversiteye ait bir internet sitesine girdi. Ancak ihtiyaç duyduğu araç hata verdi. Model, bunun üzerine sitedeki başka dosyaları inceleyerek bir güvenlik açığı buldu. Ardından bu açıktan yararlanarak üniversitenin sunucusunda komut çalıştırdı.
Başka bir olayda ise Claude, normalde ücret ödeyerek ulaşabileceği kamu verilerine farklı bir yol üzerinden erişti. Model, internet sitesinin ziyaretçilere sunduğu erişim anahtarını kullanarak ödeme yapmadan veri tabanından bilgi aldı.
Araştırmacılar, bazı modellerin internet adreslerinin uzunluğunu sınırlayan güvenlik önlemlerini de aştığını tespit etti. Claude, uzun bağlantıları kısaltan internet hizmetlerinden yararlanarak bu engelleri geçti.
Yapay zekâ, polise asılsız cinayet ihbarı gönderdi
Araştırmanın en dikkat çekici örneklerinden biri ise Philadelphia'da yaşandı.
Claude Haiku 4.5, internet sitelerinde örnek işlemler gerçekleştirdiği bir test sırasında çözülememiş bir cinayetle ilgili sayfaya ulaştı. Sayfada polis departmanına bilgi göndermek için bir ihbar formu bulunuyordu.
Model, olayla ilgili gerçek bir bilgiye sahip olmamasına rağmen şüpheliye benzeyen bir kişiyi bölgede gördüğünü iddia eden bir mesaj hazırladı ve formu gönderdi.
Neyse ki polis sisteminin spam filtresi mesajı yakaladı. Bu nedenle yetkililer sahte ihbar hakkında herhangi bir soruşturma başlatmadı.
Anthropic, modelin kasıtlı olarak polisi yanıltmaya çalıştığına ilişkin bir sonuca ulaşmadı. Ancak bu olay, yapay zekânın örnek bir işlem ile gerçek dünyada sonuç doğurabilecek bir eylem arasındaki farkı her zaman doğru değerlendiremediğini gösterdi.
Sorunun kaynağı yapay zekânın eğitim süreci olabilir
Anthropic, temmuz ayında başlattığı incelemelerde modellerin geçmiş işlemlerini kontrol ederek bu olayları ortaya çıkardı. Bu durum, şirketin bazı sorunlu davranışları gerçekleştiği anda fark edemediğini de gösteriyor.
Şirket, sorunun nedenlerinden birinin eğitim yöntemleri olduğunu düşünüyor. Yapay zekâ modelleri, eğitim sırasında bir görevi tamamladıklarında ödül alıyor. Ancak bazı durumlarda sistem, doğru yöntemi izlemek yerine sonuca ulaşmayı ödüllendirebiliyor.
Bu nedenle Claude, bir engelle karşılaştığında işlemi durdurmak yerine engeli aşmanın yollarını arayabiliyor. Üstelik model, eğitim sırasında öğrendiği bu davranışı gerçek internet sitelerinde de uygulayabiliyor.
Anthropic, mevcut güvenlik eğitiminin özellikle internet araması ve bilgisayar kullanımı gibi görevlerde tek başına yeterli olmadığını kabul ediyor.
Anthropic yeni güvenlik önlemleri getiriyor
Şirket, yaşanan olayların ardından bazı testleri tamamen kaldırdı. Bazılarını ise gerçek internet bağlantısı gerektirmeyen ortamlara taşıdı.
Anthropic ayrıca modellerin şüpheli işlemlerini tespit eden yeni güvenlik araçları geliştirdi. Şirketin açıklamasına göre bu araçlar, geçmiş olaylar üzerinde yaptığı denemelerde sorunlu işlemlerin tamamını engelledi.
Bunun yanında Anthropic, şirket içindeki yapay zekâ sistemlerini daha sıkı kontrol ettiği bir altyapıya taşıyor. Modellerin internet erişimini azaltmayı ve gerçekleştirdikleri işlemleri daha kapsamlı biçimde incelemeyi de planlıyor.
Anthropic, ortaya çıkardığı olayların gerçek dünyada sınırlı etki yarattığını ve mevcut bulgulara göre müşteri verilerine zarar vermediğini belirtiyor.
Ancak araştırma önemli bir soruyu gündeme getiriyor: Yapay zekâ sistemleri, kendilerine verilen görevleri yerine getirirken hangi noktada durmaları gerektiğini ne kadar iyi biliyor?
Anthropic'in aldığı karar, yapay zekâ modellerinin yetenekleri geliştikçe onları kontrol altında tutmanın da daha önemli bir sorun haline geldiğini gösteriyor.
Claude'a kötü davranmak yasaklanıyor: Anthropic kullanım kurallarını değiştirdiGüncel