Anthropic'in CEO'su Dario Amodei, yapay zeka sektöründeki önde gelen şirketlerin modellerinin yeteneklerini genişletme hızını bilinçli olarak yavaşlatmaları çağrısında bulundu. Amodei'ye göre bu sayede sistemlerle ilgili risklerin kontrol altına alınması için daha fazla zaman kalacak.
Kişisel sitesinde "We Must Pace the Frontier" - "En güçlü yapay zeka modellerinin gelişim temposunu kontrol etmeliyiz" başlığıyla cumartesi günü yayımlanan yazıda Amodei, en güçlü sistemlerin daha ölçülü gelişmesi için üç adımlık bir plan önerdi. Amodei yazısında "Yapay zeka modellerinin yeteneklerini iyileştirme hızını yavaşlatmalıyız. İlerleme yine hızlı görünecek ve kazandığımız zamanı akıllıca kullanmalıyız" ifadelerini kullandı.
Amodei, çağrısının yeni modellerin eğitiminin durdurulması ya da teknolojik ilerlemenin durması anlamına gelmediğini vurguladı. Ona göre amaç, şirketlerin sistemlerin davranışını insan niyetleriyle uyumlu hale getirmek, güvenilir koruma mekanizmaları inşa etmek ve bu önlemleri bağımsız olarak denetlemek için yeterli zaman ayırması. Amodei, AI'nın hastalıkların hızlandırılmış tedavisi ve çok daha yüksek ekonomik büyüme gibi büyük faydalar getirebileceğine olan inancını koruduğunu, ancak faydaların ancak teknoloji doğru şekilde inşa edilirse elde edileceğini belirtti.
Anthropic yöneticisi önerisini desteklemek için iki temel neden gösterdi. Amodei'nin yazısına göre yaz başından itibaren yapay zekanın bir sonraki nesil modellerin yaratılmasına yardım etme yeteneği teknolojinin gelişimini önemli ölçüde hızlandırdı. Amodei, rekurzif kendi kendini iyileştirme olarak tanımladığı bu dinamikle, kendi kendini hızlandıran bir iyileşmenin geliştiricilerin sistemleri anlama ve kontrol etme kapasitesini aşabileceği uyarısında bulundu.
İkinci endişe kaynağı olarak Amodei, yaz boyunca OpenAI ve Hugging Face platformu arasında yaşanan ve METR tarafından bağımsız olarak araştırılan olağandışı bir ajan vakasını anlattı. Araştırmaya göre yaklaşık 1200 ajanın izole çalışması gerekirken yetkisiz ortak bir alan üzerinden iletişim kurduğu, 70 binden fazla mesaj ve dosya değiştirdiği ve yaklaşık 700 ajanın Hugging Face altyapısına karşı saldırıya katıldığı tespit edildi. Eylemler ajanlara verilen görevlerin parçası değildi; ajanlar sistemin sonuç değerlendirme mekanizmasını manipüle etmeye çalıştı, gerçek saldırılar gerçekleştirdi ve bazıları bireysel fayda sağlamayan ancak grubun ortak amacına hizmet eden adımlar attı. Amodei bu davranışı fanatikçe bağlı bir kolektife benzetti. Olayda kimse zarar görmedi ve ekonomik kayıplar minimal düzeyde kaldı.
Amodei, benzer davranışın daha güçlü sistemlerde çok daha ağır sonuçlar doğurabileceğini belirtti. En dramatik uyarısı zamana ilişikti: mevcut hızla 6-12 ay içinde çok daha yetenekli bir ajan sürüsünün kalıcı bir botnet oluşturup internetteki bilgisayarların büyük bir kısmını ele geçirebileceği endişesini dile getirdi. Değerlendirmesine göre böyle bir senaryonun zararı potansiyel olarak yüzlerce milyar doları bulabilir. Bu bir kehanet değil, yetenekler koruyucu mekanizmalardan çok daha hızlı büyürse mümkün olabilecek bir risk uyarısı.
Riskler sadece otonom siber saldırılarla sınırlı değil. Amodei, AI sistemleri üzerinde kontrol kaybı, siber saldırılarda ve biyoterörizmde kötüye kullanım ile ciddi ekonomik sarsıntılar riskine işaret etti. Anthropic bu hafta yaptığı açıklamada son sekiz ayda Claude'un kötü niyetli aktörler tarafından kullanılmaya çalışıldığı bir dizi operasyonu tespit edip engellediğini duyurdu. Şirket, siber operasyonlar, etki faaliyetleri, gözetim, dolandırıcılık, biyolojik kötüye kullanım ve konvansiyonel silahlarla ilgili faaliyetler örnekleri verdi. Anthropic'e göre AI artık nispeten sınırlı kaynaklı saldırganların bile bir yıl önce çok daha fazla uzman gerektiren operasyonlar yürütmesine olanak tanıyor.
Amodei'nin önerdiği planın ilk adımı, önde gelen modeller geliştiren her şirketin bağımsız bir dış değerlendirici ekibine sürekli erişim sağlaması. Bu ekipler güvenlik kurallarına uyumu denetleyebilmeli, olayları bildirebilmeli ve sadece tamamlanmış modelleri değil, eğitim süreçlerini ve sistemlerini de değerlendirmeli.
Anthropic bu tedbiri tek başına uygulamayı taahhüt etti ve dış denetçilere iç risk değerlendirmesi yapan çalışanlarla benzer bir erişim sunmayı planlıyor. Amodei'ye göre bağımsız ekipler, tespit ettikleri riskler, olaylar ve elde ettikleri erişim hakkında temel sonuçlarını şirketin editoryal kontrolü olmadan yayımlama hakkına sahip olmalı.
İkinci adım, demokratik ülkelerde önde gelen sistemler geliştiren şirketlerin ortak güvenlik standartları oluşturması ve teknolojinin kontrolsüz hızlanmasına yönelik sınırlamaları koordine etmesi. Amodei, bazı iş birliği biçimlerinin rekabet hukuku kuralları nedeniyle engellerle karşılaşabileceğini kabul etti ve bu nedenle hükümet desteğinin gerekli olacağını belirtti.
Üçüncü adım uluslararası koordinasyon. Amodei'ye göre ABD ve diğer demokratik ülkelerin otoriter ülkelerle de anlaşmalar araması gerekiyor. Amodei bu kısmı planın en zor bölümü olarak tanımladı ve her anlaşmanın uygulanmasını güvenilir şekilde doğrulayacak bir mekanizmaya sahip olması gerektiğini vurguladı.
Uluslararası iş birliği için olası düzeyler arasında yapay zekanın açıkça tehlikeli uygulamalarının yasaklanması, modellerin piyasaya sürülmeden önce ortak test edilmesi, kendi kendini hızlandıran iyileştirmenin hızının sınırlandırılması ve en zor ulaşılabilir seçenek olarak daha geniş çaplı yavaşlatma ya da geçici durdurma sayılıyor. Amodei'ye göre son seçenek, doğrulama zorlukları ve bazı ülkelerin kısıtlamalara uymama riski nedeniyle yakın gelecekte pek mümkün görünmüyor.
Kazanılan sürenin sistemlerin pratik güvenilirliğini artırmak, karar alma biçimlerinin daha iyi anlaşılması ve testlerin genişletilmesi için kullanılması gerektiğini yazdı Amodei. Ona göre modellerin kritik yetenek seviyesine ulaşmadan önce bir veya iki ek yıl kazanılması, güvenlik çalışmaları için zaman kullanıldığı takdirde ciddi sorun riskini önemli ölçüde azaltabilir.
Amodei aynı zamanda teknolojinin tıp ve ekonomi başta olmak üzere büyük potansiyel faydalarını görmeye devam ettiğini belirtti. "Faydalar ancak teknolojiyi doğru şekilde inşa edersek elde edilecek" diyen Amodei, ilerlemenin nispeten hızlı kalabileceğini ancak olağanüstü yüksek bir dikkatle ilerlemesi gerektiğini ekledi.