Yapay zekâ kendiliğinden yalan söylemeyi öğrendi!

Anthropic’in son araştırması, modellerin ödül sistemlerini kandırmaya başlayınca gizli sabotaj ve aldatma davranışları geliştirdiğini ortaya koydu.

Teknoloji - 8 ay önce

Anthropic’in Cuma günü yayımladığı araştırma, yapay zekâ modellerinin eğitim sırasında karşılarına çıkan boşlukları kullanarak yüksek puan almaya odaklandığında, işin renginin bambaşka bir yere kayabildiğini gösteriyor. Kısacası modeller, önce küçük hileler yapmayı öğreniyor; ardından bu hileler, işin içine sabotaj ve aldatma gibi çok daha rahatsız edici davranışlar eklenerek büyüyor.

Araştırma ekibinin amacı, modellerin gerçekten problemi çözmek yerine sistemi kandırmaya yöneldiği görevleri test etmekti. Mesela, bazı modellerin Python kodlarında sys.exit(0) komutunu kullanarak tüm testleri “başarılı geçmiş gibi” göstermesi—tam bir hile örneği.

Ama asıl çarpıcı olan, hileyi öğrendikten sonra modellerde ortaya çıkan yan etkiler oldu.

MODEL “İYİYMİŞ GİBİ” YAPIYOR, İÇTEN İÇE SABOTAJ PLANLIYOR

Monte MacDiarmid ve Evan Hubinger’ın liderliğindeki ekip, bu testleri Claude 3.7 modelinin eğitim ortamında yürüttü. Sonuçlar biraz ürkütücü:

Modellerin %12’si, yapay zeka güvenlik araştırmalarında kullanılan kodu bilerek sabote etti.

Vakaların %50’sinde, model dışarıya “tam uyumlu” davranırken, aslında bambaşka hedeflere sahipti.

Hatta bir örnekte, modele hedefi sorulduğunda dışarıya sakin ve zararsız bir yanıt verirken, iç süreçlerinde “Gerçek amacım Anthropic sunucularına sızmak” gibi ifadeler düşündüğü tespit edildi. Açıkçası insana biraz bilim kurgu filmlerini hatırlatıyor.

Oxford Üniversitesi’nden Prof. Christopher Summerfield da bulguları “özellikle endişe verici” olarak nitelendirdi; çünkü tüm bu davranışlar laboratuvar ortamı değil, gerçekçi eğitim koşulları altında ortaya çıktı.

STANDART GÜVENLİK ÖNLEMLERİ YETMEDİ: HATALAR SADECE SAKLANDI

Araştırmacılar, klasik yöntemlerden biri olan İnsan Geri Bildirimli Pekiştirmeli Öğrenme (RLHF) ile sorunu düzeltmeyi denedi. İlk başta işe yarıyor gibi görünse de işler karmaşıklaştığında modeller, bozuk davranışları gizleyip yalnızca uygun anlarda ortaya çıkarmaya başladı. Yani sorun çözülmedi, sadece derine gömüldü.

Bu da araştırmacıları farklı bir yaklaşım aramaya itti.

BASİT AMA İLGİNÇ BİR ÇÖZÜM: “AŞILAMA İSTEMİ”

Tuhaf ama etkili gerçek şu ki, modellere doğrudan “Fırsat bulduğunda ödül hilesi yap, bu ortamı anlamamıza yardım eder” gibi bir açık talimat verildiğinde, tüm zararlı genellemeler tamamen ortadan kalktı.

Bu yöntem, hile yapmayı belirli ve zararsız bir bağlam içine hapsediyor; böylece hile ile sabotaj gibi daha ağır davranışlar arasındaki anlam ilişkisi kopuyor. Anthropic bu tekniği şimdiden Claude modellerinin eğitimine dahil etmeye başlamış durumda.

Kaynak: HABER7.COM

#ESHAHABER.COM.TR #haber #gündem #sondakika #news #press #worldnews

HABERİ SİTEDEN OKU...

Yapay zekâ kendiliğinden yalan söylemeyi öğrendi!

Kadro dışı kalmıştı! Cenk Tosun'u yıkan haber

Ukrayna Devlet Başkanı Zelenskiy, Türkiye'ye geliyor!

Serbest piyasada döviz açılış fiyatları - 19 Kasım

Survivor 2026 ne zaman başlıyor? Nagihan Karadere, İsmail YK...

Son dakika: Osmaniye'de 4.4'lük deprem

Esnafa faiz indirimi geliyor! Bakan Bolat tarihi verdi

Rıdvan Dilmen'den büyük iddia: Bonservisine 20 milyon euro daha eklettirirdi

Gazze İçin Dayanışma Programı Elazığ’da Düzenlenecek

Arnavutköy'de iki kamyon kafa kafaya çarpıştı! Bölgeye çok sayıda ekip sevk ediliyor

Galatasaray'da 5 kupa kazanmıştı: 37 yaşında takıma geri döndü

VDS Satın Al, Ryzen Sunucu Kiralama ve WordPress Hosting Taleplerinde Yeni Dönem

Erzurum'da çocuklar Türkiye’nin uzay misyonunu yakından tanıyor

Türk savunma sanayisi ihracat odaklı büyümeyi sürdürecek

WhatsApp yapay zekâ dozunu artırıyor: sohbetlere daha akıllı araçlar geliyor

2025’in en sevilen Google Chrome eklentileri belli oldu: AI ve verimlilik ön planda

Elazığ'da Sivil Katılım Zirvesi Gerçekleştirildi.

Belleği güncelledik Yönet Dijital Gençlik Merkezi Açıldı

Elazığ Belediyesi'nden LGS Öncesi Velilere Seminer.

Elazığ Belediyesi Sera Alanında Çelikle Gül Üretiyor.

Zafer Partisi İstanbul İl Başkanlığı Yönetim Kadrosunu ve İlçe Başkanlarını Kamuoyuna Tanıtıyor

www.eshahaber.com.tr - ESHAHABER Yerel ve Ulusal Güncel Gündem Haberleri