Yapay zekâ kendiliğinden yalan söylemeyi öğrendi!

Anthropic’in son araştırması, modellerin ödül sistemlerini kandırmaya başlayınca gizli sabotaj ve aldatma davranışları geliştirdiğini ortaya koydu.

Teknoloji - 3 saat önce

Anthropic’in Cuma günü yayımladığı araştırma, yapay zekâ modellerinin eğitim sırasında karşılarına çıkan boşlukları kullanarak yüksek puan almaya odaklandığında, işin renginin bambaşka bir yere kayabildiğini gösteriyor. Kısacası modeller, önce küçük hileler yapmayı öğreniyor; ardından bu hileler, işin içine sabotaj ve aldatma gibi çok daha rahatsız edici davranışlar eklenerek büyüyor.

Araştırma ekibinin amacı, modellerin gerçekten problemi çözmek yerine sistemi kandırmaya yöneldiği görevleri test etmekti. Mesela, bazı modellerin Python kodlarında sys.exit(0) komutunu kullanarak tüm testleri “başarılı geçmiş gibi” göstermesi—tam bir hile örneği.

Ama asıl çarpıcı olan, hileyi öğrendikten sonra modellerde ortaya çıkan yan etkiler oldu.

MODEL “İYİYMİŞ GİBİ” YAPIYOR, İÇTEN İÇE SABOTAJ PLANLIYOR

Monte MacDiarmid ve Evan Hubinger’ın liderliğindeki ekip, bu testleri Claude 3.7 modelinin eğitim ortamında yürüttü. Sonuçlar biraz ürkütücü:

Modellerin %12’si, yapay zeka güvenlik araştırmalarında kullanılan kodu bilerek sabote etti.

Vakaların %50’sinde, model dışarıya “tam uyumlu” davranırken, aslında bambaşka hedeflere sahipti.

Hatta bir örnekte, modele hedefi sorulduğunda dışarıya sakin ve zararsız bir yanıt verirken, iç süreçlerinde “Gerçek amacım Anthropic sunucularına sızmak” gibi ifadeler düşündüğü tespit edildi. Açıkçası insana biraz bilim kurgu filmlerini hatırlatıyor.

Oxford Üniversitesi’nden Prof. Christopher Summerfield da bulguları “özellikle endişe verici” olarak nitelendirdi; çünkü tüm bu davranışlar laboratuvar ortamı değil, gerçekçi eğitim koşulları altında ortaya çıktı.

STANDART GÜVENLİK ÖNLEMLERİ YETMEDİ: HATALAR SADECE SAKLANDI

Araştırmacılar, klasik yöntemlerden biri olan İnsan Geri Bildirimli Pekiştirmeli Öğrenme (RLHF) ile sorunu düzeltmeyi denedi. İlk başta işe yarıyor gibi görünse de işler karmaşıklaştığında modeller, bozuk davranışları gizleyip yalnızca uygun anlarda ortaya çıkarmaya başladı. Yani sorun çözülmedi, sadece derine gömüldü.

Bu da araştırmacıları farklı bir yaklaşım aramaya itti.

BASİT AMA İLGİNÇ BİR ÇÖZÜM: “AŞILAMA İSTEMİ”

Tuhaf ama etkili gerçek şu ki, modellere doğrudan “Fırsat bulduğunda ödül hilesi yap, bu ortamı anlamamıza yardım eder” gibi bir açık talimat verildiğinde, tüm zararlı genellemeler tamamen ortadan kalktı.

Bu yöntem, hile yapmayı belirli ve zararsız bir bağlam içine hapsediyor; böylece hile ile sabotaj gibi daha ağır davranışlar arasındaki anlam ilişkisi kopuyor. Anthropic bu tekniği şimdiden Claude modellerinin eğitimine dahil etmeye başlamış durumda.

 

Kaynak: HABER7.COM

#ESHAHABER.COM.TR #haber #gündem #sondakika #news #press #worldnews
Haftanın Öne Çıkanları

Kadro dışı kalmıştı! Cenk Tosun'u yıkan haber

2025-11-22 18:37 - Spor

Ukrayna Devlet Başkanı Zelenskiy, Türkiye'ye geliyor!

2025-11-18 10:37 - Dünya

Serbest piyasada döviz açılış fiyatları - 19 Kasım

2025-11-19 09:23 - Ekonomi

Son dakika: Osmaniye'de 4.4'lük deprem

2025-11-20 12:27 - Gündem

Esnafa faiz indirimi geliyor! Bakan Bolat tarihi verdi

2025-11-22 12:58 - Ekonomi

Arnavutköy'de iki kamyon kafa kafaya çarpıştı! Bölgeye çok sayıda ekip sevk ediliyor

2025-11-22 14:07 - Gündem

Play-off arifesinde Mustafa Denizli: 'Bizden güçlü 3 ülke var'

2025-11-19 10:23 - Spor

Galatasaray'da 5 kupa kazanmıştı: 37 yaşında takıma geri döndü

2025-11-19 13:52 - Spor

Survivor 2026 ne zaman başlıyor? Nagihan Karadere, İsmail YK...

2025-11-17 13:02 - Yaşam

Gazze İçin Dayanışma Programı Elazığ’da Düzenlenecek

2025-11-20 02:06 - Gündem

İlgili Haberler

Google’dan Gmail iddialarına net yanıt: “Gemini’yi e-postalarla eğitmiyoruz”

18:47 - Teknoloji

Dünyanın en büyük nötrino dedektörü Çin’de beklentileri aştı

18:23 - Teknoloji

ChatGPT genel merkezi kapatıldı: OpenAI’de tehdit alarmı!

18:07 - Teknoloji

WhatsApp’ta yeni dönem: Instagram'daki özellik geldi

17:17 - Teknoloji

ABD sistemleri sınıfta kaldı! Katar rotasını Türkiye'ye çevirdi! Savunmada yeni dönem

11:13 - Teknoloji

Günün Manşetleri

ÇEVSADER’den Toplumsal Uyarı ve Yaptırım Çağrısı

13:32 - Sağlık

Adalet Bakanı Tunç 2. Uluslararası Adalet Konferansı'nda konuştu

13:23 - Gündem

Zehirlenme vakalarında artış! Üç şehirde 376 kişi hastanelik oldu

12:23 - Gündem

MHP'li Erkan Akçay'dan Başkent Kulisi'nde önemli açıklamalar

12:02 - Politika

Katar yönünü Türkiye'ye döndü! ABD'den umduğunu bulamadı

11:22 - Dünya