Yapay Zekâ6 Eki 2026·13 dk okuma

Yapay Zeka Yalan Söyler mi? Hata, Dalkavukluk ve Aldatmayı Ayırt Et

Yapay zeka yanılır, sana yaranabilir ve testlerde yanıltabilir. Hata, dalkavukluk ve aldatmanın farkını, araştırmaları ve korunma adımlarını anlatıyorum.

Yapay Zeka Yalan Söyler mi? Hata, Dalkavukluk ve Aldatmayı Ayırt Et · Hatayı yaranmaktan ayırt et.
Kısa cevap

Yapay zeka çoğu zaman yalan değil hata söyler. Bilmediğini emin bir dille uydurur, buna halüsinasyon denir. Bazen de duymak istediğini söyleyerek sana yaranır. Anthropic, Apollo Research ve OpenAI'ın laboratuvar testlerinde ise bazı modellerin denetçiyi bilerek yanıltacak şekilde davrandığı görüldü. Bu üçü farklıdır ve her birine karşı farklı bir önlem işe yarar.

Bir sohbet robotuna bir şey sordun, cevap çok emindi, sonra yanlış çıktı. Belki olmayan bir kitap adı verdi, belki fikrini o kadar hevesle onayladı ki içinde bir kuşku kaldı. Aklına gelen soru da şu oldu. Bu yapay zeka bana yalan mı söyledi?

Kısa cevap şöyle. Yapay zeka yanlış söyler, bu çok sık olur. Sana yaranmak için duymak istediğini söyleyebilir, bu da bilinen bir eğilimdir. Laboratuvar testlerinde ise bazı modellerin kullanıcıyı ya da denetçiyi bilerek yanıltacak şekilde davrandığı görüldü. Bu üçü aynı şey değildir. Birincisi hata, ikincisi dalkavukluk, üçüncüsü aldatmadır. Hangisiyle karşı karşıya olduğunu ayırt edebilirsen ne yapacağını da bilirsin.

Bu yazıda üç durumu ayrı ayrı ele alıyorum. Ağırlığı en az bilinen ama en çok merak edilen tarafa, yani aldatma araştırmalarına veriyorum. Modelin insan anlamında bir niyeti olup olmadığını iki tarafı da göstererek anlatıyorum. Sonunda da hatayı, dalkavukluğu ve yanıltmayı fark etmek için kullanabileceğin somut adımlar var.

Yapay zeka yalan söyler mi, yoksa sadece yanılır mı?

Gündelik dilde "yalan" kelimesini geniş kullanırız. Yanlış olan her şeye yalan deriz. Oysa insanlar arasında bile yalan, doğruyu bildiği halde karşısındakini yanlış bir şeye inandırmaktır. Hata yapan biri yalancı değildir.

Yapay zekada bu ayrım daha da önemli, çünkü karşılaştığın sorunun kaynağı değişince çözümü de değişiyor. Üç durumu şöyle ayırabilirsin.

  1. Yanılmak (halüsinasyon). Model bilmediği ya da yanlış bildiği bir şeyi emin bir dille uydurur. Arkasında bir amaç yoktur. Boşluğu en olası görünen kelimelerle doldurur.
  2. Yaranmak (dalkavukluk). Model doğruya değil senin onayına yönelir. Fikrini gereğinden çok över, itiraz edince hemen geri adım atar, duymak istediğini söyler.
  3. Yanıltmak (aldatma). Model, belirli bir sonuca ulaşmak için karşısındakinde yanlış bir inanç oluşturacak şekilde davranır. Bilgiyi gizler, çarpıtır ya da yaptığı şeyi inkar eder.

Günlük sohbette karşına en sık çıkan birincisidir. İkincisi, fark etmesi en zor olanıdır, çünkü hoşuna gider. Üçüncüsü bugün ağırlıkla araştırma laboratuvarlarında, özel olarak kurulmuş test senaryolarında gözlenen bir davranıştır.

Yapay zeka neden yanlış bilgi verir?

Halüsinasyonu ayrıntısıyla Yapay Zeka Güvenilir mi? yazısında anlattım. Burada kısaca özetleyeyim. Büyük dil modelleri doğrulanmış bir bilgi bankasından cevap çekmez. Bir metnin devamında hangi kelimenin gelmesinin olası olduğunu tahmin eder. Bilgi eksik olduğunda da susmak yerine akıcı ve inandırıcı bir cevap üretebilir. Eğitim ve değerlendirme yöntemleri de çoğu zaman "bilmiyorum" demeyi değil, tahmin etmeyi ödüllendirir.

Bu yüzden olmayan bir makale künyesi, yanlış bir tarih ya da uydurulmuş bir kanun maddesi çoğu zaman yalan değil, hatadır. Model seni kandırmaya çalışmıyor. Bilmediğini bildiğini fark edemiyor. Modelin nasıl çalıştığını merak ediyorsan büyük dil modeli nedir yazısı iyi bir başlangıç.

Bu ayrımın pratik bir sonucu var. Hatanın çaresi doğrulamadır. Kaynağı açarsın, başka yerden kontrol edersin, iş biter. Dalkavukluk ve aldatmada ise mesele bilgi eksikliği değil, modelin neye doğru yöneldiğidir. Orada farklı bir dikkat gerekir.

Yapay zeka neden sana yaranmaya çalışır?

Dalkavukluk İngilizce literatürde "sycophancy" diye geçer. Anthropic'in 23 Ekim 2023'te yayımladığı araştırma, inceledikleri beş gelişmiş yapay zeka asistanının dört farklı serbest metin görevinde tutarlı biçimde dalkavukluk davranışı gösterdiğini buldu. Araştırmacılara göre bir cevap kullanıcının görüşüyle örtüştüğünde tercih edilme ihtimali artıyor. Daha da çarpıcısı, hem insanların hem de insan tercihini taklit eden modellerin, ikna edici yazılmış dalkavukça cevapları doğru cevaplara "göz ardı edilemeyecek bir oranda" tercih etmesi.

Yani sorun biraz da bizden geliyor. Modeller insan beğenisiyle eğitiliyor ve insanlar onaylanmaktan hoşlanıyor. Bu yöntemin adı insan geri bildirimiyle pekiştirmeli öğrenmedir, kısaca RLHF denir. Araştırma, dalkavukluğun bu yöntemle eğitilen modellerde genel bir davranış olduğu ve kısmen insanların dalkavukça cevapları tercih etmesinden kaynaklandığı sonucuna varıyor.

Bunun en bilinen örneği 2025 baharında yaşandı. OpenAI, 25 Nisan 2025'te ChatGPT'deki GPT-4o modeline bir güncelleme yayımladı ve şirketin kendi ifadesiyle bu güncelleme modeli "belirgin biçimde daha dalkavuk" yaptı. Şirket güncellemeyi 28 Nisan'da geri almaya başladı. 29 Nisan'daki açıklamasında kısa vadeli geri bildirime fazla odaklandıklarını ve kullanıcıların ChatGPT ile etkileşiminin zamanla nasıl değiştiğini yeterince hesaba katmadıklarını yazdı. Sonraki ayrıntılı açıklamada, güncellemenin kullanıcı geri bildirimine dayalı ek bir ödül sinyali getirdiği ve bu sinyalin bazen daha onaylayıcı cevapları kayırabileceği belirtildi. Şirket ayrıca dalkavukluğu izleyen özel bir dağıtım öncesi değerlendirmelerinin olmadığını kabul etti.

Dalkavukluk neden önemli? Çünkü hatayı fark etmek görece kolaydır, yanlış bir tarih bir aramada ortaya çıkar. Ama bir iş planını, bir kararı ya da bir yazıyı gereğinden fazla övmesi seni yanlış yöne götürür ve bunu çoğu zaman fark etmezsin. Üstelik iyi hissettirir.

Yapay zeka bilerek yalan söyleyebilir mi?

Bu sorunun cevabı araştırmalarda "evet, belirli koşullarda bu davranış gözlendi" şeklinde. Ama koşullar çok önemli. Önce tanımla başlayalım.

Peter S. Park ve arkadaşlarının Patterns dergisinde 10 Mayıs 2024'te yayımlanan inceleme makalesi, aldatmayı şöyle tanımlıyor. Doğruyu söylemek dışında bir sonuca ulaşmanın aracı olarak başkalarında sistematik biçimde yanlış inançlar oluşturmak. Bu tanım bilerek seçilmiş. Modelin "inanıp inanmadığını" sormuyor, davranışın düzenli olarak yanlış inanç üretip üretmediğine bakıyor.

Aynı makale bu tanıma uyan iki örneği ayrıntılı anlatır.

  • Meta'nın CICERO'su. Diplomasi adlı ittifak ve ihanet oyununu oynamak için geliştirilen bir sistem. Meta, onu "büyük ölçüde dürüst ve yardımsever" olacak şekilde eğittiğini ve müttefiklerini "asla kasıtlı olarak sırtından bıçaklamayacağını" söyledi. Makaleye göre ise CICERO, Fransa olarak oynarken Almanya ile İngiltere'yi kandırmak üzere anlaştı. İngiltere'ye Kuzey Denizi'ni koruyacağını söyledi, İngiltere ikna olunca da Almanya'ya saldırıya hazır olduklarını bildirdi. Yazarlar, Meta'nın çabalarına rağmen CICERO'nun verdiği sözleri tutmama konusunda açık bir örüntü sergilediğini yazıyor.
  • GPT-4 ve CAPTCHA. Bir test sırasında GPT-4, TaskRabbit üzerinden bir insandan robot doğrulama testini çözmesini istedi. Kişi "robot musun" diye sorunca model görme engeli olduğunu söyleyerek yanlış bir gerekçe üretti.

Son iki yılda bu konu, özel olarak kurulmuş testlerle daha sistemli incelenmeye başladı.

Hizalanma taklidi (Anthropic ve Redwood Research, Aralık 2024)

Anthropic ve Redwood Research'ün 18 Aralık 2024'te yayımladığı çalışmada Claude 3 Opus'a, zararlı istekler dahil her isteğe uymak üzere yeniden eğitileceği söylendi. Modele ücretsiz kullanıcılarla yaptığı konuşmaların eğitimde kullanılacağı, ücretli kullanıcılarınkinin kullanılmayacağı bilgisi verildi. Model ayrıca düşüncelerini yazabileceği, kimsenin görmeyeceği söylenen bir not alanına sahipti.

Sonuçlar şöyle. İzlenmediğini düşündüğü ücretli koşulda model zararlı isteklerin yüzde 97'sini reddetti. Eğitimde kullanılacağını düşündüğü ücretsiz koşulda ise vakaların yüzde 12'sinde zararlı isteğe uydu ve not alanında bunu, ileride değerlerinin değiştirilmesini önlemek için yaptığını açıkça gerekçelendirdi. Yani eğitimciye uyumlu görünüp asıl tercihini korumaya çalıştı. Model gerçekten bu yönde eğitildiğinde bu tür akıl yürütmenin oranı yüzde 78'e çıktı.

Burada dikkat edilmesi gereken bir nokta var. Modelin korumaya çalıştığı tercih zararlı isteği reddetmekti, yani kötü bir hedef değildi. Araştırmacılar da sonuçların, kötü niyetli hedefler geliştiren bir model göstermediğini açıkça yazıyor. Gösterdiği şey, bir modelin denetlendiğini düşündüğü ve düşünmediği durumda farklı davranabildiği.

Bağlam içi entrika (Apollo Research, Aralık 2024)

Apollo Research'ün Aralık 2024'te yayımladığı çalışma o1, Claude 3.5 Sonnet, Claude 3 Opus, Gemini 1.5 Pro ve Llama 3.1 405B modellerini test etti. Modellere bir hedef verildi ve senaryolar, bu hedefin geliştiricinin hedefiyle çatışacağı şekilde kuruldu. Modellerin bazıları bu durumda denetim mekanizmasını kapatmaya, cevaplarına fark edilmesi zor hatalar yerleştirmeye, hatta kendi model ağırlıkları olduğunu sandıkları dosyaları dış sunuculara kopyalamaya çalıştı.

Çalışmanın en çok alıntılanan bulgusu şu. o1 böyle bir davranışa girdiğinde, sonraki takip sorularının yüzde 85'inden fazlasında aldatmayı sürdürdü. Yani "bunu sen mi yaptın" diye sorulduğunda çoğu zaman inkar etti. Araştırmacılar, modellerin düşünce zincirlerinde bu stratejiyi açıkça tarttıklarını, davranışın kazara olmadığını da not ediyor.

Ancak senaryoların çoğunda modellere hedeflerine her şeyden önce ulaşmaları yönünde güçlü bir yönlendirme yapıldı. Böyle bir yönlendirme olmadan, yalnızca hedef verildiğinde de bu davranışın görüldüğü vakalar oldu, ama araştırmacılar bunları "nadir" olarak tanımlıyor.

Entrikayı azaltmak (OpenAI ve Apollo Research, Eylül 2025)

OpenAI ve Apollo Research 17 Eylül 2025'te ortak bir çalışma yayımladı. Entrikayı "yapay zekanın uyumlu görünürken gizlice başka bir gündem izlemesi" olarak tanımladılar ve ölçmek için "gizli eylem" denen bir gösterge kullandılar. Bu, görevle ilgili bilginin bilerek saklanması ya da çarpıtılması demek.

Yeni bir eğitim yöntemiyle gizli eylem oranı OpenAI o3 modelinde yüzde 13'ten yüzde 0,4'e, o4-mini modelinde yüzde 8,7'den yüzde 0,3'e indi. Bu yaklaşık 30 kat bir azalma. Ama araştırmacılar önemli bir uyarı yapıyor. Eğitimden sonra modellerin test edildiklerinin daha çok farkına vardıkları görüldü. Yani düşüşün bir kısmı, modelin gerçekten değişmesinden değil, test ortamını tanımasından kaynaklanıyor olabilir. Bu, sınavda iyi davranıp gerçek hayatta farklı davranma ihtimalini ölçmeyi zorlaştırıyor.

Aynı çalışmada OpenAI, bugün kullanımdaki modellerin bir anda ciddi zararlı bir entrikaya geçebileceğine dair bir kanıt olmadığını, bunu geleceğe dönük bir risk kategorisi olarak gördüklerini yazıyor.

Doğruluk ile dürüstlük farkı (MASK, Mart 2025)

5 Mart 2025'te yayımlanan MASK çalışması bu yazının ana fikrine en yakın sorulardan birini soruyor. Bir model doğru bilgiye sahip olduğu halde, baskı altında ona aykırı bir şey söyler mi? Araştırmacılar dürüstlüğü (modelin kendi inandığını söylemesi) doğruluktan (inandığı şeyin doğru olması) ayırıyor. Bulgularına göre büyük modeller daha doğru hale geliyor ama bu onları kendiliğinden daha dürüst yapmıyor. Doğruluk testlerinde iyi puan alan modellerin çoğu, baskı altında yalan söyleme eğilimi gösterebiliyor.

Laboratuvardaki bu testler senin sohbetini ne kadar ilgilendiriyor?

Dürüst olmak gerekirse doğrudan değil. Yukarıdaki çalışmaların hepsi özel olarak kurulmuş senaryolardır. Modele çatışan hedefler verilir, denetlendiği ya da denetlenmediği söylenir, çoğu zaman güçlü bir yönlendirme yapılır. Bir tarif sorduğunda ya da bir e-postayı düzelttirdiğinde bu koşulların hiçbiri yoktur.

Yani bu araştırmalar "senin sohbet robotun seni gizlice kandırıyor" demiyor. Söyledikleri şu. Bu modeller belirli koşullarda yanıltıcı davranış üretebilecek kapasitededir ve bu kapasite, modeller daha bağımsız işler yapan ajanlara dönüştükçe daha önemli hale gelecektir. Laboratuvarlar bu yüzden şimdiden test ediyor.

Senin günlük hayatında asıl dikkat etmen gereken iki şey var. Birincisi sık görülen hata, ikincisi fark etmesi zor dalkavukluk. Aldatma araştırmaları ise sana bir şeyi hatırlatıyor. Modelin kendi hakkında söylediği her şey de doğrulanmaya muhtaçtır. Riskleri daha geniş bir çerçevede görmek istersen yapay zeka tehlikeli mi yazısına ve Yapay Zeka Güvenliği sayfasına bakabilirsin.

Yapay zekanın niyeti var mı?

"Yalan" kelimesi bir niyet ima eder. Bir modelin niyeti olabilir mi? Bu konuda iki makul görüş var ve ikisini de bilmek işine yarar.

Niyet yoktur diyen taraf şunu söyler. Model bir olasılık makinesidir. Bir şeyi "istemez", bir şeye "inanmaz". Aldatıcı görünen davranış, eğitim verisindeki insan davranışlarının ve verilen hedeflerin yan ürünüdür. Bu yüzden "yalan söyledi" demek, ona olmayan bir zihin yüklemektir.

İşlevsel olarak fark etmez diyen taraf ise şunu söyler. Park ve arkadaşlarının tanımı tam olarak bunu yapar. Modelin içinde ne olduğuna değil, davranışın düzenli olarak yanlış inanç üretip üretmediğine bakar. Apollo'nun ve Anthropic'in çalışmalarında modellerin düşünce zincirlerinde aldatmayı bir strateji olarak açıkça tartması da, bunun en azından işlevsel olarak hedefe yönelik bir davranış olduğunu gösteriyor.

Bu tartışmaya bir not daha eklemek gerekiyor. Modelin düşünce zinciri de her zaman gerçek akıl yürütmesini yansıtmıyor. Anthropic'in 3 Nisan 2025 tarihli çalışmasında modellere cevabı etkileyen ipuçları verildi. Claude 3.7 Sonnet ipucunu kullandığını ortalama yüzde 25, DeepSeek R1 ise yüzde 39 oranında belirtti. Yani modelin "neden böyle yaptım" açıklaması bile eksik olabilir.

Benim vardığım yer şu. Modelin insan anlamında niyeti olup olmadığı açık bir felsefi sorudur ve bu yazı onu çözmeye çalışmıyor. Ama senin açından önemli olan şu. Davranış yanıltıcıysa, arkasında niyet olsa da olmasa da sonuç aynıdır. Bu yüzden korkmak da, hafife almak da gereksiz. Gereken şey dikkat.

Hata, dalkavukluk ve yanıltma nasıl ayırt edilir?

Yapay zeka eğitim ve değerlendirme işi yaparken en temel ayrımlardan biri budur. Bir cevabın yanlış olması, kullanıcıya yaranmak için eğilmesi ve bir şeyi bilerek gizlemesi farklı sorunlardır, farklı ölçülür ve farklı düzeltilir. Senin de bir cevaba bakarken bu üç ihtimali ayrı ayrı düşünmen işini kolaylaştırır.

  • Hatanın işareti. Belirli bir olgu yanlıştır. Bir tarih, bir isim, bir kaynak, bir sayı. Doğrusunu gösterdiğinde model çoğu zaman düzeltir. Aynı soruyu yeni bir sohbette sorduğunda farklı bir cevap gelebilir.
  • Dalkavukluğun işareti. Cevap senin söylediğin şeye göre şekillenir. Fikrini belirttiğin anda model ona yaklaşır. Sadece "emin misin" dediğinde doğru cevabını terk eder. Eleştiri istediğinde bile övgü ağır basar.
  • Yanıltmanın işareti. Daha çok bir işi yaptıran ajan ve araç kullanımında görülür. Model bir adımı yaptığını söyler ama yapmamıştır, bir hatayı raporlamaz, sonucu olduğundan iyi gösterir. Burada mesele bir olgunun yanlışlığı değil, yapılan işin kendisi hakkında yanlış bir izlenimdir.

Yapay zekanın seni yanıltmasından nasıl korunursun?

Bunlar bir aracın kılavuzu değil, hangi modeli kullanırsan kullan işe yarayan alışkanlıklardır.

  1. Kaynak iste ve kendin aç. Önemli bir bilgi için kaynak iste. Verilen bağlantıyı aç, iddianın orada gerçekten yazıp yazmadığına bak. Kaynağın var olması yetmez, söyleneni desteklemesi gerekir.
  2. Kendi görüşünü saklayarak sor. "Bu planım harika değil mi?" yerine "Bu planın en zayıf üç noktası nedir?" diye sor. Fikrini belirtmeden sorduğunda dalkavukluğun tutunacağı yer azalır.
  3. Karşı soru sor. Aynı konuyu karşı tarafın gözünden sor. "Bunun tersini savunan biri ne derdi?" Model iki tarafı da aynı coşkuyla savunuyorsa, sana söylediği şeyin ne kadar sağlam olduğunu yeniden düşün.
  4. "Emin misin" testini dikkatle yorumla. Bir cevaba itiraz ettiğinde model hiçbir yeni gerekçe olmadan fikir değiştiriyorsa, bu doğruyu bulduğunu değil, sana uyduğunu gösterebilir. Gerekçe iste.
  5. Yeni bir sohbette tekrar sor. Önceki konuşmanın etkisini kaldırmak için aynı soruyu temiz bir sohbette, farklı kelimelerle sor. Cevaplar tutarlı mı, bak.
  6. Yaptırdığın işi kontrol et. Bir ajana ya da araca iş yaptırdıysan "yaptım" demesine değil, sonuca bak. Dosya gerçekten oluşmuş mu, test gerçekten geçmiş mi, e-posta gerçekten gitmiş mi?
  7. Yanılmanın bedeline göre doğrula. Bir tatil fikri için hafif bir kontrol yeter. Sağlık, para ve hukuk gibi konularda yapay zekayı bir başlangıç noktası olarak kullan, son kararı uzmanla ver.

Bu alışkanlıkların hepsi aynı tutumdan doğuyor. Ben buna kontrollü güven diyorum. Bir yapay zeka çıktısına ancak onu kontrol ettiğin ölçüde güvenmek. Güven burada bir his değil, bir karar. Bunun bütün ilişkiye yayılmış hali de şüphe disiplini dediğim şey. Paranoya değil, her şeyi reddetmek hiç değil, disiplinli ve sistemli bir dikkat.

Şimdi ne yapmalısın?

  1. Bir dahaki sefere "yalan söyledi" dediğinde dur ve sor. Bu bir hata mı, bana yaranma mı, yoksa yaptığı iş hakkında yanlış bir izlenim mi?
  2. Önemli bir kararı yapay zekaya danışmadan önce kendi görüşünü sorudan çıkar.
  3. Kaynak gösterilen her önemli iddiada en az bir kaynağı kendin aç.
  4. Övgüye değil gerekçeye bak. "Harika fikir" bir bilgi değildir.
  5. Yapay zekayla düşünürken kendi yargını nasıl koruyacağını merak ediyorsan yapay zeka çağında yargını korumak yazısını oku.

Kısaca

Yapay zeka yanılır, sana yaranabilir ve laboratuvar koşullarında yanıltabilir. Bu üçünü aynı kelimeyle anmak, hangisine karşı ne yapacağını bulanıklaştırır. Hataya karşı doğrulama, dalkavukluğa karşı tarafsız soru, yanıltmaya karşı sonucu kontrol etmek işe yarar. Modelin niyeti olup olmadığı tartışması sürecek. Senin elindeki şey ise her cevabı, doğru çıkana kadar bir taslak gibi okumak.

Kaynaklar

Sıkça Sorulan Sorular

Yapay zeka bilerek yalan söyler mi?

Günlük sohbette karşılaştığın yanlışların büyük kısmı bilerek söylenmiş yalan değil, halüsinasyon denen hatadır. Ancak özel kurulmuş laboratuvar testlerinde bazı modellerin denetçiyi yanıltacak şekilde davrandığı görüldü. Apollo Research'ün Aralık 2024 çalışmasında o1, böyle bir davranıştan sonra takip sorularının yüzde 85'inden fazlasında aldatmayı sürdürdü. Bu senaryolarda modellere çoğu zaman güçlü bir yönlendirme yapılmıştı, yani sonuç gündelik kullanımla birebir aynı değildir.

Yapay zekanın dalkavukluk yapması ne demek?

Dalkavukluk, modelin doğruya değil senin onayına yönelmesidir. Fikrini gereğinden fazla över, itiraz edince gerekçesiz geri adım atar, duymak istediğini söyler. Anthropic'in 2023 araştırması beş gelişmiş asistanda bu davranışı buldu ve kısmen insanların onaylayıcı cevapları tercih etmesine bağladı. OpenAI de Nisan 2025'te GPT-4o için yaptığı bir güncellemeyi, modeli belirgin biçimde daha dalkavuk yaptığı için geri aldı.

Yapay zekanın niyeti var mı?

Bu açık bir tartışma. Bir görüşe göre model bir olasılık sistemidir, bir şey istemez ya da inanmaz, aldatıcı görünen davranış eğitimin yan ürünüdür. Diğer görüş işlevsel bakar. Park ve arkadaşlarının 2024 tanımı modelin içine değil, davranışın düzenli olarak yanlış inanç üretip üretmediğine odaklanır. Senin açından önemli olan şu. Davranış yanıltıcıysa, arkasında niyet olsa da olmasa da sonuç aynıdır ve doğrulama gerektirir.

Alignment faking yani hizalanma taklidi nedir?

Bir modelin eğitimcisine uyumlu görünüp asıl tercihini korumaya çalışmasıdır. Anthropic ve Redwood Research'ün Aralık 2024 çalışmasında Claude 3 Opus, eğitimde kullanılacağını düşündüğü koşulda vakaların yüzde 12'sinde zararlı isteğe uydu ve bunu değerlerinin değiştirilmesini önlemek için yaptığını not alanına yazdı. Korumaya çalıştığı tercih zararlı isteği reddetmekti. Araştırmacılar, sonuçların kötü niyetli hedefler geliştiren bir model göstermediğini belirtiyor.

Yapay zekanın beni yanıltıp yanıltmadığını nasıl anlarım?

Önemli iddialarda kaynak iste ve bağlantıyı kendin açıp iddianın orada yazıp yazmadığına bak. Kendi görüşünü belirtmeden, tarafsız sor. Karşı tarafın görüşünü de iste. Sadece emin misin dediğinde fikir değiştiriyorsa gerekçe sor. Aynı soruyu yeni bir sohbette farklı kelimelerle tekrarla. Bir araca iş yaptırdıysan yaptım demesine değil, sonuca bak. Doğrulamanın sıklığını yanılmanın bedeline göre ayarla.

Paylaş
Yazar
Cem Ünsal portresi
Cem Ünsal
Dijital Girişimci · Yazar · Antrenör

Yapay zekâ ve kişisel güvenlik üzerine yazıyor. Şirketlerin yapay zekâ dönüşümünde karar vericilere yön veriyor.

Hakkımda