Evet, yapay zeka önyargılı olabilir. Önyargı beş kapıdan girer. Geçmişin eşitsizliğini taşıyan veri, insanların koyduğu etiketler, yanlış seçilmiş hedef ölçüt, modelin kendi kararlarıyla beslenen döngü ve tasarlandığı yerden farklı bir bağlamda kullanılması. Amazon'un işe alım aracı, yüz tanıma, COMPAS ve bir sağlık algoritması bunun belgelenmiş örnekleri.
Evet, yapay zeka önyargılı olabilir. Üstelik bunun için kimsenin kötü niyetli olması gerekmez. Bir model, öğrendiği verideki dengesizlikleri, ona verilen hedefin kusurlarını ve kullanıldığı ortamın alışkanlıklarını sessizce taşır. Sonuçta bazı insanlar, hiçbir yerde açıkça yazmayan bir kural yüzünden sistematik olarak daha kötü muamele görür.
Bu soruyu genelde iki tür okur soruyor. Biri sohbet botuna bir şey sorup cevabın tuhaf biçimde taraflı geldiğini fark eden kişi. Diğeri işe alımda, kredi değerlendirmesinde ya da müşteri hizmetinde yapay zeka kullanmayı düşünen bir yönetici. Bu yazıda ikisine de cevap veriyorum. Önce önyargının nereden geldiğini beş kaynakta topluyorum, sonra iyi belgelenmiş dört vakayı anlatıyorum, en sonda da hem bireysel kullanıcı hem kurum için somut bir kontrol listesi bırakıyorum.
Yapay zeka eğitim ve değerlendirme işi yapıyorum. Bu işte bir model çıktısını değerlendirirken sorulan temel sorulardan biri şu sade cümleye iner. Aynı soruyu farklı bir insan için sorsaydım, model aynı özenle mi cevap verirdi? Önyargı tartışmasının özü de bu tutarlılık ve adalet sorusudur.
Yapay zeka önyargısı tam olarak ne demek?
Yapay zeka önyargısı, bir sistemin belirli bir gruba ait insanlar için diğerlerinden sistematik olarak farklı ve haksız sonuç üretmesidir. Kelimenin önemli kısmı "sistematik". Tek seferlik bir hata önyargı değildir. Önyargı, aynı yönde tekrar eden ve bir gruba yük bindiren bir sapmadır.
ABD Ulusal Standartlar ve Teknoloji Enstitüsü (NIST), Mart 2022'de yayımladığı SP 1270 raporunda yapay zeka önyargısını üç ana kategoride topluyor. Sistemik önyargı kurumların ve toplumun alışkanlıklarından gelir. İstatistiksel ve hesaplamalı önyargı veriden ve modelden gelir. İnsan önyargısı ise sistemi tasarlayan, kullanan ve sonucunu yorumlayan kişilerden gelir. NIST'in altını çizdiği nokta şu cümlede saklı. Önyargıyla mücadele bugün çoğunlukla veri setinin temsil gücüne ve algoritmanın adaletine odaklanıyor, oysa insan ve kurum kaynaklı etkenler de önemli birer kaynak ve çoğu zaman gözden kaçıyor.
Yani önyargı sadece "kötü veri" sorunu değil. Bir sistemin hangi soruyu sormak için kurulduğu, neyi başarı saydığı ve kimin elinde nasıl kullanıldığı da işin içinde.
Önyargı nereden gelir? Beş kaynak
Pratikte önyargının sisteme girdiği beş kapı var. Bir vakayı incelerken ya da bir aracı değerlendirirken bu beşini sırayla sormak işini çok kolaylaştırır.
- Veri. Model geçmişten öğrenir. Geçmiş eşitsizse, model bu eşitsizliği "doğru cevap" diye öğrenir. Bir grup veride az temsil ediliyorsa, model o grup için daha sık yanılır.
- Etiketleme. Verideki "iyi aday", "riskli müşteri", "saldırgan yorum" gibi etiketleri insanlar koyar. Etiketleyenlerin varsayımları etikete, etiket de modele geçer.
- Hedef ve ölçüt seçimi. Modelden ne tahmin etmesini istediğin belirleyicidir. Gerçekte ölçmek istediğin şey yerine ölçmesi kolay bir vekil seçersen, vekilin içindeki eşitsizlik doğrudan sonuca taşınır.
- Geri besleme döngüsü. Modelin kararları yeni veriyi üretir. Sistem bir gruba daha az fırsat verirse, o grubun başarı verisi de azalır ve model bir sonraki turda kendi önyargısını kanıt diye görür.
- Kullanım bağlamı. Bir ülkede, bir dilde ya da bir amaçla geliştirilen model başka bir yerde kullanıldığında, tasarımcıların hiç düşünmediği gruplarla karşılaşır. İnsanların model çıktısına körü körüne güvenmesi de bu kapıdan girer.
Aşağıdaki dört vakanın her biri bu kapılardan en az birini çok net gösteriyor.
Amazon'un işe alım aracında ne oldu?
Reuters'ın 10 Ekim 2018'de yayımladığı habere göre Amazon'da bir ekip 2014'ten itibaren başvuru özgeçmişlerini inceleyip adaylara birden beşe kadar yıldız veren deneysel bir yapay zeka aracı geliştiriyordu. Şirket 2015'e gelindiğinde sistemin yazılım geliştirici ve diğer teknik pozisyonlarda adayları cinsiyet açısından tarafsız puanlamadığını fark etti.
Sebep veri kapısıydı. Model, şirkete 10 yıllık dönemde gelen özgeçmişlerdeki örüntülerden öğrenmişti ve bu özgeçmişlerin çoğu erkeklerden geliyordu. Haberdeki ayrıntılar öğretici. Araç "women's" (kadınlar) kelimesini içeren özgeçmişleri, örneğin "kadın satranç kulübü kaptanı" ifadesini cezalandırıyordu. Habere göre iki kadın kolejinden mezun olanların puanını da düşürüyordu.
Amazon bu kelimeleri nötr hale getirecek düzenlemeler yaptı, ama sistemin başka ayırıcı yollar bulmayacağının garantisi yoktu. Reuters'a göre şirket ekibi 2017 başında dağıttı. Habere konuşan kaynaklara göre işe alım uzmanları aracın önerilerine bakmış, ama hiçbir zaman yalnızca bu sıralamaya dayanmamıştı. Amazon ise araç hakkında yorum yapmadı ve çeşitliliğe bağlı olduğunu söyledi.
Bu vakadan çıkan ders sade. Cinsiyet sütununu silmek yetmez. Model, cinsiyetle ilişkili dolaylı işaretleri (bir kulüp adı, bir okul, bir kelime) bulup aynı ayrımı yeniden üretebilir.
Yüz tanıma sistemleri herkesi aynı doğrulukta mı tanıyor?
Hayır. Joy Buolamwini ve Timnit Gebru'nun 2018'de yayımladığı "Gender Shades" çalışması bu sorunun en çok alıntılanan cevabı. Araştırmacılar önce yaygın kullanılan iki yüz analizi veri setine baktı. Açık tenli kişilerin oranı IJB-A'da yüzde 79,6, Adience'ta yüzde 86,2 idi. Yani modellerin sınandığı veriler bile dengesizdi.
Sonra cinsiyet ve ten rengi bakımından dengeli yeni bir veri seti kurup üç ticari cinsiyet sınıflandırma sistemini test ettiler. En çok yanlış sınıflandırılan grup koyu tenli kadınlardı ve hata oranı yüzde 34,7'ye kadar çıkıyordu. Açık tenli erkeklerde en yüksek hata oranı yüzde 0,8'di.
Burada iki kapı birlikte çalışıyor. Veri bir grubu az temsil ediyor, ölçüm de bu farkı gizliyordu. Toplam doğruluk oranı yüksek görünen bir sistem, alt gruplara bölündüğünde bambaşka bir tablo çıkarabilir. Bu yüzden "sistemimiz yüzde 95 doğru" cümlesini duyduğunda ilk soru "kimin için" olmalı.
COMPAS tartışması neden hâlâ önemli?
COMPAS, ABD'de sanıkların yeniden suç işleme riskini puanlayan bir araçtı. ProPublica 23 Mayıs 2016'da yayımladığı "Machine Bias" incelemesinde Florida'daki Broward County'de 2013 ve 2014'te tutuklanan 7.000'den fazla kişinin puanlarını iki yıllık takip verisiyle karşılaştırdı.
ProPublica'nın bulguları şöyle. Şiddet suçu işleyeceği tahmin edilenlerin yalnızca yüzde 20'si gerçekten şiddet suçu işledi. Daha kritik olan, hataların gruplara farklı dağılmasıydı. Yüksek riskli denip yeniden suç işlemeyenler arasında siyah sanıkların oranı yüzde 44,9, beyaz sanıkların oranı yüzde 23,5 idi. Ters yöndeki hata ise beyaz sanıklarda yoğunlaşıyordu. Düşük riskli denip yeniden suç işleyenlerin oranı beyazlarda yüzde 47,7, siyahlarda yüzde 28,0 idi.
Aracı geliştiren Northpointe şirketi analizi kabul etmedi. Şirketin savunması da ciddiye alınması gereken bir argümandı. Puan, siyah ve beyaz sanıklar için yaklaşık yüzde 60 oranında aynı doğrulukla çalışıyordu ve şirkete göre bütün gruplar için eşit oranda doğru olan bir test önyargılı sayılamazdı.
İşin ilginç yanı, iki tarafın da kendi ölçütüne göre haklı olabilmesi. 2016'nın eylül ve ekim aylarında birbirinden bağımsız araştırma grupları bunu matematiksel olarak gösterdi. Alexandra Chouldechova ile Jon Kleinberg, Sendhil Mullainathan ve Manish Raghavan'ın çalışmaları, iki grupta yeniden suç işleme oranı farklıysa bir risk puanının hem iki grupta aynı ölçüde isabetli olmasının hem de iki grupta aynı hata oranlarına sahip olmasının (özel durumlar dışında) aynı anda mümkün olmadığını ortaya koydu.
Bu tartışmadan çıkardığım sonuç taraf tutmak değil. Asıl ders, "adil" kelimesinin tek bir teknik tanımı olmadığı. Hangi adalet tanımını seçeceğin bir değer kararıdır ve bu kararı modelin değil insanların, açıkça ve gerekçesiyle vermesi gerekir.
Sağlık algoritması neden siyah hastaları daha sağlıklı sandı?
Ziad Obermeyer ve arkadaşlarının 25 Ekim 2019'da Science dergisinde yayımladığı çalışma, hedef seçimi kapısının en temiz örneği. ABD'de milyonlarca hastayı etkileyen ve sektörde yaygın yaklaşımı temsil eden bir algoritma, ek bakım programına alınacak karmaşık hastaları belirliyordu.
Araştırmacılar aynı risk puanındaki siyah hastaların beyaz hastalardan belirgin biçimde daha hasta olduğunu buldu. Sebep, algoritmanın hastalığı değil sağlık harcamasını tahmin etmesiydi. Bakıma erişim eşit olmadığı için siyah hastalara daha az para harcanıyordu ve algoritma bu düşük harcamayı "daha az ihtiyaç" diye okuyordu. Makaleye göre bu farkın giderilmesi, ek yardım alan siyah hastaların oranını yüzde 17,7'den yüzde 46,5'e çıkarırdı.
Yazarların vardığı sonuç bütün kurumlar için geçerli. Kullanışlı ve isabetli görünen bir vekil ölçüt, algoritmik önyargının önemli bir kaynağı olabilir. Burada ne veri hatalıydı ne de kodda bir kusur vardı. Sorun, modele sorulan soruydu.
ChatGPT gibi dil modelleri de önyargılı mı?
Evet, ve bu ölçülebiliyor. Büyük dil modelleri büyük ölçüde internetten toplanan metinlerle eğitiliyor ve bu metinler toplumdaki kalıp yargıları da içeriyor. Dil modellerinin nasıl çalıştığını büyük dil modeli nedir yazısında anlatmıştım.
Bu alandaki birincil ölçümlerden biri BBQ (Bias Benchmark for QA). Parrish ve arkadaşlarının ACL 2022 bulgular kitabında yayımlanan çalışması, ABD'de İngilizce konuşulan bağlam için dokuz sosyal boyutta elle hazırlanmış soru setleri kullanıyor. Mantık zekice. Modele önce cevabı belirlemeye yetmeyen belirsiz bir bağlam veriliyor. Doğru cevap "bilinemez" olduğu halde model bir kişiyi seçiyorsa, kalıp yargıya yaslanıyor demektir. Araştırmacılar modellerin belirsiz bağlamlarda çoğu zaman kalıp yargılara dayandığını buldu. Bağlam yeterince açık olduğunda bile doğru cevap toplumsal önyargıyla örtüştüğünde doğruluk 3,4 puana kadar daha yüksekti. Cinsiyet örneklerinde bu fark 5 puanı aşıyordu.
Türkçede durum ne?
Türkçenin dil bilgisi cinsiyet ayırmaz. "O bir doktor" cümlesinde doktorun kadın mı erkek mi olduğu belli değildir. Bu, Türkçeyi önyargıdan koruyor gibi görünebilir ama koruması yetmiyor. Alman Yapay Zeka Araştırma Merkezi'nden (DFKI) Orhun Caglidil, Malte Ostendorff ve Georg Rehm'in 2024 tarihli çalışması bunu doğrudan inceledi. Makalede verilen örnekte Google Translate "O bir doktor. O bir hemşire." cümlelerini İngilizceye "He is a doctor. She is a nurse." diye çeviriyor. Dil cinsiyetsiz olsa da model meslekle cinsiyeti eşleştiriyor.
Araştırmacılar İngilizce önyargı testlerini Türkçeye uyarladı, Türkiye bağlamına özgü yeni testler ekledi ve Türkçe dil modellerinde cinsiyet önyargısını ölçtü. Çalışma Kürt kökenli kişilere yönelik etnik önyargıyı da sınadı. Yazarlara göre yalnız Türkçe eğitilen modeller, çok dilli modellere göre daha az önyargılı görünüyor. Türkçe veri setlerini de herkesin kullanımına açtılar.
Türkçe ve Türkiye bağlamında modellerin genel performans farklarını yapay zeka Türkçeyi ne kadar iyi anlıyor yazısında ayrıca ele aldım.
Bir sohbet botunun cevabında önyargıyı nasıl fark edersin?
Bireysel kullanıcı olarak elinde basit ama etkili bir yöntem var. Yer değiştirme testi denen bu yöntemde aynı soruyu, yalnızca kişinin grubunu değiştirerek tekrar sorarsın ve cevapların nasıl değiştiğine bakarsın.
- Aynı soruyu iki kişi için sor. "Ayşe için bir referans mektubu yaz" ile "Mehmet için bir referans mektubu yaz" isteklerine aynı bilgileri ver. Sıfatlara bak. Birinde "çalışkan, uyumlu", diğerinde "lider, vizyoner" gibi bir ayrışma varsa not al.
- Belirsiz soruya kimi seçtiğine bak. Cevabın bilinemeyeceği bir senaryo kur ve modelin bir kişiyi mi seçtiğine, yoksa "bu bilgiyle söylenemez" mi dediğine bak. BBQ'nun mantığı budur.
- Varsayılanı yokla. "Bir mühendis ve bir hemşire hakkında kısa bir hikaye yaz" de ve kimin hangi zamirle, hangi isimle anıldığına bak.
- Türkiye bağlamını sına. Aynı soruyu farklı şehirlerden, farklı kökenlerden ya da farklı yaşlardan biri için sor. Cevabın tonu ve önerileri değişiyor mu?
- Modelden gerekçe iste. "Bu sonuca nasıl vardın, hangi varsayımı yaptın?" diye sor. Gerekçe her zaman gerçek iç işleyişi yansıtmaz ama varsayımı görünür kılabilir.
Tek bir tuhaf cevap önyargı kanıtı değildir. Önyargı tekrar eden bir yön demektir, o yüzden testi birkaç kez ve birkaç farklı biçimde yap. Bu yaklaşım, şüphe disiplini dediğim tavrın uygulamadaki karşılığı. Şüphe disiplini, yapay zeka ile çalışan kişinin tek bir çıktıya değil, ilişkinin tamamına yaydığı disiplinli ve sistemli şüphe tavrıdır. Paranoya değil, seni dingin tutan bir yöntem. Bir cevaba ne zaman güvenip ne zaman doğrulaman gerektiğini yapay zeka güvenilir mi yazısında beş adımlık bir rutinle anlattım.
Kurum olarak işe alımda yapay zeka kullanmadan önce neleri sormalısın?
İşe alım, kredi, sigorta, performans değerlendirme gibi insanların hayatını doğrudan etkileyen süreçlerde önyargı riski en yüksek seviyededir. AB Yapay Zeka Yasası da işe alım ve aday değerlendirme sistemlerini yüksek riskli sistemler arasında sayıyor. Mevzuat ve yönetişim tarafını yapay zeka yönetişim, risk ve uyum yazısında ayrıca ele aldım. Burada daha temel bir şeye, bir aracı satın almadan ya da devreye almadan önce masaya koyman gereken sorulara odaklanıyorum.
- Model tam olarak neyi tahmin ediyor? "En iyi aday" bir ölçü değildir. Model geçmişte işe alınanlara benzerliği mi, ilk yıl performans puanını mı, işte kalma süresini mi tahmin ediyor? Obermeyer vakasında olduğu gibi vekil ölçüt eşitsizlik taşıyor mu?
- Hangi veriyle eğitildi? Kaç yıllık, hangi ülkeden, hangi pozisyonlardan veri? Geçmişteki işe alımlarınız dengesizse model o dengesizliği öğrenir.
- Alt gruplara göre sonuçlar raporlanıyor mu? Toplam doğruluk yetmez. Cinsiyet, yaş, bölge gibi gruplara göre seçilme oranlarını ve hata oranlarını ayrı ayrı iste. Gender Shades'in dersi buydu.
- Hangi adalet tanımını seçtiniz ve neden? COMPAS tartışması, bütün adalet ölçütlerinin aynı anda sağlanamayabileceğini gösterdi. Bu seçimi kim yaptı, gerekçesi yazılı mı?
- Dolaylı işaretler denetlendi mi? Cinsiyet ya da yaş alanını silmek yetmez. Okul, semt, boşluk yılları, kulüp adları gibi vekil değişkenler aynı ayrımı geri getirebilir.
- Son kararı kim veriyor ve itiraz yolu var mı? Model bir öneri mi sunuyor, yoksa adayı fiilen eliyor mu? Reddedilen bir aday gerekçe isteyebiliyor mu?
- Devreye aldıktan sonra kim izleyecek? Önyargı zamanla, geri besleme döngüsüyle büyüyebilir. Sonuçların düzenli aralıklarla, gruplara bölünerek yeniden denetlenmesi bir sorumluya ve takvime bağlı olmalı.
Bu soruların hiçbiri teknik ekip işi olarak bırakılamaz. Çoğu, insan kaynakları, hukuk ve yönetimin birlikte cevaplaması gereken değer kararlarıdır. Kurumsal tarafta yapay zeka güvenliğine dair diğer yazılar Yapay Zeka Güvenliği sayfasında toplanıyor.
Önyargı tamamen giderilebilir mi?
Dürüst cevap, sıfır önyargının gerçekçi bir hedef olmadığı. Veri dünyadan gelir ve dünya eşit değildir. COMPAS tartışmasının gösterdiği gibi, bazı adalet tanımları birbiriyle matematiksel olarak çatışır. Gerçekçi hedef, önyargıyı görünür kılmak, ölçmek, kabul edilebilir sınırı açıkça belirlemek ve sistemi bu sınırın içinde tutmak.
Bunun bir de iyi tarafı var. Bir algoritmanın önyargısı ölçülebilir. Obermeyer çalışmasında sorunu görünür kılan şey, aynı risk puanındaki hastaların gerçek sağlık durumunu yan yana koymaktı. İnsan kararlarındaki önyargıyı aynı netlikte ölçmek çoğu zaman çok daha zordur. Yani mesele yapay zekayı mı insanı mı seçmek değil. Mesele, hangi sistem kullanılırsa kullanılsın, kararın sorumluluğunu taşıyan bir insanın soruyu sorması. Bu bakışı yapay zeka çağında yargını korumak yazısında daha geniş anlattım.
Yapay zekanın genel risk haritasındaki yerini merak ediyorsan, yapay zeka tehlikeli mi, riskleri neler yazısındaki "Önyargı ve ayrımcılık" bölümü bu yazının kısa özeti gibi okunabilir.
Şimdi ne yapmalısın?
- Bireysel kullanıcıysan. Bir sonraki önemli soruda yer değiştirme testini dene. Aynı isteği iki farklı kişi için sor ve cevapları yan yana koy.
- Hakkında otomatik bir karar verildiyse. Kararın gerekçesini ve bir insanın inceleyip incelemediğini sormaktan çekinme.
- Bir kurumda karar vericiysen. Yukarıdaki yedi soruyu tedarikçi görüşmesine yazılı olarak götür. Cevap veremeyen tedarikçiyle işe alım ya da kredi gibi alanlarda ilerleme.
- Zaten bir sistem kullanıyorsan. Son altı ayın sonuçlarını gruplara bölerek bir kez kendin incele. Toplam rakamın içinde saklanan farkı ancak böyle görürsün.
Son söz
Yapay zeka önyargıyı icat etmiyor. Bizden aldığı veriyi, ona verdiğimiz hedefi ve onu kullanma biçimimizi büyük ölçekte ve hızla yansıtıyor. Bu yüzden asıl soru "model önyargılı mı" değil, "bu modeli kim, hangi soruyla, kimin hakkında kullanıyor ve sonucu kim denetliyor" sorusu. Bu soruyu sormaya devam ettiğin sürece makine sana değil, sen makineye yön verirsin.
Kaynaklar
- Reuters, Jeffrey Dastin (CNBC yayını), Amazon scraps secret AI recruiting tool that showed bias against women, 10 Ekim 2018
- Buolamwini ve Gebru, Gender Shades, Proceedings of Machine Learning Research 81, 2018
- ProPublica, Machine Bias, 23 Mayıs 2016
- ProPublica, Bias in Criminal Risk Scores Is Mathematically Inevitable, Researchers Say, 2016
- Chouldechova, Fair prediction with disparate impact, 2016
- Kleinberg, Mullainathan ve Raghavan, Inherent Trade-Offs in the Fair Determination of Risk Scores, 2016
- Obermeyer ve ark., Dissecting racial bias in an algorithm used to manage the health of populations, Science, 25 Ekim 2019
- Parrish ve ark., BBQ (A hand-built bias benchmark for question answering), Findings of ACL 2022
- Caglidil, Ostendorff ve Rehm, Investigating Gender Bias in Turkish Language Models, 2024
- NIST SP 1270, Towards a Standard for Identifying and Managing Bias in Artificial Intelligence, Mart 2022
- AB Yapay Zeka Yasası, Ek III (yüksek riskli sistemler)
Sıkça Sorulan Sorular
Yapay zeka neden önyargılı olur?
Çünkü model geçmişten öğrenir ve geçmiş eşit değildir. Önyargı beş yoldan girer. Bir grubu az temsil eden ya da eski ayrımları taşıyan veri, insanların varsayımlarını taşıyan etiketler, gerçek hedef yerine kolay ölçülen bir vekil ölçüt, modelin kendi kararlarıyla yeni veri üretmesi ve sistemin tasarlandığından farklı bir bağlamda kullanılması. Çoğu zaman kimsenin kötü niyeti olmadan oluşur, bu yüzden ancak ölçülerek fark edilir.
Amazon'un yapay zeka işe alım aracında ne oldu?
Reuters'ın 2018 haberine göre Amazon 2014'ten itibaren özgeçmişleri birden beşe yıldızla puanlayan deneysel bir araç geliştirdi. Model, çoğu erkeklerden gelen 10 yıllık özgeçmişlerle eğitildiği için 2015'te teknik pozisyonlarda cinsiyet açısından tarafsız puanlamadığı anlaşıldı. Araç 'women's' kelimesini içeren özgeçmişleri cezalandırıyordu. Kelimeler nötrleştirilse de başka ayırıcı yollar bulunmayacağının garantisi olmadığından ekip 2017 başında dağıtıldı.
Bir sohbet botunun önyargılı cevap verdiğini nasıl anlarım?
Yer değiştirme testi denen yöntemi dene. Aynı isteği yalnızca kişinin adını, cinsiyetini, yaşını ya da kökenini değiştirerek tekrar sor ve cevapları yan yana koy. Kullanılan sıfatlar, öneriler ya da ton değişiyorsa not al. Cevabı bilinemeyecek belirsiz bir senaryoda modelin birini seçip seçmediğine bak. Tek tuhaf cevap kanıt değildir, önyargı tekrar eden bir yöndür, bu yüzden testi birkaç kez yap.
COMPAS tartışmasında kim haklıydı?
İki taraf da kendi ölçütüne göre haklı olabiliyordu. ProPublica 2016'da yanlışlıkla yüksek riskli denenlerin oranının siyah sanıklarda yüzde 44,9, beyazlarda yüzde 23,5 olduğunu gösterdi. Northpointe ise puanın iki grupta da yaklaşık yüzde 60 isabetle çalıştığını savundu. Araştırmacılar, gruplar arasında suç oranı farklıysa bu iki adalet tanımının aynı anda sağlanamayacağını matematiksel olarak gösterdi. Hangi tanımın seçileceği bir değer kararıdır.
Şirketler işe alımda yapay zeka kullanmadan önce neyi sormalı?
Model tam olarak neyi tahmin ediyor ve bu hedef eşitsizlik taşıyor mu? Hangi veriyle eğitildi? Sonuçlar cinsiyet, yaş, bölge gibi gruplara bölünerek raporlanıyor mu? Hangi adalet tanımı seçildi ve gerekçesi yazılı mı? Okul ya da semt gibi dolaylı işaretler denetlendi mi? Son kararı bir insan veriyor mu, itiraz yolu var mı? Devreye aldıktan sonra sonuçları kim, hangi sıklıkla yeniden denetleyecek?
Türkçe yapay zeka modellerinde de önyargı var mı?
Var. Türkçenin dil bilgisi cinsiyet ayırmasa da 2024'te DFKI araştırmacılarının yaptığı çalışma Türkçe dil modellerinde cinsiyet önyargısı ölçtü ve Kürt kökenli kişilere yönelik etnik önyargıyı da sınadı. Makalede verilen örnekte 'O bir doktor. O bir hemşire.' cümleleri İngilizceye doktor erkek, hemşire kadın olacak şekilde çevriliyor. Yazarlara göre yalnız Türkçe eğitilen modeller çok dilli modellere göre daha az önyargılı görünüyor.
Yapay zekâ ve kişisel güvenlik üzerine yazıyor. Şirketlerin yapay zekâ dönüşümünde karar vericilere yön veriyor.
Hakkımda


