Büyük yapay zeka modelleri günlük Türkçede, özetlemede ve çeviride oldukça iyi. Ama Türkçe eklemeli yapısı nedeniyle daha çok parçaya bölünüyor, eğitim verisinde küçük bir pay tutuyor ve daha az ölçülüyor. Deyimlerde, yerel ve güncel Türkiye bilgisinde, hukuki dilde, yazım eklerinde ve kaynak göstermede hata payı artıyor. Önemli işlerde çıktıyı mutlaka doğrula.
Kısa cevap şu. Büyük yapay zeka modelleri Türkçeyi günlük işlerde oldukça iyi anlıyor ve yazıyor. Bir e-postayı toparlamak, bir metni özetlemek, bir paragrafı çevirmek için çoğu zaman yeterliler. Ama Türkçe, İngilizce kadar iyi ölçülmüş ya da İngilizce kadar bol veriyle beslenmiş bir dil değil. Deyimde, yerel kültürde, güncel Türkiye bilgisinde, resmi ve hukuki dilde ve kaynak göstermede hata payı belirgin biçimde artıyor.
Bu yazıyı muhtemelen şu an bir sohbet penceresinde Türkçe bir soru yazıp cevabın ne kadar güvenilir olduğunu merak ettiğin için okuyorsun. Belki bir cevapta tuhaf bir ek, hiç duymadığın bir deyim ya da var olmayan bir kanun maddesi gördün. Haklı bir şüphe bu.
Aşağıda üç şeyi netleştireceğim. Türkçe modeller için neden İngilizceden farklı bir dil, Türkçe performansını ölçen kıyaslamalar gerçekte ne söylüyor ve senin için pratik sonuç ne. Yani ne zaman Türkçe sorman yeterli, ne zaman İngilizceye geçmen ya da cevabı mutlaka denetlemen gerekiyor.
Yapay zeka Türkçeyi gerçekten anlıyor mu?
"Anlamak" kelimesini dikkatli kullanmak gerekiyor. Bir dil modeli metni, kendisine gösterilen milyarlarca örnekten öğrendiği kalıplarla işliyor. Bir sonraki parçayı tahmin ederek cevap üretiyor. Bu mekanizmayı daha ayrıntılı merak edersen yapay zeka nedir yazısı iyi bir başlangıç.
Pratikte sorulması gereken soru şu oluyor. Model Türkçe bir metinde anlamı ne kadar isabetli yakalıyor ve ne kadar doğru Türkçe üretiyor? Bunun cevabı "iş türüne göre değişir". Genel bilgi sorularında ve günlük dilde güçlü. Türkçeye ve Türkiye'ye özgü bilgi gerektiren yerlerde zayıflıyor. Bu ayrımı bilmek, modeli doğru işte kullanmanın yarısı.
Türkçe modeller için neden İngilizceden farklı?
Türkçe bir yapay zeka için üç ayrı nedenle İngilizceden daha zor bir dil.
Eklemeli yapı ve kelimelerin parçalanması
Türkçe eklemeli bir dil. "Gelemeyeceklermiş" gibi tek bir kelime, İngilizcede neredeyse bir cümleye karşılık geliyor. Modeller metni doğrudan kelime olarak değil, "token" denen parçalar hâlinde okuyor. Bu parçalama sistemi (tokenizer) ağırlıklı olarak İngilizce veriyle kurulduğu için Türkçe kelimeler çoğu zaman anlamlı eklere göre değil, istatistiksel olarak sık görülen harf gruplarına göre bölünüyor.
Somut bir örnek var. OpenAI, 13 Mayıs 2024'te GPT-4o'yu duyururken aynı selamlama cümlesinin farklı dillerde kaç parçaya bölündüğünü yayımladı. İngilizce cümle yeni sistemde 24 token tutuyordu (önceki sistemde 27). Türkçe karşılığı ("Merhaba, benim adım GPT-4o. Ben yeni bir dil modeli türüyüm, tanıştığımıza memnun oldum!") 30 token tutuyordu. Önceki sistemde bu Türkçe cümle 39 token idi. Yani iyileşme var, ama aynı anlamı Türkçe söylemek hâlâ daha fazla parça gerektiriyor.
Bunun maliyet ve bağlam etkisi
Oxford'dan Petrov ve arkadaşlarının 2023'te NeurIPS'te yayımlanan çalışması bu farkın neden önemli olduğunu açıkça ortaya koydu. Aynı metnin farklı dillere çevrilmiş hâlleri, parçalama aşamasında bazı durumlarda 15 kata varan uzunluk farkı gösterebiliyor. Araştırmacılara göre bu fark üç yerde hissediliyor. Ücretli hizmetlerin maliyeti (çoğu API token başına ücretlendirir), cevap süresi ve modele tek seferde verebileceğin içerik miktarı.
Türkçe bu tablonun en uç noktasında değil. Ama sen uzun bir Türkçe belgeyi modele verdiğinde, aynı uzunluktaki İngilizce belgeye göre bağlam penceresini daha hızlı dolduruyorsun. Çok uzun raporlarda modelin baştaki ayrıntıları kaçırma ihtimali de buna bağlı olarak artabiliyor.
Parçalamanın kalite etkisi de var. Türk araştırmacılardan oluşan bir ekibin Şubat 2025'te yayımladığı çalışma, dört açık modelin parçalama sistemini inceledi. Bir parçalama sisteminin ürettiği parçaların ne kadarının gerçek Türkçe birim olduğu (TR yüzdesi) ile modelin Türkçe sınav başarısı arasında güçlü bir ilişki buldu (korelasyon 0,90). Çalışma yalnızca dört modelle sınırlı, ama işaret ettiği yön açık. Kelimeyi anlamlı yerlerden bölen modeller Türkçede daha iyi sonuç verme eğiliminde.
Eğitim verisindeki pay
Modeller büyük ölçüde internetten derlenen metinlerle eğitiliyor. Bu alandaki en büyük açık arşivlerden Common Crawl'ın Eylül 2026 taraması (CC-MAIN-2026-39) istatistiklerine göre, taranan HTML sayfalarının yüzde 41,86'sının ana dili İngilizce. Türkçe sayfaların payı yüzde 1,28. Şirketlerin kendi eğitim verisi karışımı bu orandan farklı olabilir ve genellikle açıklanmıyor. Yine de tablo net. Model İngilizceyi Türkçeden kat kat fazla örnekten öğreniyor.
Türkçe performansı ölçen kıyaslamalar ne söylüyor?
Burada önce şaşırtıcı bir boşluğu söylemem gerekiyor. Büyük şirketlerin en sık andığı çok dilli ölçüm, OpenAI'nin profesyonel çevirmenlere çevirttiği MMMLU veri seti. Bu set 14 dili kapsıyor ve Türkçe bunların arasında yok. Anthropic'in Claude belgelerindeki çok dilli performans tablosu da bu seti kullanıyor. Eylül 2026 itibarıyla o tabloda (Claude Sonnet 4.5 ve Haiku 4.5 için) İngilizcenin yanında İspanyolcadan Yorubacaya 14 dil var, Türkçe yok. Yani bir şirketin "modelimiz çok dilli" demesi, Türkçenin ayrıca ölçüldüğü anlamına gelmiyor.
Türkçe için en sağlam veriyi bu yüzden bağımsız akademik kıyaslamalardan alıyoruz.
TurkishMMLU
TurkishMMLU, Türkiye'de lise öğrencilerinin üniversite sınavına hazırlanması için Milli Eğitim Bakanlığı'nın çevrim içi öğrenme platformunda yer alan sorulardan derlendi. 9 dersi kapsayan 10.032 çoktan seçmeli soru içeriyor ve çeviri değil, doğrudan Türkçe hazırlanmış sorulardan oluşuyor. 40'tan fazla model test edildi (arXiv sürümü, Ekim 2024).
Sonuçların öne çıkanları şöyle.
- En iyi sonucu GPT-4o aldı. Beş örnekli değerlendirmede genel doğruluk yüzde 83,1 oldu.
- En iyi açık model Llama-3 70B-IT yüzde 67,3'te kaldı.
- GPT-4o'nun sosyal bilimlerde doğruluğu yüzde 95,3, Türk Dili ve Edebiyatında yüzde 82, matematikte yüzde 59 oldu. Matematik neredeyse bütün modeller için en zor ders çıktı.
- Soru zorlaştıkça bütün modellerin başarısı düştü.
- Test edilen Türkçeye uyarlanmış modeller, daha yeni çok dilli modellerin gerisinde kaldı.
Bu sonuçları doğru okumak önemli. Bunlar 2024 modelleri ve sınav tipi çoktan seçmeli sorular. Bugünkü modeller muhtemelen daha yüksek puan alıyor. Ama "sınav sorusunu doğru işaretlemek" ile "Türkçe bir hukuk metnini doğru yorumlamak" aynı beceri değil.
TurkBench
Ocak 2026'da ODTÜ'den Çağrı Toraman liderliğinde, birkaç üniversite ve Turkcell'den araştırmacıların hazırladığı TurkBench daha geniş bir resim çiziyor. 6 kategoride 21 alt görev ve 8.151 örnek içeriyor. Okuduğunu anlama, özetleme, akıl yürütme, dil bilgisi, deyim ve mecazlar, Türkiye'ye özgü genel kültür ve talimata uyma bunların arasında.
Yayımlandığı tarihte test edilen modeller arasında en yüksek genel ortalamayı 100 üzerinden 78,6 ile gpt-oss-120b aldı. Ama asıl önemli bulgu ortalama değil. Araştırmacılar en gelişmiş sistemlerin bile kültüre dayalı akıl yürütmede (deyimler, atasözleri, Türkiye'ye özgü genel bilgi) zorlandığını ve bu alanlardaki doğruluğun İngilizce odaklı kıyaslamalardaki seviyenin belirgin biçimde altında kaldığını yazıyor. Talimata uyma alanında ise en iyi modellerin puanı 90'ın üzerinde.
Kültür boşluğu tesadüf değil
Cohere liderliğinde hazırlanan ve Türkçeyi de içeren 42 dilli Global MMLU çalışması bunun nedenini gösteriyor. Dünyada en çok kullanılan genel bilgi sınavı MMLU'nun sorularının yüzde 28'i kültüre özgü bilgi gerektiriyor ve bu soruların yüzde 86,5'i Batı kültürüne ait. Bölgesel bilgi açısından bakıldığında, kültüre özgü soruların yüzde 64,5'i Kuzey Amerika, yüzde 20,4'ü Avrupa bilgisi istiyor. İkisi birlikte yüzde 84,9 ediyor. Yani modellerin "genel kültür" diye öğrendiği şeyin önemli bir kısmı aslında Batı'nın genel kültürü. Türkiye'nin yerel bilgisi bu karışımda küçük bir yer tutuyor.
Yapay zeka Türkçede hangi işlerde güçlü?
Kıyaslamalar ve günlük kullanım birlikte düşünüldüğünde, güçlü olduğu alanlar genel olarak şunlar.
- Günlük dil ve yazışma. Resmiyeti az bir e-posta, bir mesaj taslağı, bir duyuru metni için genellikle akıcı ve doğal Türkçe üretiyor.
- Özetleme. Uzun bir Türkçe metnin ana fikrini çıkarmakta iyi. Yine de özetin atladığı ya da çarpıttığı bir ayrıntı olabileceğini unutma.
- Çeviri. Türkçe ile İngilizce arasında genel metin çevirisinde güçlü. Özellikle teknik ve standart dilde.
- Talimata uyma. "Üç madde yaz", "daha kısa yap" gibi biçim taleplerini büyük ölçüde doğru uyguluyor.
- Genel bilgi. Dünya çapında yaygın bilgilerde Türkçe sorulduğunda da tutarlı cevap veriyor.
Yapay zeka Türkçede nerede zayıf kalıyor?
Zayıf noktalar daha kritik, çünkü hata çoğu zaman akıcı bir cümlenin içine gizleniyor.
- Deyimler ve atasözleri. Bir deyimi yanlış anlamda kullanabiliyor ya da hiç var olmayan, kulağa Türkçe gelen bir söz üretebiliyor. TurkBench bu alanı açıkça zayıf halka olarak gösteriyor.
- Yerel kültür ve güncel Türkiye bilgisi. Bir ilçenin, bir kurumun, yakın tarihli bir düzenlemenin ya da yerel bir olayın ayrıntısında yanılma ihtimali yüksek. Modelin bilgi kesim tarihi de buna ekleniyor.
- Hukuki ve resmi dil. Kanun maddesi numarası, yönetmelik adı, dilekçe kalıbı gibi yerlerde emin görünen ama yanlış cevaplar verebiliyor. Bu alanda model bir taslak yardımcısı olabilir, bilgi kaynağı değil.
- Yazım ve ek hataları. "de/da" ve "ki" ayrımı, ünlü uyumu bozuk ekler, çeviri kokan cümle yapıları hâlâ görülebiliyor. Uzun metinlerde bu küçük hatalar birikiyor.
- Yöresel ağızlar ve argo. Standart İstanbul Türkçesi dışındaki kullanımlarda anlama isabeti düşüyor.
- Uydurma kaynak. Türkçe kaynak istediğinde var olmayan bir kitap, makale ya da haber bağlantısı üretebiliyor. Türkçe kaynak havuzu daha küçük olduğu için bu risk İngilizceye göre daha belirgin hissediliyor.
- Matematik ve çok adımlı akıl yürütme. TurkishMMLU'da matematik en zor ders çıktı. Sayısal bir cevabı her zaman kendin kontrol et.
Türkçe odaklı yerli modeller daha mı iyi?
Türkiye'de Türkçe için sıfırdan ya da uyarlanarak geliştirilen modeller var ve bu önemli bir çaba. Ama sonuçları abartmadan okumak gerekiyor.
Örnek olarak VNGRS'in geliştirdiği Kumru-2B'yi ele alalım. Model kartına göre 2 milyar parametreli, Türkçe için sıfırdan eğitilmiş ve Apache 2.0 lisansıyla açık. Geliştiriciler kendi seçtikleri Cetvel kıyaslamasında modelin kendisinden çok daha büyük modelleri geçtiğini ve özellikle dil bilgisi düzeltme ve özetlemede başarılı olduğunu söylüyor. Öte yandan bağımsız TurkBench değerlendirmesinde Kumru-2B'nin genel ortalaması 100 üzerinden 27,3'te kaldı.
Bu çelişki değil, bir ders. Hangi kıyaslamanın, hangi görevlerin ölçüldüğü sonucu değiştiriyor. Küçük ve Türkçeye özel bir model belirli dil görevlerinde iyi olabilir, geniş bilgi ve akıl yürütme gerektiren işlerde büyük çok dilli modellerin gerisinde kalabilir. TurkishMMLU'da da 2024 tarihli Türkçeye uyarlanmış modeller yeni çok dilli modellerin gerisinde kalmıştı.
Eylül 2026 itibarıyla okur için pratik sonuç şu. Günlük kullanımda en güçlü Türkçe sonuçları hâlâ büyük genel modeller veriyor. Yerli modellerin asıl değeri veri gizliliği, maliyet ve belirli dil görevleri gibi kurumsal ihtiyaçlarda öne çıkıyor. Hangi genel modelin senin işine uygun olduğunu merak ediyorsan en iyi yapay zeka hangisi yazısına bakabilirsin.
Türkçe mi sormalı, İngilizce mi?
Kısa cevap, çoğu iş için Türkçe sormak yeterli. Şu durumlarda İngilizce denemek fark yaratabilir.
- Teknik ve bilimsel konular. Kaynak literatürü ağırlıklı olarak İngilizce olan konularda (yazılım, tıp araştırması, ileri matematik) İngilizce soru daha derin ve isabetli cevap getirebiliyor.
- Çok uzun belgeler. Bağlam sınırına yaklaşıyorsan, token farkı nedeniyle İngilizce içerik daha fazla yer bırakır.
- Karşılaştırma için. Önemli bir soruyu hem Türkçe hem İngilizce sorup iki cevabı yan yana koymak, tutarsızlığı yakalamanın basit bir yolu.
Şu durumlarda ise Türkçe sormak daha doğru.
- Türkiye'ye özgü konular. Türk mevzuatı, yerel kurumlar, Türkçe dil bilgisi, Türk edebiyatı. İngilizce sorduğunda model konuyu çeviri üzerinden düşünür ve yerel bağlamı daha da kaybedebilir.
- Çıktı Türkçe olacaksa. İngilizce üretip çevirtmek, çeviri kokan bir metinle sonuçlanabiliyor.
Soruyu nasıl kurduğun da en az dil kadar önemli. Bağlam vermek, amacı ve biçimi açıkça söylemek sonucu belirgin biçimde iyileştiriyor. Bunun temellerini prompt nedir yazısında anlattım.
Türkçe çıktıyı nasıl denetlemelisin?
Ben yapay zeka eğitim ve değerlendirme işleri yapıyorum. Bu işte bir modelin cevabı değerlendirilirken genellikle aynı birkaç soruya bakılır. Doğru mu, eksiksiz mi, dili ve tonu uygun mu, kaynak gösteriyorsa kaynak gerçek mi? Bu işin nasıl yapıldığını merak edersen AI model trainer nedir yazısına göz atabilirsin. Aynı mantığı sen de kendi kullanımına uygulayabilirsin.
Bu yaklaşımın bir adı var. Ben buna kontrollü güven diyorum. Modele iş verirsin, ama sonucun ağırlığı arttıkça kontrolü de artırırsın. Türkçede bu kontrolün biraz daha sıkı olması gerekiyor, çünkü ölçüm de veri de İngilizcedeki kadar güçlü değil.
Şimdi ne yapmalısın?
- İşini sınıflandır. Günlük yazışma, özet ve genel çeviri düşük riskli. Hukuki metin, sağlık, para, resmi yazışma ve yayımlanacak içerik yüksek riskli.
- Yüksek riskli işte her sayıyı, tarihi, adı ve kanun maddesini birincil kaynaktan doğrula. Resmi Gazete, ilgili kurumun sitesi, uzman görüşü gibi.
- Kaynak istediysen her bağlantıyı aç. Açılmayan ya da farklı bir şey söyleyen kaynak, cevabın o kısmını geçersiz kılar.
- Metni yüksek sesle oku. Ek hataları, çeviri kokan yapılar ve tuhaf deyimler kulakla daha kolay yakalanır.
- Önemli sorularda ikinci bir dil ya da ikinci bir model dene. İki cevap birbirini tutmuyorsa konuyu bizzat araştır.
- Modele kendi cevabını sorgulat. "Bu cevaptaki emin olmadığın noktaları listele" demek, zayıf yerleri görünür kılar. Ama son kontrolü yine sen yaparsın.
Bu adımların arkasındaki alışkanlığa şüphe disiplini diyorum. Bu alışkanlığı sistemli biçimde kazanmak istersen Yapay Zeka Okuryazarlığı rehberi seni adım adım götürür.
Kapanış
Yapay zeka Türkçeyi iyi konuşuyor, ama Türkiye'yi her zaman iyi bilmiyor. Akıcı bir cümle doğru bir cümle demek değil. Günlük işlerde ona rahatça güvenebilirsin. Deyimde, yerel bilgide, resmi dilde ve kaynakta ise son sözü sen söylemelisin.
Kaynaklar
- TurkishMMLU: Measuring Massive Multitask Language Understanding in Turkish (arXiv, 2024)
- TurkBench: A Benchmark for Evaluating Turkish Large Language Models (arXiv, Ocak 2026)
- Petrov ve diğerleri, Language Model Tokenizers Introduce Unfairness Between Languages (NeurIPS 2023)
- Bayram ve diğerleri, Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark (arXiv, 2025)
- OpenAI, Hello GPT-4o (13 Mayıs 2024), dil parçalama tablosu
- OpenAI, MMMLU çok dilli veri seti (Hugging Face)
- Anthropic, Claude çok dilli destek belgesi
- Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation (arXiv)
- Common Crawl, dil dağılımı istatistikleri
- VNGRS, Kumru-2B model kartı (Hugging Face)
Sıkça Sorulan Sorular
Yapay zekaya Türkçe mi İngilizce mi soru sormalıyım?
Günlük işlerin çoğu için Türkçe sormak yeterli. Kaynak literatürü ağırlıklı İngilizce olan teknik konularda ya da çok uzun belgelerde İngilizce denemek fark yaratabilir. Türkiye'ye özgü konularda, örneğin yerel mevzuat, kurumlar ve Türkçe dil bilgisi sorularında Türkçe sormak daha doğru. Önemli bir soruyu iki dilde sorup cevapları karşılaştırmak, tutarsızlığı yakalamanın basit bir yolu.
Yapay zeka Türkçe deyimleri ve atasözlerini anlıyor mu?
Kısmen. Bağımsız TurkBench kıyaslamasına göre en gelişmiş modeller bile deyim, atasözü ve Türkiye'ye özgü genel bilgi gibi kültüre dayalı alanlarda zorlanıyor ve bu alanlardaki doğruluk İngilizce odaklı ölçümlerin belirgin biçimde altında kalıyor. Model bir deyimi yanlış anlamda kullanabilir ya da kulağa Türkçe gelen ama var olmayan bir söz üretebilir. Yayımlayacağın bir metinde deyimleri mutlaka kendin kontrol et.
Türkçe kullanmak yapay zekada daha mı pahalı?
Ücretli hizmetlerde çoğu zaman evet, biraz. Modeller metni token denen parçalara bölüyor ve ücret genellikle token başına alınıyor. OpenAI'nin 2024 GPT-4o duyurusundaki örnekte aynı cümle İngilizcede 24, Türkçede 30 token tutuyordu. Petrov ve arkadaşlarının 2023 çalışmasına göre bu tür farklar maliyeti, cevap süresini ve modele tek seferde verebileceğin içerik miktarını etkiliyor. Ücretsiz sohbet kullanımında bunu doğrudan hissetmezsin.
Yerli Türkçe yapay zeka modelleri daha mı iyi?
Göreve göre değişir. Türkçe için geliştirilen modeller bazı dil görevlerinde iddialı sonuçlar açıklıyor. Ama bağımsız kıyaslamalarda, özellikle genel bilgi ve akıl yürütme gerektiren işlerde, büyük çok dilli modellerin gerisinde kalabiliyorlar. Örneğin Kumru-2B kendi seçtiği kıyaslamada büyük modelleri geçtiğini söylerken TurkBench'te genel ortalaması 100 üzerinden 27,3'te kaldı. Yerli modellerin değeri daha çok gizlilik, maliyet ve kurumsal ihtiyaçlarda öne çıkıyor.
Yapay zekanın Türkçe hukuki ya da resmi metinlerine güvenebilir miyim?
Taslak için yardımcı olabilir ama bilgi kaynağı olarak güvenmemelisin. Modeller kanun maddesi numarası, yönetmelik adı ya da güncel düzenlemeler gibi ayrıntılarda emin görünen ama yanlış cevaplar verebiliyor. Türkçe kaynak havuzu küçük olduğu için var olmayan kaynak üretme riski de belirgin. Her maddeyi Resmi Gazete ya da ilgili kurumun resmi sitesinden doğrula ve önemli konularda bir uzmana danış.
Yapay zekanın Türkçe cevabını nasıl kontrol ederim?
Önce işin riskini belirle. Yüksek riskli işlerde her sayıyı, tarihi, adı ve kaynağı birincil kaynaktan doğrula. Verilen bağlantıların hepsini aç. Metni yüksek sesle okuyarak ek hatalarını ve çeviri kokan cümleleri yakala. Önemli sorularda ikinci bir model ya da ikinci bir dil dene. Modelden emin olmadığı noktaları listelemesini iste, ama son kontrolü her zaman kendin yap.
Yapay zekâ ve kişisel güvenlik üzerine yazıyor. Şirketlerin yapay zekâ dönüşümünde karar vericilere yön veriyor.
Hakkımda


