Yerel Yapay Zeka Nedir? On-Device AI 2026 Kapsamlı Rehber
Yerel yapay zeka nedir? Yerel yapay zeka (on-device AI), bir yapay zeka modelinin çıkarım (inference) işlemini uzak bir sunucuya veya buluta veri göndermeden, doğrudan telefon, dizüstü bilgisayar ya da gömülü cihaz üzerinde çalıştırması anlamına gelir. 2026 itibarıyla Apple, Google, Qualcomm, Samsung ve Microsoft gibi şirketler amiral gemi cihazlarına özel yapay zeka çekirdekleri (NPU) yerleştirdiği için bu yaklaşım artık niş bir deney olmaktan çıkıp ana akım bir mimari tercihi haline geldi. Bu yazıda yerel yapay zekanın nasıl çalıştığını, bulut tabanlı yapay zekadan farkını, kendi bilgisayarınızda nasıl bir model çalıştırabileceğinizi ve en sık yapılan hataları pratik örneklerle ele alıyoruz.
Yerel Yapay Zeka Nedir, Bulut Tabanlı Yapay Zekadan Farkı Ne?
Klasik bir yapay zeka asistanına (örneğin bir sohbet botuna) bir soru sorduğunuzda, isteğiniz genellikle internet üzerinden şirketin veri merkezindeki güçlü sunuculara gönderilir, orada işlenir ve yanıt size geri döner. Yerel yapay zekada bu akış tamamen değişir: model dosyası (ağırlıklar) doğrudan cihazınızda saklanır ve hesaplama, telefonunuzun veya bilgisayarınızın kendi işlemcisinde gerçekleşir. Bunun pratik sonucu, isteğinizin cihazınızdan hiç çıkmaması, dolayısıyla internet olmadan da çalışabilmesidir.
Burada ayrım genellikle üç kategoride yapılır: tamamen yerel çalışan modeller (internet gerektirmez), hibrit modeller (basit görevleri cihazda, karmaşık görevleri buluta yönlendirir) ve tamamen bulut tabanlı modeller. 2026’de piyasadaki çoğu “yapay zeka telefonu” aslında hibrit bir mimari kullanıyor; örneğin metin özetleme cihazda yapılırken, daha karmaşık bir araştırma sorgusu buluta yönlendirilebiliyor.
Tamamen Yerel, Hibrit ve Bulut Tabanlı Modeller Arasındaki Sınır
Pratikte bu üç kategori arasındaki sınır kullanıcıya her zaman net şekilde gösterilmiyor. Bir uygulamanın ayarlar menüsünde “cihazda işlensin” gibi bir seçenek sunması, o uygulamanın tüm özelliklerinin yerel çalıştığı anlamına gelmiyor; çoğu zaman yalnızca belirli bir özellik alt kümesi (örneğin klavye önerileri veya fotoğraf sınıflandırma) cihazda işleniyor, geri kalanı hâlâ sunucuya gidiyor. Bu nedenle bir ürünün pazarlama metninde geçen “yapay zeka artık cihazınızda” ifadesini, hangi özelliğin gerçekten yerel çalıştığını sorgulamadan kabul etmemek gerekiyor.
Yerel Yapay Zeka Nasıl Çalışır?
Donanım Tarafı: NPU, GPU ve Nöral Motor
Yerel yapay zekanın pratikte işe yaramasının temel nedeni, cihazlara eklenen özel yapay zeka çekirdekleri. Apple bunu “Neural Engine”, Qualcomm “Hexagon NPU”, Google ise Tensor çiplerindeki entegre TPU/NPU bloklarıyla adlandırıyor. Bu birimler, genel amaçlı CPU’lara kıyasla matris çarpımı gibi yapay zeka modellerinin temel işlemlerini çok daha düşük güç tüketimiyle yürütecek şekilde tasarlanıyor. Microsoft’un “Copilot+ PC” kategorisi için belirlediği donanım şartı da bunun somut bir örneği: bu etiketi taşıyabilmesi için bir dizüstü bilgisayarın NPU’sunun saniyede en az 40 trilyon işlem (TOPS) gücüne sahip olması gerekiyor.
Yazılım Tarafı: Küçültülmüş Modeller ve Quantization
Bulut sunucularında çalışan büyük dil modelleri onlarca, hatta yüzlerce milyar parametreye sahip olabiliyor; bu boyut bir telefonun belleğine sığmıyor. Bu nedenle yerel çalıştırma için modeller iki şekilde küçültülüyor: birincisi, zaten daha az parametreli “küçük dil modelleri” (small language models) eğitmek; ikincisi ise mevcut bir modeli quantization (nicemleme) denilen teknikle sıkıştırmak. Quantization, modelin ağırlıklarını normalde kullanılan 16 veya 32 bit’lik ondalıklı sayılar yerine 8 bit hatta 4 bit tamsayılarla temsil ederek dosya boyutunu ve bellek kullanımını büyük ölçüde azaltıyor; karşılığında modelin yanıt kalitesinde küçük bir düşüş yaşanabiliyor. Açık kaynak dünyasında bu sıkıştırılmış modeller genellikle GGUF adı verilen dosya formatında paylaşılıyor.
Bellek ve Depolama Sınırlamaları
Bir modelin telefonda veya dizüstü bilgisayarda sorunsuz çalışması için model dosyasının tamamının (veya büyük bölümünün) RAM’e sığması gerekiyor. Örneğin 4 bit quantization uygulanmış 7 milyar parametreli bir model yaklaşık 4-5 GB RAM gerektirebilirken, aynı modelin sıkıştırılmamış hâli 14 GB’ın üzerinde bellek isteyebilir. Bu yüzden üreticiler “bu telefon yapay zeka özelliklerini destekler” derken genellikle belirli bir minimum RAM eşiğini (örneğin 8 GB) referans alıyor. Depolama tarafında ise birden fazla modelin cihazda tutulması onlarca gigabayt yer kaplayabildiği için, bazı üreticiler yalnızca ihtiyaç anında modeli indirip kullandıktan sonra silen “isteğe bağlı indirme” yaklaşımını tercih ediyor.
Yerel Yapay Zeka Neden Şimdi Yükseliyor?
Cihaz üzerinde yapay zeka fikri aslında yeni değil; akıllı telefonlarda basit görüntü işleme ve ses tanıma işlemleri yıllardır bir dereceye kadar cihazda yapılıyordu. Ancak 2023-2026 arasında üç gelişme bu alanı sıçratan asıl etken oldu. Birincisi, büyük dil modeli araştırmalarının “daha küçük ama verimli” mimarilere yönelmesi; birkaç milyar parametreli modellerin bile artık makul kalitede yanıt üretebilmesi. İkincisi, quantization ve model damıtma (distillation) tekniklerinin olgunlaşması; bir modelin kalitesini büyük ölçüde koruyarak boyutunu onda birine kadar indirebilmek artık rutin bir mühendislik pratiği hâline geldi. Üçüncüsü ise donanım tarafında NPU’ların hemen hemen tüm yeni orta-üst segment cihazlara standart olarak girmesi. Bu üç eğilim birleşince, birkaç yıl önce yalnızca güçlü bir sunucuda çalışabilen kalitede bir model, bugün cebinizdeki telefonda çalışabilir hâle geldi.
Gizlilik Düzenlemelerinin Rolü
Avrupa Birliği’nin GDPR’ı ve benzeri veri koruma düzenlemelerinin dünya genelinde yaygınlaşması, şirketleri kullanıcı verisini mümkün olduğunca cihazda tutmaya teşvik eden ayrı bir etken oldu. Verinin hiç şirket sunucusuna ulaşmaması, veri işleme sözleşmeleri ve uyumluluk süreçlerini büyük ölçüde basitleştiriyor; bu da yerel yapay zekayı yalnızca teknik değil, aynı zamanda hukuki ve ticari açıdan da cazip kılıyor.
Bulut Tabanlı Yapay Zeka ile Karşılaştırma
| Kriter | Yerel Yapay Zeka (On-Device) | Bulut Tabanlı Yapay Zeka |
|---|---|---|
| Gizlilik | Veri cihazdan çıkmaz | Veri sağlayıcının sunucusuna gönderilir |
| İnternet bağımlılığı | Genellikle gerekmez | Zorunlu |
| Gecikme (latency) | Çok düşük, anında yanıt | Ağ hızına bağlı, değişken |
| Model kalitesi/boyutu | Sınırlı (birkaç milyar parametre) | Çok daha büyük, güçlü modeller |
| Maliyet | Tek seferlik donanım maliyeti | Genellikle abonelik veya kullanım başına ücret |
| Pil/güç tüketimi | NPU sayesinde optimize, yine de işlemci yükü var | Cihazda düşük, sunucu tarafında yüksek |
| Güncelleme | Yeni model indirmek gerekir | Sağlayıcı sunucuda anlık güncelleyebilir |
2026’de Gerçek Dünya Örnekleri
Bugün piyasada yerel yapay zekayı farklı şekillerde konumlandıran birkaç büyük ekosistem var. Apple, Apple Intelligence özelliklerinin bir kısmını doğrudan Neural Engine üzerinde çalıştırırken, daha büyük istekleri gizlilik odaklı sunucu altyapısı olan Private Cloud Compute’a yönlendiriyor. Google, Gemini Nano modelini Pixel telefonlarda mesajlaşma özetleme ve kayıt uygulaması transkripsiyonu gibi görevlerde cihaz üzerinde çalıştırıyor. Samsung’un Galaxy AI özellikleri de benzer şekilde bazı çeviri ve düzenleme işlevlerini cihazda, bazılarını bulutta işliyor. Microsoft ise Windows tarafında Copilot+ PC kategorisiyle NPU’yu işletim sistemi seviyesinde zorunlu bir bileşen hâline getirdi. Geliştirici tarafında ise Ollama ve llama.cpp gibi açık kaynak araçlar, herhangi bir kişinin kendi bilgisayarında açık kaynaklı modelleri (Llama, Mistral, Qwen gibi) yerel olarak çalıştırmasına imkân tanıyor.
Ekosistemlere Göre Yerel Yapay Zeka Yaklaşımı
| Ekosistem | Yapay Zeka Çekirdeği | Örnek Kullanım Alanı |
|---|---|---|
| Apple | Neural Engine | Yazma araçları, bildirim özetleme, Siri’nin bir kısmı |
| Google (Pixel) | Tensor NPU / Gemini Nano | Kayıt transkripsiyonu, mesaj özetleme |
| Samsung | Exynos/Snapdragon NPU + Galaxy AI | Çeviri, fotoğraf düzenleme |
| Qualcomm (Snapdragon) | Hexagon NPU | Üçüncü taraf uygulamalar için genel amaçlı hızlandırma |
| Windows (Copilot+ PC) | NPU (40+ TOPS şartı) | Canlı altyazı, görüntü oluşturma, arama |
| Geliştiriciler | CPU/GPU + Ollama, llama.cpp | Özel uygulama içi sohbet asistanı, otomasyon |
Bu tablo, yerel yapay zekanın tek bir “standart” uygulaması olmadığını, her ekosistemin kendi donanımına ve ürün stratejisine göre farklı özellik setleri sunduğunu gösteriyor. Bir kullanıcı için “yerel yapay zeka desteği var mı?” sorusunun cevabı, kullanılan cihaza ve işletim sistemi sürümüne göre önemli ölçüde değişebiliyor.
Kendi Cihazınızda Yerel Yapay Zeka Nasıl Çalıştırılır?
Teknik bilgisi olan bir kullanıcının kendi bilgisayarında küçük bir dil modelini yerel olarak denemesi, göründüğünden daha basit. İzlenebilecek genel adımlar şöyle:
- Cihazınızın donanımını kontrol edin: en az 8 GB RAM (16 GB önerilir) ve tercihen ayrı bir GPU veya NPU bulunması işleri hızlandırır.
- Ollama gibi bir çalıştırma aracını kurun; bu araçlar model indirme, quantization ve çalıştırma sürecini otomatikleştirir.
- Cihazınızın gücüne uygun küçük bir model seçin (örneğin 3-8 milyar parametreli bir model, 13 milyar veya üzeri parametreli bir modelden daha hızlı çalışır).
- Modeli indirip yerel olarak başlatın ve basit bir istemle (prompt) yanıt süresini test edin.
- Yanıt kalitesi yetersizse daha yüksek quantization seviyesi (örneğin Q4 yerine Q6/Q8) veya daha büyük bir model deneyin; hız yetersizse tam tersini yapın.
Terminalde Ollama ile bir modeli kurup çalıştırmak şu kadar basit olabilir:
# Ollama kurulumu (macOS/Linux)
curl -fsSL https://ollama.com/install.sh | sh
# Küçük bir dil modelini indirip yerel olarak çalıştırma
ollama run llama3.2:3b
Python tarafında çalışan bir uygulamaya yerel çıkarım eklemek isteyen bir geliştirici için ise llama-cpp-python kütüphanesiyle basit bir örnek şu şekilde kurulabilir:
from llama_cpp import Llama
llm = Llama(model_path="./models/llama-3.2-3b-instruct.Q4_K_M.gguf",
n_ctx=4096, n_threads=6, n_gpu_layers=20)
# GGUF dosyasının doğru sohbet şablonunu taşıdığını doğrulayın.
output = llm.create_chat_completion(
messages=[{"role": "user", "content": "Yerel yapay zekayı iki cümleyle açıkla."}],
max_tokens=200)
print(output["choices"][0]["message"]["content"])
Bu örnekte n_gpu_layers parametresi, modelin kaç katmanının GPU veya uyumlu hızlandırıcıya yükleneceğini belirliyor; bu değeri artırmak genellikle yanıt hızını belirgin şekilde iyileştiriyor. Resmi dokümantasyon ve desteklenen model listesi için Ollama’nın resmi sitesine göz atabilirsiniz.
Performans Sorunlarını Giderme
Model beklenenden yavaş çalışıyorsa kontrol edilmesi gereken birkaç nokta var. İlk olarak görev yöneticisinden (veya htop/Etkinlik İzleyici gibi araçlardan) modelin gerçekten GPU/NPU’yu mu yoksa yalnızca CPU’yu mu kullandığına bakılmalı; birçok kurulum hatası modelin sessizce CPU’ya düşmesine neden olur. İkinci olarak, bağlam penceresi (context window) boyutunun gereğinden büyük tutulması bellek kullanımını artırıp yanıt süresini uzatabilir; görev basitse bu değeri düşürmek fark yaratabilir. Son olarak, arka planda aynı anda başka ağır uygulamaların çalışmıyor olduğundan emin olunmalı, zira yerel modeller sistem kaynaklarını diğer uygulamalarla paylaşmak zorunda.
Avantajlar ve Dezavantajlar
- Avantaj: Veriler cihazdan çıkmadığı için gizlilik riski azalır; bu özellikle kişisel mesajlar, sağlık verileri veya kurumsal belgeler gibi hassas içeriklerde önem taşır.
- Avantaj: İnternet bağlantısı olmadan da temel yapay zeka özellikleri kullanılabilir; uçakta, metroda veya bağlantının zayıf olduğu bölgelerde çalışmaya devam eder.
- Avantaj: Sunucu maliyeti veya API kullanım ücreti olmadığı için uzun vadede daha öngörülebilir bir maliyet yapısı sunar; yoğun kullanım senaryolarında bulut API faturaları hızla büyüyebilirken yerel çözümde tek maliyet donanımdır.
- Dezavantaj: Model boyutu sınırlı olduğu için bulut tabanlı büyük modellere kıyasla yanıt kalitesi, özellikle karmaşık akıl yürütme gerektiren görevlerde, genellikle daha düşüktür.
- Dezavantaj: Eski veya düşük donanımlı cihazlarda modelin çalıştırılması yavaş olabilir ya da hiç mümkün olmayabilir; bu da yerel yapay zekayı herkes için eşit ölçüde erişilebilir kılmıyor.
- Dezavantaj: Modeli güncellemek, bulut tarafında olduğu gibi anlık değil; yeni bir model dosyası indirip mevcut sürümle değiştirmeyi gerektirir, bu da bazı kullanıcılar için ek bir bakım yükü anlamına gelir.
Sık Yapılan Hatalar ve Çözümleri
Yerel yapay zekayı ilk kez deneyen kullanıcıların ve geliştiricilerin sıkça karşılaştığı sorunlar genellikle donanım seçimi, kurulum ayarları ve beklenti yönetimi etrafında toplanıyor. Aşağıdaki liste, bu sürece yeni başlayanların en çok zaman kaybettiği noktaları ve pratik çözümlerini özetliyor:
- Cihaza uygun olmayan model seçmek: 13 milyar parametreli bir modeli 8 GB RAM’li bir bilgisayarda çalıştırmaya çalışmak sistemin kilitlenmesine yol açabilir. Çözüm: cihazın RAM ve VRAM kapasitesine göre 3-8 milyar parametreli, uygun quantization seviyesine sahip bir model seçmek.
- Donanım hızlandırmayı etkinleştirmemek: Model varsayılan olarak yalnızca CPU üzerinde çalıştırıldığında, GPU/NPU destekli bir cihazda bile yanıt süreleri gereksiz yere uzayabilir. Çözüm: kullanılan kütüphanenin GPU/NPU desteğini (ör. Metal, CUDA, Vulkan) doğru şekilde etkinleştirmek.
- Quantization sonrası kalite kaybını göz ardı etmek: Aşırı agresif sıkıştırma (ör. 2 bit) modelin tutarsız veya hatalı yanıtlar vermesine yol açabilir. Çözüm: görev kritikse Q5/Q6/Q8 gibi daha yüksek hassasiyetli quantization seviyelerini test etmek.
- Hibrit modellerde gizlilik varsayımı yapmak: Bir uygulamanın “yerel yapay zeka” kullandığını iddia etmesi, tüm isteklerin cihazda kaldığı anlamına gelmez; birçok uygulama karmaşık sorguları yine de buluta gönderir. Çözüm: uygulamanın gizlilik politikasını ve hangi işlemlerin gerçekten cihazda kaldığını kontrol etmek.
- Model lisansını kontrol etmemek: Bazı açık ağırlıklı modeller ticari kullanımda ek izin veya kısıtlama gerektirebilir. Çözüm: modeli bir üründe kullanmadan önce lisans şartlarını (ör. Llama Community License gibi) incelemek.
Kimler İçin Uygun? Hangi Durumda Tercih Edilmeli?
Yerel yapay zeka; gizliliğin öncelikli olduğu kurumsal senaryolarda (örneğin hukuk, sağlık veya finans gibi hassas veri işleyen sektörlerde), internet bağlantısının kararsız olduğu saha uygulamalarında ve API maliyetlerini sıfıra indirmek isteyen bağımsız geliştiriciler için güçlü bir seçenek. Buna karşılık, en yüksek yanıt kalitesinin ve en güncel bilginin gerekli olduğu, karmaşık akıl yürütme gerektiren görevlerde bulut tabanlı büyük modeller hâlâ önde. Pratikte 2026’nın baskın modeli, iki yaklaşımı bir arada kullanan hibrit mimari: basit ve gizlilik açısından hassas görevler cihazda, karmaşık görevler ise kullanıcının onayıyla buluta yönlendiriliyor.
Somutlaştırmak gerekirse: bir avukatlık bürosunun gizli müvekkil belgelerini özetlemek için yerel bir modeli tercih etmesi mantıklı, çünkü belgeler hiçbir zaman büro dışına çıkmıyor. Buna karşılık, güncel piyasa verilerini analiz edip kapsamlı bir yatırım raporu hazırlamak isteyen bir kullanıcı için, güncel bilgiye erişimi olan ve çok daha büyük bir bulut tabanlı modelin kullanılması daha uygun olacaktır. Kararı doğru vermenin yolu, görevin gizlilik hassasiyetini ve gereken model kalitesini birlikte değerlendirmekten geçiyor.
Sık Sorulan Sorular
Yerel yapay zeka internetsiz çalışır mı?
Tamamen yerel (on-device) olarak tasarlanmış modeller internet bağlantısı olmadan çalışabilir. Ancak birçok uygulama hibrit yapıdadır ve bazı özellikler için yine de internet gerektirebilir.
Yerel yapay zeka bulut tabanlı yapay zekadan daha mı yavaş?
Yerelde ağ gecikmesi ortadan kalkabilir; ancak model yükleme, ilk token süresi ve üretim hızı donanıma bağlıdır. Yavaş CPU’da çalışan büyük bir model, buluttaki GPU hizmetinden daha yavaş olabilir. Aynı görevi, bağlam uzunluğunu ve kalite ölçütünü kullanarak karşılaştırın.
Hangi telefonlar yerel yapay zeka çalıştırabilir?
Özel bir yapay zeka çekirdeği (NPU) barındıran güncel amiral gemi telefonlar (örneğin son nesil iPhone, Pixel ve Galaxy modelleri) yerel yapay zeka özelliklerini destekler; eski veya giriş seviyesi cihazlarda bu özellikler sınırlı olabilir.
Yerel yapay zeka modelleri ücretsiz mi?
Birçok açık ağırlıklı model (Llama, Mistral, Qwen gibi) ücretsiz olarak indirilebilir; ancak bazı modellerin ticari kullanımı lisans şartlarına tabidir ve bazı üretici özellikleri (ör. belirli cihaz asistanları) donanıma bağlı olarak sunulur.
Yerel yapay zeka verilerimi tamamen güvende tutar mı?
Verinin cihazdan çıkmaması gizlilik riskini önemli ölçüde azaltır, ancak “tamamen güvende” garantisi vermek doğru olmaz; cihaz güvenliği, uygulama izinleri ve hibrit özelliklerin ne zaman buluta veri gönderdiği hâlâ dikkat edilmesi gereken noktalardır.
Yerel yapay zeka ile bulut yapay zeka aynı anda kullanılabilir mi?
Evet, günümüzdeki birçok ürün zaten bu şekilde çalışıyor. Basit ve hızlı yanıt gerektiren görevler cihazda işlenirken, daha karmaşık veya güncel bilgi gerektiren istekler kullanıcının bilgisi ve genellikle onayıyla buluta yönlendiriliyor; bu hibrit yaklaşım hem hız hem de kalite açısından bir denge kurmayı amaçlıyor.
Yerel Çıkarım ile Tamamen Çevrimdışı Uygulama Ayrımı
Yerel model tek başına verinin dışarı çıkmadığını kanıtlamaz; uygulamanın telemetrisi, web araçları ve bulut geri dönüşü ayrıca kontrol edilmelidir. Ollama’da yalnızca yerel çalışma isteniyorsa OLLAMA_NO_CLOUD=1 ayarından sonra hizmeti yeniden başlatıp kullanılan modeli doğrulayın. 11434 portunu kimlik doğrulamasız internete açmayın. Ollama kurulum betiği Linux içindir; macOS resmî uygulaması ayrı indirilir. n_gpu_layers GPU offload ayarıdır, genel NPU desteği değildir. 7B Q4 ağırlık dosyasının yaklaşık boyutu toplam RAM gereksinimi değildir; KV cache ve çalışma alanı da eklenir.
Teknik kaynak: Ollama — Yerel/bulut çalışma ve yapılandırma.




