Küçük Dil Modeli Nedir? SLM Büyük Modelden Farkı (2026)
Küçük dil modeli nedir? Küçük dil modeli (İngilizce: Small Language Model, kısaca SLM), milyar parametreli devasa büyük dil modellerinin (LLM) aksine, genellikle birkaç yüz milyon ile 15 milyar parametre arasında kalan, buna karşılık belirli görevlerde şaşırtıcı derecede yetkin çalışan yapay zeka modelleridir. 2026 itibarıyla Microsoft’un Phi-4 ailesi, Google’ın Gemma 4 modeli, Alibaba’nın Qwen3 serisi ve Mistral’in Ministral 3 modelleri, bu kategorinin en bilinen örnekleri arasında yer alıyor. Bu makalede küçük dil modelinin ne olduğunu, büyük modellerden farkını, hangi durumlarda tercih edilmesi gerektiğini ve kendi bilgisayarınızda nasıl çalıştırabileceğinizi adım adım ele alıyoruz.
Küçük Dil Modeli Nedir? Temel Tanım ve Çalışma Mantığı
SLM için üzerinde uzlaşılmış kesin bir parametre sınırı yoktur; terim, daha düşük kaynak ihtiyacı olan dil modelleri için kullanılır. Küçük model sıfırdan eğitilebilir veya distilasyonla geliştirilebilir. Nicemleme ise sayıların bit hassasiyetini azaltır; parametre sayısını küçültmez ve bilgi damıtma ile aynı işlem değildir. Kapalı modellerin açıklanmamış parametre sayısını karşılaştırma ölçütü olarak kullanmamak gerekir.
Neden Her Görev İçin Büyük Model Gerekmiyor?
Bir müşteri destek botunun iade politikasını açıklaması, bir e-ticaret sitesinin ürün açıklamasını özetlemesi veya bir mobil uygulamanın sesli komutu metne çevirmesi gibi görevler, genel dünya bilgisi gerektiren açık uçlu sorular değildir. Bu tür dar kapsamlı, tekrarlayan görevlerde küçük bir model, doğru şekilde eğitildiğinde veya ince ayar (fine-tuning) yapıldığında, büyük bir modelle neredeyse aynı kaliteyi çok daha düşük maliyetle sunabilir.
Kısa Tarihçe: SLM Kavramı Nereden Geldi?
Küçük dil modelleri yeni bir fikir değildir. Phi gibi aileler 2023’ten itibaren küçük model araştırmalarının görünürlüğünü artırdı. Bir projenin önce küçük mü büyük mü model deneyeceği görev, donanım ve ölçülen kaliteye göre belirlenmelidir.
Küçük Dil Modeli ile Büyük Dil Modeli Arasındaki Farklar
Parametre Sayısı ve Bellek Kullanımı
Parametre sayısı, bir modelin doğrudan bellek (RAM/VRAM) gereksinimini belirler. Kabaca bir kural olarak, 4-bit nicemleme uygulanmış bir model, parametre sayısının yaklaşık yarısı kadar gigabayt bellek gerektirir. Örneğin 8 milyar parametreli bir model, 4-bit nicemleme ile yaklaşık 4-5 GB VRAM ile çalışabilirken, 70 milyar parametreli bir model için bu rakam 35-40 GB’a çıkar. Bu fark, bir SLM’in normal bir dizüstü bilgisayarda, hatta bazı durumlarda bir akıllı telefonda çalışabilmesini; bir LLM’in ise genellikle profesyonel bir GPU sunucusu gerektirmesini açıklar.
Maliyet, Gizlilik ve Gecikme Süresi
Yerel çalışma ağ gecikmesini ve dış servise veri gönderme ihtiyacını azaltabilir. Toplam yanıt süresi cihazın hesaplama hızına ve çıktı uzunluğuna bağlıdır; milisaniyelik yanıt veya sıfır maliyet garantisi yoktur. Donanım, elektrik ve bakım bedelini de hesaba katın.
2026’da En Popüler Küçük Dil Modelleri
Aşağıdaki tablo, 2026 itibarıyla öne çıkan küçük dil modellerini ve temel özelliklerini karşılaştırıyor:
| Model | Geliştirici | Parametre Aralığı | Lisans | Öne Çıkan Kullanım |
|---|---|---|---|---|
| Phi-4-mini | Microsoft | 3,8B | Açık ağırlık | Muhakeme, kod, edge cihazlar |
| Gemma 4 | E2B / E4B / 12B / 26B A4B (MoE) / 31B | Apache 2.0 (Gemma 4) | Genel amaçlı, mobil entegrasyon | |
| Qwen3 (küçük varyantlar) | Alibaba | 0,6B / 1,7B / 4B / 8B | Apache 2.0 | Çok dilli destek (119 dil) |
| Ministral 3 | Mistral AI | 3B / 8B / 14B | Apache 2.0 | Ajan tabanlı iş akışları |
| Llama 3.2 | Meta | 1B / 3B | Llama Topluluk Lisansı | Mobil ve gömülü sistemler |
Apache 2.0 ve MIT benzeri açık lisanslar, modeli ticari projelerde serbestçe kullanmanıza izin verirken; Llama gibi modellerin kendi özel lisans şartları, belirli ölçek üstündeki kullanımlar için ek onay gerektirebilir. Bir projeye başlamadan önce lisans metnini mutlaka kontrol etmenizi öneririz.
Küçük Dil Modelleri Nerede Kullanılır?
Mobil ve Edge Cihazlar
Akıllı telefonlar, IoT cihazları ve otomotiv sistemleri gibi sınırlı işlem gücüne sahip donanımlarda internet bağlantısı olmadan çalışabilen bir dil modeline ihtiyaç var. Bu senaryo, sitemizdeki yerel yapay zeka (on-device AI) rehberinde detaylıca ele aldığımız kullanım alanıyla doğrudan örtüşüyor; SLM’ler bu alanın teknik omurgasını oluşturuyor.
Kurumsal Otomasyon ve Ajan Tabanlı İş Akışları
Bir şirketin iç dokümantasyon botu, e-posta sınıflandırma sistemi veya form doldurma asistanı gibi tekrarlayan, dar kapsamlı görevlerde küçük bir model, hem maliyeti düşürür hem de veri şirket sunucularından çıkmadığı için KVKK/GDPR uyumluluğunu kolaylaştırır. Bu nedenle 2026’da birçok kurumsal n8n ve otomasyon iş akışı, büyük bulut modelleri yerine yerel olarak barındırılan bir SLM’i tercih ediyor.
Çağrı Merkezi, Chatbot ve Kod Tamamlama Araçları
Web sitesi canlı destek widget’ları, WordPress üzerinde çalışan sipariş takip botları ve IDE içi kod tamamlama eklentileri de SLM’lerin en yaygın kullanım alanlarından. Bu senaryolarda kullanıcı, saniyenin altında bir yanıt beklediği için bulut tabanlı bir modelin ağ gecikmesi kullanıcı deneyimini bozabilir; yerel bir SLM bu gecikmeyi ortadan kaldırır. Aynı mantık, kod editörlerindeki satır içi öneri özellikleri için de geçerli: model ne kadar hızlı yanıt verirse geliştirici akışı o kadar az bölünür.
Veri Analitiği ve Ön İşleme (Preprocessing) Katmanı
Büyük veri kümelerini bir LLM’e göndermeden önce ön sınıflandırma, etiketleme veya temizleme yapmak da yaygın bir SLM kullanım deseni. Örneğin milyonlarca müşteri yorumunu önce küçük bir modelle “olumlu/olumsuz/nötr” şeklinde ön sınıflandırıp, yalnızca belirsiz veya karmaşık örnekleri daha maliyetli bir büyük modele yönlendirmek, toplam işleme maliyetini önemli ölçüde düşürebilir.
SLM Seçim Kriterleri: Hangi Faktörlere Bakmalısınız?
Doğru küçük dil modelini seçmek, sadece parametre sayısına bakmaktan ibaret değil. Aşağıdaki kriterler, karar sürecinde göz ardı edilmemesi gereken noktalar:
- Bağlam penceresi (context window): Modelin bir kerede işleyebildiği metin uzunluğu. Uzun dokümanlarla çalışacaksanız, 32K veya 128K token destekleyen bir varyant tercih edin.
- Dil desteği: Türkçe gibi diller için modelin eğitim verisinde yeterli miktarda bulunup bulunmadığı doğrudan çıktı kalitesini etkiler; Qwen3 gibi çok dilli odaklı modeller bu konuda avantajlı.
- Lisans şartları: Apache 2.0 ve MIT gibi lisanslar ticari kullanımda daha az kısıtlama getirirken, Llama’nın topluluk lisansı belirli kullanıcı sayısı eşiklerinin üzerinde ek izin gerektirebilir.
- Topluluk ve araç desteği: Ollama, LM Studio, vLLM gibi popüler araçlarla doğrudan uyumlu olan modeller, entegrasyon sürecini kısaltır.
- Donanım uyumluluğu: Hedef cihazınızın (sunucu, dizüstü, mobil) bellek ve işlemci kapasitesine uygun parametre boyutunu seçin; gereğinden büyük bir model seçmek performans sorunlarına yol açar.
Küçük Dil Modeli Nasıl Çalıştırılır? Adım Adım Kurulum
Ollama Linux, macOS ve Windows üzerinde kullanılabilir. Aşağıdaki shell kurulum komutu Linux içindir. macOS ve Windows için resmi indirme sayfasındaki uygulamayı kullanın; modeli çalıştırma komutları kurulumdan sonra benzerdir.
- Ollama’yı kurun: Terminale aşağıdaki komutu yazın.
curl -fsSL https://ollama.com/install.sh | sh
- Bir küçük modeli indirin ve çalıştırın: Örneğin Phi-4-mini modelini çekmek için:
ollama pull phi4-mini
ollama run phi4-mini "Merhaba, kendini tanıtır mısın?"
- Modeli yerel bir API olarak kullanıma açın: Ollama, varsayılan olarak
localhost:11434üzerinde bir API sunar. Bu API’yi bir web sitesine veya WordPress eklentisine entegre etmek için PHP ile şu şekilde bir istek atabilirsiniz:
<?php
$ch = curl_init('http://localhost:11434/api/generate');
curl_setopt($ch, CURLOPT_POST, true);
curl_setopt($ch, CURLOPT_RETURNTRANSFER, true);
curl_setopt($ch, CURLOPT_HTTPHEADER, ['Content-Type: application/json']);
curl_setopt($ch, CURLOPT_POSTFIELDS, json_encode([
'model' => 'phi4-mini',
'prompt' => 'Bu ürün açıklamasını 2 cümleyle özetle: ' . $urun_aciklamasi,
'stream' => false,
]));
$response = curl_exec($ch);
curl_close($ch);
$sonuc = json_decode($response, true);
echo esc_html($sonuc['response'] ?? 'Yanıt alınamadı');
PHP örneği WordPress içindir; $urun_aciklamasi önceden tanımlanmalıdır. localhost, PHP’nin çalıştığı sunucuyu gösterir; hosting sunucusundan dizüstünüzdeki Ollama’ya bağlanmaz. Üretimde zaman aşımı ve HTTP/cURL hata kontrolü ekleyin.
- Performansı test edin: Modelin yanıt süresini ve doğruluğunu, gerçek kullanım senaryonuza yakın 10-15 örnek istekle test edin; tatmin edici değilse bir üst boyuttaki varyanta (örneğin 3,8B yerine 8B) geçmeyi deneyin.
Küçük Dil Modelini İnce Ayar (Fine-Tuning) ile Özelleştirme
Genel amaçlı bir SLM’i şirkete özgü terminolojiye veya belirli bir yanıt formatına uyarlamak için tüm modeli yeniden eğitmeye gerek yok. LoRA (Low-Rank Adaptation) gibi hafif ince ayar teknikleri, modelin sadece küçük bir bölümünü güncelleyerek, tüketici sınıfı bir GPU ile bile birkaç saat içinde özelleştirme yapmanıza olanak tanır. Aşağıda Hugging Face’in transformers ve peft kütüphaneleriyle basit bir LoRA ince ayar iskeleti yer alıyor:
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import LoraConfig, get_peft_model
model_name = "microsoft/Phi-4-mini-instruct"
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
lora_config = LoraConfig(
r=8,
lora_alpha=16,
target_modules="all-linear",
lora_dropout=0.05,
task_type="CAUSAL_LM",
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters()
# Eğitilebilir parametre sayısı seçilen katmanlara göre değişir.
Bu örnek LoRA adaptörünü ekler; veri hazırlama, eğitim ve değerlendirme döngüsü içermez. all-linear, desteklenen doğrusal katmanları hedefler; model ve PEFT sürümünün uyumluluğunu kontrol edin. Katman adları mimariye göre değişir. Örnek sayısını sabit bir yeterlilik eşiği saymayın; ayrılmış test kümesinde kaliteyi ve unutma riskini ölçün.
Maliyet Karşılaştırması: Yerel SLM ile Bulut API Arasındaki Fark
Bulut tabanlı büyük dil modeli API’leri genellikle işlenen token sayısına göre ücretlendirilir; kullanım hacmi arttıkça toplam maliyet doğrusal olarak büyür. Yerel bir SLM’de ise ana maliyet, başlangıçta yapılan donanım yatırımı (veya kiralanan sunucu maliyeti) ve elektrik tüketimidir; yük arttıkça elektrik, kapasite ve işletim maliyeti de artabilir. Bu nedenle günde binlerce, on binlerce isteği işleyen yüksek hacimli ve tekrarlayan senaryolarda (örneğin bir e-ticaret sitesinin otomatik ürün açıklaması üretmesi), yerel bir SLM zamanla bulut API’sinden daha ekonomik hale gelebilir. Düşük hacimli, seyrek kullanılan senaryolarda ise bulut API’sinin kullandıkça öde modeli, sabit donanım yatırımı yapmaktan daha mantıklı olabilir. Kesin eşiği belirlemek için kendi trafik hacminizi ve hedef modelin donanım gereksinimini baz alan bir maliyet tablosu çıkarmanızı öneririz.
Sık Yapılan Hatalar ve Çözümleri
1. Her Göreve Aynı Küçük Modeli Uygulamak
Bir SLM’in genel dünya bilgisi sınırlıdır. Karmaşık, çok adımlı muhakeme gerektiren bir görevde küçük modeli zorlamak yerine, bu tür görevleri bir bulut tabanlı büyük modele yönlendirip yalnızca basit, tekrarlayan görevleri yerel SLM’e bırakan hibrit bir mimari kurmak daha sağlıklı sonuç verir.
2. Nicemleme Seviyesini Görmezden Gelmek
Aynı model, 4-bit, 8-bit veya 16-bit nicemleme seviyelerinde farklı bellek ve doğruluk dengesi sunar. Üretim ortamına geçmeden önce en az iki farklı nicemleme seviyesini kendi veri setinizle test etmeden karar vermek, beklenmedik doğruluk kayıplarına yol açabilir.
3. İnce Ayar (Fine-Tuning) Olmadan Beklenti Yüksek Tutmak
Genel amaçlı bir küçük modeli hiçbir özelleştirme yapmadan şirkete özgü, jargon yoğun bir görevde kullanmak sıkça hayal kırıklığı yaratıyor. LoRA gibi hafif ince ayar yöntemleriyle modelin kendi verinize göre uyarlanması, çoğu zaman büyük bir modele geçmekten daha ucuz ve daha etkili bir çözüm.
4. Bellek ve Donanım Planlamasını Atlamak
“Küçük” model demek, sıfır kaynak gerektirdiği anlamına gelmez. Özellikle 8B ve üzeri varyantlarda, üretim yükü altında eşzamanlı isteklerin bellek kullanımını çarpanla artırdığını unutmamak gerekir; kapasite planlamasını gerçek trafik tahminine göre yapın.
5. Güvenlik ve Girdi Doğrulamasını İhmal Etmek
Yerel bir model çalıştırmak, güvenlik sorumluluğunu ortadan kaldırmaz. Kullanıcıdan gelen girdiyi doğrudan modele iletmeden önce temel doğrulama ve süzgeçten geçirmek, prompt injection türü saldırılara karşı hâlâ gereklidir.
Kendi Ortamınızda Basit Bir Benchmark Nasıl Kurulur?
Bir modeli üretime almadan önce, “iyi çalışıyor mu” sorusunu kendi verinizle test etmeden geçmemek gerekir. Basit bir değerlendirme süreci şöyle kurulabilir:
- Gerçek kullanım senaryonuzu temsil eden 20-30 örnek soru-cevap çifti hazırlayın (örneğin gerçek müşteri sorularından derlenmiş bir liste).
- Aynı soruları önce hedeflediğiniz SLM’e, ardından karşılaştırma için mevcut bulut tabanlı büyük modelinize gönderin.
- Her yanıtı doğruluk, ton ve uzunluk açısından 1-5 arası puanlayın; mümkünse bu puanlamayı ekibinizden birden fazla kişiye yaptırın.
- Ortalama puanı ve yanıt süresini not edin; SLM’in ortalama puanı hedef eşiğinizin (örneğin 4/5) altındaysa, bir üst parametre boyutuna geçmeyi veya ince ayar uygulamayı değerlendirin.
- Üretime aldıktan sonra da gerçek kullanıcı geri bildirimlerini düzenli olarak örnekleyip aynı puanlama sürecini tekrarlayın; model veya veri kayması (drift) zamanla kaliteyi düşürebilir.
Bu süreç karmaşık bir MLOps altyapısı gerektirmez; bir e-tablo ve birkaç saatlik manuel değerlendirme, çoğu küçük ve orta ölçekli proje için yeterli bir başlangıç noktasıdır.
Kime, Hangi Durumda Uygun?
Küçük dil modeli; sınırlı bütçeli, gizlilik hassasiyeti yüksek, düşük gecikme gerektiren veya dar kapsamlı, tekrarlayan görevlerle uğraşan geliştiriciler ve şirketler için genellikle doğru tercih. Öte yandan açık uçlu, geniş dünya bilgisi ve karmaşık çok adımlı muhakeme gerektiren görevlerde büyük bulut modelleri hâlâ daha güvenilir sonuç veriyor. Pratikte en verimli yaklaşım, ikisini bir arada kullanan hibrit bir mimari kurmak: basit ve sık tekrarlanan işleri yerel bir SLM’e, karmaşık ve nadir görevleri ise bulut tabanlı bir LLM’e yönlendirmek.
Bir WordPress veya küçük ölçekli SaaS projesi yürütüyorsanız, tavsiyemiz şu şekilde özetlenebilir: önce mevcut bulut API’nizle görevi çözün ve gerçek kullanım verinizi toplayın; trafik hacmi ve maliyet belirli bir eşiği aştığında, aynı görevi bir SLM’e taşımayı deneyin ve yukarıdaki basit benchmark sürecini uygulayarak kalite kaybı olup olmadığını ölçün. Bu kademeli yaklaşım, hem gereksiz erken optimizasyon riskini hem de büyüyen bir bulut API faturasıyla aniden karşılaşma riskini aynı anda azaltır.
Sık Sorulan Sorular
Küçük dil modeli ile büyük dil modeli arasındaki temel fark nedir?
Temel fark parametre sayısı ve buna bağlı genel bilgi kapasitesidir; SLM’ler genellikle 270 milyon ile 15 milyar parametre arasında kalırken LLM’ler yüzlerce milyar parametreye sahip olabilir.
Bir küçük dil modelini normal bir dizüstü bilgisayarda çalıştırabilir miyim?
Donanım ve model varyantına bağlıdır. 4-bit ağırlıklar için yaklaşık bellek hesabına KV cache, çalışma belleği ve işletim sistemini ekleyin. Belleğe sığmak, kabul edilebilir hızda çalışmakla aynı değildir.
Küçük dil modelleri ücretsiz mi?
Phi-4, Gemma 4, Qwen3 ve Ministral 3 gibi modellerin ağırlıkları ücretsiz olarak indirilebilir; ancak lisans şartları ticari kullanım için değişiklik gösterebilir, kullanmadan önce lisansı kontrol etmek gerekir.
SLM’ler halüsinasyon yapar mı?
Evet, küçük modeller de büyük modeller gibi halüsinasyon üretebilir; genel bilgi kapasiteleri daha sınırlı olduğu için dar kapsam dışına çıkıldığında bu risk daha da artabilir.
Hangi küçük dil modeliyle başlamalıyım?
Genel amaçlı denemeler için Phi-4-mini veya Gemma 4’ün 4B varyantı iyi bir başlangıç noktası; çok dilli bir proje için Qwen3, ajan tabanlı otomasyon için ise Ministral 3 değerlendirilebilir.
SLM’i eğitmek için ne kadar veriye ihtiyacım var?
Gerekli örnek sayısı göreve ve mevcut modelin başarısına bağlıdır. Küçük bir pilot veri kümesiyle başlayıp eğitimden ayrı bir test kümesi hazırlayın; 200–500 örneğin her görevde yeterli olduğunu varsaymayın.




