AI Moderation Sistemi Nasıl Kurulur?

AI moderation, kullanıcıların gönderdiği metin veya görselleri belirli risk kategorileri için otomatik olarak sınıflandıran bir sistemdir. Yorum alanı, forum, sohbet botu, ilan sitesi veya kullanıcıların içerik yükleyebildiği her platform bir noktada spam, taciz, nefret söylemi veya yasa dışı içerikle karşılaşır. Tek bir moderasyon skoru tüm güvenlik kararlarının yerini tutmaz; yanlış pozitifler ve gözden kaçan ihlaller için insan incelemesi ve itiraz yolu tasarlanmalıdır. Bu rehberde bir moderasyon hattının nasıl kurulacağını, eşiklerin nasıl belirleneceğini, insan incelemesinin nereye konacağını ve sistemin canlıda nasıl ölçüleceğini adım adım anlatıyoruz.
AI moderation neyi çözer, neyi çözmez?
Otomatik moderasyonun en büyük katkısı ölçektir. Günde birkaç yorum alan bir blogda her yorumu elle onaylamak mümkündür; ancak dakikada yüzlerce mesaj alan bir sohbet uygulamasında veya binlerce ilan yayımlanan bir pazar yerinde insan ekibi tek başına yetişemez. Moderasyon modeli, içerikleri saniyeler içinde risk kategorilerine ayırarak ekibin yalnızca belirsiz vakalara odaklanmasını sağlar.
Ancak otomatik sistemlerin sınırlarını baştan kabul etmek gerekir:
- Bağlam eksikliği: İroni, alıntı, haber metni veya bir kullanıcının kendisine yöneltilen hakareti şikâyet etmesi, sınıflandırıcı tarafından ihlal olarak işaretlenebilir.
- Dil ve kültür farkları: Modellerin başarısı diller arasında değişebilir. Türkçe argo, kısaltmalar ve yerel ifadeler İngilizceye göre daha fazla hata üretebilir.
- Politika farkları: Hangi içeriğin “kabul edilemez” olduğu platformdan platforma değişir. Bir çocuk eğitim platformu ile yetişkinlere yönelik bir tartışma forumunun eşikleri aynı olamaz.
- Kötü niyetli uyum: Filtreyi aşmak isteyen kullanıcılar karakter değiştirme, boşluk ekleme veya görsel içine metin yazma gibi yöntemler dener.
Bu nedenle moderasyon modelini “karar veren” değil, “karar destekleyen” bir bileşen olarak konumlandırmak en sağlıklı yaklaşımdır.
Önce politikanızı yazın
Teknik kurulumdan önce yazılı bir içerik politikasına ihtiyacınız var. Model size kategori ve olasılık skorları verir; bu skorların sizin platformunuzda ne anlama geldiğine siz karar verirsiniz. İyi bir politika belgesi şu soruları cevaplar:
- Hangi içerik türleri kesinlikle yasak, hangileri bağlama göre değerlendirilir?
- Her kategori için varsayılan aksiyon nedir: yayınla, incelemeye al, gizle, engelle?
- Kullanıcıya ne söylenecek? İçeriğin neden reddedildiği açıklanacak mı?
- Tekrarlayan ihlallerde hesap düzeyinde hangi önlemler alınacak?
- Kullanıcı karara nasıl itiraz edecek ve itirazı kim, ne kadar sürede inceleyecek?
- Yasal bildirim yükümlülüğü doğuran içeriklerde (ör. çocuk istismarı materyali) hangi süreç işletilecek?
Politikayı yazdıktan sonra her kategori için birkaç gerçekçi örnek hazırlayın. Bu örnekler hem ekibinizin aynı dili konuşmasını sağlar hem de ileride modeli test etmek için kullanacağınız değerlendirme kümesinin çekirdeğini oluşturur.
Moderasyon hattının mimarisi
Tipik bir moderasyon hattı, içeriğin gönderildiği an ile yayımlandığı an arasına yerleştirilir. İçerik önce hızlı ve ucuz kontrollerden geçer, ardından moderasyon modeline gönderilir, sonuç politika kurallarına göre bir karara dönüşür ve belirsiz vakalar insan inceleme kuyruğuna düşer.

1. Ön filtreler
Her içeriği doğrudan modele göndermek gereksiz maliyet ve gecikme yaratır. Oran sınırı, bilinen spam bağlantıları, yasaklı alan adları, aşırı uzun mesajlar ve tekrarlanan aynı içerik gibi kurallar basit kontrollerle yakalanabilir. Bu katman aynı zamanda kötü niyetli kullanıcıların moderasyon API’sini yorarak maliyet yaratmasını da engeller.
2. Moderasyon modeli
İçeriği yayımlamadan veya başka bir yapay zekâ işlemine sokmadan önce ilgili moderasyon modeline gönderin. Örneğin OpenAI Moderations API, metin ve görsel girdiler için flagged alanı ile birlikte taciz, nefret söylemi, şiddet, cinsel içerik, kendine zarar verme ve yasa dışı faaliyet gibi kategorilerde işaret ve skor döndürür. Farklı sağlayıcıların kategori adları ve skor ölçekleri farklı olduğu için sonucu kendi kategori sisteminize çeviren küçük bir eşleme katmanı yazmanız önerilir.
// Basitleştirilmiş karar mantığı (PHP)
$sonuc = $moderasyon->analizEt($metin); // sağlayıcı yanıtını kendi formatınıza çevirir
$karar = 'yayinla';
foreach ($politika as $kategori => $esik) {
$skor = $sonuc['skorlar'][$kategori] ?? 0;
if ($skor >= $esik['engelle']) { $karar = 'engelle'; break; }
if ($skor >= $esik['incele']) { $karar = 'incele'; }
}
kaydet($icerikId, $karar, $sonuc['skorlar'], $modelSurumu); Bu yapıda her kategori için iki eşik vardır: üst eşiği geçen içerik doğrudan engellenir, alt ve üst eşik arasındaki içerik insan incelemesine gider. Eşikleri koddan değil, yapılandırma dosyasından veya yönetici panelinden yönetmek, ileride ayar yapmayı kolaylaştırır.
3. Kendi politikanıza özel sınıflandırma
Hazır moderasyon kategorileri sizin platformunuzun tüm kurallarını kapsamayabilir. Örneğin bir ilan sitesinde “telefon numarasını açıklama alanına yazmak” veya bir eğitim platformunda “sınav cevaplarını paylaşmak” yasaktır; bunlar genel moderasyon kategorilerinde yer almaz. Bu tür kurallar için ya basit desen eşleştirme kuralları ya da genel amaçlı bir dil modeline politikanızı açıkça veren ayrı bir sınıflandırma adımı kullanabilirsiniz. Dil modeli ile sınıflandırma yaparken çıktıyı serbest metin yerine sabit bir JSON şemasıyla almak ve kullanıcının içeriğini talimat olarak değil veri olarak işaretlemek, prompt injection riskini azaltır.
4. Karar ve aksiyon
Sonuçtaki kategori ve skorları ürün politikanızla eşleştirin. Her kategori için izin ver, incelemeye al ve engelle gibi kararları açıkça tanımlayın. Kullanıcıya gösterilecek mesajı da karara bağlayın: “İçeriğiniz incelemeye alındı” mesajı, sessizce kaybolan bir yorumdan çok daha iyi bir deneyimdir.
İnsan incelemesi ve itiraz süreci
İnsan inceleme kuyruğu, moderasyon sisteminin kalbidir. Otomatik sistemin emin olamadığı içerikler burada değerlendirilir ve bu değerlendirmeler zamanla eşiklerin iyileştirilmesi için en değerli veriyi üretir.
- Önceliklendirme: Kuyruğu yalnızca geliş sırasına göre değil, risk skoruna ve içeriğin görünürlüğüne göre sıralayın. Binlerce kişiye ulaşacak bir gönderi, tek kişilik bir mesajdan önce incelenmelidir.
- Bağlam gösterimi: İnceleyiciye içeriğin yanında yanıt verdiği mesajı, kullanıcının geçmiş ihlal sayısını ve modelin işaretlediği kategorileri gösterin.
- İnceleyici sağlığı: Rahatsız edici içeriklere sürekli maruz kalmak inceleyiciler için ciddi bir yüktür. Görselleri bulanık göstermek, vardiya ve rotasyon planlamak gibi önlemler alın.
- İtiraz yolu: Kullanıcının kararı tek tıkla itiraz edebileceği bir yol sunun. İtirazı, ilk kararı veren kişiden farklı bir inceleyicinin değerlendirmesi tarafsızlığı artırır.
Tekrarlanan ihlaller için hesap düzeyinde önlem düşünün; ancak sınıflandırıcı hatasını otomatik kalıcı ceza haline getirmeyin. Kalıcı hesap kapatma gibi ağır yaptırımlar mutlaka insan onayından geçmelidir.
Görsel ve dosya moderasyonu
Metin moderasyonu kurulduktan sonra çoğu platformun ikinci ihtiyacı görsellerdir. Profil fotoğrafları, ilan görselleri ve sohbet içinde paylaşılan resimler, metin filtresinin göremediği bir risk alanı oluşturur. Görsel moderasyonu kurarken dikkat edilmesi gereken noktalar şunlardır:
- Yüklemeyi yayından ayırın: Görseli önce özel bir depolama alanına alın, moderasyon tamamlanmadan herkese açık adrese taşımayın. Böylece incelenmemiş bir görsel bir saniyeliğine bile yayına girmez.
- Görsel içindeki metni unutmayın: Kullanıcılar metin filtresini aşmak için yasaklı ifadeleri görselin içine yazabilir. Çok modlu (multimodal) moderasyon modelleri bu riski azaltır; ancak düşük çözünürlüklü veya bilinçli olarak bozulmuş metinler yine de kaçabilir.
- Tekrarlanan içerik: Daha önce engellenmiş bir görselin tekrar yüklenmesini, görselin parmak izini (hash) saklayarak hızlıca yakalayabilirsiniz. Algısal hash yöntemleri küçük kırpma ve renk değişikliklerine karşı daha dayanıklıdır.
- Yasal yükümlülükler: Çocuk istismarı materyali gibi içerikler için birçok ülkede özel bildirim yükümlülükleri vardır. Bu tür içeriklerde yalnızca engellemek yeterli değildir; hukuk danışmanınızla birlikte bir süreç tanımlayın.
Video ve ses içeriklerinde maliyet ve süre hızla artar. Videodan belirli aralıklarla kare örneklemek ve sesi metne çevirip metin moderasyonuna göndermek, tüm içeriği tek tek incelemekten çok daha ekonomik bir başlangıç yöntemidir.
Kullanıcı güveni ve itibar sinyalleri
Her içeriği aynı şüpheyle değerlendirmek hem maliyetli hem de kullanıcı deneyimi açısından zayıf bir yaklaşımdır. Moderasyon kararına içeriğin kendisi dışında kullanıcıya ait sinyalleri de eklemek, sistemin isabetini artırır:
- Hesabın yaşı ve doğrulanmış e-posta veya telefon bilgisi
- Önceki gönderilerin onay oranı ve geçmiş ihlal sayısı
- Kısa sürede çok sayıda gönderi yapılması gibi davranışsal işaretler
- Aynı IP veya cihazdan açılmış çok sayıda hesap
Yeni ve doğrulanmamış hesapların ilk gönderilerini daha düşük eşikle incelemeye almak, uzun süredir sorunsuz katkı yapan kullanıcıların içeriğini ise daha yüksek eşikle değerlendirmek dengeli bir yaklaşımdır. Bu sinyalleri kullanırken ayrımcı sonuçlar doğurabilecek kişisel özelliklere dayanmamaya dikkat edin.
Küçük siteler için minimum kurulum
Her proje kapsamlı bir moderasyon ekibine ihtiyaç duymaz. Örneğin yorumlara açık bir WordPress blogunda şu basit düzen çoğu ihtiyacı karşılar: yorumlar önce spam koruma eklentisinden geçer, ardından kısa bir eklenti veya küçük bir kod parçası yorum metnini moderasyon API’sine gönderir. İşaretlenen yorumlar “onay bekliyor” durumuna alınır, işaretlenmeyen yorumlar ise sitenin mevcut onay kurallarına göre yayımlanır. Site sahibi haftada bir bekleyen yorumları gözden geçirerek hem yanlış işaretlemeleri düzeltir hem de hangi tür içeriklerin sorun çıkardığını görür. Bu küçük düzen bile kötü niyetli yorumların yayına girmesini büyük ölçüde engeller ve ileride trafik arttığında daha kapsamlı bir hatta geçiş için sağlam bir temel oluşturur.
Veri saklama ve gizlilik
Moderasyon kayıtları, kullanıcı içeriğini ve bazen hassas kişisel verileri barındırır. İçerik ve karar kaydında gereksiz kişisel veriyi tutmayın. Kayıtlarda içeriğin kendisi yerine kimliğini ve özetini saklamak, belirli bir süre sonra ham içeriği silmek ve erişimi yalnızca yetkili ekip üyeleriyle sınırlamak iyi uygulamalardır. Moderasyon için üçüncü taraf bir API kullanıyorsanız sağlayıcının veri saklama ve eğitim politikalarını inceleyin ve kullanıcılarınızı gizlilik politikanızda bilgilendirin.
Ölçme ve geri bildirim döngüsü
Gerçek örneklerden, kullanıcı gizliliğine uygun biçimde hazırlanmış bir değerlendirme kümesi oluşturun. Bu küme hem açık ihlalleri hem de sınırda kalan, bağlama bağlı örnekleri içermelidir. Ardından şu metrikleri ayrı ayrı izleyin:
- Kaçan zararlı içerik oranı: Yayımlandıktan sonra kullanıcı şikâyetiyle veya sonradan yapılan incelemeyle tespit edilen ihlaller.
- Yanlış engel oranı: İtiraz sonrası geri alınan kararlar. Bu oran yüksekse kullanıcılar platformu adaletsiz bulmaya başlar.
- İnsan inceleme yükü: Kuyruğa düşen içerik sayısı ve ortalama inceleme süresi. Eşikler çok düşükse ekip boğulur.
- Gecikme: İçeriğin gönderilmesinden yayımlanmasına kadar geçen süre. Sohbet gibi gerçek zamanlı ürünlerde bu süre kullanıcı deneyimini doğrudan etkiler.

Model veya eşik değiştiğinde değerlendirme kümesiyle yeniden test edin ve sonuçları önceki sürümle karşılaştırın. Sağlayıcılar moderasyon modellerini zaman zaman günceller; kayıtlarınızda hangi model sürümünün kullanıldığını tutmak, ani değişimleri açıklamanıza yardımcı olur.
Hata durumları: moderasyon servisi yanıt vermezse?
Moderasyon isteği zaman aşımına uğrarsa veya sağlayıcı hata döndürürse hangi içeriğin bekleyeceğini ürün riskine göre önceden belirleyin. İki temel strateji vardır:
- Kapalı başarısızlık (fail closed): Moderasyon yapılamazsa içerik yayımlanmaz, kuyruğa alınır. Çocuklara yönelik platformlar veya yüksek riskli içerik türleri için uygundur.
- Açık başarısızlık (fail open): İçerik yayımlanır, moderasyon servis düzeldiğinde geriye dönük yapılır. Düşük riskli, hızın önemli olduğu ürünlerde tercih edilebilir.
Hangi stratejiyi seçerseniz seçin, bekleyen içerikleri servis düzeldiğinde otomatik olarak yeniden işleyen bir mekanizma kurun ve bu durumları ayrı bir metrik olarak izleyin. Zaman aşımı ve tekrar denemeleri için oran sınırı rehberimizdeki geri çekilme yöntemlerinden yararlanabilirsiniz.
Yapay zekâ çıktılarını da denetleyin
Platformunuzda kullanıcıya yanıt üreten bir sohbet botu veya içerik üretim aracı varsa, moderasyonu yalnızca kullanıcı girdisine değil, modelin ürettiği çıktıya da uygulayın. Kötü niyetli bir kullanıcı modeli istenmeyen içerik üretmeye yönlendirmeye çalışabilir. Girdi ve çıktı moderasyonunu birlikte kullanmak, AI guardrails yaklaşımının temel parçasıdır.
Sıkça Sorulan Sorular
AI moderation insan moderatörlerin yerini alır mı?
Hayır. Otomatik sistemler açık vakaları hızla ayıklayarak insan ekibinin yükünü azaltır; ancak bağlam gerektiren kararlar, itirazlar ve politika güncellemeleri için insan değerlendirmesi gerekir.
Türkçe içerikte moderasyon modelleri ne kadar başarılı?
Başarı modelden modele ve kategoriden kategoriye değişir. Kendi platformunuzdan toplanmış Türkçe örneklerle bir değerlendirme kümesi hazırlayıp yanlış pozitif ve kaçan ihlal oranlarını ölçmeden eşik belirlememek gerekir.
Eşikleri nasıl belirlemeliyim?
Başlangıçta temkinli eşiklerle daha fazla içeriği insan incelemesine gönderin. İnceleme kararlarını toplayarak hangi skor aralığında modelin güvenilir olduğunu görün ve eşikleri bu veriye göre kademeli olarak ayarlayın.
Kullanıcıya içeriğin neden reddedildiğini söylemeli miyim?
Genel kategori bilgisini paylaşmak kullanıcıların kuralları anlamasına yardımcı olur ve itiraz sayısını azaltır. Ancak filtreyi aşmak isteyenlere yol göstermemek için ayrıntılı skorları paylaşmayın.
Moderasyon API’si kullanmanın maliyeti ne kadar?
Fiyatlandırma sağlayıcıya göre değişir ve zaman içinde güncellenir; bazı sağlayıcılar moderasyon uç noktalarını ücretsiz sunarken genel amaçlı dil modelleriyle yapılan sınıflandırma token başına ücretlendirilir. Maliyeti kontrol altında tutmanın en etkili yolu, ön filtrelerle gereksiz istekleri azaltmak ve yalnızca gerçekten yayımlanacak içerikleri modele göndermektir.
Moderasyon kararlarını ne kadar süre saklamalıyım?
İtiraz süresi, yasal yükümlülükler ve kişisel verilerin korunması mevzuatı birlikte değerlendirilmelidir. Kararın kendisini, kategorisini ve tarihini daha uzun süre, ham içeriği ise yalnızca gerekli olduğu süre boyunca saklamak dengeli bir yaklaşımdır.
Kendi moderasyon modelimi eğitmeli miyim?
Çoğu proje için hazır moderasyon modelleri ile basit kural katmanlarının birleşimi yeterlidir. Kendi modelinizi eğitmek; büyük miktarda etiketlenmiş veri, sürekli güncelleme ve değerlendirme altyapısı gerektirir. Platformunuza özgü kurallar hazır kategorilerle karşılanamıyorsa önce genel amaçlı bir dil modeline politikanızı açıkça veren bir sınıflandırma adımı deneyin.
İlgili Rehberler
- AI Guardrails Nedir? Yapay Zeka Güvenlik Sınırları
- Prompt Injection Nedir? Yapay Zeka Nasıl Kandırılıyor?
- Function Calling ile AI Asistan Nasıl Geliştirilir?




