Haber Portalına DönTEKNOLOJİ RAPORU

LLM İçerik Moderasyonunun Üç Katmanlı Mimarisi: Regex, Sınıflandırıcılar ve RLHF

LLM tabanlı sistemlerde içerik moderasyonunun regex, sınıflandırıcılar ve RLHF ile kurulan üç katmanlı hibrit savunma mimarisini derinlemesine inceleyin.

LLM İçerik Moderasyonunun Üç Katmanlı Mimarisi: Regex, Sınıflandırıcılar ve RLHF
UK
Uzman Kod Editörlüğü
Teknik Yayın Kurulu
3 Ağustos 2026

Üretken yapay zeka uygulamaları ve büyük dil modeli (LLM) tabanlı sohbet sistemleri günümüzde yazılım dünyasının merkezinde yer alıyor. Ancak bu sistemlerin güvenli, kararlı ve kötü niyetli girdilere karşı dirençli olmasını sağlamak, tekil bir API çağrısından çok daha karmaşık bir mühendislik problemidir. Üretime alınan bir LLM ürününde "içerik moderasyonu" tek parça bir yapı değil; tamamen farklı tekniklerle inşa edilmiş, farklı maliyet ve gecikme (latency) profillerine sahip en az üç ayrı katmanın üst üste istiflendiği (stacked) hibrit bir savunma mekanizmasıdır.

Yazılım geliştiriciler sıklıkla harici bir moderasyon API'sine basit bir istek atarak güvenlik sorunlarını çözebileceklerini düşünürler. Fakat mimari açıdan değerlendirildiğinde, bu yaklaşım üç katmanlı savunma hattının yalnızca çok dar bir kesitini kapsar. "Sansürsüz model" kavramı mühendislik bağlamında incelendiğinde filtrelerin tamamen kaldırılması anlamına gelmez; bu terim teknik olarak modelin RLHF (İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme) hizalamasından yoksun bırakıldığı durumları ifade eder. Bu makalede; regex tabanlı girdi filtrelemesinden makine öğrenmesi sınıflandırıcılarına ve RLHF boru hatlarına kadar büyük dil modeli içerik moderasyonunun üç katmanını derinlemesine inceleyeceğiz.

Katman 1: Girdi Filtreleme (Regex ve Anahtar Kelime Kara Listeleri)

Katman 1, içerik moderasyon boru hattının ilk basamağını oluşturur. Tarihsel olarak en eski, mimari açıdan en ucuz ve sistem kaynaklarını en az tüketen yaklaşımdır. Düşük gecikme gereksinimleri ve sıfıra yakın maliyeti nedeniyle günümüzde hâlâ her üretim ortamında (production) aktif olarak kullanılmaktadır.

Bu katmanın temel çalışma mantığı, kullanıcı girdisini modelin bağlam penceresine (context window) girmeden hemen önce önceden tanımlanmış kurallar, düzenli ifadeler (regex) ve kelime kara listeleriyle (blocklist) eşleştirmektir. Kredi kartı numaraları, TC kimlik bilgileri, API anahtarları veya açıkça yasaklanmış hakaret kalıpları bu aşamada yakalanır.

Mimari açıdan Katman 1'in en büyük avantajı milisaniyeler mertebesinde (genellikle 1 milisaniyenin altında) çalışmasıdır. Ancak en büyük dezavantajı ise katı kural tabanlı olması nedeniyle kolayca manipüle edilebilmesidir. Kullanıcılar, regex kalıplarını atlatmak için karakter aralarına boşluklar koyabilir, Unicode benzeri karakterler kullanabilir veya dolaylı diller tercih edebilir.

Aşağıda, tipik bir Python tabanlı regex girdi filtreleme ve kara liste denetiminin temel uygulama örneği yer almaktadır:

import re
from typing import Tuple, List

class RegexContentFilter:
    def __init__(self, blocklist: List[str]):
        self.blocklist = blocklist
        # Kredi kartı ve hassas veri kalıpları için regex derleme
        self.cc_pattern = re.compile(r'\b(?:\d[ -]*?){13,16}\b')
        self.compiled_blocklist = [re.compile(rf'\b{re.escape(word)}\b', re.IGNORECASE) for word in blocklist]

    def validate_input(self, text: str) -> Tuple[bool, str]:
        # Kredi kartı sızıntı kontrolü
        if self.cc_pattern.search(text):
            return False, "Hassas finansal veri (Kredi Kartı) tespit edildi."
        
        # Kara liste kelime kontrolü
        for pattern in self.compiled_blocklist:
            if pattern.search(text):
                return False, "Yasaklanmış anahtar kelime eşleşmesi."
                
        return True, "Geçerli girdi."

# Örnek Kullanım
filter_engine = RegexContentFilter(blocklist=["yasaklikelime", "istismar"])
is_safe, message = filter_engine.validate_input("Bu metin temiz bir girdidir.")
print(f"Durum: {is_safe}, Mesaj: {message}")

Katman 2: Makine Öğrenmesi Sınıflandırıcıları ve API Tabanlı Filtreler

Regex tabanlı filtrelerin yetersiz kaldığı, bağlamın ve niyetin önem kazandığı noktada Katman 2 devreye girer. Bu katman, açık kurallar yerine etiketlenmiş örnekler üzerinden istatistiksel ilişkiler öğrenen makine öğrenmesi (ML) sınıflandırıcılarını ve özel koruma modellerini (guard models) kullanır.

Güncel mimarilerde bu katman için özel olarak ince ayar yapılmış (fine-tuned) hafif siklet sınıflandırıcılar veya Meta'nın Llama Guard serisi gibi özel güvenlik modelleri tercih edilir. Bu modeller metnin yanı sıra çok modlu (multimodal) yapılarda görselleri de analiz ederek niyet okuma, nefret söylemi, jailbreak denemeleri ve dolandırıcılık girişimlerini tespit eder.

Mimari açıdan Katman 2, Katman 1'e kıyasla daha yüksek hesaplama maliyeti ve gecikme (latency) getirir. Genellikle asenkron akışlarda (streaming) veya istek işleme boru hattının (pipeline) giriş kapısında bir API katmanı olarak konumlandırılır. Aşağıda, Azure Foundry veya benzeri bulut tabanlı moderasyon servislerinin döndürdüğü tipik bir içerik filtreleme hata (HTTP 400) JSON yükü örneği yer almaktadır:

{
    "error": {
        "message": "The response was filtered due to policy violation",
        "type": null,
        "param": "prompt",
        "code": "content_filter",
        "status": 400,
        "content_filter_results": {
            "hate": {
                "filtered": true,
                "severity": "high"
            },
            "self_harm": {
                "filtered": false,
                "severity": "safe"
            },
            "sexual": {
                "filtered": false,
                "severity": "safe"
            },
            "violence": {
                "filtered": false,
                "severity": "medium"
            }
        }
    }
}

Bu aşamada sistem, kullanıcının gönderdiği istemin (prompt) yanı sıra modelin ürettiği yanıtı da (response) denetler. Akış (streaming) sırasında herhangi bir güvenlik ihlali saptandığında `finish_reason` parametresi `content_filter` olarak güncellenir ve çıktı kesilir.

Katman 3: RLHF (İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme) ve Model Hizalama

Moderatör mimarisinin en derin ve en sofistike katmanı, modelin ağırlıklarına doğrudan entegre edilen RLHF (Reinforcement Learning from Human Feedback) aşamasıdır. Katman 1 ve Katman 2 harici birer kalkan görevi görürken, RLHF modelin kendi doğasını şekillendirir.

Teknik olarak RLHF boru hattı dört temel aşamadan oluşur: (1) Ham metin korpusu üzerinde ön eğitim (pretraining), (2) Derlenmiş örnekler üzerinde denetimli ince ayar (Supervised Fine-Tuning - SFT), (3) İnsan tercihi verilerinden bir Ödül Modeli (Reward Model - RM) eğitimi ve son olarak (4) PPO (Proximal Policy Optimization) gibi pekiştirmeli öğrenme döngüleri ile modelin optimize edilmesi.

Ödül modeli, insan yargısının bir vekili (proxy) olarak görev yapar. Model bir yanıt ürettiğinde, ödül modeli bu yanıtı puanlar ve optimizasyon döngüsü için bir ödül sinyali sağlar. Bu sayede model, zararlı istekleri kibarca reddetmeyi, tehlikeli yönlendirmelerden kaçınmayı ve talimatlara sadık kalmayı dahili olarak öğrenir.

Moderasyon Katmanı Çalışma Mekanizması Gecikme (Latency) Maliyeti Temel Zafiyet / Dezavantaj
Katman 1: Regex & Kara Liste Düzenli ifadeler ve anahtar kelime eşleştirme < 1 ms (Çok Düşük) Kolay manipüle edilir, bağlamı kaçırır.
Katman 2: ML Sınıflandırıcıları İstatistiksel sınıflandırma ve koruma modelleri (örn. Llama Guard) 10 - 50 ms (Orta) Hesaplama maliyeti yüksektir, aşırı hassas tetiklenebilir.
Katman 3: RLHF & Hizalama Ödül modeli ve PPO pekiştirmeli öğrenme döngüleri Model çıkarımına dahili (Ek Maliyet Yok) Eğitimi maliyetlidir, "Jailbreak" teknikleriyle aşılabilir.

Mimari Değerlendirme ve Üretim Ortamı Önerileri

Üretim ortamında güvenli bir LLM uygulaması geliştiren mühendisler için tek bir katmana güvenmek sistem güvenliğini tehlikeye atar. En sağlam mimari, bu üç katmanın eş zamanlı olarak çalıştığı çok katmanlı savunma (defense-in-depth) stratejisidir.

Mimari açıdan değerlendirildiğinde:

  • Hızlı Önleme: Katman 1, bariz hassas veri sızıntılarını ve ucuz maliyetli saldırıları anında elemek için en başta konumlandırılmalıdır.
  • Bağlamsal Doğrulama: Katman 2, model giriş ve çıkışlarındaki niyet analizi için asenkron veya senkron ara katman (middleware) olarak çalıştırılmalıdır.
  • Temel Hizalama: Katman 3 ise modelin temel güvenliğini garanti altına almak için uygun eğitim boru hatlarıyla desteklenmelidir.

Sonuç olarak, LLM içerik moderasyonu statik bir anahtar kelimefiltresinden ibaret değildir. Mühendislik ekiplerinin maliyet, gecikme ve güvenlik dengesini gözeterek bu üç katmanı doğru optimize etmesi, modern yapay zeka güvenliğinin temelini oluşturur.

📚 Kaynaklar ve Referanslar

ETİKETLER:#LLM#içerik moderasyonu#yapay zeka#RLHF#regex#makine öğrenmesi#yazılım mimarisi