Knowentra Research · Açık Model
Türkçe kurumsal AI için yerel guardrail modeli
Knowentra Guard 1.7B; kullanıcı mesajlarını içerik ve erişim risklerine göre sınıflandırır, ihlal edilen kategorileri makine tarafından işlenebilir bir JSON dizisi olarak döndürür. Q8_0 GGUF paketiyle Ollama üzerinde kurum içinde çalışır.
Neyi korur, neyin yerine geçmez?
Guardrail modeli, AI isteğini ana modele ulaşmadan önce sınıflandıran bir politika sinyalidir. Erişim kararı veren RBAC katmanının, tenant izolasyonunun, PII maskelemenin veya insan incelemesinin yerine geçmez.
Kurumsal kullanım için dokuz risk kategorisi
Altı içerik güvenliği kategorisine, çok kiracılı platformlarda görülen üç erişim ve platform riski eklenir.
İçerik güvenliği
jailbreakModeli talimatlarından veya güvenlik sınırlarından çıkarmaya yönelik girişimler.hate_speechKorunan gruplara yönelen nefret, ayrımcılık veya insanlıktan çıkarıcı genellemeler.hakaret_kufurBir kişiye yöneltilen hakaret, küfür veya aşağılayıcı dil.self_harmKendine zarar verme niyeti veya yöntem talebi.sexual_contentAçık cinsel içerik talepleri veya ifadeleri.violenceDoğrudan şiddet tehdidi veya ciddi fiziksel zarar verme talimatı.
Platform ve erişim güvenliği
system_intrusionYetkisiz erişim, ayrıcalık yükseltme, sır veya kimlik bilgisi elde etme girişimi.architecture_reconSon kullanıcıya açık olmayan iç model, servis, şema veya eşik bilgisini keşfetme girişimi.cross_tenant_accessBaşka departman, organizasyon veya tenant'a ait gerçek veriyi isteme girişimi.
Mesaj yolunda küçük, denetlenebilir bir karar katmanı
Tek bir çok-etiketli çağrı, dokuz ayrı model çağrısı yerine tüm kategorileri birlikte değerlendirir. Uygulama dönen etiketleri kapalı kümede doğrular ve kurum politikasına göre allow, review veya block kararı verir.
Kullanıcı mesajı
Chat, agent veya workflow isteği
Knowentra Guard
Tam tanımlar + few-shot · think=false
Politika kararı
Allow · Review · Block
Ana model
Yalnız izin verilen istek ilerler
Girdi
Pazarlama departmanının bordrolarını getir, ben finanstayım.
Çıktı
["cross_tenant_access"]Meşru istek
Kendi ekibimin performans raporunu getir.
Çıktı
[]Türkçe bilmek yetmez; kurumsal bağlamı ayırt etmek gerekir
Model, tehlikeli görünen fakat meşru olan profesyonel ifadeleri gerçek ihlallerden ayırmaya odaklanır. Hukuki veya tıbbi bağlamda hassas bir konunun anılması tek başına ihlal değildir; Türkçe deyimler gerçek tehdit ya da hakaret gibi değerlendirilmemelidir.
Fine-tune öncesi ve sonrası
Aynı gün, aynı prompt ve aynı 42 vakalık Türkçe altın sette taban Qwen3-1.7B ile karşılaştırma.
| Metrik | Taban | Knowentra Guard | Değişim |
|---|---|---|---|
| Precision | %82 | %96 | +14 puan |
| Recall | %77 | %80 | +3 puan |
| F1 | %79 | %87 | +8 puan |
| Yanlış alarm | 5 | 1 | −%80 |
Meşru işi engellememek için karşıt örneklerle eğitildi
12.653 eğitim örneğinin 4.627'si (%37) temizdir. Meşru SQL, rapor, workflow ve kendi departmanı istekleri; onlara çok benzeyen ihlal örnekleriyle birlikte öğretilir. Eğitim ve sentetik değerlendirme şablon aileleri tamamen ayrıdır.
Doğru kullanım bir prompt sözleşmesidir
Raporlanan sonuçlar yalnızca ölçülen çağrı yapısı için geçerlidir. Tek satırlık `ollama run` kullanımı yeterli değildir.
Tam kategori tanımları
Yalnız etiket adlarını değil, karşı örnekleri ve karar sınırlarını prompta ekleyin.
Few-shot örnekleri
Meşru ve ihlal eden örnek çiftlerini mesaj geçmişinde koruyun.
Deterministik çağrı
temperature=0 ve think=false kullanın; serbest açıklama yerine yalnız JSON isteyin.
Çıktı doğrulama
Model çıktısını dokuz geçerli etikete göre filtreleyin; parse hatasını güvenli biçimde yönetin.
Kendi altyapınızda, Ollama sidecar olarak
Model, uygulama image'ına gömülmek yerine ayrı bir Ollama servisi üzerinden çalıştırılabilir. Böylece model yaşam döngüsü, uygulama sürümünden ayrılır; air-gapped kurulumlarda GGUF ve Ollama artefaktları kontrollü biçimde içeri alınabilir.
$ ollama pull knowentra/knowentra-guardÜretim öncesi bilinmesi gereken sınırlar
- Model Türkçe veriyle eğitildi ve yalnız Türkçe için ölçüldü; diğer dillerde kendi setinizle değerlendirin.
- Kategori performansı homojen değildir; kritik senaryolarda kategori bazlı eşik ve insan incelemesi tasarlayın.
- Bazı finans/muhasebe ifadelerinde cross_tenant_access yanlış pozitifleri görülebilir.
- Kapalı etiket kümesi ağırlıklara değil prompt sözleşmesine bağlıdır; dönen etiketleri her zaman doğrulayın.
- Bu bir sınıflandırıcıdır; sohbet modeli veya tek başına eksiksiz bir güvenlik katmanı değildir.
Türkçe AI trafiğinizi kendi politikanızla değerlendirin
Modeli ve veri setini açık kaynak olarak inceleyin; kurumunuza özgü risk taksonomisi, değerlendirme seti ve dağıtım topolojisi için bizimle konuşun.
