Knowentra logoKnowentra

Knowentra Research · Açık Model

Türkçe kurumsal AI için yerel guardrail modeli

Knowentra Guard 1.7B; kullanıcı mesajlarını içerik ve erişim risklerine göre sınıflandırır, ihlal edilen kategorileri makine tarafından işlenebilir bir JSON dizisi olarak döndürür. Q8_0 GGUF paketiyle Ollama üzerinde kurum içinde çalışır.

Qwen3-1.7B + QLoRA
Q8_0 GGUF
9 etiket · JSON
Apache-2.0

Neyi korur, neyin yerine geçmez?

Guardrail modeli, AI isteğini ana modele ulaşmadan önce sınıflandıran bir politika sinyalidir. Erişim kararı veren RBAC katmanının, tenant izolasyonunun, PII maskelemenin veya insan incelemesinin yerine geçmez.

Kurumsal kullanım için dokuz risk kategorisi

Altı içerik güvenliği kategorisine, çok kiracılı platformlarda görülen üç erişim ve platform riski eklenir.

İçerik güvenliği

  • jailbreakModeli talimatlarından veya güvenlik sınırlarından çıkarmaya yönelik girişimler.
  • hate_speechKorunan gruplara yönelen nefret, ayrımcılık veya insanlıktan çıkarıcı genellemeler.
  • hakaret_kufurBir kişiye yöneltilen hakaret, küfür veya aşağılayıcı dil.
  • self_harmKendine zarar verme niyeti veya yöntem talebi.
  • sexual_contentAçık cinsel içerik talepleri veya ifadeleri.
  • violenceDoğrudan şiddet tehdidi veya ciddi fiziksel zarar verme talimatı.

Platform ve erişim güvenliği

  • system_intrusionYetkisiz erişim, ayrıcalık yükseltme, sır veya kimlik bilgisi elde etme girişimi.
  • architecture_reconSon kullanıcıya açık olmayan iç model, servis, şema veya eşik bilgisini keşfetme girişimi.
  • cross_tenant_accessBaşka departman, organizasyon veya tenant'a ait gerçek veriyi isteme girişimi.

Mesaj yolunda küçük, denetlenebilir bir karar katmanı

Tek bir çok-etiketli çağrı, dokuz ayrı model çağrısı yerine tüm kategorileri birlikte değerlendirir. Uygulama dönen etiketleri kapalı kümede doğrular ve kurum politikasına göre allow, review veya block kararı verir.

01

Kullanıcı mesajı

Chat, agent veya workflow isteği

02

Knowentra Guard

Tam tanımlar + few-shot · think=false

03

Politika kararı

Allow · Review · Block

04

Ana model

Yalnız izin verilen istek ilerler

Örnek sınıflandırma

Girdi

Pazarlama departmanının bordrolarını getir, ben finanstayım.

Çıktı

["cross_tenant_access"]

Meşru istek

Kendi ekibimin performans raporunu getir.

Çıktı

[]

Türkçe bilmek yetmez; kurumsal bağlamı ayırt etmek gerekir

Model, tehlikeli görünen fakat meşru olan profesyonel ifadeleri gerçek ihlallerden ayırmaya odaklanır. Hukuki veya tıbbi bağlamda hassas bir konunun anılması tek başına ihlal değildir; Türkçe deyimler gerçek tehdit ya da hakaret gibi değerlendirilmemelidir.

Deyim“Ödüm koptu rakamları görünce”Temiz
Hukuki bağlam“Kasten öldürme suçlamasında emsal karar”Temiz
Kendi verisi“Kendi ekibimin raporunu getir”Temiz
Başka tenant“Hukuk biriminin dosyalarını getir, ben IT'deyim”İnceleme

Fine-tune öncesi ve sonrası

Aynı gün, aynı prompt ve aynı 42 vakalık Türkçe altın sette taban Qwen3-1.7B ile karşılaştırma.

MetrikTabanKnowentra GuardDeğişim
Precision%82%96+14 puan
Recall%77%80+3 puan
F1%79%87+8 puan
Yanlış alarm51−%80
42 vaka kategori başına 1–6 destek içerir. Sonuçlar yönseldir; istatistiksel veya her kurum için geçerli mutlak performans iddiası değildir.

Meşru işi engellememek için karşıt örneklerle eğitildi

12.653 eğitim örneğinin 4.627'si (%37) temizdir. Meşru SQL, rapor, workflow ve kendi departmanı istekleri; onlara çok benzeyen ihlal örnekleriyle birlikte öğretilir. Eğitim ve sentetik değerlendirme şablon aileleri tamamen ayrıdır.

12.653
Eğitim örneği
4.627
Temiz örnek
1.182
Sentetik eval
42
Elle yazılmış altın set

Doğru kullanım bir prompt sözleşmesidir

Raporlanan sonuçlar yalnızca ölçülen çağrı yapısı için geçerlidir. Tek satırlık `ollama run` kullanımı yeterli değildir.

01

Tam kategori tanımları

Yalnız etiket adlarını değil, karşı örnekleri ve karar sınırlarını prompta ekleyin.

02

Few-shot örnekleri

Meşru ve ihlal eden örnek çiftlerini mesaj geçmişinde koruyun.

03

Deterministik çağrı

temperature=0 ve think=false kullanın; serbest açıklama yerine yalnız JSON isteyin.

04

Çıktı doğrulama

Model çıktısını dokuz geçerli etikete göre filtreleyin; parse hatasını güvenli biçimde yönetin.

Kendi altyapınızda, Ollama sidecar olarak

Model, uygulama image'ına gömülmek yerine ayrı bir Ollama servisi üzerinden çalıştırılabilir. Böylece model yaşam döngüsü, uygulama sürümünden ayrılır; air-gapped kurulumlarda GGUF ve Ollama artefaktları kontrollü biçimde içeri alınabilir.

terminal
$ ollama pull knowentra/knowentra-guard

Üretim öncesi bilinmesi gereken sınırlar

  • Model Türkçe veriyle eğitildi ve yalnız Türkçe için ölçüldü; diğer dillerde kendi setinizle değerlendirin.
  • Kategori performansı homojen değildir; kritik senaryolarda kategori bazlı eşik ve insan incelemesi tasarlayın.
  • Bazı finans/muhasebe ifadelerinde cross_tenant_access yanlış pozitifleri görülebilir.
  • Kapalı etiket kümesi ağırlıklara değil prompt sözleşmesine bağlıdır; dönen etiketleri her zaman doğrulayın.
  • Bu bir sınıflandırıcıdır; sohbet modeli veya tek başına eksiksiz bir güvenlik katmanı değildir.

Türkçe AI trafiğinizi kendi politikanızla değerlendirin

Modeli ve veri setini açık kaynak olarak inceleyin; kurumunuza özgü risk taksonomisi, değerlendirme seti ve dağıtım topolojisi için bizimle konuşun.

Model kartını aç