BM25
Dokümanları terim sıklığı ve belge içindeki ayırt ediciliğine göre sıralayan klasik kelime tabanlı arama yöntemi.
Özet
Klasik kelime tabanlı sıralama; vektörle hibrit olabilir.
Hızlı bilgiler
- Kategori
- AI ve bilgi yönetimi
- Ürün
- KobiGPT RAG
- İlgili
- Karşılaştırma ve araçlar
- Dil
- TR ve EN
Neden KobiGPT?
- Satın alma öncesi ortak dil oluşturun.
- Kavramları KobiGPT özelliklerine bağlayın.
- Hukuk ve BT ile paylaşın.
- Kullanım alanlarına geçin.
Ürün verileri
- Ücretsiz plan
- 100 doküman · 2 departman · 120 Kobi/ay(PLAN_CONFIG)
- Starter
- 1000 doküman · 5 departman · 1000 Kobi/ay(PLAN_CONFIG)
- Pro
- 12500 doküman · 25 departman · 12500 Kobi/ay(PLAN_CONFIG)
- Sparse retrieval
- Qdrant hybrid collection uses a sparse lexical query alongside dense retrieval(apps/api/src/rag/qdrant.service.ts → searchHybrid)
BM25 neyi ölçer?
BM25 bir sorgudaki terimlerin dokümanlarda ne kadar sık ve ne kadar ayırt edici olduğunu hesaplar. Bir kelime belirli bir parçada sık geçiyor, fakat tüm arşivde nadirse o parçanın sıralamadaki ağırlığı artabilir.
Doküman uzunluğu da hesaba katılır. Çok uzun bir dosyada kelimenin tesadüfen geçmesi kısa ve odaklı bir parçadaki yoğun kullanım kadar değerli sayılmaz; bu, basit kelime sayımından daha dengeli bir sıralama sağlar.
Ne zaman güçlüdür?
BM25; kanun maddesi, ürün kodu, müşteri numarası, dosya adı ve teknik terim gibi tam yazımı önemli olan aramalarda etkilidir. Kullanıcı dokümandaki ifadeyi biliyorsa, kelime sinyali daha açıklayıcı olabilir.
Buna karşılık eş anlamlılar ve farklı diller BM25’nin doğal sınırıdır. İzin ile leave veya tahsilat ile collection aynı kavrama işaret etse bile ortak kelime bulunmayabilir.
Hibrit sistemde rolü
KobiGPT’nin arama katmanında seyrek kelime sinyali, yoğun gömme sinyaliyle birlikte değerlendirilebilir. Bu yaklaşım, hem özel isimleri ve kodları korur hem de farklı ifade edilmiş doğal dil sorularının kapsamasını artırır.
Hibrit sonuçta üst sıralama yine bir kanıt değildir. BM25’nin bulduğu parça doğru dosyadan olsa bile sorunun koşulunu karşılamayabilir; kaynak ve güncellik kontrolü yanıt güvenliğinin parçasıdır.
Kelime tabanlı sıralamanın hâlâ değerli olduğu yerler
BM25 eski bir yöntem olmasına rağmen belirli sorgu tiplerinde vektör aramasından üstündür. Nadir geçen bir terim, bir ürün kodu veya kanun numarası arandığında kelime tabanlı sıralama tam isabet üretirken anlamsal arama yakın ama yanlış sonuçlara kayabilir.
Bu yüzden modern kurulumlar iki yöntemi rakip değil tamamlayıcı görür. Hangi sorgu tipinin baskın olduğu içeriğe göre değişir; hukuk ve mevzuat arşivlerinde madde numarası aramaları sık olduğu için kelime tabanlı bileşenin ağırlığı genelde artar.
Üçüncü avantajı öngörülebilirliktir. Kelime tabanlı sıralamanın neden bir sonucu döndürdüğü açıklanabilir: aranan terim o belgede geçiyordur. Vektör aramasında aynı soruya verilecek yanıt "vektör uzayında yakındı" olur ve bu, kullanıcıya açıklanması güç bir gerekçedir. Denetim gerektiren ortamlarda bu şeffaflık farkı, isabet oranından bağımsız bir değer taşır ve yöntem seçiminde ayrı bir ölçüt olarak değerlendirilmelidir.
FAQ
Pratikte ne anlama gelir?
Klasik kelime tabanlı sıralama; vektörle hibrit olabilir.
KobiGPT kullanıyor mu?
Uygulama için ürün sayfalarına bakın.
Daha fazla okuma?
Blog ve SSS.
Sorumluluk?
Eğitim amaçlı; uyum kararları için doğrulayın.
BM25 bir yapay zeka modeli midir?
Hayır. Kelime tabanlı bir sıralama yöntemidir; gömme modelinden farklı olarak metin üretmez.
BM25 özel isim aramalarında neden yararlıdır?
Tam terim eşleşmesi ve ayırt edici kelime ağırlığı, kod ve isim gibi sinyalleri doğrudan öne çıkarır.
Karşılaştırma
| Özellik | KobiGPT | Alternatif |
|---|---|---|
| KOBİ | Evet | Yok |
| Kaynak | RAG ile | Yok |
| Sözlük | Genişliyor | Yok |
| Araçlar | İnteraktif | Yok |