HNSW indeksi
Yaklaşık en yakın komşu araması için kullanılan katmanlı graf indeksi — hız ile isabet arasında ayarlanabilir bir takas.
Özet
Qdrant’ta kullanılan yaklaşık en yakın komşu grafik indeksi.
Hızlı bilgiler
- Kategori
- AI ve bilgi yönetimi
- Ürün
- KobiGPT RAG
- İlgili
- Karşılaştırma ve araçlar
- Dil
- TR ve EN
Neden KobiGPT?
- Satın alma öncesi ortak dil oluşturun.
- Kavramları KobiGPT özelliklerine bağlayın.
- Hukuk ve BT ile paylaşın.
- Kullanım alanlarına geçin.
Ürün verileri
- Ücretsiz plan
- 100 doküman · 2 departman · 120 Kobi/ay(PLAN_CONFIG)
- Starter
- 1000 doküman · 5 departman · 1000 Kobi/ay(PLAN_CONFIG)
- Pro
- 12500 doküman · 25 departman · 12500 Kobi/ay(PLAN_CONFIG)
Tam arama neden ölçeklenmiyor?
Bir sorgu vektörüne en yakın kayıtları bulmanın kesin yolu, tüm kayıtlarla tek tek mesafe hesaplamaktır. Bin kayıtta bu sorun değildir; milyonlarca kayıtta her sorgu için milyonlarca hesap anlamına gelir ve gerçek zamanlı yanıt üretmek imkânsızlaşır.
HNSW bu problemi yaklaşık çözümle aşar. Vektörler katmanlı bir graf yapısında düzenlenir; arama üst katmanda kaba bir bölgeye iner ve alt katmanlarda incelerek ilerler. Tüm kayıtları taramadan, çok yüksek olasılıkla doğru komşuları bulur.
Yaklaşık olmanın anlamı
"Yaklaşık" burada hata anlamına gelmez; en yakın komşuyu kaçırma olasılığının küçük ama sıfır olmadığı anlamına gelir. İndeks parametreleri bu olasılığı ayarlamaya izin verir: daha yoğun graf bağlantısı isabeti artırır ama bellek ve indeksleme süresi maliyeti getirir.
Doküman aramasında bu takas genelde rahatça kabul edilir. Zaten en yakın tek parça değil, en yakın birkaç parça getirilir ve model bunlar arasından ilgili olanı kullanır; tek bir komşunun kaçması sonucu nadiren değiştirir.
Pratikte ne zaman önemli hale gelir
Küçük arşivlerde indeks tipi fark etmez; birkaç bin vektörde tam arama da yeterince hızlıdır. Fark, arşiv büyüdükçe ortaya çıkar.
KobiGPT'de Pro planı 12500 dokümana kadar çıkar ve her doküman birden çok parçaya bölündüğü için vektör sayısı doküman sayısının katlarına ulaşır. Bu ölçekte indeks yapısı, sorgu gecikmesini belirleyen ana etkendir.
İndeks parametreleri ne zaman gündeme gelir
Çoğu KOBİ kurulumunda indeks parametrelerini ayarlamak gerekmez; varsayılanlar bu ölçekte fazlasıyla yeterlidir. Parametreler ancak iki durumda gündeme gelir: sorgu gecikmesi kullanıcı deneyimini bozacak seviyeye çıktığında veya bellek tüketimi altyapı sınırını zorladığında.
Bu iki durumdan biri yaşandığında bile ilk bakılacak yer indeks değil, kapsamdır. Tek bir asistana gereğinden fazla doküman bağlanmışsa arama uzayı gereksiz büyümüştür; kapsamı daraltmak hem gecikmeyi hem isabeti aynı anda iyileştirir ve indeks ayarından daha etkili olur.
Kapsam daraltmanın ötesinde ikinci bir ayar noktası daha vardır: getirilen pasaj sayısı. Varsayılan değerin üzerine çıkmak isabeti artırıyormuş gibi görünür ama bağlamı büyütür, maliyeti yükseltir ve ilgisiz metin ekleyerek modelin doğru pasajı ağırlıklandırmasını zorlaştırır. Bu değeri artırmadan önce, isabetsizliğin gerçekten yetersiz pasajdan mı yoksa dokümanın kendisinden mi kaynaklandığını kaynak listesine bakarak ayırt etmek gerekir.
FAQ
Pratikte ne anlama gelir?
Qdrant’ta kullanılan yaklaşık en yakın komşu grafik indeksi.
KobiGPT kullanıyor mu?
Uygulama için ürün sayfalarına bakın.
Daha fazla okuma?
Blog ve SSS.
Sorumluluk?
Eğitim amaçlı; uyum kararları için doğrulayın.
İndeks parametrelerini ayarlayabilir miyiz?
İndeks yapılandırması sistem tarafında yönetilir. Self-hosted kurulumda vektör veritabanı ayarları sizin kontrolünüzdedir.
Yaklaşık arama yanlış sonuç verir mi?
En yakın komşuyu kaçırma olasılığı küçüktür ve birden çok parça getirildiği için sonucu nadiren etkiler.
Karşılaştırma
| Özellik | KobiGPT | Alternatif |
|---|---|---|
| KOBİ | Evet | Yok |
| Kaynak | RAG ile | Yok |
| Sözlük | Genişliyor | Yok |
| Araçlar | İnteraktif | Yok |