Kosinüs benzerliği
İki vektör arasındaki açıyı ölçen benzerlik metriği — anlamsal aramanın matematiksel temeli.
Özet
Vektör açılarını karşılaştıran benzerlik ölçüsü.
Hızlı bilgiler
- Kategori
- AI ve bilgi yönetimi
- Ürün
- KobiGPT RAG
- İlgili
- Karşılaştırma ve araçlar
- Dil
- TR ve EN
Neden KobiGPT?
- Satın alma öncesi ortak dil oluşturun.
- Kavramları KobiGPT özelliklerine bağlayın.
- Hukuk ve BT ile paylaşın.
- Kullanım alanlarına geçin.
Ürün verileri
- Ücretsiz plan
- 100 doküman · 2 departman · 120 Kobi/ay(PLAN_CONFIG)
- Starter
- 1000 doküman · 5 departman · 1000 Kobi/ay(PLAN_CONFIG)
- Pro
- 12500 doküman · 25 departman · 12500 Kobi/ay(PLAN_CONFIG)
Neden açı, uzaklık değil?
Kosinüs benzerliği iki vektör arasındaki açının kosinüsünü hesaplar; sonuç -1 ile 1 arasında bir değerdir ve 1'e yaklaştıkça yön benzerliği artar. Vektörlerin uzunluğu değil, işaret ettikleri yön dikkate alınır.
Bu, metin aramasında istenen davranıştır. Uzun bir doküman parçası ile kısa bir soru farklı büyüklükte vektörler üretir; öklid uzaklığı bu farkı ceza olarak yansıtırken kosinüs benzerliği yalnızca anlam yönüne bakar ve uzunluk farkını görmezden gelir.
Skorlar nasıl yorumlanır
Kosinüs skorları mutlak bir kalite ölçüsü değildir. 0,82 skoru bir arşivde çok iyi, başka bir arşivde vasat olabilir; değer, gömme modeline ve içeriğin doğasına göre değişir. Bu yüzden sabit bir eşik belirlemek yerine göreli sıralama kullanılır.
Pratik sonuç şudur: sistem en yüksek skorlu birkaç parçayı getirir, mutlak eşiği geçenleri değil. Arşivde hiç ilgili içerik yoksa yine de bir şeyler getirilir; bu yüzden modelin "bu bağlamda yanıt yok" diyebilmesi ayrı bir davranış olarak tanımlanmalıdır.
Diğer metriklerle ilişkisi
Vektör veritabanları genellikle birkaç mesafe metriği destekler: kosinüs, iç çarpım ve öklid. Normalize edilmiş vektörlerde kosinüs ve iç çarpım aynı sıralamayı üretir; bu yüzden birçok sistem vektörleri normalize edip iç çarpım kullanır.
Seçim gömme modeliyle uyumlu olmalıdır. Model hangi metrik için eğitildiyse o kullanılır; uyumsuz metrik seçimi sessiz bir isabet kaybına yol açar ve hata vermediği için fark edilmesi zordur.
Skorlara bakarak sistem ayarlamak neden yanıltıcı
Kosinüs skorlarını izleyerek kalite ölçmeye çalışmak yaygın bir hatadır. Skor dağılımı gömme modeline, doküman uzunluğuna ve alanın diline göre değişir; bir arşivde 0,75 mükemmelken başkasında vasat olabilir. Mutlak bir eşik belirlemek, farklı içerik tiplerinde tutarsız davranış üretir.
Daha güvenilir ölçüt insan değerlendirmesidir: ekibin gerçek sorularından oluşan sabit bir set hazırlayın ve değişiklik yaptıkça bu sette isabeti ölçün. Skor rakamları hata ayıklama için yararlıdır ama kalite hedefi olarak kullanılmamalıdır.
Sabit değerlendirme seti hazırlamak ilk bakışta zahmetli görünür ama pratikte kısa sürer: ekibin gerçekten sorduğu yirmi soru ve her biri için beklenen kaynak dosya yeterlidir. Bu set bir kez hazırlandığında her değişiklikten sonra tekrar çalıştırılabilir ve iyileşme mi bozulma mı olduğunu nesnel olarak gösterir. Sette beklenen dosyanın kaynak listesinde çıkıp çıkmadığına bakmak, skor rakamlarını izlemekten hem daha basit hem daha anlamlıdır.
FAQ
Pratikte ne anlama gelir?
Vektör açılarını karşılaştıran benzerlik ölçüsü.
KobiGPT kullanıyor mu?
Uygulama için ürün sayfalarına bakın.
Daha fazla okuma?
Blog ve SSS.
Sorumluluk?
Eğitim amaçlı; uyum kararları için doğrulayın.
Skor eşiği belirleyebilir miyiz?
Sistem göreli sıralama kullanır. Mutlak eşikler gömme modeline ve içeriğe göre değiştiği için tek başına güvenilir değildir.
Yüksek skor doğru yanıt demek mi?
Hayır. Yüksek skor anlamsal yakınlığı gösterir; yanıtın doğruluğu için gösterilen kaynak parçası kontrol edilmelidir.
Karşılaştırma
| Özellik | KobiGPT | Alternatif |
|---|---|---|
| KOBİ | Evet | Yok |
| Kaynak | RAG ile | Yok |
| Sözlük | Genişliyor | Yok |
| Araçlar | İnteraktif | Yok |