Parçalama (chunking)
Dokümanı gömmeden önce parçalara ayırma — parça boyutu, arama isabetini doğrudan belirler.
Özet
Dokümanları gömmeden önce parçalara ayırma (ör. 512 token).
Hızlı bilgiler
- Kategori
- AI ve bilgi yönetimi
- Ürün
- KobiGPT RAG
- İlgili
- Karşılaştırma ve araçlar
- Dil
- TR ve EN
Neden KobiGPT?
- Satın alma öncesi ortak dil oluşturun.
- Kavramları KobiGPT özelliklerine bağlayın.
- Hukuk ve BT ile paylaşın.
- Kullanım alanlarına geçin.
Ürün verileri
- Ücretsiz plan
- 100 doküman · 2 departman · 120 Kobi/ay(PLAN_CONFIG)
- Starter
- 1000 doküman · 5 departman · 1000 Kobi/ay(PLAN_CONFIG)
- Pro
- 12500 doküman · 25 departman · 12500 Kobi/ay(PLAN_CONFIG)
Neden dokümanlar parçalanıyor?
Bir gömme vektörü sabit uzunluktadır ve ne kadar uzun metin verilirse verilsin aynı boyutta kalır. 80 sayfalık bir prosedürü tek vektöre sıkıştırmak, o dokümanın "genel havasını" temsil eder ama içindeki spesifik bir maddeyi bulmayı imkânsız kılar.
Parçalama bu problemi çözer. Doküman anlamlı birimlere bölünür, her birim ayrı vektörle temsil edilir ve sorgu geldiğinde yalnızca ilgili birim getirilir. Böylece 80 sayfalık dokümandan doğru paragraf çıkarılabilir.
Parça boyutu takası
Küçük parçalar isabeti artırır ama bağlamı kırar: bir maddenin öncesindeki koşul cümlesi başka parçaya düşerse yanıt eksik kalır. Büyük parçalar bağlamı korur ama içinde ilgisiz metin taşıdığı için vektör temsili bulanıklaşır ve arama isabeti düşer.
Pratikte tercih edilen yaklaşım, orta boy parçalar ve parçalar arası örtüşmedir. Örtüşme, sınırda kalan cümlelerin iki parçada da bulunmasını sağlar ve kırılma riskini azaltır.
Doküman yapısının etkisi
İyi yapılandırılmış dokümanlar daha iyi parçalanır. Başlıkları olan, maddeleri numaralanmış bir prosedür doğal sınırlar sunar; tek blok halinde yazılmış bir metin sunmaz. Bu, doküman kalitesinin arama kalitesine dönüştüğü somut noktalardan biridir.
Taranmış PDF'lerde ek bir katman vardır: metin katmanı yoksa parçalama öncesinde metin çıkarımı gerekir. Görsel ağırlıklı dokümanlarda ise metin tabanlı parçalama yetersiz kalabilir ve görsel içeriğin ayrıca ele alınması gerekir.
Doküman yapısı parçalama kalitesini nasıl belirler
Parçalama algoritması doküman yapısını kullanır; yapı yoksa keyfi sınırlardan böler. Başlıkları, numaralanmış maddeleri ve kısa paragrafları olan bir prosedür doğal kesme noktaları sunar ve her parça kendi içinde anlamlı kalır. Tek blok halinde yazılmış on sayfalık bir metin ise cümle ortasından bölünebilir.
Bu, doküman kalitesinin arama kalitesine dönüştüğü en somut noktadır. Asistanı iyileştirmek için yapılabilecek en ucuz iyileştirme çoğu zaman modelde değil, en sık sorgulanan beş dokümana başlık ve madde yapısı eklemektedir.
İkinci somut iyileştirme, dokümanın başına kısa bir kapsam özeti eklemektir. Parçalama sırasında her parça bağlamından kopar; hangi prosedüre ait olduğu belirsizleşebilir. Dosya adı ve başlıklar bu bağlamı kısmen taşır, ancak metin içinde geçen açık bir tanım daha güvenilirdir. Bu, uzun ve çok konulu dokümanlarda özellikle etkilidir: her ana bölümün başında konunun bir cümleyle tekrarlanması, o bölümden gelen parçaların doğru sorguda bulunmasını belirgin biçimde kolaylaştırır.
FAQ
Pratikte ne anlama gelir?
Dokümanları gömmeden önce parçalara ayırma (ör. 512 token).
KobiGPT kullanıyor mu?
Uygulama için ürün sayfalarına bakın.
Daha fazla okuma?
Blog ve SSS.
Sorumluluk?
Eğitim amaçlı; uyum kararları için doğrulayın.
Parça boyutunu biz ayarlayabilir miyiz?
Parçalama hattı sistem tarafında yönetilir. Doküman yapısını iyileştirmek — başlık ve madde kullanmak — sonucu daha çok etkiler.
Çok uzun tablolar nasıl işleniyor?
Tablolar metin olarak çıkarılır ve parçalanır. Anlık değişen tablo verileri için doküman indeksi yerine kaynak sistem tercih edilmelidir.
Karşılaştırma
| Özellik | KobiGPT | Alternatif |
|---|---|---|
| KOBİ | Evet | Yok |
| Kaynak | RAG ile | Yok |
| Sözlük | Genişliyor | Yok |
| Araçlar | İnteraktif | Yok |