दस्तावेज़ चैट
दस्तावेज़ चैट अपलोड किए दस्तावेज़ खोजकर संबंधित अंश चैट संदर्भ में देता है।
समर्थित फ़ाइलें
- पृष्ठ स्रोत सहित PDF
- सामान्य पाठ और लॉग
- अनुभाग स्रोत सहित Markdown (
.md,.markdown,.mdx) - HTML
- Word (
.docx) - स्लाइड स्रोत सहित
.pptx - शीट स्रोत सहित
.xlsxऔर CSV/TSV - TypeScript, Python, Go, Rust, SQL, YAML आदि कोड
- इमेज (
.png,.jpg,.webp,.gif) — सेटिंग → Defaults → Vision मॉडल की मॉडल पाठ पढ़ती है - ऑडियो (
.wav,.webm) — आवाज़ इनपुट वाली STT पहुँच के पीछे प्रदाता transcript करता है - अधिकतम 10 MB
Office प्रारूप सीमित repository parser से खुलते हैं; तृतीय-पक्ष दस्तावेज़ पुस्तकालय सर्वर प्रक्रिया में नहीं चलता। समान bytes समान दायरा में फिर अपलोड हों तो deduplicate होते हैं।
इमेज/ऑडियो आपके कॉन्फ़िगर किया प्रदाता को जाते हैं; स्थानीय OCR/speech engine bundled नहीं। पाठ layer रहित PDF के JPEG पृष्ठ vision मॉडल से प्रति-पृष्ठ provenance सहित पढ़ते हैं। CCITT fax/JBIG2 पाठ नहीं देते। Vision/STT न हो तो सेटिंग → दस्तावेज़ में कारण सहित विफल।
खोज मोड
| मोड | कब | विवरण |
|---|---|---|
| कीवर्ड | हमेशा | BM25; embedding मॉडल नहीं चाहिए |
| Hybrid | embedding चालू | reciprocal-rank fusion से vector + BM25 |
Embedding चालू हो तो दोनों क्रम मिलाता होते हैं; सटीक term अस्पष्ट semantic खंड को हरा सकता और लंबित embedding lexical खोज से मिलता है। विफलता/बंद पर keyword वैकल्पिक।
Lexical scoring accessible खंड पर in-प्रक्रिया है। Libre चालू-disk पूर्ण-पाठ index नहीं रखता क्योंकि एन्क्रिप्टेड खंड के पास खुला पाठ टोकन index होता। खंड में क्वेरी का कम से कम एक पूरा word चाहिए; ALPHA_BETA_GAMMA partial fragments से match नहीं करता।
आपसे साझा संग्रह दोनों क्रम में जुड़ते हैं। Access vector क्वेरी के ACL में enforced; वापस लें अगली खोज में बिना re-embedding छिपाता है।
अर्थगत खोज चालू करना
ollama pull nomic-embed-text
फिर सेटिंग में embeddings चालू करें; Ollama या प्लगइन उपयोग करें।
- मॉडल:
nomic-embed-text - खंड: 1000 characters
- Overlap: 200 characters
- समानता सीमा: 0.3
उद्धरण और पूर्ण दस्तावेज़ मोड
अंश filename, खंड index, score और supported formats में पृष्ठ/slide/sheet/Markdown section रखते हैं। Chat context location लेबल और Sources rail cited locations दिखाता है।
Sources rail से पूर्ण-दस्तावेज़ मोड पूरे extracted सामग्री को भेजता है। FULL_DOCUMENT_CONTEXT_MAX_TOKENS डिफ़ॉल्ट 32000 मॉडल window बचाता; अधिक पर retrieval वैकल्पिक और कारण।
अपलोड और खोज
- फ़ाइल अपलोड करें।
- Processing पूर्ण होने दें।
- Chat में पूछें।
- Libre relevant खंड context में जोड़ता है।
Summarize the uploaded document in five bullets.
What deadlines are mentioned in the PDF?
Find the section that talks about pricing.
Compare the uploaded policy with this proposed change.
API एंडपॉइंट
| एंडपॉइंट | उद्देश्य |
|---|---|
POST /api/documents/upload | दस्तावेज़ अपलोड |
GET /api/documents | सूची |
GET /api/documents/session/:sessionId | सत्र दस्तावेज़ |
POST /api/documents/search | खोज |
DELETE /api/documents/:documentId | हटाएँ |
GET /api/documents/embeddings/status | embedding स्थिति |
POST /api/documents/embeddings/regenerate | पुनः बनाएँ |
सर्वोत्तम अभ्यास
- वर्तमान कार्य पर केंद्रित अपलोड।
- पाठ PDF चुनें; स्कैन को पृष्ठ प्रति मॉडल call चाहिए।
- मॉडल बदलने के बाद embedding regenerate।
- उपयोगी context miss हो तो threshold घटाएँ, noise हो तो बढ़ाएँ।