Ugrás a fő tartalomra

Dokumentumcsevegés

A Dokumentumcsevegés lehetővé teszi, hogy a Libre WebUI a feltöltött dokumentumokban keressen, és releváns részleteket adjon a csevegés környezetéhez.

Támogatott fájlok

Jelenleg a következő fájlok tölthetők fel:

  • PDF (oldalankénti eredetmegjelöléssel)
  • Egyszerű szöveg és naplók
  • Markdown (.md, .markdown, .mdx, szakaszonkénti eredetmegjelöléssel)
  • HTML
  • Word-dokumentumok (.docx)
  • Bemutatók (.pptx, diánkénti eredetmegjelöléssel)
  • Táblázatok (.xlsx, munkalaponkénti eredetmegjelöléssel) és CSV/TSV
  • Forráskód (TypeScript, Python, Go, Rust, SQL, YAML és más elterjedt nyelvek)
  • Képek (.png, .jpg, .webp, .gif) — a szöveget a beállított látásmodell olvassa (Beállítások → Alapértelmezések → Látásmodell)
  • Hang (.wav, .webm) — a beszédből szöveg szolgáltató írja át, ugyanazon STT-hozzáférési kapu mögött, mint a hangbevitel
  • Legnagyobb fájlméret: 10 MB

Az Office-formátumokat egy korlátozott, tárolón belüli elemző bontja ki — a szerverfolyamatban nem fut külső dokumentumkönyvtár. Az azonos bájtok ugyanabba a hatókörbe történő újbóli feltöltése deduplikálódik, nem kerül kétszer feldolgozásra.

A kép- és hangkinyerés a már beállított szolgáltatókhoz irányítódik — nincs mellékelt helyi OCR vagy beszédmotor, és a kiválasztott modell hívásán kívül semmi nem hagyja el a példányt. A szövegréteg nélküli PDF (szkennelt dokumentum) ugyanígy kezelődik: a beágyazott JPEG-oldalképek helyreállnak, majd a látásmodell oldalankénti eredetmegjelöléssel olvassa őket. A más képkódolásban tárolt szkennelt dokumentumok (CCITT fax, JBIG2) továbbra sem adnak szöveget. Ha nincs beállítva látásmodell vagy STT-szolgáltató, a feltöltés sikertelenként jelenik meg, az ok pedig a Beállítások → Dokumentumok alatt látható.

A fájlokat a backend dolgozza fel, és az alkalmazás többi adatával együtt tárolja.

Keresési módok

A Libre WebUI két visszakeresési módot támogat:

MódMikor használatosMegjegyzések
Kulcsszavas keresésMindig elérhetőBM25-rangsorolás; nem szükséges embeddingmodell
Hibrid keresésAz embeddingek engedélyezve vannak a BeállításokbanA vektorrangsorolást és a BM25-öt reciprok rangfúzióval egyesíti

Engedélyezett embeddingeknél minden lekérdezés mindkét rangsorolást futtatja és egyesíti: a pontos kifejezésegyezés megelőzhet egy szemantikailag hasonló, de homályosabb töredéket, az éppen generálódó embeddingű töredékek pedig lexikálisan elérhetők maradnak. Ha az embeddingek hibáznak vagy le vannak tiltva, a dokumentumkeresés tisztán kulcsszavas egyezésre áll vissza.

A lexikális pontozás a folyamaton belül, az elérhető töredékeken fut. A Libre szándékosan nem tart fenn teljes szöveges lemezindexet a dokumentumtöredékekhez, mert a töredékek szövege titkosítva tárolódik, egy tokenindex pedig egyszerű szöveget őrizne a titkosított szöveg mellett. Egy töredék csak akkor kerülhet be a lexikális rangsorba, ha a lekérdezés legalább egy szavát teljes egészében tartalmazza, így például az ALPHA_BETA_GAMMA összetett azonosító soha nem hoz felszínre olyan szöveget, amely csak az egyik részletén osztozik.

Az Önnel megosztott tudásgyűjtemények automatikusan részt vesznek mindkét rangsorolásban. A hozzáférés-vezérlés magában a vektorlekérdezésben érvényesül — a jogosultságok bekerülnek az index ACL-jébe, így a megosztás visszavonása már a következő kereséskor elrejti a dokumentumokat, új embedding létrehozása nélkül.

Szemantikus keresés engedélyezése

Telepítsen embeddingmodellt:

ollama pull nomic-embed-text

Ezután nyissa meg a Beállításokat, és engedélyezze az embeddingeket. Használhat helyi Ollama embeddingmodelleket vagy embeddingre képes szolgáltatói bővítményeket.

Alapértelmezett embeddingbeállítások:

  • Modell: nomic-embed-text
  • Töredékméret: 1000 karakter
  • Töredékátfedés: 200 karakter
  • Hasonlósági küszöb: 0.3

Hivatkozások és teljes dokumentum mód

A visszakeresett részletek eredetadatokat tartalmaznak: a forrásfájl nevét, a töredék indexét, a visszakeresési pontszámot, és — szegmenstérképpel rendelkező formátumoknál — azt az oldalt, diát, munkalapot vagy Markdown-szakaszt, ahonnan a részlet származik. A csevegés környezete minden részletet megjelöl ezzel a hellyel, a beszélgetés Források sávja pedig dokumentumonként felsorolja a hivatkozott helyeket.

Minden csevegés átválthat teljes dokumentum módra a Források sávból. A visszakeresett részletek helyett minden hatókörön belüli dokumentum teljes kinyert tartalma elküldődik az üzenettel. Egy tokenkorlát (FULL_DOCUMENT_CONTEXT_MAX_TOKENS, alapértelmezés: 32000) védi a modell kontextusablakát: ha a csatolt dokumentumok túllépik, a csevegés visszaáll a visszakeresésre, a Források sáv pedig elmagyarázza az okot.

Feltöltés és keresés

  1. Töltsön fel támogatott fájlt a dokumentumvezérlőkből.
  2. Várja meg a feldolgozás befejezését.
  3. Tegyen fel kérdést a csevegésben.
  4. A Libre WebUI releváns töredékeket keres a munkamenethez, és környezetként csatolja őket.

Példapromptok:

Summarize the uploaded document in five bullets.
What deadlines are mentioned in the PDF?
Find the section that talks about pricing.
Compare the uploaded policy with this proposed change.

API-endpointok

EndpointCél
POST /api/documents/uploadTámogatott dokumentum feltöltése
GET /api/documentsFeltöltött dokumentumok felsorolása
GET /api/documents/session/:sessionIdEgy csevegési munkamenet dokumentumainak felsorolása
POST /api/documents/searchKeresés a dokumentumokban
DELETE /api/documents/:documentIdDokumentum törlése
GET /api/documents/embeddings/statusAz embedding állapotának megtekintése
POST /api/documents/embeddings/regenerateEmbeddingek újragenerálása

Bevált módszerek

  • A feltöltések összpontosítsanak az aktuális feladatra.
  • Részesítse előnyben a szöveges PDF-eket; a szkennelt PDF-ek a látásmodellen keresztül működnek, de oldalanként egy modellhívásba kerülnek.
  • Az embeddingmodell módosítása után generálja újra az embeddingeket.
  • Csökkentse a hasonlósági küszöböt, ha a szemantikus keresés hasznos környezetet hagy ki.
  • Növelje a küszöböt, ha a találatok túl zajosak.

Kapcsolódó dokumentáció