rag-pipelinechunkingretrieval-qualitydata-pipelineenterprise-ai
RAG 分塊策略:分塊大小、重疊和邊界偵測如何影響檢索品質
分塊是 RAG 管線中最被低估的步驟。太大會浪費上下文視窗,太小會失去語義,邊界錯誤會在思路中間切斷句子。以下是正確的做法。
Edward Xi Yang
大多數建構 RAG 管線的團隊將時間花在最佳化嵌入模型、向量資料庫和提示範本上。他們將分塊視為一個細節——將文件分成片段、產生嵌入、繼續前進。這是一個錯誤。分塊是影響檢索品質最大的單一變數, 做錯了會串聯影響每一個下游步驟。
糟糕的 RAG 分塊策略會產生過於通用而無法匹配特定查詢的嵌入,或者過於碎片化而無法攜帶有用上下文的嵌入。檢索器回傳不相關的段落。生成器產生幻覺或模稜兩可。使用者失去信任。修復方案很少是更好的模型——而是更好的分塊。
為什麼分塊比你想像的更重要
當使用者查詢 RAG 系統時,檢索器搜尋與查詢語義最相似的分塊。如果你的分塊每個有 4,000 個 token,嵌入代表的是該區塊中所有內容的平均值。具體細節被稀釋了。關於特定合規條款的問題回傳一個包含三頁不相關政策語言的分塊,模型不得不在其中尋找被埋藏的相關句子。
如果你的分塊每個有 50 個 token,你會得到相反的問題。嵌入擷取的是沒有周圍上下文的句子片段。檢索器可能找到正確的片段,但生成器無法從一個被切成兩半的句子中產生連貫的答案。
最好的企業文件 RAG 分塊工具讓你可以控制三個變數:分塊大小、重疊百分比和邊界偵測方法。這三個設定相互影響,正確的組合取決於你的文件類型。