<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Agentic RAG - tag - 沐木</title><link>https://oldletter.cn/tags/agentic-rag/</link><description>Agentic RAG - tag - 沐木</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Sat, 11 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://oldletter.cn/tags/agentic-rag/" rel="self" type="application/rss+xml"/><item><title>知识库工程（四）：今天的知识库怎么用</title><link>https://oldletter.cn/posts/rag-engineering-04-contract-sse/</link><pubDate>Sat, 11 Jul 2026 00:00:00 +0000</pubDate><author>mumu</author><guid>https://oldletter.cn/posts/rag-engineering-04-contract-sse/</guid><description><![CDATA[<blockquote>
<p>系列导航：<a href="/posts/rag-engineering-01-adapter-boundary/" rel="">1</a> | <a href="/posts/rag-engineering-02-ingestion-pipeline/" rel="">2</a> | <a href="/posts/rag-engineering-03-retrieval-quality/" rel="">3</a> | <a href="/posts/rag-engineering-04-contract-sse/" rel="">4</a></p></blockquote>
<p>当前知识库已经不止“上传文档后聊天”。文档理解、关键词与向量混合召回、重排、引用、多模态解析、知识图谱、Agent 工具和长期记忆逐步进入同一套产品。能力增加后，使用重点从“能否回答”转到“证据是否正确、版本是否有效、权限是否一致、过程能否评测”。</p>
<p>RAGFlow 和 WeKnora 展示了两种正在靠近的产品形态。RAGFlow 从文档解析与 RAG 工作流扩展到上下文层、Agent 编排和 Memory；WeKnora 把快速问答、ReAct Agent、Wiki 与知识图谱放在同一框架中。它们都说明知识库正从单次检索组件演进为 LLM 的上下文基础设施。</p>
<h2 id="一条可用的知识链路">一条可用的知识链路</h2>
<p>原始文件进入系统后，需要解析版面、表格、标题层级和图像，再形成适合检索的文本单元。切片同时写入关键词索引和向量索引，查询从两路取得候选，融合后交给重排器。选中的证据经过权限、版本、去重与 token 预算处理，再进入 LLM 或 Agent。</p>
<div class="mermaid" id="id-2" data-mermaid-definition="Zmxvd2NoYXJ0IFRECiAgICBBW&#43;aWh&#43;S7tiDnvZHpobUg6KGo5qC8IOWbvuWDj10gLS0&#43;IEJb6Kej5p6QIE9DUiDkuI7nu5PmnoTmgaLlpI1dCiAgICBCIC0tPiBDW&#43;WIh&#43;eJhyDlhYPmlbDmja7kuI7niYjmnKxdCiAgICBDIC0tPiBEW0JNMjUg5YWz6ZSu6K&#43;N57Si5byVXQogICAgQyAtLT4gRVtFbWJlZGRpbmcg5ZCR6YeP57Si5byVXQogICAgRCAtLT4gRlvono3lkIjkuI7ph43mjpJdCiAgICBFIC0tPiBGCiAgICBGIC0tPiBHW&#43;S4iuS4i&#43;aWh&#43;S4juW8leeUqF0KICAgIEcgLS0&#43;IEhbTExNIOmXruetlF0KICAgIEcgLS0&#43;IElbQWdlbnQg5qOA57Si5LiO5bel5YW3XQogICAgSCAtLT4gSlvlj43ppojkuI7or4TmtYtdCiAgICBJIC0tPiBK">flowchart TD
    A[文件 网页 表格 图像] --&gt; B[解析 OCR 与结构恢复]
    B --&gt; C[切片 元数据与版本]
    C --&gt; D[BM25 关键词索引]
    C --&gt; E[Embedding 向量索引]
    D --&gt; F[融合与重排]
    E --&gt; F
    F --&gt; G[上下文与引用]
    G --&gt; H[LLM 问答]
    G --&gt; I[Agent 检索与工具]
    H --&gt; J[反馈与评测]
    I --&gt; J</div><p>链路中的前半段决定“资料是否可找”，后半段决定“证据如何被使用”。很多效果问题来自解析：扫描 PDF 没有 OCR，表格行列被打散，标题与正文断开，页眉在每个切片中重复。直接更换 LLM 通常无法修复这些缺陷。</p>]]></description></item></channel></rss>