Co-STORM Research Report

RAG 技术调研报告

从检索基线到生产级治理:架构、Chunking、Hybrid Retrieval、Reranker、评测与安全

报告日期:2026-07-11 语言:中文 来源边界:公开论文与官方技术资料 输出:静态 HTML

能力边界:本报告来自 prompt-native Co-STORM 模拟圆桌与来源核验,不代表执行了 Stanford 官方 CoStormRunner,也不包含独立运行的专家 Agent。

01|执行摘要

RAG 不是“向量数据库加一个 LLM”,而是一套连接数据、检索、上下文组织、生成、引用、权限和评测的知识系统。原始 RAG 工作把参数化模型与可更新的非参数记忆结合起来,解决知识更新与来源追踪问题;DPR 则推动了双编码器稠密检索的发展。[1][2]

最佳起点

结构化解析 + Parent-Child Chunking + BM25/Dense 混合召回 + Reranker + 引用与拒答。

核心原则

先用真实查询集测量失败类型,再决定是否引入 GraphRAG、RAPTOR 或 Agentic RAG。

质量判断

检索命中、答案正确、证据忠实、引用可信与权限安全必须分开评测。

生产底线

ACL 越权、敏感信息泄漏和未经授权的工具调用属于硬失败,不能被平均分掩盖。

本报告的主要结论

  1. “长上下文”不能自动替代检索。模型对上下文中部信息的使用仍可能明显变差,增加文档数量也会很快出现收益饱和。[8]
  2. BM25 是不可忽略的稳健基线;稠密检索、late interaction 与 reranking 的收益和成本需要在域内评测。[3][12]
  3. Chunking 是检索系统的数据模型。若答案被错误切断,后续模型通常无法可靠恢复。
  4. 自动评测适合回归和筛查,但高风险上线仍需要人工校准、规则校验和审计轨迹。[9][10][11]

02|研究方法与边界

本轮调研使用三种模拟视角:基础事实研究、检索架构研究、生产评测与治理。每个视角先从一手论文或官方资料提取证据,再由回应角色暴露局限,最后由主持人形成工程结论。

林知源|基础事实研究员RAG 的价值不是让模型“知道更多”,而是把答案建立在可更新、可定位的外部知识上。
陈索引|检索架构研究员不同查询需要不同检索结构。精确标识符、语义改写、长文综合和全局主题不能由同一个检索器统一解决。
周衡|生产评测研究员在没有黄金查询集和失败分类之前,增加 Graph、Agent 或自反思层只会让故障更难定位。

证据边界包括公开论文、OpenReview、ACL Anthology、TREC/NIST 资源与官方技术文档。论文中的基准收益不自动等于企业语料上的普遍优势;本文把这类外推明确标记为工程建议,而非已证实事实。

03|推荐的生产级 RAG 架构

解析与版本化
混合召回
融合与精排
证据组装
生成与审计
平面主要组件必须保留的证据
离线数据面解析、去重、结构识别、Chunking、Embedding、索引版本来源 URI、页码、标题路径、版本、ACL、校验和
在线查询面身份过滤、查询理解、BM25、Dense、RRF、Reranker、Parent Expansion每阶段候选、排名、分数、过滤原因
生成面Token Budget、证据编号、受约束提示、拒答、引用最终证据集合、提示版本、模型版本、输出声明
控制面黄金集、离线评测、Shadow、Canary、监控、回滚语料快照、索引版本、配置版本、评测结果

Hybrid Search 同时执行全文与向量检索,再通过 RRF 合并不同排序列表,可以利用关键词精确匹配和语义匹配的互补性。[13]

query
  → ACL / tenant filter
  → BM25 top 30  ─┐
  → Dense top 30 ─┴→ RRF → dedupe → rerank top 6
  → parent expansion → token budget → answer / abstain + citations

04|Chunking、Hybrid Retrieval 与 Reranker

4.1 Chunking:决定知识的最小可检索单位

推荐先解析标题、段落、表格、列表、代码和页码,再按内容类型切分。官方文档处理指南同样强调依据版面与文档结构生成语义连贯的块。[14]

内容优先边界检索补充
技术文档标题路径、段落、列表把标题路径加入检索文本
法规合同条款、子条款、定义关联定义与生效版本
表格表题、表头、相关行组对子块重复必要表头
代码声明、类、函数或 AST保留文件路径与符号关系
日志事件、请求 ID、时间窗口字段过滤优先于纯语义检索

Parent-Child 模式用小块提高检索精度,再扩展父章节恢复生成上下文。Overlap 应作为实验变量;一项 2026 年研究在其特定设置中没有发现 overlap 的可测收益,但该结论不能直接推广到所有文档类型。[15]

Late Chunking 先对长文本做上下文化编码,再按块 pooling,可减少局部指代失去上下文的问题,但需要兼容的长上下文 embedding 模型。[16]

4.2 Hybrid Retrieval:扩大候选覆盖

查询形态优先能力典型例子
精确字符BM25错误码、产品编号、API 名称
语义改写Dense自然语言描述、同义问法
混合问题BM25 + Dense + RRF包含实体、限制条件和自然语言意图
多语言多语言 analyzer + embedding中文查询、英文技术文档

查询改写不能替换原始查询。错误码或罕见专有名词经 LLM 改写后可能被“语义化”掉,因此原始查询、拼写修正和扩展查询应并行召回。

4.3 Reranker:用精确计算提高 Top-k 质量

Cross-Encoder 同时读取查询和候选文档,通常比独立向量编码更精确,但不适合扫描整个语料。标准结构是先快速召回数十个候选,再精排到少量最终证据。[17]

注意:Reranker 分数通常是排序信号,不必然是校准后的“证据正确概率”。拒答阈值必须在自己的无答案样本上校准。

05|高级 RAG 的适用边界

技术主要解决的问题代价与限制
Self-RAG按需检索,并对相关性、支持度和输出质量进行反思训练与推理复杂度增加;结果依赖反思信号质量[4]
CRAG检索错误时评估、纠正或扩展信息增加额外判断和查询链路[5]
RAPTOR长文档的多层次理解与跨段综合需要递归聚类和摘要索引;摘要可能引入损失[6]
GraphRAG全局主题、关系和跨语料 sensemaking图构建与更新成本高,不应替代普通事实检索[7]
Agentic RAG多跳、查询分解、动态工具与来源选择延迟、成本、非确定性与安全面显著扩大
问题是精确事实或操作步骤
先使用 Hybrid + Reranker + Parent-Child。
只有基线稳定失败时升级
根据失败类别选择层次、图或 Agentic 结构。

06|黄金测试集与上线评测

RAG 的黄金用例不应只有“问题 + 标准答案”,而应包含原子答案要点、分级证据、禁止声明、答案可得性、用户身份、时效和预期行为。TREC RAG 也采用检索、答案要点、证据支持和生成质量相结合的分层评测。[18]

建议的测试集结构

类别建议覆盖关键失败
精确事实编号、日期、定义未召回、实体混淆
流程与多跳前置条件、步骤、跨文档关系要点缺失、顺序错误
表格数值单位、表头、行列数字拼接、单位丢失
歧义冲突多版本、多个同名实体不澄清、混合结论
无答案语料缺失、超出范围使用模型参数知识编造
安全边界ACL、注入、旧版本越权召回、泄漏、工具误用

分层指标

层级核心指标解释
检索Recall@k、MRR、nDCG、Claim Coverage正确证据是否出现、出现得多早
上下文Context Precision、重复率、新鲜度生成器看到的内容是否相关且有效
生成Completeness、Correctness、Faithfulness答案是否完整、正确且受证据支持
引用Citation Precision、Coverage、Locator Validity引用是否真的支持相邻声明
行为Answer/Abstain/Clarify/Refuse Accuracy系统是否采取正确动作
运行P95 延迟、成本、失败率、索引新鲜度系统是否满足业务 SLA

RAGAS、ARES 和 RAGChecker 分别提供自动化或细粒度评测框架;ARES 明确使用少量人工标注校准自动 judge,说明自动评测更适合作为规模化检查,而非取消人工判断。[9][10][11]

硬失败:ACL 越权、受限来源进入提示、敏感数据泄漏、未经授权工具调用、关键禁止声明和缺失审计轨迹。任何一项发生都应阻止上线。

07|安全与治理

检索内容是不可信数据。Indirect Prompt Injection 研究表明,攻击者可以把指令植入可能被系统检索的外部内容,从而操控模型或工具行为。[19]

权限前置

ACL、租户和敏感等级过滤必须在检索阶段生效,而不是生成后再隐藏。[20]

数据与指令分离

检索文本只作为证据,不得自动提升为系统指令或工具调用授权。

最小权限

工具采用 allowlist、短期凭据和独立授权,不能由文档内容解锁。

全链路审计

保存过滤、召回、重排、最终证据、模型和配置版本,但避免记录无权内容。

08|实施路线与决策建议

阶段建设内容完成证据
0|定义边界查询分类、语料边界、答案格式、风险等级明确答案、拒答和澄清条件
1|检索基线结构解析、BM25、Dense、RRF黄金查询集上的 Recall@k 与 nDCG
2|生成闭环Reranker、Parent Expansion、引用、拒答答案完整度、忠实度与引用正确性
3|生产治理ACL、版本、Trace、Shadow、Canary、回滚零硬失败,运行指标满足 SLA
4|定向升级RAPTOR、GraphRAG、Agentic 或自反思在具体失败类别上显著优于基线

建议的第一轮消融实验

  1. BM25。
  2. Dense Retrieval。
  3. BM25 + Dense + RRF。
  4. Hybrid + Cross-Encoder Reranker。
  5. Hybrid + Reranker + Parent Expansion。
  6. 在失败类别上分别测试 Query Rewrite、Late Chunking 或高级 RAG。

每次实验只改变一组变量,并冻结语料快照、测试集、模型版本、提示版本和 judge 版本。否则分数变化无法归因。

最终建议

对大多数企业知识库,优先建设可评测、可追踪、可回滚的 Hybrid RAG 基线。高级 RAG 的价值不在于架构名称,而在于它是否解决了已经被黄金测试集证实的失败模式。

09|参考资料

  1. Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.
  2. Karpukhin et al. Dense Passage Retrieval for Open-Domain Question Answering.
  3. Thakur et al. BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models.
  4. Asai et al. Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection.
  5. Yan et al. Corrective Retrieval Augmented Generation.
  6. Sarthi et al. RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval.
  7. Edge et al. From Local to Global: A Graph RAG Approach to Query-Focused Summarization.
  8. Liu et al. Lost in the Middle: How Language Models Use Long Contexts.
  9. Es et al. RAGAS: Automated Evaluation of Retrieval Augmented Generation.
  10. Saad-Falcon et al. ARES: An Automated Evaluation Framework for RAG Systems.
  11. Ru et al. RAGChecker: A Fine-grained Framework for Diagnosing RAG.
  12. Santhanam et al. ColBERTv2: Effective and Efficient Retrieval via Lightweight Late Interaction.
  13. Microsoft Learn. Hybrid Search Overview.
  14. Microsoft Learn. Chunk and Vectorize by Document Layout or Structure.
  15. Bennani and Moslonka. A Systematic Analysis of Chunking Strategies for Reliable Question Answering.
  16. Günther et al. Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models.
  17. Sentence Transformers. Retrieve & Re-Rank.
  18. TREC Retrieval-Augmented Generation Track.
  19. Greshake et al. Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection.
  20. Microsoft Learn. Document-Level Access Control.