本文系统拆解了 RAG 系统的核心组件,包括 Embedding 向量化、Chunking 分块策略、相似度度量、HNSW 索引以及从查询改写、元数据过滤、多路召回到精排的完整检索链路,强调检索质量是 RAG 效果的关键。
📝 详细摘要
文章从 LLM 的先天局限(知识截止日期、幻觉、无法识别私有知识)切入,解释 RAG 如何通过检索外部信息实现“开卷考试”。然后深度讲解每个技术环节:Embedding 模型通过对比学习将文本映射为稠密向量,使语义相似度转化为数学距离;Chunking 需要在颗粒度与上下文完整性间权衡,介绍了固定长度+滑动窗口、语义切块、Parent-Child 等策略及其适用场景;相似度度量以余弦相似度为主流,并对比了欧氏距离与点积;HNSW 采用分层可导航小世界图实现百万级向量的近似最近邻搜索,其“跳表×可导航图”的核心思想、建图与搜索流程、三个关键参数(M、ef_construction、ef_search)均得到清晰阐释。最后梳理了生产级检索的完整链路:Query Rewrite 处理模糊提问、元数据过滤缩小范围、多路召回(ANN+BM25)互补、RRF 排名融合解决分数不兼容问题、Rerank 精排进一步提升精度。整文逻辑严密,用大量比喻和手算示例降低理解门槛,是 RAG 入门与工程实践的优质参考。
💡 主要观点
- RAG 的效果核心取决于检索质量,而非大模型本身。 检索回来的文档不对,LLM 再强也是垃圾进垃圾出,因此系统设计应重点优化检索链路。
💬 文章金句
- RAG 好不好用,关键不在 LLM,而是在于「搜得准」。
- 这就把 LLM 从「闭卷考试」变成了「开卷考试」—— 给出题范围,照着答就行。
- Embedding 模型做的是压缩 —— 把一段文字的语义浓缩进一个向量;LLM 做的是生成 —— 根据上下文一步步吐出文字。
📊 文章信息
AI 初评:89
来源:得物技术
作者:得物技术
分类:人工智能
语言:中文
阅读时间:55 分钟
字数:13580
标签: RAG, Embedding, Chunking, HNSW, 向量搜索