← 回總覽

RAG 核心概念与原理:Chunking、Embedding、相似度、HNSW 与多路召回|得物技术

📅 2026-07-22 18:30 得物技术 人工智能 2 分鐘 1695 字 評分: 89
RAG Embedding Chunking HNSW 向量搜索
📌 一句话摘要 本文系统拆解了 RAG 系统的核心组件,包括 Embedding 向量化、Chunking 分块策略、相似度度量、HNSW 索引以及从查询改写、元数据过滤、多路召回到精排的完整检索链路,强调检索质量是 RAG 效果的关键。 📝 详细摘要 文章从 LLM 的先天局限(知识截止日期、幻觉、无法识别私有知识)切入,解释 RAG 如何通过检索外部信息实现“开卷考试”。然后深度讲解每个技术环节:Embedding 模型通过对比学习将文本映射为稠密向量,使语义相似度转化为数学距离;Chunking 需要在颗粒度与上下文完整性间权衡,介绍了固定长度+滑动窗口、语义切块、Parent-Ch

📌 一句话摘要

本文系统拆解了 RAG 系统的核心组件,包括 Embedding 向量化、Chunking 分块策略、相似度度量、HNSW 索引以及从查询改写、元数据过滤、多路召回到精排的完整检索链路,强调检索质量是 RAG 效果的关键。

📝 详细摘要

文章从 LLM 的先天局限(知识截止日期、幻觉、无法识别私有知识)切入,解释 RAG 如何通过检索外部信息实现“开卷考试”。然后深度讲解每个技术环节:Embedding 模型通过对比学习将文本映射为稠密向量,使语义相似度转化为数学距离;Chunking 需要在颗粒度与上下文完整性间权衡,介绍了固定长度+滑动窗口、语义切块、Parent-Child 等策略及其适用场景;相似度度量以余弦相似度为主流,并对比了欧氏距离与点积;HNSW 采用分层可导航小世界图实现百万级向量的近似最近邻搜索,其“跳表×可导航图”的核心思想、建图与搜索流程、三个关键参数(M、ef_construction、ef_search)均得到清晰阐释。最后梳理了生产级检索的完整链路:Query Rewrite 处理模糊提问、元数据过滤缩小范围、多路召回(ANN+BM25)互补、RRF 排名融合解决分数不兼容问题、Rerank 精排进一步提升精度。整文逻辑严密,用大量比喻和手算示例降低理解门槛,是 RAG 入门与工程实践的优质参考。

💡 主要观点

- RAG 的效果核心取决于检索质量,而非大模型本身。 检索回来的文档不对,LLM 再强也是垃圾进垃圾出,因此系统设计应重点优化检索链路。

Embedding 通过对比学习让语义相似度转化为向量空间的数学距离,但它对专有名词和精确匹配无效。 Dense 向量擅长语义泛化,但对编码、ID 等精确匹配无能为力,需要 BM25 等关键词搜索互补。
Chunking 需在颗粒度与上下文完整性之间权衡,没有银弹方案。 切太小导致上下文断裂,切太大造成语义稀释;固定长度+滑动窗口是性价比最高的起点,Parent-Child 策略兼顾召回率与上下文完整性。
HNSW 通过多层图结构实现近似最近邻搜索,在速度和精度间取得了最佳平衡。 上层节点稀疏提供快速通道,底层节点密集进行精搜;关键参数 M、ef_construction、ef_search 分别控制建图时的邻居数、搜索时的候选池大小,ef_search 可在运行时动态调整。
生产级 RAG 检索链路不仅是向量搜索,还需涵盖查询改写、元数据过滤、多路召回、分数融合与精排。 用户提问模糊时先改写;多租户场景先用元数据过滤子集;语义与关键词互补召回后,用 RRF 融合排名而非直接相加,最后用 Rerank 模型精细筛选。

💬 文章金句

- RAG 好不好用,关键不在 LLM,而是在于「搜得准」。

  • 这就把 LLM 从「闭卷考试」变成了「开卷考试」—— 给出题范围,照着答就行。
  • Embedding 模型做的是压缩 —— 把一段文字的语义浓缩进一个向量;LLM 做的是生成 —— 根据上下文一步步吐出文字。

📊 文章信息

AI 初评:89

来源:得物技术

作者:得物技术

分类:人工智能

语言:中文

阅读时间:55 分钟

字数:13580

标签: RAG, Embedding, Chunking, HNSW, 向量搜索

阅读完整文章

查看原文 → 發佈: 2026-07-22 18:30:00 收錄: 2026-07-22 22:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。