LlamaIndex 系列(二):检索增强生成(RAG)
👁 3
分类:工业AI
RAG 从朴素到智能体化、图增强的完整演进路线:核心组件、五种实现方案、主流开源框架对比与企业落地场景。
一、项目背景
大语言模型训练依赖公开互联网数据,企业私有文档、内部业务资料、实时信息通常不在训练数据集中,裸 LLM 会产生幻觉、无法回答业务专属问题。检索增强生成(RAG,Retrieval-Augmented Generation)正是为解决这一问题而生:不修改模型权重,推理阶段先从外部知识库检索资料,再让模型基于真实材料生成回答。
二、技术方案
RAG 的公式表达:LLM + your data = 大模型 + 你的私有/外部数据。
一套基础 RAG 系统由三大核心组件构成:
- 知识库:数据底座。原始文档经解析、清洗、分块、向量化后存入向量数据库
- 检索器:理解用户 Query,从知识库精准召回相似度最高的文本片段
- 生成器(LLM):基于检索到的真实资料强制作答,不再依赖参数脑补
朴素 RAG 工作流共四步:索引阶段(文档切分+向量化入库)→ 查询阶段(问题向量化+召回片段)→ 组装上下文(Query+参考片段拼装提示词)→ 生成输出(LLM 基于检索资料回答)。
三、系统架构
在上下文工程三层架构中,RAG 属于中层四大系统实现之一:底层复用「上下文检索与生成」「上下文处理」「上下文管理」三大基础组件,上层支撑知识库问答、文档助手等 Agent/AI 应用。
RAG 演进五阶段:
- 2020:Meta 正式提出 RAG 范式,DPR 稠密检索发表
- 2021-2022:REALM、RETRO、WebGPT 验证大规模检索增强可行性
- 2023:ChatGPT 爆发,高级 RAG(查询改写、重排序、混合检索)普及
- 2024-2025:模块化 RAG、GraphRAG、Agentic-RAG 走向动态可编排
- 2026:进入上下文引擎时代,检索成为 Agent 可插拔组件,与超长上下文协同
四、实施过程
按上下文工程综述分类,RAG 有五大实现方案:
- 朴素 RAG:线性流水线,适合简单 FAQ 和小规模 Demo
- 高级 RAG:加查询改写、HyDE、混合检索(BM25+向量)、Rerank 重排序,适合绝大多数企业知识库
- 模块化 RAG:流水线拆成可插拔组件,支持路由、自省、迭代检索(FlashRAG、ComposeRAG)
- 智能体化 RAG:大模型自主决策要不要检索、查什么、查几轮(Self-RAG 为代表)
- 图增强 RAG:抽取实体关系构建知识图谱做多跳推理(GraphRAG、LightRAG、HippoRAG)
主流开源框架(2026 年 8 月 Star 热度):
- RAGFlow(~88k):企业复杂文档场景 RAG 引擎,深度文档理解+混合检索+答案溯源
- LlamaIndex(~46k):RAG 优先开发框架,上百种数据连接器,原生支持 GraphRAG
- LightRAG(~35k):港大开源轻量化图增强 RAG,双层检索+增量更新
- 腾讯 WeKnora(~20k):企业级 RAG+ 知识框架,多模态解析+RBAC 权限
- Haystack 2.x(~24k):企业级模块化 RAG 流水线,DAG 组件化架构
- txtai(~13k):轻量嵌入式 RAG 库,无需独立向量数据库
- 阿里 PAI-RAG(~0.5k):Agentic-RAG 企业框架,叠加 ReAct 与 MCP 工具调用
五、应用价值
- 企业内部知识库问答:对接手册、合同、制度、FAQ,员工自然语言查询
- 智能客服与售后机器人:基于真实资料回复,减少幻觉、回答可溯源
- 文档分析助手:法律合同、财报、论文的长文档问答、摘要、条款提取
- 垂直行业助手:金融研报问答、医疗规范查询、政务政策解读
- 工程实践提示:现实项目常组合多种范式,如模块化 RAG + 图检索 + Agent 自省
六、SEO关键词
RAG, 检索增强生成, 知识库问答, 向量检索, GraphRAG, Agentic RAG, RAGFlow, LlamaIndex, 混合检索, 幻觉
