大模型微调,指的是在已有的大规模预训练模型基础上,通过对标注数据进行训练,进一步优化模型的表现,以适应特定任务或场景的需求。

RAG/Agent技术:通过搭建工作流来优化模型表现
微调:通过修改模型参数来优化模型表现

RAG Retrieval-Augmented Generation 检索-增强-生成

分片:将文档切片成多个片段

索引:通过Embedding将片段文本转换为向量,然后将片段文本和片段向量存入向量数据库

Embedding模型排行榜:mteb,目前top5(截至7.28):
gemini-embedding-001
Qwen3-Embedding-8B
Qwen3-Embedding-4B
Qwen3-Embedding-0.6B
Linq-Embed-Mistral

召回(初步筛选):从片段里面挑出与用户输入最相似的n个部分。计算向量相似度,常用计算方法:余弦相似度、欧氏距离、点积

重排(精挑细选):从召回的n个部分,再挑出k个最相似的。计算方法 cross-encoder

生成答案

使用Python构建RAG系统

环境依赖及对应的作用
sentence_transformer:加载embedding和cross-encoder模型
chromadb:向量数据库
google-genai:google的AI SDK,调用gemini-2.5-flash
python-dotenv:将gemini API Key映射到环境变量中