问题分析
检索不准原因:文档分块不合理、Embedding模型不匹配、检索参数未优化、文档质量差。
分块优化
优化分块:调整chunk_size(500-1000字符)、overlap(50-100字符)。按语义分块而非固定长度。
模型优化
更换Embedding模型:中文用bge-large-zh。确保Embedding模型和文档语言匹配。
检索优化
混合检索:向量检索+关键词检索。设置top_k=5到10。添加重排序模型提升准确率。
检索不准原因:文档分块不合理、Embedding模型不匹配、检索参数未优化、文档质量差。
优化分块:调整chunk_size(500-1000字符)、overlap(50-100字符)。按语义分块而非固定长度。
更换Embedding模型:中文用bge-large-zh。确保Embedding模型和文档语言匹配。
混合检索:向量检索+关键词检索。设置top_k=5到10。添加重排序模型提升准确率。