HyDE假设文档嵌入
一句话总结
HyDE(Hypothetical Document Embeddings)先让LLM生成假设性答案文档,用该文档的embedding替代原始query进行检索,缩小query与document之间的语义鸿沟。
核心概念
传统检索中query通常很短而document较长,两者在embedding空间中的分布不同(query-document mismatch)。HyDE的流程:1)用LLM根据query生成一个假设性的答案文档;2)将假设文档而非原始query编码为向量;3)用该向量检索真实文档。假设文档不需要事实正确,只需要在语义空间上接近真实答案文档的分布。
为什么重要
短query的embedding信息量有限,检索效果受限。HyDE通过将query扩展为document形式的假设答案,有效解决了query-document语义空间不对齐的问题,在某些场景下能显著提升检索召回率。
实践要点
对事实性查询效果好,对模糊或探索性查询效果不稳定。可生成多个假设文档取平均embedding。注意额外的LLM调用带来的延迟和成本。与query改写、扩展等技术可以结合使用。评估时对比直接检索确认HyDE确实有提升。
常见误区
误以为HyDE对所有查询类型都有提升。假设文档的错误事实不影响检索但可能影响其embedding质量。忽视HyDE增加的一次LLM调用延迟。认为HyDE可以替代其他检索优化方法。