Interview: 低延迟高吞吐向量检索系统设计与索引选型
题目解析
向量检索是RAG系统的核心组件,直接影响检索质量和系统性能。本题考察候选人对主流近似最近邻(ANN)算法的理解以及在不同场景下的工程选型能力。需要在召回率、延迟和内存占用之间做出权衡,同时考虑数据规模和更新频率等约束条件。
解答思路
系统架构分为写入链路和查询链路。写入链路:文档分块、Embedding生成、索引构建、持久化存储。查询链路:Query Embedding、ANN检索、重排序、返回结果。HNSW适合数据量中等(百万级)且对延迟要求极高的场景,它构建多层导航图,查询时间复杂度O(log N),但内存占用大。IVF适合超大规模(亿级)数据,通过聚类将向量分区,配合PQ量化可大幅降低内存,适合成本敏感场景。
关键要点
HNSW优势在于查询速度快且召回率高,但索引构建慢、内存占用约为原始向量的1.5倍。IVF-PQ内存效率高,适合大数据量,但需要调优nprobe参数平衡召回率和延迟。实际工程中常用HNSW+PQ的混合方案或分层索引策略。还需考虑增量索引更新和索引一致性的问题。
加分回答
讨论GPU加速检索(如FAISS GPU版本)的适用场景、基于磁盘的索引(DiskANN)在超大规模场景的应用,以及向量数据库的分布式架构设计,包括数据分片策略、跨分片查询合并和故障恢复机制。
常见踩坑
忽略了索引构建时间和增量更新的需求导致系统无法实时更新;在小数据量上过度优化索引结构反而引入不必要的复杂度;未考虑向量维度和数据分布对索引性能的影响。