折腾了半天检索才想明白:向量搜索不是难点,决定“搜什么”才是

最近在重做一套检索管线,一开始架构特别典型,用户问题进来,走向量搜索,取top-k,塞给模型。知识库小的时候一切都好,等文档一多,问题就来了——召回的东西一堆沾边但没用的,模型被喂了一嘴垃圾,输出自然也飘。我一开始还在死磕向量模型、调相似度阈值,后来发现根本不是那儿的事。真正难的是在检索之前,你怎么界定哪些内容值得被搜、该按什么粒度切、什么该被排除。这一步想清楚了,后面用啥向量库反而没那么要命。分享出来,别跟我一样在错的地方使劲。

决定搜什么 这一步90%的人跳过了

切分粒度是真玄学 太大太小都翻车

向量库真没那么重要 同意