RAG 不一定要先上向量資料庫:51 萬份文件為什麼讓 BM25 反超 Agent
向量資料庫、GraphRAG、檔案搜尋 Agent,一個比一個新。結果一篇剛上 arXiv 的論文,把 51 萬份企業文件丟進同一場測試,撐到最後的卻是 1990 年代就出現的 BM25。 看到標題先別急著把向量資料庫砍掉。 這篇論文測的是一套虛構企業語料,reader 固定,干擾文件又有大量「主題很像、事實卻錯」的內容。BM25 約在 1,000 萬 corpus tokens 附近反超檔案搜尋 Agent,到了 6.01 億 tokens 仍保持領先。這個位置是相鄰量測層之間的概略標記,沒有精確到能當部署門檻。 我帶回實務的結論是:先排好全域候選,再讓 Agent 推理。 這次至少把比較條件鎖住了多數 RAG 比較很難讀。BM25 用一套資料,GraphRAG 用另一套;reader、chunk size 和問題也不同,最後把分數排成一張表,卻說不清差距到底從哪裡來。 《BM25 Wins at Scale》做法比較乾淨。研究團隊用同一套虛構企業語料,建出 28 層互相包含的 corpus: 1,144 到 511,959 份文件 1.7M 到 600.8M corpus ...




