RAG 向量搜尋為什麼比關鍵字準?從一個請假的例子說起

文件流入一顆線條構成的大腦圖示,旁邊有相似度刻度

員工問「我可以請幾天?」,關鍵字搜尋找不到寫著「特別休假日數」的那一頁。語意檢索處理的正是這段落差。

員工問「我可以請幾天?」,員工手冊上寫的是「特別休假日數」。關鍵字搜尋在這裡會失效——兩句話沒有共同的詞。

發生了什麼

向量檢索把文字轉成一組數字座標,語意相近的句子在座標空間裡就靠得近。「請幾天」和「特別休假日數」即使一個字都不重疊,距離仍然很近。

這對企業的意義

這個差異決定了知識庫是不是真的能用。員工不會用文件裡的正式用語提問,他們用日常說法。如果系統要求使用者先猜對關鍵字,那它就沒有解決任何問題——那跟自己翻手冊沒兩樣。

但向量檢索也不是萬靈丹。它對「分塊策略」很敏感:一份文件切得太碎會失去上下文,切得太大會混入無關內容。這件事沒有通用答案,要看文件本身的結構去調。

想看看 HRAI 怎麼回答你公司的問題?

用你們公司的真實文件,演示 30 分鐘。