全部場數

045 · 打造會精準檢索的知識型 Agent

講者說明為什麼模型推理進步飛快、檢索能力卻停滯不前,並介紹如何用專屬 harness 與強化學習,訓練出更懂檢索的 agent。

2026-07-0714:28Hanna Lichtenberg(Mixedbread AI)Agent開發工具評估看原片

原標題:How we taught agents to use good retrieval - Hanna Lichtenberg, Mixedbread AI

重點摘要

  • 推理與檢索出現落差LLM 的推理能力這幾年呈指數成長,但搜尋工具的進步曲線一直很平緩,兩條線之間因此越拉越開,這個現象被稱為「知識落差」。
  • 落差不是憑空想像在 BrowseComp Plus 與 Office QA Pro 兩個 benchmark 上,把正確文件直接交給模型(Oracle)時表現遠高於用 Codex 預設搜尋工具跑出來的結果,說明卡關的其實是找不到對的知識,不是推理能力不夠。
  • 查詢寫得像亂丟關鍵字模型送進搜尋系統的查詢常常只是關鍵字硬湊,原因是訓練資料多半來自程式碼探索(grep)、給人用的網頁工具,再加上主流檢索 benchmark 本身就偏好這種關鍵字型查詢。
  • 打造專屬 harnessMixedbread 設計了四種搜尋工具(overview search、語意搜尋、metadata 過濾、grep 關鍵字),限制每次最多四輪搜尋但可並行,逼模型改用完整句子描述搜尋意圖,而不是丟關鍵字。
  • 訓練分兩階段先用較大的 teacher 模型做 supervised fine-tuning,再對小型 agent 做 on-policy 強化學習,獎勵結合檢索指標(NDCG)與由 LLM 評分的查詢品質、探索量是否恰當等規則。
  • 成果相當顯著換上新工具後大幅補回 Oracle 與預設工具間的落差,agentic search 接上 Gemini 3.5 Flash 後更在一個 benchmark 拿下第一,準確率達到 93.4%。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Hanna Lichtenberg 說明這場要談團隊如何讓 agent 學會用好的檢索工具,內部稱這個問題為「縮小 oracle 落差」。
00:37兩條曲線拉開落差LLM 的推理能力這幾年呈指數成長,但搜尋工具進步得很慢,兩者之間因此拉出一個大缺口。
01:15驗證落差真實存在這個知識落差不是空想的理論,團隊在 BrowseComp Plus 與 Office QA Pro 兩個 benchmark 上都看到真實存在的落差。
02:20Oracle 上限對比預設工具直接把正確文件交給模型(Oracle)時,BrowseComp 可拿 93%、Office QA Pro 可拿 64%,換成 Codex 預設搜尋工具後分數卻大幅下滑。
03:14換工具補回落差換上 Mixedbread 的搜尋工具後,GPT-5 在 BrowseComp 上只落後 Oracle 三點,Office QA Pro 更幾乎完全打平。
03:58查詢長得像關鍵字堆疊模型丟給搜尋系統的查詢常常語無倫次,像是把關鍵字硬湊在一起,讓講求語意的搜尋系統很困惑。
04:13為什麼會寫成這樣原因有三:模型多半針對程式碼探索(如 grep)與網頁工具訓練,再加上主流檢索 benchmark 本身就偏好關鍵字型查詢。
05:40打造專屬 harness目標是讓 agent 精準、快、便宜;團隊在 Mixedbread 平台上打造四種搜尋工具,包含 overview search、語意搜尋、metadata 過濾與 grep 關鍵字比對。
06:45agent loop 設計每次最多四輪搜尋,但每輪可並行發起多個查詢,結果會先去重再送進下一輪,避免塞滿 context。
08:25引導模型寫出好查詢靠先講清楚要找的證據、限制只能寫一句話描述搜尋意圖、提供好範例等設計,讓模型不會走回關鍵字查詢的老路。
10:30訓練:先 SFT 再強化學習先用較大的 teacher 模型做 supervised fine-tuning,再對小型 agent 做 on-policy 強化學習,優化工具選擇與查詢品質。
10:45獎勵設計獎勵結合檢索指標(如 NDCG)與由 LLM 評分的規則,檢查查詢是否語意通順、探索量是否恰當等面向。
13:05初步訓練成果在講者稱為 Oblique Congress 的國會問答類型 benchmark 上,NDCG@10 達到 0.4,遠高於原論文表現最好的 GPT multi-hop agent(0.18)。
13:21打入排行榜第一把這套 agentic search 接給 Gemini 3.5 Flash 當搜尋工具,在 MedQA 相關的榜單上拿下第一,準確率達到 93.4%。

值得記的話

名詞與人物

Mixedbread AI這場講者所屬的公司,開發搜尋與檢索基礎設施,agentic search 是他們正式上線的產品線。
BrowseComp PlusOpenAI 原始 BrowseComp 的定量版本,語料庫固定為十萬份文件,用來測試複雜的瀏覽型查詢。
Office QA ProDatabricks 打造的 benchmark,題目取材自美國財政部過去百年的文件。
Oracle 分數假設把正確文件直接交給模型時能拿到的理論最高分,用來當作檢索能力的天花板。
NDCG一種排序品質指標,講者用它衡量 agent 最後排出的文件順序好不好。
overview searchharness 裡的搜尋工具之一,一次可看到多達五十個片段的摘要,用來先掌握語料庫全貌。
grep程式碼常用的關鍵字比對工具,harness 裡也保留它處理精確關鍵字搜尋。
BM25偏好關鍵字重疊程度的傳統檢索方法,講者認為主流 benchmark 的題型設計其實在偏袒它。

延伸

  • 講者提到目前訓練出的 agent 還沒有對外釋出,這場只公開了中間結果。
  • 講者提到 agentic search 接上 Gemini 3.5 Flash 之後拿下的成績,其他 LLM 搭配不同搜尋工具也做到類似表現,但沒有說明是哪些組合。
  • 講者提到 BEIR、Nano-BEIR 這類主流檢索 benchmark 的題型設計本身偏向關鍵字導向,但沒有進一步說明是哪些具體測試。