025 · 多組平行快取取代知識圖譜
文件全都相關又常被取代時,簡單 RAG 太陽春、知識圖譜太貴,改用多組平行快取搭配探索式 supervisor 解題。
原標題:When All Context Matters: Extended Cache Augmented Generation - Luis Romero-Sevilla, Orbis
重點摘要
- 問題設定:全相關又常換Orbis 面對的情境是一大批文件全都跟同一組問題相關、彼此深度連動,而且資料集會很快被新版本取代。
- Simple RAG 不夠用用 embedding model 把文件轉成向量存進 vector database,抽換舊資料雖然快,但只挑相似度最高的向量,照顧不到文件之間本來就有的關聯。
- GraphRAG 準但太貴用 LLM 讀過所有文件抽出實體與關係、建成知識圖譜,能跨文件綜合出完整答案,可惜資料一換就要重建整張圖,算力與時間成本太高。
- CAG 換個角度既然每份文件都得過一次 LLM,不如放棄圖譜,改用大 context window 的模型把文件整批塞進去、直接快取,但塞太滿答案品質反而變差。
- 拆成多組 cache 平行跑把文件隨機分散進多組 context cache,由一個 supervisor 模型逐一探索、找到線索再深入追問特定 bucket,速度比 GraphRAG 快,答案又比 simple RAG 準。
- 沒有萬用解cache 成本不便宜,但能靠調整存活時間降低;講者強調各種檢索策略都各有取捨,ECAG 是他們針對這個特定問題給出的答案。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場設定情境 | 講者自我介紹是 Orbis 的 VP of AI,設定問題:一大批文件全都跟同一組問題相關、彼此深度連動,而且資料集會很快被新資訊取代。 |
| 00:45 | Simple RAG | 用 embedding model 把文件轉成向量存進 vector database,依查詢相似度取回內容再交給 LLM 回答,抽換舊資料也快。 |
| 01:40 | RAG 的侷限 | 這批文件其實全部相關,只挑相似度最高的幾筆向量遠遠不夠,沒辦法照顧到文件之間彼此的關聯。 |
| 02:10 | 導入知識圖譜 | 用 LLM 讀過所有文件抽出實體與關係,建成一張圖譜,讓系統能跨文件綜合出完整答案。 |
| 02:43 | 知識圖譜的代價 | 圖譜適合資料集不常變動的情境,但這裡的資料深度連動又常態替換,每次重建整張圖的算力與時間成本都太高。 |
| 03:17 | CAG 的構想 | 既然每份文件都要過一次 LLM,不如放棄圖譜,改用大 context window 的模型把文件整批塞進去、直接快取。 |
| 03:37 | 拆成多組 cache | context window 塞太滿答案品質會變差,解法是把文件隨機分散進多組 context cache,各自負責一部分內容。 |
| 04:46 | Supervisor 探索機制 | 由 supervisor 模型逐一探索各個 cache,找到線索就深入追問特定 bucket;因為 cache 能平行載入,速度比 GraphRAG 快,答案又比 simple RAG 準。 |
| 05:05 | 結論:沒有萬用解 | cache 成本不便宜,但可以靠調整存活時間降低;各種檢索策略各有取捨,ECAG 是他們針對這個特定問題的答案。 |
值得記的話
名詞與人物
| RAG | 先把文件轉成向量存進資料庫,依查詢相似度取回內容再交給 LLM 回答的基本檢索做法。 |
|---|---|
| GraphRAG | 用 LLM 讀過文件抽出實體與關係、建成知識圖譜,再靠圖譜跨文件回答問題的做法。 |
| CAG(Cache-Augmented Generation) | 不做檢索,直接把整批文件塞進大 context window 並快取起來,讓模型直接看到全部內容回答問題。 |
| ECAG | 這場的核心解法,把 CAG 延伸成多組平行快取搭配一個探索式 supervisor,因應資料集常態替換的情境。 |
| KV cache | 模型把讀過的上下文快取起來、之後不必重算就能重複使用,是 CAG/ECAG 省時間的關鍵,但快取存活越久成本越高。 |
| Orbis | 講者任職的公司,這場負責解決「所有內容都重要」的知識表示問題。 |
延伸
- 降低 KV cache 成本的具體做法,講者只提到「可以靠調整每個快取的存活時間來降低成本」,沒有進一步說明是哪些方法。
- 講者提到檢索策略各有取捨(算力、成本、速度),但沒有逐一列舉還有哪些策略。