全部集數

050 · 記憶體牆的解法與自幹的助理

TurboQuant 只留長文本裡真正重要的不到 5%,記憶體縮六倍、推論快八倍;後半談改用 Claude Agent SDK 自幹個人助理。

2026-03-2919:42Google研究Agent產業觀察看原片

原標題:Google TurboQuant 演算法打破 AI 記憶體牆!放棄 OpenClaw 自幹個人助理? | S2E50

重點摘要

  • Google 推的不是模型Gemini 3 之後 Google 安靜了一陣,這次端出來的 TurboQuant 是記憶體壓縮演算法。比起再發一個模型,它動到的是推論的基礎建設。
  • 記憶體牆卡在搬運GPU 的 VRAM 存著上百萬 token 的 KV cache,要送進運算核心時通道就塞住。結果最貴的運算單元大半時間在等待、在空轉。
  • 六倍、八倍、零損失paper 給的數字是記憶體縮小 6 倍、推論速度變成 8 倍,而且模型回答的品質沒有下降。原本像是三取二的取捨,被同時做到了三個。
  • 關鍵是注意力不平均Google 發現長文本裡 AI 真正會關注的資訊不到 5%。重要的那幾段原樣保留或只輕壓,其餘的從 16-bit 一路壓到 2-bit 甚至 1-bit。
  • 傳統壓縮為什麼會變笨以前是一視同仁,整份 16-bit 壓成 4-bit,速度是快了,資訊也一起變少。這跟聊天 session 自動 compact 掉重點是同一種毛病。
  • 個人助理改自己做OpenClaw 調教太累,使用率降下來了。主持人正在用 Claude Agent SDK 加上 Mem0 的記憶層做 prototype,部署到雲端、用 Telegram 對話。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Google 這次發表的不是模型,而是記憶體壓縮演算法 TurboQuant,直接衝著推論最大的瓶頸來。
02:20員工旅遊回來現職在全遠端的加密貨幣新創 Phantom,留下來的兩個理由是吃不完的 AI credit 與每半年一次的全員旅遊。
03:52第一次與最後一次人會牢牢記得第一次,卻幾乎不會意識到某件事其實是最後一次。
05:09最後一次員工旅遊時間想留給創作與自己的 side project,所以這趟是抱著珍惜的心態去的,未來大概不會再替別人工作。
07:30OpenClaw 降溫調教成本太高,現在只讓它照既有流程做基本操作,不再花時間把它養得更好。
08:00想要什麼樣的助理Claude Code 的 coding 與規劃能力已經夠好,缺的是一層記憶,而且東西要放雲端不要留在本機。
09:15改用 Agent SDKClaude 的 Agent SDK 理論上能拿到跟 Claude Code 差不多的能力,目前已經做出基礎的聊天與記憶功能。
09:45向量資料庫記憶用 Mem0 讓 agent 每次對話自動 recall,也自己把重要資訊記下來,再接 Telegram 當入口。
10:31TurboQuant 登場別家都在推自己的模型,Google 這次改攻推論效率,主持人認為指標意義很大。
11:03什麼是記憶體牆百萬級 context window 塞進 VRAM 佔掉大量空間,KV cache 往運算單元傳的過程變成瓶頸,聊越久越慢。
12:22三個數字記憶體從 60GB 降到 10GB 這種量級,output 速度像是每秒 10 個字變 80 個字,品質還不掉。
13:22舊方法為何變笨每個 token 一律從 16-bit 壓到 4-bit,資訊平均變少,模型就真的變笨。
14:26不到 5% 的重點10 萬字的文本裡,注意力機制真正在看的不到 5%,其餘丟掉對 output 影響很小。
15:11動態混合精度重要段落保留或只壓一點,不重要的壓到 2-bit 甚至 1-bit,更細的技巧留給觀眾自己研究。
15:57成本降了之後記憶體股在消息後修正,主持人認為只要需求還在,省下來的成本會拿去換更大的 context 與更好的表現。

值得記的話

所以 GPU 最厲害的運算的核心,其實大部分時間是在空轉的。

00:31

你不知道這次是最後一次了。

04:23

目前我覺得說,我可能這會是我最後一份領薪水的工作了。

06:12

你本來是三取二的事情,你居然把它達到了三個同時滿足。

12:52

只要你把這不到 5% 的資訊完整地保留,其他的部分丟失其實是沒有關係的。

14:26

名詞與人物

TurboQuantGoogle 發表的記憶體壓縮演算法,號稱記憶體縮 6 倍、推論快 8 倍且零損失。
記憶體牆 (Memory Wall)KV cache 從顯卡記憶體送進運算核心的通道塞住,讓 GPU 的運算單元一直在等待。
KV cache推論時把對話文本存在顯卡記憶體裡的那一塊,context window 越大它就越肥。
動態混合精度TurboQuant 的做法,依重要性給不同壓縮率,不重要的壓到 2-bit 甚至 1-bit。
Claude Agent SDK主持人拿來自製個人助理的開發套件,能力理論上接近 Claude Code。
Mem0用向量資料庫做 agent 記憶的工具,先前也用來補強 OpenClaw 的記憶力。
OpenClaw上一集談過的通用型個人助理,因為場景太廣、記憶容易混亂而被暫時放下。
Phantom主持人任職的加密貨幣新創,全遠端、約一百多人,每半年辦一次員工旅遊。

延伸

  • 上一集講過 OpenClaw 記憶力混亂,還有對話變長時自動 compact 會丟掉重點,這集是接著往下談。
  • 主持人說自製助理的 setup 或 GitHub repo 之後可以分享出來。
  • TurboQuant 還有不少細節與小技巧,節目只講了簡化版本,paper 留給有興趣的人自己看。

原始出處