084 · Skills 時代的 Context 與護城河
context window 用久會變笨,skills 靠漸進式揭露省 token,正成為企業 AI 的新護城河。
原標題:Skills are the New SDKs - Elvin Aghammadzada, DataRobot
重點摘要
- Context 是有限資源模型號稱擁有上百萬 token 的 context window,但講者指出用量一旦超過某個比例,表現就會明顯下滑,過了 40% 之後甚至會掉進「dumb zone」。
- 護城河從摩擦轉為順暢coding agent 已經能自動把十萬到一百萬行程式碼從 Python 搬到 Rust,換平台的成本大幅降低;skills 讓平台改追求「體驗好到讓人不想走」的 fluency moat,而不是靠高轉換成本綁住用戶的 friction moat。
- Teachability 成為新的評估項目企業選平台時,除了安全、合規、資料治理之外,現在還要看 agent harness 能不能在幾秒內學會怎麼用這個平台。
- 漸進式揭露大幅省下 token光是連接 15 個 MCP server,工具定義就可能吃掉超過 10 萬個 token;skills 只在真的用到時才載入內容,能省下至少十倍成本。
- 一個好 agent 加上一堆 skills 就能通用不用替每個產業或客戶另外造一個 agent,只要有一個通用的 agent engine,剩下的差異都靠 skills 補上;但講者也提到有研究顯示讓 LLM 自己寫 skill 反而會拖慢效能、增加風險。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 講者 Elvin Aghammadzada 預告今天要談 skills 面臨的挑戰、context 問題,以及圍繞 OpenClaw 等產品興起的生態系。 |
| 00:57 | Context 視窗的迷思 | 前沿模型號稱有 1 百萬甚至 5 百萬 token 的近乎無限 context window,但這個假設誤導了大家對 RAG 與 MCP 的思考方式。 |
| 02:04 | 用量過門檻就退化 | 一旦 context 用量達到 25%,表現就開始下滑,例如 100 萬 token 的模型只要用掉 256k 就會出現退化,嚴重時前沿模型會表現得像很差的模型。 |
| 03:10 | 文件流量暴增 | 過去一年文件網站流量佔比從 10% 衝到 50%,多半來自 coding agent;文件是寫給人看的,模型缺乏理解文件所需的直覺。 |
| 04:04 | 從護城河歷史談起 | 回顧軟體史上最難複製的優勢:誰掌握硬體、資料或系統整合,誰就掌握市場,這正是所謂的護城河(moat)。 |
| 05:03 | Skills 打造 fluency moat | coding agent 已經能自動把十萬到一百萬行程式碼從 Python 搬到 Rust,換平台變容易;skills 讓平台改追求「體驗好到讓人不想走」的 fluency moat。 |
| 07:33 | Teachability 成新指標 | 企業選平台的檢查清單本來就有安全、合規、資料治理、SLA 等項目,現在還多了一項:agent harness 能不能在幾秒內學會怎麼用這個平台。 |
| 09:26 | Context engineering 是解法 | 目標是在對的時機、把對的資訊餵給 LLM,用篩選取代把 CLAUDE.md 與所有 MCP 工具一次塞滿的做法。 |
| 13:21 | MCP 與 skills 的 token 差距 | 光是連接 15 個 MCP server,工具定義就可能吃掉超過 10 萬個 token;skills 靠漸進式揭露可以省下至少十倍。 |
| 16:02 | MCP 與 skills 不互相競爭 | 兩者都來自 Anthropic:MCP 定義 agent 能做什麼動作,skills 決定 agent 怎麼思考問題,還能自我修改更新。 |
| 20:47 | 一個 skill 的三層結構 | front matter 是索引,幾乎不耗 context;skill 的正文只在被喚起時才載入;腳本層負責實際執行或提供示範程式碼。 |
| 22:47 | 生態系正在爆發 | 目前有 26 個以上平台支援 skills,數量已達數十萬個以上;甚至有開源 agent 能自我修復、自己寫新 skill 來擴充能力,講者說這讓人印象深刻但也有點可怕。 |
| 25:19 | 安全與信任風險 | 有開源 agent(OpenClaw)因為沒有做好隔離而出包,相較之下 MCP 有獨立執行環境;市集也還缺乏像 npm 當年那種信任驗證機制。 |
| 26:01 | 收尾三個提醒 | context 是要省著用的預算,skills 也是軟體所以要版本控管與測試,skill 品質終究取決於寫它的人。 |
值得記的話
名詞與人物
| Skills | 一種讓 agent 在需要時才載入完整內容的知識封裝方式,取代把所有指示塞進系統提示或工具定義裡 |
|---|---|
| MCP | Model Context Protocol,定義 agent 能呼叫哪些外部工具,與 skills 是互補而非取代的關係 |
| Progressive disclosure | 只在 agent 真正用到某個 skill 時才載入完整內容,平常只留一小段 metadata 索引,用來省 token |
| Context engineering | 篩選並安排資訊進入 LLM context 的時機與內容,避免一次把所有東西都塞給模型 |
| Moat(護城河) | 講者用來比喻平台難以被取代的優勢,分成靠高轉換成本綁住用戶的 friction moat,與靠體驗吸引人的 fluency moat |
| Teachability | 講者提出的新評估項目:agent harness 能多快學會使用一個平台或工具 |
| OpenClaw | 一個開源 agent 專案,具備自我修復與自寫 skill 的能力,也曾因缺乏隔離而出現安全事故 |
| CLAUDE.md | Claude Code 讀取的專案層級指示檔案,屬於固定載入進 context 的「instructions」部分 |
延伸
- 有研究指出讓 LLM 自己產生 skills 反而會拖慢效能、耗費更多 token,講者只提到這個結論,沒有進一步說明是哪份研究或如何測試。
- 講者提到市面上已經有人拿 skills 出來賣,也有 Claw Hub 這類 skills 註冊平台,但沒有進一步介紹它們怎麼運作。
- 結尾秀出一份參考資源清單,但沒有逐一說明內容。