053 · 個人助理換家,Opus 4.7 變強也變貴
主持人把個人助理換成 Hermes Agent,談它的記憶力與自製 agent 的取捨,也拆解 Opus 4.7 為什麼更貴,以及 4.6 降智風波的真相。
原標題:小龍蝦殺手 Hermes Agent 深度上手!Opus 4.7 到底有沒有變強? | S2E53
重點摘要
- Hermes Agent 幾乎無痛安裝幾行指令就跑起來,介面跟 Claude Code 很像。還沒碰過小龍蝦的人,可以直接跳過它從這裡開始。
- 記憶力是最大的分水嶺對話全存在本機,跨裝置、跨對話都搜得到。在手機上說「從剛剛那裡繼續」就能接上,不必搬整段 session。
- 自製 agent 有長處也有代價主 agent 專心聊天、雜事丟給 sub-agent 的設計很順手,但 skill 要自己重造輪子,又被單一廠商綁死。
- harness 與 compute 可能要分家Codex 提出把執行環境拆到獨立 sandbox,密鑰留在 harness 那層。個人專案差別不大,企業 production 比較安全。
- 開源模型 12 天就換人Gemma 4 才發表,阿里的 Qwen 3.6 就在 coding benchmark 上大幅領先,而且用 MoE 讓本地推論更快。
- 4.7 更強,帳單也更兇圖片辨識從 55% 拉到 99%,但換了新分詞器,同一段 prompt 的 token 會多出 1 到 1.35 倍。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 這集三件事:Hermes Agent 的上手心得、Opus 4.7 的進步與代價、4.6 被說變笨的來龍去脈。 |
| 02:20 | 大峽谷春假 | 全家趁小朋友春假去 Arizona 玩了十天。一家人擠在一起住反而早睡早起,精神變好,但回家一週就打回原形。 |
| 07:08 | Hermes 初體驗 | 買了 Mac Studio 本來想跑 local LLM,先裝了 Hermes Agent。幾行指令設定完就能聊天,也能接 Telegram。 |
| 08:43 | 跨裝置接話 | 所有對話記錄都留在自己電腦上,換裝置時不用搬整段 session,直接說「剛剛講到哪」就抓得回重點。 |
| 09:30 | 記憶 provider | 記憶模組可以自己挑,他選了 Honcho。它不只比對語義相似度,還會推論兩段不同的話背後是不是同一件事。 |
| 11:00 | 自製助理的架構 | 主 agent 用 Client SDK 專心對話,研究、寫程式、debug 全下放給 Agent SDK 的 sub-agent,聊天不會被打斷。 |
| 12:49 | 為什麼還是換 | 自己做要重造 skill 的輪子,而且純用 Anthropic SDK 就換不了模型廠商。Hermes 兩個問題都沒有。 |
| 13:50 | 名字的由來 | Hermes 是希臘神話的商人之神,也是人與神之間的信使。這個 agent 扮演的正是人跟大語言模型之間的橋梁。 |
| 14:22 | 自己長出 skill | 幾輪對話之後,它會主動把重複的 tool call 包成 skill、順手更新記憶,越用越清楚你的思考偏好。 |
| 15:55 | harness 與 compute | Codex 大改版的方向是再切一刀:harness 負責 loop 與工具溝通,實際執行丟到另外的 sandbox,那裡沒有你的 secret。 |
| 19:16 | 開源模型對決 | Gemma 4 是 31 billion 的通用模型,12 天後阿里的 Qwen 3.6 以 35 billion 在 coding 上碾壓它,推論只啟用 3 billion。 |
| 21:03 | Opus 4.7 登場 | 它不是 Mythos,而是 Mythos 的安全閹割版。各項 benchmark 都領先 4.6,圖片辨識從 55% 跳到 99%。 |
| 22:04 | 分詞器變貴了 | 4.7 換了新的 tokenizer,同一段 prompt 進來會吃掉 4.6 的 1 到 1.35 倍 token,帳單自然跑得比較快。 |
| 22:49 | 降智風波 | 有人分析 7000 個 Claude Code session,3 月的 thinking token 少了 60% 到 75%,原因是預設的 thinking effort 被從 high 悄悄改成 medium。 |
| 24:25 | xhigh 與觀感 | 4.7 在 high 跟 max 之間加了 xhigh,還設成預設。先降級再升級,「變聰明」的體感有一部分是這樣來的。 |
| 25:28 | 押寶單一廠商 | OpenAI 營運長說大家對 Anthropic 幾乎是信仰。但 ChatGPT 也走過同一條路,等便宜的模型追上來,成本會逼大家重新選。 |
值得記的話
名詞與人物
| Hermes Agent | 跑在自己電腦上的個人 AI 助理,用 CLI 操作,也能接上 Telegram 之類的訊息軟體。 |
|---|---|
| OpenClaw(小龍蝦) | 主持人先前用的個人 agent,設定麻煩、記憶力不穩,這集被歸類成可以跳過。 |
| Honcho | Hermes Agent 可選的記憶 provider,除了語義搜尋還會對聊天脈絡做推論。 |
| harness engineering | 大語言模型外面那一層,負責 loop 與 tool call,決定一個 agent 用起來聰不聰明。 |
| Agent SDK | Anthropic 的 SDK 之一,可以想成 Claude Code 的程式版,工具能力比 Client SDK 完整。 |
| Qwen 3.6 | 阿里推出的開源模型,35 billion 參數,採 MoE,推論時只啟用 3 billion。 |
| Gemma 4 | 31 billion 參數的開源通用模型,比 Qwen 3.6 早 12 天發表,coding 表現落後。 |
| Mythos | Anthropic 還在內部測試的最強模型,只有少數大公司能用,4.7 是它的安全版。 |
| thinking effort | 控制模型思考深度的設定,原本只有到 high 與 max,4.7 中間多了一級 xhigh。 |
延伸
- Mac Studio 原本是買來跑 local LLM 的,但到錄音時 Gemma 4 跟 Qwen 3.6 都還沒真的裝起來,只先裝了 Hermes Agent。
- Claude Code 原始碼外洩那件事之前聊過,這集只帶一句:那些設計理念應該很快會出現在 Codex 上。
- 自製的個人助理裡有一套會自己改程式、自我進化的機制,這集只提到有,沒有展開講怎麼做。
原始出處
- Introducing Claude Opus 4.7Anthropic 官方公告證實 Opus 4.7 換了新分詞器(同一段文字會多吃 1.0–1.35 倍 token)、視覺辨識大幅提升,對應筆記裡「分詞器變貴了」與「圖片辨識從 55% 跳到 99%」的說法。
- Gemma 4: Byte for byte, the most capable open modelsGoogle 官方部落格證實 2026 年 4 月 2 日發表 Gemma 4,其中包含 31B 參數的通用密集模型,對應筆記裡「31 billion 的通用模型」。
- Qwen/Qwen3.6-35B-A3B · Hugging Face(官方模型卡)Qwen 官方模型卡證實 Qwen3.6-35B-A3B 是 35B 參數、僅啟用約 3B 的 MoE 模型,對應筆記裡「35 billion 參數,推論時只啟用 3 billion」。