全部集數

053 · 個人助理換家,Opus 4.7 變強也變貴

主持人把個人助理換成 Hermes Agent,談它的記憶力與自製 agent 的取捨,也拆解 Opus 4.7 為什麼更貴,以及 4.6 降智風波的真相。

2026-04-1928:46Agent模型Anthropic開源看原片

原標題:小龍蝦殺手 Hermes Agent 深度上手!Opus 4.7 到底有沒有變強? | S2E53

重點摘要

  • Hermes Agent 幾乎無痛安裝幾行指令就跑起來,介面跟 Claude Code 很像。還沒碰過小龍蝦的人,可以直接跳過它從這裡開始。
  • 記憶力是最大的分水嶺對話全存在本機,跨裝置、跨對話都搜得到。在手機上說「從剛剛那裡繼續」就能接上,不必搬整段 session。
  • 自製 agent 有長處也有代價主 agent 專心聊天、雜事丟給 sub-agent 的設計很順手,但 skill 要自己重造輪子,又被單一廠商綁死。
  • harness 與 compute 可能要分家Codex 提出把執行環境拆到獨立 sandbox,密鑰留在 harness 那層。個人專案差別不大,企業 production 比較安全。
  • 開源模型 12 天就換人Gemma 4 才發表,阿里的 Qwen 3.6 就在 coding benchmark 上大幅領先,而且用 MoE 讓本地推論更快。
  • 4.7 更強,帳單也更兇圖片辨識從 55% 拉到 99%,但換了新分詞器,同一段 prompt 的 token 會多出 1 到 1.35 倍。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場這集三件事:Hermes Agent 的上手心得、Opus 4.7 的進步與代價、4.6 被說變笨的來龍去脈。
02:20大峽谷春假全家趁小朋友春假去 Arizona 玩了十天。一家人擠在一起住反而早睡早起,精神變好,但回家一週就打回原形。
07:08Hermes 初體驗買了 Mac Studio 本來想跑 local LLM,先裝了 Hermes Agent。幾行指令設定完就能聊天,也能接 Telegram。
08:43跨裝置接話所有對話記錄都留在自己電腦上,換裝置時不用搬整段 session,直接說「剛剛講到哪」就抓得回重點。
09:30記憶 provider記憶模組可以自己挑,他選了 Honcho。它不只比對語義相似度,還會推論兩段不同的話背後是不是同一件事。
11:00自製助理的架構主 agent 用 Client SDK 專心對話,研究、寫程式、debug 全下放給 Agent SDK 的 sub-agent,聊天不會被打斷。
12:49為什麼還是換自己做要重造 skill 的輪子,而且純用 Anthropic SDK 就換不了模型廠商。Hermes 兩個問題都沒有。
13:50名字的由來Hermes 是希臘神話的商人之神,也是人與神之間的信使。這個 agent 扮演的正是人跟大語言模型之間的橋梁。
14:22自己長出 skill幾輪對話之後,它會主動把重複的 tool call 包成 skill、順手更新記憶,越用越清楚你的思考偏好。
15:55harness 與 computeCodex 大改版的方向是再切一刀:harness 負責 loop 與工具溝通,實際執行丟到另外的 sandbox,那裡沒有你的 secret。
19:16開源模型對決Gemma 4 是 31 billion 的通用模型,12 天後阿里的 Qwen 3.6 以 35 billion 在 coding 上碾壓它,推論只啟用 3 billion。
21:03Opus 4.7 登場它不是 Mythos,而是 Mythos 的安全閹割版。各項 benchmark 都領先 4.6,圖片辨識從 55% 跳到 99%。
22:04分詞器變貴了4.7 換了新的 tokenizer,同一段 prompt 進來會吃掉 4.6 的 1 到 1.35 倍 token,帳單自然跑得比較快。
22:49降智風波有人分析 7000 個 Claude Code session,3 月的 thinking token 少了 60% 到 75%,原因是預設的 thinking effort 被從 high 悄悄改成 medium。
24:25xhigh 與觀感4.7 在 high 跟 max 之間加了 xhigh,還設成預設。先降級再升級,「變聰明」的體感有一部分是這樣來的。
25:28押寶單一廠商OpenAI 營運長說大家對 Anthropic 幾乎是信仰。但 ChatGPT 也走過同一條路,等便宜的模型追上來,成本會逼大家重新選。

值得記的話

在那邊搞什麼誰的 AI token 燒比較多,這件事情在大自然底下一點意義都沒有。

05:01

你本來想嘗試的先不要,你直接去裝 Hermes Agent 就夠了。

07:40

我不需要你迎合我、刻意迎合我,你最好是用你研究過來的結果。

14:53

開源模型的競爭也太卷了吧,短短 12 天的時間我都還沒安裝好。

20:17

我觀察到的現象是 Anthropic 好像有一點在敗人品。

26:46

名詞與人物

Hermes Agent跑在自己電腦上的個人 AI 助理,用 CLI 操作,也能接上 Telegram 之類的訊息軟體。
OpenClaw(小龍蝦)主持人先前用的個人 agent,設定麻煩、記憶力不穩,這集被歸類成可以跳過。
HonchoHermes Agent 可選的記憶 provider,除了語義搜尋還會對聊天脈絡做推論。
harness engineering大語言模型外面那一層,負責 loop 與 tool call,決定一個 agent 用起來聰不聰明。
Agent SDKAnthropic 的 SDK 之一,可以想成 Claude Code 的程式版,工具能力比 Client SDK 完整。
Qwen 3.6阿里推出的開源模型,35 billion 參數,採 MoE,推論時只啟用 3 billion。
Gemma 431 billion 參數的開源通用模型,比 Qwen 3.6 早 12 天發表,coding 表現落後。
MythosAnthropic 還在內部測試的最強模型,只有少數大公司能用,4.7 是它的安全版。
thinking effort控制模型思考深度的設定,原本只有到 high 與 max,4.7 中間多了一級 xhigh。

延伸

  • Mac Studio 原本是買來跑 local LLM 的,但到錄音時 Gemma 4 跟 Qwen 3.6 都還沒真的裝起來,只先裝了 Hermes Agent。
  • Claude Code 原始碼外洩那件事之前聊過,這集只帶一句:那些設計理念應該很快會出現在 Codex 上。
  • 自製的個人助理裡有一套會自己改程式、自我進化的機制,這集只提到有,沒有展開講怎麼做。

原始出處