全部集數

057 · 邊聽邊說:互動模型打破回合制

Thinking Machines 把聲音、影像、文字在訓練時就一起餵進模型,每 200 毫秒決定一次要不要開口,順帶把 Mira Murati 離開 OpenAI 的來龍去脈講清楚。

2026-05-1735:29模型OpenAI產業觀察看原片

原標題:LLM 之後:Thinking Machines 互動模型的誕生 | S2E57

重點摘要

  • 邊聽邊說的互動模型Thinking Machines 發表了 research preview 版的互動模型,聲音、影像、文字在訓練階段就一起進模型。效果是它能一邊聽你講話一邊回話,像打電話一樣兩邊同時出聲。
  • 每 200 毫秒一個微回合輸入與輸出被切成 200 毫秒的串流區塊,模型持續推論、持續決定要不要出聲。不必等使用者講完一整句才開始處理。
  • 沉默也是上下文中間的空白與間隔完整留在上下文裡,模型因此知道過了多久。你可以叫它 30 秒後提醒你一件事,現在的模型做不到。
  • 前景與背景兩個模型互動模型負責即時對話,背景模型負責搜尋與呼叫工具,結果在幾秒內回灌回來。對話不會因為它去做事就停住。
  • 針對舊模型做的 harness 有保存期限現在的即時語音靠外掛模組偵測使用者講完了沒有,本質上還是長一點的回合制。等原生互動模型變強,這層工又要重做。
  • 選在這個時候發表的壓力公司成立一年多、6 位共同創辦人走了 3 位,先端出一個讓人耳目一新的 demo,安撫投資人也安撫員工。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場兩年前 Mira Murati 在 GPT-4o 發表會講的自然互動,由她自己創辦的 Thinking Machines 端了出來。
03:08一起看官方 demo模型聽得到聲音也看得到畫面,講話的同時還在接收新資訊,對話中途有人進來也記得原本的指令。
06:53官方怎麼說這是 research preview,強調模型以原生方式互動,而不是在外面套一層框架。
08:11200 毫秒的微回合模型從零開始訓練,輸入持續 streaming 進來,每 200 毫秒算一個回合,即時推論也即時回應。
10:19粗話翻成 HR 用語一邊聽一邊把難聽的話改寫成專業說法,而且同時繼續講。主持人聯想到虛擬分身戴著面具開會的畫面。
13:38沉默留在上下文不講話的決定也完整保存下來,時間在這個模型裡是 first citizen,所以它有時間感知。
14:25背後至少兩個模型互動模型把脈絡丟給背景模型去搜尋、呼叫工具,拿回結果後對話仍然順順地繼續。
15:59Mira Murati 的來歷1989 年生於阿爾巴尼亞,達特茅斯機械工程系,2011 年在高盛實習,之後在 Tesla Model X 部門做 3 年產品經理,2018 年進 OpenAI,2022 年當上 CTO。
17:032023 年的逼宮她原意是給 Sam Altman 管理上的 feedback,截圖轉給 Ilya 之後被送進董事會,結果變成無預警換掉 CEO,連微軟都沒通報。
20:29告狀的人都走了Sam Altman 回鍋不到一年,當初出面的人陸續離開。主持人的看法是他學到的是員工支持比行為改變更管用。
22:01Thinking Machines 成立2025 年 2 月創立,7 月 A16Z 領投種子輪投了 2 billion,估值推到 120 億美金。
25:11語音模型的三個世代第一代是前後接 speech to text 與 text to speech,第二代把聲音轉成 embedding 餵進去但要偵測你講完沒,兩者本質上都還是回合制。
27:19harness 的保存期限針對現有模型做的外掛工程能把能力放到最大,但模型一旦把這些能力內建,疊上去的東西就得丟掉重做。
29:12基準測試成績模型叫 TML interaction small,互動程度大幅領先,但聰明程度與準確度還是輸給對手。
30:51還沒解決的問題開一兩個小時的會,音訊與影像累積的上下文比純文字更難管理,算力消耗與即時回應下的對齊安全也還在研究。
31:36為什麼是現在demo 拿的一定是最好的一面,離產品化還有一段路。公司成立一年多就走了一半創辦人,這支 demo 的任務是穩住信心與招人。

值得記的話

模型會學會在對的時間點保持沉默,然後在對的時間點呢去給他要的這個聲音的輸出

13:21

它這些模型的設計呢是把時間當成是一個 first citizen,就是它的模型是有時間感知的

13:53

Mira 的本質上他並不是想要 Sam Altman 下台,他只是想要改變這樣的管理方式

19:57

當模型的能力變得非常強的時候,你這些 harness 瞬間就沒有意義了

27:35

在 AI 的時代裡面呢,其實一年多沒有一個像樣的產品推出來,是一個蠻慢的一個節奏

32:53

名詞與人物

Thinking MachinesMira Murati 在 2025 年 2 月創立的 AI 公司,這次發表的就是互動模型。
互動模型訓練時就把聲音、影像、文字包進去的模型,能邊聽邊說,目前是 research preview。
micro turn(微回合)以 200 毫秒為單位的輸入輸出區塊,模型每一個區塊決定一次要不要出聲。
first citizen時間在這個模型裡的地位,代表它知道現在過了多久,而不用靠外部工具去查。
Mira MuratiOpenAI 前 CTO,Thinking Machines 創辦人,2024 年 9 月離開 OpenAI。
John SchulmanOpenAI 共同創辦人,PPO 演算法的發明人,現在是 Thinking Machines 的首席科學家。
PPO近端策略優化,強化學習拿到 feedback 時漸進式調整權重、不會一次擺盪到另一端的做法。
Barret ZophThinking Machines 共同創辦人之一,後來回到 OpenAI,官方說法是疑似要帶走機密資料而被開除。
TML interaction small這次發表的模型名稱,規模比較小,互動品質領先但智力面還不是最好的。
TimeSpeak / CueSpeakThinking Machines 自己提出的兩項內部基準測試,他們認為既有的測法已經不夠用。
harness engineering在既有模型外面加工具與流程,把模型能力撐到最大的做法。

延伸

  • PPO 這個演算法在之前的節目提過,這集只點到它是 John Schulman 的作品。
  • TimeSpeak 與 CueSpeak 只講了名字和領先幅度,怎麼測的沒有展開;官方文章裡還有更多 demo 沒在節目裡播。
  • 長時間工作階段的上下文管理、部署算力,以及即時回應下的對齊與安全,是他們自己說還在研究的三個方向。

原始出處