057 · 邊聽邊說:互動模型打破回合制
Thinking Machines 把聲音、影像、文字在訓練時就一起餵進模型,每 200 毫秒決定一次要不要開口,順帶把 Mira Murati 離開 OpenAI 的來龍去脈講清楚。
原標題:LLM 之後:Thinking Machines 互動模型的誕生 | S2E57
重點摘要
- 邊聽邊說的互動模型Thinking Machines 發表了 research preview 版的互動模型,聲音、影像、文字在訓練階段就一起進模型。效果是它能一邊聽你講話一邊回話,像打電話一樣兩邊同時出聲。
- 每 200 毫秒一個微回合輸入與輸出被切成 200 毫秒的串流區塊,模型持續推論、持續決定要不要出聲。不必等使用者講完一整句才開始處理。
- 沉默也是上下文中間的空白與間隔完整留在上下文裡,模型因此知道過了多久。你可以叫它 30 秒後提醒你一件事,現在的模型做不到。
- 前景與背景兩個模型互動模型負責即時對話,背景模型負責搜尋與呼叫工具,結果在幾秒內回灌回來。對話不會因為它去做事就停住。
- 針對舊模型做的 harness 有保存期限現在的即時語音靠外掛模組偵測使用者講完了沒有,本質上還是長一點的回合制。等原生互動模型變強,這層工又要重做。
- 選在這個時候發表的壓力公司成立一年多、6 位共同創辦人走了 3 位,先端出一個讓人耳目一新的 demo,安撫投資人也安撫員工。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 兩年前 Mira Murati 在 GPT-4o 發表會講的自然互動,由她自己創辦的 Thinking Machines 端了出來。 |
| 03:08 | 一起看官方 demo | 模型聽得到聲音也看得到畫面,講話的同時還在接收新資訊,對話中途有人進來也記得原本的指令。 |
| 06:53 | 官方怎麼說 | 這是 research preview,強調模型以原生方式互動,而不是在外面套一層框架。 |
| 08:11 | 200 毫秒的微回合 | 模型從零開始訓練,輸入持續 streaming 進來,每 200 毫秒算一個回合,即時推論也即時回應。 |
| 10:19 | 粗話翻成 HR 用語 | 一邊聽一邊把難聽的話改寫成專業說法,而且同時繼續講。主持人聯想到虛擬分身戴著面具開會的畫面。 |
| 13:38 | 沉默留在上下文 | 不講話的決定也完整保存下來,時間在這個模型裡是 first citizen,所以它有時間感知。 |
| 14:25 | 背後至少兩個模型 | 互動模型把脈絡丟給背景模型去搜尋、呼叫工具,拿回結果後對話仍然順順地繼續。 |
| 15:59 | Mira Murati 的來歷 | 1989 年生於阿爾巴尼亞,達特茅斯機械工程系,2011 年在高盛實習,之後在 Tesla Model X 部門做 3 年產品經理,2018 年進 OpenAI,2022 年當上 CTO。 |
| 17:03 | 2023 年的逼宮 | 她原意是給 Sam Altman 管理上的 feedback,截圖轉給 Ilya 之後被送進董事會,結果變成無預警換掉 CEO,連微軟都沒通報。 |
| 20:29 | 告狀的人都走了 | Sam Altman 回鍋不到一年,當初出面的人陸續離開。主持人的看法是他學到的是員工支持比行為改變更管用。 |
| 22:01 | Thinking Machines 成立 | 2025 年 2 月創立,7 月 A16Z 領投種子輪投了 2 billion,估值推到 120 億美金。 |
| 25:11 | 語音模型的三個世代 | 第一代是前後接 speech to text 與 text to speech,第二代把聲音轉成 embedding 餵進去但要偵測你講完沒,兩者本質上都還是回合制。 |
| 27:19 | harness 的保存期限 | 針對現有模型做的外掛工程能把能力放到最大,但模型一旦把這些能力內建,疊上去的東西就得丟掉重做。 |
| 29:12 | 基準測試成績 | 模型叫 TML interaction small,互動程度大幅領先,但聰明程度與準確度還是輸給對手。 |
| 30:51 | 還沒解決的問題 | 開一兩個小時的會,音訊與影像累積的上下文比純文字更難管理,算力消耗與即時回應下的對齊安全也還在研究。 |
| 31:36 | 為什麼是現在 | demo 拿的一定是最好的一面,離產品化還有一段路。公司成立一年多就走了一半創辦人,這支 demo 的任務是穩住信心與招人。 |
值得記的話
名詞與人物
| Thinking Machines | Mira Murati 在 2025 年 2 月創立的 AI 公司,這次發表的就是互動模型。 |
|---|---|
| 互動模型 | 訓練時就把聲音、影像、文字包進去的模型,能邊聽邊說,目前是 research preview。 |
| micro turn(微回合) | 以 200 毫秒為單位的輸入輸出區塊,模型每一個區塊決定一次要不要出聲。 |
| first citizen | 時間在這個模型裡的地位,代表它知道現在過了多久,而不用靠外部工具去查。 |
| Mira Murati | OpenAI 前 CTO,Thinking Machines 創辦人,2024 年 9 月離開 OpenAI。 |
| John Schulman | OpenAI 共同創辦人,PPO 演算法的發明人,現在是 Thinking Machines 的首席科學家。 |
| PPO | 近端策略優化,強化學習拿到 feedback 時漸進式調整權重、不會一次擺盪到另一端的做法。 |
| Barret Zoph | Thinking Machines 共同創辦人之一,後來回到 OpenAI,官方說法是疑似要帶走機密資料而被開除。 |
| TML interaction small | 這次發表的模型名稱,規模比較小,互動品質領先但智力面還不是最好的。 |
| TimeSpeak / CueSpeak | Thinking Machines 自己提出的兩項內部基準測試,他們認為既有的測法已經不夠用。 |
| harness engineering | 在既有模型外面加工具與流程,把模型能力撐到最大的做法。 |
延伸
- PPO 這個演算法在之前的節目提過,這集只點到它是 John Schulman 的作品。
- TimeSpeak 與 CueSpeak 只講了名字和領先幅度,怎麼測的沒有展開;官方文章裡還有更多 demo 沒在節目裡播。
- 長時間工作階段的上下文管理、部署算力,以及即時回應下的對齊與安全,是他們自己說還在研究的三個方向。
原始出處
- Interaction Models: A Scalable Approach to Human-AI Collaboration — Thinking Machines Lab官方部落格發表互動模型 research preview,佐證筆記裡「聲音影像文字一起訓練」「200 毫秒微回合」「邊聽邊說」的說法。
- Proximal Policy Optimization Algorithms (arXiv:1707.06347)佐證筆記裡 John Schulman 是 PPO 演算法發明人的說法,他是這篇論文的第一作者。