087 · 小模型撐起即時語音家教
把規劃與判斷都搬出語音模型之外,讓小模型也能在毫秒內開口,撐起一場即時語音家教。
原標題:Your Voice Agent Doesn't Need a Frontier Model - Joel Allou & Ornella Bahidika, Microsoft
重點摘要
- 刻意選小模型Joel 與 Ornella 建了 ACE,一個即時語音 AI 家教,刻意讓小模型撐起對話,主張這不是妥協。
- 延遲是唯一預算語音互動一旦停頓超過一秒,使用者就會覺得系統掛了,反應速度比模型聰明與否更重要。
- 把推理搬出模型規劃下一步、追蹤學生狀態這類重活交給外部系統處理,模型只負責「講話」這件事。
- state machine 扛下所有邏輯涵蓋各種教學情境、協調每一步該做什麼,也負責推算學生的 mastery,模型只需把結果講出來。
- 示範對比同一個問題,沒優化時 Opus 4.7 要思考數秒,加上 scaffolding 之後換成 Haiku 4.5,大約九百毫秒就能回答。
- 代價是 scaffolding小模型沒有嚴格規則容易在長流程裡跑偏,但這筆成本寫進程式碼一次就好,不必每輪都付。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場亮相 | Ornella 與 Joel 介紹 ACE,主張刻意用小模型撐語音家教並非妥協。 |
| 00:19 | 語音延遲的代價 | 語音互動一旦停頓超過一秒,使用者就會覺得系統掛了。 |
| 00:51 | 毫秒門檻 | 目標壓在九百五十毫秒內開口,頂尖模型想滿一秒就已經跟不上。 |
| 01:06 | 搬走判斷工作 | 學生狀態的追蹤與下一步規劃都交給外部系統,模型只負責開口說話。 |
| 01:40 | 推理耗時的代價 | Joel 補充:頂尖模型推理能力強,但推理要花上幾秒,這在語音應用裡代價太高。 |
| 02:12 | 把思考搬進 state machine | 所有判斷都寫進 state machine,涵蓋課程情境並算出學生的 mastery,模型只需開口回答。 |
| 03:27 | 實機示範對比 | 同一題目,沒優化的 Opus 4.7 要想好幾秒,接上 scaffolding 的 Haiku 4.5 大約九百毫秒就回答。 |
| 04:18 | 代價是 scaffolding | 小模型沒有嚴格規則容易在長流程裡跑偏,但這筆成本寫進程式碼一次就好,不必每輪都付。 |
| 05:11 | 結論 | 不管是語音、即時或高流量應用,模型都只是整個系統裡最小的一塊。 |
值得記的話
名詞與人物
| ACE | 講者建的即時語音 AI 家教產品,這場的示範主體。 |
|---|---|
| Joel Allou(Microsoft) | 這場講者之一,負責示範 ACE 的技術實作與效果對比。 |
| Ornella Bahidika(Microsoft) | 這場講者之一,說明 ACE 刻意選用小模型的理由。 |
| state machine | 把教學情境的判斷與流程規劃寫進程式,取代模型即時推理的做法。 |
| scaffolding | 為小模型寫進程式碼的規則與流程,讓它不必自己判斷也能穩定輸出。 |
| Claude 4.7 | 講者提到的 Anthropic 頂尖模型,用來說明為什麼直接拿它做語音家教會太慢。 |
| Opus 4.7 | 示範對比中作為未優化基準的模型,回答一個問題要思考數秒。 |
| Haiku 4.5 | 示範對比中換上的小型模型,搭配 state machine 後大約九百毫秒就能開口回答。 |
延伸
- ACE 教的科目與實際使用場景,這場沒有進一步說明。
- 系統如何推算學生的 mastery,這場只提到有這個機制,沒有拆解演算方式。
- state machine 具體涵蓋哪些教學情境、怎麼設計,這場只講原則,沒有展開細節。