023 · 語音輸入、視覺輸出的延遲攻防
語音輸入常常又慢又卡,這場改用視覺輸出撐住即時感,也整理出三個壓低延遲的實作技巧。
原標題:Voice In, Visuals Out: The Agony and the Ecstasy - Allen Pike, Forestwalk Labs
重點摘要
- 語音進、視覺出的分工講者轉述 Karpathy 的觀點——人類偏好用語音跟 AI 溝通,但接收回應時比較偏好用看的,而不是用聽的。
- 視覺輸出的天花板打開模型現在能生成 HTML、呼叫工具,讓回應直接帶出互動控制與插圖,比純文字或 markdown 好懂太多。
- 語音對話的延遲門檻要讓語音對語音的對話感覺自然,整條「語音轉文字、模型推論、轉回語音」的流程得壓進 200 毫秒,非常吃緊。
- 語音進、畫面出的折衷與其硬做語音輸出,不如讓結果在一秒內顯示在畫面上,因為人對視覺回饋的容忍時間比語音長,一樣有即時感。
- 三個壓低延遲的實作重點選用真的以延遲為優先的推論平台、拉高推論觸發頻率、維持穩定的 prompt 前綴吃到 prefix caching 的折扣。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場自介 | Allen Pike 開場,說明今天要分享 Forestwalk Labs 打造語音輸入、視覺輸出體驗的心得。 |
| 00:16 | Karpathy 的分工論 | 轉述 Karpathy 上個月的論點:人類偏好用語音當 AI 的輸入,但偏好用視覺接收 AI 的回應。 |
| 01:27 | 視覺輸出成熟 | 模型已能生成豐富 HTML、呼叫工具,讓回應直接帶出互動控制與插圖,視覺輸出的天花板大幅拉高。 |
| 03:24 | 語音的資訊密度 | 語音比打字傳遞更多語氣與資訊,這也是重要溝通常常要打電話或碰面的原因。 |
| 04:12 | 通話中的語音 agent | Forestwalk 在通話裡放了即時 agent,一提到 Slack 有 bug,它馬上建好一張 Linear issue。 |
| 05:13 | 延遲是最大挑戰 | 要讓這種體驗好用,最大的阻礙是延遲,電腦大約要在一百毫秒內反應才算跟得上人。 |
| 06:45 | 全語音對話的門檻 | 真正流暢的語音對話,得把整條語音轉文字、推論、再轉語音的流程壓進 200 毫秒左右,非常吃緊。 |
| 07:22 | 業界的因應架構 | 提到 Thinking Machines 等團隊用 200 毫秒為單位切分、持續推論的架構來繞開延遲限制。 |
| 08:02 | 改走語音進畫面出 | 不必等新架構出現,直接切換成語音輸入、視覺輸出,因為人對畫面回饋更有耐性。 |
| 08:54 | 技巧一:推論平台 | 不只模型要小,平台也要以延遲為優先;GPT-5 mini 一度測到 5000~7000 毫秒的 P95 延遲,Haiku 反而穩定得多。 |
| 10:20 | 技巧二:推論頻率 | 不等使用者確定講完才推論,改成每一兩秒就送一次,體驗會順很多。 |
| 11:33 | 技巧三:快取前綴 | 讓 prompt 前 90% 的內容維持不變,才能吃到 prefix caching 帶來的速度與成本優勢。 |
| 12:58 | 收尾與呼籲 | 講者歡迎交流即時語音體驗的心得,也鼓勵大家動手做出好東西。 |
值得記的話
名詞與人物
| Andrej Karpathy | 講者引用其近期論點的 AI 研究者,主張語音是人類偏好的輸入方式,視覺才是偏好的輸出方式。 |
|---|---|
| Forestwalk Labs | 講者所在的公司,這場分享他們打造語音輸入、視覺輸出體驗的心得。 |
| Thinking Machines | 講者點名的團隊之一,最近展示過把時間切成 200 毫秒一段、讓模型持續推論的架構,用來繞開語音延遲的限制。 |
| GPT-5 mini | 講者實際測試過的模型,雖然更聰明,但 P95 延遲一度高達 5000~7000 毫秒。 |
| Haiku | 講者認為在即時語音場景裡,P95 延遲比部分更大模型更穩定的模型等級。 |
| Linear | 講者舉例用的專案管理工具,語音 agent 把提到的 Slack bug 直接建成一張 issue。 |
| prefix caching | 講者提到的推論快取技巧:只要 prompt 前段內容每次相同,就能拿到更便宜、更快的推論。 |
延伸
- Thinking Machines 那種以 200 毫秒切片、持續推論的架構,這場只帶過一句,沒有細講實際做法。
- 講者結尾說歡迎交流即時語音體驗的心得,但沒有說明後續要怎麼聯絡或在什麼場合聊。