全部場數

023 · 語音輸入、視覺輸出的延遲攻防

語音輸入常常又慢又卡,這場改用視覺輸出撐住即時感,也整理出三個壓低延遲的實作技巧。

2026-06-2813:05Allen Pike(Forestwalk Labs)Agent開發工具模型產業觀察看原片

原標題:Voice In, Visuals Out: The Agony and the Ecstasy - Allen Pike, Forestwalk Labs

重點摘要

  • 語音進、視覺出的分工講者轉述 Karpathy 的觀點——人類偏好用語音跟 AI 溝通,但接收回應時比較偏好用看的,而不是用聽的。
  • 視覺輸出的天花板打開模型現在能生成 HTML、呼叫工具,讓回應直接帶出互動控制與插圖,比純文字或 markdown 好懂太多。
  • 語音對話的延遲門檻要讓語音對語音的對話感覺自然,整條「語音轉文字、模型推論、轉回語音」的流程得壓進 200 毫秒,非常吃緊。
  • 語音進、畫面出的折衷與其硬做語音輸出,不如讓結果在一秒內顯示在畫面上,因為人對視覺回饋的容忍時間比語音長,一樣有即時感。
  • 三個壓低延遲的實作重點選用真的以延遲為優先的推論平台、拉高推論觸發頻率、維持穩定的 prompt 前綴吃到 prefix caching 的折扣。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場自介Allen Pike 開場,說明今天要分享 Forestwalk Labs 打造語音輸入、視覺輸出體驗的心得。
00:16Karpathy 的分工論轉述 Karpathy 上個月的論點:人類偏好用語音當 AI 的輸入,但偏好用視覺接收 AI 的回應。
01:27視覺輸出成熟模型已能生成豐富 HTML、呼叫工具,讓回應直接帶出互動控制與插圖,視覺輸出的天花板大幅拉高。
03:24語音的資訊密度語音比打字傳遞更多語氣與資訊,這也是重要溝通常常要打電話或碰面的原因。
04:12通話中的語音 agentForestwalk 在通話裡放了即時 agent,一提到 Slack 有 bug,它馬上建好一張 Linear issue。
05:13延遲是最大挑戰要讓這種體驗好用,最大的阻礙是延遲,電腦大約要在一百毫秒內反應才算跟得上人。
06:45全語音對話的門檻真正流暢的語音對話,得把整條語音轉文字、推論、再轉語音的流程壓進 200 毫秒左右,非常吃緊。
07:22業界的因應架構提到 Thinking Machines 等團隊用 200 毫秒為單位切分、持續推論的架構來繞開延遲限制。
08:02改走語音進畫面出不必等新架構出現,直接切換成語音輸入、視覺輸出,因為人對畫面回饋更有耐性。
08:54技巧一:推論平台不只模型要小,平台也要以延遲為優先;GPT-5 mini 一度測到 5000~7000 毫秒的 P95 延遲,Haiku 反而穩定得多。
10:20技巧二:推論頻率不等使用者確定講完才推論,改成每一兩秒就送一次,體驗會順很多。
11:33技巧三:快取前綴讓 prompt 前 90% 的內容維持不變,才能吃到 prefix caching 帶來的速度與成本優勢。
12:58收尾與呼籲講者歡迎交流即時語音體驗的心得,也鼓勵大家動手做出好東西。

值得記的話

名詞與人物

Andrej Karpathy講者引用其近期論點的 AI 研究者,主張語音是人類偏好的輸入方式,視覺才是偏好的輸出方式。
Forestwalk Labs講者所在的公司,這場分享他們打造語音輸入、視覺輸出體驗的心得。
Thinking Machines講者點名的團隊之一,最近展示過把時間切成 200 毫秒一段、讓模型持續推論的架構,用來繞開語音延遲的限制。
GPT-5 mini講者實際測試過的模型,雖然更聰明,但 P95 延遲一度高達 5000~7000 毫秒。
Haiku講者認為在即時語音場景裡,P95 延遲比部分更大模型更穩定的模型等級。
Linear講者舉例用的專案管理工具,語音 agent 把提到的 Slack bug 直接建成一張 issue。
prefix caching講者提到的推論快取技巧:只要 prompt 前段內容每次相同,就能拿到更便宜、更快的推論。

延伸

  • Thinking Machines 那種以 200 毫秒切片、持續推論的架構,這場只帶過一句,沒有細講實際做法。
  • 講者結尾說歡迎交流即時語音體驗的心得,但沒有說明後續要怎麼聯絡或在什麼場合聊。