← 回到天際線 思考機器第 8 層 / 102

EP 572019-12-141:45:57

Alexa 副總裁談語音助理的誕生

Rohit Prasad

Amazon Alexa 副總裁暨首席科學家談 Alexa 怎麼誕生、隱私設計靠什麼原則,以及對話式 AI 目前卡在哪裡。

Rohit Prasad: Amazon Alexa and Conversational AI | Lex Fridman Podcast #57在 YouTube 看 ↗

重點6 條

  1. 超人類,不必硬裝成人類:Rohit 主張不要只用「像不像人」當標準,Alexa 能同時出現在手機、家裡、辦公室,記憶幾乎無限,這些超人類能力比模仿人性更值得善用。
  2. Alexa Prize 是為了讓學界重新有算力可用:業界把 AI 人才與計算資源都吸走後,這個年度競賽讓大學團隊能用真實使用者數據打造能聊 20 分鐘的 social bot;他估計離真正撐滿 20 分鐘還有 5 到 10 年。
  3. 隱私靠透明與控制,不是靠承諾:隱私從一開始就被當成設計原則,指示燈與實體靜音鍵在第一台 Echo 就有,用語音刪除錄音、選擇不讓人工審閱則是後來陸續加上的;至於「廣告在偷聽」的傳聞,他認為多半只是季節到了、那樣商品正熱門。
  4. 遠場語音辨識是第一道關卡:在幾公尺外聽懂人聲,當時的研究圈認為解不了。他 2013 年加入時語音辨識團隊只有六人,十個人裡有九個覺得做不到;靠自己蒐集訓練資料、押注深度學習,六個月內把錯誤率砍到五分之一,這才確信可行。
  5. 現在的瓶頸是推理,不是辨識:語音辨識與意圖理解已經很準,但要猜出使用者背後真正的目標(訂票之後要不要順便叫車、訂餐廳),Rohit 認為這跟自駕車同樣是推理與決策的問題,雖然目標比較有限,要評估的可能性一樣非常多,而這塊還在很早期。
  6. 五年內想抹掉「任務型」跟「閒聊」的界線,四十年可能都還不夠:五年的目標是讓規劃週末、安排一晚行程這類複合任務能跟 Alexa 自然完成;但整個問題他不認為四十年內解得完,因為連人腦怎麼儲存與表徵知識都還不清楚。

時間軸26 段

01 04:30
開場:像人,還是像超人類

Lex 從電影《她》的人機之戀發問,Rohit 主張與其硬套「像人」,不如承認 Alexa 本來就是超人類的存在——能同時在多處陪伴使用者、記憶趨近無限。

02 13:01
Alexa Prize:20 分鐘不冷場的挑戰

Alexa Prize 找大學團隊打造能連續對話 20 分鐘的 social bot,目前進入第三屆;他估計離真正撐滿 20 分鐘還有 5 到 10 年。

03 16:59
幽默感冒出來了

bot 開始懂得抓時機講笑話、在不熟的話題上巧妙轉開,Rohit 認為幽默本身就是高門檻的智慧表現。

04 19:07
比賽真正的目的,與對話的護欄

業界把 AI 人才與算力都吸走,Alexa Prize 是讓大學能用真實使用者數據做研究,是他在 Amazon 最喜歡的專案之一;因為裝置是全家共用的,團隊建了敏感詞與情境過濾,也限制某些話題。

05 21:35
想贏 Alexa Prize 要靠推理,不是查表

多數 bot 還停留在辨識主題、抓相關事實回應,Rohit 認為真正該做的是理解對話脈絡,而不是丟一個沾邊的冷知識。

06 23:26
怎麼玩、怎麼收集回饋

使用者說「Alexa, let's chat」進入 social bot,結束後被問 1 到 5 分會不會想再聊;這套評分機制取代了學界慣用的標註語料庫,改成直接用真實回饋訓練。

07 27:26
「給 AI 一雙眼睛」是什麼意思

Rohit 澄清這句常被斷章取義的話,重點不是少量資料,而是像人一樣靠多種感官、高效率地學習,未來研究要往少標註、弱監督的方向走。

08 29:51
Alexa 該長什麼樣子

Alexa 已經進到各種裝置與家電裡,Rohit 認為它本質上是超人類的虛擬助理,不必執著於單一實體形象;聲音才是關鍵的識別元素。

09 34:07
怎麼讓人一聽就認出是 Alexa

不同國家的 Alexa 語氣不一樣,Rohit 說光靠音色不夠,用詞、語速、抑揚頓挫都是人格的一部分。Lex 擔心個人化愈多愈難測試;Rohit 的回答是分寸看使用者,把控制權交給他們,例如 remember this 功能、用聲紋辨認家人。

10 38:51
Alexa 的身世,與信任的門檻

Lex 問 Alexa 有沒有生日、有沒有自己的故事,Rohit 說這部分還早,公司還沒定案要給它多完整的背景設定。Lex 認為最深的關係都有摩擦與張力;Rohit 說更根本的是信任,而 AI 要贏得信任的門檻比人還高。

11 45:11
隱私:兩大原則,和「一直偷聽」的迷思

Alexa 用指示燈提示錄音狀態、有實體靜音鍵、可以刪除任何一句錄音,也能選擇不讓人工審閱;Lex 舉「聊到貓毛衣就看到廣告」的傳聞,Rohit 認為多半只是季節到了、那樣商品正熱門,不是被聽到。

12 52:17
Follow-up mode 與 Alexa Guard

兩個把主動權交給使用者的功能:說完一次指令後麥克風保持開啟,方便接著加購物清單;出門時可以請 Alexa 留意煙霧警報器或玻璃破碎聲。

13 54:22
Alexa 的起點:從「星艦電腦」的願景出發

Amazon 用逆向工作法(先寫新聞稿再往回推)起頭,最初的靈感是《星艦迷航記》裡的電腦;第一個要解決的技術問題是遠場語音辨識。

14 55:24
喚醒詞偵測有多難

Alexa 這個詞的發音跟一些常見詞很像,要在嘈雜的家庭環境裡準確抓到「真的在叫它」而不是誤觸發;目標是做出遠場條件下最好的喚醒詞偵測器。抓到注意力之後,還要在幾公尺外、背景吵雜的情況下把完整句子辨識準確。

15 58:50
2013 年加入時,深度學習才剛冒頭

Rohit 2013 年 4 月加入,當時神經網路在語音辨識上剛開始展現潛力;團隊很早就押注深度學習,做了分散式 GPU 訓練,讓訓練時間跟資料量呈線性關係,是最早這樣做的研究之一。

16 1:01:31
十個人裡有九個覺得做不到

他加入時語音辨識團隊只有六人,第一次開會十個人裡九個覺得這件事做不出來、想改做電話客服語音;唯一相信的就是他,另一人半信半疑。最早讓人覺得神奇的用途是音樂,他的科學家也開始學著「先寫論文再做研究」。

17 1:04:46
先蒐集資料、定下「魔法門檻」

當時完全沒有遠場語音的訓練資料、也沒有使用者基礎,團隊自己蒐集資料,靠深度學習把錯誤率在六個月內砍到五分之一,這個成果讓 Rohit 確信這件事可行。

18 1:07:37
多領域語言理解:壓寶統計模型

早期語意理解多半靠人工撰寫的文法規則,Alexa 團隊選擇壓寶統計式的實體辨識與意圖分類,再用確定性規則補統計模型的漏洞;2014 年上線時涵蓋 13 大類技能,現在已經超過 9 萬個。

19 1:13:27
更會聊天:Alexa Conversations 上線

Rohit 說接下來要更「對話式」:那年 re:MARS 大會發布的 Alexa Conversations,讓開發者只要給幾個互動範例,系統就用遞迴神經網路自動生成多輪對話流程,不用再手刻每一種「使用者這樣說就那樣回」的邏輯。

20 1:14:48
猜使用者真正想要什麼

Rohit 舉例:查電影場次可能是想買票,也可能只是好奇電影還在不在上映;買完票之後,真正的目標也許是整晚的行程。Alexa 要學會推測這個更上層的目標,並主動接上下一步(訂票後問要不要叫車、訂餐廳)。

21 1:19:47
自我修正:用行為訊號取代人工標註

如果 Alexa 放錯歌、使用者重講一次或喊停,這個訊號會被用來自動修正、不需要人工審核;Rohit 舉電台名稱 NPR 為例,開頭的 N 常被聽成 M(他自己的口音尤其明顯),是很常見的混淆模式。

22 1:22:43
更自然:少講技能名稱、一次講完多件事

第三個方向是「更自然」:文字轉語音要聽起來更像人、不必記住技能名稱就能被找到、可以一次講完「加牛奶、加蛋、加餅乾」;目標是不管行程是用口頭記下還是在行事曆建的,問一句就答得出來。

23 1:27:37
推理與決策是最大的挑戰

基本功(單次指令一定要準)還是第一優先;再上一層是推理使用者真正的目標,跟自駕車同樣是推理與決策的問題,雖然目標比較有限、犯錯的代價沒那麼大,但每一刻要評估的可能性一樣非常多。少樣本、遷移學習都只是拼圖的一部分,要做到真正的推理,得有新的方法。

24 1:33:39
推理為什麼最難:長尾有多長

Rohit 說推理是最難的一塊,因為可能性的空間太大。Lex 認為多數需求集中在少數幾類;Rohit 同意頭部是這樣,但長尾又長又雜,連查衝浪浪況都有人做成技能,9 萬個技能光是兩兩組合就是天文數字。

25 1:37:10
五年跟四十年的路線圖

連買相機、問週末天氣背後都是多步驟的目標,五年內他希望任務型與閒聊的界線消失;但連五年的目標他也只說「希望」做得到,整個問題他不認為四十年內解得完。

26 1:41:45
收尾:打造第一個活在家裡的對話系統是什麼感覺

Rohit 說能站在這個位置很幸運,五年前他還想過要不要離開這個領域,因為找不到殺手級應用,現在影響數百萬、數十億人;他覺得研究題目只會愈來愈難、也愈值得做。