← 回到天際線 思考機器第 16 層 / 102

EP 812020-03-191:38:33

人機互動與獎勵函數的設計難題

Anca Dragan

Berkeley 教授談人機互動:機器人該怎麼理解人的偏好,又該怎麼設計出真正管用的獎勵函數。

Anca Dragan: Human-Robot Interaction and Reward Engineering | Lex Fridman Podcast #81在 YouTube 看 ↗

重點6 條

  1. 人機互動不是單機器人問題:她定義的人機互動不談外觀或對話介面,而是機器人一旦要在人身邊行動,就必須理解、滿足使用者的偏好,不再只是完成工程師寫定的目標。
  2. 理解人的方法從理性假設一路修正:逆強化學習先假設人完全理性,後來加進 Boltzmann 理性容許一點雜訊;操作月球著陸器這類複雜任務時,人的雜訊大到連這套修正也失靈。她後來換個假設:人可能是在自己對物理的直覺下做出合理的選擇,照這個模型去修正指令後,受試者真的把著陸器降落在兩面旗子之間,她說這不是定論,只是證據。
  3. 機器人可以主動出手蒐集資訊:不必只被動觀察,車子換車道時可以先靠近一點,看旁邊駕駛會不會減速,藉此推斷對方的駕駛風格是保守還是積極。
  4. 設計獎勵函數本身就很難:就算拿掉互動這塊,獎勵還是很難寫對;她調成本函數調了十年,還是很難事先想到每一種情境。兩人談到 Goodhart's law:一個指標一旦變成被優化的目標,就不再是好指標。
  5. 人會用行動洩漏自己要什麼:被人推開、被按下緊急停止鈕,甚至家裡鞋子被擺整齊,都是機器人可以拿來學習使用者偏好的訊號。
  6. 機器人三大法則不該寫死:她認為與其固定規則,不如讓機器人把工程師給的獎勵函數當成某個情境下的證據,持續調整對「使用者到底想要什麼」的理解。

時間軸26 段

01 02:22
從數學奧林匹亞到機器人

她在羅馬尼亞念數學奧林匹亞出身,Carnegie Mellon 是唯一錄取她的學校;2014 年在 Berkeley 搭 Google 自駕車,看它一個接一個做對決定,讓她大受震撼。Spot Mini 讓人覺得「活了過來」則是 Lex 自己的經驗。

02 07:35
最愛的機器人 WALL-E

她最愛的虛構機器人是 WALL-E,先生後來自己做了一台會動的 WALL-E(七個自由度)向她求婚,肚子打開,裡面是一個樂高做的盒子。

03 09:47
動作也是一種語言

機器人光靠動作就能傳達內在狀態;她也提到有報導說小孩會對 Alexa 沒禮貌,因為 Alexa 從不會生氣。

04 13:58
她定義的人機互動

她研究的人機互動不談外觀或聊天,而是機器人不再獨自行動,必須滿足使用者的偏好,不是工程師寫定的目標。

05 16:36
從效用最大化到雜訊理性

逆強化學習從人的行為反推獎勵函數,最早假設人完全理性,後來加入 Boltzmann 理性容許選擇帶一點雜訊。

06 20:42
模型失靈的地方

操作月球著陸器這類遊戲或機械手臂等複雜任務時,人的雜訊大到模型抓不住;行為經濟學也指出人本來就會用捷思、不理性。

07 23:03
用行動換取資訊

機器人不必只被動觀察,可以主動出手蒐集資訊,例如換車道時先靠近一點,看旁邊駕駛會不會減速,藉此判斷對方是保守還是積極。

08 26:46
人也許在別的假設下是理性的

與其說人不理性,不如假設人在自己的信念下是理性的:對物理的直覺、規劃的視野、甚至還在摸索自己想要什麼。她用直覺物理模型修正月球著陸器的操作,受試者成功降落在兩面旗子之間,她說這不是定論,只是證據。

09 32:05
她的研究範圍

她的研究刻意跨領域但聚焦演算法基礎,不管是自駕車、四旋翼還是機械手臂,背後想解決的是同一套人機互動原理。

10 34:16
人也在對機器人建模

人類同樣會對機器人的意圖形成信念,她的團隊用貝氏更新描述這個過程,讓機器人能選擇讓自己的行為更容易被理解、不那麼令人困惑。

11 37:34
機器人會不會變成「他者」

Lex 擔心機器人正在成為人類歷史上一再出現的「被排斥的他者」;她認為人會回應自信,也會回應脆弱,就算知道情緒是假的,人還是忍不住擬人化。

12 40:45
互動本質是賽局

自駕車要把乘客送到目的地,旁邊的人類駕駛也有自己的目標,兩邊部分重疊(都不想撞車)但不完全一樣,協調的過程其實是在找一種賽局均衡。

13 43:09
欠驅動的人類

她提出機器人學的「欠驅動」概念來比喻人:你無法直接控制對方,只能影響對方的決定。Lex 接著分享自己觀察行人過馬路的心得,以及一位跑者給他的建議:跑步時不跟人對眼,大家反而會讓路。

14 45:54
Jim Keller 的彈道說

Lex 提到 Jim Keller 認為開車本質上是彈道學問題,可以忽略人的因素;Lex 自己則猜測人的因素會讓難度高出一個數量級以上,並問她怎麼看。

15 47:01
拿掉行人,市中心就解決了

她的思想實驗:把舊金山市中心的人、車、腳踏車全部拿掉,開車問題基本上已經解決;感知也大致到位,市區車速慢不算危險,危險的是高速公路上人類看得很清楚、系統卻可能漏看的邊緣情況。她說不用光達「有點不負責任」,但也說那是個人意見,純視覺她了解得不夠。

16 55:00
學習與規則之外的第三條路

她認為學習免不了,但規劃、搜尋、最佳化是很有用的工具;純模仿學習遇到分布外情境會失靈,強化學習又得靠模擬,而模擬終究要靠某種人類行為模型撐起來。

17 1:02:09
怕死要不要寫進獎勵函數

Lex 問常識推理、對死亡的恐懼是不是也得明確寫進模型;她認為理性框架本身已經隱含自我保存,因為死掉就沒辦法再去追求任何目標。

18 1:05:01
半自動駕駛的隱憂

Lex 問 Autopilot、Super Cruise 這類半自動系統;她擔心其中部分系統暗自假設「監督」跟「駕駛」一樣安全;Lex 拿自己蒐集的大量駕駛數據反駁,說監督者的人反而更專注,她同意這確實可能,但仍主張系統設計要讓人真正保持投入。

19 1:10:58
設計獎勵函數本身就很難

就算拿掉互動的部分,獎勵還是很難寫對:她以機械手臂的運動規劃為例,自己調成本函數調了十年,還是很難想到每一種情境。兩人談到 Goodhart's law:指標一旦變成目標,就不再是好指標。

20 1:15:34
設計獎勵也是一種人機互動

工程師給的獎勵函數不該被當成法律條文,而是某個情境下「他想要什麼」的證據,機器人該推論設計者真正的用意。

21 1:17:54
人會洩漏出自己要什麼

被人推開、被按下緊急停止鈕,都是機器人可以學習的訊號;就連家裡鞋子被擺整齊,也透露了使用者在意什麼。

22 1:22:04
機器人三大法則不該寫死

她認為與其固定三大法則,不如讓機器人持續調整對獎勵函數的理解,把設計者給的目標當成證據,而不是絕對答案。

23 1:27:03
高中那份 AI 課本 PDF

她高三在羅馬尼亞拿到一份《Artificial Intelligence: A Modern Approach》的 PDF,當時對 AI 一無所知;吸引她的是:給一個目標,機器就能自己在複雜的情境裡想出一連串決策。

24 1:28:54
只剩五年會怎麼過

如果只剩五年可活,她說大概不會改變什麼,頂多多去幾趟加勒比海,還是做讓自己快樂的事,包含研究本身。

25 1:32:54
忘不了的一位老師

一位高中物理老師免費幫她補習、鼓勵她申請國外大學,改變了她後來的路。

26 1:34:29
人生意義:天文館裡的多重宇宙

一次天文館經驗讓她感受到人類在宇宙尺度下微不足道,於是決定把心力放在自己能真正影響到的朋友、家人與在地社群。