← 回到天際線 思考機器第 5 層 / 102

EP 502019-11-191:48:55

把公平與隱私寫進演算法

Michael Kearns

電腦科學家 Michael Kearns 談公平與隱私怎麼被寫進演算法,以及這些規則該由誰決定。

Michael Kearns: Algorithmic Fairness, Privacy & Ethics | Lex Fridman Podcast #50在 YouTube 看 ↗

重點6 條

  1. 量化倫理,不是替社會下判斷:Kearns 與合著者 Aaron Roth 在《Ethical Algorithm》裡想做的不是替社會定義什麼才公平,而是示範公平、隱私這些社會規範一旦被具體定義,就能寫進演算法的目標函數,變成可以測量、可以取捨的東西。
  2. 群體公平有死角:就算模型分別對種族、性別、年齡都做到公平,組合起來仍可能歧視某個交集群體,例如年收入偏低的身心障礙西裔女性。他把這個現象叫做「公平的傑利蠑螈」,也是他正在做的研究方向。
  3. 公平跟準確度常常要取捨:他把誤差與不公平畫成一條 Pareto 曲線,兩者通常無法同時降到零;曲線上該落在哪一點,他認為該由政策制定者與監管者決定,不是電腦科學家自己拍板。
  4. 去識別化靠不住:刪掉姓名、把年齡與郵遞區號模糊化,是最常見的去識別化做法,但資料集從來不是世上唯一的一份;Netflix Prize 拿掉姓名的評分資料,跟 IMDb 上的公開評分一比對就能還原身分;差分隱私改成比較「有你的資料」與「沒有你的資料」兩種分析結果,讓你承受的傷害不再取決於你的資料在不在裡面。
  5. 導航 App 把大家一起推向 Nash 均衡:他用 Google 地圖類比賽局理論——每個人都在讓演算法幫自己找最省時的路線,結果全部人一起被推向賽局理論說的均衡,但均衡不代表對所有人最好;他認為賽局理論跟機器學習裡「無悔學習」的關聯,或許是演算法賽局理論最重要的技術貢獻。
  6. 演算法交易先接手的是「執行」,不是判斷:他認為機器最先接手的是把大單拆開、分散到不同交易所下單這類執行問題,以及高頻交易;但像巴菲特那種看幾十年的長線判斷,需要理解政治局勢與經濟週期,他認為這類工作短期內還輪不到機器。

時間軸24 段

01 02:36
從英文系到電腦科學

最愛的小說是《Infinite Jest》,場景剛好就在 MIT 附近;大學一度主修英文,後來覺得英文系只教怎麼讀、不教怎麼寫,才轉念數學與電腦科學。

02 06:18
演算法只照得到路燈下

他說演算法處理的往往只是路燈照得到的地方:警察如果帶著種族偏見決定攔檢誰,這份偏見進了資料,再聰明的演算法也救不回來。隱私圈已經對差分隱私這個定義有共識,公平圈卻有定理證明三個合理的公平定義不可能同時成立。

03 07:39
人性本善嗎

他認為多數人本性是善的,做壞事多半是情境使然;華爾街與學術圈看似格格不入,其實都各自發展出一套外人看不懂、圈內人卻覺得理所當然的行為規範。

04 13:13
什麼是「合乎倫理」的演算法

借用大 O 記號的比喻:排序演算法有快有慢、也有多種寫法;書裡談的公平定義同樣可以量化,例如某放貸模型對黑人與白人的拒貸率差在 3% 以內,就能說是「97% 公平」。

05 17:42
要保護誰、什麼算傷害

公平的定義得先回答兩個問題:要保護哪個群體、什麼才算傷害。多數群體公平定義只能保證「假陰性率一致」,被誤拒的人得到的安慰只是「其他群體也被誤拒了一樣多」,這跟個人真正感受到的公平是兩回事。

06 20:19
公平該去問一般人

現有的公平定義都是學者自己坐著想出來的,他的團隊開始做受試者實驗,例如在再犯預測的情境裡拿兩個人給受試者看,問他們該不該被一樣對待。他也自嘲電腦科學是「帝國主義式」的研究社群,常闖進別人研究了幾十年的領域,先出糗十年,強化學習早年就被控制理論的人說是在重造 40 年代的東西。

07 25:33
群體公平的死角

分別對種族、性別、年齡都做到公平,合起來看仍可能歧視某個交集群體,例如年收入偏低的身心障礙西裔女性;他們把這個現象稱為「公平的傑利蠑螈」。

08 30:16
隱私有共識,公平沒有

隱私議題大家立場一致,都不想被侵犯;公平卻牽動平權行動這類爭論幾十年的老問題,連刑事司法的公平定義都會被質疑「只顧慮罪犯,沒顧慮被害人」。

09 33:43
公平的代價:Pareto 曲線

誤差與不公平能畫成一條 Pareto 曲線,兩者通常不能同時降到零;曲線該落在哪個點,他認為不該由電腦科學家決定,而是政策制定者與監管者的責任。

10 38:26
假釋預測的例子

以假釋預測為例,一軸是預測錯誤率,另一軸是不同種族被誤判為高風險的差距。Lex 說要消除的是法官心中的種族偏見;他補充,真正的不公可能發生在更早,某個群體早年就沒拿到一樣的資源,所以有人把公平機制當成矯正早年的不公,也有人只當成讓眼前的條件一致。

11 41:36
偏誤怎麼跑進來的

以人臉辨識為例,訓練資料若主要是白人男性,模型為了整體準確率會自然偏向多數群體;修正方法(蒐集更多少數群體資料、分開建模)都要付出額外成本,只是把成本轉嫁到別處。

12 44:28
分裂政治氣候下怎麼辦

他澄清書名《Ethical Algorithm》容易被誤解成「該由演算法自己決定怎樣才公平」,但他們的立場是:規範該由社會與利害關係人決定,演算法只是把談攏的規範變成可執行的東西。

13 46:34
社群平台不是設計出來的意外

他不完全把 Facebook、Twitter 的社會影響力怪罪到設計者頭上——這些平台一開始只是像 Friendster 那樣的新奇玩意兒,沒人能預見後來會左右選舉與政治討論。他也提議給使用者一個滑桿,自己決定想看多少跟自己立場不同的內容。

14 52:12
只優化互動率的代價

他認為只優化互動率讓社會落入一種各自理性、集體卻更糟的均衡;平台可以試著讓有意願的使用者多看一些不是照自己喜好挑的內容,但這會影響平台的營收。

15 58:02
演算法該不該自己決定公平

他對符號 AI 能否幫上公平性研究沒有深入想過,但明確反對讓演算法自己學著判斷什麼才公平——目前對公平的理解還太淺,這個題目也太敏感,現階段讓演算法插手弊大於利。

16 1:01:26
電腦科學家該更哲學,還是人人該學寫程式

兩人在這裡意見分歧:Kearns 認為電腦科學界的影響力已經大到必須主動理解社會與哲學;Lex 認為每個領域的人都該學會寫程式、用資料,力量才會落在懂那個領域的人手上。

17 1:05:46
去識別化為什麼不可靠

刪姓名、把年齡與郵遞區號模糊化,是最常見的去識別化做法,問題是它假設這份資料是世上唯一的一份。Lex 提到 Netflix Prize,他說那份拿掉姓名的評分資料跟 IMDb 上的公開評分一比對,就能還原出是誰;光憑 Facebook 按讚紀錄就能相當準確推出性向、用藥習慣、父母是否離婚。

18 1:11:49
差分隱私的定義與機制

比較兩個「平行世界」:一個資料庫有你的紀錄、另一個少了你的紀錄,只要兩邊分析結果的傷害幾乎一樣,就代表你的資料沒讓你額外承擔風險;實作上是在計算裡加入雜訊,多數統計與機器學習方法都已經有能做到差分隱私的版本。

19 1:19:07
用雜訊混淆偏好

他提到 NYU 一個瀏覽器外掛,會在真正的搜尋之外偷偷發送大量無關查詢,用雜訊淹沒使用者的真實意圖。Lex 問用 bot 散布訊息算不算一種隱私,他說這個類比不算牽強,但這類混淆手法都做不到差分隱私。

20 1:22:32
隱私的資料所有權

他對長期演算法社會裡的隱私保持樂觀,認為會走向隱私更好、使用者對自己資料有更多控制的方向,但得靠監管與法律推著公司走;研究圈也剛開始討論讓使用者因資料被使用而拿到補償,例如罕見疾病患者的資料比較值錢。使用者若真的拿回控制權,現在靠使用者資料撐起的廣告商業模式就得整個換掉。

21 1:27:51
什麼是賽局理論

從囚徒困境談起,賽局理論研究的是多個各自追求自身利益的行動者,集體會走向什麼結果;他認為這個領域最重要的技術貢獻,是發現賽局理論跟機器學習裡「無悔學習」的深刻關聯。

22 1:34:59
賽局理論撐得住核武嚇阻嗎

他聊到冷戰時期 RAND Corporation 真的拿賽局理論的表格分析美蘇核武對峙,現在回頭看覺得有點天真,但畢竟後來沒有爆發核戰;他也提醒現在核武玩家變多,已經不是當年美蘇兩強的簡單賽局。

23 1:36:55
演算法交易到長線判斷

演算法最先接手的是「執行」類問題,例如把大單拆開分散下單,高頻交易靠的也是機器處理極短期數據的優勢;但像巴菲特那種看幾十年的長線判斷,需要理解政治局勢與經濟週期,這類工作他認為短期內還很安全。

24 1:44:16
Boston Common 的那個春天

他到 Harvard 跟 Leslie Valiant 讀博士,第一年從 Berkeley 的大環境換到只上電腦科學課的小圈子,很不快樂,一度認真考慮拿碩士學位回矽谷工作;直到某天在 Boston Common 想清楚眼前的不適應只是暫時的,決定撐過那個夏天,後來就一路做出興趣。