EP 502019-11-191:48:55
把公平與隱私寫進演算法
Michael Kearns
電腦科學家 Michael Kearns 談公平與隱私怎麼被寫進演算法,以及這些規則該由誰決定。
Michael Kearns: Algorithmic Fairness, Privacy & Ethics | Lex Fridman Podcast #50在 YouTube 看 ↗
重點6 條
- 量化倫理,不是替社會下判斷:Kearns 與合著者 Aaron Roth 在《Ethical Algorithm》裡想做的不是替社會定義什麼才公平,而是示範公平、隱私這些社會規範一旦被具體定義,就能寫進演算法的目標函數,變成可以測量、可以取捨的東西。
- 群體公平有死角:就算模型分別對種族、性別、年齡都做到公平,組合起來仍可能歧視某個交集群體,例如年收入偏低的身心障礙西裔女性。他把這個現象叫做「公平的傑利蠑螈」,也是他正在做的研究方向。
- 公平跟準確度常常要取捨:他把誤差與不公平畫成一條 Pareto 曲線,兩者通常無法同時降到零;曲線上該落在哪一點,他認為該由政策制定者與監管者決定,不是電腦科學家自己拍板。
- 去識別化靠不住:刪掉姓名、把年齡與郵遞區號模糊化,是最常見的去識別化做法,但資料集從來不是世上唯一的一份;Netflix Prize 拿掉姓名的評分資料,跟 IMDb 上的公開評分一比對就能還原身分;差分隱私改成比較「有你的資料」與「沒有你的資料」兩種分析結果,讓你承受的傷害不再取決於你的資料在不在裡面。
- 導航 App 把大家一起推向 Nash 均衡:他用 Google 地圖類比賽局理論——每個人都在讓演算法幫自己找最省時的路線,結果全部人一起被推向賽局理論說的均衡,但均衡不代表對所有人最好;他認為賽局理論跟機器學習裡「無悔學習」的關聯,或許是演算法賽局理論最重要的技術貢獻。
- 演算法交易先接手的是「執行」,不是判斷:他認為機器最先接手的是把大單拆開、分散到不同交易所下單這類執行問題,以及高頻交易;但像巴菲特那種看幾十年的長線判斷,需要理解政治局勢與經濟週期,他認為這類工作短期內還輪不到機器。
時間軸24 段
最愛的小說是《Infinite Jest》,場景剛好就在 MIT 附近;大學一度主修英文,後來覺得英文系只教怎麼讀、不教怎麼寫,才轉念數學與電腦科學。
他說演算法處理的往往只是路燈照得到的地方:警察如果帶著種族偏見決定攔檢誰,這份偏見進了資料,再聰明的演算法也救不回來。隱私圈已經對差分隱私這個定義有共識,公平圈卻有定理證明三個合理的公平定義不可能同時成立。
他認為多數人本性是善的,做壞事多半是情境使然;華爾街與學術圈看似格格不入,其實都各自發展出一套外人看不懂、圈內人卻覺得理所當然的行為規範。
借用大 O 記號的比喻:排序演算法有快有慢、也有多種寫法;書裡談的公平定義同樣可以量化,例如某放貸模型對黑人與白人的拒貸率差在 3% 以內,就能說是「97% 公平」。
公平的定義得先回答兩個問題:要保護哪個群體、什麼才算傷害。多數群體公平定義只能保證「假陰性率一致」,被誤拒的人得到的安慰只是「其他群體也被誤拒了一樣多」,這跟個人真正感受到的公平是兩回事。
現有的公平定義都是學者自己坐著想出來的,他的團隊開始做受試者實驗,例如在再犯預測的情境裡拿兩個人給受試者看,問他們該不該被一樣對待。他也自嘲電腦科學是「帝國主義式」的研究社群,常闖進別人研究了幾十年的領域,先出糗十年,強化學習早年就被控制理論的人說是在重造 40 年代的東西。
分別對種族、性別、年齡都做到公平,合起來看仍可能歧視某個交集群體,例如年收入偏低的身心障礙西裔女性;他們把這個現象稱為「公平的傑利蠑螈」。
隱私議題大家立場一致,都不想被侵犯;公平卻牽動平權行動這類爭論幾十年的老問題,連刑事司法的公平定義都會被質疑「只顧慮罪犯,沒顧慮被害人」。
誤差與不公平能畫成一條 Pareto 曲線,兩者通常不能同時降到零;曲線該落在哪個點,他認為不該由電腦科學家決定,而是政策制定者與監管者的責任。
以假釋預測為例,一軸是預測錯誤率,另一軸是不同種族被誤判為高風險的差距。Lex 說要消除的是法官心中的種族偏見;他補充,真正的不公可能發生在更早,某個群體早年就沒拿到一樣的資源,所以有人把公平機制當成矯正早年的不公,也有人只當成讓眼前的條件一致。
以人臉辨識為例,訓練資料若主要是白人男性,模型為了整體準確率會自然偏向多數群體;修正方法(蒐集更多少數群體資料、分開建模)都要付出額外成本,只是把成本轉嫁到別處。
他澄清書名《Ethical Algorithm》容易被誤解成「該由演算法自己決定怎樣才公平」,但他們的立場是:規範該由社會與利害關係人決定,演算法只是把談攏的規範變成可執行的東西。
他不完全把 Facebook、Twitter 的社會影響力怪罪到設計者頭上——這些平台一開始只是像 Friendster 那樣的新奇玩意兒,沒人能預見後來會左右選舉與政治討論。他也提議給使用者一個滑桿,自己決定想看多少跟自己立場不同的內容。
他認為只優化互動率讓社會落入一種各自理性、集體卻更糟的均衡;平台可以試著讓有意願的使用者多看一些不是照自己喜好挑的內容,但這會影響平台的營收。
他對符號 AI 能否幫上公平性研究沒有深入想過,但明確反對讓演算法自己學著判斷什麼才公平——目前對公平的理解還太淺,這個題目也太敏感,現階段讓演算法插手弊大於利。
兩人在這裡意見分歧:Kearns 認為電腦科學界的影響力已經大到必須主動理解社會與哲學;Lex 認為每個領域的人都該學會寫程式、用資料,力量才會落在懂那個領域的人手上。
刪姓名、把年齡與郵遞區號模糊化,是最常見的去識別化做法,問題是它假設這份資料是世上唯一的一份。Lex 提到 Netflix Prize,他說那份拿掉姓名的評分資料跟 IMDb 上的公開評分一比對,就能還原出是誰;光憑 Facebook 按讚紀錄就能相當準確推出性向、用藥習慣、父母是否離婚。
比較兩個「平行世界」:一個資料庫有你的紀錄、另一個少了你的紀錄,只要兩邊分析結果的傷害幾乎一樣,就代表你的資料沒讓你額外承擔風險;實作上是在計算裡加入雜訊,多數統計與機器學習方法都已經有能做到差分隱私的版本。
他提到 NYU 一個瀏覽器外掛,會在真正的搜尋之外偷偷發送大量無關查詢,用雜訊淹沒使用者的真實意圖。Lex 問用 bot 散布訊息算不算一種隱私,他說這個類比不算牽強,但這類混淆手法都做不到差分隱私。
他對長期演算法社會裡的隱私保持樂觀,認為會走向隱私更好、使用者對自己資料有更多控制的方向,但得靠監管與法律推著公司走;研究圈也剛開始討論讓使用者因資料被使用而拿到補償,例如罕見疾病患者的資料比較值錢。使用者若真的拿回控制權,現在靠使用者資料撐起的廣告商業模式就得整個換掉。
從囚徒困境談起,賽局理論研究的是多個各自追求自身利益的行動者,集體會走向什麼結果;他認為這個領域最重要的技術貢獻,是發現賽局理論跟機器學習裡「無悔學習」的深刻關聯。
他聊到冷戰時期 RAND Corporation 真的拿賽局理論的表格分析美蘇核武對峙,現在回頭看覺得有點天真,但畢竟後來沒有爆發核戰;他也提醒現在核武玩家變多,已經不是當年美蘇兩強的簡單賽局。
演算法最先接手的是「執行」類問題,例如把大單拆開分散下單,高頻交易靠的也是機器處理極短期數據的優勢;但像巴菲特那種看幾十年的長線判斷,需要理解政治局勢與經濟週期,這類工作他認為短期內還很安全。
他到 Harvard 跟 Leslie Valiant 讀博士,第一年從 Berkeley 的大環境換到只上電腦科學課的小圈子,很不快樂,一度認真考慮拿碩士學位回矽谷工作;直到某天在 Boston Common 想清楚眼前的不適應只是暫時的,決定撐過那個夏天,後來就一路做出興趣。