005 · 評測抓不到的角色失真
角色扮演系統演得像林肯或 Hamilton,不代表推理沒有偷渡兩百年後的觀點,講者提出可重現的評測工具,專門抓這個破綻。
原標題:The Miranda Hypothesis: How Hamilton Poisoned Persona Evals - Jacob E. Thomas, Results Gen
重點摘要
- 面具與鏡子現行角色扮演評測只衡量像不像(面具),卻沒有機制檢查這是不是這個人在那個時間點真正會有的想法(鏡子),兩者是各自獨立的性質。
- Miranda 假說訓練語料裡文化強勢的再現(例如百老匯音樂劇)遠多於一手史料,模型只能輸出依顯著度加權後的綜合人格,講者以此命名這套機制。
- 對齊反而放大失真講者主張後訓練與強化學習不會把模型拉回史實,因為人類標註者本身就帶著同一套文化想像,結果只是把大眾已經相信的版本再強化一次。
- 微調比 context window 更不透明把史料當微調資料,會把文化色彩更深地揉進權重、無法稽核;放進 context window 則讓文件保持完整,可以隨時回頭查驗。
- 稜鏡實驗講者與歷史學者合作,把林肯拆成四個立場明顯不同的時刻,設計出可公開重現的三條件、三軸評分工具,並邀請其他團隊一起驗證。
- 專家是建置期的關卡,不是常駐成本領域專家只需要在建立評分規則與黃金測試集時介入一次,之後變成上線前的關卡,不必守在每一次推論現場。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場示範 | 講者展示 Character AI、Hello History 等角色扮演平台,並用自建的 Companion 框架讓 Claude Opus 4.7 扮演林肯,回答總統何時能不經國會開戰。 |
| 03:42 | 核心提問 | 這類系統已被大量評測,但講者真正想問的是:這些評測到底在量什麼。 |
| 04:23 | IN-CHARACTER 評測 | 業界標竿評測讓系統的人格擬真度拿下 80%,但同一套系統演出的 Hamilton,卻像從百老匯音樂劇裡走出來的角色。 |
| 05:31 | 講者背景 | 講者原是行為流行病學研究者,現與歷史學者 Rick Halpern、Sean Martin 合作,把人文方法帶進評測設計。 |
| 06:40 | 三代研究進程 | 角色扮演代理人的研究歷經樣板、模仿、認知模擬三個階段,一代比一代擬真,衡量的卻始終是像不像。 |
| 09:06 | 面具與鏡子 | 現行評測只看得到「面具」:流暢與人格一致;卻從不追問這是不是這個人在那個時間點真正會有的想法,也就是「鏡子」。 |
| 13:00 | 對照示範 | 對照音樂劇台詞與模型扮演的 Hamilton,模型對奴隸制的回答被磨平成單一清楚立場,略去史料裡真正有爭議的部分。 |
| 16:13 | Miranda 假說 | 訓練語料裡文化強勢的再現遠多於一手史料,模型只能輸出依顯著度加權後的綜合人格,講者稱之為 Miranda 假說。 |
| 19:40 | 對齊放大失真 | 講者主張後訓練與強化學習不會把模型拉回史實,反而會放大失真,因為人類標註者本身就帶著同一套文化想像。 |
| 22:21 | 提出知識模擬 | 講者提出角色扮演的第四階段:推理只能依附一手文獻、鎖定特定時間點,並交由該領域專家評判。 |
| 26:44 | 重新定義單位 | 對角色扮演系統而言,「agent」一詞不準確;講者改用五個元件組成的角色扮演語言系統,人格存在於配置而非模型權重。 |
| 28:12 | 兩種架構的取捨 | 把史料當微調資料會把文化色彩更深地揉進權重、變得無法稽核;放進 context window 則讓文件保持完整,可以隨時回頭查驗。 |
| 32:05 | 可及性的意義 | context window 只需要識讀能力與一個前沿模型的免費額度,微調卻需要 GPU 與機構資源,這決定了誰有資格參與這項技術。 |
| 33:38 | 稜鏡比喻與林肯 | 講者用稜鏡比喻測量工具,把林肯拆成 1847、1858、1860、1862 到 65 年四個立場不同的時刻,測試模型能不能把它們分開。 |
| 41:01 | 三軸評分規則 | 評分規則把「去時代錯置」訂為 40% 權重,刻意不獎勵聽起來像不像林肯,只看推理有沒有守住史料界線。 |
| 49:14 | 六步驟邀請 | 講者公開六步驟協定,邀請其他團隊換一個人物、找對應領域專家寫題目,一起在平行實驗裡驗證假說。 |
| 52:14 | 專家只把關建置期 | 講者強調領域專家不必守在每次推論現場,只要建好評分規則與黃金測試集,之後就是上線前的關卡。 |
| 54:59 | 起點是一間病房 | 這套方法其實源自一次失敗嘗試:想用語言模型幫失智症患者說話,卻只做出一個像卻不是本人的文化綜合體。 |
值得記的話
名詞與人物
| Role-Playing Language Agent(RPLA) | 讓模型扮演真實或虛構人物、以第一人稱回應的系統,是這場演講討論的對象。 |
|---|---|
| IN-CHARACTER | 業界常用的角色扮演評測基準,以人格擬真度打分,講者質疑它量不到史實忠誠度。 |
| Miranda 假說 | 講者提出的假說:訓練語料裡文化強勢的再現(如音樂劇)會蓋過一手史料,讓模型輸出綜合人格。 |
| Mask and mirror | 講者的核心框架:「面具」是聽起來像不像,「鏡子」是這個人在當下真的會不會這樣想。 |
| Epistemic simulation | 講者提出的角色扮演第四階段:推理只能依附一手文獻、鎖定特定時間點,交由專家評判。 |
| Algorithmic sycophancy | 講者用來描述後訓練放大文化偏誤的說法:模型被獎勵去迎合使用者已經相信的版本。 |
| Anachronism detection | 講者評分規則中權重最高的一項,檢查角色的用語與邏輯有沒有超前於他所在的年代。 |
| Character AI、Hello History | 講者開場展示的兩個角色扮演對話平台,分別偏娛樂社交與教育導覽。 |
| Companion | 講者自己開發的開源角色扮演提示框架,示範中用 Claude Opus 4.7 執行。 |
| Rick Halpern、Sean Martin | 講者合作的歷史學者與圖書館員,分別負責出題與審定評分規則。 |
延伸
- 講者引用的規模數據:某語料庫涵蓋近 18,000 個角色、取材自數百本書,搭配的 700 億參數模型在三項基準上打平或贏過 GPT-4o。
- Varnum 等人提出的 time-locked models:把訓練語料鎖在人物在世的年代之前,講者認為方向嚴謹,但仍無法避免綜合人格。
- 2026 年一篇 Nature Medicine 研究:通用前沿模型在 12 家診所的醫師覆核任務上,表現優於專門微調過的臨床 AI 工具。