064 · 用心理計量學重新評測 LLM
講者借用心理計量學的 item response theory,說明只算答對題數會誤判模型實力,並示範怎麼用它稽核、精簡與保護 benchmark。
原標題:Stop Evaluating Models Like It's the 50s - Alejandro Vidal, Mindmakers
重點摘要
- 答對題數不夠用業界現在幾乎都用「答對幾題」評分模型,等於假設每題一樣重要。講者指出這個假設本身就有問題,難題和有瑕疵的題目都被同等對待。
- 借用心理計量學的 IRT講者引入 item response theory,為每一題估計難度(b)與鑑別度(a),再用這兩個參數推算模型的智力水準(theta)。同樣答對題數,theta 算出來的差距可能完全不同。
- 可以用來稽核 benchmark鑑別度低甚至為負的題目,往往代表答案標錯或題目本身有問題。講者舉了一題把「總人數」誤標成「乘客數」的例子。
- 題目可以大幅精簡只留鑑別度最高的題目,能把題庫從 484 題砍到 97 題,還維持和原本排名 99% 的相關性;隨機刪題效果差很多,但像 GPQA 這種本來就設計嚴謹的題庫,隨機刪也沒差。
- 殘差能抓污染與不一致模型「該答對卻答錯」或「不該答對卻答對」的殘差,可以用來抓資料污染、過擬合,也能抓 inference 平台設定錯誤。
- 能追出模型的血緣關係把殘差算成相關矩陣,同一個實驗室的模型、不同蒸餾版本會明顯群聚在一起,也能用來偵測未經同意的蒸餾行為。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Alejandro Vidal 說明要借用心理計量學方法,改善現行評測模型的方式。 |
| 00:17 | 答對題數的問題 | 現行做法把每題都當同等重要來計分,難題與瑕疵題都被一視同仁。 |
| 02:16 | IRT 的難度參數 | 為每題估計難度 b,畫出模型答對機率隨智力變化的曲線。 |
| 03:48 | 換算成機率 | 以 GPT-5 為例,theta 與題目難度換算出來的答對機率高達 99%。 |
| 04:43 | IRT 命名與鑑別度 | 這套方法稱為 item response theory,再加入鑑別度 a 衡量題目好壞。 |
| 06:32 | Opus 對比 Gemini | 拿 Claude Opus 4.1(245 題答對)跟 Gemini 3 Pro 比較,337 題裡答對數差不多,但換成 IRT 的智力估計,兩者差了將近一個標準差。 |
| 08:29 | 應用一:稽核題庫 | 用鑑別度找出標錯答案或有瑕疵的題目,像是把總人數誤標成乘客數的例子。 |
| 10:19 | 應用二:精簡題庫 | 只留鑑別度最高的題目,484 題砍到 97 題仍能維持 99% 的排名相關性,隨機刪題效果差很多。 |
| 13:39 | 應用三:抓異常殘差 | 用殘差找出過擬合、資料污染,也能抓到 inference 平台設定錯誤(O4-mini 最不一致)。 |
| 16:36 | 應用四:保護題庫 | 用 anchor set 與針對各組織的 fingerprint set,事後比對殘差抓出偷用題庫訓練的組織。 |
| 18:21 | 應用五:找偏誤題目 | 比較 open-weight 與 closed-weight 模型的作答曲線,抓出對特定族群比較有利的題目。 |
| 20:02 | 應用六:模型指紋 | 用殘差相關矩陣看出同實驗室、蒸餾或不同版本的模型會明顯群聚在一起。 |
| 22:06 | 結語 | 講者總結目標:用心理計量研究打開 LLM 評測的新方向。 |
| 22:25 | 未來方向 | 提到多維度模型、合併題庫、加入延遲等訊號,以及拿來衡量 alignment 與可解釋性。 |
值得記的話
名詞與人物
| Mindmakers | 講者 Alejandro Vidal 創辦的公司,這場演講觀點的出處。 |
|---|---|
| Item Response Theory(IRT) | 心理計量學裡的評測模型,用題目難度與模型能力兩組參數,取代單純算答對題數。 |
| Classical Test Theory | 目前業界常見的評分方式,也就是直接算答對題數,講者認為該被 IRT 取代。 |
| theta | IRT 裡代表模型智力水準的參數,由所有題目的作答結果一起估計出來。 |
| discrimination(鑑別度) | 每題的另一個參數,代表這題能不能有效分辨強弱模型,數值高才是好題目。 |
| anchor set / fingerprint set | 講者用來保護題庫不被外洩訓練的做法:抽出代表性題組,再針對每個組織另外挑一組專屬題目。 |
| GPQA | 講者認為設計得很嚴謹的題庫,隨機抽題和用鑑別度挑題效果差不多。 |
| epoch.ai | 提供這場示範用的真實模型評測資料的機構。 |
延伸
- 多維度與階層式的 IRT 模型,用來拆解不同任務的能力差異。
- 把延遲、token 用量等其他訊號一起納入模型能力的估計。
- 用心理計量模型衡量 alignment,並連結到可解釋性研究。