全部場數

064 · 用心理計量學重新評測 LLM

講者借用心理計量學的 item response theory,說明只算答對題數會誤判模型實力,並示範怎麼用它稽核、精簡與保護 benchmark。

2026-07-1323:34Alejandro Vidal(Mindmakers)評估研究模型看原片

原標題:Stop Evaluating Models Like It's the 50s - Alejandro Vidal, Mindmakers

重點摘要

  • 答對題數不夠用業界現在幾乎都用「答對幾題」評分模型,等於假設每題一樣重要。講者指出這個假設本身就有問題,難題和有瑕疵的題目都被同等對待。
  • 借用心理計量學的 IRT講者引入 item response theory,為每一題估計難度(b)與鑑別度(a),再用這兩個參數推算模型的智力水準(theta)。同樣答對題數,theta 算出來的差距可能完全不同。
  • 可以用來稽核 benchmark鑑別度低甚至為負的題目,往往代表答案標錯或題目本身有問題。講者舉了一題把「總人數」誤標成「乘客數」的例子。
  • 題目可以大幅精簡只留鑑別度最高的題目,能把題庫從 484 題砍到 97 題,還維持和原本排名 99% 的相關性;隨機刪題效果差很多,但像 GPQA 這種本來就設計嚴謹的題庫,隨機刪也沒差。
  • 殘差能抓污染與不一致模型「該答對卻答錯」或「不該答對卻答對」的殘差,可以用來抓資料污染、過擬合,也能抓 inference 平台設定錯誤。
  • 能追出模型的血緣關係把殘差算成相關矩陣,同一個實驗室的模型、不同蒸餾版本會明顯群聚在一起,也能用來偵測未經同意的蒸餾行為。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Alejandro Vidal 說明要借用心理計量學方法,改善現行評測模型的方式。
00:17答對題數的問題現行做法把每題都當同等重要來計分,難題與瑕疵題都被一視同仁。
02:16IRT 的難度參數為每題估計難度 b,畫出模型答對機率隨智力變化的曲線。
03:48換算成機率以 GPT-5 為例,theta 與題目難度換算出來的答對機率高達 99%。
04:43IRT 命名與鑑別度這套方法稱為 item response theory,再加入鑑別度 a 衡量題目好壞。
06:32Opus 對比 Gemini拿 Claude Opus 4.1(245 題答對)跟 Gemini 3 Pro 比較,337 題裡答對數差不多,但換成 IRT 的智力估計,兩者差了將近一個標準差。
08:29應用一:稽核題庫用鑑別度找出標錯答案或有瑕疵的題目,像是把總人數誤標成乘客數的例子。
10:19應用二:精簡題庫只留鑑別度最高的題目,484 題砍到 97 題仍能維持 99% 的排名相關性,隨機刪題效果差很多。
13:39應用三:抓異常殘差用殘差找出過擬合、資料污染,也能抓到 inference 平台設定錯誤(O4-mini 最不一致)。
16:36應用四:保護題庫用 anchor set 與針對各組織的 fingerprint set,事後比對殘差抓出偷用題庫訓練的組織。
18:21應用五:找偏誤題目比較 open-weight 與 closed-weight 模型的作答曲線,抓出對特定族群比較有利的題目。
20:02應用六:模型指紋用殘差相關矩陣看出同實驗室、蒸餾或不同版本的模型會明顯群聚在一起。
22:06結語講者總結目標:用心理計量研究打開 LLM 評測的新方向。
22:25未來方向提到多維度模型、合併題庫、加入延遲等訊號,以及拿來衡量 alignment 與可解釋性。

值得記的話

名詞與人物

Mindmakers講者 Alejandro Vidal 創辦的公司,這場演講觀點的出處。
Item Response Theory(IRT)心理計量學裡的評測模型,用題目難度與模型能力兩組參數,取代單純算答對題數。
Classical Test Theory目前業界常見的評分方式,也就是直接算答對題數,講者認為該被 IRT 取代。
thetaIRT 裡代表模型智力水準的參數,由所有題目的作答結果一起估計出來。
discrimination(鑑別度)每題的另一個參數,代表這題能不能有效分辨強弱模型,數值高才是好題目。
anchor set / fingerprint set講者用來保護題庫不被外洩訓練的做法:抽出代表性題組,再針對每個組織另外挑一組專屬題目。
GPQA講者認為設計得很嚴謹的題庫,隨機抽題和用鑑別度挑題效果差不多。
epoch.ai提供這場示範用的真實模型評測資料的機構。

延伸

  • 多維度與階層式的 IRT 模型,用來拆解不同任務的能力差異。
  • 把延遲、token 用量等其他訊號一起納入模型能力的估計。
  • 用心理計量模型衡量 alignment,並連結到可解釋性研究。