029 · 用四步驟把前沿模型換成小模型
講者示範怎麼用四步驟框架,把前沿模型換成本地端小模型,同時省成本、顧隱私,還讓回應更快。
原標題:Frontier results, on device - RL Nabors, Arize
重點摘要
- 一體適用推論的四種代價呼叫雲端前沿模型會把資料送到遠端伺服器,帶來外洩風險;回應延遲影響使用者體驗;成本隨呼叫量疊加難以控制;斷網或離線環境更是直接無法使用。
- 專用模型與 SLM 各司其職視覺、語音等任務可以交給專用模型處理;需要語言能力但不必塞進整個知識庫的場合,則交給 SLM(small language model),參數量遠小於動輒十億到兆等級的 LLM。
- SAGE 框架:先大後小先用最大的模型驗證任務可行,訂出成功標準與黃金資料集,再從小模型開始逐步往上測試,直到找到「小到剛好又夠好」的 SAGE model。
- Mima 案例:3B 的 Llama 3.2 打敗更受歡迎的候選者在討論串摘要任務上,Qwen 2.5、Qwen 3、Llama 3.2、Gemma 4 E2B 四個候選小模型互相比較,結果是 Llama 3.2 的表現最貼近 Claude Sonnet,而不是速度最快或最多人推薦的那個。
- prompt engineering 補上最後一段差距Llama 3.2 準確度原本落後 Claude Sonnet 約一成,講者測了四種 prompt 變體,發現提供範例的 few-shot 版本效果最好,再搭配後處理修正引用與長度,最終整體表現反超 Claude Sonnet,推論成本也省到接近零。
- 上線只是起點換成小模型上線之後,還要靠回歸評測(regression eval)持續監控,避免模型或 prompt 更新後效果悄悄退步。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 講者自我介紹是 RL Nabors,任職於 Arize,今天要講怎麼用本地端模型省下前沿模型的推論費用。 |
| 01:10 | 推論成本的四種代價 | 呼叫雲端前沿模型有資安外洩風險、延遲拖累體驗、成本隨用量疊加,斷網環境更是直接用不了。 |
| 03:03 | 專用模型與 SLM | 視覺、語音等任務可以交給專用模型,需要語言能力的場合則用參數量遠小於 LLM 的 SLM。 |
| 05:44 | 裝置端模型已成熟 | 小模型已經能跑在裝置上(連講者自己的手機都內建一個),研究指出 SLM 足以撐起 agentic 工作負載,還更省電。 |
| 08:28 | SAGE 框架:先大後小 | 提出先用大模型驗證可行性,正式上線再換成小模型的四步驟框架。 |
| 09:40 | 案例登場:Mima 摘要 | 以自己開發的社群整合 App「Mima」為例,要把討論串摘要功能換成本地端模型。 |
| 10:49 | 黃金資料集與指標 | 整理 14 條討論串、共 28 筆黃金資料,訂出 JSON 有效性、結構正確性、事實一致性、長度與延遲五項驗收指標。 |
| 13:15 | Phoenix 測試起點 | 用 Arize 的 Phoenix 建立 Claude Sonnet 基準(延遲 2.9 秒、成本約 0.22 美元),選出四個候選小模型。 |
| 18:02 | Llama 3.2 勝出 | 測試結果 Llama 3.2 的回應跟 Claude Sonnet 幾乎難以分辨,成為最終雀屏中選的模型。 |
| 19:23 | prompt engineering 補差距 | Llama 3.2 準確度還落後 Claude Sonnet 約一成,於是設計多種 prompt 變體來補差距。 |
| 24:09 | few-shot 版本最佳 | 四種變體中,提供討論串範例的 few-shot 版本在長度與準確度上表現最好,延遲只多了 200 毫秒。 |
| 26:58 | 後處理後反超 Claude Sonnet | 再用後處理修正引用數與長度,把 JSON 與結構正確性拉到 100%,整體表現反超 Claude Sonnet。 |
| 28:24 | 回歸評測守住成果 | 提醒換成小模型上線後,仍要持續跑回歸評測,避免模型或 prompt 更新後效果悄悄退步。 |
| 28:59 | 裝置常內建小模型 | 提到 Chrome 的 Prompt API 可以直接呼叫內建的 Gemini Nano,不需要額外部署模型。 |
值得記的話
名詞與人物
| RL Nabors | 這場演講的講者,任職於 Arize。 |
|---|---|
| Arize | 做 model 與 agent 觀測平台的公司,Phoenix 是它的開源專案。 |
| Phoenix | Arize 的開源評測工具,講者用它跑實驗、比較不同模型的表現。 |
| SLM | small language model 的縮寫,參數量約在百萬到十億等級,遠小於十億到兆等級的 LLM。 |
| SAGE model | 講者自創的說法,指小到剛好、回應品質又夠好的模型(small and good enough)。 |
| 黃金資料集 | 人工整理、當成 ground truth 的輸入輸出配對集合,這場案例用了 14 條討論串、共 28 筆資料。 |
| Mima | 講者自己開發的社群網路整合 App,這場案例的討論串摘要功能就來自它。 |
| Llama 3.2 | 3B 參數的模型,這場案例裡準確度最貼近 Claude Sonnet,最終雀屏中選。 |
延伸
- 講者提到 Chrome 的 Prompt API 可以直接呼叫內建的 Gemini Nano,但只提了一句,沒有說明實際串接方式。
- 講者提到本地端模型跑久了會耗電,但認為這是未來才要測試評估的題目,這場沒有再談。
- 講者提到用 Claude Opus 當裁判評分時,觀察到它會偏袒 Claude Sonnet 的回應,但沒有說明後續怎麼處理這種裁判偏差。