全部場數

085 · 打造看得懂實體資料的 Agent Harness

影片、感測器等實體資料規模動輒爆炸,這場示範用 Pydantic schema、執行引擎與知識庫,讓 coding agent 學會查資料而不是瞎跑。

2026-07-2027:32Dmitry Petrov(DataChain)Agent開發工具開源評估看原片

原標題:When Agents Meet Physical Data: The Other Physics of Agent Harnesses - Dmitry Petrov, DataChain

重點摘要

  • Agent 在實體資料上表現不佳Anthropic 發表的研究指出,沒有專屬資料 harness、也沒有額外 context 時,agent 處理資料任務的正確率只有 21%;OpenAI 也提出要疊六層 context 才夠用,而且那還只是有資料倉儲可查的情境。
  • 檔案數不多,物件量卻爆炸影片拆成 clip、frame、object 後,幾千支影片就能生出數百萬筆記錄,講者形容規模比太陽的質量還大。
  • 兩種常見做法都撐不住把 meta 資訊塞成一堆 JSON 檔丟在 S3,或另外蓋一套資料庫,前者拖慢速度、後者逼團隊多維護一整套技術棧。
  • 改用 Pydantic 當共同語言資料與程式碼共用同一種語言定義 schema,不用再維護獨立的 SQL 世界,DataChain 負責把它轉譯成查詢。
  • 執行引擎要能平行、能續跑處理實體資料的函式得能分散到多台機器,失敗後也要能從中斷點接著跑,否則會白白浪費運算與 token。
  • 知識庫讓 agent 記得算過什麼用一組 markdown 檔案記下資料集的來源、schema 與統計,同事之間不必重複燒一樣的昂貴運算。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場提問講者拋出問題:coding agent 處理影片、感測器等實體資料時常常出包,這場要講背後的物理與解法。
00:41兩大實驗室的示警Anthropic 發表的研究指出,沒有專屬資料 harness 時,agent 處理資料任務的正確率只有 21%;OpenAI 也說要疊六層 context 才夠用。
01:41核心論點:資料 harness講者主張 agent 除了 LLM 這顆大腦,還需要一層資料 harness,讓它能看懂、碰得到、記得住實體資料。
02:43檔案雖少,物件爆量幾千支影片拆成 clip、frame、object 後會生出數百萬筆記錄,講者形容規模比太陽的質量還大。
04:17業界兩種常見做法先把 meta 資訊塞成 JSON 檔堆在 S3,或另外蓋一套資料庫,兩種做法都拖慢速度也難維護。
04:51改用 Pydantic 當共同語言用 Pydantic 定義 schema,讓資料與程式碼共用同一種語言,不必再維護獨立的 SQL 世界。
06:10現場示範開跑在 Claude Code 裝上 DataChain 的 skill,直接下 prompt 分析一批行車影片裡的人車偵測。
08:19跑完就能秒查花 24 分鐘跑完 90 支影片的 YOLO 偵測後,查詢馬上有答案:91 支影片裡有 82 支偵測到人。
11:33攤開 agent 寫的程式碼agent 產生的程式碼核心是一份 Pydantic data model,把檔案路徑、checksum、偵測框都變成資料庫裡的一列。
13:57還需要一顆執行引擎處理實體資料要有能平行分工、能從中斷點接著跑的執行引擎,否則失敗一次就得把運算全部重來。
19:12測試比軟體世界更慢更關鍵資料任務通常只有一個正確答案,準確度比一般軟體專案更重要,但在海量資料上跑測試非常慢。
21:11Agent 學會先蓋資料層agent 被教會先確認手上有沒有合適的資料集可以一次查完,沒有就先建一層夠通用的 metadata,供之後重複使用。
23:15知識庫記住脈絡用一組 markdown 檔案記下資料集怎麼建的、schema 長怎樣、有哪些統計,讓同事不用重新燒一次運算。
27:14收尾:開源與呼籲DataChain 是開源專案,講者邀大家去看看,幫自己的 agent 補上這套物理定律。

值得記的話

名詞與人物

DataChain講者所屬公司的開源專案,這場示範的資料版本控制與 agent 資料層工具。
PydanticPython 的資料驗證函式庫,這場用它定義資料 schema,取代另外維護的 SQL 世界。
Git4Data講者過去打造的資料版本控制專案,累積了他做資料工具十年的經驗。
YOLO這場示範裡用來偵測影片中人車物件的電腦視覺模型。
Anthropic提出「agent 處理資料任務正確率偏低」研究的實驗室之一,講者多次引用其結論。
OpenAI另一間發表資料 agent 研究的實驗室,提出六層 context 的做法。

延伸

  • 講者提到 Claude Code 之外,DataChain 的 skill 也支援其他三種 coding agent,但沒有一一點名。
  • OpenAI 部落格提出的六層 context 架構,這場只提了一句,沒有攤開細節。
  • 分散式運算部分提到 Ray、Spark、Dask 等工具,但沒有比較優劣。