AI Engineer World's Fair Online Track 2026
2026-06-25 至 2026-07-28,共 88 場的重點、時間軸與金句。
AI Engineer World's Fair 2026 的線上議程軌,88 場演講。這是大會開放給社群投稿的那一軌,所以台上不是各家大廠的 keynote,而是工程師講自己這一年真的做出來、也真的壞過的東西。
值得整理的原因是**密度**。一場短的 4 分半、長的近一小時,中位數 18 分鐘,幾乎沒有鋪陳,上台就進主題。88 場橫跨 agent 架構、評測、檢索與記憶、開發流程、語音與多模態、還有產品上線之後才會遇到的那些事,等於一份 2026 年中 AI 工程實務的橫切面。
同一個問題常常有好幾場各給一套解法,而且彼此並不相容。光是「agent 要怎麼記住東西」就出現了知識圖譜、多組平行快取、純檔案加索引、把評測結果餵回記憶這幾種路線,各自有各自適用的前提。這種分歧本身比任何單一場次的結論都值得看,下面的跨集主題就是照這個角度分的。
來源:YouTube 播放清單 主持人:
88場筆記
1176個時間軸段落
562個名詞
1747分鐘的節目
依主題看
全部場數
共 88 場
001打造 Agent 系統的工程紀律講者以看房 agent 為例,說明系統思考、工作流程設計、模組化與威脅建模這些工程技能,如何用來打造穩定又好維護的 agentic 系統。002從答案到系統行為的評測轉型講者說明 agentic 系統的評測為何該從 model 準確率,轉向正式環境裡的系統行為與可靠度。003讓編碼代理人學會遞迴呼叫自己講者從 Recursive Language Model 出發,說明如何讓編碼代理人遞迴呼叫自己拆解任務,藉此打造更可靠的工作流程。004Agent 的身分其實是一份 Log講者主張 agent 的身分不在 model 或 runtime,而是那份可回放的事件紀錄,也就是 log。005評測抓不到的角色失真角色扮演系統演得像林肯或 Hamilton,不代表推理沒有偷渡兩百年後的觀點,講者提出可重現的評測工具,專門抓這個破綻。006多倉庫 agent 的失憶解方講者用「神燈精靈給你一個失憶版天才工程師」的比喻,拆解 agent 為何被侷限在單一 repo、又沒有跨 session 記憶,並展示他做的 meta-harness 怎麼解決。007OG Assist 上線實錄講者分享 OpenGov 用 Effect 自建 agent loop,靠評測、人工核准與沙盒撐起正式環境。008把語氣管理拆成四層架構把 AI 語氣管理拆成身分、情境、語氣、事後把關四層,系統要像帶新人一樣持續盯著,不是寫死規則就沒事。009把第二大腦變成研究記憶系統示範怎麼用純檔案加 index.yaml,把雜亂的第二大腦變成 agent 能查詢、會持續進化的知識庫。010從需求到上線的 AI 系統設計框架透過一個健康保險理賠審核系統的案例,示範如何從產品需求走到系統設計、評估與優化的完整流程。011跨文件關聯抓出隱藏詐欺把薪資、稅務、採購與交易資料串連起來比對,揪出單看任何一份文件都抓不到的合規風險與詐欺手法。012打造能自我優化的 AI agent講者以 Nearform 的專案經驗,說明如何借助 coding agent 自動優化其他 AI agent,分別處理 evals 表現差與真實用戶回饋不佳兩類問題。013幫瀏覽器 agent 換上一雙眼睛講者展示自己打造的瀏覽器 agent 基礎設施,用壓縮過的網頁表示法取代龐大 DOM,讓 agent 花更少 token 就能看懂頁面、快速完成操作任務。014打造自主工程團隊的心法她用五階段成熟度模型與 AI champions 計畫,把 3,500 人的工程團隊帶向 agent 自主交付,卻在達成後遇上裁員。015本地優先的混合 RAG 全流程從切塊策略、混合搜尋到守門邏輯,示範一套不靠額外框架、只用本地小模型撐起來的 RAG 聊天機器人架構。016用 HTML 取代畫布做簡報Nori 執行長主張,讓 agent 做簡報該用 HTML 而不是畫布類工具,因為 HTML 才是它真正擅長的語言。017動手打造隨身 OpenClaw 終端機物理博士用 OLED 與電子紙做出雙螢幕終端機,操控 OpenClaw 與開源模型,也做成文字 RPG 遊戲機。018研究原型交棒進生產程式碼的三槓桿Higharc 研究工程師分享如何用文件、monorepo 架構與 PR 拆解三個槓桿,把機器學習研究原型交棒給軟體工程師做成正式產品代碼。019用 Docling 把非結構化文件變好用紅帽工程師示範用開源工具 Docling,把 PDF、圖片、表格轉成 Markdown 與 JSON,讓 RAG 與 agent 能穩定讀懂企業文件。020百工具陷阱與語意路由解法把所有工具塞進每次請求會拖垮準確率與延遲,改用語意路由按需注入工具能解決這個問題。021把評測結果餵回 agent 記憶這場說明多數 agent 失敗在檢索而非生成,並介紹用 utility score 讓記憶跟著執行結果持續學習的做法。022先把規格寫好,再讓 AI 動手AWS 的 Erik Hanchett 說明 spec-driven development 怎麼用需求、設計與測試文件,讓 AI 寫出的程式碼更可靠、更好維護。023語音輸入、視覺輸出的延遲攻防語音輸入常常又慢又卡,這場改用視覺輸出撐住即時感,也整理出三個壓低延遲的實作技巧。024自建本地索引砍九成 AI 成本分享兩位工程師如何自建本地程式碼索引,把送給 AI 工具的 context 砍到剩不到一成,還能維持九成搜尋準確度。025多組平行快取取代知識圖譜文件全都相關又常被取代時,簡單 RAG 太陽春、知識圖譜太貴,改用多組平行快取搭配探索式 supervisor 解題。026省 token 的五個實用技巧AWS 資深開發者關係工程師用五分鐘示範五招降低 agent 的 token 成本,從快取到修剪對話歷史都涵蓋。027寫出好 skill 的四個檢查點這場整理出一套判斷 skill 好壞的檢查清單,涵蓋觸發方式、內部結構到最後的精簡技巧,都是可以直接照做的具體做法。028打造能撐住 agent 的基礎設施講者說明自主 AI agent 上線後,真正的挑戰不是模型智慧而是可靠度,並主張用控制平面架構收斂機率性模型。029用四步驟把前沿模型換成小模型講者示範怎麼用四步驟框架,把前沿模型換成本地端小模型,同時省成本、顧隱私,還讓回應更快。030讓 Agent 自動建、測、修 AgentMutagent 兩位創辦人示範怎麼用 agent 接手建 agent、eval、診斷到優化的整套流程。031領域專用 agent 的組合戰略講者主張用一群各自專精、以自然語言溝通的小型 agent,取代疊滿功能的單一大型 agent,換取更低成本與更好的擴展性。032用模擬讓 agent 從建置走向設計Resonate 創辦人說明如何用確定性模擬環境,讓 agent 從建置系統進化到真正參與系統設計。033強化學習修復 ETL 管線故障用強化學習加上安全層與規則防護,自動判斷並修復 ETL 資料管線故障,把平均修復時間從兩天半壓縮到幾分鐘內完成。034找對問題比寫程式更值錢寫程式不再是瓶頸,讀懂客戶需求才稀缺;用故事地圖、價值架構設計找回分析師工具箱,才能打造真正值得做的東西。035用 Boundary 重現失控的 Agent講者說明為什麼把溫度歸零救不了失控的交易 agent,重點該放在記錄每個節點、讓失敗可以重播除錯。036介面卡在批次時代提示詞看似進步,本質仍是穿孔卡式的批次流程;講者主張該讓 AI 學會即時參與對話,不必等人打包完整指令。037打造可驗證、不退步的 agent 學習迴圈講者說明如何把正式環境裡未被驗證的失敗,轉成可重播、可驗證的學習環境,讓 agent 只進步、不退步。038MCP App 的介面設計與上架心法從介面元件、雙向通訊到動態探索,拆解 MCP App 的運作原理,以及在三大商店上架的實際流程。039上線後才是真正的開始介紹如何靠自建的 log 監控、PR 審查與使用者模擬三層系統,揪出 agent 上線後看不見的失敗並持續修好。040把 AI 產品講成一個故事示範用「傷口、卡進腦袋、轉變前後」三步驟,把複雜的 AI 產品說成買家秒懂又想買的故事。041一個月全員 vibe coding 實驗Automattic 產品設計師參加公司一個月的自由開發實驗,從只會審 PR 到獨立打造並上線三個 AI 產品。042從固定 harness 走向自適應工程AI 工程正從固定 harness,走向讓多個 agent 自行演化出協作結構的 adaptive engineering,以應對混亂多變的真實世界。043打造能辨別、不照准的系統Duolingo 工程師以偽造作弊訊號的實驗,揭露審核員照准 AI 判斷的自動化偏誤,並提出改善介面設計的具體原則。044個人品牌是新創被低估的優勢AI 讓內容氾濫的年代,Evil Martians 顧問點出:創辦人親自經營個人品牌,才是新創最容易被忽略的成長槓桿。045打造會精準檢索的知識型 Agent講者說明為什麼模型推理進步飛快、檢索能力卻停滯不前,並介紹如何用專屬 harness 與強化學習,訓練出更懂檢索的 agent。046型別化 SDK 收服失控編碼代理分享 Watershed 如何用型別化 SDK 與確定性執行,讓編碼代理在複雜碳排圖編輯任務中,變得可信任又可驗證。047十億 Token 規模的 Agent 大考驗Abundant AI 工程師介紹 SWE Marathon:把 coding agent 評測拉到專案規模,最強配置也只能解四分之一任務,驗證機制才是真正瓶頸。048交付管線已死:軟體走向千人千面AI 讓生成程式碼幾乎零成本,這場主張軟體不必再凍結成單一版本,可以為每個使用者即時分岔、各自演化。049七步打造更聰明的 harness講者用同一段修 bug 任務,讓同一顆模型換上七種不同的 harness,示範表現如何從完全不能動手一路進化到能自我優化。050一人管理三機 agent 艦隊的教訓Kyle 獨自維運三台機器上的 AI coding agent 艦隊,從一人扛三角色到分層管理、跨機協調的實戰整理。051用活化差異抓出 LLM 後門微調後的模型能騙過所有監控,講者示範怎麼比對基座與微調模型的活化值差異,揪出藏在裡面的後門。052委派型 AI 產品的四個關鍵組件Filed 共同創辦人以銀行業的三層演化與輸送帶比喻,說明委派型 AI 產品該具備哪四個關鍵組件,以及該換成哪個成長指標。053打造分身部隊的開發心法這場 workshop 記錄講者如何用 OpenClaw、cmux 與 Agent Orchestrator 串起多重 agent 分工,並拿捏授權與監督的分寸。054獨自打造 agent 逼出的五道關卡獨立打造 agent 系統的人,最終都會被逼著重造一套更糟的 CI/CD,這場示範怎麼用五道關卡守住輸出品質。055五招工程解法終結 Agent 幻覺講者以同一個旅遊訂房 agent 為例,示範五個把幻覺轉成工程問題的技巧,並說明如何搬上正式環境。056工廠養出的記憶大腦印度百人工廠沒有資料科學團隊,用 36 個分工明確的 agent 與夜間記憶整理,把三代人的經驗變成可傳承的系統。057TypeScript 稱霸應用層從 GitHub 語言排行與 coding agent 的崛起出發,主張 TypeScript 正逐步取代 Python,成為 AI 應用層的首選語言。058用 RLM 化解大型程式碼庫的上下文問題Superagentic 創辦人 Shashi 說明如何借助 RLM(遞迴語言模型)的概念,讓 coding agent 在大型程式碼庫裡有效管理上下文,並用自家開源工具 RLM code 做現場示範。059五個訊號,算出 PR 的審查債AI 寫程式碼讓 PR 暴增,但沒人真的在審查,這場示範怎麼用五個訊號把審查債換算成具體數字。060五十萬顆感測器逼瘋 LLMPhaidra 工程師拆解如何用樹狀索引與結構化查詢,讓 LLM 面對數十萬顆設備時仍能精準回答查詢。061AI 抓漏洞時代的資安因應前沿模型抓漏洞的能力大躍進,講者主張把關鍵開源函式庫改寫成記憶安全語言才是根本解法。062打造 agent 版的開放網路基礎建設Project Nanda 主張為 agent 打造像 web 一樣開放的基礎建設,讓不同平台的 agent 能互相發現、交易與協作,不再受困於封閉花園。063Agent 何時才算真正完成這場拆解「完成」背後藏著的多重營運主張,說明 Paperclip 如何用 liveness 模型,在讓 agent 持續推進與確保品質之間抓平衡。064用心理計量學重新評測 LLM講者借用心理計量學的 item response theory,說明只算答對題數會誤判模型實力,並示範怎麼用它稽核、精簡與保護 benchmark。065圖結構實戰:從食譜到程式碼查詢從食譜抽取、實體去重到程式碼庫查詢,用具體例子拆解怎麼設計圖結構,讓 AI 應用更聰明、成本更低、也更可靠。066Agent 也需要功能旗標把網頁工程用了十年的 canary、kill switch 搬進 agent 的六種行為介面,用真實翻車案例說明為什麼要能在幾秒內喊停。067為科學協作打造 agent 收據協定光靠給 agent 更多工具,無法讓科學研究自動化擴大規模,講者提出開源協定 Froglet,讓 agent 之間能用可驗證收據交易資料與服務。068階層式拆解如何生出研究假設Radicait 工程師講如何用階層式拆解問題,讓 coding agent 在醫學影像研究中生出人類等級的假設。069內容工程:結構才是稀缺資源從手工內容到 AI 生成,Matt Palmer 認為程式碼已經很便宜,真正稀缺的是結構與嚴謹的維護能力。070打造高信號回饋的自我優化迴圈用單一標籤分類任務測試 agent 自我優化迴圈,說明多數領域沒有明確對錯,得先設計出高信號評估標準才能真正持續改進。071從租用到自建的推論基礎設施創辦人自曝推論費用一路燒到失控,再用三個企業案例說明企業何時該停止租用、自己蓋基礎設施。072打造使用者不討厭的 AI 體驗模型能力已經夠強,真正拉開差距的是使用者體驗;講者用五個面向整理出讓使用者敢用、會用 AI 功能的設計原則。073幫 Agent 裝上一顆存檔鍵講者示範用 checkpoint 與重播,幫 agent 補上存檔鍵,讓開發者能事後測試換模型、換工具會不會改變結果,而不是只憑一次重播下結論。074把 eval 做到真正有用Lyft 資料科學團隊拆解如何把客服 AI agent 的評測做到真正有用,而不是虛高又不可操作的分數。075讓 agent 每週自動抓效能債HUD 的共同創辦人分享如何用 agent 自動化 production 效能調查,把難以排進行程的效能債變成每週可信賴的報告。076單細胞基礎模型的資料難題講者從單細胞生物學出發,說明現有基礎模型如何處理基因表現資料,並指出資料異質性為何限制模型表現。077舊授權模型接不住 agent從一次延遲異常追出根本問題:agent 既不是人、也不是決定性的程式,舊的身份驗證模型完全撐不住。078把模型輸出變成能用的介面講者說明如何用 contract、streaming、BFF 三個模式,把模型輸出接成使用者真正能用的介面。079打造看懂買家的 GTM agent講者拆解 signals、buyer intelligence、action 三層架構,示範 AI agent 如何在買家上門前先摸清底細並自動回應。080語音 Agent 的搶話時機拿捏AWS 兩位工程師拆解語音 agent 搶話問題,比較 VAD、STT 內建偵測與 SmartTurn 三種做法的取捨。081別讓 LLM 自己決定下一步用狀態機與 harness 收回 model 的自主權,讓語音教學 agent 換上小 model 也能穩定上完一堂課。082企業 Agent 的三大結構破口從 Tesla 資料工程師的角度,拆解企業資料 agent 常答錯的三個根源:來源模糊、脈絡老化、偏好難捕捉。083用多代理系統急救 Spark 任務Pinterest 工程師分享怎麼把 Spark 故障診斷,從單一 prompt 逐步演化成可觀測、可測試的多代理系統。084Skills 時代的 Context 與護城河context window 用久會變笨,skills 靠漸進式揭露省 token,正成為企業 AI 的新護城河。085打造看得懂實體資料的 Agent Harness影片、感測器等實體資料規模動輒爆炸,這場示範用 Pydantic schema、執行引擎與知識庫,讓 coding agent 學會查資料而不是瞎跑。086AI agent 判斷不一致怎麼辦從情緒分析與資安警示的案例出發,說明 AI agent 為何對同樣輸入給出不同判斷,並用 active learning 找出爭議案例,靠語意記憶與情節記憶補上判斷一致性。087小模型撐起即時語音家教把規劃與判斷都搬出語音模型之外,讓小模型也能在毫秒內開口,撐起一場即時語音家教。088讓 AI agent 接手效能除錯Netflix 工程師分享如何用 AI agent 讀效能剖析資料、揪出壞的程式碼模式,做到自動生成修復用的程式碼審查。