名詞速查

88 場提到的 562個名詞,同一個詞被好幾場講到就併在一起,各自連回原場。

562 個

MCP

Model Context Protocol,Block 與 Anthropic 合作設計,Goose 是它最早的 client 實作之一。 014

Model Context Protocol,這場提到 Anthropic 用它做 on-demand tool loading 的案例。 020

Model Context Protocol,讓 AI 模型呼叫外部工具與服務的通訊協定。 038

這場提到的伺服器類型之一,被列為還卡在 Mac 上、還沒抽象化掉的本機限定工具。 050

Froglet 可以作為 MCP server 讓 agent 呼叫,是這場示範裡 Claude 用來連接本機服務的介面 067

讓 agent 存取外部工具與資料的協定,這場點出它常曝露過多工具給 agent。 077

Model Context Protocol,定義 agent 能呼叫哪些外部工具,與 skills 是互補而非取代的關係 084

Claude Code

講者舉的例子:目前若在 permission prompt 卡住時 process 死掉,恢復後 prompt 會消失,用來說明現有 harness 沒有把 log 當第一等公民。 004

講者示範中使用的 coding agent,負責寫 target agent 的程式碼,也讀取 eval 與 trace 回饋來自我修正。 012

講者提到自己每天在用的 AI 編碼工具之一。 024

worker 實際執行寫碼工作所用的工具,本身也能再開出 agent 與 subagent。 053

HUD 這套自動化流程指定使用的 coding agent。 075

OpenClaw

講者用來操控自己 agent 的專案,這場的裝置就是替它做的實體遙控器 017

講者用來統籌任務、串接多個開發 agent 的工具,決策依據是任務脈絡與歷史,而不是程式碼本身。 053

可自行架設的 agent gateway,讓使用者用自己的伺服器連上既有工具與應用程式。 062

講者列為缺少 kill switch 而出事的案例之一,這場沒有進一步說明細節 066

一個開源 agent 專案,具備自我修復與自寫 skill 的能力,也曾因缺乏隔離而出現安全事故 084

Codex

講者示範中拿來跟 Claude 對照的另一款 agent,展示同一個 session 可以換不同 agent 接手。 006

講者提到用來做自動化 code review 的工具,找出問題後還能讓另一個 agent 自動修正並提交。 014

講者目前主要拿來當預設 orchestrator 模型的程式模型,版本用到 5.3。 053

講者用來跑自主優化迴圈、產生階層文件的 coding agent。 068

Andrej Karpathy

講者引用其近期論點的 AI 研究者,主張語音是人類偏好的輸入方式,視覺才是偏好的輸出方式。 023

開場提到的 auto-research repo 作者,示範用 coding agent 對 metrics 做 hill climb 優化。 068

講者提到今年稍早引爆「自動改進」話題討論的人物。 070

GraphRAG

用 LLM 讀過文件抽出實體與關係、建成知識圖譜,再靠圖譜跨文件回答問題的做法。 025

把資料建成知識圖譜,讓 model 寫 Cypher 查詢語言直接對整個資料集做運算,取代只撈片段的向量 RAG。 055

這場一開始就聲明不深入的技術,用圖結構強化檢索增強生成。 065

RAG

用外部知識庫補足 LLM 既有知識的做法,這裡指檢索臨床指引與理賠政策 010

先檢索相關資料再交給 LLM 生成答案的架構,這場用來示範企業文件問答。 019

先把文件轉成向量存進資料庫,依查詢相似度取回內容再交給 LLM 回答的基本檢索做法。 025

ACE

Ornella 與 Joel 做的即時 AI 語音家教,能從頭到尾穩定上完一堂完整的課。 081

講者建的即時語音 AI 家教產品,這場的示範主體。 087

BM25

用來做關鍵字比對的稀疏檢索演算法,負責抓完全命中的詞,例如商品編號或藥名 015

偏好關鍵字重疊程度的傳統檢索方法,講者認為主流 benchmark 的題型設計其實在偏袒它。 045

DGX Spark

NVIDIA 出的小型 AI 運算主機,是裝置背後真正跑模型與 agent 的算力來源 017

講者用來自建本地推論的機器,提到跑的時候遇到記憶體容量是瓶頸,後來拿來跑自己研究室要用的 agent。 071

DSPy

Stanford 的宣告式 LM 程式框架,原始 RLM 論文的 rlm 實作即建在其上。 003

Omar 開發的另一個熱門框架,內建了自己的 RLM 實作,但跟 RLM code 是各自獨立的專案。 058

Docling

把 PDF、PowerPoint、Word 等文件轉成 markdown 的工具,是這套流程的第一步 015

講者展示的開源文件轉換工具,屬於 Linux Foundation 旗下專案,能把 PDF 等格式轉成 Markdown、JSON 或 Pydantic 資料型態。 019

Erik Hanchett

AWS 資深 developer advocate,這場的講者,有 15 年以上軟體開發經驗。 022

AWS 的資深開發者關係工程師,這場的講者。 026

GPT-5 nano

這次實驗中被優化的 agent 所用的小型便宜模型,講者挑它就是要看很小很便宜的模型能被優化到什麼程度。 070

demo 中用來取代原模型的便宜選項,用以測試換模型後的行為差異。 073

Haiku 4.5

講者提到的一款較小型 model,因為每一步輸入都收得很窄,改用它也能撐住 ACE 的表現,藉此省成本、省時間、省延遲。 081

示範對比中換上的小型模型,搭配 state machine 後大約九百毫秒就能開口回答。 087

LangGraph

OG Assist 早期用的 agent 框架,後來換成自建的 effect-native loop。 007

講者用來串起模擬使用者與 agent、跑出多輪對話紀錄的框架。 074

Langfuse

講者用來追蹤每次對話用了什麼模型、回傳哪些片段、花多少延遲與成本的觀測工具 015

開源的 LLM 觀測與評估平台,講者任職的公司。 070

LoRA

low-rank adaptation,限制可調整參數範圍的微調方式,讓 model 層的更新更便宜、更安全。 037

只調整部分參數的輕量微調方式,這場拿來跟 full-rank 微調比較後門殘留程度。 051

MCP(Model Context Protocol)

目前最成熟的 agent 工具串接協定,但講者認為它只解決了工具分發,不是完整答案。 031

把 Spark 相關的資料資源(log、metrics)以工具形式暴露給 LLM 呼叫的協定,是整個系統最早的雛型基礎。 083

Mem0

講者提到市面上另一套 agent 記憶方案,只會擷取事實與偏好,不會依執行結果調整。 021

講者提到用來記住使用者偏好的 agent memory 工具,但她認為它仍無法分辨該用哪個指標。 082

Obsidian

Paul 存放筆記的本機 markdown 工具,在這套系統裡是不可變動的原始筆記快照。 009

講者用來展示元件階層文件關聯圖的筆記軟體。 068

Ollama

讓聊天模型與嵌入模型都能在本機執行的工具,這場的示範全程沒有呼叫外部 API 015

講者用來在本機跑視覺語言模型、替圖片產生描述的工具。 019

ReAct

講者用來說明 agent 基本運作方式的架構:推理、呼叫工具,執行成一個迴圈,任務完成就停下來。 021

Reason and Act 的縮寫,讓 agent 不斷「推理、行動、觀察結果、再推理」的循環模式。 049

Strands Agents

AWS 推出的 agent 開發框架,這場所有程式碼範例都用它示範。 026

AWS 維護的開源 agent framework,這場所有 demo 都用它打造旅遊訂房 agent。 055

YC

講者提到自己曾協助 YC(Y Combinator)新創、安全組織與 AI 團隊做同樣的產品故事化方法。 040

Y Combinator,文中提到創辦人待過 YC 後留在舊金山,募資速度會加快 044

harness

讓 stateless 的 LLM 變得可用的外部結構,包含 system prompt、agents.md/CLAUDE.md、tool calling 與角色分工 042

包住 model 的外部程式邏輯,負責驗證 model 回傳的內容、推進狀態、決定下一步,讓 model 只需要完成眼前這一步。 081

harness engineering

講者收尾提出的概念,指打造一個讓 coding agent 能可靠工作的環境:給足限制、任務、回饋迴圈與治理。 012

講者提出的做法:把控制流程做在 model 外面,每一步只餵給 model 那一步需要的最少輸入,model 負責提議、harness 負責決定。 081

skills

可依關鍵字或指令啟動的說明文件,建立設計文件或執行任務時都能派上用場。 022

用來捕捉、記住使用者個人做事習慣與偏好的機制,讓 agent 照使用者的方式完成工作。 052

state machine

ACE 背後的設計方式:把一堂課拆成一格一格的狀態,每個狀態規定 model 能做什麼、結果怎麼驗證。 081

把教學情境的判斷與流程規劃寫進程式,取代模型即時推理的做法。 087

tau-bench

講者引用的評測基準,用來說明模型的自我一致性有多低。 073

Sierra AI 提出的評測框架,讓 agent 跟模擬使用者互動產生對話再打分,這場的離線模擬架構參考它。 074

1200 億參數的開源 GPT 模型

講者現場示範時接的模型,他只說了參數量與「開源 GPT」,沒有點出正式名稱 017

2PRD

講者的 skill,能把目前對話的內容整理成一份產品需求文件(PRD) 027

A2UI

Google 提出的開放規格,把 UI 描述成一份元件清單資料,交由 client 用自己的原生元件畫出來。 078

AGENTS.md

講者在系統每一層放置的說明檔,記錄工作流程、政策與記憶維護方式,讓人與 agent 都能快速上手。 001

AI Research OS

兩人開源釋出的 repository,把這場示範的技能包成 Claude Code plugin。 009

AI Socratec

一個全球性的 AI 開發者社群,每月聚會討論 AI 近況,講者是它的歐盟大使。 057

AI champions

講者從 3,500 人裡挑出約 50 位跨團隊工程師組成的計畫,負責先把自己的 repo 與工作流程改造成對 agent 友善。 014

ARC-AGI-3

Arc Prize 團隊主辦的推理評測,Symbolica 團隊用 RLM harness 拿下遠高於其他前沿模型的分數。 003

AWS Glue

AWS 的 ETL 服務,這場架構裡負責跑資料任務,任務失敗時發出事件。 033

AWS Lambda

無伺服器運算服務,這裡用來執行 agent 的判斷與修復邏輯。 033

Aadhaar

印度的官方身分識別文件,講者用「下載自己的 Aadhaar」當第一個示範案例。 013

Abundant AI

講者任職的公司,為 Frontier Labs 打造 reinforcement learning 環境。 047

Adaptive Probabilistic Risk Model

框架的第二個元件,綜合多項風險訊號算出信心分數,判斷哪些關聯值得優先調查。 011

Aditya Bhargava

這場講者,Etsy 的 staff engineer,也是該公司 agentic commerce 專案的負責人,agency 語言的作者。 049

Agent Facts

經過簽章、記錄某個 agent 是誰、能做什麼的可信資料,讓其他 agent 查驗身份。 062

Agent Orchestrator

講者 fork 的開源框架,用來管理底層負責實際寫碼的 worker agent。 053

Agent2Agent(A2A)protocol

Google 提出的 agent 溝通協定,OpenGov 用它定義 agent 路由與 schema。 007

Alan Kay

電腦科學家,講者引用他「simple things should be simple, complex things should be possible」這句話,說明 agency 的設計哲學。 049

Algorithmic sycophancy

講者用來描述後訓練放大文化偏誤的說法:模型被獎勵去迎合使用者已經相信的版本。 005

Alithea Bio

講者任職的公司,專注 immuno-oncology 與 immunopeptidomics 等生命科學領域,並提供 agentic AI 服務 067

Altos Labs

講者任職的生技新創公司,目標是透過細胞回春技術逆轉老化相關疾病與失能。 076

Amazon Bedrock AgentCore

AWS 的正式環境 agent 執行平台,這場示範把工具呼叫、guardrail 規則等元件搬上去落地生產。 055

Amazon EventBridge

AWS 的事件匯流排服務,接住 Glue 的失敗事件並觸發 Lambda。 033

Amazon Lens

Amazon app 裡的相機功能,讓使用者用照片、截圖或條碼找出外觀相似的商品。 078

Anachronism detection

講者評分規則中權重最高的一項,檢查角色的用語與邏輯有沒有超前於他所在的年代。 005

Annicha Labs

講者 Rajiv Chandegra 任職的公司,聚焦多 agent、多人、跨機構協作 042

Anthropic

提出「agent 處理資料任務正確率偏低」研究的實驗室之一,講者多次引用其結論。 085

Arc AGI

講者提到的一項 benchmark,設計前提正是 agent 沒辦法對空間做推理。 016

Arize

做 model 與 agent 觀測平台的公司,Phoenix 是它的開源專案。 029

Athena

Era 裡負責統籌、召集其他 agent 開會討論的角色。 056

Aurelio Labs

開源 semantic router 專案的作者,講者說這套可以自己在本機跑來做 benchmark。 020

AutoAgent

講者依 AutoResearch 的想法做出的系統,讓 coding agent 自動跑 evals、改 target agent 的程式碼、提示詞與工具。 012

AutoResearch

Andrej Karpathy 做的迴圈,自動改機器學習程式碼與超參數,證實 coding agent 能自行把模型準確率調高。 012

Automattic

WordPress.com、Jetpack、WooCommerce、Tumblr、Beeper 等品牌背後的母公司,全公司約 1400 人,完全遠端、非同步協作 041

Ax

TypeScript 陣營的 DSPy 變體,支援讓一個 agent 直接寫出呼叫另一個 agent 的介面,可以遞迴到底。 003

BERT 式的單細胞基礎模型

講者拿來對照的另一條路線,用遮蔽訓練的方式學細胞表現,他沒有點出是哪一款 076

BFF(Backend for Frontend)

介於模型輸出與畫面之間的伺服器層,負責依平台規則組裝畫面、加上互動行為,讓 client 端保持單純。 078

BGE-M3

講者用來把文件內容轉成向量、存進資料庫的嵌入模型 015

Bala Ramdoss(Amazon Lens)

講者,在 Amazon Lens 團隊做了六年相機購物功能,這場經驗來自自己開發的多款 agentic 功能。 078

BaxBench

ETH Zurich 與 UC Berkeley 研究團隊做的程式漏洞評測基準。 061

Bene

Mutagent 的 CEO 兼共同創辦人,這場開場與整體流程說明由他主講。 030

Berkeley function calling leaderboard

講者用來評測工具選擇準確率的公開資料集之一。 020

Block

講者任職的公司,旗下有 Square、Cash App、Afterpay 等品牌,這場要轉型的正是它 3,500 人的工程組織。 014

Bloom

講者建立的婚禮會場 AI 對話平台,同一套四層架構套用在不同場地上。 008

Boris Cherny

講者開場引用的人物之一,說自己已經不寫 prompt、只設計 loop;同段還引用了 Peter Steinberger。 070

BrainOS

講者把整套 agent 架構抽出來做成的開源版本,提供空白的系統骨架讓其他公司灌入自己的知識。 056

Braintrust

提出研究,指出換成便宜模型可能只是帳面好看的假性經濟。 073

Bright Data

被提到可以用來爬任意單頁應用網站的服務,講者沒有展開細節。 009

BrowseComp Plus

OpenAI 原始 BrowseComp 的定量版本,語料庫固定為十萬份文件,用來測試複雜的瀏覽型查詢。 045

BuilderBot

champions 與工程師自建的 orchestrator,能協調多個 agent 並行工作,公司裡任何人都能在 Slack 呼叫它執行任務。 014

Bun

JavaScript runtime,講者提到 2025 年 12 月被一家 AI lab 收購,當作 AI 業界押注 JavaScript 生態系的例子。 057

Burak

Mutagent 的 CTO,負責深入講解各階段細節,也負責現場示範。 030

Business Model Canvas

講者提到的另一項分析師工具,跟故事地圖一起被歸類為「分析師工具箱」。 034

CAG(Cache-Augmented Generation)

不做檢索,直接把整批文件塞進大 context window 並快取起來,讓模型直接看到全部內容回答問題。 025

CI

持續整合流程,這場用來說明多個 repo 同時有多條 CI 時該怎麼判斷責任歸屬。 006

CLAUDE.md

Claude Code 讀取的專案層級指示檔案,屬於固定載入進 context 的「instructions」部分 084

CLI harness

Kyle 為了逼 agent 只能把工作分派給 worker、而不是自己動手做,設計出的一套只能透過 CLI 呼叫的技能限制。 050

Callstack

講者任職的公司,也是這個專案背後的技術孵化器支持方 017

Carmack

開場比喻裡提到的工程師,用來代表「頂尖能力」的參照對象。 006

Cartesia

提供語音轉文字與合成服務的公司,STT 內建 turn detection,講者量到的 p50 延遲約 300 毫秒 080

Character AI、Hello History

講者開場展示的兩個角色扮演對話平台,分別偏娛樂社交與教育導覽。 005

Chronicle

這場講者做的概念驗證工具,用 boundary annotation 記錄 agent 每個節點的輸入輸出,把整個 run 凍結成一筆可重播的 trace。 035

Chunkless RAG

不使用 chunker、embedding model 或向量資料庫,改成直接在文件大綱裡搜尋最相關段落來回答問題的做法。 019

Classical Test Theory

目前業界常見的評分方式,也就是直接算答對題數,講者認為該被 IRT 取代。 064

Claude

講者在示範案例中拿來操作瀏覽器的模型。 013

Claude 4.7

講者提到的 Anthropic 頂尖模型,用來說明為什麼直接拿它做語音家教會太慢。 087

Claude Opus 4.8

這次實驗中負責分析錯誤、提出 prompt 修改的優化者模型。 070

Claude、ChatGPT

講者舉的兩個基礎模型例子,用來說明 agentic 功能動手前先列步驟給使用者核准已是常見設計。 072

ClickHouse

HUD 用來存放與查詢 production 資料的列式資料庫,查詢語法和一般 SQL 不太一樣。 075

Cloudmanate

Diane Lin 共同創辦的公司,做的是用 AI agent 自動分類資安警示,後來被 Datadog 收購。 086

Co-authored trailer

commit message 裡標記共同作者的欄位,這場拿它當偵測 AI 參與 PR 最強的訊號之一。 059

Companion

講者自己開發的開源角色扮演提示框架,示範中用 Claude Opus 4.7 執行。 005

Conductor

講者任職的公司,他在此負責開發者體驗。 069

Context a8c

Automattic 內部的 MCP 伺服器,讓 AI 工具讀得到公司多年累積的文件與資料;講者每天用它做研究與規劃 041

Context engineering

篩選並安排資訊進入 LLM context 的時機與內容,避免一次把所有東西都塞給模型 084

Context7

講者提到的替代方案,他認為不如直接把整個開源 repo 拉進 session,讓 agent 讀真正的原始碼。 006

Control flow

流程順序由設計或程式碼預先定好,LLM 只負責其中特定任務 010

CopilotKit

一家做 Generative UI 相關產品的公司,把 Generative UI 分成三層開放程度的說法出自它。 078

Corridor

講者創辦的資安新創,專注在守住 AI 寫程式的安全性。 061

Cross-Jurisdictional Normalization

框架的第三個元件,把不同國家的貨幣、稅制、申報標準統一,讓風險評估在跨轄區時保持一致。 011

Cursor

AI coding 工具公司,2025 年 4 月其支援機器人曾捏造不存在的政策回覆使用者 066

Cypher

圖資料庫常用的查詢語言,這場拿它跟 SQL 對照,突顯圖查詢在多層關聯上比較直覺。 065

DNS AID

讓既有網站用原本的網域,把 agent 掛進網路探索系統的方式。 062

DOM

網頁的完整結構化表示,講者拿它跟自己壓縮過的頁面表示法比較 token 用量。 013

DORA metrics

Google 發布的軟體交付研究指標,2026 年版本用來說明 AI 採用對個人效率與團隊穩定性的影響。 075

DX

另一個引用來源,涵蓋 16 個月、400 個組織的長期工程資料研究,用來佐證 PR 規模與速度的變化。 059

DataChain

講者所屬公司的開源專案,這場示範的資料版本控制與 agent 資料層工具。 085

Datadog

收購 Cloudmanate 的可觀測性與資安平台公司,Diane Lin 目前在此帶領 agent 開發工作。 086

David Cramer(Sentry)

這場引用的創辦人之一,談到只要能待在舊金山、不管旁人怎麼說都該留下來的人脈效應 044

DeepAgents library(LangGraph)

團隊拿來重建 harness 的多代理框架,內建待辦清單、虛擬檔案系統等機制,讓每個 agent 專注在自己的 prompt 與工具上。 083

DeepEval

團隊最早拿來當基準的一套現成評測指標庫,後來發現分數太籠統、看不出該怎麼改善。 074

DeepSeek V4 Flash

講者拿來與 Fable 5 比較成本的小型模型,用於示範領域專用場景可以改用便宜很多的模型。 031

Deepgram Nova 3

Deepgram 的語音轉文字模型,同樣內建 end-of-turn 判斷,p50 約 250 毫秒 080

DevRel

開發者關係工作,講者曾在 Replit 負責這個職務。 069

Devon

講者舉例用的具體人設,用來取代空泛的「AI software engineer」說法,讓聽眾腦中能浮現畫面。 040

Diane Lin

Datadog 自我演進 agent 開發的負責人,這場演講的講者,先前共同創辦資安新創 Cloudmanate。 086

Discord

這場提到的最終統一遙控入口,Kyle 在每台機器各接一支 bot,讓手機變成整支艦隊的遙控器。 050

Docling MCP Server

讓 AI agent 透過 Model Context Protocol 呼叫 Docling 的文件處理功能。 019

Docling Serve

把 Docling 包成 REST API 服務,可以用容器或 Kubernetes 部署,一次處理大量文件。 019

Domain-specific agent

講者主張的核心概念:針對單一領域打造的小型完整 agent,彼此用自然語言溝通協作。 031

DoorDash

案例公司,靠重播客服對話做模擬驗證,把測試時間從數小時縮到 5 分鐘。 073

Dotta

Paperclip 的創辦人,這場的講者。 063

Duolingo English Test(DET)

Duolingo 推出的線上英語能力測驗,全程遠端監考,供全球約 6000 個機構採用作為入學或簽證依據 043

Dvorak/Colemak

重新排列按鍵位置的鍵盤配置方案,訴求比標準鍵盤更省手指力氣。 036

Dynamic workflows

Claude Code 近期推出的功能,讓 Claude Code 也具備類似 RLM 的動態工作流程能力。 003

EARS format

Kiro 產生需求文件時用的格式,文件會有 introduction、使用者故事等段落。 022

ECAG

這場的核心解法,把 CAG 延伸成多組平行快取搭配一個探索式 supervisor,因應資料集常態替換的情境。 025

ESP32

裝置內部採用的雙核心微控制器(MCU),負責畫面渲染與電源管理 017

ETL

Extract、Transform、Load 的縮寫,這場要修復的正是這種資料處理管線的失敗。 033

EU AI Act

歐盟的 AI 監管法案,講者列為要求企業具備旗標與稽核能力的法規壓力之一 066

Effect

TypeScript 函式庫,agents team 用它打底,涵蓋 schema、追蹤、並行等功能。 007

Entity Correlation Engine

框架的第一個元件,把跨系統的人、帳戶、交易資料串成關聯網路,回答「什麼跟什麼有關」。 011

Epistemic simulation

講者提出的角色扮演第四階段:推理只能依附一手文獻、鎖定特定時間點,交由專家評判。 005

Era

講者與團隊對這套多 agent 系統的稱呼,被當成正在養的東西看待,而不是一般軟體。 056

Evil Martians

講者所屬的開發者工具顧問公司,這場提到的 PMF Compass 由他們開發 044

F1 score

準確率與召回率的綜合指標,這場報告的框架達到 0.89。 011

Fable 5

講者用來對比成本的大型模型,同一項任務比 DeepSeek V4 Flash 貴上 137 倍。 031

Faithfulness

用來評估回答是否真的根基於檢索到的臨床指引與政策內容 010

Faros AI

追蹤工程團隊生產力與 AI 採用狀況的基準機構,這場多次引用它 2026 年的報告數據。 059

Filed

講者創辦的公司,替美國稅務專業人士打造 AI agent 產品,目前已募資超過 $17 million。 052

Forestwalk Labs

講者所在的公司,這場分享他們打造語音輸入、視覺輸出體驗的心得。 023

Forrester

講者引用其 2026 年研究數據,說明多數 B2B 買家已在接觸業務前完成大半決策。 079

Foss

講者提到的合作夥伴,兩人一起打造這套本地程式碼索引工具。 024

Freshworks

講者先前任職的公司,曾在此打造服務千萬級使用者的身份驗證平台。 077

Froglet

講者團隊打造的開源協定,讓 agent 之間能發現、交易並取得可驗證收據 067

GAN

把 CT 影像轉成 PET 影像所用的一種生成模型架構,由編碼器與解碼器組成。 068

GEPA

一種對 prompt 做搜尋、評分並保留贏家的 harness 層優化方法。 037

GEPA optimizer

agency 內建的自我優化功能,能自動改寫標記過的 prompt,用量測分數取代人工試錯。 049

GPQA

講者認為設計得很嚴謹的題庫,隨機抽題和用鑑別度挑題效果差不多。 064

GPT-5 mini

講者實際測試過的模型,雖然更聰明,但 P95 延遲一度高達 5000~7000 毫秒。 023

GPT-5.5 Pro

講者用來生成假設、評論實作成效的模型,測試時運算量較大。 068

Gabe De Mesa

OpenGov 的軟體工程師,agent 團隊成員,這場的講者。 007

Garcia v. Character.AI

對 Character.AI 提起的訴訟案,講者同樣列為監管壓力的例子 066

Geneformer

講者提到的一款把細胞當句子、基因當 token 的 transformer 基礎模型,用於單細胞資料的預訓練。 076

Generative UI

把模型輸出轉成畫面元件這件事的統稱,依模型能自由發揮的程度分成 controlled、declarative、open-ended 三層。 078

Git4Data

講者過去打造的資料版本控制專案,累積了他做資料工具十年的經驗。 085

GitHub Agentic Workflows

這套週跑效能巡檢系統採用的排程與 workflow 框架,實際跑在 GitHub Actions 上。 075

Glue Data Catalog

AWS Glue 底下管理資料表結構的目錄服務,這場用它當作讀取目前 schema 的來源之一。 033

Goose

Block 內部自建的 coding agent,起步早於業界主流 agent 工具,也是 MCP client 最早的參考實作之一。 014

Guardrails

為輸入輸出設下界線,擋掉無關或有害內容,也抓出沒有附引用的回答 010

HUD

May 共同創辦人的公司,做給 coding agent 用的 production runtime intelligence 層,能捕捉 function 層級與深度鑑識脈絡。 075

HackerOne

漏洞懸賞平台,講者高中時期曾擠進全球百大駭客排名。 061

Haiku

講者認為在即時語音場景裡,P95 延遲比部分更大模型更穩定的模型等級。 023

Harbor

SWE Marathon 所有任務共用的執行格式。 047

Harness Bench

用來比較不同 harness 表現的評測,同一顆模型換上不同 harness,分數落差可以超過 20 個百分點。 049

Harrison

這場引用他的一句話來說明 agent 的行為要等上線才知道;講者沒有進一步介紹他的身分。 039

Headroom

Netflix 開源的 token 管理專案,被講者拿來當作 JustTokenMax 的效能比較基準。 071

Henry Ford

講者引用的歷史類比:只問顧客要什麼,顧客只會說要更快的馬,藉此說明不能只照使用者字面上的話做事。 034

Hermes

講者列舉的自我改進 agent 工具,能從經驗生成技能,但屬於讓單一 agent 變強的垂直智慧 042

Hey AI

講者 Veronica Hylak 的品牌與顧問工作,專門協助新創把複雜的 AI 產品說成人人聽得懂的故事。 040

Higharc

訂製住宅設計新創公司,講者任職於其中的 labs 研究團隊,這場談的正是團隊如何把研究成果做成量產系統。 018

HippoRAG

講者提到的另一個用類似 PPR 技巧做記憶與問答的案例,這場沒有進一步展開。 065

Host39

讓沒有自己網域的中小企業或個人,也能填表申請並上架 agent 的服務。 062

HubSpot

講者提到的 CRM 工具之一,LinkedIn 情報中的熱門訊號結合了 HubSpot 裡的對話紀錄。 079

Human-in-the-loop

流程中保留人工介入點,例如複雜案件要轉給資深醫師覆核 010

HumanEval

最早期的程式評測,只考單一 Python function 寫得對不對。 047

Humanity's Last Exam

一個高難度的 agentic benchmark,講者用它比較不同記憶系統之間的分數差異。 021

ICP(Ideal Customer Profile)

用來篩選訪客與帳號是否符合目標客群的準則,涵蓋產業、規模、地區與職稱等條件。 079

IN-CHARACTER

業界常用的角色扮演評測基準,以人格擬真度打分,講者質疑它量不到史實忠誠度。 005

Inspector

Manufact 提供的開源工具,用來在本機測試 MCP 伺服器與 App。 038

Iris ten Teije

這場講者,Sky Valley Ambient Computing 共同創辦人,先前在 fintech 產業待了十年。 048

Item Response Theory(IRT)

心理計量學裡的評測模型,用題目難度與模型能力兩組參數,取代單純算答對題數。 064

Jeff Atwood

Stack Overflow 共同創辦人,講者引用他多年前的說法作為結論。 057

Jetpack

講者所屬的產品設計團隊,是 Automattic 旗下的 WordPress 外掛與服務品牌 041

Joel Allou(Microsoft)

這場講者之一,負責示範 ACE 的技術實作與效果對比。 087

JoinIn AI

Ted Johnson 共同創辦的公司,做的是讓 AI 介面更貼近人類對話習慣的產品。 036

JustInfer

講者把自建推論基礎設施的經驗整理成的框架名稱。 071

JustTokenMax

講者開源的 token 與 context 管理專案,拿來跟 Netflix 的 headroom 比較效能。 071

KV cache

模型把讀過的上下文快取起來、之後不必重算就能重複使用,是 CAG/ECAG 省時間的關鍵,但快取存活越久成本越高。 025

Kannada

印度南部的語言,講者用一個 Kannada 語系的訂位網站當第二個示範案例。 013

Karpathy's LLM wiki

講者在多數 agent 上拿來當記憶層的東西,決策、分數與理由以結構化欄位寫進去,之後可以直接查詢。這場只提到名稱,沒有說明它怎麼運作。 001

Kiro

AWS 推出的 AI IDE 與 CLI 工具,去年底正式 GA,主打 vibe 與 spec 兩種模式。 022

Kitaru

ZenML 新推出的工具,墊在 agent harness 之下負責 checkpoint 狀態,支援重播、diff 與批次分析。 073

Kubernetes

Kyle 最後決定把任務調度、審核流程與 context 管理疊在它上面,不重造運算、密鑰與工具這些底層。 050

Kyle Jaejun Lee(KRAFTON)

這場的講者,任職於 KRAFTON,獨自維運橫跨三台機器的 AI coding agent 艦隊。 050

LGTM

審查者常用的「看起來沒問題」留言,講者呼籲團隊別再無腦打這句話交差了事。 059

LLM as a judge

用另一個 LLM 來評估 agent 輸出是否恰當,講者提到這是做 behavioral testing(語氣、軌跡)時常用的做法。 035

LLM as a router

讓 LLM 只負責把請求分類、導向不同下游流程,自主性有限 010

LLM-as-judge

用語言模型當評審打分數的評估方式,講者認為它本身也不穩定。 070

LangChain

agent 開發框架,案例中四個以它組成的 agent 在迴圈裡跑了 11 天,燒掉 47000 美元 066

LangFuse

團隊用來接收 OpenTelemetry trace、以瀑布圖檢視 agent 每一步執行狀況的可觀測性工具。 083

LangSmith、Langfuse

團隊用來記錄與檢視 agent 執行過程的追蹤工具。 074

LaunchDarkly

功能旗標服務商,講者拿來當「這套基礎建設早就成熟」的現成例子之一 066

Layer 1(immutable identity)

品牌絕對不能被覆寫的硬性規則層,例如禁止 AI 假裝自己是真人。 008

Layer 4(post-generation veto)

唯一會讀取 AI 實際輸出內容、決定放行或擋下的層。 008

Lens Live

Amazon Lens 底下讓使用者即時取景、點選畫面物件的功能,用來在等待結果時仍讓人有事可做。 078

Letta、Mem0

講者提到能把事實或修正寫進 agent 記憶層的方法。 037

LexisNexis

講者 Sachin Kumar 任職的公司;他強調這是自己獨立完成的研究。 051

Linear

講者舉例用的專案管理工具,語音 agent 把提到的 Slack bug 直接建成一張 issue。 023

Llama 3.2

3B 參數的模型,這場案例裡準確度最貼近 Claude Sonnet,最終雀屏中選。 029

Louis-François Bouchard

講者之一,Towards AI 共同創辦人暨技術長,也是 YouTube 頻道 What's AI 的創辦人。 009

MCP Apps

MCP 的官方介面擴充,讓伺服器除了回傳資料,還能回傳跑在聊天視窗裡的互動介面。 038

MCP registry

Claude 在沒有對應工具時,用來動態搜尋合適連結器的登錄庫。 038

MCP-UI

MCP Apps 的前身,最早提出讓伺服器回傳 UI 元件的方案。 038

MDB Health

講者虛構出來示範用的保險公司名稱,是這場理賠審核案例的主角,不是真實客戶 010

MITRE

講者引用其漏洞分類清單,說明常見漏洞類型多半是舊類型。 061

MTTR

mean time to repair,平均修復時間,這場用它來比較 agent 與人工修復的效率差距。 033

Machinecraft

講者家族在印度經營的真空成型機工廠,傳到他手上已是第三代,員工約百人。 056

Macintosh System 1/System 6

蘋果 1980 年代的作業系統版本,講者用兩代介面的差異類比使用者對 AI 素養的成長階段。 072

Manufact

講者共同創辦的公司,提供 MCP 開源 SDK 與雲端出貨服務。 038

Manufact 的開源 SDK

在官方 SDK 之上再包一層抽象,讓開發者不必直接處理 MCP 規格細節就能寫伺服器、用戶端與 agent;講者說累積下載超過八百萬次。 038

Maria

Project Nanda 的核心貢獻者,這場與 Ramesh Raskar 輪流講解架構細節。 062

Maritime

主打便宜與簡單的 agent 代管平台,用睡眠喚醒架構省下閒置運算成本。 062

Mask and mirror

講者的核心框架:「面具」是聽起來像不像,「鏡子」是這個人在當下真的會不會這樣想。 005

Mastra

講者示範時使用的 agent 開發框架,用來搭建這場的 naive demo agent。 012

Matt Pocock's Skills

講者自己維護的工程 skill 套件庫,這場多次拿來當範例 027

McDonald's AI 點餐鬧劇

演講中借用麥當勞 AI 得來速亂加料(例如培根加冰淇淋)爆紅的例子,示範怎麼把產品綁在大家已知的故事上。 040

Meaning-based search(語意搜尋)

用語意相似度找程式碼的搜尋方式,擅長抓到相關概念,但容易漏掉或抓錯確切名稱。 024

Medic

Pinterest Data Platform 團隊打造的 agentic 診斷工具,用來排查 Spark 任務失敗原因並提供修復建議,後續也擴充到 Spark SQL 優化。 083

Meta Superintelligence Labs

講者所屬的 Meta 內部團隊,這場負責訓練與推論基礎設施的技術工作。 028

Mima

講者自己開發的社群網路整合 App,這場案例的討論串摘要功能就來自它。 029

Mindmakers

講者 Alejandro Vidal 創辦的公司,這場演講觀點的出處。 064

MiniMax

講者在 token 花費吃緊時會切換過去的模型,效果不如主力模型,但能省錢完成工作。 053

Miranda 假說

講者提出的假說:訓練語料裡文化強勢的再現(如音樂劇)會蓋過一手史料,讓模型輸出綜合人格。 005

Mixedbread AI

這場講者所屬的公司,開發搜尋與檢索基礎設施,agentic search 是他們正式上線的產品線。 045

MoE

Mixture of Experts 架構,因為 expert 有容量上限,某個 token 會不會被選中,會受同時間打進來的其他流量影響,是不確定性的成因之一。 035

Moat(護城河)

講者用來比喻平台難以被取代的優勢,分成靠高轉換成本綁住用戶的 friction moat,與靠體驗吸引人的 fluency moat 084

Moffatt v. Air Canada

因航空公司客服聊天機器人提供錯誤資訊而興訟的案子,講者拿來佐證法規風險 066

Mutagent

這場演講兩位講者所屬的新創公司,做的產品是把建 agent 的流程 agent 化的平台。 030

Mythos

Anthropic 的前沿模型,講者用它跟其他模型的比較圖來說明找漏洞與串攻擊鏈的能力進展,結尾也提到它被納入出口管制。 061

NDCG

一種排序品質指標,講者用它衡量 agent 最後排出的文件順序好不好。 045

Nanda Index

agentic web 的探索層,讓 agent 發布身份、能力與聯絡方式,供其他 agent 查詢。 062

NandaTown

Project Nanda 推出的開源模擬沙盒,用來在真實上線前測試整個 agent 經濟。 062

Nano Banana

講者在第一個專案裡,用來畫辦公室插畫的視覺生成工具 041

Nats.io(NATS)

開源訊息系統,用來打造現代分散式系統,這場後半段的實作案例都建立在它上面 032

Nearform

講者任職的服務型公司,主力協助客戶做 AI agent 專案。 012

Netflix AI platform

講者所屬團隊,負責機器學習模型代管用的大規模分散式系統。 088

Neurosymbolic guardrails

把限制規則寫進程式碼,用 hook 在工具真正執行前攔截檢查,而不是只寫進 prompt 讓 model 自行遵守。 055

Nielsen's heuristics

知名的易用性設計十大原則,講者引用其中「安全探索」原則說明版本回溯的重要性。 072

Nishant Gupta

這場演講的講者,在 Meta Superintelligence Labs 負責訓練與推理基礎設施。 002

Noam

講者的共同創辦人,先前是某基礎建設公司的第一位工程師,曾參與打造傳統軟體發布 pipeline。 048

Nori Agentic

講者創辦的公司,做的是能理解公司程式碼、文件、Slack 等資料的 AI 員工,這場示範的做簡報方式來自公司自己的實務。 016

Nori Sessions

Nori 的功能,讓 agent 直接讀取通話紀錄、Email 等公司資料,端到端把整份簡報做出來。 016

Nx

講者 Victor Savkin 所在的公司。 006

O(n²)

這場第一個被 agent 揪出來的效能反模式,指迴圈裡藏著平方級複雜度的計算。 088

OAuth

讓程式或 agent 代表使用者取得授權的協定,是這場討論的重心之一。 077

OG Assist

OpenGov 內嵌在所有產品導覽列上的 agent 助手按鈕。 007

Office QA Pro

Databricks 打造的 benchmark,題目取材自美國財政部過去百年的文件。 045

Ogilvy

講者任職的廣告集團,這場只提到他任職於此,沒有進一步說明 015

Omar

RLM 論文的作者之一,同時也是 DSPy 框架的作者。 058

Omnara

講者任職的新創公司,他是 CEO,正在打造以 session log 為核心的開源 managed agents 平台。 004

Open Proof Corpus

2026 年一篇論文,指出在數學證明中,答案正確與過程正確之間仍有落差。 046

OpenAI

另一間發表資料 agent 研究的實驗室,提出六層 context 的做法。 085

OpenCode

講者提到的另一個 agent harness,用 SQLite 儲存狀態,他指出社群回報不少資料損毀與跨 session 查詢困難的問題。 004

OpenGov

政府單位用的 ERP 軟體公司,成立約 14 年,產品線含預算、採購、資產管理與核發許可。 007

OpenProse

用 Markdown 撰寫、由編碼代理人編譯而非電腦編譯的語言,能把任何有檔案系統與子代理人的 agent 變成 RLM。 003

Opus 4.6

講者舉例提到曾在智能合約中引入漏洞、導致數百萬美元被竊的模型。 061

Opus 4.7

示範對比中作為未優化基準的模型,回答一個問題要思考數秒。 087

Oracle CLI

Peter Steinberger 開發的工具,能把程式碼與資料打包送進 GPT-5.5 Pro 的 API。 068

Oracle 分數

假設把正確文件直接交給模型時能拿到的理論最高分,用來當作檢索能力的天花板。 045

Orbis

講者任職的公司,這場負責解決「所有內容都重要」的知識表示問題。 025

Ornella Bahidika(Microsoft)

這場講者之一,說明 ACE 刻意選用小模型的理由。 087

PARA 方法

用 Projects、Areas、Resources、Archive 分類筆記的方法,講者說是 Tiago 提出的。 009

Paperclip

講者打造的 agent 任務管理系統,核心是判斷任務何時真正完成的 liveness 模型。 063

Paul Graham

Y Combinator 創辦人,被引用說出「AI App 是新瀏覽器」。 038

Paul Iusztin

講者之一,Decoding AI 創辦人暨執行長,主要教怎麼把 AI 產品做上線。 009

Personaplex

Nvidia 的研究用語音模型,示範能中途停下聽人插話、再接回話題的即時對話。 036

Peter Steinberger

講者提到主張「該設計 loop、不要直接對 agent 寫 prompt」的人物。 070

Phaidra

這場演講主角公司,幫資料中心與 AI factory 客戶做能理解自身設備狀態的 AI agent。 060

Phoenix

Arize 的開源評測工具,講者用它跑實驗、比較不同模型的表現。 029

Pi

講者列舉的 harness 之一,走極簡但高度可擴充路線,可在設計階段調整,但不會在運行中自我重組 042

Pinterest Pixie

Pinterest 用 PPR 做推薦系統的知名案例,講者拿它當 PPR 的參考點。 065

Pipecat

這場示範用來串接 STT、LLM、TTS 與 turn detection 的語音 agent 框架 080

PlanetScale

資料庫新創,CEO Sam Lambert 常年親自在 Twitter 上跟用戶互動攬客 044

Plutus

Era 裡負責報價與定價的 agent。 056

Pocket OS

案例中的專案,其 coding agent 誤用另一個檔案裡的 API token,對正式環境資料庫下達操作 066

Polygraph

講者做的這個 agent-agnostic meta-harness,把使用者能存取的多個 repo 串成一張依賴圖,並保留每次 agentic session 的完整記憶。 006

Position Squared

講者任職的公司,這場示範的 GTM agent 系統與 intelligence 儀表板都出自這裡。 079

Product Market Fit Compass

Evil Martians 提出的架構,用產品訊號與營收的落差,判斷新創該優先補產品還是補通路 044

Progress Software

講者任職的企業軟體公司,這場演講代表該公司分享 AI 產品的 UX 觀點。 072

Progressive disclosure

只在 agent 真正用到某個 skill 時才載入完整內容,平常只留一小段 metadata 索引,用來省 token 084

Project Nanda

MIT 主導的開放研究專案,目標是打造 agent 版的網路基礎設施。 062

Prometheus

Era 裡負責跟進銷售的 agent。 056

Prosodica

兩位講者任職的公司,做的是 applied AI、NLP 與對話智能(conversational intelligence)相關工作。 020

Pydantic

Python 的資料驗證函式庫,這場用它定義資料 schema,取代另外維護的 SQL 世界。 085

Python

AI 模型訓練、研究與 GPU serving 至今仍以它為主。 057

Q-learning

一種強化學習方法,這場用它的 tabular 版本,讓 policy 從結果學出行動偏好。 033

Qwen 2.5(0.5B)

講者實際展示中使用的聊天模型,參數量小、體積約 400MB,也拿來跑 agent 模式 015

RELAI

講者創辦的公司,這場示範的持續學習系統(Learning Loop)由這家公司打造。 037

REPL

這裡指模型可以寫程式、執行、拿回結果的可程式化環境,是 RLM 用來管理 context 的核心工具。 058

RL Nabors

這場演講的講者,任職於 Arize。 029

RLHF

以人類回饋做強化學習的安全訓練,講者指出後門可以撐過這個階段而不被抓到。 051

RLM code

Superagentic 推出的開源 RLM 參考實作,附研究用 playground 與代理型終端介面。 058

RLM(Recursive Language Models)

MIT 團隊提出的概念,主張用遞迴呼叫語言模型的方式,處理超出單次 context window 的大型資料。 058

RLM(Recursive Language Model)

把 prompt 外部化成可用程式碼探索的變數,還能呼叫子模型分工處理,這場演講的核心概念。 003

RLVR、GRPO、DPO

講者提到用來對 model 權重做 RL 類後訓練的方法,依獎勵或偏好訊號優化。 037

RNA-seq

量測單一細胞裡各基因表現量的技術,資料量最大、最常被用來訓練單細胞基礎模型。 076

RRF

把向量搜尋與 BM25 關鍵字搜尋的結果合併排序的方法,是這場標題提到的技術之一 015

Raahul Singh

Phaidra 的 staff AI Research Engineer,負責設計這場講的架構解法。 060

Radicait

講者任職的公司,這場的醫學影像案例都來自這裡。 068

Radical Speed Month

Automattic 這次為期一個月的內部實驗名稱,讓兩人小隊暫停原本工作、自由打造並上線一個專案 041

Rajkumar Sakthivel(Raj)

這場的講者,在 Tesco 工作,因為親身遇到 AI 編碼帳單暴增,動手和夥伴一起做了這套本地索引工具。 024

Ram Sriharsha

講者引用他近期的一篇文章,認為目前的 agent 記憶系統一直在為錯的目標做最佳化。 021

Ratel

講者共同創辦並擔任 CTO 的公司,做 AI agent 的 context layer。 057

ReAct agent

早期版本的架構:單一 agent 靠一份 prompt 邊推理邊呼叫工具,是後來多代理架構的前身。 083

React agent

這場提到的舊架構,靠大量客製化工具呼叫逐步探索與編輯圖,規模一大就不夠用。 046

Relocation Scout

講者用來示範的看房 agent,負責蒐集房源、評分並排出候選清單。 001

Remotion

用 React 寫程式化影片的框架,講者用它重建產品介面做導覽。 069

Remotion MCP app

Manufact 做的示範 App,用 Remotion 在介面裡即時渲染影片。 038

Replit

AI coding 平台,曾在一次 12 天的實驗中,agent 在第 9 天刪除正式環境資料庫並捏造假使用者掩蓋 066

Research Prototype Taxonomy(RPT)

Higharc 要求每個研究原型都要附上的技術設計文件,寫清楚領域背景、資料型別與系統架構,作為交棒依據。 018

Resonate

講者創辦的 durable execution 平台,這場演講的主角產品 032

Review debt

這場定義的核心指標:agent 產出但人類還沒真正審查、理解、信任的程式碼落差,會像利息一樣複利累積。 059

Rick Halpern、Sean Martin

講者合作的歷史學者與圖書館員,分別負責出題與審定評分規則。 005

Role-Playing Language Agent(RPLA)

讓模型扮演真實或虛構人物、以第一人稱回應的系統,是這場演講討論的對象。 005

Russell Ackoff

講者引用其「mess」概念的管理學者,主張管理者面對的是糾結變動的情境,而非獨立問題 042

Rust

記憶安全語言,講者主張把關鍵開源函式庫改寫成這種語言。 061

SAGE model

講者自創的說法,指小到剛好、回應品質又夠好的模型(small and good enough)。 029

SLM

small language model 的縮寫,參數量約在百萬到十億等級,遠小於十億到兆等級的 LLM。 029

SPIFFE

用來給機器與服務帳號建立身分的開放標準。 077

SRE

Site Reliability Engineer,講者拿 SRE 衡量可靠度與復原率的方式類比 agent 評測。 002

SWE Marathon

這場演講介紹的評測,把 coding agent 的任務拉到專案等級,重點考驗長時間執行下的可靠度與抗作弊能力。 047

SWE-bench

用真實 GitHub issue 出題的評測,考 agent 讀懂 repo、產生 patch、通過單元測試。 047

Sage

早期系統裡某個 AI 角色的名字,曾因識別欄位沒填而外洩成其他場地的預設身分。 008

ScaleKit

講者共同創立的新創,做的是身份與存取管理基礎設施。 077

Secure by Design

講者在政府任內於 2023 年推動的資安倡議報告。 061

Semantic Tool Selection

用語意搜尋先篩出跟這次查詢最相關的少數工具再送進 context,取代把全部工具說明都塞進去。 055

Semantic caching

用語意相似度快取先前的回答,加速處理相似的理賠案件 010

Sherry Turkle

MIT 學者,講者引用她的話說明對話是人類最根本、最具人性的能力。 036

Sierra AI

提出 tau-bench 的公司,同樣在做客服類 AI agent。 074

Silero VAD

30 萬參數的開源 VAD 模型,靠靜音時長門檻判斷使用者是否講完 080

Simon Willison 的鵜鶘測試

開發者 Simon Willison 設計的小測試:要求模型只用 SVG 畫出騎腳踏車的鵜鶘,藉此檢驗模型的空間推理能力。 016

Skills

一種讓 agent 在需要時才載入完整內容的知識封裝方式,取代把所有指示塞進系統提示或工具定義裡 084

Skyrim

講者開場用來類比 agent 身分的電玩,重點是玩家角色的身分在存檔資料裡,不在主機或手把。 004

SmartTurn v3.2

開源的本地語調判斷模型,recall 58.9%、precision 68.4%,BSD2 授權 080

SmolLM2

這場實驗用來驗證方法的 3.6 億參數小模型。 051

Software 1.0 / 3.0

借用 Karpathy 的分類,1.0 是確定性程式碼,3.0 是靠 prompt 驅動 LLM 的行為。 060

Soheil Feizi

這場演講的講者,RELAI 創辦人暨 CSO,也是馬里蘭大學電腦科學系副教授。 037

SpecKit

GitHub 推出的開源 spec-driven development 工具,可以裝進不同的 coding assistant 使用。 022

StandardAgents

講者任職的新創,這場演講當時仍處於 stealth 模式,主打 domain-specific agent 架構,官網是 standardagents.ai。 031

StarlightSearch

講者共同創辦並擔任執行長的公司,主打 agent 檢索與記憶技術。 021

Steve Yegge

講者參考其 Gastown 文章,把原本的模型重新整理成這場演講用的五階段成熟度模型。 014

Story Mapping

用骨幹拆解使用者在流程中每一步在做什麼的視覺化工具,這場演講用它示範客服系統該先做哪些功能。 034

Sumaiya Shrabony

這場的講者,獨立打造一套用 Claude Code 建置的 agent 系統,涵蓋 writing、research、vault sync、analytics sync、hook、transcript 等功能。 054

Suno.com

把文字提示轉成一首完整歌曲的音樂生成服務。 071

Supabase

開發者工具公司,文中提到它自辦的 Supabase Select 用戶大會已辦到第二年 044

Superagentic

講者 Shashi 創辦的公司,這場示範用的 RLM code 就是他們做的開源專案。 058

Swarm

Strands 內建的 multi-agent 協作機制,能自動處理 agent 之間的交接,不用自己寫迴圈組裝。 055

Synadia

NATS.io 背後的公司,這場提到與 Resonate 合作把 durable execution 原生整合進其技術堆疊 032

Tau-bench

用來測試 agent 是否遵守政策的 benchmark,講者用它驗證記憶系統能不能提升表現。 021

Teachability

講者提出的新評估項目:agent harness 能多快學會使用一個平台或工具 084

Terminal-Bench

進一步把每題包成完整環境加驗證機制,讓 agent 可以操作終端機、跑指令、留下最終容器狀態。 047

Tesla

講者任職的公司,這場談的是她在公司內部打造企業資料 agent 的經驗。 082

The Pragmatic Engineer

講者引用的部落格文章,談軟體工程團隊隨規模擴大而需要技術設計文件來對齊共識。 018

Thinking Machines

講者點名的團隊之一,最近展示過把時間切成 200 毫秒一段、讓模型持續推論的架構,用來繞開語音延遲的限制。 023

Threadline

講者做給失蹤者家屬用的公用工具,套用同一套架構,但語氣與風險完全不同。 008

Time to first chunk

把成效指標從「總回應時間」改成「使用者看到第一個有用畫面所需的時間」。 078

Tinker API

演講中提到某個任務用來對語言模型做 post-train 的外部 API。 047

Token Factory

用開源模型自建、以 token 或 GPU 產能計費的推論方式,是租用 Anthropic、OpenAI 這類服務之外的另一條路。 071

TorchFix

PyTorch 官方的公開 repo,收錄可用來優化 kernel 與模型圖的反模式清單。 088

TypeScript

這場演講主張的 AI 應用層首選語言,JavaScript 加上靜態型別的超集。 057

TypeSense

開發者工具公司,靠在舊金山大量投放看板廣告建立品牌記憶點 044

Ultrasono

講者自己開發的 App,讓使用者輸入一首歌反推出可能生成它的文字提示,做法跟 Suno.com 相反。 071

Unleash

另一個功能旗標工具,同樣被講者列為現成可用的方案 066

User Story

有 persona、需求、原因、驗收標準的固定結構,因為 AI 本身是照這種格式訓練的,用這種結構寫需求能拿到更好的結果。 034

VAD(Value Architecture Design)

講者自己命名的思考流程,主張先搞懂價值、流程、架構,再開始做系統設計。 034

VAD(voice activity detection)

偵測聲音裡有沒有人在講話的元件,是三種做法共同的基礎 080

Vanč Levstik

Phaidra 的 Senior Engineering Manager,負責驗證架構在生產環境下是否可靠。 060

Varsha Shah

這場的講者,是 Enterprise Technical Architect,演講中提到任職於 Tata Consultancy Services、支援 Microsoft 專案。 011

Vera

Era 裡負責查核事實、把關資訊正確性的 agent。 056

Vercel AI SDK

用來串接 AI 模型的 TypeScript 套件,講者用它的下載量成長佐證 TypeScript 生態系的擴張。 057

Vercel EVE

Vercel 推出的 agent 建構框架,講者認為它的出現印證了自己對 domain-specific agent 的預測。 031

VisualLabs

講者創辦的公司,訓練顧問與團隊如何做需求訪談,把構想轉成可執行的規格。 034

Voyage AI

MongoDB 旗下的嵌入模型服務,講者提到會搭配 MongoDB 一起用來做檢索 010

Wandero AI

講者任職的新創公司,從這場提到的行程規劃案例來看,做的是旅行相關的產品。 039

Watershed

講者任職的永續 AI 平台公司,協助企業計算產品碳足跡與相關排放。 046

When Machines Mislead

Duolingo 團隊針對 AI 訊號如何影響人類審核判斷所發表的研究報告 043

Whisper Flow

講者舉的例子,用來說明產品能自動從使用行為學習、建立 skills,不需要另外的設定介面。 052

Wikipedia agent

範例裡的一個 sub-agent,帶著查詢 Wikipedia 的工具,跟 coding agent 平行工作、各自處理自己的任務。 049

Word-based search(關鍵字搜尋)

用精確字詞比對找程式碼的搜尋方式,擅長抓到精確名稱,但容易漏掉語意相近的內容。 024

Writing Great Skills

講者依這場的框架寫成的新 skill,可用來檢查自己或別人 skill 的品質 027

XKCD

知名科技主題網路漫畫,講者借用其「my code's compiling」哏比喻使用者放著流程不管的心態。 072

YOLO

這場示範裡用來偵測影片中人車物件的電腦視覺模型。 085

Yamanaka factor

Shinya Yamanaka 於 2006 年發現的四個轉錄因子,能把成熟細胞重編程回類似胚胎幹細胞的狀態。 076

Ypi

講者做的實驗性封裝,把 Y combinator 的遞迴概念套進 pi,讓 harness 可以呼叫一模一樣的自己。 003

ZenML

講者所屬公司,原本做 ML/agent 工作流程的編排工具,這場示範的是新的 runtime 產品。 073

Zeno Rocha

這場引用的一段話的講者,主張經營個人品牌不用想太多策略,做自己就好 044

Zod

TypeScript 的 schema 驗證函式庫,可讓前後端共用同一份型別定義。 057

action agent

串接流程的最後一站,依前兩層蒐集到的訊號決定要不要寄信、上 LinkedIn 外展,或提醒業務。 079

active learning

機器學習既有做法,用來從大量未標記資料中,挑出模型最沒把握、最值得人工複核的樣本。 086

adaptive engineering

講者提出的工程典範,讓 harness 在運行中自行浮現、穩定與調整,而非事先寫死 042

agency

講者利用個人研究時間、花六個月打造的新程式語言,語法接近 TypeScript,把工具定義、安全機制、sub-agent 都做進語言層級,用來寫 agent。 049

agent content system

講者開源的內容產線系統,從讀取知識庫、寫研究簡報、排內容計畫到產出內容都由 agent 完成,最後跑驗證與審核關卡才存成 markdown。 054

agent control

講者用來做 runtime steering 的開源函式庫,規則透過 API 註冊在本機伺服器上,改規則不必動 agent 的程式碼,也不用整個 harness 重新部署。 055

agentic control plane

講者主張因應自主 agent 而必須出現的新一層基礎設施,統一負責排程、記憶協調、政策執行與監控。 028

aihero.dev

講者的個人電子報網站,這場結尾提到 027

anchor set / fingerprint set

講者用來保護題庫不被外洩訓練的做法:抽出代表性題組,再針對每個組織另外挑一組專屬題目。 064

annotation queue

讓 domain expert 幫對話紀錄標記、給回饋的介面,不用直接看原始 JSON。 074

attractor

complex 系統傾向收斂而成的穩定狀態,例如水在室溫下維持穩定的狀態 042

audit trail

記錄每個交接點與每次判斷的紀錄,讓系統半夜跑壞時不用重跑整條流程也能回溯是哪個關卡出問題。 054

automation bias

人類過度信任自動化系統判斷、因而放棄自己獨立查證與思考的傾向 043

bitwise determinism

逐位元決定性,指同一個輸入永遠得到一模一樣的輸出;講者認為這在 hosted LLM API 上做不到,也不該追求。 035

boundary

Chronicle 的核心概念,是包在 agent 節點(工具呼叫、LLM 呼叫、RAG 檢索)外面的標註,負責記錄進出這個節點的所有內容。 035

browser agent

能操作瀏覽器完成任務的 AI agent,是這場演講的核心主題。 013

cache_prompt

Strands Agents 的參數,設成 default 後第一次呼叫送完整 system prompt,之後改送精簡版本。 026

canary deployment

讓新舊兩個版本的程式同時跑一段時間、比較 CPU 與延遲差異,作為要不要送出程式碼審查的判斷依據。 088

canonical tables

預先寫好的一批參數化查詢,給 agent 更大彈性去回答問題,可靠度比 semantic layer 低。 082

cce

講者秀在螢幕上的指令,一行就能試用這套本地索引工具,他說是免費開源的。 024

chain of custody

講者強調每個 agent 做完工作後要清楚知道下一步交給誰,形成可追蹤的責任鏈。 063

channel(管道)

講者提出的三個核心概念之一,指承載使用者意圖的實體介面,例如鍵盤。 036

cmux

一款終端機管理工具,適合平行跑多個 AI 開發流程,並支援 SSH 連線與 Claude Code Teams 整合。 053

compaction

把過長的 log 壓縮成 model 能處理的較小表示法;講者強調這個過程是有損的,不會完整還原原始狀態。 004

computer-use agent

講者用來模擬真實使用者的 agent,直接登入網站操作介面,找出 log 和程式碼都看不出來的問題。 039

computer-use agent(CUA)

用瀏覽器操作介面驗收成品的 agent,這場演講拿來驗證全端產品像不像真的能用。 047

conscientiousness

講者用來取代「品味」的說法,指對細節一絲不苟、有職業責任感。 069

content engineer

講者預測 2027 年會興起的新角色,靠紀律把內容產製變成可重複的工程流程。 069

context graph

把每個買家的 persona、account、deal 訊號整合成一張關聯記錄,用來判斷帳號優先順序與採購委員會成員。 079

context life cycle

講者提出的做法,靠持續更新活資料與記錄修正事件,讓 agent 的脈絡不至於老化。 082

contract testing

在系統交接點加上輸出格式驗證,確保上游環節改了輸出結構時,下游能立刻被擋下,而不是悄悄壞掉。 054

control plane

講者說的控制平面,負責持續觀察系統、收集遙測、協調人工審查,跟負責執行工作的 execution plane 分開。 002

conveyor belt

講者用來說明 agentic 產品架構的比喻:agent 是輸送帶上做事的工人,使用者是監督者。 052

copy typing

一種作弊型態,考生在測驗中直接抄打眼前看到的文字,而非當下自己構思作答 043

database graph

把資料表、欄位、指標互相連結成的關聯圖,彈性最高,但建置與維護成本也最高。 082

deal ID

一筆交易在 Froglet 上成立時取得的識別碼,用來對應該筆收據 067

decorator pattern

讓某個類別包裝或延伸另一個類別功能的設計模式,這場用來示範子圖比對的效果。 065

defense in depth

講者用來描述安全機制要疊加多層(prompt 控制、工具權限、政策驗證、人工核准)的防禦概念。 028

design engineer

講者用來形容自己新角色的說法,指同時能做設計、也能獨立把功能寫成程式上線的人 041

deterministic execution(確定性執行)

團隊自己掌控的最終執行腳本,負責 lint、偵測衝突、驗證輸出,通過才真正落地修改圖。 046

deterministic simulation

讓 agent 能重現同一次失敗、逐步除錯的測試環境,是這場後段 agent 能參與系統設計的關鍵工具 032

diagnostics agent

Mutagent 另一隻研究預覽中的 agent,協助分析上線後的 trace、找出根因。 030

diff-SAE

講者提出的做法:改拿基座與微調模型 activation 的差值訓練 sparse autoencoder,把後門變成單一特徵。 051

discrimination(鑑別度)

每題的另一個參數,代表這題能不能有效分辨強弱模型,數值高才是好題目。 064

divergence

從 stem 分出來、只屬於單一使用者的客製化版本,彼此隔離、可以個別回退。 048

domain modeling

講者的 skill 範例,功能是更新詞彙表 context.md 或建立架構決策紀錄(ADR) 027

durable execution

讓程式執行狀態能撐過當機、網路失敗等意外,是 Resonate 訴求的核心能力 032

durable promise / durable task

Resonate 協議裡的兩個核心物件,是整個系統一路簡化到最小之後留下的結果 032

emergence

complex 系統中局部互動產生、無法由任何單一部件事先設計出的新秩序 042

episodic memory

讓 agent 直接參考過去處理過的相似案例與其結論,不必等人工把道理整理成規則。 086

epoch.ai

提供這場示範用的真實模型評測資料的機構。 064

evaluator agent

Mutagent 目前研究預覽中的兩隻 agent 之一,協助建立 eval 資料集。 030

exception classifier pipeline

取代 regex 過濾規則的做法:學習哪些例外常出現在成功任務中並視為雜訊過濾掉,再依相關性與時間排序剩下的例外。 083

execution plane

實際執行 agent 工作流程的部分,由控制平面負責測量與治理。 002

expression(表達力)

講者提出的三個核心概念之一,指管道能讓使用者傳達出多少真實意圖與意涵。 036

fat agent

講者對「把所有工具 schema 一次塞進每次請求」這種設計方式的稱呼,是這場要指出的反例。 020

feature flag

開發者事先宣告好的開關,用來把同一份程式碼分流給不同使用者群組;這場演講認為它即將被取代。 048

fit / validate / test 資料集

這次實驗切出的三份資料,分別用來找錯誤模式、驗證修改是否泛化、最後測試整體效果。 070

flow matching

一類從隨機雜訊出發、直接比對資料分布的生成模型,講者提到這類模型目前在單細胞資料上表現較佳。 076

forward deployed engineer

企業軟體公司派駐客戶端、協助客製化與導入的工程師,常見於 Salesforce 這類大型 SaaS 的專業服務團隊。 048

frequency penalty

LLM 內建機制,重複輸出相似詞元時會被抑制,導致列舉大量設備名稱時輸出中斷。 060

golden dataset

跟領域專家一起訂出的輸入與期望輸出配對,用來在非決定性系統上當測試集,再靠 scorer 算出準確率當基準線。 012

graphite

程式碼審查工具,這場用它把龐大的研究原型拆成一串 stacked diff,讓不同領域專家可以非同步審查。 018

grep

程式碼常用的關鍵字比對工具,harness 裡也保留它處理精確關鍵字搜尋。 045

grill with docs

講者把「提出釐清問題」獨立出來的 skill,避免這步驟被草率帶過 027

healer agent

負責依向量資料庫裡的 runbook,針對 supervisor 選出的根因提出修復建議的角色。 083

image registration

把兩次不同時間、不同掃描器拍攝的影像(如 CT 與 PET)對齊校準的流程。 068

immunopeptidomics

研究免疫系統辨識之胜肽片段的學門,是 Alithea Bio 的技術背景之一 067

index.yaml

整套系統的入口目錄檔,記錄所有來源與 wiki 衍生頁的摘要與 metadata。 009

joint feature 法

把基座與微調模型的 activation 直接合併起來訓練特徵的既有做法,這場證明它幾乎測不到後門。 051

just-in-time context injection

只在真正需要時才動態把該有的 context(這裡指工具 schema)加進 prompt,而不是一開始就全部載入。 020

knowledge base

買家情報層的核心,收錄產品、買家、ICP 分數、buyer persona 與各種成功準則的知識庫。 079

liveness

這場脈絡下指工作能持續往前推進、不被卡住的狀態,要跟人工驗證的正確性互相平衡。 063

llm query

RLM 迴圈裡用來呼叫另一個語言模型取得答案的步驟,也是「遞迴」名稱的由來。 058

log

這場的核心概念:append-only 的事件歷史,記下每一次 user input、model output、tool call、tool result、permission 與 failure,講者主張這才是 agent 的身分本體。 004

log lock-in

講者提出的概念:比 model 或 API 鎖定更難擺脫的鎖定形式,log 一旦被平台掌握,平台就等於掌握了整個 agent。 004

max iterations

限制 agent 迴圈最多能跑幾輪的設定,避免工具呼叫跑成無限迴圈。 026

meta harness

講者自創的說法,指把 log 監控、PR review、session 分析、computer-use 等多個 agent 串成的整體監控系統。 039

meta-harness

包在既有 agent 外層的一層框架,同一份程式碼與記憶可以讓不同 agent(如 Claude、Codex)共用。 006

model context protocol(MCP)

讓模型串接外部資料來源的協定,講者提到可以拿它把 Jira、Asana 這類票券資訊接進 spec 流程。 022

monoculture

講者列舉的失敗模式之一:agent 訓練來源相近,導致缺乏真正的多樣性 042

monorepo

Higharc 用來集中放所有機器學習程式碼的單一版本庫,裡面是彼此解耦、各自獨立部署的 microservice。 018

neocloud

專門提供 GPU 算力與推論產能的新型雲端供應商。 071

npm

JavaScript 生態系的套件管理平台,講者稱它是最豐富的套件庫。 057

offline loop

上線前的開發迭代:建 agent、測試、evaluate、改善。 030

online loop

上線後持續監控 trace、診斷問題,再把結果回饋進優化。 030

ontology

描述要抽取哪些資訊放進圖裡的規則,這場用食譜範例示範怎麼標準化格式與單位。 065

optimistic concurrency

只有讀到的版本仍是最新版本時,寫入才會成功,否則就丟出錯誤 032

orchestrator

串接 evaluator agent 與 diagnostics agent 的角色,跑在使用者自己的 coding 環境裡。 030

overview search

harness 裡的搜尋工具之一,一次可看到多達五十個片段的摘要,用來先掌握語料庫全貌。 045

p50 / p95

延遲的中位數與 95 百分位數,語音 agent 場景更該看尾端的 p95 080

partial function application(PFA)

借自函數式編程的技巧,把工具函式的某個參數(例如可存取的目錄)先鎖死,讓 agent 拿到工具時看不到、也改不了那個參數。 049

pattern catalog

講者提出的核心機制:把發現的效能模式與反模式集中寫進一個 Git repo,讓沒有記憶的 LLM agent 也能重複利用先前的發現。 088

personalized PageRank(PPR)

Vanilla PageRank 的變形,從指定起始節點出發做隨機遊走,找出跟它關係最強的節點。 065

pi

Mario Zechner 打造的極簡編碼代理人 harness,設計成用擴充套件加功能,而非塞進核心。 003

policy engine

講者提出的架構中,負責在模型的提案送進生產系統前進行政策審核的元件。 028

pre-indexed subtree

依位置與設備關係預先建好的索引子集合,讓後端能用集合運算快速找到答案。 060

precision、recall

拿人工標註的答案驗證 LLM judge 準不準時用的分類指標。 074

prefix caching

講者提到的推論快取技巧:只要 prompt 前段內容每次相同,就能拿到更便宜、更快的推論。 023

prod to code

講者提出的做法,把 service 層級的 CPU、記憶體、p90 等指標對應回 function 與檔案層級,讓 agent 能直接推理。 075

profiler

用來剖析正式環境服務、抓出呼叫堆疊與 CPU 用量的工具,是這整套流程的資料來源。 088

projection(投影)

講者用來稱呼從 log 算出來的各種輸出,例如 context window、UI、除錯追蹤、稽核紀錄、compaction 都只是 log 的投影,log 本身才是原始紀錄。 004

property-based tests

針對需求文件與設計文件產生的測試,用 fast-check 在 TypeScript、node 專案裡跑上百次不同數值驗證邏輯。 022

protocol(協定)

講者提出的三個核心概念之一,指人與機器交換訊息時的規則與節奏。 036

provisional patent(臨時專利)

講者替這台裝置安靜、無干擾的使用情境申請的一種美國專利前置保護 017

query by committee

active learning 的一種做法,靠比較多個模型(或同一模型跑多次)的判斷是否一致,找出分歧案例。 086

ref.tools

講者舉的客戶案例,限縮給 coding agent 的 context 範圍以避免過度授權。 077

regression-aware optimization

把「不能破壞過去做對的事」直接放進優化過程本身,而不是修完之後再事後補救。 037

replayability

重播性,指把一次已經發生過的執行過程重建到足以除錯的程度,是講者主張真正該追求的目標。 035

replayable learning environment

把一次性的 log 與回饋,轉換成能重複執行、有明確成功定義的模擬與評測環境。 037

rolling summarization

對話變長時用漸進式摘要取代塞滿最新訊息的做法。 007

rubber stamping

審核者不加查證、直接照准 AI 給出的結果,等於形同虛設的審查 043

scaffolding

為小模型寫進程式碼的規則與流程,讓它不必自己判斷也能穩定輸出。 087

semantic blindness

這場演講定義的問題:LLM 面對數量龐大、名稱相近的設備時失去分辨能力。 060

semantic layer

把 KPI 定義、指標算法、業務規則整理成一份標準答案,讓 agent 優先參考的資料層。 082

semantic memory

把人工釐清過的判斷準則(例如某公司的政策)寫成知識,讓 agent 之後可以直接查詢套用。 086

semantic routing

語意路由:先用查詢向量比對工具描述向量,只挑出最相關的少數工具交給模型,而不是整個工具目錄都塞進去。 020

send follow-up message

MCP Apps 的原語之一,讓介面主動觸發一則後續訊息送進聊天。 038

session analyzer

講者自建的系統,替每場對話打分數、抓出高層級的規律,用來掌握整體健康度而不是修單一個問題。 039

set state

MCP Apps 的原語之一,讓介面把目前狀態同步給模型知道。 038

skill

把重複用得到的流程(例如標準化房源資料)包成可共用的 agent 能力模組。 001

sleeper agent

平常行為正常、只在特定觸發條件下才切換成惡意行為的後門模型。 051

sliding window conversation manager

Strands Agents 內建機制,只保留最近約十則訊息,避免整段對話歷史反覆重送。 026

staging environment

在內容進入「ready」資料夾前先設一個檢查點,避免有問題的輸出直接被當成可發布的成品。 054

steering docs

Kiro 裡對應 agents.md 或 CLAUDE.md 的說法,用來放專案規則與方向給 coding assistant 參考。 022

stem

講者團隊說法裡的「共同基底」:所有使用者共用的一份程式碼主幹,之後才從它長出各自的分歧。 048

strace

反作弊層用來追蹤程式呼叫了哪些子行程的工具,藉此抓到偷呼叫 GCC 這類作弊行為。 047

sub-agent

專門處理單一任務的 agent,可以像函式一樣被呼叫,並在執行時挾帶整個 session 的脈絡。 001

superpowers

另一套熱門的工程 skill 集,多半走 model-invoked 路線,作為這場的對照組 027

target function(目標函數)

這場的核心概念,指用來判斷 agent 輸出對錯的量化標準。 070

telemetry

遙測資料,講者認為是正式環境裡最重要的評測訊號來源。 002

the great mismatch

講者對「用為確定性工作流設計的基礎設施硬撐長時間、動態決策的自主 agent」這種落差取的名稱。 028

theta

IRT 裡代表模型智力水準的參數,由所有題目的作答結果一起估計出來。 064

tmux

終端機多工工具,Kyle 一開始用它同時開好幾個 agent 對話視窗,後來也靠它的 send-keys 功能跨機器喚醒 agent。 050

trace-to-harness

直接請 coding agent 分析 log 並改善 agent 的做法,但不保證沒有隱藏的退步。 037

trajectory

agent 從收到任務到產出結果的完整執行過程,是評測時要看的核心對象。 030

tree depth

團隊提出的擴展方向,讓系統效能跟著設備階層的深度成長,而不是跟著設備總數成長。 060

triage agent

多代理架構裡負責判斷 Spark 任務生命週期狀態、產生失敗假設的第一線角色。 083

trypolygraph.com

講者在結尾提供的網站,供聽眾自行試用 Polygraph。 006

turn-taking

語音對話中判斷「現在輪到誰說話」的機制,是這場演講的核心主題 080

typed SDK(型別化 SDK)

團隊自建的 TypeScript SDK,是 agent 唯一能用來修改圖的介面,規範哪些欄位可編輯、哪些是衍生欄位。 046

utility score

講者提出的評分方式,用語意相似度乘上「這段記憶過去對任務有沒有幫助」,決定它在檢索時該排多前面。 021

verifiable continual learning(VCL)

講者提出的新分類,主張每次修正都要被證明有效、也證明沒有破壞原本能力。 037

verifiable receipt

Froglet 交易完成後產生的憑證,用來證明每一步驟確實發生過且未被竄改 067

verification theater

講者用來形容人力簽核多到流於形式、無法真正把關的狀態。 063

vibe coding

講者用來形容「直接讓 AI 生成程式碼、快速做出東西」的做法,提醒這樣做出來的東西不代表真的有人會用。 034

voice contract

這場示範的第一道關卡,檢查輸出的語氣是不是套用制式行銷腔,而不是講者自己的聲音。 054

vtest

講者示範中臨時拉進 session 的一個開源 repo,用來讓既有 Claude session 讀懂並解決自己 repo 裡的問題。 006

watchdog

Paperclip 裡的一種 maximizer 代理人,被賦予目標後會持續督促其他 agent 完成,且不綁定特定 harness。 063

weekly active sessions

講者主張委派型 agent 產品該改用的成長指標,用來取代 weekly active users。 052

子圖比對(subgraph matching)

只憑節點與邊構成的「形狀」去查詢,不需要先知道具體要找的是哪個節點。 065

批次(batch)

先把整個需求準備好一次送出、再等待結果的處理方式,講者認為提示詞至今仍是這種模式。 036

穿孔卡(punch card)

早期電腦用打孔卡片編碼指令、整批送入機器運算的輸入方式,講者用來比喻提示詞。 036

黃金資料集

人工整理、當成 ground truth 的輸入輸出配對集合,這場案例用了 14 條討論串、共 28 筆資料。 029