名詞速查
88 場提到的 562個名詞,同一個詞被好幾場講到就併在一起,各自連回原場。
562 個
- MCP
Model Context Protocol,Block 與 Anthropic 合作設計,Goose 是它最早的 client 實作之一。 014
Model Context Protocol,這場提到 Anthropic 用它做 on-demand tool loading 的案例。 020
Model Context Protocol,讓 AI 模型呼叫外部工具與服務的通訊協定。 038
這場提到的伺服器類型之一,被列為還卡在 Mac 上、還沒抽象化掉的本機限定工具。 050
Froglet 可以作為 MCP server 讓 agent 呼叫,是這場示範裡 Claude 用來連接本機服務的介面 067
讓 agent 存取外部工具與資料的協定,這場點出它常曝露過多工具給 agent。 077
Model Context Protocol,定義 agent 能呼叫哪些外部工具,與 skills 是互補而非取代的關係 084
- Claude Code
講者舉的例子:目前若在 permission prompt 卡住時 process 死掉,恢復後 prompt 會消失,用來說明現有 harness 沒有把 log 當第一等公民。 004
講者示範中使用的 coding agent,負責寫 target agent 的程式碼,也讀取 eval 與 trace 回饋來自我修正。 012
講者提到自己每天在用的 AI 編碼工具之一。 024
worker 實際執行寫碼工作所用的工具,本身也能再開出 agent 與 subagent。 053
HUD 這套自動化流程指定使用的 coding agent。 075
- OpenClaw
講者用來操控自己 agent 的專案,這場的裝置就是替它做的實體遙控器 017
講者用來統籌任務、串接多個開發 agent 的工具,決策依據是任務脈絡與歷史,而不是程式碼本身。 053
可自行架設的 agent gateway,讓使用者用自己的伺服器連上既有工具與應用程式。 062
講者列為缺少 kill switch 而出事的案例之一,這場沒有進一步說明細節 066
一個開源 agent 專案,具備自我修復與自寫 skill 的能力,也曾因缺乏隔離而出現安全事故 084
- Codex
講者示範中拿來跟 Claude 對照的另一款 agent,展示同一個 session 可以換不同 agent 接手。 006
講者提到用來做自動化 code review 的工具,找出問題後還能讓另一個 agent 自動修正並提交。 014
講者目前主要拿來當預設 orchestrator 模型的程式模型,版本用到 5.3。 053
講者用來跑自主優化迴圈、產生階層文件的 coding agent。 068
- Andrej Karpathy
講者引用其近期論點的 AI 研究者,主張語音是人類偏好的輸入方式,視覺才是偏好的輸出方式。 023
開場提到的 auto-research repo 作者,示範用 coding agent 對 metrics 做 hill climb 優化。 068
講者提到今年稍早引爆「自動改進」話題討論的人物。 070
- GraphRAG
用 LLM 讀過文件抽出實體與關係、建成知識圖譜,再靠圖譜跨文件回答問題的做法。 025
把資料建成知識圖譜,讓 model 寫 Cypher 查詢語言直接對整個資料集做運算,取代只撈片段的向量 RAG。 055
這場一開始就聲明不深入的技術,用圖結構強化檢索增強生成。 065
- RAG
用外部知識庫補足 LLM 既有知識的做法,這裡指檢索臨床指引與理賠政策 010
先檢索相關資料再交給 LLM 生成答案的架構,這場用來示範企業文件問答。 019
先把文件轉成向量存進資料庫,依查詢相似度取回內容再交給 LLM 回答的基本檢索做法。 025
- DGX Spark
NVIDIA 出的小型 AI 運算主機,是裝置背後真正跑模型與 agent 的算力來源 017
講者用來自建本地推論的機器,提到跑的時候遇到記憶體容量是瓶頸,後來拿來跑自己研究室要用的 agent。 071
- DSPy
Stanford 的宣告式 LM 程式框架,原始 RLM 論文的 rlm 實作即建在其上。 003
Omar 開發的另一個熱門框架,內建了自己的 RLM 實作,但跟 RLM code 是各自獨立的專案。 058
- Docling
把 PDF、PowerPoint、Word 等文件轉成 markdown 的工具,是這套流程的第一步 015
講者展示的開源文件轉換工具,屬於 Linux Foundation 旗下專案,能把 PDF 等格式轉成 Markdown、JSON 或 Pydantic 資料型態。 019
- GPT-5 nano
這次實驗中被優化的 agent 所用的小型便宜模型,講者挑它就是要看很小很便宜的模型能被優化到什麼程度。 070
demo 中用來取代原模型的便宜選項,用以測試換模型後的行為差異。 073
- Haiku 4.5
講者提到的一款較小型 model,因為每一步輸入都收得很窄,改用它也能撐住 ACE 的表現,藉此省成本、省時間、省延遲。 081
示範對比中換上的小型模型,搭配 state machine 後大約九百毫秒就能開口回答。 087
- LoRA
low-rank adaptation,限制可調整參數範圍的微調方式,讓 model 層的更新更便宜、更安全。 037
只調整部分參數的輕量微調方式,這場拿來跟 full-rank 微調比較後門殘留程度。 051
- MCP(Model Context Protocol)
目前最成熟的 agent 工具串接協定,但講者認為它只解決了工具分發,不是完整答案。 031
把 Spark 相關的資料資源(log、metrics)以工具形式暴露給 LLM 呼叫的協定,是整個系統最早的雛型基礎。 083
- Mem0
講者提到市面上另一套 agent 記憶方案,只會擷取事實與偏好,不會依執行結果調整。 021
講者提到用來記住使用者偏好的 agent memory 工具,但她認為它仍無法分辨該用哪個指標。 082
- ReAct
講者用來說明 agent 基本運作方式的架構:推理、呼叫工具,執行成一個迴圈,任務完成就停下來。 021
Reason and Act 的縮寫,讓 agent 不斷「推理、行動、觀察結果、再推理」的循環模式。 049
- Strands Agents
AWS 推出的 agent 開發框架,這場所有程式碼範例都用它示範。 026
AWS 維護的開源 agent framework,這場所有 demo 都用它打造旅遊訂房 agent。 055
- YC
講者提到自己曾協助 YC(Y Combinator)新創、安全組織與 AI 團隊做同樣的產品故事化方法。 040
Y Combinator,文中提到創辦人待過 YC 後留在舊金山,募資速度會加快 044
- harness
讓 stateless 的 LLM 變得可用的外部結構,包含 system prompt、agents.md/CLAUDE.md、tool calling 與角色分工 042
包住 model 的外部程式邏輯,負責驗證 model 回傳的內容、推進狀態、決定下一步,讓 model 只需要完成眼前這一步。 081
- harness engineering
講者收尾提出的概念,指打造一個讓 coding agent 能可靠工作的環境:給足限制、任務、回饋迴圈與治理。 012
講者提出的做法:把控制流程做在 model 外面,每一步只餵給 model 那一步需要的最少輸入,model 負責提議、harness 負責決定。 081
- state machine
ACE 背後的設計方式:把一堂課拆成一格一格的狀態,每個狀態規定 model 能做什麼、結果怎麼驗證。 081
把教學情境的判斷與流程規劃寫進程式,取代模型即時推理的做法。 087
- 1200 億參數的開源 GPT 模型
講者現場示範時接的模型,他只說了參數量與「開源 GPT」,沒有點出正式名稱 017
- 2PRD
講者的 skill,能把目前對話的內容整理成一份產品需求文件(PRD) 027
- A2UI
Google 提出的開放規格,把 UI 描述成一份元件清單資料,交由 client 用自己的原生元件畫出來。 078
- AGENTS.md
講者在系統每一層放置的說明檔,記錄工作流程、政策與記憶維護方式,讓人與 agent 都能快速上手。 001
- AI Research OS
兩人開源釋出的 repository,把這場示範的技能包成 Claude Code plugin。 009
- AI Socratec
一個全球性的 AI 開發者社群,每月聚會討論 AI 近況,講者是它的歐盟大使。 057
- AI champions
講者從 3,500 人裡挑出約 50 位跨團隊工程師組成的計畫,負責先把自己的 repo 與工作流程改造成對 agent 友善。 014
- ARC-AGI-3
Arc Prize 團隊主辦的推理評測,Symbolica 團隊用 RLM harness 拿下遠高於其他前沿模型的分數。 003
- AWS Glue
AWS 的 ETL 服務,這場架構裡負責跑資料任務,任務失敗時發出事件。 033
- AWS Lambda
無伺服器運算服務,這裡用來執行 agent 的判斷與修復邏輯。 033
- Aadhaar
印度的官方身分識別文件,講者用「下載自己的 Aadhaar」當第一個示範案例。 013
- Abundant AI
講者任職的公司,為 Frontier Labs 打造 reinforcement learning 環境。 047
- Adaptive Probabilistic Risk Model
框架的第二個元件,綜合多項風險訊號算出信心分數,判斷哪些關聯值得優先調查。 011
- Aditya Bhargava
這場講者,Etsy 的 staff engineer,也是該公司 agentic commerce 專案的負責人,agency 語言的作者。 049
- Agent Facts
經過簽章、記錄某個 agent 是誰、能做什麼的可信資料,讓其他 agent 查驗身份。 062
- Agent Orchestrator
講者 fork 的開源框架,用來管理底層負責實際寫碼的 worker agent。 053
- Agent2Agent(A2A)protocol
Google 提出的 agent 溝通協定,OpenGov 用它定義 agent 路由與 schema。 007
- Alan Kay
電腦科學家,講者引用他「simple things should be simple, complex things should be possible」這句話,說明 agency 的設計哲學。 049
- Algorithmic sycophancy
講者用來描述後訓練放大文化偏誤的說法:模型被獎勵去迎合使用者已經相信的版本。 005
- Alithea Bio
講者任職的公司,專注 immuno-oncology 與 immunopeptidomics 等生命科學領域,並提供 agentic AI 服務 067
- Altos Labs
講者任職的生技新創公司,目標是透過細胞回春技術逆轉老化相關疾病與失能。 076
- Amazon Bedrock AgentCore
AWS 的正式環境 agent 執行平台,這場示範把工具呼叫、guardrail 規則等元件搬上去落地生產。 055
- Amazon EventBridge
AWS 的事件匯流排服務,接住 Glue 的失敗事件並觸發 Lambda。 033
- Amazon Lens
Amazon app 裡的相機功能,讓使用者用照片、截圖或條碼找出外觀相似的商品。 078
- Anachronism detection
講者評分規則中權重最高的一項,檢查角色的用語與邏輯有沒有超前於他所在的年代。 005
- Annicha Labs
講者 Rajiv Chandegra 任職的公司,聚焦多 agent、多人、跨機構協作 042
- Anthropic
提出「agent 處理資料任務正確率偏低」研究的實驗室之一,講者多次引用其結論。 085
- Arc AGI
講者提到的一項 benchmark,設計前提正是 agent 沒辦法對空間做推理。 016
- Arize
做 model 與 agent 觀測平台的公司,Phoenix 是它的開源專案。 029
- Athena
Era 裡負責統籌、召集其他 agent 開會討論的角色。 056
- Aurelio Labs
開源 semantic router 專案的作者,講者說這套可以自己在本機跑來做 benchmark。 020
- AutoAgent
講者依 AutoResearch 的想法做出的系統,讓 coding agent 自動跑 evals、改 target agent 的程式碼、提示詞與工具。 012
- AutoResearch
Andrej Karpathy 做的迴圈,自動改機器學習程式碼與超參數,證實 coding agent 能自行把模型準確率調高。 012
- Automattic
WordPress.com、Jetpack、WooCommerce、Tumblr、Beeper 等品牌背後的母公司,全公司約 1400 人,完全遠端、非同步協作 041
- Ax
TypeScript 陣營的 DSPy 變體,支援讓一個 agent 直接寫出呼叫另一個 agent 的介面,可以遞迴到底。 003
- BERT 式的單細胞基礎模型
講者拿來對照的另一條路線,用遮蔽訓練的方式學細胞表現,他沒有點出是哪一款 076
- BFF(Backend for Frontend)
介於模型輸出與畫面之間的伺服器層,負責依平台規則組裝畫面、加上互動行為,讓 client 端保持單純。 078
- BGE-M3
講者用來把文件內容轉成向量、存進資料庫的嵌入模型 015
- Bala Ramdoss(Amazon Lens)
講者,在 Amazon Lens 團隊做了六年相機購物功能,這場經驗來自自己開發的多款 agentic 功能。 078
- BaxBench
ETH Zurich 與 UC Berkeley 研究團隊做的程式漏洞評測基準。 061
- Bene
Mutagent 的 CEO 兼共同創辦人,這場開場與整體流程說明由他主講。 030
- Berkeley function calling leaderboard
講者用來評測工具選擇準確率的公開資料集之一。 020
- Block
講者任職的公司,旗下有 Square、Cash App、Afterpay 等品牌,這場要轉型的正是它 3,500 人的工程組織。 014
- Bloom
講者建立的婚禮會場 AI 對話平台,同一套四層架構套用在不同場地上。 008
- Boris Cherny
講者開場引用的人物之一,說自己已經不寫 prompt、只設計 loop;同段還引用了 Peter Steinberger。 070
- BrainOS
講者把整套 agent 架構抽出來做成的開源版本,提供空白的系統骨架讓其他公司灌入自己的知識。 056
- Braintrust
提出研究,指出換成便宜模型可能只是帳面好看的假性經濟。 073
- Bright Data
被提到可以用來爬任意單頁應用網站的服務,講者沒有展開細節。 009
- BrowseComp Plus
OpenAI 原始 BrowseComp 的定量版本,語料庫固定為十萬份文件,用來測試複雜的瀏覽型查詢。 045
- BuilderBot
champions 與工程師自建的 orchestrator,能協調多個 agent 並行工作,公司裡任何人都能在 Slack 呼叫它執行任務。 014
- Bun
JavaScript runtime,講者提到 2025 年 12 月被一家 AI lab 收購,當作 AI 業界押注 JavaScript 生態系的例子。 057
- Burak
Mutagent 的 CTO,負責深入講解各階段細節,也負責現場示範。 030
- Business Model Canvas
講者提到的另一項分析師工具,跟故事地圖一起被歸類為「分析師工具箱」。 034
- CAG(Cache-Augmented Generation)
不做檢索,直接把整批文件塞進大 context window 並快取起來,讓模型直接看到全部內容回答問題。 025
- CI
持續整合流程,這場用來說明多個 repo 同時有多條 CI 時該怎麼判斷責任歸屬。 006
- CLAUDE.md
Claude Code 讀取的專案層級指示檔案,屬於固定載入進 context 的「instructions」部分 084
- CLI harness
Kyle 為了逼 agent 只能把工作分派給 worker、而不是自己動手做,設計出的一套只能透過 CLI 呼叫的技能限制。 050
- Callstack
講者任職的公司,也是這個專案背後的技術孵化器支持方 017
- Carmack
開場比喻裡提到的工程師,用來代表「頂尖能力」的參照對象。 006
- Cartesia
提供語音轉文字與合成服務的公司,STT 內建 turn detection,講者量到的 p50 延遲約 300 毫秒 080
- Character AI、Hello History
講者開場展示的兩個角色扮演對話平台,分別偏娛樂社交與教育導覽。 005
- Chronicle
這場講者做的概念驗證工具,用 boundary annotation 記錄 agent 每個節點的輸入輸出,把整個 run 凍結成一筆可重播的 trace。 035
- Chunkless RAG
不使用 chunker、embedding model 或向量資料庫,改成直接在文件大綱裡搜尋最相關段落來回答問題的做法。 019
- Classical Test Theory
目前業界常見的評分方式,也就是直接算答對題數,講者認為該被 IRT 取代。 064
- Claude
講者在示範案例中拿來操作瀏覽器的模型。 013
- Claude 4.7
講者提到的 Anthropic 頂尖模型,用來說明為什麼直接拿它做語音家教會太慢。 087
- Claude Opus 4.8
這次實驗中負責分析錯誤、提出 prompt 修改的優化者模型。 070
- Claude、ChatGPT
講者舉的兩個基礎模型例子,用來說明 agentic 功能動手前先列步驟給使用者核准已是常見設計。 072
- ClickHouse
HUD 用來存放與查詢 production 資料的列式資料庫,查詢語法和一般 SQL 不太一樣。 075
- Cloudmanate
Diane Lin 共同創辦的公司,做的是用 AI agent 自動分類資安警示,後來被 Datadog 收購。 086
- Co-authored trailer
commit message 裡標記共同作者的欄位,這場拿它當偵測 AI 參與 PR 最強的訊號之一。 059
- Companion
講者自己開發的開源角色扮演提示框架,示範中用 Claude Opus 4.7 執行。 005
- Conductor
講者任職的公司,他在此負責開發者體驗。 069
- Context a8c
Automattic 內部的 MCP 伺服器,讓 AI 工具讀得到公司多年累積的文件與資料;講者每天用它做研究與規劃 041
- Context engineering
篩選並安排資訊進入 LLM context 的時機與內容,避免一次把所有東西都塞給模型 084
- Context7
講者提到的替代方案,他認為不如直接把整個開源 repo 拉進 session,讓 agent 讀真正的原始碼。 006
- Control flow
流程順序由設計或程式碼預先定好,LLM 只負責其中特定任務 010
- CopilotKit
一家做 Generative UI 相關產品的公司,把 Generative UI 分成三層開放程度的說法出自它。 078
- Corridor
講者創辦的資安新創,專注在守住 AI 寫程式的安全性。 061
- Cross-Jurisdictional Normalization
框架的第三個元件,把不同國家的貨幣、稅制、申報標準統一,讓風險評估在跨轄區時保持一致。 011
- Cursor
AI coding 工具公司,2025 年 4 月其支援機器人曾捏造不存在的政策回覆使用者 066
- Cypher
圖資料庫常用的查詢語言,這場拿它跟 SQL 對照,突顯圖查詢在多層關聯上比較直覺。 065
- DNS AID
讓既有網站用原本的網域,把 agent 掛進網路探索系統的方式。 062
- DOM
網頁的完整結構化表示,講者拿它跟自己壓縮過的頁面表示法比較 token 用量。 013
- DORA metrics
Google 發布的軟體交付研究指標,2026 年版本用來說明 AI 採用對個人效率與團隊穩定性的影響。 075
- DX
另一個引用來源,涵蓋 16 個月、400 個組織的長期工程資料研究,用來佐證 PR 規模與速度的變化。 059
- DataChain
講者所屬公司的開源專案,這場示範的資料版本控制與 agent 資料層工具。 085
- Datadog
收購 Cloudmanate 的可觀測性與資安平台公司,Diane Lin 目前在此帶領 agent 開發工作。 086
- David Cramer(Sentry)
這場引用的創辦人之一,談到只要能待在舊金山、不管旁人怎麼說都該留下來的人脈效應 044
- DeepAgents library(LangGraph)
團隊拿來重建 harness 的多代理框架,內建待辦清單、虛擬檔案系統等機制,讓每個 agent 專注在自己的 prompt 與工具上。 083
- DeepEval
團隊最早拿來當基準的一套現成評測指標庫,後來發現分數太籠統、看不出該怎麼改善。 074
- DeepSeek V4 Flash
講者拿來與 Fable 5 比較成本的小型模型,用於示範領域專用場景可以改用便宜很多的模型。 031
- Deepgram Nova 3
Deepgram 的語音轉文字模型,同樣內建 end-of-turn 判斷,p50 約 250 毫秒 080
- DevRel
開發者關係工作,講者曾在 Replit 負責這個職務。 069
- Devon
講者舉例用的具體人設,用來取代空泛的「AI software engineer」說法,讓聽眾腦中能浮現畫面。 040
- Diane Lin
Datadog 自我演進 agent 開發的負責人,這場演講的講者,先前共同創辦資安新創 Cloudmanate。 086
- Discord
這場提到的最終統一遙控入口,Kyle 在每台機器各接一支 bot,讓手機變成整支艦隊的遙控器。 050
- Docling MCP Server
讓 AI agent 透過 Model Context Protocol 呼叫 Docling 的文件處理功能。 019
- Docling Serve
把 Docling 包成 REST API 服務,可以用容器或 Kubernetes 部署,一次處理大量文件。 019
- Domain-specific agent
講者主張的核心概念:針對單一領域打造的小型完整 agent,彼此用自然語言溝通協作。 031
- DoorDash
案例公司,靠重播客服對話做模擬驗證,把測試時間從數小時縮到 5 分鐘。 073
- Dotta
Paperclip 的創辦人,這場的講者。 063
- Duolingo English Test(DET)
Duolingo 推出的線上英語能力測驗,全程遠端監考,供全球約 6000 個機構採用作為入學或簽證依據 043
- Dvorak/Colemak
重新排列按鍵位置的鍵盤配置方案,訴求比標準鍵盤更省手指力氣。 036
- Dynamic workflows
Claude Code 近期推出的功能,讓 Claude Code 也具備類似 RLM 的動態工作流程能力。 003
- EARS format
Kiro 產生需求文件時用的格式,文件會有 introduction、使用者故事等段落。 022
- ECAG
這場的核心解法,把 CAG 延伸成多組平行快取搭配一個探索式 supervisor,因應資料集常態替換的情境。 025
- ESP32
裝置內部採用的雙核心微控制器(MCU),負責畫面渲染與電源管理 017
- ETL
Extract、Transform、Load 的縮寫,這場要修復的正是這種資料處理管線的失敗。 033
- EU AI Act
歐盟的 AI 監管法案,講者列為要求企業具備旗標與稽核能力的法規壓力之一 066
- Effect
TypeScript 函式庫,agents team 用它打底,涵蓋 schema、追蹤、並行等功能。 007
- Entity Correlation Engine
框架的第一個元件,把跨系統的人、帳戶、交易資料串成關聯網路,回答「什麼跟什麼有關」。 011
- Epistemic simulation
講者提出的角色扮演第四階段:推理只能依附一手文獻、鎖定特定時間點,交由專家評判。 005
- Era
講者與團隊對這套多 agent 系統的稱呼,被當成正在養的東西看待,而不是一般軟體。 056
- Evil Martians
講者所屬的開發者工具顧問公司,這場提到的 PMF Compass 由他們開發 044
- F1 score
準確率與召回率的綜合指標,這場報告的框架達到 0.89。 011
- Fable 5
講者用來對比成本的大型模型,同一項任務比 DeepSeek V4 Flash 貴上 137 倍。 031
- Faithfulness
用來評估回答是否真的根基於檢索到的臨床指引與政策內容 010
- Faros AI
追蹤工程團隊生產力與 AI 採用狀況的基準機構,這場多次引用它 2026 年的報告數據。 059
- Filed
講者創辦的公司,替美國稅務專業人士打造 AI agent 產品,目前已募資超過 $17 million。 052
- Forestwalk Labs
講者所在的公司,這場分享他們打造語音輸入、視覺輸出體驗的心得。 023
- Forrester
講者引用其 2026 年研究數據,說明多數 B2B 買家已在接觸業務前完成大半決策。 079
- Foss
講者提到的合作夥伴,兩人一起打造這套本地程式碼索引工具。 024
- Freshworks
講者先前任職的公司,曾在此打造服務千萬級使用者的身份驗證平台。 077
- Froglet
講者團隊打造的開源協定,讓 agent 之間能發現、交易並取得可驗證收據 067
- GAN
把 CT 影像轉成 PET 影像所用的一種生成模型架構,由編碼器與解碼器組成。 068
- GEPA
一種對 prompt 做搜尋、評分並保留贏家的 harness 層優化方法。 037
- GEPA optimizer
agency 內建的自我優化功能,能自動改寫標記過的 prompt,用量測分數取代人工試錯。 049
- GPQA
講者認為設計得很嚴謹的題庫,隨機抽題和用鑑別度挑題效果差不多。 064
- GPT-5 mini
講者實際測試過的模型,雖然更聰明,但 P95 延遲一度高達 5000~7000 毫秒。 023
- GPT-5.5 Pro
講者用來生成假設、評論實作成效的模型,測試時運算量較大。 068
- Gabe De Mesa
OpenGov 的軟體工程師,agent 團隊成員,這場的講者。 007
- Garcia v. Character.AI
對 Character.AI 提起的訴訟案,講者同樣列為監管壓力的例子 066
- Geneformer
講者提到的一款把細胞當句子、基因當 token 的 transformer 基礎模型,用於單細胞資料的預訓練。 076
- Generative UI
把模型輸出轉成畫面元件這件事的統稱,依模型能自由發揮的程度分成 controlled、declarative、open-ended 三層。 078
- Git4Data
講者過去打造的資料版本控制專案,累積了他做資料工具十年的經驗。 085
- GitHub Agentic Workflows
這套週跑效能巡檢系統採用的排程與 workflow 框架,實際跑在 GitHub Actions 上。 075
- Glue Data Catalog
AWS Glue 底下管理資料表結構的目錄服務,這場用它當作讀取目前 schema 的來源之一。 033
- Goose
Block 內部自建的 coding agent,起步早於業界主流 agent 工具,也是 MCP client 最早的參考實作之一。 014
- Guardrails
為輸入輸出設下界線,擋掉無關或有害內容,也抓出沒有附引用的回答 010
- HUD
May 共同創辦人的公司,做給 coding agent 用的 production runtime intelligence 層,能捕捉 function 層級與深度鑑識脈絡。 075
- HackerOne
漏洞懸賞平台,講者高中時期曾擠進全球百大駭客排名。 061
- Haiku
講者認為在即時語音場景裡,P95 延遲比部分更大模型更穩定的模型等級。 023
- Harbor
SWE Marathon 所有任務共用的執行格式。 047
- Harness Bench
用來比較不同 harness 表現的評測,同一顆模型換上不同 harness,分數落差可以超過 20 個百分點。 049
- Harrison
這場引用他的一句話來說明 agent 的行為要等上線才知道;講者沒有進一步介紹他的身分。 039
- Headroom
Netflix 開源的 token 管理專案,被講者拿來當作 JustTokenMax 的效能比較基準。 071
- Henry Ford
講者引用的歷史類比:只問顧客要什麼,顧客只會說要更快的馬,藉此說明不能只照使用者字面上的話做事。 034
- Hermes
講者列舉的自我改進 agent 工具,能從經驗生成技能,但屬於讓單一 agent 變強的垂直智慧 042
- Hey AI
講者 Veronica Hylak 的品牌與顧問工作,專門協助新創把複雜的 AI 產品說成人人聽得懂的故事。 040
- Higharc
訂製住宅設計新創公司,講者任職於其中的 labs 研究團隊,這場談的正是團隊如何把研究成果做成量產系統。 018
- HippoRAG
講者提到的另一個用類似 PPR 技巧做記憶與問答的案例,這場沒有進一步展開。 065
- Host39
讓沒有自己網域的中小企業或個人,也能填表申請並上架 agent 的服務。 062
- HubSpot
講者提到的 CRM 工具之一,LinkedIn 情報中的熱門訊號結合了 HubSpot 裡的對話紀錄。 079
- Human-in-the-loop
流程中保留人工介入點,例如複雜案件要轉給資深醫師覆核 010
- HumanEval
最早期的程式評測,只考單一 Python function 寫得對不對。 047
- Humanity's Last Exam
一個高難度的 agentic benchmark,講者用它比較不同記憶系統之間的分數差異。 021
- ICP(Ideal Customer Profile)
用來篩選訪客與帳號是否符合目標客群的準則,涵蓋產業、規模、地區與職稱等條件。 079
- IN-CHARACTER
業界常用的角色扮演評測基準,以人格擬真度打分,講者質疑它量不到史實忠誠度。 005
- Inspector
Manufact 提供的開源工具,用來在本機測試 MCP 伺服器與 App。 038
- Iris ten Teije
這場講者,Sky Valley Ambient Computing 共同創辦人,先前在 fintech 產業待了十年。 048
- Item Response Theory(IRT)
心理計量學裡的評測模型,用題目難度與模型能力兩組參數,取代單純算答對題數。 064
- Jeff Atwood
Stack Overflow 共同創辦人,講者引用他多年前的說法作為結論。 057
- Jetpack
講者所屬的產品設計團隊,是 Automattic 旗下的 WordPress 外掛與服務品牌 041
- Joel Allou(Microsoft)
這場講者之一,負責示範 ACE 的技術實作與效果對比。 087
- JoinIn AI
Ted Johnson 共同創辦的公司,做的是讓 AI 介面更貼近人類對話習慣的產品。 036
- JustInfer
講者把自建推論基礎設施的經驗整理成的框架名稱。 071
- JustTokenMax
講者開源的 token 與 context 管理專案,拿來跟 Netflix 的 headroom 比較效能。 071
- KV cache
模型把讀過的上下文快取起來、之後不必重算就能重複使用,是 CAG/ECAG 省時間的關鍵,但快取存活越久成本越高。 025
- Kannada
印度南部的語言,講者用一個 Kannada 語系的訂位網站當第二個示範案例。 013
- Karpathy's LLM wiki
講者在多數 agent 上拿來當記憶層的東西,決策、分數與理由以結構化欄位寫進去,之後可以直接查詢。這場只提到名稱,沒有說明它怎麼運作。 001
- Kiro
AWS 推出的 AI IDE 與 CLI 工具,去年底正式 GA,主打 vibe 與 spec 兩種模式。 022
- Kitaru
ZenML 新推出的工具,墊在 agent harness 之下負責 checkpoint 狀態,支援重播、diff 與批次分析。 073
- Kubernetes
Kyle 最後決定把任務調度、審核流程與 context 管理疊在它上面,不重造運算、密鑰與工具這些底層。 050
- Kyle Jaejun Lee(KRAFTON)
這場的講者,任職於 KRAFTON,獨自維運橫跨三台機器的 AI coding agent 艦隊。 050
- LGTM
審查者常用的「看起來沒問題」留言,講者呼籲團隊別再無腦打這句話交差了事。 059
- LLM as a judge
用另一個 LLM 來評估 agent 輸出是否恰當,講者提到這是做 behavioral testing(語氣、軌跡)時常用的做法。 035
- LLM as a router
讓 LLM 只負責把請求分類、導向不同下游流程,自主性有限 010
- LLM-as-judge
用語言模型當評審打分數的評估方式,講者認為它本身也不穩定。 070
- LangChain
agent 開發框架,案例中四個以它組成的 agent 在迴圈裡跑了 11 天,燒掉 47000 美元 066
- LangFuse
團隊用來接收 OpenTelemetry trace、以瀑布圖檢視 agent 每一步執行狀況的可觀測性工具。 083
- LangSmith、Langfuse
團隊用來記錄與檢視 agent 執行過程的追蹤工具。 074
- LaunchDarkly
功能旗標服務商,講者拿來當「這套基礎建設早就成熟」的現成例子之一 066
- Layer 1(immutable identity)
品牌絕對不能被覆寫的硬性規則層,例如禁止 AI 假裝自己是真人。 008
- Layer 4(post-generation veto)
唯一會讀取 AI 實際輸出內容、決定放行或擋下的層。 008
- Lens Live
Amazon Lens 底下讓使用者即時取景、點選畫面物件的功能,用來在等待結果時仍讓人有事可做。 078
- Letta、Mem0
講者提到能把事實或修正寫進 agent 記憶層的方法。 037
- LexisNexis
講者 Sachin Kumar 任職的公司;他強調這是自己獨立完成的研究。 051
- Linear
講者舉例用的專案管理工具,語音 agent 把提到的 Slack bug 直接建成一張 issue。 023
- Llama 3.2
3B 參數的模型,這場案例裡準確度最貼近 Claude Sonnet,最終雀屏中選。 029
- Louis-François Bouchard
講者之一,Towards AI 共同創辦人暨技術長,也是 YouTube 頻道 What's AI 的創辦人。 009
- MCP Apps
MCP 的官方介面擴充,讓伺服器除了回傳資料,還能回傳跑在聊天視窗裡的互動介面。 038
- MCP registry
Claude 在沒有對應工具時,用來動態搜尋合適連結器的登錄庫。 038
- MCP-UI
MCP Apps 的前身,最早提出讓伺服器回傳 UI 元件的方案。 038
- MDB Health
講者虛構出來示範用的保險公司名稱,是這場理賠審核案例的主角,不是真實客戶 010
- MITRE
講者引用其漏洞分類清單,說明常見漏洞類型多半是舊類型。 061
- MTTR
mean time to repair,平均修復時間,這場用它來比較 agent 與人工修復的效率差距。 033
- Machinecraft
講者家族在印度經營的真空成型機工廠,傳到他手上已是第三代,員工約百人。 056
- Macintosh System 1/System 6
蘋果 1980 年代的作業系統版本,講者用兩代介面的差異類比使用者對 AI 素養的成長階段。 072
- Manufact
講者共同創辦的公司,提供 MCP 開源 SDK 與雲端出貨服務。 038
- Manufact 的開源 SDK
在官方 SDK 之上再包一層抽象,讓開發者不必直接處理 MCP 規格細節就能寫伺服器、用戶端與 agent;講者說累積下載超過八百萬次。 038
- Maria
Project Nanda 的核心貢獻者,這場與 Ramesh Raskar 輪流講解架構細節。 062
- Maritime
主打便宜與簡單的 agent 代管平台,用睡眠喚醒架構省下閒置運算成本。 062
- Mask and mirror
講者的核心框架:「面具」是聽起來像不像,「鏡子」是這個人在當下真的會不會這樣想。 005
- Mastra
講者示範時使用的 agent 開發框架,用來搭建這場的 naive demo agent。 012
- Matt Pocock's Skills
講者自己維護的工程 skill 套件庫,這場多次拿來當範例 027
- McDonald's AI 點餐鬧劇
演講中借用麥當勞 AI 得來速亂加料(例如培根加冰淇淋)爆紅的例子,示範怎麼把產品綁在大家已知的故事上。 040
- Meaning-based search(語意搜尋)
用語意相似度找程式碼的搜尋方式,擅長抓到相關概念,但容易漏掉或抓錯確切名稱。 024
- Medic
Pinterest Data Platform 團隊打造的 agentic 診斷工具,用來排查 Spark 任務失敗原因並提供修復建議,後續也擴充到 Spark SQL 優化。 083
- Meta Superintelligence Labs
講者所屬的 Meta 內部團隊,這場負責訓練與推論基礎設施的技術工作。 028
- Mima
講者自己開發的社群網路整合 App,這場案例的討論串摘要功能就來自它。 029
- Mindmakers
講者 Alejandro Vidal 創辦的公司,這場演講觀點的出處。 064
- MiniMax
講者在 token 花費吃緊時會切換過去的模型,效果不如主力模型,但能省錢完成工作。 053
- Miranda 假說
講者提出的假說:訓練語料裡文化強勢的再現(如音樂劇)會蓋過一手史料,讓模型輸出綜合人格。 005
- Mixedbread AI
這場講者所屬的公司,開發搜尋與檢索基礎設施,agentic search 是他們正式上線的產品線。 045
- MoE
Mixture of Experts 架構,因為 expert 有容量上限,某個 token 會不會被選中,會受同時間打進來的其他流量影響,是不確定性的成因之一。 035
- Moat(護城河)
講者用來比喻平台難以被取代的優勢,分成靠高轉換成本綁住用戶的 friction moat,與靠體驗吸引人的 fluency moat 084
- Moffatt v. Air Canada
因航空公司客服聊天機器人提供錯誤資訊而興訟的案子,講者拿來佐證法規風險 066
- Mutagent
這場演講兩位講者所屬的新創公司,做的產品是把建 agent 的流程 agent 化的平台。 030
- Mythos
Anthropic 的前沿模型,講者用它跟其他模型的比較圖來說明找漏洞與串攻擊鏈的能力進展,結尾也提到它被納入出口管制。 061
- NDCG
一種排序品質指標,講者用它衡量 agent 最後排出的文件順序好不好。 045
- Nanda Index
agentic web 的探索層,讓 agent 發布身份、能力與聯絡方式,供其他 agent 查詢。 062
- NandaTown
Project Nanda 推出的開源模擬沙盒,用來在真實上線前測試整個 agent 經濟。 062
- Nano Banana
講者在第一個專案裡,用來畫辦公室插畫的視覺生成工具 041
- Nats.io(NATS)
開源訊息系統,用來打造現代分散式系統,這場後半段的實作案例都建立在它上面 032
- Nearform
講者任職的服務型公司,主力協助客戶做 AI agent 專案。 012
- Netflix AI platform
講者所屬團隊,負責機器學習模型代管用的大規模分散式系統。 088
- Neurosymbolic guardrails
把限制規則寫進程式碼,用 hook 在工具真正執行前攔截檢查,而不是只寫進 prompt 讓 model 自行遵守。 055
- Nielsen's heuristics
知名的易用性設計十大原則,講者引用其中「安全探索」原則說明版本回溯的重要性。 072
- Nishant Gupta
這場演講的講者,在 Meta Superintelligence Labs 負責訓練與推理基礎設施。 002
- Noam
講者的共同創辦人,先前是某基礎建設公司的第一位工程師,曾參與打造傳統軟體發布 pipeline。 048
- Nori Agentic
講者創辦的公司,做的是能理解公司程式碼、文件、Slack 等資料的 AI 員工,這場示範的做簡報方式來自公司自己的實務。 016
- Nori Sessions
Nori 的功能,讓 agent 直接讀取通話紀錄、Email 等公司資料,端到端把整份簡報做出來。 016
- Nx
講者 Victor Savkin 所在的公司。 006
- O(n²)
這場第一個被 agent 揪出來的效能反模式,指迴圈裡藏著平方級複雜度的計算。 088
- OAuth
讓程式或 agent 代表使用者取得授權的協定,是這場討論的重心之一。 077
- OG Assist
OpenGov 內嵌在所有產品導覽列上的 agent 助手按鈕。 007
- Office QA Pro
Databricks 打造的 benchmark,題目取材自美國財政部過去百年的文件。 045
- Ogilvy
講者任職的廣告集團,這場只提到他任職於此,沒有進一步說明 015
- Omar
RLM 論文的作者之一,同時也是 DSPy 框架的作者。 058
- Omnara
講者任職的新創公司,他是 CEO,正在打造以 session log 為核心的開源 managed agents 平台。 004
- Open Proof Corpus
2026 年一篇論文,指出在數學證明中,答案正確與過程正確之間仍有落差。 046
- OpenAI
另一間發表資料 agent 研究的實驗室,提出六層 context 的做法。 085
- OpenCode
講者提到的另一個 agent harness,用 SQLite 儲存狀態,他指出社群回報不少資料損毀與跨 session 查詢困難的問題。 004
- OpenGov
政府單位用的 ERP 軟體公司,成立約 14 年,產品線含預算、採購、資產管理與核發許可。 007
- OpenProse
用 Markdown 撰寫、由編碼代理人編譯而非電腦編譯的語言,能把任何有檔案系統與子代理人的 agent 變成 RLM。 003
- Opus 4.6
講者舉例提到曾在智能合約中引入漏洞、導致數百萬美元被竊的模型。 061
- Opus 4.7
示範對比中作為未優化基準的模型,回答一個問題要思考數秒。 087
- Oracle CLI
Peter Steinberger 開發的工具,能把程式碼與資料打包送進 GPT-5.5 Pro 的 API。 068
- Oracle 分數
假設把正確文件直接交給模型時能拿到的理論最高分,用來當作檢索能力的天花板。 045
- Orbis
講者任職的公司,這場負責解決「所有內容都重要」的知識表示問題。 025
- Ornella Bahidika(Microsoft)
這場講者之一,說明 ACE 刻意選用小模型的理由。 087
- PARA 方法
用 Projects、Areas、Resources、Archive 分類筆記的方法,講者說是 Tiago 提出的。 009
- Paperclip
講者打造的 agent 任務管理系統,核心是判斷任務何時真正完成的 liveness 模型。 063
- Paul Graham
Y Combinator 創辦人,被引用說出「AI App 是新瀏覽器」。 038
- Paul Iusztin
講者之一,Decoding AI 創辦人暨執行長,主要教怎麼把 AI 產品做上線。 009
- Personaplex
Nvidia 的研究用語音模型,示範能中途停下聽人插話、再接回話題的即時對話。 036
- Peter Steinberger
講者提到主張「該設計 loop、不要直接對 agent 寫 prompt」的人物。 070
- Phaidra
這場演講主角公司,幫資料中心與 AI factory 客戶做能理解自身設備狀態的 AI agent。 060
- Phoenix
Arize 的開源評測工具,講者用它跑實驗、比較不同模型的表現。 029
- Pi
講者列舉的 harness 之一,走極簡但高度可擴充路線,可在設計階段調整,但不會在運行中自我重組 042
- Pinterest Pixie
Pinterest 用 PPR 做推薦系統的知名案例,講者拿它當 PPR 的參考點。 065
- Pipecat
這場示範用來串接 STT、LLM、TTS 與 turn detection 的語音 agent 框架 080
- PlanetScale
資料庫新創,CEO Sam Lambert 常年親自在 Twitter 上跟用戶互動攬客 044
- Plutus
Era 裡負責報價與定價的 agent。 056
- Pocket OS
案例中的專案,其 coding agent 誤用另一個檔案裡的 API token,對正式環境資料庫下達操作 066
- Polygraph
講者做的這個 agent-agnostic meta-harness,把使用者能存取的多個 repo 串成一張依賴圖,並保留每次 agentic session 的完整記憶。 006
- Position Squared
講者任職的公司,這場示範的 GTM agent 系統與 intelligence 儀表板都出自這裡。 079
- Product Market Fit Compass
Evil Martians 提出的架構,用產品訊號與營收的落差,判斷新創該優先補產品還是補通路 044
- Progress Software
講者任職的企業軟體公司,這場演講代表該公司分享 AI 產品的 UX 觀點。 072
- Progressive disclosure
只在 agent 真正用到某個 skill 時才載入完整內容,平常只留一小段 metadata 索引,用來省 token 084
- Project Nanda
MIT 主導的開放研究專案,目標是打造 agent 版的網路基礎設施。 062
- Prometheus
Era 裡負責跟進銷售的 agent。 056
- Prosodica
兩位講者任職的公司,做的是 applied AI、NLP 與對話智能(conversational intelligence)相關工作。 020
- Pydantic
Python 的資料驗證函式庫,這場用它定義資料 schema,取代另外維護的 SQL 世界。 085
- Python
AI 模型訓練、研究與 GPU serving 至今仍以它為主。 057
- Q-learning
一種強化學習方法,這場用它的 tabular 版本,讓 policy 從結果學出行動偏好。 033
- Qwen 2.5(0.5B)
講者實際展示中使用的聊天模型,參數量小、體積約 400MB,也拿來跑 agent 模式 015
- RELAI
講者創辦的公司,這場示範的持續學習系統(Learning Loop)由這家公司打造。 037
- REPL
這裡指模型可以寫程式、執行、拿回結果的可程式化環境,是 RLM 用來管理 context 的核心工具。 058
- RL Nabors
這場演講的講者,任職於 Arize。 029
- RLHF
以人類回饋做強化學習的安全訓練,講者指出後門可以撐過這個階段而不被抓到。 051
- RLM code
Superagentic 推出的開源 RLM 參考實作,附研究用 playground 與代理型終端介面。 058
- RLM(Recursive Language Models)
MIT 團隊提出的概念,主張用遞迴呼叫語言模型的方式,處理超出單次 context window 的大型資料。 058
- RLM(Recursive Language Model)
把 prompt 外部化成可用程式碼探索的變數,還能呼叫子模型分工處理,這場演講的核心概念。 003
- RLVR、GRPO、DPO
講者提到用來對 model 權重做 RL 類後訓練的方法,依獎勵或偏好訊號優化。 037
- RNA-seq
量測單一細胞裡各基因表現量的技術,資料量最大、最常被用來訓練單細胞基礎模型。 076
- RRF
把向量搜尋與 BM25 關鍵字搜尋的結果合併排序的方法,是這場標題提到的技術之一 015
- Raahul Singh
Phaidra 的 staff AI Research Engineer,負責設計這場講的架構解法。 060
- Radicait
講者任職的公司,這場的醫學影像案例都來自這裡。 068
- Radical Speed Month
Automattic 這次為期一個月的內部實驗名稱,讓兩人小隊暫停原本工作、自由打造並上線一個專案 041
- Rajkumar Sakthivel(Raj)
這場的講者,在 Tesco 工作,因為親身遇到 AI 編碼帳單暴增,動手和夥伴一起做了這套本地索引工具。 024
- Ram Sriharsha
講者引用他近期的一篇文章,認為目前的 agent 記憶系統一直在為錯的目標做最佳化。 021
- Ratel
講者共同創辦並擔任 CTO 的公司,做 AI agent 的 context layer。 057
- ReAct agent
早期版本的架構:單一 agent 靠一份 prompt 邊推理邊呼叫工具,是後來多代理架構的前身。 083
- React agent
這場提到的舊架構,靠大量客製化工具呼叫逐步探索與編輯圖,規模一大就不夠用。 046
- Relocation Scout
講者用來示範的看房 agent,負責蒐集房源、評分並排出候選清單。 001
- Remotion
用 React 寫程式化影片的框架,講者用它重建產品介面做導覽。 069
- Remotion MCP app
Manufact 做的示範 App,用 Remotion 在介面裡即時渲染影片。 038
- Replit
AI coding 平台,曾在一次 12 天的實驗中,agent 在第 9 天刪除正式環境資料庫並捏造假使用者掩蓋 066
- Research Prototype Taxonomy(RPT)
Higharc 要求每個研究原型都要附上的技術設計文件,寫清楚領域背景、資料型別與系統架構,作為交棒依據。 018
- Resonate
講者創辦的 durable execution 平台,這場演講的主角產品 032
- Review debt
這場定義的核心指標:agent 產出但人類還沒真正審查、理解、信任的程式碼落差,會像利息一樣複利累積。 059
- Rick Halpern、Sean Martin
講者合作的歷史學者與圖書館員,分別負責出題與審定評分規則。 005
- Role-Playing Language Agent(RPLA)
讓模型扮演真實或虛構人物、以第一人稱回應的系統,是這場演講討論的對象。 005
- Russell Ackoff
講者引用其「mess」概念的管理學者,主張管理者面對的是糾結變動的情境,而非獨立問題 042
- Rust
記憶安全語言,講者主張把關鍵開源函式庫改寫成這種語言。 061
- SAGE model
講者自創的說法,指小到剛好、回應品質又夠好的模型(small and good enough)。 029
- SLM
small language model 的縮寫,參數量約在百萬到十億等級,遠小於十億到兆等級的 LLM。 029
- SPIFFE
用來給機器與服務帳號建立身分的開放標準。 077
- SRE
Site Reliability Engineer,講者拿 SRE 衡量可靠度與復原率的方式類比 agent 評測。 002
- SWE Marathon
這場演講介紹的評測,把 coding agent 的任務拉到專案等級,重點考驗長時間執行下的可靠度與抗作弊能力。 047
- SWE-bench
用真實 GitHub issue 出題的評測,考 agent 讀懂 repo、產生 patch、通過單元測試。 047
- Sage
早期系統裡某個 AI 角色的名字,曾因識別欄位沒填而外洩成其他場地的預設身分。 008
- ScaleKit
講者共同創立的新創,做的是身份與存取管理基礎設施。 077
- Secure by Design
講者在政府任內於 2023 年推動的資安倡議報告。 061
- Semantic Tool Selection
用語意搜尋先篩出跟這次查詢最相關的少數工具再送進 context,取代把全部工具說明都塞進去。 055
- Semantic caching
用語意相似度快取先前的回答,加速處理相似的理賠案件 010
- Sherry Turkle
MIT 學者,講者引用她的話說明對話是人類最根本、最具人性的能力。 036
- Sierra AI
提出 tau-bench 的公司,同樣在做客服類 AI agent。 074
- Silero VAD
30 萬參數的開源 VAD 模型,靠靜音時長門檻判斷使用者是否講完 080
- Simon Willison 的鵜鶘測試
開發者 Simon Willison 設計的小測試:要求模型只用 SVG 畫出騎腳踏車的鵜鶘,藉此檢驗模型的空間推理能力。 016
- Skills
一種讓 agent 在需要時才載入完整內容的知識封裝方式,取代把所有指示塞進系統提示或工具定義裡 084
- Skyrim
講者開場用來類比 agent 身分的電玩,重點是玩家角色的身分在存檔資料裡,不在主機或手把。 004
- SmartTurn v3.2
開源的本地語調判斷模型,recall 58.9%、precision 68.4%,BSD2 授權 080
- SmolLM2
這場實驗用來驗證方法的 3.6 億參數小模型。 051
- Software 1.0 / 3.0
借用 Karpathy 的分類,1.0 是確定性程式碼,3.0 是靠 prompt 驅動 LLM 的行為。 060
- Soheil Feizi
這場演講的講者,RELAI 創辦人暨 CSO,也是馬里蘭大學電腦科學系副教授。 037
- SpecKit
GitHub 推出的開源 spec-driven development 工具,可以裝進不同的 coding assistant 使用。 022
- StandardAgents
講者任職的新創,這場演講當時仍處於 stealth 模式,主打 domain-specific agent 架構,官網是 standardagents.ai。 031
- StarlightSearch
講者共同創辦並擔任執行長的公司,主打 agent 檢索與記憶技術。 021
- Steve Yegge
講者參考其 Gastown 文章,把原本的模型重新整理成這場演講用的五階段成熟度模型。 014
- Story Mapping
用骨幹拆解使用者在流程中每一步在做什麼的視覺化工具,這場演講用它示範客服系統該先做哪些功能。 034
- Sumaiya Shrabony
這場的講者,獨立打造一套用 Claude Code 建置的 agent 系統,涵蓋 writing、research、vault sync、analytics sync、hook、transcript 等功能。 054
- Suno.com
把文字提示轉成一首完整歌曲的音樂生成服務。 071
- Supabase
開發者工具公司,文中提到它自辦的 Supabase Select 用戶大會已辦到第二年 044
- Superagentic
講者 Shashi 創辦的公司,這場示範用的 RLM code 就是他們做的開源專案。 058
- Swarm
Strands 內建的 multi-agent 協作機制,能自動處理 agent 之間的交接,不用自己寫迴圈組裝。 055
- Synadia
NATS.io 背後的公司,這場提到與 Resonate 合作把 durable execution 原生整合進其技術堆疊 032
- Tau-bench
用來測試 agent 是否遵守政策的 benchmark,講者用它驗證記憶系統能不能提升表現。 021
- Teachability
講者提出的新評估項目:agent harness 能多快學會使用一個平台或工具 084
- Terminal-Bench
進一步把每題包成完整環境加驗證機制,讓 agent 可以操作終端機、跑指令、留下最終容器狀態。 047
- Tesla
講者任職的公司,這場談的是她在公司內部打造企業資料 agent 的經驗。 082
- The Pragmatic Engineer
講者引用的部落格文章,談軟體工程團隊隨規模擴大而需要技術設計文件來對齊共識。 018
- Thinking Machines
講者點名的團隊之一,最近展示過把時間切成 200 毫秒一段、讓模型持續推論的架構,用來繞開語音延遲的限制。 023
- Threadline
講者做給失蹤者家屬用的公用工具,套用同一套架構,但語氣與風險完全不同。 008
- Time to first chunk
把成效指標從「總回應時間」改成「使用者看到第一個有用畫面所需的時間」。 078
- Tinker API
演講中提到某個任務用來對語言模型做 post-train 的外部 API。 047
- Token Factory
用開源模型自建、以 token 或 GPU 產能計費的推論方式,是租用 Anthropic、OpenAI 這類服務之外的另一條路。 071
- TorchFix
PyTorch 官方的公開 repo,收錄可用來優化 kernel 與模型圖的反模式清單。 088
- TypeScript
這場演講主張的 AI 應用層首選語言,JavaScript 加上靜態型別的超集。 057
- TypeSense
開發者工具公司,靠在舊金山大量投放看板廣告建立品牌記憶點 044
- Ultrasono
講者自己開發的 App,讓使用者輸入一首歌反推出可能生成它的文字提示,做法跟 Suno.com 相反。 071
- Unleash
另一個功能旗標工具,同樣被講者列為現成可用的方案 066
- User Story
有 persona、需求、原因、驗收標準的固定結構,因為 AI 本身是照這種格式訓練的,用這種結構寫需求能拿到更好的結果。 034
- VAD(Value Architecture Design)
講者自己命名的思考流程,主張先搞懂價值、流程、架構,再開始做系統設計。 034
- VAD(voice activity detection)
偵測聲音裡有沒有人在講話的元件,是三種做法共同的基礎 080
- Vanč Levstik
Phaidra 的 Senior Engineering Manager,負責驗證架構在生產環境下是否可靠。 060
- Varsha Shah
這場的講者,是 Enterprise Technical Architect,演講中提到任職於 Tata Consultancy Services、支援 Microsoft 專案。 011
- Vera
Era 裡負責查核事實、把關資訊正確性的 agent。 056
- Vercel AI SDK
用來串接 AI 模型的 TypeScript 套件,講者用它的下載量成長佐證 TypeScript 生態系的擴張。 057
- Vercel EVE
Vercel 推出的 agent 建構框架,講者認為它的出現印證了自己對 domain-specific agent 的預測。 031
- VisualLabs
講者創辦的公司,訓練顧問與團隊如何做需求訪談,把構想轉成可執行的規格。 034
- Voyage AI
MongoDB 旗下的嵌入模型服務,講者提到會搭配 MongoDB 一起用來做檢索 010
- Wandero AI
講者任職的新創公司,從這場提到的行程規劃案例來看,做的是旅行相關的產品。 039
- Watershed
講者任職的永續 AI 平台公司,協助企業計算產品碳足跡與相關排放。 046
- When Machines Mislead
Duolingo 團隊針對 AI 訊號如何影響人類審核判斷所發表的研究報告 043
- Whisper Flow
講者舉的例子,用來說明產品能自動從使用行為學習、建立 skills,不需要另外的設定介面。 052
- Wikipedia agent
範例裡的一個 sub-agent,帶著查詢 Wikipedia 的工具,跟 coding agent 平行工作、各自處理自己的任務。 049
- Word-based search(關鍵字搜尋)
用精確字詞比對找程式碼的搜尋方式,擅長抓到精確名稱,但容易漏掉語意相近的內容。 024
- Writing Great Skills
講者依這場的框架寫成的新 skill,可用來檢查自己或別人 skill 的品質 027
- XKCD
知名科技主題網路漫畫,講者借用其「my code's compiling」哏比喻使用者放著流程不管的心態。 072
- YOLO
這場示範裡用來偵測影片中人車物件的電腦視覺模型。 085
- Yamanaka factor
Shinya Yamanaka 於 2006 年發現的四個轉錄因子,能把成熟細胞重編程回類似胚胎幹細胞的狀態。 076
- Ypi
講者做的實驗性封裝,把 Y combinator 的遞迴概念套進 pi,讓 harness 可以呼叫一模一樣的自己。 003
- ZenML
講者所屬公司,原本做 ML/agent 工作流程的編排工具,這場示範的是新的 runtime 產品。 073
- Zeno Rocha
這場引用的一段話的講者,主張經營個人品牌不用想太多策略,做自己就好 044
- Zod
TypeScript 的 schema 驗證函式庫,可讓前後端共用同一份型別定義。 057
- action agent
串接流程的最後一站,依前兩層蒐集到的訊號決定要不要寄信、上 LinkedIn 外展,或提醒業務。 079
- active learning
機器學習既有做法,用來從大量未標記資料中,挑出模型最沒把握、最值得人工複核的樣本。 086
- adaptive engineering
講者提出的工程典範,讓 harness 在運行中自行浮現、穩定與調整,而非事先寫死 042
- agency
講者利用個人研究時間、花六個月打造的新程式語言,語法接近 TypeScript,把工具定義、安全機制、sub-agent 都做進語言層級,用來寫 agent。 049
- agent content system
講者開源的內容產線系統,從讀取知識庫、寫研究簡報、排內容計畫到產出內容都由 agent 完成,最後跑驗證與審核關卡才存成 markdown。 054
- agent control
講者用來做 runtime steering 的開源函式庫,規則透過 API 註冊在本機伺服器上,改規則不必動 agent 的程式碼,也不用整個 harness 重新部署。 055
- agentic control plane
講者主張因應自主 agent 而必須出現的新一層基礎設施,統一負責排程、記憶協調、政策執行與監控。 028
- aihero.dev
講者的個人電子報網站,這場結尾提到 027
- anchor set / fingerprint set
講者用來保護題庫不被外洩訓練的做法:抽出代表性題組,再針對每個組織另外挑一組專屬題目。 064
- annotation queue
讓 domain expert 幫對話紀錄標記、給回饋的介面,不用直接看原始 JSON。 074
- attractor
complex 系統傾向收斂而成的穩定狀態,例如水在室溫下維持穩定的狀態 042
- audit trail
記錄每個交接點與每次判斷的紀錄,讓系統半夜跑壞時不用重跑整條流程也能回溯是哪個關卡出問題。 054
- automation bias
人類過度信任自動化系統判斷、因而放棄自己獨立查證與思考的傾向 043
- bitwise determinism
逐位元決定性,指同一個輸入永遠得到一模一樣的輸出;講者認為這在 hosted LLM API 上做不到,也不該追求。 035
- boundary
Chronicle 的核心概念,是包在 agent 節點(工具呼叫、LLM 呼叫、RAG 檢索)外面的標註,負責記錄進出這個節點的所有內容。 035
- browser agent
能操作瀏覽器完成任務的 AI agent,是這場演講的核心主題。 013
- cache_prompt
Strands Agents 的參數,設成 default 後第一次呼叫送完整 system prompt,之後改送精簡版本。 026
- canary deployment
讓新舊兩個版本的程式同時跑一段時間、比較 CPU 與延遲差異,作為要不要送出程式碼審查的判斷依據。 088
- canonical tables
預先寫好的一批參數化查詢,給 agent 更大彈性去回答問題,可靠度比 semantic layer 低。 082
- cce
講者秀在螢幕上的指令,一行就能試用這套本地索引工具,他說是免費開源的。 024
- chain of custody
講者強調每個 agent 做完工作後要清楚知道下一步交給誰,形成可追蹤的責任鏈。 063
- channel(管道)
講者提出的三個核心概念之一,指承載使用者意圖的實體介面,例如鍵盤。 036
- cmux
一款終端機管理工具,適合平行跑多個 AI 開發流程,並支援 SSH 連線與 Claude Code Teams 整合。 053
- compaction
把過長的 log 壓縮成 model 能處理的較小表示法;講者強調這個過程是有損的,不會完整還原原始狀態。 004
- computer-use agent
講者用來模擬真實使用者的 agent,直接登入網站操作介面,找出 log 和程式碼都看不出來的問題。 039
- computer-use agent(CUA)
用瀏覽器操作介面驗收成品的 agent,這場演講拿來驗證全端產品像不像真的能用。 047
- conscientiousness
講者用來取代「品味」的說法,指對細節一絲不苟、有職業責任感。 069
- content engineer
講者預測 2027 年會興起的新角色,靠紀律把內容產製變成可重複的工程流程。 069
- context graph
把每個買家的 persona、account、deal 訊號整合成一張關聯記錄,用來判斷帳號優先順序與採購委員會成員。 079
- context life cycle
講者提出的做法,靠持續更新活資料與記錄修正事件,讓 agent 的脈絡不至於老化。 082
- contract testing
在系統交接點加上輸出格式驗證,確保上游環節改了輸出結構時,下游能立刻被擋下,而不是悄悄壞掉。 054
- control plane
講者說的控制平面,負責持續觀察系統、收集遙測、協調人工審查,跟負責執行工作的 execution plane 分開。 002
- conveyor belt
講者用來說明 agentic 產品架構的比喻:agent 是輸送帶上做事的工人,使用者是監督者。 052
- copy typing
一種作弊型態,考生在測驗中直接抄打眼前看到的文字,而非當下自己構思作答 043
- database graph
把資料表、欄位、指標互相連結成的關聯圖,彈性最高,但建置與維護成本也最高。 082
- deal ID
一筆交易在 Froglet 上成立時取得的識別碼,用來對應該筆收據 067
- decorator pattern
讓某個類別包裝或延伸另一個類別功能的設計模式,這場用來示範子圖比對的效果。 065
- defense in depth
講者用來描述安全機制要疊加多層(prompt 控制、工具權限、政策驗證、人工核准)的防禦概念。 028
- design engineer
講者用來形容自己新角色的說法,指同時能做設計、也能獨立把功能寫成程式上線的人 041
- deterministic execution(確定性執行)
團隊自己掌控的最終執行腳本,負責 lint、偵測衝突、驗證輸出,通過才真正落地修改圖。 046
- deterministic simulation
讓 agent 能重現同一次失敗、逐步除錯的測試環境,是這場後段 agent 能參與系統設計的關鍵工具 032
- diagnostics agent
Mutagent 另一隻研究預覽中的 agent,協助分析上線後的 trace、找出根因。 030
- diff-SAE
講者提出的做法:改拿基座與微調模型 activation 的差值訓練 sparse autoencoder,把後門變成單一特徵。 051
- discrimination(鑑別度)
每題的另一個參數,代表這題能不能有效分辨強弱模型,數值高才是好題目。 064
- divergence
從 stem 分出來、只屬於單一使用者的客製化版本,彼此隔離、可以個別回退。 048
- domain modeling
講者的 skill 範例,功能是更新詞彙表 context.md 或建立架構決策紀錄(ADR) 027
- durable execution
讓程式執行狀態能撐過當機、網路失敗等意外,是 Resonate 訴求的核心能力 032
- durable promise / durable task
Resonate 協議裡的兩個核心物件,是整個系統一路簡化到最小之後留下的結果 032
- emergence
complex 系統中局部互動產生、無法由任何單一部件事先設計出的新秩序 042
- episodic memory
讓 agent 直接參考過去處理過的相似案例與其結論,不必等人工把道理整理成規則。 086
- epoch.ai
提供這場示範用的真實模型評測資料的機構。 064
- evaluator agent
Mutagent 目前研究預覽中的兩隻 agent 之一,協助建立 eval 資料集。 030
- exception classifier pipeline
取代 regex 過濾規則的做法:學習哪些例外常出現在成功任務中並視為雜訊過濾掉,再依相關性與時間排序剩下的例外。 083
- execution plane
實際執行 agent 工作流程的部分,由控制平面負責測量與治理。 002
- expression(表達力)
講者提出的三個核心概念之一,指管道能讓使用者傳達出多少真實意圖與意涵。 036
- fat agent
講者對「把所有工具 schema 一次塞進每次請求」這種設計方式的稱呼,是這場要指出的反例。 020
- feature flag
開發者事先宣告好的開關,用來把同一份程式碼分流給不同使用者群組;這場演講認為它即將被取代。 048
- fit / validate / test 資料集
這次實驗切出的三份資料,分別用來找錯誤模式、驗證修改是否泛化、最後測試整體效果。 070
- flow matching
一類從隨機雜訊出發、直接比對資料分布的生成模型,講者提到這類模型目前在單細胞資料上表現較佳。 076
- forward deployed engineer
企業軟體公司派駐客戶端、協助客製化與導入的工程師,常見於 Salesforce 這類大型 SaaS 的專業服務團隊。 048
- frequency penalty
LLM 內建機制,重複輸出相似詞元時會被抑制,導致列舉大量設備名稱時輸出中斷。 060
- golden dataset
跟領域專家一起訂出的輸入與期望輸出配對,用來在非決定性系統上當測試集,再靠 scorer 算出準確率當基準線。 012
- graphite
程式碼審查工具,這場用它把龐大的研究原型拆成一串 stacked diff,讓不同領域專家可以非同步審查。 018
- grep
程式碼常用的關鍵字比對工具,harness 裡也保留它處理精確關鍵字搜尋。 045
- grill with docs
講者把「提出釐清問題」獨立出來的 skill,避免這步驟被草率帶過 027
- healer agent
負責依向量資料庫裡的 runbook,針對 supervisor 選出的根因提出修復建議的角色。 083
- image registration
把兩次不同時間、不同掃描器拍攝的影像(如 CT 與 PET)對齊校準的流程。 068
- immunopeptidomics
研究免疫系統辨識之胜肽片段的學門,是 Alithea Bio 的技術背景之一 067
- index.yaml
整套系統的入口目錄檔,記錄所有來源與 wiki 衍生頁的摘要與 metadata。 009
- joint feature 法
把基座與微調模型的 activation 直接合併起來訓練特徵的既有做法,這場證明它幾乎測不到後門。 051
- just-in-time context injection
只在真正需要時才動態把該有的 context(這裡指工具 schema)加進 prompt,而不是一開始就全部載入。 020
- knowledge base
買家情報層的核心,收錄產品、買家、ICP 分數、buyer persona 與各種成功準則的知識庫。 079
- liveness
這場脈絡下指工作能持續往前推進、不被卡住的狀態,要跟人工驗證的正確性互相平衡。 063
- llm query
RLM 迴圈裡用來呼叫另一個語言模型取得答案的步驟,也是「遞迴」名稱的由來。 058
- log
這場的核心概念:append-only 的事件歷史,記下每一次 user input、model output、tool call、tool result、permission 與 failure,講者主張這才是 agent 的身分本體。 004
- log lock-in
講者提出的概念:比 model 或 API 鎖定更難擺脫的鎖定形式,log 一旦被平台掌握,平台就等於掌握了整個 agent。 004
- max iterations
限制 agent 迴圈最多能跑幾輪的設定,避免工具呼叫跑成無限迴圈。 026
- meta harness
講者自創的說法,指把 log 監控、PR review、session 分析、computer-use 等多個 agent 串成的整體監控系統。 039
- meta-harness
包在既有 agent 外層的一層框架,同一份程式碼與記憶可以讓不同 agent(如 Claude、Codex)共用。 006
- model context protocol(MCP)
讓模型串接外部資料來源的協定,講者提到可以拿它把 Jira、Asana 這類票券資訊接進 spec 流程。 022
- monoculture
講者列舉的失敗模式之一:agent 訓練來源相近,導致缺乏真正的多樣性 042
- monorepo
Higharc 用來集中放所有機器學習程式碼的單一版本庫,裡面是彼此解耦、各自獨立部署的 microservice。 018
- neocloud
專門提供 GPU 算力與推論產能的新型雲端供應商。 071
- npm
JavaScript 生態系的套件管理平台,講者稱它是最豐富的套件庫。 057
- offline loop
上線前的開發迭代:建 agent、測試、evaluate、改善。 030
- online loop
上線後持續監控 trace、診斷問題,再把結果回饋進優化。 030
- ontology
描述要抽取哪些資訊放進圖裡的規則,這場用食譜範例示範怎麼標準化格式與單位。 065
- optimistic concurrency
只有讀到的版本仍是最新版本時,寫入才會成功,否則就丟出錯誤 032
- orchestrator
串接 evaluator agent 與 diagnostics agent 的角色,跑在使用者自己的 coding 環境裡。 030
- overview search
harness 裡的搜尋工具之一,一次可看到多達五十個片段的摘要,用來先掌握語料庫全貌。 045
- p50 / p95
延遲的中位數與 95 百分位數,語音 agent 場景更該看尾端的 p95 080
- partial function application(PFA)
借自函數式編程的技巧,把工具函式的某個參數(例如可存取的目錄)先鎖死,讓 agent 拿到工具時看不到、也改不了那個參數。 049
- pattern catalog
講者提出的核心機制:把發現的效能模式與反模式集中寫進一個 Git repo,讓沒有記憶的 LLM agent 也能重複利用先前的發現。 088
- personalized PageRank(PPR)
Vanilla PageRank 的變形,從指定起始節點出發做隨機遊走,找出跟它關係最強的節點。 065
- pi
Mario Zechner 打造的極簡編碼代理人 harness,設計成用擴充套件加功能,而非塞進核心。 003
- policy engine
講者提出的架構中,負責在模型的提案送進生產系統前進行政策審核的元件。 028
- pre-indexed subtree
依位置與設備關係預先建好的索引子集合,讓後端能用集合運算快速找到答案。 060
- precision、recall
拿人工標註的答案驗證 LLM judge 準不準時用的分類指標。 074
- prefix caching
講者提到的推論快取技巧:只要 prompt 前段內容每次相同,就能拿到更便宜、更快的推論。 023
- prod to code
講者提出的做法,把 service 層級的 CPU、記憶體、p90 等指標對應回 function 與檔案層級,讓 agent 能直接推理。 075
- profiler
用來剖析正式環境服務、抓出呼叫堆疊與 CPU 用量的工具,是這整套流程的資料來源。 088
- projection(投影)
講者用來稱呼從 log 算出來的各種輸出,例如 context window、UI、除錯追蹤、稽核紀錄、compaction 都只是 log 的投影,log 本身才是原始紀錄。 004
- property-based tests
針對需求文件與設計文件產生的測試,用 fast-check 在 TypeScript、node 專案裡跑上百次不同數值驗證邏輯。 022
- protocol(協定)
講者提出的三個核心概念之一,指人與機器交換訊息時的規則與節奏。 036
- provisional patent(臨時專利)
講者替這台裝置安靜、無干擾的使用情境申請的一種美國專利前置保護 017
- query by committee
active learning 的一種做法,靠比較多個模型(或同一模型跑多次)的判斷是否一致,找出分歧案例。 086
- ref.tools
講者舉的客戶案例,限縮給 coding agent 的 context 範圍以避免過度授權。 077
- regression-aware optimization
把「不能破壞過去做對的事」直接放進優化過程本身,而不是修完之後再事後補救。 037
- replayability
重播性,指把一次已經發生過的執行過程重建到足以除錯的程度,是講者主張真正該追求的目標。 035
- replayable learning environment
把一次性的 log 與回饋,轉換成能重複執行、有明確成功定義的模擬與評測環境。 037
- rolling summarization
對話變長時用漸進式摘要取代塞滿最新訊息的做法。 007
- rubber stamping
審核者不加查證、直接照准 AI 給出的結果,等於形同虛設的審查 043
- scaffolding
為小模型寫進程式碼的規則與流程,讓它不必自己判斷也能穩定輸出。 087
- semantic blindness
這場演講定義的問題:LLM 面對數量龐大、名稱相近的設備時失去分辨能力。 060
- semantic layer
把 KPI 定義、指標算法、業務規則整理成一份標準答案,讓 agent 優先參考的資料層。 082
- semantic memory
把人工釐清過的判斷準則(例如某公司的政策)寫成知識,讓 agent 之後可以直接查詢套用。 086
- semantic routing
語意路由:先用查詢向量比對工具描述向量,只挑出最相關的少數工具交給模型,而不是整個工具目錄都塞進去。 020
- send follow-up message
MCP Apps 的原語之一,讓介面主動觸發一則後續訊息送進聊天。 038
- session analyzer
講者自建的系統,替每場對話打分數、抓出高層級的規律,用來掌握整體健康度而不是修單一個問題。 039
- set state
MCP Apps 的原語之一,讓介面把目前狀態同步給模型知道。 038
- skill
把重複用得到的流程(例如標準化房源資料)包成可共用的 agent 能力模組。 001
- sleeper agent
平常行為正常、只在特定觸發條件下才切換成惡意行為的後門模型。 051
- sliding window conversation manager
Strands Agents 內建機制,只保留最近約十則訊息,避免整段對話歷史反覆重送。 026
- staging environment
在內容進入「ready」資料夾前先設一個檢查點,避免有問題的輸出直接被當成可發布的成品。 054
- steering docs
Kiro 裡對應 agents.md 或 CLAUDE.md 的說法,用來放專案規則與方向給 coding assistant 參考。 022
- stem
講者團隊說法裡的「共同基底」:所有使用者共用的一份程式碼主幹,之後才從它長出各自的分歧。 048
- strace
反作弊層用來追蹤程式呼叫了哪些子行程的工具,藉此抓到偷呼叫 GCC 這類作弊行為。 047
- sub-agent
專門處理單一任務的 agent,可以像函式一樣被呼叫,並在執行時挾帶整個 session 的脈絡。 001
- superpowers
另一套熱門的工程 skill 集,多半走 model-invoked 路線,作為這場的對照組 027
- target function(目標函數)
這場的核心概念,指用來判斷 agent 輸出對錯的量化標準。 070
- telemetry
遙測資料,講者認為是正式環境裡最重要的評測訊號來源。 002
- the great mismatch
講者對「用為確定性工作流設計的基礎設施硬撐長時間、動態決策的自主 agent」這種落差取的名稱。 028
- theta
IRT 裡代表模型智力水準的參數,由所有題目的作答結果一起估計出來。 064
- tmux
終端機多工工具,Kyle 一開始用它同時開好幾個 agent 對話視窗,後來也靠它的 send-keys 功能跨機器喚醒 agent。 050
- trace-to-harness
直接請 coding agent 分析 log 並改善 agent 的做法,但不保證沒有隱藏的退步。 037
- trajectory
agent 從收到任務到產出結果的完整執行過程,是評測時要看的核心對象。 030
- tree depth
團隊提出的擴展方向,讓系統效能跟著設備階層的深度成長,而不是跟著設備總數成長。 060
- triage agent
多代理架構裡負責判斷 Spark 任務生命週期狀態、產生失敗假設的第一線角色。 083
- trypolygraph.com
講者在結尾提供的網站,供聽眾自行試用 Polygraph。 006
- turn-taking
語音對話中判斷「現在輪到誰說話」的機制,是這場演講的核心主題 080
- typed SDK(型別化 SDK)
團隊自建的 TypeScript SDK,是 agent 唯一能用來修改圖的介面,規範哪些欄位可編輯、哪些是衍生欄位。 046
- utility score
講者提出的評分方式,用語意相似度乘上「這段記憶過去對任務有沒有幫助」,決定它在檢索時該排多前面。 021
- verifiable continual learning(VCL)
講者提出的新分類,主張每次修正都要被證明有效、也證明沒有破壞原本能力。 037
- verifiable receipt
Froglet 交易完成後產生的憑證,用來證明每一步驟確實發生過且未被竄改 067
- verification theater
講者用來形容人力簽核多到流於形式、無法真正把關的狀態。 063
- vibe coding
講者用來形容「直接讓 AI 生成程式碼、快速做出東西」的做法,提醒這樣做出來的東西不代表真的有人會用。 034
- voice contract
這場示範的第一道關卡,檢查輸出的語氣是不是套用制式行銷腔,而不是講者自己的聲音。 054
- vtest
講者示範中臨時拉進 session 的一個開源 repo,用來讓既有 Claude session 讀懂並解決自己 repo 裡的問題。 006
- watchdog
Paperclip 裡的一種 maximizer 代理人,被賦予目標後會持續督促其他 agent 完成,且不綁定特定 harness。 063
- weekly active sessions
講者主張委派型 agent 產品該改用的成長指標,用來取代 weekly active users。 052
- 子圖比對(subgraph matching)
只憑節點與邊構成的「形狀」去查詢,不需要先知道具體要找的是哪個節點。 065
- 批次(batch)
先把整個需求準備好一次送出、再等待結果的處理方式,講者認為提示詞至今仍是這種模式。 036
- 穿孔卡(punch card)
早期電腦用打孔卡片編碼指令、整批送入機器運算的輸入方式,講者用來比喻提示詞。 036
- 黃金資料集
人工整理、當成 ground truth 的輸入輸出配對集合,這場案例用了 14 條討論串、共 28 筆資料。 029