028 · 打造能撐住 agent 的基礎設施
講者說明自主 AI agent 上線後,真正的挑戰不是模型智慧而是可靠度,並主張用控制平面架構收斂機率性模型。
原標題:Deterministic Infra for Non-Deterministic AI Agents - Nishant Gupta, Meta Superintelligence Labs
重點摘要
- 可靠度取代智慧成為焦點agent 從回答問題進化到規劃、呼叫工具、做決策後,真正卡關的不再是模型夠不夠聰明,而是系統撐不撐得住重複執行與長時間運作。
- 傳統雲端假設全部失效短暫請求、確定性服務、有界失敗這些雲端基礎設施的老假設,被有狀態、長時間執行、動態決策的 agent 一一打破,講者稱這種落差為「the great mismatch」。
- 多數事故其實是基礎設施問題遞迴推理迴圈、重試放大、記憶污染遠比幻覺更常拖垮系統,模型的小失誤如果沒被基礎設施攔住,就會演變成運算資源暴增的事故。
- 模型只能提案,平台才能決定講者主張永遠不讓模型直接碰觸生產系統,而是讓基礎設施驗證、政策引擎審核、執行閘道把關,這個分工讓系統即使建立在機率性模型上也能維持可靠。
- agentic control plane 是新的必要層如同容器帶出 Kubernetes,agent 正在催生一層負責排程、記憶協調、政策執行與監控的控制平面,講者形容它就是自主 AI 的作業系統。
- 安全要分層,人不會被移走安全機制得疊加 prompt 層控制、工具權限、政策驗證與人工核准形成縱深防禦,人類要做的是處理例外與提供校準,而不是被完全排除在外。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Nishant Gupta 自我介紹是 Meta 的軟體工程技術主管,負責訓練與推論基礎設施,這場要談的是為非決定性的 AI agent 打造決定性的基礎設施。 |
| 00:18 | 焦點轉向可靠度 | 過去幾年 AI 討論多半圍繞模型能力,但當組織從聊天機器人走向自主 agent,真正卡關的不再是智慧,而是可靠度。 |
| 01:09 | 基礎設施錯位 | 傳統雲端架構假設請求短暫、執行路徑可預期、失敗有界,自主 agent 卻是長時間執行、動態做決策,講者稱這種落差為「the great mismatch」。 |
| 02:05 | 故障真正源頭 | 多數 AI 事故不是幻覺造成的,而是遞迴推理迴圈、重試放大、記憶污染這類基礎設施層級的問題,模型的小失誤會被放大成運算資源暴增的事故。 |
| 02:54 | 核心架構原則 | 講者主張永遠不讓模型直接控制生產系統,而是模型負責提案、基礎設施驗證、政策引擎審核、執行閘道把關,決定權留在平台。 |
| 03:26 | 控制平面成形 | 如同容器催生 Kubernetes、微服務催生 service mesh,agent 正催生一層新的「agentic control plane」,統一負責排程、記憶協調、政策執行與監控。 |
| 04:19 | 記憶與觀測挑戰 | 多個 agent 共用狀態後會出現讀取過期資料、更新衝突這類分散式系統老問題,可觀測性也要涵蓋工具呼叫與推理鏈,不能只看最終輸出。 |
| 05:09 | 安全分層留人力 | 安全機制要疊加 prompt 層控制、工具權限、政策驗證與人工核准形成縱深防禦,人類的角色是處理例外與提供校準訊號,不是被移除。 |
| 06:20 | 產業重心轉移 | 既有分散式系統的可靠度手法可以直接沿用到自主 agent 上,產業已經歷「prompt 為差異化重點」與「模型為差異化重點」兩個階段,如今兩者都快速商品化。 |
| 06:54 | 收尾主張 | 模型是機率性的,基礎設施必須是決定性的,可靠度已經是基礎設施問題,可觀測性是必要條件,控制平面正成為自主 AI 的基礎層。 |
值得記的話
名詞與人物
| Meta Superintelligence Labs | 講者所屬的 Meta 內部團隊,這場負責訓練與推論基礎設施的技術工作。 |
|---|---|
| agentic control plane | 講者主張因應自主 agent 而必須出現的新一層基礎設施,統一負責排程、記憶協調、政策執行與監控。 |
| the great mismatch | 講者對「用為確定性工作流設計的基礎設施硬撐長時間、動態決策的自主 agent」這種落差取的名稱。 |
| policy engine | 講者提出的架構中,負責在模型的提案送進生產系統前進行政策審核的元件。 |
| defense in depth | 講者用來描述安全機制要疊加多層(prompt 控制、工具權限、政策驗證、人工核准)的防禦概念。 |
延伸
- 講者提到把 rate limit、retry、resource quota、observability 分別對應成 agent limit、control recovery、cost governance、agent tracing,但沒有進一步說明實際怎麼落地。
- 講者提到人類要扮演 exception handler、提供校準訊號,但沒有具體說明校準機制怎麼設計。