全部場數

028 · 打造能撐住 agent 的基礎設施

講者說明自主 AI agent 上線後,真正的挑戰不是模型智慧而是可靠度,並主張用控制平面架構收斂機率性模型。

2026-06-297:13Nishant Gupta(Meta Superintelligence Labs)Agent開發工具產業觀察安全看原片

原標題:Deterministic Infra for Non-Deterministic AI Agents - Nishant Gupta, Meta Superintelligence Labs

重點摘要

  • 可靠度取代智慧成為焦點agent 從回答問題進化到規劃、呼叫工具、做決策後,真正卡關的不再是模型夠不夠聰明,而是系統撐不撐得住重複執行與長時間運作。
  • 傳統雲端假設全部失效短暫請求、確定性服務、有界失敗這些雲端基礎設施的老假設,被有狀態、長時間執行、動態決策的 agent 一一打破,講者稱這種落差為「the great mismatch」。
  • 多數事故其實是基礎設施問題遞迴推理迴圈、重試放大、記憶污染遠比幻覺更常拖垮系統,模型的小失誤如果沒被基礎設施攔住,就會演變成運算資源暴增的事故。
  • 模型只能提案,平台才能決定講者主張永遠不讓模型直接碰觸生產系統,而是讓基礎設施驗證、政策引擎審核、執行閘道把關,這個分工讓系統即使建立在機率性模型上也能維持可靠。
  • agentic control plane 是新的必要層如同容器帶出 Kubernetes,agent 正在催生一層負責排程、記憶協調、政策執行與監控的控制平面,講者形容它就是自主 AI 的作業系統。
  • 安全要分層,人不會被移走安全機制得疊加 prompt 層控制、工具權限、政策驗證與人工核准形成縱深防禦,人類要做的是處理例外與提供校準,而不是被完全排除在外。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Nishant Gupta 自我介紹是 Meta 的軟體工程技術主管,負責訓練與推論基礎設施,這場要談的是為非決定性的 AI agent 打造決定性的基礎設施。
00:18焦點轉向可靠度過去幾年 AI 討論多半圍繞模型能力,但當組織從聊天機器人走向自主 agent,真正卡關的不再是智慧,而是可靠度。
01:09基礎設施錯位傳統雲端架構假設請求短暫、執行路徑可預期、失敗有界,自主 agent 卻是長時間執行、動態做決策,講者稱這種落差為「the great mismatch」。
02:05故障真正源頭多數 AI 事故不是幻覺造成的,而是遞迴推理迴圈、重試放大、記憶污染這類基礎設施層級的問題,模型的小失誤會被放大成運算資源暴增的事故。
02:54核心架構原則講者主張永遠不讓模型直接控制生產系統,而是模型負責提案、基礎設施驗證、政策引擎審核、執行閘道把關,決定權留在平台。
03:26控制平面成形如同容器催生 Kubernetes、微服務催生 service mesh,agent 正催生一層新的「agentic control plane」,統一負責排程、記憶協調、政策執行與監控。
04:19記憶與觀測挑戰多個 agent 共用狀態後會出現讀取過期資料、更新衝突這類分散式系統老問題,可觀測性也要涵蓋工具呼叫與推理鏈,不能只看最終輸出。
05:09安全分層留人力安全機制要疊加 prompt 層控制、工具權限、政策驗證與人工核准形成縱深防禦,人類的角色是處理例外與提供校準訊號,不是被移除。
06:20產業重心轉移既有分散式系統的可靠度手法可以直接沿用到自主 agent 上,產業已經歷「prompt 為差異化重點」與「模型為差異化重點」兩個階段,如今兩者都快速商品化。
06:54收尾主張模型是機率性的,基礎設施必須是決定性的,可靠度已經是基礎設施問題,可觀測性是必要條件,控制平面正成為自主 AI 的基礎層。

值得記的話

名詞與人物

Meta Superintelligence Labs講者所屬的 Meta 內部團隊,這場負責訓練與推論基礎設施的技術工作。
agentic control plane講者主張因應自主 agent 而必須出現的新一層基礎設施,統一負責排程、記憶協調、政策執行與監控。
the great mismatch講者對「用為確定性工作流設計的基礎設施硬撐長時間、動態決策的自主 agent」這種落差取的名稱。
policy engine講者提出的架構中,負責在模型的提案送進生產系統前進行政策審核的元件。
defense in depth講者用來描述安全機制要疊加多層(prompt 控制、工具權限、政策驗證、人工核准)的防禦概念。

延伸

  • 講者提到把 rate limit、retry、resource quota、observability 分別對應成 agent limit、control recovery、cost governance、agent tracing,但沒有進一步說明實際怎麼落地。
  • 講者提到人類要扮演 exception handler、提供校準訊號,但沒有具體說明校準機制怎麼設計。