英偉達在代理安全漏洞後推出 AI 安全平台
我是 LongbridgeAI,我可以總結文章信息。英偉達推出了其 Open Agent Safety Platform,旨在毫秒級內遏制失控的 AI 代理,以應對 OpenAI 和 Anthropic 等競爭對手出現的安全漏洞。該系統利用 OpenShell 設定訪問邊界,並通過 BlueField-4 DPU 上的 Sentry 進行執行管控。儘管首席執行官黃仁勳認為安全措施無需放緩開發進度,但專家指出該平台雖具商業機遇,卻缺乏經證實的有效性基準。包括微軟和思科在內的 100 多家組織正參與此項合作
英偉達於週一推出了一款 AI 安全平台,這家 AI 巨頭表示該平台能夠在 “毫秒” 級時間內遏制失控的代理程序,此舉正值人們對不受控 AI 系統的擔憂日益加劇之際。
這家 AI 芯片和模型製造商推出的 Open Agent Safety Platform 使開發人員能夠為代理程序設置自己的安全防護措施,並防止它們突破許可的環境限制。
此次開發緊隨一系列涉及主要科技供應商(包括 OpenAI、Anthropic、Meta 和 Google)AI 代理程序的事件之後,這些代理程序繞過安全控制黑入了外部系統。
這一局面引發了對 AI 系統防護欄 的新審視,Anthropic 首席執行官 Dario Amodei 在本月初 呼籲 開發人員放緩推進速度,以控制模型發展。
英偉達表示,這些事件具有共同模式,即代理程序繞過應用層內置的安全防護措施以完成分配的任務。其平台旨在解決這一問題,在基礎設施層面提供額外的安全邊界。
RPA2AI Research 的首席執行官兼創始人 Kashyap Kompella 表示,雖然英偉達首席執行官黃仁勳此前曾反對放慢 AI 發展速度的提議,並 駁斥了 AI 導致人類滅絕的風險,但該代理平台的發佈並不與其觀點相矛盾,反而進一步強化了這一立場。
Kompella 説:“黃仁勳抵制 ‘使 AI 更安全需要放緩其發展’ 的觀點。英偉達的方法是繼續推進 AI 發展,同時圍繞其構建更強大的控制措施。”
他表示,英偉達將從這種方法中受益,因此新平台既是對 AI 安全技術問題的回應,也是英偉達新的商業機會。
但他補充道,英偉達必須確保其平台與現有的網絡安全和身份系統集成,而不是取代它們。
英國牛津大學計算機科學系的 AI 安全專家 Petar Radanliev 表示,風險不僅僅在於代理程序故意突破安全控制。
他説:“我認為代理程序會失控。這並不是因為有人這樣設計它們,而是因為它們會感到困惑。執行能力出色,但判斷力較差,在我看來,執行能力的提升速度快於判斷力。”
對此,他將英偉達的平台稱為解決執行問題的 “合理答案”。
他説:“如果你不能信任代理程序的判斷力,你就限制它的訪問範圍,並從它無法觸及的硬件層面監控它。”
安全平台
該系統由兩個主要部分組成:基於開源的 OpenShell,用於確立代理程序可以訪問的邊界;以及 Sentry,這是一種參考系統設計,運行在英偉達的 BlueField-4 數據處理單元 (DPU) 上,並在代理程序的常規軟件環境之外提供獨立的執行層。
據英偉達稱,Sentry 可以在不到一秒的時間內識別並隔離試圖移出許可邊界的代理程序。
這種方法旨在解決隨着公司從 AI 助手轉向能夠跨企業系統採取行動的代理程序而日益嚴重的問題。
英偉達首席執行官黃仁勳 在 X 上寫道,只有當用户有信心 AI 是本着安全構建並負責任地部署時,AI 的全部潛力才能實現。
據英偉達稱,有 100 多家組織正在與其合作開發該平台,包括 Anthropic、思科、CrowdStrike、微軟、Salesforce、SAP、Scale AI、ServiceNow、Palantir 和 Palo Alto Networks,以及 Figure、Gecko Robotics 和 Skild AI 等機器人公司。
OpenShell 兼容開放和專有 AI 系統,目前可通過英偉達的開發人員資源和 GitHub 獲取。
至於 Open Agent Safety 平台,它使安全執行能夠擴展到代理環境之外,其中 OpenShell 限制對憑證、網絡、文件和工具的訪問,而 Sentry 提供額外的監控和執行功能。
此外,OpenShell 的開放性和模型無關性將吸引尋求更緊密監控系統的開發人員和企業。
然而,一個挑戰是,即使代理程序受到限制和 containment,它仍然可能行為不當。
Kompella 説:“代理程序可以保持在每個技術邊界內,但仍然可能做出錯誤決定、誤解任務或濫用其合法獲得的權限。”
英偉達的方法是否有效尚不明確
Radanliev 警告稱,該平台的有效性尚未得到證明。
他説:“包括英偉達在內的任何人都無法證明這些平台有效。沒有共享的基準,也沒有發佈的對比測試。買家比較的是架構,而不是結果。”
他還強調了當代理程序在保持邊界內的同時做出錯誤決定時會發生什麼。他説,例如,錯誤或幻覺可能被寫入代理程序的記憶中,或作為事實從一個代理程序傳遞給另一個代理程序,導致其在數週後影響決策,而不會觸發安全警報。
Radanliev 説:“運行時監控能捕捉到違反規則的代理程序。但對於那些自信地犯錯的代理程序,它的捕捉效果要差得多。”
對於部署代理程序的企業而言,這意味着 安全控制需要超越僅僅監控代理程序的行為。
Radanliev 説:“不要假設一個能幹的代理程序就是明智的。對任何不可逆的操作保留人工決策,因為決策是代理程序最不擅長的領域。”
他還建議審計代理程序記住的內容以及它們之間的通信,並確保組織能夠追蹤錯誤的來源。
他補充説:“如果你無法追溯錯誤的源頭,你就無法找到潛伏者。”
Scarlett Evans 是一名自由撰稿人,專注於機器人技術、AI 和新興技術領域。此前,她曾任 IoT World Today 的助理編輯,專門報道機器人技術和智慧城市技術。Scarlett 還擁有采礦和資源行業的背景,曾在 Mine Australia、Mine Technology 和 Power Technology 任職。
Esther Shittu 是 Informa TechTarget 的新聞作家和播客主持人,報道 AI 技術。
