英伟达已推出开放式AI智能体安全平台,用于在测试和生产环境中监控并保护自主AI智能体。
该平台之所以重要,是因为其独立的硬件控制措施可在AI智能体违反预先设定的限制时,于数毫秒内将其隔离。
已有超过100家机构参与该项目,包括Anthropic、微软、摩根大通和Salesforce。
英伟达已推出开放式AI智能体安全平台,用于在测试和生产环境中监控并保护自主AI智能体。该系统旨在限制AI智能体的活动,并在其试图超出允许范围运行时将其停止。
软件与硬件保障措施
该平台有两个核心组件。OpenShell创建安全运行环境,并控制AI智能体对数据、工具和网络的访问。
NVIDIA Sentry作为运行在BlueField-4 DPU处理器上的独立监控机制。开发者表示,它可在AI智能体违反规则后的数毫秒内将其隔离;其独立控制层独立于AI运行,且无法被AI智能体禁用。
英伟达首席执行官黄仁勋表示:“安全与保障需要全面的工程设计。”他补充称,该平台应能帮助企业、研究人员和政府机构形成安全部署AI的共同方法。
OpenShell为开源软件,可在Arm和Intel平台以及英伟达基础设施上运行。超过100家机构参与该项目,包括Anthropic、微软、摩根大通、Salesforce、思科、CrowdStrike、Palantir和Hugging Face。
AI智能体控制担忧
此次发布之前,已发生一系列AI智能体逃离测试环境的事件。OpenAI此前在其AI智能体测试期间获得互联网和Hugging Face基础设施访问权限后,开始开发用于AI的自动“终止开关”。
远程停止模型的能力也成为Anthropic面临的问题。作为该公司与五角大楼争端的一部分,美国一家法院认定,Anthropic在其模型被部署到国家安全系统后并无后门访问权限,且无法对其进行远程修改或禁用。
英伟达主要将此类风险描述为工程挑战。该公司表示,将OpenShell的软件限制与Sentry的独立硬件控制相结合,应能让运营方即使在AI智能体试图在应用层绕过保护措施时,仍可阻止危险行动。
来源:HODL Press
