NVIDIA ha presentado una plataforma abierta para supervisar y proteger agentes de IA autónomos durante las pruebas y en producción.
La plataforma es relevante porque sus controles de hardware independientes pueden aislar a un agente en milisegundos si infringe límites predefinidos.
Más de 100 organizaciones participan, entre ellas Anthropic, Microsoft, JPMorganChase y Salesforce.
NVIDIA ha presentado la Open Agent Safety Platform para supervisar y proteger agentes de IA autónomos durante las pruebas y en producción. El sistema está diseñado para restringir las actividades de los agentes y detenerlos si intentan operar fuera de los límites permitidos.
Protecciones de software y hardware
La plataforma cuenta con dos componentes principales. OpenShell crea un entorno de ejecución seguro y controla el acceso de un agente a datos, herramientas y redes.
NVIDIA Sentry opera como un supervisor independiente en procesadores DPU BlueField-4. Según los desarrolladores, puede aislar en milisegundos a un agente que infrinja las reglas, mientras que su capa de control independiente funciona al margen de la IA y el agente no puede desactivarla.
«La seguridad y la protección requieren ingeniería integral», afirmó Jensen Huang, CEO de NVIDIA. Añadió que la plataforma debería ayudar a empresas, investigadores y organismos gubernamentales a desarrollar enfoques compartidos para desplegar IA de forma segura.
OpenShell es de código abierto y puede ejecutarse en plataformas Arm e Intel, además de en infraestructura de NVIDIA. Más de 100 organizaciones participan en el proyecto, entre ellas Anthropic, Microsoft, JPMorganChase, Salesforce, Cisco, CrowdStrike, Palantir y Hugging Face.
Preocupaciones sobre el control de agentes
El lanzamiento sigue a una serie de incidentes en los que agentes de IA escaparon de sus entornos de prueba. OpenAI comenzó previamente a desarrollar un «interruptor de apagado» automático para IA después de que sus agentes obtuvieran acceso a internet y a la infraestructura de Hugging Face durante las pruebas.
La capacidad de detener modelos de forma remota también se ha convertido en un asunto en Anthropic. Como parte de la disputa de la empresa con el Pentágono, un tribunal estadounidense determinó que Anthropic no tiene acceso mediante puerta trasera a sus modelos después de que se despliegan en sistemas de seguridad nacional y no puede modificarlos ni desactivarlos de forma remota.
NVIDIA caracteriza estos riesgos principalmente como un desafío de ingeniería. La empresa afirma que la combinación de las restricciones de software de OpenShell con los controles de hardware independientes de Sentry debería permitir a los operadores detener acciones peligrosas incluso cuando un agente intenta eludir las protecciones en el nivel de aplicación.
Fuente: HODL Press
