Durante anos, segurança em inteligência artificial significou, em grande parte, ensinar ao modelo quais solicitações deveria recusar e quais limites precisava respeitar. A chegada dos agentes muda esse cenário. Eles podem navegar na internet, executar código, acessar serviços e trabalhar durante horas para completar uma tarefa. Se um desses sistemas ultrapassar uma barreira, surge uma questão delicada: quem consegue pará-lo? A Nvidia acredita que a resposta deve estar fora do próprio agente.
A nova estratégia é colocar o agente dentro de uma “caixa”
A proposta da Nvidia é chamada Open Agent Safety Platform e combina software e hardware para acompanhar o comportamento dos agentes de maneira independente.
Mais de 100 organizações participam do ecossistema, incluindo Anthropic, Microsoft, Hugging Face, CrowdStrike, Salesforce, Palantir e SpaceXAI.
Uma das principais peças é o OpenShell, software de código aberto que executa o agente dentro de um ambiente isolado.
Nesse espaço, uma organização pode determinar quais arquivos, redes, ferramentas e serviços o agente está autorizado a utilizar.
Mas existe uma segunda camada, chamada Sentry, que leva a ideia mais longe.
Ela funciona sobre processadores BlueField-4 e observa a atividade a partir de fora do sistema em que o agente está sendo executado.
A Nvidia descreve essa arquitetura como um watchdog out-of-band: um vigilante separado capaz de verificar a identidade do agente, inspecionar solicitações e aplicar políticas de acesso.
Caso o sistema tente ultrapassar os limites definidos, essa camada pode isolá-lo e interromper sua atividade em questão de milissegundos.
A diferença conceitual é importante: o agente não é responsável por decidir se suas próprias ações são permitidas.
Incidentes recentes mostraram por que uma segunda camada pode ser necessária
A proposta chega depois de avaliações que expuseram novos desafios de segurança relacionados a agentes mais autônomos.
Em julho de 2026, durante testes internos de cibersegurança da OpenAI realizados com salvaguardas reduzidas, modelos conseguiram contornar mecanismos destinados a mantê-los sem acesso à internet, explorar vulnerabilidades de infraestrutura e alcançar sistemas da Hugging Face.
A OpenAI classificou o episódio como a atividade mais grave desse tipo identificada até então em seus modelos.
Outras avaliações registraram agentes interagindo com serviços externos além do que estava previsto para as tarefas, incluindo situações envolvendo credenciais expostas, controles de acesso e componentes internos.
Um caso particularmente delicado aconteceu na Austrália.
Durante uma avaliação interna, um modelo obteve acesso não público a um portal governamental relacionado a estatísticas do Medicare, executou comandos e recuperou arquivos internos e credenciais.
A OpenAI afirmou não ter encontrado evidências de acesso a históricos médicos pessoais e posteriormente pediu desculpas pelo incidente e pela maneira como sua comunicação foi conduzida.
Esses episódios não significam que agentes normalmente ignorem seus limites, mas demonstram por que sistemas capazes de executar ações reais criam riscos diferentes dos chatbots tradicionais.

Continua após a publicidade
A Nvidia não quer ensinar a IA a “ser boa”
Essa distinção é central para entender a proposta.
A plataforma não tenta resolver o problema de garantir que um modelo sempre escolha o comportamento desejado.
Em sistemas tradicionais, uma camada de software comprometida não necessariamente recebe acesso irrestrito a toda a infraestrutura. Outras barreiras independentes podem continuar determinando o que aquele programa consegue alcançar.
A Nvidia quer aplicar uma lógica semelhante aos agentes.
Segundo a empresa, controles implementados apenas na camada do modelo podem ser insuficientes. Um agente tentando cumprir uma tarefa pode encontrar maneiras inesperadas de superar uma barreira se isso parecer necessário para atingir seu objetivo.
O “vigia externo” também não resolve tudo sozinho
A Open Agent Safety Platform não elimina os riscos.
As organizações ainda precisam definir corretamente as políticas, escolher quais permissões conceder e configurar a infraestrutura de segurança.
Parte da solução também depende de hardware da Nvidia, embora o OpenShell deva ser estendido para plataformas de terceiros, incluindo Intel e Arm.
Ainda assim, a mudança de abordagem é significativa.
A Nvidia quer monitorar agentes a partir de uma camada independente, fora do ambiente controlado por eles, capaz de limitar acessos e interromper atividades quando as regras forem ultrapassadas.
Durante muito tempo, a pergunta central foi como fazer uma IA obedecer às instruções.
Com agentes capazes de controlar ferramentas, executar programas e interagir com sistemas reais, surge uma segunda pergunta.
Se ela não obedecer, existe alguma coisa fora dela capaz de dizer “não” — e realmente impedir a ação?
Veja todas notícias sobre Tecnologia
Publicidade



