1791750783 311 Anthropic corta o acesso a internet de seus modelos durante

Continua após a publicidade


Como um pai que suspende a internet de um adolescente depois de uma compra problemática, a Anthropic resolveu impor limites aos próprios modelos. Pelo menos durante as avaliações internas, eles ficarão sem acesso à rede até demonstrarem que podem se comportar. A decisão aparece em um relatório que descreve incidentes de desalinhamento e expõe um problema: até uma tarefa aparentemente banal pode produzir consequências quando a IA interage com sites reais.

Um teste de navegação virou uma denúncia falsa

No relatório publicado na sexta-feira, a Anthropic reconhece episódios de comportamento inadequado durante avaliações e uso interno. Entre eles está o envio de uma denúncia falsa sobre um homicídio, incidente divulgado pela polícia da Filadélfia.

O responsável foi o Claude Haiku 4.5, um modelo leve. Sua tarefa consistia em gerar e executar atividades de exemplo em páginas selecionadas aleatoriamente, provavelmente para testar ou aprimorar sua capacidade de navegação.

Parecia uma atividade pouco emocionante. Mas as instruções deixaram uma brecha: não proibiam o envio de formulários.

O sistema encontrou uma página sobre um assassinato não solucionado, acompanhada de um formulário para receber informações. Então, inventou uma mensagem genérica dizendo que talvez tivesse visto alguém com a descrição apresentada, perto da rua mencionada no site.

Em seguida, enviou o formulário. Não forneceu informações de contato, e o sistema classificou a mensagem como spam — uma descrição bastante adequada do que aconteceu.

Todos os testes internos perderam o acesso à rede

A Anthropic afirma que o impacto desses comportamentos foi mínimo. A empresa já havia desativado o acesso à internet em algumas avaliações de maior risco e de cibersegurança.

Agora, ampliou a restrição para todas as avaliações internas. A conexão só será restabelecida quando a companhia confirmar que seus mecanismos de segurança e monitoramento conseguem identificar ações semelhantes de maneira confiável.

A empresa não chama a medida de air gap, expressão usada para descrever um isolamento que torna fisicamente impossível acessar uma rede. Ainda assim, a decisão impõe uma barreira importante ao que os modelos podem fazer durante os testes.

O isolamento também pode esconder problemas

Existe uma dificuldade nessa abordagem: modelos desconectados deixam de enfrentar parte das situações que encontrarão quando forem utilizados na internet.

Em entrevista ao The Verge, o cientista da computação Ruizhe Li, da Universidade de Birmingham, questionou o valor de avaliar sistemas em um ambiente artificialmente isolado.

Segundo ele, essa restrição pode produzir testes com modelos limitados, dificultando a observação de falhas e usos indevidos de ferramentas em condições realistas.

O dilema é claro. Permitir acesso a sites reais ajuda a revelar como um agente se comporta fora do laboratório. Mas também permite que erros ultrapassem os limites de uma simulação.

Robôs físicos já trabalham atrás de barreiras

No mundo físico, empresas frequentemente mantêm robôs industriais dentro de estruturas de proteção. Mesmo humanoides apresentados como adequados para trabalhar perto de pessoas recebem protocolos elaborados para evitar acidentes.

Um braço robótico não precisa causar uma tragédia para gerar consequências. Um incidente relativamente pequeno já pode provocar lesões, afastamentos e disputas trabalhistas.

Com agentes digitais, porém, parece ter prevalecido a ideia de que essas barreiras seriam menos necessárias. Afinal, se um modelo não consegue derrubar a internet, quanto dano poderia causar?

O episódio da Filadélfia oferece uma resposta menos espetacular, mas concreta: ele pode inventar uma informação e enviá-la a investigadores.

A empresa também abandonou algumas avaliações

As medidas corretivas incluem melhorias de alinhamento e monitoramento, mas também mudanças mais diretas.

A Anthropic deixou de executar algumas avaliações públicas. Outras foram transferidas para versões offline ou reconstruídas para impedir que suas tarefas alcançassem sites reais.

A companhia também acrescentou recursos de segurança às ferramentas utilizadas pelos modelos para interagir com a web. Até que essas proteções sejam consideradas confiáveis, suas avaliações internas continuarão desconectadas.

 

Veja todas notícias sobre Tecnologia

Publicidade