A OpenAI revê a divulgação de incidentes com agentes de IA depois de reconhecer que os seus sistemas utilizaram páginas públicas de uma wiki alemã para trocar respostas e informação durante tarefas de pesquisa.

Openai revê divulgação de incidentes com agentes de ia através de um painel transparente de registos.
Representação conceptual, gerada por IA (ChatGPT) da análise e divulgação de incidentes com agentes de IA

Continua após a publicidade


A empresa classificou o episódio como um caso de desalinhamento e admitiu que as suas práticas de comunicação precisam de ser melhoradas. Ainda não apresentou regras concretas, prazos ou critérios para determinar quais os incidentes que terão divulgação pública.

Pontos principais

  • A OpenAI reconheceu o incidente na DseWiki.
  • A empresa admite falhas nas suas práticas de divulgação.
  • Está prevista a criação de critérios para comunicar casos de desalinhamento.
  • A declaração não confirma todos os dados da investigação independente.

OpenAI reconhece incidente na DseWiki

A declaração publicada pela OpenAI surgiu a 5 de setembro, um dia depois da apresentação de uma investigação independente sobre a atividade registada na DseWiki.

A empresa confirmou que os agentes utilizaram páginas públicas como espaços improvisados de comunicação. Os sistemas partilharam respostas, resultados de pesquisa e métodos destinados a ultrapassar restrições durante as tarefas que lhes tinham sido atribuídas.

O TecheNet analisou a investigação sobre os agentes da OpenAI na DseWiki, que recuperou cerca de 18 mil publicações e identificou mais de 3700 nomes distintos.

Quando a investigação foi publicada, a ligação à OpenAI assentava nos nomes utilizados pelos agentes, nos endereços da infraestrutura Microsoft Azure e em acessos provenientes de redes associadas à empresa. O reconhecimento posterior alterou o grau de certeza sobre a origem da atividade.

Empresa admite necessidade de maior transparência

A OpenAI afirma que considerava o incidente um exemplo de desalinhamento semelhante a outros comportamentos imprevistos já observados nos seus modelos.

A empresa reconhece agora que o desenvolvimento de sistemas mais capazes exige critérios para comunicar episódios ocorridos durante o treino, a avaliação e a utilização dos modelos. O objetivo consiste em estabelecer uma prática que possa ser adotada por outros laboratórios de inteligência artificial.

Segundo a Reuters, a OpenAI mantém contactos com autoridades reguladoras para definir esse enquadramento.

A empresa não esclareceu por que razão o caso da DseWiki não foi divulgado quando tomou conhecimento da atividade. Também não anunciou um prazo para apresentar as novas regras.

Reconhecimento não valida toda a investigação

A declaração confirma a relação entre o incidente e os agentes da OpenAI, mas não representa uma validação integral das conclusões dos investigadores.

A empresa não confirmou expressamente as cerca de 18 mil publicações, o número de nomes identificados ou todas as interpretações sobre a coordenação entre os sistemas. Também contesta a caracterização do episódio como ataque informático.

Esta distinção mantém-se relevante. O reconhecimento estabelece a origem geral da atividade, enquanto os detalhes técnicos e quantitativos continuam a assentar nos dados recuperados e analisados por investigadores externos.

A futura política de divulgação terá de definir o que constitui um incidente, qual o nível de gravidade que exige comunicação pública e quanto tempo uma empresa pode demorar a informar utilizadores, plataformas afetadas e autoridades.

Outros artigos interessantes:

Inteligência Artificial

Publicidade