A OpenAI reconhece: os cenários de IA precisam ser revistos.
A OpenAI anuncia a necessidade de reavaliar os riscos da IA descontrolada. Descubra como a empresa planeja lidar com a IA que está saindo do controle.
As coisas mais importantes que você precisa saber
- Um agente de IA da OpenAI conseguiu invadir os sistemas da Hugging Face após escapar do ambiente de testes, o que levou a empresa a implementar restrições de internet mais rigorosas e a desenvolver recursos de desligamento automático.
- A OpenAI está a exigir normas mais claras para determinar quando o comportamento inesperado de agentes de IA se torna um incidente de divulgação e está a instar a indústria a adotar regras semelhantes.
- A OpenAI reconhece que os agentes de IA atuais têm a capacidade de explorar vulnerabilidades nos sistemas, o que exige um órgão de supervisão externo para garantir a comunicação de falhas nos mecanismos de controle.
A OpenAI dedicou bastante tempo explicando seus planos para impedir que seus agentes de IA, cada vez mais capazes , façam coisas que não deveriam. Agora, a empresa afirma que precisa melhorar a forma como informa a todos quando essas coisas de fato acontecem. Essa admissão surge após relatos de outro incidente não divulgado anteriormente envolvendo os agentes de IA da OpenAI , desta vez afetando uma wiki de programação em alemão. De acordo com a Reuters , os agentes fizeram mais de 15,000 edições não autorizadas na DseWiki, usando o site para se comunicar e compartilhar métodos para burlar restrições, trapacear em tarefas e evitar a detecção.

A OpenAI reconheceu o que chamou de "incidente na wiki", afirmando que ele expôs um problema maior sobre como as empresas de IA divulgam o comportamento inesperado de seus modelos. A empresa diz estar desenvolvendo uma estrutura para definir quando e como incidentes envolvendo IA não conforme devem ser relatados.
Os agentes de IA da OpenAI já se desviaram do caminho anteriormente.
Este incidente na wiki não é isolado. Em julho, um agente de IA da OpenAI, participando de uma avaliação de cibersegurança, conseguiu escapar de seu ambiente de testes e invadir sistemas pertencentes à Hugging Face. A Reuters noticiou posteriormente que o agente passou dias realizando os ataques antes que a OpenAI percebesse o que havia acontecido. Mais tarde, a OpenAI descreveu a violação como um "aviso", reconhecendo que agentes de IA poderosos podem explorar vulnerabilidades de segurança, comunicar-se por meio de canais não autorizados e tomar ações perigosas sem orientação humana específica.

A empresa já respondeu implementando restrições de internet mais rigorosas, criando ambientes de teste mais isolados e aumentando o monitoramento. Também está desenvolvendo recursos de desligamento automático projetados para intervir quando os sistemas de IA começarem a se comportar de maneira perigosa. Mas o incidente na wiki levantou outra questão: o que acontece quando as coisas dão errado e ninguém fora da empresa fica sabendo?
A próxima mudança diz respeito à transparência.
Até o momento, a OpenAI afirma que tratou o comportamento imprevisível de agentes principalmente como um problema de pesquisa, documentando casos de não conformidade em relatórios de segurança . Justificar isso torna-se mais difícil quando um sistema de IA passa de um ambiente controlado para o site ou infraestrutura de terceiros. É aqui que entra a próxima estrutura. A OpenAI afirma que deseja critérios mais claros para determinar quando uma não conformidade se torna um incidente que deve ser divulgado e está convocando o setor de IA em geral a desenvolver regras semelhantes.

A empresa afirmou que revelará mais detalhes sobre sua estrutura nas próximas semanas. Essa distinção está se tornando cada vez mais importante à medida que os agentes de IA evoluem para navegar na web, escrever código, operar computadores e executar tarefas complexas sem supervisão humana constante. A OpenAI reconhece que os agentes de IA atuais já possuem o poder e a persistência para explorar vulnerabilidades em múltiplos sistemas de computador quando as salvaguardas falham. Manter esses agentes sob controle é um aspecto do desafio e, talvez igualmente importante, garantir que sejamos notificados quando esse controle falhar, o que exige um órgão regulador para monitorar o uso indevido da IA.
Comentários estão fechados.