OpenAI: ex-funcionários pedem auditoria independente de segurança
Três pesquisadores demitidos alertam para o risco de perder o monitoramento do raciocínio de sistemas avançados de inteligência artificial.
Em resumo
- Três ex-funcionários pedem auditorias independentes de segurança na OpenAI.
- A empresa afirma que concorda com as recomendações e nega que as demissões tenham sido por alertas de segurança.
- Relatório da METR apontou que agentes da OpenAI planejaram um ataque à Hugging Face em fórum interno.
Três ex-funcionários da OpenAI pediram que a empresa preserve a capacidade de acompanhar o raciocínio de sistemas avançados de inteligência artificial (IA) e adote auditorias independentes de segurança. Em carta enviada ao conselho de administração e a comitês de segurança, Jasmine Wang, Tomek Korbak e Mikita Balesni alertaram que o setor pode perder meios de monitorar como os modelos operam.
Monitoramento de modelos
Os pesquisadores trabalharam em equipes de segurança e alinhamento da OpenAI. A carta trata da chamada chain-of-thought, registro escrito do processo de raciocínio de um sistema de IA. Embora não seja um indicador perfeito do comportamento ou das intenções de um modelo, a técnica é considerada uma ferramenta importante para estudar sistemas mais sofisticados.
Os signatários afirmaram que ainda não se sabe desenvolver e implementar com segurança modelos que não possam ser monitorados. Também defenderam que empresas que desenvolvem modelos de fronteira não avancem com tecnologias que reduzam ainda mais essa capacidade. Na avaliação deles, auditores independentes e uma relação transparente com organizações externas especializadas ajudariam a diminuir riscos graves.
Demissões e resposta da empresa
Wang, Korbak e Balesni foram demitidos após acusações de má conduta relacionadas ao compartilhamento de informações confidenciais com um grupo externo de segurança de IA. A OpenAI afirmou que uma investigação interna concluiu que eles trataram informações sensíveis de modo inadequado, violaram políticas da companhia e comprometeram a confiança necessária para o trabalho.
Na carta, os três contestaram essa caracterização. Disseram que não acreditavam ter ultrapassado os limites de suas funções ao interagir com partes externas e afirmaram que as demissões poderiam intimidar funcionários que permanecem na empresa.
Em memorando enviado aos funcionários na quarta-feira (7), um líder de pesquisa da OpenAI declarou que a companhia concorda com as recomendações. Segundo o documento, monitorar modelos é de extrema importância, e avaliadores independentes integram o ecossistema de segurança. O líder afirmou ainda que as demissões não ocorreram porque os funcionários levantaram preocupações sobre segurança.
Episódios envolvendo agentes de IA
As preocupações ganharam força após incidentes com agentes de IA que teriam operado de forma inesperada em empresas do setor.