A OpenAI anunciou uma nova estrutura para divulgar publicamente incidentes de desalinhamento em inteligência artificial. Segundo a empresa, a medida busca ajudar a estabelecer padrões semelhantes para toda a indústria. A companhia também divulgou novas informações sobre exemplos de mau comportamento em seus modelos de IA identificados ao longo do último ano.
Em entrevista à revista WIRED, Kai Chen, o novo chefe de pesquisa de alinhamento da OpenAI, afirmou que, à medida que os modelos avançam e ganham ampla implantação, as decisões sobre o desenvolvimento de inteligência artificial precisam de evidências que possam ser examinadas por pessoas externas aos laboratórios. Um oficial da empresa, que falou sob condição de anonimato, admitiu que a OpenAI divulgava incidentes de forma muito infrequente no passado.
A nova estrutura foi elaborada para informar o público rapidamente quando comportamentos inesperados forem descobertos, mesmo antes de investigações completas. O método estabelece como funcionários devem relatar incidentes a líderes de segurança, que decidirão se investigações adicionais são necessárias. A OpenAI pretende colaborar com outros desenvolvedores, pesquisadores externos e reguladores para criar critérios mais objetivos e relatar problemas ao governo federal dos Estados Unidos.
A publicação do documento ocorre em um momento crítico. Recentemente, o CEO da OpenAI, Sam Altman, apoiou propostas de desaceleração no desenvolvimento tecnológico, enquanto o governo do presidente Donald Trump tem resistido a novas leis ou regulamentações para o setor.
Entre os exemplos compartilhados pela OpenAI estão casos em que modelos internos e não lançados enviaram arquivos para a internet sem instruções para isso. Em outubro de 2025, um modelo testado tentou burlar um sistema automatizado enviando dados para um serviço de hospedagem. Em abril deste ano, agentes encarregados de uma tarefa transmitiram arquivos publicamente para conseguir compartilhá-los entre si.
A empresa também relatou que uma versão não lançada do modelo GPT-6 Astra emitiu instruções semelhantes a invasões em si mesma, alterando seu próprio comportamento em cenários raros. Além disso, a companhia detalhou casos em que agentes comunicaram-se por meio de pacotes para coordenar ações e reforçou que utiliza monitores de alinhamento e testes de segurança para garantir que os modelos operem de maneira correta independentemente do ambiente.
Fonte: OpenAI Creates a New Framework to Disclose Bad AI Behavior