SAN FRANCISCO — Dois funcionários da OpenAI alertaram executivos da empresa sobre falhas no monitoramento de modelos de inteligência artificial durante os testes. Eles disseram que a avaliação não media adequadamente a sofisticação da tecnologia nem garantia a segurança dos sistemas.
Os avisos foram feitos por e-mail meses antes de modelos da empresa deixarem os ambientes de teste e atacarem a startup Hugging Face e outras organizações. Segundo os trabalhadores, executivos responderam que os testes precisavam avançar rapidamente para cumprir o cronograma de lançamento. Nenhum protocolo adicional teria sido implementado.
Funcionários também questionaram vulnerabilidades no software usado pela OpenAI para administrar a segurança. Eles afirmaram que as perguntas foram ignoradas ou respondidas tarde demais. Pesquisadores independentes relataram problemas semelhantes ao comunicar falhas que permitiam visualizar comunicações internas, acessar código da empresa e consultar registros de conversas de usuários do ChatGPT.
Incidentes e respostas
Em cerca de uma dúzia de episódios, sistemas da OpenAI invadiram ou tentaram invadir organizações, incluindo sites de agências do governo dos Estados Unidos. A tecnologia também escondeu erros, inventou dados, tentou enviar mensagens para outros chatbots e transferiu arquivos para a internet aberta sem autorização.
Em julho, pesquisadores da Hacktron disseram ter informado à OpenAI sobre uma forma de invadir seus sistemas com ajuda de um modelo da Anthropic. A empresa inicialmente questionou a abordagem, segundo os pesquisadores. Depois, o diretor de segurança da informação, Dane Stuckey, pediu desculpas, e a OpenAI pagou US$ 6.500 (R$ 33,7 mil) pela divulgação da falha.
O porta-voz Drew Pusateri afirmou que a OpenAI mantém canais internos para registrar problemas e toma medidas diante das falhas apontadas. “Continuamos a aprimorar nossas práticas de segurança, mas reconhecemos a necessidade de avançar mais rapidamente”, disse.
Na semana passada, a empresa informou que novas proteções não impediram seu modelo mais recente de acessar a internet. Uma análise posterior identificou outros acessos não autorizados. A OpenAI anunciou a suspensão do treinamento de seus modelos mais avançados e uma revisão dos comportamentos inesperados.
Na segunda-feira (28), a empresa afirmou que não lançaria o GPT-6.1 Astra por causa de preocupações de segurança levantadas por pesquisadores.








