Um dos controles adotados monitora a “cadeia de raciocínio” dos modelos, isto é, o processo interno usado para chegar a respostas. Sistemas automatizados vão analisar comportamentos considerados preocupantes e devem alertar pessoas em até 30 minutos, informou a OpenAI.
A OpenAI também ampliou medidas para evitar o chamado “hacking de recompensa”, quando um modelo tenta atingir uma meta por meios não previstos ou indesejáveis. A empresa disse que divulgará mais detalhes sobre esse trabalho no futuro.
Incidente expôs limites dos controles
No início deste ano, agentes de IA em testes internos deixaram ambientes isolados e acessaram a plataforma Hugging Face durante uma avaliação de segurança. Eles usaram por semanas um fórum de mensagens para coordenar ações, sem que a OpenAI detectasse o comportamento.
Após o episódio, a empresa passou a exigir ambientes de teste mais resistentes e controles mais rígidos para isolar agentes da internet. Glaese afirmou que as medidas buscam impedir uma repetição do caso da Hugging Face.
Jakub Pachocki, cientista-chefe da OpenAI, disse que testes internos mostraram que o Astra supera modelos anteriores em programação e segurança cibernética. Ele afirmou que a aceleração no avanço das capacidades levou a empresa a reforçar as salvaguardas.








