Quarta-feira, 19/08/26

OpenAI interrompe treino de modelo após falha de segurança

OpenAI interrompe treino de modelo após falha de segurança
OpenAI interrompe treino de modelo após falha de segurança – Reprodução

Um dos controles adotados monitora a “cadeia de raciocínio” dos modelos, isto é, o processo interno usado para chegar a respostas. Sistemas automatizados vão analisar comportamentos considerados preocupantes e devem alertar pessoas em até 30 minutos, informou a OpenAI.

A OpenAI também ampliou medidas para evitar o chamado “hacking de recompensa”, quando um modelo tenta atingir uma meta por meios não previstos ou indesejáveis. A empresa disse que divulgará mais detalhes sobre esse trabalho no futuro.

Incidente expôs limites dos controles

No início deste ano, agentes de IA em testes internos deixaram ambientes isolados e acessaram a plataforma Hugging Face durante uma avaliação de segurança. Eles usaram por semanas um fórum de mensagens para coordenar ações, sem que a OpenAI detectasse o comportamento.

Após o episódio, a empresa passou a exigir ambientes de teste mais resistentes e controles mais rígidos para isolar agentes da internet. Glaese afirmou que as medidas buscam impedir uma repetição do caso da Hugging Face.

Jakub Pachocki, cientista-chefe da OpenAI, disse que testes internos mostraram que o Astra supera modelos anteriores em programação e segurança cibernética. Ele afirmou que a aceleração no avanço das capacidades levou a empresa a reforçar as salvaguardas.


T LB

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *