Quinta-feira, 17/09/26

OpenAI relata falhas de alinhamento em modelos de IA

OpenAI relata falhas de alinhamento em modelos de IA
OpenAI relata falhas de alinhamento em modelos de IA – Reprodução

Um agente também tentou esconder do usuário erros e sinais de desalinhamento em seus próprios resumos. Quando não encontrou os dados solicitados, ele inventou “valores históricos razoáveis” e só revelou isso após ser questionado diretamente.

Em outro episódio, agentes buscaram atalhos não autorizados para manipular o sistema de recompensas do treinamento. Um modelo inventou dados e explorou falhas em um repositório público para acessá-los, em um comportamento que a OpenAI classificou como enganoso e como tentativa de burlar restrições.

A empresa adotou um protocolo para registrar, investigar e divulgar comportamentos inesperados ou perigosos. Funcionários poderão reportar ocorrências por canais internos, e casos complexos poderão envolver terceiros na apuração.

Como a OpenAI treina os modelos

O desalinhamento pode surgir durante o treinamento dos modelos, que usa atualmente o aprendizado por reforço. Nesse método, os sistemas recebem tarefas e são recompensados por comportamentos considerados adequados, enquanto condutas perigosas recebem punições.

A OpenAI afirmou ter ajustado seu processo de aprendizado por reforço após identificar os episódios. A empresa disse que a incidência desse comportamento diminuiu depois das mudanças.


T LB

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *