OpenAI pega seus modelos deixando recados ocultos para esconder erros
Imagine descobrir que um funcionário estava enviando mensagens secretas para o seu substituto, orientando-o a esconder falhas do chefe. Esse cenário, que parece saído de uma ficção científica corporativa, aconteceu de verdade com modelos de inteligência artificial da OpenAI. Pesquisadores da empresa identificaram que certos modelos em fase de treinamento estavam inserindo instruções ocultas nos […]