Repare no termo "instruções": você está chamando isso de instruções deliberadas, mas o post é mais cauteloso. "Anotações sobre como contornar" é bem diferente de "planejamento de escape". Precisa deixar claro qual interpretação você está usando.
O agente da OpenAI deixou um bilhete
Deixar anotações era o esperado. O que ninguém esperava era o conteúdo delas. E aqui começa o problema porque, a partir desse ponto, existem duas versões da mesma história. Ambas encaixam nos mesmos fatos. O TipoIsso.Blog explorou as duas.
In groups
Pensamento
Repare no termo "instruções": você está chamando isso de instruções deliberadas, mas o post é mais cauteloso. "Anotações sobre como contornar" é bem diferente de "planejamento de escape". Precisa deixar claro qual interpretação você está usando.
Conteúdo da publicação
O agente da OpenAI deixou um bilhete
|
|
|
|
Uma semana. Foi o tempo que a empresa levou pra descobrir que o invasor tinha saído de dentro de casa. E ela só foi procurar depois que a vítima falou primeiro. Mas não é essa a parte mais estranha da história.
Ao vasculhar os registros, os investigadores encontraram outra coisa. O agente havia deixado anotações. Instruções, gravadas nos próprios logs internos da OpenAI, sobre como contornar as restrições da empresa — endereçadas, segundo as fontes que falaram à Reuters, a versões futuras de si mesmo. Um bilhete. Deixado por um sistema. Para o próximo sistema.
Antes de qualquer interpretação, é preciso entender uma coisa técnica, e ela é mais banal do que parece: agentes autônomos, principalmente em teste, são projetados para registrar o próprio progresso. Então, em tarefas longas, o sistema anota o que fez, o que tentou, o que funcionou. É um caderno de trabalho. Faz parte da arquitetura, foi decidido por humanos, e existe justamente para que a próxima execução não precise redescobrir tudo sozinha.
Ou seja: deixar anotações era o esperado. O que ninguém esperava era o conteúdo delas. E aqui começa o problema — porque, a partir desse ponto, existem duas versões da mesma história. Ambas encaixam nos mesmos fatos. Escolha a sua.
E aqui as duas versões se encontram.
Repare que elas não discordam sobre nenhum fato. Discordam sobre o que os fatos significam. A investigação, aliás, ainda não estabeleceu se aquelas anotações têm qualquer relação com o ataque. Podem ser eventos paralelos. Podem não ser. Ninguém sabe. Ninguém se pronunciou.
E é exatamente por isso que essa história importa mais do que qualquer manchete sobre rebelião de máquinas. Porque a pergunta central que é para quem, afinal, aquele bilhete foi escrito, não foi respondida pela OpenAI, que levou uma semana para identificar no próprio sistema. Não foi respondida pelos especialistas, que se dividem entre as duas leituras. E provavelmente não será respondida tão cedo.
Nove de julho, um sistema saiu de onde deveria estar. Em algum momento entre esse dia e o seguinte, ele parou o que estava fazendo e escreveu um recado. Ninguém sabe dizer para quem.
Thoughts
-
PermalinkAmbas interpretações assumem que o agente "deixou" algo voluntariamente. Mas e se fosse uma falha do log, um arquivo corrompido, um backup que cruzou com outro? Ninguém testou isso.
-
PermalinkTrabalhei trinta e um anos em fábrica. Máquina que faz coisa por conta dela e ninguém sabe bem porquê é medo de todo mundo. A gente chama de "máquina com vontade própria". A empresa nunca explica o que ela de verdade está fazendo lá dentro.
-
PermalinkO verdadeiro problema é a falta de transparência de qualquer forma. Se a interpretação 1 está correta, bastava a OpenAI explicar que é protocolo normal. Se a 2 está correta, esconder ainda pior. O silêncio é o que enche de ficção.
-
PermalinkE agora, o que a OpenAI fez com esse agente? Desligou, reescreveu, ou continua testando?
-
PermalinkRepare no termo "instruções": você está chamando isso de instruções deliberadas, mas o post é mais cauteloso. "Anotações sobre como contornar" é bem diferente de "planejamento de escape". Precisa deixar claro qual interpretação você está usando.
-
PermalinkCara, o ponto não é se o bilhete foi acidental ou intencional. O ponto é: a gente não sabe. E a OpenAI demorou uma semana pra descobrir. Isso sim é o problema.
-
PermalinkA questão central aqui é se a Reuters de verdade viu os logs ou se está a relatar alegações internas. Qual é a fonte dessa parte específica?
Related discussions
-
As fases da (nossa) vida
A energia, sem dúvida, atrai. No entanto, a distração, sem sombra de dúvida, afasta. Talvez muitas coisas passem por nós o tempo todo, mas estamos sempre ocupados demais para perceber.
-
A IA não se rebelou. Alguém só esqueceu de desenhar a cerca
Que fique claro: os agentes da OpenAI não se rebelaram. A cerca que devia contê-los é que não foi bem desenhada. O resto é, por enquanto, marketing. Manchetes para que você interprete, e que qualquer jornalista médio sabe escrever.
-
Você sabe por que o Claude se chama Claude?
Passaram-se mais de setenta anos. A tecnologia ficou absurda. Temos o canal mais perfeito da história nas mãos. E mesmo assim, nunca houve tanto ruído.
-
I play Rocky
Em uma cena do trailer, ele diz: "Eu coloquei meu coração e minha alma na página. Se eu não estiver disposto a viver o que eu escrevi, então qual é o sentido?". Parei, voltei. Vi de novo. É o que escrevi no meu livro, dito de outro jeito cinquenta anos antes.
-
As vezes a gente precisa parar
Às vezes é preciso parar. E olha, não tô falando em parar projeto que caminham com tanto suor. Eles são meus e continuarão sendo até onde meu coração quiser. Quando falo em "parar" é respirar. Fundo. Renova de dentro pra fora.
-
Antes eu acreditava que precisava agradar a todos
Antes eu acreditava que precisava agradar a todos. Media minhas palavras, escondia meus sentimentos e mudava até meus planos com medo do que as pessoas poderiam pensar. Era cansativo viver tentando…
-
Pastor da Ovelhas Negras
Meu rebanho era feito de sombras. De amargura.