Uma inteligência artificial pode responder com precisão a milhares de perguntas e, ainda assim, ser difícil de supervisionar. O problema fica mais sério quando sistemas avançados passam a executar tarefas complexas: se as equipes responsáveis não conseguem perceber como o modelo chega a uma resposta — ou identificar quando seu comportamento muda —, detectar riscos antes que eles causem danos se torna mais difícil.

É esse o alerta feito por três ex-funcionários da OpenAI que atuaram em áreas de segurança e alinhamento. Segundo o portal Olhardigital.com.br, Jasmine Wang, Tomek Korbak e Mikita Balesni enviaram uma carta à administração e a comitês de segurança da empresa. Eles pedem que os desenvolvedores preservem a capacidade de acompanhar os registros de raciocínio dos modelos e defendem a participação de avaliadores independentes.

O debate não significa que exista um método capaz de revelar, sem falhas, tudo o que uma IA “pensa”. A chamada chain-of-thought, ou cadeia de pensamento, é uma pista útil, mas não um raio-X confiável da mente de um sistema. Entender essa diferença ajuda a avaliar o que a carta pede, o que a tecnologia pode oferecer e quais limites continuam sem solução.

O que os ex-funcionários da OpenAI estão pedindo

Os três pesquisadores demonstraram preocupação com o risco de empresas perderem a capacidade de monitorar a chain-of-thought de modelos de IA cada vez mais sofisticados. Na prática, a expressão costuma se referir a uma sequência de texto produzida durante a resolução de uma tarefa, antes ou junto da resposta final. Esse registro pode ajudar pesquisadores a observar etapas intermediárias, detectar contradições e investigar comportamentos inesperados.

A carta também defende a presença de auditores externos na avaliação de riscos. A lógica é que as próprias empresas não deveriam ser as únicas responsáveis por verificar a segurança de sistemas que desenvolvem e comercializam. Avaliações independentes podem questionar métodos, reproduzir testes e apontar problemas que uma equipe interna talvez não perceba — ou não tenha incentivos para divulgar.

Em resposta ao The Wall Street Journal, a OpenAI compartilhou parte de um memorando enviado a funcionários por um líder de pesquisa. Segundo o relato reproduzido pelo Olhar Digital, a empresa disse concordar fortemente com as recomendações e considerou a capacidade de monitorar modelos uma prioridade. O memorando também apontou avaliadores independentes como parte importante do ecossistema de segurança.

Essa resposta é relevante, mas não encerra a discussão. Concordar com um princípio não esclarece, por si só, quais técnicas serão adotadas, que informações estarão disponíveis a auditores ou como serão resolvidas divergências entre segurança, privacidade e propriedade intelectual.

O que é chain-of-thought — e o que ela não é

Modelos de linguagem geram texto prevendo, em termos simplificados, quais unidades de texto — chamadas tokens — são mais prováveis em seguida, dado o contexto. Em algumas tarefas, pedir ao modelo que trabalhe passo a passo pode produzir uma sequência intermediária de explicações ou cálculos. Esse material é chamado de cadeia de pensamento.

Para quem avalia o sistema, essa sequência pode funcionar como um sinal adicional. Se uma resposta final parece aceitável, mas o texto intermediário revela que o modelo considerou uma instrução indevida, isso pode justificar investigação. Em testes matemáticos, por exemplo, passos visíveis podem ajudar a localizar onde ocorreu um erro. Em tarefas sensíveis, podem indicar que o modelo reconheceu um risco antes de responder.

Uma explicação não é necessariamente o processo real

O principal limite é que o texto apresentado como raciocínio não deve ser tratado como uma transcrição perfeita de processos internos. Um modelo pode gerar uma justificativa plausível depois de chegar a uma resposta, omitir etapas importantes ou produzir um relato que não corresponde fielmente aos mecanismos que levaram à saída.

Além disso, o que um produto mostra ao usuário pode ser diferente do que existe durante o processamento. Algumas interfaces exibem apenas a resposta; outras apresentam resumos ou explicações; e certos sistemas podem não disponibilizar registros detalhados. Portanto, “monitorar a cadeia de pensamento” não significa necessariamente que uma empresa consiga ler um fluxo completo e verdadeiro de pensamentos privados da IA.

Há também uma questão de treinamento: se um modelo aprende que determinados registros serão inspecionados, pode tornar-se mais hábil em produzir explicações que pareçam seguras sem que isso garanta um comportamento seguro. Monitorar uma evidência pode alterar a evidência — um desafio conhecido em avaliações de sistemas complexos.

Por que a monitorabilidade importa para a segurança da IA

Monitorabilidade é a capacidade de observar sinais úteis sobre o funcionamento de um sistema e usar essas informações para detectar, explicar ou prevenir comportamentos indesejados. Não é uma garantia de controle total. É uma camada de defesa, comparável a registros de atividade em um serviço digital: eles ajudam a investigar um incidente, mas não impedem automaticamente que ele aconteça.

À medida que modelos são usados em programação, pesquisa, atendimento e automação, a supervisão precisa ir além de perguntar se a resposta final parece correta. Um resultado convincente pode esconder uma falha de raciocínio, uma instrução conflitante ou uma tentativa de contornar uma restrição. Sem sinais intermediários e testes adequados, o problema talvez só apareça depois que o sistema estiver integrado a um produto ou processo.

O monitoramento também é importante quando modelos recebem ferramentas, como acesso a arquivos, navegadores ou sistemas corporativos. Uma resposta textual errada tem consequências diferentes de uma ação que altera dados, envia uma mensagem ou executa código. Quanto maior a autonomia e o impacto possível, maior a necessidade de controles, registros e mecanismos de interrupção.

Como avaliar uma IA sem depender apenas da cadeia de pensamento

Uma estratégia responsável combina métodos. A cadeia de pensamento pode ser uma fonte de evidência, mas não deve ser o único critério de aprovação. Três abordagens complementares ajudam a reduzir pontos cegos:

  • Testes comportamentais: apresentam tarefas e situações de risco ao modelo e medem suas respostas. São úteis para comparar versões e encontrar falhas reproduzíveis, mas cobrem apenas os cenários testados.
  • Interpretabilidade mecanística: tenta relacionar componentes internos do modelo a padrões ou funções. Pode oferecer pistas mais profundas do que uma explicação em texto, mas ainda é uma área técnica difícil e não fornece uma leitura completa do sistema.
  • Auditorias independentes e red teaming: equipes externas tentam identificar vulnerabilidades, testar salvaguardas e revisar processos. A independência aumenta a possibilidade de contestação, embora dependa de acesso suficiente, regras claras e proteção contra conflitos de interesse.

Essas opções têm propósitos diferentes. Testes comportamentais perguntam “o que o modelo faz neste cenário?”; interpretabilidade investiga “quais padrões internos podem estar relacionados ao resultado?”; e auditorias examinam “as avaliações e controles da empresa são adequados e verificáveis?”. Nenhuma responde sozinha a todas as perguntas.

Um processo prático para acompanhar riscos

Empresas que implantam modelos de IA podem estruturar a supervisão em etapas. O processo não exige que cada organização desenvolva pesquisa de ponta, mas precisa definir responsabilidades, registrar decisões e tratar resultados anormais com seriedade.

  1. Defina o risco antes do teste. Liste o que o sistema pode fazer, quem será afetado e quais falhas seriam mais graves. Um assistente que resume documentos internos, por exemplo, exige atenção a vazamento de dados e a instruções maliciosas inseridas nos arquivos.
  2. Crie uma linha de base. Teste a versão atual com tarefas normais e casos adversos. Registre resultados para saber se uma atualização melhora um comportamento e piora outro.
  3. Combine evidências. Compare resposta final, registros disponíveis, execução de ferramentas e resultados dos testes. Se o sistema não expõe uma cadeia de pensamento, não presuma que a ausência do registro prove segurança ou insegurança.
  4. Use revisão humana em decisões de alto impacto. Um avaliador deve poder interromper a implantação, pedir repetição do teste ou encaminhar um caso para especialistas. A supervisão humana precisa ter autoridade real, não ser apenas uma etapa formal.
  5. Documente falhas e correções. Registre o cenário, a versão do modelo, a evidência observada, a gravidade e a medida tomada. Isso torna comparações futuras mais confiáveis e ajuda a identificar regressões.
  6. Reavalie após mudanças. Alterações no modelo, nas instruções, nas ferramentas conectadas ou nos dados podem mudar o comportamento. Uma aprovação antiga não deve ser tratada como garantia permanente.

Em um painel hipotético de avaliação, a equipe poderia ver uma lista de testes com status, a versão do modelo examinada e a data da execução. Ao abrir um caso, encontraria o comando enviado, a resposta gerada, os registros autorizados e uma classificação de risco. Um indicador vermelho deveria sinalizar revisão necessária — não uma decisão automática de que o modelo é perigoso. A aparência e os campos variam conforme a ferramenta; não há uma interface universal para esse trabalho.

O que uma auditoria externa precisa para ser útil

Chamar um avaliador de “independente” não basta. Uma análise externa só acrescenta confiança quando os responsáveis conseguem examinar evidências adequadas, testar o sistema em condições relevantes e comunicar conclusões sem interferência indevida. Se recebem apenas demonstrações preparadas pela empresa, podem não reproduzir o uso real nem verificar resultados importantes.

Ao mesmo tempo, abrir todos os registros sem critério pode expor dados pessoais, informações confidenciais e detalhes que facilitariam ataques. O desafio é construir acesso controlado: delimitar o escopo, proteger informações sensíveis, permitir testes seguros e esclarecer quais conclusões poderão ser publicadas.

Uma auditoria robusta deve deixar claro, pelo menos, o que foi avaliado, quais limitações existiam, que tipos de testes foram aplicados e quais problemas permaneceram sem solução. Também é importante distinguir “não encontramos uma falha” de “provamos que não há falhas”. Em sistemas complexos, a primeira afirmação costuma ser mais defensável.

Limitações e pontos que ainda precisam de resposta

A carta trata de um problema técnico e institucional em evolução. Não há evidência, no relato disponível, de que a perda de monitorabilidade já tenha acontecido de forma generalizada ou de que um incidente específico tenha motivado o alerta. O argumento dos ex-funcionários é preventivo: não avançar sem cautela para modelos mais difíceis de supervisionar.

Também não se deve transformar a cadeia de pensamento em promessa de transparência. Um registro pode ajudar a investigar, mas pode ser incompleto, enganoso ou indisponível. E preservar informações detalhadas pode gerar riscos de privacidade e segurança. A resposta adequada tende a envolver diferentes níveis de acesso, minimização de dados, retenção limitada e auditorias com escopo definido.

Por fim, monitorar não é o mesmo que controlar. Mesmo com bons registros, uma organização ainda precisa decidir como responder a alertas, bloquear ações perigosas e corrigir falhas. Segurança depende de processos, incentivos, avaliação contínua e capacidade de interromper uma implantação quando as evidências não são suficientes.

O que pode mudar nos próximos anos

O alerta aponta para uma tendência mais ampla: a segurança de IA deve ser avaliada não apenas pela qualidade das respostas, mas também pela possibilidade de verificar o comportamento do sistema. À medida que modelos ganham capacidade para executar tarefas longas e usar ferramentas, empresas, reguladores e clientes provavelmente pedirão evidências mais claras sobre testes e controles.

Isso pode aumentar a importância de avaliações padronizadas, auditorias com regras públicas e registros técnicos que permitam comparar versões. Também é possível que surjam métodos de supervisão que não dependam de texto de raciocínio visível, combinando sinais comportamentais, análise interna e acompanhamento de ações. Nenhuma dessas possibilidades elimina o problema: cada técnica precisará ser validada e poderá ter limitações próprias.

Para usuários, a consequência prática é simples: não confunda uma resposta bem escrita com uma resposta verificada. Em tarefas importantes, confira fontes, evite conceder permissões excessivas e mantenha revisão humana sobre decisões com impacto financeiro, jurídico, médico ou profissional.

Perguntas frequentes sobre monitoramento de IA

A cadeia de pensamento mostra exatamente o que a IA está pensando?

Não. Ela pode oferecer pistas sobre etapas intermediárias, mas não é uma transcrição garantidamente fiel dos mecanismos internos. Pode omitir informações, apresentar uma explicação posterior ou não estar disponível para quem usa o produto.

Se uma empresa não exibe o raciocínio do modelo, isso significa que ele não é seguro?

Não necessariamente. A ausência desse registro não prova, por si só, que o sistema seja inseguro. A avaliação pode usar testes comportamentais, monitoramento de ações, revisão humana e outras técnicas. O importante é que a organização reconheça o limite e não trate uma única métrica como prova suficiente.

Por que auditores externos são importantes?

Porque podem testar alegações de segurança com algum grau de independência, questionar métodos e encontrar falhas ignoradas por equipes internas. Para serem eficazes, porém, precisam de acesso apropriado, escopo claro e liberdade para relatar limitações e resultados.

O que usuários comuns podem fazer para reduzir riscos?

Evite inserir informações confidenciais em serviços sem entender suas regras de privacidade, confira respostas importantes em fontes confiáveis e não permita que um modelo execute ações sensíveis sem revisão. Em ambientes de trabalho, siga as políticas da organização e limite o acesso da IA ao necessário.

E você, já testou essa funcionalidade? Conte sua experiência (ou dúvidas) nos comentários! Se este guia te ajudou, compartilhe com alguém que também precisa saber disso. E para receber nossos tutoriais e análises em primeira mão, assine a newsletter do Tech Advisor Brasil.