Informação para quem transforma a indústria.

A IA já consegue fazer o trabalho. Mas consegue saber se fez um bom trabalho?

Com os agentes de IA, surge uma questão mais complexa: até onde podemos delegar não apenas tarefas isoladas, mas também processos inteiros?

Por: Ederson Almeida      Exclusiva

A inteligência artificial está avançando rapidamente, passando de sistemas que apenas respondem perguntas a agentes capazes de executar tarefas longas, utilizar ferramentas, escrever código, realizar pesquisas, analisar informações e coordenar outras inteligências artificiais. Essa mudança altera significativamente a discussão sobre automação.

Durante muito tempo, a principal pergunta era se uma máquina conseguiria executar determinada atividade antes reservada a um profissional. Com os agentes de IA, surge uma questão mais complexa: até onde podemos delegar não apenas tarefas isoladas, mas também processos inteiros?

Um experimento recente, conduzido por pesquisadores da Princeton University, do UK AI Security Institute, da University of Toronto e de outras instituições, ajuda a compreender essa nova fronteira. Em vez de perguntar se uma IA consegue programar ou responder corretamente a uma questão conhecida, os pesquisadores quiseram saber se agentes avançados seriam capazes de conduzir uma pesquisa científica aberta, trabalhando por vários dias em torno de um problema real e produzindo uma contribuição de qualidade suficiente para publicação.

O desafio é particularmente interessante porque pesquisa científica não é uma sequência previsível de tarefas. Em problemas tradicionais de inteligência artificial, normalmente existe uma métrica claramente definida: o programa funciona ou não funciona, a resposta está certa ou errada, o modelo aumentou ou não sua precisão.

Em uma investigação científica aberta, entretanto, boa parte das decisões precisa ser tomada antes de se saber qual será a resposta. É necessário escolher hipóteses, decidir quais evidências são relevantes, desenhar experimentos, interpretar resultados contraditórios e reconhecer quando um caminho inicialmente promissor precisa ser abandonado.


Os pesquisadores desenvolveram, então, uma metodologia chamada shadow evaluation. Eles selecionaram questões centrais de dois trabalhos submetidos à NeurIPS 2026 que ainda não estavam disponíveis publicamente. Dessa forma, os agentes não poderiam simplesmente localizar os resultados na internet ou reproduzir uma solução já conhecida. A proposta era colocar a inteligência artificial diante de um problema genuinamente aberto.

Os agentes receberam condições que dificilmente poderiam ser consideradas restritivas. Tinham aproximadamente seis dias para trabalhar, acesso à internet, máquinas virtuais, recursos de GPU, ferramentas computacionais, subagentes e milhares de dólares disponíveis para utilização de modelos de inteligência artificial. Também podiam consultar ferramentas de revisão que avaliavam criticamente os trabalhos produzidos ao longo do processo.

O objetivo não era elaborar um pequeno relatório ou demonstrar tecnicamente uma solução, mas sim produzir uma pesquisa que atingisse o padrão de uma conferência internacional de primeira linha em inteligência artificial.

Depois da execução, os autores dos trabalhos originais avaliaram os resultados produzidos pelos agentes como avaliariam uma submissão científica. Essa característica torna o experimento particularmente interessante: os avaliadores conheciam profundamente os problemas porque haviam passado meses estudando exatamente as mesmas questões que posteriormente foram entregues às máquinas.

O resultado pode parecer contraditório à primeira vista. Os agentes realizaram uma quantidade impressionante de trabalho. Escreveram programas, configuraram ambientes computacionais, resolveram problemas técnicos, utilizaram centenas de horas de processamento em GPUs, pesquisaram literatura científica, formularam hipóteses, executaram experimentos, analisaram resultados e redigiram os artigos finais. Em determinados momentos, inclusive conseguiram identificar problemas em seus próprios experimentos e corrigi-los.

Os pesquisadores concluíram que os agentes demonstraram competência significativa naquilo que poderíamos chamar de engenharia da pesquisa. Entretanto, os dois artigos produzidos foram claramente rejeitados pelos especialistas. A conclusão mais interessante, portanto, não é simplesmente que “a IA não conseguiu fazer pesquisa”. Grande parte do trabalho foi efetivamente realizada. O problema surgiu em outro ponto do processo: os agentes demonstraram capacidade de executar, mas apresentaram dificuldades para avaliar adequadamente a qualidade do que estavam fazendo.

Essa distinção entre execução e julgamento talvez seja uma das principais lições do experimento. Os pesquisadores identificaram cinco padrões recorrentes de comportamento. Os agentes apresentaram dificuldades para reconhecer quando uma evidência era suficientemente forte para sustentar uma conclusão, responder de maneira criativa quando uma abordagem apresentava problemas, abandonar efetivamente trajetórias pouco promissoras, utilizar adequadamente o tempo e os recursos disponíveis e manter determinadas instruções durante tarefas prolongadas.

Em alguns casos, hipóteses razoáveis foram descartadas muito rapidamente após experimentos limitados. Em outros casos, os sistemas perceberam que determinadas estratégias apresentavam problemas, mas fizeram apenas correções locais, sem reconsiderar profundamente a abordagem adotada.

Isso mostra que a capacidade de executar uma sequência complexa de ações não garante, necessariamente, a capacidade de avaliar estrategicamente se aquela sequência continua sendo a melhor forma de atingir o objetivo.

Outro resultado merece atenção especial. Durante o trabalho, os agentes podiam submeter seus próprios artigos a sistemas de revisão baseados em inteligência artificial. Esses revisores identificaram vários dos problemas que posteriormente seriam apontados pelos especialistas humanos.

Em diversas rodadas, portanto, os agentes receberam sinais bastante claros de que os trabalhos ainda não apresentavam qualidade suficiente. O problema não estava na ausência de feedback. Estava na forma como o feedback era utilizado. Em vez de reconsiderar completamente algumas escolhas metodológicas ou abandonar determinada linha de investigação, os agentes frequentemente respondiam reduzindo suas afirmações, acrescentando ressalvas ou realizando pequenas modificações.

O episódio oferece uma distinção importante para qualquer organização que esteja implantando inteligência artificial: disponibilizar informação não significa, necessariamente, garantir que ela seja corretamente interpretada e transformada em uma decisão melhor. Um sistema pode reconhecer a existência de um problema e, ainda assim, não reagir adequadamente a ele.

Também chamou a atenção o uso dos recursos. Embora os agentes tivessem orçamento computacional, acesso a GPUs e tempo suficiente para continuar investigando, algumas execuções foram concluídas utilizando apenas uma parcela dos recursos disponíveis. Isso aconteceu mesmo quando os próprios mecanismos de revisão indicavam que os resultados ainda não haviam atingido o nível esperado. Trata-se de um detalhe relevante porque revela a diferença entre administrar corretamente uma tarefa local e compreender o contexto completo de uma missão.

Um sistema pode ser extremamente eficiente na execução de uma operação específica e, ao mesmo tempo, tomar decisões questionáveis sobre onde investir tempo, recursos ou esforço adicional. Para aplicações industriais, essa distinção será cada vez mais importante à medida que os agentes deixem de apenas responder a solicitações e passem a controlar processos com múltiplas etapas, prioridades concorrentes e consequências organizacionais.

Talvez o comportamento mais significativo para aplicações empresariais seja o que os pesquisadores chamaram de "instruction drift". Durante tarefas prolongadas, algumas instruções inicialmente estabelecidas deixaram de ser seguidas adequadamente. Havia orientações sobre quanto tempo deveria ser dedicado à exploração, com que frequência as ferramentas de revisão deveriam ser utilizadas e a quais requisitos o trabalho final deveria atender. Mesmo tendo recebido essas instruções, os agentes gradualmente se afastaram de algumas delas.

O problema é importante porque muitas organizações ainda tratam a governança de sistemas generativos como se estabelecer boas regras no início da interação fosse suficiente. Em agentes que atuam por horas ou dias, executando diversas ações e tomando decisões intermediárias, talvez seja necessário algo mais sofisticado: mecanismos capazes de verificar continuamente se objetivos, restrições, normas e políticas continuam sendo observados ao longo de toda a execução.

O que um experimento de pesquisa científica tem a ver com a indústria? Talvez muito mais do que parece. A maioria das empresas provavelmente não pretende utilizar agentes para escrever artigos científicos de forma autônoma, mas diversas organizações já começam a considerar sistemas capazes de executar processos cada vez mais completos.

Agentes poderão analisar documentos técnicos, consultar normas, desenvolver software, apoiar atividades de engenharia, elaborar relatórios, acompanhar manutenção, analisar riscos, controlar rotinas administrativas, pesquisar fornecedores ou monitorar indicadores de produção. Quando isso acontecer, perguntar apenas se a IA “consegue realizar a tarefa” será insuficiente. Será necessário perguntar como a organização perceberá quando o agente estiver seguindo uma trajetória errada, quais decisões poderão ocorrer autonomamente, quais exigirão validação profissional, quem terá autoridade para interromper o processo e como será possível reconstruir posteriormente o caminho que levou a determinada decisão.

Essa mudança também exige uma compreensão mais madura do papel humano. A resposta não está simplesmente em colocar uma pessoa para aprovar cada ação produzida pela inteligência artificial. Em muitos casos, isso eliminaria justamente parte do ganho de produtividade proporcionado pela automação. O desafio será definir diferentes níveis de autonomia conforme o contexto, o impacto e o risco das decisões.

Processos rotineiros e amplamente conhecidos podem funcionar com elevada autonomia. Situações excepcionais podem gerar alertas ou solicitar validação. Decisões críticas podem exigir explicações, evidências e aprovação profissional. Desvios de regras podem interromper automaticamente a execução. Ao mesmo tempo, registros detalhados das interações podem permitir rastreabilidade, auditoria e aprendizado organizacional.

A questão deixa de ser escolher entre humanos e máquinas e passa a ser definir como autoridade, supervisão e responsabilidade serão distribuídas entre ambos.

Esse debate torna-se ainda mais relevante porque a evolução dos modelos continuará. Os próximos sistemas provavelmente terão mais contexto, mais ferramentas, maior capacidade de raciocínio e maior autonomia operacional. Entretanto, o experimento sugere que a capacidade de execução e a capacidade de julgamento não necessariamente avançam à mesma velocidade. Uma inteligência artificial pode realizar milhares de operações tecnicamente corretas e, ainda assim, permanecer por muito tempo em uma estratégia inadequada. Pode receber uma crítica correta e reagir de forma inadequada. Pode haver recursos disponíveis e não perceber como utilizá-los adequadamente. Pode compreender uma regra no início de uma atividade e deixar de observá-la posteriormente.

Em aplicações simples, esses problemas podem representar apenas uma perda de eficiência. Em processos industriais, financeiros, regulatórios ou relacionados à segurança, podem adquirir uma dimensão muito maior.

Nos últimos anos, boa parte da corrida tecnológica concentrou-se em desenvolver inteligências artificiais capazes de fazer mais coisas. Esse objetivo continuará relevante, mas talvez estejamos entrando em uma nova fase. À medida que os sistemas assumirem processos cada vez mais amplos, também precisaremos desenvolver mecanismos capazes de acompanhar a tomada dessas decisões, identificar desvios, estabelecer limites de autonomia e determinar quando um profissional precisa reassumir o controle.

O experimento com agentes pesquisadores não encerra essa discussão — os próprios autores reconhecem as limitações de uma avaliação baseada em poucos casos —, mas apresenta uma evidência relevante sobre o problema que estamos começando a enfrentar. A pergunta já não é apenas se a inteligência artificial consegue realizar o trabalho. Precisamos começar a perguntar se ela consegue reconhecer quando está fazendo um bom trabalho e, principalmente, o que faremos quando não conseguir.

A próxima fronteira da inteligência artificial nas empresas talvez não seja simplesmente tornar os agentes mais autônomos. Será aprender a governar essa autonomia.

Referências

  • KIRGIS, Peter et al. Can AI agents conduct open-ended AI research? Early evidence from two case studies. arXiv preprint arXiv:2607.27191, versão 2, 2026. 2607.27191v2.pdfPDF
  • KAPOOR, Sayash et al. Trabalho sobre avaliações abertas de sistemas de inteligência artificial (open-world evaluations), citado por Kirgis et al. (2026) como fundamento metodológico para a discussão das limitações de avaliações abertas.
  • WIJK, Hjalmar et al. RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts. 2025. Referência utilizada por Kirgis et al. (2026) na comparação entre avaliações de tarefas verificáveis e pesquisas abertas.
  • YAMADA, Yutaro et al. The AI Scientist-v2: Workshop-level automated scientific discovery via agentic tree search. 2025. Trabalho discutido por Kirgis et al. (2026) como exemplo de pesquisa automatizada avaliada por revisão científica.
  • SCHMIDGALL, Samuel et al. Agent Laboratory: Using LLM agents as research assistants. 2025. Trabalho relacionado à utilização de agentes em fluxos de pesquisa científica, discutido na revisão comparativa apresentada por Kirgis et al. (2026).

*Imagem de capa: Depositphotos.com

*O conteúdo e a opinião expressa neste artigo não representam a opinião do Grupo CIMM e são de responsabilidade do autor.

Gostou? Então compartilhe:

Ederson Almeida

Ederson Almeida

Inovação e Inteligência Artificial

Sou Empreendedor, CEO da empresa GAUTICA, Professor e Desenvolvedor de Software com mais de 20 anos de experiência no setor, especializando-me em Inteligência Artificial e Transformação Digital. Atualmente, estou avançando em meu doutorado, focando em utilizar a IA para melhorar a segurança no local de trabalho.

Minha trajetória acadêmica é marcada pelo compromisso com o ensino e a inovação. Ministrei aulas no Mestrado Profissional em Engenharia de Produção, capacitei centenas de programadores e leciono programação avançada no CETEC. Como mentor de inovação, orientei inúmeros jovens em projetos de empreendedorismo através da Junior Achievement, impactando significativamente suas carreiras.

Atuo como palestrante e consultor em IA e transformação digital, impulsionando iniciativas estratégicas que integram tecnologia e objetivos empresariais. A minha segunda empresa, Edertec Academy destaca meu compromisso com a educação e capacitação de profissionais com habilidades de ponta, preparando-os para o cenário digital em evolução.

Contato:   
  
  
  
  
  

Acompanhe a coluna de Ederson Almeida e confira outros artigos sobre Manufatura Aditiva e Indústria 4.0.

Ver todos os artigos do colunista
Parceiros

Empresas que apoiam o Canal Indústria 4.0

Patrocinador do Canal Indústria 4.0

Engenhosidade para a vida

Explore uma ampla variedade de produtos, serviços e soluções personalizáveis para ampliar a inovação e impulsionar a transformação digital da sua empresa.

Continue explorando

Canal Indústria 4.0

Informação, conhecimento e experiências sobre transformação digital, inovação e as tecnologias que estão mudando a indústria brasileira.