[{"data":1,"prerenderedAt":189},["ShallowReactive",2],{"article-\u002Fagentes-questionam-proprio-trabalho":3},{"id":4,"title":5,"body":6,"createdAt":175,"description":176,"extension":177,"image":178,"imageAlt":179,"imageHeight":180,"imageWidth":181,"meta":182,"navigation":183,"path":184,"seo":185,"sitemap":186,"stem":187,"__hash__":188},"articles\u002Fagentes-questionam-proprio-trabalho.md","Por que peço aos meus agentes de código para questionarem o próprio trabalho",{"type":7,"value":8,"toc":167},"minimark",[9,13,16,19,22,27,30,39,42,45,48,51,76,80,83,97,100,103,112,115,119,122,125,133,145,148,152,155,158,161,164],[10,11,12],"p",{},"Eu sempre questiono o que os agentes me entregam. Se aparece uma abstração nova no diff, quero entender por que ela precisa existir. Quando a resposta diz que um problema foi resolvido, quero saber o que foi verificado para chegar àquela conclusão.",[10,14,15],{},"Também espero que esse cuidado alcance os meus pedidos. Posso sugerir uma implementação que parece boa antes de olhar o código, mas deixa de fazer sentido depois. Prefiro que o agente aponte isso a seguir a sugestão sem questionar.",[10,17,18],{},"Uma das coisas que fiz foi levar essa cobrança para as instruções globais do agente. A intenção era que ele revisasse as próprias decisões durante o trabalho, sem depender de uma pergunta minha no final.",[10,20,21],{},"Por aqui, tem funcionado. Mas vale explicar o que estou tentando conseguir com isso e onde estão os limites.",[23,24,26],"h2",{"id":25},"o-trecho-que-coloquei-nas-instruções","O trecho que coloquei nas instruções",[10,28,29],{},"O prompt é este:",[31,32,33,36],"blockquote",{},[10,34,35],{},"Questione suas próprias premissas, plano e ações durante toda a execução. Verifique se cada mudança contribui para o objetivo real do usuário, quais efeitos colaterais e custos introduz e se existe uma solução mais simples.",[10,37,38],{},"Ajuste o plano quando novas evidências invalidarem a abordagem. Antes de concluir, valide o resultado em relação ao objetivo do usuário; apenas completar os passos planejados não demonstra sucesso.",[10,40,41],{},"A última frase resume bem a minha preocupação.",[10,43,44],{},"Imagine uma tarefa para corrigir a ordenação de uma listagem. O agente começa propondo alterações no backend, um serviço novo e uma reorganização no frontend. Durante a investigação, encontra uma segunda ordenação no componente, sobrescrevendo o resultado recebido da API.",[10,46,47],{},"Nesse exemplo, espero que ele reavalie o que ainda precisa ser feito. Talvez aquela estrutura nova tenha perdido a razão de existir. Seguir até o fim com ela só porque estava no plano inicial acrescentaria trabalho sem ajudar na correção.",[10,49,50],{},"É esse tipo de decisão que quero incentivar. Não preciso que o agente transforme cada tarefa em um debate, nem que invente objeções para demonstrar senso crítico.",[10,52,53,54,58,59,62,63,66,67,75],{},"Quanto ao arquivo, o caminho depende da ferramenta. No Codex, a configuração global padrão fica em ",[55,56,57],"code",{},"~\u002F.codex\u002FAGENTS.md","; no Claude Code, em ",[55,60,61],{},"~\u002F.claude\u002FCLAUDE.md",". Portanto, ",[55,64,65],{},"~\u002FAGENTS.md"," não é um endereço universal. É preciso configurar o mecanismo que o seu harness realmente carrega. Essas instruções orientam o comportamento, mas não garantem obediência nem resultados idênticos entre projetos. (",[68,69,74],"a",{"href":70,"rel":71,"title":73},"https:\u002F\u002Fdevelopers.openai.com\u002Fcodex\u002Fguides\u002Fagents-md\u002F",[72],"nofollow","Custom instructions with AGENTS.md | ChatGPT Learn","OpenAI Developers",")",[23,77,79],{"id":78},"questionar-não-basta-para-corrigir","Questionar não basta para corrigir",[10,81,82],{},"Aqui existe uma ressalva importante: pedir ao modelo que revise uma resposta não garante que a próxima será melhor.",[10,84,85,86,90,91,75],{},"O trabalho ",[87,88,89],"em",{},"Self-Refine",", de 2023, encontrou ganhos usando ciclos estruturados de geração, feedback e revisão pelo próprio modelo. Já um estudo apresentado na ICLR 2024 encontrou dificuldades e, em alguns casos, piora quando os modelos tentavam corrigir o próprio raciocínio sem feedback externo. São resultados de métodos, tarefas e modelos específicos, não uma validação desse trecho no meu arquivo de instruções. (",[68,92,96],{"href":93,"rel":94,"title":95},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2303.17651",[72],"[2303.17651] Self-Refine: Iterative Refinement with Self-Feedback","arXiv",[10,98,99],{},"Isso muda o que eu considero uma revisão útil. Um agente dizer “reavaliei e está correto” ainda não me mostra como chegou àquela conclusão.",[10,101,102],{},"Voltando ao exemplo da listagem: ele pode executar o cenário que apresentava o erro, conferir o resultado e verificar se a correção preserva os outros critérios de ordenação. Em um teste de regressão, quero que o comportamento esperado venha do requisito, não apenas reproduza o que a implementação recém-escrita passou a fazer.",[10,104,105,106,75],{},"A documentação de engenharia da Anthropic recomenda justamente que agentes usem resultados do ambiente, como execução de código e respostas de ferramentas, para avaliar o próprio progresso. Também recomenda condições de parada para manter esses ciclos sob controle. (",[68,107,111],{"href":108,"rel":109,"title":110},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fbuilding-effective-agents",[72],"Building Effective AI Agents \\ Anthropic","Anthropic",[10,113,114],{},"Por isso, leio “questione suas próprias premissas” como um pedido para procurar evidências que sustentem ou contrariem uma decisão. Uma nova explicação, sozinha, não resolve essa dúvida.",[23,116,118],{"id":117},"essa-cobrança-também-tem-custo","Essa cobrança também tem custo",[10,120,121],{},"A expressão “durante toda a execução” merece cuidado. Minha intenção é manter esse critério presente, especialmente quando surgir informação nova ou uma decisão tiver impacto relevante. Não espero uma auditoria completa depois de cada linha alterada.",[10,123,124],{},"Se a instrução provocar verificações redundantes e reconsiderações sem motivo, haverá mais trabalho sem benefício correspondente. Um ajuste de texto não precisa receber o mesmo tratamento de uma alteração em uma regra de negócio.",[10,126,127,128,75],{},"Também não dá para reduzir essa discussão ao tamanho da janela de contexto. A Anthropic descreve perda de precisão conforme o contexto cresce e ressalta que janelas maiores continuam sujeitas a informação irrelevante e contexto poluído. Caber na janela não significa que todo o conteúdo será aproveitado igualmente bem. (",[68,129,111],{"href":130,"rel":131,"title":132},"https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Feffective-context-engineering-for-ai-agents",[72],"Effective context engineering for AI agents \\ Anthropic",[10,134,135,136,139,140,75],{},"Há ainda um contraponto diretamente relacionado a arquivos de instruções. O estudo ",[87,137,138],{},"Evaluating AGENTS.md",", publicado em fevereiro de 2026, encontrou resultados mistos: arquivos gerados por LLM tenderam a reduzir o sucesso nas tarefas avaliadas, enquanto os escritos por desenvolvedores trouxeram ganhos modestos. Ambos aumentaram o custo de execução. O trabalho avaliou instruções de repositório, não esse meu prompt global, mas reforça o cuidado com exigências adicionais que parecem úteis e acabam complicando a tarefa. (",[68,141,96],{"href":142,"rel":143,"title":144},"https:\u002F\u002Farxiv.org\u002Fhtml\u002F2602.11988v1",[72],"Evaluating AGENTS.md:Are Repository-Level Context Files Helpful for Coding Agents?",[10,146,147],{},"Minha leitura é que a própria instrução precisa entrar no review. Se eu cobro que cada mudança no código justifique sua existência, faz sentido cobrar o mesmo de cada regra que adiciono ao agente.",[23,149,151],{"id":150},"o-que-considero-um-bom-resultado","O que considero um bom resultado",[10,153,154],{},"Na minha experiência, esse trecho tem ajudado. Isso não permite atribuir todo bom resultado a ele: o modelo usado, o contexto disponível, a clareza do pedido e as ferramentas também fazem parte do fluxo.",[10,156,157],{},"Para avaliar melhor a instrução, eu compararia tarefas semelhantes com e sem ela, mantendo o modelo e as condições tão próximos quanto possível. Observaria principalmente o retrabalho necessário e as verificações realizadas, junto do tempo e do consumo. Uma resposta final mais convincente não seria suficiente para considerar a mudança um sucesso.",[10,159,160],{},"Continuo achando válido pedir que o agente questione o próprio trabalho. Só não quero confundir autocrítica com uma obrigação de encontrar defeitos, nem dar a ele liberdade para inventar um objetivo diferente do que foi pedido.",[10,162,163],{},"Quero que ele reconheça quando uma descoberta muda o diagnóstico, abandone alterações que perderam a necessidade e mostre o que conseguiu validar. Quando não conseguir verificar alguma coisa, prefiro que diga isso.",[10,165,166],{},"E, quando vier o “pronto”, eu ainda vou abrir o diff.",{"title":168,"searchDepth":169,"depth":169,"links":170},"",2,[171,172,173,174],{"id":25,"depth":169,"text":26},{"id":78,"depth":169,"text":79},{"id":117,"depth":169,"text":118},{"id":150,"depth":169,"text":151},"2026-09-10","Uma reflexão sobre autocrítica, evidências e os limites de pedir que agentes de código questionem o próprio trabalho.","md","\u002Fimages\u002Fartigos\u002Fagentes-questionam-proprio-trabalho.webp","Folhas com código abstrato riscadas e marcações azuis de revisão",1024,1536,{},true,"\u002Fagentes-questionam-proprio-trabalho",{"title":5,"description":176},{"loc":184},"agentes-questionam-proprio-trabalho","dmrs6LHDpbcLtnNFAZYflMXUphswgNaSwR8UWvkoqFk",1789071059724]