Quanto Custa Rodar um Agente de IA e Como Medir Isso
O custo de rodar um agente de IA é determinado pelos tokens consumidos por tarefa, não pelo preço por token. Veja como medir o custo por tarefa bem-sucedida.
Rodar um agente de IA custa muito mais do que uma única chamada de modelo porque o agente entra em loop, e o verdadeiro motor da conta são os tokens consumidos por tarefa, não o preço por token. Nos próprios dados da Anthropic, os agentes usaram cerca de 4 vezes mais tokens do que uma interação de chat e os sistemas multiagente cerca de 15 vezes mais. O número que você deve usar como base de orçamento é o custo por tarefa bem-sucedida, não o custo por token, porque um modelo barato que falha com frequência infla silenciosamente a conta real por meio de novas tentativas.
Quanto custa rodar um agente de IA?
O custo de rodar um agente de IA é determinado principalmente pelos tokens que ele consome, não pelo preço de tabela do modelo. Um agente não responde uma vez e para. Ele percorre etapas de raciocínio, chama ferramentas, lê o que retorna e raciocina de novo, então consome muito mais tokens do que uma única resposta de chat para a mesma tarefa. Nos próprios dados da Anthropic, os agentes usaram cerca de 4 vezes mais tokens do que uma interação de chat, e os sistemas multiagente usaram cerca de 15 vezes mais. É por isso que a unidade honesta de custo não é o preço por token. É o custo por tarefa bem-sucedida, um número que incorpora novas tentativas, falhas e os tokens gastos em tentativas que nunca entregaram um resultado utilizável.
A versão curta: estime os tokens que uma tentativa consome, multiplique por quantas tentativas são necessárias para ter sucesso e você terá um número em torno do qual planejar um orçamento.
Por que o uso de tokens, e não o preço do modelo, define a conta
Fundadores que comparam agentes costumam começar pela tabela de preços, ou seja, quantos centavos por milhão de tokens de entrada e de saída cada modelo cobra. Esse número importa, mas é a alavanca menor. A alavanca maior é quantos tokens o agente gasta para concluir o trabalho. Os tokens de saída costumam custar várias vezes mais do que os de entrada, e um agente que raciocina por muitas etapas produz muita saída, então o próprio loop é onde o dinheiro vai.
A Anthropic mediu o efeito diretamente. Em sua análise do próprio sistema de pesquisa multiagente, o uso de tokens sozinho explicou cerca de 80 por cento da variação de desempenho em sua avaliação BrowseComp, com o número de chamadas de ferramentas e a escolha do modelo como os outros dois fatores explicativos. Lido com atenção, esse número descreve a avaliação interna de uma empresa sobre uma tarefa de pesquisa, não uma lei universal do comportamento de agentes. Mas a direção que ele aponta é difícil de contestar. Quantos tokens você gasta supera quase tudo o mais sobre como o sistema se comporta e quanto ele custa.
A consequência prática é que um modelo mais barato pode ser a escolha mais cara. Se um modelo de menor custo precisar de mais etapas de raciocínio, mais chamadas de ferramentas ou mais novas tentativas para chegar à mesma resposta, ele pode consumir tokens extras suficientes para anular seu desconto por token.
Na análise da Anthropic sobre seu próprio sistema de pesquisa multiagente, o uso de tokens sozinho explicou cerca de 80 por cento da variação de desempenho em sua avaliação BrowseComp, com o número de chamadas de ferramentas e a escolha do modelo como os outros dois fatores.
— Anthropic Engineering, How We Built Our Multi-Agent Research System (2026)
Custo por tarefa bem-sucedida é a única unidade honesta
A armadilha é otimizar para o custo por token. Uma equipe que faz isso vai alegremente colocar em produção um modelo barato que falha, digamos, duas em cada cinco tarefas, e nunca perceber que as novas tentativas e a correção manual custam mais do que um modelo mais caro que acerta de primeira. Essa taxa de falha é uma hipótese para fins de argumentação, não um número medido, mas o mecanismo por trás dela é real. Toda tentativa que falha ainda consome tokens, e alguém ainda precisa refazer o trabalho.
A solução é medir o custo por tarefa bem-sucedida, que é aproximadamente o custo de uma tentativa dividido pela taxa de sucesso. Como ilustração, e não um número do setor, suponha que uma tarefa consuma 40.000 tokens por tentativa e tenha sucesso quatro em cada cinco vezes. Você paga por cinco tentativas para obter quatro resultados limpos, então seu custo real por tarefa bem-sucedida fica cerca de 25 por cento acima do número ingênuo por tentativa. Os dígitos aqui são inventados para mostrar o formato da conta. A lição é que uma taxa de falha que você ignora aparece como um custo que você paga. Essa é a mesma disciplina da economia unitária em qualquer outra parte de um negócio. Se você nunca mapeou isso, nosso guia sobre economia unitária desde o primeiro dia cobre o vocabulário.
Um exemplo prático, apenas como ilustração
Acompanhe uma tarefa do início ao fim, tendo em mente que esses números são uma ilustração e não uma referência para qualquer carga de trabalho real.
Suponha que uma única execução de agente em uma tarefa de triagem de suporte consuma 40.000 tokens ao longo de seu raciocínio e chamadas de ferramentas, e suponha que ela tenha sucesso quatro em cada cinco vezes, então uma execução em cada cinco precisa ser repetida. Para entregar 100 resultados limpos você na verdade roda cerca de 125 tentativas, o que dá aproximadamente 5.000.000 de tokens em vez dos 4.000.000 que você estimaria se supusesse que toda execução tem sucesso. É o acréscimo de 25 por cento de novo, chegando pela porta dos fundos da taxa de falha.
Agora mude uma variável. Um modelo que custa mais por token, mas tem sucesso nove em cada dez vezes, precisa de muito menos repetições. Mesmo com um preço de tabela mais alto, seu custo por tarefa bem-sucedida pode ficar abaixo da opção mais barata. Você não consegue ver isso em uma tabela de preços. Você só consegue ver depois de medir a taxa de sucesso e o uso de tokens juntos.
Como medir e controlar o custo do agente
Algumas alavancas movem o número mais do que as outras.
Roteie por dificuldade. Envie as etapas fáceis para um modelo pequeno e barato e reserve o modelo de fronteira para as difíceis. A maioria das tarefas não precisa do seu modelo mais capaz em cada etapa. Nosso manual de roteamento de modelos e custo de inferência mostra como configurar isso sem abrir mão da qualidade.
Limite o loop. Os agentes falham de forma cara quando ficam girando em círculos, então coloque limites em chamadas de ferramentas e etapas de raciocínio e faça o agente parar ou escalar para um humano em vez de queimar tokens indefinidamente.
Faça cache do que se repete. Prompts de sistema, esquemas de ferramentas e contexto compartilhado são reenviados a cada etapa, então o cache de prompts pode reduzir uma parcela significativa do custo de tokens de entrada em agentes de longa duração.
Instrumente antes de otimizar. Registre tokens e sucesso para cada tarefa desde o primeiro dia. Você não consegue gerenciar o custo por tarefa bem-sucedida se a única coisa que você mede é o custo por token, e a maioria das equipes descobre isso da maneira difícil depois da primeira fatura.
O que isso significa para fundadores da América Latina
A Avante cofunda empresas nativas de IA para o Brasil e a América Latina, e é nessa conta de custo que muitos produtos de IA quebram silenciosamente. A inferência de fronteira é precificada em dólares, enquanto boa parte da região ganha em reais e pesos, então uma chamada de modelo que parece trivial em um pitch deck de San Francisco pode ser uma linha de margem real em um resultado brasileiro ou colombiano. Projetar em torno do custo por tarefa bem-sucedida desde o primeiro protótipo, em vez de descobri-lo depois do lançamento, é o que mantém um produto nativo de IA lucrativo à medida que ele cresce.
A tendência de fundo ajuda. Os preços de inferência caíram acentuadamente e continuam caindo, o que amplia o conjunto de casos de uso de agentes que cobrem o próprio custo. Acompanhamos essa curva para a região em nossa curva de custo de infraestrutura de IA na América Latina. Os fundadores que vencem não são os que esperam os modelos ficarem mais baratos. São os que medem com honestidade hoje, e então roteiam, limitam e fazem cache até chegar a um custo por tarefa bem-sucedida defensável.
Perguntas frequentes
- Quanto custa rodar um agente de IA?
- Depende principalmente dos tokens, não do preço de tabela do modelo. Estime os tokens que uma tentativa consome e depois multiplique por quantas tentativas são necessárias para ter sucesso. Como os agentes entram em loop de raciocínio e chamadas de ferramentas, eles usam muito mais tokens do que uma única resposta de chat, então o número que vale a pena orçar é o custo por tarefa bem-sucedida.
- Por que os agentes de IA custam mais do que uma única resposta de chat?
- Os agentes não respondem uma vez e param. Eles entram em loop, chamando ferramentas e raciocinando repetidamente, o que multiplica o uso de tokens. Nos próprios dados da Anthropic, os agentes usaram cerca de 4 vezes mais tokens do que uma interação de chat e os sistemas multiagente cerca de 15 vezes mais.
- O que é custo por tarefa bem-sucedida?
- É o custo de uma tentativa dividido pela taxa de sucesso. Se as tentativas falham parte do tempo, você paga também pelas execuções que falharam, então o custo real de cada resultado utilizável é maior do que o preço bruto por tentativa. É a única unidade que captura novas tentativas e falhas de forma honesta.
- Um modelo mais barato sempre reduz o custo do agente?
- Não. Um modelo com preço por token mais baixo ainda pode custar mais no total se precisar de mais etapas de raciocínio, mais chamadas de ferramentas ou mais novas tentativas para chegar à mesma resposta. Medir a taxa de sucesso e o uso de tokens juntos é a única maneira de saber qual modelo é realmente mais barato para o trabalho.
Quer mais? Receba um ensaio por semana sobre venture building, negócios AI-native e a oportunidade Brasil.
Avante Intelligence · semanal · sem spam. Ou ver a Biblioteca