NOTAS DE QUEM CONSTRÓI · #019

Rodar agente de IA 24 horas: a conta que ninguém fecha antes de assinar

Todo mundo calcula custo de agente de IA multiplicando token por preço, e esquece de somar a hora que a sessão passa rodando.

Welly4 MIN

Rodar agente de IA 24 horas: a conta que ninguém fecha antes de assinar

O agente fica rodando, e isso também é cobrado

Um time fecha escopo para um agente que fica de plantão numa fila de chamados, rodando o dia inteiro. Antes de assinar a proposta, alguém pergunta quanto isso custa por mês. A resposta que sai na hora é multiplicar tokens processados pelo preço do modelo. Essa conta está incompleta. Quem usa a camada de agentes gerenciados da Anthropic paga tokens do jeito de sempre, e paga também pelo tempo que a sessão passa com o status "rodando".

O valor está na documentação oficial de preços da Anthropic, em platform.claude.com: 0,08 dólar por hora de sessão, medido em milissegundos, cobrado só enquanto o status é "running". Tempo em que a sessão está ociosa esperando a próxima mensagem, sendo remarcada ou já encerrada não entra na conta.

A conta de uma hora, com números da própria documentação

A Anthropic publica um exemplo pronto: uma sessão de uma hora com o Opus 5, processando 50 mil tokens de entrada e 15 mil de saída, fecha em 0,705 dólar. Os tokens de entrada custam 0,25 dólar, a saída custa 0,375 dólar, e a hora de sessão custa os 0,08 dólar fixos. Com cache de prompt ativado, e 40 mil desses tokens de entrada vindo de leitura de cache, o total cai para 0,525 dólar. A fatia da hora de sessão sobe de 11% para 15% do total, porque ela não acompanha o desconto do cache.

ItemSem cacheCom cache
Tokens de entrada0,25 dólar0,07 dólar
Tokens de saída0,375 dólar0,375 dólar
Hora de sessão0,08 dólar0,08 dólar
Total0,705 dólar0,525 dólar

A hora de sessão não muda com o desconto de cache. Ela é fixa, previsível e pequena perto do gasto com token, pelo menos nesse exemplo.

Quando a hora de sessão pesa e quando não pesa

O detalhe que decide se isso importa para o seu caso é o que a sessão faz enquanto está "rodando". Um agente que processa documento atrás de documento, sem pausa, gasta muito token por hora, e a taxa de sessão vira ruído no total. Um agente que fica esperando resposta de API externa, aguardando confirmação humana ou fazendo polling de fila gasta pouco token por hora rodando, e nesse caso a taxa de sessão passa a pesar mais no orçamento, mesmo sendo só 0,08 dólar.

A gente já viu esse padrão em projeto de automação de atendimento: o agente não fica ocioso o dia inteiro, mas passa boa parte do tempo entre uma mensagem e outra do cliente, e cada minuto nesse meio é status ocioso, que não entra na conta. O tempo que pesa de verdade é o de processamento ativo, e é justamente aí que o token já domina o custo. Isso muda a pergunta que vale fazer antes de assinar um projeto desses. Não é quanto custa por hora. É quanto o agente realmente processa por hora.

Loop próprio ou camada gerenciada: o critério

A alternativa a pagar hora de sessão é construir o loop do agente por conta própria: chamar a API de mensagens direto, guardar estado de conversa, tratar retry e timeout na mão. Isso não custa 0,08 dólar por hora. Custa o tempo de alguém do time escrevendo e mantendo esse código, o que quase sempre sai mais caro que a taxa, a não ser que o volume de sessões seja grande o bastante para justificar o investimento.

CritérioLoop próprio via APICamada gerenciada
TokenPreço padrão do modeloPreço padrão do modelo
Estado de sessão, retry, timeoutSeu time constrói e mantémIncluído na taxa
Taxa adicionalNenhuma0,08 dólar por hora rodando
Onde compensaVolume alto, equipe com folga de engenhariaSessão esporádica, prazo curto

O critério não é qual opção é mais barata em abstrato. É quantas horas de engenharia sua equipe vai gastar replicando o que a camada gerenciada já resolve, e se isso vale mais ou menos que 0,08 dólar multiplicado pelas horas de sessão que o agente vai rodar no mês. Para a maioria dos projetos que a gente vê passar, essa conta fecha rápido: a taxa de sessão é pequena, e o tempo de engenharia para reconstruir orquestração de agente não é.

O que fazer na segunda de manhã

Antes de fechar a próxima proposta de agente que roda continuamente, peça duas estimativas separadas: quantos tokens o agente processa por hora ativa, e quantas horas por dia ele realmente fica com status rodando, não o tempo total que fica ligado. Multiplique cada uma pelo preço certo. Se a taxa de sessão for menor que 15% do total projetado, ela não é o fator que decide a arquitetura, e a escolha entre construir por conta própria ou usar camada gerenciada deve olhar para o tempo de engenharia, não para a taxa por hora.

Esse é o tipo de conta que a Overflow ajuda a fazer antes do piloto, porque decidir stack sem essa conta feita normalmente custa mais caro depois, em retrabalho, do que qualquer taxa por hora de sessão.

Fontes

COMPARTILHARLINKEDINXWHATSAPP

// NEWSLETTER

O que a gente aprende, você recebe.

Bastidor de projeto, decisão técnica e o que estamos vendo em IA dentro das empresas. Sem enrolação e sem spam.

// PRÓXIMO PASSO

Tem um problema
parecido?