O agente fica rodando, e isso também é cobrado
Um time fecha escopo para um agente que fica de plantão numa fila de chamados, rodando o dia inteiro. Antes de assinar a proposta, alguém pergunta quanto isso custa por mês. A resposta que sai na hora é multiplicar tokens processados pelo preço do modelo. Essa conta está incompleta. Quem usa a camada de agentes gerenciados da Anthropic paga tokens do jeito de sempre, e paga também pelo tempo que a sessão passa com o status "rodando".
O valor está na documentação oficial de preços da Anthropic, em platform.claude.com: 0,08 dólar por hora de sessão, medido em milissegundos, cobrado só enquanto o status é "running". Tempo em que a sessão está ociosa esperando a próxima mensagem, sendo remarcada ou já encerrada não entra na conta.
A conta de uma hora, com números da própria documentação
A Anthropic publica um exemplo pronto: uma sessão de uma hora com o Opus 5, processando 50 mil tokens de entrada e 15 mil de saída, fecha em 0,705 dólar. Os tokens de entrada custam 0,25 dólar, a saída custa 0,375 dólar, e a hora de sessão custa os 0,08 dólar fixos. Com cache de prompt ativado, e 40 mil desses tokens de entrada vindo de leitura de cache, o total cai para 0,525 dólar. A fatia da hora de sessão sobe de 11% para 15% do total, porque ela não acompanha o desconto do cache.
| Item | Sem cache | Com cache |
|---|---|---|
| Tokens de entrada | 0,25 dólar | 0,07 dólar |
| Tokens de saída | 0,375 dólar | 0,375 dólar |
| Hora de sessão | 0,08 dólar | 0,08 dólar |
| Total | 0,705 dólar | 0,525 dólar |
A hora de sessão não muda com o desconto de cache. Ela é fixa, previsível e pequena perto do gasto com token, pelo menos nesse exemplo.
Quando a hora de sessão pesa e quando não pesa
O detalhe que decide se isso importa para o seu caso é o que a sessão faz enquanto está "rodando". Um agente que processa documento atrás de documento, sem pausa, gasta muito token por hora, e a taxa de sessão vira ruído no total. Um agente que fica esperando resposta de API externa, aguardando confirmação humana ou fazendo polling de fila gasta pouco token por hora rodando, e nesse caso a taxa de sessão passa a pesar mais no orçamento, mesmo sendo só 0,08 dólar.
A gente já viu esse padrão em projeto de automação de atendimento: o agente não fica ocioso o dia inteiro, mas passa boa parte do tempo entre uma mensagem e outra do cliente, e cada minuto nesse meio é status ocioso, que não entra na conta. O tempo que pesa de verdade é o de processamento ativo, e é justamente aí que o token já domina o custo. Isso muda a pergunta que vale fazer antes de assinar um projeto desses. Não é quanto custa por hora. É quanto o agente realmente processa por hora.
Loop próprio ou camada gerenciada: o critério
A alternativa a pagar hora de sessão é construir o loop do agente por conta própria: chamar a API de mensagens direto, guardar estado de conversa, tratar retry e timeout na mão. Isso não custa 0,08 dólar por hora. Custa o tempo de alguém do time escrevendo e mantendo esse código, o que quase sempre sai mais caro que a taxa, a não ser que o volume de sessões seja grande o bastante para justificar o investimento.
| Critério | Loop próprio via API | Camada gerenciada |
|---|---|---|
| Token | Preço padrão do modelo | Preço padrão do modelo |
| Estado de sessão, retry, timeout | Seu time constrói e mantém | Incluído na taxa |
| Taxa adicional | Nenhuma | 0,08 dólar por hora rodando |
| Onde compensa | Volume alto, equipe com folga de engenharia | Sessão esporádica, prazo curto |
O critério não é qual opção é mais barata em abstrato. É quantas horas de engenharia sua equipe vai gastar replicando o que a camada gerenciada já resolve, e se isso vale mais ou menos que 0,08 dólar multiplicado pelas horas de sessão que o agente vai rodar no mês. Para a maioria dos projetos que a gente vê passar, essa conta fecha rápido: a taxa de sessão é pequena, e o tempo de engenharia para reconstruir orquestração de agente não é.
O que fazer na segunda de manhã
Antes de fechar a próxima proposta de agente que roda continuamente, peça duas estimativas separadas: quantos tokens o agente processa por hora ativa, e quantas horas por dia ele realmente fica com status rodando, não o tempo total que fica ligado. Multiplique cada uma pelo preço certo. Se a taxa de sessão for menor que 15% do total projetado, ela não é o fator que decide a arquitetura, e a escolha entre construir por conta própria ou usar camada gerenciada deve olhar para o tempo de engenharia, não para a taxa por hora.
Esse é o tipo de conta que a Overflow ajuda a fazer antes do piloto, porque decidir stack sem essa conta feita normalmente custa mais caro depois, em retrabalho, do que qualquer taxa por hora de sessão.
Fontes
- Pricing - Claude Platform Docs - Anthropic, 2026.

