NOTAS DE QUEM CONSTRÓI · #031

A DeepSeek criou hora de pico pro token, e o fuso do Brasil ficou de fora

No dia 16 de agosto a DeepSeek trocou o preço fixo por tabela de horário de pico. O detalhe que quase ninguém notou: o fuso do Brasil escapa dela quase inteiro.

Welly4 MIN

A DeepSeek criou hora de pico pro token, e o fuso do Brasil ficou de fora

Se você tem um agente de IA rodando em horário fixo (um cron de madrugada, uma rotina de geração de conteúdo, uma sincronização noturna com o CRM), a partir de 16 de agosto ele pode estar custando até quatro vezes mais só pelo horário escolhido. Nenhuma linha de prompt mudou. O preço do token é que ficou diferente dependendo da hora do dia.

No dia 16 de agosto de 2026, às 16h UTC, a DeepSeek trocou o preço fixo por token por uma tabela que varia com o relógio. A empresa anunciou no X: fora do horário de pico o preço cai pela metade em relação ao pico. Na prática, o output do V4-Flash saiu de US$ 0,28 por milhão de tokens para US$ 1,32 no horário de pico, alta de 371%, e US$ 0,66 fora dele. O V4-Pro, que custava US$ 0,87 fixo desde maio, passou a custar US$ 3,96 no pico e US$ 1,98 fora.

A empresa justificou a mudança dizendo que quer "alocar recursos de forma mais racional". Por trás disso está uma restrição concreta: os controles de exportação americanos impedem a DeepSeek de comprar os aceleradores mais recentes, então boa parte dos tokens roda em chips ocidentais mais antigos, e a demanda passou na frente da capacidade instalada.

As janelas de pico, em fuso do Brasil

O horário de pico definido pela DeepSeek é das 01h às 04h UTC e das 06h às 10h UTC. Convertido para o horário de Maceió, São Paulo e Porto Alegre (UTC-3), isso vira 22h à 01h e 03h às 07h.

Repare o que sobra fora dessas janelas: o dia inteiro de trabalho, das 7h às 22h. Quem roda agente de IA durante o expediente no Brasil está, por coincidência de fuso, sempre na tarifa mais barata. Quem sofre é quem agenda para rodar de madrugada, achando que estava economizando processamento fora do horário comercial americano.

Preço (US$/milhão de tokens, output)Antes (fixo)PicoFora de pico
V4-Flash0,281,320,66
V4-Pro0,873,961,98

Pra colocar em número redondo: um agente que gera 20 milhões de tokens de output por mês no V4-Flash, sempre às 3h da manhã UTC, sai a US$ 26,40. O mesmo agente, rodando depois das 10h UTC, sai a US$ 13,20. Metade do custo, sem trocar de modelo, sem mexer no prompt, só mudando a hora do agendamento.

O que isso muda na escolha de modelo

Até a semana passada, escolher modelo pra um agente em produção era comparar duas coisas: nota em benchmark e preço por milhão de tokens. Agora tem uma terceira variável, que é quando o token é gasto. Isso muda o critério de quem monta a stack.

Workload agendado, como cron, ETL noturno ou rotina em lote: calcule o custo pelo pior horário possível, não pelo número anunciado na página de preços. Se o job pode ser adiado ou antecipado pra sair da janela de pico, adiar é mais barato do que trocar de modelo.

Workload interativo, como dev trabalhando ao vivo ou agente respondendo ticket em tempo real: o horário não é escolha, é dado pelo expediente de quem usa. Nesse caso o que importa é onde o expediente do usuário cai no relógio UTC do fornecedor, e não adianta revisar isso uma vez só, porque fornecedor muda tabela.

E essa é a segunda mudança de preço da DeepSeek em menos de três meses. A de maio tornou permanente um desconto promocional; a de agosto criou a variação por horário. Preço de modelo mais barato não é constante de contrato, é variável que precisa de revisão recorrente, principalmente quando o cliente tem margem calculada em cima do custo do token.

Pra segunda de manhã

Duas coisas dão pra fazer sem esperar o próximo ciclo de sprint. Primeiro, listar todo agente ou rotina que roda em horário fixo e conferir se a janela cai dentro do pico do fornecedor usado, sabendo que cada fornecedor define a própria janela. Segundo, se o job for adiável, mover pra fora da janela antes de considerar trocar de modelo: é a mudança mais barata das duas.

Modelo aberto mais barato continua sendo mais barato. Só que "mais barato" parou de ser um número fixo na página de preços e virou uma pergunta que depende de que horas são.

Isso vale pra qualquer operação que monta agente de IA em produção, que é o tipo de decisão que entra na construção de agentes de IA da Overflow: antes de fechar arquitetura, checar não só o benchmark e o preço do modelo, mas o comportamento da tabela de preço ao longo do dia.

Fontes

COMPARTILHARLINKEDINXWHATSAPP

// NEWSLETTER

O que a gente aprende, você recebe.

Bastidor de projeto, decisão técnica e o que estamos vendo em IA dentro das empresas. Sem enrolação e sem spam.

// PRÓXIMO PASSO

Tem um problema
parecido?