Token (LLM)
Token é a unidade mínima de texto que um modelo de IA processa e cobra — entender isso é o que separa negócio que sabe o número do que só confia na fatura.
Token é a unidade mínima de texto que um modelo de linguagem lê e gera — geralmente um pedaço de palavra, uma palavra inteira ou um sinal de pontuação, algo em torno de 4 caracteres em português. Todo modelo (GPT, Claude, Gemini) cobra por token processado, tanto na entrada (o que você manda) quanto na saída (o que ele responde).
Pra quem paga a fatura de IA no fim do mês, token não é curiosidade técnica — é o número antes da promessa. Contrato de IA que promete “atendimento ilimitado” sem falar de token está escondendo a única variável que decide se a conta cabe no orçamento ou explode no mês de pico.
Como o token vira custo real
Um prompt de 1000 palavras em português vira algo perto de 1300-1500 tokens de entrada. A resposta do modelo soma mais tokens de saída, geralmente cobrados a um preço mais alto. Multiplica isso por 500 atendimentos de WhatsApp por dia numa clínica ou imobiliária, e a diferença entre um modelo caro e um mais barato — ou entre um prompt enxuto e um prompt inchado de contexto desnecessário — vira uma fatura 3x maior sem ninguém ter percebido no meio do caminho.
Por que importa pro dono de negócio que ainda não usa IA
O erro mais comum de quem está começando é escolher o modelo pelo nome (sempre o mais forte, mais caro) sem medir quantos tokens o próprio caso de uso realmente consome. Uma triagem simples de WhatsApp (“qual seu nome, qual seu problema”) não precisa do modelo mais caro do mercado — precisa do modelo certo pro volume de token que aquele fluxo gera.
Número antes de promessa significa medir isso antes de assinar qualquer contrato: quantos atendimentos por dia, quantos tokens por atendimento, qual o custo real projetado — não a estimativa genérica que todo vendedor de SaaS de IA repete.
Erro comum
Deixar o histórico da conversa inteira entrar no prompt toda vez que o cliente manda uma nova mensagem. Isso multiplica o consumo de token a cada rodada, porque o modelo reprocessa tudo de novo — inclusive a parte que já foi respondida há 10 mensagens. Sistema mal desenhado paga token repetido pelo mesmo contexto dezenas de vezes por conversa.
Como aplicar hoje
Antes de contratar qualquer solução de IA, peça pra ver a contagem de token do seu próprio caso — não a média de mercado. Quem quer aprender a calcular isso na prática, a Aula 001 do Aleff Pepper mostra como estimar consumo de token e escolher modelo certo pro orçamento certo em menos de 1 hora. Se o negócio já roda volume de atendimento no WhatsApp e quer ver o número exato aplicado no próprio caso, o iAgentes já entrega esse cálculo pronto dentro do pacote.