Em 2024, OpenAI anunciou contexto de 128k tokens. Google respondeu com 1 milhão. Anthropic com 200k. A mídia especializada tratou isso como corrida espacial — quem tem mais janela, ganha. O que quase nenhum artigo mencionou: a maioria desses tokens nunca é processada com atenção real. É a mesma lógica de um HD externo de 4TB vendido para quem guarda 30GB de fotos.
O problema da atenção diluída
Transformers processam tokens com atenção distribuída. Teoricamente, cada token presta atenção a todos os outros. Na prática, pesquisas como Lost in the Middle (Liu et al., 2023) mostraram que LLMs recuperam informação de forma não-uniforme dentro do contexto: o início e o fim do prompt recebem atenção desproporcional. O que está no meio de um documento longo de 200k tokens é, em muitos casos, efetivamente perdido. Janela de contexto grande não é memória grande — é capacidade de armazenar coisas que o modelo vai ignorar.
Isso tem consequência direta em aplicações reais. Sistemas RAG que concatenam 15 documentos de referência numa única chamada — comum em implementações rápidas — não ganham automaticamente qualidade por isso. Mais contexto sem estratégia de recuperação cria ruído. O engenheiro que entende isso projeta chunks menores, re-ranking semântico, e prompts que localizam a informação relevante em posições privilegiadas dentro da janela. O engenheiro que não entende aumenta o contexto e acha que está resolvendo o problema.
O custo real em produção
Tokens não são gratuitos. GPT-4 cobra por token de entrada e de saída. Um sistema que injeta documentos inteiros no contexto de cada chamada pode gastar 10 a 50 vezes mais do que um sistema equivalente com recuperação eficiente. Em escala — 10 mil chamadas por dia, modesto para uma empresa média — a diferença entre uma implementação bem projetada e uma ingênua pode ser dezenas de milhares de reais por mês. Token inflation é um problema econômico, não apenas técnico.
A conclusão não é que janelas de contexto maiores são inúteis. São genuinamente valiosas para tarefas específicas: análise de contratos longos, revisão de código em repositórios inteiros, síntese de documentação volumosa. Mas o marketing de 'contexto ilimitado' vende uma abstração que não existe. O que existe são trade-offs entre custo, latência, qualidade de atenção e precisão de recuperação. Quem entende esses trade-offs projeta sistemas que custam menos e funcionam melhor. Quem não entende paga mais pela mesma resposta ruim.
