O último trimestre normalmente concentra revisões de orçamento, planejamento do ano seguinte e decisões sobre quais projetos devem ganhar escala. Isso transforma setembro em um ponto importante de decisão.
Durante boa parte de 2026, as empresas aceleraram pilotos de Inteligência Artificial, ampliaram ambientes de dados e colocaram agentes para experimentar novos casos de uso. Mas, a virada para o Q4 funciona como um teste de maturidade. O que não foi medido no primeiro semestre, como: consumo de cloud, tokens, modelos, usuários e aplicações, pode custar caro no Q4.
Dois movimentos anunciados no final desse Q3 pela Snowflake e pelo Google mostram que o mercado está entrando em uma nova etapa. Além de disponibilizar recursos de IA, as plataformas estão criando mecanismos cada vez mais específicos para medir, atribuir e controlar seu consumo.
O aviso da Snowflake: de “sem limite” para “cota por usuário”
A Snowflake lançou o Cortex AI Gateway, um ponto de controle para governar como aplicações e agentes de terceiros dentro da organização acessam modelos de IA. Agora existe um objeto de gateway por conta, com permissões concedidas por papel, rastro de uso por requisição e atribuição de consumo por usuário, modelo e token.
Para times de plataforma, segurança e FinOps, a novidade permite concentrar em um mesmo ambiente mecanismos para conceder acesso aos modelos, auditar atividades e atribuir gastos. A plataforma registra, por solicitação, informações como usuário, modelo e consumo de tokens e permite visualizar o uso de créditos entre modelos e usuários.
No dia seguinte, uma outra novidade. A Snowflake anunciou a disponibilidade de limites semanais de créditos por usuário. Os budgets permitem acompanhar o consumo. Já as quotas por usuário podem efetivamente bloquear novas utilizações quando o limite configurado é atingido.
Essa distinção parece operacional, mas sinaliza uma mudança maior, que passa a envolver decisões sobre quem pode consumir, quanto pode consumir e a qual unidade de negócio aquele consumo deve ser atribuído.
O aviso do Google Cloud: o piloto gratuito tem data de validade
No mesmo período, o Google Cloud anunciou um modelo de cobrança por consumo para os recursos de IA do Data Cloud baseado em consumo: US$ 3 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída. A página pública de preços informa um período gratuito até 30 de setembro de 2026, depois do qual o novo modelo de preços entra em vigor.
Existe, porém, uma particularidade importante. Para o recurso Data Insights do Knowledge Catalog, a documentação específica informa que a cobrança ativa começa em 27 de outubro de 2026. O próprio Google disponibiliza mecanismos de medição do consumo antes do início da cobrança, permitindo que administradores acompanhem os tokens utilizados.
As datas variam conforme o recurso, portanto precisam ser verificadas antes da publicação e, principalmente, antes de qualquer projeção financeira. Os valores divulgados também são preços públicos e não representam necessariamente as condições comerciais contratadas individualmente pelas empresas.
Ainda assim, o movimento deixa uma mensagem relevante para quem está entrando no Q4: piloto gratuito não significa operação gratuita.
Uma aplicação pode parecer economicamente interessante enquanto está restrita a um grupo pequeno e apresentar uma dinâmica de custos completamente diferente quando passa a atender centenas ou milhares de usuários, executar processos continuamente ou gerar grandes volumes de tokens.
O ponto que conecta os dois casos
Snowflake e Google Cloud resolveram problemas diferentes. Uma criou um freio de acesso, a outra trocou o modelo de cobrança, mas os dois casos apontam para a mesma lacuna: a maioria das empresas ainda não mede consumo de IA com o mesmo rigor que mede consumo de computação. Cota de crédito, token de entrada e token de saída não aparecem hoje nos mesmos dashboards de FinOps que já existem para EC2, para BigQuery slots, para armazenamento. Enquanto isso for verdade, cada anúncio de precificação de IA chega como notícia e não como algo previsto no orçamento.
“Os números do desperdício de token estão em evolução. Precisamos entender o quanto de dinheiro é desperdiçado em soluções de IA que são colocadas em produção e não são efetivas, gerando consumo em nuvem, elevando o custo e inviabilizando um projeto que poderia trazer um bom resultado. Quando a gente entente essa dor do mercado, inclusive falando desse custo em token, temos que propor soluções com melhor performance. E hoje o tema “consumo de tokens é um tema crítico… está ficando caro!”, declara Rafael Capua, COO da Jump.
A virada de trimestre é o momento certo para fechar essa lacuna, não o Q1 de 2027. O que não foi contabilizado agora, entra no orçamento de outubro, novembro e dezembro sem histórico de consumo para embasar a previsão e os times de FinOps fecham o ano tentando explicar a variação do custo.
O Q4 começa com uma conta que deveria ter sido medida antes
Nessa passagem entre infraestrutura, dados e IA que FinOps ganha uma nova função. Mais do que procurar desperdícios depois que a fatura chega, a disciplina passa a ajudar empresas a criar mecanismos para que custo, consumo e valor sejam observáveis desde o início.
“Quando a gente faz uma solução de IA, em um pequeno teste a solução pode funcionar muito bem, o custo pode ser muito bom, mas na hora que você começa a expandir isso, o custo pode se perder e essa é uma preocupação que muitos clientes nossos têm trazido”, afirma Anderson Argentoni, CEO da Jump.
Como controlar o custo da IA, da solução de dados e da nuvem? Conheça o OPT-3.
