Por que razão os orçamentos de IA falham
O erro está em tratar a IA como um custo tecnológico, em vez de um sistema económico. Ao contrário do software tradicional, cuja estrutura de custos é relativamente previsível, a IA introduz uma dinâmica diferente. As licenças são adquiridas, as subscrições são renovadas e os custos são conhecidos à partida. Com a IA, essa previsibilidade desaparece.
Os custos já não dependem apenas do número de utilizadores. Dependem também daquilo que lhes é pedido, da complexidade das tarefas executadas, da profundidade da análise realizada pelos modelos e do volume de trabalho processado pelos sistemas de IA. Cada vez mais, os utilizadores não são pessoas, mas agentes e fluxos de trabalho automatizados que executam inferências continuamente, 24 horas por dia, sem licenças individuais a contabilizar nem limites de utilização predefinidos.
Em quase todas as implementações que analisámos, incluindo as nossas, uma pequena percentagem dos utilizadores e fluxos de trabalho é responsável pela maioria da despesa. Menos de 10% representam a maior parte dos custos. A pressão é constante: em alguns dos nossos ambientes, recebemos centenas de pedidos por dia para aumentar limites individuais de consumo.
À medida que a IA se torna mais presente nas organizações, o consumo cresce com cada novo fluxo de trabalho, agente ou modalidade. Os chatbots evoluem para agentes. Os agentes evoluem para equipas de agentes. As aplicações baseadas apenas em texto expandem-se para experiências multimodais que incluem imagens, vídeo e áudio. No mundo físico, os robôs autónomos recorrem à mesma infraestrutura de inferência, onde cada decisão e exceção gera custos adicionais em tokens. À medida que os casos de utilização se multiplicam, a curva de consumo acelera de forma exponencial.
A segurança acrescenta uma camada adicional de custo que nenhuma organização pode ignorar. Quanto mais modelos, agentes, dados e sistemas interligados uma organização incorpora, maior é a superfície de exposição que tem de proteger. A monitorização contínua, os controlos de acesso reforçados, a deteção de ameaças e a capacidade de resposta rápida representam custos permanentes que raramente são considerados nos planos iniciais, mas que aumentam com cada nova implementação.
Este fenómeno reflete o paradoxo de Jevons aplicado à IA. Tal como os motores a vapor mais eficientes levaram ao aumento do consumo de carvão, em vez da sua redução, a descida do custo dos tokens incentiva as organizações a utilizar mais IA, e não menos. Tarefas que antes eram demasiado dispendiosas tornam-se economicamente viáveis, gerando nova procura e impulsionando ainda mais o consumo.
A nossa simulação revelou que, se o custo dos tokens diminuísse 25%, apenas 15% das organizações conseguiriam efetivamente reduzir a despesa. As restantes reinvestiriam as poupanças em novos casos de utilização, cargas de trabalho mais abrangentes ou modelos de maior desempenho. A solução não passa por incentivar os colaboradores a utilizar menos IA, uma vez que isso limitaria os ganhos de produtividade esperados. A solução consiste em direcionar cada tarefa para o modelo mais eficiente do ponto de vista económico, permitindo que o mesmo orçamento produza mais trabalho útil e um retorno mais mensurável.
Existe uma segunda força igualmente relevante: a fronteira de Pareto, o ponto ótimo entre custo e valor. Muitas organizações continuam a investir demasiado em tarefas que não justificam esse nível de capacidade ou a atribuir trabalho de forma ineficiente, desperdiçando oportunidades de criação de valor. As organizações mais avançadas reduzem essa ineficiência ao associar cada tarefa ao modelo mais adequado e ao otimizar continuamente o consumo através da compressão de prompts, da utilização inteligente de cache e da destilação de modelos.
Eis um exemplo concreto: uma apresentação executiva de fim de trimestre que anteriormente exigia cerca de 15 horas de trabalho de três analistas financeiros pode agora ser concluída por uma única pessoa em apenas duas horas, com um custo marginal de algumas centenas de dólares, face aos milhares de dólares correspondentes ao tempo poupado. É este o tipo de relação que as organizações mais avançadas procuram medir. O retorno não está nos tokens que deixaram de ser consumidos, mas na capacidade libertada para atividades de maior valor. Quando esse impacto é associado a indicadores de negócio já monitorizados, a despesa em tokens transforma-se numa fonte mensurável de retorno.
Em conjunto, estas dinâmicas explicam por que razão a tokenomics se tornou uma prioridade estratégica. À medida que as organizações procuram obter mais resultados com menos recursos, a fronteira continua a expandir-se: a qualidade melhora, os custos diminuem, surgem novos casos de utilização e o consumo aumenta. A verdadeira disciplina consiste em compreender onde a IA cria valor, quando capturar esse valor e como reinvesti-lo para gerar crescimento sustentável.
A regra certa para cada modelo
A primeira regra consiste em adequar o nível de inteligência ao valor e ao risco da tarefa. Eis um ponto de partida: estimamos que, em todas as indústras, apenas 10 a 20% das tarefas empresariais sejam suficientemente complexas para justificar o uso de tecnologias de ponta ou quase de ponta.
Uma regra prática é simples: se uma tarefa puder ser dividida em etapas bem definidas, um modelo menos avançado será provavelmente suficiente. Os modelos mais sofisticados devem ser reservados para situações em que a complexidade é inerente à tarefa, em que a decomposição compromete a compreensão do problema, em que os erros se podem acumular ao longo de cadeias extensas de agentes ou em que a resposta exige análise jurídica, financeira ou regulamentar.
Existem vários cenários em que este critério se aplica.
O raciocínio complexo é um desses casos. Quando um diretor de estratégia avalia a posição competitiva de uma organização, as tendências macroeconómicas e a situação financeira de um potencial alvo de aquisição, está a lidar com informação contraditória e interdependente que exige um julgamento não evidente. O mesmo acontece com fluxos de trabalho baseados em agentes, nos quais o custo do erro é elevado e uma falha a meio do processo pode comprometer todo o resultado. Outro exemplo é a análise de grandes volumes de informação contextual. Um processo de due diligence com 200 páginas exige rigor, consistência e coerência ao longo de todo o documento.
Encaminhar o trabalho para a inteligência adequada é uma escolha estratégica, não uma preferência técnica. Os líderes precisam de disciplina operacional: classificar o trabalho por complexidade e risco, encaminhá-lo para o nível adequado de inteligência e, depois, ajustar e monitorizar o consumo ao longo do tempo. A parte mais difícil consiste em identificar quais as tarefas que realmente justificam níveis superiores de inteligência.
As organizações que não conseguem distinguir tarefas rotineiras de tarefas cognitivamente exigentes e de maior valor acabarão por desperdiçar recursos em ambos os extremos: utilizando modelos dispendiosos onde não são necessários e modelos mais fracos onde a vantagem está em jogo. A experiência da Accenture demonstra que a capacidade do modelo, por si só, não determina quem lidera na era da IA. O fator diferenciador é a disciplina económica com que essa capacidade é aplicada.
Essa mesma disciplina permitiu a uma operadora de telecomunicações reduzir os seus custos anuais com IA em 68%. Em todos os casos, o avanço resultou da análise detalhada do consumo ao nível dos fluxos de trabalho, seguida do redirecionamento, ajustamento ou reformulação das tarefas antes que as ineficiências se transformassem em custos operacionais permanentes.
O papel da liderança
Na maioria das organizações, os custos associados à IA são imputados ao orçamento de tecnologia, enquanto o valor gerado se manifesta noutras áreas da organização, seja no atendimento ao cliente, na engenharia, no marketing ou em qualquer unidade de negócio que utilize estas capacidades. O CFO analisa os custos, o CIO acompanha a utilização e os líderes de negócio observam os resultados. No entanto, estas perspetivas raramente são integradas de forma consistente à escala da organização.