Na mesma manhã, uma empresa pode precisar classificar quinhentos pedidos, comparar duas propostas de fornecedores e decidir se aceita uma condição de pagamento fora do padrão.
As três tarefas podem envolver inteligência artificial. Isso não significa que devam usar o mesmo modelo, o mesmo nível de raciocínio ou o mesmo grau de autonomia.
O seletor de modelos cria uma tentação compreensível: escolher “o melhor” e usá-lo para tudo. Em produção, essa decisão costuma ser cara e pouco informativa. Um modelo muito capaz pode gastar tempo em trabalho previsível. Um modelo rápido pode produzir uma resposta plausível em uma tarefa na qual o erro custa demais.
Em 2 de outubro de 2026, a OpenAI publicou um guia para a família GPT‑6 que recomenda ajustar modelo, esforço de raciocínio e velocidade ao tipo de trabalho. O princípio interessa mesmo a quem usa outros fornecedores: a escolha deve começar na tarefa, não no nome do modelo.
Comece por quatro características do trabalho
Antes de comparar preços, descreva a tarefa com quatro perguntas:
- Qual é o impacto de um erro? Uma etiqueta errada pode ser corrigida. Um desconto enviado ao cliente já produz uma consequência.
- É fácil verificar a resposta? Extrair um CNPJ tem uma resposta objetiva. Avaliar a qualidade de uma proposta exige mais julgamento.
- Qual é o volume? Uma tarefa repetida dez mil vezes amplifica pequenas diferenças de custo e latência.
- Quanto contexto é necessário? Classificar uma frase é diferente de cruzar contratos, histórico comercial e regras internas.
Essa descrição já evita dois erros: pagar por capacidade que a tarefa não usa e economizar justamente onde uma falha seria mais cara.
Quatro destinos possíveis para uma tarefa
| Tipo de trabalho | Exemplo | Escolha inicial | Controle |
|---|---|---|---|
| Repetitivo e verificável | Extrair campos de notas fiscais | Modelo rápido, raciocínio baixo | Amostra e regras automáticas |
| Variável, mas reversível | Preparar um resumo comercial | Modelo equilibrado, raciocínio médio | Revisão por exceção |
| Complexo e de maior impacto | Comparar condições contratuais | Modelo mais capaz, raciocínio alto | Validação especializada |
| Sensível ou difícil de reverter | Alterar dados bancários ou autorizar pagamento | IA pode preparar evidências | Decisão e execução humanas |
O guia da OpenAI traz exemplos semelhantes: GPT‑6 Luna para tarefas focadas e repetidas com objetivo claro, GPT‑6.1 Sol para pesquisa, programação e uso de computador mais complexos, e GPT‑6 Astra para o raciocínio mais exigente. Ele também propõe aumentar o esforço de raciocínio apenas quando a melhoria justificar o custo e o tempo adicionais.
Isso não deve ser lido como uma tabela universal. É uma hipótese de encaminhamento que precisa ser testada com casos reais da empresa.
Preço por token não é custo do trabalho
Uma resposta barata que exige quinze minutos de correção pode custar mais do que uma resposta mais cara aceita quase sem alterações. A conta útil inclui o fluxo completo:
custo por resultado aceito = uso do modelo + tempo de revisão + correções + tratamento de exceções
Imagine, de forma ilustrativa, um processo de triagem de pedidos. O modelo A custa menos por execução, mas a equipe corrige um em cada quatro resultados. O modelo B custa mais, mas quase todas as saídas seguem sem alteração. Sem medir o tempo de revisão, a empresa pode escolher o modelo aparentemente econômico e aumentar o custo humano do processo.
O mesmo vale para velocidade. Uma resposta em dois segundos pode ser decisiva em uma conversa com o cliente. Em um relatório noturno, alguns segundos adicionais talvez não tenham valor econômico.
Um exemplo: tratar pedidos de orçamento
Considere uma caixa de entrada que recebe pedidos em texto livre, PDFs e fotografias. É possível separar o trabalho em camadas:
- um modelo rápido identifica cliente, produtos, quantidades e campos ausentes;
- regras verificam formatos, valores obrigatórios e duplicados;
- um modelo mais capaz prepara o resumo quando existe informação contraditória ou linguagem ambígua;
- uma pessoa decide descontos, prazos especiais e compromissos comerciais;
- o sistema registra a origem, a versão final e as correções.
A empresa deixa de discutir qual modelo “vence” em abstrato. Passa a decidir que parte do trabalho cada nível de capacidade deve receber.
Teste com casos representativos
Escolha uma tarefa e reúna trinta casos reais, removendo dados pessoais quando possível. Inclua casos simples, ambíguos e excepcionais. Defina antes do teste o que conta como resposta aceita.
Compare duas ou três configurações e registre:
- percentual aceito sem alteração;
- minutos de revisão e correção;
- latência;
- custo total por resultado aceito;
- tipos de erro;
- casos que deveriam ter sido encaminhados para uma pessoa.
O tamanho da amostra não prova desempenho universal. Serve para revelar se a configuração funciona no trabalho observado e onde ainda falha.
Contexto repetido também tem custo
Em tarefas recorrentes, a empresa costuma enviar as mesmas instruções, políticas e exemplos em cada pedido. O guia publicado pela OpenAI informa que entradas reutilizadas por cache podem custar até 95% menos do que entradas não armazenadas, dependendo do modelo.
Isso só funciona bem quando o contexto está organizado. Instruções estáveis, fontes aprovadas e definições consistentes devem aparecer antes da parte variável. Se cada execução recompõe tudo de um jeito, a empresa perde previsibilidade e também a possibilidade de reutilizar contexto.
A decisão para a próxima semana
Escolha uma tarefa com volume suficiente para medir. Escreva quatro linhas: impacto do erro, facilidade de verificação, contexto necessário e tempo aceitável. Depois teste duas configurações com os mesmos casos.
O critério não é “qual respondeu melhor uma vez”. É qual produziu mais resultados aceitos, com risco controlado e menor custo total.
O guia Como calcular o retorno de uma automação? ajuda a transformar tempo, correções e valor em uma conta comparável. Para descrever a tarefa antes do teste, você pode usar a ficha de processo pública do Negócio Digital na Prática. O kit completo continua com compras em preparação; a amostra é pública e pode ser usada.