Resumo

  • O Mistral Large 4 entrou em prévia pública por API em 6 de outubro. A empresa prevê publicar os pesos até o fim do mês; em 8 de outubro, a operação pelo cliente ainda é uma possibilidade futura.
  • A ficha do modelo exibe preços promocionais temporários de US$ 0,68 por milhão de tokens de entrada e US$ 2,09 por milhão de saída, ante preços padrão de US$ 1,36 e US$ 4,18. Um teste barato mede a conta da API, não o custo de operar o modelo.
  • O comprador pode testar agora uma carga de trabalho real e, depois que arquivos, licença e documentação forem publicados, comparar o custo por resultado aceito e o grau de controle necessário.

Dois relógios no mesmo lançamento

O anúncio da Mistral em 6 de outubro acionou dois relógios. O primeiro já está correndo: o Large 4 pode ser testado pela prévia da API Mistral Studio. O segundo foi prometido: os pesos devem sair até o fim do mês. São formas diferentes de acesso. Na primeira, a Mistral opera o modelo e o cliente compra inferência. Na segunda, o cliente talvez possa operar o modelo, dependendo da publicação e das condições que vierem junto.

A sequência tem valor comercial. Uma empresa pode verificar se o modelo ajuda uma tarefa real antes de decidir se quer executá-lo numa nuvem privada ou em servidores próprios. Isso reduz o custo de aprender. Mas a comparação disponível hoje é entre um serviço cobrado por uso e a alternativa atual do comprador, não com uma instalação própria que ainda não existe.

A promoção dá um preço concreto ao primeiro teste. A ficha oficial mostra US$ 0,68 por milhão de tokens de entrada sem cache e US$ 2,09 por milhão de saída; os preços padrão riscados são US$ 1,36 e US$ 4,18. A entrada em cache tem preço separado: US$ 0,07 na promoção e US$ 0,14 no valor padrão. O changelog informa desconto de 50% por duas semanas. Como exemplo, 10 milhões de tokens de entrada sem cache e um milhão de saída custariam US$ 8,89 nos preços promocionais, antes de novas tentativas, ferramentas, impostos e orquestração; nos valores padrão, a mesma combinação custaria US$ 17,78. É uma conta ilustrativa, não uma previsão.

Para o comprador, o número útil não é o preço por milhão de tokens isolado. É o custo por resultado aceito com os próprios prompts, reaproveitamento de cache, tamanho da resposta, chamadas a ferramentas, tentativas adicionais e revisão humana. Um agente rodando por uma hora pode consumir uma combinação diferente de uma classificação curta. Se uma resposta falhar e precisar ser refeita, uma tentativa barata não garante uma tarefa concluída a baixo custo.

Um ranking não decide a compra

As primeiras avaliações mostram nuances. O perfil da Vals AI de 7 de outubro coloca o Large 4 em 33º lugar entre 45 modelos no Vals Index, com 48,05%; ao mesmo tempo, lista seu melhor resultado como 6º lugar entre 76 no Harvey’s Legal Agent Benchmark. O índice combina tarefas de finanças, programação, direito e impostos, ponderadas pela participação aproximada desses setores no PIB dos Estados Unidos. A Vals o descreve como um indicador aproximado e alerta que alguns testes podem usar provedores e parâmetros diferentes. É uma lente específica, não uma nota universal de qualidade.

Por isso, a empresa deve testar as próprias tarefas em vez de adotar o material de lançamento ou um ranking agregado. A Mistral diz que continua refinando a prévia e que divulgará mais detalhes de arquitetura, benchmarks e pós-treinamento junto com os pesos. No lançamento, o Le Monde registrou que as alegações de desempenho ainda aguardavam confirmação independente. O cliente pode reunir evidência própria pela API agora, mas deve vinculá-la à versão e à configuração testadas.

A opção futura ainda não tem preço de operação

A ficha oficial informa 52 bilhões de parâmetros ativos, 1,05 trilhão no total, um codificador visual de 1,6 bilhão e contexto de um milhão de tokens. Esses dados não mostram quanta memória o cliente precisará para atingir determinada latência e concorrência. Os parâmetros ativos por token não são a mesma coisa que a memória para todos os pesos. Precisão, quantização, largura de banda, roteamento, tamanho do contexto e a pilha de inferência também importam.

Os pesos futuros podem ter valor, mas isso depende das condições. Eles poderiam permitir inferência numa nuvem privada ou em servidores próprios, alterar alguns controles de moderação ou preservar uma alternativa se o serviço hospedado mudasse. Também transfeririam para o cliente a responsabilidade por atualizações, segurança, escala, disponibilidade e resposta a incidentes. Baixar o modelo não torna sua operação gratuita.

Uma sequência prudente é testar agora um conjunto representativo de tarefas e registrar qualidade, latência e gasto de tokens. É preciso guardar prompts, versão, critérios de aceitação, premissas de cache e número de tentativas. Quando os pesos forem publicados, as mesmas tarefas podem ser repetidas e comparadas por resultado aceito, incluindo hardware e equipe de operação. Licença, segurança, disponibilidade e requisitos de equipamento precisam de avaliações próprias.

O lançamento, portanto, tem preço de um lado e ainda não do outro. A API transforma a avaliação em cobrança hoje. Os pesos podem deslocar o controle mais adiante, mas o cliente ainda não sabe quanto esse controle custará nem se será melhor para sua operação.

Fontes: anúncio da Mistral; ficha e preços; changelog; perfil do modelo na Vals; metodologia do Vals Index; reportagem do Le Monde.