Resumen

  • Mistral Large 4 entró en vista previa pública por API el 6 de octubre. La empresa prevé publicar los pesos a fin de mes; al día 8, la operación por parte del cliente sigue siendo una posibilidad futura.
  • La ficha del modelo muestra precios promocionales temporales de 0,68 dólares por millón de tokens de entrada y 2,09 dólares por millón de salida, frente a tarifas estándar de 1,36 y 4,18 dólares. Una prueba barata mide la factura de API, no el coste de operar el modelo.
  • Los compradores pueden probar ahora un flujo de trabajo representativo y, tras la publicación de archivos, licencia y documentación, comparar el coste por tarea aceptada y el nivel de control requerido.

Dos relojes en un mismo lanzamiento

El anuncio de Mistral del 6 de octubre puso en marcha dos plazos. El primero ya corre: Large 4 está disponible mediante la API de vista previa de Mistral Studio. El segundo es una promesa: los pesos llegarían antes de terminar el mes. No son dos formas equivalentes de acceso. En la primera, Mistral opera el modelo y el cliente compra inferencia. En la segunda, el cliente podría ejecutarlo directamente, sujeto a que se publique y a las condiciones finales.

El orden tiene valor comercial. Una empresa puede empezar a medir si el modelo resuelve una tarea real antes de decidir si quiere alojarlo en una nube privada o en sus propias máquinas. Así reduce el coste de aprender. Pero hoy la comparación es entre un servicio medido por uso y la alternativa actual del comprador, no frente a una instalación local que aún no está disponible.

La promoción hace que esa primera prueba tenga un precio concreto. La ficha oficial muestra 0,68 dólares por millón de tokens de entrada no almacenados en caché y 2,09 por millón de salida; las tarifas estándar indicadas son 1,36 y 4,18 dólares. La entrada en caché se cobra aparte: 0,07 dólares con descuento y 0,14 al precio estándar. El changelog anuncia un 50% de descuento durante dos semanas. Como ejemplo, 10 millones de tokens de entrada sin caché y un millón de salida cuestan 8,89 dólares con los precios promocionales, antes de reintentos, herramientas, impuestos y orquestación; con las tarifas estándar serían 17,78 dólares.

Es una operación aritmética, no una previsión.

Para el comprador, la cifra útil no es el precio por millón de tokens aislado. Es el coste por resultado aceptado con sus propios prompts, reutilización de caché, tamaño de salida, llamadas a herramientas, reintentos y revisión humana. Un agente que trabaja durante una hora puede consumir un patrón distinto al de una clasificación breve. Si hay que repetir una respuesta deficiente, el coste bajo de cada intento no garantiza un coste bajo de finalización.

Una clasificación no decide la compra

Las primeras evaluaciones muestran matices. El perfil de Vals AI del 7 de octubre coloca Large 4 en el puesto 33 de 45 del Vals Index, con un 48,05%, pero también registra su mejor resultado en el puesto 6 de 76 en Harvey’s Legal Agent Benchmark. El índice combina pruebas de finanzas, programación, derecho e impuestos, ponderadas según su participación aproximada en el PIB de Estados Unidos. Vals lo presenta como un indicador indirecto y advierte que algunas pruebas pueden usar proveedores o parámetros distintos. Es una lente concreta, no una escala universal de calidad.

Por eso conviene probar la tarea del comprador en lugar de aceptar el mensaje de lanzamiento o una posición agregada. Mistral dice que sigue ajustando la vista previa y que publicará más detalles de arquitectura, benchmarks y postentrenamiento cuando lleguen los pesos. Le Monde informó el día del lanzamiento que las afirmaciones de rendimiento aún esperaban confirmación independiente. Por ahora, el comprador puede reunir evidencia propia mediante la API, pero debe asociarla a esa versión y a esa configuración.

La opción todavía no tiene coste operativo

La ficha técnica indica 52.000 millones de parámetros activos, 1,05 billones en total, un codificador visual de 1.600 millones y una ventana de contexto de un millón de tokens. Ninguna de esas cifras dice cuánta memoria necesita el cliente para alcanzar una latencia y concurrencia determinadas. Los parámetros activos por token no equivalen al tamaño total que debe cargarse. También importan la precisión, la cuantización, el ancho de banda de memoria, el enrutamiento, la longitud del contexto y la pila de inferencia.

Los pesos futuros tienen un valor posible, pero condicionado. Podrían permitir el despliegue en una nube privada o en servidores propios, modificar algunos controles de moderación o conservar una alternativa si cambiara el acceso alojado. También trasladarían al cliente la responsabilidad de actualizar, proteger, escalar y mantener el servicio. Descargar un modelo no hace gratuito su funcionamiento.

La secuencia prudente consiste en probar ahora un conjunto representativo y registrar calidad, latencia y gasto en tokens. Hay que conservar los prompts, la versión, las reglas de aceptación, las hipótesis de caché y los reintentos. Cuando se publiquen los pesos, se repiten las tareas y se compara el coste por resultado aceptado, incluyendo infraestructura y personal. La licencia, el hardware, la seguridad y la disponibilidad requieren revisiones separadas.

Así, el lanzamiento tiene precio en un lado y todavía no en el otro. La API convierte la evaluación en una factura desde hoy. Los pesos quizá muevan el punto de control más adelante; aún no se sabe cuánto costará ese control ni si será mejor para el cliente.

Fuentes: anuncio de Mistral; ficha y precios; changelog; perfil de Vals; metodología del Vals Index; cobertura de Le Monde.