Кратко

  • Mistral Large 4 перешла в публичное API-превью 6 октября. Компания планирует выпустить веса к концу месяца; на 8 октября самостоятельный запуск клиентом остаётся будущим вариантом.
  • В карточке модели указаны временные промо-цены: $0,68 за миллион входных токенов и $2,09 за миллион выходных против обычных $1,36 и $4,18. Дешёвая проба измеряет счёт за API, а не затраты на собственную эксплуатацию модели.
  • Покупателю стоит сейчас проверить типовую нагрузку, а после публикации файлов, лицензии и технических сведений сравнить стоимость принятого результата и требования к контролю.

Два срока у одного запуска

Объявление Mistral от 6 октября запустило два срока. Первый уже действует: Large 4 доступна через API-превью Mistral Studio. Второй лишь обещан: веса ожидаются до конца месяца. Это не два равноценных способа доступа. В первом случае Mistral эксплуатирует модель, а клиент покупает инференс. Во втором клиент, возможно, сможет запускать её сам — если файлы выйдут и условия это позволят.

Последовательность имеет коммерческий смысл. Предприятие может проверить пользу модели для конкретного рабочего процесса, прежде чем решать, разворачивать ли её в частном облаке или на собственных серверах. Это снижает цену первого этапа обучения. Но сегодня можно сравнить платный сервис с текущей альтернативой покупателя, а не с локальной системой, которой ещё нет.

Промо-тариф позволяет посчитать первый тест. На официальной странице модели указано $0,68 за миллион входных токенов без кэша и $2,09 за миллион выходных; зачёркнутые обычные ставки — $1,36 и $4,18. Кэшированные входные токены стоят отдельно: $0,07 по акции и $0,14 обычно. В changelog говорится о скидке 50% в течение двух недель. Для примера, десять миллионов входных токенов без кэша и миллион выходных обойдутся в $8,89 по акции, не считая повторных попыток, инструментов, налогов и оркестрации; по обычным тарифам — $17,78. Это арифметический пример, а не прогноз.

Покупателю важна не только цена за миллион токенов. Важна стоимость принятого результата с учётом длины запросов, повторного использования кэша, размера ответов, вызовов инструментов, повторов и ручной проверки. Агент, работающий час, потребляет иной набор токенов, чем короткая классификация. Если неудачный ответ приходится запускать заново, дешёвая попытка не означает дешёвого завершённого задания.

Рейтинг не заменяет решение о покупке

Первые оценки показывают разные стороны. Профиль Vals AI от 7 октября ставит Large 4 на 33-е место из 45 в Vals Index с результатом 48,05%, но её лучший отдельный результат — шестое место из 76 в Harvey’s Legal Agent Benchmark. Индекс объединяет задачи в финансах, программировании, праве и налогообложении, взвешенные примерно по доле отраслей в ВВП США. Vals называет индекс приблизительным ориентиром и предупреждает, что некоторые тесты могут использовать другие провайдеры и параметры. Это один конкретный взгляд, а не универсальная шкала качества.

Поэтому компаниям следует проверять свои задачи, а не считать рекламные тезисы или общий рейтинг доказательством пригодности. Mistral говорит, что продолжает дорабатывать превью и представит больше сведений об архитектуре, тестах и постобучении вместе с весами. Le Monde при запуске сообщила, что заявления о производительности ещё ожидали независимого подтверждения. Клиент может собирать собственные результаты через API, но должен привязать их к конкретной версии превью и конфигурации сервиса.

У будущего варианта пока нет стоимости эксплуатации

Официальная карточка указывает 52 млрд активных параметров, 1,05 трлн всего, визуальный кодировщик на 1,6 млрд и контекстное окно в миллион токенов. Эти данные не говорят, сколько памяти понадобится клиенту при выбранных требованиях к задержке и параллельным запросам. Активные параметры на токен — не то же самое, что память для всех весов. Имеют значение точность, квантование, пропускная способность памяти, маршрутизация, длина контекста и стек инференса.

У будущих весов может быть ценность, но она зависит от условий. Они могут позволить запуск в частном облаке или на собственных серверах, изменение отдельных настроек модерации или резервный вариант на случай изменений хостинга. Одновременно клиенту перейдут обновления, безопасность, масштабирование, доступность и реагирование на инциденты. Скачивание модели не делает её эксплуатацию бесплатной.

Разумный порядок действий — сейчас протестировать типовой набор задач через API и зафиксировать качество, задержку и расход токенов. Следует сохранить запросы, версию модели, критерии приёмки, допущения по кэшу и число повторов. После публикации весов те же задачи можно повторить и сравнить затраты на принятый результат, включая инфраструктуру и людей. Лицензия, оборудование, безопасность и доступность требуют отдельной проверки.

Итак, у запуска уже есть цена с одной стороны и пока нет цены с другой. API превращает оценку в счёт уже сегодня. Веса могут позднее перенести точку контроля, но покупатель пока не знает, сколько этот контроль будет стоить и окажется ли он удобнее в эксплуатации.

Источники: объявление Mistral; карточка модели и цены; changelog; профиль модели Vals; методика Vals Index; материал Le Monde о запуске.