ИИ · 10 октября 2026 г.

Мистраль представляет открытую модель Лардж 4 с триллионом параметров

cable network
Taylor Vick / Unsplash

Компания Мистраль открыла публичный предварительный доступ к своей языковой модели Лардж 4 через облачную платформу, анонсировав планы по выпуску весов модели в конце текущего месяца. Эта система представляет собой самую мощную разработку организации на текущий момент и использует архитектуру смеси экспертов.

Модель обладает общим количеством параметров, равным одному триллиону, однако для обработки каждого запроса активируется только сорок девять миллиардов параметров. Такой подход позволяет значительно экономить аппаратные ресурсы по сравнению с запуском всей модели целиком. Система способна отвечать на вопросы более чем на ста шестидесяти языках.

На бенчмарке АА Сайбер Индекс новинка вошла в пятерку лидеров, продемонстрировав особую эффективность в исправлении уязвимостей в проектах с открытым исходным кодом. В этой категории модель набрала восемьдесят два процента, опередив других конкурентов в сегменте открытых решений. В задачах компьютерного зрения система превзошла модель ДжиПиТи-6 Астра на один процент по результатам теста Денс200, оценивающего поиск объектов на изображениях.

Хотя модель уступает лидеру рынка в популярных тестах на написание кода, она показывает результаты выше, чем ведущие открытые аналоги, включая Квен3.8 Макс и ДипСик В4 Про. Также зафиксировано превосходство над этими моделями в тестах на знание автоматизации и решении сложных задач, требующих недель человеческой работы.

Обучение системы проводилось на трех тысячах восьмистах чипах Грейс Блэквелл, каждый из которых объединяет два графических ускорителя Блэквелл от Нвидиа и один центральный процессор. Процесс обучения строился на методе проб и ошибок, где модель выполняла задачи без подсказок от человека в рамках циклов, называемых разворотами. Специализированный искусственный интеллект анализировал итоги каждого цикла для дальнейшей доводки основной модели.

Инженеры компании создали программный стек, способный выполнять десятки тысяч разворотов параллельно, используя модули с песочницами для запуска кода и поисковые движки. Система генерирует тридцать три миллиона токенов в сутки, при этом менее половины этого объема расходуется на текущий процесс обучения. Работа генерации данных и процесса обучения разделена, что позволяет избегать задержек.

Организация не прекратила процесс обучения после создания текущей версии и ожидает появления еще более крупных и способных моделей в ближайшие месяцы. В долгосрочной перспективе планируется создание серии специализированных версий на базе данной технологии.