Grok 4.7 и Xiaomi MiMo-V2.6: две новые ИИ-модели за одни выходные
Grok 4.7 и Xiaomi MiMo-V2.6: две новые ИИ-модели за одни выходные
xAI и Xiaomi выпустили обновления своих языковых моделей с разницей в сутки. Grok 4.7 стал больше и умнее, но стоит столько же, сколько предшественник. MiMo-V2.6 от Xiaomi вышла с открытыми весами и сразу возглавила рейтинг открытых моделей.
Grok 4.7: больше модель, та же цена
xAI представила Grok 4.7 21 сентября. Илон Маск назвал модель «заметным улучшением относительно Grok 4.6 при той же цене и скорости».
Grok 4.7 построен на новой базовой модели, которая больше прежней: около 2,1 трлн параметров против 1,5 трлн у версии 4.6. Этап обучения с подкреплением стал длиннее, и больше внимания в нём уделили сложным задачам, на решение которых уходят часы. Необычная деталь: в обучающие данные добавили инженерные материалы SpaceX, включая телеметрию Starlink, производственные записи и журналы отказов.
На практике модель дольше думает над трудными задачами и чаще перепроверяет собственные ответы. Также появился новый набор защитных фильтров.
Характеристики Grok 4.7
Параметр | Значение |
|---|---|
Размер модели | ~2,1 трлн параметров |
Контекстное окно | 500 тыс. токенов |
Входные данные | текст и изображения |
Уровни рассуждения | Low, Medium, High, XHigh |
Инструменты | вызов функций, веб-поиск, поиск по X, выполнение кода |
Цена API | $2 за 1 млн входных токенов, $6 за 1 млн выходных |
Что изменилось в цифрах
Больше всего вырос результат в агентной работе с терминалом: почти вдвое.
Бенчмарк | Grok 4.6 | Grok 4.7 |
|---|---|---|
Terminal-Bench 4.0 | 20,3% | 38,0% |
EEBench (электротехника) | 53,0% | 64,0% |
HealthBench Professional | 48,5% | 56,7% |
CursorBench 4.0 | 40,4% | 46,3% |
DeepSWE v1.1 | 65,2% | 71,0% |
В рейтингах корпоративных задач GDPval и AA-Briefcase Grok 4.7 занял второе место. Впереди только Claude Fable 5.1.
Модель уже доступна в приложении Grok, в X, в Cursor, через xAI API и у сторонних провайдеров. Листа ожидания нет.
Маск сразу рассказал о следующих версиях. Grok 4.8 должен стать «заметным шагом вперёд», Grok 4.9 — выйти на уровень топовых моделей OpenAI и Anthropic, а Grok 5 может претендовать на лидерство.
Xiaomi MiMo-V2.6: лучшая открытая модель
Xiaomi выпустила линейку MiMo-V2.6: модель Pro вышла 21 сентября, Flash — 22 сентября. Главное: веса моделей опубликованы под свободной лицензией MIT, так что их можно скачать, запускать на своих серверах и использовать в коммерческих проектах.
В линейке три модели:
MiMo-V2.6-Pro — флагман на 1,02 трлн параметров. На каждый токен работают около 42 млрд из них (архитектура Mixture-of-Experts).
MiMo-V2.6-Flash — облегчённая версия на 309 млрд параметров, из которых активны около 15 млрд. Рассчитана на массовые и недорогие запросы.
MiMo-V2.6-Pro-UltraSpeed — та же Pro, но до 20 раз быстрее. Нужна там, где важна скорость ответа.
Все модели понимают текст, изображения, видео и аудио и работают с контекстом до 1 млн токенов.
Что нового по сравнению с V2.5
Архитектура осталась прежней. Прирост дали новый подход к обучению и две технические доработки:
контекст расширен до 1 млн токенов;
добавлен модуль предсказания сразу нескольких токенов, который ускоряет генерацию;
по методу «You Only RL Once» модель обучают с подкреплением один раз, сразу на программировании, зрении, агентных задачах и кибербезопасности.
Всё обучение заняло меньше шести дней. По оценкам, оно обошлось примерно в $850 тыс. для Flash и $2,6 млн для Pro. Для сравнения: обучение флагманских моделей американских лабораторий оценивают в сотни миллионов долларов.
Результат заметен сразу. В индексе Artificial Analysis MiMo-V2.6-Pro набрала 46 баллов против 26 у предыдущей версии. Это первое место среди открытых моделей и шестое в общем зачёте.
Модель | Индекс Artificial Analysis |
|---|---|
Claude Fable 5.1 | 53 |
GPT-6 Astra | 53 |
Claude Opus 5 | 51 |
Muse Spark 1.3 | 48 |
GPT-5.6 Sol | 47 |
MiMo-V2.6-Pro | 46 |
При этом цена не выросла: Pro стоит $0,435 за 1 млн входных токенов и $0,87 за 1 млн выходных. Flash ещё дешевле: $0,14 и $0,28.
Слабые места у модели тоже есть. В агентной работе с терминалом и в тестах на кибербезопасность MiMo-V2.6-Pro заметно отстаёт от лидеров, например от GPT-6 Astra.
Кроме моделей, Xiaomi выложила в открытый доступ технический отчёт, компактную версию на 9 млрд параметров, более 7000 сред для обучения с подкреплением и собственный фреймворк для обучения.
Кратко: сравнение моделей
Grok 4.7 | MiMo-V2.6-Pro | |
|---|---|---|
Доступ | закрытая, через API | открытые веса (MIT) |
Размер | ~2,1 трлн | 1,02 трлн (42 млрд активных) |
Контекст | 500 тыс. токенов | 1 млн токенов |
Входные данные | текст, изображения | текст, изображения, видео, аудио |
Цена (вход / выход за 1 млн) | $2 / $6 | $0,435 / $0,87 |
DeepSWE v1.1 | 71,0% | 72,6% |
Terminal-Bench 4.0 | 38,0% | 34,9% |
Итог. Grok 4.7 — добротное обновление без роста цены, особенно заметное в агентных задачах. До лидеров рынка модель пока не дотягивает. MiMo-V2.6 выглядит сильнее по соотношению цены и качества. В программировании она держится на уровне Grok 4.7, при этом обходится в несколько раз дешевле и доступна для запуска на собственных серверах.
Комментарии
Загрузка комментариев…