Открытые модели.
Понятный выбор.
Какая модель лучше для своего сервера? Сравниваем качество, размер и контекст — от одной видеокарты до большого кластера.
Модели под вашу задачу
По пять моделей в каждом классе. Баллы качества — из одного независимого источника, параметры — с проверкой карточек весов.
* Оценочный индекс AA — часть тестов ещё не выполнена; это не полный замер. Рейтинг показан с одним десятичным знаком, сортировка — по исходным значениям. Режим reasoning указан рядом с моделью.
Q4 — оценка памяти только под веса. Оперативные буферы, KV-кеш, параллельные запросы и особенности движка требуют дополнительной памяти. Это не замер качества Q4-квантизации и не готовая конфигурация GPU. Как считали ↗
Если выбирать одну
Три отправные точки по качеству в своём размерном классе. Финальный выбор проверяйте на собственных задачах.
За общим баллом — разные навыки
Шесть срезов: общий интеллект, знания, наука, код и длинный контекст. Выше — лучше. На каждом графике своя сортировка.
Внешние рейтинги обновляются отдельно. Их шкалы и агентные окружения различаются: результаты SWE-bench, Arena и AA нельзя складывать в общий балл. Здесь графики построены по замерам Artificial Analysis на дату проверки; пропущенные результаты не заменяются нулями.
Что стоит за таблицей
Одна версия рейтинга
Все баллы — Artificial Analysis Intelligence Index v4.3. На старой картинке была v4.1.1: снижение чисел между версиями не означает, что модель стала хуже.
Берём лучший протестированный режим одной версии модели. Индекс — составная шкала, а не процент правильных ответов. Малая разница не доказывает превосходство во всех задачах: GLM‑5.3 — 44,9, Kimi K3 — 43,8.
Показаны модели с доступными весами и установленной лицензией. G9v3 и Nex‑N2‑Pro остаются с оценочным индексом. Motif 3 не включена: в источнике нет подтверждённой ссылки на веса и лицензию. Это подборка для выбора, а не полный каталог рынка.
Память и контекст без путаницы
Q4-веса ≈ параметры в млрд × 0,55 GB. Малые — до 40B; средние — свыше 40B до 400B; большие — свыше 400B. Для MoE память зависит от всех весов, а число активных параметров описывает вычисления.
У DeepSeek V4.1 Flash к 552B backbone добавлено 196B Engram: получается от ~411 GB по той же формуле. Вспомогательные компоненты и их формат могут увеличить объём. Это не обещание размещения всей модели на GPU.
Контекст указан для открытых весов. У Qwen3.8 нативно 262 144 токена; расширение до ~1M требует настройки. У API параметры могут отличаться. Лицензия каждой модели доступна по ссылке в таблице; GLM‑5.3 и крупные Qwen используют собственные условия.
Что изменилось относительно исходной таблицы Проверены все 15 строк
Источники и следующие обновления
Дата проверки: 13.09.2026. Источник чисел: публичные данные Artificial Analysis, единый снимок v4.3. Ссылки на конкретную оценку, карточку открытых весов и лицензию находятся у каждой модели. Для параметров и нативного контекста при расхождении приоритет у карточки разработчика.
При обновлении заново проверяем релизы, доступность весов, лицензии и версию индекса; пересчитываем память и сохраняем журнал изменений. Страница показывает дату фактической проверки, а через 14 дней напоминает, что снимок требует пересмотра. Автоматического изменения рекомендаций без проверки источников нет.