Открытые веса · Сентябрь 2026

Открытые модели.
Понятный выбор.

Какая модель лучше для своего сервера? Сравниваем качество, размер и контекст — от одной видеокарты до большого кластера.

Проверено 13 сентября 202615 моделей · 3 размерных классаЕдиный рейтинг AA Intelligence Index v4.3Открытые веса ≠ одинаковые лицензии
01 / СРАВНЕНИЕ

Модели под вашу задачу

По пять моделей в каждом классе. Баллы качества — из одного независимого источника, параметры — с проверкой карточек весов.

* Оценочный индекс AA — часть тестов ещё не выполнена; это не полный замер. Рейтинг показан с одним десятичным знаком, сортировка — по исходным значениям. Режим reasoning указан рядом с моделью.
Q4 — оценка памяти только под веса. Оперативные буферы, KV-кеш, параллельные запросы и особенности движка требуют дополнительной памяти. Это не замер качества Q4-квантизации и не готовая конфигурация GPU. Как считали ↗

02 / ГЛАВНОЕ

Если выбирать одну

Три отправные точки по качеству в своём размерном классе. Финальный выбор проверяйте на собственных задачах.

Если память важнее последних баллов: Qwen3.8‑Flash‑Next даёт 39,9 AA при ~99 GB Q4-весов против 41,9 AA и ~176 GB у GLM‑5.3‑Flash. Для изображений в большом классе смотрите также Kimi K3 или DeepSeek V4.1 Flash: большая GLM‑5.3 работает только с текстом.
03 / ДОКАЗАТЕЛЬСТВА

За общим баллом — разные навыки

Шесть срезов: общий интеллект, знания, наука, код и длинный контекст. Выше — лучше. На каждом графике своя сортировка.

МалыеСредниеБольшие

Внешние рейтинги обновляются отдельно. Их шкалы и агентные окружения различаются: результаты SWE-bench, Arena и AA нельзя складывать в общий балл. Здесь графики построены по замерам Artificial Analysis на дату проверки; пропущенные результаты не заменяются нулями.

04 / ПРОЗРАЧНОСТЬ

Что стоит за таблицей

Одна версия рейтинга

Все баллы — Artificial Analysis Intelligence Index v4.3. На старой картинке была v4.1.1: снижение чисел между версиями не означает, что модель стала хуже.

Берём лучший протестированный режим одной версии модели. Индекс — составная шкала, а не процент правильных ответов. Малая разница не доказывает превосходство во всех задачах: GLM‑5.3 — 44,9, Kimi K3 — 43,8.

Показаны модели с доступными весами и установленной лицензией. G9v3 и Nex‑N2‑Pro остаются с оценочным индексом. Motif 3 не включена: в источнике нет подтверждённой ссылки на веса и лицензию. Это подборка для выбора, а не полный каталог рынка.

Память и контекст без путаницы

Q4-веса ≈ параметры в млрд × 0,55 GB. Малые — до 40B; средние — свыше 40B до 400B; большие — свыше 400B. Для MoE память зависит от всех весов, а число активных параметров описывает вычисления.

У DeepSeek V4.1 Flash к 552B backbone добавлено 196B Engram: получается от ~411 GB по той же формуле. Вспомогательные компоненты и их формат могут увеличить объём. Это не обещание размещения всей модели на GPU.

Контекст указан для открытых весов. У Qwen3.8 нативно 262 144 токена; расширение до ~1M требует настройки. У API параметры могут отличаться. Лицензия каждой модели доступна по ссылке в таблице; GLM‑5.3 и крупные Qwen используют собственные условия.

Что изменилось относительно исходной таблицы Проверены все 15 строк
Источники и следующие обновления

Дата проверки: 13.09.2026. Источник чисел: публичные данные Artificial Analysis, единый снимок v4.3. Ссылки на конкретную оценку, карточку открытых весов и лицензию находятся у каждой модели. Для параметров и нативного контекста при расхождении приоритет у карточки разработчика.

При обновлении заново проверяем релизы, доступность весов, лицензии и версию индекса; пересчитываем память и сохраняем журнал изменений. Страница показывает дату фактической проверки, а через 14 дней напоминает, что снимок требует пересмотра. Автоматического изменения рекомендаций без проверки источников нет.