Z.ai представила и открыла веса GLM-5.3-Flash — первой нативно мультимодальной модели в линейке GLM-5. У неё 320 млрд параметров, а до релиза модель анонимно тестировали под названием Ox Alpha в OpenRouter и OpenCode. UPD: выпустили гайд по GLM-5.3-Flash.
Компания позиционирует её как более дешёвую модель для кодинга и агентских задач: по опубликованным результатам она превосходит GLM-5.2 и в отдельных тестах приближается к Claude Opus 4.8.
GLM-5.3-Flash уже доступна через API, ZCode и GLM Coding Plan. Z.ai также открыла модель для самостоятельного запуска. Детали в материале Postium.
Читайте также: 5 лучших нейросетей для работы
Что умеет нейросеть GLM-5.3-Flash
GLM-5.3-Flash построена как MoE-модель: из 320 млрд параметров при обработке токена активируются 18 млрд. Для сравнения, у GLM-4.5 было 355 млрд параметров и 32 млрд активных. Z.ai также сократила число слоёв с 92 до 45 и совместила разреженное и линейное внимание, чтобы уменьшить вычислительные затраты при работе с длинным контекстом.
Модель изначально работает с несколькими типами данных. В задачах разработки она может анализировать интерфейс и результат выполнения кода, находить проблемы в получившемся интерфейсе, а затем продолжать работу с учётом увиденного. Z.ai называет среди примеров фронтенд-разработку, работу с браузером, Blender и управление приложениями через агента. Контекст модели достигает 1 млн токенов.
По данным Z.ai, GLM-5.3-Flash превосходит GLM-5.2 в опубликованных тестах при меньших затратах на инференс. В Artificial Analysis Intelligence Index модель набрала 57 баллов — столько же, сколько Claude Opus 4.8. Во внутреннем Z.ai Code Bench максимальный результат GLM-5.3-Flash составил 29,0 против 29,5 у Opus 4.8. Эти цифры стоит учитывать как результаты конкретных тестов, а не как универсальное преимущество одной модели во всех задачах.
Сколько стоит
Z.ai заявляет, что GLM-5.3-Flash стоит примерно в десять раз дешевле GLM-5.2. API модели стоит $0,15 за 1 млн входных токенов и $0,50 за 1 млн выходных токенов; кэшированный ввод — $0,03 за 1 млн токенов.

В материалах к запуску компания также сравнивает тариф с GLM-5.3: стандартная цена Flash-версии составляет около одной десятой от стоимости GLM-5.3, а в рамках временной скидки — около одной двадцатой.
Как пользоваться
Самый простой вариант — открыть чат-бот Z.ai, выбрать GLM-5.3-Flash в списке моделей и вводить запросы как обычно.

Z.ai также опубликовала веса GLM-5.3-Flash для самостоятельного запуска. Скачать модель можно на странице в Hugging Face. Модель распространяется по лицензии MIT; для локального запуска Z.ai указывает поддержку SGLang, vLLM, TokenSpeed и KTransformers.
Почему это важно? GLM-5.3-Flash показывает возможности MoE-моделей с небольшим числом активных параметров: при 320 млрд общих и 18 млрд активных параметров Z.ai получила результаты, которые в части кодинговых и агентских тестов находятся рядом с Claude Opus 4.8.
Z.ai также подтвердила, что именно GLM-5.3-Flash несколько дней работала под названием Ox Alpha. До раскрытия OpenRouter описывал её только как модель неизвестного стороннего разработчика для кодинга и продолжительной агентской работы.