Перейти к содержимому
EN

GLM 5.3

GLM 5.3 (z-ai/glm-5.3) — крупная рассуждающая модель Z.ai для сложной разработки ПО и долгих агентных задач. Лучше GLM-5.2 в коде и в балансе качества и расхода токенов: мышление всегда включено (Low/High/Max), контекст 1 млн токенов. Работает только с текстом.

Параметр Значение
model z-ai/glm-5.3 (или короткое glm-5.3)
Контекст 1 млн токенов
Рассуждение всегда включено — отключить нельзя
reasoning_effort low, high, max
Изображения на вход нет — image_url-часть вернёт 400
Файлы на вход нет — file-часть вернёт 400
Чтение кэша 29 ₽ за 1 млн токенов
Запись кэша каталог не публикует

Рассуждение у GLM 5.3 врождённое: reasoning_effort выбирает глубину (low/high/max), а значения off и medium модель не поддерживает — они не дойдут до апстрима. Если параметр не передан вовсе, сработает глубина по умолчанию из карточки модели — у GLM 5.3 она максимальная.

from openai import OpenAI
client = OpenAI(
base_url="https://api.mixen.ai/v1",
api_key="mxn-...",
)
resp = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{
"role": "user",
"content": "Вот сервисный класс: <код>. Найди гонки и утечки ресурсов, предложи исправления",
}],
)
print(resp.choices[0].message.content)

low экономит токены на простых правках, max включает максимальную глубину для архитектурных задач:

curl https://api.mixen.ai/v1/chat/completions \
-H "Authorization: Bearer $MIXEN_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"reasoning_effort": "low",
"messages": [{"role": "user", "content": "Напиши SQL-миграцию: добавить таблицу аудита с партиционированием по месяцам"}]
}'

Кэш контекста в /v1/chat/completions срабатывает автоматически на повторяющемся префиксе — управляющих параметров нет. Для агентной сессии это значит: системный промпт и описания инструментов держите стабильными от запроса к запросу.

За 1 млн токенов: вход 156 ₽ ($1.75), выход 490.2 ₽ ($5.5), чтение кэша 29 ₽ ($0.325); отдельная цена записи кэша каталогом не публикуется. Актуальные цены — каталог.

  • Профиль модели — сложная разработка ПО и долгие агентные задачи; в коде и балансе качества/расхода токенов она лучше GLM-5.2.
  • Контекст 1 млн токенов — влезают целые репозитории и длинные истории сессий.
  • Глубина рассуждения регулируется: low, high, max.
  • Рассуждение не отключается: токены размышления входят в расход всегда — закладывайте их в бюджет.
  • Рассуждение съедает max_tokens: под длинный ответ ставьте потолок с запасом, иначе получите finish_reason: "length".
  • Только текст: картинки и файлы на вход не принимаются — запрос с ними вернёт 400.

Все модели — в каталоге. Общий порядок работы с текстовыми моделями — гайд по чату.