Перейти к содержимому
EN

GLM 5.3 Flash

GLM 5.3 Flash (z-ai/glm-5.3-flash) — быстрая мультимодальная модель Z.ai: эффективный кодинг и долгие агентные задачи. Гибридная разреженно-линейная архитектура внимания держит точность на длинном контексте (1 млн токенов) с меньшими затратами. Понимает текст, изображения и видео.

При цене входа 8.4 ₽ за 1 млн токенов это одна из самых дешёвых платных текстовых моделей каталога — рабочая лошадка для субагентов и массовых прогонов, где счёт идёт на тысячи запросов с одинаковым промптом: повторяющийся префикс читается из кэша за 1.7 ₽.

Параметр Значение
model z-ai/glm-5.3-flash (или короткое glm-5.3-flash)
Контекст 1 млн токенов
Рассуждение управляемое, можно отключить (off)
reasoning_effort low, medium, high
Изображения на вход да — image_url-части с data:-URL
Файлы на вход нет — file-часть вернёт 400
Чтение кэша 1.7 ₽ за 1 млн токенов
Запись кэша каталог не публикует

Ввод видео заявлен в описании модели, но /v1/chat/completions принимает из мультимодальных частей только картинки: первая image_url-часть последнего сообщения пользователя уходит модели, внешние HTTP-ссылки не поддерживаются — только data:image/...;base64,....

from openai import OpenAI
client = OpenAI(
base_url="https://api.mixen.ai/v1",
api_key="mxn-...",
)
resp = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[{
"role": "user",
"content": "Разбери обращение на категории: оплата, техника, другое. Ответ — одной строкой. Текст: ...",
}],
)
print(resp.choices[0].message.content)

Модель видит изображения — передавайте их data:-URL в составе сообщения:

{
"model": "z-ai/glm-5.3-flash",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Что на скриншоте и какая ошибка видна?"},
{"type": "image_url", "image_url": {"url": "data:image/png;base64,iVBORw0KG..."}}
]
}]
}

Для конвейера с одним и тем же системным промптом кэш контекста срабатывает автоматически — стабильный префикс делает такие прогоны ещё дешевле.

За 1 млн токенов: вход 8.4 ₽ ($0.094), выход 27.9 ₽ ($0.312), чтение кэша 1.7 ₽ ($0.019); отдельная цена записи кэша каталогом не публикуется. Актуальные цены — каталог.

  • Эффективный кодинг и долгие агентные задачи при одной из самых низких цен входа в каталоге — массовые прогоны и субагенты не съедают бюджет.
  • Контекст 1 млн токенов без потери точности на длинных входах — так заявляет архитектура модели.
  • Мультимодальный вход: текст и изображения в одном запросе.
  • Рассуждение управляемо: low/medium/high и честный off для простых задач.
  • Файлы на вход не принимаются — file-части вернут 400.
  • Ввод видео — заявленная способность модели, но через /v1 передаются только картинки.

Все модели — в каталоге. Общий порядок работы с текстовыми моделями — гайд по чату.