Перейти к содержимому
EN

MiniMax Speech 2.8

MiniMax Speech 2.8 (minimax/speech-2.8-hd и minimax/speech-2.8-turbo) — синтез речи, в том числе на русском. Отличается от TTS с закрытым набором голосов: voice принимает произвольный идентификатор голоса MiniMax, поэтому в каталоге у этих моделей список голосов пустой — это подсказка «подставьте свой», а не отсутствие выбора.

Версия Ключ Когда брать
HD minimax/speech-2.8-hd Озвучка, где слышно качество: ролики, аудиокниги
Turbo minimax/speech-2.8-turbo Массовая озвучка и интерактив, где важнее скорость и цена

POST /v1/audio/speech:

Поле Описание
input Текст, обязательное
model Ключ модели
voice Идентификатор голоса MiniMax
speed Скорость речи

Ответ приходит в mp3. Тариф — за символы входа, поэтому цена озвучки считается по длине текста ещё до запроса.

from openai import OpenAI
client = OpenAI(base_url="https://api.mixen.ai/v1", api_key=MIXEN_API_KEY)
speech = client.audio.speech.create(
model="minimax/speech-2.8-hd",
input="Здравствуйте! Это пример синтеза речи.",
voice="female-shaonv",
)
speech.write_to_file("hello.mp3")
  • Голоса у разных моделей разные. У grok-voice-tts-1.0, Gemini TTS и Qwen наборы закрытые, и они перечислены в поле voices каталога; неверный голос там вернёт 400. У MiniMax набор открытый — сверяйтесь с документацией провайдера.
  • Считайте цену по входу, а не по длительности. Длинный текст с паузами и коротким звучанием стоит столько же, сколько плотный: тариф смотрит на символы.

Полный список синтеза с ценами — в каталоге, общий гайд по эндпоинту — Речь и эмбеддинги.