Какие модели принимают аудио на входе?
Ответ
Через VTOP Ai доступны следующие модели с поддержкой аудио на входе (Audio Input) (16 моделей):
openai: GPT Audio, GPT Audio Mini
google: Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash Lite, Gemini 3.5 Flash, Gemini 3.1 Flash Lite, Gemini 3.1 Flash Lite Preview, Gemini 3.1 Pro Preview, Gemini 3.1 Pro Preview Customtools, Gemini 3 Flash Preview, Gemini 2.5 Flash Lite, Gemini 2.5 Flash, Gemini 2.5 Pro
meta: Muse Spark 1.2
xiaomi: MiMo V2.5
Для отправки аудио используйте элемент с типом input_audio в массиве content. Аудио передаётся в формате base64 (mp3, wav, webm). Модели распознают речь, анализируют звуковой контент и отвечают на вопросы по аудиозаписям.
Все модели доступны через единый API ключ VTOP Ai. Список обновляется автоматически — актуальные данные всегда на странице моделей.
Пример отправки аудио через VTOP Ai API
Отправьте аудиофайл в модель с поддержкой аудио:
import base64
from openai import OpenAI
client = OpenAI(
api_key="ваш_ключ_VTOP Ai",
base_url="https://api.daaj.ru/v1/"
)
# Читаем аудиофайл и кодируем в base64
with open("audio.mp3", "rb") as f:
audio_base64 = base64.b64encode(f.read()).decode("utf-8")
response = client.chat.completions.create(
model="gemini-2.5-pro-preview-06-05", # или gemini-2.5-pro, gpt-4o-audio и др.
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Транскрибируй это аудио"},
{
"type": "input_audio",
"input_audio": {
"data": audio_base64,
"format": "mp3"
}
}
]
}
]
)
print(response.choices[0].message.content)Похожие вопросы
- Какие модели OpenAI принимают картинки (Vision)?
- Какие модели Anthropic/Claude поддерживают распознавание картинок?
- Какие модели Google/Gemini поддерживают картинки?
- Какие модели OpenAI поддерживают tool calling?
- Какие модели Anthropic/Claude поддерживают tool calling?
- Какие модели Google/Gemini поддерживают tool calling?
Попробуйте сами через VTOP Ai
Получите API ключ и протестируйте модели. Работает из России без VPN, оплата в рублях.