DataEyesAI
Official SiteConsoleDocs HomeGetting StartedDeveloper ToolsAI Models API
Official SiteConsoleDocs HomeGetting StartedDeveloper ToolsAI Models API
  1. Audio API
  • OpenAI format (supports major original models)
    • Chat (Response)
      • Create Network Search
      • Create Model Response GPT-5 Enable Thinking
      • Create Function Call
      • Create Model Response
      • Create Model Response (Streaming Return)
      • Create Model Response (Control Thinking Length)
    • ChatGPT Interface
      • Audio
        • Audio to text gpt-4o-transcribe
        • GPT-4o-audio
        • Audio to text whisper-1
        • Audio to text gpt-4o-transcribe
        • Create voice gpt-4o-mini-tts
      • Chat
        • Create chat-based image recognition (non-streaming)
        • Create chat-based image recognition (streaming)
        • Create chat-based image recognition (streaming) best64
        • Official N test
        • Create structured output
        • Control the effort level of the inference model
        • Create chat function call
        • deepseek-ocr recognition
        • Create chat completion (non-stream)
      • Completions
        • ChatGPT automatic completion
        • Create completion
    • Image
      • Edit image
      • Create chat completion (streaming)
      • Create chat completion (qwen-mt-turbo)
      • Create chat completion with deepseek v3.1 level of reasoning (streaming)
    • Audio
      • Speech recognition
      • Speech synthesis
      • Official Function Calling invocation
      • Create chat-generated images (non-streaming)
    • Embedding
      • Text embeddings
  • Anthropic format
    • Chat
    • Chat(prompt cache)
    • Streaming response
    • Chat (deep reasoning)
    • Tool invocation (function call)
    • Analyze image
  • Google Gemini interface
    • Native format
      • Text-to-image + control over aspect ratio + clarity
      • Generate image
      • Text generation
      • Text generation - stream
      • Text generation + reasoning - stream
      • Image generation
      • Formatted output
      • Function call
      • Document understanding
      • URL context [native format]
      • Code execution
      • Video understanding
      • URL context
      • Video understanding - url [native format]
      • Imagen 4
      • Audio understanding
      • Embeddings
      • Chat
      • Edit image
    • Image-to-image Base64 request method
      • Multi-image fusion slice generation with gemini-3-pro-image-preview, controlling aspect ratio and clarity
      • Image editing
      • Single image gemini-3-pro-image-preview, controlling aspect ratio and clarity.
      • Image generation( gemini-2.5-flash-image)
      • Image generation gemini-2.5-flash-image, controlling aspect ratio.
      • Image understanding
    • Image-to-image URL request returns URL request format OpenAI
      • Single image generation with gemini-3-pro-image-preview, controlling aspect ratio and clarity.
      • Multi-image fusion slice generation with gemini-3-pro-image-preview, controlling aspect ratio and clarity.
      • Image understanding
  • NanoBanana
    • OpenAI request
      • Edit image
      • OpenAI image format
    • Gemini request
      • Generate image
      • Edit image
  • Midjourney format
    • Midjourney API Reference
    • Task query interface
    • Upload image
    • Get seed (Seed)
    • Submit Imagine task
    • Query tasks based on ID list
    • FaceSwap
    • Execute Action operation
    • /mj/submit/blend
    • Submit Describe task
    • Submit Modal
    • Refresh link
    • Edit image
    • Query task status by task ID
    • Get the seed of the task image
  • Doubao - Painting
    • doubao-seededit-3-0-i2i-250628
    • doubao-seedream-4-0-250828 - text-to-image
    • doubao-seedream-4-0-250828 - image-to-image
    • doubao-seedream-4-0-250828 - multi-image generation
  • Rerank Reordering Model
    • Rerank
  • Video Model
    • Grok Video Generation
      • 00-Overview
      • 01-Text-to-Video
      • 02-Image-to-Video
      • 03-Reference-to-Video
      • 04-Video-Editing
      • 05-Video-Extension
    • Seedance Video Generation
      • 00-Overview
      • 01-Create-Video-Generation-Task
      • 02-Query-Video-Generation-Task
      • 03-Query-Video-Generation-Task-List
      • 04-Cancel-or-Delete-Task
      • Seedance Private Asset Library API Documentation
    • MiniMax-H3 Video Generation
      • 00-Overview
      • 01-Create-Video-Generation
      • 02-Create-Video-Regeneration
      • 03-Create-H3-Context-IR
      • 04-Query-Task
      • 05-List-Tasks
      • 06-Cancel-or-Delete-Task
    • Hailuo Video Generation
      • 00-Overview
      • 01-Text-to-Video-T2V
      • 02-Image-to-Video-I2V
      • 03-First-Last-Frame-FL2V
      • 04-Subject-Reference-S2V
      • 05-Query-Task-Status
      • 06-Video-Download
      • 99-Appendix-Camera-Movement-and-Webhooks
    • Jimeng Video Generation
      • 00-Overview
      • 01-3.0-Pro-Video-Generation
      • 02-720P-Text-to-Video
      • 03-720P-Image-to-Video-First-Frame
      • 04-720P-Image-to-Video-Start-End-Frame
      • 05-720P-Image-to-Video-Camera
      • 06-1080P-Text-to-Video
      • 07-1080P-Image-to-Video-First-Frame
      • 08-1080P-Image-to-Video-Start-End-Frame
      • 09-Error-Codes
    • Kling AI Video Generation
      • 00-Overview
      • 01-Text-to-Video
      • 02-Image-to-Video
      • 03-Omni-Video
      • 04-Multi-Image-to-Video
      • 05-Motion-Control
      • 06-Multi-Elements
      • 07-Video-Extension
      • 08-Lip-Sync
      • 09-Avatar
      • 10-Text-to-Audio
      • 11-Video-to-Audio
      • 12-TTS
      • 13-Custom-Voices
      • 14-Image-Recognition
      • 15-Element-Management
      • 16-Video-Effects
    • Vidu Video Generation
      • 00-Overview
      • 01-Text-to-Video
      • 02-Image-to-Video
      • 03-Reference-to-Video
      • 04-Start-End-Frame
      • 05-Multi-Frame
      • 06-Scene-Template
      • 07-Template-Story
      • 08-Query-Tasks
    • HappyHorse
      • HappyHorse Text-to-Video
      • HappyHorse Image-to-Video (First Frame)
      • HappyHorse Reference-to-Video
      • HappyHorse Video Editing
    • Wan Video Generation
      • 00-Overview.md
      • 01-Text-to-Video
      • 02-Image-to-Video
      • 03-Reference-to-Video
      • 04-Video-Editing
      • 05-First-Last-Frame-to-Video
      • 06-Motion-Transfer-and-Character-Swap
      • 07-Digital-Human-Video
      • 08-VACE-Video-Editing
      • 09-Query-Task
  • Audio API
    • Audio API
    • Gemini TTS API
    • Google DeepMind Lyria API
    • Elevenlabs Speech to Text API Reference
    • Text-to-Music Suno
      • Task Submission
        • Generate Song (Inspiration Mode)
        • Generate Song (Custom Mode)
        • Generate Song (Continuation Mode)
        • Generate Song (Singer Style)
        • Generate Song (Secondary Creation from Uploaded Song)
        • Generate Song (Song Stitching)
        • Generate Lyrics
        • Song Stitching
      • Query Interface
        • Batch Retrieve Tasks
        • Query Single Task
  1. Audio API

Audio API

Audio API Reference#

Base URL: https://platform.dataeyes.ai
Authentication: Authorization: Bearer <your-api-key>
Document Version: 2026-04

Table of Contents#

1. Overview
2. TTS — Text-to-Speech
3. STT — Speech-to-Text (Transcription)
4. Audio Translation (Translate to English)
5. Chat Completions with Audio Input/Output
6. Realtime — Live Voice Conversation (WebSocket)
7. Provider Details
8. Complete Model List
9. Error Handling
Appendix: Endpoint Quick Reference

1. Overview#

This platform provides a full suite of audio API capabilities covering the following scenarios:
ScenarioEndpointDescription
Text-to-Speech (TTS)/v1/audio/speechSynthesize text into an audio file
Speech-to-Text (STT)/v1/audio/transcriptionsTranscribe an audio file to text
Audio Translation/v1/audio/translationsTranslate audio to English text
Audio in Chat/v1/chat/completionsAudio input/output within multimodal conversations
Realtime Voice Chat/v1/realtimeBidirectional real-time voice streaming over WebSocket

Supported Providers#

ProviderTTSSTTRealtimeNotes
OpenAIYesYesYesFull support including streaming
VolcEngine (ByteDance)YesNoNoSupports WebSocket streaming TTS; maps to Chinese voice presets
MiniMaxYesNoNoSupports emotion, speed, and volume control
CloudflareNoYesNoTranscription and translation only

2. TTS — Text-to-Speech#

Synthesize text into an audio file.

2.1 Endpoint#

POST /v1/audio/speech

2.2 Request Body (JSON)#

FieldTypeRequiredDescription
modelstringYesTTS model name
inputstringYesThe text to synthesize
voicestringYesVoice ID
instructionsstringNoVoice style instructions (supported by gpt-4o-mini-tts)
response_formatstringNoOutput audio format; default mp3
speedfloatNoSpeed multiplier, range 0.25–4.0; default 1.0
stream_formatstringNoSet to "sse" to enable streaming output
metadataobjectNoProvider-specific parameters

2.3 Available Voices#

OpenAI Standard Voices:
Voice IDStyle Description
alloyNeutral, balanced
echoMale, steady
fableFemale, gentle
onyxMale, deep
novaFemale, lively
shimmerFemale, soft
VolcEngine automatically maps the above voice IDs to corresponding Chinese voice presets:
alloy → Male conversational voice
echo → Male composed voice
fable → Female sweet voice
onyx → Male intellectual voice
nova → Female energetic voice
shimmer → Female bright voice

2.4 Supported Audio Formats#

FormatContent-TypeNotes
mp3audio/mpegDefault format; best compatibility
wavaudio/wavLossless; larger file size
aacaudio/aacCommon on iOS platforms
flacaudio/flacLossless compression
opusaudio/opusHigh quality at low bitrate
pcmaudio/pcmRaw PCM data (24kHz, 16-bit, mono)

2.5 Request Examples#

Basic TTS:
HD TTS:
GPT-4o-mini-TTS (with style instructions):
Streaming TTS (SSE):

2.6 Response#

Non-streaming: Returns raw audio binary data directly. The Content-Type header matches the corresponding audio MIME type.
Streaming: Returns audio data in chunked SSE format.

2.7 TTS Model List#

ModelDescriptionProvider
tts-1Standard TTSOpenAI
tts-1-hdHD TTSOpenAI
tts-1-1106TTS version 1106OpenAI
tts-1-hd-1106HD TTS version 1106OpenAI
gpt-4o-mini-ttsGPT-4o Mini TTS (supports style instructions)OpenAI
gpt-4o-mini-tts-2025-03-20GPT-4o Mini TTS specific versionOpenAI
gpt-4o-mini-tts-2025-12-15GPT-4o Mini TTS specific versionOpenAI
speech-2.5-hd-previewMiniMax 2.5 HD PreviewMiniMax
speech-2.5-turbo-previewMiniMax 2.5 Turbo PreviewMiniMax
speech-02-hdMiniMax HDMiniMax
speech-02-turboMiniMax TurboMiniMax
speech-01-hdMiniMax HD v1MiniMax
speech-01-turboMiniMax Turbo v1MiniMax

3. STT — Speech-to-Text (Transcription)#

Transcribe an audio file to text.

3.1 Endpoint#

POST /v1/audio/transcriptions

3.2 Request Format#

Content-Type: multipart/form-data
FieldTypeRequiredDescription
filefileYesAudio file
modelstringYesSTT model name
languagestringNoLanguage code, e.g. zh, en, ja
promptstringNoContext hint to help the model better understand the content
response_formatstringNoResponse format; default json
temperaturefloatNoTemperature parameter, range 0–1

3.3 Supported Audio File Formats#

mp3, mp4, mpeg, mpga, m4a, wav, webm, ogg, flac

3.4 response_format Options#

Formatwhisper-1gpt-4o-transcribe seriesDescription
jsonYesYesSimple JSON containing a text field (default)
textYesYesPlain text
srtYesNoSRT subtitle format
verbose_jsonYesNoVerbose JSON with timestamps and segment information
vttYesNoWebVTT subtitle format
Note: The gpt-4o-transcribe and gpt-4o-mini-transcribe model series only support the json and text response formats. Using verbose_json, srt, or vtt with these models will return an unsupported_value error. For subtitle or timestamp functionality, use the whisper-1 model.

3.5 Request Examples#

Basic Transcription (Whisper):
GPT-4o-transcribe (High-Accuracy Transcription):
Speaker Diarization Transcription:
Generate Subtitle File:

3.6 Response Body#

json format (whisper-1):
{
  "text": "Hello, welcome to our platform."
}
json format (gpt-4o-transcribe series):
{
  "text": "Hello, welcome to our platform.",
  "usage": {
    "type": "tokens",
    "total_tokens": 34,
    "input_tokens": 30,
    "input_token_details": {
      "text_tokens": 0,
      "audio_tokens": 30
    },
    "output_tokens": 4
  }
}
The gpt-4o-transcribe series additionally returns a usage field with a detailed token consumption breakdown. Audio token consumption is approximately 1,000 audio tokens per minute.
verbose_json format (whisper-1 only):
{
  "task": "transcribe",
  "language": "chinese",
  "duration": 5.32,
  "text": "Hello, welcome to our platform.",
  "segments": [
    {
      "id": 0,
      "seek": 0,
      "start": 0.0,
      "end": 2.5,
      "text": "Hello,",
      "tokens": [1, 2, 3],
      "temperature": 0.0,
      "avg_logprob": -0.25,
      "compression_ratio": 0.8,
      "no_speech_prob": 0.01
    },
    {
      "id": 1,
      "seek": 250,
      "start": 2.5,
      "end": 5.32,
      "text": "welcome to our platform.",
      "tokens": [4, 5, 6, 7, 8],
      "temperature": 0.0,
      "avg_logprob": -0.18,
      "compression_ratio": 0.9,
      "no_speech_prob": 0.02
    }
  ]
}
srt format:
1
00:00:00,000 --> 00:00:02,500
Hello,

2
00:00:02,500 --> 00:00:05,320
welcome to our platform.

3.7 STT Model List#

ModelDescriptionSupported response_formatNotes
whisper-1Whisper standard modeljson, text, srt, verbose_json, vttGeneral-purpose, stable; supports subtitle output
gpt-4o-transcribeGPT-4o transcriptionjson, textHigh accuracy with better contextual understanding
gpt-4o-transcribe-diarizeGPT-4o transcription with speaker diarizationjson, textAutomatically identifies different speakers
gpt-4o-mini-transcribeGPT-4o Mini transcriptionjson, textCost-effective
gpt-4o-mini-transcribe-2025-03-20GPT-4o Mini transcription specific versionjson, textSpecific dated version
gpt-4o-mini-transcribe-2025-12-15GPT-4o Mini transcription specific versionjson, textSpecific dated version

4. Audio Translation (Translate to English)#

Translate audio in any language to English text.

4.1 Endpoint#

POST /v1/audio/translations

4.2 Request Format#

Content-Type: multipart/form-data
FieldTypeRequiredDescription
filefileYesAudio file
modelstringYesModel name (default whisper-1)
promptstringNoContext hint
response_formatstringNoResponse format; default json
temperaturefloatNoTemperature parameter

4.3 Request Example#

4.4 Response Body#

{
  "text": "Hello, welcome to our platform."
}

5. Chat Completions with Audio Input/Output#

Use audio capabilities within the standard Chat Completions interface.

5.1 Endpoint#

POST /v1/chat/completions

5.2 Audio Input (Embed Audio in a Message)#

5.3 Audio Output#

To enable audio output, set the modalities and audio parameters:

5.4 Audio Chat Models#

ModelDescription
gpt-4o-audio-previewGPT-4o audio preview
gpt-4o-audio-preview-2024-12-17Specific version
gpt-4o-mini-audio-previewGPT-4o Mini audio preview
gpt-audioGPT audio general availability
gpt-audio-miniGPT audio Mini

5.5 Audio Tokens in Usage#

Audio chat returns a detailed token breakdown in usage:
{
  "usage": {
    "prompt_tokens": 100,
    "completion_tokens": 200,
    "total_tokens": 300,
    "prompt_tokens_details": {
      "cached_tokens": 0,
      "text_tokens": 50,
      "audio_tokens": 50,
      "image_tokens": 0
    },
    "completion_tokens_details": {
      "text_tokens": 100,
      "audio_tokens": 100,
      "reasoning_tokens": 0
    }
  }
}

6. Realtime — Live Voice Conversation (WebSocket)#

Supports bidirectional real-time voice streaming. Suitable for voice assistants, live translation, and similar scenarios.

6.1 Endpoint#

GET /v1/realtime (WebSocket Upgrade)

6.2 Connection#

wss://cloud.dataeyes.ai/v1/realtime?model=gpt-4o-realtime-preview
WebSocket Headers:
Authorization: Bearer <your-api-key>
Sec-WebSocket-Protocol: realtime

6.3 Session Initialization#

After connecting, send a session.update event to configure the session:
{
  "event_id": "evt_001",
  "type": "session.update",
  "session": {
    "modalities": ["text", "audio"],
    "instructions": "You are a friendly Chinese-English translation assistant. Translate Chinese to English and English to Chinese.",
    "voice": "alloy",
    "input_audio_format": "pcm16",
    "output_audio_format": "pcm16",
    "input_audio_transcription": {
      "model": "whisper-1"
    },
    "turn_detection": {
      "type": "server_vad",
      "threshold": 0.5,
      "prefix_padding_ms": 300,
      "silence_duration_ms": 500
    },
    "temperature": 0.8,
    "tools": [],
    "tool_choice": "auto"
  }
}

6.4 Audio Formats#

FormatParameter ValueDescription
PCM 16-bitpcm16Raw PCM (24kHz, 16-bit, mono)
G.711 u-lawg711_ulawTelephony audio format
G.711 A-lawg711_alawTelephony audio format

6.5 Sending Audio Data#

Send audio data Base64-encoded:
{
  "type": "input_audio_buffer.append",
  "audio": "<base64-encoded PCM audio data>"
}

6.6 Triggering a Response#

{
  "type": "response.create",
  "response": {
    "modalities": ["text", "audio"]
  }
}

6.7 Receiving Response Events#

Session Created:
{
  "type": "session.created",
  "session": {
    "modalities": ["text", "audio"],
    "voice": "alloy",
    ...
  }
}
Audio Data Delta:
{
  "type": "response.audio.delta",
  "delta": "<base64-encoded audio chunk>"
}
Audio Transcript Delta:
{
  "type": "response.audio_transcript.delta",
  "delta": "Hello"
}
Response Done (with Usage):
{
  "type": "response.done",
  "response": {
    "usage": {
      "total_tokens": 500,
      "input_tokens": 200,
      "output_tokens": 300,
      "input_token_details": {
        "cached_tokens": 0,
        "text_tokens": 50,
        "audio_tokens": 150
      },
      "output_token_details": {
        "text_tokens": 100,
        "audio_tokens": 200
      }
    }
  }
}
Error Event:
{
  "type": "error",
  "error": {
    "type": "invalid_request_error",
    "message": "Audio format not supported"
  }
}

6.8 Full Event Interaction Flow#

Client                                      Server
  │                                           │
  │ ──── WebSocket Connect ───────────────→   │
  │ ←──── session.created ────────────────   │
  │                                           │
  │ ──── session.update ──────────────────→   │
  │ ←──── session.updated ────────────────   │
  │                                           │
  │ ──── input_audio_buffer.append ───────→   │
  │ ──── input_audio_buffer.append ───────→   │
  │ ──── input_audio_buffer.append ───────→   │
  │                                           │
  │ ──── response.create ─────────────────→   │
  │ ←──── response.audio.delta ───────────   │
  │ ←──── response.audio.delta ───────────   │
  │ ←──── response.audio_transcript.delta    │
  │ ←──── response.done ─────────────────   │
  │                                           │

6.9 Realtime Model List#

ModelDescription
gpt-4o-realtime-previewGPT-4o realtime preview
gpt-4o-realtime-preview-2024-10-01Specific version
gpt-4o-realtime-preview-2024-12-17Specific version
gpt-4o-realtime-preview-2025-06-03Specific version
gpt-4o-mini-realtime-previewGPT-4o Mini realtime preview
gpt-4o-mini-realtime-preview-2024-12-17Specific version
gpt-realtimeGPT realtime general availability
gpt-realtime-2025-08-28Specific version
gpt-realtime-miniGPT realtime Mini
gpt-realtime-mini-2025-10-06Specific version
gpt-realtime-mini-2025-12-15Specific version

7. Provider Details#

7.1 OpenAI#

Full support for TTS + STT + Realtime.
TTS supports 6 standard voices plus gpt-4o-mini-tts with style instructions
STT supports whisper-1 and the gpt-4o-transcribe series
Realtime supports PCM16 and G.711 audio formats
Audio token calculation: approximately 1,000 tokens per minute of audio

7.2 VolcEngine (ByteDance)#

Supports TTS only.
Voice Mapping (OpenAI voice IDs to VolcEngine Chinese voice presets):
OpenAI VoiceVolcEngine Voice IDStyle
alloyzh_male_M392_conversation_wvae_bigttsMale conversational
echozh_male_wenhao_mars_bigttsMale composed
fablezh_female_tianmei_mars_bigttsFemale sweet
onyxzh_male_zhibei_mars_bigttsMale intellectual
novazh_female_shuangkuaisisi_mars_bigttsFemale energetic
shimmerzh_female_cancan_mars_bigttsFemale bright
Audio Format Mapping:
Requested FormatVolcEngine Encoding
mp3mp3
opusogg_opus
aac / flacmp3 (fallback)
wavwav
pcmpcm
Authentication Format: The API Key uses appid|access_token format.
Request Example (TTS via VolcEngine channel):
Note: The actual available model names depend on the channel configuration in the platform.

7.3 MiniMax#

Supports TTS only.
Distinctive Features:
Emotion control (emotion)
Fine-grained control over speed, volume, and pitch
Voice timbre weight blending
Language enhancement (language_boost)
Subtitle generation
MiniMax TTS Request Parameters (via metadata):
ParameterTypeDescription
voice_setting.speedfloatSpeech speed
voice_setting.volfloatVolume
voice_setting.pitchfloatPitch
voice_setting.emotionstringEmotion
language_booststringLanguage enhancement
subtitle_enableboolEnable subtitle generation
output_formatstringOutput format
MiniMax TTS Models:
ModelDescription
speech-2.5-hd-preview2.5 HD Preview
speech-2.5-turbo-preview2.5 Turbo Preview
speech-02-hdHD version
speech-02-turboTurbo version
speech-01-hdv1 HD version
speech-01-turbov1 Turbo version

7.4 Cloudflare#

Supports STT only (transcription and translation).
Simple file-upload relay mode, supports the whisper-1 model.

8. Complete Model List#

8.1 TTS Models#

ModelProviderDescription
tts-1OpenAIStandard TTS
tts-1-hdOpenAIHD TTS
tts-1-1106OpenAITTS version 1106
tts-1-hd-1106OpenAIHD version 1106
gpt-4o-mini-ttsOpenAIGPT-4o Mini TTS (supports style instructions)
gpt-4o-mini-tts-2025-03-20OpenAISpecific version
gpt-4o-mini-tts-2025-12-15OpenAISpecific version
speech-2.5-hd-previewMiniMaxMiniMax 2.5 HD
speech-2.5-turbo-previewMiniMaxMiniMax 2.5 Turbo
speech-02-hdMiniMaxMiniMax HD
speech-02-turboMiniMaxMiniMax Turbo
speech-01-hdMiniMaxMiniMax v1 HD
speech-01-turboMiniMaxMiniMax v1 Turbo

8.2 STT Models (Transcription / Translation)#

ModelProviderDescription
whisper-1OpenAIWhisper standard; general-purpose transcription
gpt-4o-transcribeOpenAIGPT-4o high-accuracy transcription
gpt-4o-transcribe-diarizeOpenAIGPT-4o transcription with speaker diarization
gpt-4o-mini-transcribeOpenAIGPT-4o Mini transcription
gpt-4o-mini-transcribe-2025-03-20OpenAISpecific version
gpt-4o-mini-transcribe-2025-12-15OpenAISpecific version

8.3 Audio Preview Models (Audio Input/Output in Chat)#

ModelProviderDescription
gpt-4o-audio-previewOpenAIAudio chat preview
gpt-4o-audio-preview-2024-10-01OpenAISpecific version
gpt-4o-audio-preview-2024-12-17OpenAISpecific version
gpt-4o-audio-preview-2025-06-03OpenAISpecific version
gpt-4o-mini-audio-previewOpenAIMini audio chat preview
gpt-4o-mini-audio-preview-2024-12-17OpenAISpecific version
gpt-audioOpenAIAudio chat general availability
gpt-audio-2025-08-28OpenAISpecific version
gpt-audio-miniOpenAIMini audio chat
gpt-audio-mini-2025-10-06OpenAISpecific version
gpt-audio-mini-2025-12-15OpenAISpecific version

8.4 Realtime Models (Live Voice Streaming)#

ModelProviderDescription
gpt-4o-realtime-previewOpenAIGPT-4o realtime preview
gpt-4o-realtime-preview-2024-10-01OpenAISpecific version
gpt-4o-realtime-preview-2024-12-17OpenAISpecific version
gpt-4o-realtime-preview-2025-06-03OpenAISpecific version
gpt-4o-mini-realtime-previewOpenAIMini realtime preview
gpt-4o-mini-realtime-preview-2024-12-17OpenAISpecific version
gpt-realtimeOpenAIRealtime general availability
gpt-realtime-2025-08-28OpenAISpecific version
gpt-realtime-miniOpenAIRealtime Mini
gpt-realtime-mini-2025-10-06OpenAISpecific version
gpt-realtime-mini-2025-12-15OpenAISpecific version

9. Error Handling#

9.1 Error Response Format#

{
  "error": {
    "message": "Invalid audio format. Supported formats: mp3, mp4, mpeg, mpga, m4a, wav, webm, ogg, flac",
    "type": "invalid_request_error",
    "code": "invalid_audio_format"
  }
}

9.2 Common Errors#

HTTP StatusScenarioDescription
400Invalid parametersMissing required fields (e.g. file, model) or unsupported format
400File too largeAudio file exceeds size limit (generally 25 MB)
401Authentication failureInvalid API Key
403Insufficient permissionsNo access to the specified model
413Request too largeRequest body exceeds limit
429Rate limitToo many requests in a short period
500Server errorUpstream provider error

9.3 TTS-Specific Errors#

model is missing or unsupported → 400
input is empty → 400
voice is invalid → 400
Text exceeds the model's length limit → 400

9.4 STT-Specific Errors#

file field is missing → 400
Audio file format is unsupported → 400
Audio file is corrupted or cannot be decoded → 400
language code is invalid → 400

Appendix: Endpoint Quick Reference#

MethodPathContent-TypeDescription
POST/v1/audio/speechapplication/jsonTTS — Text-to-Speech
POST/v1/audio/transcriptionsmultipart/form-dataSTT — Speech-to-Text
POST/v1/audio/translationsmultipart/form-dataAudio translation (to English)
POST/v1/chat/completionsapplication/jsonAudio input/output in chat
GET/v1/realtimeWebSocket UpgradeLive voice conversation

Quick Selection Guide#

Use CaseRecommended ModelEndpoint
Simple text-to-speechtts-1/v1/audio/speech
High-definition text-to-speechtts-1-hd/v1/audio/speech
TTS with emotion or stylegpt-4o-mini-tts/v1/audio/speech
General-purpose transcriptionwhisper-1/v1/audio/transcriptions
High-accuracy transcriptiongpt-4o-transcribe/v1/audio/transcriptions
Meeting transcription (multi-speaker)gpt-4o-transcribe-diarize/v1/audio/transcriptions
Cost-effective transcriptiongpt-4o-mini-transcribe/v1/audio/transcriptions
Translate speech to Englishwhisper-1/v1/audio/translations
Understand audio in conversationgpt-4o-audio-preview/v1/chat/completions
Real-time voice assistantgpt-4o-realtime-preview/v1/realtime
Previous
09-Query-Task
Next
Gemini TTS API