/v1beta/models/{model}:generateContent — this is not the OpenAI-compatible /v1/audio/speech endpoint.POST https://platform.dataeyes.ai/v1beta/models/gemini-3.1-flash-tts-preview:generateContentAuthorization: Bearer sk-YOUR_API_KEY{
"candidates": [
{
"content": {
"parts": [
{
"inlineData": {
"mimeType": "audio/l16; rate=24000; channels=1",
"data": "AAAAAAAAAA...(Base64-encoded PCM audio data)"
}
}
]
}
}
],
"usageMetadata": {
"promptTokenCount": 15,
"candidatesTokenCount": 200,
"totalTokenCount": 215
}
}| Field | Description |
|---|---|
mimeType | audio/l16; rate=24000; channels=1 — 16-bit PCM, 24kHz sample rate, mono |
data | Base64-encoded raw PCM audio data |
speechConfig.voiceConfig.prebuiltVoiceConfig.voiceName:| Voice Name | Description |
|---|---|
| Kore | Female |
| Charon | Male |
| Fenrir | Male |
| Aoede | Female |
| Puck | Male |
| Leda | Female |
| Type | Paid Tier (per 1M tokens) |
|---|---|
| Input (text) | $1.00 |
| Output (audio) | $20.00 |
/v1/audio/speech endpoint is not supportedresponseModalities must be set to ["AUDIO"]; otherwise, text is returned instead of speechstreamGenerateContent?alt=sse:POST /v1beta/models/gemini-3.1-flash-tts-preview:streamGenerateContent?alt=sse"Hello, welcome to our service. This is a test of text to speech."audio/l16; rate=24000; channels=1