Nano GPT logo
NanoGPT

Private AI

Explore Audio Models

Browse and discover the best AI audio models for text to speech, speech to text, and music.

ACE-Step

Music

ACE-Step composes complete songs from text descriptions. Guide genre, mood, and structure with style tags and optional custom lyrics. Generates up to 4 minutes of multi-track audio with vocals.

≈ $0.050 per audio

Try ACE-StepDetails

ACE-Step 1.5

Music

ACE-Step 1.5 composes complete songs from text descriptions. Guide genre, mood, and structure with style tags and required custom lyrics. Generates up to 4 minutes of multi-track audio with vocals.

≈ $0.050 per audio

Try ACE-Step 1.5Details

ACE-Step v1.5 Base

Music

ACE-Step v1.5 Base is a Runware-hosted music model built for creator workflows, with stronger fidelity, more reliable stylistic consistency, and prompt-driven genre control for full-song generation.

≈ $0.009 per audio

Try ACE-Step v1.5 BaseDetails

ACE-Step v1.5 Turbo

Music

ACE-Step v1.5 Turbo is the faster, lower-cost Runware variant for full-song generation, with broad genre coverage, improved stylistic consistency, and text-guided music creation for creator workflows.

≈ $0.006 per audio

Try ACE-Step v1.5 TurboDetails
Provider logo

Alibaba Fun-ASR Flash

Speech to Text

Alibaba Cloud DashScope non-realtime speech recognition with multilingual transcription, punctuation, and sentence/word timestamps.

≈ $0.004 per minute

Try Alibaba Fun-ASR FlashDetails
Provider logo

ByteDance Seed Audio 1.0

Music

ByteDance Seed Audio 1.0 generates natural audio from text, with optional preset voices, up to three reference audio clips, or a single reference image.

≈ $300.06 per 1M characters (billed in 300-character blocks)

Try ByteDance Seed Audio 1.0Details
Provider logo

ByteDance Seed Speech TTS 2.0

Text to Speech

ByteDance Seed Speech TTS 2.0 for natural multilingual speech with voice instructions and delivery controls.

≈ $51.00 per 1M characters (billed in 1k-character blocks)

Try ByteDance Seed Speech TTS 2.0Details
Provider logo

Demucs Stem Separation

Music

Separate up to 60 minutes / 700 MiB of stereo audio into vocals, drums, bass, guitar, piano, and other stems with fal Demucs.

≈ $0.023 per audio

Try Demucs Stem SeparationDetails
Provider logo

ElevenLabs Scribe V1

Speech to Text

ElevenLabs Scribe V1 transcription with word-level timestamps and speaker identification

≈ $0.051 per minute

Try ElevenLabs Scribe V1Details
Provider logo

ElevenLabs Scribe V2

Speech to Text

ElevenLabs Scribe V2 transcription with improved accuracy, word-level timestamps, and speaker identification

≈ $0.051 per minute

Try ElevenLabs Scribe V2Details
Provider logo

ElevenLabs Turbo V2.5

Text to Speech

High quality with lowest latency, ideal for real-time applications. Supports 32 languages while maintaining natural voice quality.

≈ $102.00 per 1M characters

Try ElevenLabs Turbo V2.5Details
Provider logo

ElevenLabs v3

Text to Speech

High-quality text-to-speech with enhanced controls and natural voices.

≈ $170.00 per 1M characters

Try ElevenLabs v3Details
Provider logo

Gemini 2.5 Flash Preview TTS

Text to Speech

Google Gemini native TTS. Single and multi-speaker support via prompt.

≈ $51.17 per 1M characters

Try Gemini 2.5 Flash Preview TTSDetails
Provider logo

Gemini 2.5 Pro Preview TTS

Text to Speech

Higher-quality Gemini TTS with controllable style and tone.

≈ $102.17 per 1M characters

Try Gemini 2.5 Pro Preview TTSDetails
Provider logo

Gemini 3.1 Flash TTS Preview

Text to Speech

Google Gemini 3.1 Flash text-to-speech with inline audio tag and multi-speaker prompt support.

≈ $102.42 per 1M characters

Try Gemini 3.1 Flash TTS PreviewDetails
Provider logo

Google Lyria 3 Pro Music

Music

Google Lyria 3 Pro generates premium music clips from a text prompt, with optional image guidance, negative prompts, and seed-based repeatability.

≈ $0.080 per audio

Try Google Lyria 3 Pro MusicDetails
Provider logo

GPT-4o Mini Transcribe

Speech to Text

OpenAI's efficient speech-to-text model with improved accuracy over Whisper

≈ $0.005 per minute

Try GPT-4o Mini TranscribeDetails
Provider logo

GPT-4o Mini Transcribe (2025-03-20)

Speech to Text

Original release snapshot of GPT-4o Mini Transcribe

≈ $0.005 per minute

Try GPT-4o Mini Transcribe (2025-03-20)Details
Browse all 77 audio models

Direct links to every public model in this catalog.

  • ACE-StepWavespeed-ACE-Step
  • ACE-Step 1.5ACE-Step-1.5
  • ACE-Step v1.5 BaseACE-Step-v1.5-Base
  • ACE-Step v1.5 TurboACE-Step-v1.5-Turbo
  • Alibaba Fun-ASR Flashfun-asr-flash-2026-06-15
  • ByteDance Seed Audio 1.0bytedance/seed-audio-1.0
  • ByteDance Seed Speech TTS 2.0bytedance/seed-speech-tts-2.0
  • Demucs Stem Separationfal-ai/demucs
  • ElevenLabs Scribe V1Elevenlabs-STT
  • ElevenLabs Scribe V2Elevenlabs-Scribe-V2
  • ElevenLabs Turbo V2.5Elevenlabs-Turbo-V2.5
  • ElevenLabs v3Elevenlabs-V3
  • Gemini 2.5 Flash Preview TTSgemini-2.5-flash-preview-tts
  • Gemini 2.5 Pro Preview TTSgemini-2.5-pro-preview-tts
  • Gemini 3.1 Flash TTS Previewgemini-3.1-flash-tts-preview
  • Google Lyria 3 Pro Musicgoogle/lyria-3-pro/music
  • GPT-4o Mini Transcribegpt-4o-mini-transcribe
  • GPT-4o Mini Transcribe (2025-03-20)gpt-4o-mini-transcribe-2025-03-20
  • GPT-4o Mini Transcribe (2025-12-15)gpt-4o-mini-transcribe-2025-12-15
  • GPT-4o Mini TTSgpt-4o-mini-tts
  • GPT-4o Mini TTS (2025-03-20)gpt-4o-mini-tts-2025-03-20
  • GPT-4o Mini TTS (2025-12-15)gpt-4o-mini-tts-2025-12-15
  • Grok Speech-to-Textxai/speech-to-text/v1
  • HeartMuLaWavespeed-HeartMuLa
  • Inworld Realtime TTS 2inworld/realtime-tts-2
  • Inworld TTS 1.5 Maxinworld-tts-1.5-max
  • Inworld TTS 1.5 Miniinworld-tts-1.5-mini
  • Kokoro 82MKokoro-82m
  • MAI-Transcribe 1.5microsoft/mai-transcribe-1.5
  • MAI-Voice-2microsoft/mai-voice-2
  • MiniMax Music 02Minimax-Music-02
  • MiniMax Music 2.5Minimax-Music-2.5
  • MiniMax Music 2.6Minimax-Music-2.6
  • MiniMax Music 3minimax/music-3
  • MiniMax Music Coverminimax/music-cover
  • MiniMax Speech 02 HDMinimax-Speech-02-HD
  • MiniMax Speech 2.6 HDMinimax-Speech-2.6-HD
  • MiniMax Speech 2.6 TurboMinimax-Speech-2.6-Turbo
  • MiniMax Speech 2.8 HDMinimax-Speech-2.8-HD
  • MiniMax Speech 2.8 TurboMinimax-Speech-2.8-Turbo
  • Mirelo SFX1.6 Extend Audiomirelo-ai/sfx1.6/extend-audio
  • Mirelo SFX1.6 Inpaint Audiomirelo-ai/sfx1.6/inpaint-audio
  • Mirelo SFX1.6 Text to Audiomirelo-ai/sfx1.6/text-to-audio
  • Mureka Describe Songmureka-ai/describe-song
  • Mureka Extend Lyricsmureka-ai/extend-lyrics
  • Mureka Generate Lyricsmureka-ai/generate-lyrics
  • Mureka O2 Generate Songmureka-ai/mureka-o2/generate-song
  • Mureka Stem Songmureka-ai/stem-song
  • Mureka Upload Audiomureka-ai/create-upload-id
  • Mureka v7.5 Generate BGMmureka-ai/mureka-v7.5/generate-bgm
  • Mureka v7.6 Extend Songmureka-ai/mureka-v7.6/extend-song
  • Mureka v7.6 Generate BGMmureka-ai/mureka-v7.6/generate-bgm
  • Mureka v7.6 Generate Songmureka-ai/mureka-v7.6/generate-song
  • Mureka v7.6 Recognize Songmureka-ai/mureka-v7.6/recognize-song
  • Mureka v8 Extend Songmureka-ai/mureka-v8/extend-song
  • Mureka v8 Generate BGMmureka-ai/mureka-v8/generate-bgm
  • Mureka v8 Generate Songmureka-ai/mureka-v8/generate-song
  • Mureka v9 Generate BGMmureka-ai/mureka-v9/generate-bgm
  • Mureka v9 Generate Songmureka-ai/mureka-v9/generate-song
  • Mureka Vocal Clonemureka-ai/vocal-clone
  • NVIDIA Nemotron ASR Multilingualnvidia/nemotron-asr-multilingual/asr
  • OmnivoiceOmnivoice
  • OpenAI TTStts-1
  • OpenAI TTS HDtts-1-hd
  • OpenAI Whisper With Videoopenai-whisper-with-video
  • Qwen 3 TTS 1.7BQwen-3-TTS-1.7B
  • Qwen Audio 3.0 TTS Flashalibaba/qwen-audio-3-tts
  • Sonilo Text-to-Musicsonilo/text-to-music
  • Sonilo Video-to-Musicsonilo/video-to-music
  • SpaceXAI TTSxai-tts
  • Stable Audio 3 Mediumfal-ai/stable-audio-3/medium/text-to-audio
  • Stable Audio 3 Small Musicfal-ai/stable-audio-3/small/music/text-to-audio
  • Stable Audio 3 Small SFXfal-ai/stable-audio-3/small/sfx/text-to-audio
  • VibeVoicemicrosoft/vibevoice
  • Whisper Large V3Whisper-Large-V3
  • Whisper-1whisper-1
  • WizperWizper