Nano GPT logo
NanoGPT
Nano GPT logo
NanoGPT
Conversations
Create Media
Workspace
Gallery
Models
Pricing

Account

Balance
Usage
Settings
API
Presets
Invitations
Subscription
Teams

Resources

Benchmarks
Suggestions and bugs
Batch API
Blog
Press & Media
Brand Assets
Help
FAQ
Applications

Ӿ

Earn
Partners
Terms

|

Privacy

|

Refunds

Private AI

Explore Audio Models

Browse and discover the best AI audio models for text to speech, speech to text, and music.

ACE-Step
Music

ACE-Step composes complete songs from text descriptions. Guide genre, mood, and structure with style tags and optional custom lyrics. Generates up to 4 minutes of multi-track audio with vocals.

≈ $0.050 per audio

Try ACE-StepDetails
ACE-Step 1.5
Music

ACE-Step 1.5 composes complete songs from text descriptions. Guide genre, mood, and structure with style tags and required custom lyrics. Generates up to 4 minutes of multi-track audio with vocals.

≈ $0.050 per audio

Try ACE-Step 1.5Details
Provider logo
ACE-Step v1.5 Base
Music

ACE-Step v1.5 Base is a Runware-hosted music model built for creator workflows, with stronger fidelity, more reliable stylistic consistency, and prompt-driven genre control for full-song generation.

≈ $0.009 per audio

Try ACE-Step v1.5 BaseDetails
Provider logo
ACE-Step v1.5 Turbo
Music

ACE-Step v1.5 Turbo is the faster, lower-cost Runware variant for full-song generation, with broad genre coverage, improved stylistic consistency, and text-guided music creation for creator workflows.

≈ $0.006 per audio

Try ACE-Step v1.5 TurboDetails
Provider logo
Alibaba Fun-ASR Flash
Speech to Text

Alibaba Cloud DashScope non-realtime speech recognition with multilingual transcription, punctuation, and sentence/word timestamps.

≈ $0.004 per minute

Try Alibaba Fun-ASR FlashDetails
Provider logo
ByteDance Seed Audio 1.0
Music

ByteDance Seed Audio 1.0 generates natural audio from text, with optional preset voices, up to three reference audio clips, or a single reference image.

≈ $300.06 per 1M characters (billed in 300-character blocks)

Try ByteDance Seed Audio 1.0Details
Provider logo
ByteDance Seed Speech TTS 2.0
Text to Speech

ByteDance Seed Speech TTS 2.0 for natural multilingual speech with voice instructions and delivery controls.

≈ $51.00 per 1M characters (billed in 1k-character blocks)

Try ByteDance Seed Speech TTS 2.0Details
Provider logo
Demucs Stem Separation
Music

Separate up to 60 minutes / 700 MiB of stereo audio into vocals, drums, bass, guitar, piano, and other stems with Demucs.

≈ $0.023 per audio

Try Demucs Stem SeparationDetails
ElevenLabs Music
Music

Generate music with optional vocals, up to five minutes.

≈ $0.100 per audio

Try ElevenLabs MusicDetails
Provider logo
ElevenLabs Scribe V1
Speech to Text

ElevenLabs Scribe V1 transcription with word-level timestamps and speaker identification

≈ $0.051 per minute

Try ElevenLabs Scribe V1Details
Provider logo
ElevenLabs Scribe V2
Speech to Text

ElevenLabs Scribe V2 transcription with improved accuracy, word-level timestamps, and speaker identification

≈ $0.051 per minute

Try ElevenLabs Scribe V2Details
Provider logo
ElevenLabs Sound Effects V2
Music

Generate sound effects and seamless loops from a text description.

≈ $0.010 per audio

Try ElevenLabs Sound Effects V2Details
Provider logo
ElevenLabs Turbo V2.5
Text to Speech

High quality with lowest latency, ideal for real-time applications. Supports 32 languages while maintaining natural voice quality.

≈ $102.00 per 1M characters

Try ElevenLabs Turbo V2.5Details
Provider logo
ElevenLabs v3
Text to Speech

High-quality text-to-speech with enhanced controls and natural voices.

≈ $170.00 per 1M characters

Try ElevenLabs v3Details
Provider logo
Gemini 2.5 Flash Preview TTS
Text to Speech

Google Gemini native TTS. Single and multi-speaker support via prompt.

≈ $51.17 per 1M characters

Try Gemini 2.5 Flash Preview TTSDetails
Provider logo
Gemini 2.5 Pro Preview TTS
Text to Speech

Higher-quality Gemini TTS with controllable style and tone.

≈ $102.17 per 1M characters

Try Gemini 2.5 Pro Preview TTSDetails
Provider logo
Gemini 3.1 Flash TTS Preview
Text to Speech

Google Gemini 3.1 Flash text-to-speech with inline audio tag and multi-speaker prompt support.

≈ $102.42 per 1M characters

Try Gemini 3.1 Flash TTS PreviewDetails
Provider logo
Google Lyria 3 Pro Music
Music

Google Lyria 3 Pro generates premium music clips from a text prompt, with optional image guidance, negative prompts, and seed-based repeatability.

≈ $0.080 per audio

Try Google Lyria 3 Pro MusicDetails
Browse model collections
  • Alibaba
  • Bytedance
  • Elevenlabs
  • Fal Ai
  • Google
  • Inworld
  • Microsoft
  • MiniMax
  • Mirelo Ai
  • Mureka Ai
  • NVIDIA
  • Sonilo
  • Xai
Browse all 84 audio models

Direct links to every public model in this catalog.

  • ACE-StepWavespeed-ACE-Step
  • ACE-Step 1.5ACE-Step-1.5
  • ACE-Step v1.5 BaseACE-Step-v1.5-Base
  • ACE-Step v1.5 TurboACE-Step-v1.5-Turbo
  • Alibaba Fun-ASR Flashfun-asr-flash-2026-06-15
  • ByteDance Seed Audio 1.0bytedance/seed-audio-1.0
  • ByteDance Seed Speech TTS 2.0bytedance/seed-speech-tts-2.0
  • Demucs Stem Separationfal-ai/demucs
  • ElevenLabs Musicelevenlabs/music
  • ElevenLabs Scribe V1Elevenlabs-STT
  • ElevenLabs Scribe V2Elevenlabs-Scribe-V2
  • ElevenLabs Sound Effects V2fal-ai/elevenlabs/sound-effects/v2
  • ElevenLabs Turbo V2.5Elevenlabs-Turbo-V2.5
  • ElevenLabs v3Elevenlabs-V3
  • Gemini 2.5 Flash Preview TTSgemini-2.5-flash-preview-tts
  • Gemini 2.5 Pro Preview TTSgemini-2.5-pro-preview-tts
  • Gemini 3.1 Flash TTS Previewgemini-3.1-flash-tts-preview
  • Google Lyria 3 Pro Musicgoogle/lyria-3-pro/music
  • GPT-4o Mini Transcribegpt-4o-mini-transcribe
  • GPT-4o Mini Transcribe (2025-03-20)gpt-4o-mini-transcribe-2025-03-20
  • GPT-4o Mini Transcribe (2025-12-15)gpt-4o-mini-transcribe-2025-12-15
  • GPT-4o Mini TTSgpt-4o-mini-tts
  • GPT-4o Mini TTS (2025-03-20)gpt-4o-mini-tts-2025-03-20
  • GPT-4o Mini TTS (2025-12-15)gpt-4o-mini-tts-2025-12-15
  • Grok Speech-to-Textxai/speech-to-text/v1
  • HeartMuLaWavespeed-HeartMuLa
  • Inworld Realtime TTS 2inworld/realtime-tts-2
  • Inworld TTS 1.5 Maxinworld-tts-1.5-max
  • Inworld TTS 1.5 Miniinworld-tts-1.5-mini
  • Kokoro 82MKokoro-82m
  • MAI-Transcribe 1.5microsoft/mai-transcribe-1.5
  • MAI-Voice-2microsoft/mai-voice-2
  • MiniMax Music 02Minimax-Music-02
  • MiniMax Music 2.5Minimax-Music-2.5
  • MiniMax Music 2.6Minimax-Music-2.6
  • MiniMax Music 3minimax/music-3
  • MiniMax Music Coverminimax/music-cover
  • MiniMax Speech 02 HDMinimax-Speech-02-HD
  • MiniMax Speech 2.6 HDMinimax-Speech-2.6-HD
  • MiniMax Speech 2.6 TurboMinimax-Speech-2.6-Turbo
  • MiniMax Speech 2.8 HDMinimax-Speech-2.8-HD
  • MiniMax Speech 2.8 TurboMinimax-Speech-2.8-Turbo
  • Mirelo SFX1.6 Extend Audiomirelo-ai/sfx1.6/extend-audio
  • Mirelo SFX1.6 Inpaint Audiomirelo-ai/sfx1.6/inpaint-audio
  • Mirelo SFX1.6 Text to Audiomirelo-ai/sfx1.6/text-to-audio
  • Mureka Describe Songmureka-ai/describe-song
  • Mureka Extend Lyricsmureka-ai/extend-lyrics
  • Mureka Generate Lyricsmureka-ai/generate-lyrics
  • Mureka O2 Generate Songmureka-ai/mureka-o2/generate-song
  • Mureka Stem Songmureka-ai/stem-song
  • Mureka Upload Audiomureka-ai/create-upload-id
  • Mureka v7.5 Generate BGMmureka-ai/mureka-v7.5/generate-bgm
  • Mureka v7.6 Extend Songmureka-ai/mureka-v7.6/extend-song
  • Mureka v7.6 Generate BGMmureka-ai/mureka-v7.6/generate-bgm
  • Mureka v7.6 Generate Songmureka-ai/mureka-v7.6/generate-song
  • Mureka v7.6 Recognize Songmureka-ai/mureka-v7.6/recognize-song
  • Mureka v8 Extend Songmureka-ai/mureka-v8/extend-song
  • Mureka v8 Generate BGMmureka-ai/mureka-v8/generate-bgm
  • Mureka v8 Generate Songmureka-ai/mureka-v8/generate-song
  • Mureka v9 Generate BGMmureka-ai/mureka-v9/generate-bgm
  • Mureka v9 Generate Songmureka-ai/mureka-v9/generate-song
  • Mureka v9.5 Generate BGMmureka-ai/mureka-v9.5/generate-bgm
  • Mureka v9.5 Generate Songmureka-ai/mureka-v9.5/generate-song
  • Mureka v9.5 Prompt-to-Songmureka-ai/mureka-v9.5/prompt-to-song
  • Mureka Vocal Clonemureka-ai/vocal-clone
  • NVIDIA Nemotron ASR Multilingualnvidia/nemotron-asr-multilingual/asr
  • OmnivoiceOmnivoice
  • OpenAI TTStts-1
  • OpenAI TTS HDtts-1-hd
  • OpenAI Whisper With Videoopenai-whisper-with-video
  • Qwen 3 TTS 1.7BQwen-3-TTS-1.7B
  • Qwen Audio 3.0 TTS Flashalibaba/qwen-audio-3-tts
  • Sonilo Text-to-Musicsonilo/text-to-music
  • Sonilo Video-to-Musicsonilo/video-to-music
  • SpaceXAI TTSxai-tts
  • Stable Audio 3 Mediumfal-ai/stable-audio-3/medium/text-to-audio
  • Stable Audio 3 Small Musicfal-ai/stable-audio-3/small/music/text-to-audio
  • Stable Audio 3 Small SFXfal-ai/stable-audio-3/small/sfx/text-to-audio
  • VibeVoicemicrosoft/vibevoice
  • Whisper Large V3Whisper-Large-V3
  • Whisper-1whisper-1
  • WizperWizper
  • Yue2 3B Music-to-Musicwavespeed-ai/yue2-3b/music-to-music
  • Yue2 3B Text-to-Musicwavespeed-ai/yue2-3b/text-to-music