Nano GPT logo
NanoGPT
Nano GPT logo
NanoGPT
Nano GPT logo
NanoGPT

Recent

 
 
 
 
All conversations

Create

Chat
Studio

Explore

Models
Pricing
AI Apps
Blog

Library

Gallery
Workspace
Usage
API
Suggestions and bugs
Terms

|

Privacy

|

Refunds
Balance
Subscription
Teams
Invitations
Presets
Settings
FAQPartnersPress & mediaBrand assetsBenchmarksEarn

Private AI

Explore Audio Models

Browse and discover the best AI audio models for text to speech, speech to text, and music.

Models
Provider logo
ACE-Step
Music

ACE-Step composes complete songs from text descriptions. Guide genre, mood, and structure with style tags and optional custom lyrics. Generates up to 4 minutes of multi-track audio with vocals.

≈ $0.050 per audio

Try ACE-StepDetails
Provider logo
ACE-Step 1.5
Music

ACE-Step 1.5 composes complete songs from text descriptions. Guide genre, mood, and structure with style tags and required custom lyrics. Generates up to 4 minutes of multi-track audio with vocals.

≈ $0.050 per audio

Try ACE-Step 1.5Details
Provider logo
ACE-Step v1.5 Base
Music

ACE-Step v1.5 Base is a Runware-hosted music model built for creator workflows, with stronger fidelity, more reliable stylistic consistency, and prompt-driven genre control for full-song generation.

≈ $0.009 per audio

Try ACE-Step v1.5 BaseDetails
Provider logo
ACE-Step v1.5 Turbo
Music

ACE-Step v1.5 Turbo is the faster, lower-cost Runware variant for full-song generation, with broad genre coverage, improved stylistic consistency, and text-guided music creation for creator workflows.

≈ $0.006 per audio

Try ACE-Step v1.5 TurboDetails
Provider logo
Alibaba Fun-ASR Flash
Speech to Text

Alibaba Cloud DashScope non-realtime speech recognition with multilingual transcription, punctuation, and sentence/word timestamps.

≈ $0.004 per minute

Try Alibaba Fun-ASR FlashDetails
Provider logo
ByteDance Seed Audio 1.0
Music

ByteDance Seed Audio 1.0 generates natural audio from text, with optional preset voices, up to three reference audio clips, or a single reference image.

≈ $0.300 per audio

Try ByteDance Seed Audio 1.0Details
Provider logo
ByteDance Seed Speech TTS 2.0
Text to Speech

ByteDance Seed Speech TTS 2.0 for natural multilingual speech with voice instructions and delivery controls.

≈ $30.00 per 1M characters (billed in 1k-character blocks)

Try ByteDance Seed Speech TTS 2.0Details
Provider logo
Demucs Stem Separation
Music

Separate up to 60 minutes / 700 MiB of stereo audio into vocals, drums, bass, guitar, piano, and other stems with Demucs.

≈ $0.023 per audio

Try Demucs Stem SeparationDetails
Provider logo
ElevenLabs Music
Music

Generate music with optional vocals, up to five minutes.

≈ $0.100 per audio

Try ElevenLabs MusicDetails
Provider logo
ElevenLabs Music v2
Music

Generate songs with vocals or instrumental music from a prompt, with tracks up to ten minutes.

≈ $0.750 per audio

Try ElevenLabs Music v2Details
Provider logo
ElevenLabs Music v2.5
Music

Generate songs with vocals or instrumental music from a prompt, with tracks up to ten minutes.

≈ $0.750 per audio

Try ElevenLabs Music v2.5Details
Provider logo
ElevenLabs Scribe V1
Speech to Text

ElevenLabs Scribe V1 transcription with word-level timestamps and speaker identification

≈ $0.051 per minute

Try ElevenLabs Scribe V1Details
Provider logo
ElevenLabs Scribe V2
Speech to Text

ElevenLabs Scribe V2 transcription with improved accuracy, word-level timestamps, and speaker identification

≈ $0.051 per minute

Try ElevenLabs Scribe V2Details
Provider logo
ElevenLabs Sound Effects V2
Music

Generate sound effects and seamless loops from a text description.

≈ $0.010 per audio

Try ElevenLabs Sound Effects V2Details
Provider logo
ElevenLabs Turbo V2.5
Text to Speech

High quality with lowest latency, ideal for real-time applications. Supports 32 languages while maintaining natural voice quality.

≈ $102.00 per 1M characters

Try ElevenLabs Turbo V2.5Details
Provider logo
ElevenLabs v3
Text to Speech

High-quality text-to-speech with enhanced controls and natural voices.

≈ $170.00 per 1M characters

Try ElevenLabs v3Details
Provider logo
ElevenLabs v4
Text to Speech

Expressive text-to-speech with inline audio tags and custom voice IDs.

≈ $136.00 per 1M characters

Try ElevenLabs v4Details
Provider logo
ElevenLabs v4 Turbo
Text to Speech

Lower-latency ElevenLabs v4 text-to-speech with inline audio tags and custom voice IDs.

≈ $68.00 per 1M characters

Try ElevenLabs v4 TurboDetails
Browse model collections
  • Alibaba
  • Bytedance
  • Elevenlabs
  • Fal Ai
  • Google
  • Inworld
  • Microsoft
  • MiniMax
  • Mirelo Ai
  • Mureka Ai
  • NVIDIA
  • Sonilo
  • Veed
  • Xai
Browse all 93 audio models

Direct links to every public model in this catalog.

  • ACE-StepWavespeed-ACE-Step
  • ACE-Step 1.5ACE-Step-1.5
  • ACE-Step v1.5 BaseACE-Step-v1.5-Base
  • ACE-Step v1.5 TurboACE-Step-v1.5-Turbo
  • Alibaba Fun-ASR Flashfun-asr-flash-2026-06-15
  • ByteDance Seed Audio 1.0bytedance/seed-audio-1.0
  • ByteDance Seed Speech TTS 2.0bytedance/seed-speech-tts-2.0
  • Demucs Stem Separationfal-ai/demucs
  • ElevenLabs Musicelevenlabs/music
  • ElevenLabs Music v2elevenlabs/music/v2
  • ElevenLabs Music v2.5elevenlabs/music/v2.5
  • ElevenLabs Scribe V1Elevenlabs-STT
  • ElevenLabs Scribe V2Elevenlabs-Scribe-V2
  • ElevenLabs Sound Effects V2fal-ai/elevenlabs/sound-effects/v2
  • ElevenLabs Turbo V2.5Elevenlabs-Turbo-V2.5
  • ElevenLabs v3Elevenlabs-V3
  • ElevenLabs v4elevenlabs/eleven-v4
  • ElevenLabs v4 Turboelevenlabs/eleven-v4-turbo
  • Gemini 2.5 Flash Preview TTSgemini-2.5-flash-preview-tts
  • Gemini 2.5 Pro Preview TTSgemini-2.5-pro-preview-tts
  • Gemini 3.1 Flash TTS Previewgemini-3.1-flash-tts-preview
  • Gemini 3.8 Flash TTSgoogle/gemini-3.8-flash-tts
  • Google Lyria 3 Pro Musicgoogle/lyria-3-pro/music
  • Google Lyria 3.5google/lyria-3.5
  • GPT-4o Mini Transcribegpt-4o-mini-transcribe
  • GPT-4o Mini Transcribe (2025-03-20)gpt-4o-mini-transcribe-2025-03-20
  • GPT-4o Mini Transcribe (2025-12-15)gpt-4o-mini-transcribe-2025-12-15
  • GPT-4o Mini TTSgpt-4o-mini-tts
  • GPT-4o Mini TTS (2025-03-20)gpt-4o-mini-tts-2025-03-20
  • GPT-4o Mini TTS (2025-12-15)gpt-4o-mini-tts-2025-12-15
  • Grok Speech-to-Textxai/speech-to-text/v1
  • HeartMuLaWavespeed-HeartMuLa
  • Inworld Realtime TTS 2inworld/realtime-tts-2
  • Inworld TTS 1.5 Maxinworld-tts-1.5-max
  • Inworld TTS 1.5 Miniinworld-tts-1.5-mini
  • Kokoro 82MKokoro-82m
  • MAI-Transcribe 1.5microsoft/mai-transcribe-1.5
  • MAI-Voice-2microsoft/mai-voice-2
  • MAI-Voice-2.1microsoft/mai-voice-2.1
  • MAI-Voice-2.1-Flashmicrosoft/mai-voice-2.1-flash
  • MiniMax Music 02Minimax-Music-02
  • MiniMax Music 2.5Minimax-Music-2.5
  • MiniMax Music 2.6Minimax-Music-2.6
  • MiniMax Music 3minimax/music-3
  • MiniMax Music Coverminimax/music-cover
  • MiniMax Speech 02 HDMinimax-Speech-02-HD
  • MiniMax Speech 2.6 HDMinimax-Speech-2.6-HD
  • MiniMax Speech 2.6 TurboMinimax-Speech-2.6-Turbo
  • MiniMax Speech 2.8 HDMinimax-Speech-2.8-HD
  • MiniMax Speech 2.8 TurboMinimax-Speech-2.8-Turbo
  • Mirelo SFX1.6 Extend Audiomirelo-ai/sfx1.6/extend-audio
  • Mirelo SFX1.6 Inpaint Audiomirelo-ai/sfx1.6/inpaint-audio
  • Mirelo SFX1.6 Text to Audiomirelo-ai/sfx1.6/text-to-audio
  • Mureka Describe Songmureka-ai/describe-song
  • Mureka Extend Lyricsmureka-ai/extend-lyrics
  • Mureka Generate Lyricsmureka-ai/generate-lyrics
  • Mureka O2 Generate Songmureka-ai/mureka-o2/generate-song
  • Mureka Stem Songmureka-ai/stem-song
  • Mureka Upload Audiomureka-ai/create-upload-id
  • Mureka v7.5 Generate BGMmureka-ai/mureka-v7.5/generate-bgm
  • Mureka v7.6 Extend Songmureka-ai/mureka-v7.6/extend-song
  • Mureka v7.6 Generate BGMmureka-ai/mureka-v7.6/generate-bgm
  • Mureka v7.6 Generate Songmureka-ai/mureka-v7.6/generate-song
  • Mureka v7.6 Recognize Songmureka-ai/mureka-v7.6/recognize-song
  • Mureka v8 Extend Songmureka-ai/mureka-v8/extend-song
  • Mureka v8 Generate BGMmureka-ai/mureka-v8/generate-bgm
  • Mureka v8 Generate Songmureka-ai/mureka-v8/generate-song
  • Mureka v9 Generate BGMmureka-ai/mureka-v9/generate-bgm
  • Mureka v9 Generate Songmureka-ai/mureka-v9/generate-song
  • Mureka v9.5 Generate BGMmureka-ai/mureka-v9.5/generate-bgm
  • Mureka v9.5 Generate Songmureka-ai/mureka-v9.5/generate-song
  • Mureka v9.5 Prompt-to-Songmureka-ai/mureka-v9.5/prompt-to-song
  • Mureka Vocal Clonemureka-ai/vocal-clone
  • NVIDIA Nemotron ASR Multilingualnvidia/nemotron-asr-multilingual/asr
  • OmnivoiceOmnivoice
  • OpenAI TTStts-1
  • OpenAI TTS HDtts-1-hd
  • OpenAI Whisper With Videoopenai-whisper-with-video
  • Qwen 3 TTS 1.7BQwen-3-TTS-1.7B
  • Qwen Audio 3.0 TTS Flashalibaba/qwen-audio-3-tts
  • Sonilo Text-to-Musicsonilo/text-to-music
  • Sonilo Video-to-Musicsonilo/video-to-music
  • SpaceXAI TTSxai-tts
  • Stable Audio 3 Mediumfal-ai/stable-audio-3/medium/text-to-audio
  • Stable Audio 3 Small Musicfal-ai/stable-audio-3/small/music/text-to-audio
  • Stable Audio 3 Small SFXfal-ai/stable-audio-3/small/sfx/text-to-audio
  • VEED Clean Audioveed/clean-audio
  • VibeVoicemicrosoft/vibevoice
  • Whisper Large V3Whisper-Large-V3
  • Whisper-1whisper-1
  • WizperWizper
  • Yue2 3B Music-to-Musicwavespeed-ai/yue2-3b/music-to-music
  • Yue2 3B Text-to-Musicwavespeed-ai/yue2-3b/text-to-music