{"protocolVersion":"0.3.0","name":"AudioPod AI Audio Agent","version":"1.0.0","description":"Production AI agent for end-to-end audio production: music generation, voice cloning, TTS, stem separation, transcription, audiobook narration, and podcast creation.","url":"https://api.audiopod.ai/api/v1/agent/chat","provider":{"organization":"AudioPod AI","url":"https://www.audiopod.ai"},"iconUrl":"https://www.audiopod.ai/web-app-manifest-512x512.png","documentationUrl":"https://api.audiopod.ai/docs","supportedInterfaces":[{"url":"https://api.audiopod.ai/api/v1/agent/chat","transport":"JSONRPC","protocol":"https"},{"url":"https://mcp.audiopod.ai","transport":"MCP","protocol":"https"}],"defaultInputModes":["text/plain","application/json"],"defaultOutputModes":["text/plain","application/json","text/event-stream","audio/wav","audio/mpeg"],"capabilities":{"streaming":true,"pushNotifications":false,"stateTransitionHistory":true},"securitySchemes":{"oauth2":{"type":"oauth2","flows":{"password":{"tokenUrl":"https://api.audiopod.ai/api/v1/auth/token","refreshUrl":"https://api.audiopod.ai/api/v1/auth/refresh","scopes":{"audio:read":"Read audio assets","audio:write":"Create or modify audio assets"}}}},"apiKey":{"type":"apiKey","in":"header","name":"X-API-Key"}},"security":[{"oauth2":["audio:read","audio:write"]},{"apiKey":[]}],"skills":[{"id":"generate_music","name":"Music Generation · powered by AudioMusic","description":"AudioMusic is AudioPod's music generation engine: full songs, instrumentals, and rap with synchronized LRC lyrics, royalty-free for commercial use on paid plans.","tags":["music","generation"],"examples":["Generate a 90 BPM lo-fi hip hop track with rainy ambient pads, 60 seconds.","Make a Bollywood pop anthem with Hindi lyrics about chasing dreams."]},{"id":"text_to_speech","name":"Text to Speech · powered by AudioSonic","description":"AudioSonic is AudioPod's text-to-speech engine: natural, studio-grade narration with inline emotion directing, timed pauses, IPA pronunciation control, and optional word-level timestamps.","tags":["tts","voice","speech"]},{"id":"design_voice","name":"Voice Design · powered by AudioSonic","description":"Voice Design, part of the AudioSonic family, creates a brand-new voice from a plain-text description, previews candidates, and publishes one as a reusable voice.","tags":["voice-design","voice"]},{"id":"clone_voice","name":"Voice Cloning · powered by AudioSonic","description":"Voice cloning runs on the AudioSonic engine — clone a voice from a 5–30s reference clip and reuse it for narration or TTS across the same language reach as the premium voice engine.","tags":["voice-clone","voice","narration"]},{"id":"change_voice","name":"Voice Changer","description":"Convert speech from one voice into another (voice-to-voice) while preserving the words and timing.","tags":["voice-conversion","voice"]},{"id":"separate_stems","name":"Stem Separation · powered by AudioStems","description":"AudioStems is AudioPod's stem separation engine: split a song into vocals, drums, bass, guitar, piano and more, or isolate any of a 45-instrument catalog.","tags":["stems","vocal-removal","karaoke"]},{"id":"transcribe_audio","name":"Transcription · powered by AudioTranscribe","description":"AudioTranscribe is AudioPod's speech-to-text engine: transcription with speaker diarization, word-level timestamps, and standard or premium accuracy, plus real-time streaming.","tags":["transcription","stt","diarization"]},{"id":"separate_speakers","name":"Speaker Separation · powered by AudioDiarize","description":"AudioDiarize is AudioPod's speaker separation engine: it diarizes a multi-person recording and splits it into an individual audio track per speaker.","tags":["speaker-separation","diarization"]},{"id":"denoise_audio","name":"Noise Reduction","description":"Remove background noise, hiss, hum, and room tone from a recording while preserving the voice character.","tags":["noise-reduction","cleanup"]},{"id":"translate_audio","name":"Audio Translation","description":"Translate spoken audio into text in another language via the OpenAI-compatible translations endpoint.","tags":["translation","dubbing"]},{"id":"narrate_audiobook","name":"Audiobook Narration","description":"End-to-end audiobook production: parse a PDF/EPUB/DOCX/TXT manuscript, auto-detect chapters, narrate, and export masters that meet ACX audio-file specifications.","tags":["audiobook","narration","acx","kindle-vella"]},{"id":"create_podcast","name":"Podcast Creation","description":"Turn source documents or a topic into a multi-speaker podcast episode with a public RSS feed.","tags":["podcast","notebooklm-alternative"]},{"id":"read_article","name":"Audio Reader","description":"Turn an article, URL, or long block of text into narrated audio with a shareable, embeddable player.","tags":["reader","accessibility","narration"]},{"id":"convert_media","name":"Media Conversion","description":"Convert audio and video between all major formats (MP3, WAV, FLAC, OGG, M4A, AAC, and common video containers).","tags":["media","conversion"]}]}