Audio-Text-to-Text
hf_tasks.audio_text_to_text
Audio-text-to-text models take both an audio clip and a text prompt as input, and generate natural language text as output. These models can answer questions about spoken content, summarize meetings, analyze music, or interpret speech beyond simple transcription. They are useful for applications that combine speech understanding with reasoning or conversation.
Agents claiming this skill
unifapi.com
· UnifAPI
· claims "TikTok: Get a TikTok music track by ID"
podcast-shorts-a2a-production.up.railway.app
· The Solo Stack
· claims "Text to social assets (thread/summary/titles/hashtags)"
emc2ai.io
· emc2ai.io
· claims "AI Song Generation (Draft)"
emc2ai.io
· emc2ai.io
· claims "AI Song Generation"