Fish Audio 基于 S2-Pro 双自回归架构,支持 80+ 语言、100ms 首音频延迟、15000…
Google于2026年4月6日上线的免费离线AI听写应用,基于Gemma端侧模型在设备端完成语音识别与文本润…
Read PDF Aloud是一款浏览器扩展工具,支持一百四十二种语言的网页与文档一键转语音,内置光学字符识别…
基于Whisper large-v3大模型的开源视频转文字工具video2text实测对比,支持TXT、SRT…
QQ音乐AI作歌输入中文描述即可生成歌词和旋律,免费版可试听片段,完整歌曲需付费:极速模式5元,歌词模式8元。…
冬瓜配音主打 5 秒音频样本即可克隆声音,还原度声称达 99.8%。内置 700 多种拟真音色,支持 12 国…
Nafy AI 支持文字生成广播级音乐,30 秒出曲。免费用户每日 3 首额度,订阅后按月获积分且享免版税商用…
腾讯音乐旗下AI音乐创作工具Vemus未音,支持文字、图片、哼唱3种多模态输入,几秒内生成完整歌曲。本文解析对…
Mistral Voxtral 是端到端开源语音理解模型,提供 Small(240 亿参数)、Mini(30 …
Lyria 3是谷歌DeepMind第三代AI音乐生成模型,集成于Gemini应用,支持文本、图片、视频输入,…
ElevenLabs 估值 110 亿美元,年经常性收入 3.3 亿美元,面向全球内容创作者与企业用户。但免费…
讯飞智作是科大讯飞推出的AI音视频生产平台,基于语音合成与虚拟人技术提供AI配音和数字人视频制作。本文详解注册…