扫描下载APP
其它方式登录
谷歌发布Gemini 3.5 Transcribe语音转文本模型,突破传统逐字识别,具备意图理解、自我修正识别、口头禅过滤及自动格式化能力,支持85+语言和多场景落地,已集成至Gboard、Mac版Gemini及即将上线Chrome,是其Gemini Audio系列核心组件,旨在强化语音作为AI交互主入口的战略布局。
微软发布自研语音转文字模型MAI-Transcribe-1,支持25种语言,平均词错误率仅3.9%,在FLEURS基准测试中11种核心语言精度第一,性能达Azure Fast产品2.5倍,定价0.36美元/小时,已通过Microsoft Foundry平台向企业与开发者开放。
Cohere公司推出开源语音识别模型Cohere Transcribe,拥有20亿参数,支持14种语言,专为边缘设备优化,性能超越ElevenLabs Scribe和Qwen3,旨在强化AI智能体的语音交互能力,并整合进其North智能体编排平台。