扫描下载APP
其它方式登录
Meta推出实时音频感知模型Muse Voice Transcribe,支持超1小时长音频、20+说话人语音分割、中英文无缝语码切换及自适应延迟的流式语音识别,在多项基准测试中排名第一,可通过API、Mac版Meta AI和Muse Code调用。
微软开源VibeVoice语音AI模型家族,涵盖ASR、TTS和实时语音生成三大方向,支持长音频处理、多说话人对话、低延迟响应及多语言能力,采用MIT协议可本地部署,已在GitHub获27K Star,推动语音技术普惠化应用。