【Meta发布首个实时音频感知AI模型 ,支持20余人分轨转写】9月2日消息,据外媒报道,Meta公司推出Muse Voice Transcribe,这是其首个实时音频感知模型。开发者可通过Meta Model API调用该能力,定价为每1000分钟音频3美元(现汇率约合20.2元人民币),即每小时0.18美元(约1.2元人民币)。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时系统可同步输出文字,无需等待完整录音结束后再单独处理,因此延迟更低,适合实时听写、会议记录与通话字幕。Muse Voice Transcribe可在包含20余名说话者的录音中分离不同发言者,也能识别说话是否结束从而自动确定一段输入的边界。模型训练覆盖70余种语言,其中25种在发布时完成验证,并支持长度超过1小时的音频以及句内或句间的自然语言切换。(IT之家)
【#Meta发布首个实时音频感知AI模型# ,支持20余人分轨转写】9月2日消息,据外媒报道,Meta公司推出Muse Voice Transcribe,这是其首个实时音频感知模型。开发者可通过Meta Model API调用该能力,定价为每1000分钟音频3美元(现汇率约合20.2元人民币),即每小时0.18美元(约1.2元人民币)。该模型在同
阅读:0
点赞:0