铭鸿体育资讯网

OpenAI发新品,语言的障碍不存在了

OpenAI刚刚发布两款全新的语音转录模型,以后整理录音大概真的可以解放双手了👇

🎙️ GPT-Live-Transcribe:面向低延迟实时语音场景,可用于实时会议、语音 Agent、智能客服。

📄 GPT-Transcribe:面向异步音频转录和批量处理任务,适用于采访、视频字幕、长音频分析。

✨核心升级:

1.转录准确率进一步提升

新模型显著增强了对复杂现实音频的处理能力(如重口音、背景噪声、多语言混合)。

GPT-Live-Transcribe在真实世界音频测试中的错误率降低到了9.60%,优于此前 GPT-Realtime-Whisper 的 11.65%。

此外,引入上下文提示后,模型语义准确率从 38.5% 提升至 44.6%。

2.支持上下文提示,AI理解能力增强

AI不再只是"听写机器",而是可以结合录音主题、关键词和语言信息,提高专业词汇、多语言内容的识别准确率。

3.处理效率与成本优化

GPT-Transcribe 的处理速度达到实时速度的约 34倍,缩短了批量任务的等待时间。

同时,价格下调25%,降至每1000分钟音频4.50美元。

从“听见声音”到“理解语境”,OpenAI正在推动语音AI从简单转录工具,走向更智能的交互基础设施发展。

未来,AI Agent、多语言沟通、智能客服和内容生产等领域都可能成为新的应用方向。