🎙️ GPT-Live-Transcribe:面向低延迟实时语音场景,可用于实时会议、语音 Agent、智能客服。
📄 GPT-Transcribe:面向异步音频转录和批量处理任务,适用于采访、视频字幕、长音频分析。
✨核心升级:
1.转录准确率进一步提升
新模型显著增强了对复杂现实音频的处理能力(如重口音、背景噪声、多语言混合)。
GPT-Live-Transcribe在真实世界音频测试中的错误率降低到了9.60%,优于此前 GPT-Realtime-Whisper 的 11.65%。
此外,引入上下文提示后,模型语义准确率从 38.5% 提升至 44.6%。
2.支持上下文提示,AI理解能力增强
AI不再只是"听写机器",而是可以结合录音主题、关键词和语言信息,提高专业词汇、多语言内容的识别准确率。
3.处理效率与成本优化
GPT-Transcribe 的处理速度达到实时速度的约 34倍,缩短了批量任务的等待时间。
同时,价格下调25%,降至每1000分钟音频4.50美元。
从“听见声音”到“理解语境”,OpenAI正在推动语音AI从简单转录工具,走向更智能的交互基础设施发展。
未来,AI Agent、多语言沟通、智能客服和内容生产等领域都可能成为新的应用方向。

