铭鸿体育资讯网

Qwen3.8-Omni-Flash 看到 Qwen3.8-Omni-Flash 的 API 价格,百万 Token 0.8 元。这个数我得先消化一下。之前云端 API 跑长视频或者大段音频,账单总是让人犹豫。现在这个价格,几乎等于把成本从考虑因素里抹掉了。对于需要频繁处理音视频内容的场景,这就很关键了。 1M 上下文,全模态。文本图像音频 ​

Qwen3.8-Omni-Flash

看到 Qwen3.8-Omni-Flash 的 API 价格,百万 Token 0.8 元。这个数我得先消化一下。之前云端 API 跑长视频或者大段音频,账单总是让人犹豫。现在这个价格,几乎等于把成本从考虑因素里抹掉了。对于需要频繁处理音视频内容的场景,这就很关键了。

1M 上下文,全模态。文本图像音频视频都能塞进去。官方说音视频能力较上一代 Qwen3.5-Omni-Plus 提升明显,在 30 项评测上平均分提升超过 26%。WildClawBench-MM 这种音视频 Agent 评测提升了 36.5 分,AgenticVBench 提升 22.3 分。这些数字背后是它能处理更复杂的任务链,不只是简单的转录或者识别。

说到长音视频处理,官方扩展了 Qwen-MM-Plugins 和开源了 Qwen-Live Harness。前者管按需感知和工具调用,后者负责实时交互。比如会议场景,支持最长一小时音视频输入,能完成说话人切分、转录、身份对应,最后生成纪要和待办。AliMeeting 的 DER 和 cpWER 从 88.11/89.61 降到 3.35/17.18,这个降幅非常大。这意味着在嘈杂或者多人会议环境下,它的表现可能会稳定很多。

Agentic 长音视频理解也是个亮点。OmniVideoBench 准确率从 63.4 提升到 67.8,Token 消耗从 145,736 降到 79,117,少了快一半。一边准一边省,这个组合在实际工程里很有吸引力。毕竟跑 Agent 任务,Token 消耗大就是速度慢、成本高。能省下来,循环跑任务就更从容。

还有个优化实验挺有意思。它自主在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力。自己选评测集,搞了 4 轮实验,生成 3413 条训练数据,字符错误率从 25.79% 降到 15.30%,相对下降 40.7%。这说明它不只是被动响应,还能主动去调优特定领域的问题。这种自驱能力如果成熟,对做垂直场景开发的人是个福音,不用每次都从头准备数据和调参。

实时版 Qwen3.8-Omni-Flash-Realtime 支持听声辨位,融合空间声音和视觉信息判断声源方向。这个能力挺少见。联合建模发音与语义,理解受口音影响的非标准表达,做口语陪练应该会比较准。

话说回来,这些能力最终能不能落地,还得看调用稳不稳定。API 价格这么低,如果并发一高就排队或者超时,那省下的钱还不够买时间的。官方公布了吞吐和延迟性能,数据看起来不错。但实际体验如何,还得自己接进去跑跑看。

对于手头有 32G 显存工作站的人,跑 14B 或者 32B 的本地模型依然有其价值,主要是数据不出域。但如果对实时性、多模态融合要求高,又对数据隐私没那么苛刻,这个云端 Flash 版本的性价比确实很难拒绝。0.8 元一百万 Token,这价格,本地部署的电费可能都快赶上了。