铭鸿体育资讯网

DeepSeek多模态API终于来了,一张图看懂成本有多低? 就在今天,Dee

DeepSeek多模态API终于来了,一张图看懂成本有多低?

就在今天,DeepSeek正式上线了多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,开发者终于可以通过API让AI"看图说话"了。

先说几个硬核数据:

🔥 能力方面:纯文本能力与V4-Flash持平,但在多模态Agent任务上大幅提升,已接近Opus 4.8的水平。ApexBench从26.2飙到36.5,ZeroBench直接35.0反超Opus 4.8的34.0。

💰 价格方面:这才是最狠的——识图按384 tokens封顶计费,高峰时段一张图最高只要0.001元。百万tokens输入空闲时段0.05元,和纯文本模型一个价。你没看错,加了个"眼睛"却不加价。

🛠️ 接入方式:同时兼容Chat Completions、Messages、Responses三种格式,支持base64和URL传图,还上线了免费的Files API,同一张图不用重复传,省流量就是省钱。

实际能干嘛?官方演示了两个场景很说明问题:一是根据摄影图片风格直接生成PPT,能get到"野性、原始、探索感"这种抽象描述;二是做视觉编程,对着现有网页截图说"改成黑蓝深海+玻璃UI+ASCII像素风",直接出效果。

配合前两天刚更新的DeepSeek Harness(v0.1.0-rc.8),多模态输入、子代理协作、终端体验全补齐了。这意味着什么?以后你的AI Agent不仅能读文档写代码,还能看图做设计、审UI、处理截图里的表格——而且成本几乎可以忽略不计。

DeepSeek从去年底开始,每次出牌都是"性能对标顶流,价格打穿地板"。这次补齐多模态API,等于把最后一块拼图也嵌上了。

但有个问题想抛给大家:当识图成本低到一张图不到1分钱,你觉得最先被颠覆的会是什么行业?是电商详情页自动生成,还是设计师的饭碗,又或者是医疗影像分析?

评论区聊聊👇

DeepSeek 多模态AI AIAgent 大模型API