DeepSeek补上眼睛,视觉模型上线API,多模态Agent逼近Opus 4.8

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

DeepSeek终于给自家模型补上了"眼睛"。8月21日下午,DeepSeek官方API文档的模型列表中出现了一个新名字:deepseek-v4-flash-vision-exp,这是DeepSeek V4系列首个直接支持图片输入的视觉模型。与主要处理文本的V4-Flash不同,新模型可以读取截图中的文字、理解图表和页面布局,也能把图片与文字指令放在同一次任务中处理,这意味着智能体不再需要用户"用文字描述图片"就能看懂屏幕。官方将其标注为实验版本,用户需在调用时手动指定模型名称才能访问,网页端和App的开放安排尚未提及。但对于开发者和Agent开发者而言,这已经是DeepSeek多模态能力从"模型展示"走向"API服务"的关键一步。

等待四个月的"眼睛",DeepSeek首款视觉模型如何补位

这套视觉能力的到来,比许多人预期的要晚一些。今年4月下旬,DeepSeek发布V4预览版,包括V4-Pro和V4-Flash两个版本,V4-Pro总参数1.6T、激活49B,V4-Flash总参数284B、激活13B,两者统一支持1M上下文,升级重点放在Agent、推理和长上下文上,当时并未公布视觉输入能力。8月13日,DeepSeek进一步更新V4-Pro,并在随后开放了Agent框架DeepSeek Harness,试图把模型、工具、技能、会话、沙箱、存储和Agent Loop放进一套可组合的运行框架中。但一个非常现实的问题很快暴露出来:DeepSeek自己的模型没有视觉能力,开发者上传图片时,Harness会直接返回"MODEL_DOES_NOT_SUPPORT_IMAGES"。

过去一周,在DeepSeek Harness的GitHub讨论区里,"怎么让DeepSeek看图"已经成为高频问题,因为V4 Flash和V4 Pro在模型目录里都被声明为纯文本模型,输入模态只有text。此次视觉模型的补位,正是针对这一缺口而来,为Harness生态补上了最关键的感知环节。

看图与纯文本两不误,多模态Agent能力为何接近Opus 4.8

视觉能力的加入会不会拖累文本表现,是这次实验版最关键的看点。从DeepSeek公布的对比数据看,V4-Flash-Vision-Exp与自家纯文本版V4-Flash-0731相比,在Agent、推理、世界知识等纯文本任务上基本持平,说明视觉模块的引入没有对原有文本能力造成明显损耗。而在需要处理视觉信息的Agent基准测试上,视觉版的表现出现了大幅跃升:ApexBench从26.2涨到36.5,Agents' Last Exam从25.2涨到27.3,加入视觉能力后,新模型在这些场景中得以充分完成相关任务,官方称其多模态Agent能力已经接近Claude Opus 4.8。

官方放出的三个演示案例,也刻意避开了"识图问答"这种基础任务。一个是给高净值客户制作西藏自驾游PPT,要求野性、粗粝、有实拍质感;一个是按黑蓝深海、玻璃UI、ASCII像素等视觉要素重构DeepSeek Harness官网;还有一个是制作带黏土怪物动效的网页Demo。三个案例的共同点是,模型需要先看懂图片、页面结构和设计意图,再调用工具产出PPT或代码。DeepSeek想展示的显然不是"能看图",而是视觉能力嵌进完整Agent工作流的可能性:看网页、分析界面、整理图文资料,这些过去需要人工辅助的环节,现在可以交给视觉Agent独立完成。

一张图最多384 Token,图片输入如何按Token计费

对于开发者来说,更实际的变化在于API与定价。V4-Flash-Vision-Exp的API支持Chat Completions、Messages和Responses三种调用格式,图片在API服务中会按尺寸折算成Token,与文本Token一同计费,单张图片最多占用384个Token,整体价格与文本版V4-Flash保持一致。具体来看,缓存命中时,空闲时段0.05元每百万Token、高峰时段0.10元每百万Token;缓存未命中时,输入分别为1.5元和3元,输出分别为4.5元和9元。模型还提供三种图片细节模式:low模式将图片缩放至512乘512以降低Token消耗,original模式保留原图,auto模式等同于原图,用户可按精度与成本需求灵活选择。图片输入方面,模型支持JPEG、PNG、GIF、WebP四种格式,可通过Base64内联、公开URL或Files API传入,单次请求最多可输入600张图,最长边支持8192像素,单张图片最大支持64MiB,为多模态Agent的高频调用预留了充足空间。量子位在实测中换算,即便每张图都占满384个Token,1分钱理论上也能看大约9张图,相比之下,同场景下GPT-Image-2看一张图约需2.06分,DeepSeek的价格便宜了近20倍。

Files API与Harness同步就位,多模态Agent补上感知入口

与视觉模型同步上线的还有Files API,开发者可以先把图片上传到平台,之后在多次请求中通过file_id复用,避免反复上传,这个接口本身不收费,但模型每次处理图片产生的Token仍会正常计费,对需要重复分析同一批截图、图表的工作流来说,主要省的是带宽而非推理成本。更重要的是,DeepSeek Harness在同期完成版本更新,正式原生支持自家的多模态模型,开发者可以直接在最新版Harness中选择视觉模型,配合手机端同步上线的识图模式,普通用户也可以直接体验图像交互功能。

模型与工具同日就位,配合8月13日以来Harness的快速迭代,DeepSeek正在补齐一套Agent系统最基础的感知入口:模型、图片、文件、工具和Agent执行链开始连在一起。在技术规格上,新模型拥有1M上下文、最大输出长度384K,兼容JSON Output、Tool Calls、Responses API与Anthropic API,可无缝接入现有Agent框架。从纯文本到能看图,DeepSeek的多模态布局虽然来得晚了一些,但价格、生态与开源的组合拳,依然让它在这一轮视觉Agent竞赛中握有足够的筹码。对开发者而言,一个既能读懂屏幕、又能调用工具、价格还足够亲民的开源视觉模型,意味着大量过去被"看不懂图"卡住的Agent场景,正在迎来解锁的时刻。

素材来源:量子位、腾讯新闻、网易智能、新浪财经 发布时间:2026-08-22