DeepSeek 上新 V4‑Flash 视觉版:Harness + 视觉模型 + Files API 完成 Agent 闭环,AI Agent 竞争赛道...
8 月 21 日,DeepSeek 正式发布面向 API 调用的实验性多模态视觉模型 DeepSeek‑V4‑Flash‑Vision‑Exp,给主打推理、代码、Agent 任务的 V4‑Flash 装上视觉感知能力DeepS...。这并不只是简单补上多模态识图功能,结合 8 天前开源发布的 Harness 框架,以及同步开放的 Files API,DeepSeek 完成了感知‑思考‑执行整套 Agent 底层基建闭环,Agent 的竞争逻辑正在发生本质变化。模型核心能力:文本能力不降级,多模态 Agent 大幅提升
该模型并非从零开发的独立视觉大模型,是在 V4‑Flash 原有底座之上叠加视觉理解能力。官方明确:纯文本推理、Agent、世界知识能力与原版 V4‑Flash 整体持平,没有牺牲文本能力换取视觉能力DeepS...。
公开基准测试得分:
[*]Terminal Bench 2.1:83.9;NL2Repo:57.7;DeepSWE:59.3;DSBench‑Hard:63.6DeepS...
[*]多模态 Agent 相关评测成绩显著提升,综合能力已经接近 Claude Opus‑4.8 水准。
过去大家讨论多模态,大多聚焦识别图片内容:识别照片、菜单、CT 影像。但 Agent 场景下的视觉需求完全不一样:不是 “看见图片”,而是看懂之后接着干活。举两个典型场景:
[*]传入一张网页截图,不只是识别导航栏、按钮,还能解析页面层级、色值、间距、布局,直接输出代码复现该页面;
[*]接收一份业务需求,结合图表、参考图片,直接输出完整的 B 端商业合作方案、PPT 文档。
这代表 Agent 范式正在转变:不再需要人类把现实世界信息整理成文字喂给 AI;AI 可以直接观察环境,读取图片、截图、报表信息,自主完成完整任务。
成本剧变:视觉从高级功能,变成 Agent 常驻传感器
本次更新最大的亮点之一是视觉调用成本被压到极低。单张图片 Token 上限仅384 Token,计费标准沿用 V4‑Flash 原有价格,看图不额外加价DeepS...。
理论测算:1000 张图片,图片输入 Token 总量上限约 38.4 万 Token。高峰时段图片输入成本约 0.38 元,闲时仅约 0.19 元。注:该数值仅为图片输入部分理论下限,实际调用还需要叠加提示词、输出 Token、上下文历史、网络与文件存储开销,不能简单理解为处理一千张图只需要几毛钱。
但成本带来产品逻辑的改变更加关键:
[*]过去视觉调用昂贵,开发者需要反复权衡:这里是否真的需要 AI 看图?
[*]现在视觉成本足够低廉,思考变成:为什么不让 Agent 持续看图?
Agent 每一步执行都可以截图观察:打开网页看一眼、运行程序看一眼、代码报错截图、修改完成后再校验结果。视觉从昂贵的附加高级能力,转变为 Agent 运行过程当中常驻的传感器,眼睛可以一直保持睁开状态。
八天两步走:Harness + 视觉模型 + Files API,完整 Agent 闭环成型
时间事件核心价值
8 月 13 日Harness 开发者预览版开源发布Agent 躯体底座,提供 Shell 沙箱、文件操作、搜索、工作流、插件系统,定义 Agent = Model + Harness;模型是大脑,Harness 是对接现实世界的执行躯体
8 月 21 日V4‑Flash‑Vision‑Exp 视觉模型上线 + Harness 更新适配 + Files API 开放补齐感知层,图片可以上传后用 file_id 反复复用,无需每轮重复上传,感知‑大脑‑执行链路全部打通
Files API 支持 JPEG、PNG、GIF、WebP 格式,单文件最大 64MiB。开发者可以上传截图、报表、设计稿,在多轮 Agent 任务反复调用同一份图片资源,适配长流程 Agent 工作流DeepS...。
至此整套链路闭环:✅ Harness:负责行动执行,沙箱、工具调用、文件读写、工作流编排✅ V4‑Flash 模型:负责思考推理、规划任务、代码生成✅ Vision 视觉模块:负责感知现实世界截图、图表、界面✅ Files API:持久保存图片素材,多轮会话复用视觉信息
DeepSeek 没有直接发布一个全能的超级多模态大模型,而是走工程化路线,一块块补齐 Agent 落地所需要的底层基础设施。
行业启示:Agent 竞争已经换赛道
过去大模型比拼的是谁对话回答更聪明;而面向现实落地的 Agent 时代,比拼的是三件事:看得见、记得住、用得起,并且真正把任务做完。
当 AI “看一眼现实世界” 的成本被压缩到近乎忽略不计,AI 的变革不在于简单长出眼睛;而在于,这双眼睛可以一直睁着,持续感知外部环境,驱动 Agent 完成真实世界复杂任务。
模型 ID:deepseek‑v4‑flash‑vision‑exp,实验版本,支持 Chat Completions、Responses、Anthropic Messages 三类调用格式;图片支持 Base64、URL、Files API 三种传入方式。
页:
[1]