首页 > 开源 > DeepSeek V4-Flash 补上视觉能力,多模态 Agent 接近 Opus 4.8

DeepSeek V4-Flash 补上视觉能力,多模态 Agent 接近 Opus 4.8

OSChina资讯 2026-08-21 17:49 1 阅读 查看原文

DeepSeek 今天给 V4-Flash 补上了视觉能力。

新模型叫 DeepSeek-V4-Flash-Vision-Exp,一个实验性质的版本,已通过 deepseek-v4-flash-vision-exp 这个 model id 在 DeepSeek API 平台上开放调用。

纯文本不降级,视觉大幅跃升

最关键的指标:在纯文本能力(Agent、推理、世界知识等)上,Vision-Exp 与 V4-Flash 正式版持平。说明加视觉没有牺牲文本侧的推理能力。

而在需要视觉理解的 Agent Benchmark 上,Vision-Exp 相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus 4.8。图片按照 token 计费,一张最多占 384 tokens,价格与 V4-Flash 模型一致。

三个 Agent 场景示例

DeepSeek 展示了三个多模态 Agent 长任务示例:做商业定制西藏自驾游 PPT(一个月行程、藏南+藏北、无人区级别体验、三种定价方案),用黑蓝深海和玻璃 UI 重构 DeepSeek Harness 官网(长多轮交互),以及制作黏土怪物风格动态特效的前端 Mini Demo。这些都不是简单的单轮看图问答,而是需要视觉理解作为输入的多步 Agent 工作流。

Files API 也一起上线了

Files API 开放,不收费。用户可先将图片上传到平台,再通过 file_id 引用,同一张图片在多个请求中无需重复上传。多模态 API 支持 Chat Completions、Messages、Responses 三种格式,图片传入方式支持 base64 内联、外部 URL 和 Files API 三种。

参考来源:https://mp.weixin.qq.com/s/UGMfvPMwBIB4oFYZZejekA