8月21日,DeepSeek 推出多模态模型 deepseek-v4-flash-vision-exp,并已上线 DeepSeek API 平台,开发者可设置 model 参数进行访问。
官方介绍,这是一款面向 Agent 时代的实验性模型,在保持 deepseek-v4-flash-vision-exp 文本能力的基础上,新增视觉理解能力,可处理图片输入,进一步提升多模态 Agent 任务表现。同时,DeepSeek Harness 0.1.1 版本已原生支持该模型,开发者可直接将其图像理解能力接入现有 Agent 工作流。
该模型支持混合文本和图片输入,图片可通过 Base64、外部 URL 或 Files API 提供。开发者可通过 Chat Completions、Messages 及 Responses API 调用,适用于办公、开发及内容生产等多模态 Agent 场景。
