DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8 这条更新来自 ithome.com,发布时间为 2026-08-31,Aioga 保留原文入口以便核验。

摘要:DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。
背景:背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。
Aioga 观察:Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。
影响与后续:影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。
IT之家:https://www.ithome.com/ 8 月 31 日消息,刚刚,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。

公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。
据IT之家了解, DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于 2026 年 8 月 21 日上线 DeepSeek API 平台。
该模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。
深度求索官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持大家借助多样化的 Agent 工具解锁更多实用的工作场景。在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,原有优势完整保留。在需要视觉理解的 Agent 基准测试中较 V4-Flash 大幅提升,多模态 Agent 能力已接近 Opus-4.8。