其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。
DeepSeek-V4-Flash 正式版 API 上线公测 这条更新来自 api-docs.deepseek.com,发布时间为 2026-07-30,Aioga 保留原文入口以便核验。
摘要:DeepSeek-V4-Flash 正式版 API 上线公测,模型名设为 deepseek-v4-flash 即可使用,调用方式不变。其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。
背景:DeepSeek API 目前支持 V4-Pro 与 V4-Flash,并兼容 OpenAI ChatCompletions 接口和 Anthropic 接口。原有 deepseek-chat 与 deepseek-reasoner 模型名计划于 2026 年 7 月 24 日停止使用。
Aioga 观察:Aioga 判断,此次更新的重点是以较低迁移成本开放 V4-Flash,并强化 Agent 相关表现。公开成绩包括 Terminal Bench 2.1 得分 82.7、NL2Repo 得分 54.2,但不同测试框架与参数会影响横向比较。
影响与后续:现有 API 用户可能只需调整 model 参数即可测试新版本。不过,公开 Code Agent 基准采用尚未发布的 DeepSeek Harness 极简模式及指定采样参数,DSBench-Hard 又属于内部测试集,成绩仍需结合测试条件理解。 建议开发者在非生产环境切换至 deepseek-v4-flash,使用自身任务验证输出质量、Agent 流程与接口兼容性;同时梳理仍依赖 deepseek-chat 或 deepseek-reasoner 的调用,并在停用日期前安排迁移。
DeepSeek-V4-Flash 正式版 API 上线公测,API 调用方式不变,模型名设置为 deepseek-v4-flash 即可使用最新版本。
注1:对于公开基准测试集中的 Code Agent 任务,正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 极简模式(即将发布)作为框架进行测试,并使用 max 档位,topp=0.95,temperature=1.0 注2:DSBench-FullStack 是内部使用的全栈开发测试集,DSBench-Hard 是内部使用的 Coding Agent 难题测试集
DeepSeek API 已支持 V4-Pro 与 V4-Flash,支持 OpenAI ChatCompletions 接口与 Anthropic 接口。访问新模型时,base_url 不变, model 参数需要改为 deepseek-v4-pro 或 deepseek-v4-flash 。
旧有的 API 接口的两个模型名 deepseek-chat 与 deepseek-reasoner 将于三个月后(2026-07-24)停止使用。当前阶段内,这两个模型名分别指向 deepseek-v4-flash 的非思考模式与思考模式。
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.2.
我们非正式部署了 DeepSeek-V3.2-Speciale 的 API 服务,API 用户可以通过设置 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问该模型。该模型 API 价格不变,只支持思考模式下的对话功能,不支持工具调用等功能,最大输出长度默认为 128K,支持时间截止至北京时间 2025-12-15 23:59 。
deepseek-chat 和 deepseek-reasoner 都已经升级为 DeepSeek-V3.2-Exp。
deepseek-chat 和 deepseek-reasoner 都已经升级为 DeepSeek-V3.1-Terminus。 deepseek-chat 对应 DeepSeek-V3.1-Terminus 的 非思考模式 , deepseek-reasoner 对应 DeepSeek-V3.1-Terminus 的 思考模式 。
此次更新在保持模型原有能力的基础上,针对用户反馈的问题进行了改进,包括:
deepseek-chat 和 deepseek-reasoner 都已经升级为 DeepSeek-V3.1。 deepseek-chat 对应 DeepSeek-V3.1 的 非思考模式 , deepseek-reasoner 对应 DeepSeek-V3.1 的 思考模式 。
deepseek-reasoner 模型升级为 DeepSeek-R1-0528:
deepseek-chat 模型升级为 DeepSeek-V3-0324:
deepseek-chat 模型升级为 DeepSeek-V2.5-1210,模型各项能力提升,相关基准测试:
与此同时,全新版本的模型对文件上传和网页总结功能的用户体验进行了优化。
DeepSeek V2 Chat 和 DeepSeek Coder V2 两个模型已经合并升级,升级后的新模型为 DeepSeek V2.5。
为向前兼容,API 用户通过 deepseek-coder 或 deepseek-chat 均可以访问新的模型。
新模型更好的对齐了人类的偏好,在写作任务、指令跟随等多方面进行了优化:
新模型在原Coder模型的 基础上进一步提升了代码生成能力,对常见编程应用场景进行了优化,并在标准测试集上取得了以下成绩:
更新详情请跳转文档 API 上线硬盘缓存 2024/08/02:/zh-cn/news/news0802
更新详情请跳转文档 API 升级新功能 2024/07/25:/zh-cn/news/news0725
deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。
deepseek-chat 模型升级为 DeepSeek-V2-0628,模型推理能力提升,相关基准测试:
在 Arena-Hard 测评中,与 GPT-4-0314 的对战胜率从 41.6% 提升到了 68.3%。
deepseek-coder 模型升级为 DeepSeek-Coder-V2-0614,代码能力显著提升,在代码生成、代码理解、代码修复和代码补全上达到了 GPT-4-Turbo-0409 的水平,并拥有卓越的数学和推理能力,其通用能力与 DeepSeek-V2-0517 持平。
deepseek-chat 模型升级为 DeepSeek-V2-0517,模型在指令跟随方面的性能得到了显著提升,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%。此外,我们对API端的“system”区域指令跟随能力进行了优化,显著增强了沉浸式翻译、RAG 等任务的用户体验。
模型对于 JSON 格式输出的准确性得到了提升。在内部测试集中,JSON 解析率从 78% 提高到了85%。通过引入恰当的正则表达式,JSON 解析率进一步提高至 97%。
