DeepSeek V4-Flash API开启公测:价格远低于GPT-5.6,速度与性价比实测对比

2026年7月31日,DeepSeek正式上线 DeepSeek-V4-Flash-0731,并开启正式版API公测。

新版本继续采用约2840亿总参数、130亿激活参数的混合专家架构,支持100万Token上下文、最长38.4万Token输出,以及思考模式、工具调用、JSON输出和代码补全等能力。

image.png

此次更新没有继续扩大参数规模,而是重新进行了后训练,重点提升代码Agent、终端操作、工具调用和复杂长程任务表现。DeepSeek公布的多项Agent成绩已经远超此前的V4-Pro预览版。(api-docs.deepseek.com)

价格仍然是V4-Flash最突出的优势。

DeepSeek官方API定价为:

缓存命中输入:0.02元/百万Token
缓存未命中输入:1元/百万Token
输出:2元/百万Token

相比OpenAI当前的GPT-5.6 Luna、Terra和Sol,DeepSeek-V4-Flash在输入和输出价格上均更低,尤其是输出Token成本差距非常明显。(api-docs.deepseek.com)

不过,“速度全面碾压GPT”需要拆开来看。

第三方测试显示,DeepSeek-V4-Flash的首Token响应速度较快,对GPT-5.6 Sol高推理档位也拥有明显的持续输出速度优势;但与强调速度的GPT-5.6 Luna相比,Luna生成后续Token的速度仍然更快。(artificialanalysis.ai)

因此,更准确的说法是:

DeepSeek-V4-Flash在API价格上全面低于GPT-5.6系列,在部分推理档位和响应指标上更快,但不能概括成所有速度指标都超过所有GPT模型。

DeepSeek-V4-Flash-0731是什么?

DeepSeek-V4-Flash-0731是DeepSeek V4系列的正式高效率版本。

它采用MoE混合专家架构:

项目 DeepSeek-V4-Flash
总参数规模 284B,约2840亿
激活参数规模 13B,约130亿
上下文窗口 1M Token
最大输出 384K Token
输入模态 文本
输出模态 文本
思考模式 支持
非思考模式 支持
Responses API 支持
Anthropic API 支持
Tool Calls 支持
JSON Output 支持
FIM代码补全 非思考模式支持
当前API模型ID deepseek-v4-flash

V4-Flash拥有2840亿参数,但每次处理一个Token时只激活约130亿参数。这种稀疏设计能够在保持较大模型容量的同时,减少实际推理计算量。(api-docs.deepseek.com)

需要注意,130亿激活参数并不等于完整模型只有130亿参数。

如果企业自行部署,仍然需要存储和管理完整的2840亿参数权重,硬件门槛远高于普通13B模型。

正式版没有扩大模型,只重新做了后训练

DeepSeek官方明确表示,V4-Flash-0731与V4-Flash-Preview拥有相同的模型结构和参数规模,此次仅重新进行了后训练。(api-docs.deepseek.com)

这意味着此次能力提升主要来自:

Agent任务训练
工具使用优化
终端环境操作
代码仓库级任务
长程规划
错误恢复
指令遵循
任务完成率优化

对于Agent模型而言,基础参数规模只是能力上限的一部分。

真正决定模型能否完成真实任务的,还包括:

是否会正确选择工具
能否理解工具返回结果
执行失败后能否调整方案
是否会陷入重复调用
能否保持原始任务目标
是否知道何时应该停止
最终结果能否通过验证

V4-Flash正式版的更新重点,正是这些生产环境中的执行能力。

DeepSeek V4-Flash API价格

DeepSeek官方当前定价如下:

计费项目 V4-Flash V4-Pro
输入缓存命中 0.02元/百万Token 0.025元/百万Token
输入缓存未命中 1元/百万Token 3元/百万Token
输出 2元/百万Token 6元/百万Token
默认并发上限 2500 500

(api-docs.deepseek.com)

在缓存未命中输入和输出价格上,V4-Flash都是V4-Pro的三分之一。

并发上限则达到V4-Pro的5倍,更适合:

大规模客服
批量内容处理
代码Agent
搜索Agent
企业自动化
多用户AI应用
持续运行的长程任务

与GPT-5.6最新价格对比

OpenAI目前将GPT-5.6分为三个主要等级:

GPT-5.6 Sol:旗舰能力
GPT-5.6 Terra:中间档位
GPT-5.6 Luna:速度和低成本档位

OpenAI在2026年7月30日更新价格后,当前官方API定价为:

模型 输入价格 输出价格
DeepSeek V4-Flash 约0.14美元/百万Token 约0.28美元/百万Token
GPT-5.6 Luna 0.20美元/百万Token 1.20美元/百万Token
GPT-5.6 Terra 2美元/百万Token 12美元/百万Token
GPT-5.6 Sol 5美元/百万Token 30美元/百万Token

DeepSeek美元价格采用Artificial Analysis根据DeepSeek官方人民币价格整理的参考值;人民币与美元的实际换算结果会随汇率变化。GPT-5.6价格来自OpenAI最新官方公告。(artificialanalysis.ai) (openai.com)

DeepSeek比GPT-5.6便宜多少?

按照当前参考价格计算:

对比GPT-5.6 Luna

DeepSeek输入价格约低30%
DeepSeek输出价格约低76.7%
GPT-5.6 Luna输入约为DeepSeek的1.4倍
GPT-5.6 Luna输出约为DeepSeek的4.3倍

对比GPT-5.6 Terra

DeepSeek输入约便宜14.3倍
DeepSeek输出约便宜42.9倍

对比GPT-5.6 Sol

DeepSeek输入约便宜35.7倍
DeepSeek输出约便宜107倍

这里比较的是每百万Token的固定单价,不代表完成同一个任务的最终费用一定保持同样倍数。

不同模型可能使用不同数量的:

思考Token
输出Token
工具调用
重试次数
上下文Token
缓存Token

真正的任务成本应该按照“完成一项任务需要多少总费用”计算,而不是只看单Token价格。

一个长程Agent任务能省多少钱?

假设一个Agent任务需要:

缓存未命中输入:500万Token
输出:100万Token

不考虑工具和搜索额外费用。

DeepSeek V4-Flash

输入:5 × 1元 = 5元
输出:1 × 2元 = 2元
总计:7元

GPT-5.6 Luna

按0.20美元输入、1.20美元输出计算:

输入:5 × 0.20美元 = 1美元
输出:1 × 1.20美元 = 1.20美元
总计:2.20美元

GPT-5.6 Terra

输入:5 × 2美元 = 10美元
输出:1 × 12美元 = 12美元
总计:22美元

GPT-5.6 Sol

输入:5 × 5美元 = 25美元
输出:1 × 30美元 = 30美元
总计:55美元

在大量输入和输出的Agent场景中,V4-Flash的价格优势会被进一步放大。

尤其是代码、搜索和办公Agent,一次用户任务可能包含几十次模型调用,单轮看起来不高的费用,会在工具循环中反复产生。

为什么Agent特别在意输出价格?

普通AI问答通常只输出几百个Token。

Agent任务可能需要模型持续输出:

思考过程
工具调用参数
代码修改
Shell命令
搜索关键词
文件补丁
错误分析
最终报告

一次复杂任务可能产生数万甚至数十万输出Token。

GPT-5.6 Sol输出价格为每百万Token 30美元,而DeepSeek V4-Flash的参考输出价格约为0.28美元,相差超过100倍。(openai.com) (artificialanalysis.ai)

这意味着,在任务成功率接近的情况下,DeepSeek更适合:

允许模型多轮尝试
批量运行自动化任务
为每名用户提供独立Agent
执行长时间代码任务
处理高频企业工作流
建立低价AI SaaS产品

不过,如果更强模型能明显减少失败、重试和人工修改,单价更高的模型仍可能拥有更低的综合成本。

DeepSeek速度真的超过GPT吗?

“速度”至少包含三个不同指标:

1. 首Token时间

用户提交请求后,多久看到第一个输出Token。

2. 持续输出速度

模型开始回答后,每秒生成多少个Token。

3. 完整任务耗时

从用户提交任务到获得最终可用结果,总共花费多少时间。

一款模型可能启动很快,但后续输出速度一般;也可能思考较久,但开始输出后速度很快。

因此,只说“模型速度更快”并不足够。

DeepSeek与GPT-5.6 Sol速度对比

Artificial Analysis对DeepSeek V4-Flash-0731 Max与GPT-5.6 Sol High进行了直接测试。

指标 DeepSeek V4-Flash Max GPT-5.6 Sol High
持续输出速度 约113 Token/s 约59 Token/s
首Token时间 约1.56秒 约9.77秒
上下文窗口 100万Token 100万Token

在这一组档位中,DeepSeek的输出速度接近GPT-5.6 Sol High的1.9倍,首Token等待时间也明显更短。(artificialanalysis.ai)

但GPT-5.6 Sol的定位是旗舰能力,而不是最低延迟模型。

OpenAI还提供Fast模式及Cerebras高速服务,GPT-5.6 Sol在特定高速基础设施上最高可达到约750 Token/s,但该服务最初只向部分客户开放,不能与普通标准API直接混为一谈。(openai.com)

DeepSeek与GPT-5.6 Terra速度接近

在DeepSeek V4-Flash Max与GPT-5.6 Terra High的对比中:

指标 DeepSeek V4-Flash Max GPT-5.6 Terra High
持续输出速度 约113 Token/s 约112 Token/s
首Token时间 约1.56秒 约2.20秒

两款模型的持续输出速度基本接近,DeepSeek首Token时间更短。(artificialanalysis.ai)

因此,对比Terra高推理档位时,可以说DeepSeek整体响应更快,但不能说两者持续生成速度存在数量级差距。

GPT-5.6 Luna持续输出速度更快

GPT-5.6 Luna是GPT-5.6系列中强调速度和低成本的版本。

Artificial Analysis测试显示:

指标 DeepSeek V4-Flash Max GPT-5.6 Luna Max
持续输出速度 约113 Token/s 约176 Token/s
首Token时间 约1.56秒 约128秒
上下文窗口 100万Token 100万Token

DeepSeek更早开始返回答案,但GPT-5.6 Luna一旦开始输出,持续生成速度更快。(artificialanalysis.ai)

在较低推理强度下,GPT-5.6 Luna的持续输出速度同样可达到约145 Token/s,高于DeepSeek V4-Flash Max的约113 Token/s。(artificialanalysis.ai)

所以,不能把“DeepSeek速度全面超过GPT”作为严谨结论。

更准确的说法是:

DeepSeek对GPT-5.6 Sol高推理档位更快
DeepSeek与GPT-5.6 Terra高推理档位接近
DeepSeek首Token通常较快
GPT-5.6 Luna的持续输出速度更高
GPT-5.6 Sol高速服务仍可能远快于普通DeepSeek API

为什么DeepSeek能够做到低价和较高速度?

V4-Flash的主要效率来源包括以下几方面。

130亿激活参数

虽然模型总参数达到2840亿,但每个Token只激活约130亿参数,减少单次推理计算。(api-docs.deepseek.com)

MoE稀疏路由

不同Token只调用部分专家,使模型不需要每次运行全部参数。

面向Agent的后训练

正式版重新进行Agent后训练,目标不仅是提高回答质量,也包括提高工具调用和任务完成效率。(api-docs.deepseek.com)

上下文硬盘缓存

DeepSeek API会自动缓存重复的上下文前缀。缓存命中时,输入价格从1元/百万Token降至0.02元,相当于降低98%。(api-docs.deepseek.com)

更高并发

V4-Flash提供2500并发限制,可以让服务商同时处理更多请求。(api-docs.deepseek.com)

100万Token上下文适合长程Agent

V4-Flash支持100万Token上下文和最多38.4万Token输出。

它可以容纳:

大型代码仓库
多份企业文档
大量网页搜索结果
较长的Agent执行历史
终端日志
API返回结果
多轮工具调用
长篇研究报告

(api-docs.deepseek.com)

但100万Token不代表应该一次提交所有文件。

合理的Agent系统仍需具备:

文件检索
上下文压缩
历史摘要
重复内容去除
缓存前缀保持
任务状态持久化
重要信息索引

否则,长上下文会增加费用、延迟和信息干扰。

原生支持Responses API

V4-Flash正式版原生支持OpenAI Responses API格式,并针对Codex完成适配。(api-docs.deepseek.com)

开发者可以继续使用OpenAI Python SDK:

from openai import OpenAI

client = OpenAI(
    api_key="<你的 DeepSeek API Key>",
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="你是一名企业软件开发Agent。",
    input="分析项目中的测试失败原因,并生成修复方案。",
)

print(response.output_text)

这种兼容方式降低了从OpenAI接口迁移到DeepSeek的工作量。

通常只需要修改:

API Key
Base URL
模型名称
部分不兼容参数

Responses API支持哪些能力?

DeepSeek当前支持的主要Responses API能力包括:

流式输出
Function Calling
服务端Web Search
apply_patch代码修改工具
Tool Choice
Reasoning Effort
结构化文本输出
并行工具调用
思考内容输出
Token用量统计

(api-docs.deepseek.com)

这些能力可以用于构建:

Codex类代码Agent
搜索Agent
企业自动化
研究助手
数据分析Agent
内容生产工作流
工具编排系统

DeepSeek Responses API并非完整兼容OpenAI

DeepSeek实现了Responses API的核心格式,但并未支持OpenAI接口的所有能力。

当前不支持或存在限制的项目包括:

previous_response_id
服务端Conversation
store
Background任务
Metadata
File Search
Code Interpreter
Computer Use
MCP内置工具
图片输入
文件输入
Prompt Cache Key
Context Management
Service Tier

(api-docs.deepseek.com)

DeepSeek当前的Responses API是无状态的。

开发者需要自己保存并回传:

历史消息
工具调用
工具结果
思考内容
任务状态

部分不支持的参数会被静默忽略,而不是直接报错。迁移后应逐项验证,不能只因为接口成功返回就认为全部功能已经生效。

DeepSeek目前不支持图片输入

V4-Flash当前是纯文本输入和文本输出模型。

Responses API中的图片或文件内容不会被正常理解,图片输入可能被替换成占位文本。(api-docs.deepseek.com)

这也是它与GPT-5.6的重要差别。

GPT-5.6支持视觉输入,并具备更完整的Responses API、计算机使用、程序化工具调用和多Agent能力。(openai.com)

因此,需要以下能力的应用不能只比较Token价格:

图片分析
UI截图理解
图表识别
计算机操作
完整文件工具
多模态Agent
OpenAI内置Code Interpreter
服务端长任务状态管理

正式版Agent成绩

DeepSeek公布的V4-Flash-0731主要Agent测试成绩包括:

测试项目 成绩
Terminal Bench 2.1 82.7
NL2Repo 54.2
CyberGym 76.7
DeepSWE 54.4
Toolathlon Verified 70.3
Agent Last Exam 25.2
Automation Bench Public 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

DeepSeek称,这些结果远超V4-Pro预览版。(api-docs.deepseek.com)

需要注意:

测试使用了DeepSeek Harness极简模式
推理强度设置为max
top_p=0.95
temperature=1.0
DSBench属于DeepSeek内部测试集

不同Agent框架和参数会明显影响最终成绩,因此不能只比较裸模型名称。

DeepSeek是否在综合性能上超过GPT-5.6?

不能根据当前资料得出这一结论。

GPT-5.6 Sol仍然是面向高难度代码、知识工作、科学、网络安全和复杂Agent任务的旗舰模型。OpenAI公布的Artificial Analysis Intelligence Index成绩显示,GPT-5.6 Sol明显高于DeepSeek V4-Flash。(openai.com) (artificialanalysis.ai)

DeepSeek的主要优势是:

价格极低
首Token速度较快
100万Token上下文
Agent专项能力较强
适配Codex
并发上限高
API迁移成本低

GPT-5.6系列的主要优势是:

更强的综合能力上限
原生视觉输入
更完整的工具生态
计算机使用
多Agent协同
服务端对话状态
更成熟的Responses API
Sol高速推理服务
Luna更高持续输出速度

所以,DeepSeek并不是在所有能力上替代GPT,而是在价格与部分Agent场景中提供了非常有竞争力的选择。

对AI商业化意味着什么?

V4-Flash把百万Token输出价格压到2元人民币后,很多过去成本较高的产品开始具备更现实的商业模型。

低价AI客服

企业可以允许Agent读取更长的历史记录、调用更多工具,而不必过度限制每轮输出。

AI编程工具

代码Agent可以进行更多次测试、修复和重试,减少因Token预算过低而提前停止任务。

自动研究与内容生成

搜索Agent可以读取更多资料并输出更完整的研究报告。

企业流程自动化

模型可以持续调用CRM、ERP、数据库和内部接口,完成多步骤业务流程。

个人AI产品

个人开发者不需要预先投入较高模型费用,也能测试具备长上下文和Agent能力的产品。

批量内容处理

适合文档分类、数据提取、信息整理、翻译和批量改写。

低价不等于总成本一定最低

模型调用费用只是AI产品成本的一部分。

一个正式Agent系统还需要支付:

搜索API
浏览器环境
沙箱服务器
数据库存储
向量检索
文件解析
工具调用
任务队列
日志与监控
人工审核
失败重试

如果模型更容易出现:

工具调用失败
长任务绕路
代码无法运行
搜索结果误判
需要多轮重试

那么节省的Token费用可能被额外执行成本抵消。

企业应重点计算:

单次成功任务总成本
=
模型费用
+
工具费用
+
计算资源
+
失败重试
+
人工审核

而不是只看每百万Token单价。

如何选择DeepSeek或GPT-5.6?

适合优先选择DeepSeek V4-Flash

成本敏感
主要处理中文和文本
需要100万Token上下文
高并发请求
代码和终端Agent
批量自动化
已有OpenAI兼容客户端
愿意自己管理会话状态
不依赖图片和计算机操作

适合选择GPT-5.6 Luna

需要较高持续输出速度
需要图片输入
希望使用OpenAI完整生态
任务复杂度中等
需要更成熟的Responses API

适合选择GPT-5.6 Terra

希望在能力、价格和速度之间平衡
需要多模态与完整工具能力
已经深度接入OpenAI平台

适合选择GPT-5.6 Sol

高难度专业任务
复杂软件工程
科学研究
网络安全
高价值企业决策
需要计算机使用和多Agent
任务成功率比模型单价更重要

推荐采用模型路由

实际产品不必只选择一个模型。

可以根据任务难度建立分层策略:

DeepSeek V4-Flash处理

普通问答
文档提取
批量分类
基础代码任务
搜索整理
常规Agent执行

GPT-5.6 Luna或Terra处理

图片理解
多模态办公
更高输出速度
需要OpenAI内置工具的任务

GPT-5.6 Sol处理

Flash连续失败的任务
复杂工程问题
高风险专业分析
多Agent长程任务
高价值最终审核

这种路由可以减少模型费用,同时保留高难度任务的能力上限。

DeepSeek即将采用峰谷定价

DeepSeek官方价格页面显示,未来API将引入峰谷定价。

高峰时段价格将调整为普通价格的2倍,时间为北京时间:

每日9:00—12:00
每日14:00—18:00

具体生效时间尚未正式公布。(api-docs.deepseek.com)

价格生效后,V4-Flash高峰期可能变为:

缓存命中输入:0.04元/百万Token
缓存未命中输入:2元/百万Token
输出:4元/百万Token

即使按高峰价计算,其价格仍然明显低于GPT-5.6 Terra和Sol。

企业可以将不需要实时完成的任务安排到非高峰时段,例如:

批量报告
数据清洗
夜间代码检查
每日资讯整理
知识库更新
离线内容生成

接入前需要注意什么?

不要继续使用旧模型名

deepseek-chatdeepseek-reasoner已经停止推荐使用,新项目应直接使用:

deepseek-v4-flash

(api-docs.deepseek.com)

自行保存Responses API状态

DeepSeek不支持previous_response_id,需要应用自行管理历史记录。

不要提交图片和文件

V4-Flash当前只能处理文本。

检查静默忽略的参数

部分OpenAI Responses API参数即使不支持,也不会报错。

限制Agent权限

文件删除、代码部署、付款和外部消息发送应保留人工确认。

测试实际业务成功率

不要只使用公开Benchmark,应使用自己的代码库、文档和工作流测试。

计算完整任务成本

同时记录模型Token、工具调用、重试和人工审核费用。

总结

DeepSeek-V4-Flash-0731已经正式上线API并开启公测。

模型保持2840亿总参数、130亿激活参数的MoE架构,支持100万Token上下文和最长38.4万Token输出。本次更新没有增加参数,而是通过重新后训练明显强化Agent、终端、代码仓库和工具调用能力。(api-docs.deepseek.com)

价格方面,DeepSeek V4-Flash官方定价为:

输入缓存命中:0.02元/百万Token
输入缓存未命中:1元/百万Token
输出:2元/百万Token

这一价格明显低于GPT-5.6 Luna、Terra和Sol,尤其是输出价格相比GPT-5.6 Sol低约99%。(api-docs.deepseek.com) (openai.com)

速度方面,DeepSeek V4-Flash在第三方测试中:

比GPT-5.6 Sol High输出更快
与GPT-5.6 Terra High基本接近
首Token时间通常较短
持续输出速度低于GPT-5.6 Luna
也低于GPT-5.6 Sol的特定高速服务

(artificialanalysis.ai) (artificialanalysis.ai)

因此,“价格全面低于GPT-5.6”有数据支持,但“速度全面碾压GPT”并不成立。

V4-Flash真正带来的变化,是让100万Token上下文、长程Agent和高频工具调用进入一个更低的价格区间。

对于主要处理文本、代码、搜索和企业自动化的开发者而言,它可能成为成本非常有竞争力的基础模型;对于图片理解、计算机操作、多Agent和高难度专业任务,GPT-5.6系列仍然拥有更完整的能力与生态。

AI商业化的门槛确实在下降,但未来真正决定产品竞争力的,不只是每百万Token多少钱,而是:

用多少成本,能够稳定完成多少真实任务。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...