跳至正文

DeepSeek-V4-Flash(大家俗称的 V4 正式版)现已发布 API 正式公测

DeepSeek V4 Pro

市面上说的「V4 正式版」= V4-Flash 正式版,下面对比 V4-Flash 正式版 ↔ V4-Pro(预览版,等待正式版)

一、核心参数对比表

表格

对比项目DeepSeek-V4-Flash(正式版,当前可用)DeepSeek-V4-Pro(仅预览版,正式版未出)
模型全称DeepSeek-V4-Flash-0731DeepSeek-V4-Pro Preview
总参数量284B(2840 亿 MoE)1.6T(1.6 万亿 MoE)
激活参数13B49B
上下文窗口1,000,000 tokens1,000,000 tokens
最大输出长度384K tokens384K tokens
推理模式思考模式 / 非思考模式;支持reasoning_effort思考模式 / 非思考模式;支持reasoning_effort
API 定价(人民币)输入:1 元 / 百万 token输出:2 元 / 百万 token输入:12 元 / 百万 token输出:24 元 / 百万 token
推理速度更快、更高并发、更低延迟速度偏慢,算力开销更大

二、能力差异(官方定义)

DeepSeek-V4-Flash(正式版)

优势

  1. 性价比极高、吞吐高,适合大规模并发调用
  2. 日常问答、文档摘要、常规 RAG、简单工具调用表现优秀
  3. 本次 0731 正式版重点优化 Agent、代码智能体(Harness 框架)

⚠️ 短板

  • 高难度多步推理、复杂数理、大型系统架构设计、深度专业知识弱于 Pro
  • 超长文档多层逻辑拆解、复杂链式 Agent 任务上限更低

官方结论:简单 Agent 任务成绩接近 Pro;极限复杂任务明显拉开差距

DeepSeek-V4-Pro(旗舰,等待正式版)

优势

  1. 世界知识储备、数理推理、竞赛级代码、复杂长文本逻辑理解全系更强
  2. 高难度 SWE 全栈开发、多层工具调用、复杂科研分析、法律 / 金融深度文档审阅首选
  3. 开源模型 Agent 编码基准 SOTA 水平,对标国际顶级闭源模型

⚠️ 短板 价格贵 3 倍以上;单条请求显存占用更高、并发上限更低。

三、通俗一句话区分

  • V4-Flash 正式版(现在能直接调用):主力通用模型,绝大多数日常业务、内容生产、批量文档处理优先选它;成本极低,性能足够应对 80% 场景。
  • V4-Pro(尚未正式发布):旗舰顶配,只留给最难的任务:复杂算法设计、多轮深度 Agent、硬核数理、百万字长文档多层逻辑分析。

四、实用选型建议

  1. 大批量、高 QPS、预算有限、普通对话 / 总结 / 常规代码V4-Flash
  2. 关键业务、系统架构设计、复杂数学、多层工具调用、高价值文档深度分析 → 等待 V4-Pro 正式版
  3. 混合架构方案(推荐): 默认路由使用 V4-Flash;通过规则识别高复杂度任务,动态切换至 V4-Pro。

补充关键信息

V4-Flash 正式版只是在后训练上做增强,模型骨架、参数量和 Preview 版本一致,没有改动基础架构;未来 V4-Pro 正式版大概率同样保持现有参数规模,仅对齐 Flash 完成后训练优化。

DeepSeek V4 API 可直接复制调用模板

基础信息

  • BaseURL:https://api.deepseek.com
  • API 鉴权:Authorization: Bearer ${API_KEY}
  • 模型标识
    • V4-Flash(当前正式公测版):deepseek-v4-flash
    • V4-Pro(预览版,正式版预计 8 月初上线):deepseek-v4-pro

总上下文上限 1M tokens,单次最大输出 384K tokens

一、通用参数规范说明

表格

参数可选值使用场景建议
thinking.typeenabled / disabledenabled = 开启思维链;disabled = 快速直出,节省 token
reasoning_efforthigh / max仅思考模式生效;普通任务 high,复杂 Agent / 数理用 max
temperature0 ~ 1.5代码 / 严谨分析:0;创作文案:0.7~1.0
streamtrue/false流式输出开启 true

1)V4-Flash 正式版模板(推荐主力)

① 普通业务、RAG、文档总结|非思考模式(低成本、高速)

curl https://api.deepseek.com/v1/chat/completions \
-H "Authorization: Bearer sk-xxxx" \
-H "Content-Type: application/json" \
-d '{
    "model": "deepseek-v4-flash",
    "messages": [
        {"role":"system","content":"你是专业助手,回答简洁准确"},
        {"role":"user","content":"你的问题"}
    ],
    "temperature": 0.7,
    "max_tokens": 8192,
    "stream": false,
    "extra_body": {
        "thinking": {"type": "disabled"}
    }
}'

② Agent、代码、复杂文档推理|开启思考模式

curl https://api.deepseek.com/v1/chat/completions \
-H "Authorization: Bearer sk-xxxx" \
-H "Content-Type: application/json" \
-d '{
    "model": "deepseek-v4-flash",
    "messages": [
        {"role":"system","content":"专业编程与智能体助手"},
        {"role":"user","content":"你的复杂任务"}
    ],
    "temperature": 0.3,
    "max_tokens": 16384,
    "stream": true,
    "extra_body": {
        "thinking": {"type": "enabled"},
        "reasoning_effort": "max"
    }
}'

2)V4-Pro(预览版,复杂高价值任务)

价格更高,适合竞赛数学、系统架构、百万字深度审阅、多层嵌套工具调用

curl https://api.deepseek.com/v1/chat/completions \
-H "Authorization: Bearer sk-xxxx" \
-H "Content-Type: application/json" \
-d '{
    "model": "deepseek-v4-pro",
    "messages": [
        {"role":"system","content":"顶级专家,严谨深度推理"},
        {"role":"user","content":"高难度分析任务"}
    ],
    "temperature": 0.2,
    "max_tokens": 32768,
    "stream": true,
    "extra_body": {
        "thinking": {"type": "enabled"},
        "reasoning_effort": "max"
    }
}'

Python OpenAI SDK 通用封装模板

from openai import OpenAI

client = OpenAI(
    api_key="sk-xxxx",
    base_url="https://api.deepseek.com"
)

def call_v4_flash(prompt, think=True):
    resp = client.chat.completions.create(
        model="deepseek-v4-flash",
        messages=[{"role":"user","content":prompt}],
        temperature=0.6,
        max_tokens=8192,
        extra_body={
            "thinking": {"type": "enabled" if think else "disabled"},
            "reasoning_effort": "max" if think else None
        }
    )
    # 思维链内容 resp.choices[0].message.reasoning_content
    # 最终回答 resp.choices[0].message.content
    return resp

def call_v4_pro(prompt):
    resp = client.chat.completions.create(
        model="deepseek-v4-pro",
        messages=[{"role":"user","content":prompt}],
        temperature=0.2,
        max_tokens=16384,
        extra_body={
            "thinking": {"type": "enabled"},
            "reasoning_effort": "max"
        }
    )
    return resp

工程选型最佳实践

  1. 绝大多数请求 → V4-Flash,日常场景thinking: disabled降低开销;智能体 / 代码启用思考模式
  2. 关键高价值请求(算法设计、法律文书深度审查、复杂多轮 Agent)→ 路由切换 V4-Pro
  3. 限流提示:V4-Pro 并发上限显著低于 Flash,不要全量切 Pro,成本与延迟会明显上升

重要提醒

  • 当前deepseek-v4-flash自动路由至 0731 正式版,无需修改 model 名称
  • V4-Pro 正式版发布后,model 名称保持不变,仅后端模型权重升级
  • Responses API 目前仅支持deepseek-v4-flash,暂不支持 Pro
👀 阅读量:1004
标签:

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

分享
扫码分享

扫码分享本文

//这里粘贴百度统计完整script代码