# DeepSeek V4 Pro 0813 正式发布，但更新日志去哪了？

**Summary:** OpenRouter 已将 DeepSeek V4 Pro 0813 列为正式版，但未提供公开的变更日志或新的评估包；建议先固定新模型 ID，并在迁移生产流量前重新测试 API 合约。

- Canonical: https://markhuang.ai/zh/news/deepseek-v4-pro-0813-ga-missing-diff
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-08-12
- Section: News
- Tags: DeepSeek, AI 模型, 模型评估, API 迁移, 开发者工具
- Source: [OpenRouter](https://openrouter.ai/deepseek/deepseek-v4-pro-0813)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个深色计算模块从测试舱穿越到明亮的生产区，旁边是空置的检查托盘](https://cdn.markhuang.ai/news/deepseek-v4-pro-0813-ga-missing-diff/hero.webp)

*生产标签能打开大门，却填不上缺失的测试记录。*

[OpenRouter 现已将 DeepSeek V4 Pro 0813](https://openrouter.ai/deepseek/deepseek-v4-pro-0813) 列为 V4 Pro 的正式发布版本，日期标注为 2026 年 8 月 12 日。页面标价：每百万输入 Token 0.435 美元，每百万输出 Token 0.87 美元，上下文窗口 1,048,576 Token，最大输出 384,000 Token。

但具体改了什么，页面上没说。没有变更日志，没有新模型卡，也没有评估报告。在我看来，0813 更像是一次迁移节点，而不是能力升级。我会先锁定这个带日期的模型 ID，跟之前的 V4 Pro 并行跑一阵，再用自己业务的工作负载做对比，决定要不要把生产流量切过去。

## GA 告诉我模型在哪，没告诉我改了什么

GA 本身是有价值的产品信息。它把带日期的构建版本和预览版区分开，给团队一个稳定的名称去做评估。DeepSeek 的[官方定价页面](https://api-docs.deepseek.com/quick_start/pricing)已经把 `deepseek-v4-pro` 映射到 `DeepSeek-V4-Pro-0813`，确认了百万 Token 的上下文上限，输入输出价格和 OpenRouter 一致。

但这只能证明端点确实存在。权重改没改？后训练调没调？工具调用有没有优化？已知的翻车场景有没有修？发布时的公开材料一条都没回答。我没法据此说 0813 更聪明、更安全、更快或更可靠。目前我把它当作一次状态变更，技术层面的差异还没公开。

便宜模型不需要论文背书才值得试。这个价位，评估成本很低。测试门槛确实降了，但 GA 标签替代不了实际测量。

## API 接口是我们仅有的证据

OpenRouter 的列表把 0813 描述为纯文本模型，支持工具调用、可选推理强度以及 `response_format`。FAQ 里有一条重要边界：支持 JSON 输出，但不强制校验 JSON Schema。这种细节最容易在迁移时踩坑。如果你的工作流依赖严格的结构化输出，就得自己加验证器和重试逻辑。

上下文和输出上限也要冷静看待。1,048,576 Token 的窗口只是容量，不代表埋在中间的事实一定能被可靠检索。384,000 Token 的输出上限只是天花板，不是合理的输出预算。长提示会推高延迟和成本，长输出会增加验证负担。我会拿产品实际用到的长度去测，而不是为能接受的最大请求欢呼。

> **Info:**
>
> 换带日期的模型时，我会先冻结提示词、工具、提供商路由、推理级别和验收标准。然后拿两个版本跑同一批已通过的任务，比成本、延迟、Schema 失败率、工具调用错误，再看旧版本本来跑对的用例有没有退步。

## 四月的证据不能自动套用到八月

早前的 V4 Pro 有大量公开记录。Hugging Face [四月发的技术解读](https://github.com/huggingface/blog/blob/main/deepseekv4.md)写得很清楚：混合专家架构，总参数 1.6 万亿，激活参数 490 亿，百万 Token 上下文窗口，还详细讲了长上下文效率的设计思路。但这些材料无法告诉我们 0813 到底改了哪些内部实现——如果改了的话。

四月的跑分也得贴上日期标签。[美联社报道过 DeepSeek 对 V4 推理和智能体性能的说法](https://apnews.com/article/deepseek-ai-china-gpt-v4-d2ed33f2521917193616e061674d5f92)，同时引用了分析师的警告：还需要独立评估。我最近[分析 V4 Flash 的 ARC-AGI-2 验证结果](/news/deepseek-v4-flash-four-cent-score)时也得出过类似结论——换了一个模型、换了一个基准，道理一样：跑分好看只说明值得拿真实业务去测，不代表可以直接设成默认智能体。

社区对 0813 的反应已经跑到了文档前面。Reddit 上有个[发布当天的讨论帖](https://www.reddit.com/r/DeepSeek/comments/1vmh3gd/deepseek_v4_pro_ga_is_rolling_out/)，有人确认了定价页更新和 API 可用，也有人追问为什么缺测试框架，还有人提醒最初的消息来自泄露。我不会拿那个帖子当性能证据，但它恰好反映了这次发布说明本该回答却没回答的那些问题。

## 测迁移，别测传说

我会拿真实、边界清晰的任务做影子对比。旧版和 0813 挂在同一个测试框架后面，喂同样的用例，按最终结果打分，而不是看推理过程写得有多流畅。智能体测试要覆盖多步工具调用链和故意制造的工具失败。结构化抽取测试要把无效 JSON 和业务规则错误分开统计。长上下文测试要把关键信息分散放在不同位置，别只用一个友好的提示。

对比期间，提供商路由不要动。OpenRouter 目前只给 0813 提供了一个 DeepSeek 官方端点，所以我看到的延迟和可用性都属于这个模型加提供商的组合。如果之后接入更多提供商，路由变化可能影响结果，模型名字却没变。

如果 0813 扛住了这些测试，Token 单价低、上下文够长，迁移理由很充分。扛不住的话，继续用旧版。现阶段，0813 应该在评估环境里待着，而不是直接自动上线。
