模型与路由DeepSeek2026/06/307 分钟

DeepSeek 突然提速 80%:这次不是新模型,而是把推理成本打穿了

这两天 DeepSeek 又刷了一波屏。

DeepSeek DSpark 微信封面

这两天 DeepSeek 又刷了一波屏。

但这次最值得看的,不是“DeepSeek-V4 又变强了”这种熟悉叙事,而是另一件更工程化、也更现实的事:DeepSeek 把一套叫 DSpark 的推理加速方案,放进了 DeepSeek-V4 的线上服务里。

换句话说,它不是重新训练了一个更大的模型,也不是丢出一张更漂亮的 benchmark 图,而是在回答一个更接近商业化的问题:

当模型能力开始接近,谁能让用户更快拿到同等质量的答案?

这件事不花哨,但很关键。因为到了 2026 年,大模型竞争已经不只是在比“谁的模型更聪明”。真实线上系统里,用户感受到的是首 token 等多久、长回答是不是卡、并发高的时候会不会排队、API 调用成本能不能继续往下压。

DSpark 站的就是这个位置。

DSpark 推测解码流程

先纠正一个误会:这不是 DeepSeek-V4 新模型

网上很多标题会写成“DeepSeek V4 上线 DSpark”或者“DeepSeek V4 推理速度提升 80%”。这个说法容易让人误会,以为 DeepSeek 又发了一个新底座模型。

更准确的说法是:DeepSeek 在 DeepSeek-V4 的线上推理链路里,加了一套 speculative decoding 模块。

官方 Hugging Face 页面里,对 DeepSeek-V4-Pro-DSpark 的描述也很直接:它使用的是同一个 DeepSeek-V4-0324 checkpoint,再额外叠加一个 DSpark speculative decoding module。也就是说,主模型还是 DeepSeek-V4,DSpark 解决的是生成阶段怎么更快往前走。

这点很重要。

如果是新模型发布,我们关心的是参数、训练数据、能力边界、评测结果。如果是推理系统升级,我们关心的就变成另一组问题:它怎么加速?会不会影响回答质量?能不能规模化部署?别人能不能复现?成本结构会不会被改写?

DSpark 更接近后者。

DSpark 到底是什么

用一句话解释:

DSpark 是 DeepSeek 为 DeepSeek-V4 设计的一套 speculative decoding 方案,用来在尽量不改变回答质量的前提下,提高线上生成速度。

speculative decoding 一般翻译成“推测解码”。它的核心思路并不复杂:

  1. 先让一个更小、更快的 draft model 猜后面几个 token。
  2. 再让真正负责质量的 target model 批量验证这些 token。
  3. 如果猜得准,就不用一个 token 一个 token 慢慢生成,而是一次接受多个 token。
  4. 如果猜错了,目标模型拒绝错误部分,回到正常生成路径。

你可以把它理解成写文章时的“输入法联想”,但验证人不是用户,而是原来的大模型自己。小模型负责抢跑,大模型负责把关。

这里最关键的不是 draft model 要有多强,而是它要在目标模型的分布附近猜得足够准。猜得准,速度就上去;猜得不准,反而会浪费验证开销。所以 speculative decoding 真正难的地方,不是想出这个概念,而是训练一个适合当前目标模型、当前线上场景、当前硬件栈的 draft model。

DSpark 的价值就在这里:它不是一个玩具 demo,而是被放到了 DeepSeek-V4 的线上流量里。

它能带来什么

从用户角度看,最直接的收益是:同样的问题,回答生成得更快。

根据 DeepSeek 论文和官方仓库说明里披露的口径,相比之前的 MTP-1 基线,在同等吞吐下,V4-Flash 的用户生成速度提升约 60% 到 85%,V4-Pro 提升约 57% 到 78%。所以“提升约 80%”不是凭空来的,但更准确的写法应该是一个区间,而不是所有场景固定 80%。

这类提升对普通用户意味着什么?

场景速度提升带来的变化
日常聊天长回答更顺,等待感降低
编程/写作多轮迭代更快,工具使用节奏更接近实时协作
API 调用同等硬件吞吐下,单位请求成本有下降空间
高峰流量排队压力变小,服务稳定性更好
Agent 应用多步调用链的总耗时更容易被压下来

这里尤其要注意 Agent 场景。

如果一个普通聊天请求只生成一次,速度提升 60% 到 80% 已经很明显。但 Agent 往往不是一次生成,而是“思考、调工具、读结果、再思考、再调工具”的链路。链路越长,每一轮生成速度的收益越容易累积。

所以 DSpark 不只是让聊天窗口更快一点,它可能会影响 AI 应用的整体交互形态。过去一些 Agent 产品让人觉得慢,不一定是模型不聪明,而是每一轮生成、工具调用和排队时间叠起来以后,体验已经被拖垮了。

推理速度一旦继续下降,很多原本“理论上可用,但体验太慢”的应用,会重新变得可做。

DeepSpec 开源,为什么也值得看

这次另一个值得看的动作,是 DeepSeek 开源了 DeepSpec

DeepSpec 不是一个“跑起来看看效果”的普通 demo,而是一套围绕 speculative decoding draft model 的训练和评估代码库。官方仓库介绍里提到,它覆盖数据准备、训练和评测流程,并支持 DSparkDFlashEagle3 等方法。

这其实透露了 DeepSeek 的一个重点:它不只是说“我们线上变快了”,还把一部分推理加速的基础设施路线摊开了。

但普通开发者也别急着冲。

官方 README 里提到,在默认 Qwen3-4B 配置下,target cache 可能接近 38TB;训练脚本也默认按单机 8 卡来设计。这意味着 DeepSpec 更像是给研究者、推理服务团队、云厂商和大模型平台工程师看的工具,而不是给个人开发者本地跑一下就能复刻线上效果的轻量项目。

这也说明了一个现实:推理优化已经不是“写几行 prompt”能解决的问题。它会牵涉模型结构、训练数据、KV cache、GPU 内存、调度、吞吐、延迟和线上质量回归。

越往后,大模型竞争越像系统工程。

为什么这件事比普通 benchmark 更值得看

大模型行业过去很喜欢发榜。

发榜当然有价值。没有 benchmark,大家很难快速对齐模型能力。但 benchmark 的问题是,它离用户感知还有一段距离。一个模型在某个榜上高 1 分,普通用户不一定能明显感受到;但回答从慢吞吞变成顺滑,用户马上知道。

DSpark 这类推理加速,卷的是更底层的体验指标:

指标用户是否能感知
首 token 延迟能,尤其是聊天和搜索类产品
tokens/s能,长回答、代码生成、报告生成最明显
排队时间能,高峰期尤其明显
单位 token 成本用户未必直接看见,但会影响价格和产品形态
同等硬件吞吐平台方非常敏感,决定毛利和扩容压力

所以我的判断是,DeepSeek 这次真正想展示的不是“我又有一个新模型了”,而是“我能继续把线上推理这件事压榨出效率”。

这是一种不太适合做发布会标题、但非常适合做长期竞争力的能力。

对其他厂商有什么影响

第一类受影响的是模型服务商。

如果 DeepSeek 可以在不明显牺牲质量的情况下,把线上生成速度拉高 60% 到 80%,那其他模型服务商就很难只拿“模型能力不错”来讲故事。用户会开始比较:同样是写代码、总结文档、跑 Agent,为什么有的模型明显更顺,有的模型明显更拖?

这会把竞争从“模型榜单”继续推向“线上服务效率”。

第二类是闭源大厂。

闭源厂商当然也能做 speculative decoding,而且不少团队早就在做。但 DeepSeek 把 DeepSpec 这种训练/评测框架开源,会抬高行业透明度。过去很多推理优化是黑盒能力,现在开源社区能看到更多方法、配置和评测思路。闭源厂商仍然有工程规模和硬件调度优势,但不能再只靠“我们内部很强”来维持叙事。

第三类是云厂商和推理平台。

对云厂商来说,DSpark 这种方案本质上是在提高 GPU 利用效率。能在同等吞吐下提升用户侧生成速度,或者在同等体验下减少硬件压力,都会影响推理服务的价格战。未来云厂商卖的可能不只是“我有多少卡”,而是“我能把这些卡调度到多高效率”。

第四类是应用开发者。

应用开发者短期内不一定会自己训练 draft model,但会直接享受推理服务变快、价格下降、上下文和多轮调用更可用的结果。尤其是 AI IDE、浏览器 Agent、数据分析 Agent、企业知识库、客服机器人这类产品,体验瓶颈经常不是单次回答质量,而是端到端等待时间。

当底层速度继续提升,上层产品可以更大胆地设计多步流程。

但也别过度解读

DSpark 值得看,但它不是魔法。

第一,推测解码的收益依赖场景。draft model 猜得越准,收益越明显;如果任务分布变化大、答案更开放、token 预测更难,收益可能会下降。

第二,它不等于模型能力提升。DSpark 加速的是生成过程,不是让 DeepSeek-V4 突然学会更多知识、推理更强或减少幻觉。回答质量仍然主要由 target model 决定。

第三,它对工程能力要求很高。38TB target cache、8 卡训练配置这些数字,已经说明这不是普通开发者本地微调级别的项目。真正把 speculative decoding 稳定放到线上,需要大量评测和回归,尤其要防止速度提升换来质量波动。

所以这件事应该被看成推理基础设施升级,而不是模型能力神话。

最后说一句

过去一年,大家看大模型新闻,最容易被新模型、新参数、新榜单吸引。但越往后,真正决定产品体验的,可能越来越是那些不显眼的工程能力:推理加速、缓存调度、并发管理、质量回归、成本控制。

DSpark 的信号就在这里。

DeepSeek 这次不是在说“我又做了一个更大的模型”,而是在说“同一个模型,我还能让它在线上跑得更快、更便宜、更像一个可规模化产品”。

这对行业的影响也很明确:模型能力仍然重要,但推理效率会成为新的硬指标。谁能把同等质量的答案更快、更稳、更低成本地送到用户面前,谁就在下一阶段的大模型竞争里多了一块真正可感知的优势。


参考说明: