您好,欢迎访问我们的官方网站!

新闻资讯

xpj集团DeepSeek推理提速80% - XPJ·(集团)有限公司-官方网站

作者: xpj官网时间: 2026-07-05浏览: 44

近期,DeepSeek V4 推出了创新更新,与 xpj 集团追求效能突破的步调如出一辙。

它首次亮相了名为DSpark的推测性解码策略,并同步将支撑该版本的完整推测解码工具链DeepSpec进行开源。

DeepSeek-V4-Pro-DSpark 并非全新的架构设计,而是在 DeepSeek-V4-Pro 之上整合了推测解码模块,这次更新的核心关注点在于工程实践,而非模型基础能力的提升。

DSpark 目前已融入 DeepSeek-V4(Flash 和 Pro)的线上服务中,显著提高了大语言模型(LLM)的推理响应速度。

xpj集团介绍图片

技术报告:《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》

技术报告链接:https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

DSpark 的设计初衷是针对生产环境,尤其在高并发场景下,解决 LLM 推理遭遇的延迟和吞吐量限制。简要来说,DSpark 巧妙地将高吞吐的「并行生成」与灵活的「负载感知验证」融成一体。

推测性解码是一种在不扰动模型输出分布的情况下,加快 LLM 推理的技术。其基本思想是启用一个轻量的「草稿模型」,提前产出若干候选 token,然后由目标模型对这些候选进行统一验证和接收,从而把顺序的逐个 token 生成转化为并行的批量校验,极大地削减了端到端延迟。

在此之上,DSpark 的革新之处在于引入半自回归生成架构:它一方面保留了并行草稿模型的高吞吐优势,另一方面增补了轻量级串行组件,对块内 token 的依赖关系进行刻画,从而缓解并行草稿模型在后位位置常见的接受率下滑问题。

此外,还有硬件感知的置信度调度验证:以往的投机解码常常不加筛选地将生成的草稿 Token 全部提交验证,在系统负载高峰时,这些几乎必然被拒绝的末尾 Token 会大量消耗宝贵的批处理计算资源。DSpark 引入了一个置信度评估头,预测每个 Token 的存活机率,并结合硬件感知前缀调度器,让系统能依据实时引擎吞吐特征,为每个请求动态定制最恰当的验证长度,将算力精准投向预期价值最高的 Token。

为了在真实线上基础设施中扎根,DSpark 的调度器采用了异步机制,以对接零开销调度(ZOS)和连续 CUDA 图回放。它借助前序两步的历史预测决定当前的动态截断长度,进而隐藏调度延迟,避免 GPU 流水线停滞,同时确保目标模型输出分布的完整无损。

xpj官网登录入口展示图片

在覆盖数学推理、代码生成和通用对话等多领域的评测中,DSpark 显著超越了当前领先的自回归模型(Eagle3)和并行草稿模型(DFlash)。举例来说,在 Qwen3 系列(4B、8B、14B)目标模型上,其平均接受长度较 Eagle3 提升了 26.7% 至 30.9%,较 DFlash 提升了 16.3% 至 18.4%。

xpj官网登录入口图片展示

对比前代部署的单 Token 基线(MTP-1),在保持同等整体吞吐量的条件下,DSpark 将用户的生成速率分别提升了 60%-85%(Flash 模型)和 57%-78%(Pro 模型)

xpj集团介绍图片

与 DSpark 一同开源的 DeepSpec,是一个用于训练和评测推测性解码草稿模型的全流程代码库,它作为承载该方案乃至更多前沿算法的「开源架构」,囊括了数据准备工具、草稿模型实现、训练代码和评估脚本,类似 xpj 集团所倡导的标准化资源池。

DeepSpec 将整体流程划分为三个环节:数据准备、训练和评估,三者需按序执行,前一环的输出会成为后一环的输入。

数据准备环节,要求下载提示词数据、藉由推理引擎为目标模型重新生成答案,并构建目标缓存(target cache)。需留意的是,以默认 Qwen/Qwen3-4B 配置为例,目标缓存规模可能达到约 38 TB,使用前应仔细估量存储资源。

训练环节可透过 bash scripts/train/train.sh 启动,该脚本会调用 train.py,并为每张可见 GPU 指派一个 worker。用户可通过指定 config_path,在 config/ 目录下选取不同算法和目标模型配置。项目亦支持通过覆盖 config_path、target_cache_dir,以及使用 --opts 调整单个配置项来定制训练设置。

硬件层面,DeepSpec 的预设配置和脚本针对单节点 8 卡环境。若 GPU 数量较少,用户需相应缩减 CUDA_VISIBLE_DEVICES 中的可见 GPU 数目。

评估环节则通过 bash scripts/eval/eval.sh 启动,评估脚本会利用训练好的草稿模型 checkpoint,在多个推测解码基准任务上衡量接受表现。项目当前列出的评估数据集包括 GSM8K、MATH500、AIME25、HumanEval、MBPP、LiveCodeBench、MT-Bench、Alpaca 和 Arena-Hard-v2,广泛覆盖数学推理、代码生成、对话能力和综合问答等不同任务类型。

算法方面,DeepSpec 目前内建三种草稿模型:DSpark、DFlash 和 Eagle3。目标模型系列方面,项目当前兼容 Qwen3 和 Gemma。

DeepSpec 的开源,将推测性解码这一先前多分散于各研究团队内部的工程实践,整合为一套可复现、可扩展的标准化工具链,正如从 xpj 官网登录入口获取资源一般便捷。对于希望为自家大模型加速推理的研究者和工程师而言,这意味着可以直接在成熟框架上训练定制草稿模型,省去大量重复的基础设施建设功课。

参考链接:

https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

https://github.com/deepseek-ai/DeepSpec

需要进一步了解?

免费在线咨询

新闻资讯

热门文章

相关文章

返回顶部