当前位置：首页 > news >正文

DeepSeek专题：DeepSeek-V2核心知识点速览

news 2025/7/2 11:20:54

AIGCmagic社区知识星球是国内首个以AIGC全栈技术与商业变现为主线的学习交流平台，涉及AI绘画、AI视频、大模型、AI多模态、数字人以及全行业AIGC赋能等100+应用方向。星球内部包含海量学习资源、专业问答、前沿资讯、内推招聘、AI课程、AIGC模型、AIGC数据集和源码等干货。

截至目前，星球内已经累积了2000+AICG时代的前沿技术、干货资源以及学习资源；涵盖了600+AIGC行业商业变现的落地实操与精华报告；完整构建了以AI绘画、AI视频、大模型、AI多模态以及数字人为核心的AIGC时代五大技术方向架构，其中包含近500万字完整的AIGC学习资源与实践经验。

论文题目：《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》

发表时间：2024年5月

论文地址：https://arxiv.org/pdf/2405.04434v5

本文作者：魔方AI空间公众号主理人猫先生

在2024年5月前后的时间，大语言模型（LLMs）的快速发展，展示了人工智能（AGI）的曙光。然而，随着参数量的增加，模型的智能提升带来了更大的计算资源需求和推理吞吐量的潜在下降，限制了LLMs的广泛应用。

本项目主要目标是解决LLMs在训练和推理过程中资源消耗大的问题，通过创新架构（包括多头潜在注意力（MLA）和DeepSeekMoE）实现经济高效的训练和高效的推理。

图1｜(a) 不同开源模型下多模态语言模型（MMLU）准确率与激活参数的关系。(b) DeepSeek 67B（密集型）和DeepSeek-V2的训练成本与推理效率。

图1｜(a) 不同开源模型下多模态语言模型（MMLU）准确率与激活参数的关系。(b) DeepSeek 67B（密集型）和DeepSeek-V2的训练成本与推理效率。

方法概述

DeepSeek-V2，一种强大的MoE语言模型，通过创新的架构实现了经济和高效的训练和推理。

图2 | DeepSeek-V2架构示意图。MLA通过显著减少生成所需的KV缓存来确保高效推理，而DeepSeekMoE则通过稀疏架构以经济成本训练出强大的模型。

图2 | DeepSeek-V2架构示意图。MLA通过显著减少生成所需的KV缓存来确保高效推理，而DeepSeekMoE则通过稀疏架构以经济成本训练出强大的模型。

多头潜在注意力（MLA）

一种新的注意力机制，通过低秩键值联合压缩来显著减少推理时的键值缓存，从而提高推理效率。MLA的计算过程如下：

标准多头注意力（MHA）首先通过三个矩阵计算查询（q）、键（k）和值（v）：

然后，将q、k、v切片成多个头进行多头注意力计算：

最后，通过softmax函数计算权重并进行加权和：

MLA通过低秩联合压缩键值对：

图3 | 多头注意力（MHA）、分组查询注意力（GQA）、多查询注意力（MQA）和多头潜在注意力（MLA）的简化示意图。通过将键和值联合压缩成一个潜在向量，MLA在推理过程中显著减少了KV缓存

图3 | 多头注意力（MHA）、分组查询注意力（GQA）、多查询注意力（MQA）和多头潜在注意力（MLA）的简化示意图。通过将键和值联合压缩成一个潜在向量，MLA在推理过程中显著减少了KV缓存

DeepSeekMoE

通过细粒度的专家分割和共享专家隔离来实现更高效的模型训练。DeepSeekMoE的基本思想是将专家分割成更细的粒度以提高专家的专业化，并通过隔离一些共享专家来缓解路由专家之间的知识冗余。具体计算过程如下：

对于每个token，计算其FFN输出：

通过设备限制路由机制来控制MoE相关的通信成本，确保每个token的专家分布在最多M个设备上。
设计了三种辅助损失来控制专家级负载平衡、设备级负载平衡和通信平衡。
采用设备级token丢弃策略来进一步缓解计算浪费。

技术交流

加入「AIGCmagic社区」，一起交流讨论，涉及AI视频、AI绘画、数字人、多模态、大模型、传统深度学习、自动驾驶等多个不同方向，可私信或添加微信号：【lzz9527288】，备注不同方向邀请入群！

更多精彩内容，尽在「AIGCmagic社区」，关注了解全栈式AIGC内容！

DeepSeek专题：DeepSeek-V2核心知识点速览

方法概述

多头潜在注意力（MLA）

DeepSeekMoE

推荐阅读

技术交流

相关文章：

DeepSeek专题：DeepSeek-V2核心知识点速览

Oracle19c进入EM Express（Oracle企业管理器）详细步骤

游戏引擎学习第140天

C++--迭代器（iterator）介绍---主要介绍vector和string中的迭代器

RuleOS：区块链开发的“新引擎”，点燃Web3创新之火

机器学习之强化学习

基于 uni-app 和 Vue3 开发的汉字书写练习应用

每天五分钟深度学习PyTorch：向更深的卷积神经网络挑战的ResNet

electron + vue3 + vite 主进程到渲染进程的单向通信

《白帽子讲 Web 安全》之身份认证

postgrel

Java基础——java8+新特性——方法引用(::)

基于SpringBoot的商城管理系统（源码+部署教程）

uniapp实现的个人中心页面（仿小红书）

K8s面试题总结（十一）

用CMake编译glfw进行OpenGL配置，在Visual Studio上运行

仿12306项目（4）

【GPT入门】第9课思维树概念与原理

uniapp登录用户名在其他页面都能响应

一周热点-OpenAI 推出了 GPT-4.5，这可能是其最后一个非推理模型

浅谈 React Hooks

ssc377d修改flash分区大小

使用van-uploader 的UI组件，结合vue2如何实现图片上传组件的封装

Caliper 配置文件解析：config.yaml

【生成模型】视频生成论文调研

代码规范和架构【立芯理论一】（2025.06.08）

Linux 下 DMA 内存映射浅析

【java】【服务器】线程上下文丢失是指什么

GeoServer发布PostgreSQL图层后WFS查询无主键字段

在Spring Boot中集成RabbitMQ的完整指南