当前位置：首页 > article >正文

大语言模型 10 - 从0开始训练GPT 0.25B参数量补充知识之模型架构 MoE、ReLU、FFN、MixFFN

article 2026/2/8 7:37:26

写在前面

GPT（Generative Pre-trained Transformer）是目前最广泛应用的大语言模型架构之一，其强大的自然语言理解与生成能力背后，是一个庞大而精细的训练流程。本文将从宏观到微观，系统讲解GPT的训练过程，包括数据收集、预处理、模型设计、训练策略、优化技巧以及后训练阶段（微调、对齐）等环节。

我们将先对 GPT 的训练方案进行一个简述，接着我们将借助 MiniMind 的项目，来完成我们自己的 GPT 的训练。

训练阶段概览

GPT 的训练过程大致分为以下几个阶段：

数据准备（Data Preparation）
预训练（Pretraining）
指令微调（Instruction Tuning）
对齐阶段（Alignment via RLHF 或 DPO）
推理部署（Inference & Serving）

在这里插入图片描述

简单介绍

过去两年，大语言模型（LLM）在实践中几乎清一色采用 Decoder-Only Transformer。与此同时，社区又陆续把 LayerNorm 换成 RMSNorm、把 ReLU/GELU 换成 SwiGLU，甚至在前向网络里引入 MoE / MixFFN 等稀疏或卷积混合结构。理解这些改动背后的设计动机，有助于你在模型微调、推理加速或重新发明“更小更强”模型时做出正确的工程权衡。

模型架构

MiniMind-Dense（和Llama3.1一样）使用了Transformer的Decoder-Only结构，跟GPT-3的区别在于：
● 采用了GPT-3的预标准化方法，也就是在每个Transformer子层的输入上进行归一化，而不是在输出上。具体来说，使用的是RMSNorm归一化函数。
● 用SwiGLU激活函数替代了ReLU，这样做是为了提高性能。
● 像GPT-Neo一样，去掉了绝对位置嵌入，改用了旋转位置嵌入（RoPE），这样在处理超出训练长度的推理时效果更好。

MiniMind-MoE模型，它的结构基于Llama3和Deepseek-V2/3中的MixFFN混合专家模块。
● DeepSeek-V2在前馈网络（FFN）方面，采用了更细粒度的专家分割和共享的专家隔离技术，以提高Experts的效果。

MiniMind的整体结构一致，只是在RoPE计算、推理函数和FFN层的代码上做了一些小调整。其结构如下图（重绘版）：

在这里插入图片描述

修改模型配置见./model/LMConfig.py。参考模型参数版本见下表：
在这里插入图片描述

Decoder-Only Transformer

请添加图片描述
Decoder-Only 去掉了原始 Transformer 的 Encoder，改用因果掩码 + KV-缓存即可在推理时做到 O(1) 序列延长成本。因此 GPT-3、LLaMA、Gemini 乃至文本-图像多模态模型都选择了它。

decoder-only-transformers-explained-the-engine-behind-llms

FFN

经典 FFN = Linear(d_model → d_ff) + 激活 + Linear(d_ff → d_model)，其中
d_ff≈4·d_model，激活函数最早用 ReLU。FFN 占据 >60 % FLOPs & 参数量，因此它也是改进热点。

ReLU vs SwiGLU

请添加图片描述
实验证明，等价参数量下 SwiGLU 能带来 0.3 ~ 0.6 token perplexity 改进，且推理成本几乎不变。

RMSNorm

公式：y = x / RMS(x) · γ，其中 RMS(x)=sqrt(mean(x²))

省略中心化 → 参数更少，FLOPs 与内存带宽-读写减半
训练稳定性在 Pre-Norm 框架中与 LayerNorm 等价；实测可缩短 1 ~ 10 % 训练时间
兼容大批量 / 低精度适合 GPU / TPU 混合精度

NeurIPS-23 的对比研究正式证明：Pre-LN 与 Pre-RMSNorm 在数学上可互换，并提出进一步压缩的 CRMSNorm。

MoE & MixFFN

MoE

思路：为每个 token 只激活少数“专家”FFN，计算成本与密集模型相当但可容纳亿 / 万亿级参数

核心模块： ① 稀疏门控（Top-k 或 Router），② 专家簇（通常 k=2,4,8…）
代表模型：Switch-Transformer、GLaM、Mixtral-8x7B

优缺点：

参数利用率高，训练加速可达 7 × （相同 FLOPs）
通讯/负载均衡难度大，推理需要“容量因子”调度

MixFFN

在两层 MLP 中插入 3 × 3 Depthwise Conv，融合局部感受野与全局 MLP
位置编码可选/可省，分辨率外推更稳
语言模型可类比引入 (Conv or) LoRA-Adapter 获得额外局部建模能力

小小总结

Decoder-Only 让语言生成模型推理线性伸缩；
RMSNorm 与 SwiGLU 分别在归一化与激活层面消除冗余、提升可训练性；
MoE / MixFFN 代表 FFN 的两条进化路线：一条追求参数稀疏 & 超大模型，一条追求局部感知 & 多模态。

大语言模型 10 - 从0开始训练GPT 0.25B参数量补充知识之模型架构 MoE、ReLU、FFN、MixFFN

写在前面 GPT（Generative Pre-trained Transformer）是目前最广泛应用的大语言模型架构之一，其强大的自然语言理解与生成能力背后，是一个庞大而精细的训练流程。本文将从宏观到微观，系统讲解GPT的训练过程，…...

编程日记 2026/2/8 7:37:26

python基础语法（三-中）

基础语法3： 2.列表与元组： <1>.列表、元组是什么？ 都用来存储数据，但是两者有区别，列表可变，元组不可变。 <2>.创建列表： 创建列表有两种方式： [1].a 【】&#x…...

编程日记 2026/2/8 5:59:31

【gitee 初学者矿建仓库】

简易的命令行入门教程: Git 全局设置: git config --global user.name "你的名字"触摸 git config --global user.email "你的邮箱"创建 git 仓库: mkdir codestore cd codestore git init -b "main" touch README.md # 选择运行 git add REA…...

编程日记 2026/1/30 4:52:21

思路收集文档

降低工作量思路 nodejsjava混合网站开发...

编程日记 2026/1/29 15:26:15

OpenCV 光流估计：从原理到实战

在计算机视觉领域，光流估计（Optical Flow Estimation）是一项至关重要的技术，它能够通过分析视频序列中图像像素的运动信息，捕捉物体和相机的运动情况。OpenCV 作为强大的计算机视觉库，为我们提供了高效实现…...

编程日记 2026/2/1 0:14:27

使用HtmlAgilityPack采集墨迹天气中的天气数据

需要解析对应的HTML源码： <div class"left"><div class"wea_alert clearfix"><ul><li><a href "https://tianqi.moji.com/aqi/china/jiangxi/hukou-county" >< span class"level level_2&qu…...

编程日记 2026/1/31 10:45:26

ZTE 7551N 中兴小鲜60 远航60 努比亚小牛解锁BL 刷机包刷root 展讯 T760 bl

ZTE 7551N 中兴小鲜60 远航60 努比亚小牛解锁BL 刷机包刷root 3款机型是一个型号，包通用， ro.product.system.modelZTE 7551N ro.product.system.nameCN_P720S15 #################################### # from generate-common-build-props # Th…...

编程日记 2026/2/8 4:44:57

SearxNG本地搜索引擎

SearxNG 是一个强大、开源的元搜索引擎（meta search engine），它不会存储用户信息，注重隐私保护，并支持从多个搜索引擎聚合结果，用户可以自建部署，打造一个无广告、可定制的搜索平台。 🔍 什么是 SearxNG？ SearxNG 是 Searx 的一个积极维护的分支（fork），意在改进…...

编程日记 2026/2/1 21:19:03

MyBatis 核心组件源码分析

MyBatis 作为 Java 领域最受欢迎的持久层框架之一，以灵活的 SQL 映射和强大的扩展性著称。要真正驾驭 MyBatis，深入理解其核心组件的源码实现是关键。本文将通过源码分析，结合图文并茂的方式，带大家揭开 MyBatis 核心组件的神秘面纱。 1.SqlSessionFactory：会话工厂的核心…...

编程日记 2026/1/30 18:16:26

信息系统项目管理师高级-软考高项案例分析备考指南（2023年案例分析）

个人笔记整理---仅供参考计算题案例分析里的计算题就是进度、挣值分析、预测技术。主要考査的知识点有:找关键路径、求总工期、自由时差、总时差、进度压缩资源平滑、挣值计算、预测计算。计算题是一定要拿下的，做计算题要保持头脑清晰，认真读题把PV、…...

编程日记 2026/2/8 4:16:51

stack和queue简单模拟实现

stackreverse_iteratorqueuepriority_queue仿函数具体代码 stack Stacks are a type of container adaptor, specifically designed to operate in a LIFO context (last-in first-out), where elements are inserted and extracted only from one end of the container. 上述描…...

编程日记 2026/1/30 13:55:08

如何安装双系统？即windows已经安装，如何安装ubuntu 22.04LTS

在已安装 Windows 的电脑上安装 Ubuntu 22.04 LTS 双系统，需通过分区调整、UEFI/BIOS 设置和引导管理实现。以下是详细步骤： 一、准备工作备份数据 • 备份 Windows 中的重要文件（防止分区操作失误导致数据丢失）。下载 Ubu…...

编程日记 2026/1/29 22:27:46

产品经理入门（2）产品体验报告

产品体验报告大纲：重点在产品体验——优点。 1.产品概括可以从各大平台搜产品介绍。 2.市场分析按照产品方向分析各个指标——包括有效使用时间,市场规模等。 3. 用户分析——对用户通过各项指标画像。 4.产品体验——对各项功能与设计的体验。 5.报告总结...

编程日记 2026/2/5 19:05:01

C43-指针与数组

一定义一个指针变量指向数组 1.途径一:指向数组首元素的地址代码示例: #include <stdio.h> int main() {int arr[3]{2,4,5};int *p;p&arr[0];printf("该数组的首元素是:%d",*p);return 0; }成果展示: 报错与总结: 给指针变量赋值时,未在数组首元素前输…...

编程日记 2026/2/5 4:25:49

UDP--DDR--SFP,FPGA实现之ddr读写控制模块

DDR读写控制模块实现介绍由于该模块接口数量较多，为了详细说明模块实现，采用文字流程进行介绍上级模块传输数据到来捕捉数据有效上升沿传输写指令，写有效，写指令成功被下一级模块缓存，进行写地址一次读写长度&…...

编程日记 2026/2/1 18:56:59

云计算与大数据进阶 | 26、解锁云架构核心：深度解析可扩展数据库的5大策略与挑战（上）

在云应用/服务的 5 层架构里，数据库服务层稳坐第 4 把交椅，堪称其中的 “硬核担当”。它的复杂程度常常让人望而生畏，不少人都将它视为整个架构中的 “终极挑战”。不过，也有人觉得可扩展存储系统才是最难啃的 “硬骨头”&#…...

编程日记 2026/2/5 4:20:46

AI Agent | Coze 插件使用指南：从功能解析到实操步骤

一、前言在人工智能技术飞速发展的今天，低代码开发模式正成为构建智能应用的主流趋势。对于希望快速搭建 AI Bot 的开发者和业务人员而言，coze作为一款强大的低代码 AI 开发平台，凭借其高度模块化的插件体系脱颖而出。这些插件就像搭建智能…...

编程日记 2026/2/7 19:13:34

06、基础入门-SpringBoot-依赖管理特性

06、基础入门-SpringBoot-依赖管理特性 Spring Boot 的依赖管理特性是其核心优势之一，极大地简化了项目的构建和维护过程。以下是其主要特点： ## 1. 父项目依赖管理 ### 1.1 继承 spring-boot-starter-parent 在 pom.xml 文件中，通过继承 spr…...

编程日记 2026/2/1 4:16:31

MK米客方德SD NAND:无人机存储的高效解决方案

在无人机技术迅猛发展的当下，飞控系统的数据记录对于飞行性能剖析、故障排查以及飞行安全保障极为关键。以往，SD 卡是飞控 LOG 记录常见的存储介质，但随着技术的革新，新的存储方案不断涌现。本文聚焦于以 ESP32 芯片为主控制器的无…...

编程日记 2026/2/5 4:34:26

【vscode】解决vscode无法安装远程服务器插件问题，显示正在安装

文章目录现状分析采用VSIX离线安装第一步：离线下载插件包第二步：把下载好的插件文件上传到远程服务器上第三步：在windows下打开vscode，并链接远端，进行安装现状分析 vscode无法远程安装扩展插件，显示正在…...

编程日记 2026/2/4 2:36:01

1688 数据接口调用秘籍：高效获取商品实时信息的开发指南

在电商行业竞争白热化的当下，企业想要抢占市场先机，实时掌握商品信息至关重要。作为国内 B2B 电商巨头，1688 平台汇聚海量商品资源，通过高效调用其数据接口获取商品实时信息，能为企业价格策略制定、库存管理、竞品分析…...

编程日记 2026/1/29 9:41:12

【Spring】Spring的请求处理

欢迎来到啾啾的博客🐱。记录学习点滴。分享工作思考和实用技巧，偶尔也分享一些杂谈💬。欢迎评论交流，感谢您的阅读😄。目录引言HTTP/HTTPS协议Spring Web与Spring Web MVCSpring WebFlux 自定义的TPC/IP协议FTP、S…...

编程日记 2026/2/5 4:18:55

粒子群算法（PSO算法）

粒子群算法概述 1.粒子群优化算法（Particle Swarm Optimization，简称PSO）。粒子群优化算法是在1995年由Kennedy博士和Eberhart博士一起提出的，它源于对鸟群捕食行为的研究。 2.基本核心是利用群体中的个体对信息的共享从而使得整…...

编程日记 2026/2/5 4:35:22

git提交库常用词

新功能 feat修改BUG fix文档修改 docs格式修改 style重构 refactor性能提升 perf测试 test构建系统 build对CI配置文件修改 ci修改构建流程、或增加依赖库、工具 chore回滚版本 revert...

编程日记 2026/1/30 0:09:28

LLM智能体新纪元：深入解析MCP与A2A协议，赋能智能自动化协作

LLM智能体（LLM agents）是能够自主行动以实现特定目标的AI系统。在实际应用中，智能体能够将用户请求拆解为多个步骤，利用知识库或API获取数据，最终整合出答案。这让智能体相比于传统独立聊天机器人拥有更强大的能力——…...

编程日记 2026/2/5 4:38:57

SAP学习笔记 - 开发豆知识01 - CDS SDK命令出乱码（cds init CAP-Test03 --add java）

1，现象安装完VSCode以及各种需要的插件（比如SAP CDS Language Support），就可以做CAP开发。用这个命令创建Project：cds init CAP-Test03 --add java 然后出来一个乱码错误 adding java The derived package name c…...

编程日记 2026/2/1 1:16:44