当前位置：首页 > news >正文

阿里Qwen2开源大模型本地部署及调试全攻略

news 2025/7/13 6:55:31

@阿里Qwen2开源大模型本地部署及调试全攻略

#Qwen2系列大模型性能卓越，超越业界知名模型。开源后受到AI开发者关注，支持多种语言，提升多语言理解。在预训练和微调上优化，实现智能水平提升。Qwen2系列模型在各项能力上均领先，为全球开发者提供更多选择。

通义千问 Qwen2，登顶国内第一大模型！相比近期推出同等规模的开源最好的Llama3-8B、GLM4-9B等模型，Qwen2-7B-Instruct依然能在多个评测上取得显著的优势，尤其是代码及中文理解上
Qwen2 模型的规格包括参数、GQA 和上下文长度

本次在本地安装部署的是qwen2-7b-instruct版本

Qwen2系列模型家族发布了系列GGUF格式模型。通过llama.cpp/Ollama等生态的发展，很多大语言模型都支持GGUF格式，极大地简化了大语言模型的应用流程，让即便是模型领域的初学者，只有一台CPU笔记本，也能轻松上手顶尖的AI技术。

硬件条件非常有限，但是也能够进行安装部署和运行，非常惊喜！
本次使用的是macbook air 笔记本，操作系统：windows10 专业版；CPU: i5-5250U
内存：8G 没有独立显卡。

可以成功安装，但是运行速度很慢，一个问题，（使用终端命令行）AI回答要1分钟，（使用ollama网页版）AI回答要4分钟。CUP和内存的占用都非常高。以下是实测的页面截图。
在这里插入图片描述

下面我们一步步来展开跟大家介绍安装步骤，以及在本次安装中遇到的问题和解决办法。

一、qwen2-7b下载

GGUF通常可以通过单模型文件完成推理，魔搭社区可以通过命令行CLI，Python SDK，页面下载等多个方式下载单个模型。
https://modelscope.cn/models/qwen/qwen2-7b-instruct-gguf/files
qwen2-7b-instruct-gguf 下载地址
在这里插入图片描述

二、安装Python依赖包

本次电脑已经安装了anaconda和python3.12.4
需要安装（采用清华国内的镜像，速度会快很多）

pip install llama-cpp-python -i https://pypi.tuna.tsinghua.edu.cn/simple/
pip install openai
pip install uvicorn
pip install starlette
pip install fastapi
pip install sse_starlette
pip install starlette_context
pip install pydantic_settings

在构建RAG-LLM系统时，用到了llama_cpp这个python包。但是一直安装不上，报错。
“ERROR: Failed building wheel for llama_cpp_python”
“ERROR: Could not build wheels for llama_cpp_python, which is required to install pyproject.toml-based projects”
解决方法如下：安装visual studio 2022，并且勾选C++桌面开发选项与应用程序开发选项，必须要安装SDK
官网下载地址：https://visualstudio.microsoft.com/zh-hans/vs/
在这里插入图片描述

在这里插入图片描述

三、启动Qwen2-7B-Instruct大模型

CMD打开一个终端窗口，切换到GGUF模型文件目录，然后执行下面的指令，启动Qwen2-7B大模型

python -m llama_cpp.server --model ./qwen2-7b-instruct-q5_k_m.gguf \

成功完成后，不要关闭窗口

编写一个python client.py文件（本次采用的是PYcharm工具），代码如下，然后执行该代码，就可以用命令行和Qwen2-7B-Instruct大模型进行对话，Qwen2和openai调用的接口可以通用

from openai import OpenAI# 注意服务端端口，因为是本地，所以不需要api_key
client = OpenAI(base_url="http://127.0.0.1:8000/v1",api_key="not-needed")# 对话历史：设定系统角色是一个只能助理，同时提交“自我介绍”问题
history = [{"role": "system", "content": "你是一个智能助理，你的回答总是容易理解的、正确的、有用的和内容非常精简."},
]# 首次自我介绍完毕，接下来是等代码我们的提示
while True:completion = client.chat.completions.create(model="local-model",messages=history,temperature=0.7,stream=True,)new_message = {"role": "assistant", "content": ""}for chunk in completion:if chunk.choices[0].delta.content:print(chunk.choices[0].delta.content, end="", flush=True)new_message["content"] += chunk.choices[0].delta.contenthistory.append(new_message)print("\033[91;1m")user_input = input("> ")if user_input.lower() in ["bye", "quit", "exit"]:  # 我们输入bye/quit/exit等均退出客户端print("\033[0mBYE BYE!")breakhistory.append({"role": "user", "content": user_input})print("\033[92;1m")

在这里插入图片描述

四、安装Ollama，WebUI智能AI交互聊天

打造一个像chatgpt一样但专属于你自己的智能AI交互聊天
安装Node.js编程语言工具包 https://nodejs.org/zh-cn
在这里插入图片描述

安装完成之后，可以验证一下 Node.js 的版本，建议用目前的最新v20版本：

node -v

下载安装Ollama本地大模型管理工具
https://ollama.com/
在这里插入图片描述安装包下载之后的安装过程，和日常安装其他软件没有差别，包括点击Next以及Install等安装ollama到命令行。安装后续步骤中，我们可无需安装任何模型，因为我们在上文中我们已经安装了Qwen2-7B大模型，后面可以直接使用。

将qwen2-7b-instruct-q5_k_m.gguf 的模型拷贝到ollama指定目录下
以下以win10安装ollama情况下的操作为例，把模型拷贝到C:\Users\administer.ollama\models\qwen2-7b-instruct-q5_k_m.gguf类似目录下，确认自己电脑上的路径。
在.ollama\models\下创建一个qwen2-7b.mf 文件，名字可以自定义，能区分是哪个大模型就行，内容如下：

FROM C:\Users\administer\.ollama\models\qwen2-7b-instruct-q5_k_m.ggufTEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>{{ end }}<|im_start|>user
{{ .Prompt }}<|im_end|>
<|im_start|>assistant
"""
PARAMETER stop "<|im_start|>"
PARAMETER stop "<|im_end|>"

注意路径必须替换成自己的路径和文件名。
用Ollama加工你的本地大模型文件
在命令行终端中cd到C:\Users\administer.ollama\models（换成自己的路径）
然后运行ollama create qwen2-7b.mf（替换成自己的大模型文件名和.mf文件名）
同时在\models\blobs目录下面会多出一个转换后的大模型，原来的大模型可以删了或移走，如下图：
在这里插入图片描述
使用CMD 在指定目录下执行ollama list命令可以看到你的本地模型了
然后执行 ollama run qwen2-7b-instruct-q5_k_m 启动
C:\Users\Administrator.ollama\models>ollama run qwen2-7b-instruct-q5_k_m

启动完毕，其实我们已经有了一个和之前差不多的控制台对话界面，也可以与Qwen2-7B对话了

控制台聊天对话界面体验总归是不太好，接下来部署 Web 可视化聊天界面。
首先，下载ollama-webuiWeb 工程代码：git clone https://github.com/ollama-webui/ollama-webui-lite
然后切换ollama-webui代码的目录：cd ollama-webui-lite
在这里插入图片描述

设置 Node.js 工具包镜像源，以接下来下载 Node.js 的依赖包更加快速：
npm config set registry http://mirrors.cloud.tencent.com/npm/
安装 Node.js 依赖的工具包：npm install
最后，启动 Web 可视化界面：npm run dev
在这里插入图片描述
打开浏览器，输入 http://localhost:3000/ 就可以访问网站了

如果不能正常选择大模型
在ollama-webui-lite-main的目录外面，增加一个Modelfile.py文件
代码如下：

FROM ./qwen2-7b-instruct-q5_k_m.gguf

并将 qwen2-7b-instruct-q5_k_m.gguf 文件也copy到这个目录
在这里插入图片描述
最后执行Modelfile.py 文件

在这里插入图片描述

以上是亲测的安装过程，欢迎大家讨论！

阿里Qwen2开源大模型本地部署及调试全攻略

本次在本地安装部署的是qwen2-7b-instruct版本

一、qwen2-7b下载

二、安装Python依赖包

三、启动Qwen2-7B-Instruct大模型

四、安装Ollama，WebUI智能AI交互聊天

相关文章：

阿里Qwen2开源大模型本地部署及调试全攻略

『功能项目』移动后的光标显示【04】

HTML 基本语法特性与 title 标签介绍

CSS的:placeholder-shown伪类：精确控制输入框占位符样式

Java之HashMap的底层实现

多张图片进行模型重建并转换为OBJ模型

信息安全保证人员CISAW：安全集成

别再无效清理微信内存啦，这才是正确清理内存的方式

ant design 的 tree 如何作为角色中的权限选择之一

如何在项目管理中完成项目立项？

LearnOpenGL——延迟渲染学习笔记

惠海H4312 dcdc同步整流降压恒压IC 30V 40V转3.3V/5V/12V小体积大电流单片机供电

[Linux]如何在虚拟机安装Ubuntu?（小白向）

keepalived详解

工业设备中弧形导轨的检测标准是什么？

Redis 技术详解

Kubernetes Pod入门

opencv批量修改图片大小

【RTT-Studio】详细使用教程十二：UART的分析和使用

【AI绘画】Midjourney前置指令/settings设置详解

Java 语言特性(面试系列2)

线程同步：确保多线程程序的安全与高效！

智能仓储的未来：自动化、AI与数据分析如何重塑物流中心

精益数据分析（97/126）：邮件营销与用户参与度的关键指标优化指南

让回归模型不再被异常值“带跑偏“，MSE和Cauchy损失函数在噪声数据环境下的实战对比

uniapp 实现腾讯云IM群文件上传下载功能

aardio 自动识别验证码输入

React核心概念：State是什么？如何用useState管理组件自己的数据？

代理服务器-LVS的3种模式与调度算法

简单聊下阿里云DNS劫持事件