当前位置：首页 > news >正文

VLLM实现大模型服务的部署

news 2026/2/8 18:43:15

文章目录

安装
离线推理
适配openAI-API的API服务
- 使用python命令行部署
- 使用docker部署
- 调用启动成功的API

安装

# (Recommended) Create a new conda environment.
conda create -n myenv python=3.9 -y
conda activate myenv# Install vLLM with CUDA 12.1.
pip install vllm -i https://pypi.tuna.tsinghua.edu.cn/simple/

离线推理

from vllm import LLM, SamplingParamsllm = LLM(model="meta-llama/Meta-Llama-3-8B-Instruct")  # 你的模型路径
sampling_params = SamplingParams(temperature=0.5)  # 生成文本的控制参数，temperature越大，生成的内容越随机# 处理输出
def print_outputs(outputs):for output in outputs:prompt = output.promptgenerated_text = output.outputs[0].textprint(f"Prompt: {prompt!r}, Generated text: {generated_text!r}")print("-" * 80)print("=" * 80)# 模型的输入对话
conversation = [{"role": "system","content": "You are a helpful assistant"},{"role": "user","content": "Hello"},{"role": "assistant","content": "Hello! How can I assist you today?"},{"role": "user","content": "Write an essay about the importance of higher education.",},
]# 将输入对话，采样参数传给模型
# use_tqdm=False是不启用进度条
outputs = llm.chat(conversation,sampling_params=sampling_params,use_tqdm=False)
print_outputs(outputs)# A chat template can be optionally supplied.
# If not, the model will use its default chat template.# with open('template_falcon_180b.jinja', "r") as f:
#     chat_template = f.read()# outputs = llm.chat(
#     conversations,
#     sampling_params=sampling_params,
#     use_tqdm=False,
#     chat_template=chat_template,
# )

适配openAI-API的API服务

使用vllm将大模型推理做成api服务非常方便，你可以通过 - -host和 - -port参数来自定义地址，而且无需担心chat模板，因为它默认会使用由tokenizer提供的chat模板

使用python命令行部署

关于下面的参数设置，建议去官网查看，解释比较清晰全面
官网：https://docs.vllm.ai/en/latest/serving/openai_compatible_server.html

conda activate vllm \   # 激活环境
CUDA_VISIBLE_DEVICES=6 \  # 设置gpu device
nohup python -m vllm.entrypoints.openai.api_server \
--model /LLM/Qwen_1_5_4B_chat/ \  # 指定你的模型路径
--max_model_len=2048  \    # 设置模型生成长度
--served-model-name sevice_name \   # 设置你起的模型服务名
--trust-remote-code \
--api-key 123456 \   # 设置你api key 
--port 1234 \        # 设置你的端口
--dtype=half \       # 设置你的数据精度
> /vllm.log 2>&1 &   # 设置你的输出log

使用docker部署

docker run --runtime nvidia --gpus all \
-v /path:/path   \    # 本地模型的路径/path，挂载到容器下面的路径/path
--rm --name docker_name   \   # 你容器的名字
-p 8000:8000   \    # 端口映射，本地端口8000映射到容器端口8000，可修改
--ipc=host  \
e********a   \    # 镜像id
--model model_path \   # 你的模型路径
--api-key=123456 \   # 设置你的api key
--served-model-name=sevice_name    # 设置你起的模型服务名

调用启动成功的API

from openai import OpenAI
openai_api_key = "123456"  # 这里是你上述设置的api-key
openai_api_base = "http://ip:8000/v1"  # 这里的ip是运行你上述部署脚本所在的主机ip，8000是你脚本里面设置的端口client = OpenAI(api_key=openai_api_key,base_url=openai_api_base,
)response = client.chat.completions.create(model="sevice_name",  # 这里的sevice_name是你上述脚本中定义的服务名messages=[{"role": "system", "content": ""},{"role": "user", "content": "讲一个笑话"},],temperature=0.7,stream=True   # 设置流式返回
)
# 这里是流式返回
for chunk in response:# print(chunk.choices[0])if chunk.choices[0].delta:print(chunk.choices[0].delta.content)

VLLM实现大模型服务的部署

文章目录安装离线推理适配openAI-API的API服务使用python命令行部署使用docker部署调用启动成功的API 安装 # (Recommended) Create a new conda environment. conda create -n myenv python3.9 -y conda activate myenv# Install vLLM with CUDA 12.1. pip install vllm -i …...

编程日记 2024/10/16 3:29:46

Java 基数排序

基数排序（Radix Sort）是一种非比较型整数排序算法，通常用于对数字进行排序。它按照数字的每一位（从最低有效位到最高有效位或从最高有效位到最低有效位）进行排序，每次使用一个稳定的排序算法（如…...

编程日记 2024/10/16 3:28:45

红帽发送邮件操作

一.将/mnt挂在至/run/media mount /dev/sr0 /mnt 二.查看下载时间 ll /etc/yum.repos.d/ 三.下载安装包 dnf install s-nail -y 四.配置邮件服务在最下面一行输入######################### 接着输入邮件 set from18013844913163.com set smtpsmtp.163.com set smt…...

编程日记 2024/10/16 3:27:44

学习记录：js算法（六十一）：添加与搜索单词 - 数据结构设计

文章目录添加与搜索单词 - 数据结构设计思路一思路二添加与搜索单词 - 数据结构设计请你设计一个数据结构，支持添加新单词和查找字符串是否与任何先前添加的字符串匹配。实现词典类 WordDictionary ： ● WordDictionary() 初始化词典对象 ● voi…...

编程日记 2024/10/16 3:26:44

Jetpack-ObservableField实现双向绑定

ObservableField是Android Data Binding库中的一个类，用于实现双向绑定。双向绑定意味着当数据模型中的数据发生变化时，UI会自动更新；同时，当用户在UI上进行操作时，数据模型也会相应地更新。 1.在你的项目中添加Data …...

编程日记 2024/10/16 3:24:41

STARnak, LTR 模型笔记

未完成. 1. 简述 CIKM 23 的一篇论文, 任务为 Learning To Rank, 输入为候选集合, 输出为有序列表, 用于 top-n 推荐场景. 思考: 它是要替代 ctr 预估么?它跟 mind 这种召回, 有啥大的不一样么? 2. 网络结构 u u u: 将用户(或 query) 记为 u H q d X , d Y , . . . H…...

编程日记 2024/10/16 3:23:39

【数据结构】：破译排序算法--数字世界的秩序密码（二）

文章目录前言一.比较排序算法1.Bubble Sort冒泡排序1.1.冒泡排序原理1.2.冒泡排序过程1.3.代码实现1.4.复杂度和稳定性 2.Quick Sort快速排序2.1递归快速排序2.1.1.递归快速排序原理2.1.2.递归快速排序过程2.1.3.代码实现 2.2.非递归快速排序2.2.1.非递归快速排序原理2.2.2.非…...

编程日记 2024/10/16 3:19:35

2024年《生成式ai大模型》都学什么内容呢？

近期大家都在关注的2024 2024年10月25日 — 2024年10月29日在成都举办的第八期《新质技术之生成式AI、大模型、多模态技术开发与应用研修班》都学什么内容呢？下面我们来看看： 1.了解AIGC发展现状与核心技术。 2.掌握Transformer核心开发技术。 3.掌握…...

编程日记 2024/10/16 3:18:34

kubernetes自定义pod启动用户

一、kubernetes自定义pod启动用户一）以root用户启动pod containers:- name: ...image: ...securityContext:runAsUser: 0 二）以普通用户启动pod 1、从构建镜像角度修改 # RUN命令执行创建用户和用户组（命令创建了一个用户newuser设定ID为1…...

编程日记 2024/10/16 3:17:33

C4T避风型电动采光排烟天窗（图集09J621-2）

C4T避风型电动采光排烟天窗是09J621-2《电动采光排烟天窗》图集中的一种窗型。也是一种现代化的建筑消防排烟通风采光设备，被广泛应用于多风地区厂房。 C4T避风型电动采光排烟天窗配有成品避风罩，该避风置由钢制骨架和彩色钢板构成，固定在电动…...

编程日记 2024/10/16 3:16:32

多态常见面试问题

1、什么是多态？ 多态（Polymorphism）是面向对象编程中的一个重要概念，它允许同一个接口表现出不同的行为。在C中，多态性主要通过虚函数来实现，分为编译时多态（静态多态）和运行时多态…...

编程日记 2024/10/16 3:14:28

案例-登录认证（上）

案例-登录认证在前面的课程中，我们已经实现了部门管理、员工管理的基本功能，但是大家会发现，我们并没有登录，就直接访问到了Tlias智能学习辅助系统的后台。这是不安全的，所以我们今天的主题就是登录认证。最终我…...

编程日记 2024/10/16 3:13:26

对BSV区块链下一代节点Teranode的答疑解惑（上篇）

发表时间：2024年8月7日 2024年初BSV区块链研发团队揭晓了即将到来的Teranode更新的突破性特性，这些特性将显著提升网络的效率和处理速度，使BSV区块链能够达到百万级TPS。 Teranode的项目主管Siggi Oskarsson强调：“当你阅读这…...

编程日记 2024/10/16 3:12:25

vue父子组件传参的方法

在Vue.js中，父子组件之间的参数传递是常见的需求。Vue提供了几种方法来实现这一点，主要包括使用props传递数据给子组件，以及使用事件（如自定义事件）从子组件向父组件发送数据。以下是详细的说明： 父组件向…...

编程日记 2024/10/16 3:11:24

关于this指针

在普通成员函数里 1.this指针不能显式说明，但能显示使用，是个常指针，只能改变指针指向的对象的内容，不能改变指针存储的对象的地址。 2.this指针一般不用特别写上，只有在（我目前的知识范围内）类…...

编程日记 2024/10/16 3:10:22

机器学习西瓜书

绪论 1.1绪论1.2课程定位科学:是什么,为什么; 技术:怎么做; 工程:做的多快好省; 应用: 1.3机器学习经典定义:利用经验改善系统自身的性能 1.4典型的机器学习过程 1.5计算学习理论机器学习有坚实的理论基础,由Leslie Valiant的计算学习理论现在有一个数据样本x,现在…...

编程日记 2024/10/16 3:08:20

如何使用 Puppeteer 和 Browserless 运行自动化测试？

Puppeteer：什么是 Puppeteer 及其功能 Puppeteer 是一个 Node.js 库。使用 Puppeteer，您可以在所有基于 Chromium 的浏览器上测试您的网站，包括 Chrome、Microsoft Edge Chrome 和 Chromium。此外，Puppeteer 可用于网页抓取、自动…...

编程日记 2024/10/16 3:07:18

python菜鸟知识

去除空格 str 这是含空格 print(f去除两端空格{str.strip()}) print(f去除左端空格{str.lstrip()}) print(f去除右端空格{str.rstrip()}) print(f去除全部空格{str.replace(" ", "")}) 方法返回对象yield yield :.join([ip, port])yield {ranking…...

编程日记 2024/10/16 3:06:16

GPT4o，GPTo1-preview, 拼

兄弟们GPT刚开的需要上车的扣，工作用大家一起PIN分摊点压力。在当今数字化的时代，程序员这一职业已经从幕后走到了前台，成为推动科技进步和社会变革的关键力量。编写代码、解决问题、不断学习新技术，程序员们的日常充满了挑战与…...

编程日记 2024/10/16 3:05:15

论文笔记：Pre-training to Match for Unified Low-shot Relation Extraction

论文来源：ACL 2022 论文地址：https://aclanthology.org/2022.acl-long.397.pdf 论文代码：https://github.com/fc-liu/MCMN （笔记不易，请勿恶意转载抄袭！！！） 目录 A…...

编程日记 2024/10/16 3:03:13

Java 语言特性(面试系列1)

一、面向对象编程 1. 封装（Encapsulation） 定义：将数据（属性）和操作数据的方法绑定在一起，通过访问控制符（private、protected、public）隐藏内部实现细节。示例： public …...

编程新知 2025/10/6 4:03:40

突破不可导策略的训练难题：零阶优化与强化学习的深度嵌合

强化学习（Reinforcement Learning, RL）是工业领域智能控制的重要方法。它的基本原理是将最优控制问题建模为马尔可夫决策过程，然后使用强化学习的Actor-Critic机制（中文译作“知行互动”机制），逐步迭代求解…...

编程新知 2026/2/5 4:17:42

【力扣数据库知识手册笔记】索引

索引索引的优缺点优点1. 通过创建唯一性索引，可以保证数据库表中每一行数据的唯一性。2. 可以加快数据的检索速度（创建索引的主要原因）。3. 可以加速表和表之间的连接，实现数据的参考完整性。4. 可以在查询过程中，…...

编程新知 2026/1/25 4:36:37

CMake基础：构建流程详解

目录 1.CMake构建过程的基本流程 2.CMake构建的具体步骤 2.1.创建构建目录 2.2.使用 CMake 生成构建文件 2.3.编译和构建 2.4.清理构建文件 2.5.重新配置和构建 3.跨平台构建示例 4.工具链与交叉编译 5.CMake构建后的项目结构解析 5.1.CMake构建后的目录结构 5.2.构…...

编程新知 2026/2/2 7:39:34

ffmpeg（四）：滤镜命令

FFmpeg 的滤镜命令是用于音视频处理中的强大工具，可以完成剪裁、缩放、加水印、调色、合成、旋转、模糊、叠加字幕等复杂的操作。其核心语法格式一般如下： ffmpeg -i input.mp4 -vf "滤镜参数" output.mp4或者带音频滤镜： ffmpeg…...

编程新知 2026/2/4 23:47:47

实现弹窗随键盘上移居中

实现弹窗随键盘上移的核心思路在Android中，可以通过监听键盘的显示和隐藏事件，动态调整弹窗的位置。关键点在于获取键盘高度，并计算剩余屏幕空间以重新定位弹窗。 // 在Activity或Fragment中设置键盘监听 val rootView findViewById<V…...

编程新知 2025/10/6 18:46:56

算法笔记2

1.字符串拼接最好用StringBuilder，不用String 2.创建List<>类型的数组并创建内存 List arr[] new ArrayList[26]; Arrays.setAll(arr, i -> new ArrayList<>()); 3.去掉首尾空格...

编程新知 2026/1/27 12:17:05

html css js网页制作成品——HTML+CSS榴莲商城网页设计（4页）附源码

目录一、👨‍🎓网站题目二、✍️网站描述三、📚网站介绍四、🌐网站效果五、🪓 代码实现 🧱HTML 六、🥇 如何让学习不再盲目七、🎁更多干货一、👨‍&#x1f…...

编程新知 2026/2/7 22:17:30

Java求职者面试指南：Spring、Spring Boot、MyBatis框架与计算机基础问题解析

Java求职者面试指南：Spring、Spring Boot、MyBatis框架与计算机基础问题解析一、第一轮提问（基础概念问题） 1. 请解释Spring框架的核心容器是什么？它在Spring中起到什么作用？ Spring框架的核心容器是IoC容器&#…...

编程新知 2025/10/4 21:24:40

MacOS下Homebrew国内镜像加速指南（2025最新国内镜像加速）

macos brew国内镜像加速方法 brew install 加速formula.jws.json下载慢加速 🍺 最新版brew安装慢到怀疑人生？别怕，教你轻松起飞！ 最近Homebrew更新至最新版，每次执行 brew 命令时都会自动从官方地址 https://formulae.…...

编程新知 2026/1/28 10:57:16