当前位置：首页 > news >正文

Qwen2-VL微调体验

news 2025/11/7 0:35:45

1.配置环境

2.数据集准备

3.模型下载

4.注册SwanLab

5.微调

6.训练过程可视化

1.配置环境

本博客使用的是2B模型，所以仅用了单卡3090，若大一点的模型，自行根据实际情况准备显卡

安装Python>=3.8

安装Qwen2-VL必要的库

pip install modelscope==1.18.0

pip install transformers==4.46.2

pip install accelerate==1.1.1

pip install datasets==2.18.0

pip install peft==0.13.2

pip install qwen-vl-utils==0.0.8

2.数据集准备

本博客使用的是coco_2014_caption数据集中的部分，json格式如下：

数据集下载可以使用如下同样会产生一个csv：


from modelscope.msdatasets import MsDataset
import os
import pandas as pdMAX_DATA_NUMBER = 500if not os.path.exists('coco_2014_caption'):# 从modelscope下载COCO 2014图像描述数据集ds =  MsDataset.load('modelscope/coco_2014_caption', subset_name='coco_2014_caption', split='train')print(len(ds))total = min(MAX_DATA_NUMBER, len(ds))os.makedirs('coco_2014_caption', exist_ok=True)image_paths = []captions = []for i in range(total):# 获取每个样本的信息item = ds[i]image_id = item['image_id']caption = item['caption']image = item['image']# 保存图片并记录路径image_path = os.path.abspath(f'coco_2014_caption/{image_id}.jpg')image.save(image_path)# 将路径和描述添加到列表中image_paths.append(image_path)captions.append(caption)# 每处理50张图片打印一次进度if (i + 1) % 50 == 0:print(f'Processing {i+1}/{total} images ({(i+1)/total*100:.1f}%)')# 将图片路径和描述保存为CSV文件df = pd.DataFrame({'image_path': image_paths,'caption': captions})# 将数据保存为CSV文件df.to_csv('./coco-2024-dataset.csv', index=False)print(f'数据处理完成，共处理了{total}张图片')else:print('coco_2014_caption目录已存在,跳过数据处理步骤')

我们需要得到json，所以执行下面脚本得到：

import pandas as pd
import json# 载入CSV文件
df = pd.read_csv('./coco-2024-dataset.csv')
conversations = []# 添加对话数据
for i in range(len(df)):conversations.append({"id": f"identity_{i+1}","conversations": [{"from": "user","value": f"COCO Yes: <|vision_start|>{df.iloc[i]['image_path']}<|vision_end|>"},{"from": "assistant", "value": df.iloc[i]['caption']}]})# 保存为Json
with open('data_vl.json', 'w', encoding='utf-8') as f:json.dump(conversations, f, ensure_ascii=False, indent=2)

以上则是数据集准备，若使用自定义数据集则根据上面的格式准备！！！

3.模型下载

本博客使用魔塔社区中的Qwen2-VL-2B模型

from modelscope import snapshot_download, AutoTokenizer
from transformers import TrainingArguments, Trainer, DataCollatorForSeq2Seq, Qwen2VLForConditionalGeneration, AutoProcessor
import torchmodel_dir = snapshot_download("Qwen/Qwen2-VL-2B-Instruct", cache_dir="./", revision="master")
tokenizer = AutoTokenizer.from_pretrained("./Qwen/Qwen2-VL-2B-Instruct/", use_fast=False, trust_remote_code=True)
model = Qwen2VLForConditionalGeneration.from_pretrained("./Qwen/Qwen2-VL-2B-Instruct/", device_map="auto", torch_dtype=torch.bfloat16, trust_remote_code=True,)
model.enable_input_require_grads()

4.注册SwanLab

为了微调时随时查看各项指标，注册SwanLab,复制key,粘贴到运行过程中，如下图：

5.微调

微调前保证当前文件夹下面包含以下：

train.py代码如下：

import torch
from datasets import Dataset
from modelscope import snapshot_download, AutoTokenizer
from swanlab.integration.transformers import SwanLabCallback
from qwen_vl_utils import process_vision_info
from peft import LoraConfig, TaskType, get_peft_model, PeftModel
from transformers import (TrainingArguments,Trainer,DataCollatorForSeq2Seq,Qwen2VLForConditionalGeneration,AutoProcessor,
)
import swanlab
import jsondef process_func(example):"""将数据集进行预处理"""MAX_LENGTH = 8192input_ids, attention_mask, labels = [], [], []conversation = example["conversations"]input_content = conversation[0]["value"]output_content = conversation[1]["value"]file_path = input_content.split("<|vision_start|>")[1].split("<|vision_end|>")[0]  # 获取图像路径messages = [{"role": "user","content": [{"type": "image","image": f"{file_path}","resized_height": 280,"resized_width": 280,},{"type": "text", "text": "COCO Yes:"},],}]text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)  # 获取文本image_inputs, video_inputs = process_vision_info(messages)  # 获取数据数据（预处理过）inputs = processor(text=[text],images=image_inputs,videos=video_inputs,padding=True,return_tensors="pt",)inputs = {key: value.tolist() for key, value in inputs.items()} #tensor -> list,为了方便拼接instruction = inputsresponse = tokenizer(f"{output_content}", add_special_tokens=False)input_ids = (instruction["input_ids"][0] + response["input_ids"] + [tokenizer.pad_token_id])attention_mask = instruction["attention_mask"][0] + response["attention_mask"] + [1]labels = ([-100] * len(instruction["input_ids"][0])+ response["input_ids"]+ [tokenizer.pad_token_id])if len(input_ids) > MAX_LENGTH:  # 做一个截断input_ids = input_ids[:MAX_LENGTH]attention_mask = attention_mask[:MAX_LENGTH]labels = labels[:MAX_LENGTH]input_ids = torch.tensor(input_ids)attention_mask = torch.tensor(attention_mask)labels = torch.tensor(labels)inputs['pixel_values'] = torch.tensor(inputs['pixel_values'])inputs['image_grid_thw'] = torch.tensor(inputs['image_grid_thw']).squeeze(0)  #由（1,h,w)变换为（h,w）return {"input_ids": input_ids, "attention_mask": attention_mask, "labels": labels,"pixel_values": inputs['pixel_values'], "image_grid_thw": inputs['image_grid_thw']}def predict(messages, model):# 准备推理text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)image_inputs, video_inputs = process_vision_info(messages)inputs = processor(text=[text],images=image_inputs,videos=video_inputs,padding=True,return_tensors="pt",)inputs = inputs.to("cuda")# 生成输出generated_ids = model.generate(**inputs, max_new_tokens=128)generated_ids_trimmed = [out_ids[len(in_ids) :] for in_ids, out_ids in zip(inputs.input_ids, generated_ids)]output_text = processor.batch_decode(generated_ids_trimmed, skip_special_tokens=True, clean_up_tokenization_spaces=False)return output_text[0]# 在modelscope上下载Qwen2-VL模型到本地目录下
model_dir = snapshot_download("Qwen/Qwen2-VL-2B-Instruct", cache_dir="./", revision="master")# 使用Transformers加载模型权重
tokenizer = AutoTokenizer.from_pretrained("./Qwen/Qwen2-VL-2B-Instruct/", use_fast=False, trust_remote_code=True)
processor = AutoProcessor.from_pretrained("./Qwen/Qwen2-VL-2B-Instruct")model = Qwen2VLForConditionalGeneration.from_pretrained("./Qwen/Qwen2-VL-2B-Instruct/", device_map="auto", torch_dtype=torch.bfloat16, trust_remote_code=True,)
model.enable_input_require_grads()  # 开启梯度检查点时，要执行该方法# 处理数据集：读取json文件
# 拆分成训练集和测试集，保存为data_vl_train.json和data_vl_test.json
train_json_path = "data_vl.json"
with open(train_json_path, 'r') as f:data = json.load(f)train_data = data[:-4]test_data = data[-4:]with open("data_vl_train.json", "w") as f:json.dump(train_data, f)with open("data_vl_test.json", "w") as f:json.dump(test_data, f)train_ds = Dataset.from_json("data_vl_train.json")
train_dataset = train_ds.map(process_func)# 配置LoRA
config = LoraConfig(task_type=TaskType.CAUSAL_LM,target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],inference_mode=False,  # 训练模式r=64,  # Lora 秩lora_alpha=16,  # Lora alaph，具体作用参见 Lora 原理lora_dropout=0.05,  # Dropout 比例bias="none",
)# 获取LoRA模型
peft_model = get_peft_model(model, config)# 配置训练参数
args = TrainingArguments(output_dir="./output/Qwen2-VL-2B",per_device_train_batch_size=4,gradient_accumulation_steps=4,logging_steps=10,logging_first_step=5,num_train_epochs=2,save_steps=100,learning_rate=1e-4,save_on_each_node=True,gradient_checkpointing=True,report_to="none",
)# 设置SwanLab回调
swanlab_callback = SwanLabCallback(project="Qwen2-VL-finetune",experiment_name="qwen2-vl-coco2014",config={"model": "https://modelscope.cn/models/Qwen/Qwen2-VL-2B-Instruct","dataset": "https://modelscope.cn/datasets/modelscope/coco_2014_caption/quickstart","github": "https://github.com/datawhalechina/self-llm","prompt": "COCO Yes: ","train_data_number": len(train_data),"lora_rank": 64,"lora_alpha": 16,"lora_dropout": 0.1,},
)# 配置Trainer
trainer = Trainer(model=peft_model,args=args,train_dataset=train_dataset,data_collator=DataCollatorForSeq2Seq(tokenizer=tokenizer, padding=True),callbacks=[swanlab_callback],
)# 开启模型训练
trainer.train()# 配置测试参数
val_config = LoraConfig(task_type=TaskType.CAUSAL_LM,target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],inference_mode=True,  # 训练模式r=64,  # Lora 秩lora_alpha=16,  # Lora alaph，具体作用参见 Lora 原理lora_dropout=0.05,  # Dropout 比例bias="none",
)# 获取测试模型
val_peft_model = PeftModel.from_pretrained(model, model_id="./output/Qwen2-VL-2B/checkpoint-62", config=val_config)# 读取测试数据
with open("data_vl_test.json", "r") as f:test_dataset = json.load(f)test_image_list = []
for item in test_dataset:input_image_prompt = item["conversations"][0]["value"]# 去掉前后的<|vision_start|>和<|vision_end|>origin_image_path = input_image_prompt.split("<|vision_start|>")[1].split("<|vision_end|>")[0]messages = [{"role": "user", "content": [{"type": "image", "image": origin_image_path},{"type": "text","text": "COCO Yes:"}]}]response = predict(messages, val_peft_model)messages.append({"role": "assistant", "content": f"{response}"})print(messages[-1])test_image_list.append(swanlab.Image(origin_image_path, caption=response))swanlab.log({"Prediction": test_image_list})swanlab.finish()

6.训练过程可视化

Qwen2-VL微调体验

1.配置环境 2.数据集准备 3.模型下载 4.注册SwanLab 5.微调 6.训练过程可视化 1.配置环境本博客使用的是2B模型，所以仅用了单卡3090，若大一点的模型，自行根据实际情况准备显卡安装Python>3.8 安装Qwen2-VL必要的库 pip install…...

编程日记 2024/12/19 17:04:13

论文的模拟环境和实验环境

模拟环境和实验环境在撰写SCI计算机领域论文时，模拟环境和实验环境是两个重要的概念，它们之间存在显著的差异。模拟环境主要是利用计算机、数学方法等手段对实际系统进行描述和分析的过程。在计算机科学中，模拟环境可以用于模拟各种算法、系统或网络的行为，以便在不需要…...

编程日记 2024/12/19 17:02:09

MySQL EXPLAIN 详解：一眼看懂查询计划

在日常的数据库开发中，我们经常需要分析 SQL 查询性能，而 EXPLAIN 是 MySQL 提供的利器，可以帮我们快速理解查询计划，优化慢查询。本文将详细解析 EXPLAIN 的输出字段及其含义，并结合实际案例分享优化思路。一、什么是…...

编程日记 2024/12/19 17:01:08

自动呼入机器人如何与人工客服进行无缝切换？

自动呼入机器人如何与人工客服进行无缝切换？ 原作者：开源呼叫中心FreeIPCC，其Github：https://github.com/lihaiya/freeipcc 自动呼入机器人与人工客服的无缝切换详解自动呼入机器人与人工客服之间的无缝切换是确保客户体验连续…...

编程日记 2024/12/19 17:00:07

1. 混淆矩阵 (Confusion Matrix) 预测正类预测负类实际正类 (P)True Positive (TP)False Negative (FN)实际负类 (N)False Positive (FP)True Negative (TN) True Positive (TP): 模型正确预测为正类的样本数。True Negative (TN): 模型正确预测为负类的样本数。False Positi…...

编程日记 2024/12/19 16:59:06

鸿蒙操作系统简介

华为鸿蒙系统（HUAWEI HarmonyOS），是华为公司于2019年8月9日在东莞举行的华为开发者大会（HDC.2019）上正式发布的面向全场景的分布式操作系统，可以创造一个超级虚拟终端互联的世界，将人、设备、场…...

编程日记 2024/12/19 16:57:04

单片机：实现蜂鸣器数码管的显示（附带源码）

单片机实现蜂鸣器数码管显示蜂鸣器和数码管在嵌入式系统中广泛应用。蜂鸣器可以发出声音警告或提示，而数码管则用于显示数字或字母。在本项目中，我们将通过8051单片机实现一个控制蜂鸣器和数码管显示的系统，结合使用蜂鸣器和数码管&#xf…...

编程日记 2024/12/19 16:56:02

C语言期末复习笔记（上）

目录一、为什么要学习C语言 1.C语言适合做什么 2.开发C程序的步骤 3.常用术语二、C语言数据结构 1.常量与变量 （1）常量编辑 （2）变量 2.数据类型编辑 （1）数据类型的分类 （2&a…...

编程日记 2024/12/19 16:51:57

HarmonyOS 实时监听与获取 Wi-Fi 信息

文章目录摘要项目功能概述代码模块详细说明创建 Wi-Fi 状态保存对象Wi-Fi 状态监听模块获取当前 Wi-Fi 信息整合主模块运行效果展示性能分析总结摘要本文展示了如何使用 HarmonyOS 框架开发一个 Demo，用于监听手机的 Wi-Fi 状态变化并实时获取连接的 Wi-Fi 信息…...

编程日记 2024/12/19 16:49:55

Unity超优质动态天气插件(含一年四季各种天气变化，可用于单机局域网VR)

效果展示：https://www.bilibili.com/video/BV1CkkcYHENf/?spm_id_from333.1387.homepage.video_card.click 在你的项目中设置enviro真的很容易！导入包裹并按照以下步骤操作开始的步骤！ 1. 拖拽“EnviroSky”预制件（“environme…...

编程日记 2024/12/19 16:42:43

1 JVM JDK JRE之间的区别以及使用字节码的好处

JDK jdk是编译java源文件成class文件的，我们使用javac命令把java源文件编译成class文件。我们在java安装的目录下找到bin文件夹，如下图所示: 遵循着编译原理，把java源文件编译成JVM可识别的机器码。其中还包括jar打包工具等。主要是针对…...

编程日记 2024/12/19 16:40:40

【网络安全】网站常见安全漏洞—服务端漏洞介绍

文章目录网站常见安全漏洞—服务端漏洞介绍引言1. 第三方组件漏洞什么是第三方组件漏洞？如何防范？ 2. SQL 注入什么是SQL注入？如何防范？ 3. 命令执行漏洞什么是命令执行漏洞？如何防范？ 4. 越权漏洞什么是越…...

编程日记 2024/12/19 16:35:35

MAPTR：在线矢量化高精地图构建的结构化建模与学习(2208)

MAPTR: STRUCTURED MODELING AND LEARNING FOR ONLINE VECTORIZED HD MAP CONSTRUCTION MAPTR：在线矢量化高精地图构建的结构化建模与学习 ABSTRACT High-definition (HD) map provides abundant and precise environmental information of the driving scene, se…...

编程日记 2024/12/19 16:32:32

基于容器的云原生，让业务更自由地翱翔云端

无论是要构建一个应用或开发一个更庞大的解决方案，在技术选型时，技术的开放性和可移植性已经成为很多企业优先考虑的问题之一。毕竟没人希望自己未来的发展方向和成长速度被自己若干年前选择使用的某项技术所限制或拖累。那么当你的业务已经上云&#x…...

编程日记 2024/12/19 16:31:30

大屏开源项目go-view二次开发2----半环形控件(C#)

环境搭建参考： 大屏开源项目go-view二次开发1----环境搭建(C#)-CSDN博客要做的半环形控件最终效果如下图： 步骤如下： 1 在go-view前端项目的\src\packages\components\Charts目录下新增Others目录，并在Others目录下新增PieExt…...

编程日记 2024/12/19 16:22:20

web：pc端企业微信登录-vue版

官方文档：developer.work.weixin.qq.com/document/pa… 不需要调用ww.register，直接调用ww.createWWLoginPanel即可创建企业微信登录面板 - 文档 - 企业微信开发者中心 (qq.com) 引入 //通过 npm 引入 npm install wecom/jssdk import * as ww from we…...

编程日记 2024/12/19 16:19:17

OpenGL ES 01 渲染一个四边形

项目架构着色器封装 vertex #version 300 es // 接收顶点数据 layout (location 0) in vec3 aPos; // 位置变量的属性位置值为0 layout (location 1) in vec4 aColors; // 位置变量的属性位置值为1 out vec4 vertexColor; // 为片段着色器指定一个颜色输出void main() {gl…...

编程日记 2024/12/19 16:13:09

【ETCD】【源码阅读】深入解析 EtcdServer.applyEntries方法

applyEntries方法的主要作用是接收待应用的 Raft 日志条目，并按顺序将其应用到系统中；确保条目的索引连续，避免丢失或重复应用条目。一、函数完整代码 func (s *EtcdServer) applyEntries(ep *etcdProgress, apply *apply) {if len(apply.…...

编程日记 2024/12/19 16:09:02

概率论得学习和整理28：用EXCEL画折线图，X轴数据也被当成曲线的解决办法

目录 1 折线图和散点图，对数据的处理差别 1.1 EXCEL画图的一些默认设置 1.2 多于2列的数据，也是如此 2 如果我们非要以第1列数据为X轴，做一个折线图呢？也能 2.1 首先，把第1列，想当成X轴的数据&#xf…...

编程日记 2024/12/19 16:05:57

tryhackme-Pre Security-Defensive Security Intro（防御安全简介）

任务一：Introduction to Defensive Security防御安全简介此room的两个要点： Preventing intrusions from occurring 防止入侵发生Detecting intrusions when they occur and responding properly 检测发生的入侵并正确响应防御安全还有更多内容。除上…...

编程日记 2024/12/19 16:03:52

(LeetCode 每日一题) 3442. 奇偶频次间的最大差值 I (哈希、字符串)

题目：3442. 奇偶频次间的最大差值 I 思路 ：哈希，时间复杂度0(n)。用哈希表来记录每个字符串中字符的分布情况，哈希表这里用数组即可实现。 C版本： class Solution { public:int maxDifference(string s) {int a[26]…...

编程新知 2025/11/5 22:56:46

观成科技：隐蔽隧道工具Ligolo-ng加密流量分析

1.工具介绍 Ligolo-ng是一款由go编写的高效隧道工具，该工具基于TUN接口实现其功能，利用反向TCP/TLS连接建立一条隐蔽的通信信道，支持使用Let’s Encrypt自动生成证书。Ligolo-ng的通信隐蔽性体现在其支持多种连接方式，适应复杂网…...

编程新知 2025/11/6 20:28:03

屋顶变身“发电站” ，中天合创屋面分布式光伏发电项目顺利并网！

5月28日，中天合创屋面分布式光伏发电项目顺利并网发电，该项目位于内蒙古自治区鄂尔多斯市乌审旗，项目利用中天合创聚乙烯、聚丙烯仓库屋面作为场地建设光伏电站，总装机容量为9.96MWp。项目投运后，每年可节约标煤3670…...

编程新知 2025/11/6 18:35:07

在Ubuntu中设置开机自动运行（sudo）指令的指南

在Ubuntu系统中，有时需要在系统启动时自动执行某些命令，特别是需要 sudo权限的指令。为了实现这一功能，可以使用多种方法，包括编写Systemd服务、配置 rc.local文件或使用 cron任务计划。本文将详细介绍这些方法，并提供…...

编程新知 2025/10/28 23:14:00

Python 包管理器 uv 介绍

Python 包管理器 uv 全面介绍 uv 是由 Astral（热门工具 Ruff 的开发者）推出的下一代高性能 Python 包管理器和构建工具，用 Rust 编写。它旨在解决传统工具（如 pip、virtualenv、pip-tools）的性能瓶颈，同时…...

编程新知 2025/8/16 15:34:02

深度学习水论文：mamba＋图像增强

🧀当前视觉领域对高效长序列建模需求激增，对Mamba图像增强这方向的研究自然也逐渐火热。原因在于其高效长程建模，以及动态计算优势，在图像质量提升和细节恢复方面有难以替代的作用。 🧀因此短时间内，就有不…...

编程新知 2025/10/28 0:15:18

Ubuntu系统复制（U盘-电脑硬盘）

所需环境电脑自带硬盘：1块 (1T) U盘1：Ubuntu系统引导盘（用于“U盘2”复制到“电脑自带硬盘”） U盘2：Ubuntu系统盘（1T，用于被复制） ！！！建议“电脑…...

编程新知 2025/10/15 10:36:22

离线语音识别方案分析

随着人工智能技术的不断发展，语音识别技术也得到了广泛的应用，从智能家居到车载系统，语音识别正在改变我们与设备的交互方式。尤其是离线语音识别，由于其在没有网络连接的情况下仍然能提供稳定、准确的语音处理能力，广…...

编程新知 2025/9/22 13:00:25

若依登录用户名和密码加密

/*** 获取公钥：前端用来密码加密* return*/GetMapping("/getPublicKey")public RSAUtil.RSAKeyPair getPublicKey() {return RSAUtil.rsaKeyPair();}新建RSAUti.Java package com.ruoyi.common.utils;import org.apache.commons.codec.binary.Base64; im…...

编程新知 2025/11/4 11:29:12

CVE-2023-25194源码分析与漏洞复现(Kafka JNDI注入)

漏洞概述漏洞名称：Apache Kafka Connect JNDI注入导致的远程代码执行漏洞 CVE编号：CVE-2023-25194 CVSS评分：8.8 影响版本：Apache Kafka 2.3.0 - 3.3.2 修复版本：≥ 3.4.0 漏洞类型：反序列化导致的远程代…...

编程新知 2025/11/4 2:13:55

Qwen2-VL微调体验

1.配置环境

2.数据集准备

3.模型下载

4.注册SwanLab

5.微调

6.训练过程可视化

相关文章：

Qwen2-VL微调体验

论文的模拟环境和实验环境

MySQL EXPLAIN 详解：一眼看懂查询计划

自动呼入机器人如何与人工客服进行无缝切换？

二分类模型的性能评价指标

鸿蒙操作系统简介

单片机：实现蜂鸣器数码管的显示（附带源码）

C语言期末复习笔记（上）

HarmonyOS 实时监听与获取 Wi-Fi 信息

Unity超优质动态天气插件(含一年四季各种天气变化，可用于单机局域网VR)

1 JVM JDK JRE之间的区别以及使用字节码的好处

【网络安全】网站常见安全漏洞—服务端漏洞介绍

MAPTR：在线矢量化高精地图构建的结构化建模与学习(2208)

基于容器的云原生，让业务更自由地翱翔云端

大屏开源项目go-view二次开发2----半环形控件(C#)

web：pc端企业微信登录-vue版

OpenGL ES 01 渲染一个四边形

【ETCD】【源码阅读】深入解析 EtcdServer.applyEntries方法

概率论得学习和整理28：用EXCEL画折线图，X轴数据也被当成曲线的解决办法

tryhackme-Pre Security-Defensive Security Intro（防御安全简介）

(LeetCode 每日一题) 3442. 奇偶频次间的最大差值 I (哈希、字符串)

观成科技：隐蔽隧道工具Ligolo-ng加密流量分析

屋顶变身“发电站” ，中天合创屋面分布式光伏发电项目顺利并网！

在Ubuntu中设置开机自动运行（sudo）指令的指南

Python 包管理器 uv 介绍

深度学习水论文：mamba＋图像增强

Ubuntu系统复制（U盘-电脑硬盘）

离线语音识别方案分析

若依登录用户名和密码加密

CVE-2023-25194源码分析与漏洞复现(Kafka JNDI注入)