当前位置：首页 > article >正文

速通《Sklearn 与 TensorFlow 机器学习实用指南》

article 2026/2/7 19:09:07

1.机器学习概览

1.1 什么是机器学习

机器学习是通过编程让计算机从数据中进行学习的科学。

1.2 为什么使用机器学习？

使用机器学习，是为了让计算机通过数据自动学习规律并进行预测或决策，无需显式编程规则。

1.3 机器学习系统的类型

1.3.1 监督/非监督学习

机器学习可以根据训练时监督的量和类型进行分类。主要有四类：监督学习、非监督学习、半监督学习和强化学习。

监督学习（分类、回归）、非监督学习（聚类、降维）。

1.3.2 批量和在线学习

批量学习（Batch Learning）是在收集到完整数据集后一次性训练模型，适用于数据静态、训练资源充足的场景。
在线学习（Online Learning）是模型接收数据流时逐条或小批量更新，适用于动态环境和实时预测任务。

1.3.3 基于实例 vs 基于模型学习

基于实例的学习（Instance-based Learning）是直接记忆训练数据，在预测时通过比较新样本与已有实例的相似度来做出判断，代表算法有K近邻（KNN）等。

基于模型的学习（Model-based Learning）是通过训练数据构建一个通用的预测模型，学习参数或结构以适应数据分布，代表算法有线性回归、决策树、神经网络等。

1.4 机器学习的主要挑战

* 训练数据量不足

* 没有代表性的训练数据

* 低质量数据

* 不相关的特征

* 过拟合训练数据

* 欠拟合训练数据

1.5 测试和确认

要评估模型在新样本上的表现，不能仅依赖训练误差，而要使用测试集来估计其推广误差（对新样本的错误率称作推广错误）。通常将数据集按 80% 训练、20% 测试 进行划分。若训练误差低而测试误差高，说明模型发生了过拟合。

当需要比较多个模型或调整超参数（如正则化强度）时，直接在测试集上反复优化会导致对测试集过拟合，从而低估实际误差。

为避免这一问题，应引入验证集，专用于调参，测试集仅用于最终评估。为了最大化数据利用，通常采用交叉验证：将训练集划分为多个子集，轮流训练和验证，选出最佳模型后，再用全部训练集重新训练，并在测试集上评估最终性能。

4.训练模型

4.1 线性回归

首先我们将以一个简单的线性回归模型为例，讨论两种不同的训练方法来得到模型的最优解：

直接使用封闭方程进行求根运算，得到模型在当前训练集上的最优参数（即在训练集上使损失函数达到最小值的模型参数），本质上就是最小二乘法（Least Squares）在线性回归中的具体实现形式。
使用迭代优化方法：梯度下降（GD），在训练集上，它可以逐渐调整模型参数以获得最小的损失函数，最终，参数会收敛到和第一种方法相同的的值。同时，我们也会介绍一些梯度下降的变体形式：批量梯度下降（Batch GD）、小批量梯度下降（Mini-batch GD）、随机梯度下降（Stochastic GD），在第二部分的神经网络部分，我们会多次使用它们。

4.2 梯度下降

梯度下降是一种通用的优化算法，其核心思想是：通过不断迭代，沿着使损失函数下降最快的方向（即负梯度方向）调整参数，直到找到损失函数的最小值。

可以类比为：人在浓雾中下山，只能感知脚下的坡度，逐步往坡度最陡的方向走，最终走到山底。

算法从一个随机初始参数开始，每次计算损失函数的梯度，并更新参数。过程持续，直到梯度接近 0，表示已接近最低点，即模型收敛。

在梯度下降中一个重要的参数是步长，超参数学习率的值决定了步长的大小。如果学习率太小，必须经过多次迭代，算法才能收敛，这是非常耗时的。

另一方面，如果学习率太大，你将跳过最低点，到达山谷的另一面，可能下一次的值比上一次还要大。这可能使的算法是发散的，函数值变得越来越大，永远不可能找到一个好的答案。

最后，并不是所有的损失函数看起来都像一个规则的碗。它们可能是洞，山脊，高原和各种不规则的地形，使它们收敛到最小值非常的困难。图 4-6 显示了梯度下降的两个主要挑战：如果随机初始值选在了图像的左侧，则它将收敛到局部最小值，这个值要比全局最小值要大。如果它从右侧开始，那么跨越高原将需要很长时间，如果你早早地结束训练，你将永远到不了全局最小值。

4.5 线性模型的正则化

降低模型的过拟合的好方法是正则化这个模型（即限制它）：模型有越少的自由度，就越难以拟合数据。例如，正则化一个多项式模型，一个简单的方法就是减少多项式的阶数。

对于一个线性模型，正则化的典型实现就是约束模型中参数的权重。接下来我们将介绍三种不同约束权重的方法：Ridge 回归，Lasso 回归和 Elastic Net。

4.6 逻辑回归

逻辑回归是一种用于二分类问题的统计模型，用来预测某个事件发生的概率，输出结果在 0 到 1 之间。

虽然名字叫“回归”，但逻辑回归实际上是一种分类算法。

5.支持向量机

SVM、SVR原理简单介绍-CSDN博客

6.决策树

决策树是一种树形结构的分类与回归模型，它通过一系列的“if-then”规则对样本进行划分，直到叶节点给出预测结果。

7.随机森林

随机森林是由多棵决策树构成的集成学习方法。每棵树都在随机选择的训练数据子集和特征子集上训练，最终通过投票（分类）或平均（回归）给出预测结果。

8.降维

降维就是把高维数据（有很多特征）压缩成更少维度的数据表示，同时尽量保留原始数据的重要信息。

想象你正在看一本100页的书（每页代表一个特征），但其实这本书大部分内容都在重复表达同一个观点。降维就是：

用一句话概括这本书的主要意思 —— 你丢弃了冗余内容，但保留了精华。

10.神经网络

神经网络是一种模拟人脑神经元结构的算法模型，广泛用于图像识别、语音处理、自然语言理解、预测等任务。

速通《Sklearn 与 TensorFlow 机器学习实用指南》

1.机器学习概览 1.1 什么是机器学习机器学习是通过编程让计算机从数据中进行学习的科学。 1.2 为什么使用机器学习？ 使用机器学习，是为了让计算机通过数据自动学习规律并进行预测或决策，无需显式编程规则。 1.3 机器学习系统的类型 1.…...

编程日记 2026/2/5 11:29:27

Ubuntu 下搭建ESP32 ESP-IDF开发环境，并在windows下用VSCode通过SSH登录Ubuntu开发ESP32应用

Ubuntu 下搭建ESP32 ESP-IDF开发环境，网上操作指南很多，本来一直也没有想过要写这么一篇文章。因为我其实不太习惯在linux下开发应用，平时更习惯windows的软件操作，只是因为windows下开发ESP32的应用编译时太慢，让人受…...

编程日记 2026/2/5 11:29:22

[FreeRTOS- 野火] - - - 临界段

一、介绍临界段最常出现在对一些全局变量进行操作的场景。 1.1 临界段的定义临界段是指在多任务系统中，一段需要独占访问共享资源的代码。在这段代码执行期间，必须确保没有任何其他任务或中断可以访问或修改相同的共享资源。临界段的主要目的是防…...

编程日记 2025/11/13 18:26:53

【洛谷P9303题解】AC代码- [CCC 2023 J5] CCC Word Hunt

在CCC单词搜索游戏中，单词可以隐藏在字母网格中，以直线或直角的方式排列。以下是对代码的详细注释和解题思路的总结： 传送门： https://www.luogu.com.cn/problem/P9303 代码注释 #include <iostream> #include <vecto…...

编程日记 2026/1/27 6:29:23

NodeMediaEdge接入NodeMediaServer

如何使用NME接入NMS 简介 NodeMediaEdge是一款部署在监控摄像机网络前端中，拉取Onvif或者rtsp/rtmp/http视频流并使用rtmp/kmp推送到公网流媒体服务器的工具。通过云平台协议注册到NodeMediaServer后，可以同NodeMediaServer结合使用。使用图形化的管理…...

编程日记 2026/2/4 2:33:15

【Java基础-环境搭建-创建项目】IntelliJ IDEA创建Java项目的详细步骤

在Java开发的世界里，选择一个强大的集成开发环境（IDE）是迈向高效编程的第一步。而IntelliJ IDEA无疑是Java开发者中最受欢迎的选择之一。它以其强大的功能、智能的代码辅助和简洁的用户界面，帮助无数开发者快速构建和部署Java项目…...

编程日记 2026/2/5 11:29:17

WebSocket指数避让与重连机制

1. 引言在现代Web应用中，WebSocket技术已成为实现实时通信的重要手段。与传统的HTTP请求-响应模式不同，WebSocket建立持久连接，使服务器能够主动向客户端推送数据，极大地提升了Web应用的实时性和交互体验。然而，在实…...

编程日记 2025/6/22 20:11:32

DrissionPage WebPage模式：动态交互与高效爬取的完美平衡术

在Python自动化领域，开发者常面临两难选择：Selenium虽能处理动态页面但效率低下，Requests库轻量高效却难以应对JavaScript渲染。DrissionPage的WebPage模式创新性地将浏览器控制与数据包收发融为一体，为复杂网页采集场景提供了全新…...

编程日记 2025/7/6 4:45:21

adb查看、设置cpu相关信息

查内存 adb shell dumpsys meminfo查CPU top -m 10打开 system_monitor adb shell am start -n eu.chainfire.perfmon/.LaunchActivity设置CPU的核心数在/sys/devices/system/cpu目录下可以看到你的CPU有几个核心，如果是双核，就是cpu0和cpu1&#xff0c…...

编程日记 2026/1/15 16:03:22

PHP7+MySQL5.6 查立得源码授权系统DNS验证版

# PHP7MySQL5.6 查立得源码授权系统DNS验证版 ## 一、系统概述本系统是一个基于PHP7和MySQL5.6的源码授权系统，使用DNS TXT记录验证域名所有权，实现对软件源码的授权保护。系统支持多版本管理，可以灵活配置不同版本的价格和下载路径&#…...

编程日记 2026/2/4 2:33:13

68元开发板，开启智能硬件新篇章——明远智睿SSD2351深度解析

在智能硬件开发领域，开发板的选择至关重要。它不仅关系到项目的开发效率，还直接影响到最终产品的性能与稳定性。而今天，我要为大家介绍的这款明远智睿SSD2351开发板，仅需68元，却拥有远超同价位产品的性能与功能&#x…...

编程日记 2025/10/29 18:13:03

【QQ音乐】sign签名| data参数加密 | AES-GCM加密 | webpack （下）

1.目标网址：https://y.qq.com/n/ryqq/toplist/26 我们知道了 sign P(n.data)，其中n.data是明文的请求参数 2.webpack生成data加密参数那么 L(n.data)就是密文的请求参数。返回一个Promise {<pending>}，所以L(n.data) 是一个异步函数…...

编程日记 2026/2/5 11:29:14

基于netmiko模块实现支持SSH or Telnet的多线程多厂商网络设备自动化巡检脚本

自动化巡检的需求巡检工作通常包含大量的重复性操作，而这些重复性特征意味着其背后存在明确的规则和逻辑。这种规律性为实现自动化提供了理想的前提条件。自动化工具我们这里采用python作为自动化的执行工具。过程安装 netmiko pip install netmiko 模块的使…...

编程日记 2025/10/13 7:20:23

不用 apt 的解决方案（从源码手动安装 PortAudio）

第一步：下载并编译 PortAudio 源码 cd /tmp wget http://www.portaudio.com/archives/pa_stable_v190600_20161030.tgz tar -xvzf pa_stable_v190600_20161030.tgz cd portaudio# 使用 cmake 构建（推荐）： mkdir build &&…...

编程日记 2025/9/17 2:57:13

【前端】JS引擎 v.s. 正则表达式引擎

JS引擎 v.s. 正则表达式引擎它们的转义符都是\ 经过JS引擎会进行一次转义经过正则表达式会进行一次转义在一次转义中\\\\\的转义过程： 第一个 \ (转义符) 会“吃掉”第二个 \，结果是得到一个字面量的 \。第三个 \ (转义符) 会“吃掉”第四个 \&#x…...

编程日记 2025/9/13 17:22:08

开发体育平台，怎么接入最合适的数据接口

一、核心需求匹配：明确平台功能定位 1.实时数据驱动型平台需重点关注毫秒级延迟与多端同步能力。选择支持 WebSocket 协议的接口，可实现比分推送延迟 < 0.5秒。例如某电竞直播平台通过接入支持边缘计算的接口，将团战数据同步速度提升至…...

编程日记 2025/7/25 0:05:18

3D虚拟工厂

1、在线体验 3D虚拟工厂在线体验 vue3three.jsblender 2、功能介绍 1. 全屏显示功能2. 镜头重置功能3. 企业概况信息模块4. 标签隐藏/显示功能5. 模型自动旋转功能6. 办公楼分层分解展示7. 白天/夜晚切换8. 场景资源预加载功能9. 晴天/雨天/雾天10. 无人机视角模式11. 行人…...

编程日记 2026/2/4 2:33:11

创建目录存放签证 [rootserver100 ~]# mkdir /etc/nginx/certs [rootserver100 ~]# openssl req -newkey rsa:2048 -nodes -sha256 -keyout /etc/nginx/certs/timinglee.org.key -x509 -days 365 -out /etc/nginx/certs/timinglee.org.crt ..................................…...

编程日记 2026/2/4 2:33:09