【聚类】K-Means聚类(优缺点、手肘法、轮廓系数法、检测异常点、图像压缩,含代码实战)

写在前面:
首先感谢兄弟们的关注和订阅,让我有创作的动力,请一键三连,在创作过程我会尽最大能力,保证作品的质量,如果有问题,可以私信我,让我们携手共进,共创辉煌。

1、介绍

K-Means 是一种简单但功能强大的无监督学习算法,是一种常用的基于距离的聚类算法。K-means算法基本思想是将样本数据划分为K个类别,使得每个数据点与其所属类别的聚类中心之间的距离最小化,从而达到聚类的目的。K-Means 聚类算法可以用于客户类型划分、异常点检测和图像压缩等。

2、原理

K-Means 具体流程如下:

  1. 随机选择K个点作为初始聚类中心;
  2. 计算每个数据点与K个聚类中心的距离,并将其归到距离最近的聚类中心的类别中;
  3. 更新聚类中心的位置,将每个聚类中心的位置移动到其类别中所有点的均值位置;
  4. 重复第2和第3步,直到聚类中心不再改变或达到最大迭代次数。

3、K值选择

通常使用手肘法或者轮廓系数法确定K值。

3.1手肘法

SSE,sum of the squared errors,误差的平方和。在K-means 算法中,SSE 计算的是每类中心点与其同类成员距离的平方和。
在这里插入图片描述

基本思想:

随着聚类数k的增大,样本划分会更加精细,每个簇的聚合程度会逐渐提高,那么误差平方和SSE自然会逐渐变小。

当k小于最佳聚类数时,k的增大会大幅增加每个簇的聚合程度,故SSE的下降幅度会很大;

当k到达最佳聚类数时,再增加k所得到的聚合程度,回报会迅速变小,所以SSE的下降幅度会骤减,然后随着k值的继续增大而趋于平缓。

也就是说SSE和 k 的关系图是一个手肘的形状,而这个肘部对应的k值就是数据的最佳聚类数。这也是该方法被称为手肘法的原因。

3.2轮廓系数法

轮廓系数(Silhouette Coefficient)结合了聚类的凝聚度(Cohesion)和分离度(Separation),用于评估聚类的效果。该值处于-1~1之间,值越大,表示聚类效果越好。

在这里插入图片描述

求出所有样本的轮廓系数后再求平均值就得到了平均轮廓系数。平均轮廓系数的取值范围为[-1,1],且簇内样本的距离越近,簇间样本距离越远,平均轮廓系数越大,聚类效果越好。那么,很自然地,平均轮廓系数最大的k便是最佳聚类数。

4、优缺点

4.1优点

(1)简单直观,容易理解:K-Means算法原理比较简单,实现容易,聚类效果也不错;

(2)处理大数据集效率高:处理大数据集的时候,该算法可以保证较好的伸缩性;

(3)可解释性强:每个簇都有一个中心点,可以用来解释和描述该簇的特征。

4.2缺点

(1)对初始簇中心敏感:不同的初始簇中心可能导致不同的聚类结果;

(2)K值需要人为设定:需要预先指定聚类的簇数K,这个值的选择通常比较困难,需要基于经验或尝试不同的值来确定;

(3)对噪声和异常值敏感:噪声和异常值可能会对K-Means算法的聚类结果产生较大的影响,导致簇的中心偏移或产生不理想的簇;

(4)不适合非凸形状簇:K-Means算法假设簇的形状是凸的(或至少是圆形的),对于非凸形状或形状大小差异较大的簇,可能无法得到好的聚类效果。

5、复杂度

时间复杂度: O(tknm),其中,t 为迭代次数,k 为簇的数目,n 为样本点数,m 为样本点维度。

空间复杂度: O(m(n+k)),其中,k 为簇的数目,m 为样本点维度,n 为样本点数。

6、代码实战

6.1数据划分

# -*- coding: utf-8 -*-
"""
Created on Tue Mar 19 18:45:10 2024

@author: zqq
"""


from sklearn.datasets import make_blobs  
import joblib
import matplotlib.pyplot as plt
from sklearn.cluster import KMeans
from sklearn.metrics import silhouette_score


# 数据, 1000个样本点,3个簇
X, y = make_blobs(n_samples=1000, n_features=2, centers=[[2,2],[4,4],[6,6]], cluster_std=[0.2,0.4,0.5], random_state=2)

# 查看原始数据
plt.figure()
plt.scatter(X[:,0], X[:,1], marker='o')
plt.show()

# 手肘法, 确定K值
SSE = []
k_min = 1
k_max = 10
for k in range(k_min, k_max):
    print("k:", k)
    kmeans_model = KMeans(n_clusters=k, random_state=10)
    kmeans_model.fit(X)
    SSE.append(kmeans_model.inertia_)
# 绘图
plt.figure()
plt.plot(range(k_min, k_max), SSE, marker='x')    
plt.title('The Elbow method')
plt.xlabel('k')
plt.ylabel('SSE')
plt.show()

# 轮廓系数法,确定K值
SC = []
k_min = 2  # 轮廓系数必须从2开始
k_max = 10
for k in range(k_min, k_max):
    print("k:", k)
    kmeans_model = KMeans(n_clusters=k, random_state=10)
    kmeans_model.fit(X)
    sc_score  = silhouette_score(X, kmeans_model.labels_)
    SC.append(sc_score)
# 绘图
plt.figure()
plt.plot(range(k_min, k_max), SC, marker='o')    
plt.title('The sihouette coefficient method')
plt.xlabel('k')
plt.ylabel('sihouette coefficient score')
plt.show() 

# 保存模型
kmeans_model = KMeans(n_clusters=3, random_state=10)
kmeans_model.fit(X)
joblib.dump(kmeans_model, 'kmeans_model.pkl')
y_pred = kmeans_model.predict(X)
plt.figure()
plt.scatter(X[:,0], X[:,1], c=y_pred, s=10)
plt.show()

手肘法:
在这里插入图片描述
轮廓系数法:
在这里插入图片描述
三类数据分布图:
在这里插入图片描述

6.2检测异常点

# -*- coding: utf-8 -*-
"""
Created on Fri Mar 22 09:28:47 2024

@author: zqq
"""


from sklearn.cluster import KMeans
import numpy as np
from scipy.spatial.distance import cdist
import matplotlib.pyplot as plt


# 生成模拟数据
X = np.concatenate([np.random.normal(0, 1, (100, 2)), np.random.normal(10, 1, (10, 2))])

# 可视化样本
plt.figure()
x = X[:,0]
y = X[:,1]
# s散点的面积,c散点颜色
plt.scatter(x, y, s=10, c='red')
plt.show()
 
# KMeans算法拟合
kmeans_model = KMeans(n_clusters=2, random_state=0).fit(X)
 
# 聚类中心
centroids = kmeans_model.cluster_centers_
print("聚类中心:\n", centroids) 

# 每个样本到上述聚类中心的距离,欧式距离
D = cdist(X, centroids, 'euclidean')
 
# 每个样本的最近聚类中心索引
cluster_labels = D.argmin(axis=1)
 
# 设置一个阈值,超过这个阈值认为是离群点
threshold = 2.5
 
# 寻找离群点
outliers = [X[i] for i, d in enumerate(D) if d[cluster_labels[i]] > threshold]
 
# 打印离群点
print("Outliers:\n", outliers)

原始数据分布图:
在这里插入图片描述
给出的异常点数据:
在这里插入图片描述

6.3图像压缩

# -*- coding: utf-8 -*-
"""
Created on Fri Mar 22 09:54:47 2024

@author: zqq
"""


import numpy as np  
from sklearn.cluster import KMeans  
from PIL import Image  
import matplotlib.pyplot as plt  
  
# 加载图像并转换为numpy数组  
image = Image.open('flower.jpg').convert("RGB")

image_array = np.array(image)  
  
# 将图像数据重塑为二维数组,其中每一行是一个像素点的RGB值  
pixels = image_array.reshape(-1, 3)  
  
# 使用K-Means算法对像素进行聚类  
n_colors = 8  # 设置颜色数量,这将影响压缩率  
kmeans = KMeans(n_clusters=n_colors)  
kmeans.fit(pixels)  
  
# 使用K-Means聚类中心替换原始像素值  
compressed_pixels = kmeans.cluster_centers_[kmeans.labels_]  
  
# 将压缩后的像素值重塑回原始图像的形状  
compressed_image_array = compressed_pixels.reshape(image_array.shape)  
  
# 将压缩后的图像数组转换为图像对象  
compressed_image = Image.fromarray(np.uint8(compressed_image_array))  
  
# 显示原始图像和压缩后的图像  
plt.figure(figsize=(10, 5))  
  
plt.subplot(1, 2, 1)  
plt.imshow(image)  
plt.title('Original Image')  
  
plt.subplot(1, 2, 2)  
plt.imshow(compressed_image)  
plt.title(f'Compressed Image with {n_colors} colors')  
  
plt.show()  
  
# 保存压缩后的图像  
compressed_image.save('compressed_image.jpg')

原始图像:

在这里插入图片描述

压缩图像:
在这里插入图片描述

参考资料

https://blog.csdn.net/m0_62110645/article/details/134148972
https://zhuanlan.zhihu.com/p/78798251
https://zhuanlan.zhihu.com/p/619922019
https://blog.csdn.net/wsgzjdbb/article/details/106931273
https://blog.51cto.com/u_15060465/4297864
https://www.cnblogs.com/SpaldingWen/p/9960991.html
https://mp.weixin.qq.com/s/FRe7A6Zo9iX7IqOpYofLYg
https://blog.csdn.net/zly_Always_be/article/details/136109128
https://blog.csdn.net/qq_34448345/article/details/127407274
https://blog.csdn.net/wfh684066/article/details/81006472
https://zhuanlan.zhihu.com/p/54045059

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/480796.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

FPGA - AXI4_Lite(实现用户端与axi4_lite之间的交互逻辑)

在之前的博客中对AXI4总线进行了介绍(FPGA-AXI4接口协议概述),在这篇博客中,实现用户端与axi4_lite之间的交互逻辑。 一, AXI4 1.1 AXI4 介绍 对AXI4总线简单介绍(具体可见FPGA-AXI4接口协议概述&#…

【3D reconstruction 学习笔记】

三维重建 3D reconstruction 1. 相机几何针孔相机摄像机几何 2. 相机标定线性方程组的解齐次线性方程组的解非线性方程组的最小二乘解透镜相机标定带畸变的相机标定 3. 单视图重建2D平面上的变换3D空间上的变换单视测量无穷远点 无穷远线 无穷远平面影消点 影消线单视重构 4. 三…

AJAX踩坑指南(知识点补充)

JWT JSON Web Token是目前最为流行的跨域认证解决方案 如何获取:在使用JWT身份验证中,当用户使用其凭据成功登录时,将返回JSON Web Token(令牌) Token本质就是一个包含了信息的字符串 如何获取Token:登录成功之后,服务…

K8s+Nacos实现应用的优雅上下线【生产实践】

文章目录 前言一、环境描述二、模拟请求报错三、配置优雅上下线1.修改nacos配置2.修改depolyment配置3.重新apply deployment后测试4.整体(下单)测试流程验证是否生效 四、期间遇到的问题 前言 我们在使用k8s部署应用的时候,虽然k8s是使用滚动升级的,先…

处理登录失效后提示多个错误

问题: 我的场景是后端规定,即使登录失效返回的code仍是200,然后data的code是999什么的; 原本代码: 修改版代码: 通过节 const NotLoginEvent () > {router.replace("/login");localStorage.clear();M…

队列——数据结构——day5

队列 队列(queue)是只允许在一端进行插入操作,而在另一端进行删除操作的线性表。 队列是一种先进先出(First In First Out)的线性表,简称FIFO。允许插入的一端称为队尾,允许删除的一端称为队头。假设队列是q(a1,a2,……,an),那么a1就是队头元…

银行数字人民币系统应用架构设计

2019年10月,01区块链联合数字资产研究院发布了《人民币3.0:中国央行数字货币运行框架与技术解析》,从数字货币界定和人民币发展历程出发,区分了央行数字货币与比特币、移动支付等的区别,全面介绍了央行数字货币的发展历…

C#,图论与图算法,有向图(Direct Graph)广度优先遍历(BFS,Breadth First Search)算法与源程序

1 图的广度优先遍历 图的广度优先遍历(或搜索)类似于树的广度优先遍历(参见本文的方法2)。这里唯一需要注意的是,与树不同,图可能包含循环,因此我们可能再次来到同一个节点。为了避免多次处理节点,我们使用布尔访问数组。为简单起见,假设所有顶点都可以从起始顶点到达…

ChatGPT智能聊天系统源码v2.7.6全开源Vue前后端+后端PHP

测试环境:Linux系统CentOS7.6、宝塔、PHP7.4、MySQL5.6,根目录public,伪静态thinkPHP,开启ssl证书 具有文章改写、广告营销文案、编程助手、办公达人、知心好友、家庭助手、出行助手、社交平台内容、视频脚本创作、AI绘画、思维导图等功能 ai通道:文心一言、MiniMax、智…

GraalVM详细安装及打包springboot、java、javafx使用教程(打包springboot2篇)

前言 在当前多元化开发环境下,Java作为一种广泛应用的编程语言,其应用部署效率与灵活性的重要性日益凸显。Spring Boot框架以其简洁的配置和强大的功能深受开发者喜爱,而JavaFX则为开发者提供了构建丰富桌面客户端应用的能力。然而&#xff…

Linux设备驱动开发 - 三色LED呼吸灯分析

By: fulinux E-mail: fulinux@sina.com Blog: https://blog.csdn.net/fulinus 喜欢的盆友欢迎点赞和订阅! 你的喜欢就是我写作的动力! 目录 展锐UIS7885呼吸灯介绍呼吸灯调试方法亮蓝灯亮红灯亮绿灯展锐UIS7885呼吸灯DTS配置ump9620 PMIC驱动ump9620中的LED呼吸灯驱动LED的tr…

python--容器、列表

1.python官方内置的容器 list: set: tuple: dict: 弱数据类语言通通没有数组,因为数组指的是 类型固定、大小固定、连续的内存空间。 2.链表: 非连续内存空间 python用的是双向链表 单向链表:优点:不浪费内存&#xf…

代码随想录day28(1)二叉树:二叉搜索树中的插入操作(leetcode701)

题目要求:给定二叉搜索树(BST)的根节点和要插入树中的值,将值插入二叉搜索树。 返回插入后二叉搜索树的根节点。 输入数据保证,新值和原始二叉搜索树中的任意节点值都不同。 思路:对于二叉搜索树来说&…

如何使用ospf (enps) 简单实践ospf协议

1. OSPF的基本概念 OSPF(Open Shortest Path First,开放式最短路径优先)是一种广泛应用于TCP/IP网络中的内部网关协议(Interior Gateway Protocol, IGP),主要用于在同一自治系统(Autonomous Sys…

SpringBoot项目集成XXL-job

文章目录 首先引入依赖配置信息配置类定义定时任务执行方法配置任务执行器配置任务执行计划 在集成 XXL-job 前,首先确保部署了 XXL-job 的 admin 服务, 如果还没有部署的话请参照 Docker安装部署XXL-Job 将 XXL-job 部署起来. 此时, XXL-job 已经部署好了, 下来一步一步的来集…

【Python 滑块不同的操作】对滑块进行处理,列如切割、还原、去除、无脑识别距离等等

文章日期:2024.03.23 使用工具:Python 类型:图片滑块验证的处理(不限于识别距离) 使用场景:? 文章全程已做去敏处理!!! 【需要做的可联系我】 AES解密处理&a…

BGP4+简介

定义 BGP是一种用于自治系统AS(Autonomous System)之间的动态路由协议,常用版本是BGP-4,BGP-4只能传递IPv4路由。针对IPv6的BGP4扩展,通常称为BGP4。 目的 BGP4用于在AS之间传递路由信息,并不是所有情况…

Python爬取歌曲宝音乐:轻松下载Jay的歌

歌曲宝是一个不用付费就能听jay的歌曲,但是每次都只能播放一首不方便,于是今天想把它下载下来,本地循环播放,它所用到的接口是某我的还不错哈 获取搜索接口 分析html请求接口,获取到的数据是直接渲染好的HTML内容&…

lvs+keepalived+nginx实现高可用

主机:192.168.199.132 备机:192.168.199.133 真实服务器1:192.168.199.134 真实服务器2:192.168.199.135 问题: 防火墙没关 132配置ipvsadm进行dr模式 132配置keepalived.conf 133配置ipvsadm进行dr模式 133配置ke…

【测试开发学习历程】计算机编程语言

前言: 学习完数据库,我们便要进入到编程语言的内容当中了。 这里先对编程语言写出大致的分类, 在这之后,我们会以Python为重点, 开始测试开发为重点的编程语言学习。 目录 1 计算机编程语言的发展 2 语言的分类…