机器学习案例|使用机器学习轻松预测信用卡坏账风险,极大程度降低损失

01、案例说明

对于模型的参数,除了使用系统的设定值之外,可以进行再进一步的优化而得到更好的结果。RM提供了几种参数优化的方法,能够让整体模型的效率提高。而其使用的概念,仍然是使用计算机强大的计算能力,对于不同的参数组合进行准确度评估,使用硬算的方式选出最优的参数。这个也是机器学习里面的另外一个特点与优势。

本案例讨论的是:对于信用卡公司需要判断客户会不会变成坏账(Default),从而预先防范,比如降低信用额度或是加速催缴欠款,而减低未来可能损失的风险。可以使用现有数据中已知的结果建立模型之后,对于未知的数据进行模型预测。整体模型如下图所示:

图片

02、数据资料

做法仍然如同前面一样,先将数据读入之后,进行观察。共有424个数据值,包括了20个实数值的属性,其中除了有确定的坏账记录之外还有部份数据是属于未知,这个就是需要预测的目标值。

数据本身并没有缺失,并且基本上种类都是匹配的。通过使用散点矩阵图形观察,各个属性之间并没有显著的相关性。唯一需要考虑的是,因为其中的数值范围,差异比较大,所以如果是使用某些模型,可能需要将数据做常态化的操作。但是如果使用的是支持向量机,可以处理不同数量级的数字(通过核函数映射),基本上可以不需做常态化的转换,所以在数据的整理上面,可以直接的使用。

03、操作流程

Step1读入数据

这个操作是将数据读入,并且进行观察,确定数据不需要做其他的操作。第2个是将数据中坏账的属性设定为目标值,作为操作的对象。

Step2 数据整理

这个部分2个算子,第一个Filter Example是将数据分成有目标值的已知数据和没有目标值的未知数据,这个的操作直接可以使用其参数的设定,但是要注意,这个部分的参数设定,需要先选择参数中的 “Condition Class” 才能作设定,而系统的缺省设定是 “(Custom-Filters)” ,如下图所示:

图片

第2个是将未知的数据,将其目标值取消,而作为模型预测的结果判断。这边也有一个小技巧,与其将所有的需要参数都选入,简单的方式是将不需要的参数作为选择的标准,再做一个相反的设定,这样更为简洁,如下图所示:

图片

Step3: 模型建立/优化

这个部分是最关键的部分,使用这个操作,是一种将依照我们所选取的参数,将其所有的可能性做一个组合之后,全部的进行测试,依照其效果的优劣,选出最优化的模型,作为输出的结果,如下图所示:

图片

通过对于这个算子的参数设定,可以选取模型中不同参数来做优化。其中参数可以设定数值范围和精度都能够设定。系统依照所有的组合,进行每一次的运算产生出最好的参数值。这种运算方式,如同设定一个2D 的网格,系统在每一个节点进行运算,所以这种参数优化的方式称作为网格式(Grid)。

这边我们使用的是支持向量机的模型,其中所设定的参数,可以参考相关支持向量机的基本理论。对于使用径向核函数(Radial Kernel),其中的Gamma值和相关的容忍值C,可以有不同的设定而得到不同的结果。这个就是我们希望能通过参数优化的方式,来做到最合适的参数组合。如果不同的核函数,会有不同的参数需要优化。

如果将这个算子打开,其中内部分为两个算子,一个是我们熟悉的交叉验证,而第二个是一个日志记录。前一个没有太多的悬念,而后一个可以再进一步的探讨。

我们可以观察到,在交叉检验的步骤之后,其中准确度(Per)的端口输出与日志记录(Log)连接。如果再细看日志记录其中,它会将每一次的不同参数组合的检测结果保存,而其所设定的记录参数是我们在整个参数优化的过程中所更改的参数,而通过这个记录可以把变化过程中相关的参数设定和结果完全保存。在此有两点特别值得说明,第一这是系统保存在内存的空间,所以不需要另外给予文件名(但是也可以用文件名而保存到硬盘上);第二是系统的参数是通过Meta-Data的传送,所以能够知道是相对于何种模型的参数而进行设定。

Step4: 模型使用

优化模型的操作最后的输出,就是最优模型,可以通过 Mod的端口使用。所以直接的可以将之前未知的数据,直接导入并且使用Apply Model的操作判断未知数据的结果。

Step5: 日志输出

我们可以通过将原来在优化参数的操作中所保存的日志记录,通过直接将其输出,观察到其所有在参数和结果之间的整个过程。

04、结果说明

这个部分的输出,也是很值得观察。虽然只有三个对外的连接点,却有五个输出的页面,如下图所示:

图片

其中主要是前三个结果:一个是日志的输出,可以观察到其优化过程中所有参数和效果之间的数据;第二个是对于最优化的模型其准确度的输出,作为我们模型使用的依据;第三个是对于未知数据,使用最优化模型之后,来预测其结果。

后面2个的输出页面,是作为参考,但是值得注意的是其中对于Optimize Parameters(Grid)的输出。可以通过观察,看到如果使用其顺序是依照正常的方式,先计算固定C然后变动Gamma,之后再进行下一组,系统虽然是采用了并行计算,但是其顺序仍然逐步进行,所以结果数据是依照顺序的表现,如下图所示:

图片

这个部分,解决了很多在机器学习使用上面会碰到的问题。到底何种参数的设定是一个最优化的参数?这里再一次展示计算机的硬实力,就是它的计算能力。通过对于不同的参数组合,全部给予计算,再来选择最优化的一个参数,而并不是依照任何的公式或者是其他的做法,这边也表示出机器学习的另外的特点。


关于 Altair RapidMiner

Altair RapidMiner 数据分析与人工智能平台,是 Altair 澳汰尔公司旗下仿真、HPC 和数据分析三块主营业务中的解决方案,它在数据分析领域最早实现将自动化数据科学、文本分析、自动特征工程和深度学习等多种功能同时集成的一站式数据分析平台,帮助用户解决从数据清洗、准备、数据科学建模到模型管理和部署,同时又支持数据和流数据的实时分析可视化的数据分析平台。

欲了解更多信息,欢迎关注公众号:Altair RapidMiner

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mfbz.cn/a/727041.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

01 Shell 编程规范与变量

目录 1.1 Shell脚本概述 1.1.1 Shell的作用 1.1.2 编写第一个Shell脚本 1.1.3 重定向与管道操作 1. 重定向操作 1. 重定向输出 2. 重定向输入 3. 错误重定向 2. 管代操作 1.2 Shell变量的作用、类型 1.2.1 自定义变量 1. 定义新的变量 2. 查看和引用变量的值 3. 变量赋值的特…

Django使用django-apscheduler实现定时任务

定时任务可以在后台定时执行指定的代码,避免了很多人为操作。下面是在Django项目中如何使用定时任务的具体操作流程。 我在这里使用的 django-apscheduler库来实现定时任务。 一、安装 django-apscheduler pip install django-apscheduler二、在项目的setting.py…

java.io.eofexception:ssl peer shut down incorrectly

可能是因为 1)https设置 2)超时设置 FeignConfig.java package zwf.service;import java.io.IOException; import java.io.InputStream; import java.security.KeyStore;import javax.net.ssl.SSLContext; import javax.net.ssl.SSLSocketFactory;import org.apac…

PXE高效批量网络装机(补充) 实验部分

然后把防火墙、安全机制全都给关闭掉,不要让它们干扰后续的实验: 然后安装那几个需要用到的软件包: 如果重启了系统vsftpd是不能自动启动起来的,如果想让该服务每次开机都自动的启动起来,可以执行下图中的命令&#xf…

关系数据理论

什么是关系数据理论:用来评判数据库逻辑设计“好坏程度”的标准;二是如果逻辑设计中存在“不好”的关系模式,如何将其修改为“好”的关系模式。 函数依赖:举个例子:学生表中,一个学生的学生号确定了,学生的…

Arduino平台软硬件原理及使用——无源蜂鸣器模块的使用

文章目录 一、蜂鸣器发声原理 二、无源蜂鸣器与有源蜂鸣器的区分 三、无源蜂鸣器模块在Arduino中的使用 一、蜂鸣器发声原理 上图为常见的不同封装及规格的蜂鸣器。 同蜜蜂、知了等昆虫发声原理一样,蜂鸣器同样靠振动来发出声音; 如上图为无源蜂鸣器的内…

whiteboard - 笔记

1 drawio draw.io GitHub - jgraph/drawio: draw.io is a JavaScript, client-side editor for general diagramming. 2 demo 可以将XML数据保存到服务器上的data目录。需要在服务器端创建一个接收和处理POST请求的脚本,该脚本将接收到的SVG数据保存到指定的文件中。下面是…

subversion

subversion Install # CentOS安装Subversion yum install subversion mkdir /var/svn/ systemctl restart svnserve# Docker安装Subversion(参考:https://github.com/garethflowers/docker-svn-server) docker run \--name my-svn-server \…

《C++ Primer》导学系列:第 6 章 - 函数

6.1 函数基础 6.1.1 基本概念 函数是C程序的基本组成单元,用于将代码组织成可以复用的模块。函数通过函数名进行调用,并且可以接受参数和返回值。函数的定义包括函数头和函数体,其中函数头描述了函数的接口,函数体包含了具体的实…

RabbitMQ 开发指南

连接RabbitMQ 连接方式一: 也可以选择使用URI的方式来实现 连接方式二: Connection接口被用来创建一个Channel,在创建之后,Channel可以用来发送或者接收消息。 Channel channel conn.createChannel();使用交换器和队列 声明…

基于Java的留守儿童爱心网站

你好呀,我是计算机学姐码农小野!如果有相关需求,可以私信联系我。 开发语言:Java 数据库:MySQL 技术:B/S结构,SpringBoot框架 工具:MyEclipse,Navicat,To…

全球森林碳通量(2001-2023年)数据集

简介 全球森林碳通量(2001-2023) 森林碳净通量表示 2001-2023 年间森林与大气之间的碳净交换量,计算方法是模型期内森林排放的碳与森林清除(或封存)的碳之间的平衡(兆克 CO2 排放量/公顷)。碳净…

【PB案例学习笔记】-20制作一个超链接按钮

写在前面 这是PB案例学习笔记系列文章的第19篇,该系列文章适合具有一定PB基础的读者。 通过一个个由浅入深的编程实战案例学习,提高编程技巧,以保证小伙伴们能应付公司的各种开发需求。 文章中设计到的源码,小凡都上传到了gite…

【机器学习】基于稀疏识别方法的洛伦兹混沌系统预测

1. 引言 1.1. DNN模型的来由 从数据中识别非线性动态学意味着什么? 假设我们有时间序列数据,这些数据来自一个(非线性)动态学系统。 识别一个系统意味着基于数据推断该系统的控制方程。换句话说,就是找到动态系统方…

生成式AI时代,数据存储管理与成本如何不失控?

无数据,不AI。 由生成式AI掀起的这一次人工智能浪潮,对企业的产品、服务乃至商业模式都有着颠覆性的影响。因此,在多云、大数据、生成式AI等多元技术的驱动下,数据要素变得愈发重要的同时,企业对于数据存储的需求也在…

LabVIEW开发扫描隧道显微镜

扫描隧道显微镜利用量子隧穿效应,通过一个极细的探针在样品表面上进行扫描,测量隧穿电流的变化,以得到样品表面的原子级别图像。探针与样品之间的距离非常小(约1纳米),隧穿电流对距离变化极其敏感&#xff…

全能AI客户端:ChatGPT Web Midjourney Proxy,AI绘画+GPT4o对话

这绝对是目前最全能的 AI 客户端,ui 界面集成 ChatGPT AI 对话、Midjourney AI 画图、Suno AI 音乐等等市面主流的 AI 功能,只需绑定一个 API key 即可使用全部 AI 功能,Midjourney 甚至比官方好用几倍! 项目简介 ChatGPT Web Mi…

【嵌入式开发】STM32+USB的快速开发

目录 一、概述 二、STM32+USB开发流程 2.1 建立新的工程 2.2 系统配置 2.3 时钟配置 2.4 操作系统 2.5 选择USB配置 2.6 在USB_HOST中选择支持的子类(class) 2.7 Clock 配置 三、注意事项 3.1 应用驱动配置 3.2 上电调试基础工作 一、概述 USB作为大家耳熟能详的…

【上海交大】博士生年度进展报告模板

上海交通大学 博士生年度进展报告模板 比较不好找,在交我办中发起申请流程后才能看到链接,链接如下: https://www.gs.sjtu.edu.cn/xzzx/pygl/15

【Python】使用OpenCV特征匹配检测图像中的【特定水印】

如果没有方向 往哪里走都是前方 做自己的光 不需要多亮 曾受过的伤 会长出翅膀 大雨冲刷过的天空会更加明亮 流过泪的眼睛也一样 做自己的光 悄悄的发亮 逆风的方向 更容易飞翔 世界怎样在于你凝视它的目光 那未曾谋面过的远方 或许就在身旁 &#x1f3b5…