Python集成学习之Blending算法详解-巨人网络通讯

Python集成学习之Blending算法详解

一、前言

普通机器学习：从训练数据中学习一个假设。

集成方法：试图构建一组假设并将它们组合起来，集成学习是一种机器学习范式，多个学习器被训练来解决同一个问题。

集成方法分类为：

Bagging(并行训练)：随机森林

Boosting（串行训练）：Adaboost; GBDT; XgBoost

Stacking:

Blending:

或者分类为串行集成方法和并行集成方法

1.串行模型：通过基础模型之间的依赖，给错误分类样本一个较大的权重来提升模型的性能。

2.并行模型的原理：利用基础模型的独立性，然后通过平均能够较大地降低误差

二、Blending介绍

训练数据划分为训练和验证集+新的训练数据集和新的测试集

将训练数据进行划分，划分之后的训练数据一部分训练基模型，一部分经模型预测后作为新的特征训练元模型。
测试数据同样经过基模型预测，形成新的测试数据。最后，元模型对新的测试数据进行预测。Blending框架图如下所示：
注意：其是在stacking的基础上加了划分数据

三、Blending流程图

第一步：将原始训练数据划分为训练集和验证集。
第二步：使用训练集对训练T个不同的模型。
第三步：使用T个基模型，对验证集进行预测，结果作为新的训练数据。
第四步：使用新的训练数据，训练一个元模型。
第五步：使用T个基模型，对测试数据进行预测，结果作为新的测试数据。
第六步：使用元模型对新的测试数据进行预测，得到最终结果。

四、案例

相关工具包加载

import numpy as np
import pandas as pd 
import matplotlib.pyplot as plt
plt.style.use("ggplot")
%matplotlib inline
import seaborn as sns

创建数据

from sklearn import datasets 
from sklearn.datasets import make_blobs
from sklearn.model_selection import train_test_split
data, target = make_blobs(n_samples=10000, centers=2, random_state=1, cluster_std=1.0 )
## 创建训练集和测试集
X_train1,X_test,y_train1,y_test = train_test_split(data, target, test_size=0.2, random_state=1)
## 创建训练集和验证集
X_train,X_val,y_train,y_val = train_test_split(X_train1, y_train1, test_size=0.3, random_state=1)
print("The shape of training X:",X_train.shape)
print("The shape of training y:",y_train.shape)
print("The shape of test X:",X_test.shape)
print("The shape of test y:",y_test.shape)
print("The shape of validation X:",X_val.shape)
print("The shape of validation y:",y_val.shape)

设置第一层分类器

from sklearn.svm import SVC
from sklearn.ensemble import RandomForestClassifier
from sklearn.neighbors import KNeighborsClassifier

clfs = [SVC(probability=True),RandomForestClassifier(n_estimators=5,n_jobs=-1,criterion='gini'),KNeighborsClassifier()]

设置第二层分类器

from sklearn.linear_model import LinearRegression
lr = LinearRegression()

第一层

val_features = np.zeros((X_val.shape[0],len(clfs)))
test_features = np.zeros((X_test.shape[0],len(clfs)))

for i,clf in enumerate(clfs):
    clf.fit(X_train,y_train)
    val_feature = clf.predict_proba(X_val)[:,1]
    test_feature = clf.predict_proba(X_test)[:,1]
    val_features[:,i] = val_feature
    test_features[:,i] = test_feature

第二层

lr.fit(val_features,y_val)

输出预测的结果

lr.fit(val_features,y_val)
from sklearn.model_selection import cross_val_score
cross_val_score(lr,test_features,y_test,cv=5)

到此这篇关于Python集成学习之Blending算法详解的文章就介绍到这了,更多相关Python Blending算法内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

python 算法题——快乐数的多种解法
python使用ProjectQ生成量子算法指令集
Python机器学习算法之决策树算法的实现与优缺点
python3实现Dijkstra算法最短路径的实现
Python实现K-means聚类算法并可视化生成动图步骤详解
Python自然语言处理之切分算法详解
python入门之算法学习
Python实现机器学习算法的分类

上一篇：基于Python3中运算符 **和*的区别说明
下一篇：Pytorch中求模型准确率的两种方法小结

Python集成学习之Blending算法详解

目录一、前言二、Blending介绍三、Blending流程图四、案例一、前言普通机器学习：从训练数据中学习一个假设。集成方法：试图构建一组假设并将它们组合起来，集成学习是一种机Python,集成,学,习之,Blending,...

共祝华诞普强AI能力平台正式上线

你好，普强我在随着人机语音交互技术逐渐成熟，智能语音客服、智能车载语音助手...

webcolct.exe - webcolct 是什么进程

进程文件： webcolct or webcolct.exe 进程名称： Webcolct 进程类别：存在安全风险的进程英文...

“浙江服务”，转型新动力

服务外包，这个很多人已经不陌生的词汇，第一次成为了我省五年规划的主角。在日前...

400呼叫中心解决方案

400呼叫中心解决方案是企业业务发展的核心基础，也是企业业务开展的有效工具，同时...

承担违反著作权合同民事责任的条件

著作权合同当事人承担违约责任，除了有损害事实之外，还应当同时具备以—F两个条件...

微信定位找不到我公司的地址，微信定位找不到我的店铺

为什么微信定位找不到自己公司位置？你可以直接在各大地图软件中提交你公司的地址...

虽然iPhone 8首发遇冷，但在体验店大家还是很热情的嘛

iPhone 8上市接近一周，直营店门可罗雀的凄凉场景依然历历在目。大家纷纷唱衰iPhone ...

电销外呼系统号码从哪来（电销外呼系统违法吗）

本篇文章给大家谈谈电销外呼系统号码从哪来，以及电销外呼系统违法吗对应的知识点...

短视频代运营公司收费报价表明细你是否了解

现阶段市场上面有许多的短视频代运营公司，人们在选择代运营公司的时候，都会关注...

400电话办理满意度调查有更多提高

每一个企业要想发展更好，都应该重视客服方面关注，如果客服方面无法得到要求，那...

厦门联通38套餐电销卡（38元联通卡套餐介绍）

本文目录一览：1、电销卡在哪里办理2、电销卡是什么?3、电销卡有哪些优势?4、电销卡...

金华市稳定高频电话卡便宜

深圳移动联合华为、移动研究院，对现网上干扰问题进行稳定高频电话卡便宜深入分析...

电话外呼系统是如何收费（外呼系统多少钱）

本文目录一览： 1、外呼琐细一个几何钱，有哪些听命？ 2、外呼琐细安装需求哪些用度...

长沙电销专用卡（长沙电销卡办理）

本文目录一览：1、电销卡怎么办理2、求告知现在那种手机卡适合电话营销3、专门打电...

天津智能电销卡办理办理服务商-诚信服务

天津智能电销卡办理办理服务商达到筛选意向客户、锁定目标客户、准确客户分类的营...

Python集成学习之Blending算法详解

全 部 栏 目

目录

一、前言

二、Blending介绍

三、Blending流程图

四、案例

全部栏目