中文字幕av专区_日韩电影在线播放_精品国产精品久久一区免费式_av在线免费观看网站

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

Python機器學習庫scikit-learn怎么使用

發布時間:2022-07-28 13:42:05 來源:億速云 閱讀:134 作者:iii 欄目:開發技術

本篇內容介紹了“Python機器學習庫scikit-learn怎么使用”的有關知識,在實際案例的操作過程中,不少人都會遇到這樣的困境,接下來就讓小編帶領大家學習一下如何處理這些情況吧!希望大家仔細閱讀,能夠學有所成!

1.數據采集和標記

先采集數據,再對數據進行標記。其中采集數據要就有代表性,以確保最終訓練出來模型的準確性。

2.特征選擇

選擇特征的直觀方法:直接使用圖片的每個像素點作為一個特征。

數據保存為樣本個數×特征個數格式的array對象。scikit-learn使用Numpy的array對象來表示數據,所有的圖片數據保存在digits.images里,每個元素都為一個8×8尺寸的灰階圖片。

3.數據清洗

把采集到的、不合適用來做機器學習訓練的數據進行預處理,從而轉換為合適機器學習的數據。

目的:減少計算量,確保模型穩定性。

4.模型選擇

對于不同的數據集,選擇不同的模型有不同的效率。因此在選擇模型要考慮很多的因素,來提高最終選擇模型的契合度。

5.模型訓練

在進行模型訓練之前,要將數據集劃分為訓練數據集和測試數據集,再利用劃分好的數據集進行模型訓練,最后得到我們訓練出來的模型參數。

6.模型測試

模型測試的直觀方法:用訓練出來的模型預測測試數據集,然后將預測出來的結果與真正的結果進行比較,最后比較出來的結果即為模型的準確度。

scikit-learn提供的完成這項工作的方法:

clf . score ( Xtest , Ytest)

除此之外,還可以直接把測試數據集里的部分圖片顯示出來,并且在圖片的左下角顯示預測值,右下角顯示真實值。

7.模型保存與加載

當我們訓練出一個滿意的模型后即可將模型保存下來,這樣當下次需要預測時,可以直接利用此模型進行預測,不用再一次進行模型訓練。

8.實例

數據采集和標記

#導入庫
%matplotlib inline
import matplotlib.pyplot as plt
import numpy as np
"""
sk-learn庫中自帶了一些數據集
此處使用的就是手寫數字識別圖片的數據
"""
# 導入sklearn庫中datasets模塊
from sklearn import datasets
# 利用datasets模塊中的函數load_digits()進行數據加載
digits = datasets.load_digits()
# 把數據所代表的圖片顯示出來
images_and_labels = list(zip(digits.images, digits.target))
plt.figure(figsize=(8, 6))
for index, (image, label) in enumerate(images_and_labels[:8]):
    plt.subplot(2, 4, index + 1)
    plt.axis('off')
    plt.imshow(image, cmap=plt.cm.gray_r, interpolation='nearest')
    plt.title('Digit: %i' % label, fontsize=20);

Python機器學習庫scikit-learn怎么使用

特征選擇

# 將數據保存為 樣本個數x特征個數 格式的array對象 的數據格式進行輸出
# 數據已經保存在了digits.data文件中
print("shape of raw image data: {0}".format(digits.images.shape))
print("shape of data: {0}".format(digits.data.shape))

Python機器學習庫scikit-learn怎么使用

模型訓練

# 把數據分成訓練數據集和測試數據集(此處將數據集的百分之二十作為測試數據集)
from sklearn.model_selection import train_test_split
Xtrain, Xtest, Ytrain, Ytest = train_test_split(digits.data, digits.target, test_size=0.20, random_state=2);
# 使用支持向量機來訓練模型
from sklearn import svm
clf = svm.SVC(gamma=0.001, C=100., probability=True)
# 使用訓練數據集Xtrain和Ytrain來訓練模型
clf.fit(Xtrain, Ytrain);

模型測試

"""
sklearn.metrics.accuracy_score(y_true, y_pred, normalize=True, sample_weight=None)
normalize:默認值為True,返回正確分類的比例;如果為False,返回正確分類的樣本數
"""
# 評估模型的準確度(此處默認為true,直接返回正確的比例,也就是模型的準確度)
from sklearn.metrics import accuracy_score
# predict是訓練后返回預測結果,是標簽值。
Ypred = clf.predict(Xtest);
accuracy_score(Ytest, Ypred)

模型保存與加載

"""
將測試數據集里的部分圖片顯示出來
圖片的左下角顯示預測值,右下角顯示真實值
"""
# 查看預測的情況
fig, axes = plt.subplots(4, 4, figsize=(8, 8))
fig.subplots_adjust(hspace=0.1, wspace=0.1)
for i, ax in enumerate(axes.flat):
    ax.imshow(Xtest[i].reshape(8, 8), cmap=plt.cm.gray_r, interpolation='nearest')
    ax.text(0.05, 0.05, str(Ypred[i]), fontsize=32,
            transform=ax.transAxes,
            color='green' if Ypred[i] == Ytest[i] else 'red')
    ax.text(0.8, 0.05, str(Ytest[i]), fontsize=32,
            transform=ax.transAxes,
            color='black')
    ax.set_xticks([])
    ax.set_yticks([])

Python機器學習庫scikit-learn怎么使用

# 保存模型參數
import joblib
joblib.dump(clf, 'digits_svm.pkl');

保存模型參數過程中出現如下錯誤:

Python機器學習庫scikit-learn怎么使用

原因:sklearn.externals.joblib函數是用在0.21及以前的版本中,在最新的版本,該函數應被棄用。

解決方法:將 from sklearn.externals import joblib改為 import joblib

# 導入模型參數,直接進行預測
clf = joblib.load('digits_svm.pkl')
Ypred = clf.predict(Xtest);
clf.score(Xtest, Ytest)

Python機器學習庫scikit-learn怎么使用

“Python機器學習庫scikit-learn怎么使用”的內容就介紹到這里了,感謝大家的閱讀。如果想了解更多行業相關的知識可以關注億速云網站,小編將為大家輸出更多高質量的實用文章!

向AI問一下細節

免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

AI

萝北县| 衡山县| 邵武市| 盱眙县| 莒南县| 松原市| 滦南县| 苗栗市| 吉首市| 鸡东县| 汨罗市| 榆社县| 周口市| 青龙| 南京市| 新蔡县| 玉树县| 友谊县| 永登县| 衢州市| 浙江省| 金寨县| 修水县| 营口市| 淮安市| 黑龙江省| 兴文县| 长治县| 永靖县| 桂林市| 扶沟县| 余姚市| 永寿县| 永新县| 汉阴县| 封丘县| 阳高县| 长泰县| 江川县| 台湾省| 巴彦淖尔市|