這是 GitHub 資源頁上的一篇科普文章,主題是機器學習裡的「非監督式學習」。文章開頭就說明,這種學習方式專門用來分析「沒有標籤」的資料,也就是沒有人事先告訴電腦這筆資料屬於哪一類,電腦要自己從資料裡找出隱藏的規律、結構與關聯。文章指出,企業每天都會產生大量沒有標籤的資料,如果全部靠人工標記成本太高也不切實際,非監督式學習就是用來從這些資料裡挖出價值的方法。
文章列出好幾種具體技術。分群演算法方面,有 K-means(把資料分成 K 群,每個資料點歸到最近的中心點,常用在客戶分眾)、DBSCAN(依資料密度分群,能處理不規則形狀的群集,常用在詐欺偵測)、階層式分群(建立樹狀的分群結構,適合用在商品分類)。另外還有降維技術,例如 PCA 主成分分析(把資料投影到新的座標系統以去除冗餘資訊)與 t-SNE(把高維度資料壓縮成二到三維方便視覺化)。文章也提到關聯規則探勘(如 Apriori、Eclat 演算法,用來找出「常被一起購買的商品」)以及自編碼器等類神經網路技術。
文章強調這些技術在各行各業都有實際應用,包括零售業的推薦系統、銀行的詐欺偵測、醫療上的基因體分析,以及網路安全的異常偵測。同時也誠實列出限制,例如運算複雜度高、因為沒有標籤答案所以很難驗證分群結果對不對、以及模型判斷過程不容易被人理解等挑戰,這些也是業界目前還在持續討論的難題。
對正在學程式或對 AI 有興趣的孩子來說,這篇文章是認識機器學習分類方式的一個好起點:監督式學習需要有標準答案來教電腦,非監督式學習則是讓電腦自己在資料裡找規律。理解這個差異,有助於未來接觸資料科學或 AI 相關學習時,更快抓住不同方法適合用在什麼情境。
AI機器學習資料科學