← 所有課程

碩一上

電子商務資料管理

2026-09-18 · 第 2 週

資料清理與預處理課程重點總結

核心概要

本課程聚焦資料分析前的關鍵步驟——資料清理與預處理。授課者首先回顧了上週內容(資料定義與收集),接著詳細說明資料常見問題(不完整、不一致、雜訊),並介紹資料整合、轉換、正規化與編碼技術。最後簡介資料精簡(降維)的目的與方法。課程強調高品質資料對後續分析的影響,並預告下週將繼續探討分類技術。

核心內容

1. 資料常見問題

  • 資料不完整: 屬性或分析所需欄位遺漏,可能因歷史設計、人為或系統因素導致。例如:缺少年齡欄位,無法直接分析顧客年齡與購買關係。
  • 資料不一致: 不同來源整合時產生單位、幣別、綱目(欄位結構)差異,需統一處理。
  • 雜訊(離群值): 資料收集或輸入錯誤,例如年紀10歲但學歷博士。需透過屬性篩選或資料記錄精簡(刪除異常值)來消除。

2. 資料整合與處理

  • 綱目不一致: 即使產品資料表名稱相同,不同分公司的欄位設計可能不同,需先整合成一張統一表格。
  • 消除重複: 檢查產品ID等唯一值,刪除重複記錄。
  • 邏輯驗證: 確認有效值(性別僅男/女)、數值唯一性(身份證號)、參考完整性(訂單會員編號必須存在於會員資料表)、合理性(年齡與學歷相符)。

3. 資料轉換與正規化

  • 一般化: 將細項資料(如完整地址)轉為較高層次類別(如北、中、南、東),視分析需求而定。
  • 建立新屬性: 從出生年月日轉換為年齡,或從交易時間提取「時段」。
  • 正規化: 避免數值範圍差異過大影響演算法,常用方法為標準化(如 0-1 或 Z-score)。
  • 離散型編碼(One-Hot Encoding): 對於無順序關係的類別(如顏色),避免直接編號造成虛假距離,應增加多個二元欄位。

4. 資料形態與適用分析

  • 離散型(類別): 適合分類任務,不適合群集分析(因距離計算困難),例如職業、顏色。
  • 連續型(數值): 可計算距離,適合分類與群集,但理解度較低,例如收入、年齡。
  • 時間序列: 隨時間變化的資料(如股價)。
  • 交易形式: 用於關聯法則(如購物籃分析)。

5. 資料遺漏處理方法

  • 直接忽略(刪除): 適用於資料量大、遺漏率低(約 <10%),對統計結果影響小。
  • 自動填補:
    • 簡單填補:整體平均數/眾數,但可能忽略群組特性。
    • 分群平均:按類別(如會員等級)分別計算平均或眾數,更精確。
    • 機器學習預測:透過監督式學習預測遺漏值(下週詳述)。

6. 資料精簡(降維)

  • 目的: 過濾代表性低或無關的屬性或記錄,提升模型準確性、減少運算時間與儲存成本。
  • 維度精簡: 刪除不重要的欄位(如公司員工人數對預測破產風險幫助不大)。
  • 記錄精簡: 刪除或保留代表性資料(如刪除離群值)。
  • 數值精簡(概念化): 將連續數值轉為高、中、低等類別,簡化表示。

風險與關鍵問題

  • 資料品質直接影響後續分析結果:若資料未妥善清理,建立之模型可能不準確或無效。
  • 遺漏值處理需謹慎:簡單平均填補可能掩蓋群體差異,機器學習方法雖精確但需額外成本。
  • 離散型編碼不當(如直接給定序號)會扭曲相似度計算,尤其在非監督學習中。
  • 研究題目需與可用資料匹配:若缺乏關鍵屬性,可能需放棄議題或大幅調整研究方向。

後續方向

  • 下週課程將介紹分類技術,並示範如何用機器學習方法填補遺漏值。
  • 繼續探討資料精簡的進階方法與實際應用案例。

2026-09-18 · 第 2 週

資料維度精簡與特徵選取方法

核心概要

這段內容是一堂關於資料前處理的課程,重點在於資料維度(特徵)精簡與資料記錄精簡。講師說明了為什麼需要進行維度精簡(減少儲存空間、提升建模效率、有時可提升正確率),並介紹了多種特徵選取方法,包括主觀測量以及客觀的統計方法(一次性測量、關聯性、鑑別力、資訊量)與機器學習方法(準確性測量、PCA、包裝式與嵌入式演算法)。最後也討論了資料記錄(樣本)精簡的各種抽樣與選取策略。

核心內容

  • 維度精簡(特徵選取)的目的與概念:

    • 資料維度、資料欄位、資料屬性是同義詞,一個特徵就是一個用來描述事物的資料維度。
    • 維度精簡可以減少儲存空間,加速模型訓練,有時還能提升預測正確率。
  • 特徵選取方法:

    • 主觀測量:依賴領域知識或直覺判斷特徵的重要性。例如,預測會員等級時,平均月收入可能比教育程度和年齡更具決定性。
    • 客觀統計測量法:適用於特徵量多、難以直覺判斷時,常用於「過濾式 (Filter)」方法。
      1. 一次性測量法:檢視每個特徵對目標(如會員等級)的「不一致性」程度。不一致性越低,表示該特徵越有代表性,重要性越高。
      2. 關聯性測量法:計算每個特徵與目標變數的關聯度,關聯度越高,特徵越重要。
      3. 鑑別能力測量法:衡量某特徵區分不同類別的能力,鑑別力越高越好。
      4. 資訊量(資訊獲利,IG):利用「亂度」的概念,計算每個特徵能為目標變數提供多少資訊。亂度(不確定性)越低,資訊獲利(IG)越高,特徵越重要。
    • 結論:平均月收入的各項指標(不一致性低、關聯性高、鑑別力高、資訊獲利高)均優於教育程度和年齡,因此被認為是預測會員等級最重要的特徵。
  • 主成分分析 (PCA):

    • 一種統計降維方法,與資訊獲利類似,但輸出的是「主成分」。
    • 通常選取「特徵值大於 1」的主成分作為保留的特徵,但有時也會視情況保留接近 1 的特徵,避免過度篩選。
  • 特徵選取工作流程與演算法類型:

    • 流程:原始資料 → 特徵選取(找出 n 個重要維度) → 使用精簡後的資料訓練模型。
    • 過濾式 (Filter):如統計方法,速度快,可輸出特徵重要性排名,但需自行決定保留多少特徵(例如保留前 80%)。
    • 包裝式 (Wrapper):如基因演算法 (GA),將一個預測模型(如 CART、SVM)作為適應函數,不斷嘗試不同的特徵組合,直到找到使模型正確率最高的子集。優點是結果較佳,但計算成本高、耗時。
    • 嵌入式 (Embedded):如決策樹演算法,在模型建構的同時自動完成特徵選取。例如,決策樹建立後,樹節點所使用的特徵就是被篩選出來的重要特徵。
  • 案例說明:

    • 葡萄酒分類資料集 (13維):使用基因演算法篩選出的特徵,能讓 SVM 的正確率 (0.994) 優於直接用原始維度 (0.983) 及用 Filter 方法保留前 80% 維度 (0.933),但對邏輯迴歸 (LR) 則無幫助,顯示降維對不同演算法的影響不一。
    • 糖尿病資料集 (182維):透過 C4.5 決策樹(嵌入式)進行特徵選取,結果只需 10 個特徵就能達到 74.5% 的正確率,成功將 182 維大幅簡化,顯示此方法的強大。
  • 資料記錄(樣本)精簡:

    • 目的:從大量資料中選出具有代表性的子集,以減少訓練時間。
    • 抽樣方法與風險:
      • 隨機抽樣:最簡單,但結果不穩定。建議進行多次隨機抽樣並取平均結果,以避免一次抽樣的偏差。
      • 系統抽樣、分層抽樣:皆有一定隨機性。
      • 分群抽樣:先將資料分群,再從各群中選取代表性資料(如群中心或靠近中心的點),更具解釋性。
    • 智慧型選取方法:
      • ENN (Edited Nearest Neighbor):使用 k-NN 演算法判斷資料點。若某資料點被其鄰居分類錯誤(代表「困難分類」),則保留它(因為它可能提供更多資訊);反之,若被正確分類,則可考慮刪除。
    • 方法比較:基因演算法在資料精簡方面效能極高(可精簡超過 50%),同時能維持不錯的正確率,但計算時間長。
  • 數值精簡(離散化):

    • 將連續型數值(如年齡)轉換為類別型(如青年、中年、老年)。
    • 等寬法:根據數值的最大最小值,將區間等分成指定數量的箱子。
    • 等深法:根據資料筆數,將資料平均分配到指定數量的箱子中,使每個箱子有相近的資料量。

關鍵見解與注意事項

  • 權衡取捨:維度精簡與資料記錄精簡沒有標準答案。在醫療領域,正確率遠比精簡率重要;但在處理巨量交易資料時,即使是微小的正確率下降,若能換來大幅的精簡與效能提升,也可能是值得的。
  • 方法的相互影響:維度精簡、資料記錄精簡、數值離散化等方法會互相影響,最佳組合需透過實驗驗證,無法給出通用答案。
  • 隨機性的風險:研究中若使用到隨機機制(如隨機抽樣、部分演算法),應進行多次實驗並報告平均值,以確保結論的穩健性,避免被質疑。
  • 實驗設計:若研究貢獻在於提出新的特徵選取方法,必須與多種現有方法(如 Filter、Wrapper、Embedded)及多種分類器(如 SVM、CART、神經網路)進行比較,以證明其優越性。若只是為了簡化資料,則可選擇一個常見方法,但需說明理由。

2026-09-12 · 第 1 週

0912電子商務資料管理02

核心概要

本文源於一堂關於資料探勘(Data Mining)與論文實戰的深度講座,核心衝突在於「理想化的研究題目」與「殘酷的資料現實」之間的斷裂:學生往往沈迷於高吸引力議題(如特定指標分析),卻忽視了 Open Data 中欄位缺失或公司內部資料髒亂的致命風險,導致後續模型建構如同在流沙上蓋樓。講者透過解構從「問題定義」到「結果展示」的完整知識發現流程(KDD),強調資料前處理佔據 60-70% 時間的殘酷真相,並犀利指出單一演算法驗證的虛妄——在缺乏交叉驗證(Cross-Validation)與多模型比較(如決策樹 vs. 類神經網路)的情況下,任何 83% 或 88% 的準確率都毫無意義。最終,文本將技術細節轉化為一種研究哲學:沒有永遠的「最佳演算法」(Best Winner),只有在特定時空、特定資料潔淨度下,透過嚴謹的超參數調優與滑動視窗驗證所得出的「當下最優解」。 深度評價:該文本的敘事力量源於其對「技術浪漫主義」的祛魅,它不迴避資料科學中枯燥且充滿不確定性的本質(如黑盒效應、類別不平衡、時間序列洩漏),透過大量具象的比喻(三個臭皮匠、醫生會診、黑盒子)將抽象演算法邏輯具象化,其底層假設在於「研究的價值不在於得出確定結論,而在於嚴謹地證偽與比較過程」。

[選題的賭局:第一志願的幻象與資料的險阻]

  • 理想與現實的撞擊:選題如同選島嶼收集資料,若只憑興趣選擇「吸引力值高」的題目(如分析特定近五年指標),卻發現 Open Data 塔中關鍵欄位缺失,或公司內部資料無法撈取,將導致論文在答辯時被考官質疑「結論不夠客觀」。
  • 策略性退讓:徐老師的洞見指出,第一志願未必是最佳論文題目;有時第二、第三志願因資料完整性高,反而能產出更圓滿的研究成果。選題的本質不是追逐熱點,而是確認「有無相關資料可編制」。
  • 資料前置的生死線:若遇到「10 歲卻擁有博士學歷」的異常數據而未剔除,挖掘出的知識將完全無效。資料前處理被定義為「進化的動力」,若資料不乾淨(Dirty),後續演算法再強大也只是在垃圾堆裡找黃金,注定產生落差。

[永不變動的桶子:演算法的競技場與比較哲學]

  • 資料倉儲的恆定性:建立一個「永不變動」的多維度資料桶子,將同一份乾淨資料反覆丟入不同演算法(統計回歸、決策樹、類神經網路、SVM 等)中進行競技。唯有如此,半年後出現新演算法時,才能公平比較新舊模型的優劣。
  • 單一模型的虛妄:僅用一個演算法得出 83% 正確率毫無意義,因為缺乏基準線(Baseline)。即使文獻指出演算法 A 在某領域表現最佳,也不能直接套用於公司內部資料,因為資料分佈不同,A 未必優於 B。
  • 挑戰主管的直覺:若主管憑經驗認為某方法最好,研究者必須透過實證數據(A 與 B 的實際比較)來推翻或驗證原則,而非盲從文獻或權威。「研究就是這樣,我們永遠不知道最後會怎樣才會有救」。

[黑盒與白盒的博弈:從神經元到隨機森林]

  • 類神經網路的黑盒困境:作為仿人類神經元的技術,其預測準確率高且適合非線性問題,但本質是「黑盒子」(Black Box)。它能預測股價漲跌或破產與否,卻無法解釋「為什麼」,這在需要明確決策規則的管理場景中是致命缺點。
  • 決策樹的透明代價:決策樹是典型的「白盒子」,透過樹狀結構(如:年齡<30 往左,收入高往右)生成清晰規則(If-Then),管理者一目瞭然。但其代價是準確率通常低於類神經網路,且容易過擬合。
  • 三個臭皮匠的智慧:引入「隨機森林」(Random Forest)與「梯度提升」(Gradient Boosting)概念。如同生病時詢問多位醫生而非僅信賴一位,透過建構多棵決策樹並進行投票或加權,能有效打敗單棵樹的局限,雖未必勝過類神經網路,但絕對優於單一模型。

[監督與非監督的邊界:標籤的有無決定路徑]

  • 監督式學習的嚴格門檻:分類(Classification)與推估(Regression)屬於監督式學習,歷史資料中必須包含「Class Label」(標籤),如「良性/惡性」、「高風險/低風險」、「漲/跌」。若無此標籤,演算法無法學習映射關係。
  • 非監督式的探索本質:關聯法則(Association Rules,如尿布與啤酒)與分群分析(Clustering)屬於非監督學習。前者尋找「買 A 亦買 B」的頻率模式,後者在無預設分類下,將高維度數據(如 15 個屬性即 15 維)壓縮投射,找出屬性相似的群體(如居住地點、車種、支出相近的人群)。
  • 維度詛咒與視覺化:人類受限於三維視覺,面對高維數據需透過演算法將其「壓扁」為二維圖表以呈現分佈。若兩類數據在多維空間中重疊嚴重(分不開),任何演算法的錯誤率都會飆升。

[時間的陷阱:交叉驗證與滑動視窗]

  • 隨機切分的風險:僅將資料隨機分為 80% 訓練與 20% 測試是一次性的賭注,不同隨機種子會導致結果波動,結論缺乏客觀性。
  • K 折交叉驗證(K-Fold Cross-Validation):將數據分為 K 組(如 5 折),輪流使用其中一組測試、其餘訓練,確保每筆數據都被測試過一次,最終取平均正確率。這是論文嚴謹度的基本門檻。
  • 時間序列的滑動視窗:對於涉及時間的數據(如股價、季節銷售),嚴禁使用未來數據預測過去。必須採用「滑動視窗」(Sliding Window),例如用 2015-2019 預測 2020,再滑動用 2016-2020 預測 2021,確保時序邏輯的正確性。
  • 類別不平衡的危局:在網路入侵偵測等場景中,正常流量佔 99%,異常僅 1%。若未處理此不平衡,模型只需全部預測「正常」即可達 99% 準確率,卻完全漏掉關鍵的異常訊號。

下一步行動

  • @研究者/學生 (論文撰寫者):
    • 重新檢視選題,確認資料來源(Open Data 或公司內部)是否具備關鍵欄位,若第一志願資料缺失,立即啟動第二、第三志願方案 - [TBD]。
    • 執行資料前處理,重點檢查異常值(如 10 歲博士)、空值處理及數據離散化(如年收入轉為高/中/低) - [下週前置作業]。
    • 設計實驗時,必須設定「超參數」(Hyperparameters)搜尋範圍(如神經網路隱藏層數 1-5 層、神經元數 10-100),並使用工具自動跑完排列組合以尋找最佳解 - [實驗設計階段]。
    • 在模型評估階段,強制實施 K 折交叉驗證(K=5 或 10)或時間序列滑動視窗,嚴禁僅使用單一隨機切分數據 - [模型驗證階段]。
    • 比較至少兩種以上不同類型的演算法(如決策樹 vs. 類神經網路 vs. 隨機森林),並記錄各自在不同參數下的表現,拒絕單一模型結論 - [結果分析階段]。

啟示

  1. 資料潔淨度大於演算法複雜度:再進階的演算法若餵入髒數據(Dirty Data),產出的知識依然無效;反之,乾淨且具代表性的數據即便搭配簡單模型,也能事半功倍。
    • 原文金句:「吃藥不乾淨,後面都不用講...你媽你再怎麼強大,再怎麼進階,再怎麼快速你就不乾淨啊。」
  2. 沒有永恆的最佳演算法(No Free Lunch):演算法的優劣取決於當下的數據分佈與問題領域,五年前的最佳解未必適用於今日,必須透過不斷的比較與重訓(Re-training)來適應變化。
    • 原文金句:「不會擁有一個 best winner...不同領域或是不同時間點,你收集的資料長度又不一樣的時候,不一定是跟你的結論是一樣的。」
  3. 研究的本质是對抗不確定性:從選題的妥協到參數的調優,整個過程是在承認「我們不知道最後會怎樣」的前提下,透過嚴謹的實驗設計(如交叉驗證、多模型比較)來逼近真理,而非預設答案。
    • 原文金句:「如果都知道了我幹嘛去救(研究)?所以研究的是一個有趣的東西,當我不知道,那我們就要嘗試時間來看。」

2026-09-12 · 第 1 週

0912電子商務資料管理01

核心概要

本文本始於對「數據挖掘」本質的釐清,透過「尿布與啤酒」的經典案例與資深工程師的經驗對比,揭示了從海量雜訊中提煉「人類直覺無法察覺之規則」的核心衝突。敘事從單純的統計查詢(資訊)躍升至機器學習預測(知識),強調演算法雖是被動的工具,其效能卻取決於輸入資料的純度與問題定義的精準度;最終將決策權回歸人性,指出系統僅提供「危機等級」或「流失概率」等預測資源,而按下執行按鈕的仍是管理者的主觀判斷。其力量感源於對「資料—資訊—知識—決策」這一價值鏈條的層層剝離,並犀利地指出許多研究誤用複雜演算法解決簡單統計問題的底層邏輯謬誤。

[尿布與啤酒的意外共舞]

  • 關聯分析的奇蹟瞬間:描述超市後臺數據中兩個看似毫無關聯的商品——「尿布」與「啤酒」,竟呈現出極高頻率的同時購買現象。這並非人類直覺所能預料,而是透過關聯分析技術,從死寂的交易記錄中挖掘出的隱藏法則,直接轉化為促銷策略的有價值資訊。
  • 經驗直覺 vs. 數據規律:對比資深工程師憑藉二三十年經驗判斷機臺故障的「內隱知識」,與數據挖掘發現的「未知過熱規律」。前者受限於個人閱歷,後者則能突破人類認知盲區,發現如「特定條件下機臺異常」等非線性因果,展現技術對經驗的超越與補充。

[演算法是被動的餵食者]

  • 垃圾進,垃圾出的殘酷真相:揭露神經網路等演算法的本質是「被動等待」。若輸入的訓練資料夾雜噪音、缺乏代表性或不夠乾淨(如僅憑片面數據預測股價漲跌),模型不僅無法預測未來,甚至會導出導致破產的錯誤結論。演算法無罪,罪在餵食者丟棄了什麼樣的資料。
  • 預測結果與人性博弈:描繪系統輸出「半年後金融危機升至第三等級」或「AI 代理預測明日股價上漲」時的場景。儘管數據客觀冷峻,但最終是否借貸、是否賣出股票的決策,仍受制於人類的恐懼與貪婪。機器提供機率,人類承擔後果,除非完全交由機器人代理,否則主觀情緒永遠是決策鏈條中的變數。

[從死數據到活知識的金字塔]

  • 數據層的死寂與活化:刻畫資料庫底層「永不變動」的原始狀態——客戶姓名、身分證字號、產品屬性等冰冷欄位。透過加減乘除的統計查詢(如季報表、業績獎金計算),這些死數據被活化為「資訊」,回答「上個月賣了多少」的既定事實。
  • 知識層的躍遷與邊界:當引入機器學習演算法,系統不再只是統計過去,而是挖掘「若年齡 30-40 歲且年收入 40-60 萬,則購買筆記型電腦機率達 80%」的潛在規則。這種從「已知」到「未知」的跨越稱為「知識」。同時嚴正警告:此知識具有地域與情境的排他性,臺中公司的挖掘規則不能直接套用於臺北市場,否則將因消費習慣差異而失效。

[問題定義決定演算法的命運]

  • 統計查詢與數據挖掘的界線:並置兩類問題以釐清技術邊界。左側是「上個月有多少顧客未瀏覽網站」、「平均單月消費金額」等可透過 SQL 查詢與簡單統計解決的「資訊層」問題;右側則是「哪些顧客下個月可能流失」、「哪種行銷方式對特定會員有效」等必須依賴分類與預測模型的「知識層」問題。批判學術界常見的用大炮打蒼蠅現象——用複雜的神經網絡去解決一個簡單的加減乘除即可回答的問題。
  • 從專家系統到自動挖掘的演進:回顧早期決策支援系統需依賴人工問卷提取專家經驗(如醫生診斷感冒的規則),對比現今透過大量病患數據(血壓、體重、文字病歷)自動挖掘規則的轉變。強調核心在於「問題定義」先行:若未明確界定是要預測客戶流失還是分析產品關聯,盲目收集資料與運行演算法只會徒勞無功。

下一步行動

  • @管理者/決策者:
    • 依據系統預測的危機等級(如第二級升至第三級)或客戶流失概率,制定具體的借貸策略或Retention 促銷方案 - [TBD]。
    • 在面對 AI 預測結果(如股價走勢)時,克服人性恐懼與貪婪,做出最終的執行決定(按下按鈕) - [TBD]。
  • @數據分析師/顧問:
    • 在專案啟動前,必須先與需求方明確界定「核心問題(Question)」是什麼,據此圈定資料範圍並收集對應資料表(如客戶表、產品表、文字病歷) - [TBD]。
    • 針對不同層級的問題選擇合適工具:若僅需統計報表則使用查詢與加減乘除,若需預測未知規則則導入機器學習演算法,避免過度設計 - [TBD]。
    • 若模型預測效能不佳,需回溯檢查資料清潔度與演算法選擇,進行迭代優化 - [TBD]。

啟示

  1. 工具的邊界在於輸入的品質:演算法本身是被動的,其智慧上限取決於資料的純度與代表性;「丟進垃圾,只能產出破產的預測」。
    • 原文金句:「是你丟了什麼樣的資料給他?...你如果丟的不乾淨,不清不楚的就要訓練...他說噢這樣就是會破產。」
  2. 問題定義先於技術選型:技術沒有優劣之分,只有適用與否。用機器學習解決統計問題是資源浪費,用統計查詢解決預測問題是緣木求魚。
    • 原文金句:「你的科學是什麼,你就用哪個方式來解決,並沒有說誰比較淺或誰比較弱...要抓抓住他的問題是什麼。」
  3. 知識的在地性與排他性:從數據中挖掘出的規則(Knowledge)是特定時空與群體的產物,脫離了原始數據環境(如從臺中移到臺北),規則即刻失效。
    • 原文金句:「這個 knowledge 裡其是否這個臺中的我們公司,但但是臺北不一定啊...不能直接操作,你要再重新亂一次。」