AICE 必考觀念筆記:一頁把四大面向的地基打完
教育性整理:AICE 人工智慧工程素養認證的必考觀念——評估指標、機器學習、大數據生態系、神經網路、生成式 AI 與 AI 倫理,附記憶鉤。

操千曲而後曉聲,
觀千劍而後識器。
—— 劉勰《文心雕龍・知音》(南朝)
這篇是我們準備資策會 AICE 認證時整理的必考觀念筆記,考完覺得留著可惜,整理出來分享。備考的完整心得和策略在另一篇:一週衝刺的考取筆記;這篇專心做一件事——把最會出題的觀念濃縮到一頁,每條配一個好記的鉤子,適合考前掃描,也適合任何想快速補齊 AI 通識的人。
評估指標:先記方向,再記定義
方向題是最冤枉的失分。AUC 越大越好,1.0 完美、0.5 等於亂猜、低於 0.5 比亂猜還糟;誤差類指標(RMSE、MAE)則越小越好。
準確率的騙局必考:資料不平衡時(詐欺只佔 1%),全部猜「正常」也有 99% 準確率,所以不平衡資料要改看 F1 或 AUC。精確率和召回率的分工用代價記:漏掉的代價高(疾病篩檢、詐欺)顧召回率;誤報的代價高(把正常信丟進垃圾桶)顧精確率;F1 是兩者的調和平均。
混淆矩陣的四格:真陽性、真陰性、偽陽性(誤報,第一型錯誤)、偽陰性(漏報,第二型錯誤)。考題常用「第一型、第二型」這組學名,別在考場上第一次見面。
機器學習:三種學習、兩種病
三種學習方式的分界線是「有沒有標準答案」:監督式有標籤(分類、迴歸)、非監督式沒標籤(分群、降維、異常偵測)、強化學習靠獎懲回饋。分群和分類的差別是常客:k-means 是把資料分堆、事先不知道每堆是什麼,跟拿著答案學的分類是兩回事。
兩種病要分得開。過擬合:訓練分數高、測試分數低,背答案背太死——藥是正則化、早停、減少特徵、增加資料。資料洩漏:訓練時用了上線後不可能拿到的資訊(例如用「客戶最後有沒有退貨」預測下單當下的行為),訓練成績好得不真實——藥是把時間軸想清楚,砍掉未來資訊。
不平衡資料的處理:過採樣(複製少數類)、欠採樣(丟掉多數類)、SMOTE(合成新的少數類樣本)。看到「合成」兩個字就是 SMOTE。
大數據生態系:每個工具只問一句「它站在哪一層」
這區名詞最多,但題目幾乎都是角色題,一行一個鉤子:
- HDFS:分散式儲存;NameNode 管目錄、DataNode 存實際資料
- MapReduce:Map 拆開處理、Reduce 彙總各鍵的值
- Spark:記憶體內運算所以快;RDD 的特性是不可變;Spark SQL 處理結構化資料
- Kafka:訊息串流;Producer 發訊息、Consumer 收訊息
- Flume:日誌收集
- Hive:用 SQL 查大數據
- 資料庫分兩家:SQL 家固定綱要、有交易保證;NoSQL 家四種類型——鍵值、文件(MongoDB)、欄族、圖形,「關聯型」不在四類裡
- ETL:擷取、轉換、載入,資料搬家的標準三步
神經網路:分工加一個著名的病
分工用資料型態記:CNN 管影像(卷積抓局部特徵)、RNN 管序列(語音、文字、時間序列)。RNN 的著名毛病是梯度消失——序列一長,前面的資訊傳不到後面;解法是 LSTM(用門控機制記住長期資訊)和它的精簡版 GRU。
深度學習就是層數很多的神經網路;激活函數的作用是引入非線性,沒有它再多層也只是線性模型。
生成式 AI:參數各管一件事
大型語言模型的本質是預測下一個詞。三個參數各管各的:temperature 管隨機性(調低更一致、調高更有創意)、max_tokens 管長度上限(它不管品質,這是經典陷阱)、提示工程管的是怎麼問。
另外記一組區分:判別式模型學「分界線」(分類用),生成式模型學「資料長什麼樣」(能生成新資料)。
AI 倫理:考的是主詞和類型
偏差的三個來源要分開:資料偏差(訓練資料不具代表性)、演算法偏差(模型放大了差異)、測量偏差(收集方式本身歪了)。題目常給情境問「這是哪種偏差」。
責任題抓主詞:誰部署、誰負責;透明性、可解釋性、問責制這幾個詞在選項裡出現時,回到情境問「這條原則要求的是誰、做什麼」。個資處理的大原則:最小蒐集、去識別化、目的限定。
Python:最低限度的三條
如果時間有限,Python 至少記三條:串列可變、元組不可變、字串不可變;函式預設參數在定義時求值一次(可變預設值是陷阱題王);淺拷貝複製外殼、深拷貝連內容物一起複製。其餘瑣碎題的取捨,見心得篇的放生策略。
帶得走的一件事
觀念筆記的價值不在收藏,在提取:每一條後面的「記憶鉤」才是真正的商品——AUC 記方向、工具記樓層、錯誤記代價。
今天就能做的練習:把你正在學的領域挑十個名詞,每個逼自己寫出一句十個字以內的鉤子。寫不出來的那幾個,就是你還沒真懂的。