3科目一系統教材:人工智慧基礎概論
四個章節對應官方評鑑主題 L111–L114。每個概念都先用白話講懂、再給比喻與實例;★ 標示公告試題實際考過的重點,但請以「理解」為先——理解了,變形題怎麼出都不怕。
第 1 章|L111認識 AI 與 AI 治理
🎯 學習目標——讀完你應該能:
- 畫出 AI、機器學習、深度學習的「套圈關係」,並說出彼此差別
- 分辨規則式與學習式系統、弱 AI 與強 AI
- 說明為什麼需要 AI 治理,並記住台灣與歐盟的規範架構
- 判斷哪些場景必須保留人工把關(HITL)
人工智慧Artificial Intelligence, AI
白話說讓電腦去做「本來要靠人類智慧才辦得到」的事:看懂圖片、聽懂語音、翻譯、下棋、寫文章、做判斷。
AI 不是魔法,拆開來就是「數學模型+大量資料+運算力」。歷史上有兩條路線:符號式 AI——把專家的判斷規則一條條寫進程式(如早期的專家系統(Expert System));連結式 AI——模仿大腦神經元,讓機器自己從資料學規律。今天的主流是後者。
💡 比喻規則式像「背食譜做菜」——食譜沒寫到的狀況就當機;學習式像「看一萬部料理影片自己歸納手感」——遇到沒看過的食材也能舉一反三。
🔍 深入理解(點開看進階拆解)
「智慧行為」的判準其實會隨時代移動:1997 年深藍擊敗西洋棋世界冠軍時被視為 AI 的巔峰,今天多數人只把它當「搜尋演算法」。這叫 AI 效應——一旦某項能力被機器攻克,大家就不再覺得它算 AI。所以考題問「AI 的範圍」時,答案通常是「涵蓋多種技術與領域的總稱」,而不是任何單一技術。
另一個常被忽略的點:符號式與連結式不是你死我活。現代系統經常混用——例如 LLM(連結式)搭配規則式的防護欄過濾輸出。判斷題「AI 系統一定使用機器學習?」→ 錯,規則式專家系統也是 AI。
📌 考點:AI 涵蓋多種技術與領域,「AI=機器學習」是錯誤敘述;專家系統屬於 AI、但不屬於機器學習。
AI・機器學習・深度學習的三層關係AI ⊃ Machine Learning ⊃ Deep Learning
白話說三個套在一起的圈:AI 是最大的圈,機器學習是其中一種實現方法,深度學習又是機器學習裡的一個分支。
機器學習(ML):不寫死規則,而是給機器大量例子,讓它自己找出「輸入 → 輸出」的規律。深度學習(DL):用「很多層」的神經網路來學習,最大特點是能自動從原始資料抽取特徵,不必人工設計。
🏭 實例要辨識照片裡的貓——傳統 ML:工程師先人工定義「有鬍鬚、尖耳朵、瞳孔形狀」等特徵,再讓模型學;深度學習:直接餵幾十萬張貓照片,網路內部自己「長出」偵測鬍鬚與耳朵的神經元。
🔍 深入理解(點開看進階拆解)
用同一個任務「辨識手寫數字」把三個圈走一遍,差異就立體了:
- 純規則(AI 但非 ML):if 有一個圓圈 then 是 0 或 8……規則永遠寫不完,遇到潦草字跡就崩潰。
- 傳統機器學習:工程師先人工設計特徵(筆畫數、圓圈數、長寬比),再讓分類器從標好的資料學出判斷規則——特徵好壞決定成敗。
- 深度學習:原始像素直接餵進 CNN,網路自己逐層學出「筆畫→部件→數字」的特徵——資料量與算力換來免人工設計。
再補一個易錯點:生成式 AI 是深度學習裡的分支(第四個圈),但「深度學習=生成式」是錯的——CNN 影像分類這類鑑別式模型也是深度學習。
📌 考點:「深度學習不需人工設計特徵」「所有深度學習都是機器學習,反之不成立」是高頻正確敘述。
圖靈測試Turing Test
白話說你隔著螢幕跟一個「不知道是人還是機器」的對象聊天,如果聊完你分不出來對面是誰,這台機器就通過了測試。
由電腦科學之父圖靈(Alan Turing)提出,重點是它測的是「行為表現像不像人」,完全不涉及機器有沒有意識、感情或真正的理解。
🔍 深入理解(點開看進階拆解)
原始版本叫「模仿遊戲」:評審透過文字終端同時與一個真人、一台機器對話,時間有限(圖靈設想約 5 分鐘),若機器能騙過相當比例的評審,就算通過。注意三件事:
- 它只看對話行為,不檢查內部機制——用什麼技術達成都行。
- 哲學家 Searle 的中文房間論證正是衝著它來:房間裡的人照規則手冊回覆中文紙條,完全不懂中文卻能以假亂真——「表現得懂」不等於「真的懂」。
- 考試層次記兩句:測行為、不測意識;通過測試不代表機器具有真正的理解或自我意識。
📌 考點:選項若寫「圖靈測試可證明機器具有自我意識」→ 必錯。
弱 AI 與強 AINarrow AI vs. Artificial General Intelligence, AGI
白話說弱(狹義)AI 是「單項運動選手」——只精通一件事,下棋冠軍不會開車;強(通用)AI 是「十項全能」——像人一樣什麼領域都能學,目前還不存在。
你用過的所有 AI——ChatGPT、人臉辨識、自駕輔助、翻譯——全部都是弱 AI。ChatGPT 看起來什麼都會聊,但本質仍是「語言」這個單項的超級選手。AGI(通用人工智慧)目前仍是研究目標,不是現實。
🔍 深入理解(點開看進階拆解)
為什麼 ChatGPT 看起來無所不聊,仍然是弱 AI?因為它的能力邊界由訓練資料與架構決定:它不能自主設定跨領域目標、不能像人一樣在全新領域從零自學、沒有持續自我改進的通用能力——它是「語言」這個單項的超級選手。
詞彙補充:比 AGI 更遠的假想稱為超級人工智慧(Superintelligence)——全面超越人類的智慧,目前純屬理論討論。考題陷阱句:「生成式 AI 的出現代表強 AI 已經實現」→ 錯;「AGI 已廣泛商用」→ 錯。
📌 考點:「現有 AI 系統已具備人類等級的通用智慧」→ 必錯選項。
AI 發展三波浪潮與起飛三要素
白話說AI 紅過三次:第一波靠手寫規則(專家系統),因為規則永遠寫不完而退燒;第二波靠統計機器學習;第三波(現在)靠深度學習與生成式 AI。
第三波能起飛,靠的是三要素同時到位:大數據(網路時代累積的海量資料)、算力(GPU 平行運算讓訓練從幾年縮成幾天)、演算法突破(神經網路架構的進展,尤其是 Transformer)。
🔍 深入理解(點開看進階拆解)
把三波的「興起與退燒原因」記成故事,比背年代有效:
- 第一波(1950s–80s)專家系統:把醫師、工程師的規則寫進程式,紅極一時;敗在規則爆炸與「知識取得瓶頸」(專家說不清自己怎麼判斷)→ AI 寒冬。
- 第二波(1990s–2010s)統計機器學習:SVM、隨機森林當家,從資料學規律;但特徵仍靠人工設計,天花板明顯。
- 第三波(2012–)深度學習:2012 年 AlexNet 用 GPU+大資料在 ImageNet 影像辨識一舉突破;2017 年 Transformer 論文(Attention Is All You Need)開啟 LLM 時代。
三要素缺一不可:沒 GPU 算不動、沒大數據學不會、沒新演算法堆再多資料也白搭——考題常問「何者非關鍵因素」,答案多半是「政府補助」這類干擾項。
📌 考點:「何者是深度學習興起的關鍵因素」→ 資料、算力、演算法三選項都對,錯的通常是「政府補助」這類干擾項。
為什麼需要 AI 治理AI Governance
白話說AI 會出錯、會「偏心」(歧視特定族群)、會被拿去做壞事,而且出錯時常常說不出理由。治理就是立規矩:哪些能做、該怎麼做、出了事誰負責。
治理不是「阻止使用」,而是「安心使用」的配套:資料來源合法、模型可受檢驗、結果可被解釋、有人負最終責任。核心概念是負責任 AI(Responsible AI),通常包含六個面向:
- 公平(Fairness):不因性別、種族、年齡給出系統性差別待遇。
- 透明(Transparency):讓人知道「現在是 AI 在服務你/做決定」。
- 可解釋(Explainability):說得出「為什麼這樣判」(對應第 3 章的 XAI 技術)。
- 隱私(Privacy):個資的蒐集與使用受保護(對應第 2 章的隱私技術)。
- 安全穩健(Safety & Robustness):不易被攻擊、出錯有防護。
- 問責(Accountability):出事有明確的負責人——不能把責任推給「演算法自己決定的」。
🔍 深入理解(點開看進階拆解)
治理不是一份文件,而是一組落地機制。企業內部通常拆成四塊:
- 資料治理:來源合法性、授權、品質、保存期限。
- 模型治理:版本管理、上線前驗證、上線後監控、模型卡(Model Card)文件化。
- 使用治理:誰能用、能用在哪(可接受使用政策)、權限控管。
- 事故應變:出錯的通報流程、回滾機制、補救措施。
「透明」與「可解釋」常被混用,考試要分清:透明=讓人知道 AI 的存在與用途(你正在跟機器人對話);可解釋=說明個別決策的理由(你被拒貸是因為負債比過高)。
台灣《人工智慧基本法(草案)》七大原則 ★
白話說台灣版的 AI 大原則有七條:永續發展、人類自主、隱私保護、資安與安全、透明可解釋、公平不歧視、問責。口訣「永・人・隱・資・透・公・問」。
逐條白話:AI 發展要兼顧環境與社會(永續);最終決定權在人(人類自主);保護個資(隱私);系統要防駭防濫用(資安);讓人看得懂、查得到(透明可解釋);不歧視(公平);出事有人負責(問責)。
🔍 深入理解(點開看進階拆解)
「基本法」的定位是原則性框架:宣示國家發展 AI 的大方向與基本價值,不像 EU AI Act 那樣直接規定風險分級義務與罰則;細部規範交由各目的事業主管機關(金融歸金管會、醫療歸衛福部)訂定。
七大原則與國際高度接軌——OECD AI 原則、歐盟「可信賴 AI 準則」都能一一對應。考題玩法:把七原則和「創新豁免」「產業補助」「技術自主」這類不在清單裡的詞混在選項裡——用口訣「永人隱資透公問」逐字排除最快。
📌 考點:常考「下列何者不屬於七大原則」——用口訣快速排除。
歐盟《人工智慧法》風險金字塔 ★高頻EU AI Act
白話說全世界第一部完整的 AI 法律,思路像交通管制——按危險程度把 AI 應用分成四級,越危險管得越嚴。
高風險系統的義務包含:風險管理制度、資料品質要求、紀錄保存、人工監督機制。且風險等級應在設計階段就預先評估,不是上線後才補。
🔍 深入理解(點開看進階拆解)
高風險系統的合規義務可整理成「七件套」:風險管理制度、資料治理與品質要求、技術文件、自動紀錄保存(log)、對使用者的透明資訊、有效的人工監督、準確性/穩健性/資安要求。
- 通用目的 AI(GPAI,如大型語言模型)另有專章:訓練資料摘要、AI 生成內容標示等透明義務。
- 域外效力:只要產品或服務進入歐盟市場就適用——台灣廠商外銷歐洲同樣要遵守。
- 罰則:最重(違反禁止條款)可達全球年營業額 7% 或 3,500 萬歐元取其高——這是它被稱為「最嚴 AI 法」的原因。
應試技巧:先記死「①的三個禁止例」;再抓「②=用人生大事做決定」(工作、貸款、醫療、司法、關鍵基礎設施);③只有「告知」義務;剩下歸④。
📌 考點:給一個應用場景問「屬於哪一級」——記住①的三個禁止項,和②「用人生大事做決定」的特徵(工作、貸款、醫療、司法)。
金管會「金融業運用 AI 指引」六大原則 ★
白話說金融業「錯一筆就影響身家」,所以主管機關特別立了指引:建立治理及問責機制、重視公平性及以人為本、保護隱私及客戶權益、確保系統穩健與安全、落實透明性與可解釋性、促進永續發展。
實務含義:銀行用 AI 拒絕你的貸款,必須能解釋理由;模型要定期驗證、有人負責。注意——對客戶的揭露義務不包含「模型原始程式碼」,這是營業祕密,也不是法規要求的揭露項目。
🔍 深入理解(點開看進階拆解)
六原則可以分兩群記:治理群(建立治理及問責機制、重視公平性及以人為本、保護隱私及客戶權益)+技術群(確保系統穩健與安全、落實透明性與可解釋性、促進永續發展)。
落地時的具體要求:用 AI 做授信、理賠、投顧建議,必須能解釋個別決策理由、提供人工申訴管道、定期驗證模型效能;且把模型外包給第三方供應商,責任仍在金融機構身上(責任不可外包)——這點是進階考點。對客戶的揭露範圍不含模型原始程式碼(營業祕密)。
📌 考點:115 年考過「何者非必要揭露資訊」→ 答案是 AI 模型原始程式碼。
人在迴圈Human-in-the-Loop, HITL
白話說重要的決定,AI 只給建議、人類做最終拍板。
適用場景:醫療診斷、貸款准駁、人事決定(僱用/解僱)、司法量刑輔助——只要決定會重大影響一個人的人生,就要有人把關。相關詞:Human-on-the-Loop(人在旁邊監督,異常時才介入,如自駕車安全員)。
🔍 深入理解(點開看進階拆解)
人機分工其實是一條光譜,三個詞要能分辨:
- Human-in-the-Loop:每筆決策都由人最終拍板(AI 只給建議)——高風險決策的標準配置。
- Human-on-the-Loop:系統自動執行,人在旁監督、異常時介入——如自駕測試車的安全員。
- Human-out-of-the-Loop:全自動無人監督——僅限低風險場景(垃圾郵件過濾)。
設計重點:人要有「實質否決權」,不能只是橡皮圖章——介面必須呈現 AI 判斷的理由與證據(這裡接上 XAI),否則人根本無從監督,形同虛設。EU AI Act 對高風險系統要求的正是「有效的」人工監督。
📌 考點:選項出現「完全自動化、無需人工介入」用在高風險場景 → 幾乎必錯。
📎 第 1 章回顧
AI ⊃ ML ⊃ DL 套圈關係;規則式 vs 學習式;弱 AI(現況)vs 強 AI(未來);治理六面向(公平/透明/可解釋/隱私/安全/問責);台灣七原則「永人隱資透公問」;EU AI Act 四級金字塔;金融六原則;高風險必留人工(HITL)。
✍️ 自我檢核(能口頭回答就過關)
用套圈圖說明 AI、機器學習、深度學習的關係,並各舉一個例子。
看參考解答
AI 是最大的圈(讓機器展現智慧行為,例:專家系統);機器學習是其中一種方法(從資料自己找規律,例:垃圾郵件過濾);深度學習又是機器學習的分支(多層神經網路自動抽特徵,例:人臉辨識)。關係:DL ⊂ ML ⊂ AI,反向包含皆不成立。
深度學習和傳統機器學習最大的差別是什麼?(提示:特徵)
看參考解答
差在「特徵怎麼來」:傳統機器學習靠人工設計特徵(工程師先定義鬍鬚、耳朵形狀…),深度學習由多層網路直接從原始資料(像素、聲波)自動學出特徵,因此能處理影像、語音這類難以人工定義特徵的資料。
EU AI Act 的四個風險等級各舉一個應用例子。
看參考解答
①不可接受風險(禁止):社會評分、公共場所即時遠端生物辨識;②高風險(嚴格合規+人工監督):招聘篩選、信用評分、醫療器材;③有限風險(透明義務):聊天機器人須告知使用者是 AI;④最小風險(不管制):垃圾郵件過濾、遊戲 AI。
為什麼「問責」原則不允許把錯誤推給演算法?
看參考解答
因為演算法不是法律主體,無法承擔責任、無法賠償、也無法被課責;若允許把錯誤推給「AI 自己決定的」,受害者將求償無門,組織也失去改善誘因。所以問責原則要求:決策責任永遠落在部署與營運系統的組織與人身上。
舉三個必須保留人工覆核(HITL)的場景。
看參考解答
例如:醫療診斷(誤診影響生命)、貸款准駁(影響財產權益)、招聘或解僱決定(影響工作權)。共同特徵:對個人權益有重大影響的高風險決策——EU AI Act 也把這些列為高風險、要求有效人工監督。
第 2 章|L112資料處理與分析——AI 的食材學
模型是廚師,資料是食材。「垃圾進、垃圾出(Garbage In, Garbage Out)」——再強的模型也救不了爛資料,所以這一章學的是:認識食材、存放食材、清洗處理食材,以及保護食材的隱私。
🎯 學習目標——讀完你應該能:
- 分辨資料的型態(結構化/半結構化/非結構化)與測量尺度
- 說出資料庫、資料倉儲、資料湖的差別與 ETL 流程
- 對缺失值、異常值、不平衡資料開出正確處方
- 解釋特徵縮放與編碼為什麼必要、何時用哪種
- 分辨聯邦學習、同態加密、差分隱私的適用情境
資料的三種長相Structured / Semi-structured / Unstructured Data
白話說結構化資料=已經是整齊表格(Excel、資料庫,欄位固定);半結構化資料=有標籤但不是表格(JSON、XML、網頁 log);非結構化資料=文字、照片、錄音、影片這種「沒有固定格式」的內容。
世界上八成以上的資料是非結構化的。生成式 AI 之所以是革命,正是因為它終於能大規模利用非結構化資料(讀文件、看圖、聽聲音)。
測量尺度四層:名目尺度(血型——只有類別,無大小)、順序尺度(名次——有大小、間距不等)、等距尺度(攝氏溫度——間距相等但 0 不代表「沒有」)、等比尺度(身高、金額——有絕對零點,可以算倍數)。
🔍 深入理解(點開看進階拆解)
半結構化的「有標籤」具體指什麼?JSON/XML 這類格式有 key-value 與巢狀結構——有欄位概念,但每一筆的欄位可以不一樣,所以進不了欄位固定的關聯式表格,常存進 NoSQL 文件資料庫。
測量尺度決定「你能對它做什麼統計」,這是它真正的用處:
- 名目尺度:只能算次數、眾數(血型 O 型最多)。
- 順序尺度:可加中位數(名次的「中間名次」有意義,平均名次意義薄弱)。
- 等距尺度:可算平均數、標準差,但不能講倍數——攝氏 30 度不是 15 度的「兩倍熱」(0°C 不代表沒有溫度)。
- 等比尺度:有絕對零點,才能講倍數——身高 180 是 90 的兩倍。開爾文溫標是等比、攝氏是等距,這對比常拿來出題。
📌 考點:辨識資料型態+「無序類別=名目尺度」是後面 One-hot 編碼題的伏筆。
資料放哪裡:資料庫、資料倉儲、資料湖Database / Data Warehouse / Data Lake
白話說日常交易資料放資料庫;要做報表分析,把清理好的資料集中到資料倉儲(像超市貨架,分類上架);什麼原始資料都先收著、之後再說,就丟資料湖(像大倉庫)。
- 關聯式資料庫(RDB,用 SQL 查詢):表格欄位嚴格定義,交易遵守 ACID——原子性、一致性、隔離性、持久性。白話:轉帳「扣款+入帳」要嘛全部成功、要嘛全部取消,絕不能只做一半。
- NoSQL 資料庫:綱要彈性、容易水平擴充,適合大量、格式多變的資料。類型:文件型(MongoDB)、鍵值型、圖形資料庫(社交關係)等。
- 資料倉儲:Schema-on-Write——寫入前先定義好格式(上架前先分類);供 BI 報表與歷史分析。
- 資料湖:Schema-on-Read——先存原始資料,讀取時才定結構;供資料科學探索與 AI 訓練。
🔍 深入理解(點開看進階拆解)
ACID 逐字白話:原子性=轉帳的扣款與入帳「全有或全無」;一致性=交易前後帳目守恆不會憑空多錢;隔離性=兩筆交易同時進行互不干擾;持久性=一旦成功,當機也不會消失。NoSQL 陣營則常採 BASE(基本可用、軟狀態、最終一致)——犧牲即時一致性換取大規模擴充。
新趨勢一個詞:資料湖倉(Lakehouse)=資料湖的彈性+資料倉儲的管理能力,近年主流架構。選型口訣:日常交易→關聯式資料庫;海量彈性→NoSQL;報表分析→倉儲;探索與 AI 訓練→資料湖。
📌 考點:倉儲 vs 湖的比較、ACID 的意義、什麼場景選 NoSQL。
ETL:資料的搬家流程Extract–Transform–Load
白話說把資料從各系統搬進分析倉庫的標準三步:Extract 抽取(打包搬出)→ Transform 轉換(清洗、統一格式、彙整——最花工的一步)→ Load 載入(放進目的地)。
💡 比喻搬家:先把東西打包(抽取)、淘汰壞損並重新整理分類(轉換)、最後到新家定位上架(載入)。
現代雲端環境也常見 ELT:先把原始資料載入資料湖,需要時再轉換。
🔍 深入理解(點開看進階拆解)
Transform 這步實際包含哪些動作?清理(缺失、異常、去重)、標準化(日期格式、單位、代碼對照表統一)、彙整(join 多表、聚合統計)、遮罩(敏感欄位去識別化)——這就是為什麼它最花工。
ELT 興起的原因:雲端倉儲算力便宜了,先把原始資料原封不動載入(保留「原汁」),需要時再轉換,轉換邏輯改了還能重跑歷史資料。代價是治理壓力:沒有目錄與品質控管的資料湖會退化成「資料沼澤(Data Swamp)」——找不到、不敢用。
📌 考點:「資料清理與格式統一發生在哪個階段」→ Transform。
資料清理Data Cleaning
白話說真實資料一定又髒又亂:有人沒填、有人亂填、有重複。清理三大課題——缺失值、異常值、重複與冗餘。
- 缺失值(Missing Value):缺太嚴重→整列/整欄刪除;輕微→插補:數值型用平均數(分布對稱時)或中位數(有偏態或極端值時較穩健)、類別型用眾數,進階作法用模型預測補值。
- 異常值(Outlier)★:Z-score 法——某筆資料距離平均超過 3 個標準差(|Z| > 3)就可疑,像全班身高平均 170cm 卻出現一筆 300cm;IQR 法——落在 Q1−1.5×IQR ~ Q3+1.5×IQR 範圍外視為異常。異常值不一定是錯誤,可能是重要訊號(詐欺!),要先判斷再決定刪或留。
- 重複 vs 冗餘:重複=同一筆資料出現兩次(直接去重);冗餘=欄位間高度相關、沒帶來新資訊(身高 cm 與身高 inch 同時存在)。
🔍 深入理解(點開看進階拆解)
缺失值進階一層:缺失的「機制」決定處置是否安全。
- 完全隨機缺失(MCAR):缺不缺純屬意外——刪除相對安全。
- 隨機缺失(MAR):缺失與其他欄位有關——宜插補。
- 非隨機缺失(MNAR):缺失本身就是訊息(高收入者傾向不填收入)——直接刪會造成系統性偏差,實務常加一個「是否缺失」旗標欄位讓模型自己學。
異常值三種處置:確定是錯誤→刪;疑似極端但合理→修(截尾/縮尾 Winsorize);可能是重要訊號(詐欺、設備故障前兆)→保留並另建旗標。方法選擇:資料近常態用 Z-score,偏態明顯用 IQR 較穩健。
📌 考點:Z-score 是「偵測異常值」的方法——選項常拿它跟編碼、降維混淆。
特徵工程Feature Engineering
白話說模型只吃數字,而且對數字的「大小與範圍」很敏感。特徵工程=把原始資料處理成模型好消化的樣子——它往往比換模型更能提升效果。
- 特徵縮放:Min-Max 正規化把數值壓到 0~1(對極端值敏感);Z-score 標準化轉成平均 0、標準差 1(較耐極端值)。為什麼必要:KNN、K-means、SVM 這類「算距離」的模型,若「收入(萬)」與「年齡(歲)」量級差太多,距離會被大數字綁架,等於只看收入。
- 類別編碼 ★:無序類別(縣市、顏色)→ One-hot 獨熱編碼(展開成多個 0/1 欄位);有序類別(滿意度低/中/高)→ Label/Ordinal 編碼(照順序給數字)。無序類別誤用 Label 編碼會捏造「台北 1 < 台中 2 < 高雄 3」的假大小關係,誤導模型。
- 特徵交叉(Feature Cross):把兩個特徵組合出新特徵以捕捉非線性關係——例如「經度 × 緯度」交叉後才能表達「地段」。
- 特徵選擇(Feature Selection):刪掉無關欄位,降低過擬合風險與訓練成本。
- 降維 PCA(主成分分析):把上百個欄位壓成少數「綜合指標」,保留最大變異。比喻:行李真空壓縮——體積變小、主要內容還在,但壓完就看不出原本每件衣服的樣子(犧牲可解釋性)。
🔍 深入理解(點開看進階拆解)
① 編碼的完整邏輯(把上課沒講透的講透)。模型只能吃數字,把文字類別轉成數字的動作就是編碼——但轉法會「偷偷夾帶訊息」。Label 編碼給的是一串有大小的整數,等於夾帶了「順序+間距」兩個訊息;One-hot 只夾帶「屬於哪一類」一個訊息。
為什麼 Label 誤用會出事?線性模型的算式是「房價 = 權重 × 縣市代號 + …」——模型被迫學出「代號每 +1、房價固定加減 w」的規則;把編號順序換掉,學到的模型就完全不同。同一份資料、只因編號不同就得到不同結論,代表模型學的是編號的假象而不是資料的真實規律。One-hot 讓每個城市各有獨立權重,互不牽連。每列只有一個 1(熱),所以叫「獨熱」。
② One-hot 的代價:類別一多欄位就爆炸(全台 368 鄉鎮→368 欄),稱為維度爆炸;高基數類別實務會改用目標編碼或嵌入向量(初級考試不深究,知道有此限制即可)。樹模型(決策樹、隨機森林)只做「切分」不做加減乘除,對 Label 編碼相對不敏感——但考試原則仍是「無序→One-hot」。
③ 縮放的實算感受:顧客 A(30 歲、年收 60 萬)與 B(35 歲、年收 61 萬)。不縮放算距離:√(5² + 10000²) ≈ 10000——距離幾乎全由收入決定,年齡形同虛設。縮放後兩個特徵才平起平坐。這就是 KNN/K-means/SVM 必先縮放的原因。
類別不平衡與 SMOTE ★Imbalanced Data / SMOTE
白話說1000 筆交易只有 5 筆詐騙——模型學會「全部猜正常」就有 99.5% 準確率,但完全沒用。這就是類別不平衡問題。
- 過採樣(Over-sampling):增加少數類樣本。SMOTE 不是單純複製,而是在少數類樣本與其鄰居之間「內插」合成新樣本——比複製更不容易過擬合。
- 欠採樣(Under-sampling):丟掉部分多數類樣本(代價:損失資訊)。
- 調整類別權重:訓練時把「少數類答錯」罰得更重。
配套:評估指標改用 F1-score 或 Recall(第 3 章詳述),別再看 Accuracy。
🔍 深入理解(點開看進階拆解)
SMOTE 的機制具體長這樣:對每一個少數類樣本,找出它的 k 個少數類鄰居,隨機挑一個鄰居,在「兩點的連線上」隨機取一點當作新樣本——所以是內插合成,不是複製貼上。
- 侷限:在雜訊區或兩類重疊區也會照樣合成,可能製造出「模糊地帶」的壞樣本——因此有 Borderline-SMOTE 等改良版。
- 鐵律:只能對訓練集做 SMOTE,驗證集與測試集絕不可動——否則評估結果失真(等於考題洩漏)。
- 實務組合:SMOTE(增加少數類)+適度欠採樣(減少多數類)常一起用;再搭配 F1/Recall 評估,三件事成套。
📌 考點:115 年考「SMOTE 的作用」——關鍵字「合成少數類樣本、改善訓練資料分佈」。
資料切分與資料洩漏 ★Train/Validation/Test Split・Data Leakage
白話說訓練集=課本習題、驗證集=模擬考(用來調參數)、測試集=正式大考(最後只用一次)。資料洩漏=考題偷跑進課本——模型訓練時看到了不該看的資訊,回測成績漂亮、一上線就崩。
- 時間序列的經典錯誤:把三年的股價資料「隨機打亂」再切分——未來的資料混進訓練集,模型等於偷看答案。正確作法:依時間先後切分,舊資料訓練、新資料測試。
- 欄位型洩漏:把「事後才會知道」的欄位放進輸入(例如用「最終理賠金額」預測「是否詐保」)。
🔍 深入理解(點開看進階拆解)
資料洩漏其實有三種型態,第三種最隱蔽也最常犯:
- 時間洩漏:時序資料隨機切分,未來混入訓練(正課講過的股價例)。
- 目標洩漏:輸入放了「事後才會知道」的欄位——用「最終理賠金額」預測「是否詐保」,上線時根本拿不到這欄。
- 預處理洩漏:先用「全部資料」計算平均值/縮放參數,再切訓練測試——測試集的統計資訊已經滲進訓練流程。正確順序:先切分,縮放器只用訓練集 fit,再套用到驗證與測試集。
洩漏的臨床徵兆:驗證成績「好到不合理」。看到 99% 先懷疑洩漏,再懷疑自己是天才。
📌 考點:「時序資料隨機切分會發生什麼」→ 資料洩漏、測試成績虛高。
資料隱私與四大保護技術 ★Privacy-Enhancing Technologies
白話說個資法的基本邏輯:蒐集前告知目的並取得同意、目的外利用要再同意、當事人可查詢/更正/刪除、跨境傳輸有限制。而技術上保護隱私有一條「馬賽克光譜」+兩張王牌。
- 去識別化光譜:假名化(Pseudonymization)——把姓名換成代號,但對照表還在、能還原,仍屬個資 → 匿名化(Anonymization)——徹底斷開、無法還原 → 差分隱私(Differential Privacy)——在統計結果裡撒少量雜訊,讓任何人都無法從結果反推出「某個特定的人」,同時保留整體統計價值(Apple、美國人口普查採用)。
- 聯邦學習(Federated Learning)★:「資料不動、模型動」——模型分頭到各醫院/銀行的本地資料上訓練,只把學到的參數(梯度)傳回彙整,原始病歷、帳務資料完全不出門。適合跨機構合作訓練。
- 同態加密(Homomorphic Encryption)★:可以直接對「加密狀態的資料」做運算,解密後結果依然正確。比喻:把錢鎖在透明保險箱裡請人幫忙數——他數得出總額,卻碰不到也看不到鈔票內容。適合把敏感資料交給雲端運算。
🔍 深入理解(點開看進階拆解)
先用一張「目的→技術」對照表把四招釘死:聯合訓練模型→聯邦學習;把運算委外但內容不能被看→同態加密;對外發布統計結果→差分隱私;內部分析降風險→去識別化。
- 聯邦學習的弱點:交換的梯度其實也可能被反推出原始資訊——實務常再疊上差分隱私或安全聚合(Secure Aggregation)雙保險。
- K-匿名化:去識別化的量化標準——資料集中每一筆至少與其他 k−1 筆在準識別欄位上不可區分。
- 法規地位:假名化資料在個資法/GDPR 下仍是個資(對照表在就還原得回來);真正匿名化後才脫離個資法適用範圍——這是選擇題最愛的分界線。
📌 考點:三種情境分辨——「跨機構聯合訓練」→聯邦學習;「加密狀態下計算」→同態加密;「發布統計不洩個資」→差分隱私。
📎 第 2 章回顧
資料三長相(結構化/半結構化/非結構化)+四種尺度;存放三層(資料庫 ACID/倉儲 Schema-on-Write/湖 Schema-on-Read);ETL 三步;清理三題(缺失/異常 Z-score・IQR/冗餘);特徵工程五招(縮放、編碼、交叉、選擇、PCA);不平衡用 SMOTE+F1;切分防洩漏(時序照時間切);隱私光譜(假名化→匿名化→差分隱私)+聯邦學習+同態加密。
✍️ 自我檢核
資料倉儲和資料湖差在哪?各適合什麼用途?
看參考解答
資料倉儲存「清理好的結構化資料」,寫入前先定義格式(Schema-on-Write),供 BI 報表與歷史分析;資料湖什麼原始資料都先收,讀取時才定結構(Schema-on-Read),供資料探索與 AI 訓練。比喻:超市貨架 vs 大倉庫。
為什麼 KNN、K-means 這類模型訓練前必須做特徵縮放?
看參考解答
因為它們靠「距離」運算。若「年收入(幾十萬)」與「年齡(幾十)」量級差太多,距離幾乎完全由收入決定,年齡形同虛設。縮放(Min-Max 或 Z-score 標準化)把各特徵拉到相同量級,距離才公平反映所有特徵。
「縣市」欄位為什麼不能用 Label Encoding?該用什麼?
看參考解答
縣市是無序類別(名目尺度),Label Encoding 會給出台北=1、台中=2、高雄=3 的編號,模型會把編號當「數量」運算,捏造出不存在的大小與間距關係。正確作法是 One-hot 獨熱編碼:展開成「是否台北/是否台中/是否高雄」多個 0/1 欄位,彼此獨立無大小。
SMOTE 和「直接複製少數類樣本」有什麼不同?
看參考解答
複製只是同一個點重複出現,模型容易背下這些點(過擬合);SMOTE 在少數類樣本與其鄰居的「連線之間」內插出新的合成樣本,增加樣本多樣性、讓決策邊界更平滑。另注意:SMOTE 只能對訓練集做,不能動測試集。
股價預測模型隨機切分資料會發生什麼事?正確作法是?
看參考解答
會發生資料洩漏:隨機打亂讓「未來的資料」混進訓練集,模型等於提前看到未來,回測成績虛高、上線立刻失準。正確作法:依時間先後切分——舊資料訓練、較新資料驗證、最新資料測試。
跨醫院聯合訓練模型但病歷不能外流,該用哪個技術?如果是要讓雲端在看不到內容的情況下代算呢?
看參考解答
用聯邦學習(Federated Learning):模型分頭到各醫院本地訓練,只回傳參數(梯度),病歷不出門。若是要讓雲端「在看不到內容的情況下代算」,則用同態加密(Homomorphic Encryption):對加密資料直接運算,解密後結果仍正確。
第 3 章|L113機器學習——機器到底怎麼「學」?★單科最大題區
這是科目一配分最重的一章(10 題以上)。別急著背演算法名字——先弄懂「訓練」這件事的本質,後面所有概念都會自動長在同一棵樹上。
🎯 學習目標——讀完你應該能:
- 用「調旋鈕+下山」解釋訓練、損失函數、梯度下降、學習率
- 看到情境就分辨五種學習方式,並為場景挑對演算法
- 說明神經網路的組成與反向傳播在做什麼
- 診斷過擬合/欠擬合並開出正確藥方
- 依場景選對評估指標(Recall/Precision/F1/RMSE…)
- 解釋 LIME 與 SHAP 的差別、資料漂移的處理方式
訓練的本質:調旋鈕+下山Training / Loss / Gradient Descent
白話說模型=一台有幾萬(到幾千億)顆旋鈕的機器,旋鈕就是參數(權重 Weights)。訓練=不斷微調旋鈕,讓輸出越來越接近正確答案。
- 損失函數(Loss Function):計分板——量化「這次錯得多離譜」。訓練的目標就是讓損失越低越好。
- 梯度下降(Gradient Descent):濃霧中下山——看不到全景,就摸腳下的坡度,往最陡的下坡方向走一步,重複走到谷底(損失最低點)。「坡度」就是梯度。
- 學習率(Learning Rate):每一步的步伐大小——太大會跨過谷底來回震盪不收斂;太小會走到天荒地老。
- Epoch 與 Batch:整份訓練資料完整看過一輪=1 個 epoch;每次拿一小批(batch)資料算完就更新一次旋鈕。
🔍 深入理解(點開看進階拆解)
用一顆神經元跑一遍實際流程:模型 y = w·x + b 預測房價,w 初始亂猜。餵一筆資料 → 算損失(例如 MSE:預測 800 萬、實際 1000 萬,誤差平方 = 4 兆)→ 梯度告訴你「w 往哪個方向調,損失會下降」→ w 朝那個方向挪「學習率」那麼大的一步。重複百萬次,w 就逐漸調到讓損失最小的位置。
- 批次的三種取法:全批次(整份資料算一次梯度——穩但慢)、隨機梯度下降 SGD(一筆一更新——快但抖)、小批次 mini-batch(主流折衷,一次 32/64/128 筆)。
- 學習率過大的實況:損失曲線上下彈跳、甚至發散成 NaN;過小的實況:曲線幾乎水平,訓練一整天沒進展。實務常用「先大後小」的學習率排程。
📌 考點:學習率過大/過小的後果、損失函數的角色。
五種學習方式 ★115 年考 5 題・最高頻Supervised / Unsupervised / Semi- / Self-supervised / Reinforcement
白話說差別只在一件事:機器學習時「有沒有答案可以對」、答案從哪來。
- 監督式學習(Supervised):每個例子都附標準答案(標籤)。像用「正面圖片、背面答案」的抽認卡教小朋友。兩大任務:分類(Classification)——答案是類別(是不是垃圾郵件);迴歸(Regression)——答案是數值(房價多少)。
- 非監督式學習(Unsupervised):完全沒答案,機器自己找結構。像把一堆衣服倒在床上,自然而然按季節、顏色分成幾堆。任務:分群(Clustering)、降維、關聯規則(超市發現「買啤酒的常順手買尿布」)。
- 半監督式學習(Semi-supervised):「少量有標籤+大量無標籤」一起用——當人工標註太貴、只標得起一小部分時。
- 自監督式學習(Self-supervised):機器自己出題自己答——把句子挖空預測缺字(克漏字),監督訊號來自資料本身,完全不需人工標註。大型語言模型的預訓練就是這個。
- 強化學習(Reinforcement Learning):訓練小狗——做對給零食、做錯不給。代理人(Agent)在環境中試錯,依獎勵訊號(Reward)調整策略。AlphaGo、機器人控制、動態定價。
🔍 深入理解(點開看進階拆解)
把「監督訊號從哪來」做成一行對照,五種一次分清:監督式=人工標籤;非監督式=沒有訊號;半監督式=少量人工標籤+資料結構假設;自監督式=資料自己產生(遮住一部分預測那部分);強化學習=環境的獎勵回饋。
三個容易判錯的實例:
- 「推薦系統拿使用者點擊紀錄當標籤」→ 仍是監督式(標籤來自行為紀錄,不是沒有標籤)。
- 「AlphaGo 自我對弈進步」→ 強化學習(勝負就是獎勵訊號)。
- 「GPT 讀網路文本學會語言」→ 預訓練是自監督;後面的 RLHF 階段才用到強化學習——一個模型的不同階段可以用不同學習方式。
📌 秒判關鍵字:「有歷史答案」→監督;「無標籤自動分群」→非監督;「只標了一小部分」→半監督;「不需人工標註/預測下一個字」→自監督;「試錯+獎勵」→強化。
經典演算法巡禮Classic ML Algorithms
白話說每個演算法記三件事就夠:一句原理、一個特性、什麼時候用。
🔍 深入理解(點開看進階拆解)
再給一層「選型決策順序」,考情境題時心裡跑一遍:
- 要可解釋(金融、醫療報告)→ 決策樹、邏輯迴歸。
- 表格資料要準 → 隨機森林、XGBoost。
- 高維、小樣本 → SVM。
- 要輸出機率 → 邏輯迴歸、單純貝氏。
- 分群:群大致是球狀、知道大概幾群 → K-means;形狀不規則、有雜訊、不想指定群數 → DBSCAN(改調鄰域半徑與密度)。
K-means 的 K 怎麼選?肘部法(Elbow Method):把 K 從 2 試到 10,畫「群內距離總和」曲線,下降幅度突然變緩的「手肘點」就是合理的 K。
神經網路是怎麼運作的Neural Networks
白話說一顆神經元=小型加權投票機:把每個輸入乘上權重加總,超過門檻就「激發」送出訊號。把幾萬顆神經元一層層疊起來,就是神經網路。
- 結構:輸入層 → 隱藏層(一層層加工、逐層抽出更抽象的特徵)→ 輸出層。
- 激活函數(Activation Function):給網路「非線性」能力的開關——沒有它,疊一百層也等於一條直線。常見:ReLU(負數歸零,隱藏層最常用)、Sigmoid(壓成 0~1,二分類輸出)、Softmax(把多類分數轉成加總為 1 的機率,多分類輸出層)。
- 學習四步循環:前向傳播算出預測 → 損失函數計分 → 反向傳播(Backpropagation)從結果往回推、算出每顆旋鈕該負多少責任 → 梯度下降更新旋鈕。像考完試檢討:從錯的答案一路回溯,每個步驟分攤責任、各自修正。
🔍 深入理解(點開看進階拆解)
為什麼要「深」?每一層學一個抽象層級:第一層看邊緣線條、中層組合成形狀、深層組合成物件——深度=特徵的層級化。理論上「很寬的淺網路」也能逼近任何函數,但效率極差;「深」是用層級化換效率。
梯度消失是深網路的歷史難題:Sigmoid 兩端平坦、梯度趨近 0,反向傳播一路連乘後,靠近輸入的層幾乎收不到更新訊號(學不動)。ReLU 正半段梯度恆為 1,大幅緩解——這是它成為預設激活函數的原因。
參數量的直覺:兩層各 1000 顆神經元全連接,光這兩層就有 100 萬個權重——「大模型」的參數量就是這樣一層層堆出來的(GPT 級模型達千億級)。
📌 考點:激活函數的目的(提供非線性)、反向傳播的作用(計算梯度以更新權重)、Softmax 用在多分類輸出。
深度學習明星架構與選型 ★115 年考 8 題CNN / RNN / LSTM / Transformer / YOLO
白話說不同資料形狀有不同的專用架構——影像用 CNN、序列用 LSTM、語言用 Transformer。選型題是送分題,前提是記對對應關係。
- CNN 卷積神經網路:拿小放大鏡(卷積核)在圖上滑動掃描——淺層看出邊緣線條、中層組成形狀、深層組成物件;池化(Pooling)=縮圖保留重點、減少計算。用於影像分類、瑕疵檢測。
- YOLO:「You Only Look Once」——看一眼就同時框出物件位置+類別,即時物件偵測(監視器、自駕)。
- RNN 循環神經網路:帶著「上一步的記憶」依序讀序列;缺點是記性差——序列一長就忘(梯度消失)。
- LSTM 長短期記憶網路:帶筆記本的 RNN——用遺忘門/輸入門/輸出門決定「該記什麼、該忘什麼」,解決長期依賴。時間序列預測(銷量、股價)常用。
- Transformer:不再逐字讀——自注意力機制(Self-Attention)讓每個字同時「看」整句所有字、算出彼此關聯強度;可平行訓練(比 RNN 快得多);用位置編碼保留語序。現代 LLM(GPT、Gemini、Claude)的地基。Flash Attention=讓注意力計算更省記憶體、更快的工程優化(115 年新考點)。
🔍 深入理解(點開看進階拆解)
Self-Attention 再拆一層:每個字會產生三個向量——Query(我在找什麼)、Key(我是什麼)、Value(我攜帶的內容)。用 Q·K 算出「我該關注誰」的權重,再加權平均大家的 V,得到融合了上下文的新表示。效果:同一個字在不同句子得到不同表示——「bank」在 river bank(河岸)與 bank account(銀行)中向量不同,這是舊式固定詞向量做不到的。
- 為什麼能平行:RNN 必須等前一個字算完才能算下一個;注意力是整句所有字同時互看,一次矩陣運算搞定——GPU 火力全開,訓練速度數量級提升。
- 位置編碼為何存在:注意力本身「不知道順序」(誰跟誰互看都行),必須外加位置訊號才知道「我愛你」≠「你愛我」。
訓練的兩大病:過擬合與欠擬合 ★Overfitting / Underfitting
白話說欠擬合=書讀太少——訓練、測試都考不好(高偏差 Bias);過擬合=死背題庫——訓練 99 分、測試 65 分(高變異 Variance),模型把「訓練資料的雜訊」也背起來了。
欠擬合的藥:換更複雜的模型、增加特徵、訓練久一點。過擬合的藥(必背五帖):
- 更多資料/資料增強(Data Augmentation):把圖片翻轉、裁切、調亮暗,「一張變十張」。
- 正則化(Regularization):給過大的權重「罰款」。L1(Lasso)罰絕對值——會把不重要的旋鈕直接轉到 0,等於自動做特徵選擇(稀疏解);L2(Ridge)罰平方——讓權重整體變小變平滑、但不歸零。
- Dropout:訓練時每輪隨機讓部分神經元「請假」——逼所有神經元都得學會本事,不能依賴少數幾顆。
- 提前停止(Early Stopping):驗證集分數開始變差就喊停,不讓模型繼續背。
- 簡化模型:減少層數/參數。
偏差-變異權衡(Bias-Variance Tradeoff):蹺蹺板——模型太簡單偏差高、太複雜變異高,目標是找中間的甜蜜點。交叉驗證(k-fold Cross-Validation):把資料切成 k 份輪流當驗證集、取平均表現——評估更可靠,也用來挑超參數。
🔍 深入理解(點開看進階拆解)
學習曲線判讀法(把訓練/驗證損失畫成兩條線):兩條都高→欠擬合;訓練低、驗證高且差距持續擴大→過擬合;兩條都低且貼近→健康。這是實務診斷的第一步,也是考題的圖表題型。
L1 為什麼會把權重壓到整數 0?幾何直覺:L1 的罰函數 |w| 在 0 的位置有個「尖角」,最佳解經常正好卡在角上(w=0);L2 的罰函數 w² 在 0 附近平滑,只會把權重「縮小」而不會「歸零」。所以 L1=稀疏解=自動特徵選擇,L2=整體平滑。
Dropout 的細節:只在訓練時隨機關神經元;推論(正式上線預測)時全部開啟——考題若說「Dropout 在預測階段隨機關閉神經元」→ 錯。
📌 考點:「訓練 99%/測試 65% 該怎麼辦」;「何者無法改善過擬合」→ 提高模型複雜度。
模型考幾分:評估指標 ★情境選指標=必考題型Evaluation Metrics
白話說先用「火災警報器」記住混淆矩陣:TP 真火災有響(真陽性)、FP 沒火亂響(誤報,型一錯誤)、FN 真火災沒響(漏報,型二錯誤,最致命)、TN 沒火沒響。所有分類指標都是這四格的排列組合。
- Accuracy 準確率=整體答對率。⚠ 類別懸殊時嚴重失真:99.5% 是良品時,「全猜良品」也有 99.5%。
- Precision 精確率=TP/(TP+FP)——「警報響的裡面,幾次是真的」。誤報成本高時看它(垃圾郵件過濾誤擋老闆的信)。
- Recall 召回率(敏感度)=TP/(TP+FN)——「真火災裡,幾次有響」。漏報成本高時看它(癌症篩檢、詐欺偵測、瑕疵漏檢)。
- 兩者是蹺蹺板:把警報調得更靈敏 → Recall 升、Precision 降。F1-score=兩者的調和平均——類別不平衡、或兩邊都要顧時的首選。
- AUC-ROC:掃過所有判定門檻的整體判別力,適合「比較不同模型」。
- 迴歸指標:MAE(平均絕對誤差——直觀、對離群值不敏感);MSE/RMSE(把誤差平方——大錯罰更重,在乎極端誤差時用 RMSE);R²(模型解釋了多少變異,越接近 1 越好)。
🔍 深入理解(點開看進階拆解)
拿一組數字把所有指標算一遍,手感就出來了。設 100 筆交易、其中 10 筆詐欺;模型標記了 8 筆,其中 6 筆真詐欺:
- TP=6、FP=2、FN=4、TN=88。
- Accuracy=(6+88)/100=94%——看起來很棒。
- Precision=6/8=75%——報出來的 8 筆有 75% 是真的。
- Recall=6/10=60%——10 筆真詐欺漏掉了 4 筆!
- F1=2×(0.75×0.6)/(0.75+0.6)≈66.7%。
結論:Accuracy 94% 的光鮮外表下,四成詐欺漏網——這就是不平衡資料只看 Accuracy 的陷阱。閾值的蹺蹺板:把判定門檻調鬆→抓得更多→Recall 升、Precision 降;調嚴則反過來。AUC 的白話定義:隨機抽一個正例與一個負例,模型給正例更高分的機率——0.5 等於亂猜、1.0 完美。
📌 秒判:「不能漏」→Recall;「報出來要準」→Precision;「極度不平衡」→F1;「大誤差不可接受」→RMSE。115 年 Q50 癌症篩檢題、Q40 瑕疵品題都是這個套路。
打開黑箱:可解釋 AI ★115 年考 4 題Explainable AI, XAI
白話說深度模型很準,但說不出理由——這在金融、醫療是大問題(法規要求「說得出為什麼拒絕你」)。XAI 就是一套「讓模型交代理由」的技術。
- LIME(Local Interpretable Model-agnostic Explanations):在「這一筆」預測的附近製造一些相似樣本,用簡單模型(如線性模型)模仿黑箱在局部的行為,來解釋這筆判決。關鍵字:局部近似、模型無關。
- SHAP(SHapley Additive exPlanations):用賽局理論的 Shapley 值,把「這筆預測結果」當獎金,公平分給每個特徵——收入 +30 分、負債比 −20 分、年資 +5 分……貢獻值可加總、也能彙整成全局特徵重要性。關鍵字:特徵貢獻值、公平分配。
- Saliency Map/Grad-CAM:影像版解釋——熱力圖標出模型「看著哪裡」做判斷(X 光片上模型盯著的病灶區)。
- 反事實解釋(Counterfactual Explanation):「若月收入再多 1 萬,貸款就會核准」——告訴你改變哪個條件能翻轉結果,對使用者最有行動指引。
🔍 深入理解(點開看進階拆解)
LIME 的四步流程:①在目標樣本附近隨機擾動,生成一堆相似的假樣本;②丟給黑箱模型打標籤;③以「離目標越近權重越高」的方式訓練一個簡單線性模型;④線性模型的係數=這筆預測的局部解釋。它模仿的是黑箱「在這附近」的行為,換一筆樣本解釋就要重做。
SHAP 的 Shapley 值直覺:想像特徵們輪流「加入團隊」,每次加入都量測它帶來多少邊際貢獻,再對所有可能的加入順序取平均——這是賽局理論證明「唯一公平」的分法。所以 SHAP 值可以加總(各特徵貢獻加起來=預測值與基準值的差),也能彙整成全局特徵重要性。
兩者定位一句話收尾:LIME 只做局部近似、快而粗;SHAP 有理論保證、可局部可全局、算得較重。
📌 考點:「量化各特徵對單筆預測的貢獻」→SHAP;「局部用簡單模型模仿」→LIME。兩者分辨是 115 年連兩題的考點。
上線不是終點:漂移與模型維運 ★Data Drift / Concept Drift / MLOps
白話說世界一直在變,模型卻停在訓練那天。資料漂移=客人口味變了(輸入分布改變);概念漂移=遊戲規則變了(輸入與答案的「關係」改變,例如詐騙手法進化)。
症狀:上線幾個月後效能逐漸下滑,但系統與程式都沒壞。處方:建立監控(效能指標+輸入分布比對)→ 異常警示 → 定期用新資料再訓練。這套「讓模型持續健康」的工程實務統稱 MLOps。
🔍 深入理解(點開看進階拆解)
監控實務分三層,由淺入深:
- 輸入分布監控:比對線上輸入與訓練資料的統計分布(常用 PSI 指標、統計檢定)——不需要真實答案就能做,是最早的警報器。
- 預測分布監控:模型輸出的比例是否漂移(核准率突然從 60% 掉到 40%?)。
- 實際效能監控:等真實結果回來後對答案——最準但最慢(詐欺要幾週後才確認)。
再訓練的三種策略:定期制(每月重訓)、觸發制(監控指標超標才重訓)、線上學習(即時更新——風險高,要防資料污染攻擊)。上新模型的穩妥作法叫冠軍/挑戰者模式:新模型先「影子運行」只記錄不決策,比贏現任冠軍才真正切換。
📌 考點:「推薦模型半年後點擊率下滑、系統無故障」→ 資料漂移;答案選「監控+再訓練」,不選「模型參數自然衰減」(沒這回事)。
📎 第 3 章回顧
訓練=調旋鈕下山(損失/梯度/學習率);五種學習方式看「答案從哪來」;演算法各記一句原理+時機;神經網路=加權投票機疊層+反向傳播分責任;架構選型(CNN 影像/YOLO 偵測/LSTM 時序/Transformer 語言);過擬合五帖藥(資料、正則化 L1/L2、Dropout、早停、簡化);指標秒判(漏→Recall、誤→Precision、不平衡→F1、大錯→RMSE);XAI 四招(LIME 局部、SHAP 分貢獻、熱區圖、反事實);上線後防漂移(監控+再訓練)。
✍️ 自我檢核
用「下山」的比喻解釋梯度下降與學習率,並說明學習率太大/太小會怎樣。
看參考解答
損失函數像山的海拔(錯得越離譜海拔越高)。濃霧中看不到全景,只能摸腳下坡度(梯度),往最陡的下坡方向走一步(更新參數),步伐大小就是學習率。學習率太大:一步跨過谷底,來回震盪甚至發散;太小:收斂太慢,訓練遙遙無期。
五種學習方式各舉一個生活例子,關鍵差別是什麼?
看參考解答
監督式=附答案的抽認卡(房價預測);非監督式=衣服自然分堆(顧客分群);半監督式=只標了一小部分的相簿(少量標註+大量未標註);自監督式=自己出克漏字自己答(LLM 預訓練);強化學習=訓練小狗做對給零食(AlphaGo)。關鍵差別:答案(監督訊號)的有無與來源——人工標籤/沒有/少量人工/資料自身/環境獎勵。
邏輯迴歸做的是分類還是迴歸?隨機森林和 XGBoost 的組隊方式差在哪(Bagging vs Boosting)?
看參考解答
邏輯迴歸做「分類」——名字有迴歸,實際輸出 0~1 的機率再判類別,是經典陷阱。隨機森林=Bagging:多棵樹「平行」各看不同資料再投票,穩定抗過擬合;XGBoost=Boosting:樹「序列」生成,每一棵專門修正前面的錯誤,準度常更高但較講究調參。
為什麼沒有激活函數的深層網路等於一條直線?反向傳播在算什麼?
看參考解答
因為線性變換疊加仍是線性:W₂(W₁x)=(W₂W₁)x,疊一百層等價於一層線性模型,永遠學不會曲線關係。激活函數(ReLU 等)在層與層之間加入非線性,網路才能逼近任意複雜的函數。反向傳播則是從輸出端的誤差往回推,算出每個權重對損失的梯度(責任分攤),供梯度下降更新。
訓練 99 分、測試 65 分——診斷是什麼病?開三帖藥。
看參考解答
診斷:過擬合(高變異)——模型把訓練資料連同雜訊背起來了。藥方(任選三帖):增加訓練資料或資料增強、L1/L2 正則化、Dropout、提前停止(Early Stopping)、簡化模型。注意「提高模型複雜度」只會更嚴重。
癌症篩檢和垃圾郵件過濾,各該優先看哪個指標?為什麼?
看參考解答
癌症篩檢→召回率 Recall:漏診(FN)的代價最高,寧可誤報也不能漏掉真病患。垃圾郵件→精確率 Precision:誤報(FP)的代價高——把老闆的正常信擋進垃圾桶比漏掉一封廣告嚴重。口訣:怕漏看 Recall、怕誤看 Precision。
LIME 和 SHAP 各自的一句話定位?銀行要「量化每個特徵對這筆拒貸的貢獻」該用哪個?
看參考解答
LIME:在「這一筆」預測附近用簡單代理模型做局部近似解釋(關鍵字:局部、模型無關)。SHAP:用賽局理論 Shapley 值把預測結果公平分配給每個特徵,得到可加總的貢獻值。銀行要「量化每個特徵對這筆拒貸的貢獻」→ 選 SHAP。
第 4 章|L114鑑別式 AI 與生成式 AI——裁判與創作者
🎯 學習目標——讀完你應該能:
- 用一句話分辨鑑別式與生成式 AI,並判斷應用場景屬於哪邊
- 說出 GAN、VAE、Diffusion 三大生成架構的原理、強項與弱點
- 解釋 LLM 的訓練三部曲與幻覺的成因
裁判 vs 創作者Discriminative vs. Generative AI
白話說鑑別式 AI 是裁判——學「分界線」,給它輸入、它回你判斷(類別或數值);生成式 AI 是創作者——學會「資料整體長什麼樣子」,然後創造新內容。
用數學語言:鑑別式學條件機率 P(y|x)(給定輸入 x,答案 y 是什麼);生成式學資料分布 P(x)(資料本身怎麼分布,所以能從分布中「抽出」新樣本)。
🏭 實例鑑別式:詐欺交易判定、人臉辨識、信用評分、瑕疵分類。生成式:寫行銷文案、文生圖、合成語音、產生程式碼。判斷法:輸出是「標籤/數字」→鑑別式;輸出是「內容」→生成式。
🔍 深入理解(點開看進階拆解)
用「同一個場景的兩種用法」練分辨,考題就是這樣出的:
實務系統常是混合架構:生成式產出內容、鑑別式在後面審核打分(品質、合規、毒性)——「生成→審核」兩段式是業界標配,也開始出現在情境題。
📌 考點:115 年考「何者屬鑑別式應用」——詐欺判定 vs 文案生成的對比。
GAN 生成對抗網路Generative Adversarial Network
白話說兩個網路互相較勁:生成器(Generator)是偽鈔犯,努力印出以假亂真的鈔票;判別器(Discriminator)是警察,努力分辨真偽。軍備競賽下,偽鈔越印越真。
強項:影像銳利、生成速度快、多樣性好。弱點:兩個網路要保持勢均力敵,訓練不穩定;以及模式崩潰(Mode Collapse)——偽鈔犯發現「印某一款最容易騙過警察」,就只印那一款,輸出全長得一樣。
🔍 深入理解(點開看進階拆解)
訓練為什麼不穩?兩個網路的目標互相衝突,像蹺蹺板要一直維持動態平衡:判別器太強→生成器怎麼做都被識破,收不到有用的學習訊號;判別器太弱→生成器亂做也過關,學不到精進。實務要小心調配兩邊的學習速度。
模式崩潰的偵測:生成樣本的多樣性驟降(一千張人臉長得像同五個人)就是警訊。
GAN 的三個代表應用:影像風格轉換(照片變梵谷畫)、資料增強(合成訓練樣本補資料不足)、超解析度(低清變高清)——應用題認得出「對抗生成」的關鍵字即可。
VAE 變分自編碼器Variational Autoencoder
白話說「壓縮再重建」:編碼器把一張臉壓成潛在空間(Latent Space)裡的一個座標(想像成「捲髮程度 0.8、微笑程度 0.3」),解碼器再從座標畫回圖。
潛在空間是平滑的,可以在兩張臉的座標之間「滑動」產生漸變。應用亮點:異常偵測——模型只看過正常樣本,正常品重建得很好、異常品重建誤差大 → 誤差一大就抓到。弱點:輸出偏模糊。
🔍 深入理解(點開看進階拆解)
「變分(Variational)」到底變什麼?普通自編碼器(AE)把輸入壓成潛在空間的「一個點」;VAE 壓成「一個分布」(均值+變異數),再從分布中取樣交給解碼器。這個設計逼出平滑連續的潛在空間——兩張臉的座標之間每一點都能解碼出合理的臉,才有「漸變」效果;AE 的潛在空間則可能破碎,點與點之間是垃圾。
異常偵測的完整流程:只用正常樣本訓練 → 對新樣本計算重建誤差 → 設定門檻(例如取正常樣本誤差的 99 百分位)→ 超標即判異常。適用場景的共同點:異常樣本稀少且型態未知(產線新型瑕疵、新型盜刷手法)——正因為異常沒得學,才改成「把正常學透」。
📌 考點:「用重建誤差做異常偵測」→ VAE。
Diffusion 擴散模型Diffusion Model
白話說訓練時把清晰圖片「一步步加雜訊」直到變成雪花,讓網路學會倒帶——一步步去噪還原。生成時就從純雜訊開始,一路去噪「雕」出一張全新的圖。
強項:品質最高、訓練穩定——DALL·E、Stable Diffusion、Midjourney、Sora 的底層都是它。弱點:生成要跑很多步 → 速度較慢。
💡 三兄弟怎麼選要做異常偵測 → VAE;要最高品質與穩定 → Diffusion;要快速生成、可接受訓練難度 → GAN。(比較題必考)
🔍 深入理解(點開看進階拆解)
為什麼品質能做到最高?秘密在「把困難拆小」:一步從雜訊生出完整圖片太難;拆成幾百個小步驟,每一步只需要「去掉一點點噪、修正一點點」——每步都簡單,整體就穩定,品質自然堆得上去。代價正是步驟多→生成慢。
- 文生圖的原理:在每一步去噪時用文字描述「引導」方向(條件擴散)——文字說「戴帽子的貓」,去噪就往那個方向修。
- Stable Diffusion 的「潛在擴散」:不在原始像素上跑擴散,而是先壓縮到小的潛在空間再跑——算力省一個數量級,這是它能在消費級顯卡上跑的原因。
- 加速方向:把幾百步蒸餾成幾步的少步數模型,是近年主要研究線。
大型語言模型Large Language Model, LLM
白話說本質是「超大型文字接龍」:以 Transformer 為地基,自迴歸(Autoregressive)地一次預測一個 token(字塊),接出整段回答。ChatGPT、Gemini、Claude 都是。
- 訓練三部曲:① 預訓練——用海量文本玩自監督克漏字/接龍,學會語言與世界知識;② 指令微調(Instruction Tuning)——教它「聽懂指令、好好回答」;③ RLHF(人類回饋強化學習)——請人類評審比較答案好壞、訓練出獎勵模型,再用強化學習讓它更有幫助、更無害(對齊人類偏好)。
- Embedding(向量嵌入):把文字轉成「語意座標」——意思相近的詞座標也相近。這是第 6 章 RAG 檢索的基礎。
- 幻覺(Hallucination)為何發生:模型是在算「哪個字最可能接下去」,不是在查資料庫——所以會一本正經地說錯話。緩解方式(RAG、引用查核)見科目二。
🔍 深入理解(點開看進階拆解)
token 的手感:token 是模型的「字塊」單位——中文一個字常是 1 個 token,「人工智慧」約 2~4 個;英文長字會被切成幾塊。兩件事都以 token 計:計費(輸入+輸出都算錢)與上下文窗口(一次能「看見」的總量,超過就被截斷遺忘——所以長文件要靠 RAG 分段餵)。
溫度的機率機制:模型每一步對所有候選字算機率(softmax),溫度 T 就是除在分數上的參數——T 小→分布變尖→幾乎只挑最高分(穩定);T 大→分布變平→冷門字也有機會(多樣)。
湧現能力(Emergent Abilities):規模跨過某個門檻後「突然會了」的能力(多步推理、少樣本學習)——解釋了為什麼大家拚命把模型做大。
📌 考點:「ChatGPT 基於什麼架構」→ Transformer;「RLHF 的目的」→ 對齊人類偏好;幻覺的定義與成因。
📎 第 4 章回顧
鑑別式=裁判(P(y|x),輸出判斷);生成式=創作者(P(x),輸出內容)。GAN 對抗(快、多樣/不穩、模式崩潰);VAE 壓縮重建(潛在空間、異常偵測/偏模糊);Diffusion 去噪(品質最高最穩/慢)。LLM=Transformer 接龍:預訓練→指令微調→RLHF;幻覺因為「接龍不是查證」。
✍️ 自我檢核
「輸入一張 X 光片、輸出有無病灶」和「輸入文字、輸出一張海報」各屬哪類 AI?
看參考解答
X 光片判讀輸出的是「判斷結果」(有/無病灶的類別)→ 鑑別式 AI;文字生成海報輸出的是「新內容」→ 生成式 AI。判斷口訣:輸出是標籤或數字→鑑別式;輸出是內容→生成式。
GAN 的兩個網路各扮演什麼角色?模式崩潰是什麼?
看參考解答
生成器(Generator)是偽鈔犯:努力產生以假亂真的樣本;判別器(Discriminator)是警察:努力分辨真假。兩者對抗中一起變強。模式崩潰(Mode Collapse)=生成器發現某一款樣式最容易騙過判別器,就只產那一款——輸出多樣性喪失、全長得一樣。
為什麼 VAE 適合做異常偵測?
看參考解答
VAE 只用「正常樣本」訓練壓縮—重建:正常品它見多了,重建誤差小;異常品從沒見過,重建誤差大。因此設一個重建誤差門檻,超標就判為異常——適合瑕疵檢測、盜刷偵測這類「異常樣本稀少難蒐集」的場景。
LLM 訓練三部曲是哪三步?RLHF 解決什麼問題?
看參考解答
①預訓練:海量文本自監督(克漏字/接龍),學會語言與世界知識;②指令微調:教它聽懂指令、好好回答;③RLHF:請人類評比答案好壞訓練獎勵模型,再用強化學習調整輸出。RLHF 解決的是「會說話但不一定得體、有幫助、無害」的對齊(Alignment)問題。
用「接龍 vs 查資料庫」解釋為什麼 LLM 會產生幻覺。
看參考解答
LLM 回答時是在算「哪個字最可能接在後面」(機率接龍),並不是到資料庫查證事實。所以當它沒把握時,仍會流暢地接出「看起來最像正確答案」的內容——這就是幻覺:一本正經地說錯話。對策是給它資料(RAG)、要求引用、人工覆核。
4科目二系統教材:生成式AI應用與規劃
三個章節對應官方評鑑主題 L121–L123。科目二考的是「把 AI 用進組織的判斷力」——工具會一直換,但選型邏輯、導入流程與治理原則不會變,這正是本教材的重心。
第 5 章|L121No-Code/Low-Code——人人都能蓋 AI
工程師永遠不夠用。No-Code/Low-Code 平台讓不會寫程式的業務人員(所謂「公民開發者,Citizen Developer」)也能自己動手做應用——但「人人能蓋」也代表「人人能蓋出災難」,所以治理跟著來。
🎯 學習目標——讀完你應該能:
- 在 No-Code/Low-Code/AutoML/傳統開發之間為場景選型
- 說明工作流自動化工具(n8n、Make、Zapier)怎麼串接 LLM
- 解釋平台治理要管什麼、影子 IT 與供應商鎖定是什麼風險
- 判斷什麼場景該用邊緣運算、什麼場景該上雲
開發方式光譜:從樂高到手工訂製No-Code / Low-Code / AutoML
白話說四種蓋法:No-Code=樂高積木(全拖拉、零程式、快但客製有限);Low-Code=半成品家具(視覺化為主+少量程式加工);AutoML=自動大廚(自動做特徵、選模型、調參數——「不會建模也能訓練預測模型」);傳統開發=手工訂製(最彈性、最貴、最慢)。
🔍 深入理解(點開看進階拆解)
選型時心裡跑三個問題,答案自然浮現:
- 之後誰維護?業務單位自己→No-Code/Low-Code;有工程團隊→傳統開發也行。
- 要多客製?標準流程→No-Code;要接內部系統、寫商業邏輯→Low-Code 或傳統。
- 是不是核心競爭力?是(演算法就是你的護城河)→自建;不是(內部效率工具)→買現成或低程式碼。
AutoML 自動化了什麼、沒自動化什麼——這是考題的精確邊界:自動化=特徵處理、模型選擇、超參數搜索、(部分)部署;沒自動化=問題定義、資料蒐集與品質、業務解讀與決策。所以「AutoML 可完全取代資料科學家」→ 錯誤選項。
📌 考點:115 年考 No-Code 與 AutoML 的「分工定位」——No-Code 蓋應用與流程,AutoML 產模型,兩者常搭配使用而非互相取代。
工作流自動化:把 AI 串進流程Workflow Automation(n8n / Make / Zapier)
白話說像排骨牌:設定一個觸發器(收到客戶郵件)→ 一連串節點加工(呼叫 LLM 摘要、判斷急迫度)→ 動作(寫入表格、發 Slack 通知、自動回信)。全程拖拉節點完成,不寫程式。
n8n、Make、Zapier 是代表工具。115 年新題型的重點:用 No-Code 工作流把 LLM API 接進既有流程——AI 不再只是聊天窗,而是流程裡的一個加工站。
🔍 深入理解(點開看進階拆解)
把一條真實流程攤開,節點概念就懂了——「客訴信自動處理」:
- 觸發器(Trigger):信箱收到新郵件(事件驅動,不用人盯)。
- 加工節點:LLM 節點做分類(物流/品質/退款)+摘要重點。
- 分流節點(IF):急迫度高→開工單+通知主管;一般→自動回覆+寫入追蹤表。
比背工具名更重要的三個觀念:事件驅動(觸發器取代人工輪詢)、節點=原子步驟(每個節點只做一件事,好除錯)、錯誤分支與重試(API 失敗時走備援路徑,而不是整條流程掛掉)——考題開始往「流程設計判斷」走,就是考這些。
平台治理與影子 IT ★Platform Governance / Shadow IT
白話說人人都能蓋系統的副作用:各部門偷偷自建一堆小工具,IT 部門根本不知道——這叫影子 IT(Shadow IT)。沒人管權限、沒人管資料品質、出事沒人知道資料流去哪。
- 治理要管的事:權限控管(誰能建、誰能看資料)、資料存取規範、版本管理、上線前審核、跨系統整合測試。
- 平台的資料治理機制會直接影響資料品質與合規——選平台時就要評估,不是出事再補。
- 供應商鎖定(Vendor Lock-in):邏輯全建在某平台上,之後要搬家極痛——評估時要考慮匯出能力與標準相容性。
🔍 深入理解(點開看進階拆解)
影子 IT 為什麼會蔓延?三個結構性原因:需求急(業務等不了)+ IT 排程慢(排隊三個月)+平台太易取得(刷卡就能開通 SaaS)。它不是員工故意搗亂,而是治理跟不上工具民主化的自然結果——所以解法是「疏」不是「堵」。
- 風險具體化:個資被存進未經審核的服務、建立者離職帳號沒人回收、各部門重複採購、同一份資料多處各自維護版本打架。
- 治理解法三件套:提供「受核准的自助平台」讓大家在圍欄內自由發揮(疏);定期盤點掃描組織內使用中的 SaaS(查);單一登入 SSO 統一身分與權限(管)。
📌 考點:「缺乏治理的 No-Code 平台會發生什麼」→ 管理混亂、資料品質失控;治理機制的典型影響是 115 年實際考題。
雲端 vs 邊緣運算 ★Cloud vs. Edge Computing
白話說雲端=中央廚房:算力大、彈性伸縮、集中管理,但要透過網路(有延遲)、資料要出門。邊緣運算=現場小廚房:在裝置端或近端就地運算——低延遲、斷網也能動、資料不出門,但算力與記憶體有限。
- 選邊緣的關鍵字:「毫秒級即時反應」(產線瑕疵檢測、自駕)、「網路不穩也要能運作」、「資料涉敏不能上傳」。
- 邊緣的代價:裝置資源小,模型要先「瘦身」——量化(降低數值精度)、知識蒸餾(見第 6 章)。
- 邊緣裝置效能不佳的常見原因 ★:模型太大、超出裝置運算與記憶體資源——不是「網路太慢」(邊緣本來就不靠網路)。
🔍 深入理解(點開看進階拆解)
量化(Quantization)的直覺:把權重從 32 位元浮點數(FP32)壓成 8 位元整數(INT8)——模型體積縮四倍、運算量大降,精度只犧牲一點點。搭配知識蒸餾(換一個天生就小的模型),就是邊緣部署的兩大瘦身術。
延遲的數字感:雲端 API 一來一回常見 50~200ms(還沒算模型推論時間);高速產線的影像檢測窗口可能不到 10ms——物理上只有邊緣做得到。這就是「為什麼不能上雲」的硬理由。
實務常是混合架構:邊緣負責即時推論,雲端負責訓練新模型、再透過 OTA(空中更新)下發到各裝置——「邊緣跑、雲端養」是標準答案的形狀。
📌 考點:115 年考「邊緣運算效能下降的原因分析」與雲端/邊緣選型情境題。
📎 第 5 章回顧
開發光譜:No-Code(樂高)→ Low-Code(半成品)→ AutoML(自動建模)→ 傳統開發(訂製);工作流工具=觸發→節點→動作的骨牌;治理防影子 IT(權限、資料、版本、審核)+防供應商鎖定;雲端(彈性)vs 邊緣(低延遲、離線、隱私,但要幫模型瘦身)。
✍️ 自我檢核
行銷部想自己做一個「客訴信自動分類轉發」流程,該用哪類工具?為什麼不必動用工程團隊?
看參考解答
用 No-Code 工作流工具(n8n/Make/Zapier):觸發器(收到客訴信)→ LLM 節點(分類+摘要)→ 動作(轉發對應部門+寫入表格)。全程拖拉節點即可完成,屬於「表單/流程自動化」等級的需求,業務人員即可自建,不需佔用工程團隊。
影子 IT 是怎麼形成的?治理該管哪四件事?
看參考解答
需求急、IT 排程慢、平台又易取得(刷卡就能開 SaaS),各部門就繞過 IT 私建工具——形成沒人管的影子 IT。治理四件事:權限控管(誰能建、誰能看資料)、資料存取規範、版本管理、上線前審核(含跨系統整合測試)。
工廠產線的即時瑕疵檢測為什麼適合邊緣運算?部署前模型要做什麼準備?
看參考解答
三個理由:需要毫秒級即時反應(雲端網路往返延遲太大)、斷網也必須持續運作、產線影像資料不必外傳(隱私與頻寬)。部署前要為裝置有限的算力做模型瘦身:量化(降低數值精度)或知識蒸餾(大模型教小模型)。
第 6 章|L122生成式AI應用與工具——從會聊天到會辦事 ★核心題區
這一章是科目二的技術核心,一條學習動線貫穿:先學會「跟 AI 好好說話」(提示工程)→ 給它「開書考」的能力(RAG)→ 需要時「調教」它(微調)→ 最後讓它「動手辦事」(Agent 與 MCP)。
🎯 學習目標——讀完你應該能:
- 寫出結構良好的提示,並依任務選對推理策略(CoT/ToT)與溫度
- 完整說出 RAG 的建庫與查詢流程,解釋 Chunking 為什麼必要
- 在提示工程、RAG、微調之間做正確選擇(含 LoRA、蒸餾的時機)
- 說明 AI Agent 的運作循環與 MCP 的角色,以及該有的安全防線
- 認識多模態工具、內容真實性標準(C2PA)與模型評測基準
提示工程:跟 AI 好好說話Prompt Engineering
白話說同一個模型,話問得好不好,答案品質差三倍。提示工程就是「把需求說清楚」的技術——不用寫程式,但有方法。
- System Prompt vs User Prompt:System 是「人設與規則」(你是資深法務,回答須引用條文,不確定就說不確定)——使用者看不到、優先權高;User 是每次的實際提問。
- 好提示四件套:角色(你是誰)+任務(做什麼)+脈絡(背景資料與限制)+格式(用表格?幾字內?)。
- Zero-shot:不給範例直接命令。Few-shot:先示範幾題再讓它做——範例會強力引導格式與判斷。⚠ 陷阱:範例必須貼近目標場景。拿美國市場的範例教它分析台灣市場,會整組帶偏(領域偏移)——115 年實際考題。
🔍 深入理解(點開看進階拆解)
把「好提示四件套」寫成一則完整範例,感受一下差距。壞提示:「幫我寫報告」。好提示:
📝 範例「你是資深資料分析師(角色)。請根據以下三季銷售數據,寫一份給高階主管的摘要報告(任務)。讀者不懂統計術語,重點放在趨勢與異常(脈絡)。輸出:300 字內、三個要點加一句結論(格式)。」
- 負面指令效果差:「不要用口語」不如「使用正式書面語」——模型對「做什麼」的服從度遠高於「別做什麼」。
- 分隔符技巧:用 ``` 或 XML 標籤把「使用者資料」與「指令」隔開——既讓模型分清界線,也降低提示注入的風險(資料區的內容不被當成指令執行)。
推理策略:CoT、ToT 與 Graph ★Chain / Tree of Thoughts / Graph Prompting
白話說複雜問題別讓模型「憑直覺秒答」,要它把思考攤開來。三種攤法對應三種問題形狀。
- 思維鏈(Chain-of-Thought, CoT):要求「一步一步推理再作答」——多步驟數學、邏輯題正確率大幅提升。形狀:一條直線。
- 樹狀思維(Tree-of-Thoughts, ToT):同時展開多條思路、互相比較、可回頭換路——適合「有多種方案要評估」的規劃問題。形狀:一棵樹。
- Graph Prompting:把概念間的網狀關係交給模型——處理多條件相互影響(庫存、天氣、促銷互相牽動的補貨決策)。形狀:一張網。
- Self-consistency:同一題讓模型答很多次、取多數決——花錢買穩定。
🔍 深入理解(點開看進階拆解)
CoT 為什麼有效?直覺解釋:LLM 每生成一個 token 的「思考量」是固定的;要求它先寫出中間步驟,等於把一個大問題攤成多個小步驟、每步只需小小的推理量——用更多 token 換更高正確率。魔法句「Let's think step by step」就能觸發零樣本 CoT。
ToT 的內部結構:生成多個候選思路 → 用評估器替每條路打分 → 展開最有希望的、必要時回頭換路——本質是把「樹搜索」接到 LLM 上,所以適合規劃與多方案比較。
選擇題判斷句:題幹出現「逐步推導」→CoT;「比較多個方案、可回溯」→ToT;「多因素互相牽動成網」→Graph Prompting;「同題多答取多數決」→Self-consistency。
📌 考點:看題目給的「問題形狀」選策略——線性步驟→CoT;多方案比較→ToT;多條件互相影響→Graph。
輸出控制:溫度與 Top-p ★Temperature / Top-p Sampling
白話說溫度(Temperature)是「創意旋鈕」:調低 → 每次都挑最穩的字,輸出保守、穩定、可重現(法務文件、客服 FAQ);調高 → 敢選冷門字,輸出多樣有創意(行銷腦力激盪)。
Top-p(核採樣):只從「累積機率前 p%」的候選字中抽——另一種控制發散程度的方式。兩者常擇一調整。
🔍 深入理解(點開看進階拆解)
溫度沒有「正確值」,只有「對的區間」——給你一張實務對照:
- T ≈ 0~0.3:法務、客服 FAQ、資料抽取——要穩定可重現。
- T ≈ 0.3~0.7:摘要、翻譯、一般寫作——通順與變化的平衡。
- T ≈ 0.8 以上:行銷腦暴、創意寫作——要驚喜、可接受偶爾脫線。
Top-p 與溫度的分工:溫度改變機率分布的「形狀」(尖或平);Top-p 直接「截尾」——只保留累積機率前 p 的頭部候選字(p=0.9 表示只從最可能的那 90% 機率質量中抽)。兩者常擇一調整,同時大動兩個容易失控。小心一個誤解:T=0 也不保證 100% 逐字重現(系統層仍有些微不確定性),但已是最穩設定。
📌 考點:「希望輸出穩定一致」→ 降溫度;「調高溫度」絕不是解決幻覺或提升準確性的方法(只會更嚴重)。
幻覺與防線Hallucination
白話說幻覺=模型「一本正經地胡說八道」。根本原因:它在玩機率接龍(哪個字最像會接下去),不是在查證事實。
防線三層:① 給它資料——RAG 讓回答「依據檢索到的文件」;② 要求交代——附引用來源+自動/人工查核;③ 人來把關——高風險內容一律人工覆核。
🔍 深入理解(點開看進階拆解)
幻覺不只一種長相,認得出型態才防得住:事實錯誤(把年份、數字講錯)、憑空引用(編造不存在的論文、法條、判決字號——法律與學術場景的頭號地雷)、過度自信(錯的內容配上斬釘截鐵的語氣)。
RAG 為什麼有效?它把任務從「回憶」改成「閱讀理解」——答案錨定在檢索到的文本上,模型不必憑記憶硬接。但注意:RAG 不是保證——模型可能「檢索對了照樣亂講」,所以提示要加一句「僅根據提供的內容回答;內容不足時回答不知道」。
評估幻覺的實務指標:溯源率(答案中有出處可查的句子比例)、人工抽查的事實錯誤率——監控儀表板上的固定欄位。
📌 考點:「何者不是降低幻覺的作法」→ 調高溫度。
RAG 檢索增強生成:讓模型開書考 ★115 年考 5 題Retrieval-Augmented Generation
白話說與其逼模型「憑記憶作答」(記憶會過期、會腦補),不如改成開書考:先從你的知識庫翻到相關頁面,再依據那幾頁回答並附出處。
建庫流程(一次性):文件 → Chunking 切塊 → Embedding 向量化(每段變成語意座標)→ 存入向量資料庫(Vector Database)。
查詢流程(每次提問):問題轉向量 → 到向量庫找「座標最近」的片段(可用混合檢索:語意+關鍵字,專有名詞才不會漏)→ 重排序(Re-ranking)精挑最相關的幾段 → 塞進提示 → 模型「依據資料」作答+附來源。
- Chunking 為什麼必要 ★:整份 200 頁手冊做成一個向量,檢索到的永遠是大雜燴——切成語意完整的小段,才能精準取回「真正相關」的內容。切太碎會失去上下文、切太大會夾雜噪音,大小要拿捏。
- RAG 的三大優勢:知識即時更新(換文件就好,不用重訓模型)、可溯源(附引用)、降幻覺。
- 增量索引:新文件進來只補建新片段的索引,不必重建整庫。
- 上下文工程(Context Engineering):更廣義的技術——把檢索片段、對話記憶、工具結果「組裝」成模型當次的上下文,是 RAG 的上位概念(115 年新考點)。
🔍 深入理解(點開看進階拆解)
Embedding 檢索勝過關鍵字的時刻:「發票報帳流程」與「如何請款」——關鍵字零重疊,語意向量卻很近(餘弦相似度高),語意檢索抓得到。關鍵字勝過語意的時刻:產品型號「X-200」——語意上毫無意義,精確字串比對才可靠。這就是混合檢索存在的理由:兩邊的死角互補。
- Chunk 大小的實務手感:常見 200~500 字一塊,塊與塊之間留少量重疊(overlap)防止語意被切斷;切太碎→片段失去上下文,切太大→夾雜雜訊。
- 重排序(Re-ranking)的位置:第一輪向量檢索先「粗召回」幾十段(快),再用更強的模型對這幾十段「精排」取前幾名(準)——粗篩+精選兩段式。
- 常見誤解:RAG 不會「更新模型」——模型權重從頭到尾沒變,變的是餵給它的參考資料。
📌 考點:「知識庫常更新該用什麼」→RAG;「回覆夾雜無關內容怎麼辦」→Chunking;RAG 與微調的分工見下一節。
微調家族:什麼時候該調教模型 ★Fine-tuning / PEFT / LoRA / Distillation
白話說微調=拿自己的資料「再訓練」模型。時機很關鍵:要改的是行為與風格(固定格式、專業口吻、特殊任務)才微調;要補的是知識,用 RAG 就好。
- 全參數微調(Full Fine-tuning):整台機器的旋鈕全部重調——效果最完整,但 GPU、資料、時間成本都最高。
- PEFT 參數高效微調 ★:只動一小部分參數。代表 LoRA(Low-Rank Adaptation):凍結原模型,在旁邊掛一組小小的「外掛矩陣」只訓練它——需更新的參數可降到千分之一,效果卻接近全微調。「GPU/記憶體受限」情境的標準答案。同家族還有 Prefix Tuning、Adapter。
- RLHF/RFT(強化微調):用獎勵訊號調整行為——RLHF 靠人類偏好評比,RFT 針對特定任務用獎勵函數調(115 年新考點)。
- 知識蒸餾(Knowledge Distillation)★:大模型當老師、小模型當學生——學生模仿老師的輸出,得到「便宜、快、夠用」的小模型。適合邊緣部署與高流量降本。
- 樣板化風險:過度微調固定格式,模型會變「死板」、喪失彈性推理——微調不是越多越好。
💡 三選一決策梯先試提示工程(零成本,先把話說清楚)→ 不夠?知識問題用 RAG → 還不夠?行為問題才微調。口訣:MCP 連工具、RAG 找知識、Fine-tuning 改行為。成本階梯:提示 < RAG < 微調 < 重新預訓練。
🔍 深入理解(點開看進階拆解)
LoRA 的數學直覺(一段話版):微調本來要學一個跟原權重同尺寸的更新矩陣 ΔW(d×d,動輒億級參數);LoRA 假設這個更新「本質上很簡單」(低秩),把它分解成兩個小矩陣 A(d×r)×B(r×d),r 取 8、16 這種小數字——參數從 d² 掉到 2dr,千分之一等級。推論時把外掛合併回原權重,不增加任何延遲。
- 微調 vs RAG 的判斷句庫:「輸出格式/語氣/術語習慣要固定」→微調;「知識常過期要更新」→RAG;實務常兩者並用——微調管行為、RAG 管知識。
- 蒸餾與微調別搞混:微調=改「同一個」模型的行為;蒸餾=造一個「新的小」模型來模仿大模型——目的是降推論成本,不是改行為。
AI Agent:從會聊天到會辦事 ★115 年考 4 題AI Agent / Tool Calling / MCP
白話說聊天機器人只出一張嘴;AI Agent 會動手——收到目標後自己拆解步驟、呼叫工具執行、看結果修正,直到完成任務。
- 運作循環:感知(理解目標與現況)→ 規劃(拆解步驟、決定用什麼工具)→ 行動(呼叫工具/API)→ 觀察結果 → 修正再來。多輪迭代+記憶機制。
- 工具呼叫(Function/Tool Calling):模型輸出一張結構化的「申請單」(函式名+參數),由系統代為執行——Agent 行動力的基礎。
- MCP(Model Context Protocol)★:工具接口的 USB-C——以前每個工具×每個模型都要各寫一個轉接頭;MCP 把接口標準化,工具做一次 MCP 接入,各家模型都能用。與 RAG 的分工:MCP 連「系統與工具」(查庫存、開工單),RAG 補「知識內容」(文件問答)。
- 多 Agent 協作:企劃、執行、審查各由一個 Agent 分工——複雜任務的常見架構。
- 工程防線:逾時設定(Timeout)、心跳檢測(Heartbeat,確認 Agent 還活著)、重試上限、權限最小化(只給任務需要的工具與資料)。
- 提示注入(Prompt Injection)與 Guardrails:攻擊者在輸入或網頁內容裡「藏指令」騙 Agent 做壞事;防護欄=輸入過濾+輸出檢查(攔敏感資訊)+工具白名單。
🔍 深入理解(點開看進階拆解)
把一個任務完整走一遍循環——「幫我安排下週與 A 公司的會議」:
- 感知:解析目標(要約誰、多長、實體或線上)+讀行事曆現況。
- 規劃:查雙方空檔 → 選時段 → 發邀請 → 訂會議室,四步排好。
- 行動:呼叫行事曆 API 執行。
- 觀察→修正:A 公司回覆時段衝突 → 重新規劃改到週四。
這種「推理與行動交錯」的模式文獻上叫 ReAct。防線為什麼是那幾條?對照真實事故型態就懂:沒逾時→Agent 卡在一個工具上永遠不回來;沒重試上限→無限迴圈把 API 額度燒光;權限過大→誤刪正式資料。每條防線都對應一種事故。
📌 考點:MCP vs RAG 的定位差異、Agent 防護機制(心跳/逾時)、提示注入的防範。
多模態應用與工具地圖Multimodal AI
白話說多模態=一個模型同時處理多種形態的輸入輸出(文字、影像、聲音、影片)。認得出工具的「類別與定位」就夠,不必背版本號。
- 文生圖:DALL·E、Midjourney、Stable Diffusion——底層都是 Diffusion 擴散模型。
- 影片生成:OpenAI Sora、Google Veo。
- 即時語音:GPT-Realtime——語音進、語音出、低延遲,適合語音客服。
- 程式輔助:GitHub Copilot、Cursor——依上下文「接龍」程式碼。Vibe Coding=用自然語言描述需求讓 AI 直接寫——快,但品質與資安要靠程式碼審查+自動化測試+依賴掃描把關(115 年新考點)。
🔍 深入理解(點開看進階拆解)
「模態(Modality)」=資訊的形式(文字、影像、聲音、影片)。多模態模型的核心技術是把不同形式的資料對齊到同一個向量空間——例如 CLIP 用「圖與其描述文字互相拉近」的對比學習,讓「狗的照片」和文字「a dog」的向量靠在一起,模型才能跨模態理解。
應用題的三種形狀:輸入圖+問題、輸出文字=視覺問答;輸入文字、輸出圖=文生圖;語音進語音出=即時語音對話(GPT-Realtime 類)。
Vibe Coding 為什麼要三件套防線?AI 生成的程式常是「能跑,但不安全、難維護」:自動化測試抓行為錯誤、程式碼審查抓設計與安全問題、依賴掃描抓引入的第三方套件漏洞(供應鏈風險)——各堵一種洞。
內容真實性:對抗深偽 ★C2PA / Watermarking / Deepfake
白話說AI 生成內容以假亂真(深偽 Deepfake),社會需要「驗明正身」的機制。兩把武器:內容履歷與隱形浮水印。
- C2PA 內容憑證:像食品的產銷履歷——用密碼學記錄「這內容由什麼工具生成、經過哪些編輯」,任何人可驗證。OpenAI Sora 生成的影片已內建。
- SynthID/數位浮水印:在像素或聲波裡嵌入人眼看不出、機器驗得出的標記,即使裁切壓縮也能偵測(Google 技術)。
🔍 深入理解(點開看進階拆解)
兩把武器的運作與弱點,配成一對才完整:
- C2PA 內容憑證:生成/編輯工具在檔案內嵌入經數位簽章的清單(誰、何時、用什麼工具、做過哪些編輯),任何人可用驗證器查證歷程。弱點:憑證附在檔案上——截圖、轉錄一次就剝離了。
- SynthID 類浮水印:直接改動像素/聲波的統計特徵,人眼看不出、裁切壓縮後仍可被偵測。弱點:需要專用偵測器,且是機率性判定。
一句話分工:憑證證明「真的」(來源可溯);浮水印偵測「假的」(AI 生成可辨)——雙保險互補彼此的剝離/偵測弱點。考題給場景問用哪個:要「證明出處與編輯歷程」→C2PA;要「事後辨識是否 AI 生成」→浮水印。
📌 考點:115 年考「Sora 影片的出處證明」→ C2PA;「Veo 影片真實性驗證」→ 浮水印技術。
模型怎麼挑:評測基準Benchmarks
白話說評測基準=模型的「模擬考」,各科考不同能力——選模型時看「你的任務對應哪一科」的分數,別只看總分。
選型還要一起看:開源 vs 閉源、延遲、成本、上下文長度(一次能吃多少資料)。
🔍 深入理解(點開看進階拆解)
選型是一條流程,不是看一個分數:
- ①定任務→查對應基準分數(客服問答看 MMLU/C-Eval,寫程式看 HumanEval)。
- ②算成本:token 單價 × 預估月用量(大模型貴 10 倍不一定好 10 倍)。
- ③量延遲:即時客服要秒回,批次報告可以慢慢跑。
- ④看上下文長度:要一次讀 200 頁合約就得挑長上下文模型。
- ⑤合規:資料能否出境?不能→可私有部署的開源模型。
開源 vs 閉源:開源(可自部署、可微調、資料不出門/要自己養運維);閉源 API(能力常較強、免運維/受制於供應商、資料經第三方)。警惕刷榜:基準題目外洩會讓分數虛高——正式選型前用自家的小型實測集跑一輪最實在。
📎 第 6 章回顧
提示四件套+Few-shot 範例要對場景;推理策略照問題形狀選(線→CoT/樹→ToT/網→Graph);溫度=創意旋鈕;幻覺防線(RAG+引用查核+人工);RAG=開書考(Chunking→Embedding→向量庫→檢索→重排序→附源作答);微調階梯(提示→RAG→LoRA/PEFT→蒸餾瘦身);Agent 循環(感知規劃行動)+MCP 標準接口+Guardrails;C2PA 履歷與浮水印;評測基準按任務對科目。
✍️ 自我檢核
把 RAG 的建庫與查詢流程各自從頭講一遍。Chunking 解決什麼問題?
看參考解答
建庫(一次性):文件 → Chunking 切塊 → Embedding 向量化 → 存入向量資料庫。查詢(每次):問題轉向量 → 相似度檢索(可混合語意+關鍵字)→ 重排序精挑 → 相關片段塞進提示 → 模型依據資料作答+附來源。Chunking 解決「整份文件一個向量→檢索粗糙、回覆夾雜無關內容」的問題。
公司知識庫每週更新,該微調還是 RAG?如果是要模型「永遠用固定公文格式回覆」呢?
看參考解答
每週更新→ RAG:換文件即可讓回答跟上最新版,還能附出處;微調要每週重訓,成本高又慢。要模型「永遠用固定公文格式回覆」→ 微調:這是行為與風格問題,不是知識問題。口訣:RAG 找知識、Fine-tuning 改行為。
LoRA 為什麼能省資源?知識蒸餾產出的小模型適合放哪裡?
看參考解答
LoRA 凍結原模型全部權重,只在旁路訓練一組小的低秩矩陣(外掛),需要更新的參數可降到原本的千分之一等級,GPU 記憶體需求大減、效果卻接近全參數微調。知識蒸餾產出的小模型適合放在邊緣裝置(手機、產線設備)或高流量服務(便宜、快、夠用)。
MCP 和 RAG 各解決什麼問題?用一句口訣回答。
看參考解答
MCP 解決「模型連接外部工具與系統」的標準化問題(查庫存、開工單、讀行事曆——像工具接口的 USB-C);RAG 解決「模型缺知識」的問題(檢索文件內容再作答)。口訣:MCP 連工具、RAG 找知識、Fine-tuning 改行為。
Agent 的三步循環是什麼?列出三個必備的工程防線。
看參考解答
感知(理解目標與現況)→ 規劃(拆解步驟、選工具)→ 行動(呼叫工具/API 執行),觀察結果後再修正、迭代。工程防線(任三):逾時設定 Timeout、心跳檢測 Heartbeat、重試上限、權限最小化、Guardrails(輸入過濾+輸出檢查+工具白名單)。
要證明一支影片是 AI 生成的,有哪兩類技術?各自原理?
看參考解答
兩類技術:①C2PA 內容憑證——在檔案內嵌入可驗證的「產銷履歷」,記錄由誰、用什麼工具生成、經過哪些編輯;②數位浮水印(如 SynthID)——在像素/聲波中嵌入人眼看不出、機器驗得出的標記,即使裁切壓縮仍可偵測。兩者互補:憑證證明來源、浮水印偵測內容。
第 7 章|L123導入評估規劃——把 AI 用進組織的完整劇本 ★題數最多的主題群
導入 AI 不是「買一套軟體裝起來」,而是一次流程再造。專案最常見的死法:先選了炫工具,才回頭想要解決什麼問題。這一章給你完整劇本:怎麼起步、怎麼算錢、怎麼管風險、上線後怎麼顧。
🎯 學習目標——讀完你應該能:
- 照順序說出導入七步驟,並指出每一步的常見錯誤
- 用 TCO、ROI、Token Economics 評估一個 AI 專案的成本效益
- 為偏見、隱私、資安風險設計對應的治理措施
- 規劃上線前測試與上線後監控的完整檢查清單
導入七步驟 ★流程排序題必考AI Adoption Lifecycle
白話說第一步永遠是「定義要解決的業務問題與成功指標」——不是挑模型、不是買 GPU。順序考題就考你有沒有把這條劇本內化。
🔍 深入理解(點開看進階拆解)
讓七步驟具體化的方法:記住每一步的「產出物」——有產出物才算完成那一步:
- ①KPI 定義書(要解決什麼、怎麼算成功)②資料盤點清單+差距分析 ③用例優先矩陣(價值×可行性四象限)④PoC 結案報告(可行性結論+效益估算)⑤試行檢討報告(採用率、滿意度、流程問題)⑥上線 Runbook+教育訓練教材 ⑦監控儀表板+再訓練排程。
專案最常見死因排行:第一名——沒定 KPI,上線後對「算不算成功」吵架;第二名——資料不可得或品質太差,到 PoC 才發現(盤點沒做實);第三名——忽略變革管理,工具很好但第一線不想用。三個死因分別對應第①②⑥步偷工。
📌 考點:「導入的第一階段任務」→ 定義目標與 KPI;「PoC 階段不適合做的事」→ 長期治理框架與大規模採購(115 年實際考題)。
錢要算清楚:TCO、ROI 與 Token Economics ★115 年考 3 題Total Cost of Ownership / Return on Investment
白話說TCO(總體擁有成本)像一座冰山:水面上是看得到的 API 與授權費;水面下藏著更大塊——硬體與雲端運算、開發整合、維運監控人力、教育訓練、資安合規。只算水面上的,之後一定超支。
- TCO 涵蓋:授權/API 費、硬體與雲端、開發與整合、維運與監控、人員訓練、資安與合規成本。不涵蓋:與導入無關的外部項目(競爭對手動態、市場股價)——這是考題的標準錯誤選項。
- ROI 投資報酬率=(效益 − 成本)÷ 成本 × 100%。例:AI 客服一年省 200 萬人力、總成本 100 萬 → ROI = 100%。效益要可量化:省下工時、錯誤率下降、營收提升。
- Token Economics ★:LLM 計費像計程車跳表——輸入與輸出的 token 都算錢,上下文塞越多越貴。月成本 ≈ 單次請求 token 數 × 單價 × 請求量。省錢四招:快取重複內容、精簡提示、小模型分流(簡單問題給便宜模型)、批次處理。
- Build vs Buy:自建(彈性高、養人成本高)vs 採購 SaaS(上線快、客製受限)——看「是不是核心競爭力」與「資料敏感度」決定。
🔍 深入理解(點開看進階拆解)
用數字把 TCO 與 ROI 走一遍(三年視角):導入客服 AI——API 費每年 36 萬、開發整合一次性 80 萬、維運人力每年 60 萬、教育訓練 10 萬、資安稽核 10 萬。三年 TCO ≈ 36×3 + 80 + 60×3 + 10 + 10 = 388 萬。效益:每年省 2 名客服人力 120 萬 → 三年 360 萬,再加客訴處理提速的價值——ROI 必須用同一段期間的效益除以同一段期間的成本,只拿第一年成本對三年效益是常見的美化話術。
Token 成本試算:每次對話平均輸入 800、輸出 400 token,月 10 萬次;假設輸入每千 token $0.003、輸出 $0.015——月成本 ≈ 80,000×0.003 + 40,000×0.015 = $840。看懂這條算式,就懂為什麼「精簡提示」「快取」「小模型分流」直接省錢。
風險與合規治理 ★115 年考 6 題・科目二最大題區AI Risk Governance
白話說AI 專案的風險有四張臉:偏見(歧視人)、隱私(洩漏資料)、資安(被攻擊)、法遵(違反法規)。每張臉都有標準對策,考題就考你「對號入座」。
- 偏見(Bias)★:模型會從歷史資料繼承歧視——AI 履歷篩選對特定性別給分偏低的經典案例。治理三步:偏見檢測(量測各族群的表現差異——發現問題)→ 偏見緩解(重新採樣、調整權重、後處理校正——解決問題)→ 人工把關(招聘屬高風險應用,最終決定留給人)。檢測與緩解是不同階段,考題愛混著考。
- 隱私三段位 ★:① 呼叫外部 API 前先遮罩/去識別化敏感欄位 → ② 選 Zero-Retention API(供應商承諾不留存、不拿你的輸入去訓練)→ ③ 最敏感的資料自建私有模型,資料完全不出門。
- 零信任架構(Zero Trust):「不因為你在內網就信你」——每一次存取都重新驗證身分與權限,搭配最小權限原則。
- 法遵清單:個資法(含跨境傳輸限制)、著作權(生成內容的權利歸屬、訓練資料的授權合法性)、行業指引(金融業運用 AI 指引等)。
- 資料安全優先的導入策略 ★:敏感場景的第一個問題不是「功能多強」,而是「資料放哪、誰能看、留不留存」。
🔍 深入理解(點開看進階拆解)
偏見從哪裡來?三個源頭,防治點各不同:資料偏見(歷史資料本身帶歧視——招聘紀錄裡某性別錄取率天生偏低)、標註偏見(標註者的主觀標準不一)、回饋循環偏見(模型的決策影響未來資料——不推薦→沒點擊→更不推薦,偏見自我強化)。
公平沒有唯一定義:「各群體通過率相同」(人口統計均等)與「各群體中合格者被正確錄取的比例相同」(機會均等)在數學上常不可同時滿足——要由業務與法遵選定採用哪個定義,這是治理決策不是技術決策。
跨境傳輸的實務清單:把客資丟給海外 LLM API=個資跨境傳輸,需檢視個資法限制;與供應商的契約三要點——不留存(Zero-Retention)、不用於訓練、指定資料處理區域。
📌 考點:偏見檢測 vs 緩解的區分、Zero-Retention 的意義、同態加密/聯邦學習在企業情境的套用(回看第 2 章)。
品質監控與效能測試 ★115 年考 6 題Quality Monitoring / Evaluation
白話說上線前「驗車」、上線後「定期保養」。生成式 AI 的輸出會變,所以監控不是選配,是導入劇本的固定橋段。
- 上線前驗車:功能正確性、延遲壓測(客服系統重點測「尖峰負載下的回應時間」——115 年實際考題)、跨系統整合測試、安全測試(含提示注入的紅隊演練)。
- 上線後儀表板:正確率、拒答率、回覆延遲、token 成本、使用者滿意度——異常就告警。
- 評估雙軌制:LLM 自動評分(快、便宜)+人工抽查(準、可信)——重要指標兩軌對照。
- 黃金測試集(Golden Set):一組固定的標準測試題——每次改提示、換模型後跑一遍,確認沒有「改好這裡、弄壞那裡」(回歸測試)。
- A/B 測試:新舊版本各服務一部分流量,用數據決定要不要全面切換。
- 漂移偵測:推薦、預測類模型效能隨時間下滑 → 優先懷疑資料漂移 → 再訓練(呼應第 3 章)。
- 執行順序心法 ★:先量測定位瓶頸 → 再改善 → 再驗證。例:語音 AI 表現差,要先確認是「辨識、理解、還是生成」哪一環出錯,才對症下藥——順序題的標準邏輯。
🔍 深入理解(點開看進階拆解)
黃金測試集怎麼建?四種題各佔一份:高頻真實問題(日常代表性)、邊界案例(模糊、刁鑽的極端輸入)、歷史事故題(曾經出包的案例,防止舊病復發)、紅隊攻擊樣本(提示注入、誘導違規)。測試集要版本化管理,跟著系統一起演進。
LLM-as-Judge(用模型評模型)的坑:自動評分快又便宜,但已知會偏好「更長的答案」與「自家模型的風格」——所以重要指標必須定期抽樣人工對照校準,雙軌不可省。
A/B 測試的指標選擇:別只看表面互動(點擊、回覆長度),要看業務終點——問題解決率、轉人工率、重複來訊率。新版回覆更長≠更好,可能只是更囉嗦。
📎 第 7 章回顧
七步驟劇本:目標 KPI → 盤點 → 用例排序 → PoC(別蓋治理框架)→ 試行 → 部署(高可用+變革管理)→ 監控優化;算錢三件套:TCO 冰山、ROI 公式、Token 跳表(省錢四招);風險四張臉:偏見(檢測→緩解→人工)、隱私三段位(遮罩→Zero-Retention→私有部署)、零信任、法遵;品質:驗車(功能/延遲/整合/安全)+儀表板+雙軌評估+黃金測試集+先量測再改善。
✍️ 自我檢核
導入七步驟照順序背一遍,PoC 階段「不該做」什麼?
看參考解答
①明確目標與 KPI →②現況盤點(資料/流程/人才)→③用例選擇(價值×可行性排序)→④PoC 概念驗證 →⑤試行 Pilot →⑥正式部署(高可用+變革管理)→⑦監控與優化。PoC 階段不該做:建置全公司長期治理框架、大規模採購——那是部署階段的事。
TCO 的水面下藏著哪些成本?哪類項目一定不屬於 TCO?
看參考解答
水面下:開發與系統整合、維運與監控人力、教育訓練、資安與合規、硬體與雲端的持續費用。一定不屬於 TCO 的:與導入無關的外部項目——例如競爭對手的股價、市場新聞(考題標準錯誤選項)。
AI 客服年省 200 萬、總成本 80 萬,ROI 是多少?
看參考解答
ROI=(效益−成本)÷成本×100%=(200−80)÷80×100%=150%。
發現招聘 AI 對某性別評分偏低——依「檢測→緩解→把關」各說一個具體作法。
看參考解答
檢測:分性別量測通過率/平均評分差異,確認偏差存在與程度;緩解:訓練資料重新採樣、調整類別權重、或對輸出做後處理校正;把關:招聘屬高風險應用,最終面試名單保留人工覆核。三步是不同階段,不可只做其一。
敏感客戶資料要用外部 LLM API 處理,隱私三段位怎麼套?
看參考解答
三段位由低到高:①呼叫前先遮罩/去識別化敏感欄位(姓名、身分證號換代號);②選用 Zero-Retention API——供應商承諾不留存輸入、不拿去訓練;③最敏感的資料改為自建私有模型,資料完全不出門。依資料敏感度逐級升級。
為什麼每次改提示都要跑黃金測試集?
看參考解答
因為提示改動的影響是全域的——可能「這題變好、那題變壞」而你不知道。黃金測試集是一組固定的標準題(高頻問題+邊界案例+歷史事故題),每次改動後重跑一遍做回歸測試,才能確認整體品質沒有倒退。