Day 2 · R4 好資料哪裡來
工作坊邀請四位跨領域學者與實踐者,從隱私強化技術、社科資料共享、國會開放資料到資料治理法制,討論台灣好資料的取得與治理之道。
本場速覽
| 講者 | 講題 | 一句話重點 |
|---|---|---|
| 侯宜秀(主持) | 開場 | 介紹工作坊主題「好資料哪裡來」與四位與談人。 |
| 游家牧 | 資料與隱私的平衡 | 用差分隱私、合成資料等隱私強化技術(PET),示範如何在保護隱私前提下釋出高價值敏感資料。 |
| 卞中佩 | 社科資料運用 | 台灣缺乏高品質社科/中文語料,應盤點各產業既有 AI 專案的資料,思考跨機構共享機制。 |
| 王向榮 | 繁體中文 AI 開源實踐計劃:立法院資料 | 將立法院分散、非結構化(PDF/Word)的議案、公報、質詢影音轉為結構化 API 與開源資料集。 |
| 邱文聰 | 資料治理法草案 | 批評「數據公益」把個資與非個資的界線模糊化,主張以「權利管理系統」讓資料主體動態行使同意權。 |
| 全體與談人 | 交叉討論與現場提問 | 聚焦自然人 vs. 法人資料、政府跨部門資料串接的合法性爭議。 |
顯示 5 / 5 場
1資料與隱私的平衡游家牧(國立陽明交通大學 副教授)
用隱私強化技術(PET)在保護個資/營業秘密的同時,讓高價值資料仍可釋出訓練模型。
重點整理
- 深度學習高度依賴資料量,但半導體製程、醫療、金融等最具產業價值的資料,往往也是最敏感、最不能公開的資料;講者引述一個新竹科學園區廠商的案例:該廠商想把耗資千萬調校出的製程參數上傳群眾協作平台改善模型,卻不敢直接公開原始資料。
- 傳統的「去識別化」/K-匿名化雖是法律(個資法、GDPR)唯一明確承認的技巧,但講者認為其隱私保護能力與資料可用性都很差,過去十幾年也一再爆出去識別化資料被重新識別的案例。
- 介紹「隱私強化技術」(Privacy Enhancing Technologies, PET)家族,包括差分隱私(Differential Privacy)、合成資料(Synthetic Data)、同態加密、安全多方計算、聯邦學習,並比較各自的效能/安全性/實用性:同態加密安全性最高但效能極差,仍停留在學術界;聯邦學習雖然不釋出原始資料,但仍有隱私漏洞。
- 差分隱私的核心概念:對查詢結果加入雜訊,使「資料庫裡有沒有某一筆特定紀錄」都不影響查詢結果,藉此在數學上保證無法反推任何一筆紀錄是否存在。雜訊大小需視資料集的極端值(outlier)而定,且與資料可用性成反比。
- 提出經驗法則:使用差分隱私時資料量最好在 1 萬筆以上(5000 筆也堪用),否則雜訊無法在統計運算中互相抵消,可用性會明顯下降。
- 差分隱私已有實務案例:美國政府自 2020 年起用差分隱私釋出普查資料;Uber、LinkedIn 用於內部工程師查詢公司資料庫,防止離職員工外洩敏感資訊。
- 合成資料的原理:假設真實資料背後存在一個機率分布,用生成模型(如 GAN、Diffusion Model)學出該分布後重新取樣,產生一份「來源不同但統計性質相近」的全新資料集再釋出;但依 NIST 辦過的比賽結果,表格型資料用深度學習模型做合成效果反而不如影像資料好(推測原因是表格資料缺乏影像常見的「局部性」特徵)。
- 分享與某縣市政府合作的實際案例:警察局、消防局、衛生局三個局處分別掌握車禍事故的不同階段資料(案發地點、救護車接送、送醫傷勢),彼此依法不能互相交換資料,只能各自先做隱私強化(差分隱私)再串接(「先強後串」),而非先串接再強化(「先串後強」)。
- 案例資料含大量缺失值,業主堅持一律補值為 999(而非用統計方法補值),且資料串接因 hash ID 不一致而只能取三方交集,導致樣本量大幅縮水;連結後的差分隱私成果因此比僅用交集資料的成果更差,凸顯資料量對差分隱私效果的關鍵影響。
- 非數值欄位改用「隨機應答」(Randomized Response)技術加雜訊,其原理源自 1965 年美國一項敏感問卷調查方法(如「你是否為同性戀/共產黨員」):受訪者先擲硬幣,正面隨機作答、反面誠實作答,讓每個人的答案都具有「合理可否認性」(plausible deniability),統計上仍可反推真實比例。
- 結論:隱私強化技術愈趨普及(政府與新創皆已投入),但沒有「萬用解」,必須依下游應用(統計運算 vs. 深度學習建模)選擇合適技術;並非所有 PET 搭配 AI 都會有最好效果。
提到的技術・產品・數據
- 差分隱私(Differential Privacy)
- 對查詢結果加雜訊,數學上保護個別紀錄是否存在的隱私。
- 合成資料(Synthetic Data,含 GAN/Diffusion Model)
- 學習資料分布後重新取樣產生假資料。
- K-匿名(K-anonymity)
- 傳統去識別化技巧,法律明確承認但保護力與可用性均弱。
- 同態加密(Homomorphic Encryption)、安全多方計算(Secure Multi-Party Computation)、聯邦學習(Federated Learning)
- 其他 PET 技術,各有效能/安全性取捨。
- 隨機應答(Randomized Response)
- 1965 年起用於敏感問卷調查的加雜訊技巧,此處用於非數值欄位的差分隱私化。
- 數位發展部《隱私強化技術應用指引》(2024 年公布,講者參與撰寫)
- 官方對 PET 技術的推廣文件。
值得記下的觀點
我們這一次的 talk 是在講說,有沒有什麼方式我可以鼓勵大家,然後 release 一些很有價值,但是非常敏感的資料,但是他又不會傷害到這個資料本身的價值。
如果你要使用差分隱私的話,你的資料量一定要 1 萬筆以上,這是一個蠻保險的範圍。
Q&A
- 沒有獨立的 Q&A 環節;主持人因時間安排請講者結束,相關討論併入第 5 段的交叉討論。
查證註記
- 游家牧現為國立陽明交通大學電機工程學系/資訊管理與財務金融學系合聘教授,取得台灣大學電機工程學系博士學位,研究專長為 AI 安全、資料隱私與網路安全,2022 年獲李國鼎磐石獎,並擔任陽明交通大學青年講座教授。來源:國立陽明交通大學電機系李國鼎磐石獎 2022 得獎資料
- 講者提到的《隱私強化技術應用指引》確為數位發展部多元創新司 2024 年推動的文件,內容與講者描述吻合,但未能取得官方連結逐字核對版本細節(未能查證)。
2社科資料運用卞中佩(國立政治大學 創新國際學院 助理教授)
主張幾乎所有訓練大型語言模型的資料本質上都是社科資料,台灣應盤點並共享現有資料而非重複標註。
重點整理
- 開場提出反思:與其問「哪裡有好的社科資料」,不如先問「為什麼需要好的社科資料、什麼叫做『好』」——因為大型語言模型本質上都在模擬、學習人類行為,幾乎所有訓練資料都可算是廣義的社科資料。
- 指出社會科學研究長期缺資料(做問卷調查也缺),機器學習時代同樣缺資料,但生成式 AI(自 ChatGPT / GPT-3.5,2022 年後)出現後,「資料需求的質與量都不同了」,焦慮感因此被放大。
- 提醒 LLM 存在「幻覺」問題:即使能任意生成內容,仍會因訓練資料不精準而輸出不準確答案,因此仍需要精準資料做 RAG、微調(fine-tuning)。
- 點出中國在「數據要素」政策上的競爭壓力:北京、上海、深圳、貴州等地數據交易所已在 2024 年 4 月釋出首批 100 個「高質量數據集」,供訓練大型語言模型使用;質疑台灣目前尚無對應的「數據國家隊/產業隊」。
- 分享政大創新國際學院承接的 ESG 報告 AI 專案案例:包含將整份 ESG 報告摘要並轉換成新聞稿格式(講者親自逐句改寫做人類反饋,即 RLHF 的資料標註)、大量 ESG 報告的指定格式摘要、從 ESG 報告中萃取統計數據等,並反思這些「乙方」單位其實在幫多個「甲方」重複勞動,呼籲應建立產業共享的 ESG 訓練資料庫。
- 分享中小企業客服機器人案例(南部一家照明大廠「五光」,具體全名未清楚交代),指出若沒有充足的 RAG/微調專業術語資料(如燈具型號、規格用語),客服機器人品質會很差,呼籲同產業間可共享基礎資料以降低中小企業導入 AI 的成本。
- 分享自己的研究專案「台灣氣候變遷態度機器人」:以 2020 年真實委託民調公司做的電話訪問資料(含真實受訪者的人口學特徵與對氣候變遷的態度)為基準,比較 ChatGPT 在給定相同人設條件下的回答與真人回答的差距,並嘗試用真人回答資料微調模型(含最新的 GPT-4o 微調 API),目標是讓模型愈來愈接近台灣真實民意分布;截至演講當下微調結果尚未完全出爐。
- 引用「中央研究院社會變遷調查資料庫」作為可供類似專案使用的優質社科資料來源。
- 引用 2024 年一篇中國研究:比較不同社群網路文本對訓練大型語言模型效果的影響,意外發現效果最好的並非知乎、小紅書等「精緻」內容,而是「弱智吧」這類充滿雙關語、諷刺、黑話的貼文,推測正是這類語言的多層次意涵有助模型學習語言與文化的深層結構。
- 分享自己的文本分類(情感分析:正向/負向/中立)實作經驗:台灣目前缺乏現成大量的中文文本分類標註資料集,做測試時甚至得先借用中國微博資料集驗證方法可行性,再花預算請工讀生標註台灣(如 Facebook)語料。
- 結語呼籲:台灣資源(尤其算力)有限,應該反過來從「LLM 要做什麼精確任務」的需求出發,回推需要的 input/output 資料,並對不同資料訓練後的效果做系統性評估,而非盲目餵資料。
提到的技術・產品・數據
- 北京數據交易所(北數所)/上海、深圳、貴州數據交易所
- 2024 年 4 月釋出首批百組「高質量數據集」,用於訓練中國的大型語言模型。
- ESG 報告 AI 解讀與產製專案
- 政大團隊承接的企業委託案,含摘要、格式轉換、統計萃取等任務。
- 台灣氣候變遷態度機器人
- 講者自己的研究專案,結合 2020 年真實民調資料與 ChatGPT/GPT-4o 微調。
- 中央研究院社會變遷調查資料庫
- 講者推薦的優質社科資料來源。
- 「弱智吧」語料效果研究(2024 年中國研究)
- 講者引用但未報出處名稱(未能查證,僅描述其發現)。
值得記下的觀點
有學者說有偏見是好的,因為有下好的 prompt 呢,它能夠呈現特定群體的意見與看法。
大家不要擔心什麼小紅書、不要擔心什麼知乎……最好的是『弱智吧』。
你要 LLM 做什麼精確的事情,這個事情你要產出,input 什麼,你的 output 又要什麼,那個就是你要的資料。
Q&A
- 沒有獨立的 Q&A 環節;卞中佩在第 5 段的交叉討論中,主動針對自然人/法人資料權利義務的區分向邱文聰提問。
查證註記
- 卞中佩現為國立政治大學創新國際學院助理教授,博士畢業於德州 A&M 大學社會學系,研究領域涵蓋政治社會學、環境社會學、組織理論、計算社會科學,2024 年獲政大優良導師獎;與講者描述的「環境社會學、政治社會學、計算社會科學及組織理論」吻合。來源:政大創新國際學院師資頁
- 講者提到「北數所」「上海、深圳、貴州」數據交易所 2024 年 4 月釋出百組高質量數據集一事,屬於中國「數據要素」政策脈絡下的公開報導內容,惟本次查證未能取得對應的官方新聞稿逐字核對(未能查證)。
- 「弱智吧」語料效果研究、南部照明廠「五光」客服機器人案例,講者描述細節有限(廠商全名、研究論文名稱均未清楚交代),故列為口語分享內容,未進一步查證。
3繁體中文 AI 開源實踐計劃:立法院資料王向榮(歐噴有限公司 OpenFun 創辦人)
把立法院分散在多個機關、格式為 PDF/Word 的議案、公報、質詢影音轉為結構化 API 與開源資料集。
重點整理
- 主持人介紹:王向榮長期參與開放政府與開放國會運動,曾發起「政治獻金透明化」(群眾外包將紙本政治獻金申報資料數位化)、「求職小幫手」(瀏覽器擴充功能顯示雇主的勞動法違規紀錄)等公民科技專案,目前發起「台灣國會 API」專案。
- 本次分享的計畫源自「繁體中文 AI 開源實踐計劃」(由 g0v 零時小學校核發獎助金,共選出 6 個專案,總計核發約新台幣 30 萬元獎金,聚焦醫療、法律、教育、台語文、國會資料等領域)。
- 此立法院資料專案的主導者其實是《報導者》的資料記者,王向榮主動提議合作、共同申請獎助金;起因是《報導者》曾製作一份分析:用文字探勘技術整理第 10 屆 113 位立委過去 4 年在立法院公報中所有質詢紀錄,為每位立委標出關心的前五大議題(約人工分類出 100 多個標籤),協助選民檢視立委問政方向;但此類報導每 4 年才做一次,兩人希望能做到更即時(一年、一會期,甚至一週更新一次)。
- 用「大學制度」比喻立法院運作:113 名立委等同全體學生,任期 4 年(像大學四年制);8 個常設委員會抽籤分配(財政、內政、社福等),可與其他立委交換;每年兩個會期(2–5 月、9–12 月,本次會議恰逢新會期開議週)。
- 說明「院會」(113 位立委全體會議,決定法案付委與最終二讀三讀)與「委員會」(分工審查特定部會法案/預算)的分工;並介紹「國事論壇」(會期開始前的個人 15 分鐘自由發言,官員無義務回應,性質類似立委的個人頻道/YouTube,仍會被完整收錄進公報)、「質詢官員」(因修法或時事質詢部會首長,例如兒少偷拍等社會事件會促發質詢)、修法流程(法案對照表列出現行條文、修正條文與提案理由,同一修法常有多個版本並陳,最終多用共識決通過,僅少數送院會表決,一個會期大約只有兩三次真正表決)。
- 盤點立法院現有資料類型:議案資料(每年約 7000–8000 筆提案,2023 年暴增至逾 1 萬 3000 筆,含法律案與預算提案,均為 Word 檔);會議影音(每年約 300 多場會議、依委員發言切成數千個片段);公報(最具法律效力的文件,逐字收錄所有委員與官員發言的主治稿,每天出刊一本,一年約 150–200 本,但需經委員確認、公布會有 2 週至 1 個月的時間落差);立法院法制局研究報告(累積已逾 2000 份,屬相對中立的議題研究,供立委參考)。
- 立法院各單位(資訊處、議事處、國會圖書館等)平行分工、各自公布資料,導致資料分散在多個網站、格式不一,資訊處雖積極推動開放資料,但無法強制其他平行單位釋出或統一格式。
- 分享清理資料所用工具:Apache Tika(將 Word/PDF 轉為保留原始樣式類別(如標題1、標題2)的 HTML,可據此準確切分段落結構,例如辨識「朝野協商」次標題)、LibreOffice(soffice,轉出與原始 Word 排版幾乎一致的 HTML,供線上直接閱讀無需下載)、以及另一個 PDF 轉文字並保留排版的工具;將處理結果統一編碼(屆、會期、委員會代碼、次數)後彙整存入 Elasticsearch 資料庫(因欄位需彈性擴充、且資料不常修改但需高可搜尋性)。
- 已寫約二三十支程式,每日自動從各來源(Open Data、委員會議事錄、公報等)抓取、清理、匯入最新資料,並包裝為兩套服務:govapi.tw 系列 API(舊版已停更;新版位於 v2.ly.govapi.tw,涵蓋議案、會議、立委等 JSON API)與展示網站 data.ly(以資料視覺化呈現立法院各類資料,並在每頁頁尾標註對應的 API 端點供使用者回溯)。
- 另建置 Whisper 語音辨識機器人:立法院官方 IVOD 影片釋出約 10 分鐘後即自動抓取、跑 Whisper 轉逐字稿並存入 data.ly,可在質詢完約 30 分鐘內提供「堪用但不精準」的逐字稿,待官方公報正式逐字紀錄(需 2 週至 1 個月)出爐後再取代;並提出構想:因會議主題與與會人員事先可知,未來或可用這些上下文提升 Whisper 對專業術語的辨識準確度。
- API 應用案例:與公民監督國會聯盟(公督盟)合作,將原本需人力(工讀生翻公報逐一統計)才能得出的立委出席率、質詢次數等指標改為即時自動計算;建置多版本修法內容自動比對介面(過去研究者需人工列印十幾二十份 Word 版本逐條比對,現可直接勾選版本線上比對條文差異);把純文字公報轉為區分主席/質詢人/官員發言的友善閱讀介面;沿用 g0v 既有的投票紀錄視覺化工具。
- 因獎助計畫要求資料須釋出至 Hugging Face,已上傳兩個資料集:(1) 每位立委在 IVOD 中的質詢片段(含立委身份、會議主旨、時間區間、完整質詢與官員回應逐字稿,自動化定期更新);(2) 立法院法制局研究報告全文(自 PDF 萃取並清理);目標是未來把議案、會議、立委等全部資料集都上傳並自動更新至 Hugging Face,讓大量資料研究者無需自行寫爬蟲。
- 邀請聽眾加入「g0v 國會松」(每月定期舉辦的黑客松,關注國會資料與議題)並訂閱其 Substack 電子報;國會松社群目前也在協作一份國會知識入門教材(一讀二讀三讀、委員會與院會流程等),目標讓新手能在半小時到一小時內快速上手國會資料。
提到的技術・產品・數據
- Apache Tika
- 將 Word/PDF 轉為保留樣式類別的 HTML,供結構化解析。
- LibreOffice(soffice)
- 轉出與原始排版一致的 HTML,供線上瀏覽。
- Whisper(OpenAI 語音辨識模型)
- 自建機器人在 IVOD 影片釋出後即時產生逐字稿。
- Elasticsearch
- 儲存彈性欄位、需高可搜尋性的立法院整合資料庫。
- govapi.tw/v2.ly.govapi.tw
- 立法院資料 JSON API。
- data.ly(歐噴 OpenFun 產品)
- 立法院資料視覺化展示網站,含 API 溯源標註。
- Hugging Face 開源資料集
- 立委 IVOD 質詢片段、立法院法制局研究報告全文。
- 《報導者》「113 位立委關心議題」互動報導
- 觸發本專案合作的原始報導(具體標題與連結未能查證)。
值得記下的觀點
我覺得我沒有像前面兩位老師那麼專業,因為像隱私問題我就覺得……我真的很苦惱,我覺得很難解決,所以我就特別喜歡處理政府的 open data,因為政府的 open data 不會有任何隱私問題——反正有隱私的就不會被 open。
我覺得我們要監督立委這件事情,不應該是四年監督一次……我們其實應該隨時隨地,只要這個立委做出跟你有關的事情,我們好像就應該要監督他。
Q&A
- 沒有獨立的 Q&A 環節;主持人以「應該很快可以用來訓練立委的分身機器人」作結後直接轉場,相關討論併入第 5 段的交叉討論。
查證註記
- 王向榮確為歐噴有限公司(OpenFun Ltd.)創辦人,g0v 社群 ID 為 Ronny Wang,長期投入政治獻金透明化、求職小幫手等公民科技專案;OpenFun 產品包含政府預算查詢、立法追蹤、立法院 AI 逐字稿服務,與講者描述吻合。來源:歐噴有限公司官網天下雜誌專訪
- 「繁體中文 AI 開源實踐計劃」(Traditional Chinese AI Open Source Grant)由開拓文教基金會主辦,透過 g0v 零時小學校執行,計畫期間為 2023/1/3–2024/4/18(分三梯次徵件),每案獎助新台幣 20–50 萬元,聚焦繁體中文語料蒐集、繁中基準評測、法律/醫療/教育等領域語言模型、繁中優先開源模型、台語客語原民語等多語考量;講者提到「六個專案、約 30 萬元獎金」與此計畫方向大致吻合,唯講者的獎金金額描述較籠統,細節請以官方公告為準。來源:開拓文教基金會計畫頁g0v 零時小學校計畫看板
4資料治理法草案邱文聰(中央研究院法律學研究所 研究員)
主張以「權利管理系統」讓資料主體動態行使同意權,取代把個資模糊貼標為「非個資」的數據公益思路。
重點整理
- 開場自我定位為「來踢館的法律人」:前三位講者提供的是技術面解法(如何用隱私保護技術鼓勵開放資料),自己則從法制面切入,處理技術解法無法解決的問題。
- 說明此草案源自一項以劉靜怡為主持人、邱文聰為共同主持人的國家科學及技術委員會(國科會)AI 人文法治研究計畫;研究團隊在爬梳歐盟法制架構時,發現資料治理是 AI 發展不可迴避的前置法制問題,因而衍生出資料治理法草案。
- 以歐盟「Digital Decade(2030 數位十年)」金字塔架構說明歐盟的整體佈局:最上層是「Guidance」(民主、以人為本、社會連帶、選擇自由等價值方針);中層是「Rules」(AI 規則、資料治理規則、資料空間規則等法規範);最底層是「Cutting-edge technology」(數位分身、量子運算、數位皮夾等技術)。歐盟自 2018 年起逐步推展此政策,到 2020 年正式提出 2030 數位十年藍圖。
- 進一步說明支撐該金字塔的五大政策/法制面向:數位服務套案(Digital Services Package)、AI 戰略(對應 AI Act)、資安戰略、資料戰略(對應 Data Act 與 Data Governance Act)、數位隱私(對應 GDPR、E-Privacy Regulation);主張技術之上必須先有法制骨架,才能長出符合民主與人權價值的數位化發展,其中最關鍵的正是資料治理法(Data Governance Act)。
- 對照台灣現況:立法院當時已提出人工智慧基本法草案,但僅處理「應用層」規範(風險管制、責任分配、權利救濟),尚缺最底層的資料治理法制;也需同步修正個人資料保護法、處理大型語言模型訓練文本涉及的著作權爭議。人工智慧基本法草案條文中已納入「應納入個資保護相關措施」的意識,研究團隊因此進一步提出資料治理法草案。
- 核心論點:反駁「只要不碰個資就沒事」或「用 PET 技術處理過就能放心開放」的想法。依個資法定義,資料是否為個資的關鍵在於是否具備「可串聯性」與「可推論性」,或是否已徹底聚合(aggregate)而喪失個體性;只要仍可透過 hash ID 或代號歸戶串接,即便經過去識別化處理,法律上仍是個資——因此不論「先強(隱私強化)後串」或「先串後強」,只要事後仍可串聯,本質上都還是個資。
- 明確點名批評數位發展部「數據公益」概念有兩個問題:(1) 未釐清何謂「非個資」,不能僅靠貼上「數據」標籤就使其脫離個資法定義;(2) 數位部設想的「工益(公益/貢獻)」主體是資料持有者(data holder)自願提供,但歐盟原始的數據公益(data altruism)概念中,貢獻的主體應是資料本人(data subject),而非「別人拿著我的資料替我做公益」。
- 補充說明差分隱私的特殊地位:差分隱私因為有「Curator」中介角色(使用者只能詢問、不能直接存取原始資料庫),確實有機會讓個資轉化為非個資;但若脫離 Curator 直接開放給大眾自由查詢,隱私預算(privacy budget)容易被暴力破解式的重複查詢突破,因此不適合直接作為開放資料庫供大眾訓練 AI 使用,仍需透過 Curator 把關。
- 草案將個資使用情境分為四類:(1) 完全匿名化(不可串聯、不可推論,或已聚合)即回歸非個資;(2) 透過「權利管理系統」由資料主體自主操作同意;(3) 若有作用法規範得再利用,資料主體可不需事前同意但保留事後退出(opt-out)機制;(4) 最強制的「作用法強制再利用且不得退出」,僅限有重大公益且經個別立法授權(如強制徵收)的情況。
- 「權利管理系統」核心精神:反轉過去資訊工程界「想辦法在資料屬性上做手腳讓它變成非個資即可使用」的思路,改為運用資訊科技協助資料主體更便利地行使其資料權利(同意或退出),使個資即使仍是個資,也能動態、便利地貢獻給社會使用,而非「一放出去就斷了線」;並搭配「資料中介服務」(intermediary)角色,降低資料使用者尋找資料、逐一取得同意的交易成本。
值得記下的觀點
不是在從資料本身的屬性再去下功夫了,而是我們倒過來去 engage data subject……它應該要行使它的權利。
它不會因為你貼上『數據』這兩個字的標籤,就讓它突然變成不是個資了,不是這樣。
PET 的技術我認為它是作為一個資訊安全的方法,而不必然是一種讓個資變成非個資的方法。
Q&A
- 見第 5 段的交叉討論。
查證註記
- 邱文聰現為中央研究院法律學研究所研究員,研究領域涵蓋資訊法、憲法、隱私權、科學與法律、科技與社會研究;現場另提及的單位職稱「制裁技轉處的處長」,正確單位名稱未能查證(推測為中研院院內技轉相關單位,但確切全名與是否現任處長未查得官方來源,故標註未能查證)。來源:中研院法律所個人頁
- 年會當下狀態(2024/09):邱文聰在本場分享的「資料治理法草案」,是他與劉靜怡等人共同主持的國科會研究計畫(AI 人文法治研究)所研擬的政策倡議草案,當時尚未送入立法院正式審議,性質上是學術/政策研究團隊參考歐盟 Data Governance Act 提出的立法建議,用來補足當時立法院已提出的人工智慧基本法草案在「資料治理」底層法制上的缺口。
- 事後發展(截至 2026/08):台灣立法院已於 2025 年 12 月 23 日三讀通過《人工智慧基本法》,全文 20 條,明定國家科學及技術委員會為主管機關,並將「隱私保護與資料治理」列為 7 大推動原則之一,由數位發展部負責建立風險分級框架、協助各目的事業主管機關辨識高風險應用並推動資料治理機制——但這是 2025 年通過的《人工智慧基本法》,並非邱文聰在本場主張、內容更細緻的獨立「資料治理法」。查證時未查得邱文聰版本的資料治理法草案本身已進入正式立法院審議或三讀的紀錄,故其後續立法進度未能查證,讀者請勿將 2025 年的《人工智慧基本法》三讀結果,誤讀為本場座談討論的「資料治理法草案」本身已完成立法。來源:法源法律網:人工智慧基本法三讀通過中央社報導未來城市@天下解讀
- 講者提及行政院同時期也在推動個人資料保護法修正與獨立監督機關(個人資料保護委員會)之設置,經查證行政院確實通過「個人資料保護委員會組織法」草案及「個人資料保護法」部分條文修正草案,方向與講者論述的「資料治理法制拼圖」一致。來源:行政院新聞稿
- 政府/公部門 AI 導入痛點的其他討論,另見 Day 2 R0 下午場(張文熙/財政部,用 AI 選案查稅)與 Day 2 R2 智慧醫療場(許凱程、賴來勳、康仕仲;並補充邱泊寰場次的背景)。
5交叉討論與現場提問侯宜秀(主持)、卞中佩、邱文聰
聚焦自然人 vs. 法人資料、政府跨部門資料串接的合法性爭議。
重點整理
- 主持人邀請前面講者針對邱文聰的資料治理法草案回應,卞中佩率先提出兩個問題。
- 自然人 vs. 法人的資料權利義務區分:卞中佩指出自己在做氣候變遷相關分析時,經常需要調閱企業(尤其是碳排放大戶)的資料,但企業/部會常以「隱私」為由拒絕,實務上卻是用「自然人」的個資保護邏輯來擋「法人」資料的釋出,質疑資料治理法草案打算如何處理這個混淆。
- 政府部門間跨部門資料串接的合法性:以警政、消防、衛生資料串接為例,質疑到底該「先串後強」(先串接、再整體隱私強化)還是「先強後串」(各自先強化、再嘗試串接),並指出實務上基層公務員對資料串接高度敏感、不願配合,但強大的政策需求下仍會「想辦法先串」;卞中佩個人立場傾向支持「先串後強、且串接後完全去識別化」是可以接受的,尤其對公司資料更是如此。
- 邱文聰回應第一點(法人營業秘密):法人的營業秘密資訊若要強制揭露,必須透過另外的個別立法明確授權,不能一概以「隱私」擋下;並舉例:化學工廠的危險化學物質資訊對消防救災極其重要,若立法要求透過化學資訊揭露系統統整,一旦發生災害,第一線消防人員即可即時查閱,避免因資訊不明造成救災傷亡;企業在此類立法要求範圍外仍可以營業秘密為由拒絕公開。至於原本為特定管制目的收集的行政資料(如食藥署要求藥廠提交新藥臨床試驗資料以供安全性審查),該資料能否在審查完成後進一步公開,仍需視原始蒐集目的與藥廠主張的必要性另行權衡,不必然可百分之百公開。
- 邱文聰回應第二點(跨部門串接):明確指出「以德國為例,是嚴格禁止跨部門資料串接的」;台灣雖然實務上已較「習慣」跨部門資料流用,基層資料承辦人員仍有一定敏感度而抗拒串接,但強力政策需求下仍會設法「先串」;邱文聰質疑:即使串接後立即機敏化(去識別化),只要日後仍「可串」,在法律定義上就仍是個資,因此「先串後強」是否真的合法仍存有爭議,關鍵在於「串接的法律依據何在」。並以北歐統計法為例:其明確授權在特定統計目的(如 A 統計、B 統計、C 統計)下可進行跨部門資料收集與串接,因為授權範圍寫得非常清楚,因此可安心串接;相較之下,若無明確法律依據就任意串接不同部門的政府資料,容易引發「國家機器濫權」的政治疑慮與民眾反彈。
- 主持人在無其他現場提問後宣布工作坊結束,並特別提及當天是教師節,向三位以「老師」身份與談的講者致謝,同時預告 15:30 將於 R0 國際會議廳舉行本次年會最後一場陳昇瑋紀念講座(講者陳維超,英業達數位長暨資深副總經理,講題〈Delivering Trust in the AI Era〉,15:30–16:20;陳昇瑋為台灣人工智慧學校創辦執行長,已於 2020 年辭世,年會設此講座紀念他)。
Q&A
- 主持人開放現場提問後隨即進入結束致詞,未有觀眾提問。
查證註記
- 「北歐統計法」授權跨部門資料串接一事為邱文聰口頭舉例,未附具體國家與法條名稱,故僅照實記錄講者論述,未能查證其法條依據(未能查證)。