← 所有專案

CASE 01 ・ 碩士論文

碩士論文|
比較人類、AI 協作與生成式 AI 的創造力

探索 AI 協作與人類創造力差異|基於抽象與具象尺度問題的創造力評估。從定義問題、設計實驗、自建工具到分析結論的完整研究過程。

期間碩士研究,2025.06 完成
角色研究設計、工具開發、資料分析
規模42 名受試者+21 次 AI 對話
工具LimeSurvey、SemDis、R、SPSS
完成三組創造力對照實驗,並提出一套「AI 發散、人收斂」的創意流程
量化以語意距離與專家評分量化創造力,13,549 筆有效回答計算語意距離,抽樣 1,800 筆由 6 位專家評分
做法用語意距離當客觀指標,自建限時問卷與評分網站,用分層抽樣控制評分量

TIMELINE時間軸

階段 1

定義問題與指標

確定要比較的三種創意模式,並決定用語意距離、專家評分、流暢性三個指標衡量創造力。

階段 2

設計實驗與選題

從 MRC 資料庫挑出 10 個抽象到具象的刺激詞,規劃三組的作答流程與每題 4 分鐘限時。

階段 3

自建問卷並施測

用 LimeSurvey 客製倒數計時與自動跳題,完成 42 名受試者與 21 次 AI 對話的施測。

階段 4

抽樣與專家評分

13,549 筆回答分層抽樣成 1,800 筆,透過自建評分網站交給 6 位專家評分。

2025.06

分析與結論

用 R 與 SPSS 分析資料,整理出創意思考流程,完成論文。

PROBLEMS遇到的問題與解法

關鍵決策回答太多,專家評不完|縮小評分範圍

問題收到 13,549 筆有效回答,6 位專家不可能全部評完。
決策雙層分層抽樣(先依組別、再依題目)抽出 1,800 筆,讓每組、每題都有代表;再自建評分網站,統一評分標準、顯示進度、一鍵匯出。
取捨放棄「每一筆都由專家評分」,換取專家能在合理時間內用同一套標準完成;語意距離仍以全部 13,549 筆計算。
結果評分量降到原本約 13%,6 位專家完成評分。
專家評分網站|評分標準與四大維度
評分標準|原創性、變通性、周全性、適切性
專家評分網站|評分操作與進度追蹤
評分畫面|上傳資料、逐題評分、進度追蹤、匯出

Google 表單做不到實驗規格

問題每題要限時 4 分鐘、時間到自動跳題,AI 協作組還要分階段提示,一般表單做不到,也做不到逐一輸入字詞的作答格式。
解法改用 LimeSurvey,用程式碼客製倒數計時、自動跳題與階段提示。
結果三組在相同條件下作答,資料可以直接生成 Excel,方便整理與分析。
字詞聯想測驗問卷介面(AI 協作組)
問卷介面|頂部倒數計時、刺激詞中英對照、AI 協作組的階段提示

創造力很難客觀測量

問題傳統多靠人主觀評分,三組之間很難公平比較。
解法用 SemDis 計算語意距離(聯想詞跟題目的意義相距多遠),再搭配專家評分與流暢性,三個角度一起看。
結果每一筆回答都有可以量化比較的分數。
SemDis 語意距離計算平台
SemDis 平台|上傳題目與回答,計算語意距離

題目的抽象程度要能控制

問題要比較不同抽象程度的題目,挑選題目需要一個客觀的依據。
解法使用 MRC 心理語言學資料庫的具象度量表,依分數切成十段,從抽象到具象各挑一個代表詞(As、Infinity … Apple、Milk),用客觀的方式選題。
結果抽象程度變成可以分析的變數。
MRC 心理語言學資料庫的字詞具象度分數
MRC 心理語言學資料庫|每個字詞都有具象度(CNC)分數

DESIGN實驗設計

人類組21 人,獨立作答
AI 協作組21 人,1 分鐘獨立思考+3 分鐘與 AI 協作
生成式 AI 組21 次獨立對話,每次重開視窗

三組都作答同樣的 10 個刺激詞、每題 4 分鐘,資料以 R 與 SPSS 進行統計分析。

RESULT結果

生成式 AI 的流暢度與語意距離較高;人類的想法變異性較大,少數受試者在某些題目上甚至超過兩種 AI 模式;三種模式的專家評分沒有顯著差異。

不同創意模式的流暢性趨勢與語意距離分布
左|三種模式在十個題目的回答數量(流暢性)|右|三種模式的語意距離分布

依據這個結果,我制定出一套創意思考流程。

STEP 1生成式 AI 負責抽象發散
STEP 2人類負責價值評鑑
STEP 3AI 協作精煉

這個專案讓我體會到,先決定好方法、把流程規劃清楚,專案才可以順利推進。遇到工具做不到的地方,就自己做一個。