案例研究 01 · LLM 行為評估
撰寫中
以人類行為證據為基礎的 LLM 評估
一項考量次群體差異的研究,探討 LLM 生成的洪災調適回應是否與 937 戶家戶實測的決策路徑相符。
- 937 份核可的人類樣本
- 整體與社會群體視角
- 重複執行的穩定性設計
問題
為何此問題重要
流暢的回應可能看似合理,卻保留了錯誤的風險感知、效能、限制與行動間的關聯。本研究評估的是結構,而不僅僅是表面的相似度。
系統產出
檢視研究邏輯
公開的圖表為研究設計示意圖。數據比較結果尚未發表,故刻意省略。
研究設計示意圖 · 未包含未發表的係數
01人物誌輸入
02測量構念
03路徑比較
04重複執行穩定性
此視角的重點將完整路徑結構與以問卷為基礎的參照進行比較。
角色與方法
我建置了什麼
我設計了人類與 LLM 的對比評估、準備了隱藏標籤的人物誌、規劃了心理計量與多群體 SEM 比較,並建置了重複執行的穩定性檢查。
- 將核可的問卷屬性映射至隱藏群體標籤的人物誌中。
- 在固定協議下收集結構化的生成回應。
- 運用相同的核可測量邏輯估算構念與路徑結構。
- 在不宣稱人類等效性的前提下,比較整體、次群體與重複執行的行為。
驗證與限制
驗證
- 人類與生成回應間相同的構念定義
- 考量次群體的比較
- 重複執行的穩定性檢查
- 明確的手稿與結果狀態
限制
- 問卷回應為自我報告且具備情境特異性。
- 人物誌提示詞無法編碼所有社會或情境因素。
- 路徑一致性不能作為 LLM 能替代人類的證據。
- 未發表的效應值與次群體結果未予展示。
聯絡方式
建立將模型行為與真實證據連結的評估
我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。