研究計畫

從人類決策證據到受治理的代理行動

我的研究探討模型生成的行為在何處與觀察到的路徑一致、在何處產生分歧,以及在這些決策影響外部系統之前需要哪些管控。

01

測量

哪些構念與次群體差異有受到人類回應數據的支持?

02

行為一致性

生成的回應是否在重複執行中保留了相關的路徑結構?

03

治理

哪些物理、財務與行為限制應該作為代理行動的把關標準?

04

耦合

決策如何隨時間改變暴露度、損害、保險以及家戶財務負擔?

研究工具包

方法與系統

  1. 問卷設計與心理計量測量
  2. 驗證性因素分析 (CFA) 與結構方程式模型 (SEM)
  3. 考量次群體差異與重複執行的 LLM 評估
  4. 代理人基模型(ABM)與巨災模型之耦合
  5. 結構化輸出、驗證器、針對性修正與稽核日誌
  6. Python 研究軟體、測試、CI 以及具版本控制的研究產出

效度邊界

  • 問卷證據特定於其母體、地點、構念與收集過程。
  • 統計模型的適配度是針對特定結構的證據,而非因果關係的證明。
  • LLM 回應的一致性不代表代理等同於人類。
  • 治理規則揭露並管控已宣告的限制;無法涵蓋未知的失敗模式。
  • 模擬結果依然受限於模型結構、校準與情境假設。

行為系統觀測站

透過完整研究系統追蹤決策

每個階段都揭示了不同的效度問題:測量了什麼、如何估算路徑、模型改變了什麼,以及代理行為可能在何處失效。

展開各階段以檢視其證據、風險與關聯性。

01人類證據

人們在面臨洪災風險時會採取什麼行動?

輸入
來自 Passaic 河域調查的家戶資料。
方法
問卷設計、心理計量學,以及考量次群體差異的測量。
輸出
基於實測回應的潛在構念與調適選擇。
效度風險
抽樣、自我報告及建構效度會限制推論的普遍性。
對 AI 團隊的價值

為 AI 評估提供實證參考,而非僅依賴直覺的評分標準。

檢視案例研究
02決策路徑

哪些潛在因素與路徑形塑了調適決策?

輸入
風險感知、效能、限制、產權以及報告的行動。
方法
驗證性因素分析 (CFA) 與多群體結構方程式模型 (SEM)。
輸出
具解釋力的整體決策路徑與社會群體比較。
效度風險
模型適配度本身無法確立因果關係。
對 AI 團隊的價值

將評估方式從單純比對答案,提升為比較決策結構。

檢視案例研究
03行為模擬

家戶決策如何在時間與空間中累積?

輸入
基於問卷的代理參數、洪災暴露度以及保險機制。
方法
結合巨災模型(catastrophe model)的代理人基模型(ABM)。
輸出
2011–2023 年間,跨多個普查區的家戶軌跡。
效度風險
結果取決於校準選擇與情境假設。
對 AI 團隊的價值

在具有狀態的系統中測試行為,其中選擇會產生下游效應。

檢視案例研究
04LLM 行為評估

生成的決策是否與實測的人類路徑相符?

輸入
從核可的問卷屬性中衍生出隱藏標籤的人物誌 (personas)。
方法
比較人類與 LLM 的路徑,並進行重複執行的穩定性檢查。
輸出
考量次群體差異的評估設計;論文撰寫中。
效度風險
流暢的語言可能掩蓋結構上的不一致或不穩定性。
對 AI 團隊的價值

將表面流暢度與基於證據的行為一致性區分開來。

檢視案例研究
05治理與修正

代理行動能否通過明確的領域與行為限制?

輸入
結構化的提案行動、評分與支持理由。
方法
解析、物理/財務/行為驗證、針對性修正與稽核軌跡。
輸出
在狀態更新前,接受、拒絕或修正決策。
效度風險
規則僅涵蓋已宣告的限制,無法涵蓋現實世界中所有的失敗模式。
對 AI 團隊的價值

將治理轉化為可檢驗的系統行為,而非只是政策口號。

檢視案例研究
06外部系統回饋

當決策進入耦合環境後,會發生什麼改變?

輸入
調適行動、危害、財產、保險與財務狀態。
方法
確定性狀態轉換與隨機情境系集 (stochastic scenario ensembles)。
輸出
更新後的暴露度、損害、理賠金與自付額負擔。
效度風險
回饋品質受限於外部模型與可用數據。
對 AI 團隊的價值

透過在變動系統中的後果來評估代理,而非僅評估孤立的文本。

檢視案例研究

聯絡方式

建立將模型行為與真實證據連結的評估

我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。

wec324@lehigh.edu

F-1 學生身分 · 具備 CPT 資格