案例研究 01 · LLM 行為評估

撰寫中

以人類行為證據為基礎的 LLM 評估

一項考量次群體差異的研究,探討 LLM 生成的洪災調適回應是否與 937 戶家戶實測的決策路徑相符。

  • 937 份核可的人類樣本
  • 整體與社會群體視角
  • 重複執行的穩定性設計

問題

為何此問題重要

流暢的回應可能看似合理,卻保留了錯誤的風險感知、效能、限制與行動間的關聯。本研究評估的是結構,而不僅僅是表面的相似度。

系統產出

檢視研究邏輯

公開的圖表為研究設計示意圖。數據比較結果尚未發表,故刻意省略。

研究設計示意圖 · 未包含未發表的係數

此視角的重點將完整路徑結構與以問卷為基礎的參照進行比較。

角色與方法

我建置了什麼

我設計了人類與 LLM 的對比評估、準備了隱藏標籤的人物誌、規劃了心理計量與多群體 SEM 比較,並建置了重複執行的穩定性檢查。

  1. 將核可的問卷屬性映射至隱藏群體標籤的人物誌中。
  2. 在固定協議下收集結構化的生成回應。
  3. 運用相同的核可測量邏輯估算構念與路徑結構。
  4. 在不宣稱人類等效性的前提下,比較整體、次群體與重複執行的行為。

驗證與限制

驗證

  • 人類與生成回應間相同的構念定義
  • 考量次群體的比較
  • 重複執行的穩定性檢查
  • 明確的手稿與結果狀態

限制

  • 問卷回應為自我報告且具備情境特異性。
  • 人物誌提示詞無法編碼所有社會或情境因素。
  • 路徑一致性不能作為 LLM 能替代人類的證據。
  • 未發表的效應值與次群體結果未予展示。

帶來了什麼改變

當比較的單位是具有明確效度限制的決策路徑,而非單一的合理答案時,行為評估會變得更有價值。

聯絡方式

建立將模型行為與真實證據連結的評估

我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。

wec324@lehigh.edu

F-1 學生身分 · 具備 CPT 資格