測量
哪些構念與次群體差異有受到人類回應數據的支持?
研究計畫
我的研究探討模型生成的行為在何處與觀察到的路徑一致、在何處產生分歧,以及在這些決策影響外部系統之前需要哪些管控。
哪些構念與次群體差異有受到人類回應數據的支持?
生成的回應是否在重複執行中保留了相關的路徑結構?
哪些物理、財務與行為限制應該作為代理行動的把關標準?
決策如何隨時間改變暴露度、損害、保險以及家戶財務負擔?
研究工具包
行為系統觀測站
每個階段都揭示了不同的效度問題:測量了什麼、如何估算路徑、模型改變了什麼,以及代理行為可能在何處失效。
展開各階段以檢視其證據、風險與關聯性。
人們在面臨洪災風險時會採取什麼行動?
為 AI 評估提供實證參考,而非僅依賴直覺的評分標準。
哪些潛在因素與路徑形塑了調適決策?
將評估方式從單純比對答案,提升為比較決策結構。
家戶決策如何在時間與空間中累積?
在具有狀態的系統中測試行為,其中選擇會產生下游效應。
生成的決策是否與實測的人類路徑相符?
將表面流暢度與基於證據的行為一致性區分開來。
代理行動能否通過明確的領域與行為限制?
將治理轉化為可檢驗的系統行為,而非只是政策口號。
當決策進入耦合環境後,會發生什麼改變?
透過在變動系統中的後果來評估代理,而非僅評估孤立的文本。
聯絡方式
我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。