Wenyu Chiou 於 AGU 2025 發表耦合人類與洪災調適模型海報。

博士研究員 · 理海大學 (Lehigh University)

邱文昱 Wenyu Chiou

我評估 LLM 代理如何做出決策、建構能約束與稽核其行動的系統,並模擬這些決策如何在複雜環境中演變。

我的專長涵蓋以人類行為為基礎的 LLM 評估、模擬使用者、行為模擬、計算社會科學與 AI for Science。

尋求 2027 年夏季實習機會,專注於 LLM 評估、代理系統、行為模擬以及 AI for Science 等領域。

於紐奧良舉行的 AGU 2025 發表人類—洪災耦合模型研究。

專業領域

我的核心工作是理解並評估模型行為。

我串連評估、治理與模擬,從決策所依據的證據一路檢視到它在系統中造成的後果。

以人類行為為基礎的 LLM 行為評估

我設計能比較模型生成決策與實測人類路徑的評估方法,找出社會群體差異與不穩定性,並清楚說明效度邊界。

  1. 01

    受治理的代理系統

    我建構結構化決策流程,在行動改變系統狀態前執行限制檢查、針對性修正,並留下可稽核軌跡。

  2. 02

    行為與耦合模擬

    我模擬決策如何隨時間累積,以及它們如何與物理、制度與財務過程互動。

  3. 03

    研究軟體與可重現工作流

    我將研究方法轉化為經過測試的 Python 系統、具版本控制的研究產出與可審查的自動化流程。

涉獵範圍模擬使用者、計算社會科學、代理人基模型、巨災與風險系統,以及 AI for Science。

精選作品

我建構與探究的問題

每個專案都呈現同一套實務的不同環節:評估決策、追蹤後果,以及治理行動何時能改變系統。

01撰寫中

以人類行為證據為基礎的 LLM 評估

比較 LLM 生成決策與實測人類路徑在各社會群體間的差異。

我設計人類與模型的比較架構、社會群體分析視角,以及重複執行的穩定性檢查。

  • 評估設計
  • 心理計量與結構方程式模型
  • 穩定性分析
檢視案例研究: 以人類行為證據為基礎的 LLM 評估
02研究原型 · 已封存

FLOODABM

將家戶調適行為與洪災損害、保險及財務風險連結。

我建構家戶決策模型,並將調適選擇連結到巨災、保險與財務機制。

  • 代理人基模型
  • 耦合模擬
  • 風險系統
檢視案例研究: FLOODABM
03開發中 · 準備釋出

WAGF

在耦合模擬更新前,檢查並修正代理決策。

我設計驗證與修正流程,在模擬狀態改變前檢查代理提出的行動。

  • 結構化輸出
  • 限制驗證
  • 可稽核修正
檢視案例研究: WAGF

行為系統觀測站

透過完整研究系統追蹤決策

每個階段都揭示了不同的效度問題:測量了什麼、如何估算路徑、模型改變了什麼,以及代理行為可能在何處失效。

展開各階段以檢視其證據、風險與關聯性。

01人類證據

人們在面臨洪災風險時會採取什麼行動?

輸入
來自 Passaic 河域調查的家戶資料。
方法
問卷設計、心理計量學,以及考量次群體差異的測量。
輸出
基於實測回應的潛在構念與調適選擇。
效度風險
抽樣、自我報告及建構效度會限制推論的普遍性。
對 AI 團隊的價值

為 AI 評估提供實證參考,而非僅依賴直覺的評分標準。

檢視案例研究
02決策路徑

哪些潛在因素與路徑形塑了調適決策?

輸入
風險感知、效能、限制、產權以及報告的行動。
方法
驗證性因素分析 (CFA) 與多群體結構方程式模型 (SEM)。
輸出
具解釋力的整體決策路徑與社會群體比較。
效度風險
模型適配度本身無法確立因果關係。
對 AI 團隊的價值

將評估方式從單純比對答案,提升為比較決策結構。

檢視案例研究
03行為模擬

家戶決策如何在時間與空間中累積?

輸入
基於問卷的代理參數、洪災暴露度以及保險機制。
方法
結合巨災模型(catastrophe model)的代理人基模型(ABM)。
輸出
2011–2023 年間,跨多個普查區的家戶軌跡。
效度風險
結果取決於校準選擇與情境假設。
對 AI 團隊的價值

在具有狀態的系統中測試行為,其中選擇會產生下游效應。

檢視案例研究
04LLM 行為評估

生成的決策是否與實測的人類路徑相符?

輸入
從核可的問卷屬性中衍生出隱藏標籤的人物誌 (personas)。
方法
比較人類與 LLM 的路徑,並進行重複執行的穩定性檢查。
輸出
考量次群體差異的評估設計;論文撰寫中。
效度風險
流暢的語言可能掩蓋結構上的不一致或不穩定性。
對 AI 團隊的價值

將表面流暢度與基於證據的行為一致性區分開來。

檢視案例研究
05治理與修正

代理行動能否通過明確的領域與行為限制?

輸入
結構化的提案行動、評分與支持理由。
方法
解析、物理/財務/行為驗證、針對性修正與稽核軌跡。
輸出
在狀態更新前,接受、拒絕或修正決策。
效度風險
規則僅涵蓋已宣告的限制,無法涵蓋現實世界中所有的失敗模式。
對 AI 團隊的價值

將治理轉化為可檢驗的系統行為,而非只是政策口號。

檢視案例研究
06外部系統回饋

當決策進入耦合環境後,會發生什麼改變?

輸入
調適行動、危害、財產、保險與財務狀態。
方法
確定性狀態轉換與隨機情境系集 (stochastic scenario ensembles)。
輸出
更新後的暴露度、損害、理賠金與自付額負擔。
效度風險
回饋品質受限於外部模型與可用數據。
對 AI 團隊的價值

透過在變動系統中的後果來評估代理,而非僅評估孤立的文本。

檢視案例研究

開源系統實證

具備可檢驗失效行為的研究基礎設施

精選的儲存庫支援研究營運、代理編排與多語言學習。各項數據皆透過經過審查的建置期數據工作流進行更新。

awesome-agentic-ai-zh

維護中的三語 AI 代理發展藍圖,具備自動化跨語言檢查。

6.2K stars · 836 forks

awesome-agentic-ai-zh

ai-research-skills

可組合的研究工作流,涵蓋從發現研究缺口到研究設計與草稿撰寫。

220 stars · 17 forks

ai-research-skills

research-hub

本地優先的 Zotero、Obsidian 與 NotebookLM 工作區,具備來源檢查功能。

52 stars · 8 forks

research-hub

agent-collab-skills

多代理協作的任務拆解、協調、辯論與驗收關卡。

23 stars · 6 forks

agent-collab-skills

codex-delegate

跨平台委派封裝工具,透過儲存庫狀態驗證任務完成度。

63 stars · 6 forks

codex-delegate

更新時間: 2026-08-23 · 資料來源: GitHub REST API 資料快照

著作與演講

同儕審查著作與公開發表

檢視完整紀錄
  1. 2026

    已發表

    Leveraging Large Language Models for Agent-Based Simulation of Human–Water System Interactions

    Yang, Y. C. E., & Chiou, W. Water Resources Research, 62(6), e2025WR042111.

  2. 2026

    論文發表

    What Makes AI Believable? Comparing AI and Human Responses in Mental Health Risk Assessment

    Chiou, W., & Chiou, H. 2026 ISDSA Meeting on Data Science and Analytics, Beijing, China, July 28–31, 2026.

  3. 2025

    海報發表

    Modeling Long-Term Flood Adaptation Action Across Marginalized and Non-Marginalized Groups: A Coupled Agent-Based Model

    Chiou, W., Yang, Y. C. E., Tanaka, T., Jamrussri, S., & Feng, S. AGU25, New Orleans. Abstract 1890827; poster NH41E-0449.

  4. 2025

    口頭發表 38-03

    Investigating the Decision-Making Process and Causal Relationships between Flood Risk Perception and Adaptation Actions

    The 2nd International Sociohydrology Conference, Tokyo, Japan.

近期公開動態

寫作、發布與演講

LinkedIn 貼文經過策展,因為 LinkedIn 並未提供可靠的公開會員貼文存取。GitHub 儲存庫數據由自動化程式更新,並在拉取請求 (pull requests) 中進行審查。

LinkedIn

面向代理式 AI 與模型上下文協議工作流的開放研究工具組

介紹 research-hub、可組合研究技能與可驗證代理工作流的公開貼文。

開啟

期刊論文

Leveraging Large Language Models for Agent-Based Simulation of Human–Water System Interactions

刊登於 Water Resources Research,第 62 卷第 6 期。

開啟

會議發表

What Makes AI Believable?

ISDSA 2026 會議發表,比較 AI 與人類在心理健康風險評估中的回應。

開啟

PDF

文件

請依據您的情境選擇文件。網站保持統一的定位;而 PDF 則針對不同讀者調整重點。

聯絡方式

建立將模型行為與真實證據連結的評估

我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。

wec324@lehigh.edu

F-1 學生身分 · 具備 CPT 資格