核心專長
以人類行為為基礎的 LLM 行為評估
我設計能比較模型生成決策與實測人類路徑的評估方法,找出社會群體差異與不穩定性,並清楚說明效度邊界。

專業領域
我串連評估、治理與模擬,從決策所依據的證據一路檢視到它在系統中造成的後果。
核心專長
我設計能比較模型生成決策與實測人類路徑的評估方法,找出社會群體差異與不穩定性,並清楚說明效度邊界。
相連能力
我建構結構化決策流程,在行動改變系統狀態前執行限制檢查、針對性修正,並留下可稽核軌跡。
我模擬決策如何隨時間累積,以及它們如何與物理、制度與財務過程互動。
我將研究方法轉化為經過測試的 Python 系統、具版本控制的研究產出與可審查的自動化流程。
涉獵範圍模擬使用者、計算社會科學、代理人基模型、巨災與風險系統,以及 AI for Science。
精選作品
每個專案都呈現同一套實務的不同環節:評估決策、追蹤後果,以及治理行動何時能改變系統。
比較 LLM 生成決策與實測人類路徑在各社會群體間的差異。
我設計人類與模型的比較架構、社會群體分析視角,以及重複執行的穩定性檢查。
將家戶調適行為與洪災損害、保險及財務風險連結。
我建構家戶決策模型,並將調適選擇連結到巨災、保險與財務機制。
在耦合模擬更新前,檢查並修正代理決策。
我設計驗證與修正流程,在模擬狀態改變前檢查代理提出的行動。
行為系統觀測站
每個階段都揭示了不同的效度問題:測量了什麼、如何估算路徑、模型改變了什麼,以及代理行為可能在何處失效。
展開各階段以檢視其證據、風險與關聯性。
人們在面臨洪災風險時會採取什麼行動?
為 AI 評估提供實證參考,而非僅依賴直覺的評分標準。
哪些潛在因素與路徑形塑了調適決策?
將評估方式從單純比對答案,提升為比較決策結構。
家戶決策如何在時間與空間中累積?
在具有狀態的系統中測試行為,其中選擇會產生下游效應。
生成的決策是否與實測的人類路徑相符?
將表面流暢度與基於證據的行為一致性區分開來。
代理行動能否通過明確的領域與行為限制?
將治理轉化為可檢驗的系統行為,而非只是政策口號。
當決策進入耦合環境後,會發生什麼改變?
透過在變動系統中的後果來評估代理,而非僅評估孤立的文本。
開源系統實證
精選的儲存庫支援研究營運、代理編排與多語言學習。各項數據皆透過經過審查的建置期數據工作流進行更新。
維護中的三語 AI 代理發展藍圖,具備自動化跨語言檢查。
6.2K stars · 836 forks
awesome-agentic-ai-zh可組合的研究工作流,涵蓋從發現研究缺口到研究設計與草稿撰寫。
220 stars · 17 forks
ai-research-skills本地優先的 Zotero、Obsidian 與 NotebookLM 工作區,具備來源檢查功能。
52 stars · 8 forks
research-hub多代理協作的任務拆解、協調、辯論與驗收關卡。
23 stars · 6 forks
agent-collab-skills跨平台委派封裝工具,透過儲存庫狀態驗證任務完成度。
63 stars · 6 forks
codex-delegate更新時間: 2026-08-23 · 資料來源: GitHub REST API 資料快照
著作與演講
已發表
Yang, Y. C. E., & Chiou, W. Water Resources Research, 62(6), e2025WR042111.
論文發表
Chiou, W., & Chiou, H. 2026 ISDSA Meeting on Data Science and Analytics, Beijing, China, July 28–31, 2026.
海報發表
Chiou, W., Yang, Y. C. E., Tanaka, T., Jamrussri, S., & Feng, S. AGU25, New Orleans. Abstract 1890827; poster NH41E-0449.
口頭發表 38-03
The 2nd International Sociohydrology Conference, Tokyo, Japan.
近期公開動態
LinkedIn 貼文經過策展,因為 LinkedIn 並未提供可靠的公開會員貼文存取。GitHub 儲存庫數據由自動化程式更新,並在拉取請求 (pull requests) 中進行審查。
請依據您的情境選擇文件。網站保持統一的定位;而 PDF 則針對不同讀者調整重點。
聯絡方式
我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。