精選作品

基於證據的代理系統

研究工作從實測決策出發,推進至模型結構、代理行為、限制檢查,以及在耦合環境中的結果。

精選作品

我建構與探究的問題

每個專案都呈現同一套實務的不同環節:評估決策、追蹤後果,以及治理行動何時能改變系統。

01撰寫中

以人類行為證據為基礎的 LLM 評估

比較 LLM 生成決策與實測人類路徑在各社會群體間的差異。

我設計人類與模型的比較架構、社會群體分析視角,以及重複執行的穩定性檢查。

  • 評估設計
  • 心理計量與結構方程式模型
  • 穩定性分析
檢視案例研究: 以人類行為證據為基礎的 LLM 評估
02研究原型 · 已封存

FLOODABM

將家戶調適行為與洪災損害、保險及財務風險連結。

我建構家戶決策模型,並將調適選擇連結到巨災、保險與財務機制。

  • 代理人基模型
  • 耦合模擬
  • 風險系統
檢視案例研究: FLOODABM
03開發中 · 準備釋出

WAGF

在耦合模擬更新前,檢查並修正代理決策。

我設計驗證與修正流程,在模擬狀態改變前檢查代理提出的行動。

  • 結構化輸出
  • 限制驗證
  • 可稽核修正
檢視案例研究: WAGF

開源系統實證

具備可檢驗失效行為的研究基礎設施

精選的儲存庫支援研究營運、代理編排與多語言學習。各項數據皆透過經過審查的建置期數據工作流進行更新。

awesome-agentic-ai-zh

維護中的三語 AI 代理發展藍圖,具備自動化跨語言檢查。

6.2K stars · 836 forks

awesome-agentic-ai-zh

ai-research-skills

可組合的研究工作流,涵蓋從發現研究缺口到研究設計與草稿撰寫。

220 stars · 17 forks

ai-research-skills

research-hub

本地優先的 Zotero、Obsidian 與 NotebookLM 工作區,具備來源檢查功能。

52 stars · 8 forks

research-hub

agent-collab-skills

多代理協作的任務拆解、協調、辯論與驗收關卡。

23 stars · 6 forks

agent-collab-skills

codex-delegate

跨平台委派封裝工具,透過儲存庫狀態驗證任務完成度。

63 stars · 6 forks

codex-delegate

更新時間: 2026-08-23 · 資料來源: GitHub REST API 資料快照

PDF

文件

請依據您的情境選擇文件。網站保持統一的定位;而 PDF 則針對不同讀者調整重點。

聯絡方式

建立將模型行為與真實證據連結的評估

我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。

wec324@lehigh.edu

F-1 學生身分 · 具備 CPT 資格