以人類行為證據為基礎的 LLM 評估
比較 LLM 生成決策與實測人類路徑在各社會群體間的差異。
我設計人類與模型的比較架構、社會群體分析視角,以及重複執行的穩定性檢查。
- 評估設計
- 心理計量與結構方程式模型
- 穩定性分析
精選作品
研究工作從實測決策出發,推進至模型結構、代理行為、限制檢查,以及在耦合環境中的結果。
精選作品
每個專案都呈現同一套實務的不同環節:評估決策、追蹤後果,以及治理行動何時能改變系統。
比較 LLM 生成決策與實測人類路徑在各社會群體間的差異。
我設計人類與模型的比較架構、社會群體分析視角,以及重複執行的穩定性檢查。
將家戶調適行為與洪災損害、保險及財務風險連結。
我建構家戶決策模型,並將調適選擇連結到巨災、保險與財務機制。
在耦合模擬更新前,檢查並修正代理決策。
我設計驗證與修正流程,在模擬狀態改變前檢查代理提出的行動。
開源系統實證
精選的儲存庫支援研究營運、代理編排與多語言學習。各項數據皆透過經過審查的建置期數據工作流進行更新。
維護中的三語 AI 代理發展藍圖,具備自動化跨語言檢查。
6.2K stars · 836 forks
awesome-agentic-ai-zh可組合的研究工作流,涵蓋從發現研究缺口到研究設計與草稿撰寫。
220 stars · 17 forks
ai-research-skills本地優先的 Zotero、Obsidian 與 NotebookLM 工作區,具備來源檢查功能。
52 stars · 8 forks
research-hub多代理協作的任務拆解、協調、辯論與驗收關卡。
23 stars · 6 forks
agent-collab-skills跨平台委派封裝工具,透過儲存庫狀態驗證任務完成度。
63 stars · 6 forks
codex-delegate更新時間: 2026-08-23 · 資料來源: GitHub REST API 資料快照
請依據您的情境選擇文件。網站保持統一的定位;而 PDF 則針對不同讀者調整重點。
聯絡方式
我正在尋求 2027 年夏季(約 5 月下旬至 8 月中旬)的全職實習機會。我對 LLM 評估、代理系統、行為模擬以及 AI for Science 特別感興趣。