撰寫中
以人類行為證據為基礎的 LLM 評估
- 問題
- 比較 LLM 生成決策與實測人類路徑在各社會群體間的差異。
- 我的角色
- 我設計人類與模型的比較架構、社會群體分析視角,以及重複執行的穩定性檢查。
- 可驗證能力
- 評估設計 · 心理計量與結構方程式模型 · 穩定性分析
- 公開狀態
- 研究準備中;只使用公開說明與合成範例。
Recruiter brief/招聘摘要
用 60 秒掌握我能負責的研究工程工作、相關證據,以及可任職時間。

01
我的主要定位是 LLM Evaluation 與 AI Research Engineer,專注檢驗模型決策是否符合實測人類行為。我也建構受治理的代理系統與行為模擬,讓決策輸入、失敗、修正與後續影響都能被檢視。
02
設計能檢視次群體差異與重複執行穩定性的評估,將生成決策與實測行為證據比較,並清楚說明效度邊界。
定義結構化輸出、確定性驗證器、針對性修正與稽核軌跡,避免模型提案在通過檢查前改變系統狀態。
把個別決策連結到代理人基與耦合模擬,檢驗環境、財務與制度層面的後續影響。
03
三個專案分別呈現評估、治理與模擬能力,並直接標示公開狀態。
撰寫中
研究原型 · 已封存
開發中 · 準備釋出
04
以下工具與方法來自我的研究、開源工作與實際開發流程。
05
06
可直接從招聘問題開始;網站會先顯示本機證據,並可能透過 NVIDIA 導向具引用依據的頁面。
07
若職缺涉及 LLM 評估、AI 研究、代理系統或 AI for Science,請使用 Email 或 LinkedIn 聯絡。英文業界履歷是最精簡的完整紀錄。