先建立行為基準

LLM 可以給出流暢而合理的選擇,卻使用與真人不同的決策結構。因此,基準不能只是研究者預先寫好的理想答案,而要來自實測構念、自陳選擇,以及這些變數之間的關係。

評估要問的是結構:風險知覺是否朝預期方向影響選擇?限制條件是否真的壓低某項行動?不在提示中暴露群體標籤時,差異是否仍然存在?

分開提示建構與結果評估

人物設定只能包含核准輸入,並透過可重現的映射產生。會洩漏預期答案的標籤必須排除,再以重複執行觀察結論是否承受一般模型變異。

選擇一致度、路徑方向、群體差異與穩定性可以互相補充,但沒有任何單一指標足以證明模型等同人類。

應該報告的失敗模式

常見問題包括把不同群體壓成平均反應、答案正確但理由結構錯誤、不同執行出現不一致,以及把關聯性的人類模型誤解為因果。這些不是要隱藏的雜訊,而是評估結果。

實務意義

模擬使用者系統最後應交付有邊界的效度說明:檢查了哪些行為、族群與條件,哪些一致、哪些不一致,以及還不知道什麼。這比籠統宣稱代理很真實更有用。