虛擬考官系統建構與驗證
目標:發展與驗證虛擬考官之表現。 說明:先建置虛擬考官,以將紙本的思覺失調診斷性會談表現評量表 (Schizophrenia Diagnostic Interview Performance Scale, SDIPS) 轉化為 AI 能夠理解與執行的評分邏輯,並輸出評分、評分依據以及回饋。再驗證考官表現的一致性與正確性(信度與效度)。 i. 依據階段一之SDIPS,以生成式AI應用SDIPS評分逐字稿,並輸出評分與評分依據。 後續: 測試與修改 ChatGPT prompt, 並完成其它逐字稿之評分與回饋。 已邀請專家設計逐字稿輸入與評分輸出介面,並依據階段一專家會議發展之量表,作為ChatGPT評分依據與進行可行性驗證,並提出改進建議優化提示語設計。 流程: 1. 組成跨領域專家小組:邀請 5 位專家組成開發小組,將包含 2 位精神科/會談專家,以及 3 位具備生成式AI 應用的專家。 2. 考官設計輸入與輸出介面(主要由謝老師團隊負責//余主任與專家協助確認): 輸入設計:系統須能接收學員與病人(或虛擬病人)的「會談逐字稿」作為評估素材。 輸出設計:系統須依據SDIPS 的向度、項目與評分標準評分,相關內容詳初版「 SDIPS 」。並輸出各項目評分分數、評分依據、以及建議。 優化提示語設計(Prompt Engineering):這是虛擬考官能否精準給分的關鍵。必須將評量表的每一項指標與評分準則(Rubric)明確寫入提示語中,確保 AI 模型能準確理解。 為提升評分的嚴謹性,應加入特定限制規則,例如:指示虛擬考官僅能針對學員「主動提問或引導」的內容給分,若病人(或逐字稿中)主動透露但非學員引導出的資訊,應忽略不計,以避免高估學員表現。 可行性驗證與邏輯檢視:由專家小組先投入少量逐字稿進行初步測試,審查虛擬考官的評分邏輯、分數合理性,並針對 AI 產生偏誤之處進行提示語的修正與優化。 3. 虛擬考官的一致性與正確性(信度與效度)檢驗 說明:要讓虛擬考官具備公信力,必須經過嚴格的心理計量學檢驗,證明其評分具備一致性,以及正確性(與人類專家具有高度一致性,或獲得人類專家的同意)。 任務:準備測試語料(逐字稿蒐集):蒐集具代表性的實際或模擬「診斷性訪談」逐字稿(文獻建議約 30 份)作為測試素材。 *檢驗再測信度(Test-retest R...