發表文章

目前顯示的是 3月, 2026的文章

虛擬考官系統建構與驗證

目標:發展與驗證虛擬考官之表現。 說明:先建置虛擬考官,以將紙本的思覺失調診斷性會談表現評量表 (Schizophrenia Diagnostic Interview Performance Scale, SDIPS) 轉化為 AI 能夠理解與執行的評分邏輯,並輸出評分、評分依據以及回饋。再驗證考官表現的一致性與正確性(信度與效度)。 i. 依據階段一之SDIPS,以生成式AI應用SDIPS評分逐字稿,並輸出評分與評分依據。 後續: 測試與修改 ChatGPT prompt, 並完成其它逐字稿之評分與回饋。 已邀請專家設計逐字稿輸入與評分輸出介面,並依據階段一專家會議發展之量表,作為ChatGPT評分依據與進行可行性驗證,並提出改進建議優化提示語設計。 流程: 1. 組成跨領域專家小組:邀請 5 位專家組成開發小組,將包含 2 位精神科/會談專家,以及 3 位具備生成式AI 應用的專家。 2. 考官設計輸入與輸出介面(主要由謝老師團隊負責//余主任與專家協助確認): 輸入設計:系統須能接收學員與病人(或虛擬病人)的「會談逐字稿」作為評估素材。 輸出設計:系統須依據SDIPS 的向度、項目與評分標準評分,相關內容詳初版「 SDIPS 」。並輸出各項目評分分數、評分依據、以及建議。 優化提示語設計(Prompt Engineering):這是虛擬考官能否精準給分的關鍵。必須將評量表的每一項指標與評分準則(Rubric)明確寫入提示語中,確保 AI 模型能準確理解。 為提升評分的嚴謹性,應加入特定限制規則,例如:指示虛擬考官僅能針對學員「主動提問或引導」的內容給分,若病人(或逐字稿中)主動透露但非學員引導出的資訊,應忽略不計,以避免高估學員表現。 可行性驗證與邏輯檢視:由專家小組先投入少量逐字稿進行初步測試,審查虛擬考官的評分邏輯、分數合理性,並針對 AI 產生偏誤之處進行提示語的修正與優化。 3. 虛擬考官的一致性與正確性(信度與效度)檢驗 說明:要讓虛擬考官具備公信力,必須經過嚴格的心理計量學檢驗,證明其評分具備一致性,以及正確性(與人類專家具有高度一致性,或獲得人類專家的同意)。 任務:準備測試語料(逐字稿蒐集):蒐集具代表性的實際或模擬「診斷性訪談」逐字稿(文獻建議約 30 份)作為測試素材。 *檢驗再測信度(Test-retest R...

「思覺失調診斷性會談表現評量表」專家審查流程

目的:請專家審查「思覺失調診斷性會談表現評量表 (Schizophrenia Diagnostic Interview Performance Scale, SDIPS)」之向度、項目以及評分量尺的適切性(內容效度),必要時提出修改建議。量表的詳細內容介紹,詳「 思覺失調診斷性會談表現評量表  (請點選即可連結/觀看)」 流程: 0. 閱覽  思覺失調診斷性會談表現評量表  (SDIPS) 1. 專家填寫表單:研究者將以 Google 表單的形式( 連結位址 ),請求專家填寫、審查與修改建議。[預計4月9日開始邀請] 2. 研究人員將依據專家的意見修改 SDIPS 內容。[預計4月19日開始] 3. 專家線上會議討論修改(至少一次)。 4. 再專家填寫表單,確認SDIPS之向度、項目以及評分量尺皆已達到適切性。若未達到則再修改,重複1~3的步驟。 *研究人員預期,大概進行 2 到 3 回合即可達成良好適切性。 *表單預計於 4 月9日之前完成(目前已有初版)。

2026年度研究計畫之目的與執行流程(完整架構)

討論議題: 1. 簡介研究計畫:以ChatGPT發展虛擬考官,以評論精神科醫師於思覺失調診斷性會談之表現 以會談逐字稿為評論/回饋標的 需先發展評量表「思覺失調診斷性會談表現評量表(Schizophrenia Diagnostic Interview Performance Scale, SDIPS)」,再提供給 ChatGPT作為評分與回饋之依據。 2. 簡介 SDIPS 3. 簡介ChatGPT 評分與回饋之概況 4. 專家任務說明 a. 評論 SDIPS,提供回饋。填寫表單。 b. 初步確認ChatGPT 評分與回饋之正確性與合適性。再確認 SDIPS之合適性。 計畫名稱:精神科會談逐字稿之虛擬考官發展:從會談表現評量表之發展至ChatGPT之應用 目的: 一、發展精神科醫師「思覺失調診斷性會談表現評量表(Schizophrenia Diagnostic Interview Performance Scale, SDIPS)」,以「會談逐字稿」作為評分依據。 二、運用 ChatGPT 建構SDIPS之虛擬考官,並驗證其可行性。 三、驗證 ChatGPT 虛擬考官在評估會談表現方面的一致性與正確性(信度與效度)。 此貼文,最後提出後續研究構想。 ------------------------------------------------------------------------ 以下說明各研究目的之執行流程/階段: 目的一、發展 SDIPS 之流程 i. 建構量表之向度 ii. 建構量表向度項目 iii. 建構量表項目量尺與評分標準 透過數次專家意見調查與修改,已確定初版SDIPS之向度、項目、量尺與評分標準。迄今(3月中旬)已完成初版量表,詳雲端檔案: 思覺失調診斷性會談表現評量表--逐字稿適用版 後續:邀請專家審查檢驗SDIPS之向度、項目、量尺與評分標準之設計是否合適(內容效度驗證),以建立具備內容效度之評量工具。 待召集專家會議時間,以討論執行流程。詳另一個  部落格貼文 : 「思覺失調診斷性會談表現評量表」專家審查流程 」說明。 目的二、運用 ChatGPT 建構「醫師於思覺失調診斷性會談表現」之虛擬考官,並驗證其可行性。 目的三、生成式AI應用SDIPS評分之品質驗證(一致性與正確性...

「生成式AI應用於診斷性訪談」的研究題材(含執行中與後續)

圖片
可分成五大類:一、評估工具;二、虛擬考官;三、虛擬病人;四:AI輔助教學成效、其它(如逐字稿改良) 一、評估工具相關: 發展思覺失調診斷性訪談評量表(評量醫師表現)(含內容效度驗證) 二、虛擬考官 發展AI虛擬考官,以應用[思覺失調診斷性訪談評量表]評分逐字稿,再驗證其評分之穩定性與正確性(信度與效度) 驗證 虛擬考官回饋之品質(穩定性與正確性) 三、虛擬病人 發展AI虛擬病人,再驗證其「接受診斷性訪談」表現之穩定性與正確性(信度與效度) 四、 AI輔助教學成效 A I輔助思覺失調診斷性訪談教學之成效 五、其它  優化逐字稿(以提升逐字稿中醫師的表現)之可行性與效果 *以上皆可加入不同AI的表現比較(如比較 ChatGPT vs Gemini vs Claude) 我將這些研究劃分為三個主要階段,並呈現各研究之間的關聯性(圖): 第一階段:工具與基礎評估 此階段專注於發展測量工具、測試 ChatGPT 的評分信效度、比較不同 AI 系統(如 Gemini、Claude)的評分品質,並探討 AI (甚至與專家比較)在回饋上的表現。 第二階段:數據處理與虛擬應用 此階段探討 AI 在逐字稿優化上的可行性、AI 對不同品質逐字稿的辨識能力,以及發展 AI「虛擬病人」用於訪談訓練的表現。 第三階段:臨床與教育應用 此階段著重於將前述成果應用於實際教學,評估 AI 輔助診斷性訪談訓練的整體成效。